0
点赞
收藏
分享

微信扫一扫

SPARK组件

忍禁 2022-12-07 阅读 56


SPARK组件_Streaming

1. Spark SQL 

支持多种数据源,包括 Hive,Avro,Parquet,ORC,JSON 和 JDBC

2. Spark Streaming

Spark Streaming 主要用于快速构建可扩展,高吞吐量,高容错的流处理程序。支持从 HDFS,Flume,Kafka,Twitter 和 ZeroMQ 读取数据,并进行处理

SPARK组件_大数据_02

Spark Streaming 的本质是微批处理,它将数据流进行极小粒度的拆分,拆分为多个批处理,从而达到接近于流处理的效果。

SPARK组件_大数据_03

3. MLlib

4. Graphx

GraphX 是 Spark 中用于图形计算和图形并行计算的新组件。

举报

相关推荐

0 条评论