IMF传奇行动第84课：Spark Streaming第三课：StreamingContext、DStream、Receiver深度剖析

最新推荐文章于 2021-08-23 22:57:58 发布

Pitt_Zhou

最新推荐文章于 2021-08-23 22:57:58 发布

阅读量6.4k

点赞数

分类专栏：大数据文章标签：大数据 spark spark streaming IMF DT_Spark

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/csdn_zf/article/details/51285705

版权

大数据专栏收录该内容

14 篇文章

订阅专栏

本课分成四部分讲解:

第一部分对StreamingContext功能及源码剖析；

第二部分对DStream功能及源码剖析；

第三部分对Receiver功能及源码剖析；

最后一部分将StreamingContext、DStream、Receiver结合起来分析其流程。

注意：下面的图中带分号结尾的是Java代码，否则是Scala代码，请谅解。

一、StreamingContext功能及源码剖析：

1、通过StreamingContext实例对象jssc，创建应用程序主入口，并连上Driver上的接收数据服务端口9999写入源数据：

2、StreamingContext的主要功能有：

主程序的入口；
提供了各种创建DStream 的方法接收各种流入的数据源（例如：Kafka 、Flume 、Twitter 、ZeroMQ 和简单的TCP 套接字等）；
通过构造函数实例化 StreamingContext 对象时，可以指定master URL 、appName 、或者传入SparkConf 配置对象、或者已经创建的SparkContext 对象；
将接收的数据流传入DStreams 对象中；
通过StreamingContext 对象实例的start 方法启动当前应用程序的流计算框架或通过stop 方法结束当前应用程序的流计算框架。

二、DStream功能及源码剖析：

1、DStream是RDD的模板，RDD是抽象的，DStream也是抽象的。

2、DStream的具体实现子类如下图所示：

3、以StreamingContext实例的socketTextSteam方法为例，其执行完的结果返回DStream对象实例，其源码调用过程如下图：

注意：socket.getInputStream用来获取数据，while循环用来存储数据(到内存、磁盘)。

三、Receiver功能及源码剖析：

1、Receiver代表数据的输入，接收外部输入的数据，如从Kafka上抓取数据；

2、Receiver运行在Worker节点上；

3、Receiver在Worker节点上抓取Kafka分布式消息框架上的数据时，具体实现类是KafkaReceiver；

4、Receiver是抽象类，其抓取数据的实现子类如下图所示；

5、如果上述实现类都满足不了您的要求，您自己可以定义Receiver类，只需要继承Receiver抽象类来实现自己子类的业务需求。

四、StreamingContext、DStream、Receiver结合流程分析：

（1）inputStream代表了数据输入流(如：Socket、Kafka、Flume等)

（2）Transformation代表了对数据的一系列操作，如flatMap、map等

（3）outputStream代表了数据的输出，例如wordCount中的println方法

数据数据在流进来之后最终会生成Job，最终还是基于Spark Core的RDD进行执行：在处理流进来的数据时是DStream进行Transformation由于是StreamingContext所以根本不会去运行，StreamingContext会根据Transformation生成”DStream的链条”及DStreamGraph，而DStreamGraph就是DAG的模板，这个模板是被框架托管的。当我们指定时间间隔的时候，Driver端就会根据这个时间间隔来触发Job而触发Job的方法就是根据OutputDStream中指定的具体的function,例如wordcount中print，这个函数一定会传给ForEachDStream，它会把函数交给最后一个DStream产生的RDD，也就是RDD的print操作，而这个操作就是RDD触发Action。

总结：

使用Spark Streaming可以处理各种数据来源类型，如：数据库、HDFS，服务器log日志、网络流，其强大超越了你想象不到的场景，只是很多时候大家不会用，其真正原因是对Spark、sparkstreaming本身不了解。

课程笔记来源:

DT大数据梦工厂IMF传奇行动课程学员整理。YY直播永久课堂频道68917580每晚8点准时开课。

Life is short, you need spark!

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。