Spark Streaming消费Kafka的数据进行统计

最新推荐文章于 2024-05-07 16:23:35 发布

29DCH

最新推荐文章于 2024-05-07 16:23:35 发布

阅读量1.3k

点赞数

CC 4.0 BY-SA版权

分类专栏： Scala学习 BigData 大数据平台Spark生态系统 Kafka Spark Streaming Spark大数据生态圈学习总结及项目实战文章标签：大数据 Spark Streaming Kafka

本文链接：https://blog.youkuaiyun.com/CowBoySoBusy/article/details/84851730

Spark大数据生态圈学习总结及项目实战同时被 3 个专栏收录

22 篇文章

订阅专栏

BigData

19 篇文章

订阅专栏

大数据平台Spark生态系统

13 篇文章

订阅专栏

本文详细介绍SparkStreaming如何与Kafka消息队列进行整合，通过使用Receiver-based方式，实现从Kafka中读取数据并进行实时处理。文章提供了一个具体的代码示例，展示了如何配置SparkStreaming应用程序以连接到ZooKeeper集群，指定消费者组，以及如何定义主题及其线程数。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

流处理平台：
在这里插入图片描述
这里是第四步的实现：
Spark Streaming整合Kafka采用的是Receiver-based，另一种方式Direct Approach，稍作修改就行。

package spark

import org.apache.spark.SparkConf
import org.apache.spark.streaming.kafka.KafkaUtils
import org.apache.spark.streaming.{Seconds, StreamingContext}

/**
  * Spark Streaming对接Kafka
  */
object KafkaStreamingApp {

  def main(args: Array[String]): Unit = {

    if(args.length != 4) {
      System.err.println("Usage: KafkaStreamingApp <zkQuorum> <group> <topics> <numThreads>")
    }

    val Array(zkQuorum, group, topics, numThreads) = args

    val sparkConf = new SparkConf().setAppName("KafkaReceiverWordCount")
      .setMaster("local[2]")

    val ssc = new StreamingContext(sparkConf, Seconds(5))

    val topicMap = topics.split(",").map((_, numThreads.toInt)).toMap

    // Spark Streaming如何对接Kafka
    val messages = KafkaUtils.createStream(ssc, zkQuorum, group,topicMap)

    messages.map(_._2).count().print()

    ssc.start()
    ssc.awaitTermination()
  }
}