spark--WordCount执行过程详解

最新推荐文章于 2025-06-19 15:19:16 发布

原创最新推荐文章于 2025-06-19 15:19:16 发布 · 1.3k 阅读

3 ·

CC 4.0 BY-SA版权

文章标签：

#WordCount执行过程

spark 专栏收录该内容

47 篇文章

订阅专栏

博客介绍了WordCount代码执行过程。先读取数据，经两次map和一次reduce操作后保存结果，此过程共生成6个RDD。reduce过程即shuffle，分局部和全局聚合两步。一个分区对应一个task，有两个阶段，共生成2种、4个task。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

首先看一下WordCount代码：

val conf = new SparkConf().setAppName("ScalaWordCount").setMaster("local[4]")
    //创建spark执行的入口
    val sc = new SparkContext(conf)
    //指定以后从哪里读取数据创建RDD（弹性分布式数据集）
    val lines:RDD[String]= sc.textFile(args(0))
    //val lines: RDD[String] = sc.textFile("hdfs://L1:9000/aaa")
    //切分压平
    val words:RDD[String] = lines.flatMap(_.split(" "))
    //将单词和1组合
    val wordAndOne:RDD[(String,Int)] = words.map((_, 1))
    //按Key进行聚合
    val reduced:RDD[(String,Int)] = wordAndOne.reduceByKey(_+_)
    //将结果保存到HDFS中
    sorted.saveAsTextFile(args(1))

在一个统计词数的程序中，首先读取数据，在执行两次map操作，和一个reduce操作，最好保存结果，在这个过程中，一共生成了6个RDD
在这里插入图片描述