Scala入门案例---Wordcount

本文介绍如何使用Scala编程语言在Apache Spark环境下实现WordCount程序,包括数据读取、切分、映射、归约和结果排序等关键步骤,最后将处理结果保存到指定路径。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

import org.apache.spark.rdd.RDD
import org.apache.spark.{SparkConf, SparkContext}

object ScalaWordCount {
  def main(args: Array[String]): Unit = {

    if (args.size != 2) {
      println(
        """
          |Usage:clw.spark.day01.ScalaWordCount
          |<srcPath>,<desPath>
        """.stripMargin)
      sys.exit(-1)
    }

    val Array(srcPath, desPath) = args

    //创建Spark配置,设置应用的名字
    val sparkConf = new SparkConf()
      .setAppName("ScalaWordCount")
      .setMaster("local[*]")
    //创建Spark的执行入口
    val sc = new SparkContext(sparkConf)

    //指定以后从哪里读取数据,创建RDD
    val data: RDD[String] = sc.textFile(srcPath)

    //切分压平
    val words: RDD[String] = data.flatMap(_.split(","))

    //将单词和1组装
    val wordAndOne: RDD[(String, Int)] = words.map((_, 1))

    //按key进行聚合
    val result: RDD[(String, Int)] = wordAndOne.reduceByKey(_ + _)

    //排序
    val resultSort: RDD[(String, Int)] = result.sortBy(-_._2)

    //将数据存入指定文件
    result.saveAsTextFile(desPath)


    //释放资源
    sc.stop()
  }

}

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值