Scala课堂小结

全文单词统计:

 可分为以下几个步骤:

 1.读取文件,得到很长的字符串

5ede209502944d618bebcd6aafe3cda7.png

 2.把字符串拆分成一个一个的单词

cb748d1e5ebf4f0c885f3cffade2b580.png

 3.统计每个单词出现的次数

745f567c66f141f0a837f9eb02ca4882.png

4.排序

c24d2ab1da13417890eaf2e3e55b1ea4.png 

 5.把结果写入到一个文件中

5c8e87c5dd06411fb28459ef4bc58b20.png

完整代码如下

 

import java.io.PrintWriter

 

import scala.io.Source

 

object 全文单词统计 {

 

  def main(args: Array[String]){

 

    //1.读入文件内容

 

    val content = Source.fromFile("1.text").mkString

 

    println(content)

 

    //2.把字符串拆分为一个一个的单词,保存到数组

 

    //正则表达式

 

    // \\:表示正则表达式

 

    // W:表示一个非字(不是一个字 eg:空格,逗号,句号……)

 

    // W+:多个非字

 

    val arr = content.split("\\W+")

 

    for(word <- arr){

 

      println(word)

 

    }

 

    //3.统计每个单词出现的次数

 

    val wordMap = scala.collection.mutable.Map[String,Int]()

 

    for(word <- arr){

 

      if(wordMap.contains(word)){

 

        wordMap(word) += 1

 

      }else{

 

        wordMap(word) = 1

 

      }

 

    }

 

    //4.排序。Map是无序,要对其进行排序,要先把数组转成序列。List,Array

    println(wordMap.toList)

    val orderWordList = wordMap.toList.sortWith((a,b)=> a._2 > b._2).filter(e=>e._1.length>2).slice(0,30)

    for (e <- orderWordList){

      println(e)

    }

    //5.把结果写到一个文件中

    for(e <- orderWordList){

      println(e)

    }

    val writer = new PrintWriter("2.txt")

    for (e <- orderWordList) {

      writer.write(s"${e._1}: ${e._2}\n")

    }

    writer.close()

  }

}

b6f69bde12e942f68cba9997366222d1.png

 

内容概要:本文档详细介绍了在三台CentOS 7服务器(IP地址分别为192.168.0.157、192.168.0.158和192.168.0.159)上安装和配置Hadoop、Flink及其他大数据组件(如Hive、MySQL、Sqoop、Kafka、Zookeeper、HBase、Spark、Scala)的具体步骤。首先,文档说明了环境准备,包括配置主机名映射、SSH免密登录、JDK安装等。接着,详细描述了Hadoop集群的安装配置,包括SSH免密登录、JDK配置、Hadoop环境变量设置、HDFS和YARN配置文件修改、集群启动与测试。随后,依次介绍了MySQL、Hive、Sqoop、Kafka、Zookeeper、HBase、Spark、Scala和Flink的安装配置过程,包括解压、环境变量配置、配置文件修改、服务启动等关键步骤。最后,文档提供了每个组件的基本测试方法,确保安装成功。 适合人群:具备一定Linux基础和大数据组件基础知识的运维人员、大数据开发工程师以及系统管理员。 使用场景及目标:①为大数据平台搭建提供详细的安装指南,确保各组件能够顺利安装和配置;②帮助技术人员快速掌握Hadoop、Flink等大数据组件的安装与配置,提升工作效率;③适用于企业级大数据平台的搭建与维护,确保集群稳定运行。 其他说明:本文档不仅提供了详细的安装步骤,还涵盖了常见的配置项解释和故障排查建议。建议读者在安装过程中仔细阅读每一步骤,并根据实际情况调整配置参数。此外,文档中的命令和配置文件路径均为示例,实际操作时需根据具体环境进行适当修改。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值