一,关于Spark与SparkStreaming
Spark由美国加利福尼亚大学伯克利分校的AMP实验室于2009年开发,是基于内存计算的大数据并行计算架构,可用于构建大型的、低延迟的数据分析应用程序。2013年Spark成为Apache孵化器项目后,开始获得迅猛的发展,如今已成为Apache软件基金会最重要的三大分布式计算系统开源项目(Hadoop,Spark,Flink)之一。
BDAS架构如图所示:
Spark Core:实现了 Spark 的基本功能,包含 RDD、任务调度、内存管理、错误恢复、与存储系统交互等模块。
Spark SQL:Spark 用来操作结构化数据的程序包。通过 Spark SQL,我们可以使用 SQL 操作数据。
Spark Streaming:Spark 提供的对实时数据进行流式计算的组件。提供了用来操作数据流的 API。
Spark MLlib: