一、大数据
(一)概念:
指的是传统数据处理应用软件不足以处理(存储和计算)它们大而复杂的数据集。
(二)数据级别:
1.MB:普通用户数据级别
2.PB:企业级数据级别
3.ZB:全球数据总量级别
(三)特点:
容量大,种类多,速度快,价值高
(四)Hadoop
1.概念:Apache旗下的一套开源软件平台
2.功能:利用服务式集群,根据用户的自定义业务逻辑,对海量数据进行分布式处理
3.核心组件:
Common(基础功能组件)(工具包,RPC框架)JNDI和RPC
HDFS(HadoopDistributeFileSystem分布式文件系统)
YARN(YetanotherResoucesNegotiator运算资源调度系统)
MapReduce(Map和Reduce分布式运算编程框架)
4.重点组件:
HDFS:Hadoop的分布式文件存储系统
MapReduce:Hadoop的分布式程序运算框架,也可以叫做一种编程模型
Hive:基于Hadoop的类SQL数据仓库工具
HBase:基于Hadoop的列式分布式NoSQL数据库
ZooKeeper:分布式协调服务组件
Mahout:基于MapReduce/Flink/Spark等分布式运算框架的机器学习算法库
Oozie/Azkaban:工作流调度引擎
Sqoop:数据迁入迁出工具
Flume:日志采集工具
5.分布式系统:
利用多个节点共同协作完成一项或多项具体业务功能的系统
(五)HDFS原理剖析
1.HDFS工作机制:
(1)概述:
1)HDFS集群分为两大主要角色:namenode、datanode(secondarynamenode和client)
2)namenode负责管理