Hadoop实战(上)
自序
学习大数据课程,课程需要。借优快云博客平台发布些学习笔记,大数据是接触也谈不上入门,有什么问题大家可以一起讨论。欢迎大家来拍砖。
大纲
hadoop2介绍
HDFS概述
HDFS读写流程
Hadoop定义:Hadoop是Apache基金会旗下的一个分布式系统基础架构。Hadoop2框架最核心的设计就是HDFS、MapReduce、YARN。为海量的数据提供存储和计算。
HDFS:用于海量数据存储。
MapReduce:主要用于分布式缓存系统。
YARN:Hadoop2资源管理器。
Hadoop2改进
YARN
NameNode HA
HDFS federation
Hadoop RPC序列化扩展性
Hadoop2在以上四点来改变hadoop在各个瓶颈变成可扩展。
HDFS主要特性:
- 支持超大文件
- 检测和快速应对硬件故障
- 流式数据访问
- 简化一致性模型
HDFS不适合场景:
- 低延迟数据访问
- 大量的小文件
- 多用户写入文件、修改文件
HDFS体系结构:
数据块:
HDFS也有数据块的概念,hadoop2中hdfs块默认大小128MB,以linux上普通文件的形式保存到数据节点的文件系统中。数据块是hdfs文件存储处理单元。
数据块的好处:HDFS可以保存比存储节点单一磁盘大的文件;
简化存储子系统,简化存储管理,也消除分布式管理文件元数据的复杂性;
方便容错,有利于数据复制。
总结:
对Hadoop2进行介绍,并详细介绍HDFS体系结构、块、读写等。对hadoop和HDFS有一定认识。