Hadoop实战(上)--学习笔记

本文介绍了Hadoop2的基础架构及HDFS体系结构,详细解析了HDFS的主要特性及其适用场景,适合初学者理解Hadoop2的核心概念。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

Hadoop实战(上)

自序

学习大数据课程,课程需要。借优快云博客平台发布些学习笔记,大数据是接触也谈不上入门,有什么问题大家可以一起讨论。欢迎大家来拍砖。

大纲

hadoop2介绍
HDFS概述
HDFS读写流程

Hadoop定义:Hadoop是Apache基金会旗下的一个分布式系统基础架构。Hadoop2框架最核心的设计就是HDFS、MapReduce、YARN。为海量的数据提供存储和计算。
HDFS:用于海量数据存储。
MapReduce:主要用于分布式缓存系统。
YARN:Hadoop2资源管理器。

Hadoop2改进

YARN
NameNode HA
HDFS federation
Hadoop RPC序列化扩展性

Hadoop2在以上四点来改变hadoop在各个瓶颈变成可扩展。
HDFS主要特性:

  • 支持超大文件
  • 检测和快速应对硬件故障
  • 流式数据访问
  • 简化一致性模型

HDFS不适合场景:

  • 低延迟数据访问
  • 大量的小文件
  • 多用户写入文件、修改文件

HDFS体系结构:
HDFS体系来自网易云课堂课程

数据块:

HDFS也有数据块的概念,hadoop2中hdfs块默认大小128MB,以linux上普通文件的形式保存到数据节点的文件系统中。数据块是hdfs文件存储处理单元。
数据块的好处:HDFS可以保存比存储节点单一磁盘大的文件;
简化存储子系统,简化存储管理,也消除分布式管理文件元数据的复杂性;
方便容错,有利于数据复制。

总结:

对Hadoop2进行介绍,并详细介绍HDFS体系结构、块、读写等。对hadoop和HDFS有一定认识。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值