flume简介和入门使用
flume简介和入门使用
flume简单介绍和初步使用
flume 简介
Flume是Cloudera提供的一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统。Flume基于流式架构,灵活简单。

flume 最主要的作用就是实时读取本地或者网络的数据,将数据写到hdfs上。
flume 几个优点:
1.可以和任意存储进程集成。
2.输入的的数据速率大于写入目的存储的速率,flume会进行缓冲,减小hdfs的压力。
3.flume中的事务基于channel,使用了两个事务模型(sender + receiver),确保消息被可靠发送。
Flume使用两个独立的事务分别负责从soucrce到channel,以及从channel到sink的事件传递。一旦事务中所有的数据全部成功提交到channel,那么source才认为该数据读取完成。同理,只有成功被sink写出去的数据,才会从channel中移除。
flume 角色介绍
1.总体架构图

2.详细架构逻辑图


本文介绍了Apache Flume的基础概念,包括其架构、组件(Source、Channel、Sink)以及Event。Flume是一个用于收集、聚合和传输大规模日志的高可用系统,能与多种数据源集成并支持数据缓冲。文章还提供了Flume的安装部署步骤,通过简单案例展示了如何使用HTTP Source和Logger Sink。此外,还讲解了Flume与Kafka的集成,实现日志数据流向Kafka的流程。
最低0.47元/天 解锁文章
1万+

被折叠的 条评论
为什么被折叠?



