flume

最新推荐文章于 2024-10-26 16:26:36 发布

原创最新推荐文章于 2024-10-26 16:26:36 发布 · 679 阅读

0 ·

CC 4.0 BY-SA版权

本文介绍了Flume的安装、配置和使用方法。Flume是一个分布式、可靠和高可用的日志聚合系统，支持定制数据发送方和接收方，提供数据处理能力。通过详细步骤和官方文档链接，帮助用户快速掌握Flume的基本操作。

flume-ng安装、配置和使用

flume中文手册

http://www.tuicool.com/articles/q2umQb
用户手册

http://flume.apache.org/FlumeUserGuide.html

一、背景说明：
Flume是apache基金会下的一个分布式、可靠、和高可用的海量日志聚合的系统，支持在系统中定制各类数据发送方，用于收集数据；同时，Flume提供对数据进行简单处理，并写到各种数据接受方（可定制）的能力。

一、安装：
# wget http://mirror.bit.edu.cn/apache/flume/1.4.0/apache-flume-1.4.0-bin.tar.gz
# tar -zxvf apache-flume-1.4.0-bin.tar.gz
# mv apache-flume-1.4.0-bin /usr/local/flume-1.4.0
# vi /etc/profile //在该文件中添加 FLUME_HOME=/usr/local/flume-1.4.0 变量，并将 $FLUME_HOME/bin 添加到PATH变量中
# source /etc/profile

二、配置，参考官网https://cwiki.apache.org/confluence/display/FLUME/Getting+Started 的 Configuration 块的说明，里边已经说得非常详细

启动
bin/flume-ng agent --conf ./conf/ -f conf/flume.conf -Dflume.root.logger=DEBUG,console -n agent1 &

三、使用：
# cd $FLUME_HOME
# ./bin/flume-ng agent -n access_log -c conf -f conf/access_log_kafka.properties -Dflume.root.logger=DEBUG,console

参考资料：
1、官网wiki： https://cwiki.apache.org/confluence/display/FLUME/Getting+Started
2、官网：http://flume.apache.org/

Flume是一个分布式、可靠、和高可用的海量日志聚合的系统，支持在系统中定制各类数据发送方，用于收集数据；同时，Flume提供对数据进行简单处理，并写到各种数据接受方（可定制）的能力。

用户可以根据需要添加自己的agent，collector或者storage。此外，Flume自带了很多组件，包括各种agent（file， syslog等），collector和storage（file，HDFS等）。

(1) agent
agent的作用是将数据源的数据发送给collector。

Flume自带了很多直接可用的数据源（source），如：

text(“filename”)：将文件filename作为数据源，按行发送
tail(“filename”)：探测filename新产生的数据，按行发送出去
fsyslogTcp(5140)：监听TCP的5140端口，并且接收到的数据发送出去
tailDir("dirname"[, fileregex=".*"[, startFromEnd=false[, recurseDepth=0]]])：监听目录中的文件末尾，使用正则去选定需要监听的文件（不包含目录），recurseDepth为递归监听其下子目录的深度
更多可参见这位朋友的整理：http://www.cnblogs.com/zhangmiao-chp/archive/2011/05/18/2050465.html

同时提供了很多sink，如：

console[("format")] ：直接将将数据显示在consolr上
text(“txtfile”)：将数据写到文件txtfile中
dfs(“dfsfile”)：将数据写到HDFS上的dfsfile文件中
syslogTcp(“host”,port)：将数据通过TCP传递给host节点
agentSink[("machine"[,port])]：等价于agentE2ESink，如果省略，machine参数，默认使用flume.collector.event.host与flume.collector.event.port作为默认collecotr
agentDFOSink[("machine" [,port])]：本地热备agent，agent发现collector节点故障后，不断检查collector的存活状态以便重新发送event，在此间产生的数据将缓存到本地磁盘中
agentBESink[("machine"[,port])]：不负责的agent，如果collector故障，将不做任何处理，它发送的数据也将被直接丢弃
agentE2EChain：指定多个collector提高可用性。当向主collector发送event失效后，转向第二个collector发送，当所有的collector失败后，它会非常执着的再来一遍
更多可参见这位朋友的整理：http://www.cnblogs.com/zhangmiao-chp/archive/2011/05/18/2050472.html

(2) collector
collector的作用是将多个agent的数据汇总后，加载到storage中。

它的source和sink与agent类似。

数据源（source），如：

collectorSource[(port)]：Collector source，监听端口汇聚数据
autoCollectorSource：通过master协调物理节点自动汇聚数据
logicalSource：逻辑source，由master分配端口并监听rpcSink
sink，如：

collectorSink( "fsdir","fsfileprefix",rollmillis)：collectorSink，数据通过collector汇聚之后发送到hdfs, fsdir 是hdfs目录，fsfileprefix为文件前缀码
customdfs("hdfspath"[, "format"])：自定义格式dfs
(3) storage
storage是存储系统，可以是一个普通file，也可以是HDFS，HIVE，HBase，分布式存储等。

(4) Master
Master是管理协调agent和collector的配置等信息，是flume集群的控制器。