flume-ng安装、配置和使用
flume中文手册
http://www.tuicool.com/articles/q2umQb
用户手册
http://flume.apache.org/FlumeUserGuide.html
一、背景说明:
Flume是apache基金会下的一个分布式、可靠、和高可用的海量日志聚合的系统,支持在系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。
一、安装:
# wget http://mirror.bit.edu.cn/apache/flume/1.4.0/apache-flume-1.4.0-bin.tar.gz
# tar -zxvf apache-flume-1.4.0-bin.tar.gz
# mv apache-flume-1.4.0-bin /usr/local/flume-1.4.0
# vi /etc/profile //在该文件中添加 FLUME_HOME=/usr/local/flume-1.4.0 变量,并将 $FLUME_HOME/bin 添加到PATH变量中
# source /etc/profile
二、配置,参考官网https://cwiki.apache.org/confluence/display/FLUME/Getting+Started 的 Configuration 块的说明,里边已经说得非常详细
启动
bin/flume-ng agent --conf ./conf/ -f conf/flume.conf -Dflume.root.logger=DEBUG,console -n agent1 &
三、使用:
# cd $FLUME_HOME
# ./bin/flume-ng agent -n access_log -c conf -f conf/access_log_kafka.properties -Dflume.root.logger=DEBUG,console
参考资料:
1、官网wiki: https://cwiki.apache.org/confluence/display/FLUME/Getting+Started
2、官网:http://flume.apache.org/
Flume是一个分布式、可靠、和高可用的海量日志聚合的系统,支持在系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。
用户可以根据需要添加自己的agent,collector或者storage。此外,Flume自带了很多组件,包括各种agent(file, syslog等),collector和storage(file,HDFS等)。

(1) agent
agent的作用是将数据源的数据发送给collector。
Flume自带了很多直接可用的数据源(source),如:
text(“filename”):将文件filename作为数据源,按行发送
tail(“filename”):探测filename新产生的数据,按行发送出去
fsyslogTcp(5140):监听TCP的5140端口,并且接收到的数据发送出去
tailDir("dirname"[, fileregex=".*"[, startFromEnd=false[, recurseDepth=0]]]):监听目录中的文件末尾,使用正则去选定需要监听的文件(不包含目录),recurseDepth为递归监听其下子目录的深度
更多可参见这位朋友的整理:http://www.cnblogs.com/zhangmiao-chp/archive/2011/05/18/2050465.html
同时提供了很多sink,如:
console[("format")] :直接将将数据显示在consolr上
text(“txtfile”):将数据写到文件txtfile中
dfs(“dfsfile”):将数据写到HDFS上的dfsfile文件中
syslogTcp(“host”,port):将数据通过TCP传递给host节点
agentSink[("machine"[,port])]:等价于agentE2ESink,如果省略,machine参数,默认使用flume.collector.event.host与flume.collector.event.port作为默认collecotr
agentDFOSink[("machine" [,port])]:本地热备agent,agent发现collector节点故障后,不断检查collector的存活状态以便重新发送event,在此间产生的数据将缓存到本地磁盘中
agentBESink[("machine"[,port])]:不负责的agent,如果collector故障,将不做任何处理,它发送的数据也将被直接丢弃
agentE2EChain:指定多个collector提高可用性。 当向主collector发送event失效后,转向第二个collector发送,当所有的collector失败后,它会非常执着的再来一遍
更多可参见这位朋友的整理:http://www.cnblogs.com/zhangmiao-chp/archive/2011/05/18/2050472.html
(2) collector
collector的作用是将多个agent的数据汇总后,加载到storage中。
它的source和sink与agent类似。
数据源(source),如:
collectorSource[(port)]:Collector source,监听端口汇聚数据
autoCollectorSource:通过master协调物理节点自动汇聚数据
logicalSource:逻辑source,由master分配端口并监听rpcSink
sink,如:
collectorSink( "fsdir","fsfileprefix",rollmillis):collectorSink,数据通过collector汇聚之后发送到hdfs, fsdir 是hdfs目录,fsfileprefix为文件前缀码
customdfs("hdfspath"[, "format"]):自定义格式dfs
(3) storage
storage是存储系统,可以是一个普通file,也可以是HDFS,HIVE,HBase,分布式存储等。
(4) Master
Master是管理协调agent和collector的配置等信息,是flume集群的控制器。
本文介绍了Flume的安装、配置和使用方法。Flume是一个分布式、可靠和高可用的日志聚合系统,支持定制数据发送方和接收方,提供数据处理能力。通过详细步骤和官方文档链接,帮助用户快速掌握Flume的基本操作。
4万+

被折叠的 条评论
为什么被折叠?



