Flume在企业大数据仓库架构中位置及功能

Flume在企业大数据仓库架构中位置及功能

数据仓库架构

1、如下图所示,外部数据中,关系型数据库导入到HDFS用sqoop,由Nginx产生的文件实时监控用Flume获得。
在HDFS或Hbase中,如果要进行实时查询用Impala(内存),如果是分析可以用Hive,Mapreduce分析。用Oozie来调用工作流执行任务。
enter description here

2、左边是数据的来源:系统日志文件,应用文件(应用系统收集APP产生的日志),点击流(点击产生的日志),销售点(订单信息)。通过Flume收集然后给HDFS存储。
enter description here

3、Flume在企业中的做法

enter description here

enter description here

posted @ 2016-04-01 06:10  Raymoc  阅读(642)  评论(0编辑  收藏  举报