大数据仓库集锦
大数据目前的主要趋势(自己理解)
文件系统、部署、各种流和开源工具-------ETL开发(BI项目)----数据统计分析------数据挖掘、机器学习
图片来自 浅析
一、关于kakfa kafka相关
Kafka是由LinkedIn开发的一个分布式的消息系统,使用Scala编写,它以可水平扩展和高吞吐率而被广泛使用。目前越来越多的开源分布式处理系统如Storm,Spark,Flink都支持与Kafka集成。现在我们的数据实时处理平台也使用到了kafka。现在它已被多家不同类型的公司作为多种类型的数据管道和消息系统使用。
二、spark Spark 以及 spark streaming 核心原理及实践
三、Sqoop sqoop 学习
将导入或导出命令翻译成 MapReduce 程序来实现 在翻译出的 MapReduce 中主要是对 InputFormat 和 OutputFormat 进行定制.
四、FLume (博客)