摘要:
大数据技术之Scala 第一篇:Scala编程语言 一、Scala语言基础 1、Scala简介 Scala是一种多范式的编程语言,其设计的初衷是要集成面向对象编程和函数式编程的各种特性。Scala运行于Java平台(Java虚拟机),并兼容现有的Java程序。它也能运行于CLDC配置的Java ME 阅读全文
摘要:
大数据技术之Elasticsearch 一 概述 1.1 什么是搜索 百度:我们比如说想找寻任何的信息的时候,就会上百度去搜索一下,比如说找一部自己喜欢的电影,或者说找一本喜欢的书,或者找一条感兴趣的新闻(提到搜索的第一印象)。百度 != 搜索 1)互联网的搜索:电商网站,招聘网站,新闻网站,各种a 阅读全文
摘要:
# ElasticSearch课堂笔记 Search and analyze your data in real time. ## 1. 全文检索技术简介 ### 什么是搜索? 搜索,就是在任何场景下,找寻你想要的信息,这个时候,会输入一段你要搜索的关键字,然后就期望找到这个关键字相关的有些信息。 阅读全文
摘要:
hbasegoogle: gfs -》 hdfsmapreduce -》 mapreducebigtable -》 hbaseApache HBase™是Hadoop数据库,是一个分布式,可扩展的大数据存储。当您需要对大数据进行随机,实时读/写访问时,请使用Apache HBase™。该项目的目标是 阅读全文
摘要:
hbasegoogle: gfs -》 hdfsmapreduce -》 mapreducebigtable -》 hbaseApache HBase™是Hadoop数据库,是一个分布式,可扩展的大数据存储。当您需要对大数据进行随机,实时读/写访问时,请使用Apache HBase™。该项目的目标是 阅读全文
摘要:
hbasegoogle: gfs -》 hdfsmapreduce -》 mapreducebigtable -》 hbaseApache HBase™是Hadoop数据库,是一个分布式,可扩展的大数据存储。当您需要对大数据进行随机,实时读/写访问时,请使用Apache HBase™。该项目的目标是 阅读全文
摘要:
Azkaban官网:https://azkaban.github.io/Azkaban是一款开源工作流管理器。Azkaban是在LinkedIn上创建的批处理工作流作业调度程序,用于运行Hadoop作业。Azkaban通过作业依赖性解决订单,并提供易于使用的Web用户界面来维护和跟踪您的工作流程。工 阅读全文
摘要:
Azkaban官网:https://azkaban.github.io/Azkaban是一款开源工作流管理器。Azkaban是在LinkedIn上创建的批处理工作流作业调度程序,用于运行Hadoop作业。Azkaban通过作业依赖性解决订单,并提供易于使用的Web用户界面来维护和跟踪您的工作流程。工 阅读全文
摘要:
sqoopflume数据采集 采集日志数据sqoop数据迁移 hdfs->mysqlazkaban任务调度 flume->hdfs->shell->hive->sql->BIsqoop数据迁移=mapreduce处理离线数据整个过程就是数据导入处理导出过程直接使用mapsqoop作用:简化开发mys 阅读全文
摘要:
sqoopflume数据采集 采集日志数据sqoop数据迁移 hdfs->mysqlazkaban任务调度 flume->hdfs->shell->hive->sql->BIsqoop数据迁移=mapreduce处理离线数据整个过程就是数据导入处理导出过程直接使用mapsqoop作用:简化开发mys 阅读全文