014作业9.18

一.

1.DKhadoop发行版：有效的集成了整个HADOOP生态系统的全部组件，并深度优化，重新编译为一个完整的更高性能的大数据通用计算平台，实现了各部件的有机协调。因此DKH相比开源的大数据平台，在计算性能上有了高达5倍(最大)的性能提升。DKhadoop将复杂的大数据集群配置简化至三种节点(主节点、管理节点、计算节点)，极大的简化了集群的管理运维，增强了集群的高可用性、高可维护性、高稳定性

2、Cloudera发行版：CDH是Cloudera的hadoop发行版，完全开源，比Apache hadoop在兼容性，安全性，稳定性上有增强。

3、€Hortonworks发行版：Hortonworks 的主打产品是Hortonworks Data Platform (HDP)，也同样是100%开源的产品，其版本特点：HDP包括稳定版本的Apache Hadoop的所有关键组件;安装方便，HDP包括一个现代化的，直观的用户界面的安装和配置工具。

4、MAPR发行版：mapR有免费和商业两个版本，免费版本在功能上有所减少。

5、华为hadoop发行版：华为的hadoop版本基于自研的Hadoop HA平台，构建NameNode、JobTracker、HiveServer的HA功能，进程故障后系统自动Failover，无需人工干预，这个也是对hadoop的小修补，远不如mapR解决的彻底。

二：

组件名	功能及作用	优势	局限	应用场景	相关功能组件
HDFS	分布式文件系统。存储是大数据技术的基础	（1）高吞吐量访问；（2）高容错性；（3）容量扩充	（1）不适合低延迟数据访问；（2）不适合存储大量小文件；（3）不支持多用户写入及任意修改文件（只能执行追加操作，写操作只能在文件末位完成）	可处理超大文件，可运行于廉价的商用机器集群。	hadoop文件系统包含local（支持有客户端校验和的本地文件系统）、har（构建在其他文件系统上进行归档文件的文件系统，在hadoop主要被用来减少namenode的内存使用）、kfs（cloudstroe前身是Kosmos文件系统，是类似于HDFS和Google的GFS的文件系统）、ftp（由FTP服务器支持的文件系统）
Mapreduce	计算模型	（1）被多台主机同事处理，速度快；（2）擅长处理少量大数据；（3）容错性，节点故障导致失败作业时，mapreduce计算框架会自动将作业安排到健康的节点	（1）不适合大量小数据；（2）过于底层化，编程复杂；（3）JobTracker单点瓶颈，JobTracker负责作业的分发、管理和调度，任务量多会造成其内存和网络带宽的快速消耗，最终使其成为集群的单点瓶颈；（4）Task分配容易不均；（5）作业延迟高（TaskTracker汇报资源和运行情况，JobTracker根据其汇报情况分配作业等过程）；（6）编程框架不够灵活；（7）Map池和Reduce池区分降低了资源利用率；	日志分析、海量数据排序、在海量数据中查找特定模式等	可用hive简化操作，完成简单任务
Yarn	改善MapReduce的缺陷	（1）分散了JobTracker任务，提高了集群的扩展性和可用性；（2）扩大了MapReduce编程人员范围；（3）在资管管理器故障时，可快速重启恢复状态；（4）不再区分Map池和Reduce池，提高了资源利用率；
Hive	数据仓库	（1）易操作；（2）能处理不变的大规模数据级上的批量任务；（3）可扩展性（可自动适应机器数目和数据量的动态变化）；（4）可延展性（结合mapreduce和用户定义的函数库）；（5）良好的容错性；（6）低约束的数据输入格式	（1）不提供数据排序和查询功能；（2）不提供在线事务处理；（3）不提供实时查询；（4）执行延迟
Hbase	数据仓库	数据库，存储松散型数据。向下提供存储，向上提供运算。	（1）海量存储；（2）列式存储；（3）极易扩展（基于RegionServer上层处理能力的扩展和基于HDFS存储的扩展）；（4）高并发；（5）稀疏，列数据为空时，不会占用存储空间。	（1）对多表关联查询支持不足；（2）不支持sql，开发难度加大	查询简单、不涉及复杂关联的场景，如海量流水数据、交易记录、数据库历史数据
Pig	数据分析平台，侧重数据查询和分析，而不是对数据进行修改和删除等。需要把真正的查询转换成相应的MapReduce作业	（1）处理海量数据的速度快（2）相较mapreduce，使用Pig Latin编写程序时，不需关心程序如何更好地在hadoop云平台上运行，因为这些都有pig系统自行分配。（3）在资管管理器故障时，可快速重启恢复状态；（4）不再区分Map池和Reduce池，提高了资源利用率；		处理系统内日志文件、处理大型数据库文件、处理特定web数据	可看做简化mapreduce的高级语言
Zookeeper	协调服务	（1）高吞吐量（2）低延迟（3）高可靠（4）有序性，每一次更新操作都有一个全局版本号		控制集群中的数据，如管理hadoop集群中的NameNode、Hbase中的Mster Election、Server见的状态同步
Avro	基于二进制数据传输高性能的中间件。数据序列化系统，可以将数据结构或对象转化成便于存储或传输的格式，以节约数据存储空间和网络传输贷款。适用于远程或本地大批量数据交互。	（1）模式和数据在一起，反序列化时写入的模式和独处的模式都是已知的；（2）多语言支持；（3）可有效减少大规模存储较小的数据文件的数据量；（4）丰富的数据结构类型			hadoop的RPC
Chukwa	数据收集系统，帮助hadoop用户清晰了解系统运行的状态，分析作业运行的状态及HDFS的文件存储状态				Scribe存储在中央存储系统（NFS）、Kafka、Flume。看到一篇对于日志系统讲的比较清晰的，也做了分类比较，再次引用给大家。

三：

安装hadoop

在apache hadoop安装hadoop2.6.0，并将其解压到/usr/local中,修改目录名，因为在根目录下的执行命令需要输入密码，所以，改变hadoop目录的用户为hadoop，方便操作。

sudo tar -zxvf hadoop-2.6.0.tar.gz -C /usr/local/

cd /usr/local

sudo mv hadoop-2.6.0/ hadoop

sudo chown -R hadoop ./hadoop

查看版本

其中hadoop的目录结构就是

其中bin和sbin就是使用hadoop的脚本，类似于jdk中bin中javac这个编译程序，所以可以配置环境。配置环境之后，用source生效。

export HADOOP_HOME=/usr/local/hadoop

export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

到此位置，单机版的hadoop已经配置完毕。也就是利用本地的文件系统。

现在我们可以执行例子来感受下 Hadoop 的运行。Hadoop 附带了丰富的例子（运行 ./bin/hadoop jar ./share/hadoop/mapreduce/hadoop-mapreduce-examples-2.6.0.jar 可以看到所有例子），包括 wordcount、terasort、join、grep 等。
测试如下：

cd /usr/local/hadoop

mkdir ./input

cp ./etc/hadoop/*.xml ./input # 将配置文件作为输入文件

hadoop jar ./share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar grep ./input ./output 'dfs[a-z.]+'

cat ./output/*

Hadoop 默认不会覆盖结果文件，因此再次运行上面实例会提示出错，需要先将 ./output 删除

rm -r ./output/

伪分布式配置

这一部分需要自学hdfs相关内容

Hadoop 的配置文件位于 /usr/local/hadoop/etc/hadoop/ 中，伪分布式需要修改2个配置文件 core-site.xml 和 hdfs-site.xml 。Hadoop的配置文件是 xml 格式，每个配置以声明 property 的 name 和 value 的方式来实现。这些标签所代表的意义可以在官网上寻找。

修改配置文件 core-site.xml：

<name>hadoop.tmp.dir</name>

<value>file:/usr/local/hadoop/tmp</value>

<description>Abase for other temporary directories.</description>

</property>

<name>fs.defaultFS</name>

<value>hdfs://localhost:9000</value>

</property>

</configuration>

修改hdfs-site.xml：

<name>dfs.replication</name>

</property>

<name>dfs.namenode.name.dir</name>

<value>file:/usr/local/hadoop/tmp/dfs/name</value>

</property>

<name>dfs.datanode.data.dir</name>

<value>file:/usr/local/hadoop/tmp/dfs/data</value>

</property>

</configuration>

说明：

此外，伪分布式虽然只需要配置 fs.defaultFS 和 dfs.replication 就可以运行，不过若没有配置 hadoop.tmp.dir 参数，则默认使用的临时目录为根目录下的 /tmp/hadoo-hadoop，而这个目录在重启时有可能被系统清理掉，导致必须重新执行 format 才行。所以我们进行了设置，同时也指定dfs.namenode.name.dir 和 dfs.datanode.data.dir，否则在接下来的步骤中可能会出错。

接下来执行：

cd /usr/local/hadoop

./bin/hdfs namenode -format

namenode可以看作是集群中的boss，就像是一块硬盘需要初始化成某种格式才能使用，这里的namenode就是一块硬盘，初始化为hdfs格式了。

Error: JAVA_HOME is not set and could not be found. 的错误，则说明之前设置 JAVA_HOME 环境变量那边就没设置好，那就要好好配置java环境变量，如果还不行的话，修改配置文件目录下hadoop-env.sh文件的参数export JAVA_HOME=安装jdk的具体地址。

启动hdfs

start-dfs.sh

jps是jdk提供的一个查看当前java进程的小工具，可以看做是JavaVirtual Machine Process Status Tool的缩写。非常简单实用。

jps

出现SecondaryNameNode， DataNode，NameNode，Jps则表示启动成功。

hadoop启动后，会在本地的web端口50070显示一些信息，可以访问 Web 界面 http://localhost:50070 查看 NameNode 和 Datanode 信息，还可以在线查看 HDFS 中的文件。

到此，hadoop成功安装成伪分布式了。

关闭hadoop如下：（其中.sh结尾的是shell脚本，直接运行）

posted on 2020-09-18 11:07 今天中午恰什么阅读(95) 评论(0) 编辑收藏举报

会员力量，点亮园子希望

刷新页面返回顶部

今天中午恰什么

导航

公告

014作业9.18