摘要: 一、动态分区 先来说说我对动态分区的理解与一些感受吧。 由于我们通过hive去查询数据的时候,实际还是查询HDFS上的数据,一旦一个目录下有很多文件呢?而我们去查找的数据也没有那么多,全盘扫描就会浪费很多时间和资源。 为了避免全盘扫描和提高查询效率,引入了分区的概念。 分区的展现形式,就是在HDFS 阅读全文
posted @ 2019-12-25 20:29 Xiaohu_BigData 阅读(396) 评论(0) 推荐(0) 编辑
摘要: Hive优化(下面的红色标记是十分重要的,大部分情况是需要开启的) 优化1:hive的抓取策略理论上来说,Hive中的所有sql都需要进行mapreduce,但是hive的抓取策略帮我们省略掉了这个过程,把切片split的过程提前帮我们做了。Set hive.fetch.task.conversio 阅读全文
posted @ 2019-12-25 16:13 Xiaohu_BigData 阅读(263) 评论(0) 推荐(0) 编辑