第十章 Hive调优 【group by 开启map端聚合】
1. 对group by的调优 (开启map端聚合)
说明 : 默认情况下 Map阶段相同的key 会被发送到同一个reduce中去聚合
当某个key数据量过大时,就造成了数据倾斜
什么是map端聚合?
并不是所有聚合操作,都需要在reduce端聚合,可以在map端先将部分数据,进行聚合,最终数据在reduce聚合
参数设置
-- 是否开启map的聚合(默认为true) set hive.map.aggr=true; -- 在 Map 端进行聚合操作的条目数目 set hive.groupby.mapaggr.checkinterval=100000; -- 发生数据倾斜时,进行负载均衡 set hive.groupby.skewindata=true; 说明 : 当选项设定为 true,生成的查询计划会有两个 MR Job。 第一个 MR Job 中,Map 的输出结果(outKey) 会随机分布到 Reduce 中, 每个 Reduce 做部分聚合操作,并输出结果
这样处理好处是 相同的 Group By Key 有可能被分发到不同的 Reduce 中,从而达到负载均衡的目的 第二 个 MR Job 再根据预处理的数据结果
按照 Group By Key 分布到 Reduce 中(这个过程可以保证 相同的 Group By Key 被分布到同一个 Reduce 中),最后完成最终的聚合操作
测试
INFO : Hadoop job information for Stage-1: number of mappers: 1; number of reducers: 1
开启map端聚合 : 748 rows selected (31.345 seconds)
关闭map端聚合 : 748 rows selected (38.138 seconds)
分类:
Hive
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· 【自荐】一款简洁、开源的在线白板工具 Drawnix
· 没有Manus邀请码?试试免邀请码的MGX或者开源的OpenManus吧
· 园子的第一款AI主题卫衣上架——"HELLO! HOW CAN I ASSIST YOU TODAY
· 无需6万激活码!GitHub神秘组织3小时极速复刻Manus,手把手教你使用OpenManus搭建本
· C#/.NET/.NET Core优秀项目和框架2025年2月简报