HIVE 大表JOIN大表优化方法
摘要:今天遇到了百亿级别的数据量JOIN 十亿级别的数据量 发现reduce 40分钟还没有出来,进去看单个task 某些task要30min+才能跑完成
阅读全文
posted @
2021-05-30 15:53
大鹏的鸿鹄之志
阅读(903)
推荐(0) 编辑
取排名前50%的数据
摘要:1 SELECT 2 goods_id, 3 mall_id, 4 gmv 5 FROM( 6 SELECT 7 goods_id, 8 mall_id, 9 gmv, 10 dense_rank() over (partition by mall_id order by gmv desc ) as
阅读全文
posted @
2021-05-20 21:31
大鹏的鸿鹄之志
阅读(144)
推荐(0) 编辑