2019 年 6月 23 日随笔档案 - 郭小白

2019年6月23日

摘要：在spark中，框架默认使用的事hashPartitioner分区器进行对rdd分区，但是实际生产中，往往使用spark自带的分区器会产生数据倾斜等原因，这个时候就需要我们自定义分区，按照我们指定的字段进行分区。具体的流程步骤如下： 1、创建一个自定义的分区类，并继承Partitioner，注意这个阅读全文

posted @ 2019-06-23 17:06 郭小白阅读(4486) 评论(0) 推荐(0) 编辑

郭小白

公告