spark中stage划分简单总结
父RDD的每一个分区最多被一个子RDD的分区所用,即同分区的所有key可以被映射到同一分区,这就是窄依赖,没必要进行shuffle。
宽依赖,key被映射到不同分区,需要shuffle。
spark中有两类stage,也称为task,一类是shuffleMapTask(用于shuffle),另一类是resultTask(用于产生结果)。
父RDD的每一个分区最多被一个子RDD的分区所用,即同分区的所有key可以被映射到同一分区,这就是窄依赖,没必要进行shuffle。
宽依赖,key被映射到不同分区,需要shuffle。
spark中有两类stage,也称为task,一类是shuffleMapTask(用于shuffle),另一类是resultTask(用于产生结果)。
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】凌霞软件回馈社区,博客园 & 1Panel & Halo 联合会员上线
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】博客园社区专享云产品让利特惠,阿里云新客6.5折上折
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步