会员
周边
众包
新闻
博问
闪存
赞助商
所有博客
当前博客
我的博客
我的园子
账号设置
简洁模式
...
退出登录
注册
登录
waker_wang
博客园
|
首页
|
新随笔
|
新文章
|
联系
|
订阅
|
管理
2018年8月26日
HDSF读写文件
摘要: HDFS 读取文件 HDFS的文件读取原理,主要包括以下几个步骤: 1、首先调用FileSystem对象的open方法,其实获取的是一个DistributedFileSystem的 实例。 2、DistributedFileSystem通过RPC(远程过程调用)获得文件的第一批block的 loca
阅读全文
posted @ 2018-08-26 14:28 waker_wang
阅读(228)
评论(0)
推荐(0)
编辑
一个 mr 作业跑的比较慢,如何来优化。
摘要: mr跑的慢可能有很多原因,如:数据倾斜、map和reduce数设置不合理、reduce等待过久、小文件过多、spill 次数过多、 merge 次数过多等。 1、解决数据倾斜:数据倾斜可能是partition不合理,导致部分partition中的数据过多,部分过少。可通过分析数据,自定义分区器解决。
阅读全文
posted @ 2018-08-26 10:39 waker_wang
阅读(1413)
评论(0)
推荐(0)
编辑
公告