会员
周边
众包
新闻
博问
闪存
赞助商
所有博客
当前博客
我的博客
我的园子
账号设置
简洁模式
...
退出登录
注册
登录
elite_lcf
博客园
首页
新随笔
联系
订阅
管理
2010年10月24日
(转)海量数据处理专题
摘要: 1. 给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?方案1:可以估计每个文件安的大小为50G×64=320G,远远大于内存限制的4G。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。s 遍历文件a,对每个url求取,然后根据所取得的值将url分别存储到1000个小文件(记为)中。这样每个小文件的大约为300M...
阅读全文
posted @ 2010-10-24 19:51 elite_lcf
阅读(4250)
评论(0)
推荐(2)
编辑
公告
本博客采用
知识共享署名-非商业性使用-禁止演绎 2.5 中国大陆许可协议
进行许可。