
hadoop
文章平均质量分 82
core_cto
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
不懂商业就别谈数据
前一段日子见到一位数据发烧友,我们两个有一个一致的观点:电子商务发展速度越来越快,这个行业的趋势变化也越来越快。对于电子商务公司老板来说,想要自己永远跟着趋势走,学会数据驱动是必然的了。 庆幸的是,今年搞电子商务的人对数据分析开始重视起来了,就连夫妻店起来的淘宝卖家也开始招数据分析师,更别谈一些再大些的电子商务公司。 但是,这让我心存隐忧:现在不是缺数据,转载 2013-03-07 00:36:10 · 781 阅读 · 0 评论 -
Hadoop 多表 join:map side join 范例
在没有 pig 或者 hive 的环境下,直接在 mapreduce 中自己实现 join 是一件极其蛋疼的事情,MR中的join分为好几种,比如有最常见的 reduce side join,map side join,semi join 等。今天我们要讨论的是第 2 种:map side join,这种 join 在处理多个小表关联大表时非常有用,而 reduce join 在处理多表关联时是比转载 2013-03-07 00:13:15 · 2759 阅读 · 0 评论 -
浅析 Hadoop 中的数据倾斜
最近几次被问到关于数据倾斜的问题,这里找了些资料也结合一些自己的理解. 在并行计算中我们总希望分配的每一个task 都能以差不多的粒度来切分并且完成时间相差不大,但是集群中可能硬件不同,应用的类型不同和切分的数据大小不一致总会导致有部分任务极大的拖慢了整个任务的完成时间,硬件不同就不说了,应用的类型不同其中就比如page rank 或者data mining 里面一些计算,它的每条记录转载 2013-03-07 00:32:03 · 26298 阅读 · 1 评论