
Hadoop
文章平均质量分 61
是一只萨摩耶
编程很枯燥,但是养只修勾一定很有趣
展开
-
浅谈大数据
研究大数据有什么意义?现在的社会是一个高速发展的社会,科技发达,信息流通,人们之间的交流也越来越密切,生活也越来越便捷,大数据就是这个高科技时代的产物。阿里巴巴创办人马云曾经说过,未来的时代将不是IT时代,而是DT的时代,DT就是Data Technology,数据科技,这显示出大数据对于阿里巴巴集团来说是举足轻重的。有人把数据比喻为蕴藏能量的煤矿。煤炭按照性质有焦煤、无烟煤、肥煤、贫煤等分类,而露天煤矿、深山煤矿的挖掘成本又不一样。与此类似,大数据并不在于“大”,而在于“有用”。数据的价值含量、挖掘成原创 2021-04-27 17:13:30 · 326 阅读 · 0 评论 -
Hadoop实现join的几种方法【大数据开发面试】
问题分析本题主要是考察学员对mapreduce的熟悉程度核心答案讲解(1)reduce side joinreduce side join是一种最简单的join方式,其主要思想如下:在map阶段,map函数同时读取两个文件File1和File2,为了区分两种来源的key/value数据对,对每条数据打一个标签 (tag),比如:tag=0表示来自文件File1,tag=2表示来自文件File2。即:map阶段的主要任务是对不同文件中的数据打标签。在reduce阶段,reduce函数获取key相同转载 2021-04-12 15:34:53 · 172 阅读 · 1 评论