如何做大表和大表的关联？

最新推荐文章于 2025-01-18 17:29:54 发布

mark_to_win

最新推荐文章于 2025-01-18 17:29:54 发布

阅读量1.7k

点赞数

CC 4.0 BY-SA版权

分类专栏： Hadoop与MapReduce 文章标签： Hadoop MapReduce 马克-to-win 马克java社区如何做大表和大表的关联

本文链接：https://blog.youkuaiyun.com/mark_to_win/article/details/90379327

Hadoop与MapReduce 专栏收录该内容

38 篇文章

订阅专栏

博客围绕大表和大表的关联展开，指出reducejoin可解决关联问题但有数据倾斜风险。提出将其中一个大表切分成多个小表再进行关联的思路，还给出了相关代码示例，更多内容可查看指定链接。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

如何做大表和大表的关联？对于大表和大表的关联： 1.reducejoin可以解决关联问题，但不完美，有数据倾斜的可能，如前所述。 2.思路：将其中一个大表进行切分，成多个小表再进行关联。

package com;

import org.apache.commons.lang.StringUtils;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.NullWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Mapper;
import java.io.BufferedReader;
import java.io.FileInputStream;
import java.io.IOException;
import java.io.InputStreamReader;
import java.util.HashMap;
import java.util.Map;

public class MapJoinMapper extends Mapper<LongWritable, Text, Text, NullWritable> {
    Map<String, String> dictMap = new HashMap<>();
    Text k = new Text();

    protected void setup(Context context) throws IOException, InterruptedException {
        String path = context.getCacheFiles()[0].getPath();
        BufferedReader br = new BufferedReader(new InputStreamReader(new FileInputStream(path)));
        String line;
        while (StringUtils.isNotEmpty(line = br.readLine())) {
            String[] fields = line.split(",");
            dictMap.put(fields[0], fields[1]+","+fields[2]);
        }
        br.close();
    }

    protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException {
        String orderLine = value.toString();
        String[] fields = orderLine.split(",");

更多请见：https://blog.youkuaiyun.com/qq_44594249/article/details/96970999