Hadoop实战之专利数据处理

最新推荐文章于 2020-06-13 00:26:07 发布

原创

最新推荐文章于 2020-06-13 00:26:07 发布 · 1.2k 阅读

4 ·

CC 4.0 BY-SA版权

文章标签：

#hadoop #mapreduce

本文介绍了一次使用Hadoop进行专利数据处理的实验，基于Hadoop in action一书第四章内容。实验中，从http://data.nber.org/patents/获取专利数据并上传至hdfs，主要处理文件cite75-99.txt，通过MapReduce程序实现专利引用的倒排，计算每个专利的引用次数，并进一步统计不同引用次数的专利数量。运行结果显示，大部分专利被引用次数少于10次，少数专利被引用上百次。

运行环境VMware10、CentOS6.6、hadoop1.2.1

本实验依照Hadoop in action一书第四章进行

首先拿到专利数据：http://data.nber.org/patents/，并上传到hdfs中

本文使用是的cite75-99.txt，该文件涵盖了自1975年到1999年间对美国专利的引用，包含超过1600万条数据，前几行如下图：

其中第一列为专利号、第二列为被第一列引用的专利号，可见专利3858241共引用了5个专利。

编写MapReduce程序读取专利引用数据并进行倒排，对于每一个专利找到哪些专列对他进行了引用并进行合并。

package HIA;
import java.io.IOException;
import java.util.StringTokenizer;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Mapper.Context;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;


public class job1 {

	public st

最低0.47元/天解锁文章