新闻正文提取之joyhtml

最新推荐文章于 2021-02-24 01:00:11 发布

dataee

最新推荐文章于 2021-02-24 01:00:11 发布

阅读量184

点赞数

分类专栏： Spider

Spider 专栏收录该内容

14 篇文章

订阅专栏

本文介绍了一种使用JoyHTML解析HTML文档并提取新闻正文的方法。通过DOM树解析模式，利用超链接密度法作为主要判断依据，实现了从指定URL中提取新闻内容的功能。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

joyHTML的目的是解析HTML文本当中的链接和正文，利用超链接密度法为主要判断依据的标记窗算法，采用DOM树解析模式。

环境描述：

jdk1.6

joyhtml-0.2.2

提取新闻正文demo代码如下：

public static void main(String[] args) throws Exception {
	DOMParser parser = new DOMParser();
	String url = "http://finance.people.com.cn/n/2013/1011/c66323-23157265.html";
	parser.parse(new InputSource(new URL(url).openStream()));
	Document doc = parser.getDocument();
	TextExtractor extractor = new TextExtractor(doc);
	String str = extractor.extract();
	System.out.println(str);

}

依赖的lib参见附件