htmlparser1.6
提取tr似乎有些问题,直接用css selector提取的tr冗余,tr里面还有tr。
所以这里多做了些处理。请看代码。
public static Map<String,String> parseList(String url) {
Map<String,String> rlt=new LinkedHashMap<String,String>();
NodeFilter filter=new CssSelectorNodeFilter (".className tr");
filter = new AndFilter(filter, new NotFilter(new HasChildFilter(new CssSelectorNodeFilter ("tr"))));
Parser parser;
try {
parser = new Parser(url);
NodeList list = parser.extractAllNodesThatMatch(filter);
for(int i=0;i<list.size();i++){
Node tr=list.elementAt(i);
parser = new Parser(tr.toHtml());
NodeList tds = parser.extractAllNodesThatMatch(new CssSelectorNodeFilter ("td"));
String key=tds.elementAt(0).toPlainTextString();
String value=tds.elementAt(1).toPlainTextString();
rlt.put(key, value);
}
} catch (ParserException e) {
e.printStackTrace();
}
return rlt;
}

考虑一下

本文介绍了一种使用htmlparser1.6版本解析HTML表格时遇到的问题及解决方案。针对直接使用CSS选择器提取tr标签导致的冗余问题,通过特定过滤器进行处理,实现了正确提取表格数据。
304

被折叠的 条评论
为什么被折叠?



