用htmlparser提取table信息

最新推荐文章于 2024-08-09 08:32:46 发布

原创最新推荐文章于 2024-08-09 08:32:46 发布 · 435 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#htmlparser #CssSelectorNodeFilter #AndFilter #NotFilter #HasChildFilter

java 同时被 2 个专栏收录

9 篇文章

订阅专栏

htmlparser

2 篇文章

订阅专栏

本文介绍了一种使用htmlparser1.6版本解析HTML表格时遇到的问题及解决方案。针对直接使用CSS选择器提取tr标签导致的冗余问题，通过特定过滤器进行处理，实现了正确提取表格数据。

htmlparser1.6
提取tr似乎有些问题，直接用css selector提取的tr冗余，tr里面还有tr。
所以这里多做了些处理。请看代码。

  public static Map<String,String> parseList(String url) {
    Map<String,String> rlt=new LinkedHashMap<String,String>();
    NodeFilter filter=new CssSelectorNodeFilter (".className tr");
    filter = new AndFilter(filter, new NotFilter(new HasChildFilter(new CssSelectorNodeFilter ("tr"))));
    Parser parser;
    try {
      parser = new Parser(url);
      NodeList list = parser.extractAllNodesThatMatch(filter);
      for(int i=0;i<list.size();i++){
        Node tr=list.elementAt(i);
        parser = new Parser(tr.toHtml());
        NodeList tds = parser.extractAllNodesThatMatch(new CssSelectorNodeFilter ("td"));
        String key=tds.elementAt(0).toPlainTextString();
        String value=tds.elementAt(1).toPlainTextString();
        rlt.put(key, value);
      }
    } catch (ParserException e) {
      e.printStackTrace();
    }
    return rlt;
  }

考虑一下