数据爬取 -- 编码（UTF-8 to GBK）

最新推荐文章于 2020-12-26 16:55:59 发布

原创最新推荐文章于 2020-12-26 16:55:59 发布 · 244 阅读

0 ·

CC 4.0 BY-SA版权

Network 专栏收录该内容

1 篇文章

订阅专栏

本文讨论了在从某点评网站爬取数据时遇到的乱码问题，通过使用`InputStreamReader`配合指定编码方式，成功解决了乱码问题，并提供了完整的代码实现。

昨日从某点评网爬取数据

网页编码为 UTF-8, 本地的系统默认编码为 GBK

直接使用 BufferReader 读取 HttpURLConnection 打开的 stream，会导致乱码

使用 DataInputStream 的 readUTF 也引起乱码

最后使用如下代码，得到正确的文本，如下：

BufferedReader dis;

String content = new String();
String line;
try {

    dis = new BufferedReader(new InputStreamReader(is, "UTF-8"));

    while ((line = dis.readLine()) != null) {
        content += line;
    }
    dis.close();
    String nct = new String(content.getBytes("GBK"));
    } catch (Exception e) {
        e.printStackTrace();
}