利用 Java 爬虫获取店铺所有商品实战指南

Java爬虫实战：获取店铺商品信息

最新推荐文章于 2025-12-02 21:20:38 发布

原创最新推荐文章于 2025-12-02 21:20:38 发布 · 280 阅读

7 ·

CC 4.0 BY-SA版权

文章标签：

#java #爬虫 #开发语言

在电商领域，获取店铺的所有商品信息对于市场分析、竞品研究和商业决策具有极高的价值。Java 爬虫技术可以帮助我们高效地完成这一任务。本文将详细介绍如何利用 Java 编写爬虫，获取特定店铺的所有商品信息，并提供完整的代码示例。

一、准备工作

（一）Java 开发环境

确保你的电脑上安装了 Java 开发工具包（JDK），并配置了环境变量。推荐使用 JDK 1.8 及以上版本。

（二）安装必要的 Java 库

通过 Maven 或 Gradle 管理项目依赖，主要包括以下库：

Apache HttpClient：用于发送 HTTP 请求。
Jsoup：用于解析 HTML 页面。
Jackson：用于解析 JSON 数据。

在 pom.xml 中添加以下依赖：

xml

<dependencies>
    <dependency>
        <groupId>org.apache.httpcomponents</groupId>
        <artifactId>httpclient</artifactId>
        <version>4.5.13</version>
    </dependency>
    <dependency>
        <groupId>org.jsoup</groupId>
        <artifactId>jsoup</artifactId>
        <version>1.13.1</version>
    </dependency>
    <dependency>
        <groupId>com.fasterxml.jackson.core</groupId>
        <artifactId>jackson-databind</artifactId>
        <version>2.10.0</version>
    </dependency>
</dependencies>

二、爬虫实现步骤

（一）发送 HTTP 请求

使用 Apache HttpClient 发送 GET 请求，获取店铺页面的 HTML 内容。

java

import org.apache.http.client.methods.CloseableHttpResponse;
import org.apache.http.client.methods.HttpGet;
import org.apache.http.impl.client.CloseableHttpClient;
import org.apache.http.impl.client.HttpClients;
import org.apache.http.util.EntityUtils;

public class HttpUtil {
    public static String sendGetRequest(String url) {
        CloseableHttpClient httpClient = HttpClients.createDefault();
        HttpGet httpGet = new HttpGet(url);
        try {
            return EntityUtils.toString(httpClient.execute(httpGet).getEntity());
        } catch (Exception e) {
            e.printStackTrace();
        } finally {
            try {
                httpClient.close();
            } catch (Exception e) {
                e.printStackTrace();
            }
        }
        return null;
    }
}

（二）解析 HTML 内容

利用 Jsoup 解析 HTML 文档，提取商品详情。

java

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

public class JsoupUtil {
    public static void parseProductDetails(String html) {
        Document doc = Jsoup.parse(html);
        Elements products = doc.select("div.product");
        for (Element product : products) {
            String name = product.select("h2.product-name").text();
            String price = product.select("span.product-price").text();
            System.out.println("Product Name: " + name + ", Price: " + price);
        }
    }
}

（三）完整流程

将上述功能整合到主程序中，实现完整的爬虫程序。

java

public class ProductCrawler {
    public static void main(String[] args) {
        String shopUrl = "https://www.example.com/shop/123";
        String html = HttpUtil.sendGetRequest(shopUrl);
        if (html != null) {
            JsoupUtil.parseProductDetails(html);
        }
    }
}