mathematica抓取网页

本文介绍了一个使用Mathematica编写的简易网页抓取程序。该程序可以抓取指定页面上的链接及标题信息,并将信息存储为列表形式。适用于初学者了解网页抓取的基本流程。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

一个简易的获取网页.nb程序

list = List[];
url = "http://blog.youkuaiyun.com/gl486546/article/category/6389727/";
catchPageElem[n_] := Block[{xml, len, d, i, temp},
  xml = Import[url <> ToString[n], "XMLObject"];
  d = Cases[xml,
    XMLElement[
      "span", {"class" -> "link_title"}, {XMLElement[
        "a", {"shape" -> "rect", 
         "href" -> 
          href_}, {title_}], __}] :> {"http://blog.youkuaiyun.com" <> href, 
      StringTrim[title]}, {0, Infinity}];
  len = Length[d];
  Do[AppendTo[list, d[[i]]], {i, 1, len}]
  ]
Do[catchPageElem[i], {i, 1, 13}];
list

运行结果:
这里写图片描述
“`

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值