【问题标题】:scraperwiki: why does my scraper work for 1 url but not another?scraperwiki:为什么我的刮刀适用于 1 个 url 而不是另一个?
【发布时间】:2013-03-02 03:42:08
【问题描述】:

这是我的第一个爬虫https://scraperwiki.com/scrapers/my_first_scraper_1/

我设法抓取了 google.com,但没有抓取此页面。

http://subeta.net/pet_extra.php?act=read&petid=1014561

有什么原因吗?

我已按照此处的文档进行操作。

https://scraperwiki.com/docs/php/php_intro_tutorial/

而且代码没有理由不工作。

【问题讨论】:

    标签: php screen-scraping scraperwiki


    【解决方案1】:

    看起来您正在指定查找特定元素。元素的变化取决于您正在抓取的网站。因此,如果它没有找到您正在寻找的元素,您将无法获得回报。另外我会考虑用 curl 创建你自己的抓取/爬取工具。您不仅会学到很多东西,还会发现很多关于如何抓取网站的信息。

    另外一方面,您可能不想考虑遵守您正在抓取的网站上的 robots.txt 文件,或者在抓取之前征求许可,因为这被认为是不礼貌的。

    【讨论】:

      猜你喜欢
      • 2019-04-07
      • 1970-01-01
      • 1970-01-01
      • 2020-06-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-12-10
      相关资源
      最近更新 更多