【问题标题】:How to scrape "download page" of any site using python [closed]如何使用 python 抓取任何网站的“下载页面”[关闭]
【发布时间】:2012-11-08 17:43:13
【问题描述】:

我想使用 python 抓取任何站点的下载页面以提取有关版本的信息及其下载链接。 我正在学习python,想用beautifulsoup 来做,但是这些页面非常复杂,而且看起来很难找到这些东西。 提前致谢

【问题讨论】:

  • 你的问题太模糊了,没人敢回答:)
  • 仅供参考,它是 scrape(和 scrapingscrapedscraper)而不是 scrap

标签: python web-scraping beautifulsoup


【解决方案1】:

欢迎来到堆栈溢出! --我猜你的意思是“scrape”,因为“scrap”的意思是“扔掉”。

首先,您必须使用 urllib2 来创建要抓取的页面的文件对象。阅读this 了解如何操作。

然后,您必须通过检查页面的 html 内容来确定要从页面本身获取哪些信息。

最后,您将文件对象传递给美丽汤的解析器,并浏览 HTML 以返回您想要获取的信息。

为了将来参考,BeautifulSoup 有 beautiful 文档。如果你想精通编程,就必须学习如何阅读文档——从这里开始真的只会变得更难。

【讨论】:

  • 除非完全必要,否则我倾向于避免使用urllib2,而使用docs.python-requests.org/en/latest
  • @JonClements 我也是,但如果有人说他们是初学者,我通常会根据标准库给出建议。请求是几个月(或几周或几年,取决于学生的敬业程度)。
猜你喜欢
  • 2012-07-27
  • 1970-01-01
  • 1970-01-01
  • 2016-07-16
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-09-26
相关资源
最近更新 更多