【问题标题】:Trying to download html pages to create a very simple web crawler尝试下载html页面创建一个非常简单的网络爬虫
【发布时间】:2014-01-26 19:30:02
【问题描述】:

我是在 python 上处理 html 页面的新手。 我正在尝试从我的 PC 上离线运行 BBC 网站,为此我编写了一个 python 代码。 通过浏览主页上的链接(使用正则表达式),我已经制作了下载网站上所有 html 页面的功能。 我在本地目录上有所有链接,但它们都称为 sub0、sub1、sub2。 如何编辑主页,以便将所有链接指向我目录上的 html 页面而不是在线页面? 再一次,这些页面没有以其原始名称命名- 所以用本地目录替换域是行不通的。 我需要一种方法来浏览主页上的所有链接并更改它们的整个路径。

【问题讨论】:

    标签: python html regex web-crawler


    【解决方案1】:

    我认为最好的方法是创建某种映射文件。该文件将映射 BBC 站点上的原始 URL => 您机器上文件的路径。当您从主页抓取链接时,您可以在此过程中非常轻松地生成此文件。然后,当您想离线抓取此站点时,您可以简单地遍历此文档并访问本地文件路径。或者,您可以爬过原始主页并搜索映射文件中的链接并找出它们指向的文件。

    这种方法有一些明显的缺点,最明显的是更改下载页面的目录结构/文件名会破坏您的抓取...

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-05-06
      • 2023-03-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多