【发布时间】:2014-01-26 19:30:02
【问题描述】:
我是在 python 上处理 html 页面的新手。 我正在尝试从我的 PC 上离线运行 BBC 网站,为此我编写了一个 python 代码。 通过浏览主页上的链接(使用正则表达式),我已经制作了下载网站上所有 html 页面的功能。 我在本地目录上有所有链接,但它们都称为 sub0、sub1、sub2。 如何编辑主页,以便将所有链接指向我目录上的 html 页面而不是在线页面? 再一次,这些页面没有以其原始名称命名- 所以用本地目录替换域是行不通的。 我需要一种方法来浏览主页上的所有链接并更改它们的整个路径。
【问题讨论】:
标签: python html regex web-crawler