【发布时间】:2017-03-03 04:04:31
【问题描述】:
我回到了我在 Python 中的一个旧项目,但我似乎忘记了我是如何设法提取数据的,如果有人能指出正确的方向和实现这一点的文档,我将不胜感激。
我实现了一个网络爬虫,它通过扫描我的 html 代码从 HTML 页面中提取信息。使用我使用过的 BeautifulSoup 和 urllib2 库扫描 mywebsite.com/product=1 的 URL。
但我想让 mywebsite.com 最多增加到 10。我如何准确地提取、读取和替换 url 的末尾并替换它?我注意到其他人实现了 urlparse 库来替换域 main,但它与我的方法不同。
> mywebsite.com/product=1
> mywebsite.com/product=2
> mywebsite.com/product=3
> mywebsite.com/product=4 ..
> mywebsite.com/product=10
谢谢!
【问题讨论】:
标签: python url extract counter