【问题标题】:Python URL end string counterPython URL 结束字符串计数器
【发布时间】:2017-03-03 04:04:31
【问题描述】:

我回到了我在 Python 中的一个旧项目,但我似乎忘记了我是如何设法提取数据的,如果有人能指出正确的方向和实现这一点的文档,我将不胜感激。

我实现了一个网络爬虫,它通过扫描我的 html 代码从 HTML 页面中提取信息。使用我使用过的 BeautifulSoup 和 urllib2 库扫描 mywebsite.com/product=1 的 URL。

但我想让 mywebsite.com 最多增加到 10。我如何准确地提取、读取和替换 url 的末尾并替换它?我注意到其他人实现了 urlparse 库来替换域 main,但它与我的方法不同。

>  mywebsite.com/product=1  
>  mywebsite.com/product=2 
>  mywebsite.com/product=3  
>  mywebsite.com/product=4  .. 
>  mywebsite.com/product=10

谢谢!

【问题讨论】:

    标签: python url extract counter


    【解决方案1】:

    你的意思是循环爬取10次吗?

    for i in range(1, 11):
        url = r"mywebsite.com/product=" + str(i)
        url = r"mywebsite.com/product={}".format(i) # or use str.format
        print(url)
    
        # crawl and extract
    

    【讨论】:

      猜你喜欢
      • 2012-11-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-03-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多