【问题标题】:Simple script for scraping data in python用于在 python 中抓取数据的简单脚本
【发布时间】:2017-07-17 03:48:45
【问题描述】:

我正计划构建一个脚本来从网站上抓取数据,该数据将在 url 中包含不同的 id,所以我想遍历它。

例如网址:http://demosite.com/posts/1 上述网址中的“1”的数量从 1 到 2,00,000 不等。所以我想运行一个 python 脚本,它会在循环中运行并从网站上获取 1-2,00,000 之间的数据。

我正在使用以下代码-

import urllib2
import re
for i in xrange(1,200000):
    req = urllib2.Request('http://demosite.com/posts/' + i,
          headers={ 'User-Agent': 'Mozilla/5.0' })
    html = urllib2.urlopen(req).read()

    print html

【问题讨论】:

  • SO 不是代码编写服务。你应该至少付出最小的努力来自己解决这个问题。
  • 更新了我正在使用但遇到错误的代码。

标签: python web-scraping automation


【解决方案1】:

i 是一个 int'http://demosite.com/posts/' 是一个字符串。您不能使用 + 连接 int 和字符串。将i 转换为字符串(str(i))或使用str.format

url = 'http://demosite.com/posts/{}'.format(i)
req = urllib2.Request(url, headers={ 'User-Agent': 'Mozilla/5.0' })

【讨论】:

  • 增加一次性发送的请求数量并将输出保存到 txt 文件的可能方法是什么?
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2011-12-24
  • 2018-07-27
  • 1970-01-01
相关资源
最近更新 更多