【发布时间】:2017-07-17 03:48:45
【问题描述】:
我正计划构建一个脚本来从网站上抓取数据,该数据将在 url 中包含不同的 id,所以我想遍历它。
例如网址:http://demosite.com/posts/1 上述网址中的“1”的数量从 1 到 2,00,000 不等。所以我想运行一个 python 脚本,它会在循环中运行并从网站上获取 1-2,00,000 之间的数据。
我正在使用以下代码-
import urllib2
import re
for i in xrange(1,200000):
req = urllib2.Request('http://demosite.com/posts/' + i,
headers={ 'User-Agent': 'Mozilla/5.0' })
html = urllib2.urlopen(req).read()
print html
【问题讨论】:
-
SO 不是代码编写服务。你应该至少付出最小的努力来自己解决这个问题。
-
更新了我正在使用但遇到错误的代码。
标签: python web-scraping automation