【发布时间】:2010-05-10 15:08:15
【问题描述】:
我想从 http://abc.com/view_page.aspx?ID= 下载几个 HTML 页面,ID 来自不同数字的数组。
我有兴趣访问此 URL 的多个实例并使用不同的代理 IP/端口将文件保存为 [ID].HTML。
我想使用不同的用户代理,并且我想随机化每次下载前的等待时间。
这样做的最佳方法是什么? urllib2? pycURL?卷曲?对于手头的任务,您更喜欢什么?
请指教。谢谢大家!
【问题讨论】:
-
为什么要随机化用户代理?
-
我不想透露我是下载该页面的人。为了加强,如果我们随机使用不同的浏览器,那将巩固我的匿名性,你说什么?
标签: python proxy screen-scraping