【发布时间】:2015-11-30 08:28:09
【问题描述】:
我想从这个页面上刮掉信息:https://www.jobsbank.gov.sg/ICMSPortal/portlets/JobBankHandler/SearchDetail.do?id=JOB-2015-0321370
但是,我无法使用 python 解析它。我不确定是什么问题,因为我不熟悉 html。这可能与我在 html 中看到的影子根有关吗?如果是这样,我该如何克服它?
url = 'https://www.jobsbank.gov.sg/ICMSPortal/portlets/JobBankHandler/SearchDetail.do?id=JOB-2015-0321370'
hdr = {'User-Agent':'Mozilla/5.0'}
while True:
req = urllib2.Request(url,headers=hdr)
try:
page = urllib2.urlopen(req)
except:
print("Exception ConnectionError was caught, retrying requests...")
time.sleep(5)
else:
break
content = page.read()
tree = html.fromstring(content)
jobTitle = tree.xpath('//div[@class="jobDes"]/h3/text()')
谢谢。
【问题讨论】:
-
你遇到了什么问题?
-
您是否获得了正确的 html,或者它阻止了您使用刮板?我试过了,经过几次尝试,它开始返回一个页面,上面写着
Hello, I am a java script test analytics page
标签: python html parsing web-scraping