【发布时间】:2020-04-03 06:43:15
【问题描述】:
在这里,我想抓取一个名为“fundsnetservices.com”的网站。具体来说,我想抓取每个程序下方的文本——它是关于一个段落的文本。
使用 Google Chrome Inspect 方法,我能够拉出这个...
'/html/body/div[3]/div/div/div[1]/div/p[2]/text()'
... 作为 xpath。但是,每次我打印出文本时,它都会返回 [ ]。为什么会这样?
response = urllib.request.urlopen('http://www.fundsnetservices.com/searchresult/30/International-Grants-&-Funders/18.html')
tree = etree.HTML(response.read().decode('utf-16'))
text = tree.xpath('/html/body/div[3]/div/div/div[1]/div/p[2]/text()')
【问题讨论】:
标签: python html xml xpath lxml