【发布时间】:2014-12-17 03:31:02
【问题描述】:
这是我的html代码:
<div style="font-size: 14px;">
<img src="somelink.com">"TEXT"<br>
这是我的 xpath:
storedText = tree.xpath('//div[@style="font-size: 14px;"]/img/text()')
但它似乎没有将“TEXT”分配给 storedText
编辑:我想添加一些不包含 img 元素但我不想抓取的文本的 html sn-ps
<div style="font-size: 14px;">
"TEXT I DONT WANT"
【问题讨论】:
-
依赖元素的
style属性看起来不太可靠。你能显示更多你正在处理的 HTML 代码吗? (或网站链接)。谢谢。 -
您使用的是哪个 xml 包? lxml、ElementTree、beautifulsoup...等
-
尝试打印
div元素以查看您的html 解析器如何构建文档。它因包而异,但如果它的 lxml 的 html 解析器,它将是lxml.html.tostring(tree.xpath('//div[@style="font-size: 14px;"]')[0]。 -
@alecxe 这里是站点:hltv.org/?pageid=2,我只想在团队名称旁边有图片(旗帜)时抓取团队名称。
标签: python html xpath web-scraping html-parsing