【发布时间】:2012-06-07 12:43:00
【问题描述】:
我正在尝试使用 lxml 来获取格式为的 cmets 数组
<div id="comment-1">
TEXT
</div>
<div id="comment-2">
TEXT
</div>
<div id="comment-3">
TEXT
</div>
...
我尝试过使用
html.findall(".//div[@id='comment-*']")
但这会搜索文字星号。
对于我正在尝试做的事情来说,正确的语法是什么?
编辑:我终于做到了
doc = lxml.html.parse(url).getroot()
comment_array = doc.xpath('.//div[starts-with(@id, "comment-")]')
【问题讨论】:
-
试试
html.findall(".//div[starts-with(@id,'comment-')")