【发布时间】:2011-06-13 19:13:02
【问题描述】:
我通过 xpath 废弃了一些 html,然后将其转换为 etree。类似的东西:
<td> text1 <a> link </a> text2 </td>
但是当我调用 element.text 时,我只得到 text1(它必须在那里,当我在 FireBug 中检查我的查询时,元素的文本被突出显示,嵌入锚元素之前和之后的文本......
【问题讨论】:
-
这是一种方法(代码 sn-p 来自我的小 python 抓取处理器)。想知道这是否是一个 lxml 错误?
-
这里是sn-p的代码:
-
if element.tag == "td": children = element.getchildren() if len(children) > 0: topic = (element.text + children[0].tail) else: topic = element.text print("\tTopic:\t\t%s" % 主题)
标签: python xml lxml elementtree xml.etree