【发布时间】:2013-09-23 08:38:16
【问题描述】:
我正在使用 Python 版本的 lxml 库。我目前正在尝试解析表格中的文本,但遇到了一些文本是链接的问题。
例如,其中一个单元格可能如下所示:
<td>
Can I kick it, <a>to all the people</a> who can quest like a <a>tribe</a> does
</td>
说解析html后,td元素存储为foo。然后foo.text 将不会显示整个文本,只会显示不是链接的部分。此外,如果我使用[i.text for i in foo.getchildren()] 找到链接文本,我将不再知道放置非链接文本和链接文本的顺序。
有没有简单的方法来解决这个问题?
【问题讨论】:
标签: python lxml elementtree