【问题标题】:Reading text in elements using lxml.etree使用 lxml.etree 读取元素中的文本
【发布时间】:2013-09-23 08:38:16
【问题描述】:

我正在使用 Python 版本的 lxml 库。我目前正在尝试解析表格中的文本,但遇到了一些文本是链接的问题。

例如,其中一个单元格可能如下所示:

<td>
    Can I kick it, <a>to all the people</a> who can quest like a <a>tribe</a> does
</td>

说解析html后,td元素存储为foo。然后foo.text 将不会显示整个文本,只会显示不是链接的部分。此外,如果我使用[i.text for i in foo.getchildren()] 找到链接文本,我将不再知道放置非链接文本和链接文本的顺序。

有没有简单的方法来解决这个问题?

【问题讨论】:

    标签: python lxml elementtree


    【解决方案1】:

    搜索了一个小时后,在发布此问题后的 2 分钟内,我找到了解决方案。

    使用 foo.text_content() 方法,这将显示需要的内容。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2012-02-19
      • 2011-06-13
      • 2012-07-02
      • 2022-01-17
      • 1970-01-01
      • 2017-03-30
      • 1970-01-01
      相关资源
      最近更新 更多