【发布时间】:2013-08-05 04:54:42
【问题描述】:
我有这个 HTML 代码:
<a name="apple"></a>
<h3> header1 </h3>
<p> some text </p>
<p> some text1 </p>
<a name="orange"></a>
<h3> header2 </h3>
<p> some text 2 </p>
我想检索标题标签后的文本,使用如下代码:
for header in tree.iter('h3'):
paragraph = header.xpath('(.//following::p)[1]')
if (header.text=="apple"):
print "%s: %s" % (header.text, paragraph[0].text)
当我有多个<p> 标签时它不起作用。如何找出我的标题后有多少 <p> 标签并检索所有标签?
我使用 python 2.7 和 xpath。
【问题讨论】:
-
在每个
<h3>之后直到 下一个<h3>之后都需要所有<p>吗?还是第一个<h3>之后的所有内容,包括第二个“header2”? -
@paul t。每个
.
之后的所有
标签: python-2.7 xpath lxml