【发布时间】:2016-06-02 18:45:09
【问题描述】:
我有一些像这样的html:
...
<table width="100%">
<tr class="blueborder">
<td colspan="2" class="blackbold">Some Other Text</td>
</tr>
</table>
<table width="100%">
<tr class="upcoming">
<td class="lists" >
<ul>
<li> List1 Element1</li>
<li> List1 Element2</li>
<li> List1 Element3</li>
</ul>
</td>
</tr>
</table>
<table width="100%">
<tr class="blueborder">
<td colspan="2" class="blackbold">Signaling Text</td>
</tr>
</table>
<table width="100%">
<tr class="upcoming">
<td class="lists" >
<ul>
<li> List2 Element1</li>
<li> List2 Element2</li>
<li> List2 Element3</li>
</ul>
</td>
</tr>
</table>
...
我使用的是employees = root.xpath('.//td[@class = "lists"]/ul/li/text()'),但这会同时获取两个列表元素。我只想获取列表 2,但它们具有相同的属性(类等)。唯一的区别是<td colspan="2" class="blackbold">Signaling Text</td> 在我想要的列表之前。有什么方法可以表明在此之后只获取此列表吗?
【问题讨论】:
标签: python web-scraping lxml