【发布时间】:2014-05-26 12:51:11
【问题描述】:
我正在尝试使用 lxml 解析 html,如下所示:
<tr id="element-36a07b7" class=" " ... data-date="2014-05-25">
<td>2014-05-25</td>
<td>Wikipedia (<a href="http://example.com/36a07b7" title="Wikipedia search">link</a>)</td>
<td>Yandex (<a href="http://ya.ru/36a07b7" title="Yandex search">link</a>)</td>
<td title="what I am looking for">another needed info<span class="small">(<a href="http://example.com">info 3</a>)</span>
</td>
<td class="result">1</td>
<td class="result">2</td>
<td class="result">3</td>
...
</tr>
并希望获取 id 等于 element-... 的所有元素并从那里提取 36a07b7、data-date、what I am looking for、another needed info 和 info 3。
首先,我正在尝试获取所有element-s:
elements = t.find('//*[@id="flight-"]')
如何在 id 名称中使用通配符?尝试使用*,.*,但不起作用。
【问题讨论】:
标签: python html parsing python-2.7 lxml