【发布时间】:2016-08-16 18:00:43
【问题描述】:
我正在尝试解析 html,如下所示:
<tbody>
<tr class data-row="0">
<td align="right"></td>
</tr>
<tr class data-row="1">
<td align="right"></td>
</tr>
<tr class="thead over_theader" data-row="2">
<td align="right"></td>
</tr>
<tr class="thead" data-row="3">
<td align="right"></td>
</tr>
<tr class data-row="4">
<td align="right"></td>
</tr>
<tr class data-row="5">
<td align="right"></td>
</tr>
</tbody>
我想获取未指定class 的所有tr 标签(及其子标签)。对于上面的示例,这意味着我想要 tr 标签,其中 data-row 不是 2 或 3。
如何使用 Beautiful Soup 4 做到这一点?
我试过了
tableBody = soup.findAll('tbody')
rows = tableBody[0].findAll(attrs={"class":""})
但是当我想要一个长度为 4 的 bs4.element.ResultSet(每个 tr 一个带有 @987654332 @)。
【问题讨论】:
标签: python html parsing attributes beautifulsoup