【发布时间】:2018-12-07 03:42:20
【问题描述】:
我想在下面的代码中忽略 <td> 中的嵌套标签。
我只想要<td> 中的整数(数字)而不是<strong> 标签中包含的文本。
我已经编写了 selenium 代码,但它在 <td>. 中返回了整个文本
有什么方法可以让我忽略嵌套并获取<td>中的数字
Python 代码:
wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '#middle > table > tbody > tr:nth-child(2) > td:nth-child(1) > table > tbody > tr:nth-child(1) > td')))
data = driver.find_elements_by_css_selector("#middle > table > tbody > tr:nth-child(2) > td:nth-child(1) > table > tbody > tr:nth-child(1) > td")
print(data[0].text)
输出:: 包裹号 71200000
但我只想要71200000
HTML:
<table width="100%">
<tbody>
<tr style="">
<td><strong>Parcel Number</strong> 71200000</td>
</tr>
<tr style="">
<td><strong>Tax Area</strong> 19A - TAX DISTRICT 19A</td>
</tr>
<tr style="">
<td><strong>Situs Address</strong> </td>
</tr>
<tr style="">
<td><strong>Legal Summary</strong> W.H.M. SECTION A BLK 1 LOT 1 CONT. 7.14 AC</td>
</tr>
</tbody>
</table>
【问题讨论】:
-
您可以应用正则表达式来提取数字。
-
但对于其他
我不能应用正则表达式。例如 税区 19A - TAX DISTRICT 19A 在此我需要:19A - 仅限 TAX DISTRICT 19A -
你将不得不处理你得到的文本。我可以用 java 提供,但似乎你需要用 Python。
标签: python html selenium web-scraping css-selectors