【发布时间】:2013-11-05 20:28:53
【问题描述】:
我正在从一个网站上提取数据,在查看源代码时使用 <td class="xxx">&nbsp;</td>,但是当使用美丽的汤提取时,python 解释器中显示为 <td class="xxx">Tá</td>。我正在尝试针对该 td 中的数据。现在它是空的。像下面这样的东西没有用,因为这不是 Ascii 字符。救命!!:
result = <td class="xxx"> </td>
#Check to see if it is returning an empty string
if not result:
print 'empty'
【问题讨论】:
-
既不是 'Tá' 也不是 ' ' (或带有文字 nbsp 的字符串)将是空字符串。另外,BeautifulSoup 不会将“ ”转换为“Tá”……您能告诉我们更多来源吗? HTML 的 URL?
-
当然。这是 URL link - 这是此 TD 中的数据:'
' -
该评论中的冒号后面应该有一个 URL 吗?好了。 :-) -
该来源中有大约 10 亿个
<td>s:您如何缩小 HTML 范围? (你是如何计算result的?)如果你可以发布一个最小的测试用例来展示你的问题,它将允许我们运行它/调试它。 -
是的,here it is
标签: python python-2.7 beautifulsoup