【发布时间】:2013-01-10 17:48:25
【问题描述】:
我正在使用 beautifulsoup 从 html 字符串中提取图像和链接。这一切都很好,但是对于某些在链接内容中有标签的链接,它会引发错误。
示例链接:
<a href="http://www.example.com"><strong>Link Text</strong></a>
Python 代码:
soup = BeautifulSoup(contents)
links = soup.findAll('a')
for link in links:
print link.contents # generates error
print str(link.contents) # outputs [Link Text]
错误信息:
TypeError: sequence item 0: expected string, Tag found
我真的不想遍历链接文本中的任何子标签,我只是想返回原始内容,这对 BS 可行吗?
【问题讨论】:
-
原始内容 == 只是可见文本?还是您希望它返回
<strong>Link Text</strong>? -
对不起,我的意思是文本加上标签是什么,所以在这种情况下,我希望它输出 Link Text
标签: python beautifulsoup