【发布时间】:2015-05-29 23:47:34
【问题描述】:
我的 HTML 代码如下所示:
<a href="/Content.aspx?id=102966" id="mylink" target="_blank">EZSTORAGE - PACK IT. STORE IT. WIN - <img src="/images/usa.png" style="border:none; height:14px; margin-bottom:-2px;"/> Nationwide - <span title="college students/staff of schools in valid states">Restrictions</span> - Ends 6/30/15</a>
我正在尝试提取呈现此 HTML 时显示的文本。
更具体地说,对于这个示例“a”标签,我正在尝试提取“EZSTORAGE - 打包。存储它。WIN - Nationwide - Restrictions - Ends 6/30/15”
但我无法提取全文,因为它被“img”标签和“span”分解。
为了提供更多上下文,我一直在使用下面的代码来搜索所有“a”标签并提取链接文本。
for link in soup.find_all('a', id='mylink'):
raw.append(link)
link_text = link.contents[0].encode('utf-8')
sweeps.append(link_text)
#output: 'EZSTORAGE - PACK IT. STORE IT. WIN - '
任何见解将不胜感激!
【问题讨论】:
标签: python html web-scraping beautifulsoup