【发布时间】:2012-11-06 08:52:55
【问题描述】:
我需要从 HTML 页面中提取艺术家的姓名。这是页面的sn-p:
</td>
<td class="playbuttonCell">
<a class="playbutton preview-track" href="/music/example" data-analytics-redirect="false" >
<img class="transparent_png play_icon" width="13" height="13" alt="Play" src="http://cdn.last.fm/flatness/preview/play_indicator.png" style="" />
</a>
</td>
<td class="subjectCell" title="example, played 3 times">
<div>
<a href="/music/example-artist" >Example artist name</a>
我已经尝试过了,但没有完成这项工作。
import urllib
from bs4 import BeautifulSoup
html = urllib.urlopen('http://www.last.fm/user/Jehl/charts?rangetype=overall&subtype=artists').read()
soup = BeautifulSoup(html)
print soup('a')
for link in soup('a'):
print html
我在哪里搞砸了?
【问题讨论】:
-
您在循环中打印
html而不是link。 -
哦,是的,我打印了 html 以在此处发布代码并忘记更改。但仍然不是我需要的解决方案,它会打印整个锚标签。
-
我已经在这里回答了你的问题,它有效stackoverflow.com/questions/13233548/…
-
也许
str(link)或link.prettify()是你想要的? -
这不是你最初问 muchacho 的问题。您的问题应该更具描述性,我们无法读懂您的想法。
标签: python anchor beautifulsoup scraper