【发布时间】:2016-02-21 21:21:06
【问题描述】:
我从网页中抓取了一个标题列表,在源代码中采用以下形式:
<h2 class="story-heading"><a href="somelink.html">Crash Highlights
Indonesia’s Poor Air
Safety Record</a><span class="product-label theme-nyt-now "><span class="visually-hidden">NYT Now</span><i class="icon dot-logo-icon"></i></span></h2>
我只想要文字。
我得到以下列表:
[u'Crash Highlights\nIndonesia\u2019s Poor Air\nSafety RecordNYT Now', u'Palestine Joins\nHague Criminal\nCourt, Risking\nU.S. SanctionsNYT Now', ... ]
每个字符串都有"\n" 字符并以"NYT Now" 结尾 我现在如何删除NYT?据我了解,get_text() 应该只检索<a> 选项卡内的函数
这是我的代码:
url="<website link>"
html = urllib2.urlopen(url)
soup = BeautifulSoup(html,'lxml')
headings_list=[]
for heading in soup.find_all(class_="story-heading"):
for text in heading.find_all('a'):
headings_list.append(heading.get_text().strip())
print headings_list
【问题讨论】:
标签: python python-2.7 beautifulsoup