【发布时间】:2016-07-31 13:21:23
【问题描述】:
我正在学习如何使用beautiful soup 解析和操作html,如下所示:
from lxml.html import parse
import urllib2
from urllib2 import urlopen
from BeautifulSoup import BeautifulSoup
url = 'some-url-here'
req = urllib2.Request(url, headers={'User-Agent' : "Magic Browser"})
parsed = urllib2.urlopen( req )
soup = BeautifulSoup(parsed)
for elem in soup.findAll(['script', 'style', 'i']):
elem.extract()
for main_body in soup.findAll("div", {"role" : "main"}):
print main_body.getText(separator=u' ')
结果包含<i> 标签,我不知道如何删除它们。这如何实现,为什么上面的代码没有去掉唯一的标签?
【问题讨论】:
-
可以分享一下html吗?代码应该可以正常工作
标签: python beautifulsoup web-crawler