【发布时间】:2014-05-19 04:19:30
【问题描述】:
如何让 BeautifulSoup 只考虑网页内容的特定部分?
例如,我想在页面http://www.dailypress.com/ 上的“当前查看最多”之后仅提取所有div 标签。
是这样的:
from bs4 import BeautifulSoup
import urllib2
url = ' http://www.dailypress.com/ '
page = urllib2.urlopen(url)
soup = BeautifulSoup(page.read())
我可以使用:
str(soup).find(' Most viewed right now')
定位句子,但对确定我想要的内容部分没有帮助。
【问题讨论】:
标签: python web-scraping html-parsing beautifulsoup webpage