【发布时间】:2010-11-03 16:10:24
【问题描述】:
是否可以只对页面上两个字符串之间的内容运行 Beautiful Soup?
在反复遇到使用 Yahoo Pipes 进行屏幕抓取的限制后,我开始使用 Beautiful Soup,部分原因是 Scraperwiki 上提供了托管版本。
Yahoo Pipes 中的 HTML 导入块的一个方便之处在于它可以让您识别开始字符串和停止字符串,因此您可以将抓取限制在页面的特定区域。
我在 Beautiful soup 中找到了一种从 /from/ 中提取特定字符串的方法:
def scrapeFrom(soup,txt,el,attr=''):
start=soup.find(text=txt)
return start.findAllNext(el,attr)
但看不到如何转储字符串下游的所有内容?
也就是说,我希望能够说“scrapeFromUntil(soup,fromText,untilText)”并且只在这两个字符串之间抓取标签?
有什么办法吗?
【问题讨论】:
标签: beautifulsoup