【问题标题】:Beautiful Soup - Searching Between Two Parts of a DocumentBeautiful Soup - 在文档的两个部分之间进行搜索
【发布时间】:2010-11-03 16:10:24
【问题描述】:

是否可以只对页面上两个字符串之间的内容运行 Beautiful Soup?

在反复遇到使用 Yahoo Pipes 进行屏幕抓取的限制后,我开始使用 Beautiful Soup,部分原因是 Scraperwiki 上提供了托管版本。

Yahoo Pipes 中的 HTML 导入块的一个方便之处在于它可以让您识别开始字符串和停止字符串,因此您可以将抓取限制在页面的特定区域。

我在 Beautiful soup 中找到了一种从 /from/ 中提取特定字符串的方法:

def scrapeFrom(soup,txt,el,attr=''):
start=soup.find(text=txt)
return start.findAllNext(el,attr)

但看不到如何转储字符串下游的所有内容?

也就是说,我希望能够说“scrapeFromUntil(soup,fromText,untilText)”并且只在这两个字符串之间抓取标签?

有什么办法吗?

【问题讨论】:

    标签: beautifulsoup


    【解决方案1】:

    不完全是您想要的,但根据您的 HTML 格式,您可能会发现 using SoupStrainer to limit parsing to only part of the document 很有用。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-09-29
      • 1970-01-01
      • 2019-04-16
      • 2019-07-03
      • 2022-12-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多