【问题标题】:Extract text from Webpages with Python 3.x使用 Python 3.x 从网页中提取文本
【发布时间】:2011-12-13 19:53:27
【问题描述】:

我正在使用 Python 3.x

我想从多个网页中提取文本。有什么好的图书馆可以让我这样做?

谢谢, 巴里。

【问题讨论】:

  • 根据您的目标,您可以使用模块 re。 95 % 的人不赞成这样的建议,但事实是,我确实从带有 re 的网页中提取文本并且令人满意,没有他们警告过的所有可怕的事情。

标签: python python-3.x beautifulsoup


【解决方案1】:

【讨论】:

  • 我听说 lxml 比 BeautifulSoup 快,但是任何一个都应该可以工作。
  • @John Doe 根据我曾经做过的一个测试,lxml 比 BeatifulSoup 慢 10 倍,而后者比模块 re慢 10 倍>。这种比较应该得到验证,但无论如何我相信如果比率不是 10,它们至少是 2。
【解决方案2】:

mechanize 是不错的库,但遗憾的是还没有为 python 3 做好准备,但你可以看看lxml.html

【讨论】:

    【解决方案3】:

    我会建议使用Beautiful Soup,而不仅仅是通过返回的结构来获取类似于电子邮件地址的任何内容。

    您也可以只使用 urllib2,但 Beautiful Soup 会为您解决很多语法问题。

    【讨论】:

      【解决方案4】:

      你没有用提取的文本说出你想做什么,这使得你愿意付出多少努力不同把它拿出来。

      如果您尝试获取网页的 正文 减去所有与网站相关的内容(非平凡 任务),请查看 @987654321 @。它是用 Java 编写的,但在从随机网页中提取基本文本方面做得非常好。

      接下来几周我的一个爱好是在 Python 中重新创建锅炉管道的核心逻辑。我们需要它为项目提供的功能,但不想拖着 JVM 的 10 吨重的石头。我敢肯定,一旦它相当稳定,我们就会发布它。

      【讨论】:

        猜你喜欢
        • 2020-09-03
        • 1970-01-01
        • 1970-01-01
        • 2018-08-04
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多