【发布时间】:2011-12-13 19:53:27
【问题描述】:
我正在使用 Python 3.x
我想从多个网页中提取文本。有什么好的图书馆可以让我这样做?
谢谢, 巴里。
【问题讨论】:
-
根据您的目标,您可以使用模块 re。 95 % 的人不赞成这样的建议,但事实是,我确实从带有 re 的网页中提取文本并且令人满意,没有他们警告过的所有可怕的事情。
标签: python python-3.x beautifulsoup
我正在使用 Python 3.x
我想从多个网页中提取文本。有什么好的图书馆可以让我这样做?
谢谢, 巴里。
【问题讨论】:
标签: python python-3.x beautifulsoup
【讨论】:
mechanize 是不错的库,但遗憾的是还没有为 python 3 做好准备,但你可以看看lxml.html
【讨论】:
我会建议使用Beautiful Soup,而不仅仅是通过返回的结构来获取类似于电子邮件地址的任何内容。
您也可以只使用 urllib2,但 Beautiful Soup 会为您解决很多语法问题。
【讨论】:
你没有用提取的文本说出你想做什么,这使得你愿意付出多少努力大不同把它拿出来。
如果您尝试获取网页的 正文 减去所有与网站相关的内容(非平凡 任务),请查看 @987654321 @。它是用 Java 编写的,但在从随机网页中提取基本文本方面做得非常好。
接下来几周我的一个爱好是在 Python 中重新创建锅炉管道的核心逻辑。我们需要它为项目提供的功能,但不想拖着 JVM 的 10 吨重的石头。我敢肯定,一旦它相当稳定,我们就会发布它。
【讨论】: