【发布时间】:2020-02-03 10:25:59
【问题描述】:
我对同一工作的多个库感到困惑。我想学习一个可以同时处理 xml 和 html 解析的库。做 elementtree 是否兼容 html 解析。我听说过 lxml、xml.elementtree、beautifulsoup、minidom、scrapy。谁能帮帮我。
【问题讨论】:
标签: beautifulsoup scrapy elementtree minidom celementtree
我对同一工作的多个库感到困惑。我想学习一个可以同时处理 xml 和 html 解析的库。做 elementtree 是否兼容 html 解析。我听说过 lxml、xml.elementtree、beautifulsoup、minidom、scrapy。谁能帮帮我。
【问题讨论】:
标签: beautifulsoup scrapy elementtree minidom celementtree
Scrapy 用于抓取网页(从网页中提取数据)因此得名。
Beautiful Soup 是用于从 XML 和 HTML 文件中解析/提取数据的库。
xml.elementtree提供XML文件的对象表示,是Python XML包的XML处理模块。它非常适合用于解析和操作 XML 格式的数据。
lxml 是他们声称的兼容但优于 Python XML 模块的 elementtree 但本质上是相同的,但是我从未使用它来解析 HTML 文件。
根据我的经验,我使用 Scrapy 从各种用户面板中获取数据,这些用户面板没有任何类型的 API 来提取数据。然而,我主要使用 Beautiful Soup 来解析 HTML 文件,因为它非常简洁且易于使用。 关于 XML 解析,我主要使用 Python XML 包,但是我从来没有执行任何复杂的 XML 解析,所以 Python XML 包涵盖了我需要的一切。
正确的工具确实取决于您的要求。如果你需要库来解析 XML 和 HTML 文件,我会选择 Beautiful Soup,因为它非常易于使用,而且你有大量的在线文档。
【讨论】: