【问题标题】:Best way to scrape CSVs on the web with Python使用 Python 在 Web 上抓取 CSV 的最佳方法
【发布时间】:2014-10-21 13:48:31
【问题描述】:
我希望将 Yahoo Query Language 替换为更易于管理和更可靠的语言。现在我们使用它来抓取公共CSV 文件并在我们的网络应用程序中使用这些信息。
目前我在寻找替代方案时遇到了麻烦,似乎使用Python 抓取网站是最好的选择。但是,我什至不知道从哪里开始。
我的问题是需要什么来抓取CSV、保存数据并在使用 Python 的 Web 应用程序的其他地方使用它?我需要专用数据库还是可以以不同的方式保存数据?
感谢简单的解释
【问题讨论】:
标签:
python
csv
web-scraping
【解决方案1】:
这有点宽泛,但让我们将其划分为单独的任务
我的问题是抓取 CSV 文件需要什么
如果您的意思是从已知 URL 下载 CSV 文件,您可以简单地使用 urllib。如果您没有 CSV URL,则必须以某种方式获取它们。如果要从网页中获取 URL,beautifulsoup 通常用于解析 HTML。 scrapy 用于更大规模的抓取。
保存数据。
我需要一个专用数据库还是可以用其他方式保存数据?
一点也不。您可以将 CSV 文件直接保存到您的磁盘,使用 pickle 存储它们,将它们序列化为 JSON 或使用关系或 NoSQL 数据库。您应该使用什么在很大程度上取决于您想要做什么以及您需要对数据进行何种访问(本地/远程、集中式/分布式)。
并使用 Python 在 Web 应用程序的其他地方使用它
您可能想学习如何为此使用 Web 框架(django、flask 和 cherrypy 是常见的选择)。如果您不需要并发写访问,我提到的任何存储方法都可以使用这些