【问题标题】:Efficient storage of UNICODED text for processing with Blaze/Pandas使用 Blaze/Pandas 高效存储 UNICODE 文本
【发布时间】:2015-10-31 23:15:22
【问题描述】:

我有大约 500 万行(并且还在增长)的 twitter 提要,我想有效地存储它们,以便使用 Pandas 更快地读/写访问(最好是Blaze)。从一条推文的庞大元数据中,我只存储了[username, tweet time, tweet & tweet ID]。所以不多。此外,所有推文都经过unicode 编码。现在存储这些数据的最佳方式是什么?我目前将它们存储在一堆 CSV 中,但随着数据的增长,我认为它不是一个可行的解决方案,因此计划转移到数据库。我首先想到的是 HDF5,但它仍然有 issues 存储 unicoded 列(即使在 Python 3 中也是如此)。

由于 Blaze 对数据库有出色的支持(而且我认为它也非常适合分析),我是否可以知道什么是解决我的问题的良好架构解决方案(在生产级别,如果可能)?由于我的数据也是结构化的,我觉得不需要 NoSQL 解决方案,但愿意接受建议。

目前,这 5 MM 行只占用大约 1 GB 的空间,我认为它不会超过几十 GB。那么,使用Postgres 是不是最好?

谢谢

【问题讨论】:

    标签: postgresql pandas unicode blaze nosql


    【解决方案1】:

    是的,PostgresSQL 是您 10 年代 GB 应用程序的完美选择。我很轻松地将sqlalchemypsycopg2 驱动程序一起使用,psql 命令行工具很好。

    There is an incredible command-line interface to PostgresSQL called pgcli that offers tab-completion for table and column names.我强烈推荐它,仅仅这个工具就足以推动你使用 PostgresSQL。

    【讨论】:

      猜你喜欢
      • 2021-12-06
      • 2015-10-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-11-26
      • 1970-01-01
      • 1970-01-01
      • 2015-11-24
      相关资源
      最近更新 更多