【发布时间】:2022-03-04 18:19:16
【问题描述】:
我有一个来自 Plasma DataStore 的 RecordBatch,我可以将其读入 pyarrow.RecordBatch 或 pyarrow.Table。我现在试图在将行转换为熊猫之前过滤掉行(to_pandas)。
有没有办法在pyarrow.Table 上使用来自新数据集 API(您可以在 ParquetDataset 上使用)中的 filter 方法?这将允许我给我们一个这样的过滤器:
[[('date', '=', '2020-01-01')]]
查看源代码pyarrow.Table 和pyarrow.RecordBatch 似乎都有过滤功能,但至少RecordBatch 需要布尔掩码。
这可能吗?原因是数据集包含许多不是零拷贝的字符串(和/或类别),因此运行to_pandas 实际上会引入显着的延迟,而我只在寻找大约 20% 的数据集。
问候,
尼克拉斯
【问题讨论】:
-
此问题的任何更新...
-
@qaiser 是也不是,等待issues.apache.org/jira/browse/ARROW-7945启用