【发布时间】:2022-01-25 10:49:03
【问题描述】:
我有一个 python 程序作为文件读取器读取 parquet 文件,并试图用它来构造一个 pyarrow 数据集。我可以使用以下方法将文件读取器读入 pyarrow 表:
import pyarrow.parquet as pq
table = pq.read_table(file_reader)
但是,将文件读取器直接传递给数据集初始化程序会出错。这是有道理的,因为 pyarrow 文档显示 ds.dataset 函数不接受文件读取器作为数据源:
import pyarrow.dataset as ds
dataset = ds.dataset(file_reader) # TypeError: Expected a path-like, list of path-likes or a list of
# Datasets instead of the given type
我正在尝试的当前解决方法是将流作为表格读取,然后将表格作为数据集读取:
import pyarrow.parquet as pq
import pyarrow.dataset as ds
table = pq.read_table(input_stream)
dataset = ds.dataset(table)
但是,我不确定这是否是数据集的有效解决方法,因为数据集可能期望传递的表由基础文件支持,但事实并非如此。
【问题讨论】:
标签: pyarrow