【发布时间】:2021-03-04 08:16:20
【问题描述】:
我一直在使用最新的 R arrow 包 (arrow_2.0.0.20201106),它支持直接从 AWS S3 进行读写(太棒了)。
我在编写和读取自己的文件时似乎没有问题(见下文):
write_parquet(iris, "iris.parquet")
system("aws s3 mv iris.parquet s3://myawsbucket/iris.parquet")
df <- read_parquet("s3://myawsbucket/iris.parquet")
但是当我尝试读入其中一个示例 R arrow 文件时,我收到以下错误:
df <- read_parquet("s3://ursa-labs-taxi-data/2019/06/data.parquet")
Error in parquet___arrow___FileReader__ReadTable1(self) :
IOError: NotImplemented: Support for codec 'snappy' not built
当我检查编解码器是否可用时,它看起来不可用:
codec_is_available(type="snappy")
[1] FALSE
任何人都知道一种使“快速”编解码器可用的方法吗?
谢谢, 迈克
###########
跟进
感谢下面@Neal 的回答。这是为我安装所有需要的依赖项的代码。
Sys.setenv(ARROW_S3="ON")
Sys.setenv(NOT_CRAN="true")
install.packages("arrow", repos = "https://arrow-r-nightly.s3.amazonaws.com")
【问题讨论】:
标签: r snappy apache-arrow