【发布时间】:2022-01-06 21:31:29
【问题描述】:
这里是非常新的 python 用户。我有一个压缩数据集 (csv.gz) 的链接,我试图在没有先下载到我的桌面、解压缩并上传到 github 以使用 pd.read_csv 的情况下进入 python。该链接的形式是我认为我应该使用请求来请求它?但我得到一个 403 状态码。我不知道是因为我请求错误,还是 .gz 是问题?
这就是我尝试导入它的方式。
import requests
query = {'AWSAccessKeyId':'theaccesskey', 'Signature':'thesignature','Expires':'12345'}
url = 'https://s3.amazonaws.com/research.insideairbnb.com/data/united-states/or/portland/2015-12-02/data/listings.csv.gz'
response = requests.get(url, params=query)
但即使假设我可以弄清楚如何获得 200 状态码,我如何从 .gz 转到我可以使用 pandas 的数据框?
【问题讨论】:
-
您可以使用
io.BytesIO和pandas.read_csv。有趣的是,您的网址会生成 JPEG 图像而不是.gz文件。是正确的 url / 参数吗? -
我输入了虚拟参数