【发布时间】:2021-04-09 13:05:29
【问题描述】:
我有一个大的(大约 25 MB)CSV 文件存储在 S3 中。它包含两列。第一列的每个单元格包含文件引用,第二列的每个单元格包含一个大的(500 到 1000 个字)正文。此 CSV 中有数千行。
我想从sagemaker jupyter notebook 读取它并将其保存为内存中的字符串列表。然后我将在我的 NLP 模型中使用这个列表。
我正在使用以下代码:
def load_file(bucket, key, sep=','):
client = boto3.client('s3')
obj = client.get_object(Bucket=bucket, Key=key)
data = obj['Body'].read().decode('utf-8')
text = open(data)
string_io = StringIO(data)
return pd.read_csv(string_io, sep=sep)
file = load_file("bucket", 'key',sep=',')
我收到以下错误:
OSError:[Errno 36] 文件名太长:
【问题讨论】:
标签: amazon-s3 text boto3 amazon-sagemaker