【发布时间】:2019-08-09 01:31:40
【问题描述】:
我在 S3 存储中有大量压缩格式的 CSV 文件。出于机器学习的目的,我只需要数据中的一部分列。我应该如何在不传输整个文件的情况下将这些列提取到 EMR 中,然后再提取到 Redshift?
我的想法是将所有文件处理成 EMR,然后提取子集并将所需的列推送到 Redshift。但这需要很多时间。如果有处理这些数据的优化方法,请告诉我。
编辑:我正在尝试使用 Kafka 自动化此管道。假设在 S3 中添加了一个新文件夹,它应该在 EMR 中使用 spark 处理并存储到 redshift 中,无需任何人工干预。
编辑 2:感谢各位提供意见,我能够使用 EMR 中的 Pyspark 创建从 S3 到 Redshift 的管道。目前,我正在尝试将 Kafka 集成到此管道中。
【问题讨论】:
-
如果您对 python / r / spark 感到满意,您可以在 EMR 中进行操作。我相信对于 ML,您无论如何都需要将数据加载到 EMR 或 EC2 中。
标签: amazon-s3 amazon-redshift amazon-emr