【发布时间】:2018-05-04 18:05:31
【问题描述】:
我有一个放在 HDFS 中的文件。我想知道什么是使用 python 读取文件的有效方法。我可以使用 pyspark 吗?
【问题讨论】:
-
1 Tb csv 文件?古比请
-
您尝试过 Spark吗?
-
“高效”的方法是 1) 在 Hadoop 中不使用 CSV - 将其转换为 Parquet 2) 在其上定义 Hive 表并使用 Presto 或 Impala,如果你有可用的。否则,Hive 或 Spark
-
查看 Dask。
-
你想用这些数据做什么? HDFS 和 YARN 在处理数据方面非常有效,但您需要的实际工具由用例定义。
标签: python hadoop pyspark hdfs