【发布时间】:2018-02-22 00:32:15
【问题描述】:
我有一个 5 节点集群,部署了 YARN。 2 个名称节点和 3 个数据节点。虽然我的代码是在 spark 中提交的。我正在尝试将数据导出到 csv,但是当我这样做时,数据会导出到 2 个数据节点,并且两者在导出文件夹中都有不同的内容。一个将具有 _SUCCESS 文件,另一个将具有导出的 csv(部分-*)。我的应用程序最终有一个空白路径,因为有时具有 _SUCCESS 文件的节点和运行应用程序的节点是相同的,但实际的 csv 在另一个节点中。有时也不会创建 _SUCCESS 文件,但会创建 part-*.csv 但在另一个节点中,在这种情况下,如果应用程序不再在同一节点中运行,我最终会再次出现空白路径。我正在使用方式如下:
dataframe.coalesce(1).write.option("header","true").csv(path)
【问题讨论】:
-
你的路径值是多少?
-
file:///
标签: apache-spark hdfs cluster-computing hadoop-yarn