【发布时间】:2018-09-02 17:01:55
【问题描述】:
我有一个从 Spark 中的 hive/orc 读取的数据集,但是我遇到了从 csv 读取时没有遇到的各种错误。我怎样才能告诉 spark 将该数据集转换为非兽人的东西而不击中磁盘?现在我正在使用这个:
FileSystem.get(sc.hadoopConfiguration).delete(new Path(name));
loadedTbl.write.json(name);
val q = hc.read.json(name);
【问题讨论】:
-
编辑您的问题以包含 MCVE 代码和您看到的异常。阅读此内容以获取有关创建 MCVE 的信息:stackoverflow.com/help/mcve
-
我不知道如果数据集来自 ORC 或 csv,为什么会有差异,你得到什么样的错误?
-
从您的问题看来,您希望将文件从 ORC 转换为其他格式。但是,您提到您不想撞到磁盘。我的任何一个观点都必须是错误的,你能澄清一下吗?这可能会使回复更容易。如果您的目的只是阅读文件,也许您可以分享其他详细信息,以便人们可以更轻松地帮助您。诸如您使用的 Spark 版本、您遇到的错误、您的文件是否支持 Hive 表等等。
-
请详细说明“我有一个从 Spark 中的 hive/orc 读取的数据集,但遇到各种错误” 中的错误。编辑您的问题并添加错误。越多越好。
标签: apache-spark orc