【问题标题】:How do I convert an ORC dataframe in Spark to something else?如何将 Spark 中的 ORC 数据框转换为其他内容?
【发布时间】:2018-09-02 17:01:55
【问题描述】:

我有一个从 Spark 中的 hive/orc 读取的数据集,但是我遇到了从 csv 读取时没有遇到的各种错误。我怎样才能告诉 spark 将该数据集转换为非兽人的东西而不击中磁盘?现在我正在使用这个:

FileSystem.get(sc.hadoopConfiguration).delete(new Path(name));
loadedTbl.write.json(name);
val q = hc.read.json(name);

【问题讨论】:

  • 编辑您的问题以包含 MCVE 代码和您看到的异常。阅读此内容以获取有关创建 MCVE 的信息:stackoverflow.com/help/mcve
  • 我不知道如果数据集来自 ORC 或 csv,为什么会有差异,你得到什么样的错误?
  • 从您的问题看来,您希望将文件从 ORC 转换为其他格式。但是,您提到您不想撞到磁盘。我的任何一个观点都必须是错误的,你能澄清一下吗?这可能会使回复更容易。如果您的目的只是阅读文件,也许您可​​以分享其他详细信息,以便人们可以更轻松地帮助您。诸如您使用的 Spark 版本、您遇到的错误、您的文件是否支持 Hive 表等等。
  • 请详细说明“我有一个从 Spark 中的 hive/orc 读取的数据集,但遇到各种错误” 中的错误。编辑您的问题并添加错误。越多越好。

标签: apache-spark orc


【解决方案1】:

您可以重写为任何格式并使用它。

df.write.json('json_file_name')
df.write.parquet('parquet_file_name')

【讨论】:

  • 有没有办法做到这一点,但避免撞到磁盘?
猜你喜欢
  • 2016-07-25
  • 1970-01-01
  • 2019-01-24
  • 2019-11-04
  • 2018-08-29
  • 2013-06-23
  • 1970-01-01
  • 2019-09-24
  • 1970-01-01
相关资源
最近更新 更多