【问题标题】:Create Parquet file in Scala without Spark在没有 Spark 的 Scala 中创建 Parquet 文件
【发布时间】:2018-10-09 20:37:07
【问题描述】:

我正在尝试使用 Scala(没有 Spark)将流式 JSON 消息直接写入 Parquet。我只看到几篇在线帖子和this 帖子,但是我看到ParquetWriter API 已被弃用,并且该解决方案实际上并没有提供可遵循的示例。我也阅读了其他一些帖子,但没有找到任何描述性的解释。

我知道我必须使用ParquetFileWriter API,但缺乏文档让我很难使用它。有人可以提供它的示例以及所有构造函数参数以及如何创建这些参数,尤其是架构吗?

【问题讨论】:

    标签: scala parquet


    【解决方案1】:

    您可能想尝试使用Eel,这是一个在 Hadoop 生态系统中操作数据的工具包。

    我建议阅读README 以更好地了解该库,但为了让您了解该库的工作原理,您尝试执行的操作类似于以下内容:

    val source = JsonSource(() => new FileInputStream("input.json"))
    val sink = ParquetSink(new Path("output.parquet"))
    source.toDataStream().to(sink)
    

    【讨论】:

    • 啊它适用于Streams,我在我的应用程序中使用 Akka Streams,因此它很容易集成。我还从 Lightbend 找到了akka-stream-alpakka-avroparquet。我现在都在尝试。感谢您的建议。
    猜你喜欢
    • 2016-10-11
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-07-10
    • 1970-01-01
    • 1970-01-01
    • 2018-03-10
    • 1970-01-01
    相关资源
    最近更新 更多