【发布时间】:2014-03-18 22:58:22
【问题描述】:
我是 Spark 和 Scala 的新手。我们将广告事件日志文件格式化为 CSV,然后使用 pkzip 进行压缩。我已经看到了很多关于如何使用 Java 解压缩压缩文件的示例,但是我将如何使用 Scala for Spark 来做到这一点?最终,我们希望从每个传入文件中获取、提取数据并将其加载到 Hbase 目标表中。也许这可以用 HadoopRDD 来完成?在此之后,我们将引入 Spark 流来监视这些文件。
谢谢, 本
【问题讨论】:
标签: scala apache-spark