【发布时间】:2019-04-28 09:12:32
【问题描述】:
我对 Apache Spark 非常陌生,我正在尝试将 SchemaRDD 与我的管道分隔文本文件一起使用。我在我的 Mac 上使用 Scala 10 独立安装了 Spark 1.5.2。我有一个包含以下代表性数据的 CSV 文件,我试图根据记录的第一个值(列)将以下文件拆分为 4 个不同的文件.我非常感谢我能得到的任何帮助。
1|1.8|20140801T081137|115810740
2|20140714T060000|335|22159892|3657|0.00|||181
2|20140714T061500|335|22159892|3657|0.00|||157
2|20140714T063000|335|22159892|3657|0.00|||156
2|20140714T064500|335|22159892|3657|0.00|||66
2|20140714T070000|335|22159892|3657|0.01|||633
2|20140714T071500|335|22159892|3657|0.01|||1087
3|34|Starz
3|35|VH1
3|36|CSPAN: Cable Satellite Public Affairs Network
3|37|Encore
3|278|CMT: Country Music Television
3|281|Telehit
4|625363|1852400|Matlock|9212|The Divorce
4|625719|1852400|Matlock|16|The Rat Pack
4|625849|1846952|Smallville|43|Calling
【问题讨论】:
-
欢迎来到 SO。如果您包括自己的尝试,您将有更好的机会获得答案。
标签: scala apache-spark apache-spark-sql