【发布时间】:2017-08-21 06:22:30
【问题描述】:
我正在 Apache spark 中使用大约 10M 条记录的 Scala(除了一个字段,其余 331 可以为空)处理巨大的数据集(包含 332 个字段)。但我想用空白字符串(“”)替换 null。由于我有大量字段,因此实现这一目标的最佳方法是什么? 我想在导入此数据集时处理空值,以便在执行转换或导出到 DF 时安全。所以我创建了具有 332 个字段的案例类,处理这些空值的最佳方法是什么?我可以使用 Option(field).getOrElse(""),但我想这不是最好的方法,因为我有大量的字段。谢谢!!
【问题讨论】:
-
@mtoto 不应该被标记为这个问题的重复:stackoverflow.com/questions/33376571/…
-
@eliasah 和 mtoto:我同意上述评论。很高兴找到慈善家
标签: scala apache-spark apache-spark-sql spark-dataframe