【发布时间】:2019-09-23 03:48:49
【问题描述】:
文件是逗号分隔的 CSV。
存在用于提取 CSV 文件的框架。 来自同一文件的标题被跳过:
Df.Option(“header”, “true”)
但是在同一个spark包中的预告片,我无法跳过它同样的逻辑。
请帮助处理此数据提取。
【问题讨论】:
-
你可以尝试在hive表中设置这个属性,TBLPROPERTIES('skip.header.line.count'='1', 'skip.footer.line.count'='1'); # 当 1 行作为页眉或页脚跳过时。这样有什么顾虑吗?
标签: scala apache-spark apache-spark-sql hiveql