【发布时间】:2017-05-30 17:17:50
【问题描述】:
我有一个 CSV 文件,我正在尝试使用 Spark CSV package 加载它,但它无法正确加载数据,因为其中很少有字段包含 \n,例如以下两行
"XYZ", "Test Data", "TestNew\nline", "OtherData"
"XYZ", "Test Data", "blablablabla
\nblablablablablalbal", "OtherData"
我正在使用以下代码,这很简单我在互联网上使用parserLib 作为univocity 它解决了多个换行问题,但对我来说似乎并非如此。
SQLContext sqlContext = new SQLContext(sc);
DataFrame df = sqlContext.read()
.format("com.databricks.spark.csv")
.option("inferSchema", "true")
.option("header", "true")
.option("parserLib","univocity")
.load("data.csv");
如何在以引号开头的字段中替换换行符。有没有更简单的方法?
【问题讨论】:
标签: scala apache-spark apache-spark-sql spark-csv apache-spark-1.6