【发布时间】:2021-02-08 01:15:32
【问题描述】:
我在读取UTF-16 中的以下 CSV 数据时遇到了一些问题:
FullName, FullLabel, Type
TEST.slice, "Consideration":"Verde (Spar Verde, Fonte Verde)", Test,
据我了解,这对读者来说应该不是问题,因为有一个quote 参数来处理它。
df = spark.read.csv(file_path, header=True, encoding='UTF-16', quote = '"')
但是,这仍然会给我一个不正确的拆分:
有什么方法可以处理这些情况,还是我需要使用 RDD 来解决?
提前谢谢你。
【问题讨论】:
-
尝试像这样引用:quote = '\"'。那是使用转义字符。让我们知道这是否有效。
-
引号应该包含整个列,而不是列的一部分
-
@vijayinani 不幸的是:/
-
这里需要一些正则表达式。一些正则表达式专家可以提供帮助。
标签: python apache-spark pyspark apache-spark-sql pyspark-dataframes