【发布时间】:2018-02-14 02:48:38
【问题描述】:
文件大小为 20 GB,行尾字符为 ␀。以下是 PySpark 代码:
text_file = sc.textFile(file_name)
counts = text_file.flatMap(lambda line: line.split("␀"))
counts.count()
错误如下: 换行符前的字节过多:2147483648
问题:如何使用 PySpark 读取大型自定义行尾文件?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql line-endings