【问题标题】:Getting error when loading CSV file to dataframe using Jupyter notebook使用 Jupyter 笔记本将 CSV 文件加载到数据框时出错
【发布时间】:2017-09-27 18:13:19
【问题描述】:
sc = pyspark.SparkContext()
sqlCxt = SQLContext(sc)
df=sqlCxt.read.format("csv").option("delimiter","|").load("D:/SparkPy/u.item")

错误:

ERROR:root: 对输入进行标记时发生意外错误 以下回溯可能已损坏或无效 错误信息是:('EOF in multi-line string', (651, 72))

【问题讨论】:

  • 此错误与 pyspark 无关。您的文件缺少引号、撇号或其他内容。检查错误消息中给出的行号。
  • 这看起来不像 csv 问题,即使在创建了一个虚拟 csv 并使用它之后,我也会遇到同样的错误。
  • 你能分享产生上述错误的最小可能虚拟csv文件的内容吗?

标签: python csv pyspark jupyter


【解决方案1】:

当我将 Spark 更新到 2.2.0 版后,问题得到了解决。

Python 3.6 与 Spark v2.2.0 兼容

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-09-09
    • 1970-01-01
    • 1970-01-01
    • 2018-03-20
    • 1970-01-01
    • 2020-04-02
    相关资源
    最近更新 更多