【问题标题】:Error tokenizing data when I use a high number of files使用大量文件时错误标记数据
【发布时间】:2021-10-03 15:51:07
【问题描述】:

我正在尝试从 >3,000 个文件的列表中为每个文件创建一个数据框。当我使用少量文件时,我的代码可以正常工作,但是当我尝试更大的数字(>300 个文件)时,我不断收到相同的错误:

ParserError:标记数据时出错。 C 错误:第 4 行中应有 1 个字段,但看到了 5

这是脚本:

all_files_df = [pd.read_table("/data/lab/datasets/Drug_CyTOF_screening/"+x, sep='\t') for x in all_files]

有谁知道是什么导致了这个问题?

谢谢!

【问题讨论】:

  • 您的 csv 文件中的一行有一个额外的选项卡。

标签: python dataframe tokenize large-data-volumes


【解决方案1】:

要调试,请尝试以下操作:

data = []
for x in all_files:
   try:
       df = pd.read_table("/data/lab/datasets/Drug_CyTOF_screening/"+x, sep='\t')
       data.append(df)
   except pd.errors.ParseError as err:
       print(f"'{x}' contains errors. skipped")
       print(err)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-02-03
    • 1970-01-01
    • 2019-06-18
    • 1970-01-01
    • 2021-12-02
    • 1970-01-01
    • 2014-12-22
    • 2016-09-27
    相关资源
    最近更新 更多