【问题标题】:Pandas / Dask Reading a semi-tabular textPandas / Dask 阅读半表格文本
【发布时间】:2021-04-30 14:50:59
【问题描述】:

我有一个如下所示的文本文件:

Version:23
Developer: Ali

NAME AGE IN
- Carol 22 no
- Kyle 31 yes
...

我会使用 Dask 数据框(应该类似于 Pandas)来阅读它。结果表应该是这样的数据框:

NAME AGE IN
Carol 22 no
Kyle 31 yes

我无法删除列名“-”下方的每行中的破折号(“-”)。我试过了

dd.read_csv(filepath, header = 3, sep="\s+")

这导致数据帧具有不同的行大小并带来更多问题, 我也尝试使用多个分隔符,但仍然报错。

dd.read_csv(filepath, header = 3, sep="\s-\s+")

【问题讨论】:

    标签: pandas dataframe parsing dask


    【解决方案1】:

    dask.dataframe 假定您的数据已经采用表格格式。如果您坚持使用 dask,那么您将进一步使用dask.bag,它将逐行加载文件。然后,您可以过滤掉不以破折号开头的行,并处理那些以破折号开头的行,将它们编码为 json 对象/dict,稍后您可以使用 .to_dataframe() 将其转换为数据帧。

    【讨论】:

      猜你喜欢
      • 2017-02-21
      • 2019-07-16
      • 1970-01-01
      • 1970-01-01
      • 2021-03-04
      • 2019-08-10
      • 2021-04-11
      • 1970-01-01
      • 2014-06-10
      相关资源
      最近更新 更多