【发布时间】:2020-02-18 21:41:43
【问题描述】:
我正在处理超过 100,000 条数据,问题是它是以非常不利于格式的 pdf 格式编写的。我不知道如何分离数据。我正在使用 pandas 和 matplotlib 对这些数据进行一些基本的绘图。我无法弄清楚如何从中制作一个csv。
例如:
Property 1
Data 1
Data 2
Data 3
Property 2
Data 4
Data 5
Data 6
我尝试过使用查找和替换,但没有格式我无法弄清楚,但我没有时间逐字逐句地检查每条数据并手动添加逗号。
我希望能够将每个属性绘制为一列,每个数据块都是一个单元格。
【问题讨论】:
-
您是在问如何从 PDF 中获取文本,或者如何将文本数据组织到 CSV 文件中?
-
所以你用你在例子中给出的格式生成了一个文本文件? - 每个数据记录恰好有四行? - 那么,是的,当然你可以自动解析它;如果长度不同,那就更难了
-
不,这只是一个例子,它的长度不同,每个数据点的长度都不同,每个属性大约有 10,000 个点。
标签: python pandas csv matplotlib