【发布时间】:2019-09-01 04:11:17
【问题描述】:
我正在尝试读取 pandas 中的一些 excel 文件。在某些文件中,感兴趣的表格式不完美,即多行被格式化为单行,但每一行都有多行。因此,当您查看 excel 文件时,数据看起来很好。此外,当使用 pandas 解析它时,每一行的末尾确实有一个换行符 (\n)。
问题是,当我使用 read_excel() 函数读取它时,它会将其转换为 DataFrame,该 DataFrame 不会将此换行符视为单独的行,而是将其放入其中包含 \n 的一行。我想编写一个代码,将 N 行的每一行视为/转换为 N 行(使用换行符作为新行的指示符)。
在解析文件或在 Python 中对数据帧进行后处理时,有没有办法做到这一点?
在这里,我提供了一个非常简化的虚拟 excel 文件和一些代码来解释问题。
Excel 文件示例:
Name | Price
-------------------------------
Coca Cola | 46.66
-------------------------------
Google | 1204.44
Facebook | 177.58
-------------------------------
Berkshire Hathaway | 306513.75
我只是在 Python 中使用 Pandas 的 read_excel:
dataframe_parsed = pandas.read_excel(file_name)
print(dataframe_parsed.head())
我得到以下 DataFrame 作为输出:
Name Price
0 Coca Cola 46.66
1 Google\nFacebook 1204.44\n177.58
2 Berkshire Hathaway 306513.75
想要的输出是:
Name Price
0 Coca Cola 46.66
1 Google 1204.44
2 Facebook 177.58
3 Berkshire Hathaway 306513.75
我们将不胜感激任何帮助。
【问题讨论】:
标签: python excel pandas dataframe parsing