【发布时间】:2021-11-09 17:40:35
【问题描述】:
我需要从 pdf 中导出表格并选择特定的列。 我已经设法通过“表格”、“表格”导出,但是它没有以正确的格式导出。在原始文件中,有 5 列,但在导出后我完全得到 3 列,因为由于某种原因,前三列被视为一列。 enter image description here
这是原始表格的表格: enter image description here
下面是我的输出代码:
【问题讨论】:
-
感谢您的评论。正好被当做一列的那一列本来就是由3列组成的,所以只是想着如何将它们分开。
-
请提供足够的代码,以便其他人更好地理解或重现问题。
-
导入的包 (tabulate, pandas, tabulate.io) file= "name of file" dfs = read_pdf(file, pages="all", pandas_options={'header':None}) dfs[ 0].columns = ["结构","纬度","经度"] lat = dfs[0][3:] lat.iloc[0]["经度"]
-
我添加 3 列而不是 5 列的原因,因为它不会以其他方式运行。我从一列得到值:'16° 03' 53.80628"'。现在尝试将其导出为十进制。
标签: python pandas dataframe tabulate