【发布时间】:2020-12-02 14:24:38
【问题描述】:
我有一个 Excel 报告,其中三张纸上有几百万行。我尝试使用以下代码导入整个 Excel 文件和所有工作表,并检查所有工作表中的重复行并显示所有重复行(第一行除外)。
如果我在没有 sheet_name=None 的情况下运行代码,它可以工作,但它只分析第一个工作表。
但是,当我添加参数 sheet_name=None 时,希望检查所有表格是否有重复项 - 它不起作用并且我收到错误消息。
import pandas as pd
df = pd.read_excel('Dup test.xlsx', sheet_name=None)
dups=df[df.duplicated()]
print(dups)
有人知道为什么会这样吗?以及如何检查我的 Excel 文件的每一页中的重复行 - 请问?谢谢。
这是错误:
Traceback(最近一次调用最后一次):文件 "\eu.ad.hertz.com\userdocs\irac920\Desktop\My Files\Python\4.py", 第 4 行,在 dups=df[df.duplicated()] AttributeError: 'dict' object has no attribute 'duplicated'
【问题讨论】:
-
“它不起作用,我收到一个错误”——如果您将错误作为问题的一部分发布,那将会很有帮助。
-
@Justin Ezequiel 当然。更新。谢谢。
-
看来您的变量“df”不是 Pandas DataFrame 而是 Python 字典。您的 Excel 文件的每个工作表都可能有一个数据框。