【发布时间】:2022-12-12 06:35:43
【问题描述】:
我正在尝试删除数据框中某些列的空值,但我得到的 python 和 scala 行数不同。
我对两者都做了同样的事情。在 python 中我收到2127178我收到的行和 scala8723行。
例如在 python 中我做了:
dfplaneairport.dropna(subset=["model"], inplace= True)
dfplaneairport.dropna(subset=["engine_type"], inplace= True)
dfplaneairport.dropna(subset=["aircraft_type"], inplace= True)
dfplaneairport.dropna(subset=["status"], inplace= True)
dfplaneairport.dropna(subset=["ArrDelay"], inplace= True)
dfplaneairport.dropna(subset=["issue_date"], inplace= True)
dfplaneairport.dropna(subset=["manufacturer"], inplace= True)
dfplaneairport.dropna(subset=["type"], inplace= True)
dfplaneairport.dropna(subset=["tailnum"], inplace= True)
dfplaneairport.dropna(subset=["DepDelay"], inplace= True)
dfplaneairport.dropna(subset=["TaxiOut"], inplace= True)
dfplaneairport.shape
(2127178, 32)
和 spark scala 我做了:
dfairports = dfairports.na.drop(Seq("engine_type", "aircraft_type", "status", "model", "issue_date", "manufacturer", "type","ArrDelay", "DepDelay", "TaxiOut", "tailnum"))
dfairports.count()
8723
我期待相同数量的行,我不知道我做错了什么
我将不胜感激任何帮助
【问题讨论】:
标签: python dataframe scala apache-spark dataset