【发布时间】:2020-11-15 15:23:14
【问题描述】:
我的数据框有一些组,我想根据得分列的上一个可用和下一个可用平均值填充缺失值,即(上一个值+下一个值)/2。
我想按州、学校、班级、学科分组,然后填写值。
如果分数列中的第一个值不可用,则用下一个可用的值填充该值,或者 如果最后一个值不可用,则用以前可用的值填充该值 对于每个组,都需要遵循这一点。
这是数据插补复杂问题。我在网上搜索,发现熊猫有一些功能,即 pandas.core.groupby.DataFrameGroupBy.ffill 但不知道在这种情况下如何使用。
我正在考虑用 python、pyspark、SQL 解决!
我的数据框是这样的
【问题讨论】:
-
德州新月学校的所有记录的数学分数应该是 46 吗?
-
不,你错过了班级群!!
-
你只想这样填写吗?分组后如何插值?
-
如果我可以分组和插值,那将解决我的问题。我面临的问题是如何分组和填写信息@Pygirl
标签: python sql machine-learning pyspark missing-data