【发布时间】:2018-12-30 18:51:49
【问题描述】:
例如,我想计算以下矩阵的“a”和“c”列的加权和,权重在字典 w 中定义。
df = pd.DataFrame({'a': [1,2,3],
'b': [10,20,30],
'c': [100,200,300],
'd': [1000,2000,3000]})
w = {'a': 1000., 'c': 10.}
我自己想出了一些选项(见下文),但看起来都有些复杂。这个基本用例没有直接的熊猫操作吗? df.wsum(w) 之类的东西?
我试过pd.DataFrame.dot,但它引发了一个值错误:
df.dot(pd.Series(w))
# This raises an exception:
# "ValueError: matrices are not aligned"
可以通过为每一列指定权重来避免异常,但这不是我想要的。
w = {'a': 1000., 'b': 0., 'c': 10., 'd': 0. }
df.dot(pd.Series(w)) # This works
如何仅计算列子集的点积?或者,可以在应用点操作之前选择感兴趣的列,或者利用 pandas/numpy 在计算(逐行)总和时忽略 nans 的事实(见下文)。
以下是我自己发现的三种方法:
w = {'a': 1000., 'c': 10.}
# 1) Create a complete lookup W.
W = { c: 0. for c in df.columns }
W.update(w)
ret = df.dot(pd.Series(W))
# 2) Select columns of interest before applying the dot product.
ret = df[list(w.keys())].dot(pd.Series(w))
# 3) Exploit the handling of NaNs when computing the (row-wise) sum
ret = (df * pd.Series(w)).sum(axis=1)
# (df * pd.Series(w)) contains columns full of nans
我错过了一个选项吗?
【问题讨论】:
-
并不比你的第三个选项好多少,但是...
df.mul(w).sum(axis=1) -
您能分享一下您对当前解决问题的三个解决方案的不满意之处吗?
-
你可以这样做:
df.loc[:, w].dot(pd.Series(w)) -
@jorijnsmit 我想知道我是否错过了最佳选择。一组列的加权组合很常见,根据经验,pandas 通常为此类常见任务提供简单的解决方案。我也可以想象我的三个建议在成本方面是不等价的。最后,我在 SO 上没有找到满意的答案来解决我的问题,这就是为什么我收集了我目前的理解并要求澄清的原因。也许其他人会从中受益。
标签: python pandas dot-product