【发布时间】:2022-04-04 10:30:15
【问题描述】:
我已经搜索了很多,但似乎找不到针对我的特定问题的枢轴功能线的东西。我将传达一个我正在寻找的简单示例:
长桌
dependent_variable step a b
5.5 1 20 30
5.5 2 25 37
6.1 1 22 19
6.1 2 18 29
想要的宽桌
dependent_variable a_step1 a_step2 b_step1 b_step2
5.5 20 25 30 37
6.1 22 18 19 29
实际上,我想以 Step 列为中心,并使其余自变量(在本例中为 a 和 b)的列名包括步骤编号和与之关联的 a/b 值。
一旦旋转,我将使用因变量列并作为 numpy 数组和新旋转的因变量输入各种机器学习算法。
当我尝试 piRSquared 的建议时(谢谢),我得到了错误:索引包含重复的条目,无法重塑。
然后我尝试了(来自Here)
d1 =data.set_index(['dependent_variable','step'], append=True).unstack()
d1.columns = d1.columns.map(lambda x: '{}_step{}'.format(*x))
d1.reset_index(inplace=True)
并且(使用示例表)得到以下结果:
level_0 dependent_variable a_step1 a_step2 b_step1 b_step2
1 5.5 20 NaN 30 NaN
2 5.5 NaN 25 NaN 37
3 6.1 22 NaN 19 NaN
4 6.1 NaN 18 NaN 29
所以,我还是少了一步
【问题讨论】:
-
别人可能明白你在追求什么,但我不明白。我继续尝试回答这个问题,除非你能更好地展示你拥有的东西、你想要的东西以及你尝试过的东西。我会猜测其他人可能会有类似的感觉。阅读 MCVE、HowToAsk 和 GoodQuestions,以更好地了解如何最大限度地提高问题得到解答的机会。
-
感谢您的反馈,新版本是否更有意义?
-
@chemneach,已经有一段时间了,希望你还知道。您究竟是如何解决整个表格中的
NaN的?我尝试了这篇文章中的所有解决方案,但我无法修复它。可能是命令或命令错误或类似的东西。
标签: python-2.7 pandas