【问题标题】:Pandas dataframe to array for further use熊猫数据框到数组以供进一步使用
【发布时间】:2018-12-12 19:14:22
【问题描述】:

我有一个数据框,其中包含销售 KPI(数量、文章编号和相应日期)的 csv 我需要将数据框分成多个,每个都包含一个文章编号的数据(例如 frame1= 123,frame2=345 等等。 )

如何像这样动态拆分以便在 sklearns kmean 中进一步使用? (匹配不同的货号及其销售KPI) 非常感谢

【问题讨论】:

  • 分享一个具体的例子你的输入和所需的输出 - 你的问题太模糊和不清楚

标签: python-3.x pandas scikit-learn sklearn-pandas


【解决方案1】:

您可以使用groupBy按文章编号分组。

grouped = df.groupby(['article_number'])    

然后您可以使用

访问各个组
grouped.groups

或直接应用 grouped.sum(['quantity']) 之类的聚合函数来获取具有每个组各自值的新帧。

另请参阅User Guide

【讨论】:

  • 谢谢,也发现了。问题是数据帧的长度不相等,因此 kmeans 不接受拆分帧的数组(在您的答案分组中,这意味着 kmeans.fit(grouped) 不起作用)。那么我应该用 0 填充分割的帧直到它们具有相同的长度吗?以及如何做到这一点?
  • 我不明白你想通过在分组 DF 上使用 KMeans 来实现什么。也许您可以编辑您的问题并更详细地描述您的预期结果。
  • 我只想对所有文章编号运行 kmeans 以匹配其中的一些相等性
  • KMeans 集群(或换句话说“组”)条目。尝试将预先存在的组聚集在一起似乎违反直觉。您想 (i) 将聚类应用到每个单独的组,还是 (ii) 将聚类应用到整个数据集,然后查看每个组中的哪些聚类条目?同样,我建议重新考虑您的预期结果并在原始问题中详细描述它。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2020-06-12
  • 2020-06-03
  • 2020-05-17
  • 2020-12-14
  • 2020-11-09
  • 2016-10-03
  • 1970-01-01
相关资源
最近更新 更多