【发布时间】:2020-11-29 16:52:16
【问题描述】:
我有一个非常大的数据集(大约 600,000 行)。我想在前4列相同的情况下,通过在最后一列创建数组来减少数据行数。
make year model engine part
alfa romeo 1960 giulietta 1.3l l4 A
alfa romeo 1958 giulietta 1.3l l4 B
alfa romeo 1958 giulietta 1.3l l4 A
alfa romeo 1957 giulietta 1.3l l4 B
alfa romeo 1957 giulietta 1.3l l4 A
alfa romeo 1956 giulietta 1.3l l4 B
alfa romeo 1956 giulietta 1.3l l4 A
alfa romeo 1954 giulietta 1.3l l4 B
alfa romeo 1954 giulietta 1.3l l4 A
alfa romeo 1955 giulietta 1.3l l4 B
alfa romeo 1955 giulietta 1.3l l4 A
期望的输出:
make year model engine part
alfa romeo 1960 giulietta 1.3l l4 [A]
alfa romeo 1958 giulietta 1.3l l4 [A,B]
alfa romeo 1957 giulietta 1.3l l4 [A,B]
alfa romeo 1956 giulietta 1.3l l4 [A,B]
alfa romeo 1955 giulietta 1.3l l4 [A,B]
alfa romeo 1954 giulietta 1.3l l4 [A,B]
我想我可以使用dataframe.groupby 来获得我想要的输出,但我无法通过多次尝试。我不断收到以下输出的形式<pandas.core.groupby.generic.DataFrameGroupBy object at xxx>。
任何帮助将不胜感激!
【问题讨论】: