【发布时间】:2016-06-06 06:35:04
【问题描述】:
DataFrame 有一列df['Title'],其中每一行都是在某个位置销售的一本书,LOCATION_ID。我想将df 按LOCATION_ID 分组,并创建一个包含两列的新DataFrame:LOCATION_ID 和Title-Count每个位置出售的书籍的字典。
具体来说,我正在尝试做类似的事情:
from collections import Counter
new_df = df.groupby('LOCATION_ID')['TITLE'].apply(lambda x: Counter(x))
我期待这样的输出:
LOCATION_ID | TITLES
1 {'TitleA':12; 'TitleB':56 ; ...}
2 {'TitleK':5; 'TitleC':23 ; ...}
...
但相反,我收到的是这样的:
LOCATION_ID Title
1 TitleA 12
TitleB 56
...
2 TitleK 5
TitleG 23
...
感谢您的帮助。
【问题讨论】:
-
您当前的输出有什么问题?看起来,输出就是你想要的。为什么需要字典?
-
TITLES 将成为逻辑分类器的特征。我要使用的库方法需要字典格式。
-
你会使用 Scikit-learn 吗?
-
您能提供一个输入样本吗?
-
@Joe R 我正在使用graphlab 的logistic_classifier。我想估计: book_model = graphlab.logistic_classifier.create(train_data, target='books_sold', features=['book_count'], validation_set=test_data)d
标签: python dictionary pandas counter