【发布时间】:2018-03-14 07:11:22
【问题描述】:
考虑以下data.frame:
> head(dtrain)
content_id item_age item_ctr likes clicks no_clicks event
1 11201926 461540 0.02787456 1 24 837 0
2 11201926 462497 0.02784223 1 24 838 0
3 11201926 473215 0.02780997 1 24 839 0
4 11201926 532983 0.02777778 1 24 840 0
5 11201926 536696 0.02774566 1 24 841 0
6 11201926 545545 0.02771363 1 24 842 0
我想通过 content_id 拆分数据,只需要以下命令
result <- split(dtrain , f = dtrain$content_id )
但是我想只保留来自 dtrain 的数据,其中 content_id 在列表 1000 中出现(在 dtrain 中)。换句话说,相同的 content_id 在 dtrain 中出现超过 1000 次。
最后,我将按 content_id 拆分数据,其中每个拆分将在列表中出现 1000 次(因为这是聚合条件)
【问题讨论】: