【发布时间】:2011-03-19 22:30:30
【问题描述】:
我正在尝试对列中的数据进行迭代排序以提取 N 个最大值。
我的数据设置为包含职业名称和代码的第一列和第二列,其余所有列包含这些职业的比较值(在这种情况下,必须预先为每个城市计算的位置商)不同城市:
*occ_code city1 ... city300*
occ1 5 ... 7
occ2 20 ... 22
. . . .
. . . .
occ800 20 ... 25
对于我想按最大值排序的每个城市,选择与它们各自的职业头衔和头衔匹配的最大值的子集。我认为这将是相对微不足道的,但是......
编辑澄清:我想以数据的排序子集结束分析。
occ_code city1
occ200 10
occ90 8
occ20 2
occ95 1.5
同时我希望能够按列重复排序(所以我通过直接调用列尝试了很多排序命令:data[,2]; 只是为了能够运行相同的分析函数覆盖整个数据集。
过去 3 天我一直在搞乱 plyr,我觉得我的数据集的设置不利于 plyer 的使用方式。
【问题讨论】:
-
你能澄清一下这个问题吗?给我们一个以较小数据框作为输入的示例以及您要提取的输出示例将有所帮助。
-
是的,在这里很难弄清楚你想要什么。
-
首先,我想得到一个包含两列数据的子集:列“city1”的10个最大值的列表,与它们各自的“occ_codes”匹配,(来自第一列) .这在 excel 中将是一个足够简单的排序,只是我需要重复操作 300 次 * 10 年的数据。