【发布时间】:2011-10-27 16:55:54
【问题描述】:
我在处理数据框的级别名称时遇到了很大的麻烦。
我有一个大数据框,其中一个列是具有很多级别的因素。
问题是其中一些数据是重复的,我分析的下一步不接受重复的数据。所以我需要更改重复关卡的名称,以便继续下一步。
让我举个小例子:
假设我们有一个包含一列的简单数据框:
> df
col_foo
1 bar1
2 bar2
3 bar3
4 bar2
5 bar4
6 bar5
7 bar3
如果我们查看该列,我们会发现它是一个具有 5 个不同级别的因子。
>df$col_foo
[1] bar1 bar2 bar3 bar2 bar4 bar5 bar3
Levels: bar1 bar2 bar3 bar4 bar5
好的,问题来了。看到bar2 和bar3 级别重复。我想知道的是如何添加一个级别名称,例如bar2_X,并且只替换重复的名称。所以数据框应该变成这样:
> df
col_foo
1 bar1
2 bar2
3 bar3
4 bar2_X
5 bar4
6 bar5
7 bar3_X
这可能吗?我无法更改列的类,它应该仍然是一个因素,因此需要更改它的解决方案无法解决我的问题,除非可以再次强制因素。
谢谢
【问题讨论】:
标签: r