【发布时间】:2017-09-25 21:37:31
【问题描述】:
级别是有道理的,它是向量的唯一值,但我无法理解因子是什么。它似乎只是重复向量值。
factor(c(1,2,3,3,4,5,1))
[1] 1 2 3 3 4 5 1
Levels: 1 2 3 4 5
谁能解释一下应该做什么,或者我为什么要使用它?
我开始怀疑因子是否类似于数据库中的代码表。其中因子名称是代码表名称,级别是代码表的唯一选项。 ?
【问题讨论】:
-
在拟合统计模型时,分类数据(因子)的处理方式通常与连续数据或数值数据截然不同。如果你不做那种事情,你可能根本不需要太多使用因子。
-
我可以看到级别就像下拉列表中的唯一选项,但我仍然不了解因素
-
它只是一个整数向量和一组“级别”,您可以将其视为整数映射到的内容。因此,例如,您可能有一个变量
Gender,其值为M和F。作为一个因素,这只是一个 1 和 2 的序列,其中 1 = F 和 2 = M。 -
在控制台打印因子时,您通常只会看到级别,而不是底层整数代码。
-
所以 factor 将标签含义应用于值?所以我会做类似 c(1,2) factor(c("Male","Female")) 的事情?
标签: r