【发布时间】:2016-12-14 14:21:40
【问题描述】:
问题已更新!!
我有 15 列分类变量,我想要它们之间的相关性。数据集 20,000+ 长,数据集如下所示:
state | job | hair_color | car_color | marital_status
NY | cs | brown | blue | s
FL | mt | black | blue | d
NY | md | blond | white | m
NY | cs | brown | red | s
请注意,第一行和最后一行 NY、cs 和 s 重复。我想找出那种模式。 NY 和 cs 高度相关。我需要对列中的值组合进行排名。希望现在这个问题有意义。请注意不计算NY 或cs。是关于找出NY 和blond 在同一行中一起出现的次数。我需要按行对所有值执行此操作。希望现在这有意义。
我尝试将cor() 与 R 一起使用,但由于这些是分类变量,因此该函数不起作用。我如何使用这个数据集来找出它们之间的相关性?
【问题讨论】:
-
你能澄清一下你想用
cor()测量什么吗?例如,cor(c("red","blue"), c("red","yellow"))是高于、等于还是低于cor(c("red","blue"), c("red","brown"))? -
不,不一般。对于 id 1 我有 15 种颜色,对于 id 2 其他 15 种颜色,我有 20,000 个 id。颜色不会按 id 重复。我想找出每种颜色与其他颜色的相关性。使用
cor(),R 返回一个表格矩阵,其中包含所有变量以及每个变量的相关性。颜色变量不是普通的,它们只是分类的。明白我在做什么? -
是的,但是对于 16 个变量而不是 2 个。
标签: r correlation categorical-data