【发布时间】:2021-03-27 05:55:55
【问题描述】:
我有以下 DF,我想创建一个具有自动比例的假人,以明确表示一个城市是有小公司、中等公司还是有很多公司。
| cities | sum of companies |
|---|---|
| CTY A | 199 |
| CITY B | 358 |
| CITY C | 250 |
| CITY D | 1265 |
| CITY E | 610 |
我尝试了以下代码:
#install.packages("scales")
library(scales)
COMP_SCALES<- breaks_extended() #from packages Scales
COMP_A<-COMP_SCALES(df[2], n =4)
COMP_A <- cut(df[2],
breaks=c(-Inf, COMP_A[2],COMP_A[3],COMP_A[4], Inf),
labels=c("LITTLE","MEDIUM","A LOT OF","+ A LOT OF"))
但是,一旦所有城市都在小范围内,自动计算的比例就不是很合适了。如何更好地自动化此代码?
最后的目的是创建一个表格以更好地可视化结果,如下所示:
COMP_A_CLUSTER <- as.data.frame.matrix(table(COMP_A,kmeans.k$cluster))
预期结果: 城市 A 应该放在“Little”上。 城市 B 和 C 应放在“中”。 城市 E 应该放在“很多”上。 D市应该放在“+很多”上。
我有一个包含 10,000 多个城市和 100 多个列的列表来执行类似的过程,这就是为什么我希望自动计算虚拟对象的规模。
【问题讨论】:
标签: r cluster-analysis dummy-variable dummy-data