【发布时间】:2016-06-02 04:08:37
【问题描述】:
我正在运行一个计算产品描述之间相似度的 R 程序。程序的输入是一个包含 1 列的文件,其中包含产品描述列表,每个都位于单独的行中
我有另一个文件,其中包含产品标题列表,每个文件位于单独的行中。
使用 dist 函数,我计算了产品描述之间的相似性,并将它们作为矩阵存储在 dist.mat 中。
接下来,我想将产品标题加入到我计算出的相似度中。所以,我阅读了名称中的产品标题,然后:
dist.mat <- data.frame(dist.mat, row.names=Names[,1])
colnames(dist.mat) <- (row.names(dist.mat))
然后我得到一个错误: data.frame(dist.mat, row.names = Names[, 1]) 中的错误: 提供的行名长度错误
不太确定如何修复它。我读到这个:Invalid 'row.names' length 但我无法使用 Sample$ 或 as.character 修复错误
我正在使用:lsa_0.73、SnowballC_0.5.1、tm_0.5-10
这是一个实际的例子: 产品描述文件:
- 这个杯子可以用来喝威士忌
- 这是不锈钢玻璃
- 这是一朵红玫瑰
产品标题文件:
- 威士忌酒杯
- 玻璃
- 玫瑰
如果有人能帮忙就好了
【问题讨论】:
-
您能告诉我有关
Whiskeyglass字符串的信息吗?算一两个字吗? -
@akrun: Whiskeyglass 算作 1 个字
-
我试图了解您是如何获得输出文件中的值的。你能更新一下逻辑吗
标签: r