【发布时间】:2019-06-07 17:54:11
【问题描述】:
我正在使用 R 我有两个数据框。一个包含 200000 个单词,例如“cat”、“cats”、“cts”、“dogs”和“dog”,另一个包含 200000 个单词,例如“cat”和“dog”。
我想对第一个数据帧进行聚类,并将所有相似的单词替换为适合第二个数据帧的单词。例如,“cats”和“cts”变成“cat”。
【问题讨论】:
-
这样做的第一步是定义相似性的含义。看起来您正在考虑类似的拼写。为此,您应该查看 Levenshtein 距离。然而,这将意味着“好”和“神”是相似的。 “阅读”和“红色”。您需要仔细考虑您的真正意思。
-
是的,我的意思是拼写错误或使用复数形式。我想将它们与所有实际动物名称的数据框进行分类,并将猫替换为例如猫,以便创建具有单词“猫”的频率的直方图。
-
完全同意@G5W。这项任务并不容易,需要大量手动输入(以规则、匹配表等形式)。您可能想查看
stringdist包,更重要的是查看可用的指标。 -
你怎么知道 cts 是猫而不是割伤或婴儿床?
-
您应该提供一个最小的可重现示例。
标签: r text cluster-analysis data-science