【发布时间】:2021-06-24 06:30:49
【问题描述】:
我有一个字符串向量(每个 50 个元素)的大列表(10,000 项)。 这是来自向量的一个小样本:
c("0101000000000000000000000000000000000000000000001000000000000000000000000000000100000000000100000000000000100000000000000000110000000000000000000000",
"0000000000000000000000000000000010000000000000000000000000110000000000000000000000000001000000000000001000000010000000000000000000000000000000000001",
"0000000000000000000100010000000010000000000000010000000000100000000000000100000001000001100000000000001000001000000100000000000000000000000000000100")
在每个向量中,我想估计所有成对差异(即每对中不同字符的数量),然后估计平均值。 鉴于列表的规模很大,这样做的成本效益如何? 谢谢!!
编辑-更新
我正在添加一个具有较短向量和预期输出的示例(与我在下面的评论相同):
a=c("0010100101",
"1001011101",
"1111111010")
预期结果(成对差异的平均值): 6.666667
非常感谢@Roland 提供基于 Levenshtein 距离的解决方案!
【问题讨论】:
-
你能给出这个例子的预期输出吗?