【发布时间】:2011-07-13 00:47:09
【问题描述】:
我知道这个问题的重复:
这些问题对算法的实际工作方式很感兴趣。我的问题更像是:让我们假设 Google 不存在,或者这个功能不存在并且我们没有用户输入。如何实现该算法的近似版本?
为什么这很有趣?
好的。尝试在 Google 中输入“qualfy”,它会告诉您:
您的意思是: 合格
很公平。它对从数十亿用户收集的数据使用统计机器学习来做到这一点。但现在尝试在 Google 中输入:“Trytoreconnectyou”,它会告诉你:
你的意思是: 尝试重新连接你
现在这是更有趣的部分。谷歌如何确定这一点?有一本方便的字典并使用用户输入再次猜测最有可能的单词吗?它如何区分拼写错误的单词和句子?
现在考虑到大多数程序员无法访问数十亿用户的输入,我正在寻找实现该算法的最佳近似方法以及可用的资源(数据集、库等)。有什么建议吗?
【问题讨论】:
-
@Benjamin:我也可以列出可以利用的数据集吗?我不是来自这个领域,所以任何额外的帮助都会是一个福音。
-
您是否阅读了您发布的链接的答案?第一个链接的第二个答案指向norvig.com/spell-correct.html,这几乎正是您要查找的内容。
-
Norvig 链接也在您的第二个链接的第三高答案中。
-
您注意到google.com/… 不起作用了吗?
标签: algorithm language-agnostic nlp machine-learning