【发布时间】:2020-08-05 11:09:40
【问题描述】:
我正在尝试编写 Python 代码,将单词作为输入(例如 book),并输出具有相似度分数的最相似单词。
我尝试过不同的现成编辑距离算法,如余弦、Levenshtein 等,但这些无法说明差异程度。例如,(book, bouk) 和 (book,bo0k)。我正在寻找一种可以为这两个示例给出不同分数的算法。我正在考虑使用 fastText 或 BPE,但是它们使用余弦距离。
有什么算法可以解决这个问题吗?
【问题讨论】:
标签: python-3.x nlp text-classification fasttext edit-distance