【发布时间】:2020-01-12 21:32:15
【问题描述】:
是否可以使用 Google BERT 计算两个文本文档之间的相似度?据我了解,BERT 的输入应该是有限大小的句子。一些作品使用 BERT 对句子进行相似度计算,例如:
https://github.com/AndriyMulyar/semantic-text-similarity
https://github.com/beekbin/bert-cosine-sim
是否有实现 BERT 以将其用于大型文档而不是句子作为输入(包含数千个单词的文档)?
【问题讨论】:
-
是的,使用句子-bert。平均文档的句子嵌入。文档之间的余弦相似度。
标签: python text scikit-learn nlp word-embedding