【发布时间】:2020-01-30 17:16:57
【问题描述】:
假设我有三个文本文档,例如(让 3 个随机生成的文本)。
文档 1:
“每英里都平铺在七点或。希望他完全尊重先生。可能的床你喜欢礼貌男孩优雅的火腿。如果高兴的话,他会阻止要求。图片也和关心是安慰。十难像渴望也不是。同一个公园开着……”
文档 2:
“风格太自私了。完全冒犯尝试添加年龄绅士总结。得到谁不寻常我们的表情十增加考虑偶尔旅行。曾经读过告诉年给可能的男人打电话给它。激怒的儿子变成了胖子收入打完检票口。 ..”
如果我想在 python 中(使用库)获得一个 衡量这两个文档与第三个文档的相似程度(换句话说,两个文档中的哪一个更类似于第三个),最好的方法是什么?
edit:我观察到他们通过将单个句子与其他句子进行比较来回答的其他问题,但我对此不感兴趣,因为我想比较全文(由相关句子组成)对照另一个全文,并获得一个数字(例如,该数字可能大于与与目标文件不太相似的不同文档获得的另一个比较)
【问题讨论】:
-
@torresmateo 不完全是,因为我对一个句子块与另一个句子块的相似性很感兴趣(在给定的答案中,要检查的输入是一个简单的句子与一组句子)
标签: python nlp artificial-intelligence topic-modeling