【问题标题】:Ways of obtaining a similarity metric between two full text documents?获得两个全文文档之间的相似性度量的方法?
【发布时间】:2020-01-30 17:16:57
【问题描述】:

假设我有三个文本文档,例如(让 3 个随机生成的文本)。

文档 1:

“每英里都平铺在七点或。希望他完全尊重先生。可能的床你喜欢礼貌男孩优雅的火腿。如果高兴的话,他会阻止要求。图片也和关心是安慰。十难像渴望也不是。同一个公园开着……”

文档 2:

“风格太自私了。完全冒犯尝试添加年龄绅士总结。得到谁不寻常我们的表情十增加考虑偶尔旅行。曾经读过告诉年给可能的男人打电话给它。激怒的儿子变成了胖子收入打完检票口。 ..”

如果我想在 python 中(使用库)获得一个 衡量这两个文档与第三个文档的相似程度(换句话说,两个文档中的哪一个更类似于第三个),最好的方法是什么?

edit:我观察到他们通过将单个句子与其他句子进行比较来回答的其他问题,但我对此不感兴趣,因为我想比较全文(由相关句子组成)对照另一个全文,并获得一个数字(例如,该数字可能大于与与目标文件不太相似的不同文档获得的另一个比较)

【问题讨论】:

标签: python nlp artificial-intelligence topic-modeling


【解决方案1】:

这个问题没有简单的答案。因为根据您要执行的特定任务,相似性会表现得更好或更差。

话虽如此,您在比较文本块方面确实有几个选项。 This post 比较计算句子相似度的几种不同方法并对其进行排名,然后您可以将其聚合以执行完整的文档相似度。如何聚合这个?也将取决于您的特定任务。一种简单但通常表现良好的方法是计算 2 个(或更多)文档的平均句子相似度。

此主题的其他有用链接包括:

【讨论】:

    猜你喜欢
    • 2017-09-01
    • 1970-01-01
    • 1970-01-01
    • 2019-04-29
    • 2017-09-23
    • 1970-01-01
    • 2010-12-23
    • 2012-02-12
    • 2021-08-17
    相关资源
    最近更新 更多