【问题标题】:Finding Likelihood of Plagiarism in Multiple Entries using PHP使用 PHP 在多个条目中查找抄袭的可能性
【发布时间】:2011-05-17 20:16:10
【问题描述】:

我正在开发一个跟踪帮助台条目的 Web 应用程序。我们希望找到一种方法来防止人们复制和粘贴他们关于常见问题的笔记 - 我们希望为每次故障呼叫编写原始的帮助台条目。

无论如何,我们有成千上万的条目,其中一些是相似的,我试图找到一种方法将它们相互比较并指出任何与其他条目非常相似的条目,即 80% 的可能性是直接复制等。

我研究了similar_text() 和其他一些内置的PHP 函数,但我很想知道其他人以前是否做过类似的事情。我不相信我可以有效地使用similar_text(),因为我需要将多个条目相互比较,而不是两个字符串。

感谢任何输入。

【问题讨论】:

  • 您可能会发现this 值得一读。

标签: php comparison similarity


【解决方案1】:

我确实认为similar_text() 会做你想做的事。只要您的机器有足够的内存来处理比较,它应该可以正常工作。另请查看 levenshtein() 和 soundex()。

【讨论】:

    【解决方案2】:

    您可能需要考虑尝试一下 Solr 数据库。虽然您的最终架构可能包含许多不同的字段,但主字段将属于“文本”类型,并且将包含帮助台条目的文本。默认的 Solr 模式(不需要修改)自动标记文本字段中的数据,以搜索同义词的方式对数据进行索引,“cities”将匹配“cities”等。

    最终,使用 Solr,您将获得一个可扩展的解决方案,无论是从性能角度还是功能角度。

    【讨论】:

      【解决方案3】:

      首先,你为什么在乎?如果这是一个可以通过复制和粘贴来解决的常见问题,为什么这不是正确的做法?听起来你是为了工作而产生更多的工作。

      其次,您可以查看以下内容: http://en.wikipedia.org/wiki/W-shingling

      如果此处提供的其他选项还不够。

      【讨论】:

      • James - 我很在意,因为我们正在进行一个国防部项目,该项目要求我们提供高质量的报告和反馈。这不是传统的“帮助台”,在我们的情况下,任何两种情况都不应该非常接近。我无法详细介绍所有细节,但希望能给您提供背景信息。无论如何,感谢您的链接。
      猜你喜欢
      • 2014-01-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-01-22
      • 2012-07-03
      • 2014-03-22
      • 1970-01-01
      相关资源
      最近更新 更多