【问题标题】:Showing plagiarism results显示抄袭结果
【发布时间】:2011-05-19 06:23:32
【问题描述】:

我正在开发一个抄袭检测框架。在那里,我们首先以词干提取、同义词替换和停用词删除的方式对文档进行预处理。所以预处理后的文档与原始文档有些不同。

在我们将预处理的文档输入抄袭函数后,它会返回相似的句子。

然后在我们的 GUI 中,我们必须通过高亮显示这两个文档和相似的句子。

要在 java 中突出显示,我们必须获取单词的索引并突出显示。

问题是预处理后的文本与原始文档不同,因此很难对原始文档中的相似句子进行索引。

谁能帮我解决这个问题??

【问题讨论】:

  • 这是一个具有讽刺意味的人的家庭作业吗?
  • 已经完成 : Simian - Similarity Analyser: harukizaemon.com/simian
  • @Andrew Grimm:任务的第二部分是在自己的代码上运行!! (也很好地涵盖了递归!)
  • 为什么不使用 gvimdiff?鉴于两者之间存在偏移,可能有一个对齐文件的选项。
  • @Andrew:按照最好的传统,自掘坟墓……

标签: java preprocessor highlighting plagiarism-detection


【解决方案1】:

您必须在预处理文档中存储某种元数据,以便将其内容映射到原始文档。就像保留因删除停用词而导致的所有空白的列表,或存储有关您将单词替换为同义词的位置的信息。

如果您记录在预处理期间所做的所有更改(位置/替换文本),那么您应该能够在原始文档中找到原始短语。

【讨论】:

  • 同意:解决方案的核心是跟踪原始文档的转换方式。那可能是停用词/空格/标点符号删除,在这种情况下转换仍然是线性的(并且可以将差异用作核心技术),但也许可以重新排序句子?在这种情况下,您需要一张关于哪些片段移动到哪里的地图。
猜你喜欢
  • 2021-07-25
  • 1970-01-01
  • 2014-03-22
  • 1970-01-01
  • 2013-12-12
  • 1970-01-01
  • 2014-01-11
  • 1970-01-01
  • 2012-07-03
相关资源
最近更新 更多