【发布时间】:2015-09-11 09:49:17
【问题描述】:
我目前正在为 Java 中的 pdf 文件开发一个自动化 Index-Generator。这个概念非常简单(现在):我遍历 pdf 中的每个单词,与一个忽略列表(类似于该语言中 10000 个最常见的单词)进行比较,然后将其添加到 com.google.common.collect.HashMultimap,单词为 String和一个 HashSet 页面,单词出现在。
这工作得很好,但我仍然将所有不同的偏角/共轭形式的单词作为索引中的单独项目。我正在考虑仅比较这些单词的相对子字符串,但例如在德语(该程序旨在用于)及其所有不规则性的情况下,这种方法的好处非常少。
还有其他想法、库、正则表达式吗? 提前致谢
【问题讨论】:
-
Lucene,有不同的变体:
org.tartarus.snowball.ext.German2Stemmer和org.apache.lucene.analysis.de.GermanLightStemmer。 default analyzer 使用 light stemmer,然后是德国化的雪球。 -
对于 NLP 任务,您应该搜索包含该语言数据和规则的 NLP 库。要求人们为此构建正则表达式就像要求人们重新发明轮子并为您进行研究。
-
我不是在要求正则表达式或任何预构建的解决方案,只是为了获得正确方向的提示。也许我的问题不清楚,对此感到抱歉。不过多亏了其他的回复,我今晚去看看
标签: java regex nlp similarity linguistics