【发布时间】:2019-10-01 14:59:26
【问题描述】:
我尝试检测短语中的语言,但由于检测结果错误而感到惊讶。
LanguageDetector detector = new OptimaizeLangDetector();
try {
detector.loadModels();
} catch (IOException e) {
LOG.error(e.getMessage(), e);
throw new ExceptionInInitializerError(e);
}
LanguageResult languageResult = detector.detect("Hello, my friend!")
languageResult 包含“中等”概率的挪威语。为什么?我认为它必须是英语。似乎可以正确检测到较长的短语。这是否意味着 Apache Tika 不应该用于短文本?
【问题讨论】:
标签: java nlp apache-tika