【发布时间】:2020-10-24 04:42:43
【问题描述】:
是否可以更改 tika 的语言(默认检测)?
我正在尝试使用泰米尔语的 pdf 文件。 (语言代码“ta”)。但 tika 将其检测为“th”(泰语)。 虽然大多数字符都被很好地识别,但它并没有背叛少数字符。
请参阅下面的示例,其中一些“o”出现在文本之间。
ஓவச -அக்ைரும்பாகலைளில்பாய்வதால்ஓகெயும்ஓகெயும்ஓகெயும்; வவவலச்சங்கின் -ஓவச -நீர்க்நீர்க்ெங்குைளிடமிருந்து
from tika import language
print(language.from_file(u'pdf/KambaRamayanam1.pdf' ))
结果是'th'。 预期是“ta”
【问题讨论】:
-
看看github.com/apache/tika/blob/main/tika-core/src/main/resources/… 和github.com/apache/tika/blob/main/tika-core/src/main/java/org/…。 Tika 显然支持 28 种语言,泰语 (th) 是其中之一。不支持泰米尔语。无论如何,Tika 显然使用 n-gram 分析进行语言检测。这是一种统计方法,永远不会非常精确。我刚刚尝试了两个德语 PDF,它检测到语言为“en”和“th”...
-
感谢@RobertPetermeier。我也是这么想的。感谢您的回复。
-
看这里:medium.com/@masreis/… 在“识别语言”部分。 Tika 端点语言/流用于识别语言。它适用于本机 pdf,但对于扫描的 pdf,返回值为“th”。根本原因是:OCR 不用于语言检测(仅用于简单的文本提取),因此当需要 ocr 时(扫描的 pdf 或 jpgs)比检测到的值是 th
标签: python nlp apache-tika tamil