【发布时间】:2021-07-06 17:40:28
【问题描述】:
我希望恢复损坏的僧伽罗语手写文件。请告诉我:Tesseract 也可以用于僧伽罗语吗?
【问题讨论】:
-
StackOverflow 问题通常应该比可以使用 Google 研究的问题更重要。以下是一些可能对您有所帮助的文章:medium.com/@isurianuradha96/…researchgate.net/publication/…。
标签: tesseract
我希望恢复损坏的僧伽罗语手写文件。请告诉我:Tesseract 也可以用于僧伽罗语吗?
【问题讨论】:
标签: tesseract
签出tessdata folder the from tesseract-ocr GitHub 存储库:
sin.traineddata 表示实际的僧伽罗语语言,并且script/Sinhala.traineddata。将其中一个(或两个)复制到您的 tessdata 文件夹,可能位于某些 Windows 机器上的 C:\tesseract\tessdata。
例如,从命令行运行 Tesseract,然后可以使用
tesseract myimage.png output -l sin
或
tesseract myimage.png output -l Sinhala
我截取了Sinhala script Wikipedia page的截图,并裁剪了以下部分:
以上两个命令都会产生以下输出:
සිංහල අක්ෂර මාලාව
这对我来说似乎很好,但我并没有声称能够阅读或理解任何僧伽罗文字或语言!
所以,总的来说:是的,看来,您可以 OCR 僧伽罗文本!
但是:对于任何文字,对于非拉丁文字来说可能更困难,您可能不会在手写文本上获得好的结果。这些文本的 OCR 本身就是一个研究领域。
【讨论】: