【问题标题】:Can Tesseract be used for Sinhala handwritten text recognition?Tesseract 可以用于僧伽罗语手写文本识别吗?
【发布时间】:2021-07-06 17:40:28
【问题描述】:

我希望恢复损坏的僧伽罗语手写文件。请告诉我:Tesseract 也可以用于僧伽罗语吗?

【问题讨论】:

标签: tesseract


【解决方案1】:

签出tessdata folder the from tesseract-ocr GitHub 存储库:

  • sin.traineddata 表示实际的僧伽罗语语言,并且
  • 僧伽罗语脚本script/Sinhala.traineddata

将其中一个(或两个)复制到您的 tessdata 文件夹,可能位于某些 Windows 机器上的 C:\tesseract\tessdata

例如,从命令行运行 Tesseract,然后可以使用

tesseract myimage.png output -l sin

tesseract myimage.png output -l Sinhala

我截取了Sinhala script Wikipedia page的截图,并裁剪了以下部分:

以上两个命令都会产生以下输出:

සිංහල අක්ෂර මාලාව

这对我来说似乎很好,但我并没有声称能够阅读或理解任何僧伽罗文字或语言!

所以,总的来说:是的,看来,您可以 OCR 僧伽罗文本!

但是:对于任何文字,对于非拉丁文字来说可能更困难,您可能不会在手写文本上获得好的结果。这些文本的 OCR 本身就是一个研究领域。

【讨论】:

    猜你喜欢
    • 2013-07-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-03
    • 1970-01-01
    • 2014-11-06
    相关资源
    最近更新 更多