【发布时间】:2020-09-28 09:57:41
【问题描述】:
我正在 pythonanywhere 中为 OCR 创建一个网站。在此用户可以上传文本图像并以可编辑格式下载。对于英语,它运行良好,但是当我尝试包含一些其他语言(南印度语言)时,它会显示一些错误消息。
我将额外的训练数据放在文件夹“/home/wiltomalayalamocr/mysite/langfiles”中,其中包含“mal.traineddata”文件
在我的代码中
pytesseract.pytesseract.tesseract_cmd = r"/usr/bin/tesseract"
custom_oem_psm_config = '-l {} --psm {} --tessdata-dir "/home/wiltomalayalamocr/mysite/langfiles"'.format(lang,6)
text = pytesseract.image_to_string(Image.open(filename) , config=custom_oem_psm_config)
其中 lang="mal" 但我得到了错误
pytesseract.pytesseract.TesseractError: (1, 'Tesseract Open Source OCR Engine v3.04.01 with Leptonica Error opening data file /usr/share/tesseract-ocr/tessdata/mal.traineddata Please make sure the TESSDATA_PREFIX environment variable is set to the parent directory of your "tessdata" directory. Failed loading language \'mal\' Tesseract couldn\'t load any languages! Could not initialize tesseract.')
我正在使用 python-Flask 框架
任何人都可以帮助我......
【问题讨论】:
-
或许可以将 mal.traineddata 下载到您的 homedir 中,然后将
TESSDATA_PREFIX设置为指向您的 homedir? -
$export TESSDATA_PREFIX = /home/wiltomalayalamocr/mysite/langfiles 以上代码我在 Bash 控制台中输入并尝试过....但是同样的错误