【问题标题】:Tesseract and OCR can't recognize digital-like fontsTesseract 和 OCR 无法识别类似数字的字体
【发布时间】:2021-05-13 14:45:50
【问题描述】:

我需要从显示如下的数字秤屏幕上读取数字,例如:

所以我使用网络摄像头、Javascript 和 Tesseract.js 来使用 OCR。但最好的结果是:

Jo | |
I 10)

显然,当预期结果是123456

以下是一些生成的 JSON:

block: {
    paragraphs: Array(1),
    text: "Jo | |↵I 10)↵",
    confidence: 47.748504638671875,
    baseline: {
        …},
    bbox: {
        …},
    …
}

处理图像的代码如下:

function recognizeFile(file){
    const corePath = window.navigator.userAgent.indexOf("Edge") > -1
        ? 'js/tesseract-core.asm.js'
        : 'js/tesseract-core.wasm.js';


    const worker = new Tesseract.TesseractWorker({
        corePath,
    });

    worker.recognize(file,
        $("#langsel").val()
    )
        .progress(function(packet){
            console.info(packet)
        })
        .then(function(data){
            console.log(data)
        })
}

还有其他选择可以实现吗?有没有更适合这些案例的图书馆?

提前致谢。

【问题讨论】:

    标签: javascript ocr tesseract


    【解决方案1】:
    【解决方案2】:

    看起来您正在使用 typescript / javascript。我做到了 - 纯网络应用程序。就像上面提到的用户一样,ssd 训练的数据效果更好。我尝试了一些额外的技术,裁剪矩形,应用白名单等。

    https://github.com/kiichi/meter-cap

    【讨论】:

      猜你喜欢
      • 2021-03-11
      • 1970-01-01
      • 2011-07-25
      • 1970-01-01
      • 2017-08-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多