【问题标题】:OCR AWS Textract service fails to make distinction in superscript/exponentsOCR AWS Textract 服务无法区分上标/指数
【发布时间】:2020-01-03 17:21:51
【问题描述】:

我正在使用 Textract AWS 服务。

  1. 像 1010 这样的值被读取为 1010。这会导致读取数据错误。
  2. 此外,单元格内的数据边界有时会与包含单元格的边界重叠。

如何解决这些问题?

【问题讨论】:

    标签: java amazon-web-services ocr amazon-textract


    【解决方案1】:

    您无法自行解决此问题。您将不得不提出支持票,并希望他们能解决问题。 AWS 不断训练他们的预测模型以使其变得更好。但是由于他们的模型已经使用数百万种不同类型的文档进行了训练,因此在识别单元格或表单元素时会出现错误。

    仅针对一种类型的表单进行过专门训练的模型在该表单上的表现要好得多。你必须为了多样性而牺牲准确性。

    【讨论】:

    • 意思是这个没有办法解决?我无法根据需要调整处理?我很惊讶为什么他们错过了用上标书写的文本需要根据较小的大小和位置进行分隔的这一方面
    • 不,没有办法改变 textract 的检测能力。它是一个完全托管的 AI 解决方案。 AWS 继续使用更多形式训练他们的模型。您可以联系支持并提出功能请求。如果还有很多其他人想要这个功能,他们可能会决定在未来将其训练成 Textract。
    猜你喜欢
    • 2016-12-02
    • 1970-01-01
    • 2021-06-29
    • 1970-01-01
    • 1970-01-01
    • 2020-01-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多