【问题标题】:aws sagemaker for detecting text in an imageaws sagemaker 用于检测图像中的文本
【发布时间】:2019-02-05 04:46:42
【问题描述】:

我知道最好为此使用 aws Rekognition。但是,当我使用我拥有的图像(有点像带有标签的小容器)进行尝试时,它似乎效果不佳。文本出现拼写错误和碎片化。

我是 ML 和 sagemaker 的新手。从我所见,用例似乎是用于预测和图像分类。我找不到一个关于训练用于检测图像中文本的模型。是否可以使用 Sagemaker 做到这一点?如果有人指出我正确的方向,我将不胜感激。

【问题讨论】:

    标签: amazon-web-services amazon-sagemaker


    【解决方案1】:

    不同的服务都将为光学字符识别 (OCR) 提供不同的抽象级别,具体取决于您最喜欢使用管道的哪些部分以及您希望抽象的内容。

    这里有几个选项:

    • Rekognition 将提供开箱即用的 OCR 和 DetectText 功能。但是,在当前情况下,您似乎需要对图像执行某种预处理以获得更好的结果。这可以通过您选择的任何方法(Lambda、EC2 等)来完成。

    • SageMaker 是一种工具,可让您轻松训练和部署自己的模型(任何类型)。 SageMaker 有两个主要选择:

      1. 自己动手的选项:如果您希望走上标记自己的数据、收集相当大的训练集并训练自己的 OCR 模型的道路,这是可以通过 SageMaker 训练和部署您自己的模型。

      2. 现有的 OCR 算法:有许多算法都对 OCR 有不同的潜在权衡。一个例子是Tesseract。使用它,您可以更紧密地将预处理步骤与文本检测结合起来。

    • Amazon Textract(预览中)是一种专门构建的专用 OCR 服务,根据您的图像外观和您选择的设置,它可能会提供更好的性能。

    我个人建议先查看pre-processing for OCR,看看它是否能提高 Rekognition 的准确性,然后再转向其他选项。即使它不能提高 Rekognition 的准确性,它对于大多数其他选项仍然很有价值!

    【讨论】:

    • 您好,感谢您的回复。谷歌云视觉 API 似乎很好地给了我文本。我已经发布了另一个问题,希望您能帮助我回答。你似乎很了解这些东西。
    猜你喜欢
    • 1970-01-01
    • 2018-12-13
    • 2020-03-28
    • 2011-02-05
    • 2019-06-09
    • 2016-02-18
    • 2016-03-28
    • 2023-02-01
    • 2014-11-11
    相关资源
    最近更新 更多