【问题标题】:Is there a way to predict document title from Google Cloud Vision OCR?有没有办法从 Google Cloud Vision OCR 预测文档标题?
【发布时间】:2021-11-15 10:33:46
【问题描述】:

我需要帮助的是一种从 Google Cloud Vision 从 pdf/jpg 文件中提取的 OCR 文本预测文档标题的方法。

我有一个jpg file,我将它发送到 Vision API,我得到了 OCR 文本。对于附加的图像,我如何以编程方式预测文档的标题是“钢琴姿势检查表”?

【问题讨论】:

    标签: pdf jpeg google-cloud-vision vision-api


    【解决方案1】:

    使用 Vision API (TextAnnotation) 检测文本时得到的响应结构类似于 TextAnnotation -> 页面 -> 块(文本块、表格块等)-> 段落 -> 单词 -> 符号。这些的附加属性是检测到的语言,检测到的中断(空格、连字符、换行符)。因此,Vision API 无法预测文档的“标题”那么具体。见TextAnnotation reference

    如果您想预测文档/图像中的“标题”那么具体。我建议使用AutoML Vision,在给定一组正确标记的文档/图像的情况下,您可以在其中训练一个预测“标题”的模型。训练完成后,您可以发送预测请求来预测“标题”。

    有关如何准备数据集、训练模型和预测的示例,您可以参考此document

    【讨论】:

    • 感谢您的建议!
    【解决方案2】:

    您想要“预测文档标题”。这里有两种可能的情况:

    1. 要么您想根据出现在文档中某处的标题本身来预测正确的文档标题,要么
    2. 您想根据(OCR)内容来预测标题,因为文档没有/没有标题。

    对于#1,我同意Ricco 的回复:您应该为您的应用程序构建Cloud Vision API 的自定义版本,IOW 使用AutoML(好吧,AutoML Vision)调整模型到满足您的需求,例如,从 OCR 文档中获取标题,是否要查找标题放置/位置、字体大小等。

    更高级的是#2。您可能必须使用 pair API... OCR 和 Cloud Vision(不带 AutoML)然后使用 NLU 通过Cloud Natural Language(或AutoML Natural Language,如果需要)分析文本) 如果文档没有出现,则可能会根据其内容自动生成标题。我相信在这种情况下,您的训练可能不得不倾向于监督学习,在这种情况下,您在训练数据中提供与无标题文档配对的标题。

    【讨论】:

    • 我正在寻找您提到的第二种情况。感谢您的建议!我会试试看。
    猜你喜欢
    • 2019-02-19
    • 2023-03-02
    • 2017-01-25
    • 2016-07-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多