【发布时间】:2021-11-15 10:33:46
【问题描述】:
我需要帮助的是一种从 Google Cloud Vision 从 pdf/jpg 文件中提取的 OCR 文本预测文档标题的方法。
我有一个jpg file,我将它发送到 Vision API,我得到了 OCR 文本。对于附加的图像,我如何以编程方式预测文档的标题是“钢琴姿势检查表”?
【问题讨论】:
标签: pdf jpeg google-cloud-vision vision-api
我需要帮助的是一种从 Google Cloud Vision 从 pdf/jpg 文件中提取的 OCR 文本预测文档标题的方法。
我有一个jpg file,我将它发送到 Vision API,我得到了 OCR 文本。对于附加的图像,我如何以编程方式预测文档的标题是“钢琴姿势检查表”?
【问题讨论】:
标签: pdf jpeg google-cloud-vision vision-api
使用 Vision API (TextAnnotation) 检测文本时得到的响应结构类似于 TextAnnotation -> 页面 -> 块(文本块、表格块等)-> 段落 -> 单词 -> 符号。这些的附加属性是检测到的语言,检测到的中断(空格、连字符、换行符)。因此,Vision API 无法预测文档的“标题”那么具体。见TextAnnotation reference。
如果您想预测文档/图像中的“标题”那么具体。我建议使用AutoML Vision,在给定一组正确标记的文档/图像的情况下,您可以在其中训练一个预测“标题”的模型。训练完成后,您可以发送预测请求来预测“标题”。
有关如何准备数据集、训练模型和预测的示例,您可以参考此document。
【讨论】:
您想要“预测文档标题”。这里有两种可能的情况:
对于#1,我同意Ricco 的回复:您应该为您的应用程序构建Cloud Vision API 的自定义版本,IOW 使用AutoML(好吧,AutoML Vision)调整模型到满足您的需求,例如,从 OCR 文档中获取标题,是否要查找标题放置/位置、字体大小等。
更高级的是#2。您可能必须使用 pair API... OCR 和 Cloud Vision(不带 AutoML)然后使用 NLU 通过Cloud Natural Language(或AutoML Natural Language,如果需要)分析文本) 如果文档没有出现,则可能会根据其内容自动生成标题。我相信在这种情况下,您的训练可能不得不倾向于监督学习,在这种情况下,您在训练数据中提供与无标题文档配对的标题。
【讨论】: