【问题标题】:I need some clarification regarding document "structure/type" in Microsoft Form Recognizer docs我需要一些关于 Microsoft Form Recognizer docs 中文档“结构/类型”的说明
【发布时间】:2019-11-19 23:43:22
【问题描述】:

Form Recognizer documentation 中,据说“您应该至少有五个与您的主要输入数据类型/结构相同的已填写表格(PDF 文档和/或图像)”。我的数据主要是表格的,但有些列的数量和其中的内容有所不同。例如,有些是like this——但列中有数字——有些类似于this one

我的问题是它们是否可以被视为相同的“类型/结构”,因为它们都是表格的,或者它们不能因为它们有些不同。

如果它们不能被认为是同一类型,那么如果我将它们一起用作“表格文档”的训练样本,会损害大部分性能吗?

我不确定这是否是提出这个问题的正确地方,但如果有人可以将我重定向到可以提出这个问题或回答我的问题的地方,我将非常感激 :) 谢谢!

【问题讨论】:

    标签: ocr microsoft-cognitive


    【解决方案1】:

    就我而言(我上周开始使用表单识别器),当它说相同的类型/结构时,这意味着所有文件必须具有相同的扩展名(所有 PDF 或所有 JPEG)并且所有文件必须在相同位置具有相同名称/标题的相同列/字段,以便模型可以将这些字段识别为键,然后提取与这些键关联的值。

    因此,就您而言,我认为您必须针对文件的不同结构训练不同的模型。

    希望对你有帮助!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2023-04-01
      • 2021-09-28
      • 2019-05-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多