【发布时间】:2018-03-18 23:18:01
【问题描述】:
所以我一直在开发一个应用程序,用户可以在其中上传(扫描的)代表某种形式的 PDF 文件,在他们感兴趣的字段周围绘制边界框,并将这些内容 OCR 并以结构化文本格式返回。因为绘制边界框有点拖累,所以我在想一种方法来减少用户所需的工作;即已经为他/她提供了一个自动检测到的字段划分形式。我开始研究这个问题,发现了一些有趣的方法,主要是基于计算机视觉算法。但是,由于此应用程序将来可能会频繁使用,因此用户将绘制大量边界框,因此不尝试使用此数据集来应用学习方法对我来说几乎是一种浪费。所以我开始查看很多不同的表格,并注意到它们中的大多数都是以这样的方式由边框构成的:
这里有一些观察:通常不要求提取 100% 用文本填充的框,因为它们代表条款/条件/免责声明/等。 (大部分)为空的框也不会被请求,因为它们大多表示不相关的字段。唯一有趣的盒子似乎是那些在顶部/左侧带有标签并且在盒子主体中有一些内容的盒子。
当然也应该说,并不是每个表格都像上面的表格那样具有良好的边框结构。有些只在字段之间使用单个分隔边界(即水平或垂直),有时根本没有边界。
由于我们正在处理图像,我开始研究对象识别并尝试了 YOLOv2(卷积神经网络),我让它在一个包含 100 个表格的数据集上训练了一晚(我意识到这个数据集仍然太小,因为我在我的 CPU 上训练,我也没有训练足够长的时间)。无论如何,我希望所有训练字段都有边框和一些内容这一事实能够快速帮助系统自己找到有边框的框。然而,到目前为止,结果非常令人失望(平均损失/错误 = 9.6)。我开始思考这个问题,然后意识到如果用户跳过绘制某些带有完美边界框的字段,它会在学习过程中混淆神经网络,我说的对吗?
至于我的问题的其余部分:你们认为对象识别是解决问题的方法,还是考虑到这种形式的性质,它对系统来说太混乱了?如果是这样,如果我应用了一些过滤器来尝试将文本“模糊”在一起,使这些框看起来更像彼此,情况是否仍然如此?或者,给定每个文档(大多数)相关框的坐标数据集,什么是更好的学习方法?甚至是一种不太基于边界存在的方法?
请记住,我要求的唯一要求是能够使用用户绘制的边界框作为数据集来不断改进系统。
感谢大家的宝贵时间!
【问题讨论】:
标签: machine-learning computer-vision artificial-intelligence conv-neural-network object-recognition