【问题标题】:An algorithm or a library to give structure to OCR-ed tabular data为 OCR 编辑的表格数据提供结构的算法或库
【发布时间】:2016-11-01 17:18:26
【问题描述】:

我正在使用 OCR 读取难以辨认的表格数据表。来自 OCR 的数据包含很多拼写错误和错误提取的项目。有一个应该从表中提取的正确数据结构的定义。我的任务是找到一个程序来清理来自 OCR 的数据并提取尽可能多的有用数据点。例如:

在数据中,我期望以下数据点:

高度 - 以米表示的 0.01 到 10.0 范围内的十进制值

宽度 - 以米表示的 0.01 到 10.0 范围内的十进制值

重量 - 以千克表示的 5 到 50 范围内的整数值

颜色 - 值为“红色”、“黄色”或“橙色”的字符串

...等等

从 OCR 我得到:

neiont: l2.G n

weion: 14 劫

oolowr: veHou

鉴于上述限制,我应该能够将 OCR 输出解析为:

高度:12.5 米

重量:14 公斤

颜色:黄色

您能否提出一个通用算法、技术或优化程序,或者甚至是一个现成的库可以用来处理这项任务?

【问题讨论】:

  • 所有输入都是同一个人(或少数可识别的人)写的?
  • 输入是用一小部分常用字体打印出来的,但是由于是手机摄像头拍的,所以图片经常变形。

标签: algorithm ocr


【解决方案1】:

这是一项艰巨的任务!可能超出了 SO 的范围。更多的专利发明。

有很多事情需要考虑。一方面,你怎么知道 G 应该是 5 而不是封闭的 6?是的,你的眼睛可以分辨,但是教计算机什么是 OCR。

更不用说写得不好的 7 被解释为“我”。

至少颜色只有 3 个可能的值...

【讨论】:

  • 我可能会因此而被否决,但事实有时可能很残酷)
  • 无论如何,谢谢您的评论。我不指望找到一个完美的解决方案。我只是在寻找可能有助于提高我能够提取的有用数据比例的想法。
猜你喜欢
  • 1970-01-01
  • 2011-04-08
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多