【发布时间】:2016-11-01 17:18:26
【问题描述】:
我正在使用 OCR 读取难以辨认的表格数据表。来自 OCR 的数据包含很多拼写错误和错误提取的项目。有一个应该从表中提取的正确数据结构的定义。我的任务是找到一个程序来清理来自 OCR 的数据并提取尽可能多的有用数据点。例如:
在数据中,我期望以下数据点:
高度 - 以米表示的 0.01 到 10.0 范围内的十进制值
宽度 - 以米表示的 0.01 到 10.0 范围内的十进制值
重量 - 以千克表示的 5 到 50 范围内的整数值
颜色 - 值为“红色”、“黄色”或“橙色”的字符串
...等等
从 OCR 我得到:
neiont: l2.G n
weion: 14 劫
oolowr: veHou
鉴于上述限制,我应该能够将 OCR 输出解析为:
高度:12.5 米
重量:14 公斤
颜色:黄色
您能否提出一个通用算法、技术或优化程序,或者甚至是一个现成的库可以用来处理这项任务?
【问题讨论】:
-
所有输入都是同一个人(或少数可识别的人)写的?
-
输入是用一小部分常用字体打印出来的,但是由于是手机摄像头拍的,所以图片经常变形。