【问题标题】:Which features can i use for handwritten OCR other than a downsampled binary grid of the image?除了图像的下采样二进制网格之外,我还可以将哪些功能用于手写 OCR?
【发布时间】:2012-10-15 02:39:18
【问题描述】:
您好,我一直在搜索研究论文,了解哪些特征适合我在我的手写 OCR 分类神经网络中使用。我是一个初学者,所以我一直只是拍摄手写字符的图像,在它周围制作一个边界框,然后将其调整为 15x20 二进制图像。所以这意味着我有一个包含 300 个特征的输入层。从我在谷歌上找到的论文(其中大部分都很旧)中,方法确实有所不同。仅使用图像的二进制网格,我的准确性还不错,但是我想知道是否有人可以使用其他功能来提高准确性。甚至只是将我指向正确的方向。我真的很感激!
谢谢,
扎克
【问题讨论】:
标签:
neural-network
ocr
handwriting
feature-extraction
【解决方案1】:
我没有读过任何关于这个主题的实际论文,但我的建议是要有创意。使用任何你能想到的可能有助于分类器识别数字的东西。
我的第一个想法是尝试识别图像中的“线条”,可能通过修改后的“滑动窗口”算法(滑动/旋转线?),或者尝试识别“最适合的线条”图像(帮助分类器响应斜体或写作风格的变化)。确实,如果您使用的是神经网络,它应该可以在没有您手动帮助的情况下处理这些事情(这就是它们的全部意义!)
我会首先关注网络的结构和拓扑以尝试提高性能,并且只有在您无法通过其他方式获得令人满意的性能时才会担心其他功能。你也可以尝试改进你已经拥有的功能,确保字符在图像中居中,或者尝试一种算法来倾斜斜体字符以使其垂直?
根据我的经验,这些事情通常不会有帮助,但你可能会很幸运并遇到一个可以改善你的网络的事情:)