【问题标题】:OCR and coordinate association on image for each character每个字符的图像上的 OCR 和坐标关联
【发布时间】:2018-05-12 00:10:35
【问题描述】:

我正在做一个项目来帮助我的视障朋友,一个 python 脚本将首先每秒截取一个屏幕截图,图像上的任何内容都将转换为文本,最接近光标坐标的字符, 将是输出。

用户可以将光标移动到屏幕上的任意位置,离光标最近的字母将是程序的输出。

不要担心输出的形式,它会以音频的形式出现。但是为了简单起见,我们假设它是单字符文本的形式。

我能找到的每个教程都解释了如何使用 OCR 依赖项将所有文本转换为连续的文本文件。

对于我的特定应用程序,每个字母表都将与一个特定的坐标相关联。但我只是找不到单一资源来学习如何识别图像上转换字符的位置。

请教我如何从图像中提取字符的坐标。

【问题讨论】:

  • 对于您的视障朋友,我建议您使用 Knoppix Adriane,它是一个专为视障人士或盲人开发的 Linux 发行版:knopper.net/knoppix-adriane/index-en.html 它非常好,并且可以阅读您输入的内容每秒 OCR 一个屏幕截图。

标签: python python-3.x image-processing ocr opencv3.1


【解决方案1】:

这是一个很好的项目。但我认为这是一个先有鸡还是先有蛋的问题。您需要由功能强大的 OCR 引擎(大多数不提供坐标)执行 OCR,结果将包含文本和相关坐标。您的问题“如何从图像中提取字符的坐标”意味着执行 OCR 并获取坐标。如果执行区域 OCR,即不是整个屏幕,您需要知道要 OCR 的区域,并且建立此区域以确保它包含该区域中鼠标位置周围的所有必要文本可能是最大的挑战。我在www.wisetrend.com 的公司按案例构建此类 OCR 专业项目。如果您愿意合作,我们很乐意在这个非商业项目中提供帮助。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-08-20
    • 1970-01-01
    • 2011-06-29
    • 1970-01-01
    • 1970-01-01
    • 2020-07-28
    • 2016-08-26
    相关资源
    最近更新 更多