【问题标题】:Replacing known text in an unreliable string (OCR)替换不可靠字符串 (OCR) 中的已知文本
【发布时间】:2019-11-24 11:52:31
【问题描述】:

我有来自表单的 OCRed 文本。我需要提取经常与标题和其他无关(但已知)文本混合的文本。

我的表单上有一个 name 框。我通常会从 OCR 中返回:

“名字:某个名字”

在这里我可以删除“姓名:”并继续我的一天。

不幸的是,我经常得到这样的东西:

  • “命名一些名字”
  • “ame:某个名字”
  • "ame Some Name"
  • “名字。一些名字”
  • “姓名”
  • “ameSome 名称”

当您现在要删除的字符串经常被损坏时,有哪些技术可以清理/提取所需的文本?

我正在使用 Javascript/Node。

谢谢

【问题讨论】:

  • “Some Name”是变量还是静态文本?
  • Some Name 是可变文本。

标签: javascript node.js ocr text-extraction


【解决方案1】:

如果您一直希望获得标签,或者至少是其中的一部分,您可以尝试使用正则表达式来匹配它,然后删除。

类似(先将其转换为小写):

^n?ame[:.\-\s]?

行首可能有也可能没有“n”,后跟“ame”,然后是分隔符,如“: . or -”

这可能不适用于所有情况,但它适用于您提供的示例

【讨论】:

  • 先生。艾姆斯没有被逗乐;)
  • @Piskvorcc-by-sa3.0 除非根本不提取标签,否则我认为 Ames 先生会很好,因为正则表达式只在行开头捕获标签,当然这不包括不过,在所有情况下,这都是用提取结果调整正则表达式的问题
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-03-24
  • 1970-01-01
  • 2018-02-05
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多