【发布时间】:2021-02-28 21:58:40
【问题描述】:
我正在尝试仅删除其中的一行。所以我希望当我运行 pytesseract 时,我会得到可用的数据。
相反,我得到了像'Ce eet il ae oe a on) os\n\nooo eo oo oo oom om om om)\n\n[OO COCO ORR OW OR PRP ODWWG\n\neyo fe) Fee ote) = = - = = eo me-e-)\n\n(Ss: oo ~7~oO 0 0\n\neB\n\n© te O fa ©\n\nOORFONONWR OW DFW NN\n\nVaso\nVES -5)\n1866\nnny\n1625\n1368\nLt\n1070\n898\n838\nwhey)\nom\na\nRie)\n15\n\nny,\n\n=ARAM= gksvlrwOlf\nDarth_Zipzap\naE a\njohnny478423\n=CNAPG _920831993\nOLOLUCTIIN AG\nRivDecartes\nfleadog406\nFormula13\n\nxL LongDubber\nDankdudledan\n_Trix_1740\n\nLUT engl)\n\n=MOPB= JP_Akatonbo\nPlutoh71689\nMakinHerSquirt\n\x0c'这样的字符串
我尝试将其灰度化,但无济于事。我认为考虑到这里的离散列,我可以将字符串拆分为空格和换行符,但是......不。
任何正确方向的指针将不胜感激。
在之前的实验中,我遇到了一些麻烦,因为像小控制器图标这样的图像,我只能在将图像传递给 tesseract 之前检测并屏蔽这些图像。但在这张图片中,tesseract 未能非常一致地识别列中的数字。
【问题讨论】:
-
您是否尝试将图像部分裁剪为仅一行然后使用 tesseract?尝试获取行之间的 y 间隔,然后分别遍历每一行
-
一行会改变。如果我能确定哪一行有我正在寻找的用户名,我可能会这样做,但我也不知道该怎么做。我想我可以尝试寻找较小的文本框边界,例如 geeksforgeeks.org/… 演示,看看我是否可以找到包含名称的文本框的坐标,以便拉出那一行。
-
您可以使用与此处相同的解决方案:stackoverflow.com/questions/52083129/…