【发布时间】:2011-05-03 02:06:51
【问题描述】:
我正在尝试根据线条/笔划的粗细来比较文本和非文本区域。使用距离变换和之后的一些摆弄,设法获得了包含图片特征的每个笔划的粗细(实际上是粗细的一半)。
这是一个程序运行的典型结果:
1.文本区域
34444433343554335533553555545544455445533444444344455435553335545556665444445654444444444444444444444444455434554554455444456544444445555445555543355556665544665444535444553354434553444444444444455444445544444454444444444444444444444444455442444444554444444544444444444444554444456444554414454444444444444444444554444445543454445443444544434443344443334442133223332221
- 非文字
1111112222212222222213333232111112234444411415445125544126143211123445716422457887433442222991443110103332222113111163124134444312122222222224551313122222222222243455553141432222222232111422222351515513211134161412234411743111111454181813111434555191113145520111322223334554452121204233145433467891011121311732525252524202022213137326252419192112222222335831818204233332222344315625171714334444451111788992225161619334538215151811341234258811414113111223144488242413131711332543444872416135247724113223544356152554433333332666652323151444444336675523151344443335566523881333444552222113344445514141433345555202120141114444444345201433355644454191313322333474351818134322266657342171266672415161131145657419111421316665581447891113151513135555555586745556555588551214145145335557888755141314774333455886555141011111211981417776348524111099814144444556414341181114135447434567845534444334881088891011111213141113477734444379888881414144477437254448998834733764226777753781313577776677654466665753466 712124666645444551124476735456655444432446663254664411476757773464147322222777455332224237738833223378121242311333378583438869913135923222344338101013139943333115533910111111884112155339910101011111111101111111097777778855544553991010111111111111111110999999101111111110777764111113561091097543434552999989998666544436554888778755554455541444465554317777774555555544455556665555564424443356433222345222124422341111312111214411322222223222231221143334424322342222123536411441664431775446548856766655885555664444644665449876444477544227887772
那么,有没有比标准差更复杂的统计方法来表明这两个数据集的差异:一个是逐渐变化的,而第二个是剧烈变化的? (包括可怕的数字来说明我试图量化的内容!)
另外请注意,数据点的数量不会相同,因为我将比较不同的区域与一些实验确定的 SD 阈值(或一些其他度量),而不是它们之间的区域。
【问题讨论】:
-
您的区域是分开的,有文本内容还是非文本内容,或者您是否有要从中提取文本和非文本区域的单个粗细列表?
-
连通分量分析发现的分离区域,根据统计测量结果分类为文本/非文本。
标签: math image-processing opencv statistics