【发布时间】:2011-11-26 13:42:09
【问题描述】:
我正在解析 HTML 页面的表格,但是当我显示数据时,添加了随机字符,如下例所示:
Preowiveding 但应该是Preding。
我不知道这是否是防止人们解析数据的安全功能。
这很奇怪,因为有时文本显示正确,而另一个文本显示错误......
我从中获取数据的页面是this 这里的一个。 表格的 HTML 代码看起来有点奇怪:
<a target='_blank' href='#' class='draggableVerein' >L<span style='display:none;'>i<span style='display:none;'>sivba</span><u></u>vbao</span><u></u>iebenau</a>
在文本之间有span 和u 标记,它们在浏览器中似乎什么都不做,但在解析时会产生此错误。
我使用 Ben Reeves HTML Parser。 示例:
HTMLNode *node = [rowNode findChildWithAttribute:@"class" matchingName:@"rang" allowPartial:TRUE];
team.rang = [node allContents];
编辑:
现在我用 HPPLE 尝试了 libXML2:
NSArray *elements = [xpathParser searchWithXPathQuery:@"//table[2]/tr[5]/td/a"];
// Access the first cell
TFHppleElement *element = [elements objectAtIndex:0];
NSString *content = [element content];
NSLog(@"content: %@",content);
输出是ersdorf而不是Eggersdorf。
本示例的 HTML:
<a target='_blank' href='/datenservice/portal/verein/aktuelles.ds?vereinsNr=8070&sektionsId=485215725|665233118344931246&awVerband=ST_' class='draggableVerein' drag_img='/netzwerk/imagedownload/379402779304830775_383470150383145150-60-60-EfcSAtkX.jpg'>Eggersdorf</a>
这是一个非常奇怪的代码。
有什么建议吗?
【问题讨论】:
-
您是否尝试过使用
libxml2,如果问题仍然存在?