【发布时间】:2011-05-16 15:43:35
【问题描述】:
看HTML源代码
我发现 Google 永远不会关闭 td 和 tr 标记。源中没有</tr> 没有</td>。
为什么?
<tr class=bb>
<th class="bb lm">Date
<th class="rgt bb">Open
<th class="rgt bb">High
<th class="rgt bb">Low
<th class="rgt bb">Close
<th class="rgt bb rm">Volume
<tr>
<td class="lm">Nov 26, 2010
<td class="rgt">11,183.50
<td class="rgt">11,183.50
<td class="rgt">11,067.17
<td class="rgt">11,092.00
<td class="rgt rm">68,396,121
<tr>
是否因为 XML 解析器无法读取它而使其更难解析?我已经指出 &output=csv 不适用于索引(此 url 不起作用:http://www.google.com/finance?q=INDEXDJX:.DJI&output=csv)而它可用于股票(http://www.google.com/finance/historical?q=NASDAQ:GOOG&output =csv 将起作用)以便在 csv 中获取索引的历史数据,您必须进行解析工作!
【问题讨论】:
-
不,不是骗子,因为这是有效的 HTML。
-
Google 有多个版本的主页。每个用于另一个浏览器。他们在每一个可能的方面都进行了优化。
-
Rebol:这不是 XHTML,而且他们从未声称它是。这并不是让它“更难解析”,因为在阳光下的每个 HTML 解析器仍然可以很好地处理它。
标签: html