【发布时间】:2015-12-19 22:43:34
【问题描述】:
我想使用 XML 包对 this link 进行网络抓取。问题是数据不是自动生成的。这段 HTML 生成了表格:
<table width="1280px" id="maintable">
<tr id="tabletoggles">
<td> </td>
<td id="tablelabel"> </td>
<td id="abovestats" class="abovestats" align="right">
<span class="revscore likelink"></span>
<b>Stats:</b>
<span class="statso stattab">Serve</span> | <span class="statsr stattab likelink">Return</span> | <span class="statsw stattab likelink">Raw</span>
</td></tr>
<tr>
<td id="footer" class="footer"> </td>
<td colspan="2" id="stats" class="stats"><table id="matches"></table></td>
</tr>
<tr>
<td id="belowmenus"> <br/> <br/> <br/> <br/> </td>
<td colspan="2" id="belowmatches"> </td>
</tr>
</table></div>
</div>
在这段 HTML 上使用 XML 中的函数 readHTMLTable 时,我得到的只是无意义的值:
readHTMLTable("http://www.tennisabstract.com/cgi-bin/player.cgi?p=NovakDjokovic&f=ACareerqq",which = 3)
V1 V2
1 Â
2 Â Â Â Â Â Â
如何检索包含所有数据的“完整链接”?我可以使用Firebug 为每个页面手动执行此操作,但我希望有一个可以同时检索多个 url 的解决方案。
【问题讨论】:
-
那是因为你想要的所有数据都是here
-
(被拉开)每个页面都是动态生成的。您要么必须使用 selenium,要么获取与页面关联的 javascript 数据并将其清理为
fromJSON或使用V8将其变为可读形式。 -
刚刚错过了数据,谢谢两位
标签: html xml r xml-parsing