【问题标题】:Generating all data HTML生成所有数据 HTML
【发布时间】:2015-12-19 22:43:34
【问题描述】:

我想使用 XML 包对 this link 进行网络抓取。问题是数据不是自动生成的。这段 HTML 生成了表格:

<table width="1280px" id="maintable">
<tr id="tabletoggles">
<td>&nbsp;</td>
<td id="tablelabel">&nbsp;</td>
<td id="abovestats" class="abovestats" align="right">
&nbsp;&nbsp;&nbsp;<span class="revscore likelink"></span>
&nbsp;&nbsp;&nbsp;<b>Stats:</b>&nbsp;
<span class="statso stattab">Serve</span>&nbsp;|&nbsp;<span class="statsr stattab likelink">Return</span>&nbsp;|&nbsp;<span class="statsw stattab likelink">Raw</span>
</td></tr>
<tr>
<td id="footer" class="footer">&nbsp;</td>
<td colspan="2" id="stats" class="stats"><table id="matches"></table></td>
</tr>
<tr>
<td id="belowmenus">&nbsp;<br/>&nbsp;<br/>&nbsp;<br/>&nbsp;<br/>&nbsp;</td>
<td colspan="2" id="belowmatches">&nbsp;</td>
</tr>
</table></div>
</div>

在这段 HTML 上使用 XML 中的函数 readHTMLTable 时,我得到的只是无意义的值:

readHTMLTable("http://www.tennisabstract.com/cgi-bin/player.cgi?p=NovakDjokovic&f=ACareerqq",which = 3)

V1         V2
1 Â
2 Â Â Â Â Â   Â

如何检索包含所有数据的“完整链接”?我可以使用Firebug 为每个页面手动执行此操作,但我希望有一个可以同时检索多个 url 的解决方案。

【问题讨论】:

  • 那是因为你想要的所有数据都是here
  • (被拉开)每个页面都是动态生成的。您要么必须使用 selenium,要么获取与页面关联的 javascript 数据并将其清理为 fromJSON 或使用 V8 将其变为可读形式。
  • 刚刚错过了数据,谢谢两位

标签: html xml r xml-parsing


【解决方案1】:

我认为这是由于缺少 UTF8 编码。

您使用什么语言来获取这些数据?

如果你使用 PHP 取数据,我推荐使用

header('Content-Type: text/html; charset=utf-8');

在整个代码之前。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-11-22
    • 2012-01-07
    • 2021-08-22
    • 2014-06-29
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多