【发布时间】:2017-09-05 02:06:06
【问题描述】:
我在网站http://www.flashscore.com/nhl/ 上,我正在尝试提取“今日比赛”表的链接。
我正在用下面的代码试一下,但是还是不行你能指出错误在哪里吗?
final Document page = Jsoup
.connect("http://d.flashscore.com/x/feed/t_4_200_G2Op923t_1_en_1")
.cookie("_ga","GA1.2.47011772.1485726144")
.referrer("http://d.flashscore.com/x/feed/proxy-local")
.userAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.87 Safari/537.36")
.header("X-Fsign", "SW9D1eZo")
.header("X-GeoIP", "1")
.header("X-Requested-With", "XMLHttpRequest")
.header("Accept" , "*/*")
.get();
for (Element game : page.select("table.hockey tr")) {
Elements links = game.getElementsByClass("tr-first stage-finished");
for (Element link : links) {
String linkHref = link.attr("href");
String linkText = link.text();
}
}
为了尝试修复它,我开始调试它。它表明我们得到了页面(尽管我们得到了一种奇怪的 HTML)。之后调试显示 for 循环甚至没有启动。我试图将 page.select("") 部分更改为不同的部分(如 getElementByAttribute 等),但我刚刚开始学习网络抓取,所以我需要熟悉这些方法来浏览文档。我应该如何提取这些数据?
【问题讨论】:
标签: java web-scraping css-selectors jsoup data-extraction