【发布时间】:2018-03-06 21:55:05
【问题描述】:
我想从“aspx”页面中提取数据(我不是网页格式专家): http://www.ffvoile.fr/ffv/web/pratique/habitable/OSIRIS/table.aspx
更准确地说,我想提取每艘船的信息,我们可以点击行左侧的“信息”按钮访问这些信息。
我的问题是“aspx”页面的 URL 始终相同,所以我不明白如何访问每艘船的信息。
我知道如何从“标准”网页中提取数据,所以我需要如何修改以下代码(这些页面在船上显示的信息与“aspx”页面相似但更有限)?
library(rvest)
Url <- "http://www.ffvoile.fr/ffv/public/Application1/Habitable/HN_Detail.asp?Matricule=1"
Page <- read_html(Url)
Data <- Page %>%
html_nodes(".Valeur") %>% # I use SelectorGadget to highlights the relevant elements
html_text()
print(Data)
【问题讨论】:
-
URL 上的页面扩展名是什么无关紧要。它们都提供 HTML。您很可能正在处理使用
javascript更新其内容的页面。您将需要使用可以运行 javascript 的东西,例如RSelenium。也许这个:r-bloggers.com/web-scraping-javascript-rendered-sites 或者这个:r-bloggers.com/scraping-javascript-rendered-web-content-using-r 可以提供帮助 -
您可以考虑使用 Fiddler 来查看您在浏览网站时的 http 请求。然后使用 httr::GET 或 http:POST 获得等价物。让我知道你是否能够得到它
标签: r import web-scraping