【发布时间】:2020-11-04 14:59:29
【问题描述】:
我正在尝试使用rvest 包来抓取页面上嵌入的链接列表。在我使用这样的东西之前:
library(rvest)
page <- read_html("link")
page %>% html_nodes('{a href}') %>% html_attr('href')
但是,这只给了我与<a href="https://www.abcefg.com">Here</a>相关的链接,而不是这个链接<a rel="external nofollow noopener" href="www.dropbox.com/abcdefg.rar" "target="_blank">Part 01</a>
我的问题是如何在忽略第一个链接的同时获取第二个链接?
【问题讨论】:
-
你用过 html_nodes('a [href]') 吗?并且不确定 r 但您可能无法在响应头中获得链接。
标签: r web-scraping xpath css-selectors rvest