【问题标题】:rvest on extracting link within <a rel= ... href=>rvest 在 <a rel= ... href=> 中提取链接
【发布时间】:2020-11-04 14:59:29
【问题描述】:

我正在尝试使用rvest 包来抓取页面上嵌入的链接列表。在我使用这样的东西之前:

library(rvest)
page <- read_html("link")
page %>% html_nodes('{a href}') %>% html_attr('href')

但是,这只给了我与&lt;a href="https://www.abcefg.com"&gt;Here&lt;/a&gt;相关的链接,而不是这个链接&lt;a rel="external nofollow noopener" href="www.dropbox.com/abcdefg.rar" "target="_blank"&gt;Part 01&lt;/a&gt;

我的问题是如何在忽略第一个链接的同时获取第二个链接?

【问题讨论】:

  • 你用过 html_nodes('a [href]') 吗?并且不确定 r 但您可能无法在响应头中获得链接。

标签: r web-scraping xpath css-selectors rvest


【解决方案1】:

使用 xpath,也许 //a[@rel] 会有所帮助(它会选择所有具有 rel 属性的 a 元素)。

【讨论】:

    猜你喜欢
    • 2021-06-09
    • 2023-03-12
    • 1970-01-01
    • 2017-09-13
    • 2016-05-16
    • 1970-01-01
    • 2010-09-21
    • 2021-01-05
    • 1970-01-01
    相关资源
    最近更新 更多