【问题标题】:Web Scraping using Rvest on a Tennis table from Wiki在 Wiki 的网球桌上使用 Rvest 进行网页抓取
【发布时间】:2016-08-19 09:35:34
【问题描述】:

在这里,我是 R 的初学者。我正在尝试了解有关 rvest 以及如何从网络上抓取的更多信息。这是 wiki 页面 (https://en.wikipedia.org/wiki/Andy_Murray),下面是我要转移到 R 的表格。

使用 CSS 选择器,我发现特定表格位于“.wikitable”上。按照其他网页上的一些教程,这是我使用的代码:

library(rvest)
tennis <- read_html("https://en.wikipedia.org/wiki/Andy_Murray")
trial <- tennis %>% html_nodes(".wikitable") %>% html_table(fill = T)
trial

我无法将结果隔离到我想要的表中。有人可以教我怎么做吗?另一件事,管道做什么(%>%)?

【问题讨论】:

    标签: r web-scraping rvest


    【解决方案1】:

    你快到了。你提取的是一个列表。要获得所需的元素,您需要使用索引:

    trial[[2]]
    

    要进一步清洁它,请使用:

    df <- trial[[2]]
    df <- df[-1,]
    df[,17:20] <- NULL
    

    %&gt;% 被称为 magrittr/dplyr 包中的管道。更多信息here.

    【讨论】:

      猜你喜欢
      • 2019-10-11
      • 2018-02-15
      • 2018-10-27
      • 2015-09-06
      • 1970-01-01
      相关资源
      最近更新 更多