【发布时间】:2018-07-14 07:59:03
【问题描述】:
所以我试图在网站上制作一些信息的数据表。这是我到目前为止所做的。
library(rvest)
url <- 'https://uws-community.symplicity.com/index.php?s=student_group'
page <- html_session(url)
name_nodes <- html_nodes(page,".grpl-name a")
name_text <- html_text(name_nodes)
df <- data.frame(matrix(unlist(name_text)), stringsAsFactors = FALSE)
library(tidyverse)
df <- df %>% mutate(id = row_number())
desc_nodes <- html_nodes(page, ".grpl-purpose")
desc_text <- html_text(desc_nodes)
df <- left_join(df, data.frame(matrix(unlist(desc_text)),
stringsAsFactors = FALSE) %>%
mutate(id = row_number()))
email_nodes <- html_nodes(page, ".grpl-contact a")
email_text <- html_text(email_nodes)
df <- left_join(df, data.frame(matrix(unlist(email_text)),
stringsAsFactors = FALSE) %>%
mutate(id = row_number()))
这一直有效,直到我进入电子邮件部分。一些条目没有电子邮件。在数据框中,最后三行显示的是 NA 值,而不是显示电子邮件的 NA 值的相应行。
如何使适当的行显示具有 NA 值,而不仅仅是最后 3 行?
【问题讨论】:
标签: r web-scraping data-science rvest