【发布时间】:2018-01-03 14:35:34
【问题描述】:
我想使用 R 计算 html 文章中的单词。 像标题这样的抓取数据效果很好,我可以下载文章(下面的代码)。现在我想计算所有这些文章中的单词,例如“默克尔”这个词。
这似乎有点复杂。我能够使它与标题一起使用(将每个标题放入 1 个向量中并计算单词),但那太详细且代码太多(因为如果有超过1 页导致搜索),这就是为什么我不会在这里发布所有代码(我相信这很容易,但那是另一个问题)。
我想我搞砸了,这就是为什么我不能对 html 文章做同样的事情。不同之处在于我直接抓取了标题,但我必须先下载 html 文件。
那么我怎样才能浏览我的 10000 个(这里只有 45 个)html 页面并寻找一些不错的关键字? 一月的例子; 我用这个代码下载文章;
library(xml2)
library(rvest)
url_parsed1 <- read_html("http://www.sueddeutsche.de/news?search=Fl%C3%BCchtlinge&sort=date&dep%5B%5D=politik&typ%5B%5D=article&sys%5B%5D=sz&catsz%5B%5D=alles&time=2015-01-01T00%3A00%2F2015-12-31T23%3A59&startDate=01.01.2015&endDate=31.01.2015")
link_nodes <- html_nodes(url_parsed1, css = ".entrylist__link")
html_links <- html_attr(link_nodes, "href")
getwd()
dir.create("html_articles")
setwd("html_articles")
for (url in html_links) {
newName <- paste (basename(url),".html")
download.file(url, destfile = newName)
}
非常感谢您的帮助!
【问题讨论】:
标签: html r web-scraping