【发布时间】:2016-08-16 11:26:18
【问题描述】:
我想通过不同的搜索从this website 中提取超链接(不要害怕它是丹麦语)。可以在右侧找到超链接(v15、v14、v13 等)[example]。 我试图以某种方式抓取的网站使用来自某种 jquery/javascript 的搜索结果。这是基于我 非常 有限的 HTML 知识,可能是错误的。
我认为这一事实使以下代码无法运行(我使用“rvest”包):
sdslink="http://karakterstatistik.stads.ku.dk/#searchText=&term=&block=&institute=null&faculty=&searchingCourses=true&page=1"
s_link = recs %>%
read_html(encoding = "UTF-8") %>%
html_nodes("#searchResults a") %>%
html_attr("href")
我找到了一种可行的方法,但它需要我手动下载页面,每个页面都使用“右键单击”+“另存为”。然而,这是不可行的,因为我想抓取总共 100 页的超链接。
我尝试将 jsonlite 包与 httr 结合使用,但似乎找不到正确的 .json 文件。
我希望你们可能有一个解决方案,要么让 jsonlite 工作,自动化“另存为”解决方案,要么第三个更聪明的路径。
【问题讨论】:
标签: jquery json r web-scraping