【发布时间】:2017-07-12 16:09:03
【问题描述】:
我试图爬取 Kickstarter。但是,当我尝试获取引用项目的 URL 时,我没有得到结果。
这应该是结果之一:
这是我的代码:
代码:
main.page1 <- read_html(x ="https://www.kickstarter.com/discover/advanced?
category_id=1&sort=end_date&seed=2498921&page=1")
urls1 <- main.page1 %>% # feed `main.page` to the next step
html_nodes(".block.img-placeholder.w100p") %>% # get the CSS nodes
html_attr("href") # extract the URLs
有人知道我哪里出错了吗?
【问题讨论】:
-
看起来页面使用 Ajax 来填充详细信息 - 加载时 .img-placeholder div 是空的(而且似乎也没有 .block 类)。见
html_nodes(main.page1,"div.img-placeholder") -
@Spacedman 你知道如何将这些脚本放入 R 中的数据框中吗?
-
实际上看起来占位符是从另一个 div 的“data-project”属性中填充的……等等……,
标签: r web-scraping screen-scraping scrapy-spider kickstarter