【发布时间】:2021-07-03 06:18:35
【问题描述】:
我正在做一些抓取,但是当我解析大约 4000 个 URL 时,网站最终会检测到我的 IP 并每 20 次迭代阻止我一次。
我已经写了一堆Sys.sleep(5) 和一个tryCatch,所以我不会很快被屏蔽。
我使用 VPN,但我必须不时手动断开连接并重新连接以更改我的 IP。这样的刮刀应该整夜运行,这不是一个合适的解决方案。
我认为轮换代理应该可以完成这项工作。
这是我当前的代码(至少是其中的一部分):
library(rvest)
library(dplyr)
scraped_data = data.frame()
for (i in urlsuffixes$suffix)
{
tryCatch({
message("Let's scrape that, Buddy !")
Sys.sleep(5)
doctolib_url = paste0("https://www.website.com/test/", i)
page = read_html(site_url)
links = page %>%
html_nodes(".seo-directory-doctor-link") %>%
html_attr("href")
Sys.sleep(5)
name = page %>%
html_nodes(".seo-directory-doctor-link") %>%
html_text()
Sys.sleep(5)
job_title = page %>%
html_nodes(".seo-directory-doctor-speciality") %>%
html_text()
Sys.sleep(5)
address = page %>%
html_nodes(".seo-directory-doctor-address") %>%
html_text()
Sys.sleep(5)
scraped_data = rbind(scraped_data, data.frame(links,
name,
address,
job_title,
stringsAsFactors = FALSE))
}, error=function(e){cat("Houston, we have a problem !","\n",conditionMessage(e),"\n")})
print(paste("Page : ", i))
}
【问题讨论】:
标签: r proxy screen-scraping vpn rvest