【发布时间】:2021-06-12 06:52:46
【问题描述】:
我正在尝试从this website 中提取四个链接的列表,这些链接明确命名为:
PNADC_012018_20190729.zip
PNADC_022018_20190729.zip
PNADC_032018_20190729.zip
PNADC_042018_20190729.zip
我已经看到它们都是名为“jstree-wholerow”的类的一部分。我不太擅长抓取,但我尝试使用这种规律性来捕获此类链接:
x <- rvest::read_html('https://www.ibge.gov.br/estatisticas/downloads-estatisticas.html?caminho=Trabalho_e_Rendimento/Pesquisa_Nacional_por_Amostra_de_Domicilios_continua/Trimestral/Microdados/2018') %>%
rvest::html_nodes("jstree-wholerow") %>%
rvest::html_text()
但是,我收到了一个空向量作为输出。
有人可以帮忙解决这个问题吗?
【问题讨论】:
-
它们不是链接。它们链接到处理下载数据生成和 ftp 下载的 javascript
-
但是我怎么能提取这些呢?
-
我不确定。可以对其中一个源文件 (servicodados.ibge.gov.br/api/v1/downloads....) 中的一个 API 调用进行逆向工程。或者,使用浏览器自动化(例如 RSelenium)之类的方法,您只需点击相应的元素即可。
-
这是一个有趣的问题。
-
我想这些不是一个真正的选择,因为这是一个包?但是这些不是链接实际上是一个问题吗?在这个阶段,我只想要这些字符串,而不是下载任何东西
标签: r web-scraping rvest