【发布时间】:2018-06-18 18:16:21
【问题描述】:
我正在做一个项目,该项目需要进入与 FTC 相当的巴西数据库并下载一些文件(我将稍后处理),我想使用 R 自动执行此操作。
我的问题是,在给文件命名时,我必须告诉它文件扩展名,我不知道它会是什么(通常会是扫描的pdf,但有时会是html文件)。举个例子:
我想要第一个和第十个文件。下载它们很容易:
download.file("https://sei.cade.gov.br/sei/modulos/pesquisa/md_pesq_documento_consulta_externa.php?DZ2uWeaYicbuRZEFhBt-n3BfPLlu9u7akQAh8mpB9yPDzrBMElK1BGz7u3NcOFP7-Z5s9oDvQR1K4ELVR_nmNlPto_G3CRD_y2Hu6JLvHZVV2LDxnr4dccffqX3xlEao", destfile = 'C:/teste/teste1', mode = 'wb')
download.file("https://sei.cade.gov.br/sei/modulos/pesquisa/md_pesq_documento_consulta_externa.php?DZ2uWeaYicbuRZEFhBt-n3BfPLlu9u7akQAh8mpB9yPaFy5S3krC8lTKjlRbfodOIg2NArJmAFS5PyUEHL3hnJYr8VG9zLGdNts6K99Ht673e_ZPr2gr3Cw7r8zJqRiH", destfile = 'C:/teste/teste2', mode = 'wb')
问题是,我不知道哪个是 pdf 文件,哪个是 html 文件,而无需手动尝试使用另一个程序打开它们。有没有办法告诉 R 在下载时自动添加正确的文件扩展名?
【问题讨论】:
标签: r web-scraping download