【发布时间】:2020-02-05 06:28:30
【问题描述】:
我有数百个 TXT 文件,其中包含许多内容和一些下载链接。
下载链接的样式是这样的:
开头: http://
和
以: .nc
结尾为了您的方便,我创建了一个示例文本文件,您可以从此链接下载:
https://www.dropbox.com/s/5crmleli2ppa1rm/textfile_including_https.txt?dl=1
基于Stackoverflow中的这个话题,我尝试从文本文件中提取所有下载链接:
Extract websites links from a text in R
这是我的代码:
download_links <- readLines(file.choose())
All_my_links <- gsub(download_links, pattern=".*(http://.*nc).*", replace="\\1")
但它也返回所有行,而我只想提取以 .nc 结尾的 http 链接
结果如下:
head(All_my_links )
tail(All_my_links )
> head(All_my_links )
[1] "#!/bin/bash"
[2] "##############################################################################"
[3] "version=1.3.2"
[4] "CACHE_FILE=.$(basename $0).status"
[5] "openId="
[6] "search_url='https://esgf-node.llnl.gov/esg-search/wget/?distrib=false&dataset_id=CMIP6.HighResMIP.MIROC.NICAM16-9S.highresSST-present.r1i1p1f1.day.pr.gr.v20190830|esgf-data2.diasjp.net'"
> tail(All_my_links )
[1] "MYPROXY_STATUS=$HOME/.MyProxyLogon"
[2] "COOKIE_JAR=$ESG_HOME/cookies"
[3] "MYPROXY_GETCERT=$ESG_HOME/getcert.jar"
[4] "CERT_EXPIRATION_WARNING=$((60 * 60 * 8)) #Eight hour (in seconds)"
[5] ""
[6] "WGET_TRUSTED_CERTIFICATES=$ESG_HOME/certificates"
我的代码有什么错误?
任何评论将不胜感激。
【问题讨论】:
-
我好几天都在跟踪这样一个神秘的东西。直到我发现一些隐藏的角色把它炸毁了。只是一个想法。
-
您的代码没有问题。您只是没有任何匹配的数据。
-
感谢你们两位的cmets。实际上,我在文本文件中有匹配的数据。但是,它仍然无法正常工作。