【问题标题】:Need to extract URLs from a CSV file - GREP OR FINDSTR ONLY需要从 CSV 文件中提取 URL - 仅限 GREP 或 FINDSTR
【发布时间】:2014-11-14 05:40:48
【问题描述】:
我正在寻找一个单行 GREP 或 FINDSTR 脚本,它将扫描一个包含 4 列 CSV 文件的文件夹并仅提取 URL 并将它们输出到一个文本文件中,每行一个 URL。 URL 的格式是“http://example.com/”我一直在玩这个脚本,但我似乎无法让它输出任何东西
cat filename | grep http | grep -shoP 'http.*?[" >]' > outfilename
【问题讨论】:
标签:
bash
csv
grep
findstr
【解决方案1】:
你可以试试这个:
find BASEDIR -type f -exec grep -oP "\bhttp://[^/]*/" {} \; > OUTFILE
BASEDIR下的文件不需要是CSV文件。
编辑
如果您想要完整的 URL(不是格式“http://example.com/”而是“http://example.com/path”)并假设 CSV 分隔符是“;”,那么
find BASEDIR -type f -exec grep -oP "\bhttp://[^;]*" {} \; > OUTFILE