【问题标题】:Need to extract URLs from a CSV file - GREP OR FINDSTR ONLY需要从 CSV 文件中提取 URL - 仅限 GREP 或 FINDSTR
【发布时间】:2014-11-14 05:40:48
【问题描述】:

我正在寻找一个单行 GREP 或 FINDSTR 脚本,它将扫描一个包含 4 列 CSV 文件的文件夹并仅提取 URL 并将它们输出到一个文本文件中,每行一个 URL。 URL 的格式是“http://example.com/”我一直在玩这个脚本,但我似乎无法让它输出任何东西

cat filename | grep http | grep -shoP 'http.*?[" >]' > outfilename

【问题讨论】:

    标签: bash csv grep findstr


    【解决方案1】:

    你可以试试这个:

    find BASEDIR -type f -exec grep -oP "\bhttp://[^/]*/" {} \; > OUTFILE
    

    BASEDIR下的文件不需要是CSV文件。

    编辑

    如果您想要完整的 URL(不是格式“http://example.com/”而是“http://example.com/path”)并假设 CSV 分隔符是“;”,那么

    find BASEDIR -type f -exec grep -oP "\bhttp://[^;]*" {} \; > OUTFILE
    

    【讨论】:

    • 正则表达式只提取域而不是完整的 URL,询问。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-08-25
    • 1970-01-01
    相关资源
    最近更新 更多