【问题标题】:Mass URL parameter cleanup from txt file从 txt 文件中清除大量 URL 参数
【发布时间】:2017-01-29 17:00:33
【问题描述】:

我有一个类似的 url 列表文件

    Www.dell.com/any=abc&anyone=bcd
    Www.google.co.in 
    Www.yahoo.com/abc=fgh

然后我想清理一下,因为它们只显示等号 = 之前的数据。例如,上面显示的行应该输出

Www.dell.com/any=
Www.dell.com/any=abc&anyone=
Www.google.co.in 
Www.yahoo.com/abc=

在 python 或 bash 等中对代码清理有任何脚本建议吗?

【问题讨论】:

  • 等号对于查询字符串很重要,并且那些带有问号。目前尚不清楚您的最终目标是什么,但将键和值分开似乎是个坏主意

标签: python bash curl wget


【解决方案1】:

使用正则表达式逐行编写脚本,该正则表达式仅将标记 #1 添加到结果文件中

正则表达式获取一行的所有内容,直到第一个 =

^([^=]*=)

编辑您的第二个带有多个参数的示例与文本不完全匹配,我专注于您的文本以在 FIRST = 之后删除所有内容 否则将 [^=] 替换为 .得到所有东西直到最后=

【讨论】:

    【解决方案2】:

    您可以像在 Python 中那样循环并剥离行。

    for l in urls:
        print l.split('=')[0]
    

    【讨论】:

      【解决方案3】:
      url = re.sub(r'^(.*?=).*$', r'\1', url)
      

      这将为您提供 url,直到第一个“=”。去除那个 ”?”标记以获取 URL,直到最后一个“=”。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2020-09-29
        • 1970-01-01
        • 1970-01-01
        • 2021-11-13
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-07-18
        相关资源
        最近更新 更多