【问题标题】:PySpark regex to filter invalid IPv4 and IPv6 addresses from dataframe columnPySpark 正则表达式从数据框列中过滤无效的 IPv4 和 IPv6 地址
【发布时间】:2022-05-27 16:15:50
【问题描述】:

我在代码中有以下行:

.filter((~f.col(\"DestinationIP\").rlike(\"^([0-9]{1,3})\\\\.([0-9]{1,3})\\\\.([0-9]{1,3})\\\\.([0-9]{1,3})$\")) | 
                            ~f.col(\"DestinationIP\").rlike(\"^([0-9a-fA-F]{1,4}:){7,7}[0-9a-fA-F]{1,4}|([0-9a-fA-F]{1,4}:){1,7}:|([0-9a-fA-F]{1,4}:){1,6}:[0-9a-fA-F]{1,4}|([0-9a-fA-F]{1,4}:){1,5}(:[0-9a-fA-F]{1,4}){1,2}|([0-9a-fA-F]{1,4}:){1,4}(:[0-9a-fA-F]{1,4}){1,3}|([0-9a-fA-F]{1,4}:){1,3}(:[0-9a-fA-F]{1,4}){1,4}|([0-9a-fA-F]{1,4}:){1,2}(:[0-9a-fA-F]{1,4}){1,5}|[0-9a-fA-F]{1,4}:((:[0-9a-fA-F]{1,4}){1,6})|:((:[0-9a-fA-F]{1,4}){1,7}|:)|fe80:(:[0-9a-fA-F]{0,4}){0,4}%[0-9a-zA-Z]{1,}|::(ffff(:0{1,4}){0,1}:){0,1}((25[0-5]|(2[0-4]|1{0,1}[0-9]){0,1}[0-9])\\.){3,3}(25[0-5]|(2[0-4]|1{0,1}[0-9]){0,1}[0-9])|([0-9a-fA-F]{1,4}:){1,4}:((25[0-5]|(2[0-4]|1{0,1}[0-9]){0,1}[0-9])\\.){3,3}(25[0-5]|(2[0-4]|1{0,1}[0-9]){0,1}[0-9])\"))

但我收到此错误消息:

raise ValueError(\'%r 似乎不是 IPv4 或 IPv6 地址\'%
ValueError: \'016301004081\' 似乎不是 IPv4 或 IPv6 地址

如何解决这个问题?我只希望有效的 IPv4 和 IPv6 地址保留在我的列中并过滤掉所有其他行。

  • 你能显示完整的代码吗,似乎异常是由 Python 的 ipaddress 库引发的。

标签: regex dataframe pyspark ipv6 ipv4


【解决方案1】:

您可能应该删除在 Spark 中等同于 NOT~ 符号。

您当前的过滤器保留了哪些行不符合任一条件。如果您有 IPv4,它可能与 IPv6 条件不匹配,因此该值保持不变。 016301004081 也是如此——它不匹配任何条件,所以它仍然存在。

代替:

Keep:
    (NOT IPv4)
    OR
    (NOT IPv6)

改变后你会有

Keep:
    IPv4
    OR
    IPv6

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-01-16
    • 2018-02-27
    • 2014-11-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-10-06
    相关资源
    最近更新 更多