【问题标题】:iPhone - Reg Exp for url validityiPhone - 网址有效性的正则表达式
【发布时间】:2011-09-02 12:45:19
【问题描述】:

我有一个聊天视图,用户可以在其中互相发送网址。 如果是 url,我想让用户按下链接并打开网页视图。

我正在使用 IFTweetLabel,它使用 RegexKitLite。 目前唯一可用的支持是 url 是否以 http/https 开头。 我想支持没有 http 的链接,例如:www.nytimes.com,甚至没有“www”,nytimes.com。 (以及许多其他扩展)。

这是 http/s 前缀 reg exp :

@"([hH][tT][tT][pP][sS]?:\\/\\/[^ ,'\">\\]\\)]*[^\\. ,'\">\\]\\)])

谁能告诉我我需要回答我的其他要求的其他正则表达式。

我尝试使用 This 之一,但将其添加到目标 c 代码会产生很多问题。

谢谢

【问题讨论】:

    标签: iphone objective-c regex ios4 regexkitlite


    【解决方案1】:

    这将匹配 http://example.org 和 www.example.org。

    @"(([hH][tT][tT][pP][sS]?:\\/\\/|www\\.)[^ ,'\">\\]\\)]*\\.[^\\. ,'\">\\]\\)]{2,6})
    

    虽然我添加了一个“匹配组”,但请检查 RegExp 返回的匹配/搜索结果,以便将正确的参数重新插入正确的位置。

    如果你能把整个代码sn-p贴出来,那就更容易了。

    正则表达式解释:

    (
        (
            [hH][tT][tT][pP][sS]?:\/\/    # Match HTTP/http (and hTtP :)
            |                             # OR
            www\.                         # www<literal DOT>
        )
        [^ ,'\">\]\)]*                    # Match at least 1 character that are not any of space, comma, apostrophe, quotation mark, "more than", "right square bracket", "right parenthese"
        \.                                # Match <literal DOT>
        [^\. ,'\">\]\)]{2,6}              # Match 2-6 characters that are not any of dot, space, comma, apostrophe, quotation mark, "more than", "right square bracket", "right parenthese"
    )
    

    【讨论】:

    • 太棒了,现在没有“www”的 example.org 呢?
    • 另一件事,在您提供的 reg exp 中,像“www.example”这样的字符串仍然有效,即使它不是真正有效的。我也不想要那样。您可以将这两个要求也添加到 reg exp 中吗?谢谢!
    • 那真的很复杂。如果你时间不短,我建议你去regular-expressions.info/tutorial.html。这样您就可以使 RegExp 完全满足您的需求。
    • 哦,真的吗?我不能以某种方式强制它以 .com/.net/.org/.edu 等结尾吗?我不介意手动添加所有选项。如果我能做到这一点,同时将“www”设为可选,那正是我所需要的。谢谢
    • 看起来好多了...你能解释一下你做了什么吗?我很好奇最后的 {2,6} 部分。我很好奇您是否可以为我提供另一个将后缀强制为 .com 或 .net 等的 reg(我当然会手动添加所有这些) - 一个不必成为一部分的 reg exp你已经给我的那个。无论如何,非常感谢,您的回答已被默认接受!
    【解决方案2】:

    以下是John Grubers URL Matching Regex

    (?i)\b(?:[a-z][\w-]+:(?:/{1,3}|[a-z0-9%])|www\d{0,3}[.]|[a-z0-9.\-]+[.][a-z]{2,4}/)(?:[^\s()<>]+|\(([^\s()<>]+|(\([^\s()<>]+\)))*\))+(?:\(([^\s()<>]+|(\([^\s()<>]+\)))*\)|[^\s`!()\[\]{};:'".,<>?«»“”‘’])
    

    以下是我通过混合我周围的一些其他正则表达式和一大块 Grubers 正则表达式得出的一个正则表达式:

    (?i)\b(?:(?:[a-z][\w\-]+://(?:\S+?(?::\S+?)?\@)?)|(?:(?:[a-z0-9\-]+\.)+[a-z]{2,4}))(?:[^\s()<>]+|\((?:[^\s()<>]+|(?:\([^\s()<>]*\)))*\))*(?<![\s`!()\[\]{};:'".,<>?«»“”‘’])
    

    以下是一个示例程序,它通过 RegexKitLite 演示每个正则表达式与示例文本的匹配内容:

    你看到了吗 http://www.stackoverflow.com?要么 http://www.stackoverflow.com/?

    然后有 www.stackoverflow.com/,以及 www.stackoverflow.com/index.

    可能类似于 stackoverflow.com 有额外的 stackoverflow.com?要么 “stackoverflow.com”?

    也许是jobs.stackoverflow.com,或者 'http://twitter.com/#!/CHOCKENBERRY', 大锁!!

    文件 @file:///Users/johne/rkl/rkl.html#RegexKitLiteCookbook?

    也许 http://www.yahoo.com/index///i.htmlhttp://www.yahoo.com/////xyz.html?!

    代码:

    #import <Foundation/Foundation.h>
    #import "RegexKitLite.h"
    
    int main(int argc, char *argv[]) {
      NSAutoreleasePool *pool = [[NSAutoreleasePool alloc] init];
    
      NSString *urlRegex = @"(?i)\\b(?:(?:[a-z][\\w\\-]+://(?:\\S+?(?::\\S+?)?\\@)?)|(?:(?:[a-z0-9\\-]+\\.)+[a-z]{2,4}))(?:[^\\s()<>]+|\\((?:[^\\s()<>]+|(?:\\([^\\s()<>]*\\)))*\\))*(?<![\\s`!()\\[\\]{};:'\".,<>?«»“”‘’])";
    
      // John Gruber's URL matching regex from http://daringfireball.net/2010/07/improved_regex_for_matching_urls
      NSString *gruberURLRegex = @"(?i)\\b(?:[a-z][\\w-]+:(?:/{1,3}|[a-z0-9%])|www\\d{0,3}[.]|[a-z0-9.\\-]+[.][a-z]{2,4}/)(?:[^\\s()<>]+|\\(([^\\s()<>]+|(\\([^\\s()<>]+\\)))*\\))+(?:\\(([^\\s()<>]+|(\\([^\\s()<>]+\\)))*\\)|[^\\s`!()\\[\\]{};:'\".,<>?«»“”‘’])";
    
      NSString *urlString = @"Did you see http://www.stackoverflow.com?  Or http://www.stackoverflow.com/?\n\nAnd then there is www.stackoverflow.com/, along with www.stackoverflow.com/index.\n\nMaybe something like stackoverflow.com with extra stackoverflow.com?  Or \"stackoverflow.com\"?\n\nPerhaps jobs.stackoverflow.com, or 'http://twitter.com/#!/CHOCKENBERRY', the CHOCKLOCK!!\n\nFile @file:///Users/johne/rkl/rkl.html#RegexKitLiteCookbook?\n\nMaybe http://www.yahoo.com/index///i.html!  http://www.yahoo.com/////xyz.html?!";
    
      NSLog(@"String :\n\n%@\n\n", urlString);
    
      NSLog(@"Matches: %@\n", [urlString componentsMatchedByRegex:urlRegex]);
    
      NSLog(@"Gruber URL Regex Matches: %@\n", [urlString componentsMatchedByRegex:gruberURLRegex]);
    
      [pool release]; pool = NULL;
      return(0);
    }
    

    编译:

    shell% gcc -o url url.m RegexKitLite.m -framework Foundation -licucore
    

    运行时:

    shell% ./url
    2011-05-27 20:32:58.204 url[25520:903] String :
    
    Did you see http://www.stackoverflow.com?  Or http://www.stackoverflow.com/?
    
    And then there is www.stackoverflow.com/, along with www.stackoverflow.com/index.
    
    Maybe something like stackoverflow.com with extra stackoverflow.com?  Or "stackoverflow.com"?
    
    Perhaps jobs.stackoverflow.com, or 'http://twitter.com/#!/CHOCKENBERRY', the CHOCKLOCK!!
    
    File @file:///Users/johne/rkl/rkl.html#RegexKitLiteCookbook?
    
    Maybe http://www.yahoo.com/index///i.html!  http://www.yahoo.com/////xyz.html?!
    
    2011-05-27 20:32:58.211 url[25520:903] Matches: (
        "http://www.stackoverflow.com",
        "http://www.stackoverflow.com/",
        "www.stackoverflow.com/",
        "www.stackoverflow.com/index",
        "stackoverflow.com",
        "stackoverflow.com",
        "stackoverflow.com",
        "jobs.stackoverflow.com",
        "http://twitter.com/#!/CHOCKENBERRY",
        "file:///Users/johne/rkl/rkl.html#RegexKitLiteCookbook",
        "http://www.yahoo.com/index///i.html",
        "http://www.yahoo.com/////xyz.html"
    )
    2011-05-27 20:32:58.213 url[25520:903] Gruber URL Regex Matches: (
        "http://www.stackoverflow.com",
        "http://www.stackoverflow.com/",
        "www.stackoverflow.com/",
        "www.stackoverflow.com/index",
        "http://twitter.com/#!/CHOCKENBERRY",
        "file:///Users/johne/rkl/rkl.html#RegexKitLiteCookbook",
        "http://www.yahoo.com/index///i.html",
        "http://www.yahoo.com/////xyz.html"
    )
    

    编辑 2011/05/27: 对正则表达式进行了细微更改,以解决与 ( ) 括号不正确匹配的问题。

    编辑 2011/05/27: 发现上面的正则表达式不能很好地处理一些额外的极端情况。更新正则表达式:

    (?i)\b(?:[a-z][\w\-]+://(?:\S+?(?::\S+?)?\@)?)?(?:(?:(?<!:/|\.)(?:(?:[a-z0-9\-]+\.)+[a-z]{2,4}(?![a-z]))|(?<=://)/))(?:(?:[^\s()<>]+|\((?:[^\s()<>]+|(?:\([^\s()<>]*\)))*\))*)(?<![\s`!()\[\]{};:'".,<>?«»“”‘’])
    

    ... 作为 Obj-C 字符串:

    @"(?i)\\b(?:[a-z][\\w\\-]+://(?:\\S+?(?::\\S+?)?\\@)?)?(?:(?:(?<!:/|\\.)(?:(?:[a-z0-9\\-]+\\.)+[a-z]{2,4}(?![a-z]))|(?<=://)/))(?:(?:[^\\s()<>]+|\\((?:[^\\s()<>]+|(?:\\([^\\s()<>]*\\)))*\\))*)(?<![\\s`!()\\[\\]{};:'\".,<>?«»“”‘’])";
    

    OP 还询问如何确保尾随 TLD 是“有效的”。这是相同的正则表达式,采用 Obj-C 字符串形式,所有 currently valid TLDs(截至 2011 年 5 月 27 日):

    @"(?i)\\b(?:[a-z][\\w\\-]+://(?:\\S+?(?::\\S+?)?\\@)?)?(?:(?:(?<!:/|\\.)(?:(?:[a-z0-9\\-]+\\.)+(?:(ac|ad|ae|aero|af|ag|ai|al|am|an|ao|aq|ar|arpa|as|asia|at|au|aw|ax|az|ba|bb|bd|be|bf|bg|bh|bi|biz|bj|bm|bn|bo|br|bs|bt|bv|bw|by|bz|ca|cat|cc|cd|cf|cg|ch|ci|ck|cl|cm|cn|co|com|coop|cr|cu|cv|cx|cy|cz|de|dj|dk|dm|do|dz|ec|edu|ee|eg|er|es|et|eu|fi|fj|fk|fm|fo|fr|ga|gb|gd|ge|gf|gg|gh|gi|gl|gm|gn|gov|gp|gq|gr|gs|gt|gu|gw|gy|hk|hm|hn|hr|ht|hu|id|ie|il|im|in|info|int|io|iq|ir|is|it|je|jm|jo|jobs|jp|ke|kg|kh|ki|km|kn|kp|kr|kw|ky|kz|la|lb|lc|li|lk|lr|ls|lt|lu|lv|ly|ma|mc|md|me|mg|mh|mil|mk|ml|mm|mn|mo|mobi|mp|mq|mr|ms|mt|mu|museum|mv|mw|mx|my|mz|na|name|nc|ne|net|nf|ng|ni|nl|no|np|nr|nu|nz|om|org|pa|pe|pf|pg|ph|pk|pl|pm|pn|pr|pro|ps|pt|pw|py|qa|re|ro|rs|ru|rw|sa|sb|sc|sd|se|sg|sh|si|sj|sk|sl|sm|sn|so|sr|st|su|sv|sy|sz|tc|td|tel|tf|tg|th|tj|tk|tl|tm|tn|to|tp|tr|travel|tt|tv|tw|tz|ua|ug|uk|us|uy|uz|va|vc|ve|vg|vi|vn|vu|wf|ws|xn--0zwm56d|xn--11b5bs3a9aj6g|xn--3e0b707e|xn--45brj9c|xn--80akhbyknj4f|xn--90a3ac|xn--9t4b11yi5a|xn--clchc0ea0b2g2a9gcd|xn--deba0ad|xn--fiqs8s|xn--fiqz9s|xn--fpcrj9c3d|xn--fzc2c9e2c|xn--g6w251d|xn--gecrj9c|xn--h2brj9c|xn--hgbk6aj7f53bba|xn--hlcj6aya9esc7a|xn--j6w193g|xn--jxalpdlp|xn--kgbechtv|xn--kprw13d|xn--kpry57d|xn--lgbbat1ad8j|xn--mgbaam7a8h|xn--mgbayh7gpa|xn--mgbbh1a71e|xn--mgbc0a9azcg|xn--mgberp4a5d4ar|xn--o3cw4h|xn--ogbpf8fl|xn--p1ai|xn--pgbs0dh|xn--s9brj9c|xn--wgbh1c|xn--wgbl6a|xn--xkc2al3hye2a|xn--xkc2dl3a5ee0h|xn--yfro4i67o|xn--ygbi2ammx|xn--zckzah|xxx|ye|yt|za|zm|zw))(?![a-z]))|(?<=://)/))(?:(?:[^\\s()<>]+|\\((?:[^\\s()<>]+|(?:\\([^\\s()<>]*\\)))*\\))*)(?<![\\s`!()\\[\\]{};:'\".,<>?«»“”‘’])";
    

    【讨论】:

    • 这似乎并没有拒绝无效的方案,例如htp://
    【解决方案3】:

    您不想为此使用正则表达式。

    您需要NSDataDetector,它会为您找到所有信息。

    【讨论】:

    • 谢谢,不知道。
    猜你喜欢
    • 1970-01-01
    • 2014-01-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多