【发布时间】:2017-05-06 06:32:37
【问题描述】:
我有一个带有一些 url 的数据框 df。我想用 stringr 和 str_extract 提取的 URL 中的斜杠中有子类别
我的数据看起来像
Text URL
Hello www.facebook.com/group1/bla/exy/1234
Test www.facebook.com/group2/fssas/eda/1234
Text www.facebook.com/group-sdja/sdsds/adeds/23234
Texter www.facebook.com/blablabla/sdksds/sdsad
我现在想提取 .com/ 和下一个 / 之后的所有内容
我试过suburlpattern <- "^.com//{1,20}//$"
和df$categories <- str_extract(df$URL, suburlpattern)
但我只在 df$categories 中得到 NA
知道我在这里做错了什么吗?这是我的正则表达式代码吗?
非常感谢任何帮助!非常感谢事先。
【问题讨论】:
-
^在正则表达式模式中意味着它只匹配字符串的开头。由于.com不在网址的开头,因此您的模式将不匹配。你可能不需要^。 -
感谢 Amber,但不幸的是,它仍然只给我 NA... 还有其他想法吗?