【发布时间】:2015-06-25 10:26:21
【问题描述】:
我在提取表单中的 ID 时遇到了一些困难:
27da12ce-85fe-3f28-92f9-e5235a5cf6ac
来自数据框:
a<-c("NAME_27da12ce-85fe-3f28-92f9-e5235a5cf6ac_THOMAS_MYR",
"NAME_94773a8c-b71d-3be6-b57e-db9d8740bb98_THIMO",
"NAME_1ed571b4-1aef-3fe2-8f85-b757da2436ee_ALEX",
"NAME_9fbeda37-0e4f-37aa-86ef-11f907812397_JOHN_TYA",
"NAME_83ef784f-3128-35a1-8ff9-daab1c5f944b_BISHOP",
"NAME_39de28ca-5eca-3e6c-b5ea-5b82784cc6f4_DUE_TO",
"NAME_0a52a024-9305-3bf1-a0a6-84b009cc5af4_WIS_MICHAL",
"NAME_2520ebbb-7900-32c9-9f2d-178cf04f7efc_Sarah_Lu_Van_Gar/Thomas")
基本上是第一个和第二个下划线之间的东西。
通常我会这样处理:
library(tidyr)
df$a<-as.character(df$a)
df<-df[grep("_", df$a), ]
df<- separate(df, a, c("ID","Name") , sep = "_")
df$a<-as.numeric(df$ID)
但是这次有很多下划线......我的方法失败了。有没有办法提取该 ID?
【问题讨论】:
-
您需要 ID 和 NAME 还是只需要 ID?
-
嗨,大卫,姓名是可选的。但是,看看如何提取名称会很棒。
-
NAME的模式是什么,它有什么不同吗? -
变体带有下划线。它通常是大写字母