【发布时间】:2019-03-10 13:34:09
【问题描述】:
我有一个如下数据集,称为关键字:
输出如下:
逻辑是这样的:
- foldercount 列只不过是 Link 列中的“/”数
- Status 列只有 3 个值,Parent、Child 和 Orphan。
- 如果“链接”列中没有“/s”,则这些关键字的状态将为 - 孤立。
- 对于特定关键字,如果“/s”出现在链接中,并且该特定关键字的文件夹计数最少,则将其称为父级。存在“/s”的任何其他链接都是子链接。父母和孩子应该附加一个数字,这应该有助于我识别特定父母的孩子,例如 child1 是 parent1 的孩子。它可能发生在特定的关键字上,我们根本没有孩子。
我使用了以下代码,但它不符合我的目的:
Keyword$foldercount <- str_count(Keyword$URL, "/")
Keyword$last_char <- str_sub(Keyword$URL, -3,-1)
Keyword$last_char2 <- str_sub(Keyword$URL, -2,-1)
Keyword$isParent <- ifelse(Keyword$last_char == '/s/'| Keyword$last_char2 == '/s','Parent','Child')
Keyword$isParentDerivable <- "No"
h<- grep('/s/', Keyword$URL)
Keyword$isParentDerivable[h] <- "Y"
【问题讨论】:
-
请分享
dput(Keyword)作为样本数据