【发布时间】:2023-01-04 01:16:14
【问题描述】:
这是我的数据框的样子......
我 |法斯塔标头 | | ------ | | Zm00001eb122880_P002;Zm00001eb122880_P003;Zm00001eb122880_P005;Zm00001eb336740_P002;Zm00001eb336740_P001| | Zm00001eb031730_P001;Zm00001eb136170_P001 | | Zm00001eb273230_P001;Zm00001eb273230_P002 |
我设法使用下面的代码将列中的分隔字符串变成一行
library(tidyr)
library(dplyr)
without_02473 %>%
mutate(`Fasta headers` = strsplit(as.character(`Fasta headers`), ";")) %>% unnest(`Fasta headers`)
这导致了以下
| Fasta headers |
|---|
| Zm00001eb122880_P002 |
| Zm00001eb122880_P003 |
| Zm00001eb122880_P005 |
| Zm00001eb336740_P002 |
| Zm00001eb031730_P001 |
但是,我希望最终得到以下结果。
|法斯塔标头 |
| ------ |
| Zm00001eb122880 |
| Zm00001eb336740 |
| Zm00001eb031730|
| Zm00001eb273230|
我尝试使用组和过滤器,unnest(string_string_array),但我没有成功。 有人能帮我吗?
【问题讨论】:
标签: r string duplicates