【发布时间】:2021-04-14 06:56:35
【问题描述】:
我必须清理 R 中的数据表,但我卡在一个点
我正在搜索如何通过保留物种名称的第一部分(在“_”之前并添加“.sp”)来在表格中具体化,如果它不具体的话。
如果我给你一个例子会更好:
我有一张这样的桌子:
reads | species
ST311 | cylindrotheca_closterium
ST311 | cylindrotheca_fusiformis
ST311 | cylindrotheca_fusiformis
ST311 | cylindrotheca_fusiformis
ST311 | cylindrotheca_closterium
ST312 | alexandrium_minutum
ST317 |pseudo.nitzschia_australis
最后,我只需要相同读数和同一属的不同物种,这里以它的 cylindrotheca 为例:对于这个阅读“ST311”的所有物种,输入:“cylindrotheca_sp”。
如果读取是特定的,例如 ST312 用于 alexandrium minutum 和 ST317 用于伪 nitzschia australis 我想保留它。
这是我期望的表:
reads | species
ST311 | cylindrotheca_sp
ST311 | cylindrotheca_sp
ST311 | cylindrotheca_sp
ST311 | cylindrotheca_sp
ST311 | cylindrotheca_sp
ST312 | alexandrium_minutum
ST317 |pseudo.nitzschia_australis
我是这么想的:(我知道它错了......但是有这个想法)
TEST <-prim51test %>%
group_by(read) %>%
if(species > 1){
print == "*_sp"
}
(我有一个包含很多不同物种的大数据集)
我该怎么做?
感谢您的帮助
【问题讨论】:
标签: r database filter selection data-cleaning