【发布时间】:2021-05-27 16:25:52
【问题描述】:
在我的数据巨大的 .csv 数据框中,我通过 cmd 合并了 100 多个 csv。这包括标题。现在,我希望从 R 中的主 csv 中删除以下重复的标题:
Year|RecID|ParID|ConParID|Country|Division|RegCnty|RegDist|SubDist|RC|RD|RSD|Parish|Area|Part|Population|MalePop|FemalePop|NoOfInstit|InstitPop|ParType|Censusref|ImageRef|PageType|DocType|EnuDist|BuildType|BTCode|NoOfRooms|NoOfRoomsCode|Schedule|H|Absent|Absentcode|HSS|InstName|InstDesc|VessName|VessPos|PID|Sex|SexInf|Age|Cage|AgeInf|Cond|Mar|MarInf|Relat|Rela|RelInf|HeadInf|Occ|HollerOcc|Occode|HISCO|Industry|HollerInd|Employ|EmployCode|AtHome|Inactive|Disab|DisCode1|DisCode2|Bpstring|BpCmty|Std_Par|BpCnty|Cnti|Alt_Cnti|BpCtry|Ctry|Alt_Ctry|HollerB|Nationality|Lang|Langcode|YearsMar|MarYear|ChildTot|ChildAlive|ChildDead|ChildrenCode|HHD|H_Sex|H_Age|H_Rela|H_Mar|H_Occ|H_CFU|SameName|CFU|n_CFUs|tn_CFUs|CFUsize|Spouse|Father|Mother|f_Off|m_Off|m_Offm|f_Offm|Offsp|Kids|Relats|Inmates|Servts|Non_Rels|Visitors|Military
此标头出现的次数与初始 csv 文件的出现次数一样多,而不是定期出现。如何选择包含此标题的所有行以将其包含在以下代码中:
myData <- myData[-c(...)]
任何帮助表示赞赏或其他替代解决方案。这是大数据,所以我无法在 excel 中打开和删除重复项。
【问题讨论】:
-
最好不要一开始就阅读它们。例如,
read.csv具有header参数。在线文档中的详细信息。 -
我有数百个文件,名称如 8721dnis843284,这将花费大量的时间和精力来编译......不过我会调查一下。但我认为我采取的方法是最简单的解决方案......
-
你还有那些 100+ csv 吗?不要使用 cmd 合并它们,而是在 R 中完成所有操作,请参阅这篇文章:stackoverflow.com/q/11433432/680068
-
获取列表中的文件名。
list.files?然后bind_rows(lapply, fileList, read.csv, header=TRUE)或类似的。