【发布时间】:2016-05-17 13:21:23
【问题描述】:
我有一个大文本文件(50,000 行)我正在尝试从中删除重复项/查找唯一词
CSV 中的行/字符串各不相同,三行可能如下所示:
I like cars
Ford
Cars go fast
我想先将每一行/字符串分开,然后将它们组合起来,这样我就可以从上面得到以下列表:
I
like
cars
Ford
Cars
go
fast
该列表完成后,应该很容易更改每个单词的大小写,然后删除重复项,留下文档中所有单词的唯一列表。
有些行是段落,因此 Excel 无法处理这项工作。我猜paste 和paste(unique()) 可能有用,但我无法使用read.csv 从文档中获取所需格式的单词。
这些段落可能包含标点符号、数字和@等随机字符,因此可能需要先转换字符串。
编辑:
3 种有效的方法,但结果不同,这里是 csv 的链接,任何关于为什么结果不同的见解将不胜感激。
【问题讨论】:
-
您可以执行
unlist(strsplit(x, " ", fixed = TRUE))之类的操作(可能需要在两者之间进行as.character转换。尽管dput的数据可能也很有帮助。 -
我已经设法获得一个包含 25000 个变量的表(其中每个变量是一个可以是单词或段落的字符串)或包含 62 个变量的 530000 个 obs 的表,其中 62是任何段落中最多的单词数(由空格分隔)。
标签: r string list duplicates read.csv