【发布时间】:2018-03-30 21:38:18
【问题描述】:
我想取一些字符串向量,并将向量中找到的单词的频率作为数据框。数据框的列名应该是在所有组合字符串中找到的唯一单词。我有这部分,正是这些词被添加到数据框中的频率让我着迷。这是我正在尝试的一个非常缩小的版本。我曾尝试使用 table(),但我不确定我的方向是否正确。
a <- c('A', 'B', 'C', 'D', 'E')
b <- c('A', 'D', 'J', 'G', 'X')
c <- c('A', 'A', 'B', 'B', 'C', 'X')
示例 Data.Frame 设计
vector.name A B C D E J G X
a 1 1 1 1 1 0 0 0
b 1 0 0 1 0 1 1 1
c 2 2 1 0 0 0 0 1
【问题讨论】:
-
要计算字符串的出现次数,请尝试
sum(grepl("A", c)) -
我用过 grepl,但这对于向量中的每个值来说似乎都非常乏味。我该如何扩展它?
-
似乎我可以使用应用函数树中的一些东西来遍历向量并计算所有单词的频率。但是,如何以正确的格式将结果添加到数据框中?