【发布时间】:2010-10-08 18:51:15
【问题描述】:
我在标有 Keyword.text 的列中有数百万个关键字。每个因素或关键字可以包含多个单词(或者我们应该说令牌)。这是一个包含 4 个关键字的示例
关键字.文本
敏捷的棕色狐狸
.8 .crazy 懒狗
狗
跳过+9
我想统计每个Keyword中的token个数,得到:
关键字长度
5
4
1
4
我安装了 Tau 包,但还没有走多远……
textcnt(Mydf$Keyword.text, split = "[[:space:][:punct:]]+", method = "string", n = 1L)
返回一个我不明白的错误。也许是有因素造成的;练习字符串时效果很好。
我知道如何在 excel 中执行此操作,但它不适用于最后一行。如果 A2 有关键字,那么: =LEN(TRIM(A2))-LEN(SUBSTITUTE(A2," ",""))+1 会做
【问题讨论】:
-
错误:FUN(X[[1L]], ...) 中的错误:非字符参数
标签: r