【发布时间】:2014-09-05 13:38:24
【问题描述】:
我正在使用 Weka 使用 StringToWordVector 类创建术语文档矩阵。但是,无论输入语料库的大小如何,当我使用 R tm 包时,我在输出中只能看到 500 个术语/“num 个属性”,而同一语料库生成 549 个术语。
我尝试更改 wordsToKeep 设置,但这不会影响生成的术语总数。对我来说,似乎有一些默认设置需要更改以增加生成的条款。但是,我没有找到这样的配置。
我正在使用 Weka 3.6.11 和 NGramTokenizer。
如何让 Weka 生成更多条款?
【问题讨论】: