【发布时间】:2016-09-08 02:31:57
【问题描述】:
在一个文本分类案例的训练过程中,process documentmodule 生成的词表长度约为 15000 个词。另一方面,我应用了特征选择模块,即weight by information gain和select by weight来选择前500个特征。词表和选定的权重都被存储。有什么方法可以将生成的 500 个权重应用于词表并构建短词表,它与 500 个权重完全匹配。换句话说,我想要原始词表(大约 15000 个词)和前 500 个特征(或基于 的前 500 个词)的交集。
下面显示了我正在使用的脚本。存储的权重(用红色圈出)是两列,第一列是单词(属性),第二列是对应的权重值。基于此,我们可以选择前 500 名或任何其他顶级特征。原始词表(红色圈出)可以有 15000 个词,一个有 15000 行的矩阵。
我的问题是如何根据排名权重对象生成过滤后的词表对象。
我已经在Rapidminer forum 上发布了这个问题。请关注那里的更新。
【问题讨论】:
标签: rapidminer