【问题标题】:the interaction of wordlist and top features selected based on weights词表和基于权重选择的顶级特征的交互
【发布时间】:2016-09-08 02:31:57
【问题描述】:

在一个文本分类案例的训练过程中,process documentmodule 生成的词表长度约为 15000 个词。另一方面,我应用了特征选择模块,即weight by information gainselect by weight来选择前500个特征。词表和选定的权重都被存储。有什么方法可以将生成的 500 个权重应用于词表并构建短词表,它与 500 个权重完全匹配。换句话说,我想要原始词表(大约 15000 个词)和前 500 个特征(或基于 的前 500 个词)的交集。

下面显示了我正在使用的脚本。存储的权重(用红色圈出)是两列,第一列是单词(属性),第二列是对应的权重值。基于此,我们可以选择前 500 名或任何其他顶级特征。原始词表(红色圈出)可以有 15000 个词,一个有 15000 行的矩阵。

我的问题是如何根据排名权重对象生成过滤后的词表对象。

我已经在Rapidminer forum 上发布了这个问题。请关注那里的更新。

【问题讨论】:

    标签: rapidminer


    【解决方案1】:

    您应该发布一个代表流程。如果没有,很难提供帮助,但我的观点是,您可以使用 500 字的示例集并再次对其进行处理以从中制作单词列表。

    【讨论】:

    • 我已根据您的建议更新了我的原始帖子。
    • 我在 RapidMiner 论坛上回答了这个问题。值得链接到此,以便其他人受益。
    • 谢谢,链接已包含在原帖中。
    猜你喜欢
    • 2020-10-28
    • 2011-01-10
    • 1970-01-01
    • 2014-09-20
    • 2013-11-08
    • 1970-01-01
    • 2016-02-25
    • 1970-01-01
    • 2021-07-26
    相关资源
    最近更新 更多