【发布时间】:2016-11-02 23:28:25
【问题描述】:
我正在尝试制作垃圾邮件预测器。我有话要说。
我得到了矩阵,其中列是邮件中出现的单词,结果是垃圾邮件/非垃圾邮件,例如
例子:-
mail thing money dollar spam
0 1 1 1 1
1 0 0 1 0
0 0 1 1 1
等等。 此处的“垃圾邮件”列表示邮件是否为垃圾邮件。
我应该如何删除列总和(仅当垃圾邮件为 0 时)小于特定值(比如说 x)的列?
这样我可以删除检测垃圾邮件根本不需要的术语。
感谢您的帮助!
【问题讨论】:
-
your_matrix[, colSums(your_matrix * your_matrix[, 5]) >= x] -
然而,这是一种非常糟糕的变量选择方法。任何与垃圾邮件相反相关的内容都有信息,但会被删除。
标签: r multiple-columns