【发布时间】:2018-03-05 02:24:58
【问题描述】:
我正在研究随机森林分类器模型,将数据分为 4 类。数据集是来自两个不同防火墙应用程序的串联日志,具有 100K+ 样本和 10 个属性。来自训练集的样本数据集的准确率是 0.90-0.97。
根据测试数据,我从 1 个防火墙获得的日志为 0.7-0.97,而另一个为 ~0.5(始终)。我应该考虑调整射频还是我的模型完全有问题? “Text field1”将被预测。
y,label = pd.factorize(train["Text field1"])
clf=RandomForestClassifier(n_jobs=10,n_estimators=100,max_features=1,max_depth=80)
clf.fit(train[features],y)
pred=clf.predict(test[features])
pred_label=label[pred]
`
我是这方面的初学者,感谢任何帮助。谢谢!
【问题讨论】:
-
您应该期望分类器在训练数据上的工作比在测试数据上更好。您/您尝试过使用哪些参数?你在用
sklearn吗? -
@JeremyMcGibbon 是的,我正在使用 sklearn RF 分类器。我已将我的代码添加到原始帖子中。对于大于 80 的树深度,模型的准确性似乎正在降低,尽管我想知道这是否不是太高的值。 max_features = 1,我似乎得到了最好的结果。这就是为什么我对我的模型有点怀疑的原因。
标签: python performance classification random-forest