【发布时间】:2017-11-18 01:41:47
【问题描述】:
我使用以下简单的IsolationForest 算法来检测给定数据集X 的20K 样本和16 特征的异常值,我运行以下代码
train_X, tesy_X, train_y, test_y = train_test_split(X, y, train_size=.8)
clf = IsolationForest()
clf.fit(X) # Notice I am using the entire dataset X when fitting!!
print (clf.predict(X))
我得到了结果:
[ 1 1 1 -1 ... 1 1 1 -1 1]
这个问题是:在适合IsolationForest 时使用整个数据集X 或仅使用train_X 在逻辑上是否正确?
【问题讨论】:
标签: machine-learning scikit-learn outliers