【问题标题】:How do I apply my Random Forest classifier to an unlabelled dataset?如何将我的随机森林分类器应用于未标记的数据集?
【发布时间】:2022-11-30 08:45:31
【问题描述】:

使用 sklearn,我刚刚完成训练、调整超参数并使用 RandomizedSearchCV 测试随机森林多类分类器。我获得了最好的参数,最好的分数等等。这一切都是通过标记的数据集完成的。现在我想将这个分类器应用于未标记的数据集(意味着只有特征而没有类)来进行类/标签预测。

我该怎么做呢?

我还没有尝试任何东西,因为我被卡住了。

【问题讨论】:

  • 请发布您的代码
  • @gtomer 刚刚编辑了它!
  • @johndo 我看到您再次编辑了答案以删除代码。我没有投反对票,但这可能就是为什么你现在有这些投反对票的原因。请注意我的回答是基于this version of your question 中可用的代码。

标签: python scikit-learn classification random-forest


【解决方案1】:

编辑:此答案基于以下版本的问题:https://stackoverflow.com/revisions/74613826/2

您可以使用forest_search.predict(X_test) 方法,它将使用best parameters found in search

【讨论】:

    【解决方案2】:

    或者你可以尝试转到无监督学习方向,尝试其中一种聚类方法(例如KMeans)。

    这是示例:

    from sklearn.cluster import KMeans
    import numpy as np
    X = np.array([[1, 2], [1, 4], [1, 0],
                   [10, 2], [10, 4], [10, 0]])
    kmeans = KMeans(n_clusters=2, random_state=0).fit_predict(X)
    print(kmeans)
    

    这种方法很酷,您可以将聚类后收到的新标签与您之前的随机森林模型的结果进行比较

    【讨论】:

      猜你喜欢
      • 2020-04-27
      • 2015-09-22
      • 2018-02-18
      • 2020-08-16
      • 1970-01-01
      • 2018-05-20
      • 2016-09-07
      • 2018-09-03
      • 2023-04-04
      相关资源
      最近更新 更多