【问题标题】:Do unsupervised machine learning model features need to be independent?无监督机器学习模型特征是否需要独立?
【发布时间】:2022-12-10 06:22:23
【问题描述】:

我正在训练一个无监督机器学习模型,并希望确保我的功能尽可能有用!

特色无监督机器学习模型是否需要独立?例如,我有一个特征(subscriptionId),它是一个租户内不同云帐户的订阅 Id。我还有一个功能,即订阅中资源的 resourceId

但是,这个resourceId 包含subscriptionId。最好的做法是组合这些特征或删除一个特征(例如subscriptionId)以避免数据集特征之间的依赖和重复?

【问题讨论】:

    标签: machine-learning unsupervised-learning supervised-learning


    【解决方案1】:

    无监督学习本质上比监督学习更难,因为它没有相应的输出。 无监督学习算法的结果可能不太准确,因为输入数据未被标记,并且算法事先不知道确切的输出。

    【讨论】:

    • 这是 ChatGPT 答案吗?因为它对这个问题没有任何意义。
    【解决方案2】:

    对于常用于聚类、关联或降维的无监督学习,特征不需要完全独立,但如果您有许多独特的值,您的模型很可能可以学习区分这些高熵值,而不是学习有趣的或您可能希望的重要事情。

    如果你正在从事生成的无监督模型,对于客户,我无法表达这可能会产生多少风险,用于安全和秘密泄露,适用于 Oracle 云基础设施 (OCI) 客户。生成模型的前提是反刍他们的输入,并且已经写了数千篇关于从训练模型中获取私人信息的论文。


    不清楚是什么问题你正在研究这个问题,这个问题似乎很早就出现了。

    我建议您花时间研究统计和数据科学的局限性,它们是现代流行机器学习方法的基础。

    一旦您知道 ML 可以很好地回答哪些问题,哪些不能,那么您可能会考虑像 fastAI 的课程。

    https://towardsdatascience.com/the-actual-difference-between-statistics-and-machine-learning-64b49f07ea3

    https://www.nature.com/articles/nmeth.4642

    同样,根据输出的使用方式或谁可以查看或(甚至间接地)查询模型,训练私有值似乎是不明智的,尤其是如果您想生成输出。 ML 方法只有在您可以访问大量数据时才有用,如果您可以访问许多用户的数据,那么您需要成为 Oracle 云客户数据的好管家。

    【讨论】:

      猜你喜欢
      • 2014-12-21
      • 2014-04-20
      • 2016-05-28
      • 2013-03-24
      • 1970-01-01
      • 2011-07-21
      • 2017-02-21
      • 2017-08-21
      • 2019-02-20
      相关资源
      最近更新 更多