【问题标题】:Amazon Machine Learning with Categorical Attributes - Limitations具有分类属性的 Amazon 机器学习 - 限制
【发布时间】:2017-03-19 06:42:40
【问题描述】:

我正在使用回归模型从一组 120 个属性中预测数值。其中 7 个属性是分类的,但最大的类别有大约 90,000 个唯一值。我正在使用大约 100 万行数据进行训练。

但是,当我查看数据源摘要中的分类属性时,我可以看到这些属性最多显示 5000 个唯一值。这是 AWS 机器学习正在实施的某种限制,它会影响我的模型的准确性,还是只是摘要显示的限制?

此外,我突出显示了最常见的类别结果,其中空白显示为最常见的值。 (这可能是因为我的 CSV 包含引号,因此是有效值)AWS ML 是否忽略分类元素的空白条目?或者我应该用 UUID/随机字符串填充缺失的分类值,以便一个共同的共享“空白”值不会扭曲预测。

我了解某些机器学习模型会保留一个备用神经元,以便在输入新的(以前在训练中未见过的)分类值进行预测时使用。 AWS 机器学习是这种情况吗?

我是 ML 新手,如果我的问题很愚蠢,或者我的方法/假设是错误的,非常抱歉。在询问之前我确实扫描了 AWS 文档。

谢谢。

【问题讨论】:

  • 你使用了大量的属性,所以很明显没有科学的属性选择推理,我们把所有的属性都放在没有属性选择*的情况下进行学习。某些属性可能对学习没有意义或导致反向学习,还有可能没有捕捉到相关属性。我可以看到相关因子非常低,大约在 0.5 左右。即使是专家在使用大数据时也会忽略这方面。使用 PCA 改进网络,没有多余的神经元,所有输入数据都收敛到训练好的输出

标签: neural-network amazon-machine-learning


【解决方案1】:

使用这么多类别值通常没有多大意义,并且只会使用最高值,因为其他较小的类别没有太大的预测能力。

这些类别与目标的相关性非常高,这有点可疑。但如果该模型与他们配合得很好,我就不会太担心。您可以尝试在没有它们的情况下构建模型,看看它是否有任何区别,但我不会在选择特征上付出太多努力,而更多的是在添加更多潜在特征上。

【讨论】:

  • 谢谢。是的,我想用唯一“描述”这些类别的数字属性替换分类属性。我将比较两个输出。我只是想知道我在使用 AWS 时遇到了哪些限制。你知道 AWS ML 是否有使用最“有用”的 5000 个分类值的硬性限制……或者你只是在谈论机器学习的一般工作原理吗?许多分类值。?
猜你喜欢
  • 1970-01-01
  • 2016-10-09
  • 2020-05-04
  • 2023-04-04
  • 2021-04-14
  • 1970-01-01
  • 2020-07-23
  • 2017-07-01
  • 2011-10-04
相关资源
最近更新 更多