【问题标题】:Predict Value Not In Data Set预测不在数据集中的值
【发布时间】:2018-12-05 14:41:30
【问题描述】:

鉴于我有训练和测试数据,可能缺少逻辑序号。是否可以推断出一个不存在的值?

例如: 训练/测试数据具有为标签指定的值 1、2、3、4、5...7、8、9、10。

是否有可能基于数据模型,即使在训练或测试数据中没有发生这种情况的实例,它也可以预测结果为 6?

我是机器学习的新手,并且已阅读有关监督/非监督学习的内容。很难找到一个明确的答案,因为对于我不熟悉的领域很难找到正确的术语。

最好在数据集中创建一个包含不存在的标签值的任意行吗?

使用 ML.net。

抱歉,如果这是一个简单的问题。

谢谢

【问题讨论】:

    标签: machine-learning classification ml.net


    【解决方案1】:

    您的问题是关于确定性与概率性的方法吗?我不明白为什么你应该使用机器学习,但尝试阅读马尔可夫链:

    https://en.wikipedia.org/wiki/Markov_chain

    【讨论】:

    • 嗨阿拉诺,我的问题对于一组不同的变量/特征是确定性的。我将根据重点领域创建几个模型。每个重点领域都会有我开始引入更多变量的阶段。对于一个标签/分数,这些一起有望给我一个概率结果。我开始训练和测试具有大量变量/特征的模型,发现它对预测来说太混乱了——这是否过度拟合?相反,我的目标是根据较小的部分创建一个更大的图景,并可能对这些进行加权。谢谢。
    【解决方案2】:

    分类问题中,“标签”是“真实类”的索引。如果训练数据集中没有示例属于“6”类,则学习模型将永远不会预测 6 类:它被教导永远不会这样做。

    回归问题中,“标签”是“要预测的数量”(一个实数)。在这种情况下,模型预测它在训练时没有看到的值是很正常的:模型可能预测 6、5.7 或 6.1 等。

    如果没有更多细节,我无法判断您是在解决分类问题还是回归问题。

    【讨论】:

    • 这是一个分类问题,desertnaut 出于某种我不知道的原因删除了部分标题。最初的标题是:机器学习 - 分类 - 预测不在数据集中的值。但这可能会破坏一些房子。谢谢Zruty,除非有先例,否则分类似乎会失败。我认为使用回归模型会更合适,我认为回归模型更多的是关于接下来会发生什么。我的目标是找到基于整数的预测结果。我可以将预测分数四舍五入到最接近的值,但也可以考虑
    【解决方案3】:

    我解决或实际上缓解缺乏价值的方法是执行以下操作。对于需要顺序的每种输入数据类型 - 没有间隙,我只使用我的数据集中的数据/行,其中有一个完整的序列,跨越所有条目。

    给定以下:0,1,2,3,4,5,6,7,9

    我只使用符合所有条目中最大可用序列的数据。 0 - 7。这可能会导致训练模型的一些数据丢失,但由于数据相当一致,因此很少有遗漏。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-07-29
      • 2020-01-06
      • 2019-04-02
      • 2023-03-19
      • 1970-01-01
      • 1970-01-01
      • 2016-02-22
      • 1970-01-01
      相关资源
      最近更新 更多