【问题标题】:How to train a model with data with only one label如何用只有一个标签的数据训练模型
【发布时间】:2019-10-23 00:10:18
【问题描述】:

我正在尝试建立一个模型来预测网球比赛的结果(获胜或失败),作为练习。我正在使用 Python、Pandas 和 scikit-learn。

我拥有的数据集包含两个玩家 ID 和比赛结果,以及其他数量。 就我而言,数据库的组织方式始终将 Player1 作为获胜者,将 Player2 作为较松者。所以,如果我必须给数据加标签,它总是相同的标签(例如 1)。

你觉得哪个更好:

  1. 尝试使用单值训练序列(例如 1-label SVM)训练模型
  2. 随机打乱数据,以便将某些 Player2 放置为 Player1,反之亦然,从而获得另一个标签(例如 0)?

非常感谢!

【问题讨论】:

    标签: python machine-learning supervised-learning


    【解决方案1】:

    听起来你需要洗牌。您拥有以数据结构编码的固有信息的数据集(玩家 1 获胜)。您无法在运行时重新创建此信息。

    你想要的是一个玩家信息的顺序并不重要的数据集,以及一个确定玩家 1 或玩家 2 获胜的标签 0/1。

    【讨论】:

    • 你可以改变玩家1和玩家2的顺序,玩家2获胜。
    • 您需要的是关于每个玩家的信息,以及在这两个玩家之间的每场比赛中谁是获胜者。 OP 有,但是编码不好。
    • 我看错了@christian 的问题
    • 我仍然认为在这里洗牌没有意义
    • 我的数据集已经有关于每个玩家的信息:第一次服务的百分比、赢得的分数百分比、排名等。因此,赢家在一列而输家在另一列的事实应该似乎没有那么决定性。但是,如果在所有情况下 Player_1 都获胜,这可能会导致与 Player_1 相关的所有参数可能具有更高的权重。我仍然认为数据洗牌是最好的解决方案,但我想确定。感谢您的所有回答!
    猜你喜欢
    • 1970-01-01
    • 2019-04-20
    • 2018-10-23
    • 1970-01-01
    • 2021-07-12
    • 2020-12-15
    • 2013-04-20
    • 2017-05-27
    • 1970-01-01
    相关资源
    最近更新 更多