【问题标题】:Using training data and testing data in a shared task在共享任务中使用训练数据和测试数据
【发布时间】:2018-05-19 13:45:48
【问题描述】:

我正在处理这个共享任务http://alt.qcri.org/semeval2017/task4/index.php?id=data-and-tools

这只是 Twitter 情绪分析。由于我对机器学习还很陌生,我不太清楚如何同时使用训练数据和测试数据。

因此,共享任务提供了两组相同的推特推文,一组没有结果(火车),另一组有结果。

我目前对在机器学习中使用这类数据的理解如下:

  • 训练集:我们应该将其分成训练和测试部分(可能 90% 的训练和 10% 的测试?)

但是单独的测试数据的存在令人困惑。

我们是否应该使用“训练集”的 10% 部分在测试中获得的结果,并将其与“测试集”的实际结果进行比较?

有人可以纠正我的理解吗?

【问题讨论】:

  • 查看答案here; Wikipedia entry 也可能有用。花一些时间来掌握 ML 的基础知识,而不是直接跳到“行动”...
  • 谢谢。在我提供的链接中,它给了我一个没有预期结果的训练集。这是正常的吗?根据您提供的链接,训练集应该具有预期的标签。我的链接提供了一个具有正确标签的单独测试集。我已经阅读了解释,但这与我所阅读的内容有所不同..

标签: machine-learning


【解决方案1】:

在训练机器学习模型时,您正在为算法提供名为 training set 的数据集,在此阶段,您将告诉算法您放入算法的每个样本的基本事实是什么,这样,该算法从您提供给它的每个样本中学习。 training set 通常是整个数据集的 80%,数据集的另外 20% 是 testing set,在这种情况下,您知道每个样本的基本事实是什么,但您让算法预测它认为事实是你让它预测的每个样本。所有对testing set 的预测都是基于算法从你之前输入的training set 中学到的。 在您对 testing set 做出所有预测后,您可以根据实际情况检查模型与模型所做的预测相比的准确度。

【讨论】:

  • 我在问题上的链接也提供了带有正确标签的测试数据,这个单独的测试数据与你提到的数据的 20% 部分有什么不同 testing set ?跨度>
  • @Dawn17 显然,在您上面附加的链接中,他们已经在training settesting set 之间进行了拆分。在每种情况下,为了了解您训练模型的效果如何,您的所有样本都需要有一个正确的标签,您可以检查模型是否做出了良好的预测。
  • 对于training set,正确的标签是为了让算法从中学习,对于testing set,标签是为了检查算法是否做出了好的预测
  • 链接提供的training set 有空标签,这意味着我无法通过将其拆分为 80% 的训练数据和 20% 的测试数据来进行测试。这就是为什么他们为我们提供了一个带有正确标签的单独训练集,并且应该在测试过程中使用它而不是训练数据的 20% 部分。我说的对吗?
  • @Dawn17,我总是很乐意提供帮助,很高兴我回答了你的问题。我还建议遵循一些其他示例和教程,尤其是来自 Kaggle 的。您还可以看到其他一些人的工作,看看他们是如何解决类似问题的
猜你喜欢
  • 2017-02-20
  • 1970-01-01
  • 2021-12-30
  • 2017-06-21
  • 2021-03-14
  • 1970-01-01
  • 1970-01-01
  • 2019-06-16
  • 2021-03-30
相关资源
最近更新 更多