【发布时间】:2018-05-19 13:45:48
【问题描述】:
我正在处理这个共享任务http://alt.qcri.org/semeval2017/task4/index.php?id=data-and-tools
这只是 Twitter 情绪分析。由于我对机器学习还很陌生,我不太清楚如何同时使用训练数据和测试数据。
因此,共享任务提供了两组相同的推特推文,一组没有结果(火车),另一组有结果。
我目前对在机器学习中使用这类数据的理解如下:
- 训练集:我们应该将其分成训练和测试部分(可能 90% 的训练和 10% 的测试?)
但是单独的测试数据的存在令人困惑。
我们是否应该使用“训练集”的 10% 部分在测试中获得的结果,并将其与“测试集”的实际结果进行比较?
有人可以纠正我的理解吗?
【问题讨论】:
-
查看答案here; Wikipedia entry 也可能有用。花一些时间来掌握 ML 的基础知识,而不是直接跳到“行动”...
-
谢谢。在我提供的链接中,它给了我一个没有预期结果的训练集。这是正常的吗?根据您提供的链接,训练集应该具有预期的标签。我的链接提供了一个具有正确标签的单独测试集。我已经阅读了解释,但这与我所阅读的内容有所不同..
标签: machine-learning