【发布时间】:2014-03-21 00:19:36
【问题描述】:
我的目标是使用 weka 将一堆推文分类为一组预定义的 3 个类别(例如新闻、教育、体育)
在这种情况下,训练集和测试集是不同的。(训练冗长的网页,只测试一两行推文)。
如何针对这个问题执行 'N' 折交叉验证。
我是否需要混合训练和测试数据集以构成单个文件并应用“n”折交叉验证,或者我是否需要先训练分类器然后对测试集应用“n”折交叉验证韦卡。
我认为后者是有道理的,但我不确定。请帮我解决这个问题。
【问题讨论】:
标签: twitter classification weka text-mining document-classification