【发布时间】:2013-12-16 04:23:45
【问题描述】:
我有大约 10 GB 的文本,我根据词袋模型从中提取特征。问题是特征空间的维度非常高(100 万个单词),我不能根据每个单词的计数来丢弃单词,因为出现次数最多和最少的单词对于模型表现得更好都很重要。有哪些不同的策略可以减少训练数据的大小和特征数量,同时仍然保持/改进模型性能?
编辑:
由于过度拟合和训练时间,我想减少训练数据的大小。我使用 FastRank(Boosted trees) 作为我的 ML 模型。我的机器有一个核心 i5 处理器,运行 8GB RAM。训练实例的数量约为 700-8 亿。除了处理之外,模型的训练还需要一个多小时。我目前对训练和测试数据进行随机抽样,以便将大小减少到700MB左右,以便模型的训练在几分钟内完成。
【问题讨论】:
-
您的模型需要字数统计吗?也许一个带有位集的简单二进制模型可能就足够了,每个向量大约 125kb。
标签: machine-learning nlp text-processing statistics