【问题标题】:What are the different strategies for detecting noisy data in a pile of text?检测一堆文本中的噪声数据有哪些不同的策略?
【发布时间】:2013-12-16 04:23:45
【问题描述】:

我有大约 10 GB 的文本,我根据词袋模型从中提取特征。问题是特征空间的维度非常高(100 万个单词),我不能根据每个单词的计数来丢弃单词,因为出现次数最多和最少的单词对于模型表现得更好都很重要。有哪些不同的策略可以减少训练数据的大小和特征数量,同时仍然保持/改进模型性能?
编辑: 由于过度拟合和训练时间,我想减少训练数据的大小。我使用 FastRank(Boosted trees) 作为我的 ML 模型。我的机器有一个核心 i5 处理器,运行 8GB RAM。训练实例的数量约为 700-8 亿。除了处理之外,模型的训练还需要一个多小时。我目前对训练和测试数据进行随机抽样,以便将大小减少到700MB左右,以便模型的训练在几分钟内完成。

【问题讨论】:

  • 您的模型需要字数统计吗?也许一个带有位集的简单二进制模型可能就足够了,每个向量大约 125kb。

标签: machine-learning nlp text-processing statistics


【解决方案1】:

我不完全确定这是否会对您有所帮助,因为我不知道您的研究是关于什么的,但是如果有一种合乎逻辑的方法可以将 10Gigs 的文本(分成文档或段落)划分为可能,您可以尝试TF-IDF。 http://en.wikipedia.org/wiki/Tf%E2%80%93idf

这将允许您丢弃在所有分区中经常出现的单词,并且通常(理解是)它们不会对整个文档/段落等贡献显着价值。

如果您的唯一要求是保留最常用和最不常用的词 - 词频的标准分布会有所帮助吗?摆脱平均值和 1 个标准偏差(或您认为合适的任何数字)。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-02-26
    • 2012-05-08
    • 2015-10-14
    • 1970-01-01
    • 2020-03-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多