【发布时间】:2016-12-09 20:39:24
【问题描述】:
我正在从事一个文本多类分类项目,我需要构建文档/术语矩阵并用 R 语言进行训练和测试。
我已经有不适合 R 中基矩阵类的有限维度的数据集,并且需要构建大型稀疏矩阵才能对例如 10 万条推文进行分类。我正在使用 quanteda 包,因为它现在比包 tm 更有用和更可靠,其中使用字典创建 DocumentTermMatrix 会使该过程非常耗内存与小数据集。目前,正如我所说,我使用 quanteda 来构建等效的 Document Term Matrix 容器,稍后我将其转换为 data.frame 来执行训练。
我想知道是否有办法构建如此大的矩阵。我一直在阅读有关允许这种容器的 bigmemory 包,但我不确定它是否可以与 caret 一起用于以后的分类。总的来说,我想了解这个问题并建立一个解决方法,以便能够处理更大的数据集,因为 RAM 不是一个(大)问题(32GB),但我正在尝试找到一种方法来解决这个问题,我感到完全迷失了关于它。
【问题讨论】:
标签: r classification text-mining r-caret quanteda