【问题标题】:Text Mining with too much data数据过多的文本挖掘
【发布时间】:2013-09-19 12:12:26
【问题描述】:

我正在尝试使用 R 语言提供的文本挖掘工具,但由于我在一台旧机器上运行,所以我面临以下问题。

我想使用 tm 包和语料库函数创建一个文档术语矩阵。 当我创建 DTM 时,我收到一个可以分配 4GB 内存的错误(我的机器有 2GB 内存)。一般来说,您如何面对这样的问题?例如,在一般应用中,DTM 应该比我的矩阵大得多。有没有办法使用 SQL 数据库而不是使用内存?

//我研究了一篇有关使用 sqldf 库创建临时 sqlite 数据库的相关文章。但在这种情况下,我什至无法创建矩阵。

【问题讨论】:

    标签: r matrix text-mining


    【解决方案1】:

    您一般如何面对这样的问题?

    使用sparse matrix data structure。没有它,文本挖掘几乎是不可能的。有了一个,我可以在几百 MB 中处理 100 到 1000 个文档。

    我自己不在R工作,但它一定有一个稀疏矩阵包。

    【讨论】:

    • 这不是一个真正有用的答案,因为 R 的 tm 包生成的文档术语矩阵已经是一个稀疏矩阵:inside-r.org/packages/cran/tm/docs/as.TermDocumentMatrix
    • @Ben:我明白了。但 OP 的问题是“一般来说,您如何面对这样的问题?”显然这个建议有效,所以也许他们首先创建了一个密集矩阵。
    猜你喜欢
    • 2011-02-07
    • 2012-07-01
    • 1970-01-01
    • 1970-01-01
    • 2012-01-25
    • 1970-01-01
    • 2019-05-05
    • 2013-02-09
    • 1970-01-01
    相关资源
    最近更新 更多