【发布时间】:2015-03-25 03:23:52
【问题描述】:
背景 我正在尝试使用以下数据和规范文档 = 140 000、单词 = 3000 和主题 = 15 来拟合主题模型。我在 Windows 7 机器(ram 24 GB,8 核)。我的问题是计算只会继续进行,而不会产生任何“收敛”。
我在topicmodels 中使用LDA() 函数中的默认选项:
运行模型
dtm2.sparse_TM <- LDA(dtm2.sparse, 15)
该模型已经运行了大约 72 小时 - 我写的时候仍然如此。
问题 所以,我的问题是(a)这是否是正常行为; (b) 如果不是第一个问题,您对做什么有什么建议; (c) 如果第一个问题是肯定的,我怎样才能显着提高计算速度?
附加信息:原始数据包含的不是 3000 个单词,而是大约 370 万个单词。当我(在同一台机器上)运行它时,它并没有收敛,甚至在几周后也没有。所以我用 300 个单词和 500 个文档(随机选择)运行它,但并不是所有的都能正常工作。我对所有模型都使用了与以前相同的主题和默认值。
所以对于我当前的模型(请参阅我的问题),我在 tm 包的帮助下删除了稀疏术语。
删除稀疏词
dtm2.sparse <- removeSparseTerms(dtm2, 0.9)
感谢您提前输入 阿德尔
【问题讨论】:
标签: r machine-learning lda topic-modeling unsupervised-learning