【发布时间】:2021-03-08 21:23:48
【问题描述】:
我正在运行 gensim LdaMulticore 包,用于使用 Python 进行主题建模。
我试图理解LdaMulticore 中参数的含义,并找到了对参数的使用提供一些解释的网站。作为一个非专家,我很难直观地理解这些。我还参考了网站上的一些其他材料,但我想这个页面对每个参数都有相对完整的解释。
This page
-
chunksize每个训练块中使用的文档数。
->这是否意味着它决定了一次要分析(训练)多少个文档?
更改chunksize号码会产生明显不同的结果吗?还是只影响运行时间?
2.alpha, eta, decay
->我一直在阅读解释,但根本无法理解。
谁能给我一些直观的解释,说明这些是关于什么的/我什么时候需要调整这些?
3.迭代
在推断语料库的主题分布时,通过语料库的最大迭代次数。
->当我将它设置为 n 时,Python 似乎超过了整个语料库的 n 次。所以数字越大,分析的数据越多,但需要的时间越长。
4.随机状态
randomState 对象或生成对象的种子。对重现性有用。
->我见过人们通过放置一个随机数来设置它。但是什么是随机状态呢?
【问题讨论】:
标签: python python-3.x nlp gensim lda