【发布时间】:2015-05-19 14:28:11
【问题描述】:
我有一个文件夹,其中包含旅游评论 .txt 中的许多文档。我想使用词袋方法将它们转换为 C++ 中机器学习的某种数字表示(潜在狄利克雷分配 - LDA),以训练系统识别每个文档的主题。
但不知何故,我不知道如何处理 Bag of Word 算法,而且我听说过一些工具,例如 Scikit-learn。但是 Scikit-learn 在 python 环境中工作。我想知道,是否有一些推荐工具/库可以帮助我解决我的词袋模块?或者是否有 C++ 的 scikit-learn 的 C++ 包装器?
我已经到了不知道该怎么做的水平,不胜感激。谢谢你:)
【问题讨论】:
标签: c++ machine-learning text-processing text-extraction lda