【问题标题】:bag-of-words approach / tools / library for C++?C++ 的词袋方法/工具/库?
【发布时间】:2015-05-19 14:28:11
【问题描述】:

我有一个文件夹,其中包含旅游评论 .txt 中的许多文档。我想使用词袋方法将它们转换为 C++ 中机器学习的某种数字表示(潜在狄利克雷分配 - LDA),以训练系统识别每个文档的主题。

但不知何故,我不知道如何处理 Bag of Word 算法,而且我听说过一些工具,例如 Scikit-learn。但是 Scikit-learn 在 python 环境中工作。我想知道,是否有一些推荐工具/库可以帮助我解决我的词袋模块?或者是否有 C++ 的 scikit-learn 的 C++ 包装器?

我已经到了不知道该怎么做的水平,不胜感激。谢谢你:)

【问题讨论】:

    标签: c++ machine-learning text-processing text-extraction lda


    【解决方案1】:

    嗯……编码应该很容易吧?

    最愚蠢但保证有效的方法是对所有文档进行两次迭代。在第一次迭代期间,创建单词的哈希图和唯一索引(类似于 HashMap 的结构),在第二次迭代期间,您进行表查找并打印单词的索引以创建数据的数字表示。

    如果你想要一个词袋表示,在第二次迭代中,你可以在每次看到一个新文档时创建一个哈希图(HashMap),并增加每个词索引的计数,一旦你到达一个文件,你读出计数,然后打印出来。

    【讨论】:

      【解决方案2】:

      对于 C++,您可以 take a look at these resources

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2019-01-14
        • 2015-11-22
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2014-12-15
        • 2013-03-09
        • 1970-01-01
        相关资源
        最近更新 更多