【发布时间】:2020-02-17 03:22:46
【问题描述】:
来自 Keras 的文档:
主输入将接收标题,作为整数序列(每个整数编码一个单词)。整数将在 1 之间 和 10,000(10,000 个单词的词汇表),序列将是 100字长。
这里对单词进行编码的方式似乎只是简单地使用构建词汇表中的单词索引来表示单词。如果训练数据中有 'n' 个单词,则要向量化的整数 i 将来自 [0, n-1]。
但在 scikit-learn 的 CountVectorizer 中:
此实现生成计数的稀疏表示 使用 scipy.sparse.csr_matrix。
这两种词向量化方式之间有什么联系吗?计数向量表示会比基于索引的向量化更有效吗? CountVectorizer 考虑了词频。
【问题讨论】:
标签: keras scikit-learn nlp