【发布时间】:2020-07-02 17:37:06
【问题描述】:
我想创建一个文档术语矩阵。在我的情况下,它不像文档 x 单词,而是句子 x 单词,因此句子将充当文档。我正在使用 'l2' 规范化 post doc-term 矩阵创建。
术语计数对我在进一步的步骤中使用 SVD 创建摘要很重要。
我的问题是哪个轴适合应用“l2”标准化。经过充分的研究,我了解到:
- Axis=1 :将给出句子中单词的重要性(按列标准化)
- Axis=0:文档中单词的重要性(按行标准化)。
即使知道了理论,我也无法决定选择哪个替代方案,因为选择会极大地影响我的总结结果。所以请指导我一个解决方案以及相同的原因。
【问题讨论】:
标签: python normalization countvectorizer lsa