【发布时间】:2020-02-12 23:33:31
【问题描述】:
我正在尝试在 python 中实现多类感知器。当涉及到多分类时,我已经完全理解了感知器算法的概念,但仍然对我们应该从训练数据中提供的特征向量感到困惑。
这个问题只是一个文本(文档)分类问题。我正在尝试在文本预处理阶段使用一元词频率作为感知器的特征。当我根据每个训练文档中的术语(即 unigram)频率为每个文档构建特征时,构造的特征恰好非常稀疏(文档中出现的每个标记的术语频率,而那些没有的则为 0发生)。
我的问题是关于这个的替代模式。构建特征向量有更好的解决方案吗?
谢谢!
【问题讨论】:
标签: python machine-learning perceptron