【问题标题】:How to encode different size of feature vectors in SVM如何在 SVM 中编码不同大小的特征向量
【发布时间】:2014-07-20 22:11:53
【问题描述】:

我致力于将一些评论(段落)由多个句子组成。我通过 libSVM 在 Weka 中使用词袋特征对它们进行分类。但是,我有另一个想法,我不知道如何实现:

我认为在评论中为每个句子创建基于句法和浅语义的特征值得一试。但是,我找不到任何方法来按顺序对这些特征进行编码,因为段落的句子大小会有所不同。我想让这些特征保持有序的原因是句子特征的顺序可能会为分类提供更好的线索。例如,如果我有两个实例 P1(3 个句子)和 P2(2 个句子),我将有一个这样的空间(假设每个句子都有一个二进制特征作为 a 或 b):

P1 -> a b b /classX P2 -> b a /classY

所以,我的问题是,我是否可以在特征空间中实现不同特征大小的分类?如果是,是否有任何类型的分类器可以在 Weka、scikit-learn 或 Mallet 中使用?我将不胜感激。

谢谢

【问题讨论】:

  • 特征工程是将您的想法转化为固定长度向量的艺术 :)
  • :) 是啊,看来我得学了:)

标签: machine-learning scikit-learn weka text-classification


【解决方案1】:

无论实现如何,具有标准内核(线性、多边形、RBF)的 SVM 都需要固定长度的特征向量。您可以通过编码为布尔值来编码这些特征向量中的任何信息;例如收集您的语料库中出现的所有句法/语义特征,然后引入表示“本文档中出现的某些特征”的布尔值。如果捕获这些特征出现在多个句子中这一事实很重要,请对其进行计数并使用将频率放入特征向量中(但请务必按​​文档长度对频率进行归一化,因为 SVM 不是尺度不变的)。

【讨论】:

  • 感谢您的回复,我忘记了这个帖子对不起;我必须在没有标准化的情况下创建那些基于布尔和频率的特征。我还将通过应用归一化来比较我的结果。
【解决方案2】:

如果您要对文本数据进行分类,我建议您查看“Rational Kernels”,它是基于加权有限换能器制作的,用于对自然语言文本进行分类。 Rational Kernels 可以应用于不同长度的向量,并且已经作为一个开源项目 (OpenFST) 实现。

【讨论】:

    【解决方案3】:

    是库的问题,由于SVM本身不需要定长特征向量,只需要一个核函数,如果你能提供一个变长向量的核函数,SVM应该没问题

    【讨论】:

      猜你喜欢
      • 2021-09-26
      • 2018-02-25
      • 2013-05-11
      • 2015-12-08
      • 2016-06-29
      • 1970-01-01
      • 2014-06-03
      • 2021-08-18
      • 2016-04-02
      相关资源
      最近更新 更多