【问题标题】:Dealing with outlier in a MFFC with DTW setup使用 DTW 设置处理 MFFC 中的异常值
【发布时间】:2013-04-25 19:53:50
【问题描述】:

我有一个小型命令识别系统,用户首先记录他的命令,然后系统尝试识别它们。前端的特征向量是 MFCC 的系数。后端使用 DTW 进行识别以对齐这些特征向量并输出分数( 0 -> 命令相等)。此设置的问题在于将命令(用户记录的命令)与其他单词区分开来。选择最大分数作为识别命令的阈值不会产生好的结果。我查找了 LDA 和 PCA,目的是将记录的特征投影到不同的特征空间,在那里它们可以更容易分离。每个记录的命令都是一个类,它具有来自与该命令的帧相关联的前端的样本特征向量。由此我计算了 LDA 所需的变换,并将变换应用于每组生成的 MFCC 系数。这并没有让我区分记录的命令和未记录的命令。

我的问题是:

  • 应用 LDA 的方法是否错误?
  • 还有其他方法更适合我的设置(MFCC + DTW)吗?

非常感谢任何帮助或指导。

谢谢

【问题讨论】:

    标签: pattern-matching speech-recognition mfcc


    【解决方案1】:

    此设置的问题在于区分未记录的命令。

    您可能想要更好地表达您想要将您正在寻找的关键字与所有其他可能的词分开。不清楚您所说的“未记录”是什么意思

    应用 LDA 的方法是错误的吗?

    没有错,没有意义。 PCA 优化了不同的属性,但绝不会提高分离度。

    选择最大分数作为识别命令的阈值不会产生好的结果。

    这种方法可能不是最好的方法,但它应该相对有效。多年来,它被证明了。您可能只是在它的实现或测试中犯了一个错误,或者还有其他一些错误。建议你重温一下。

    您唯一需要知道的是阈值必须依赖于模板关键字。所以对于不同的模板关键字阈值必须不同。单一的阈值是行不通的。

    【讨论】:

    • 感谢您的回复,我尝试通过选择该关键字与所有其他关键字之间的最高分来为每个关键字设置一个阈值。它在噪声条件下不会产生良好的效果。我还尝试为每个关键字选择通过将该关键字(在干净的条件下)与其余关键字匹配而获得的最高分数,只有后者在噪声条件下才被说出。虽然在现实世界的场景中不可行,但它给出了很好的结果。有没有办法利用这些知识?
    猜你喜欢
    • 2012-01-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-02
    • 2017-06-15
    • 2020-08-23
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多