【问题标题】:Speaker adaptation of acoustic model for Indian accent kaldi ASR印度口音 kaldi ASR 声学模型的说话人适应
【发布时间】:2016-01-23 21:37:20
【问题描述】:

我正在努力为印度口音的人进行语音识别。目前,我正在使用 Kaldi ASR 的在线 nnet2 解码工具。 当说话者具有良好的英语发音时,该工具运行良好。但是,当说话者的口音与美国英语口音不同时,它就失败了。

那么,任何人都可以建议任何使用 Kaldi ASR 对声学或神经网络模型进行说话人适应的程序吗?

【问题讨论】:

  • 俚语是指accent吗?

标签: neural-network speech-recognition speech-to-text


【解决方案1】:

有很多方法可以做到或考虑。

1 - 如果你只谈论口音(这意味着没有新词,标准语法) -> 那么你应该主要使用模型的声学部分。尽可能多地获取音频和转录数据(数百小时),以便更新模型的 H 部分。

2 - 如果您在谈论更复杂的内容,您应该考虑更新词典(添加单词)和语法(fst's)(包括我的第一点)。

您可以尝试从 AMI 模型及其论文开始,它们包含在 Kaldi 的示例中。见Examples included with Kaldi

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-12-29
    • 1970-01-01
    • 2022-01-19
    • 2019-01-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-11-15
    相关资源
    最近更新 更多