【问题标题】:I want to know 'd-vector' for speaker diarization我想知道说话人分类的“d-vector”
【发布时间】:2020-08-20 23:27:56
【问题描述】:

将分段语音音频添加到 DNN 模型时,我了解到从最后一个隐藏层提取的特征的平均值是“d-vector”。 在那种情况下,我想知道即使我在没有学习的情况下放置说话人的声音,是否可以提取说话人的 d-vector。 使用这个,当一个多人说话的语音文件的分割值(使用mel-filterbank或MFCC)被放入时,我们可以通过对提取的d-vector值进行聚类来区分说话者吗?

【问题讨论】:

  • 你指的是哪个型号?
  • 你好 @LukaszTracewski 我想我可以提取 d-vector,从语音分类 DNN 模型(如 LSTM)中提取。

标签: audio deep-learning artificial-intelligence lstm mfcc


【解决方案1】:

回答您的问题:

  1. 训练模型后,只需通过网络前向传播输入向量即可得到d-vector。通常您会查看 ANN 的输出(最后一层),但您同样可以从倒数第二层(d-vector)检索值。

  2. 是的,您可以用d-vector 区分扬声器,因为它以一种高级嵌入的方式产生音频信号,这将为不同的人提供独特的功能。参见例如这个paper

【讨论】:

    猜你喜欢
    • 2022-11-28
    • 2019-10-15
    • 2021-12-29
    • 1970-01-01
    • 2017-05-12
    • 2017-03-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多