【发布时间】:2020-08-20 23:27:56
【问题描述】:
将分段语音音频添加到 DNN 模型时,我了解到从最后一个隐藏层提取的特征的平均值是“d-vector”。 在那种情况下,我想知道即使我在没有学习的情况下放置说话人的声音,是否可以提取说话人的 d-vector。 使用这个,当一个多人说话的语音文件的分割值(使用mel-filterbank或MFCC)被放入时,我们可以通过对提取的d-vector值进行聚类来区分说话者吗?
【问题讨论】:
-
你指的是哪个型号?
-
你好 @LukaszTracewski 我想我可以提取 d-vector,从语音分类 DNN 模型(如 LSTM)中提取。
标签: audio deep-learning artificial-intelligence lstm mfcc