【问题标题】:Is it possible to identify speakers for each conversation after "autodetec" function in R是否可以在 R 中的“自动检测”功能后识别每个对话的说话者
【发布时间】:2017-01-27 13:22:53
【问题描述】:

我为 wav 文件运行下面的代码,我得到了 4 个变量:sound.files、selec、start 和 end 在 output.output。有谁知道是否可以为每个对话指定发言人,以便我们可以知道每个星号和结束持续时间是扬声器 A 说话或扬声器 B 说话。

 autodetec(flist = sub, threshold = 0.5, env = "abs", ssmooth = 500, power = 1, redo = TRUE,
            bp=c(0,9), xl = 2, picsize = 2, res = 200, flim= c(0,10), osci = TRUE,
            wl = 300, ls = FALSE, sxrow = 2, rows = 4, mindur=0.5, maxdur=8, set = TRUE)

【问题讨论】:

  • 这个自动检测功能从何而来?
  • 来自 warbleR 包

标签: python r audio split speaker


【解决方案1】:

问题建立在speaker diarisation 的主题之上。如果您已经拥有每个扬声器的同质段(自动检测功能的输出),您可以计算音频描述符,例如常用的 MFCC,以对每个段进行分类。像Kmeans 这样的简单分类器就可以完成这项工作。

【讨论】:

    猜你喜欢
    • 2019-10-21
    • 2016-07-18
    • 2020-07-01
    • 1970-01-01
    • 1970-01-01
    • 2021-07-10
    • 1970-01-01
    • 1970-01-01
    • 2018-12-13
    相关资源
    最近更新 更多