【问题标题】:Cannot Train Wav2vec XLSR Model With Common Voice Data无法使用普通语音数据训练 Wav2vec XLSR 模型
【发布时间】:2023-01-07 22:13:38
【问题描述】:

我正在尝试使用丹麦语的 wav2vec XLSR 训练变压器 ASR 模型,但每当我尝试使用数据集库提取丹麦数据集时,它都会给我一个错误。Notebook link

错误日志:

ValueError:未找到 BuilderConfig da。可用:['ab', 'ar', 'as', 'br', 'ca', 'cnh', 'cs', 'cv', 'cy', 'de', 'dv', 'el' , 'en', 'eo', 'es', 'et', 'eu', 'fa', 'fi', 'fr', 'fy-NL', 'ga-IE', 'hi', ' hsb', 'hu', 'ia', 'id', 'it', 'ja', 'ka', 'kab', 'ky', 'lg', 'lt', 'lv', 'mn' , 'mt', 'nl', 'or', 'pa-IN', 'pl', 'pt', 'rm-sursilv', 'rm-vallader', 'ro', 'ru', 'rw' , 'sah', 'sl', 'sv-SE', 'ta', 'th', 'tr', 'tt', 'uk', 'vi', 'vot', 'zh-CN', ' zh-HK', 'zh-TW']

【问题讨论】:

    标签: python machine-learning deep-learning speech-recognition voice-recognition


    【解决方案1】:

    我帮你查过了

    丹麦语子集在以下语言中受支持:

    • 普通语音语料库8.0
    • 普通语音语料库9.0

    发布。

    但是,Hugging Face 的数据集库(版本 2.2.1)使用的是 6.1.0 版本的语料库。您可以通过加载语料库的任何子集并打印数据集信息来检查自己,如下所示:

    代码

    from datasets import load_dataset
    
    dataset_de = load_dataset("common_voice", "de")
    print(dataset_de.info)
    

    输出

    Downloading and preparing dataset common_voice/de (download: 21.68 GiB, 
    generated: 137.78 MiB, post-processed: Unknown size, total: 21.82 GiB) to 
    /root/.cache/huggingface/datasets/common_voice/de/6.1.0/
    

    See the Corpus Details

    See the Library

    您应该等待库的新版本或向他们的repository 提出请求。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2022-06-29
      • 2021-07-09
      • 2019-03-13
      • 2018-10-23
      • 2017-08-19
      • 1970-01-01
      相关资源
      最近更新 更多