【问题标题】:How to Train Wav2vec2 XLSR With local Custom Dataset如何使用本地自定义数据集训练 Wav2vec2 XLSR
【发布时间】:2022-06-29 16:22:01
【问题描述】:

我想用丹麦语用wav2vec2 xlsr(基于变压器的模型)训练一个语音到文本模型,作为推荐,许多人在数据集库的帮助下使用common voice训练他们的模型,但是用普通的声音,丹麦语的数据量非常少,现在我想用我自己的自定义数据训练模型,但我找不到任何明确的文档,谁能帮我解决这个问题,我该怎么做一步一步来?

【问题讨论】:

  • 你可能喜欢这个blog 帖子。

标签: python machine-learning speech-recognition huggingface-transformers huggingface-datasets


【解决方案1】:

我建议您使用自己的数据集扩展通用语音 (CV) 丹麦语子集。首先分析数据集,使您的数据像 CV 语料库一样。此时:数据扩展名(.wav、.mp3 ...)、类型(float32、int ...)、音频长度,当然还有转录格式很重要。不要让你的语料库变得稀疏。

将数据放入 CV 语料库文件夹并加载数据集。然后您应该能够使用现有代码使用扩展数据微调模型。

如果您不是 wav2vec 专家,请勿创建全新的语料库。

注意:您应该使用较少的数据获得合理的结果。您实现了什么 WER,您的目标是什么。超参数调整可能是您寻找的第一件事,而不是数据。

【讨论】:

    猜你喜欢
    • 2020-10-16
    • 1970-01-01
    • 2022-09-27
    • 1970-01-01
    • 2021-07-07
    • 2023-01-21
    • 2017-06-19
    • 2022-10-08
    • 1970-01-01
    相关资源
    最近更新 更多