【问题标题】:How to Train Wav2vec2 XLSR With local Custom Dataset如何使用本地自定义数据集训练 Wav2vec2 XLSR
【发布时间】:2022-06-29 16:22:01
【问题描述】:
我想用丹麦语用wav2vec2 xlsr(基于变压器的模型)训练一个语音到文本模型,作为推荐,许多人在数据集库的帮助下使用common voice训练他们的模型,但是用普通的声音,丹麦语的数据量非常少,现在我想用我自己的自定义数据训练模型,但我找不到任何明确的文档,谁能帮我解决这个问题,我该怎么做一步一步来?
【问题讨论】:
标签:
python
machine-learning
speech-recognition
huggingface-transformers
huggingface-datasets
【解决方案1】:
我建议您使用自己的数据集扩展通用语音 (CV) 丹麦语子集。首先分析数据集,使您的数据像 CV 语料库一样。此时:数据扩展名(.wav、.mp3 ...)、类型(float32、int ...)、音频长度,当然还有转录格式很重要。不要让你的语料库变得稀疏。
将数据放入 CV 语料库文件夹并加载数据集。然后您应该能够使用现有代码使用扩展数据微调模型。
如果您不是 wav2vec 专家,请勿创建全新的语料库。
注意:您应该使用较少的数据获得合理的结果。您实现了什么 WER,您的目标是什么。超参数调整可能是您寻找的第一件事,而不是数据。