【发布时间】:2023-02-22 07:18:50
【问题描述】:
我已经构建了一个 U-Net 模型来执行多轨音频的音频混合,为此我使用了 20 秒的音轨剪辑(转换为频谱图)作为训练模型的输入。然而训练过程非常长,所以我认为最好从每条轨道上取 2s 片段来训练模型。
数据被组织为 8 个词干(单独的乐器轨道)作为输入,词干的单一混合作为目标(都有 sr=44100)。我想找到混合轨道中最有活力的 2s 部分,并裁剪所有轨道(输入和混合)这个特定的 2s 部分。我主要在我的数据准备中使用 librosa,但我不确定使用什么函数来找到最响亮的(我知道这是模棱两可的)88200 样本段 (2s) 的起点。
【问题讨论】:
标签: python audio pytorch librosa torchaudio