【发布时间】:2021-05-30 01:41:29
【问题描述】:
我需要至少 3/4 种不同的 tts 声音,但不幸的是我只有一种声音。
这是因为我只有一个意大利神经声音(迭戈),其他都是标准声音,质量要差得多。
最终目标是为至少 3/4 人创建配音,但我无法使用精确的配音。
出于这个原因,我喜欢创建一些变体,由我拥有的唯一一个神经声音开始,它给人的印象是其他人的声音,所有这些都不会显得不自然。
实际上,我有 Adobe Audition、Audacity、Ircam Trax、ffmpeg,除此之外,我还可以将 SSML 与 API 一起使用(在本例中为 Microsoft Azure)。
我不知道有什么效果以及在什么情况下使用它不会损坏声音。
简而言之,如果我能获得更好的结果,我会问使用我拥有的软件或其他软件的最佳方法是什么。
谢谢!
【问题讨论】:
标签: text-to-speech web-audio-api microsoft-cognitive audio-processing