【问题标题】:API to break voice into phonemes / synthesize new speech given speech samples?API将语音分解为音素/在给定语音样本的情况下合成新语音?
【发布时间】:2011-10-24 14:26:43
【问题描述】:

您知道那些技术极客录制某人的声音,然后他们的软件将其分解为音素的电影吗?然后他们可以用它来输入任何短语,并让目标看起来好像在说它?

该软件是否存在于 API 版本中?我什至不知道谷歌是什么。

【问题讨论】:

  • +1 仅用于zoom…enhance 级别的合理问题。
  • 没有商业上可用的技术可以模仿别人的声音达到可识别的程度。有很多文本到语音合成软件可用。必应文字转语音
  • @Phonon,请不要。我对做这样的事情非常感兴趣。 (仅用于娱乐目的 - 我正在尝试为电影配音......)
  • @AShelly 很长一段时间,但你能解释一下你是怎么做到的(把声音变成音素),因为我必须这样做,拜托。

标签: api audio signal-processing phoneme


【解决方案1】:

没有这样的软件。将任意语音分解为其组成音素只是部分解决的问题:speech-to-text 软件仍然不完善,text-to-speech 也是如此。

这个想法是重现目标声音的timbre。即使您能够完美地分割音频,重新排序音素也会产生不自然的节奏和语调的音频,更不用说拼接伪影了。那时,您将进入平滑、时间缩放和音高校正,所有这些在理论上都是可能的并且很好理解,但是在现实世界的数据上运行不佳,尤其是当所讨论的音频样本很短时单个音素,当需要保留音色时进一步。

allophonic 基于口音和周围音素的声音变化加剧了语音方面的这些问题;为了忠实地产生低质量的近似音频,您需要详细了解目标的语言、口音和语音模式。

此外,您的终极问题是social engineering 之一,当涉及到他们认识的人的声音时,人们不容易被愚弄。即使有大量的输入数据,充其量只能得到一个简短的低质量样本,不足以进行对话。

因此,虽然这当然是可能的,但这很困难;即使它存在,也并不总是足够好。

【讨论】:

  • +1 指出现有 API 中的漏洞。电影总是让它看起来像一个现成的解决方案
  • +1 获取详细答案。社会工程学方面并不重要——我实际上并不是想愚弄任何人。在阅读了更多之后,我最想要的是像 Auto-tune 这样的东西。该技术是否有任何开源实现?
  • 完成这项任务的最佳方法是使用神经网络,但获得正确的数据来训练它是困难的部分。
  • @devinbost:是的,我认为风格迁移的最新进展使其成为可能。最初的问题假设目标声音的某种语料库。
【解决方案2】:

SRI International(为 iOS 创建 Siri 的公司)有一个名为 EduSpeak 的 SDK,它将接收音频输入并将其分解为单独的音素。我知道这一点是因为我大约一周前参加了该产品的演示。在演示期间,演示者向我们展示了使用 SDK 创建的应用程序。该应用程序提供了几行文本供演示者阅读。阅读文本后,应用程序会显示一个条形图,其中每个条形代表他演讲中的一个音素。每个条形的高度代表每个音素发音的好坏得分(演示者不是以英语为母语的人,因此与其他人相比,他在某些音素上的得分较低)。演示者还可以单击每个单独的条,以使用原始音频仅播放该单独的音素。

所以是的,存在按音素划分音频的软件,并且它非常做得很好。现在,这些音素是否可以重新组合成语音是一个悬而未决的问题。如果我们最终获得了 SDK 的试用版,我会试用并通知您。

【讨论】:

    【解决方案3】:

    如果你的目标是模仿别人的声音,那么另一种态度是转换你自己的声音(而不是组装音素)。它(令人惊讶地)称为语音转换,例如http://www.busim.ee.boun.edu.tr/~speech/projects/Voice_Conversion.htm

    【讨论】:

    • 谢谢,这实际上非常接近我可以用于我正在考虑的项目的东西。 (不幸的是,它似乎更接近于学术阶段而不是实际应用)
    【解决方案4】:

    该技术被称为“语音合成”和“语音识别”

    Java API 可以在这里找到Java voice JSAPI

    Apple 有一个用于此 Apple speech 的 API

    微软有几个...这里讨论一个Vista speech

    【讨论】:

    • 这里真正的挑战不是语音合成也不是语音识别,而是语音转换。
    【解决方案5】:

    Lyrebird 是一家正在解决这个问题的初创公司。给定一个人的声音样本和一些书面文本,它可以在样本中的人的声音中合成该书面文本的口语版本。

    【讨论】:

    • 我检查了您输入的链接。这确实产生了惊人的输出。我用过谷歌和亚马逊。但是,如果产品提供更多的语言选项,没有人可以与他们竞争。
    【解决方案6】:

    您可以通过共振峰感知音高转换获得有趣的语音变形效果。 Adobe Audition 有一个非常好的实现。 Antares 产生了一些有趣的vocal effects VST plugins

    这些技术使用某种形式的linear predictive coding (LPC) 将语音视为源过滤器模型。 LPC 通过估计声道(共振峰)的共振,用逆滤波器反转其效果,然后对生成的残余信号进行编码来处理语音信号。残余信号理想地是代表声门脉冲的脉冲序列。这允许独立地缩放音高和共振峰,从而产生比简单的音高转换更好的性别转换结果。

    【讨论】:

      【解决方案7】:

      我不知道是否有商业可用的解决方案,但这个概念并非完全超出了可能性范围。例如,特拉华大学有相当不错的软件可以做到这一点。

      http://www.modeltalker.com

      【讨论】:

        猜你喜欢
        • 2023-03-03
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2020-04-26
        • 1970-01-01
        • 1970-01-01
        • 2017-10-29
        相关资源
        最近更新 更多