【发布时间】:2011-04-25 00:16:39
【问题描述】:
我打算做什么:
我想开发English accent(未经专业培训)。
执行摘要推理背后的一组公理:
以下内容故意过于简化,对此深表歉意。我尽量让问题简短。
第 1 部分:了解学习的工作原理。
目前我假设Broca's area 和Wernicke's area 必须知道语言,并且现有语音字母表的肌肉记忆将构建语音。口音只是随着时间的推移通过语音字母同化自然形成的。
我使用 Google 发现 speech shadowing 可以潜在地用于音标同化。另一方面,可以通过重复动作轻松训练肌肉记忆。这是最有效的,如果一个人是 23-24 岁并且他/她手上有很多无法解释的时间,因为失去注意力会显着降低有效的学习曲线梯度。这种procedural memory 大概可以优化为在memory with designed sleep pattern 中刷新。
第 2 部分:设计行为模式
- 寻找一位流利的演讲者,让我的口音听起来像。
- 区分目标重音音素和音素。
- 训练肌肉记忆以产生目标口音。
第 3 部分:找到一个流利的演讲者,我想听起来像他的口音。
Youtube 是一个强大的免费资源。示例音频,我很难挑选:
Someone Like You - Adele (Cover) 高清。
我不介意,那是高音的女声。
第 4 部分:区分目标重音音素和音素。
这不是一项简单的任务 - 识别和判断语音电话是否正确。以及人类说出有形文字的正确程度。实际上它看起来很复杂,我不会费心让它自动化,只是使用IPA 作为基线。
这是上面示例音频的美国国际音标中第一首带有单词重音的诗篇:
无意侵犯版权。并且图像是使用upodn(替代:photransedit)创建的。
第 5 部分:训练肌肉记忆以产生目标口音。
虽然尝试模仿和存档同步很有趣,但我更喜欢构建一个工具,将单词提取为音频文件。所以我可以使用 winamp 或 ipod 循环播放我想要的单词。
我想,我可以为此使用 MS Expression Encoder。
问题
如果给定一个音频文件(例如 wav 格式,大小
主要目的是减少我会做的工作,如果这是手动完成的话。
【问题讨论】:
-
关于您的问题域的信息可能有点过多,但仍然是一个好问题。是否有任何现有的解决方案或算法来检测您已经研究或正在考虑的语音检测?这只是解决方案的一部分,但快速傅里叶变换 (FFT) 和边缘检测(通常用于图像处理)可能是需要研究的东西。此外,说话的声音特征可能与唱歌有很大不同。
-
你能找到解决这个问题的办法吗?我正在寻找类似问题的答案 - 您的反馈将很有价值。
标签: c# algorithm word-boundaries