【发布时间】:2011-02-18 13:08:09
【问题描述】:
我不想要声音到文本的软件。我需要的是以下内容:
- 我会录制多个(比如 50 多个)音频流(广播电台的录音)
- 从这些录音中,我会标记有趣的音频剪辑 - 它们的长度范围从 2 到 60 秒 - 会有几千个这样的音频剪辑
- 库应该能够从录制的声音流中找到相同音频剪辑的其他实例
- 应向使用的人报告置信度并提供额外的输入,以便下次识别效果更好
你知道这样的软件库吗? LGPL 对我来说最有价值,但我也可以申请商业许可。
音频剪辑将包含音乐、文本、效果或其任意组合。所以,TEXT 识别是不可能的。
架构:c++、C# 用于胶水、CUDA(如果可能)。
【问题讨论】:
-
音频剪辑会包含语音、声音、音乐,所有这些吗?
-
您是否考虑过特定的语言或处理器架构?
-
顺便说一句,我创建了自己的实现,经过 2 年的开发,它可用于商业开发 :) videophill.com/index.php?page=playkontrol
-
videophil.com/index.php 上的数据库连接失败?page=playkontrol @DanielMošmondor
-
MIT 许可的 Python 库在这里:github.com/worldveil/dejavu
标签: audio signal-processing audio-processing