【发布时间】:2011-07-23 06:10:46
【问题描述】:
我有一个系统,要求用户在提示后重复一个句子。它使用HTK 到force-align 的用户口语-句子到预定义的词级标签文件(句子的)来获得时间对齐的电话级文件。 HMM 已经在大量数据上进行了训练,并通过HVite 提供了非常准确的时间对齐文件。当用户没有说出需要说出的确切句子时,我的问题就出现了。让我用一个例子来说明:
需要朗读的目标句子的词级标签文件(用户知道):
这是一个非常美好的一天。用户说(案例 1):今天是美好的一天。
在这种情况下,用户重复了完全相同的句子。时间对齐的文件非常准确,一切都很好。用户说(案例 2):今天是个好日子。
在这种情况下,使用上面给出的字级标签文件执行强制对齐。生成的时间对齐文件显示了用户从未说过的单词的时间瞬间(例如 VERY 存在于原始句子中但不存在于此处)。
HTK 中是否有办法检测并可能避免这种情况?
一种解决方案是某种前端预处理器,它可以进行语音识别(这本身就是一个非常困难的问题,因为它必须有无限的词汇量)并让用户知道他们所说的内容是不正确的.
HTK 中是否有任何工具/命令行选项允许我执行此操作?
P.S:如果需要更多详细信息,请告诉我。
谢谢,
斯里拉姆
【问题讨论】: