言语识别中的时域及频域信息
徐立
School of Hearing, Speech and Language Sciences, Ohio University, Athens, Ohio, 45701, USA
摘要:本文对言语识别中的声学要素从时域和频域的角度进行探讨,旨在为人工耳蜗编码策略的改善提供理论依据.声码器技术被用于一系列的实验以确定时域和频域信息对言语识别和汉语四声识别的相互作用.频域信息是由声码器中的频道数来决定,而时域信息则是由声码器的低通滤波器的截止频率来决定.听力正常成人参加了各项感知试验.结果 表明,时域和频域信息都对音素识别很重要.在安静环境下,辅音和元音识别率分别在8和12频道及16 Hz和4 Hz的低通截止频率时达到平台成绩.在噪声环境下,元音识别受益于增高的频道数.汉语四声的识别需要256 Hz的低通截止频率才达到平台成绩,这一频率比英语音素识别所需的时域信息高得多.声调识别率在本研究中最高频道数12时仍未见饱和.为了研究细微结构和时域包络对四声识别的相对重要性,我们用声嵌合技术将不同声调信号的时域包络和细微结构进行对换.感知实验结果表明,声调识别主要取决于细微结构,这一点与音乐感知的结果类似,而不象言语识别,后者主要依赖于时域包络信息.因此,增加人工耳蜗系统中有效的频道数将有助于尤其是噪声环境下的言语识别.将人工耳蜗刺激中提供更多的细微结构信息可能会提高患者声调识别的成绩.
关键词:人工耳蜗言语识别声调识别时域信息频域信息
分类号:R339.16(人体生理学)H018.4(语音学)
资助基金:美国国立卫生研究院资助项目(F32-DC00470)美国国立卫生研究院资助项目(RO1-DC03808)美国国立卫生研究院资助项目(R03-DC006161)
论文发表日期:2006-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 335-342 )
英文信息
