一文读懂智能语音前端处理中的关键问题互联网+

雷锋网 2017-07-18 12:49
分享到:
导读

通过回声消除、噪声抑制、去混响提高语音识别的鲁棒性,此时需要有效的回声消除算法来抑制远端信号的干扰,蓝色部分包括了从声源直接到达麦克风的语音以及早期混响成分、橙色部分是晚期混响成分、灰色部分是房间中各种噪声源的干扰。

雷锋网编者按:本文由极限元智能科技语音算法专家、中科院-极限元“智能交互联合实验室”核心技术人员、中科院自动化所博士刘斌整理分享,后续将会为大家分享更多智能语音技术的研究、应用等一系列的优质内容。本文首发雷锋网(公众号:雷锋网) 随着深度

  雷锋网编者按:本文由极限元智能科技语音算法专家、中科院-极限元“智能交互联合实验室”核心技术人员、中科院自动化所博士刘斌整理分享,后续将会为大家分享更多智能语音技术的研究、应用等一系列的优质内容。本文首发雷锋网(公众号:雷锋网)

  随着深度学习技术的快速发展,安静环境下的语音识别已基本达到实用的要求;但是面对真实环境下噪声、混响、回声的干扰,面对着更自然随意的口语表达,语音识别的性能明显下降;尤其是远讲环境下的语音识别,还难以达到实用的要求。

  语音前端处理技术对于提高语音识别的鲁棒性起到了非常重要的作用;通过前端处理模块抑制各种干扰,使待识别的语音更干净;尤其是面向智能家居和智能车载中的语音识别系统,语音前端处理模块扮演着重要角色。除了语音识别,语音前端处理算法在语音通信和语音修复中也有着广泛的应用。

  在面向语音识别的语音前端处理算法,通过回声消除、噪声抑制、去混响提高语音识别的鲁棒性;真实环境中包含着背景噪声、人声、混响、回声等多种干扰源,上述因素组合到一起,使得这一问题更具挑战性。

  远场语音识别的几个典型的应用场景,包括:智能机器人(行情300024,诊股)、智能家居等,此外智能车载也有着非常广泛的应用。为了使得这几个典型应用场景的技术真正落地,需要解决一系列技术痛点,语音前端处理的一个最为重要的目标是实现释放双手的语音交互,使得人机之间更自然的交互。

  此图形象的描述的语音前端处理模块的几个关键问题:Echo:远端扬声器播放的声音回传给麦克;Diffuse Noise:无向噪声的干扰;Reflected Sound:声音通过墙壁反射,造成混响干扰;Interference:其他方向的干扰源; Target Speech:目标方向声音。Microphone Array:利用麦克风阵列拾音。

  语音前端处理模块跟语音交互系统的关系:橙色部分表示多通道处理模块,蓝色部分表示单通道处理模块,红色部分表示后端识别合成等模块。麦克风阵列采集的语音首先利用参考源对各通道的信号进行回波消除,然后确定声源的方向信息,进而通过波束形成算法来增强目标方向的声音,再通过混响消除方法抑制混响;需要强调的是可以先进行多通道混响消除再进行波束形成,也可以先进行波束形成再进行单通道混响消除。经过上述处理后的单路语音进行后置滤波消除残留的音乐噪声,然后通过自动增益算法调节各个频带的能量后最为前端处理的输出,将输出的音频传递给后端进行识别和理解。

  对于远场语音识别,更多的是采用双麦克,甚至是多麦克进行声音采集,这是由于单麦克远距离拾音能力有限,而麦克风阵列可以有效的增强目标方向声音。上图为麦克风阵列采集语音的示意图,各个通道的信号通过滤波器加权融合,Y为多通道融合增强后的语音,可以将其分解为两部分:目标语音成分和残留噪声成分;残留噪声成分可以通过后置滤波算法进一步处理,也可以通过改进麦克风阵列波束形成算法使这一成分得到有效抑制。

  一、回声消除的方法:

  在远场语音识别系统中,回声消除最典型的应用是智能终端播放音乐,远端扬声器播放的音乐会回传给近端麦克风,此时需要有效的回声消除算法来抑制远端信号的干扰。回声消除的两个难点是双讲检测和延时估计,对于智能终端的回声消除模块,解决双讲条件下对远端干扰源的抑制是最为关键的问题。

  这是一个更为复杂的回声消除系统,近端通过麦克风阵列采集信号,远端是双声道扬声器输出;因此近端需要考虑如何将波束形成算法跟回声消除算法对接,远端需要考虑如何对立体声信号去相关。如图所示DTD部分结合远端信号和近端信号进行双讲检测,通过判断当前的模式(近讲模式、远讲模式、双讲模式)采用不同的策略对滤波器w1和w2进行更新,进而滤除远端干扰,在此基础上通过后置滤波算法消除残留噪声的干扰。

  二、混响消除方法:

  声音在房间传输过程中,会经过墙壁或其它障碍物的反射后到达麦克风,从而生成混响语音;房间大小、声源和麦克风的位置、室内障碍物、混响时间等因素均影响着混响语音的生成;可以通过T60描述混响时间,它的定义为声源停止发声后,声压级减少60dB所需要时间即为混响时间。混响时间过短,声音发干,枯燥无味不亲切自然,混响时间过长,会使声音含混不清:合适时声音圆润动听。大多数房间的混响时间在200-1000ms范围内。

  上图为一个典型的房间脉冲响应,蓝色部分为早期混响,橙色部分为晚期混响;在语音去混响任务中,更多的关注于对晚期混响的抑制。

  此图相对直观的描述了混响语音的生成过程,安静语音在时域上卷积房间脉冲响应滤波器后生成混响语音;通常语音在传输过程中会伴随噪声的干扰;因此麦克风接收到的语音Y包含三个部分:蓝色部分包括了从声源直接到达麦克风的语音以及早期混响成分、橙色部分是晚期混响成分、灰色部分是房间中各种噪声源的干扰。

  当前主流的混响消除方法主要包括以下四类:基于波束形成方法、基于逆滤波方法、基于语音增强方法、基于深度学习方法。基于波束形成的混响消除方法假设干扰信号与直达信号之间是独立的,它对于抑制加性噪声非常有效,它并不适用于混响环境;理论上,逆滤波算法可以获得较好的混响消除性能,但是缺少能够在实际环境中对混响等效滤波器进行盲估计的有效算法,因此很难实际应用;谱增强算法根据预先定义好的语音信号的波形或频谱模型,对混响信号进行处理,但是该方法难以提取出纯净语音,从而难以有效实现混响消除。针对上述问题,一些学者开始尝试基于深度学习的语音混响消除方法,这种方法的劣势是当训练集和测试集不匹配时,算法性能会下降。这次报告重点介绍一种使用比较广的基于加权预测误差的混响消除方法。这种方法是由日本的NTTData公司提出并进一步改进的,能够适用于单通道和多通道的混响消除。

  这种方法的思想和语音编码中的线性预测系数有些相似,如下图所示,混响语音信号Y可以分解为安静语音成分D混响成分L,L可以通过先前若干点的Y加权确定,G表示权重系数;WPE算法的核心问题是确定G,然后估计出混响消除后的语音。

  该算法通过如下目标函数估计滤波器系数,具体推倒过程如下所示,更为详细的算法流程可以参考一下网址推荐的论文。

  

  由于早期混响成分有助于提高语音的可懂度,因此可以对上述的方法进行改进,只抑制晚期混响成分。如下图所示D同时包括安静语音成分和早期混响成分,通过先前若干点的Y确定L时没有考虑早期混响成分。

  在此基础上将WPE方法扩展到多通道混响消除模式,此时某一通道的晚期混响成分L可以通过各个通道先前若干点的Y加权确定,通过估计最优的权重系数G,消除晚期混响成分的干扰。

  基于WPE的多通道混响消除的流程,如果所示需要经过多次迭代确定出滤波器系数g,生成出混响消除后的语音。输出的去混响后的各通道语音可以作为波束形成算法的输入。

  三、语音降噪方法:

  这个公式表示第j个麦克风接收到语音信号时域上的数学表达式,x表示安静语音,h表示房间响应函数,u表示其它噪声干扰。接下来介绍的算法将更多的侧重于对噪声源u的抑制。

  此公式表示第j个麦克风接收到语音信号频域上的数学表达式,X表示安静语音,H表示房间响应函数,U表示其它噪声干扰。接下来介绍的算法将更多的侧重于对噪声源U的抑制。

语音 混响 消除 算法 干扰
分享到:

1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。


观点约架