CN106920558B - 关键词识别方法及装置 - Google Patents

关键词识别方法及装置 Download PDF

Info

Publication number
CN106920558B
CN106920558B CN201510993729.8A CN201510993729A CN106920558B CN 106920558 B CN106920558 B CN 106920558B CN 201510993729 A CN201510993729 A CN 201510993729A CN 106920558 B CN106920558 B CN 106920558B
Authority
CN
China
Prior art keywords
median
voice data
recognized
sound
distance
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN201510993729.8A
Other languages
English (en)
Other versions
CN106920558A (zh
Inventor
孙廷玮
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Spreadtrum Communications Shanghai Co Ltd
Original Assignee
Spreadtrum Communications Shanghai Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Spreadtrum Communications Shanghai Co Ltd filed Critical Spreadtrum Communications Shanghai Co Ltd
Priority to CN201510993729.8A priority Critical patent/CN106920558B/zh
Publication of CN106920558A publication Critical patent/CN106920558A/zh
Application granted granted Critical
Publication of CN106920558B publication Critical patent/CN106920558B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00—Speaker identification or verification techniques
    • G10L17/04—Training, enrolment or model building
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00—Speaker identification or verification techniques
    • G10L17/16—Hidden Markov models [HMM]

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Telephonic Communication Services (AREA)

Abstract

关键词识别方法及装置,所述方法包括:将获取的待识别声音数据划分为多个重叠的声音帧;对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量;将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为识别结果。上述的方案,可以提高关键词识别的准确率,并节约计算资源。

Description

关键词识别方法及装置
技术领域
本发明涉及语音识别技术领域,特别是涉及一种关键词识别方法及装置。
背景技术
语音识别是机器通过识别和理解过程将人的语音转换为对应的文本或指令的技术。作为语音识别领域的一个重要分支,关键词(Isolated Word Recognition,IWR)识别在通信、消费电子、自助服务、办公自动化等领域得到了广泛的应用。
现有技术中,一般采用隐马尔可夫模型(Hidden Markov Model,HMM)hiddenMarkov models(HMMs)及其对应的参数,或者关键词识别系统(KWS)进行关键词识别。
但是,现有技术中关键词识别方法需要建立对应的模型,并需要对应的翻译操作训练模型参数,存在着计算量大且识别准确率低的问题。
发明内容
本发明实施例解决的问题是提高关键词识别的准确率,并节约计算资源。
为解决上述问题,本发明实施例提供了一种关键词识别方法,所述关键词识别方法包括:
将获取的待识别声音数据划分为多个重叠的声音帧;
对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量;
将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;
根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;
当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为识别结果。
可选地,在所述待识别声音数据的频谱能量大于预设的能量阈值时,执行所述将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数的操作。
可选地,所述预设的阈值与所述待识别声音数据的噪音水平相关联。
可选地,所述待识别声音数据的噪音水平包括低噪音水平、中等噪音水平和高噪音水平,其中:
当p≥p1时,确定所述待识别声音数据具有低噪音水平,p表示所述待识别声音数据对应的绝对幅值,p1为预设的第一阈值;
当p2≥p>p1时,确定所述待识别声音数据具有中等噪音水平,p2为预设的第二阈值,且p1>p2;
当p<p2时,确定所述待识别声音数据具有高噪音水平。
可选地,p1等于0.8,p2等于0.45。
可选地,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息。
本发明实施例还提供了一种关键词识别装置,所述装置包括:
分帧处理单元,适于将获取的待识别的声音数据划分为多个重叠的声音帧;
频域转换单元,适于对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量;
第一计算单元,适于将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;
第二计算单元,适于根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;
判断单元,适于判断当前声音帧与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值三者的均值是否小于预设的阈值;
关键词识别单元,适于当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为识别结果。
可选地,还包括触发单元,所述触发单元适于在所述待识别声音数据的频谱能量大于预设的能量阈值时,触发所述第一计算单元执行所述将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数的操作。
可选地,所述预设的阈值与所述待识别声音数据的噪音水平相关联。
可选地,所述待识别声音数据的噪音水平包括低噪音水平、中等噪音水平和高噪音水平,其中:
当p≥p1时,确定所述待识别声音数据具有低噪音水平,p表示所述待识别声音数据对应的绝对幅值,p1为预设的第一阈值;
当p2≥p>p1时,确定所述待识别声音数据具有中等噪音水平,p2为预设的第二阈值,且p1>p2;
当p<p2时,确定所述待识别声音数据具有高噪音水平。
可选地,p1等于0.8,p2等于0.45。
可选地,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息。
与现有技术相比,本发明的技术方案具有以下的优点:
上述的方案,通过基于对应MFCC参数计算得到的待识别声音数据与参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值与预设的阈值进行比较,来确定声音帧中是否包括关键词,而无需建立对应的数学识别模型,也不需要对关键词进行相应的翻译,因此,可以节关键词识别的的计算资源,并可以提高关键词识别的准确率。
进一步地,当待识别声音数据的频谱能量大于预设的能量阈值时,才对对应的待识别声音数据进行关键词识别,反之,则不对待识别声音数据进行关键词识别,因此,可以进一步节约计算资源,并提高关键词识别的速度。
进一步地,在录制对应的参考模板时,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息,使得参考模板可以与对应的特定人的语音和语音所属环境进行较为准确地记录,因此,可以进一步提高关键词识别的准确性。
附图说明
图1是本发明实施例中的一种关键词识别方法的流程图;
图2是本发明实施例中的另一种关键词识别方法的流程图;
图3是本发明实施例中的一种关键词识别装置的结构示意图。
具体实施方式
为解决现有技术中存在的上述问题,本发明实施例采用的技术方案通过在确定待识别声音数据与参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值与预设的阈值进行比较,来确定声音帧中是否包括关键词,可以节关键词识别的计算资源,并可以提高关键词识别的准确率。
为使本发明的上述目的、特征和优点能够更为明显易懂,下面结合附图对本发明的具体实施例做详细的说明。
图1示出了本发明实施例中的一种关键词识别方法的流程图。如图1所示的关键词识别方法,可以包括如下步骤:
步骤S101:将获取的待识别声音数据划分为多个重叠的声音帧。
在具体实施中,各个声音帧之间的重叠部分的大小可以根据实际的需要进行设置。例如,当各个声音帧的长度为32ms时,相邻声音帧之间的重叠部分的大小可以为16ms。
步骤S102:对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量。
在具体实施中,划分得到的多个声音信号为时域的声音信号,通过快速傅立叶变换运算(FFT),可以将时域的声音信号转换为频域的声音信号。
步骤S103:将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数。
在具体实施中,经过快速傅立叶变换运算得到声音信号的频谱能量(功率谱),可以按照预设的对应关系,转换为梅尔频率下的频谱能量,并根据梅尔频率下的频谱能量,计算各个声音帧对应的梅尔频率倒谱系数(Mel Frequency Cepstrum Coefficient,MFCC)参数。
步骤S104:根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值。
在具体实施中,预设的多个参考模板中分别包括对应的关键词的语音内容。其中,预设的参考模板的数量可以根据实际的需要进行设置,本发明在此不做限制。
步骤S105:当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为识别结果。
在具体实施中,通过对预设的多个参考模板进行遍历,分别计算当前待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值,并将当前待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值与预设的阈值进行比较,当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,可以将当前参考模板中的关键词作为识别结果;反之,则确定当前待识别的声音数据中不包括当前参考模板中的关键词的语音信息。
下面将结合图2对本发明实施例中的关键词识别方法做进一步详细的介绍。
图2示出了本发明实施例中的另一种关键词识别方法的流程图。如图2所示的关键词识别方法,可以包括如下的步骤:
步骤S201:将获取的声音数据进行重叠分帧,得到对应的多个声音帧。
在具体实施中,首先可以对所采集的声音信号进行模数转换,得到对应的声音数据。接着,可以将对应的声音数据进行重叠分帧,得到多个声音帧。对采集的声音数据进行分帧,实质是对声音数据进行短时分析。短时分析是把声音信号分成具有固定周期的时间短段,每个时间短段是相对固定的持续声音片段。其中,相邻的两个声音帧之间部分重叠,重叠范围可以根据实际情况进行选择。
步骤S202:对所得到的多个声音帧进行加窗处理。
在具体实施中,可以选择汉明窗、汉宁窗、矩形窗等语音信号处理常用的窗函数,帧长选择为10~40ms,典型值为20ms。其中,对语音信号进行分帧处理破坏了声音信号的自然度,通过使用声音帧进行加窗和回移处理等,可以解决这个问题。
步骤S203:将经过加窗处理后的声音帧进行快速傅立叶变换运算,得到各个声音帧对应的频谱能量的信息。
在具体实施中,声音数据理论上来说是随时间变化的,是一个非稳态的过程,不可以直接进行频域的转换。但是,由于对声音数据进行分帧处理(短时分析),每帧的声音数据可以认为是相对稳定的,因而可以对其应用频域转换。
在具体实施中,可以采用短时傅立叶变换(Short-Time Fourier Transform/Short-Term Fourier Transform,STFT)对每帧的声音数据进行频域转换,以得到各个声音帧对应的频谱信息。其中,所得到的频谱中包括对应的声音信号的频率和能量的关系。
步骤S204:将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数。
在本发明一实施例中,当得到当前待识别声音数据的多个声音帧对应的频谱能量之后,可以首先判断当前待识别声音数据的频谱能量是否大于预设的能量阈值,当确定当前待识别声音数据的频谱能量大于所述能量阈值时,继续执行步骤S204,否则,确定当前待识别声音数据中不包括关键词的语音信息,因此,便可以停止对当前待识别声音数据的后续处理,以进一步节约计算资源。
在具体实施中,可以按照预设的对应关系,将经过FFT运算得到的频谱能量转换成为梅尔(Mel)频率下的频谱能量,并计算每个声音帧对应的MFCC参数,作为每个声音帧的特征向量。
步骤S205:根据各个声音帧对应的MFCC参数,计算得到当前声音帧与预设的多个参考模板中当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值。
在本发明一实施例中,在计算当前待识别的声音数据与参考模板之间的DTW距离时,当前待识别的声音数据和参考模板分别被划分成I帧。同时,本申请的发明人根据经验获知,在参考模板的录制过程中,说话者的发音会变得亢奋,且语速也比往常要慢。因此,将参考模板划分为I帧,用于DTW距离计算的每跳大小为0.1I帧,在计算得到当前待识别声音数据的I帧与参考模板的I帧的DTW距离之后,将I个DTW距离的中值作为当前待识别声音数据与对应的参考模板的DTW距离中值。类似地,我们可以得到当前待识别声音数据与对应的参考模板的欧式距离(ED)中值和互相关距离(CC)距离中值。
步骤S206:判断待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值是否小于预设的阈值;当判断结果为是时,可以执行步骤S207,反之,则对预设的多个参考模板中的下一参考模板从步骤S205开始执行。
在具体实施中,在计算得到当前待识别声音数据与参考模板之间的DTW距离中值、欧式距离中值和互相关距离中值之后,将三者的均值与预设的阈值进行比较。
在本发明一实施例中,所述预设的阈值与当前待识别声音数据的噪音水平相关联,即不同的噪音水平,对应的预设的阈值将会不同。其中,当前待识别声音数据的绝对幅值概率大于当p≥p1时,确定所述待识别声音数据具有低噪音水平,p表示所述待识别声音数据对应的绝对幅值,p1为预设的第一阈值;p2≥p>p1时,确定所述待识别声音数据具有中等噪音水平,p2为预设的第二阈值,且p1>p2;当p<p2时,确定所述待识别声音数据具有高噪音水平。在本发明一实施例中,p1为0.8,p2为0.45。
步骤S207:将当前参考模板中的关键词作为识别结果并输出。
在具体实施中,当确定预设的参考模板中的某个参考模板与当前待识别声音数据之间的DTW距离中值、欧式距离中值和互相关距离中值的均值小于预设的阈值时,可以确定当前待识别声音数据中包括参考模板中的关键词的语音信息。因此,可以将所述参考模板中的关键词作为当前待识别声音数据的关键词识别结果并输出。
在具体实施中,当将上述的关键词识别方法应用于告警系统中时,在识别出对应的关键词时,告警系统可以执行告警操作。
这里需要指出的是,在紧急情况或者其他的关键词应用中,单纯(如未经训练)的用户可以用于录制个性化关键词。为了确保良好的识别性能,参考模板变得非常重要。这可以通过简单的核查操作来确保参考模板的录制质量。
因此,本申请的发明人提倡三种检测因素,即检测瞬态噪声源(如摔门声),静态噪声源(如风扇或者交通噪声),且丰富关键词的发音内容。上述三种因素需要同时满足,否则将需要重新录制关键词。其中,瞬态噪声的检测,可以使用连续25ms的声音帧,且每跳大小为5ms的声音信号的能量的绝对幅值的差异。其中,可以将每5个声音帧的绝对幅值进行平均。在静态噪声检测时,关键词的录制发生在安静环境中预设的5s时间窗内。与包括关键词的声音数据相比,在5s时间窗内,不包括关键词的参考模板的开头和结尾的信号能量具有较大的差异。在核查丰富的发音内容时,只有单一元音而没有如“啊”之类的辅音的关键词是被拒绝的,这种拒绝可以基于与关键词的发音内容相关的修正过零率做出。
下面将对本发明实施例中的关键词识别方法对应的装置做进一步详细的介绍。
请参见图3,本发明实施例中的关键词识别装置300,可以包括分帧处理单元301、频域转换单元302、第一计算单元303、第二计算单元304、判断单元305和关键词识别单元306,其中:
所述分帧处理单元301,适于将获取的待识别的声音数据划分为多个重叠的声音帧;
所述频域转换单元302,适于对划分得到的多个声音帧进行遍历,并将遍历到的当前声音帧的声音信号进行快速傅立叶变换运算,得到对应的频谱能量;
所述第一计算单元303,适于将所得到的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;
在具体实施中,在所述关键词识别装置300还可以设置一个触发单元(图中未示出),该触发单元适于在遍历到的当前声音帧的频谱能量大于预设的能量阈值时,触发所述第一计算单元303执行所述将所得到频谱能量转换为Mel频率下的频谱能量,并计算对应的MFCC参数的操作;
所述第二计算单元304,适于根据当前声音帧对应的MFCC参数,分别计算得到当前声音帧与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;
所述判断单元305,适于判断当前声音帧与参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值是否小于预设的阈值;
在具体实施中,所述预设的阈值与当前声音帧的噪音水平相关联,其中,当p≥p1时,确定当前声音帧具有低噪音水平,p表示当前声音帧对应的绝对幅值,p1为预设的第一阈值;当p2≥p>p1时,确定当前声音帧具有中等噪音水平,p2为预设的第二阈值,且p1>p2;当p<p2时,确定当前声音帧具有高噪音水平。其中,在本发明一实施例中,p1等于0.8,p2等于0.45。
在具体实施中,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息。
所述关键词识别单元306,适于当确定当前声音帧与参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为识别结果并输出。
本领域普通技术人员可以理解上述实施例的各种方法中的全部或部分步骤是可以通过程序来指令相关的硬件来完成,该程序可以存储于计算机可读存储介质中,存储介质可以包括:ROM、RAM、磁盘或光盘等。
以上对本发明实施例的方法及系统做了详细的介绍,本发明并不限于此。任何本领域技术人员,在不脱离本发明的精神和范围内,均可作各种更动与修改,因此本发明的保护范围应当以权利要求所限定的范围为准。

Claims (12)

1.一种关键词识别方法,其特征在于,包括:
将获取的待识别声音数据划分为多个重叠的声音帧;
对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量;
将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;
根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;所述多个参考模板中分别包括对应的关键词的语音内容;在计算所述待识别的声音数据与所述预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值时,将所述待识别的声音数据与参考模板划分为I帧;用于DTW距离、欧式距离和互相关距离计算计算的每跳大小为0.1I帧,在计算得到当前待识别声音数据的I帧与参考模板的I帧的DTW距离、欧式距离和互相关距离之后,将I个DTW距离的中值作为所述待识别声音数据与对应的参考模板的DTW中值,将I个欧式距离的中值作为所述待识别声音数据与对应的参考模板的欧式距离中值,将I个互相关距离的中值作为所述待识别声音数据与对应的参考模板的互相关距离中值;
当确定所述待识别声音数据与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为所述待识别声音数据的关键词识别结果。
2.根据权利要求1所述的关键词识别方法,其特征在于,在所述待识别声音数据的频谱能量大于预设的能量阈值时,执行所述将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数的操作。
3.根据权利要求1所述的关键词识别方法,其特征在于,所述预设的阈值与所述待识别声音数据的噪音水平相关联。
4.根据权利要求3所述的关键词识别方法,其特征在于,所述待识别声音数据的噪音水平包括低噪音水平、中等噪音水平和高噪音水平,其中:
当p≥p1时,确定所述待识别声音数据具有低噪音水平,p表示所述待识别声音数据对应的绝对幅值,p1为预设的第一阈值;
当p2≥p>p1时,确定所述待识别声音数据具有中等噪音水平,p2为预设的第二阈值,且p1>p2;
当p<p2时,确定所述待识别声音数据具有高噪音水平。
5.根据权利要求4所述的关键词识别方法,其特征在于,p1等于0.8,p2等于0.45。
6.根据权利要求1所述的关键词识别方法,其特征在于,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息。
7.一种关键词识别装置,其特征在于,包括:
分帧处理单元,适于将获取的待识别的声音数据划分为多个重叠的声音帧;
频域转换单元,适于对划分得到的多个声音帧的声音信号分别进行快速傅立叶变换运算,得到对应的频谱能量;
第一计算单元,适于将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数;
第二计算单元,适于根据各个声音帧对应的MFCC参数,分别计算得到所述待识别声音数据与预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值;所述多个参考模板中分别包括对应的关键词的语音内容;在计算所述待识别的声音数据与所述预设的多个参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值时,将所述待识别的声音数据与参考模板划分为I帧;用于DTW距离、欧式距离和互相关距离计算计算的每跳大小为0.1I帧,在计算得到当前待识别声音数据的I帧与参考模板的I帧的DTW距离、欧式距离和互相关距离之后,将I个DTW距离的中值作为所述待识别声音数据与对应的参考模板的DTW中值,将I个欧式距离的中值作为所述待识别声音数据与对应的参考模板的欧式距离中值,将I个互相关距离的中值作为所述待识别声音数据与对应的参考模板的互相关距离中值;
判断单元,适于判断当前声音帧与当前参考模板之间的DTW距离中值、欧氏距离中值和互相关距离中值三者的均值是否小于预设的阈值;
关键词识别单元,适于当确定所述待识别声音数据与当前参考模板之间的DTW距离、欧氏距离中值和互相关距离中值的均值小于预设的阈值时,将当前参考模板中的关键词作为所述待识别声音数据的关键词识别结果。
8.根据权利要求7所述的关键词识别装置,其特征在于,还包括触发单元,所述触发单元适于在所述待识别声音数据的频谱能量大于预设的能量阈值时,触发所述第一计算单元执行所述将各个声音帧对应的频谱能量转换为梅尔频率下的频谱能量,并计算对应的MFCC参数的操作。
9.根据权利要求7所述的关键词识别装置,其特征在于,所述预设的阈值与所述待识别声音数据的噪音水平相关联。
10.根据权利要求9所述的关键词识别装置,其特征在于,所述待识别声音数据的噪音水平包括低噪音水平、中等噪音水平和高噪音水平,其中:
当p≥p1时,确定所述待识别声音数据具有低噪音水平,p表示所述待识别声音数据对应的绝对幅值,p1为预设的第一阈值;
当p2≥p>p1时,确定所述待识别声音数据具有中等噪音水平,p2为预设的第二阈值,且p1>p2;
当p<p2时,确定所述待识别声音数据具有高噪音水平。
11.根据权利要求10所述的关键词识别装置,其特征在于,p1等于0.8,p2等于0.45。
12.根据权利要求7所述的关键词识别装置,其特征在于,所述参考模板中包括瞬态噪声、静态噪声和特定人的丰富的语音内容的信息。
CN201510993729.8A 2015-12-25 2015-12-25 关键词识别方法及装置 Active CN106920558B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201510993729.8A CN106920558B (zh) 2015-12-25 2015-12-25 关键词识别方法及装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201510993729.8A CN106920558B (zh) 2015-12-25 2015-12-25 关键词识别方法及装置

Publications (2)

Publication Number Publication Date
CN106920558A CN106920558A (zh) 2017-07-04
CN106920558B true CN106920558B (zh) 2021-04-13

Family

ID=59454658

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201510993729.8A Active CN106920558B (zh) 2015-12-25 2015-12-25 关键词识别方法及装置

Country Status (1)

Country Link
CN (1) CN106920558B (zh)

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109065043B (zh) * 2018-08-21 2022-07-05 广州市保伦电子有限公司 一种命令词识别方法及计算机存储介质
CN112765335B (zh) * 2021-01-27 2024-03-08 上海三菱电梯有限公司 语音呼梯系统
CN116884396A (zh) * 2023-08-08 2023-10-13 上海交通大学 适合硬件进行处理的语音关键字识别方法及系统

Family Cites Families (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7894637B2 (en) * 2004-05-21 2011-02-22 Asahi Kasei Corporation Device, program, and method for classifying behavior content of an object person
CN101222703A (zh) * 2007-01-12 2008-07-16 杭州波导软件有限公司 一种基于语音辨识的移动终端的身份验证方法
CN101599269B (zh) * 2009-07-02 2011-07-20 中国农业大学 语音端点检测方法及装置
US8432368B2 (en) * 2010-01-06 2013-04-30 Qualcomm Incorporated User interface methods and systems for providing force-sensitive input
CN102509547B (zh) * 2011-12-29 2013-06-19 辽宁工业大学 基于矢量量化的声纹识别方法及系统
CN103021409B (zh) * 2012-11-13 2016-02-24 安徽科大讯飞信息科技股份有限公司 一种语音启动拍照系统
CN103065627B (zh) * 2012-12-17 2015-07-29 中南大学 基于dtw与hmm证据融合的特种车鸣笛声识别方法
CN103971678B (zh) * 2013-01-29 2015-08-12 腾讯科技(深圳)有限公司 关键词检测方法和装置
CN103854645B (zh) * 2014-03-05 2016-08-24 东南大学 一种基于说话人惩罚的独立于说话人语音情感识别方法
CN104978507B (zh) * 2014-04-14 2019-02-01 中国石油化工集团公司 一种基于声纹识别的智能测井评价专家系统身份认证方法
CN104103272B (zh) * 2014-07-15 2017-10-10 无锡中感微电子股份有限公司 语音识别方法、装置和蓝牙耳机
CN104103280B (zh) * 2014-07-15 2017-06-06 无锡中感微电子股份有限公司 基于动态时间归整算法的离线语音端点检测的方法和装置
CN104778951A (zh) * 2015-04-07 2015-07-15 华为技术有限公司 语音增强的方法和装置

Non-Patent Citations (5)

* Cited by examiner, † Cited by third party
Title
"Voice Command Recognition system based on MFCC and DTW";Abhijeet Kumar;《International Journal or engineering Science and Technology》;20101231;全文 *
"Voice Recognition Algorithms using Mel Frequency Cepstral Coefficient and DTW techniques";Lindasalwa;《Journal of Computing》;20100331;第2卷(第3期);全文 *
"一种结合端点检测可检错的DTW乐谱跟随算法";吴康妍;《计算机应用与软件》;20150315;全文 *
"加权DTW距离的自动步态识别";刘志镜;《中国图像图形学报》;20101231;全文 *
"时间序列动态模糊聚类的研究";赵晓慧;《中国优秀硕士学位论文全文数据库 信息科技辑》;20141231;全文 *

Also Published As

Publication number Publication date
CN106920558A (zh) 2017-07-04

Similar Documents

Publication Publication Date Title
US9368116B2 (en) Speaker separation in diarization
CN108198547A (zh) 语音端点检测方法、装置、计算机设备和存储介质
US11580955B1 (en) Synthetic speech processing
US12080276B2 (en) Adapting automated speech recognition parameters based on hotword properties
WO2014153800A1 (zh) 语音识别系统
WO2017084360A1 (zh) 一种用于语音识别方法及系统
CN108305639B (zh) 语音情感识别方法、计算机可读存储介质、终端
CN106782508A (zh) 语音音频的切分方法和语音音频的切分装置
JP7604656B2 (ja) 検出のシーケンスに基づいたホットフレーズトリガ
US11308946B2 (en) Methods and apparatus for ASR with embedded noise reduction
Jung et al. Linear-scale filterbank for deep neural network-based voice activity detection
JP5282523B2 (ja) 基本周波数抽出方法、基本周波数抽出装置、およびプログラム
CN110827853A (zh) 语音特征信息提取方法、终端及可读存储介质
CN108682432B (zh) 语音情感识别装置
Tong et al. Evaluating vad for automatic speech recognition
Gowda et al. Quasi-closed phase forward-backward linear prediction analysis of speech for accurate formant detection and estimation
CN106356076B (zh) 基于人工智能的语音活动性检测方法和装置
US11978431B1 (en) Synthetic speech processing by representing text by phonemes exhibiting predicted volume and pitch using neural networks
CN106920558A (zh) 关键词识别方法及装置
US11574624B1 (en) Synthetic speech processing
JP6526602B2 (ja) 音声認識装置、その方法、及びプログラム
Joseph et al. Indian accent detection using dynamic time warping
US12488782B1 (en) Synthetic speech processing related to prosody prediction
Guo et al. Research on voice activity detection in burst and partial duration noisy environment
Singh et al. Robust Voice Activity Detection Algorithm based on Long Term Dominant Frequency and Spectral Flatness Measure

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant