CN1125437C - 语音识别方法 - Google Patents
语音识别方法 Download PDFInfo
- Publication number
- CN1125437C CN1125437C CN99105366A CN99105366A CN1125437C CN 1125437 C CN1125437 C CN 1125437C CN 99105366 A CN99105366 A CN 99105366A CN 99105366 A CN99105366 A CN 99105366A CN 1125437 C CN1125437 C CN 1125437C
- Authority
- CN
- China
- Prior art keywords
- feature
- voice
- word
- recognition method
- frame
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Fee Related
Links
- 238000000034 method Methods 0.000 title claims abstract description 76
- 238000012549 training Methods 0.000 claims abstract description 20
- 239000000284 extract Substances 0.000 claims abstract description 9
- 238000000605 extraction Methods 0.000 claims abstract description 8
- 230000008569 process Effects 0.000 claims description 27
- 230000003595 spectral effect Effects 0.000 claims description 22
- 230000001186 cumulative effect Effects 0.000 claims description 14
- 238000001228 spectrum Methods 0.000 claims description 12
- 238000000151 deposition Methods 0.000 claims 15
- 230000008676 import Effects 0.000 claims 2
- 238000005070 sampling Methods 0.000 claims 2
- 241001269238 Data Species 0.000 claims 1
- 238000007792 addition Methods 0.000 claims 1
- 230000008878 coupling Effects 0.000 claims 1
- 238000010168 coupling process Methods 0.000 claims 1
- 238000005859 coupling reaction Methods 0.000 claims 1
- 238000001514 detection method Methods 0.000 abstract description 4
- 238000012360 testing method Methods 0.000 description 11
- 238000004364 calculation method Methods 0.000 description 10
- 230000006870 function Effects 0.000 description 10
- 230000008901 benefit Effects 0.000 description 7
- 239000013598 vector Substances 0.000 description 6
- 230000004044 response Effects 0.000 description 5
- 238000005516 engineering process Methods 0.000 description 3
- 230000005284 excitation Effects 0.000 description 3
- 238000012545 processing Methods 0.000 description 3
- 238000005452 bending Methods 0.000 description 2
- 238000004891 communication Methods 0.000 description 2
- 238000012986 modification Methods 0.000 description 2
- 230000004048 modification Effects 0.000 description 2
- 230000001419 dependent effect Effects 0.000 description 1
- 238000010586 diagram Methods 0.000 description 1
- 230000007774 longterm Effects 0.000 description 1
- 230000011218 segmentation Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 230000001131 transforming effect Effects 0.000 description 1
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/10—Speech classification or search using distance or distortion measures between unknown speech and reference templates
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/26—Devices for calling a subscriber
- H04M1/27—Devices whereby a plurality of signals may be stored simultaneously
- H04M1/271—Devices whereby a plurality of signals may be stored simultaneously controlled by voice recognition
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/12—Speech classification or search using dynamic programming techniques, e.g. dynamic time warping [DTW]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/223—Execution procedure of a spoken command
Landscapes
- Engineering & Computer Science (AREA)
- Human Computer Interaction (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Telephonic Communication Services (AREA)
Abstract
语音拨号方法包括:如果用户输入电话号码和对应于电话号码的语音时,仅检测语音分段,提取并存储检测的语音分段的特征的训练步骤;如果接收到输入语音,仅检测语音分段,提取检测的语音分段的特征,把提取的特征与在训练步骤中存储的寄存字的特征比较,选择具有与输入语音特征最类似的特征的寄存字的识别步骤;如果在识别步骤中选择的寄存字的类似性没有超过预定阈值,则确定识别的结果是正确的和自动地拨对应于识别字的电话号码的步骤。
Description
技术领域
本发明涉及利用语音识别技术执行自动拨号功能的语音识别方法。
背景技术
人用语音与他人交流他的/她的思想。把人类之间交流工具的语音用作人机之间交流的工具。也就是说,把语音识别技术应用到操作日常使用的电气或电子设备。特别是把语音识别技术应用到移动电话具有各种使用上的优越性。
发明内容
由此,本发明涉及克服有关技术中一种或多种限制和缺陷的语音识别方法。本发明的目的是要提供一种通过把现有语音识别算法应用到具有内置声码器的移动电话而允许利用语音拨号的语音识别方法。
下面的说明中将指出本发明的附加特征和优点,并且将从说明中部分地了解,或从本发明的实践中部分地学到它们。通过如写出的说明书和权利要求以及附图中说明的结构将实现和获得本发明的目的和其它优点。
为实现这些和其它优点,根据如同实施例体现的和概括说明的本发明的目的,在调制输入语音和具有用于为调制的语音信号编码的内置声码器的电话中,语音识别方法包括:训练步骤,如果用户输入一个电话号码和对应于所述电话号码的语音,在所述声码器进行编码,利用作为编码结果而输出的信息仅检测语音分段,并提取和存储检测的语音分段的特征;识别步骤,如果接收到输入的语音,在所述声码器进行编码,利用作为编码结果而输出的信息仅检测语音分段,提取检测的语音分段的特征,把提取的特征与在所述训练步骤过程中存储的寄存字的特征比较,和选出具有与输入语音的特征最类似的特征的寄存字;和确定步骤,如果在所述识别步骤中选出的寄存字的类似性不超过预定阈值,确定识别的结果是正确的,并且自动拨出对应于识别的字的电话号码,其中,所述识别步骤包括提取已经在所述声码器编码的LSP参数并且将提取的LSP参数变换为伪对数倒频谱的步骤。
训练步骤和识别步骤的特征在于,仅检测来自输入信号的实际发音的语音分段,使用代码薄增益作为能量信息,把代码薄增益作为声码器编码结果输出。
训练步骤和识别步骤的特征在于,提取对应于语音分段的帧的频谱系数作为特征,如果检测了语音分段则把系数作为编码结果输出。
识别步骤的特征在于,把提取的特征与训练步骤中存储的寄存字的特征比较,如果帧的特征对应于语音分段,则选择具有与输入语音特征最类似特征的寄存字。
识别步骤的特征在于,在把从输入语音提取的频谱系数与训练步骤中寄存的每个字的频谱系数的比较中使用动态时间弯曲(dynamictime warping)(DTW)。
识别步骤的特征在于,为了选择具有与输入语音特征最类似特征的寄存字,在DTW之前进行预选择步骤。
预选择步骤的特征在于,仅利用从每个帧提取的部分频谱信息进行DTW以选择预定数量的具有相对高的类似性的寄存字,和随后对选出的寄存字进行DTW以最终选出具有与输入语音最高类似性的寄存字。
语音识别技术中最简单的一种是与讲话者有关的单字识别。
根据这种技术,只有事先经过训练的人的语音能够被识别,并且只有以字(或短的语句)为单位说出的语音能够被识别。
有各种现有语音识别算法。可以把它们大致分类为,语音分段检测法,特征提取法,和匹配法。
这些方法需要相对大的计算量,因而需要高速处理器。但是,市场上销售的移动电话装备有提取语音频谱参数的内置声码器,由此,本发明的优点在于不需要专门的特征提取处理。
应当理解上述的一般说明和以下的详细说明都是示例和解释性的,并且只是为了提供对权利要求定义的本发明的进一步的说明。
为了提供对本发明的进一步的理解,所涉及的、与说明书结合并构成说明书的一部分的附图示出了本发明的实施例,并且与说明书一同用于解释本发明的原理。
附图说明
在附图中:
图1是显示根据本发明的语音识别电话的方框图;
图2是显示根据本发明的语音识别算法的语音训练处理的流程图;
图3是显示根据本发明的语音识别算法的语音匹配处理的流程图;
图4是显示根据本发明的语音识别算法的语音识别处理的流程图;
图5是显示根据本发明的检索区设置状态的坐标平面;和
具体实施方式
从以下本发明的详细说明可以对本发明的其它目的、特征和优点有更清楚的了解。
以下参考附图详细说明本发明的优选实施例。
图1所示的本发明的语音识别电话系统包括:话筒(以下简称mic)11,扬声器12,编译码器(CODEC)13,声码器14,控制器15,数据存储器16,和程序存储器17。
在该构造中,mic11把用户发音并输入的语音信号转换成电信号,并把电信号提供给CODEC13。扬声器12将语音从CODEC13输出到外部。
CODEC13把经由mic11接收的语音调制成脉码调制(PCM)或-lawPCM数据,并输出到声码器14。
CODEC13也解调来自声码器14的输出语音信号,并向扬声器12提供输出信号。
声码器14为PCM或-law PCM数据编码。
此时,声码器14的输出数据是由代表频谱信息和增益的系数和用于模拟语音激励信号的信息构成的。
例如,在QCELP情况下有一个LSP系数,一个代码薄索引和增益,以及长期预测器的延迟值和增益。
用于控制语音识别电话整个操作的控制器15根据为语音识别功能存储在程序存储器17中的语音识别序列控制训练和识别处理,并且在与声码器14交流数据时写入和读出需要的数据。
数据存储器16存储电话操作所需数据和用于语音识别功能的寄存字的参考图形。
程序存储器17存储用于电话操作的每个序列。
把语音识别算法划分为用于生成寄存字参考图形数据库的训练处理和将输入语音与寄存字比较以识别语音的识别处理。
首先,在训练处理中,如图2中所示,寄存要识别的字。
也就是说,一旦用户输入了一个电话号码和对应于该电话号码的语音,分析输入的语音,以提取它的特征,并把该特征存储在数据存储器1 6中。
此时,把特征赋予对应的电话号码。
更具体地说,一旦用户用十个键输入了希望的电话号码(步骤201),电话经过扬声器12输出指示用户输入语音的消息(步骤202)。
随后,当用户把对应于输入电话号码的语音(例如,对应于911的语音是“消防站”)给予mic11时(步骤203),CODEC13将输入的语音调制为PCM或-law PCM数据,声码器14对从CODEC13接收的调制语音进行编码(步骤204)。
把语音信号划分为短的分段信号(即,帧),以便按帧编码。作为编码的结果,产生了频谱信息和激励代码薄增益。根据每帧的能量信息仅检测来自输入信号的实际发音的分段,即,语音分段(步骤205)。利用从声码器14输出的代码薄增益作为能量信息。具体地说,代码薄增益指示了语音的大小信息。如果增益超过预定值,那么把对应的信号确定为语音。如果在步骤205检测到语音分段,那么把对应于语音分段的帧的频谱系数存储在数据存储器16中(步骤206)。也就是说,把语音信号帧的频谱信息用作语音特征。提取所有的帧的特征以便存储或用作识别。本发明利用从声码器14输出的LSP系数作为特征。把语音分段中的帧的所有编码数据存储在数据存储器16中,以便在识别处理过程中用语音通知识别的结果。此后,如果用户有更多的电话号码要输入,过程返回到步骤201,并重复进行上述各个步骤。如果没有电话号码要输入,过程结束(步骤207)。
在识别处理中,如图3所示,语音识别是通过把要识别的字与在训练处理中存储的寄存字比较并取出最类似的字这样的方式完成的。
一旦根据存储在数据存储器16中的寄存字的特征识别出语音,在识别处理中自动拨出对应于识别出的语音特征的电话号码。
具体地说,当输入语音后,分析输入的语音并提取它的特征。把提取的特征与存储的寄存字比较,并且选出具有与输入语音最类似特征的寄存字。
如果类似性满足了预定的水准,那么确定识别的结果为正确,因而自动拨出对应于被识别字的电话号码。另一方面,如果类似性没有达到预定水准,那么可以假设说出的是未寄存的字,因而过程返回到识别处理的开始步骤。
更具体地说,电话经过扬声器12输出指令用户给出语音的消息(步骤301),接下来用户对mic11说出对应于要拨电话号码的事先寄存的字(步骤302)。
例如,如果对于911寄存了“消防站”,那么要拨911的用户应当说出“消防站”。
然后,如图2所示的一样,CODEC13把输入语音调制为PCM或-law PCM数据,声码器14对来自CODEC13的调制输入信号进行编码(步骤303)。
把语音信号划分成短的分段信号(即,帧),以便按帧编码。作为编码的结果,产生频谱信息和激励代码薄增益。
根据每帧的能量信息仅检测来自输入信号的实际发音分段,即,语音分段,并且把从声码器14输出的代码薄增益用作能量信息(步骤304)。
即,步骤301至304与图2中所示的训练处理中的对应步骤相同。
一旦在步骤304检测到语音分段,那么执行搜索寄存语音以找出一个与输入语音最类似语音的匹配步骤(步骤305)。
也就是说,把存储的寄存字的特征与输入语音的特征比较,选出与输入语音特征最类似的寄存字的特征。选出的特征就是识别的结果。
对于这个结果,把从输入语音提取的频谱系数与在训练处理中寄存的每个字的频谱系数比较,以计算类似性。
在计算了所有有关寄存字的类似性之后,提取最高类似性的寄存字。
在类似性计算过程中,输入语音的发音速度可能与存储语音的发音速度不同,由此对语音应用时间弯曲(time-warping),以减小语音发音速度造成的误差。对于时间弯曲使用了动态时间弯曲(DTW)。
同一个用户有可能在每次用不同的速度说出相同的字,由此,由于说话速度的差异,语音信号可能在时间域中是非线性弹性的。
DTW是一种用于将测试图形(即,输入语音)与参考图形(即,存储的寄存字)比较,并确定两个图形之间的类似性,因而消除时间域中的变化的时间调节计算方法。
由于测试图形和参考图形的时间分段不重合,所以根据一种非线性时间弯曲方法确定时标。
时标确定是利用DTW方法完成的。当使用DTW方法时,可以动态地确定一个通过其使输入图形与参考图形之间的类似性最大的路径,因而同时地进行字边界检测、非线性时间校准和识别三个处理。
由此,没有可能产生由于字边界与时间校准中发生的误差而造成的识别误差。
对于DTW,如图5中所示,把要进行匹配的两个序列的长度分别表示为N和M。
如果要比较的两个序列长度M和N的较大的值超过了它们中较小的值的二倍,那么几乎不存在两个序列相符的可能性,因而不进行匹配处理并把匹配失真设置为预定的最大值。
在输入字与寄存字之间的长度差超过较短的一个的二倍时,进行该操作从识别字对输入语音的类似性确定排除一个寄存字。
为两个序列的匹配形成一个具有M×N个格点的二维正交坐标。
寄存字的长度,即,参考图象帧的数量,与输入语音的长度,即,测试图形帧的数量比较,并且为了平滑计算使具有更多帧的图形位于M轴。
建立一个窗口通过限定最优路径搜索范围减少不必要的计算。
由于同一个用户说话不存在大的差异,可以建立窗口以便限制搜索范围。
建立窗口可以用各种方法实现。在本发明中,如下确定窗口,以易于建立窗口而不必计算斜率和提高计算速度,因而提高响应速度。
语音图形R和T是相对于特征提取的特征矢量序列,可以如下表示:
R=[R1,R2,…,Rm,…,RM]
T=[T1,T2,…,Tn,…,TN]
图形R和T分别沿m轴和n轴变化。语音图形特征矢量之间的差属于C(k)系列,并且表示如下:
F=C(1),C(2),…,C(k),…C(K),
其中C(k)=(m(k),n(k)),F是把一个时间域从测试图形投射到参考图形的时间域的弯曲函数。
弯曲函数用于找出最小距离的最优路径m=W(n)。然后,建立限定最优路径搜索范围的窗口,减少不必要的计算。由于在同一个人说话时没有大的语音上的差别,因而可以建立窗口以便限制最优路径搜索区。首先分别画出从起始格点(1,1)和结束格点(M,N)开始的具有斜率1的斜线。
如果把两个斜线水平移动一个预定值(N/2n,其中N是帧数,n是自然数,并且在n是2时产生最适合的值),两个斜线之间的格点落在为匹配而要搜索的区内。设置窗口的宽度为N/2n以便消除除法的复数除数,因而只有一个移位器有效使用。
在此,N可以是测试图形的帧数,或参考图形的帧数。
搜索窗口内的一个格点(m,n)具有两个序列的第m个特征和第n个特征的最小累积距离值。
为特征值定标,使其具有一个0~5000的整数值。
限制一个小的分段路径,以避免在特定时间分段的过度压缩和过度控制。示出了作为一个实施例的确定最小分段路径的方法。
三个可能方向(m-1,n-1),(m-1,n),和(m,n-1)中的一个通过弯曲函数移动到一个特定格点(m,n)。
例如,有三种达到格点(m,n)的路途:1)从格点(m-1,n-1)至格点(m,n)的直接移动;2)从格点(m-1,n)至格点(m,n)的间接移动;和3)从格点(m,n-1)至格点(m,n)的间接移动。〖公式1〗
初始状态:D1,1=2d1,1
1≤m≤M,1≤n≤N
Dm,n:在格点(m,n)的最小累积距离
dm,n:在格点(m,n)的两个特征之间的距离
a1,m i:第一序列的第m个特征的i序数值
a2,n i:第二序列的第n个特征的i序数值
P:一个特征的序数
此时,到达的格点(m,n)与图形R的第m帧和图形T的第n帧之间的欧几里德距离或对数倒频谱距离的加权Wmn相关。
把加权Wmn应用到各间接路径,并且把加权2Wmn应用到直接路径,因而如公式1中所示,把在格点(m,n)的两个特征之间的距离定义为dm,n。
对应于两个特征不同序数的值之间的差全部相加,得到两个特征之间的距离。
根据公式1计算在格点(m,n)的最小累积距离,如果计算的值超过一个整数的范围,那么用一个最大整数值替换之。
从底行开始向上相继计算搜索区内各格点的最小累积距离值。
存储前面一行的最小累积距离值,因为需要用它们来计算当前行的最小累积距离值。
用两个序列长度的和(M+N)除格点(M,N)处最小累积距离而得到最终匹配记录。
将这种DTW处理进行与寄存字数一样多的次数,以计算有关寄存字的所有类似性。计算完成之后,提取最类似的寄存字。
如果提取的最类似的寄存字与输入语音之间的类似性满足了移动水准,例如,它没有超过预定阈值,确定识别结果是正确的。
如果成功地完成了匹配处理(步骤306),自动地拨出对应于寄存字的电话号码(步骤307)。
作为替代,如果提取的最类似寄存字与输入语音之间的类似性超过了预定阈值,那么确定输入了一个未寄存的语音,并且过程返回到步骤301接收新的语音。
在必要时可以删除或增加这个步骤。
如图4中所示,当经过mic11输入了语音时(步骤401),把语音调制为PCM或-law PCM信号,然后在声码器14编码(步骤402)。
将编码语音信号划分为短分段信号(帧),并测量能量和每个帧的零相交率,以便仅检测实际发音的语音分段(步骤403)。
例如,可以将作为编码结果而产生的代码薄增益用作能量信息。
如果在步骤403检测到了语音分段,那么提取对应于语音分段的帧的特征。在本发明中,使用了声码器14,因而把声码器14输出的LSP系数作为特征使用。
声码器14提供语音的频谱参数,例如,作为编码结果的LSP系数,由此,本发明的优点在于不需要用于提取特征的专门处理。〖公式2〗
i=1,…,N(N:对数倒频谱序数)
M:LSP序数。
由于LSP系数具有上述问题,由此根据公式2把LSP系数转换为伪对数倒频谱(步骤404)。如下面公式3所示,一个特定信号的对数倒频谱是对该信号的对数反傅里叶变换(IFT)。对数倒频谱系数是推导出的结果。〖公式3〗
其中S(w)是功率频谱,Cn是对数倒频谱系数。
“对数倒频谱(cepstrum)”一词是用相反的次序重新排列字“频谱(spectrum)”的前几个字母而形成的。
由于对数倒频谱是一个频域函数的逆变换,由此可以把对数倒频谱定义为一个时间域的函数。对数倒频谱的特点之一是要把频谱包络信息和区域结构从语音信息分离开。
根据下面的公式4,对数倒频谱距离最好是等于rms(均方根)log频谱距离。
〖公式4〗 因此,在使用对数倒频谱时可以容易地得到功率频谱之间的差,所以对数倒频谱被广泛使用。
但是,不可能从LSP参数获得对数倒频谱,所以如公式2中所示那样,把LSP参数变换为类似于对数倒频谱的伪对数倒频谱。
把变换的伪对数倒频谱用作测试图形或参考图形的特征矢量。
也就是说,如果存储了语音信号的参考图形,那么把特征矢量存储在数据存储器16中作为参考图形。在语音匹配处理的情况下,输入语音的测试图形被用作特征矢量,所以在匹配处理过程中把作为测试图形的特征矢量与参考图形比较(步骤405)。
当在步骤405测量测试图形与参考图形之间的类似性时,输入语音的发音速度可能与存储语音的发音速度不同,因此进行有关语音的时间弯曲,以减小误差。为时间弯曲使用了DTW方法。
在进行了与寄存参考图形数量一样多次数的DTW和计算了有关所有寄存参考图形的类似性之后,提取最类似的参考图形。
有多种DTW方法。本发明使用了一种测量测试图形与以数据库形式存储的各参考图形之间的频谱距离并选出具有最短频谱距离的参考图形作为识别图形的方法。
如果在步骤405提取的参考图形的类似性满足了预定水准,例如,它不超过一个预定的阈值,那么确定识别的结果是正确的(步骤406),并把提取的参考图形作为识别处理的结果输出(步骤407)。
另一方面,如果提取的参考图形与测试图形之间的类似性超过了预定阈值,那么确定输入了未寄存的语音。
但是,DTW算法需要一定的计算量,所以响应时间相对较长。
采用预选择处理来改善这一问题。在选出最类似输入语音的寄存字之前进行该处理。在该处理过程中,通过简单计算得到几个具有相对高的类似性的寄存字。
因而减少了寄存字候选者,使得DTW算法进行的次数可以减少。结果,可以提高响应速度。
预选择方法中的一种是通过仅利用从每个帧提取的频谱信息的一部分进行DTW而确定N个候选者,然后对有关N个候选者进行DTW,以便确定一个最终的候选者。
通过减少频谱系数的序数的方法,分抽样帧的方法,或共同使用两种方法的方法来检测一部分信息。
另一种预选择的方法是利用比DTW少的计算的线性匹配法确定N个候选者和对有关N个候选者执行DTW,以便确定有关最终候选者。
采用前面一种方法用于本发明的实施例。根据前面一种方法,使用了10个序数LSP系数中的四个,因而减少了为每个帧产生的代码的数量。对帧进行2比1比率的分抽样,因而跳过一帧进行最优路径搜索。
如上所述,本发明的语音识别方法利用移动电话终端中声码器输出的代码薄增益仅检测语音分段,并且通过利用频谱参数作为特征而将具有较少附加计算量的语音识别功能应用于该终端,因而允许在移动终端中简单地实现语音识别功能。语音识别功能的采用可以在该终端使用中产生各种优点。
此外,本发明在输入语音与相应的寄存参考语音的比较中使用了DTW,并且在DTW之前进行了预选择处理,因此减少了与语音响应有关的响应时间。
本发明可以应用到PDA和其它具有与本实施例同样功能的系统中。
熟悉本发明的技术人员应当知道,可以对本发明的语音识别方法进行各种改造和改变,而不脱离本发明的精神和范围。因此,本发明将包括对本发明的改造和改变,主要它们在附属的权利要求及其等同物的范围中。
Claims (19)
1.在调制输入语音并具有用于对调制的语音信号编码的内置声码器的电话中,一种语音识别方法包括:
训练步骤,如果用户输入一个电话号码和对应于所述电话号码的语音,在所述声码器进行编码,利用作为编码结果而输出的信息仅检测语音分段,并提取和存储检测的语音分段的特征;
识别步骤,如果接收到输入的语音,在所述声码器进行编码,利用作为编码结果而输出的信息仅检测语音分段,提取检测的语音分段的特征,把提取的特征与在所述训练步骤过程中存储的寄存字的特征比较,和选出具有与输入语音的特征最类似的特征的寄存字;和
确定步骤,如果在所述识别步骤中选出的寄存字的类似性不超过预定阈值,确定识别的结果是正确的,并且自动拨出对应于识别的字的电话号码,
其中,所述识别步骤包括提取已经在所述声码器编码的线谱对参数并且将提取的线谱对参数变换为伪对数倒频谱的步骤。
2.如权利要求1所述的语音识别方法,其中所述训练步骤包括:
第一步骤,如果用户输入电话号码和对应于所述电话号码的语音,调制输入的语音以提供对所述声码器的输出,把语音信号划分为帧,并按帧进行编码;
第二步骤,利用代码薄增益作为能量信息,仅检测来自输入信号的实际发音的语音分段,所述代码薄增益是在所述第一步骤作为编码结果输出的;
第三步骤,如果在所述第二步骤检测到语音分段,存储对应于语音分段的帧的频谱系数作为特征,所述系数是作为编码结果输出的;和
第四步骤,如果有另一个电话号码输入,返回到所述第一步骤以重复所述各步骤。
3.如权利要求2所述的语音识别方法,其中在所述第三步骤中,把从所述声码器输出的线谱对系数用作特征。
4.如权利要求2所述的语音识别方法,其中所述第三步骤包括为用语音识别的结果的信息存储对应于语音分段的帧的所有编码数据的步骤。
5.如权利要求1所述的语音识别方法,其中所述伪对数倒频谱变换步骤是如下式定义的:
i=1,…,N,其中N为对数倒频谱序数;
M:线谱对序数;
Ci:第i个伪对数倒频谱;
lj:第j个线谱对。
6.如权利要求1所述的语音识别方法,其中所述识别步骤包括:
第一步骤,如果用户用语音输入要呼叫的目的地,调制输入的语音以提供对所述声码器的输出,将语音信号划分为帧,并按帧进行编码;
第二步骤,利用代码薄增益作为能量信息,仅检测来自输入信号的实际发音的语音分段,所述代码薄增益是在所述第一步骤作为编码结果输出的;
第三步骤,如果在所述第二步骤检测到语音分段,提取对应于作为编码结果输出的语音分段的帧的频谱系数作为特征,把提取的特征与在所述训练步骤中存储的寄存字的特征比较,并选出具有与输入语音的特征最类似的特征的寄存字。
7.如权利要求6所述的语音识别方法,其中在所述第三步骤中,在从输入语音提取的频谱系数与所述训练步骤中寄存的每个字的频谱系数的比较中使用了动态时间弯曲。
8.如权利要求7所述的语音识别方法,其中所述动态时间弯曲包括步骤:
形成一个具有M×N个格点的二维正交坐标平面,以便匹配输入语音和存储的寄存字的特征集的两个序列,其中M是输入语音的帧的数量,N是一个寄存字的帧的数量;
在所述二维正交坐标平面上画出分别从起始格点(1,1)和终止格点(M,N)开始的、具有斜率1的两条斜线,把两条斜线水平地移动预定值N/2n以建立用于匹配的搜索区,其中N是帧的数量,n是自然数;
计算在所述搜索区内的一行中的每个格点处的两个特征之间的距离,并选出通过其实现两个特征间最小距离的路径;
对所述搜索区内所有行重复所述最小路径选择步骤;和
在所述终止格点(M,N)用两个序列的和(M+N)除最小累积距离,以计算最终匹配记录。
9.如权利要求8所述的语音识别方法,其中在每个格点的两个特征之间的所述距离是通过把所有对应于两个特征的相应序数的值的差相加而计算出的,并且如下式定义:
初始状态:D1,1=2d1,1
1≤m≤M,1≤n≤N
Dm,n:在格点(m,n)的最小累积距离;
dm,n:在格点(m,n)的两个特征之间的距离
a1,m i:第一序列的第m个特征的i序数值;
a2,n i:第二序列的第n个特征的i序数值;
P:一个特征的序数。
10.如权利要求9所述的语音识别方法,其中如果最小累积距离值超过一个整数范围,用一个最大整数值替换在每个格点(m,n)的最小累积距离的值。
11.如权利要求10所述的语音识别方法,其中所述搜索区内每行中的所述格点(m,n)具有测试图形和参考图形的两个序列的第m和第n个特征的最小累积距离值。
12.如权利要求11所述的语音识别方法,其中通过把一个距离值从前面一个格点(m-1,n-1)直接移动到当前格点(m,n)和把距离值从两个相邻格点(m-1,n)和(m,n-1)间接移动到当前格点(m,n)的至少一种功能的方式反复地产生所述搜索区内每行中所述格点(m,n)的新路径值。
13.如权利要求12所述的语音识别方法,其中存储每个前面一行中的最小累积距离值,以获得当前行中的最小累积距离值。
14.如权利要求6所述的语音识别方法,其中所述第三步骤包括在选择具有与输入语音的特征最类似特征的寄存字之前的预选择步骤。
15.如权利要求14所述的语音识别方法,其中所述预选择步骤包括仅利用从每帧提取的频谱信息的一部分进行动态时间弯曲以选出预定数量的具有相对高的类似性的寄存字,并且相继地进行有关的选出的寄存字的动态时间弯曲以最后选出具有与输入语音最高类似性的寄存字的步骤。
16.如权利要求15所述的语音识别方法,其中所述预选择步骤包括减少从每帧提取的频谱系数的序数并进行动态时间弯曲以选出预定数量的具有相对高的类似性的寄存字的步骤。
17.如权利要求15所述的语音识别方法,其中所述预选择步骤包括对帧分抽样以减少帧的数量和进行动态时间弯曲以选出预定数量的具有相对高的类似性的寄存字的步骤。
18.如权利要求15所述的语音识别方法,其中所述预选择步骤包括减少从每帧提取的频谱系数的序数,对帧分抽样,和进行动态时间弯曲以选出预定数量的具有相对高的类似性的寄存字的步骤。
19.如权利要求14所述的语音识别方法,其中所述预选择步骤包括利用线性匹配法选出预定数量的具有相对高的类似性的寄存字和相继地对有关选出的寄存字进行动态时间弯曲以最后选出具有与输入语音最高类似性的寄存字的步骤。
Applications Claiming Priority (6)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR15108/1998 | 1998-04-28 | ||
| KR1019980015109A KR100293465B1 (ko) | 1998-04-28 | 1998-04-28 | 음성인식방법 |
| KR1019980015108A KR100287842B1 (ko) | 1998-04-28 | 1998-04-28 | 음성다이얼링방법 |
| KR15109/1998 | 1998-04-28 | ||
| KR15696/1998 | 1998-04-30 | ||
| KR1019980015696A KR100269357B1 (ko) | 1998-04-30 | 1998-04-30 | 음성 인식 방법 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN1238513A CN1238513A (zh) | 1999-12-15 |
| CN1125437C true CN1125437C (zh) | 2003-10-22 |
Family
ID=27349715
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN99105366A Expired - Fee Related CN1125437C (zh) | 1998-04-28 | 1999-04-28 | 语音识别方法 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US6321195B1 (zh) |
| CN (1) | CN1125437C (zh) |
Families Citing this family (19)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6754629B1 (en) * | 2000-09-08 | 2004-06-22 | Qualcomm Incorporated | System and method for automatic voice recognition using mapping |
| US6660042B1 (en) * | 2001-02-02 | 2003-12-09 | Rutgers, The State University Of New Jersey | Methods of biomimetic finger control by filtering of distributed forelimib pressures |
| DE10120513C1 (de) * | 2001-04-26 | 2003-01-09 | Siemens Ag | Verfahren zur Bestimmung einer Folge von Lautbausteinen zum Synthetisieren eines Sprachsignals einer tonalen Sprache |
| US7050973B2 (en) * | 2002-04-22 | 2006-05-23 | Intel Corporation | Speaker recognition using dynamic time warp template spotting |
| US20040111259A1 (en) * | 2002-12-10 | 2004-06-10 | Miller Edward S. | Speech recognition system having an application program interface |
| US20040186704A1 (en) * | 2002-12-11 | 2004-09-23 | Jiping Sun | Fuzzy based natural speech concept system |
| US7509257B2 (en) * | 2002-12-24 | 2009-03-24 | Marvell International Ltd. | Method and apparatus for adapting reference templates |
| KR100547858B1 (ko) * | 2003-07-07 | 2006-01-31 | 삼성전자주식회사 | 음성인식 기능을 이용하여 문자 입력이 가능한 이동통신단말기 및 방법 |
| KR100640893B1 (ko) * | 2004-09-07 | 2006-11-02 | 엘지전자 주식회사 | 음성 인식용 베이스밴드 모뎀 및 이동통신용 단말기 |
| US7567903B1 (en) * | 2005-01-12 | 2009-07-28 | At&T Intellectual Property Ii, L.P. | Low latency real-time vocal tract length normalization |
| US20070129945A1 (en) * | 2005-12-06 | 2007-06-07 | Ma Changxue C | Voice quality control for high quality speech reconstruction |
| JP2009527024A (ja) * | 2006-02-14 | 2009-07-23 | インテレクチャル ベンチャーズ ファンド 21 エルエルシー | 話者非依存的音声認識を有する通信装置 |
| KR100897553B1 (ko) | 2007-01-04 | 2009-05-15 | 삼성전자주식회사 | 사용자의 기기 사용 패턴을 이용한 음성 인식 방법 및 장치 |
| CN101030994A (zh) * | 2007-04-11 | 2007-09-05 | 华为技术有限公司 | 语音识别方法、系统、语音识别服务器 |
| WO2009008055A1 (ja) * | 2007-07-09 | 2009-01-15 | Fujitsu Limited | 音声認識装置、音声認識方法、および、音声認識プログラム |
| JP5533042B2 (ja) * | 2010-03-04 | 2014-06-25 | 富士通株式会社 | 音声検索装置、音声検索方法、プログラム及び記録媒体 |
| US10229685B2 (en) * | 2017-01-18 | 2019-03-12 | International Business Machines Corporation | Symbol sequence estimation in speech |
| CN109147770B (zh) * | 2017-06-16 | 2023-07-28 | 阿里巴巴集团控股有限公司 | 声音识别特征的优化、动态注册方法、客户端和服务器 |
| CN112329457B (zh) * | 2019-07-17 | 2024-07-23 | 北京声智科技有限公司 | 输入语音的识别方法及相关设备 |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE3482627D1 (de) * | 1983-04-11 | 1990-08-09 | Nec Corp | Orthogonale transformation und geraet zu ihrer durchfuehrung. |
| US4797929A (en) * | 1986-01-03 | 1989-01-10 | Motorola, Inc. | Word recognition in a speech recognition system using data reduced word templates |
| US4870686A (en) * | 1987-10-19 | 1989-09-26 | Motorola, Inc. | Method for entering digit sequences by voice command |
| US5007081A (en) * | 1989-01-05 | 1991-04-09 | Origin Technology, Inc. | Speech activated telephone |
| GB2297465B (en) * | 1995-01-25 | 1999-04-28 | Dragon Syst Uk Ltd | Methods and apparatus for detecting harmonic structure in a waveform |
-
1999
- 1999-04-21 US US09/295,523 patent/US6321195B1/en not_active Expired - Lifetime
- 1999-04-28 CN CN99105366A patent/CN1125437C/zh not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| US6321195B1 (en) | 2001-11-20 |
| CN1238513A (zh) | 1999-12-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN1125437C (zh) | 语音识别方法 | |
| CN1188831C (zh) | 具有多个话音识别引擎的话音识别系统和方法 | |
| US8589166B2 (en) | Speech content based packet loss concealment | |
| CN1119794C (zh) | 分布式话音识别系统 | |
| JP5037772B2 (ja) | 音声発話を予測的に量子化するための方法および装置 | |
| CN1168070C (zh) | 分布式语音识别系统 | |
| CN1160698C (zh) | 噪声信号中语音的端点定位 | |
| CN112133277B (zh) | 样本生成方法及装置 | |
| CN1125432C (zh) | 基于声码器的语音识别器、识别方法及数字蜂窝电话 | |
| CN1148720C (zh) | 说话者识别 | |
| US20230197061A1 (en) | Method and System for Outputting Target Audio, Readable Storage Medium, and Electronic Device | |
| CN1315809A (zh) | 用于移动通信的拼写语音识别装置和方法 | |
| CN1543640A (zh) | 在分布式语音识别系统中传输语音活动的方法和设备 | |
| CN1335980A (zh) | 借助于映射矩阵的宽频带语音合成 | |
| CN1238058A (zh) | 语音处理系统 | |
| CN1969319A (zh) | 信号编码 | |
| AU5958599A (en) | Automatic speech/speaker recognition over digital wireless channels | |
| JP2023539948A (ja) | ロングコンテキストエンドツーエンド音声認識システム | |
| CN1624766A (zh) | 语音编码中噪音鲁棒分类方法 | |
| CN1315721A (zh) | 客户服务器语音信息传送系统与方法 | |
| CN117497010A (zh) | 一种语音检测方法及其装置、电子设备、存储介质 | |
| CN1009320B (zh) | 语音识别 | |
| US20070129946A1 (en) | High quality speech reconstruction for a dialog method and system | |
| CN1607576A (zh) | 一种语音识别系统 | |
| KR100205060B1 (ko) | 정규 펄스 여기 방식을 이용한 celp 보코더의 피치검색 방법 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| C10 | Entry into substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| C06 | Publication | ||
| PB01 | Publication | ||
| C14 | Grant of patent or utility model | ||
| GR01 | Patent grant | ||
| C17 | Cessation of patent right | ||
| CF01 | Termination of patent right due to non-payment of annual fee |
Granted publication date: 20031022 Termination date: 20100428 |