JPH0568716B2 - - Google Patents
Info
- Publication number
- JPH0568716B2 JPH0568716B2 JP59058435A JP5843584A JPH0568716B2 JP H0568716 B2 JPH0568716 B2 JP H0568716B2 JP 59058435 A JP59058435 A JP 59058435A JP 5843584 A JP5843584 A JP 5843584A JP H0568716 B2 JPH0568716 B2 JP H0568716B2
- Authority
- JP
- Japan
- Prior art keywords
- standard pattern
- input
- dissimilarity
- audio
- frame
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 claims description 28
- 230000001186 cumulative effect Effects 0.000 claims 1
- 239000000284 extract Substances 0.000 claims 1
- 238000012545 processing Methods 0.000 description 12
- 230000008569 process Effects 0.000 description 10
- 238000010586 diagram Methods 0.000 description 5
- 238000010606 normalization Methods 0.000 description 5
- 230000004044 response Effects 0.000 description 3
- 238000001228 spectrum Methods 0.000 description 3
- 238000001514 detection method Methods 0.000 description 2
- 238000003708 edge detection Methods 0.000 description 2
- 230000014509 gene expression Effects 0.000 description 2
- 230000003595 spectral effect Effects 0.000 description 2
- 230000008901 benefit Effects 0.000 description 1
- 238000012790 confirmation Methods 0.000 description 1
- 230000008602 contraction Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 238000012827 research and development Methods 0.000 description 1
- 230000000717 retained effect Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 210000001260 vocal cord Anatomy 0.000 description 1
Description
【発明の詳細な説明】
(技術分野)
本発明は音声認識方法に関し、具体的には単語
入力音声の終端の確認を待たないで、入力音声の
始端検出から認識動作を開始するようにした音声
認識方法に関する。
入力音声の終端の確認を待たないで、入力音声の
始端検出から認識動作を開始するようにした音声
認識方法に関する。
(背景技術)
音声認識方法の一形式として、各標準音声に対
応して周波数成分のフレーム時系列として標準パ
ターンを記憶しておき、入力音声から同じく周波
数成分のフレーム時系列として入力パターンを抽
出し、入力パターンと各標準パターンとの非類似
度を計算し、その非類似度に基づいて入力音声を
識別する方法が知られている。
応して周波数成分のフレーム時系列として標準パ
ターンを記憶しておき、入力音声から同じく周波
数成分のフレーム時系列として入力パターンを抽
出し、入力パターンと各標準パターンとの非類似
度を計算し、その非類似度に基づいて入力音声を
識別する方法が知られている。
一例として、沖研究開発第118号第53頁、昭和
57年12月、に開示されている。このような方法に
おける標準又は入力の音声パターンは、通常、規
則的にフレームを設定して周波数分析し、対数変
換と最小自乗近似直線を用いた声帯振動特性等の
正規化とを経て、周波数成分のフレーム時系列と
して表現したものを用いる。
57年12月、に開示されている。このような方法に
おける標準又は入力の音声パターンは、通常、規
則的にフレームを設定して周波数分析し、対数変
換と最小自乗近似直線を用いた声帯振動特性等の
正規化とを経て、周波数成分のフレーム時系列と
して表現したものを用いる。
また、入力パターンと各標準パターンとの非類
似度を計算するためにマツチングパスを設定する
方法としては、動的計画法を用いたDPマツチン
グ法と前記文献に見られるような本質的に線形な
マツチング法とが知られている。構成の簡易化の
観点からは、線形マツチング法が有利であるが、
第1図に例示した如く、単語の発声速度は変動が
きわめて大きく、個人差があると共に心理状態や
状況によつても変動し、標準という感覚のもとで
すら20%〜40%の発声長のばらつきが見られ、何
等かの工夫が必要である。線形マツチング法には
種々の形式が提案されているが、前記文献に限ら
ず、そこでは入力音声の終端を検出したのち、マ
ツチングパスを設定していて、認識応答の面では
問題があり、入力パターンも始端から終端を確認
するまで記憶しておく必要がある。
似度を計算するためにマツチングパスを設定する
方法としては、動的計画法を用いたDPマツチン
グ法と前記文献に見られるような本質的に線形な
マツチング法とが知られている。構成の簡易化の
観点からは、線形マツチング法が有利であるが、
第1図に例示した如く、単語の発声速度は変動が
きわめて大きく、個人差があると共に心理状態や
状況によつても変動し、標準という感覚のもとで
すら20%〜40%の発声長のばらつきが見られ、何
等かの工夫が必要である。線形マツチング法には
種々の形式が提案されているが、前記文献に限ら
ず、そこでは入力音声の終端を検出したのち、マ
ツチングパスを設定していて、認識応答の面では
問題があり、入力パターンも始端から終端を確認
するまで記憶しておく必要がある。
(発明の目的)
本発明の目的は、入力音声の始端を検出して直
ちにマツチング動作を開始させることによつて認
識速度を高め、且つ発声速度変動を予想してマツ
チングパスを設定することによつて発声速度の変
動を吸収することにある。
ちにマツチング動作を開始させることによつて認
識速度を高め、且つ発声速度変動を予想してマツ
チングパスを設定することによつて発声速度の変
動を吸収することにある。
(発明の概要)
本発明の第1の特徴は、入力パターンの各フレ
ーム毎にマツチング処理を行ない、各フレーム毎
に各標準パターンの各マツチングパスに対応した
非類似度を更新記憶するようにしたことにある。
ーム毎にマツチング処理を行ない、各フレーム毎
に各標準パターンの各マツチングパスに対応した
非類似度を更新記憶するようにしたことにある。
まず、入力音声の有音状態の検出には音声パワ
ーを用いる方法を用いることができる。この場合
音声の始端検出はフレーム電力P(j)(但しjは入
力パターンのフレーム番号)があらかじめ定めら
れた閾値を越えた時点を始端と考える。但し外部
からの雑音などにより音声入力が行なわれていな
くとも電力P(j)が閾値を越えてしまい、誤つた始
端とする場合がある。そのため、ともかくフレー
ム電力P(j)が閾値を越えたフレームを始端と考え
認識処理を開始するものの連続して3フレーム以
上フレーム電力が閾値を越えなければその入力フ
レームを音声の始端とは考えず認識処理を中断し
始端検出のための処理へともどる。但し、フレー
ム長を16msecとしている。ここで音声の始端か
らフレーム電力が閾値を越えたフレームの番号付
けを定義しh番目の音声フレームと称し、単なる
入力フレーム番号とは区別する。すなわち、音声
フレーム番号hの音声フレームは、有音区間でh
番目の入力フレームに対応する。
ーを用いる方法を用いることができる。この場合
音声の始端検出はフレーム電力P(j)(但しjは入
力パターンのフレーム番号)があらかじめ定めら
れた閾値を越えた時点を始端と考える。但し外部
からの雑音などにより音声入力が行なわれていな
くとも電力P(j)が閾値を越えてしまい、誤つた始
端とする場合がある。そのため、ともかくフレー
ム電力P(j)が閾値を越えたフレームを始端と考え
認識処理を開始するものの連続して3フレーム以
上フレーム電力が閾値を越えなければその入力フ
レームを音声の始端とは考えず認識処理を中断し
始端検出のための処理へともどる。但し、フレー
ム長を16msecとしている。ここで音声の始端か
らフレーム電力が閾値を越えたフレームの番号付
けを定義しh番目の音声フレームと称し、単なる
入力フレーム番号とは区別する。すなわち、音声
フレーム番号hの音声フレームは、有音区間でh
番目の入力フレームに対応する。
発声速度の正規化を行なうマツチング処理を音
声の始端から開始し、音声分析部出力が得られる
周期(フレーム周期)ごとに行なえれば音声分析
部のデータを始端からすべて格納しておく必要も
なく、また、応答時間も速くなる。
声の始端から開始し、音声分析部出力が得られる
周期(フレーム周期)ごとに行なえれば音声分析
部のデータを始端からすべて格納しておく必要も
なく、また、応答時間も速くなる。
本発明の第2の特徴は発声がおそく行なわれた
場合、標準的に行なわれた場合、はやく行なわれ
た場合を想定したマツチングパスを設定しそれぞ
れのマツチングパス上でのマツチング処理を行な
うことにある。音声の始端検出時点では今から入
力される単語の発声速度は不明である。そこで発
声がおそく行なわれた場合、標準的に行なわれた
場合、はやく行なわれた場合を想定したマツチン
グパスを設定し、それぞれのマツチングパス上で
マツチング処理を行なえば終端検出前からでもマ
ツチング処理が開始可能となる。もちろん、この
場合、入力の終端と標準パターンの終端が一致す
るパスが存在する可能性は少ないが、入力の終端
と標準パターンの終端が最も一致しているパス上
での非類似度が最小となることが予想される。
場合、標準的に行なわれた場合、はやく行なわれ
た場合を想定したマツチングパスを設定しそれぞ
れのマツチングパス上でのマツチング処理を行な
うことにある。音声の始端検出時点では今から入
力される単語の発声速度は不明である。そこで発
声がおそく行なわれた場合、標準的に行なわれた
場合、はやく行なわれた場合を想定したマツチン
グパスを設定し、それぞれのマツチングパス上で
マツチング処理を行なえば終端検出前からでもマ
ツチング処理が開始可能となる。もちろん、この
場合、入力の終端と標準パターンの終端が一致す
るパスが存在する可能性は少ないが、入力の終端
と標準パターンの終端が最も一致しているパス上
での非類似度が最小となることが予想される。
一方、単語には「イチ」の「イ」と「チ」の間
のように単語内にフレーム電力が閾値に満たない
部分すなわち無音状態のフレームを持つ単語があ
る。このような部分を「パワーデイツプ」と称す
る。このパワーデイツプの長さは単語によつて異
なるが通常30フレーム長を越えることはほとんど
ない。音声の始端を検出後、あるフレーム時間点
においてそのフレーム電力が閾値未満すなわち無
音状態となつた場合、そのフレーム時間点はパワ
ーデイツプの始まりなのか、音声の終端なのかは
判断がつかない。この判定は通常、その時点から
30フレームの間に音声の始端条件(3フレーム以
上連続してフレーム電力が閾値以上)を満足する
フレームが存在するかしないかによつて行なうた
め最大30フレーム後でなければ判断が下されな
い。従つて、フレーム電力が閾値未満となつた場
合のマツチング結果は何らかの形で保留されなけ
ればならない。本発明では、音声フレーム番号の
更新を停止して、フレーム電力が閾値未満すなわ
ち無音状態となつたフレームに対してはマツチン
グ処理を停止することによりこの問題を解決す
る。
のように単語内にフレーム電力が閾値に満たない
部分すなわち無音状態のフレームを持つ単語があ
る。このような部分を「パワーデイツプ」と称す
る。このパワーデイツプの長さは単語によつて異
なるが通常30フレーム長を越えることはほとんど
ない。音声の始端を検出後、あるフレーム時間点
においてそのフレーム電力が閾値未満すなわち無
音状態となつた場合、そのフレーム時間点はパワ
ーデイツプの始まりなのか、音声の終端なのかは
判断がつかない。この判定は通常、その時点から
30フレームの間に音声の始端条件(3フレーム以
上連続してフレーム電力が閾値以上)を満足する
フレームが存在するかしないかによつて行なうた
め最大30フレーム後でなければ判断が下されな
い。従つて、フレーム電力が閾値未満となつた場
合のマツチング結果は何らかの形で保留されなけ
ればならない。本発明では、音声フレーム番号の
更新を停止して、フレーム電力が閾値未満すなわ
ち無音状態となつたフレームに対してはマツチン
グ処理を停止することによりこの問題を解決す
る。
第2図aは本発明による音声認識方法における
入力パターンと標準パターンとのマツチングを行
なう複数のマツチングパス例を示した図、第2図
bは入力パターンのフレーム電力例を示した図、
第2図cは入力パターンと標準パターンとの各マ
ツチングパスにおける非類似度Dn(j)、D′n(j)、
D″n(j)の例を示した図である。
入力パターンと標準パターンとのマツチングを行
なう複数のマツチングパス例を示した図、第2図
bは入力パターンのフレーム電力例を示した図、
第2図cは入力パターンと標準パターンとの各マ
ツチングパスにおける非類似度Dn(j)、D′n(j)、
D″n(j)の例を示した図である。
第2図aにおいては発声速度の範囲を例えば±
20%と考え、マツチングパスを3本設定した場合
を示している。第2図aにおいて、横軸は入力パ
ターンのフレーム番号を表わす。また、縦軸は標
準パターンのフレーム番号を表わし、n番目の標
準パターンSnを例として考え、そのフレーム長
をSL(n)とする。101は発声を20%遅く発声し
た場合を想定したパス、102は標準的な発声を
想定したパス、103は発声を20%速く想定した
場合のパスを示す。j番目の入力フレームの電力
が閾値以上の場合、3本のパス上での標準パター
ンSnとの距離を次式によつて与える。但し、h
はj番目の入力フレーム番号に対応した音声フレ
ーム番号であり、W(i、j)は入力フレーム番
号がjでチヤンネル番号がi(但し、i=1〜8)
の入力パターンの成分であり、Sn(i、k)はフ
レーム番号がkでチヤンネル番号がiの標準パタ
ーンの成分である。
20%と考え、マツチングパスを3本設定した場合
を示している。第2図aにおいて、横軸は入力パ
ターンのフレーム番号を表わす。また、縦軸は標
準パターンのフレーム番号を表わし、n番目の標
準パターンSnを例として考え、そのフレーム長
をSL(n)とする。101は発声を20%遅く発声し
た場合を想定したパス、102は標準的な発声を
想定したパス、103は発声を20%速く想定した
場合のパスを示す。j番目の入力フレームの電力
が閾値以上の場合、3本のパス上での標準パター
ンSnとの距離を次式によつて与える。但し、h
はj番目の入力フレーム番号に対応した音声フレ
ーム番号であり、W(i、j)は入力フレーム番
号がjでチヤンネル番号がi(但し、i=1〜8)
の入力パターンの成分であり、Sn(i、k)はフ
レーム番号がkでチヤンネル番号がiの標準パタ
ーンの成分である。
パス101に対する距離
dn(j)=8
〓i=1
|W(i、j)−Sn(i、k)|
但し
k=〔1/1.2h〕 〔1/1.2h〕≦SL(n)
SL(n) 〔1/1.2h〕>SL(n) ……第1式
パス102に対する距離
d′n(j)=8
〓i=1
|W(i、j)−Sn(i、k′)|
但し
k′=h
SL(n) h≦SL(n)
h>SL(n) ……第2式
パス103に対する距離
d″n(j)=8
〓i=1
|W(i、j)−Sn(i、k″)|
但し
k″=〔1/0.8h〕 〔1/0.8h〕≦SL(n)
SL(k) 〔1/0.8h〕>SL(n) ……第3式
尚、〔 〕はガウス記号を示す。
前記の式によればパス101においては入力パ
ターンのj番目の入力音声フレームと標準パター
ンのk番目のフレームの間の距離計算を行なう。
パス102においては入力パターンj番目の入力
フレームと標準パターンのk′番目のフレームの間
の距離計算を行ない、パス103においては入力
パターンのj番目の入力フレームと標準パターン
のk″番目のフレームの間の距離計算が行なわれ
る。但し、標準パターンのフレーム番号を示す
k、k′、k″はその標準パターンの長さSL(n)より
大きくなる場合にはSL(n)に制限される。
ターンのj番目の入力音声フレームと標準パター
ンのk番目のフレームの間の距離計算を行なう。
パス102においては入力パターンj番目の入力
フレームと標準パターンのk′番目のフレームの間
の距離計算を行ない、パス103においては入力
パターンのj番目の入力フレームと標準パターン
のk″番目のフレームの間の距離計算が行なわれ
る。但し、標準パターンのフレーム番号を示す
k、k′、k″はその標準パターンの長さSL(n)より
大きくなる場合にはSL(n)に制限される。
一方、j番目の入力フレームの電力が閾値未満
の場合、それぞれのパス上での距離dn(j)、d′n
(j)、d″n(j)を強制的に dn(j)=0 ……第4式 d′n(j)=0 ……第5式 d″n(j)=0 ……第6式 とすることによりフレーム電力が閾値以下の場合
の非類似度計算を事実上加算しない処理を行な
う。またこのために、標準パターンもパワーデイ
ツプ対応のフレームすなわち無音状態に対応する
フレームを除いた形で蓄積する。
の場合、それぞれのパス上での距離dn(j)、d′n
(j)、d″n(j)を強制的に dn(j)=0 ……第4式 d′n(j)=0 ……第5式 d″n(j)=0 ……第6式 とすることによりフレーム電力が閾値以下の場合
の非類似度計算を事実上加算しない処理を行な
う。またこのために、標準パターンもパワーデイ
ツプ対応のフレームすなわち無音状態に対応する
フレームを除いた形で蓄積する。
このように、パワーデイツプや標準パターンの
終端以後でのマツチングのように、非類似度とし
て重要でないフレームでは距離を0としているけ
れども、本発明では本質的に線形なマツチングで
ある。
終端以後でのマツチングのように、非類似度とし
て重要でないフレームでは距離を0としているけ
れども、本発明では本質的に線形なマツチングで
ある。
次に入力パターンのj番目の入力フレームまで
の非類似度Dn(j)、D′n(j)、D″n(j)が計算される。
の非類似度Dn(j)、D′n(j)、D″n(j)が計算される。
パス101の非類似度
Dn(j)=dn(j)+Dn(j−1) ……第7式
パス102の非類似度
D′n(j)=d′n(j)+D′n(j−1)……第8式
パス103の非類似度
D″n(j)=d″n(j)+D″n(j−1)……第9式
すなわち、それぞれのパス上でのj番目のフレ
ームの非類似度の算出は各チヤンネルごとの距離
(例えば|W(i、j)−Sn(i、k)|)をチヤン
ネル分、j−1番目のフレームに対する非類似度
値(たとえばDn(j−1))に加えることによつ
て得られる。これらの演算はj番目のフレームの
入力がなされた時点で行なわれる。j番目の入力
フレームに対する非類似度の算出にあたつてはj
番目のフレームの入力パターンデータとそれぞれ
のパスに相当する標準パターンのデータおよび1
フレーム前のj−1番目の入力フレームの目のフ
レームの非類似度データのみが必要であつて2フ
レーム以上前の入力パターンデータは不必要であ
る。そのため、終端を検出するまでの入力パター
ンを格納しておかなければならない線形伸縮マツ
チング法に比較しても記憶領域が小さくなる効果
が生じる。
ームの非類似度の算出は各チヤンネルごとの距離
(例えば|W(i、j)−Sn(i、k)|)をチヤン
ネル分、j−1番目のフレームに対する非類似度
値(たとえばDn(j−1))に加えることによつ
て得られる。これらの演算はj番目のフレームの
入力がなされた時点で行なわれる。j番目の入力
フレームに対する非類似度の算出にあたつてはj
番目のフレームの入力パターンデータとそれぞれ
のパスに相当する標準パターンのデータおよび1
フレーム前のj−1番目の入力フレームの目のフ
レームの非類似度データのみが必要であつて2フ
レーム以上前の入力パターンデータは不必要であ
る。そのため、終端を検出するまでの入力パター
ンを格納しておかなければならない線形伸縮マツ
チング法に比較しても記憶領域が小さくなる効果
が生じる。
第2図cは入力パターンと標準パターンとの各
マツチングパターンでの非類似度Dn(j)、D′n(j)、
D″n(j)を示したものであるが、第2図cに見られ
るようにフレーム電力が閾値以下となつたとき距
離値を強制的に0にすることにより非類似度Dn
(j)、D′n(j)、D″n(j)は保持される。従つて、終端
における非類似度と終端から30フレームへだてた
入力フレーム(この時点で初めて終端が検出され
る)における非類似度は等しい。
マツチングパターンでの非類似度Dn(j)、D′n(j)、
D″n(j)を示したものであるが、第2図cに見られ
るようにフレーム電力が閾値以下となつたとき距
離値を強制的に0にすることにより非類似度Dn
(j)、D′n(j)、D″n(j)は保持される。従つて、終端
における非類似度と終端から30フレームへだてた
入力フレーム(この時点で初めて終端が検出され
る)における非類似度は等しい。
次に、音声の終端を検出した時点(音声の終端
から30フレーム後)から各標準パターンごとに得
られた非類似度によつてカテゴリーの判定が行な
われる。終端検出時点の入力フレーム番号をj、
音声フレーム番号をHとするとn番目の標準パタ
ーンに対する各パスの非類似度はDn(j)、D′n(j)、
D″n(j)で与えられる。これらの非類似度の組が標
準パターンの数(Nとする)だけ存在する。これ
らの非類似度を用いてカテゴリー判定を行なう手
法について述べる。判定第1ステツプは次のよう
に行なわれる。まず、n番目の標準パターンに対
する各パスごとの非類似度Dn(j)、D′n(j)、D″n(j)
のうち1つが選択される。この選択にあたつては
音声終端検出時の音声フレーム番号Hに対して次
式で与えられるL、L′、L″が用いられる。
から30フレーム後)から各標準パターンごとに得
られた非類似度によつてカテゴリーの判定が行な
われる。終端検出時点の入力フレーム番号をj、
音声フレーム番号をHとするとn番目の標準パタ
ーンに対する各パスの非類似度はDn(j)、D′n(j)、
D″n(j)で与えられる。これらの非類似度の組が標
準パターンの数(Nとする)だけ存在する。これ
らの非類似度を用いてカテゴリー判定を行なう手
法について述べる。判定第1ステツプは次のよう
に行なわれる。まず、n番目の標準パターンに対
する各パスごとの非類似度Dn(j)、D′n(j)、D″n(j)
のうち1つが選択される。この選択にあたつては
音声終端検出時の音声フレーム番号Hに対して次
式で与えられるL、L′、L″が用いられる。
パス101 L=〔1/1.2H〕 ……第10式
パス102 L′=H ……第11式
パス103 L″=〔1/0.8H〕 ……第12式
これらの値L、L′、L″は音声フレームに対応
する標準パターンのフレーム数を与える式に類似
しているが、標準パターンの長さにSL(n)によつ
て制限されることはない。従つて、L、L′、
L″は標準パターンの種類とは無関係である。こ
れらL、L′、L″のうち標準パターンの長さSL(n)
に最も近い値を示すパスに対応する非類似度のみ
を選択する。たとえば、L′がSL(n)に最も近いと
するとパス102が対応しそれに対する非類似度
D′n(J)が選択される。選択された非類似度をDDn
とするこれらの選択は標準パターンごとに行なれ
る。
する標準パターンのフレーム数を与える式に類似
しているが、標準パターンの長さにSL(n)によつ
て制限されることはない。従つて、L、L′、
L″は標準パターンの種類とは無関係である。こ
れらL、L′、L″のうち標準パターンの長さSL(n)
に最も近い値を示すパスに対応する非類似度のみ
を選択する。たとえば、L′がSL(n)に最も近いと
するとパス102が対応しそれに対する非類似度
D′n(J)が選択される。選択された非類似度をDDn
とするこれらの選択は標準パターンごとに行なれ
る。
次に判定の第2ステツプが行なわれる。前記判
定第1ステツプによつて得られた標準パターンご
との非類似度DDnに対して最小値を求める。こ
の最小値を与える標準パターンに付加されたカテ
ゴリが認識結果となる。
定第1ステツプによつて得られた標準パターンご
との非類似度DDnに対して最小値を求める。こ
の最小値を与える標準パターンに付加されたカテ
ゴリが認識結果となる。
(実施例)
第3図は本発明におけるマツチング処理と判定
処理を行なう回路構成を示した一実施例である。
以下、その動作について詳細に説明する。
処理を行なう回路構成を示した一実施例である。
以下、その動作について詳細に説明する。
第3図において、52は始端からの音声フレー
ム数をカウントする音声フレームカウンタで、始
端検出時はリセツトパルス50によつてその内容
は0となり以後入力フレームの電力が閾値を越え
たときに入力されるカウントパルス51によつて
カウントアツプ動作を行なう。入力フレームの電
力が閾値未満の場合にはカウントパルス51は付
加されず、音声フレームカウンタ52の出力は保
持される。音声フレームカウンタ52の出力であ
る音声フレーム番号をhとする。53はマツチン
グの際のパスの種類を表わす信号でパスの数は3
本なので0〜2の値をとる。54はh番目の音声
フレームにおいて各パス上で対応する標準パター
ンのフレーム番号を与えるROMである。ROM
54には〔1/0.8h〕、h、〔1/1.2h〕に相当する
値 が格納されている。ROM54の出力をlとす
る。55は標準パターンの番号を与える標準パタ
ーン番号信号であつてnとする。標準パターンの
総数がNのとき0〜N−1の値をとる。56はn
番目の標準パターンに対してその標準パターンの
長さS(n)を格納するROMである。57は標準パ
ターンフレーム番号lを出力するROM54の出
力と標準パターンの長さSL(n)を出力するROM5
6の内容を比較してl≦SL(n)ならば“1”を、
l>SL(n)ならば“0”を出力するコンパレータ
である。58はコンパレータ57の出力が“1”
のときはROM54の出力を、コンパレータ57
の出力が“0”のときはROM56の出力を選択
するセレクタである。コンパレータ57とセレク
タ58によつてl≦SL(n)ならばlが、l>SL(n)
ならばSL(n)がセレクタ58より出力される動作
が行なわれる。セレクタ58の出力をkとする。
59はチヤンネル番号iを与える信号である。6
0はチヤンネル番号iとセレクタ58の出力例え
ばkと標準パターン番号信号nによつてアドレツ
シングされ標準パターンの各成分Sn(i、k)を
出力する標準パターンのメモリである。61はス
ペクトル正規化を行なつた1フレーム分の入力パ
ターンの成分W(i、j)を格納しておくメモリ
でチヤンネル番号信号59によつてアドレスが与
えられる。62はメモリ61の入力端子であり、
図示しないスペクトル正規化部でスペクトル正規
化された入力データW(i、j)が入力される。
63はメモリ61の出力W(i、j)と標準パタ
ーンROM60の出力Sn(i、k)の間でコント
ロール信号CONTによつて以下の値を出力する
演算器である。
ム数をカウントする音声フレームカウンタで、始
端検出時はリセツトパルス50によつてその内容
は0となり以後入力フレームの電力が閾値を越え
たときに入力されるカウントパルス51によつて
カウントアツプ動作を行なう。入力フレームの電
力が閾値未満の場合にはカウントパルス51は付
加されず、音声フレームカウンタ52の出力は保
持される。音声フレームカウンタ52の出力であ
る音声フレーム番号をhとする。53はマツチン
グの際のパスの種類を表わす信号でパスの数は3
本なので0〜2の値をとる。54はh番目の音声
フレームにおいて各パス上で対応する標準パター
ンのフレーム番号を与えるROMである。ROM
54には〔1/0.8h〕、h、〔1/1.2h〕に相当する
値 が格納されている。ROM54の出力をlとす
る。55は標準パターンの番号を与える標準パタ
ーン番号信号であつてnとする。標準パターンの
総数がNのとき0〜N−1の値をとる。56はn
番目の標準パターンに対してその標準パターンの
長さS(n)を格納するROMである。57は標準パ
ターンフレーム番号lを出力するROM54の出
力と標準パターンの長さSL(n)を出力するROM5
6の内容を比較してl≦SL(n)ならば“1”を、
l>SL(n)ならば“0”を出力するコンパレータ
である。58はコンパレータ57の出力が“1”
のときはROM54の出力を、コンパレータ57
の出力が“0”のときはROM56の出力を選択
するセレクタである。コンパレータ57とセレク
タ58によつてl≦SL(n)ならばlが、l>SL(n)
ならばSL(n)がセレクタ58より出力される動作
が行なわれる。セレクタ58の出力をkとする。
59はチヤンネル番号iを与える信号である。6
0はチヤンネル番号iとセレクタ58の出力例え
ばkと標準パターン番号信号nによつてアドレツ
シングされ標準パターンの各成分Sn(i、k)を
出力する標準パターンのメモリである。61はス
ペクトル正規化を行なつた1フレーム分の入力パ
ターンの成分W(i、j)を格納しておくメモリ
でチヤンネル番号信号59によつてアドレスが与
えられる。62はメモリ61の入力端子であり、
図示しないスペクトル正規化部でスペクトル正規
化された入力データW(i、j)が入力される。
63はメモリ61の出力W(i、j)と標準パタ
ーンROM60の出力Sn(i、k)の間でコント
ロール信号CONTによつて以下の値を出力する
演算器である。
CONT=1のとき
|W(i、j)−Sn(i、k)|
CONT=0のとき
0 ……第13式
CONT信号はフレーム電力が閾値以上のとき
は“1”を、閾値未満のときは“0”となる信号
である。64は加算器、65はパス信号53と標
準パターン番号信号55の値をアドレスとする
RAMであり非類似度Dn(j)、D′n(j)、D″n(j)が格
納される。67は音声フレーム長hに対して判定
第1ステツプにおける選択すべきパス番号を与え
るROMである。但し、選択すべきパス番号は標
準パターンごとに与えられるためROM67は音
声フレーム番号hと標準パターン番号nをアドレ
スとして入力しそのとき選択すべきパス番号を出
力する。68はROM67の出力とパス信号53
とを比較して一致すると“1”を出力するコンパ
レータである。69はコンパレータ68の信号に
従いコンパレータ68の出力が“1”のときは
RAM65の出力をそのまま、またコンパレータ
68の出力が“0”のときはRAM65の出力を
非類似度最大値に変換するためのコンバータであ
る。70はコンバータ69の出力と後で述べるレ
ジスタ71の出力を比較して小さい方の値を出力
する最小値選択回路であり、2つの信号を出力す
る。1つは比較した結果のうち小さい方の値を与
える信号であり、この信号はレジスタ71に格納
される。もう一方の信号は比較の結果コンバータ
69の値の方が小さければ発するクロツクであり
レジスタ72の入力クロツクとなる。レジスタ7
1は非類似度の最小値を与えるレジスタでありフ
レーム周期の始めに非類似度の最大値がセツトさ
れる。レジスタ72は最小値選択回路70の出力
パルスによつて標準パターン番号信号を格納する
レジスタで非類似度最小値を与える標準パターン
の番号が格納されている。
は“1”を、閾値未満のときは“0”となる信号
である。64は加算器、65はパス信号53と標
準パターン番号信号55の値をアドレスとする
RAMであり非類似度Dn(j)、D′n(j)、D″n(j)が格
納される。67は音声フレーム長hに対して判定
第1ステツプにおける選択すべきパス番号を与え
るROMである。但し、選択すべきパス番号は標
準パターンごとに与えられるためROM67は音
声フレーム番号hと標準パターン番号nをアドレ
スとして入力しそのとき選択すべきパス番号を出
力する。68はROM67の出力とパス信号53
とを比較して一致すると“1”を出力するコンパ
レータである。69はコンパレータ68の信号に
従いコンパレータ68の出力が“1”のときは
RAM65の出力をそのまま、またコンパレータ
68の出力が“0”のときはRAM65の出力を
非類似度最大値に変換するためのコンバータであ
る。70はコンバータ69の出力と後で述べるレ
ジスタ71の出力を比較して小さい方の値を出力
する最小値選択回路であり、2つの信号を出力す
る。1つは比較した結果のうち小さい方の値を与
える信号であり、この信号はレジスタ71に格納
される。もう一方の信号は比較の結果コンバータ
69の値の方が小さければ発するクロツクであり
レジスタ72の入力クロツクとなる。レジスタ7
1は非類似度の最小値を与えるレジスタでありフ
レーム周期の始めに非類似度の最大値がセツトさ
れる。レジスタ72は最小値選択回路70の出力
パルスによつて標準パターン番号信号を格納する
レジスタで非類似度最小値を与える標準パターン
の番号が格納されている。
第3図は以上の如く構成されており、以下動作
について説明する。
について説明する。
各処理はフレーム電力P(j)が閾値以上となつた
時点から開始されるが、3フレーム以上連続して
フレーム電力P(j)が閾値以上でなければ処理はリ
セツトされる。音声の始端フレーム前はカウンタ
52はリセツトパルス50によつてリセツト状態
にある。また、メモリ65の値はすべてリセツト
されている。以後、始端検出後の1フレーム周期
内の処理を順次説明する。但し、説明のため入力
フレーム番号はjとする。j番目の入力フレーム
のフレーム電力が閾値を越えた場合、カウントパ
ルス51がカウンタ52に印加され、カウンタ5
2はカウントアツプし音声フレーム番号hを出力
する。音声フレーム番号hに対応する標準パター
ンのフレーム番号はROM54とROM56とコ
ンパレータ57とセレクタ58によつて出力され
る。n番目の標準パターンのk番目のフレームの
iチヤンネルのデータSn(i、k)はROM60
によつて出力される。一方、メモリ61には前段
のスペクトル正規化部(図示せず)より出力され
るj番目の入力フレームのスペクトル正規化後の
入力データW(i、j)が入力端子62より入力
され格納されている。ROM60の出力Sn(i、
k)とメモリ61の出力W(i、j)はチヤンネ
ル番号信号59に同期して出力され演算器63に
おいて第13式に与えられる演算を行なう。演算器
63の出力とメモリ65の間で第1式〜第9式に
相当する演算が実行される。実際は第1式〜第9
式の演算は統合された次の形式で行なわれる。
時点から開始されるが、3フレーム以上連続して
フレーム電力P(j)が閾値以上でなければ処理はリ
セツトされる。音声の始端フレーム前はカウンタ
52はリセツトパルス50によつてリセツト状態
にある。また、メモリ65の値はすべてリセツト
されている。以後、始端検出後の1フレーム周期
内の処理を順次説明する。但し、説明のため入力
フレーム番号はjとする。j番目の入力フレーム
のフレーム電力が閾値を越えた場合、カウントパ
ルス51がカウンタ52に印加され、カウンタ5
2はカウントアツプし音声フレーム番号hを出力
する。音声フレーム番号hに対応する標準パター
ンのフレーム番号はROM54とROM56とコ
ンパレータ57とセレクタ58によつて出力され
る。n番目の標準パターンのk番目のフレームの
iチヤンネルのデータSn(i、k)はROM60
によつて出力される。一方、メモリ61には前段
のスペクトル正規化部(図示せず)より出力され
るj番目の入力フレームのスペクトル正規化後の
入力データW(i、j)が入力端子62より入力
され格納されている。ROM60の出力Sn(i、
k)とメモリ61の出力W(i、j)はチヤンネ
ル番号信号59に同期して出力され演算器63に
おいて第13式に与えられる演算を行なう。演算器
63の出力とメモリ65の間で第1式〜第9式に
相当する演算が実行される。実際は第1式〜第9
式の演算は統合された次の形式で行なわれる。
(メモリ65)←(メモリ65)
+|W(i、j)−Sn(i、k″)|
0
次に判定第1ステツプの動作について説明す
る。
る。
判定第1ステツプに必要なパスの選択はROM
67とコンパレータ68とコンバータ69によつ
て行なわれる。ROM67にはn番目の標準パタ
ーンにおいて音声フレーム番号hの場合に選択さ
れるべきパス番号が格納されており、その設定基
準は音声フレーム番号に対する第10式〜第12式の
演算結果のうちn番目の標準パターンの長さSL
(n)に最も近いパス番号によつて与えられる。
ROM67の出力のパス番号とパス信号53がコ
ンパレータ68によつて比較され、コンパレータ
68では両者が一致すれば“1”をコンバータ6
9に出力する。コンバータ69ではコンパレータ
68からの入力が“1”のときはメモリ65の出
力を、“0”のときは非類似度の最大値を出力し
ており、この処理によりコンパレータ68からの
出力が“0”、すなわちROM67の出力とパス
信号53とが一致しない場合、そのときの非類似
度が最小判定処理によつて選択されることを実質
的に禁示している。この処理により判定第1ステ
ツプが行なわれる。次に最小値選択回路70によ
つてレジスタ71に格納されている非類似度とコ
ンバータ69によつて出力される非類似度のうち
小さい方がレジスタ71に格納される。と同時に
コンバータ69の出力の方が小さければパルスが
レジスタ72に加えられそのときの標準パターン
番号がレジスタ72に格納される。この処理をす
べての標準パターンについて行なえばそのときの
最小非類類似度を与える標準パターン番号がレジ
スタ72に格納されることになる。以上の1フレ
ーム周期内の処理に対するタイムチヤートを第4
図に示す。
67とコンパレータ68とコンバータ69によつ
て行なわれる。ROM67にはn番目の標準パタ
ーンにおいて音声フレーム番号hの場合に選択さ
れるべきパス番号が格納されており、その設定基
準は音声フレーム番号に対する第10式〜第12式の
演算結果のうちn番目の標準パターンの長さSL
(n)に最も近いパス番号によつて与えられる。
ROM67の出力のパス番号とパス信号53がコ
ンパレータ68によつて比較され、コンパレータ
68では両者が一致すれば“1”をコンバータ6
9に出力する。コンバータ69ではコンパレータ
68からの入力が“1”のときはメモリ65の出
力を、“0”のときは非類似度の最大値を出力し
ており、この処理によりコンパレータ68からの
出力が“0”、すなわちROM67の出力とパス
信号53とが一致しない場合、そのときの非類似
度が最小判定処理によつて選択されることを実質
的に禁示している。この処理により判定第1ステ
ツプが行なわれる。次に最小値選択回路70によ
つてレジスタ71に格納されている非類似度とコ
ンバータ69によつて出力される非類似度のうち
小さい方がレジスタ71に格納される。と同時に
コンバータ69の出力の方が小さければパルスが
レジスタ72に加えられそのときの標準パターン
番号がレジスタ72に格納される。この処理をす
べての標準パターンについて行なえばそのときの
最小非類類似度を与える標準パターン番号がレジ
スタ72に格納されることになる。以上の1フレ
ーム周期内の処理に対するタイムチヤートを第4
図に示す。
以上の処理は1フレーム周期ごとに行なわれ終
端が検出された時点におけるレジスタ72の結果
が最終的な認識結果となり、出力端子73から出
力される。
端が検出された時点におけるレジスタ72の結果
が最終的な認識結果となり、出力端子73から出
力される。
(発明の効果)
本発明は以上説明したように、入力フレームご
とに距離計算、非類似度計算を行なうため終端検
出後、1フレーム以内にに認識結果が出る利点が
ある。また、非類似度計算のためには前の入力フ
レームに対する非類似度値と現入力フレームに対
する距離値との累算を行なうだけでよく、始端か
ら終端までの入力データを格納する必要がない。
とに距離計算、非類似度計算を行なうため終端検
出後、1フレーム以内にに認識結果が出る利点が
ある。また、非類似度計算のためには前の入力フ
レームに対する非類似度値と現入力フレームに対
する距離値との累算を行なうだけでよく、始端か
ら終端までの入力データを格納する必要がない。
さらに、回路構成の簡易化を目的とした方式で
あるためLSI化が容易であり、ゲート数の少ない
安価な音声認識用LSIチツプを供給すると同時に
汎用マイクロプロセツサのソフト処理によつても
実現され得るものである。
あるためLSI化が容易であり、ゲート数の少ない
安価な音声認識用LSIチツプを供給すると同時に
汎用マイクロプロセツサのソフト処理によつても
実現され得るものである。
第1図は発声長変動を説明するための図、第2
図は本発明のマツチングパスの概要を説明するた
めに示した図、第3図は本発明の一実施例を示す
ブロツク図、第4図は本実施例の1フレーム周期
内の処理に対するタイムチヤートを示した図であ
る。 52……音声フレーム番号hのカウンタ、54
……標準パターンのフレーム番号相当のものを発
生させるためのROM、56……標準パターンの
長さを記憶しているROM、57……コンパレー
タ、58……セレクタ、60……標準パターンメ
モリ、61……入力パターンのメモリ、63……
距離の演算器、64……加算器、67……選択す
べきパス番号のROM、68……コンパレータ、
69……コンバータ、70……最小値選択回路、
71……最小非類似度のメモリ、72……認識結
果としての標準パターン番号のメモリ。
図は本発明のマツチングパスの概要を説明するた
めに示した図、第3図は本発明の一実施例を示す
ブロツク図、第4図は本実施例の1フレーム周期
内の処理に対するタイムチヤートを示した図であ
る。 52……音声フレーム番号hのカウンタ、54
……標準パターンのフレーム番号相当のものを発
生させるためのROM、56……標準パターンの
長さを記憶しているROM、57……コンパレー
タ、58……セレクタ、60……標準パターンメ
モリ、61……入力パターンのメモリ、63……
距離の演算器、64……加算器、67……選択す
べきパス番号のROM、68……コンパレータ、
69……コンバータ、70……最小値選択回路、
71……最小非類似度のメモリ、72……認識結
果としての標準パターン番号のメモリ。
Claims (1)
- 【特許請求の範囲】 1 各標準音声に対応して周波数成分のフレーム
時系列として表現され且つ無音状態に対応するフ
レームを除去した形で表現された標準パターンと
各標準パターン対応に設けられたパス選択情報と
を記憶しておき、 (a) 入力音声から周波数成分のフレーム時系列と
して入力パターンを抽出し、 (b) 入力音声の始端を検出して入力パターンのフ
レームの計数を開始し、有音状態を検出してい
る間は音声フレーム番号を順次更新し、一方無
音状態を検出している間は音声フレーム番号の
更新を停止し、入力音声の終端を確認する以前
に再び有音状態を検出すると当該音声フレーム
番号の更新を再開し、 (c) 音声フレーム番号の更新毎に、その音声フレ
ーム番号に本質的に線形な関係で標準パターン
の複数のフレーム番号を発生させることによつ
て入力パターンと各標準パターンとの間に複数
のマツチングパスを設定し、 (d) 音声フレーム番号の更新毎に、前記各マツチ
ングパスで対応づけられたフレーム間で入力パ
ターンと各標準パターンとの距離を計算し、 (e) 入力音声の始端から任意の音声フレーム番号
までの前記マツチングパスに沿つた前記距離の
累算値を非類似度として、音声フレーム番号の
更新毎に、直前の非類似度と当該フレーム番号
での距離とを加算して一旦記憶することによつ
て、各標準パターン毎の各マツチングパスに対
応した非類似度を更新記憶し、 (f) 音声フレーム番号の更新毎に、前記パス選択
情報に基づいて各標準パターンに対応して1つ
のパス選択信号を発生させ、各標準パターン毎
に前記パス選択信号で指定されるマツチングパ
スに対応した非類似度を選択し、選択された非
類似度のうちで最小値を示す非類似度に対応し
た標準パターンのコードを前記音声フレーム番
号の更新毎に更新記憶し、 (g) 入力音声の終端を確認した時点で、入力音声
の終端の音声フレーム番号に対応して記憶され
ている最小値を示す非類似度に対応した前記標
準パターンのコードを入力音声のカテゴリとし
て認識することを特徴とした音声認識方法。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59058435A JPS60203992A (ja) | 1984-03-28 | 1984-03-28 | 音声認識方法 |
| US06/716,154 US4868879A (en) | 1984-03-27 | 1985-03-26 | Apparatus and method for recognizing speech |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59058435A JPS60203992A (ja) | 1984-03-28 | 1984-03-28 | 音声認識方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS60203992A JPS60203992A (ja) | 1985-10-15 |
| JPH0568716B2 true JPH0568716B2 (ja) | 1993-09-29 |
Family
ID=13084311
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP59058435A Granted JPS60203992A (ja) | 1984-03-27 | 1984-03-28 | 音声認識方法 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS60203992A (ja) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS61252593A (ja) * | 1985-05-02 | 1986-11-10 | 沖電気工業株式会社 | 音声認識装置 |
-
1984
- 1984-03-28 JP JP59058435A patent/JPS60203992A/ja active Granted
Also Published As
| Publication number | Publication date |
|---|---|
| JPS60203992A (ja) | 1985-10-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5899971A (en) | Computer unit for speech recognition and method for computer-supported imaging of a digitalized voice signal onto phonemes | |
| US5621849A (en) | Voice recognizing method and apparatus | |
| US6029130A (en) | Integrated endpoint detection for improved speech recognition method and system | |
| JPH0247760B2 (ja) | ||
| US4868879A (en) | Apparatus and method for recognizing speech | |
| US5974381A (en) | Method and system for efficiently avoiding partial matching in voice recognition | |
| JPH0568717B2 (ja) | ||
| JPH0313600B2 (ja) | ||
| JPS61133994A (ja) | 音声認識方法 | |
| JP3477751B2 (ja) | 連続単語音声認識装置 | |
| JP3112037B2 (ja) | 音声認識装置 | |
| JPS60203992A (ja) | 音声認識方法 | |
| JPS61170799A (ja) | 音声認識方法 | |
| JPH0313599B2 (ja) | ||
| JP2001005483A (ja) | 単語音声認識方法及び単語音声認識装置 | |
| JP3007357B2 (ja) | 音声認識装置の辞書更新方式 | |
| JPH0567037B2 (ja) | ||
| JP3063855B2 (ja) | 音声認識におけるマッチング距離値の極小値探索方法 | |
| JPH0449954B2 (ja) | ||
| JPH02300800A (ja) | 音声認識装置 | |
| JPS6344699A (ja) | 音声認識装置 | |
| JPS61235899A (ja) | 音声認識装置 | |
| JPS6247100A (ja) | 音声認識装置 | |
| JP2000267691A (ja) | 音声認識システムにおける認識辞書選択方法 | |
| JPH0262879B2 (ja) |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| EXPY | Cancellation because of completion of term |