JPS60203992A - 音声認識方法 - Google Patents
音声認識方法Info
- Publication number
- JPS60203992A JPS60203992A JP59058435A JP5843584A JPS60203992A JP S60203992 A JPS60203992 A JP S60203992A JP 59058435 A JP59058435 A JP 59058435A JP 5843584 A JP5843584 A JP 5843584A JP S60203992 A JPS60203992 A JP S60203992A
- Authority
- JP
- Japan
- Prior art keywords
- input
- frame
- frame number
- standard
- audio
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 238000000034 method Methods 0.000 claims description 33
- 230000008569 process Effects 0.000 description 12
- 238000012545 processing Methods 0.000 description 12
- 238000004364 calculation method Methods 0.000 description 8
- 238000010586 diagram Methods 0.000 description 6
- 238000001514 detection method Methods 0.000 description 4
- 238000010606 normalization Methods 0.000 description 3
- 238000004458 analytical method Methods 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 230000008901 benefit Effects 0.000 description 1
- 238000012790 confirmation Methods 0.000 description 1
- 230000008602 contraction Effects 0.000 description 1
- 238000003708 edge detection Methods 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 238000012827 research and development Methods 0.000 description 1
- 230000000717 retained effect Effects 0.000 description 1
- 238000001228 spectrum Methods 0.000 description 1
- 210000002784 stomach Anatomy 0.000 description 1
- 239000013589 supplement Substances 0.000 description 1
- 238000012360 testing method Methods 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
- 230000002747 voluntary effect Effects 0.000 description 1
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
(技術分野)
本発明は音声認識方法に関し、具体的には単語入力音声
の終端の確認を待たないで、入力音声の始端検出から認
識動作を開始するようにした音声認識方法に関する。
の終端の確認を待たないで、入力音声の始端検出から認
識動作を開始するようにした音声認識方法に関する。
(背景技術)
音声認識方法の一形式として、各標準音声に対応して周
波数成分のフレーム時系列として標準パターンを記憶し
ておき、入力音声から同じく周波数成分のフレーム時系
列として入カバターンを抽出し、入力・ぞターンと各標
準・ぐターンとの非類似度を計算し、その非類似度に基
づいて入力音声を識別する方法が知られている。
波数成分のフレーム時系列として標準パターンを記憶し
ておき、入力音声から同じく周波数成分のフレーム時系
列として入カバターンを抽出し、入力・ぞターンと各標
準・ぐターンとの非類似度を計算し、その非類似度に基
づいて入力音声を識別する方法が知られている。
一例として、沖研究開発第118号第53頁、昭和57
年12月、に開示されている。このような方法における
標準又は入力の音声パターンは、通常、規則的にフレー
ムを設定して周波数分析し、対数変換と最小自乗近似直
線を用いた声道長等の正規化とを経て、周波数成分のフ
レーム時系列として表現したものを用いる。
年12月、に開示されている。このような方法における
標準又は入力の音声パターンは、通常、規則的にフレー
ムを設定して周波数分析し、対数変換と最小自乗近似直
線を用いた声道長等の正規化とを経て、周波数成分のフ
レーム時系列として表現したものを用いる。
また、入カッやターンと各標準パターンとの非類似度を
計算するためにマツチングパスを設定する方法としては
、動的計画法を用いだDPマツチング法と前記文献に見
られるような本質的に線形なマツチング法とが知られて
いる。構成の簡易化の観点からは、線形マツチング法が
有利であるが、奔 第1図に例示した如く、単語の発生速度は変動がきわめ
て大きく、個人差があると共に心理状態や状況によって
も変動し、標準という感覚のもとてすら20%〜40チ
の発声長のばらつきが見られ何等かの工夫が必要である
。線形マツチング法には種々の形式が提案されているが
、前記文献に限らず、そこでは入力音声の終端を検出し
たのち、マツチングパスを設定していて、認識応答の面
では問題があり、入カバターンも始端から終端を確認す
るまで記憶しておく必要がある。
計算するためにマツチングパスを設定する方法としては
、動的計画法を用いだDPマツチング法と前記文献に見
られるような本質的に線形なマツチング法とが知られて
いる。構成の簡易化の観点からは、線形マツチング法が
有利であるが、奔 第1図に例示した如く、単語の発生速度は変動がきわめ
て大きく、個人差があると共に心理状態や状況によって
も変動し、標準という感覚のもとてすら20%〜40チ
の発声長のばらつきが見られ何等かの工夫が必要である
。線形マツチング法には種々の形式が提案されているが
、前記文献に限らず、そこでは入力音声の終端を検出し
たのち、マツチングパスを設定していて、認識応答の面
では問題があり、入カバターンも始端から終端を確認す
るまで記憶しておく必要がある。
(発明の目的)
本発明の目的は、入力音声の始端を検出して直ちにマツ
チング動作を開始させることによって認識速度を高め、
且つ発声速度変動を予想してマツチングパスを設定する
ことによって発声速度の変動を吸収することにある。
チング動作を開始させることによって認識速度を高め、
且つ発声速度変動を予想してマツチングパスを設定する
ことによって発声速度の変動を吸収することにある。
(発明の概要)
本発明の第1の特徴は、入カッ9ターンの各フレーム毎
にマツチング処理を行ない、各フレーム毎に各標準パタ
ーンの各マツチングパスに対応した非類似度を更新記憶
するようにしたことにある。
にマツチング処理を行ない、各フレーム毎に各標準パタ
ーンの各マツチングパスに対応した非類似度を更新記憶
するようにしたことにある。
まず、入力音声の有音状態の検出には音声パワーを用い
る方法を用いることができる。この場合音声の始端検出
はフレーム電力P(j) (但しjは入力ieターンの
フレーム番号)があらかじめ定められた閾値を越えた時
点を始端と考える。但し外部からの雑音などにより音声
入力が行なわれていなくとも電力P(j)が閾値を越え
てしまい、誤った始端とする場合がある。そのため、と
もかくフレーム電力P (j)が閾値を越えたフレーム
を始端と考え認識処理を開始するものの連続して3フレ
一ム以上電力が閾値を越えなければその人力フレームを
音声の始端とは考えず認識処理を中断し始端検出のだめ
の処理へともどる。但し、フレーム長を16m5ec。
る方法を用いることができる。この場合音声の始端検出
はフレーム電力P(j) (但しjは入力ieターンの
フレーム番号)があらかじめ定められた閾値を越えた時
点を始端と考える。但し外部からの雑音などにより音声
入力が行なわれていなくとも電力P(j)が閾値を越え
てしまい、誤った始端とする場合がある。そのため、と
もかくフレーム電力P (j)が閾値を越えたフレーム
を始端と考え認識処理を開始するものの連続して3フレ
一ム以上電力が閾値を越えなければその人力フレームを
音声の始端とは考えず認識処理を中断し始端検出のだめ
の処理へともどる。但し、フレーム長を16m5ec。
とじている。ここで音声の始端からフレーム電力が閾値
を越えたフレームの番号付けを定義しh番目の音声フレ
ームと称し、単なる入力フレーム番号とは区別する。す
なわち、音声フレーム番号りの音声フレームは、有音区
間でh番目の入力フレームに対応する。
を越えたフレームの番号付けを定義しh番目の音声フレ
ームと称し、単なる入力フレーム番号とは区別する。す
なわち、音声フレーム番号りの音声フレームは、有音区
間でh番目の入力フレームに対応する。
発声速度の正規化を行なうマツチング処理を音声の始端
から開始し、音声分析部用力が得られる周期(フレーム
周期)ごとに行なえれば音声分析部のデータを始端から
すべて格納しておく必要もなく、また、応答時間も速く
なる。
から開始し、音声分析部用力が得られる周期(フレーム
周期)ごとに行なえれば音声分析部のデータを始端から
すべて格納しておく必要もなく、また、応答時間も速く
なる。
本発明の第2の特徴は発声がおそく行なわれた場合、標
準的に行なわれた場合、はやく行なわれた場合を想定し
たマツチングパスを設定しそれぞれのマツチングパス上
でのマツチング処理を行なうことにある。音声の始端検
出時点では今から入力される単語の発生速度は不明であ
る。そこで発生がおそく行なわれた場合、標準的に行な
われた場合、はやく行なわれた場合を想定したマツチン
グパスを設定し、それぞれのマツチングパス上でマツチ
ング処理を行々えば終端検出前からでもマツチング処理
が開始可能となる。もちろん、この場合、入力の終端と
標準ノeターンの終端が一致するパスが存在する可能性
は少ないが、入力の終端と標準パターンの終端が最も一
致している・ぐス上での非類似度が最小となることが予
想される。
準的に行なわれた場合、はやく行なわれた場合を想定し
たマツチングパスを設定しそれぞれのマツチングパス上
でのマツチング処理を行なうことにある。音声の始端検
出時点では今から入力される単語の発生速度は不明であ
る。そこで発生がおそく行なわれた場合、標準的に行な
われた場合、はやく行なわれた場合を想定したマツチン
グパスを設定し、それぞれのマツチングパス上でマツチ
ング処理を行々えば終端検出前からでもマツチング処理
が開始可能となる。もちろん、この場合、入力の終端と
標準ノeターンの終端が一致するパスが存在する可能性
は少ないが、入力の終端と標準パターンの終端が最も一
致している・ぐス上での非類似度が最小となることが予
想される。
一方、単語には「イチ」の「イ」と「チ」の間のように
単語内にフレーム電力が閾値に満たない部分を持つ単語
がある。このような部分を「ノクワーディソグ」と称す
る。このノヤワーディップの長さは単語によって1なる
が通常30フレーム長を越えることはほとんどない。音
声の始端を検出後、あるフレーム時間点においてそのフ
レーム電力が閾値未満となった場合、そのフレーム時間
点は・ぐワーディッゾの始まりなのか、音声の終端なの
かは判断がつかない。この判定は通常、フレーム電力が
閾値未満の区間が30フレ一ム以上あるかないかによっ
て行なうため最大30フレーム後でなければ判断が下さ
れない。従って、フレーム電力が閾値未満となった場合
のマツチング結果は何らかの形で保留されなければなら
々い。本発明では、音声フレーム番号の更新を停止して
、フレーム電力が閾値未満となったフレームに対しては
マツチング処理を停止することによシこの問題を解決す
る。
単語内にフレーム電力が閾値に満たない部分を持つ単語
がある。このような部分を「ノクワーディソグ」と称す
る。このノヤワーディップの長さは単語によって1なる
が通常30フレーム長を越えることはほとんどない。音
声の始端を検出後、あるフレーム時間点においてそのフ
レーム電力が閾値未満となった場合、そのフレーム時間
点は・ぐワーディッゾの始まりなのか、音声の終端なの
かは判断がつかない。この判定は通常、フレーム電力が
閾値未満の区間が30フレ一ム以上あるかないかによっ
て行なうため最大30フレーム後でなければ判断が下さ
れない。従って、フレーム電力が閾値未満となった場合
のマツチング結果は何らかの形で保留されなければなら
々い。本発明では、音声フレーム番号の更新を停止して
、フレーム電力が閾値未満となったフレームに対しては
マツチング処理を停止することによシこの問題を解決す
る。
第2図(a)は本発明による音声認識方法における入力
・ぐターンと標準パターンとのマツチングを行なう複数
のマツチングパス上例を示した図、第2図(b)は入力
・ぐターンのフレーム電力例を示した図、第2図(c)
は入カバターンと標準・々ターンとの各マツチングパス
における非類似度Dn(j) 、 D’n (j) 、
D”n(j)の例を示した図である。
・ぐターンと標準パターンとのマツチングを行なう複数
のマツチングパス上例を示した図、第2図(b)は入力
・ぐターンのフレーム電力例を示した図、第2図(c)
は入カバターンと標準・々ターンとの各マツチングパス
における非類似度Dn(j) 、 D’n (j) 、
D”n(j)の例を示した図である。
第2図(、)においては発声速度の範囲を例えば±20
%と考え、マツチングパスを3本設定した場合を示して
いる。第2図(a)において、横軸は入力/−,l)タ
ーンのフレーム番号を表わす。また、縦軸は標準・やタ
ーンのフレーム番号を表わし、n番目の標準パターンS
nを例として考え、そのフレーム長を5L(Fl)とす
る。101は発声を20チ遅く発声した場合を想定した
・ぐス、102Vl標準的な発声を想定した・ぐス、1
03は発声を20%速く想定した場合のパスを示す。3
番目の入力フレームの電力が開鎖以上の場合、3本のノ
クス上での標準パターンSnとの距離を次式によって与
える。但し、hはj番目の入力フレーム番号に対応した
音声フレーム番号であり、W(i、j)は入力フレーム
番号がJでチャンネル番号が1(但し、i = 1〜8
)の入力・eターンであり、’Sn (i、k )はフ
レーム番号がkでチャンネル番号がlの標準パターンで
ある。
%と考え、マツチングパスを3本設定した場合を示して
いる。第2図(a)において、横軸は入力/−,l)タ
ーンのフレーム番号を表わす。また、縦軸は標準・やタ
ーンのフレーム番号を表わし、n番目の標準パターンS
nを例として考え、そのフレーム長を5L(Fl)とす
る。101は発声を20チ遅く発声した場合を想定した
・ぐス、102Vl標準的な発声を想定した・ぐス、1
03は発声を20%速く想定した場合のパスを示す。3
番目の入力フレームの電力が開鎖以上の場合、3本のノ
クス上での標準パターンSnとの距離を次式によって与
える。但し、hはj番目の入力フレーム番号に対応した
音声フレーム番号であり、W(i、j)は入力フレーム
番号がJでチャンネル番号が1(但し、i = 1〜8
)の入力・eターンであり、’Sn (i、k )はフ
レーム番号がkでチャンネル番号がlの標準パターンで
ある。
パス1.01に対する距離
d n (j)=ΣIW(t、D−8n (t、k)
11=1 パス102に対する距離 d ’n (j)−ΣIW(i、j)−8n (i、に
′)1パス103に対する距離 d#n(j)=ΣIw(t、j)−8n(i、k“)1
−1 尚、〔〕はガウス記号を示す。
11=1 パス102に対する距離 d ’n (j)−ΣIW(i、j)−8n (i、に
′)1パス103に対する距離 d#n(j)=ΣIw(t、j)−8n(i、k“)1
−1 尚、〔〕はガウス記号を示す。
前記の式によればノeス10’lにおいては人カッやタ
ーンの3番目の入力音声フレームと標準パターンのに番
目のフレームの間の距離計算を行々う。
ーンの3番目の入力音声フレームと標準パターンのに番
目のフレームの間の距離計算を行々う。
パス102においては入カバターンJ番目の入力フレー
ムと標準ノぐターンのに′番目のフレームの間の距離計
算を行ない、iQQ100.3においては入力・ぐター
ンのj番目の入力フレームと標準パターンのに″番目の
フレームの間の距離計算が行なわれる。
ムと標準ノぐターンのに′番目のフレームの間の距離計
算を行ない、iQQ100.3においては入力・ぐター
ンのj番目の入力フレームと標準パターンのに″番目の
フレームの間の距離計算が行なわれる。
但し、標準パターンのフレヘム番号を示すk 、 k’
。
。
k“はその標準パターンの長さ5L(n)より大きくな
る場合には5L(n)に制限される。
る場合には5L(n)に制限される。
一方、j番目の入力フレームの電力が閾値未7.j、%
の場合、それぞれのパス上での距M dn(j) 、
d’n(j) 。
の場合、それぞれのパス上での距M dn(j) 、
d’n(j) 。
d’n(j)を強制的に
d n (j)= 0 ・第4式
d’n (j)= O・・第5式
d“n(j)=O第6式
とすることによりフレーム電力が閾値以下の場合の非類
似度計算を事実上加算しない処理を行なう。
似度計算を事実上加算しない処理を行なう。
またこのために、標準ノやターンもパワーディ、プ対応
のフレームを除いた形で蓄積する。
のフレームを除いた形で蓄積する。
このように、パワーディノブや標準ノミターンの終端以
後でのマツチングのように、非類似度としてM9でない
フレームでは距離を0としているけれども、本発明では
本質的に線形なマツチングである。、 次に入カッPターンの3番目の入力フレームまでの非類
似度Dn (F) 、 D’n (j) 、 D”n
l)が計算される。
後でのマツチングのように、非類似度としてM9でない
フレームでは距離を0としているけれども、本発明では
本質的に線形なマツチングである。、 次に入カッPターンの3番目の入力フレームまでの非類
似度Dn (F) 、 D’n (j) 、 D”n
l)が計算される。
・ぐス101の非類似度
Dn(j)−dn(j)+Dn(j −1) 第7式%
式% D’n(j)= d’n(j)+D’n (j −1)
・第8式パス103の非類似度 D’n(j)−d’n(j)+D’n (j −1)
−第9式すなわち、それぞれのパス上での3番目のフレ
ームの非類似度の算出は各チャンネルごとの距離(例え
ばIW(i、D−8n(i、k) l )をチャンネル
分、j−1番目のフレームに対する非類似度値(たとえ
ばDn(j−1))に加えることによって得られる。
式% D’n(j)= d’n(j)+D’n (j −1)
・第8式パス103の非類似度 D’n(j)−d’n(j)+D’n (j −1)
−第9式すなわち、それぞれのパス上での3番目のフレ
ームの非類似度の算出は各チャンネルごとの距離(例え
ばIW(i、D−8n(i、k) l )をチャンネル
分、j−1番目のフレームに対する非類似度値(たとえ
ばDn(j−1))に加えることによって得られる。
これらの演算は3番目のフレームの入力がなされた時点
で行なわれる。3番目のフレームに対する非類似度の算
出にあたっては3番目のフレームの入カバターンデータ
とそれぞれのieスに相当する標準パターンのデータお
よび1フレーム前のJ−1番目のフレームの非類似度デ
ータのみが必要であって2フレ一ム以上前の入カッ9タ
ーンデータは不必要である。そのため、終端を検出する
までの入カッやターンを格納しておかなければならない
線形伸縮マツチング法に比較しても記憶領域が小さくな
る効果が生じる。
で行なわれる。3番目のフレームに対する非類似度の算
出にあたっては3番目のフレームの入カバターンデータ
とそれぞれのieスに相当する標準パターンのデータお
よび1フレーム前のJ−1番目のフレームの非類似度デ
ータのみが必要であって2フレ一ム以上前の入カッ9タ
ーンデータは不必要である。そのため、終端を検出する
までの入カッやターンを格納しておかなければならない
線形伸縮マツチング法に比較しても記憶領域が小さくな
る効果が生じる。
第2図(c)は入力・ぐターンと標準・ぐターンとの各
マツチングパターンでの非類似度Dn (j) 、 D
’n (j) 。
マツチングパターンでの非類似度Dn (j) 、 D
’n (j) 。
D”n(j)を示したものであるが、第2図(C)に見
られるようにフレーム電力が閾値以下となったとき距離
値を強制的に0にすることにより非類似度Dn (j)
。
られるようにフレーム電力が閾値以下となったとき距離
値を強制的に0にすることにより非類似度Dn (j)
。
”” (J) + D“n(J)は保持される。従って
、終端における非類似度と終端から30フレームへだて
だ入力フレーム(この時点で初めて終端が検出される)
における非類似度は等しい。
、終端における非類似度と終端から30フレームへだて
だ入力フレーム(この時点で初めて終端が検出される)
における非類似度は等しい。
次に、音声の終端を検出した時点(音声の終端から30
フレーム後)から各標準パターンごとに得られた非類似
度によってカテコ゛リーの判定が行なわれる。終端検出
時点の入力フレーム番号をJ、音声フレーム番号をHと
するとn番目の標準パターンに対する各ノクスの非類似
度はDn (J) 、 D’n (J) 。
フレーム後)から各標準パターンごとに得られた非類似
度によってカテコ゛リーの判定が行なわれる。終端検出
時点の入力フレーム番号をJ、音声フレーム番号をHと
するとn番目の標準パターンに対する各ノクスの非類似
度はDn (J) 、 D’n (J) 。
D n (J)で与えられる。これらの非類似度の組が
杼準・やターンの数(Nとする)だけ存在する。これら
の非類似度を用いてカテゴリー判定を行なう手法につい
て述べる。判定第1ステツプは次のように行なわれる。
杼準・やターンの数(Nとする)だけ存在する。これら
の非類似度を用いてカテゴリー判定を行なう手法につい
て述べる。判定第1ステツプは次のように行なわれる。
寸ず、n番目の標準ノ9ターンに対する各/Fスごとの
非類似度Dn (J) 、 D’n (J) 、 D“
n (J)のうち1つが選択される。この選択にあたっ
ては音声終端検出時の音声フレーム番号Hに対して次式
で与えられるり、L’、L“が用いられる。
非類似度Dn (J) 、 D’n (J) 、 D“
n (J)のうち1つが選択される。この選択にあたっ
ては音声終端検出時の音声フレーム番号Hに対して次式
で与えられるり、L’、L“が用いられる。
パス101 L=C−H:] ・第11式)e7.10
2 L’=H−第11式 ノぐス103 L“=〔工H〕 ・・・第12式これら
の値り、L’、L“は音声フレームに対応する標準/e
ターンのフレーム数を与える式に類似しているが、標準
/ぐターンの長さS L (n)によって制限されるこ
とはない。従って、L 、 L’、、 L“は標準・や
ターンの種類とは無関係である。これらり、L′、L“
のうち標準・(ターンの長さS L (n)に最も近い
値を示すパスに対応する非類似度のみを選択する。たと
えば、L′が5L(n)に最も近いとすると・ぐス10
2が対応しそれに対する非類似度D’n(J)が選択さ
れる。
2 L’=H−第11式 ノぐス103 L“=〔工H〕 ・・・第12式これら
の値り、L’、L“は音声フレームに対応する標準/e
ターンのフレーム数を与える式に類似しているが、標準
/ぐターンの長さS L (n)によって制限されるこ
とはない。従って、L 、 L’、、 L“は標準・や
ターンの種類とは無関係である。これらり、L′、L“
のうち標準・(ターンの長さS L (n)に最も近い
値を示すパスに対応する非類似度のみを選択する。たと
えば、L′が5L(n)に最も近いとすると・ぐス10
2が対応しそれに対する非類似度D’n(J)が選択さ
れる。
選択された非類似度をDDnとするこれらの選択は標準
パターンごとに行なわれる。
パターンごとに行なわれる。
次に判定の第2ステノゾが行なわれる。前記側、定第1
ステ、ゾによって得られた標準・ぐターンごとの非類似
度DDnに対して最小値をめる。この最小値を与える標
準パターンに付加されたカテコ゛リが認識結果となる。
ステ、ゾによって得られた標準・ぐターンごとの非類似
度DDnに対して最小値をめる。この最小値を与える標
準パターンに付加されたカテコ゛リが認識結果となる。
(実施例)
第3図は本発明におけるマツチング処理と判定処理を行
なう回路構成を示した一実施例である。
なう回路構成を示した一実施例である。
以下、その動作について詳細に説明する。
第3図において、52は始端からの音声フレーム数をカ
ウントする音声フレームカウンタで、始端検出時はリセ
ット・ぞルス50によってその内容は0となり以後入力
フレームの電力が閾値を越えたときに入力されるカラン
トノぐルス51によってカウントアノf動作を行なう。
ウントする音声フレームカウンタで、始端検出時はリセ
ット・ぞルス50によってその内容は0となり以後入力
フレームの電力が閾値を越えたときに入力されるカラン
トノぐルス51によってカウントアノf動作を行なう。
入力フレームの電力が閾値未満の場合にはカランF 7
Fルス5ノは付加されず、音声フレームカウンタ52の
出力は保持される。音声フレームカウンタ52の出力で
ある音声フレーム番号をhとする。53はマツチングの
際の・やスの種類を表わす信号でパスの数は3本なので
0〜2の値をとる。54はh番目の音声フレームにおい
て各パス上で対応する標準ノやターンのフレーム番号を
与えるROMである。ROM 541 には[Tf−g−h 〕、 h ! [、h )に相当
する値が格納されている。ROM 54の出力をtとす
る。55は標準パターンの番号を与える標準・ぐターン
番号信号であってnとする。標準パターンの総数がNの
とき0−N−’1の値をとる。56はn番目の標準ノや
ターンに対してその標準・母ターンの長さS L (n
)を格納するROMである。57は標準パターンフレー
ム番号tを出力するROM 54の出力と標準パターン
の長さS L (n)を出力するROM 56の内容を
比較してt≦S L (n)ならばl″を、z)SL(
n)ならば°゛0″を出力スルコンノぐレータ−t’、
sル。58はコンパレータ57の出力が°゛1″のとき
はROM 54の出力を、コンノやレータ57の出力が
“O”のときはROM56の出力を選択するセレクタで
ある。コン・ぐレータ57とセレクタ58によってt≦
SL (n)ならばtが、A)SL(n)ならば5L(
n)がセレクタ58より出力される動作が行なわれる。
Fルス5ノは付加されず、音声フレームカウンタ52の
出力は保持される。音声フレームカウンタ52の出力で
ある音声フレーム番号をhとする。53はマツチングの
際の・やスの種類を表わす信号でパスの数は3本なので
0〜2の値をとる。54はh番目の音声フレームにおい
て各パス上で対応する標準ノやターンのフレーム番号を
与えるROMである。ROM 541 には[Tf−g−h 〕、 h ! [、h )に相当
する値が格納されている。ROM 54の出力をtとす
る。55は標準パターンの番号を与える標準・ぐターン
番号信号であってnとする。標準パターンの総数がNの
とき0−N−’1の値をとる。56はn番目の標準ノや
ターンに対してその標準・母ターンの長さS L (n
)を格納するROMである。57は標準パターンフレー
ム番号tを出力するROM 54の出力と標準パターン
の長さS L (n)を出力するROM 56の内容を
比較してt≦S L (n)ならばl″を、z)SL(
n)ならば°゛0″を出力スルコンノぐレータ−t’、
sル。58はコンパレータ57の出力が°゛1″のとき
はROM 54の出力を、コンノやレータ57の出力が
“O”のときはROM56の出力を選択するセレクタで
ある。コン・ぐレータ57とセレクタ58によってt≦
SL (n)ならばtが、A)SL(n)ならば5L(
n)がセレクタ58より出力される動作が行なわれる。
セレクタ58の出方をkとする。59はチャンネル番号
lを与える9号である。60はチャンネル番号lとセレ
クタ58の出力例えばkと標準ノソターン番号信号nに
よってアドレッシングされ標準パターン5n(i、k)
を出力する標準パターンのメモリである。61はスペク
トル正規化を行なった1フレ一ム分の入カバターンW(
i、j)を格納しておくメモリでチャンネル番号信号5
9によってアドレスが与えられる。
lを与える9号である。60はチャンネル番号lとセレ
クタ58の出力例えばkと標準ノソターン番号信号nに
よってアドレッシングされ標準パターン5n(i、k)
を出力する標準パターンのメモリである。61はスペク
トル正規化を行なった1フレ一ム分の入カバターンW(
i、j)を格納しておくメモリでチャンネル番号信号5
9によってアドレスが与えられる。
62はメモリ61の入力端子であり、図示しないスペク
トル正規化部でスペクトル正規化された入力データW(
i、j )が入力される。63はメモリ6ノの出力W(
t、j )と標準パターンROM 60の出力5n(i
、k)の間でコントロール信号C0NTによって以下の
値を出力する演算器である。
トル正規化部でスペクトル正規化された入力データW(
i、j )が入力される。63はメモリ6ノの出力W(
t、j )と標準パターンROM 60の出力5n(i
、k)の間でコントロール信号C0NTによって以下の
値を出力する演算器である。
C0NT = 1のとき IW(i、j)−8n(i、
k) lを、閾値未満のときは′0″となる信号である
。
k) lを、閾値未満のときは′0″となる信号である
。
64は加算器、65は・やス信号53と標準パターン番
号信号55の値をアドレスとするRAMであり非類似度
Dn(j) 、 D′n(j) 、 D″n(j)が格
納される。67は音声フレーム長りに対して判定第1ス
テツプにおける選択すべきノ9ス番号を与えるROMで
ある。但し、選択すべきパス番号は標準ンやターンごと
に力えられるためROM 67は音声フレーム番号りと
標準ノeターン番号nをアドレスとして入力しそのとき
選択すべきパス番号を出力する。68はROM67の出
力とAス信号53とを比較して一致すると1を出力する
コンパレータである。69はコンパレータ68の信号に
従いコン・eレータ68の出力が1″′のときはRAM
65の出力をそのまま、またコンパレータ68の出力
が0″のときはRAM 65の出力を非類似度最大値に
変換するだめのコンバーりである。70はコンバータ6
9の出力と後で述べるレジスタ7ノの出力を比較して小
さい方のイ直を出力するコンバータであり、2つの信号
を出力する。1つは比較した結果のうち小さい方の値を
与える信号であり、この信号はレジスタ7ノに格納され
る。もう一方の信号は比較の結果コンバータ69の値の
方が小さければ発するクロックでありレジスタ72の入
力り口、りとなる。
号信号55の値をアドレスとするRAMであり非類似度
Dn(j) 、 D′n(j) 、 D″n(j)が格
納される。67は音声フレーム長りに対して判定第1ス
テツプにおける選択すべきノ9ス番号を与えるROMで
ある。但し、選択すべきパス番号は標準ンやターンごと
に力えられるためROM 67は音声フレーム番号りと
標準ノeターン番号nをアドレスとして入力しそのとき
選択すべきパス番号を出力する。68はROM67の出
力とAス信号53とを比較して一致すると1を出力する
コンパレータである。69はコンパレータ68の信号に
従いコン・eレータ68の出力が1″′のときはRAM
65の出力をそのまま、またコンパレータ68の出力
が0″のときはRAM 65の出力を非類似度最大値に
変換するだめのコンバーりである。70はコンバータ6
9の出力と後で述べるレジスタ7ノの出力を比較して小
さい方のイ直を出力するコンバータであり、2つの信号
を出力する。1つは比較した結果のうち小さい方の値を
与える信号であり、この信号はレジスタ7ノに格納され
る。もう一方の信号は比較の結果コンバータ69の値の
方が小さければ発するクロックでありレジスタ72の入
力り口、りとなる。
レジスタ7ノは非類似度の最小値を力えるレジスタであ
りフレーム周期の始めに非類似度の最大値がセットされ
る。レジスタ72はコンバータ70の出力・ぐルスによ
って標準パターン番号信号を格納するレジスタで非類似
度最小値を与える標準ツヤターンの番号が格納されてい
る。
りフレーム周期の始めに非類似度の最大値がセットされ
る。レジスタ72はコンバータ70の出力・ぐルスによ
って標準パターン番号信号を格納するレジスタで非類似
度最小値を与える標準ツヤターンの番号が格納されてい
る。
第3図は以上の如く構成されており、以下動作について
説明する。
説明する。
各処理はフレーム電力P(j)が閾値以上となった時点
から開始されるが、3フレ一ム以上連続してフレーム電
力P (j)が閾値以上でなければ処理はリセットされ
る。音声の始端フレーム前はカウンタ52はリセッF
’ /9ルス50によってリセット状態にある。また、
メモリ65の値はすべてリセットされている。以後、始
端検出後の1フレ一ム周期内の処理を順次説明する。但
し、説明のため入力フレーム番号はJとする。3番目の
入力フレームのフレーム電力が閾値を越えた場合、カウ
ント・ぐルス5ノがカウンタ52に印加され、カウンタ
52はカウントアツプし音声フレーム番号りを出力する
。
から開始されるが、3フレ一ム以上連続してフレーム電
力P (j)が閾値以上でなければ処理はリセットされ
る。音声の始端フレーム前はカウンタ52はリセッF
’ /9ルス50によってリセット状態にある。また、
メモリ65の値はすべてリセットされている。以後、始
端検出後の1フレ一ム周期内の処理を順次説明する。但
し、説明のため入力フレーム番号はJとする。3番目の
入力フレームのフレーム電力が閾値を越えた場合、カウ
ント・ぐルス5ノがカウンタ52に印加され、カウンタ
52はカウントアツプし音声フレーム番号りを出力する
。
音声フレーム番号りに対応する標準・やターンのフレー
ム番号はROM54とコンパレータ57とセレクタ58
によって出力される。n番目の標準パターンのに番目の
フレームの1チャンネルのデータ5n(i、k)はRO
M 60によって出力される。一方、メモリ6ノには前
段のスペクトル正規化部(図示せず)より出力される3
番目の入力フレームのスにクトル正規化後の入力データ
W(i、Dが入力端子62より入力され格納されている
。ROM 60の出力Sn(+、k)とメモリ6ノの出
力W(i、j)はチャンネル番号信号59に同期して出
力され演算器63において第13式に与えられる演算を
行なう。演算器63の出力とメモリ65の間で第1式〜
第9式に相当する演算が実行される。実際は第1式〜第
9式の演算は統合された次の形式で行なわれる。
ム番号はROM54とコンパレータ57とセレクタ58
によって出力される。n番目の標準パターンのに番目の
フレームの1チャンネルのデータ5n(i、k)はRO
M 60によって出力される。一方、メモリ6ノには前
段のスペクトル正規化部(図示せず)より出力される3
番目の入力フレームのスにクトル正規化後の入力データ
W(i、Dが入力端子62より入力され格納されている
。ROM 60の出力Sn(+、k)とメモリ6ノの出
力W(i、j)はチャンネル番号信号59に同期して出
力され演算器63において第13式に与えられる演算を
行なう。演算器63の出力とメモリ65の間で第1式〜
第9式に相当する演算が実行される。実際は第1式〜第
9式の演算は統合された次の形式で行なわれる。
次に判定第1ステツプの動作について説明する。
判定第1ステ、プに必要なノPスの選択はROM67と
コンノやレータ68とコンバータ69によって行なわれ
る。ROM 67にはn番目の標準・ぐターンにおいて
音声フレーム番号りの場合に選択されるべき・やス番号
が格納されており、その設定基準は音声フレーム番号に
対する第10式〜第12式の演算結果のうちn番目の標
準ノ9ターンの長さS L (n)に最も近い・ぐス番
号によって与えられる。
コンノやレータ68とコンバータ69によって行なわれ
る。ROM 67にはn番目の標準・ぐターンにおいて
音声フレーム番号りの場合に選択されるべき・やス番号
が格納されており、その設定基準は音声フレーム番号に
対する第10式〜第12式の演算結果のうちn番目の標
準ノ9ターンの長さS L (n)に最も近い・ぐス番
号によって与えられる。
ROM 67の出力のパス番号とパス番号nがコンパレ
ーク68によって比較され、コン・ぐレータ68では両
者が一致すれば1″をコンバータ69に出力スル。コン
バータ69ではコンパレータ68からの入力が” ]
”のときはメモリ65の出力を、” o ”のときは非
類似度の最大値を出力しており、この処理によりコンノ
ぐレータ68からの出力が” 0 ”、すなわちROM
67の出力とノヤス番号nとが一致しない場合、その
ときの非類似度が最小判定処理によって選択されること
を実質的に禁示している。この処理により判定第1ステ
、フ0が行なわれる。次にコンバータ70によってレジ
スタ7ノに格納されている非類似度とコンバータ69に
よって出力される非類似度のうち小さい方がレジスタ7
ノに格納される。と同時にコンバーク69の出力の方が
小さければパルスがレジスタ72に加えられそのときの
標準パターン番号がレジスタ72に格納される。この処
理をすべての標準iQターンについて行なえばそのとき
の最小非類似度を与える標準パターン番号がレジスタ7
2に格納されることになる。以上の1フレ一ム周期内の
処理に対するタイムチャートを第4図に示す。
ーク68によって比較され、コン・ぐレータ68では両
者が一致すれば1″をコンバータ69に出力スル。コン
バータ69ではコンパレータ68からの入力が” ]
”のときはメモリ65の出力を、” o ”のときは非
類似度の最大値を出力しており、この処理によりコンノ
ぐレータ68からの出力が” 0 ”、すなわちROM
67の出力とノヤス番号nとが一致しない場合、その
ときの非類似度が最小判定処理によって選択されること
を実質的に禁示している。この処理により判定第1ステ
、フ0が行なわれる。次にコンバータ70によってレジ
スタ7ノに格納されている非類似度とコンバータ69に
よって出力される非類似度のうち小さい方がレジスタ7
ノに格納される。と同時にコンバーク69の出力の方が
小さければパルスがレジスタ72に加えられそのときの
標準パターン番号がレジスタ72に格納される。この処
理をすべての標準iQターンについて行なえばそのとき
の最小非類似度を与える標準パターン番号がレジスタ7
2に格納されることになる。以上の1フレ一ム周期内の
処理に対するタイムチャートを第4図に示す。
以上の処理は1フレ一ム周期ごとに行なわれ終端が検出
された時点におけるレジスタ72の結果が最終的な認識
結果となり、出力端子73から出力される。
された時点におけるレジスタ72の結果が最終的な認識
結果となり、出力端子73から出力される。
(発明の効果)
本発明は以上説明したように、入力フレームごとに距1
lllt割算、非類似度計算を行なうため終端検出後、
1フレ一ム以内に認識結果が出る利点がある。また、非
類似度計算のためには前の入力フレームに対する非類似
度値と現入力フレームに対する距離値との累算を行なう
だけでよく、始端から終端捷での入力データを格納する
必要が外い。
lllt割算、非類似度計算を行なうため終端検出後、
1フレ一ム以内に認識結果が出る利点がある。また、非
類似度計算のためには前の入力フレームに対する非類似
度値と現入力フレームに対する距離値との累算を行なう
だけでよく、始端から終端捷での入力データを格納する
必要が外い。
さらに、回路構成の簡易化を目的とした方式であるため
LSI化が容易であり、ケ゛−ト数の少々い安価な音声
認識用LSIチップを供給すると同時に汎用マイクロプ
ロセッサのソフト処理によっても実現され得るものであ
る。
LSI化が容易であり、ケ゛−ト数の少々い安価な音声
認識用LSIチップを供給すると同時に汎用マイクロプ
ロセッサのソフト処理によっても実現され得るものであ
る。
第1図は発声長変動を説明するための図、第2図は本発
明のマツチングパスの概要を説明するために示した図、
第3図は本発明の一実施例を示すブロック図、第4図は
本実施例の1フレ一ム周期内の処理に対するタイムチャ
ートを示した図である。 52・・音声フレーム番号りのカウンタ、54・。 標準・ぐターンのフレーム番号相当のものを発生させる
ためのROM、56・・・標準パターンの長さを記憶シ
ているROM、57・・コンツヤレーク、58 セレク
タ、60・・標準パターンのメモリ、61 人カバター
ンのメモリ、63・距離の演算器、64・・加算器、6
7・・選択すべきパス番号のROM 。 68・コンノやレータ、69・コンバータ、70コンバ
ータ、71・・最小非類似度のメモリ、72・・・認識
結果としての標準パターン番号のメモリ。 第1図 り数 第4図 フンバレー768 レン□゛スク 72 手続補正書(自発) 1 事件の表示 昭和59年 特 許 願第058435号2 発明の名
称 音声認識方法 3 補正をする者 事件との関係 特許出願人 任 所(〒105) 東京都港区虎ノ門1丁目7番12
号住 所(〒105) 東京都港区虎ノ門1]泪7番1
2号5、補止の対象 明細書中「発明のif 、Y−1
11な説明」の4ffl及び6 補正の内容 (1) 明細書第4頁第1行目に1声道長等」とあるの
を「声帯振動特性等」と補正する。 (2) 同1第6頁第1行目から第2行目に1以上電力
が」とあるのを1以上フレーム電力が」と補正する。 (3) 同1.第7頁第1行目と第1行目から第2行目
にかけて「発生」とあるのを1発声」と補正する。 (4) 同頁筒20行目から第8頁第2行目に「この判
定は通常・あるかないかによって」とあるのを「この判
定は通常、その時点から30フレームの間に音声の始端
条件(3フレ一ム以上連続してフレーム電力が閾値以上
)を満足するフレームが存在するかしないかによって」
と補正する。 (6) 同1第12頁第9行目と第13行目に1番目の
フレーム」とあるのを[番目の入力フレーム」と補正す
る。 (7) 同書第18頁第5行目に11を出力する」とあ
るのをr”t”を出力する」と補正する。 (8) 同書第19頁第19行目に「ROM 54とコ
ンiEレータ」とあるのをlROM 54とROM56
とコン・やレータ」と補正する。 (9) 同1第21貞第4行目と第11行目に「パス番
号n」とあるのを「パス信号53」と補正する。 (10)図面「第2図(a)」と「第4図」を別紙の通
り補正する。
明のマツチングパスの概要を説明するために示した図、
第3図は本発明の一実施例を示すブロック図、第4図は
本実施例の1フレ一ム周期内の処理に対するタイムチャ
ートを示した図である。 52・・音声フレーム番号りのカウンタ、54・。 標準・ぐターンのフレーム番号相当のものを発生させる
ためのROM、56・・・標準パターンの長さを記憶シ
ているROM、57・・コンツヤレーク、58 セレク
タ、60・・標準パターンのメモリ、61 人カバター
ンのメモリ、63・距離の演算器、64・・加算器、6
7・・選択すべきパス番号のROM 。 68・コンノやレータ、69・コンバータ、70コンバ
ータ、71・・最小非類似度のメモリ、72・・・認識
結果としての標準パターン番号のメモリ。 第1図 り数 第4図 フンバレー768 レン□゛スク 72 手続補正書(自発) 1 事件の表示 昭和59年 特 許 願第058435号2 発明の名
称 音声認識方法 3 補正をする者 事件との関係 特許出願人 任 所(〒105) 東京都港区虎ノ門1丁目7番12
号住 所(〒105) 東京都港区虎ノ門1]泪7番1
2号5、補止の対象 明細書中「発明のif 、Y−1
11な説明」の4ffl及び6 補正の内容 (1) 明細書第4頁第1行目に1声道長等」とあるの
を「声帯振動特性等」と補正する。 (2) 同1第6頁第1行目から第2行目に1以上電力
が」とあるのを1以上フレーム電力が」と補正する。 (3) 同1.第7頁第1行目と第1行目から第2行目
にかけて「発生」とあるのを1発声」と補正する。 (4) 同頁筒20行目から第8頁第2行目に「この判
定は通常・あるかないかによって」とあるのを「この判
定は通常、その時点から30フレームの間に音声の始端
条件(3フレ一ム以上連続してフレーム電力が閾値以上
)を満足するフレームが存在するかしないかによって」
と補正する。 (6) 同1第12頁第9行目と第13行目に1番目の
フレーム」とあるのを[番目の入力フレーム」と補正す
る。 (7) 同書第18頁第5行目に11を出力する」とあ
るのをr”t”を出力する」と補正する。 (8) 同書第19頁第19行目に「ROM 54とコ
ンiEレータ」とあるのをlROM 54とROM56
とコン・やレータ」と補正する。 (9) 同1第21貞第4行目と第11行目に「パス番
号n」とあるのを「パス信号53」と補正する。 (10)図面「第2図(a)」と「第4図」を別紙の通
り補正する。
Claims (1)
- 【特許請求の範囲】 各標準音声に対応して周波数成分のフレーム時系列とし
て表現された標準パターンと・やス選択情報とを記憶し
ておき、 a)入力音声から周波数成分のフレーム時系列として入
カバターンを抽出し、 b)入力音声の始端を検出して入カバターンのフレーム
の計数を開始して音声フレーム番号を更新し、無音状態
を検出している間は音声フレーム番号の更新を停止し、
入力音声の終端を確認する以前に有音状態を検出すると
当該音声フレーム番号の更新を再開し、 C)音声フレーム番号の更新毎に、そのフレーム番号に
本質的に線形々関係で標準・ぐターンの複数のフレーム
番号を発生させることによって各標準ハターンとの間に
複数のマッチングパスヲ設定し、 d)音声フレーム番号の更新毎に、前記各マツチングミ
9スで対応づけられたフレーム間で入カバターンと各標
準パターンとの距離を計算し、e)入力音声の始端から
任意の音声フレーム番号までの前記マツチング)Pスに
沿った前記距離の累算値を非類似度として、音声フレー
ム番号の更新毎に、直前の非類似度と当該フレーム番号
での距離とを加算して一旦記憶することによって、各標
準・やターン毎の各マツチング・ぐスに対応して非類似
度を更新記憶し、 f)音声フレーム番号の更新毎に、前記パス選択情報に
基づいて各標準パターンに対応して1つのノクス選択信
号を発生させ、各標準パターン毎に前、記パス選択信号
に対応した非類似度を選択し、選択された非類似度のう
ちで最小値を与える標準パターンのコードを前記音声フ
レーム番号の更新毎に更新記憶し、 g)入力音声の終端を確認した時点で、入力音声の終端
の音声フレーム番号に対応して記憶されている最小値を
与える前記標準ノソターンのコードを入力音声のカテゴ
リとして認識することを特徴とした音声認識方法。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59058435A JPS60203992A (ja) | 1984-03-28 | 1984-03-28 | 音声認識方法 |
| US06/716,154 US4868879A (en) | 1984-03-27 | 1985-03-26 | Apparatus and method for recognizing speech |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59058435A JPS60203992A (ja) | 1984-03-28 | 1984-03-28 | 音声認識方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS60203992A true JPS60203992A (ja) | 1985-10-15 |
| JPH0568716B2 JPH0568716B2 (ja) | 1993-09-29 |
Family
ID=13084311
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP59058435A Granted JPS60203992A (ja) | 1984-03-27 | 1984-03-28 | 音声認識方法 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS60203992A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS61252593A (ja) * | 1985-05-02 | 1986-11-10 | 沖電気工業株式会社 | 音声認識装置 |
-
1984
- 1984-03-28 JP JP59058435A patent/JPS60203992A/ja active Granted
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS61252593A (ja) * | 1985-05-02 | 1986-11-10 | 沖電気工業株式会社 | 音声認識装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPH0568716B2 (ja) | 1993-09-29 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US4723290A (en) | Speech recognition apparatus | |
| US5621849A (en) | Voice recognizing method and apparatus | |
| JPWO2009008055A1 (ja) | 音声認識装置、音声認識方法、および、音声認識プログラム | |
| US6029130A (en) | Integrated endpoint detection for improved speech recognition method and system | |
| CN112750445A (zh) | 语音转换方法、装置和系统及存储介质 | |
| JP3119510B2 (ja) | 音声認識装置 | |
| US5751898A (en) | Speech recognition method and apparatus for use therein | |
| JPH0247760B2 (ja) | ||
| JP4661239B2 (ja) | 音声対話装置及び音声対話方法 | |
| JP2853418B2 (ja) | 音声認識方法 | |
| JP2001005483A (ja) | 単語音声認識方法及び単語音声認識装置 | |
| JPS60203994A (ja) | 音声認識方法 | |
| JPH0568717B2 (ja) | ||
| JPH0568716B2 (ja) | ||
| JPS6129897A (ja) | パタ−ン比較装置 | |
| JPS61133994A (ja) | 音声認識方法 | |
| JPH0455518B2 (ja) | ||
| JPH0247758B2 (ja) | ||
| JP3009962B2 (ja) | 音声認識装置 | |
| JPH0320759B2 (ja) | ||
| JPS6247100A (ja) | 音声認識装置 | |
| JPH0552516B2 (ja) | ||
| JPH0449954B2 (ja) | ||
| JPH0313599B2 (ja) | ||
| JPH0567037B2 (ja) |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| EXPY | Cancellation because of completion of term |