JPH0567037B2 - - Google Patents
Info
- Publication number
- JPH0567037B2 JPH0567037B2 JP60093813A JP9381385A JPH0567037B2 JP H0567037 B2 JPH0567037 B2 JP H0567037B2 JP 60093813 A JP60093813 A JP 60093813A JP 9381385 A JP9381385 A JP 9381385A JP H0567037 B2 JPH0567037 B2 JP H0567037B2
- Authority
- JP
- Japan
- Prior art keywords
- standard pattern
- input
- frame
- frame number
- pattern
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Description
【発明の詳細な説明】
(産業上の利用分野)
本発明は音声認識装置に関し、特に単語入力音
声の終端の確認を持たないで、入力音声の始端検
出時点から認識動作をリアルタイムに開始するよ
うにした音声認識装置に関する。
声の終端の確認を持たないで、入力音声の始端検
出時点から認識動作をリアルタイムに開始するよ
うにした音声認識装置に関する。
(従来の技術)
一般に、音声は発声されるたびに発声長が変わ
り、その長さも特に母音の長さが伸縮し、全体と
して線形には変化しない。
り、その長さも特に母音の長さが伸縮し、全体と
して線形には変化しない。
第11図は種々の単語の発声長の変動を示した
図である。同図において、発声した単語の種類
は、英語では“オン(ON)”、“オフ(OFF)”、
“スタート(START)”及び“ストツプ
(STOP)”であり、日本語では“ハイ”、“ウエ”
及び“シタ”である。同図から明らかなように、
単語の発声長は変動がきわめて大きく、個人差が
あると共に話者の心理状態や状況によつても変動
し、標準という感覚のもとですら20%〜40%の発
声長のばらつきが見られる。従つて、この発声長
の変動に対応し、良好な音声認識を行うには何ら
かな工夫が必要である。
図である。同図において、発声した単語の種類
は、英語では“オン(ON)”、“オフ(OFF)”、
“スタート(START)”及び“ストツプ
(STOP)”であり、日本語では“ハイ”、“ウエ”
及び“シタ”である。同図から明らかなように、
単語の発声長は変動がきわめて大きく、個人差が
あると共に話者の心理状態や状況によつても変動
し、標準という感覚のもとですら20%〜40%の発
声長のばらつきが見られる。従つて、この発声長
の変動に対応し、良好な音声認識を行うには何ら
かな工夫が必要である。
上述の如き発声長の変動に対応するための音声
認識方法の一形式として、各標準音声に対応して
周波数成分のフレーム時系列として標準パターン
を記憶しておき、入力音声から同じく周波数成分
のフレーム時系列として入力パターンを抽出し、
入力パターンと各標準パターンとの累積距離(以
下、これを非類似度と称す)を計算し、その非類
似度に基づいて入力音声を識別する方法が知られ
ている。このような方法における標準又は入力の
音声パターンは、通常、規則的にフレームを設定
して周波数分析し、対数変換と最小自乗近似直線
を用いた声道長等の正規化とを経て、周波数成分
のフレーム時系列として表現したものを用いる。
認識方法の一形式として、各標準音声に対応して
周波数成分のフレーム時系列として標準パターン
を記憶しておき、入力音声から同じく周波数成分
のフレーム時系列として入力パターンを抽出し、
入力パターンと各標準パターンとの累積距離(以
下、これを非類似度と称す)を計算し、その非類
似度に基づいて入力音声を識別する方法が知られ
ている。このような方法における標準又は入力の
音声パターンは、通常、規則的にフレームを設定
して周波数分析し、対数変換と最小自乗近似直線
を用いた声道長等の正規化とを経て、周波数成分
のフレーム時系列として表現したものを用いる。
また、入力パターンと各標準パターンとの非類
似度を計算するためにマツチングパスを設定する
方法としては、動的計画法を用いたDPマツチン
グ法と線形マツチング法とが知られている。
似度を計算するためにマツチングパスを設定する
方法としては、動的計画法を用いたDPマツチン
グ法と線形マツチング法とが知られている。
(発明が解決しようとする問題点)
しかしながら、DPマツチング法はマツチング
精度が上がる反面計算量が多く、ハードウエアで
実現するとしてもゲート数が多くなるという欠点
があつた。
精度が上がる反面計算量が多く、ハードウエアで
実現するとしてもゲート数が多くなるという欠点
があつた。
一方、線形マツチング法は、短い音節数の単語
には比較的有効であり、DPマツチングに比べて
演算量も少ないが、少なくとも音声の始端から終
端までの情報を畜えておくメモリが必要であり、
回路規模の限られた装置で実現するのは困難であ
つた。
には比較的有効であり、DPマツチングに比べて
演算量も少ないが、少なくとも音声の始端から終
端までの情報を畜えておくメモリが必要であり、
回路規模の限られた装置で実現するのは困難であ
つた。
したがつて、本発明は上記問題点を解決し、入
力音声の始端を検出して直ちに認識動作を開始す
るようにして速い認識速度と入力音声のデータを
格納するためのメモリ容量の低減とを可能とする
とともに、入力音声の発声長の変動を予想して本
質的に線形なマツチングパスを複数個設けること
によつて、発声長の変動に対応することを可能と
した音声認識装置を提供することを目的とする。
力音声の始端を検出して直ちに認識動作を開始す
るようにして速い認識速度と入力音声のデータを
格納するためのメモリ容量の低減とを可能とする
とともに、入力音声の発声長の変動を予想して本
質的に線形なマツチングパスを複数個設けること
によつて、発声長の変動に対応することを可能と
した音声認識装置を提供することを目的とする。
(問題点を解決するための手段)
本発明は、入力音声を周波数分析し、複数チヤ
ネルの周波数成分のフレーム時系列情報である入
力パターンを抽出する手段(手段(a))と、前記入
力パターンの各フレームの各チヤネルのデータを
スペクトル正規化してスペクトル正規化データW
(i,j)を作成する手段(手段(b))と、前記ス
ペクトル正規化データに基づいて入力音声の始
端、終端及び有音状態を検出する手段(手段(c))
と、距離計算及び判定のための距離計算及び判定
手段(手段(d))とを具備する。
ネルの周波数成分のフレーム時系列情報である入
力パターンを抽出する手段(手段(a))と、前記入
力パターンの各フレームの各チヤネルのデータを
スペクトル正規化してスペクトル正規化データW
(i,j)を作成する手段(手段(b))と、前記ス
ペクトル正規化データに基づいて入力音声の始
端、終端及び有音状態を検出する手段(手段(c))
と、距離計算及び判定のための距離計算及び判定
手段(手段(d))とを具備する。
本発明によれば、上記手段(d)は以下のとおり手
段(d1)〜(d8)から構成される。
段(d1)〜(d8)から構成される。
手段(d1)は、予め複数の標準音声を周波数分
析し、スペクトル正規化することにより作成され
た各々複数フレーム、複数チヤネルのスペクトル
正規化データSn(i,kp)(但し、iはチヤネル
番号、kpはフレーム番号)からなる複数の標準
パターンを格納する標準パターンメモリである。
析し、スペクトル正規化することにより作成され
た各々複数フレーム、複数チヤネルのスペクトル
正規化データSn(i,kp)(但し、iはチヤネル
番号、kpはフレーム番号)からなる複数の標準
パターンを格納する標準パターンメモリである。
手段(d2)は、前記スペクトル正規化手段から
送られる入力パターンの1フレーム分の全チヤネ
ルのスペクトル正規化データW(i,j)を格納
する入力メモリである。
送られる入力パターンの1フレーム分の全チヤネ
ルのスペクトル正規化データW(i,j)を格納
する入力メモリである。
手段(d3)は、入力音声の始端検出後、入力パ
ターンのフレーム計数を開始して入力音声が有音
状態であるか無音状態であるかにかかわらず、音
声フレーム番号を順次更新するものである。
ターンのフレーム計数を開始して入力音声が有音
状態であるか無音状態であるかにかかわらず、音
声フレーム番号を順次更新するものである。
手段(d4)は、前記音声フレーム番号の更新毎
に、各標準パターンと前記入力パターンとの間に
複数のマツチングパスを設定するために、前記音
声フレーム番号と本質的に線形な関係で標準パタ
ーンの複数のフレーム番号kpを発生するもので
ある。
に、各標準パターンと前記入力パターンとの間に
複数のマツチングパスを設定するために、前記音
声フレーム番号と本質的に線形な関係で標準パタ
ーンの複数のフレーム番号kpを発生するもので
ある。
手段(d5)は、前記音声フレーム番号の更新毎
に、前記マツチングパスで対応づけられるフレー
ム間で各チヤネルにわたつて前記入力パターンの
スペクトル正規データW(i,j)と前記標準パ
ターンのスペクトル正規化データSn(i,kp)と
の距離を算出するものである。
に、前記マツチングパスで対応づけられるフレー
ム間で各チヤネルにわたつて前記入力パターンの
スペクトル正規データW(i,j)と前記標準パ
ターンのスペクトル正規化データSn(i,kp)と
の距離を算出するものである。
手段(d6)は、入力音声の始端から、任意の前
記音声フレーム番号の前記マツチングパスに沿つ
た前記距離の累算値を非類似度として音声フレー
ム番号の更新毎に直前の非類似度と当該フレーム
番号での距離を加算して、一時的に格納すること
によつて各標準パターン毎の各マツチングパスに
対応した非類似度を算出するものである。
記音声フレーム番号の前記マツチングパスに沿つ
た前記距離の累算値を非類似度として音声フレー
ム番号の更新毎に直前の非類似度と当該フレーム
番号での距離を加算して、一時的に格納すること
によつて各標準パターン毎の各マツチングパスに
対応した非類似度を算出するものである。
手段(d7)は、標準パターンのカテゴリーの単
語発声長の分布範囲により分布の多い部分を表現
する各標準パターン毎の所定の判定対象区間に関
して、前記音声フレーム番号が任意の標準パター
ンの前記所定の判定対象区間内にある場合にの
み、当該音声フレーム番号と当該標準パターンに
対して選択する1つもしくは2つの前記非類似度
を選択するための1つもしくは2つのパス選択情
報を格納し、音声フレーム番号の更新毎に前記標
準パターンに対応して1つもしくは2つの前記パ
ス選択情報を出力する。
語発声長の分布範囲により分布の多い部分を表現
する各標準パターン毎の所定の判定対象区間に関
して、前記音声フレーム番号が任意の標準パター
ンの前記所定の判定対象区間内にある場合にの
み、当該音声フレーム番号と当該標準パターンに
対して選択する1つもしくは2つの前記非類似度
を選択するための1つもしくは2つのパス選択情
報を格納し、音声フレーム番号の更新毎に前記標
準パターンに対応して1つもしくは2つの前記パ
ス選択情報を出力する。
手段(d8)は、選択された前記非類似度のうち
で最小の非類似度を検出し、当該最小の非類似度
に対応する標準パターンの番号を格納するもので
ある。
で最小の非類似度を検出し、当該最小の非類似度
に対応する標準パターンの番号を格納するもので
ある。
(作用)
入力音声は上記手段(a)により周波数分析され、
複数チヤネルの周波数成分のフレーム時系列情報
である入力パターンが抽出される。この入力パタ
ーンの各フレームの各チヤネルのデータは、上記
手段(b)によりスペクトル正規化され、スペクトル
正規化データW(i,j)が得られる。このスペ
クトル正規化データに基づき、手段(c)により入力
音声の始端、終端及び有音状態が検出される。
複数チヤネルの周波数成分のフレーム時系列情報
である入力パターンが抽出される。この入力パタ
ーンの各フレームの各チヤネルのデータは、上記
手段(b)によりスペクトル正規化され、スペクトル
正規化データW(i,j)が得られる。このスペ
クトル正規化データに基づき、手段(c)により入力
音声の始端、終端及び有音状態が検出される。
前記スペクトル正規化手段から送られる入力パ
ターンの1フレーム分の全チヤネルのスペクトル
正規化データW(i,j)は上記(d2)の手段に
格納される。また、上記手段(c)による入力音声の
始端検出後、入力パターンのフレーム計数を開始
して入力音声が有音状態であるか無音状態である
かにかかわらず、音声フレーム番号は上記手段
(d3)により順次更新される。更に、この音声フ
レーム番号の更新毎に、各標準パターンと入力パ
ターンとの間に複数のマツチングパスを設定する
ために、この音声フレーム番号と本質的に線形な
関係で標準パターンの複数のフレーム番号kpが
上記手段(d4)により形成される。
ターンの1フレーム分の全チヤネルのスペクトル
正規化データW(i,j)は上記(d2)の手段に
格納される。また、上記手段(c)による入力音声の
始端検出後、入力パターンのフレーム計数を開始
して入力音声が有音状態であるか無音状態である
かにかかわらず、音声フレーム番号は上記手段
(d3)により順次更新される。更に、この音声フ
レーム番号の更新毎に、各標準パターンと入力パ
ターンとの間に複数のマツチングパスを設定する
ために、この音声フレーム番号と本質的に線形な
関係で標準パターンの複数のフレーム番号kpが
上記手段(d4)により形成される。
そして、前記音声フレーム番号の更新毎に、前
記マツチングパスで対応づけられるフレーム間で
各チヤンネルにわたつて前記入力パターンのスペ
クトル正規化データW(i,j)と前記標準パタ
ーンのスペクトル正規化データSn(i,kp)との
距離が、上記手段(d5)により計算される。尚、
標準パターンは上記手段(d1)に格納されてい
る。そして、上記手段(d6)により、各標準パタ
ーン毎の各マツチングパスに対応した非類似度
が、入力音声の始端から、任意の前記音声フレー
ム番号の前記マツチングパスに沿つた前記距離の
累算値を非類似度として音声フレーム番号の更新
毎に直前の非類似度と当該フレーム番号での距離
を加算して、一時的に格納することによつて得ら
れる。この際、マツチングパスは手段(d7)によ
り、音声フレーム番号が任意の標準パターンの前
記所定の判定対象区間内にある場合に、当該フレ
ーム番号と当該標準パターンの番号とで指定され
るアドレスに1つもしくは2つの非類似度を選択
するための1つもしくは2つの格納されたパス選
択情報に基づき選択される。一方、音声フレーム
番号が任意の標準パターンの所定の判定対象区間
外にある場合には、マツチングパスは選択されな
い。そして、最終的に、選択された前記非類似度
のうちで最小の非類似度を検出し、当該最小の非
類似度に対応する標準パターンの番号を上記手段
(d8)に格納する。
記マツチングパスで対応づけられるフレーム間で
各チヤンネルにわたつて前記入力パターンのスペ
クトル正規化データW(i,j)と前記標準パタ
ーンのスペクトル正規化データSn(i,kp)との
距離が、上記手段(d5)により計算される。尚、
標準パターンは上記手段(d1)に格納されてい
る。そして、上記手段(d6)により、各標準パタ
ーン毎の各マツチングパスに対応した非類似度
が、入力音声の始端から、任意の前記音声フレー
ム番号の前記マツチングパスに沿つた前記距離の
累算値を非類似度として音声フレーム番号の更新
毎に直前の非類似度と当該フレーム番号での距離
を加算して、一時的に格納することによつて得ら
れる。この際、マツチングパスは手段(d7)によ
り、音声フレーム番号が任意の標準パターンの前
記所定の判定対象区間内にある場合に、当該フレ
ーム番号と当該標準パターンの番号とで指定され
るアドレスに1つもしくは2つの非類似度を選択
するための1つもしくは2つの格納されたパス選
択情報に基づき選択される。一方、音声フレーム
番号が任意の標準パターンの所定の判定対象区間
外にある場合には、マツチングパスは選択されな
い。そして、最終的に、選択された前記非類似度
のうちで最小の非類似度を検出し、当該最小の非
類似度に対応する標準パターンの番号を上記手段
(d8)に格納する。
このようにして、入力音声の終端を検出した時
点で入力音声の終端の音声フレーム番号に対応し
て格納されている最小の前記非類似度に対応する
前記標準パターンの番号が入力音声の識別結果と
して判定される。
点で入力音声の終端の音声フレーム番号に対応し
て格納されている最小の前記非類似度に対応する
前記標準パターンの番号が入力音声の識別結果と
して判定される。
(実施例)
実施例を説明するのに先だつて、まず本発明に
おける音声認識処理について説明する。
おける音声認識処理について説明する。
本発明における音声認識処理は、始端検出処
理、有音状態の処理、無音状態の処理、パワーデ
イツプ終了後の有音処理及び終端処理の5つの処
理から構成される。次に、それぞれの処理内容を
具体的に説明する。
理、有音状態の処理、無音状態の処理、パワーデ
イツプ終了後の有音処理及び終端処理の5つの処
理から構成される。次に、それぞれの処理内容を
具体的に説明する。
(A) 始端検出処理
音声の有音状態の検出は、音声パワーを用いる
方法を用いることができる。この場合音声の始端
検出はフレーム電力P(j)(但しjは入力パターン
のフレーム番号)があらかじめ定められた閾値を
越えた時点を始端と考える。但し、外部からの雑
音などにより音声入力が行なわれていなくともフ
レーム電力P(j)が閾値を越えてしまい、誤つた始
端とする場合がある。そのため、ともかくフレー
ム電力P(j)が閾値を越えたフレームを始端と考え
認識処理を開始するものの連続して3フレーム以
上電力が閾値を越えなければその入力フレームを
音声の始端とは考えず認識処理を中断し始端検出
のための処理へともどる。但し、フレーム長を
16msecとしている。
方法を用いることができる。この場合音声の始端
検出はフレーム電力P(j)(但しjは入力パターン
のフレーム番号)があらかじめ定められた閾値を
越えた時点を始端と考える。但し、外部からの雑
音などにより音声入力が行なわれていなくともフ
レーム電力P(j)が閾値を越えてしまい、誤つた始
端とする場合がある。そのため、ともかくフレー
ム電力P(j)が閾値を越えたフレームを始端と考え
認識処理を開始するものの連続して3フレーム以
上電力が閾値を越えなければその入力フレームを
音声の始端とは考えず認識処理を中断し始端検出
のための処理へともどる。但し、フレーム長を
16msecとしている。
(B) 有音状態の処理
(B−1) マツチングパス
音声の始端からフレーム電力が閾値を越えたフ
レームの番号付けを定義しh番目の音声フレーム
と称し、単なる入力フレーム番号とは区別する。
すなわち、音声フレーム番号hの音声フレーム
は、有音区間でh番目の入力フレームに対応す
る。
レームの番号付けを定義しh番目の音声フレーム
と称し、単なる入力フレーム番号とは区別する。
すなわち、音声フレーム番号hの音声フレーム
は、有音区間でh番目の入力フレームに対応す
る。
発声速度の正規化を行なうマツチング処理を音
声の始端から開始し、音声分析部出力が得られる
周期(フレーム周期)ごとに行なえれば音声分析
部のデータを始端からすべて格納しておく必要も
なく、また、応答時間も速くなる。
声の始端から開始し、音声分析部出力が得られる
周期(フレーム周期)ごとに行なえれば音声分析
部のデータを始端からすべて格納しておく必要も
なく、また、応答時間も速くなる。
本発明は発声がおそく行なわれた場合、標準的
に行なわれた場合、はやく行なわれた場合を想定
したマツチングパスを設定しそれぞれのマツチン
グパス上でのマツチング処理を行なう。音声の始
端検出時点では今から入力される単語の発声速度
は不明である。そこで発声がおそく行なわれた場
合、標準的に行なわれた場合、はやく行なわれた
場合を想定したマツチングパスを設定し、それぞ
れのマツチングパス上でマツチング処理を行なえ
ば終端検出前からでもマツチング処理が開始可能
となる。
に行なわれた場合、はやく行なわれた場合を想定
したマツチングパスを設定しそれぞれのマツチン
グパス上でのマツチング処理を行なう。音声の始
端検出時点では今から入力される単語の発声速度
は不明である。そこで発声がおそく行なわれた場
合、標準的に行なわれた場合、はやく行なわれた
場合を想定したマツチングパスを設定し、それぞ
れのマツチングパス上でマツチング処理を行なえ
ば終端検出前からでもマツチング処理が開始可能
となる。
第2図aは、本発明による音声認識方法におけ
る入力パターンと標準パターンとのマツチングを
行なう複数のマツチングパス例を示した図、第2
図bは入力パターンのフレーム電力例を示した
図、第2図cは入力パターンと標準パターンとの
各マツチングパスにおける非類似度Dn0(j),Dn1
(j),Dn2(j)の例を示した図である。尚、第2図a
〜cのそれぞれの横軸は相互に対応するものであ
る。
る入力パターンと標準パターンとのマツチングを
行なう複数のマツチングパス例を示した図、第2
図bは入力パターンのフレーム電力例を示した
図、第2図cは入力パターンと標準パターンとの
各マツチングパスにおける非類似度Dn0(j),Dn1
(j),Dn2(j)の例を示した図である。尚、第2図a
〜cのそれぞれの横軸は相互に対応するものであ
る。
第2図aにおいては発声速度の範囲を例えば±
20%と考え、マツチングパスを3本設定した場合
を示している。第2図aにおいて、横軸は入力パ
ターンのフレーム番号を表わす。また、縦軸は標
準パターンのフレーム番号を表わし、n番目の標
準パターンSnを例として考え、そのフレーム長
をSL(n)とする。パス0は発声を20%遅く発声し
た場合を想定したパス、パス1は標準的な発声を
想定したパス、パス2は発声を20%速く想定した
場合のパスを示す。
20%と考え、マツチングパスを3本設定した場合
を示している。第2図aにおいて、横軸は入力パ
ターンのフレーム番号を表わす。また、縦軸は標
準パターンのフレーム番号を表わし、n番目の標
準パターンSnを例として考え、そのフレーム長
をSL(n)とする。パス0は発声を20%遅く発声し
た場合を想定したパス、パス1は標準的な発声を
想定したパス、パス2は発声を20%速く想定した
場合のパスを示す。
ここで、h番目の音声フレームに対して、それ
ぞれのパスに対応するフレーム番号をパス対応フ
レーム番号と称す。特にパスp(p=0,1,2)
に対応するパス対応フレーム番号をパスp対応フ
レーム番号と称し次式(1)−(3)で表わす。
ぞれのパスに対応するフレーム番号をパス対応フ
レーム番号と称す。特にパスp(p=0,1,2)
に対応するパス対応フレーム番号をパスp対応フ
レーム番号と称し次式(1)−(3)で表わす。
パス0対応フレーム番号0
0=〔1/1.2h〕 ……(1)
パス1対応フレーム番号1
1=h ……(2)
パス2対応フレーム番号2
2=〔1/0.8h〕 ……(3)
ただし〔 〕はガウス記号を示す。
(B−2) 距離計算
j番目の入力フレームに対し、標準パターン
Sn(i,kp)との各パス上での距離dnp(i,j)
を次式(4)によつて定める。但し、hはj番目の入
力フレーム番号に対応した音声フレーム番号、p
はパスの番号、W(i,j)は入力フレーム番号
がjでチヤネル番号がi(但しi=0〜7)の入
力パターンのデータ、kpは標準パターンのフレ
ーム番号、及びSn(i,kp)は標準パターンのデ
ータである。
Sn(i,kp)との各パス上での距離dnp(i,j)
を次式(4)によつて定める。但し、hはj番目の入
力フレーム番号に対応した音声フレーム番号、p
はパスの番号、W(i,j)は入力フレーム番号
がjでチヤネル番号がi(但しi=0〜7)の入
力パターンのデータ、kpは標準パターンのフレ
ーム番号、及びSn(i,kp)は標準パターンのデ
ータである。
dnp(i,j)=|W(i,j)−Sn(i,kp)|
……(4) 但し、 kp=p p≦SL(n) SL(n) p>SL(n) この式によれば、パスpにおいては入力パター
ンのj番目の入力フレームのデータと標準パター
ンのkp番目のフレームのデータとの間の距離計
算を行う。またパス対応フレーム番号pは標準
パターンの長さSL(n)に制限され標準パターンの
フレーム番号kpとなる。
……(4) 但し、 kp=p p≦SL(n) SL(n) p>SL(n) この式によれば、パスpにおいては入力パター
ンのj番目の入力フレームのデータと標準パター
ンのkp番目のフレームのデータとの間の距離計
算を行う。またパス対応フレーム番号pは標準
パターンの長さSL(n)に制限され標準パターンの
フレーム番号kpとなる。
(B−3) 非類似度
次に、始端から入力パターンのj番目の入力フ
レームまでの非類似度Dnp(j)が次式(5)に示すごと
く計算される。但し、pはパスの番号p=0,
1,2を表わす。
レームまでの非類似度Dnp(j)が次式(5)に示すごと
く計算される。但し、pはパスの番号p=0,
1,2を表わす。
Dnp(j)=Dnp(j−1)+7
〓i=0
dnp(i,j) ……(5)
すなわち、それぞれのパス上でのj番目のフレ
ームの非類似度の算出は各チヤネルごとの距離
(例えば|W(i,j)−Sn(i,kp)|)をチヤネ
ル分、j−1番目のフレームに対する非類似度値
(たとえばDnp(j−1))に加えることによつて
得られる。これらの演算はj番目のフレームの入
力がなされた時点で行なわれる。j番目のフレー
ムに対する非類似度の算出にあたつてはj番目の
フレームの入力パターンデータとそれぞれのパス
に相当する標準パターンのデータおよび1フレー
ム前のj−1番目のフレームの非類似度データの
みが必要であつて2フレーム以上前の入力パター
ンデータは不必要である。そのため、終端を検出
するまでの入力パターンを格納しておかなければ
ならない線形伸縮マツチング法に比較しても記憶
領域が小さくなる効果が生じる。
ームの非類似度の算出は各チヤネルごとの距離
(例えば|W(i,j)−Sn(i,kp)|)をチヤネ
ル分、j−1番目のフレームに対する非類似度値
(たとえばDnp(j−1))に加えることによつて
得られる。これらの演算はj番目のフレームの入
力がなされた時点で行なわれる。j番目のフレー
ムに対する非類似度の算出にあたつてはj番目の
フレームの入力パターンデータとそれぞれのパス
に相当する標準パターンのデータおよび1フレー
ム前のj−1番目のフレームの非類似度データの
みが必要であつて2フレーム以上前の入力パター
ンデータは不必要である。そのため、終端を検出
するまでの入力パターンを格納しておかなければ
ならない線形伸縮マツチング法に比較しても記憶
領域が小さくなる効果が生じる。
(B−4) 判定処理
従来の線形マツチング方式では終端を検出して
からでないと認識処理を開始することが出来なか
つたが、その最大の原因は始端と終端を結んだ線
形マツチングパスを設定することにあつた。本発
明では、終端を検出する前においても認識処理を
開始ならしめるために、始端と終端を線形に結ん
だ1本のパスのかわりに始端からの複数のマツチ
ングパスを設定し先行的に認識処理を開始し、非
類似度を算出している。
からでないと認識処理を開始することが出来なか
つたが、その最大の原因は始端と終端を結んだ線
形マツチングパスを設定することにあつた。本発
明では、終端を検出する前においても認識処理を
開始ならしめるために、始端と終端を線形に結ん
だ1本のパスのかわりに始端からの複数のマツチ
ングパスを設定し先行的に認識処理を開始し、非
類似度を算出している。
判定処理は複数のマツチングパス上での非類似
度Dnp(j)を基にして、現在のフレームを終端と仮
定した場合の認識結果を得る処理と定義される。
したがつて、現フレームを終端と仮定した場合
に、複数のマツチングパスのうち、本来の始端と
終端を直線にて結んだパスに最も近いパスの選択
が可能となり、そのパス上での非類似度の中から
最小類似度を与えるカテゴリーを認識結果とする
方法が有効である。このパスの選定にあたつては
標準パターンの長さSL(n)とパス対応フレーム番
号pが用いられ、SL(n)に最も近いパス対応フ
レーム番号pを与えるパス番号が選択される。
度Dnp(j)を基にして、現在のフレームを終端と仮
定した場合の認識結果を得る処理と定義される。
したがつて、現フレームを終端と仮定した場合
に、複数のマツチングパスのうち、本来の始端と
終端を直線にて結んだパスに最も近いパスの選択
が可能となり、そのパス上での非類似度の中から
最小類似度を与えるカテゴリーを認識結果とする
方法が有効である。このパスの選定にあたつては
標準パターンの長さSL(n)とパス対応フレーム番
号pが用いられ、SL(n)に最も近いパス対応フ
レーム番号pを与えるパス番号が選択される。
第3図aは入力パターンに対して長さの短い標
準パターンnとのマツチングで、パス0が選択さ
れた例を示す図、bは入力パターンに対して同程
度の長さの標準パターンn′とのマツチングで、パ
ス1が選択された例を示す図、cは入力パターン
に対し長さの長い標準パターンn″とのマツチング
で、パス2が選択された例を示す図である。また
dはパスの選択がしずらい場合を示しており、こ
のようなときには両方のパス0とパス1とを選択
し、有効とする。一方、第3図eに示されるよう
に、入力の長さに対し標準パターンの長さが極端
に異なる場合がある。このような現象は認識対象
語の中にその長さが極端に異なる単語を含んでい
る場合に見られる。このような場合、無理に終端
を一致させる処理よりも、むしろ長さによつて認
識対象語を限定する処理の方がより効果的であ
る。したがつてeに示されるような入力と標準パ
ターンの組み合わせでは、パスを全く選択しない
ことにより実質的にその標準パターンを判定対象
から削除する。逆に標準パターン長が極端に短い
場合にも、パスは選択されない。
準パターンnとのマツチングで、パス0が選択さ
れた例を示す図、bは入力パターンに対して同程
度の長さの標準パターンn′とのマツチングで、パ
ス1が選択された例を示す図、cは入力パターン
に対し長さの長い標準パターンn″とのマツチング
で、パス2が選択された例を示す図である。また
dはパスの選択がしずらい場合を示しており、こ
のようなときには両方のパス0とパス1とを選択
し、有効とする。一方、第3図eに示されるよう
に、入力の長さに対し標準パターンの長さが極端
に異なる場合がある。このような現象は認識対象
語の中にその長さが極端に異なる単語を含んでい
る場合に見られる。このような場合、無理に終端
を一致させる処理よりも、むしろ長さによつて認
識対象語を限定する処理の方がより効果的であ
る。したがつてeに示されるような入力と標準パ
ターンの組み合わせでは、パスを全く選択しない
ことにより実質的にその標準パターンを判定対象
から削除する。逆に標準パターン長が極端に短い
場合にも、パスは選択されない。
これを、標準パターン側から考えれば入力音声
の長さを表わす音声フレーム長がある範囲でなけ
れば判定対象とされないことになる。ここである
標準パターンを判定対象とする音声フレーム長の
範囲を判定対象区間と称する。判定対象区間は標
準パターンごとに異なつてており、その設定は標
準パターンが表わす単語の発声の長さがたとえば
95%程度分布している範囲に設定される。
の長さを表わす音声フレーム長がある範囲でなけ
れば判定対象とされないことになる。ここである
標準パターンを判定対象とする音声フレーム長の
範囲を判定対象区間と称する。判定対象区間は標
準パターンごとに異なつてており、その設定は標
準パターンが表わす単語の発声の長さがたとえば
95%程度分布している範囲に設定される。
第4図に、判定対象区間と音声フレームの関係
を示す。同図において、縦軸は標準パターンフレ
ーム番号を示し、横軸は音声フレーム番号を示
す。また、参照番号50で示される曲線はその標
準パターンが表わす単語の発声長の分布を示す。
同図に示されるように、音声フレーム番号がh1の
場合は判定対象区間外であるため、どのパスも選
択されない。一方、音声フレーム番号がh2の場合
は判定対象区間内であるため、パス1が選択され
る。そして、選択されたパス上での非類似度Dnp
(j)の中から最小値を与える標準パターンに与えら
れたカテゴリーを認識結果とする。
を示す。同図において、縦軸は標準パターンフレ
ーム番号を示し、横軸は音声フレーム番号を示
す。また、参照番号50で示される曲線はその標
準パターンが表わす単語の発声長の分布を示す。
同図に示されるように、音声フレーム番号がh1の
場合は判定対象区間外であるため、どのパスも選
択されない。一方、音声フレーム番号がh2の場合
は判定対象区間内であるため、パス1が選択され
る。そして、選択されたパス上での非類似度Dnp
(j)の中から最小値を与える標準パターンに与えら
れたカテゴリーを認識結果とする。
(C) 無音状態の処理
フレーム電力が閾値未満となつた点を音声の終
端と考えがちであるが、単語には「ichi」の
「i」と「chi」の間、「stop」の「sto」と「p」
の間のように単語内にフレーム電力が閾値未満と
なる部分を持つ場合があつて、このような単語の
終端を単にフレーム電力が閾値未満となるかどう
かによつて判断することはできない。このような
部分を「パワーデイツプ」と称する。このパワー
デイツプの長さは単語によつて異なるが通常30フ
レーム長を越えることはほとんどない。音声の始
端を検出後、あるフレーム時間点においてそのフ
レーム電力が閾値未満となつた場合、そのフレー
ム時間点はパワーデイツプの始まりなのか、音声
の終端なのかは判断がつかない。この判定は通
常、フレーム電力が閾値未満の区間(“無音フレ
ーム番号”と称しuにて表現する)が30フレーム
以上あるかないかによつて行なうためフレーム電
力が閾値未満となつて30フレーム後でなければ判
断が下されない。従つて、フレーム電力が閾値未
満となつた場合の結果は終端が確定するまで何ら
かの形で保留されなければならない。
端と考えがちであるが、単語には「ichi」の
「i」と「chi」の間、「stop」の「sto」と「p」
の間のように単語内にフレーム電力が閾値未満と
なる部分を持つ場合があつて、このような単語の
終端を単にフレーム電力が閾値未満となるかどう
かによつて判断することはできない。このような
部分を「パワーデイツプ」と称する。このパワー
デイツプの長さは単語によつて異なるが通常30フ
レーム長を越えることはほとんどない。音声の始
端を検出後、あるフレーム時間点においてそのフ
レーム電力が閾値未満となつた場合、そのフレー
ム時間点はパワーデイツプの始まりなのか、音声
の終端なのかは判断がつかない。この判定は通
常、フレーム電力が閾値未満の区間(“無音フレ
ーム番号”と称しuにて表現する)が30フレーム
以上あるかないかによつて行なうためフレーム電
力が閾値未満となつて30フレーム後でなければ判
断が下されない。従つて、フレーム電力が閾値未
満となつた場合の結果は終端が確定するまで何ら
かの形で保留されなければならない。
フレーム電力が閾値未満となつたとき、音声の
フレーム番号の更新を停止して、かつ距離を強制
的に0にして累積距離の加算を停止することにあ
る。すなわち、無音状態の場合には前記(4)式に対
応する距離を強制的に次式(6)に示す如く、 dnp(i,j)=0 ……(6) とすることによりフレーム電力が閾値以下の場合
の非類似度計算を事実上加算しない処理を行な
う。またこのために、標準パターンもパワーデイ
ツプ対応のフレームを除いた形で蓄積する。
フレーム番号の更新を停止して、かつ距離を強制
的に0にして累積距離の加算を停止することにあ
る。すなわち、無音状態の場合には前記(4)式に対
応する距離を強制的に次式(6)に示す如く、 dnp(i,j)=0 ……(6) とすることによりフレーム電力が閾値以下の場合
の非類似度計算を事実上加算しない処理を行な
う。またこのために、標準パターンもパワーデイ
ツプ対応のフレームを除いた形で蓄積する。
このように、パワーデイツプや標準パターンの
終端以後でのマツチングのように、非類似度とし
て重要でないフレームでは距離を0としているけ
れども、本発明では本質的に線形なマツチングで
ある。
終端以後でのマツチングのように、非類似度とし
て重要でないフレームでは距離を0としているけ
れども、本発明では本質的に線形なマツチングで
ある。
第5図aは本発明における無音処理による入力
パターンと標準パターンとのマツチングを行うマ
ツチングパスの一例を示す図であり、横軸に入力
パターンのフレーム番号jをとり、縦軸に標準パ
ターンのフレーム番号をとり20%遅く発声した場
合、標準的に発声した場合、及び20%速く発声し
た場合を想定した3本のマツチングパスを示すも
のである。第5図bは入力パターンの音声フレー
ム番号jに対応したフレーム電力を示すものであ
る。第5図cは各マツチングパスにおける非類似
度Dn1(j),Dn2(j),Dn3(j) の例を示す図である。
尚、第5図a〜cのそれぞれの横軸は相互に対応
するものである。
パターンと標準パターンとのマツチングを行うマ
ツチングパスの一例を示す図であり、横軸に入力
パターンのフレーム番号jをとり、縦軸に標準パ
ターンのフレーム番号をとり20%遅く発声した場
合、標準的に発声した場合、及び20%速く発声し
た場合を想定した3本のマツチングパスを示すも
のである。第5図bは入力パターンの音声フレー
ム番号jに対応したフレーム電力を示すものであ
る。第5図cは各マツチングパスにおける非類似
度Dn1(j),Dn2(j),Dn3(j) の例を示す図である。
尚、第5図a〜cのそれぞれの横軸は相互に対応
するものである。
(D) パワーデイツプ終了後の有音処理
パワーデイツプをもつ単語の認識処理の場合に
は、フレーム電力が閾値未満となつて30フレーム
以内に再びフレーム電力が閾値以上(有音状態)
となる。この有音状態においても音声フレームの
更新、距離計算、累積距離演算など前記有音処理
と同じ認識処理が行われる。
は、フレーム電力が閾値未満となつて30フレーム
以内に再びフレーム電力が閾値以上(有音状態)
となる。この有音状態においても音声フレームの
更新、距離計算、累積距離演算など前記有音処理
と同じ認識処理が行われる。
(E) 終端処理
フレーム電力が30フレーム連続して閾値以下と
なつた点で終端が判定される。実際の音声終端は
終端を判定した時点から30フレーム前となり、こ
の時点での判定結果を認識結果として出力する。
なつた点で終端が判定される。実際の音声終端は
終端を判定した時点から30フレーム前となり、こ
の時点での判定結果を認識結果として出力する。
本発明は、以上の如く処理される。
第1図は本発明による音声認識装置の第1の実
施例を示すブロツク図である。同図において、1
1は音声入力端子、12は周波数分析部、13は
スペクトル正規化部、14は距離計算及び判定
部、15は音声のフレーム電力比較部、16はコ
ントローラで例えばマイクロプロセツサが用いら
れる。17はフレーム電力、18はフレーム電力
が閾値を越えていることを示すオーバ信号、19
はコントローラ16が周波数分析部12に与える
コントロール信号、20はコントローラ16がス
ペクトル正規化部13に与えるコントロール信
号、21はコントローラ16が距離計算及び判定
部14に与えるコントロール信号、22はコント
ローラ16に距離計算及び判定部14から与えら
れるフレーム番号信号(音声フレーム番号h、無
音フレーム番号uを表わす信号)である。
施例を示すブロツク図である。同図において、1
1は音声入力端子、12は周波数分析部、13は
スペクトル正規化部、14は距離計算及び判定
部、15は音声のフレーム電力比較部、16はコ
ントローラで例えばマイクロプロセツサが用いら
れる。17はフレーム電力、18はフレーム電力
が閾値を越えていることを示すオーバ信号、19
はコントローラ16が周波数分析部12に与える
コントロール信号、20はコントローラ16がス
ペクトル正規化部13に与えるコントロール信
号、21はコントローラ16が距離計算及び判定
部14に与えるコントロール信号、22はコント
ローラ16に距離計算及び判定部14から与えら
れるフレーム番号信号(音声フレーム番号h、無
音フレーム番号uを表わす信号)である。
動作を説明すると、電気信号に変換された入力
音声信号は、音声入力端子11を介して、周波数
分析部12に入力される。周波数分析部12は、
例えばデイジタルバンドパスフイルタで構成さ
れ、入力音声信号を周波数分析し、8つの周波数
帯域(以下、チヤネルと称す)毎のスペクトル強
度をあらわすデータに変換する。
音声信号は、音声入力端子11を介して、周波数
分析部12に入力される。周波数分析部12は、
例えばデイジタルバンドパスフイルタで構成さ
れ、入力音声信号を周波数分析し、8つの周波数
帯域(以下、チヤネルと称す)毎のスペクトル強
度をあらわすデータに変換する。
周波数分析部12で分析されたデータは、スペ
クトル正規化部13に送られる。スペクトル正規
化部13は話者による音源特性及び発声強度の違
いの正規化を行い、スペクトル正規化されたデー
タを距離計算及び判定部14へ出力する。同時
に、周波数分析部12の出力の8チヤネル平均で
あるフレーム電力17を計算し、フレーム電力比
較部15へ出力する。距離計算及び判定部14内
には、あらかじめ周波数分析され、スペクトル正
規化を施されたフレーム時系列として多数の標準
パターンデータからなる標準パターン
(reference pattern)N個があり、標準パターン
と、スペクトル正規化後の入力パターンとの距離
計算と最も近い標準パターンのカテゴリーを判定
する動作を行う。フレーム電力比較部15はフレ
ーム電力による閾値判定を行い、結果としてオー
バ信号18をコントローラ16に出力する。オー
バ信号18はフレーム電力p(j)が閾値以上のとき
は1となり、閾値未満のときは0となる。以下、
これらのオーバ信号の値を示すのにOVER=
“1”、OVER=“0”なる表現を用いる。
クトル正規化部13に送られる。スペクトル正規
化部13は話者による音源特性及び発声強度の違
いの正規化を行い、スペクトル正規化されたデー
タを距離計算及び判定部14へ出力する。同時
に、周波数分析部12の出力の8チヤネル平均で
あるフレーム電力17を計算し、フレーム電力比
較部15へ出力する。距離計算及び判定部14内
には、あらかじめ周波数分析され、スペクトル正
規化を施されたフレーム時系列として多数の標準
パターンデータからなる標準パターン
(reference pattern)N個があり、標準パターン
と、スペクトル正規化後の入力パターンとの距離
計算と最も近い標準パターンのカテゴリーを判定
する動作を行う。フレーム電力比較部15はフレ
ーム電力による閾値判定を行い、結果としてオー
バ信号18をコントローラ16に出力する。オー
バ信号18はフレーム電力p(j)が閾値以上のとき
は1となり、閾値未満のときは0となる。以下、
これらのオーバ信号の値を示すのにOVER=
“1”、OVER=“0”なる表現を用いる。
コントローラ16ではフレーム電力比較部15
からのオーバ信号18と距離計算&判定部14か
らのフレーム番号信号22を入力として、各部に
コントロール信号19,20,21を出力する。
コントローラ16はオーバ信号18とフレーム番
号信号22を遷移条件とする状態遷移によつて動
作しておりその状態遷移図を第6図に示す。
からのオーバ信号18と距離計算&判定部14か
らのフレーム番号信号22を入力として、各部に
コントロール信号19,20,21を出力する。
コントローラ16はオーバ信号18とフレーム番
号信号22を遷移条件とする状態遷移によつて動
作しておりその状態遷移図を第6図に示す。
次にコントローラ16の状態とその遷移につい
て説明する。
て説明する。
状態は次の5つに分けられる。
状態1:初期状態
状態2:有音状態
状態3:無音状態
状態4:パワーデイツプ後の有音状態
状態5:終端検出状態
〔状態1−初期状態〕
装置の電源が投入された直後もしくは先行する
単語の認識処理が完了し次の単語の入力を待つて
いる状態である。
単語の認識処理が完了し次の単語の入力を待つて
いる状態である。
(遷移1000)
フレーム電力p(j)が閾値未満の状態では状態1
をくりかえす。
をくりかえす。
(遷移1001)
フレーム電力p(j)が閾値以上となると状態2へ
遷移する。遷移1001を行つたフレーム音声の始端
と考えられる。
遷移する。遷移1001を行つたフレーム音声の始端
と考えられる。
〔状態2−有音状態〕
フレーム電力p(j)が閾値以上の状態を示す。状
態2では前記(B)有音状態の処理が行われる。
態2では前記(B)有音状態の処理が行われる。
(遷移1002)
フレーム電力が閾値以上の条件では、状態2は
くりかえされる。
くりかえされる。
(遷移1003)
フレーム電力p(j)が閾値未満でかつ状態2をく
りかえしたフレーム数(h)が3未満の場合には、状
態1の初期状態へもどる。
りかえしたフレーム数(h)が3未満の場合には、状
態1の初期状態へもどる。
この処理は、外部からの雑音により音声入力が
行われていなくともフレーム電力p(j)が閾値を越
えてしまい、状態2へ移つてしまい音声の始端を
検出し認識処理を開始することを回避するための
処理である。
行われていなくともフレーム電力p(j)が閾値を越
えてしまい、状態2へ移つてしまい音声の始端を
検出し認識処理を開始することを回避するための
処理である。
(遷移1004)
フレーム電力p(j)が閾値以下でかつ状態2をく
りかえしたフレーム数(h)が3以上の場合には、状
態2から状態3へ遷移する。状態2から状態3の
遷移は音声の終端らしき点を検出したと考えられ
る遷移であるが、本当の終端であるかどうかはは
つきりしない。
りかえしたフレーム数(h)が3以上の場合には、状
態2から状態3へ遷移する。状態2から状態3の
遷移は音声の終端らしき点を検出したと考えられ
る遷移であるが、本当の終端であるかどうかはは
つきりしない。
〔状態3−無音状態〕
フレーム電力が閾値以下の状態を示す。状態3
では前記(C)無音状態での処理が行われる。
では前記(C)無音状態での処理が行われる。
(遷移1005) 状態3においてフレーム電力が閾
値以下(無声)の状態が連続して30フレーム以内
続いている遷移を示し状態3をくりかえす。
値以下(無声)の状態が連続して30フレーム以内
続いている遷移を示し状態3をくりかえす。
(遷移1006) 状態3においてフレーム電力が閾
値以下(無声)の状態が連続して30フレーム続い
た場合の遷移を示す。この遷移は状態3の無声状
態が単語の終端による無声であることを示す遷移
で状態5へ遷移する。
値以下(無声)の状態が連続して30フレーム続い
た場合の遷移を示す。この遷移は状態3の無声状
態が単語の終端による無声であることを示す遷移
で状態5へ遷移する。
(遷移1007) 状態3からフレーム電力が再び閾
値以上になつた場合を示す。この遷移は状態3の
無声状態がパワーデイツプによるものであること
を示す遷移で状態4へ移る。
値以上になつた場合を示す。この遷移は状態3の
無声状態がパワーデイツプによるものであること
を示す遷移で状態4へ移る。
〔状態4−パワーデイツプ終了後の有音状態〕
フレーム電力p(j)が閾値以上の状態を示すが、
状態2と異なる点はパワーデイツプ検出後の有音
状態を示す部分である。
状態2と異なる点はパワーデイツプ検出後の有音
状態を示す部分である。
状態4では前記(D)のパワーデイツプ終了後
の有音処理が行われる。
の有音処理が行われる。
(遷移1008)
フレーム電力p(j)が閾値を越えている(有音)
状態がくりかえされる遷移を示す。
状態がくりかえされる遷移を示す。
(遷移1009)
フレーム電力p(j)が閾値以下となつた場合の遷
移を示す。
移を示す。
この場合状態は状態4から〔状態3−無声状
態〕へ移る。
態〕へ移る。
〔状態5−終端状態〕
30フレーム状態3が継続した場合に移る状態で
単語の終端を検出した状態である。
単語の終端を検出した状態である。
状態5においては前記(E)終端処理が行われ
る。
る。
(遷移1010)
状態5は1フレームのみの状態で次のフレーム
には初期状態である状態1へ無条件に遷移する。
には初期状態である状態1へ無条件に遷移する。
次に、上述した遷移の代表例を第7図a〜cに
示す。第7図aは雑音が入つた場合を示した図で
あり、第7図bは音声区間が1つの場合を示した
図であり、第7図cは音声区間が2つ以上の場合
(単語内にパワーデイツプがある場合)を示した
図である。第7図a〜cにおいて、サークル内の
番号は各状態の番号に対応するものである。
示す。第7図aは雑音が入つた場合を示した図で
あり、第7図bは音声区間が1つの場合を示した
図であり、第7図cは音声区間が2つ以上の場合
(単語内にパワーデイツプがある場合)を示した
図である。第7図a〜cにおいて、サークル内の
番号は各状態の番号に対応するものである。
次に、本発明の第1の実施例における距離計算
及び判定部14の動作について説明する。
及び判定部14の動作について説明する。
本発明の第1の実施例における距離計算及び判
定部14は第8図のブロツク図のごとく構成され
る。第8図において、52は始端からの音声フレ
ーム番号hをカウントする音声フレームカウンタ
で、音声フレーム番号信号43をコントローラ1
6および後述するROM54,ROM75に出力
する。53は無音状態のフレーム番号uをカウン
トする無音フレームカウンタで、無音フレーム番
号信号44をコントローラ16に出力する。54
はパス対応フレーム番号pを表わすパス対応フ
レーム番号信号を出力するメモリで、例えば
Read−Only−Memory(ROM)が用いられる。
56はn番目の標準パターンに対してその標準パ
ターンの長さSL(n)を表わす信号を出力するメモ
リで例えばRead−Only−Memory(ROM)が用
いられる。57は標準パターンフレーム番号p
を表わすROM54の出力と標準パターンの長さ
SL(n)を表わすROM56の出力を比較してp≦
SL(n)ならば“1”を、p>SL(n)ならば“0”
を出力するコンパレータである。58はコンパレ
ータ57の出力が“1”のときはROM54の出
力を、コンパレータ57の出力が“0”のときは
ROM56の出力を選択するセレクタである。コ
ンパレータ57とセレクタ58によつてp≦
SL(n)ならばpが、p>SL(n)ならばSL(n)がセ
レクタ58より標準パターンフレーム番号kpを
表わす標準パターンフレーム番号信号として出力
される。60はチヤネル番号信号40と標準パタ
ーンフレーム番号信号と標準パターン番号信号4
2によつてアドレツシングされ標準パターンデー
タSn(i,kp)を出力する標準パターンメモリで
ある。61はスペクトル正規化を行なつた1フレ
ーム分の入力パターンデータW(i,j)格納し
ておく入力メモリでチヤンネル番号信号40によ
つてアドレスが与えられる。62はメモリ61の
入力端子であり、第1図のスペクトル正規化部1
3でのスペクトル正規化された入力パターンのデ
ータW(i,j)が入力される。63は距離演算
器であり、メモリ61から出力される入力パター
ンデータW(i,j)と標準パターンメモリ60
の出力の標準パターンデータSn(i,kp)の間
で、第1図のコントローラ16からの制御信号
(CONT)45によつて、次の(7)式に示す距離演
算を行う。
定部14は第8図のブロツク図のごとく構成され
る。第8図において、52は始端からの音声フレ
ーム番号hをカウントする音声フレームカウンタ
で、音声フレーム番号信号43をコントローラ1
6および後述するROM54,ROM75に出力
する。53は無音状態のフレーム番号uをカウン
トする無音フレームカウンタで、無音フレーム番
号信号44をコントローラ16に出力する。54
はパス対応フレーム番号pを表わすパス対応フ
レーム番号信号を出力するメモリで、例えば
Read−Only−Memory(ROM)が用いられる。
56はn番目の標準パターンに対してその標準パ
ターンの長さSL(n)を表わす信号を出力するメモ
リで例えばRead−Only−Memory(ROM)が用
いられる。57は標準パターンフレーム番号p
を表わすROM54の出力と標準パターンの長さ
SL(n)を表わすROM56の出力を比較してp≦
SL(n)ならば“1”を、p>SL(n)ならば“0”
を出力するコンパレータである。58はコンパレ
ータ57の出力が“1”のときはROM54の出
力を、コンパレータ57の出力が“0”のときは
ROM56の出力を選択するセレクタである。コ
ンパレータ57とセレクタ58によつてp≦
SL(n)ならばpが、p>SL(n)ならばSL(n)がセ
レクタ58より標準パターンフレーム番号kpを
表わす標準パターンフレーム番号信号として出力
される。60はチヤネル番号信号40と標準パタ
ーンフレーム番号信号と標準パターン番号信号4
2によつてアドレツシングされ標準パターンデー
タSn(i,kp)を出力する標準パターンメモリで
ある。61はスペクトル正規化を行なつた1フレ
ーム分の入力パターンデータW(i,j)格納し
ておく入力メモリでチヤンネル番号信号40によ
つてアドレスが与えられる。62はメモリ61の
入力端子であり、第1図のスペクトル正規化部1
3でのスペクトル正規化された入力パターンのデ
ータW(i,j)が入力される。63は距離演算
器であり、メモリ61から出力される入力パター
ンデータW(i,j)と標準パターンメモリ60
の出力の標準パターンデータSn(i,kp)の間
で、第1図のコントローラ16からの制御信号
(CONT)45によつて、次の(7)式に示す距離演
算を行う。
CONT=1のとき |W(i,j)−Sn(
i,kp) CONT=0のとき 0 (7) 64は演算器63の出力とメモリ65の出力と
を加算して非類似度を算出する加算器である。6
5はパス番号信号41と標準パターン番号信号4
2をアドレスとするメモリであり、加算器64で
算出された非類似度Dnp(j)を格納する。66はメ
モリ65の内容を0にするためのANDゲートで
ある。70は加算器64の出力である非類似度
Dnp(j)と後述するレジスタ71の出力を比較する
コンパレータである。71は非類似度Dnp(j)の中
で最小値を与える非類似度を格納するためのレジ
スタであり、また後述する初期パルス313によつ
て格納し得る最大値がセツトされるレジスタであ
る。72は非類似度の最小値を与える標準パター
ン番号を格納するためのレジスタであり、終端検
出時の認識結果を出力する。73は認識結果の出
力端子、74はレジスタ71とレジスタ72に値
を格納するためのパルスを出力するANDゲート
である。75は選択されるパスの情報を格納する
メモリで、音声フレーム番号信号43、標準パタ
ーン番号42及びパス番号信号41をアドレス入
力としてパス選択信号47を出力する。この信号
はアンドゲート74に入力される。メモリ75
は、例えばROMが用いられる。
i,kp) CONT=0のとき 0 (7) 64は演算器63の出力とメモリ65の出力と
を加算して非類似度を算出する加算器である。6
5はパス番号信号41と標準パターン番号信号4
2をアドレスとするメモリであり、加算器64で
算出された非類似度Dnp(j)を格納する。66はメ
モリ65の内容を0にするためのANDゲートで
ある。70は加算器64の出力である非類似度
Dnp(j)と後述するレジスタ71の出力を比較する
コンパレータである。71は非類似度Dnp(j)の中
で最小値を与える非類似度を格納するためのレジ
スタであり、また後述する初期パルス313によつ
て格納し得る最大値がセツトされるレジスタであ
る。72は非類似度の最小値を与える標準パター
ン番号を格納するためのレジスタであり、終端検
出時の認識結果を出力する。73は認識結果の出
力端子、74はレジスタ71とレジスタ72に値
を格納するためのパルスを出力するANDゲート
である。75は選択されるパスの情報を格納する
メモリで、音声フレーム番号信号43、標準パタ
ーン番号42及びパス番号信号41をアドレス入
力としてパス選択信号47を出力する。この信号
はアンドゲート74に入力される。メモリ75
は、例えばROMが用いられる。
第9図及び第10図は本実施例のタイムシーケ
ンスを示したものである。第9図は入力音声の始
端検出から終端検出までの信号の流れを示すタイ
ムシーケンス、第10図は有音状態における1フ
レーム内の信号の流れを示すタイムシーケンスで
ある。
ンスを示したものである。第9図は入力音声の始
端検出から終端検出までの信号の流れを示すタイ
ムシーケンス、第10図は有音状態における1フ
レーム内の信号の流れを示すタイムシーケンスで
ある。
まず、これらの図の各信号について説明する。
40,41,42は第1図のコントローラ16か
ら送られてくる信号である。40はチヤネル番号
iを表わすチヤネル番号信号で、0から7までサ
イクリツクに変化する。41はパス番号pを表わ
すパス番号信号で、0から2までサイクリツクに
変化する。42は標準パターン番号nを表わす標
準パターン番号信号で、0からN−1まで変化す
る。43は音声フレームカウンタ52から出力さ
れる音声フレーム番号hを与える音声フレーム番
号信号、44は無音フレームカウンタ53から出
力される無音フレーム番号uを与える無音フレー
ム番号信号、45は第1図のコントローラ16よ
り送られ、後述する演算器63を制御する制御信
号(CONT)である。46は第1図のコントロ
ーラより送られ、後述するANDゲート66を制
御する制御信号である。47は後述するROM7
5の出力であるパス選択信号である。
40,41,42は第1図のコントローラ16か
ら送られてくる信号である。40はチヤネル番号
iを表わすチヤネル番号信号で、0から7までサ
イクリツクに変化する。41はパス番号pを表わ
すパス番号信号で、0から2までサイクリツクに
変化する。42は標準パターン番号nを表わす標
準パターン番号信号で、0からN−1まで変化す
る。43は音声フレームカウンタ52から出力さ
れる音声フレーム番号hを与える音声フレーム番
号信号、44は無音フレームカウンタ53から出
力される無音フレーム番号uを与える無音フレー
ム番号信号、45は第1図のコントローラ16よ
り送られ、後述する演算器63を制御する制御信
号(CONT)である。46は第1図のコントロ
ーラより送られ、後述するANDゲート66を制
御する制御信号である。47は後述するROM7
5の出力であるパス選択信号である。
301は第1図のコントローラ16内で用いられ
るフレーム周期(=16ミリ秒)を表わすフレーム
パルス、 302は第1図のコントローラ16より送られる
音声フレームカウンタ52をリセツトするパル
ス、 303は第1図のコントローラ16より送られる
音声フレームカウンタ52をカウントアツプする
パルス、 304は第1図のコントローラ16より送られる
無音フレームカウンタ53をリセツトするパル
ス、 305は第1図のコントローラ16より送られる
無音フレームカウンタ53をカウントアツプする
パルス、 310は第1図のコントローラ16内で用いられる
処理のための基本パルス、 311は第1図のコントローラ16より送られる入
力メモリ61のライトパルス、 312は第1図のコントローラ16より送られるメ
モリ65のライトパルス、 313は第1図のコントローラ16より送られるレ
ジスタ71の初期値パルス、 314は第1図のコントローラ16より送られAND
ゲート74の出力パルスを作成するためのもとと
なるパルスである。
るフレーム周期(=16ミリ秒)を表わすフレーム
パルス、 302は第1図のコントローラ16より送られる
音声フレームカウンタ52をリセツトするパル
ス、 303は第1図のコントローラ16より送られる
音声フレームカウンタ52をカウントアツプする
パルス、 304は第1図のコントローラ16より送られる
無音フレームカウンタ53をリセツトするパル
ス、 305は第1図のコントローラ16より送られる
無音フレームカウンタ53をカウントアツプする
パルス、 310は第1図のコントローラ16内で用いられる
処理のための基本パルス、 311は第1図のコントローラ16より送られる入
力メモリ61のライトパルス、 312は第1図のコントローラ16より送られるメ
モリ65のライトパルス、 313は第1図のコントローラ16より送られるレ
ジスタ71の初期値パルス、 314は第1図のコントローラ16より送られAND
ゲート74の出力パルスを作成するためのもとと
なるパルスである。
次に第8図の構成図、第9図、第10図のタイ
ムチヤートにしたがい距離計算及び判定部14の
動作について説明するが、コントローラ16が第
6図の状態遷移図にしたがつてフレームパルス
301ごとに動作しているため、状態ごとの動作に
ついて説明する。
ムチヤートにしたがい距離計算及び判定部14の
動作について説明するが、コントローラ16が第
6図の状態遷移図にしたがつてフレームパルス
301ごとに動作しているため、状態ごとの動作に
ついて説明する。
〔状態1の動作〕…初期状態の動作
(音声フレームカウンタ52、無音フレームカウ
ンタ53のリセツト) 第9図に示されるがごとく、リセツトパルス
302が音声フレームカウンタ52に、パルス304が
無音フレームカウンタ53にそれぞれ加えられ、
リセツトされる。
ンタ53のリセツト) 第9図に示されるがごとく、リセツトパルス
302が音声フレームカウンタ52に、パルス304が
無音フレームカウンタ53にそれぞれ加えられ、
リセツトされる。
(非類似度の初期化)
また制御信号46が“0”となつており、
ANDゲート66の出力は強制的に0となる。こ
のとき、メモリ65はパス番号信号41と標準パ
ターン番号信号42をアドレスとしてライトパル
ス312が加えられており、この処理によりメモリ
65の内容はすべて0となる。
ANDゲート66の出力は強制的に0となる。こ
のとき、メモリ65はパス番号信号41と標準パ
ターン番号信号42をアドレスとしてライトパル
ス312が加えられており、この処理によりメモリ
65の内容はすべて0となる。
〔状態2の動作〕…有音状態の処理
有音状態における1フレーム内の動作は第10
図に示すタイムシーケンスの如く行なわれる。そ
の動作は大きく分けてサイクル1とサイクル2の
2つに分けられる。
図に示すタイムシーケンスの如く行なわれる。そ
の動作は大きく分けてサイクル1とサイクル2の
2つに分けられる。
<サイクル1>
入力データの読み込みを行う。
基本パルス310に同期してチヤネル番号信号4
0が0から7まで変化し、入力メモリ61のアド
レスとなる。その際、入力端子62からは基本パ
ルス310に同期して第1図のスペクトル正規化部
13より入力パターンデータW(i,j)が入力
され、ライトパルス311によつて入力メモリ61
に書き込まれる。
0が0から7まで変化し、入力メモリ61のアド
レスとなる。その際、入力端子62からは基本パ
ルス310に同期して第1図のスペクトル正規化部
13より入力パターンデータW(i,j)が入力
され、ライトパルス311によつて入力メモリ61
に書き込まれる。
<サイクル2>
距離計算および判定処理を行う。
基本パルス310に同期して、チヤネル番号信号
40が0から7までサイクリツクに変化する。チ
ヤネル番号信号40の1サイクルごとにパス番号
信号41は変化する。その値は0から2までをサ
イクリツクにくりかえす。パス番号信号41の1
サイクルごとに、標準パターン番号信号42は変
化する。その値は標準パターンの数Nに対応して
0からN−1までである。
40が0から7までサイクリツクに変化する。チ
ヤネル番号信号40の1サイクルごとにパス番号
信号41は変化する。その値は0から2までをサ
イクリツクにくりかえす。パス番号信号41の1
サイクルごとに、標準パターン番号信号42は変
化する。その値は標準パターンの数Nに対応して
0からN−1までである。
このサイクル2では、(イ)パス対応フレーム番号
pの算出、(ロ)標準パターンフレーム番号kpの
算出、(ハ)標準パターンデータの出力、(ニ)入力パタ
ーンデータの出力、(ホ)距離計算、(ヘ)非類似度計算
及び(ト)判定動作が行なわれる。以下、これらを個
個に説明する。
pの算出、(ロ)標準パターンフレーム番号kpの
算出、(ハ)標準パターンデータの出力、(ニ)入力パタ
ーンデータの出力、(ホ)距離計算、(ヘ)非類似度計算
及び(ト)判定動作が行なわれる。以下、これらを個
個に説明する。
(イ) パス対応フレーム番号pの算出
パス対応フレーム番号pの算出はパス番号信
号41、音声フレーム番号信号43を入力として
ROM54によつて行われる。ROM54は音声
フレーム番号信号43(音声フレーム番号h)に
対しパス番号信号pが0のときは〔1/0.8h〕、1 のときは〔h〕、2のときは〔1/1.2h〕の値をパ ス対応フレーム番号pとして出力する。
号41、音声フレーム番号信号43を入力として
ROM54によつて行われる。ROM54は音声
フレーム番号信号43(音声フレーム番号h)に
対しパス番号信号pが0のときは〔1/0.8h〕、1 のときは〔h〕、2のときは〔1/1.2h〕の値をパ ス対応フレーム番号pとして出力する。
(ロ) 標準パターンフレーム番号kpの算出
標準パターンフレーム番号kpはパス対応フレ
ーム番号pと標準パターン番号信号nを入力と
してROM56とコンパレータ57、セレクタ5
8によつて算出される。ROM56からn番目の
標準パターンの長さSL(n)が出力される。コンパ
レータ57においてSL(n)とパス対応フレーム番
号pとの大小比較が行われ、その結果がセレク
タ58に加えられ、標準パターンの長さSL(n)と
パス対応フレーム番号pのどちらか一方が選択
され、標準パターンフレーム番号kpとして出力
される。すなわち、 SL(n)≧pのときは kp=p SL(n)<pのときは kp=SL(n) となる。
ーム番号pと標準パターン番号信号nを入力と
してROM56とコンパレータ57、セレクタ5
8によつて算出される。ROM56からn番目の
標準パターンの長さSL(n)が出力される。コンパ
レータ57においてSL(n)とパス対応フレーム番
号pとの大小比較が行われ、その結果がセレク
タ58に加えられ、標準パターンの長さSL(n)と
パス対応フレーム番号pのどちらか一方が選択
され、標準パターンフレーム番号kpとして出力
される。すなわち、 SL(n)≧pのときは kp=p SL(n)<pのときは kp=SL(n) となる。
(ハ) 標準パターンの出力
標準パターンは標準パターンメモリ60に格納
されており、標準パターン番号信号42とチヤネ
ル番号信号40と標準パターンフレーム番号kp
を入力として標準パターンデータSn(i,kp)が
出力される。
されており、標準パターン番号信号42とチヤネ
ル番号信号40と標準パターンフレーム番号kp
を入力として標準パターンデータSn(i,kp)が
出力される。
(ニ) 入力データの出力
入力メモリ61の内容はサイクル1において格
納されている。入力メモリ61はチヤネル番号信
号40によつてアドレツシングされ入力パターン
データW(i,j)を出力する。
納されている。入力メモリ61はチヤネル番号信
号40によつてアドレツシングされ入力パターン
データW(i,j)を出力する。
(ホ) 距離計算
距離の計算は距離演算部63によつて行われ
る。距離演算部63では、標準パターンパターン
データSn(i,kp)、入力パターンデータW(i,
j)及び第1図のコントローラ16からの制御信
号(CONT)45を用いて次の第8式に従い距
離計算を行う。
る。距離演算部63では、標準パターンパターン
データSn(i,kp)、入力パターンデータW(i,
j)及び第1図のコントローラ16からの制御信
号(CONT)45を用いて次の第8式に従い距
離計算を行う。
dnp(i,j)=|W(i,j)−Sn(i,kp)|
×CONT (8) (ヘ) 非類似度計算 それぞれの標準パターン番号n、パス番号pに
対して非類似度Dnp(j)が計算される。この計算に
は加算器64とメモリ65が用いられる。メモリ
65は標準パターン番号信号42とパス番号信号
41をアドレスとしているため、チヤネル番号信
号40が0から7まで1サイクル変化する間は同
じアドレスを示しており、その間にメモリ65の
ライトパルス312がチヤネル番号信号40に同期
して与えられる。従つて、次式(9)の如く、 Dnp(j)=Dnp(i−1)+7 〓i=0 dnp(i,j) (9) なる結果がチヤネル番号信号40が“7”にな
つたサイクルに得られる。ただし状態2では制御
信号46はつねに“1”であり、ANDゲート6
6は開いている。
×CONT (8) (ヘ) 非類似度計算 それぞれの標準パターン番号n、パス番号pに
対して非類似度Dnp(j)が計算される。この計算に
は加算器64とメモリ65が用いられる。メモリ
65は標準パターン番号信号42とパス番号信号
41をアドレスとしているため、チヤネル番号信
号40が0から7まで1サイクル変化する間は同
じアドレスを示しており、その間にメモリ65の
ライトパルス312がチヤネル番号信号40に同期
して与えられる。従つて、次式(9)の如く、 Dnp(j)=Dnp(i−1)+7 〓i=0 dnp(i,j) (9) なる結果がチヤネル番号信号40が“7”にな
つたサイクルに得られる。ただし状態2では制御
信号46はつねに“1”であり、ANDゲート6
6は開いている。
このようにして、n番目の標準パターンのパス
pにおける非類似度Dnp(j)が対応する標準パター
ン信号42の対応するパス番号信号41のチヤネ
ル番号信号40の“7”のサイクルにおいて得ら
れる。
pにおける非類似度Dnp(j)が対応する標準パター
ン信号42の対応するパス番号信号41のチヤネ
ル番号信号40の“7”のサイクルにおいて得ら
れる。
(ト) 判定
判定処理におけるパスの選択は、音声フレーム
毎で且つ標準パターン毎に行われる。該当音声フ
レーム、該当標準パターン番号に対して、選択さ
れるパスの数は1つの場合、2つの場合、あるい
は全く選択されない場合がある。パスの選択は
ROM75の出力であるパス選択信号47によつ
て行われる。ROM75は音声フレーム、標準パ
ターン番号、パス番号をアドレスとしており、パ
ス選択信号47を出力する。ROM75には該当
音声フレーム、該当標準パターンに対して、該当
パスを選択しない場合に、該当音声フレーム、該
当標準パターン番号、当該パス番号で与えられる
アドレスに“1”を格納しておく。逆に、該当音
声フレーム、該当標準パターンに対して、該当パ
スを選択しない場合に、該当音声フレーム、該当
標準パターン番号、当該パス番号で与えられるア
ドレスに“0”を格納しておく。
毎で且つ標準パターン毎に行われる。該当音声フ
レーム、該当標準パターン番号に対して、選択さ
れるパスの数は1つの場合、2つの場合、あるい
は全く選択されない場合がある。パスの選択は
ROM75の出力であるパス選択信号47によつ
て行われる。ROM75は音声フレーム、標準パ
ターン番号、パス番号をアドレスとしており、パ
ス選択信号47を出力する。ROM75には該当
音声フレーム、該当標準パターンに対して、該当
パスを選択しない場合に、該当音声フレーム、該
当標準パターン番号、当該パス番号で与えられる
アドレスに“1”を格納しておく。逆に、該当音
声フレーム、該当標準パターンに対して、該当パ
スを選択しない場合に、該当音声フレーム、該当
標準パターン番号、当該パス番号で与えられるア
ドレスに“0”を格納しておく。
このようにROM75の内容を変更することに
よりパスの選択、無選択は自由である。
よりパスの選択、無選択は自由である。
一方、音声フレーム番号に対するパスの選択条
件は認識対象となる単語の集まりによつて異なつ
ており、認識対象語が変わつた場合でも回路変更
することなくROM75の内容のみを変更するこ
とよりパスの選択条件を変更できることは重要な
事である。
件は認識対象となる単語の集まりによつて異なつ
ており、認識対象語が変わつた場合でも回路変更
することなくROM75の内容のみを変更するこ
とよりパスの選択条件を変更できることは重要な
事である。
判定処理はコンパレータ70、レジスタ71、
レジスタ72、ANDゲート74、ROM75によ
つて行なわれる。非類似度Dnp(j)はサイクル2に
おけるチヤネル番号信号40が“7”のサイクル
に加算器64よりコンパレータ70に送出され
る。
レジスタ72、ANDゲート74、ROM75によ
つて行なわれる。非類似度Dnp(j)はサイクル2に
おけるチヤネル番号信号40が“7”のサイクル
に加算器64よりコンパレータ70に送出され
る。
レジスタ71は非類似度の最小値Dminを格納
するためのレジスタであり、サイクル2の先頭時
において初期値パルス313によつて実現しうる最
大値がセツトされる。コンパレータ70において
加算器64の出力Dnp(j)とレジスタ71の出力で
あるそれまでの非類似度の最小値Dminが比較さ
れ、 Dnp(j)<Dminであれば“1” Dnp(j)≧Dminであれば“0” をANDゲート74に出力する。一方、ROM75
は音声フレーム番号信号43、標準パターン番号
信号42、パス番号信号41をアドレスとしてい
る。音声フレーム番号h、標準パターン番号nの
ときに、パス番号pのパスが選択されていれば、
h,n,pがアドレスとしてROM75に与えら
れたとき、ROM75の出力であるパス選択信号
47は“1”となる。一方、パス番号pのパスが
選択されなければ、パス選択信号47は“0”と
なる。パス選択信号47はANDゲート74の1
入力となり、パス選択信号47が“1”でかつコ
ンパレータ70の出力が“1”すなわち、Dnp(j)
<Dminのときにアンドゲート74を介して入力
パルス314がレジスタ71、レジスタ72に加え
られる。
するためのレジスタであり、サイクル2の先頭時
において初期値パルス313によつて実現しうる最
大値がセツトされる。コンパレータ70において
加算器64の出力Dnp(j)とレジスタ71の出力で
あるそれまでの非類似度の最小値Dminが比較さ
れ、 Dnp(j)<Dminであれば“1” Dnp(j)≧Dminであれば“0” をANDゲート74に出力する。一方、ROM75
は音声フレーム番号信号43、標準パターン番号
信号42、パス番号信号41をアドレスとしてい
る。音声フレーム番号h、標準パターン番号nの
ときに、パス番号pのパスが選択されていれば、
h,n,pがアドレスとしてROM75に与えら
れたとき、ROM75の出力であるパス選択信号
47は“1”となる。一方、パス番号pのパスが
選択されなければ、パス選択信号47は“0”と
なる。パス選択信号47はANDゲート74の1
入力となり、パス選択信号47が“1”でかつコ
ンパレータ70の出力が“1”すなわち、Dnp(j)
<Dminのときにアンドゲート74を介して入力
パルス314がレジスタ71、レジスタ72に加え
られる。
この結果、レジスタ71にはその時点での非類
似度の最小値として、前記非類似度Dnp(j)が格納
される。また、レジスタ72には前記非類似度
Dnp(j)に対応する標準パターン番号信号が入力さ
れ、標準パターン番号nが格納される。そして、
1フレームの全標準パターンとの判定処理終了時
には、そのフレームまでの最小非類似度Dminを
与える標準パターン番号がレジスタ72に格納さ
れている。
似度の最小値として、前記非類似度Dnp(j)が格納
される。また、レジスタ72には前記非類似度
Dnp(j)に対応する標準パターン番号信号が入力さ
れ、標準パターン番号nが格納される。そして、
1フレームの全標準パターンとの判定処理終了時
には、そのフレームまでの最小非類似度Dminを
与える標準パターン番号がレジスタ72に格納さ
れている。
〔状態3の動作〕…無音状態の処理
無音状態において、その以前の有音状態での最
後のフレームにおける結果を保持するために、前
述の(C)無音処理を行なう。この状態3では、
音声フレームカウンタ52のカウントアツプ動作
をパルス303を加えないことにより停止する動作
と、パルス304を加えない動作と、パルス305を加
える動作と、演算器63に加えられている制御信
号(CONT)45を“0”にすること以外は、
状態2と同様の動作を行う。
後のフレームにおける結果を保持するために、前
述の(C)無音処理を行なう。この状態3では、
音声フレームカウンタ52のカウントアツプ動作
をパルス303を加えないことにより停止する動作
と、パルス304を加えない動作と、パルス305を加
える動作と、演算器63に加えられている制御信
号(CONT)45を“0”にすること以外は、
状態2と同様の動作を行う。
ただし、制御信号(CONT)45を0にする
ことにより、距離dnp(i,j)が0となり最小
の非類似度Dminは保持されているため、コンパ
レータ70及びレジスタ71による判定動作は行
つても行なわなくても結果は変わらないため、判
定動作を省略することは可能である。
ことにより、距離dnp(i,j)が0となり最小
の非類似度Dminは保持されているため、コンパ
レータ70及びレジスタ71による判定動作は行
つても行なわなくても結果は変わらないため、判
定動作を省略することは可能である。
〔状態4の動作〕…パワーデイツプ終了後の有音
処理 状態2の動作と全く同じである。
処理 状態2の動作と全く同じである。
〔状態5の動作〕…終端処理
終端を検出した時点で、レジスタ72に格納さ
れた標準パターン番号を認識結果のカテゴリーと
して出力するだけの動作を行う。
れた標準パターン番号を認識結果のカテゴリーと
して出力するだけの動作を行う。
以上のとおり、本実施例は動作する。
(発明の効果)
本発明は以上説明したように、入力フレームご
とに距離計算、非類似度計算を行なうため終端検
出後、1フレーム以内に認識結果が出る利点があ
る。また、非類似度計算のためには前の入力フレ
ームに対する非類似度値と現入力フレームに対す
る距離値との累算を行なうだけでよく、始端から
終端までの入力データを格納する必要がない。
とに距離計算、非類似度計算を行なうため終端検
出後、1フレーム以内に認識結果が出る利点があ
る。また、非類似度計算のためには前の入力フレ
ームに対する非類似度値と現入力フレームに対す
る距離値との累算を行なうだけでよく、始端から
終端までの入力データを格納する必要がない。
さらに、回路構成の簡易化を目的とした方式で
あるためLSI化が容易であり、ゲート数の少ない
安価な音声認識用LSIチツプの供給を可能にする
と同時に汎用マイクロプロセツサのソフト処理に
よつても実現され得るものである。
あるためLSI化が容易であり、ゲート数の少ない
安価な音声認識用LSIチツプの供給を可能にする
と同時に汎用マイクロプロセツサのソフト処理に
よつても実現され得るものである。
また、認識判定において、入力の長さと極端に
異なる標準パターンを認識判定処理からはずすこ
とにより認識精度の向上が図られる。
異なる標準パターンを認識判定処理からはずすこ
とにより認識精度の向上が図られる。
また、認識対象語の変更に際しても標準パター
ンやパスの選択に関する情報の変更はROMを変
更することだけにより実現でき、回路変更を必要
としないため、音声認識LSIチツプの供給には好
適である。
ンやパスの選択に関する情報の変更はROMを変
更することだけにより実現でき、回路変更を必要
としないため、音声認識LSIチツプの供給には好
適である。
第1図は本発明の一実施例のブロツク図、第2
図aは本発明の音声認識方法における入力パター
ンと標準パターンとのマツチングを行う複数のマ
ツチングパスの例を示す図、第2図bは入力パタ
ーンのフレーム電力の例を示す図、第2図cは本
発明による音声認識処理における入力パターンと
標準パターンの各マツチングパスにおける非類似
度Dnp(i)の例を示す図、第3図は本発明における
判定処理のパス選択の例を示す図、第4図は判定
対象区間を説明するための図、第5図は本発明に
おける無音処理を説明するための図、第6図は第
1図に示すコントローラ16の動作の状態遷移を
示す図、第7図は状態遷移の例を示す図、第8図
は第1図に示す距離計算及び判定部14の構成を
示すブロツク図、第9図は第1図と第8図に示さ
れる本発明の実施例における入力音声の始端検出
から終端検出までの信号の流れを示すタイムシー
ケンス、第10図は同実施例における有音状態で
の1フレーム内の信号の流れを示すタイムシーケ
ンス、及び第11図は種々の単語の発声長の変動
を示す図である。 11……音声入力端子、12……周波数分析
部、13……スペクトル正規化部、14……距離
計算及び判定部、15……フレーム電力比較部、
16……コントローラ、52……音声フレームカ
ウンタ、53……無音フレームカウンタ、54,
56,75……ROM、57,70……コンパレ
ータ、61,65……メモリ、58……セレク
タ、60……標準パターンメモリ、63……距離
演算部、71,72……レジスタ。
図aは本発明の音声認識方法における入力パター
ンと標準パターンとのマツチングを行う複数のマ
ツチングパスの例を示す図、第2図bは入力パタ
ーンのフレーム電力の例を示す図、第2図cは本
発明による音声認識処理における入力パターンと
標準パターンの各マツチングパスにおける非類似
度Dnp(i)の例を示す図、第3図は本発明における
判定処理のパス選択の例を示す図、第4図は判定
対象区間を説明するための図、第5図は本発明に
おける無音処理を説明するための図、第6図は第
1図に示すコントローラ16の動作の状態遷移を
示す図、第7図は状態遷移の例を示す図、第8図
は第1図に示す距離計算及び判定部14の構成を
示すブロツク図、第9図は第1図と第8図に示さ
れる本発明の実施例における入力音声の始端検出
から終端検出までの信号の流れを示すタイムシー
ケンス、第10図は同実施例における有音状態で
の1フレーム内の信号の流れを示すタイムシーケ
ンス、及び第11図は種々の単語の発声長の変動
を示す図である。 11……音声入力端子、12……周波数分析
部、13……スペクトル正規化部、14……距離
計算及び判定部、15……フレーム電力比較部、
16……コントローラ、52……音声フレームカ
ウンタ、53……無音フレームカウンタ、54,
56,75……ROM、57,70……コンパレ
ータ、61,65……メモリ、58……セレク
タ、60……標準パターンメモリ、63……距離
演算部、71,72……レジスタ。
Claims (1)
- 【特許請求の範囲】 1 a 入力音声を周波数分析し、複数のチヤネ
ルの周波数成分のフレーム時系列情報である入
力パターンを抽出する手段と、 b 前記入力パターンの各フレームの各チヤネル
のデータをスペクトル正規化してスペクトル正
規化データW(i,j)を作成する手段と、 c 前記スペクトル正規化データに基づいて入力
音声の始端、終端及び有音状態を検出する手段
と、 d 距離計算及び判定のための手段であつて、 d1 予め複数の標準音声を周波数分析し、スペ
クトル正規化することにより作成された各々
複数フレーム、複数チヤネルのスペクトル正
規化データSn(i,kp)(但し、iはチヤネ
ル番号、kpはフレーム番号)からなる複数
の標準パターンを格納する標準パターンメモ
リと、 d2 前記スペクトル正規化手段から送られる入
力パターンの1フレーム分の全チヤネルのス
ペクトル正規化データW(i,j)を格納す
る入力メモリと、 d3 入力音声の始端検出後、入力パターンのフ
レーム計数を開始して入力音声が有音状態で
あるか無音状態であるにかかわらず、音声フ
レーム番号を順次更新する手段と、 d4 前記音声フレーム番号の更新毎に、各標準
パターンと前記入力パターンとの間に複数の
マツチングパスを設定するために、前記音声
フレーム番号と本質的に線形な関係で標準パ
ターンの複数のフレーム番号kpを発生する
手段と、 d5 前記音声フレーム番号の更新毎に、前記マ
ツチングパスで対応づけられるフレーム間で
各チヤネルにわたつて前記入力パターンのス
ペクトル正規化データW(i,j)と前記標
準パターンのスペクトル正規化データSn
(i,kp)と距離を算出する手段と、 d6 入力音声の始端から、任意の前記音声フレ
ーム番号の前記マツチングパスに沿つた前記
距離の累算値を非類似度として音声フレーム
番号の更新毎に直前の非類似度と当該フレー
ム番号での距離を加算して、一時的に格納す
ることによつて各標準パターン毎の各マツチ
ングバスに対応した非類似度を算出し格納す
る手段と、 d7 標準パターンのカテゴリーの単語発声長の
分布範囲により分布の多い部分を表現する各
標準パターン毎の所定の判定対象区間に関し
て、前記音声フレーム番号が任意の標準パタ
ーンの前記所定の判定対象区間内にある場合
にのみ、当該音声フレーム番号と当該標準パ
ターンに対して選択する1つもしくは2つの
前記非類似度を選択するための1つもしくは
2つのパス選択情報を格納し、音声フレーム
番号の更新毎に前記標準パターンに対応して
1つもしくは2つの前記パス選択情報を出力
する手段と、 d8 選択された前記非類似度のうちで最小の非
類似度を検出し、当該最小の非類似度に対応
する標準パターンの番号を格納する手段とか
らなる距離計算及び判定手段、 とを有することを特徴とする音声認識装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP9381385A JPS61252593A (ja) | 1985-05-02 | 1985-05-02 | 音声認識装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP9381385A JPS61252593A (ja) | 1985-05-02 | 1985-05-02 | 音声認識装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS61252593A JPS61252593A (ja) | 1986-11-10 |
| JPH0567037B2 true JPH0567037B2 (ja) | 1993-09-24 |
Family
ID=14092837
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP9381385A Granted JPS61252593A (ja) | 1985-05-02 | 1985-05-02 | 音声認識装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS61252593A (ja) |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS60203992A (ja) * | 1984-03-28 | 1985-10-15 | 沖電気工業株式会社 | 音声認識方法 |
| JPS60203993A (ja) * | 1984-03-28 | 1985-10-15 | 沖電気工業株式会社 | 音声認識方法 |
| JPS60203995A (ja) * | 1984-03-28 | 1985-10-15 | 沖電気工業株式会社 | 音声パタ−ンマツチング方法 |
| JPH0313599A (ja) * | 1989-06-09 | 1991-01-22 | Nippon Steel Corp | 電気メッキ用不溶性電極 |
| JPH0723559B2 (ja) * | 1989-06-12 | 1995-03-15 | ダイセル化学工業株式会社 | スタンパー洗浄装置 |
-
1985
- 1985-05-02 JP JP9381385A patent/JPS61252593A/ja active Granted
Also Published As
| Publication number | Publication date |
|---|---|
| JPS61252593A (ja) | 1986-11-10 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP1355295B1 (en) | Speech recognition apparatus, speech recognition method, and computer-readable recording medium in which speech recognition program is recorded | |
| EP1376537B1 (en) | Apparatus, method, and computer-readable recording medium for recognition of keywords from spontaneous speech | |
| JP2003044078A (ja) | 発声速度正規化分析を用いた音声認識装置 | |
| US5751898A (en) | Speech recognition method and apparatus for use therein | |
| US4868879A (en) | Apparatus and method for recognizing speech | |
| JP3523382B2 (ja) | 音声認識装置及び音声認識方法 | |
| JPS61235899A (ja) | 音声認識装置 | |
| JPS61252593A (ja) | 音声認識装置 | |
| JPH0772899A (ja) | 音声認識装置 | |
| JPH0568717B2 (ja) | ||
| JPH0313600B2 (ja) | ||
| JPS60164800A (ja) | 音声認識装置 | |
| JPH07281692A (ja) | 音声認識装置 | |
| JPH0568716B2 (ja) | ||
| JP3293191B2 (ja) | 音声認識装置 | |
| JPH0313599B2 (ja) | ||
| JPS607492A (ja) | 単音節音声認識方式 | |
| JPS6312000A (ja) | 音声認識装置 | |
| JPH0449954B2 (ja) | ||
| JPH0552516B2 (ja) | ||
| JPS62111295A (ja) | 音声認識装置 | |
| JPS6180298A (ja) | 音声認識装置 | |
| JPH026079B2 (ja) | ||
| JPH03228100A (ja) | 音声認識装置 | |
| JPS61138298A (ja) | 音声認識装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| EXPY | Cancellation because of completion of term |