JP2804265B2 - 音声認識方式 - Google Patents
音声認識方式Info
- Publication number
- JP2804265B2 JP2804265B2 JP62179562A JP17956287A JP2804265B2 JP 2804265 B2 JP2804265 B2 JP 2804265B2 JP 62179562 A JP62179562 A JP 62179562A JP 17956287 A JP17956287 A JP 17956287A JP 2804265 B2 JP2804265 B2 JP 2804265B2
- Authority
- JP
- Japan
- Prior art keywords
- state
- standard pattern
- time
- pattern
- input
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Description
【発明の詳細な説明】
技術分野
本発明は、音声認識方式、より詳細には、音声認識に
おける照合方式に関する。 従来技術 音声パターンの照合方式の1つであるDPマッチング
は、計算量が多いという欠点があった。これは、局所距
離、累積距離を計算すべき、格子点の数が(入力フレー
ム数)×(標準パターンのフレーム数)に比例している
ことに起因している。また、圧縮DPという手法も知られ
ている。これは、格子点の数を減らすのに有効な方法で
あるが、音声パターンのどの部分をどれだけ圧縮するか
とういう決め方が難しい。また、伸縮の制御も複雑にな
り、単語によって圧縮率が異なる等の欠点があった。ま
た、HMMでは、距離と確率との違いはあるが、格子点の
数が、(入力フレーム数)×(モデルの状態数)とな
り、DPマッチングの格子点と比較して、計算量が大幅に
少なくなっている。また、状態数が固定であるため、語
いの変更によって演算量が変化しないなどの利点があ
る。しかし、HMMでは、時間方向の伸縮(状態遷移の制
御)が難しいという欠点があった。また、訓練データが
少ないと良質のモデルが得にくいという欠点があった。 目的 本発明は、上述のごとき実情に鑑みてなされたもの
で、特に、少ない演算量と少ない標準パターン用メモリ
を用いて精密な音声パターンの照合を行なうことを目的
としてなされたものである。 構成 本発明は、上記目的を達成するために、入力された音
声信号を特徴系列変換手段を用いて特徴ベクトルの時系
列に変換し、標準パターンを一定の状態数を持つ状態の
系列として表現し、各状態ごとに状態を代表する特徴ベ
クトルと状態の継続時間が記憶してあり、該入力音声の
特徴ベクトルの時系列を前記標準パターンと照合する音
声認識装置において、照合を行なう際、状態遷移の重み
を、入力音声が標準パターンの各状態に帰属する時間と
標準パターンの各状態の継続時間の差を自乗に比例させ
た量とし、該重みを照合の際の累積距離に加えることを
特徴としたものである。 以下、本発明の実施例に基づいて説明する。 第1図は、本発明の一実施例を説明するためのブロッ
ク線図で、図中、1はマイクロフォン、2は特徴系列変
換手段、3は音声区間検出手段、4はマッチング部、5
は標準パターン、6は認識結果出力部で、マイクロフォ
ン1から入力された音声は、特徴ベクトル変換手段2に
よって特徴ベクトルの時系列に変換される。特徴ベクト
ルとしては、スペクトラム、LPCケプストラム等様々な
ものが考えられる。本実施例では、スペクトラムを用い
て説明するが、本発明は、これに限るわけではない。音
声波形をスペクトラムパターンに変換するには、中心周
波数が250〜6300Hzで1/3オクターブごとに配置した15チ
ャンネルのバンドパスフィルター群を用いればよい。ま
た、フレーム周期は10ms程度とすればよい。 音声区間検出手段3としては様々な方式が知られてお
り、本発明には直接関係ないのでここでの詳細な説明は
省略する。 ここで入力音声は、次に示すベクトルの時系列として
得られたことになる。 xi=(x1i,x2i,……x15i) (2) (ただし、Iは入力音声フレーム数,xiは入力音声のi
フレームの特徴ベクトル、xfiは、入力音声のiフレー
ムのfチャンネルの出力である。) また、標準パターンは、次に示す形で登録されてい
る。 (ただし、Nは状態数, は標準パターンの第j状態の特徴ベクトル,yfjは、標準
パターンの第j状態のfチャンネルの値,ljは標準パタ
ーンの第j状態の継続時間(フレーム長)である。) パターンマッチングは、動的計画法や、山登り法等を
用いることができ、ここでは、動的計画法を用いて説明
する。 step1. D(1,1)=d(1,1) (6) step3.(標準パターンと入力音声との距離)=D(I,
N) (ただし、iは入力フレーム番号,jは状態番号,d(i,
j)は入力iフレームと標準パターンj状態との局所距
離,D(i,j)は格子点(i,j)に到達する最適累積距離,W
は状態遷移の重みである。) 第2図は、上述のようにして求めた入力音声と標準パ
ターンとの照合における最適状態列の例(状態数N=
4)で、このようにして最適な状態列を求め、そのとき
の累積距離D(I,N)を照合結果としている。 局所距離は、市街地距離、ユークリッド距離、マハラ
ノビスの汎距離等様々なものが知られており、例えば、
市街地距離を用いればd(i,j)は、 して計算される。 通常のDPマッチングでは、標準パターンは、入力パタ
ーンと基本的には同じ形式であり、マッチング平面は第
3図に示すようになる。例えば、フレーム周期10msの単
語認識の場合、平面単語長は60フレーム(600ms)程度
であり、格子点の個数はI・J=3600となる。ところ
が、本発明の場合には、例えば状態数N=4(第2図)
とすると、格子点の個数はI・N=240と大幅に少なく
なっており、演算時間の大幅な短縮が可能となる。 (8)式における状態遷移の重みWは、入力パターン
と標準パターンとの対応において極端な時間伸縮を防ぐ
時間制御のための項である。 第4図において格子点C(i,j)に到る最適パスは、
格子点A(i−1,j)に到達した最適パスIと、格子点
B(i−1,j−1)に到る最適パスIIとの2つのパスか
ら選択される。 ここで、格子点Bに到達する最適パスにおいて、初め
て状態j−1に到達したときに入力フレーム番号をi′
とすれば、状態j−1への帰属時間はi−i′フレーム
である。また、標準パターンにおける状態j−1の継続
時間をlj−lとする。このとき、状態遷移の重みWを W=a{(i−i′)−lj-l}2 (10) として表わす(aは定数)。(10)式の重みを採用する
ことにより、帰属時間と継続時間との差が小さい(即
ち、入力パターンと標準パターンとの時間的なズレが少
ない)ときのみWの値は小さくなり、状態遷移が起り易
くなる。このため、精密な時間制御が可能となる。 また、Wを と定義することもできる。 この(11)式は、状態j−1への帰属時間を状態j−
1の継続時間の1/2〜2倍に制限しており、不適当な時
間対応を防ぐことができる。 (10),(11)で用いられている継続時間lj(1≦j
≦N)は、一回の訓練データ(標準パターン作成用の発
声)で得ることができるが、標準パターンを精密に作成
するため、複数の訓練データがある場合には、その平均
値とすれば良い。 効果 以上の説明から明らかなように、本発明によると、少
ない演算量と少ない標準パターン用のメモリーを用い
て、正確な時間長制御を行うことができる精密な音声認
識を行うことが可能となる。
おける照合方式に関する。 従来技術 音声パターンの照合方式の1つであるDPマッチング
は、計算量が多いという欠点があった。これは、局所距
離、累積距離を計算すべき、格子点の数が(入力フレー
ム数)×(標準パターンのフレーム数)に比例している
ことに起因している。また、圧縮DPという手法も知られ
ている。これは、格子点の数を減らすのに有効な方法で
あるが、音声パターンのどの部分をどれだけ圧縮するか
とういう決め方が難しい。また、伸縮の制御も複雑にな
り、単語によって圧縮率が異なる等の欠点があった。ま
た、HMMでは、距離と確率との違いはあるが、格子点の
数が、(入力フレーム数)×(モデルの状態数)とな
り、DPマッチングの格子点と比較して、計算量が大幅に
少なくなっている。また、状態数が固定であるため、語
いの変更によって演算量が変化しないなどの利点があ
る。しかし、HMMでは、時間方向の伸縮(状態遷移の制
御)が難しいという欠点があった。また、訓練データが
少ないと良質のモデルが得にくいという欠点があった。 目的 本発明は、上述のごとき実情に鑑みてなされたもの
で、特に、少ない演算量と少ない標準パターン用メモリ
を用いて精密な音声パターンの照合を行なうことを目的
としてなされたものである。 構成 本発明は、上記目的を達成するために、入力された音
声信号を特徴系列変換手段を用いて特徴ベクトルの時系
列に変換し、標準パターンを一定の状態数を持つ状態の
系列として表現し、各状態ごとに状態を代表する特徴ベ
クトルと状態の継続時間が記憶してあり、該入力音声の
特徴ベクトルの時系列を前記標準パターンと照合する音
声認識装置において、照合を行なう際、状態遷移の重み
を、入力音声が標準パターンの各状態に帰属する時間と
標準パターンの各状態の継続時間の差を自乗に比例させ
た量とし、該重みを照合の際の累積距離に加えることを
特徴としたものである。 以下、本発明の実施例に基づいて説明する。 第1図は、本発明の一実施例を説明するためのブロッ
ク線図で、図中、1はマイクロフォン、2は特徴系列変
換手段、3は音声区間検出手段、4はマッチング部、5
は標準パターン、6は認識結果出力部で、マイクロフォ
ン1から入力された音声は、特徴ベクトル変換手段2に
よって特徴ベクトルの時系列に変換される。特徴ベクト
ルとしては、スペクトラム、LPCケプストラム等様々な
ものが考えられる。本実施例では、スペクトラムを用い
て説明するが、本発明は、これに限るわけではない。音
声波形をスペクトラムパターンに変換するには、中心周
波数が250〜6300Hzで1/3オクターブごとに配置した15チ
ャンネルのバンドパスフィルター群を用いればよい。ま
た、フレーム周期は10ms程度とすればよい。 音声区間検出手段3としては様々な方式が知られてお
り、本発明には直接関係ないのでここでの詳細な説明は
省略する。 ここで入力音声は、次に示すベクトルの時系列として
得られたことになる。 xi=(x1i,x2i,……x15i) (2) (ただし、Iは入力音声フレーム数,xiは入力音声のi
フレームの特徴ベクトル、xfiは、入力音声のiフレー
ムのfチャンネルの出力である。) また、標準パターンは、次に示す形で登録されてい
る。 (ただし、Nは状態数, は標準パターンの第j状態の特徴ベクトル,yfjは、標準
パターンの第j状態のfチャンネルの値,ljは標準パタ
ーンの第j状態の継続時間(フレーム長)である。) パターンマッチングは、動的計画法や、山登り法等を
用いることができ、ここでは、動的計画法を用いて説明
する。 step1. D(1,1)=d(1,1) (6) step3.(標準パターンと入力音声との距離)=D(I,
N) (ただし、iは入力フレーム番号,jは状態番号,d(i,
j)は入力iフレームと標準パターンj状態との局所距
離,D(i,j)は格子点(i,j)に到達する最適累積距離,W
は状態遷移の重みである。) 第2図は、上述のようにして求めた入力音声と標準パ
ターンとの照合における最適状態列の例(状態数N=
4)で、このようにして最適な状態列を求め、そのとき
の累積距離D(I,N)を照合結果としている。 局所距離は、市街地距離、ユークリッド距離、マハラ
ノビスの汎距離等様々なものが知られており、例えば、
市街地距離を用いればd(i,j)は、 して計算される。 通常のDPマッチングでは、標準パターンは、入力パタ
ーンと基本的には同じ形式であり、マッチング平面は第
3図に示すようになる。例えば、フレーム周期10msの単
語認識の場合、平面単語長は60フレーム(600ms)程度
であり、格子点の個数はI・J=3600となる。ところ
が、本発明の場合には、例えば状態数N=4(第2図)
とすると、格子点の個数はI・N=240と大幅に少なく
なっており、演算時間の大幅な短縮が可能となる。 (8)式における状態遷移の重みWは、入力パターン
と標準パターンとの対応において極端な時間伸縮を防ぐ
時間制御のための項である。 第4図において格子点C(i,j)に到る最適パスは、
格子点A(i−1,j)に到達した最適パスIと、格子点
B(i−1,j−1)に到る最適パスIIとの2つのパスか
ら選択される。 ここで、格子点Bに到達する最適パスにおいて、初め
て状態j−1に到達したときに入力フレーム番号をi′
とすれば、状態j−1への帰属時間はi−i′フレーム
である。また、標準パターンにおける状態j−1の継続
時間をlj−lとする。このとき、状態遷移の重みWを W=a{(i−i′)−lj-l}2 (10) として表わす(aは定数)。(10)式の重みを採用する
ことにより、帰属時間と継続時間との差が小さい(即
ち、入力パターンと標準パターンとの時間的なズレが少
ない)ときのみWの値は小さくなり、状態遷移が起り易
くなる。このため、精密な時間制御が可能となる。 また、Wを と定義することもできる。 この(11)式は、状態j−1への帰属時間を状態j−
1の継続時間の1/2〜2倍に制限しており、不適当な時
間対応を防ぐことができる。 (10),(11)で用いられている継続時間lj(1≦j
≦N)は、一回の訓練データ(標準パターン作成用の発
声)で得ることができるが、標準パターンを精密に作成
するため、複数の訓練データがある場合には、その平均
値とすれば良い。 効果 以上の説明から明らかなように、本発明によると、少
ない演算量と少ない標準パターン用のメモリーを用い
て、正確な時間長制御を行うことができる精密な音声認
識を行うことが可能となる。
【図面の簡単な説明】
第1図は、本発明の一実施例を説明するためのブロック
線図、第2図は、入力音声と標準パターンとの照合にお
ける最適状態列の例を示す図、第3図は、DPマッチング
における計算平面を示す図、第4図は、最適パスの例を
示す図である。 1……マイクロフォン,2……特徴系列変換手段,3……音
声区間検出手段,4……マッチング部,5……標準パター
ン,6……認識結果出力部。
線図、第2図は、入力音声と標準パターンとの照合にお
ける最適状態列の例を示す図、第3図は、DPマッチング
における計算平面を示す図、第4図は、最適パスの例を
示す図である。 1……マイクロフォン,2……特徴系列変換手段,3……音
声区間検出手段,4……マッチング部,5……標準パター
ン,6……認識結果出力部。
Claims (1)
- (57)【特許請求の範囲】 1.入力された音声信号を特徴系列変換手段を用いて特
徴ベクトルの時系列に変換し、標準パターンを一定の状
態数を持つ状態の系列として表現し、各状態ごとに状態
を代表する特徴ベクトルと状態の継続時間が記憶してあ
り、該入力音声の特徴ベクトルの時系列を前記標準パタ
ーンと照合する音声認識装置において、照合を行なう
際、状態遷移の重みを、入力音声が標準パターンの各状
態に帰属する時間と標準パターンの各状態の継続時間の
差の自乗に比例させた量とし、該重みを照合の際の累積
距離に加えることを特徴とする音声認識方式。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62179562A JP2804265B2 (ja) | 1987-07-17 | 1987-07-17 | 音声認識方式 |
| US07/213,826 US4918731A (en) | 1987-07-17 | 1988-06-30 | Speech recognition method and apparatus |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62179562A JP2804265B2 (ja) | 1987-07-17 | 1987-07-17 | 音声認識方式 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS6423299A JPS6423299A (en) | 1989-01-25 |
| JP2804265B2 true JP2804265B2 (ja) | 1998-09-24 |
Family
ID=16067900
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP62179562A Expired - Lifetime JP2804265B2 (ja) | 1987-07-17 | 1987-07-17 | 音声認識方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP2804265B2 (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3066920B2 (ja) | 1991-06-11 | 2000-07-17 | キヤノン株式会社 | 音声認識方法及び装置 |
| JP3135931B2 (ja) | 1991-02-14 | 2001-02-19 | 株式会社リコー | 音声認識方式 |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0850673B1 (en) | 1996-07-11 | 2003-10-01 | Sega Enterprises, Ltd. | Game input device and game input method with voice recognition |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5720639B2 (ja) * | 1974-10-04 | 1982-04-30 |
-
1987
- 1987-07-17 JP JP62179562A patent/JP2804265B2/ja not_active Expired - Lifetime
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3135931B2 (ja) | 1991-02-14 | 2001-02-19 | 株式会社リコー | 音声認識方式 |
| JP3066920B2 (ja) | 1991-06-11 | 2000-07-17 | キヤノン株式会社 | 音声認識方法及び装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPS6423299A (en) | 1989-01-25 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP2733955B2 (ja) | 適応型音声認識装置 | |
| US4751737A (en) | Template generation method in a speech recognition system | |
| JP2692581B2 (ja) | 音響カテゴリ平均値計算装置及び適応化装置 | |
| JPH0394299A (ja) | 音声認識方法と音声認識装置訓練方法 | |
| US5758021A (en) | Speech recognition combining dynamic programming and neural network techniques | |
| JP3130524B2 (ja) | 音声信号認識方法およびその方法を実施する装置 | |
| JPH08211897A (ja) | 音声認識装置 | |
| JP2000298495A (ja) | 音声認識装置用の回帰クラス木構造の指定方法 | |
| Roucos et al. | A stochastic segment model for phoneme-based continuous speech recognition | |
| JP3315565B2 (ja) | 音声認識装置 | |
| JPH05232989A (ja) | 音響モデルの話者適応化法 | |
| JP3011997B2 (ja) | 参照ベクトル更新方法 | |
| JP3029803B2 (ja) | 音声認識のための単語モデル生成装置及び音声認識装置 | |
| JP2921059B2 (ja) | 連続音声認識装置 | |
| JP3003353B2 (ja) | タスク適応標準パターン学習装置 | |
| JP3285047B2 (ja) | 不特定話者用音声認識装置 | |
| JP3518195B2 (ja) | 音声認識装置 | |
| JP3044741B2 (ja) | 標準パターン学習方法 | |
| JPH0635495A (ja) | 音声認識装置 | |
| JP3036706B2 (ja) | 音声認識方法 | |
| JP3316352B2 (ja) | 音声認識方法 | |
| JPH04311997A (ja) | Dpマッチング法 | |
| JP3448371B2 (ja) | Hmmの学習装置 | |
| JP3135931B2 (ja) | 音声認識方式 | |
| Gupta et al. | On multiframe parameter optimization in articulatory analysis/synthesis of speech |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| EXPY | Cancellation because of completion of term |