JP2804265B2 - 音声認識方式 - Google Patents

音声認識方式

Info

Publication number
JP2804265B2
JP2804265B2 JP62179562A JP17956287A JP2804265B2 JP 2804265 B2 JP2804265 B2 JP 2804265B2 JP 62179562 A JP62179562 A JP 62179562A JP 17956287 A JP17956287 A JP 17956287A JP 2804265 B2 JP2804265 B2 JP 2804265B2
Authority
JP
Japan
Prior art keywords
state
standard pattern
time
pattern
input
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP62179562A
Other languages
English (en)
Other versions
JPS6423299A (en
Inventor
哲也 室井
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Ricoh Co Ltd
Original Assignee
Ricoh Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Ricoh Co Ltd filed Critical Ricoh Co Ltd
Priority to JP62179562A priority Critical patent/JP2804265B2/ja
Priority to US07/213,826 priority patent/US4918731A/en
Publication of JPS6423299A publication Critical patent/JPS6423299A/ja
Application granted granted Critical
Publication of JP2804265B2 publication Critical patent/JP2804265B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Description

【発明の詳細な説明】 技術分野 本発明は、音声認識方式、より詳細には、音声認識に
おける照合方式に関する。 従来技術 音声パターンの照合方式の1つであるDPマッチング
は、計算量が多いという欠点があった。これは、局所距
離、累積距離を計算すべき、格子点の数が(入力フレー
ム数)×(標準パターンのフレーム数)に比例している
ことに起因している。また、圧縮DPという手法も知られ
ている。これは、格子点の数を減らすのに有効な方法で
あるが、音声パターンのどの部分をどれだけ圧縮するか
とういう決め方が難しい。また、伸縮の制御も複雑にな
り、単語によって圧縮率が異なる等の欠点があった。ま
た、HMMでは、距離と確率との違いはあるが、格子点の
数が、(入力フレーム数)×(モデルの状態数)とな
り、DPマッチングの格子点と比較して、計算量が大幅に
少なくなっている。また、状態数が固定であるため、語
いの変更によって演算量が変化しないなどの利点があ
る。しかし、HMMでは、時間方向の伸縮(状態遷移の制
御)が難しいという欠点があった。また、訓練データが
少ないと良質のモデルが得にくいという欠点があった。 目的 本発明は、上述のごとき実情に鑑みてなされたもの
で、特に、少ない演算量と少ない標準パターン用メモリ
を用いて精密な音声パターンの照合を行なうことを目的
としてなされたものである。 構成 本発明は、上記目的を達成するために、入力された音
声信号を特徴系列変換手段を用いて特徴ベクトルの時系
列に変換し、標準パターンを一定の状態数を持つ状態の
系列として表現し、各状態ごとに状態を代表する特徴ベ
クトルと状態の継続時間が記憶してあり、該入力音声の
特徴ベクトルの時系列を前記標準パターンと照合する音
声認識装置において、照合を行なう際、状態遷移の重み
を、入力音声が標準パターンの各状態に帰属する時間と
標準パターンの各状態の継続時間の差を自乗に比例させ
た量とし、該重みを照合の際の累積距離に加えることを
特徴としたものである。 以下、本発明の実施例に基づいて説明する。 第1図は、本発明の一実施例を説明するためのブロッ
ク線図で、図中、1はマイクロフォン、2は特徴系列変
換手段、3は音声区間検出手段、4はマッチング部、5
は標準パターン、6は認識結果出力部で、マイクロフォ
ン1から入力された音声は、特徴ベクトル変換手段2に
よって特徴ベクトルの時系列に変換される。特徴ベクト
ルとしては、スペクトラム、LPCケプストラム等様々な
ものが考えられる。本実施例では、スペクトラムを用い
て説明するが、本発明は、これに限るわけではない。音
声波形をスペクトラムパターンに変換するには、中心周
波数が250〜6300Hzで1/3オクターブごとに配置した15チ
ャンネルのバンドパスフィルター群を用いればよい。ま
た、フレーム周期は10ms程度とすればよい。 音声区間検出手段3としては様々な方式が知られてお
り、本発明には直接関係ないのでここでの詳細な説明は
省略する。 ここで入力音声は、次に示すベクトルの時系列として
得られたことになる。 xi=(x1i,x2i,……x15i) (2) (ただし、Iは入力音声フレーム数,xiは入力音声のi
フレームの特徴ベクトル、xfiは、入力音声のiフレー
ムのfチャンネルの出力である。) また、標準パターンは、次に示す形で登録されてい
る。 (ただし、Nは状態数, は標準パターンの第j状態の特徴ベクトル,yfjは、標準
パターンの第j状態のfチャンネルの値,ljは標準パタ
ーンの第j状態の継続時間(フレーム長)である。) パターンマッチングは、動的計画法や、山登り法等を
用いることができ、ここでは、動的計画法を用いて説明
する。 step1. D(1,1)=d(1,1) (6) step3.(標準パターンと入力音声との距離)=D(I,
N) (ただし、iは入力フレーム番号,jは状態番号,d(i,
j)は入力iフレームと標準パターンj状態との局所距
離,D(i,j)は格子点(i,j)に到達する最適累積距離,W
は状態遷移の重みである。) 第2図は、上述のようにして求めた入力音声と標準パ
ターンとの照合における最適状態列の例(状態数N=
4)で、このようにして最適な状態列を求め、そのとき
の累積距離D(I,N)を照合結果としている。 局所距離は、市街地距離、ユークリッド距離、マハラ
ノビスの汎距離等様々なものが知られており、例えば、
市街地距離を用いればd(i,j)は、 して計算される。 通常のDPマッチングでは、標準パターンは、入力パタ
ーンと基本的には同じ形式であり、マッチング平面は第
3図に示すようになる。例えば、フレーム周期10msの単
語認識の場合、平面単語長は60フレーム(600ms)程度
であり、格子点の個数はI・J=3600となる。ところ
が、本発明の場合には、例えば状態数N=4(第2図)
とすると、格子点の個数はI・N=240と大幅に少なく
なっており、演算時間の大幅な短縮が可能となる。 (8)式における状態遷移の重みWは、入力パターン
と標準パターンとの対応において極端な時間伸縮を防ぐ
時間制御のための項である。 第4図において格子点C(i,j)に到る最適パスは、
格子点A(i−1,j)に到達した最適パスIと、格子点
B(i−1,j−1)に到る最適パスIIとの2つのパスか
ら選択される。 ここで、格子点Bに到達する最適パスにおいて、初め
て状態j−1に到達したときに入力フレーム番号をi′
とすれば、状態j−1への帰属時間はi−i′フレーム
である。また、標準パターンにおける状態j−1の継続
時間をlj−lとする。このとき、状態遷移の重みWを W=a{(i−i′)−lj-l}2 (10) として表わす(aは定数)。(10)式の重みを採用する
ことにより、帰属時間と継続時間との差が小さい(即
ち、入力パターンと標準パターンとの時間的なズレが少
ない)ときのみWの値は小さくなり、状態遷移が起り易
くなる。このため、精密な時間制御が可能となる。 また、Wを と定義することもできる。 この(11)式は、状態j−1への帰属時間を状態j−
1の継続時間の1/2〜2倍に制限しており、不適当な時
間対応を防ぐことができる。 (10),(11)で用いられている継続時間lj(1≦j
≦N)は、一回の訓練データ(標準パターン作成用の発
声)で得ることができるが、標準パターンを精密に作成
するため、複数の訓練データがある場合には、その平均
値とすれば良い。 効果 以上の説明から明らかなように、本発明によると、少
ない演算量と少ない標準パターン用のメモリーを用い
て、正確な時間長制御を行うことができる精密な音声認
識を行うことが可能となる。
【図面の簡単な説明】 第1図は、本発明の一実施例を説明するためのブロック
線図、第2図は、入力音声と標準パターンとの照合にお
ける最適状態列の例を示す図、第3図は、DPマッチング
における計算平面を示す図、第4図は、最適パスの例を
示す図である。 1……マイクロフォン,2……特徴系列変換手段,3……音
声区間検出手段,4……マッチング部,5……標準パター
ン,6……認識結果出力部。

Claims (1)

  1. (57)【特許請求の範囲】 1.入力された音声信号を特徴系列変換手段を用いて特
    徴ベクトルの時系列に変換し、標準パターンを一定の状
    態数を持つ状態の系列として表現し、各状態ごとに状態
    を代表する特徴ベクトルと状態の継続時間が記憶してあ
    り、該入力音声の特徴ベクトルの時系列を前記標準パタ
    ーンと照合する音声認識装置において、照合を行なう
    際、状態遷移の重みを、入力音声が標準パターンの各状
    態に帰属する時間と標準パターンの各状態の継続時間の
    差の自乗に比例させた量とし、該重みを照合の際の累積
    距離に加えることを特徴とする音声認識方式。
JP62179562A 1987-07-17 1987-07-17 音声認識方式 Expired - Lifetime JP2804265B2 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP62179562A JP2804265B2 (ja) 1987-07-17 1987-07-17 音声認識方式
US07/213,826 US4918731A (en) 1987-07-17 1988-06-30 Speech recognition method and apparatus

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP62179562A JP2804265B2 (ja) 1987-07-17 1987-07-17 音声認識方式

Publications (2)

Publication Number Publication Date
JPS6423299A JPS6423299A (en) 1989-01-25
JP2804265B2 true JP2804265B2 (ja) 1998-09-24

Family

ID=16067900

Family Applications (1)

Application Number Title Priority Date Filing Date
JP62179562A Expired - Lifetime JP2804265B2 (ja) 1987-07-17 1987-07-17 音声認識方式

Country Status (1)

Country Link
JP (1) JP2804265B2 (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP3066920B2 (ja) 1991-06-11 2000-07-17 キヤノン株式会社 音声認識方法及び装置
JP3135931B2 (ja) 1991-02-14 2001-02-19 株式会社リコー 音声認識方式

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0850673B1 (en) 1996-07-11 2003-10-01 Sega Enterprises, Ltd. Game input device and game input method with voice recognition

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5720639B2 (ja) * 1974-10-04 1982-04-30

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP3135931B2 (ja) 1991-02-14 2001-02-19 株式会社リコー 音声認識方式
JP3066920B2 (ja) 1991-06-11 2000-07-17 キヤノン株式会社 音声認識方法及び装置

Also Published As

Publication number Publication date
JPS6423299A (en) 1989-01-25

Similar Documents

Publication Publication Date Title
JP2733955B2 (ja) 適応型音声認識装置
US4751737A (en) Template generation method in a speech recognition system
JP2692581B2 (ja) 音響カテゴリ平均値計算装置及び適応化装置
JPH0394299A (ja) 音声認識方法と音声認識装置訓練方法
US5758021A (en) Speech recognition combining dynamic programming and neural network techniques
JP3130524B2 (ja) 音声信号認識方法およびその方法を実施する装置
JPH08211897A (ja) 音声認識装置
JP2000298495A (ja) 音声認識装置用の回帰クラス木構造の指定方法
Roucos et al. A stochastic segment model for phoneme-based continuous speech recognition
JP3315565B2 (ja) 音声認識装置
JPH05232989A (ja) 音響モデルの話者適応化法
JP3011997B2 (ja) 参照ベクトル更新方法
JP3029803B2 (ja) 音声認識のための単語モデル生成装置及び音声認識装置
JP2921059B2 (ja) 連続音声認識装置
JP3003353B2 (ja) タスク適応標準パターン学習装置
JP3285047B2 (ja) 不特定話者用音声認識装置
JP3518195B2 (ja) 音声認識装置
JP3044741B2 (ja) 標準パターン学習方法
JPH0635495A (ja) 音声認識装置
JP3036706B2 (ja) 音声認識方法
JP3316352B2 (ja) 音声認識方法
JPH04311997A (ja) Dpマッチング法
JP3448371B2 (ja) Hmmの学習装置
JP3135931B2 (ja) 音声認識方式
Gupta et al. On multiframe parameter optimization in articulatory analysis/synthesis of speech

Legal Events

Date Code Title Description
EXPY Cancellation because of completion of term