JPH0581920B2 - - Google Patents
Info
- Publication number
- JPH0581920B2 JPH0581920B2 JP2311974A JP31197490A JPH0581920B2 JP H0581920 B2 JPH0581920 B2 JP H0581920B2 JP 2311974 A JP2311974 A JP 2311974A JP 31197490 A JP31197490 A JP 31197490A JP H0581920 B2 JPH0581920 B2 JP H0581920B2
- Authority
- JP
- Japan
- Prior art keywords
- phoneme
- hmm
- parser
- context
- predicted
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Fee Related
Links
- 230000009471 action Effects 0.000 claims abstract description 22
- 230000001419 dependent effect Effects 0.000 claims abstract description 16
- 238000012795 verification Methods 0.000 abstract description 2
- 238000000034 method Methods 0.000 description 35
- 238000010586 diagram Methods 0.000 description 11
- 238000012545 processing Methods 0.000 description 9
- 238000004458 analytical method Methods 0.000 description 7
- CIWBSHSKHKDKBQ-JLAZNSOCSA-N Ascorbic acid Chemical compound OC[C@H](O)[C@H]1OC(=O)C(O)=C1O CIWBSHSKHKDKBQ-JLAZNSOCSA-N 0.000 description 6
- 238000004364 calculation method Methods 0.000 description 6
- 230000008569 process Effects 0.000 description 6
- 230000009467 reduction Effects 0.000 description 3
- 230000007704 transition Effects 0.000 description 3
- 230000006870 function Effects 0.000 description 2
- 230000000694 effects Effects 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 238000013507 mapping Methods 0.000 description 1
- 238000003672 processing method Methods 0.000 description 1
- 238000011160 research Methods 0.000 description 1
- 238000000926 separation method Methods 0.000 description 1
- 230000005236 sound signal Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
- G10L15/187—Phonemic context, e.g. pronunciation rules, phonotactical constraints or phoneme n-grams
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/14—Speech classification or search using statistical models, e.g. Hidden Markov Models [HMMs]
- G10L15/142—Hidden Markov Models [HMMs]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
- G10L2015/025—Phonemes, fenemes or fenones being the recognition units
Landscapes
- Engineering & Computer Science (AREA)
- Artificial Intelligence (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Machine Translation (AREA)
Description
【発明の詳細な説明】
[産業上の利用分野]
この発明は連続音声認識装置に関し、特に、
LRテーブルを入力音声データの予測に用い、こ
の予測をHMM音素認識装置の音素照合機能で検
証することによつて、音声認識と言語処理を統一
的に行なうような連続音声認識装置に関する。
LRテーブルを入力音声データの予測に用い、こ
の予測をHMM音素認識装置の音素照合機能で検
証することによつて、音声認識と言語処理を統一
的に行なうような連続音声認識装置に関する。
[従来の技術]
従来より、音声認識と言語処理とを統一的かつ
効率的に行なう連続音声認識手法として、HMM
−LR法がある。この手法では、それまで別々に
行われていた音声認識と言語処理とが統一的に扱
われることにより、文節ラテイスなどの中間的な
データを介することなく、信頼性の高い効率的な
処理が行なわれる。
効率的に行なう連続音声認識手法として、HMM
−LR法がある。この手法では、それまで別々に
行われていた音声認識と言語処理とが統一的に扱
われることにより、文節ラテイスなどの中間的な
データを介することなく、信頼性の高い効率的な
処理が行なわれる。
HMM−LR法では、LR法(LRパーザ)と呼
ばれる言語処理法によつて予測された音素の存在
確率がHMM(Hidden Markov Model)法と呼
ばれる音声認識法により計算される。以下、
HMM−LR法の説明の前に、LR法とHMM法に
ついて説明する。
ばれる言語処理法によつて予測された音素の存在
確率がHMM(Hidden Markov Model)法と呼
ばれる音声認識法により計算される。以下、
HMM−LR法の説明の前に、LR法とHMM法に
ついて説明する。
計算幾何学、特にプログラミング言語の処理系
の分野では、構文解析の技術に関し十分な研究が
なされ、そのうちの1つの方式にLRパーザと呼
ばれるものがある。LRパーザはいわゆるSHIFT
−REDUCE型のパーザの一種であり、入力記号
を左から右に読みながら解析を進めるものであ
る。LRパーザは内部に「状態」と呼ばれるもの
を保持しており、現在の状態と入力記号とを用い
て、次にとるべき動作を決定する。LRパーザの
動作には、 (1) ACCEPT (2) ERROR (3) SHIFT (4) REDUCE の4つが許されている。ACCEPTはLRパーザへ
の入力記号列が受理されたことを示す。ERROR
はLRパーザへの入力記号列が受理されなかつた
ことを示す。SHIFTは現在LRパーザが見ている
入力記号および現在の状態をスタツクに積む。
REDUCEは文法規則を使つてスタツクの最上段
にある記号をより大きな単位に換言する。
REDUCEの際には、使われた文法規則の右辺に
ある文法規則の数だけスタツクから状態記号およ
び入力記号を取除く。
の分野では、構文解析の技術に関し十分な研究が
なされ、そのうちの1つの方式にLRパーザと呼
ばれるものがある。LRパーザはいわゆるSHIFT
−REDUCE型のパーザの一種であり、入力記号
を左から右に読みながら解析を進めるものであ
る。LRパーザは内部に「状態」と呼ばれるもの
を保持しており、現在の状態と入力記号とを用い
て、次にとるべき動作を決定する。LRパーザの
動作には、 (1) ACCEPT (2) ERROR (3) SHIFT (4) REDUCE の4つが許されている。ACCEPTはLRパーザへ
の入力記号列が受理されたことを示す。ERROR
はLRパーザへの入力記号列が受理されなかつた
ことを示す。SHIFTは現在LRパーザが見ている
入力記号および現在の状態をスタツクに積む。
REDUCEは文法規則を使つてスタツクの最上段
にある記号をより大きな単位に換言する。
REDUCEの際には、使われた文法規則の右辺に
ある文法規則の数だけスタツクから状態記号およ
び入力記号を取除く。
現在の状態と入力信号とから、LRパーザの動
作を決定するためにはLRテーブルと呼ばれる表
を参照する。LRテーブルはLRパーザでの解析に
先立ち、予め用意しておく必要がある。LRテー
ブルは、文法規則から機械的に構成することがで
きる。
作を決定するためにはLRテーブルと呼ばれる表
を参照する。LRテーブルはLRパーザでの解析に
先立ち、予め用意しておく必要がある。LRテー
ブルは、文法規則から機械的に構成することがで
きる。
第4図は文法規則の一例を示す図であり、第5
図は第4図に示した文法規則をLRテーブルに変
換した例を示す図である。
図は第4図に示した文法規則をLRテーブルに変
換した例を示す図である。
LRテーブルは第5図に示すように、ACTION
テーブルとGOTOテーブルと呼ばれる2つの表
からなつている。ACTIONテーブルは縦軸方向
にLRパーザの状態を記述し、横軸方向に入力記
号を配置したテーブルであり、テーブルの一区画
にはLRパーザの取るべき動作が記述されている。
第5図において、accと記述された動作は
ACCEPTのことであり、テーブル中の空間は
ERRORを示す。sで始まる記号はSHIFTを表
しており、sの後に記述された数字はSHIFT動
作を行なつた後に、LRテーブルが取るべき状態
である。rで始まる記号はREDUCEを表してお
り、rの後に記された数字nはn番目の文法規則
を用いた還元動作を行なうことを示している。
テーブルとGOTOテーブルと呼ばれる2つの表
からなつている。ACTIONテーブルは縦軸方向
にLRパーザの状態を記述し、横軸方向に入力記
号を配置したテーブルであり、テーブルの一区画
にはLRパーザの取るべき動作が記述されている。
第5図において、accと記述された動作は
ACCEPTのことであり、テーブル中の空間は
ERRORを示す。sで始まる記号はSHIFTを表
しており、sの後に記述された数字はSHIFT動
作を行なつた後に、LRテーブルが取るべき状態
である。rで始まる記号はREDUCEを表してお
り、rの後に記された数字nはn番目の文法規則
を用いた還元動作を行なうことを示している。
LRパーザはREDUCE動作を行なつた後に、
GOTOテーブルを参照する。GOTOテーブルは、
縦軸方向にLRパーザの状態を記述し、横軸方向
に非終端記号を記述したテーブルである。LRパ
ーザはREDUCE動作の結果作られた非終端記号
と現在の状態とから、GOTOテーブルにより新
しい状態を決定する。解析が開始した時点での
LRパーザの状態は0であり、LRパーザが
ACCEPT動作を行ない入力記号列を受理するか、
ERROR動作を行ない入力記号列を受理しないか
で解析は終了する。
GOTOテーブルを参照する。GOTOテーブルは、
縦軸方向にLRパーザの状態を記述し、横軸方向
に非終端記号を記述したテーブルである。LRパ
ーザはREDUCE動作の結果作られた非終端記号
と現在の状態とから、GOTOテーブルにより新
しい状態を決定する。解析が開始した時点での
LRパーザの状態は0であり、LRパーザが
ACCEPT動作を行ない入力記号列を受理するか、
ERROR動作を行ない入力記号列を受理しないか
で解析は終了する。
一方、音声認識の分野では、発話を確率的な状
態遷移と見なして認識処理する手法があり、
HMM方式と呼ばれている。
態遷移と見なして認識処理する手法があり、
HMM方式と呼ばれている。
第6図はHMM方式で用いる典型的な音素モデ
ルの図である。以下に、第6図を参照して、
HMMによる音素認識の方法について説明する。
HMMの各弧には状態間の遷移の確率と、記号の
出力確率の値が与えられており、これらの値に基
づいて確率的に記号列を出力する。HMM方式を
用いて音素認識を行なうためには、予め音素の種
類だけHMMを用意し、それぞれ学習用音素デー
タの記号列を最も高い確率で出力するように、音
素HMMの確率を学習しておき、次に未知音声デ
ータ記号列に対して、全てのHMMからその記号
列が出力される確率を計算して、最も高い確率が
得られるHMMに対応する音素を認識結果とす
る。
ルの図である。以下に、第6図を参照して、
HMMによる音素認識の方法について説明する。
HMMの各弧には状態間の遷移の確率と、記号の
出力確率の値が与えられており、これらの値に基
づいて確率的に記号列を出力する。HMM方式を
用いて音素認識を行なうためには、予め音素の種
類だけHMMを用意し、それぞれ学習用音素デー
タの記号列を最も高い確率で出力するように、音
素HMMの確率を学習しておき、次に未知音声デ
ータ記号列に対して、全てのHMMからその記号
列が出力される確率を計算して、最も高い確率が
得られるHMMに対応する音素を認識結果とす
る。
この未知音声データに対する確率を計算する操
作を音素照合と称する。この操作は、たとえば第
6図のHMMに対しては、次のような手順で実現
される。
作を音素照合と称する。この操作は、たとえば第
6図のHMMに対しては、次のような手順で実現
される。
(定義の記号)
N:未知音声データに対する記号列の長さ
Oi:未知音声データ記号列のi番目の記号
M:照合される音素HMMの状態の数
a(i、j):照合される音素HMMにおいて状態
iと状態jを結ぶ弧の遷移確率 b(i、j、k):照合される音素HMMにおいて
状態iと状態jを結ぶ弧が記号kを出力する確
率 (初期化) P(0、0)=1.0 P(0、j)=1.0e-∞ (j=1…M) P(i、0)=1.0e-∞ (i=1…N) (漸化計算(i=1…N、j=1…M)) P(i、j)=P(i−1、j)×a(j、j) ×b(j、j、Oi)+P(i−1、j−1) ×a(j−1、j)×b(j−1、j、Oi)Q(i) =P(i、M) (i=1…N) 音素照合の結果は、確率テーブルQ(1)…Q(N)の
中に求められる。
iと状態jを結ぶ弧の遷移確率 b(i、j、k):照合される音素HMMにおいて
状態iと状態jを結ぶ弧が記号kを出力する確
率 (初期化) P(0、0)=1.0 P(0、j)=1.0e-∞ (j=1…M) P(i、0)=1.0e-∞ (i=1…N) (漸化計算(i=1…N、j=1…M)) P(i、j)=P(i−1、j)×a(j、j) ×b(j、j、Oi)+P(i−1、j−1) ×a(j−1、j)×b(j−1、j、Oi)Q(i) =P(i、M) (i=1…N) 音素照合の結果は、確率テーブルQ(1)…Q(N)の
中に求められる。
以上のようなLR法とHMM法を統一的に扱つ
て解析するのがHMM−LR法である。HMM−
LR法は、LRテーブルから、発話された音声デー
タ中の音素を予測し、予測された音素に対し、
HMM音素照合を駆動することにより、予測され
た音素の存在確率を計算する。これにより、音声
認識と言語処理を同時進行させる。このため、音
声認識と言語処理との橋渡し的な中間的データを
介することなく、信頼性の高い効率的な処理を行
なうことができる。以下、HMM−LR法のこと
を単にパーザと呼ぶ。
て解析するのがHMM−LR法である。HMM−
LR法は、LRテーブルから、発話された音声デー
タ中の音素を予測し、予測された音素に対し、
HMM音素照合を駆動することにより、予測され
た音素の存在確率を計算する。これにより、音声
認識と言語処理を同時進行させる。このため、音
声認識と言語処理との橋渡し的な中間的データを
介することなく、信頼性の高い効率的な処理を行
なうことができる。以下、HMM−LR法のこと
を単にパーザと呼ぶ。
パーザはいくつかの可能性のある構文解析木を
同時に成長させる。構文解析木とは文を一次元の
単語列として表現し、これらの関係を木のように
表したものである。構文解析木は、その構文解析
木が受容される確率値が付与されており、この確
率値が予め決められている閾値以下になると、そ
の構文解析木は成長させる価値がないと見なし、
却下される。パーザは現在成長させている構文解
析木に関する情報を記憶しておくための場所をい
くつか持つている。この場所を以下ではセルと称
する。1つのセルには、1つの構文解析木が対応
している。現在までに受理されている構文解析木
に対応するセルをアクテイブなセルと称する。セ
ルに記憶される情報には以下のものがある。
同時に成長させる。構文解析木とは文を一次元の
単語列として表現し、これらの関係を木のように
表したものである。構文解析木は、その構文解析
木が受容される確率値が付与されており、この確
率値が予め決められている閾値以下になると、そ
の構文解析木は成長させる価値がないと見なし、
却下される。パーザは現在成長させている構文解
析木に関する情報を記憶しておくための場所をい
くつか持つている。この場所を以下ではセルと称
する。1つのセルには、1つの構文解析木が対応
している。現在までに受理されている構文解析木
に対応するセルをアクテイブなセルと称する。セ
ルに記憶される情報には以下のものがある。
(1) LRパーザの状態スタツク
(2) 前回の音素照合で計算された確率テーブルQ
(1)…Q(N)の値 ただし、Nは入力音声データに対する記号列の
長さである。
(1)…Q(N)の値 ただし、Nは入力音声データに対する記号列の
長さである。
解析が開始した時点でセルCはただ1つだけ存
在し、そのただ1つのセルCのLRパーザの状態
スタツクの最上段には、状態0がプツシユされ
る。また、このセルCの確率テーブルQには、以
下の値が初期値として入れられる。
在し、そのただ1つのセルCのLRパーザの状態
スタツクの最上段には、状態0がプツシユされ
る。また、このセルCの確率テーブルQには、以
下の値が初期値として入れられる。
Q(0)=1.0
Q(i)=1.0e-∞ (i=1…N)
次に、パーザはアクテイブなセルを1つ選び出
し、そのセルのLR状態スタツクの最上段の状態
sを読み、LRテーブルの状態sに対応する動作
表を調べる。選ばれた動作がSHIFTであれば、
SHIFTされるべき入力記号AがHMM音素照合
され、セル中の確率テーブルの値が以下のように
して更新される。
し、そのセルのLR状態スタツクの最上段の状態
sを読み、LRテーブルの状態sに対応する動作
表を調べる。選ばれた動作がSHIFTであれば、
SHIFTされるべき入力記号AがHMM音素照合
され、セル中の確率テーブルの値が以下のように
して更新される。
(漸次計算)
P(0、j)=1.0e-∞ (j=1…M′)
P(i、0)=Q(i) (i=1…N)
P(i、j)=P(i−1、j)×a(j、j)
×b(j、j、Oi)+P(i−1、j−1)
×a(j−1、j)×b(j−1、j、Oi)
(i=1…N、j=1…M′)
Q(i)=P(i、M′) (i=1…N)
ただし、M′は記号AのHMMでの状態数
上述の計算で更新された確率テーブルQ(1)…Q
(N)の中で最も高い確率値を持つQ(i)が、閾値より
も小さければこのセルは捨てられ、閾値よりも小
さくなれば、LR状態スタツクに新しい状態が積
まれる。
(N)の中で最も高い確率値を持つQ(i)が、閾値より
も小さければこのセルは捨てられ、閾値よりも小
さくなれば、LR状態スタツクに新しい状態が積
まれる。
一方、選ばれた動作がREDUCEであれば、文
法規則による還元動作が実行される。これは、通
常のLRパーザと全く同じ動作である。また、選
ばれた動作がACCEPTであり、入力音声データ
が全て処理されていれば解析は終了する。
法規則による還元動作が実行される。これは、通
常のLRパーザと全く同じ動作である。また、選
ばれた動作がACCEPTであり、入力音声データ
が全て処理されていれば解析は終了する。
さて、音声認識で用いる音素モデルを、音素周
辺の環境情報によつて統一的に記述する手法とし
て、音素環境クラスタリング(Phoneme
Environment Clustering:PEC)がある。これ
は、音素パターン空間と音素環境空間との写像に
おける総歪み量の最小化を図ることで環境依存音
素のクラスタを抽出する手法である。音素環境要
因としては、音素文脈、ピツチ、パワー、話者、
発話速度、言語などが挙げられる。このうち、音
素環境として特に重要な情報を担つていると考え
られるのが音素文脈の情報である。特に、HMM
−LR法のように音素文脈が既知の場合には、
PECにより得られた音素分離度の高い音素モデ
ルを用いて精度の高い認識が期待できる。
辺の環境情報によつて統一的に記述する手法とし
て、音素環境クラスタリング(Phoneme
Environment Clustering:PEC)がある。これ
は、音素パターン空間と音素環境空間との写像に
おける総歪み量の最小化を図ることで環境依存音
素のクラスタを抽出する手法である。音素環境要
因としては、音素文脈、ピツチ、パワー、話者、
発話速度、言語などが挙げられる。このうち、音
素環境として特に重要な情報を担つていると考え
られるのが音素文脈の情報である。特に、HMM
−LR法のように音素文脈が既知の場合には、
PECにより得られた音素分離度の高い音素モデ
ルを用いて精度の高い認識が期待できる。
[発明が解決しようとする課題]
ところで、音素環境として音素文脈要因を取上
げた場合、音素環境クラスタリングによつて決定
された音素モデルは、音素文脈に依存したモデル
となる。この音素モデルを駆動して連続音声認識
を行うためには、パーザが音素文脈に依存する動
作をしなければならない。しかし、従来のHMM
−LR法におけるLRパーザでは、音素文脈に応じ
た動作をすることができず、上述の音素文脈依存
型音素モデルを駆動できなかつた。
げた場合、音素環境クラスタリングによつて決定
された音素モデルは、音素文脈に依存したモデル
となる。この音素モデルを駆動して連続音声認識
を行うためには、パーザが音素文脈に依存する動
作をしなければならない。しかし、従来のHMM
−LR法におけるLRパーザでは、音素文脈に応じ
た動作をすることができず、上述の音素文脈依存
型音素モデルを駆動できなかつた。
それゆえに、この発明の主たる目的は、音素文
脈依存型音素モデルを駆動するための連続音声認
識装置を提供することである。
脈依存型音素モデルを駆動するための連続音声認
識装置を提供することである。
[課題を解決するための手段]
この発明は連続音声認識装置であつて、入力さ
れた音声の各音素に対する確率を計算するHMM
音素照合部と、LRテーブルのアクシヨン指定項
目を音素予測に用いる予測LRパーザ部と、予測
された音素周辺の音素文脈をLRテーブルのアク
シヨン指定項目を用いて予測する音素文脈予測部
とを備え、予測LRパーザ部によつて予測された
音素の音素文脈を音素文脈予測部で予測し、当該
音素文脈の環境と適合する音素文脈依存型音素モ
デルを駆動して、上述の音素文脈予測部によつて
予測された音素の存在確率をHMM音素照合部を
駆動することにより求めるように構成される。
れた音声の各音素に対する確率を計算するHMM
音素照合部と、LRテーブルのアクシヨン指定項
目を音素予測に用いる予測LRパーザ部と、予測
された音素周辺の音素文脈をLRテーブルのアク
シヨン指定項目を用いて予測する音素文脈予測部
とを備え、予測LRパーザ部によつて予測された
音素の音素文脈を音素文脈予測部で予測し、当該
音素文脈の環境と適合する音素文脈依存型音素モ
デルを駆動して、上述の音素文脈予測部によつて
予測された音素の存在確率をHMM音素照合部を
駆動することにより求めるように構成される。
[作用]
この発明に係る連続音声認識装置は、LRテー
ブルを用いて入力音声データ中の音素の予測を行
ない、予測された音素について当該音素周辺の音
素文脈の予測をLRテーブルを用いて音素文脈予
測部で行ない、これらの予測をHMM音声認識部
の音素照合機能で検証することにより、LRパー
ザ音素文脈に応じた音素文脈依存型HMM音素モ
デルを駆動するようにしたものである。
ブルを用いて入力音声データ中の音素の予測を行
ない、予測された音素について当該音素周辺の音
素文脈の予測をLRテーブルを用いて音素文脈予
測部で行ない、これらの予測をHMM音声認識部
の音素照合機能で検証することにより、LRパー
ザ音素文脈に応じた音素文脈依存型HMM音素モ
デルを駆動するようにしたものである。
[発明の実施例]
第1図はこの発明の一実施例の構成を示す概略
ブロツク図である。まず、第1図を参照して、こ
の発明の一実施例の構成について説明する。入力
端子100を介し音声信号がHMM音素照合部1
01に与えられる。HMM音素照合部101は音
素文脈依存型HMM音素モデル102を用いて、
音素を照合する。音素依存型LRパーザ部109
は、音素文脈予測部107と予測LRパーザ部1
08とを含む。予測LRパーザ部108は、LRテ
ーブル106から次の音素を予測するものであ
り、予測された音素は音素文脈予測部107に与
えられる。音素文脈予測部107は、当該予測音
素を中心音素として、LRテーブルとセルに記述
された音素文脈の履歴情報を参照して、当該予測
音素における音素文脈を予測する。
ブロツク図である。まず、第1図を参照して、こ
の発明の一実施例の構成について説明する。入力
端子100を介し音声信号がHMM音素照合部1
01に与えられる。HMM音素照合部101は音
素文脈依存型HMM音素モデル102を用いて、
音素を照合する。音素依存型LRパーザ部109
は、音素文脈予測部107と予測LRパーザ部1
08とを含む。予測LRパーザ部108は、LRテ
ーブル106から次の音素を予測するものであ
り、予測された音素は音素文脈予測部107に与
えられる。音素文脈予測部107は、当該予測音
素を中心音素として、LRテーブルとセルに記述
された音素文脈の履歴情報を参照して、当該予測
音素における音素文脈を予測する。
さらに、上述の予測された音素文脈に適合する
音素環境クラスタを決定した後、予測された音素
が音声信号中に実際に存在するか否かを調べるた
めに、制御信号がHMM音素照合部101に与え
られてこのHMM音素照合部101が起動され
る。HMM音素照合部101は、当該音素環境ク
ラスタに相当する音素文脈依存型HMM音素モデ
ルを駆動し、当該予測音素に対する音素照合を行
なう。HMM音素照合部101による予測音素に
対する照合結果104は予測LRパーザ部108
に返される。予測LRパーザ部108はACCEPT
動作をLRテーブル106中に見付けるまで同様
の操作を繰返す。そして、予測LRパーザ部10
8から認識結果109が出力される。
音素環境クラスタを決定した後、予測された音素
が音声信号中に実際に存在するか否かを調べるた
めに、制御信号がHMM音素照合部101に与え
られてこのHMM音素照合部101が起動され
る。HMM音素照合部101は、当該音素環境ク
ラスタに相当する音素文脈依存型HMM音素モデ
ルを駆動し、当該予測音素に対する音素照合を行
なう。HMM音素照合部101による予測音素に
対する照合結果104は予測LRパーザ部108
に返される。予測LRパーザ部108はACCEPT
動作をLRテーブル106中に見付けるまで同様
の操作を繰返す。そして、予測LRパーザ部10
8から認識結果109が出力される。
第2図はこの発明の一実施例の具体的な動作を
説明するためのフロー図であり、第3図は音素文
脈の予測の動作を説明するための図である。
説明するためのフロー図であり、第3図は音素文
脈の予測の動作を説明するための図である。
次に、第2図および第3図を参照して、この発
明の一実施例の具体的な動作について説明する。
明の一実施例の具体的な動作について説明する。
まず、セルに記憶される情報には、第3図に示
すように以下のものがある。
すように以下のものがある。
(1) LRパーザの状態スタツク
(2) 音素環境クラスタのスタツク
(3) 前回の音素照合で計算された確率テーブルQ
(1)…Q(N)の値。ただし、Nは入力音声データに
対する記号列の長さである。
(1)…Q(N)の値。ただし、Nは入力音声データに
対する記号列の長さである。
第2図に示すように、解析が開始した時点のス
テツプ(図示ではSPと略称する)SP1において、
セルCはただ1つ存在し、そのただ1つのセルC
のLRパーザの状態スタツクの最上段には、状態
0がプツシユされる。また、このセルCの確率テ
ーブルQには以下の値が初期値として入れられ
る。
テツプ(図示ではSPと略称する)SP1において、
セルCはただ1つ存在し、そのただ1つのセルC
のLRパーザの状態スタツクの最上段には、状態
0がプツシユされる。また、このセルCの確率テ
ーブルQには以下の値が初期値として入れられ
る。
Q(0)=1.0
Q(i)=1.0e-∞ (i=1…N)
ステツプSP2において、予測LRパーザ108
はアクテイブなセルがあるか否かを判別し、なけ
れば解析を終了し、あればステツプSP3において
アクテイブなセルを1つ選び出し、そのセルの
LR状態スタツクの最上段の状態Sを読み、LRテ
ーブル106の状態sに対応する動作欄を調べ
る。そして、予測LRパーザ部108は動作欄に
ある動作の数だけセルのコピーを作る。作られた
セルのコピーは、1つの動作を実行するのに用い
られ、以下の操作は、このコピーされたセルに対
して行なわれる。
はアクテイブなセルがあるか否かを判別し、なけ
れば解析を終了し、あればステツプSP3において
アクテイブなセルを1つ選び出し、そのセルの
LR状態スタツクの最上段の状態Sを読み、LRテ
ーブル106の状態sに対応する動作欄を調べ
る。そして、予測LRパーザ部108は動作欄に
ある動作の数だけセルのコピーを作る。作られた
セルのコピーは、1つの動作を実行するのに用い
られ、以下の操作は、このコピーされたセルに対
して行なわれる。
ステツプSP4において、コピーにより作られた
セルがあるか否かが判別され、なければステツプ
SP2に戻り、あればステツプSP5に進む。ステツ
プSP5において、各セルに対応する動作が調べら
れ、選ばれた動作がSHIFTであれば、ステツプ
SP6に進む。以上のステツプSP1からステツプ
SP5までは、通常のHMM−LR法と全く同じ処
理である。
セルがあるか否かが判別され、なければステツプ
SP2に戻り、あればステツプSP5に進む。ステツ
プSP5において、各セルに対応する動作が調べら
れ、選ばれた動作がSHIFTであれば、ステツプ
SP6に進む。以上のステツプSP1からステツプ
SP5までは、通常のHMM−LR法と全く同じ処
理である。
ステツプSP6において、当該セル中の環境クラ
スタスタツク最上段を参照し、SHIFTされるべ
き入力記号Aが上述の参照された環境クラスタに
ついて音素文脈的に後続が許されるか否かが判定
される。後続が許されない場合は、ステツプSP7
においてセルは捨てられ、後続が許されるならば
ステツプSP8へ進む。ステツプSP8において、予
測音素文脈の仮説を以下のようにして立てる。こ
こでは、予測音素文脈は先行音素、中心音素、後
続音素の通常3要因からなるものとして説明す
る。
スタスタツク最上段を参照し、SHIFTされるべ
き入力記号Aが上述の参照された環境クラスタに
ついて音素文脈的に後続が許されるか否かが判定
される。後続が許されない場合は、ステツプSP7
においてセルは捨てられ、後続が許されるならば
ステツプSP8へ進む。ステツプSP8において、予
測音素文脈の仮説を以下のようにして立てる。こ
こでは、予測音素文脈は先行音素、中心音素、後
続音素の通常3要因からなるものとして説明す
る。
まず、現在の状態SからSHIFTすべき次の状
態S′における動作を参照し、SHIFT動作である
項目の入力記号Bを当該入力記号Aの予測後続音
素とする。ここでSHIFTすべき次の状態S′にお
いてSHIFT以外の動作のある場合はスキツプす
る。次に、当該セル中の入力記号のスタツクの最
上段にある入力信号Cを先行音素とし、当該先行
音素Cと、上述の予測後続音素Bと、上述の入力
記号Aとの音素3つ組による予測音素文脈を生成
する。当該音素文脈により、音素環境クラスタを
決定する。
態S′における動作を参照し、SHIFT動作である
項目の入力記号Bを当該入力記号Aの予測後続音
素とする。ここでSHIFTすべき次の状態S′にお
いてSHIFT以外の動作のある場合はスキツプす
る。次に、当該セル中の入力記号のスタツクの最
上段にある入力信号Cを先行音素とし、当該先行
音素Cと、上述の予測後続音素Bと、上述の入力
記号Aとの音素3つ組による予測音素文脈を生成
する。当該音素文脈により、音素環境クラスタを
決定する。
ステツプSP9において、上述の決定された音素
環境クラスタに相当する音素文脈依存型HMM音
素モデルを用いて、SHIFTされるべき入力記号
がHMM音素照合部101で音素照合される。こ
のとき、セル中の確率テーブルの値の更新計算
は、前述した通常のHMM−LR法の更新計算と
全く同じである。当該計算で更新された確率テー
ブルQ(1)…Q(N)の中で最も高い確率値を持つQ(i)
が閾値よりも小さいか否かがステツプSP10にお
いて判別される。
環境クラスタに相当する音素文脈依存型HMM音
素モデルを用いて、SHIFTされるべき入力記号
がHMM音素照合部101で音素照合される。こ
のとき、セル中の確率テーブルの値の更新計算
は、前述した通常のHMM−LR法の更新計算と
全く同じである。当該計算で更新された確率テー
ブルQ(1)…Q(N)の中で最も高い確率値を持つQ(i)
が閾値よりも小さいか否かがステツプSP10にお
いて判別される。
もし、最も高い確率値を持つQ(i)が閾値よりも
小さければ、ステツプSP11においてこのセルが
捨てられ、アクテイブでなくなる。しかし閾値よ
りも小さくなれば、ステツプSP12においてLR状
態スタツクに新しい状態が積まれ、環境クラスタ
のスタツクに上述の決定された音素環境クラスタ
が積まれる。この場合セルはアクテイブのままで
ある。次に、ステツプSP13へ進み、LRテーブル
106で参照している次の状態S′における
SHIFT動作が存在するか否かを判定し、存在す
ればステツプSP6へ戻り、存在しなければステツ
プSP2に戻る。
小さければ、ステツプSP11においてこのセルが
捨てられ、アクテイブでなくなる。しかし閾値よ
りも小さくなれば、ステツプSP12においてLR状
態スタツクに新しい状態が積まれ、環境クラスタ
のスタツクに上述の決定された音素環境クラスタ
が積まれる。この場合セルはアクテイブのままで
ある。次に、ステツプSP13へ進み、LRテーブル
106で参照している次の状態S′における
SHIFT動作が存在するか否かを判定し、存在す
ればステツプSP6へ戻り、存在しなければステツ
プSP2に戻る。
一方、前述のステツプSP5において、選ばれた
動作がREDUCEであれば、ステツプSP14に進
み、文法規則による還元動作が実行される。これ
は、通常のLRパーザと全く同じ動作である。こ
のとき、セルはアクテイブなままである。また、
ステツプSP5において、選ばれた動作が
ACCEPTであることが判別されてしかもステツ
プSP15において入力音声データが全て処理され
ているか否かが判別され、全て処理されていれ
ば、解析は成功したものとして終了する。そうで
なければ、このセルはステツプSP16において捨
てられ、ステツプSP2に戻る。
動作がREDUCEであれば、ステツプSP14に進
み、文法規則による還元動作が実行される。これ
は、通常のLRパーザと全く同じ動作である。こ
のとき、セルはアクテイブなままである。また、
ステツプSP5において、選ばれた動作が
ACCEPTであることが判別されてしかもステツ
プSP15において入力音声データが全て処理され
ているか否かが判別され、全て処理されていれ
ば、解析は成功したものとして終了する。そうで
なければ、このセルはステツプSP16において捨
てられ、ステツプSP2に戻る。
[発明の効果]
以上のように、この発明によれば、HMM−
LR法による連続音声認識において、音素文脈に
応じた動作を行なうLRパーザを実現でき、当該
音素文脈依存型LRパーザを用いて音素文脈依存
型の音素モデルを駆動することができる。
LR法による連続音声認識において、音素文脈に
応じた動作を行なうLRパーザを実現でき、当該
音素文脈依存型LRパーザを用いて音素文脈依存
型の音素モデルを駆動することができる。
第1図はこの発明の一実施例の概略ブロツク図
である。第2図はこの発明の一実施例の動作を説
明するためのフロー図である。第3図は音素文脈
の予測の動作を説明するための図である。第4図
は文法規則の例を示した図である。第5図は文法
規則をLRテーブルに変換した例を示す図である。
第6図はHMMの一例を示した図である。 図において100は入力端子、101はHMM
音素照合部、102は音素文脈依存型HMM音素
モデル、106はLRテーブル、107は音素文
脈予測部、108は予測LRパーザ部、109は
音素文脈依存型LRパーザ部を示す。
である。第2図はこの発明の一実施例の動作を説
明するためのフロー図である。第3図は音素文脈
の予測の動作を説明するための図である。第4図
は文法規則の例を示した図である。第5図は文法
規則をLRテーブルに変換した例を示す図である。
第6図はHMMの一例を示した図である。 図において100は入力端子、101はHMM
音素照合部、102は音素文脈依存型HMM音素
モデル、106はLRテーブル、107は音素文
脈予測部、108は予測LRパーザ部、109は
音素文脈依存型LRパーザ部を示す。
Claims (1)
- 【特許請求の範囲】 1 入力された音声の各音素に対する確率を計算
するHMM(Hideen Markov Model)音素照合
部と、 LR(Left to Right)テーブルのアクシヨン指
定項目を音素予測に用いる予測LRパーザ部と、 前記予測LRパーザ部によつて予測された音素
周辺の音素文脈をLR(Left to Right)テーブル
のアクシヨン指定項目を用いて予測する音素文脈
予測部とを備え、 前記音素文脈予測部によつて予測された音素文
脈に適合する音素文脈依存HMM音素モデルを用
いて音素を照合するHMM音素照合部を駆動する
ことにより、前記予測LRパーザ部によつて予測
された音素の存在確率を求めることを特徴とす
る、連続音声認識装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2311974A JPH04182000A (ja) | 1990-11-16 | 1990-11-16 | 連続音声認識装置 |
| US08/086,569 US6058365A (en) | 1990-11-16 | 1993-07-06 | Speech processing using an expanded left to right parser |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2311974A JPH04182000A (ja) | 1990-11-16 | 1990-11-16 | 連続音声認識装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH04182000A JPH04182000A (ja) | 1992-06-29 |
| JPH0581920B2 true JPH0581920B2 (ja) | 1993-11-16 |
Family
ID=18023680
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2311974A Granted JPH04182000A (ja) | 1990-11-16 | 1990-11-16 | 連続音声認識装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US6058365A (ja) |
| JP (1) | JPH04182000A (ja) |
Families Citing this family (20)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3969908B2 (ja) * | 1999-09-14 | 2007-09-05 | キヤノン株式会社 | 音声入力端末器、音声認識装置、音声通信システム及び音声通信方法 |
| US6714905B1 (en) * | 2000-05-02 | 2004-03-30 | Iphrase.Com, Inc. | Parsing ambiguous grammar |
| US6704728B1 (en) * | 2000-05-02 | 2004-03-09 | Iphase.Com, Inc. | Accessing information from a collection of data |
| US8478732B1 (en) | 2000-05-02 | 2013-07-02 | International Business Machines Corporation | Database aliasing in information access system |
| US9699129B1 (en) | 2000-06-21 | 2017-07-04 | International Business Machines Corporation | System and method for increasing email productivity |
| US6408277B1 (en) | 2000-06-21 | 2002-06-18 | Banter Limited | System and method for automatic task prioritization |
| US8290768B1 (en) | 2000-06-21 | 2012-10-16 | International Business Machines Corporation | System and method for determining a set of attributes based on content of communications |
| US7308400B2 (en) * | 2000-12-14 | 2007-12-11 | International Business Machines Corporation | Adaptation of statistical parsers based on mathematical transform |
| US7644057B2 (en) | 2001-01-03 | 2010-01-05 | International Business Machines Corporation | System and method for electronic communication management |
| US7136846B2 (en) | 2001-04-06 | 2006-11-14 | 2005 Keel Company, Inc. | Wireless information retrieval |
| US7343372B2 (en) * | 2002-02-22 | 2008-03-11 | International Business Machines Corporation | Direct navigation for information retrieval |
| US7024360B2 (en) * | 2003-03-17 | 2006-04-04 | Rensselaer Polytechnic Institute | System for reconstruction of symbols in a sequence |
| US20050187913A1 (en) | 2003-05-06 | 2005-08-25 | Yoram Nelken | Web-based customer service interface |
| US8495002B2 (en) | 2003-05-06 | 2013-07-23 | International Business Machines Corporation | Software tool for training and testing a knowledge base |
| CN101657666B (zh) * | 2006-08-21 | 2011-05-18 | 西斜坡公用事业公司 | 管道修复安装的系统和方法 |
| KR101217524B1 (ko) * | 2008-12-22 | 2013-01-18 | 한국전자통신연구원 | 고립어 엔베스트 인식결과를 위한 발화검증 방법 및 장치 |
| US20100228538A1 (en) * | 2009-03-03 | 2010-09-09 | Yamada John A | Computational linguistic systems and methods |
| US9824684B2 (en) * | 2014-11-13 | 2017-11-21 | Microsoft Technology Licensing, Llc | Prediction-based sequence recognition |
| GB2580655A (en) * | 2019-01-21 | 2020-07-29 | Sonova Ag | Reducing a noise level of an audio signal of a hearing system |
| CN115440194B (zh) * | 2022-09-01 | 2025-05-13 | 成都知道创宇信息技术有限公司 | 违规音频检测方法、装置、电子设备及计算机可读存储介质 |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5105353A (en) * | 1987-10-30 | 1992-04-14 | International Business Machines Corporation | Compressed LR parsing table and method of compressing LR parsing tables |
| US4931928A (en) * | 1988-11-09 | 1990-06-05 | Greenfeld Norton R | Apparatus for analyzing source code |
| JP2841404B2 (ja) * | 1989-01-12 | 1998-12-24 | 日本電気株式会社 | 連続音声認識装置 |
| US4984178A (en) * | 1989-02-21 | 1991-01-08 | Texas Instruments Incorporated | Chart parser for stochastic unification grammar |
| US5054074A (en) * | 1989-03-02 | 1991-10-01 | International Business Machines Corporation | Optimized speech recognition system and method |
| US5033087A (en) * | 1989-03-14 | 1991-07-16 | International Business Machines Corp. | Method and apparatus for the automatic determination of phonological rules as for a continuous speech recognition system |
-
1990
- 1990-11-16 JP JP2311974A patent/JPH04182000A/ja active Granted
-
1993
- 1993-07-06 US US08/086,569 patent/US6058365A/en not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| US6058365A (en) | 2000-05-02 |
| JPH04182000A (ja) | 1992-06-29 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US10741170B2 (en) | Speech recognition method and apparatus | |
| US6058365A (en) | Speech processing using an expanded left to right parser | |
| Chen et al. | Advances in speech transcription at IBM under the DARPA EARS program | |
| US4977598A (en) | Efficient pruning algorithm for hidden markov model speech recognition | |
| US6163768A (en) | Non-interactive enrollment in speech recognition | |
| JP4414088B2 (ja) | 音声認識において無音を使用するシステム | |
| Haeb-Umbach et al. | Improvements in beam search for 10000-word continuous-speech recognition | |
| CN112542170B (zh) | 对话系统、对话处理方法和电子装置 | |
| JP2021501376A (ja) | 音声認識システム | |
| JP3459712B2 (ja) | 音声認識方法及び装置及びコンピュータ制御装置 | |
| US20040186714A1 (en) | Speech recognition improvement through post-processsing | |
| US20050149326A1 (en) | Speech recognition system and technique | |
| US5873061A (en) | Method for constructing a model of a new word for addition to a word model database of a speech recognition system | |
| JP2000075895A (ja) | 連続音声認識用n最良検索方法 | |
| CN112509560B (zh) | 一种基于缓存语言模型的语音识别自适应方法和系统 | |
| JP2004341520A (ja) | 音声認識方法 | |
| US20010002465A1 (en) | Speech recognition device implementing a syntactic permutation rule | |
| JP2003208195A5 (ja) | ||
| JP2871420B2 (ja) | 音声対話システム | |
| JPH09134191A (ja) | 音声認識装置 | |
| JPH0638197B2 (ja) | 連続音声認識装置 | |
| EP1160767B1 (en) | Speech recognition with contextual hypothesis probabilities | |
| JP2905686B2 (ja) | 音声認識装置 | |
| JP4661216B2 (ja) | 音声認識装置、方法、およびシステム | |
| JP3818154B2 (ja) | 音声認識方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| LAPS | Cancellation because of no payment of annual fees |