JPH09244688A - 音声認識方法 - Google Patents

音声認識方法

Info

Publication number
JPH09244688A
JPH09244688A JP8049899A JP4989996A JPH09244688A JP H09244688 A JPH09244688 A JP H09244688A JP 8049899 A JP8049899 A JP 8049899A JP 4989996 A JP4989996 A JP 4989996A JP H09244688 A JPH09244688 A JP H09244688A
Authority
JP
Japan
Prior art keywords
phoneme
environment
standard pattern
node
network
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP8049899A
Other languages
English (en)
Inventor
Tomokazu Yamada
智一 山田
Shigeki Sagayama
茂樹 嵯峨山
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NTT Inc
Original Assignee
Nippon Telegraph and Telephone Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nippon Telegraph and Telephone Corp filed Critical Nippon Telegraph and Telephone Corp
Priority to JP8049899A priority Critical patent/JPH09244688A/ja
Publication of JPH09244688A publication Critical patent/JPH09244688A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】 【課題】 環境依存音素標準パターンを利用した高精度
の認識を可能とする。 【解決手段】 環境独立の音素を終端記号とする文脈自
由文法とLRパーザを利用してネットワークを生成しな
がら標準パターンを決定すると共に、入力音声とHMM
の標準パターンとの照合をとりながらOne−Pass
サーチによりサーチを進め、HMMの標準パターンに環
境依存の音素標準パターンを用い、ネットワークの拡張
の際に各弧の音素を、前記環境依存の音素数だけ先のノ
ードへ伝搬させ、弧拡張の際に、先端ノード3で、LR
パーザで予測された音素P3 と、ノード3に到達した音
素系列P1 ,P2 とによってtriphoneモデルの
音素標準パターンを決定して、ノード3,4間の弧に設
定する。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】この発明は、隠れマルコフモ
デル(例えば中川聖一「確率モデルによる音声認識」電
子情報通信学会編(1988))と、一般化LR文脈解析アル
ゴリズム(例えばM.Tomita : "An Efficient Context-F
ree Parsing Algorithm for Natural Languages and it
s Applications ”, Carnegie-Mellon University(198
5)) と、One-Passサーチ・アルゴリズム(例えば J. Br
idle 他 :"An Algorithm For Connected Word Recogni
tion, ”ICASSP82 , pp. 899-902(1982)) とを用いて入
力音声を連続的に認識する方法に関する。
【0002】
【従来の技術】従来の音声認識において、LRパーザ
(文法解析機)を用いて、予め決められた文法にかなう
認識候補を探し、その認識候補の標準パターンと入力音
声との照合を行いながら認識を行う方法がある。また予
め決められたネットワークを用い、その一部について標
準パターンと入力音声との照合を行い、かつスコアの小
さいものを除き、処理量の増加を最小限にしながらサー
チを進め、最終的にスコアの最も高い候補を認識結果と
するOne−Passサーチ方法が知られている。
【0003】更に隠れマルコフモデル、一般化LRパー
ザ、One−Passアルゴリズムを統合した音声認識
の方法が知られている。この統合した認識方法としては
環境独立の音素による文脈自由文法からLRパーザを用
いてサブ・ネットワークを作成し、それらサブ・ネット
ワーク間の接合部分で環境依存の音素を考慮し、環境依
存の音素標準パターンを利用する方法(例えば伊藤克亘
他:「拡張LR構文解析法を用いた連続音声認識」信学
技報,SP90−74,49〜56頁)や、環境独立の
音素による文脈自由文法からLRパーザを用いて一つの
ネットワークを動的に作成し、環境独立の音素標準パタ
ーンを利用する方法があった。(例えば北研二他:「L
Rパーザ制御によるOne−Pass型連続音声認識ア
ルゴリズム」,信学技報、SP94−13(1994−
05)55〜62頁)。
【0004】効率の点ではサブ・ネットワークを用いず
に一つのネットワークで処理した方がよいし、音声認識
の精度の点では環境依存の音素標準パターンを利用した
方がよいが、両者を同時に利用できる方法はなかった。
【0005】
【発明が解決しようとする課題】この発明は、隠れマル
コフモデル、一般化LRパーザ、One−Passアル
ゴリズムを統合するに際し、一つのネットワークを使っ
て効率的に処理すると同時に、環境依存の音素標準パタ
ーンを利用することができ、認識率の高い音声認識方法
を提供することを目的とする。
【0006】
【課題を解決するための手段】この発明によれば、環境
依存の音素標準パターンを用い、ネットワークの各弧の
音素を、少くとも音素環境依存を考慮した数だけ先のノ
ードまでの各ノードへ伝搬させ、ネットワーク上で新た
に生成されたノードに対し、LRパーザによってそのノ
ードへの弧に設定すべきと予測された音素と、その弧の
ソース・ノードに蓄えられた過去の音素系列とによっ
て、その弧に設定すべき環境依存の音素標準パターンを
決定する。
【0007】
【発明の実施の形態】図1に、この発明の実施例を適用
した認識装置の構成を機能的に示す。入力端子1から入
力された音声は、特徴抽出部2においてディジタル信号
に変換され、更にLPCケプストラム分析された後、1
フレーム(例えば10ミリ秒)ごとに特徴パラメータに
変換される。この特徴パラメータは、例えばLPCケプ
ストラム係数である。
【0008】学習用音声データベースより、上記特徴ベ
クトルと同一形式で、隠れマルコフモデルの環境依存の
音素標準パターンを作り、標準パターンメモリ4に記憶
してある。認識対象の範囲を規定する、環境独立(環境
非依存)の音素を終端記号とする文脈自由文法から、L
Rパーザ用のテーブルを作り、LRテーブル5に記憶し
てある。
【0009】認識部3での処理のフローチャートを図2
に示す。1フレーム分の入力音声の特徴パラメータを読
み込み(S1 )、(毎フレームまたは数フレームごと
に)ネットワークを成長させ(S2 )、入力音声特徴パ
ラメータと標準パターンとのパターン照合を行ない(S
3 )、次のステップでも処理を進めるアクティブ・ノー
ドを決定してステップS1 に戻る(S4 )。このことを
入力される音声がなくなるまで繰り返す。入力される音
声がなくならなくても、パターン照合によって得られた
スコアから、何らかの条件により処理を打ち切ってもよ
い。
【0010】ネットワークはノードと弧によって構成さ
れ、最初は初期ノード一つだけが存在する。各ノード
は、LRパーザを用いて生成される仮説で、スタックの
内容が同一のものに対して一つが割り当てられ、対応づ
けられる。そのため、LRパーザによってそれ以降の処
理が同じになるものは、同一のノードに統合される(同
一のノードに弧が接続される)。ここではこれをマージ
・ノードと呼ぶ。各ステップでの照合結果に基づき、得
られたスコアの高いものを、次のステップでも処理を進
めるべきアクティブ・ノードとする。それ以外のノード
は、そのままネットワーク中に保持してもよいし、メモ
リの有効利用のために、捨ててもよい。このようにして
ネットワークを、環境独立の音素終端信号とする文脈自
由文法とLRパーザを利用して拡張しながらOne−P
assサーチによりサーチを進めてゆく。
【0011】図3を参照してこの発明の特徴部分である
ネットワークの生成(成長動作)を説明する。文脈自由
文法からは、無限の大きさのネットワークを作成可能な
ので、あらかじめネットワークの全体を作成しておけな
い場合が想定される。そこでネットワーク生成部では、
ネットワークの各アクティブ・ノードからLRパーザを
使って新たなノードを作成し、弧を伸ばす(ネットワー
クを成長させる)、といった動作を、有限個先の音素ま
でに限定する。ここでは一度に一つ音素を伸ばす場合で
説明する。図中、点線の上に示された記号は、LRパー
ザによって各ノード間に予測された環境独立の音素であ
る。ノード間に実線で示されているのがネットワークの
弧であり、この発明では環境依存の音素標準パターンが
設定される(図を見やすくするため、1−2,2−3,
5−6,6−3のノード間の弧は省略してある)。ここ
では、中心となる音素(C)の左側(L)及び右側
(R)の環境を考慮に入れた、いわゆるtriphon
eモデルの場合で説明し、L−C−Rと表記する。ノー
ドが設定されると、その前のノード間の弧に設定された
音素をその新ノードに伝搬させる。この例ではtrip
honeモデルの場合であるから、この前のノードまで
の各弧の音素を伝搬保持させる。
【0012】まず簡単な図3Aの場合で説明する。ノー
ド1〜3を生成済みのネットワークから、ノード3に対
してネットワークを成長させる場合を考える。LRパー
ザによって、ノード3から環境独立の音素P3 が予測さ
れ、新たなノード4で表されるスタックの状態に変化す
ることが分かったとする。ここで、ノード3に伝搬され
て蓄えられている過去の2音素系列の情報(P1 ,P2)
から、P1 、P2 、P 3 という3音素系列が得られる。
これをもとにノード3−4間の弧に、P1 −P 2 −P3
という環境依存の音素標準パターンを設定する。
【0013】ノード3がマージ・ノードである場合を図
3Bで説明する。この場合は、ノード3に伝搬されて蓄
えられた過去の2音素系列として、(P1 ,P2)と(P
4 ,P5)の2組が存在する。LRパーザによって新たに
予測された環境独立の音素P 3 との組み合わせにより、
ノード3−4間には、P1 −P2 −P3 とP4 −P5−
P3 を設定する二本の弧が必要であることが分かる。そ
して、音響的な整合性を確保するため、ノード3を二つ
に分割するか、ノード2からの弧にはP1 −P 2 −P3
の弧が、ノード6からの弧にはP4 −P5 −P3 が対応
してデータの受渡しがされるように制約を設ける。
【0014】処理量を削減するため、整合性を考慮しな
い方法も考えられる。この場合、得られる結果には誤差
が含まれる。ノード3までの過去の音素系列とノード3
−4間の新たな音素の組み合わせとして参照するのでは
なく、ノード4に必要な全音素系列、前記例ではP1 −
P2−P3 (及びP4 −P5 −P3 )を保持させて参照
してもよいし、不要な音素系列まで含めて最初のノード
から全て伝搬させて保持し、必要な部分のみを参照して
もよい。
【0015】最終的に、LRパーザ上で受理(acce
pt)された仮説は、一つのマージ・ノードとなる。全
ステップ終了時に、このマージ・ノードに最も高いスコ
アを伝搬した弧を遡ることにより、認識結果を得ること
ができる。音素の環境依存としてはtriphoneモ
デルに限らない、各ノードに伝搬保持させる音素数は、
環境依存標準パターンの音素数より少くとも1つ少ない
数とする。
【0016】
【発明の効果】仮に環境依存の音素を終端記号とするL
Rテーブルを用いた場合にマージ・ノードが少なく、文
法的には同一であるが複数に分れたままネットワークが
成長し、多数のパスが生じ、つまり多数の候補が生じ演
算量が多くなる。しかしこの発明では、前記環境依存の
音素を終端記号とするLRテーブルを用いると分散して
しまうマージ・ノードを、環境独立(環境非依存)の音
素を終端記号としたLRテーブルを用いることで回避
し、マージ・ノードで必要な数だけ伝搬されて来た音素
を用いて環境依存の音素標準パターンを決定し、新たに
作成したノードの弧に設定しているため、マージ効率の
高いネットワークを動的に作成しながら、環境依存の音
素標準パターンを利用した高精度の認識処理が可能であ
る。
【図面の簡単な説明】
【図1】本発明の実施例を示すブロック図である。
【図2】本発明の実施例を示す認識処理部のフローチャ
ートである。
【図3】本発明の実施例で、環境依存の音素標準パター
ンを、ネットワークの弧に設定する方法を説明する図で
ある。

Claims (1)

    【特許請求の範囲】
  1. 【請求項1】 入力音声を特徴パラメータ時系列とし、 環境独立の音素を終端記号とする文脈自由文法とLRパ
    ーザを利用してネットワークを生成しながら音素標準パ
    ターンを決定すると共に、 上記入力音声の特徴パラメータ時系列と隠れマルコフモ
    デルの上記標準パターンとの照合をとりながらOne−
    Passサーチによりサーチを進めて類似尤度の高い候
    補を認識結果とする音声認識方法において、 上記隠れマルコフモデルの標準パターンに環境依存の音
    素標準パターンを用い、 上記ネットワークの各弧の音素を少くとも音素環境依存
    を考慮した数だけ、先のノードまでの各ノードへ伝搬さ
    せ、 上記ネットワークの拡張の際に先端ノードで、LRパー
    ザによって新たに予測された音素と、そのノードに到達
    した弧に伝搬されてきた音素系列とによって環境依存の
    音素標準パターンを決定し、ネットワーク上の弧に設定
    することを特徴とする音声認識方法。
JP8049899A 1996-03-07 1996-03-07 音声認識方法 Pending JPH09244688A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP8049899A JPH09244688A (ja) 1996-03-07 1996-03-07 音声認識方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP8049899A JPH09244688A (ja) 1996-03-07 1996-03-07 音声認識方法

Publications (1)

Publication Number Publication Date
JPH09244688A true JPH09244688A (ja) 1997-09-19

Family

ID=12843873

Family Applications (1)

Application Number Title Priority Date Filing Date
JP8049899A Pending JPH09244688A (ja) 1996-03-07 1996-03-07 音声認識方法

Country Status (1)

Country Link
JP (1) JPH09244688A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100557650B1 (ko) * 2002-09-25 2006-03-10 주식회사 케이티 문맥 종속 음소 지속시간 정보를 이용한 음성인식 방법
CN112259089A (zh) * 2019-07-04 2021-01-22 阿里巴巴集团控股有限公司 语音识别方法及装置

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100557650B1 (ko) * 2002-09-25 2006-03-10 주식회사 케이티 문맥 종속 음소 지속시간 정보를 이용한 음성인식 방법
CN112259089A (zh) * 2019-07-04 2021-01-22 阿里巴巴集团控股有限公司 语音识别方法及装置

Similar Documents

Publication Publication Date Title
CN108305634B (zh) 解码方法、解码器及存储介质
US5581655A (en) Method for recognizing speech using linguistically-motivated hidden Markov models
JP3834169B2 (ja) 連続音声認識装置および記録媒体
US7035802B1 (en) Recognition system using lexical trees
Kenny et al. A*-admissible heuristics for rapid lexical access
JP3459712B2 (ja) 音声認識方法及び装置及びコンピュータ制御装置
JP2000075895A (ja) 連続音声認識用n最良検索方法
US6058365A (en) Speech processing using an expanded left to right parser
JPH02273795A (ja) 連続音声認識方法
JP2841404B2 (ja) 連続音声認識装置
KR100930714B1 (ko) 음성인식 장치 및 방법
JP3634863B2 (ja) 音声認識システム
JP2003208195A (ja) 連続音声認識装置および連続音声認識方法、連続音声認識プログラム、並びに、プログラム記録媒体
US7464033B2 (en) Decoding multiple HMM sets using a single sentence grammar
JPH1124693A (ja) 音声認識装置
JP2000056795A (ja) 音声認識装置
JPH09244687A (ja) 音声認識方法
JP2000267693A (ja) 音声処理装置及び索引作成装置
JPH1097275A (ja) 大語彙音声認識装置
JP3818154B2 (ja) 音声認識方法
JP2738403B2 (ja) 音声認識装置
JPH08202384A (ja) 音声認識方法及び装置
JPH0962290A (ja) 音声認識装置
Thomae et al. A One-Stage Decoder for Interpretation of Natural Speech
JPH10198392A (ja) 音声認識方法