JPH07506198A - 複合エキスパート - Google Patents
複合エキスパートInfo
- Publication number
- JPH07506198A JPH07506198A JP5511977A JP51197793A JPH07506198A JP H07506198 A JPH07506198 A JP H07506198A JP 5511977 A JP5511977 A JP 5511977A JP 51197793 A JP51197793 A JP 51197793A JP H07506198 A JPH07506198 A JP H07506198A
- Authority
- JP
- Japan
- Prior art keywords
- hypothetical
- score
- solution
- true
- expert
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 239000002131 composite material Substances 0.000 title description 13
- 238000000034 method Methods 0.000 claims description 29
- 238000012549 training Methods 0.000 claims description 13
- 238000012360 testing method Methods 0.000 claims description 11
- 238000007476 Maximum Likelihood Methods 0.000 claims description 8
- 238000009825 accumulation Methods 0.000 claims 1
- 239000004575 stone Substances 0.000 claims 1
- 230000006870 function Effects 0.000 description 41
- 241001417093 Moridae Species 0.000 description 3
- 241000252794 Sphinx Species 0.000 description 2
- 150000001875 compounds Chemical class 0.000 description 2
- 230000001186 cumulative effect Effects 0.000 description 2
- 238000011156 evaluation Methods 0.000 description 2
- 239000012634 fragment Substances 0.000 description 2
- 238000012067 mathematical method Methods 0.000 description 2
- 238000012545 processing Methods 0.000 description 2
- 238000013459 approach Methods 0.000 description 1
- 238000007796 conventional method Methods 0.000 description 1
- 230000003247 decreasing effect Effects 0.000 description 1
- 230000005284 excitation Effects 0.000 description 1
- 239000000284 extract Substances 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 238000012804 iterative process Methods 0.000 description 1
- 238000007619 statistical method Methods 0.000 description 1
- 238000002945 steepest descent method Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
- G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
- G10L15/197—Probabilistic grammars, e.g. word n-grams
Landscapes
- Engineering & Computer Science (AREA)
- Artificial Intelligence (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Machine Translation (AREA)
Abstract
(57)【要約】本公報は電子出願前の出願データであるため要約のデータは記録されません。
Description
【発明の詳細な説明】
複合エキスパート
発明の背景
本発明は、音声認識に関するものあり、より詳細には、連続的な音声(話音)を
解析する複数のシステム或いは比較情報源の各々により与えられるスコアに対し
て与えるべき重要性或いは相対重み(relative weight)を調整
する方法に関するものである。スコアを生成するシステム或いは情報源を、以下
、”エキスパート”と称する。
本技術分野の当業者により理解されているように、文脈上の知識(contex
tualknowledge)を適用し、或いは、利用することにより、音響的
な音声アナライザによる単語認識の正確さを、向上させることが可能である。言
い換えれば、最も確実そうな候補を、予め決められた単語モデルの5當から選択
し、未知の音声セグメントに適用することは、与えられた候補が、解析されてい
る音声のシーケンスにおける先行する単語に、適切に続いていることが確実であ
るかどうかを考慮することにより、向上され得る。さらに、たとえば、まず、先
行する単語のみを利用し、さらに、2或いは3の先行する単語を利用することに
より、多重言語的システム(multiple linguistic sys
tem)或いは多重言語的解析を適用することができる。本発明に関連するこれ
らシステムの各々は、”エキスパートであると考えられる。さらに、人力音声の
音響的な解析を実行する種々の方法が存在するため、たとえば、周知のスフィン
クス認識システム(Sphinx recognizer 5yste+++)
により利用される3つのいわゆるコードブックなど、一つ以上の音響的なエキス
パートが存在し得る。一般には、このようなエキスパートの各々は、未知の音声
が認識装置の5當の与えられたモデルに整合する最尤性(likelihood
)を示すスコアを戻すことが従来からなされている。これらスコアは、一般に、
マイナスログの確率として示される。
いくつかのエキスパートシステムについてのスコアを組合せ、全体としての整合
の最尤性を達成するためには、異なるエキスパートについての相対重要性(re
lative importance) 、即ち重み付けを決定するための評価
がなされなければならない。この重み付けは、しばしば、本質的には、任意に、
システム設計者の経験に基づいて決定される。スコアのそれぞれが、良好で、独
立した確率評価となる場合には、これらを、単純に掛は算することにより結合す
ることができる。しがしながら、一般的には、これらスコアは、独立してはおら
ず、むしろ、相互に関連している。
独立した単語の認識装置の場合には、認識すべき種々の個々の単語の音響的なサ
ンプルを含むトレーニングデータベースが存在するならば、相対重みを改善する
ために統計的な方法を適用することができる。しかしながら、理解されるように
、独立した単語の前後関係で生成された発声サンプルは、連続的な音声(話合)
認識に対して最も正確とはならない。なぜなら連続した話合においては、フレー
ズ内で発声された単語の間の相互調音或いは相互作用ががなり存在するがらであ
る。しかしながら、有用な5曽の中に予期される個々の単語の適切な順列(組合
せ)をすべて包含させるためには、データベースは殆ど限界がなくなってしまう
ので、フレーズの語曽を形成することは実現不可能である。したがって、認識装
置の5會は、必然的に、個々の単語から形成される必要がある。
本発明は、連続的な音声認識装置における多重的なエキスパートにより生成され
るスコアに与えるべき相対重みを調整する方法に関するものであり、この目的の
ためのトレーニングデータが、分離した単語というよりもむしろ多重的な単語フ
レーズの形態をなして得られる。しかしながら、多重的な単語フレーズの文脈に
おいて、真である個々の単語は、真である多重的な単語の仮定解(Hypoth
eses)の一部とも、また、偽である多重的な単語の仮定解の一部ともなり得
るため、この問題に数学的な方法(numerical method)を適用
することは、直接的ではなく、また自明ではない。
a;1述【、たように、認識すべきフレーズの諸量を形成することは、実現不可
能であるが、むしろ、連続的な音声(話合)認識においてすら、認識装置は、本
質的には、甲語毎に、或いは、音ごとに、それを基礎として処理がなされるよう
になっており、システム全体で使用されるエキスパートの各々は、未知の音声セ
グメントの各々と、システムの諸量における単語モデルとの間の整合の最尤性を
表すスコアを与える。このような状況において、“単語”という語は、日本人の
話す言語を形成するモーラ、音素、或いは、英語のシラブルなどのサブワード片
(フラグメント)を含む包括的な意味で用いられる。
本発明にかかる方法は、その大部分を以下のような認識に基づいている。即ち、
多重エキスパートにより提起された複数の多重的な単語の仮定解の累積されたス
コアを比較し、解析することができる目的関数を推論することができること、及
びいくつかのエキスパートについての相対重み係数は、この目的関数の成果を最
大にするようにシステマティックに調整されることができ、それにより、システ
ムの認識精度を向上させることができるという認識である。
発明の概要
本発明にかかる方法においては、連続的な音声認識装置において音響学的なエキ
スパートおよび言語学的なエキスパートにより生成されるそれぞれのスコアに与
えられる相対重み係数が、多重的な単語フレーズ(multiple word
phrases)内で認識すべき単語を利用した音声トレーニングデータを用
いて調整される。多重用語フレーズは、音響学的なエキスパートに供され、それ
により、各フレーズごとに、各々が対応する累積されたスコアを有する複数の多
重的な単語の仮定解が決定される。この仮定解は、言語学的なエキスパートに供
され、各仮定解ごとに、対応する累積されたスコアが決定される。累積された音
響学的なスコアおよび言語学的なスコアは、各仮定解ごとに、初期的に任意に選
択された重み係数を用いて、結合され、結合された仮定解のスコアが、それぞれ
得られる。供されたフレーズに対して、いずれかの仮定解力慎である場合に、目
的関数は、真の仮定解の組み合わされたスコアと、少なくとも一つの偽の仮定解
の組み合わされたスコアとの間の相違の関数として可変的な値を有するように算
出される。目的関数の値は、真の仮定解を生成する全てのフレーズにわたって累
積され、重み係数の調整のベクトル方向が算出され、累積された目的関数の値が
改善される。次いで、このベクトル方向における係数の調整がなされる。方向を
決定するステップおよび調整ステップは、係数ごとの最善の値をめるために繰り
返されることが好ましい。
図面の簡単な説明
図1は、本発明にかかる方法を示すフローチャートであり、連続音声認識装置に
おける複数のエキスパートにより生成されたそれぞれのスコアに与えるべき比較
重み係数の調整を説明する図である。
好適な実施例の説明
前述したように、有効な語’1(effective vocabulary)
が非常に多いため、音響学的な音声アナライザに、多重的な単語フレーズのモデ
ルを設けることは実際的ではない。むしろ、音響学的なエキスパートは、必然的
に、単語ごとに基づいて、或いは、モーラ(zora)ごとに基づいて実行され
、そのDllの中の個々のモデルに、未知の音声の各々を整合させるべく試みる
必要がある。確実そうな候補だけを、各セグメントに対して選択することにより
、音響学的なエキスパートは、各単語ごとの候補の順列(permutatio
n)に基づいて複数の多重的な単語の仮定解(hypothesis)を生成す
ることができる。最も確実そうなフレーズを、多重的な(multiple)仮
定解から選択することは、音響学的なスコアをそのまま用いることたけではなく
、少なくとも一つの言語学的なエキスパートにより提供されるスコアを用いるこ
とによりなされる。本発明のある実施態様によれば、音響学的スコアおよび言語
学的スコアに適用すべき相対重み(relative weighting)は
、多重的な単語フレーズにおいて認識すべき単語を利用するトレーニングデータ
に基づいて調整される。
本発明にかかる方法は、複合関数(composite function)を
利用し、トレーニングデータ内の発音人力(input utterance)
から得られた仮定解を解析している。
ここに例示として記載された実施例は、日本語の連続音声アナライザーに基づい
たものであり、したがって、仮定解の各々は、モーラのシーケンスとなる。複合
関数は、仮定解が正しいこと、すなわち、仮定解が、正しいモーラのシーケンス
であることの最尤性(likelihood)の尺度(measure)である
複合スコアを提供する。
前述したように、個々のエキスパート出力は、一般に、マイナスログの確率とし
て与えられる。
特に、ここに例示された実施例において、音響学的なエキスパートの出力および
言語学的なエキスパートの出力は、同様に取り扱われ、したがって、複合関数は
、”同質(homogeneous)”なものとして示される。他の有用な複合
関数は、後述する。この例において使用された特定の複合関数は、次のようであ
る。
ここに、mは、仮定解のモーラ、Pe (m)は、モーラmを観察するエキスパ
ートeについて推論された確率、Wは、重みのベクトル、Weは、あるエキスパ
ートeに対する重みである。
本発明の重要な目的は、全体としての認識の精度を最適化するラムダの組を見出
し、決定するために数学的な方法を用いることにある。これを達成するために、
本発明にかかる方法は、目的関数を利用し、その最小化が精度に関係している。
この目的関数は、複合関数か、同一のテストフレーズを表現し、或いは、同一の
テストフレーズにより得られる真の仮定解と偽の仮定解とを識別する程度を測る
(measure)ことを目的としている。
III用される特定の目的関数は、真の仮定解と偽の仮定解とを比較する。トレ
ーニングデータを用いてラムダを調整する際に、汽の仮定解を生成するテストフ
レーズのみが利用される。真の仮定解を生成しないテストフレーズは、無視され
る。
さらに、特に例示された実施例において、真の仮定解は、他の偽の仮定解の一つ
と比較される。
この一つの偽の仮定解は、複合関数にしたがって、偽の仮定解のうち最も良いス
コアを有するものとして選択される。以下、この選択された偽の仮定解は、これ
か偽の仮定解の中で最も良いスコアを有しているため、最も困難な、すなわち、
最も真の解と混同しやすい偽であるという意味で、最も偽(worst 1nn
correct)と称される。実際に、個々のテストフレーズに関して、最も偽
であるものが、真の仮定解よりも良いスコアを有する可能性すらある。本発明の
調整関数或いは学習関数は、ラムダを調整し、真の仮定解を生成するテストフレ
ーズのグループ全てに対して、最も偽の仮定解に対する真の仮定解の識別性を向
上させる。ある目的関数は、次式により示される。
SmnnthcdErrorRate(11/ )=CFは、上に定義したC
F homogeneousなどの複合関数rcorrectJは、特定のフレ
ーズに対する真の仮定解、rWorstlncorrectJは、この発音テス
トについて最も真のスコアに近い、或いは遠い、すなわち、”最も偽”の仮定解
、[NpHrasesJは、トレーニングに用いられるデータセットのフレーズ
数である。
本技術分野において理解されているように、ングモイド関数などの非線形関数を
用いることは、極端なケースが、全ての結果にあまりに大きな影響を与えること
を防止するのに有用である。
ラムダ値を最適化するために用いられる技法は、最急降下法(gradient
descent)を形成することである。この手順は、基本的に、ある特定の
任意に選択されたラムダ配置により開始し、そのラムダの組合せにおける目的関
数の勾配を見出し、勾配方向に、少しのステップを移動することによる。これが
繰り返されて、局地的な最小値が見出される。
目的関数の勾配を見出すために、複合関数の勾配を見出すことか必要である。
これは、次式のように決定される。
前述したように、この方法は、多重的な単語テスト或いはトレーニングフレー真
の仮定解および最も偽の仮定解についても複合関数の勾配を用いて、コスト即ち
、目的関数の勾配が、本質的には、次式のように算出され得る。
目的関数の勾配は、ラムダの調整のベクトル方向、即ち、累積された目的関数の
値を改善する係数を与える。このようなベクトル方向を算出するごとに、これに
続いて、この方向におけるステップの変更がなされる。最急降下法において従来
からなされているように、これは繰り返され、最小値が見つけたされる。マルチ
プルエキスパート音声認識装置における係数に適用された、最急降下法の特定の
コンピュータの実行(implementation)は、前に特定したマイク
ロフィッシュの付録に与えられている。この特定の実施例において、実際に、ス
テップサイズは、周知のサーチ技法にしたがって適用可能である。これは、小さ
な値で開始し、このサイズのステップが、目的関数を損ない始めるまで大きくな
り、次いで、最小値がシークされるにしたかって、ステップサイズが減少させら
れる。
前述したように、本発明にかかる方法は、マルチプルエキスパートにより提起さ
れた複数の多重的な単語の仮定解の累積されたスコアを比較し、解析することか
できる目的関数を推論することができるという認識に、その大部分が基づいてい
る。実際には、この認識は、重み係数を改善する反復的プロセスにより具体化さ
れている。このようなプロセス或いは方法は、図1に示されている。
前述したように、記載されてきた特定の例は、全てのエキスパート、音響学的ズ
の収集成いはリストを利用している。このリストは、ブロック11で示されるよ
うに初期化される。このリストは、ブロック13に示されるように、引き続いて
処理され、ブロック15に示されるように、各フレーズは、順に、音響学的なエ
キスパートに適用され、複数の多重的な単語の仮定解を生成する。仮定解の各々
に関連して、音響学的なスコアは、仮定群内の単語(words)に対応してい
る。
ブロック17に示されるように、仮定解は、順に、少なくとも一つの言語学的な
エキスパートに供され、それにより、仮定解の各々に対して、対応する言語学的
なスコアが生成される。
ブロック19に示されるように、選択された複合関数は、仮定解の各々に与えら
れ、現在のラムダ或いは重み値を用いて、それぞれのコスト値が得られる。与え
られたテスト或いはトレーニングフレーズに対して、全ての仮定解が真ではなか
った場合に、全ての対応するスコアはトレーニング手続(procedure)
において利用されない。むしろ、そのフレーズについての値は無視され、ブロッ
ク21に示されるように、処理のために、新たなフレーズが選択される。
真の仮定解を生成するテストフレーズに対して、最も偽の、即ち最も混同しやす
い偽の仮定解も特定される。これは、最も高いスコアを備えた真ではない仮定解
となる。このステップは、ブロック23に示されている。次いで、目的関数が、
ブロック25に示されるように、真の仮定解および最も偽の仮定解に、与えられ
、ブロック27に示されるように、目的関数の値が、次に続くテスト或いはトレ
ーニングフレーズにわたって累積される。ひとたび、ブロック29に示されるよ
うに、全てのテストフレーズが処理されると、ブロック31に示されるように、
累積コスト(cumultive cost)関数のベクトル勾配が決定される
。次いで、ブロック33に示されるように、ラムダが、その方向にステップイン
され、ブロック35に示されるように、最小値が見出されるまで、この処理が、
反復して繰り返される。この点で、ラムダ或いは重み係数は、最適値に調整され
、この最適値により、与えられた音響学的なエキスパートの特性および言語学的
なエキスパートの特性の組に対する最良の認識結果が生成される。
他の実施例
tものおよび言語学的なものの双方が、本質的に同様に取り吸われるといつX啄
で、同質的な例である。他のアプローチでは、音響学的なエキスパートと言語学
的なエキスパートとが幾分異なって取り扱われるマルコフモデルにより近い目的
関数を用いている。この場合、複合関数は次式のように表される。
Nmhrs NEJIDenS
であるので、音声以外のエキスパートeについて多くの音声認識システムにおい
て、ラムダを制限して(constrain) 、それらの合計か1になるよう
にするのが一般的である。特に、“マルコフ”システムにおいて、ラムダを確率
として解釈することができ、その場合に、それらは合計が1になるばかりでなく
、負ではない。同質的なシステムにおいては、この解釈は不可能であるか、ラム
ダの金言1か1になることをめ、ゼロに収束し、或いは、無限大に発散すること
を防止することか望ましい。これは、次の2つの方法によって達成される。1つ
には、ラムダの一つを1マイナス他の合計にするように定義することであり、も
う1つは、コスト関数に、ラムダの一つと全体との間の相違(発散)に依存する
項(term>を加えることである。これらのうちの前者は、比較的直接的であ
るか、データセットをめる際に、勾配(grads)の算出か複雑である。後者
の方法は、独立して計算された項にトレーニングデータを加える。各コスト関数
に以下の式が加えられる。
ここに、eは、関連するエキスパート(すなわち、同質的な場合には全てのエキ
スパート、マルコフケースではLMエキスパート)にわたって変動する、ベータ
は、制限(constraint)がどのくらい重要であるかを制御する重み付
は項である。
この新たな項の勾配は、次式のように表される。
前述したコスト関数の一つの合計である目的関数を考えた場合に、その勾配は、
上に算出された対応する勾配(grad)とr BetaCost Jの勾配と
の合計となる。目的関数を最小化することは、1に近い合計を有し、認識に際し
て良好なラムダ値に向けられている。
以上の説明から、本発明のいくつかの目的が解決され、他の有利な結果が達成さ
れることが理解されるであろう。
本発明の範囲を逸脱することなく、上述した構成に種々の変更を加えることが可
能であり、上述した説明および添付図面に示された全ての事項は、例示として解
釈され、発明の範囲を制限するものではないことに留意すべきである。
図面
図1
Claims (7)
- 1.連続的な音声認識装置において生成されるスコアに、それぞれ与えられる相 対重み係数を調整する方法であって、前記音声認識装置が、音響学的なエキスパ ートと言語学的なエキスパートとを含む複数のエキスパートを有し、前記音響学 的なエキスパートおよび言語学的なエキスパートが、システムの語彙から仮定さ れた各単語に対するそれぞれのスコアを生成するように構成され、前記方法が、 多重的な単語フレーズ内で認識すべき単語を用いて連続的な音声トレーニングデ ータを得て、 前記多重的な単語フレーズを、少なくとも一つの音響学的エキスパートに供し、 それにより、各フレーズごとに、各々が、対応する累積された音声的なスコアで あって、整合の最尤性(likelihood)を示す音響学的スコアを有する 複数の多重的な単語の仮定解を決定し、 前記仮定解を、少なくとも一つの言語学的なエキスパートに供し、それにより、 各仮定形ごとに、整合の最尤性を示す対応する累積された言語学的スコアを決定 し、 各仮定解に対して、初期的に任意に選択された重み係数を用いて、前記累積され た音響学的スコアおよび言語学的スコアを組み合わせ、それにより、それぞれ、 組み合わされた仮定解スコアを得て、 供されたフレーズの各々ごとに、何れかの仮定解が真であることを決定し、真の 仮定解が存在する場合に、真の仮定解の組み合わされたスコアと、少なくとも一 つの偽の仮定解の組み合わされたスコアとの間の相違の関数として可変的な値を 有する目的関数を算出し、 少なくとも一つの真の仮定解を生成する全てのフレーズにわたって、目的関数の 値を累積し、 累積された目的関数の値を改善する前記係数を調整するベクトル方向を算出し、 前記方向に、前記係数を調整することを特徴とする方法。
- 2.仮定解における前記一つの偽の仮定解が、最善のスコアを有し、かつ、真の 仮定解ではないことを特徴とする請求項1に記載の方法。
- 3.前記目的関数が、全ての単語及び複数のエキスパートにわたって、各単語ご との重み付けられたスコアを合計したものに対応することを特徴とする請求項1 に記載の方法。
- 4.前記目的関数の値の累積が、真の仮定解についての目的関数の値と、最善の スコアを有し、かつ、真の仮定解ではない仮定解についての目的関数の値との間 の差異を全てのテストフレーズにわたって合計したものに対応することを特徴と する請求項3に記載の方法。
- 5.合計の前に、差異の各々に対して、シグモイド関数が与えられることを特徴 とする請求項4に記載の方法。
- 6.前記シグモイド関数が、 Sig(x)=(1/1+e)−x により定義されることを特徴とする請求項5に記載の方法。
- 7.連続的な音声認識装置において生成されるスコアに、それぞれ与えられる相 対重み係数を調整する方法であって、前記音声認識装置が、音響学的エキスパー トと言語学的エキスパートとを含む複数のエキスパートを有し、前記音響学的エ キスパートおよび言語学的エキスパートが、システムの語彙から仮定された各単 語に対するそれぞれのスコアを生成するように構成され、前記方法が、多重的な 単語フレーズ内で認識すべき単語を用いて連続的な音声トレーニングデータを得 て、さらに、 (a)前記多重的な単語フレーズを、少なくとも一つの音響学的エキスパートに 供し、それにより、各フレーズごとに、各々が、対応する累積された音響学的ス コアであって、整合の最尤性を示す音響学的スコアを有する複数の多重的な単語 仮定解を決定し、 (b)前記仮定解を、少なくとも一つの言語学的エキスパートに供し、それによ り、各仮定解ごとに、整合の最尤性を示す対応する累積された言語学的スコアを 決定し、 (c)各仮定整に対して、初期的に任意に選択された重み係数を用いて、前記累 積された音響学的スコアおよび言語学的スコアを組合せ、それにより、それぞれ 、組み合わされた仮定解スコアを得て、 (d)供されたフレーズの各々ごとに、何れかの仮定解が真であることを決定し 、真の仮定解が存在する場合に、真の仮定解の組み合わされたスコアと、少なく とも一つの偽の仮定解の組み合わされたスコアとの間の相違の関数として可変的 な値を有する目的関数を算出し、 (e)少なくとも一つの真の仮定解を生成する全てのフレーズにわたって、目的 関数の値を累積し、 (f)累積された目的関数の値を改善する前記係数を調整するベクトル方向を算 出し、 (g)前記方向に、前記係数を調整するステップを備え、前記ステップ(a)な いし(g)を操り返すことを特徴とする方法。
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US812,581 | 1985-12-23 | ||
| US07/812,581 US5280563A (en) | 1991-12-20 | 1991-12-20 | Method of optimizing a composite speech recognition expert |
| PCT/US1992/011375 WO1993013519A1 (en) | 1991-12-20 | 1992-12-18 | Composite expert |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH07506198A true JPH07506198A (ja) | 1995-07-06 |
Family
ID=25210032
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP5511977A Pending JPH07506198A (ja) | 1991-12-20 | 1992-12-18 | 複合エキスパート |
Country Status (5)
| Country | Link |
|---|---|
| US (1) | US5280563A (ja) |
| EP (1) | EP0617827B1 (ja) |
| JP (1) | JPH07506198A (ja) |
| DE (1) | DE69229124T2 (ja) |
| WO (1) | WO1993013519A1 (ja) |
Families Citing this family (25)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0559349B1 (en) * | 1992-03-02 | 1999-01-07 | AT&T Corp. | Training method and apparatus for speech recognition |
| US5546499A (en) * | 1994-05-27 | 1996-08-13 | Kurzweil Applied Intelligence, Inc. | Speech recognition system utilizing pre-calculated similarity measurements |
| CA2126380C (en) * | 1993-07-22 | 1998-07-07 | Wu Chou | Minimum error rate training of combined string models |
| JP3311460B2 (ja) * | 1994-01-28 | 2002-08-05 | 富士通株式会社 | 音声認識装置 |
| US5677991A (en) * | 1995-06-30 | 1997-10-14 | Kurzweil Applied Intelligence, Inc. | Speech recognition system using arbitration between continuous speech and isolated word modules |
| US5794196A (en) * | 1995-06-30 | 1998-08-11 | Kurzweil Applied Intelligence, Inc. | Speech recognition system distinguishing dictation from commands by arbitration between continuous speech and isolated word modules |
| US5880966A (en) * | 1995-12-14 | 1999-03-09 | Xynetix Design Systems, Inc. | Apparatus using scoring advisors having outputs combined on a back plane for evaluating designs |
| US6151575A (en) * | 1996-10-28 | 2000-11-21 | Dragon Systems, Inc. | Rapid adaptation of speech models |
| US6122613A (en) * | 1997-01-30 | 2000-09-19 | Dragon Systems, Inc. | Speech recognition using multiple recognizers (selectively) applied to the same input sample |
| US6260013B1 (en) * | 1997-03-14 | 2001-07-10 | Lernout & Hauspie Speech Products N.V. | Speech recognition system employing discriminatively trained models |
| US6490555B1 (en) | 1997-03-14 | 2002-12-03 | Scansoft, Inc. | Discriminatively trained mixture models in continuous speech recognition |
| US6212498B1 (en) * | 1997-03-28 | 2001-04-03 | Dragon Systems, Inc. | Enrollment in speech recognition |
| US6167377A (en) * | 1997-03-28 | 2000-12-26 | Dragon Systems, Inc. | Speech recognition language models |
| US6076056A (en) * | 1997-09-19 | 2000-06-13 | Microsoft Corporation | Speech recognition system for recognizing continuous and isolated speech |
| US20020099545A1 (en) * | 2001-01-24 | 2002-07-25 | Levitt Benjamin J. | System, method and computer program product for damage control during large-scale address speech recognition |
| US7444284B1 (en) | 2001-01-24 | 2008-10-28 | Bevocal, Inc. | System, method and computer program product for large-scale street name speech recognition |
| EP1466318B1 (de) * | 2002-01-17 | 2006-08-30 | Siemens Aktiengesellschaft | Spracherkenner und betriebsverfahren für einen solchen |
| US20040193412A1 (en) * | 2003-03-18 | 2004-09-30 | Aurilab, Llc | Non-linear score scrunching for more efficient comparison of hypotheses |
| DE102004029873B3 (de) * | 2004-06-16 | 2005-12-29 | Deutsche Telekom Ag | Verfahren und Vorrichtung zur intelligenten Eingabekorrektur für automatische Sprachdialogsysteme |
| EP1696198B1 (en) * | 2005-02-28 | 2014-07-16 | Saab Ab | Method and system for fire simulation |
| US8255216B2 (en) * | 2006-10-30 | 2012-08-28 | Nuance Communications, Inc. | Speech recognition of character sequences |
| US8239200B1 (en) * | 2008-08-15 | 2012-08-07 | Google Inc. | Delta language model |
| TWI377560B (en) * | 2008-12-12 | 2012-11-21 | Inst Information Industry | Adjustable hierarchical scoring method and system |
| US8838449B2 (en) * | 2010-12-23 | 2014-09-16 | Microsoft Corporation | Word-dependent language model |
| US10304440B1 (en) * | 2015-07-10 | 2019-05-28 | Amazon Technologies, Inc. | Keyword spotting using multi-task configuration |
Family Cites Families (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4741036A (en) * | 1985-01-31 | 1988-04-26 | International Business Machines Corporation | Determination of phone weights for markov models in a speech recognition system |
| US4926488A (en) * | 1987-07-09 | 1990-05-15 | International Business Machines Corporation | Normalization of speech by adaptive labelling |
-
1991
- 1991-12-20 US US07/812,581 patent/US5280563A/en not_active Expired - Lifetime
-
1992
- 1992-12-18 WO PCT/US1992/011375 patent/WO1993013519A1/en not_active Ceased
- 1992-12-18 EP EP93903391A patent/EP0617827B1/en not_active Expired - Lifetime
- 1992-12-18 DE DE69229124T patent/DE69229124T2/de not_active Expired - Fee Related
- 1992-12-18 JP JP5511977A patent/JPH07506198A/ja active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| DE69229124T2 (de) | 1999-09-16 |
| EP0617827A4 (en) | 1995-12-13 |
| WO1993013519A1 (en) | 1993-07-08 |
| DE69229124D1 (de) | 1999-06-10 |
| EP0617827A1 (en) | 1994-10-05 |
| EP0617827B1 (en) | 1999-05-06 |
| US5280563A (en) | 1994-01-18 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| McAuliffe et al. | Montreal forced aligner: Trainable text-speech alignment using kaldi. | |
| US5280563A (en) | Method of optimizing a composite speech recognition expert | |
| Schwartz et al. | Context-dependent modeling for acoustic-phonetic recognition of continuous speech | |
| EP0635820B1 (en) | Minimum error rate training of combined string models | |
| US8532991B2 (en) | Speech models generated using competitive training, asymmetric training, and data boosting | |
| CN112349289A (zh) | 一种语音识别方法、装置、设备以及存储介质 | |
| KR20050082253A (ko) | 모델 변이 기반의 화자 클러스터링 방법, 화자 적응 방법및 이들을 이용한 음성 인식 장치 | |
| Gholamdokht Firooz et al. | Spoken language recognition using a new conditional cascade method to combine acoustic and phonetic results | |
| Reynolds et al. | Automatic language recognition via spectral and token based approaches | |
| Bisikalo et al. | Precision Automated Phonetic Analysis of Speech Signals for Information Technology of Text-dependent Authentication of a Person by Voice. | |
| Thamburaj et al. | Automatic speech recognition based on improved deep learning | |
| Wang et al. | A multi-space distribution (MSD) approach to speech recognition of tonal languages. | |
| Chetouani et al. | Neural predictive coding for speech discriminant feature extraction: The DFE-NPC. | |
| Shaikh Naziya et al. | Speech recognition system—a review | |
| KR100327486B1 (ko) | 스테이트별 가중치를 적용한 음성 인식 장치 및 방법 | |
| Golda Brunet et al. | Transcription correction using group delay processing for continuous speech recognition | |
| Savchenko et al. | Optimization of gain in symmetrized itakura-saito discrimination for pronunciation learning | |
| Schnell et al. | Neural VTLN for Speaker Adaptation in TTS. | |
| Bacchiani et al. | Optimization of time-frequency masking filters using the minimum classification error criterion | |
| Swarnamughi et al. | Enhanced Machine Learning Framework for English Speaking Assessment: Addressing Accent and Speech Variability Through BiLSTM-Transformer Architecture | |
| JPH10254485A (ja) | 話者正規化装置、話者適応化装置及び音声認識装置 | |
| JPH02272498A (ja) | 音声認識方法 | |
| Sigmund | Search for keywords and vocal elements in audio recordings | |
| Unnikrishnan et al. | Non-uniform Region Based Features for Automatic Language Identification | |
| Frikha et al. | Hidden Markov models (HMMs) isolated word recognizer with the optimization of acoustical analysis and modeling techniques |