JPH07506198A - 複合エキスパート - Google Patents

複合エキスパート

Info

Publication number
JPH07506198A
JPH07506198A JP5511977A JP51197793A JPH07506198A JP H07506198 A JPH07506198 A JP H07506198A JP 5511977 A JP5511977 A JP 5511977A JP 51197793 A JP51197793 A JP 51197793A JP H07506198 A JPH07506198 A JP H07506198A
Authority
JP
Japan
Prior art keywords
hypothetical
score
solution
true
expert
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP5511977A
Other languages
English (en)
Inventor
ギャノン、ウィリアム、エフ、ザ・サード
Original Assignee
クーツウェイル・アプライド・インテリジェンス・インコーポレーテッド
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by クーツウェイル・アプライド・インテリジェンス・インコーポレーテッド filed Critical クーツウェイル・アプライド・インテリジェンス・インコーポレーテッド
Publication of JPH07506198A publication Critical patent/JPH07506198A/ja
Pending legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/08—Speech classification or search
    • G10L15/18—Speech classification or search using natural language modelling
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/08—Speech classification or search
    • G10L15/18—Speech classification or search using natural language modelling
    • G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
    • G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
    • G10L15/197—Probabilistic grammars, e.g. word n-grams

Landscapes

  • Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Machine Translation (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるため要約のデータは記録されません。

Description

【発明の詳細な説明】 複合エキスパート 発明の背景 本発明は、音声認識に関するものあり、より詳細には、連続的な音声(話音)を 解析する複数のシステム或いは比較情報源の各々により与えられるスコアに対し て与えるべき重要性或いは相対重み(relative weight)を調整 する方法に関するものである。スコアを生成するシステム或いは情報源を、以下 、”エキスパート”と称する。
本技術分野の当業者により理解されているように、文脈上の知識(contex tualknowledge)を適用し、或いは、利用することにより、音響的 な音声アナライザによる単語認識の正確さを、向上させることが可能である。言 い換えれば、最も確実そうな候補を、予め決められた単語モデルの5當から選択 し、未知の音声セグメントに適用することは、与えられた候補が、解析されてい る音声のシーケンスにおける先行する単語に、適切に続いていることが確実であ るかどうかを考慮することにより、向上され得る。さらに、たとえば、まず、先 行する単語のみを利用し、さらに、2或いは3の先行する単語を利用することに より、多重言語的システム(multiple linguistic sys tem)或いは多重言語的解析を適用することができる。本発明に関連するこれ らシステムの各々は、”エキスパートであると考えられる。さらに、人力音声の 音響的な解析を実行する種々の方法が存在するため、たとえば、周知のスフィン クス認識システム(Sphinx recognizer 5yste+++) により利用される3つのいわゆるコードブックなど、一つ以上の音響的なエキス パートが存在し得る。一般には、このようなエキスパートの各々は、未知の音声 が認識装置の5當の与えられたモデルに整合する最尤性(likelihood )を示すスコアを戻すことが従来からなされている。これらスコアは、一般に、 マイナスログの確率として示される。
いくつかのエキスパートシステムについてのスコアを組合せ、全体としての整合 の最尤性を達成するためには、異なるエキスパートについての相対重要性(re lative importance) 、即ち重み付けを決定するための評価 がなされなければならない。この重み付けは、しばしば、本質的には、任意に、 システム設計者の経験に基づいて決定される。スコアのそれぞれが、良好で、独 立した確率評価となる場合には、これらを、単純に掛は算することにより結合す ることができる。しがしながら、一般的には、これらスコアは、独立してはおら ず、むしろ、相互に関連している。
独立した単語の認識装置の場合には、認識すべき種々の個々の単語の音響的なサ ンプルを含むトレーニングデータベースが存在するならば、相対重みを改善する ために統計的な方法を適用することができる。しかしながら、理解されるように 、独立した単語の前後関係で生成された発声サンプルは、連続的な音声(話合) 認識に対して最も正確とはならない。なぜなら連続した話合においては、フレー ズ内で発声された単語の間の相互調音或いは相互作用ががなり存在するがらであ る。しかしながら、有用な5曽の中に予期される個々の単語の適切な順列(組合 せ)をすべて包含させるためには、データベースは殆ど限界がなくなってしまう ので、フレーズの語曽を形成することは実現不可能である。したがって、認識装 置の5會は、必然的に、個々の単語から形成される必要がある。
本発明は、連続的な音声認識装置における多重的なエキスパートにより生成され るスコアに与えるべき相対重みを調整する方法に関するものであり、この目的の ためのトレーニングデータが、分離した単語というよりもむしろ多重的な単語フ レーズの形態をなして得られる。しかしながら、多重的な単語フレーズの文脈に おいて、真である個々の単語は、真である多重的な単語の仮定解(Hypoth eses)の一部とも、また、偽である多重的な単語の仮定解の一部ともなり得 るため、この問題に数学的な方法(numerical method)を適用 することは、直接的ではなく、また自明ではない。
a;1述【、たように、認識すべきフレーズの諸量を形成することは、実現不可 能であるが、むしろ、連続的な音声(話合)認識においてすら、認識装置は、本 質的には、甲語毎に、或いは、音ごとに、それを基礎として処理がなされるよう になっており、システム全体で使用されるエキスパートの各々は、未知の音声セ グメントの各々と、システムの諸量における単語モデルとの間の整合の最尤性を 表すスコアを与える。このような状況において、“単語”という語は、日本人の 話す言語を形成するモーラ、音素、或いは、英語のシラブルなどのサブワード片 (フラグメント)を含む包括的な意味で用いられる。
本発明にかかる方法は、その大部分を以下のような認識に基づいている。即ち、 多重エキスパートにより提起された複数の多重的な単語の仮定解の累積されたス コアを比較し、解析することができる目的関数を推論することができること、及 びいくつかのエキスパートについての相対重み係数は、この目的関数の成果を最 大にするようにシステマティックに調整されることができ、それにより、システ ムの認識精度を向上させることができるという認識である。
発明の概要 本発明にかかる方法においては、連続的な音声認識装置において音響学的なエキ スパートおよび言語学的なエキスパートにより生成されるそれぞれのスコアに与 えられる相対重み係数が、多重的な単語フレーズ(multiple word  phrases)内で認識すべき単語を利用した音声トレーニングデータを用 いて調整される。多重用語フレーズは、音響学的なエキスパートに供され、それ により、各フレーズごとに、各々が対応する累積されたスコアを有する複数の多 重的な単語の仮定解が決定される。この仮定解は、言語学的なエキスパートに供 され、各仮定解ごとに、対応する累積されたスコアが決定される。累積された音 響学的なスコアおよび言語学的なスコアは、各仮定解ごとに、初期的に任意に選 択された重み係数を用いて、結合され、結合された仮定解のスコアが、それぞれ 得られる。供されたフレーズに対して、いずれかの仮定解力慎である場合に、目 的関数は、真の仮定解の組み合わされたスコアと、少なくとも一つの偽の仮定解 の組み合わされたスコアとの間の相違の関数として可変的な値を有するように算 出される。目的関数の値は、真の仮定解を生成する全てのフレーズにわたって累 積され、重み係数の調整のベクトル方向が算出され、累積された目的関数の値が 改善される。次いで、このベクトル方向における係数の調整がなされる。方向を 決定するステップおよび調整ステップは、係数ごとの最善の値をめるために繰り 返されることが好ましい。
図面の簡単な説明 図1は、本発明にかかる方法を示すフローチャートであり、連続音声認識装置に おける複数のエキスパートにより生成されたそれぞれのスコアに与えるべき比較 重み係数の調整を説明する図である。
好適な実施例の説明 前述したように、有効な語’1(effective vocabulary) が非常に多いため、音響学的な音声アナライザに、多重的な単語フレーズのモデ ルを設けることは実際的ではない。むしろ、音響学的なエキスパートは、必然的 に、単語ごとに基づいて、或いは、モーラ(zora)ごとに基づいて実行され 、そのDllの中の個々のモデルに、未知の音声の各々を整合させるべく試みる 必要がある。確実そうな候補だけを、各セグメントに対して選択することにより 、音響学的なエキスパートは、各単語ごとの候補の順列(permutatio n)に基づいて複数の多重的な単語の仮定解(hypothesis)を生成す ることができる。最も確実そうなフレーズを、多重的な(multiple)仮 定解から選択することは、音響学的なスコアをそのまま用いることたけではなく 、少なくとも一つの言語学的なエキスパートにより提供されるスコアを用いるこ とによりなされる。本発明のある実施態様によれば、音響学的スコアおよび言語 学的スコアに適用すべき相対重み(relative weighting)は 、多重的な単語フレーズにおいて認識すべき単語を利用するトレーニングデータ に基づいて調整される。
本発明にかかる方法は、複合関数(composite function)を 利用し、トレーニングデータ内の発音人力(input utterance) から得られた仮定解を解析している。
ここに例示として記載された実施例は、日本語の連続音声アナライザーに基づい たものであり、したがって、仮定解の各々は、モーラのシーケンスとなる。複合 関数は、仮定解が正しいこと、すなわち、仮定解が、正しいモーラのシーケンス であることの最尤性(likelihood)の尺度(measure)である 複合スコアを提供する。
前述したように、個々のエキスパート出力は、一般に、マイナスログの確率とし て与えられる。
特に、ここに例示された実施例において、音響学的なエキスパートの出力および 言語学的なエキスパートの出力は、同様に取り扱われ、したがって、複合関数は 、”同質(homogeneous)”なものとして示される。他の有用な複合 関数は、後述する。この例において使用された特定の複合関数は、次のようであ る。
ここに、mは、仮定解のモーラ、Pe (m)は、モーラmを観察するエキスパ ートeについて推論された確率、Wは、重みのベクトル、Weは、あるエキスパ ートeに対する重みである。
本発明の重要な目的は、全体としての認識の精度を最適化するラムダの組を見出 し、決定するために数学的な方法を用いることにある。これを達成するために、 本発明にかかる方法は、目的関数を利用し、その最小化が精度に関係している。
この目的関数は、複合関数か、同一のテストフレーズを表現し、或いは、同一の テストフレーズにより得られる真の仮定解と偽の仮定解とを識別する程度を測る (measure)ことを目的としている。
III用される特定の目的関数は、真の仮定解と偽の仮定解とを比較する。トレ ーニングデータを用いてラムダを調整する際に、汽の仮定解を生成するテストフ レーズのみが利用される。真の仮定解を生成しないテストフレーズは、無視され る。
さらに、特に例示された実施例において、真の仮定解は、他の偽の仮定解の一つ と比較される。
この一つの偽の仮定解は、複合関数にしたがって、偽の仮定解のうち最も良いス コアを有するものとして選択される。以下、この選択された偽の仮定解は、これ か偽の仮定解の中で最も良いスコアを有しているため、最も困難な、すなわち、 最も真の解と混同しやすい偽であるという意味で、最も偽(worst 1nn correct)と称される。実際に、個々のテストフレーズに関して、最も偽 であるものが、真の仮定解よりも良いスコアを有する可能性すらある。本発明の 調整関数或いは学習関数は、ラムダを調整し、真の仮定解を生成するテストフレ ーズのグループ全てに対して、最も偽の仮定解に対する真の仮定解の識別性を向 上させる。ある目的関数は、次式により示される。
SmnnthcdErrorRate(11/ )=CFは、上に定義したC  F homogeneousなどの複合関数rcorrectJは、特定のフレ ーズに対する真の仮定解、rWorstlncorrectJは、この発音テス トについて最も真のスコアに近い、或いは遠い、すなわち、”最も偽”の仮定解 、[NpHrasesJは、トレーニングに用いられるデータセットのフレーズ 数である。
本技術分野において理解されているように、ングモイド関数などの非線形関数を 用いることは、極端なケースが、全ての結果にあまりに大きな影響を与えること を防止するのに有用である。
ラムダ値を最適化するために用いられる技法は、最急降下法(gradient  descent)を形成することである。この手順は、基本的に、ある特定の 任意に選択されたラムダ配置により開始し、そのラムダの組合せにおける目的関 数の勾配を見出し、勾配方向に、少しのステップを移動することによる。これが 繰り返されて、局地的な最小値が見出される。
目的関数の勾配を見出すために、複合関数の勾配を見出すことか必要である。
これは、次式のように決定される。
前述したように、この方法は、多重的な単語テスト或いはトレーニングフレー真 の仮定解および最も偽の仮定解についても複合関数の勾配を用いて、コスト即ち 、目的関数の勾配が、本質的には、次式のように算出され得る。
目的関数の勾配は、ラムダの調整のベクトル方向、即ち、累積された目的関数の 値を改善する係数を与える。このようなベクトル方向を算出するごとに、これに 続いて、この方向におけるステップの変更がなされる。最急降下法において従来 からなされているように、これは繰り返され、最小値が見つけたされる。マルチ プルエキスパート音声認識装置における係数に適用された、最急降下法の特定の コンピュータの実行(implementation)は、前に特定したマイク ロフィッシュの付録に与えられている。この特定の実施例において、実際に、ス テップサイズは、周知のサーチ技法にしたがって適用可能である。これは、小さ な値で開始し、このサイズのステップが、目的関数を損ない始めるまで大きくな り、次いで、最小値がシークされるにしたかって、ステップサイズが減少させら れる。
前述したように、本発明にかかる方法は、マルチプルエキスパートにより提起さ れた複数の多重的な単語の仮定解の累積されたスコアを比較し、解析することか できる目的関数を推論することができるという認識に、その大部分が基づいてい る。実際には、この認識は、重み係数を改善する反復的プロセスにより具体化さ れている。このようなプロセス或いは方法は、図1に示されている。
前述したように、記載されてきた特定の例は、全てのエキスパート、音響学的ズ の収集成いはリストを利用している。このリストは、ブロック11で示されるよ うに初期化される。このリストは、ブロック13に示されるように、引き続いて 処理され、ブロック15に示されるように、各フレーズは、順に、音響学的なエ キスパートに適用され、複数の多重的な単語の仮定解を生成する。仮定解の各々 に関連して、音響学的なスコアは、仮定群内の単語(words)に対応してい る。
ブロック17に示されるように、仮定解は、順に、少なくとも一つの言語学的な エキスパートに供され、それにより、仮定解の各々に対して、対応する言語学的 なスコアが生成される。
ブロック19に示されるように、選択された複合関数は、仮定解の各々に与えら れ、現在のラムダ或いは重み値を用いて、それぞれのコスト値が得られる。与え られたテスト或いはトレーニングフレーズに対して、全ての仮定解が真ではなか った場合に、全ての対応するスコアはトレーニング手続(procedure) において利用されない。むしろ、そのフレーズについての値は無視され、ブロッ ク21に示されるように、処理のために、新たなフレーズが選択される。
真の仮定解を生成するテストフレーズに対して、最も偽の、即ち最も混同しやす い偽の仮定解も特定される。これは、最も高いスコアを備えた真ではない仮定解 となる。このステップは、ブロック23に示されている。次いで、目的関数が、 ブロック25に示されるように、真の仮定解および最も偽の仮定解に、与えられ 、ブロック27に示されるように、目的関数の値が、次に続くテスト或いはトレ ーニングフレーズにわたって累積される。ひとたび、ブロック29に示されるよ うに、全てのテストフレーズが処理されると、ブロック31に示されるように、 累積コスト(cumultive cost)関数のベクトル勾配が決定される 。次いで、ブロック33に示されるように、ラムダが、その方向にステップイン され、ブロック35に示されるように、最小値が見出されるまで、この処理が、 反復して繰り返される。この点で、ラムダ或いは重み係数は、最適値に調整され 、この最適値により、与えられた音響学的なエキスパートの特性および言語学的 なエキスパートの特性の組に対する最良の認識結果が生成される。
他の実施例 tものおよび言語学的なものの双方が、本質的に同様に取り吸われるといつX啄 で、同質的な例である。他のアプローチでは、音響学的なエキスパートと言語学 的なエキスパートとが幾分異なって取り扱われるマルコフモデルにより近い目的 関数を用いている。この場合、複合関数は次式のように表される。
Nmhrs NEJIDenS であるので、音声以外のエキスパートeについて多くの音声認識システムにおい て、ラムダを制限して(constrain) 、それらの合計か1になるよう にするのが一般的である。特に、“マルコフ”システムにおいて、ラムダを確率 として解釈することができ、その場合に、それらは合計が1になるばかりでなく 、負ではない。同質的なシステムにおいては、この解釈は不可能であるか、ラム ダの金言1か1になることをめ、ゼロに収束し、或いは、無限大に発散すること を防止することか望ましい。これは、次の2つの方法によって達成される。1つ には、ラムダの一つを1マイナス他の合計にするように定義することであり、も う1つは、コスト関数に、ラムダの一つと全体との間の相違(発散)に依存する 項(term>を加えることである。これらのうちの前者は、比較的直接的であ るか、データセットをめる際に、勾配(grads)の算出か複雑である。後者 の方法は、独立して計算された項にトレーニングデータを加える。各コスト関数 に以下の式が加えられる。
ここに、eは、関連するエキスパート(すなわち、同質的な場合には全てのエキ スパート、マルコフケースではLMエキスパート)にわたって変動する、ベータ は、制限(constraint)がどのくらい重要であるかを制御する重み付 は項である。
この新たな項の勾配は、次式のように表される。
前述したコスト関数の一つの合計である目的関数を考えた場合に、その勾配は、 上に算出された対応する勾配(grad)とr BetaCost Jの勾配と の合計となる。目的関数を最小化することは、1に近い合計を有し、認識に際し て良好なラムダ値に向けられている。
以上の説明から、本発明のいくつかの目的が解決され、他の有利な結果が達成さ れることが理解されるであろう。
本発明の範囲を逸脱することなく、上述した構成に種々の変更を加えることが可 能であり、上述した説明および添付図面に示された全ての事項は、例示として解 釈され、発明の範囲を制限するものではないことに留意すべきである。
図面 図1

Claims (7)

    【特許請求の範囲】
  1. 1.連続的な音声認識装置において生成されるスコアに、それぞれ与えられる相 対重み係数を調整する方法であって、前記音声認識装置が、音響学的なエキスパ ートと言語学的なエキスパートとを含む複数のエキスパートを有し、前記音響学 的なエキスパートおよび言語学的なエキスパートが、システムの語彙から仮定さ れた各単語に対するそれぞれのスコアを生成するように構成され、前記方法が、 多重的な単語フレーズ内で認識すべき単語を用いて連続的な音声トレーニングデ ータを得て、 前記多重的な単語フレーズを、少なくとも一つの音響学的エキスパートに供し、 それにより、各フレーズごとに、各々が、対応する累積された音声的なスコアで あって、整合の最尤性(likelihood)を示す音響学的スコアを有する 複数の多重的な単語の仮定解を決定し、 前記仮定解を、少なくとも一つの言語学的なエキスパートに供し、それにより、 各仮定形ごとに、整合の最尤性を示す対応する累積された言語学的スコアを決定 し、 各仮定解に対して、初期的に任意に選択された重み係数を用いて、前記累積され た音響学的スコアおよび言語学的スコアを組み合わせ、それにより、それぞれ、 組み合わされた仮定解スコアを得て、 供されたフレーズの各々ごとに、何れかの仮定解が真であることを決定し、真の 仮定解が存在する場合に、真の仮定解の組み合わされたスコアと、少なくとも一 つの偽の仮定解の組み合わされたスコアとの間の相違の関数として可変的な値を 有する目的関数を算出し、 少なくとも一つの真の仮定解を生成する全てのフレーズにわたって、目的関数の 値を累積し、 累積された目的関数の値を改善する前記係数を調整するベクトル方向を算出し、 前記方向に、前記係数を調整することを特徴とする方法。
  2. 2.仮定解における前記一つの偽の仮定解が、最善のスコアを有し、かつ、真の 仮定解ではないことを特徴とする請求項1に記載の方法。
  3. 3.前記目的関数が、全ての単語及び複数のエキスパートにわたって、各単語ご との重み付けられたスコアを合計したものに対応することを特徴とする請求項1 に記載の方法。
  4. 4.前記目的関数の値の累積が、真の仮定解についての目的関数の値と、最善の スコアを有し、かつ、真の仮定解ではない仮定解についての目的関数の値との間 の差異を全てのテストフレーズにわたって合計したものに対応することを特徴と する請求項3に記載の方法。
  5. 5.合計の前に、差異の各々に対して、シグモイド関数が与えられることを特徴 とする請求項4に記載の方法。
  6. 6.前記シグモイド関数が、 Sig(x)=(1/1+e)−x により定義されることを特徴とする請求項5に記載の方法。
  7. 7.連続的な音声認識装置において生成されるスコアに、それぞれ与えられる相 対重み係数を調整する方法であって、前記音声認識装置が、音響学的エキスパー トと言語学的エキスパートとを含む複数のエキスパートを有し、前記音響学的エ キスパートおよび言語学的エキスパートが、システムの語彙から仮定された各単 語に対するそれぞれのスコアを生成するように構成され、前記方法が、多重的な 単語フレーズ内で認識すべき単語を用いて連続的な音声トレーニングデータを得 て、さらに、 (a)前記多重的な単語フレーズを、少なくとも一つの音響学的エキスパートに 供し、それにより、各フレーズごとに、各々が、対応する累積された音響学的ス コアであって、整合の最尤性を示す音響学的スコアを有する複数の多重的な単語 仮定解を決定し、 (b)前記仮定解を、少なくとも一つの言語学的エキスパートに供し、それによ り、各仮定解ごとに、整合の最尤性を示す対応する累積された言語学的スコアを 決定し、 (c)各仮定整に対して、初期的に任意に選択された重み係数を用いて、前記累 積された音響学的スコアおよび言語学的スコアを組合せ、それにより、それぞれ 、組み合わされた仮定解スコアを得て、 (d)供されたフレーズの各々ごとに、何れかの仮定解が真であることを決定し 、真の仮定解が存在する場合に、真の仮定解の組み合わされたスコアと、少なく とも一つの偽の仮定解の組み合わされたスコアとの間の相違の関数として可変的 な値を有する目的関数を算出し、 (e)少なくとも一つの真の仮定解を生成する全てのフレーズにわたって、目的 関数の値を累積し、 (f)累積された目的関数の値を改善する前記係数を調整するベクトル方向を算 出し、 (g)前記方向に、前記係数を調整するステップを備え、前記ステップ(a)な いし(g)を操り返すことを特徴とする方法。
JP5511977A 1991-12-20 1992-12-18 複合エキスパート Pending JPH07506198A (ja)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US812,581 1985-12-23
US07/812,581 US5280563A (en) 1991-12-20 1991-12-20 Method of optimizing a composite speech recognition expert
PCT/US1992/011375 WO1993013519A1 (en) 1991-12-20 1992-12-18 Composite expert

Publications (1)

Publication Number Publication Date
JPH07506198A true JPH07506198A (ja) 1995-07-06

Family

ID=25210032

Family Applications (1)

Application Number Title Priority Date Filing Date
JP5511977A Pending JPH07506198A (ja) 1991-12-20 1992-12-18 複合エキスパート

Country Status (5)

Country Link
US (1) US5280563A (ja)
EP (1) EP0617827B1 (ja)
JP (1) JPH07506198A (ja)
DE (1) DE69229124T2 (ja)
WO (1) WO1993013519A1 (ja)

Families Citing this family (25)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0559349B1 (en) * 1992-03-02 1999-01-07 AT&T Corp. Training method and apparatus for speech recognition
US5546499A (en) * 1994-05-27 1996-08-13 Kurzweil Applied Intelligence, Inc. Speech recognition system utilizing pre-calculated similarity measurements
CA2126380C (en) * 1993-07-22 1998-07-07 Wu Chou Minimum error rate training of combined string models
JP3311460B2 (ja) * 1994-01-28 2002-08-05 富士通株式会社 音声認識装置
US5677991A (en) * 1995-06-30 1997-10-14 Kurzweil Applied Intelligence, Inc. Speech recognition system using arbitration between continuous speech and isolated word modules
US5794196A (en) * 1995-06-30 1998-08-11 Kurzweil Applied Intelligence, Inc. Speech recognition system distinguishing dictation from commands by arbitration between continuous speech and isolated word modules
US5880966A (en) * 1995-12-14 1999-03-09 Xynetix Design Systems, Inc. Apparatus using scoring advisors having outputs combined on a back plane for evaluating designs
US6151575A (en) * 1996-10-28 2000-11-21 Dragon Systems, Inc. Rapid adaptation of speech models
US6122613A (en) * 1997-01-30 2000-09-19 Dragon Systems, Inc. Speech recognition using multiple recognizers (selectively) applied to the same input sample
US6260013B1 (en) * 1997-03-14 2001-07-10 Lernout & Hauspie Speech Products N.V. Speech recognition system employing discriminatively trained models
US6490555B1 (en) 1997-03-14 2002-12-03 Scansoft, Inc. Discriminatively trained mixture models in continuous speech recognition
US6212498B1 (en) * 1997-03-28 2001-04-03 Dragon Systems, Inc. Enrollment in speech recognition
US6167377A (en) * 1997-03-28 2000-12-26 Dragon Systems, Inc. Speech recognition language models
US6076056A (en) * 1997-09-19 2000-06-13 Microsoft Corporation Speech recognition system for recognizing continuous and isolated speech
US20020099545A1 (en) * 2001-01-24 2002-07-25 Levitt Benjamin J. System, method and computer program product for damage control during large-scale address speech recognition
US7444284B1 (en) 2001-01-24 2008-10-28 Bevocal, Inc. System, method and computer program product for large-scale street name speech recognition
EP1466318B1 (de) * 2002-01-17 2006-08-30 Siemens Aktiengesellschaft Spracherkenner und betriebsverfahren für einen solchen
US20040193412A1 (en) * 2003-03-18 2004-09-30 Aurilab, Llc Non-linear score scrunching for more efficient comparison of hypotheses
DE102004029873B3 (de) * 2004-06-16 2005-12-29 Deutsche Telekom Ag Verfahren und Vorrichtung zur intelligenten Eingabekorrektur für automatische Sprachdialogsysteme
EP1696198B1 (en) * 2005-02-28 2014-07-16 Saab Ab Method and system for fire simulation
US8255216B2 (en) * 2006-10-30 2012-08-28 Nuance Communications, Inc. Speech recognition of character sequences
US8239200B1 (en) * 2008-08-15 2012-08-07 Google Inc. Delta language model
TWI377560B (en) * 2008-12-12 2012-11-21 Inst Information Industry Adjustable hierarchical scoring method and system
US8838449B2 (en) * 2010-12-23 2014-09-16 Microsoft Corporation Word-dependent language model
US10304440B1 (en) * 2015-07-10 2019-05-28 Amazon Technologies, Inc. Keyword spotting using multi-task configuration

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4741036A (en) * 1985-01-31 1988-04-26 International Business Machines Corporation Determination of phone weights for markov models in a speech recognition system
US4926488A (en) * 1987-07-09 1990-05-15 International Business Machines Corporation Normalization of speech by adaptive labelling

Also Published As

Publication number Publication date
DE69229124T2 (de) 1999-09-16
EP0617827A4 (en) 1995-12-13
WO1993013519A1 (en) 1993-07-08
DE69229124D1 (de) 1999-06-10
EP0617827A1 (en) 1994-10-05
EP0617827B1 (en) 1999-05-06
US5280563A (en) 1994-01-18

Similar Documents

Publication Publication Date Title
McAuliffe et al. Montreal forced aligner: Trainable text-speech alignment using kaldi.
US5280563A (en) Method of optimizing a composite speech recognition expert
Schwartz et al. Context-dependent modeling for acoustic-phonetic recognition of continuous speech
EP0635820B1 (en) Minimum error rate training of combined string models
US8532991B2 (en) Speech models generated using competitive training, asymmetric training, and data boosting
CN112349289A (zh) 一种语音识别方法、装置、设备以及存储介质
KR20050082253A (ko) 모델 변이 기반의 화자 클러스터링 방법, 화자 적응 방법및 이들을 이용한 음성 인식 장치
Gholamdokht Firooz et al. Spoken language recognition using a new conditional cascade method to combine acoustic and phonetic results
Reynolds et al. Automatic language recognition via spectral and token based approaches
Bisikalo et al. Precision Automated Phonetic Analysis of Speech Signals for Information Technology of Text-dependent Authentication of a Person by Voice.
Thamburaj et al. Automatic speech recognition based on improved deep learning
Wang et al. A multi-space distribution (MSD) approach to speech recognition of tonal languages.
Chetouani et al. Neural predictive coding for speech discriminant feature extraction: The DFE-NPC.
Shaikh Naziya et al. Speech recognition system—a review
KR100327486B1 (ko) 스테이트별 가중치를 적용한 음성 인식 장치 및 방법
Golda Brunet et al. Transcription correction using group delay processing for continuous speech recognition
Savchenko et al. Optimization of gain in symmetrized itakura-saito discrimination for pronunciation learning
Schnell et al. Neural VTLN for Speaker Adaptation in TTS.
Bacchiani et al. Optimization of time-frequency masking filters using the minimum classification error criterion
Swarnamughi et al. Enhanced Machine Learning Framework for English Speaking Assessment: Addressing Accent and Speech Variability Through BiLSTM-Transformer Architecture
JPH10254485A (ja) 話者正規化装置、話者適応化装置及び音声認識装置
JPH02272498A (ja) 音声認識方法
Sigmund Search for keywords and vocal elements in audio recordings
Unnikrishnan et al. Non-uniform Region Based Features for Automatic Language Identification
Frikha et al. Hidden Markov models (HMMs) isolated word recognizer with the optimization of acoustical analysis and modeling techniques