JPH06308995A - 音声認識システム - Google Patents
音声認識システムInfo
- Publication number
- JPH06308995A JPH06308995A JP6049648A JP4964894A JPH06308995A JP H06308995 A JPH06308995 A JP H06308995A JP 6049648 A JP6049648 A JP 6049648A JP 4964894 A JP4964894 A JP 4964894A JP H06308995 A JPH06308995 A JP H06308995A
- Authority
- JP
- Japan
- Prior art keywords
- grammar
- graph
- recognition
- vocabulary
- grammar graph
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 230000015654 memory Effects 0.000 claims abstract description 19
- 238000000034 method Methods 0.000 claims description 22
- 230000007613 environmental effect Effects 0.000 claims 1
- 230000000737 periodic effect Effects 0.000 claims 1
- 238000012217 deletion Methods 0.000 abstract description 3
- 230000037430 deletion Effects 0.000 abstract description 3
- 239000000284 extract Substances 0.000 abstract description 2
- 230000002452 interceptive effect Effects 0.000 description 6
- 238000013507 mapping Methods 0.000 description 4
- 230000003190 augmentative effect Effects 0.000 description 3
- 206010028980 Neoplasm Diseases 0.000 description 2
- 230000002457 bidirectional effect Effects 0.000 description 2
- 238000010586 diagram Methods 0.000 description 2
- 230000003068 static effect Effects 0.000 description 2
- 241001441571 Hiodontidae Species 0.000 description 1
- 241000009298 Trigla lyra Species 0.000 description 1
- 238000007792 addition Methods 0.000 description 1
- 238000003491 array Methods 0.000 description 1
- 210000000481 breast Anatomy 0.000 description 1
- 230000003139 buffering effect Effects 0.000 description 1
- 201000011510 cancer Diseases 0.000 description 1
- 230000001149 cognitive effect Effects 0.000 description 1
- 238000007796 conventional method Methods 0.000 description 1
- 230000009977 dual effect Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000011156 evaluation Methods 0.000 description 1
- 230000010006 flight Effects 0.000 description 1
- 238000011835 investigation Methods 0.000 description 1
- 210000004072 lung Anatomy 0.000 description 1
- 230000004044 response Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
- G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
- G10L15/193—Formal grammars, e.g. finite state automata, context free grammars or word networks
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
- G10L15/063—Training
- G10L2015/0638—Interactive procedures
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/226—Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
- G10L2015/228—Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics of application context
Landscapes
- Engineering & Computer Science (AREA)
- Artificial Intelligence (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Machine Translation (AREA)
Abstract
(57)【要約】
【目的】 対話型動的制約音声認識の方法およびシステ
ムを提供すること。 【構成】 この方法は、更新済み文法グラフのコンパイ
ルに使用される音声パターン・データベースを使用す
る。文法グラフは、外部適用業務システムからの入力に
基づいて、利用可能な単語選択肢に制約される。認識プ
ロセッサ内で使用される文法グラフは、現在利用可能な
語彙を反映するように動的に再コンパイルされる。
ムを提供すること。 【構成】 この方法は、更新済み文法グラフのコンパイ
ルに使用される音声パターン・データベースを使用す
る。文法グラフは、外部適用業務システムからの入力に
基づいて、利用可能な単語選択肢に制約される。認識プ
ロセッサ内で使用される文法グラフは、現在利用可能な
語彙を反映するように動的に再コンパイルされる。
Description
【0001】
【産業上の利用分野】本発明は、全般的に、音声認識技
法に関し、より詳しくは、音声認識の精度を増す手段と
しての文法制約の技法に関する。
法に関し、より詳しくは、音声認識の精度を増す手段と
しての文法制約の技法に関する。
【0002】
【従来の技術】現在の音声認識システムの精度は、タス
クの「パープレクシティ」、すなわち音声文字列の任意
の点での可能な語選択肢の数に大きく依存している。こ
れらの因子は、活用語彙の総サイズ(総選択肢)と文法
/構文が与える「制約」の度合いとに依存する。文法の
制約が大きいほど、文を評価する各ステップでの選択肢
は少なくなる。適用業務によっては、非常に大規模な語
彙を必要とし、パープレクシティが極めて高いものもあ
る。これらの適用業務では、現在の技術で極めて低いエ
ラー率を達成するのは、不可能でないとしても、非常に
困難である。
クの「パープレクシティ」、すなわち音声文字列の任意
の点での可能な語選択肢の数に大きく依存している。こ
れらの因子は、活用語彙の総サイズ(総選択肢)と文法
/構文が与える「制約」の度合いとに依存する。文法の
制約が大きいほど、文を評価する各ステップでの選択肢
は少なくなる。適用業務によっては、非常に大規模な語
彙を必要とし、パープレクシティが極めて高いものもあ
る。これらの適用業務では、現在の技術で極めて低いエ
ラー率を達成するのは、不可能でないとしても、非常に
困難である。
【0003】従来の音声認識システムでは、設計者は、
システムを手動で制約して、パープレクシティ/分岐を
削減しようと試みている。たとえば、放射線医学のタス
クでは、システムが文法モデルの全部分を除去するため
に用いる一連の単語、たとえば人間、女性、胸、肺、腫
瘍、ガンを、ユーザが発声する必要がある。その目標
は、文法の非常に小さな部分しか残らないように、各単
語の後の可能な選択肢の75%を除去することである。
その時点で、ユーザは、完全な文を発声することができ
る。この手動制約は、2つの理由で必要である。第1
に、どの瞬間にも、何が話されるかについての予備知識
がない。第2に、文法グラフを記述ファイルからコンパ
イルし、ターゲット・マシン上にインストールする必要
がある。言い換えると、文法は静的である。
システムを手動で制約して、パープレクシティ/分岐を
削減しようと試みている。たとえば、放射線医学のタス
クでは、システムが文法モデルの全部分を除去するため
に用いる一連の単語、たとえば人間、女性、胸、肺、腫
瘍、ガンを、ユーザが発声する必要がある。その目標
は、文法の非常に小さな部分しか残らないように、各単
語の後の可能な選択肢の75%を除去することである。
その時点で、ユーザは、完全な文を発声することができ
る。この手動制約は、2つの理由で必要である。第1
に、どの瞬間にも、何が話されるかについての予備知識
がない。第2に、文法グラフを記述ファイルからコンパ
イルし、ターゲット・マシン上にインストールする必要
がある。言い換えると、文法は静的である。
【0004】そのような手動制約では、放射線医学のよ
うな非実時間適用業務には受け入れられる結果を生成す
る可能性があるが、発声される文を予備的な注釈なしで
直ちに認識しなければならない航空管制(ATC)など
の実時間適用業務では受け入れられない。このような適
用業務での唯一の方法は、より適切な4ワード選択肢で
はなく、おそらく文の各点で数百または数千の単語が可
能な、かなり制約の少ない文法を構築することである。
このような低レベルの制約を実時間のストレスと雑音の
多い環境で使用すると、エラー率および応答時間が受け
入れられないものになる。
うな非実時間適用業務には受け入れられる結果を生成す
る可能性があるが、発声される文を予備的な注釈なしで
直ちに認識しなければならない航空管制(ATC)など
の実時間適用業務では受け入れられない。このような適
用業務での唯一の方法は、より適切な4ワード選択肢で
はなく、おそらく文の各点で数百または数千の単語が可
能な、かなり制約の少ない文法を構築することである。
このような低レベルの制約を実時間のストレスと雑音の
多い環境で使用すると、エラー率および応答時間が受け
入れられないものになる。
【0005】適用業務の態様が、認識語彙を制約するた
めに使用できるあるレベルの予備知識を認識システムに
提供できる、航空管制などの適用業務の範疇がある。音
声認識者の環境からのデータを使用して任意の瞬間に活
用文法を動的に制約するなど、システムに制約を与える
方法が必要とされている。動的制約の方法を用いれば、
音声認識エラー率が大幅に減少するはずである。認識者
とのインタフェースとなるシステムからデータを抽出
し、そのデータを使用して、次の数分間以内に発声され
る可能性のある語彙だけを含む文法グラフを実時間でコ
ンパイルする手段が必要である。この手段は、その文法
が発声の候補でなくなったと判定された後に、文法グラ
フから語彙を削除する手段を含む。
めに使用できるあるレベルの予備知識を認識システムに
提供できる、航空管制などの適用業務の範疇がある。音
声認識者の環境からのデータを使用して任意の瞬間に活
用文法を動的に制約するなど、システムに制約を与える
方法が必要とされている。動的制約の方法を用いれば、
音声認識エラー率が大幅に減少するはずである。認識者
とのインタフェースとなるシステムからデータを抽出
し、そのデータを使用して、次の数分間以内に発声され
る可能性のある語彙だけを含む文法グラフを実時間でコ
ンパイルする手段が必要である。この手段は、その文法
が発声の候補でなくなったと判定された後に、文法グラ
フから語彙を削除する手段を含む。
【0006】
【発明が解決しようとする課題】本発明の目的は、任意
の瞬間に活用文法を動的に制約することによって音声認
識の精度を増すことである。これは、文法グラフを動的
に更新することによって達成される。音声認識プロセス
制御装置は、利用可能な文法の現リストを文法グラフの
形で維持する。文法グラフは、システム環境に基づいて
実時間で対話的に更新される。
の瞬間に活用文法を動的に制約することによって音声認
識の精度を増すことである。これは、文法グラフを動的
に更新することによって達成される。音声認識プロセス
制御装置は、利用可能な文法の現リストを文法グラフの
形で維持する。文法グラフは、システム環境に基づいて
実時間で対話的に更新される。
【0007】
【課題を解決するための手段】音声認識システムは、外
部適用業務から、利用可能な語彙に関する入力を受け取
る。入力は、コンパイラに送られ、コンパイラは利用可
能な語彙および音声パターン・データベースに基づいて
文法グラフ・データベースをコンパイルする。この文法
グラフを使って、認識プロセッサが、発声された単語ま
たは句を迅速かつ正確に決定する。2つの文法グラフを
使用すれば、実時間での更新が可能になる。
部適用業務から、利用可能な語彙に関する入力を受け取
る。入力は、コンパイラに送られ、コンパイラは利用可
能な語彙および音声パターン・データベースに基づいて
文法グラフ・データベースをコンパイルする。この文法
グラフを使って、認識プロセッサが、発声された単語ま
たは句を迅速かつ正確に決定する。2つの文法グラフを
使用すれば、実時間での更新が可能になる。
【0008】
【実施例】従来の技術で知られる典型的な音声認識シス
テムを図1に示す。このシステムは、3つの主要サブセ
クション、すなわち文法グラフの作成に使用されるオフ
ライン・プロセッサ60と、実際の認識を実行するため
に使用されるオンライン・システム55と、放射線医学
や航空管制など、音声認識の結果に依存する適用業務で
ある外部システム10とから構成される。典型的な使用
法では、音声認識の専門家によって静的文法記述ファイ
ルが作成される。このファイルは、普遍的な1組の認識
されるすべての可能な音声入力を記述する。このファイ
ル65は、それに含まれる単語の音声パターンを含むデ
ータベース25に対してオフラインでコンパイルされ
る。作成されたファイルは、電子的にまたはディスケッ
トを介してオンライン・システム55に転送される。制
御/入出力モジュール15は、この文法グラフをメモリ
30にロードする。すると、オンライン・システム55
は、音声認識処理45を初期設定し、開始する準備がで
きる。認識結果は、制御/入出力プロセッサ15を介し
て適用業務10に出力される。
テムを図1に示す。このシステムは、3つの主要サブセ
クション、すなわち文法グラフの作成に使用されるオフ
ライン・プロセッサ60と、実際の認識を実行するため
に使用されるオンライン・システム55と、放射線医学
や航空管制など、音声認識の結果に依存する適用業務で
ある外部システム10とから構成される。典型的な使用
法では、音声認識の専門家によって静的文法記述ファイ
ルが作成される。このファイルは、普遍的な1組の認識
されるすべての可能な音声入力を記述する。このファイ
ル65は、それに含まれる単語の音声パターンを含むデ
ータベース25に対してオフラインでコンパイルされ
る。作成されたファイルは、電子的にまたはディスケッ
トを介してオンライン・システム55に転送される。制
御/入出力モジュール15は、この文法グラフをメモリ
30にロードする。すると、オンライン・システム55
は、音声認識処理45を初期設定し、開始する準備がで
きる。認識結果は、制御/入出力プロセッサ15を介し
て適用業務10に出力される。
【0009】図2に示すように、前記の認識システム5
5が、オンライン対話型動的文法制約システム50によ
って増補された。本発明は、制御/入出力プロセッサ1
7内に配置された特殊な制御/インタフェース・ソフト
ウェアと、双方向インタフェース12および外部適用業
務システム10内のサポート・ソフトウェアと、実時間
コンパイラ22と、第2のメモリ常駐文法グラフ35
と、メモリ・マッピング・スイッチ40を伴う。
5が、オンライン対話型動的文法制約システム50によ
って増補された。本発明は、制御/入出力プロセッサ1
7内に配置された特殊な制御/インタフェース・ソフト
ウェアと、双方向インタフェース12および外部適用業
務システム10内のサポート・ソフトウェアと、実時間
コンパイラ22と、第2のメモリ常駐文法グラフ35
と、メモリ・マッピング・スイッチ40を伴う。
【0010】対話型動的文法制約システム50は、音声
パターン・データベース27だけが活動状態である状態
から開始する。音声パターン・データベース27は、オ
ンライン・システム50に含まれ、すべての可能な単語
の音声パターンを含めることから開始する。このデータ
ベースは、オフライン・システム60中のデータベース
25に似ている。対話型動的文法制約システム50は、
標準文法グラフ"A"32と増補文法グラフ"B"35のメ
モリが共に空の状態から開始する。次に、外部適用業務
システム10は、次の時間間隔中に発声される可能性の
ある候補と判定された句または文のリストを制御/入出
力プロセッサ17に送る。このリストは、実時間コンパ
イラ22に転送され、実時間コンパイラ22は、音声パ
ターン・データベース27から適用可能なパターンだけ
を選択し、極めて制約された文法グラフを出力する。こ
の文法グラフは標準文法グラフ"A"32のメモリ位置A
にロードされる。このプロセスにかかる時間は1秒未満
である。制御/入出力プロセッサ17は、認識プロセス
がその音声認識処理で標準文法グラフ"A"32を使用す
るようにメモリ割振りスイッチ40をセットする。認識
結果は、通常の方式で外部適用業務システム10に出力
される。
パターン・データベース27だけが活動状態である状態
から開始する。音声パターン・データベース27は、オ
ンライン・システム50に含まれ、すべての可能な単語
の音声パターンを含めることから開始する。このデータ
ベースは、オフライン・システム60中のデータベース
25に似ている。対話型動的文法制約システム50は、
標準文法グラフ"A"32と増補文法グラフ"B"35のメ
モリが共に空の状態から開始する。次に、外部適用業務
システム10は、次の時間間隔中に発声される可能性の
ある候補と判定された句または文のリストを制御/入出
力プロセッサ17に送る。このリストは、実時間コンパ
イラ22に転送され、実時間コンパイラ22は、音声パ
ターン・データベース27から適用可能なパターンだけ
を選択し、極めて制約された文法グラフを出力する。こ
の文法グラフは標準文法グラフ"A"32のメモリ位置A
にロードされる。このプロセスにかかる時間は1秒未満
である。制御/入出力プロセッサ17は、認識プロセス
がその音声認識処理で標準文法グラフ"A"32を使用す
るようにメモリ割振りスイッチ40をセットする。認識
結果は、通常の方式で外部適用業務システム10に出力
される。
【0011】ある時間間隔の後に、外部適用業務システ
ム10は制御/入出力プロセッサ17に更新メッセージ
を送る。このメッセージは、認識の資格がある追加の文
または句と認識の資格がなくなった文または句の両方を
含む。次に、制御/入出力プロセッサ17は、このデー
タと、すでに受信したデータを合計する。すなわち、追
加が加算され、削除が減算される。この結果、次の時間
間隔に有効とみなされる文または句だけを含む新しいフ
ァイルが作成される。このデータは、実時間コンパイラ
22に送られる。実時間コンパイラ22は、音声パター
ン・データベース27から必要な追加情報を取り出し、
新しい文法グラフをコンパイルする。新しい文法グラフ
・データは、文法グラフ・メモリ"B"35中の位置に送
られる。このプロセス全体にかかる時間は1分以内であ
る。制御/入出力プロセッサ17は、認識プロセッサ4
7をモニタして、能動的音声認識プロセスが進行中でな
いことを確認する。進行中でない場合、次に開始される
認識プロセスが、前に使用していた標準文法グラフ"A"
32の代わりに文法グラフ"B"35を使用するように、
メモリ・マッピング・スイッチ40がセットされる。認
識プロセスが進行中である場合、制御/入出力プロセッ
サ17は、そのプロセスが終了するのを待ってから、メ
モリ・マッピング・スイッチ40の状態を変更する。
ム10は制御/入出力プロセッサ17に更新メッセージ
を送る。このメッセージは、認識の資格がある追加の文
または句と認識の資格がなくなった文または句の両方を
含む。次に、制御/入出力プロセッサ17は、このデー
タと、すでに受信したデータを合計する。すなわち、追
加が加算され、削除が減算される。この結果、次の時間
間隔に有効とみなされる文または句だけを含む新しいフ
ァイルが作成される。このデータは、実時間コンパイラ
22に送られる。実時間コンパイラ22は、音声パター
ン・データベース27から必要な追加情報を取り出し、
新しい文法グラフをコンパイルする。新しい文法グラフ
・データは、文法グラフ・メモリ"B"35中の位置に送
られる。このプロセス全体にかかる時間は1分以内であ
る。制御/入出力プロセッサ17は、認識プロセッサ4
7をモニタして、能動的音声認識プロセスが進行中でな
いことを確認する。進行中でない場合、次に開始される
認識プロセスが、前に使用していた標準文法グラフ"A"
32の代わりに文法グラフ"B"35を使用するように、
メモリ・マッピング・スイッチ40がセットされる。認
識プロセスが進行中である場合、制御/入出力プロセッ
サ17は、そのプロセスが終了するのを待ってから、メ
モリ・マッピング・スイッチ40の状態を変更する。
【0012】本発明を使用すると、活用認識文法を、必
要に応じて各認識事象の合間に動的に「再制約」して、
制約が最大にかつエラーが最小になるように、認識文法
を連続的に調整することができる。使用されなくなった
文法は、更新済み文法グラフから削除することができ
る。
要に応じて各認識事象の合間に動的に「再制約」して、
制約が最大にかつエラーが最小になるように、認識文法
を連続的に調整することができる。使用されなくなった
文法は、更新済み文法グラフから削除することができ
る。
【0013】本発明の他の利点は、認識文法を任意選択
で、文が単語であるかのように、一連の文全体としてコ
ンパイルすることによって、文全体を複数のエンティテ
ィとして相互に評価できることである。
で、文が単語であるかのように、一連の文全体としてコ
ンパイルすることによって、文全体を複数のエンティテ
ィとして相互に評価できることである。
【0014】本発明は、航空管制適用業務で管制塔制御
動作を改善するために実施された。現在は自動化によっ
て、現在は紙のフライト・ストリップに記録されている
各フライトに関するデータが、今後はコンピュータ端末
で表示するためにコンピュータ・データベースに格納さ
れる。航空管制装置が各航空機に通話するとき、音声認
識システムは、適用業務がこの航空機に関するデータを
検索できるように、航空機識別(航空機ID)を認識し
なければならない。このタスクは、現場条件で2%未満
のエラー率で実行しなければならない。調査を行った
後、従来の技術では、このエラー性能を達成できないと
判定された。
動作を改善するために実施された。現在は自動化によっ
て、現在は紙のフライト・ストリップに記録されている
各フライトに関するデータが、今後はコンピュータ端末
で表示するためにコンピュータ・データベースに格納さ
れる。航空管制装置が各航空機に通話するとき、音声認
識システムは、適用業務がこの航空機に関するデータを
検索できるように、航空機識別(航空機ID)を認識し
なければならない。このタスクは、現場条件で2%未満
のエラー率で実行しなければならない。調査を行った
後、従来の技術では、このエラー性能を達成できないと
判定された。
【0015】このタスクの困難さを理解するために、一
般航空用の1種類の航空機IDだけがある例について説
明する。図3は、接頭部とそれに続く1つないし5つの
位置接尾部とから構成する必要があるこの種のIDの
「構文」を記述する方法を示す。規則は単純である。
(1)第1の接尾部位置にゼロを使用することはできな
い。使用できるのは数字1ないし9だけである。(2)
位置2ないし5では、数字0ないし9とアルファベット
AないしZの大部分が使用できる。(3)ただし、アル
ファベットは、最後のフィールドと最後から2番目のフ
ィールドにしか使用できない(1つまたは2つの英字し
か使用できず、アルファベットの次に数字が続くことは
ない)。
般航空用の1種類の航空機IDだけがある例について説
明する。図3は、接頭部とそれに続く1つないし5つの
位置接尾部とから構成する必要があるこの種のIDの
「構文」を記述する方法を示す。規則は単純である。
(1)第1の接尾部位置にゼロを使用することはできな
い。使用できるのは数字1ないし9だけである。(2)
位置2ないし5では、数字0ないし9とアルファベット
AないしZの大部分が使用できる。(3)ただし、アル
ファベットは、最後のフィールドと最後から2番目のフ
ィールドにしか使用できない(1つまたは2つの英字し
か使用できず、アルファベットの次に数字が続くことは
ない)。
【0016】これらの規則を使用すれば、自動車の認可
ナンバー・プレートを形成する場合とまったく同じよう
に、非常に多数のIDを構築することができる。接頭部
は、必ずしも航空機を一義的に記述する必要はないが、
管制装置が発声する必要がある。接頭部は、航空機の製
造業者名または機種名とすることができる。接頭部の現
在の数は、数千の範囲である。
ナンバー・プレートを形成する場合とまったく同じよう
に、非常に多数のIDを構築することができる。接頭部
は、必ずしも航空機を一義的に記述する必要はないが、
管制装置が発声する必要がある。接頭部は、航空機の製
造業者名または機種名とすることができる。接頭部の現
在の数は、数千の範囲である。
【0017】図4は、すべての可能な航空機IDを認識
すべき場合に作成する必要がある文法グラフの最初の3
つのノードを示す。平均分岐係数は4であることが望ま
しいが、このグラフの第1ブランチが数千の範囲の分岐
係数をもち、次の分岐係数が9であることに留意された
い。これは、現在の音声認識技術では達成不能な課題で
ある。
すべき場合に作成する必要がある文法グラフの最初の3
つのノードを示す。平均分岐係数は4であることが望ま
しいが、このグラフの第1ブランチが数千の範囲の分岐
係数をもち、次の分岐係数が9であることに留意された
い。これは、現在の音声認識技術では達成不能な課題で
ある。
【0018】航空管制適用業務を分析した後、航空管制
環境から予備知識を収集できると判断された。通常の状
況では、管制装置は、データベース中にフライト・プラ
ンが存在する航空機だけに通話する。これらのプラン
は、特定の管制装置のコンピュータ・データベースに
「通知」される。1台の管制装置の制御下にあるフライ
トの公称量は20である。したがって、おそらく百万程
度の認識される可能性のあるIDのうち、任意の所与の
時間に生じる公算のあるのは20だけである。以下の表
1に、8つのそのような航空機IDを示す。
環境から予備知識を収集できると判断された。通常の状
況では、管制装置は、データベース中にフライト・プラ
ンが存在する航空機だけに通話する。これらのプラン
は、特定の管制装置のコンピュータ・データベースに
「通知」される。1台の管制装置の制御下にあるフライ
トの公称量は20である。したがって、おそらく百万程
度の認識される可能性のあるIDのうち、任意の所与の
時間に生じる公算のあるのは20だけである。以下の表
1に、8つのそのような航空機IDを示す。
【0019】
【表1】 CESSNA 13AZ CESSNA 175A CESSNA 172 CESSNA 69432 MOONEY 378WL LEAR 9785 LEAR 973 PIPER 302
【0020】図5に、これらのIDの文法グラフを示
す。初期分岐係数は、数千ではなく4である。そればか
りでなく、このグラフの平均分岐係数は2未満であり、
現在の音声認識技術の限界内に十分収まる。
す。初期分岐係数は、数千ではなく4である。そればか
りでなく、このグラフの平均分岐係数は2未満であり、
現在の音声認識技術の限界内に十分収まる。
【0021】しかし、本発明を使用しない場合は、利用
可能な予備知識を活用できないはずである。航空管制装
置の位置に電子的に通知されてから1−2秒以内に航空
機IDが認識できなければならない。これは、実時間の
動的制約音声認識システムを使わないと不可能である。
可能な予備知識を活用できないはずである。航空管制装
置の位置に電子的に通知されてから1−2秒以内に航空
機IDが認識できなければならない。これは、実時間の
動的制約音声認識システムを使わないと不可能である。
【0022】前述のように、本発明は、2つの文法アレ
イ用の2重メモリ位置32および35と、音声認識適用
業務を一方または他方のメモリ位置にマップできるよう
にするメモリ・マッピング・スイッチ40とを使用す
る。単一のメモリ位置を使用しても、本発明の結果を達
成することが可能である。この場合、様々な技術を使用
して、認識事象の合間に単一のメモリ位置を更新するこ
とができる。
イ用の2重メモリ位置32および35と、音声認識適用
業務を一方または他方のメモリ位置にマップできるよう
にするメモリ・マッピング・スイッチ40とを使用す
る。単一のメモリ位置を使用しても、本発明の結果を達
成することが可能である。この場合、様々な技術を使用
して、認識事象の合間に単一のメモリ位置を更新するこ
とができる。
【0023】本発明のソフトウェア・リストを図6に示
す。擬似コードは、適用業務とのセッションを初期設定
または確立し、次いで要求時に適用業務中で有効な文法
を取り出す。ATC適用業務では、これはその特定の位
置に関する現在の活動航空機IDリストである。この文
法は、文法グラフにコンパイルされる。このプロセスで
は、現在有効な航空機IDのリストと、事前定義された
構文(規則)と、すべての可能な語彙の音声パターンを
含むデータベースを使用する。この文法グラフは、シス
テムが初期設定中であり、両方のメモリが空なので、メ
モリ位置"A"にロードされる。次に、位置"A"が使用中
であることを示すフラグがセットされる。この時点
で、"A"の文法グラフに対する認識が発生する。その
間、システムは待機状態にあり、適用業務からの入力を
待つ。更新を受信すると、デルタ・コンパイル・プロセ
スが開始される。更新は、追加の航空機IDもしくは削
除またはその両方を含み、あるいは完全に新しいIDリ
ストも含むことができる。デルタ・コンパイルの一部と
して、これらの違いが調整され、新しい文法グラフが生
成される。このコンパイル中に、必要に応じて構文デー
タベースおよび音声パターン・データベースからデータ
が取り出される。次のステップでは、新しい文法グラフ
を記憶する。フラグの状態が検査される。フラグが真で
ある("A"が使用中である)場合、位置"B"がロードさ
れる。システムは次に、ループに入り、活用文法が"A"
から"B"に、あるいは"B"から"A"に変更できる時間を
待つ。認識活動が検出されない場合は、メモリ・スイッ
チがトグルされる。活動が進行中である場合、システム
は、現在の認識の終りまでループし、その後、スイッチ
がトグルされる。スイッチを切り替えている間に、ただ
ちに次の認識が開始する場合、切替え段で適切なバッフ
ァリングが行われ、認識を保留にして実時間に追いつく
ことができるようになる。
す。擬似コードは、適用業務とのセッションを初期設定
または確立し、次いで要求時に適用業務中で有効な文法
を取り出す。ATC適用業務では、これはその特定の位
置に関する現在の活動航空機IDリストである。この文
法は、文法グラフにコンパイルされる。このプロセスで
は、現在有効な航空機IDのリストと、事前定義された
構文(規則)と、すべての可能な語彙の音声パターンを
含むデータベースを使用する。この文法グラフは、シス
テムが初期設定中であり、両方のメモリが空なので、メ
モリ位置"A"にロードされる。次に、位置"A"が使用中
であることを示すフラグがセットされる。この時点
で、"A"の文法グラフに対する認識が発生する。その
間、システムは待機状態にあり、適用業務からの入力を
待つ。更新を受信すると、デルタ・コンパイル・プロセ
スが開始される。更新は、追加の航空機IDもしくは削
除またはその両方を含み、あるいは完全に新しいIDリ
ストも含むことができる。デルタ・コンパイルの一部と
して、これらの違いが調整され、新しい文法グラフが生
成される。このコンパイル中に、必要に応じて構文デー
タベースおよび音声パターン・データベースからデータ
が取り出される。次のステップでは、新しい文法グラフ
を記憶する。フラグの状態が検査される。フラグが真で
ある("A"が使用中である)場合、位置"B"がロードさ
れる。システムは次に、ループに入り、活用文法が"A"
から"B"に、あるいは"B"から"A"に変更できる時間を
待つ。認識活動が検出されない場合は、メモリ・スイッ
チがトグルされる。活動が進行中である場合、システム
は、現在の認識の終りまでループし、その後、スイッチ
がトグルされる。スイッチを切り替えている間に、ただ
ちに次の認識が開始する場合、切替え段で適切なバッフ
ァリングが行われ、認識を保留にして実時間に追いつく
ことができるようになる。
【0024】
【発明の効果】多数の異なる適用業務で使用される音声
認識用の対話型動的文法制約システムについて説明し
た。航空管制用の特定の適用業務は、実時間設定におい
て高精度の音声認識能力を示した。
認識用の対話型動的文法制約システムについて説明し
た。航空管制用の特定の適用業務は、実時間設定におい
て高精度の音声認識能力を示した。
【図1】従来の技術で知られる典型的な音声認識システ
ムの概略図である。
ムの概略図である。
【図2】本発明の対話型動的文法制約音声認識システム
を示す図である。
を示す図である。
【図3】「一般航空」と呼ばれる1つの種類の航空機I
Dを作成するための構文の例を示す図である。
Dを作成するための構文の例を示す図である。
【図4】すべての可能な一般航空航空機IDに関する文
法グラフの様々なノードの例を示す図である。
法グラフの様々なノードの例を示す図である。
【図5】表1に列挙した特定の一般航空航空機IDに関
する「非常に制約された」文法グラフを示す図である。
する「非常に制約された」文法グラフを示す図である。
【図6】本発明の動的文法制約の実施態様の擬似コード
・リストである。
・リストである。
10 外部システム 12 双方向インタフェース 15 制御/入出力モジュール 17 制御/入出力プロセッサ 22 実時間コンパイラ 25 データベース 27 音声パターン・データベース 30 メモリ 32 標準文法グラフ"A" 35 増補文法グラフ"B" 47 認識プロセッサ 50 対話型動的文法制約システム 55 オンライン・システム 60 オフライン・プロセッサ
Claims (7)
- 【請求項1】音声認識語彙を含む音声認識データベース
と、 実時間環境で走行する外部音声認識適用業務とインタフ
ェースする制御装置と、 前記外部適用業務からの入力に基づいて、利用可能な文
法グラフを生成するコンパイラと、 前記コンパイルされた文法グラフをメモリ位置に記憶す
る記憶手段と、 前記文法グラフの内容との比較によって、前記外部適用
業務が受け取った音声パターンを分析し、前記外部適用
業務に認識結果を出力する認識プロセッサとを備え、 前記文法グラフが、前記外部適用業務の実時間環境条件
に基づき定期的再コンパイルによって更新されて、利用
可能な語彙を制約することを特徴とする、 対話型動的文法制約を使用する音声認識システム。 - 【請求項2】単一の文法グラフを、認識プロセッサと共
に使用することを特徴とする、請求項1に記載のシステ
ム。 - 【請求項3】2つの文法グラフが、順次更新され、かつ
前記文法グラフの一方または他方を認識プロセッサに接
続するスイッチを有し、前記文法グラフそれぞれの内容
が、認識プロセッサに接続されていないときだけ更新さ
れることを特徴とする、請求項1に記載のシステム。 - 【請求項4】コンパイラが、外部適用業務が使用できな
くなった語彙を削除することを特徴とする、請求項1に
記載のシステム。 - 【請求項5】外部適用業務から利用可能な活用語彙に関
する入力情報を受け取るステップと、 入力情報を音声パターン・データベースでコンパイルし
て、活用語彙を表す文法グラフを得るステップと、 文法グラフを認識プロセッサで使用して、音声を分析す
るステップと、 外部適用業務から受け取った変化する入力情報に基づい
て文法グラフを定期的に更新して、高精度の音声認識を
実現するための対話型の動的に制約された音声語彙を得
るステップとを備えることを特徴とする、音声認識シス
テムの語彙を動的に制約する方法。 - 【請求項6】さらに、文法グラフが認識プロセッサに接
続されていないときに限り、2つの文法グラフのうちの
一方を順次更新するステップと、 認識処理の間に一方の文法グラフと他方の文法グラフの
間で接続を切り替えるステップとを備えることを特徴と
する、請求項5に記載の方法。 - 【請求項7】コンパイル中に文法グラフから非活用語彙
を削除するステップを含むことを特徴とする、請求項5
に記載の方法。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US4237393A | 1993-04-02 | 1993-04-02 | |
| US042373 | 1993-04-02 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH06308995A true JPH06308995A (ja) | 1994-11-04 |
Family
ID=21921565
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP6049648A Pending JPH06308995A (ja) | 1993-04-02 | 1994-03-22 | 音声認識システム |
Country Status (2)
| Country | Link |
|---|---|
| EP (1) | EP0618565A3 (ja) |
| JP (1) | JPH06308995A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2010211536A (ja) * | 2009-03-10 | 2010-09-24 | Hitachi Ltd | 空港向け航空管制システム |
Families Citing this family (16)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6092043A (en) * | 1992-11-13 | 2000-07-18 | Dragon Systems, Inc. | Apparatuses and method for training and operating speech recognition systems |
| US5920836A (en) * | 1992-11-13 | 1999-07-06 | Dragon Systems, Inc. | Word recognition system using language context at current cursor position to affect recognition probabilities |
| JP3530591B2 (ja) * | 1994-09-14 | 2004-05-24 | キヤノン株式会社 | 音声認識装置及びこれを用いた情報処理装置とそれらの方法 |
| EP0718823B1 (de) * | 1994-12-23 | 2000-09-20 | Siemens Aktiengesellschaft | Verfahren zur Umwandlung von sprachlich eingegebenen Informationen in maschinenlesbare Daten |
| US5668928A (en) * | 1995-01-31 | 1997-09-16 | Kor Team International, Inc. | Speech recognition system and method with automatic syntax generation |
| US6167377A (en) * | 1997-03-28 | 2000-12-26 | Dragon Systems, Inc. | Speech recognition language models |
| DE19905916C2 (de) * | 1998-02-14 | 2003-07-03 | Tiefenbach Gmbh | Weichen-Steuerung |
| US20030007609A1 (en) * | 2001-07-03 | 2003-01-09 | Yuen Michael S. | Method and apparatus for development, deployment, and maintenance of a voice software application for distribution to one or more consumers |
| US7697673B2 (en) | 2003-11-17 | 2010-04-13 | Apptera Inc. | System for advertisement selection, placement and delivery within a multiple-tenant voice interaction service system |
| US7890328B1 (en) * | 2006-09-07 | 2011-02-15 | At&T Intellectual Property Ii, L.P. | Enhanced accuracy for speech recognition grammars |
| FR3080941B1 (fr) * | 2018-05-04 | 2020-04-17 | Thales | Systeme et procede de reconnaissance vocale pour aeronef |
| US11967306B2 (en) | 2021-04-14 | 2024-04-23 | Honeywell International Inc. | Contextual speech recognition methods and systems |
| US12190861B2 (en) | 2021-04-22 | 2025-01-07 | Honeywell International Inc. | Adaptive speech recognition methods and systems |
| US12431025B2 (en) | 2021-06-16 | 2025-09-30 | Honeywell International Inc. | Contextual transcription augmentation methods and systems |
| US12505751B2 (en) | 2022-05-12 | 2025-12-23 | Honeywell International Inc. | Transcription systems and related supplementation methods |
| US12437156B2 (en) | 2022-10-28 | 2025-10-07 | Honeywell International Inc. | Transcription systems and methods for challenging clearances |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB8702910D0 (en) * | 1987-02-10 | 1987-03-18 | British Telecomm | Multi-user speech recognition system |
| US5386492A (en) * | 1992-06-29 | 1995-01-31 | Kurzweil Applied Intelligence, Inc. | Speech recognition system utilizing vocabulary model preselection |
| EP0602296A1 (en) * | 1992-12-17 | 1994-06-22 | International Business Machines Corporation | Adaptive method for generating field dependant models for intelligent systems |
-
1994
- 1994-01-14 EP EP94100506A patent/EP0618565A3/en not_active Withdrawn
- 1994-03-22 JP JP6049648A patent/JPH06308995A/ja active Pending
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2010211536A (ja) * | 2009-03-10 | 2010-09-24 | Hitachi Ltd | 空港向け航空管制システム |
Also Published As
| Publication number | Publication date |
|---|---|
| EP0618565A2 (en) | 1994-10-05 |
| EP0618565A3 (en) | 1996-06-26 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5613036A (en) | Dynamic categories for a speech recognition system | |
| Glass et al. | Multilingual spoken-language understanding in the MIT Voyager system | |
| US6704710B2 (en) | Assigning meanings to utterances in a speech recognition system | |
| US7529657B2 (en) | Configurable parameters for grammar authoring for speech recognition and natural language understanding | |
| US5991712A (en) | Method, apparatus, and product for automatic generation of lexical features for speech recognition systems | |
| US7072837B2 (en) | Method for processing initially recognized speech in a speech recognition session | |
| US6434521B1 (en) | Automatically determining words for updating in a pronunciation dictionary in a speech recognition system | |
| EP1538535A2 (en) | Determination of meaning for text input in natural language understanding systems | |
| US5875426A (en) | Recognizing speech having word liaisons by adding a phoneme to reference word models | |
| EP0618565A2 (en) | Interactive dynamic grammar constraint in speech recognition | |
| JPH11149297A (ja) | 情報アクセスのための口頭対話システム | |
| Chung et al. | A dynamic vocabulary spoken dialogue interface | |
| Minker | Stochastic versus rule-based speech understanding for information retrieval | |
| JP3634863B2 (ja) | 音声認識システム | |
| Rudnicky et al. | Spoken language recognition in an office management domain | |
| Eckert et al. | Managing spoken dialogues for information services. | |
| US6735560B1 (en) | Method of identifying members of classes in a natural language understanding system | |
| EP0980063A2 (en) | Memory management in search phase of a speech recognizer | |
| Nakano et al. | Mokusei: a telephone-based Japanese conversational system in the weather domain. | |
| Seneff et al. | Automatic induction of n-gram language models from a natural language grammar. | |
| US7548857B2 (en) | Method for natural voice recognition based on a generative transformation/phrase structure grammar | |
| CN114547068A (zh) | 数据生成方法、装置、设备及计算机可读存储介质 | |
| Gibbon et al. | Speech lexica and consistent multilingual vocabularies | |
| Ackermann et al. | Speedata: Multilingual spoken data entry | |
| Xu et al. | A multilingual-supporting dialog system using a common dialog controller. |