JPH07210189A - 音声認識方法およびシステム - Google Patents
音声認識方法およびシステムInfo
- Publication number
- JPH07210189A JPH07210189A JP6277404A JP27740494A JPH07210189A JP H07210189 A JPH07210189 A JP H07210189A JP 6277404 A JP6277404 A JP 6277404A JP 27740494 A JP27740494 A JP 27740494A JP H07210189 A JPH07210189 A JP H07210189A
- Authority
- JP
- Japan
- Prior art keywords
- speech
- recognition system
- mobile
- speech recognition
- location
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000000034 method Methods 0.000 title claims abstract description 45
- 230000001413 cellular effect Effects 0.000 claims abstract description 11
- 230000004044 response Effects 0.000 claims description 4
- 230000002708 enhancing effect Effects 0.000 claims description 2
- 238000010586 diagram Methods 0.000 description 4
- 230000005540 biological transmission Effects 0.000 description 2
- 240000006766 Cornus mas Species 0.000 description 1
- 230000019771 cognition Effects 0.000 description 1
- 239000002131 composite material Substances 0.000 description 1
- 230000010485 coping Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 238000001914 filtration Methods 0.000 description 1
- 230000006870 function Effects 0.000 description 1
- 238000007619 statistical method Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/26—Speech to text systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/28—Constructional details of speech recognition systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/226—Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/226—Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
- G10L2015/228—Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics of application context
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Navigation (AREA)
- Mobile Radio Communication Systems (AREA)
Abstract
(57)【要約】 (修正有)
【目的】 決定された地理的位置に基づいて音声認識シ
ステムのパープレクシティを低減する方法およびシステ
ム。 【構成】 音声を表す記憶されたテンプレートと突き合
わせて入力音声フレームを処理する可動式音声認識シス
テムでは、基本音声語彙を表す音声テンプレートのコア
・ライブラリ38が作成されて記憶される。それぞれ、
特定の地理的位置の専用語彙を表す音声テンプレートを
含む、音声テンプレートの複数の位置固有のライブラリ
40も作成されて記憶される。次いで、セルラ電話シス
テム、衛星測位システム、または他の類似のシステムを
使用して可動式音声認識システムの地理的位置が定期的
に決定され、システムの現在位置用の音声テンプレート
の位置固有のライブラリが識別される。次いで、音声入
力フレームがコア・ライブラリ38と特定の位置固有の
ライブラリ40を組み合わせたものと突き合わされて処
理する。
ステムのパープレクシティを低減する方法およびシステ
ム。 【構成】 音声を表す記憶されたテンプレートと突き合
わせて入力音声フレームを処理する可動式音声認識シス
テムでは、基本音声語彙を表す音声テンプレートのコア
・ライブラリ38が作成されて記憶される。それぞれ、
特定の地理的位置の専用語彙を表す音声テンプレートを
含む、音声テンプレートの複数の位置固有のライブラリ
40も作成されて記憶される。次いで、セルラ電話シス
テム、衛星測位システム、または他の類似のシステムを
使用して可動式音声認識システムの地理的位置が定期的
に決定され、システムの現在位置用の音声テンプレート
の位置固有のライブラリが識別される。次いで、音声入
力フレームがコア・ライブラリ38と特定の位置固有の
ライブラリ40を組み合わせたものと突き合わされて処
理する。
Description
【0001】
【産業上の利用分野】本発明は、全般的には、改良され
た音声認識システムに関し、詳細には、音声認識精度向
上のための改良された方法およびシステムに関する。さ
らに詳細には、本発明は音声テンプレートの位置固有の
ライブラリおよびシステム位置の識別を使用する可動式
システムでの音声認識向上のための方法およびシステム
に関する。
た音声認識システムに関し、詳細には、音声認識精度向
上のための改良された方法およびシステムに関する。さ
らに詳細には、本発明は音声テンプレートの位置固有の
ライブラリおよびシステム位置の識別を使用する可動式
システムでの音声認識向上のための方法およびシステム
に関する。
【0002】
【従来の技術】音声認識は従来技術で周知である。既知
の話者の所与の語彙からそれぞれの単語を認識すること
は最も簡単なタイプの音声認識であり、この種の音声認
識はかなり前から知られている。認識すべき語彙内の単
語は通常、それぞれ、語彙中の単語の音声パターンを表
す、個別のテンプレートとして事前に記憶される。それ
ぞれの単語が発音されるとき、システムは単に、語彙を
表す個別のテンプレートとその単語を比較する。この技
術は一般に、全単語テンプレート突合せと呼ばれてい
る。成功している多数の音声認識システムは、この技術
を動的プログラミングと共に使用して、発音された単語
と事前に記憶されたテンプレートの間の非線形タイム・
スケール変動に対処している。
の話者の所与の語彙からそれぞれの単語を認識すること
は最も簡単なタイプの音声認識であり、この種の音声認
識はかなり前から知られている。認識すべき語彙内の単
語は通常、それぞれ、語彙中の単語の音声パターンを表
す、個別のテンプレートとして事前に記憶される。それ
ぞれの単語が発音されるとき、システムは単に、語彙を
表す個別のテンプレートとその単語を比較する。この技
術は一般に、全単語テンプレート突合せと呼ばれてい
る。成功している多数の音声認識システムは、この技術
を動的プログラミングと共に使用して、発音された単語
と事前に記憶されたテンプレートの間の非線形タイム・
スケール変動に対処している。
【0003】連続する音声、あるいは固有名または地名
を含む音声を認識することはこれよりも難しい。従来技
術では、連続する音声、すなわち連結された単語は多重
経路動的プログラミングを使用して認識されている。そ
のようなシステムの一例は、H.サコエ(Sakoe)の論文
「Two Level DP Matching A Dynamic Programming Base
d Pattern Matching Algorithm For Connected Word Re
cognition」IEEE Transactions on Acoustics Speech a
nd Signal Processing、ASSP−27巻、第6号、1
979年12月、588−595ページで提案されてい
る。この論文は、入力パターン全体に最もよく一致する
単語テンプレートのシーケンスを見つけるためのツー・
パス動的プログラミング・アルゴリズムを提案したもの
である。システムを通る各パスは、あらゆる入力パター
ンのあらゆる可能な部分と突き合わされたあらゆるテン
プレート間の類似性を示すスコアを生成する。次いで第
2のパスでは、スコアを使用して、入力パターン全体に
対応する最良のテンプレート・シーケンスを見つける。
を含む音声を認識することはこれよりも難しい。従来技
術では、連続する音声、すなわち連結された単語は多重
経路動的プログラミングを使用して認識されている。そ
のようなシステムの一例は、H.サコエ(Sakoe)の論文
「Two Level DP Matching A Dynamic Programming Base
d Pattern Matching Algorithm For Connected Word Re
cognition」IEEE Transactions on Acoustics Speech a
nd Signal Processing、ASSP−27巻、第6号、1
979年12月、588−595ページで提案されてい
る。この論文は、入力パターン全体に最もよく一致する
単語テンプレートのシーケンスを見つけるためのツー・
パス動的プログラミング・アルゴリズムを提案したもの
である。システムを通る各パスは、あらゆる入力パター
ンのあらゆる可能な部分と突き合わされたあらゆるテン
プレート間の類似性を示すスコアを生成する。次いで第
2のパスでは、スコアを使用して、入力パターン全体に
対応する最良のテンプレート・シーケンスを見つける。
【0004】米国特許第5040127号は、音声を表
す事前に記憶されたテンプレートと入力フレームを比較
し、次いで、認識される可能性のある個別の単語として
検討中の各テンプレート用のリンクされたネットワーク
中のレコード間のリンクを作成することによって連続す
る音声を処理する連続音声認識システムを提案したもの
である。リンクされたレコードは、テンプレートを表す
記号と、リンク・レコードが記憶された相対時間を表す
シーケンス・インディケータと、あるリンク・レコード
の派生元のネットワーク中の該リンク・レコードを示す
ポインタとを含む各データ・セットを含むインデックス
付きデータ・セットとして記憶された親元リンク・レコ
ードおよび派生リンク・レコードを含む。
す事前に記憶されたテンプレートと入力フレームを比較
し、次いで、認識される可能性のある個別の単語として
検討中の各テンプレート用のリンクされたネットワーク
中のレコード間のリンクを作成することによって連続す
る音声を処理する連続音声認識システムを提案したもの
である。リンクされたレコードは、テンプレートを表す
記号と、リンク・レコードが記憶された相対時間を表す
シーケンス・インディケータと、あるリンク・レコード
の派生元のネットワーク中の該リンク・レコードを示す
ポインタとを含む各データ・セットを含むインデックス
付きデータ・セットとして記憶された親元リンク・レコ
ードおよび派生リンク・レコードを含む。
【0005】固有名を認識することは、音声認識システ
ムのいわゆる「パープレクシティ(perplexity)」が増
加することを表し、この問題は最近、米国特許第521
2730号で認識された。この特許は、複数の発音が可
能な固有名の音声表現を認識するためのテキスト派生認
識モデルを使用して名前認識を実行するものである。こ
の特許に記載された名前認識技術は、名前テキストを指
定することによってアクセスされるテキスト・データベ
ースに名前テキストを入力し、次いで、選択された数の
テキスト派生認識モデルを名前テキストから作成するこ
とを含む。各テキスト派生認識モデルは名前の少なくと
も1つの発音を表す。次いで、発音された名前入力によ
ってテキスト・データベースにアクセスが試みられるた
びに、テキスト・データベースが、発音された名前入力
と比較され、一致するかどうかが決定される。
ムのいわゆる「パープレクシティ(perplexity)」が増
加することを表し、この問題は最近、米国特許第521
2730号で認識された。この特許は、複数の発音が可
能な固有名の音声表現を認識するためのテキスト派生認
識モデルを使用して名前認識を実行するものである。こ
の特許に記載された名前認識技術は、名前テキストを指
定することによってアクセスされるテキスト・データベ
ースに名前テキストを入力し、次いで、選択された数の
テキスト派生認識モデルを名前テキストから作成するこ
とを含む。各テキスト派生認識モデルは名前の少なくと
も1つの発音を表す。次いで、発音された名前入力によ
ってテキスト・データベースにアクセスが試みられるた
びに、テキスト・データベースが、発音された名前入力
と比較され、一致するかどうかが決定される。
【0006】米国特許第5202952号は、それぞ
れ、平滑化されると所定の数のフレームに対して平滑な
フレーム・モデルを生成する、フレーム・データセット
に音声を変換することによって音声を認識する、大規模
語彙連続音声プレフィルタリング処理システムを開示す
るものである。一連のフレーム・ピリオドにわたって音
声的に類似している単語モデルのクラスタが常駐語彙と
して指定され、次いで、平滑化されたフレーム・モデル
の比較対象であるクラスタ用の確率モデルを使用して評
価された平滑フレームの確度を含むクラスタ・スコアが
システムによって生成される。
れ、平滑化されると所定の数のフレームに対して平滑な
フレーム・モデルを生成する、フレーム・データセット
に音声を変換することによって音声を認識する、大規模
語彙連続音声プレフィルタリング処理システムを開示す
るものである。一連のフレーム・ピリオドにわたって音
声的に類似している単語モデルのクラスタが常駐語彙と
して指定され、次いで、平滑化されたフレーム・モデル
の比較対象であるクラスタ用の確率モデルを使用して評
価された平滑フレームの確度を含むクラスタ・スコアが
システムによって生成される。
【0007】これらのシステムはそれぞれ、音声認識が
成功するには、連続音声のパープレクシティを低減する
必要があることを認識したものである。この問題に取り
組んだ文献には、「Perplexity-A Measure of Difficul
ty of Speech Recognition Tasks」、Journal of the A
coustical Society of America、第62巻、補遺第1
号、1977年秋、S−63ページ、および「Continuo
us Speech RecognitionStatistical Methods」、Handbo
ok of Statistics、第2巻、Classification Pattern R
ecognition and Reduction of Dimensionality、North-
Holland Publishing Company、1982年、549−5
73ページがある。
成功するには、連続音声のパープレクシティを低減する
必要があることを認識したものである。この問題に取り
組んだ文献には、「Perplexity-A Measure of Difficul
ty of Speech Recognition Tasks」、Journal of the A
coustical Society of America、第62巻、補遺第1
号、1977年秋、S−63ページ、および「Continuo
us Speech RecognitionStatistical Methods」、Handbo
ok of Statistics、第2巻、Classification Pattern R
ecognition and Reduction of Dimensionality、North-
Holland Publishing Company、1982年、549−5
73ページがある。
【0008】上記に鑑みて、音声認識が成功するには、
発音された多数の類似の単語を区別する拡張された能力
が必要であることが明らかであろう。これは、固有名、
地名、および数字の場合に特に難しい問題である。した
がって、音声認識の精度および効率を高める方法および
システムが必要であることが明らかであろう。
発音された多数の類似の単語を区別する拡張された能力
が必要であることが明らかであろう。これは、固有名、
地名、および数字の場合に特に難しい問題である。した
がって、音声認識の精度および効率を高める方法および
システムが必要であることが明らかであろう。
【0009】
【発明が解決しようとする課題】したがって、本発明の
一目的は、改良された音声認識システムを提供すること
である。
一目的は、改良された音声認識システムを提供すること
である。
【0010】本発明の他の目的は、音声認識精度および
効率の向上のための改良された方法およびシステムを提
供することである。
効率の向上のための改良された方法およびシステムを提
供することである。
【0011】本発明の他の目的は、音声テンプレートの
位置固有のライブラリおよびシステム位置の識別を使用
する可動式音声認識システムでの音声認識の向上のため
の改良された方法およびシステムを提供することであ
る。
位置固有のライブラリおよびシステム位置の識別を使用
する可動式音声認識システムでの音声認識の向上のため
の改良された方法およびシステムを提供することであ
る。
【0012】
【課題を解決するための手段】前記の目的はこれから説
明するようにして達成される。決定された地理的位置に
基づいて音声認識システムのパープレクシティを低減す
る方法およびシステムを開示する。入力音声フレームを
音声を表す記憶されたテンプレートと突き合わせて処理
する可動式音声認識システムでは、基本音声語彙を表す
音声テンプレートのコア・ライブラリが作成されて記憶
される。それぞれ、固有の地理的位置の専用語彙を表す
音声テンプレートを含む、音声テンプレートの複数の位
置固有のライブラリも作成されて記憶される。次いで、
セルラ電話システム、衛星測位システム、または他の類
似のシステムを使用して可動式音声認識システムの地理
的位置が定期的に決定され、システムの現在位置用の音
声テンプレートの位置固有のライブラリが識別される。
次いで、音声入力フレームがコア・ライブラリと特定の
位置固有のライブラリを組み合わせたものと突き合わさ
れて処理され、システムによる音声認識の効率が大幅に
向上する。位置固有のライブラリはそれぞれ、特定の地
理的位置内の地名、固有名、および会社名を表す音声テ
ンプレートを含むことが好ましい。
明するようにして達成される。決定された地理的位置に
基づいて音声認識システムのパープレクシティを低減す
る方法およびシステムを開示する。入力音声フレームを
音声を表す記憶されたテンプレートと突き合わせて処理
する可動式音声認識システムでは、基本音声語彙を表す
音声テンプレートのコア・ライブラリが作成されて記憶
される。それぞれ、固有の地理的位置の専用語彙を表す
音声テンプレートを含む、音声テンプレートの複数の位
置固有のライブラリも作成されて記憶される。次いで、
セルラ電話システム、衛星測位システム、または他の類
似のシステムを使用して可動式音声認識システムの地理
的位置が定期的に決定され、システムの現在位置用の音
声テンプレートの位置固有のライブラリが識別される。
次いで、音声入力フレームがコア・ライブラリと特定の
位置固有のライブラリを組み合わせたものと突き合わさ
れて処理され、システムによる音声認識の効率が大幅に
向上する。位置固有のライブラリはそれぞれ、特定の地
理的位置内の地名、固有名、および会社名を表す音声テ
ンプレートを含むことが好ましい。
【0013】
【実施例】ここで、図面、特に図1を参照すると、本発
明の方法およびシステムを実施するために使用できる可
動式音声認識システム12の絵画図が示されている。図
のように、可動式音声認識システム12は、いわゆる
「ノートブック・コンピュータ」など適当にプログラム
されたポータブル・コンピュータを使用して実施するこ
とができる。図のように、可動式音声認識システム12
はキーボード14と、ディスプレイ16と、表示画面1
8とを含むことができる。本明細書で詳細に説明するよ
うに、可動式音声認識システム12は、言葉が発音され
たことを検出したことに応じて可動式音声認識システム
12の特定の地理的位置を電気的に決定するために使用
できるアンテナ20を含むこともできる。
明の方法およびシステムを実施するために使用できる可
動式音声認識システム12の絵画図が示されている。図
のように、可動式音声認識システム12は、いわゆる
「ノートブック・コンピュータ」など適当にプログラム
されたポータブル・コンピュータを使用して実施するこ
とができる。図のように、可動式音声認識システム12
はキーボード14と、ディスプレイ16と、表示画面1
8とを含むことができる。本明細書で詳細に説明するよ
うに、可動式音声認識システム12は、言葉が発音され
たことを検出したことに応じて可動式音声認識システム
12の特定の地理的位置を電気的に決定するために使用
できるアンテナ20を含むこともできる。
【0014】図1には、可動式音声認識システム12に
結合されたオーディオ入力装置も示されている。マイク
ロフォン22は、可動式音声認識システム12用のオー
ディオ入力装置として働き、かつ追加情報を提供し、特
定の機能を実行し、あるいは場合によっては音声コマン
ドに応答するために、音声認識技術分野の当業者に周知
のように、可動式音声認識システム12のユーザによっ
て発音された言葉を捕獲するために使用することができ
る。
結合されたオーディオ入力装置も示されている。マイク
ロフォン22は、可動式音声認識システム12用のオー
ディオ入力装置として働き、かつ追加情報を提供し、特
定の機能を実行し、あるいは場合によっては音声コマン
ドに応答するために、音声認識技術分野の当業者に周知
のように、可動式音声認識システム12のユーザによっ
て発音された言葉を捕獲するために使用することができ
る。
【0015】可動式音声認識システム12は本明細書内
では可動式として特徴付けられており、そのようなシス
テムは、自動車、パトカー、消防車、救急車、ユーザが
携帯できるパーソナル・ディジタル・アシスタント(P
DA)などの可動式プラットフォームで応用されること
が予期される。本開示を参照すれば、当業者には、シス
テムが街路名、番地、レストランの名前、会社名、可動
式システムが位置する特定の地理的位置に関連する他の
固有名を認識する必要があるため、可動式プラットフォ
ーム上の音声認識が音声認識問題のパープレクシティの
一定の増加を表すことが理解されよう。
では可動式として特徴付けられており、そのようなシス
テムは、自動車、パトカー、消防車、救急車、ユーザが
携帯できるパーソナル・ディジタル・アシスタント(P
DA)などの可動式プラットフォームで応用されること
が予期される。本開示を参照すれば、当業者には、シス
テムが街路名、番地、レストランの名前、会社名、可動
式システムが位置する特定の地理的位置に関連する他の
固有名を認識する必要があるため、可動式プラットフォ
ーム上の音声認識が音声認識問題のパープレクシティの
一定の増加を表すことが理解されよう。
【0016】この問題を解決するには、可動式音声認識
システム12がシステムの地理的位置を決定するための
装置を含むことが好ましい。これは、衛星測位システム
などの測位システムの使用を含む多数の異なる技術を使
用して行うことができる。したがって、可動式音声認識
システム12のアンテナ20で衛星28からの無線信号
を受信し、それを使用して、特定の発音時の可動式音声
認識システム12の特定の地理的位置を決定することが
できる。同様に、セルラ送信塔24および26などのセ
ルラ電話網からの無線信号を使用して、可動式音声認識
システム12の地理的位置を効率的に決定することもで
きる。図示しないが、当業者には、特殊目的の無線信
号、慣性誘導システム、または他の類似の電子手段を使
用して、これらの技術の現在の範囲内の方法で、可動式
音声認識システム12の地理的位置を決定できることも
理解されよう。単にユーザがキーボード14を使用して
地理的位置の指示を可動式音声認識システム12に入力
することもできる。
システム12がシステムの地理的位置を決定するための
装置を含むことが好ましい。これは、衛星測位システム
などの測位システムの使用を含む多数の異なる技術を使
用して行うことができる。したがって、可動式音声認識
システム12のアンテナ20で衛星28からの無線信号
を受信し、それを使用して、特定の発音時の可動式音声
認識システム12の特定の地理的位置を決定することが
できる。同様に、セルラ送信塔24および26などのセ
ルラ電話網からの無線信号を使用して、可動式音声認識
システム12の地理的位置を効率的に決定することもで
きる。図示しないが、当業者には、特殊目的の無線信
号、慣性誘導システム、または他の類似の電子手段を使
用して、これらの技術の現在の範囲内の方法で、可動式
音声認識システム12の地理的位置を決定できることも
理解されよう。単にユーザがキーボード14を使用して
地理的位置の指示を可動式音声認識システム12に入力
することもできる。
【0017】ここで、図2を参照すると、図1の可動式
音声認識システム12のハイ・レベル・ブロック図が示
されている。図2は、この地理的位置の決定を使用して
音声認識のパープレクシティを低減する方法を示す。図
2内に示したように、基本音声語彙を表す音声テンプレ
ートのコア・ライブラリ38を含むメモリ36が可動式
音声認識システム12内に設けられる。同様に、複数の
位置固有のライブラリ40もメモリ36内に記憶されて
いる。位置固有のライブラリ40はそれぞれ、特定の地
理的位置の専用語彙を表すテンプレートを含む。たとえ
ば、音声テンプレートの位置固有のライブラリはそれぞ
れ、その地理的位置内の街路名、その地理的位置内の会
社名、または選択された地理的位置に関連する他の固有
名を表す一連の音声テンプレートを含むことができる。
音声認識システム12のハイ・レベル・ブロック図が示
されている。図2は、この地理的位置の決定を使用して
音声認識のパープレクシティを低減する方法を示す。図
2内に示したように、基本音声語彙を表す音声テンプレ
ートのコア・ライブラリ38を含むメモリ36が可動式
音声認識システム12内に設けられる。同様に、複数の
位置固有のライブラリ40もメモリ36内に記憶されて
いる。位置固有のライブラリ40はそれぞれ、特定の地
理的位置の専用語彙を表すテンプレートを含む。たとえ
ば、音声テンプレートの位置固有のライブラリはそれぞ
れ、その地理的位置内の街路名、その地理的位置内の会
社名、または選択された地理的位置に関連する他の固有
名を表す一連の音声テンプレートを含むことができる。
【0018】したがって、マイクロフォン22で発音が
検出されるたびに、プロセッサ32に結合されたアナロ
グ・ディジタル変換器34を使用する処理ができるよう
にその音声を適切に変換することができる。次いで、プ
ロセッサ32は位置決定回路30を使用して、発音時の
可動式音声認識システム12の特定の地理的位置を識別
する。上述のように、これは、衛星測位システム、また
はアンテナ20で受信されるセルラ電話からの無線周波
数信号を使用し、あるいはユーザが特定の地理的位置の
IDを定期的にキーボード14で入力することを必要と
する簡単な手段によって行うことができる。
検出されるたびに、プロセッサ32に結合されたアナロ
グ・ディジタル変換器34を使用する処理ができるよう
にその音声を適切に変換することができる。次いで、プ
ロセッサ32は位置決定回路30を使用して、発音時の
可動式音声認識システム12の特定の地理的位置を識別
する。上述のように、これは、衛星測位システム、また
はアンテナ20で受信されるセルラ電話からの無線周波
数信号を使用し、あるいはユーザが特定の地理的位置の
IDを定期的にキーボード14で入力することを必要と
する簡単な手段によって行うことができる。
【0019】次いで、プロセッサ32によって、位置決
定回路30の出力を使用して、メモリ36内に含まれて
いる複数の位置固有のライブラリ40の内の特定の1つ
が選択される。次いで、入力音声データ・フレームが、
コア・ライブラリ38と位置固有のライブラリ40の内
の特定の1つとから成る複合ライブラリと比較される。
このように、可動式音声認識システムでの音声認識のパ
ープレクシティを大幅に低減し、それによってシステム
内の音声認識の精度および効率を拡張することができ
る。
定回路30の出力を使用して、メモリ36内に含まれて
いる複数の位置固有のライブラリ40の内の特定の1つ
が選択される。次いで、入力音声データ・フレームが、
コア・ライブラリ38と位置固有のライブラリ40の内
の特定の1つとから成る複合ライブラリと比較される。
このように、可動式音声認識システムでの音声認識のパ
ープレクシティを大幅に低減し、それによってシステム
内の音声認識の精度および効率を拡張することができ
る。
【0020】音声認識における従来の試みに関して上記
で論じたように、入力音声を処理する際に突き合わせる
テンプレートは、個別の単語、句、または単語の一部を
表すテンプレートで構成することができる。「テンプレ
ート」の語は、本明細書では、プロセッサ32が未知の
発音を識別するために使用できる記憶されたディジタル
表現を意味するものとする。
で論じたように、入力音声を処理する際に突き合わせる
テンプレートは、個別の単語、句、または単語の一部を
表すテンプレートで構成することができる。「テンプレ
ート」の語は、本明細書では、プロセッサ32が未知の
発音を識別するために使用できる記憶されたディジタル
表現を意味するものとする。
【0021】最後に図3を参照すると、本発明の方法を
実施するためのプロセスを示すハイ・レベル・フロー・
チャートが示されている。図のように、このプロセスは
ブロック60で始まり、次いで、ブロック62に進む。
ブロック62では、言葉が発音されたことが検出された
かどうかを判定する。検出されなかった場合、プロセス
は単に、発音が検出されるまで反復する。しかし、言葉
が発音されたことが検出されると、プロセスはブロック
64に進む。
実施するためのプロセスを示すハイ・レベル・フロー・
チャートが示されている。図のように、このプロセスは
ブロック60で始まり、次いで、ブロック62に進む。
ブロック62では、言葉が発音されたことが検出された
かどうかを判定する。検出されなかった場合、プロセス
は単に、発音が検出されるまで反復する。しかし、言葉
が発音されたことが検出されると、プロセスはブロック
64に進む。
【0022】ブロック64では、可動式音声認識システ
ム12の現在の地理的位置を決定する。上述のように、
これは、衛星測位システム、セルラ電話システム、ある
いは他の専用無線周波数信号または慣性航法技術を使用
して行うことができる。次いで、ブロック66で、地理
的位置の決定を使用して、特定の位置固有のライブラリ
が選択される。
ム12の現在の地理的位置を決定する。上述のように、
これは、衛星測位システム、セルラ電話システム、ある
いは他の専用無線周波数信号または慣性航法技術を使用
して行うことができる。次いで、ブロック66で、地理
的位置の決定を使用して、特定の位置固有のライブラリ
が選択される。
【0023】次いで、ブロック68で、入力発音が、基
本語彙単語のコア・ライブラリと、可動式音声認識シス
テム12の決定された地理的位置に関連する特定の位置
固有のライブラリとに突き合わされて処理される。次い
で、プロセスはブロック70に進む。ブロック70で
は、発音が認識されたかどうかを判定する。認識されな
かった場合、プロセスはブロック72に進む。ブロック
72では、エラー・メッセージ、ユーザに発音を繰り返
させる音声化されたコマンド、またはシステムが音声を
認識できなかったことを解決するための同様な技術が生
成される。プロセスは、そのようなメッセージを生成し
た後、ブロック76に進み、リターンして、次の発音が
検出されるのを待つ。
本語彙単語のコア・ライブラリと、可動式音声認識シス
テム12の決定された地理的位置に関連する特定の位置
固有のライブラリとに突き合わされて処理される。次い
で、プロセスはブロック70に進む。ブロック70で
は、発音が認識されたかどうかを判定する。認識されな
かった場合、プロセスはブロック72に進む。ブロック
72では、エラー・メッセージ、ユーザに発音を繰り返
させる音声化されたコマンド、またはシステムが音声を
認識できなかったことを解決するための同様な技術が生
成される。プロセスは、そのようなメッセージを生成し
た後、ブロック76に進み、リターンして、次の発音が
検出されるのを待つ。
【0024】再びブロック70を参照すると、音声が認
識された場合、プロセスはブロック74に進む。ブロッ
ク74でその音声を処理する。当業者には、ユーザに提
供される情報を生成し、システムのある部分の活動を制
御し、あるいは将来参照できるようにデータを記憶する
ように、音声を処理できることが理解されよう。次い
で、上記のように、プロセスはブロック76に進み、リ
ターンして、次の発音が検出されるのを待つ。
識された場合、プロセスはブロック74に進む。ブロッ
ク74でその音声を処理する。当業者には、ユーザに提
供される情報を生成し、システムのある部分の活動を制
御し、あるいは将来参照できるようにデータを記憶する
ように、音声を処理できることが理解されよう。次い
で、上記のように、プロセスはブロック76に進み、リ
ターンして、次の発音が検出されるのを待つ。
【0025】前記を参照すれば、当業者には、本発明の
方法およびシステムが、可動式音声認識システムの地理
的位置を決定し、次いで、音声テンプレートの位置固有
のライブラリを使用することによって、音声認識システ
ムのパープレクシティを大幅に低減し、それによって、
音声認識の精度および効率を高めることが理解されよ
う。
方法およびシステムが、可動式音声認識システムの地理
的位置を決定し、次いで、音声テンプレートの位置固有
のライブラリを使用することによって、音声認識システ
ムのパープレクシティを大幅に低減し、それによって、
音声認識の精度および効率を高めることが理解されよ
う。
【0026】まとめとして、本発明の構成に関して以下
の事項を開示する。
の事項を開示する。
【0027】(1)入力音声フレームを音声を表す記憶
されたテンプレートと突き合わせて処理する可動式音声
認識システムの効率を高める方法において、基本音声語
彙を表す音声テンプレートのコア・ライブラリを作成し
て記憶するステップと、それぞれ特定の地理的位置の専
用語彙を表す、音声テンプレートの複数の位置固有のラ
イブラリを作成して記憶するステップと、前記可動式音
声認識システムの地理的位置を決定するステップと、前
記可動式認識システムの前記地理的位置の前記決定に応
じて、音声テンプレートの前記複数の位置固有のライブ
ラリの内の特定の1つと音声テンプレートの前記コア・
ライブラリを組み合わせるステップと、音声の入力フレ
ームを前記コア・ライブラリおよび位置固有のライブラ
リと突き合わせて処理するステップとを含む方法。 (2)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、セルラ電話システムを使用して前
記可動式音声認識システムの地理的位置を決定するステ
ップを含むことを特徴とする、上記(1)に記載の可動
式音声認識システムの効率を拡張する方法。 (3)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、衛星測位システムの受信装置を使
用して前記可動式音声認識システムの地理的位置を決定
するステップを含むことを特徴とする、上記(1)に記
載の可動式音声認識システムの効率を拡張する方法。 (4)入力音声を受け取るためのオーディオ入力手段
と、メモリと、基本音声語彙を表す、前記メモリ内に記
憶された音声テンプレートのコア・ライブラリと、それ
ぞれ特定の地理的位置の専用語彙を表す、前記メモリ内
に記憶された音声テンプレートの複数の位置固有のライ
ブラリと、前記可動式音声認識システムの地理的位置を
決定するための位置決定手段と、前記メモリおよび前記
位置決定手段に結合された、前記可動式音声認識システ
ムの前記地理的位置の決定に応じて前記複数の位置固有
のライブラリの内の特定の1つを選択するためのライブ
ラリ選択手段と、前記オーディオ入力手段および前記メ
モリに結合された、入力音声フレームを前記コア・ライ
ブラリおよび前記複数の位置固有のライブラリの内の特
定の1つと突き合わせて処理するための音声プロセッサ
手段とを備え、音声認識の効率が高められることを特徴
とする可動式音声認識システム。 (5)前記オーディオ入力手段がマイクロフォンを含む
ことを特徴とする上記(4)に記載の可動式音声認識シ
ステム。 (6)前記位置決定手段がセルラ電話トランシーバを含
むことを特徴とする上記(4)に記載の可動式音声認識
システム。 (7)前記位置決定手段が衛星測位システム受信装置を
含むことを特徴とする上記(4)に記載の可動式音声認
識システム。 (8)前記音声プロセッサ手段がアナログ・ディジタル
変換器を含むことを特徴とする上記(4)に記載の可動
式音声認識システム。 (9)前記音声プロセッサ手段がパーソナル・コンピュ
ータを含むことを特徴とする上記(8)に記載の可動式
音声認識システム。 (10)音声テンプレートの前記複数の位置固有のライ
ブラリがそれぞれ、複数の地名を表す、複数のテンプレ
ートから成ることを特徴とする上記(4)に記載の可動
式音声認識システム。
されたテンプレートと突き合わせて処理する可動式音声
認識システムの効率を高める方法において、基本音声語
彙を表す音声テンプレートのコア・ライブラリを作成し
て記憶するステップと、それぞれ特定の地理的位置の専
用語彙を表す、音声テンプレートの複数の位置固有のラ
イブラリを作成して記憶するステップと、前記可動式音
声認識システムの地理的位置を決定するステップと、前
記可動式認識システムの前記地理的位置の前記決定に応
じて、音声テンプレートの前記複数の位置固有のライブ
ラリの内の特定の1つと音声テンプレートの前記コア・
ライブラリを組み合わせるステップと、音声の入力フレ
ームを前記コア・ライブラリおよび位置固有のライブラ
リと突き合わせて処理するステップとを含む方法。 (2)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、セルラ電話システムを使用して前
記可動式音声認識システムの地理的位置を決定するステ
ップを含むことを特徴とする、上記(1)に記載の可動
式音声認識システムの効率を拡張する方法。 (3)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、衛星測位システムの受信装置を使
用して前記可動式音声認識システムの地理的位置を決定
するステップを含むことを特徴とする、上記(1)に記
載の可動式音声認識システムの効率を拡張する方法。 (4)入力音声を受け取るためのオーディオ入力手段
と、メモリと、基本音声語彙を表す、前記メモリ内に記
憶された音声テンプレートのコア・ライブラリと、それ
ぞれ特定の地理的位置の専用語彙を表す、前記メモリ内
に記憶された音声テンプレートの複数の位置固有のライ
ブラリと、前記可動式音声認識システムの地理的位置を
決定するための位置決定手段と、前記メモリおよび前記
位置決定手段に結合された、前記可動式音声認識システ
ムの前記地理的位置の決定に応じて前記複数の位置固有
のライブラリの内の特定の1つを選択するためのライブ
ラリ選択手段と、前記オーディオ入力手段および前記メ
モリに結合された、入力音声フレームを前記コア・ライ
ブラリおよび前記複数の位置固有のライブラリの内の特
定の1つと突き合わせて処理するための音声プロセッサ
手段とを備え、音声認識の効率が高められることを特徴
とする可動式音声認識システム。 (5)前記オーディオ入力手段がマイクロフォンを含む
ことを特徴とする上記(4)に記載の可動式音声認識シ
ステム。 (6)前記位置決定手段がセルラ電話トランシーバを含
むことを特徴とする上記(4)に記載の可動式音声認識
システム。 (7)前記位置決定手段が衛星測位システム受信装置を
含むことを特徴とする上記(4)に記載の可動式音声認
識システム。 (8)前記音声プロセッサ手段がアナログ・ディジタル
変換器を含むことを特徴とする上記(4)に記載の可動
式音声認識システム。 (9)前記音声プロセッサ手段がパーソナル・コンピュ
ータを含むことを特徴とする上記(8)に記載の可動式
音声認識システム。 (10)音声テンプレートの前記複数の位置固有のライ
ブラリがそれぞれ、複数の地名を表す、複数のテンプレ
ートから成ることを特徴とする上記(4)に記載の可動
式音声認識システム。
【0028】
【発明の効果】したがって、本発明によれば、改良され
た音声認識システムが提供される。また、音声認識精度
および効率の向上のための改良された方法およびシステ
ムが提供される。さらに、音声テンプレートの位置固有
のライブラリおよびシステム位置の識別を使用する可動
式音声認識システムでの音声認識の向上のための改良さ
れた方法およびシステムが提供される。
た音声認識システムが提供される。また、音声認識精度
および効率の向上のための改良された方法およびシステ
ムが提供される。さらに、音声テンプレートの位置固有
のライブラリおよびシステム位置の識別を使用する可動
式音声認識システムでの音声認識の向上のための改良さ
れた方法およびシステムが提供される。
【図1】本発明の方法およびシステムを実施するために
使用できる可動式音声認識システムの絵画図である。
使用できる可動式音声認識システムの絵画図である。
【図2】図1の可動式音声認識システムのハイ・レベル
・ブロック図である。
・ブロック図である。
【図3】本発明の方法を実施するためのプロセスを示す
ハイ・レベル論理フローチャートである。
ハイ・レベル論理フローチャートである。
【符号の説明】 12 可動式音声認識システム 14 キーボード 16 ディスプレイ 18 表示画面 20 アンテナ 22 マイクロフォン 24 セルラ送信塔 28 衛星 30 位置決定回路 32 プロセッサ 34 アナログ・ディジタル変換器 36 メモリ 38 コア・ライブラリ 40 位置固有のライブラリ
───────────────────────────────────────────────────── フロントページの続き (72)発明者 ジョン・エム・ルカッセン アメリカ合衆国10025 ニューヨーク州ニ ューヨーク ワンハンドレッド・アンド・ サード・ストリート・ウェスト 308 (72)発明者 ロジャー・エム・ミラー アメリカ合衆国06804 コネチカット州ブ ルックフィールド ピー・オー・ボックス 778 (72)発明者 エルトン・ビー・シャーウィン・ジュニア アメリカ合衆国06903 コネチカット州ス タンフォード ドッグウッド・レーン 26
Claims (10)
- 【請求項1】入力音声フレームを音声を表す記憶された
テンプレートと突き合わせて処理する可動式音声認識シ
ステムの効率を高める方法において、 基本音声語彙を表す音声テンプレートのコア・ライブラ
リを作成して記憶するステップと、 それぞれ特定の地理的位置の専用語彙を表す、音声テン
プレートの複数の位置固有のライブラリを作成して記憶
するステップと、 前記可動式音声認識システムの地理的位置を決定するス
テップと、 前記可動式音声認識システムの前記地理的位置の前記決
定に応じて、音声テンプレートの前記複数の位置固有の
ライブラリの内の特定の1つと音声テンプレートの前記
コア・ライブラリを組み合わせるステップと、 音声の入力フレームを前記コア・ライブラリおよび位置
固有のライブラリと突き合わせて処理するステップとを
含む方法。 - 【請求項2】前記可動式音声認識システムの地理的位置
を決定する前記ステップが、セルラ電話システムを使用
して前記可動式音声認識システムの地理的位置を決定す
るステップを含むことを特徴とする、請求項1に記載の
可動式音声認識システムの効率を拡張する方法。 - 【請求項3】前記可動式音声認識システムの地理的位置
を決定する前記ステップが、衛星測位システムの受信装
置を使用して前記可動式音声認識システムの地理的位置
を決定するステップを含むことを特徴とする、請求項1
に記載の可動式音声認識システムの効率を拡張する方
法。 - 【請求項4】入力音声を受け取るためのオーディオ入力
手段と、 メモリと、 基本音声語彙を表す、前記メモリ内に記憶された音声テ
ンプレートのコア・ライブラリと、 それぞれ特定の地理的位置の専用語彙を表す、前記メモ
リ内に記憶された音声テンプレートの複数の位置固有の
ライブラリと、 前記可動式音声認識システムの地理的位置を決定するた
めの位置決定手段と、 前記メモリおよび前記位置決定手段に結合された、前記
可動式音声認識システムの前記地理的位置の決定に応じ
て前記複数の位置固有のライブラリの内の特定の1つを
選択するためのライブラリ選択手段と、 前記オーディオ入力手段および前記メモリに結合され
た、入力音声フレームを前記コア・ライブラリおよび前
記複数の位置固有のライブラリの内の特定の1つと突き
合わせて処理するための音声プロセッサ手段とを備え、
音声認識の効率が高められることを特徴とする可動式音
声認識システム。 - 【請求項5】前記オーディオ入力手段がマイクロフォン
を含むことを特徴とする請求項4に記載の可動式音声認
識システム。 - 【請求項6】前記位置決定手段がセルラ電話トランシー
バを含むことを特徴とする請求項4に記載の可動式音声
認識システム。 - 【請求項7】前記位置決定手段が衛星測位システム受信
装置を含むことを特徴とする請求項4に記載の可動式音
声認識システム。 - 【請求項8】前記音声プロセッサ手段がアナログ・ディ
ジタル変換器を含むことを特徴とする請求項4に記載の
可動式音声認識システム。 - 【請求項9】前記音声プロセッサ手段がパーソナル・コ
ンピュータを含むことを特徴とする請求項8に記載の可
動式音声認識システム。 - 【請求項10】音声テンプレートの前記複数の位置固有
のライブラリがそれぞれ、複数の地名を表す、複数のテ
ンプレートから成ることを特徴とする請求項4に記載の
可動式音声認識システム。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US08/175,701 US5524169A (en) | 1993-12-30 | 1993-12-30 | Method and system for location-specific speech recognition |
| US175701 | 1993-12-30 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH07210189A true JPH07210189A (ja) | 1995-08-11 |
Family
ID=22641283
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP6277404A Pending JPH07210189A (ja) | 1993-12-30 | 1994-11-11 | 音声認識方法およびシステム |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US5524169A (ja) |
| EP (1) | EP0661688A2 (ja) |
| JP (1) | JPH07210189A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2004212641A (ja) * | 2002-12-27 | 2004-07-29 | Toshiba Corp | 音声入力システム及び音声入力システムを備えた端末装置 |
Families Citing this family (90)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6385312B1 (en) * | 1993-02-22 | 2002-05-07 | Murex Securities, Ltd. | Automatic routing and information system for telephonic services |
| JP3691511B2 (ja) * | 1993-03-25 | 2005-09-07 | ブリテイッシュ・テレコミュニケーションズ・パブリック・リミテッド・カンパニー | 休止検出を行う音声認識 |
| AU672895B2 (en) * | 1993-03-31 | 1996-10-17 | British Telecommunications Public Limited Company | Connected speech recognition |
| US6230128B1 (en) | 1993-03-31 | 2001-05-08 | British Telecommunications Public Limited Company | Path link passing speech recognition with vocabulary node being capable of simultaneously processing plural path links |
| JP2674521B2 (ja) * | 1994-09-21 | 1997-11-12 | 日本電気株式会社 | 移動体誘導装置 |
| US5717828A (en) * | 1995-03-15 | 1998-02-10 | Syracuse Language Systems | Speech recognition apparatus and method for learning |
| US6109923A (en) | 1995-05-24 | 2000-08-29 | Syracuase Language Systems | Method and apparatus for teaching prosodic features of speech |
| CA2185262C (en) * | 1995-09-12 | 2006-08-29 | Michele B. Gammel | Method and system for enrolling addresses in a speech recognition database |
| US5842165A (en) * | 1996-02-29 | 1998-11-24 | Nynex Science & Technology, Inc. | Methods and apparatus for generating and using garbage models for speaker dependent speech recognition purposes |
| US5895448A (en) * | 1996-02-29 | 1999-04-20 | Nynex Science And Technology, Inc. | Methods and apparatus for generating and using speaker independent garbage models for speaker dependent speech recognition purpose |
| US6076054A (en) * | 1996-02-29 | 2000-06-13 | Nynex Science & Technology, Inc. | Methods and apparatus for generating and using out of vocabulary word models for speaker dependent speech recognition |
| EP0891589B1 (de) * | 1996-04-02 | 1999-10-06 | Siemens Aktiengesellschaft | Anordnung zur erstellung eines digitalen wörterbuchs und verfahren zum aufbau eines digitalen wörterbuchs mit hilfe eines rechners |
| AU2744097A (en) | 1996-04-26 | 1997-11-19 | At & T Corporation | Method and apparatus for data transmission using multiple transmit antennas |
| US6314411B1 (en) | 1996-06-11 | 2001-11-06 | Pegasus Micro-Technologies, Inc. | Artificially intelligent natural language computational interface system for interfacing a human to a data processor having human-like responses |
| US5842161A (en) * | 1996-06-25 | 1998-11-24 | Lucent Technologies Inc. | Telecommunications instrument employing variable criteria speech recognition |
| US5832429A (en) * | 1996-09-11 | 1998-11-03 | Texas Instruments Incorporated | Method and system for enrolling addresses in a speech recognition database |
| US6272457B1 (en) * | 1996-09-16 | 2001-08-07 | Datria Systems, Inc. | Spatial asset management system that time-tags and combines captured speech data and captured location data using a predifed reference grammar with a semantic relationship structure |
| US6173192B1 (en) * | 1996-10-01 | 2001-01-09 | Honeywell International Inc. | Interactive voice responsive radio tuning system |
| FR2761848B1 (fr) * | 1997-04-04 | 2004-09-17 | Parrot Sa | Dispositif de commande vocale pour radiotelephone, notamment pour utilisation dans un vehicule automobile |
| US6856960B1 (en) * | 1997-04-14 | 2005-02-15 | At & T Corp. | System and method for providing remote automatic speech recognition and text-to-speech services via a packet network |
| US8209184B1 (en) | 1997-04-14 | 2012-06-26 | At&T Intellectual Property Ii, L.P. | System and method of providing generated speech via a network |
| US6078886A (en) | 1997-04-14 | 2000-06-20 | At&T Corporation | System and method for providing remote automatic speech recognition services via a packet network |
| US6490561B1 (en) * | 1997-06-25 | 2002-12-03 | Dennis L. Wilson | Continuous speech voice transcription |
| US6125341A (en) * | 1997-12-19 | 2000-09-26 | Nortel Networks Corporation | Speech recognition system and method |
| US6483896B1 (en) | 1998-02-05 | 2002-11-19 | At&T Corp. | Speech recognition using telephone call parameters |
| US6134529A (en) * | 1998-02-09 | 2000-10-17 | Syracuse Language Systems, Inc. | Speech recognition apparatus and method for learning |
| US6223156B1 (en) | 1998-04-07 | 2001-04-24 | At&T Corp. | Speech recognition of caller identifiers using location information |
| FI981154A7 (fi) * | 1998-05-25 | 1999-11-26 | Nokia Mobile Phones Ltd | Menetelmä ja laite puheen tunnistamiseksi |
| US6434526B1 (en) | 1998-06-29 | 2002-08-13 | International Business Machines Corporation | Network application software services containing a speech recognition capability |
| JP3036696B1 (ja) * | 1998-11-27 | 2000-04-24 | 株式会社アスキー | ナビゲーションシステム、方法、および、そのプログラムを記録した記録媒体 |
| US6434403B1 (en) * | 1999-02-19 | 2002-08-13 | Bodycom, Inc. | Personal digital assistant with wireless telephone |
| US6360201B1 (en) * | 1999-06-08 | 2002-03-19 | International Business Machines Corp. | Method and apparatus for activating and deactivating auxiliary topic libraries in a speech dictation system |
| US6434547B1 (en) | 1999-10-28 | 2002-08-13 | Qenm.Com | Data capture and verification system |
| US7050977B1 (en) | 1999-11-12 | 2006-05-23 | Phoenix Solutions, Inc. | Speech-enabled server for internet website and method |
| US9076448B2 (en) | 1999-11-12 | 2015-07-07 | Nuance Communications, Inc. | Distributed real time speech recognition system |
| US7725307B2 (en) * | 1999-11-12 | 2010-05-25 | Phoenix Solutions, Inc. | Query engine for processing voice based queries including semantic decoding |
| US7392185B2 (en) | 1999-11-12 | 2008-06-24 | Phoenix Solutions, Inc. | Speech based learning/training system using semantic decoding |
| JP4543294B2 (ja) * | 2000-03-14 | 2010-09-15 | ソニー株式会社 | 音声認識装置および音声認識方法、並びに記録媒体 |
| US6272464B1 (en) * | 2000-03-27 | 2001-08-07 | Lucent Technologies Inc. | Method and apparatus for assembling a prediction list of name pronunciation variations for use during speech recognition |
| DE10017717B4 (de) * | 2000-04-11 | 2006-01-05 | Leopold Kostal Gmbh & Co. Kg | Spracheingabe gesteuertes Steuergerät |
| US20020107918A1 (en) * | 2000-06-15 | 2002-08-08 | Shaffer James D. | System and method for capturing, matching and linking information in a global communications network |
| JP2004503887A (ja) * | 2000-06-16 | 2004-02-05 | ヘルセテック インコーポレイテッド | 携帯情報端末用音声認識装置 |
| WO2002005264A1 (de) * | 2000-07-07 | 2002-01-17 | Siemens Aktiengesellschaft | Sprachgesteuerte anordnung und verfahren zur spracheingabe und -erkennung |
| DE10043531A1 (de) * | 2000-09-05 | 2002-03-14 | Philips Corp Intellectual Pty | Sprachdialogsystem |
| US6850882B1 (en) | 2000-10-23 | 2005-02-01 | Martin Rothenberg | System for measuring velar function during speech |
| US7444284B1 (en) * | 2001-01-24 | 2008-10-28 | Bevocal, Inc. | System, method and computer program product for large-scale street name speech recognition |
| US20020133344A1 (en) * | 2001-01-24 | 2002-09-19 | Damiba Bertrand A. | System, method and computer program product for large-scale street name speech recognition |
| US20020111810A1 (en) * | 2001-02-15 | 2002-08-15 | Khan M. Salahuddin | Spatially built word list for automatic speech recognition program and method for formation thereof |
| US6885989B2 (en) | 2001-04-02 | 2005-04-26 | International Business Machines Corporation | Method and system for collaborative speech recognition for small-area network |
| MY141150A (en) * | 2001-11-02 | 2010-03-15 | Panasonic Corp | Channel selecting apparatus utilizing speech recognition, and controling method thereof |
| JP3943983B2 (ja) * | 2002-04-18 | 2007-07-11 | キヤノン株式会社 | 音声認識装置及びその方法、プログラム |
| US7224981B2 (en) * | 2002-06-20 | 2007-05-29 | Intel Corporation | Speech recognition of mobile devices |
| US7752045B2 (en) * | 2002-10-07 | 2010-07-06 | Carnegie Mellon University | Systems and methods for comparing speech elements |
| US20050131685A1 (en) * | 2003-11-14 | 2005-06-16 | Voice Signal Technologies, Inc. | Installing language modules in a mobile communication device |
| JP4040573B2 (ja) * | 2003-12-12 | 2008-01-30 | キヤノン株式会社 | 音声認識装置および方法 |
| US7664639B2 (en) * | 2004-01-14 | 2010-02-16 | Art Advanced Recognition Technologies, Inc. | Apparatus and methods for speech recognition |
| US20050261904A1 (en) * | 2004-05-20 | 2005-11-24 | Anuraag Agrawal | System and method for voice recognition using user location information |
| US20060074660A1 (en) * | 2004-09-29 | 2006-04-06 | France Telecom | Method and apparatus for enhancing speech recognition accuracy by using geographic data to filter a set of words |
| US20060122834A1 (en) * | 2004-12-03 | 2006-06-08 | Bennett Ian M | Emotion detection device & method for use in distributed systems |
| ATE403928T1 (de) * | 2006-12-14 | 2008-08-15 | Harman Becker Automotive Sys | Sprachdialogkontrolle basierend auf signalvorverarbeitung |
| EP2118881A1 (en) * | 2007-02-13 | 2009-11-18 | Ntera Limited | Voltage feedback circuit for active matrix reflective display devices |
| US8938392B2 (en) * | 2007-02-27 | 2015-01-20 | Nuance Communications, Inc. | Configuring a speech engine for a multimodal application based on location |
| US9208783B2 (en) * | 2007-02-27 | 2015-12-08 | Nuance Communications, Inc. | Altering behavior of a multimodal application based on location |
| US8645143B2 (en) * | 2007-05-01 | 2014-02-04 | Sensory, Inc. | Systems and methods of performing speech recognition using global positioning (GPS) information |
| US8060367B2 (en) * | 2007-06-26 | 2011-11-15 | Targus Information Corporation | Spatially indexed grammar and methods of use |
| US20090018842A1 (en) * | 2007-07-11 | 2009-01-15 | Garmin Ltd. | Automated speech recognition (asr) context |
| US8219399B2 (en) * | 2007-07-11 | 2012-07-10 | Garmin Switzerland Gmbh | Automated speech recognition (ASR) tiling |
| US8255224B2 (en) | 2008-03-07 | 2012-08-28 | Google Inc. | Voice recognition grammar selection based on context |
| WO2010019831A1 (en) * | 2008-08-14 | 2010-02-18 | 21Ct, Inc. | Hidden markov model for speech processing with training method |
| US20100070360A1 (en) * | 2008-09-13 | 2010-03-18 | At&T Intellectual Property I, L.P. | System and method for creating a speech search platform for coupons |
| JP5334178B2 (ja) * | 2009-01-21 | 2013-11-06 | クラリオン株式会社 | 音声認識装置およびデータ更新方法 |
| CN103154762B (zh) | 2010-05-07 | 2015-08-19 | 位波私人有限公司 | 基于远程行动感测的智能数据收集及传输 |
| US8532674B2 (en) * | 2010-12-10 | 2013-09-10 | General Motors Llc | Method of intelligent vehicle dialing |
| US20130332170A1 (en) * | 2010-12-30 | 2013-12-12 | Gal Melamed | Method and system for processing content |
| US9129591B2 (en) | 2012-03-08 | 2015-09-08 | Google Inc. | Recognizing speech in multiple languages |
| US9275635B1 (en) | 2012-03-08 | 2016-03-01 | Google Inc. | Recognizing different versions of a language |
| US9043205B2 (en) * | 2012-06-21 | 2015-05-26 | Google Inc. | Dynamic language model |
| US8831957B2 (en) * | 2012-08-01 | 2014-09-09 | Google Inc. | Speech recognition models based on location indicia |
| US10593326B2 (en) * | 2013-04-25 | 2020-03-17 | Sensory, Incorporated | System, method, and apparatus for location-based context driven speech recognition |
| US9589564B2 (en) * | 2014-02-05 | 2017-03-07 | Google Inc. | Multiple speech locale-specific hotword classifiers for selection of a speech locale |
| US9773499B2 (en) | 2014-06-18 | 2017-09-26 | Google Inc. | Entity name recognition based on entity type |
| EP3198593A4 (en) * | 2014-08-01 | 2019-02-20 | Maluuba Inc. | VOICE RECOGNITION USING TEMPLATES ASSOCIATED WITH A GEOGRAPHICAL LOCATION |
| US9460721B2 (en) * | 2015-01-16 | 2016-10-04 | The United States Of America As Represented By The Secretary Of The Navy | Method for context driven speech recognition and processing |
| CN105206263A (zh) * | 2015-08-11 | 2015-12-30 | 东莞市凡豆信息科技有限公司 | 基于动态字典的语音语义识别方法 |
| CN106875949B (zh) * | 2017-04-28 | 2020-09-22 | 深圳市大乘科技股份有限公司 | 一种语音识别的校正方法及装置 |
| KR102356889B1 (ko) * | 2017-08-16 | 2022-01-28 | 삼성전자 주식회사 | 음성 인식을 수행하는 방법 및 이를 사용하는 전자 장치 |
| US20250191585A1 (en) * | 2023-12-07 | 2025-06-12 | International Business Machines Corporation | Multilingual command line interface bots enabled with a real-time language analysis service |
| US12596524B2 (en) | 2024-04-24 | 2026-04-07 | Motorola Mobility Llc | Ending active noise cancellation based on a detected audio source |
| US12613674B2 (en) * | 2024-04-24 | 2026-04-28 | Motorola Mobility Llc | Ending audio playback based on a trigger word |
| US12614551B2 (en) | 2024-04-24 | 2026-04-28 | Motorola Mobility Llc | Presenting relevant audio data |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6441912A (en) * | 1987-08-08 | 1989-02-14 | Fujitsu Ltd | Constant voltage circuit |
| JPH02232696A (ja) * | 1989-03-06 | 1990-09-14 | Toshiba Corp | 音声認識装置 |
| JPH03175478A (ja) * | 1989-12-05 | 1991-07-30 | Sony Corp | 地図表示装置 |
Family Cites Families (26)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4525793A (en) * | 1982-01-07 | 1985-06-25 | General Electric Company | Voice-responsive mobile status unit |
| US4620286A (en) * | 1984-01-16 | 1986-10-28 | Itt Corporation | Probabilistic learning element |
| US4797924A (en) * | 1985-10-25 | 1989-01-10 | Nartron Corporation | Vehicle voice recognition method and apparatus |
| US4831550A (en) * | 1986-03-27 | 1989-05-16 | International Business Machines Corporation | Apparatus and method for estimating, from sparse data, the probability that a particular one of a set of events is the next event in a string of events |
| JPS62239231A (ja) * | 1986-04-10 | 1987-10-20 | Kiyarii Rabo:Kk | 口唇画像入力による音声認識方法 |
| US4903305A (en) * | 1986-05-12 | 1990-02-20 | Dragon Systems, Inc. | Method for representing word models for use in speech recognition |
| US4866778A (en) * | 1986-08-11 | 1989-09-12 | Dragon Systems, Inc. | Interactive speech recognition apparatus |
| US4856066A (en) * | 1986-11-06 | 1989-08-08 | Lemelson Jerome H | Speech communication system and method |
| US4914703A (en) * | 1986-12-05 | 1990-04-03 | Dragon Systems, Inc. | Method for deriving acoustic models for use in speech recognition |
| DE3711348A1 (de) * | 1987-04-03 | 1988-10-20 | Philips Patentverwaltung | Verfahren zum erkennen kontinuierlich gesprochener woerter |
| GB2207027B (en) * | 1987-07-15 | 1992-01-08 | Matsushita Electric Works Ltd | Voice encoding and composing system |
| EP0302614B1 (en) * | 1987-07-16 | 1993-03-10 | Fujitsu Limited | Speech recognition device |
| GB8720387D0 (en) * | 1987-08-28 | 1987-10-07 | British Telecomm | Matching vectors |
| US4852173A (en) * | 1987-10-29 | 1989-07-25 | International Business Machines Corporation | Design and construction of a binary-tree system for language modelling |
| US4984177A (en) * | 1988-02-05 | 1991-01-08 | Advanced Products And Technologies, Inc. | Voice language translator |
| US5003490A (en) * | 1988-10-07 | 1991-03-26 | Hughes Aircraft Company | Neural network signal processor |
| US5027406A (en) * | 1988-12-06 | 1991-06-25 | Dragon Systems, Inc. | Method for interactive speech recognition and training |
| US5167011A (en) * | 1989-02-15 | 1992-11-24 | W. H. Morris | Method for coodinating information storage and retrieval |
| US4984178A (en) * | 1989-02-21 | 1991-01-08 | Texas Instruments Incorporated | Chart parser for stochastic unification grammar |
| US5033087A (en) * | 1989-03-14 | 1991-07-16 | International Business Machines Corp. | Method and apparatus for the automatic determination of phonological rules as for a continuous speech recognition system |
| US4994983A (en) * | 1989-05-02 | 1991-02-19 | Itt Corporation | Automatic speech recognition system using seed templates |
| US5274695A (en) * | 1991-01-11 | 1993-12-28 | U.S. Sprint Communications Company Limited Partnership | System for verifying the identity of a caller in a telecommunications network |
| US5297183A (en) * | 1992-04-13 | 1994-03-22 | Vcs Industries, Inc. | Speech recognition system for electronic switches in a cellular telephone or personal communication network |
| US5233681A (en) * | 1992-04-24 | 1993-08-03 | International Business Machines Corporation | Context-dependent speech recognizer using estimated next word context |
| JP2602158B2 (ja) * | 1992-12-04 | 1997-04-23 | 株式会社エクォス・リサーチ | 音声出力装置 |
| US5384892A (en) * | 1992-12-31 | 1995-01-24 | Apple Computer, Inc. | Dynamic language model for speech recognition |
-
1993
- 1993-12-30 US US08/175,701 patent/US5524169A/en not_active Expired - Fee Related
-
1994
- 1994-11-11 JP JP6277404A patent/JPH07210189A/ja active Pending
- 1994-11-22 EP EP94308600A patent/EP0661688A2/en not_active Withdrawn
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6441912A (en) * | 1987-08-08 | 1989-02-14 | Fujitsu Ltd | Constant voltage circuit |
| JPH02232696A (ja) * | 1989-03-06 | 1990-09-14 | Toshiba Corp | 音声認識装置 |
| JPH03175478A (ja) * | 1989-12-05 | 1991-07-30 | Sony Corp | 地図表示装置 |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2004212641A (ja) * | 2002-12-27 | 2004-07-29 | Toshiba Corp | 音声入力システム及び音声入力システムを備えた端末装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| US5524169A (en) | 1996-06-04 |
| EP0661688A2 (en) | 1995-07-05 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5524169A (en) | Method and system for location-specific speech recognition | |
| US5802251A (en) | Method and system for reducing perplexity in speech recognition via caller identification | |
| US7184957B2 (en) | Multiple pass speech recognition method and system | |
| US7328155B2 (en) | Method and system for speech recognition using grammar weighted based upon location information | |
| JP5334178B2 (ja) | 音声認識装置およびデータ更新方法 | |
| US6112174A (en) | Recognition dictionary system structure and changeover method of speech recognition system for car navigation | |
| KR100556050B1 (ko) | 적어도위치및/또는거리이름들을위한입력시스템 | |
| US6910012B2 (en) | Method and system for speech recognition using phonetically similar word alternatives | |
| EP1171871B1 (en) | Recognition engines with complementary language models | |
| US7983913B2 (en) | Understanding spoken location information based on intersections | |
| US7822613B2 (en) | Vehicle-mounted control apparatus and program that causes computer to execute method of providing guidance on the operation of the vehicle-mounted control apparatus | |
| EP1542207B1 (en) | Speech recognition method and apparatus | |
| EP0769184B1 (en) | Speech recognition methods and apparatus on the basis of the modelling of new words | |
| US20060100871A1 (en) | Speech recognition method, apparatus and navigation system | |
| KR20090085673A (ko) | 음성 인식을 이용한 콘텐츠 선택 | |
| US6662159B2 (en) | Recognizing speech data using a state transition model | |
| JP2003308090A (ja) | 音声認識装置、音声認識方法および音声認識プログラム | |
| EP1600942B1 (en) | Automatic word pronunciation generation for speech recognition | |
| CN111462748A (zh) | 语音识别处理方法、装置、电子设备及存储介质 | |
| KR102392992B1 (ko) | 음성 인식 기능을 활성화시키는 호출 명령어 설정에 관한 사용자 인터페이싱 장치 및 방법 | |
| JP2001141500A (ja) | 車載エージェント処理装置 | |
| JP3645104B2 (ja) | 辞書検索装置及び辞書検索プログラムを記録した記録媒体 | |
| JP3296783B2 (ja) | 車載用ナビゲーション装置および音声認識方法 | |
| JPH10282987A (ja) | 音声認識システムおよび方法 | |
| JPS5941226B2 (ja) | 音声翻訳装置 |