JPH07210189A - 音声認識方法およびシステム - Google Patents

音声認識方法およびシステム

Info

Publication number
JPH07210189A
JPH07210189A JP6277404A JP27740494A JPH07210189A JP H07210189 A JPH07210189 A JP H07210189A JP 6277404 A JP6277404 A JP 6277404A JP 27740494 A JP27740494 A JP 27740494A JP H07210189 A JPH07210189 A JP H07210189A
Authority
JP
Japan
Prior art keywords
speech
recognition system
mobile
speech recognition
location
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP6277404A
Other languages
English (en)
Inventor
Paul S Cohen
ポール・エス・コーエン
John M Lucassen
ジョン・エム・ルカッセン
Roger M Miller
ロジャー・エム・ミラー
Jr Elton B Sherwin
エルトン・ビー・シャーウィン・ジュニア
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
International Business Machines Corp
Original Assignee
International Business Machines Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by International Business Machines Corp filed Critical International Business Machines Corp
Publication of JPH07210189A publication Critical patent/JPH07210189A/ja
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/26Speech to text systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/226Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/226Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
    • G10L2015/228Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics of application context

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Navigation (AREA)
  • Mobile Radio Communication Systems (AREA)

Abstract

(57)【要約】 (修正有) 【目的】 決定された地理的位置に基づいて音声認識シ
ステムのパープレクシティを低減する方法およびシステ
ム。 【構成】 音声を表す記憶されたテンプレートと突き合
わせて入力音声フレームを処理する可動式音声認識シス
テムでは、基本音声語彙を表す音声テンプレートのコア
・ライブラリ38が作成されて記憶される。それぞれ、
特定の地理的位置の専用語彙を表す音声テンプレートを
含む、音声テンプレートの複数の位置固有のライブラリ
40も作成されて記憶される。次いで、セルラ電話シス
テム、衛星測位システム、または他の類似のシステムを
使用して可動式音声認識システムの地理的位置が定期的
に決定され、システムの現在位置用の音声テンプレート
の位置固有のライブラリが識別される。次いで、音声入
力フレームがコア・ライブラリ38と特定の位置固有の
ライブラリ40を組み合わせたものと突き合わされて処
理する。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】本発明は、全般的には、改良され
た音声認識システムに関し、詳細には、音声認識精度向
上のための改良された方法およびシステムに関する。さ
らに詳細には、本発明は音声テンプレートの位置固有の
ライブラリおよびシステム位置の識別を使用する可動式
システムでの音声認識向上のための方法およびシステム
に関する。
【0002】
【従来の技術】音声認識は従来技術で周知である。既知
の話者の所与の語彙からそれぞれの単語を認識すること
は最も簡単なタイプの音声認識であり、この種の音声認
識はかなり前から知られている。認識すべき語彙内の単
語は通常、それぞれ、語彙中の単語の音声パターンを表
す、個別のテンプレートとして事前に記憶される。それ
ぞれの単語が発音されるとき、システムは単に、語彙を
表す個別のテンプレートとその単語を比較する。この技
術は一般に、全単語テンプレート突合せと呼ばれてい
る。成功している多数の音声認識システムは、この技術
を動的プログラミングと共に使用して、発音された単語
と事前に記憶されたテンプレートの間の非線形タイム・
スケール変動に対処している。
【0003】連続する音声、あるいは固有名または地名
を含む音声を認識することはこれよりも難しい。従来技
術では、連続する音声、すなわち連結された単語は多重
経路動的プログラミングを使用して認識されている。そ
のようなシステムの一例は、H.サコエ(Sakoe)の論文
「Two Level DP Matching A Dynamic Programming Base
d Pattern Matching Algorithm For Connected Word Re
cognition」IEEE Transactions on Acoustics Speech a
nd Signal Processing、ASSP−27巻、第6号、1
979年12月、588−595ページで提案されてい
る。この論文は、入力パターン全体に最もよく一致する
単語テンプレートのシーケンスを見つけるためのツー・
パス動的プログラミング・アルゴリズムを提案したもの
である。システムを通る各パスは、あらゆる入力パター
ンのあらゆる可能な部分と突き合わされたあらゆるテン
プレート間の類似性を示すスコアを生成する。次いで第
2のパスでは、スコアを使用して、入力パターン全体に
対応する最良のテンプレート・シーケンスを見つける。
【0004】米国特許第5040127号は、音声を表
す事前に記憶されたテンプレートと入力フレームを比較
し、次いで、認識される可能性のある個別の単語として
検討中の各テンプレート用のリンクされたネットワーク
中のレコード間のリンクを作成することによって連続す
る音声を処理する連続音声認識システムを提案したもの
である。リンクされたレコードは、テンプレートを表す
記号と、リンク・レコードが記憶された相対時間を表す
シーケンス・インディケータと、あるリンク・レコード
の派生元のネットワーク中の該リンク・レコードを示す
ポインタとを含む各データ・セットを含むインデックス
付きデータ・セットとして記憶された親元リンク・レコ
ードおよび派生リンク・レコードを含む。
【0005】固有名を認識することは、音声認識システ
ムのいわゆる「パープレクシティ(perplexity)」が増
加することを表し、この問題は最近、米国特許第521
2730号で認識された。この特許は、複数の発音が可
能な固有名の音声表現を認識するためのテキスト派生認
識モデルを使用して名前認識を実行するものである。こ
の特許に記載された名前認識技術は、名前テキストを指
定することによってアクセスされるテキスト・データベ
ースに名前テキストを入力し、次いで、選択された数の
テキスト派生認識モデルを名前テキストから作成するこ
とを含む。各テキスト派生認識モデルは名前の少なくと
も1つの発音を表す。次いで、発音された名前入力によ
ってテキスト・データベースにアクセスが試みられるた
びに、テキスト・データベースが、発音された名前入力
と比較され、一致するかどうかが決定される。
【0006】米国特許第5202952号は、それぞ
れ、平滑化されると所定の数のフレームに対して平滑な
フレーム・モデルを生成する、フレーム・データセット
に音声を変換することによって音声を認識する、大規模
語彙連続音声プレフィルタリング処理システムを開示す
るものである。一連のフレーム・ピリオドにわたって音
声的に類似している単語モデルのクラスタが常駐語彙と
して指定され、次いで、平滑化されたフレーム・モデル
の比較対象であるクラスタ用の確率モデルを使用して評
価された平滑フレームの確度を含むクラスタ・スコアが
システムによって生成される。
【0007】これらのシステムはそれぞれ、音声認識が
成功するには、連続音声のパープレクシティを低減する
必要があることを認識したものである。この問題に取り
組んだ文献には、「Perplexity-A Measure of Difficul
ty of Speech Recognition Tasks」、Journal of the A
coustical Society of America、第62巻、補遺第1
号、1977年秋、S−63ページ、および「Continuo
us Speech RecognitionStatistical Methods」、Handbo
ok of Statistics、第2巻、Classification Pattern R
ecognition and Reduction of Dimensionality、North-
Holland Publishing Company、1982年、549−5
73ページがある。
【0008】上記に鑑みて、音声認識が成功するには、
発音された多数の類似の単語を区別する拡張された能力
が必要であることが明らかであろう。これは、固有名、
地名、および数字の場合に特に難しい問題である。した
がって、音声認識の精度および効率を高める方法および
システムが必要であることが明らかであろう。
【0009】
【発明が解決しようとする課題】したがって、本発明の
一目的は、改良された音声認識システムを提供すること
である。
【0010】本発明の他の目的は、音声認識精度および
効率の向上のための改良された方法およびシステムを提
供することである。
【0011】本発明の他の目的は、音声テンプレートの
位置固有のライブラリおよびシステム位置の識別を使用
する可動式音声認識システムでの音声認識の向上のため
の改良された方法およびシステムを提供することであ
る。
【0012】
【課題を解決するための手段】前記の目的はこれから説
明するようにして達成される。決定された地理的位置に
基づいて音声認識システムのパープレクシティを低減す
る方法およびシステムを開示する。入力音声フレームを
音声を表す記憶されたテンプレートと突き合わせて処理
する可動式音声認識システムでは、基本音声語彙を表す
音声テンプレートのコア・ライブラリが作成されて記憶
される。それぞれ、固有の地理的位置の専用語彙を表す
音声テンプレートを含む、音声テンプレートの複数の位
置固有のライブラリも作成されて記憶される。次いで、
セルラ電話システム、衛星測位システム、または他の類
似のシステムを使用して可動式音声認識システムの地理
的位置が定期的に決定され、システムの現在位置用の音
声テンプレートの位置固有のライブラリが識別される。
次いで、音声入力フレームがコア・ライブラリと特定の
位置固有のライブラリを組み合わせたものと突き合わさ
れて処理され、システムによる音声認識の効率が大幅に
向上する。位置固有のライブラリはそれぞれ、特定の地
理的位置内の地名、固有名、および会社名を表す音声テ
ンプレートを含むことが好ましい。
【0013】
【実施例】ここで、図面、特に図1を参照すると、本発
明の方法およびシステムを実施するために使用できる可
動式音声認識システム12の絵画図が示されている。図
のように、可動式音声認識システム12は、いわゆる
「ノートブック・コンピュータ」など適当にプログラム
されたポータブル・コンピュータを使用して実施するこ
とができる。図のように、可動式音声認識システム12
はキーボード14と、ディスプレイ16と、表示画面1
8とを含むことができる。本明細書で詳細に説明するよ
うに、可動式音声認識システム12は、言葉が発音され
たことを検出したことに応じて可動式音声認識システム
12の特定の地理的位置を電気的に決定するために使用
できるアンテナ20を含むこともできる。
【0014】図1には、可動式音声認識システム12に
結合されたオーディオ入力装置も示されている。マイク
ロフォン22は、可動式音声認識システム12用のオー
ディオ入力装置として働き、かつ追加情報を提供し、特
定の機能を実行し、あるいは場合によっては音声コマン
ドに応答するために、音声認識技術分野の当業者に周知
のように、可動式音声認識システム12のユーザによっ
て発音された言葉を捕獲するために使用することができ
る。
【0015】可動式音声認識システム12は本明細書内
では可動式として特徴付けられており、そのようなシス
テムは、自動車、パトカー、消防車、救急車、ユーザが
携帯できるパーソナル・ディジタル・アシスタント(P
DA)などの可動式プラットフォームで応用されること
が予期される。本開示を参照すれば、当業者には、シス
テムが街路名、番地、レストランの名前、会社名、可動
式システムが位置する特定の地理的位置に関連する他の
固有名を認識する必要があるため、可動式プラットフォ
ーム上の音声認識が音声認識問題のパープレクシティの
一定の増加を表すことが理解されよう。
【0016】この問題を解決するには、可動式音声認識
システム12がシステムの地理的位置を決定するための
装置を含むことが好ましい。これは、衛星測位システム
などの測位システムの使用を含む多数の異なる技術を使
用して行うことができる。したがって、可動式音声認識
システム12のアンテナ20で衛星28からの無線信号
を受信し、それを使用して、特定の発音時の可動式音声
認識システム12の特定の地理的位置を決定することが
できる。同様に、セルラ送信塔24および26などのセ
ルラ電話網からの無線信号を使用して、可動式音声認識
システム12の地理的位置を効率的に決定することもで
きる。図示しないが、当業者には、特殊目的の無線信
号、慣性誘導システム、または他の類似の電子手段を使
用して、これらの技術の現在の範囲内の方法で、可動式
音声認識システム12の地理的位置を決定できることも
理解されよう。単にユーザがキーボード14を使用して
地理的位置の指示を可動式音声認識システム12に入力
することもできる。
【0017】ここで、図2を参照すると、図1の可動式
音声認識システム12のハイ・レベル・ブロック図が示
されている。図2は、この地理的位置の決定を使用して
音声認識のパープレクシティを低減する方法を示す。図
2内に示したように、基本音声語彙を表す音声テンプレ
ートのコア・ライブラリ38を含むメモリ36が可動式
音声認識システム12内に設けられる。同様に、複数の
位置固有のライブラリ40もメモリ36内に記憶されて
いる。位置固有のライブラリ40はそれぞれ、特定の地
理的位置の専用語彙を表すテンプレートを含む。たとえ
ば、音声テンプレートの位置固有のライブラリはそれぞ
れ、その地理的位置内の街路名、その地理的位置内の会
社名、または選択された地理的位置に関連する他の固有
名を表す一連の音声テンプレートを含むことができる。
【0018】したがって、マイクロフォン22で発音が
検出されるたびに、プロセッサ32に結合されたアナロ
グ・ディジタル変換器34を使用する処理ができるよう
にその音声を適切に変換することができる。次いで、プ
ロセッサ32は位置決定回路30を使用して、発音時の
可動式音声認識システム12の特定の地理的位置を識別
する。上述のように、これは、衛星測位システム、また
はアンテナ20で受信されるセルラ電話からの無線周波
数信号を使用し、あるいはユーザが特定の地理的位置の
IDを定期的にキーボード14で入力することを必要と
する簡単な手段によって行うことができる。
【0019】次いで、プロセッサ32によって、位置決
定回路30の出力を使用して、メモリ36内に含まれて
いる複数の位置固有のライブラリ40の内の特定の1つ
が選択される。次いで、入力音声データ・フレームが、
コア・ライブラリ38と位置固有のライブラリ40の内
の特定の1つとから成る複合ライブラリと比較される。
このように、可動式音声認識システムでの音声認識のパ
ープレクシティを大幅に低減し、それによってシステム
内の音声認識の精度および効率を拡張することができ
る。
【0020】音声認識における従来の試みに関して上記
で論じたように、入力音声を処理する際に突き合わせる
テンプレートは、個別の単語、句、または単語の一部を
表すテンプレートで構成することができる。「テンプレ
ート」の語は、本明細書では、プロセッサ32が未知の
発音を識別するために使用できる記憶されたディジタル
表現を意味するものとする。
【0021】最後に図3を参照すると、本発明の方法を
実施するためのプロセスを示すハイ・レベル・フロー・
チャートが示されている。図のように、このプロセスは
ブロック60で始まり、次いで、ブロック62に進む。
ブロック62では、言葉が発音されたことが検出された
かどうかを判定する。検出されなかった場合、プロセス
は単に、発音が検出されるまで反復する。しかし、言葉
が発音されたことが検出されると、プロセスはブロック
64に進む。
【0022】ブロック64では、可動式音声認識システ
ム12の現在の地理的位置を決定する。上述のように、
これは、衛星測位システム、セルラ電話システム、ある
いは他の専用無線周波数信号または慣性航法技術を使用
して行うことができる。次いで、ブロック66で、地理
的位置の決定を使用して、特定の位置固有のライブラリ
が選択される。
【0023】次いで、ブロック68で、入力発音が、基
本語彙単語のコア・ライブラリと、可動式音声認識シス
テム12の決定された地理的位置に関連する特定の位置
固有のライブラリとに突き合わされて処理される。次い
で、プロセスはブロック70に進む。ブロック70で
は、発音が認識されたかどうかを判定する。認識されな
かった場合、プロセスはブロック72に進む。ブロック
72では、エラー・メッセージ、ユーザに発音を繰り返
させる音声化されたコマンド、またはシステムが音声を
認識できなかったことを解決するための同様な技術が生
成される。プロセスは、そのようなメッセージを生成し
た後、ブロック76に進み、リターンして、次の発音が
検出されるのを待つ。
【0024】再びブロック70を参照すると、音声が認
識された場合、プロセスはブロック74に進む。ブロッ
ク74でその音声を処理する。当業者には、ユーザに提
供される情報を生成し、システムのある部分の活動を制
御し、あるいは将来参照できるようにデータを記憶する
ように、音声を処理できることが理解されよう。次い
で、上記のように、プロセスはブロック76に進み、リ
ターンして、次の発音が検出されるのを待つ。
【0025】前記を参照すれば、当業者には、本発明の
方法およびシステムが、可動式音声認識システムの地理
的位置を決定し、次いで、音声テンプレートの位置固有
のライブラリを使用することによって、音声認識システ
ムのパープレクシティを大幅に低減し、それによって、
音声認識の精度および効率を高めることが理解されよ
う。
【0026】まとめとして、本発明の構成に関して以下
の事項を開示する。
【0027】(1)入力音声フレームを音声を表す記憶
されたテンプレートと突き合わせて処理する可動式音声
認識システムの効率を高める方法において、基本音声語
彙を表す音声テンプレートのコア・ライブラリを作成し
て記憶するステップと、それぞれ特定の地理的位置の専
用語彙を表す、音声テンプレートの複数の位置固有のラ
イブラリを作成して記憶するステップと、前記可動式音
声認識システムの地理的位置を決定するステップと、前
記可動式認識システムの前記地理的位置の前記決定に応
じて、音声テンプレートの前記複数の位置固有のライブ
ラリの内の特定の1つと音声テンプレートの前記コア・
ライブラリを組み合わせるステップと、音声の入力フレ
ームを前記コア・ライブラリおよび位置固有のライブラ
リと突き合わせて処理するステップとを含む方法。 (2)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、セルラ電話システムを使用して前
記可動式音声認識システムの地理的位置を決定するステ
ップを含むことを特徴とする、上記(1)に記載の可動
式音声認識システムの効率を拡張する方法。 (3)前記可動式音声認識システムの地理的位置を決定
する前記ステップが、衛星測位システムの受信装置を使
用して前記可動式音声認識システムの地理的位置を決定
するステップを含むことを特徴とする、上記(1)に記
載の可動式音声認識システムの効率を拡張する方法。 (4)入力音声を受け取るためのオーディオ入力手段
と、メモリと、基本音声語彙を表す、前記メモリ内に記
憶された音声テンプレートのコア・ライブラリと、それ
ぞれ特定の地理的位置の専用語彙を表す、前記メモリ内
に記憶された音声テンプレートの複数の位置固有のライ
ブラリと、前記可動式音声認識システムの地理的位置を
決定するための位置決定手段と、前記メモリおよび前記
位置決定手段に結合された、前記可動式音声認識システ
ムの前記地理的位置の決定に応じて前記複数の位置固有
のライブラリの内の特定の1つを選択するためのライブ
ラリ選択手段と、前記オーディオ入力手段および前記メ
モリに結合された、入力音声フレームを前記コア・ライ
ブラリおよび前記複数の位置固有のライブラリの内の特
定の1つと突き合わせて処理するための音声プロセッサ
手段とを備え、音声認識の効率が高められることを特徴
とする可動式音声認識システム。 (5)前記オーディオ入力手段がマイクロフォンを含む
ことを特徴とする上記(4)に記載の可動式音声認識シ
ステム。 (6)前記位置決定手段がセルラ電話トランシーバを含
むことを特徴とする上記(4)に記載の可動式音声認識
システム。 (7)前記位置決定手段が衛星測位システム受信装置を
含むことを特徴とする上記(4)に記載の可動式音声認
識システム。 (8)前記音声プロセッサ手段がアナログ・ディジタル
変換器を含むことを特徴とする上記(4)に記載の可動
式音声認識システム。 (9)前記音声プロセッサ手段がパーソナル・コンピュ
ータを含むことを特徴とする上記(8)に記載の可動式
音声認識システム。 (10)音声テンプレートの前記複数の位置固有のライ
ブラリがそれぞれ、複数の地名を表す、複数のテンプレ
ートから成ることを特徴とする上記(4)に記載の可動
式音声認識システム。
【0028】
【発明の効果】したがって、本発明によれば、改良され
た音声認識システムが提供される。また、音声認識精度
および効率の向上のための改良された方法およびシステ
ムが提供される。さらに、音声テンプレートの位置固有
のライブラリおよびシステム位置の識別を使用する可動
式音声認識システムでの音声認識の向上のための改良さ
れた方法およびシステムが提供される。
【図面の簡単な説明】
【図1】本発明の方法およびシステムを実施するために
使用できる可動式音声認識システムの絵画図である。
【図2】図1の可動式音声認識システムのハイ・レベル
・ブロック図である。
【図3】本発明の方法を実施するためのプロセスを示す
ハイ・レベル論理フローチャートである。
【符号の説明】 12 可動式音声認識システム 14 キーボード 16 ディスプレイ 18 表示画面 20 アンテナ 22 マイクロフォン 24 セルラ送信塔 28 衛星 30 位置決定回路 32 プロセッサ 34 アナログ・ディジタル変換器 36 メモリ 38 コア・ライブラリ 40 位置固有のライブラリ
───────────────────────────────────────────────────── フロントページの続き (72)発明者 ジョン・エム・ルカッセン アメリカ合衆国10025 ニューヨーク州ニ ューヨーク ワンハンドレッド・アンド・ サード・ストリート・ウェスト 308 (72)発明者 ロジャー・エム・ミラー アメリカ合衆国06804 コネチカット州ブ ルックフィールド ピー・オー・ボックス 778 (72)発明者 エルトン・ビー・シャーウィン・ジュニア アメリカ合衆国06903 コネチカット州ス タンフォード ドッグウッド・レーン 26

Claims (10)

    【特許請求の範囲】
  1. 【請求項1】入力音声フレームを音声を表す記憶された
    テンプレートと突き合わせて処理する可動式音声認識シ
    ステムの効率を高める方法において、 基本音声語彙を表す音声テンプレートのコア・ライブラ
    リを作成して記憶するステップと、 それぞれ特定の地理的位置の専用語彙を表す、音声テン
    プレートの複数の位置固有のライブラリを作成して記憶
    するステップと、 前記可動式音声認識システムの地理的位置を決定するス
    テップと、 前記可動式音声認識システムの前記地理的位置の前記決
    定に応じて、音声テンプレートの前記複数の位置固有の
    ライブラリの内の特定の1つと音声テンプレートの前記
    コア・ライブラリを組み合わせるステップと、 音声の入力フレームを前記コア・ライブラリおよび位置
    固有のライブラリと突き合わせて処理するステップとを
    含む方法。
  2. 【請求項2】前記可動式音声認識システムの地理的位置
    を決定する前記ステップが、セルラ電話システムを使用
    して前記可動式音声認識システムの地理的位置を決定す
    るステップを含むことを特徴とする、請求項1に記載の
    可動式音声認識システムの効率を拡張する方法。
  3. 【請求項3】前記可動式音声認識システムの地理的位置
    を決定する前記ステップが、衛星測位システムの受信装
    置を使用して前記可動式音声認識システムの地理的位置
    を決定するステップを含むことを特徴とする、請求項1
    に記載の可動式音声認識システムの効率を拡張する方
    法。
  4. 【請求項4】入力音声を受け取るためのオーディオ入力
    手段と、 メモリと、 基本音声語彙を表す、前記メモリ内に記憶された音声テ
    ンプレートのコア・ライブラリと、 それぞれ特定の地理的位置の専用語彙を表す、前記メモ
    リ内に記憶された音声テンプレートの複数の位置固有の
    ライブラリと、 前記可動式音声認識システムの地理的位置を決定するた
    めの位置決定手段と、 前記メモリおよび前記位置決定手段に結合された、前記
    可動式音声認識システムの前記地理的位置の決定に応じ
    て前記複数の位置固有のライブラリの内の特定の1つを
    選択するためのライブラリ選択手段と、 前記オーディオ入力手段および前記メモリに結合され
    た、入力音声フレームを前記コア・ライブラリおよび前
    記複数の位置固有のライブラリの内の特定の1つと突き
    合わせて処理するための音声プロセッサ手段とを備え、
    音声認識の効率が高められることを特徴とする可動式音
    声認識システム。
  5. 【請求項5】前記オーディオ入力手段がマイクロフォン
    を含むことを特徴とする請求項4に記載の可動式音声認
    識システム。
  6. 【請求項6】前記位置決定手段がセルラ電話トランシー
    バを含むことを特徴とする請求項4に記載の可動式音声
    認識システム。
  7. 【請求項7】前記位置決定手段が衛星測位システム受信
    装置を含むことを特徴とする請求項4に記載の可動式音
    声認識システム。
  8. 【請求項8】前記音声プロセッサ手段がアナログ・ディ
    ジタル変換器を含むことを特徴とする請求項4に記載の
    可動式音声認識システム。
  9. 【請求項9】前記音声プロセッサ手段がパーソナル・コ
    ンピュータを含むことを特徴とする請求項8に記載の可
    動式音声認識システム。
  10. 【請求項10】音声テンプレートの前記複数の位置固有
    のライブラリがそれぞれ、複数の地名を表す、複数のテ
    ンプレートから成ることを特徴とする請求項4に記載の
    可動式音声認識システム。
JP6277404A 1993-12-30 1994-11-11 音声認識方法およびシステム Pending JPH07210189A (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/175,701 US5524169A (en) 1993-12-30 1993-12-30 Method and system for location-specific speech recognition
US175701 1993-12-30

Publications (1)

Publication Number Publication Date
JPH07210189A true JPH07210189A (ja) 1995-08-11

Family

ID=22641283

Family Applications (1)

Application Number Title Priority Date Filing Date
JP6277404A Pending JPH07210189A (ja) 1993-12-30 1994-11-11 音声認識方法およびシステム

Country Status (3)

Country Link
US (1) US5524169A (ja)
EP (1) EP0661688A2 (ja)
JP (1) JPH07210189A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2004212641A (ja) * 2002-12-27 2004-07-29 Toshiba Corp 音声入力システム及び音声入力システムを備えた端末装置

Families Citing this family (90)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6385312B1 (en) * 1993-02-22 2002-05-07 Murex Securities, Ltd. Automatic routing and information system for telephonic services
JP3691511B2 (ja) * 1993-03-25 2005-09-07 ブリテイッシュ・テレコミュニケーションズ・パブリック・リミテッド・カンパニー 休止検出を行う音声認識
AU672895B2 (en) * 1993-03-31 1996-10-17 British Telecommunications Public Limited Company Connected speech recognition
US6230128B1 (en) 1993-03-31 2001-05-08 British Telecommunications Public Limited Company Path link passing speech recognition with vocabulary node being capable of simultaneously processing plural path links
JP2674521B2 (ja) * 1994-09-21 1997-11-12 日本電気株式会社 移動体誘導装置
US5717828A (en) * 1995-03-15 1998-02-10 Syracuse Language Systems Speech recognition apparatus and method for learning
US6109923A (en) 1995-05-24 2000-08-29 Syracuase Language Systems Method and apparatus for teaching prosodic features of speech
CA2185262C (en) * 1995-09-12 2006-08-29 Michele B. Gammel Method and system for enrolling addresses in a speech recognition database
US5842165A (en) * 1996-02-29 1998-11-24 Nynex Science & Technology, Inc. Methods and apparatus for generating and using garbage models for speaker dependent speech recognition purposes
US5895448A (en) * 1996-02-29 1999-04-20 Nynex Science And Technology, Inc. Methods and apparatus for generating and using speaker independent garbage models for speaker dependent speech recognition purpose
US6076054A (en) * 1996-02-29 2000-06-13 Nynex Science & Technology, Inc. Methods and apparatus for generating and using out of vocabulary word models for speaker dependent speech recognition
EP0891589B1 (de) * 1996-04-02 1999-10-06 Siemens Aktiengesellschaft Anordnung zur erstellung eines digitalen wörterbuchs und verfahren zum aufbau eines digitalen wörterbuchs mit hilfe eines rechners
AU2744097A (en) 1996-04-26 1997-11-19 At & T Corporation Method and apparatus for data transmission using multiple transmit antennas
US6314411B1 (en) 1996-06-11 2001-11-06 Pegasus Micro-Technologies, Inc. Artificially intelligent natural language computational interface system for interfacing a human to a data processor having human-like responses
US5842161A (en) * 1996-06-25 1998-11-24 Lucent Technologies Inc. Telecommunications instrument employing variable criteria speech recognition
US5832429A (en) * 1996-09-11 1998-11-03 Texas Instruments Incorporated Method and system for enrolling addresses in a speech recognition database
US6272457B1 (en) * 1996-09-16 2001-08-07 Datria Systems, Inc. Spatial asset management system that time-tags and combines captured speech data and captured location data using a predifed reference grammar with a semantic relationship structure
US6173192B1 (en) * 1996-10-01 2001-01-09 Honeywell International Inc. Interactive voice responsive radio tuning system
FR2761848B1 (fr) * 1997-04-04 2004-09-17 Parrot Sa Dispositif de commande vocale pour radiotelephone, notamment pour utilisation dans un vehicule automobile
US6856960B1 (en) * 1997-04-14 2005-02-15 At & T Corp. System and method for providing remote automatic speech recognition and text-to-speech services via a packet network
US8209184B1 (en) 1997-04-14 2012-06-26 At&T Intellectual Property Ii, L.P. System and method of providing generated speech via a network
US6078886A (en) 1997-04-14 2000-06-20 At&T Corporation System and method for providing remote automatic speech recognition services via a packet network
US6490561B1 (en) * 1997-06-25 2002-12-03 Dennis L. Wilson Continuous speech voice transcription
US6125341A (en) * 1997-12-19 2000-09-26 Nortel Networks Corporation Speech recognition system and method
US6483896B1 (en) 1998-02-05 2002-11-19 At&T Corp. Speech recognition using telephone call parameters
US6134529A (en) * 1998-02-09 2000-10-17 Syracuse Language Systems, Inc. Speech recognition apparatus and method for learning
US6223156B1 (en) 1998-04-07 2001-04-24 At&T Corp. Speech recognition of caller identifiers using location information
FI981154A7 (fi) * 1998-05-25 1999-11-26 Nokia Mobile Phones Ltd Menetelmä ja laite puheen tunnistamiseksi
US6434526B1 (en) 1998-06-29 2002-08-13 International Business Machines Corporation Network application software services containing a speech recognition capability
JP3036696B1 (ja) * 1998-11-27 2000-04-24 株式会社アスキー ナビゲーションシステム、方法、および、そのプログラムを記録した記録媒体
US6434403B1 (en) * 1999-02-19 2002-08-13 Bodycom, Inc. Personal digital assistant with wireless telephone
US6360201B1 (en) * 1999-06-08 2002-03-19 International Business Machines Corp. Method and apparatus for activating and deactivating auxiliary topic libraries in a speech dictation system
US6434547B1 (en) 1999-10-28 2002-08-13 Qenm.Com Data capture and verification system
US7050977B1 (en) 1999-11-12 2006-05-23 Phoenix Solutions, Inc. Speech-enabled server for internet website and method
US9076448B2 (en) 1999-11-12 2015-07-07 Nuance Communications, Inc. Distributed real time speech recognition system
US7725307B2 (en) * 1999-11-12 2010-05-25 Phoenix Solutions, Inc. Query engine for processing voice based queries including semantic decoding
US7392185B2 (en) 1999-11-12 2008-06-24 Phoenix Solutions, Inc. Speech based learning/training system using semantic decoding
JP4543294B2 (ja) * 2000-03-14 2010-09-15 ソニー株式会社 音声認識装置および音声認識方法、並びに記録媒体
US6272464B1 (en) * 2000-03-27 2001-08-07 Lucent Technologies Inc. Method and apparatus for assembling a prediction list of name pronunciation variations for use during speech recognition
DE10017717B4 (de) * 2000-04-11 2006-01-05 Leopold Kostal Gmbh & Co. Kg Spracheingabe gesteuertes Steuergerät
US20020107918A1 (en) * 2000-06-15 2002-08-08 Shaffer James D. System and method for capturing, matching and linking information in a global communications network
JP2004503887A (ja) * 2000-06-16 2004-02-05 ヘルセテック インコーポレイテッド 携帯情報端末用音声認識装置
WO2002005264A1 (de) * 2000-07-07 2002-01-17 Siemens Aktiengesellschaft Sprachgesteuerte anordnung und verfahren zur spracheingabe und -erkennung
DE10043531A1 (de) * 2000-09-05 2002-03-14 Philips Corp Intellectual Pty Sprachdialogsystem
US6850882B1 (en) 2000-10-23 2005-02-01 Martin Rothenberg System for measuring velar function during speech
US7444284B1 (en) * 2001-01-24 2008-10-28 Bevocal, Inc. System, method and computer program product for large-scale street name speech recognition
US20020133344A1 (en) * 2001-01-24 2002-09-19 Damiba Bertrand A. System, method and computer program product for large-scale street name speech recognition
US20020111810A1 (en) * 2001-02-15 2002-08-15 Khan M. Salahuddin Spatially built word list for automatic speech recognition program and method for formation thereof
US6885989B2 (en) 2001-04-02 2005-04-26 International Business Machines Corporation Method and system for collaborative speech recognition for small-area network
MY141150A (en) * 2001-11-02 2010-03-15 Panasonic Corp Channel selecting apparatus utilizing speech recognition, and controling method thereof
JP3943983B2 (ja) * 2002-04-18 2007-07-11 キヤノン株式会社 音声認識装置及びその方法、プログラム
US7224981B2 (en) * 2002-06-20 2007-05-29 Intel Corporation Speech recognition of mobile devices
US7752045B2 (en) * 2002-10-07 2010-07-06 Carnegie Mellon University Systems and methods for comparing speech elements
US20050131685A1 (en) * 2003-11-14 2005-06-16 Voice Signal Technologies, Inc. Installing language modules in a mobile communication device
JP4040573B2 (ja) * 2003-12-12 2008-01-30 キヤノン株式会社 音声認識装置および方法
US7664639B2 (en) * 2004-01-14 2010-02-16 Art Advanced Recognition Technologies, Inc. Apparatus and methods for speech recognition
US20050261904A1 (en) * 2004-05-20 2005-11-24 Anuraag Agrawal System and method for voice recognition using user location information
US20060074660A1 (en) * 2004-09-29 2006-04-06 France Telecom Method and apparatus for enhancing speech recognition accuracy by using geographic data to filter a set of words
US20060122834A1 (en) * 2004-12-03 2006-06-08 Bennett Ian M Emotion detection device & method for use in distributed systems
ATE403928T1 (de) * 2006-12-14 2008-08-15 Harman Becker Automotive Sys Sprachdialogkontrolle basierend auf signalvorverarbeitung
EP2118881A1 (en) * 2007-02-13 2009-11-18 Ntera Limited Voltage feedback circuit for active matrix reflective display devices
US8938392B2 (en) * 2007-02-27 2015-01-20 Nuance Communications, Inc. Configuring a speech engine for a multimodal application based on location
US9208783B2 (en) * 2007-02-27 2015-12-08 Nuance Communications, Inc. Altering behavior of a multimodal application based on location
US8645143B2 (en) * 2007-05-01 2014-02-04 Sensory, Inc. Systems and methods of performing speech recognition using global positioning (GPS) information
US8060367B2 (en) * 2007-06-26 2011-11-15 Targus Information Corporation Spatially indexed grammar and methods of use
US20090018842A1 (en) * 2007-07-11 2009-01-15 Garmin Ltd. Automated speech recognition (asr) context
US8219399B2 (en) * 2007-07-11 2012-07-10 Garmin Switzerland Gmbh Automated speech recognition (ASR) tiling
US8255224B2 (en) 2008-03-07 2012-08-28 Google Inc. Voice recognition grammar selection based on context
WO2010019831A1 (en) * 2008-08-14 2010-02-18 21Ct, Inc. Hidden markov model for speech processing with training method
US20100070360A1 (en) * 2008-09-13 2010-03-18 At&T Intellectual Property I, L.P. System and method for creating a speech search platform for coupons
JP5334178B2 (ja) * 2009-01-21 2013-11-06 クラリオン株式会社 音声認識装置およびデータ更新方法
CN103154762B (zh) 2010-05-07 2015-08-19 位波私人有限公司 基于远程行动感测的智能数据收集及传输
US8532674B2 (en) * 2010-12-10 2013-09-10 General Motors Llc Method of intelligent vehicle dialing
US20130332170A1 (en) * 2010-12-30 2013-12-12 Gal Melamed Method and system for processing content
US9129591B2 (en) 2012-03-08 2015-09-08 Google Inc. Recognizing speech in multiple languages
US9275635B1 (en) 2012-03-08 2016-03-01 Google Inc. Recognizing different versions of a language
US9043205B2 (en) * 2012-06-21 2015-05-26 Google Inc. Dynamic language model
US8831957B2 (en) * 2012-08-01 2014-09-09 Google Inc. Speech recognition models based on location indicia
US10593326B2 (en) * 2013-04-25 2020-03-17 Sensory, Incorporated System, method, and apparatus for location-based context driven speech recognition
US9589564B2 (en) * 2014-02-05 2017-03-07 Google Inc. Multiple speech locale-specific hotword classifiers for selection of a speech locale
US9773499B2 (en) 2014-06-18 2017-09-26 Google Inc. Entity name recognition based on entity type
EP3198593A4 (en) * 2014-08-01 2019-02-20 Maluuba Inc. VOICE RECOGNITION USING TEMPLATES ASSOCIATED WITH A GEOGRAPHICAL LOCATION
US9460721B2 (en) * 2015-01-16 2016-10-04 The United States Of America As Represented By The Secretary Of The Navy Method for context driven speech recognition and processing
CN105206263A (zh) * 2015-08-11 2015-12-30 东莞市凡豆信息科技有限公司 基于动态字典的语音语义识别方法
CN106875949B (zh) * 2017-04-28 2020-09-22 深圳市大乘科技股份有限公司 一种语音识别的校正方法及装置
KR102356889B1 (ko) * 2017-08-16 2022-01-28 삼성전자 주식회사 음성 인식을 수행하는 방법 및 이를 사용하는 전자 장치
US20250191585A1 (en) * 2023-12-07 2025-06-12 International Business Machines Corporation Multilingual command line interface bots enabled with a real-time language analysis service
US12596524B2 (en) 2024-04-24 2026-04-07 Motorola Mobility Llc Ending active noise cancellation based on a detected audio source
US12613674B2 (en) * 2024-04-24 2026-04-28 Motorola Mobility Llc Ending audio playback based on a trigger word
US12614551B2 (en) 2024-04-24 2026-04-28 Motorola Mobility Llc Presenting relevant audio data

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6441912A (en) * 1987-08-08 1989-02-14 Fujitsu Ltd Constant voltage circuit
JPH02232696A (ja) * 1989-03-06 1990-09-14 Toshiba Corp 音声認識装置
JPH03175478A (ja) * 1989-12-05 1991-07-30 Sony Corp 地図表示装置

Family Cites Families (26)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4525793A (en) * 1982-01-07 1985-06-25 General Electric Company Voice-responsive mobile status unit
US4620286A (en) * 1984-01-16 1986-10-28 Itt Corporation Probabilistic learning element
US4797924A (en) * 1985-10-25 1989-01-10 Nartron Corporation Vehicle voice recognition method and apparatus
US4831550A (en) * 1986-03-27 1989-05-16 International Business Machines Corporation Apparatus and method for estimating, from sparse data, the probability that a particular one of a set of events is the next event in a string of events
JPS62239231A (ja) * 1986-04-10 1987-10-20 Kiyarii Rabo:Kk 口唇画像入力による音声認識方法
US4903305A (en) * 1986-05-12 1990-02-20 Dragon Systems, Inc. Method for representing word models for use in speech recognition
US4866778A (en) * 1986-08-11 1989-09-12 Dragon Systems, Inc. Interactive speech recognition apparatus
US4856066A (en) * 1986-11-06 1989-08-08 Lemelson Jerome H Speech communication system and method
US4914703A (en) * 1986-12-05 1990-04-03 Dragon Systems, Inc. Method for deriving acoustic models for use in speech recognition
DE3711348A1 (de) * 1987-04-03 1988-10-20 Philips Patentverwaltung Verfahren zum erkennen kontinuierlich gesprochener woerter
GB2207027B (en) * 1987-07-15 1992-01-08 Matsushita Electric Works Ltd Voice encoding and composing system
EP0302614B1 (en) * 1987-07-16 1993-03-10 Fujitsu Limited Speech recognition device
GB8720387D0 (en) * 1987-08-28 1987-10-07 British Telecomm Matching vectors
US4852173A (en) * 1987-10-29 1989-07-25 International Business Machines Corporation Design and construction of a binary-tree system for language modelling
US4984177A (en) * 1988-02-05 1991-01-08 Advanced Products And Technologies, Inc. Voice language translator
US5003490A (en) * 1988-10-07 1991-03-26 Hughes Aircraft Company Neural network signal processor
US5027406A (en) * 1988-12-06 1991-06-25 Dragon Systems, Inc. Method for interactive speech recognition and training
US5167011A (en) * 1989-02-15 1992-11-24 W. H. Morris Method for coodinating information storage and retrieval
US4984178A (en) * 1989-02-21 1991-01-08 Texas Instruments Incorporated Chart parser for stochastic unification grammar
US5033087A (en) * 1989-03-14 1991-07-16 International Business Machines Corp. Method and apparatus for the automatic determination of phonological rules as for a continuous speech recognition system
US4994983A (en) * 1989-05-02 1991-02-19 Itt Corporation Automatic speech recognition system using seed templates
US5274695A (en) * 1991-01-11 1993-12-28 U.S. Sprint Communications Company Limited Partnership System for verifying the identity of a caller in a telecommunications network
US5297183A (en) * 1992-04-13 1994-03-22 Vcs Industries, Inc. Speech recognition system for electronic switches in a cellular telephone or personal communication network
US5233681A (en) * 1992-04-24 1993-08-03 International Business Machines Corporation Context-dependent speech recognizer using estimated next word context
JP2602158B2 (ja) * 1992-12-04 1997-04-23 株式会社エクォス・リサーチ 音声出力装置
US5384892A (en) * 1992-12-31 1995-01-24 Apple Computer, Inc. Dynamic language model for speech recognition

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6441912A (en) * 1987-08-08 1989-02-14 Fujitsu Ltd Constant voltage circuit
JPH02232696A (ja) * 1989-03-06 1990-09-14 Toshiba Corp 音声認識装置
JPH03175478A (ja) * 1989-12-05 1991-07-30 Sony Corp 地図表示装置

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2004212641A (ja) * 2002-12-27 2004-07-29 Toshiba Corp 音声入力システム及び音声入力システムを備えた端末装置

Also Published As

Publication number Publication date
US5524169A (en) 1996-06-04
EP0661688A2 (en) 1995-07-05

Similar Documents

Publication Publication Date Title
US5524169A (en) Method and system for location-specific speech recognition
US5802251A (en) Method and system for reducing perplexity in speech recognition via caller identification
US7184957B2 (en) Multiple pass speech recognition method and system
US7328155B2 (en) Method and system for speech recognition using grammar weighted based upon location information
JP5334178B2 (ja) 音声認識装置およびデータ更新方法
US6112174A (en) Recognition dictionary system structure and changeover method of speech recognition system for car navigation
KR100556050B1 (ko) 적어도위치및/또는거리이름들을위한입력시스템
US6910012B2 (en) Method and system for speech recognition using phonetically similar word alternatives
EP1171871B1 (en) Recognition engines with complementary language models
US7983913B2 (en) Understanding spoken location information based on intersections
US7822613B2 (en) Vehicle-mounted control apparatus and program that causes computer to execute method of providing guidance on the operation of the vehicle-mounted control apparatus
EP1542207B1 (en) Speech recognition method and apparatus
EP0769184B1 (en) Speech recognition methods and apparatus on the basis of the modelling of new words
US20060100871A1 (en) Speech recognition method, apparatus and navigation system
KR20090085673A (ko) 음성 인식을 이용한 콘텐츠 선택
US6662159B2 (en) Recognizing speech data using a state transition model
JP2003308090A (ja) 音声認識装置、音声認識方法および音声認識プログラム
EP1600942B1 (en) Automatic word pronunciation generation for speech recognition
CN111462748A (zh) 语音识别处理方法、装置、电子设备及存储介质
KR102392992B1 (ko) 음성 인식 기능을 활성화시키는 호출 명령어 설정에 관한 사용자 인터페이싱 장치 및 방법
JP2001141500A (ja) 車載エージェント処理装置
JP3645104B2 (ja) 辞書検索装置及び辞書検索プログラムを記録した記録媒体
JP3296783B2 (ja) 車載用ナビゲーション装置および音声認識方法
JPH10282987A (ja) 音声認識システムおよび方法
JPS5941226B2 (ja) 音声翻訳装置