JPH10207685A - ハイパーリンク化された情報との音声化されたインターフェースのためのシステムおよび方法 - Google Patents

ハイパーリンク化された情報との音声化されたインターフェースのためのシステムおよび方法

Info

Publication number
JPH10207685A
JPH10207685A JP9333888A JP33388897A JPH10207685A JP H10207685 A JPH10207685 A JP H10207685A JP 9333888 A JP9333888 A JP 9333888A JP 33388897 A JP33388897 A JP 33388897A JP H10207685 A JPH10207685 A JP H10207685A
Authority
JP
Japan
Prior art keywords
information
hyperlink
user
voice
speech
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP9333888A
Other languages
English (en)
Other versions
JP3811280B2 (ja
Inventor
Daniel Jitzchak Mayer
ジッツチャック メイヤー ダニエル
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
AT&T Inc
Original Assignee
AT&T Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by AT&T Inc filed Critical AT&T Inc
Publication of JPH10207685A publication Critical patent/JPH10207685A/ja
Application granted granted Critical
Publication of JP3811280B2 publication Critical patent/JP3811280B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/42Systems providing special services or facilities to subscribers
    • H04M3/487Arrangements for providing information services, e.g. recorded voice services or time announcements
    • H04M3/493Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
    • H04M3/4938Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals comprising a voice browser which renders and interprets, e.g. VoiceXML

Landscapes

  • Engineering & Computer Science (AREA)
  • Signal Processing (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Information Transfer Between Computers (AREA)
  • Computer And Data Communications (AREA)

Abstract

(57)【要約】 【課題】 本発明は、格納された情報とユーザとが対話
(Interaction)、特に、そのような対話が音声会話を介
して行われる技術に関し、音声ブラウザの改善を提供す
ることを目的とする。 【解決手段】 本発明は、音声の形式でユーザに対して
提示される複数のハイパーリンクの中から1つのハイパ
ーリンクの選択を容易にするものであり、該複数のハイ
パーリンクと1以上の他の語の音声発声を表す、ハイパ
ーリンクの識別を含んだ第1の信号を該ユーザに提供
し、該ユーザによって発声された音声を表す第2の信号
の音声認識を実行する段階とからなり、該音声認識が、
少なくとも2つの該ハイパーリンクに対応するエントリ
からなる認識装置の語彙を使うことによって実行される
ことを特徴とする。

Description

【発明の詳細な説明】
【発明の属する技術分野】
【0001】本出願は、格納された情報とユーザとが対
話(Interaction) 、特に、そのような対話が音声会話を
介して行われる技術に関する。
【0002】
【発明の背景】「ブラウザ」として知られているソフト
ウェア・プログラムは、一般的に、ワールド・ワイド・
ウェブ(WWW)として知られているインターネットの
一部への簡単なアクセスを提供するために使われてい
る。そのようなブラウザの例としては、ネットスケープ
・コミュニケーション社(Netscape Communications In
c.)から入手できるネットスケープナビゲータ(Netsca
pe Navigator)や、マイクロソフト社(Microsoft Corp
oration) から入手できるインターネットエクスプロー
ラ(Internet Explorer) 等がある。これらのブラウザ
は、コンピュータユーザがWWWからの情報を要求し表
示することを支援する文字的・グラフィックス的なユー
ザ・インターフェースである。ブラウザによって表示さ
れる情報は、画像、文字、音声、グラフィックスおよび
ハイパーリンクを含むドキュメント(または「ペー
ジ」)を含み、それはよく「ハイパーテキスト(hypert
ext) 」と称される。
【0003】ハイパーテキストは、情報を見いだせる別
のアドレス(通常は別のドキュメント)のテキスト形式
のグラフィック表現である。そのような情報は普通、
「テキスト」によって伝えられる情報の内容と関連す
る。ハイパーテキストは、通常アドレスそのものではな
く、ユーザの関心の対象となり得るいくつかの情報を伝
えるテキストである。ユーザがハイパーテキストの一部
分を選択(例えば、マウスの「クリック」によって選
択)すると、ブラウザは通常、そのハイパーテキストに
関連するアドレスに基づいてサーバから別のドキュメン
トを要求する。この意味において、ハイパーテキスト
は、関連するアドレスにあるドキュメントへのリンクで
ある。
【0004】従来のコンピュータ・ソフトウェア・ブラ
ウザの他に、他の型式のブラウザが知られている。オー
ディオ・ブラウザ(Audio Browser) は、ユーザ(リス
ナ)に対しWWWのドキュメント・テキストを「音読」
することによってコンピュータ・ブラウザの機能に接近
する。オーディオ・ブラウザは視力に障害のある人、あ
るいはコンピュータにアクセスできないが電話にアクセ
スできる人にとって特に有用である。テキストの音読
は、従来のテキスト−音声変換(Text-To-Speech:T
TS)技術によって、あるいは予め録音された音声を再
生することによって行うことができる。ハイパーテキス
トが、その前後に「ビープ音」などの可聴デリミタ(Aud
ible Delimiter) によって、あるいはハイパーテキスト
をリスナへ話すときの音声の特性の変化によって、リス
ナに示される。リスナがハイパーテキストに関係してい
るリンクされたアドレスへジャンプしたいときには、リ
スナーはDTMFトーン(すなわち、タッチトーン)に
よって応答するか、あるいは自動音声認識システムによ
って認識される「ジャンプ」または「リンク」などのコ
マンド語を話すことによって応答する。いずれの場合に
おいても、オーディオ・ブラウザは、この応答を、リス
ナーに対して音読したハイパーリンクに関係するアドレ
スにあるドキュメントを検索するコマンドと解釈す
る。。
【0005】
【発明の概要】本発明は、改善されたオーディオ・ブラ
ウザに向けられている。従来のブラウザには、ハイパー
リンクを選択するために単純なコマンド語またはトーン
を使用しなければならない制限があることを本発明の発
明者は認識している。特に、ハイパーテキストでリンク
されたアドレスへジャンプする要望を示すために「同
じ」コマンドまたはトーンを用いるので、従来のオーデ
ィオ・ブラウザでは、そのリスナ(ユーザ)が「次の」
ハイパーリンク・テキストを示す「前に」、任意のハイ
パーテキスト・リンクを選択しなければならない。ハイ
パーテキスト・リンクが連続的に速く現れることから、
あるいは、追加のハイパーリンクを聞くまではどのハイ
パーリンクを選択するかをユーザが知ることができない
ことから、そのようなオーディオ・ブラウザのユーザ
は、巻き戻しおよび再生のコマンドを使って、ハイパー
テキストの次の部分の音読の前に、読まれたが選択しな
かったハイパーテキストを選択できるようにしなければ
ならない。
【0006】本発明の発明者はさらに、「目の見える」
人に対するコンピュータ・ブラウザで採用されている音
声認識技術の特徴が「コンピュータの画面を見ることが
できない」人のためのブラウザを改善するのに有用であ
ることを認識している。例えば、1995年6月5日に
出願された米国特許出願第08/460,955号を参照された
い。
【0007】本発明の1つの実施例によると、例えばW
WWドキュメントから得られる複数のハイパーテキスト
・リンク(あるいは、もう少し詳細には「ハイパーリン
ク語(Hyperlink Word)」)が、「オーディオ」ブラウザ
に対する音声認識装置の語彙として用いられている。こ
れらのハイパーリンク語を、そのオーディオ・ブラウザ
の「話し声」の通常の課程でユーザに音読する。ユーザ
は、そのようなハイパーリンク語を、例えば「話し声」
に対する音声の特性の変化によって識別する。ユーザが
ハイパーリンク語を選択したい時、従来技術のオーディ
オ・ブラウザのようにコマンドを話すかDTMFトーン
を使うのではなく、そのハイパーリンク語そのものを単
に繰り返す。ドキュメントのハイパーリンク語のいくつ
か、またはすべてをその語彙として有している音声認識
装置は、話されたハイパーリンク語を認識し、認識され
たハイパーリンク語に関連してリンクされたアドレスへ
のジャンプを生じさせる。
【0008】
【発明の詳細な記述】現代の環境においては、ユーザと
そのユーザに関心のある情報との間の電子媒体を経由し
たインターフェースは、ほぼ至る所にも存在するように
なってきている。そのようなインターフェースの代表的
なものが図1に示されている。そこでは音声端末(例え
ば、電話端末)101に位置するユーザは、代表的に公
衆電話網(PSTN)110として示されている通信経
路を経由して、音声サーバノード(Audio Serving Note)
120へのアクセスを得る。音声サーバノード120に
おいては、音声サーバ122が関連するデータベース
(データ記憶装置121)に格納されている情報へのユ
ーザに対するインターフェースを提供している。
【0009】図に示されているように、ユーザは、デー
タ端末(例えば、コンピュータ端末)102のような文
字またはグラフィックを基礎とする媒体から所望の情報
へのアクセスを得ることもできる。ユーザは、代表的に
PSTN110として示されている通信経路を経由し
て、データサーバノード130へのアクセスを得る。デ
ータサーバノード130においては、データ・サーバ1
32が関連するデータベース(データ記憶装置131)
に格納されている情報へのユーザに対するインターフェ
ースを提供している。
【0010】そのような文字またはグラフィックを基礎
とするインターフェース・デバイスから非常に複雑な多
階層の情報源へのアクセスを提供することは既に知られ
ているが、前述したとおり、従来技術で知られるような
声を基礎とするインターフェースは、そのような情報の
非常に限られた範囲だけにアクセスを提供することがで
きる。
【0011】しかし、複雑の程度及び詳細の程度を増加
する(あるいは減少する)リンクされた層あるいは論理
的な関係を指定しているネットワークのリンクのいずれ
かで構成されているテキストを基礎とする情報(トラン
ザクション的なオプションを含む)を提供することは、
この分野の技術においてよく知られている。情報が階層
構造で構成されている場所において、そのような層の間
のリンクが、特定の層に配置されているキー語またはフ
レーズに基づいて通常設定されており、このキー語の各
々は通常、別の層にある関連する情報へのリンクを提供
する。ここでの説明は、階層に格納されている情報への
アクセスに焦点を向けているが、この利用は例示的なも
のであり、本発明の範囲を限定することを意図するもの
ではないことに留意されたい。事実、本発明は、論理的
なリンクのすべての型式に適している。
【0012】そのような階層的にリンクされた情報層の
テキストを基礎とする集合を頻繁に用いている場合が、
ハイパーテキスト・マークアップ・ランゲージ(HyperT
extMarkup Language:HTML)として知られている方
法に見出される。HTMLは、ワールド・ワイド・ウェ
ブに対する重要な機能を提供する。WWWによって、初
期層、すなわち、「ホームページ」がユーザに提示さ
れ、そのホームページは、そのウェブ・サイトに関連す
る主題の事項やアプリケーションに関連する、比較的高
いレベルの情報の記述を提供する。そのホームページ情
報に関連するより詳しい情報または特定のトランザクシ
ョンを追求したいユーザのために、そのホームページの
テキスト中にキー語またはフレーズが強調表示されてお
り、それらはより詳細な情報や特定のトランザクション
にリンクされている。そのようなリンクがHTMLの機
能によって提供されている。
【0013】代表的なHTMLのアプリケーションにお
いては、ユーザに対してテキストのページがパーソナル
・コンピュータのモニタ表示され(最初のそのようなペ
ージは通常はホームページと呼ばれている)、そのテキ
スト中のハイパーテキスト(またはハイパーリンク語)
は特定の色又はアンダーライン付きで表示されるか、通
常のテキストの活字とは異なる何らかの他の方法で表示
される。そのようなハイパーリンク語の下にある(すな
わち、関連する)情報にアクセスしたいユーザは、マウ
ス・ポインタまたはカーソルでそのハイパーテキストを
指定し、そしてマウスのボタンをクリックするか、ある
いはキーボードの「Enter」キーを押すかのいずれかに
よって、下にある情報をアクセスする意志を知らせるこ
とになる。
【0014】<I.本発明に従った例示的な処理の紹介
>1つの実施例によると、相互にリンクされた情報の階
層構造の集合に対する音声によるユーザ・インターフェ
ースが、テキストを基礎とするリンクされたHTML層
の集合(以降ではHTML「ページ」と呼ばれることが
ある)として、所望の情報データベースの初期確立を通
じて提供される。これらのページは、単独のサーバに、
あるいは複数のネットワーク化されたサーバに格納され
る。本発明の1つの実施例によると、任意のHTMLペ
ージのテキストが音声の形式に変換され、そのテキスト
のハイパーリンク語は他のテキストとは区別される音声
とされる。ユーザは、関連する追加の情報が必要である
ポイントを表すハイパーリンク語を繰り返す(すなわ
ち、発声する)ことによって、この音声化された情報シ
ステムと対話(Interactive) し、自動音声認識システム
は、そのユーザによって与えられたハイパーリンク語の
発声を認識する。そのような与えられたハイパーリンク
語の認識に応動して、その与えられたハイパーリンク語
に対応する情報層へのジャンプが行われ、その後に、そ
の新しい情報層のテキストが音声の形式に変換される。
【0015】本発明のこの実施例によると、HTMLペ
ージのテキストが音声形式に変換される。その音声化さ
れたHTMLテキストが、この実施例における電話のリ
ンクを含む種々の周知の通信リンクを経由して、ユーザ
に対して再生される。このようなテキストから音声形式
への変換は非常によく知られており、通常はテキスト−
音声合成器(Text-To-Speech synthesizer:TTS)
によって実行されることになる。そのようなTTSシス
テムはそれ自身よく知られている。TTSシステムの例
は米国特許第4,685,135号、第5,157,759号、及び第5,20
4,905号に開示されている。
【0016】実施例の音声化情報サービスとインターフ
ェースするユーザは、追加の情報に関連するハイパーリ
ンク語に向けられた応答によって、リンクされた情報の
別の層を探索する興味を示すであろうから、音声化され
た情報は、ハイパーリンク語と他の音声化されたテキス
トとの間で聴覚的な区別をすることが望ましい。合成さ
れたテキストの異なる部分についての異なる音声を生成
する各種の方法が、TTS技術において知られている。
本発明の一実施例を表すそのような方法の1つの例は、
普通のテキストは男性の声で提供され、ハイパーリンク
語は女性の声で提供されるものである。あるいはその逆
にすることもできる。TTS技術における声の変更はよ
く知られた手法である。
【0017】ユーザは任意の層の情報についての音声化
されたテキストを聴いており、そしてハイパーリンク語
を聞いたときに、ユーザには2つの選択がある。ユーザ
は発音されたテキストを引き続き聴くことができる(H
TMLページの連続する音読に対応している)。あるい
は、そのハイパーリンク語がそのハイパーリンク語に関
連する更に詳細な情報を必要とするかを入力要求(prom
pt)する場合、ユーザは、その語を繰り返すことによっ
て、その語の選択を示すことができる。その音声による
ユーザの応答は、通信リンクを経由して情報システムと
関連する音声認識装置に伝えられる。その通信リンクは
ユーザに対して発音された情報を提供するのに用いられ
るのと同じ通信リンクであってもよい。そのような音声
認識装置もこの分野の技術においてよく知られている。
【0018】本発明のシステムにおける音声認識装置の
機能は、ユーザが発生した応答を、検討中の情報層のハ
イパーリンク語の1つ、またはシステムに何らかの動作
をさせるように設定された少数の予約された「アクショ
ン」語(例えば、コマンド)の1つのいずれかとして認
識する機能である。従って、ハイパーリンク語はそのア
クション語と一緒に、音声認識装置の語彙の一部として
働く。アクション語は予約語であり、それ故にハイパー
リンク語として使うことはできず、例えば、「停止(st
op)」、「戻り(back)」、「開始(start)」、「より
遅く(slower)」、「より速く(faster)」などであ
り、一般にシステム・オペレータによって設定される。
もちろん、アクション語の集合は小さいことが好まし
く、同じ集合がそのモデルのすべてのアプリケーション
にわたって共通に維持されることが望ましい。
【0019】本発明のシステムのための音声認識機能は
特に実装しやすい。というのは、この音声認識装置は、
任意のある時点において少数の語彙、すなわち、ハイパ
ーリンク語およびアクション語の語彙を認識するだけで
済むからである。音声認識装置の性能を支援するため、
ハイパーリンク語のスライディング・ウィンドウ(Slidi
ng Window)を使って認識装置の語彙を定義することがで
き、任意のある時点で、その語彙は最近再生されたハイ
パーリンク語や以前に発音されたいくつかのハイパーリ
ンク語を含むようにすることができる(しかし、一般に
は、以前に再生されたリンク全ての合計より少ない)。
従って、任意のハイパーリンク語と同じ時間間隔におけ
る追加の語(追加のハイパーリンク語を含んでもよい)
からなる音声認識装置の語彙に対してスライディング・
ウィンドウ(これは発音者を追跡する)を使うことによ
って、語認識装置はその時間間隔の中に現われるハイパ
ーリンク語(と、システムのアクション語)を認識でき
ればよい。さらに、それらのハイパーリンク語の発音を
提供するTTSシステムは語認識装置と同じシステムの
一部であるため、語認識装置およびTTSシステムはあ
る種の音声データ、例えば、ハイパーリンク語の音素の
シーケンスを共有することができ、それはTTSシステ
ムと認識装置の「ウィンドウ」の同期化を保つのに役立
つ。
【0020】ユーザによって話されたハイパーリンク語
が語認識装置によって認識されることに応答して、特定
のハイパーリンク語がユーザによって選択されたことを
示す信号が生成される。純粋にテキストを基礎とするハ
イパーテキスト・システムで使われているものと同様の
方法を使って、特定のハイパーリンク語のこの認識は、
システムがそのハイパーリンク語にリンクされた情報層
へジャンプするように働く。そのリンクされた層に到達
すると、その層のテキストは、同様に、ユーザへの通信
のために音声形式に変換され、その新しい層内のハイパ
ーリンク語またはシステム・アクション語の選択に関す
る更なるユーザ応答の条件となる。ワールド・ワイド・
ウェブのようなテキストを基礎とする既存の技術の場合
と同様に、リンクされた情報層の1つまたはそれ以上
が、他の場所において動作しているサーバに関連する記
憶媒体に存在することができ、そのリンクが、第1のサ
ーバとリンクされたサーバとの間の通信経路を経由して
設定される。
【0021】また、任意の層に、情報の一部またはすべ
てを、ストリーム・オーディオ、例えばプログレッシブ
・ネットワーク社(Progressive Networks,Inc.) 製の
リアルオーディオ(RealAudioTM )によってワールド・
ワイド・ウェブ上で提供されるような予め録音された人
間の声や格納された音声情報とすることができる。この
場合、ハイパーリンク語は、他のテキストに対して使わ
れるものとは反対の性の声で、そのようなハイパーリン
ク語を録音することによって区別することができる。
【0022】<II.例のプロセスの実装>図2におい
て、本発明の方法を実行するシステムが示されている。
この図を参照すると、対象となる情報データベースを表
す一組のHTMLページがデータ記憶装置202の中に
提供され、これは関連するHTMLサーバ203ととも
に、一次サーバノード201−Pを構成する。しかしな
がら、情報セットの部分層または関連する部分を、リモ
ートサーバノード201−R1乃至201−Rmに格納
することができ、そのような各リモートサーバノード
は、HTMLサーバと関連するデータ記憶手段とをそれ
ぞれ含んでいる。各リモートサーバノードは次に音声サ
ーバノード215へリンクし、データ・ネットワーク2
05(例えば、インターネット)を経由して他のサーバ
ノードにリンクされる。
【0023】そのデータ・セットへのアクセスの要求に
応答して(例えば、ユーザの音声端末101からPST
N110を介しての電話呼出しの到着によって)、音声
サーバノード215の自動呼出し分配装置225は、利
用できる音声取扱ユニット216−1をサービス要求に
割り当てる。割り当てられた音声取扱ユニットにおい
て、HTMLクライアント250は、一次サーバノード
201から呼び出されるべきHTMLページの最初のペ
ージ(「ホームページ」)が、割り当てられた音声取扱
ユニットによってさらに処理されるようにする(一次サ
ーバノード201は音声取扱ノード215と一緒に配置
してもよい。)。HTMLのホームページ(これは、一
次サーバノード201にあるデータ記憶装置202から
音声取扱ユニット216−1にあるHTMLクライアン
ト250へHTMLサーバ203によって供給される)
は通常、次に音声化変換手段210によって音声形式に
変換される。通常これはTTSシステムによって実現さ
れる。いくつかの、あるいはすべてのHTML「ペー
ジ」の音声化された形式が、必ずしもユーザアクセス、
ユーザ要求の直後である必要はないが、そのアクセス、
要求の前に得られていて格納されていてもよいことに留
意されたい。この分野の技術においてよく知られている
キャッシング技術は、どの音声形式が予め格納されてい
るか、ユーザ要求に応答してどれが発生されたかを決定
することができる。
【0024】HTMLホームページから音声化されたテ
キストは、次に通信リンク211を介してバージ・イン
・フィルタ(Barge-In Filter) 230へ送信され、そ
こからユーザの音声端末101を経由してそのユーザが
聴くことができる。ユーザが音声化変換手段によって発
音されているHTMLページを聴いている時、そのユー
ザは、追加のあるいは関連する詳細を得たい(あるいは
以下に説明するようにトランザクションをトリガした
い)と思うハイパーリンク語を聞くことができる。その
ような追加のあるいは関連する詳細に対する要求を示す
べく、、ユーザは、ユーザの音声端末101を介してハ
イパーリンク語を繰返す(話す)。ユーザからのその音
声応答は、バージ・イン・フィルタ220を通じて処理
され、通信リンク221を介して音声認識装置240へ
送信される。
【0025】バージ・イン・フィルタ220の重要な機
能は、ユーザによって発声された語(音声化変換手段に
よって発音された語を除く)だけが、音声認識装置24
0に入力されることを保証することである。そのような
バージ・イン・フィルタは、この技術分野において知ら
れており、そして既知の源(音声化変換手段)から生成
された電気信号を、その既知の源とユーザが発生した語
とを混合した全てから差し引くことによって動作する。
この開示の目的のために、バージ・イン・フィルタもま
た、ユーザとその音声取扱ユニットとの間の伝送経路に
ある不完全性を補償するエコー・キャンセラとして働く
ことを理解されたい。
【0026】音声認識装置240は、音声化変換手段2
10から通信リンク222を介してその認識語彙(ユー
ザが繰返し発声するであろうハイパーリンク語を伴う)
を同期化する。音声認識装置によって選択されたハイパ
ーリンク語の認識に応答して、その語に関連する信号
が、その認識装置からHTMLクライアント250へ送
信され、HTMLクライアント250はその信号をHT
MLサーバに対する適切なコードに変換し、そのコード
はその選択されたハイパーリンク語へリンクされた情報
層及び位置に対してハイパーリンクが設定されるべきで
ある示す。この動作は、そのハイパーリンク語を指して
いるカーソルをマウスでユーザがクリックし、システム
がそれに対して応答するのに似ている。
【0027】図3は、図2で示されてた特徴のある機能
のいくつかの詳細を示している。特に、図3は、従来の
テキスト−音素変換プロセッサ315と音素−音声変換
プロセッサ317とを含む音声化変換210、HTML
のドキュメント・ページから利用できるテキストのスト
リームについて動作するハイパーテキスト識別プロセッ
サ310、識別されたハイパーリンクと音素のストリン
グとの相関のためのハイパーテキスト−音素相関器32
0、及びハイパーテキスト・テキストの識別されたシー
ケンスのどれがその音声認識システムに対する語彙の一
部として音声認識プロセッサ350によって使われるべ
きかを決定するウィンドウ・フィルタ330のTTS処
理を行う機能を示している。
【0028】記述されている実施例に従って、任意のH
TMLドキュメント・ページ(これはシステム・ユーザ
に対する音声での提示のためのものである。)が、HT
MLクライアント250によって一次サーバノード20
1から呼び出され、それ以降の処理のために利用できる
ようにされる。与えられたHTMLドキュメントのペー
ジがハイパーテキスト識別プロセッサ310によって解
析され、そのページのハイパーテキストが識別される。
ハイパーテキスト識別プロセッサ310からの出力が、
ハイパーテキスト−音素相関器320へ提供され、そし
てハイパーリンク語とHTMLページの他のテキストと
の間の音声の区別を容易にするために、その出力から得
られる信号が音素−音声変換プロセッサ317へ提供さ
れる。
【0029】ドキュメント・ページ上のテキストが、音
声の変換のために音声化変換器(TTS)システム21
0に対しても提供される。これは、テキスト−音素変換
プロセッサ315によるテキストを音素のシーケンスに
変換する段階と、音素−音声変換プロセッサ317によ
る音素を音声へ変換する段階の、通常の2つの段階によ
って行われる。
【0030】相関付けられたハイパーテキストおよび音
素のシーケンスがウィンドウ・フィルタ320に提示さ
れ、ウィンドウ・フィルタ320は、任意の時刻までに
ユーザに対して再生されたどのハイパーリンク語/フレ
ーズが音声認識装置の語彙(システムのアクション語と
共に)を形成するかを識別する。このウィンドウ・フィ
ルタ330は、過去のある期間(例えば、秒数または語
数で測定することができる)における最近再生されたハ
イパーテキストとそれ以前の全てのハイパーテキストを
選択する。ウィンドウ・フィルタ330は、ユーザに最
近再生された語に関する同期情報を、通信リンク318
を経由して音素−音声変換プロセッサ317から受信す
る。そのウィンドウ・フィルタ・プロセスの結果、即ち
任意のウィンドウの持続期間内で発生したハイパーリン
ク語又はフレーズのシーケンスが、そのような音声の音
素モデル(通常は別個に訓練された隠れマルコフモデル
(Hidden Markov Models) として実行される)とと
もにデータベース340に格納される。当然、データベ
ース340は、システム・アクション語の音素モデルも
含んでいる。従来の自動音声認識プロセッサ350は、
ユーザから(バージ・イン・フィルタ220および通信
リンク221を経由して)未知の音声を受信し、ハイパ
ーリンク語またはシステム・アクション語の現在の語彙
の1つとしてその音声を認識するように動作する。音声
認識プロセッサ350はデータベース340と対話し
て、従来、例えばビタビ(Viterbi) スコアリングをその
データベースの中の各種のモデルによってその未知の音
声に対して行う。ハイパーリンク語又はフレーズ、又は
システム・アクション語の認識に応答して、選択された
ハイパーリンク語(例えば、それと同等のHTML「ペ
ージ」の検索)またはシステム・アクション語に対する
適切な動作のために、その認識システムの出力が一次サ
ーバノード201に提供される。
【0031】ウィンドウ・フィルタ330は、所定の時
間ウィンドウで発音されたすべてのハイパーリンク語を
等しい確率でその音声認識装置の語彙の中に受け入れ
る、平坦な重み付けとすることができる。代わりに、ウ
ィンドウ・フィルタは、最近発音されたハイパーリンク
語を、以前に認識ウィンドウで発音された語より高い確
率でその音声認識装置の語彙の中に受け入れる、時間で
定義された「コンテキスト的なスムージング」(contex
tual smoothing)を提供することもできる。これらの確
率は、認識を実行する時に音声認識装置350によって
考慮される。
【0032】ある種のシステム・アクション語は、音素
−音声変換手段の動作(例えば、「より速く」、「より
遅く」、...)を参照する。そのような語が音声認識
プロセッサ350によって認識されると、それぞれを識
別する信号が適切な動作のために音声化変換手段へ送信
される。
【0033】ユーザが経験する範囲内の任意の時点にお
いて、テキストから音声への変換音声ではなく、予め録
音された音声または音声コンテント(例えば、音楽)が
使えることも理解すべきである。発音されるテキストで
はなく人間の声が望ましいとき、そのシステムの動作が
図4に示されている。図の中で見出せるように、この実
施例におけるデータ源は、ストリーム音声サーバ410
とともにHTMLサーバ201から構成されている(各
サーバは適切な記憶手段を含んでいる)。HTMLサー
バ201とストリーム音声サーバ410は、単独のサー
バあるいは別々のサーバとして実行でき、そしてそれぞ
れが複数の物理的サーバから構成されており、それらが
同じ場所にあっても、あるいは離れた場所にあってもよ
いことに留意されたい。HTMLサーバ201によって
提供されるデータは、以前に記述された実施例の場合と
同様に、テキストのHTMLページである。しかし、ス
トリーム音声サーバに対し、データの内容は、そのユー
ザが利用できるハイパーテキスト・データの集合の全
て、あるいはその一部分に対応する予め録音された音声
セグメントからなる。そのような音声セグメントは通
常、正確な音読スクリプト(reading script)として、ハ
イパーテキスト・データの素材を人間が録音することに
よって設定される。1つの実施例においては、問題のデ
ータのテキスト部分が男性の声で読まれて(記録さ
れ)、そしてハイパーリンク語は女性の声(男性の声と
は明確に異なるピッチを有する)で読まれる。リンクを
設定できる全てのセグメントは別々に録音される。スト
リーム音声セグメントの再生はHTMLサーバによって
制御される。
【0034】この実施例に対するシステムの動作は、図
3に対して記載されているように進行する。ただし、ユ
ーザには発音された音声の代わりに、(少なくとも選択
されたデータ・セグメントに対して)ストリーム音声の
再生が提示される。通信リンク310上で再生されたす
べてのハイパーリンク語が、ハイパーリンク音声識別装
置417を通じてハイパーリンク語・テキストおよび音
声同期手段420に対して与えられる。ハイパーリンク
音声識別はハイパーリンク語の音声を他のテキストに対
する音声から識別するように動作する。この実施例にお
いては、女性の声(ハイパーリンク語)を男性の声(他
のテキスト)から識別する。前に述べたように、ハイパ
ーリンク・テキスト識別手段310は、この場合はハイ
パーリンク語・テキストおよび音声同期化手段420を
通してハイパーリンク語(テキスト形式)を供給し、そ
れはこの分野の技術においてよく知られている方法で、
同じ語のテキスト・バージョンと一緒にストリームオー
ディオハイパーリンク語の進行を追跡し、それによって
ウィンドウ・フィルタ330に対して必要な同期信号を
提供する。ユーザはその同じ方法でそのシステムとイン
ターフェースし、そして音声認識手段は前と同じように
動作する。ハイパーリンク語が認識されると、HTML
クライアントは前と同様にトリガされ、HTMLサーバ
はストリーム音声サーバがその要求されたあらかじめ録
音されているセグメントへ移動するようにさせ、そして
その新しいセグメントをユーザに対して再生し続けるよ
うにさせる。
【0035】<III.発明の方法の応用>本発明の実施例
は、従来の音声情報システムに付随する多くの問題を解
決することができる。例えば、従来の音声情報システム
は設計および使用が難しいことが多い。この困難性のた
めに、リスナーがタッチ・トーン・キーを押すことによ
って選択しなければならないような、よくあるネストさ
れた階層形式において、リスナに対して各種のオプショ
ンを提示するための「ユーザ・フレンドリ」なシステム
を設計する問題が抑制される。この設計の仕事の困難性
は、それ自身、例えば銀行または仲買い業の機関におけ
る自動化されたトランザクション・システムを初めて使
うようなユーザが遭遇する。ユーザは音声「メニュー」
の入れ込まれた階層は、ナビゲートするのが難しいこと
に不満を洩らす場合が多い。それと対照的に、本発明は
情報をナビゲートして所望のオプションを選択するため
のもっと直観的なインターフェースを提供する。本発明
によると、ユーザは自分が必要とするオプションをしゃ
べり、システムとより直観的に(例えば、手を使わなく
てよい、目を使わなくてよい)正しく対処できるように
する。さらに、本発明の方法によると、ユーザは特定の
オプションを選択する時に利用できるオプションに気付
くことがずっと多くなる。というのは、任意の点におい
て利用できる、提示される複数の話し言葉のオプション
が利用できるからである。多くの従来技術の方法におけ
るように、概念を番号と関係付ける必要はない。
【0036】本発明は自由様式、制約のないフレーズの
認識に関する現代水準の音声認識システムの問題を解決
することもできる。繰り返されるべき話し言葉のハイパ
ーリンク語によってブラウザを提示することにより、そ
のシステムはハイパーテキストの選択においてリスナー
によって話される可能性の高い語の限定された集合を前
もって「知る」。従って、このシステムは音声情報シス
テムの設計者が工夫する可能性のある実質的にどんな話
された語やフレーズも認識することができる。設計者は
認識装置の精度を維持するだけのために認識、あるいは
いくつかの代替方法の中で使うために少数の語彙(その
音声情報システムのコンテキストに対応している)を選
択することに制限されない。
【0037】また、ウィンドウ・フィルタを採用してい
る実施例では、認識装置の語彙を一時的に制限して最小
化することによって、高度な音声認識性能を容易に得る
ことができる。従って、その認識装置は常にすべての語
(設計者によってハイパーテキストとして選択された)
を認識しようと試みることはない(あるいはその必要が
ない)。これによって認識装置の性能が改善される。と
いうのは、認識装置が長時間にわたってそれぞれの可能
な同義語を認識する必要があるすべての語が存在するた
めに語彙が大規模になる時、正しい認識はますます困難
になるからである。
【0038】また、本発明によって、音声情報システム
の設計者は豊富なHTMLオーサリング・ツールを利用
することができる。
【0039】本発明を実施することの他の利点として
は、拡張されたHTML媒体において後で複製すること
ができる情報空間を通じての記録された経路の指定があ
る。例えば、ユーザは電話を使って情報空間の中をナビ
ゲートすることができ、その後、テキスト「および」関
連付けられた画像(同じ経路を辿って得られる)をFA
Xマシーンに対して、あるいは電子メールのメッセージ
に対する付属物として配送するようシステムに指令する
ことができる。電話機のユーザおよび目が不自由なPC
のユーザに対してWWWのパーツをオープンにするこ
と、音声メッセージングおよび電子メールの統合化され
た使用、およびタッチトーン電話機を採用しない場所に
ある世界において音声情報システムのより一般的な適用
を提供する。
【0040】<IV.結論>記憶された情報によって音声
による対話を行うためのシステムおよび方法が説明され
てきた。その中で、実質的により簡単で、より直感的な
ユーザ・インターフェース以外に、従来技術によって処
理されるよりずっと複雑な情報の集合の表示を提供す
る。本発明の1つの応用例においては、ユーザまたは潜
在的なユーザの集合に対して利用できる情報の収集を行
いたいエンティティによって、その情報が一組のリンク
されたHTMLページの中に作り込まれるようにするこ
とができる。そのHTMLデータは1つまたはそれ以上
の取扱ノードに関連する記憶媒体の中にロードされるこ
とになる。無料の電話番号などの取扱ノードにアクセス
するための手段が確立される。通常、情報の集合の利用
可能性に関する情報(アクセスのための手段以外に)が
公開され、ユーザ又は潜在的なユーザに対して公示され
る。取扱ノードにアクセスする時、ユーザはHTMLの
データベースの「ホームページ」の中に現われるテキス
トが発音されることによって迎えられる。この場合、そ
のホームページの中のハイパーリンク語は通常のテキス
トの発音方法とは明確に異なる方法で発音される。次に
ユーザはさらに詳しい情報が求められる(そのハイパー
リンク語が発音された後、調整可能な時間のウィンドウ
の間に)ようなハイパーリンク語を聞いた後、そのハイ
パーリンク語を繰り返すことによって「バージ・イン(b
arge in)」する(入り込む)。そのハイパーリンク語の
「バージ・イン」の繰返しが、その取扱ノードに関連付
けられている音声認識装置によって認識され(その時間
ウィンドウの中の「アクティブ(active)」などの複数の
語から)、そしてその特定のハイパーリンク語の選択を
示している信号に変換され、サーバがそのハイパーリン
ク語に対してリンクされているHTMLポイントに対し
てハイパーリンクを生成するようにさせ、あるいは株の
売買などのトランザクションをトリガするため、あるい
はユーザの電話をそれ以降の会話のために別の電話にリ
ンクするようにさせる。
【0041】本発明の実施例が詳細に説明されてきた
が、追加の請求項によって定義されているような本発明
の精神および範囲から逸脱することなしに、各種の変更
および置き換えが可能であることを理解されたい。特
に、このシステムはユーザによって発音されたハイパー
リンク語を認識した時に、その語がそのユーザの選択の
確認としてユーザに対して繰り返して送り返されるよう
に変更することができる。「間違い(wrong) 」または
「停止(stop)」など、短時間の間のユーザの応答が存在
しない時に、このシステムはその語に対してリンクされ
るHTML層に対するハイパーリンクを実装するように
進行する。ここに記載されているシステムおよび方法を
追加の変更として、グラフィック・データを含んでいる
HTMLページ(それはもちろん、口頭では伝えること
ができない)は、そのような画像の存在を示すために
「画像がここにある(image here)」などのフレーズが発
音されるように構造化することができる。追加の機能と
して、このシステムはそのような画像に関心のあること
を示しているユーザに問合わせてそのユーザのFAX番
号を提供させるようにし、その問題の画像を含んでいる
ページのFAXによるコピーがそのユーザのFAX装置
に送信されるようにすることができる。さらに変更とし
て、そのデータの部分を音声の形式で記憶し、そしてそ
の音声データの提示がそのユーザに対して行われるよう
にし、HTMLクライアントに対してリアルタイムのデ
ジタル化されたオーディオ情報を提供するための、スト
リーム音声と呼ばれるよく知られているWWW技法によ
ってサービング・ノードに対する接続を設定する。
【0042】さらに、ユーザが本発明に従って音声化さ
れたHTMLホームページから下位の音声化された詳細
情報、あるいは関連付けられた層にナビゲートするプロ
セスは、例えば、自動化された呼出し案内システム付き
の対話型の音声応答(Interactive Voice Response:I
VR)システムの利点のすべてを提供するが、IVRの
メニュー構造を制限したり無効にしたりすることなしに
行われる。代わりに、そのナビゲーションのプロセスは
特定の内容の如何にかかわらず、ユーザがホームページ
から関心のある情報を表示する層に入り込む、ワールド
・ワイド・ウェブのテキストをベースとするナビゲーシ
ョンの配置と本質的に同じ方法で、首尾一貫して動作す
る。そして、よく知られているように、そのWWWのH
TMLシステムは高度に多様な情報アクセス媒体を提供
するだけでなく、実質的にユーザ・フレンドリーである
本質的に直感的なナビゲーション方式を備えていること
も示されている。従って、ユーザはこのインターフェー
スに対するモデルを一度学習するだけで済み、その後、
そのモデルを使っている別のデータベースとの対話が、
そのデータベースの内容とは無関係に、対応しているナ
ビゲーション方式を提供することが分かる。さらに、ハ
イパーリンク語にアクセスすることによって到達される
下に隠れているデータは、学習したモデルの場合と対応
している方法で行動する。
【0043】HTMLページに関心のある情報をオーサ
リングする際、認識システムの性能を高めるため、およ
び本発明の方法をユーザにとってより有用であるように
するために、そのハイパーリンクの語やフレーズは比較
的「コンパクト」(すなわち、普通は1つまたは2つの
語を含んでいる)であって数が少ないことが好ましい。
【図面の簡単な説明】
【図1】従来技術の情報アクセス・システムを示す図で
ある。
【図2】本発明の音声による情報アクセスを示す図であ
る。
【図3】図2に略図が示されている機能のいくつかの更
なる詳細を示す図である。
【図4】あらかじめ録音された音声または他の音声内容
として情報が提供される場合の本発明のシステムの一実
施例を示す図である。

Claims (60)

    【特許請求の範囲】
  1. 【請求項1】 音声の形式でユーザに対して提示される
    複数のハイパーリンクの中から1つのハイパーリンクの
    選択を容易にする方法であって、該方法は、 該複数のハイパーリンクと1以上の他の語の音声発声を
    表す第1の信号を該ユーザに提供する段階からなり、該
    信号は該ハイパーリンクの識別を含んでおり、該方法は
    さらに、 該ユーザによって発声された音声を表す第2の信号の音
    声認識を実行する段階とからなり、該音声認識が、少な
    くとも2つの該ハイパーリンクに対応するエントリーか
    らなる認識装置の語彙を使うことによって実行されるこ
    とを特徴とする方法。
  2. 【請求項2】 請求項1に記載の方法において、該信号
    を提供する段階は、テキストの集成に基づいて該第1の
    信号における該音声発声を合成する段階を含み、該集成
    が該複数のハイパーリンクを含むことを特徴とする方
    法。
  3. 【請求項3】 請求項2に記載の方法において、該テキ
    ストの集成がコンピュータ・ネットワーク・サーバによ
    って提供されるドキュメントのテキストからなることを
    特徴とする方法。
  4. 【請求項4】 請求項3に記載の方法において、該ドキ
    ュメントがHTMLページからなることを特徴とする方
    法。
  5. 【請求項5】 請求項1に記載の方法において、該第1
    の信号で表される該音声発声の少なくとも一部分があら
    かじめ録音された人間の声からなることを特徴とする方
    法。
  6. 【請求項6】 請求項1に記載の方法において、該ユー
    ザに提供されるハイパーリンクの該発声が、該他の語の
    該発声とは聴覚的に異なることを特徴とする方法。
  7. 【請求項7】 請求項1に記載の方法において、該第1
    および第2の信号が電話ネットワーク上で伝送され、そ
    して少なくとも該信号のルーティングの部分が認識され
    たハイパーリンクに基づくことを特徴とする方法。
  8. 【請求項8】 請求項1に記載の方法において、該ハイ
    パーリンクの該少なくとも2つが、該複数のハイパーリ
    ンクのすべてのハイパーリンクより少ないハイパーリン
    クを含むことを特徴とする方法。
  9. 【請求項9】 請求項1に記載の方法においてさらに、
    該ユーザに提供されるすべてのハイパーリンクのサブセ
    ットである該認識装置の語彙エントリーを選択する段階
    からなることを特徴とする方法。
  10. 【請求項10】 請求項1に記載の方法においてさら
    に、該複数のハイパーリンクのサブセットを規定する時
    間的なウィンドウに従って該ハイパーリンクの該少なく
    とも2つを選択する段階からなることを特徴とする方
    法。
  11. 【請求項11】 請求項10に記載の方法においてさら
    に、該音声認識を実行する段階は、該ウィンドウ内で特
    定のハイパーリンクの時間的な位置に基づいて該ハイパ
    ーリンクの該少なくとも2つの中からの結果としての認
    識として特定のハイパーリンクを選択する段階からなる
    ことを特徴とする方法。
  12. 【請求項12】 請求項1に記載の方法において、該音
    声認識のための該認識装置の語彙からなる該複数のハイ
    パーリンク・エントリーが、所定の時間間隔の間に該第
    1の信号の中に発生した該複数のハイパーリンクのサブ
    セットに限定されることを特徴とする方法。
  13. 【請求項13】 請求項12に記載の方法において、該
    認識装置の語彙からなる該ハイパーリンク・エントリー
    の各々が、該第2の信号の未知の音声発声を表す確立が
    同じであることを特徴とする方法。
  14. 【請求項14】 請求項12に記載の方法において、該
    認識装置の語彙からなる該ハイパーリンク・エントリー
    の任意の1つが、該所定の時間間隔における該任意のハ
    イパーリンクの時間的な位置に従って重み付けられてい
    る、該第2の信号の未知の音声発声を表す確立を有する
    ことを特徴とする方法。
  15. 【請求項15】 請求項1に記載の方法においてさら
    に、認識されたハイパーリンクに基づいて所定のアクシ
    ョンを実行させる段階からなることを特徴とする方法。
  16. 【請求項16】 請求項1に記載の方法においてさら
    に、認識されたハイパーリンクに基づいてトランザクシ
    ョンを初期化する段階からなることを特徴とする方法。
  17. 【請求項17】 請求項1に記載の方法においてさら
    に、認識されたハイパーリンクに基づいてトランザクシ
    ョンを実行する段階からなることを特徴とする方法。
  18. 【請求項18】 請求項2に記載の方法においてさら
    に、認識されたハイパーリンクに基づいてテキストの第
    2の集成を識別する段階からなることを特徴とする方
    法。
  19. 【請求項19】 請求項18に記載の方法において、該
    第2のテキストの集成がコンピュータ・ネットワーク・
    サーバ上にあるドキュメントのテキストを含むことを特
    徴とする方法。
  20. 【請求項20】 音声の形式でユーザに対して提示され
    る複数のハイパーリンクの中から1つのハイパーリンク
    の選択を容易にするシステムであって、該システムが、 該複数のハイパーリンクと1以上の他の語の音声発声を
    表す第1の信号を該ユーザに提供するインターフェース
    からなり、該信号は該ハイパーリンクの識別を含んでお
    り、該システムは更に、 該ユーザによって発声された音声を表す第2の信号の音
    声認識を実行する音声認識装置とからなり、該音声認識
    が、少なくとも2つの該ハイパーリンクに対応するエン
    トリーからなる認識装置の語彙を使うことによって実行
    されることを特徴とするシステム。
  21. 【請求項21】 請求項20に記載のシステムにおい
    て、該インターフェースは、テキストの集成に基づいて
    該第1の信号における該音声発声を合成するよう動作
    し、該集成は該複数のハイパーリンクを含むことを特徴
    とするシステム。
  22. 【請求項22】 請求項20に記載のシステムにおい
    て、該テキストの集成がコンピュータ・ネットワーク・
    サーバによって提供されるドキュメントのテキストから
    なることを特徴とするシステム。
  23. 【請求項23】 請求項20に記載のシステムにおい
    て、該第1の信号で表される該音声発声の少なくとも一
    部分があらかじめ録音された人間の声からなることを特
    徴とするシステム。
  24. 【請求項24】 請求項20に記載のシステムにおい
    て、該第1の信号の該ハイパーリンクの識別が、該他の
    語の該発声とは聴覚的に異なる形式で該ユーザに対して
    提供されるハイパーリンクの該発声を提供することによ
    って実行されることを特徴とするシステム。
  25. 【請求項25】 請求項20のシステムにおいて、該第
    1および第2の信号が通信ネットワーク上で伝送され、
    そして少なくとも該信号のルーチングの部分が認識され
    たハイパーリンクに基づくことを特徴とするシステム。
  26. 【請求項26】 請求項20に記載のシステムにおい
    て、該認識手段に対する語彙のエントリーが、該ユーザ
    に対して提供されたすべてのハイパーリンクのサブセッ
    トであるように選択されることを特徴とするシステム。
  27. 【請求項27】 請求項20に記載のシステムにおいて
    さらに、該複数のハイパーリンクのサブセットを規定す
    る時間的なウィンドウに従って該ハイパーリンクの該少
    なくとも2つを選択する手段を含むシステム。
  28. 【請求項28】 請求項27に記載のシステムにおい
    て、該音声認識装置は、該ウィンドウ内で特定のハイパ
    ーリンクの時間的な位置に基づいて該ハイパーリンクの
    該少なくとも2つの中からの結果としての認識として特
    定のハイパーリンクを選択することを特徴とするシステ
    ム。
  29. 【請求項29】 請求項20に記載のシステムにおい
    て、該音声認識装置に対する該音声認識装置の語彙から
    なる該ハイパーリンク・エントリーが、所定の時間間隔
    の間に該第1の信号の中に発生した該複数のハイパーリ
    ンクのサブセットに限定されることを特徴とするシステ
    ム。
  30. 【請求項30】 請求項29に記載のシステムにおい
    て、該認識装置の語彙からなる該ハイパーリンク・エン
    トリーの各々が、該第2の信号の未知の音声発声を表す
    確立が同じであることを特徴とするシステム。
  31. 【請求項31】 請求項29に記載のシステムにおい
    て、該認識装置の語彙からなる該ハイパーリンク・エン
    トリーの任意の1つが、該所定の時間間隔における該任
    意のハイパーリンクの時間的な位置に従って重み付けら
    れる、該第2の信号の未知の音声発声を表す確立を有す
    ることを特徴とするシステム。
  32. 【請求項32】 請求項20に記載のシステムにおい
    て、該認識されたハイパーリンクに基づいて所定のアク
    ションを実行させる手段を含むことを特徴とするシステ
    ム。
  33. 【請求項33】 請求項20に記載のシステムにおいて
    さらに、認識されたハイパーリンクに基づいてトランザ
    クションを初期化するトランザクション初期化装置から
    なることを特徴とするシステム。
  34. 【請求項34】 請求項20に記載のシステムにおいて
    さらに、認識されたハイパーリンクに基づいてトランザ
    クションを実行するトランザクション・プロセッサから
    なることを特徴とするシステム。
  35. 【請求項35】 請求項21に記載のシステムにおい
    て、認識されたハイパーリンクに基づいてテキストの第
    2の集成を識別する手段を含むことを特徴とするシステ
    ム。
  36. 【請求項36】 請求項35に記載のシステムにおい
    て、第2のテキストの集成がコンピュータ・ネットワー
    ク・サーバ上にあるドキュメントのテキストからなるこ
    とを特徴とするシステム。
  37. 【請求項37】 音声化された情報インターフェース・
    システムであって、該システムは、 1つ以上の対応する情報リンクを有するテキストを含む
    情報のデータベースと、 該データベースと関連して情報が音声化された形式で提
    供されるよう動作する手段と、 該提供された情報に関連するユーザによる音声応答を認
    識する手段と、 該認識されたユーザ応答に応動して、該情報リンクのう
    ちの少なくとも1つに関連する情報へシフトする手段と
    を含むシステム。
  38. 【請求項38】 請求項37に記載のシステムにおい
    て、該情報のデータベースが複数の情報層として配置さ
    れ、そして該情報層間のリンクが該情報リンクによって
    提供されることを特徴とするシステム。
  39. 【請求項39】 請求項38に記載のシステムにおい
    て、該情報リンクが、任意の情報層の識別された情報セ
    グメントとして提供されることを特徴とするシステム。
  40. 【請求項40】 請求項39に記載のシステムにおい
    て、該任意の情報層の中の該情報が複数のテキスト・語
    として提供されることを特徴とするシステム。
  41. 【請求項41】 請求項37に記載のシステムにおい
    て、該音声化された形式で情報が提供されるようにする
    手段が、他の音声化された情報とは聴覚的に異なる方法
    で、該情報リンクが提供されるようにする更なる手段を
    含むことを特徴とするシステム。
  42. 【請求項42】 請求項41に記載のシステムにおい
    て、該情報リンクが聴覚的に異なる方法で提供されるよ
    うにする該更なる手段が、該他の音声化された情報とは
    異なる反対の性の声によって該情報リンクが音声化され
    るように動作することを特徴とするシステム。
  43. 【請求項43】 請求項37に記載のシステムにおい
    て、ユーザによる該音声応答が、該システムによってあ
    らかじめ規定されたアクションに対する指令として構成
    されることを特徴とするシステム。
  44. 【請求項44】 請求項39に記載のシステムにおい
    て、ユーザによる該音声応答が、該任意の層の該識別さ
    れた情報セグメントの1つの繰返しとして構成されるこ
    とを特徴とするシステム。
  45. 【請求項45】 請求項37に記載のシステムにおい
    て、該ユーザに対する該音声応答の確認を提供する更な
    る手段を含むことを特徴とするシステム。
  46. 【請求項46】 請求項37に記載のシステムにおい
    て、該情報のデータベースにあるグラフィック情報をユ
    ーザに提供する更なる手段を含むことを特徴とするシス
    テム。
  47. 【請求項47】 請求項46に記載のシステムにおい
    て、該グラフィック情報が、グラフィック・アクセス・
    チャネル手段を経由して該ユーザに提供されることを特
    徴とするシステム。
  48. 【請求項48】 1つ以上の対応する情報リンクを有す
    るテキストを含む、格納された情報への音声化アクセス
    を提供する方法であって、該方法は、 該情報の少なくとも一部分が音声化された形式で提供さ
    れるようにする段階と、 該提供された情報に関連するユーザからの音声応答を認
    識する段階と、 該認識されたユーザ応答に応動して、該情報リンクのう
    ちの少なくとも1つに関連する情報へシフトする段階と
    からなることを特徴とする方法。
  49. 【請求項49】 請求項48に記載の方法において、該
    情報が複数の情報層として配置され、該情報層間のリン
    クが該情報リンクによって提供されることを特徴とする
    方法。
  50. 【請求項50】 請求項49に記載の方法において、該
    情報リンクが、任意の情報層の識別された情報セグメン
    トとして提供されることを特徴とする方法。
  51. 【請求項51】 請求項50に記載の方法において、該
    任意の情報層の中の該情報が複数のテキスト・語として
    提供されることを特徴とする方法。
  52. 【請求項52】 請求項48に記載の方法において、該
    音声化された形式で情報が提供されるようにする該段階
    が、他の音声化された情報とは聴覚的に異なる方法で、
    該情報リンクが提供されるようにする副段階を含むこと
    を特徴とする方法。
  53. 【請求項53】 請求項52に記載の方法において、該
    情報リンクが聴覚的に異なる方法で提供されるようにす
    る該サブ段階が、該他の音声化された情報とは異なる反
    対の性の声によって該情報リンクが音声化されるように
    することを特徴とする方法。
  54. 【請求項54】 請求項48に記載の方法において、ユ
    ーザによる該音声応答が所定のアクションに対する指令
    として構成されることを特徴とする方法。
  55. 【請求項55】 請求項50に記載の方法において、ユ
    ーザによる該音声応答が、該任意の層の該識別された情
    報セグメントの1つの繰返しとして構成されることを特
    徴とする方法。
  56. 【請求項56】 請求項48に記載の方法において、該
    ユーザに対する該音声応答の確認を提供する更なる段階
    を含むことを特徴とする方法。
  57. 【請求項57】 請求項48に記載の方法において、該
    格納された情報にあるグラフィック情報をユーザに提供
    する更なる段階を含むことを特徴とする方法。
  58. 【請求項58】 請求項57に記載の方法において、該
    グラフィック情報が、グラフィック・アクセス・チャネ
    ル手段を経由して該ユーザに提供されることを特徴とす
    る方法。
  59. 【請求項59】 情報の格納されたデータベースへのイ
    ンターフェースを提供するシステムであって、該システ
    ムは、 一組のリンクされた情報層として、音声の型式で格納さ
    れている該情報のデータベースを提供する手段と、 ユーザに該情報の特定の層を提供するよう動作する手段
    と、 該特定の層の情報に関連して該ユーザによる音声応答を
    認識する手段と、 該認識されたユーザ応答に基づいて該特定の層から1つ
    のリンクされた層へシフトするよう動作する手段とから
    なることを特徴とするシステム。
  60. 【請求項60】 情報の格納されたデータベースへイン
    ターフェースを提供するシステムであって、該システム
    は、 一組のリンクされた情報層として情報の該データベース
    を確立する手段からなり、そのような層間のリンクが特
    定の情報層のリンク語に関連しており、該システムは更
    に、 該格納された情報層と結合して動作し、任意の層の情報
    が音声化された形式で提供されるようにする手段からな
    り、該任意の層の該リンク・語が該任意の層の中他の情
    報とは聴覚的に異なる方法で提供されるものであり、該
    システムは更に、 該任意の層の該リンク・語の1つに関連するユーザから
    の音声応答を認識する手段と、 該認識された音声によるユーザ応答に基づいて任意の層
    から該リンク・語へリンクされた別の層へシフトするよ
    うに動作する手段とからなることを特徴とするシステ
    ム。
JP33388897A 1996-12-04 1997-12-04 ハイパーリンク化された情報との音声化されたインターフェースのためのシステムおよび方法 Expired - Lifetime JP3811280B2 (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/759,916 US6282511B1 (en) 1996-12-04 1996-12-04 Voiced interface with hyperlinked information
US08/759916 1996-12-04

Publications (2)

Publication Number Publication Date
JPH10207685A true JPH10207685A (ja) 1998-08-07
JP3811280B2 JP3811280B2 (ja) 2006-08-16

Family

ID=25057455

Family Applications (1)

Application Number Title Priority Date Filing Date
JP33388897A Expired - Lifetime JP3811280B2 (ja) 1996-12-04 1997-12-04 ハイパーリンク化された情報との音声化されたインターフェースのためのシステムおよび方法

Country Status (4)

Country Link
US (1) US6282511B1 (ja)
EP (1) EP0847179A3 (ja)
JP (1) JP3811280B2 (ja)
CA (1) CA2213591A1 (ja)

Cited By (15)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2000137596A (ja) * 1998-10-06 2000-05-16 Lucent Technol Inc 対話型音声応答システム
KR20010076633A (ko) * 2000-01-27 2001-08-16 최중인 부속 사전방식의 하이퍼 보이스 음성 명령 체계및 데이터처리 시스템
JP2001255885A (ja) * 2000-03-13 2001-09-21 Oki Electric Ind Co Ltd 音声ブラウザシステム
JP2001312296A (ja) * 2000-05-02 2001-11-09 Internatl Business Mach Corp <Ibm> 音声認識システム、音声認識方法およびコンピュータ可読な記録媒体
KR100329244B1 (ko) * 1998-12-16 2002-03-18 포만 제프리 엘 원격 웹 페이지 리더
JP2002091756A (ja) * 2000-06-15 2002-03-29 Internatl Business Mach Corp <Ibm> 多数の音響情報源を同時に提供するためのシステム及び方法
JP2002169750A (ja) * 2000-11-30 2002-06-14 Nec Corp ブラウザ搭載装置
JP2002525689A (ja) * 1998-09-22 2002-08-13 ノキア ネットワークス オサケ ユキチュア スピーチ認識システムを構成する方法及びシステム
JP2002527800A (ja) * 1998-10-02 2002-08-27 インターナショナル・ビジネス・マシーンズ・コーポレーション 会話ブラウザおよび会話システム
JP2002532018A (ja) * 1998-12-01 2002-09-24 ニュアンス・コミュニケーションズ 音声ウェブを形成しブラウズする方法及びそのシステム
JP2002342212A (ja) * 2001-04-27 2002-11-29 Internatl Business Mach Corp <Ibm> 情報アクセス方法、情報アクセスシステムおよびプログラム
JP2003044496A (ja) * 2001-07-26 2003-02-14 Nec Corp 情報サービス提供方法、装置及びプログラム
JP2003167598A (ja) * 2001-12-04 2003-06-13 Canon Inc 音声認識装置及びその方法、プログラム
JP2006172294A (ja) * 2004-12-17 2006-06-29 Nippon Telegr & Teleph Corp <Ntt> 音声ブラウザ装置、音声ブラウザ方法およびプログラム
JP2016501391A (ja) * 2012-12-20 2016-01-18 アマゾン テクノロジーズ インコーポレーテッド 発話対象の識別

Families Citing this family (181)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8209184B1 (en) * 1997-04-14 2012-06-26 At&T Intellectual Property Ii, L.P. System and method of providing generated speech via a network
US6760746B1 (en) 1999-09-01 2004-07-06 Eric Schneider Method, product, and apparatus for processing a data request
EP1062798A1 (en) * 1998-03-10 2000-12-27 Siemens Corporate Research, Inc. A system for browsing the world wide web with a traditional telephone
US6772139B1 (en) * 1998-10-05 2004-08-03 Smith, Iii Julius O. Method and apparatus for facilitating use of hypertext links on the world wide web
GB2342530A (en) * 1998-10-07 2000-04-12 Vocalis Ltd Gathering user inputs by speech recognition
AUPP713598A0 (en) * 1998-11-17 1998-12-10 Telstra R & D Management Pty Ltd A data access system and method
US6490550B1 (en) * 1998-11-30 2002-12-03 Ericsson Inc. System and method for IP-based communication transmitting speech and speech-generated text
US6523061B1 (en) * 1999-01-05 2003-02-18 Sri International, Inc. System, method, and article of manufacture for agent-based navigation in a speech-based data navigation system
SE9900652D0 (sv) 1999-02-24 1999-02-24 Pipebeach Ab A voice browser and a method at a voice browser
US6338082B1 (en) 1999-03-22 2002-01-08 Eric Schneider Method, product, and apparatus for requesting a network resource
USRE43690E1 (en) 1999-03-22 2012-09-25 Esdr Network Solutions Llc Search engine request method, product, and apparatus
US9141717B2 (en) 1999-03-22 2015-09-22 Esdr Network Solutions Llc Methods, systems, products, and devices for processing DNS friendly identifiers
US8037168B2 (en) 1999-07-15 2011-10-11 Esdr Network Solutions Llc Method, product, and apparatus for enhancing resolution services, registration services, and search services
US8667051B2 (en) * 1999-03-22 2014-03-04 Esdr Network Solutions Llc Real-time communication processing method, product, and apparatus
US7188138B1 (en) 1999-03-22 2007-03-06 Eric Schneider Method, product, and apparatus for resource identifier registration and aftermarket services
US20050261907A1 (en) 1999-04-12 2005-11-24 Ben Franklin Patent Holding Llc Voice integration platform
US20050091057A1 (en) * 1999-04-12 2005-04-28 General Magic, Inc. Voice application development methodology
US6408272B1 (en) * 1999-04-12 2002-06-18 General Magic, Inc. Distributed voice user interface
EP1145146A2 (en) * 1999-05-07 2001-10-17 Argo Interactive Limited Graphical data within documents
WO2001002997A1 (en) * 1999-07-02 2001-01-11 Koninklijke Philips Electronics N.V. User-profile driven mapping of speech onto urls
DE19940940A1 (de) * 1999-08-23 2001-03-08 Mannesmann Ag Talking Web
USRE44207E1 (en) 1999-09-01 2013-05-07 Esdr Network Solutions Llc Network resource access method, product, and apparatus
GB2354394B (en) * 1999-09-09 2003-11-26 Roke Manor Research Method and apparatus for communicating via the internet
AU7356100A (en) * 1999-09-10 2001-04-10 Everypath, Inc. Method for converting two-dimensional data into a canonical representation
CA2384618A1 (en) * 1999-09-10 2001-03-15 Rajeev Mohindra Method for customizing and rendering of selected data fields
US6557026B1 (en) * 1999-09-29 2003-04-29 Morphism, L.L.C. System and apparatus for dynamically generating audible notices from an information network
USRE42904E1 (en) * 1999-09-29 2011-11-08 Frederick Monocacy Llc System and apparatus for dynamically generating audible notices from an information network
JP4172886B2 (ja) * 1999-10-08 2008-10-29 富士通株式会社 疑似クライアント装置、疑似クライアントプログラムを格納したコンピュータ可読媒体、及び、チャットシステム
IES20000802A2 (en) * 1999-10-18 2001-04-18 Voxsurf Software Ltd Accessing databases via the internet
US6970915B1 (en) 1999-11-01 2005-11-29 Tellme Networks, Inc. Streaming content over a telephone interface
WO2001030046A2 (en) * 1999-10-22 2001-04-26 Tellme Networks, Inc. Streaming content over a telephone interface
US7376586B1 (en) 1999-10-22 2008-05-20 Microsoft Corporation Method and apparatus for electronic commerce using a telephone interface
US7941481B1 (en) 1999-10-22 2011-05-10 Tellme Networks, Inc. Updating an electronic phonebook over electronic communication networks
US6807574B1 (en) 1999-10-22 2004-10-19 Tellme Networks, Inc. Method and apparatus for content personalization over a telephone interface
EP1145226B1 (en) * 1999-11-09 2011-01-05 Nuance Communications Austria GmbH Speech recognition method for activating a hyperlink of an internet page
US7412643B1 (en) 1999-11-23 2008-08-12 International Business Machines Corporation Method and apparatus for linking representation and realization data
US6424945B1 (en) 1999-12-15 2002-07-23 Nokia Corporation Voice packet data network browsing for mobile terminals system and method using a dual-mode wireless connection
US6978127B1 (en) * 1999-12-16 2005-12-20 Koninklijke Philips Electronics N.V. Hand-ear user interface for hand-held device
CN1302030B (zh) * 1999-12-24 2010-04-21 纽昂斯通讯公司 词义消歧的机器翻译方法和系统
US6999448B1 (en) 2000-03-14 2006-02-14 Avaya Technology Corp. Internet protocol standards-based multi-media messaging
SG98374A1 (en) * 2000-03-14 2003-09-19 Egis Comp Systems Pte Ltd A client and method for controlling communications thereof
US8645137B2 (en) 2000-03-16 2014-02-04 Apple Inc. Fast, language-independent method for user authentication by voice
US7974875B1 (en) 2000-03-21 2011-07-05 Aol Inc. System and method for using voice over a telephone to access, process, and carry out transactions over the internet
EP1137242A1 (en) * 2000-03-24 2001-09-26 Alcatel Telecommunication system, terminal and network for vocal commanding
GB2361556A (en) * 2000-04-19 2001-10-24 Roundpoint Inc Text-to-speech browser
US6968380B1 (en) * 2000-05-30 2005-11-22 International Business Machines Corporation Method and system for increasing ease-of-use and bandwidth utilization in wireless devices
US6985933B1 (en) 2000-05-30 2006-01-10 International Business Machines Corporation Method and system for increasing ease-of-use and bandwidth utilization in wireless devices
FR2810125B1 (fr) * 2000-06-08 2004-04-30 Interactive Speech Technologie Systeme de commande vocale d'une page stockee sur un serveur et telechargeable en vue de sa visualisation sur un dispositif client
US7080315B1 (en) * 2000-06-28 2006-07-18 International Business Machines Corporation Method and apparatus for coupling a visual browser to a voice browser
US6868523B1 (en) * 2000-08-16 2005-03-15 Ncr Corporation Audio/visual method of browsing web pages with a conventional telephone interface
KR20020017373A (ko) * 2000-08-30 2002-03-07 정익주 엠에스에이치티엠엘 컴포넌트를 이용한 음성인식 브라우저구현 방법
US7240006B1 (en) * 2000-09-27 2007-07-03 International Business Machines Corporation Explicitly registering markup based on verbal commands and exploiting audio context
WO2002031811A1 (de) * 2000-10-10 2002-04-18 Siemens Aktiengesellschaft Akustische ausgabe vernetzter dokumente
US7792676B2 (en) * 2000-10-25 2010-09-07 Robert Glenn Klinefelter System, method, and apparatus for providing interpretive communication on a network
US6915262B2 (en) 2000-11-30 2005-07-05 Telesector Resources Group, Inc. Methods and apparatus for performing speech recognition and using speech recognition results
US8135589B1 (en) 2000-11-30 2012-03-13 Google Inc. Performing speech recognition over a network and using speech recognition results
US6823306B2 (en) 2000-11-30 2004-11-23 Telesector Resources Group, Inc. Methods and apparatus for generating, updating and distributing speech recognition models
GB0029800D0 (en) * 2000-12-07 2001-01-17 Hewlett Packard Co Sound links
GB0029799D0 (en) 2000-12-07 2001-01-17 Hewlett Packard Co Sound links
US7349867B2 (en) * 2000-12-22 2008-03-25 Invenda Corporation Tracking transactions by using addresses in a communications network
US7415429B2 (en) 2000-12-22 2008-08-19 Invenda Corporation Providing navigation objects for communications over a network
US7363248B2 (en) 2000-12-22 2008-04-22 Invenda Corporation Pre-filling order forms for transactions over a communications network
DE10064661A1 (de) * 2000-12-22 2002-07-11 Siemens Ag Kommunikationsanordnung und Verfahren für Kommunikationssysteme mit interaktiver Sprachfunktion
US7356530B2 (en) * 2001-01-10 2008-04-08 Looksmart, Ltd. Systems and methods of retrieving relevant information
BR0207508A (pt) * 2001-02-28 2004-03-02 Telecom Italia Spa Sistema e método para acesso a estruturas multimìdia
ITTO20010179A1 (it) 2001-02-28 2002-08-28 Cselt Centro Studi Lab Telecom Sistema e metodo per l'accesso a strutture multimediali.
US20020122053A1 (en) * 2001-03-01 2002-09-05 International Business Machines Corporation Method and apparatus for presenting non-displayed text in Web pages
US20020173333A1 (en) * 2001-05-18 2002-11-21 Buchholz Dale R. Method and apparatus for processing barge-in requests
US6941268B2 (en) * 2001-06-21 2005-09-06 Tellme Networks, Inc. Handling of speech recognition in a declarative markup language
US8238881B2 (en) 2001-08-07 2012-08-07 Waloomba Tech Ltd., L.L.C. System and method for providing multi-modal bookmarks
US8644475B1 (en) 2001-10-16 2014-02-04 Rockstar Consortium Us Lp Telephony usage derived presence information
GB2381409B (en) * 2001-10-27 2004-04-28 Hewlett Packard Ltd Asynchronous access to synchronous voice services
US20030135624A1 (en) * 2001-12-27 2003-07-17 Mckinnon Steve J. Dynamic presence management
US7565402B2 (en) * 2002-01-05 2009-07-21 Eric Schneider Sitemap access method, product, and apparatus
US9374451B2 (en) * 2002-02-04 2016-06-21 Nokia Technologies Oy System and method for multimodal short-cuts to digital services
FR2836249A1 (fr) * 2002-02-18 2003-08-22 Converge Online Procede de synchronisation des interactions multimodales dans la presentation d'un contenu multimodal sur un support multimodal
US7210098B2 (en) * 2002-02-18 2007-04-24 Kirusa, Inc. Technique for synchronizing visual and voice browsers to enable multi-modal browsing
US7058887B2 (en) * 2002-03-07 2006-06-06 International Business Machines Corporation Audio clutter reduction and content identification for web-based screen-readers
US7712020B2 (en) * 2002-03-22 2010-05-04 Khan Emdadur R Transmitting secondary portions of a webpage as a voice response signal in response to a lack of response by a user
US7873900B2 (en) * 2002-03-22 2011-01-18 Inet Spch Property Hldg., Limited Liability Company Ordering internet voice content according to content density and semantic matching
US8213917B2 (en) 2006-05-05 2012-07-03 Waloomba Tech Ltd., L.L.C. Reusable multimodal application
US8392609B2 (en) 2002-09-17 2013-03-05 Apple Inc. Proximity detection for media proxies
KR100872191B1 (ko) * 2002-09-27 2008-12-09 인터내셔널 비지네스 머신즈 코포레이션 발표 하이퍼링크 타임 테이블 생성 방법, 발표 처리 방법, 컴퓨팅 시스템 및 컴퓨터 판독가능한 기록 매체
US7461352B2 (en) * 2003-02-10 2008-12-02 Ronald Mark Katsuranis Voice activated system and methods to enable a computer user working in a first graphical application window to display and control on-screen help, internet, and other information content in a second graphical application window
NL1024398C2 (nl) * 2003-09-29 2005-03-31 Tno Werkwijze en middelen voor presentatie van een tekst met activeerbare tekstelementen.
KR20050040983A (ko) * 2003-10-29 2005-05-04 (주)텔리뷰 음성을 이용한 웹 브라우징 시스템 및 제어방법
DE602004006641T2 (de) * 2003-11-10 2008-01-24 Philips Intellectual Property & Standards Gmbh Audio-dialogsystem und sprachgesteuertes browsing-verfahren
US20050108754A1 (en) * 2003-11-19 2005-05-19 Serenade Systems Personalized content application
US9118574B1 (en) 2003-11-26 2015-08-25 RPX Clearinghouse, LLC Presence reporting using wireless messaging
WO2005089357A2 (en) * 2004-03-16 2005-09-29 Freedom Scientific, Inc. Multimodal xml delivery system and method
US7624016B2 (en) * 2004-07-23 2009-11-24 Microsoft Corporation Method and apparatus for robustly locating user barge-ins in voice-activated command systems
US7509260B2 (en) * 2004-09-20 2009-03-24 International Business Machines Corporation Systems and methods for inputting graphical data into a graphical input field
JP4743686B2 (ja) * 2005-01-19 2011-08-10 京セラ株式会社 携帯端末装置、およびその音声読み上げ方法、並びに音声読み上げプログラム
EP1693570B1 (en) * 2005-02-16 2008-07-16 National-Oilwell, L.P. Connector assembly, rod retention system and method
JP4574390B2 (ja) * 2005-02-22 2010-11-04 キヤノン株式会社 音声認識方法
US7321856B1 (en) 2005-08-03 2008-01-22 Microsoft Corporation Handling of speech recognition in a declarative markup language
US8977636B2 (en) 2005-08-19 2015-03-10 International Business Machines Corporation Synthesizing aggregate data of disparate data types into data of a uniform data type
US7958131B2 (en) * 2005-08-19 2011-06-07 International Business Machines Corporation Method for data management and data rendering for disparate data types
US8677377B2 (en) 2005-09-08 2014-03-18 Apple Inc. Method and apparatus for building an intelligent automated assistant
US20070061371A1 (en) * 2005-09-14 2007-03-15 Bodin William K Data customization for data of disparate data types
US20070061712A1 (en) * 2005-09-14 2007-03-15 Bodin William K Management and rendering of calendar data
US8266220B2 (en) * 2005-09-14 2012-09-11 International Business Machines Corporation Email management and rendering
US8694319B2 (en) 2005-11-03 2014-04-08 International Business Machines Corporation Dynamic prosody adjustment for voice-rendering synthesized data
US20070165538A1 (en) * 2006-01-13 2007-07-19 Bodin William K Schedule-based connectivity management
US8271107B2 (en) * 2006-01-13 2012-09-18 International Business Machines Corporation Controlling audio operation for data management and data rendering
US20070192673A1 (en) * 2006-02-13 2007-08-16 Bodin William K Annotating an audio file with an audio hyperlink
US9135339B2 (en) 2006-02-13 2015-09-15 International Business Machines Corporation Invoking an audio hyperlink
US20070192675A1 (en) * 2006-02-13 2007-08-16 Bodin William K Invoking an audio hyperlink embedded in a markup document
US20070249406A1 (en) * 2006-04-20 2007-10-25 Sony Ericsson Mobile Communications Ab Method and system for retrieving information
EP2059924A4 (en) * 2006-08-28 2010-08-25 Shaul Shalev SYSTEMS AND METHODS FOR AUDIO MARKING INFORMATION ELEMENTS FOR IDENTIFYING AND APPLYING LINKS TO INFORMATION, OR PROCESSES RELATING TO THE MARKED ELEMENTS
US9318108B2 (en) 2010-01-18 2016-04-19 Apple Inc. Intelligent automated assistant
US9196241B2 (en) 2006-09-29 2015-11-24 International Business Machines Corporation Asynchronous communications using messages recorded on handheld devices
US9318100B2 (en) 2007-01-03 2016-04-19 International Business Machines Corporation Supplementing audio recorded in a media file
US7844462B2 (en) * 2007-02-01 2010-11-30 Sap Ag Spatial sound generation for screen navigation
US8996376B2 (en) 2008-04-05 2015-03-31 Apple Inc. Intelligent text-to-speech conversion
US8943394B2 (en) * 2008-11-19 2015-01-27 Robert Bosch Gmbh System and method for interacting with live agents in an automated call center
US8359202B2 (en) * 2009-01-15 2013-01-22 K-Nfb Reading Technology, Inc. Character models for document narration
US9031216B1 (en) * 2009-03-05 2015-05-12 Google Inc. In-conversation search
US10241644B2 (en) 2011-06-03 2019-03-26 Apple Inc. Actionable reminder entries
US10241752B2 (en) 2011-09-30 2019-03-26 Apple Inc. Interface for a virtual digital assistant
US9431006B2 (en) 2009-07-02 2016-08-30 Apple Inc. Methods and apparatuses for automatic speech recognition
JP5697860B2 (ja) * 2009-09-09 2015-04-08 クラリオン株式会社 情報検索装置,情報検索方法及びナビゲーションシステム
US8996384B2 (en) * 2009-10-30 2015-03-31 Vocollect, Inc. Transforming components of a web page to voice prompts
US8682667B2 (en) 2010-02-25 2014-03-25 Apple Inc. User profiling for selecting user specific voice input processing information
US9262612B2 (en) 2011-03-21 2016-02-16 Apple Inc. Device access using voice authentication
US20120310642A1 (en) * 2011-06-03 2012-12-06 Apple Inc. Automatically creating a mapping between text data and audio data
US20130204413A1 (en) * 2012-02-07 2013-08-08 Apple Inc. Audio Hyperlinking
US9280610B2 (en) 2012-05-14 2016-03-08 Apple Inc. Crowd sourcing information to fulfill user requests
US9721563B2 (en) 2012-06-08 2017-08-01 Apple Inc. Name recognition system
US9495129B2 (en) * 2012-06-29 2016-11-15 Apple Inc. Device, method, and user interface for voice-activated navigation and browsing of a document
US9547647B2 (en) 2012-09-19 2017-01-17 Apple Inc. Voice-based media searching
US9691377B2 (en) 2013-07-23 2017-06-27 Google Technology Holdings LLC Method and device for voice recognition training
US9275638B2 (en) 2013-03-12 2016-03-01 Google Technology Holdings LLC Method and apparatus for training a voice recognition model database
WO2014197334A2 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for user-specified pronunciation of words for speech synthesis and recognition
WO2014197336A1 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for detecting errors in interactions with a voice-based digital assistant
US9582608B2 (en) 2013-06-07 2017-02-28 Apple Inc. Unified ranking with entropy-weighted information for phrase-based semantic auto-completion
WO2014197335A1 (en) 2013-06-08 2014-12-11 Apple Inc. Interpreting and acting upon commands that involve sharing information with remote devices
US10176167B2 (en) 2013-06-09 2019-01-08 Apple Inc. System and method for inferring user intent from speech inputs
EP3008641A1 (en) 2013-06-09 2016-04-20 Apple Inc. Device, method, and graphical user interface for enabling conversation persistence across two or more instances of a digital assistant
US9548047B2 (en) 2013-07-31 2017-01-17 Google Technology Holdings LLC Method and apparatus for evaluating trigger phrase enrollment
CN104123085B (zh) * 2014-01-14 2015-08-12 腾讯科技(深圳)有限公司 通过语音访问多媒体互动网站的方法和装置
US9430463B2 (en) 2014-05-30 2016-08-30 Apple Inc. Exemplar-based natural language processing
US9338493B2 (en) 2014-06-30 2016-05-10 Apple Inc. Intelligent automated assistant for TV user interactions
WO2016032021A1 (ko) * 2014-08-27 2016-03-03 삼성전자주식회사 음성 명령 인식을 위한 장치 및 방법
US9668121B2 (en) 2014-09-30 2017-05-30 Apple Inc. Social reminders
KR102232583B1 (ko) 2015-01-08 2021-03-26 삼성전자주식회사 전자장치 및 전자장치의 웹 재현 방법
US10567477B2 (en) 2015-03-08 2020-02-18 Apple Inc. Virtual assistant continuity
US9578173B2 (en) 2015-06-05 2017-02-21 Apple Inc. Virtual assistant aided communication with 3rd party service in a communication session
US10671428B2 (en) 2015-09-08 2020-06-02 Apple Inc. Distributed personal assistant
US10747498B2 (en) 2015-09-08 2020-08-18 Apple Inc. Zero latency digital assistant
US11010550B2 (en) 2015-09-29 2021-05-18 Apple Inc. Unified language modeling framework for word prediction, auto-completion and auto-correction
US10366158B2 (en) 2015-09-29 2019-07-30 Apple Inc. Efficient word encoding for recurrent neural network language models
US11587559B2 (en) 2015-09-30 2023-02-21 Apple Inc. Intelligent device identification
US10691473B2 (en) 2015-11-06 2020-06-23 Apple Inc. Intelligent automated assistant in a messaging environment
US10049668B2 (en) 2015-12-02 2018-08-14 Apple Inc. Applying neural network language models to weighted finite state transducers for automatic speech recognition
US10223066B2 (en) 2015-12-23 2019-03-05 Apple Inc. Proactive assistance based on dialog communication between devices
US10446143B2 (en) 2016-03-14 2019-10-15 Apple Inc. Identification of voice inputs providing credentials
US9934775B2 (en) 2016-05-26 2018-04-03 Apple Inc. Unit-selection text-to-speech synthesis based on predicted concatenation parameters
US9972304B2 (en) 2016-06-03 2018-05-15 Apple Inc. Privacy preserving distributed evaluation framework for embedded personalized systems
US10249300B2 (en) 2016-06-06 2019-04-02 Apple Inc. Intelligent list reading
US10049663B2 (en) 2016-06-08 2018-08-14 Apple, Inc. Intelligent automated assistant for media exploration
DK179588B1 (en) 2016-06-09 2019-02-22 Apple Inc. INTELLIGENT AUTOMATED ASSISTANT IN A HOME ENVIRONMENT
US10586535B2 (en) 2016-06-10 2020-03-10 Apple Inc. Intelligent digital assistant in a multi-tasking environment
US10067938B2 (en) 2016-06-10 2018-09-04 Apple Inc. Multilingual word prediction
US10490187B2 (en) 2016-06-10 2019-11-26 Apple Inc. Digital assistant providing automated status report
US10509862B2 (en) 2016-06-10 2019-12-17 Apple Inc. Dynamic phrase expansion of language input
US10192552B2 (en) 2016-06-10 2019-01-29 Apple Inc. Digital assistant providing whispered speech
DK179343B1 (en) 2016-06-11 2018-05-14 Apple Inc Intelligent task discovery
DK201670540A1 (en) 2016-06-11 2018-01-08 Apple Inc Application integration with a digital assistant
DK179049B1 (en) 2016-06-11 2017-09-18 Apple Inc Data driven natural language event detection and classification
DK179415B1 (en) 2016-06-11 2018-06-14 Apple Inc Intelligent device arbitration and control
US10043516B2 (en) 2016-09-23 2018-08-07 Apple Inc. Intelligent automated assistant
US10593346B2 (en) 2016-12-22 2020-03-17 Apple Inc. Rank-reduced token representation for automatic speech recognition
DK201770439A1 (en) 2017-05-11 2018-12-13 Apple Inc. Offline personal assistant
DK179496B1 (en) 2017-05-12 2019-01-15 Apple Inc. USER-SPECIFIC Acoustic Models
DK179745B1 (en) 2017-05-12 2019-05-01 Apple Inc. SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT
DK201770431A1 (en) 2017-05-15 2018-12-20 Apple Inc. Optimizing dialogue policy decisions for digital assistants using implicit feedback
DK201770432A1 (en) 2017-05-15 2018-12-21 Apple Inc. Hierarchical belief states for digital assistants
DK179549B1 (en) 2017-05-16 2019-02-12 Apple Inc. FAR-FIELD EXTENSION FOR DIGITAL ASSISTANT SERVICES
US11443646B2 (en) 2017-12-22 2022-09-13 Fathom Technologies, LLC E-Reader interface system with audio and highlighting synchronization for digital books
US10671251B2 (en) 2017-12-22 2020-06-02 Arbordale Publishing, LLC Interactive eReader interface generation based on synchronization of textual and audial descriptors

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4726065A (en) * 1984-01-26 1988-02-16 Horst Froessl Image manipulation by speech signals
US5333237A (en) * 1989-10-10 1994-07-26 Hughes Aircraft Company Hypermedia structured knowledge base system
US5781913A (en) * 1991-07-18 1998-07-14 Felsenstein; Lee Wearable hypermedium system
AU2868092A (en) * 1991-09-30 1993-05-03 Riverrun Technology Method and apparatus for managing information
DE69424019T2 (de) * 1993-11-24 2000-09-14 Canon Information Systems, Inc. System zur Sprachlichen Wiedergabe von Hypertextdokumenten, wie Hilfsdateien
DE4440598C1 (de) * 1994-11-14 1996-05-23 Siemens Ag Durch gesprochene Worte steuerbares Hypertext-Navigationssystem, Hypertext-Dokument für dieses Navigationssystem und Verfahren zur Erzeugung eines derartigen Dokuments
US5774628A (en) * 1995-04-10 1998-06-30 Texas Instruments Incorporated Speaker-independent dynamic vocabulary and grammar in speech recognition
GB9523759D0 (en) 1995-11-21 1996-01-24 Pollitt Alexander J World wide web information retrieval system

Cited By (16)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2002525689A (ja) * 1998-09-22 2002-08-13 ノキア ネットワークス オサケ ユキチュア スピーチ認識システムを構成する方法及びシステム
JP2003525477A (ja) * 1998-10-02 2003-08-26 インターナショナル・ビジネス・マシーンズ・コーポレーション 汎用階層オブジェクトを介する効率的なボイス・ナビゲーションのための構造スケルトン
JP2002527800A (ja) * 1998-10-02 2002-08-27 インターナショナル・ビジネス・マシーンズ・コーポレーション 会話ブラウザおよび会話システム
JP2000137596A (ja) * 1998-10-06 2000-05-16 Lucent Technol Inc 対話型音声応答システム
JP2002532018A (ja) * 1998-12-01 2002-09-24 ニュアンス・コミュニケーションズ 音声ウェブを形成しブラウズする方法及びそのシステム
KR100329244B1 (ko) * 1998-12-16 2002-03-18 포만 제프리 엘 원격 웹 페이지 리더
KR20010076633A (ko) * 2000-01-27 2001-08-16 최중인 부속 사전방식의 하이퍼 보이스 음성 명령 체계및 데이터처리 시스템
JP2001255885A (ja) * 2000-03-13 2001-09-21 Oki Electric Ind Co Ltd 音声ブラウザシステム
JP2001312296A (ja) * 2000-05-02 2001-11-09 Internatl Business Mach Corp <Ibm> 音声認識システム、音声認識方法およびコンピュータ可読な記録媒体
JP2002091756A (ja) * 2000-06-15 2002-03-29 Internatl Business Mach Corp <Ibm> 多数の音響情報源を同時に提供するためのシステム及び方法
JP2002169750A (ja) * 2000-11-30 2002-06-14 Nec Corp ブラウザ搭載装置
JP2002342212A (ja) * 2001-04-27 2002-11-29 Internatl Business Mach Corp <Ibm> 情報アクセス方法、情報アクセスシステムおよびプログラム
JP2003044496A (ja) * 2001-07-26 2003-02-14 Nec Corp 情報サービス提供方法、装置及びプログラム
JP2003167598A (ja) * 2001-12-04 2003-06-13 Canon Inc 音声認識装置及びその方法、プログラム
JP2006172294A (ja) * 2004-12-17 2006-06-29 Nippon Telegr & Teleph Corp <Ntt> 音声ブラウザ装置、音声ブラウザ方法およびプログラム
JP2016501391A (ja) * 2012-12-20 2016-01-18 アマゾン テクノロジーズ インコーポレーテッド 発話対象の識別

Also Published As

Publication number Publication date
US6282511B1 (en) 2001-08-28
EP0847179A2 (en) 1998-06-10
CA2213591A1 (en) 1998-06-04
EP0847179A3 (en) 2000-05-31
JP3811280B2 (ja) 2006-08-16
MX9709035A (es) 1998-06-28

Similar Documents

Publication Publication Date Title
JP3811280B2 (ja) ハイパーリンク化された情報との音声化されたインターフェースのためのシステムおよび方法
CA2280331C (en) Web-based platform for interactive voice response (ivr)
US9495956B2 (en) Dealing with switch latency in speech recognition
US8909532B2 (en) Supporting multi-lingual user interaction with a multimodal application
US6430531B1 (en) Bilateral speech system
EP2824596B1 (en) Speech- Enabled Web Content Searching Using a Multimodal Browser
JP6588637B2 (ja) 個別化されたエンティティ発音の学習
US9626959B2 (en) System and method of supporting adaptive misrecognition in conversational speech
US6532444B1 (en) Network interactive user interface using speech recognition and natural language processing
US8073692B2 (en) Enabling speech recognition grammars in web page frames
TWI353585B (en) Computer-implemented method,apparatus, and compute
US6832196B2 (en) Speech driven data selection in a voice-enabled program
US8886540B2 (en) Using speech recognition results based on an unstructured language model in a mobile communication facility application
US8725513B2 (en) Providing expressive user interaction with a multimodal application
US9349367B2 (en) Records disambiguation in a multimodal application operating on a multimodal device
US20090326953A1 (en) Method of accessing cultural resources or digital contents, such as text, video, audio and web pages by voice recognition with any type of programmable device without the use of the hands or any physical apparatus.
US20020143535A1 (en) Method of providing concise forms of natural commands
US20030144846A1 (en) Method and system for modifying the behavior of an application based upon the application&#39;s grammar
US20060143007A1 (en) User interaction with voice information services
JPH08335160A (ja) ビデオスクリーン表示を音声対話型にするシステム
US20020087328A1 (en) Automatic dynamic speech recognition vocabulary based on external sources of information
CN1264468A (zh) 给用户提供声音反馈的可扩展语音识别系统
EP2126902A2 (en) Speech recognition of speech recorded by a mobile communication facility
MXPA97009035A (en) System and method for the sound interface with information hiperenlaz
JP2003345372A (ja) 音声合成装置及び音声合成方法

Legal Events

Date Code Title Description
A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20041101

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20050627

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20051205

A601 Written request for extension of time

Free format text: JAPANESE INTERMEDIATE CODE: A601

Effective date: 20060303

A602 Written permission of extension of time

Free format text: JAPANESE INTERMEDIATE CODE: A602

Effective date: 20060308

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20060327

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20060418

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20060502

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20060526

R150 Certificate of patent or registration of utility model

Free format text: JAPANESE INTERMEDIATE CODE: R150

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090602

Year of fee payment: 3

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100602

Year of fee payment: 4

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100602

Year of fee payment: 4

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20110602

Year of fee payment: 5

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20120602

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20120602

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20130602

Year of fee payment: 7

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

S111 Request for change of ownership or part of ownership

Free format text: JAPANESE INTERMEDIATE CODE: R313113

S111 Request for change of ownership or part of ownership

Free format text: JAPANESE INTERMEDIATE CODE: R313113

R350 Written notification of registration of transfer

Free format text: JAPANESE INTERMEDIATE CODE: R350

R360 Written notification for declining of transfer of rights

Free format text: JAPANESE INTERMEDIATE CODE: R360

S111 Request for change of ownership or part of ownership

Free format text: JAPANESE INTERMEDIATE CODE: R313113

R370 Written measure of declining of transfer procedure

Free format text: JAPANESE INTERMEDIATE CODE: R370

EXPY Cancellation because of completion of term
R350 Written notification of registration of transfer

Free format text: JAPANESE INTERMEDIATE CODE: R350