JP2012137777A - 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 - Google Patents
出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 Download PDFInfo
- Publication number
- JP2012137777A JP2012137777A JP2012060252A JP2012060252A JP2012137777A JP 2012137777 A JP2012137777 A JP 2012137777A JP 2012060252 A JP2012060252 A JP 2012060252A JP 2012060252 A JP2012060252 A JP 2012060252A JP 2012137777 A JP2012137777 A JP 2012137777A
- Authority
- JP
- Japan
- Prior art keywords
- audio signal
- signal
- input
- output audio
- subscriber unit
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 230000005236 sound signal Effects 0.000 title claims abstract description 332
- 238000000034 method Methods 0.000 title claims abstract description 110
- 238000012545 processing Methods 0.000 title claims abstract description 55
- 238000004891 communication Methods 0.000 claims abstract description 45
- 230000004044 response Effects 0.000 abstract description 33
- 230000006870 function Effects 0.000 description 32
- 230000015572 biosynthetic process Effects 0.000 description 30
- 238000003786 synthesis reaction Methods 0.000 description 30
- 230000005540 biological transmission Effects 0.000 description 20
- 230000011664 signaling Effects 0.000 description 17
- 239000013598 vector Substances 0.000 description 13
- 230000001413 cellular effect Effects 0.000 description 10
- 230000008569 process Effects 0.000 description 9
- 238000013461 design Methods 0.000 description 7
- 238000010586 diagram Methods 0.000 description 5
- 239000005441 aurora Substances 0.000 description 4
- 230000002457 bidirectional effect Effects 0.000 description 4
- 238000001514 detection method Methods 0.000 description 4
- 238000005516 engineering process Methods 0.000 description 3
- 230000007613 environmental effect Effects 0.000 description 3
- 230000001755 vocal effect Effects 0.000 description 3
- 238000004458 analytical method Methods 0.000 description 2
- 230000003466 anti-cipated effect Effects 0.000 description 2
- 238000013459 approach Methods 0.000 description 2
- 238000003491 array Methods 0.000 description 2
- 238000010420 art technique Methods 0.000 description 2
- 230000008901 benefit Effects 0.000 description 2
- 230000000694 effects Effects 0.000 description 2
- 230000015654 memory Effects 0.000 description 2
- 230000002194 synthesizing effect Effects 0.000 description 2
- 206010028980 Neoplasm Diseases 0.000 description 1
- 230000005534 acoustic noise Effects 0.000 description 1
- 239000008186 active pharmaceutical agent Substances 0.000 description 1
- 201000011510 cancer Diseases 0.000 description 1
- 238000006243 chemical reaction Methods 0.000 description 1
- 239000002131 composite material Substances 0.000 description 1
- 230000008878 coupling Effects 0.000 description 1
- 238000010168 coupling process Methods 0.000 description 1
- 238000005859 coupling reaction Methods 0.000 description 1
- 238000013500 data storage Methods 0.000 description 1
- 238000000354 decomposition reaction Methods 0.000 description 1
- 230000001934 delay Effects 0.000 description 1
- 230000001419 dependent effect Effects 0.000 description 1
- 238000011161 development Methods 0.000 description 1
- 230000007717 exclusion Effects 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
- 230000014509 gene expression Effects 0.000 description 1
- 238000010348 incorporation Methods 0.000 description 1
- 238000002347 injection Methods 0.000 description 1
- 239000007924 injection Substances 0.000 description 1
- 238000012423 maintenance Methods 0.000 description 1
- 239000003550 marker Substances 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 238000013468 resource allocation Methods 0.000 description 1
- 238000005070 sampling Methods 0.000 description 1
- 230000001629 suppression Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 230000000007 visual effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/28—Constructional details of speech recognition systems
- G10L15/30—Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/487—Arrangements for providing information services, e.g. recorded voice services or time announcements
- H04M3/493—Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2201/00—Electronic components, circuits, software, systems or apparatus used in telephone systems
- H04M2201/40—Electronic components, circuits, software, systems or apparatus used in telephone systems using speech recognition
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2201/00—Electronic components, circuits, software, systems or apparatus used in telephone systems
- H04M2201/60—Medium conversion
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2207/00—Type of exchange or network, i.e. telephonic medium, in which the telephonic communication takes place
- H04M2207/18—Type of exchange or network, i.e. telephonic medium, in which the telephonic communication takes place wireless networks
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/002—Applications of echo suppressors or cancellers in telephonic connections
Landscapes
- Engineering & Computer Science (AREA)
- Signal Processing (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Quality & Reliability (AREA)
- Telephonic Communication Services (AREA)
- Mobile Radio Communication Systems (AREA)
Abstract
入力音声信号の開始は、決定される(701)際の出力オーディオ信号に対する、出力オーディオ信号と入力開始時間との生成の間に検出される。入力開始時間は、次に、入力音声信号に応答するのに使用されるために提供される(704)。入力音声信号が、出力オーディオ信号が生ずる間に検出されるとき、出力オーディオ信号の識別は、入力音声信号に応答するのに使用されるために提供される。データおよび/または制御信号を備えている情報の信号(705)は、少なくとも提供されるコンテキスト上の情報、すなわち、入力開始時間および/または出力オーディオ信号の識別に応じて提供される。本発明は、基礎をなす通信システムの遅延特性にかかわらず、出力オーディオ信号に対する入力音声信号のコンテキストを精密に確立する。
【選択図】図7
Description
本発明は、一般に、音声認識を組み込んでいる通信システムに関し、特に、出力オーディオ信号が生ずる間の入力音声信号を“バージイン”(barge-in)処理する方法および装置に関する。
音声認識システムは、特に電話システムに関して一般的に公知の技術である。米国特許4,914,692、5,475,791、5,708,704と、また5,765,130は、音声認識システムを組み込んだ電話網を例示している。各システムの共通する特徴は、音声認識エレメント(即ち、音声認識を実施するデバイス)は、加入者の通信デバイス(即ち、ユーザーの電話)とは逆に、一般的に、電話網の構成の中心に位置されている。典型的には、音声の合成と音声認識エレメントとの組み合せは、電話網あるいはインフラストラクチャ内で展開されている。呼者は、そのシステムにアクセスし、音声合成エレメントを介して、合成された音声の形での情報のプロンプトあるいはクエリーの提供を受けることができる。呼者は、一般的に、合成された音声に対して口頭による応答を行い、音声認識エレメントは、呼者にさらなるサービスを提供するために、呼者の口頭による応答を処理する。
本発明は、例えば、以下を提供する。
(項目1) 入力音声信号の開始を検出するステップと、
出力オーディオ信号に対して、入力音声信号の開始の入力開始時間を決定するステップと、
入力音声信号に応答するのに使用される入力開始時間を提供するステップとを備える、出力オーディオ信号が生ずる間に入力音声信号を処理する方法。
(項目2) 入力開始時間が、出力オーディオ信号の一時的なコンテキストに対するタイムスタンプ、出力オーディオ信号のサンプルコンテキストに対するサンプルインデックス、および出力オーディオ信号のフレームコンテキストに対するフレームインデックスのいずれか1つを備える、項目1に記載の方法。
(項目3) 項目1に記載のステップを行うコンピュータ実行可能命令を有するコンピュータ読出し可能媒体。
(項目4) 入力音声信号を検出するステップと、
出力オーディオ信号に対応する識別を決定するステップと、
入力音声信号に応答するのに使用される識別を提供するステップとを備える、
出力オーディオ信号が生ずる間に入力音声信号を処理する方法。
(項目5) 項目4に記載のステップを行うコンピュータ実行可能命令を有するコンピュータ読出し可能媒体。
(項目6) 音声認識サーバを備えるインフラストラクチャとの無線通信における加入者ユニットにおいて、加入者ユニットがスピーカおよびマイクロフォンを備え、スピーカが出力オーディオ信号を提供し、マイクロフォンが入力音声信号を提供し、入力音声信号を処理する方法であって、
出力音声信号が生ずる間に入力音声信号の開始を検出するステップと、
出力オーディオ信号に対して、入力音声信号の開始の入力開始時間を決定するステップと、
制御パラメータとして音声認識サーバに上記入力開始時間を提供するステップとを備える、入力音声信号を処理する方法。
(項目7) 少なくとも一部の入力開始時間に基づき、音声認識サーバから少なくとも1つの情報信号を受信するステップをさらに備える、項目6に記載の方法。
(項目8) オンセットマーカを決定するステップが、
出力オーディオ信号の開始より遅く、かつその後の出力オーディオ信号の開始よりも早い入力開始時間を決定するステップをさらに備える、項目6に記載の方法。
(項目9) 入力開始時間が、出力オーディオ信号の一時的なコンテキストに対するタイムスタンプ、出力オーディオ信号のサンプルコンテキストに対するサンプルインデックス、および出力オーディオ信号のフレームコンテキストに対するフレームインデックスのいずれか1つである、項目6に記載の方法。
(項目10) 出力オーディオ信号が、インフラストラクチャにより提供された音声信号を備える、項目6に記載の方法。
(項目11) 出力オーディオ信号が、インフラストラクチャにより提供された制御シグナリングに応答して加入者ユニットにより合成された音声信号を備える、項目6に記載の方法。
(項目12) パラメータで表示された音声信号を提供するために入力音声信号を分析するステップと、
パラメータで表示された音声信号を音声認識サーバに提供するステップと、
少なくとも一部の入力開始時間およびパラメータで表示された音声信号に基づき音声認識サーバから少なくとも1つの情報信号を受信するステップとをさらに備える、項目6に記載の方法。
(項目13) 音声認識サーバを備えるインフラストラクチャとの無線通信における加入者ユニットにおいて、加入者ユニットがスピーカおよびマイクロフォンを備え、スピーカが出力オーディオ信号を提供し、マイクロフォンが入力音声信号を提供し、入力音声信号を処理する方法であって、
出力オーディオ信号が生ずる間に入力音声信号を検出するステップと、
出力オーディオ信号に対応する識別を決定するステップと、
制御パラメータとして音声認識サーバに識別を提供するステップとを備える、
入力音声信号を処理する方法。
(項目14) 少なくとも一部の識別に基づき、音声認識サーバから少なくとも1つの情報信号を受信するステップをさらに備える、項目13に記載の方法。
(項目15) 出力オーディオ信号が、インフラストラクチャにより提供された音声信号を備える、項目13に記載の方法。
(項目16) 出力オーディオ信号が、インフラストラクチャにより提供された制御シグナリングに応答して加入者ユニットにより合成された音声信号を備える、項目13に記載の方法。
(項目17) パラメータで表示された音声信号を提供するために入力音声信号を分析するステップと、
パラメータで表示された音声信号を音声認識サーバに提供するステップと、
少なくとも一部の識別およびパラメータで表示された音声信号に基づき、音声認識サーバから少なくとも1つの情報信号を受信するステップとをさらに備える、項目13に記載の方法。
(項目18) 1つ以上の加入者ユニットと無線通信するインフラストラクチャの一部を形成する音声認識サーバにおいて、1つ以上の加入者ユニットの加入者ユニットに情報信号を提供する方法であって、
加入者ユニットで出力オーディオ信号を生じさせるステップと、
加入者ユニットにおける出力オーディオ信号に対する入力音声信号の開始に対応する少なくとも入力開始時間を加入者ユニットから受信するステップと、
少なくとも一部の開始時間に応答して、加入者ユニットに情報信号を提供するステップとを備える、1つ以上の加入者ユニットの加入者ユニットに情報信号を提供する方法。
(項目19) 入力開始時間が、出力オーディオ信号の一時的なコンテキストに対するタイムスタンプ、出力オーディオ信号のサンプルコンテキストに対するサンプルインデックス、および出力オーディオ信号のフレームコンテキストに対するフレームインデックスのいずれか1つである、項目18に記載の方法。
(項目20) 出力オーディオ信号を生じさせるステップが、
加入者ユニットに音声信号を提供するステップをさらに備える、項目18に記載の方法。
(項目21) 情報信号を提供するステップが、
加入者ユニットに情報信号を向けるステップをさらに備え、情報信号が、上記加入者ユニットの動作を制御する、項目18に記載の方法。
(項目22) 上記加入者ユニットが、少なくとも1つの装置に結合され、情報信号を提供するステップが、
少なくとも1つの装置に情報を向けるステップをさらに備え、情報信号が、少なくとも1つの装置の動作を制御する、項目18に記載の方法。
(項目23) 出力オーディオ信号を生じさせるステップが、
加入者ユニットに制御シグナリングを提供するステップをさらに備え、制御シグナリングが、加入者ユニットに出力オーディオ信号として音声信号を合成させる、項目18に記載の方法。
(項目24) 入力音声信号に対応するパラメータで表示された音声信号を受信するステップと、
少なくとも一部の開始時間およびパラメータで表示された音声信号に応答して、加入者ユニットに情報信号を提供するステップとをさらに備える、項目18に記載の方法。
(項目25) 1つ以上の加入者ユニットと無線通信するインフラストラクチャの一部を形成する音声認識サーバにおいて、1つ以上の加入者ユニットの加入者ユニットに情報信号を提供する方法であって、
加入者ユニットで出力オーディオ信号を生じさせるステップであって、出力オーディオ信号が対応する識別を有する、加入者ユニットで出力オーディオ信号を生じさせるステップと、
出力オーディオ信号が生ずる間に入力音声信号が加入者ユニットで検出されると、加入者ユニットから少なくとも識別を受信するステップと、
少なくとも一部の識別に応答して、加入者ユニットに情報信号を提供するステップとを備える、1つ以上の加入者ユニットの加入者ユニットに情報信号を提供する方法。
(項目26) 出力オーディオ信号を生じさせるステップが、
加入者ユニットに音声信号を提供するステップを備える、項目25に記載の方法。
(項目27) 情報信号を提供するステップが、
加入者ユニットに情報信号を向けるステップをさらに備え、情報信号が、加入者ユニットの動作を制御する、項目25に記載の方法。
(項目28) 加入者ユニットが、少なくとも1つの装置に結合され、情報信号を提供するステップが、
少なくとも1つの装置に情報を向けるステップをさらに備え、情報信号が、少なくとも1つの装置の動作を制御する、項目25に記載の方法。
(項目29) 出力オーディオ信号を生じさせるステップが、
加入者ユニットに制御シグナリングを提供するステップをさらに備え、制御シグナリングが、加入者ユニットに出力オーディオ信号として音声信号を合成させる、項目25に記載の方法。
(項目30) 入力音声信号に対応するパラメータで表示された音声信号を受信するステップと、
少なくとも一部の識別およびパラメータで表示された音声信号に応答して、加入者ユニットに情報信号を提供するステップとをさらに備える、項目25に記載の方法。
(項目31) 音声認識サーバを備えるインフラストラクチャと無線通信する加入者ユニットであって、加入者ユニットがスピーカおよびマイクロフォンを備え、スピーカが出力オーディオ信号を提供し、マイクロフォンが入力音声信号を提供し、加入者ユニットが、
入力音声信号の開始を検出する手段と、
出力オーディオ信号に対して、入力音声信号の開始の入力開始時間を決定する手段と、
制御パラメータとして音声認識サーバに入力開始時間を提供する手段とを備える、加入者ユニット。
(項目32) 少なくとも一部の入力開始時間に基づき、音声認識サーバから少なくとも1つの情報信号を受信する手段をさらに備える、項目31に記載の加入者ユニット。
(項目33) パラメータで表示された音声信号を提供するために入力音声信号を分析する手段をさらに備え、
提供する手段が、さらに、パラメータで表示された音声信号を音声認識サーバに提供するよう機能し、受信する手段が、さらに、少なくとも一部の入力開始時間およびパラメータで表示された音声信号に基づき音声認識サーバから少なくとも1つの制御信号を受信するよう機能する、項目32に記載の加入者ユニット。
(項目34) 入力開始時間を決定する手段が、出力オーディオ信号の開始より遅く、かつその後の出力オーディオ信号の開始よりも早い入力開始時間を決定するよう機能する、項目31に記載の加入者ユニット。
(項目35) 入力開始時間が、出力オーディオ信号の一時的なコンテキストに対するタイムスタンプ、出力オーディオ信号のサンプルコンテキストに対するサンプルインデックス、および出力オーディオ信号のフレームコンテキストに対するフレームインデックスのいずれか1つである、項目31に記載の加入者ユニット。
(項目36) インフラストラクチャから出力オーディオ信号として提供される音声信号を受信する手段をさらに備える、項目31に記載の加入者ユニット。
(項目37) インフラストラクチャから出力オーディオ信号に関する制御シグナリングを受信する手段と、
制御シグナリングに応答して出力オーディオ信号として音声信号を合成する手段とをさらに備える、項目31に記載の加入者ユニット。
(項目38) 音声認識サーバを備えるインフラストラクチャと無線通信する加入者ユニットであって、加入者ユニットがスピーカおよびマイクロフォンとを備え、スピーカが出力オーディオ信号を提供し、マイクロフォンが入力音声信号を提供し、
出力オーディオ信号が生ずる間に入力音声信号を検出する手段と、
出力オーディオ信号に対応する識別を決定するする手段と、
制御パラメータとして音声認識サーバに識別を提供する手段とをさらに備える、加入者ユニット。
(項目39) 少なくとも一部の識別に基づき、音声認識サーバから少なくとも1つの制御信号を受信する手段をさらに備える、項目38に記載の加入者ユニット。
(項目40) パラメータで表示された音声信号を提供するために入力音声信号を分析する手段をさらに備え、
提供する手段が、さらに、パラメータで表示された音声信号を音声認識サーバに提供するよう機能し、受信する手段が、さらに、少なくとも一部の識別およびパラメータで表示された音声信号とに基づき音声認識サーバから少なくとも1つの制御信号を受信するよう機能する、項目39に記載の加入者ユニット。
(項目41) インフラストラクチャから出力オーディオ信号として提供される音声信号を受信する手段をさらに備える、項目38に記載の加入者ユニット。
(項目42) インフラストラクチャから出力オーディオ信号に関する制御シグナリングを受信する手段と、
制御シグナリングに応答して出力オーディオ信号として音声信号を合成する手段とをさらに備える、項目38に記載の加入者ユニット。
(項目43) 1つ以上の加入者ユニットと無線通信するインフラストラクチャの一部を形成する音声認識サーバであって、
1つ以上の加入者ユニットの加入者ユニットで出力オーディオ信号を生じさせる手段と、
加入者ユニットにおける出力オーディオ信号に対する入力音声信号の開始に対応する少なくとも入力開始時間を加入者ユニットから受信する手段と、
少なくとも一部の入力開始時間に応答して加入者ユニットに情報信号を提供する手段とを備える、音声認識サーバ。
(項目44) 入力開始時間が、出力オーディオ信号の一時的なコンテキストに対するタイムスタンプ、出力オーディオ信号のサンプルコンテキストに対するサンプルインデックス、および出力オーディオ信号のフレームコンテキストに対するフレームインデックスのいずれか1つである、項目43に記載の音声認識サーバ。
(項目45) 情報信号を提供する手段が、
加入者ユニットに情報信号を向けるよう機能し、情報信号が、加入者ユニットの動作を制御する、項目43に記載の音声認識サーバ。
(項目46) 加入者ユニットが、少なくとも1つの装置に結合され、情報信号を提供する手段が、さらに、少なくとも1つの装置に情報を向けるよう機能し、情報信号が、少なくとも1つの装置の動作を制御する、項目43に記載の方法。
(項目47) 出力オーディオ信号を生じさせる手段が、さらに、出力オーディオ信号として提供される音声信号を提供するよう機能する、項目43に記載の音声認識サーバ。
(項目48) 出力オーディオ信号を生じさせる手段が、さらに、加入者ユニットに制御シグナリングを提供するよう機能し、制御シグナリングが、加入者ユニットに出力オーディオ信号として音声信号を合成させる、項目43に記載の音声認識サーバ。
(項目49) 受信する手段が、さらに、入力音声信号に対応するパラメータで表示された音声信号を受信するよう機能し、提供する手段が、さらに、少なくとも一部の入力開始時間およびパラメータで表示された音声信号に応答して加入者ユニットに情報信号を提供するよう機能する、項目43に記載の音声認識サーバ。
(項目50) 1つ以上の加入者ユニットと無線通信するインフラストラクチャの一部を形成する音声認識サーバであって、
1つ以上の加入者ユニットの加入者ユニットで出力オーディオ信号を生じさせる手段であって、出力オーディオ信号が対応する識別を有する、1つ以上の加入者ユニットの加入者ユニットで出力オーディオ信号を生じさせる手段と、
入力音声信号が、出力オーディオ信号が生ずる間に加入者ユニットにおいて検出されると、加入者ユニットから少なくとも識別を受信する手段と、
少なくとも一部の識別に応答して、加入者ユニットに情報信号を提供する手段とをさらに備える、音声認識サーバ。
(項目51) 出力オーディオ信号を生じさせる手段が、さらに、出力オーディオ信号として提供される音声信号を提供するよう機能する、項目50に記載の音声認識サーバ。
(項目52) 出力オーディオ信号を生じさせる手段が、さらに、加入者ユニットに制御シグナリングを提供するよう機能し、制御シグナリングが、加入者ユニットに出力オーディオ信号として音声信号を合成させる、項目50に記載の音声認識サーバ。
(項目53) 受信する手段が、さらに、入力音声信号に対応するパラメータで表示された音声信号を受信するよう機能し、提供する手段が、さらに、少なくとも一部の入力開始時間およびパラメータで表示された音声信号に応答して加入者ユニットに情報信号を提供するよう機能する、項目50に記載の音声認識サーバ。
(項目54) 情報信号を提供する手段が、さらに、加入者ユニットに情報信号を向けるよう機能し、情報信号が、加入者ユニットの動作を制御する、項目50に記載の音声認識サーバ。
(項目55) 加入者ユニットが、少なくとも1つの装置に結合され、情報信号を提供する手段が、さらに、少なくとも1つの装置に情報を向けるよう機能し、情報信号が、少なくとも1つの装置の動作を制御する、項目50に記載の方法。
本発明は、図1乃至図9を参照すると、いっそう完全に記述されることができる。図1は、加入者ユニット102−103を備える無線通信システム100の全体のシステムアーキテクチャを示している。その加入者ユニット102−103は、無線システム110によってサポートされる無線チャンネルを媒介としてインフラストラクチャと通信する。本発明のインフラストラクチャは、無線システム110に加えて、小さなエンティティシステム120、コンテンツプロバイダシステム130およびデータ網150いずれかを媒介として互いに結合される企業システム140を備えている。
そして、パラメトリック表現を、次に、第1のオーディオパス316を媒介としてECEPブロック301に引き渡される音声信号に変換する。使用される特定のパラメトリック表現は、設計選択の考慮すべき問題である。1つの一般に使用されているパラメトリック表現は、Klattの“Software For A Cascade/Parallel Formant Synthesizer”,Journal of the Acoustical society of America,Vol.67,1980,pp.971−995に記述されるように、フォルマントパラメータである。線形予測パラメータは、MarkelらのLinear Prediction of Speech,Springer Verlag,New York,1976に記述されるように、別の一般に使用されるパラメトリック表現である。KlattおよびMarkelらの公報のそれぞれの教示は、参照としてここに含まれている。
加入者ユニットからの音声認識パラメータベクトルを受け、そして、認識処理を完了する。認識されたワード、あるいは、発話507は、次に、ローカル制御プロセッサ508に受け渡される。パラメータベクトルを認識された発話に変換するのに必要な処理の記述は、Leeらの“自動音声認識:The Development of theSphinx System”,1988に見られることが可能であり、その公報の教示は、参照としてここに含まれている。上記に述べられるように、加入者ユニットからパラメータベクトルを受信するのではなく、サーバ(すなわち、音声認識分析器504)は、パラメータで表示されない音声情報を受信することができることも分かる。もう一度、音声情報は、上記に記述されるようにいくつかの形状のいずれかをとる。この場合、音声認識分析器504は、第一に、たとえば、mel cepstra技術を使用して、音声情報をパラメータで表示する。結果として生ずるパラメータベクトルは、次に、上記に記述されるように、認識された発話に変換されることができる。
図6に関して上記に述べられるように、その識別は、出力オーディオ信号から独立するか、あるいは、出力オーディオ信号に組み込まれることができるかである。最も重要なことは、出力オーディオ信号識別は、出力オーディオ信号とすべての他の出力オーディオ信号とを独特に区別する必要がある。合成されたプロンプトなどの場合、これは、各そのような合成されたプロンプトに独特のコードを割り当てることによって、達成されることが可能である。リアルタイム音声の場合、インフラストラクチャ利用タイム特質などの反復性のないコードが使用されることができる。識別が表わされる方法にかかわらず、それは、加入者ユニットによって確かめ得る必要がある。
Claims (19)
- 無線通信加入者ユニットにおいて、入力音声信号を処理する方法であって、前記無線通信加入者ユニットは、スピーカとマイクロフォンとを含み、前記スピーカは、出力オーディオ信号を提供し、前記マイクロフォンは、入力音声信号を提供し、
前記方法は、
前記出力オーディオ信号を提示する間に前記入力音声信号の開始を検出することと、
前記出力オーディオ信号に対して、前記入力音声信号の開始の入力開始時間を決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記入力開始時間を制御パラメータとして音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記入力開始時間および前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから少なくとも1つの情報信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの情報信号に基づいて動作することと
を含む、方法。 - 前記入力開始時間を決定することというステップは、
前記出力オーディオ信号の開始より遅く、かつ、その後の出力オーディオ信号の開始よりも早く、前記入力開始時間を決定することをさらに含む、請求項1に記載の方法。 - 前記入力開始時間は、前記出力オーディオ信号のリアルタイム参照に対するタイムスタンプと、前記出力オーディオ信号が複数のオーディオサンプルとして再構成および/または符号化された場合には、前記出力オーディオ信号の開始サンプルに対するサンプルインデックスと、前記出力オーディオ信号のフレームコンテキストに対するフレームインデックスとのうちのいずれか1つである、請求項1に記載の方法。
- 無線通信加入者ユニットにおいて、入力音声信号を処理する方法であって、前記無線通信加入者ユニットは、スピーカとマイクロフォンとを含み、前記スピーカは、出力オーディオ信号を提供し、前記マイクロフォンは、入力音声信号を提供し、
前記方法は、
前記出力オーディオ信号を提示する間に前記入力音声信号を検出することと、
前記出力オーディオ信号を識別する識別データを決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記識別データを制御パラメータとして音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記識別データおよび前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから少なくとも1つの情報信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの情報信号に基づいて動作することと
を含む、方法。 - 前記出力オーディオ信号は、出力音声信号を含む、請求項4に記載の方法。
- 1つ以上の加入者ユニットと無線通信する音声認識サーバから情報信号を提供する方法であって、
前記方法は、
前記加入者ユニットにおいて、出力オーディオ信号を提示させることと、
前記加入者ユニットにおける前記出力オーディオ信号に対する入力音声信号の開始に対応する入力開始時間を前記加入者ユニットから少なくとも受信することと、
前記入力音声信号に対応するパラメータで表示された音声信号を受信することと、
前記入力開始時間および前記パラメータで表示された音声信号に少なくとも基づいて、前記情報信号を生成することと、
前記情報信号を前記加入者ユニットに提供することと
を含み、前記情報信号は、前記入力音声信号に応答するように、前記加入者ユニットの動作を制御する、方法。 - 前記入力開始時間は、前記出力オーディオ信号のリアルタイム参照に対するタイムスタンプと、前記出力オーディオ信号が複数のオーディオサンプルとして再構成および/または符号化された場合には、前記出力オーディオ信号の開始サンプルに対するサンプルインデックスと、前記出力オーディオ信号のフレームに対するフレームインデックスとのうちのいずれか1つである、請求項6に記載の方法。
- 前記出力オーディオ信号を提示させることは、
前記加入者ユニットに音声信号を提供することをさらに含む、請求項6に記載の方法。 - 1つ以上の加入者ユニットと無線通信する音声認識サーバから情報信号を提供する方法であって、
前記方法は、
前記加入者ユニットにおいて出力オーディオ信号を提示させることであって、前記出力オーディオ信号は、識別データによって識別される、ことと、
前記出力オーディオ信号を提示する間に入力音声信号が前記加入者ユニットにおいて検出された場合には、前記加入者ユニットから少なくとも前記識別データを受信することと、
前記入力音声信号に対応するパラメータで表示された音声信号を受信することと、
前記識別データおよび前記パラメータで表示された音声信号に少なくとも基づいて、前記情報信号を生成することと、
前記情報信号を前記加入者ユニットに提供することと
を含み、前記情報信号は、前記入力音声信号に応答するように、前記加入者ユニットの動作を制御する、方法。 - 前記出力オーディオ信号を提示させることは、
前記加入者ユニットに音声信号を提供することをさらに含む、請求項9に記載の方法。 - 音声認識サーバを含む無線通信システムと無線通信する加入者ユニットであって、前記加入者ユニットは、
出力オーディオ信号を提供するように構成されたスピーカと、
入力音声信号を提供するように構成されたマイクロフォンと、
無線トランシーバと、
プロセッサと
を含み、
前記プロセッサは、前記無線トランシーバと協働することにより、
前記入力音声信号の開始を検出することと、
前記出力オーディオ信号に対して、前記入力音声信号の開始の入力開始時間を決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記入力開始時間を前記音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記入力開始時間および前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから、少なくとも1つの制御信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの制御信号に基づいて動作することと
を行うように構成されている、加入者ユニット。 - 前記プロセッサは、前記出力オーディオ信号の開始より遅く、かつ、その後の出力オーディオ信号の開始よりも早く、前記入力開始時間を決定するように構成されている、請求項11に記載の加入者ユニット。
- 前記入力開始時間は、前記出力オーディオ信号のリアルタイム参照に対するタイムスタンプと、前記出力オーディオ信号が複数のオーディオサンプルとして再構成および/または符号化された場合には、前記出力オーディオ信号の開始サンプルに対するサンプルインデックスと、前記出力オーディオ信号のフレームコンテキストに対するフレームインデックスとのうちのいずれか1つである、請求項11に記載の加入者ユニット。
- 音声認識サーバを含む無線通信システムと無線通信する加入者ユニットであって、前記加入者ユニットは、
出力オーディオ信号を提供するように構成されたスピーカと、
入力音声信号を提供するように構成されたマイクロフォンと、
無線トランシーバと、
プロセッサと
を含み、
前記プロセッサは、前記無線トランシーバと協働することにより、
前記入力音声信号の開始を検出することと、
前記出力オーディオ信号を識別する識別データを決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記識別データを前記音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記識別データおよび前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから少なくとも1つの制御信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの制御信号に基づいて動作することと
を行うように構成されている、加入者ユニット。 - 前記出力オーディオ信号は、出力音声信号を含む、請求項14に記載の加入者ユニット。
- 1つ以上の加入者ユニットと無線通信する無線通信システムの音声認識サーバであって、
前記音声認識サーバは、プロセッサを含み、
前記プロセッサは、
入力音声信号の開始を検出することと、
出力オーディオ信号に対して、前記入力音声信号の開始の入力開始時間を決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記入力開始時間を前記音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記入力開始時間および前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから少なくとも1つの制御信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの制御信号に基づいて動作することと
を行うように構成されている、音声認識サーバ。 - 前記入力開始時間は、前記出力オーディオ信号のリアルタイム参照に対するタイムスタンプと、前記出力オーディオ信号が複数のオーディオサンプルとして再構成および/または符号化された場合には、前記出力オーディオ信号の開始サンプルに対するサンプルインデックスと、前記出力オーディオ信号のフレームコンテキストに対するフレームインデックスとのうちのいずれか1つである、請求項16に記載の音声認識サーバ。
- 1つ以上の加入者ユニットと無線通信する無線通信システムの音声認識サーバであって、
前記音声認識サーバは、プロセッサを含み、
前記プロセッサは、
入力音声信号の開始を検出することと、
出力音声信号を識別する識別データを決定することと、
前記入力音声信号を分析することにより、パラメータで表示された音声信号を提供することと、
前記識別データを前記音声認識サーバに提供することと、
前記パラメータで表示された音声信号を前記音声認識サーバに提供することと、
前記識別データおよび前記パラメータで表示された音声信号に少なくとも基づいて、前記音声認識サーバから少なくとも1つの制御信号を受信することと、
前記入力音声信号に応答するように、前記少なくとも1つの制御信号に基づいて動作することと
を行うように構成されている、音声認識サーバ。 - 前記出力オーディオ信号は、出力音声信号を含む、請求項18に記載の音声認識サーバ。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US09/412,202 | 1999-10-05 | ||
| US09/412,202 US6937977B2 (en) | 1999-10-05 | 1999-10-05 | Method and apparatus for processing an input speech signal during presentation of an output audio signal |
Related Parent Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2001528975A Division JP2003511884A (ja) | 1999-10-05 | 2000-10-04 | 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JP2012137777A true JP2012137777A (ja) | 2012-07-19 |
| JP5306503B2 JP5306503B2 (ja) | 2013-10-02 |
Family
ID=23632018
Family Applications (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2001528975A Withdrawn JP2003511884A (ja) | 1999-10-05 | 2000-10-04 | 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 |
| JP2012060252A Expired - Lifetime JP5306503B2 (ja) | 1999-10-05 | 2012-03-16 | 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 |
Family Applications Before (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2001528975A Withdrawn JP2003511884A (ja) | 1999-10-05 | 2000-10-04 | 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US6937977B2 (ja) |
| JP (2) | JP2003511884A (ja) |
| KR (1) | KR100759473B1 (ja) |
| CN (1) | CN1188834C (ja) |
| AU (1) | AU7852700A (ja) |
| WO (1) | WO2001026096A1 (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2014191030A (ja) * | 2013-03-26 | 2014-10-06 | Fuji Soft Inc | 音声認識端末およびコンピュータ端末を用いる音声認識方法 |
Families Citing this family (133)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20010054622A (ko) * | 1999-12-07 | 2001-07-02 | 서평원 | 음성 인식 시스템의 음성 인식률 향상 방법 |
| EP1117191A1 (en) * | 2000-01-13 | 2001-07-18 | Telefonaktiebolaget Lm Ericsson | Echo cancelling method |
| US7233903B2 (en) * | 2001-03-26 | 2007-06-19 | International Business Machines Corporation | Systems and methods for marking and later identifying barcoded items using speech |
| US7336602B2 (en) * | 2002-01-29 | 2008-02-26 | Intel Corporation | Apparatus and method for wireless/wired communications interface |
| US7369532B2 (en) * | 2002-02-26 | 2008-05-06 | Intel Corporation | Apparatus and method for an audio channel switching wireless device |
| US7254708B2 (en) * | 2002-03-05 | 2007-08-07 | Intel Corporation | Apparatus and method for wireless device set-up and authentication using audio authentication—information |
| US6904364B2 (en) * | 2002-04-02 | 2005-06-07 | William S. Randazzo | Navcell pier to pier GPS |
| JP2003295890A (ja) * | 2002-04-04 | 2003-10-15 | Nec Corp | 音声認識対話選択装置、音声認識対話システム、音声認識対話選択方法、プログラム |
| US7398209B2 (en) | 2002-06-03 | 2008-07-08 | Voicebox Technologies, Inc. | Systems and methods for responding to natural language speech utterance |
| US7224981B2 (en) * | 2002-06-20 | 2007-05-29 | Intel Corporation | Speech recognition of mobile devices |
| US7693720B2 (en) * | 2002-07-15 | 2010-04-06 | Voicebox Technologies, Inc. | Mobile systems and methods for responding to natural language speech utterance |
| US20050137877A1 (en) * | 2003-12-17 | 2005-06-23 | General Motors Corporation | Method and system for enabling a device function of a vehicle |
| US20050193092A1 (en) * | 2003-12-19 | 2005-09-01 | General Motors Corporation | Method and system for controlling an in-vehicle CD player |
| US20050134504A1 (en) * | 2003-12-22 | 2005-06-23 | Lear Corporation | Vehicle appliance having hands-free telephone, global positioning system, and satellite communications modules combined in a common architecture for providing complete telematics functions |
| US7801283B2 (en) * | 2003-12-22 | 2010-09-21 | Lear Corporation | Method of operating vehicular, hands-free telephone system |
| US7050834B2 (en) * | 2003-12-30 | 2006-05-23 | Lear Corporation | Vehicular, hands-free telephone system |
| US7197278B2 (en) | 2004-01-30 | 2007-03-27 | Lear Corporation | Method and system for communicating information between a vehicular hands-free telephone system and an external device using a garage door opener as a communications gateway |
| US7778604B2 (en) * | 2004-01-30 | 2010-08-17 | Lear Corporation | Garage door opener communications gateway module for enabling communications among vehicles, house devices, and telecommunications networks |
| US20050186992A1 (en) * | 2004-02-20 | 2005-08-25 | Slawomir Skret | Method and apparatus to allow two way radio users to access voice enabled applications |
| JP2005250584A (ja) * | 2004-03-01 | 2005-09-15 | Sharp Corp | 入力装置 |
| FR2871978B1 (fr) * | 2004-06-16 | 2006-09-22 | Alcatel Sa | Procede de traitement de signaux sonores pour un terminal de communication et terminal de communication mettant en oeuvre ce procede |
| TWM260059U (en) * | 2004-07-08 | 2005-03-21 | Blueexpert Technology Corp | Computer input device having bluetooth handsfree handset |
| EP1667106B1 (en) * | 2004-12-06 | 2009-11-25 | Sony Deutschland GmbH | Method for generating an audio signature |
| US8706501B2 (en) * | 2004-12-09 | 2014-04-22 | Nuance Communications, Inc. | Method and system for sharing speech processing resources over a communication network |
| US20060258336A1 (en) * | 2004-12-14 | 2006-11-16 | Michael Sajor | Apparatus an method to store and forward voicemail and messages in a two way radio |
| US9104650B2 (en) * | 2005-07-11 | 2015-08-11 | Brooks Automation, Inc. | Intelligent condition monitoring and fault diagnostic system for preventative maintenance |
| US7640160B2 (en) | 2005-08-05 | 2009-12-29 | Voicebox Technologies, Inc. | Systems and methods for responding to natural language speech utterance |
| US7620549B2 (en) | 2005-08-10 | 2009-11-17 | Voicebox Technologies, Inc. | System and method of supporting adaptive misrecognition in conversational speech |
| US7949529B2 (en) | 2005-08-29 | 2011-05-24 | Voicebox Technologies, Inc. | Mobile systems and methods of supporting natural language human-machine interactions |
| EP1934971A4 (en) | 2005-08-31 | 2010-10-27 | Voicebox Technologies Inc | DYNAMIC LANGUAGE SCRIPTURE |
| US7876996B1 (en) | 2005-12-15 | 2011-01-25 | Nvidia Corporation | Method and system for time-shifting video |
| US8738382B1 (en) * | 2005-12-16 | 2014-05-27 | Nvidia Corporation | Audio feedback time shift filter system and method |
| US20080086311A1 (en) * | 2006-04-11 | 2008-04-10 | Conwell William Y | Speech Recognition, and Related Systems |
| US8249238B2 (en) * | 2006-09-21 | 2012-08-21 | Siemens Enterprise Communications, Inc. | Dynamic key exchange for call forking scenarios |
| US8073681B2 (en) | 2006-10-16 | 2011-12-06 | Voicebox Technologies, Inc. | System and method for a cooperative conversational voice user interface |
| US9135797B2 (en) | 2006-12-28 | 2015-09-15 | International Business Machines Corporation | Audio detection using distributed mobile computing |
| US7818176B2 (en) | 2007-02-06 | 2010-10-19 | Voicebox Technologies, Inc. | System and method for selecting and presenting advertisements based on natural language processing of voice-based input |
| WO2008132533A1 (en) * | 2007-04-26 | 2008-11-06 | Nokia Corporation | Text-to-speech conversion method, apparatus and system |
| US7987090B2 (en) * | 2007-08-09 | 2011-07-26 | Honda Motor Co., Ltd. | Sound-source separation system |
| US8140335B2 (en) | 2007-12-11 | 2012-03-20 | Voicebox Technologies, Inc. | System and method for providing a natural language voice user interface in an integrated voice navigation services environment |
| US8589161B2 (en) | 2008-05-27 | 2013-11-19 | Voicebox Technologies, Inc. | System and method for an integrated, multi-modal, multi-device natural language voice services environment |
| US9305548B2 (en) | 2008-05-27 | 2016-04-05 | Voicebox Technologies Corporation | System and method for an integrated, multi-modal, multi-device natural language voice services environment |
| US8326637B2 (en) | 2009-02-20 | 2012-12-04 | Voicebox Technologies, Inc. | System and method for processing multi-modal device interactions in a natural language voice services environment |
| CN102668519B (zh) * | 2009-10-09 | 2015-07-08 | 松下电器产业株式会社 | 车载装置 |
| US9171541B2 (en) | 2009-11-10 | 2015-10-27 | Voicebox Technologies Corporation | System and method for hybrid processing in a natural language voice services environment |
| US9502025B2 (en) | 2009-11-10 | 2016-11-22 | Voicebox Technologies Corporation | System and method for providing a natural language content dedication service |
| JP5156043B2 (ja) * | 2010-03-26 | 2013-03-06 | 株式会社東芝 | 音声判別装置 |
| US9704486B2 (en) * | 2012-12-11 | 2017-07-11 | Amazon Technologies, Inc. | Speech recognition power management |
| US8977555B2 (en) | 2012-12-20 | 2015-03-10 | Amazon Technologies, Inc. | Identification of utterance subjects |
| US9818407B1 (en) * | 2013-02-07 | 2017-11-14 | Amazon Technologies, Inc. | Distributed endpointing for speech recognition |
| US9277354B2 (en) * | 2013-10-30 | 2016-03-01 | Sprint Communications Company L.P. | Systems, methods, and software for receiving commands within a mobile communications application |
| WO2016032021A1 (ko) * | 2014-08-27 | 2016-03-03 | 삼성전자주식회사 | 음성 명령 인식을 위한 장치 및 방법 |
| EP4478276A3 (en) | 2014-09-16 | 2025-01-22 | VB Assets, LLC | Voice commerce |
| US9898459B2 (en) | 2014-09-16 | 2018-02-20 | Voicebox Technologies Corporation | Integration of domain information into state transitions of a finite state transducer for natural language processing |
| CN107003999B (zh) | 2014-10-15 | 2020-08-21 | 声钰科技 | 对用户的在先自然语言输入的后续响应的系统和方法 |
| US10614799B2 (en) | 2014-11-26 | 2020-04-07 | Voicebox Technologies Corporation | System and method of providing intent predictions for an utterance prior to a system detection of an end of the utterance |
| US10431214B2 (en) | 2014-11-26 | 2019-10-01 | Voicebox Technologies Corporation | System and method of determining a domain and/or an action related to a natural language input |
| US9552816B2 (en) | 2014-12-19 | 2017-01-24 | Amazon Technologies, Inc. | Application focus in speech-based systems |
| US9912977B2 (en) * | 2016-02-04 | 2018-03-06 | The Directv Group, Inc. | Method and system for controlling a user receiving device using voice commands |
| US9965247B2 (en) | 2016-02-22 | 2018-05-08 | Sonos, Inc. | Voice controlled media playback system based on user profile |
| US9772817B2 (en) | 2016-02-22 | 2017-09-26 | Sonos, Inc. | Room-corrected voice detection |
| US10264030B2 (en) | 2016-02-22 | 2019-04-16 | Sonos, Inc. | Networked microphone device control |
| US9811314B2 (en) | 2016-02-22 | 2017-11-07 | Sonos, Inc. | Metadata exchange involving a networked playback system and a networked microphone system |
| US10095470B2 (en) | 2016-02-22 | 2018-10-09 | Sonos, Inc. | Audio response playback |
| US9947316B2 (en) | 2016-02-22 | 2018-04-17 | Sonos, Inc. | Voice control of a media playback system |
| US9978390B2 (en) | 2016-06-09 | 2018-05-22 | Sonos, Inc. | Dynamic player selection for audio signal processing |
| US10152969B2 (en) | 2016-07-15 | 2018-12-11 | Sonos, Inc. | Voice detection by multiple devices |
| US10134399B2 (en) | 2016-07-15 | 2018-11-20 | Sonos, Inc. | Contextualization of voice inputs |
| US10331784B2 (en) | 2016-07-29 | 2019-06-25 | Voicebox Technologies Corporation | System and method of disambiguating natural language processing requests |
| US10115400B2 (en) | 2016-08-05 | 2018-10-30 | Sonos, Inc. | Multiple voice services |
| US10580404B2 (en) * | 2016-09-01 | 2020-03-03 | Amazon Technologies, Inc. | Indicator for voice-based communications |
| US10453449B2 (en) * | 2016-09-01 | 2019-10-22 | Amazon Technologies, Inc. | Indicator for voice-based communications |
| US9942678B1 (en) | 2016-09-27 | 2018-04-10 | Sonos, Inc. | Audio playback settings for voice interaction |
| US9743204B1 (en) | 2016-09-30 | 2017-08-22 | Sonos, Inc. | Multi-orientation playback device microphones |
| US10181323B2 (en) | 2016-10-19 | 2019-01-15 | Sonos, Inc. | Arbitration-based voice recognition |
| US11183181B2 (en) | 2017-03-27 | 2021-11-23 | Sonos, Inc. | Systems and methods of multiple voice services |
| KR102371313B1 (ko) * | 2017-05-29 | 2022-03-08 | 삼성전자주식회사 | 사용자 발화를 처리하는 전자 장치 및 그 전자 장치의 제어 방법 |
| US10475449B2 (en) | 2017-08-07 | 2019-11-12 | Sonos, Inc. | Wake-word detection suppression |
| US10048930B1 (en) | 2017-09-08 | 2018-08-14 | Sonos, Inc. | Dynamic computation of system response volume |
| US10515637B1 (en) | 2017-09-19 | 2019-12-24 | Amazon Technologies, Inc. | Dynamic speech processing |
| US10446165B2 (en) | 2017-09-27 | 2019-10-15 | Sonos, Inc. | Robust short-time fourier transform acoustic echo cancellation during audio playback |
| US10482868B2 (en) | 2017-09-28 | 2019-11-19 | Sonos, Inc. | Multi-channel acoustic echo cancellation |
| US10051366B1 (en) | 2017-09-28 | 2018-08-14 | Sonos, Inc. | Three-dimensional beam forming with a microphone array |
| US10621981B2 (en) | 2017-09-28 | 2020-04-14 | Sonos, Inc. | Tone interference cancellation |
| US10466962B2 (en) | 2017-09-29 | 2019-11-05 | Sonos, Inc. | Media playback system with voice assistance |
| US10880650B2 (en) | 2017-12-10 | 2020-12-29 | Sonos, Inc. | Network microphone devices with automatic do not disturb actuation capabilities |
| US10818290B2 (en) | 2017-12-11 | 2020-10-27 | Sonos, Inc. | Home graph |
| US11343614B2 (en) | 2018-01-31 | 2022-05-24 | Sonos, Inc. | Device designation of playback and network microphone device arrangements |
| US11175880B2 (en) | 2018-05-10 | 2021-11-16 | Sonos, Inc. | Systems and methods for voice-assisted media content selection |
| US10847178B2 (en) | 2018-05-18 | 2020-11-24 | Sonos, Inc. | Linear filtering for noise-suppressed speech detection |
| US10959029B2 (en) | 2018-05-25 | 2021-03-23 | Sonos, Inc. | Determining and adapting to changes in microphone performance of playback devices |
| US10681460B2 (en) | 2018-06-28 | 2020-06-09 | Sonos, Inc. | Systems and methods for associating playback devices with voice assistant services |
| CN109166570B (zh) * | 2018-07-24 | 2019-11-26 | 百度在线网络技术(北京)有限公司 | 一种语音切分的方法、装置、设备和计算机存储介质 |
| US11076035B2 (en) | 2018-08-28 | 2021-07-27 | Sonos, Inc. | Do not disturb feature for audio notifications |
| US10461710B1 (en) | 2018-08-28 | 2019-10-29 | Sonos, Inc. | Media playback system with maximum volume setting |
| US10878811B2 (en) * | 2018-09-14 | 2020-12-29 | Sonos, Inc. | Networked devices, systems, and methods for intelligently deactivating wake-word engines |
| US10587430B1 (en) | 2018-09-14 | 2020-03-10 | Sonos, Inc. | Networked devices, systems, and methods for associating playback devices based on sound codes |
| US11024331B2 (en) | 2018-09-21 | 2021-06-01 | Sonos, Inc. | Voice detection optimization using sound metadata |
| US10811015B2 (en) | 2018-09-25 | 2020-10-20 | Sonos, Inc. | Voice detection optimization based on selected voice assistant service |
| JP2020052145A (ja) * | 2018-09-25 | 2020-04-02 | トヨタ自動車株式会社 | 音声認識装置、音声認識方法、及び音声認識プログラム |
| US11100923B2 (en) | 2018-09-28 | 2021-08-24 | Sonos, Inc. | Systems and methods for selective wake word detection using neural network models |
| US10692518B2 (en) | 2018-09-29 | 2020-06-23 | Sonos, Inc. | Linear filtering for noise-suppressed speech detection via multiple network microphone devices |
| US11899519B2 (en) | 2018-10-23 | 2024-02-13 | Sonos, Inc. | Multiple stage network microphone device with reduced power consumption and processing load |
| EP3654249A1 (en) | 2018-11-15 | 2020-05-20 | Snips | Dilated convolutions and gating for efficient keyword spotting |
| US11183183B2 (en) | 2018-12-07 | 2021-11-23 | Sonos, Inc. | Systems and methods of operating media playback systems having multiple voice assistant services |
| US11132989B2 (en) | 2018-12-13 | 2021-09-28 | Sonos, Inc. | Networked microphone devices, systems, and methods of localized arbitration |
| US10602268B1 (en) | 2018-12-20 | 2020-03-24 | Sonos, Inc. | Optimization of network microphone devices using noise classification |
| US10867604B2 (en) | 2019-02-08 | 2020-12-15 | Sonos, Inc. | Devices, systems, and methods for distributed voice processing |
| US11315556B2 (en) | 2019-02-08 | 2022-04-26 | Sonos, Inc. | Devices, systems, and methods for distributed voice processing by transmitting sound data associated with a wake word to an appropriate device for identification |
| US11120794B2 (en) | 2019-05-03 | 2021-09-14 | Sonos, Inc. | Voice assistant persistence across multiple network microphone devices |
| US11200894B2 (en) | 2019-06-12 | 2021-12-14 | Sonos, Inc. | Network microphone device with command keyword eventing |
| US10586540B1 (en) | 2019-06-12 | 2020-03-10 | Sonos, Inc. | Network microphone device with command keyword conditioning |
| US11361756B2 (en) | 2019-06-12 | 2022-06-14 | Sonos, Inc. | Conditional wake word eventing based on environment |
| US11138975B2 (en) | 2019-07-31 | 2021-10-05 | Sonos, Inc. | Locally distributed keyword detection |
| US10871943B1 (en) | 2019-07-31 | 2020-12-22 | Sonos, Inc. | Noise classification for event detection |
| US11138969B2 (en) | 2019-07-31 | 2021-10-05 | Sonos, Inc. | Locally distributed keyword detection |
| US11189286B2 (en) | 2019-10-22 | 2021-11-30 | Sonos, Inc. | VAS toggle based on device orientation |
| US11200900B2 (en) | 2019-12-20 | 2021-12-14 | Sonos, Inc. | Offline voice control |
| US11562740B2 (en) | 2020-01-07 | 2023-01-24 | Sonos, Inc. | Voice verification for media playback |
| US11556307B2 (en) | 2020-01-31 | 2023-01-17 | Sonos, Inc. | Local voice data processing |
| US11308958B2 (en) | 2020-02-07 | 2022-04-19 | Sonos, Inc. | Localized wakeword verification |
| US11308962B2 (en) | 2020-05-20 | 2022-04-19 | Sonos, Inc. | Input detection windowing |
| US11727919B2 (en) | 2020-05-20 | 2023-08-15 | Sonos, Inc. | Memory allocation for keyword spotting engines |
| US11482224B2 (en) | 2020-05-20 | 2022-10-25 | Sonos, Inc. | Command keywords with input detection windowing |
| US12387716B2 (en) | 2020-06-08 | 2025-08-12 | Sonos, Inc. | Wakewordless voice quickstarts |
| US11698771B2 (en) | 2020-08-25 | 2023-07-11 | Sonos, Inc. | Vocal guidance engines for playback devices |
| US12283269B2 (en) | 2020-10-16 | 2025-04-22 | Sonos, Inc. | Intent inference in audiovisual communication sessions |
| US11984123B2 (en) | 2020-11-12 | 2024-05-14 | Sonos, Inc. | Network device interaction by range |
| US11551700B2 (en) | 2021-01-25 | 2023-01-10 | Sonos, Inc. | Systems and methods for power-efficient keyword detection |
| US12327556B2 (en) | 2021-09-30 | 2025-06-10 | Sonos, Inc. | Enabling and disabling microphones and voice assistants |
| WO2023056258A1 (en) | 2021-09-30 | 2023-04-06 | Sonos, Inc. | Conflict management for wake-word detection processes |
| US12327549B2 (en) | 2022-02-09 | 2025-06-10 | Sonos, Inc. | Gatekeeping for voice intent processing |
| US12525234B2 (en) * | 2023-09-18 | 2026-01-13 | Qualcomm Incorporated | Low power always-on listening artificial intelligence (AI) system |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6395532A (ja) * | 1986-10-13 | 1988-04-26 | Nippon Telegr & Teleph Corp <Ntt> | 音声ガイダンス出力制御方法 |
| JPH0876964A (ja) * | 1994-08-19 | 1996-03-22 | Internatl Business Mach Corp <Ibm> | 音声応答システム |
Family Cites Families (22)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4253157A (en) * | 1978-09-29 | 1981-02-24 | Alpex Computer Corp. | Data access system wherein subscriber terminals gain access to a data bank by telephone lines |
| US4821325A (en) * | 1984-11-08 | 1989-04-11 | American Telephone And Telegraph Company, At&T Bell Laboratories | Endpoint detector |
| US4914692A (en) | 1987-12-29 | 1990-04-03 | At&T Bell Laboratories | Automatic speech recognition using echo cancellation |
| CA2032765C (en) * | 1989-12-21 | 1995-12-12 | Hidetaka Yoshikawa | Variable rate encoding and communicating apparatus |
| US5155760A (en) | 1991-06-26 | 1992-10-13 | At&T Bell Laboratories | Voice messaging system with voice activated prompt interrupt |
| JPH05307397A (ja) * | 1992-04-30 | 1993-11-19 | Fujitsu Ltd | 音声認識装置 |
| JP3404776B2 (ja) * | 1992-11-06 | 2003-05-12 | ソニー株式会社 | 信号再生装置 |
| JP3681414B2 (ja) * | 1993-02-08 | 2005-08-10 | 富士通株式会社 | 通話路制御方法及び装置 |
| US5657423A (en) * | 1993-02-22 | 1997-08-12 | Texas Instruments Incorporated | Hardware filter circuit and address circuitry for MPEG encoded data |
| US5475791A (en) | 1993-08-13 | 1995-12-12 | Voice Control Systems, Inc. | Method for recognizing a spoken word in the presence of interfering speech |
| FI93915C (fi) * | 1993-09-20 | 1995-06-12 | Nokia Telecommunications Oy | Digitaalisen radiopuhelinjärjestelmän transkoodausyksikkö ja transdekoodausyksikkö sekä menetelmä transkoodausyksikön ulostulon säätämiseksi ja transdekoodausyksikön ulostulon säätämiseksi |
| US5758317A (en) | 1993-10-04 | 1998-05-26 | Motorola, Inc. | Method for voice-based affiliation of an operator identification code to a communication unit |
| DE4339464C2 (de) * | 1993-11-19 | 1995-11-16 | Litef Gmbh | Verfahren zur Sprachverschleierung und -entschleierung bei der Sprachübertragung und Einrichtung zur Durchführung des Verfahrens |
| US5652789A (en) | 1994-09-30 | 1997-07-29 | Wildfire Communications, Inc. | Network based knowledgeable assistant |
| US5708704A (en) * | 1995-04-07 | 1998-01-13 | Texas Instruments Incorporated | Speech recognition method and system with improved voice-activated prompt interrupt capability |
| US5652791A (en) * | 1995-07-19 | 1997-07-29 | Rockwell International Corp. | System and method for simulating operation of an automatic call distributor |
| US5765130A (en) * | 1996-05-21 | 1998-06-09 | Applied Language Technologies, Inc. | Method and apparatus for facilitating speech barge-in in connection with voice recognition systems |
| US6236715B1 (en) * | 1997-04-15 | 2001-05-22 | Nortel Networks Corporation | Method and apparatus for using the control channel in telecommunications systems for voice dialing |
| US6044108A (en) | 1997-05-28 | 2000-03-28 | Data Race, Inc. | System and method for suppressing far end echo of voice encoded speech |
| US5910976A (en) * | 1997-08-01 | 1999-06-08 | Lucent Technologies Inc. | Method and apparatus for testing customer premises equipment alert signal detectors to determine talkoff and talkdown error rates |
| JP4240562B2 (ja) * | 1998-02-04 | 2009-03-18 | ブラザー工業株式会社 | 情報処理用端末装置 |
| US6098043A (en) * | 1998-06-30 | 2000-08-01 | Nortel Networks Corporation | Method and apparatus for providing an improved user interface in speech recognition systems |
-
1999
- 1999-10-05 US US09/412,202 patent/US6937977B2/en not_active Expired - Lifetime
-
2000
- 2000-10-04 WO PCT/US2000/027307 patent/WO2001026096A1/en not_active Ceased
- 2000-10-04 CN CNB008167303A patent/CN1188834C/zh not_active Expired - Lifetime
- 2000-10-04 JP JP2001528975A patent/JP2003511884A/ja not_active Withdrawn
- 2000-10-04 AU AU78527/00A patent/AU7852700A/en not_active Abandoned
- 2000-10-04 KR KR1020027004392A patent/KR100759473B1/ko not_active Expired - Lifetime
-
2012
- 2012-03-16 JP JP2012060252A patent/JP5306503B2/ja not_active Expired - Lifetime
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6395532A (ja) * | 1986-10-13 | 1988-04-26 | Nippon Telegr & Teleph Corp <Ntt> | 音声ガイダンス出力制御方法 |
| JPH0876964A (ja) * | 1994-08-19 | 1996-03-22 | Internatl Business Mach Corp <Ibm> | 音声応答システム |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2014191030A (ja) * | 2013-03-26 | 2014-10-06 | Fuji Soft Inc | 音声認識端末およびコンピュータ端末を用いる音声認識方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| AU7852700A (en) | 2001-05-10 |
| WO2001026096A1 (en) | 2001-04-12 |
| KR20020071850A (ko) | 2002-09-13 |
| JP5306503B2 (ja) | 2013-10-02 |
| US6937977B2 (en) | 2005-08-30 |
| CN1188834C (zh) | 2005-02-09 |
| JP2003511884A (ja) | 2003-03-25 |
| KR100759473B1 (ko) | 2007-09-20 |
| US20030040903A1 (en) | 2003-02-27 |
| CN1408111A (zh) | 2003-04-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP5306503B2 (ja) | 出力オーディオ信号が生ずる間に入力音声信号を処理する方法および装置 | |
| KR100742259B1 (ko) | 로컬 인터럽트 검출을 기반으로 한 음성인식 기술 | |
| CN100530355C (zh) | 用于基于语音识别的信息信号提供的方法和设备 | |
| US20020173333A1 (en) | Method and apparatus for processing barge-in requests | |
| US20050065779A1 (en) | Comprehensive multiple feature telematics system | |
| US20050180464A1 (en) | Audio communication with a computer | |
| US7328159B2 (en) | Interactive speech recognition apparatus and method with conditioned voice prompts | |
| US20050113061A1 (en) | Method and system for establishing a telephony data connection to receiver | |
| US20210227355A1 (en) | System and Method for Data Analytics for Communications in Walkie-Talkie Network | |
| US7003458B2 (en) | Automated voice pattern filter | |
| JP2002237877A (ja) | ハンズフリーシステム、携帯電話およびハンズフリー装置 | |
| JP3925326B2 (ja) | 端末通信システム、連携サーバ、音声対話サーバ、音声対話処理方法および音声対話処理プログラム | |
| JP2004343443A (ja) | 携帯通信装置、通信方法 | |
| JP2002508629A (ja) | 電話呼び出しを確立するための方法 | |
| JP2007194833A (ja) | ハンズフリー機能を備えた携帯電話 | |
| JPH118711A (ja) | 電話装置 | |
| JP2003008745A (ja) | 音声補完方法及び音声補完装置ならびに電話端末装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A977 | Report on retrieval |
Free format text: JAPANESE INTERMEDIATE CODE: A971007 Effective date: 20130121 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20130123 |
|
| A601 | Written request for extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A601 Effective date: 20130422 |
|
| A602 | Written permission of extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A602 Effective date: 20130425 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20130516 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20130603 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20130625 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 Ref document number: 5306503 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |