JPH0792993A - 音声認識装置 - Google Patents
音声認識装置Info
- Publication number
- JPH0792993A JPH0792993A JP5233863A JP23386393A JPH0792993A JP H0792993 A JPH0792993 A JP H0792993A JP 5233863 A JP5233863 A JP 5233863A JP 23386393 A JP23386393 A JP 23386393A JP H0792993 A JPH0792993 A JP H0792993A
- Authority
- JP
- Japan
- Prior art keywords
- voice
- unit
- delay
- delay time
- speaker
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/221—Announcement of recognition results
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Telephonic Communication Services (AREA)
Abstract
(57)【要約】
【目的】 本発明は音声認識装置に関し、入力音声の認
識速度が速すぎる場合に、認識結果又は応答の出力が速
すぎることを防止して使用者が面食らうことがなく使用
感が向上することを目的とする。 【構成】 音声認識装置は、話者の入力音声を認識し、
認識結果又は上記認識結果に対応する応答を出力する。
遅延部(16,32)は、上記認識結果又は応答の出力
を所定時間遅延する。
識速度が速すぎる場合に、認識結果又は応答の出力が速
すぎることを防止して使用者が面食らうことがなく使用
感が向上することを目的とする。 【構成】 音声認識装置は、話者の入力音声を認識し、
認識結果又は上記認識結果に対応する応答を出力する。
遅延部(16,32)は、上記認識結果又は応答の出力
を所定時間遅延する。
Description
【0001】
【産業上の利用分野】本発明は音声認識装置に関し、入
力音声を認識して、それに応じた出力を行なう音声認識
装置に関する。
力音声を認識して、それに応じた出力を行なう音声認識
装置に関する。
【0002】
【従来の技術】従来より、入力音声を認識して、その認
識結果又は応答を音声又は文字等で出力するヒューマン
インタフェースとしての音声認識装置がある。
識結果又は応答を音声又は文字等で出力するヒューマン
インタフェースとしての音声認識装置がある。
【0003】
【発明が解決しようとする課題】従来装置では、入力音
声から認識結果又は応答を出力するまでの時間は音声の
認識速度で決定され、認識速度が速い場合は認識結果又
は応答も早く出力される。このため、内容が複雑な入力
音声に対して認識結果又は応答の出力が速すぎる場合が
生じ、音声を入力した使用者が面食らってしまい、ヒュ
ーマンインタフェースとして使用感が悪いという問題が
あった。
声から認識結果又は応答を出力するまでの時間は音声の
認識速度で決定され、認識速度が速い場合は認識結果又
は応答も早く出力される。このため、内容が複雑な入力
音声に対して認識結果又は応答の出力が速すぎる場合が
生じ、音声を入力した使用者が面食らってしまい、ヒュ
ーマンインタフェースとして使用感が悪いという問題が
あった。
【0004】本発明は上記の点に鑑みなされたもので、
入力音声の認識速度が速すぎる場合に、認識結果又は応
答の出力が速すぎることを防止して使用者が面食らうこ
とがなく使用感が向上する音声認識装置を提供すること
を目的とする。
入力音声の認識速度が速すぎる場合に、認識結果又は応
答の出力が速すぎることを防止して使用者が面食らうこ
とがなく使用感が向上する音声認識装置を提供すること
を目的とする。
【0005】
【課題を解決するための手段】本発明の音声認識装置
は、話者の入力音声を認識し、認識結果又は上記認識結
果に対応する応答を出力する音声認識装置において、上
記認識結果又は応答の出力を所定時間遅延する遅延部を
有する。
は、話者の入力音声を認識し、認識結果又は上記認識結
果に対応する応答を出力する音声認識装置において、上
記認識結果又は応答の出力を所定時間遅延する遅延部を
有する。
【0006】また、時刻を計算する時計と、時刻に応じ
て前記遅延部の遅延時間を可変する遅延時間設定部を有
する。
て前記遅延部の遅延時間を可変する遅延時間設定部を有
する。
【0007】また、音声認識の回数をカウントする使用
回数カウント部と、上記使用回数カウント部のカウント
値に応じて前記遅延部の遅延時間を可変する遅延時間設
定部とを有する。
回数カウント部と、上記使用回数カウント部のカウント
値に応じて前記遅延部の遅延時間を可変する遅延時間設
定部とを有する。
【0008】また、入力音声の連続する音声区間の長さ
を計算する音声区間長計算部と、上記音声区間の長さに
応じて前記遅延部(32)の遅延時間を可変する遅延時
間設定部とを有する。
を計算する音声区間長計算部と、上記音声区間の長さに
応じて前記遅延部(32)の遅延時間を可変する遅延時
間設定部とを有する。
【0009】また、入力音声のパワーを計算する音声パ
ワー計算部と、上記音声パワーの大きさに応じて前記遅
延部(32)の遅延時間を可変する遅延時間設定部とを
有する。
ワー計算部と、上記音声パワーの大きさに応じて前記遅
延部(32)の遅延時間を可変する遅延時間設定部とを
有する。
【0010】また、使用者により入力された遅延時間を
前記遅延部に設定する遅延時間設定部を有する。
前記遅延部に設定する遅延時間設定部を有する。
【0011】
【作用】本発明においては、遅延部を設けているため、
音声の認識速度が速すぎても、認識結果又は応答は遅延
部で遅延されて出力され、出力が速すぎて使用者が面食
らうことを防止できる。
音声の認識速度が速すぎても、認識結果又は応答は遅延
部で遅延されて出力され、出力が速すぎて使用者が面食
らうことを防止できる。
【0012】また、本発明においては、遅延部の遅延時
間を時刻、使用回数、音声区間長、音声パワー、使用者
の設定等に応じて可変調速するため、状況に応じた遅延
時間が設定され使用感が向上する。
間を時刻、使用回数、音声区間長、音声パワー、使用者
の設定等に応じて可変調速するため、状況に応じた遅延
時間が設定され使用感が向上する。
【0013】
【実施例】図1は本発明装置の第1実施例のブロック図
を示す。同図中、マイクロホン10は入力音声を音声信
号に変換して音声区間切り出し部11に供給する。音声
区間切り出し部11は音声信号が所定レベル以上で連続
する音声区間を切り出し、プリエンファシス及び雑音除
去等の前処理を行なってスペクトル計算部12に供給す
る。
を示す。同図中、マイクロホン10は入力音声を音声信
号に変換して音声区間切り出し部11に供給する。音声
区間切り出し部11は音声信号が所定レベル以上で連続
する音声区間を切り出し、プリエンファシス及び雑音除
去等の前処理を行なってスペクトル計算部12に供給す
る。
【0014】スペクトル計算部12は音声信号を20程
度の周波数帯域に分割して、各帯域出力の2乗平均値を
10〜20msecのフレーム周期毎に特徴パラメータ
として読み取り、音声のパワースペクトルを得てDPマ
ッチング部14に供給する。DPマッチング部14では
スペクトル計算部12で得られた音声区間の特徴パラメ
ータと、単語テンプレート15に予め格納されている標
準パラメータとのダイナミックプログラミング(DP)
技法を用いた非線形マッチングを行ない、時間軸歪を取
り除いた類似度計算による距離が最小となる標準パター
ンの単語を認識結果として出力する。
度の周波数帯域に分割して、各帯域出力の2乗平均値を
10〜20msecのフレーム周期毎に特徴パラメータ
として読み取り、音声のパワースペクトルを得てDPマ
ッチング部14に供給する。DPマッチング部14では
スペクトル計算部12で得られた音声区間の特徴パラメ
ータと、単語テンプレート15に予め格納されている標
準パラメータとのダイナミックプログラミング(DP)
技法を用いた非線形マッチングを行ない、時間軸歪を取
り除いた類似度計算による距離が最小となる標準パター
ンの単語を認識結果として出力する。
【0015】この認識結果は遅延部16で所定時間遅延
された後、表示部17に供給されて入力音声の認識結果
が文字表示される。この遅延部16の遅延時間は入力音
声の認識結果が表示されるまでに要する時間が例えば2
秒を越えない時間となるような所定時間である。
された後、表示部17に供給されて入力音声の認識結果
が文字表示される。この遅延部16の遅延時間は入力音
声の認識結果が表示されるまでに要する時間が例えば2
秒を越えない時間となるような所定時間である。
【0016】このように、遅延部を設けているため、音
声の認識速度が速すぎても、認識結果又は応答は遅延部
で遅延されて出力され、出力が速すぎて使用者が面食ら
うことを防止でき、使用感が向上する。
声の認識速度が速すぎても、認識結果又は応答は遅延部
で遅延されて出力され、出力が速すぎて使用者が面食ら
うことを防止でき、使用感が向上する。
【0017】図2,図3夫々は本発明装置の変形例のブ
ロック図を示す。同図中、図1と同一部分には同一符号
を付し、その説明を省略する。図2において、DPマッ
チング部14の出力する認識結果は出力文選択部20に
供給される。出力文選択部20は上記認識結果を用いて
出力文データベース21を検索し、入力音声の認識結果
に応じた出力文を読み出す。例えば、入力音声が「東京
の天気は」であるとしたら、出力文データベース21か
ら、「東京の天気は」に対応する「明日の東京は晴」等
の出力文が検索される。
ロック図を示す。同図中、図1と同一部分には同一符号
を付し、その説明を省略する。図2において、DPマッ
チング部14の出力する認識結果は出力文選択部20に
供給される。出力文選択部20は上記認識結果を用いて
出力文データベース21を検索し、入力音声の認識結果
に応じた出力文を読み出す。例えば、入力音声が「東京
の天気は」であるとしたら、出力文データベース21か
ら、「東京の天気は」に対応する「明日の東京は晴」等
の出力文が検索される。
【0018】選択された出力文は遅延部16で所定時間
遅延されて表示部17に供給され文字表示される。
遅延されて表示部17に供給され文字表示される。
【0019】図3においては、出力文選択部20で選択
された出力文は出力音声選択部22に供給される。出力
音声選択部22では出力文を用いて出力文音声データベ
ース23を検索し、出力文を発音するための音声データ
を読み出す。この音声データは遅延部16で所定時間遅
延されて発音部24に供給され、ここで音声データが音
声信号に変換され発音部24に内蔵されるスピーカより
発音される。
された出力文は出力音声選択部22に供給される。出力
音声選択部22では出力文を用いて出力文音声データベ
ース23を検索し、出力文を発音するための音声データ
を読み出す。この音声データは遅延部16で所定時間遅
延されて発音部24に供給され、ここで音声データが音
声信号に変換され発音部24に内蔵されるスピーカより
発音される。
【0020】図4は本発明装置の第2実施例のブロック
図を示す。同図中、図2と同一部分には同一符号を付
し、その説明を省略する。図4において、時計30は現
在時刻を計時して遅延時間設定部31に供給する。遅延
時間設定部31は朝から午前中は時間と共に遅延時間が
減少し、午後は遅延時間が一定となるように、遅延時間
の設定が可能な遅延部32の遅延時間を可変設定する。
この遅延時間も応答に要する時間が例えば2秒を越えな
いような値である。
図を示す。同図中、図2と同一部分には同一符号を付
し、その説明を省略する。図4において、時計30は現
在時刻を計時して遅延時間設定部31に供給する。遅延
時間設定部31は朝から午前中は時間と共に遅延時間が
減少し、午後は遅延時間が一定となるように、遅延時間
の設定が可能な遅延部32の遅延時間を可変設定する。
この遅延時間も応答に要する時間が例えば2秒を越えな
いような値である。
【0021】これにより、午前中は時間と共に反応が速
くなる人間に合わせて、入力音声から応答が出力される
までの時間が速くなるように可変され、使用感が向上す
る。
くなる人間に合わせて、入力音声から応答が出力される
までの時間が速くなるように可変され、使用感が向上す
る。
【0022】図5は本発明装置の第3実施例のブロック
図を示す。同図中、図4と同一部分には同一符号を付
し、その説明を省略する。図5において、DPマッチン
グ部14の出力する認識結果が使用回数記憶部35に供
給される。使用回数カウント部35は電源投入後、認識
結果が供給される毎に使用回数を1ずつカウントアップ
する。遅延時間設定部36はそのカウント値に応じてカ
ウント値が増大するほど遅延時間が減少し、カウント値
が所定値を越えると遅延時間が一定となるよう遅延部3
2の遅延時間を設定する。
図を示す。同図中、図4と同一部分には同一符号を付
し、その説明を省略する。図5において、DPマッチン
グ部14の出力する認識結果が使用回数記憶部35に供
給される。使用回数カウント部35は電源投入後、認識
結果が供給される毎に使用回数を1ずつカウントアップ
する。遅延時間設定部36はそのカウント値に応じてカ
ウント値が増大するほど遅延時間が減少し、カウント値
が所定値を越えると遅延時間が一定となるよう遅延部3
2の遅延時間を設定する。
【0023】これにより、使用回数が増加して装置の使
用に馴れるに従って応答が速くなり、使用感が向上す
る。
用に馴れるに従って応答が速くなり、使用感が向上す
る。
【0024】図6は本発明装置の第4実施例のブロック
図を示す。同図中、図4と同一部分には同一符号を付
し、その説明を省略する。図6において、音声区間切り
出し部11で切り出された音声区間が音声区間長計算部
38に供給される。音声区間長計算部38は音声区間の
長さつまり時間を計算する。遅延時間設定部39は音声
区間長が長いほど遅延時間が長くなるよう遅延部32の
遅延時間を設定する。
図を示す。同図中、図4と同一部分には同一符号を付
し、その説明を省略する。図6において、音声区間切り
出し部11で切り出された音声区間が音声区間長計算部
38に供給される。音声区間長計算部38は音声区間の
長さつまり時間を計算する。遅延時間設定部39は音声
区間長が長いほど遅延時間が長くなるよう遅延部32の
遅延時間を設定する。
【0025】通常、音声区間が長いほど、その内容を理
解するのに時間がかかり、内容理解の時間に合わせて応
答が返ってくる時間が長くなり、使用感が向上する。
解するのに時間がかかり、内容理解の時間に合わせて応
答が返ってくる時間が長くなり、使用感が向上する。
【0026】図7は本発明装置の第5実施例のブロック
図を示す。同図中、図6と同一部分には同一符号を付
し、その説明を省略する。図7において、音声区間切り
出し部11で切り出された音声区間が音声パワー計算部
40に供給される。音声パワー計算部40は音声区間の
平均音声パワーを計算する。遅延時間設定部41は平均
音声パワーが大なるほど遅延時間が短かくなるよう遅延
部32の遅延時間を設定する。
図を示す。同図中、図6と同一部分には同一符号を付
し、その説明を省略する。図7において、音声区間切り
出し部11で切り出された音声区間が音声パワー計算部
40に供給される。音声パワー計算部40は音声区間の
平均音声パワーを計算する。遅延時間設定部41は平均
音声パワーが大なるほど遅延時間が短かくなるよう遅延
部32の遅延時間を設定する。
【0027】通常、音声の大きさが大きいほど、その内
容を理解するのに時間が短かくて済み、内容理解の時間
に合わせて応答が返ってくる時間が短かくなり、使用感
が向上する。
容を理解するのに時間が短かくて済み、内容理解の時間
に合わせて応答が返ってくる時間が短かくなり、使用感
が向上する。
【0028】図8,図9は本発明装置の第6実施例のブ
ロック図を示す。同図中、図4と同一部分には同一符号
を付し、その説明を省略する。図8において、遅延時間
設定部42は端子43より入来する使用者が設定した遅
延時間を記憶し、この遅延時間を遅延部32に設定す
る。また、図9において、遅延時間設定部45は端子4
6より入来する使用者の識別番号である話者IDと、端
子47より入来する使用者が設定した遅延時間とを対応
付けて記憶しておき、話者IDが入力される毎に対応す
る遅延時間を遅延部32に設定する。
ロック図を示す。同図中、図4と同一部分には同一符号
を付し、その説明を省略する。図8において、遅延時間
設定部42は端子43より入来する使用者が設定した遅
延時間を記憶し、この遅延時間を遅延部32に設定す
る。また、図9において、遅延時間設定部45は端子4
6より入来する使用者の識別番号である話者IDと、端
子47より入来する使用者が設定した遅延時間とを対応
付けて記憶しておき、話者IDが入力される毎に対応す
る遅延時間を遅延部32に設定する。
【0029】このように使用者毎に所望する遅延時間を
設定することにより、その使用者に合わせて入力音声か
ら応答が出力されるまでの時間を可変でき、使用感が向
上する。
設定することにより、その使用者に合わせて入力音声か
ら応答が出力されるまでの時間を可変でき、使用感が向
上する。
【0030】図10,図11夫々は本発明装置の第7実
施例のブロック図を示す。同図中、図5と同一部分には
同一符号を付し、その説明を省略する。図10におい
て、初期化部50は端子51から話者IDが供給される
毎に前回供給された話者IDと比較して、両者が異なる
ときにのみリセット信号を生成する。このリセット信号
は使用回数カウント部35に供給されて、そのカウント
値がゼロリセットされる。つまり、使用者が代る毎に使
用回数がリセットされ、その後の使用回数が増加すると
共に応答が速くなる。
施例のブロック図を示す。同図中、図5と同一部分には
同一符号を付し、その説明を省略する。図10におい
て、初期化部50は端子51から話者IDが供給される
毎に前回供給された話者IDと比較して、両者が異なる
ときにのみリセット信号を生成する。このリセット信号
は使用回数カウント部35に供給されて、そのカウント
値がゼロリセットされる。つまり、使用者が代る毎に使
用回数がリセットされ、その後の使用回数が増加すると
共に応答が速くなる。
【0031】また、図11においては、使用回数カウン
ト部52は端子53より供給される話者IDに対応して
使用回数を別々にカウントし、話者IDが入力された現
在の使用者に対応するカウント値を遅延時間設定部36
に供給する。これにより、各使用者に、延べ使用回数が
増加すると共に応答が速くなる。
ト部52は端子53より供給される話者IDに対応して
使用回数を別々にカウントし、話者IDが入力された現
在の使用者に対応するカウント値を遅延時間設定部36
に供給する。これにより、各使用者に、延べ使用回数が
増加すると共に応答が速くなる。
【0032】図12,図13,図14夫々は本発明装置
の第8実施例のブロック図を示す。同図中、図9,図1
0,図11夫々と同一部分には同一符号を付し、その説
明を省略する。図12〜図14夫々において、マイクロ
ホン10の出力する音声信号は音声個人特性抽出部60
は入力音声の音声信号から例えば長時間ケプストラム等
の音声の個人特性のパラメータを抽出する。音声個人特
性照合部61は上記音声個人特性抽出部60で抽出され
た音声個人特性(パラメータ)と音声個人特性辞書62
に予め話者IDと共に登録されている音声個人特性パラ
メータとのマッチングを行ない、マッチングにより得ら
れた話者IDを遅延時間設定部45、又は使用回数カウ
ント部35、又は52に供給する。
の第8実施例のブロック図を示す。同図中、図9,図1
0,図11夫々と同一部分には同一符号を付し、その説
明を省略する。図12〜図14夫々において、マイクロ
ホン10の出力する音声信号は音声個人特性抽出部60
は入力音声の音声信号から例えば長時間ケプストラム等
の音声の個人特性のパラメータを抽出する。音声個人特
性照合部61は上記音声個人特性抽出部60で抽出され
た音声個人特性(パラメータ)と音声個人特性辞書62
に予め話者IDと共に登録されている音声個人特性パラ
メータとのマッチングを行ない、マッチングにより得ら
れた話者IDを遅延時間設定部45、又は使用回数カウ
ント部35、又は52に供給する。
【0033】つまり図12〜図14の装置では入力音声
から話者IDを自動的に得ている。
から話者IDを自動的に得ている。
【0034】
【発明の効果】上述の如く、本発明の音声認識装置によ
れば、入力音声の認識速度が速すぎる場合に、認識結果
又は応答の出力が速すぎることを防止して使用者が面食
らうことがなく、使用感が向上し、実用上きわめて有用
である。
れば、入力音声の認識速度が速すぎる場合に、認識結果
又は応答の出力が速すぎることを防止して使用者が面食
らうことがなく、使用感が向上し、実用上きわめて有用
である。
【図1】本発明装置のブロック図である。
【図2】本発明装置のブロック図である。
【図3】本発明装置のブロック図である。
【図4】本発明装置のブロック図である。
【図5】本発明装置のブロック図である。
【図6】本発明装置のブロック図である。
【図7】本発明装置のブロック図である。
【図8】本発明装置のブロック図である。
【図9】本発明装置のブロック図である。
【図10】本発明装置のブロック図である。
【図11】本発明装置のブロック図である。
【図12】本発明装置のブロック図である。
【図13】本発明装置のブロック図である。
【図14】本発明装置のブロック図である。
10 マイクロホン 11 音声区間切り出し部 12 スペクトル計算部 14 DPマッチング部 15 単語テンプレート 16,32 遅延部 17 表示部 20 出力文選択部 21 出力文データベース 22 出力音声選択部 23 出力文音声データベース 24 発音部 30 時計 31,36,39,41,42,45 遅延時間設定部 35,52 使用回数カウント部 38 音声区間長計算部 40 音声パワー計算部 50 初期化部 60 音声個人特性抽出部 61 音声個人特性照合部 62 音声個人特性辞書
Claims (10)
- 【請求項1】 話者の入力音声を認識し、認識結果又は
上記認識結果に対応する応答を出力する音声認識装置に
おいて、 上記認識結果又は応答の出力を所定時間遅延する遅延部
(16,32)を有することを特徴とする音声認識装
置。 - 【請求項2】 時刻を計算する時計(30)と、 時刻に応じて前記遅延部(32)の遅延時間を可変する
遅延時間設定部(31)を有することを特徴とする請求
項1記載の音声認識装置。 - 【請求項3】 音声認識の回数をカウントする使用回数
カウント部(35)と、 上記使用回数カウント部のカウント値に応じて前記遅延
部(32,52)の遅延時間を可変する遅延時間設定部
(36)とを有することを特徴とする請求項1記載の音
声認識装置。 - 【請求項4】 入力音声の連続する音声区間の長さを計
算する音声区間長計算部(38)と、 上記音声区間の長さに応じて前記遅延部(32)の遅延
時間を可変する遅延時間設定部(39)とを有すること
を特徴とする請求項1記載の音声認識装置。 - 【請求項5】 入力音声のパワーを計算する音声パワー
計算部(40)と、 上記音声パワーの大きさに応じて前記遅延部(32)の
遅延時間を可変する遅延時間設定部(41)とを有する
ことを特徴とする請求項1記載の音声認識装置。 - 【請求項6】 使用者により入力された遅延時間を前記
遅延部(32)に設定する遅延時間設定部(42,4
5)を有することを特徴とする請求項1記載の音声認識
装置。 - 【請求項7】 前記遅延時間設定部(45)は、使用者
を識別する話者IDを入力され、上記話者IDに対応し
て各使用者により入力された遅延時間を前記遅延部(3
2)に設定することを特徴とする請求項6記載の音声認
識装置。 - 【請求項8】 入力された話者IDが前回の話者IDと
異なるとき前記使用回数カウント部(35)のカウント
値をリセットする初期化部を有することを特徴とする請
求項3記載の音声認識装置。 - 【請求項9】 前記使用回数カウント部(52)は、入
力された話者IDに対応して話者ID毎の音声認識の回
数をカウントしてそのカウント値を出力することを特徴
とする請求項3記載の音声認識装置。 - 【請求項10】 入力音声を分析して上記入力音声の話
者を識別する話者IDを特定する話者ID特定部(60
〜62)を有することを特徴とする請求項7又は請求項
8又は請求項9記載の音声認識装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5233863A JPH0792993A (ja) | 1993-09-20 | 1993-09-20 | 音声認識装置 |
| US08/266,381 US5758318A (en) | 1993-09-20 | 1994-06-27 | Speech recognition apparatus having means for delaying output of recognition result |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5233863A JPH0792993A (ja) | 1993-09-20 | 1993-09-20 | 音声認識装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH0792993A true JPH0792993A (ja) | 1995-04-07 |
Family
ID=16961756
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP5233863A Pending JPH0792993A (ja) | 1993-09-20 | 1993-09-20 | 音声認識装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US5758318A (ja) |
| JP (1) | JPH0792993A (ja) |
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2006171111A (ja) * | 2004-12-13 | 2006-06-29 | Mitsubishi Electric Corp | 音声認識装置 |
| JP2008160667A (ja) * | 2006-12-26 | 2008-07-10 | Hitachi Communication Technologies Ltd | 通信会議装置 |
| JP2010152119A (ja) * | 2008-12-25 | 2010-07-08 | Toyota Central R&D Labs Inc | 応答生成装置及びプログラム |
| US12112745B2 (en) | 2018-11-08 | 2024-10-08 | Samsung Electronics Co., Ltd. | Electronic device and control method thereof |
Families Citing this family (66)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6317716B1 (en) * | 1997-09-19 | 2001-11-13 | Massachusetts Institute Of Technology | Automatic cueing of speech |
| CA2342787A1 (en) * | 1999-07-01 | 2001-03-01 | Alexei B. Machovikov | Speech recognition system for data entry |
| US8645137B2 (en) | 2000-03-16 | 2014-02-04 | Apple Inc. | Fast, language-independent method for user authentication by voice |
| US6728671B1 (en) * | 2000-03-29 | 2004-04-27 | Lucent Technologies Inc. | Automatic speech recognition caller input rate control |
| US6725193B1 (en) * | 2000-09-13 | 2004-04-20 | Telefonaktiebolaget Lm Ericsson | Cancellation of loudspeaker words in speech recognition |
| US7167831B2 (en) * | 2002-02-04 | 2007-01-23 | Microsoft Corporation | Systems and methods for managing multiple grammars in a speech recognition system |
| US8374879B2 (en) | 2002-02-04 | 2013-02-12 | Microsoft Corporation | Systems and methods for managing interactions from multiple speech-enabled applications |
| WO2004104986A1 (ja) * | 2003-05-21 | 2004-12-02 | Matsushita Electric Industrial Co., Ltd. | 音声出力装置及び音声出力方法 |
| EP1699040A4 (en) * | 2003-12-12 | 2007-11-28 | Nec Corp | INFORMATION PROCESSING SYSTEM, INFORMATION PROCESSING METHOD AND INFORMATION PROCESSING PROGRAM |
| US7349836B2 (en) * | 2003-12-12 | 2008-03-25 | International Business Machines Corporation | Method and process to generate real time input/output in a voice XML run-time simulation environment |
| JP2006155269A (ja) * | 2004-11-30 | 2006-06-15 | Fuji Xerox Co Ltd | 音声ガイドシステムおよびその音声ガイド方法 |
| US20070055520A1 (en) * | 2005-08-31 | 2007-03-08 | Microsoft Corporation | Incorporation of speech engine training into interactive user tutorial |
| US8677377B2 (en) | 2005-09-08 | 2014-03-18 | Apple Inc. | Method and apparatus for building an intelligent automated assistant |
| US9318108B2 (en) | 2010-01-18 | 2016-04-19 | Apple Inc. | Intelligent automated assistant |
| JP2008065789A (ja) * | 2006-09-11 | 2008-03-21 | Canon Inc | 入力操作支援装置およびその制御方法 |
| US8996376B2 (en) | 2008-04-05 | 2015-03-31 | Apple Inc. | Intelligent text-to-speech conversion |
| US10241752B2 (en) | 2011-09-30 | 2019-03-26 | Apple Inc. | Interface for a virtual digital assistant |
| US10241644B2 (en) | 2011-06-03 | 2019-03-26 | Apple Inc. | Actionable reminder entries |
| US9431006B2 (en) | 2009-07-02 | 2016-08-30 | Apple Inc. | Methods and apparatuses for automatic speech recognition |
| US8682667B2 (en) | 2010-02-25 | 2014-03-25 | Apple Inc. | User profiling for selecting user specific voice input processing information |
| US9262612B2 (en) | 2011-03-21 | 2016-02-16 | Apple Inc. | Device access using voice authentication |
| US9280610B2 (en) | 2012-05-14 | 2016-03-08 | Apple Inc. | Crowd sourcing information to fulfill user requests |
| US9721563B2 (en) | 2012-06-08 | 2017-08-01 | Apple Inc. | Name recognition system |
| US9547647B2 (en) | 2012-09-19 | 2017-01-17 | Apple Inc. | Voice-based media searching |
| US9368114B2 (en) * | 2013-03-14 | 2016-06-14 | Apple Inc. | Context-sensitive handling of interruptions |
| WO2014197334A2 (en) | 2013-06-07 | 2014-12-11 | Apple Inc. | System and method for user-specified pronunciation of words for speech synthesis and recognition |
| US9582608B2 (en) | 2013-06-07 | 2017-02-28 | Apple Inc. | Unified ranking with entropy-weighted information for phrase-based semantic auto-completion |
| WO2014197335A1 (en) | 2013-06-08 | 2014-12-11 | Apple Inc. | Interpreting and acting upon commands that involve sharing information with remote devices |
| KR101959188B1 (ko) | 2013-06-09 | 2019-07-02 | 애플 인크. | 디지털 어시스턴트의 둘 이상의 인스턴스들에 걸친 대화 지속성을 가능하게 하기 위한 디바이스, 방법 및 그래픽 사용자 인터페이스 |
| US10176167B2 (en) | 2013-06-09 | 2019-01-08 | Apple Inc. | System and method for inferring user intent from speech inputs |
| US9430463B2 (en) | 2014-05-30 | 2016-08-30 | Apple Inc. | Exemplar-based natural language processing |
| US9338493B2 (en) | 2014-06-30 | 2016-05-10 | Apple Inc. | Intelligent automated assistant for TV user interactions |
| US9558736B2 (en) * | 2014-07-02 | 2017-01-31 | Bose Corporation | Voice prompt generation combining native and remotely-generated speech data |
| JP6448950B2 (ja) * | 2014-08-20 | 2019-01-09 | シャープ株式会社 | 音声対話装置及び電子機器 |
| US9668121B2 (en) | 2014-09-30 | 2017-05-30 | Apple Inc. | Social reminders |
| US9965464B2 (en) * | 2014-12-05 | 2018-05-08 | Microsoft Technology Licensing, Llc | Automatic process guidance |
| WO2017014721A1 (en) * | 2015-07-17 | 2017-01-26 | Nuance Communications, Inc. | Reduced latency speech recognition system using multiple recognizers |
| US10747498B2 (en) | 2015-09-08 | 2020-08-18 | Apple Inc. | Zero latency digital assistant |
| US10671428B2 (en) | 2015-09-08 | 2020-06-02 | Apple Inc. | Distributed personal assistant |
| US10366158B2 (en) | 2015-09-29 | 2019-07-30 | Apple Inc. | Efficient word encoding for recurrent neural network language models |
| US11010550B2 (en) | 2015-09-29 | 2021-05-18 | Apple Inc. | Unified language modeling framework for word prediction, auto-completion and auto-correction |
| US11587559B2 (en) | 2015-09-30 | 2023-02-21 | Apple Inc. | Intelligent device identification |
| US10691473B2 (en) | 2015-11-06 | 2020-06-23 | Apple Inc. | Intelligent automated assistant in a messaging environment |
| US10049668B2 (en) | 2015-12-02 | 2018-08-14 | Apple Inc. | Applying neural network language models to weighted finite state transducers for automatic speech recognition |
| US9484030B1 (en) * | 2015-12-02 | 2016-11-01 | Amazon Technologies, Inc. | Audio triggered commands |
| US10223066B2 (en) | 2015-12-23 | 2019-03-05 | Apple Inc. | Proactive assistance based on dialog communication between devices |
| US10446143B2 (en) | 2016-03-14 | 2019-10-15 | Apple Inc. | Identification of voice inputs providing credentials |
| US9934775B2 (en) | 2016-05-26 | 2018-04-03 | Apple Inc. | Unit-selection text-to-speech synthesis based on predicted concatenation parameters |
| US9972304B2 (en) | 2016-06-03 | 2018-05-15 | Apple Inc. | Privacy preserving distributed evaluation framework for embedded personalized systems |
| US10249300B2 (en) | 2016-06-06 | 2019-04-02 | Apple Inc. | Intelligent list reading |
| US10049663B2 (en) | 2016-06-08 | 2018-08-14 | Apple, Inc. | Intelligent automated assistant for media exploration |
| DK179588B1 (en) | 2016-06-09 | 2019-02-22 | Apple Inc. | INTELLIGENT AUTOMATED ASSISTANT IN A HOME ENVIRONMENT |
| US10509862B2 (en) | 2016-06-10 | 2019-12-17 | Apple Inc. | Dynamic phrase expansion of language input |
| US10067938B2 (en) | 2016-06-10 | 2018-09-04 | Apple Inc. | Multilingual word prediction |
| US10586535B2 (en) | 2016-06-10 | 2020-03-10 | Apple Inc. | Intelligent digital assistant in a multi-tasking environment |
| US10490187B2 (en) | 2016-06-10 | 2019-11-26 | Apple Inc. | Digital assistant providing automated status report |
| US10192552B2 (en) | 2016-06-10 | 2019-01-29 | Apple Inc. | Digital assistant providing whispered speech |
| DK179343B1 (en) | 2016-06-11 | 2018-05-14 | Apple Inc | Intelligent task discovery |
| DK201670540A1 (en) | 2016-06-11 | 2018-01-08 | Apple Inc | Application integration with a digital assistant |
| DK179049B1 (en) | 2016-06-11 | 2017-09-18 | Apple Inc | Data driven natural language event detection and classification |
| DK179415B1 (en) | 2016-06-11 | 2018-06-14 | Apple Inc | Intelligent device arbitration and control |
| US10593346B2 (en) | 2016-12-22 | 2020-03-17 | Apple Inc. | Rank-reduced token representation for automatic speech recognition |
| DK179745B1 (en) | 2017-05-12 | 2019-05-01 | Apple Inc. | SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT |
| DK201770431A1 (en) | 2017-05-15 | 2018-12-20 | Apple Inc. | Optimizing dialogue policy decisions for digital assistants using implicit feedback |
| GB2574035A (en) * | 2018-05-23 | 2019-11-27 | To Play For Ltd | Interaction with an intelligent artificial agent |
| DK201970509A1 (en) | 2019-05-06 | 2021-01-15 | Apple Inc | Spoken notifications |
Family Cites Families (14)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB1569450A (en) * | 1976-05-27 | 1980-06-18 | Nippon Electric Co | Speech recognition system |
| US4093831A (en) * | 1976-10-12 | 1978-06-06 | Business Education Products, Inc. | Transcriber having selectable word reproduction rate |
| JPS57118299A (en) * | 1981-01-14 | 1982-07-23 | Nissan Motor | Voice load driver |
| JPS5861040A (ja) * | 1981-10-06 | 1983-04-11 | Nissan Motor Co Ltd | 車載機器の音声指令制御装置 |
| US4528687A (en) * | 1981-10-22 | 1985-07-09 | Nissan Motor Company, Limited | Spoken-instruction controlled system for an automotive vehicle |
| US4468204A (en) * | 1982-02-25 | 1984-08-28 | Scott Instruments Corporation | Process of human-machine interactive educational instruction using voice response verification |
| US5199062A (en) * | 1988-01-20 | 1993-03-30 | Phone Base Systems Inc. | Telephone communications system including a digital telephone switch, a voice response unit and a stored program sequence for controlling both the switch and the voice response unit |
| US5040790A (en) * | 1988-12-16 | 1991-08-20 | Swingpacer Corporation | Apparatus for pacing |
| US5157384A (en) * | 1989-04-28 | 1992-10-20 | International Business Machines Corporation | Advanced user interface |
| US5165095A (en) * | 1990-09-28 | 1992-11-17 | Texas Instruments Incorporated | Voice telephone dialing |
| US5263167A (en) * | 1991-11-22 | 1993-11-16 | International Business Machines Corporation | User interface for a relational database using a task object for defining search queries in response to a profile object which describes user proficiency |
| US5293584A (en) * | 1992-05-21 | 1994-03-08 | International Business Machines Corporation | Speech recognition system for natural language translation |
| US5425128A (en) * | 1992-05-29 | 1995-06-13 | Sunquest Information Systems, Inc. | Automatic management system for speech recognition processes |
| DE69423838T2 (de) * | 1993-09-23 | 2000-08-03 | Xerox Corp., Rochester | Semantische Gleichereignisfilterung für Spracherkennung und Signalübersetzungsanwendungen |
-
1993
- 1993-09-20 JP JP5233863A patent/JPH0792993A/ja active Pending
-
1994
- 1994-06-27 US US08/266,381 patent/US5758318A/en not_active Expired - Lifetime
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2006171111A (ja) * | 2004-12-13 | 2006-06-29 | Mitsubishi Electric Corp | 音声認識装置 |
| JP2008160667A (ja) * | 2006-12-26 | 2008-07-10 | Hitachi Communication Technologies Ltd | 通信会議装置 |
| JP2010152119A (ja) * | 2008-12-25 | 2010-07-08 | Toyota Central R&D Labs Inc | 応答生成装置及びプログラム |
| US12112745B2 (en) | 2018-11-08 | 2024-10-08 | Samsung Electronics Co., Ltd. | Electronic device and control method thereof |
Also Published As
| Publication number | Publication date |
|---|---|
| US5758318A (en) | 1998-05-26 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JPH0792993A (ja) | 音声認識装置 | |
| JP2986313B2 (ja) | 音声コード化装置及びその方法並びに音声認識装置及びその方法 | |
| US6873953B1 (en) | Prosody based endpoint detection | |
| US10490181B2 (en) | Technology for responding to remarks using speech synthesis | |
| Zwicker et al. | Automatic speech recognition using psychoacoustic models | |
| JP3476006B2 (ja) | コマンド境界識別装置、方法およびプログラム記憶装置 | |
| EP1168306A2 (en) | Method and apparatus for improving the intelligibility of digitally compressed speech | |
| US20030163314A1 (en) | Customizing the speaking style of a speech synthesizer based on semantic analysis | |
| US20040148161A1 (en) | Normalization of speech accent | |
| CN111370024A (zh) | 一种音频调整方法、设备及计算机可读存储介质 | |
| JP6373621B2 (ja) | 話し方評価装置、話し方評価方法、プログラム | |
| CN110875036A (zh) | 语音分类方法、装置、设备及计算机可读存储介质 | |
| JP2001272991A (ja) | 音声対話方法及び音声対話装置 | |
| US10643600B1 (en) | Modifying syllable durations for personalizing Chinese Mandarin TTS using small corpus | |
| JP6314879B2 (ja) | 音読評価装置、音読評価方法、及びプログラム | |
| Broad | Formants in automatic speech recognition | |
| TW508564B (en) | Method and system for phonetic recognition | |
| CN112542159B (zh) | 一种数据处理方法以及设备 | |
| JPH1083193A (ja) | 音声合成装置および音声素片作成方法 | |
| JPH10254493A (ja) | 録音音声の音量正規化方法およびこの方法を実施する装置 | |
| JP3808732B2 (ja) | 音声認識方法及びそのシステム | |
| KR101394290B1 (ko) | 한국어 경음/연음 구분을 이용한 음성인식 시스템 및 방법 | |
| JP2006017819A (ja) | 音声合成方法、音声合成プログラム及び音声合成装置 | |
| JP2697995B2 (ja) | 発声発語訓練器 | |
| JP2001312290A (ja) | 音声合成装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A02 | Decision of refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A02 Effective date: 20020521 |