JPH1063293A - 電話音声認識装置 - Google Patents
電話音声認識装置Info
- Publication number
- JPH1063293A JPH1063293A JP8239938A JP23993896A JPH1063293A JP H1063293 A JPH1063293 A JP H1063293A JP 8239938 A JP8239938 A JP 8239938A JP 23993896 A JP23993896 A JP 23993896A JP H1063293 A JPH1063293 A JP H1063293A
- Authority
- JP
- Japan
- Prior art keywords
- voice
- line
- speech
- connection information
- telephone
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/28—Constructional details of speech recognition systems
- G10L15/30—Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/20—Speech recognition techniques specially adapted for robustness in adverse environments, e.g. in noise, of stress induced speech
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/26—Devices for calling a subscriber
- H04M1/27—Devices whereby a plurality of signals may be stored simultaneously
- H04M1/271—Devices whereby a plurality of signals may be stored simultaneously controlled by voice recognition
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2201/00—Electronic components, circuits, software, systems or apparatus used in telephone systems
- H04M2201/40—Electronic components, circuits, software, systems or apparatus used in telephone systems using speech recognition
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y10—TECHNICAL SUBJECTS COVERED BY FORMER USPC
- Y10S—TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y10S379/00—Telephonic communications
- Y10S379/907—Speech recognition via telephone system or component
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Telephonic Communication Services (AREA)
Abstract
(57)【要約】
【課題】 回線状況に影響を受けることなく、高い認識
性能を期待することのできる電話音声認識装置を提供す
ることにある。 【解決手段】 本発明は、回線接続情報に応じた音声分
析部4、5および音声モデル格納部7〜9を具備してい
る。回線接続情報取得機能付き回線インタフェース1は
回線を介して入力してきた呼から発信国、呼が辿ってき
たルート等の分析を行い、回線接続情報を回線接続情報
処理部2に通知する。回線接続情報処理部2は該回線接
続情報に基づいて、前記音響分析部4、5の中の一つを
選択する。また、前記音声モデル格納部7〜9の中の一
つを選択する。音声照合部11は前記選択された音響分
析部からの出力である音響ベクトル列と前記選択された
音声モデルとを比較し、音声認識を行う。
性能を期待することのできる電話音声認識装置を提供す
ることにある。 【解決手段】 本発明は、回線接続情報に応じた音声分
析部4、5および音声モデル格納部7〜9を具備してい
る。回線接続情報取得機能付き回線インタフェース1は
回線を介して入力してきた呼から発信国、呼が辿ってき
たルート等の分析を行い、回線接続情報を回線接続情報
処理部2に通知する。回線接続情報処理部2は該回線接
続情報に基づいて、前記音響分析部4、5の中の一つを
選択する。また、前記音声モデル格納部7〜9の中の一
つを選択する。音声照合部11は前記選択された音響分
析部からの出力である音響ベクトル列と前記選択された
音声モデルとを比較し、音声認識を行う。
Description
【0001】
【発明の属する技術分野】この発明は電話音声認識装置
に関し、特に電話回線、ネットワークもしくは交換機な
どに接続して利用して好適な電話音声認識装置に関す
る。
に関し、特に電話回線、ネットワークもしくは交換機な
どに接続して利用して好適な電話音声認識装置に関す
る。
【0002】
【従来の技術】従来の電話回線に接続される音声認識装
置の一例を、図3を参照して説明する。利用者からの発
呼があり、該利用者の音声を音声認識する場合には、電
話回線等を介して入力してきた音声は回線インタフェー
ス31を介して音声認識装置に接続される。音声認識装
置は、概略、音響分析部32、音声照合部33および音
声モデル格納部34から構成されている。
置の一例を、図3を参照して説明する。利用者からの発
呼があり、該利用者の音声を音声認識する場合には、電
話回線等を介して入力してきた音声は回線インタフェー
ス31を介して音声認識装置に接続される。音声認識装
置は、概略、音響分析部32、音声照合部33および音
声モデル格納部34から構成されている。
【0003】回線インタフェース31を介して入力され
た利用者の音声は、まず音響分析部32に送られる。音
響分析部32では、周知のように、音声を25m秒程度
のハミング窓などで10m秒毎に切り出し、ケプストラ
ム分析等の音響分析を行う。そして、音響ベクトル列を
生成し、音声照合部33に出力する。音声モデル格納部
34には、HMM(Hidden Markov Model)等の音声モデ
ルが予め格納されている。そこで、前記音響ベクトル列
が入力してくると、音声照合部33は音声モデル格納部
34に格納されている音声モデルと照合する。そして、
照合の結果、最も尤度の高い音声モデルに対応する記号
列を認識結果として出力する。
た利用者の音声は、まず音響分析部32に送られる。音
響分析部32では、周知のように、音声を25m秒程度
のハミング窓などで10m秒毎に切り出し、ケプストラ
ム分析等の音響分析を行う。そして、音響ベクトル列を
生成し、音声照合部33に出力する。音声モデル格納部
34には、HMM(Hidden Markov Model)等の音声モデ
ルが予め格納されている。そこで、前記音響ベクトル列
が入力してくると、音声照合部33は音声モデル格納部
34に格納されている音声モデルと照合する。そして、
照合の結果、最も尤度の高い音声モデルに対応する記号
列を認識結果として出力する。
【0004】
【発明が解決しようとする課題】しかしながら、前記し
た従来技術では、利用者の電話端末から音声認識装置の
入り口である回線インタフェース31に至るまでの回線
接続状況と無関係に音声認識が行われることになる。す
なわち、前記回線接続状況と無関係に、音声照合部33
は音声モデル格納部34に格納されている音声モデルと
照合して音声認識をしていた。このため、回線により混
入される特殊な雑音や、移動体電話等の周波数特性が通
常の電話回線と大きく異なる状況では、満足のいく認識
性能が得られないという問題があった。
た従来技術では、利用者の電話端末から音声認識装置の
入り口である回線インタフェース31に至るまでの回線
接続状況と無関係に音声認識が行われることになる。す
なわち、前記回線接続状況と無関係に、音声照合部33
は音声モデル格納部34に格納されている音声モデルと
照合して音声認識をしていた。このため、回線により混
入される特殊な雑音や、移動体電話等の周波数特性が通
常の電話回線と大きく異なる状況では、満足のいく認識
性能が得られないという問題があった。
【0005】特に、国際回線を経由した音声を認識する
場合には、国により端末および回線事情が大きく異なる
ため、従来の音声認識装置で国際回線経由の音声を認識
することに困難があり、満足のいく認識性能が得られな
いという問題があった。
場合には、国により端末および回線事情が大きく異なる
ため、従来の音声認識装置で国際回線経由の音声を認識
することに困難があり、満足のいく認識性能が得られな
いという問題があった。
【0006】この発明の目的は、前記した従来技術の問
題点を除去し、回線状況に影響を受けることなく、高い
認識性能を期待することのできる電話音声認識装置を提
供することにある。
題点を除去し、回線状況に影響を受けることなく、高い
認識性能を期待することのできる電話音声認識装置を提
供することにある。
【0007】
【課題を解決するための手段】前記目的を達成するため
に、この発明は、回線を経由して入力してくる音声情報
を音声認識する電話音声認識装置において、前記回線に
接続され、回線接続情報を検出する回線インタフェース
と、回線特性あるいはルーティング特性に応じた雑音を
除去する手段を備えた複数個の音響分析部と、前記回線
インタフェースから出力された回線接続情報に基づいて
前記音響分析部を選択する回線接続情報処理部とを具備
した点に第1の特徴がある。また、この発明は、回線特
性あるいはルーティング特性に応じた音声モデルを格納
する複数個の音声モデル格納部を具備した点に第2の特
徴がある。
に、この発明は、回線を経由して入力してくる音声情報
を音声認識する電話音声認識装置において、前記回線に
接続され、回線接続情報を検出する回線インタフェース
と、回線特性あるいはルーティング特性に応じた雑音を
除去する手段を備えた複数個の音響分析部と、前記回線
インタフェースから出力された回線接続情報に基づいて
前記音響分析部を選択する回線接続情報処理部とを具備
した点に第1の特徴がある。また、この発明は、回線特
性あるいはルーティング特性に応じた音声モデルを格納
する複数個の音声モデル格納部を具備した点に第2の特
徴がある。
【0008】この発明によれば、回線接続情報に基づい
て適切な音響分析部を選択することができ、また音声モ
デルを選択することができるので、音声認識の性能を大
幅に向上することができる。
て適切な音響分析部を選択することができ、また音声モ
デルを選択することができるので、音声認識の性能を大
幅に向上することができる。
【0009】
【発明の実施の形態】以下に、図面を参照して、本発明
を詳細に説明する。図1は、本発明の一実施形態の構成
を示すブロック図である。
を詳細に説明する。図1は、本発明の一実施形態の構成
を示すブロック図である。
【0010】図示されているように、電話回線、ネット
ワークもしくは交換機などに、回線接続情報取得機能付
き回線インタフェース1が接続されている。該回線接続
情報取得機能付き回線インタフェース1は、相手先の電
話番号、PBXからの呼であるか否かの判別、特に国際
回線に接続された場合には、発信国、呼が辿ってきたル
ートの判別(例えば、衛星経由か海底ケーブル経由かの
判別)等の回線接続情報の検出を行うことができる。該
回線接続情報取得機能付き回線インタフェース1は、分
析した回線接続情報aを回線接続情報処理部2に送出す
ると共に、受信した音声情報bを第1のスイッチング部
3に送出する。
ワークもしくは交換機などに、回線接続情報取得機能付
き回線インタフェース1が接続されている。該回線接続
情報取得機能付き回線インタフェース1は、相手先の電
話番号、PBXからの呼であるか否かの判別、特に国際
回線に接続された場合には、発信国、呼が辿ってきたル
ートの判別(例えば、衛星経由か海底ケーブル経由かの
判別)等の回線接続情報の検出を行うことができる。該
回線接続情報取得機能付き回線インタフェース1は、分
析した回線接続情報aを回線接続情報処理部2に送出す
ると共に、受信した音声情報bを第1のスイッチング部
3に送出する。
【0011】前記回線接続情報処理部2は、回線接続情
報取得機能付き回線インタフェース1から受け取った回
線接続情報aにより、第1および第2のスイッチング部
3、6の切替えを制御し、第1または第2の音響分析部
4または5の選択を行う。第1および第2の音響分析部
4、5は、音声を25m秒程度のハミング窓などで10
m秒毎に切り出し、ケプストラム分析等の音響分析を行
い、音響ベクトル列を生成する働きをする。しかしなが
ら、呼の発信国あるいは呼が辿ってきたルートによって
は、例えばヨーロッパのある国からの呼の場合には、音
声信号中の特定の周波数に雑音が混入してくる。そこ
で、例えば第2の音響分析部5には、この雑音を除去す
るための例えばノッチフィルタを挿入し、該ノッチフィ
ルタで前記の雑音を除去した後の音声情報から音響ベク
トル列を生成するようにしている。第1の音響分析部4
は、前記雑音が混入されていない音声情報に対応するも
のである。図示の例では、音響分析部4、5は2個しか
示されていないが、これに限定されるものではなく、雑
音が混入している音声情報を3種類以上受信する場合に
は、3個以上の音響分析部を配置して、これに対応させ
ることができる。
報取得機能付き回線インタフェース1から受け取った回
線接続情報aにより、第1および第2のスイッチング部
3、6の切替えを制御し、第1または第2の音響分析部
4または5の選択を行う。第1および第2の音響分析部
4、5は、音声を25m秒程度のハミング窓などで10
m秒毎に切り出し、ケプストラム分析等の音響分析を行
い、音響ベクトル列を生成する働きをする。しかしなが
ら、呼の発信国あるいは呼が辿ってきたルートによって
は、例えばヨーロッパのある国からの呼の場合には、音
声信号中の特定の周波数に雑音が混入してくる。そこ
で、例えば第2の音響分析部5には、この雑音を除去す
るための例えばノッチフィルタを挿入し、該ノッチフィ
ルタで前記の雑音を除去した後の音声情報から音響ベク
トル列を生成するようにしている。第1の音響分析部4
は、前記雑音が混入されていない音声情報に対応するも
のである。図示の例では、音響分析部4、5は2個しか
示されていないが、これに限定されるものではなく、雑
音が混入している音声情報を3種類以上受信する場合に
は、3個以上の音響分析部を配置して、これに対応させ
ることができる。
【0012】次に、第1〜第3の音声モデル格納部7〜
9には、発信者の国名、ルーティング等に応じて作成さ
れたHMM等の音声モデルが格納されている。第3のス
イッチング部10は、前記回線接続情報処理部2からの
制御信号により、音声モデル格納部を選択し、音声照合
部11に接続する。音声照合部11は、第2のスイッチ
ング部6を介して入力されてきた音響ベクトル列cと、
前記選択された音声モデル格納部に格納されている音声
モデルdとを比較し、音声認識を行う。そして、音声認
識結果を出力する。
9には、発信者の国名、ルーティング等に応じて作成さ
れたHMM等の音声モデルが格納されている。第3のス
イッチング部10は、前記回線接続情報処理部2からの
制御信号により、音声モデル格納部を選択し、音声照合
部11に接続する。音声照合部11は、第2のスイッチ
ング部6を介して入力されてきた音響ベクトル列cと、
前記選択された音声モデル格納部に格納されている音声
モデルdとを比較し、音声認識を行う。そして、音声認
識結果を出力する。
【0013】この実施形態によれば、発信者の国名、ル
ーティング情報等の回線接続情報に応じて、実情に合っ
た音響分析部と音声モデル格納部とを選択することがで
きるので、回線特性や雑音特性に適合した音声認識を行
うことができるようになり、音声認識装置の性能を向上
させることができる。なお、前記第1〜第3の音声モデ
ル格納部7〜9に格納されている音声モデルは学習によ
りその品質を高めることができる。
ーティング情報等の回線接続情報に応じて、実情に合っ
た音響分析部と音声モデル格納部とを選択することがで
きるので、回線特性や雑音特性に適合した音声認識を行
うことができるようになり、音声認識装置の性能を向上
させることができる。なお、前記第1〜第3の音声モデ
ル格納部7〜9に格納されている音声モデルは学習によ
りその品質を高めることができる。
【0014】次に、本発明の第2の実施形態を、図2を
参照して説明する。この実施形態は、前記第1の実施形
態と比較して、第1〜第3の音声モデル格納部12〜1
4に特徴があり、他の構成は前記第1の実施形態と同様
である。そこで、該第1〜第3の音声モデル格納部12
〜14について、詳細に説明する。
参照して説明する。この実施形態は、前記第1の実施形
態と比較して、第1〜第3の音声モデル格納部12〜1
4に特徴があり、他の構成は前記第1の実施形態と同様
である。そこで、該第1〜第3の音声モデル格納部12
〜14について、詳細に説明する。
【0015】第1の音声モデル格納部12と第2の音声
モデル格納部13には、雑音モデルが格納されている。
すなわち、会話中には必ず音声の存在しない空白期間が
存在する。音声認識では、この空白期間を正しく認識
し、該空白期間を音声と誤認識しないようにすることが
重要である。しかしながら、ある国からの呼、あるいは
特定のルートを辿ってきた呼には、この空白期間に特有
の雑音が乗って来る。そこで、第1および第2の音声モ
デル格納部12、13には、この雑音のモデルが格納さ
れている。そして、この第1および第2の音声モデル格
納部12、13は、前記回線情報処理部2からの制御信
号により、第3のスイッチング部10によって選択さ
れ、音声照合部11に送られる。一方、音声モデル格納
部14には、発信国あるいは回線によらずに使用される
音声モデルが格納されている。すなわち、図3の音声モ
デル格納部34と同様のHMM等の音声モデルが格納さ
れている。音声照合部11は、前記第3のスイッチング
部10を経て得た雑音モデルにより会話の空白期間を認
識し、音声モデル格納部14から得た音声モデルにより
音声情報の照合計算を行い、実会話期間の音声を音声認
識する。そして、その認識結果を出力する。
モデル格納部13には、雑音モデルが格納されている。
すなわち、会話中には必ず音声の存在しない空白期間が
存在する。音声認識では、この空白期間を正しく認識
し、該空白期間を音声と誤認識しないようにすることが
重要である。しかしながら、ある国からの呼、あるいは
特定のルートを辿ってきた呼には、この空白期間に特有
の雑音が乗って来る。そこで、第1および第2の音声モ
デル格納部12、13には、この雑音のモデルが格納さ
れている。そして、この第1および第2の音声モデル格
納部12、13は、前記回線情報処理部2からの制御信
号により、第3のスイッチング部10によって選択さ
れ、音声照合部11に送られる。一方、音声モデル格納
部14には、発信国あるいは回線によらずに使用される
音声モデルが格納されている。すなわち、図3の音声モ
デル格納部34と同様のHMM等の音声モデルが格納さ
れている。音声照合部11は、前記第3のスイッチング
部10を経て得た雑音モデルにより会話の空白期間を認
識し、音声モデル格納部14から得た音声モデルにより
音声情報の照合計算を行い、実会話期間の音声を音声認
識する。そして、その認識結果を出力する。
【0016】なお、前記第1および第2の音声モデル格
納部12、13は学習を行い、雑音モデルを改善するこ
とができる。すなわち、電話回線等を介して受信した実
際の音声データを記憶手段に記憶しておき、回線の不使
用期間に該音声データを前記第1あるいは第2の音響分
析部4または5に入力し、その出力の雑音データを採取
することにより、学習をすることができる。この学習効
果により、前記第1および第2の音声モデル格納部1
2、13の雑音モデルを改善することができる。
納部12、13は学習を行い、雑音モデルを改善するこ
とができる。すなわち、電話回線等を介して受信した実
際の音声データを記憶手段に記憶しておき、回線の不使
用期間に該音声データを前記第1あるいは第2の音響分
析部4または5に入力し、その出力の雑音データを採取
することにより、学習をすることができる。この学習効
果により、前記第1および第2の音声モデル格納部1
2、13の雑音モデルを改善することができる。
【0017】前記の実施形態では、音声モデル格納部1
4は、発信国あるいは回線によらずに使用される音声モ
デルが格納されているとしたが、本発明はこれに限定さ
れず、発信国あるいは回線に依存する音声モデルを格納
した音声モデル格納部を複数個容易し、該音声モデル格
納部も前記回線接続情報処理部2からの制御信号により
切り替えるようにしてもよい。
4は、発信国あるいは回線によらずに使用される音声モ
デルが格納されているとしたが、本発明はこれに限定さ
れず、発信国あるいは回線に依存する音声モデルを格納
した音声モデル格納部を複数個容易し、該音声モデル格
納部も前記回線接続情報処理部2からの制御信号により
切り替えるようにしてもよい。
【0018】次に、本実施態様の動作を説明する。い
ま、国際電話回線等を介して着信呼があると、回線接続
情報取得機能付き回線インタフェース1は、その発信電
話番号等から発呼者の国あるいは都市名、呼が辿ってき
たルートを検出する。そして、該検出した回線接続情報
aを回線接続情報処理部2に通知する。また、該回線イ
ンタフェース1は、音声情報bを第1のスイッチング部
3へ送出する。回線接続情報処理部2は前記回線接続情
報aを受信すると、前記第1、第2のスイッチング部
3、6の選択制御信号と、第3のスイッチング部10の
選択制御信号とを、該回線接続情報aに基づいて出力す
る。例えば、発呼者国あるいは都市名が特定のものでな
ければ、図示されているように、第1の音響分析部4の
選択と、第1の音声モデル格納部12を選択する制御信
号を出力する。
ま、国際電話回線等を介して着信呼があると、回線接続
情報取得機能付き回線インタフェース1は、その発信電
話番号等から発呼者の国あるいは都市名、呼が辿ってき
たルートを検出する。そして、該検出した回線接続情報
aを回線接続情報処理部2に通知する。また、該回線イ
ンタフェース1は、音声情報bを第1のスイッチング部
3へ送出する。回線接続情報処理部2は前記回線接続情
報aを受信すると、前記第1、第2のスイッチング部
3、6の選択制御信号と、第3のスイッチング部10の
選択制御信号とを、該回線接続情報aに基づいて出力す
る。例えば、発呼者国あるいは都市名が特定のものでな
ければ、図示されているように、第1の音響分析部4の
選択と、第1の音声モデル格納部12を選択する制御信
号を出力する。
【0019】この結果、前記回線インタフェース1を通
って入力してきた音声情報はこれに適合した第1の音響
分析部4により音響分析をされ、第1の音声モデル格納
部12に格納されている雑音モデルにより会話の空白期
間の検出が行われ、かつ音声モデル格納部14に格納さ
れている音声モデルにより音声認識されることになる。
しかしながら、特定の国から発信された呼あるいは特
定のルートを辿ってきた呼の場合には、前記第2の音響
分析部5と音声モデル格納部13とが選択される。この
結果、該特定の国から発信された呼あるいは特定のルー
トを辿ってきた呼に対しても、適切な音響分析部の選択
と、音声モデルの選択を行うことができるようになり、
音声認識の性能を向上することができるようになる。
って入力してきた音声情報はこれに適合した第1の音響
分析部4により音響分析をされ、第1の音声モデル格納
部12に格納されている雑音モデルにより会話の空白期
間の検出が行われ、かつ音声モデル格納部14に格納さ
れている音声モデルにより音声認識されることになる。
しかしながら、特定の国から発信された呼あるいは特
定のルートを辿ってきた呼の場合には、前記第2の音響
分析部5と音声モデル格納部13とが選択される。この
結果、該特定の国から発信された呼あるいは特定のルー
トを辿ってきた呼に対しても、適切な音響分析部の選択
と、音声モデルの選択を行うことができるようになり、
音声認識の性能を向上することができるようになる。
【0020】以上のように、この実施形態によれば、発
呼者の国名や、呼の辿ってきたルートに合わせて音響分
析部および音声モデル格納部を切り替えることが可能に
なり、高い認識性能を提供できるようになる。ある特定
の国からの公衆電話には、断続的な挿入信号が入ってく
るが、本実施形態によれば、該挿入信号も前記音響分析
部を選択することにより除去することが可能になる。ま
た、国内においても、特定の局番は移動体電話であるこ
とが予めわかっているから、そこからの接続である場合
は、移動体電話用の音声モデルを選択して使用するよう
にすることにより、高い認識性能を達成することができ
るようになる。
呼者の国名や、呼の辿ってきたルートに合わせて音響分
析部および音声モデル格納部を切り替えることが可能に
なり、高い認識性能を提供できるようになる。ある特定
の国からの公衆電話には、断続的な挿入信号が入ってく
るが、本実施形態によれば、該挿入信号も前記音響分析
部を選択することにより除去することが可能になる。ま
た、国内においても、特定の局番は移動体電話であるこ
とが予めわかっているから、そこからの接続である場合
は、移動体電話用の音声モデルを選択して使用するよう
にすることにより、高い認識性能を達成することができ
るようになる。
【0021】
【発明の効果】以上の説明から明らかなように、この発
明によれば、発信者の電話番号あるいはルーティング情
報等の回線接続情報に応じて、音響分析部や音声モデル
を選択することができるので、回線特性や雑音特性に適
合した音声認識が可能になる。この結果、音声認識の性
能を大幅に向上することができる。
明によれば、発信者の電話番号あるいはルーティング情
報等の回線接続情報に応じて、音響分析部や音声モデル
を選択することができるので、回線特性や雑音特性に適
合した音声認識が可能になる。この結果、音声認識の性
能を大幅に向上することができる。
【図1】 本発明の第1の実施形態の構成を示すブロッ
ク図である。
ク図である。
【図2】 本発明の第2の実施形態の構成を示すブロッ
ク図である。
ク図である。
【図3】 従来の音声認識装置の一例を示すブロック図
である。
である。
1…回線接続情報取得機能付き回線インタフェース、2
…回線接続情報処理部、3、6…第1、第2のスイッチ
ング部、4、5…第1、第2の音響分析部、7〜9、1
2〜14…音声モデル格納部、10…第3のスイッチン
グ部、11…音声照合部。
…回線接続情報処理部、3、6…第1、第2のスイッチ
ング部、4、5…第1、第2の音響分析部、7〜9、1
2〜14…音声モデル格納部、10…第3のスイッチン
グ部、11…音声照合部。
───────────────────────────────────────────────────── フロントページの続き (51)Int.Cl.6 識別記号 庁内整理番号 FI 技術表示箇所 H04M 3/42 H04M 3/42 P (72)発明者 酒寄 信一 東京都新宿区西新宿2丁目3番2号 国際 電信電話株式会社内 (72)発明者 藤岡 雅宣 東京都新宿区西新宿2丁目3番2号 国際 電信電話株式会社内
Claims (5)
- 【請求項1】 回線を経由して入力してくる音声情報を
音声認識する電話音声認識装置において、 前記回線に接続され、回線接続情報を検出する回線イン
タフェースと、 回線特性あるいはルーティング特性に応じた雑音を除去
する手段を備えた複数個の音響分析部と、 前記回線インタフェースから出力された回線接続情報に
基づいて前記音響分析部を選択する回線接続情報処理部
とを具備したことを特徴とする電話音声認識装置。 - 【請求項2】 請求項1記載の電話音声認識装置におい
て、 さらに、回線特性あるいはルーティング特性に応じた音
声モデルを格納する複数個の音声モデル格納部を具備
し、 前記回線接続情報処理部からの選択信号により、該音声
モデル格納部を選択して使用するようにしたことを特徴
とする電話音声認識装置。 - 【請求項3】 請求項2記載の電話音声認識装置におい
て、 前記音声モデル格納部に、回線に依存する音声モデルが
格納されていることを特徴とする電話音声認識装置。 - 【請求項4】 請求項2記載の電話音声認識装置におい
て、 前記音声モデル格納部に、会話の空白期間に発生する雑
音モデルが格納されており、音声照合部は該雑音モデル
から会話の空白期間を認識するようにしたことを特徴と
する電話音声認識装置。 - 【請求項5】 請求項3または4記載の電話音声認識装
置において、 前記音声モデル格納部に格納される音声モデルを学習さ
せるようにすることを特徴とする電話音声認識装置。
Priority Applications (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP8239938A JPH1063293A (ja) | 1996-08-23 | 1996-08-23 | 電話音声認識装置 |
| US08/892,606 US5960063A (en) | 1996-08-23 | 1997-07-14 | Telephone speech recognition system |
| GB9717929A GB2316575B (en) | 1996-08-23 | 1997-08-22 | Telephone speech recognition system |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP8239938A JPH1063293A (ja) | 1996-08-23 | 1996-08-23 | 電話音声認識装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH1063293A true JPH1063293A (ja) | 1998-03-06 |
Family
ID=17052061
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP8239938A Pending JPH1063293A (ja) | 1996-08-23 | 1996-08-23 | 電話音声認識装置 |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US5960063A (ja) |
| JP (1) | JPH1063293A (ja) |
| GB (1) | GB2316575B (ja) |
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2002287788A (ja) * | 2001-03-23 | 2002-10-04 | Ricoh Co Ltd | 録音周波数特性測定方法、録音周波数特性変換方法および音声認識方法 |
| JP2003504653A (ja) * | 1999-07-01 | 2003-02-04 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | ノイズのある音声モデルからのロバスト音声処理 |
| WO2007091462A1 (ja) * | 2006-02-06 | 2007-08-16 | Nec Corporation | 音声認識装置、音声認識方法、及び音声認識用プログラム |
Families Citing this family (14)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB9620082D0 (en) | 1996-09-26 | 1996-11-13 | Eyretel Ltd | Signal monitoring apparatus |
| US6483896B1 (en) * | 1998-02-05 | 2002-11-19 | At&T Corp. | Speech recognition using telephone call parameters |
| NL1012148C2 (nl) * | 1999-05-25 | 2000-11-28 | Koninkl Kpn Nv | Spraakverwerkend systeem. |
| JP3969908B2 (ja) | 1999-09-14 | 2007-09-05 | キヤノン株式会社 | 音声入力端末器、音声認識装置、音声通信システム及び音声通信方法 |
| US7689416B1 (en) | 1999-09-29 | 2010-03-30 | Poirier Darrell A | System for transferring personalize matter from one computer to another |
| US7110952B2 (en) * | 1999-12-07 | 2006-09-19 | Kursh Steven R | Computer accounting method using natural language speech recognition |
| US7047192B2 (en) * | 2000-06-28 | 2006-05-16 | Poirier Darrell A | Simultaneous multi-user real-time speech recognition system |
| AU2001286937A1 (en) | 2000-09-01 | 2002-03-13 | Eliza Corporation | Sppech recognition method and system to determine the status of an outbound telephone call |
| AU2002213338A1 (en) * | 2000-10-16 | 2002-04-29 | Eliza Corporation | Method of and system for providing adaptive respondent training in a speech recognition application |
| EP1400953B1 (en) * | 2002-09-12 | 2013-03-20 | me2me AG | Method for building speech and/or language recognition models |
| GB2395330A (en) * | 2002-10-18 | 2004-05-19 | Eckoh Technologies | Telephone voting system |
| US7437294B1 (en) * | 2003-11-21 | 2008-10-14 | Sprint Spectrum L.P. | Methods for selecting acoustic model for use in a voice command platform |
| EP3281249A4 (en) | 2015-04-08 | 2018-12-26 | Fractal Antenna Systems Inc. | Fractal plasmonic surface reader antennas |
| US11487501B2 (en) * | 2018-05-16 | 2022-11-01 | Snap Inc. | Device control using audio data |
Family Cites Families (15)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6340434A (ja) * | 1986-08-06 | 1988-02-20 | Kazuo Hashimoto | 人工知能機能付留守番電話装置 |
| IT1211194B (it) * | 1987-07-10 | 1989-10-12 | Olivetti & Co Spa | Sistema di misura e compensazione automatica delle distorsioni di un collegamento tra un apparecchio telefonico e un unita centrale di trattamento voce |
| JPH0362800A (ja) * | 1989-07-31 | 1991-03-18 | Toshiba Corp | 音声リモートコントロール装置 |
| JPH03120598A (ja) * | 1989-10-03 | 1991-05-22 | Canon Inc | 音声認識方法及び装置 |
| US5274695A (en) * | 1991-01-11 | 1993-12-28 | U.S. Sprint Communications Company Limited Partnership | System for verifying the identity of a caller in a telecommunications network |
| US5369685A (en) * | 1991-03-07 | 1994-11-29 | Sprint Communications Company L.P. | Voice-activated telephone directory and call placement system |
| GB2260670A (en) * | 1991-10-18 | 1993-04-21 | * Norm Pacific Automation Corporation | Multi-functional telephone system with speech recognition and control device |
| US5758021A (en) * | 1992-06-12 | 1998-05-26 | Alcatel N.V. | Speech recognition combining dynamic programming and neural network techniques |
| US5553119A (en) * | 1994-07-07 | 1996-09-03 | Bell Atlantic Network Services, Inc. | Intelligent recognition of speech signals using caller demographics |
| US5764759A (en) * | 1994-10-06 | 1998-06-09 | Dialogic Corporation | Call processing using previously obtained line characteristics |
| US5812972A (en) * | 1994-12-30 | 1998-09-22 | Lucent Technologies Inc. | Adaptive decision directed speech recognition bias equalization method and apparatus |
| DE19500494C2 (de) * | 1995-01-10 | 1997-01-23 | Siemens Ag | Merkmalsextraktionsverfahren für ein Sprachsignal |
| JP3008799B2 (ja) * | 1995-01-26 | 2000-02-14 | 日本電気株式会社 | 音声適応化装置,単語音声認識装置,連続音声認識装置およびワードスポッティング装置 |
| US5721808A (en) * | 1995-03-06 | 1998-02-24 | Nippon Telegraph And Telephone Corporation | Method for the composition of noise-resistant hidden markov models for speech recognition and speech recognizer using the same |
| US5806029A (en) * | 1995-09-15 | 1998-09-08 | At&T Corp | Signal conditioned minimum error rate training for continuous speech recognition |
-
1996
- 1996-08-23 JP JP8239938A patent/JPH1063293A/ja active Pending
-
1997
- 1997-07-14 US US08/892,606 patent/US5960063A/en not_active Expired - Fee Related
- 1997-08-22 GB GB9717929A patent/GB2316575B/en not_active Expired - Fee Related
Cited By (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2003504653A (ja) * | 1999-07-01 | 2003-02-04 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | ノイズのある音声モデルからのロバスト音声処理 |
| JP4818556B2 (ja) * | 1999-07-01 | 2011-11-16 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | 確率論的ロバスト音声処理 |
| JP2002287788A (ja) * | 2001-03-23 | 2002-10-04 | Ricoh Co Ltd | 録音周波数特性測定方法、録音周波数特性変換方法および音声認識方法 |
| WO2007091462A1 (ja) * | 2006-02-06 | 2007-08-16 | Nec Corporation | 音声認識装置、音声認識方法、及び音声認識用プログラム |
| JP4905361B2 (ja) * | 2006-02-06 | 2012-03-28 | 日本電気株式会社 | 音声認識装置、音声認識方法、及び音声認識用プログラム |
| US9165557B2 (en) | 2006-02-06 | 2015-10-20 | Nec Corporation | Voice recognizing apparatus, voice recognizing method, and program for recognizing voice |
Also Published As
| Publication number | Publication date |
|---|---|
| GB2316575B (en) | 1998-10-07 |
| GB9717929D0 (en) | 1997-10-29 |
| GB2316575A (en) | 1998-02-25 |
| US5960063A (en) | 1999-09-28 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US10320982B2 (en) | Speech recognition method of and system for determining the status of an answered telephone during the course of an outbound telephone call | |
| US8175874B2 (en) | Personalized voice activity detection | |
| US6687673B2 (en) | Speech recognition system | |
| US6744860B1 (en) | Methods and apparatus for initiating a voice-dialing operation | |
| JPH09106296A (ja) | 音声認識装置及び方法 | |
| JP2011022600A (ja) | 音声認識システムの動作方法 | |
| US5960063A (en) | Telephone speech recognition system | |
| JP2001308970A (ja) | 携帯電話の音声認識操作方法及びシステム | |
| JP2001075580A (ja) | 音声認識方法および音声認識装置 | |
| US20030088403A1 (en) | Call classification by automatic recognition of speech | |
| US20050278177A1 (en) | Techniques for interaction with sound-enabled system or service | |
| JPH08163252A (ja) | Pbx−コンピュータ連動システム | |
| US7643992B2 (en) | Method, system and device for automatic recognition of limited speech | |
| US20030081756A1 (en) | Multi-detector call classifier | |
| JP2000010590A (ja) | 音声認識装置およびその制御方法 | |
| JPH07110021B2 (ja) | 対話形音声応答装置 | |
| JP3088625B2 (ja) | 電話応答システム | |
| CN114679515B (zh) | 外呼系统的接通时刻点判定方法、装置、设备和存储介质 | |
| JP2002252705A (ja) | 話者id検出方法及び装置 | |
| KR100674799B1 (ko) | 화자종속 고립단어 음성인식을 통한 안내전화번호 자동다이얼링 방법 | |
| CA2712853C (en) | Speech recognition method and system to determine the status of an outbound telephone call | |
| JPH08331228A (ja) | 音声認識装置試験用電話機 | |
| JPH05219176A (ja) | 音声認識電話機 | |
| Guojun et al. | An automatic telephone operator using speech recognition | |
| JPS61107399A (ja) | 音声認識装置 |