JPH03274098A - 雑音除去方式 - Google Patents
雑音除去方式Info
- Publication number
- JPH03274098A JPH03274098A JP2074689A JP7468990A JPH03274098A JP H03274098 A JPH03274098 A JP H03274098A JP 2074689 A JP2074689 A JP 2074689A JP 7468990 A JP7468990 A JP 7468990A JP H03274098 A JPH03274098 A JP H03274098A
- Authority
- JP
- Japan
- Prior art keywords
- signal
- section
- noise
- electroacoustic transducer
- acoustic
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Landscapes
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
- Circuit For Audible Band Transducer (AREA)
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
枝先分立
本発明は、音声!!識装置、より詳細には、高雑音環境
での音声認識における雑音除去技術に関し、例えば、自
動車内での、ダイヤリング、オーディオ機器の制御、ニ
アコンディショナーの制御、ナビゲーションシステムの
制御等のための音声L&識装置に適用して好適なもので
あり、更には、家庭内、事務所内などでも応用可能なも
のである。
での音声認識における雑音除去技術に関し、例えば、自
動車内での、ダイヤリング、オーディオ機器の制御、ニ
アコンディショナーの制御、ナビゲーションシステムの
制御等のための音声L&識装置に適用して好適なもので
あり、更には、家庭内、事務所内などでも応用可能なも
のである。
史来挟先
近年、音声による情報入力手段が注目を集めているが、
自動車内においても、自動車電話の発呼、オーディオ機
器の制御、ニアコンディショナーの制御、ナビゲーショ
ンシステムの制御等のための音声認識技術を応用するこ
とが考えられている。
自動車内においても、自動車電話の発呼、オーディオ機
器の制御、ニアコンディショナーの制御、ナビゲーショ
ンシステムの制御等のための音声認識技術を応用するこ
とが考えられている。
しかしながら、自動車内の音声認識は、エンジン音、タ
イヤの走行音、あるいは、ラジオ、ステレオの再生音が
雑音として音声信号に混入することと、運転中に接話型
マイクなどの口との距離の近いマイクが装着できないた
め、音声信号とノイズとの比、即ち、S/Nが悪いこと
が問題となり、雑音除去技術が不可欠なものとなってい
る。
イヤの走行音、あるいは、ラジオ、ステレオの再生音が
雑音として音声信号に混入することと、運転中に接話型
マイクなどの口との距離の近いマイクが装着できないた
め、音声信号とノイズとの比、即ち、S/Nが悪いこと
が問題となり、雑音除去技術が不可欠なものとなってい
る。
従来の音声認識における雑音除去技術としては。
S、F、Bollをはじめとするスペクトラルサブトラ
クション法、 B、 11idrovをはじめとするア
ダプテイブノイズキャンセリング等がある。
クション法、 B、 11idrovをはじめとするア
ダプテイブノイズキャンセリング等がある。
しかしながら、スペクトラルサブトラクション法は、時
間非定常な雑音に弱く、例えば、ラジオ。
間非定常な雑音に弱く、例えば、ラジオ。
ステレオの再生音(音声や楽音)のように、音声帯域で
時間非定常な雑音が大きい場合は、まず、音声区間検出
も十分にできず、音声区間検出ができたとしても、推定
雑音成分量が実際の雑音成分と異なるという欠点がある
。また、アダプティブノイズキャンセリングは、2人力
、即ち、2本のマイクを用いた場合、複数の雑音源から
の合成された雑音に対してうまく対応ができないという
欠点があり、であるからといって、マイクの本数をいた
ずらに増やしても、信号処理の量が膨大になり、かつ、
コスト高になり実用化が困難になるという欠点がある。
時間非定常な雑音が大きい場合は、まず、音声区間検出
も十分にできず、音声区間検出ができたとしても、推定
雑音成分量が実際の雑音成分と異なるという欠点がある
。また、アダプティブノイズキャンセリングは、2人力
、即ち、2本のマイクを用いた場合、複数の雑音源から
の合成された雑音に対してうまく対応ができないという
欠点があり、であるからといって、マイクの本数をいた
ずらに増やしても、信号処理の量が膨大になり、かつ、
コスト高になり実用化が困難になるという欠点がある。
また、ラジオ、ステレオなどのスピーカから再生される
音(音声認識装置にとっては雑音〉に関しては、マイク
からの入力から、スピーカに送られる信号に適当なゲイ
ンをかけたものを差し引く方法も考えられるが、スピー
カからマイクまでの遅延や、周囲の反射音があるために
、時間波形上で単純に両者の差を取っても効果は期待で
きない。
音(音声認識装置にとっては雑音〉に関しては、マイク
からの入力から、スピーカに送られる信号に適当なゲイ
ンをかけたものを差し引く方法も考えられるが、スピー
カからマイクまでの遅延や、周囲の反射音があるために
、時間波形上で単純に両者の差を取っても効果は期待で
きない。
さらにマイクの入力から、スピーカに入力される電気信
号を補正して、補正することも考えられるが、自動車内
等の狭い空間を考える場合、その中に存在する人間の数
によって補正の仕方が異なってくると言う問題があった
。
号を補正して、補正することも考えられるが、自動車内
等の狭い空間を考える場合、その中に存在する人間の数
によって補正の仕方が異なってくると言う問題があった
。
且−一攻
本発明は、上述のごとき従来技術の欠点に鑑みて威され
たもので、特に、音声を入力するためのマイク付近で発
生する音声帯域で、かつ1時間非定常性の強いラジオ、
ステレオなどの再生音が雑音として音声信号に重畳して
いても、適切にこの雑音を除去し、このような雑音環境
下での良好な音声認識を実現することを目的としてなさ
れたものである。
たもので、特に、音声を入力するためのマイク付近で発
生する音声帯域で、かつ1時間非定常性の強いラジオ、
ステレオなどの再生音が雑音として音声信号に重畳して
いても、適切にこの雑音を除去し、このような雑音環境
下での良好な音声認識を実現することを目的としてなさ
れたものである。
璽−一」又
本発明は、上記目的を遠戚するために、音声認識用の音
響収集部に、認識させたい音声信号と、その近傍に置か
れた電気音響変換器から再生される不要な信号が混入し
、入力された音声信号の中から、不要な信号を除去する
雑音除去方式において、(1)前記電気音響変換器から
音声認識用の音響収集部までの複数種類の音響伝搬特性
あるいはそれに準ずるものを記憶する記憶手段をもち、
音声認識用の音響収集部で入力される、雑音を含んだ音
声から特徴量を抽出する第1の特徴量抽出部と、上記音
響収集部の近傍に置かれた電気音響変換器から再生する
為に利用する電気(Q号を第1の特徴抽出部と同じ特徴
に変換する第2の特徴量抽出部と(第1と第2が同じも
のであっても良い)、上記第2または第1の特徴量抽出
部で抽出された特徴量に前記記憶手段に記憶された音響
伝搬特性の一つの補正をした後、第1または第2の特徴
量抽出部で抽出された信号から除去するようにしたこと
を特徴としたものであり、更には、(2)上記音声収集
部の周囲に置かれた電気音響変換器が複数個ある場合に
、それぞれの電気音響変換器から再生するための電気音
響変換器再生用信号に、上記それぞれの電気音響変換器
と上記音声収集部との予め定められた位置関係で予め測
定された上記それぞれの電気音響変換器再生用信号と上
記音声収集部から入力される信号間の伝達関数に相当す
るそれぞれの処理を行った信号をすべて加算した信号の
特徴量を電気音響変換器再生用信号による雑音の特徴量
とすることを特徴としたものである。以下、本発明の実
施例に基づいて説明する。
響収集部に、認識させたい音声信号と、その近傍に置か
れた電気音響変換器から再生される不要な信号が混入し
、入力された音声信号の中から、不要な信号を除去する
雑音除去方式において、(1)前記電気音響変換器から
音声認識用の音響収集部までの複数種類の音響伝搬特性
あるいはそれに準ずるものを記憶する記憶手段をもち、
音声認識用の音響収集部で入力される、雑音を含んだ音
声から特徴量を抽出する第1の特徴量抽出部と、上記音
響収集部の近傍に置かれた電気音響変換器から再生する
為に利用する電気(Q号を第1の特徴抽出部と同じ特徴
に変換する第2の特徴量抽出部と(第1と第2が同じも
のであっても良い)、上記第2または第1の特徴量抽出
部で抽出された特徴量に前記記憶手段に記憶された音響
伝搬特性の一つの補正をした後、第1または第2の特徴
量抽出部で抽出された信号から除去するようにしたこと
を特徴としたものであり、更には、(2)上記音声収集
部の周囲に置かれた電気音響変換器が複数個ある場合に
、それぞれの電気音響変換器から再生するための電気音
響変換器再生用信号に、上記それぞれの電気音響変換器
と上記音声収集部との予め定められた位置関係で予め測
定された上記それぞれの電気音響変換器再生用信号と上
記音声収集部から入力される信号間の伝達関数に相当す
るそれぞれの処理を行った信号をすべて加算した信号の
特徴量を電気音響変換器再生用信号による雑音の特徴量
とすることを特徴としたものである。以下、本発明の実
施例に基づいて説明する。
第1図は1本発明の一実施例を説明するための構成図で
、図中、1はマイク、2はマイクlの周囲に置かれたス
ピーカ、10はマイク1から入力された雑音を含む音声
の特徴量を抽出する第1の特徴量抽出部、20はスピー
カ再生用信号による雑音の特徴量を抽出する第2の特徴
量抽出部、30は第1の雑音除去部、40は音声区間検
出部。
、図中、1はマイク、2はマイクlの周囲に置かれたス
ピーカ、10はマイク1から入力された雑音を含む音声
の特徴量を抽出する第1の特徴量抽出部、20はスピー
カ再生用信号による雑音の特徴量を抽出する第2の特徴
量抽出部、30は第1の雑音除去部、40は音声区間検
出部。
50は雑音推定部、60は第2の雑音除去部、70は入
カバターン生戒部、80は標準パターンメモリ、90は
認識部で、請求項第1項に記載の発明は、音声認識用の
音響収集部1に、認識させたい音声と、該音響収集部1
近傍に置かれた電気音響変換器2から再生される不要な
信号が混入し、入力された音声信号の中から、不要な信
号を除去する雑音除去方式において、前記電気音響変換
器2から音声認識用の音響収集部1までの複数種類の音
響伝搬特性あるいは、それに準ずるものを記憶する記憶
手段28をもち、音声認識用の音響収集部1で入力され
る、雑音を含んだ音声から特徴量を抽出する彫工の特徴
量抽出部10と、上記音響収集部1の近傍に置かれた電
気音響変換器2から再生する為に利用する電気信号を第
1の特徴抽出部と同じ特徴に変換する第2の特徴量抽出
部20と(第1と第2が同じものであっても良い)と、
上記第2または第1の特徴量抽出部で抽出された特徴量
に前記記憶された音響伝搬特性の一つの補正をした後、
第1または第2の特徴量抽出部で抽出された信隆から除
去するようにして雑音を除去するようにしたものである
。
カバターン生戒部、80は標準パターンメモリ、90は
認識部で、請求項第1項に記載の発明は、音声認識用の
音響収集部1に、認識させたい音声と、該音響収集部1
近傍に置かれた電気音響変換器2から再生される不要な
信号が混入し、入力された音声信号の中から、不要な信
号を除去する雑音除去方式において、前記電気音響変換
器2から音声認識用の音響収集部1までの複数種類の音
響伝搬特性あるいは、それに準ずるものを記憶する記憶
手段28をもち、音声認識用の音響収集部1で入力され
る、雑音を含んだ音声から特徴量を抽出する彫工の特徴
量抽出部10と、上記音響収集部1の近傍に置かれた電
気音響変換器2から再生する為に利用する電気信号を第
1の特徴抽出部と同じ特徴に変換する第2の特徴量抽出
部20と(第1と第2が同じものであっても良い)と、
上記第2または第1の特徴量抽出部で抽出された特徴量
に前記記憶された音響伝搬特性の一つの補正をした後、
第1または第2の特徴量抽出部で抽出された信隆から除
去するようにして雑音を除去するようにしたものである
。
更に詳細に説明すると、第1の特徴量抽出部10は、自
動車内に設置され音声を入力するためのマイク1から入
力される雑音を含む音声の特徴量を抽出するもので、マ
イクアンプ11は、増幅を行ない、プリエンファシス1
2は、高域を強調し、バンドパスフィルタバンク13は
、250Hzから6.35KHzまで対数軸上で等間隔
に配置された15個の周波数を中心周波数とするバント
パスフィルタ群と、その各帯域毎の整流器、ローパスフ
ィルタから成り、スペクトルを求める。マルチプレクサ
14は、上記の各部域のデータを切り替え、A/Dコン
バータ15は、10a+sのサンプリング周期で各帯域
毎のデータをデジタル化する。
動車内に設置され音声を入力するためのマイク1から入
力される雑音を含む音声の特徴量を抽出するもので、マ
イクアンプ11は、増幅を行ない、プリエンファシス1
2は、高域を強調し、バンドパスフィルタバンク13は
、250Hzから6.35KHzまで対数軸上で等間隔
に配置された15個の周波数を中心周波数とするバント
パスフィルタ群と、その各帯域毎の整流器、ローパスフ
ィルタから成り、スペクトルを求める。マルチプレクサ
14は、上記の各部域のデータを切り替え、A/Dコン
バータ15は、10a+sのサンプリング周期で各帯域
毎のデータをデジタル化する。
従って、第1の特徴量抽出部10に入力された信号は、
マイクアンプ11、プリエンファシス12、バンドパス
フィルタバンク13、マルチプレクサ14、A/Dコン
バータ15を経て、雑音を含む音声のタイムスペクトル
パターンX (tt f)(ここで、しは時間軸、fは
周波数軸である)となる。また、第2の特徴量抽出部2
0は、マイク1の周囲に置かれたスピーカ2から再生さ
れるためのスピーカ再生用信号を用いてスピーカ再生用
信号による雑音の特yIl量を抽出するもので、プリエ
ンファシス22は、プリエンファシス12と同様に高域
を強調し、バンドパスフィルタバンク23は、バンドパ
スフィルタバンク13と同様にしてスピーカ再生用信号
のスペクトルを求め、マルチプレクサ24は、マルチプ
レクサ14と同様にして各帯域のデータを切り換え、A
/Dコンバータ25は、A/Dコンバータ15と同様に
して各征域毎のデータをデジタル化する。第2の特徴量
抽出部20に入力された信号は、プリエンファシス22
、バンドパスフィルタバンク23.マルチプレクサ24
、A/Dコンバータ25を経て、スピーカ再生用信号の
タイムスペクトルパターンN (t、f)となる。更に
、例えば、このスピーカ再生用信号のタイムスペクトル
パターンN(t。
マイクアンプ11、プリエンファシス12、バンドパス
フィルタバンク13、マルチプレクサ14、A/Dコン
バータ15を経て、雑音を含む音声のタイムスペクトル
パターンX (tt f)(ここで、しは時間軸、fは
周波数軸である)となる。また、第2の特徴量抽出部2
0は、マイク1の周囲に置かれたスピーカ2から再生さ
れるためのスピーカ再生用信号を用いてスピーカ再生用
信号による雑音の特yIl量を抽出するもので、プリエ
ンファシス22は、プリエンファシス12と同様に高域
を強調し、バンドパスフィルタバンク23は、バンドパ
スフィルタバンク13と同様にしてスピーカ再生用信号
のスペクトルを求め、マルチプレクサ24は、マルチプ
レクサ14と同様にして各帯域のデータを切り換え、A
/Dコンバータ25は、A/Dコンバータ15と同様に
して各征域毎のデータをデジタル化する。第2の特徴量
抽出部20に入力された信号は、プリエンファシス22
、バンドパスフィルタバンク23.マルチプレクサ24
、A/Dコンバータ25を経て、スピーカ再生用信号の
タイムスペクトルパターンN (t、f)となる。更に
、例えば、このスピーカ再生用信号のタイムスペクトル
パターンN(t。
f)と、予め測定され伝達関数メモリ28に記憶された
スピーカ2とマイク1間の伝達関数H(f)との積N(
t、f)・H(f )が乗算器27で計算され、スピー
カ再生用信号による雑音のタイムスペクトルパターン N1(t、f)=N(t、f) ・I−(r(f)とな
る。なお、伝達関数H(f)の添え字rは、伝連関数が
複数あるとき、その種類を表すものとする。スピーカ2
とマイク1間の伝達関数Hr(f)は。
スピーカ2とマイク1間の伝達関数H(f)との積N(
t、f)・H(f )が乗算器27で計算され、スピー
カ再生用信号による雑音のタイムスペクトルパターン N1(t、f)=N(t、f) ・I−(r(f)とな
る。なお、伝達関数H(f)の添え字rは、伝連関数が
複数あるとき、その種類を表すものとする。スピーカ2
とマイク1間の伝達関数Hr(f)は。
第2の特徴量抽出部20に入力されるスピーカ再生用信
号にインパルス信号を与えて、スピーカ2を介して再生
された音をマイク1から収音して得られるインパルス応
答をフーリエ変換して予め求めることができる。または
、スピーカからホワイトノイズのような周波数帯域の広
い信号を出したり、周波数スィーブ信号を再生して、そ
のときにマイクから収拾される信号との関係を調べるこ
とによって求めることができる。ただし、部屋の中に居
る人間の数等で伝達関数が大きく変化することが考えら
れるので、人数によって関数がどのような変化をするか
を調べておく必要がある。その調べた結果を複数保持し
ておく。
号にインパルス信号を与えて、スピーカ2を介して再生
された音をマイク1から収音して得られるインパルス応
答をフーリエ変換して予め求めることができる。または
、スピーカからホワイトノイズのような周波数帯域の広
い信号を出したり、周波数スィーブ信号を再生して、そ
のときにマイクから収拾される信号との関係を調べるこ
とによって求めることができる。ただし、部屋の中に居
る人間の数等で伝達関数が大きく変化することが考えら
れるので、人数によって関数がどのような変化をするか
を調べておく必要がある。その調べた結果を複数保持し
ておく。
第1の雑音除去部30は、第1の特徴量抽出部10で抽
出された雑音を含む音声のタイムスペクトルパターンX
(t、f)から第2の特徴量抽出部20で抽出されたス
ピーカ再生用信号による雑音のタイムスペクトルパター
ンN1(t、f)を減じ、雑音を含む音声信号からスピ
ーカ再生用信号による雑音を除去したタイムスペクトル
パターンxi(t、f)=X(t、f)−Nl(t、f
)を生成する。
出された雑音を含む音声のタイムスペクトルパターンX
(t、f)から第2の特徴量抽出部20で抽出されたス
ピーカ再生用信号による雑音のタイムスペクトルパター
ンN1(t、f)を減じ、雑音を含む音声信号からスピ
ーカ再生用信号による雑音を除去したタイムスペクトル
パターンxi(t、f)=X(t、f)−Nl(t、f
)を生成する。
音声区間検出部40は、第1の雑音除去部30で生成さ
れた雑音を含む音声信号からスピーカ再生用信号による
雑音を除去したタイムスペクトルパターンX1(t、f
)から音声区間を検出する。
れた雑音を含む音声信号からスピーカ再生用信号による
雑音を除去したタイムスペクトルパターンX1(t、f
)から音声区間を検出する。
ここで用いられる音声区間検出の方法は、タイムスペク
トルパターンX1(t、f)の各フレームにおける合計 5 Σ XI(t、f) f=1 が、予め定められたしきい値を越えた区間を音声区間と
する。
トルパターンX1(t、f)の各フレームにおける合計 5 Σ XI(t、f) f=1 が、予め定められたしきい値を越えた区間を音声区間と
する。
第2の雑音除去部60は、音声区間検出部40で検出さ
れた音声区間における第1の雑音除去部30で生成され
た雑音を含む音声信診からスピーカ再生用信号による雑
音を除去したタイムスペクトルパターンX1s(t、f
)(添え字Sは、音声区間を表す〉から更にスピーカ再
生用信号による雑音以外の雑音のタイムスペクトルパタ
ーンN 2 (t、f)を雑音推定部50で推定して減
じ、音声のタイムスペクトルパターン S (t、f)= X1s(t、f) −NZ(t、f
)を生成する。ここで、スピーカ再生用信号による雑音
以外の雑音のタイムスペクトルパターンN2(t、f)
は、公知のスペクトルサブトラクション法に従って、音
声区間でない時の第1の雑音除去部30の出力X1n(
t、f)の複数フレームの平均を雑音推定部50にて推
定して充てる(添え字nは、非音声区間を表す)。
れた音声区間における第1の雑音除去部30で生成され
た雑音を含む音声信診からスピーカ再生用信号による雑
音を除去したタイムスペクトルパターンX1s(t、f
)(添え字Sは、音声区間を表す〉から更にスピーカ再
生用信号による雑音以外の雑音のタイムスペクトルパタ
ーンN 2 (t、f)を雑音推定部50で推定して減
じ、音声のタイムスペクトルパターン S (t、f)= X1s(t、f) −NZ(t、f
)を生成する。ここで、スピーカ再生用信号による雑音
以外の雑音のタイムスペクトルパターンN2(t、f)
は、公知のスペクトルサブトラクション法に従って、音
声区間でない時の第1の雑音除去部30の出力X1n(
t、f)の複数フレームの平均を雑音推定部50にて推
定して充てる(添え字nは、非音声区間を表す)。
入カバターン生成部70は、第2の雑音除去部60で生
成された音声の特yIi量から公知の例えばB T S
P (Ilinary Time Spectruw
+ Pattern)音声認識方式の音声パターン生成
法に徒って入力された音声の入カバターンを生成する。
成された音声の特yIi量から公知の例えばB T S
P (Ilinary Time Spectruw
+ Pattern)音声認識方式の音声パターン生成
法に徒って入力された音声の入カバターンを生成する。
標準パターンメモリ80は、BTSP音声認識方式の標
準パターン形式になっている音声の標準パターンを記憶
する。
準パターン形式になっている音声の標準パターンを記憶
する。
認識部90は、入カバターン生成部70で生成された入
カバターンと上記標準パターンメモリ80に記憶された
標準パターンとで公知のBTSP音声認識方式の認識処
理に従って認識処理を行う。
カバターンと上記標準パターンメモリ80に記憶された
標準パターンとで公知のBTSP音声認識方式の認識処
理に従って認識処理を行う。
セレクトスイッチ28′は伝達関数メモリ28の中に記
憶された複数の伝達関数の中の一つを選び出すためのス
イッチである。
憶された複数の伝達関数の中の一つを選び出すためのス
イッチである。
尚、以上に示した実施例で用いた手段以外に、音声区間
検出部40の音声区間検出法、第2の雑音除去部60の
雑音除去法、入カバターン生成部70のパターン生成法
、a準パターンメモリ80のパターン形式、認識部90
の認識処理などに公知の方法を用いても本発明を実施す
ることができる。
検出部40の音声区間検出法、第2の雑音除去部60の
雑音除去法、入カバターン生成部70のパターン生成法
、a準パターンメモリ80のパターン形式、認識部90
の認識処理などに公知の方法を用いても本発明を実施す
ることができる。
また、バンドパスフィルタバンク13.23は、FFT
などのデジタル43号処理と置き換えても良く、また、
A/Dコンバータ15と25は1時分割処理によって共
有することも可能である。
などのデジタル43号処理と置き換えても良く、また、
A/Dコンバータ15と25は1時分割処理によって共
有することも可能である。
まず、自動車のような狭い室内を考え、セレクトスイッ
チによって室内にいる人数を選ぶと、それに応じた伝達
関数が選ばれて補正用に使われる。
チによって室内にいる人数を選ぶと、それに応じた伝達
関数が選ばれて補正用に使われる。
伝達関数は中に居る人間の大きさ体形更に厳密に言うな
ら衣類によっても変化してくるが、ここでは近似的なも
のを設定しておけばよい6つまり、式(1)でのrを設
定する。後は、得られた結果を式(2)に代入して雑音
を除去した48号を作り出す。
ら衣類によっても変化してくるが、ここでは近似的なも
のを設定しておけばよい6つまり、式(1)でのrを設
定する。後は、得られた結果を式(2)に代入して雑音
を除去した48号を作り出す。
第2図は、第1図に示した実施例を、スピーカが複数個
ある場合に対応するために拡張した場合の一実施例を示
す構成図で、スピーカの数が例えば2個の場合、第2の
特徴量抽出部20a、20bも2個で、スピーカ2a、
2bから再生されるためのそれぞれのスピーカ再生用信
号を入力し、バンドパスフィルタ23a、23bで得ら
れるこれらのスピーカ再生用信号のタイムスペクトルパ
ターンNa(t、f)、 Nb(t、f)と、予め測定
されたスピーカ2a、2bとマイク1間の伝達関数1(
a (f )、I−Ib(f)のそれぞれの積が乗算器
27a、27bで求められ、これらの積の総和が加算器
28でスピーカ再生用信号による雑音のタイムスペクト
ルパターン N1(t、f) =Na(t、f)・Ha(f)
+ Nb(t、f)・Nb(f)(3) となる。これ以降の処理は、第1図に示した実施例と同
じである。また、スピーカの個数が3個以上でも同様な
手法で実現できる。
ある場合に対応するために拡張した場合の一実施例を示
す構成図で、スピーカの数が例えば2個の場合、第2の
特徴量抽出部20a、20bも2個で、スピーカ2a、
2bから再生されるためのそれぞれのスピーカ再生用信
号を入力し、バンドパスフィルタ23a、23bで得ら
れるこれらのスピーカ再生用信号のタイムスペクトルパ
ターンNa(t、f)、 Nb(t、f)と、予め測定
されたスピーカ2a、2bとマイク1間の伝達関数1(
a (f )、I−Ib(f)のそれぞれの積が乗算器
27a、27bで求められ、これらの積の総和が加算器
28でスピーカ再生用信号による雑音のタイムスペクト
ルパターン N1(t、f) =Na(t、f)・Ha(f)
+ Nb(t、f)・Nb(f)(3) となる。これ以降の処理は、第1図に示した実施例と同
じである。また、スピーカの個数が3個以上でも同様な
手法で実現できる。
塾−一朱
以上の説明から明らかなように、請求項第1項の発明に
よると、第1の雑音除去部30において、雑音を含む音
声の特徴量から音声帯域でしかも時間非定常性の強いス
ピーカ再生用信3による雑音の特徴量を除去してから、
音声区間検出部40において、音声区間を検出するので
、スピーカ再生音以外の雑音、例えば、自動車内では、
エンジン音、タイヤの走行音、また例えば、家庭内、事
務所内では、Hothノイズに代表されるような雑音と
いったいずれも低域(100117,から数Loot(
z程度)でしかも時間定常性の強い雑音が主な雑音から
音声区間を検出するので検出精度が向上し、結果として
高雑音下の音声の認識率が改善される。
よると、第1の雑音除去部30において、雑音を含む音
声の特徴量から音声帯域でしかも時間非定常性の強いス
ピーカ再生用信3による雑音の特徴量を除去してから、
音声区間検出部40において、音声区間を検出するので
、スピーカ再生音以外の雑音、例えば、自動車内では、
エンジン音、タイヤの走行音、また例えば、家庭内、事
務所内では、Hothノイズに代表されるような雑音と
いったいずれも低域(100117,から数Loot(
z程度)でしかも時間定常性の強い雑音が主な雑音から
音声区間を検出するので検出精度が向上し、結果として
高雑音下の音声の認識率が改善される。
更に、室内に存在する人数で部屋の音響特性が変化して
も、それにあった伝達関数を選ぶことができるため、正
確な雑音除去が可能になる。
も、それにあった伝達関数を選ぶことができるため、正
確な雑音除去が可能になる。
また、請求項第2項の発明によれば、マイク1の周囲に
置かれたスピーカ2が複数個ある場合にモ、 第2 ノ
特5i’景抽出部20 a 、 20 b 、 、 、
。
置かれたスピーカ2が複数個ある場合にモ、 第2 ノ
特5i’景抽出部20 a 、 20 b 、 、 、
。
が、それぞれのスピーカ2a、2b、、 0、とマイク
1間の伝達関数に相当するそれぞれの処理を乗算器27
a、27b、、、、で行った信号をすべて加算器29で
加算した信号の特徴量をスピーカ再生用信号による靴音
の特徴量とし、第1の雑音除去部30が、雑音を含む音
声の特徴量がらスピーカ再生用信号による雑音の特徴量
を除去するので、スピーカ2が複数個ある場合にも、ス
ピーカ再生用信号による雑音の取分を正確に除去できる
ので、結果として高雑音下の音声の′L1F!P識率が
改善される。
1間の伝達関数に相当するそれぞれの処理を乗算器27
a、27b、、、、で行った信号をすべて加算器29で
加算した信号の特徴量をスピーカ再生用信号による靴音
の特徴量とし、第1の雑音除去部30が、雑音を含む音
声の特徴量がらスピーカ再生用信号による雑音の特徴量
を除去するので、スピーカ2が複数個ある場合にも、ス
ピーカ再生用信号による雑音の取分を正確に除去できる
ので、結果として高雑音下の音声の′L1F!P識率が
改善される。
第1図は、請求項第1項に記載した発明の一実施例を説
明するための構成図、第2図は、請求項第2項に記載し
た発明の−・実施例を説明するための構成図である。 1・・・マイク、2.2a、2b・・・スピーカ、10
・・第1の特徴量抽出部、20.20a、20b・・・
第2の特徴量抽出部、11・・・マイクアンプ、12゜
22.22a、22b・・・プリエンファシス回路、1
3.23.23a、23b=バンドパスフイルタバ”)
’)、 14、24、24 a 、 24 b−マ)
Iiチプレクサ、 15、25、25 a 、 25
b ・・ハ/Dコンバータ、27、27 a 、 2
7 b −乗算器、28、28 a 、 28 b−伝
達関数メモリ、28′・・セレクトスイッチ、29・・
・加算器、3o・・第1の雑音除去部、40・・・音声
区間検出部 5 Q・・・雑音推定部、60・・・第2
の雑音除去部、7o・・・人カバターン生成部、8o・
・・標準パターンメモリ、90・・・認識部。 代 理 人 高 野 明 近(ばか1名)第 1 認諏砧果 図 第 図
明するための構成図、第2図は、請求項第2項に記載し
た発明の−・実施例を説明するための構成図である。 1・・・マイク、2.2a、2b・・・スピーカ、10
・・第1の特徴量抽出部、20.20a、20b・・・
第2の特徴量抽出部、11・・・マイクアンプ、12゜
22.22a、22b・・・プリエンファシス回路、1
3.23.23a、23b=バンドパスフイルタバ”)
’)、 14、24、24 a 、 24 b−マ)
Iiチプレクサ、 15、25、25 a 、 25
b ・・ハ/Dコンバータ、27、27 a 、 2
7 b −乗算器、28、28 a 、 28 b−伝
達関数メモリ、28′・・セレクトスイッチ、29・・
・加算器、3o・・第1の雑音除去部、40・・・音声
区間検出部 5 Q・・・雑音推定部、60・・・第2
の雑音除去部、7o・・・人カバターン生成部、8o・
・・標準パターンメモリ、90・・・認識部。 代 理 人 高 野 明 近(ばか1名)第 1 認諏砧果 図 第 図
Claims (1)
- 【特許請求の範囲】 1、音声認識用の音響収集部に、認識させたい音声信号
と、該音響収集部近傍に置かれた電気音響変換器から再
生される不要な信号が混入する場合、入力された音声信
号の中から、不要な信号を除去する雑音除去方式におい
て、前記電気音響変換器から音声認識用の音響収集部ま
での複数種類の音響伝搬特性あるいはそれに準ずるもの
を記憶する記憶手段を有し、音声認識用の音響収集部で
入力される、雑音を含んだ音声から特徴量を抽出する第
1の特徴量抽出部と、上記音響収集部の近傍に置かれた
電気音響変換器から再生する為に利用する電気信号を前
記第1の特徴抽出部と同じ特徴に変換する第2の特徴量
抽出部と、上記第2または第1の特徴量抽出部で抽出さ
れた特徴量に前記記憶手段に記憶された音響伝搬特性の
一つの補正をした後、前記第1または第2の特徴量抽出
部で抽出された信号から除去するようにした雑音除去方
式。 2、上記音声収集部の周囲に置かれた電気音響変換器が
複数個ある場合に、それぞれの電気音響変換器から再生
するための電気音響変換器再生用信号に、上記それぞれ
の電気音響変換器と上記音声収集部との予め定められた
位置関係で予め測定された上記それぞれの電気音響変換
器再生用信号と上記音声収集部から入力される信号間の
伝達関数に相当するそれぞれ補正処理を行った信号をす
べて加算した信号の特徴量を電気音響変換器再生用信号
による雑音の特徴量とすることを特徴とした請求項第1
項に記載の雑音除去方式。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2074689A JPH03274098A (ja) | 1990-03-23 | 1990-03-23 | 雑音除去方式 |
| DE19914106405 DE4106405C2 (de) | 1990-03-23 | 1991-02-28 | Geräuschunterdrückungseinrichtung für ein Spracherkennungsystem |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2074689A JPH03274098A (ja) | 1990-03-23 | 1990-03-23 | 雑音除去方式 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH03274098A true JPH03274098A (ja) | 1991-12-05 |
Family
ID=13554436
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2074689A Pending JPH03274098A (ja) | 1990-03-23 | 1990-03-23 | 雑音除去方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH03274098A (ja) |
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20030016791A (ko) * | 2001-08-22 | 2003-03-03 | (주) 마이크로 웹 | 음향기기의 잡음이 있는 상황에서 음성인식률을 높이는 방법 |
| JP2008518288A (ja) * | 2004-10-18 | 2008-05-29 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | 人物をモニタするシステム |
| JP2021503633A (ja) * | 2017-12-28 | 2021-02-12 | アイフライテック カンパニー,リミテッド | 音声ノイズ軽減方法、装置、サーバー及び記憶媒体 |
| JP2024004720A (ja) * | 2022-06-29 | 2024-01-17 | 綜合警備保障株式会社 | 異常音検知システム及び異常音検知方法 |
-
1990
- 1990-03-23 JP JP2074689A patent/JPH03274098A/ja active Pending
Cited By (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20030016791A (ko) * | 2001-08-22 | 2003-03-03 | (주) 마이크로 웹 | 음향기기의 잡음이 있는 상황에서 음성인식률을 높이는 방법 |
| JP2008518288A (ja) * | 2004-10-18 | 2008-05-29 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | 人物をモニタするシステム |
| JP2021503633A (ja) * | 2017-12-28 | 2021-02-12 | アイフライテック カンパニー,リミテッド | 音声ノイズ軽減方法、装置、サーバー及び記憶媒体 |
| US11064296B2 (en) | 2017-12-28 | 2021-07-13 | Iflytek Co., Ltd. | Voice denoising method and apparatus, server and storage medium |
| JP2024004720A (ja) * | 2022-06-29 | 2024-01-17 | 綜合警備保障株式会社 | 異常音検知システム及び異常音検知方法 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN107479030B (zh) | 基于分频和改进的广义互相关双耳时延估计方法 | |
| US5757937A (en) | Acoustic noise suppressor | |
| CN110931031A (zh) | 一种融合骨振动传感器和麦克风信号的深度学习语音提取和降噪方法 | |
| KR20040044982A (ko) | 선택적인 사운드 증강 | |
| JP2022505997A (ja) | 骨振動センサーとマイクの信号を融合するディープラーニング音声抽出及びノイズ低減方法 | |
| CN110931027B (zh) | 音频处理方法、装置、电子设备及计算机可读存储介质 | |
| CN111883153B (zh) | 一种基于麦克风阵列的双端讲话状态检测方法及装置 | |
| CN109195042A (zh) | 低功耗的高效降噪耳机及降噪系统 | |
| US12465524B2 (en) | Ear-worn device and reproduction method | |
| CN113870889B (zh) | 一种回声消除中的时延估计方法、装置以及电子设备 | |
| US20250184665A1 (en) | Ear-worn device and reproduction method | |
| CN113744752A (zh) | 语音处理方法及装置 | |
| CN118474607A (zh) | 主动降噪方法、装置和主动降噪耳机 | |
| JPH11249693A (ja) | 収音装置 | |
| CN117912480A (zh) | 二轮电动车语音处理装置、方法及二轮电动车 | |
| CN115410593B (zh) | 音频信道的选择方法、装置、设备及存储介质 | |
| CN115802225B (zh) | 一种用于无线耳机的噪声抑制方法和噪声抑制装置 | |
| JP2008070878A (ja) | 音声信号前処理装置、音声信号処理装置、音声信号前処理方法、及び音声信号前処理用のプログラム | |
| WO2017045512A1 (zh) | 一种语音识别的方法、装置、终端及语音识别设备 | |
| JPH03274099A (ja) | 音声認識装置 | |
| JPH03269498A (ja) | 雑音除去方式 | |
| JP2859634B2 (ja) | 雑音除去装置 | |
| CN109788399A (zh) | 一种音箱的回声消除方法及系统 | |
| JP2002064617A (ja) | 反響抑圧方法・反響抑圧装置 | |
| CN116089867A (zh) | 终端的拾音功能的评估方法、装置及电子设备 |