JPH01202799A - スペクトル正規化装置 - Google Patents
スペクトル正規化装置Info
- Publication number
- JPH01202799A JPH01202799A JP63029676A JP2967688A JPH01202799A JP H01202799 A JPH01202799 A JP H01202799A JP 63029676 A JP63029676 A JP 63029676A JP 2967688 A JP2967688 A JP 2967688A JP H01202799 A JPH01202799 A JP H01202799A
- Authority
- JP
- Japan
- Prior art keywords
- spectrum
- straight line
- approximate straight
- frequency
- calculating
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 238000001228 spectrum Methods 0.000 title claims abstract description 51
- 238000010606 normalization Methods 0.000 claims abstract description 16
- 238000010183 spectrum analysis Methods 0.000 claims description 6
- 238000004364 calculation method Methods 0.000 claims description 4
- 230000000694 effects Effects 0.000 description 9
- 230000003595 spectral effect Effects 0.000 description 4
- 238000000034 method Methods 0.000 description 2
- 238000007781 pre-processing Methods 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
(産業上の利用分野)
本発明は音声認識装置などの前処理に用いられる音声ス
ペクトルの正規化に関する。
ペクトルの正規化に関する。
(従来の技術)
雑音下で発声された音声の認識は非常に困難である。こ
れは音声が雑音によりマスクされるだけでなく、191
1年にロンバード(Lombard)によって示された
ロンバード効果として知られる発声自身の変形があるた
めである。ロンバード効果は雑音により発声が発声者自
身に取って聞き取り辛くなるために、発声者がより大き
く、より明瞭に発声しようとするために生じる。同一話
者が静かな環境と高雑音下において発声した母音/a/
のスペクトルを第2図に示す。第2図において実線は静
かな環境において発声された音声のスペクトルであり、
点線は高雑音下において発声された音声のスペクトルで
ある。第2図に示すように高雑音下において発声された
場合は全体のエネルギーの上昇だけでなくそのスペクト
ルの概形も変化している。
れは音声が雑音によりマスクされるだけでなく、191
1年にロンバード(Lombard)によって示された
ロンバード効果として知られる発声自身の変形があるた
めである。ロンバード効果は雑音により発声が発声者自
身に取って聞き取り辛くなるために、発声者がより大き
く、より明瞭に発声しようとするために生じる。同一話
者が静かな環境と高雑音下において発声した母音/a/
のスペクトルを第2図に示す。第2図において実線は静
かな環境において発声された音声のスペクトルであり、
点線は高雑音下において発声された音声のスペクトルで
ある。第2図に示すように高雑音下において発声された
場合は全体のエネルギーの上昇だけでなくそのスペクト
ルの概形も変化している。
スペクトル概形の補正方法としては不特定話者の音声認
識を目的とした三輪らの゛音声認識のための話者正規化
の検討″、日本音響学会講演論文集3−2−1、pp、
577−578.1979年6月(以下、文献1と呼ぶ
)がある。
識を目的とした三輪らの゛音声認識のための話者正規化
の検討″、日本音響学会講演論文集3−2−1、pp、
577−578.1979年6月(以下、文献1と呼ぶ
)がある。
第3図を用いて文献1によるスペクトル正規化法を説明
する。入力端子200に音声が入力されたとする。スペ
クトル分析部201は信号線210より音声を受は取り
、帯域フィルタ群(29チヤンネル、中心周波数250
kHz〜6300Hz、1/6オクタ一ブ間隔、Q=6
、広域強調無し)により分析を行い振幅、周波数とも対
数で表現された音声スペクトル(S(n)、n=1.2
9)を10m5毎に信号線211および信号線212へ
出力する。近似直線計算部202は信号線212より音
声スペクトルを受は取り最小2乗誤差を与える近似直線
N(n)=aXn+bを計算し、係数a、 bを信号線
213へ出力する。スペクトル正規化部203は信号線
211より音声スペクトルを信号線213より近似直線
の係数を受は取り正規化スペクトル(SN(n)、n=
1.29)を5N(n)= 5(n)−a X n −
bとして計算し信号線214を介して出力端子204へ
出力する。
する。入力端子200に音声が入力されたとする。スペ
クトル分析部201は信号線210より音声を受は取り
、帯域フィルタ群(29チヤンネル、中心周波数250
kHz〜6300Hz、1/6オクタ一ブ間隔、Q=6
、広域強調無し)により分析を行い振幅、周波数とも対
数で表現された音声スペクトル(S(n)、n=1.2
9)を10m5毎に信号線211および信号線212へ
出力する。近似直線計算部202は信号線212より音
声スペクトルを受は取り最小2乗誤差を与える近似直線
N(n)=aXn+bを計算し、係数a、 bを信号線
213へ出力する。スペクトル正規化部203は信号線
211より音声スペクトルを信号線213より近似直線
の係数を受は取り正規化スペクトル(SN(n)、n=
1.29)を5N(n)= 5(n)−a X n −
bとして計算し信号線214を介して出力端子204へ
出力する。
(発明が解決しようとする問題点)
しかしながら、従来のスペクトル正規化法は声道長の個
人差に起因する影響を補正しようとするものであり、対
数周波数軸に対して線形な影響を正規化することを目的
とした方法である。しかし、第2図に示したようにロン
バード効果は2.5kHz〜4kHzにおけるエネルギ
ーの顕著な上昇として現れており、その影響は対数周波
数軸に対して非線形であると考えられる。したがって、
従来の1次近似式では十分に近似できない。
人差に起因する影響を補正しようとするものであり、対
数周波数軸に対して線形な影響を正規化することを目的
とした方法である。しかし、第2図に示したようにロン
バード効果は2.5kHz〜4kHzにおけるエネルギ
ーの顕著な上昇として現れており、その影響は対数周波
数軸に対して非線形であると考えられる。したがって、
従来の1次近似式では十分に近似できない。
(発明の構成)
本発明は入力された音声を分析しスペクトルを計算する
スペクトル分析部と、あらかじめ定められる周波数を記
憶する周波数記憶部と前記スペクトルを前記周波数によ
り分割し、分割されたスペクトル内においてそれぞれ近
似直線を求めるに際して前記分割周波数において前記近
似直線が連続となるように近似直線を計算する近似直線
計算部と、前記スペクトルを前記近似直線により正規化
するスペクトル正規化部とから構成されることを特徴と
する。
スペクトル分析部と、あらかじめ定められる周波数を記
憶する周波数記憶部と前記スペクトルを前記周波数によ
り分割し、分割されたスペクトル内においてそれぞれ近
似直線を求めるに際して前記分割周波数において前記近
似直線が連続となるように近似直線を計算する近似直線
計算部と、前記スペクトルを前記近似直線により正規化
するスペクトル正規化部とから構成されることを特徴と
する。
(作用)
ロンバード効果は周波数領域におけるエネルギーの上昇
が対数周波数軸に対して線形ではなく、2.5〜4kH
zでのエネルギーの顕著な上昇として現れる。したがっ
て、ロンバード効果は従来のようにス弓りトルの1次近
似直線で正規化することはできない。
が対数周波数軸に対して線形ではなく、2.5〜4kH
zでのエネルギーの顕著な上昇として現れる。したがっ
て、ロンバード効果は従来のようにス弓りトルの1次近
似直線で正規化することはできない。
そこで、本発明はある定められた周波数においてスペク
トルを分割し、分割されたスペクトル毎に1次近似直線
を求める際に、分割点においてそれら1次近似直線が連
続となるように1次近似直線を求め、スペクトルの正規
化を行うものである。
トルを分割し、分割されたスペクトル毎に1次近似直線
を求める際に、分割点においてそれら1次近似直線が連
続となるように1次近似直線を求め、スペクトルの正規
化を行うものである。
いま、音声から得られたスペクトルをS(ω)とする。
このスペクトルS(ω)を定められた周波数ωCにおい
て(Sl(ω)、ωくωC)と(S2(ω)、ω≧ωC
)に分割する。分割した81(ω)、82(ω)ごとに
近似直線Nl(ω)= al X ω+ bl、N2(
ω)= a2 X ω+ b2を求める。
て(Sl(ω)、ωくωC)と(S2(ω)、ω≧ωC
)に分割する。分割した81(ω)、82(ω)ごとに
近似直線Nl(ω)= al X ω+ bl、N2(
ω)= a2 X ω+ b2を求める。
但し、分割点において不連続とならないよう条件alX
ωc+bl=a2Xωc+b2
(1)を加える。係数a1、a2、bl、b2はこの条
件式および2乗誤差 e=(81(ω)−Nl(ω))2dω+(S2(ω)
−N2(ω))2dω (2)を最小化する条件により
求められる。
ωc+bl=a2Xωc+b2
(1)を加える。係数a1、a2、bl、b2はこの条
件式および2乗誤差 e=(81(ω)−Nl(ω))2dω+(S2(ω)
−N2(ω))2dω (2)を最小化する条件により
求められる。
正規化スペクトルSN(ω)は次式により与えられる。
このようにすることにより従来の最小2乗直線による正
規化では補正できなかったスペクトルの変形、すなわち
、ロンバード効果に見られる特定のある周波数を中心に
エネルギーが上昇するようなスペクトルの変形を正規化
することができる。
規化では補正できなかったスペクトルの変形、すなわち
、ロンバード効果に見られる特定のある周波数を中心に
エネルギーが上昇するようなスペクトルの変形を正規化
することができる。
(実施例)
第1図に示すのは本発明の一実施例である。
入力端子100には音声が入力されたとする。
スペクトル分析部101は信号線110より音声を受は
取り、音声スペクトルS(ω)を計算する。スペクトル
分析部の例は文献1、文献2に示されている。
取り、音声スペクトルS(ω)を計算する。スペクトル
分析部の例は文献1、文献2に示されている。
近似直線計算部102は信号線111により音声スペク
トルS(ω)を受は取り、信号線117より分割周波数
記憶部105内にあらかじめ保持されている分割周波数
ωCを読出しこの分割周波数ωCによりS(ω)を81
(ω)、82(ω)に分割し、SL(ω)、82(ω)
毎に1次近似直線Nl(ω) = al X ω+ b
l、N2(ω)=a2×ω+b2を(1)式の条件のも
とで(2)式を最小にするよう係数a1、a2、bl、
b2、をもとめ、信号線112へ係数a1、a2、bl
、b2、およびωCを出力する。ωCとしては例えばロ
ンバード効果の正規化ならば2.5〜4kHzにスペク
トルの上昇の中心が存在するので2.5〜4kHz内の
周波数を選べばよい。
トルS(ω)を受は取り、信号線117より分割周波数
記憶部105内にあらかじめ保持されている分割周波数
ωCを読出しこの分割周波数ωCによりS(ω)を81
(ω)、82(ω)に分割し、SL(ω)、82(ω)
毎に1次近似直線Nl(ω) = al X ω+ b
l、N2(ω)=a2×ω+b2を(1)式の条件のも
とで(2)式を最小にするよう係数a1、a2、bl、
b2、をもとめ、信号線112へ係数a1、a2、bl
、b2、およびωCを出力する。ωCとしては例えばロ
ンバード効果の正規化ならば2.5〜4kHzにスペク
トルの上昇の中心が存在するので2.5〜4kHz内の
周波数を選べばよい。
スペクトル正規化部103は信号線112より係数a1
、a2、bl、b2および分割周波数ωCを、信号線1
13より音声スペクトルS(ω)を受は取り正規化スペ
クトルSN(ω)を として求め、信号線114を介して端子105へ出力す
る。
、a2、bl、b2および分割周波数ωCを、信号線1
13より音声スペクトルS(ω)を受は取り正規化スペ
クトルSN(ω)を として求め、信号線114を介して端子105へ出力す
る。
(発明の効果)
以上のように本発明によるスペクトル正規化装置によれ
ば周波数軸に対して非線形な影響を受けた音声スペクト
ルであっても適切に正規化を行える。
ば周波数軸に対して非線形な影響を受けた音声スペクト
ルであっても適切に正規化を行える。
第1図は本発明の一実施例、第2図、第3図は従来技術
の説明図である。 図において、100は入力端子、101はスペクトル分
析部、102は近似直線計算部、103はスペクトル正
規化部、104は出力端子、105は分割周波数記憶部
、200は入力端子、201はスペクトル分析部、20
2は近似直線計算部、203はスペクトル正規化部、2
04は出力端子である。
の説明図である。 図において、100は入力端子、101はスペクトル分
析部、102は近似直線計算部、103はスペクトル正
規化部、104は出力端子、105は分割周波数記憶部
、200は入力端子、201はスペクトル分析部、20
2は近似直線計算部、203はスペクトル正規化部、2
04は出力端子である。
Claims (1)
- 入力された音声を分析しスペクトルを計算するスペクト
ル分析部と、あらかじめ定められる周波数を記憶する周
波数記憶部と前記スペクトルを前記周波数により分割し
、分割されたスペクトル内においてそれぞれ近似直線を
求めるに際して前記分割周波数において前記近似直線が
連続となるように近似直線を計算する近似直線計算部と
、前記スペクトルを前記近似直線により正規化するスペ
クトル正規化部とから構成されることを特徴とするスペ
クトル正規化装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP63029676A JPH0814759B2 (ja) | 1988-02-09 | 1988-02-09 | スペクトル正規化装置 |
| US07/308,905 US5001761A (en) | 1988-02-09 | 1989-02-08 | Device for normalizing a speech spectrum |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP63029676A JPH0814759B2 (ja) | 1988-02-09 | 1988-02-09 | スペクトル正規化装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH01202799A true JPH01202799A (ja) | 1989-08-15 |
| JPH0814759B2 JPH0814759B2 (ja) | 1996-02-14 |
Family
ID=12282715
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP63029676A Expired - Lifetime JPH0814759B2 (ja) | 1988-02-09 | 1988-02-09 | スペクトル正規化装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH0814759B2 (ja) |
-
1988
- 1988-02-09 JP JP63029676A patent/JPH0814759B2/ja not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| JPH0814759B2 (ja) | 1996-02-14 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP0950239B1 (en) | Method and recognizer for recognizing a sampled sound signal in noise | |
| KR910002198B1 (ko) | 음성인식방법과 그 장치 | |
| Bou-Ghazale et al. | A comparative study of traditional and newly proposed features for recognition of speech under stress | |
| KR20010005685A (ko) | 음성 분석 시스템 | |
| US4937871A (en) | Speech recognition device | |
| US7917359B2 (en) | Noise suppressor for removing irregular noise | |
| JPH03206499A (ja) | 音声認識装置 | |
| de Veth et al. | Channel normalization techniques for automatic speech recognition over the telephone | |
| Kotnik et al. | Robust MFCC feature extraction algorithm using efficient additive and convolutional noise reduction procedures | |
| US5001761A (en) | Device for normalizing a speech spectrum | |
| JPH01202799A (ja) | スペクトル正規化装置 | |
| JPH0242495A (ja) | スペクトル正規化装置 | |
| Upadhyay et al. | Robust recognition of English speech in noisy environments using frequency warped signal processing | |
| JPH07121197A (ja) | 学習式音声認識方法 | |
| JPH04369698A (ja) | 音声認識方式 | |
| JPH032793A (ja) | 音声認識用前処理装置 | |
| Marković et al. | Recognition of normal and whispered speech based on RASTA filtering and DTW algorithm | |
| Barlaskar et al. | Study on the varying degree of speaker identity information reflected across the different MFCCs | |
| JP2968976B2 (ja) | 音声認識装置 | |
| JP3100180B2 (ja) | 音声認識方法 | |
| Menéndez-Pidal et al. | Compensation of channel and noise distortions combining normalization and speech enhancement techniques | |
| JPS6029796A (ja) | 音声認識装置 | |
| JP2975808B2 (ja) | 音声認識装置 | |
| Marković et al. | Recognition of Whispered Speech Based on PLP Features and DTW Algorithm | |
| JPH0316038B2 (ja) |