JPH0389400A - フォルマント軌跡抽出方式 - Google Patents
フォルマント軌跡抽出方式Info
- Publication number
- JPH0389400A JPH0389400A JP1226592A JP22659289A JPH0389400A JP H0389400 A JPH0389400 A JP H0389400A JP 1226592 A JP1226592 A JP 1226592A JP 22659289 A JP22659289 A JP 22659289A JP H0389400 A JPH0389400 A JP H0389400A
- Authority
- JP
- Japan
- Prior art keywords
- formant
- trajectories
- neural network
- locus
- maximum likelihood
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
挟止立夏
本発明は、フォルマント軌跡抽出方式、より詳細には、
音声波形からフォルマント軌跡を抽出する方式に関する
。
音声波形からフォルマント軌跡を抽出する方式に関する
。
従米夫揉
音声波形からフォルマント軌跡を抽出する方法として従
来より様々なものが知られているが、代表的なものには
、Abs法、モーメント法、最尤法などがある。Abs
法は非常に精度良くフォルマント抽出が行えることが知
られているが、計算量が膨大であるという欠点を有する
。モーメント法はアルゴリズムが非常に簡単であり実時
間処理に向くが、スペクトルの全体的な傾きなどによっ
て大きな抽出誤差を生む。また、最尤法は線形予測の技
術によって比較的簡単に、しかも精度良くフォルマント
抽出が出来る。
来より様々なものが知られているが、代表的なものには
、Abs法、モーメント法、最尤法などがある。Abs
法は非常に精度良くフォルマント抽出が行えることが知
られているが、計算量が膨大であるという欠点を有する
。モーメント法はアルゴリズムが非常に簡単であり実時
間処理に向くが、スペクトルの全体的な傾きなどによっ
て大きな抽出誤差を生む。また、最尤法は線形予測の技
術によって比較的簡単に、しかも精度良くフォルマント
抽出が出来る。
しかし、上述の最尤法によってフォルマント軌跡を抽出
する場合には以下のような問題がある。
する場合には以下のような問題がある。
■最尤法では、推定される極の数がフォルマントの数よ
りも多く成るように分析を行う。このため、推定された
極の中からフォルマントを選択するという後工程が必要
となる。
りも多く成るように分析を行う。このため、推定された
極の中からフォルマントを選択するという後工程が必要
となる。
■推定された極軌跡は、第2図に示すように、周波数−
時間平面上で消滅、生成する場合があり、これを選択的
に接続しても滑らかなフォルマント軌跡は得られない。
時間平面上で消滅、生成する場合があり、これを選択的
に接続しても滑らかなフォルマント軌跡は得られない。
■に関してはフォルマントの帯域幅と連続性を考慮して
、動的計画法によってフォルマント軌跡を抽出する方法
が提案されている。しかし、この方法はコスト関数に用
いる重み係数の設定が微妙であり、計算量も多大である
。また、■の問題に関しては考慮されていない。
、動的計画法によってフォルマント軌跡を抽出する方法
が提案されている。しかし、この方法はコスト関数に用
いる重み係数の設定が微妙であり、計算量も多大である
。また、■の問題に関しては考慮されていない。
且−一鰹
本発明は、上述のような問題点を解決し、最尤法によっ
て得られた極の系列から、滑らかなフォルマント軌跡を
得ることを目的としてなされたものである。
て得られた極の系列から、滑らかなフォルマント軌跡を
得ることを目的としてなされたものである。
遭−−」又
本発明は、上記目的を達成するために、音声波形から最
尤法によって、音声スペクトルの有理スペクトル近似に
おける極周波数及び帯域幅を求め、これらの時系列を入
力データとし、専門家によって描かれたフォルマント軌
跡を教師データとして与え、バックプロパゲージョンに
よって学習させたニューラルネットを用いて、その出力
データからフォルマント軌跡を求めることを特徴とした
ものである。以下、本発明の実施例に基づいて説明する
。
尤法によって、音声スペクトルの有理スペクトル近似に
おける極周波数及び帯域幅を求め、これらの時系列を入
力データとし、専門家によって描かれたフォルマント軌
跡を教師データとして与え、バックプロパゲージョンに
よって学習させたニューラルネットを用いて、その出力
データからフォルマント軌跡を求めることを特徴とした
ものである。以下、本発明の実施例に基づいて説明する
。
第1図は、本発明の一実施例を説明するための構成図で
1図中、lは入力音声、2は最尤法部。
1図中、lは入力音声、2は最尤法部。
3は接糸列部、4はニューラルネット部、5はフォルマ
ント軌跡、6はFFT、7は端末部、8はフォルマント
軌跡で、本発明は、上述のごとき欠点を解決するために
、最尤法から得られた極系列を入力データとし、専門家
によって描かれたフォルマント軌跡を教師データとして
与え、バックプロパゲージョンによって学習させたニュ
ーラルネットを用いて、その出力データからフォルマン
ト軌跡を求めるよ、うにしたものである。
ント軌跡、6はFFT、7は端末部、8はフォルマント
軌跡で、本発明は、上述のごとき欠点を解決するために
、最尤法から得られた極系列を入力データとし、専門家
によって描かれたフォルマント軌跡を教師データとして
与え、バックプロパゲージョンによって学習させたニュ
ーラルネットを用いて、その出力データからフォルマン
ト軌跡を求めるよ、うにしたものである。
第1図において、音声波形は予めA/D変換されてファ
イルに蓄えられているとする。実際の分析系は図の下半
分の点線で囲った部分を含まない。
イルに蓄えられているとする。実際の分析系は図の下半
分の点線で囲った部分を含まない。
しかし実際の分析を行う前に、ニューラルネットの重み
係数を学習しなければならない、この際、点線の部分を
含んだ形となる(すなわち、点線内は学習時のみ必要で
ある)。
係数を学習しなければならない、この際、点線の部分を
含んだ形となる(すなわち、点線内は学習時のみ必要で
ある)。
先ず、学習時の方法について説明する。音声を適当なフ
レーム毎に最尤法によって分析し、音声スペクトルの有
理スペクトル近似における極周波数と帯域幅を求める。
レーム毎に最尤法によって分析し、音声スペクトルの有
理スペクトル近似における極周波数と帯域幅を求める。
この際、極の数は抽出すべきフォルマントの数より多く
する。こうして得られた極の時系列をニューラルネット
への入力とする。一方、この極の時系列を端末画面に表
示する。
する。こうして得られた極の時系列をニューラルネット
への入力とする。一方、この極の時系列を端末画面に表
示する。
また、必要に応じて波形データや、FFTその他のスペ
クトル分析の結果も併せて表示する。専門家はこれを見
てフォルマント軌跡をキーボード、マウス、ライトペン
等の端末器で入力する。また、上述のスペクトル情報を
紙に印刷してデジタイザによってフォルマント軌跡を描
く方法も考えられる。この様にして作成されたフォルマ
ント軌跡(時系列)を教師データとしてニューラルネッ
トに与える。入力データと教師データが与えられた後に
、ニューラルネットはバックプロパゲージョンによって
重み係数を学習する。
クトル分析の結果も併せて表示する。専門家はこれを見
てフォルマント軌跡をキーボード、マウス、ライトペン
等の端末器で入力する。また、上述のスペクトル情報を
紙に印刷してデジタイザによってフォルマント軌跡を描
く方法も考えられる。この様にして作成されたフォルマ
ント軌跡(時系列)を教師データとしてニューラルネッ
トに与える。入力データと教師データが与えられた後に
、ニューラルネットはバックプロパゲージョンによって
重み係数を学習する。
次に実際の分析の方法について説明する。音声を適当な
フレーム毎に最尤法によって分析し、極の周波数と帯域
幅を求める。この際、極の数は抽出すべきフォルマント
の数より多くする。こうして得られた極の時系列をニュ
ーラルネットへの入力とする。ニューラルネットは既に
重み係数を学習済みであるので、専門家の描くフォルマ
ント軌跡と近いフォルマント軌跡を出力する。
フレーム毎に最尤法によって分析し、極の周波数と帯域
幅を求める。この際、極の数は抽出すべきフォルマント
の数より多くする。こうして得られた極の時系列をニュ
ーラルネットへの入力とする。ニューラルネットは既に
重み係数を学習済みであるので、専門家の描くフォルマ
ント軌跡と近いフォルマント軌跡を出力する。
羞−一来
以上の説明から明らかなように、本発明によると、!&
尤法から得られた極系列を入力データとし。
尤法から得られた極系列を入力データとし。
専門家によって描かれたフォルマント軌跡を教師データ
として与え、バックプロパゲージョンによって学習させ
たニューラルネットを用いて、その出力データからフォ
ルマント軌跡を求めることにより、学習後は比較的簡単
に、精度良くフォルマント軌跡を抽出することが出来る
。また、推定された極を選択的に接続する方法ではない
ので、極軌跡の周波数−時間平面上での消滅、生成にも
対応できる。
として与え、バックプロパゲージョンによって学習させ
たニューラルネットを用いて、その出力データからフォ
ルマント軌跡を求めることにより、学習後は比較的簡単
に、精度良くフォルマント軌跡を抽出することが出来る
。また、推定された極を選択的に接続する方法ではない
ので、極軌跡の周波数−時間平面上での消滅、生成にも
対応できる。
第11!lは1本発明の一実施例を説明するための構成
図、第2図は、フォルマント軌跡の抽出の例を説明する
ための図である。 l・・・入力音声、2・・・最尤法部、3・・・横系列
部、4・・・ニューラルネット部、5・・・フォルマン
ト軌跡。 6・・・FFT、7・・・端末部、8・・・フォルマン
ト軌跡。
図、第2図は、フォルマント軌跡の抽出の例を説明する
ための図である。 l・・・入力音声、2・・・最尤法部、3・・・横系列
部、4・・・ニューラルネット部、5・・・フォルマン
ト軌跡。 6・・・FFT、7・・・端末部、8・・・フォルマン
ト軌跡。
Claims (1)
- 1、音声波形から最尤法によって、音声スペクトルの有
理スペクトル近似における極周波数及び帯域幅を求め、
これらの時系列を入力データとし、専門家によって描か
れたフォルマント軌跡を教師データとして与え、バック
プロパゲージョンによって学習させたニューラルネット
を用いて、その出力データからフォルマント軌跡を求め
ることを特徴としたフォルマント軌跡抽出方式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP1226592A JPH0389400A (ja) | 1989-09-01 | 1989-09-01 | フォルマント軌跡抽出方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP1226592A JPH0389400A (ja) | 1989-09-01 | 1989-09-01 | フォルマント軌跡抽出方式 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH0389400A true JPH0389400A (ja) | 1991-04-15 |
Family
ID=16847600
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP1226592A Pending JPH0389400A (ja) | 1989-09-01 | 1989-09-01 | フォルマント軌跡抽出方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH0389400A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2006112760A (ja) * | 2004-10-18 | 2006-04-27 | Tdk Corp | 焼成炉 |
-
1989
- 1989-09-01 JP JP1226592A patent/JPH0389400A/ja active Pending
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2006112760A (ja) * | 2004-10-18 | 2006-04-27 | Tdk Corp | 焼成炉 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Virtanen | Sound source separation using sparse coding with temporal continuity objective | |
| US11830521B2 (en) | Voice activity detection method and system based on joint deep neural network | |
| US4783807A (en) | System and method for sound recognition with feature selection synchronized to voice pitch | |
| CN105023573B (zh) | 使用听觉注意力线索的语音音节/元音/音素边界检测 | |
| US8676574B2 (en) | Method for tone/intonation recognition using auditory attention cues | |
| US12548586B2 (en) | Audio signal generation model and training method using generative adversarial network | |
| CN108597496A (zh) | 一种基于生成式对抗网络的语音生成方法及装置 | |
| US11611581B2 (en) | Methods and devices for detecting a spoofing attack | |
| GB2107101A (en) | Continous word string recognition | |
| KR100745976B1 (ko) | 음향 모델을 이용한 음성과 비음성의 구분 방법 및 장치 | |
| CN113223487B (zh) | 一种信息识别方法及装置、电子设备和存储介质 | |
| CN108461081B (zh) | 语音控制的方法、装置、设备和存储介质 | |
| US5671330A (en) | Speech synthesis using glottal closure instants determined from adaptively-thresholded wavelet transforms | |
| CN110782915A (zh) | 一种基于深度学习的波形音乐成分分离方法 | |
| Sunny et al. | Recognition of speech signals: an experimental comparison of linear predictive coding and discrete wavelet transforms | |
| CN112863485A (zh) | 口音语音识别方法、装置、设备及存储介质 | |
| CN110070891B (zh) | 一种歌曲识别方法、装置以及存储介质 | |
| US4707857A (en) | Voice command recognition system having compact significant feature data | |
| Gao et al. | Metric Learning Based Feature Representation with Gated Fusion Model for Speech Emotion Recognition. | |
| CN119517012A (zh) | 一种智能语音机器人的语音识别方法及系统 | |
| CN117877510A (zh) | 语音自动化测试的方法、装置、电子设备及存储介质 | |
| CN113823271B (zh) | 语音分类模型的训练方法、装置、计算机设备及存储介质 | |
| CN119170058A (zh) | 支持边缘计算设备的大模型高质推理方法及系统 | |
| Sunny et al. | Feature extraction methods based on linear predictive coding and wavelet packet decomposition for recognizing spoken words in malayalam | |
| Yousfi et al. | Isolated Iqlab checking rules based on speech recognition system |