JPH0389400A - フォルマント軌跡抽出方式 - Google Patents

フォルマント軌跡抽出方式

Info

Publication number
JPH0389400A
JPH0389400A JP1226592A JP22659289A JPH0389400A JP H0389400 A JPH0389400 A JP H0389400A JP 1226592 A JP1226592 A JP 1226592A JP 22659289 A JP22659289 A JP 22659289A JP H0389400 A JPH0389400 A JP H0389400A
Authority
JP
Japan
Prior art keywords
formant
trajectories
neural network
locus
maximum likelihood
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP1226592A
Other languages
English (en)
Inventor
Tetsuya Sakayori
哲也 酒寄
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Ricoh Co Ltd
Original Assignee
Ricoh Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Ricoh Co Ltd filed Critical Ricoh Co Ltd
Priority to JP1226592A priority Critical patent/JPH0389400A/ja
Publication of JPH0389400A publication Critical patent/JPH0389400A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 挟止立夏 本発明は、フォルマント軌跡抽出方式、より詳細には、
音声波形からフォルマント軌跡を抽出する方式に関する
。
従米夫揉 音声波形からフォルマント軌跡を抽出する方法として従
来より様々なものが知られているが、代表的なものには
、Abs法、モーメント法、最尤法などがある。Abs
法は非常に精度良くフォルマント抽出が行えることが知
られているが、計算量が膨大であるという欠点を有する
。モーメント法はアルゴリズムが非常に簡単であり実時
間処理に向くが、スペクトルの全体的な傾きなどによっ
て大きな抽出誤差を生む。また、最尤法は線形予測の技
術によって比較的簡単に、しかも精度良くフォルマント
抽出が出来る。
しかし、上述の最尤法によってフォルマント軌跡を抽出
する場合には以下のような問題がある。
■最尤法では、推定される極の数がフォルマントの数よ
りも多く成るように分析を行う。このため、推定された
極の中からフォルマントを選択するという後工程が必要
となる。
■推定された極軌跡は、第2図に示すように、周波数−
時間平面上で消滅、生成する場合があり、これを選択的
に接続しても滑らかなフォルマント軌跡は得られない。
■に関してはフォルマントの帯域幅と連続性を考慮して
、動的計画法によってフォルマント軌跡を抽出する方法
が提案されている。しかし、この方法はコスト関数に用
いる重み係数の設定が微妙であり、計算量も多大である
。また、■の問題に関しては考慮されていない。
且−一鰹 本発明は、上述のような問題点を解決し、最尤法によっ
て得られた極の系列から、滑らかなフォルマント軌跡を
得ることを目的としてなされたものである。
遭−−」又 本発明は、上記目的を達成するために、音声波形から最
尤法によって、音声スペクトルの有理スペクトル近似に
おける極周波数及び帯域幅を求め、これらの時系列を入
力データとし、専門家によって描かれたフォルマント軌
跡を教師データとして与え、バックプロパゲージョンに
よって学習させたニューラルネットを用いて、その出力
データからフォルマント軌跡を求めることを特徴とした
ものである。以下、本発明の実施例に基づいて説明する
。
第1図は、本発明の一実施例を説明するための構成図で
1図中、lは入力音声、2は最尤法部。
3は接糸列部、4はニューラルネット部、5はフォルマ
ント軌跡、6はFFT、7は端末部、8はフォルマント
軌跡で、本発明は、上述のごとき欠点を解決するために
、最尤法から得られた極系列を入力データとし、専門家
によって描かれたフォルマント軌跡を教師データとして
与え、バックプロパゲージョンによって学習させたニュ
ーラルネットを用いて、その出力データからフォルマン
ト軌跡を求めるよ、うにしたものである。
第1図において、音声波形は予めA/D変換されてファ
イルに蓄えられているとする。実際の分析系は図の下半
分の点線で囲った部分を含まない。
しかし実際の分析を行う前に、ニューラルネットの重み
係数を学習しなければならない、この際、点線の部分を
含んだ形となる(すなわち、点線内は学習時のみ必要で
ある)。
先ず、学習時の方法について説明する。音声を適当なフ
レーム毎に最尤法によって分析し、音声スペクトルの有
理スペクトル近似における極周波数と帯域幅を求める。
この際、極の数は抽出すべきフォルマントの数より多く
する。こうして得られた極の時系列をニューラルネット
への入力とする。一方、この極の時系列を端末画面に表
示する。
また、必要に応じて波形データや、FFTその他のスペ
クトル分析の結果も併せて表示する。専門家はこれを見
てフォルマント軌跡をキーボード、マウス、ライトペン
等の端末器で入力する。また、上述のスペクトル情報を
紙に印刷してデジタイザによってフォルマント軌跡を描
く方法も考えられる。この様にして作成されたフォルマ
ント軌跡(時系列)を教師データとしてニューラルネッ
トに与える。入力データと教師データが与えられた後に
、ニューラルネットはバックプロパゲージョンによって
重み係数を学習する。
次に実際の分析の方法について説明する。音声を適当な
フレーム毎に最尤法によって分析し、極の周波数と帯域
幅を求める。この際、極の数は抽出すべきフォルマント
の数より多くする。こうして得られた極の時系列をニュ
ーラルネットへの入力とする。ニューラルネットは既に
重み係数を学習済みであるので、専門家の描くフォルマ
ント軌跡と近いフォルマント軌跡を出力する。
羞−一来 以上の説明から明らかなように、本発明によると、!&
尤法から得られた極系列を入力データとし。
専門家によって描かれたフォルマント軌跡を教師データ
として与え、バックプロパゲージョンによって学習させ
たニューラルネットを用いて、その出力データからフォ
ルマント軌跡を求めることにより、学習後は比較的簡単
に、精度良くフォルマント軌跡を抽出することが出来る
。また、推定された極を選択的に接続する方法ではない
ので、極軌跡の周波数−時間平面上での消滅、生成にも
対応できる。
【図面の簡単な説明】
第11!lは1本発明の一実施例を説明するための構成
図、第2図は、フォルマント軌跡の抽出の例を説明する
ための図である。 l・・・入力音声、2・・・最尤法部、3・・・横系列
部、4・・・ニューラルネット部、5・・・フォルマン
ト軌跡。 6・・・FFT、7・・・端末部、8・・・フォルマン
ト軌跡。

Claims (1)

    【特許請求の範囲】
  1. 1、音声波形から最尤法によって、音声スペクトルの有
    理スペクトル近似における極周波数及び帯域幅を求め、
    これらの時系列を入力データとし、専門家によって描か
    れたフォルマント軌跡を教師データとして与え、バック
    プロパゲージョンによって学習させたニューラルネット
    を用いて、その出力データからフォルマント軌跡を求め
    ることを特徴としたフォルマント軌跡抽出方式。
JP1226592A 1989-09-01 1989-09-01 フォルマント軌跡抽出方式 Pending JPH0389400A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP1226592A JPH0389400A (ja) 1989-09-01 1989-09-01 フォルマント軌跡抽出方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1226592A JPH0389400A (ja) 1989-09-01 1989-09-01 フォルマント軌跡抽出方式

Publications (1)

Publication Number Publication Date
JPH0389400A true JPH0389400A (ja) 1991-04-15

Family

ID=16847600

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1226592A Pending JPH0389400A (ja) 1989-09-01 1989-09-01 フォルマント軌跡抽出方式

Country Status (1)

Country Link
JP (1) JPH0389400A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2006112760A (ja) * 2004-10-18 2006-04-27 Tdk Corp 焼成炉

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2006112760A (ja) * 2004-10-18 2006-04-27 Tdk Corp 焼成炉

Similar Documents

Publication Publication Date Title
Virtanen Sound source separation using sparse coding with temporal continuity objective
US11830521B2 (en) Voice activity detection method and system based on joint deep neural network
US4783807A (en) System and method for sound recognition with feature selection synchronized to voice pitch
CN105023573B (zh) 使用听觉注意力线索的语音音节/元音/音素边界检测
US8676574B2 (en) Method for tone/intonation recognition using auditory attention cues
US12548586B2 (en) Audio signal generation model and training method using generative adversarial network
CN108597496A (zh) 一种基于生成式对抗网络的语音生成方法及装置
US11611581B2 (en) Methods and devices for detecting a spoofing attack
GB2107101A (en) Continous word string recognition
KR100745976B1 (ko) 음향 모델을 이용한 음성과 비음성의 구분 방법 및 장치
CN113223487B (zh) 一种信息识别方法及装置、电子设备和存储介质
CN108461081B (zh) 语音控制的方法、装置、设备和存储介质
US5671330A (en) Speech synthesis using glottal closure instants determined from adaptively-thresholded wavelet transforms
CN110782915A (zh) 一种基于深度学习的波形音乐成分分离方法
Sunny et al. Recognition of speech signals: an experimental comparison of linear predictive coding and discrete wavelet transforms
CN112863485A (zh) 口音语音识别方法、装置、设备及存储介质
CN110070891B (zh) 一种歌曲识别方法、装置以及存储介质
US4707857A (en) Voice command recognition system having compact significant feature data
Gao et al. Metric Learning Based Feature Representation with Gated Fusion Model for Speech Emotion Recognition.
CN119517012A (zh) 一种智能语音机器人的语音识别方法及系统
CN117877510A (zh) 语音自动化测试的方法、装置、电子设备及存储介质
CN113823271B (zh) 语音分类模型的训练方法、装置、计算机设备及存储介质
CN119170058A (zh) 支持边缘计算设备的大模型高质推理方法及系统
Sunny et al. Feature extraction methods based on linear predictive coding and wavelet packet decomposition for recognizing spoken words in malayalam
Yousfi et al. Isolated Iqlab checking rules based on speech recognition system