JPS58105295A - 音声標準パタン作成方法 - Google Patents

音声標準パタン作成方法

Info

Publication number
JPS58105295A
JPS58105295A JP56203731A JP20373181A JPS58105295A JP S58105295 A JPS58105295 A JP S58105295A JP 56203731 A JP56203731 A JP 56203731A JP 20373181 A JP20373181 A JP 20373181A JP S58105295 A JPS58105295 A JP S58105295A
Authority
JP
Japan
Prior art keywords
speakers
standard
voice
button
differences
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP56203731A
Other languages
English (en)
Inventor
畑岡 信夫
市川 「あきら」
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Ltd
Original Assignee
Hitachi Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Ltd filed Critical Hitachi Ltd
Priority to JP56203731A priority Critical patent/JPS58105295A/ja
Priority to US06/449,660 priority patent/US4590605A/en
Priority to CA000417894A priority patent/CA1190650A/en
Publication of JPS58105295A publication Critical patent/JPS58105295A/ja
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training

Landscapes

  • Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Machine Translation (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Image Analysis (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 本発明は音声認識装置において、同一カテゴリに属する
複数個の音−バタンを各カテゴリの標準バタンとして設
置する音−標準バタンの作成方法に関する。
不特定話者対象の音声認識装置における標準パタンは、
複数話者の音声の平均バタンか複数個の標準パタ/(マ
ルチテンプレート)で構成されることが多い。従来の標
準バタン作成方法は、上記いずれの方法をとるにしても
、音声の話者の違いによる物理的特徴と音声の無声化な
どによる発話的特徴の違いを区別しないで音声の特徴量
の違いとしてとらえ、平均パタンを作成するか、複数個
の゛標準パタンを配置していた。従って、完全に両者の
%徴を区別して多数話者の音声の特徴を細部にわたって
代表した標準パタンの作成は困難であつ九。
ま九、同一内容の音声パタンを複数個の組に分類する従
来の方法は、単純に音−のスペクトラムなどの視察から
分類したり、各組の初期の代表パタンをもとに類似して
いる音声パタンをその組に割りふるクラスタリング手法
(例えば k−means tteratton法; 
IB’BB ’rrans onAcoust、、3p
eech 、  a”itd Signal proc
essing■OL、 A38F−27,N(1,、2
、AI)r、 79”  Interactive  
 C1us電eving  Techniquesfo
r Selecting  5peaker −■nd
ependentBeference ’l’empl
ates  for  l5olatedWord ′
fLecogn目to/3. E、Lev tns t
on 、 L。
R,1labiner  et  al)などで行って
い九。しかじ1視察からの分類は不確実であり〜はしめ
に代表パタンを設定することを必要とするクラスタリン
グは設定される初期の代表パタンによって大幅に結果が
異なるという問題があつ九。
したがって本発明は上記問題点を解決するためになされ
たもので多数話者の音声を細部にわたって代表する標準
パタンの作成方法及び設定される初期の代表パタンによ
らない確実なりラスタリング手法を提供することを目的
とする。
この目的を達成するために、本発明では第1段として、
発話的に安定している音声を用いて、゛話者の物理的特
徴の違いにもとづく話者の分類をおこない、細部にわた
った音声の特徴を代表する標準パタンの作成を行なう点
に第1の特徴があり、更に、上記分類をおこなう方法と
して、音声の認識の際に使う距離尺度(類似性尺度)を
もとにし、tつとも類似している音声の話者から順に同
じ組の話者として分類する階層的なりラスタリングを行
なう点に第2の特徴がある。
以下、本発明の原理を詳細に説明する。
一般に、音声の話者による特徴の違いは、話者の声道や
鼻腔などの音声器官の構造の違いによる話者特有の物理
的特徴と、発声する音声の種類に従い音韻の前後関係(
よって本来の音韻特有の特徴が現わnるか否かにもとづ
く発話的特徴とがある。
第1図は、話者の音声器官の物理的特徴の違いによる音
声の特徴の違いを表わしたもので、話者A、BO母音(
vowet) 1 a 1 ノxヘクトル概形である。
横軸は周波数を、縦軸は強度(gain)を表わしてい
る。スペクトル上のピーク(ホルマント周波数)はその
音韻固有(この場合は母音1a1)の特徴を表わす。話
者の物理的特徴の違いは、このホルマント周波数のズレ
(ピークのズレ)と共振の鋭さのちがいおよびスペクト
ル概形の全体的な傾きの違いとして現れてくる。この様
子は話者A(実線)、話者B(破線)のスペクトル概形
がズしていることから明瞭である。
一方、音声の発話的特徴には音声の前後関係によって、
母音本来の音響的特徴が現れない、いわゆる母音の無声
化現象や鼻音化現象などがある。
無声化現象とは、1pl=  l ’ Is  1kl
−1h1.IIl、1chl  などの無−子音に1i
1.julの母音がはさまれ、またはその母音で終る場
合、母音の口の構えだけで111゜luIが有声に響か
ない現象である。第2図は音声l 、1chj lに現
れる無声化現象の例を示している。横軸は周波数、縦軸
は時間(7レーム、15ミリ秒/lフレーム)を表わし
ている。中は無声化していない本来の11chi l 
(lchl の後のIIがはっきりと現われている]で
あり、(1)は無声化し九l 1chi lで1.1 
ch lの後に本来のIjlのスペクトルは現われてい
ない。
以上のような複雑な特徴を呈する音声を認識しようとす
る場合、物理的特徴と発話的特徴を区別して取り扱う必
要がある。もし、これらの特徴を区別しないで処理し、
同一音声の標準パタンを複数個用意する、いわゆるマル
チテンプレートで音声認識を行うと、これらの特徴が入
り混じってしまう結果、精度の良い標準バタン作成が困
難となる。−例として50人の話者が発声した音−11
chi lを上記のようにそのまま平等に6個の組に分
類した結果はつぎのようになる。
ここでW、〜W、 ii分類されるべき組(クラスタ)
数字は話者番号、○印は女声の話者番号を指示しΔ印は
無−化している音声の話者番号を指示している。話者の
物理的特徴が大きく異なる男声1女声の話者が同−組の
なかに混在し、かつW・のように、無声化してない音声
の話者と無声化している音−の話者が混在した分類とな
ってしまう。
本発明は、以上のように物理的特徴と発話的特徴の違い
が混在するのを避けるために、階層的に、141段で発
話的に安定している音声(無声化、鼻音化しない音−)
を用いて話者の物理的特徴の違いにもとづく分類をおこ
ない、第2段では分類さnた各々の話者の組において発
話的特徴の違いにもとづく分類をおこない、かつ、各段
における音声の分類を音声の特徴量が類似しているもの
のなかから順次ひとつの組に分類する、いわゆる初期の
代表バタンによらない自動階層的クラスタリング手法を
用いるものである。
つぎに、階層的クラスタリング手法の原理を詳細に説明
する。まず、クラスタW、を次のように要素X を用い
て表示する。
” =4 ”1  a xl  m ””””” p 
”ml  )個体総数N=Z  m但 M;クラスタ数
mg 最初に必要な情報は個体xkとxl間の距離(類似度な
ど)d(XklXJ)であシ、各個体が各クラスタの唯
一の要素となっているN個のクラスタの状態から、クラ
スタ間の距離DIJの最小のものを順にひとつのクラス
タに融合し、これを目標のクラスタ数Mになるまで繰り
返す。以上をまとめると次のようになる。
中 各個体間の距離d(xk、x、)を求める。
(if)  各クラスタ間の距離DI、  を次のよう
に定義して求める。
(最大距離] (平均距離) 頓) り2スタの融合を行う。
W儀;W 1 [J W 3 IVI 、所望のクラスタ数になるまで11) 、 (
iiDを繰り返す、(但し、繰り返し回数Iは、i<1
(N−1) たとえば、個体数5の場合、M=1にするまでの上記中
〜01l)のステップは (1)  個体間の距離を求める。
=(5)に対して、以 下のように第1回の融 合をおこなう。
(幻 クラスタ間の距離を求める。
D11″”5 争Dll=” ’ e I)ta= 1
0 s D11=20、D、、=5.D□冨1.D、1
=13゜D84−” a DJI = 2 p DJI
 = 10Qi9  距離が最小となるクラスタW、と
W、の融合をおこなう。
この結果生ずるクラスタの状態: Wt =(x)tWt =(2t4LWs =(aL印 WI=(5)に対して、以下のように第2図の融合をお
こなう。
(H)DI=10.D、、=10.D、、=20゜I)
ms= 5 e I)ms= 13 e I)ms= 
26i0  距離が最小となるクラスタW、とw、の融
合をおこなう。
この結果生ずるクラスタの状態; w1=(ILWI=(214)tWa=(ass>K対
して、以下のように第3回の融合をおこなう。
(M)  D□=10.Dl、=20.D□=13(i
l−距離が最小となるクラスタW1とW、の融合をおこ
なう。
この結果生ずるクラメタの状態: ”’s =(1t2t4L”s =(3*5)に対して
、以下のように第4回の融合をおこなう。
(II)  Dss” 20 oiD  クラスタW、とW、の融合をおこなう。
この結果生ずるクラスタの状態: w、=(1,2,3,4,5)のどとく唯1つのクラス
タに融合さn%M=1になるから融合の処理を終了する
ここで、λラスタに分類した結果の良し悪しの尺度とし
て、次のようにクラスタの紐間平均距離と経内平均距離
との比Rを定義する。
μ 但しμ・、=1 !I M s  ms (m愈−1) この平均値比が大きい程、クラスタ間のオーバラップが
少なく、艮〈分離している。本発明は、この平均値比を
用いて、分噛の良−クラスタ数を決定する方法をも提供
するものである。
第3図は話者の物理的特徴の違いにもとづく分類をおこ
なう第1段に比較的発話的に安定している音声1hai
lを使って、階層的クラスタリングを行った結果である
。横軸は話者番号、縦軸は融デ 合して行く距離(を縦比)の値を示している。距離が大
きくなるにつれ、最初50個のクラスタが順次融合して
行って、最終的にはひとつのクラスタになって行く過程
を示しヤいる。この結果、例えば、あわせて3組のクラ
スタを与える融合距離は、1.4付近であり、次のよう
に男9女声の話者がほぼ確実に分類されている。
(0印は女声の話者番号を示す) 次にwL2段として、上記分類によ、って分類され順に
したがって2組に分類した結果は次のようになる。
この結果は前記式(1)と比較して、男9女声話者の分
類、無声化か否かの分類が確実に行われたことと示し、
第1段で話者の物理的特徴ともとづいた分類をおこない
、その後第2段で発話的特徴にもとづいた分類をおこな
う本発明の方法が有効であることを示している。
次に第4−゛を用いて、分類の良いクラスタ数を決定す
る方法を説明する。第4図は、盛0人の話者が発声した
音声に階層的クラスタリングを適用し九時の式シンで足
義される距離比を示している。
横軸はクラスタ数である。音声の特徴量が平面に配置さ
れていると仮定し九場合、平均距離比が2.0以上にな
っていれば実験的にクラスタ間の分離がよくできている
とみなされる。l sa口1 。
1hachi lはクラスタ数2ですでに分離の良−組
分けができているが、一方1ni l 、 l rok
u lに関しては、4個のクラスタが必要となっている
従って、距離比を例えば20とするクラスタの数を求め
ることによって、各音声共通に分離の良いクラスタリン
グが行われることになる。
以下、本発明を実施例を参照して詳細に説明する。第5
図は、本発明を用い喪音声堅識装置の一実施例のブロッ
ク図である。入力音声lはサンプnた後−アナログ−デ
ィジタル変換器(ADC)3でディジタル値に変換され
る。その後、特徴バラメータ分析回路4にて、入力音声
のパラメータが求められる。特徴パラメータとしては、
例えば自己相関係数、l、 p C(Linear p
redictlveCoefficients)分析8
(線形予測分析)結果の各種パラメータ、そしてフィル
タバンク値などを用いることができる。特徴パラメータ
を求めた後、距離計算回路5にて、複数個の音韻標準バ
タンメモリ6から読み込まれた音声の構成要素である音
韻の特徴パラメータと入力音声の特徴バラメニタ元 との距離(例えば(縦比やユークリッド距離など)が求
められる。距離計算回路5は乗算器と加算器あるいは減
算器などで構成される。つぎに%DPマツチング計算回
路7にて、音韻標準バタンとの距離と単語辞書メモリ8
から読み込まれた音声の時間構造を表現する情報を4と
に入力音声と単語辞書を構成する単語との総距離及び時
間構造などが計算された後、単語判定回路9にて総距離
の大小関係が比較され、認識結果10が出力される。
本発明は音韻標準バタンメモリ6に格納爆nている標準
バタンの作成方法を与えるものでおる。
第6図は、本発明による標準バタン作成装置の一実施例
を具体的に示し九ものである。標準パタンを作成するの
に必要な音声データや操作上必要な各種入力パラメータ
などの入力情報61がCRT62やM/T読取読取機上
3入力され、本発明の原理に示した処理がCPU64に
て行われる。その処理はCRT62、M/T読取読取機
上3てDi8K メモリ65を有機的に使って行わn、
標準バタン情報がM/T読取読取機上3して出力情報6
6として出力される。
第7図の処理の流れにて、前記CPU64で行われる本
発明の処理を具体的に説明する。まず入力情報として、
話者数N、単語数工の讐声情報f所望の話者の組数など
が入力さn、第1段の話者の分III(物理的%徴によ
る分類)が些(′較的発話的に安定な単語(たとえば9
16 l hai lを使って行われる。この分類の手
順は前記本発明の詳細な説明し九階層的クラスタリング
の手順Φ〜6シにて話者の組数が所望の組数Mあるいは
式り)で定義嘔れる距離比がαに等しくなるまで行われ
る。その後〜話者の組ごとに各単語において第2段の発
話的特徴による分類が階層的クラスタリングを用いて同
様に行われ、各単語内での組(系列)が決定する。
更に、単語内の各系統の代表バタンから音韻の切シ出し
を行い、全単語にて同様に切り出した後、−組の音韻標
準バタンか求まる。この処理を話者の各組にて行うこと
によシ、複数組の音韻標準バタン(マルチテンプレート
)が決定される。
以上説明したごとく、本発明によれば、音声の特徴に7
’t&み込みの形で混在している話者の物理的特徴と音
声の発話的特徴とを分離できるので、多数話者の音声を
細部にわたって代表する精度の良い標準バタン作成が可
能になる効果がある。更に、階層的クラスタリングを用
いれば、初期の代表バタンによらない分類が可能になる
効果もある。
【図面の簡単な説明】
第1図は話者の違いによる音声の物理的特徴の違いを示
す母音IJIIのスペクトル概形図、第2図は音声の発
話的特徴の違いを示す音声1ich目のスペクトル概形
図、第3図は50人の話者が発声し友音声1hajlに
階層的クラスタリングを適用し九時のクラスタ融合の過
程を示す図、第4図は階層的クラスタリングの際のクラ
スタの精度を表わす尺度であるクラスタの距離比の変化
を示す図、第5図は本発明を用いた音声U繊装置のブロ
ック図、第6図は本発明による標準バタン作成装置の一
実施例の処理ブロック図、第7図は本発明による標準バ
タン作成処理のフローチャートである。 vJl   図 4舎1α1 − 側波数(にHE) (I)/にcLに1 図 (itン /にc7Li/  (り良戸イしン部

Claims (1)

  1. 【特許請求の範囲】 1、同一カテゴリに属する複数話者による複数個の音−
    パタ/を各カテゴリの標準バタンとして設置する音声標
    準バタン作成方法において、発話的に安定している第1
    の音声バタンを用いて複数話者の物理的特徴の違いにも
    とづいて骸話者を複数の第1の組に分類す為第1のステ
    ップと、上記各カテゴリを代表する音響的特徴を有する
    @2の音声パタンを用いて上記分類された各組における
    話者の発話的特徴の違いにもとづいて該各組における話
    者を第2の組に再分類する第2のステップと、該第2の
    ステップにより再分類された各組に属する話者による上
    記第2の音声パタンに対応するバタンをすべて同一カテ
    ゴリに属する音声標準バタンとして該当するカテゴリに
    割当てるlI3のステップとからなることを%像とする
    音声標準バタン作成方法。 2、上記第1および第2のステップにおける分類はたが
    いに類似している音声バタンを順次同一の組に融合して
    いく階層的クラスタリングによりおこなうことを特徴と
    する特許請求範囲第1項の音声標準バタン作成方法。 3、上記階層的クラスタリングにより融合される組数は
    分類された各組内における音声バタンどうじの類似度に
    対応する量と分類された複数の組の間における音声バタ
    ンどうしの類似度に対応する量との比により決定するこ
    とを特徴とする特許請求範囲第2項の音声標準バタン作
    成方法。
JP56203731A 1981-12-18 1981-12-18 音声標準パタン作成方法 Pending JPS58105295A (ja)

Priority Applications (3)

Application Number Priority Date Filing Date Title
JP56203731A JPS58105295A (ja) 1981-12-18 1981-12-18 音声標準パタン作成方法
US06/449,660 US4590605A (en) 1981-12-18 1982-12-14 Method for production of speech reference templates
CA000417894A CA1190650A (en) 1981-12-18 1982-12-16 Method for production of speech reference templates

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP56203731A JPS58105295A (ja) 1981-12-18 1981-12-18 音声標準パタン作成方法

Publications (1)

Publication Number Publication Date
JPS58105295A true JPS58105295A (ja) 1983-06-23

Family

ID=16478916

Family Applications (1)

Application Number Title Priority Date Filing Date
JP56203731A Pending JPS58105295A (ja) 1981-12-18 1981-12-18 音声標準パタン作成方法

Country Status (3)

Country Link
US (1) US4590605A (ja)
JP (1) JPS58105295A (ja)
CA (1) CA1190650A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2002109536A (ja) * 2000-09-22 2002-04-12 Nightingale Technologies Ltd データクラスタリング方法とアプリケーション

Families Citing this family (29)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5131043A (en) * 1983-09-05 1992-07-14 Matsushita Electric Industrial Co., Ltd. Method of and apparatus for speech recognition wherein decisions are made based on phonemes
FR2554623B1 (fr) * 1983-11-08 1986-08-14 Texas Instruments France Procede d'analyse de la parole independant du locuteur
US4780906A (en) * 1984-02-17 1988-10-25 Texas Instruments Incorporated Speaker-independent word recognition method and system based upon zero-crossing rate and energy measurement of analog speech signal
US5146539A (en) * 1984-11-30 1992-09-08 Texas Instruments Incorporated Method for utilizing formant frequencies in speech recognition
US4956865A (en) * 1985-01-30 1990-09-11 Northern Telecom Limited Speech recognition
CA1245363A (en) * 1985-03-20 1988-11-22 Tetsu Taguchi Pattern matching vocoder
US4759068A (en) * 1985-05-29 1988-07-19 International Business Machines Corporation Constructing Markov models of words from multiple utterances
US5774851A (en) * 1985-08-15 1998-06-30 Canon Kabushiki Kaisha Speech recognition apparatus utilizing utterance length information
US4885791A (en) * 1985-10-18 1989-12-05 Matsushita Electric Industrial Co., Ltd. Apparatus for speech recognition
CA1299750C (en) * 1986-01-03 1992-04-28 Ira Alan Gerson Optimal method of data reduction in a speech recognition system
US5023911A (en) * 1986-01-10 1991-06-11 Motorola, Inc. Word spotting in a speech recognition system without predetermined endpoint detection
US5129000A (en) * 1986-04-05 1992-07-07 Sharp Kabushiki Kaisha Voice recognition method by analyzing syllables
US4903305A (en) * 1986-05-12 1990-02-20 Dragon Systems, Inc. Method for representing word models for use in speech recognition
JPH0760318B2 (ja) * 1986-09-29 1995-06-28 株式会社東芝 連続音声認識方式
US5146503A (en) * 1987-08-28 1992-09-08 British Telecommunications Public Limited Company Speech recognition
GB8809898D0 (en) * 1988-04-27 1988-06-02 British Telecomm Voice-operated service
US5315689A (en) * 1988-05-27 1994-05-24 Kabushiki Kaisha Toshiba Speech recognition system having word-based and phoneme-based recognition means
JPH02195400A (ja) * 1989-01-24 1990-08-01 Canon Inc 音声認識装置
JP3045510B2 (ja) * 1989-12-06 2000-05-29 富士通株式会社 音声認識処理装置
JPH05509409A (ja) * 1990-06-21 1993-12-22 レイノルズ ソフトウエア,インコーポレイティド 波動分析・事象認識方法およびその装置
US5369727A (en) * 1991-05-16 1994-11-29 Matsushita Electric Industrial Co., Ltd. Method of speech recognition with correlation of similarities
US6847717B1 (en) * 1997-05-27 2005-01-25 Jbc Knowledge Ventures, L.P. Method of accessing a dial-up service
US9978373B2 (en) 1997-05-27 2018-05-22 Nuance Communications, Inc. Method of accessing a dial-up service
US7630895B2 (en) * 2000-01-21 2009-12-08 At&T Intellectual Property I, L.P. Speaker verification method
DE19912405A1 (de) * 1999-03-19 2000-09-21 Philips Corp Intellectual Pty Bestimmung einer Regressionsklassen-Baumstruktur für Spracherkenner
JP4590692B2 (ja) * 2000-06-28 2010-12-01 パナソニック株式会社 音響モデル作成装置及びその方法
JP4456537B2 (ja) * 2004-09-14 2010-04-28 本田技研工業株式会社 情報伝達装置
JP4220449B2 (ja) * 2004-09-16 2009-02-04 株式会社東芝 インデキシング装置、インデキシング方法およびインデキシングプログラム
US20070179784A1 (en) * 2006-02-02 2007-08-02 Queensland University Of Technology Dynamic match lattice spotting for indexing speech content

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4181821A (en) * 1978-10-31 1980-01-01 Bell Telephone Laboratories, Incorporated Multiple template speech recognition system
US4363102A (en) * 1981-03-27 1982-12-07 Bell Telephone Laboratories, Incorporated Speaker identification system using word recognition templates

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2002109536A (ja) * 2000-09-22 2002-04-12 Nightingale Technologies Ltd データクラスタリング方法とアプリケーション

Also Published As

Publication number Publication date
CA1190650A (en) 1985-07-16
US4590605A (en) 1986-05-20

Similar Documents

Publication Publication Date Title
JPS58105295A (ja) 音声標準パタン作成方法
Wu et al. Gender recognition from speech. Part I: Coarse analysis
TW502249B (en) Segmentation approach for speech recognition systems
US5749066A (en) Method and apparatus for developing a neural network for phoneme recognition
Zwicker et al. Automatic speech recognition using psychoacoustic models
JPS59226400A (ja) 音声認識装置
JPH0713594A (ja) 音声合成において音声の質を評価するための方法
Hasija et al. Recognition of children Punjabi speech using tonal non-tonal classifier
CN118430542B (zh) 一种数字化回忆干预系统的智能语音互动方法
Glass et al. Detection and recognition of nasal consonants in American English
Evain et al. Beatbox sounds recognition using a speech-dedicated HMM-GMM based system
Cheng et al. Comparative performance study of several pitch detection algorithms
Gillmann A fast frequency domain pitch algorithm
Umeda Another consistency in phoneme duration
Bhattachajee et al. An experimental analysis of speech features for tone speech recognition
JPS5979295A (ja) 音声標準パタン作成方法
Al-Shoshan Classification and Separation of Audio and Music Signals
Federico et al. A new automated method for reliable speaker identification and verification over telephone channels
JP2862306B2 (ja) 音声認識装置
Shattuck‐Hufnagel et al. Analysis of 1500 phonetic errors in spontaneous speech
JP2886879B2 (ja) 音声認識方法
JP2744622B2 (ja) 破裂子音識別方式
Gu et al. An acoustic and articulatory knowledge integrated method for improving synthetic Mandarin speech's fluency
Loizou et al. Automatic recognition of syllable‐final nasals preceded by/ε
JPS6346499A (ja) 大語▲い▼単語音声認識方式