JPS5958497A - 音素認識法 - Google Patents

音素認識法

Info

Publication number
JPS5958497A
JPS5958497A JP57171633A JP17163382A JPS5958497A JP S5958497 A JPS5958497 A JP S5958497A JP 57171633 A JP57171633 A JP 57171633A JP 17163382 A JP17163382 A JP 17163382A JP S5958497 A JPS5958497 A JP S5958497A
Authority
JP
Japan
Prior art keywords
phoneme
standard pattern
recognition
consonant
analysis
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP57171633A
Other languages
English (en)
Inventor
藤井 諭
二矢田 勝行
森井 秀司
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Priority to JP57171633A priority Critical patent/JPS5958497A/ja
Publication of JPS5958497A publication Critical patent/JPS5958497A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 産業上の利用分野 本発明は人間によって発声された音声化けを自動的に認
識するだめの、音声自動認識・/ステムにおける音素認
識法に関するものである。
従来例の構成とその問題点 人間によって発声された音声を自動的に認識する音声自
動認識装置は人間から電子割算磯や各種機械へデータや
命令を鳥える手段として非常に有効と考えられる。
従来研究あるいは発表されている音声自動認識システム
の動作原理としてはバタンマツチング法が多く採用され
ている3、この方法は認識さ牙する必要がある全種類の
右記に対して標準パターンあらかじめ記憶しておき、入
力される未知の入カバターンと比較することによって一
致の度合(以下類似度と呼ぶ)を言」算し、最大一致か
得ら才するt、Hl:(準パターンと同一の単語である
と判定するものである。このバタンマツチング法では認
識されるべき全ての単語に対して標準パターンを用意し
なけ)−シばならない/こめ、発声者が変つ/と」21
合には新らしく標準パターン全入力して記憶させる必9
1.1がある。。
従って日本全国の都市名のようしこ12’l i’T 
Fn類以にの11を詔を認識対象とするようなi混合、
全(Φ類の中a1′;を発声して登録するには膨大な時
間と労カイi−″必四とし、又登録に要するメモリー容
i74も膨k (1(−f3ツ、ことが予想される。さ
らに入カバターンと(シ1“jfi、h、yzパターン
バタンマツチングに・皮する時間も’l” 1ili数
か多くなると長くなってし−まう欠点か7(す/1、。
これに対して、入力音声を音素?)1−位に分1dで1
′?素の組合せとして認識しく以下と1素紹識と吋ふ)
音素単位で表記された単語辞書との類イ」月W4−・求
める方法は単語辞書に要するメモリー容111か火it
に少なくて済みバタンマツチングにJ、Q−J−、/、
、 lI冒[1jか’t:’、)くでき、故実の内容変
更も容易で;(す/・という!1′1長を持っている。
この方法の例は[7’r、)!・スーくりトルの概略形
とその動特性を利用し/r.単iirF ’?η声認識
/ステムー1三輪他,日本音響学会に!:34(197
8)に述べである,。
この方法における単語認識システムのフローを第1図に
示す。1ず、あらかじめ多数話者の音声を10msの分
析区間毎に音響分析部1によ−・てフィルタバンクを用
いて分析し、得らノまたスペクトル メータを求める。この特徴パラメータから/a/。
10/等の母音や,/m/,/b/等の子音に代表され
る音素毎又は音素グループ毎に標準パターンヲ作成して
標準パターン登録部6(/C登録し2ておく。。
次に、入力された不111定話者の音声を、同様に分析
区間fnに音響分析部1によって分析し、j1’.’j
徴抽出部2によって特徴パラメータを求める。、この特
徴パラメータと標準パターン登録部5の(;p準バクー
ンk)月いてセグメンデーヅヨン’RB 3 (tこよ
、・いてtυ音と子音の区切り作業(以下セグメンーア
ーノ9ンと呼ぶ)を行なう2、この結果をもとに、7”
r,二4:’,判別部4において標準パターン登録部5
の4,HV4準パターンと照合することによって、最も
耕似度の高い標準パターンに該当する音素をその区間し
こおける音素と決定する4。
最後に、この結果作成した音素の時系列(以下音素系列
と呼ぶ)を単語認識部6に送り、同様に音素系列て表現
さf]た単語辞書7と最も類似度の大きい項目に該当す
る単語を認識結果としてlJj力する。
以十述べた単語認識システムのフロー(lこおいて音素
判別部4はその中心をなすものである,、?Cの部分に
」:って音素の名前を決定するため、音素系列はこの時
点でほぼ決定され、後段においてその内容を修復するこ
とは致しい。従−)てこの部分で音素判別を誤った場合
には単語認識N<:S 6[において全く関係のない単
語辞書と類似することによって認識単語を誤ってし寸う
危険性か人きくなる1。
オず、従来の音素判別の方法石−次にj15へる。第1
図の音響分析部1において)rルタバンつてあらかしめ
多数話者の音声をスペクトル分析し、特徴抽出部2でス
ペクトルのピークイ「求め、音素毎にスペクトルピーク
の周波数分イ1jケ求める3、これを第2図に示すよう
に、横ilIll+ (/C第1のピーク。
!i,Y輔に第2のピークを配置したγN素tll別l
ツlと1〜で寸とめ、標準パターンとする。しかる後に
、入力された話者の音声について前記方法と同様に周波
数スペクトルのピーク周波数を求め、第2図ヴ用″τ素
判別図にピーク周波数をあてはめることによー。
て分析区間毎に音素名を決定し、−音素区間で最も数の
多かった音素名をその区間における音素と決定する方法
である。
この方法はスペクトルのピークにのみ’jH [ilす
るためアルコリズムとしては簡1%であるか、ピーク周
波数の似かよった音素間てd−それらのI’ll別か知
しく、音素認識率を低−ドさせてし甘う欠点かあったa
(ll′に子音においては/n/,/b/,/r/のよ
うにピーク周波数の似かよった音素の区別か報(シ、く
お〃いの混同か非常に大きい欠点かぁー・た1、これら
の音素を区別するためにはスベク]・ルのピーク1/こ
着目するのみでなく、スペクトル全体の形:lIり(′
こ着目しなけれは区別することはできない1。
発明の目的 ゛ 本発明は一lx記欠点を解消し、音素認識イ・−の大幅
向上をはかった音素認識法呑−I)、1供することを・
l・1的とする,J 発明つ褐へ・ 本発明は上記目的を達成するために、寸ずあらかじめ多
数話者の発声した音′fi;データに目視によって音素
名のラベル伺けをしておき、次にこの音声データを線形
予測分析することに、L−・てLPCケプストラム係数
を求め、この係数の多次ノ1〕面規分布を仮定して標準
パターンを作成する1、この係数は音声信号のスペクト
ル包絡を表わすパラメータで、スペクトル全体の概略形
を・保1旨7でぃ/)3゜次に入力音声について線形予
測り)イIi L−1LPGり一ブストラム係数を求め
てiiJ記標ベイパクーノと照合するようにしたもので
、従来の方法の、1−うにスー(りトルのピークのみで
は区別のできなか、/、冒’′l”!’、を、ピーク以
外の情報にも着1゛1ず/′、)ことI/(−,1: 
・−C分離することが可能となり、?:r’ ;(’1
j。IJ識(、ろ友1:°1゛1に1古J−J二できる
。。
実施例の説明 第3図に本発明の音素認識法イτ・J+、体化する1゛
1声自動認識システムの構成の一実hfu例イ「小ず3
゜マイク20から入った音声信−弓i1、A 、/ D
変換部21で12kt(zザンプリングされ12ビ、l
にA/D変換する。これを信号処理回路22て6 d 
B/ 、4クターブのプリエンファシスおよび20 m
 sのハミング窓をかけ、10m5毎’tc 線形予測
分析プロセッサ23にてLPCケプストラム係数を9出
する3、このLPCケプストラム係数で標準パターンメ
モリ25に登録した標準パターンに対する確率密度関数
又は尤度をマトリクス刷算機24Vこて言1算し結果を
メモリ2了に転送する。一方、パワー泪a音1(30(
7こて音声のパワーを計算し、メモリ27に転送する。
メインプロセッサ26でd]メモリ27のデータを用い
てセグメンテーションと名素f、lI別を行ない、音素
系列を単語辞引28と照合することによって最も類イ」
)1度の大きい浄語名を認識結宋とし2てI10部29
pこ出力する3、次に本発明に係る1ll−素認識法の
実h[11例についで第3図を参照にしk・がら詳しく
説明する。
−まず標準パターンの作成方法(・でついて述へる。
あらかじめ多数話者の発声した多数のrl、−,77i
音声を/a/、10/等の旬1°i +/m/、/b/
等の有声子音。
/S/JV等の無声r音のような7゛7素に分け、音素
の区切りとラベル伺けを行ってγ冒l・データを作成し
ておく。この音声データを用い、信シJ″処:171!
 1ijl路22及び線形予測分析プロセッーリ23し
く−より必要とする音素の区間を10m5程度の分41
区間毎に次数15程度の線形予測分析を1Jい線形予測
係数を求める6、この線形予測係数からンlUi化式に
よりLPCケプストラム係数を算出する6、音素lにお
けるLPCケプストラム係数をCよ(n)とすると(n
は音素iの出現番号)、LPCケプストラム係数の平均
値m・ は ここでN1 は音素iの出現数である。
音素1のLPCケプストラム係数の共分散行列ここでt
(/i転置行列であることを示す、。
標準パターンとしては有声と無声、又は有音と無声の同
居しない音素として次のものについて多次元正規分布を
仮定し」二記1,2式、1.す求め標準パターンメモリ
25に登録しておく。
〔1〕 母音/a/、10/、/u/、/i/、/e/
、/S/(無声音) 〔2〕  有声子音/N/(鼻音)、/B/(イi′I
′A破裂音) ? /r/+/D/、/h1/ (/a
/、10/。
/u汐つ後続する/h/)/に、/(/a/T10/。
/u/の後続する/に/) 〔3〕  無声子音/S/(無声摩擦音) + /h7
C/a/。
10/、/u/以外の後続する/h/)、外、/(/a
/、10/、/u/以外の後続する/に/)(IJ、(
2J式による標準パターン作成には多数話者の音声デー
タにラベル付けした各音素の全区間を使用する。従って
この標準パターンiJ−話者の個人差を吸収して不特定
話者に対応できると共に、同−音素内の時間変動を吸収
できる特長も(+!fiえている。
しかし同−音素内で有声、無声の両方あるいは有音、無
音の両方を持つ等の変動要因の大きい音素は多次元正規
分布を仮定することができないので標準パターンから除
く。。
次にマイク20から入力さ、11−だ未知な音声信号に
ついて、信号処理回路22及び線形予測分析プロセツサ
23を使用してLPCり゛ブストラム係数Cxを求め、
7トリツクス言1算機24に転送し、予め求めて標準パ
ターンメモリ25に収納しである標準パターンm工、W
エ を用いで、LPCケプストラム係数Cx の音素C
xの音素iの4′7’!準パターンに対する確率密度関
係P□を求め、メモリ27に記憶する。
未知な音声のLPCケプストラム係数Cの音素1の標準
パターンに対する確率密度1′)j数P1←]、3Wf
  (Cx−m、)]         ”””(’=
9ここでwHは共分散行列W□ の逆行列、 L i1
gLPcケプストラム係数の次数であ2)。
一方パワー割算部30によりセグメンテーション用パラ
メータを割算しメモリ27に転」4する。
メインプロセノザ26でセグメンテーション用パラメー
タを用いて子音区間の確率密度の総和を割算するととも
に有声無声判定及び有音無音”glJ定を行いその結果
をメモリ27に転送する。。
次にメモリ2Yより上NIL結果を読み出し、メインプ
ロセソザ26により子音を決定し音素系列をつくるL、 その結果と単語辞書28を、照合し、最も類似度の高い
単語を認識結果としてI10部29に出力する。
第4図はある成人男子の発声した/RA K U D 
A/という単語を音素認識した例で、横軸はパラメータ
の種類を表わす、Aはあらかじめ目視によ−)て分析区
間毎に音素名のラベルイ」けをしたものである。
Bは母音の標準パターンに対する事後確率を求めて示し
たもので、同様にCは子音の標19−パターンに対する
事後確率を示しだものであZ)、、D4.l雪′<声パ
ワーの時間変化を示したもので、liJ音と子音の境界
を決定するセグメンテーションに使用する。
lS<無音声であることを示す、、Ei7j、Bの結果
より最も確率の高か−、たけ音を分析区間4Uに示した
もの、Fは母音の認識結果を小し/4もの、Hl: C
の結果より最も確率の高かった千7′4. f、’ 、
j()i区間4υに示したものである。又、Gfd−音
声が有声音の場合はv9無声音の場合し、1]u、無声
音の1易合&:l:Qで示したものである。捷ずり、E
、Gのパラメータを用いて母音と子音の境界を決定し7
、’l” )irF/RAKUDA/の子音/R/、/
に/+/Dyの領域を決、定する。決定した/Rfi)
区間中−〇’−,ri’r 4図Cに示す子音の標準パ
ターンに7・1する@I率の総1lVllを標準パター
ン毎に計算すると/r 7j/) 標7((パターンに
対する確率の総和が最も太きかつブr−こと苓−°ン」
、し、これを認識結果としてIに示す3.同様しこ/D
/lJ)区間中で確率の総和の最も大きい標準パターン
ル佃/てあり、これを認識結果として工に示J−4゜子
音/に、4d、その区間中で有音部(無γ?以外のとこ
ろ)における標準パターン/に1/又は/に2/に対す
る確率が最も高いことと、無音の存在(Qで示す)より
、無声破裂音/P/ として認識し、とれを工に示す。
このように、本実施例はあらかじめ子音に相当する区間
をセグメンテーションした後、そのr、 、’g区間V
こおける各様べf2パターンに対する確率の総和が最も
大きい音素しこ相当するものを認識音素とすることを基
本とする。1これに、音素の+Φ類によ−・て無音の存
在、無声音の存在、子音の1.1続時間を併用して音素
判別を行なう。本実施例に、1゜・いてLPCケプスト
ラム係数を出い、スペクI・ルのピークのみでなく、ス
ペクトル全体の形状VCk目することと、各標準パター
ンに対する類似度か確率で表示できる点か従来と大きく
異なり、スベク[・ルのピーク周波数の似かよった子音
間の[メ別かしやすく、又認識した音素のイご軸度を表
わすことも可能である。。
これに対して従来の方法ではスペクトルのピークのみに
落目するため、その(jJかl、−1たj’7(、’、
、 (例えば/n/と/b/、/r/)f:区別するこ
としよしはしは難しかった。例えば第4図の語頭/ r
/−iスペクトルのピークのみで判別することに1−難
しい理由により、従来は認識する方法かなく、/N/又
は/B/としていた。又、第4図の語中の音素/に/に
おいては、その区間中の無音の存在と有音部の持続時間
のみで決定するため、同様に無音の存在し得る音素/C
,,/+//b/としばしば誤る欠点を持っていた。。
第4図は本実施例によってこれらの欠点を解決した結果
を示している。
以上を甘とめると、本実施例による音素認識法の特長は
次の通りである。
(1)LPCケプストラムの多次元正規分布を仮定した
音素標準パターンを、多数話者の多敬音声ザンプルにあ
らかじめ音素のラベルイ・]けをして、全てのサンプル
点で作成する/こめ、話者の個人差と同一音素の時間変
動を吸収できる4、(2)LPCケプストラム係数がス
ペクトル包絡の概略形を表わす特徴量であるため、これ
を用いると、従来のスペクトルのピークのみに着目する
方法に比べ、スペクトルのピークの類似し/こ異音素間
の分離がし易い。。
(3)  従来法の、一つの音素区間に」、・け2.第
1候補音素数の最も多いものを認識結果とす/、方法に
比し、一つの音素区間における各様7(Qパターンに対
する確率の総和の最も大きいものを認識結果とする本実
施例の方か、音素判別のだめの数値の精度が高い。
第5図は語頭子音の認識法を従来の方法と本実施例によ
る方法で比較したもので11か本実施例による方法の場
合を、12は従来の方法の場合を示す。
従来の方法では全く認識のできなかった子音/r/。
/2乃二認識できるようになり、/b/+/d/y/q
/の認識法か大きく向上していることかわがる1゜又、
無声破裂音/p/、/l/、/に/がいずれも向上して
いる。13は本実施例による甲−均認識法、14は従来
の方法による平均認識法を示し、57係から75%へと
大きく向上し本実施例による認識法の効果の犬なること
を示しててる33 第6図は語中子音の認識法を従来の方法と本実施例によ
る方法で比較したもので、16か本実施例による場合を
、16が従来の方法の駆1合を示す、。
従来の方法では全く認識のできなか−った/り/か標準
パターンを設けることにより62%認識できるようにな
り、寸だ、/Z/や/b/、/〔l/に効果の大きいこ
とがわかる3、無声子音も全て向1.シフ、標準パター
ン/に/を設けjtコとt/C,1:す!4Jvr /
KJ に’いて効果の大きいことを示している1、17
は本実施例での平均認識率を、18は従来の力〜、での
平均認識法を示し、76係から87係・I−入きく向I
し、本実施例の有効性を示している4゜発明の効果 以上述べたように本発明は、あらかしめ多数話者の発声
した音声を適度な分析時04目+jに線形予測分析し、
求めたLPCケブストラノ、係数の多次元正規分布を仮
定した子音の音素又Q]、ど1素グループ毎の標準パタ
ーンを作成しておき、次Vこ、不特定話者の発声した入
力音声を同様に線形予測分析し、求めたLPCケプスト
ラム係数の前記標準パターンに対する確率密度又は尤度
とセグメンテーションのための特徴パラメータを求め、
まず特徴パラメータによって子音のセグメンテーション
を行なっプj後、その区間の中で前記確率密度又Ur尤
度に相当する値の総和の最も大きくなる音素をその区間
における音素を決定し、さらに」−記総和値VC無音の
存在5音素の接続時間等を組合ぜて音素の最終決定を行
うようにしたもので従来の方法に比して音素認識法を大
幅に向上し、高141.能の?1つ1語1:!ヒ識シス
テムを実現することができる利点を有する。
【図面の簡単な説明】
第1図は従来の音声認識/ステムのフローを示す図、第
2図は従来方法における子音認識のための音素判別図、
第3図は本発明の音素認識法を用いた音声認識装置の全
体構成の一例を示すブロック図、第4図は本発明の一実
施例でΔうる7j?素認識の例を示した図、第5図は語
頭子音の認識率を本発明と従来例を比較して示す図、第
6図に1、語中子音の認識率を、本発明と従来例を比較
しで示す図である。 20・・・・・マイク、21・・・・・A/D  変換
?り1へ22・・・・信号処理回路、23・・・・・線
形予測分析プロセツサ、24・・・・・マトリックス網
算機、25・・・・標準パターンメモリ、26・・・・
メインプロセツサ、27・・・・・・メモリ、28・・
・・・・単語辞書、29・・・・・I10部。 代理人の氏名 弁理士 中 尾 敏 男 ほか1名第1
図 入り肯声 読・轍蹄果

Claims (1)

    【特許請求の範囲】
  1. 予め多数話者の音声を適度な分析時間毎に線形予測分析
    してLPCケプストラム係数を求め、子音の音素又は音
    素グループ毎に、LPCケプストラム係数の多次元正規
    分布を仮定した標準パターンを作成しておき、入力音声
    について同様に線形予測分析して求めたLPCケプスト
    ラム係数の前記標準パターンに対する確認密度又U1、
    先度を分析区間毎に算出し、さらに有声無声判定と有音
    無音判定を行い、セグメンテーションにより求められノ
    こ子音それぞれについて、音素の始端から終端寸での区
    間の前記確率密度又は先度の総和の最大となる1;1素
    を選択し、前記確率密度又は尤度の総和の最大と々る音
    素に、音素の4′−1j゛続時間、有声、無声、無音の
    存在からなる項目のうちの少なくとも一項を組合わせる
    ことにより子音の音素名を決定することを將徴とする音
    素認識法3゜
JP57171633A 1982-09-29 1982-09-29 音素認識法 Pending JPS5958497A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP57171633A JPS5958497A (ja) 1982-09-29 1982-09-29 音素認識法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP57171633A JPS5958497A (ja) 1982-09-29 1982-09-29 音素認識法

Publications (1)

Publication Number Publication Date
JPS5958497A true JPS5958497A (ja) 1984-04-04

Family

ID=15926802

Family Applications (1)

Application Number Title Priority Date Filing Date
JP57171633A Pending JPS5958497A (ja) 1982-09-29 1982-09-29 音素認識法

Country Status (1)

Country Link
JP (1) JPS5958497A (ja)

Similar Documents

Publication Publication Date Title
Zue The use of speech knowledge in automatic speech recognition
JPH09500223A (ja) 多言語音声認識システム
China Bhanja et al. A pre-classification-based language identification for Northeast Indian languages using prosody and spectral features
Anoop et al. Automatic speech recognition for Sanskrit
Paulose et al. Performance evaluation of different modeling methods and classifiers with MFCC and IHC features for speaker recognition
Kangas Phoneme recognition using time-dependent versions of self-organizing maps.
Akila et al. Isolated Tamil word speech recognition system using HTK
Davis et al. Evaluation of acoustic parameters for monosyllabic word identification
Oladipo et al. Automatic speech recognition and accent identification of ethnically diverse Nigerian English speakers
Mahmud Performance Analysis of Different Acoustic Features Based on LSTM for Bangla Speech Recognition
Mashao Computations and Evaluations of an Optimal Feature-set for an HMM-based Recognizer
Chang et al. Chinese dialect identification using segmental and prosodic features
Raghudathesh et al. Analysis and classification of spoken utterance using feature vector statistics and machine learning algorithms
Çömez Large vocabulary continuous speech recognition for Turkish using HTK
Dass The Comparative Analysis of Speech Processing Techniques at Different Stages
Bhattachajee et al. An experimental analysis of speech features for tone speech recognition
Huggins et al. The use of shibboleth words for automatically classifying speakers by dialect
Marasek Large vocabulary continuous speech recognition system for Polish
Manjunath et al. Improvement of phone recognition accuracy using source and system features
Reddy Using Syllable Boundary Information for Query-by-Example Spoken Term Detection
JP2003345384A (ja) 音声認識装置、音声認識方法および音声認識プログラム
JPS5958493A (ja) 認識装置
Bronson Syntactic pattern recognition of discrete utterances
JPS60164800A (ja) 音声認識装置
Zheng et al. A Chinese speech recognition system