JPS5958497A - 音素認識法 - Google Patents
音素認識法Info
- Publication number
- JPS5958497A JPS5958497A JP57171633A JP17163382A JPS5958497A JP S5958497 A JPS5958497 A JP S5958497A JP 57171633 A JP57171633 A JP 57171633A JP 17163382 A JP17163382 A JP 17163382A JP S5958497 A JPS5958497 A JP S5958497A
- Authority
- JP
- Japan
- Prior art keywords
- phoneme
- standard pattern
- recognition
- consonant
- analysis
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
産業上の利用分野
本発明は人間によって発声された音声化けを自動的に認
識するだめの、音声自動認識・/ステムにおける音素認
識法に関するものである。
識するだめの、音声自動認識・/ステムにおける音素認
識法に関するものである。
従来例の構成とその問題点
人間によって発声された音声を自動的に認識する音声自
動認識装置は人間から電子割算磯や各種機械へデータや
命令を鳥える手段として非常に有効と考えられる。
動認識装置は人間から電子割算磯や各種機械へデータや
命令を鳥える手段として非常に有効と考えられる。
従来研究あるいは発表されている音声自動認識システム
の動作原理としてはバタンマツチング法が多く採用され
ている3、この方法は認識さ牙する必要がある全種類の
右記に対して標準パターンあらかじめ記憶しておき、入
力される未知の入カバターンと比較することによって一
致の度合(以下類似度と呼ぶ)を言」算し、最大一致か
得ら才するt、Hl:(準パターンと同一の単語である
と判定するものである。このバタンマツチング法では認
識されるべき全ての単語に対して標準パターンを用意し
なけ)−シばならない/こめ、発声者が変つ/と」21
合には新らしく標準パターン全入力して記憶させる必9
1.1がある。。
の動作原理としてはバタンマツチング法が多く採用され
ている3、この方法は認識さ牙する必要がある全種類の
右記に対して標準パターンあらかじめ記憶しておき、入
力される未知の入カバターンと比較することによって一
致の度合(以下類似度と呼ぶ)を言」算し、最大一致か
得ら才するt、Hl:(準パターンと同一の単語である
と判定するものである。このバタンマツチング法では認
識されるべき全ての単語に対して標準パターンを用意し
なけ)−シばならない/こめ、発声者が変つ/と」21
合には新らしく標準パターン全入力して記憶させる必9
1.1がある。。
従って日本全国の都市名のようしこ12’l i’T
Fn類以にの11を詔を認識対象とするようなi混合、
全(Φ類の中a1′;を発声して登録するには膨大な時
間と労カイi−″必四とし、又登録に要するメモリー容
i74も膨k (1(−f3ツ、ことが予想される。さ
らに入カバターンと(シ1“jfi、h、yzパターン
バタンマツチングに・皮する時間も’l” 1ili数
か多くなると長くなってし−まう欠点か7(す/1、。
Fn類以にの11を詔を認識対象とするようなi混合、
全(Φ類の中a1′;を発声して登録するには膨大な時
間と労カイi−″必四とし、又登録に要するメモリー容
i74も膨k (1(−f3ツ、ことが予想される。さ
らに入カバターンと(シ1“jfi、h、yzパターン
バタンマツチングに・皮する時間も’l” 1ili数
か多くなると長くなってし−まう欠点か7(す/1、。
これに対して、入力音声を音素?)1−位に分1dで1
′?素の組合せとして認識しく以下と1素紹識と吋ふ)
音素単位で表記された単語辞書との類イ」月W4−・求
める方法は単語辞書に要するメモリー容111か火it
に少なくて済みバタンマツチングにJ、Q−J−、/、
、 lI冒[1jか’t:’、)くでき、故実の内容変
更も容易で;(す/・という!1′1長を持っている。
′?素の組合せとして認識しく以下と1素紹識と吋ふ)
音素単位で表記された単語辞書との類イ」月W4−・求
める方法は単語辞書に要するメモリー容111か火it
に少なくて済みバタンマツチングにJ、Q−J−、/、
、 lI冒[1jか’t:’、)くでき、故実の内容変
更も容易で;(す/・という!1′1長を持っている。
この方法の例は[7’r、)!・スーくりトルの概略形
とその動特性を利用し/r.単iirF ’?η声認識
/ステムー1三輪他,日本音響学会に!:34(197
8)に述べである,。
とその動特性を利用し/r.単iirF ’?η声認識
/ステムー1三輪他,日本音響学会に!:34(197
8)に述べである,。
この方法における単語認識システムのフローを第1図に
示す。1ず、あらかじめ多数話者の音声を10msの分
析区間毎に音響分析部1によ−・てフィルタバンクを用
いて分析し、得らノまたスペクトル メータを求める。この特徴パラメータから/a/。
示す。1ず、あらかじめ多数話者の音声を10msの分
析区間毎に音響分析部1によ−・てフィルタバンクを用
いて分析し、得らノまたスペクトル メータを求める。この特徴パラメータから/a/。
10/等の母音や,/m/,/b/等の子音に代表され
る音素毎又は音素グループ毎に標準パターンヲ作成して
標準パターン登録部6(/C登録し2ておく。。
る音素毎又は音素グループ毎に標準パターンヲ作成して
標準パターン登録部6(/C登録し2ておく。。
次に、入力された不111定話者の音声を、同様に分析
区間fnに音響分析部1によって分析し、j1’.’j
徴抽出部2によって特徴パラメータを求める。、この特
徴パラメータと標準パターン登録部5の(;p準バクー
ンk)月いてセグメンデーヅヨン’RB 3 (tこよ
、・いてtυ音と子音の区切り作業(以下セグメンーア
ーノ9ンと呼ぶ)を行なう2、この結果をもとに、7”
r,二4:’,判別部4において標準パターン登録部5
の4,HV4準パターンと照合することによって、最も
耕似度の高い標準パターンに該当する音素をその区間し
こおける音素と決定する4。
区間fnに音響分析部1によって分析し、j1’.’j
徴抽出部2によって特徴パラメータを求める。、この特
徴パラメータと標準パターン登録部5の(;p準バクー
ンk)月いてセグメンデーヅヨン’RB 3 (tこよ
、・いてtυ音と子音の区切り作業(以下セグメンーア
ーノ9ンと呼ぶ)を行なう2、この結果をもとに、7”
r,二4:’,判別部4において標準パターン登録部5
の4,HV4準パターンと照合することによって、最も
耕似度の高い標準パターンに該当する音素をその区間し
こおける音素と決定する4。
最後に、この結果作成した音素の時系列(以下音素系列
と呼ぶ)を単語認識部6に送り、同様に音素系列て表現
さf]た単語辞書7と最も類似度の大きい項目に該当す
る単語を認識結果としてlJj力する。
と呼ぶ)を単語認識部6に送り、同様に音素系列て表現
さf]た単語辞書7と最も類似度の大きい項目に該当す
る単語を認識結果としてlJj力する。
以十述べた単語認識システムのフロー(lこおいて音素
判別部4はその中心をなすものである,、?Cの部分に
」:って音素の名前を決定するため、音素系列はこの時
点でほぼ決定され、後段においてその内容を修復するこ
とは致しい。従−)てこの部分で音素判別を誤った場合
には単語認識N<:S 6[において全く関係のない単
語辞書と類似することによって認識単語を誤ってし寸う
危険性か人きくなる1。
判別部4はその中心をなすものである,、?Cの部分に
」:って音素の名前を決定するため、音素系列はこの時
点でほぼ決定され、後段においてその内容を修復するこ
とは致しい。従−)てこの部分で音素判別を誤った場合
には単語認識N<:S 6[において全く関係のない単
語辞書と類似することによって認識単語を誤ってし寸う
危険性か人きくなる1。
オず、従来の音素判別の方法石−次にj15へる。第1
図の音響分析部1において)rルタバンつてあらかしめ
多数話者の音声をスペクトル分析し、特徴抽出部2でス
ペクトルのピークイ「求め、音素毎にスペクトルピーク
の周波数分イ1jケ求める3、これを第2図に示すよう
に、横ilIll+ (/C第1のピーク。
図の音響分析部1において)rルタバンつてあらかしめ
多数話者の音声をスペクトル分析し、特徴抽出部2でス
ペクトルのピークイ「求め、音素毎にスペクトルピーク
の周波数分イ1jケ求める3、これを第2図に示すよう
に、横ilIll+ (/C第1のピーク。
!i,Y輔に第2のピークを配置したγN素tll別l
ツlと1〜で寸とめ、標準パターンとする。しかる後に
、入力された話者の音声について前記方法と同様に周波
数スペクトルのピーク周波数を求め、第2図ヴ用″τ素
判別図にピーク周波数をあてはめることによー。
ツlと1〜で寸とめ、標準パターンとする。しかる後に
、入力された話者の音声について前記方法と同様に周波
数スペクトルのピーク周波数を求め、第2図ヴ用″τ素
判別図にピーク周波数をあてはめることによー。
て分析区間毎に音素名を決定し、−音素区間で最も数の
多かった音素名をその区間における音素と決定する方法
である。
多かった音素名をその区間における音素と決定する方法
である。
この方法はスペクトルのピークにのみ’jH [ilす
るためアルコリズムとしては簡1%であるか、ピーク周
波数の似かよった音素間てd−それらのI’ll別か知
しく、音素認識率を低−ドさせてし甘う欠点かあったa
(ll′に子音においては/n/,/b/,/r/のよ
うにピーク周波数の似かよった音素の区別か報(シ、く
お〃いの混同か非常に大きい欠点かぁー・た1、これら
の音素を区別するためにはスベク]・ルのピーク1/こ
着目するのみでなく、スペクトル全体の形:lIり(′
こ着目しなけれは区別することはできない1。
るためアルコリズムとしては簡1%であるか、ピーク周
波数の似かよった音素間てd−それらのI’ll別か知
しく、音素認識率を低−ドさせてし甘う欠点かあったa
(ll′に子音においては/n/,/b/,/r/のよ
うにピーク周波数の似かよった音素の区別か報(シ、く
お〃いの混同か非常に大きい欠点かぁー・た1、これら
の音素を区別するためにはスベク]・ルのピーク1/こ
着目するのみでなく、スペクトル全体の形:lIり(′
こ着目しなけれは区別することはできない1。
発明の目的 ゛
本発明は一lx記欠点を解消し、音素認識イ・−の大幅
向上をはかった音素認識法呑−I)、1供することを・
l・1的とする,J 発明つ褐へ・ 本発明は上記目的を達成するために、寸ずあらかじめ多
数話者の発声した音′fi;データに目視によって音素
名のラベル伺けをしておき、次にこの音声データを線形
予測分析することに、L−・てLPCケプストラム係数
を求め、この係数の多次ノ1〕面規分布を仮定して標準
パターンを作成する1、この係数は音声信号のスペクト
ル包絡を表わすパラメータで、スペクトル全体の概略形
を・保1旨7でぃ/)3゜次に入力音声について線形予
測り)イIi L−1LPGり一ブストラム係数を求め
てiiJ記標ベイパクーノと照合するようにしたもので
、従来の方法の、1−うにスー(りトルのピークのみで
は区別のできなか、/、冒’′l”!’、を、ピーク以
外の情報にも着1゛1ず/′、)ことI/(−,1:
・−C分離することが可能となり、?:r’ ;(’1
j。IJ識(、ろ友1:°1゛1に1古J−J二できる
。。
向上をはかった音素認識法呑−I)、1供することを・
l・1的とする,J 発明つ褐へ・ 本発明は上記目的を達成するために、寸ずあらかじめ多
数話者の発声した音′fi;データに目視によって音素
名のラベル伺けをしておき、次にこの音声データを線形
予測分析することに、L−・てLPCケプストラム係数
を求め、この係数の多次ノ1〕面規分布を仮定して標準
パターンを作成する1、この係数は音声信号のスペクト
ル包絡を表わすパラメータで、スペクトル全体の概略形
を・保1旨7でぃ/)3゜次に入力音声について線形予
測り)イIi L−1LPGり一ブストラム係数を求め
てiiJ記標ベイパクーノと照合するようにしたもので
、従来の方法の、1−うにスー(りトルのピークのみで
は区別のできなか、/、冒’′l”!’、を、ピーク以
外の情報にも着1゛1ず/′、)ことI/(−,1:
・−C分離することが可能となり、?:r’ ;(’1
j。IJ識(、ろ友1:°1゛1に1古J−J二できる
。。
実施例の説明
第3図に本発明の音素認識法イτ・J+、体化する1゛
1声自動認識システムの構成の一実hfu例イ「小ず3
゜マイク20から入った音声信−弓i1、A 、/ D
変換部21で12kt(zザンプリングされ12ビ、l
にA/D変換する。これを信号処理回路22て6 d
B/ 、4クターブのプリエンファシスおよび20 m
sのハミング窓をかけ、10m5毎’tc 線形予測
分析プロセッサ23にてLPCケプストラム係数を9出
する3、このLPCケプストラム係数で標準パターンメ
モリ25に登録した標準パターンに対する確率密度関数
又は尤度をマトリクス刷算機24Vこて言1算し結果を
メモリ2了に転送する。一方、パワー泪a音1(30(
7こて音声のパワーを計算し、メモリ27に転送する。
1声自動認識システムの構成の一実hfu例イ「小ず3
゜マイク20から入った音声信−弓i1、A 、/ D
変換部21で12kt(zザンプリングされ12ビ、l
にA/D変換する。これを信号処理回路22て6 d
B/ 、4クターブのプリエンファシスおよび20 m
sのハミング窓をかけ、10m5毎’tc 線形予測
分析プロセッサ23にてLPCケプストラム係数を9出
する3、このLPCケプストラム係数で標準パターンメ
モリ25に登録した標準パターンに対する確率密度関数
又は尤度をマトリクス刷算機24Vこて言1算し結果を
メモリ2了に転送する。一方、パワー泪a音1(30(
7こて音声のパワーを計算し、メモリ27に転送する。
メインプロセッサ26でd]メモリ27のデータを用い
てセグメンテーションと名素f、lI別を行ない、音素
系列を単語辞引28と照合することによって最も類イ」
)1度の大きい浄語名を認識結宋とし2てI10部29
pこ出力する3、次に本発明に係る1ll−素認識法の
実h[11例についで第3図を参照にしk・がら詳しく
説明する。
てセグメンテーションと名素f、lI別を行ない、音素
系列を単語辞引28と照合することによって最も類イ」
)1度の大きい浄語名を認識結宋とし2てI10部29
pこ出力する3、次に本発明に係る1ll−素認識法の
実h[11例についで第3図を参照にしk・がら詳しく
説明する。
−まず標準パターンの作成方法(・でついて述へる。
あらかじめ多数話者の発声した多数のrl、−,77i
音声を/a/、10/等の旬1°i +/m/、/b/
等の有声子音。
音声を/a/、10/等の旬1°i +/m/、/b/
等の有声子音。
/S/JV等の無声r音のような7゛7素に分け、音素
の区切りとラベル伺けを行ってγ冒l・データを作成し
ておく。この音声データを用い、信シJ″処:171!
1ijl路22及び線形予測分析プロセッーリ23し
く−より必要とする音素の区間を10m5程度の分41
区間毎に次数15程度の線形予測分析を1Jい線形予測
係数を求める6、この線形予測係数からンlUi化式に
よりLPCケプストラム係数を算出する6、音素lにお
けるLPCケプストラム係数をCよ(n)とすると(n
は音素iの出現番号)、LPCケプストラム係数の平均
値m・ は ここでN1 は音素iの出現数である。
の区切りとラベル伺けを行ってγ冒l・データを作成し
ておく。この音声データを用い、信シJ″処:171!
1ijl路22及び線形予測分析プロセッーリ23し
く−より必要とする音素の区間を10m5程度の分41
区間毎に次数15程度の線形予測分析を1Jい線形予測
係数を求める6、この線形予測係数からンlUi化式に
よりLPCケプストラム係数を算出する6、音素lにお
けるLPCケプストラム係数をCよ(n)とすると(n
は音素iの出現番号)、LPCケプストラム係数の平均
値m・ は ここでN1 は音素iの出現数である。
音素1のLPCケプストラム係数の共分散行列ここでt
(/i転置行列であることを示す、。
(/i転置行列であることを示す、。
標準パターンとしては有声と無声、又は有音と無声の同
居しない音素として次のものについて多次元正規分布を
仮定し」二記1,2式、1.す求め標準パターンメモリ
25に登録しておく。
居しない音素として次のものについて多次元正規分布を
仮定し」二記1,2式、1.す求め標準パターンメモリ
25に登録しておく。
〔1〕 母音/a/、10/、/u/、/i/、/e/
、/S/(無声音) 〔2〕 有声子音/N/(鼻音)、/B/(イi′I
′A破裂音) ? /r/+/D/、/h1/ (/a
/、10/。
、/S/(無声音) 〔2〕 有声子音/N/(鼻音)、/B/(イi′I
′A破裂音) ? /r/+/D/、/h1/ (/a
/、10/。
/u汐つ後続する/h/)/に、/(/a/T10/。
/u/の後続する/に/)
〔3〕 無声子音/S/(無声摩擦音) + /h7
C/a/。
C/a/。
10/、/u/以外の後続する/h/)、外、/(/a
/、10/、/u/以外の後続する/に/)(IJ、(
2J式による標準パターン作成には多数話者の音声デー
タにラベル付けした各音素の全区間を使用する。従って
この標準パターンiJ−話者の個人差を吸収して不特定
話者に対応できると共に、同−音素内の時間変動を吸収
できる特長も(+!fiえている。
/、10/、/u/以外の後続する/に/)(IJ、(
2J式による標準パターン作成には多数話者の音声デー
タにラベル付けした各音素の全区間を使用する。従って
この標準パターンiJ−話者の個人差を吸収して不特定
話者に対応できると共に、同−音素内の時間変動を吸収
できる特長も(+!fiえている。
しかし同−音素内で有声、無声の両方あるいは有音、無
音の両方を持つ等の変動要因の大きい音素は多次元正規
分布を仮定することができないので標準パターンから除
く。。
音の両方を持つ等の変動要因の大きい音素は多次元正規
分布を仮定することができないので標準パターンから除
く。。
次にマイク20から入力さ、11−だ未知な音声信号に
ついて、信号処理回路22及び線形予測分析プロセツサ
23を使用してLPCり゛ブストラム係数Cxを求め、
7トリツクス言1算機24に転送し、予め求めて標準パ
ターンメモリ25に収納しである標準パターンm工、W
エ を用いで、LPCケプストラム係数Cx の音素C
xの音素iの4′7’!準パターンに対する確率密度関
係P□を求め、メモリ27に記憶する。
ついて、信号処理回路22及び線形予測分析プロセツサ
23を使用してLPCり゛ブストラム係数Cxを求め、
7トリツクス言1算機24に転送し、予め求めて標準パ
ターンメモリ25に収納しである標準パターンm工、W
エ を用いで、LPCケプストラム係数Cx の音素C
xの音素iの4′7’!準パターンに対する確率密度関
係P□を求め、メモリ27に記憶する。
未知な音声のLPCケプストラム係数Cの音素1の標準
パターンに対する確率密度1′)j数P1←]、3Wf
(Cx−m、)] ”””(’=
9ここでwHは共分散行列W□ の逆行列、 L i1
gLPcケプストラム係数の次数であ2)。
パターンに対する確率密度1′)j数P1←]、3Wf
(Cx−m、)] ”””(’=
9ここでwHは共分散行列W□ の逆行列、 L i1
gLPcケプストラム係数の次数であ2)。
一方パワー割算部30によりセグメンテーション用パラ
メータを割算しメモリ27に転」4する。
メータを割算しメモリ27に転」4する。
メインプロセノザ26でセグメンテーション用パラメー
タを用いて子音区間の確率密度の総和を割算するととも
に有声無声判定及び有音無音”glJ定を行いその結果
をメモリ27に転送する。。
タを用いて子音区間の確率密度の総和を割算するととも
に有声無声判定及び有音無音”glJ定を行いその結果
をメモリ27に転送する。。
次にメモリ2Yより上NIL結果を読み出し、メインプ
ロセソザ26により子音を決定し音素系列をつくるL、 その結果と単語辞書28を、照合し、最も類似度の高い
単語を認識結果としてI10部29に出力する。
ロセソザ26により子音を決定し音素系列をつくるL、 その結果と単語辞書28を、照合し、最も類似度の高い
単語を認識結果としてI10部29に出力する。
第4図はある成人男子の発声した/RA K U D
A/という単語を音素認識した例で、横軸はパラメータ
の種類を表わす、Aはあらかじめ目視によ−)て分析区
間毎に音素名のラベルイ」けをしたものである。
A/という単語を音素認識した例で、横軸はパラメータ
の種類を表わす、Aはあらかじめ目視によ−)て分析区
間毎に音素名のラベルイ」けをしたものである。
Bは母音の標準パターンに対する事後確率を求めて示し
たもので、同様にCは子音の標19−パターンに対する
事後確率を示しだものであZ)、、D4.l雪′<声パ
ワーの時間変化を示したもので、liJ音と子音の境界
を決定するセグメンテーションに使用する。
たもので、同様にCは子音の標19−パターンに対する
事後確率を示しだものであZ)、、D4.l雪′<声パ
ワーの時間変化を示したもので、liJ音と子音の境界
を決定するセグメンテーションに使用する。
lS<無音声であることを示す、、Ei7j、Bの結果
より最も確率の高か−、たけ音を分析区間4Uに示した
もの、Fは母音の認識結果を小し/4もの、Hl: C
の結果より最も確率の高かった千7′4. f、’ 、
j()i区間4υに示したものである。又、Gfd−音
声が有声音の場合はv9無声音の場合し、1]u、無声
音の1易合&:l:Qで示したものである。捷ずり、E
、Gのパラメータを用いて母音と子音の境界を決定し7
、’l” )irF/RAKUDA/の子音/R/、/
に/+/Dyの領域を決、定する。決定した/Rfi)
区間中−〇’−,ri’r 4図Cに示す子音の標準パ
ターンに7・1する@I率の総1lVllを標準パター
ン毎に計算すると/r 7j/) 標7((パターンに
対する確率の総和が最も太きかつブr−こと苓−°ン」
、し、これを認識結果としてIに示す3.同様しこ/D
/lJ)区間中で確率の総和の最も大きい標準パターン
ル佃/てあり、これを認識結果として工に示J−4゜子
音/に、4d、その区間中で有音部(無γ?以外のとこ
ろ)における標準パターン/に1/又は/に2/に対す
る確率が最も高いことと、無音の存在(Qで示す)より
、無声破裂音/P/ として認識し、とれを工に示す。
より最も確率の高か−、たけ音を分析区間4Uに示した
もの、Fは母音の認識結果を小し/4もの、Hl: C
の結果より最も確率の高かった千7′4. f、’ 、
j()i区間4υに示したものである。又、Gfd−音
声が有声音の場合はv9無声音の場合し、1]u、無声
音の1易合&:l:Qで示したものである。捷ずり、E
、Gのパラメータを用いて母音と子音の境界を決定し7
、’l” )irF/RAKUDA/の子音/R/、/
に/+/Dyの領域を決、定する。決定した/Rfi)
区間中−〇’−,ri’r 4図Cに示す子音の標準パ
ターンに7・1する@I率の総1lVllを標準パター
ン毎に計算すると/r 7j/) 標7((パターンに
対する確率の総和が最も太きかつブr−こと苓−°ン」
、し、これを認識結果としてIに示す3.同様しこ/D
/lJ)区間中で確率の総和の最も大きい標準パターン
ル佃/てあり、これを認識結果として工に示J−4゜子
音/に、4d、その区間中で有音部(無γ?以外のとこ
ろ)における標準パターン/に1/又は/に2/に対す
る確率が最も高いことと、無音の存在(Qで示す)より
、無声破裂音/P/ として認識し、とれを工に示す。
このように、本実施例はあらかじめ子音に相当する区間
をセグメンテーションした後、そのr、 、’g区間V
こおける各様べf2パターンに対する確率の総和が最も
大きい音素しこ相当するものを認識音素とすることを基
本とする。1これに、音素の+Φ類によ−・て無音の存
在、無声音の存在、子音の1.1続時間を併用して音素
判別を行なう。本実施例に、1゜・いてLPCケプスト
ラム係数を出い、スペクI・ルのピークのみでなく、ス
ペクトル全体の形状VCk目することと、各標準パター
ンに対する類似度か確率で表示できる点か従来と大きく
異なり、スベク[・ルのピーク周波数の似かよった子音
間の[メ別かしやすく、又認識した音素のイご軸度を表
わすことも可能である。。
をセグメンテーションした後、そのr、 、’g区間V
こおける各様べf2パターンに対する確率の総和が最も
大きい音素しこ相当するものを認識音素とすることを基
本とする。1これに、音素の+Φ類によ−・て無音の存
在、無声音の存在、子音の1.1続時間を併用して音素
判別を行なう。本実施例に、1゜・いてLPCケプスト
ラム係数を出い、スペクI・ルのピークのみでなく、ス
ペクトル全体の形状VCk目することと、各標準パター
ンに対する類似度か確率で表示できる点か従来と大きく
異なり、スベク[・ルのピーク周波数の似かよった子音
間の[メ別かしやすく、又認識した音素のイご軸度を表
わすことも可能である。。
これに対して従来の方法ではスペクトルのピークのみに
落目するため、その(jJかl、−1たj’7(、’、
、 (例えば/n/と/b/、/r/)f:区別するこ
としよしはしは難しかった。例えば第4図の語頭/ r
/−iスペクトルのピークのみで判別することに1−難
しい理由により、従来は認識する方法かなく、/N/又
は/B/としていた。又、第4図の語中の音素/に/に
おいては、その区間中の無音の存在と有音部の持続時間
のみで決定するため、同様に無音の存在し得る音素/C
,,/+//b/としばしば誤る欠点を持っていた。。
落目するため、その(jJかl、−1たj’7(、’、
、 (例えば/n/と/b/、/r/)f:区別するこ
としよしはしは難しかった。例えば第4図の語頭/ r
/−iスペクトルのピークのみで判別することに1−難
しい理由により、従来は認識する方法かなく、/N/又
は/B/としていた。又、第4図の語中の音素/に/に
おいては、その区間中の無音の存在と有音部の持続時間
のみで決定するため、同様に無音の存在し得る音素/C
,,/+//b/としばしば誤る欠点を持っていた。。
第4図は本実施例によってこれらの欠点を解決した結果
を示している。
を示している。
以上を甘とめると、本実施例による音素認識法の特長は
次の通りである。
次の通りである。
(1)LPCケプストラムの多次元正規分布を仮定した
音素標準パターンを、多数話者の多敬音声ザンプルにあ
らかじめ音素のラベルイ・]けをして、全てのサンプル
点で作成する/こめ、話者の個人差と同一音素の時間変
動を吸収できる4、(2)LPCケプストラム係数がス
ペクトル包絡の概略形を表わす特徴量であるため、これ
を用いると、従来のスペクトルのピークのみに着目する
方法に比べ、スペクトルのピークの類似し/こ異音素間
の分離がし易い。。
音素標準パターンを、多数話者の多敬音声ザンプルにあ
らかじめ音素のラベルイ・]けをして、全てのサンプル
点で作成する/こめ、話者の個人差と同一音素の時間変
動を吸収できる4、(2)LPCケプストラム係数がス
ペクトル包絡の概略形を表わす特徴量であるため、これ
を用いると、従来のスペクトルのピークのみに着目する
方法に比べ、スペクトルのピークの類似し/こ異音素間
の分離がし易い。。
(3) 従来法の、一つの音素区間に」、・け2.第
1候補音素数の最も多いものを認識結果とす/、方法に
比し、一つの音素区間における各様7(Qパターンに対
する確率の総和の最も大きいものを認識結果とする本実
施例の方か、音素判別のだめの数値の精度が高い。
1候補音素数の最も多いものを認識結果とす/、方法に
比し、一つの音素区間における各様7(Qパターンに対
する確率の総和の最も大きいものを認識結果とする本実
施例の方か、音素判別のだめの数値の精度が高い。
第5図は語頭子音の認識法を従来の方法と本実施例によ
る方法で比較したもので11か本実施例による方法の場
合を、12は従来の方法の場合を示す。
る方法で比較したもので11か本実施例による方法の場
合を、12は従来の方法の場合を示す。
従来の方法では全く認識のできなかった子音/r/。
/2乃二認識できるようになり、/b/+/d/y/q
/の認識法か大きく向上していることかわがる1゜又、
無声破裂音/p/、/l/、/に/がいずれも向上して
いる。13は本実施例による甲−均認識法、14は従来
の方法による平均認識法を示し、57係から75%へと
大きく向上し本実施例による認識法の効果の犬なること
を示しててる33 第6図は語中子音の認識法を従来の方法と本実施例によ
る方法で比較したもので、16か本実施例による場合を
、16が従来の方法の駆1合を示す、。
/の認識法か大きく向上していることかわがる1゜又、
無声破裂音/p/、/l/、/に/がいずれも向上して
いる。13は本実施例による甲−均認識法、14は従来
の方法による平均認識法を示し、57係から75%へと
大きく向上し本実施例による認識法の効果の犬なること
を示しててる33 第6図は語中子音の認識法を従来の方法と本実施例によ
る方法で比較したもので、16か本実施例による場合を
、16が従来の方法の駆1合を示す、。
従来の方法では全く認識のできなか−った/り/か標準
パターンを設けることにより62%認識できるようにな
り、寸だ、/Z/や/b/、/〔l/に効果の大きいこ
とがわかる3、無声子音も全て向1.シフ、標準パター
ン/に/を設けjtコとt/C,1:す!4Jvr /
KJ に’いて効果の大きいことを示している1、17
は本実施例での平均認識率を、18は従来の力〜、での
平均認識法を示し、76係から87係・I−入きく向I
し、本実施例の有効性を示している4゜発明の効果 以上述べたように本発明は、あらかしめ多数話者の発声
した音声を適度な分析時04目+jに線形予測分析し、
求めたLPCケブストラノ、係数の多次元正規分布を仮
定した子音の音素又Q]、ど1素グループ毎の標準パタ
ーンを作成しておき、次Vこ、不特定話者の発声した入
力音声を同様に線形予測分析し、求めたLPCケプスト
ラム係数の前記標準パターンに対する確率密度又は尤度
とセグメンテーションのための特徴パラメータを求め、
まず特徴パラメータによって子音のセグメンテーション
を行なっプj後、その区間の中で前記確率密度又Ur尤
度に相当する値の総和の最も大きくなる音素をその区間
における音素を決定し、さらに」−記総和値VC無音の
存在5音素の接続時間等を組合ぜて音素の最終決定を行
うようにしたもので従来の方法に比して音素認識法を大
幅に向上し、高141.能の?1つ1語1:!ヒ識シス
テムを実現することができる利点を有する。
パターンを設けることにより62%認識できるようにな
り、寸だ、/Z/や/b/、/〔l/に効果の大きいこ
とがわかる3、無声子音も全て向1.シフ、標準パター
ン/に/を設けjtコとt/C,1:す!4Jvr /
KJ に’いて効果の大きいことを示している1、17
は本実施例での平均認識率を、18は従来の力〜、での
平均認識法を示し、76係から87係・I−入きく向I
し、本実施例の有効性を示している4゜発明の効果 以上述べたように本発明は、あらかしめ多数話者の発声
した音声を適度な分析時04目+jに線形予測分析し、
求めたLPCケブストラノ、係数の多次元正規分布を仮
定した子音の音素又Q]、ど1素グループ毎の標準パタ
ーンを作成しておき、次Vこ、不特定話者の発声した入
力音声を同様に線形予測分析し、求めたLPCケプスト
ラム係数の前記標準パターンに対する確率密度又は尤度
とセグメンテーションのための特徴パラメータを求め、
まず特徴パラメータによって子音のセグメンテーション
を行なっプj後、その区間の中で前記確率密度又Ur尤
度に相当する値の総和の最も大きくなる音素をその区間
における音素を決定し、さらに」−記総和値VC無音の
存在5音素の接続時間等を組合ぜて音素の最終決定を行
うようにしたもので従来の方法に比して音素認識法を大
幅に向上し、高141.能の?1つ1語1:!ヒ識シス
テムを実現することができる利点を有する。
第1図は従来の音声認識/ステムのフローを示す図、第
2図は従来方法における子音認識のための音素判別図、
第3図は本発明の音素認識法を用いた音声認識装置の全
体構成の一例を示すブロック図、第4図は本発明の一実
施例でΔうる7j?素認識の例を示した図、第5図は語
頭子音の認識率を本発明と従来例を比較して示す図、第
6図に1、語中子音の認識率を、本発明と従来例を比較
しで示す図である。 20・・・・・マイク、21・・・・・A/D 変換
?り1へ22・・・・信号処理回路、23・・・・・線
形予測分析プロセツサ、24・・・・・マトリックス網
算機、25・・・・標準パターンメモリ、26・・・・
メインプロセツサ、27・・・・・・メモリ、28・・
・・・・単語辞書、29・・・・・I10部。 代理人の氏名 弁理士 中 尾 敏 男 ほか1名第1
図 入り肯声 読・轍蹄果
2図は従来方法における子音認識のための音素判別図、
第3図は本発明の音素認識法を用いた音声認識装置の全
体構成の一例を示すブロック図、第4図は本発明の一実
施例でΔうる7j?素認識の例を示した図、第5図は語
頭子音の認識率を本発明と従来例を比較して示す図、第
6図に1、語中子音の認識率を、本発明と従来例を比較
しで示す図である。 20・・・・・マイク、21・・・・・A/D 変換
?り1へ22・・・・信号処理回路、23・・・・・線
形予測分析プロセツサ、24・・・・・マトリックス網
算機、25・・・・標準パターンメモリ、26・・・・
メインプロセツサ、27・・・・・・メモリ、28・・
・・・・単語辞書、29・・・・・I10部。 代理人の氏名 弁理士 中 尾 敏 男 ほか1名第1
図 入り肯声 読・轍蹄果
Claims (1)
- 予め多数話者の音声を適度な分析時間毎に線形予測分析
してLPCケプストラム係数を求め、子音の音素又は音
素グループ毎に、LPCケプストラム係数の多次元正規
分布を仮定した標準パターンを作成しておき、入力音声
について同様に線形予測分析して求めたLPCケプスト
ラム係数の前記標準パターンに対する確認密度又U1、
先度を分析区間毎に算出し、さらに有声無声判定と有音
無音判定を行い、セグメンテーションにより求められノ
こ子音それぞれについて、音素の始端から終端寸での区
間の前記確率密度又は先度の総和の最大となる1;1素
を選択し、前記確率密度又は尤度の総和の最大と々る音
素に、音素の4′−1j゛続時間、有声、無声、無音の
存在からなる項目のうちの少なくとも一項を組合わせる
ことにより子音の音素名を決定することを將徴とする音
素認識法3゜
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP57171633A JPS5958497A (ja) | 1982-09-29 | 1982-09-29 | 音素認識法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP57171633A JPS5958497A (ja) | 1982-09-29 | 1982-09-29 | 音素認識法 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPS5958497A true JPS5958497A (ja) | 1984-04-04 |
Family
ID=15926802
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP57171633A Pending JPS5958497A (ja) | 1982-09-29 | 1982-09-29 | 音素認識法 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS5958497A (ja) |
-
1982
- 1982-09-29 JP JP57171633A patent/JPS5958497A/ja active Pending
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Zue | The use of speech knowledge in automatic speech recognition | |
| JPH09500223A (ja) | 多言語音声認識システム | |
| China Bhanja et al. | A pre-classification-based language identification for Northeast Indian languages using prosody and spectral features | |
| Anoop et al. | Automatic speech recognition for Sanskrit | |
| Paulose et al. | Performance evaluation of different modeling methods and classifiers with MFCC and IHC features for speaker recognition | |
| Kangas | Phoneme recognition using time-dependent versions of self-organizing maps. | |
| Akila et al. | Isolated Tamil word speech recognition system using HTK | |
| Davis et al. | Evaluation of acoustic parameters for monosyllabic word identification | |
| Oladipo et al. | Automatic speech recognition and accent identification of ethnically diverse Nigerian English speakers | |
| Mahmud | Performance Analysis of Different Acoustic Features Based on LSTM for Bangla Speech Recognition | |
| Mashao | Computations and Evaluations of an Optimal Feature-set for an HMM-based Recognizer | |
| Chang et al. | Chinese dialect identification using segmental and prosodic features | |
| Raghudathesh et al. | Analysis and classification of spoken utterance using feature vector statistics and machine learning algorithms | |
| Çömez | Large vocabulary continuous speech recognition for Turkish using HTK | |
| Dass | The Comparative Analysis of Speech Processing Techniques at Different Stages | |
| Bhattachajee et al. | An experimental analysis of speech features for tone speech recognition | |
| Huggins et al. | The use of shibboleth words for automatically classifying speakers by dialect | |
| Marasek | Large vocabulary continuous speech recognition system for Polish | |
| Manjunath et al. | Improvement of phone recognition accuracy using source and system features | |
| Reddy | Using Syllable Boundary Information for Query-by-Example Spoken Term Detection | |
| JP2003345384A (ja) | 音声認識装置、音声認識方法および音声認識プログラム | |
| JPS5958493A (ja) | 認識装置 | |
| Bronson | Syntactic pattern recognition of discrete utterances | |
| JPS60164800A (ja) | 音声認識装置 | |
| Zheng et al. | A Chinese speech recognition system |