JP2655903B2 - 音声認識装置 - Google Patents

音声認識装置

Info

Publication number
JP2655903B2
JP2655903B2 JP1026033A JP2603389A JP2655903B2 JP 2655903 B2 JP2655903 B2 JP 2655903B2 JP 1026033 A JP1026033 A JP 1026033A JP 2603389 A JP2603389 A JP 2603389A JP 2655903 B2 JP2655903 B2 JP 2655903B2
Authority
JP
Japan
Prior art keywords
articulation
input
value
units
unit
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Fee Related
Application number
JP1026033A
Other languages
English (en)
Other versions
JPH02204798A (ja
Inventor
耕市 山口
憲治 坂本
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Consejo Superior de Investigaciones Cientificas CSIC
Original Assignee
Consejo Superior de Investigaciones Cientificas CSIC
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Consejo Superior de Investigaciones Cientificas CSIC filed Critical Consejo Superior de Investigaciones Cientificas CSIC
Priority to JP1026033A priority Critical patent/JP2655903B2/ja
Priority to US07/473,238 priority patent/US5175793A/en
Publication of JPH02204798A publication Critical patent/JPH02204798A/ja
Application granted granted Critical
Publication of JP2655903B2 publication Critical patent/JP2655903B2/ja
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Description

【発明の詳細な説明】 <産業上の利用分野> この発明は、音声認識時のマッチングの際における話
者の変動吸収や計算量の低減・効率化を可能にする音声
認識装置に関する。
<従来の技術> 一般に、単語音声認識装置には、単語を単位とする標
準パターンを用いて、マッチングによって単語音声を認
識する方式(単語音声認識方式)と、単語より小さい音
素や音節を単位とする標準パターンを用いてマッチング
によって単語音声を認識する方式(音素認識方式)とが
ある。
上記単語音声認識方式は、調音結合による誤認識とい
う問題がなく、高い認識率が得られる。ところが、語彙
数が増すと標準パターン数が増え、大きな記憶容量が必
要であるという問題がある。さらに、マッチングにおけ
る計算量が膨大なものになるという問題もある。特に、
不特定話者を対象としたときには、話者によって大きな
音声の変動が生じるため、一単語につき複数個の標準パ
ターン(マルチ・テンプレート)が必要となり、重大な
問題となる。上記音声の変動には種々の要因が考えられ
る。すなわち、話者には性別,年齢差および声道長差等
の生理的要因が存在するため、話者が変化すると音声に
変動が生じるのである。また、同一話者内であっても、
状況によって発生の仕方(声の大きさや発声速度など)
が異なったり、周囲騒音が変わったりすると音声に変動
が生じるのである。
そこで、上記語彙数が増加した場合の問題について
は、マッチングの対象となる標準パターン数を減らすた
めに、本番のマッチングを実行する前に入力音声の持続
時間,大局的特徴,局所的特徴および標準パターンとの
DPマッチングの中間結果等に基づいて標準パターンの予
備選択を実行するようにしている。
しかしながら、話者の変化に起因する音声の変動を完
全に除去する方法はまだ発見されていない。音声を1次
〜3次の臨海制動形の適応逆フィルタに通すことによ
り、話者による変動のうち音源特性をある程度補償でき
ることが知られている。また、かつて、第1〜第3ホル
マントを使って音声信号に簡単な変換を行い、話者間の
差を正規化しようとする試みが行われた程度である。
ところで、音響分析・特徴抽出の際においては、音声
を全極モデルと仮定することによって、音声を線形予測
分析(LPC)によって少ないパラメータで表現すること
ができる。このようなモデル化の手法を調音器官の構造
とその運動上の特性を直接的に表現することに利用し
て、声道断面積関数を効果的にモデル化して記述しよう
とする試みがある。これを調音パラメータxによる調音
モデルと呼ぶ(白井,誉田:“音声波からの調音パラメ
ータの推定”、信学論、61−A,5,pp409−416、昭53)。
上記調音パラメータxは、下顎の開閉角:X(J),舌面
の前後形:X(T1),高低変形:X(T2),口唇の開口面積
・突き出し:X(L).声門形:X(G),口蓋帆の開き
(鼻音化度):X(N)からなる。つまり、調音パラメー
タxはx=[X(T1),X(T2),X(J),X(L),X
(G),X(N)]と表すことができる。そして、調音パ
ラメータxから音響パラメータへ変換する非線形な調音
モデルが与えられるものと仮定し、逆に音響パラメータ
から非線形な最適化問題を解くことによって調音パラメ
ータxが求められるのである。この場合、上述のLPCに
おけるパラメータの次元数が通常12〜20であるのに対し
て、調音パラメータxの次元数は6である。したがっ
て、調音パラメータxにおいては、さらにLPCパラメー
タの1/2以下に情報圧縮していることになる。
先に、発明者らは、以上述べたような標準パターンの
予備選択や情報圧縮への応用、さらには、マッチングパ
スの制限への応用を考え、調音パラメータxに類似した
特徴として、声道中の調音点における狭めの度合い:C
や、調音点の前後方向の位置xおよび上下方向の位置y
を表す座標:(x,y)を抽出する音声の特徴抽出装置を
提案した。
上記狭めの度合いは、調音パラメータxでは精度上表
現するのが難しい半面、母音,摩擦およびクロージャ等
の調音様式に深くかかわっている。そこで、狭めの度合
いCは調音パラメータxや狭めの位置の座標(x,y)と
は別に抽出されて音声認識等に利用される。また、狭め
の度合いCおよび狭めの位置ベクトル(x.y)は、共に
音響パラメータからニューラル・ネットを用いることに
よって簡単に算出することができ、調音パラメータxの
ような非線形の最適化問題を避けることができるという
特徴を有する。
<発明が解決しようとする課題> 上述のように、一般に不特定話者を対象とする単語認
識においては、入力音声の特徴パターンと標準パターン
とのマッチング時における演算量が多くなるという問題
がある。
また、調音モデルを設定して、音響パラメータから調
音パラメータxを推定する方法は、非線形の最適化問題
を解かなければならず、計算量や収束の安定性の点で問
題がある。この問題を回避するために、パラメータの変
動範囲,連続性の考慮およびテーブル検索などの手段が
試されているが、本質的には計算量は多い。さらに上記
調音パラメータxは特定話者を対象としていると同時
に、母音定常部でしかうまく推定できないという問題も
ある。
また、ホルマント周波数を使うことによって不特定話
者に対応できるようにする種々の方法も提案されている
が、決定的なものはないのが現状である。
そこで、この発明の目的は、不特定話者を対象した音
声認識を行う際に、話者の生理的な差に起因する音声の
変動を除去できるような少ない次元の特徴量を、上記狭
めの度合いCおよび調音点の座標(x,y)の特徴量を更
に発展させることによって設定し、この特徴量を用いる
ことにより、標準パターン数およびマッチング計算量の
低減を実現することができる音声認識装置を提供するこ
とにある。
<課題を解決するための手段> 上記目的を達成するため、この発明の音声認識装置
は、入力された音声信号からこの音声信号の音響パラメ
ータを求める音響分析部と、上記音響パラメータに基づ
いて所定の手順で予め作製された教師データを用いて誤
差逆伝播法によって学習し、入力音声の音響パラメータ
を、調音点の前後・高低の各位置,声帯振動の有無,鼻
音化の度合いおよび円唇化の度合いのうち少なくとも一
つと調音点における声道の狭めの度合いと要素とする調
音ベクトルに変換する規則を自ら作成したニューラル・
ネットを有して、このニューラル・ネットによって、入
力音声の音響パラメータを上記調音ベクトルにフレーム
毎に変換するパターン変換部と、上記パターン変換部に
よって生成された音声サンプルの調音ベクトルの時系列
から成る標準パターンを格納する標準パターン格納部
と、上記パターン変換部によって生成された調音ベクト
ルの時系列から成る入力音声の特徴パターンと上記標準
パターンとのマッチングを、所定の手順によって求めら
れる上記両パターンの調音ベクトル時系列間の距離を用
いて行って入力音声を認識する識別部を備えたことを特
徴としている。
<作用> 音声信号が入力されると音響分析部によって音声信号
の音響パラメータが求められる。そうすると、パラメー
タ変換部のニューラル・ネットが、上記音響パラメータ
に基づいて所定の手順で予め作成された教師データを用
いた誤差逆伝播法による学習によって自ら作成した規
則、すなわち、入力音声の音響パラメータを、調音点の
前後・高低の各位置,声帯振動の有無,鼻音化の度合い
および円唇化の度合いのうち少なくとも一つと調音点に
おける声道の狭めの度合いと要素とする調音ベクトルに
変換する規則に従って、パターン変換部によって、入力
音声の音響パラメータがフレーム毎に上記調音ベクトル
に変換される。
そして、標準パターン格納部に格納された音声サンプ
ルの調音ベクトルの時系列から成る標準パターンと、上
記パターン変換部によって生成された調音ベクトルの時
系列から成る入力音声の特徴パターンとのマッチング
が、所定の手順によって求められる上記両パターンの調
音ベクトル時系列間の距離を用いて識別部によって行わ
れ、入力音声が認識される。
<実施例> 以下、この発明を図示の実施例により詳細に説明す
る。
第1図はこの発明に係る音声認識装置のブロック図で
ある。マイクロホン1から入力された音声信号は音響分
析部2によって分析処理され、単位時間(フレーム)毎
に音響パラメータの時系列が出力される。この音響分析
部2における音響分析としては、バンドパス・フィルタ
(BPF)群による周波数分析や高速フーリエ変換による
周波数分析、ケプストラム分析およびLPC等がある。
次に、上述のようにして得られた音響パラメータ時系
列はパターン変換部3に入力され、後に詳述するような
多層パーセプトロン型のニューラル・ネットを用いた手
法等により、狭めの度合い,調音点,鼻音化度,声帯振
動の有無および円唇化度等の要素からなる調音ベクトル
の時系列が生成される。つまり、入力音声は調音ベクト
ルの時系列(以下、特等パターンと言う)で表現された
ことになる。この調音ベクトルは、話者による周波数成
分の変動に存在しない要素で構成されており、話者の生
理的な差に起因する音声の変動を除去することができ
る。
第2図は「ジュウダイ」と発声された入力音声の波
形,音素記号列および調音ベクトルの各要素を示す。第
2図(a)は入力波形を示し、第2図(b)は上記入力
音声波形に対応する音素記号列を示す。第2図(b)に
おいて、bbはバスバー、dzは有声摩擦、sは無音、dは
破裂[d]、a,i,uおよびeは夫々母音[a],
[i],[u]および[e]を表わす。第2図(c)は
調音ベクトルの狭めの度合いを表す要素Cの値の時系列
を示す。図中、同じ値の要素Cが連続する区間すなわち
セグメント(要素Cの時系列のうち、隣接する同じ要素
Cの値をとるフレームを1まとまりにしたもの)を1ま
とめにして表現している。第2図(d)は調音ベクトル
の要素C以外の要素、すなわち、調音点の前後方向の座
標x,調音点の上下方向の座標y,鼻音化度n,声帯振動を有
無gおよび円唇化度lの時系列をアナログ的に示したも
のである。図中における値の大小は、xにおいては前
後、yにおいては高低、nにおいては大小、gにおいて
は有無、lにおいては大小に対応する。したがって、入
力音声の第jフレームajはaj=(xj,yj,nj,gj,lj,Cj)
と表すことができるのである。
一方、上述のようにして生成された入力音声の特徴パ
ターンとマッチングを取るための標準パターンも、入力
音声の特徴パターンと同様にして作成される。すなわ
ち、音声サンプルを音響分析して得られた特徴パラメー
タに基づいて、調音ベクトル時系列を音声サンプル毎に
求める。そして、クラスタリング等の統計処理によっ
て、幾つかの代表的な調音ベクトル時系列を導出するこ
とによって作成する。この作成された標準パターンは標
準パターン格納部6に格納される。
上記入力音声の特徴パターンと標準パターンとのマッ
チングが識別部5において行われる。その場合、両パタ
ーンの調音ベクトル時系列間のDPマッチングが行われ
る。その際に、認識語彙数が多い場合には、識別部5に
おけるマッチングの対象となる標準パターンを予備選択
部4で予備選択することによって絞り込む。こうするこ
とによって、音声認識に要するマッチングの計算量を低
減するのである。
上記識別部5は、予備選択部4によって選出された標
準パターンのすべての中から、算出した両パターン間の
距離Dに基づいて、入力音声の特徴パターンとの距離D
の値が最も小さい(すなわち、D=Dminである)標準パ
ターンを選出して、入力音声を識別する。
次に、予め設定されているリジェクト闘値θと、上記
最小距離Dminとが比較される。その結果、Dminがθ未満
であれば、入力された単語音声はそのDminを与える標準
パターンの単語であるとして認識される。逆にDminがθ
以上のときは、その入力音声はリジェクトされる。そし
て、上述の判定結果は表示部7に表示される。
次に、上記予備選択部4によって行われる予備選択お
よび識別部5においても行われるマッチングについて詳
細に述べる。上記予備選択部4における標準パターンの
予備選択は、上記調音ベクトル中の要素C(狭めの度合
い)を用いて行う。すなわち、入力音声の特徴パターン
と標準パターンとにおける記要素Cの時系列(以下、C
系列パターンと言う)を比較する。この場合、標準パタ
ーンのC系列パターンには、各々のセグメントの標準継
続時間およびセグメントの継続時間の許容範囲が格納さ
れている。この特徴パターンのC系列パターンと標準パ
ターンのC系列パターンとの比較に際しては、C系列パ
ターン中における各セグメントの要素Cの値のみなら
ず、各セグメントの継続時間および上記許容範囲も参照
して類似度が判断される。こうすることによって、特徴
パターンとほぼ一致した標準パターンを選出することが
できる。
上記識別部5におけるマッチングは、要素Cによるマ
ッチングパスの制限がついた方法によって行う。すなわ
ち、同種類のセグメント間の距離をDPマッチングにより
算出する。こうすることによって、DPマッチングの際の
計算量を少なくすることができるのである。入力音声の
特徴パターンと標準パターンとのマッチングの距離D
は、両パターンの第iセグメント間のDPマッチングによ
る距離をDiとおくと、Diに対する重みをp(k)(k=
0,1,2)、第iセグメントにおける要素Cの値をCi、総
セグメント数をNとして、 で表わされる。ここで、重みp(Ci)の値はCiの値(声
道閉鎖:Ci=0、狭め形成:Ci=1、声道開放:Ci=2)
による安定性やスペクトルのばらつきを考慮して、p
(0)<1,p(1)>1およびp(2)=1となるよう
に設定する。
また、上記入力音声の特徴パターンと標準パターンの
第iセグメント間の距離DiはDPマッチングにより求めら
れる。その際に、この算出に必要な両パターンの第iセ
グメントに属するフレームのフレーム間距離dとして、
両パターンの第iセグメントに属する上記フレームの各
調音ベクトル間の距離を用いる。すなわち、入力音声の
特徴パターンの第jフレームaj=(xj,yj,nj,gj,lj,C
j)と標準パターンの第kフレームbk=(xk,yk,nk,gk,l
k,Ck)との距離d(aj,bk)を、各要素に対する重みをw
x,wy,wn,wt,wc(≧0)として、 と表す。
ここで、各要素の重みは、音声の生成・知覚に対する
各要素の寄与度を考慮して、次のように設定する。
(wc>wx,wy>wn>wg>wl>0) 調音ベクトルの要素x,yは最も重要な要素であるから
重みwx,wyは大きな値とする。ただし、後述のように要
素Cの値によりwy=0,wx=1となることがある。要素l
は後述するように推定するのが難しく誤差が大きいの
で、重みwlは最小かあるいは0にする。要素gは発声の
仕方に大きく依存するため安定した特徴量とは言えない
ので、重みwgは重みwlに次いで小さい値とする。
要素Cは、上述のように、標準パターンの予備選択の
際におけるC系列パターンによるマッチング、あるい
は、識別部5における特徴パターンと標準パターンとの
マッチングの際のマッチングパス制限にすでに用いる。
したがって、重みwcはフレーム間距離dの算出の際には
用いなくてもよい。すなわち、wc=0である。ただし、
C系列パターンに基づく標準パターンの予備選択を行わ
ない場合や、特徴パターンと標準パターンとのマッチン
グの際にマッチング制限を用いない場合には、重みwcは
重みwx,wyよりも大きい値とする。この場合の特徴パタ
ーン標準パターンとのマッチングは、特徴パターンと標
準パターンの全区間に対するDPマッチングである。各重
みの設定例をケース1(標準パターン予備選択およびマ
ッチングパス制限有り)とケース2(標準パターン予備
選択およびマッチングパス制限無し)について示す。
表中、重みwx,wy,wlにおいては、要素Cの値等に応じ
て2つの値のうちいずれかを用いる。
以下、この発明の主要な部分である上記パターン変換
部3において実施される上記ニューラル・ネットによる
調音ベクトルの各要素C,x,y,n,g,lの生成方法について
詳細に述べる。
ここで、上記ニューラル・ネットについて簡単に説明
する。ニューラル・ネットとは、人間の脳の構造を真似
たネットワークであって、脳のニューロンに対応したユ
ニットが複数個複雑に接続しあって形成されている。上
記ユニットの構造は他のユニットからの入力信号を受け
る部分と、入力信号を一定の規則で変換する部分と、変
換した結果を出力する部分とから成る。上記複数のユニ
ットは、後に詳述するように入力層,中間層および出力
層からなる階層構造のネットワークを形成し、他のユニ
ットとの結合部には結合の強さを表す結合係数が付けら
れている。
上記結合係数はユニット間の結合の強さをあらわすも
のであり、この結合係数の値を変えるとネットワークの
構造が変わるのである。すなわち、上記ニューラル・ネ
ットの学習とは、所定の関数を有する2つの事象のうち
の一方の事象に属するデータを入力すると、そのデータ
に対応する他方の事象に属するデータを出力するように
ネットワークの構造を変えることである。
本実施例において用いたニューラル・ネットは第4図
に示すような構造を有している。すなわち、このニュー
ラル・ネットは図中下側から順に入力層11,中間層12お
よび出力層13から成る3層構造を有する。入力層11には
16個のユニット14,14,…を配し(後に詳述するように、
要素Cを生成するニューラル・ネットの場合には、この
16個のユニット14,14,…から成るユニットのセットを5
セット配する)、中間層12には生成する調音ベクトルの
要素に応じた数のユニット15,15,…を配し、出力層13に
は上記要素に応じた数のユニット16,16,…を配してい
る。上記入力層11の16個のユニット14,14,…の一つに
は、16チャンネルのBPF群の一つのチャンネルからの出
力信号が入力される。また、出力層13のユニット16,16,
…は、目的とする調音ベクトルの要素の値に応じた出力
値を出力するのである。入力層11の各ユニット14,14,…
は夫々中間層12の全ユニット15,15,…と接続している。
また、中間層12の各ユニット15,15,…は夫々出力層13の
全ユニット16,…,16と接続している。しかしながら、各
層内のユニット間は接続されない。
上記構造のニューラル・ネットは結合係数と共に上記
パターン変換部3の図示しないメモリに、調音ベクトル
の要素毎に格納されている。
上記構成のニューラル・ネットは次のように動作す
る。
入力音声の特徴パラメータとしてのBPF群からの出力
データが、各チャンネル別に入力層11の対応するユニッ
ト14,…,14に入力する。そうすると、この入力されたBP
F群からの出力データは各ユニット14,14,…において、
ジグモイド(sigmoid)関数によって変換されて、中間
層12の各ユニット15,15,…に伝えられる。その際に、中
間層12の各ユニット15,15,…には、入力層11の各ユニッ
ト14,14,…の出力値に対して上記結合係数を掛けた値の
総和が入力される。同様に、中間層12の各ユニット15,1
5,…は、入力層11の各ユニット14,14,…から入力された
値をシグモイド関数によって変換し、出力層13の各ユニ
ット16,16,…に出力する。その際に、出力層13の各ユニ
ット16,16,…には、中間層12の各のユニット15,15,…の
出力値に対して結合係数を掛けた値の総和が入力され
る。そして、出力層13の各ユニット16,16,…は中間層12
の各ユニット15,15,…から入力された値をシグモイド関
数によって変換して出力する。その際に、出力層13のユ
ニット16,16,…が調音ベクトルの何の要素の値に対応し
た値を出力するかは、後に説明するように、各要素毎の
学習によって設定される結合係数に基づくネットワーク
の構造によって決定されるのである。
次に、調音ベクトルの各要素の生成法について、要素
別に詳細に説明する。
(A)要素Cの生成 狭めの度合いを表す要素Cは、後に詳述するように、
誤差逆伝播法(Error Back Propagation法、以下、BP法
と言う)で学習した多層バーセプトロン型のニューラル
・ネットを用いて生成する。この要素Cの生成に用いら
れるニューラル・ネットにおいて、入力層11のユニット
14,14,…の数は上述のように80(16個のユニット14,14,
…から成るユニットのセットが5セット)である。ま
た、中間層12のユニット15の数は10であり、出力層13の
ユニット16の数は3である。この出力層の3個のユニッ
ト16,16,16を順に16a,16b,16cとすると、例えばユニッ
ト16aには、要素Cの一つの値C=0を割り当てる。ま
た、ユニット16bには、要素Cの他の一つ値C=1を割
り当てる。また、ユニット16cには、要素Cの他の一つ
値C=2を割り当てるのである。
上記ニューラル・ネットの学習の際に用いられる教師
データは、次のようにして作成する。すなわち、スペク
トログラムの視察によって音声サンプルにラベル付けを
行い、このラベルから所定の規則に従って要素Cの値を
求める。このようにして求められた、音声サンプルの要
素Cの値を表すデータを教師データとしてニューラル・
ネットの学習を次のようにして行う。
学習時には、ニューラル・ネットの入力層11のユニッ
ト14,14,…に要素Cの値が既知の音声サンプルにおける
対象フレームとその前後2フレームの合計5フレームの
音響パラメータ(すなわち、16チャンネルのBPF群から
の出力データ)が、各フレームおよび各チャンネル別に
(したがって、80種類のBPFの出力値が)入力される。
次に、出力層13の3個のユニット16a,16b,16cに、上
述のように入力層11に音響パラメータが入力された音声
サンプルの対象となるフレームに関する教師データ(す
なわち、上記対象フレームの要素Cの値に割り当てられ
たユニット(16a,16b,16cのいずれか)への入力値が
“1"であり、他のユニットへの入力値が“0"であるデー
タ)を入力する。そうすると、ニューラル・ネットは、
出力層13のユニット16a,16b,16cからの出力が教師デー
タと同じになるように結合係数を設定しなおしてネット
ワーク構造を決定するのである。
要素Cを生成する場合には、上述のようにして、多数
の教師データに基づいて学習したニューラル・ネットの
入力層11に、入力音声における音響パラメータ(すなわ
ち、音響分析2のBPF群からの出力データ)を入力す
る。そして、出力層13のユニット16a,16b,16cからの出
力値の一番大きな値を出力しているユニットに割り当て
られた要素Cの値を、その入力音声の要素Cの値とする
のである。この場合、ニューラル・ネットを多数話者の
音声サンプルから得られた教師データによって学習させ
ておけば、不特定話者に対しても安定して要素Cの値が
生成可能となる。
(B)要素x,yから成る座標(x,y)の生成 調音点の前後方向を表す要素xおよび上下方向を表す
要素yから成る座標(x,y)は、要素Cと同様にBP法で
学習した多層バーセプトロン型のニューラル・ネットを
用いて生成する。この場合、調音点の座標(x,y)の生
成方法は、母音区間と子音区間とによって異なる。ここ
で、母音区間とは要素Cの値がC=2のセグメントに対
応し、子音区間とはC=0,1のセグメントに対応する。
(a)母音区間(C=2) 母音区間における調音点の座標(x,y)生成に用いら
れるニューラル・ネットは、入力層11のユニット14の数
は上述のように16であり、中間層12のユニット15の数は
10であり、出力層13のユニット16の数は14である。この
出力層の14個のユニット16は7個づつ2つのグループか
ら成る。そして、そのうちの一方の7個の各ユニット16
d,16d,…には、要素xの座標値の大小に応じて7分割し
た座標値を割り当てる。また、他方の7個のユニット16
e,16e,…には、要素yの座標値の大小に応じて7分割し
た座標値を割り当てる。
上記ニューラル・ネットの学習の際に用いられる教師
データは、次のようにして作成する。すなわち、スペク
トログラムの視察によって母音区間と判定され、母音の
種類([a],[i],[u],[e],[o]のいず
れか)のラベル付けが成された単語中の母音の音声デー
タを音響分析してホルマントを抽出する。そして、予め
求められた調音点の座標(x,y)が既知の単母音ホルマ
ント周波数に基づいて、上記のようにして抽出された単
語中の母音のホルマント周波数から、この単語中の母音
の調音点の座標(x,y)を、予め多数のサンプルを基に
決められた所定のアルゴリズムに従って算出する。この
ようにして算出された単語中の母音の調音点の座標(x,
y)を表すデータを教師データとしてニューラル・ネッ
トの学習を次のようにして行う。
学習時には、ニューラル・ネットの入力層11のユニッ
ト14,14,…に、調音点の座標(x,y)が既知の音声サン
プルの単語中の母音の音響パラメータ(すなわち、16チ
ャンネルのBPF群からの出力値)が、各チャンネル別に
入力される。次に、出力層13の一方の7個の7ユニット
16d,…,16dには、上述のように入力層11に音響パラメー
タが入力された単語中の母音に対する教師データ(すな
わち、既知の調音点のx座標値が当てられたユニット16
dへの入力値が“1"であり、他のユニット16dへの入力値
が“0"であるデータ)を入力する。同様に、他方の7個
のユニット16e,…,16eには、上記単語中の母音の教師デ
ータ(すなわち、既知の調音点のy座標値に割り当てら
れたユニット16eへの入力値が“1"であり、他のユニッ
ト16eへの入力値が16eへの入力値が“0"であるデータ)
を入力する。そうすると、ニューラル・ネットは、出力
層13のユニット16d,…,16e,…からの出力が教師データ
と同じになるように結合係数を設定しなおしてネットワ
ーク構造を決定するのである。
要素x,yを生成する場合には、上述のようにして、多
数の教師データに基づいて学習したニューラル・ネット
の入力層11に、入力音声の音響パラメータ(BPF群から
の出力データ)を入力する。そして、出力層13の一方の
7個のユニット16d,…,16dからの出力値の一番大きな値
を出力しているユニット16dに割り当てられたx座標値
を要素xの値とする。同様に、他方の7個のユニット16
e,…,16eからの出力値の一番大きな値を出力しているユ
ニット16eに割り当てられたy座標値を要素yの値とす
るのである。
この場合、ニューラル・ネットを多数話者の音声サン
プルから得られた教師データによって学習させておけ
ば、不特定話者に対しても安定して調音点の座標(x,
y)を生成することができる。
(b)子音区間(C=0,1) 子音区間では、声道中のどこかに狭めまたは閉鎖が生
じている。この狭めあるいは閉鎖の位置が子音の調音点
である。この調音点には、第3図(a)に示すように、
前から後に向かって両唇(例えば、[m],[p]の場
合)、歯・歯茎(例えば、[n],[t],[s]の場
合)、硬口蓋(例えば[∫]の場合)、軟口蓋(例え
ば、[k],[g]の場合)、声門(例えば、[h]の
場合)などが存在する。この場合、調音点の上下方向の
要素yは固定されており(y=0)、したがって重みwy
の値はwy=0であり、前後方向の要素xのみが有効とな
る。第3図(b)は第3図(a)に示す実際の調音点の
位置に対応する要素xの値を示す。図中、x=8は両唇
音,x=7は歯音,x=2は軟口蓋音に対応している。以
下、子音区間の調音点の位置を表す要素xの生成方法
を、要素Cの値C=0,1の2つの場合に分けて説明す
る。
i)C=1(狭め形成)の場合 第2図(b),(c)に示すように、入力音声が要素
C=1のセグメントの場合、その区間は有声摩擦[dz]
区間や破裂[d]区間である。このような音声区間にお
いては調音点に応じてかなり固有のスペクトル形状が観
察できる。したがって、前後方向の調音点を表す要素x
の値は子音のラベルと後続母音によってほぼ一意的に決
定することができる。そこで、スペクトログラム視察に
よってラベル付けされた音声サンプルの子音と後続母音
のラベルに基づいて要素xの値を決定し、この音声サン
プルの子音の要素xの値を表すデータを教師データとし
て用いるのである。
子音区間の調音点の要素xの生成の場合も、母音区間
における調音点の座標(x,y)の生成の場合と同様に、B
P法による学習によって子音区間の調音点の要素xを生
成するネットワーク構成を呈する多層パーセプトロン型
のニューラル・ネットを用いる。ここで用いるニューラ
ル・ネットの構成は、第4図において、入力層11のユニ
ット数は16、中間層12のユニット数は10、出力層13のユ
ニット数は8である。
入力層11の各ユニット14,…,14には音響パラメータ
(すなわち、16チャンネルのBPF群の各チャンネルから
の出力データ)が入力される。そして、各層の各ユニッ
トはシグモイド関数によって変換した値を次の層の各ユ
ニットに出力する。出力層13の8個の各ユニット16,…,
16からの出力値は、子音区間の調音点の要素xの値に対
応している。すなわち、出力層13のユニット16,…,16を
例えば図中右から順に1,2,…,8と番号つけると、一番大
きな値を出力しているユニット16の番号が要素xの値そ
のものとなるのである。
学習時には、調音点の要素xが既知の子音の音響パラ
メータ(BPF群の出力データ)を入力層11のユニット14,
…,14に入力する。次に、上記入力データの子音におけ
る要素xの値に対応している教師データを出力層13のユ
ニット16,…,16に入力する。ここで、教師データは、入
力データの要素xの値がx=i(1≦i≦8)である場
合、出力層の第iユニット16iへの入力値が“1"であ
り、その他のユニット16への入力値が“0"であるデータ
である。
要素xの生成時には、上述のように、出力層13のユニ
ット16,…,16のうち最大の値を出力するユニット番号
を、入力音声の子音区間にける調音点の要素xの値とす
る。下表に、要素xの値とそれに対応する子音が含まれ
るCV(子音−母音)音節例を示す。
ii)C=0(閉鎖)の場合 要素Cの値がC=0の場合には、調音点の要素xの値
の生成は困難である。すなわち、後に詳述する声帯振動
有無の要素gの値がg=0(無声)のときは完全に無音
である。一方、g=1(有無)ときは鼻腔や喉からの放
射音があるので、音としては存在する。したがって、C
=0かつg=1のフレームの場合には、C=1の場合と
同じニューラル・ネットを用いて調節点の要素xの値の
生成を行う。また、C=0かつg=0のセグメントの場
合には、このセグメントの調音点の要素xは直前・直後
のフレームにおける調音点の要素xの値(夫々、x=x
f,x=xbとする)を参照して次のように定める。すなわ
ち、xf=xbであれx=xfとし、xf≠xbであればx=xbと
する。
このように、要素Cの値がC=0の場合の要素xの値
は、C=2,1の場合に比べて正確でない。そこで、この
C=0のセグメントについては、上述のように、入力音
声の特徴パターンの第jフレームajと標準パターンの第
kフレームbkとの距離d(aj,bk)を算出する際の要素
xの重みwx=1とするのである。
(C)要素gの生成 声帯振動有無の要素gについては、スペクトログラム
の視察によってラベル付けされた音声サンプルの要素g
の値を教師データとして、BP法によって学習した多層ス
プトロン型のニューラル・ネットによって生成する。こ
の場合、第4図において、入力層11のユニット14,…,14
の数は16、中間層12のユニット15,…,15の数は8、出力
層13のユニット16,16の数は2である。
学習時には、入力層11のユニット14,…,14に、要素g
の値が既知の音声サンプルにおける対象フレームの音響
パラメータ(BPF群からの出力データ)を入力する。次
に、出力層13の2個のユニット16,16の一方を16f,他方
を16gとすると、上記要素gの知が既知の入力音声サン
プルの対象フレームの要素gの値がg=0の場合には、
出力層13のユニット16fへの入力値が“0"であり、ユニ
ット16gへの入力値が“1"である教師データを入力す
る。一方、入力データの要素gの値がg=1の場合に
は、出力層13のユニット16fへの入力値が“1"であり、
ユニット16gへの入力値が“0"である教師データを入力
して学習する。
要素gの生成時には、入力音声の音響パラメータ(BP
F群からの出力データ)を入力層11のユニット14,14,…,
14に入力する。そして、出力層13のユニット16fの出力
値がユニット16gの出力値より大きければ、要素gの値
をg=1とする。また、ユニット16fの出力値がユニッ
ト16gの出力値より小さければ、要素gの値をg=0と
するのである。
(D)要素nの生成 鼻音化度の要素nについては、スペクトログラムの視
察によってラベル付けされた音声サンプルの要素nの値
を教師データとして、BP法によって学習した多層パーセ
プトロン型のニューラル・ネットによって生成する。こ
の場合、第4図において、入力層11のユニット14,14,…
の数は16、中間層12のユニット15,15,…の数は8、出力
層13のユニット16,16,…の数は3である。
要素nにおける教師データは、次のようにして作成す
る。すなわち、音声における鼻音化の状態を、有声破
裂音のバズバー部[bb]や鼻音のマーマー部、母音が
鼻音化して主として第1ホルマント領域のスペクトルが
平坦化している部分の2種類に分ける。また、上記,
のいずれにも該当しない状態、すなわち、母音,摩擦
音および無音等の鼻音ではない状態をとする。そし
て、上記状態における要素nの値をn=2とし、状態
における要素nの値をn=1とし、状態における要
素nの値をn=0とする。教師データを作成する際にお
ける音声サンプルのスペクトログラム視察においては、
状態,,が検索できるようなラベル付けを行う。
例えば、状態に対しては、母音ラベルの他に鼻音化ラ
ベルを併記するのである。このようにしてラベル付けさ
れた音声サンプルの対象フレームのラベルに基づいて要
素nの値を決定し、この音声サンプルの要素nの値を表
すデータ教師データとして用いるのである。
学習時には、入力層11のユニット14,14,…に、要素n
の値が既知の音声サンプルの音響パラメータ(BPF群か
らの出力データ)が入力される。次に、上記教師データ
を出力層13のユニット16,16,…に入力する場合には次の
ようにする。要素nの値n=2を出力層13の3個のユニ
ット16,16,…の1つ(ユニット16hとする)に割り当
て、n=1をユニット16,16,…の他の1つ(ユニット16
iとする)に割り当てる。そして、n=0を残りのユニ
ット16(ユニット16jとする)に割り当てるのである。
すなわち、要素nの値がn=2の場合は、ユニット16h
への入力値が“1"であり、ユニット16iおよびユニット1
6jへの入力値が“0"である教師データを入力する。ま
た、n=1の場合は、ユニット16iへの入力値が“1"で
あり、ユニット16hおよびユニット16jへの入力値が“0"
である教師データを入力する。また、n=0の場合は、
ユニット16jへの入力値が“1"であり、ユニット16hおよ
びユニット16iへの入力値が“0"である教師データを入
力するのである。
要素nの生成時には、入力音声の音響パラメータ(BP
F群からの出力データ)を入力層11のユニット14,…,14
に入力する。そして、出力層13のユニット16h,16i,16j
の出力値のうち、一番大きな値を出力しているユニット
に割り当てられた要素nの値を入力音声の要素nの値と
するのである。
ただし、この要素nの生成方法は、主としてC=2か
つg=1のフレームにおいて実行する。つまり、C=0
かつg=0のときは上記状態に自動的に対応する。ま
た、C=0かつg=1のときは状態に自動的に対応す
る。また、C=1のときは状態であると言える。した
がって、C=0かつg=0,C=0かつg=1,C=1の場合
には、要素nの値の生成を行わず、要素Cの値と要素g
の値から一義的に要素の値を決定するのである。
(E)要素lの生成 円唇化度の要素lについては、スペクトログラムの視
察によってラベル付けされた音声サンプルの要素lの値
を教師データとして、BP法によって学習した多層パーセ
プトロン型のニューラル・ネットによって生成する。こ
の場合、第4図において、入力層11のユニット14,14,…
の数は16、中間層12のユニット15,15,…の数は8、出力
層13のユニット16,16,…の数は2である。また、ラベル
に基づいて決定された音声サンプルの該当フレームの要
素lの値を表すデータを教師データとする。
学習時には、入力層11のユニット14,14,…に要素lの
値が既知の音声サンプルの該当フレームの音響パラメー
タ(BPF群の出力データ)が入力される。次に、上記音
声サンプルの該当フレームの要素lの値を表す教師デー
タが出力層13のユニット16,16,…に入力されて、学習が
行われる。
要素lの生成時には、入力音声の音響パラメータを入
力層11のユニット14,…,14に入力する。そして、出力層
13のユニット16,16の出力値に基づいて要素lの値を生
成する。
この場合、スペクトログラムの視察による円唇化度の
高いフレームに対するラベル付けの精度があまり良くな
いので、良好な教師データを得ることができない。その
結果、要素lの生成の際の精度もあまり良くない。した
がって、上述のように、上記識別部5におけるマッチン
グの際の要素lの重みwlの値を小さい値にして、単語音
声の確認への要素lの寄与度を小さくしておくのであ
る。また、円唇/平唇の差によって音質は変化するが、
音韻声はそれほど影響はないので、重みwlの値を小さく
しても認識性能は下がらないのである。
上述のように、この発明の音声認識装置は、BP法によ
る学習で音声の音響パラメータの時系列を調音ベクトル
(狭めの度合いC,調音点(x,y),鼻音化度n,声帯振動
の有無gおよび円唇化度lを要素とするベクトル)の時
系列に変換する規則を自ら作成したニューラル・ネット
を用いて、音響分析部2からの入力音声の影響パラメー
タに基づいて、パターン変換部3によって入力音声の調
音ベクトルの時系列(すなわち、特徴パターン)を生成
する。また、同様にして、音声サンプルの音響パラメー
タに基づいて、調音ベクトルから成る標準パターンを生
成し、この生成された標準パターンを標準パターン格納
部6に格納する。そして、上記入力音声の特徴パターン
の調音ベクトルの時系列と標準パターンの調音ベクトル
の時系列との距離を所定の手順によって算出し、この両
調音ベクトル時系列間の距離を用いて特徴パターンと標
準パターンとのマッチングを行って、入力された音声の
単語を認識するようにしている。
上述のように、音声信号には種々の要因による変動が
含まれている。ところが、上記調音ベクトルは、上記音
声信号の変動の種々の要因のうち、話者の生理的な差に
起因する変動を除去することができる。よって、調音ベ
クトル時系列で表わされた音声は、異音や継続時間とい
った発声の仕方の差による変動のみが含まれることにな
る。すなわち、この発明においては、入力音声の特徴パ
ターンおよび標準パターンを調音ベクトルで表現するよ
うにしているので、話者の生理的な差に起因する音声変
動を除去することができる。したがって、標準パターン
のテンプレートの数を少なくし、マッチング計算量を少
なくすることができる。
また、この発明においては、学習によって上記調音ベ
クトルを生成する規則を自ら生成するニューラル・ネッ
トを用いて、調音ベクトルを生成するようにしている。
したがって、複雑な計算を必要とせず簡単な演算のみに
よって調音ベクトルを生成することができ、調音ベクト
ル生成時の計算量を少なくすることができる。また、多
数話者の音声サンプルから得られた教師データによって
ニューラル・ネットの学習を行えば、あらゆる入力音声
に対して安定して調音ベクトルを生成することができ
る。
さらに、語彙数が多いために上記識別部5におけるマ
ッチングの対象となる標準パターン数が多い場合には、
予め予備選択部4によって標準パターンを予備選択して
標準パターン数を絞り込むようにしている。したがっ
て、さらにマッチングの計算量を少なくすることができ
る。
上記実施例においては、上記調音ベクトルは声道の狭
めの度合いC,調音点の前後・高低の座標(x,y),声帯
振動の有無g,鼻音化の度合いnおよび円唇化の度合いl
の要素を有している。しかしながら、この発明はこれに
限定されるものでない。すなわち、単語音声の認識の精
度に応じて、例えば上記要素のうち単語音声認識への寄
与度の低い円唇化度の要素l等を削除してマッチングの
計算量をさらに少なくしてもよい。
この発明におけるニューラル・ネットの構成は、上述
の構成に限定するものではない。すなわち、BPF群のチ
ャンネル数に応じて入力層のユニット数を変えてもよ
い。また、各要素の度合いを表す段階に応じて出力層の
ユニット数を変えてもよい。さらに、中間層を複数にし
て要素の値の生成の精度さらに上げるようにしてもよ
い。
<発明の効果> 以上より明らかなように、この発明の音声認識装置
は、入力された音声信号から音響分析部によって音響パ
ラメータを求め、パターン変換部によって、入力音声の
音響パラメータから調音点の前後・高低の位置,声帯振
動の有無,鼻音化の度合いおよび円唇化の度合いのうち
少なくとも一つと声道の狭めの度合いとを要素とする調
音ベクトルを生成し、上記調音ベクトルの時系列から成
る入力音声の特徴パターンと音声サンプルの調音ベクト
ルの時系列から成る標準パターンの両調音ベクトル時系
列間の距離を用いて、上記両パターンのマッチングを識
別部で行うようにしたので、調音ベクトルで音声を表現
することによって話者の生理的な差に起因する音声の変
動を除去でき、不特定話者を対象とする場合に標準パタ
ーンのテンプレート数を少なくして、マッチングの計算
量を低減することができる。
また、上記調音ベクトルを生成する際に、パラメータ
変換部において、所定の手順、で予め作成された教師デ
ータを用いて誤差逆伝播法で学習して、上記入力音声の
音響パラメータを調音ベクトルに変換する規則を自ら作
成したニューラル・ネットによって、入力音声の音響パ
ラメータを調音ベクトルに変換するようにしたので、単
純な積和演算のみで調音ベクトルを生成することがで
き、調音ベクトル生成時の計算量を少なくすることがで
きる。また、多数和者の音声サンプルから得られた教師
データによってニューラル・ネットの学習を行うことに
よって、あらゆる入力音声に対して安定して調音ベクト
ルを生成することができる。
【図面の簡単な説明】
第1図はこの発明に係る音声認識装置の一実施例を示す
ブロック図、第2図(a)は入力音声波形の一例を示す
図、第2図(b)は第2図(a)の音声波形に対応する
音素記号の時系列を示す図、第2図(c)は第2図
(a)の音声波形に対応する調音ベクトルの要素Cの時
系列を示す図、第2図(d)は第2図(a)の音声波形
に対応する調音ベクトルの要素x,要素y,要素n,要素gお
よび要素lの時系列を示す図、第3図(a)は子音の調
音点を説明するための人間の口腔断面図、第3図(b)
は第3図(a)に示す口腔断面における調音点に対応す
る子音の要素xの値を示す図、第4図はニューラル・ネ
ットの構成図である。 1……マイクロホン、2……音響分析部、3……パター
ン変換部、4……予備選択部、5……識別部、6……標
準パターン格納部、7……表示部。
───────────────────────────────────────────────────── フロントページの続き (56)参考文献 特開 昭60−163099(JP,A) 特開 昭57−54999(JP,A) 特表 昭59−501520(JP,A) 日本音響学会誌 44巻10号(昭和63 年)P.798〜804 古井「ディジタル音声処理」東海大学 出版会(昭和60年)P.7〜11 Complex Systems N o.1(昭和62年)P.145〜168

Claims (1)

    (57)【特許請求の範囲】
  1. 【請求項1】入力された音声信号からこの音声信号の音
    響パラメータを求める音響分析部と、 上記音響パラメータに基づいて所定の手順で予め作成さ
    れた教師データを用いて誤差逆伝播法によって学習し、
    入力音声の音響パラメータを、調音点の前後・高低の各
    位置,声帯振動の有無,鼻音化の度合いおよび円唇化の
    度合いのうち少なくとも一つと調音点における声道の狭
    めの度合いとを要素とする調音ベクトルに変換する規則
    を自ら作成したニューラル・ネットを有して、このニュ
    ーラル・ネットによって、入力音声の音響パラメータを
    上記調音ベクトルにフレーム毎に変換するパターン変換
    部と、 上記パターン変換部によって生成された音声サンプルの
    調音ベクトルの時系列から成る標準パターンを格納する
    標準パターン格納部と、 上記パターン変換部によって生成された調音ベクトルの
    時系列から成る入力音声の特徴パターンと上記標準パタ
    ーンとのマッチングを、所定の手順によって求められる
    上記両パターンの調音ベクトル時系列間の距離を用いて
    行って、入力音声を認識する識別部を備えたことを特徴
    とする音声認識装置。
JP1026033A 1989-02-01 1989-02-02 音声認識装置 Expired - Fee Related JP2655903B2 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP1026033A JP2655903B2 (ja) 1989-02-02 1989-02-02 音声認識装置
US07/473,238 US5175793A (en) 1989-02-01 1990-01-31 Recognition apparatus using articulation positions for recognizing a voice

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1026033A JP2655903B2 (ja) 1989-02-02 1989-02-02 音声認識装置

Publications (2)

Publication Number Publication Date
JPH02204798A JPH02204798A (ja) 1990-08-14
JP2655903B2 true JP2655903B2 (ja) 1997-09-24

Family

ID=12182393

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1026033A Expired - Fee Related JP2655903B2 (ja) 1989-02-01 1989-02-02 音声認識装置

Country Status (1)

Country Link
JP (1) JP2655903B2 (ja)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN104751856B (zh) * 2013-12-31 2017-12-22 中国移动通信集团公司 一种语音语句识别方法及装置

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
Complex Systems No.1(昭和62年)P.145〜168
古井「ディジタル音声処理」東海大学出版会(昭和60年)P.7〜11
日本音響学会誌 44巻10号(昭和63年)P.798〜804

Also Published As

Publication number Publication date
JPH02204798A (ja) 1990-08-14

Similar Documents

Publication Publication Date Title
CN108806696B (zh) 建立声纹模型的方法、装置、计算机设备和存储介质
US5175793A (en) Recognition apparatus using articulation positions for recognizing a voice
Hansen et al. Speech under stress: Analysis, modeling and recognition
AU2020102516A4 (en) Health status monitoring system based on speech analysis
EP1635327B1 (en) Information transmission device
Ruinskiy et al. An effective algorithm for automatic detection and exact demarcation of breath sounds in speech and song signals
CN109979436B (zh) 一种基于频谱自适应法的bp神经网络语音识别系统及方法
Jagadeeshwar et al. ASERNet: Automatic speech emotion recognition system using MFCC-based LPC approach with deep learning CNN
Hasija et al. Recognition of children Punjabi speech using tonal non-tonal classifier
Airaksinen et al. Data augmentation strategies for neural network F0 estimation
Coto-Jiménez et al. LSTM deep neural networks postfiltering for enhancing synthetic voices
Wagner et al. Generative models for improved naturalness, intelligibility, and voicing of whispered speech
KR20060066483A (ko) 음성 인식을 위한 특징 벡터 추출 방법
Selva Nidhyananthan et al. Assessment of dysarthric speech using Elman back propagation network (recurrent network) for speech recognition
CN120319271B (zh) 语音评测方法、设备、介质、程序产品
JP3798530B2 (ja) 音声認識装置及び音声認識方法
Sahoo et al. MFCC feature with optimized frequency range: An essential step for emotion recognition
Brucal et al. Female voice recognition using artificial neural networks and MATLAB voicebox toolbox
MY An improved feature extraction method for Malay vowel recognition based on spectrum delta
Spijkerman Using voice conversion and time-stretching to enhance the quality of dysarthric speech for automatic speech recognition
Bhardwaj et al. A Study of Methods Involved In Voice Emotion Recognition
JP2655902B2 (ja) 音声の特徴抽出装置
JPH07210197A (ja) 話者識別方法
JPH02204798A (ja) 音声認識装置
Hamzah et al. Impact of acoustical voice activity detection on spontaneous filled pause classification

Legal Events

Date Code Title Description
LAPS Cancellation because of no payment of annual fees