JPS604996A - 音声認識装置 - Google Patents

音声認識装置

Info

Publication number
JPS604996A
JPS604996A JP58113091A JP11309183A JPS604996A JP S604996 A JPS604996 A JP S604996A JP 58113091 A JP58113091 A JP 58113091A JP 11309183 A JP11309183 A JP 11309183A JP S604996 A JPS604996 A JP S604996A
Authority
JP
Japan
Prior art keywords
word
syllable
pattern
matching
frame
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP58113091A
Other languages
English (en)
Other versions
JPH0534680B2 (ja
Inventor
中川 聖一
英一 坪香
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Priority to JP58113091A priority Critical patent/JPS604996A/ja
Publication of JPS604996A publication Critical patent/JPS604996A/ja
Publication of JPH0534680B2 publication Critical patent/JPH0534680B2/ja
Granted legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 産業上の利用分野 本発明は音声認識装置−特に登録が容易な、少い標準パ
ターンで認識が可能な音声認識装置に関する。
従来例の構成とその問題点 人間にとって最も自然な情報発生手段である音声が、人
間−機械系の入力手段として使用できれば、その効果は
非常に大きい。
従来、音声認識装置としては特定話者登録方式によるも
のが実用化されている。即ち一認識装置を使用しようと
する話者が、予め、認識すべきすべての単語を一白分の
声で特徴ベクトルの系列に変換し単語辞書に標準パター
ンとして登録しておき、認識時に発声された音声を、同
様に特徴ベクトルの系列に変換し、前記単語辞書中のど
の単語に最も近いかを予め定められた規則によって計算
し。
最も類似している単語を認識結果とするものである0 ところが−この方法によると、認識単語数が少いときは
良いが、数百、数千単語といつたように増加してくると
、主として次の三つの問題が無視し得なくなる。
(1)登録時における話者の負担が著しく増大する0 (2)認識時に発声された音声と標準、パターンとの類
似度あるいは距離を計算するのに要する時間が著しく増
大し、認識装置の応答速度が遅くなる。
(3)前記単語辞書のために要するメモリが非常に大き
くなる。
一方一以上の欠点を回避するための方法として認識の単
位を子音+母音および母音の単音節(以後それぞれay
、vで表す。Cは子音、Vは母音を意味する。)とする
方法がある。即ち、標準パターンとして単音節を特徴ベ
クトルの系列として登録しておき、認識時に特徴ベクト
ルの系列に変換された入力音声を、、前記単音節の標準
パターンとマツチングすることにより一単音節の系列に
変換するものである。日本語の場合、単音節はたかだか
101種類であり、単音節は仮名文字に対応しているか
ら、この方法によれば1日本語の任意の単語あるいは文
章を単音節列に変換する(認識する)ことができること
になり、前記(1)〜(3)の問題はすべて解決される
ことになる。しかし−この場合の問題の一つに調音結合
がある。即ち、音節を連続して発声すると、各音節は前
後の音節の影響を受けるため、スペクトル構造が前後に
接続される音節の影響を受けて変化する。従って、標章
パターンとして登録されている単音節のスペクトルと語
中の音節とはスペクトル構造が異り、正確に認識するこ
とが難しくなる。この問題を解決するために二つの方法
が考えられる。一つは一認識の際の入力音声を音節毎に
区切って発声し、1音節ずつ認識する方法、もう一つは
それぞれの単音節の語頭から母音の定常部までと母音十
子音+母音および母音+母音(以後それぞれvcv、v
vで表す)のそれぞれの先行母音の定常部から後続母音
の定常部までを標準パターンとしてもつ方法である。前
者は1発声が不自然になる欠点がある。
後者はcv、v、vv、vcvの連鎖を母音定常部で接
続しながら作り出すことになるので、調音結合の影響が
回避できるものであるが−ay、v。
vv 、vcvのあらゆる組合せを標準パターン登録時
に発声するとなるとその種類は単音節の6〜7倍の量と
なり、標準パターンの登録の手間が非常に大きくなる欠
点がある。
発明の目的 本発明は上記従来の欠点を除き、連続的に発声された任
意の入力音声を音節列に変換すなわち認識するために必
要な標準パターン数が少なくてよい音声認識装置を提供
することを目的とする。
発明の構成 本発明は、入力音声信号を特徴ベクトルの系列lL1 
、 a2 、・・・・・・2LI に変換する特徴抽出
手段と一部n単音節に対する特徴ベクトルの系列す、n
、b2n。
−−、b’;n (ただし−n=1 、2 、=・−、
N iNは単音節数 ynは第n単音節の母音定常部の
フレーム)を標準パターンとして記憶する標準ノくター
ン記憶手段と一前記入力音声信号の特徴ベクトルの系列
を、前記単音節標準パタトンとマツチングするとともに
いくつかのn′に対しては、第n′単音節の特徴ベクト
ルの系列b1°′、b2°′、・・・・・・、 bJ”
n”を逆の順序に並べた特徴ベクトルの系列b%n’+
bgnl−1,・−・・・、b2n、bjnトモマッチ
ンクスルハターンマッチング手段とを備えた音声認識装
置である。
vCv音声パターンのスペクトルを詳細に検討してみる
と、先行母音と後続母音が同じ場合′、無声破裂音、拗
音等を除いて子音を中心としてほぼ対称であることが認
められる。また、このようなりCvに含まれるCvと同
じ子音および母音からなる単音節のスペクトルはほぼ同
じ形をしている。
従って−VCV標準パターンのうち前記対称でない一部
のものを除けば、先行母音V+、子音C2後続母音V2
(7)音節v1Cv2 を単音節CiV+とCv2から
作ることができる。即ち、CV+から得られた特徴ベク
トルの系列を時間的に逆向に並べ一〇V2から得られた
特徴ベクトルの系列と結合したものをv1Cv2 に対
応する標準パターンとすることができる。このようにす
れは−vCvのあらゆる種類を標準パターンとして登録
する場合に比べ、大幅にその数を減らすことができる0
例えば1日本語に含まれる全ての音韻を含むようにvC
vとCVの標準パターンを持つことにすれば、その総数
は630程度であるが1本発明における以上の考えによ
れば370程度で済む。また、「キョウト」と発声すべ
きときは「キヨウト」というように発声することにして
、拗音は発声に用いないことにすれば、430程度を1
70程度と半分以下に減することができる。
上記のように−v1Cv2に対する標章パターンをCV
+とCV2から作るというのが本発明の基本的な考え方
である。ところでこのようにしてVlCVzの形で標準
パターンを持つ方法も考えられるが−その場合は、標準
パターンを記憶するに要するメモリはvCvのあらゆる
種類を標章パターンとして持つ場合と同じ量になり一あ
まり得策ではない。
そこで、入力音声と例えばv1Cv2とのマツチング計
算を行う場合は単音節Cv1 の特徴ベクトルの逆系列
V+Cとのマツチング計算を先ず行い。
次にCV2 とのマツチング計算を行うようにすれば−
V1(5に対応する特徴ベクトルの系列は、単音節CV
1 に対応する特徴ベクトルを記憶している標章パター
ンメモリから逆向に読出すのみで良いから−V1Ci 
に対応する標準パターンは記憶する必要がなく、(勿論
−V1CV2に対応する標準パターンも記憶する必要は
ない)標準パターンを記憶するためのメモリも大幅に減
らすことができる。
本発明による音声認識装置は以上の原理に基づくもので
ある。
実施例の説明 パターンマツチングの効果的な方法として−DPマツチ
ングと呼ばれる方法がある。次に説明する本発明の一実
施例は、前記発明の構成において述べたパターンマツチ
ングとして、DPマツチングを用いたものである。実施
例の説明に入る前にDPマツチングによる単語音声の認
識について説明する。
パターンマツチングによる音声認識装置の一般的な構成
は次のようなものである。
入力音声信号を、フィルタバンク、周波数分析−LPC
分析等によって特徴ベクトルの系列に変換する特徴抽出
手段と、予め発声され、この特徴抽出手段により抽出さ
れた特徴ベクトルの系列を認識単語全部について標章パ
ターンとして登録7ておく標準パターン記憶手段と、認
識させるべく発声され一前記特徴抽出手段により抽出さ
れた入力パターンと前記標準パターン記憶手段に記憶さ
れている標準パターンの全てと特徴ベクトルとの系列と
しての類似度あるいは距離を計算するパターン比較手段
と、パターン比較の効果、最も類似度の高かった(距離
の小さかった)標準パターンに対応する単語全認識結果
として判定出力する判定手段からなる。
このとき、同一話者が同一の単語を発声しても、発声の
都度−その発声時間長が異なるので、前記パターン比較
手段で標章パターンと入カバターンの比較2行う際には
1両者の時間軸全伸縮させ。
両者のパターン長を揃えて比較する必要がある。
その際ン発声時間長の変化は1発声単語の各部で一様に
生じているわけではないので、各部を不均一に伸縮する
必要がある。その伸縮は、比較すべき両者のパターンの
類似度が最大になる(距離が最小になる。以下距離で説
明する)ように行われるのが最も良い結果が得られてい
る。この上つなマツチングを効率的に行うのに動的計画
法を用いる装置が一般的であり、このマツチングはDP
マツチングと呼ばれている。
DPマクチングの方法は格子グラフによって説明できる
。第1図は格子グラフであって、横軸は入カバターン’
r=a1.a2・・・・・・aI に対応するl座標、
縦軸は標準パターンRn=b1n、b2n、・・・・・
。
bn。に対応するコ座標を表わす。入カバターンでと標
準パターンRnを時間軸を非線形に伸縮してマツチング
するとは、この格子グラフ上において一両パターンの各
特徴ベクトルの対応関係を示す径路1を伺らかの標価基
準によって決定し、この径路に関して両パターンの距離
を評価することである。この径路を決定する際には音声
の性質を考慮して制限条件を設ける。第2図(a)は径
路選択の制限条件の一例である。即ち、この例では点(
L、コ)へ至る径路は一点(i−2,コー1)から点(
i−1,コ)を通る径路2か1点(i−1,j−1)か
ら来る径路3か1点(i−1,j −2)から点(i、
j−1を通る径路4かの何れかしか取シ得ないというこ
とを意味している。このとき、入カバターンと標準パタ
ーンの始端と終端は必ず対応させるという条件をつけれ
ば、前記マツチングの径路は第1図の斜線の部分に制限
され・る。この制限は−いかに時間軸が伸縮するといっ
ても一同一単語に対してはそれ程極端に伸縮するはずは
ないという事実からあまシ極端な対応づけが生じないよ
うにするためである。
al トbg (Dヘク) ル間W8111r、 d”
(i 、 j) (!:すれば、入カバターンTと標準
パターンRnのパターン間の前記径路に沿う距離は、そ
の径路に沿うdn(i、j)の荷重平均として定義され
る。第2図の径路上のa、b、c、d、eはそれに対応
する径路が選ばれたときの荷重である。DPマツチング
が適用できるためには、この荷重の決め方は、格子グラ
フ上で前記制限条件の下でいかなる径路が渇ばれようと
もその径路に沿う荷重の和が一定になるように決めれば
良い。a−C=8=2゜b=d=1とすれば、この荷重
の和は工+Jnとなり、a=b=c=1.d=e=o、
6とすれば、この荷重の和は工となり、a=b=0.6
.Q=d−8=1とすれば、この荷重の和はJnとなり
、径路の選ばれ方によらず一定となる。これらは共によ
く用いられる。また、前記荷重の和一定という条件の下
で、この荷重をコに関する関数とすることにより、より
重視してマツチングしたい径路上の部分の荷重を重くす
る等の操作も可能である○入カバターンTと標準パター
ンanの距離は前記制限条件の下で前記荷重平均の最小
値として定義される。即ち1次の漸化式を解くことによ
って前記荷重平均の最小値とその最小値を与える径路が
決定され得る。
・・・・・・・・・・・・・・・・・・・・・・・・・
・・(1)初期条件g0(1,1)−dn(1,1)。
ここにD(T、Rn) は入カバターンTと標準パター
ンRnの距離である。
径路選択の条件としては他にも種々考えられる。
第2図Φ)〜O)等は他の例である。この他にもさらに
種々の変形が考えられ得る。これら径路の選択条件に伴
って前記漸化式は対応するものに書き換えられるのは勿
論である。
また、孤立して発声された単語を認識する場合は勿論、
連続して発声された(単語と単語の間に切れ目なく発声
された)音声を認識する場合もDPマツチングは良好な
成績をふ・さめている。
連続単語音声認識の問題は次のように定式化される。
入カバターンのフレーム数をI−第1フレームの特徴ベ
クトルを84 、単語nの標準パターンのフレーム数を
Jn−mコフレームの特徴ベクトルをす、nとするとき
、単語nの標準パターンRnは次のように表わされる。
R” =b、nb2n、−、、、−bin、、、 b1
7nそこでX個の単語列に対応する標準パターンの結合 、=Rq(1)Rq(2)、、、 Rq(8)=bQ(
+)b2q(+)、、、岡(1,b?(2)b2q(2
)10.b鶏309.岬(イ)b2q■1.b晶・・・
・・・・・・・・・・・・・・・・・・・・・・・・(
2)と入カバターンT = aj a2・・・・・・a
i alとのベクトル系列間の距離が最小になる単語列
q(1) q(2)・・・・・・q(X)をめる。
以上の計算を前記孤立単語の場合と同様にしてそのまま
DPマツチングで解ζうとすれば1例えば1o数字の単
語を標準パターンとしてもっているとき、3数字の連続
発声された音声を認識するには10=1000 種類の
標準パターンとマツチングしなければならない。標準バ
タμンの数が増せば、たちまちその組合せの数は禁止的
な量になる。
そこで、連続単語の認識にもDPマツチングを適用する
ために、マツチングの累積距離の正規化係数(前記荷重
の和のこと)は入力のフレーム数にのみ依存するように
径路の選択の条件を設定すれば、以下に示すように標準
パターンの単語の組合せにも動的計画法が適用でき計算
量を大幅に減らし得る。
径路の選択条件としては一般に第3図(a)〜(8)に
示すものがあるが、径路上に示した数値はその径路が選
ばれたときの荷重係数である。
入カバターンTの第1フレームの特徴ベクトル(以後フ
レームとのみ称する)alとX個の標準パターンの連結
からなる連続標準パターンHの第1フレームbj(7)
フレーム間距離(ベクトルM距離)を(li(i 、j
 )とし、入カバターンと連続標準パターンとの対応づ
けする時間関数(前記マツチングの径路)をu(gとし
て、この時間関数に沿ってめられる次の累積距離(フレ
ーム間距離の荷重す)がめるものであるとする。即ち D(T 、R)=min (:Σdn(i、u(i))
)] −−−−(3)u(i) l = 1 Q=argmtn(D(T、R):I n ここで、第3図(a)の径路のときは。
○(u(1)−u(i −1) <2 、u(1)=1
 、 LSI) =JRである。また1m1n(f(6
)〕は2に関して最小化さにだ1層−argml[f(
6)]は細を最小にする2の値を意味する。
弐(3)は次の漸化式を解くことでめられる。ただし+
 Dx(L)は入力が第1フレームで終端すると仮定し
たX単語列に対する最小累積距離、Nx(i)はDx(
i)に対応する単語列の最後尾単語名+ Bx(i)は
Nz(i)の始点位置マイナス1(Nx(i)の一つ前
の単語の最終フレーム、バックボインクと称する)−D
n(s:t) は入力のs −t、フレームと単語nと
の最小累積距離−nxn(t、コ)はDx −+ (m
)と、入力のm+1〜1フレームと単語nの1〜コフレ
ームとの最小累積距離の和のmについての最小値である
。
初期条件りゆ)−〇、Bに)−〇としてDz(i)=m
in (Dx−+(In)+Dn(m+1: 1 ))
 −−(4)n、m =m1nDz”(1、J”) をX=1.2.・・・・・・、Xについてめ−この式を
△ △ 満たすn、mをn、mとするとき、 △ △ NX(1)= n 、 BX(1)= mとする。L−
Xまでこの計算を行えば、次のようにして最後尾の単語
から逆順に単語がまる。即ち 最後尾の単語: Nx(I) 最後から2番目の単語: Nx−+ (Bx(I))最
後から3番目の単語: NX−2(BX−1(BX(I
) )最初の単語: J (B2(B3(−(Bx(I
) ) −)))でB1(B2 (B3 (−・−(B
x(I))・=)))−oとなって終了する。第4図は
Nx(1) 、 Bx(i)から上の単語列をめるフロ
ーチャートである。
Xについても最適化する場合は、次のようになる。ここ
で−D(i)は入力の1フレームで終端すると仮定した
ときの単語列の最小累積距離(D(i)−mlnDz(
i) ) 、 N(i)はD(i) IC対応f る単
語列o 最後尾単語名+ B(i)はN(i)の始点位
置マイナス1(N(i)の一つ前の単語の最終フレーム
)−D”(i、j)はD(m)と入力のnB−1〜lフ
レームと単語nの1〜jフレームとの最小累積距離の和
のmについての最小値である。
初期条件D(ハ)=O、B向=0として=mLn(D(
m)l−D”(m+1 :i))−min(Dn(i、
J”))n、11 0 ・・・・・・・・・・・・・・・・・・・・・・・・・
・・・・・・・・(6)をめ、この式を満たすn、mを
合、沓とするとき。
△ △ N、(1)= n 、 B(1)−m とする。認識結果は次のようにXが既知の場合と同様に
まる。
最後の単語: N(r) 最後から2番目の単語: N (B(I))最後から3
番目の単語: N (B (B(1) ) )最初の単
語: N(B(B(・・・(B(I))・・す))でB
(B(B(=−(B(I))−)))−o となったと
き終了する。第5図はN(i) 、 B(i)から上の
単語列をめるフローチャートである。
なおりn(m+1:f)は次式で定義され、前記の孤立
単語のDPマツチングと同じ方法でめられる。
Dh(Ill−1−1: i )=minΣ dn(k
、u(k)) ・・・・・・・・・・山・16)u(i
) 、顧0+1 o<u(=)−u(k−1)<2.u(m+1)=1.
u(t)=J”以上の連続単語音声認識において、単語
の標準パターンヲ前記vcv 、cv 、vc 、v 
、vvの標準パターンに置き替えれば、任意の入力音声
を音節列に変換することができる音声認識装置の実現が
可能である。
第6図は1本発明の第1の実施例である。入力音節数未
知の場合について本発明の詳細な説明する。100は音
声信号の入力端子、1o1はフィルタバンク等で構成さ
れた特徴抽出部であって2人力音声信号を特徴ベクトル
の系列a1.a2.・・・・・・a工 に変換する。1
02は標準パターン記憶部であって、前記vCvおよび
Cvに対応するN個の標準パターンが特徴ベクトルの系
列として予め登録されている。103はフレーム間距離
計算部であって、入力の第iフレームにおける特徴ベク
トルA1トn番目(7)’fi準ハターンRn=bnl
、 b2n・・bSnのそれぞ江5炒特徴ベクトルとの
距離dn(i、i)を1 りn〈N 、 1 <、j 
りJ”についてめる。do(i、i) は例えばaiと
biの市街地距離として定義できる。即ち、ベクトルの
次元をlとし−ai= Dt+ 、 aiz、 −−、
aiz) 、 b5n=(b’j+ 、 b)。
・・・・・・s”jt)とするとき。
dn(i 、1) =、己、 lalに−b7kl・・
・−−(力とすることができる。104 、106は、
このフレーム間距離を必要がなくなるまで記憶するフレ
ン 一ム間距離記憶部である。104は前記の如くVCに対
応するパターンとしても用いられるq、vに対応する標
準パターンに関して計算されたフレーム間距離を記憶す
るフレーム間距離記憶部(1)−105i1J[V、V
、TV、(−(7)他前記Cv以外のCvに対応する標
準パターンに関して計算されたフレーム間距離を記憶す
るフレーム間距離記憶部(2)でるる。jCに対、応す
るフレーム間距離は、CvK関してめられたフレーム間
距離dn(i、1)dn(i、2)、=−−−−、dn
(i、j)、−・・−・・、dn(i、Jn)ヲj V
C関Lf逆ニ並ヘタd”(L 、 Jr′) 、 dr
′(i、Jn−1) 、・・・’・・、dn(’ 、]
 )、−’−・−、a”(i、2)。
d”(t、1)となるにすぎないから、フレーム間距離
についてはVCについてはめる必要はない。
106はフレーム間距離記憶部(1)104に対し。
以後の処理において、Cvに対する7レ一ム間距( 離を必要とする場合と、vCに対するフレーム間距離を
必要とする場合について、フレーム間距離dn(i、j
)のコに関するi出順序を切シ替える読み出しアドレス
制御部である。107は累積距離計算部であって式(6
)の漸化式を計算するものである。具体的には、前記D
”(i’、 j )とそれに対応するバックポインタB
n(f、+)をfl=1.2゜・・・・・・+N;j−
’1,2.・・・・・・ an についてめる。径路の
拘束条件の例としては第3図(a)〜(θ)等が考えら
れるが−ここでは第3図伽)のマツチング4路を採用す
るものとすれば、次の漸化式を計算することになる。即
ち−ay、v、vv、vcvに対する標準パターンの一
連番号をn=1.2゜・・・・・・、N’、VCに対す
る標準パターンの一連番号f:n =N’−M 、 N
’+2、−=−、Nとし、同一の子音、同一の母音から
なるCv音節とVC音節のそれぞれの標準パターンに対
応する番号n 、 n’をn=n/ N/ となるよう
に番号付けたとき、n=1゜2、・・・・・・N′に関
しては ・・・・・・・・・・・・・・・・・・・・・・・(s
−1)また+ n=N’+1 、 N’+2 、 ・−
・−、N VC関しては・・・・・・・・・・・・・・
・・・・・・・・・・(8−2)となる。
バックポインタは ・・・・・・・・・・・・・・・・・・・・・・・・・
・・・・・(9)ただし、初期値は B(:O) =。
である。
第7図は漸化式(8)が計算される様子を図解したもの
であって、格子点114へ至る一つ前の格子点は116
,116,117の何れかである。同様にして格子点1
16,116,117のそれぞれの一つ前の格子点は、
格子点115については118.119,12(l格子
点116については119,121,122−格子点1
17については120,122,123の何れかとなる
。従って、格子点(i 、 Jr′)に至る径路は、第
8図の斜線部の内部に限定される。ただし、横軸は入カ
バターン、縦軸は標準パターンnであって、124は傾
斜y2の直線、125は傾斜2の直線である。
またーこの図の意味するところは入力の1フレームを終
端と仮定して、最後尾の入カバターンの部分パターンを
標章パターンnとマツチングしたときの累積距離D”(
i 、 Jn)は、1′〜1”のうちnn c t 、
 Jn )が最小になるという意味で最適な点が標準パ
ターンnに対応する始端点として自動的に選択された結
果として計算される。また、その点がBn(i、 Jn
)−4−1ということになる。ただしt’ 、 t″は
それぞれ直線12a 、 126と1軸との交点でおる
。また、第7図の説明からも明らかなように、第1フレ
ームにおけるフレーム間距離dn(i、j )−1it
ltI)n(t 、j )ハiカ変ル度に対応する第8
図で示した斜線部のすべての格子点についてめ直す必要
はなく、各格子点について1回計算するのみでよい。
累積距離計算部107は、さらに終端累積距離D(1)
、終端バックポインタB(i) +最後尾音節N (i
)を次のようにしてめる。
n=1.2.・・・・・・、N′に対してD”(i) 
−D” (i 、 Jn)B”(i) =B” (i 
、 Jn)とおく。
また、vlo(!:Cv2を結合するとき、その筐ま結
合するとvlCのO(!: Cj V2のCの長さの和
になるので、長くなりすぎる場合がある。従って、実際
はvlCに対応する標準パターンに対しては終端点自由
−CV2vc対応する標準パターンについては始動点自
由にしてマツチングするのがよい。最も簡単にはVCパ
ターンに対して終端点自由のみのマツチングを行えばよ
い。
即?)n =N’−1−1 、 N’+2、、−−−−
−・、 Nに対してそれぞれのnに対してjnを定め B“(i)= B”(i 、♀) とおく。ただし、全は弐口2を満足するコである。
しかる後 B(i)=B会(i) △ N(i)−n △ をめる。ただしnは弐〇3を満足するnである0108
は累積距離記憶部であって、累積距離計算部107 請
求メラレタDn(i 、 J” ) 、 B”(i 、
 Jn)を一時的に記憶するものである。これらの値は
。
累積距離計算部107における計算の際に必要なもので
あるが一第7図からも明らかなように、第i7レー4ノ
D”(1,j)、Bn(i、j)+7)計113Eに対
しては一第3図(b)の径路を採用するときは−D0(
i−1,j ) 、Dn(L −2、j ) 、B’(
i −1、j )。
Bn(l−2,j) のみ必要であるから、2フレ一ム
分のみ記憶していれば良い。第3図(a)の径路を採用
するときは勿論1フレ一ム分のみ記憶していればよい。
このことは、前記フレーム間距離記憶部104 、10
5についても言えることであって累積距離Dn(i、j
)の計算に必要なフレーム間距離は第3図[有])の径
路のときはdn(t sj ) 、d”(i−1,j)
のみであり、第3図(a)の径路のときはdn(ttj
)のみであるから、フレーム間距離記憶部10a 、 
105についてもたかだか2フレ一ム分のフレーム間距
離に対する記憶容量があれば良いことになる。
109はバックポインタ記憶部であって、累積距離計算
部107で計算されたバックポインタB(i)を記憶す
るものである。112は最後尾音節記憶部であって、累
積距離計算部107で計算され△ △ た−前記第1フレームにおけるnをN (1) = n
として記憶するものである。
以上の処理はフレームが1進む毎に行われる。
110は音声区間検出部であって、入力信号の大きさ等
から周知の方法により音声区間を判定するものであって
、音声区間検出部110が音声入力が開始されたことを
検出すると、フレーム数計数部111はフレーム毎に計
数を始める。これまでの説明は第1フレームにおける処
理であったが。
このフレーム数計数部111の計数値が、このlを設定
している。フレーム数計数部111は音声区間が検出さ
れると計数を始め一音声区間が終了するとリセットされ
る。音声区間の終了は入力音声の最後の定常部とする。
これは日本語においては必ず母音で終了するものであり
、母音部の中心付近は定常だからである。従って、最後
尾音節記憶部113.バックポインタ記憶部109には
−N (i) 、 B (1)が1=1.2.・・・・
・・、工について記憶されることになる。
セグメンテーション部112はバックポインタ記憶部1
09に対し、所定のバックポインタを読出すべき命令を
発するものである。即ち、セグメンテーション部112
が1なる値をバックポインタ記憶部109に発すると、
バックポインタ記憶部109からはバックポインタB 
(1)が読出される。
セグメンテーション部112は、バックポインタ記憶部
109からB (i)なる値を受け取ると、その同じ値
をバックポインタ記憶部109に発する。
従って一音声区間検出部110が音声入力の終了を検知
すると、フレーム数計数部111の最終値工がセグメン
テーション部112に供給され、セグメンテーション部
112は先ず工なる値をバックポインタ記憶部109に
発する。以後−前記説明の動作に従って、バックポイン
タ記憶部109からB (I) 、 B (JI)) 
、・・・・・・、0 なる出力が順次得られることにな
る。これらの値は最後から2番目のパターンの終りのフ
レーム、同3番目の終すのフレーム、同4番目の終りの
フレーム、・・・・・・というものであり、N (i)
は第1フレームで終るノ(ターンであるから、この値を
そのまま最後尾音節記憶部113に与えると、端子12
6には最後の音節から逆の順序で認識結果が得られる。
第9図は以上の実施例の動作をプログラム的に表現した
図であり、ソフトウェアで実現する場合もこれに従えば
よいOなお、同図においてDOWHII、ICロエコ E、NDDO なる記法は、条件人が成立する間Bを行うということを
意味する。また。
DOUNTIL 口■コ NDDO なる記法は1条件人が成立するまでBを行うということ
を意味する。
ステップ200.201は累積距離D(1)、Dn(i
、コ)バックポインタB(i)、B(i、コ)の初期化
を行う部分である。
ステップ203は第1フレームにおける処理を示してお
り、大きくわけて中間累積距離Dn(i、j)および中
間バックポインタB”(i、j) をめる部分204.
207と終端累積距離D(i) 、終端バックポインタ
B(i)、最後尾音節N (i)をめる部分205に分
かれる。
ステップ204はn=1.2.・・・・・・、N′につ
いて、ステップ207はn =N’−4−1 、 N’
+2 、−・・−・r N K ツイテ前He Dn(
’ 、3 )、Bn(’ r j) 請求めるものであ
る。
スフ−スフ205 、2osid前記Dn(i 、j 
) 、’Bn(1,j)をめるに際し、フレーム毎に初
期化する部分である。
ステップ206.209では、Dn(t 、J)ニ関−
jル漸化式Th計算L−Dn(i 、j ) 、Bn(
i 、j )をめると共に、標準パターンnに関する終
端累積距離D”(i)と終端バックポインタBn(i)
をめている。このとき、フレーム間距離については前述
したように、ステップ206でめておけば一ステップ2
09では計算する必要はない。
△ ステップ210はDr′(1)を最小にするnをめ、終
端累積距離D(i) = D”(i)と終端バックポイ
ンタ分である。
ステップ211,212はステップ203で得られたi
=1.2.・・・・・・、工についてのB(i) 、 
N(i)から認識音節列を得る判定処理部であって、第
6図のフローチャートに従っている。この部分で得△ られるnを逆順に並べ替えれは、vcv 、vv 。
cv、v、vcの形で認識された音節列が得られる。
以上の処理を前記第6図の実施例と対応させてみると、
ステップ203における処理はブロック103〜109
における処理に対応しており、ステップ212の処理は
、ブロック108,109゜112.113の処理に対
応している。
以上、第1の実施例においては、入カバターンと、標準
パターンの連結し苑ものとをマツチングするとき−とに
かく、入カバターンに最も近くなるようにマツチングさ
れるのであって、vCv。
c’v、vvなど母音で芦る音節の次にCvなど子音で
始まる音節が存在するように認識はれる場合がある。ま
た、VC音節の次に、母音で始まる音節が存在するとし
て認識される恐れもある。この問題を除くには、母音v
Xで終る音節の次には必ず母音VXで始まる音節が続き
、子音Cxで終る音節の次には必ず子音CXで始まる音
節が続くようにマツチングすればよい。次にこのように
改良した第2の実施例について説明する。
この改良は第1の実施例を少し変更するだけで簡単に実
現できる。即ち、第1フレームにおける終端累積距離D
(1)を後続音韻毎にめておき、後続音韻mの音節に対
する終端累積距離をD m (i)とするとき1次のフ
レームで先行音韻がmの音節とマツチングするときは累
積距離の初期値としてDID(i) i用いるものであ
る。従って、後続音韻mの終端バックポインタをB m
 (i) 、音節nの先行音韻tf(n)とすると式(
9)の初期条件は次のように変更される。
ただし−Mは音韻に付された番号で後続音韻となり得る
音韻の種類に等しい。
式(I4)を初期値として式(B 1 ) 、(8−2
)、 (9)を解くことになる。終端累積距離Dm(i
) 、終端バンクポインタBm(i) 、最後尾音節N
m (i)は次のようにしてまる。
Dn(i) 、 Bn(i)は第1の実施例の場合と同
様にしてめる。次にDm(i) 、 Bm(i) 、 
Nm(i) (Dm(i) に対応する後続音韻mの最
後尾音節)’izm=1.2゜・・・・・・1Mについ
てめる。
Bm(i) = B’(i) Nm(i) = n △ ただし−p(n)は音節nの後続音韻、nは式(151
を満足するnである。
第10図は本発明の第2の実施例の構成を示すブロツク
図である。同図において、第6図の第1の実施例と同一
の番号を付したブロックは、第1の実施例とほぼ同じ動
作をする。ただ、累積距離計算部107における処理が
上記の如く変更になったのと一累積距離記憶部108.
パックポインタ記憶部109.最後尾音節記憶部113
においてDm(’) r Bm(1)、 Nm(i)を
1くmくhに対して記憶す、る点が異る。127は後続
音韻決定部であって、第2の実施例において付加される
ものである。即ちm=1.2.・・・・・・9M′を母
音に対して付された番号−m =M’−1−1 、 M
’+2 、−−−−−− 、 M全子音に対して付され
た番号とするとき。
m = argm tn (Dm(I) ’]+りm<
M’ をめるものである。このmに対し、最後尾音節△ 記憶部113からn = Nm(I)が読み出され、セ
グメンテーション部112を通じてバックポインタ記憶
部109からB6(I)が読み出される。即ち、N、%
I) の1つ前の音節はフレームBM(I)で終端して
いる。128は先行音韻決定部であって、n−N台(I
)の先行音韻J°(合)を探索する。これは、フレーム
i = BM(I)において、後続音韻J’ C’R)
の音節カN分(I)の1つ前の音節となるからである。
故に△ 後続音韻決定部127において新たなmとして△ △ m =−f(n)とおいて最後尾音節記憶部113がら
△ △ 後続音韻mの新たな音節n = N台(i)が読み出さ
れる。同時に、セグメンテーシ・ン部112は金と1か
ら、バックポインタ記憶部109に対してフ△ レームlにおける後続音韻mのバックポインタB合(i
)を読み出すべく作用する。
以下、同様な動作が行われて、音節列が逆の順序でまっ
てゆく。
第11図は第2の実施例の動作をプログラム的に表現し
た図であり、ソフトウェアで実現する場合もこれに従え
ばよい。
第9図と同じ番号を付したステップはほぼ同じ処理をす
るものである。第9図と異る点は、ステップ200にお
いてD(o) 、 B(0)がDm(0) 、 Bm(
0)となっている点−ステップ205.208において
D(i−+)が−Df(m)(i −1)となっている
点、ステップ210において、終端累積距離Dm(i)
 、終端バックポインタBm(i)、最後尾音節N(1
(i)等後続音韻毎にめている点、ステップ211,2
12において、フレームiで終端する音節に続く音節の
先行音韻は前者の後続音韻と等しいという制限のもとで
、各フレーム1に対してめられているBm(i) 。
Nm(i)とDm(I)から音節列を逆向に決定してゆ
く点である。これらの処理は既に第10図の実施例で説
明法である。
発明の効果 以上のように一本発明によれば、少い登録パターン数で
連続的に発声された音声を認識して、音節列に変換する
ことが可能となったものである。
なお、本発明の実施例として、DPマツチングを用い、
入力音節数未知の場合について説明したが1本発明はそ
れに限定されるものではない。即ち、式(3)を解くこ
とによって、連続パターンの認識を行う装置は他にも種
々考えられるが1本発明は、それらすべてに適用可能で
ある。例えば、入力音節数が既知の場合は、式(4)に
基づく認識装置に適用できるものである。さらに1本発
明はDPマクチングを用いた装置ばかりでなくVCV音
節を標準パターンとして必要とするあらゆる音声認識装
置に適用することができる。
【図面の簡単な説明】
第1図はDPマツチングの原理を説明する格子グラフ、
第2図(a)〜(i)は格子グラフ上におけるマツチン
グ径路の制限条件の一例を示す図、第3図(ロ))〜(
θ)は連続単語音声の認識等に用いられるマツチング径
路の制限条件の一例を示す図、第4図。 第5図はそれぞれ入力単語数既知の場合と、未知の場合
についての最終的に認識単語列を得る方法を示すフロー
チャート、第6図は本発明の一実施例を示すブロック図
、第7図、第8図は同実施例におけるマクテング計算の
様子を説明する図、第9図は本発明の実施例に対応する
処理をプログラム的に実現する方法を示す図、第10図
は本発明の第2の実施例を示すブロック図、第11図は
第2の実施例に対応する処理をソフトウェア的に実現す
る方法を示す図である。 101・・・・・・特徴抽出部−102・・・・・・標
準パターン記憶部、103・・・・・フレーム間距離計
算部、104・・・・・・フレーム間距離記憶部(1)
、106・・・・・・フレーム間距離記憶部(2)=1
06・・・・・・読み出しアドレス制御部、107・・
・・・・累・積距離計算部、108・・・・・・累積距
離記憶部2109・・・・・・バックポインタ記憶部、
110・・・・・・音声区間検声部、111・・・・・
・フレーム数計数部−112・・・・・・セグメンテー
ション部−113・・・・・・最後尾音節記憶部。 代理人の氏名 弁理士 中 尾 敏 男 ほか1名第2
図 Ca) (b) (C) cd−ノ (eン (チジ 第3図 (cL) (b) (C) (d) (e)第4図 第 5 図

Claims (1)

  1. 【特許請求の範囲】 入力音声信号を特徴ベクトルの系列&+ 、 2L2 
    。 ・・・・・・arに変換する特徴抽出手段と、第n単音
    節に対する特徴ベクトルの系列b1.b2. ・・・・
    ・・。 bJn(ただし−n=1 、2、−−−−−・、N i
    Nは単音節数、Jn は第n単音節の母音定常部の)、
    レーム)を標準パターンとして記憶する標準パターン記
    憶手段と、前記入力音声信号の特徴ベクトルの系列を、
    前記単音節標糸パターンとマツチングするとともにいく
    つかのn′に対しては、第n′単音節の特徴ベクトルの
    系列bj 、b2 、・・・・・・z l)”Jn’を
    逆の順序に並べた特徴ベクトルの系列bシニ・* bJ
    H’ −<。 ・・・・・・+ br21 bl”ともマツチングする
    パターンマツチング手段とを備えたことを特徴とする音
    声認識装置。
JP58113091A 1983-06-22 1983-06-22 音声認識装置 Granted JPS604996A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP58113091A JPS604996A (ja) 1983-06-22 1983-06-22 音声認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP58113091A JPS604996A (ja) 1983-06-22 1983-06-22 音声認識装置

Publications (2)

Publication Number Publication Date
JPS604996A true JPS604996A (ja) 1985-01-11
JPH0534680B2 JPH0534680B2 (ja) 1993-05-24

Family

ID=14603248

Family Applications (1)

Application Number Title Priority Date Filing Date
JP58113091A Granted JPS604996A (ja) 1983-06-22 1983-06-22 音声認識装置

Country Status (1)

Country Link
JP (1) JPS604996A (ja)

Also Published As

Publication number Publication date
JPH0534680B2 (ja) 1993-05-24

Similar Documents

Publication Publication Date Title
US7107216B2 (en) Grapheme-phoneme conversion of a word which is not contained as a whole in a pronunciation lexicon
US10319373B2 (en) Information processing device, information processing method, computer program product, and recognition system
JPH0535299A (ja) 音声符号化方法及び装置
EP0265692B1 (en) System for continuous speech recognition
JPH0247760B2 (ja)
US4802226A (en) Pattern matching apparatus
JP2964881B2 (ja) 音声認識装置
JPS60164800A (ja) 音声認識装置
JPS62173499A (ja) 連続音声認識装置
JPH0534680B2 (ja)
JPH0223876B2 (ja)
US20070271096A1 (en) Voice Recognition Method And System Based On The Contexual Modeling Of Voice Units
JPH0449954B2 (ja)
JPH0566598B2 (ja)
JPS61107398A (ja) 音声認識装置
JPH0646357B2 (ja) 連続音声認識装置
JPS6283798A (ja) 連続音声認識装置
JPS60182499A (ja) 音声認識装置
JPH0247757B2 (ja)
JPH067359B2 (ja) 音声認識装置
JPS6335996B2 (ja)
JPH0320759B2 (ja)
JPH0552516B2 (ja)
JPH045398B2 (ja)
JPS5961897A (ja) 認識装置