JPS63236000A - 音声認識方法 - Google Patents
音声認識方法Info
- Publication number
- JPS63236000A JPS63236000A JP62069344A JP6934487A JPS63236000A JP S63236000 A JPS63236000 A JP S63236000A JP 62069344 A JP62069344 A JP 62069344A JP 6934487 A JP6934487 A JP 6934487A JP S63236000 A JPS63236000 A JP S63236000A
- Authority
- JP
- Japan
- Prior art keywords
- frame
- similarity
- word
- calculated
- speech
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
産業上の利用分野
3 ・\一
本発明は人間の声を機械に認識させる音声認識方法に関
するものである。
するものである。
従来の技術
近年音声認識技術の開発が活発に行なわれ、商品化され
ているが、これらのほとんどは声を登録した人のみを認
識対象とする特定話者用である。
ているが、これらのほとんどは声を登録した人のみを認
識対象とする特定話者用である。
特定話者用の装置は認識すべき言葉をあらかじめ装置に
登録する手間を要するため、連続的に長時間使用する場
合を除けば、使用者にとって大きな負担となる。これに
対し、声の登録を必要とせず、使い勝手のよい不特定話
者用の認識技術の研究が最近では精力的に行なわれるよ
うになった。
登録する手間を要するため、連続的に長時間使用する場
合を除けば、使用者にとって大きな負担となる。これに
対し、声の登録を必要とせず、使い勝手のよい不特定話
者用の認識技術の研究が最近では精力的に行なわれるよ
うになった。
音声認識方法を一般的に言うと、入力音声と辞書中に格
納しである標準的な音声(これらはパラメータ化しであ
る)のパターンマツチングラ行す°って、類似度が最も
高い辞書中の音声を認識結果として出力するということ
である。この場合、入力音声と辞書中の音声が物理的に
全く同じものならば問題はないわけであるが、一般には
同一音声であっても、人が違ったり、言い方が違ってい
る人の違い、言い方の違いなどは、物理的にはスペクト
ルの特徴の違いと時間的な特徴の違いとして表現される
。すなわち、調音器官(ロ、舌、のどなど)の形状は人
ごとに異なっているので、人が違えば同じ言葉でもスペ
クトル形状は異なる。
納しである標準的な音声(これらはパラメータ化しであ
る)のパターンマツチングラ行す°って、類似度が最も
高い辞書中の音声を認識結果として出力するということ
である。この場合、入力音声と辞書中の音声が物理的に
全く同じものならば問題はないわけであるが、一般には
同一音声であっても、人が違ったり、言い方が違ってい
る人の違い、言い方の違いなどは、物理的にはスペクト
ルの特徴の違いと時間的な特徴の違いとして表現される
。すなわち、調音器官(ロ、舌、のどなど)の形状は人
ごとに異なっているので、人が違えば同じ言葉でもスペ
クトル形状は異なる。
また早口で発声するか、ゆっくシ発声するかによって時
間的な特徴は異なる。
間的な特徴は異なる。
不特定話者用の認識技術では、このようなスペクトルお
よびその時間的変動を正規化して、標準パターンと比較
する必要がある。
よびその時間的変動を正規化して、標準パターンと比較
する必要がある。
不特定話者の音声認識に有効な方法として、本出願人等
は既にパラメータの時系列情報と統計的距離尺度を併用
する方法が提案され(二矢田他;“簡単な不特定話者用
音声認識方法″、日本音響学会講演論文集、1−1−4
(昭和61年3月))更に認識の演算効率の向上をはか
った手法が出願人の一人によって出願されている(特願
昭61−272475号)ので以下、従来の技術例とし
て説明する。
は既にパラメータの時系列情報と統計的距離尺度を併用
する方法が提案され(二矢田他;“簡単な不特定話者用
音声認識方法″、日本音響学会講演論文集、1−1−4
(昭和61年3月))更に認識の演算効率の向上をはか
った手法が出願人の一人によって出願されている(特願
昭61−272475号)ので以下、従来の技術例とし
て説明する。
これらの方法はパターンマツチング法を用いて、5 へ
− 音声を騒音中からスポツティングすることによって、音
声の認識を行うと同時に音声区間をも検出する事ができ
る。
− 音声を騒音中からスポツティングすることによって、音
声の認識を行うと同時に音声区間をも検出する事ができ
る。
まず、パターンマツチングに用いている距離尺度(統計
的距離尺度)について説明する。
的距離尺度)について説明する。
入力単語音声長をJフレームに線形伸縮し、1フレーム
あたりのパラメータベクトルを1+Jとすると、入力ベ
クトル×は次のようになる。
あたりのパラメータベクトルを1+Jとすると、入力ベ
クトル×は次のようになる。
沃0(月、虜2.・・・・・・、匂)
ここで、各&Jはp次元のベクトルである。
単語ωk(に=1.2.・・・、K)の標準パターンと
して、平均値ベクトルを/l’ k s共分散行列をI
WI(とすると、事後確率P(ωkl&)を最大とする
単語を認識結果とすればよい。
して、平均値ベクトルを/l’ k s共分散行列をI
WI(とすると、事後確率P(ωkl&)を最大とする
単語を認識結果とすればよい。
ベイズの定理より
P(ωに1次)−P(ωk)・P(水1ωk)/P(メ
)右辺第1項のP(ωk)は定数と見なせる。正規外−
exp (−1/2 (/(−#k ) ・%Wk・(
X−yk)) (2)分母項P(至)は入力パラメ
ータが同一ならば定数と見做せるが、異なる入力に対し
て相互比較するときは、定数にならない。ここでは、P
〆)が平均値〃x1 共分散行列wxの正規分布に従う
ものと仮−exp[1/2(&−I/1.x)・W )
’ (JC−#x)) (3)(1)の対数をと
り、定数項を省略して、これをILkと置くと、 1Lk−(A 7zk )・’w k’ (x /1t
k) −(fi−#x )、\wx・(m−/px)+
log IIWk IIWx l (4)
ここで、lWk、WXを全て共通と置き1wとする。す
なわち、 W=(lWI+lW2+−−−−−+lWk+1Wx)
/(K+1) (5)として(4)式を展開する
と、 Lk = Bk −/Ak−メ
(6)ただし、 Ak=2(vl/・/1tk−%W ・/l1x)
(7)Bk=Ittk−SW −/
/zk −#x −SW ・〃lz
(8)7へ (6)式は計算量が少ない1次判別式である。ここで、
(6)式を次のように変形する。
)右辺第1項のP(ωk)は定数と見なせる。正規外−
exp (−1/2 (/(−#k ) ・%Wk・(
X−yk)) (2)分母項P(至)は入力パラメ
ータが同一ならば定数と見做せるが、異なる入力に対し
て相互比較するときは、定数にならない。ここでは、P
〆)が平均値〃x1 共分散行列wxの正規分布に従う
ものと仮−exp[1/2(&−I/1.x)・W )
’ (JC−#x)) (3)(1)の対数をと
り、定数項を省略して、これをILkと置くと、 1Lk−(A 7zk )・’w k’ (x /1t
k) −(fi−#x )、\wx・(m−/px)+
log IIWk IIWx l (4)
ここで、lWk、WXを全て共通と置き1wとする。す
なわち、 W=(lWI+lW2+−−−−−+lWk+1Wx)
/(K+1) (5)として(4)式を展開する
と、 Lk = Bk −/Ak−メ
(6)ただし、 Ak=2(vl/・/1tk−%W ・/l1x)
(7)Bk=Ittk−SW −/
/zk −#x −SW ・〃lz
(8)7へ (6)式は計算量が少ない1次判別式である。ここで、
(6)式を次のように変形する。
=−、利の3回の加算と1回の減算で求められる。
次に上記の距離尺度を用いて騒音中から音声をスポツテ
ィングして認識する方法について説明したちとで、計算
量の削減方法について説明する。
ィングして認識する方法について説明したちとで、計算
量の削減方法について説明する。
音声を確実に含む十分長い区間を対象として、この中に
種々の部分区間を設定して、各単語との類似度を(9)
式によって求め、全ての部分区間を通して類似度が最大
となる単語を認識結果とすればよい。この類似度計算を
そのまま実行すると計算量が膨大となるが、単語の持続
時間を考慮して部分区間長を制限し、また計算の途中で
部分類似度dk)を共通に利用することによって、大幅
に計算」 量を削減できる。第3図は本方法の説明図である。
種々の部分区間を設定して、各単語との類似度を(9)
式によって求め、全ての部分区間を通して類似度が最大
となる単語を認識結果とすればよい。この類似度計算を
そのまま実行すると計算量が膨大となるが、単語の持続
時間を考慮して部分区間長を制限し、また計算の途中で
部分類似度dk)を共通に利用することによって、大幅
に計算」 量を削減できる。第3図は本方法の説明図である。
入力と単語にの照合を行う場合、部分区間長n (n”
、’<n <nセ))を標準パターン長Jに線形伸縮し
、フレームごとに終端固定で類似度を計算していく様子
を示している。類似度はQR上の点Tから出発してPで
終るルートに沿って(9)式で計算される。したがって
、1フレームあたシの類似度計算は全てAPQR内で行
われる。ところで(9)式のXJは、区間長nを伸縮し
た後の第jフレーム成分なので、対応する入力フレーム
コ′ が存在する。
、’<n <nセ))を標準パターン長Jに線形伸縮し
、フレームごとに終端固定で類似度を計算していく様子
を示している。類似度はQR上の点Tから出発してPで
終るルートに沿って(9)式で計算される。したがって
、1フレームあたシの類似度計算は全てAPQR内で行
われる。ところで(9)式のXJは、区間長nを伸縮し
た後の第jフレーム成分なので、対応する入力フレーム
コ′ が存在する。
そこで入力ベクトルを用いて、dklを次のように表現
できる。
できる。
矢) 、 k)
’ (i 、j)−町・凌t (1
0)ただし、i′−レr、(J)+1 (11
)ここで、r、 (J)は単語長nとJの線形伸縮を関
係づける関数である。したがって、入力の各フレームと
亀、との部分類似度が予め求められていれば、(9)式
はl′の関係を有する部分類似度を選択して加算するこ
とによって簡単に計算できる。ところで、APQRは1
フレームごとに右へ移動するの伽) で、PS上で機、と/+[10部分類似度を計算して、
それを△PQSに相当する分だけメモリに蓄積し、9
・\− フレームごとにシフトするように構成しておけば、必要
な類似度は全てメモリ内にあるので、部分類似度を求め
る演算の重複が省略でき計算量が少なくなる。しかし更
に、上記Lkのかわ9に(12)式及び(13)式で示
される遂次演算で与えられる値L’kを用いる事により
更に演算量の削減をはかる事ができる。
0)ただし、i′−レr、(J)+1 (11
)ここで、r、 (J)は単語長nとJの線形伸縮を関
係づける関数である。したがって、入力の各フレームと
亀、との部分類似度が予め求められていれば、(9)式
はl′の関係を有する部分類似度を選択して加算するこ
とによって簡単に計算できる。ところで、APQRは1
フレームごとに右へ移動するの伽) で、PS上で機、と/+[10部分類似度を計算して、
それを△PQSに相当する分だけメモリに蓄積し、9
・\− フレームごとにシフトするように構成しておけば、必要
な類似度は全てメモリ内にあるので、部分類似度を求め
る演算の重複が省略でき計算量が少なくなる。しかし更
に、上記Lkのかわ9に(12)式及び(13)式で示
される遂次演算で与えられる値L’kを用いる事により
更に演算量の削減をはかる事ができる。
(転)
Lk−日k RJ
(12)R央)=、卸+、、、ax(R(−−l
) R(−一(J−1) p(r−7)>」J
J−1+ J−1 この式の意味は第3図のへPQR内の直線PTの集合の
みならず、それを含む傾き1/mからIAの範囲内の全
ての単調増加折れ線の全集合に対して最適なマツチング
パスを求めている事に相当する。上記のようにして求め
だL’には、Lk と比較して、等しいか又は小さな
値をとる性質がある点で多少異る値をとるものの実用上
は支障ないが、むしろ良い結果が得られる事が実験によ
シ確かめられている。又更にこの方法によれば、必要な
演算量及びメモリの量が、それぞれ、(13)式の遂次
演算を行うに必要な量のみになり、Lkを直接求める方
法に比べて、約1A程度にまで削減できる。
(12)R央)=、卸+、、、ax(R(−−l
) R(−一(J−1) p(r−7)>」J
J−1+ J−1 この式の意味は第3図のへPQR内の直線PTの集合の
みならず、それを含む傾き1/mからIAの範囲内の全
ての単調増加折れ線の全集合に対して最適なマツチング
パスを求めている事に相当する。上記のようにして求め
だL’には、Lk と比較して、等しいか又は小さな
値をとる性質がある点で多少異る値をとるものの実用上
は支障ないが、むしろ良い結果が得られる事が実験によ
シ確かめられている。又更にこの方法によれば、必要な
演算量及びメモリの量が、それぞれ、(13)式の遂次
演算を行うに必要な量のみになり、Lkを直接求める方
法に比べて、約1A程度にまで削減できる。
以下その方法を第4図及び第5図を用いて説明する。第
4図はその機能ブロック図である。
4図はその機能ブロック図である。
入力された未知入力音声信号は、AD変換部41で、8
KHzサンプリングされて12ビツトのディジタル信号
に変換される。音響分析部42は10 m5ec(iフ
レーム)ごとに入力信号のLPG分析を行ない、10次
の線形予測係数と残差パワーを求める。特徴パラメータ
抽出部43は、線形予測係数と残差パワーを用いて、L
PCケプストラム係数01〜C5とパワー環coを特徴
パラメータとして求める。
KHzサンプリングされて12ビツトのディジタル信号
に変換される。音響分析部42は10 m5ec(iフ
レーム)ごとに入力信号のLPG分析を行ない、10次
の線形予測係数と残差パワーを求める。特徴パラメータ
抽出部43は、線形予測係数と残差パワーを用いて、L
PCケプストラム係数01〜C5とパワー環coを特徴
パラメータとして求める。
したがってフレーム毎の特徴ベクトルXは灰’=(Co
、 C1−・−C5) (14)である
。
、 C1−・−C5) (14)である
。
フレーム同期信号発生部44ば10 m5ec ごと
11−・ のタイミング信号(フレーム信号)を発生する部分であ
シ、認識処理フレーム信号に同期して行なわれる。
11−・ のタイミング信号(フレーム信号)を発生する部分であ
シ、認識処理フレーム信号に同期して行なわれる。
標準パターン選択部45は、1フレームの期間に標準パ
ターン格納部46に格納されている単語ナンバーに=1
,2.・・・・・・にを次々と選択してゆく。
ターン格納部46に格納されている単語ナンバーに=1
,2.・・・・・・にを次々と選択してゆく。
部分類似度計算部47では、選択された標準パターン−
と第1フレームの特徴ベクトルXi の部分類像度c
i(k)(i+j)を計算する。
と第1フレームの特徴ベクトルXi の部分類像度c
i(k)(i+j)を計算する。
do)(i、j)−&tkJ)、X戦、−4,2501
,、)(15)類似度計算部47では上記−(i、j)
よシ、後述の方法によって得られた値をL’にとして得
る。
,、)(15)類似度計算部47では上記−(i、j)
よシ、後述の方法によって得られた値をL’にとして得
る。
類似度比較部410では、求めたLkと一時記憶411
の内容を比較し、類似度が大きい(距離が小さい)方を
一時記憶411に記録する。
の内容を比較し、類似度が大きい(距離が小さい)方を
一時記憶411に記録する。
L′シ?(maX)
このようにして、フレーム1=ioから始め、標準パタ
ーンに=1に対して、 =(1)< n(ne(1)の
範囲で最大類似度L”、’ (m ax ) を求め
、次にに=2としてn”< n < n”の範囲で求め
たL2とL 、(max )S−e を比較して類似度の最大値を求め、このようにしてに−
Kまで同様な手順を繰返して最大類似度L’A9 (m
ax )とその時の単語ナンバーに′ を一時記憶41
1に記憶する。次に1−10+△i として同様な手順
を繰返して、最終フレームI = Iに到達した時に一
時記憶に残されている単語ナンバーに=kmが認識結果
である。また、最大類似度が得られた時のフレームナン
バーi=imと単語長n=nmを一時記憶411に蓄積
し、更新するようにしておけば、認識結果と同時に、そ
の時の音声区間を結果として求めることができる。音声
区間はim−nm−imである。
ーンに=1に対して、 =(1)< n(ne(1)の
範囲で最大類似度L”、’ (m ax ) を求め
、次にに=2としてn”< n < n”の範囲で求め
たL2とL 、(max )S−e を比較して類似度の最大値を求め、このようにしてに−
Kまで同様な手順を繰返して最大類似度L’A9 (m
ax )とその時の単語ナンバーに′ を一時記憶41
1に記憶する。次に1−10+△i として同様な手順
を繰返して、最終フレームI = Iに到達した時に一
時記憶に残されている単語ナンバーに=kmが認識結果
である。また、最大類似度が得られた時のフレームナン
バーi=imと単語長n=nmを一時記憶411に蓄積
し、更新するようにしておけば、認識結果と同時に、そ
の時の音声区間を結果として求めることができる。音声
区間はim−nm−imである。
以上のようにして音声認識処理が完了する。
次に第4図中類似度計算部47のLk の算出方法につ
いて詳しく説明する。ここで例としてJ−16、l=
1 、 m=4の場合について説明する。
いて詳しく説明する。ここで例としてJ−16、l=
1 、 m=4の場合について説明する。
第5図は、類似度計算部の1フレーム当シの実際の演算
機構を示した図である。
機構を示した図である。
まず動作の前に全ての記憶素子の内容を−■にしておく
。次にフレーム同期信号が64個入力されるのを待って
から未知入力音声から求まっている部分音素系列を入力
する。又遅延素子フレーム同期信号が1個入力される毎
に素子の入力側の信号を出力側へ移す働きをする。図は
同じ回路16段(段数はJに等しい)で構成されてお]
、L’scの算出が遂次演算によりなされている事が分
る。
。次にフレーム同期信号が64個入力されるのを待って
から未知入力音声から求まっている部分音素系列を入力
する。又遅延素子フレーム同期信号が1個入力される毎
に素子の入力側の信号を出力側へ移す働きをする。図は
同じ回路16段(段数はJに等しい)で構成されてお]
、L’scの算出が遂次演算によりなされている事が分
る。
即ち各段の部分累積値なる量、R覧RちいR覧を図で示
した位置での数値とすると、第1段の値は (k−4) R,−1) (is) (j=1,2.・・・・・・、16) 伽) で与えられる事が分る。従って最終段の値R16はとな
る。但しくξ(2))は を同時に満たす全ての関数の集合である。このようにし
て得られた<4を定数Bkから減ずれば、最終的にL’
kが得られる。以上述べた機構により13の遂次演算を
実現する事ができ、所望のL’kを得る事ができる。
した位置での数値とすると、第1段の値は (k−4) R,−1) (is) (j=1,2.・・・・・・、16) 伽) で与えられる事が分る。従って最終段の値R16はとな
る。但しくξ(2))は を同時に満たす全ての関数の集合である。このようにし
て得られた<4を定数Bkから減ずれば、最終的にL’
kが得られる。以上述べた機構により13の遂次演算を
実現する事ができ、所望のL’kを得る事ができる。
この方式における1フレーム1単語当シ必要な計算量は
、第5図によれば4個の数値から最大値を求める演算が
16.加算が16回程度の量ですむ。これを9式〜11
式に基きLkを直接求める方法だと第3図中APQR内
の候補直線PTの本数即ち、始端の範囲のフレーム数回
程度(具体的には約50)の比較演算と、始端の範囲の
フレー数×16回程度の演算が必要であシ、又メモリ量
に対しても△PQらの部分に相当する部分だけ必要であ
り、具体的には500程度必要となり、後に説明した方
法は演算量の点で相当に有利な方法である事が分る。
、第5図によれば4個の数値から最大値を求める演算が
16.加算が16回程度の量ですむ。これを9式〜11
式に基きLkを直接求める方法だと第3図中APQR内
の候補直線PTの本数即ち、始端の範囲のフレーム数回
程度(具体的には約50)の比較演算と、始端の範囲の
フレー数×16回程度の演算が必要であシ、又メモリ量
に対しても△PQらの部分に相当する部分だけ必要であ
り、具体的には500程度必要となり、後に説明した方
法は演算量の点で相当に有利な方法である事が分る。
発明が解決しようとする問題点
以上説明した従来技術においては(13)式の演算にお
いて、l、mが全フレームに関して一定値であり、(具
体例においてはl = 1 、 m=4)であシ、この
ままでもある程度の認識性能の確保はできるものの、パ
ターンマツチングにおける時間軸整合の自由度が太きす
ぎ、それに起因するミスマツチングが生じ、認識性能を
低下する要因を含んでいた。
いて、l、mが全フレームに関して一定値であり、(具
体例においてはl = 1 、 m=4)であシ、この
ままでもある程度の認識性能の確保はできるものの、パ
ターンマツチングにおける時間軸整合の自由度が太きす
ぎ、それに起因するミスマツチングが生じ、認識性能を
低下する要因を含んでいた。
本発明はかかる従来の問題点を解決し、きめの細かいマ
ツチングを行ない、認識率の向上を図ることを目的とす
るものである。
ツチングを行ない、認識率の向上を図ることを目的とす
るものである。
問題点を解決するだめの手段
本発明は上記目的を達成するものでその技術的手段は、
予め、認識対象とする単語の音声の各々の標準パターン
を表現する長さしのパラメータの系列P1 、 P2
、 、、、 PLを、認識対象とする全音声のデータ及
び全音声の周囲情報を用いて作成しておき、一方、認識
すべき音声とその周囲の情報を含む未知入力に対して単
位時間間隔(フレームという。)毎に、そのフレームに
おけるデータを表現するパラメータQn(ただしnはフ
レームの番号)を算出し、上記フレーム毎に前記パラメ
ータ系列の各要素P)(i=1.2.・・・L)につい
て、PiとQn との間の距離又は類似度Rn、+ (
i=1.2゜3、・・・L)を求め、更に以下の漸化式
9式% を利用し、前記漸化式のkおよびmをnの推移に従って
、又は対象単語毎に動的に変化させながら、全ての認識
対象単語、又は対象となる全フレームnについて算出さ
れるSn、Lの最適値を与える単語を認識結果として得
る事を特徴とする音声認識方法にある。
予め、認識対象とする単語の音声の各々の標準パターン
を表現する長さしのパラメータの系列P1 、 P2
、 、、、 PLを、認識対象とする全音声のデータ及
び全音声の周囲情報を用いて作成しておき、一方、認識
すべき音声とその周囲の情報を含む未知入力に対して単
位時間間隔(フレームという。)毎に、そのフレームに
おけるデータを表現するパラメータQn(ただしnはフ
レームの番号)を算出し、上記フレーム毎に前記パラメ
ータ系列の各要素P)(i=1.2.・・・L)につい
て、PiとQn との間の距離又は類似度Rn、+ (
i=1.2゜3、・・・L)を求め、更に以下の漸化式
9式% を利用し、前記漸化式のkおよびmをnの推移に従って
、又は対象単語毎に動的に変化させながら、全ての認識
対象単語、又は対象となる全フレームnについて算出さ
れるSn、Lの最適値を与える単語を認識結果として得
る事を特徴とする音声認識方法にある。
作 用
本発明は、上記構成において、前述の(13)式のjの
変化にともない、β及びmを動的に変化させる事によシ
、マツチングにおける時間軸整合の自由度を制御するこ
とにより認識性能の向上をは17 ・− かっている。
変化にともない、β及びmを動的に変化させる事によシ
、マツチングにおける時間軸整合の自由度を制御するこ
とにより認識性能の向上をは17 ・− かっている。
実施例
以下、図面を用いて本発明の実施例について説明する。
第1図は本発明の一実施例における音声認識方法を具現
化するだめの機能ブロック図である。
化するだめの機能ブロック図である。
入力された未知入力音声信号は、AD変換部11で、8
にHz サンプリングされて12ピツトのディジタル
信号に変換される。音響分析部12は10 m5ec
(1フレーム)ごとに入力信号のLPC分析を行ない、
10次の線形予測係数と残差パワーを求める。特徴パラ
メータ抽出部13は、線形予測係数と残差パワーを用い
て、LPCケプストラム係数01〜C5とパワー環co
を特徴パラメータとして求める。
にHz サンプリングされて12ピツトのディジタル
信号に変換される。音響分析部12は10 m5ec
(1フレーム)ごとに入力信号のLPC分析を行ない、
10次の線形予測係数と残差パワーを求める。特徴パラ
メータ抽出部13は、線形予測係数と残差パワーを用い
て、LPCケプストラム係数01〜C5とパワー環co
を特徴パラメータとして求める。
したがってフレーム毎の特徴ベクトルXはXt−(Co
C1−Cs ) (19)である。
C1−Cs ) (19)である。
フレーム同期信号発生部14は10 m5ec ごと
のタイミング信号(フレーム信号)を発生する部分であ
り、認識処理はフレーム信号に同期して行なわれる。
のタイミング信号(フレーム信号)を発生する部分であ
り、認識処理はフレーム信号に同期して行なわれる。
標準パターン選択部15は、1フレームの期間に標準パ
ターン格納部16に格納されている単語ナンバー、k=
1.2.・・・にを次々と選択してゆく。
ターン格納部16に格納されている単語ナンバー、k=
1.2.・・・にを次々と選択してゆく。
部分類似度計算部17では、選択された標準バタ眞)
一ンajと第1フレームの特徴ベクトル×1の部分類似
度d(k′(I、j)を計算する。
度d(k′(I、j)を計算する。
d(k)(I、j)=詠)t
−XI
(J””t2t・・・J)
類似度計算部17では、上記d(k)(I、j)より従
来例のかわシに後述の方法によって得られた値をL’に
として得る。
来例のかわシに後述の方法によって得られた値をL’に
として得る。
類似度比較部110は、求めだLk と一時記憶11
1の内容を比較し、類似度が大きい(距離が小さい)方
を一時記憶11に記録する。
1の内容を比較し、類似度が大きい(距離が小さい)方
を一時記憶11に記録する。
このようにして、フレームI ”” +6から始め、標
準パターンに=1に対してn(1)< n < n♀)
の範囲で最大類似度L1 (max)を求め、次にに
−2としてns<、≦ne■の範囲で求めた弓0とL:
’ (max )■ を比較して類似度の最大値を求め、このようにしてに=
Kまで同様な手順を繰返して最大類似度14? (ma
x)とその時の単語ナンバーに′を一時記憶111に記
憶する。次に+=io+△i として同様な手順を繰返
して、最終フレームi = lに到達した時に一時記憶
に残されている単語ナンバーに=kmが認識結果である
。また、最大類似度が得らレタ時のフレームナンバーi
==imと単語長n−nmを一時記憶111に蓄積し、
更新するようにしておけば、認識結果と同時に、その時
の音声区間を結果として求めることができる。音声区間
はim−nm−imである。
準パターンに=1に対してn(1)< n < n♀)
の範囲で最大類似度L1 (max)を求め、次にに
−2としてns<、≦ne■の範囲で求めた弓0とL:
’ (max )■ を比較して類似度の最大値を求め、このようにしてに=
Kまで同様な手順を繰返して最大類似度14? (ma
x)とその時の単語ナンバーに′を一時記憶111に記
憶する。次に+=io+△i として同様な手順を繰返
して、最終フレームi = lに到達した時に一時記憶
に残されている単語ナンバーに=kmが認識結果である
。また、最大類似度が得らレタ時のフレームナンバーi
==imと単語長n−nmを一時記憶111に蓄積し、
更新するようにしておけば、認識結果と同時に、その時
の音声区間を結果として求めることができる。音声区間
はim−nm−imである。
以上のようにして音声認識処理が完了する。
最後に、本発明が実施されている部分である類似度計算
部の構成と、動作を説明する。第2図はそれを説明する
だめの図である。第2図は従来例の第5図に示しだ(1
3)式を計算する機構と基本的には同じ動作をするが、
パターンマツチングの際の時間軸の整合の際の自由度を
制御する機構を新しく設けた所が改善された点である。
部の構成と、動作を説明する。第2図はそれを説明する
だめの図である。第2図は従来例の第5図に示しだ(1
3)式を計算する機構と基本的には同じ動作をするが、
パターンマツチングの際の時間軸の整合の際の自由度を
制御する機構を新しく設けた所が改善された点である。
まず動作の前に全ての記憶素子の内容を−■にしておく
。次にフレーム同期信号が64個入力されるのを待って
から未知入力音声から求まっている部分音素系列を入力
する。又遅延素子はフレーム同期信号が1個入力される
毎に素子の入力側の信号を出力側へ移す働きをする。又
、図中のmaxと書かれた正方形の枠は入力された複数
の数値データのうちから最大値を検出する機能を有する
素0に 子、又、制御信号SJ及び複数の数値データを入力し複
数の数値データを出力する素子は、入力データのうちS
、で指定されるデータの組のみを有効にするデータ選択
素子である。従来の構成に加えて、上記データ選択素子
を導入する事により、(転) 伽) 伽) 各段の部分累積値なるf、R1,R2,・・・R16の
値は、(16)式に代って、 で与えられる。ここで記号S、は記号括弧の中の要素か
らなる集合の中の部分集合のうちの1つを21−・ ・ 指定するだめの演算子であり、マツチング段数jされた
部分集合の要素の最大値を意味する。最終的にL’には 仮) Lk=Bk−R16(21) で得られ、この値が最終的な類似度となる。
。次にフレーム同期信号が64個入力されるのを待って
から未知入力音声から求まっている部分音素系列を入力
する。又遅延素子はフレーム同期信号が1個入力される
毎に素子の入力側の信号を出力側へ移す働きをする。又
、図中のmaxと書かれた正方形の枠は入力された複数
の数値データのうちから最大値を検出する機能を有する
素0に 子、又、制御信号SJ及び複数の数値データを入力し複
数の数値データを出力する素子は、入力データのうちS
、で指定されるデータの組のみを有効にするデータ選択
素子である。従来の構成に加えて、上記データ選択素子
を導入する事により、(転) 伽) 伽) 各段の部分累積値なるf、R1,R2,・・・R16の
値は、(16)式に代って、 で与えられる。ここで記号S、は記号括弧の中の要素か
らなる集合の中の部分集合のうちの1つを21−・ ・ 指定するだめの演算子であり、マツチング段数jされた
部分集合の要素の最大値を意味する。最終的にL’には 仮) Lk=Bk−R16(21) で得られ、この値が最終的な類似度となる。
ここで従来の方法との比較しながら本実施例の効果を述
べるならば、従来の方法は、(20)式において、記号
Sj の機能を除去し、記号maxの後の括弧の中の全
ての要素Rj−1(n−1,2,3,4)が、最大値算
出の対象となる。
べるならば、従来の方法は、(20)式において、記号
Sj の機能を除去し、記号maxの後の括弧の中の全
ての要素Rj−1(n−1,2,3,4)が、最大値算
出の対象となる。
従来の方式(即ち(16)式)に従ってパターンマツチ
ング演算を行うと、上述の通り例えば極端な場合、ある
フレームjにおいては部分類積値(k□1)が採択され
、次のフレームJ+1においJ1 (k−4) てはRが採択され、現実にそぐわないマツチングがなさ
れる可能性がちシ、マツチングの際の自由度が大きすぎ
る事に起因する弊害が生じる恐れがあった。一方、本実
施例による方法によれば、(20)式に示した通りマツ
チング演算における部分類似度の採択の自由度を認識対
象単語k及びフレーム番号jの推移に従って、制御する
事により、従来の方法における問題の解決がはかれ、よ
り高い認識率の実現が可能となる。
ング演算を行うと、上述の通り例えば極端な場合、ある
フレームjにおいては部分類積値(k□1)が採択され
、次のフレームJ+1においJ1 (k−4) てはRが採択され、現実にそぐわないマツチングがなさ
れる可能性がちシ、マツチングの際の自由度が大きすぎ
る事に起因する弊害が生じる恐れがあった。一方、本実
施例による方法によれば、(20)式に示した通りマツ
チング演算における部分類似度の採択の自由度を認識対
象単語k及びフレーム番号jの推移に従って、制御する
事により、従来の方法における問題の解決がはかれ、よ
り高い認識率の実現が可能となる。
発明の効果
以上要するに本発明は、マツチング演算における部分類
似度の採択の自由度を、認識対象単語及びフレーム番号
の推移に従って制御することにより、きめの細かなマツ
チングが可能となり、よシ高い認識率の実現が可能とな
る利点を有する。
似度の採択の自由度を、認識対象単語及びフレーム番号
の推移に従って制御することにより、きめの細かなマツ
チングが可能となり、よシ高い認識率の実現が可能とな
る利点を有する。
第1図は本発明の一実施例における音声認識方法を具現
化するための機能ブロック図、第2図は本実施例の類似
度計算部の詳細な構成図、第3図は従来の方法における
マツチングの方法を説明するための概念図、第4図は従
来の方法に基く音声認識方法の一構成例を説明するため
の機能ブロック図、第5図は従来の方法に基く構成例の
中の類似度計算部の詳細な構成図である。 11・・・・・・AD変換部、12・・・・・・音響分
析部、13・・・・・・特徴パラメータ抽出部、14・
・・・・・フレーム同期信号発生部、15・・・・・・
標準パターン選択部、16・・・・・・標準パターン格
納部、17・・・・・・部分類似度計算部、18・・・
・・・区間候補設定部、19・・・・・・類似度計算部
、110・・・・・・類似度比較部、111・・・・・
・一時記憶部。
化するための機能ブロック図、第2図は本実施例の類似
度計算部の詳細な構成図、第3図は従来の方法における
マツチングの方法を説明するための概念図、第4図は従
来の方法に基く音声認識方法の一構成例を説明するため
の機能ブロック図、第5図は従来の方法に基く構成例の
中の類似度計算部の詳細な構成図である。 11・・・・・・AD変換部、12・・・・・・音響分
析部、13・・・・・・特徴パラメータ抽出部、14・
・・・・・フレーム同期信号発生部、15・・・・・・
標準パターン選択部、16・・・・・・標準パターン格
納部、17・・・・・・部分類似度計算部、18・・・
・・・区間候補設定部、19・・・・・・類似度計算部
、110・・・・・・類似度比較部、111・・・・・
・一時記憶部。
Claims (3)
- (1)予め、認識対象とする単語の音声の各々の標準パ
ターンを表現する長さLのパラメータの系列P_1、P
_2、…P_Lを、認識対象とする全音声のデータ及び
全音声の周囲情報を用いて作成しておき、一方、認識す
べき音声とその周囲の情報を含む未知入力に対して単位
時間間隔(フレームという。)毎に、そのフレームにお
けるデータを表現するパラメータQ_n(ただしnはフ
レームの番号)を算出し、上記フレーム毎に前記パラメ
ータ系列の各要素P_i(i=1、2、……L)につい
て、P_iとQ_nとの間の距離又は類似度R_n、_
i(i=1、2、3、……L)を求め、更に以下の漸化
式 S_n、_o=定数 S_n、_j=R_n、_j+opt(S_n_−_k
、_j_−_1、S_n_−_k_−_1、_j_−_
1、…、S_n_−_k_−_m、_j_−_1) (j=1、2、……、L) {ただし、k、mは予め定めてある正の定数、又記号o
ptは括弧の中の最適なものを採択するという意味であ
る。} を利用し、前記漸化式のkおよびmをnの推移に従って
、又は対象単語毎に動的に変化させながら、全ての認識
対象単語、又は対象となる全フレームnについて算出さ
れるS_n、Lの最適値を与える単語を認識結果として
得る事を特徴とする音声認識方法。 - (2)未知入力信号の特徴パラメータと各音声との標準
パターンとの類似度又は距離を統計的距離尺度を用いて
計算することを特徴とする特許請求の範囲第1項記載の
音声認識方法。 - (3)統計的距離尺度が、事後確率に基づく尺度、一次
判別関数、二次判別関数、マハラノビス距離、ベイズ判
定、複合類似度に基づく尺度のうちのいずれかであるこ
とを特徴とする特許請求の範囲第2項記載の音声認識方
法。
Priority Applications (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62069344A JPS63236000A (ja) | 1987-03-24 | 1987-03-24 | 音声認識方法 |
| US07/385,525 US4984275A (en) | 1987-03-13 | 1989-07-27 | Method and apparatus for speech recognition |
| US07/777,713 US5220609A (en) | 1987-03-13 | 1991-10-21 | Method of speech recognition |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62069344A JPS63236000A (ja) | 1987-03-24 | 1987-03-24 | 音声認識方法 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPS63236000A true JPS63236000A (ja) | 1988-09-30 |
Family
ID=13399834
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP62069344A Pending JPS63236000A (ja) | 1987-03-13 | 1987-03-24 | 音声認識方法 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS63236000A (ja) |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS59223499A (ja) * | 1983-06-02 | 1984-12-15 | 松下電器産業株式会社 | 音素認識装置 |
| JPS6093498A (ja) * | 1983-10-27 | 1985-05-25 | 藤崎 博也 | 音節標準パタンを用いた音声認識方式 |
| JPS6129897A (ja) * | 1984-07-23 | 1986-02-10 | 松下電器産業株式会社 | パタ−ン比較装置 |
-
1987
- 1987-03-24 JP JP62069344A patent/JPS63236000A/ja active Pending
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS59223499A (ja) * | 1983-06-02 | 1984-12-15 | 松下電器産業株式会社 | 音素認識装置 |
| JPS6093498A (ja) * | 1983-10-27 | 1985-05-25 | 藤崎 博也 | 音節標準パタンを用いた音声認識方式 |
| JPS6129897A (ja) * | 1984-07-23 | 1986-02-10 | 松下電器産業株式会社 | パタ−ン比較装置 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Laptev et al. | You do not need more data: Improving end-to-end speech recognition by text-to-speech data augmentation | |
| US10847137B1 (en) | Trigger word detection using neural network waveform processing | |
| Nishimura et al. | Singing Voice Synthesis Based on Deep Neural Networks. | |
| Bourlard et al. | A continuous speech recognition system embedding MLP into HMM | |
| Morgan et al. | Continuous speech recognition using multilayer perceptrons with hidden Markov models | |
| Deng et al. | Improving accent identification and accented speech recognition under a framework of self-supervised learning | |
| Deng et al. | Recent advances in deep learning for speech research at Microsoft | |
| Demirel et al. | Automatic lyrics transcription using dilated convolutional neural networks with self-attention | |
| Siniscalchi et al. | Speech recognition using long-span temporal patterns in a deep network model | |
| Shivakumar et al. | A study on impact of language model in improving the accuracy of speech to text conversion system | |
| Chandrakala | Investigation of DNN-HMM and lattice free maximum mutual information approaches for impaired speech recognition | |
| Wang et al. | End-to-end spoken language understanding using joint ctc loss and self-supervised, pretrained acoustic encoders | |
| Garg et al. | Data driven grapheme-to-phoneme representations for a lexicon-free text-to-speech | |
| Lee et al. | Isolated word recognition using modular recurrent neural networks | |
| WO2019212375A1 (ru) | Способ получения дикторозависимых малоразмерных высокоуровневых акустических признаков речи | |
| Qian | English speech recognition system based on long short term memory algorithm | |
| JP5300000B2 (ja) | 調音特徴抽出装置、調音特徴抽出方法、及び調音特徴抽出プログラム | |
| Huang et al. | Exploring the Encoder Layers of Discriminative Autoencoders for LVCSR. | |
| Sarma et al. | Speech recognition in Indian languages—a survey | |
| Li et al. | Partially speaker-dependent automatic speech recognition using deep neural networks | |
| Wang et al. | End-to-end Mandarin recognition based on convolution input | |
| Sokolov et al. | Gender domain adaptation for automatic speech recognition | |
| Schmid et al. | Explicit, n-best formant features for vowel classification | |
| Khudhair et al. | Improving low resources arabic speech recognition using data augmentation | |
| JP2705061B2 (ja) | 音声認識方法 |