JPH0570838B2 - - Google Patents
Info
- Publication number
- JPH0570838B2 JPH0570838B2 JP59224632A JP22463284A JPH0570838B2 JP H0570838 B2 JPH0570838 B2 JP H0570838B2 JP 59224632 A JP59224632 A JP 59224632A JP 22463284 A JP22463284 A JP 22463284A JP H0570838 B2 JPH0570838 B2 JP H0570838B2
- Authority
- JP
- Japan
- Prior art keywords
- pattern
- standard
- standard pattern
- network
- features
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 claims description 36
- 230000006978 adaptation Effects 0.000 claims description 21
- 230000004048 modification Effects 0.000 claims description 4
- 238000012986 modification Methods 0.000 claims description 4
- 230000000875 corresponding effect Effects 0.000 description 13
- 238000013507 mapping Methods 0.000 description 11
- 238000012545 processing Methods 0.000 description 11
- 230000003044 adaptive effect Effects 0.000 description 7
- 230000008569 process Effects 0.000 description 7
- 239000013598 vector Substances 0.000 description 7
- 238000001514 detection method Methods 0.000 description 4
- 230000007704 transition Effects 0.000 description 4
- 238000012937 correction Methods 0.000 description 3
- 238000010586 diagram Methods 0.000 description 3
- 230000004044 response Effects 0.000 description 3
- 230000008901 benefit Effects 0.000 description 2
- 238000006243 chemical reaction Methods 0.000 description 2
- 230000002596 correlated effect Effects 0.000 description 2
- 230000006866 deterioration Effects 0.000 description 2
- 238000007781 pre-processing Methods 0.000 description 2
- 230000008859 change Effects 0.000 description 1
- 230000008602 contraction Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000006467 substitution reaction Methods 0.000 description 1
Description
【発明の詳細な説明】
(産業上の利用分野)
本発明は音声認識装置の標準パターンの利用者
の声質に対する適応方式に関する。
の声質に対する適応方式に関する。
(従来技術とその問題点)
音声認識技術は近年急速に向上し、計算機への
データ入力、各種機械システムへの制御指令入力
等に広く利用されるようになつている。しかし、
その認識性能は理想的なものとは言えず、利用者
本人の音声による標準パターン登録が必要である
とか、誤認識が発声するとかいつた問題が残され
ている。
データ入力、各種機械システムへの制御指令入力
等に広く利用されるようになつている。しかし、
その認識性能は理想的なものとは言えず、利用者
本人の音声による標準パターン登録が必要である
とか、誤認識が発声するとかいつた問題が残され
ている。
これら既存のシステムはすべてパターンマツチ
ングの原理によつて動作するように設計されてい
る。これは各単語ごとに標準パターンを用意して
おき、未知入力パターンが与えられると、これら
標準パターンと比較を行つて最も類似したものを
探索することによつて判定を行うという原理であ
る。通常、標準パターンは利用者が本人の発音に
よつて登録する。これは同一単語であつても人に
よつて音声の特徴が大幅に異なるという個人差の
問題に対処するためである。
ングの原理によつて動作するように設計されてい
る。これは各単語ごとに標準パターンを用意して
おき、未知入力パターンが与えられると、これら
標準パターンと比較を行つて最も類似したものを
探索することによつて判定を行うという原理であ
る。通常、標準パターンは利用者が本人の発音に
よつて登録する。これは同一単語であつても人に
よつて音声の特徴が大幅に異なるという個人差の
問題に対処するためである。
しかし、同一人による同一単語の発音であつて
も、音声のパターンは様々に変化する。このうち
時間方向の伸縮に関しては、特願昭45−53896号
明細書に記されるごとく、動的計画法を利用した
パターンマツチング手法(DPマツチングと呼ば
れている)が開発され有効に利用されている。こ
の他に、母音の無声化、鼻母音化、などいわば周
波数方向の変動というべきものがあり、これに対
してはDPマツチングのような有効な方策が見付
かつていない。
も、音声のパターンは様々に変化する。このうち
時間方向の伸縮に関しては、特願昭45−53896号
明細書に記されるごとく、動的計画法を利用した
パターンマツチング手法(DPマツチングと呼ば
れている)が開発され有効に利用されている。こ
の他に、母音の無声化、鼻母音化、などいわば周
波数方向の変動というべきものがあり、これに対
してはDPマツチングのような有効な方策が見付
かつていない。
このような種類の変動(以下単に変動と呼ぶ)
に対する方策として、同一単語に対して複数個の
標準パターンを用意しておき、これによつて実際
の入力パターンが、いずれかの標準パターンと一
致するようにしようとする方法がとられる。すな
わち、利用者が各単語をそれぞれ複数回発声して
登録を行い、これらが実際に発声し得る周波数方
向の変動の代表例になつていると期待して用いる
ことによつて、パターン変に起因する誤認識を低
減しようとするものである。しかし、多量の標準
パターンを用意するには、それなりに大容量のメ
モリーが必要となり、結果として、音声認識装置
が高価になるという欠点がある。それに加えて、
利用者が多数回発声登録しても、それで実際に生
起し得るパターン変動を総てカバーできるという
保証がないという問題がある。むしろ普通の利用
者は緊張してしまつて、一定のかしこまつた発声
を繰り返してしまい、種々の変動パターンが登録
できないことが多い。
に対する方策として、同一単語に対して複数個の
標準パターンを用意しておき、これによつて実際
の入力パターンが、いずれかの標準パターンと一
致するようにしようとする方法がとられる。すな
わち、利用者が各単語をそれぞれ複数回発声して
登録を行い、これらが実際に発声し得る周波数方
向の変動の代表例になつていると期待して用いる
ことによつて、パターン変に起因する誤認識を低
減しようとするものである。しかし、多量の標準
パターンを用意するには、それなりに大容量のメ
モリーが必要となり、結果として、音声認識装置
が高価になるという欠点がある。それに加えて、
利用者が多数回発声登録しても、それで実際に生
起し得るパターン変動を総てカバーできるという
保証がないという問題がある。むしろ普通の利用
者は緊張してしまつて、一定のかしこまつた発声
を繰り返してしまい、種々の変動パターンが登録
できないことが多い。
(発明の目的)
本発明は従来の標準パターン適応方式の有する
上記欠点を改良し、標準パターンのメモリー効率
が良く、かつ登録されなかつた変動を持つた音声
パターンをも高い精度で認識できる標準パターン
適応方式を実現し、高性能で、しかも安価な音声
認識装置を提供することを目的とする。
上記欠点を改良し、標準パターンのメモリー効率
が良く、かつ登録されなかつた変動を持つた音声
パターンをも高い精度で認識できる標準パターン
適応方式を実現し、高性能で、しかも安価な音声
認識装置を提供することを目的とする。
(発明の構成)
本発明によれば、標準パターン適応方式は、特
徴の時系列のネツトワークとして標準パターンを
表現し、それと利用者の発声による音声パターン
とをマツチングさせてネツトワーク中に最適パス
を定め、この最適パス上の上記特徴を上記音声パ
ターンによつて修正することを特徴とする標準パ
ターン適応方式が得られる。
徴の時系列のネツトワークとして標準パターンを
表現し、それと利用者の発声による音声パターン
とをマツチングさせてネツトワーク中に最適パス
を定め、この最適パス上の上記特徴を上記音声パ
ターンによつて修正することを特徴とする標準パ
ターン適応方式が得られる。
また、本発明によれば、特徴の時系列のネツト
ワークとして表現される標準パターンと利用者の
発声による音声パターンとをマツチングさせてネ
ツトワーク中に最適パスを定め、最適パス上の上
記特徴と、それに対応する上記音声パターン中の
特徴とが所定の基準以上類似しているときに限つ
て前記標準パターン特徴を該音声パターン特徴に
よつて修正することを特徴とする標準パターン適
応方式が得られる。
ワークとして表現される標準パターンと利用者の
発声による音声パターンとをマツチングさせてネ
ツトワーク中に最適パスを定め、最適パス上の上
記特徴と、それに対応する上記音声パターン中の
特徴とが所定の基準以上類似しているときに限つ
て前記標準パターン特徴を該音声パターン特徴に
よつて修正することを特徴とする標準パターン適
応方式が得られる。
さらに本発明によれば、特徴の時系列のネツト
ワークとして表現される標準パターンと利用者の
発声による音声パターンとをマツチングさせてネ
ツトワーク中に最適パスを定め、最適パス上の上
記特徴と、それに対応する上記音声パターン中の
特徴とが、所定の基準以上類似している部分では
前記標準パターン特徴を該音声パターン特徴で修
正し、所定の基準以上類似していない部分におい
ては、該部分に並列する新たなパスを、該音声パ
ターン特徴をもとにして作成することを特徴とす
る標準パターン適応方式が得られる。
ワークとして表現される標準パターンと利用者の
発声による音声パターンとをマツチングさせてネ
ツトワーク中に最適パスを定め、最適パス上の上
記特徴と、それに対応する上記音声パターン中の
特徴とが、所定の基準以上類似している部分では
前記標準パターン特徴を該音声パターン特徴で修
正し、所定の基準以上類似していない部分におい
ては、該部分に並列する新たなパスを、該音声パ
ターン特徴をもとにして作成することを特徴とす
る標準パターン適応方式が得られる。
(作用)
特願昭57−165413号明細書には標準パターンを
特徴の時系列ネツトワークとして表現し、それを
時系列標準パターンとマツチングさせることによ
つて認識を行う方法が示されている。このように
標準パターンをネツトワーク表現すると、標準パ
ターン記憶のためのメモリー効率が高いという利
点がある。いま、例として数字音声“8”(/
hat∫i/)の場合について考察する。この単語の
発音は通常は/hat∫i/であるが、語頭の母音/
a/が無声化して/aΓ/(下部の“Γ”は無声化
を意味する)となつたり、語尾の母音/i/が無
声化して/iΓ/となつたりすることが知られてい
る。このような現象は相互独立に発生するので、
結果として第1図に示すような(a),/hat∫i/,
(b),/haΓt∫iΓ/,(c),/haΓt∫iΓ/(d)
,/
hat∫i/、の計4種の変動が発生することになる。
第1図は、いわゆるオートマトン表現であり、初
期状態0より出発して、音韻h,a(aΓ),t∫,i
(iΓ)を受け取つて順次、状態1,2,3と進み、
最終状態4に至つて終了する。
特徴の時系列ネツトワークとして表現し、それを
時系列標準パターンとマツチングさせることによ
つて認識を行う方法が示されている。このように
標準パターンをネツトワーク表現すると、標準パ
ターン記憶のためのメモリー効率が高いという利
点がある。いま、例として数字音声“8”(/
hat∫i/)の場合について考察する。この単語の
発音は通常は/hat∫i/であるが、語頭の母音/
a/が無声化して/aΓ/(下部の“Γ”は無声化
を意味する)となつたり、語尾の母音/i/が無
声化して/iΓ/となつたりすることが知られてい
る。このような現象は相互独立に発生するので、
結果として第1図に示すような(a),/hat∫i/,
(b),/haΓt∫iΓ/,(c),/haΓt∫iΓ/(d)
,/
hat∫i/、の計4種の変動が発生することになる。
第1図は、いわゆるオートマトン表現であり、初
期状態0より出発して、音韻h,a(aΓ),t∫,i
(iΓ)を受け取つて順次、状態1,2,3と進み、
最終状態4に至つて終了する。
ある状態から次の状態へある入力(この場合は
音韻)を受けて移ることは遷移と呼ばれる。この
場合の入力としては音韻を示す記号でもよいが、
一般的には、それぞれの入力(例えば/a/に対
応するもの)が特徴を示す量(例えばベクトル)
の時系列となつていてもよい。
音韻)を受けて移ることは遷移と呼ばれる。この
場合の入力としては音韻を示す記号でもよいが、
一般的には、それぞれの入力(例えば/a/に対
応するもの)が特徴を示す量(例えばベクトル)
の時系列となつていてもよい。
第1図のa,b,c,dの例はそれぞれの種類
の変形(の組合せ)に対して独立の標準パターン
を用意する場合を示している。このような場合
に、利用者本人の発声によつて登録されなかつた
種類の変動に対しても高い精度で認識できる方式
が昭和59年8月1日に出願された特許明細書「標
準パターン登録方式」に記載されている。しか
し、このような方式は、もともと各種変動に対し
て独立に標準パターンを用意する必要があるため
記憶量が大になるという欠点があつた。
の変形(の組合せ)に対して独立の標準パターン
を用意する場合を示している。このような場合
に、利用者本人の発声によつて登録されなかつた
種類の変動に対しても高い精度で認識できる方式
が昭和59年8月1日に出願された特許明細書「標
準パターン登録方式」に記載されている。しか
し、このような方式は、もともと各種変動に対し
て独立に標準パターンを用意する必要があるため
記憶量が大になるという欠点があつた。
そこで、本発明においては第2図の如く、標準
パターンをネツトワーク状(分岐を含む)オート
マトンとして表現することを前提としている。こ
のように表現すると標準パターン記憶のためのメ
モリ量が大幅に低減されるという利点がある。す
なわち、記憶量はほぼ、オートマトンの状態
(節)と状態(節)を結ぶ遷移(枝)の数に比例
するが、第1図のa,b,c,dでは計16個であ
るのに対して、第2図では6個となつている。
パターンをネツトワーク状(分岐を含む)オート
マトンとして表現することを前提としている。こ
のように表現すると標準パターン記憶のためのメ
モリ量が大幅に低減されるという利点がある。す
なわち、記憶量はほぼ、オートマトンの状態
(節)と状態(節)を結ぶ遷移(枝)の数に比例
するが、第1図のa,b,c,dでは計16個であ
るのに対して、第2図では6個となつている。
このように分岐を有するオートマトン表現され
る標準パターンのことをネツトワーク表現される
標準パターンと呼ぶ。第1,2図の“○”(状態)
のことを節と呼び、“→”(状態遷移)のことを枝
と呼ぶのはグラフ理論での術語によるものであ
る。なお、第2図の各枝に対しては/h/,/
a/のような記号が存在するのではなくて、前記
特願昭57−156413号明細書での標準パターン記述
と同様に音声の特徴の時系列が対応しているので
ある。
る標準パターンのことをネツトワーク表現される
標準パターンと呼ぶ。第1,2図の“○”(状態)
のことを節と呼び、“→”(状態遷移)のことを枝
と呼ぶのはグラフ理論での術語によるものであ
る。なお、第2図の各枝に対しては/h/,/
a/のような記号が存在するのではなくて、前記
特願昭57−156413号明細書での標準パターン記述
と同様に音声の特徴の時系列が対応しているので
ある。
いま例として、音韻/h/に対応する特徴をベ
クトル列b1b2b3で示す。同様にして各音韻に /h/ /a/ /aΓ/ /t∫/ /i/ /iΓ/b1b2b3 b4b5b6b7b8 b9b10b11 b12b13 b14b15b16b17 b18b19b20 (1) なるベクトル列を対応づける。前記特願昭57−
156413号明細書にはこのような標準パターンを B=b1b2b3{b4b5b6b7b8/b9b10b11}b12b13{b14
b15b16b17/b18b19b20} (2) と表現し、入力パターン A=a1 b2……ai……aI (3) とのマツチングを行う装置が記載されている。こ
のパターンマツチング装置を用い、(2)式の如き標
準パターンを所要の単語毎に用意しパターンマツ
チング法を行うことにより、小量の標準パターン
メモリ量で、しかもパターンの変動に対して安定
な認識を行うことができる。
クトル列b1b2b3で示す。同様にして各音韻に /h/ /a/ /aΓ/ /t∫/ /i/ /iΓ/b1b2b3 b4b5b6b7b8 b9b10b11 b12b13 b14b15b16b17 b18b19b20 (1) なるベクトル列を対応づける。前記特願昭57−
156413号明細書にはこのような標準パターンを B=b1b2b3{b4b5b6b7b8/b9b10b11}b12b13{b14
b15b16b17/b18b19b20} (2) と表現し、入力パターン A=a1 b2……ai……aI (3) とのマツチングを行う装置が記載されている。こ
のパターンマツチング装置を用い、(2)式の如き標
準パターンを所要の単語毎に用意しパターンマツ
チング法を行うことにより、小量の標準パターン
メモリ量で、しかもパターンの変動に対して安定
な認識を行うことができる。
ここで問題になるのは標準パターンBを如何し
て作成するかという点である。これに対しては本
発明では次の2点を基本方針としている。
て作成するかという点である。これに対しては本
発明では次の2点を基本方針としている。
(1) 予想される種類の変動はあらかじめネツトワ
ーク中の技として組み込んでおき原形標準パタ
ーンを用意する。この処理は大量のサンプル発
声のパターンを目視と手作業によつて実行でき
る。
ーク中の技として組み込んでおき原形標準パタ
ーンを用意する。この処理は大量のサンプル発
声のパターンを目視と手作業によつて実行でき
る。
(2) このままでは利用者本人の発声パターンが考
慮されていないので認識率が低いと予想され
る。そこで、この原形標準パターンを本人の発
声によつて修正する。
慮されていないので認識率が低いと予想され
る。そこで、この原形標準パターンを本人の発
声によつて修正する。
上記の内、(1)は人間が介在してのオフライン処
理であつてよく、その方法に関しては本発明の関
与するところではないので、これ以上の説明は省
略する。
理であつてよく、その方法に関しては本発明の関
与するところではないので、これ以上の説明は省
略する。
以下、上記(2)を実行する方式について説明す
る。いま原形標準パターンとして第2図のネツト
ワーク、すなわち(2)式のBが与えられていると
し、(3)式のAを利用者本人の発声による音声パタ
ーンとして、これを用いて原形標準パターンBを
修正する場合について述べる。
る。いま原形標準パターンとして第2図のネツト
ワーク、すなわち(2)式のBが与えられていると
し、(3)式のAを利用者本人の発声による音声パタ
ーンとして、これを用いて原形標準パターンBを
修正する場合について述べる。
音声パターンAと原形標準パターンBとをマツ
チングして、入力パターンAの各特徴aiが標準パ
ターンのどの特徴に対応づけられるかを定める。
この対応づけを定める方法としては前記特願昭57
−156413号明細書に記さているスタツクを用いる
DPマツチング法を改良し用いることによつても
可能であるが、ここでは、より理解し易い方法の
例を示す。第2図のネツトワークを展開して第1
図のa,b,c,dのような形に変換する。(1),
(2)式の形式で考えると次の4種の時系列に変換さ
れる。
チングして、入力パターンAの各特徴aiが標準パ
ターンのどの特徴に対応づけられるかを定める。
この対応づけを定める方法としては前記特願昭57
−156413号明細書に記さているスタツクを用いる
DPマツチング法を改良し用いることによつても
可能であるが、ここでは、より理解し易い方法の
例を示す。第2図のネツトワークを展開して第1
図のa,b,c,dのような形に変換する。(1),
(2)式の形式で考えると次の4種の時系列に変換さ
れる。
B1=b1b2b3b4b5b6b7b8b12b13b14b15b16b17
B2=b1b2b3b9b10b11b12b13b18b19b20
B3=b1b2b3b4b5b6b7b8b12b13b19b20
B4=b1b2b3b9b10b11b12b13b18b19b20 (2)′
これらを統一的に示すために添字をつけなおし
て C=c1c2……cj……cJ (4) と表現する。例えばB4の場合 c1=b1,c2=b2,c3=b3,c4=b9 c5=b10,c6=b11,c7=b12,c8=b13 c9=b18,c10=b19,c11=b20(J=11) (5) となる。
て C=c1c2……cj……cJ (4) と表現する。例えばB4の場合 c1=b1,c2=b2,c3=b3,c4=b9 c5=b10,c6=b11,c7=b12,c8=b13 c9=b18,c10=b19,c11=b20(J=11) (5) となる。
特願昭46−62782号明細書にはこのような時系
列AとCとの間で、特徴aiとcjとの間の対応を、
写像j=j(i)として定め、対応づけられた特
徴同士の距離が、全体として最小になるようにす
る手段が記載されている。これによつて得られる
写像j=j(i)によると音韻/h/,/
a/,/t∫/,/i/に属するベクトルaiとcjと
が正確に対応づけられるとされている。このため
に特願昭46−62782号明細書では(12),(13)式に動
的計画法漸化式 g(i,j)=d(i,j)+Ming(i-1,j) g(i-1,j-1) g(i-1,j-2) (6) を、初期条件 g(1,1)=d(1,1) (7) のもとに計算するという、いわゆるDPマツチン
グの処理を実行している。ここにd(i,j)は
aiとcjとの距離‖ai−cj‖である。(6)式の計算並行
して右辺〔 〕内の最小値が第1式、第2式であ
るそれぞれの場合に応じてW(i,j)=0,1,
2の値をテーブル状に記憶しておく。これをもと
にして次のような漸化的処理によつて写像j(i)
を定める。
列AとCとの間で、特徴aiとcjとの間の対応を、
写像j=j(i)として定め、対応づけられた特
徴同士の距離が、全体として最小になるようにす
る手段が記載されている。これによつて得られる
写像j=j(i)によると音韻/h/,/
a/,/t∫/,/i/に属するベクトルaiとcjと
が正確に対応づけられるとされている。このため
に特願昭46−62782号明細書では(12),(13)式に動
的計画法漸化式 g(i,j)=d(i,j)+Ming(i-1,j) g(i-1,j-1) g(i-1,j-2) (6) を、初期条件 g(1,1)=d(1,1) (7) のもとに計算するという、いわゆるDPマツチン
グの処理を実行している。ここにd(i,j)は
aiとcjとの距離‖ai−cj‖である。(6)式の計算並行
して右辺〔 〕内の最小値が第1式、第2式であ
るそれぞれの場合に応じてW(i,j)=0,1,
2の値をテーブル状に記憶しておく。これをもと
にして次のような漸化的処理によつて写像j(i)
を定める。
j(I)=J
j(i−1)=j(i)−W(i,j(i)) (8)
また(5)式の計算結果として得られるg(I,J)
はパターンAとCとの間の距離D(A,C)とな
ることが知られている。
はパターンAとCとの間の距離D(A,C)とな
ることが知られている。
いまパターンCとして前記のBを展開したパタ
ーンB1,B2,B3,B4を代入して(6)(7)式によるDP
マツチングを繰り返し実行して距離D(A,B1),
D(A,B2),D(A,B3),D(A,B4)を求め
る。これら距離が最小となるBnを求めると、こ
の音声パターンAはBnと同じ傾向の変動を持つ
ていることになる。そこで原形標準パターンBの
中のBnに対応する枝列(最適パスと呼ぶ)上の
特徴を音声パターンAの特徴で修正する。かくす
ると、同一傾向の変動である限り、利用者本人の
特徴がマツチングに使用されることになるので、
正確な認識動作が可能となる。
ーンB1,B2,B3,B4を代入して(6)(7)式によるDP
マツチングを繰り返し実行して距離D(A,B1),
D(A,B2),D(A,B3),D(A,B4)を求め
る。これら距離が最小となるBnを求めると、こ
の音声パターンAはBnと同じ傾向の変動を持つ
ていることになる。そこで原形標準パターンBの
中のBnに対応する枝列(最適パスと呼ぶ)上の
特徴を音声パターンAの特徴で修正する。かくす
ると、同一傾向の変動である限り、利用者本人の
特徴がマツチングに使用されることになるので、
正確な認識動作が可能となる。
上記の最適パス上の特徴の修正操作を具体例を
用いて説明する。距離D(A,Bn)が最小となる
展開パターンがB4であつたとする。この場合第
2図では技/h/,/aΓ/,/t∫/,/iΓ/の最
適パス上の特徴、すなわち(5)式のcjが修正される
ことになる。(8)式によつて得られる写像j=j
(i)によつて時系列cの中でaiに対応づけられ
るべきcjが定まるので、このcjに(5)式によつて対
応づけられる特徴bをaiによつて置換する。例え
ば ……j(3)=4,j(4)=4,j(5)=6…… となつたときは a3→b9(=c4) a4→b9(=c4) a5→b10(=c5) (9) なる置換によつて修正を行う。
用いて説明する。距離D(A,Bn)が最小となる
展開パターンがB4であつたとする。この場合第
2図では技/h/,/aΓ/,/t∫/,/iΓ/の最
適パス上の特徴、すなわち(5)式のcjが修正される
ことになる。(8)式によつて得られる写像j=j
(i)によつて時系列cの中でaiに対応づけられ
るべきcjが定まるので、このcjに(5)式によつて対
応づけられる特徴bをaiによつて置換する。例え
ば ……j(3)=4,j(4)=4,j(5)=6…… となつたときは a3→b9(=c4) a4→b9(=c4) a5→b10(=c5) (9) なる置換によつて修正を行う。
このような修正は1個の原形標準パターンに対
して複数の音声パターン(当然同一語のもの)を
繰り返し与えて行なうのがよい。かくして標準パ
ターンの(利用者に対する)適応化が完成する。
して複数の音声パターン(当然同一語のもの)を
繰り返し与えて行なうのがよい。かくして標準パ
ターンの(利用者に対する)適応化が完成する。
このようにして得られる標準パターンBは、ネ
ツトワーク表現されているためにメモリ量が少な
くてよく。利用者本人の発声に現われる種類の変
動に対しては適応化が完成している。また、たま
たま利用者本人の発声に現れなかつた種類の変動
に対しては原形標準パターンとして与えられた枝
が残されている。それゆえ、このような標準パタ
ーンの適応処理を各単語毎に行つて、これら標準
パターンBを用い、前記特願昭57−156413に記載
されている手段によつて入力パターンとのパター
ンマツチングを行うことにすると、小形でかつ高
精度の音声認識が可能になる。
ツトワーク表現されているためにメモリ量が少な
くてよく。利用者本人の発声に現われる種類の変
動に対しては適応化が完成している。また、たま
たま利用者本人の発声に現れなかつた種類の変動
に対しては原形標準パターンとして与えられた枝
が残されている。それゆえ、このような標準パタ
ーンの適応処理を各単語毎に行つて、これら標準
パターンBを用い、前記特願昭57−156413に記載
されている手段によつて入力パターンとのパター
ンマツチングを行うことにすると、小形でかつ高
精度の音声認識が可能になる。
(実施例)
第3図は本発明による第1の実施例を説明する
ためのブロツク図である。制御部10は制御信号
n,mを発生して全体の動作を制御する。この認
識装置の動作は標準パターンを利用者本人の性質
に適応させるための適応モードと、実際に認識を
行うための認識モードとに分れている。まず本発
明が直接関与する適応モードについて説明する。
ためのブロツク図である。制御部10は制御信号
n,mを発生して全体の動作を制御する。この認
識装置の動作は標準パターンを利用者本人の性質
に適応させるための適応モードと、実際に認識を
行うための認識モードとに分れている。まず本発
明が直接関与する適応モードについて説明する。
いま認識対象単語として数字“0”,“1”…n
…“9”を考える。各単語nには原形標準パター
ンBnが(2)式に例示した形式で記憶部14に記憶
されている。これらは前記制御部10よりの制御
信号nによつて指定されて読み出され、バツフア
15に送られて適応処理される。いまn=8とし
て数字8の標準パターンB8が適応処理される場
合の例を示す。添字8を省略して、第2図に対応
する(2)式のBの形で示して説明する。
…“9”を考える。各単語nには原形標準パター
ンBnが(2)式に例示した形式で記憶部14に記憶
されている。これらは前記制御部10よりの制御
信号nによつて指定されて読み出され、バツフア
15に送られて適応処理される。いまn=8とし
て数字8の標準パターンB8が適応処理される場
合の例を示す。添字8を省略して、第2図に対応
する(2)式のBの形で示して説明する。
マイクロホン11から利用者本人の発声による
“8”の音声が入力され、前処理部12で分析処
理され、(3)式の音声パターンAの形に変換されバ
ツフア13に入力される。この時点以後、前記制
御部10からの制御信号mは、1,2,3,4,
5の値をとつて変化される。これに応じて前記バ
ツフア15から、前記原形パターンを展開したパ
ターンB1,B2,B3,B4が発生され、それぞれが
(4)式のパターンCとしてバツフア16に送られ、
前記の入力パターンAと、第1マツチング部17
でマツチング処理される。第1マツチング部17
は前記特願昭46−62782号明細書の第5図と同様
に構成され、前記(6),(7),(8)式の如き処理によつ
て、距離D(A,C)と、写像j(i)とが出力さ
れる。
“8”の音声が入力され、前処理部12で分析処
理され、(3)式の音声パターンAの形に変換されバ
ツフア13に入力される。この時点以後、前記制
御部10からの制御信号mは、1,2,3,4,
5の値をとつて変化される。これに応じて前記バ
ツフア15から、前記原形パターンを展開したパ
ターンB1,B2,B3,B4が発生され、それぞれが
(4)式のパターンCとしてバツフア16に送られ、
前記の入力パターンAと、第1マツチング部17
でマツチング処理される。第1マツチング部17
は前記特願昭46−62782号明細書の第5図と同様
に構成され、前記(6),(7),(8)式の如き処理によつ
て、距離D(A,C)と、写像j(i)とが出力さ
れる。
最小値検出部18では、各C=Bnに対して計
算される距離D(A,C)が最小となるm=m′を
定める。このm=m′に対応する写像j(i)は写
像バツフア19に保持される。いま先の原理説明
の場合と同様m′=4であつたとする。変換記憶
部20にはB4を発生するためのcjとbkとの対応
((5)式のような対応づけ)が記憶されている。こ
の対応づけと、前記写像バツフア19に保持され
る写像を用いて(9)式に例示したごとく、cj(i)
に対応するベクトルbkを定め、これをaiによつて
置換することにより、標準パターンの修正を行う
という処理が修正部21で実行される。このよう
に修正された標準パターンは前記記憶部14に数
字4の標準パターンB8として記憶される。
算される距離D(A,C)が最小となるm=m′を
定める。このm=m′に対応する写像j(i)は写
像バツフア19に保持される。いま先の原理説明
の場合と同様m′=4であつたとする。変換記憶
部20にはB4を発生するためのcjとbkとの対応
((5)式のような対応づけ)が記憶されている。こ
の対応づけと、前記写像バツフア19に保持され
る写像を用いて(9)式に例示したごとく、cj(i)
に対応するベクトルbkを定め、これをaiによつて
置換することにより、標準パターンの修正を行う
という処理が修正部21で実行される。このよう
に修正された標準パターンは前記記憶部14に数
字4の標準パターンB8として記憶される。
このような処理を数字0〜9について行なうこ
とに適応モードが終了する。
とに適応モードが終了する。
次に認識モードについて簡単に説明する。この
モードではバツフア13に入力されるパターンA
は未知の入力パターンである。このパターンは第
2マツチング部22に導かれ、そこで前記記憶部
14に保持されている適応済みの標準パターン
Bn(n=0,1,……9)と比較される。このマ
ツチング部の構成は前記の特願昭57−156413号明
細書の第7図と同様である。ただし、この文献で
はオンライン文字認識への応用を例示しており、
音声認識を対象としている本発明の場合には上記
第7図の距離計算部26を、特徴aiと特徴bjとの
距離を算出する形式に変更する。
モードではバツフア13に入力されるパターンA
は未知の入力パターンである。このパターンは第
2マツチング部22に導かれ、そこで前記記憶部
14に保持されている適応済みの標準パターン
Bn(n=0,1,……9)と比較される。このマ
ツチング部の構成は前記の特願昭57−156413号明
細書の第7図と同様である。ただし、この文献で
はオンライン文字認識への応用を例示しており、
音声認識を対象としている本発明の場合には上記
第7図の距離計算部26を、特徴aiと特徴bjとの
距離を算出する形式に変更する。
このマツチング部によつて入力パターンAと各
標準パターンBnとの距離D(A,Bn)が算出され
る。これらは最小値検出部23によつて相互比較
され、最小となるn=n^が決定される。このn^が
認識結果として出力される。
標準パターンBnとの距離D(A,Bn)が算出され
る。これらは最小値検出部23によつて相互比較
され、最小となるn=n^が決定される。このn^が
認識結果として出力される。
以上第1の実施例について説明したが、第1の
実施例においては、次のような問題点が残されて
いる。第2図の例で述べると、原形標準パターン
Bには母音/a/としては正常な音声/a/と無
声化した発声/aΓ/の2種の変動が用意されてい
る。母音の変動には、この他に鼻音化という現象
があることが知られており、/a〜/(〜は鼻音化
を示す)なる変動パターンが発声し得る。いま音
声パターンAに/a〜/なる変動があるとき、これ
を用いて適応を行うと、/a/または/aΓ/のい
ずれかの枝(ここでは/aΓ/とする)が/a〜/の
特徴によつて置換されてしまう。こうなると正常
な母音/a/の枝が消減してしまい、/hat∫i/
あるいは/hat∫iΓ/なる発声に対する認識が劣化
することになる。
実施例においては、次のような問題点が残されて
いる。第2図の例で述べると、原形標準パターン
Bには母音/a/としては正常な音声/a/と無
声化した発声/aΓ/の2種の変動が用意されてい
る。母音の変動には、この他に鼻音化という現象
があることが知られており、/a〜/(〜は鼻音化
を示す)なる変動パターンが発声し得る。いま音
声パターンAに/a〜/なる変動があるとき、これ
を用いて適応を行うと、/a/または/aΓ/のい
ずれかの枝(ここでは/aΓ/とする)が/a〜/の
特徴によつて置換されてしまう。こうなると正常
な母音/a/の枝が消減してしまい、/hat∫i/
あるいは/hat∫iΓ/なる発声に対する認識が劣化
することになる。
以下に述べる第2の実施例は、上記の如く原形
標準パターンBに存在しなかつた種類の変動を有
する音声パターンAを用いて適応処理を行なつて
も、原形標準パターンに劣化を生じない標準パタ
ーン適応方式を提供するものである。
標準パターンBに存在しなかつた種類の変動を有
する音声パターンAを用いて適応処理を行なつて
も、原形標準パターンに劣化を生じない標準パタ
ーン適応方式を提供するものである。
本発明の第2の実施例は、特徴の時系列のネツ
トワークとして表現される標準パターンと利用者
の発声による音声パターンとをマツチングさせて
ネツトワーク中に最適パスを定め、最適パス上の
上記特徴と、それに対応する上記音声パターン中
の特徴とが所定の基準以上類似しているときに限
って前記標準パターン特徴を該音声パターン特徴
によつて修正することを特徴とする。
トワークとして表現される標準パターンと利用者
の発声による音声パターンとをマツチングさせて
ネツトワーク中に最適パスを定め、最適パス上の
上記特徴と、それに対応する上記音声パターン中
の特徴とが所定の基準以上類似しているときに限
って前記標準パターン特徴を該音声パターン特徴
によつて修正することを特徴とする。
かくの如く適応することにすると、正常母音/
a/に対しても、無声化母音/aΓ/に対しても鼻
音化母音/a〜/は一定以上異なつたパターンであ
るので、類似性は基準値以下となり、修正によつ
て/a/,/aΓ/の枝が消減することはなく、し
たがつて原形標準パターンが劣化するという現象
は回避できる。
a/に対しても、無声化母音/aΓ/に対しても鼻
音化母音/a〜/は一定以上異なつたパターンであ
るので、類似性は基準値以下となり、修正によつ
て/a/,/aΓ/の枝が消減することはなく、し
たがつて原形標準パターンが劣化するという現象
は回避できる。
第3図において、第1マツチング部17によつ
て(6)式を実行するためにaiとcjの距離d(i,j)
が算出されている。前記修正部でcj(i)に対応する
ベクトルbkを修正するとき、前記の距離d(i,
j(i))が所定の基準値以下であると、bkをaiで
置換するという処理を省略する。
て(6)式を実行するためにaiとcjの距離d(i,j)
が算出されている。前記修正部でcj(i)に対応する
ベクトルbkを修正するとき、前記の距離d(i,
j(i))が所定の基準値以下であると、bkをaiで
置換するという処理を省略する。
かくすると、原形標準パターンに含まれていな
い音声パターンで適応化を行なつても、標準パタ
ーンが劣化することはない。
い音声パターンで適応化を行なつても、標準パタ
ーンが劣化することはない。
以上述べた第2の実施例により、第1の実施例
において残されていた原形標準パターンに含まれ
ない種類の変動を持つた音声パターンを用いて適
応処理を行なつても標準パターンが劣化するとい
う問題をも防止することができた。しかし、この
第2の実施例においても原形標準パターンネツト
ワークの枝として組み込まれていない種類の変動
は、そのような変動を持つたパターンAを用いて
適応処理を行つても、永久に標準パターン中に組
み込まれることが無いという欠点が残されてい
る。例えば第2図の原形標準パターンBには/
a/が鼻音化した/a〜/なる枝が含まれていない
ので、/ha〜t∫iΓ/なる音声パターンAを用いて
適応処理を行つても、第2の発明の処理では/
a〜/の特徴を持つた枝は発生せず、したがつて/
ha〜t∫i/あるいは/ha〜t∫iΓ/なる音声パタ
ー
ンの認識は上手く行かない。
において残されていた原形標準パターンに含まれ
ない種類の変動を持つた音声パターンを用いて適
応処理を行なつても標準パターンが劣化するとい
う問題をも防止することができた。しかし、この
第2の実施例においても原形標準パターンネツト
ワークの枝として組み込まれていない種類の変動
は、そのような変動を持つたパターンAを用いて
適応処理を行つても、永久に標準パターン中に組
み込まれることが無いという欠点が残されてい
る。例えば第2図の原形標準パターンBには/
a/が鼻音化した/a〜/なる枝が含まれていない
ので、/ha〜t∫iΓ/なる音声パターンAを用いて
適応処理を行つても、第2の発明の処理では/
a〜/の特徴を持つた枝は発生せず、したがつて/
ha〜t∫i/あるいは/ha〜t∫iΓ/なる音声パタ
ー
ンの認識は上手く行かない。
以下に述べる第3の実施例は上記欠点をも改良
し、原形標準パターンネツトワークに組込まれて
いなかつたような種類の変動をも学習し適応し得
るものである。
し、原形標準パターンネツトワークに組込まれて
いなかつたような種類の変動をも学習し適応し得
るものである。
本発明の第3の実施例は、特徴の時系列のネツ
トワークとして表現される標準パターンと利用者
の発声のよる音声パターンとをマツチングさせて
ネツトワーク中に最適パスを定め、最適パス上の
上記特徴と、それに対応する上記音声パターン中
の特徴とが、所定の基準以上類似している部分で
は前記標準パターン特徴を該音声パターン特徴で
修正し、所定の基準以上類似していない部分にお
いては、該部分に並列する新たなパスを、該音声
パターン特徴をもとにして作成することを特徴と
する。
トワークとして表現される標準パターンと利用者
の発声のよる音声パターンとをマツチングさせて
ネツトワーク中に最適パスを定め、最適パス上の
上記特徴と、それに対応する上記音声パターン中
の特徴とが、所定の基準以上類似している部分で
は前記標準パターン特徴を該音声パターン特徴で
修正し、所定の基準以上類似していない部分にお
いては、該部分に並列する新たなパスを、該音声
パターン特徴をもとにして作成することを特徴と
する。
第2図、あるいは(2)式に示す原形標準パターン
Bを考える。これに対して、/ha〜t∫iΓ/なる音
声パターンAを用いて適応化処理を行うとする。
第3図の第1マツチング部で得られる写像j(i)
と距離d(i,j)を参照する修正部21では/
a〜/に属するベクトルaiとそれに対応するcj(i)と
の距離d(i,j(i))が、/a/あるいは/
aΓ/と/a〜/との不一致に起因して大となること
が検知できる。これらの部分では、第4図のよう
に、/a〜/の特徴を音声パターンから抜きとつて
並べ、新たな枝を付加する。(2)式は例えば次のよ
うになる。
Bを考える。これに対して、/ha〜t∫iΓ/なる音
声パターンAを用いて適応化処理を行うとする。
第3図の第1マツチング部で得られる写像j(i)
と距離d(i,j)を参照する修正部21では/
a〜/に属するベクトルaiとそれに対応するcj(i)と
の距離d(i,j(i))が、/a/あるいは/
aΓ/と/a〜/との不一致に起因して大となること
が検知できる。これらの部分では、第4図のよう
に、/a〜/の特徴を音声パターンから抜きとつて
並べ、新たな枝を付加する。(2)式は例えば次のよ
うになる。
B=b1b2b3{b4b5b6b7b8/b9b10b11/a3a4a5}b12
b13{b14b15b16b17/b18b19b20} (10) ここにa3a4a5が鼻音化母音/aΓ/に対応する特
徴として音声パターンAから抜き出したものであ
る。かくすると、あらかじめ原形標準パターンB
に組み込まれていない種類の変動をも自動習得し
て適応することが可能となつた。
b13{b14b15b16b17/b18b19b20} (10) ここにa3a4a5が鼻音化母音/aΓ/に対応する特
徴として音声パターンAから抜き出したものであ
る。かくすると、あらかじめ原形標準パターンB
に組み込まれていない種類の変動をも自動習得し
て適応することが可能となつた。
以上、本発明の原理を実施例に基づいて説明し
たがこれらの記載は本発明の権利範囲を限定する
ものではない。特に標準パターン特徴bjをaiによ
つて修正する方法としてaiによるbjの置換の例を
示したが、bjとaiの(荷重)平均によることもで
きる。またネツトワーク標準パターンの表現及び
取り扱い方法としては別の方法(例えば特願昭58
−131438号明細書に記載の方式)によることもで
きる。さらに、音声の単位は数字のような単語で
なく、子音・母音音節、子音・母音・子音音声等
の別の単位であつてもよい。
たがこれらの記載は本発明の権利範囲を限定する
ものではない。特に標準パターン特徴bjをaiによ
つて修正する方法としてaiによるbjの置換の例を
示したが、bjとaiの(荷重)平均によることもで
きる。またネツトワーク標準パターンの表現及び
取り扱い方法としては別の方法(例えば特願昭58
−131438号明細書に記載の方式)によることもで
きる。さらに、音声の単位は数字のような単語で
なく、子音・母音音節、子音・母音・子音音声等
の別の単位であつてもよい。
(発明の効果)
かくの如き適応方式を用いると、標準パターン
記憶量が少なく、かつ話者適応性が良く、適応モ
ードで入力されなかつた種類の変動を正しく認識
できる話者適応が可能となつた。
記憶量が少なく、かつ話者適応性が良く、適応モ
ードで入力されなかつた種類の変動を正しく認識
できる話者適応が可能となつた。
第1図、第2図、第4図は原理説明図、第3図
は実施例ブロツク図である。 図において、10……制御部、11……マイク
ロホン、12……前処理部、13……バツフア、
14……記憶部、15……バツフア、16……バ
ツフア、17……第1マツチング部、18……最
小値検出部、19……写像バツフア、20……変
換記憶部、21……修正部、22……第2マツチ
ング部、23……最小値検出部、である。
は実施例ブロツク図である。 図において、10……制御部、11……マイク
ロホン、12……前処理部、13……バツフア、
14……記憶部、15……バツフア、16……バ
ツフア、17……第1マツチング部、18……最
小値検出部、19……写像バツフア、20……変
換記憶部、21……修正部、22……第2マツチ
ング部、23……最小値検出部、である。
Claims (1)
- 【特許請求の範囲】 1 特徴の時系列のネツトワークとして表現され
る標準パターンと利用者の発声による音声パター
ンとマツチングさせてネツトワーク中に最適パス
を定め、この最適パス上の上記特徴を上記音声パ
ターンによつて修正することを特徴とする標準パ
ターン適応方式。 2 特徴の時系列のネツトワークとして表現され
る標準パターンと利用者の発声による音声パター
ンとをマツチングさせてネツトワーク中に最適パ
スを定め、最適パス上の上記特徴と、それに対応
する上記音声パターン中の特徴とが所定の基準以
上類似しているときに限つて前記標準パターン特
徴を該音声パターン特徴によつて修正することを
特徴とする標準パターン適応方式。 3 特徴の時系列のネツトワークとして表現され
る標準パターンと利用者の発声による音声パター
ンとをマツチングさせてネツトワーク中に最適パ
スを定め、最適パス上の上記特徴と、それに対応
する上記音声パターン中の特徴とが、所定の基準
以上類似している部分では前記標準パターン特徴
を該音声パターン特徴で修正し、所定の基準以上
類似していない部分においては、該部分に並列す
る新たなパスを、該音声パターン特徴をもとにし
て作成することを特徴とする標準パターン適応方
式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59224632A JPS61102698A (ja) | 1984-10-25 | 1984-10-25 | 標準パタ−ン適応方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP59224632A JPS61102698A (ja) | 1984-10-25 | 1984-10-25 | 標準パタ−ン適応方式 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS61102698A JPS61102698A (ja) | 1986-05-21 |
| JPH0570838B2 true JPH0570838B2 (ja) | 1993-10-05 |
Family
ID=16816752
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP59224632A Granted JPS61102698A (ja) | 1984-10-25 | 1984-10-25 | 標準パタ−ン適応方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS61102698A (ja) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS63291100A (ja) * | 1987-05-25 | 1988-11-28 | 中村 尚五 | 音声認識の方法 |
-
1984
- 1984-10-25 JP JP59224632A patent/JPS61102698A/ja active Granted
Also Published As
| Publication number | Publication date |
|---|---|
| JPS61102698A (ja) | 1986-05-21 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US12165634B2 (en) | Speech recognition method and apparatus, device, storage medium, and program product | |
| JP5200712B2 (ja) | 音声認識装置、音声認識方法及びコンピュータプログラム | |
| JP6654611B2 (ja) | 成長型対話装置 | |
| EP4018437A1 (en) | Optimizing a keyword spotting system | |
| JPS5991500A (ja) | 音声分析器 | |
| JP3124277B2 (ja) | 音声認識システム | |
| CN112750445B (zh) | 语音转换方法、装置和系统及存储介质 | |
| JP6027754B2 (ja) | 適応化装置、音声認識装置、およびそのプログラム | |
| JP2017126051A (ja) | テンプレート生成装置、テンプレート生成方法、テンプレート生成プログラムおよびフレーズ検知システム | |
| CN114530145B (zh) | 语音识别结果纠错方法及装置、计算机可读存储介质 | |
| US11043212B2 (en) | Speech signal processing and evaluation | |
| JPH09292899A (ja) | 音声認識装置 | |
| JP2980382B2 (ja) | 話者適応音声認識方法および装置 | |
| JPS61102698A (ja) | 標準パタ−ン適応方式 | |
| JP5772219B2 (ja) | 音響モデル生成装置、音響モデル生成方法及び音響モデル生成用コンピュータプログラム | |
| JP2002082688A (ja) | 話者適応化装置、話者適応化方法、話者適応化プログラムを記録したコンピュータ読取可能な記録媒体、音声認識装置、音声認識方法および音声認識プログラムを記録したコンピュータ読取可能な記録媒体 | |
| JPH1097270A (ja) | 音声認識装置 | |
| JP3841342B2 (ja) | 音声認識装置および音声認識プログラム | |
| KR100476337B1 (ko) | 음성인식기의유사단어인식방법 | |
| JP5152016B2 (ja) | 音声認識用辞書作成装置及び音声認識用辞書作成方法 | |
| KR20260052323A (ko) | 호출어 인식 학습 장치 및 방법 | |
| JPH01185599A (ja) | 音声認識装置 | |
| JPH0713587A (ja) | 隠れマルコフモデル連結学習方法 | |
| JPH0552516B2 (ja) | ||
| JPS63147198A (ja) | 単語音声検出方式 |