JPS5852696A - 音声認識装置 - Google Patents
音声認識装置Info
- Publication number
- JPS5852696A JPS5852696A JP15075281A JP15075281A JPS5852696A JP S5852696 A JPS5852696 A JP S5852696A JP 15075281 A JP15075281 A JP 15075281A JP 15075281 A JP15075281 A JP 15075281A JP S5852696 A JPS5852696 A JP S5852696A
- Authority
- JP
- Japan
- Prior art keywords
- recognition
- speech
- processor
- reliability
- results
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
本発明は、人間の音声によって入力された言語データを
単音節ごとに判断して対応する文字データを得るための
音声認識装置に関する。
単音節ごとに判断して対応する文字データを得るための
音声認識装置に関する。
このような音声認識装置としては、従来からコンピュー
タ音用い、入力された音声から各音節ごとの特徴データ
を抽出し、これ全あらかじめ用意しであるそれぞれの音
節ごとの標準特徴データと比較して音声の認識を行なう
装置が主として採用されていた。
タ音用い、入力された音声から各音節ごとの特徴データ
を抽出し、これ全あらかじめ用意しであるそれぞれの音
節ごとの標準特徴データと比較して音声の認識を行なう
装置が主として採用されていた。
そして、このときの特徴データの抽出方式としては、例
えば以下に示すよう力種々の方式のものが使用されてい
た。
えば以下に示すよう力種々の方式のものが使用されてい
た。
1.線形予d4Ij係数又はP A、 RCOR係数方
式。
式。
2、本文差波解析方式。
3、周波数スペクトラム方式。
4、第17オルマント抽出方式。
5、無音期間の後に続く高周波成分による方式。
6、振幅による方式。
ところで、これらの方式を用いて音声の特徴データの抽
出を行ない、音声認識を行なってみると、各方式には音
節の種類により得手、不得手があり、単音節全構成する
音素の特徴を良く現わす方式とそうでない方式とに別れ
、音声認識結果の認識率にも音節の種類によって差があ
ることが判る。
出を行ない、音声認識を行なってみると、各方式には音
節の種類により得手、不得手があり、単音節全構成する
音素の特徴を良く現わす方式とそうでない方式とに別れ
、音声認識結果の認識率にも音節の種類によって差があ
ることが判る。
そして、一般に、日本語を対象とした場合、音声中の音
素とその特徴データを良好に抽出する方式との対応は、
例えば第1表に示すようになっている。
素とその特徴データを良好に抽出する方式との対応は、
例えば第1表に示すようになっている。
従って、従来の音声認識装置においては、音節の種類に
よっては充分な認識結果が得られないという欠点があっ
た。
よっては充分な認識結果が得られないという欠点があっ
た。
本発明の目的は、上記した従来技術の欠点全線き、必要
とする音節のすべてにわたって充分に高い認識結果が得
られるように1〜た音声認識装Wを提供するにある。
とする音節のすべてにわたって充分に高い認識結果が得
られるように1〜た音声認識装Wを提供するにある。
この目的を達成するため、本発明は、入力された音声の
各音節ごとに複数の異なった方式によるt+I徴データ
の抽出全行ない、これによって得た複数の認識結果の総
合的な評価によυ装置全体としての認識結果を得るよう
にし、それぞれの特徴データ抽出方式ごとの得手、不得
手全相互に補い、成る方式による認識結果がその方式に
おいて得手とする音節に対するものであったときには、
その認識結果金高い信頼度のもとで評価し、反対に不得
手な音節に対するものであったときには低い信頼度のも
とて評価するようにした点全特徴とする。
各音節ごとに複数の異なった方式によるt+I徴データ
の抽出全行ない、これによって得た複数の認識結果の総
合的な評価によυ装置全体としての認識結果を得るよう
にし、それぞれの特徴データ抽出方式ごとの得手、不得
手全相互に補い、成る方式による認識結果がその方式に
おいて得手とする音節に対するものであったときには、
その認識結果金高い信頼度のもとで評価し、反対に不得
手な音節に対するものであったときには低い信頼度のも
とて評価するようにした点全特徴とする。
以下、本発明による音声認識装置全実施例によって説明
する。
する。
」二記したように、本発明においては、複数の異々つた
特徴データ抽出方式による音声認識全入力される音声の
単音節ごとに行なう必要があり、これを1台のプロセッ
サで行方わせようとすれば認識時間が長時間化シフ、入
力音声の実時間処理が困難になり、さらに処理動作が極
めて高速度の高価なプロセッサと入力音声會蓄えておく
ための記憶装置などが必要になるため、著しくコストア
ップ全招きやすい。
特徴データ抽出方式による音声認識全入力される音声の
単音節ごとに行なう必要があり、これを1台のプロセッ
サで行方わせようとすれば認識時間が長時間化シフ、入
力音声の実時間処理が困難になり、さらに処理動作が極
めて高速度の高価なプロセッサと入力音声會蓄えておく
ための記憶装置などが必要になるため、著しくコストア
ップ全招きやすい。
そこで、以下に示す本発明の実施例においては、それぞ
れの異なった特徴データ抽出方式による音声認識処理装
置をそれぞれ専用に設け、各方式による認識処理を並列
に実行させることにより、比較的低速のプロセッサ、例
えばマイクロプロセッサを用いても充分に頬い時間で認
識処理が行々えるようにしてコストダウンを可n目に(
〜ている。また、この実施例においては、上記した複数
の音声認識処理装置によって得た複数の認識結果全総合
的に評価し、本発明による音声認識装置全体と12での
最終的なg識結果を得るための処理装置にも専用のプロ
セッサが用いられており、いわゆるマルチプロセッサ構
成となっている。そして、この結果、各プロセッサに必
要なソフトウェアの単純化が可能になっている。
れの異なった特徴データ抽出方式による音声認識処理装
置をそれぞれ専用に設け、各方式による認識処理を並列
に実行させることにより、比較的低速のプロセッサ、例
えばマイクロプロセッサを用いても充分に頬い時間で認
識処理が行々えるようにしてコストダウンを可n目に(
〜ている。また、この実施例においては、上記した複数
の音声認識処理装置によって得た複数の認識結果全総合
的に評価し、本発明による音声認識装置全体と12での
最終的なg識結果を得るための処理装置にも専用のプロ
セッサが用いられており、いわゆるマルチプロセッサ構
成となっている。そして、この結果、各プロセッサに必
要なソフトウェアの単純化が可能になっている。
さて、第1図は本発明の一実施例を示すブロック図で、
■はマイクロホンと増幅器などからなる音声信号入力部
、2は線形予測係数方1式(又はPARCOR係数方式
)の認識プロセッサ、3は本文差波分析方式の認識プロ
セッサ、4は周波数スペクトラム方式の認識プロセッサ
、5は第]フオルマント抽出方式の認識プロセッサ、6
は振幅方式の認識プロセッサ、7は無音期間に続く高周
波成分方式の認識プロセッサ、8は評価プロセッサであ
る。
■はマイクロホンと増幅器などからなる音声信号入力部
、2は線形予測係数方1式(又はPARCOR係数方式
)の認識プロセッサ、3は本文差波分析方式の認識プロ
セッサ、4は周波数スペクトラム方式の認識プロセッサ
、5は第]フオルマント抽出方式の認識プロセッサ、6
は振幅方式の認識プロセッサ、7は無音期間に続く高周
波成分方式の認識プロセッサ、8は評価プロセッサであ
る。
各方式の認識プロセッサ2〜7け音声信号入力部1から
の信号全共通に取入れ、認識結果をそれぞれ評価プ11
セツザ8に通知する。
の信号全共通に取入れ、認識結果をそれぞれ評価プ11
セツザ8に通知する。
評価プロセッサ8は各認識プロセッサ2〜7がらの認識
結果をそれぞれ評価し、この装置全体としての認識結果
(以下、これ全最終認識結果という)を算出する。才だ
、この評価プロセッサ8は、それぞれの認識プロセッサ
2〜7の動作全制御し、さらに外部装置との情報交換も
受持っている。
結果をそれぞれ評価し、この装置全体としての認識結果
(以下、これ全最終認識結果という)を算出する。才だ
、この評価プロセッサ8は、それぞれの認識プロセッサ
2〜7の動作全制御し、さらに外部装置との情報交換も
受持っている。
従って、音声信号入力部】と各認識プロセッサ2〜7と
の間はアナログ信号回線で結ばれ、これら認識プロセッ
サ2〜7と評価プロセッサ8との間はデジタル通信回線
で結ばれている。
の間はアナログ信号回線で結ばれ、これら認識プロセッ
サ2〜7と評価プロセッサ8との間はデジタル通信回線
で結ばれている。
次に、第2図はそれぞれの認識プロセッサ2〜7の一実
施例で、10はそれぞれの特徴データ抽出方式による特
徴抽出用ハードウェア、11はマ用のメモリ、13は音
声辞書メモIJ、14けプログラムメモリ、15は通信
回線、16は内部バス(B U S という)である。
施例で、10はそれぞれの特徴データ抽出方式による特
徴抽出用ハードウェア、11はマ用のメモリ、13は音
声辞書メモIJ、14けプログラムメモリ、15は通信
回線、16は内部バス(B U S という)である。
ハードウェア10はそれぞれの特徴データ抽出方式に応
じて構成され、入力されたアナログ音声。
じて構成され、入力されたアナログ音声。
信号をその方式にしたがって特徴抽出処理してからディ
ジタル化して出力する。
ジタル化して出力する。
CPUIIUプログラムメモリ14に格納されている音
声認識プログラムにl〜たがって所定の処理を行なう。
声認識プログラムにl〜たがって所定の処理を行なう。
音声辞書メモリ13には入力される音声信号として予定
されている各音節の音声見本よυ得た各音節に対応する
特徴データ、即ち、標準データが格納されている。
されている各音節の音声見本よυ得た各音節に対応する
特徴データ、即ち、標準データが格納されている。
通信回路15は第1図に示した評価プロセッサ8との間
で情報交換を行なうためのハードウェアである。なお、
作業用メモリ12、内部バス16などは通常のマイクロ
コンピュータと同じであるから説明は省略する。
で情報交換を行なうためのハードウェアである。なお、
作業用メモリ12、内部バス16などは通常のマイクロ
コンピュータと同じであるから説明は省略する。
従って、この第2図に示した装置は内部バス16で結合
されて全体で第1図に示したそれぞれの認識プロセッサ
2〜7全形成し、音声信号が入力されるとその各音節ご
とにそれぞれの方式にしたがった特徴データの抽出全行
ない、それ全辞書メモリ13から読出した標準データと
比較して認識結果を得るようにCPUI 1による処理
が行なわれることになる。
されて全体で第1図に示したそれぞれの認識プロセッサ
2〜7全形成し、音声信号が入力されるとその各音節ご
とにそれぞれの方式にしたがった特徴データの抽出全行
ない、それ全辞書メモリ13から読出した標準データと
比較して認識結果を得るようにCPUI 1による処理
が行なわれることになる。
また、第3図は第1図における評価プロセッサ8の一実
施例で、20は通信回線、21はマイクロプロセッサ(
CPU)、22は作業用メモリ、23は信頼度管理テー
ブル、24はプログラムメモリ、25は通信回線、26
は内部バスである。
施例で、20は通信回線、21はマイクロプロセッサ(
CPU)、22は作業用メモリ、23は信頼度管理テー
ブル、24はプログラムメモリ、25は通信回線、26
は内部バスである。
通信回線20は第1図及び第2図に示したそれぞれの認
識プロセッサ2〜7との間での情報交換を行なうハード
ウェアであり、同じく通信回線25け外部装置、例えば
モニタを含むプリンタ、電子植字装置などとの間での情
報交換を行なうハードウェアである。
識プロセッサ2〜7との間での情報交換を行なうハード
ウェアであり、同じく通信回線25け外部装置、例えば
モニタを含むプリンタ、電子植字装置などとの間での情
報交換を行なうハードウェアである。
信頼度管理テーブル23は各認識プロセッサ2〜7の各
音節ごとの認識結果についての信頼度情報を記録してお
くメモリである。
音節ごとの認識結果についての信頼度情報を記録してお
くメモリである。
なお、CPU21、作業用メモリ22、プログラムメモ
リ24、内部バス26などは第2図と同じである。
リ24、内部バス26などは第2図と同じである。
従って、この第3図に示した装置は内部バス26で結合
されて全体で第1図に示した評価プロ総合的な評価と全
行々い最終認識結果を外部装置に出力すると共に、この
最終認識結果に対する外部装置からのフィードバック情
報を受は入れ、信頼度管理テーブル23の内容を更新す
る働き全するO また、以上の説明から明らかなように、第1図に示した
本発明の実施例は、全体として複数の認識プロセッサ2
〜7と評価プロセッサ8とを通信回線によって結合した
、いわゆる疎結合マルチプロセッサを形成している。
されて全体で第1図に示した評価プロ総合的な評価と全
行々い最終認識結果を外部装置に出力すると共に、この
最終認識結果に対する外部装置からのフィードバック情
報を受は入れ、信頼度管理テーブル23の内容を更新す
る働き全するO また、以上の説明から明らかなように、第1図に示した
本発明の実施例は、全体として複数の認識プロセッサ2
〜7と評価プロセッサ8とを通信回線によって結合した
、いわゆる疎結合マルチプロセッサを形成している。
次に動作について説明する。
既に説明したように、この実施例による音声認識装置k
全体の動作、及び外部装置との間の情報交換は全て評価
プロセッサ8によって行なわれる。
全体の動作、及び外部装置との間の情報交換は全て評価
プロセッサ8によって行なわれる。
そして、各認識プロセッサ2〜7は評価プロセッサ8か
らの制御命令により動作し、その結果である認識結果全
評価プロセッサ8に送り出す。
らの制御命令により動作し、その結果である認識結果全
評価プロセッサ8に送り出す。
このとき、評価プロセッサ8から各認識プロセッサ2〜
7のそれぞれに送られる制御命令とデータは、 1、音声辞書格納命令、及び音声辞書データ、2、音声
辞書作成(更新)命令、及び作成(更新)される音節基
、 3、音声認識作業開始命令、 4、音声辞書転送命令、 であり、これに対して各認識プロセッサ2〜7のそれぞ
れから評価プロセッサ8に送られる情報は、上記1〜4
に対応して 1、音声辞書格納完了信号、 2、音声辞書作成(更新)終了信号、 3、音声認識結果、 となっている。
7のそれぞれに送られる制御命令とデータは、 1、音声辞書格納命令、及び音声辞書データ、2、音声
辞書作成(更新)命令、及び作成(更新)される音節基
、 3、音声認識作業開始命令、 4、音声辞書転送命令、 であり、これに対して各認識プロセッサ2〜7のそれぞ
れから評価プロセッサ8に送られる情報は、上記1〜4
に対応して 1、音声辞書格納完了信号、 2、音声辞書作成(更新)終了信号、 3、音声認識結果、 となっている。
そこで、笠ず、装置が動作可能な状態に操作されると、
評価プロセッサ8は音声辞書格納命令とそれに続いて外
部の所定のメモリに収容しである音声辞書データを各認
識プロセッサ2〜7に送出し、各認識プロセッサ2〜7
の辞書メモリ13に認識処理に必要な標準データ會格納
する。そして、辞書メモリ13に対する標準データの格
納が完了すると、対応する認識プロセッサ2〜7から音
声辞書格納完了信号が評価プロセッサ8に送られる。
評価プロセッサ8は音声辞書格納命令とそれに続いて外
部の所定のメモリに収容しである音声辞書データを各認
識プロセッサ2〜7に送出し、各認識プロセッサ2〜7
の辞書メモリ13に認識処理に必要な標準データ會格納
する。そして、辞書メモリ13に対する標準データの格
納が完了すると、対応する認識プロセッサ2〜7から音
声辞書格納完了信号が評価プロセッサ8に送られる。
そこで、次に、評価プロセッサ8は各認識プロセッサ2
〜7に音声認識作業開始命令を送り、これにより各認識
プロセッサ2〜7はそれぞれの特徴データ抽出方式によ
る音声認識作業を開始し、音声が入力される七それぞれ
の方式による認識結果を得、それらを評価プロセッサ8
に転送する。
〜7に音声認識作業開始命令を送り、これにより各認識
プロセッサ2〜7はそれぞれの特徴データ抽出方式によ
る音声認識作業を開始し、音声が入力される七それぞれ
の方式による認識結果を得、それらを評価プロセッサ8
に転送する。
一方、オペレータが変ったりして標準データの作成(更
新)が必要になったときには、音声辞書格納命令と音声
辞書データを評価プロセッサ8から各認識プロセッサ2
〜7に送シ出す代りに、音声辞書作成(更新)命令と作
成(更新)される音節名全送り出し、一方、各認識プロ
セッサ2〜7は音声辞書格納完了信号の代りに音声辞書
作成(更新)終了信号を評価プロセッサ8に送り返す。
新)が必要になったときには、音声辞書格納命令と音声
辞書データを評価プロセッサ8から各認識プロセッサ2
〜7に送シ出す代りに、音声辞書作成(更新)命令と作
成(更新)される音節名全送り出し、一方、各認識プロ
セッサ2〜7は音声辞書格納完了信号の代りに音声辞書
作成(更新)終了信号を評価プロセッサ8に送り返す。
なお、この音声辞書作成(更新)作業については周知の
とおりに行なえばよいので、説明は省略する。
とおりに行なえばよいので、説明は省略する。
さて、こうして音声認識処理が開始すると評価プロセッ
サ8には各認識プロセッサ2〜7から6種類の認識結果
が送られてくる。このとき、各認識プロセッサ2〜7か
ら送られてくる認識結果は、日本語を対象とした場合、
その音節A−Hの68種類(だく音、半だ〈音を含めれ
ば101種類)のうちのいずれか1音節に対応するもの
となっている0 そこで、評価プロセッサ8は各認識プロセッサ2〜7の
それぞれの認識結果(音節)からその音節に対応する信
頼度rk信頼度管理テーブル23から取シ出す。
サ8には各認識プロセッサ2〜7から6種類の認識結果
が送られてくる。このとき、各認識プロセッサ2〜7か
ら送られてくる認識結果は、日本語を対象とした場合、
その音節A−Hの68種類(だく音、半だ〈音を含めれ
ば101種類)のうちのいずれか1音節に対応するもの
となっている0 そこで、評価プロセッサ8は各認識プロセッサ2〜7の
それぞれの認識結果(音節)からその音節に対応する信
頼度rk信頼度管理テーブル23から取シ出す。
ここで、信頼度管理テーブル23に格納されている信頼
度をRとすれば、 (R1r (1,1)、r (1,2)、r (1、3
) −。
度をRとすれば、 (R1r (1,1)、r (1,2)、r (1、3
) −。
r(a、1))
a−日本語の音節数(1〜68と々る)、1−認識プロ
セッサの数(この実施例では6である)。
セッサの数(この実施例では6である)。
とな9、Rの要素数は(a X i ) −(68X6
)となる。
)となる。
そして、r (j+ k)は第に番目の認識プロセッサ
の音節をjとしたときの認識結果が正しいと思われる信
頼度を表わし、 0 <r (j、 k) Sl であり、この値が1.0に近いほどその認識結果に対す
る信頼度が高い。
の音節をjとしたときの認識結果が正しいと思われる信
頼度を表わし、 0 <r (j、 k) Sl であり、この値が1.0に近いほどその認識結果に対す
る信頼度が高い。
そこで、各認識プロセッサからの認識結果に対する信頼
度をRi とすれば、 (Ri l r、 (a)、r2 (a)、r3(a)
・・・・・・、ri(a))となり、r4(a)は第1
番目の認識プロセッサによる認識結果の音節aに対する
信頼度を表わし、信頼度R4の要素数はi個となり、第
1図の実施例では6個となる。
度をRi とすれば、 (Ri l r、 (a)、r2 (a)、r3(a)
・・・・・・、ri(a))となり、r4(a)は第1
番目の認識プロセッサによる認識結果の音節aに対する
信頼度を表わし、信頼度R4の要素数はi個となり、第
1図の実施例では6個となる。
また、信頼度r1の属性となる音節の種類は、全ての認
識プロセッサが同じ音節と認識した場合には、全てのa
の値は同じであるので1種類であり、全ての異なった音
節であると認識したときには1種類になる。
識プロセッサが同じ音節と認識した場合には、全てのa
の値は同じであるので1種類であり、全ての異なった音
節であると認識したときには1種類になる。
次に、各認識プロセッサ単位の信頼度Ri k音節の種
類ごとの信頼度Salに変換する。ここでSal は、 (Sa e l Sal 、 Sa 2.5a3−、・
・・・・、 Sal但し、lは信頼度R4中に含まれる
音節の種類である。
類ごとの信頼度Salに変換する。ここでSal は、 (Sa e l Sal 、 Sa 2.5a3−、・
・・・・、 Sal但し、lは信頼度R4中に含まれる
音節の種類である。
であり、この変化は次のようにして行なう。
5al=[Ri=a I 5al=I −yr C1−
r4 (a) )) ]なお、πは積和を表わす。
r4 (a) )) ]なお、πは積和を表わす。
そして、信頼度Ri 中aという音節を認識結果に持つ
全てのri(a)に対して、1−π(:1 ri(a
) )全計算1〜たもの全音節aに対する信頼度Saと
する。この信頼度Saは信頼度Riに含壕れる音節付し
て信頼度Salとしである。
全てのri(a)に対して、1−π(:1 ri(a
) )全計算1〜たもの全音節aに対する信頼度Saと
する。この信頼度Saは信頼度Riに含壕れる音節付し
て信頼度Salとしである。
そこで、評価プロセッサ8はこの信頼度Sal’に用い
、認識プロセッサ2〜7から得た認識結果の評価を行な
って最終認識結果を算出する。即ち、最も信頼度の高い
認識結果は、Sal中で最大の信頼度5r11aXa=
1.4AX (Sal)”ir持つ音節aとなるから、
認識プロセッサ8はこの信頼度SmaXaを持つ音節全
最終認識結果と1〜で出力する。
、認識プロセッサ2〜7から得た認識結果の評価を行な
って最終認識結果を算出する。即ち、最も信頼度の高い
認識結果は、Sal中で最大の信頼度5r11aXa=
1.4AX (Sal)”ir持つ音節aとなるから、
認識プロセッサ8はこの信頼度SmaXaを持つ音節全
最終認識結果と1〜で出力する。
こうして、入力された音声信号の一音節に対する認識処
理を完了したら、ついで評価プロセッサ8は再び音声認
識作業開始命令を各認識プロセッサ2〜7に送り、次の
音節の音声信号に対する認識処理に入って動作を続行す
る。
理を完了したら、ついで評価プロセッサ8は再び音声認
識作業開始命令を各認識プロセッサ2〜7に送り、次の
音節の音声信号に対する認識処理に入って動作を続行す
る。
次に、評価プロセッサ8は音声全入力するオペレータが
変ったシ、この音声認識装置が動作を停止させようとし
たときには、各認識プロセッサ2〜7のそれぞれの音声
辞書メモリ13に格納されている音声辞書と、評価プロ
セッサ8の中に設けられている信頼度管理テーブル23
に格納されている信頼度とを外部のメモリに待避させる
ように動作する。
変ったシ、この音声認識装置が動作を停止させようとし
たときには、各認識プロセッサ2〜7のそれぞれの音声
辞書メモリ13に格納されている音声辞書と、評価プロ
セッサ8の中に設けられている信頼度管理テーブル23
に格納されている信頼度とを外部のメモリに待避させる
ように動作する。
そして、このうち音声辞書の待避は評価プロセッサ8か
ら各認識プロセッサ2〜7に音声辞書転送命令を送り、
これに応じて各認識プロセッサ2〜7はその音声辞書メ
モリ13から音声辞書データを読出して転送することに
より行なわれる。
ら各認識プロセッサ2〜7に音声辞書転送命令を送り、
これに応じて各認識プロセッサ2〜7はその音声辞書メ
モリ13から音声辞書データを読出して転送することに
より行なわれる。
以上説明したように、この実施例によれば、入力音声信
号の各音節ごとの認識処理をそれぞれ異なった特徴デー
タ抽出方式による専用の認識プロセッサ2〜7で同時に
開始し、並列に行なっているから、比較的低速のCPU
で構成しても処理時間が永くなる虞れが少なく、シかも
、複数の異なった特徴データ抽出方式による認識結果を
それぞれの方式によって決腫る信頼度を加味して総合的
に評価することによシ最終認識結果を得ているから、特
徴データ抽出方式の相違による音節ごとの得手、不得手
が相互に補われ、充分に高い認識率をもった結果を容易
に得ることができる。
号の各音節ごとの認識処理をそれぞれ異なった特徴デー
タ抽出方式による専用の認識プロセッサ2〜7で同時に
開始し、並列に行なっているから、比較的低速のCPU
で構成しても処理時間が永くなる虞れが少なく、シかも
、複数の異なった特徴データ抽出方式による認識結果を
それぞれの方式によって決腫る信頼度を加味して総合的
に評価することによシ最終認識結果を得ているから、特
徴データ抽出方式の相違による音節ごとの得手、不得手
が相互に補われ、充分に高い認識率をもった結果を容易
に得ることができる。
ところで、上記実施例においては、評価プロセッサ8の
信頼度管理テーブル23に最初に格納すべき信頼度デー
タについては、特に説明しなかったが、これは各特徴デ
ータ抽出方式による認識装置のそれぞれの音節に対する
認識結果の過去の経験や実績に基づいて定めればよい。
信頼度管理テーブル23に最初に格納すべき信頼度デー
タについては、特に説明しなかったが、これは各特徴デ
ータ抽出方式による認識装置のそれぞれの音節に対する
認識結果の過去の経験や実績に基づいて定めればよい。
しかしながら、このような音声認識装置においては、認
識結果をモニタしてオペレータが判断し、誤った結果が
得られたときには訂正しながら使用されるのが通例であ
り、このような場合には認識結果についての正誤情報を
得ることができる。
識結果をモニタしてオペレータが判断し、誤った結果が
得られたときには訂正しながら使用されるのが通例であ
り、このような場合には認識結果についての正誤情報を
得ることができる。
そこで、このようなときには、認識結果の正誤情報によ
り信頼度管理テーブル23に格納すべき信頼度データ全
正誤情報に基づいて更新し、装置の使用を続行するにつ
れてさらに高い認識率が得られるようにすること′がで
き、以下、この点についての一実施例について説明する
。
り信頼度管理テーブル23に格納すべき信頼度データ全
正誤情報に基づいて更新し、装置の使用を続行するにつ
れてさらに高い認識率が得られるようにすること′がで
き、以下、この点についての一実施例について説明する
。
まず、上記した信頼度Rは、原理的に次のように定義で
きる。
きる。
r (a、 i) −”−虹(2)−〇n(a、i)
・・・・・・・・・・・・(1)n (a
、 i) ・・・・・・第1番認識プロセッサが入力
音声音aと認識した 回数。
・・・・・・・・・・・・(1)n (a
、 i) ・・・・・・第1番認識プロセッサが入力
音声音aと認識した 回数。
nc (a、 i)・・・・・・第1番認識プロセッサ
が入力音声音aと認識し、 それが正しかった回数。
が入力音声音aと認識し、 それが正しかった回数。
そして、信頼度Rの更新は次のようにして行なうように
する。
する。
1、第1番認識プロセッサの認識結果が、外部からの正
誤情報によシ正しかったと判断されたときには(1)式
の分母と分子に共に1を加えとする。
誤情報によシ正しかったと判断されたときには(1)式
の分母と分子に共に1を加えとする。
2、同じく、正しくなかったと判断されたときには(1
)式の分母にだけ1を加え とする。
)式の分母にだけ1を加え とする。
しかl−ながら、この更新方法では、nとneの値を順
次そのまま保存しておかなくてはならず、しかも、これ
らn、ncの値は装置の使用回数に伴なって際限なく大
きく々るから処理に具合が悪い。
次そのまま保存しておかなくてはならず、しかも、これ
らn、ncの値は装置の使用回数に伴なって際限なく大
きく々るから処理に具合が悪い。
そこで、この実施例では、現時点での信頼度Rだけから
更新後の信頼度R’t−算出するようにした。
更新後の信頼度R’t−算出するようにした。
笠ず、現時点での信頼度Rが現時点よりm回前笠での認
識結果からの信頼度全反映り一でいると仮定すれば、 n (a + 1 ) =m nc (a、 i) =mXr (a+ i)となる。
識結果からの信頼度全反映り一でいると仮定すれば、 n (a + 1 ) =m nc (a、 i) =mXr (a+ i)となる。
次に、更新後の信頼度R′に更新したことにょ9(m+
1)回前になってしまう認識結果が正しい答であったか
誤りであったかを信頼度Rの値から以下のようにして決
定する。
1)回前になってしまう認識結果が正しい答であったか
誤りであったかを信頼度Rの値から以下のようにして決
定する。
まず、rand (x) k O,O〜1.0の値をと
る一様乱数とし、もしも、r (a、 i)≧rand
(x)ならば更新した結果(m+1)回前になってしま
う結果を正しいものとみなし、次の式によって更新全行
なう。
る一様乱数とし、もしも、r (a、 i)≧rand
(x)ならば更新した結果(m+1)回前になってしま
う結果を正しいものとみなし、次の式によって更新全行
なう。
mXr (a、1)−1+β
r’(a、i)−□
ここで、βは第1番認識プロセッサの今回の認識結果a
が正しかったとき1に、そして誤まっていたときにはO
になる数である。
が正しかったとき1に、そして誤まっていたときにはO
になる数である。
腫だ、r (a、 i) < rand (x)となっ
たときには更新した結果、(m+1)回前と寿つてしま
う認識結果は誤りであったものとみなし、 によって更新を行なうようにする。
たときには更新した結果、(m+1)回前と寿つてしま
う認識結果は誤りであったものとみなし、 によって更新を行なうようにする。
こうして信頼度r(a、i)の更新を全ての認識プロセ
ッサ2〜6の信頼度管理テーブル23に格納しであるデ
ータについて行なえば、信頼度Rの更新を容易に行かう
ことができ、上記実施例の音声認識装置における最終認
識結果の認識率をその使用回数の増加とともにさらに改
善することができるO 以上説明したように、本発明によれば、複数の異なった
音声特徴データ抽出方法による認識結果を総合的に評価
して最終的な認識結果を得るようにしたから、それぞれ
の抽出方式における音節ごとの得手、不得手が相互に補
われて充分に正しい認識結果が得られることになり、従
来技術の欠点を除き、入力された音声において必要とす
る音節の全てについて常に充分に高い認識率を保って動
作することの可能な音声認識装置を提供することができ
る。
ッサ2〜6の信頼度管理テーブル23に格納しであるデ
ータについて行なえば、信頼度Rの更新を容易に行かう
ことができ、上記実施例の音声認識装置における最終認
識結果の認識率をその使用回数の増加とともにさらに改
善することができるO 以上説明したように、本発明によれば、複数の異なった
音声特徴データ抽出方法による認識結果を総合的に評価
して最終的な認識結果を得るようにしたから、それぞれ
の抽出方式における音節ごとの得手、不得手が相互に補
われて充分に正しい認識結果が得られることになり、従
来技術の欠点を除き、入力された音声において必要とす
る音節の全てについて常に充分に高い認識率を保って動
作することの可能な音声認識装置を提供することができ
る。
第1図は本発明による音声認識装置の一実施例を示すブ
ロック図、第2図は認識プロセッサの一実施例を示すブ
ロック図、第3図は評価プロセッサの一実施例を示すブ
ロック図である。 1・・・・・・音声信号入力部、2〜7・・・・・・そ
れぞれ異なった特徴抽出方式による認識プロセッサ、8
・・・・・・評価プロセッサ。
ロック図、第2図は認識プロセッサの一実施例を示すブ
ロック図、第3図は評価プロセッサの一実施例を示すブ
ロック図である。 1・・・・・・音声信号入力部、2〜7・・・・・・そ
れぞれ異なった特徴抽出方式による認識プロセッサ、8
・・・・・・評価プロセッサ。
Claims (1)
- 【特許請求の範囲】 (])音声信号から抽出した各音節ごとの特徴データを
標準データと比較して音声認識を行なう方式の音声認識
装置において、少くとも2種類の異なった特徴データ抽
出方式によシ音声認識を行なって複数の認識結果を得る
ようにした音声認識手段と、これら複数の認識結果全入
力とする総合評価手段とを設け、複数の認識結果の総合
評価による認識率の高い音声認識結果が得られるように
構成したことを特徴とする音声認識装置。 (2、特許請求の範囲第1項において、それぞれ専用の
音声認識プロセッサ金偏え独立して音声認識処理動作が
可能が少くとも2系統の音声認識手段を設け、異った複
数の特徴データ抽出方式による音声認識処理動作全単音
節ごとに同時に開始して上記複数の認識結果を得るよう
に構成したこと全特徴とする音声認識装置。 (3)特許請求の範囲第1項又は第2項において、上記
複数の認識結果のそれぞれに対応し、それぞれの認識結
果の正誤に応じて順次更新されてゆく複数の信頼度係数
全算出する手段を設け、上記評価手段を、これら複数の
信頼度係数のそれぞれを対応する上記複数の認識結果の
それぞれに加味した上で総合的に評価する手段で構成し
たことを特徴とする音声認識装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP15075281A JPS5852696A (ja) | 1981-09-25 | 1981-09-25 | 音声認識装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP15075281A JPS5852696A (ja) | 1981-09-25 | 1981-09-25 | 音声認識装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPS5852696A true JPS5852696A (ja) | 1983-03-28 |
Family
ID=15503635
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP15075281A Pending JPS5852696A (ja) | 1981-09-25 | 1981-09-25 | 音声認識装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS5852696A (ja) |
Cited By (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS59222900A (ja) * | 1983-06-02 | 1984-12-14 | 沖電気工業株式会社 | 音声認識方法 |
| JPS6019199A (ja) * | 1983-07-13 | 1985-01-31 | 沖電気工業株式会社 | 音声認識方法 |
| JPS63173099A (ja) * | 1987-01-13 | 1988-07-16 | 松下通信工業株式会社 | 音声認識装置 |
| JPH0298000A (ja) * | 1988-10-05 | 1990-04-10 | Sekisui Chem Co Ltd | 男女声の識別方法 |
| JPH02273798A (ja) * | 1989-04-14 | 1990-11-08 | Sekisui Chem Co Ltd | 話者認識方式 |
| JPH02304498A (ja) * | 1989-05-18 | 1990-12-18 | Sekisui Chem Co Ltd | 単語認識方式 |
| JPH03111899A (ja) * | 1989-09-26 | 1991-05-13 | Sekisui Chem Co Ltd | 音声錠装置 |
| JPH03157697A (ja) * | 1989-11-16 | 1991-07-05 | Sekisui Chem Co Ltd | 単語認識システム |
| JPH0588695A (ja) * | 1991-04-12 | 1993-04-09 | Samsung Electron Co Ltd | オーデイオ帯域信号の音声/音楽判別装置 |
| JPH06175681A (ja) * | 1992-12-11 | 1994-06-24 | Matsushita Electric Ind Co Ltd | 音声認識方法 |
| JPH08266747A (ja) * | 1995-03-31 | 1996-10-15 | Matsushita Electric Ind Co Ltd | 音声認識装置、反応装置、反応選択装置及びこれらを用いた反応玩具 |
| WO2001065541A1 (en) * | 2000-02-28 | 2001-09-07 | Sony Corporation | Speech recognition device and speech recognition method, and recording medium |
-
1981
- 1981-09-25 JP JP15075281A patent/JPS5852696A/ja active Pending
Cited By (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS59222900A (ja) * | 1983-06-02 | 1984-12-14 | 沖電気工業株式会社 | 音声認識方法 |
| JPS6019199A (ja) * | 1983-07-13 | 1985-01-31 | 沖電気工業株式会社 | 音声認識方法 |
| JPS63173099A (ja) * | 1987-01-13 | 1988-07-16 | 松下通信工業株式会社 | 音声認識装置 |
| JPH0298000A (ja) * | 1988-10-05 | 1990-04-10 | Sekisui Chem Co Ltd | 男女声の識別方法 |
| JPH02273798A (ja) * | 1989-04-14 | 1990-11-08 | Sekisui Chem Co Ltd | 話者認識方式 |
| JPH02304498A (ja) * | 1989-05-18 | 1990-12-18 | Sekisui Chem Co Ltd | 単語認識方式 |
| JPH03111899A (ja) * | 1989-09-26 | 1991-05-13 | Sekisui Chem Co Ltd | 音声錠装置 |
| JPH03157697A (ja) * | 1989-11-16 | 1991-07-05 | Sekisui Chem Co Ltd | 単語認識システム |
| JPH0588695A (ja) * | 1991-04-12 | 1993-04-09 | Samsung Electron Co Ltd | オーデイオ帯域信号の音声/音楽判別装置 |
| JPH06175681A (ja) * | 1992-12-11 | 1994-06-24 | Matsushita Electric Ind Co Ltd | 音声認識方法 |
| JPH08266747A (ja) * | 1995-03-31 | 1996-10-15 | Matsushita Electric Ind Co Ltd | 音声認識装置、反応装置、反応選択装置及びこれらを用いた反応玩具 |
| WO2001065541A1 (en) * | 2000-02-28 | 2001-09-07 | Sony Corporation | Speech recognition device and speech recognition method, and recording medium |
| US7881935B2 (en) | 2000-02-28 | 2011-02-01 | Sony Corporation | Speech recognition device and speech recognition method and recording medium utilizing preliminary word selection |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69327188T2 (de) | Einrichtung für automatische Spracherkennung | |
| DE69831076T2 (de) | Verfahren und vorrichtung zur sprachanalyse und -synthese mittels allpass-sieb-kettenfiltern | |
| CN110675862A (zh) | 语料获取方法、电子装置及存储介质 | |
| JPH02163819A (ja) | テキスト処理装置 | |
| CN114283828A (zh) | 语音降噪模型的训练方法、语音评分方法、装置及介质 | |
| CN112908308B (zh) | 一种音频处理方法、装置、设备及介质 | |
| RU2510954C2 (ru) | Способ переозвучивания аудиоматериалов и устройство для его осуществления | |
| CN113658599A (zh) | 基于语音识别的会议记录生成方法、装置、设备及介质 | |
| JP2001282277A (ja) | 音声情報処理装置及びその方法と記憶媒体 | |
| JP3130524B2 (ja) | 音声信号認識方法およびその方法を実施する装置 | |
| JPH03120598A (ja) | 音声認識方法及び装置 | |
| CN113327583A (zh) | 一种基于ppg一致性的最优映射跨语言音色转换方法及系统 | |
| JP3011997B2 (ja) | 参照ベクトル更新方法 | |
| JP3031081B2 (ja) | 音声認識装置 | |
| JPS6147999A (ja) | 音声認識装置 | |
| JP6139430B2 (ja) | 信号処理装置、方法及びプログラム | |
| JPH0562357B2 (ja) | ||
| WO1994015330A1 (en) | Method and apparatus for automatic evaluation of pronunciation | |
| HK40074384A (zh) | 语音降噪模型的训练方法、语音评分方法、装置及介质 | |
| JPH01319099A (ja) | 音声認識装置 | |
| JPS6131476B2 (ja) | ||
| JPS59204899A (ja) | 音声パタ−ン照合装置 | |
| CN120951015A (zh) | 信息处理方法、电子设备、存储介质及计算机程序产品 | |
| JPS63289599A (ja) | セグメンテ−ション装置 | |
| JPH1011085A (ja) | 音声認識方法 |