JPS61249182A - パタ−ン認識学習装置 - Google Patents

パタ−ン認識学習装置

Info

Publication number
JPS61249182A
JPS61249182A JP60091401A JP9140185A JPS61249182A JP S61249182 A JPS61249182 A JP S61249182A JP 60091401 A JP60091401 A JP 60091401A JP 9140185 A JP9140185 A JP 9140185A JP S61249182 A JPS61249182 A JP S61249182A
Authority
JP
Japan
Prior art keywords
pattern
recognition
learning
input
dictionary
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP60091401A
Other languages
English (en)
Inventor
Hiroshi Matsuura
博 松浦
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Toshiba Corp
Original Assignee
Toshiba Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Toshiba Corp filed Critical Toshiba Corp
Priority to JP60091401A priority Critical patent/JPS61249182A/ja
Publication of JPS61249182A publication Critical patent/JPS61249182A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Character Discrimination (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 〔発明の技術分野〕 本発明は入力パターンの認識処理に用いられる1!臓辞
■を効果的に学習し、その認識性能の向上を図ることの
できるパターン認識学習装置に関する。
〔発明の技術的背景とその問題点〕
従来のパターン認lI装置は、学習時に入力された数個
のパターンに多少の加工を施して殆んどそのまま標準パ
ターンとしてms辞書メモリに登録し、この11m辞書
メモリに登録された種々のカテゴリの標準パターンと入
力パターンとを、例えばDPマツチング法を用いて照合
して上記入力パターンを認識処理するものが多い。
然し乍ら、この種のDPマツチング法で用いられる標準
パターンは、!!!諏対象の統計的分布をさほど考慮し
ていないので、例えば不特定話者に対する音声認識等に
適用するには不十分である。そこで最近では、マハラノ
ピスの汎距離や複合類似度法等のパターンの統計的分布
を考慮してi!謙方式が注目されている。
この認識方式で用いられる認識辞書は、認識パターンの
統計的分布を考慮して作成されるものであるが、その作
成は一般に非常に困難である。そこで上記統計的分布の
幅を制限し、その範囲内で多くの学習パターンを採取し
て、例えばn次元の辞書パターンを作成することが行わ
れている。しかしこのようにしても、その認識辞書(辞
書パターン)を作成するには多くの労力と多大な作業時
間を必要とした。
このような理由から、認識辞書を作成した慢にはその認
識辞書をそのまま用いてパターン認識を行っているのが
実情であり、例えば認識対象の分布が前記III辞書の
作成時の分布から大きく変化した場合等、十分な認識率
が得られなくなる等の不具合が生じていた。
そこで認識率の向上を図るべく、l!識辞書の適応化方
式が種々提唱されているが、その殆んどは単に簡便な方
法によってその認識辞書を特定の認識対象に合致するよ
うに修正するだけのものである。この為、総合的な、つ
まり認識パターンの統計的分布を考慮した!識辞書の充
実化を望むことは到底望むことができず、成る分布を持
つ認識対象に対する認識率の向上を図ることができなか
った。
〔発明の目的〕
本発明はこのような事情を考慮してなされたもので、そ
の目的とするところは、パターン認識に用いる認識辞書
の学習に必要なパターンを効率良く採取し、そのl!臓
辞−の学習を効果的に行わしめてWIII率の向上を図
ることのできるパターン認識学習装置を提供することに
ある。
(発明の概要〕 本発明は、入力パターンと認識辞書とを複合類似度法や
部分空間法により照合して上記入力パターンを認識処理
すると共に、このi!識結果に基いて上記入力パターン
を用いて特定カテゴリのW111辞書を学習する手段を
具備したパターン認識学習装置において、上記特定カテ
ゴリのall辞書の学習に用いられた入力パターン数を
管理して、その学習を行う特定カテゴリ名やその学習に
必要なパターン入力数、更には該特定カテゴリを含むデ
ータ入力例を等をディスプレイ表示して、その特定カテ
ゴリのパターンの入力を促すようにしたことを特徴とす
るものである。
そして、例えば共分散行列の更新とKLI!開法とを利
用して、その特性核または上記共分散行列に対する上記
学習用の入力パターンの寄与率を変化させる等して前記
特定カテゴリのl!!誠辞書の学習処理を行うようにし
たものである。
〔発明の効1) かくして本発明によれば、li!識辞書の学習に必要な
パターンの入力が、その必要個数や入力パターン例等と
してディスプレイ表示されて促されるので、オペレータ
はその表示情報に従ってaS辞1の学習に必要なパター
ンを簡易に、効率良く入力することが可能となる。しか
も装置側にとっては、認識辞書の学習に必要なパターン
を効率良く採取でき、例えば共分散行列の更新とKL展
開法とを利用してそのI!!!識辞書のm識対象の分布
を十分に考慮した学習を効果的に行うことができる。
故に、!!!臓辞書の効果的な充実化を図り、その認識
率の向上を図り得る等の実用上多大なる効果が奏せられ
る。
〔発明の実施例〕 以下、図面を参照して本発明の一実施例につき説明する
。
第1図は実施例vRHの概略構成図である。尚、ここで
は入力音声のパターンX!IIにつき説明するが、手書
き文字認識等のパターン認識!識についても同様に適用
することができる。
音声入力部1は、マイクロフォンや増幅器からなり、入
力音声を電気信号に変換している。この音声入力部1を
介して入力された音声信号は特徴抽出部2に与えられ、
例えば8チヤンネルのフィルタバンクを介して周波数分
解され、各周波数成分を入力音声の特徴パラメータとす
る入力音声パターンに変換される。
!!識郡部3、入力音声パターンの特徴ベクトルをfと
したとき、辞書メモリ4に登録されたカテゴリ2の辞書
パターン(φ141n)の各n面のベクトル成分との間
で N’)” EI”n <  t 、  φl1ln)2
S”’ [f ]−Σ □ n=1    11fl” なる複合類似度計算を実行し、その類似度Sを最大とす
るカテゴリを前記入力音声パターンのNII結果として
いる。尚、この認識処理法としては、マハラノビス汎距
離やユークリッド距離等を用いて行うようにしても勿論
良い。
このようにして求められた前記入力音声パターンの認識
結果が、表示部5にてディスプレイ表示される。
一方、メモリ部らには、前記特徴抽出部2で求められた
入力音声のパターンが順次蓄積される。
このメモリ部6は複数の入力音声パターンを蓄積するも
ので、各認識対象カテゴリ毎に何個の入力音声パターン
が蓄積されているか、また蓄積された入力音声パターン
の内のどのデータが既に学習処理に利用されたか等をそ
れぞれ管理している。
尚、メモリ部6の配憶容量には制限があることから、メ
モリ部6ではその記憶容量が満杯となったとき、どのデ
ータから捨てるか、或いは外部メモリ7に蓄積するか等
を制御している。
学習部8は、前記特徴抽出部2を介して求められた入力
音声パターン、および上記メモリ部6に蓄積された入力
音声パターンを用いて前記辞書メモリ4に登録された辞
書パターンを各I!識対象カテゴリ毎に学習するもので
ある。この学習81I8における辞書パターンの学習は
、例えば第2図に示すように共分散行列の繰返し更新処
理と、その共分散行列データのKL展開によって行われ
る。即ち、 なる演算を施すことによってその学習が行われる。
但し、Sは学習パターンであり、例えば64次元のベク
トルとして与えられる。またKはパターンSを学習する
前の共分散行列であり、K′は学習後の共分散行列であ
る。そしてWは正負の値をとる重み係数であり、正の場
合には上記共分散行列の特性各の入力パターンに対する
類似度を大きくする作用を呈し、また負ならばその類似
度を小さくする作用を呈する。
このような共分散行列の学習が、各認識対象カテゴリ毎
に複数のサンプルパターンを用いて複数回繰返して行わ
れ、この学習結果として求められた共分散行列ベクトル
に′をKLjm開してその固有値と固有ベクトルが計算
される。この学習とKLm開によって求められた固有値
とその固有ベクトルが、各認識対象カテゴリの認識辞書
とLノで前記辞書メモリ4に登録される。
尚、辞書メモリ4の記憶容量が満杯になったときには、
各カテゴリ毎にその認識パターンを前記外部メモリ7に
格納し、これを辞書メモリ4にロードするようにしても
良い。
本装置では、基本的には上述したようにして各カテゴリ
のfill辞書(辞書パターン)の学習が行われる。と
ころが上記KL展開は、ヤコビ法やハウスホルダースツ
ルム法、べき乗法等の計算法で実行されるが、一般にそ
の計算処理には多大な時間を必要とする。従って上述し
た共分散行列の更新処理を、成る程度の学習効果が得ら
れる回数だけ繰返し実行し、その共分散行列ベクトルを
KL展開して前記辞書メモリ4に登録する認識辞書の効
率のよい効果的な学習を行うようにしている。
学習部8は、このようにして認識辞書の成る程度の効果
のある学習を実現するべく、その学習に必要な入力パタ
ーン数を各カテゴリ毎に管理し、且つ既に学習処理に用
いられた入力パターンと、その入力パターン数を管理し
ている。そして、前記表示部5を介してその学習カテゴ
リ名と、現在までに認識辞書の学習に用いた入力パター
ン数等を、例えば第3図に示すように表示してその学習
に必要なパターンの入力を促している。この場合、発声
例メモリ9に登録された入力音声パターン例を同時表示
し、効果的な学習を可能とする入力パターンを得る為の
音声例を表示している。
具体的には、音声カテゴリrアjの認識辞書を学習する
場合、例えば前述した重み係数Wや、認識装置自体の処
理精度(ビット精度)等から、その学習に必要な入力パ
ターンが最低2011必要とすることが学習部8にて判
断される。尚、学習に必要な入力パターン数の判断は、
認識辞書の学習仕様に応じて定めれば良いものであり、
例えば認識辞書の学習に対する経験的知識を利用して各
認識対象カテゴリ毎に定めたり、或いは必ず10個以上
の入力パターンを用いて各認識対象カテゴリの認識辞書
の学習を行う等として定めることもできる。
学習部8はこのような必要人カバターン数の情報に従っ
て、その認識辞書の学習に既に利用した入力パターン数
から、その学習に必要な残りの入力パターン数を前記表
示部5を介してディスプレイ表示している。この結果、
オペレータは呈示されたカテゴリのOII辞書の学習に
必要な入力パターン数を知ることが可能となる。
この際、学習カテゴリ「アJを単音節として発声入力し
ただけでは、連続発声時における「ア」の発声パターン
変動を考慮した学習ができなくなる。つまり、音声にお
ける単音節はその前後の音節の影響を受けて比較的大き
な変動を示す。そこでこのような音節パターンの変動を
吸収するべく、上記単音節「ア」の前後に他の音節を付
加した単語を前記発声例メモリ9から得、これを音声パ
ターンの入力例として、その単語を前記表示部5を介し
て表示する。例えばrアjなる音声カテゴリのm識辞書
を学習する場合には、この「ア」を含む 「しあい」 「きあつ」「シあげ」・・・等の単語の発
声入力を促す。これらの単語の表示は、1つづつ選択的
に表示しても良いし、或いは複数の単語を表示し、カー
ソル等で順次指定するようにしても良い。また表示され
た複数の単語の中から、オペレータが自ら選択指定して
、その指定単語を発声入力するようにしても良い。
しかして装置側では、このような学習用の音声入力時に
は、その入力音声のパターン中から学習対象としている
カテゴリの入力パターンを抽出し、これを前記メモリ部
6に蓄積し、学習部8に与えている。この結果、その入
力パターンに従う前述した認識辞書の学習が実行される
ことになる。
以上説明したように本装置によれば、認識辞書の効果的
な学習に必要な、入力パターンの数がオペレータに呈示
され、またその入力パターンを得るに効果的な発声例(
単語)がオペレータに指示されるので、オペレータはそ
の指示に従って音声を発声入力するだけで良い。また学
習部8では認識辞書の学習に必要な入力パターンだけを
効果的に得、これを用いてその学習処理を実行すること
になるので、不本意な入力パターンによって学習誤差の
発生を招くことがない。しかも学習効果の向上を図り得
る有効な入力パターンのみを効率よく、且つ必要個数収
集することができるので、その認識辞書の効果的な学習
を行い得る。
従って認識辞書の無駄の少ない効率的な学習を行い、そ
の認識率の向上を図り得る等の実用上多大なる効果が奏
せられる。
尚、本発明は上述した実施例に限定されるものではない
。例えば認識辞書の学習に必要な入力パターン数の判断
アルゴリズムは、i!識辞書の構成等に応じて定めれば
良いものである。また手書き文字!l!!識等のパター
ン認識装置における認識辞書の学習にも同様に適用可能
なことは勿論のことである。更には、学習に必要なパタ
ーン入力の呈示法も種々変形することができる。要する
に本発明はその要旨を逸脱しない範囲で種々変形して実
施することができる。
【図面の簡単な説明】
第1図は本発明の一実施例装置の概略構成図、第2図は
実施例装置における認識辞書の学習アルゴリズムを示す
図、第3図は実施例装置におけるパターン入力を促すメ
ツセージ出力の例を示す図である。 1・・・音声入力部、2・・・特徴抽出部、3・・・!
i!識部、4・・・辞書メモリ、5・・・表示部、6・
・・メモリ部、1・・・外部メモリ、8・・・学習部、
9・・・発声例メモリ。 出願人代理人 弁理士 鈴江武彦 113rl!J

Claims (4)

    【特許請求の範囲】
  1. (1)入力パターンと認識辞書とを照合して上記入力パ
    ターンを認識処理する手段と、この認識結果に基いて上
    記入力パターンを用いて特定カテゴリの認識辞書を学習
    する手段と、この特定カテゴリの認識辞書の学習に用い
    られた入力パターン数を管理して該特定カテゴリのパタ
    ーンの入力を促す手段とを具備したことを特徴とするパ
    ターン認識学習装置。
  2. (2)特定カテゴリのパターンの入力を促す手段は、特
    定カテゴリ名と、その特定カテゴリの認識辞書の学習に
    必要なパターン数とをディスプレイ表示するものである
    特許請求の範囲第1項記載のパターン認識学習装置。
  3. (3)特定カテゴリのパターンの入力を促す手段は、該
    特定カテゴリを含むデータ入力例をディスプレイ表示し
    て行われるものである特許請求の範囲第1項記載のパタ
    ーン認識学習装置。
  4. (4)入力パターンと認識辞書との照合によるパターン
    認識処理は、複合類似度法または部分空間法により行わ
    れるものであって、特定カテゴリの認識辞書の学習処理
    は、共分散行列の更新とKL展開法とを用い、その特性
    核または上記共分散行列に対する入力パターンの寄与率
    を変化させて行われるものである特許請求の範囲第1項
    記載のパターン認識学習装置。
JP60091401A 1985-04-27 1985-04-27 パタ−ン認識学習装置 Pending JPS61249182A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP60091401A JPS61249182A (ja) 1985-04-27 1985-04-27 パタ−ン認識学習装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP60091401A JPS61249182A (ja) 1985-04-27 1985-04-27 パタ−ン認識学習装置

Publications (1)

Publication Number Publication Date
JPS61249182A true JPS61249182A (ja) 1986-11-06

Family

ID=14025355

Family Applications (1)

Application Number Title Priority Date Filing Date
JP60091401A Pending JPS61249182A (ja) 1985-04-27 1985-04-27 パタ−ン認識学習装置

Country Status (1)

Country Link
JP (1) JPS61249182A (ja)

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS63223693A (ja) * 1987-03-12 1988-09-19 富士通株式会社 音韻パタ−ン登録方法
JPS63289685A (ja) * 1987-05-21 1988-11-28 Toshiba Corp パタ−ン認識装置
JPH08248975A (ja) * 1995-03-09 1996-09-27 Nec Corp 標準パターン学習装置およびこの装置を使用した音声認識装置
JP2000259170A (ja) * 1999-02-10 2000-09-22 Internatl Business Mach Corp <Ibm> 音声認識システムにユーザを登録する方法および装置
JPWO2023101000A1 (ja) * 2021-12-03 2023-06-08

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5734046B2 (ja) * 1978-11-18 1982-07-21
JPS57204598A (en) * 1981-06-11 1982-12-15 Matsushita Electric Industrial Co Ltd Voice recognizer
JPS5946699A (ja) * 1982-09-09 1984-03-16 富士通株式会社 単語音声登録装置
JPS6057898A (ja) * 1983-09-09 1985-04-03 電子計算機基本技術研究組合 音声登録方式
JPS6073593A (ja) * 1983-09-29 1985-04-25 富士通株式会社 音韻辞書作成方式

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5734046B2 (ja) * 1978-11-18 1982-07-21
JPS57204598A (en) * 1981-06-11 1982-12-15 Matsushita Electric Industrial Co Ltd Voice recognizer
JPS5946699A (ja) * 1982-09-09 1984-03-16 富士通株式会社 単語音声登録装置
JPS6057898A (ja) * 1983-09-09 1985-04-03 電子計算機基本技術研究組合 音声登録方式
JPS6073593A (ja) * 1983-09-29 1985-04-25 富士通株式会社 音韻辞書作成方式

Cited By (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS63223693A (ja) * 1987-03-12 1988-09-19 富士通株式会社 音韻パタ−ン登録方法
JPS63289685A (ja) * 1987-05-21 1988-11-28 Toshiba Corp パタ−ン認識装置
JPH08248975A (ja) * 1995-03-09 1996-09-27 Nec Corp 標準パターン学習装置およびこの装置を使用した音声認識装置
JP2000259170A (ja) * 1999-02-10 2000-09-22 Internatl Business Mach Corp <Ibm> 音声認識システムにユーザを登録する方法および装置
JPWO2023101000A1 (ja) * 2021-12-03 2023-06-08
WO2023101000A1 (ja) * 2021-12-03 2023-06-08 パナソニックIpマネジメント株式会社 音声登録装置および音声登録方法

Similar Documents

Publication Publication Date Title
CN109817246B (zh) 情感识别模型的训练方法、情感识别方法、装置、设备及存储介质
CN107564511B (zh) 电子装置、语音合成方法和计算机可读存储介质
Deb et al. Emotion classification using segmentation of vowel-like and non-vowel-like regions
US6208971B1 (en) Method and apparatus for command recognition using data-driven semantic inference
US11049495B2 (en) Method and device for automatically learning relevance of words in a speech recognition system
US20170358306A1 (en) Neural network-based voiceprint information extraction method and apparatus
US11282511B2 (en) System and method for automatic speech analysis
US11935523B2 (en) Detection of correctness of pronunciation
JP7544989B2 (ja) ルックアップテーブルリカレント言語モデル
CN108711421A (zh) 一种语音识别声学模型建立方法及装置和电子设备
CN115132170B (zh) 语种分类方法、装置及计算机可读存储介质
CN113035231A (zh) 关键词检测方法及装置
KR20050070073A (ko) 서면 텍스트로부터의 조정가능 신경망 기반 언어 식별
CN105702251A (zh) 基于Top-k加强音频词袋模型的语音情感识别方法
Chuctaya et al. Isolated automatic speech recognition of Quechua numbers using MFCC, DTW and KNN
CN115631748A (zh) 基于语音对话的情感识别方法、装置、电子设备及介质
CN110853669A (zh) 音频识别方法、装置及设备
CN116778918B (zh) 命令词的置信度的确定方法、确定装置与处理器
Sayem Speech analysis for alphabets in Bangla language: automatic speech recognition
Nazir et al. An Arabic mispronunciation detection system based on the frequency of mistakes for Asian speakers
Kocsor et al. A nonlinearized discriminant analysis and its application to speech impediment therapy
Liu et al. Character-aware sub-word level language modeling for uyghur and turkish ASR
CN117649861A (zh) 基于帧级别情感状态对齐的语音情感识别方法和系统
CN113658609B (zh) 关键字匹配信息的确定方法、装置、电子设备和介质
KR102838784B1 (ko) 인공지능을 이용하여 영어 문장에 대해 자동으로 검토 및 채점을 수행하는 시스템 및 방법