JPS59229600A - 音声認識装置 - Google Patents
音声認識装置Info
- Publication number
- JPS59229600A JPS59229600A JP59050789A JP5078984A JPS59229600A JP S59229600 A JPS59229600 A JP S59229600A JP 59050789 A JP59050789 A JP 59050789A JP 5078984 A JP5078984 A JP 5078984A JP S59229600 A JPS59229600 A JP S59229600A
- Authority
- JP
- Japan
- Prior art keywords
- state
- word
- array
- template
- incoming
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 238000000034 method Methods 0.000 title claims description 34
- 230000015654 memory Effects 0.000 claims description 14
- 238000003491 array Methods 0.000 claims description 13
- 230000006870 function Effects 0.000 claims description 6
- 230000008569 process Effects 0.000 description 22
- 238000012360 testing method Methods 0.000 description 8
- 230000005236 sound signal Effects 0.000 description 6
- 101100496105 Mus musculus Clec2e gene Proteins 0.000 description 5
- 239000002184 metal Substances 0.000 description 5
- 229910052751 metal Inorganic materials 0.000 description 5
- 101100047785 Arabidopsis thaliana TT16 gene Proteins 0.000 description 4
- 238000010586 diagram Methods 0.000 description 4
- PCHJSUWPFVWCPO-UHFFFAOYSA-N gold Chemical compound [Au] PCHJSUWPFVWCPO-UHFFFAOYSA-N 0.000 description 4
- 239000010931 gold Substances 0.000 description 4
- 229910052737 gold Inorganic materials 0.000 description 4
- 210000003128 head Anatomy 0.000 description 4
- 230000004044 response Effects 0.000 description 4
- 101001016849 Mus musculus Heat shock protein HSP 90-alpha Proteins 0.000 description 3
- 101000985444 Mus musculus Heat shock protein HSP 90-beta Proteins 0.000 description 3
- 230000008859 change Effects 0.000 description 3
- 238000011156 evaluation Methods 0.000 description 3
- 238000002360 preparation method Methods 0.000 description 3
- 239000000047 product Substances 0.000 description 3
- 238000003860 storage Methods 0.000 description 3
- 238000009825 accumulation Methods 0.000 description 2
- 230000008901 benefit Effects 0.000 description 2
- 238000011161 development Methods 0.000 description 2
- 238000012854 evaluation process Methods 0.000 description 2
- 238000005259 measurement Methods 0.000 description 2
- 238000010606 normalization Methods 0.000 description 2
- 238000012545 processing Methods 0.000 description 2
- 238000005070 sampling Methods 0.000 description 2
- 238000010183 spectrum analysis Methods 0.000 description 2
- 230000007704 transition Effects 0.000 description 2
- 238000013519 translation Methods 0.000 description 2
- 230000001755 vocal effect Effects 0.000 description 2
- IEOJHRAIYGJUBG-UHFFFAOYSA-N 3-methyl-1-(1-phenylcyclohexyl)piperidine Chemical compound C1C(C)CCCN1C1(C=2C=CC=CC=2)CCCCC1 IEOJHRAIYGJUBG-UHFFFAOYSA-N 0.000 description 1
- 235000001674 Agaricus brunnescens Nutrition 0.000 description 1
- 101100064317 Arabidopsis thaliana DTX41 gene Proteins 0.000 description 1
- 101100505882 Arabidopsis thaliana GSTF12 gene Proteins 0.000 description 1
- 101100398584 Arabidopsis thaliana TT10 gene Proteins 0.000 description 1
- 241000196324 Embryophyta Species 0.000 description 1
- 241001634549 Microcos Species 0.000 description 1
- 241000933095 Neotragus moschatus Species 0.000 description 1
- 241000277269 Oncorhynchus masou Species 0.000 description 1
- 102100030551 Protein MEMO1 Human genes 0.000 description 1
- 101710176845 Protein MEMO1 Proteins 0.000 description 1
- 229920002472 Starch Polymers 0.000 description 1
- 238000004458 analytical method Methods 0.000 description 1
- 230000003416 augmentation Effects 0.000 description 1
- 238000011888 autopsy Methods 0.000 description 1
- 230000015572 biosynthetic process Effects 0.000 description 1
- 239000003795 chemical substances by application Substances 0.000 description 1
- 230000001149 cognitive effect Effects 0.000 description 1
- 238000004590 computer program Methods 0.000 description 1
- 238000012937 correction Methods 0.000 description 1
- 230000007423 decrease Effects 0.000 description 1
- 238000013461 design Methods 0.000 description 1
- 230000008030 elimination Effects 0.000 description 1
- 238000003379 elimination reaction Methods 0.000 description 1
- 235000013305 food Nutrition 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 239000010985 leather Substances 0.000 description 1
- 238000004519 manufacturing process Methods 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- SYHGEUNFJIGTRX-UHFFFAOYSA-N methylenedioxypyrovalerone Chemical compound C=1C=C2OCOC2=CC=1C(=O)C(CCC)N1CCCC1 SYHGEUNFJIGTRX-UHFFFAOYSA-N 0.000 description 1
- 238000012544 monitoring process Methods 0.000 description 1
- NJPPVKZQTLUDBO-UHFFFAOYSA-N novaluron Chemical compound C1=C(Cl)C(OC(F)(F)C(OC(F)(F)F)F)=CC=C1NC(=O)NC(=O)C1=C(F)C=CC=C1F NJPPVKZQTLUDBO-UHFFFAOYSA-N 0.000 description 1
- 230000000737 periodic effect Effects 0.000 description 1
- 210000001747 pupil Anatomy 0.000 description 1
- 229920006395 saturated elastomer Polymers 0.000 description 1
- 238000000926 separation method Methods 0.000 description 1
- 238000010374 somatic cell nuclear transfer Methods 0.000 description 1
- 230000003595 spectral effect Effects 0.000 description 1
- 235000019698 starch Nutrition 0.000 description 1
- 239000008107 starch Substances 0.000 description 1
- 239000013589 supplement Substances 0.000 description 1
- 238000012549 training Methods 0.000 description 1
- 238000012546 transfer Methods 0.000 description 1
- 235000021419 vinegar Nutrition 0.000 description 1
- 239000000052 vinegar Substances 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/10—Speech classification or search using distance or distortion measures between unknown speech and reference templates
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Signal Processing (AREA)
- Telephonic Communication Services (AREA)
- Machine Translation (AREA)
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
この発明は、音声認識コンピュータに関するものであり
、かつより特定的には、話者独立型認識コンピュータに
関する。特に、この発明は、特定された応用例のために
非常に安価で製造され得る、注意深く選択された詔案を
有Jる1ilJ者独立型の音声utAのために用いられ
るマイクロコンピュータに関する。 人の声を認識するコンピュータの使用は、この30年間
にわたって発達してきて、増加したB?jlXを認iす
ることができる非常に複雑な]ンビュータ化されたシス
テムが提供されるまでに到っている。さらに、実質的な
努力が、一連の帯域通過フィルタを用いることによって
入来音声信号のスペクトル分析に基づいて行なわれてき
ている。各帯域通過フィルタは、システムフロンhエン
ドとして、異なる周波数帯域を選択する。帯域通過フィ
ルタレンジの各々における信号レベルj:たは音声出力
は、典型的には、周期的な時間間隔でサンプリングされ
て、ワード(単語)またはフレーズ(句)に対する、周
波数対時間音声71−リクスを提供する。多種多様の時
間正規化技術が、それらの時間持続期間にかかわらずワ
ードを認識するために用いられてきており、かつ周波数
正規化技術は話者独立性を達成する試みにおいて用いら
れてきている。 もちろん、このずべての発達により、非常に複雑でかつ
費用のかかる装置が出現し、それは、音声認識の利益を
、はとんどの消費者製品のための価格範囲を越えるもの
とする。本質において、音声認識コンピュータは、複雑
な装置の!こめの入力システムおよび研究所の道具に限
定されてきて、そのシステムは、入力媒体として複雑な
音声認識システムの費用を正当化するために非常に高い
価格である。この発達とともに、多種多様な消費者製品
のための簡単な音声認識装置の利用が看過されてきた。 さらに、より複雑なシステムのために用いられる技術は
、はとんどの認識システムのための記憶条件だ
、かつより特定的には、話者独立型認識コンピュータに
関する。特に、この発明は、特定された応用例のために
非常に安価で製造され得る、注意深く選択された詔案を
有Jる1ilJ者独立型の音声utAのために用いられ
るマイクロコンピュータに関する。 人の声を認識するコンピュータの使用は、この30年間
にわたって発達してきて、増加したB?jlXを認iす
ることができる非常に複雑な]ンビュータ化されたシス
テムが提供されるまでに到っている。さらに、実質的な
努力が、一連の帯域通過フィルタを用いることによって
入来音声信号のスペクトル分析に基づいて行なわれてき
ている。各帯域通過フィルタは、システムフロンhエン
ドとして、異なる周波数帯域を選択する。帯域通過フィ
ルタレンジの各々における信号レベルj:たは音声出力
は、典型的には、周期的な時間間隔でサンプリングされ
て、ワード(単語)またはフレーズ(句)に対する、周
波数対時間音声71−リクスを提供する。多種多様の時
間正規化技術が、それらの時間持続期間にかかわらずワ
ードを認識するために用いられてきており、かつ周波数
正規化技術は話者独立性を達成する試みにおいて用いら
れてきている。 もちろん、このずべての発達により、非常に複雑でかつ
費用のかかる装置が出現し、それは、音声認識の利益を
、はとんどの消費者製品のための価格範囲を越えるもの
とする。本質において、音声認識コンピュータは、複雑
な装置の!こめの入力システムおよび研究所の道具に限
定されてきて、そのシステムは、入力媒体として複雑な
音声認識システムの費用を正当化するために非常に高い
価格である。この発達とともに、多種多様な消費者製品
のための簡単な音声認識装置の利用が看過されてきた。 さらに、より複雑なシステムのために用いられる技術は
、はとんどの認識システムのための記憶条件だ
【プで、
実質的にメモリの価格それ自体がそのシステムを消費者
市場の範囲を越えるので、比較的簡単な音声認識システ
ムには役立たない。 伯のシステムが音声認識のためにスペクトル分析の有用
性を認めているが、これらのシステムは、そのシステム
の詔象を拡げるために、I」音UおよびOならびに子音
T J5よびBのような比較的に<似た音声のエレメン
トを認識ツるように試みられてきた。 この発明は、1983年6月14日に発行された、アメ
リカ合衆国特許番号第4,388,495に開示される
音声認識マイクロコンピュータに関する改良である。親
出願および本件出願はともに、低価格の話者独立型音声
認識マイクロコンピュータを提供するものである。親出
願に開示される装置の場合、実質的に話者独立型が可能
であったが、2人の話者は、彼等が話した方法が非常に
異なっているため、一方の話者が成るワードの部分を声
に出さず、他の話者が声に出したときは、=1ンビュー
タは一連の付加的な記憶されたワードテンプレートが付
加えられない限り、同じワードとしてそれらを認識する
ことができなかったことが、検査の結果明らかになった
。この発明のマイクロコンピュータは、たとえワードが
実質的に異なる方法で話されても、付加的な記憶された
ワードテンプレートを必要とすることなり、IIJjじ
ワードの認識を可能にする。 この発明の一局面において、入来J−るγ′1声を、分
類された音声状態のアレイに分割しかつ各音声状態の長
さを測定して対応1゛る入米状態長さアレイを形成する
ための回路を含む音声認識装置が提供される。そして、
入来する音声状態アレイの分類を、記憶されたテンブレ
ードア。レイの分類で比較する働きをする回路が設けら
れる。記憶されたテンプレートは、分類されたワード状
態の第1のアレイと、対応する記憶されたワード状態の
少なくともいくつかの長さを示す一連の値からなる第2
のアレイとを含む。比較回路に応答して、他の回路は、
入来する音声状態アレイと、テンプレートワード状態ア
レイとの間の一致の度合の尺瓜を発生し、前記テンプレ
ートワード状態アレイは、入来音声状態と、一致する分
類を有するこれらの状態のための対応するテンプレート
ワード状態との間の長さの差の関数である。 この発明の他の局面において、この発明の音声認識装置
は話されたワードをとり、そのワードを一連の短い、好
ましくは10ミリ秒のワード部分に分割する。10ミリ
秒のワード部分の各々の間の話されたワードの平均周波
数は、音声信号パターンがしぎい値レベルと交差する回
数を計数づることによって決定される。このカウントは
零交差カウントとして示される。各10ミリ秒ワード部
分は、次いで、摩擦音型、母音型または無音としてその
平均周波数に基づいて分類される。一般に、周波数がよ
り高い周波数であれば、そのワード部分は摩擦音型とし
て分類され、それが中間稈度の周波数であれば、ワード
部分は母音型として分類され、かつそれが低いまたはO
の周波数であれば、そのワード部分は無音であるとして
分類される。 コンピュータはこれらのワード部分を集めて分類するの
で、それは絶えず、1組のワード部分が、共に、与えら
れた分類のワード状態へグループ分けされることがされ
るように3個の可能な分類の1つに分類される短いワー
ド部分が十分に接近して配置されているかどうかを決定
するようにチェックしている。一旦それがワード状態が
存在するということを決定すると、その状態の分類およ
びその状態の長さく時間持続期間)がマイクロコンピュ
ータにより記憶される。マイクロコンピュータは話され
たワードの10ミリ秒サンプルをとり、それらを分類し
かつ状態が認識されるべきか否かを決定し続ける。 いくつかの非無音状態が認識されかつそれらのそれぞれ
の長さとともに記憶された後、コンビ」。 −タは連続的にそのワードの終わりのためテストする。 そのワードの終わりは、10ミリ秒の部分の十分に長い
ストリングが無音であると分類されたときに決定される
。たとえば、この発明の好ましい実施例では、無音であ
るとして分類された16個の連続する10ミリ秒のワー
ド部分が、マイクロコンピュータがそのワードが完了し
たということを見出す前に必要とされる。 完了したワードが記憶装置に入れられたという表示があ
るとすぐに、マイクロコンピュータは、すぐに、入力さ
れた音声ワードから集められた状態のアレイを、マイク
ロコンピュータに永久に記憶される一連のワードテンプ
レートと比較する。 たとえ異なる話者によって全く異なつ1C風に話されて
も、それらのワードを同じものであると認識することが
できるのがこの比較プロセスである。 簡単な例がこのポイントを例示する。話されたワード゛
’ligbts”を認識することが望まれているものと
想定する。この発明のマイクロコンピュータへ話される
ときのこのワード゛’l1lJIItS”は3個の状態
のアレイをしばしば生じる。第1の状態は母音型であり
、第2の状態は無音であり、かつ第3の状態が摩擦音型
である。しかしながら、成る人は、そのワード冒11J
hts”を“’1ice”として発音する。その結果生
じる状態アレイは2つの状態しか有しない、すなわち、
第1に母音型状態おJ:び第2に摩擦音型状態である。 “t′°音が形成されているので通常生じる無音状態が
省略された。しかしながら、無音状態はそのワード(こ
の例において)を識別するのに絶対的に必要とされない
ので、この発明のシステムは3個の状態アレイ、母音−
無音一摩擦音、または2状態アレイ、母音−摩擦音が見
出されるかどうかのワード認識を可能にする。 この融通性を与える1つの方法は、コンビ−1−夕が与
えられたフードであると認識しなIプればならない異な
る可能な入力状態アレイの各々をカバーするためより多
くのテンプレートを付加えることであろう。しかしなが
ら、話者間の非常に数多(の変動を有する任意のワード
に対しては、記憶容量が問題となる。 この発明の解決は、マイクロコンピュータが認識しよう
と意図される各ワードごとに各テンプレートの3個のア
レイを記憶することである。第1のアレイは任意のワー
ドに対するずべての可能なワード状態のリストである。 これらのワード状態は、それらが任意の話者の音声にお
いて生じるであろう順序でグループ分けされる。しかし
ながら、多くの場合、話されたワードの分析の後コンピ
ュータによって決定されるワード状態アレイにおいて正
確に見出されるであろうよりも、テンプレートワード状
態アレイに、より多くのワード状態がある。これは、ワ
ード゛’ l ights” ’を’1ice”として
言う人が、コンピュータが彼のワード’1ice”をち
ょうど2状態(母音−摩擦音)のアレイで登録するとい
うことを経験して知るであろう場合の、上述の例におい
て図解される。°“lights”のためのワードテン
プレートのワード状態アレー7は、しかしながら、可能
な3個のすべての状態、母音−無音−摩擦音を含む。 テンプレートにおける第2のアレイはテンプレートのワ
ード状態アレイの各状態へ割当てられる一連の重みまた
は数値であるa ”3えられたワードの認識において非
常に重要である状態に対しくはより高い重みが与えられ
、かつ与えられたワードの認識においてそれほど重要で
ない状態に対してはより低い重みが与えられる。上述の
例では、本来の母音型および最終の摩擦&型状態にはよ
り高い重みが割当てられ、他方、さほど重要ぐない中央
の無音状態にはより低い重みが割当てられる。 第3のアレイは平均的な話者が特定の状態を発生するの
に費す時間の長さを示J−各状態ごとの数を提供づる。 たとえば、ワード’lights”において、平均的な
話者は母音状態において220ミリ秒、無音状態におい
て20ミリ秒および摩擦音状態において120ミリ秒を
費すということがわかっている。 上述したように、状態アレイが未知の入力ワードのため
に形成された後、コンピュータは、テンプレートアレイ
のエレメントを入力音声アレイのエレメントで比較する
。前述したように、入力ワードはそのワードの各状態の
分類を示すワード状態アレイと、話者が各別々の状態を
発生した時間の量を示す長さアレイとを有する。マイク
ロコンピュータの賄flkを表わす一連のテンプレート
の第1のテンプレートから始まり、コンピュータはまず
入力された話されたワードの第1の状態を、第1のテン
プレートワードの第1の状態と比較する。 第1の状態の分類が同じであれば、コンピュータはその
状態のための平均長さと、その状態のための実際の話さ
れた長さとの間の絶対的な差を計算する。この値が、次
いで、5COREの符号の付いた変数に既に記憶された
聞へ加えられる。もしこれが、そのワードのために比較
されている第1の状態であれば、その変数5COREは
前もってOにセットされていたであろう。 他方、そのテンプレートの第1の状態が入来するワード
の第1の状態と同じ分類を有していなければ、第1の状
態に対応する、重み付けするアレイの値は変数5COR
Eへ加えられるであろう。 第1の状態の比較が行なわれた後、コンピュータは第2
の状態を比較する。ワードテンプレートの第1の状態お
よび入来するワード状態アレイの第1の状態の分類が同
じであったならば、マイクロコンピュータは入来ワード
状態アレイの第2の状態を、テンプレートアレイの第2
の状態で比較するであろう。もし分類が同じであれば、
再び長さの差の絶対値が変数5COREへ加えられる。 もし一致がなければ、テンプレートワードアレイの第2
の状態へ割当てられる重みは変数5COREへ加えられ
るであろう。 もし第1状態の分類が本来的に一致しな(プれば、コン
ピュータはテンプレートアレイの第2の状態を、入来ワ
ード状態アレイの第1の状態と比較する。第2の比較の
ための状態数におけるこの不一致は、元の状態の不一致
が入来ワード状態アレイにない状態に起因したとの想定
に起因する。もしこのときに一致があれば、長さ間の差
の絶対値が5COREへ入れられ、もし分類間に一致が
なければ、テンプレートワードアレイの第2の状態へ割
当てられる重み番よ■す変S CORI=へ加えられる
。 テンプレート・ワードの終わりJ、たは入来ワードアレ
イの終わりに達りるJ、でこのプ1]レスが続く。 まず、テンブレー1−フフレイの終わりに達すると、入
来ワード状態7レイの残りの状態の良さが共に加えられ
かつ変数s c OREへ加えられる。これらの長さの
いずれか1つが任意のしきい値レベルの下であれば、間
違った伯が差し替えられ他の長さとともに合=1される
。もし最初に入来ワード状態アレイの終わりに3!¥り
ると、テンプレートワードの残りの状態にλ!l I、
i> iJる■みが其に加えらね、変数S COREへ
加えられる。 入力ワード状態アレイと第1のテンプレートワードのテ
ンブレートアレイとの比較を完了しI、:後、コンビ」
−夕は入来ワード状態アレイを第2のテンブレー1〜ア
レイで比較覆る。上述の比較に類似りる比較の後、変数
s c o r< IEの伯が変数5COREのための
前の(1t1と比較され、低い方の値に対応1゛るテン
ブレー1〜が正しいワードであるとして仮に示される。 マイクロコンピュータにおけるすべてのテンプレートが
入来ワード状態アレイと比較された後、最も低い5CO
REの伯を有するテンブレ・−トが認識されるべき最も
可能性のあるワードであるとして示される。このテンブ
レー!・のための変数S COREの値は、次いで、前
に決定されたしきい値と比較される。この値がこのしき
い値を越えていれば、そのワードは拒絶され、何のワー
ドも認識されない。しかしながら、その値がしきい値よ
りも低ければ、そのワードは、変数5COREのための
最も低い値を有するテンプレートに対応するワードであ
ると認識される。 ワード’lights”の場合、記憶されたテンプレー
トは3個のアレイを有する。第1のアレイ【よ3状態を
有するであろう。これらの状態は母音型、無音およびr
!Jtll音型であろう。各状態ごとに選択される対応
の重みはプログラマがそれら状態の各々に割当てた重要
性に依存する。発音“1ice’″がワード゛’lig
hts”のために認識されるべきでdりる状況では、第
2の状態は低い重みを割当Cられるであろう。したがっ
て、たとえば、重みアレイは10.7および10であっ
てもJ:い。上述したように、これらの状態のための平
均長さは経験的に決定される。したがって、長さアレイ
は22.2゜′12でもよい。これらの数は好ましい実
施例では10ミリ秒のユニットにある。もし入来するワ
ードがワード” l ights”を“1ice”とし
て発音する人によって話されたのならば、その入来Jる
ワード状態アレイは2状態、すなわら1つが母音型で1
つが摩擦音型を有するであろう。これらの状態の長さが
平均である(換言すれば、母音型状態に対応する長さが
220ミリ秒であり、摩擦音型状態に対応する長さが1
20ミリ秒である)と想定すると、入来ワードのための
長さのアレイは22および12であろう。したがって、
この入来ワード状態アレイがワード“’l1gM5”の
ためのテンプレートアレイと比較されると、次の結果が
生じる。 テンプレートにおける第1の状態は入来ワードの第1の
状態と比較され、その分類は同一であると判断されよう
。次いで、コンピュータはそれらの長さを比較し、それ
らもまた同一であろう。このように、変数5COREへ
加えられる量はOであろう。次のステップはテンブレー
1〜の第2の状態を入来ワード状態アレイの第2の状態
と比較することである。2つの状態の分類が異なるので
、テンプレートの第2の状態の重み(すなわち7)が変
数5COREへ加えられるであろう。次に、マイクロコ
ンピュータはテンプレートの第3の状態を入来ワードの
第2の状態と比較覆る。これらの状態は同じ分類であり
かつまた同じ長さのものであるので、変数5COREへ
は何の付加的な値も加えられない。その結果は、“冒i
ce”と発音されたワード゛lights”のための変
数5COREの値は7であろう。マイクロコンビュ°−
タテンプレートアレイにおける他のεrj柔ワードが正
しく設定されれば、これは最も低い点数でしきい値以下
でなければならない。コンピュータは、ワード”11g
11t s ″がRHされたということを示す。 このように、同じワードが、実質的に異なる発音をする
異なる話者によって話されたときにそのワードを同じワ
ードであると認識することができる低価格の音声認識マ
イクロコンピュータが開示される。 初めに第1図を参照Jると、もし入来する音声信号が、
10ミリ秒のペースでサンプリングされたならば、1キ
ロヘルツの正弦波周波数が、10ミリ秒について正に進
む10の零交叉カウントを与えるであろうということが
理解できる。同様に、5キロヘルツの周波数は、零交叉
しぎい値が、検知された正弦波の頂点の間にあるならば
、10ミリ秒について50の正に進むμ交叉カウンi−
を発生する。もし、音声パターンの羽1測において、過
度に限定される増幅器が用いられるならば、実質的にす
べての音声パターンが、その増幅器を飽和し、かつ零交
叉カウントを発生する。このように、過度に限定された
増幅器からの電気信号をモニタすることにより実現され
るその最後のカウントは、平均周波数測定を与える。第
2図にお【ノるブロック図に示されるように、この発明
のシステムにおいて、マイクロフォン11が、すべての
音声信号が零交叉データを発生するように飽和される高
利得のオーディオ増幅器13へ、オーディオ信号入力を
与える。この信号は、たとえばM Qtol・ola3
emiconductorsにより製造されるMC6
805P2マイクロコンピユータチツプのようなマイク
ロコンビコータチップ17のタイマ入力への線75に与
えられる。このタイマ人カフ5は、0.8ボルトのしき
い値電圧で負へ進む信号を検知し、そのため、もしオー
ディオ増幅器13が、飽和において5ポルl〜の出力を
与えるならば、そのタイマへの入力は、マイクロフォン
11に与えられる音声信号の平均スペクトル周波数に等
しい周波数で生ずるであろう。 マイクロコンピュータ17内で、リードオンリメモリ1
9が、認識されるべき単品に対するファームワードの音
声テンプレートと同様に、音yji認識システムのため
のファームウェアを含む。このように、台座認識システ
ムが理解づ′べさ°予め定められた選択された詔常が、
マイクロコンピュータ17の製造のときに、または少な
くともマイク[1コンピユータ17を販売する前に、リ
ードオンリメモリ19内に永久的に記憶される。このよ
うに、この音声認識装置を使用する間語葉の訓練がなさ
れず、かつしたがって、その語粟を認識可能な単語のグ
ループに予め設定しかつ音声認識システムを安価で生産
することを可能にづるために、初めの製造のときにその
仕事がなされる。 リードオンリメモリ19内に記憶されたファームウェア
に従って、第2図の音声認識システムは、第3図ないし
第8図のフローチャートにおいて表わされるプロセスに
よって、マイクロフォン11からの入来する音声データ
を分析する。 最初に第3図を参照すると、そのシステムは、最初マイ
クロコンビコータ17に電力が送られるとステップ11
1で初期設定される。この初期設定は、その装置のため
の出力ポートとして、第2図のボートA、BおよびC:
それぞれ21.23゜および25を指定する。これらの
ポート21ないし25の各々は、マイクロコンピュータ
17のための出力または入力として動作し得、かつこれ
らのポートの指定は、音声認識から生ずる出力データが
、ボートA、BおよびCのいずれかで与えられることを
可能にすると、いうことが理解できる。 この指定はステップ113で生じ、その後マイクロコン
ピュータ17のランダムアクセスメモリ27のレジスタ
に記憶された変数がステップ115で初期設定される。 第3図のフローチャー1−および第4図ないし第6図の
他のフローチャートは、分岐点からのようなシーケンス
のリターンをそのフローチャート内の多種なジャンプポ
イン1〜内に与えるリターンポイントTT16.117
のようなリターンポイントを含む。 ステップ115で初期設定される変数は、以下を含む:
F、CNTは、摩擦音型カウントであり、かつ非常に高
い周波数または摩擦音型音声エネlレギを有する10ミ
リ秒の間隔の数を規定する。VCNTは、非常に低い周
波数の音声パワーを有づる母音型10ミリ秒間隔をカラ
ン1〜iIるために用いられる変数である。5CNTは
、実質的に音声内容を有さない10ミリ秒の無音の間隔
をカウントするために用いられる変数である。Xは、音
声パ少−ンを認識するために用いられる状態シーケンヌ
内で連続する状態(摩擦音型、母音型、無音)を数で識
別するために用いられるポインタ変数である。蛯数Nは
、入来する単語に対する状態の総数を規定する。 ステップ119において、1対のアレイが初期設定され
る。アレイSEG (X)は、入来する単語に対する実
際の状態のジ−タンス、すなわち摩擦音型、母音型また
は無音のような各セグメントを識別する各ゼグメン1〜
Xに対するデータを含む。 アレイVOWL (X)は、状態の長さ、すなわち特定
の状態として識別されたレグメントX内の10ミリ秒の
期間の数を規定する。 これらの変数およびアレイは、以下の表により、よりよ
く理解でき得る。 紅 5EG(X)’:摩擦音型−2 母音型 =1 無音 −〇 単語:5ix N=4 上の表から、SEG (X)は、その状態が摩擦音型、
ずなわら主に高い周波数の音響的エネル−1゛であるな
らば、1つの単語内の特定の状態に対して2として規定
されることがわかる。同様に、もしその単語の状態が、
主に母音型ならば、S[G(X)は、1として規定され
、一方Oが無音状態を規定づ−る。以上に示されるよう
に、単語゛six”対して、典型的な発音にJ5いて、
Nが4に等しいような4つの連続的な状態がある。1か
ら4のXの値に対して、SEG (X)は、シーケンス
2102 、すなわち摩擦音型、母音型、無音、摩擦
音型である。単語“”six”の最初の“S″は、11
X”が1に等しいところで摩擦音型状態を与える。単
語sixにおける母音は、Xが2に等しいところで母音
型状態を与える。単語sixにおけるX音の形成の前に
、摩擦音的なXを発生するためにエネルギが蓄積される
ときに、声道は閉じられてX=3でSEG (X)=O
により規定される瞬間的な無音を生ずる。この短い無音
の後に、X=4でSEG (X)=2に示される摩擦音
型X音が続く。 アレイVOWL (X)は、単語sixの各状態の持続
期間を規定する値Q+ 、Q2 、Q、、Q、を記憶す
る。 以下の説明からJ:り理解できるように、たとえば、X
=1またはX=4で摩擦音型状態を規定するために、摩
擦音型の音声エネルギは、予め定められた持続期間を有
しなければならない。この持続期間は、摩擦音型エネル
ギが生ずる間の10ミリ秒時間の期間をカウントする変
数FONTにより計測される。同様に、上記の例におい
てX=2の母音型状態は、母音型の平均周波数が予め定
められた持続期間の間存在すること必要とし、それは変
数VCNTを用いて記憶される。変数5CNTは、同様
の態様で無音持続期間をカウントするために用いられる
。 第3図に示されるシーケンスを参照すると、ステップ1
15および119における変数およびアレイの初期設定
に続いて、マイクロプロレザ1フ内の零交叉カウンタ3
1が、ステップ121で開始される。これによって、カ
ウンタ31は、高利得のオーディオ増幅器13がプリス
ケーラ33のしきい値、この例では0.8ポル1−を横
切るごとに増分される。リターンポイントT12は、第
3図において123で示され、かつ上)ホしたようにこ
のシステム内のルーピングを与えるために用いられる。 ステップ125において、10ミリ秒の遅延が、零、交
叉カウンタがステップ121で始動また後に′すぐに開
始される。この10ミリ秒の遅延は、第2図に示される
6タイマ31およびタイマ制御器35により計測される
。この10ミリ秒遅延の終わりに、第2図のRAM27
にお、いて記憶された変数ZCRAが、カウンタ31内
のカウント、すなわちこの10ミリ秒期間の間の合計の
零交叉カウントに等しくされる。ステップ127で示さ
れるようにこの値が記憶されて、零交叉カウンタ31が
、すぐにリセットされ、かつ再びステップ129で始動
し、そのため次の10ミリ秒期間のための零交叉データ
が、累算され、それとともにRAM27において変数Z
CRAとして記憶された最初の10ミリ秒期間からの零
交叉データが分析される。このマイクロ処理システムは
、充分早(、それが最初の10ミリ秒の時間データに関
係しながら、ステップ125にお1プる10ミリ秒遅延
の終わる前に処理のすべての残りの部分を完了すること
ができる。このように、以下に示される説明かられかる
ように、この最初の10ミリ秒データが分析された鴇、
プログラムは、ポイントTT2,123に戻り、ステッ
プ125における次の10ミリ秒期間の終わるのを持ち
、そのため次の零交叉カウントがステップ127で記録
され得る。 入来する零交叉カウントを分析する第1のステップは、
このカウントと2とを比較することである。もしこの零
交叉カウントが2よりも小さいならば、第1図に示され
るように、1iA75上でそのシステムに入る主なエネ
ルギは、200ヘルツよりも低く、また零交叉がない場
合には存在しない。 これは、無音期間として解釈される。このように、ステ
ップ131で行なわれる比較は、70−ヂヤートの分岐
ステップを規定し、もし零交叉カウントが2よりも小さ
いならばステップ133への続行した処理を指示し、か
つもし零交叉カウントが2を越えるならばそれをルーピ
ングポイント「T9.135へ向ける。すなわち、もし
、この10ミリ秒期間の間に、線75(第2図)上の入
来信号が、無音を示すならば、そのシーケンスはステッ
プ133で続行する。他方、もし認識可ロヒな音声が存
在するならば、そのプログラムはT79゜135ヘジヤ
ンプするであろう。 もし、この特定の10ミリ秒期間に対して、ZCRAレ
ジスタ位置に記憶される零交叉カウントが2よりも小さ
いなら、すなわち無音を示すならば、ステップ133は
、変数5CNT、無音カウンティング変数を増分し、そ
のためこの変数は今1に等しく、1つの無音10ミリ秒
期間を示す。 以下の説明から明らかなように、変数5CNTは、10
ミリ秒の無音の増分の合計数をカウントして実際の無音
状態が存在するかどうかを決定するために用いられる。 もちろん、今説明されているシーケンスのポイントで、
もしこの全プロセスがちょうど始まっているところなら
ば、この最初の無音の増分は、認識されるべき音声が未
だ始まっていないということを示す。このことは、ステ
ップ137において一1現在のセグメント、すなわちモ
ニタされた最も最近の状態が、0すなわち無音に等しい
かどうかを判断づるために、1直5EG(X)とOとを
比較する。プログラムオペレーションの初期におけるこ
の例では、SEG (X)は、ステップ119でOに等
しくされたので、分岐ステップ137は、そのシーケン
スにポイントT712゜139において続行するように
指示する。このリターンポイントTT12.139は、
第3図りフローチャートにおいて後で示されるリターン
ポイント139へのそのシーケンスにおけるジャンプを
与える。上述したように、今無音状態にあり、かつ他の
無音増分を計測しステップ133で無音カウントを増分
したので、FCNT変数および■CNT変数が、ステッ
プ141でOにセットされる。その合計の無音カウント
は、次にステップ143で、16の10進数に等しい1
6進数字10と比較される。要するに、このステップ1
43は、10ミリ秒の16倍すなわち160ミリ秒の合
泪した無音期間を示す16にその無音カウントが達した
かどうかを判断する。もし無音カウントが16よりも小
さいならば、そのプログラムは、」二連したリターンポ
イントTT2.123に分岐してより大きな零交叉、1
0ミリ秒データを得る。しかしながら、もし16の無音
カウントがあれば、そのシーケンスはステップ145で
続行される。 ステップ145において、変数Xは、何らかの状態がこ
の単語に対して記録されたかどうかを判断するためにO
と比較される。本質的に、このステップ145は、その
シーケンスが単語の最初の部分を今なお持っているかど
うかを判断するためのテストである。もしXが0に等し
いならば、そのプログラムはリターンポイントTT16
.117に戻され、そこで変数およびアレイがステップ
115′および11って再び初期設定されかつデータ収
集がステップ121で再び始まる。 しばらくすると成るポイントで、プログラムが上述した
シーケンスを介して連続してループしていた後、それを
各160ミリ秒の無音ごとに再び初期設定し、単語が話
されて、最初の右意義な零交叉データを線75(第2図
)に与えられる。10ミリ秒のサンプリング期間が、2
以上にZC’RA零交叉カウントを与えるときのポイン
トにJ3いて、ステップ131は、そのプログラムを分
岐してポイントTT9.135に戻す。このリターンポ
イントT79.135は、第4図において最初のステッ
プとして示される。 第4図は、現在のサンプルが、線75(第2図)で入来
する音声が無音でないことを示したとぎ、ポイントT7
9.135において始まるのみである。今、その音が、
この10ミリ秒間隔において摩擦音型または母音型かど
うかが判断されなければならない。このテス1〜は、現
在の状態5EG(X)と0どを比較する分岐ステップ1
47で始まる。もし、この例において、そのシーケンス
が音声の最初にあるならば、SEG (X)が、ステッ
プ119においてOにセットされかつしたがってそのシ
ーケンスが分岐ステップ11!I9で続行することが思
い出される。このステップにおいて、零交叉カウント、
ZCRΔは、16進10または10進16と比較される
。もしその零交叉カウントがステップ131で判断され
たように2よりも大きくかつ16よりも小さいならば、
第1図にd5いて示されるように、検査される10ミリ
秒期間の間のその平均周波数は、200ヘルツ以上でか
つ1600ヘルツ以下であり、さらにそれは母音型音声
として解釈される。このように、リターンポイント15
1を通った後、ステップ153は、母音型10ミリ秒間
隔をカウントするために用いられる変数VCN’−1−
を増分する。ステップ155において、変数VCNTの
値、すなわち母音型10ミリ秒間隔の合計数は、60ミ
リ秒の母音型間隔があるかどうかを判断するため、6と
比較される。この例において、分岐ステップ155は、
我々がちょうど単語を始めたので、la V CN T
は、ステップ153において1に増分されたことを示し
、かつそのシーケンスは、リターンポイントTT2.1
23に戻されて付加的な10ミリ秒入力データを収集す
る。このように、1つの10ミリ秒サンプリング期間が
、母音型状態を規定するのに不充分であるので、状態は
未だ認識されない。 しかしながら、変数V CN Tは、200および16
00ヘルツの間の周波数でその主なエネルギを有してい
る音声でこの単語が現に始まるかどうかを判断するため
我々は母音型10ミリ秒期間をカウントし続けるように
、その関数V CN 1−が増分された。 もし、リターンポイントTT2.123に戻ることによ
って、今、5つの付加的な時間について、各時間が、ス
テップ153が変数VCNTを値6に増分するように上
述したシーケンスに従う−bのと仮定すると、そのシー
ケンスはステップ152へ続く。ステップ152におい
て、S[EG(X)が値2と比較されて、先のワード状
態の分類がどのようなものであったかを決定する。この
理由は、そのワード状態の長さがどのようなものであっ
たかを決定したいからである。もし先のワード状態が摩
擦音型であれば、SEG (X)が2に等しいことがわ
かり、リターンポイントTT24.1’54を通過して
ステップ156へ進み、ステップ156にJINT、V
OWL (X) がFCN−1に等しくなるようにセッ
トされ、リターンポインj−王T25.15Bへ移る。 もし先の状態が無音であれば、SEG (X)は2に等
しくなく、ステップ160へ進み、ステップ160にお
いて、VOWL(X)を5CNTに等しくなるようにセ
ットし、TT25.158へ進む。次のステップは15
7であり、ポインタ変数Xが増分され、それによつてそ
れは1に等しくなり、認識されるべきワード内の第1の
状態を識別する。ステップ159で、SEG (X)の
第1の状態が1にセットされ、5EG(1)のための母
音型状態を示′cJ。 ステップ159における第1の状態を規定して、もし、
6の合計の母音型増分が生ずる時間期間の間に介在する
無音カウントおよび摩擦音型カウントがあるならば、そ
のプログラムは、リターンポイント161.TT4を介
して、変数5CNTおよびFCNTがOにセットされる
ステップ163に続行し、そのため5CNTおよびFC
NT変数の新しいカウンティングが再び始まり、かつそ
のシーケンスは第3図において示されるリターンポイン
ト123で続行される。 もしこの単語の初めにおいて、母音型音よりもむしろ摩
擦音復音が、線75(第2図)上に現われるならば、ス
テップ149における分岐テストが、16進10.また
は10進16を越えて零交叉カウントを与え、1600
ヘルツを越えて平均の音声周波数を示したであろう。こ
の場合、そのシーケンスは、リターンポイント’T’T
7.165を介して、摩擦音型10ミリ秒サンプルをカ
ウントするFONT変数が増分されるステップ167へ
続行する。変数FONTは、次にステップ169で値2
と比較されて、合呂1して20ミリ秒の摩擦音復音がモ
ニタされたかどうかを判断する。もし最後の状態の規定
から20ミリ秒以下の摩擦音復音がモニタされたならば
、そのプログラムは、ポイントTT2.123に戻るで
あろう。しかしながら、もし変数F CN 1’が、値
2に等しいかまたはそれよりも大きければ、分岐ステッ
プ171は、最も最近規定したワード状態が母音型音で
あったかどうかを決定する。ここで説明している例では
、SEG (X)は0に設定されたことが認識され、し
たがって、プログラムはステップ173に続き、ステッ
プ173において、変数<VOWL (X) )が5C
NTに等しくなるようにセットされ、プログラムはポイ
ントTT14.175へ戻る。後者の例では、単語の最
初にお【ブる以外、母音型音が摩tl!音型音に先行す
るとき合計の母音カウント変数VCNTを記憶すること
が有効であろう。このように、もし分岐ステップ171
におけるテストが、最も最近にモニタされた状態が母音
であることを示すならば、そのプ[1グラムが、リター
ンポイント1−T1’5,177を介して続行され、変
数VOW+−1X)を増分ステップ153において予め
記憶されたIII!V CN Tと等しくする。 これは、ステップ179に83いて生ずる。この手続は
、それからリターンポイントTT14,175を介して
続行され、上jホしたステップ175と同様の態様でス
テップ181においてXを増分して、上述したステップ
159と同様、のステップ183で、SEG (X)ア
レイにJ3ける次の状態を摩擦音復音すなわち2と規定
し、かつその手続は、リターンポイントT’r17,1
85を介して続行される。上述したようにステップ16
3と同様の態様で、ステップ187におけるシーケンス
はそれから、変数5CNTおよびVCNTをリセットし
、かつイ1加的なデータの収集のため、第3図のポイン
トT T 2 、ステップ123にそのプ[Iグラムを
戻す。 以上の説明から、分岐ステップ147で判断さ
れたように、もし前の状、態が照合なら、認識されるべ
きこの単語の第1の状態どして、60ミリ秒の合計の母
音型持続期間が、母音型状態を規定し、かつ20ミリ秒
の金品1の摩擦音型持続期間が、摩擦音型状態を規定づ
る。 本質において、これまでに)小べられてさたものは、予
め定められた状態が、予め定められた時間、この場合母
畠型音に対しては60ミリ秒かつ照合に続く摩擦音復音
に対しては20ミリ秒の間、このシステムにとって入来
りるデータを特定の状態として受入れるために続くこと
を必要とするこのシステムにおけるヒステリシスの形式
である。 以下の説明において明らかになるように、前の状態の識
別は、特定の音声が母畠型かj、たは摩擦音型かどうか
を判IFi’llるために用いられる周波数の識別を変
えるために用いられる。このように、ステップ149に
おいて、前の状態が、ステップ147において無音とし
て規定されたので、1600ヘルツを越える周波数は、
摩擦音型としC規定された。以下の説明から明らかなよ
うに、もし最も最近に規定された状態が母音であるなら
ば、特定の10ミリ秒間隔は、もしその間隔の平均の周
波数内容が2400ヘルツを越えないならば摩擦音型と
して規定されbい。これは、もし母音型置から摩擦音型
合へ進むしきい値が増加するならば誤り率が減少すると
いうことがわかるので、無音の後の摩擦音型合よりも母
音の後の摩擦音型合を認識づることをより困難にするヒ
ステリシスの付加的な形式である。このように、それぞ
れステップ169および155における摩擦音型および
母音型持続期間の必要物により生じたこのシステムの基
本的なヒステリシスに加えて、前の単語の状態に基づい
て母音型および摩擦音型10ミリ秒間隔の間の周波数の
移り変わりの個所を変えることにより、変更可能なヒス
テリシスがこのシステムに導入される。 以下のシーケンスは、このヒスプリシスの原理を述べる
。もし、ステップ147において、最も最近に規定され
た単語の状態が無音でないことが判断されると、プログ
ラムシーケンスは、ポイントTTS、189を介して分
岐ステップ191に続行され、そこT−8EG(X)と
値1どを比較することにより前(7)単語の状態が母音
型置であるがどうかを判断する。もし前の状態が母音型
置であるならば、そのシーケンスは、ステップ193に
分岐し、そこで零交叉カウントが、2/100ヘルツの
周波数平均を示す16進値18づなわち10y#値24
と比較される。もしその値が2400ヘルツを越えなか
ったなら、そのプログラムは、ステップ195に進み、
変数VCNTを増分し、この10ミリ秒期間を母音型と
して識別しかつそのシーケンスを上述したリターンポイ
ント]−■4 。 161に戻す。他方、もし分岐ポイント193において
、周波数内容が2400ヘルツを越えるならば、そのプ
ログラムは、上述したリターンポイントTT7.165
に進み、かつ変数FONTをステップ167で増分する
。このように、J!!擦潟型10ミリ秒期間に対する周
波数しきい値が、予め記録された単語の状態が母音また
は無音状態がどうかに依存する。 もし煎の状態が母音型置ならば、ずなわちステップ15
5においてなされたテストが、60ミリ秒の母音型置が
生じかつアレイ5EG(X)がステップ159において
セットされて母音型状態を示すということを既に表わし
たならば、分岐ステップ193に達するということを注
目すべきである。もちろん、これが比較的長い母音の音
声の表示であるのみであるから、別の母音型状態が、あ
る、母音型状態に続くことは望ましくない。このように
、ステップ195において生ずるVCNTの増分とリタ
ーンポイン1〜TT4,161へのプログラムのリター
ンとが、母音型状態が、他の間隔、無音または摩擦音型
合が遭遇されるまで規定されたとすれば、連続する母音
型間隔の累算を単に与え、その付加的な母音型間隔は、
付加的な母音型状態を与えない。 同様に、分岐ポインl−191において、5EG(X>
の1との比較が、前の状態が1でないことを示したなら
ば、かつ分岐ステップ147が、前の状態が無音でない
ことを示したので、そのプログラムは、もし前の状態が
S擦音型音であると識別すればステップ197に分岐す
るであろう。この場合、最も最近の10ミリ秒間隔に対
する零交叉データが16を越えるならば、これは最も最
近の摩擦音型状態を与えた摩擦音型合の連続して登録さ
れ、かつ長さカウンタF ON Tはステップ198で
増分される。そのプログラムは、上述したリターンポイ
ン1−TT7,185に分岐して、そのプログラムが、
付加的な摩擦音型状態を与えることなく付加的な摩擦音
型70ミリ秒間隔を累算することを可能にする。2つの
連続する#振音型状態は、比較的長い摩擦音型合よりも
むしろ連続する位四で1つの単語内で2つの摩擦音型の
形状を誤って示すからである。他方、もし前の状態が、
摩擦音型合であるならば、かつ最も最近の10ミリ秒間
隔のサンプルが160’1ヘルツ以下の周波数平均を与
えるならば、分岐ステップ197は、上述したリターン
ポイントTT6.151にプログラムを戻して母音型置
の初めを識別する。 ステップ195、ステップ155で規定されたカウント
6を越える母音型カウントの連続に続いて、そのプログ
ラムは、リターンポイントTT4゜161で戻り、変数
5CNTおよびFCNTをOにセットして、そのため母
音型音の中央の随時の無音型間隔および摩擦音型間隔が
累算されずに、もしこれらの10ミリ秒サンプルが連続
して生じないならば無音状態または摩擦音型状態を誤っ
て示す。このように、1つの摩擦音型または無音のサン
プル間隔が母音型力ウシティングシーケンスの中央で生
じる限りは、変数5CNTおよびF CNTは、0にさ
れてこれらの変数の非連続的fzカウントの累算を禁止
する。 同様なシー、ケンスが、リターンポイントTT17.1
85で生じ、摩擦音型金が生じかつ離れた無音間lll
1および母音型間隔が生ずる限り、ステップ187にお
いて変数S CN T LJ−3よびVCNTをリセッ
トする。 第3図を再び参照すると、もし成る音が存在したならば
そのシーケンスが分岐ステップ131からリターンポイ
ントTT9,13!:lに分岐して、非無音間隔を示し
、かつステップ137において、もし無音間隔が単語の
初めにあったならばそのシーケンスはリターンポインh
TT12.139に分岐するということが思い出される
。1:)シ、分岐ステップ137において、最も最近に
記録された単語の状態が無音でないことが判断されるな
らば、かつステップ131において現在の10ミリ秒サ
ンプル間隔が無音状態であると判断したならば、そのシ
ーケンスは、ステップ199に分岐し、そこで変数5C
NTの現在の値が、値3と比較されるであろう。すなわ
ち、無音期間が30ミリ秒、つまり音声エネルギが破裂
型合のために蓄えられる間声道の前破裂音の閉鎖のよう
な単hh内の短な無音状態獲得するのに充分な時間期間
を越えたかどうかに関する判断がなされる。もし変数S
OX丁が、3を越えないならば、そのプログラムはリタ
ーンポイントTT2.123に分岐してより多くの間隔
データを集める。もし変数5CNTが植3を越えるなら
ば、そのプログラムは、分岐ステップ201に続行して
、最も最近に記録された単語の状態が母音型音であるか
どうかをテストする。 もし無音状態の前の最後の状態が、母音型状態であるな
らば、そのプログラムはリターンポイントTT18,2
03を介してステップ205に続行し、そこで変数VO
WL(X、)が、ステップ179(第4図)における母
音型音の合計の持続期間に等しく予めセットされた変数
VCNTに等しくセットされる。もし最も最近の状態が
摩擦音型金であるならば、分岐ステップ201は、プロ
グラムをステップ207に続行し、そこで変数■OWL
(X)に摩擦音型状態、FONTを記憶する。 それからそのシーケンスが、リターンポイント19.2
09を介してステップ211に続行され、そこで値Xが
増分され、かつその無音のカウント変数5CNTが3を
越えたので(ステップ199)、変数SEG (X)は
、ステップ213における無音状態を規定するようにセ
ットされる。同時に、変数VOWL (X)がリセット
され、これは、ステップ311における増分によって、
ステップ2(j5においてセラ1〜された位置の後のV
OW+−アレイお番)る次の連続する位置である。 上述したように、ステップ141はそれから、変数5C
NTおよびF CN ’T’をリセットし、かつ無音の
合計の持続期間、すなわら変数5CNTの値が16を越
えるかどうかを判断するためにステップ143において
比較がされる。無音カウン1−が160ミリ秒を越えた
とすると、上述したJ:うに、前の単語の状態が記録さ
れたかどうかの判断が分岐ステップ145においてなさ
れる。もし単品の状態が記録されたならば、160ミリ
秒の無音の持続期間が、単語の終わりを示すのに充分長
いとして規定され、かつしだかってそのプログラムはス
テップ147に分岐し、そこでその単語内の状態の合計
数を示づ変数Nが、変数Xに等しくセットされ、記録さ
れた単語の状態の合計数を今規定する。ステップ147
の完了において、そのシーケンスは、リターンポイント
T T 23 、ステップ215を介して、第5図に表
わされたステップのシーケンスに続行する。 以下の説明から明らかなように、第5図のステップのシ
ーケンスは、最後に記録された単語の状態をチェックし
て、それが短い母音型金かどうかを判断するために用い
られる。単語の終わりにおける短い母音型レグメントが
、しばしば間違った母音の表示であるということが判断
されるので、摩擦音型音の終わりにおけるエネルギの減
衰に対して、第5図に示されるステップのシーケンスは
、そのような短い母音型の終わりの古を状態のシーケン
スから除去するために用いられる。 最初に、変数Xが、ステップ217において変数Nと等
しくセットされ、そのため、注目されるように、そのシ
ーケンス内、すべての単語を、160ミリ秒間隔を越え
る無音状態とともに終わるものとして規定したので、変
数Xは今、無音である最後の記録された状態を示ず。ス
テップ219において、変数Xが減分されて、終わりの
無音の前に次の前11語の状態を識別する。この次の前
単語の状態は、5EG(X)と値1とを比較することに
よりステップ221において識別されて、この次の前の
単語の状態が母音型金であるかどうかを判断する。もし
それが母音型金でないならば、そのプログラムは、第6
図に示されるリターンポイントRFC,223に分岐す
る。他方、もし終わりの無音の前に記録された最後の単
品の状態が、母音型金であるならば、分岐ステップ22
5が、ステップ205(第3図)でセットされた変数V
OWL (X)と値60進10まノCは10進16どを
比較することにより、母音型金の合計の持続期間と16
0ミリ秒とを比較する。もし、母音型金が160ミリ秒
を越えたならば、そのシーケンスは、リターンポイント
TT22.227で続行する。他方、もし終わりの母音
型名が、持続期間において160ミリ秒よりも短いなら
ば、これは偽の終わりの母音であるということが判断さ
れた。 この哩山て、ステップ229が、変数XおよびNの両方
を減分してこの間違った状態を効果的に除去するために
用いられる。ステップ231はそれから、無音状態が、
間違った終わりの母音型状態のずぐ前に生じたかどうか
を判断するために用いられる。もし無音型状態が、この
間違った母音型状態に先行しなかったならば、そのシー
ケンスは、リターンポイントRFC,223で続行する
。しかしながら、もし無音状態が、この間違った母音型
状態に先行したならば、その無音状態もまた間違ってお
り、かつしたがってステップ233において、値Xおよ
びNが、再び減分されて間違った無音状態を除去する。 アレイSEG (X)がリセットされなくて、記録され
た間違った状態を物理的に除去するにもがかわらず、第
6図の説明かられかるように、値Nを減分することによ
り、これらの間違った状態を単語の認識シーケンスにお
い゛C関係することがら効果的に除去する。 このように間違った終わりの状態を除去すると、そのプ
ログラムは、リターンポイント227がら分岐ステップ
235へ続行し、そこで変数Nど偵2とを比較する。記
録された最後の状態が、任意の単語の終わりにおける無
音状態であるから、変数Nは、状態のシーケンス内の有
意義な状態の実際の数よりも1だけ大きい。このように
、Nと2との比較によって、その状態のシーケンス内の
1よりも大きな有意義な状態があるがどうかを判断する
。もし変数Nが2を越えるならば、有意義な状態のシー
ケンスが規定され、かつステップのシーケンスが第6図
のステップ223に分岐する。 もしNの値が、値2よりも小さいがまたはそれと等しい
ならば、ステップ237は、その値が1が2かを判断す
るために再び値2と値Nとを比較する。もしその値が2
より小さければ、我々は、その信号の状態が単語の終わ
りにおいて無音でありかつ有意義な状態のシーケンスが
ないので、イの全体の状態のシーケンスを本質的に除去
する。このように、プログラムが、リターンポイント1
17、TT16で第3図に戻される。 もし分岐ステップ273において、Nの値が2−であり
、そのためその単語の中に1つの有意義な単語の状態が
あることが判断されると、変数V。 WL (X)の値が、ステップ239におイア 480
ミリ秒の母音型持続期間を示す値16進3oまたは10
進48とを比較される。その単語において1つの母音型
状態のみがあるならば、そのシーケンスは、母音型状態
が、それ自体で、有意義なこの状態ために、少なくとも
480ミリ秒の持続期間を有することを必要とする。も
し、この持続期間が、480ミリ秒よりも小さいならば
、そのシーケンスは、再初期設定のために第3図のTT
16、ステップ117に戻る。他方、もし母音型状態の
持続期間が480ミリ秒を越えたならば、そのシーケン
スは、第6図のリターンポイントRFC,ステップ22
3に続行する。もしその1つの状態シーケンスが、ただ
1つの摩擦音復音を含むならば、ス”テン7187(第
7図)が、値■cNTを0にセットするということも認
められるべきである。したがって、分岐ステップ239
は、1つの摩擦音状態のシーケンスを効果的に除去し、
プログラムをリターンポイントTT16.117に戻し
てそのシーケンスを再初期設定する。 第6図を今参照すると、認識シーケンスが、リターンポ
イントRFC,223で始まって示される。このシーケ
ンスは、上述したアレイ5EG(X)において記憶され
た状態のシーケンスおよびアレイVOWL (X)に記
憶された状態長さにより規定される新しい単語と、マイ
クロプロセサ(第2図)のリードオンリメモリ19にお
いて永久的に記憶された殉教の単語テンプレートとを比
較するために用いられる。このテンプレートは、以下の
フォーマットでREF(IX、)として識別されたアレ
イにおいて記憶される。 1 単語:SIX 1LLLZ 次コ2jニンー
REF(XTMP)4’2 1 0 2WT (XTM
P) OW W Vb WIN(XTMP)
0 Ω、 Q、 Q、ヘポインタXTMPが、ア
レイにお゛いて連続するメモリバイトを規定するために
用いられる。リードオンリメモリ19内の各単語のテン
プレートは、その単語のテンプレートにおける状態の数
を指定することで始まる、。表2に示された例において
、状態の数は、4であり、REF (0)で記憶される
。この最初の指定に続いて、その単語のテンプレート内
の状態のシーケンスが続く。この場合、上述した表1と
同様に、芙BRの単語sixに対する典型的なテンプレ
ートが、以下のシーケンスとして記憶される:W、擦音
型、母音型、無音、摩擦音型:tlJt)’5.210
2 :が、XTMP=1ないし4の位ILK記憶される
。もしそのテンプレートが、3つの状態のテンプレート
であったならば、最初の位ff1R’EF(0)が、3
であり、かっただ3つの状態の識別子が、XTMP=1
ないし3において続く。 アレイ(WT、(XTMP)は話者の集団についてその
状態の発生瞳率と、その朋fltにおける他のワードか
らそのワードを区別する際のその状態の有益さとの両方
に比例する各基準状態へ割当てられる重みを含む。アレ
イLN (XTMP)は各状態の平均長さく持続期間)
を含む。 表2に示すように、次の連続するワードテンプレートは
位11REF(5)における最初の単語のテンプレート
のすぐ後に続き、がっREF(,5)に記憶されたこの
次のテンプレートの状態の数で続く。テンプレートの各
々は、このように、状態シーケンステン、プレートが異
なる長さを有し得るにもかかわらず、連続する位1fX
TMPでリートオンリメモリに連続して記憶される。 ポインタYTMPが、入来する話されたワードアレイの
連続エレメントを規定するために用いられる。アレイS
EG (YTMP)およびVOWL(YTMP)からな
る話されたワードを、アレイREF (XTMP)、W
T (XTMP) 13J:びLN (XTMP)から
なる記憶されたワードパターンと比較する際に、状態ご
との比較が行なわれる。 すなわち、アレイREF (XTMP)に含まれる、記
憶されたワードパターンの第1の状態は、アレイSEG
(YTMP)に含まれる、新しいワードの第1の状態
と比較される。も−しそれらが共に同じ分類を有してい
れば、変数” S CORE ”がアレイVOWL(Y
l−MP)およびLN (XTMP)に含まれる状態長
さの差だけ増大される。Y1’MPおよびXTMPは共
に次の状態比較を準備して増分される。第1状態の分類
が同じでなければ、すなわち、アレイREF(XTMP
)に従って期待される状態が新しいワードになければ、
変数“’ S CORE ”が、アレイWT (XTM
P>に含まれるその状態に関連の重みだけ増大される。 8R案ワードを区別する際の状態が重要であればあるほ
ど、その重みは大きく、それは変数5COREにより多
くの影響を与える。 REI=(1)に記憶された第1のテンプレートワード
の第1の状態が5EG(1)で記憶された入来する話さ
れたワード状態アレイの第1の状態と同じであれば、X
TMPおよびY 1− M Pは共に増分されて次の比
較における次の状態比較のため、入来する話されたワー
ド状態アレイSEG (2)の第2の状態を準備する。 さらに、マイクロコンピュータは第1のテンプレートの
第1の状態の長さ、LN(1)と、入来ワード状態アレ
イ■0WL(1)の第1の状態の長さとの差の絶対値を
剖算する。次いで、この値が変数5COREへ加えられ
る。第1のテンプレートREF(1)の第1の状態が入
来ワード状態アレイ5EG(1)の第1の状態と比較さ
れたときに分類が異なる口とがわかれば、第1のテンプ
レートの第1の状態のための重みの値、WT(1)が変
数S CORE /\加えられる。さらに、XTMPが
増分されるが、YTMPは増分されず、次の比較のため
の準備をする。次に、マイクロコンピュータは第1のテ
ンブレー1−の第2の状態、REF (2)と、入来す
る話されたワード状態アレイの第1の状態、 5U−G
(1)と比較する。もし分類が同じであれば、第1のテ
ンプレートの第2の状態の長さ、LN (2)と、入来
する話されたワード状態アレイの第1の状態の長さ、5
EG(1)との差の絶対値が変数5COREへ加えられ
る。もし分類が異なれば、第1のテンプレートの第2の
状態の重み、WT(2)が変数5COREへ加えられる
。 状1118EG (1)のため(7)REF (XTM
P)においで一致が見られると、XTMPおよびYTM
Pは共に増分され、5EG(2)は次の連続する基準状
態と比較される。 より多くの状態が入力ワードシーケンスSEG(YTM
P)k−留tりながらバタ ’ンREF(XTMP)の
終わりに達すると、これらの過剰な状態(7)iさVO
WL (YTMP)が変数5COREに加えられる。こ
れらの長さの値のいずれかが10以下であれば、1直1
0は、長さを加えるどきに置換えられる。他方、より多
くの状態が基準テンプレートパターンRFP(XTMP
)に留まりながら入力ワード−シーケンス5EG(Y’
rMP)の終わりに到達すれば、これらの過剰な状態の
重みWT(XTMP)が変数5COREへ加えられる。 この手順が各記憶された語粱ワードごとに繰返され、変
数5COREのための最も低い値が最も近い一致を示す
ものどじて選ばれる。この5COREがI10ボートA
21のビット2.3.4および5から抽出されたしぎい
値よりも小さいかまたは等しければ、最も低い5COR
Eを有するテンプレートワードに対応する数を含む変数
CLASSはポートB23.ビット0−6に出力される
。 さもなくば、入来するワードが拒絶され、拒絶表示がボ
ートBのビット7に与えられる。表3は、ピッドパ、タ
ーンに対応しかつI10ボー1〜A21゜ビット2−5
から抽出される可能な拒絶しきい値を示す。任縁のマイ
クロコンピュータにおいては、これらの1ト絶しきい値
の1つだ番ノが用いられよう。 しきい値の選択は、何の誤差も作られていないというこ
とがユーザにとってどれほど重要であるかに依存する。 ユーザが誤差についての関心が少なければ少ないほど、
しきい値は高いが、誤差が高価格を有するようであれば
、しきい幼は低いであろう。もし応用がおもちゃのロボ
ットの制御であれば、主要事項は、指令に応答してロボ
ットが何かを行なわなければならないことである。この
ような応用における拒絶しぎい値は高いであろう。 他方、その応用が産業的なものであり、エラーが費用の
かかるものになるかもしれなければ、拒絶しきい値は低
く設定されるであろう。 表3 ポート ピッ とツ ピッ ピッ 拒絶しきい値A
ト5 ト4 ト3 ト2 0 0 0 0 64 0001 4 0010 8 0 0 1 1 12 0 1 0 0 16 0 1 0 1 20 0 1 1 0 24 0 1 1 1 28 1 0 0 0 32 1 0 0 1 36 1 0 1 0 40 1 0 1 1 44 1 1 0 0 48 1 1 0 1 52 1 1 1 0 56 1 1 1 1 .60 認識シーケンスの詳細を第6図を参照して説明する。こ
の認識シーケンスの初期ステップは、前述したように、
認識されるべき新しいワードにおける状態の総数を規定
する変数Nの減分として、第6図のステップ241に示
される。値Nは新しい状態シーケンスの最終の無音状態
を含みかつステップ241での減分は、認識されるべき
ワード内で、この最終無音状態なしで、実際の意味のあ
る状態まで、状態の総数を減少させるために用いられる
ということが思い出されよう。次に、ステップ243で
、ポインタXTMPがOにリセットされ、アレイREF
、WT、およびLNの第1のエレメントから比較シーケ
ンスを開始させる。 ステップ245で、変数CLASSがOにセットされる
。この変数は、比較プロセスに含まれる男在のlff1
ワード数を示寸ために用いられる。ステップ249は変
数B’ES’r’を16進7Fに初期設定する。これは
8ビツトワードにお()る可能な最大の正の数である。 この変数は、比較プロセスが1個゛のWJ案ワードから
次のソー下へ移動するに従って、現在の最も低い距離の
スコアを追跡するために用いられる。ステップ253は
ポインタYTMP=1をセットして、比較プロセスがア
レイSEGおよびVOWLにおける第1の有効−なエン
トリから始まるのを可能にする。先に説明したように、
これらのアレイは新しい音声ワードの状態シーケンスお
よび状態長さを含む。ステップ255で、新しいワード
と、記憶された1mワードとの間の比較を用意して、変
数5COREがOにセットされる。この比較処理の間、
この変数は新しいワードと記憶されたワードとの非類似
性の度合を反映する。各ワード比較処理が開始される前
に再初期設定される。ステップ257はXTMPにより
指示されるアレイREFのエレメントに等しい変数りを
セットする。これは、比較中の現デンプレートワードの
状態数であり、または、すべてのワードが用い尽されれ
ば、16進値FFである。 ステップ257において示されるアレイR’E Fの′
エレメントはステップ259の値FFと比較される。も
しそれが16進FFに等しければ、それは、記憶された
IJIテンプレートの終わりに達したことを意味し、出
口手順ステップ261(第8図)が実行される。 記憶された語粟が用い尽されていない、すなわち、RE
F(XTMP)がステップ259−(” F Fに等し
くないと想定すれば、変数L1は、らようと話されたワ
ードにおける数の状態である変数Nに等しくなるように
セットされる。2つの変数りおよびLlは、新しいワー
ドおよび記憶された韻案ワードにおいて比較されるため
残っている状態の数を反映する1=め、1個のワードの
比較の間に調整される。共にOになれば、特定のデンプ
レートワードのための比較プロセスが完成する。状態の
総数を得た後、ポインタXTMPがステップ267で増
分されて、アレイREF、Wl’、およびLNの次のエ
レメント、この場合、各アレイの第1のデータエレメン
トを選択する。 ポインタXTMPおよびYTMPが、テンプレートおよ
び音声人力アレイのための正しいエレメントでそれぞれ
指示しているように調整されている。実際のワード認識
の評価が今準備できる。ステップ270で始まり、テン
プレートワードアレイの第1の状態が音声入力の第1の
状態と比較される。もしこれらの状態が同一であれば、
変数5COREが、ステップ272で、状態の長さ間の
差の絶対値、すなわち、音声入力の持続期間VOWL
(YTMP)と、記憶されたKnlQテンプレートの持
続期間、LN (XTMP)との間の差の絶対値だけ、
増大される。音声ワード(L2)およびテンブレー1−
ワード(L)の両方のための状態カウンタは共にステッ
プ274で減分され、他方、音声ワードおよびテンプレ
ートワードのためのアレイポインタYTMPおよびXT
MPは、それぞれ、ステップ275で増分される。 しかしながら、ステップ270で、状態が一致しなかっ
たと想定すれば、変数SCO’REが、重み付はアレイ
にストアされた値WTだけ、ステップ277で記憶され
たワードポインタxTiv+pで、増分される。この状
態が、テンプレート器素ワードの正しい識別のためによ
り重要であればあるほど、重みが高く仝す、変数S C
9RElの増大がにり大きくなる。ステップ279で、
テンプレートワードアレイポインタXTMPが増大され
、他方、記憶されたワード状態カウンタLが、次の状態
の比較の準備で、ステップ281にJ3いて減分される
。テンブレー1−ワードポインタおよびカウンタのみが
変更され、音声ワード変数がそのまま変更されずに残り
、そのため音声ワードの現在の状態が記憶されたワード
の後続の状態に対して一致をチェックされることができ
るシとに注目されたい。 記憶されたワードは各語棄ワードにおいて生ずるかもし
れないすべての状態(たとえそれらが低確率であっても
)を含みかつ、その結果、同じワードの何らかの新しい
音声に対して状態の数により、等しいまたはそれよりも
大きい長さのものであるということが指摘されなければ
ならない。 各状態の比較が完成し、スコアポインタおよびカウンタ
が正しく調整された後、ワードの評価が完了したかどう
かが決定されなければならない。 評価プロセスは、音声および記憶されたワードの両方の
ための状態カウンタがOであるときに完了する、すなわ
ち、すべての状態が評価されかつ最終のスコアが決定さ
れたときに完成する。ステップ283で始まり、記憶さ
れたワード状態カウンタLが0のためにチェックされる
。もし状態カウントが0でなければ、すなわち、記憶さ
れたワード状態のすべてが評価されてなければ、音声ワ
ード状態カウンタはステップ285でOに対してチェッ
クされる。もし音声ワードカウンタもまたOでなければ
、状態比較は完成してな(、状態比較プロセスがステッ
プ269で続けられる。もし音声ワード状態カウンタが
Oであれば、スコアが残っている、比較されてない記憶
されたワード状態の重みの総和だけ増大される。このプ
ロセスは、スコアが現に記憶されたワード状態の重み、
ずなわちWT (XTMP)だけ増大されるステップ2
87で始まる。記憶されたワード状態、ポインタXTM
Pがステップ289で増分され、かつ音声ワード状態カ
ウンタLがステップ291で減分される。重みを総和し
かつポインタおよびカウンタを調整するプロセスは、記
憶され1〔ワード状態カウンタLがOであるまで続く。 音声ワード状態との比較によって、または残っている状
態重みの総和によって、ずべ°Cの記′憶されたワード
状態の評価をした後、記憶されたワード状態カウンタL
がOであり、制御が、ステップ283からステップ29
3へ移される。ステップ293で、音声ワード状態カウ
ンタ1.1がOと比較される。もし音声ワード状態カウ
ンタがOであれば(かつ記憶されたワード状態カウンタ
が、ステップ283でOであるとして前に確立されてい
たならば)、音声ワード状態および記憶されたワード状
態の比較が完成され、すなわちf&柊のスコアが確立さ
れている。その比較が完了すれば、5COREの評価プ
ロセスはステップ305(第7図)で始められる。記憶
されたソー下におりるづべての状態が用い尽されている
間により多(の状態が音声ワードに残っていれば、ステ
ップ299で、距離尺度5COREが、付加えられた状
態の長さの2倍または10でいずれか大きい方だ【プ増
大される。音声ワードにおけるずべての余分な状態は距
離尺度5COREを増大ざVかつ記憶されたワードとし
て音声ワードの分類をほとんどしないようにさせ、この
増大は音声ワードにおりる付加的なデータ(長さ)の用
に関連している。ステップ301および303は音声ワ
ード状態ポインタYTMPを増分し、かつ音声ワード状
態カウンタL1を減分させる。このプロセスは、ステッ
プ295で始まり、音声ワード状態カウンタが、スコア
更新が完成するということを示すOになるまで繰返す。 第7図を参照して、新しいワードを、記憶されたN案ワ
ードと比較するプロレスが完了し5COREが確立され
たとき、5COREは、これまで2であった最も低いス
コア、BESTとステップ305で比較される。もし現
在のスコアが前のベストスコアよりも小さければ、それ
はステップ311でBESTを@換える(0のスコアは
状態および長さの両方の完全な一致を示す)。現在のベ
ストスコアで維持しながら、ステップ313で、そのス
コアに関連するワード数(CLASS)が変数ANSに
記憶される。もし現在のスニ17がそのポイントまでの
ベストスコアよりも大きいかまたは等しければステップ
311および313は行なわれない。ステップ309で
、ワード数CLASSが、記憶された器素ワードとの次
の比較を準備して、増分される。制御は、次の記憶され
たワードのため同じ評価プロセスを繰返すステップ25
1(第6図)へ移る。 すべての比較が完了するとき、すなわち、記憶されたワ
ードの第1の状態がステップ259で16進’FFであ
るとき、これは第8図において制御をEXIT261へ
移す働きをする。この点で、最も低いスコアBESTお
よびその関連のワード数ANSが決定された。入カポ−
1−A 21は、ステップ315で、アキュムレータA
CCへ読み込まれて、新しいワードが記憶された語瑣ワ
ードの1つと一致しなければならない程度を制御するた
めに用いられるべき拒絶しきい値の値を決定する。 しきい値が低ければ低いほど、その一致はより接近しな
番プればならない。許容可能な拒絶しぎい値のための表
3を参照されたい。このボートにおける他のビットは異
なる意味を有しているので、変数ACCは1ビツト右へ
シフトされ(ステップ316)かつデータは、ステップ
318で、16進78と論理積処理されて不所望なビッ
トを取り去る。 もしもすべてのビンがロー(接地)へ接続されれば、1
6進40のディフオルト(drAau日)値がステップ
317i15よび319において示されるしきい値のた
めに用いられる。づべてのビンがローに接続されなけれ
ば、制御はステップ321へ移り、値がポー1− Aか
ら、しきい値として計算される。 アキュムレータにお番プる拒絶しぎい値がステップ32
3で測定されるBESTスコアよりも大きければ、ワー
ド数ANSはステップ327でボートB23へ出力され
、さもなくば、拒絶ライン、ボートB23.ビット7が
ステップ325で活性化されて、一致は十分に接近して
いなかったことを示す。制御は、次に、ポイントステッ
プ117−へ移り、新しい音声ワードを待つ。 この発明のワード認識システムの利用か次の例によって
示される。第2図に示1J、うに、出力ボートB23は
、その最下位ピッ1−、ビットBOが1対のスイッチコ
ンタクト303を駆動でるリレーコイル301へ接続さ
れてもよい。同様に、次の最下位ピッ]・、ビットB1
は、スイッチ対307を駆動するリレーコイル305へ
接続されてもよい。 マイクロプロセサ17.高利得客用増幅器13゜マイク
ロホン11.およびシステム用のバッテリ電源を含む全
体のシステムは小さなお−bち15のロボット内に収納
されてもよい。この場合、J3もちヤのロボットは、た
とえば、ロボッ1〜の頭を回転させるように接続される
モータ309と、ロボットを歩かせるためのトラクタ運
動構を駆動覆るように接続される第2のモータ311ど
を含む。ロボットヘッド回転器309はスイッチ303
によって駆動され、他方、ロボットのトラクタ運動はス
イッチ307によって制御される。もしポートB23か
らの出力ワードが2進数01て′あれば、ロボットの頭
が回転されることがわかる、な1!′ならばビットB
Oの2進1出力はスイッチ303を+311じるためリ
レー301を駆動するからである。同様に、ポート82
3から、10進2に等しい、2進数10の出力によって
、リレー305が駆動し、スイッチ307を閉じ、ロボ
ッ1〜を歩かせる。同様に、ポートB23からの2進数
OOの出力によって、ロボットの】べての運動が止まる
。ざらに、マイクロコンピュータは、たとえば、ロボッ
トの目がユーザにJ:り与えられる命令に依存して光り
または消えるように結線される口とかできる。 次の表、表4は、tAtl?iの音声’7− ト” 3
earC11” 。 ”5top” 、 ”go” 、 ” light
s” 、および0冒ightsoff”を4するために
、マイクロブ0セサ17のリードオンリメモリ19に記
憶される状態シーケンステンプレートの一例である。 表4 REF 4,2,1,0.2 5EARCH6,2
,0,2,1,0,I 5TOP2.2.I
G O3,1,0,2L I G
+−1’r S5.1,0,2,1,2 LI
GI−ITS 0FFWT O,10,10,
10,10S E△1マCHO,18,18,4,18
,2,28丁OPO,5,30G。 O,10,7,1OL I G l−I T SO,5
,5,5,10,10L I G HT S OF
FLN O、F、10.O,B 5EAR
CHO,13,0,2,13,0,B S 1− OP
’0 .2.10
G。 O,22,2,12L I G HT SD、1[3
,2,7,26,21I G HT S OF F
これらの状態シーケンステンプレートは上述の表2の形
式であり、・第1の桁は、各シーケンス内の状態の数を
識別する。表4にリストされたテンブレ・−トから、英
語のワード″’5earch”および”go’”はうま
く規定された状態シーケンスを提供することがわかる。 表4および第2図ないし第6図の前述の説明から、ワー
ド’ 5earch” 、 “”5tOp” 、およ
び’g。 ahead ”をマイクロホン11へ話ずことによって
、ユーザは、ユーザが選択するどのような順序でも、そ
の頭を回転させ、停止させかつ歩かせることができる。 もちろん、これは極めて筒中な例であるが、この発明の
有用性を示すものである。スイッチ307および303
ならびに、ボー1−21.23および25へ接続される
多種多様な他のスイッチが、音声ワードの識別に従って
多種多様な消費者または産業製品を制御するために用い
られることができるということを認識しな番プればなら
ない。 ワード°冒i g h t s ”および’ ligh
ts orr”が特に、ここでは命令的である。上の例
において、ワード” l +9+1ts”が無音状態が
省略されて、”1ice”として成る人によって発音さ
れる。無音状態はそのワード(この例において)を識別
するのに絶対的に必要とされるものではないので、無己
状態(0)に関連の重みは、その省略を重(みないよう
に、他の状態よりも低くてもよい。この例に見られるよ
うに、中間の無音状態へ割当てられる重みは、他の2つ
の状態へ割当てられる重み10に対して、7である。こ
こにお番プるしきいla4よ、J3そらく、もつと高く
セットされるであろう、なぜならばエラーのコスト、す
なわち、全体的に異なるワードに応答してライトをオン
にするOボッ1〜は、あまり高くないからである。した
がって、しぎい植(よ25であり、明らかに間違ってい
るワードをなおも拒絶する。ワード°゛lights
off”に含まれるより高い全体的な重みのため、ライ
トを偶然にΔ〕にさせるのがより困難であろうというこ
とがわかる。もし我々が指令に基づいてのみライ1−が
Aフになってほしいことを決めれば、これらの状態の各
々をより高いものに重み付番プしてもよい。たとえば、
ここで既に説明した級数5.5,5.10゜10に代わ
って、10.10.10.20.20の重み付けの列を
有してもよい。 上で説明したように、この認識システムの1つの利点は
、二人の異なる話者によって実質的に異なった様に話さ
れたワードが、これら異なる発音を予期して一連の記憶
されたテンプレートを含むようにする必要もなく、同じ
ワードとしてなおも認識されることができるということ
である。 このように、ワード冒1Qhts”に代わって°1ic
e”と言う人は、彼がワード゛1ice”と言うときに
ロボットがそのライトをオンにするということをなおも
知るであろう。これは、マイクロコンピュータが、器素
ワードテンブレー1−7レイの第2の状態を、入来する
記憶されたアレイの第2の状態と比較し、分類が同じで
ないことを知るときに、話者のペナルティは、7の変数
5COREにおりる増加にすぎないからである。(これ
は、話者がワード゛’ l igl+ts”を’1ic
e”として言うときに見出されないワード°’ligh
ts”の無音状態に対し重み付は値からくる)。次に、
マイクロコンピュータは摩擦音型であるテンプレートア
レイの次の状態を、先に比較された入力ワードアレイの
同じ状態と比較し続ける。もちろん、この第2の比較に
おいて、2つの分類が一致し、変数5COREに対する
状態のみが、その状態のためのテンプレートに記憶され
た平均長さと、話されたその状態の実際の長さとの間の
差の絶対値である。したが−)て、ワード’1ice”
は“lights”として認識される。 次の表5は、好ましい実施例においC用いられるMot
orola Model MC68o5P2 l−1
MO8マイクロコンピュータとコンパチブルであるコン
ピコ−タブΩグラムをリストする。もらろん、第3図な
いし第8図のフローチル−1〜情報および上で与えられ
た一般的な説明を用いることによって、この発明は多種
多様なコンピュータプログラムま7jは特殊目的のコン
ピュータ装置を用いC実現されることが認識されよう。 表5 、OR03COH L D A # $ F F STA BDDR 3T A CD D R 8TA 、 TOYFLGCL RP O
R丁B TT16 CLR、A STA FONT STA VCNT STA 5CNT AX STA N 5l−A SE’G、X 5TA VOWL、X LDA #$7F STA TIMDAT TT2 LDA #5STA
DECAY TT32 CLRA T731 1NG’ ABNE
TT32 L D A # $ 7 I=SUB
T IMDAT STA ZCRA B S E T OP OR1−C BCLROPORTC LDA #$7に STA TIM[)AT L D A Z CRA CMP R2 BPL TT9 I N CS CN T LDA SEG、X 8EQ 丁T12 L D A S CN T CMP R3 BPL TTl 1 BRA TT10 BEQ TTl8 CL RA STA VOWL、 XBRA
TTl9 TTl8 1−DA VCNTSTA
VOWL、X TT19’ INCX CLRA STA SEG、 X5TA
VOWL、X TT12 CLRA STA FCNT STA VCNT LDA SCNT OMP #$10 BMI TT1’0 TST X BEQ TTl6 STX N JMP TT26 T 1−10 J M P ’T
T 2TT9 LDA SEG
、XBNE TT8 LDA ZCRA CMP #$10 B P L T T 7 JMP TT6 TT8 CMP #IBNE
TT5 LDA ZCRA CMP #$18 BPL ’ TT7 I N CV CN T J M P T T 4 TT7 1NG FONTLDA
FCNT cvp #2 BM I TT3 LDA SPG、X CMP #1 BEQ TTl5 CL RA STA VOWL、 XB RA
T T 1 4TT15 LDA
VCNTSTA VOW
+−、X TT14. INCX LDA #2 STA SEG、X TTl 7 CLRA S T A S CN TSTA
VCNT JMP T]−3 TT5 LDA ZCRAC
MP #$10 BPL PTTllA JMP TT6 PTllA INCFCNT JMP TTl7 TT6 INCVCNT LDA VA、CNT CMP #6 BM I TT3 L D A F CN TSTA
VOWL、 XINCX LDA #1 STA SEG、X TT4 CLRA S T A S CN TSTA
FCNT TT3 JMP TT2−r
T26 LDA 5EG−1,XB
NE TT30 DECX B E Q 1− T 29LDA
5EG−1,XTT30 CMP
#1B N E T
T 2 7LDA VOWL−1,XC
MP #6 BPL TT2’8 DECX J M P T T 26
R3TT27 CPX #3BPL
TT28 R4TT29
JMP TT16TT28 S
TX NRECDECN L D A # OR8 S T A X T MpSTA
CLASS LDA #$7F STA’ BEST R1LDA #I S T A Y T M PCI RS
CORE L D X X T M PLDA
REF、X S T A L CMP #$FF BNE R4 JMP EXIT INCGl−Δ8S JMP RI LDA N 5TA LI INCX 5TX XTM’P L D X Y T M PLDA
SEG、X L D X X 1− M PCMP
REF、 XBEQ
R5 LDA WT、X ΔDDSCOR[三 STA’ 5CORE INCXTMP INCX DECL JMP R7 R5LDA LN、 XLDX
YTMP SUB VOWL、 XBPL
R6 LDA VOWL、 XLDX
XTMP StJB LN、 XR6DECL D E CL、 I INCXTMP I N CY T M P S T A T E M PADD
5CORE S T’ A S CORER7LDA
L BEQ R9 LDA 、 LI BNE R8 LDX XTMP LDA WT、、X ADD 5CORE 8TA S CORE INCXTMP ECL JMP R7 R9L D A L I BEQ R10 LDX YTMP LDA VOWl、X LSL A CMP #$Δ BPL R91 ODA #$A R91ADD 5CORESTA ’
5COR−[”− INCYTMP DEC11 JMP R9 R10LDA SCOREBMI
R33 CMP B[:5T BPL R33 S T A 13E’ S TL r、)
A C[Δ5S STA ANS R33JMP R3 EXIT LDA PORTAAND
#$78 LSRA [3NE FX4 LDA #$40 E X 4 CM l) B E
S TBPL EXI BSET 7.POR−TB J M P T T 16EXI
LDA ANSSTA ’FOR
TB JMP TT16 上述したロボットの例から、この発明は、認識可能なN
葉の注意深い予めの選択により、話省の独立性および比
較的低い誤り率を!Jえることがわかる。このように、
表4から、認識可能な単nl”5earC11” 、
11stopIT、”go” 、 ” 11g11
ts” 、 Jjに ’Cf ” lights o
H” (7) トレbが、l1Jl t;状fQ4 ノ
ーiンプレートを有さないということがわかる。これに
よって、これらの3つの話された手詰の間の正確な区別
ができ、しかし同じ言語にお1ノる他のよく似た単語か
らこれらの単語のうらのどれかをIg別することはでは
ない。この発明は、システムのハードウェアを簡素化し
かつしたがって認識システムの価格および複雑性を有意
義に減するために、認識可能な単語を認識可能なグルー
プ以外の単語から区別づることはできない。 上述したシステムは、い(つかの重要な特徴を含む。最
初に、話された音声が、周期的にサンプルされ、かつそ
の゛個々のサンプルが、システムのフロントエンドフィ
ルタなしに、摩擦音型、母音型および無音間隔への零交
叉データのみを用いて区別される。これらの間隔の連続
づ゛るグループがカウントされ、かつそのカウントは、
そのシステムが摩擦音型状態、母音型状態、または無音
状態を規定するために予め定められた数に達しな番プれ
ばならない。特定の状態の存在を規定するために用いら
れるサンプルの特定の数゛は、その単胎内のその状態の
位置に依存しCbよい。たとえば、1つの単語の終わり
の母音型合が、母名型状態として認識されるために16
0ミリ秒の持続期間を有さなければならなく、それに対
し1つの単語の中央の母音が、母音型状態として認識さ
れるためにただ60ミリ秒の持続期間を有J−るだけで
よい。 状態の認識を達成するために、多種の、連続する、同一
の間隔の条件は、実際、システムヒステリシスの第1の
順序を与え、なぜなら、たとえば摩擦音型から母音型へ
の平均周波数内容の変化が、母音型シーケンスの前の成
る予め定められた持続期間に対する母音型の平均の残り
が、認識されるであろうことを必要とする。 システムヒステリシスの第2の形状は、特定のサンプル
増分を摩tl!l!音型または母音型として識別するた
めに用いられる零交叉の数の変更を可能にすることによ
り与えられる。たとえば、もし前の状態が無音ならば、
1600ヘルツ以上の平均の音声周波数を示′rj10
ミリ秒内の16の零交叉カウントが、摩擦音型間隔を与
えるであろう。しかしながら、もし前の状態が母音型状
態であったならば、零交叉カウントは、24を越えて、
2400ヘルツ以上の周波数平均で、前の無音状態の場
合よりもより高い周波数を示ず。これにより、母音型合
から摩擦音型寥への移り変わりを達成づることがより困
難になり、なぜなら母音型合の終了はしばしば、実際の
摩11A音型音を示ざない1600I3よび2400ヘ
ルツの間の範囲にお(〕る周周波数分を形成するからで
ある。このように、この第2の順序のヒステリシスは、
前の状態の基づいて変更可能である。 このシステムはまた、状態のシーケンスの終わりで短い
母音型状態の除去を与え、なぜならそれらはしばしば、
実際の母音の終わりよりもむしろ摩擦音型合の終わりに
おけるエネルギの消失から生ずることが判断されたから
である。 音声ワードの状態シーケンスを、記憶されたテンプレー
トの状態シーケンスと比較することによって認識が行な
われる。状態が一致すると、誤差のスコアは、話された
状態の長さと、テンプレートに記憶されたワードに対応
する期待された長さとの差だけ増大される。マイクロコ
ンピュータは、次いで、話されたワードアレイの次の状
態の分類を、テンプレートアレイの次の状態と比較し続
ける。状態が一致しないときは、誤差のスコアは重み付
は関数に従って増大される。マイクロコンピュータは、
次いで、話されたワードアレイの同じ状態の分類を、テ
ンプレートアレイの次の状態と比較し続ける。重み付【
ノ関数は、大ぎなエラーが、臨界的な状態にJ3いて不
一致であるときに作り出されるが、他方、さほど臨界的
でない状態にお()る不一致に対しては小さな誤差が発
生されるように選ばれる。事実、これによって、マイク
ロコンピュータは、ワードの認識にとって重要でないと
きは見つからない状態を無視することができる。
実質的にメモリの価格それ自体がそのシステムを消費者
市場の範囲を越えるので、比較的簡単な音声認識システ
ムには役立たない。 伯のシステムが音声認識のためにスペクトル分析の有用
性を認めているが、これらのシステムは、そのシステム
の詔象を拡げるために、I」音UおよびOならびに子音
T J5よびBのような比較的に<似た音声のエレメン
トを認識ツるように試みられてきた。 この発明は、1983年6月14日に発行された、アメ
リカ合衆国特許番号第4,388,495に開示される
音声認識マイクロコンピュータに関する改良である。親
出願および本件出願はともに、低価格の話者独立型音声
認識マイクロコンピュータを提供するものである。親出
願に開示される装置の場合、実質的に話者独立型が可能
であったが、2人の話者は、彼等が話した方法が非常に
異なっているため、一方の話者が成るワードの部分を声
に出さず、他の話者が声に出したときは、=1ンビュー
タは一連の付加的な記憶されたワードテンプレートが付
加えられない限り、同じワードとしてそれらを認識する
ことができなかったことが、検査の結果明らかになった
。この発明のマイクロコンピュータは、たとえワードが
実質的に異なる方法で話されても、付加的な記憶された
ワードテンプレートを必要とすることなり、IIJjじ
ワードの認識を可能にする。 この発明の一局面において、入来J−るγ′1声を、分
類された音声状態のアレイに分割しかつ各音声状態の長
さを測定して対応1゛る入米状態長さアレイを形成する
ための回路を含む音声認識装置が提供される。そして、
入来する音声状態アレイの分類を、記憶されたテンブレ
ードア。レイの分類で比較する働きをする回路が設けら
れる。記憶されたテンプレートは、分類されたワード状
態の第1のアレイと、対応する記憶されたワード状態の
少なくともいくつかの長さを示す一連の値からなる第2
のアレイとを含む。比較回路に応答して、他の回路は、
入来する音声状態アレイと、テンプレートワード状態ア
レイとの間の一致の度合の尺瓜を発生し、前記テンプレ
ートワード状態アレイは、入来音声状態と、一致する分
類を有するこれらの状態のための対応するテンプレート
ワード状態との間の長さの差の関数である。 この発明の他の局面において、この発明の音声認識装置
は話されたワードをとり、そのワードを一連の短い、好
ましくは10ミリ秒のワード部分に分割する。10ミリ
秒のワード部分の各々の間の話されたワードの平均周波
数は、音声信号パターンがしぎい値レベルと交差する回
数を計数づることによって決定される。このカウントは
零交差カウントとして示される。各10ミリ秒ワード部
分は、次いで、摩擦音型、母音型または無音としてその
平均周波数に基づいて分類される。一般に、周波数がよ
り高い周波数であれば、そのワード部分は摩擦音型とし
て分類され、それが中間稈度の周波数であれば、ワード
部分は母音型として分類され、かつそれが低いまたはO
の周波数であれば、そのワード部分は無音であるとして
分類される。 コンピュータはこれらのワード部分を集めて分類するの
で、それは絶えず、1組のワード部分が、共に、与えら
れた分類のワード状態へグループ分けされることがされ
るように3個の可能な分類の1つに分類される短いワー
ド部分が十分に接近して配置されているかどうかを決定
するようにチェックしている。一旦それがワード状態が
存在するということを決定すると、その状態の分類およ
びその状態の長さく時間持続期間)がマイクロコンピュ
ータにより記憶される。マイクロコンピュータは話され
たワードの10ミリ秒サンプルをとり、それらを分類し
かつ状態が認識されるべきか否かを決定し続ける。 いくつかの非無音状態が認識されかつそれらのそれぞれ
の長さとともに記憶された後、コンビ」。 −タは連続的にそのワードの終わりのためテストする。 そのワードの終わりは、10ミリ秒の部分の十分に長い
ストリングが無音であると分類されたときに決定される
。たとえば、この発明の好ましい実施例では、無音であ
るとして分類された16個の連続する10ミリ秒のワー
ド部分が、マイクロコンピュータがそのワードが完了し
たということを見出す前に必要とされる。 完了したワードが記憶装置に入れられたという表示があ
るとすぐに、マイクロコンピュータは、すぐに、入力さ
れた音声ワードから集められた状態のアレイを、マイク
ロコンピュータに永久に記憶される一連のワードテンプ
レートと比較する。 たとえ異なる話者によって全く異なつ1C風に話されて
も、それらのワードを同じものであると認識することが
できるのがこの比較プロセスである。 簡単な例がこのポイントを例示する。話されたワード゛
’ligbts”を認識することが望まれているものと
想定する。この発明のマイクロコンピュータへ話される
ときのこのワード゛’l1lJIItS”は3個の状態
のアレイをしばしば生じる。第1の状態は母音型であり
、第2の状態は無音であり、かつ第3の状態が摩擦音型
である。しかしながら、成る人は、そのワード冒11J
hts”を“’1ice”として発音する。その結果生
じる状態アレイは2つの状態しか有しない、すなわち、
第1に母音型状態おJ:び第2に摩擦音型状態である。 “t′°音が形成されているので通常生じる無音状態が
省略された。しかしながら、無音状態はそのワード(こ
の例において)を識別するのに絶対的に必要とされない
ので、この発明のシステムは3個の状態アレイ、母音−
無音一摩擦音、または2状態アレイ、母音−摩擦音が見
出されるかどうかのワード認識を可能にする。 この融通性を与える1つの方法は、コンビ−1−夕が与
えられたフードであると認識しなIプればならない異な
る可能な入力状態アレイの各々をカバーするためより多
くのテンプレートを付加えることであろう。しかしなが
ら、話者間の非常に数多(の変動を有する任意のワード
に対しては、記憶容量が問題となる。 この発明の解決は、マイクロコンピュータが認識しよう
と意図される各ワードごとに各テンプレートの3個のア
レイを記憶することである。第1のアレイは任意のワー
ドに対するずべての可能なワード状態のリストである。 これらのワード状態は、それらが任意の話者の音声にお
いて生じるであろう順序でグループ分けされる。しかし
ながら、多くの場合、話されたワードの分析の後コンピ
ュータによって決定されるワード状態アレイにおいて正
確に見出されるであろうよりも、テンプレートワード状
態アレイに、より多くのワード状態がある。これは、ワ
ード゛’ l ights” ’を’1ice”として
言う人が、コンピュータが彼のワード’1ice”をち
ょうど2状態(母音−摩擦音)のアレイで登録するとい
うことを経験して知るであろう場合の、上述の例におい
て図解される。°“lights”のためのワードテン
プレートのワード状態アレー7は、しかしながら、可能
な3個のすべての状態、母音−無音−摩擦音を含む。 テンプレートにおける第2のアレイはテンプレートのワ
ード状態アレイの各状態へ割当てられる一連の重みまた
は数値であるa ”3えられたワードの認識において非
常に重要である状態に対しくはより高い重みが与えられ
、かつ与えられたワードの認識においてそれほど重要で
ない状態に対してはより低い重みが与えられる。上述の
例では、本来の母音型および最終の摩擦&型状態にはよ
り高い重みが割当てられ、他方、さほど重要ぐない中央
の無音状態にはより低い重みが割当てられる。 第3のアレイは平均的な話者が特定の状態を発生するの
に費す時間の長さを示J−各状態ごとの数を提供づる。 たとえば、ワード’lights”において、平均的な
話者は母音状態において220ミリ秒、無音状態におい
て20ミリ秒および摩擦音状態において120ミリ秒を
費すということがわかっている。 上述したように、状態アレイが未知の入力ワードのため
に形成された後、コンピュータは、テンプレートアレイ
のエレメントを入力音声アレイのエレメントで比較する
。前述したように、入力ワードはそのワードの各状態の
分類を示すワード状態アレイと、話者が各別々の状態を
発生した時間の量を示す長さアレイとを有する。マイク
ロコンピュータの賄flkを表わす一連のテンプレート
の第1のテンプレートから始まり、コンピュータはまず
入力された話されたワードの第1の状態を、第1のテン
プレートワードの第1の状態と比較する。 第1の状態の分類が同じであれば、コンピュータはその
状態のための平均長さと、その状態のための実際の話さ
れた長さとの間の絶対的な差を計算する。この値が、次
いで、5COREの符号の付いた変数に既に記憶された
聞へ加えられる。もしこれが、そのワードのために比較
されている第1の状態であれば、その変数5COREは
前もってOにセットされていたであろう。 他方、そのテンプレートの第1の状態が入来するワード
の第1の状態と同じ分類を有していなければ、第1の状
態に対応する、重み付けするアレイの値は変数5COR
Eへ加えられるであろう。 第1の状態の比較が行なわれた後、コンピュータは第2
の状態を比較する。ワードテンプレートの第1の状態お
よび入来するワード状態アレイの第1の状態の分類が同
じであったならば、マイクロコンピュータは入来ワード
状態アレイの第2の状態を、テンプレートアレイの第2
の状態で比較するであろう。もし分類が同じであれば、
再び長さの差の絶対値が変数5COREへ加えられる。 もし一致がなければ、テンプレートワードアレイの第2
の状態へ割当てられる重みは変数5COREへ加えられ
るであろう。 もし第1状態の分類が本来的に一致しな(プれば、コン
ピュータはテンプレートアレイの第2の状態を、入来ワ
ード状態アレイの第1の状態と比較する。第2の比較の
ための状態数におけるこの不一致は、元の状態の不一致
が入来ワード状態アレイにない状態に起因したとの想定
に起因する。もしこのときに一致があれば、長さ間の差
の絶対値が5COREへ入れられ、もし分類間に一致が
なければ、テンプレートワードアレイの第2の状態へ割
当てられる重み番よ■す変S CORI=へ加えられる
。 テンプレート・ワードの終わりJ、たは入来ワードアレ
イの終わりに達りるJ、でこのプ1]レスが続く。 まず、テンブレー1−フフレイの終わりに達すると、入
来ワード状態7レイの残りの状態の良さが共に加えられ
かつ変数s c OREへ加えられる。これらの長さの
いずれか1つが任意のしきい値レベルの下であれば、間
違った伯が差し替えられ他の長さとともに合=1される
。もし最初に入来ワード状態アレイの終わりに3!¥り
ると、テンプレートワードの残りの状態にλ!l I、
i> iJる■みが其に加えらね、変数S COREへ
加えられる。 入力ワード状態アレイと第1のテンプレートワードのテ
ンブレートアレイとの比較を完了しI、:後、コンビ」
−夕は入来ワード状態アレイを第2のテンブレー1〜ア
レイで比較覆る。上述の比較に類似りる比較の後、変数
s c o r< IEの伯が変数5COREのための
前の(1t1と比較され、低い方の値に対応1゛るテン
ブレー1〜が正しいワードであるとして仮に示される。 マイクロコンピュータにおけるすべてのテンプレートが
入来ワード状態アレイと比較された後、最も低い5CO
REの伯を有するテンブレ・−トが認識されるべき最も
可能性のあるワードであるとして示される。このテンブ
レー!・のための変数S COREの値は、次いで、前
に決定されたしきい値と比較される。この値がこのしき
い値を越えていれば、そのワードは拒絶され、何のワー
ドも認識されない。しかしながら、その値がしきい値よ
りも低ければ、そのワードは、変数5COREのための
最も低い値を有するテンプレートに対応するワードであ
ると認識される。 ワード’lights”の場合、記憶されたテンプレー
トは3個のアレイを有する。第1のアレイ【よ3状態を
有するであろう。これらの状態は母音型、無音およびr
!Jtll音型であろう。各状態ごとに選択される対応
の重みはプログラマがそれら状態の各々に割当てた重要
性に依存する。発音“1ice’″がワード゛’lig
hts”のために認識されるべきでdりる状況では、第
2の状態は低い重みを割当Cられるであろう。したがっ
て、たとえば、重みアレイは10.7および10であっ
てもJ:い。上述したように、これらの状態のための平
均長さは経験的に決定される。したがって、長さアレイ
は22.2゜′12でもよい。これらの数は好ましい実
施例では10ミリ秒のユニットにある。もし入来するワ
ードがワード” l ights”を“1ice”とし
て発音する人によって話されたのならば、その入来Jる
ワード状態アレイは2状態、すなわら1つが母音型で1
つが摩擦音型を有するであろう。これらの状態の長さが
平均である(換言すれば、母音型状態に対応する長さが
220ミリ秒であり、摩擦音型状態に対応する長さが1
20ミリ秒である)と想定すると、入来ワードのための
長さのアレイは22および12であろう。したがって、
この入来ワード状態アレイがワード“’l1gM5”の
ためのテンプレートアレイと比較されると、次の結果が
生じる。 テンプレートにおける第1の状態は入来ワードの第1の
状態と比較され、その分類は同一であると判断されよう
。次いで、コンピュータはそれらの長さを比較し、それ
らもまた同一であろう。このように、変数5COREへ
加えられる量はOであろう。次のステップはテンブレー
1〜の第2の状態を入来ワード状態アレイの第2の状態
と比較することである。2つの状態の分類が異なるので
、テンプレートの第2の状態の重み(すなわち7)が変
数5COREへ加えられるであろう。次に、マイクロコ
ンピュータはテンプレートの第3の状態を入来ワードの
第2の状態と比較覆る。これらの状態は同じ分類であり
かつまた同じ長さのものであるので、変数5COREへ
は何の付加的な値も加えられない。その結果は、“冒i
ce”と発音されたワード゛lights”のための変
数5COREの値は7であろう。マイクロコンビュ°−
タテンプレートアレイにおける他のεrj柔ワードが正
しく設定されれば、これは最も低い点数でしきい値以下
でなければならない。コンピュータは、ワード”11g
11t s ″がRHされたということを示す。 このように、同じワードが、実質的に異なる発音をする
異なる話者によって話されたときにそのワードを同じワ
ードであると認識することができる低価格の音声認識マ
イクロコンピュータが開示される。 初めに第1図を参照Jると、もし入来する音声信号が、
10ミリ秒のペースでサンプリングされたならば、1キ
ロヘルツの正弦波周波数が、10ミリ秒について正に進
む10の零交叉カウントを与えるであろうということが
理解できる。同様に、5キロヘルツの周波数は、零交叉
しぎい値が、検知された正弦波の頂点の間にあるならば
、10ミリ秒について50の正に進むμ交叉カウンi−
を発生する。もし、音声パターンの羽1測において、過
度に限定される増幅器が用いられるならば、実質的にす
べての音声パターンが、その増幅器を飽和し、かつ零交
叉カウントを発生する。このように、過度に限定された
増幅器からの電気信号をモニタすることにより実現され
るその最後のカウントは、平均周波数測定を与える。第
2図にお【ノるブロック図に示されるように、この発明
のシステムにおいて、マイクロフォン11が、すべての
音声信号が零交叉データを発生するように飽和される高
利得のオーディオ増幅器13へ、オーディオ信号入力を
与える。この信号は、たとえばM Qtol・ola3
emiconductorsにより製造されるMC6
805P2マイクロコンピユータチツプのようなマイク
ロコンビコータチップ17のタイマ入力への線75に与
えられる。このタイマ人カフ5は、0.8ボルトのしき
い値電圧で負へ進む信号を検知し、そのため、もしオー
ディオ増幅器13が、飽和において5ポルl〜の出力を
与えるならば、そのタイマへの入力は、マイクロフォン
11に与えられる音声信号の平均スペクトル周波数に等
しい周波数で生ずるであろう。 マイクロコンピュータ17内で、リードオンリメモリ1
9が、認識されるべき単品に対するファームワードの音
声テンプレートと同様に、音yji認識システムのため
のファームウェアを含む。このように、台座認識システ
ムが理解づ′べさ°予め定められた選択された詔常が、
マイクロコンピュータ17の製造のときに、または少な
くともマイク[1コンピユータ17を販売する前に、リ
ードオンリメモリ19内に永久的に記憶される。このよ
うに、この音声認識装置を使用する間語葉の訓練がなさ
れず、かつしたがって、その語粟を認識可能な単語のグ
ループに予め設定しかつ音声認識システムを安価で生産
することを可能にづるために、初めの製造のときにその
仕事がなされる。 リードオンリメモリ19内に記憶されたファームウェア
に従って、第2図の音声認識システムは、第3図ないし
第8図のフローチャートにおいて表わされるプロセスに
よって、マイクロフォン11からの入来する音声データ
を分析する。 最初に第3図を参照すると、そのシステムは、最初マイ
クロコンビコータ17に電力が送られるとステップ11
1で初期設定される。この初期設定は、その装置のため
の出力ポートとして、第2図のボートA、BおよびC:
それぞれ21.23゜および25を指定する。これらの
ポート21ないし25の各々は、マイクロコンピュータ
17のための出力または入力として動作し得、かつこれ
らのポートの指定は、音声認識から生ずる出力データが
、ボートA、BおよびCのいずれかで与えられることを
可能にすると、いうことが理解できる。 この指定はステップ113で生じ、その後マイクロコン
ピュータ17のランダムアクセスメモリ27のレジスタ
に記憶された変数がステップ115で初期設定される。 第3図のフローチャー1−および第4図ないし第6図の
他のフローチャートは、分岐点からのようなシーケンス
のリターンをそのフローチャート内の多種なジャンプポ
イン1〜内に与えるリターンポイントTT16.117
のようなリターンポイントを含む。 ステップ115で初期設定される変数は、以下を含む:
F、CNTは、摩擦音型カウントであり、かつ非常に高
い周波数または摩擦音型音声エネlレギを有する10ミ
リ秒の間隔の数を規定する。VCNTは、非常に低い周
波数の音声パワーを有づる母音型10ミリ秒間隔をカラ
ン1〜iIるために用いられる変数である。5CNTは
、実質的に音声内容を有さない10ミリ秒の無音の間隔
をカウントするために用いられる変数である。Xは、音
声パ少−ンを認識するために用いられる状態シーケンヌ
内で連続する状態(摩擦音型、母音型、無音)を数で識
別するために用いられるポインタ変数である。蛯数Nは
、入来する単語に対する状態の総数を規定する。 ステップ119において、1対のアレイが初期設定され
る。アレイSEG (X)は、入来する単語に対する実
際の状態のジ−タンス、すなわち摩擦音型、母音型また
は無音のような各セグメントを識別する各ゼグメン1〜
Xに対するデータを含む。 アレイVOWL (X)は、状態の長さ、すなわち特定
の状態として識別されたレグメントX内の10ミリ秒の
期間の数を規定する。 これらの変数およびアレイは、以下の表により、よりよ
く理解でき得る。 紅 5EG(X)’:摩擦音型−2 母音型 =1 無音 −〇 単語:5ix N=4 上の表から、SEG (X)は、その状態が摩擦音型、
ずなわら主に高い周波数の音響的エネル−1゛であるな
らば、1つの単語内の特定の状態に対して2として規定
されることがわかる。同様に、もしその単語の状態が、
主に母音型ならば、S[G(X)は、1として規定され
、一方Oが無音状態を規定づ−る。以上に示されるよう
に、単語゛six”対して、典型的な発音にJ5いて、
Nが4に等しいような4つの連続的な状態がある。1か
ら4のXの値に対して、SEG (X)は、シーケンス
2102 、すなわち摩擦音型、母音型、無音、摩擦
音型である。単語“”six”の最初の“S″は、11
X”が1に等しいところで摩擦音型状態を与える。単
語sixにおける母音は、Xが2に等しいところで母音
型状態を与える。単語sixにおけるX音の形成の前に
、摩擦音的なXを発生するためにエネルギが蓄積される
ときに、声道は閉じられてX=3でSEG (X)=O
により規定される瞬間的な無音を生ずる。この短い無音
の後に、X=4でSEG (X)=2に示される摩擦音
型X音が続く。 アレイVOWL (X)は、単語sixの各状態の持続
期間を規定する値Q+ 、Q2 、Q、、Q、を記憶す
る。 以下の説明からJ:り理解できるように、たとえば、X
=1またはX=4で摩擦音型状態を規定するために、摩
擦音型の音声エネルギは、予め定められた持続期間を有
しなければならない。この持続期間は、摩擦音型エネル
ギが生ずる間の10ミリ秒時間の期間をカウントする変
数FONTにより計測される。同様に、上記の例におい
てX=2の母音型状態は、母音型の平均周波数が予め定
められた持続期間の間存在すること必要とし、それは変
数VCNTを用いて記憶される。変数5CNTは、同様
の態様で無音持続期間をカウントするために用いられる
。 第3図に示されるシーケンスを参照すると、ステップ1
15および119における変数およびアレイの初期設定
に続いて、マイクロプロレザ1フ内の零交叉カウンタ3
1が、ステップ121で開始される。これによって、カ
ウンタ31は、高利得のオーディオ増幅器13がプリス
ケーラ33のしきい値、この例では0.8ポル1−を横
切るごとに増分される。リターンポイントT12は、第
3図において123で示され、かつ上)ホしたようにこ
のシステム内のルーピングを与えるために用いられる。 ステップ125において、10ミリ秒の遅延が、零、交
叉カウンタがステップ121で始動また後に′すぐに開
始される。この10ミリ秒の遅延は、第2図に示される
6タイマ31およびタイマ制御器35により計測される
。この10ミリ秒遅延の終わりに、第2図のRAM27
にお、いて記憶された変数ZCRAが、カウンタ31内
のカウント、すなわちこの10ミリ秒期間の間の合計の
零交叉カウントに等しくされる。ステップ127で示さ
れるようにこの値が記憶されて、零交叉カウンタ31が
、すぐにリセットされ、かつ再びステップ129で始動
し、そのため次の10ミリ秒期間のための零交叉データ
が、累算され、それとともにRAM27において変数Z
CRAとして記憶された最初の10ミリ秒期間からの零
交叉データが分析される。このマイクロ処理システムは
、充分早(、それが最初の10ミリ秒の時間データに関
係しながら、ステップ125にお1プる10ミリ秒遅延
の終わる前に処理のすべての残りの部分を完了すること
ができる。このように、以下に示される説明かられかる
ように、この最初の10ミリ秒データが分析された鴇、
プログラムは、ポイントTT2,123に戻り、ステッ
プ125における次の10ミリ秒期間の終わるのを持ち
、そのため次の零交叉カウントがステップ127で記録
され得る。 入来する零交叉カウントを分析する第1のステップは、
このカウントと2とを比較することである。もしこの零
交叉カウントが2よりも小さいならば、第1図に示され
るように、1iA75上でそのシステムに入る主なエネ
ルギは、200ヘルツよりも低く、また零交叉がない場
合には存在しない。 これは、無音期間として解釈される。このように、ステ
ップ131で行なわれる比較は、70−ヂヤートの分岐
ステップを規定し、もし零交叉カウントが2よりも小さ
いならばステップ133への続行した処理を指示し、か
つもし零交叉カウントが2を越えるならばそれをルーピ
ングポイント「T9.135へ向ける。すなわち、もし
、この10ミリ秒期間の間に、線75(第2図)上の入
来信号が、無音を示すならば、そのシーケンスはステッ
プ133で続行する。他方、もし認識可ロヒな音声が存
在するならば、そのプログラムはT79゜135ヘジヤ
ンプするであろう。 もし、この特定の10ミリ秒期間に対して、ZCRAレ
ジスタ位置に記憶される零交叉カウントが2よりも小さ
いなら、すなわち無音を示すならば、ステップ133は
、変数5CNT、無音カウンティング変数を増分し、そ
のためこの変数は今1に等しく、1つの無音10ミリ秒
期間を示す。 以下の説明から明らかなように、変数5CNTは、10
ミリ秒の無音の増分の合計数をカウントして実際の無音
状態が存在するかどうかを決定するために用いられる。 もちろん、今説明されているシーケンスのポイントで、
もしこの全プロセスがちょうど始まっているところなら
ば、この最初の無音の増分は、認識されるべき音声が未
だ始まっていないということを示す。このことは、ステ
ップ137において一1現在のセグメント、すなわちモ
ニタされた最も最近の状態が、0すなわち無音に等しい
かどうかを判断づるために、1直5EG(X)とOとを
比較する。プログラムオペレーションの初期におけるこ
の例では、SEG (X)は、ステップ119でOに等
しくされたので、分岐ステップ137は、そのシーケン
スにポイントT712゜139において続行するように
指示する。このリターンポイントTT12.139は、
第3図りフローチャートにおいて後で示されるリターン
ポイント139へのそのシーケンスにおけるジャンプを
与える。上述したように、今無音状態にあり、かつ他の
無音増分を計測しステップ133で無音カウントを増分
したので、FCNT変数および■CNT変数が、ステッ
プ141でOにセットされる。その合計の無音カウント
は、次にステップ143で、16の10進数に等しい1
6進数字10と比較される。要するに、このステップ1
43は、10ミリ秒の16倍すなわち160ミリ秒の合
泪した無音期間を示す16にその無音カウントが達した
かどうかを判断する。もし無音カウントが16よりも小
さいならば、そのプログラムは、」二連したリターンポ
イントTT2.123に分岐してより大きな零交叉、1
0ミリ秒データを得る。しかしながら、もし16の無音
カウントがあれば、そのシーケンスはステップ145で
続行される。 ステップ145において、変数Xは、何らかの状態がこ
の単語に対して記録されたかどうかを判断するためにO
と比較される。本質的に、このステップ145は、その
シーケンスが単語の最初の部分を今なお持っているかど
うかを判断するためのテストである。もしXが0に等し
いならば、そのプログラムはリターンポイントTT16
.117に戻され、そこで変数およびアレイがステップ
115′および11って再び初期設定されかつデータ収
集がステップ121で再び始まる。 しばらくすると成るポイントで、プログラムが上述した
シーケンスを介して連続してループしていた後、それを
各160ミリ秒の無音ごとに再び初期設定し、単語が話
されて、最初の右意義な零交叉データを線75(第2図
)に与えられる。10ミリ秒のサンプリング期間が、2
以上にZC’RA零交叉カウントを与えるときのポイン
トにJ3いて、ステップ131は、そのプログラムを分
岐してポイントTT9.135に戻す。このリターンポ
イントT79.135は、第4図において最初のステッ
プとして示される。 第4図は、現在のサンプルが、線75(第2図)で入来
する音声が無音でないことを示したとぎ、ポイントT7
9.135において始まるのみである。今、その音が、
この10ミリ秒間隔において摩擦音型または母音型かど
うかが判断されなければならない。このテス1〜は、現
在の状態5EG(X)と0どを比較する分岐ステップ1
47で始まる。もし、この例において、そのシーケンス
が音声の最初にあるならば、SEG (X)が、ステッ
プ119においてOにセットされかつしたがってそのシ
ーケンスが分岐ステップ11!I9で続行することが思
い出される。このステップにおいて、零交叉カウント、
ZCRΔは、16進10または10進16と比較される
。もしその零交叉カウントがステップ131で判断され
たように2よりも大きくかつ16よりも小さいならば、
第1図にd5いて示されるように、検査される10ミリ
秒期間の間のその平均周波数は、200ヘルツ以上でか
つ1600ヘルツ以下であり、さらにそれは母音型音声
として解釈される。このように、リターンポイント15
1を通った後、ステップ153は、母音型10ミリ秒間
隔をカウントするために用いられる変数VCN’−1−
を増分する。ステップ155において、変数VCNTの
値、すなわち母音型10ミリ秒間隔の合計数は、60ミ
リ秒の母音型間隔があるかどうかを判断するため、6と
比較される。この例において、分岐ステップ155は、
我々がちょうど単語を始めたので、la V CN T
は、ステップ153において1に増分されたことを示し
、かつそのシーケンスは、リターンポイントTT2.1
23に戻されて付加的な10ミリ秒入力データを収集す
る。このように、1つの10ミリ秒サンプリング期間が
、母音型状態を規定するのに不充分であるので、状態は
未だ認識されない。 しかしながら、変数V CN Tは、200および16
00ヘルツの間の周波数でその主なエネルギを有してい
る音声でこの単語が現に始まるかどうかを判断するため
我々は母音型10ミリ秒期間をカウントし続けるように
、その関数V CN 1−が増分された。 もし、リターンポイントTT2.123に戻ることによ
って、今、5つの付加的な時間について、各時間が、ス
テップ153が変数VCNTを値6に増分するように上
述したシーケンスに従う−bのと仮定すると、そのシー
ケンスはステップ152へ続く。ステップ152におい
て、S[EG(X)が値2と比較されて、先のワード状
態の分類がどのようなものであったかを決定する。この
理由は、そのワード状態の長さがどのようなものであっ
たかを決定したいからである。もし先のワード状態が摩
擦音型であれば、SEG (X)が2に等しいことがわ
かり、リターンポイントTT24.1’54を通過して
ステップ156へ進み、ステップ156にJINT、V
OWL (X) がFCN−1に等しくなるようにセッ
トされ、リターンポインj−王T25.15Bへ移る。 もし先の状態が無音であれば、SEG (X)は2に等
しくなく、ステップ160へ進み、ステップ160にお
いて、VOWL(X)を5CNTに等しくなるようにセ
ットし、TT25.158へ進む。次のステップは15
7であり、ポインタ変数Xが増分され、それによつてそ
れは1に等しくなり、認識されるべきワード内の第1の
状態を識別する。ステップ159で、SEG (X)の
第1の状態が1にセットされ、5EG(1)のための母
音型状態を示′cJ。 ステップ159における第1の状態を規定して、もし、
6の合計の母音型増分が生ずる時間期間の間に介在する
無音カウントおよび摩擦音型カウントがあるならば、そ
のプログラムは、リターンポイント161.TT4を介
して、変数5CNTおよびFCNTがOにセットされる
ステップ163に続行し、そのため5CNTおよびFC
NT変数の新しいカウンティングが再び始まり、かつそ
のシーケンスは第3図において示されるリターンポイン
ト123で続行される。 もしこの単語の初めにおいて、母音型音よりもむしろ摩
擦音復音が、線75(第2図)上に現われるならば、ス
テップ149における分岐テストが、16進10.また
は10進16を越えて零交叉カウントを与え、1600
ヘルツを越えて平均の音声周波数を示したであろう。こ
の場合、そのシーケンスは、リターンポイント’T’T
7.165を介して、摩擦音型10ミリ秒サンプルをカ
ウントするFONT変数が増分されるステップ167へ
続行する。変数FONTは、次にステップ169で値2
と比較されて、合呂1して20ミリ秒の摩擦音復音がモ
ニタされたかどうかを判断する。もし最後の状態の規定
から20ミリ秒以下の摩擦音復音がモニタされたならば
、そのプログラムは、ポイントTT2.123に戻るで
あろう。しかしながら、もし変数F CN 1’が、値
2に等しいかまたはそれよりも大きければ、分岐ステッ
プ171は、最も最近規定したワード状態が母音型音で
あったかどうかを決定する。ここで説明している例では
、SEG (X)は0に設定されたことが認識され、し
たがって、プログラムはステップ173に続き、ステッ
プ173において、変数<VOWL (X) )が5C
NTに等しくなるようにセットされ、プログラムはポイ
ントTT14.175へ戻る。後者の例では、単語の最
初にお【ブる以外、母音型音が摩tl!音型音に先行す
るとき合計の母音カウント変数VCNTを記憶すること
が有効であろう。このように、もし分岐ステップ171
におけるテストが、最も最近にモニタされた状態が母音
であることを示すならば、そのプ[1グラムが、リター
ンポイント1−T1’5,177を介して続行され、変
数VOW+−1X)を増分ステップ153において予め
記憶されたIII!V CN Tと等しくする。 これは、ステップ179に83いて生ずる。この手続は
、それからリターンポイントTT14,175を介して
続行され、上jホしたステップ175と同様の態様でス
テップ181においてXを増分して、上述したステップ
159と同様、のステップ183で、SEG (X)ア
レイにJ3ける次の状態を摩擦音復音すなわち2と規定
し、かつその手続は、リターンポイントT’r17,1
85を介して続行される。上述したようにステップ16
3と同様の態様で、ステップ187におけるシーケンス
はそれから、変数5CNTおよびVCNTをリセットし
、かつイ1加的なデータの収集のため、第3図のポイン
トT T 2 、ステップ123にそのプ[Iグラムを
戻す。 以上の説明から、分岐ステップ147で判断さ
れたように、もし前の状、態が照合なら、認識されるべ
きこの単語の第1の状態どして、60ミリ秒の合計の母
音型持続期間が、母音型状態を規定し、かつ20ミリ秒
の金品1の摩擦音型持続期間が、摩擦音型状態を規定づ
る。 本質において、これまでに)小べられてさたものは、予
め定められた状態が、予め定められた時間、この場合母
畠型音に対しては60ミリ秒かつ照合に続く摩擦音復音
に対しては20ミリ秒の間、このシステムにとって入来
りるデータを特定の状態として受入れるために続くこと
を必要とするこのシステムにおけるヒステリシスの形式
である。 以下の説明において明らかになるように、前の状態の識
別は、特定の音声が母畠型かj、たは摩擦音型かどうか
を判IFi’llるために用いられる周波数の識別を変
えるために用いられる。このように、ステップ149に
おいて、前の状態が、ステップ147において無音とし
て規定されたので、1600ヘルツを越える周波数は、
摩擦音型としC規定された。以下の説明から明らかなよ
うに、もし最も最近に規定された状態が母音であるなら
ば、特定の10ミリ秒間隔は、もしその間隔の平均の周
波数内容が2400ヘルツを越えないならば摩擦音型と
して規定されbい。これは、もし母音型置から摩擦音型
合へ進むしきい値が増加するならば誤り率が減少すると
いうことがわかるので、無音の後の摩擦音型合よりも母
音の後の摩擦音型合を認識づることをより困難にするヒ
ステリシスの付加的な形式である。このように、それぞ
れステップ169および155における摩擦音型および
母音型持続期間の必要物により生じたこのシステムの基
本的なヒステリシスに加えて、前の単語の状態に基づい
て母音型および摩擦音型10ミリ秒間隔の間の周波数の
移り変わりの個所を変えることにより、変更可能なヒス
テリシスがこのシステムに導入される。 以下のシーケンスは、このヒスプリシスの原理を述べる
。もし、ステップ147において、最も最近に規定され
た単語の状態が無音でないことが判断されると、プログ
ラムシーケンスは、ポイントTTS、189を介して分
岐ステップ191に続行され、そこT−8EG(X)と
値1どを比較することにより前(7)単語の状態が母音
型置であるがどうかを判断する。もし前の状態が母音型
置であるならば、そのシーケンスは、ステップ193に
分岐し、そこで零交叉カウントが、2/100ヘルツの
周波数平均を示す16進値18づなわち10y#値24
と比較される。もしその値が2400ヘルツを越えなか
ったなら、そのプログラムは、ステップ195に進み、
変数VCNTを増分し、この10ミリ秒期間を母音型と
して識別しかつそのシーケンスを上述したリターンポイ
ント]−■4 。 161に戻す。他方、もし分岐ポイント193において
、周波数内容が2400ヘルツを越えるならば、そのプ
ログラムは、上述したリターンポイントTT7.165
に進み、かつ変数FONTをステップ167で増分する
。このように、J!!擦潟型10ミリ秒期間に対する周
波数しきい値が、予め記録された単語の状態が母音また
は無音状態がどうかに依存する。 もし煎の状態が母音型置ならば、ずなわちステップ15
5においてなされたテストが、60ミリ秒の母音型置が
生じかつアレイ5EG(X)がステップ159において
セットされて母音型状態を示すということを既に表わし
たならば、分岐ステップ193に達するということを注
目すべきである。もちろん、これが比較的長い母音の音
声の表示であるのみであるから、別の母音型状態が、あ
る、母音型状態に続くことは望ましくない。このように
、ステップ195において生ずるVCNTの増分とリタ
ーンポイン1〜TT4,161へのプログラムのリター
ンとが、母音型状態が、他の間隔、無音または摩擦音型
合が遭遇されるまで規定されたとすれば、連続する母音
型間隔の累算を単に与え、その付加的な母音型間隔は、
付加的な母音型状態を与えない。 同様に、分岐ポインl−191において、5EG(X>
の1との比較が、前の状態が1でないことを示したなら
ば、かつ分岐ステップ147が、前の状態が無音でない
ことを示したので、そのプログラムは、もし前の状態が
S擦音型音であると識別すればステップ197に分岐す
るであろう。この場合、最も最近の10ミリ秒間隔に対
する零交叉データが16を越えるならば、これは最も最
近の摩擦音型状態を与えた摩擦音型合の連続して登録さ
れ、かつ長さカウンタF ON Tはステップ198で
増分される。そのプログラムは、上述したリターンポイ
ン1−TT7,185に分岐して、そのプログラムが、
付加的な摩擦音型状態を与えることなく付加的な摩擦音
型70ミリ秒間隔を累算することを可能にする。2つの
連続する#振音型状態は、比較的長い摩擦音型合よりも
むしろ連続する位四で1つの単語内で2つの摩擦音型の
形状を誤って示すからである。他方、もし前の状態が、
摩擦音型合であるならば、かつ最も最近の10ミリ秒間
隔のサンプルが160’1ヘルツ以下の周波数平均を与
えるならば、分岐ステップ197は、上述したリターン
ポイントTT6.151にプログラムを戻して母音型置
の初めを識別する。 ステップ195、ステップ155で規定されたカウント
6を越える母音型カウントの連続に続いて、そのプログ
ラムは、リターンポイントTT4゜161で戻り、変数
5CNTおよびFCNTをOにセットして、そのため母
音型音の中央の随時の無音型間隔および摩擦音型間隔が
累算されずに、もしこれらの10ミリ秒サンプルが連続
して生じないならば無音状態または摩擦音型状態を誤っ
て示す。このように、1つの摩擦音型または無音のサン
プル間隔が母音型力ウシティングシーケンスの中央で生
じる限りは、変数5CNTおよびF CNTは、0にさ
れてこれらの変数の非連続的fzカウントの累算を禁止
する。 同様なシー、ケンスが、リターンポイントTT17.1
85で生じ、摩擦音型金が生じかつ離れた無音間lll
1および母音型間隔が生ずる限り、ステップ187にお
いて変数S CN T LJ−3よびVCNTをリセッ
トする。 第3図を再び参照すると、もし成る音が存在したならば
そのシーケンスが分岐ステップ131からリターンポイ
ントTT9,13!:lに分岐して、非無音間隔を示し
、かつステップ137において、もし無音間隔が単語の
初めにあったならばそのシーケンスはリターンポインh
TT12.139に分岐するということが思い出される
。1:)シ、分岐ステップ137において、最も最近に
記録された単語の状態が無音でないことが判断されるな
らば、かつステップ131において現在の10ミリ秒サ
ンプル間隔が無音状態であると判断したならば、そのシ
ーケンスは、ステップ199に分岐し、そこで変数5C
NTの現在の値が、値3と比較されるであろう。すなわ
ち、無音期間が30ミリ秒、つまり音声エネルギが破裂
型合のために蓄えられる間声道の前破裂音の閉鎖のよう
な単hh内の短な無音状態獲得するのに充分な時間期間
を越えたかどうかに関する判断がなされる。もし変数S
OX丁が、3を越えないならば、そのプログラムはリタ
ーンポイントTT2.123に分岐してより多くの間隔
データを集める。もし変数5CNTが植3を越えるなら
ば、そのプログラムは、分岐ステップ201に続行して
、最も最近に記録された単語の状態が母音型音であるか
どうかをテストする。 もし無音状態の前の最後の状態が、母音型状態であるな
らば、そのプログラムはリターンポイントTT18,2
03を介してステップ205に続行し、そこで変数VO
WL(X、)が、ステップ179(第4図)における母
音型音の合計の持続期間に等しく予めセットされた変数
VCNTに等しくセットされる。もし最も最近の状態が
摩擦音型金であるならば、分岐ステップ201は、プロ
グラムをステップ207に続行し、そこで変数■OWL
(X)に摩擦音型状態、FONTを記憶する。 それからそのシーケンスが、リターンポイント19.2
09を介してステップ211に続行され、そこで値Xが
増分され、かつその無音のカウント変数5CNTが3を
越えたので(ステップ199)、変数SEG (X)は
、ステップ213における無音状態を規定するようにセ
ットされる。同時に、変数VOWL (X)がリセット
され、これは、ステップ311における増分によって、
ステップ2(j5においてセラ1〜された位置の後のV
OW+−アレイお番)る次の連続する位置である。 上述したように、ステップ141はそれから、変数5C
NTおよびF CN ’T’をリセットし、かつ無音の
合計の持続期間、すなわら変数5CNTの値が16を越
えるかどうかを判断するためにステップ143において
比較がされる。無音カウン1−が160ミリ秒を越えた
とすると、上述したJ:うに、前の単語の状態が記録さ
れたかどうかの判断が分岐ステップ145においてなさ
れる。もし単品の状態が記録されたならば、160ミリ
秒の無音の持続期間が、単語の終わりを示すのに充分長
いとして規定され、かつしだかってそのプログラムはス
テップ147に分岐し、そこでその単語内の状態の合計
数を示づ変数Nが、変数Xに等しくセットされ、記録さ
れた単語の状態の合計数を今規定する。ステップ147
の完了において、そのシーケンスは、リターンポイント
T T 23 、ステップ215を介して、第5図に表
わされたステップのシーケンスに続行する。 以下の説明から明らかなように、第5図のステップのシ
ーケンスは、最後に記録された単語の状態をチェックし
て、それが短い母音型金かどうかを判断するために用い
られる。単語の終わりにおける短い母音型レグメントが
、しばしば間違った母音の表示であるということが判断
されるので、摩擦音型音の終わりにおけるエネルギの減
衰に対して、第5図に示されるステップのシーケンスは
、そのような短い母音型の終わりの古を状態のシーケン
スから除去するために用いられる。 最初に、変数Xが、ステップ217において変数Nと等
しくセットされ、そのため、注目されるように、そのシ
ーケンス内、すべての単語を、160ミリ秒間隔を越え
る無音状態とともに終わるものとして規定したので、変
数Xは今、無音である最後の記録された状態を示ず。ス
テップ219において、変数Xが減分されて、終わりの
無音の前に次の前11語の状態を識別する。この次の前
単語の状態は、5EG(X)と値1とを比較することに
よりステップ221において識別されて、この次の前の
単語の状態が母音型金であるかどうかを判断する。もし
それが母音型金でないならば、そのプログラムは、第6
図に示されるリターンポイントRFC,223に分岐す
る。他方、もし終わりの無音の前に記録された最後の単
品の状態が、母音型金であるならば、分岐ステップ22
5が、ステップ205(第3図)でセットされた変数V
OWL (X)と値60進10まノCは10進16どを
比較することにより、母音型金の合計の持続期間と16
0ミリ秒とを比較する。もし、母音型金が160ミリ秒
を越えたならば、そのシーケンスは、リターンポイント
TT22.227で続行する。他方、もし終わりの母音
型名が、持続期間において160ミリ秒よりも短いなら
ば、これは偽の終わりの母音であるということが判断さ
れた。 この哩山て、ステップ229が、変数XおよびNの両方
を減分してこの間違った状態を効果的に除去するために
用いられる。ステップ231はそれから、無音状態が、
間違った終わりの母音型状態のずぐ前に生じたかどうか
を判断するために用いられる。もし無音型状態が、この
間違った母音型状態に先行しなかったならば、そのシー
ケンスは、リターンポイントRFC,223で続行する
。しかしながら、もし無音状態が、この間違った母音型
状態に先行したならば、その無音状態もまた間違ってお
り、かつしたがってステップ233において、値Xおよ
びNが、再び減分されて間違った無音状態を除去する。 アレイSEG (X)がリセットされなくて、記録され
た間違った状態を物理的に除去するにもがかわらず、第
6図の説明かられかるように、値Nを減分することによ
り、これらの間違った状態を単語の認識シーケンスにお
い゛C関係することがら効果的に除去する。 このように間違った終わりの状態を除去すると、そのプ
ログラムは、リターンポイント227がら分岐ステップ
235へ続行し、そこで変数Nど偵2とを比較する。記
録された最後の状態が、任意の単語の終わりにおける無
音状態であるから、変数Nは、状態のシーケンス内の有
意義な状態の実際の数よりも1だけ大きい。このように
、Nと2との比較によって、その状態のシーケンス内の
1よりも大きな有意義な状態があるがどうかを判断する
。もし変数Nが2を越えるならば、有意義な状態のシー
ケンスが規定され、かつステップのシーケンスが第6図
のステップ223に分岐する。 もしNの値が、値2よりも小さいがまたはそれと等しい
ならば、ステップ237は、その値が1が2かを判断す
るために再び値2と値Nとを比較する。もしその値が2
より小さければ、我々は、その信号の状態が単語の終わ
りにおいて無音でありかつ有意義な状態のシーケンスが
ないので、イの全体の状態のシーケンスを本質的に除去
する。このように、プログラムが、リターンポイント1
17、TT16で第3図に戻される。 もし分岐ステップ273において、Nの値が2−であり
、そのためその単語の中に1つの有意義な単語の状態が
あることが判断されると、変数V。 WL (X)の値が、ステップ239におイア 480
ミリ秒の母音型持続期間を示す値16進3oまたは10
進48とを比較される。その単語において1つの母音型
状態のみがあるならば、そのシーケンスは、母音型状態
が、それ自体で、有意義なこの状態ために、少なくとも
480ミリ秒の持続期間を有することを必要とする。も
し、この持続期間が、480ミリ秒よりも小さいならば
、そのシーケンスは、再初期設定のために第3図のTT
16、ステップ117に戻る。他方、もし母音型状態の
持続期間が480ミリ秒を越えたならば、そのシーケン
スは、第6図のリターンポイントRFC,ステップ22
3に続行する。もしその1つの状態シーケンスが、ただ
1つの摩擦音復音を含むならば、ス”テン7187(第
7図)が、値■cNTを0にセットするということも認
められるべきである。したがって、分岐ステップ239
は、1つの摩擦音状態のシーケンスを効果的に除去し、
プログラムをリターンポイントTT16.117に戻し
てそのシーケンスを再初期設定する。 第6図を今参照すると、認識シーケンスが、リターンポ
イントRFC,223で始まって示される。このシーケ
ンスは、上述したアレイ5EG(X)において記憶され
た状態のシーケンスおよびアレイVOWL (X)に記
憶された状態長さにより規定される新しい単語と、マイ
クロプロセサ(第2図)のリードオンリメモリ19にお
いて永久的に記憶された殉教の単語テンプレートとを比
較するために用いられる。このテンプレートは、以下の
フォーマットでREF(IX、)として識別されたアレ
イにおいて記憶される。 1 単語:SIX 1LLLZ 次コ2jニンー
REF(XTMP)4’2 1 0 2WT (XTM
P) OW W Vb WIN(XTMP)
0 Ω、 Q、 Q、ヘポインタXTMPが、ア
レイにお゛いて連続するメモリバイトを規定するために
用いられる。リードオンリメモリ19内の各単語のテン
プレートは、その単語のテンプレートにおける状態の数
を指定することで始まる、。表2に示された例において
、状態の数は、4であり、REF (0)で記憶される
。この最初の指定に続いて、その単語のテンプレート内
の状態のシーケンスが続く。この場合、上述した表1と
同様に、芙BRの単語sixに対する典型的なテンプレ
ートが、以下のシーケンスとして記憶される:W、擦音
型、母音型、無音、摩擦音型:tlJt)’5.210
2 :が、XTMP=1ないし4の位ILK記憶される
。もしそのテンプレートが、3つの状態のテンプレート
であったならば、最初の位ff1R’EF(0)が、3
であり、かっただ3つの状態の識別子が、XTMP=1
ないし3において続く。 アレイ(WT、(XTMP)は話者の集団についてその
状態の発生瞳率と、その朋fltにおける他のワードか
らそのワードを区別する際のその状態の有益さとの両方
に比例する各基準状態へ割当てられる重みを含む。アレ
イLN (XTMP)は各状態の平均長さく持続期間)
を含む。 表2に示すように、次の連続するワードテンプレートは
位11REF(5)における最初の単語のテンプレート
のすぐ後に続き、がっREF(,5)に記憶されたこの
次のテンプレートの状態の数で続く。テンプレートの各
々は、このように、状態シーケンステン、プレートが異
なる長さを有し得るにもかかわらず、連続する位1fX
TMPでリートオンリメモリに連続して記憶される。 ポインタYTMPが、入来する話されたワードアレイの
連続エレメントを規定するために用いられる。アレイS
EG (YTMP)およびVOWL(YTMP)からな
る話されたワードを、アレイREF (XTMP)、W
T (XTMP) 13J:びLN (XTMP)から
なる記憶されたワードパターンと比較する際に、状態ご
との比較が行なわれる。 すなわち、アレイREF (XTMP)に含まれる、記
憶されたワードパターンの第1の状態は、アレイSEG
(YTMP)に含まれる、新しいワードの第1の状態
と比較される。も−しそれらが共に同じ分類を有してい
れば、変数” S CORE ”がアレイVOWL(Y
l−MP)およびLN (XTMP)に含まれる状態長
さの差だけ増大される。Y1’MPおよびXTMPは共
に次の状態比較を準備して増分される。第1状態の分類
が同じでなければ、すなわち、アレイREF(XTMP
)に従って期待される状態が新しいワードになければ、
変数“’ S CORE ”が、アレイWT (XTM
P>に含まれるその状態に関連の重みだけ増大される。 8R案ワードを区別する際の状態が重要であればあるほ
ど、その重みは大きく、それは変数5COREにより多
くの影響を与える。 REI=(1)に記憶された第1のテンプレートワード
の第1の状態が5EG(1)で記憶された入来する話さ
れたワード状態アレイの第1の状態と同じであれば、X
TMPおよびY 1− M Pは共に増分されて次の比
較における次の状態比較のため、入来する話されたワー
ド状態アレイSEG (2)の第2の状態を準備する。 さらに、マイクロコンピュータは第1のテンプレートの
第1の状態の長さ、LN(1)と、入来ワード状態アレ
イ■0WL(1)の第1の状態の長さとの差の絶対値を
剖算する。次いで、この値が変数5COREへ加えられ
る。第1のテンプレートREF(1)の第1の状態が入
来ワード状態アレイ5EG(1)の第1の状態と比較さ
れたときに分類が異なる口とがわかれば、第1のテンプ
レートの第1の状態のための重みの値、WT(1)が変
数S CORE /\加えられる。さらに、XTMPが
増分されるが、YTMPは増分されず、次の比較のため
の準備をする。次に、マイクロコンピュータは第1のテ
ンブレー1−の第2の状態、REF (2)と、入来す
る話されたワード状態アレイの第1の状態、 5U−G
(1)と比較する。もし分類が同じであれば、第1のテ
ンプレートの第2の状態の長さ、LN (2)と、入来
する話されたワード状態アレイの第1の状態の長さ、5
EG(1)との差の絶対値が変数5COREへ加えられ
る。もし分類が異なれば、第1のテンプレートの第2の
状態の重み、WT(2)が変数5COREへ加えられる
。 状1118EG (1)のため(7)REF (XTM
P)においで一致が見られると、XTMPおよびYTM
Pは共に増分され、5EG(2)は次の連続する基準状
態と比較される。 より多くの状態が入力ワードシーケンスSEG(YTM
P)k−留tりながらバタ ’ンREF(XTMP)の
終わりに達すると、これらの過剰な状態(7)iさVO
WL (YTMP)が変数5COREに加えられる。こ
れらの長さの値のいずれかが10以下であれば、1直1
0は、長さを加えるどきに置換えられる。他方、より多
くの状態が基準テンプレートパターンRFP(XTMP
)に留まりながら入力ワード−シーケンス5EG(Y’
rMP)の終わりに到達すれば、これらの過剰な状態の
重みWT(XTMP)が変数5COREへ加えられる。 この手順が各記憶された語粱ワードごとに繰返され、変
数5COREのための最も低い値が最も近い一致を示す
ものどじて選ばれる。この5COREがI10ボートA
21のビット2.3.4および5から抽出されたしぎい
値よりも小さいかまたは等しければ、最も低い5COR
Eを有するテンプレートワードに対応する数を含む変数
CLASSはポートB23.ビット0−6に出力される
。 さもなくば、入来するワードが拒絶され、拒絶表示がボ
ートBのビット7に与えられる。表3は、ピッドパ、タ
ーンに対応しかつI10ボー1〜A21゜ビット2−5
から抽出される可能な拒絶しきい値を示す。任縁のマイ
クロコンピュータにおいては、これらの1ト絶しきい値
の1つだ番ノが用いられよう。 しきい値の選択は、何の誤差も作られていないというこ
とがユーザにとってどれほど重要であるかに依存する。 ユーザが誤差についての関心が少なければ少ないほど、
しきい値は高いが、誤差が高価格を有するようであれば
、しきい幼は低いであろう。もし応用がおもちゃのロボ
ットの制御であれば、主要事項は、指令に応答してロボ
ットが何かを行なわなければならないことである。この
ような応用における拒絶しぎい値は高いであろう。 他方、その応用が産業的なものであり、エラーが費用の
かかるものになるかもしれなければ、拒絶しきい値は低
く設定されるであろう。 表3 ポート ピッ とツ ピッ ピッ 拒絶しきい値A
ト5 ト4 ト3 ト2 0 0 0 0 64 0001 4 0010 8 0 0 1 1 12 0 1 0 0 16 0 1 0 1 20 0 1 1 0 24 0 1 1 1 28 1 0 0 0 32 1 0 0 1 36 1 0 1 0 40 1 0 1 1 44 1 1 0 0 48 1 1 0 1 52 1 1 1 0 56 1 1 1 1 .60 認識シーケンスの詳細を第6図を参照して説明する。こ
の認識シーケンスの初期ステップは、前述したように、
認識されるべき新しいワードにおける状態の総数を規定
する変数Nの減分として、第6図のステップ241に示
される。値Nは新しい状態シーケンスの最終の無音状態
を含みかつステップ241での減分は、認識されるべき
ワード内で、この最終無音状態なしで、実際の意味のあ
る状態まで、状態の総数を減少させるために用いられる
ということが思い出されよう。次に、ステップ243で
、ポインタXTMPがOにリセットされ、アレイREF
、WT、およびLNの第1のエレメントから比較シーケ
ンスを開始させる。 ステップ245で、変数CLASSがOにセットされる
。この変数は、比較プロセスに含まれる男在のlff1
ワード数を示寸ために用いられる。ステップ249は変
数B’ES’r’を16進7Fに初期設定する。これは
8ビツトワードにお()る可能な最大の正の数である。 この変数は、比較プロセスが1個゛のWJ案ワードから
次のソー下へ移動するに従って、現在の最も低い距離の
スコアを追跡するために用いられる。ステップ253は
ポインタYTMP=1をセットして、比較プロセスがア
レイSEGおよびVOWLにおける第1の有効−なエン
トリから始まるのを可能にする。先に説明したように、
これらのアレイは新しい音声ワードの状態シーケンスお
よび状態長さを含む。ステップ255で、新しいワード
と、記憶された1mワードとの間の比較を用意して、変
数5COREがOにセットされる。この比較処理の間、
この変数は新しいワードと記憶されたワードとの非類似
性の度合を反映する。各ワード比較処理が開始される前
に再初期設定される。ステップ257はXTMPにより
指示されるアレイREFのエレメントに等しい変数りを
セットする。これは、比較中の現デンプレートワードの
状態数であり、または、すべてのワードが用い尽されれ
ば、16進値FFである。 ステップ257において示されるアレイR’E Fの′
エレメントはステップ259の値FFと比較される。も
しそれが16進FFに等しければ、それは、記憶された
IJIテンプレートの終わりに達したことを意味し、出
口手順ステップ261(第8図)が実行される。 記憶された語粟が用い尽されていない、すなわち、RE
F(XTMP)がステップ259−(” F Fに等し
くないと想定すれば、変数L1は、らようと話されたワ
ードにおける数の状態である変数Nに等しくなるように
セットされる。2つの変数りおよびLlは、新しいワー
ドおよび記憶された韻案ワードにおいて比較されるため
残っている状態の数を反映する1=め、1個のワードの
比較の間に調整される。共にOになれば、特定のデンプ
レートワードのための比較プロセスが完成する。状態の
総数を得た後、ポインタXTMPがステップ267で増
分されて、アレイREF、Wl’、およびLNの次のエ
レメント、この場合、各アレイの第1のデータエレメン
トを選択する。 ポインタXTMPおよびYTMPが、テンプレートおよ
び音声人力アレイのための正しいエレメントでそれぞれ
指示しているように調整されている。実際のワード認識
の評価が今準備できる。ステップ270で始まり、テン
プレートワードアレイの第1の状態が音声入力の第1の
状態と比較される。もしこれらの状態が同一であれば、
変数5COREが、ステップ272で、状態の長さ間の
差の絶対値、すなわち、音声入力の持続期間VOWL
(YTMP)と、記憶されたKnlQテンプレートの持
続期間、LN (XTMP)との間の差の絶対値だけ、
増大される。音声ワード(L2)およびテンブレー1−
ワード(L)の両方のための状態カウンタは共にステッ
プ274で減分され、他方、音声ワードおよびテンプレ
ートワードのためのアレイポインタYTMPおよびXT
MPは、それぞれ、ステップ275で増分される。 しかしながら、ステップ270で、状態が一致しなかっ
たと想定すれば、変数SCO’REが、重み付はアレイ
にストアされた値WTだけ、ステップ277で記憶され
たワードポインタxTiv+pで、増分される。この状
態が、テンプレート器素ワードの正しい識別のためによ
り重要であればあるほど、重みが高く仝す、変数S C
9RElの増大がにり大きくなる。ステップ279で、
テンプレートワードアレイポインタXTMPが増大され
、他方、記憶されたワード状態カウンタLが、次の状態
の比較の準備で、ステップ281にJ3いて減分される
。テンブレー1−ワードポインタおよびカウンタのみが
変更され、音声ワード変数がそのまま変更されずに残り
、そのため音声ワードの現在の状態が記憶されたワード
の後続の状態に対して一致をチェックされることができ
るシとに注目されたい。 記憶されたワードは各語棄ワードにおいて生ずるかもし
れないすべての状態(たとえそれらが低確率であっても
)を含みかつ、その結果、同じワードの何らかの新しい
音声に対して状態の数により、等しいまたはそれよりも
大きい長さのものであるということが指摘されなければ
ならない。 各状態の比較が完成し、スコアポインタおよびカウンタ
が正しく調整された後、ワードの評価が完了したかどう
かが決定されなければならない。 評価プロセスは、音声および記憶されたワードの両方の
ための状態カウンタがOであるときに完了する、すなわ
ち、すべての状態が評価されかつ最終のスコアが決定さ
れたときに完成する。ステップ283で始まり、記憶さ
れたワード状態カウンタLが0のためにチェックされる
。もし状態カウントが0でなければ、すなわち、記憶さ
れたワード状態のすべてが評価されてなければ、音声ワ
ード状態カウンタはステップ285でOに対してチェッ
クされる。もし音声ワードカウンタもまたOでなければ
、状態比較は完成してな(、状態比較プロセスがステッ
プ269で続けられる。もし音声ワード状態カウンタが
Oであれば、スコアが残っている、比較されてない記憶
されたワード状態の重みの総和だけ増大される。このプ
ロセスは、スコアが現に記憶されたワード状態の重み、
ずなわちWT (XTMP)だけ増大されるステップ2
87で始まる。記憶されたワード状態、ポインタXTM
Pがステップ289で増分され、かつ音声ワード状態カ
ウンタLがステップ291で減分される。重みを総和し
かつポインタおよびカウンタを調整するプロセスは、記
憶され1〔ワード状態カウンタLがOであるまで続く。 音声ワード状態との比較によって、または残っている状
態重みの総和によって、ずべ°Cの記′憶されたワード
状態の評価をした後、記憶されたワード状態カウンタL
がOであり、制御が、ステップ283からステップ29
3へ移される。ステップ293で、音声ワード状態カウ
ンタ1.1がOと比較される。もし音声ワード状態カウ
ンタがOであれば(かつ記憶されたワード状態カウンタ
が、ステップ283でOであるとして前に確立されてい
たならば)、音声ワード状態および記憶されたワード状
態の比較が完成され、すなわちf&柊のスコアが確立さ
れている。その比較が完了すれば、5COREの評価プ
ロセスはステップ305(第7図)で始められる。記憶
されたソー下におりるづべての状態が用い尽されている
間により多(の状態が音声ワードに残っていれば、ステ
ップ299で、距離尺度5COREが、付加えられた状
態の長さの2倍または10でいずれか大きい方だ【プ増
大される。音声ワードにおけるずべての余分な状態は距
離尺度5COREを増大ざVかつ記憶されたワードとし
て音声ワードの分類をほとんどしないようにさせ、この
増大は音声ワードにおりる付加的なデータ(長さ)の用
に関連している。ステップ301および303は音声ワ
ード状態ポインタYTMPを増分し、かつ音声ワード状
態カウンタL1を減分させる。このプロセスは、ステッ
プ295で始まり、音声ワード状態カウンタが、スコア
更新が完成するということを示すOになるまで繰返す。 第7図を参照して、新しいワードを、記憶されたN案ワ
ードと比較するプロレスが完了し5COREが確立され
たとき、5COREは、これまで2であった最も低いス
コア、BESTとステップ305で比較される。もし現
在のスコアが前のベストスコアよりも小さければ、それ
はステップ311でBESTを@換える(0のスコアは
状態および長さの両方の完全な一致を示す)。現在のベ
ストスコアで維持しながら、ステップ313で、そのス
コアに関連するワード数(CLASS)が変数ANSに
記憶される。もし現在のスニ17がそのポイントまでの
ベストスコアよりも大きいかまたは等しければステップ
311および313は行なわれない。ステップ309で
、ワード数CLASSが、記憶された器素ワードとの次
の比較を準備して、増分される。制御は、次の記憶され
たワードのため同じ評価プロセスを繰返すステップ25
1(第6図)へ移る。 すべての比較が完了するとき、すなわち、記憶されたワ
ードの第1の状態がステップ259で16進’FFであ
るとき、これは第8図において制御をEXIT261へ
移す働きをする。この点で、最も低いスコアBESTお
よびその関連のワード数ANSが決定された。入カポ−
1−A 21は、ステップ315で、アキュムレータA
CCへ読み込まれて、新しいワードが記憶された語瑣ワ
ードの1つと一致しなければならない程度を制御するた
めに用いられるべき拒絶しきい値の値を決定する。 しきい値が低ければ低いほど、その一致はより接近しな
番プればならない。許容可能な拒絶しぎい値のための表
3を参照されたい。このボートにおける他のビットは異
なる意味を有しているので、変数ACCは1ビツト右へ
シフトされ(ステップ316)かつデータは、ステップ
318で、16進78と論理積処理されて不所望なビッ
トを取り去る。 もしもすべてのビンがロー(接地)へ接続されれば、1
6進40のディフオルト(drAau日)値がステップ
317i15よび319において示されるしきい値のた
めに用いられる。づべてのビンがローに接続されなけれ
ば、制御はステップ321へ移り、値がポー1− Aか
ら、しきい値として計算される。 アキュムレータにお番プる拒絶しぎい値がステップ32
3で測定されるBESTスコアよりも大きければ、ワー
ド数ANSはステップ327でボートB23へ出力され
、さもなくば、拒絶ライン、ボートB23.ビット7が
ステップ325で活性化されて、一致は十分に接近して
いなかったことを示す。制御は、次に、ポイントステッ
プ117−へ移り、新しい音声ワードを待つ。 この発明のワード認識システムの利用か次の例によって
示される。第2図に示1J、うに、出力ボートB23は
、その最下位ピッ1−、ビットBOが1対のスイッチコ
ンタクト303を駆動でるリレーコイル301へ接続さ
れてもよい。同様に、次の最下位ピッ]・、ビットB1
は、スイッチ対307を駆動するリレーコイル305へ
接続されてもよい。 マイクロプロセサ17.高利得客用増幅器13゜マイク
ロホン11.およびシステム用のバッテリ電源を含む全
体のシステムは小さなお−bち15のロボット内に収納
されてもよい。この場合、J3もちヤのロボットは、た
とえば、ロボッ1〜の頭を回転させるように接続される
モータ309と、ロボットを歩かせるためのトラクタ運
動構を駆動覆るように接続される第2のモータ311ど
を含む。ロボットヘッド回転器309はスイッチ303
によって駆動され、他方、ロボットのトラクタ運動はス
イッチ307によって制御される。もしポートB23か
らの出力ワードが2進数01て′あれば、ロボットの頭
が回転されることがわかる、な1!′ならばビットB
Oの2進1出力はスイッチ303を+311じるためリ
レー301を駆動するからである。同様に、ポート82
3から、10進2に等しい、2進数10の出力によって
、リレー305が駆動し、スイッチ307を閉じ、ロボ
ッ1〜を歩かせる。同様に、ポートB23からの2進数
OOの出力によって、ロボットの】べての運動が止まる
。ざらに、マイクロコンピュータは、たとえば、ロボッ
トの目がユーザにJ:り与えられる命令に依存して光り
または消えるように結線される口とかできる。 次の表、表4は、tAtl?iの音声’7− ト” 3
earC11” 。 ”5top” 、 ”go” 、 ” light
s” 、および0冒ightsoff”を4するために
、マイクロブ0セサ17のリードオンリメモリ19に記
憶される状態シーケンステンプレートの一例である。 表4 REF 4,2,1,0.2 5EARCH6,2
,0,2,1,0,I 5TOP2.2.I
G O3,1,0,2L I G
+−1’r S5.1,0,2,1,2 LI
GI−ITS 0FFWT O,10,10,
10,10S E△1マCHO,18,18,4,18
,2,28丁OPO,5,30G。 O,10,7,1OL I G l−I T SO,5
,5,5,10,10L I G HT S OF
FLN O、F、10.O,B 5EAR
CHO,13,0,2,13,0,B S 1− OP
’0 .2.10
G。 O,22,2,12L I G HT SD、1[3
,2,7,26,21I G HT S OF F
これらの状態シーケンステンプレートは上述の表2の形
式であり、・第1の桁は、各シーケンス内の状態の数を
識別する。表4にリストされたテンブレ・−トから、英
語のワード″’5earch”および”go’”はうま
く規定された状態シーケンスを提供することがわかる。 表4および第2図ないし第6図の前述の説明から、ワー
ド’ 5earch” 、 “”5tOp” 、およ
び’g。 ahead ”をマイクロホン11へ話ずことによって
、ユーザは、ユーザが選択するどのような順序でも、そ
の頭を回転させ、停止させかつ歩かせることができる。 もちろん、これは極めて筒中な例であるが、この発明の
有用性を示すものである。スイッチ307および303
ならびに、ボー1−21.23および25へ接続される
多種多様な他のスイッチが、音声ワードの識別に従って
多種多様な消費者または産業製品を制御するために用い
られることができるということを認識しな番プればなら
ない。 ワード°冒i g h t s ”および’ ligh
ts orr”が特に、ここでは命令的である。上の例
において、ワード” l +9+1ts”が無音状態が
省略されて、”1ice”として成る人によって発音さ
れる。無音状態はそのワード(この例において)を識別
するのに絶対的に必要とされるものではないので、無己
状態(0)に関連の重みは、その省略を重(みないよう
に、他の状態よりも低くてもよい。この例に見られるよ
うに、中間の無音状態へ割当てられる重みは、他の2つ
の状態へ割当てられる重み10に対して、7である。こ
こにお番プるしきいla4よ、J3そらく、もつと高く
セットされるであろう、なぜならばエラーのコスト、す
なわち、全体的に異なるワードに応答してライトをオン
にするOボッ1〜は、あまり高くないからである。した
がって、しぎい植(よ25であり、明らかに間違ってい
るワードをなおも拒絶する。ワード°゛lights
off”に含まれるより高い全体的な重みのため、ライ
トを偶然にΔ〕にさせるのがより困難であろうというこ
とがわかる。もし我々が指令に基づいてのみライ1−が
Aフになってほしいことを決めれば、これらの状態の各
々をより高いものに重み付番プしてもよい。たとえば、
ここで既に説明した級数5.5,5.10゜10に代わ
って、10.10.10.20.20の重み付けの列を
有してもよい。 上で説明したように、この認識システムの1つの利点は
、二人の異なる話者によって実質的に異なった様に話さ
れたワードが、これら異なる発音を予期して一連の記憶
されたテンプレートを含むようにする必要もなく、同じ
ワードとしてなおも認識されることができるということ
である。 このように、ワード冒1Qhts”に代わって°1ic
e”と言う人は、彼がワード゛1ice”と言うときに
ロボットがそのライトをオンにするということをなおも
知るであろう。これは、マイクロコンピュータが、器素
ワードテンブレー1−7レイの第2の状態を、入来する
記憶されたアレイの第2の状態と比較し、分類が同じで
ないことを知るときに、話者のペナルティは、7の変数
5COREにおりる増加にすぎないからである。(これ
は、話者がワード゛’ l igl+ts”を’1ic
e”として言うときに見出されないワード°’ligh
ts”の無音状態に対し重み付は値からくる)。次に、
マイクロコンピュータは摩擦音型であるテンプレートア
レイの次の状態を、先に比較された入力ワードアレイの
同じ状態と比較し続ける。もちろん、この第2の比較に
おいて、2つの分類が一致し、変数5COREに対する
状態のみが、その状態のためのテンプレートに記憶され
た平均長さと、話されたその状態の実際の長さとの間の
差の絶対値である。したが−)て、ワード’1ice”
は“lights”として認識される。 次の表5は、好ましい実施例においC用いられるMot
orola Model MC68o5P2 l−1
MO8マイクロコンピュータとコンパチブルであるコン
ピコ−タブΩグラムをリストする。もらろん、第3図な
いし第8図のフローチル−1〜情報および上で与えられ
た一般的な説明を用いることによって、この発明は多種
多様なコンピュータプログラムま7jは特殊目的のコン
ピュータ装置を用いC実現されることが認識されよう。 表5 、OR03COH L D A # $ F F STA BDDR 3T A CD D R 8TA 、 TOYFLGCL RP O
R丁B TT16 CLR、A STA FONT STA VCNT STA 5CNT AX STA N 5l−A SE’G、X 5TA VOWL、X LDA #$7F STA TIMDAT TT2 LDA #5STA
DECAY TT32 CLRA T731 1NG’ ABNE
TT32 L D A # $ 7 I=SUB
T IMDAT STA ZCRA B S E T OP OR1−C BCLROPORTC LDA #$7に STA TIM[)AT L D A Z CRA CMP R2 BPL TT9 I N CS CN T LDA SEG、X 8EQ 丁T12 L D A S CN T CMP R3 BPL TTl 1 BRA TT10 BEQ TTl8 CL RA STA VOWL、 XBRA
TTl9 TTl8 1−DA VCNTSTA
VOWL、X TT19’ INCX CLRA STA SEG、 X5TA
VOWL、X TT12 CLRA STA FCNT STA VCNT LDA SCNT OMP #$10 BMI TT1’0 TST X BEQ TTl6 STX N JMP TT26 T 1−10 J M P ’T
T 2TT9 LDA SEG
、XBNE TT8 LDA ZCRA CMP #$10 B P L T T 7 JMP TT6 TT8 CMP #IBNE
TT5 LDA ZCRA CMP #$18 BPL ’ TT7 I N CV CN T J M P T T 4 TT7 1NG FONTLDA
FCNT cvp #2 BM I TT3 LDA SPG、X CMP #1 BEQ TTl5 CL RA STA VOWL、 XB RA
T T 1 4TT15 LDA
VCNTSTA VOW
+−、X TT14. INCX LDA #2 STA SEG、X TTl 7 CLRA S T A S CN TSTA
VCNT JMP T]−3 TT5 LDA ZCRAC
MP #$10 BPL PTTllA JMP TT6 PTllA INCFCNT JMP TTl7 TT6 INCVCNT LDA VA、CNT CMP #6 BM I TT3 L D A F CN TSTA
VOWL、 XINCX LDA #1 STA SEG、X TT4 CLRA S T A S CN TSTA
FCNT TT3 JMP TT2−r
T26 LDA 5EG−1,XB
NE TT30 DECX B E Q 1− T 29LDA
5EG−1,XTT30 CMP
#1B N E T
T 2 7LDA VOWL−1,XC
MP #6 BPL TT2’8 DECX J M P T T 26
R3TT27 CPX #3BPL
TT28 R4TT29
JMP TT16TT28 S
TX NRECDECN L D A # OR8 S T A X T MpSTA
CLASS LDA #$7F STA’ BEST R1LDA #I S T A Y T M PCI RS
CORE L D X X T M PLDA
REF、X S T A L CMP #$FF BNE R4 JMP EXIT INCGl−Δ8S JMP RI LDA N 5TA LI INCX 5TX XTM’P L D X Y T M PLDA
SEG、X L D X X 1− M PCMP
REF、 XBEQ
R5 LDA WT、X ΔDDSCOR[三 STA’ 5CORE INCXTMP INCX DECL JMP R7 R5LDA LN、 XLDX
YTMP SUB VOWL、 XBPL
R6 LDA VOWL、 XLDX
XTMP StJB LN、 XR6DECL D E CL、 I INCXTMP I N CY T M P S T A T E M PADD
5CORE S T’ A S CORER7LDA
L BEQ R9 LDA 、 LI BNE R8 LDX XTMP LDA WT、、X ADD 5CORE 8TA S CORE INCXTMP ECL JMP R7 R9L D A L I BEQ R10 LDX YTMP LDA VOWl、X LSL A CMP #$Δ BPL R91 ODA #$A R91ADD 5CORESTA ’
5COR−[”− INCYTMP DEC11 JMP R9 R10LDA SCOREBMI
R33 CMP B[:5T BPL R33 S T A 13E’ S TL r、)
A C[Δ5S STA ANS R33JMP R3 EXIT LDA PORTAAND
#$78 LSRA [3NE FX4 LDA #$40 E X 4 CM l) B E
S TBPL EXI BSET 7.POR−TB J M P T T 16EXI
LDA ANSSTA ’FOR
TB JMP TT16 上述したロボットの例から、この発明は、認識可能なN
葉の注意深い予めの選択により、話省の独立性および比
較的低い誤り率を!Jえることがわかる。このように、
表4から、認識可能な単nl”5earC11” 、
11stopIT、”go” 、 ” 11g11
ts” 、 Jjに ’Cf ” lights o
H” (7) トレbが、l1Jl t;状fQ4 ノ
ーiンプレートを有さないということがわかる。これに
よって、これらの3つの話された手詰の間の正確な区別
ができ、しかし同じ言語にお1ノる他のよく似た単語か
らこれらの単語のうらのどれかをIg別することはでは
ない。この発明は、システムのハードウェアを簡素化し
かつしたがって認識システムの価格および複雑性を有意
義に減するために、認識可能な単語を認識可能なグルー
プ以外の単語から区別づることはできない。 上述したシステムは、い(つかの重要な特徴を含む。最
初に、話された音声が、周期的にサンプルされ、かつそ
の゛個々のサンプルが、システムのフロントエンドフィ
ルタなしに、摩擦音型、母音型および無音間隔への零交
叉データのみを用いて区別される。これらの間隔の連続
づ゛るグループがカウントされ、かつそのカウントは、
そのシステムが摩擦音型状態、母音型状態、または無音
状態を規定するために予め定められた数に達しな番プれ
ばならない。特定の状態の存在を規定するために用いら
れるサンプルの特定の数゛は、その単胎内のその状態の
位置に依存しCbよい。たとえば、1つの単語の終わり
の母音型合が、母名型状態として認識されるために16
0ミリ秒の持続期間を有さなければならなく、それに対
し1つの単語の中央の母音が、母音型状態として認識さ
れるためにただ60ミリ秒の持続期間を有J−るだけで
よい。 状態の認識を達成するために、多種の、連続する、同一
の間隔の条件は、実際、システムヒステリシスの第1の
順序を与え、なぜなら、たとえば摩擦音型から母音型へ
の平均周波数内容の変化が、母音型シーケンスの前の成
る予め定められた持続期間に対する母音型の平均の残り
が、認識されるであろうことを必要とする。 システムヒステリシスの第2の形状は、特定のサンプル
増分を摩tl!l!音型または母音型として識別するた
めに用いられる零交叉の数の変更を可能にすることによ
り与えられる。たとえば、もし前の状態が無音ならば、
1600ヘルツ以上の平均の音声周波数を示′rj10
ミリ秒内の16の零交叉カウントが、摩擦音型間隔を与
えるであろう。しかしながら、もし前の状態が母音型状
態であったならば、零交叉カウントは、24を越えて、
2400ヘルツ以上の周波数平均で、前の無音状態の場
合よりもより高い周波数を示ず。これにより、母音型合
から摩擦音型寥への移り変わりを達成づることがより困
難になり、なぜなら母音型合の終了はしばしば、実際の
摩11A音型音を示ざない1600I3よび2400ヘ
ルツの間の範囲にお(〕る周周波数分を形成するからで
ある。このように、この第2の順序のヒステリシスは、
前の状態の基づいて変更可能である。 このシステムはまた、状態のシーケンスの終わりで短い
母音型状態の除去を与え、なぜならそれらはしばしば、
実際の母音の終わりよりもむしろ摩擦音型合の終わりに
おけるエネルギの消失から生ずることが判断されたから
である。 音声ワードの状態シーケンスを、記憶されたテンプレー
トの状態シーケンスと比較することによって認識が行な
われる。状態が一致すると、誤差のスコアは、話された
状態の長さと、テンプレートに記憶されたワードに対応
する期待された長さとの差だけ増大される。マイクロコ
ンピュータは、次いで、話されたワードアレイの次の状
態の分類を、テンプレートアレイの次の状態と比較し続
ける。状態が一致しないときは、誤差のスコアは重み付
は関数に従って増大される。マイクロコンピュータは、
次いで、話されたワードアレイの同じ状態の分類を、テ
ンプレートアレイの次の状態と比較し続ける。重み付【
ノ関数は、大ぎなエラーが、臨界的な状態にJ3いて不
一致であるときに作り出されるが、他方、さほど臨界的
でない状態にお()る不一致に対しては小さな誤差が発
生されるように選ばれる。事実、これによって、マイク
ロコンピュータは、ワードの認識にとって重要でないと
きは見つからない状態を無視することができる。
第1図は、正弦波周波数に対する10ミリ秒ベースの零
交叉カウントのグラ°ノ″Cある。 第2図は、この発明の回路のブ[1ツク図である。 第3図ないし第8図は、この発明のシステムの動作を示
すフローチャー1〜である。 図において、11はマイクロフォン、13はオーディオ
増幅器、19はメモ1ハ23はレジスタ、31はタイマ
/カウンタ、33はプリスケーラ、35はタイマ制御器
を承り。 特許出願人 インターステイト・Jニレクトロニクス・
コーポレーシヨン 弁理士 深 見 久 部 1.:
、’、)”、不 ・j、lき□ (ほか2名) ””’i:。 手続補正書(方式) 昭和59年7月 夕日 1、事件の表示 昭和59年特許願第 50789 号2、発明の名称 音声認識装置および方法 3、補正をする者 事件との関係 特許出願人 住 所 アメリカ合衆国、カリフォルニア州、アナハ
イムイースト・ボール・ロード、1001 名 称 インターステイト・エレクトロニクス・コー
ポレーション代表者 ドナルド・ダブリューヒゲビ
イ4、代理人 住 所 大阪市北区天神橋2丁目3番9号 八千代第一
ビル昭和59年6月26日 ゛、に′”ゝパ一つも So、−”− 6、補正の対象 願書の4.特許出願人の代表者の欄、図面企図、委任状
および訳文 7、補正の内容 (1)願書の4.特許出願人の代表者の欄に「 ドナル
ド・ダブリューヒゲビイ 」を補充致します。 その目的で新たにll!製した訂正願書を添付致します
。 (2)!墨で描いた図面企図を別紙のとおり補充致しま
1゜なお、内容についての変更はありません。 (3)委任状および訳文を別紙のとおり補充致します。 以 上
交叉カウントのグラ°ノ″Cある。 第2図は、この発明の回路のブ[1ツク図である。 第3図ないし第8図は、この発明のシステムの動作を示
すフローチャー1〜である。 図において、11はマイクロフォン、13はオーディオ
増幅器、19はメモ1ハ23はレジスタ、31はタイマ
/カウンタ、33はプリスケーラ、35はタイマ制御器
を承り。 特許出願人 インターステイト・Jニレクトロニクス・
コーポレーシヨン 弁理士 深 見 久 部 1.:
、’、)”、不 ・j、lき□ (ほか2名) ””’i:。 手続補正書(方式) 昭和59年7月 夕日 1、事件の表示 昭和59年特許願第 50789 号2、発明の名称 音声認識装置および方法 3、補正をする者 事件との関係 特許出願人 住 所 アメリカ合衆国、カリフォルニア州、アナハ
イムイースト・ボール・ロード、1001 名 称 インターステイト・エレクトロニクス・コー
ポレーション代表者 ドナルド・ダブリューヒゲビ
イ4、代理人 住 所 大阪市北区天神橋2丁目3番9号 八千代第一
ビル昭和59年6月26日 ゛、に′”ゝパ一つも So、−”− 6、補正の対象 願書の4.特許出願人の代表者の欄、図面企図、委任状
および訳文 7、補正の内容 (1)願書の4.特許出願人の代表者の欄に「 ドナル
ド・ダブリューヒゲビイ 」を補充致します。 その目的で新たにll!製した訂正願書を添付致します
。 (2)!墨で描いた図面企図を別紙のとおり補充致しま
1゜なお、内容についての変更はありません。 (3)委任状および訳文を別紙のとおり補充致します。 以 上
Claims (14)
- (1) 入来する音声を、分類された音声状態のアレイ
に分割しかつ各音声状態の長さを測定して対応する入来
状態長さアレイを形成するための回路と、 音声ml装置のLn承り一ドを表わす少なくども1個の
テンプレートを記憶するためのメモリ(19)とを備え
、前記テンプレートは分類されたワード状態の第1のア
レイと、対応する記憶されたワード状態の少なくともい
くつかの長さを示す一連の値からなる第2のアレイとを
含み、入来する音声状態アレイの分類を、テンプレート
状態アレイの分類で比較する働きをする回路と、入来す
る音声状態アレイとテンプレートワード状態アレイとの
間の一致の程痕の尺度を発生ずるための回路とをさらに
備え、前記尺度は、入来する音声状態と、一致している
分類を有する状態の対応するテンプレートワード状態と
の間の長さの差の関数である、音声認識装置。 - (2) テンプレートと、入来する相のアレイとの間の
一致の度合の発生された尺度を、しきい値レベルで比較
して、入来する音声を、テンプレートに対応するIIワ
ードとして認識づべきか否かを決定するための回路と、 入来音声アレイの組が、テンプレートに対応するワード
として認識されたということを示すための出力信号発生
器(23)とをざらに描えた、特許請求の範囲第1項記
載の音声認識装置。 - (3) 前記メモリ(19)は各々1個の詔柔9−ドを
表わす、複数個のテンプレートを記憶し、前記比較回路
は入来するアレイの組をテンプレートの各々と逐次的に
比較する働きをし、かつ尺度発生回路は各テンプレート
ごとの一致の度合の尺度を発生する働きをし、 前記音声aia装置はさらに前記テンプレートのどれが
入来する組のアレイに最も近い一致であるかを決定する
ための回路をさらに備える、特許請求の範囲第1項記載
の音声認識装置。 - (4) 最も近い一致であると決定されたテンプレート
のための一致尺度の度合を、しきい値レベルで比較して
、入来音声を、テンプレートに対応する語案ワードとし
て認識する回路と、入来音声アレイの組が、最も近い一
致であると決定されたテンプレートに対応するワードと
して認識されたことを示す1=めの出力信号発生器(2
3)とをさらに備えた、特許請求の範囲第3項記載の音
声認識装置。 - (5) 各音声状態は、摩擦音型、母音型または無音の
いずれかとして分類される、特許請求の範囲第1項記載
の音声認識装置。 - (6) 前記比較回路は、逐次的に、入来ワード状態ア
レイの状態の分類を、テンプレート状態アレイの分類で
比較する、特許請求の範囲第1項記載の音声認識装置。 - (7) 各記憶されたテンプレートは、さらに、一連の
重み付けした値を有づ゛る第3のアレイを含み、1つの
値は、ワードの認識に対Jるワード状態の重要性に基づ
き各記憶されたワード状態へ割当てられており、 前記尺度は入来する音声状態と、一致している分類を有
する状態のための対応するテンブレー1−ワード状態ど
の間の長さの差、および、一致している分類を有してい
ない状態に対応づる重みの関数である誤差値であり、 前記尺度発生回路は、 比較されている状態の分類が同じであるときその特定の
比較されている状態に対応する前記持続期間アレイの値
開の差の絶対値だけ、誤差値を増大させる回路と、 比較されている状態の分類が同じでないときに比較され
ている前記テンプレート状態アレイの特定の状態に対応
する前記重み付けしているアレイの重み付けした値に等
しい量だけ、誤差値を増大させる回路とを含む、特許請
求の範囲第11rJ記載の音声認識装置。 - (8) 前記比較回路は、さらに、fFl後に比較され
た状態が一致しなかった分類を有したときに、テンプレ
ート状態アレイの次の状態で、最後に比較した入来音声
状態を比較する回路をさらに含む、特許請求の範囲第7
項記載の音声認識装置。 - (9) 前記尺度発生回路は、さらに、入来する音声状
態アレイに最も近い一致Cあるテンプレートとして、最
も低い誤差値を有するテンプレートを指定づる回路を含
む、特許請求の範囲第7項記載の音声認識装置。 - (10) あまりにも隔たっている一致を拒絶する回路
をざらに含み、かつ前記拒絶回路はそのテンプレートに
対応する誤差値が所定のしきい値よりも大きいときに最
も近い一致テンプレートを特徴する特許請求の範囲第9
項記載の音声認識装置。 - (11) このテンプレートが前記拒絶手段によって拒
絶されなかったならば、最も近い一致を有しているもの
として選択されたテンプレートに対応するワードである
として、入来する音声ワード状態アレイを認識する回路
をさらに含む、特許請求の範囲第10項記載の音声認識
装置。 - (12) 前−記尺度は誤差値であり、ボI記尺度発生
回路は、比較されている状態の分類が同じであるときそ
の特定の比較されている状態に対応覆る前記持続期間ア
レイの値開の差の絶対値だけ誤差値を増大させる回路を
含む、特許請求の範囲第1項記載の音声認識装置。 - (13) 入来音声を、分類された音声状態のアレイに
分割し、 各音声状態の長さを測定して対応する入来状態長さアレ
イを形成し、 記憶された語粟ワードを表わすテンプレートを与え、前
記テンプレートは分類されたワード状態の第1のアレイ
と、対応するワード状態の少なくともいくつかの長さを
示す一連の値を含む第2のアレイとを含み、 入来する音声状態アレイの分類を、テンプレート状態ア
レイの分類で比較し、かつ 前記入来音声状態アレイと、前記テンプレートワード状
態アレイとの間の一致の度合の尺度を発生し、前記尺度
は前記入来音声状態と一致するテンプレートワード状態
との間の長さの差の関数である、音声認識方法。 - (14) 前記分割スデップは、摩擦音型、母音型また
は無音のいずれかであるとして前記音声状態の各々を分
類する、特許請求の範囲第13項記載の方法。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US06/475,888 US4761815A (en) | 1981-05-01 | 1983-03-16 | Speech recognition system based on word state duration and/or weight |
| US475,888 | 1983-03-16 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS59229600A true JPS59229600A (ja) | 1984-12-24 |
| JPH0554680B2 JPH0554680B2 (ja) | 1993-08-13 |
Family
ID=23889583
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP59050789A Granted JPS59229600A (ja) | 1983-03-16 | 1984-03-15 | 音声認識装置 |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US4761815A (ja) |
| EP (1) | EP0119835A1 (ja) |
| JP (1) | JPS59229600A (ja) |
| KR (1) | KR920010582B1 (ja) |
| AU (1) | AU2554784A (ja) |
| CA (1) | CA1207456A (ja) |
Families Citing this family (45)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5131043A (en) * | 1983-09-05 | 1992-07-14 | Matsushita Electric Industrial Co., Ltd. | Method of and apparatus for speech recognition wherein decisions are made based on phonemes |
| JPH0632012B2 (ja) * | 1985-03-25 | 1994-04-27 | 株式会社東芝 | 音声認識装置 |
| US4852180A (en) * | 1987-04-03 | 1989-07-25 | American Telephone And Telegraph Company, At&T Bell Laboratories | Speech recognition by acoustic/phonetic system and technique |
| WO1988010413A1 (en) * | 1987-06-09 | 1988-12-29 | Central Institute For The Deaf | Speech processing apparatus and methods |
| US4918731A (en) * | 1987-07-17 | 1990-04-17 | Ricoh Company, Ltd. | Speech recognition method and apparatus |
| GB8720527D0 (en) * | 1987-09-01 | 1987-10-07 | King R A | Voice recognition |
| FR2622727A1 (fr) * | 1987-10-29 | 1989-05-05 | Feart Michel | Procede de reconnaissance de la parole ou de toute autre onde sonore et son procede de mise en oeuvre |
| DE4031421C2 (de) * | 1989-10-05 | 1995-08-24 | Ricoh Kk | Musteranpassungssystem für eine Spracherkennungseinrichtung |
| JP2609752B2 (ja) * | 1990-10-09 | 1997-05-14 | 三菱電機株式会社 | 音声/音声帯域内データ識別装置 |
| US5592389A (en) * | 1990-12-03 | 1997-01-07 | Ans, Llp | Navigation system utilizing audio CD player for data storage |
| US5454062A (en) * | 1991-03-27 | 1995-09-26 | Audio Navigation Systems, Inc. | Method for recognizing spoken words |
| US5748840A (en) * | 1990-12-03 | 1998-05-05 | Audio Navigation Systems, Inc. | Methods and apparatus for improving the reliability of recognizing words in a large database when the words are spelled or spoken |
| US5444817A (en) * | 1991-10-02 | 1995-08-22 | Matsushita Electric Industrial Co., Ltd. | Speech recognizing apparatus using the predicted duration of syllables |
| US5475798A (en) * | 1992-01-06 | 1995-12-12 | Handlos, L.L.C. | Speech-to-text translator |
| CA2107317A1 (en) * | 1992-10-30 | 1994-05-01 | Rajendra Prasad Mikkilineni | Speech recognition system |
| JP3691511B2 (ja) * | 1993-03-25 | 2005-09-07 | ブリテイッシュ・テレコミュニケーションズ・パブリック・リミテッド・カンパニー | 休止検出を行う音声認識 |
| BR9508898A (pt) * | 1994-09-07 | 1997-11-25 | Motorola Inc | Sistema para reconhecer sons falados |
| US5594834A (en) * | 1994-09-30 | 1997-01-14 | Motorola, Inc. | Method and system for recognizing a boundary between sounds in continuous speech |
| US5596679A (en) * | 1994-10-26 | 1997-01-21 | Motorola, Inc. | Method and system for identifying spoken sounds in continuous speech by comparing classifier outputs |
| US5638486A (en) * | 1994-10-26 | 1997-06-10 | Motorola, Inc. | Method and system for continuous speech recognition using voting techniques |
| US5796924A (en) * | 1996-03-19 | 1998-08-18 | Motorola, Inc. | Method and system for selecting pattern recognition training vectors |
| WO1998014934A1 (en) * | 1996-10-02 | 1998-04-09 | Sri International | Method and system for automatic text-independent grading of pronunciation for language instruction |
| US5899976A (en) * | 1996-10-31 | 1999-05-04 | Microsoft Corporation | Method and system for buffering recognized words during speech recognition |
| US5950160A (en) | 1996-10-31 | 1999-09-07 | Microsoft Corporation | Method and system for displaying a variable number of alternative words during speech recognition |
| US5884258A (en) * | 1996-10-31 | 1999-03-16 | Microsoft Corporation | Method and system for editing phrases during continuous speech recognition |
| US5829000A (en) * | 1996-10-31 | 1998-10-27 | Microsoft Corporation | Method and system for correcting misrecognized spoken words or phrases |
| US6233557B1 (en) * | 1999-02-23 | 2001-05-15 | Motorola, Inc. | Method of selectively assigning a penalty to a probability associated with a voice recognition system |
| JP3132815B2 (ja) * | 1999-04-21 | 2001-02-05 | 株式会社トイテック | 玩具用音声認識装置 |
| DE10220520A1 (de) * | 2002-05-08 | 2003-11-20 | Sap Ag | Verfahren zur Erkennung von Sprachinformation |
| EP1361740A1 (de) * | 2002-05-08 | 2003-11-12 | Sap Ag | Verfahren und System zur Verarbeitung von Sprachinformationen eines Dialogs |
| DE10220522B4 (de) * | 2002-05-08 | 2005-11-17 | Sap Ag | Verfahren und System zur Verarbeitung von Sprachdaten mittels Spracherkennung und Frequenzanalyse |
| DE10220524B4 (de) * | 2002-05-08 | 2006-08-10 | Sap Ag | Verfahren und System zur Verarbeitung von Sprachdaten und zur Erkennung einer Sprache |
| DE10220521B4 (de) * | 2002-05-08 | 2005-11-24 | Sap Ag | Verfahren und System zur Verarbeitung von Sprachdaten und Klassifizierung von Gesprächen |
| EP1363271A1 (de) * | 2002-05-08 | 2003-11-19 | Sap Ag | Verfahren und System zur Verarbeitung und Speicherung von Sprachinformationen eines Dialogs |
| US7219059B2 (en) * | 2002-07-03 | 2007-05-15 | Lucent Technologies Inc. | Automatic pronunciation scoring for language learning |
| JP4667082B2 (ja) * | 2005-03-09 | 2011-04-06 | キヤノン株式会社 | 音声認識方法 |
| US9478218B2 (en) * | 2008-10-24 | 2016-10-25 | Adacel, Inc. | Using word confidence score, insertion and substitution thresholds for selected words in speech recognition |
| US9646603B2 (en) * | 2009-02-27 | 2017-05-09 | Longsand Limited | Various apparatus and methods for a speech recognition system |
| GB2468203B (en) * | 2009-02-27 | 2011-07-20 | Autonomy Corp Ltd | Various apparatus and methods for a speech recognition system |
| US8229743B2 (en) * | 2009-06-23 | 2012-07-24 | Autonomy Corporation Ltd. | Speech recognition system |
| US8190420B2 (en) * | 2009-08-04 | 2012-05-29 | Autonomy Corporation Ltd. | Automatic spoken language identification based on phoneme sequence patterns |
| CN103247290A (zh) * | 2012-02-14 | 2013-08-14 | 富泰华工业(深圳)有限公司 | 通信装置及其控制方法 |
| WO2017029850A1 (ja) * | 2015-08-20 | 2017-02-23 | ソニー株式会社 | 情報処理装置、情報処理方法およびプログラム |
| JP7251953B2 (ja) * | 2018-11-19 | 2023-04-04 | トヨタ自動車株式会社 | 音声認識装置、音声認識方法及び音声認識プログラム |
| CN115132198B (zh) * | 2022-05-27 | 2024-03-15 | 腾讯科技(深圳)有限公司 | 数据处理方法、装置、电子设备、程序产品及介质 |
Citations (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS56113199A (en) * | 1980-02-12 | 1981-09-05 | Tokyo Shibaura Electric Co | Voice recognizing apparatus |
| JPS57176100A (en) * | 1981-03-27 | 1982-10-29 | Western Electric Co | Recognizer for input word |
| JPS57185500A (en) * | 1981-05-01 | 1982-11-15 | Intaasuteito Electonics Corp | Voice recognition apparatus |
| JPS589087A (ja) * | 1981-07-10 | 1983-01-19 | Citizen Watch Co Ltd | 電子時計 |
Family Cites Families (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB981154A (en) * | 1961-03-20 | 1965-01-20 | Nippon Telegraph & Telephone | Improved phonetic typewriter system |
| US3238303A (en) * | 1962-09-11 | 1966-03-01 | Ibm | Wave analyzing system |
| US3278685A (en) * | 1962-12-31 | 1966-10-11 | Ibm | Wave analyzing system |
| GB1055371A (en) * | 1964-03-06 | 1967-01-18 | Standard Telephones Cables Ltd | Apparatus for the recognition of speech |
| GB1155422A (en) * | 1965-08-24 | 1969-06-18 | Nat Res Dev | Speech Recognition |
| GB1180288A (en) * | 1967-06-23 | 1970-02-04 | Standard Telephones Cables Ltd | Analysing Complex Signal Waveforms |
| US3816722A (en) * | 1970-09-29 | 1974-06-11 | Nippon Electric Co | Computer for calculating the similarity between patterns and pattern recognition system comprising the similarity computer |
| DE2240557A1 (de) * | 1971-08-18 | 1973-02-22 | Jean Albert Dreyfus | Spracherkennungsvorrichtung zum steuern von maschinen |
| US3812291A (en) * | 1972-06-19 | 1974-05-21 | Scope Inc | Signal pattern encoder and classifier |
| US3969700A (en) * | 1974-04-10 | 1976-07-13 | International Business Machines Corporation | Regional context maximum likelihood error correction for OCR, keyboard, and the like |
| US3943295A (en) * | 1974-07-17 | 1976-03-09 | Threshold Technology, Inc. | Apparatus and method for recognizing words from among continuous speech |
| JPS5272504A (en) * | 1975-12-15 | 1977-06-17 | Fuji Xerox Co Ltd | Device for recognizing word audio |
| US4156868A (en) * | 1977-05-05 | 1979-05-29 | Bell Telephone Laboratories, Incorporated | Syntactic word recognizer |
-
1983
- 1983-03-16 US US06/475,888 patent/US4761815A/en not_active Expired - Lifetime
-
1984
- 1984-03-13 AU AU25547/84A patent/AU2554784A/en not_active Abandoned
- 1984-03-15 EP EP84301756A patent/EP0119835A1/en not_active Withdrawn
- 1984-03-15 CA CA000449665A patent/CA1207456A/en not_active Expired
- 1984-03-15 JP JP59050789A patent/JPS59229600A/ja active Granted
- 1984-03-15 KR KR1019840001316A patent/KR920010582B1/ko not_active Expired
Patent Citations (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS56113199A (en) * | 1980-02-12 | 1981-09-05 | Tokyo Shibaura Electric Co | Voice recognizing apparatus |
| JPS57176100A (en) * | 1981-03-27 | 1982-10-29 | Western Electric Co | Recognizer for input word |
| JPS57185500A (en) * | 1981-05-01 | 1982-11-15 | Intaasuteito Electonics Corp | Voice recognition apparatus |
| EP0065829A1 (en) * | 1981-05-01 | 1982-12-01 | Figgie International Inc. | Speech recognition system |
| JPS589087A (ja) * | 1981-07-10 | 1983-01-19 | Citizen Watch Co Ltd | 電子時計 |
Also Published As
| Publication number | Publication date |
|---|---|
| AU2554784A (en) | 1984-09-20 |
| EP0119835A1 (en) | 1984-09-26 |
| KR840008194A (ko) | 1984-12-13 |
| JPH0554680B2 (ja) | 1993-08-13 |
| US4761815A (en) | 1988-08-02 |
| KR920010582B1 (ko) | 1992-12-07 |
| CA1207456A (en) | 1986-07-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CA1207456A (en) | Speech recognition system based on word state duration and/or weight | |
| JPH0420199B2 (ja) | ||
| US4969194A (en) | Apparatus for drilling pronunciation | |
| US4910784A (en) | Low cost speech recognition system and method | |
| US20060004567A1 (en) | Method, system and software for teaching pronunciation | |
| JPH08187368A (ja) | ゲーム装置、入力装置、音声選択装置、音声認識装置及び音声反応装置 | |
| Cooper | Selective adaptation for acoustic cues of voicing in initial stops | |
| Seppänen et al. | Prosody-based classification of emotions in spoken finnish. | |
| Biem et al. | Cepstrum-based filter-bank design using discriminative feature extraction training at various levels | |
| Jesus et al. | Frication and voicing classification | |
| Markey | Acoustic-based syllabic representation and articulatory gesture detection: prerequisites for early childhood phonetic and articulatory development | |
| JPH06504383A (ja) | 会話の中の項目別表現を識別するあるいは数えるためのシステム | |
| US5774862A (en) | Computer communication system | |
| Armstrong | The effects of concurrent motor tasking on performance of a voice recognition system | |
| Howell et al. | Perceptual and acoustic evidence for reduced fluency in the vicinity of stuttering episodes | |
| JPH0455518B2 (ja) | ||
| Eskénazi et al. | Recognition of steady-state French sounds pronounced by several speakers: comparison of human performance and an automatic recognition algorithm | |
| JP3899122B6 (ja) | 音声対話式言語指導のための方法及び装置 | |
| Alim et al. | LPC and its derivatives for stuttered speech recognition | |
| JP3899122B2 (ja) | 音声対話式言語指導のための方法及び装置 | |
| JPS6331798B2 (ja) | ||
| Hermes | Vowel-onset detection | |
| JPH02254498A (ja) | 音韻分類記号化装置 | |
| WO1989003519A1 (en) | Speech processing apparatus and methods for processing burst-friction sounds | |
| Prathosh | Temporal processing for event-based speech analysis with focus on stop consonants |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| EXPY | Cancellation because of completion of term |