JPS59176793A - 単語音声認識装置 - Google Patents
単語音声認識装置Info
- Publication number
- JPS59176793A JPS59176793A JP58050697A JP5069783A JPS59176793A JP S59176793 A JPS59176793 A JP S59176793A JP 58050697 A JP58050697 A JP 58050697A JP 5069783 A JP5069783 A JP 5069783A JP S59176793 A JPS59176793 A JP S59176793A
- Authority
- JP
- Japan
- Prior art keywords
- word
- speech recognition
- code
- recognition device
- words
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
く技術分野〉
本発明は簡易形単語音声認識装置に関するものである。
〈背 景〉
単語音声認識に於いて、認識対象の単語以外の音声、特
に使用者が不用意に発声した話声1せきばらい、又周囲
騒音で突発的に発生した物音に対して、誤認識を行なう
不都合がよくみられるΦ特に音声の特徴分析能力が十分
でない場合はさらに顕著になる。
に使用者が不用意に発声した話声1せきばらい、又周囲
騒音で突発的に発生した物音に対して、誤認識を行なう
不都合がよくみられるΦ特に音声の特徴分析能力が十分
でない場合はさらに顕著になる。
〈発明の目的〉
本発明はこのような問題点を改善し、たとえば2語の単
語の認識を行なった後初めて結果を出力することで、上
記の誤認識が起こる程度を低減させるものである。
語の認識を行なった後初めて結果を出力することで、上
記の誤認識が起こる程度を低減させるものである。
なお、2以上の単語でも可能であるが、全体としての認
識率が各単語の積と々るので、特に分析能力が低い簡易
形では2語が適当である。
識率が各単語の積と々るので、特に分析能力が低い簡易
形では2語が適当である。
〈実施例〉
以り図面に従って本発明の一実施例を説明する。
第1図は本発明の一実施例を示すブoyり構成図である
。
。
マイク1に入力された単語音声は、前処理部2により増
1〕され必要に応じプリエンファシス等の処理が々・さ
れる。
1〕され必要に応じプリエンファシス等の処理が々・さ
れる。
特微分析部3では音声の特徴を表わしうる量、たとえば
、短時間スペクトル、自己相関関数、零交差数等の分析
が行なわれる。この特微分析部3で得られた特徴時系列
は、単語区間判定部4にて単語区間の比較照合用時系列
+01と単語区間判定信号102が得られる。単語区間
判定信号+02は単語区間判定のだめのサイレンス部の
検出を行なうたびに単語が有効か否かの情報を含めて出
力される。
、短時間スペクトル、自己相関関数、零交差数等の分析
が行なわれる。この特微分析部3で得られた特徴時系列
は、単語区間判定部4にて単語区間の比較照合用時系列
+01と単語区間判定信号102が得られる。単語区間
判定信号+02は単語区間判定のだめのサイレンス部の
検出を行なうたびに単語が有効か否かの情報を含めて出
力される。
パターン作成部5では特定された単語区間の特徴時系列
lotより時間方向への圧縮等が加えられ、情報圧縮さ
れてパターン化される。
lotより時間方向への圧縮等が加えられ、情報圧縮さ
れてパターン化される。
標準パターン格納部6は前って同様の処理によって得ら
れた単語毎のパターンを格納している部分である。この
標準パターンとパターン作成部5で作成された入力語の
パターンについて、マツチング処理部7で類似度等の計
算がされ、その結果を103として出力する。
れた単語毎のパターンを格納している部分である。この
標準パターンとパターン作成部5で作成された入力語の
パターンについて、マツチング処理部7で類似度等の計
算がされ、その結果を103として出力する。
制御部8はこれらの処理部の制御を行なうと共に外部よ
りの入力及び外部への出力を制御する部分である。外部
入力部9から与えられる入力信号104け、単語毎の設
定コードや2段目の単語受入許容時間設定コード入力で
ある。
りの入力及び外部への出力を制御する部分である。外部
入力部9から与えられる入力信号104け、単語毎の設
定コードや2段目の単語受入許容時間設定コード入力で
ある。
出力部lOは制御部8よりの出力コードから認識結果及
び2段目受入可能表示を行なう。認識結果により他の装
置を種々制御することももちろん可能である。
び2段目受入可能表示を行なう。認識結果により他の装
置を種々制御することももちろん可能である。
第2図は第1図の点線部内を1ビツトマイクロコンヒユ
ータ11で構成したものである。マイクo−ミツピユー
タ11はCPU12.R2M17.RAM14を含み、
不特定話者を対象とする場合、標準パターンは上記RO
M + 3に格納される。
ータ11で構成したものである。マイクo−ミツピユー
タ11はCPU12.R2M17.RAM14を含み、
不特定話者を対象とする場合、標準パターンは上記RO
M + 3に格納される。
特定話者単語音声認識は、近年のティ7タル信号処理技
術、LSI技術の進歩により、低価格化の方向でボード
やLSIが開発されているが、不特定話者認識は大型か
つ高価な装置にとどまっている。
術、LSI技術の進歩により、低価格化の方向でボード
やLSIが開発されているが、不特定話者認識は大型か
つ高価な装置にとどまっている。
話者による変動の少ない特徴パラメータとして、すべて
の音韻について適用できるものはない。しかしながら、
大寸かな分類を行なう場合には比較的個人差の少ないパ
ラメータとじて零交差数が知られている。パラメータと
して零交差数を採り上げ、種々の検討を加えた結果、短
時間定レベル交差数(Level Crossing
)分析法を採用すれば、上記のようにアナログ回路部を
除いて、不特定音声認識装置をCMO3+チップLSI
で実現できるO 第3図に短時間定レベル交差数の定義を示す。
の音韻について適用できるものはない。しかしながら、
大寸かな分類を行なう場合には比較的個人差の少ないパ
ラメータとじて零交差数が知られている。パラメータと
して零交差数を採り上げ、種々の検討を加えた結果、短
時間定レベル交差数(Level Crossing
)分析法を採用すれば、上記のようにアナログ回路部を
除いて、不特定音声認識装置をCMO3+チップLSI
で実現できるO 第3図に短時間定レベル交差数の定義を示す。
本行微量は音声波形Vが一定の閾値レベルLhを交差す
る回数を、短時間フレーム(周期τ)毎に計数して得ら
れるものである。閾値レベルは定常周囲騒音よりもやや
大きい値に調整設定することにより、単語音声区間と無
音区間の判別を可能にしている。
る回数を、短時間フレーム(周期τ)毎に計数して得ら
れるものである。閾値レベルは定常周囲騒音よりもやや
大きい値に調整設定することにより、単語音声区間と無
音区間の判別を可能にしている。
特徴量は音声のスペクトルの相対強度を表わし得るもの
で第4図に定レベル交差数分析により得られた特徴時系
例を示す。(a)は音声波形、(b)は定レベル交差系
列である。図中に見られるように、有声音では低い値を
示し、無声音5%に115 L2+(S HIf等の摩
擦音1″TH“等の破擦音に対しでは高い値を示す。零
レベル交差分析法では特徴分析部3において、このよう
なフレーム毎の定レベル交差数が特徴として抽出される
。
で第4図に定レベル交差数分析により得られた特徴時系
例を示す。(a)は音声波形、(b)は定レベル交差系
列である。図中に見られるように、有声音では低い値を
示し、無声音5%に115 L2+(S HIf等の摩
擦音1″TH“等の破擦音に対しでは高い値を示す。零
レベル交差分析法では特徴分析部3において、このよう
なフレーム毎の定レベル交差数が特徴として抽出される
。
音声資料として仮に周囲騒音の少ないものを使用したと
しても、実使用にあたっては周囲騒音があり、これによ
る誤認識が問題となる。上記のような定レベル交差分析
では、その特性上、類似した音韻系列を有する認識対象
語以外の未知音声に対する棄却能力が低い。
しても、実使用にあたっては周囲騒音があり、これによ
る誤認識が問題となる。上記のような定レベル交差分析
では、その特性上、類似した音韻系列を有する認識対象
語以外の未知音声に対する棄却能力が低い。
第5図は標準パターン記憶部6、又はlチノプマイクロ
コンビーータ11を使用するものそはそのRO1v11
3部に格納される標準パターンのメモリマツプ例であり
、各単語毎に特徴系列X、1段目段目単語−コード2段
目単語組コードZ、更に認識単語の結果出力コードPが
記憶されている。
コンビーータ11を使用するものそはそのRO1v11
3部に格納される標準パターンのメモリマツプ例であり
、各単語毎に特徴系列X、1段目段目単語−コード2段
目単語組コードZ、更に認識単語の結果出力コードPが
記憶されている。
1段目単語組コートYは必ずしも必要ではないが、認識
の対象語が多い場合、特に更に分析能力が十分でないと
きには対象語を絞ぼれ、寸だ2語目の組との組換えを多
様化する利点があり有用である。
の対象語が多い場合、特に更に分析能力が十分でないと
きには対象語を絞ぼれ、寸だ2語目の組との組換えを多
様化する利点があり有用である。
第6図は認識手順の主要部をフローチャートとして示し
たものであり、以下これを参照して動作を説明する。
たものであり、以下これを参照して動作を説明する。
まず、外部入力部9から与えられた1段目の単語組コー
ドを読取り、認識対象語以外 さらに同じく外部入力部9から与えられている受入れ可
能時間コードを読取り記憶する。
ドを読取り、認識対象語以外 さらに同じく外部入力部9から与えられている受入れ可
能時間コードを読取り記憶する。
2段目フラグ、これは2段目の単語組を認識する状態に
なっていることを表すフラグであるが、これをリセット
して1段目の認識状態にする。このフラグの内容は出力
部IOにてLED等の表示かなされ使者話者に知らされ
る。
なっていることを表すフラグであるが、これをリセット
して1段目の認識状態にする。このフラグの内容は出力
部IOにてLED等の表示かなされ使者話者に知らされ
る。
単語と語選択コード例を下表に示す。コードの上段は1
段目単語組コード、下段は2段目単語組コードである。
段目単語組コード、下段は2段目単語組コードである。
単語名 コード 単語名 コード今、1段目の
単語組コードとして9a″を設定しているものとする。
単語組コードとして9a″を設定しているものとする。
この状態で、初め単語「窓」を発声したとする。
すると処理は■の流れになり、1段目コード組単語「窓
」、「ドア」、「照明」の標準・くターンのマ・ンチン
グ処理が行なわれる。この結果が良ければ2段目のコー
ドが設定されているかを判断する。本例では2段目のコ
ードが設定されており、コード内容がゞゝb”であるの
で結果(一時記憶はされる)を出力せず、認識対象語の
組を単語「あける」。
」、「ドア」、「照明」の標準・くターンのマ・ンチン
グ処理が行なわれる。この結果が良ければ2段目のコー
ドが設定されているかを判断する。本例では2段目のコ
ードが設定されており、コード内容がゞゝb”であるの
で結果(一時記憶はされる)を出力せず、認識対象語の
組を単語「あける」。
「しめる」の組のコードゝゝb“に切換えるとともに、
2段目フラグをセントする。
2段目フラグをセントする。
認識結果が悪ければリジェクト出力、結果が良く2段目
コードが設定されていなければ、その単語の結果コード
を出力部10に出力する事になる。
コードが設定されていなければ、その単語の結果コード
を出力部10に出力する事になる。
従ってこの2段目コードの有無により、1段で認識する
単語との混在が可能となる0 この1段目の単語が「照明」の場合、2段目の単語組は
コードゝC“の「つける」「けす」が選択される。
単語との混在が可能となる0 この1段目の単語が「照明」の場合、2段目の単語組は
コードゝC“の「つける」「けす」が選択される。
2段目フラグがセットされた後、流れは■に切り換わり
、単語が入力されるのを待つ状態となる。
、単語が入力されるのを待つ状態となる。
この時単語入力がない場合、経過時間がカウントされ、
受入可能時間コードに対応する時間との判定がなされる
。経過時間が受入可能時間を越えた時、1段目の単語認
識はリジェクトされ、初期の状態にもどり2段目フラグ
をリセットする。この流れから時間内に単語が発声され
、正しく認識された時のみ廠゛果を出力する様になって
いる。
受入可能時間コードに対応する時間との判定がなされる
。経過時間が受入可能時間を越えた時、1段目の単語認
識はリジェクトされ、初期の状態にもどり2段目フラグ
をリセットする。この流れから時間内に単語が発声され
、正しく認識された時のみ廠゛果を出力する様になって
いる。
1段目の単語組コード及び受入れ可能時間コードは、常
に初期の状態にもどった時読取るようにしているので、
1段目の単語入力に先立って随時任意のものに設定する
ことができる。
に初期の状態にもどった時読取るようにしているので、
1段目の単語入力に先立って随時任意のものに設定する
ことができる。
本実施例は、標準パターンとして既に格納されている例
(不特定話者向単語音声認識装置)について記したが、
1段目、2段目コードに対応する入力を用意し、標準パ
ターンを登録出来る様にしだ、特定話者向単語音声認識
装置へも適用が可能である。
(不特定話者向単語音声認識装置)について記したが、
1段目、2段目コードに対応する入力を用意し、標準パ
ターンを登録出来る様にしだ、特定話者向単語音声認識
装置へも適用が可能である。
また2語で認識する事で、最初の単語で動作させる機器
を指定し、2語目でその機器の動作種類を指定する様な
応用に関しても有効である。
を指定し、2語目でその機器の動作種類を指定する様な
応用に関しても有効である。
〈発明の効果〉
以上のように本発明によれば、認識対象の単語以外の音
声、特に使用者が不用意に発声した話声。
声、特に使用者が不用意に発声した話声。
せきはらい、又周囲騒音で突発的に発生した物音に対し
て、適当な複数単語の認識を行なった後、初めて結果を
出力するようにしたものであり、未知入力音声に対する
性能向上をはかった有用な単語音声認識装置が提供でき
る。
て、適当な複数単語の認識を行なった後、初めて結果を
出力するようにしたものであり、未知入力音声に対する
性能向上をはかった有用な単語音声認識装置が提供でき
る。
特に、不特定話者向きに定レベル交差数等を採用して%
像分析能力が十分でない場合も、誤認識が起こる程度を
低減して1チンプLSI等に集積化して実現することが
できる。
像分析能力が十分でない場合も、誤認識が起こる程度を
低減して1チンプLSI等に集積化して実現することが
できる。
捷だ1語目認識時より2語目の入力可能時間を設定する
ことで、1語目が周囲騒音の突発的な音によるものに起
因する誤認識となった場合、最終的誤りを低減すること
ができる。
ことで、1語目が周囲騒音の突発的な音によるものに起
因する誤認識となった場合、最終的誤りを低減すること
ができる。
第1図は本発明の一実施例を示すブロンク構成いた場合
のブロック図、第3図は音声波形を示す図、第4図は音
声波形(a)と特徴系列(b)を対比して示す図、第5
図は標準パターンのメモリマツプ、第6図は主要部の動
作を説明するフローチャートである。 1 ・マイク1.2・・・前処理部、3 ・特徴分析部
、4 ・単語区間判定部、5・パターン作成部、6標準
パタ一ン記憶部、7・・マツチング処理部、8・制御部
、9・・外部入力部、IO・・出力部、11 ・1チ
ノゾマイクロコンピユータ、12・・CPU。 13・−ROM、l 4 RAM、X・・・特徴系列
、Y1段目単語組コード、Z・・・2段目単語組コード
。 代理人 弁理士 福 士 愛 彦(他2名)第1図 第2図 第3図
のブロック図、第3図は音声波形を示す図、第4図は音
声波形(a)と特徴系列(b)を対比して示す図、第5
図は標準パターンのメモリマツプ、第6図は主要部の動
作を説明するフローチャートである。 1 ・マイク1.2・・・前処理部、3 ・特徴分析部
、4 ・単語区間判定部、5・パターン作成部、6標準
パタ一ン記憶部、7・・マツチング処理部、8・制御部
、9・・外部入力部、IO・・出力部、11 ・1チ
ノゾマイクロコンピユータ、12・・CPU。 13・−ROM、l 4 RAM、X・・・特徴系列
、Y1段目単語組コード、Z・・・2段目単語組コード
。 代理人 弁理士 福 士 愛 彦(他2名)第1図 第2図 第3図
Claims (1)
- 【特許請求の範囲】 l 標準パターンとして特徴系列の他に連続する認識対
象語の組を切換えるコードを含めて記憶する手段と、複
数の連続する単語が前記認識対象語の組の切換えにした
がって正しく認識された場合に限り結果を出力する認識
判定手級とを備えてなることを特徴とする単語音声認識
装置。 2 連続する認識対象語は2語であることを特徴とする
特許請求の範囲第1項記載の単語音声認識装置。 32段目の認識対象語の組を切換えるコード内で、2段
目に移行しないコードを設定する事により、1単語入力
で認識結果を出力する単語と、2単語入力で認識結果を
出力する単語との混在を許容することを特徴とする特許
請求の範囲第2項記載の単語音声認識装置。 41段目の単語を認識したのちの2段目の単語の受は入
れ可能時間を設定し、この時間内に2段目の単語が入力
されない場合、入力語を棄却することを特徴とする特許
請求の範囲第2項記載の単語音声認識装置。 52段目の単語の受は入れ可能時間を外部コードにより
設定することを特徴とする特許請求の範囲第4項記載の
単語音声認識装置。 62段目の単語の受は入れ可能状態を外部に知らしめる
ため視覚的表示又は電気的信号を出力する事を特徴とす
る特許請求の範囲第4項記載の単語音声認識装置。 7 音声の特徴量として、定レベル交差波形を用いlチ
ップに集積回路化された特許請求の範囲第1項から第6
項記載の単語音声認識装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP58050697A JPS59176793A (ja) | 1983-03-25 | 1983-03-25 | 単語音声認識装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP58050697A JPS59176793A (ja) | 1983-03-25 | 1983-03-25 | 単語音声認識装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS59176793A true JPS59176793A (ja) | 1984-10-06 |
| JPH0245200B2 JPH0245200B2 (ja) | 1990-10-08 |
Family
ID=12866100
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP58050697A Granted JPS59176793A (ja) | 1983-03-25 | 1983-03-25 | 単語音声認識装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS59176793A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH02502149A (ja) * | 1987-10-02 | 1990-07-12 | モトローラ・インコーポレーテッド | 音声命令によって通話を終了させる方法 |
Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5629293A (en) * | 1979-08-20 | 1981-03-24 | Tokyo Shibaura Electric Co | Voice indentifier |
| JPS56140398A (en) * | 1980-04-04 | 1981-11-02 | Tokyo Shibaura Electric Co | Voice recognizing method |
| JPS57118299A (en) * | 1981-01-14 | 1982-07-23 | Nissan Motor | Voice load driver |
| JPS57185093A (en) * | 1981-05-08 | 1982-11-15 | Oki Electric Ind Co Ltd | Voice recognition system |
| JPS5814436U (ja) * | 1981-07-23 | 1983-01-29 | 株式会社ボッシュオートモーティブ システム | 消防車用電子ガバナの始動保護回路 |
| JPS5824200A (ja) * | 1981-08-06 | 1983-02-14 | 富士通株式会社 | 音声認識方式 |
-
1983
- 1983-03-25 JP JP58050697A patent/JPS59176793A/ja active Granted
Patent Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5629293A (en) * | 1979-08-20 | 1981-03-24 | Tokyo Shibaura Electric Co | Voice indentifier |
| JPS56140398A (en) * | 1980-04-04 | 1981-11-02 | Tokyo Shibaura Electric Co | Voice recognizing method |
| JPS57118299A (en) * | 1981-01-14 | 1982-07-23 | Nissan Motor | Voice load driver |
| JPS57185093A (en) * | 1981-05-08 | 1982-11-15 | Oki Electric Ind Co Ltd | Voice recognition system |
| JPS5814436U (ja) * | 1981-07-23 | 1983-01-29 | 株式会社ボッシュオートモーティブ システム | 消防車用電子ガバナの始動保護回路 |
| JPS5824200A (ja) * | 1981-08-06 | 1983-02-14 | 富士通株式会社 | 音声認識方式 |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH02502149A (ja) * | 1987-10-02 | 1990-07-12 | モトローラ・インコーポレーテッド | 音声命令によって通話を終了させる方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPH0245200B2 (ja) | 1990-10-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Nwe et al. | Speech based emotion classification | |
| Abdelatty Ali et al. | Acoustic-phonetic features for the automatic classification of fricatives | |
| Sethu et al. | Speaker normalisation for speech-based emotion detection | |
| JP2001166789A (ja) | 初頭/末尾の音素類似度ベクトルによる中国語の音声認識方法及びその装置 | |
| US7181396B2 (en) | System and method for speech recognition utilizing a merged dictionary | |
| Schuller et al. | Comparing one and two-stage acoustic modeling in the recognition of emotion in speech | |
| JPH0245200B2 (ja) | ||
| JPH04324499A (ja) | 音声認識装置 | |
| JPS61249099A (ja) | 音声認識装置 | |
| JPS61116400A (ja) | 音声情報処理装置 | |
| JPH0254560B2 (ja) | ||
| JPS63161499A (ja) | 音声認識装置 | |
| JPH0480398B2 (ja) | ||
| JP2697995B2 (ja) | 発声発語訓練器 | |
| JPS58195895A (ja) | 単語音声認識装置 | |
| JPS6227798A (ja) | 音声認識装置 | |
| JPS62217297A (ja) | 単語音声認識装置 | |
| JPS59111700A (ja) | 語頭子音のセグメンテ−シヨン法 | |
| JPH06324697A (ja) | 音声認識システム | |
| JPS59123899A (ja) | 音声認識装置 | |
| KR20060075533A (ko) | 안티워드 모델을 이용한 음성인식 방법 | |
| JPS6069694A (ja) | 語頭子音のセグメンテ−ション法 | |
| JPS62145298A (ja) | 音声認識装置 | |
| JPS62174798A (ja) | 音声分析装置 | |
| JPS62280800A (ja) | 破裂子音識別方式 |