JPH09297596A - 音声認識装置 - Google Patents

音声認識装置

Info

Publication number
JPH09297596A
JPH09297596A JP8112872A JP11287296A JPH09297596A JP H09297596 A JPH09297596 A JP H09297596A JP 8112872 A JP8112872 A JP 8112872A JP 11287296 A JP11287296 A JP 11287296A JP H09297596 A JPH09297596 A JP H09297596A
Authority
JP
Japan
Prior art keywords
voice
power information
recognition
amplification
section
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP8112872A
Other languages
English (en)
Inventor
Hiroaki Hattori
浩明 服部
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NEC Corp
Original Assignee
NEC Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by NEC Corp filed Critical NEC Corp
Priority to JP8112872A priority Critical patent/JPH09297596A/ja
Publication of JPH09297596A publication Critical patent/JPH09297596A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】 【課題】 雑音等が入力された場合、及び回線ゲインが
変動しかつ未知の場合は誤った認識がなされる場合があ
ること。 【解決手段】 入力音声は音声増幅部1で増幅された
後、前処理部2、特徴抽出部3を介して音声検出部4で
音声区間が求められ、認識部5でその音声区間より単語
が認識される。一方、パワー情報抽出部2ではその単語
の音声パワー情報が抽出され、増幅率決定部8ではその
音声パワー情報とパワー情報記憶部9に記憶されたその
単語に対応するパワー情報とが比較される。そして、増
幅率決定部8はそのパワー情報の差がゼロとなるよう音
声増幅部1の増幅率を変更する。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】本発明は音声認識装置に関
し、特にパワー情報を用いて音声検出を行う音声認識装
置に関する。
【0002】
【従来の技術】従来、音声認識装置における音声検出は
入力音声からパワー情報を抽出し、これと予め定められ
る音声検出しきい値と比較を行うことにより行われてい
た。しかしながら、発声内容によって単語のパワー情報
が変化するため安定した音声検出しきい値を定めること
が困難であった。これに対して入力音声が母音いを含む
単語(以下、i系単語)であるかの判定を行い、そうで
ある場合には音声検出しきい値を下げる手法が特開昭6
0−260096号公報(以下文献1という)に提案さ
れている。
【0003】図4は母音のパワー(相対値)を示す図で
ある。同図に示すようにi系(例えば「イチ」、「ニ」
は他の単語(例えばa系「サン」、o系「ヨン」に比べ
て音声パワーが高く、音声区間しきい値が一定である従
来装置においては、i系単語については音声区間検出し
きい値が高すぎる状態となり、欠落などを生じて誤認識
となることが多かったのである。
【0004】そこで、文献1ではi系単語については音
声区間検出しきい値を下げるようにしたものである。
【0005】図5は従来の音声認識装置(文献1)の構
成図である。
【0006】同図において、入力された音声は前処理部
100においてアナログデジタル変換され、パラメータ
抽出部101において特徴パラメータに変換される。i
系判定部102では入力音声の最大パワーをもつフレー
ムの2〜4次ケプストラム(音声パワー・スペクトルの
対数の逆フーリエ変換)の合計値によりi系単語である
か判定を行い、i系である場合にはしきい値操作部10
3は音声区間検出部104のしきい値を下げる。照合部
105は下げられたしきい値により検出された音声区間
に対し、認識辞書106との比較,照合を行い、判定部
107において音声の判定を行う。
【0007】
【発明が解決しようとする課題】しかし、従来の音声認
識装置(文献1)は短時間の音響的特徴、即ち、音声パ
ワーが最大であるフレームのケプストラムデータにおい
て、2次/3次/4次のデータの合計値、のみを用いて
判定を行っていたため、周囲に雑音が存在する場合や衝
撃音等の瞬間的に大きなパワーを持つ雑音が生じた場合
にはそのフレームを判定に用いてしまう可能性がある。
この場合、その音響的特徴(ケプストラムの2次/3次
/4次)は雑音の特徴を表しており、正しいi系判定を
行うことはできない。
【0008】また、電話回線のように伝送路の回線ゲイ
ンが変動し、かつ未知の場合には、回線ゲインの不足の
ために音声のパワーが設定された検出しきい値に達せ
ず、検出に失敗する場合が生じるが、文献1の方法では
このような入力のゲイン不足による検出誤りには対処で
きない。
【0009】そこで本発明の目的は、雑音等が入力され
た場合、及び回線ゲインが変動しかつ未知の場合でも安
定した音声検出が可能な音声認識装置を提供することに
ある。
【0010】
【課題を解決するための手段】前記課題を解決するため
に本発明は、入力された音声を増幅する増幅手段と、こ
の増幅手段で増幅された音声に基づき入力単語の認識を
行う認識手段と、前記増幅手段で増幅された音声の音声
パワーと前記認識手段で認識された単語とに基づき前記
増幅手段の増幅率を変更する増幅率変更手段とを含むこ
とを特徴とする。
【0011】
【発明の実施の形態】本発明によれば、入力された音声
はまず増幅手段で増幅される。次に、その増幅された音
声は認識手段にて単語の認識が行われる。さらに、増幅
率変更手段によりその音声の音声パワーが検出され、増
幅率変更手段はその音声パワーに応じて増幅手段の増幅
率を変更する。
【0012】さらに詳細には、本発明では短時間の音響
的特徴ではなく入力音声の認識結果から入力音声の発声
内容の推定を行うことで判定精度を向上させ、更に、予
め記憶されている当該発声内容のパワー情報と入力され
た音声のパワー情報とを比較し、入力音声レベルを音声
検出しきい値設定時と同じレベルになるよう音声信号を
アナログデジタル変換の前段階において増幅/減衰させ
ることで、より正確な音声検出を可能とするものであ
る。
【0013】また、アナログデジタル変換においては通
常16bit程度の有限のレベルによる量子化が行われ
るため、入力音声のパワーが不十分な場合には十分な精
度が得られず音声検出性能だけでなく認識性能の低下を
招く。本発明によれば、アナログデジタル変換の前に適
切なレベルに信号が増幅されるために、このような認識
性能の低下は生じない。
【0014】以下、本発明の実施の形態について添付図
面を参照しながら説明する。
【0015】図1は本発明に係る音声認識装置の第1の
実施の形態の構成図である。第1の実施の形態は、音声
増幅部1と、前処理部2と、特徴抽出部3と、音声検出
部4と、認識部5と、標準パターン記憶部6と、パワー
情報抽出部7と、増幅率決定部8と、パワー情報記憶部
9とからなる。
【0016】入力された音声は音声増幅部1において予
め定められた増幅率で増幅される。
【0017】前処理部2は増幅された音声をアナログデ
ジタル変換し、入力音声を離散波形データへ変換する。
【0018】特徴抽出部3は離散波形データを例えば1
5ms毎に音響分析を行い、音響的特徴を表す音声パワ
ーを含む特徴ベクトル系列に変換する。特徴ベクトルと
しては、例えば古井著、「ディジタル音声処理」,東海
大学出版会(以下文献2という)に挙げられているFF
T分析,線形予測分析等により得られるケプストラム,
LPC係数,これらの時間変化量等が利用可能である。
音声検出部4は各時刻における音声パワーを予め定めら
れるしきい値と比較することにより音声区間を求め、認
識部5へ送る。
【0019】標準パターン記憶部6は予め集録された音
声から抽出された認識対象単語の音響的特徴を表す標準
パターンを蓄えているものとする。
【0020】認識部5は音声検出部4から受けとった音
声区間の特徴ベクトル系列と標準パターン記憶部6に蓄
えられている認識対象単語の標準パターンと照合を行
い、最も近い標準パターンに対応する単語を認識結果と
する。
【0021】パワー情報抽出部7は検出された音声区間
の音声パワーから入力音声のパワー情報を抽出する。抽
出するパワー情報としては音声区間の音声パワーの平均
値や適当な平滑化を行った後の最大値等が利用可能であ
る。
【0022】パワー情報記憶部9は各認識対象単語に関
する上記パワー情報を標準パターン作成用データから求
め、保持しているものとする。
【0023】増幅率決定部8は認識部5から受けとった
認識結果に対応するパワー情報をパワー情報記憶部9か
ら、入力音声のパワー情報をパワー情報抽出部7から受
けとり、それらの差が小さくなるように音声増幅部1に
おける入力音声の増幅率を決定,更新し、次発話に備え
る。すなわち、入力音声のパワー情報が標準パターンの
パワー情報より大きければ、増幅率を減少させ、入力音
声のパワー情報が標準パターンのパワー情報より小さけ
れば増幅率を増加させる。
【0024】図2は本発明に係る音声認識装置の第2の
実施の形態の構成図である。なお、第1の実施の形態と
同様の構成部分については同一番号を付し、その説明を
省略する。
【0025】第2の実施の形態が第1の実施の形態と異
なる点は、標準パターン記憶部6とともに認識対象外音
標準パターン記憶部11を設けた点である。
【0026】すなわち、入力される音声が認識対象単
語、たとえば、「あさ」、「ひる」のような単語は標準
パターン記憶部6に記憶された標準パターンとの照合に
より認識されるが、入力される音声が認識対象外音、た
とえば、咳払い音、呼吸による吹かれ音、衝撃音、「え
ーと」、「あのー」等の発声である場合は、これらの音
声の標準パターンを認識対象外音標準パターン記憶部1
1に予め記憶しておき、認識部5にて認識された音声が
これらの認識対象外音である場合は、この情報を受け取
った増幅率決定部8は音声増腹部1の増幅率の変更を行
わない。
【0027】図3は本発明に係る音声認識装置の第3の
実施の形態の構成図である。なお、本実施の形態におい
ても第1の実施の形態と同様の構成部分については同一
番号を付し、その説明を省略する。
【0028】第3の実施の形態が第1の実施の形態と異
なる点は、さらに棄却判定部21を設けた点である。
【0029】この棄却判定部21には音声検出部4の出
力と認識部5の出力とが入力され、棄却判定部21の出
力は増幅率決定部8へ入力される。
【0030】棄却判定部21は音声検出部4の出力より
認識対象単語にも認識対象外音にも該当しない語彙ある
いは雑音を検出する。
【0031】たとえば、「えーと」、「あのー」という
言葉にしても人によりその発音は夫々異なり、従って、
方言等を含む聞き取り難い言葉である場合もあり得る。
このような語彙が「認識対象単語にも認識対象外音にも
該当しない語彙」であり、この「認識対象単語にも認識
対象外音にも該当しない語彙」が棄却判定部21で検出
された場合、棄却判定部21はこの語彙を棄却し、増幅
率決定部8に音声増腹部1の増幅率の変更を行わせな
い。
【0032】一方、棄却判定部21で語彙が棄却されな
い場合は、通常どおり認識部5で認識された単語及びパ
ワー情報抽出部7で抽出された音声パワーに基づき増幅
率決定部8にて音声増幅部1の増幅率が変更される。
【0033】なお、認識対象外音標準パターン記憶部1
1と棄却判定部2の両者を同時に設け、認識対象外音あ
るいはこの外音にも該当しない語彙、雑音等と認識され
た場合に音声増幅部1の増幅率を変更しないようにする
ことも可能である。
【0034】
【発明の効果】本発明によれば、入力された音声を増幅
する増幅手段と、この増幅手段で増幅された音声に基づ
き入力単語の認識を行う認識手段と、前記増幅手段で増
幅された音声の音声パワーと前記認識手段で認識された
単語とに基づき前記増幅手段の増幅率を変更する増幅率
変更手段とを含んで構成したため、雑音等が入力された
場合、及び回線ゲインが変動しかつ未知の場合でも安定
した音声検出が可能となり、これにより十分な量子化レ
ベルが確保できるため、高い識別性能が得られる。
【図面の簡単な説明】
【図1】本発明に係る音声認識装置の第1の実施の形態
の構成図である。
【図2】本発明に係る音声認識装置の第2の実施の形態
の構成図である。
【図3】本発明に係る音声認識装置の第3の実施の形態
の構成図である。
【図4】母音のパワー(相対値)を示す図である。
【図5】従来の音声認識装置(文献1)の構成図であ
る。
【符号の説明】
1 音声増幅部 2 前処理部 3 特徴抽出部 4 音声検出部 5 認識部 6 標準パターン記憶部 7 パワー情報抽出部 8 増幅率決定部 9 パワー情報記憶部 11 認識対象外音標準パターン記憶部 21 棄却判定部

Claims (4)

    【特許請求の範囲】
  1. 【請求項1】 入力された音声を増幅する増幅手段と、
    この増幅手段で増幅された音声に基づき入力単語の認識
    を行う認識手段と、前記増幅手段で増幅された音声の音
    声パワーと前記認識手段で認識された単語とに基づき前
    記増幅手段の増幅率を変更する増幅率変更手段とを含む
    ことを特徴とする音声認識装置。
  2. 【請求項2】 前記増幅率変更手段は前記増幅手段で増
    幅された音声の音声パワー情報を抽出する音声パワー情
    報抽出手段と、認識対象単語のパワー情報が格納される
    パワー情報格納手段と、前記音声パワー情報抽出手段で
    抽出された音声パワー情報とこの音声パワー情報に対応
    するパワー情報を前記パワー情報格納手段より読み出
    し、両パワー情報の比較結果に基づき前記増幅手段の増
    幅率を決定する増幅率決定手段とを含むことを特徴とす
    る請求項1記載の音声認識装置。
  3. 【請求項3】 前記認識手段は認識対象単語の標準パタ
    ーンと認識対象外音の標準パターンとが格納される標準
    パターン格納手段を有し、前記認識手段で前記認識対象
    外音が認識された場合、前記増幅率変更手段は増幅率を
    変更しないことを特徴とする請求項1又は2記載の音声
    認識装置。
  4. 【請求項4】 前記認識手段はさらに認識対象単語の標
    準パターン及び認識対象外音の標準パターンのいずれに
    も該当しない雑音等を検出する雑音等検出手段を有し、
    前記認識手段で前記雑音等が検出された場合、前記増幅
    率変更手段は増幅率を変更しないことを特徴とする請求
    項1〜3いずれかに記載の音声認識装置。
JP8112872A 1996-05-08 1996-05-08 音声認識装置 Pending JPH09297596A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP8112872A JPH09297596A (ja) 1996-05-08 1996-05-08 音声認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP8112872A JPH09297596A (ja) 1996-05-08 1996-05-08 音声認識装置

Publications (1)

Publication Number Publication Date
JPH09297596A true JPH09297596A (ja) 1997-11-18

Family

ID=14597647

Family Applications (1)

Application Number Title Priority Date Filing Date
JP8112872A Pending JPH09297596A (ja) 1996-05-08 1996-05-08 音声認識装置

Country Status (1)

Country Link
JP (1) JPH09297596A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100366057B1 (ko) * 2000-06-26 2002-12-27 한국과학기술원 인간 청각 모델을 이용한 효율적인 음성인식 장치

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100366057B1 (ko) * 2000-06-26 2002-12-27 한국과학기술원 인간 청각 모델을 이용한 효율적인 음성인식 장치

Similar Documents

Publication Publication Date Title
US7756700B2 (en) Perceptual harmonic cepstral coefficients as the front-end for speech recognition
US5732394A (en) Method and apparatus for word speech recognition by pattern matching
US5778342A (en) Pattern recognition system and method
EP1159737B1 (en) Speaker recognition
JPH09325790A (ja) 音声処理方法および装置
US20030200086A1 (en) Speech recognition apparatus, speech recognition method, and computer-readable recording medium in which speech recognition program is recorded
US5854999A (en) Method and system for speech recognition with compensation for variations in the speech environment
US8271283B2 (en) Method and apparatus for recognizing speech by measuring confidence levels of respective frames
JP2745535B2 (ja) 音声認識装置
US6574596B2 (en) Voice recognition rejection scheme
HK1043423A (en) Voice recognition rejection scheme
JP3119510B2 (ja) 音声認識装置
JP2002366192A (ja) 音声認識方法及び音声認識装置
JP3354252B2 (ja) 音声認識装置
JPH034918B2 (ja)
JP3020999B2 (ja) パターン登録方法
JP3032551B2 (ja) 音声標準パターン登録方法
JPH0635495A (ja) 音声認識装置
JPH0695690A (ja) 話者認識方法
JP2000155600A (ja) 音声認識システムおよび入力音声レベル警告方法
JP3026855B2 (ja) 音声認識装置
JPH0635498A (ja) 音声認識装置及び方法
JPS6227798A (ja) 音声認識装置
JPH054680B2 (ja)
JPH0316038B2 (ja)