JPH10187181A - 音声認識装置 - Google Patents
音声認識装置Info
- Publication number
- JPH10187181A JPH10187181A JP8357403A JP35740396A JPH10187181A JP H10187181 A JPH10187181 A JP H10187181A JP 8357403 A JP8357403 A JP 8357403A JP 35740396 A JP35740396 A JP 35740396A JP H10187181 A JPH10187181 A JP H10187181A
- Authority
- JP
- Japan
- Prior art keywords
- state
- time
- frame
- recognition result
- similarity
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/10—Speech classification or search using distance or distortion measures between unknown speech and reference templates
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L2015/088—Word spotting
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Telephonic Communication Services (AREA)
Abstract
リアルタイムに行い、瞬時に認識結果を出力する。 【解決手段】 入力信号をフレーム毎の特徴ベクトル時
系列に変換する手段2を有し、各状態毎に標準パターン
と前記特徴ベクトルとをフレーム毎に照合部3で比較照
合し、入力信号の各時点での各状態毎の類似度を求め
る。状態遷移時に遷移前の状態の類似度を累積し、各状
態系列の最終状態の類似度が閾値αを越えたときに、そ
の状態系列をその時点での認識結果候補とする。各状態
毎に各状態がそれぞれ継続している間、各状態毎の継続
フレーム長を算出する手段4を有し、状態遷移を起こっ
た時点で、遷移前状態の継続フレーム数をその状態の継
続フレーム数の初期値とし、遷移前状態の継続フレーム
長を累積していく。各状態系列の最終状態の類似度が閾
値αを越えたときのその状態系列の最終状態の累積フレ
ーム長を認識結果候補の全フレーム長とする。
Description
り詳細には、音声認識分野におけるワードスポッティン
グ技術の認識結果出力に関する。
識処理とを同時に行う音声認識方法において、類似度に
標準パターンの長さに対応した重みを付加することによ
り、同じ音韻列をもつ標準パターンの誤認識を避ける方
法がある(例えば、特開平4−362699号公報)。
また、
長さの傾向を統計的な量として標準パターンに反映させ
た統計的距離尺度を用いて二次的に類似度を計算する音
声認識方法がある(特開平5−127696号公報)。
(2)の従来技術の欠点を解決するため、つまり、ワー
ドスポッティング法における、部分マッチング問題を解
決するための、辞書作成時における発声長や認識時の発
声長に左右されない方式を極めて少ない処理量で実現す
ることができる方法を提案した。この方法は具体的に
は、音声区間内での類似度が閾値αを越える認識結果候
補のそれぞれのフレームが互いに重なっていないかを判
定し、独立している候補はすべて認識結果として出力
し、互いに重なり合っている候補はフレーム長が比較さ
れ、より長い方の候補が認識結果とされるものである。
ただし、フレーム長には差がない場合は、より類似度の
高い候補が認識結果として出力されるものである。
ーム長を算出する手段と音声区間検出手段については、
従来技術を用いればよいとされており、例えば、フレー
ム長算出は、類似度が閾値αを越えたフレームから過去
にさかのぼってパスを決定することによって求め、ま
た、音声区間検出は、パワー情報やゼロクロス法などを
用い、音声区間の終端を無音時間が一定の時間以上継続
する場合に、音声入力が終了したと判定すればよいとし
ている。
を出力する方法として、結果候補出力後一定時間後に認
識結果として候補を出力する方法がある。
方式の音声認識方法として、例えば、前記従来技術で取
り上げた方法がある。しかし、これらの従来技術では、
フレーム長を算出する場合、過去にさかのぼってパスを
逆算することによって求めなければならない。また、音
声区間検出は、パワー情報やゼロクロス法などを用いる
ため、音声終端まで結果出力ができない。その他に区間
検出を使用しないで結果を出力する方法として、結果候
補出力後一定時間後に認識結果として候補を出力する方
法があるが、この場合、閾値を越えたものが全て認識結
果となるため、長い単語の一部がより短い単語に一致す
る“部分マッチング”や“湧き出し”が生じるため、前
記の従来技術(3)のような後処理ができない。
めのもので、音声区間検出を行わず、フレーム長の算出
をリアルタイムに行い、瞬時に認識結果を出力し、か
つ、“部分マッチング”や“湧き出し”を後処理で対応
できるように認識結果候補を出力する方法を提供するも
のである。
を入力する手段と、入力音声信号を一定時間(フレー
ム)毎の特徴ベクトル時系列に変換する手段を有し、あ
らかじめ登録された一定の状態数を持つ状態系列で、各
状態毎に状態を代表する特徴ベクトル(および状態の標
準継続時間)を記憶した標準パターンと前記特徴ベクト
ルとをフレーム毎に比較照合して、入力信号の各時点で
の各状態毎の類似度を求め、状態遷移時に遷移前の状態
の類似度を累積し、各状態系列の最終状態の類似度が閾
値(α)を越えたときに、その状態系列をその時点での
認識結果候補とする音声認識装置において、各状態毎に
各状態がそれぞれ継続している間、毎フレームに1つ加
算することで算出する各状態毎の継続フレーム数算出手
段を有し、状態毎に他状態から状態遷移が起こった時点
で、遷移前状態の継続フレーム数をその状態の継続フレ
ーム数の初期値とし、遷移前状態の継続フレーム長を累
積していき、各状態系列の最終状態の類似度が閾値
(α)を越えたときのその状態系列の最終状態の累積フ
レーム長を認識結果候補の全フレーム長とすることを特
徴としたものである。
と、入力音声信号を一定時間(フレーム)毎の特徴ベク
トル時系列に変換する手段を有し、あらかじめ登録され
た一定の状態数を持つ状態系列で、各状態毎に状態を代
表する特徴ベクトル(および状態の標準継続時間)を記
憶した標準パターンと前記特徴ベクトルとをフレーム毎
に比較照合して、入力信号の各時点での各状態毎の類似
度を求め、状態遷移時に遷移前の状態の類似度を累積
し、各状態系列の最終状態の類似度が閾値(α)を越え
たときに、その状態系列をその時点での認識結果候補と
する音声認識装置において、各状態系列の各状態の累積
フレーム数の最長値をフレーム毎に更新し、フレーム毎
にその時点での各状態系列の最長値の最大値(最大フレ
ーム数)を保持し、状態系列の最終状態の類似度が閾値
(α)を越えた時点(T0)で、その状態系列固有の系
列番号を認識結果候補として保持し、結果候補決定時点
(T0)から各フレーム毎に候補決定時点(T0)から
の経過時間(Ta0)とその時点での最大フレーム数と
を比較し、経過時間(Ta0)が最大フレーム数より大
きくなったとき、保持されている認識結果候補を認識結
果として出力することを特徴としたものである。
て、結果候補決定時点(T0)から経過時間(Ta0)
が最大フレーム数より大きくなる前(T1時点)に新た
に認識結果候補が出力された場合、経過時間(Ta0)
を0にクリアし、以後は前記T1時点からの経過時間
(Ta1)とフレーム毎の最大フレーム数を比較し、経
過時間(Ta1)が最大フレーム数より大きくなったと
き、保持されている認識結果候補0と認識結果候補1を
認識結果として出力し、同様に、T2…Tnに対応する
認識結果候補2…nが存在する場合はTnからの経過時
間(Tan)がフレーム毎の最大フレーム数より大きく
なったとき、保持されているn+1個の認識結果候補を
全て出力することを特徴としたものである。
認識装置(前記従来技術)の一例を示す図で、図中、1
は音声入力部、2は特徴抽出部、3は辞書照合部、4は
継続フレーム長算出部、5は最大フレーム数算出部、6
は結果候補保存部、7は継続時間との比較部、8は認識
結果出力部で、同図は、本発明を説明する上で使用する
ワードスポッティング技術として継続時間制御型状態遷
移モデルを用いた単語音声認識法の例を示す図である。
図1において、マイクロフォン(音声入力部)1から入
力された音声は、入力の各時点において特徴抽出部2で
特徴ベクトルに変換された後、辞書照合部3においてあ
らかじめ辞書に登録されている一定の状態数を持つ各状
態系列(各状態毎に状態を代表する特徴ベクトルおよび
状態の継続時間を記憶したもののデータ列)の各状態と
フレーム毎に比較照合され、各状態毎の類似度が求めら
れる。
イムチャートで、各状態のフレーム長は、状態毎に他状
態から状態遷移が起こった時点で、遷移前状態の継続フ
レーム数をその状態の継続フレーム数の初期値としてセ
ットし、状態が継続している間、そのフレーム数を加算
することで、その状態の継続フレーム長を算出する(継
続フレーム長計算部4)。状態が遷移する毎に遷移前の
継続フレーム長を累積することで、各状態系列の最終状
態の累積フレーム長を全フレーム長として算出すること
ができる。
の各状態の累積フレーム数の最長値(最大フレーム数)
をフレーム毎に更新し、その時点での最大フレーム数を
算出する。最終状態の類似度が閾値αを越えたとき(T
0)、その状態系列を結果候補保存部6にて認識結果候
補の情報として、類似度,終端位置,フレーム長(及び
最終状態の継続フレーム長)が保存される。認識結果出
力部8では、結果候補決定時点(T0)から各フレーム
毎にT0からの経過時間Ta0とその時点での最大フレ
ーム数とを比較部7で比較し、経過時間Ta0が最大フ
レーム数より大きくなったとき、結果候補保存部6に保
持されている認識結果候補を認識結果として出力する。
定時点(T0)から経過時間Ta0が最大フレーム数よ
り大きくなる前(T1時点)に新たに認識結果候補が出
力された場合、経過時間Ta0を0にクリアし、以後
は、T1からの経過時間Ta1とフレーム毎の最大フレ
ーム数を比較し、経過時間Ta1が最大フレーム数より
大きくなったとき、保持されている認識結果候補0と認
識結果候補1を認識結果として出力する。同様に、T2
…Tnに対応する認識結果候補2…nが存在する場合
は、Tnからの経過時間Tanがフレーム毎の最大フレ
ーム数より大きくなったとき、保持されているn+1個
の認識結果候補を全て出力する。
算出をリアルタイムで処理を可能とし、瞬時に認識結果
を出力することができる。さらに、“部分マッチング”
や“湧き出し”を後処理で対応できるように認識結果候
補を出力することができる。
す図である。
ャートである。
…継続フレーム長算出部、5…最大フレーム数算出部、
6…結果候補保存部、7…比較部、8…認識結果出力
部。
Claims (3)
- 【請求項1】 音声を入力する手段と、入力音声信号を
一定時間(フレーム)毎の特徴ベクトル時系列に変換す
る手段を有し、あらかじめ登録された一定の状態数を持
つ状態系列で、各状態毎に状態を代表する特徴ベクトル
および状態の標準継続時間を記憶した標準パターンと前
記特徴ベクトルとをフレーム毎に比較照合して、入力信
号の各時点での各状態毎の類似度を求め、状態遷移時に
遷移前の状態の類似度を累積し、各状態系列の最終状態
の類似度が閾値(α)を越えたときに、その状態系列を
その時点での認識結果候補とする音声認識装置におい
て、各状態毎に各状態がそれぞれ継続している間、毎フ
レームに1つ加算することで算出する各状態毎の継続フ
レーム数算出手段を有し、状態毎に他状態から状態遷移
が起こった時点で、遷移前状態の継続フレーム数をその
状態の継続フレーム数の初期値とし、遷移前状態の継続
フレーム長を累積していき、各状態系列の最終状態の類
似度が閾値(α)を越えたときのその状態系列の最終状
態の累積フレーム長を認識結果候補の全フレーム長とす
ることを特徴とした音声認識装置。 - 【請求項2】 音声を入力する手段と、入力音声信号を
一定時間(フレーム)毎の特徴ベクトル時系列に変換す
る手段を有し、あらかじめ登録された一定の状態数を持
つ状態系列で、各状態毎に状態を代表する特徴ベクトル
および状態の標準継続時間を記憶した標準パターンと前
記特徴ベクトルとをフレーム毎に比較照合して、入力信
号の各時点での各状態毎の類似度を求め、状態遷移時に
遷移前の状態の類似度を累積し、各状態系列の最終状態
の類似度が閾値(α)を越えたときに、その状態系列を
その時点での認識結果候補とする音声認識装置におい
て、各状態系列の各状態の累積フレーム数の最長値をフ
レーム毎に更新し、フレーム毎にその時点での各状態系
列の最長値の最大値(最大フレーム数)を保持し、状態
系列の最終状態の類似度が閾値(α)を越えた時点(T
0)で、その状態系列固有の系列番号を認識結果候補と
して保持し、結果候補決定時点(T0)から各フレーム
毎に候補決定時点(T0)からの経過時間(Ta)とそ
の時点での最大フレーム数とを比較し、経過時間(T
a)が最大フレーム数より大きくなったとき、保持され
ている認識結果候補を認識結果として出力することを特
徴とした音声認識装置。 - 【請求項3】 請求項2において、結果候補決定時点
(T0)から経過時間(Ta)が最大フレーム数より大
きくなる前(T1時点)に新たに認識結果候補が出力さ
れた場合、経過時間(Ta)を0にクリアし、以後は前
記T1時点からの経過時間(Ta1)とフレーム毎の最
大フレーム数を比較し、経過時間(Ta1)が最大フレ
ーム数より大きくなったとき、保持されている認識結果
候補0と認識結果候補1を認識結果として出力し、同様
に、T2…Tnに対応する認識結果候補2…nが存在す
る場合はTnからの経過時間Tanがフレーム毎の最大
フレーム数より大きくなったとき、保持されているn+
1個の認識結果候補を全て出力することを特徴とした音
声認識装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP35740396A JP3625002B2 (ja) | 1996-12-26 | 1996-12-26 | 音声認識装置 |
| US08/995,258 US5974381A (en) | 1996-12-26 | 1997-12-19 | Method and system for efficiently avoiding partial matching in voice recognition |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP35740396A JP3625002B2 (ja) | 1996-12-26 | 1996-12-26 | 音声認識装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH10187181A true JPH10187181A (ja) | 1998-07-14 |
| JP3625002B2 JP3625002B2 (ja) | 2005-03-02 |
Family
ID=18453949
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP35740396A Expired - Fee Related JP3625002B2 (ja) | 1996-12-26 | 1996-12-26 | 音声認識装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US5974381A (ja) |
| JP (1) | JP3625002B2 (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7343288B2 (en) | 2002-05-08 | 2008-03-11 | Sap Ag | Method and system for the processing and storing of voice information and corresponding timeline information |
| US7406413B2 (en) | 2002-05-08 | 2008-07-29 | Sap Aktiengesellschaft | Method and system for the processing of voice data and for the recognition of a language |
Families Citing this family (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3578587B2 (ja) * | 1997-03-28 | 2004-10-20 | 株式会社リコー | 音声認識装置および音声認識方法 |
| EP1361740A1 (de) * | 2002-05-08 | 2003-11-12 | Sap Ag | Verfahren und System zur Verarbeitung von Sprachinformationen eines Dialogs |
| DE10220520A1 (de) * | 2002-05-08 | 2003-11-20 | Sap Ag | Verfahren zur Erkennung von Sprachinformation |
| US7412378B2 (en) * | 2004-04-01 | 2008-08-12 | International Business Machines Corporation | Method and system of dynamically adjusting a speech output rate to match a speech input rate |
| US8326625B2 (en) * | 2009-11-10 | 2012-12-04 | Research In Motion Limited | System and method for low overhead time domain voice authentication |
| US8321209B2 (en) | 2009-11-10 | 2012-11-27 | Research In Motion Limited | System and method for low overhead frequency domain voice authentication |
| US9275139B2 (en) * | 2012-03-30 | 2016-03-01 | Aurix Limited | “At least” operator for combining audio search hits |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5885499A (ja) * | 1981-11-18 | 1983-05-21 | 株式会社デンソー | 連続音声認識装置 |
| JPS58115497A (ja) * | 1981-12-28 | 1983-07-09 | シャープ株式会社 | 音声認識方法 |
| JPS58132298A (ja) * | 1982-02-01 | 1983-08-06 | 日本電気株式会社 | 窓制限付パタンマツチング装置 |
| JP3066920B2 (ja) * | 1991-06-11 | 2000-07-17 | キヤノン株式会社 | 音声認識方法及び装置 |
| JP2853418B2 (ja) * | 1991-11-08 | 1999-02-03 | 松下電器産業株式会社 | 音声認識方法 |
| US5305422A (en) * | 1992-02-28 | 1994-04-19 | Panasonic Technologies, Inc. | Method for determining boundaries of isolated words within a speech signal |
| JPH0950292A (ja) * | 1995-05-31 | 1997-02-18 | Ricoh Co Ltd | 音声認識装置 |
-
1996
- 1996-12-26 JP JP35740396A patent/JP3625002B2/ja not_active Expired - Fee Related
-
1997
- 1997-12-19 US US08/995,258 patent/US5974381A/en not_active Expired - Fee Related
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7343288B2 (en) | 2002-05-08 | 2008-03-11 | Sap Ag | Method and system for the processing and storing of voice information and corresponding timeline information |
| US7406413B2 (en) | 2002-05-08 | 2008-07-29 | Sap Aktiengesellschaft | Method and system for the processing of voice data and for the recognition of a language |
Also Published As
| Publication number | Publication date |
|---|---|
| US5974381A (en) | 1999-10-26 |
| JP3625002B2 (ja) | 2005-03-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP3789246B2 (ja) | 音声区間検出装置、音声区間検出方法、音声認識装置、音声認識方法および記録媒体 | |
| JP3434838B2 (ja) | ワードスポッティング法 | |
| EP0319140B1 (en) | Speech recognition | |
| JPH05197389A (ja) | 音声認識装置 | |
| JPH10187181A (ja) | 音声認識装置 | |
| US5799274A (en) | Speech recognition system and method for properly recognizing a compound word composed of a plurality of words | |
| JPH10254475A (ja) | 音声認識方法 | |
| JP4393648B2 (ja) | 音声認識装置 | |
| JP3578587B2 (ja) | 音声認識装置および音声認識方法 | |
| JPH11184491A (ja) | 音声認識装置 | |
| JP2996019B2 (ja) | 音声認識装置 | |
| Suaudeau et al. | An efficient combination of acoustic and supra-segmental informations in a speech recognition system | |
| JPH06266386A (ja) | ワードスポッティング方法 | |
| JPH0823758B2 (ja) | 話者適応形音声認識装置 | |
| JP3148322B2 (ja) | 音声認識装置 | |
| JP3368989B2 (ja) | 音声認識方法 | |
| JPH08314490A (ja) | ワードスポッティング型音声認識方法と装置 | |
| JPH09311694A (ja) | 音声認識装置 | |
| JP3100208B2 (ja) | 音声認識装置 | |
| JP3291073B2 (ja) | 音声認識方式 | |
| JPH0997095A (ja) | 音声認識装置 | |
| JP3583930B2 (ja) | 音声認識装置及びその方法 | |
| JPH0772899A (ja) | 音声認識装置 | |
| JPS58159598A (ja) | 単音節音声認識方式 | |
| JPH0950292A (ja) | 音声認識装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20040210 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20040412 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20040803 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20040901 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20041124 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20041124 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20071210 Year of fee payment: 3 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20081210 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20081210 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20091210 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20101210 Year of fee payment: 6 |
|
| LAPS | Cancellation because of no payment of annual fees |