JPH08314490A - ワードスポッティング型音声認識方法と装置 - Google Patents

ワードスポッティング型音声認識方法と装置

Info

Publication number
JPH08314490A
JPH08314490A JP7123469A JP12346995A JPH08314490A JP H08314490 A JPH08314490 A JP H08314490A JP 7123469 A JP7123469 A JP 7123469A JP 12346995 A JP12346995 A JP 12346995A JP H08314490 A JPH08314490 A JP H08314490A
Authority
JP
Japan
Prior art keywords
keyword
likelihood
section
input voice
vowel
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP7123469A
Other languages
English (en)
Inventor
Toru Imai
亨 今井
Akio Ando
彰男 安藤
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Japan Broadcasting Corp
Original Assignee
Nippon Hoso Kyokai NHK
Japan Broadcasting Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nippon Hoso Kyokai NHK, Japan Broadcasting Corp filed Critical Nippon Hoso Kyokai NHK
Priority to JP7123469A priority Critical patent/JPH08314490A/ja
Publication of JPH08314490A publication Critical patent/JPH08314490A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】 【目的】 湧き出し誤りが少なく、認識精度が高く、高
速認識が可能なワードスポッティング型音声認識方法お
よび装置を提供する。 【構成】 母音の標準パターンを用いて入力音声の各時
刻の母音候補を求め、これとキーワード発音辞書中の母
音列との対応をとり、入力音声中のキーワードの存在区
間を検出し(2)、該検出された存在区間におけるキー
ワードの尤度を隠れマルコフモデルにより求める(3)
とともに、検出された前記キーワードの存在区間と求め
られた前記尤度から音声認識結果を出力する(4)。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】この発明は、音声認識方法と装置
に係り、特に入力音声中のキーワードを検出して音声認
識を行うワードスポッティング型音声認識方法と装置に
関するものである。
【0002】
【従来の技術】従来のワードスポッティング型音声認識
装置を使用する方法には、例えば以下の (a), (b) の
ような方法が提案されている。 (a)隠れマルコフモデルだけを使用する方法(今村明
弘:“HMM(隠れマルコフモデル)による電話音声の
スポッティング”,信学技報 SP90-18, 1990参照)。 (b)音素認識ネットワーク素子による単語予備選択
と、DPマッチング(例えば“確率モデルによる音声認
識”,電子情報通信学会刊,中川聖著,18頁,1988参
照)による単語決定を併用した方法(小倉広実:“音素
事後確率時系列を用いた単語予備選択と大語彙単語音声
認識”, 信学技報 SP94-87, 1995)。
【0003】
【発明が解決しようとする課題】上述の従来の方法
(a)では、入力音声の任意のフレームから任意のフレ
ームまでをキーワード存在区間と仮定し、隠れマルコフ
モデルのみにより尤度を求めていた。そのため計算量が
多く、実際には発生していない場所でキーワードを検出
してしまうこと(湧き出し誤り)が多いという問題点が
あった。
【0004】また従来の方法(b)では、子音も含めた
全ての音素の認識を高い精度で実現することが困難であ
り、DPマッチングによるキーワードの尤度計算の精度
も、特に不特定話者を想定した場合には隠れマルコフモ
デルより劣るという問題点があった。そこで本発明の目
的は、従来のこの種技術の欠点を排除し、湧き出し誤り
が少なく、認識精度が高く、高速認識が可能なワードス
ポッティング型音声認識方法および装置を提供せんとす
るものである。
【0005】
【課題を解決するための手段】この目的を達成するため
本発明ワードスポッティング型音声認識方法は、母音の
標準パターンを用いて入力音声の各時刻の母音候補を求
め、これとキーワード発音辞書中の母音列との対応をと
り、入力音声中のキーワードの存在区間を検出し、該検
出された存在区間におけるキーワードの尤度を隠れマル
コフモデルにより求めるとともに、検出された前記キー
ワードの存在区間と求められた前記尤度から音声認識結
果を出力することを特徴とするものである。
【0006】また、本発明ワードスポッティング型音声
認識装置は、入力音声の音響分析を行う音響分析部と、
該分析部の分析結果およびあらかじめ設けられたキーワ
ード発音辞書に基づいて入力音声の母音の認識を行い、
入力音声における各キーワードの存在区間を検出する存
在区間検出部と、前記分析結果、キーワード発音辞書お
よび検出されたキーワード存在区間に基づいて入力音声
に含まれる各キーワードの尤度を求める尤度算出部と、
各キーワードの存在区間および求められた尤度に基づい
てキーワード認識結果を出力する認識結果出力部とを具
備したことを特徴とするものである。
【0007】
【実施例】以下添附図面を参照し実施例により本発明を
詳細に説明する。本発明によるワードスポッティング型
音声認識方法を実施するために使用される装置の一実施
例を示す図1を参照するに、本発明音声認識装置は、入
力音声の音響分析を行う音響分析部1と、分析結果およ
びキーワード音声辞書に基づいて母音の認識を行い、入
力音声における各キーワードの存在区間を検出する存在
区間検出部2と、分析結果とキーワード音声辞書とキー
ワード存在区間に基づいて各キーワードの尤度を求める
尤度算出部と、各キーワードの存在区間と尤度に基づい
てキーワード認識結果を出力する認識結果出力部で構成
されている。
【0008】音響分析部1は、図2に示すように、入力
音声をA/D変換器11によりA/D変換し、フレーム
化器12により20ms程度の幅を1フレームとして、
各フレームの平均パワー、LPC(線形予測)ケプスト
ラム係数(周波数分布を表す係数)などの値を算出部1
3により計算する。
【0009】存在区間検出部2には図3に示すようにあ
らかじめ、母音(あ、い、う、え、お、ん)のケプスト
ラム係数などの標準的な値(母音標準パターン)を母音
標準パターンメモリ部21に保存しておく。この母音標
準パターンと入力音声の分析結果を比較器22で比較
し、入力音声の各フレームがどの母音に相当するかを母
音候補決定部23で求める。ただし各フレームに対して
一意に1つの母音を決定するのではなく、各母音の標準
パターンと入力音声の近さを尤度に変換して、各フレー
ムに対して複数の母音候補を求める。
【0010】次に、認識対象であるキーワードの母音列
が入力音声に含まれているかどうかを、キーワード発音
辞書に基づいて調べる。これも母音候補決定部23で行
われる。キーワード発音辞書は、認識対象であるキーワ
ードの漢字仮名混じり表記と、その発音をローマ字で記
述したものである。例えば「スポーツ」というキーワー
ドに対しては「s,u,p,oo,ts,u 」という発音を、「相
撲」というキーワードに対しては「s,u,m,oo」という発
音をあらかじめ記述しておく。キーワードの母音列「u,
oo,u」や「u,oo」などが入力音声に含まれている場合に
は、入力音声の何フレーム目から何フレーム目までがど
のキーワードなのか、各キーワードの存在区間情報を出
力する。
【0011】キーワードの母音列が入力音声に含まれて
いるかどうかを調べる際、例えば「スポーツ」の母音列
「u,oo,u」が入力音声に含まれているかどうかを調べる
際、「u,oo,a,u」など母音が挿入した場合もキーワード
の存在区間とする。もちろん、1つのキーワードに対し
て複数の存在区間を出力可能とする。以上の操作をキー
ワード発音辞書中のすべてのキーワードに対して行う。
【0012】尤度算出部3には図4に示すように、あら
かじめ母音(a,i,u,e,o) と子音(p,t,k,ts など) の音素
単位の隠れマルコフモデルをメモリ(ROM)に保存し
ておく。そしてキーワード発音辞書中の発音に従ってこ
れらを直列に連結32し、「スポーツ」や「相撲」など
のキーワードに相当する隠れマルコフモデルをブロック
33(RAM)で作成する。存在区間検出部2から各キ
ーワードの存在区間を受け取り、入力音声のその区間に
対する尤度を、尤度算出器34で各キーワードに相当す
る隠れマルコフモデルにより求める。
【0013】認識結果出力部4は図5に示すように各キ
ーワードの存在区間と尤度を尤度メモリ部41で受け取
り、あらかじめ設定した閾値メモリ部42からの尤度の
閾値と比較器43で比較し、その閾値を超えるキーワー
ドがあった場合には、そのキーワードが発声されたもの
として、そのキーワードを認識結果として出力する。
【0014】認識例を図6により説明する。例えば「あ
のー、スポーツ番組ありますか」というような音声が入
力された時、存在区間検出部2においてまず母音の認識
が行われ、「a,oo,u,oo,u,a,N,u,i,a,i,a,u,a 」という
ような母音列が得られる。次に「スポーツ(s,u,p,oo,t
s,u)」、「スキー(s,u,k,ii)」、「相撲(s,u,m,oo)」な
どのキーワードの母音列が入力音声のある部分と一致す
ることが検出され、この区間がキーワード存在区間とし
て尤度算出部3に渡される。尤度算出部3は、「スポー
ツ(s,u,p,oo,ts,u)」、「スキー(s,u,k,ii)」、「相撲
(s,u,m,oo)」に対して隠れマルコフモデルにより尤度を
求める。認識結果出力部4は、最も大きな尤度を示し、
あらかじめ定めた−13.0などの閾値を越える尤度−
12.0を示した「スポーツ」をキーワード認識結果と
して出力する。
【0015】認識実験により、本発明の有効性の検証を
行う。まず母音標準パターンと隠れマルコフモデルを市
販の女性音声データベースにより学習し、2人の女性話
者の50文でさらに話者適応化を行った。母音標準パタ
ーンと隠れマルコフモデルにはLPCケプストラム係数
を特徴量として用いた。キーワード発音辞書には20の
単語キーワードを登録した。前述の2人の女性話者が、
文中に1つのキーワードを含む48文を発声し、本発明
の認識装置により認識を行った。その結果、94%の認
識率が得られ(従来の方法(a)では30%であっ
た)、湧き出し誤りはゼロであり、ほぼ実時間で処理を
終えた。
【0016】以上一実施例により本発明を説明してきた
が、本発明はこの実施例に限定されることはなく、本発
明の要旨内で各種の変形、変更の可能なことは当業者に
自明であろう。例えば図3図示の尤度24は、分析結果
の入力音声の母音パターンを母音標準パターンと比較し
て両者の距離差を求めるものであってもよい。また本発
明方法を実施する装置は、上述のハード構成のものの
他、プログラムされたコンピュータソフトで処理される
ものであってもよい。
【0017】
【発明の効果】本発明方法ならびに装置によれば、母音
の標準パターンを用いて入力音声中のキーワードの存在
区間を求めた後に、隠れマルコフモデルを用いてキーワ
ードの尤度を求めるので従来のワードスポッティング型
音声認識装置に比し、湧き出し誤りが少なく、認識精度
が高く、高速認識の可能な音声認識方法ならびに装置が
提供される。
【図面の簡単な説明】
【図1】本発明方法を実施するための装置の実施例構成
を示すブロック線図。
【図2】図1図示音響分析部の構成を示す図。
【図3】図1図示存在区間検出部の構成を示す図。
【図4】図1図示尤度算出部の構成を示す図。
【図5】図1図示認識結果出力部の構成を示す図。
【図6】認識例を説明するための図。
【符号の説明】
1 音響分析部 2 存在区間検出部 3 尤度算出部 4 認識結果出力部 11 A/D変換器 12 フレーム化器 13 パワーLPCケプストラム係数算出部 21 母音標準パターンメモリ部 22 比較器 23 母音候補決定部 24 尤度 31 音素単位隠れマルコフモデルメモリ部 32 連結 33 キーワード単位隠れマルコフモデル 34 尤度算出器 41 尤度メモリ部 42 閾値メモリ部 43 比較器

Claims (2)

    【特許請求の範囲】
  1. 【請求項1】 母音の標準パターンを用いて入力音声の
    各時刻の母音候補を求め、これとキーワード発音辞書中
    の母音列との対応をとり、入力音声中のキーワードの存
    在区間を検出し、該検出された存在区間におけるキーワ
    ードの尤度を隠れマルコフモデルにより求めるととも
    に、検出された前記キーワードの存在区間と求められた
    前記尤度から音声認識結果を出力することを特徴とする
    ワードスポッティング型音声認識方法。
  2. 【請求項2】 入力音声の音響分析を行う音響分析部
    と、該分析部の分析結果およびあらかじめ設けられたキ
    ーワード発音辞書に基づいて入力音声の母音の認識を行
    い、入力音声における各キーワードの存在区間を検出す
    る存在区間検出部と、前記分析結果、キーワード発音辞
    書および検出されたキーワード存在区間に基づいて入力
    音声に含まれる各キーワードの尤度を求める尤度算出部
    と、各キーワードの存在区間および求められた尤度に基
    づいてキーワード認識結果を出力する認識結果出力部と
    を具備したことを特徴とするワードスポッティング型音
    声認識装置。
JP7123469A 1995-05-23 1995-05-23 ワードスポッティング型音声認識方法と装置 Pending JPH08314490A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP7123469A JPH08314490A (ja) 1995-05-23 1995-05-23 ワードスポッティング型音声認識方法と装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP7123469A JPH08314490A (ja) 1995-05-23 1995-05-23 ワードスポッティング型音声認識方法と装置

Publications (1)

Publication Number Publication Date
JPH08314490A true JPH08314490A (ja) 1996-11-29

Family

ID=14861407

Family Applications (1)

Application Number Title Priority Date Filing Date
JP7123469A Pending JPH08314490A (ja) 1995-05-23 1995-05-23 ワードスポッティング型音声認識方法と装置

Country Status (1)

Country Link
JP (1) JPH08314490A (ja)

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1058446A3 (en) * 1999-06-03 2003-07-09 Lucent Technologies Inc. Key segment spotting in voice messages
US10311874B2 (en) 2017-09-01 2019-06-04 4Q Catalyst, LLC Methods and systems for voice-based programming of a voice-controlled device
CN110781270A (zh) * 2018-07-13 2020-02-11 北京搜狗科技发展有限公司 一种解码网络中非关键词模型的构建方法和装置
WO2020073839A1 (zh) * 2018-10-11 2020-04-16 阿里巴巴集团控股有限公司 语音唤醒方法、装置、系统及电子设备
KR20230006055A (ko) * 2018-07-13 2023-01-10 구글 엘엘씨 종단 간 스트리밍 키워드 탐지

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1058446A3 (en) * 1999-06-03 2003-07-09 Lucent Technologies Inc. Key segment spotting in voice messages
US10311874B2 (en) 2017-09-01 2019-06-04 4Q Catalyst, LLC Methods and systems for voice-based programming of a voice-controlled device
CN110781270A (zh) * 2018-07-13 2020-02-11 北京搜狗科技发展有限公司 一种解码网络中非关键词模型的构建方法和装置
KR20230006055A (ko) * 2018-07-13 2023-01-10 구글 엘엘씨 종단 간 스트리밍 키워드 탐지
WO2020073839A1 (zh) * 2018-10-11 2020-04-16 阿里巴巴集团控股有限公司 语音唤醒方法、装置、系统及电子设备

Similar Documents

Publication Publication Date Title
CN110675855B (zh) 一种语音识别方法、电子设备及计算机可读存储介质
US8478591B2 (en) Phonetic variation model building apparatus and method and phonetic recognition system and method thereof
US8315870B2 (en) Rescoring speech recognition hypothesis using prosodic likelihood
US20180137109A1 (en) Methodology for automatic multilingual speech recognition
US20110218802A1 (en) Continuous Speech Recognition
CN114627896B (zh) 语音评测方法、装置、设备及存储介质
US6963834B2 (en) Method of speech recognition using empirically determined word candidates
KR102199246B1 (ko) 신뢰도 측점 점수를 고려한 음향 모델 학습 방법 및 장치
JP2003044078A (ja) 発声速度正規化分析を用いた音声認識装置
KR20130126570A (ko) 핵심어에서의 음소 오류 결과를 고려한 음향 모델 변별 학습을 위한 장치 및 이를 위한 방법이 기록된 컴퓨터 판독 가능한 기록매체
Iwano et al. Prosodic word boundary detection using statistical modeling of moraic fundamental frequency contours and its use for continuous speech recognition
JP3444108B2 (ja) 音声認識装置
CN108806691B (zh) 语音识别方法及系统
JP3403838B2 (ja) 句境界確率計算装置および句境界確率利用連続音声認識装置
JP2938865B1 (ja) 音声認識装置
CN114255758B (zh) 口语评测方法及装置、设备以及存储介质
Qian et al. A Multi-Space Distribution (MSD) and two-stream tone modeling approach to Mandarin speech recognition
KR100474253B1 (ko) 단어의 첫 자음 발성을 이용한 음성인식 방법 및 이를 저장한 기록 매체
JP3061292B2 (ja) アクセント句境界検出装置
JPH10232693A (ja) 音声認識装置
JP3207378B2 (ja) 音声認識方法
Jelinek et al. 25 Continuous speech recognition: Statistical methods
Kalinli et al. Continuous speech recognition using attention shift decoding with soft decision.
JP2979912B2 (ja) 音声認識装置
Montero-Asenjo et al. On the use of high-level information in speaker and language recognition