JPH054678B2 - - Google Patents

Info

Publication number
JPH054678B2
JPH054678B2 JP60241054A JP24105485A JPH054678B2 JP H054678 B2 JPH054678 B2 JP H054678B2 JP 60241054 A JP60241054 A JP 60241054A JP 24105485 A JP24105485 A JP 24105485A JP H054678 B2 JPH054678 B2 JP H054678B2
Authority
JP
Japan
Prior art keywords
speech
standard pattern
formula
similarity
voice
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP60241054A
Other languages
English (en)
Other versions
JPS62100799A (ja
Inventor
Katsuyuki Futayada
Taisuke Watanabe
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Priority to JP60241054A priority Critical patent/JPS62100799A/ja
Publication of JPS62100799A publication Critical patent/JPS62100799A/ja
Publication of JPH054678B2 publication Critical patent/JPH054678B2/ja
Granted legal-status Critical Current

Links

Description

【発明の詳細な説明】 産業上の利用分野 本発明は人間の声を機械に認識させる音声認識
方法に関するものである。
従来の技術 近年音声認識技術の開発が活発に行なわれ、商
品化されているが、これらのほとんどは声を登録
した人のみを認識対象とする特定話者用である。
特定話者用の装置は認識すべき言葉をあらかじめ
装置に登録する手間を要するため、連続的に長時
間使用する場合を除けば、使用者にとつて大きな
負担となる。大語彙単語を対象とする特定話者用
の音声認識方式においては、このような負担およ
び処理量、記憶容量の点から音節など小さな単位
を標準パターンとする必要があるとして、次のよ
うな認識方法が提案されている(日本音響学会研
究会資料S83−50)。即ち、予め各音節の標準パ
ターンと、標準パターン作成時の統計量を求めて
おく。認識時にはまず入力と各音節の標準パター
ンとの距離(類似度)を、単純距離尺度を用いて
計算し、その後、この類似度を上記統計量(1次
元の統計分布)にあてはめて事後確率に変換す
る。次に事後確率の時系列ラテイスを、情報削減
の後、辞書と照合して単語を認識するというもの
である。
これに対し、声の登録を必要とせず、使い勝手
のよい不特定話者用の認識技術の研究が最近では
精力的に行なわれるようになつた。
音声認識方法を一般的に言うと、入力音声と辞
書中に格納してある標準的な音声(これらはパラ
メータ化してある)のパターンマツチングを行な
つて、類似度が最も高い辞書中の音声を認識結果
として出力するということである。この場合、入
力音声と辞書中の音声が物理的に全く同じものな
らば問題はないわけであるが、一般には同一音声
であつても、人が違つたり、言い方が違つている
ため、全く同じにはならない。
人の違い、言い方の違いなどは、物理的にはス
ペクトルの特徴の違いと時間的な特徴の違いとし
て表現される。すなわち、調音器官(口、舌、の
どなど)の形状は人ごとに異なつているので、人
が違えば同じ言葉でもスペクトル形状は異なる。
また早口で発声するか、ゆつくり発声するかによ
つて時間的な特徴は異なる。
不特定話者用の認識技術では、このようなスペ
クトルおよびその時間的変動を正規化して、標準
パターンと比較する必要がある。
不特定話者の音声認識に有効な方法として、発
明者の本出願人は既にパラメータの時系列情報と
統計的距離尺度を併用する方法に関して特許を出
願している(特願昭60−29547号)ので、その方
法を以下に説明する。
第6図は本願出願人が以前に提案した音声認識
方法の具現化を示す機能ブロツク図である。
図において、1は入力音声をデイジタル信号に
変換するAD変換部、2は音声を分析区間(フレ
ーム)毎に分析しスペクトル情報を求める音響分
析部、3は特徴パラメータを求める特徴パラメー
タ抽出部、4は始端フレームと終端フレームを検
出する音声区間検出部、5は単語長の伸縮を行う
時間軸正規化部、6は入力パターンと標準パター
ンとの類似度を計算する距離計算部、7は予め作
成された標準パターンを格納する標準パターン格
納部である。上記構成において以下その動作を説
明する。
入力音声をAD変換部1によつて12ビツトのデ
イジタル信号に変換する。標本化周波数は8KHz
である。音響分析部2では、1フレーム
(10msec)ごとに自己相関法によるLPC分析を行
なう。分析の次数は10次とし、線形予測係数α0,
α1,α2…α10を求める。またここではフレームご
との音声パワーW0も求めておく。特徴パラメー
タ抽出部3では線形予測係数を用いて、LPCケ
プストラム係数Cl〜Cd(dは打切り次数)および
正規化対数残差パワーCoを求める。なお、LPC
分析とLPCケプストラム係数の抽出法に関して
は、例えば、J.D.マーケル、A.H.グレイ著、鈴木
久喜訳「音声の線形予測」に詳しく記述してある
ので、ここでは説明を省略する。また特徴パラメ
ータ抽出部3では対数パワーLWoを次式で求め
る。
LWo=10log10Wo (式1) 音声区間検出部4は(式1)で求めたLWoを
閾値θsと比較し、LWo>θのフレームがlsフレー
ム以上持続する場合、その最初のフレームを音声
区間の始端フレームFsとする。またFsの後にお
いて、LWoと閾値θeを比較し、LWo>θeとなる
フレームがleフレーム以上連続するとき、その最
初のフレームを音声区間の終端フレームFeとす
る。このようにしてFeからFeまでを音声区間と
する。いま説明を簡単にするために、改めてFs
を第1フレームと考え、フレームナンバーを
(1,2,…i,…I)とする。ただし、I=Fe
−Fs+である。
時間軸正規化部5では、単語長をJフレームの
長さに分割することにより線形に伸縮をする。伸
縮後の第jフレームと入力音声の第iフレームは
(式2)の関係を持つ。
j=〔J−1/I−1i+I−j/I−1+0.5〕(
式2) ただし〔 〕は、その数を超えない最大の整数
を表す。例ではJ=16としている。
次に伸縮後の特徴パラメータを時系列に並べ、
時系列パターン〓xを作成する。いま第jフレー
ムの特徴パラメータ(LPCケプトラム係数)を
C(x) j,k(k=0,1,2,…P:d個)とすると〓x
は次式となる。
〓x=(C(x) 1,0,C(x) 1,1C(x) 1,2…C(x) 1,p
……C(x) j,0,C(x) j,1……C(x) j,0C(x) j,1…C(x) j,p)
(式3) すなわち〓xは、J・(P+1)すなわちJ・d
次元のベクトルとなる(dは1フレームあたりの
パラメータ数)。
距離計算部6は入力パターン〓xと標準パター
ン格納部7に格納されている各音声の標準パター
ンとの類似度を統計的な距離尺度を用いて計算
し、最も距離が小さくなる音声を認識結果として
出力する。標準パターン格納部7に格納されてい
る第n番目の音声に対応する標準パターンを〓n
(平均値)、対象とする全音声に共通な共分散行列
を〓とすると、入力パターン〓xと第n番目の標
準パターンとのマハラノビス距離Snは次式で計
算される。
Sn=(〓x−〓n)t・〓−1・(〓x−〓n)
(式4) 添字tは転置を、また−1は逆行列であること
を表す。(式4)を展開すると Sn=〓t x・〓−1・〓x−2〓t o ・〓−1・〓x+〓t o・〓−1・〓n
(式5) (式5)の第1項はnに無関係なので大小比較
をするときは考慮しなくてもよい。したがつて第
1項を取除いて、SnをDnに置きかえると、Dnは
次のようになる。
Dn=bn−αt o・〓x (式6) ただし αo=2〓−1・〓n (式7) bn=〓t o・〓−1・〓n (式8) Dnを全てのn(n=1,2…N)について計算
し、Dnを最小とする音声を認識結果とする。こ
こでNは標準パターン格納部7に格納されている
音声標準パターンの数である。実際には標準パタ
ーンは〓nとbnが1対として、音声の数(N種
類)だけ格納されている。
(式6)に要する計算量は積和演算がJ・(P
+1)回、減算が1回であり、非常に計算量が少
ないのが特長である。実用的にはJ=16,P=4
とすれば十分なので、積和演算回数は1単語あた
り、80回である。
次に標準パターン〓n,〓(実際には〓n,
bnに変換される)の作成方法について説明する。
標準パターンは、各音声ごとに多くのデータサ
ンプルを用いて作成する。各音声に対して、用い
るサンプルの数をMとする。各サンプルに対して
(式2)を適用して、フレーム数をJに揃える。
音声nに対して平均値ベクトルを求める。
〓n=(C(n) 1,0,C(n) 1,1,C(n) 1,2,…C(n
)
1,p……C(n) j,0,C(n) j,1……C(n) J,0,C(n) J,1,…C(
n)
J,p(式9) ただし C(n) j,k=1/MM 〓m=1 Cj,(n) k,n (式10) (j=1,2,…J:Jフレーム k=0,
1,2,…P:d個) ここでCj,(n) k,nは音声nの第m番目のサンプル
で、第jフレームの第k次のケプストラム係数を
示す。平均値ベクトルと同様な手順で音声nの共
分散行列〓(n)を求める。全音声に共通な共分散行
列〓は次式で求める。
〓=1/N(〓(1)+〓(2)+…+〓(n)+……+〓(n)
) (式11) 〓n,〓を(式7)(式8)によつて〓n,bn
に変換し、標準パターン格納部7にあらかじめ格
納しておく。
発明が解決しようとする問題点 かかる方法における問題点は、音声区間が一意
に確実に決められていると仮定している点にあ
る。現実の音声データは種々のノイズを含んでい
たり、語頭や語尾における発声が不明瞭であるた
め、音声区間を正確に決められない場合が多々あ
る。誤まつた音声区間に対してこの方法を適用す
ると、当然のことながら、認識率が大きく低下し
てしまう。
本発明の目的は上記問題点を解決するもので、
音声区間が一意に決められない場合においても、
高い認識率を確保できる音声認識方法を提供する
ものである。
問題点を解決するための手段 本発明は上記目的を達成するもので、不特定話
者の単語認識を行なうために、パラメータの多次
元統計分布を仮定した統計的距離尺度を使用し、
かつ異なる入力に対する類似度の相互比較ができ
るようにするために、事後確率化された類似度を
用いる。事後確率については、前記日本音響学会
音声研究会資料S83−50に記載がみられるが、こ
れは距離尺度として統計的距離尺度ではなく、単
純距離尺度を用いており、まず、入力と標準パタ
ーンとのパターンマツチングによつて距離(類似
度)を求め、次に距離の分布が1次元の統計分布
に従うと仮定して事後確率に変換するものであ
る。これは、統計的距離尺度そのものを事後確率
化している本願発明の事後確率とは目的、用法と
もに異なるものである。即ち本願発明は、予め、
認識対象とする音声の各々の標準パターンを、
各々の音声に属するデータと認識対象とする全音
声のデータおよび全音声のデータの周囲情報を用
いて作成しておき、入力音声の始端候補区間(k1
フレームとする)、終端候補区間(k2フレームと
する)を決め、前記候補区間における始端、終端
の全ての組合わせによつてk1×k2とおりの音声区
間を設定し、これらの音声区間の全部または一部
を対象として、各々始端と終端の間をJフレーム
に分割し、各フレームごとにd個の特徴パラメー
タを抽出して時間的順序に並べてd×J次元の入
力ベクトルを作成し、これと前述の各々の音声標
準パターンとの事後確率化された類似度または距
離を、入力パラメータの分布が多次元統計分布に
従うと仮定して計算し、このようにして全音声区
間における全単語の標準パターンとの類似度また
は距離を計算し、全ての類似度または距離を比較
して、類似度を最大または距離を最小とした標準
パターンに対応する単語を結果として出力するも
のである。
作 用 本発明は、正確な始端、終端の位置を含む始
端、終端の候補区間を求め、この候補区間におけ
る始端、終端の全ての組合わせによる音声区間に
対するデータについて類似度または距離を求める
ので、音声区間が一意に正確に決められない場合
においても高い認識率を確保できる。
実施例 以下に本発明の実施例を図面を用いて詳細に説
明する。
第1図は本発明の一実施例における音声認識方
法を具現化するための機能ブロツク図である。図
において、1は入力音声をデイジタル信号に変換
するAD変換部、2は音声を分析区間(フレー
ム)ごとに分析する音響分析部、3は特徴パラメ
ータ抽出部であり、これらのブロツクの機能は第
6図と同じである。10は音声の始端候補区間お
よび終端候補区間を求める音声区間候補検出部、
11は始端候補フレームと終端候補フレームをい
ろいろと組合わせて音声区間を設定する音声区間
設定部、12は設定された音声区間のフレーム長
を伸縮して標準パターンのフレーム長に正規化す
る時間軸正規化部、13は時間正規化された未知
入力と、標準パターン格納部14に格納されてい
る各単語の標準パターンとの間の類似度(距離)
を計算する距離計算部、15は全音声区間、全単
語に対する類似度を比較して類似度最大(距離最
小)となる単語名を結果として出力する類似度比
較部である。上記構成において以下その動作を説
明する。AD変換部1、音響分析部2および特徴
パラメータ抽出部3の動作は従来例と全く同じな
ので説明を省略する。
音声区間検出に用いるパラメータは残差パワ
ー、帯域パワーなどいろいろなものが考えられる
が、ここでは(式1)で求めた対数パワーLWo
を用いて説明する。
従来例では、LWoを用いて音声の始端、終端
を一意に定めたが、現実には正確に定まらない場
合があるので本実施例では、始端、終端の候補区
間を求め、候補区間内には正確な始端、終端の位
置が含まれているようにする。このようにする
と、始端、終端はあいまいにしか求められない
が、外れる割合はずつと小さくなる。
次に音声区間候補検出部10の機能の一例を説
明する。始端検出のための閾値θ1 s,θ2 s(θ1 s>θ2 s
)
および終端検出のための閾値θ1 eθ2 e(θ1 e>θ2 e)を
あ
らかじめ定めておく。ここでθ1 s,θ1 eは、音声以外
の区間を含まないように高めに設定し、θ2 s,θ2 eは
逆に音声の区間を外さないように設定する。第2
図に示すように、これらの閾値を入力音声の対数
パワー値(LWo)に対して適用し、θ2 sを超える
最初のフレームをs1,θ1 sを超える最初のフレーム
をs2,そしてθ1 eより小さくなる最後のフレームを
e1,θ2 eよりも低くなる最後のフレームをe2とす
る。そうすると正確な始端Fsはs1≦Fs≦s2、正
確な終端Feはe1≦Fe<e2となる。実際にはLWo
の値の連続性を見て、規則によつてs1,s2,e1,
e2の位置を修正している。
このようにして始端候補区間、終端候補区間を
求めると、始端候補区間フレームk1=s2−s1+
1、終端候補区間k2=e2−e1+1フレームとな
り、音声区間の組合わせはL=k1×k2とおりと
なる。音声区間設定部11は、Lとおりの音声区
間の1つ1つに対して、始端sと終端eおよび音
声長I=e−s+1を決め、遂次、時間軸正規化
部12へと送出する。時間軸正規化部12では、
前記(式2)を用いて時間長をJフレームに伸縮
し、(式3)と全く同様にして、入力特徴ベクト
ル〓xを求める。これを第l番目の音声区間に対
する特徴ベクトルという意味で〓l xとする。距離
計算部13は〓l xと、標準パターン格納部14に
格納されている各単語(単語ナンバーをnとす
る)の標準パターン〓n,Bnとの距距離Dl oを
(式6)と同じ形式の(式12)で計算する。
Dl x=Bn−〓t o・〓l x (式12) 〓n,Bnおよび(式12)については後で説明
する。
Dl nを全てのn(n=1,2,…N;Nは単語
数)について計算する。そしてさらに、ブロツク
11,12,13,14の操作をくり返して、全
ての音声区間l(l=1,2,…L)について計
算すると、類似度Dl xはL×N個だけ求められる。
類似度比較部15はL×N個の中から類似度最
大(距離最小)となるものを求め、それをdl′o′と
する。認識結果は単語メンバーn′に対応する単語
を出力する。
上記のように、音声区間が正確に検出できない
場合の認識方法を説明してきたが、この方法が効
果を発揮するためには、(式12)における標準パ
ターン〓n,Bnの作成方法に工夫が必要である。
次に標準パターンの作成方法について説明する。
先ず、従来例による標準パターン((式7),
(式8))を用いたときの、問題点について述べ
る。話を単純にするために、語頭および語尾の位
置が、正確な始端、終端に対して±mフレーム以
内の範囲でずれた場合について考察する。すなわ
ち、第2図において、s2−Fe=Fs−s1=m,e2
−Fe=Fe−e1=mとした場合において、ずれ幅
mと認識率の関係について調べる。データは110
名の成人男女がそれぞれ発声した10数字(イチ、
ニ、サン、ヨン、ゴ、ロク、ナナ、ナチ、キユ
ウ、ゼロ)を用いる。第3図の破線は、従来法に
よる標準パターンを用いた場合の、ずれ幅mと10
数字の平均認識率の関係を示したものである。図
から明らかなように、m=±2以内、すなわち語
頭候補区間も、語尾候補区間も正確な位置から±
2フレーム以内の区間として検出された場合は認
識率はあまり低下しないが、語頭、語尾候補区間
がそれ以上広くなると、認識率が急激に低下して
しまう。このように従来法の標準パターンを使用
した場合は、候補区間をかなり狭く絞る必要があ
り、音声区間検出が正確でない場合にも対処でき
るようにするという本発明の目的を十分に達成す
ることができない。
次に本実施例による標準パターン作成法を説明
する。
(式6)の類似度計算式は、もともと(式5)
において、標準パターンに関係しない第1項を省
略して、求めたものである。第1項は入力の特徴
量のみに関係する量であるので、入力特徴量〓x
が同じならば省略してもさしつかえない。すなわ
ち、音声区間が1つであれば、全ての単語に対し
て第1項は共通になるので省略できる。しかし、
複数の音声区間に対する類似度を相互に比較する
場合は、(式2)で抽出されるフレームが異なる
ので、〓xが同じという条件が成立しない。これ
が第3図において、mを大きくすると、認識率が
大きく低下する主な理由である。
異なる特徴量を相互に比較する場合、事後確率
を求める方法が有効である。特徴量〓xの単語
Wnに対する事後確率をP(Wn|〓x)とする
と、ベイズの定理より、 P(Wn|〓x)=P(Wn)・P(〓x|Wn)/P(〓
x) (式13) 対数をとると logP(Wn|〓x)=logP(Wn)+logP(〓x|
Wn)−logP(〓x) (式14) どの単諸も同じ確率で出現すると考えてよいので logP(Wn)=C(定数) (式15) (式14)の第2項は確率密度関数の対数であるの
で logP(〓x|Wn)=−1/2(〓x−〓n)t ・〓n−1・(〓x−〓n)−Qn (式16) ただし Qn=log{(2π)d/2・|〓n|1/2}
(式17) ここで〓nは単語Wnの平均値、Wnは共分散
行列である。(式14)の第3項のP(〓x)は、入
力特徴量の出現確率であり、あらゆる音声区間を
設定して求めた入力特徴量の分布から求められ
る。ここでは〓xの分布が正規分布に従うものと
仮定する。すなわち logP(〓x)=−1/2(〓x−〓x)t・
〓-1/2 x・(〓x−〓x)−Qx(式18) ただし Qx=log{(2π)d/2|〓x|1/2 (式19) ここで〓x,〓xはそれぞれ〓xの平均値と共
分散行列である。これらは、全ての単語に対して
種々の音声区間を設定してそれぞれ入力特徴量〓
xを求め、それらの平均値と共分散行列を求めて
作成する。具体的には、目視によつてラベル付け
されたデータサンプルを用い、第4図に示すよう
に、始端、終端の前後にそれぞれMフレームの区
間を取つて、始端、終端を組合わせて(2M+1)
2組の区間を考え、各々を(式2)で伸縮して
(式3)のごとくパラメータ系列に変換し、全て
の組、全ての単語の全てのデータの平均値と共分
散行列を求める。このようにP(〓x)は、音声
区間が存在する周囲の情報をいろいろな状況を考
慮して正規分布としてモデル化したものと考える
ことができる。〓x、Wxの作成方法は上記に限
定されず、音声区間の周囲情報を十分に含むこと
ができる方法ならば、どのようにしてもよい。
さて(式15)〜(式19)を用いると(式14)は
次のようになる。
logP(Wn|〓x)=−1/2{(〓x−〓n)t
・〓-1 o・(〓x+〓n)−(〓x−〓x)・〓-1 x・(
〓x−
〓x)}−{Qn−Qx−C} (式20) ここで、等共分散行列の仮定を行なう。すなわ
ち 〓=〓n=〓x (式21) そうすると(式20)の{ }内の第1項は(式
4)に一致するので、 (〓x−〓n)t・〓−1・(〓x−〓n)=〓t
x・〓−1・〓x−〓t o・〓x+bn(式22) 同様に第2項は (〓x−〓x)t・〓−1・(〓x−〓x)=〓t
x・W-1・〓x−〓t x・〓x+bx(式23) ただし 〓x=2〓t x・〓−1 (式24) bx=〓t x・〓−1・〓x (式25) またQn=Qxとなるので、(式22),(式23)を
(式20)に代入すると、 logP(Wn|〓x)=1/2(〓t o・〓x−〓t x・
〓x)−1/2(bn−bx)+C=1/2〓t o・〓x−1
/2Bn+C
(式26) ここで 〓n=〓n−〓x (式27) Bn=bn−bx (式28) (式26)で定数Cは大小比較には無関係である
から除くことができる。(式26)からCを除いて
両辺に−2を掛けこれをDnとすると Dn=Bn−〓t o・〓x (式29) (式29)は(式12)に一致している。
このように本実施例で用いる類似度計算式(式
12)は、形の上では従来例の計算式(式6)と全
く同じであるが、従来例ではマハラノビス距離と
いう考え方に基づいているのに対し、本実施例で
は(式13)で示した事後確率という考え方に基づ
いている。(式13)から(式29)を導びく場合に、
計算を簡単にするために、P(〓x)の正規分布
仮定および(式21)の等共分散仮定を置いている
ので(式29)は正確な意味では事後確率とは異な
る。従つて、ここでは擬似事後確率と呼ぶことに
する。
本実施例の標準パターンは(式27),(式28)で
あるが、形式的には単語そのものの標準パターン
から、周囲情報を除去した形となつている。
以上説明した方法で標準パターンを作成する場
合のブロツク図を第5図に示す。図において1〜
3は第1図と全く同じ機能を有する。破線で示し
てある目視ラベル部16は、特徴パラメータを参
照して、目視によつて正確に音声区間を切出すこ
とを示す。標準パターンには単語音声の標準パタ
ーン〓n,〓nと周囲情報の標準パターン〓x,
〓xの2種類があるが、先ず前者について作成方
法を説明する。
あらかじめ結果が既知(たとえば単語n)の単
語音声データを第5図AD変換部1、音響分析部
2、特徴パラメータ抽出部3のブロツクで分析し
て目視ラベル部16で音声区間を求める。そし
て、この音声区間長()を(式2)を用いて、
時間軸正規化部12によつてJの長さに正規化す
る。単語別標準パターン作成部18では(式2)
の関係を満足する特徴パラメータのみを取込む。
このような操作を単語nに属する多くの音声デー
タサンプルを用いて行ない、単語別標準パターン
作成部18において、平均〓nと共分散行列〓n
を求めることによつて、各単語音声の標準パター
ンを作成する。
周囲情報の標準パターンは次のようにして作成
する。音声サンプル(結果が未知であつてもよ
い)を分析して目視ラベル部16で音声区間を求
め、区間設定部17によつて、音声区間の始端、
終端の前後にそれぞれMフレームの区間を取つて
(2M+1)2組の区間を設定する。時間軸正規化部
12では、各組に対して時間長をJフレームに正
規化し、対応するフレームの特徴パラメータCx
を環境情報作成部20に送出する。すなわち、1
つのデータサンプルに対して(2M+1)2の環境
情報が集まることになる。このような操作を多く
のデータサンプルを入力して行ない、環境情報作
成部20によつて、平均値〓xと共分散行列〓x
を求める。標準パターン変換部19では、単語別
標準パターン作成部18で求めた〓n,〓n,及
び環境情報作成部20で求めた〓x,〓xを用い
て(式7),(式8)(式24),(式25)および(式
28)〜(式29)を用いて、標準パターン〓n,
Bnを作成する。
これで標準パターン作成方法の説明を終える。
第3図の実線は本実施例による標準パターンを
使用した場合の始端、終端のずれ幅と平均認識率
の関係を示したものである。図から明らかなよう
に、従来法による標準パターンを使用した場合よ
りも、本実施例による標準パターンを使用した場
合の方が、音声区間のずれに対して格段に強い。
このように本実施例による標準パターンを第1図
における標準パターン格納部14に格納しておけ
ば、音声区間候補検出部10において、始端、後
端の候補区間が広く検出された場合においても、
認識率の低下はあまりない。
発明の効果 以上述べたように、本発明は音声区間の自動検
出を前提とした実用的な方法に関するものであ
り、音声区間の始端、後端のそれぞれの候補区間
を求め、候補区間の組合わせによつていくつかの
音声区間を設定し、各音声区間に対して時間軸の
正規化を行なつて、音声区間の環境情報を含んだ
新しい単語標準パターンとの間に事後確率化され
た類似度または距離の、入力パラメータの分布が
多次元統計分布に従うと仮定した計算を行ない、
このようにして全音声区間に対する類似度または
距離を求めて相互に比較を行なつて、類似度が最
も大きいまたは距離が最も小さい単語を結果とし
て出力する音声認識方法を提供するもので、音声
区間が一意に正確に決められない場合においても
高い認識率を確保できるとともに各音素区間あた
りの計算量が少ないという利点を有する。
【図面の簡単な説明】
第1図は本発明の一実施例における音声認識方
法を具現化する装置の機能ブロツク図、第2図は
本発明の一実施例における音声の始端候補と終端
候補の決定方法を示す説明図、第3図は音声区間
が正確でない場合における本実施例と従来例との
平均認識率の比較図、第4図は本発明の一実施例
における標準パターン作成時の音声区間の設定方
法を示す説明図、第5図は本発明の一実施例にお
ける音声標準パターンの作成を示す機能ブロツク
図、第6図は従来の音声認識装置の機能ブロツク
図である。 1……AD変換部、2……音響分析部、3……
特徴パラメータ抽出部、10……音声区間候補検
出部、11……音声区間設定部、12……時間軸
正規化部、13……距離計算部、14……標準パ
ターン格納部、15……類似度比較部。

Claims (1)

  1. 【特許請求の範囲】 1 予め、認識対象とするN種の音声の各々の標
    準パターンを、各々の音声に属するデータと認識
    対象とする全音声のデータおよび全音声のデータ
    の周囲情報を用いて作成しておき、一方入力音声
    から始端候補区間k1フレーム、終端候補区間k2フ
    レームを検出し、始端候補区間と終端候補区間を
    組合わせてK=k1×k2とおりの音声区間を設定
    し、これらの音声区間の全部または1部(K1と
    おり)を対象として、各々始端と終端の間をJフ
    レームに分割し、各フレームごとにd個の特徴パ
    ラメータを抽出して時間的順序に並べてd×J次
    元の入力ベクトルを作成し、これと前述の各々の
    音声標準パターンとの事後確率化された類似度ま
    たは距離を、入力パラメータの分布が多次元統計
    分布に従うと仮定して計算し、このようにして
    K1とおりの音声区間に対する各々の音声標準パ
    ターンとの類似度または距離を求め、N×K1種
    の類似度または距離を比較して、類似度が最大ま
    たは距離が最小となる結果に対応する音声標準パ
    ターンが属する音声を認識結果とすることを特徴
    とする音声認識方法。 2 特徴パラメータがLPCケプストラム係数、
    自己相関係数、帯域通過フイルタの出力のいずれ
    かであることを特徴とする特許請求の範囲第1項
    記載の音声認識方法。 3 周囲情報を正確な始端付近l1フレームと正確
    な終端付近l2フレームを組合わせて定まる音声区
    間を用い、全対象単語に属する多くのデータサン
    プルから統計的に作成することを特徴とする特許
    請求の範囲第1項記載の音声認識方法。 4 ある音声nの標準パターンを、nに属するデ
    ータを用いて統計的に求めた標準パターンから周
    囲情報を除去した形で求めることを特徴とする特
    許請求の範囲第1項記載の音声認識方法。 5 類似度を計算する式が1次判別関数であるこ
    とを特徴とする特許請求の範囲第1項記載の音声
    認識方法。
JP60241054A 1985-10-28 1985-10-28 音声認識方法 Granted JPS62100799A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP60241054A JPS62100799A (ja) 1985-10-28 1985-10-28 音声認識方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP60241054A JPS62100799A (ja) 1985-10-28 1985-10-28 音声認識方法

Publications (2)

Publication Number Publication Date
JPS62100799A JPS62100799A (ja) 1987-05-11
JPH054678B2 true JPH054678B2 (ja) 1993-01-20

Family

ID=17068621

Family Applications (1)

Application Number Title Priority Date Filing Date
JP60241054A Granted JPS62100799A (ja) 1985-10-28 1985-10-28 音声認識方法

Country Status (1)

Country Link
JP (1) JPS62100799A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2002003378A1 (en) * 2000-07-05 2002-01-10 Nec Corporation Speech recognition device, and method, and recording medium

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH07113836B2 (ja) * 1987-05-29 1995-12-06 日本電気株式会社 音声認識装置
JP2008216618A (ja) * 2007-03-05 2008-09-18 Fujitsu Ten Ltd 音声判別装置

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5852698A (ja) * 1981-09-24 1983-03-28 富士通株式会社 音声認識処理システム

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2002003378A1 (en) * 2000-07-05 2002-01-10 Nec Corporation Speech recognition device, and method, and recording medium

Also Published As

Publication number Publication date
JPS62100799A (ja) 1987-05-11

Similar Documents

Publication Publication Date Title
Chapaneri Spoken digits recognition using weighted MFCC and improved features for dynamic time warping
Das et al. Recognition of isolated words using features based on LPC, MFCC, ZCR and STE, with neural network classifiers
US8271283B2 (en) Method and apparatus for recognizing speech by measuring confidence levels of respective frames
Kumar et al. Design of an automatic speaker recognition system using MFCC, vector quantization and LBG algorithm
JPH0743598B2 (ja) 音声認識方法
Karpov Real-time speaker identification
Hidayat et al. Wavelet detail coefficient as a novel wavelet-mfcc features in text-dependent speaker recognition system
JP2003044078A (ja) 発声速度正規化分析を用いた音声認識装置
Singh et al. Phoneme based Hindi speech recognition using deep learning
Elkourd et al. Arabic isolated word speaker dependent recognition system
Adam et al. Analysis of momentous fragmentary formants in talaqi-like neoteric assessment of quran recitation using mfcc miniature features of quranic syllables
IL322559A (en) Identification of expressive event types for computer speech analysis
Prasad et al. Gender based emotion recognition system for telugu rural dialects using hidden markov models
JPS62100799A (ja) 音声認識方法
US20120116764A1 (en) Speech recognition method on sentences in all languages
Nwe et al. Myanmar language speech recognition with hybrid artificial neural network and Hidden Markov Model
TWI460718B (zh) 一個辨認所有語言句子方法
Sultoni et al. Speaker Recognition System Using MFCC and HMM Methods
Manor et al. Voice trigger system using fuzzy logic
Majidnezhad A HTK-based method for detecting vocal fold pathology
JPS63213899A (ja) 話者照合方式
Patro et al. Statistical feature evaluation for classification of stressed speech
Jung et al. Normalized minimum-redundancy and maximum-relevancy based feature selection for speaker verification systems
JPH0997095A (ja) 音声認識装置
Tolba et al. Comparative experiments to evaluate the use of auditory-based acoustic distinctive features and formant cues for automatic speech recognition using a multi-stream paradigm.

Legal Events

Date Code Title Description
EXPY Cancellation because of completion of term