JPH04122997A - パターン表現モデル学習装置 - Google Patents
パターン表現モデル学習装置Info
- Publication number
- JPH04122997A JPH04122997A JP2243225A JP24322590A JPH04122997A JP H04122997 A JPH04122997 A JP H04122997A JP 2243225 A JP2243225 A JP 2243225A JP 24322590 A JP24322590 A JP 24322590A JP H04122997 A JPH04122997 A JP H04122997A
- Authority
- JP
- Japan
- Prior art keywords
- hmm
- category
- probability
- vector
- occurrence probability
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/14—Speech classification or search using statistical models, e.g. Hidden Markov Models [HMMs]
- G10L15/142—Hidden Markov Models [HMMs]
- G10L15/144—Training of HMMs
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/20—Analysing
- G06F18/29—Graphical models, e.g. Bayesian networks
- G06F18/295—Markov models or related models, e.g. semi-Markov models; Markov random fields; Networks embedding Markov models
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- Theoretical Computer Science (AREA)
- General Engineering & Computer Science (AREA)
- Probability & Statistics with Applications (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Evolutionary Biology (AREA)
- Evolutionary Computation (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Artificial Intelligence (AREA)
- General Physics & Mathematics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Bioinformatics & Computational Biology (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Image Analysis (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
[産業上の利用分野]
本発明は、音声認識装置内なとで使用する曙れマルコフ
モデル(Hidden Markov Model 、
以後HMMと略す)のパラメータ学習に用いられるパタ
ーン表現モデル学習装置に関するものである。
モデル(Hidden Markov Model 、
以後HMMと略す)のパラメータ学習に用いられるパタ
ーン表現モデル学習装置に関するものである。
[従来の技術]
HMMは特徴系列を確率的に表現するモデルであり、複
数の状態とその間の遷移により構成され、状態間遷移の
確率と、遷移時に出力される特徴の出力確率分布をパラ
メータとする。HMMは一般に、離散分布で表された出
力確率分布を持ち、ラベル系列を表現する離散分布HM
Mと、ガウス分布等の連続分布で表された出力確率分布
を持ち、ベクトル系列を表現する連続分布HMMに大別
される。離散分布HMMによりベクトル系列を表現する
場合は、入力されたベクトルと予め用意されたベクトル
の組(コードブックと呼ぶ)との間で距離を求め、最も
距離の小さいコードブック内ベクトルの番号を出力する
ベクトル量子化(VectorQuantizatio
n、 V Qと略す)により、ベクトル系列をラベル
系列に変換して用いる。
数の状態とその間の遷移により構成され、状態間遷移の
確率と、遷移時に出力される特徴の出力確率分布をパラ
メータとする。HMMは一般に、離散分布で表された出
力確率分布を持ち、ラベル系列を表現する離散分布HM
Mと、ガウス分布等の連続分布で表された出力確率分布
を持ち、ベクトル系列を表現する連続分布HMMに大別
される。離散分布HMMによりベクトル系列を表現する
場合は、入力されたベクトルと予め用意されたベクトル
の組(コードブックと呼ぶ)との間で距離を求め、最も
距離の小さいコードブック内ベクトルの番号を出力する
ベクトル量子化(VectorQuantizatio
n、 V Qと略す)により、ベクトル系列をラベル
系列に変換して用いる。
HMMを学習する方式として最も一般的なものは、学習
に用いる特徴系列に対してHMMの出力する尤度が大き
くなるようにHMMのパラメータを設定する方式で、こ
れを一般に最尤推定法(Maximum Likeli
hood Estimation Method)と呼
ぶ。
に用いる特徴系列に対してHMMの出力する尤度が大き
くなるようにHMMのパラメータを設定する方式で、こ
れを一般に最尤推定法(Maximum Likeli
hood Estimation Method)と呼
ぶ。
音声認識のための最尤推定法によるHMMの学習のうち
、HMMの出力確率分布として混合連続分布を用いるも
のとしては、例えば文献L L、R。
、HMMの出力確率分布として混合連続分布を用いるも
のとしては、例えば文献L L、R。
Rabiner、 B、 H,Juang、 S、 E
、 Levinson、 M、 M、 5ondhi著
″Recognition of l5olated
Digits Using HicldenMarko
v Models With Continuo
us Mixture Densities
(AT&T Technical Journal
Vol、64.No、6゜July−August
1985 )がある。混合連続分布HMMは、VQに基
づく離散分布HMMと比へ量子化の際に生じる歪(VQ
歪)の影響を受けないため、特に多数話者など音響的特
徴の分散の大きなデータを表現する際に特に有効である
。
、 Levinson、 M、 M、 5ondhi著
″Recognition of l5olated
Digits Using HicldenMarko
v Models With Continuo
us Mixture Densities
(AT&T Technical Journal
Vol、64.No、6゜July−August
1985 )がある。混合連続分布HMMは、VQに基
づく離散分布HMMと比へ量子化の際に生じる歪(VQ
歪)の影響を受けないため、特に多数話者など音響的特
徴の分散の大きなデータを表現する際に特に有効である
。
第4図は文献1に記述されているHMM学習方式の構成
を図示したものである。図において、(IA)は初期混
合連続分布HMM、(2A)は音響的特徴ベクトル系列
、(3B)は最尤パラメータ推定手段、(4)は学習結
果を示す。本従来例において、音響的特徴ベクトル系列
および混合連続分布HMMの単位は単語である。
を図示したものである。図において、(IA)は初期混
合連続分布HMM、(2A)は音響的特徴ベクトル系列
、(3B)は最尤パラメータ推定手段、(4)は学習結
果を示す。本従来例において、音響的特徴ベクトル系列
および混合連続分布HMMの単位は単語である。
複数の単語カテゴリ毎に用意された初期混合連続分布H
MM (IA)は、状態数・状態間遷移および遷移確率
・出力確率分布の各パラメータか予め設定されている。
MM (IA)は、状態数・状態間遷移および遷移確率
・出力確率分布の各パラメータか予め設定されている。
また、前記複数の単語カテゴリのいずれかに属する音響
的特徴ベクトル系列(2A)は、音声信号から音響分析
により求める。
的特徴ベクトル系列(2A)は、音声信号から音響分析
により求める。
最尤パラメータ推定手段(3B)では、前記初期混合連
続分布HMMのうち前記音響的特徴ベクトル系列と同じ
単語カテゴリに属する自カテゴリHMMについて、この
音響的特徴ベクトル系列が生起する確率が高くなるよう
にHMMのパラメータを再推定する。再推定されたHM
Mを初期混合連続分布HMMとし、同しまたは異なる前
記音響的特徴ベクトル系列について前記の処理を必要回
数行った後、得られた混合連続分布HMMを学習結果(
4)として出力する。
続分布HMMのうち前記音響的特徴ベクトル系列と同じ
単語カテゴリに属する自カテゴリHMMについて、この
音響的特徴ベクトル系列が生起する確率が高くなるよう
にHMMのパラメータを再推定する。再推定されたHM
Mを初期混合連続分布HMMとし、同しまたは異なる前
記音響的特徴ベクトル系列について前記の処理を必要回
数行った後、得られた混合連続分布HMMを学習結果(
4)として出力する。
最尤推定法によるHMMの学習は、モデル間の識別能力
を学習時に考慮していないため、得られたモデルによる
識別性能に限界かある。音声認識のための、離散分布H
MMを用いたHMM学習方式についてこの問題を解決す
る目的で提案されているものとしては、例えば文献2
L、R,Bahl、 P。
を学習時に考慮していないため、得られたモデルによる
識別性能に限界かある。音声認識のための、離散分布H
MMを用いたHMM学習方式についてこの問題を解決す
る目的で提案されているものとしては、例えば文献2
L、R,Bahl、 P。
F、Brown、 P、V、de 5ousa、 R,
L、Mercer著″A NewAlgorithm
for the Estimation of Hid
den Mark。
L、Mercer著″A NewAlgorithm
for the Estimation of Hid
den Mark。
v Model Parameters (Proc
、IEEE ICASSP88.311.2)のような
ものがある。
、IEEE ICASSP88.311.2)のような
ものがある。
本従来例におけるHMM学習方式は、複数カテゴリにつ
いて用意された離散分布HMMを用いて学習用特徴系列
に対する認識評価を行い、この特徴系列に対する誤認識
を減少させる方向にHMMを更新することで、モデル間
の識別能力を向上させるものと考えることができる。
いて用意された離散分布HMMを用いて学習用特徴系列
に対する認識評価を行い、この特徴系列に対する誤認識
を減少させる方向にHMMを更新することで、モデル間
の識別能力を向上させるものと考えることができる。
第5図は文献2に記述されている学習方式の構成を図示
したものである。図において、(IB)は初期離散分布
HMM、(2B)は音響的特徴ラベル系列、(5)は生
起確率計算手段、(6)は生起確率、(7)は選択手段
、(8)は選択結果、(3C)はラベル出現頻度制御手
段、(4)は学習結果を示す。本従来例において、音響
的特徴ラベル系列および離散分布HMMの単位は単語で
ある。
したものである。図において、(IB)は初期離散分布
HMM、(2B)は音響的特徴ラベル系列、(5)は生
起確率計算手段、(6)は生起確率、(7)は選択手段
、(8)は選択結果、(3C)はラベル出現頻度制御手
段、(4)は学習結果を示す。本従来例において、音響
的特徴ラベル系列および離散分布HMMの単位は単語で
ある。
複数の単語カテゴリ毎に用意された初期離散分布HMM
(IB)は、状態数・状態間遷移および遷移確率・出力
確率分布の各パラメータが予め設定されている。この例
において、初期離散分布HMMのパラメータは最尤推定
法により求めている。
(IB)は、状態数・状態間遷移および遷移確率・出力
確率分布の各パラメータが予め設定されている。この例
において、初期離散分布HMMのパラメータは最尤推定
法により求めている。
また、前記複数の単語カテゴリのいずれかに属する音響
的特徴ラベル系列(2B)は、音声信号から音響分析及
びVQにより求める。生起確率計算手段(5)では、こ
の音響的特徴ラベル系列の、前記複数の初期離散分布H
MMの各々からの生起確率(6)を出力する。選択手段
(7)では、前記複数の初期離散分布HMMのうち、生
起確率計算手段に用いた前記音響的特徴ラベル系列と異
なるカテゴリに属し、前記生起確率計算手段により得ら
れた生起確率か最大となる最近傍他カテゴリのHMMを
選択し、選択結果(8)を出力する。
的特徴ラベル系列(2B)は、音声信号から音響分析及
びVQにより求める。生起確率計算手段(5)では、こ
の音響的特徴ラベル系列の、前記複数の初期離散分布H
MMの各々からの生起確率(6)を出力する。選択手段
(7)では、前記複数の初期離散分布HMMのうち、生
起確率計算手段に用いた前記音響的特徴ラベル系列と異
なるカテゴリに属し、前記生起確率計算手段により得ら
れた生起確率か最大となる最近傍他カテゴリのHMMを
選択し、選択結果(8)を出力する。
ラベル出現頻度制御手段(3B)では、前記初期離散分
布HMMのうち前記音響的特徴ベクトル系列と同じ単語
カテゴリに属する自カテゴリHMM。
布HMMのうち前記音響的特徴ベクトル系列と同じ単語
カテゴリに属する自カテゴリHMM。
及び前記選択手段により選択された最近傍他カテゴリH
MMについて、この音響的特徴ベクトル系列が生起する
確率が自カテゴリHMMでは高く、最近傍他カテゴリH
MMでは低くなるようにHMMのラベル出現頻度パラメ
ータを制御し、HMMのパラメータを再推定する。再推
定されたHMMを初期離散分布HMMとし、同じまたは
異なる前記音響的特徴ベクトル系列について前記の処理
を必要回数行った後、得られた離散分布HMMを学習結
果(4)として出力する。
MMについて、この音響的特徴ベクトル系列が生起する
確率が自カテゴリHMMでは高く、最近傍他カテゴリH
MMでは低くなるようにHMMのラベル出現頻度パラメ
ータを制御し、HMMのパラメータを再推定する。再推
定されたHMMを初期離散分布HMMとし、同じまたは
異なる前記音響的特徴ベクトル系列について前記の処理
を必要回数行った後、得られた離散分布HMMを学習結
果(4)として出力する。
次に、ラベル出現頻度制御手段の本従来例における詳細
を述へる。6図にラベル出現頻度制御アルゴリズムを示
す。前記音響的特徴ラベル系列が、前記自カテゴリHM
M及び最近傍他カテゴリHMMから生起する確率をそれ
ぞれPA、PBとする。
を述へる。6図にラベル出現頻度制御アルゴリズムを示
す。前記音響的特徴ラベル系列が、前記自カテゴリHM
M及び最近傍他カテゴリHMMから生起する確率をそれ
ぞれPA、PBとする。
PAかPBと比べ十分大きい場合(PA −PB >δ
、δ〉0)、前記音響的特徴ラベル系列にたいして誤認
識は生じていないとしてHMMの更新は行なわない。P
AかPBより小さい場合(PAPB≦0)誤認識が生じ
たとして次の処理を行なう。この音響的特徴ラベル系列
の第fフレームのラベルをL(f)、生起確率計算時に
求まるViterbiパス(生起確率か最大となる様な
、特徴系列とHMMの状態との対応関係)により決定さ
れる、自カテゴリHMM及び最近傍他カテゴリHMMに
関してL (f)に対応する状態をそれぞれS A(f
)。
、δ〉0)、前記音響的特徴ラベル系列にたいして誤認
識は生じていないとしてHMMの更新は行なわない。P
AかPBより小さい場合(PAPB≦0)誤認識が生じ
たとして次の処理を行なう。この音響的特徴ラベル系列
の第fフレームのラベルをL(f)、生起確率計算時に
求まるViterbiパス(生起確率か最大となる様な
、特徴系列とHMMの状態との対応関係)により決定さ
れる、自カテゴリHMM及び最近傍他カテゴリHMMに
関してL (f)に対応する状態をそれぞれS A(f
)。
S B(f)とし、各々の状態におけるラベルL (f
)の出現頻度c (SA(f)、 L(f) ) 、
c (SR(fl L(f))を次の様に更新す
る。
)の出現頻度c (SA(f)、 L(f) ) 、
c (SR(fl L(f))を次の様に更新す
る。
c (S A(f)、 L (f))−c (S A
(f)、 L (f))+βc (S B(f)、
L (f))c (S B(f)、 L (f
))−β(β〉0) ・ ・ ・ ・ (1) ただし、c (SB(f)、 L(f) ) < O
となった時c (SB(f)、L(f))=ε ・・
・ (2)(εは十分小さい値) また、PAはPBより大きいがその差が小さい場合(0
< PA−PB≦δ)前述のラベル出現頻度を0≦γ
≦βとなる値γを用いて次のように更新する。
(f)、 L (f))+βc (S B(f)、
L (f))c (S B(f)、 L (f
))−β(β〉0) ・ ・ ・ ・ (1) ただし、c (SB(f)、 L(f) ) < O
となった時c (SB(f)、L(f))=ε ・・
・ (2)(εは十分小さい値) また、PAはPBより大きいがその差が小さい場合(0
< PA−PB≦δ)前述のラベル出現頻度を0≦γ
≦βとなる値γを用いて次のように更新する。
c (SA(f)、 L(f))=c (SA(
f)、 L(f))+γc (S B(f)、L (
f))−c (S B(f)、 L (f)) −
7・・ (3) ここに、 γ−β (1−(PA −PB )/δ)・・ (4)
たたし、c (SB(f)、 L(f) ) <0と
なった時c (SB(f)、L(f))−ε ・・・・
(5)(εは十分小さい値) ラベル出現頻度の更新の概念を第7図に示す。
f)、 L(f))+γc (S B(f)、L (
f))−c (S B(f)、 L (f)) −
7・・ (3) ここに、 γ−β (1−(PA −PB )/δ)・・ (4)
たたし、c (SB(f)、 L(f) ) <0と
なった時c (SB(f)、L(f))−ε ・・・・
(5)(εは十分小さい値) ラベル出現頻度の更新の概念を第7図に示す。
図中に示す通り、HMMの各状態におけるラベル出力確
率は、その状態におけるラベル出現頻度をラベル出現総
量で正規化したものと考えられるが、図より前記の出現
頻度更新によって自カテゴリHMMに対する生起確率は
高くなり、逆に近傍他カテゴリに対する生起確率は低下
することがゎがる。
率は、その状態におけるラベル出現頻度をラベル出現総
量で正規化したものと考えられるが、図より前記の出現
頻度更新によって自カテゴリHMMに対する生起確率は
高くなり、逆に近傍他カテゴリに対する生起確率は低下
することがゎがる。
前記ラベル出現頻度の操作により、S A(f)におけ
るL (f)の出力確率は大きくなり、S B(f)に
おけるL (f)の出力確率は小さくなることがら、P
Aは増加しPBは減少する方向にHMMは更新され、そ
の結果前記音響的特徴ラベル系列について生じた誤認識
は減少する。このことがら、HMM間の識別能力は向上
したといえる。
るL (f)の出力確率は大きくなり、S B(f)に
おけるL (f)の出力確率は小さくなることがら、P
Aは増加しPBは減少する方向にHMMは更新され、そ
の結果前記音響的特徴ラベル系列について生じた誤認識
は減少する。このことがら、HMM間の識別能力は向上
したといえる。
[発明が解決しようとする課題]
文献1に示す8MM学習装置は、出力確率が混合連続分
布で表されるためVQ歪の影響を受けず、特徴の分散か
大きなデータを表現する場合特に有効であるが、最尤推
定法によりHMMを学習するためモデル間の識別能力か
学習に反映されず、識別性能に限界かある。文献2に示
す8MM学習装置は、モデル間の識別能力を学習に反映
させているため、最尤推定法を用いた場合と比べ識別能
力の高いHMMか学習されるが、出力確率が離散分布で
あるためVQ歪の影響か避けられない。文献2の従来例
においてモデル間の識別能力を高めるために採られた学
習法は、VQラベルの出現頻度を操作するものであり文
献1の学習方式に直接適用することはできない。
布で表されるためVQ歪の影響を受けず、特徴の分散か
大きなデータを表現する場合特に有効であるが、最尤推
定法によりHMMを学習するためモデル間の識別能力か
学習に反映されず、識別性能に限界かある。文献2に示
す8MM学習装置は、モデル間の識別能力を学習に反映
させているため、最尤推定法を用いた場合と比べ識別能
力の高いHMMか学習されるが、出力確率が離散分布で
あるためVQ歪の影響か避けられない。文献2の従来例
においてモデル間の識別能力を高めるために採られた学
習法は、VQラベルの出現頻度を操作するものであり文
献1の学習方式に直接適用することはできない。
本発明は係る問題点を解決するためなされたもので、高
い認識性能を期待できる混合連続分布HMMを用い、モ
デル間の識別能力を考慮した認識精度の高いモデルを得
る8MM学習装置を提供することを目的とする。
い認識性能を期待できる混合連続分布HMMを用い、モ
デル間の識別能力を考慮した認識精度の高いモデルを得
る8MM学習装置を提供することを目的とする。
ための
[課題を解決す茗(r+]
この発明は、複数の状態とその間の遷移により構成され
、状態間遷移の確率と、遷移時に出力されるベクトルの
出力確率分布をパラメータとし、出力確率分布が中心ベ
クトルと分散共分散行列、および分布間の分岐確率によ
り決定される1つ以上の連続分布によって表現されるH
MMを複数のカテゴリについて用意し、これら複数のH
MMの各パラメータを、学習用ベクトル系列を用いて学
習するパターン表現モデル学習装置において、あるカテ
ゴリに属する前記学習用ベクトル系列が、前記複数のH
MMの各々から生起する確率を求める生起確率計算手段
と、この複数のHMMから、前記学習用ベクトル系列と
異なるカテゴリに属し、前記生起確率計算手段より得ら
れた生起確率が最大となる最近傍他カテゴリHMMを選
択する選択手段と、前記複数のHMMのうち、前記生起
確率計算手段に用いた学習用ベクトル系列のカテゴリと
同じカテゴリに属する自カテゴリHMM、および前記選
択手段により選択された前記最近傍他カテゴリHMMに
ついて、これらのHMMの前記出力確率分布を構成する
各連続分布の中心ベクトルを動かす中心ベクトル制御手
段を備える。
、状態間遷移の確率と、遷移時に出力されるベクトルの
出力確率分布をパラメータとし、出力確率分布が中心ベ
クトルと分散共分散行列、および分布間の分岐確率によ
り決定される1つ以上の連続分布によって表現されるH
MMを複数のカテゴリについて用意し、これら複数のH
MMの各パラメータを、学習用ベクトル系列を用いて学
習するパターン表現モデル学習装置において、あるカテ
ゴリに属する前記学習用ベクトル系列が、前記複数のH
MMの各々から生起する確率を求める生起確率計算手段
と、この複数のHMMから、前記学習用ベクトル系列と
異なるカテゴリに属し、前記生起確率計算手段より得ら
れた生起確率が最大となる最近傍他カテゴリHMMを選
択する選択手段と、前記複数のHMMのうち、前記生起
確率計算手段に用いた学習用ベクトル系列のカテゴリと
同じカテゴリに属する自カテゴリHMM、および前記選
択手段により選択された前記最近傍他カテゴリHMMに
ついて、これらのHMMの前記出力確率分布を構成する
各連続分布の中心ベクトルを動かす中心ベクトル制御手
段を備える。
「作用」
この発明における中心ベクトル制御手段は、前記複数の
HMMのうち、前記生起確率計算手段に用いた学習用ベ
クトル系列と同じカテゴリに属する自カテゴリHMM、
および前記選択手段により選択された前記最近傍他カテ
ゴリHMMについて、これらのHMMの前記出力確率分
布を構成する各連続分布の中心ベクトルを動かす。
HMMのうち、前記生起確率計算手段に用いた学習用ベ
クトル系列と同じカテゴリに属する自カテゴリHMM、
および前記選択手段により選択された前記最近傍他カテ
ゴリHMMについて、これらのHMMの前記出力確率分
布を構成する各連続分布の中心ベクトルを動かす。
[発明の実施例]
本実施例における学習方式は、複数カテゴリについて用
意された混合連続分布HMMを用いて学習用特徴系列に
対する認識評価を行い、この特徴系列に対する誤認識を
減少させる方向にHMMを更新することで、モデル間の
識別能力を向上させるものと考えることができる。
意された混合連続分布HMMを用いて学習用特徴系列に
対する認識評価を行い、この特徴系列に対する誤認識を
減少させる方向にHMMを更新することで、モデル間の
識別能力を向上させるものと考えることができる。
第1図は音声認識の為のHMM学習に係る本発明の一実
施例の構成図である。
施例の構成図である。
図において、(LA)は初期混合連続分布HMM、(2
A)は音響的特徴ベクトル系列、(5)は生起確率計算
手段、(6)は生起確率、(7)は選択手段、(8)は
選択結果、(3A)は中心ベクトル制御手段、(4)は
学習結果を示す。本従来例において、音響的特徴ベクト
ル系列及び混合連続分布HMMの単位は単語とする。
A)は音響的特徴ベクトル系列、(5)は生起確率計算
手段、(6)は生起確率、(7)は選択手段、(8)は
選択結果、(3A)は中心ベクトル制御手段、(4)は
学習結果を示す。本従来例において、音響的特徴ベクト
ル系列及び混合連続分布HMMの単位は単語とする。
複数の単語カテゴリ毎に用意された初期混合連続分布H
MM(IA)は、状態数・状態間遷移および遷移確率・
出力確率分布の各パラメータが予め設定されている。こ
の例において、初期混合連続分布HMMのパラメータは
最尤推定法により求めている。また、前記複数の単語カ
テゴリのいずれかに属する音響的特徴ベクトル系列(2
A)は、音声信号から音響分析により求める。生起確率
計算手段(5)では、この音響的特徴ベクトル系列の、
前記複数の初期混合連続分布HMMの各々からの生起確
率(6)を出力する。選択手段(7)では、前記複数の
初期混合連続分布HMMのうち、生起確率計算手段に用
いた前記音響的特徴ベクトル系列と異なるカテゴリに属
し、前記生起確率計算手段により得られた生起確率か最
大となる最近傍他カテゴリのHMMを選択し、選択結果
(8)を出力する。中心ベクトル制御手段(3A)では
、前記初期混合連続分布HMMのうち前記音響的特徴ベ
クトル系列と同し単語カテゴリに属する自カテゴリHM
M、及び前記選択手段により選択された最近傍他カテゴ
リHMMについて、この音響的特徴ベクトル系列が生起
する確率が自カテゴIJ HMMでは高く、最近傍他カ
テゴリHMMでは低くなるようにHMMの出力確率分布
の中心ベクトルを移動し、HMMのパラメータを再推定
する。再推定されたHMMを初期混合連続分布HMMと
し、同じまたは異なる前記音響的特徴ベクトル系列につ
いて前記の処理を必要回数行った後、得られた混合連続
分布HMMを学習結果(4)として出力する。
MM(IA)は、状態数・状態間遷移および遷移確率・
出力確率分布の各パラメータが予め設定されている。こ
の例において、初期混合連続分布HMMのパラメータは
最尤推定法により求めている。また、前記複数の単語カ
テゴリのいずれかに属する音響的特徴ベクトル系列(2
A)は、音声信号から音響分析により求める。生起確率
計算手段(5)では、この音響的特徴ベクトル系列の、
前記複数の初期混合連続分布HMMの各々からの生起確
率(6)を出力する。選択手段(7)では、前記複数の
初期混合連続分布HMMのうち、生起確率計算手段に用
いた前記音響的特徴ベクトル系列と異なるカテゴリに属
し、前記生起確率計算手段により得られた生起確率か最
大となる最近傍他カテゴリのHMMを選択し、選択結果
(8)を出力する。中心ベクトル制御手段(3A)では
、前記初期混合連続分布HMMのうち前記音響的特徴ベ
クトル系列と同し単語カテゴリに属する自カテゴリHM
M、及び前記選択手段により選択された最近傍他カテゴ
リHMMについて、この音響的特徴ベクトル系列が生起
する確率が自カテゴIJ HMMでは高く、最近傍他カ
テゴリHMMでは低くなるようにHMMの出力確率分布
の中心ベクトルを移動し、HMMのパラメータを再推定
する。再推定されたHMMを初期混合連続分布HMMと
し、同じまたは異なる前記音響的特徴ベクトル系列につ
いて前記の処理を必要回数行った後、得られた混合連続
分布HMMを学習結果(4)として出力する。
次に、中心ベクトル制御手段の本実施例における詳細を
述べる。
述べる。
第2図に中心ベクトル制御アルゴリズムを示す。
前記音響的特徴ベクトル系列が、前記自カテゴリHMM
及び最近傍他カテゴリHMMから生起する確率をそれぞ
れPA、PBとする。PAかPBと比べ十分大きい場合
(PA −PB >δ、δ>0)、前記音響的特徴ベク
トル系列に対して誤認識は生じていないとしてHMMの
更新は行なわない。PAがPBより小さい場合(PA−
PB≦0)誤認識が生じたとして次の処理を行う。まず
、前記音響的特徴ベクトル系列の第fフレームの特徴ベ
クトルをV(f)、生起確率計算時に求まるViter
biパスにより決定される、自カテゴリHM M及び最
近傍他カテゴリHMMに関してV (f)に対応する状
態をそれぞれ5A(f)、 5B(f)とする。次に
、各々の状態における出力確率を表す分布数Mの混合連
続分布に関して、V (f)に対する部分確率が最大と
なる分布を選択し、その中心ベクトルをそれぞれμ(S
A(f)、 V(f) ) 、 tt (SB(f
)、 V(f) )とする。そして、これらの中心ベ
クトルを次の様に更新する。
及び最近傍他カテゴリHMMから生起する確率をそれぞ
れPA、PBとする。PAかPBと比べ十分大きい場合
(PA −PB >δ、δ>0)、前記音響的特徴ベク
トル系列に対して誤認識は生じていないとしてHMMの
更新は行なわない。PAがPBより小さい場合(PA−
PB≦0)誤認識が生じたとして次の処理を行う。まず
、前記音響的特徴ベクトル系列の第fフレームの特徴ベ
クトルをV(f)、生起確率計算時に求まるViter
biパスにより決定される、自カテゴリHM M及び最
近傍他カテゴリHMMに関してV (f)に対応する状
態をそれぞれ5A(f)、 5B(f)とする。次に
、各々の状態における出力確率を表す分布数Mの混合連
続分布に関して、V (f)に対する部分確率が最大と
なる分布を選択し、その中心ベクトルをそれぞれμ(S
A(f)、 V(f) ) 、 tt (SB(f
)、 V(f) )とする。そして、これらの中心ベ
クトルを次の様に更新する。
u (SA(f)、 V(f) ) −u (S
A(f)、 V(f))+β(V(f) −u (S
A(f)、 V(f))u (SB(f)、 V
(f) ) =u (SB(f)、 V(f))
β CVCf) −t−t (SB(f)、 V
(f))・ ・ ・ (6) (β〉0) またPAはPBより大きいがその差か小さい場合(0<
PA−PB≦δ)前述の中心ベクトルをO≦γ≦βとな
る値γを用いて次の様に更新する。
A(f)、 V(f))+β(V(f) −u (S
A(f)、 V(f))u (SB(f)、 V
(f) ) =u (SB(f)、 V(f))
β CVCf) −t−t (SB(f)、 V
(f))・ ・ ・ (6) (β〉0) またPAはPBより大きいがその差か小さい場合(0<
PA−PB≦δ)前述の中心ベクトルをO≦γ≦βとな
る値γを用いて次の様に更新する。
μ(SA(f)、 V(f))=μ(SA(f)、
V(f))+γ (■(f)−μ(SA(f)、
V(f)))11 (SB(f)、 V(f))−μ
(SB(f)、 v(D)γ(V(f)−μ(SB(
fl V(f)))・・・ (7) ここに、γは(4)式により決定する。本実施例におい
て、δ−3,0、β−0,075とする。
V(f))+γ (■(f)−μ(SA(f)、
V(f)))11 (SB(f)、 V(f))−μ
(SB(f)、 v(D)γ(V(f)−μ(SB(
fl V(f)))・・・ (7) ここに、γは(4)式により決定する。本実施例におい
て、δ−3,0、β−0,075とする。
この操作により、 μ(SA(f)、 V(f) )
は■(f)に近づき、μ(SB(f)、 V(f) )
はV (f)から遠ざかる。これに伴い、5A(f)に
おけるV (f)の出力確率は大きくなり、5B(f)
におけるV (f)の出力確率は小さくなることから、
PAは増加しPBは減少する方向にモデルは更新され、
その結果前記音響的特徴系列について生じた誤認識は減
少する。このことから、HMMの識別能力は向上したと
いえる。
は■(f)に近づき、μ(SB(f)、 V(f) )
はV (f)から遠ざかる。これに伴い、5A(f)に
おけるV (f)の出力確率は大きくなり、5B(f)
におけるV (f)の出力確率は小さくなることから、
PAは増加しPBは減少する方向にモデルは更新され、
その結果前記音響的特徴系列について生じた誤認識は減
少する。このことから、HMMの識別能力は向上したと
いえる。
本実施例におけるδ、βの値は他の値でも良い。
また、本実施例においてPAが増加しPBが減少する方
向に中心ベクトルを制御したが、いずれが一方のみの制
御でも良い。更に、中心ベクトルの制御式(6,7)は
、例えば次のようなものでも良い。
向に中心ベクトルを制御したが、いずれが一方のみの制
御でも良い。更に、中心ベクトルの制御式(6,7)は
、例えば次のようなものでも良い。
μ (SA(fl V[f))
μ (SA(f)、 V(f))十βV (f)μ
(SB(f)、 V(f)) μ (SB(f)、V(f))−βV (f)・ ・
・ (8) 本実施例においては学習の対象を音声としたが、画像な
ど他の対象に対して用いても良い。すなわち、これらの
条件は本発明を制限しない。
(SB(f)、 V(f)) μ (SB(f)、V(f))−βV (f)・ ・
・ (8) 本実施例においては学習の対象を音声としたが、画像な
ど他の対象に対して用いても良い。すなわち、これらの
条件は本発明を制限しない。
[発明の効果コ
以上のように本発明によれば、 複数の状態とその間の
遷移により構成され、状態間遷移の確率と、遷移時に出
力されるベクトルの出力確率分布をパラメータとし、出
力確率分布が中心ベクトルと分散共分散行列、および分
布間の分岐確率により決定される1つ以上の連続分布に
よって表現されるHMMを複数のカテゴリについて用意
し、これら複数のHMMの各パラメータを、学習用ベク
トル系列を用いて学習するパターン表現モデル学習装置
において、あるカテゴリに属する前記学習用ベクトル系
列が、前記複数の混合連続分布HMMの各々から生起す
る確率を求める生起確率計算手段と、この複数のHMM
から、前記学習用ベクトル系列と異なるカテゴリに属し
、前記生起確率計算手段より得られた生起確率が最大と
なる最近傍他カテゴリHMMを選択する選択手段と、前
記複数のHMMのうち、前記生起確率計算手段に用いた
学習用ベクトル系列のカテゴリと同じカテゴリに属する
自カテゴリHMM、および前記選択手段により選択され
た前記最近傍他カテゴリHMMについて、これらのHM
Mの前記出力確率分布を構成する各連続分布の中心ベク
トルを動かす中心ベクトル制御手段を備えたので、識別
性能の高い混合連続分布を用いたHMMについて、モデ
ル間の識別能力を考慮した更に識別性能の高いモデルを
得るパターン表現モデル学習装置を提供することができ
る。
遷移により構成され、状態間遷移の確率と、遷移時に出
力されるベクトルの出力確率分布をパラメータとし、出
力確率分布が中心ベクトルと分散共分散行列、および分
布間の分岐確率により決定される1つ以上の連続分布に
よって表現されるHMMを複数のカテゴリについて用意
し、これら複数のHMMの各パラメータを、学習用ベク
トル系列を用いて学習するパターン表現モデル学習装置
において、あるカテゴリに属する前記学習用ベクトル系
列が、前記複数の混合連続分布HMMの各々から生起す
る確率を求める生起確率計算手段と、この複数のHMM
から、前記学習用ベクトル系列と異なるカテゴリに属し
、前記生起確率計算手段より得られた生起確率が最大と
なる最近傍他カテゴリHMMを選択する選択手段と、前
記複数のHMMのうち、前記生起確率計算手段に用いた
学習用ベクトル系列のカテゴリと同じカテゴリに属する
自カテゴリHMM、および前記選択手段により選択され
た前記最近傍他カテゴリHMMについて、これらのHM
Mの前記出力確率分布を構成する各連続分布の中心ベク
トルを動かす中心ベクトル制御手段を備えたので、識別
性能の高い混合連続分布を用いたHMMについて、モデ
ル間の識別能力を考慮した更に識別性能の高いモデルを
得るパターン表現モデル学習装置を提供することができ
る。
第1図は本発明の一実施例に係る音声認識用8MM学習
装置を示す構成図、第2図は第1図の中心ベクトル制御
手段における制御アルゴリズムを示す図、第3図はこの
中心ベクトル制御手段における制御の概念図、第4図は
従来の音声認識用8MM学習装置を示す構成図、第5図
は他の従来の音声認識用8MM学習装置を示す構成図、
第6図は第5図のVQラベル出現頻度制御手段における
制御アルゴリズムを示す図、第7図はこのVQラベル出
現頻度制御手段における制御の概念図である。 図中同一符号は同一または相当部分を示し、(IA)は
音響的特徴ベクトル系列、(IB)は音響的特徴ラベル
系列、(3A)は初期混合連続分布HMM、(2B)は
初期離散分布HMM。 (3A)は中心ベクトル制御手段、(3B)は最尤パラ
メータ推定手段、(3C)はラベル出現頻度制御手段、
(4)は学習結果、(5)は生起確率計算手段、(6)
は生起確率、(7)は選択手段、(8)は選択結果であ
る。
装置を示す構成図、第2図は第1図の中心ベクトル制御
手段における制御アルゴリズムを示す図、第3図はこの
中心ベクトル制御手段における制御の概念図、第4図は
従来の音声認識用8MM学習装置を示す構成図、第5図
は他の従来の音声認識用8MM学習装置を示す構成図、
第6図は第5図のVQラベル出現頻度制御手段における
制御アルゴリズムを示す図、第7図はこのVQラベル出
現頻度制御手段における制御の概念図である。 図中同一符号は同一または相当部分を示し、(IA)は
音響的特徴ベクトル系列、(IB)は音響的特徴ラベル
系列、(3A)は初期混合連続分布HMM、(2B)は
初期離散分布HMM。 (3A)は中心ベクトル制御手段、(3B)は最尤パラ
メータ推定手段、(3C)はラベル出現頻度制御手段、
(4)は学習結果、(5)は生起確率計算手段、(6)
は生起確率、(7)は選択手段、(8)は選択結果であ
る。
Claims (1)
- 複数の状態とその間の遷移により構成され、状態間遷
移の確率と、遷移時に出力されるベクトルの出力確率分
布をパラメータとし、出力確率分布が中心ベクトルと分
散共分散行列、および分布間の分岐確率により決定され
る1つ以上の連続分布によって表現される隠れマルコフ
モデルを複数のカテゴリについて用意し、これら複数の
隠れマルコフモデルの各パラメータを、学習用ベクトル
系列を用いて学習するパターン表現モデル学習装置にお
いて、あるカテゴリに属する前記学習用ベクトル系列が
、前記複数の隠れマルコフモデルの各々から生起する確
率を求める生起確率計算手段と、この複数の隠れマルコ
フモデルから、前記学習用ベクトル系列と異なるカテゴ
リに属し、前記生起確率計算手段より得られた生起確率
が最大となる最近傍他カテゴリ隠れマルコフモデルを選
択する選択手段と、前記複数の隠れマルコフモデルのう
ち、前記生起確率計算手段に用いた学習用ベクトル系列
のカテゴリと同じカテゴリに属する自カテゴリ隠れマル
コフモデル、および前記選択手段により選択された前記
最近傍他カテゴリ隠れマルコフモデルについて、これら
の隠れマルコフモデルの前記出力確率分布を構成する各
連続分布の中心ベクトルを動かす中心ベクトル制御手段
とを備えることを特徴とするパターン表現モデル学習装
置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2243225A JPH0833739B2 (ja) | 1990-09-13 | 1990-09-13 | パターン表現モデル学習装置 |
| US07/674,069 US5289562A (en) | 1990-09-13 | 1991-03-21 | Pattern representation model training apparatus |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2243225A JPH0833739B2 (ja) | 1990-09-13 | 1990-09-13 | パターン表現モデル学習装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH04122997A true JPH04122997A (ja) | 1992-04-23 |
| JPH0833739B2 JPH0833739B2 (ja) | 1996-03-29 |
Family
ID=17100699
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2243225A Expired - Fee Related JPH0833739B2 (ja) | 1990-09-13 | 1990-09-13 | パターン表現モデル学習装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US5289562A (ja) |
| JP (1) | JPH0833739B2 (ja) |
Families Citing this family (131)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3050934B2 (ja) * | 1991-03-22 | 2000-06-12 | 株式会社東芝 | 音声認識方式 |
| JPH064093A (ja) * | 1992-06-18 | 1994-01-14 | Matsushita Electric Ind Co Ltd | Hmm作成装置、hmm記憶装置、尤度計算装置及び、認識装置 |
| EP0694862A3 (en) * | 1994-07-22 | 1996-07-24 | At & T Corp | Detection of degraded, grayscale documents using two-dimensional hidden pseudo-Markov models and N-best hypotheses |
| JP3581401B2 (ja) * | 1994-10-07 | 2004-10-27 | キヤノン株式会社 | 音声認識方法 |
| US5794198A (en) * | 1994-10-28 | 1998-08-11 | Nippon Telegraph And Telephone Corporation | Pattern recognition method |
| US5812972A (en) * | 1994-12-30 | 1998-09-22 | Lucent Technologies Inc. | Adaptive decision directed speech recognition bias equalization method and apparatus |
| JP3092491B2 (ja) * | 1995-08-30 | 2000-09-25 | 日本電気株式会社 | 記述長最小基準を用いたパターン適応化方式 |
| US5806030A (en) * | 1996-05-06 | 1998-09-08 | Matsushita Electric Industrial Co Ltd | Low complexity, high accuracy clustering method for speech recognizer |
| US5835890A (en) * | 1996-08-02 | 1998-11-10 | Nippon Telegraph And Telephone Corporation | Method for speaker adaptation of speech models recognition scheme using the method and recording medium having the speech recognition method recorded thereon |
| US6064958A (en) * | 1996-09-20 | 2000-05-16 | Nippon Telegraph And Telephone Corporation | Pattern recognition scheme using probabilistic models based on mixtures distribution of discrete distribution |
| US6260013B1 (en) * | 1997-03-14 | 2001-07-10 | Lernout & Hauspie Speech Products N.V. | Speech recognition system employing discriminatively trained models |
| US6112021A (en) | 1997-12-19 | 2000-08-29 | Mitsubishi Electric Information Technology Center America, Inc, (Ita) | Markov model discriminator using negative examples |
| US6263326B1 (en) | 1998-05-13 | 2001-07-17 | International Business Machines Corporation | Method product ‘apparatus for modulations’ |
| US6804648B1 (en) * | 1999-03-25 | 2004-10-12 | International Business Machines Corporation | Impulsivity estimates of mixtures of the power exponential distrubutions in speech modeling |
| US8645137B2 (en) | 2000-03-16 | 2014-02-04 | Apple Inc. | Fast, language-independent method for user authentication by voice |
| KR100446289B1 (ko) * | 2000-10-13 | 2004-09-01 | 삼성전자주식회사 | 역 히든 마르코브 모델(ihmm)을 이용한 정보 탐색방법및 장치 |
| US6801656B1 (en) | 2000-11-06 | 2004-10-05 | Koninklijke Philips Electronics N.V. | Method and apparatus for determining a number of states for a hidden Markov model in a signal processing system |
| US6928409B2 (en) * | 2001-05-31 | 2005-08-09 | Freescale Semiconductor, Inc. | Speech recognition using polynomial expansion and hidden markov models |
| JP3996428B2 (ja) * | 2001-12-25 | 2007-10-24 | 松下電器産業株式会社 | 異常検知装置及び異常検知システム |
| US8677377B2 (en) | 2005-09-08 | 2014-03-18 | Apple Inc. | Method and apparatus for building an intelligent automated assistant |
| US9318108B2 (en) | 2010-01-18 | 2016-04-19 | Apple Inc. | Intelligent automated assistant |
| US8977255B2 (en) | 2007-04-03 | 2015-03-10 | Apple Inc. | Method and system for operating a multi-function portable electronic device using voice-activation |
| US9330720B2 (en) | 2008-01-03 | 2016-05-03 | Apple Inc. | Methods and apparatus for altering audio output signals |
| US8996376B2 (en) | 2008-04-05 | 2015-03-31 | Apple Inc. | Intelligent text-to-speech conversion |
| US10496753B2 (en) | 2010-01-18 | 2019-12-03 | Apple Inc. | Automatically adapting user interfaces for hands-free interaction |
| US20100030549A1 (en) | 2008-07-31 | 2010-02-04 | Lee Michael M | Mobile device having human language translation capability with positional feedback |
| US8379794B2 (en) * | 2008-09-05 | 2013-02-19 | The Board Of Trustees Of The Leland Stanford Junior University | Method to estimate position, motion and trajectory of a target with a single x-ray imager |
| US8218859B2 (en) * | 2008-12-05 | 2012-07-10 | Microsoft Corporation | Transductive multi-label learning for video concept detection |
| US9959870B2 (en) | 2008-12-11 | 2018-05-01 | Apple Inc. | Speech recognition involving a mobile device |
| US9858925B2 (en) | 2009-06-05 | 2018-01-02 | Apple Inc. | Using context information to facilitate processing of commands in a virtual assistant |
| US10255566B2 (en) | 2011-06-03 | 2019-04-09 | Apple Inc. | Generating and processing task items that represent tasks to perform |
| US10241644B2 (en) | 2011-06-03 | 2019-03-26 | Apple Inc. | Actionable reminder entries |
| US10241752B2 (en) | 2011-09-30 | 2019-03-26 | Apple Inc. | Interface for a virtual digital assistant |
| US9431006B2 (en) * | 2009-07-02 | 2016-08-30 | Apple Inc. | Methods and apparatuses for automatic speech recognition |
| US10276170B2 (en) | 2010-01-18 | 2019-04-30 | Apple Inc. | Intelligent automated assistant |
| US10553209B2 (en) | 2010-01-18 | 2020-02-04 | Apple Inc. | Systems and methods for hands-free notification summaries |
| US10705794B2 (en) | 2010-01-18 | 2020-07-07 | Apple Inc. | Automatically adapting user interfaces for hands-free interaction |
| US10679605B2 (en) | 2010-01-18 | 2020-06-09 | Apple Inc. | Hands-free list-reading by intelligent automated assistant |
| US8682667B2 (en) | 2010-02-25 | 2014-03-25 | Apple Inc. | User profiling for selecting user specific voice input processing information |
| US8515758B2 (en) | 2010-04-14 | 2013-08-20 | Microsoft Corporation | Speech recognition including removal of irrelevant information |
| US10762293B2 (en) | 2010-12-22 | 2020-09-01 | Apple Inc. | Using parts-of-speech tagging and named entity recognition for spelling correction |
| US9262612B2 (en) | 2011-03-21 | 2016-02-16 | Apple Inc. | Device access using voice authentication |
| US10672399B2 (en) | 2011-06-03 | 2020-06-02 | Apple Inc. | Switching between text data and audio data based on a mapping |
| US10057736B2 (en) | 2011-06-03 | 2018-08-21 | Apple Inc. | Active transport based notifications |
| US8994660B2 (en) | 2011-08-29 | 2015-03-31 | Apple Inc. | Text correction processing |
| US10134385B2 (en) | 2012-03-02 | 2018-11-20 | Apple Inc. | Systems and methods for name pronunciation |
| US9483461B2 (en) | 2012-03-06 | 2016-11-01 | Apple Inc. | Handling speech synthesis of content for multiple languages |
| US9280610B2 (en) | 2012-05-14 | 2016-03-08 | Apple Inc. | Crowd sourcing information to fulfill user requests |
| US9721563B2 (en) | 2012-06-08 | 2017-08-01 | Apple Inc. | Name recognition system |
| US9495129B2 (en) | 2012-06-29 | 2016-11-15 | Apple Inc. | Device, method, and user interface for voice-activated navigation and browsing of a document |
| US9576574B2 (en) | 2012-09-10 | 2017-02-21 | Apple Inc. | Context-sensitive handling of interruptions by intelligent digital assistant |
| US9547647B2 (en) | 2012-09-19 | 2017-01-17 | Apple Inc. | Voice-based media searching |
| DE112014000709B4 (de) | 2013-02-07 | 2021-12-30 | Apple Inc. | Verfahren und vorrichtung zum betrieb eines sprachtriggers für einen digitalen assistenten |
| US9368114B2 (en) | 2013-03-14 | 2016-06-14 | Apple Inc. | Context-sensitive handling of interruptions |
| US10652394B2 (en) | 2013-03-14 | 2020-05-12 | Apple Inc. | System and method for processing voicemail |
| WO2014144579A1 (en) | 2013-03-15 | 2014-09-18 | Apple Inc. | System and method for updating an adaptive speech recognition model |
| WO2014144949A2 (en) | 2013-03-15 | 2014-09-18 | Apple Inc. | Training an at least partial voice command system |
| US9582608B2 (en) | 2013-06-07 | 2017-02-28 | Apple Inc. | Unified ranking with entropy-weighted information for phrase-based semantic auto-completion |
| WO2014197336A1 (en) | 2013-06-07 | 2014-12-11 | Apple Inc. | System and method for detecting errors in interactions with a voice-based digital assistant |
| WO2014197334A2 (en) | 2013-06-07 | 2014-12-11 | Apple Inc. | System and method for user-specified pronunciation of words for speech synthesis and recognition |
| WO2014197335A1 (en) | 2013-06-08 | 2014-12-11 | Apple Inc. | Interpreting and acting upon commands that involve sharing information with remote devices |
| KR101959188B1 (ko) | 2013-06-09 | 2019-07-02 | 애플 인크. | 디지털 어시스턴트의 둘 이상의 인스턴스들에 걸친 대화 지속성을 가능하게 하기 위한 디바이스, 방법 및 그래픽 사용자 인터페이스 |
| US10176167B2 (en) | 2013-06-09 | 2019-01-08 | Apple Inc. | System and method for inferring user intent from speech inputs |
| KR101809808B1 (ko) | 2013-06-13 | 2017-12-15 | 애플 인크. | 음성 명령에 의해 개시되는 긴급 전화를 걸기 위한 시스템 및 방법 |
| KR101749009B1 (ko) | 2013-08-06 | 2017-06-19 | 애플 인크. | 원격 디바이스로부터의 활동에 기초한 스마트 응답의 자동 활성화 |
| US9620105B2 (en) | 2014-05-15 | 2017-04-11 | Apple Inc. | Analyzing audio input for efficient speech and music recognition |
| US10592095B2 (en) | 2014-05-23 | 2020-03-17 | Apple Inc. | Instantaneous speaking of content on touch devices |
| US9502031B2 (en) | 2014-05-27 | 2016-11-22 | Apple Inc. | Method for supporting dynamic grammars in WFST-based ASR |
| US9633004B2 (en) | 2014-05-30 | 2017-04-25 | Apple Inc. | Better resolution when referencing to concepts |
| WO2015184186A1 (en) | 2014-05-30 | 2015-12-03 | Apple Inc. | Multi-command single utterance input method |
| US9760559B2 (en) | 2014-05-30 | 2017-09-12 | Apple Inc. | Predictive text input |
| US10289433B2 (en) | 2014-05-30 | 2019-05-14 | Apple Inc. | Domain specific language for encoding assistant dialog |
| US9430463B2 (en) | 2014-05-30 | 2016-08-30 | Apple Inc. | Exemplar-based natural language processing |
| US9785630B2 (en) | 2014-05-30 | 2017-10-10 | Apple Inc. | Text prediction using combined word N-gram and unigram language models |
| US10078631B2 (en) | 2014-05-30 | 2018-09-18 | Apple Inc. | Entropy-guided text prediction using combined word and character n-gram language models |
| US9715875B2 (en) | 2014-05-30 | 2017-07-25 | Apple Inc. | Reducing the need for manual start/end-pointing and trigger phrases |
| US10170123B2 (en) | 2014-05-30 | 2019-01-01 | Apple Inc. | Intelligent assistant for home automation |
| US9842101B2 (en) | 2014-05-30 | 2017-12-12 | Apple Inc. | Predictive conversion of language input |
| US9734193B2 (en) | 2014-05-30 | 2017-08-15 | Apple Inc. | Determining domain salience ranking from ambiguous words in natural speech |
| US9338493B2 (en) | 2014-06-30 | 2016-05-10 | Apple Inc. | Intelligent automated assistant for TV user interactions |
| US10659851B2 (en) | 2014-06-30 | 2020-05-19 | Apple Inc. | Real-time digital assistant knowledge updates |
| US10446141B2 (en) | 2014-08-28 | 2019-10-15 | Apple Inc. | Automatic speech recognition based on user feedback |
| US9818400B2 (en) | 2014-09-11 | 2017-11-14 | Apple Inc. | Method and apparatus for discovering trending terms in speech requests |
| US10789041B2 (en) | 2014-09-12 | 2020-09-29 | Apple Inc. | Dynamic thresholds for always listening speech trigger |
| US9668121B2 (en) | 2014-09-30 | 2017-05-30 | Apple Inc. | Social reminders |
| US10127911B2 (en) | 2014-09-30 | 2018-11-13 | Apple Inc. | Speaker identification and unsupervised speaker adaptation techniques |
| US9646609B2 (en) | 2014-09-30 | 2017-05-09 | Apple Inc. | Caching apparatus for serving phonetic pronunciations |
| US10074360B2 (en) | 2014-09-30 | 2018-09-11 | Apple Inc. | Providing an indication of the suitability of speech recognition |
| US9886432B2 (en) | 2014-09-30 | 2018-02-06 | Apple Inc. | Parsimonious handling of word inflection via categorical stem + suffix N-gram language models |
| US10552013B2 (en) | 2014-12-02 | 2020-02-04 | Apple Inc. | Data detection |
| US9711141B2 (en) | 2014-12-09 | 2017-07-18 | Apple Inc. | Disambiguating heteronyms in speech synthesis |
| US9865280B2 (en) | 2015-03-06 | 2018-01-09 | Apple Inc. | Structured dictation using intelligent automated assistants |
| US9721566B2 (en) | 2015-03-08 | 2017-08-01 | Apple Inc. | Competing devices responding to voice triggers |
| US9886953B2 (en) | 2015-03-08 | 2018-02-06 | Apple Inc. | Virtual assistant activation |
| US10567477B2 (en) | 2015-03-08 | 2020-02-18 | Apple Inc. | Virtual assistant continuity |
| US9899019B2 (en) | 2015-03-18 | 2018-02-20 | Apple Inc. | Systems and methods for structured stem and suffix language models |
| US9842105B2 (en) | 2015-04-16 | 2017-12-12 | Apple Inc. | Parsimonious continuous-space phrase representations for natural language processing |
| US10083688B2 (en) | 2015-05-27 | 2018-09-25 | Apple Inc. | Device voice control for selecting a displayed affordance |
| US10127220B2 (en) | 2015-06-04 | 2018-11-13 | Apple Inc. | Language identification from short strings |
| US10101822B2 (en) | 2015-06-05 | 2018-10-16 | Apple Inc. | Language input correction |
| US10186254B2 (en) | 2015-06-07 | 2019-01-22 | Apple Inc. | Context-based endpoint detection |
| US10255907B2 (en) | 2015-06-07 | 2019-04-09 | Apple Inc. | Automatic accent detection using acoustic models |
| US11025565B2 (en) | 2015-06-07 | 2021-06-01 | Apple Inc. | Personalized prediction of responses for instant messaging |
| US10747498B2 (en) | 2015-09-08 | 2020-08-18 | Apple Inc. | Zero latency digital assistant |
| US10671428B2 (en) | 2015-09-08 | 2020-06-02 | Apple Inc. | Distributed personal assistant |
| US9697820B2 (en) | 2015-09-24 | 2017-07-04 | Apple Inc. | Unit-selection text-to-speech synthesis using concatenation-sensitive neural networks |
| US10366158B2 (en) | 2015-09-29 | 2019-07-30 | Apple Inc. | Efficient word encoding for recurrent neural network language models |
| US11010550B2 (en) | 2015-09-29 | 2021-05-18 | Apple Inc. | Unified language modeling framework for word prediction, auto-completion and auto-correction |
| US11587559B2 (en) | 2015-09-30 | 2023-02-21 | Apple Inc. | Intelligent device identification |
| US10691473B2 (en) | 2015-11-06 | 2020-06-23 | Apple Inc. | Intelligent automated assistant in a messaging environment |
| US10049668B2 (en) | 2015-12-02 | 2018-08-14 | Apple Inc. | Applying neural network language models to weighted finite state transducers for automatic speech recognition |
| US10223066B2 (en) | 2015-12-23 | 2019-03-05 | Apple Inc. | Proactive assistance based on dialog communication between devices |
| US10446143B2 (en) | 2016-03-14 | 2019-10-15 | Apple Inc. | Identification of voice inputs providing credentials |
| US9934775B2 (en) | 2016-05-26 | 2018-04-03 | Apple Inc. | Unit-selection text-to-speech synthesis based on predicted concatenation parameters |
| US9972304B2 (en) | 2016-06-03 | 2018-05-15 | Apple Inc. | Privacy preserving distributed evaluation framework for embedded personalized systems |
| US10249300B2 (en) | 2016-06-06 | 2019-04-02 | Apple Inc. | Intelligent list reading |
| US10049663B2 (en) | 2016-06-08 | 2018-08-14 | Apple, Inc. | Intelligent automated assistant for media exploration |
| DK179588B1 (en) | 2016-06-09 | 2019-02-22 | Apple Inc. | INTELLIGENT AUTOMATED ASSISTANT IN A HOME ENVIRONMENT |
| US10490187B2 (en) | 2016-06-10 | 2019-11-26 | Apple Inc. | Digital assistant providing automated status report |
| US10586535B2 (en) | 2016-06-10 | 2020-03-10 | Apple Inc. | Intelligent digital assistant in a multi-tasking environment |
| US10509862B2 (en) | 2016-06-10 | 2019-12-17 | Apple Inc. | Dynamic phrase expansion of language input |
| US10067938B2 (en) | 2016-06-10 | 2018-09-04 | Apple Inc. | Multilingual word prediction |
| US10192552B2 (en) | 2016-06-10 | 2019-01-29 | Apple Inc. | Digital assistant providing whispered speech |
| DK179415B1 (en) | 2016-06-11 | 2018-06-14 | Apple Inc | Intelligent device arbitration and control |
| DK201670540A1 (en) | 2016-06-11 | 2018-01-08 | Apple Inc | Application integration with a digital assistant |
| DK179343B1 (en) | 2016-06-11 | 2018-05-14 | Apple Inc | Intelligent task discovery |
| DK179049B1 (en) | 2016-06-11 | 2017-09-18 | Apple Inc | Data driven natural language event detection and classification |
| US10593346B2 (en) | 2016-12-22 | 2020-03-17 | Apple Inc. | Rank-reduced token representation for automatic speech recognition |
| DK179745B1 (en) | 2017-05-12 | 2019-05-01 | Apple Inc. | SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT |
| DK201770431A1 (en) | 2017-05-15 | 2018-12-20 | Apple Inc. | Optimizing dialogue policy decisions for digital assistants using implicit feedback |
| JP6941494B2 (ja) * | 2017-07-18 | 2021-09-29 | 日本放送協会 | エンドツーエンド日本語音声認識モデル学習装置およびプログラム |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4783804A (en) * | 1985-03-21 | 1988-11-08 | American Telephone And Telegraph Company, At&T Bell Laboratories | Hidden Markov model speech recognition arrangement |
-
1990
- 1990-09-13 JP JP2243225A patent/JPH0833739B2/ja not_active Expired - Fee Related
-
1991
- 1991-03-21 US US07/674,069 patent/US5289562A/en not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| US5289562A (en) | 1994-02-22 |
| JPH0833739B2 (ja) | 1996-03-29 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JPH04122997A (ja) | パターン表現モデル学習装置 | |
| JP3053711B2 (ja) | 音声認識装置およびそのトレーニング方法ならびに装置 | |
| US4829577A (en) | Speech recognition method | |
| US6044344A (en) | Constrained corrective training for continuous parameter system | |
| US7447634B2 (en) | Speech recognizing apparatus having optimal phoneme series comparing unit and speech recognizing method | |
| US7672847B2 (en) | Discriminative training of hidden Markov models for continuous speech recognition | |
| US7587321B2 (en) | Method, apparatus, and system for building context dependent models for a large vocabulary continuous speech recognition (LVCSR) system | |
| Pellom et al. | Fast likelihood computation techniques in nearest-neighbor based search for continuous speech recognition | |
| CA2275712A1 (en) | Speech recognition system employing discriminatively trained models | |
| EP0720149A1 (en) | Speech recognition bias equalisation method and apparatus | |
| US5956676A (en) | Pattern adapting apparatus using minimum description length criterion in pattern recognition processing and speech recognition system | |
| EP0725383B1 (en) | Pattern adaptation system using tree scheme | |
| JP2003005785A (ja) | 音源の分離方法および分離装置 | |
| JP2570448B2 (ja) | 標準パターン学習方法 | |
| JPH0895592A (ja) | パターン認識方法 | |
| Lv et al. | An asynchronous WFST-based decoder for automatic speech recognition | |
| JPH06266384A (ja) | 音響モデル適応方式 | |
| Mellouk et al. | Discriminative training for improved neural prediction systems | |
| JP5694976B2 (ja) | 分散補正パラメータ推定装置、音声認識システム、分散補正パラメータ推定方法、音声認識方法及びプログラム | |
| Minami et al. | Recognition method with parametric trajectory generated from mixture distribution HMMs | |
| JP2705537B2 (ja) | 話者学習装置 | |
| Kim et al. | Deleted strategy for MMI-based HMM training | |
| Ostendorf et al. | Tree-based dependence models for speech recognition | |
| JPH06259089A (ja) | 音声認識方法 | |
| JP2010060809A (ja) | 誤り数別識別スコア・事後確率計算方法と、その方法を用いた誤り数重み付き識別学習装置とその方法と、その装置を用いた音声認識装置と、プログラムと記録媒体 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| LAPS | Cancellation because of no payment of annual fees |