JPH0632003B2 - 単語登録方法 - Google Patents
単語登録方法Info
- Publication number
- JPH0632003B2 JPH0632003B2 JP62202546A JP20254687A JPH0632003B2 JP H0632003 B2 JPH0632003 B2 JP H0632003B2 JP 62202546 A JP62202546 A JP 62202546A JP 20254687 A JP20254687 A JP 20254687A JP H0632003 B2 JPH0632003 B2 JP H0632003B2
- Authority
- JP
- Japan
- Prior art keywords
- standard pattern
- pattern
- word
- phoneme class
- voice
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Description
【発明の詳細な説明】 (産業上の利用分野) 本願発明は特定話者の単語音声認識装置に適用する単語
登録方法の改良に関する。
登録方法の改良に関する。
(従来の技術とその問題点) 特定話者の単語音声認識装置では、あらかじめ登録され
た標準パタンの各々と入力された未知音声のパタンを比
較して最大の類似度を与える単語を選択することによっ
て認識が行われる。標準パタンの登録においては、単語
音声の区間を切り出すことが必要であり、音声信号の振
幅パラメータを用いた端点検出が行われる。しかしなが
ら、使用者の舌打ち音や息音や周囲雑音のため、単語音
声の区間を誤って登録することがあり、誤認識の原因と
なっている。
た標準パタンの各々と入力された未知音声のパタンを比
較して最大の類似度を与える単語を選択することによっ
て認識が行われる。標準パタンの登録においては、単語
音声の区間を切り出すことが必要であり、音声信号の振
幅パラメータを用いた端点検出が行われる。しかしなが
ら、使用者の舌打ち音や息音や周囲雑音のため、単語音
声の区間を誤って登録することがあり、誤認識の原因と
なっている。
本願発明は、登録する単語の音声学的な構造を考慮して
単語音声の端点を検出することによって、より正確な単
語検出を実現し、これによって認識精度の高い音声認識
を実現することを目的とする。
単語音声の端点を検出することによって、より正確な単
語検出を実現し、これによって認識精度の高い音声認識
を実現することを目的とする。
(問題点を解決するための手段) 前述の問題点を解決するために本願の第1の発明が提供
する単語登録方法は、使用者の発声した登録音声を標準
パタンとして登録するに際して、環境雑音パタン及び不
特定話者の音素クラス標準パタンを記憶する手段を有
し、音素クラス系列として表現された登録単語に対し
て、前記音素クラス標準パタンを連結することによって
結合標準パタンとして仮の単語標準パタンを生成し、前
記結合標準パタンの前後に前記環境雑音パタンを連結し
たパタンと登録音声との時間軸対応付けによるマッチン
グを行って、結合標準パタンと環境雑音パタンとの境界
位置に対応する登録音声上の位置を抽出することによっ
て登録音声の端点を検出することを特徴とする。
する単語登録方法は、使用者の発声した登録音声を標準
パタンとして登録するに際して、環境雑音パタン及び不
特定話者の音素クラス標準パタンを記憶する手段を有
し、音素クラス系列として表現された登録単語に対し
て、前記音素クラス標準パタンを連結することによって
結合標準パタンとして仮の単語標準パタンを生成し、前
記結合標準パタンの前後に前記環境雑音パタンを連結し
たパタンと登録音声との時間軸対応付けによるマッチン
グを行って、結合標準パタンと環境雑音パタンとの境界
位置に対応する登録音声上の位置を抽出することによっ
て登録音声の端点を検出することを特徴とする。
また、本願の第2の発明が提供する単語登録方法は、使
用者の発声した登録音声を標準パタンとして登録するに
際して、環境雑音パタン及び音素クラス位置の情報を付
加されている不特定話者の基本単語標準パタンを記憶す
る手段を有し、あらかじめ使用者の発声した基本単語音
声と前記基本単語標準パタンの前後に前記環境雑音パタ
ンを連結したパタンとの時間軸対応付けによるマッチン
グを行って、基本単語標準パタンの音素クラス位置に対
応する基本単語音声の音素クラス位置を抽出することに
より音素クラス標準パタンを求め、音素クラス系列とし
て表現された登録単語に対して、前記音素クラス標準パ
タンを連結することによって結合標準パタンとして仮の
標準パタンを生成し、結合標準パタンの前後に前記環境
雑音パタンを連結したパタンと登録音声との時間軸対応
付けによるマッチングを行って、結合標準パタンと環境
雑音標準パタンとの境界位置に対応する登録音声上の位
置を抽出することによって登録音声の端点を検出するこ
とを特徴とする。
用者の発声した登録音声を標準パタンとして登録するに
際して、環境雑音パタン及び音素クラス位置の情報を付
加されている不特定話者の基本単語標準パタンを記憶す
る手段を有し、あらかじめ使用者の発声した基本単語音
声と前記基本単語標準パタンの前後に前記環境雑音パタ
ンを連結したパタンとの時間軸対応付けによるマッチン
グを行って、基本単語標準パタンの音素クラス位置に対
応する基本単語音声の音素クラス位置を抽出することに
より音素クラス標準パタンを求め、音素クラス系列とし
て表現された登録単語に対して、前記音素クラス標準パ
タンを連結することによって結合標準パタンとして仮の
標準パタンを生成し、結合標準パタンの前後に前記環境
雑音パタンを連結したパタンと登録音声との時間軸対応
付けによるマッチングを行って、結合標準パタンと環境
雑音標準パタンとの境界位置に対応する登録音声上の位
置を抽出することによって登録音声の端点を検出するこ
とを特徴とする。
(作用) 本願発明の基本的な原理を以下に説明する。
単語を認識装置に登録するためには、発声された単語音
声の始点と終点(端点)を検出することが必要であり、
このため、一般に、音声信号の振幅パラメータが用いら
れるが、発声された単語音声の前後に舌打ち音、息音、
背景雑音が付加されている場合には、端点の検出を誤る
ことがある。本願発明では、このような雑音の存在する
場合にも正確に単語の端点を検出するため、単語の音声
学的な構造を利用する。ここでは、単語の音声学的な表
現として、単語音素クラスの系列として表現する方法を
用いる。音素クラスとは、一般に、/a/,/i/,/u/,/e/,/o
/,/p/,/k/,/t/,/s/,/z/,/n/,/m/等の音素を指すが、複
数の音素を1つのクラスにまとめたものであってもよい
(例えば、/p,k,t/は無声破裂音、/s,z/は
摩擦音として1つの音素クラスにまとめることが可能で
ある)。
声の始点と終点(端点)を検出することが必要であり、
このため、一般に、音声信号の振幅パラメータが用いら
れるが、発声された単語音声の前後に舌打ち音、息音、
背景雑音が付加されている場合には、端点の検出を誤る
ことがある。本願発明では、このような雑音の存在する
場合にも正確に単語の端点を検出するため、単語の音声
学的な構造を利用する。ここでは、単語の音声学的な表
現として、単語音素クラスの系列として表現する方法を
用いる。音素クラスとは、一般に、/a/,/i/,/u/,/e/,/o
/,/p/,/k/,/t/,/s/,/z/,/n/,/m/等の音素を指すが、複
数の音素を1つのクラスにまとめたものであってもよい
(例えば、/p,k,t/は無声破裂音、/s,z/は
摩擦音として1つの音素クラスにまとめることが可能で
ある)。
発声される単語の音素クラス表現が既知である場合に
は、音素クラス標準パタンを用いて次のようにして単語
区間を検出することができる。発声される単語の音素ク
ラス表現(即ち、音素クラス系列)を {s1,s2,…,sk,…,sk} とする。また、各音素クラスsについて特徴ベクトルと
して表される音素クラス標準パタンX(s)が与えられてい
るものとする。このとき、音素クラス標準パタンを連結
して単語の結合標準パタンXを生成する。
は、音素クラス標準パタンを用いて次のようにして単語
区間を検出することができる。発声される単語の音素ク
ラス表現(即ち、音素クラス系列)を {s1,s2,…,sk,…,sk} とする。また、各音素クラスsについて特徴ベクトルと
して表される音素クラス標準パタンX(s)が与えられてい
るものとする。このとき、音素クラス標準パタンを連結
して単語の結合標準パタンXを生成する。
X={X(s1),…,X(s1),X(s2),…,X(s2,…, X(sk),…,X(sk)} ここで、各音素クラス標準パタンX(sk)はそれぞれ固有
の個数が並べられる。さらに、環境雑音パタンを特徴ベ
クトルNで表すものとし、結合標準パタンの前後に環境
雑音パタンを付加した拡張結合標準パタンX*を考える。
の個数が並べられる。さらに、環境雑音パタンを特徴ベ
クトルNで表すものとし、結合標準パタンの前後に環境
雑音パタンを付加した拡張結合標準パタンX*を考える。
X*={N,X(s1),…,X(s1),X(s2),…,X(S2),…, X(sk),…,X(sk),N} ={X*(1),X*(2),…,X
*(i),…,X*(1)} 環境雑音パタンは、環境雑音の平均的なパタンであり、
発声する前に一定時間の入力を観測、平均化することに
よって得ることができる。一方、入力される単語音声を
特徴ベクトルの系列Y={Y(1),Y(2),…,Y(J)}とす
る。2つの特徴ベクトル系列パタンX*,Yはよく知られ
ている動的計画法を利用したDPマッチングにより時間
軸を非線形的に対応付けることができる(DPマッチン
グの原理は日本音響学会誌Vol.27,No.9,p.483参照)。
即ち、ベクトル間距離 d(i,j)=distance(X*(i),Y(j)) に関する累積量g(i,j)について次の漸化式を解けばよ
い。
*(i),…,X*(1)} 環境雑音パタンは、環境雑音の平均的なパタンであり、
発声する前に一定時間の入力を観測、平均化することに
よって得ることができる。一方、入力される単語音声を
特徴ベクトルの系列Y={Y(1),Y(2),…,Y(J)}とす
る。2つの特徴ベクトル系列パタンX*,Yはよく知られ
ている動的計画法を利用したDPマッチングにより時間
軸を非線形的に対応付けることができる(DPマッチン
グの原理は日本音響学会誌Vol.27,No.9,p.483参照)。
即ち、ベクトル間距離 d(i,j)=distance(X*(i),Y(j)) に関する累積量g(i,j)について次の漸化式を解けばよ
い。
初期条件:g(0,0)=0,g(i,0)=∞(i=1,…,I), g(0,j)=∞(j=1,…,J) 漸化式: この漸化式計算は入力音声の時間軸に沿って実行するこ
とができ、時間軸の対応付けを求めるには仮の終点(i,
j)からマッチング経路をh(i,j)を用いてトレースバック
すればよい。入力音声の仮の終点Jは、振幅を用いて音
声の存在する可能性のある区間を求める、発声を終えた
時点を使用者がマニュアルで指定する等の方法により決
定することができる。第1図にDPマッチングによる時
間軸対応付け結果の例を示す。図においてIS,IEは
それぞれ結合標準パタンの始点、終点であり、これらに
対応する位置JS,JEが単語音声の始点、終点とな
る。このようにして決定された端点は、入力音声を単語
に先行する雑音部分、これに続く音素クラスの系列から
構成される単語部分、単語に後続する雑音部分として解
釈した結果として得られたものであり、単に振幅の大小
によって決定された端点に比べて正確なものである。
とができ、時間軸の対応付けを求めるには仮の終点(i,
j)からマッチング経路をh(i,j)を用いてトレースバック
すればよい。入力音声の仮の終点Jは、振幅を用いて音
声の存在する可能性のある区間を求める、発声を終えた
時点を使用者がマニュアルで指定する等の方法により決
定することができる。第1図にDPマッチングによる時
間軸対応付け結果の例を示す。図においてIS,IEは
それぞれ結合標準パタンの始点、終点であり、これらに
対応する位置JS,JEが単語音声の始点、終点とな
る。このようにして決定された端点は、入力音声を単語
に先行する雑音部分、これに続く音素クラスの系列から
構成される単語部分、単語に後続する雑音部分として解
釈した結果として得られたものであり、単に振幅の大小
によって決定された端点に比べて正確なものである。
音素クラス標準パタンについては不特定話者の標準パタ
ンを用いる方法と、特定話者の標準パタンを用いる方法
の2通りが考えられる。不特定話者標準パタンを用いる
場合には、多数の話者の音声サンプルから抽出した音素
クラスパタンを平均化する方法、クラスタリングによっ
て複数個の標準パタンを求める方法などによって、あら
かじめ音素クラス標準パタンを求めておくことができ
る。特定話者標準パタンを用いる場合には、不特定話者
標準パタンを用いる方法より更に精度の良い端点の検出
を行うことができる。この場合には、あらかじめ音素ク
ラス標準パタンを求めておくことができないため、単語
の登録に先だって、話者の音素クラス標準パタンの作成
を以下の手順によって行う。
ンを用いる方法と、特定話者の標準パタンを用いる方法
の2通りが考えられる。不特定話者標準パタンを用いる
場合には、多数の話者の音声サンプルから抽出した音素
クラスパタンを平均化する方法、クラスタリングによっ
て複数個の標準パタンを求める方法などによって、あら
かじめ音素クラス標準パタンを求めておくことができ
る。特定話者標準パタンを用いる場合には、不特定話者
標準パタンを用いる方法より更に精度の良い端点の検出
を行うことができる。この場合には、あらかじめ音素ク
ラス標準パタンを求めておくことができないため、単語
の登録に先だって、話者の音素クラス標準パタンの作成
を以下の手順によって行う。
まず、あらかじめ基本となる基本単語セットを定義して
おく。この基本単語セットはすべての音素クラスを含む
ようにし、これに対応する不特定話者の単語標準パタン
を用意しておく。基本単語の標準パタンはあらかじめ多
数話者の基本単語の音声サンプルから平均化、クラスタ
リングなどの手法によって作成することが可能である。
ここで基本単語の標準パタン上で音素クラスの位置を指
定しておく。第2図にその一例を示す。話者の発声した
基本単語音声と不特定話者の基本単語標準パタンとの時
間軸対応付けをDPマッチングにより実行する。このと
き、既に説明したように、環境雑音パタンを標準パタン
の前後に付加しておくことによって単語区間の検出が確
実なものとなる。DPマッチングの結果から、話者の発
声した音声上での音素クラス位置が決定される。これら
の位置にある特徴ベクトルをその話者の音素クラス標準
パタンとすることができる。(1つの音素クラスに対し
て複数個の位置が存在する場合には、ここでも、平均
化、クラスタリング等の手法を利用できる) 本説明では、音素クラス標準パタン、環境雑音パタンは
共に単一のベクトルとしたが、一般には複数のベクトル
の集合とすることが可能である。即ち、ベクトル間距離
の計算において、ある音素クラスに対して標準パタンの
集合が X(s)={X* 1,X* 2,…,X* m,…,X* M} として与えられている場合には としてベクトル間距離を計算すれば良い。ただし、ここ
でyは入力音声の特徴ベクトルである。
おく。この基本単語セットはすべての音素クラスを含む
ようにし、これに対応する不特定話者の単語標準パタン
を用意しておく。基本単語の標準パタンはあらかじめ多
数話者の基本単語の音声サンプルから平均化、クラスタ
リングなどの手法によって作成することが可能である。
ここで基本単語の標準パタン上で音素クラスの位置を指
定しておく。第2図にその一例を示す。話者の発声した
基本単語音声と不特定話者の基本単語標準パタンとの時
間軸対応付けをDPマッチングにより実行する。このと
き、既に説明したように、環境雑音パタンを標準パタン
の前後に付加しておくことによって単語区間の検出が確
実なものとなる。DPマッチングの結果から、話者の発
声した音声上での音素クラス位置が決定される。これら
の位置にある特徴ベクトルをその話者の音素クラス標準
パタンとすることができる。(1つの音素クラスに対し
て複数個の位置が存在する場合には、ここでも、平均
化、クラスタリング等の手法を利用できる) 本説明では、音素クラス標準パタン、環境雑音パタンは
共に単一のベクトルとしたが、一般には複数のベクトル
の集合とすることが可能である。即ち、ベクトル間距離
の計算において、ある音素クラスに対して標準パタンの
集合が X(s)={X* 1,X* 2,…,X* m,…,X* M} として与えられている場合には としてベクトル間距離を計算すれば良い。ただし、ここ
でyは入力音声の特徴ベクトルである。
(実施例) 第3図は本願の第1の発明の一実施例を示すブロック図
である。参照数字1は音声分析部であり、入力された音
声信号が特徴ベクトルの系列に変換され出力される。こ
こで、特徴ベクトルの表現としてスペクトラム、ケプス
トラム、バンドパスフィルタ等任意のものが可能であ
る。2は切り替えスイッチであり、環境雑音パタンを登
録する時は端子Aに、標準パタン作成のため単語登録を
行う時は端子Cに、認識時には端子Dに接続される。
である。参照数字1は音声分析部であり、入力された音
声信号が特徴ベクトルの系列に変換され出力される。こ
こで、特徴ベクトルの表現としてスペクトラム、ケプス
トラム、バンドパスフィルタ等任意のものが可能であ
る。2は切り替えスイッチであり、環境雑音パタンを登
録する時は端子Aに、標準パタン作成のため単語登録を
行う時は端子Cに、認識時には端子Dに接続される。
まず最初に、スイッチ2においてAが選択され、環境雑
音パタンの登録が行われる。無音状態において音声分析
部により分析された結果である特徴ベクトルが環境雑音
パタン記憶部3に格納される。6は音素クラス標準パタ
ン記憶部で、あらかじめ多数話者の音声サンプルから作
成された音素クラス標準パタンが格納されている。7は
登録単語リスト記憶部で、認識対象語いの各々について
の音素クラス系列記述が格納される。単語の登録時に
は、スイッチ2においてCが選択される。ここでは、ま
ず、7に格納されている登録単語の音素クラス系列に基
づいて、記憶部6に格納されている音素クラス標準パタ
ンを連結することによって結合標準パタンを作成し、更
に、記憶部3から読みだされた環境雑音パタンを結合標
準パタンの前後に付加し拡張結合標準パタンが作成さ
れ、バッファ8に格納される。処理部9はバッファ8か
ら読みだされた拡張結合標準パタンと、スイッチ2Cを
経由して音声分析部1から送出されてきた登録単語音声
とのDPマッチングを実行し、時間軸対応を求め、入力
音声の始点、終点を決定し区間内の特徴ベクトル系列を
標準パタンとして記憶部10に格納する。
音パタンの登録が行われる。無音状態において音声分析
部により分析された結果である特徴ベクトルが環境雑音
パタン記憶部3に格納される。6は音素クラス標準パタ
ン記憶部で、あらかじめ多数話者の音声サンプルから作
成された音素クラス標準パタンが格納されている。7は
登録単語リスト記憶部で、認識対象語いの各々について
の音素クラス系列記述が格納される。単語の登録時に
は、スイッチ2においてCが選択される。ここでは、ま
ず、7に格納されている登録単語の音素クラス系列に基
づいて、記憶部6に格納されている音素クラス標準パタ
ンを連結することによって結合標準パタンを作成し、更
に、記憶部3から読みだされた環境雑音パタンを結合標
準パタンの前後に付加し拡張結合標準パタンが作成さ
れ、バッファ8に格納される。処理部9はバッファ8か
ら読みだされた拡張結合標準パタンと、スイッチ2Cを
経由して音声分析部1から送出されてきた登録単語音声
とのDPマッチングを実行し、時間軸対応を求め、入力
音声の始点、終点を決定し区間内の特徴ベクトル系列を
標準パタンとして記憶部10に格納する。
認識時には、スイッチ2においてDが選択され、記憶部
10から読みだされた標準パタンを用いて認識部11におい
て認識処理が行われる。
10から読みだされた標準パタンを用いて認識部11におい
て認識処理が行われる。
第4図は本願の第2の発明の一実施例を示すブロック図
である。参照数字21は音声分析部であり、入力された音
声信号が特徴ベクトルの系列に変換され出力される。こ
こで、特徴ベクトルの表現としてスペクトラム、ケプス
トラム、バンドパスフィルタ等任意のものが可能であ
る。22は切り替えスイッチであり、環境雑音パタンを登
録する時は端子Aに、音素標準パタン生成のため基本単
語を入力する時は端子Bに、標準パタン作成のため単語
登録を行う時は端子Cに、認識時には端子Dに接続され
る。
である。参照数字21は音声分析部であり、入力された音
声信号が特徴ベクトルの系列に変換され出力される。こ
こで、特徴ベクトルの表現としてスペクトラム、ケプス
トラム、バンドパスフィルタ等任意のものが可能であ
る。22は切り替えスイッチであり、環境雑音パタンを登
録する時は端子Aに、音素標準パタン生成のため基本単
語を入力する時は端子Bに、標準パタン作成のため単語
登録を行う時は端子Cに、認識時には端子Dに接続され
る。
まず最初に、スイッチ22においてAが選択され、環境雑
音パタンの登録が行われる。無音状態で入力され、音声
分析部21により分析された結果である特徴ベクトルが環
境雑音パタン記憶部23に格納される。24は不特定話者の
基本単語の標準パタンを保持する記憶部で、この標準パ
タンはあらかじめ多数話者のサンプルから作成されたも
のを搭載しておく。続いて、スイッチ22においてBが選
択され音素クラス標準パタンの生成が行われる。25は音
素クラス標準パタン抽出部であり、記憶部24から読みだ
された不特定話者の基本単語標準パタンの前後に記憶部
23から読みだされた環境雑音パタンを付加したパタン
と、スイッチ22Bを経由して音声分析部21から送出され
てきた基本単語音声とのDPマツチングが実行される。
この結果得られた2つのパタンの時間軸の対応関係から
入力音声上の音素クラス位置が決定され、その位置上の
特徴ベクトルが音素クラス標準パタンとして記憶部26に
格納される。27は登録単語リスト記憶部で、認識対象語
いの各々についての音素クラス系列記述が格納される。
単語の登録の時には、スイッチ22においてCが選択され
る。ここでは、まず、27に格納されている登録単語の音
素クラス系列に基づいて、記憶部26に格納されている音
素クラス標準パタンを連結することによって結合標準パ
タンを作成し、更に、記憶部23から読みだされた環境雑
音パタンを結合標準パタンの前後に付加し拡張結合標準
パタンが作成され、バッファ28に格納される。処理部29
はバッファ28から読みだされた拡張結合標準パタンと、
スイッチ22Cを経由して音声分析部21から送出されてき
た登録単語音声とのDPマッチングを実行し、時間軸対
応を求め、入力音声の始点、終点を決定し区間内の特徴
ベクトル系列を標準パタンとして記憶部30に格納する。
音パタンの登録が行われる。無音状態で入力され、音声
分析部21により分析された結果である特徴ベクトルが環
境雑音パタン記憶部23に格納される。24は不特定話者の
基本単語の標準パタンを保持する記憶部で、この標準パ
タンはあらかじめ多数話者のサンプルから作成されたも
のを搭載しておく。続いて、スイッチ22においてBが選
択され音素クラス標準パタンの生成が行われる。25は音
素クラス標準パタン抽出部であり、記憶部24から読みだ
された不特定話者の基本単語標準パタンの前後に記憶部
23から読みだされた環境雑音パタンを付加したパタン
と、スイッチ22Bを経由して音声分析部21から送出され
てきた基本単語音声とのDPマツチングが実行される。
この結果得られた2つのパタンの時間軸の対応関係から
入力音声上の音素クラス位置が決定され、その位置上の
特徴ベクトルが音素クラス標準パタンとして記憶部26に
格納される。27は登録単語リスト記憶部で、認識対象語
いの各々についての音素クラス系列記述が格納される。
単語の登録の時には、スイッチ22においてCが選択され
る。ここでは、まず、27に格納されている登録単語の音
素クラス系列に基づいて、記憶部26に格納されている音
素クラス標準パタンを連結することによって結合標準パ
タンを作成し、更に、記憶部23から読みだされた環境雑
音パタンを結合標準パタンの前後に付加し拡張結合標準
パタンが作成され、バッファ28に格納される。処理部29
はバッファ28から読みだされた拡張結合標準パタンと、
スイッチ22Cを経由して音声分析部21から送出されてき
た登録単語音声とのDPマッチングを実行し、時間軸対
応を求め、入力音声の始点、終点を決定し区間内の特徴
ベクトル系列を標準パタンとして記憶部30に格納する。
認識時には、スイッチ22においてDが選択され、記憶部
30から読みだされた標準パタンを用いて認識部31におい
て認識処理が行われる。
30から読みだされた標準パタンを用いて認識部31におい
て認識処理が行われる。
以上に於て、DPマッチングにおける漸化式は本発明で
述べたものに限定されるものではない。また、認識部1
1,31はDPマッチング以外にも任意の方式が利用可能
である。
述べたものに限定されるものではない。また、認識部1
1,31はDPマッチング以外にも任意の方式が利用可能
である。
(発明の効果) 以上に述べたように本願発明によれば、登録する単語の
音声学的な構造を考慮した単語音声の端点の検出が行わ
れるので、より正確な単語検出を実現し、これによって
認識精度の高い音声認識を実現することが可能となる。
音声学的な構造を考慮した単語音声の端点の検出が行わ
れるので、より正確な単語検出を実現し、これによって
認識精度の高い音声認識を実現することが可能となる。
第1図はDPマッチングによる時間軸の対応付けの一例
を示す概念図、第2図は不特定話者の単語標準パタンの
一例を示す概念図、第3図および第4図は本願発明の実
施例を示すブロック図である。 これら図において、参照数字1,21は音声分析部、2,
22は切り替えスイッチ、3,23は環境雑音パタン記憶
部、24は不特定話者単語標準パタン記憶部、25は音素ク
ラス標準パタン抽出部、6,26は音素クラス標準パタン
記憶部、7,27は登録単語リスト記憶部、8,28は結合
標準パタンバッファ、9,29は処理部(単語標準パタン
登録部)、10,30は単語標準パタン記憶部、11,31は認
識部である。
を示す概念図、第2図は不特定話者の単語標準パタンの
一例を示す概念図、第3図および第4図は本願発明の実
施例を示すブロック図である。 これら図において、参照数字1,21は音声分析部、2,
22は切り替えスイッチ、3,23は環境雑音パタン記憶
部、24は不特定話者単語標準パタン記憶部、25は音素ク
ラス標準パタン抽出部、6,26は音素クラス標準パタン
記憶部、7,27は登録単語リスト記憶部、8,28は結合
標準パタンバッファ、9,29は処理部(単語標準パタン
登録部)、10,30は単語標準パタン記憶部、11,31は認
識部である。
Claims (2)
- 【請求項1】使用者の発声した登録音声を標準パタンと
して登録するに際して、環境雑音パタン及び不特定話者
の音素クラス標準パタンを記憶する手段を有し、音素ク
ラス系列として表現された登録単語に対して、前記音素
クラス標準パタンを連結することによって結合標準パタ
ンとして仮の単語標準パタンを生成し、前記結合標準パ
タンの前後に前記環境雑音パタンを連結したパタンと登
録音声との時間軸対応付けによるマッチングを行って、
結合標準パタンと環境雑音パタンとの境界位置に対応す
る登録音声上の位置を抽出することによって登録音声の
端点を検出することを特徴とする単語音声認識における
単語登録方法。 - 【請求項2】使用者の発声した登録音声を標準パタンと
して登録するに際して、環境雑音パタン及び音素クラス
位置の情報を付加されている不特定話者の基本単語標準
パタンを記憶する手段を有し、あらかじめ使用者の発声
した基本単語音声と前記基本単語標準パタンの前後に前
記環境雑音パタンを連結したパタンとの時間軸対応付け
によるマッチングを行って、基本単語標準パタンの音素
クラス位置に対応する基本単語音声の音素クラス位置を
抽出することにより音素クラス標準パタンを求め、音素
クラス系列として表現された登録単語に対して、前記音
素クラス標準パタンを連結することによって結合標準パ
タンとして仮の標準パタンを生成し、結合標準パタンの
前後に前記環境雑音パタンを連結したパタンと登録音声
との時間軸対応付けによるマッチングを行って、結合標
準パタンと環境雑音標準パタンとの境界位置に対応する
登録音声上の位置を抽出することによって登録音声の端
点を検出することを特徴とする単語音声認識における単
語登録方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62202546A JPH0632003B2 (ja) | 1987-08-12 | 1987-08-12 | 単語登録方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62202546A JPH0632003B2 (ja) | 1987-08-12 | 1987-08-12 | 単語登録方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS6444493A JPS6444493A (en) | 1989-02-16 |
| JPH0632003B2 true JPH0632003B2 (ja) | 1994-04-27 |
Family
ID=16459293
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP62202546A Expired - Lifetime JPH0632003B2 (ja) | 1987-08-12 | 1987-08-12 | 単語登録方法 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH0632003B2 (ja) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH082015A (ja) * | 1994-06-27 | 1996-01-09 | Nec Corp | プリンタ装置 |
-
1987
- 1987-08-12 JP JP62202546A patent/JPH0632003B2/ja not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| JPS6444493A (en) | 1989-02-16 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP3050934B2 (ja) | 音声認識方式 | |
| JP3337233B2 (ja) | 音声符号化方法及び装置 | |
| EP2048655A1 (en) | Context sensitive multi-stage speech recognition | |
| JPH0968994A (ja) | パターンマッチングによる単語音声認識方法及びその方法を実施する装置 | |
| Rivlin et al. | A phone-dependent confidence measure for utterance rejection | |
| JPS6247320B2 (ja) | ||
| US20040199385A1 (en) | Methods and apparatus for reducing spurious insertions in speech recognition | |
| JP2001166789A (ja) | 初頭/末尾の音素類似度ベクトルによる中国語の音声認識方法及びその装置 | |
| Kuamr et al. | Implementation and performance evaluation of continuous Hindi speech recognition | |
| JP2996019B2 (ja) | 音声認識装置 | |
| JP2745562B2 (ja) | ノイズ適応形音声認識装置 | |
| WO2007114346A1 (ja) | 音声認識装置 | |
| JP2813209B2 (ja) | 大語彙音声認識装置 | |
| JPS58108590A (ja) | 音声認識装置 | |
| JP3277522B2 (ja) | 音声認識方法 | |
| JP3457578B2 (ja) | 音声合成を用いた音声認識装置および音声認識方法 | |
| KR100677224B1 (ko) | 안티워드 모델을 이용한 음성인식 방법 | |
| JP2882791B2 (ja) | パターン比較方式 | |
| JP3029654B2 (ja) | 音声認識装置 | |
| JP2943473B2 (ja) | 音声認識方法 | |
| JPH0997095A (ja) | 音声認識装置 | |
| JP2004309654A (ja) | 音声認識装置 | |
| JP3357752B2 (ja) | パターンマッチング装置 | |
| JP2862306B2 (ja) | 音声認識装置 | |
| JPS63217399A (ja) | 音声区間検出装置 |