JPS60198598A - 音声認識方式 - Google Patents
音声認識方式Info
- Publication number
- JPS60198598A JPS60198598A JP5547784A JP5547784A JPS60198598A JP S60198598 A JPS60198598 A JP S60198598A JP 5547784 A JP5547784 A JP 5547784A JP 5547784 A JP5547784 A JP 5547784A JP S60198598 A JPS60198598 A JP S60198598A
- Authority
- JP
- Japan
- Prior art keywords
- pattern
- dictionary
- patterns
- similarity
- matching
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
技監立夏
本発明は、音声認識方式、より詳細には、音声認識装置
におけるパターンマツチング方式に関する。
におけるパターンマツチング方式に関する。
凭】U1籠
単語音声を認識するための新しいパターンマツチング方
式として、本出願人は、先に1周波数と時間を変数とす
るスペクトルグラフを基本として2種類の2次元パター
ン(ローカルピークの軌跡を表わす細線化パターンと2
値化されたブロードパターン)の重なり具合を用いて類
似度を算出する方式について種々提案した。
式として、本出願人は、先に1周波数と時間を変数とす
るスペクトルグラフを基本として2種類の2次元パター
ン(ローカルピークの軌跡を表わす細線化パターンと2
値化されたブロードパターン)の重なり具合を用いて類
似度を算出する方式について種々提案した。
更に詳細に説明すると、単語の音声認識を目的として、
マイクロホンから取り入れた単語の音声信号を特徴抽出
部に導き、何らかの方法によって数m s e c〜数
十m s e c程度の時間間隔で周波数分析し、音声
信号の短時間パワースペクトルをめ、これを特徴量とし
た場合、これ等の特徴量を周波数と時間を2軸として2
次元平面上に表示したパターンは音声のタイムスペクト
ルパターンとして知られている。本発明は、このタイム
スペクトルパターンを基本として、そのローカルピーク
を連ねた細線化パターン(第1図)と、ある闇値を設け
、これによって2値化したブロードパターン(第2図)
との2種類のパターンの重畳比較により類似度を算出し
、認識をおこなう方式に係わるものである。而して、上
記2種類のパターンのマツチング処理をおこなう場合、
2種類のパターンの内、いずれか一方を標準パターンと
して予め登録しておくのが一般的であり、登録、してお
くパターンを辞書パターンと称し、マツチング処理に際
しては、入カバターンをこの辞書パターンと照合する処
理をおこなう。しかし乍ら、単純な線形伸縮によるマツ
チング゛では辞書の有声部と入カバターンの無声部又は
その逆のケースの様に本来異なる部分同志がマツチング
計算の対象となり、これが類似度に寄与するという不具
合があった。また、辞書パターンを登録した話者と認識
時における入力音声の発話者が異なる場合には、声道特
性の個人的バラツキにより上記タイムスペクトルパター
ンに周波数方向のヅレを生じ、そのままマツチングをお
こなっても辞書パターンとの整合性が悪く、認識率が劣
化することはすでに明らかである。
マイクロホンから取り入れた単語の音声信号を特徴抽出
部に導き、何らかの方法によって数m s e c〜数
十m s e c程度の時間間隔で周波数分析し、音声
信号の短時間パワースペクトルをめ、これを特徴量とし
た場合、これ等の特徴量を周波数と時間を2軸として2
次元平面上に表示したパターンは音声のタイムスペクト
ルパターンとして知られている。本発明は、このタイム
スペクトルパターンを基本として、そのローカルピーク
を連ねた細線化パターン(第1図)と、ある闇値を設け
、これによって2値化したブロードパターン(第2図)
との2種類のパターンの重畳比較により類似度を算出し
、認識をおこなう方式に係わるものである。而して、上
記2種類のパターンのマツチング処理をおこなう場合、
2種類のパターンの内、いずれか一方を標準パターンと
して予め登録しておくのが一般的であり、登録、してお
くパターンを辞書パターンと称し、マツチング処理に際
しては、入カバターンをこの辞書パターンと照合する処
理をおこなう。しかし乍ら、単純な線形伸縮によるマツ
チング゛では辞書の有声部と入カバターンの無声部又は
その逆のケースの様に本来異なる部分同志がマツチング
計算の対象となり、これが類似度に寄与するという不具
合があった。また、辞書パターンを登録した話者と認識
時における入力音声の発話者が異なる場合には、声道特
性の個人的バラツキにより上記タイムスペクトルパター
ンに周波数方向のヅレを生じ、そのままマツチングをお
こなっても辞書パターンとの整合性が悪く、認識率が劣
化することはすでに明らかである。
そこで、まず、多数の不特定な話者に適応させるための
措置として予め選定された複数の話者のタイムスペク1
へルパターンを時間的に線形伸縮して加算することによ
り得られる荷重平均辞書を標準パターンとして用いるこ
とにより話者変動を吸収する方式について説明する。
措置として予め選定された複数の話者のタイムスペク1
へルパターンを時間的に線形伸縮して加算することによ
り得られる荷重平均辞書を標準パターンとして用いるこ
とにより話者変動を吸収する方式について説明する。
便宜的に、以下に、2種類の2値パターンの内、ブロー
ドパターンを辞書に用いる場合について説明するが、勿
論、この逆も可能である。この場合N人の話者を考える
とN個の2値ブロードパターンを加算することになり、
その結果得られたパターンはN段階のレベルを有するこ
とになる。この辞書パターンは話者が異なっても変動し
にくい部分は大きな値を持つのに対し、話者毎に変動し
やすい部分は小さな値となり周波数方向に旦って重み付
けされたパターンとなる。
ドパターンを辞書に用いる場合について説明するが、勿
論、この逆も可能である。この場合N人の話者を考える
とN個の2値ブロードパターンを加算することになり、
その結果得られたパターンはN段階のレベルを有するこ
とになる。この辞書パターンは話者が異なっても変動し
にくい部分は大きな値を持つのに対し、話者毎に変動し
やすい部分は小さな値となり周波数方向に旦って重み付
けされたパターンとなる。
上記のごとき荷重された辞書と入カバターン(2値のロ
ーカルピークパターン)とをマツチングさせる場合、そ
の類似度を計算する方式は種々考えられる。例えば、そ
の類似度式の一例を示すと下式のごとくなる。
ーカルピークパターン)とをマツチングさせる場合、そ
の類似度を計算する方式は種々考えられる。例えば、そ
の類似度式の一例を示すと下式のごとくなる。
上記(1)式を用いて類似度を計算すると、入カバター
ンは2値の細線パターンであり、辞書パターンは周波数
方向に幅を持って重みが付けられたパターンであるため
、タイムスペクトルパターン上で話者変動に対してスペ
クトル変動の大きな部分では類似度は一般に低くなり、
一方、話者変動に対してスペクトル変動の少ないフレー
ムでは類似度は平均して高くなるという傾向にあり、従
って、不特定な話者を対象とした場合には、この荷重平
均辞書は有効である。しかし乍ら、入カバターンと荷重
平均辞書の類似度を計算する場合、時間軸方向に線形に
伸縮してマツチングをするのが普通であるが、一般に音
声の時間的発声変動は非線形であるので線形伸縮マツチ
ングをおこなった場合には入カバターンの有声音フレー
ムと辞書パターンの無声音フレームとの間で類似度計算
がおこなわれる場合が生じる。これは本来無意味なマツ
チング処理であるばかりでなく、正しい認識処理のため
には有害な場合が多い。
ンは2値の細線パターンであり、辞書パターンは周波数
方向に幅を持って重みが付けられたパターンであるため
、タイムスペクトルパターン上で話者変動に対してスペ
クトル変動の大きな部分では類似度は一般に低くなり、
一方、話者変動に対してスペクトル変動の少ないフレー
ムでは類似度は平均して高くなるという傾向にあり、従
って、不特定な話者を対象とした場合には、この荷重平
均辞書は有効である。しかし乍ら、入カバターンと荷重
平均辞書の類似度を計算する場合、時間軸方向に線形に
伸縮してマツチングをするのが普通であるが、一般に音
声の時間的発声変動は非線形であるので線形伸縮マツチ
ングをおこなった場合には入カバターンの有声音フレー
ムと辞書パターンの無声音フレームとの間で類似度計算
がおこなわれる場合が生じる。これは本来無意味なマツ
チング処理であるばかりでなく、正しい認識処理のため
には有害な場合が多い。
目 的
本発明は、」二記のごとき実情に鑑みてなされたもので
、特に、異種音間の望ましくないマツチングを避け、線
形伸縮においても比較的正しく類似度を得ることのでき
る音声認識方式を提供することを目的としてなされたも
のである。
、特に、異種音間の望ましくないマツチングを避け、線
形伸縮においても比較的正しく類似度を得ることのでき
る音声認識方式を提供することを目的としてなされたも
のである。
−植成
本発明の構成について、以下、実施例に基づいて説明す
る。
る。
先ず、辞書作成モードでは荷重辞書作成に供せられる複
数の話者それぞれについて、各フレーム毎にそのフレー
ムが有声音(V)か無声音(U V)かの識別をおこな
い、このV又はUVの情報としてVの場合は1.UVの
場合には0を各フレームに付加する。この様な状態でN
人の話者のタイムスペクトルパターンを加算するとN段
階のタイムスペクトルパターンを有する荷重平均辞書が
得られ、同時に、荷重平均辞書の各フレームに0〜Nま
での数値情報が付加される。この数値は有声/無声に関
する情報であり1例えば、0はN人の全員がこのフレー
ムは無声音であることを示し、一方、Nは全員がこのフ
レームは有声音であることを示している。一般的にN−
M(N≧M)なる数値はM人が無声音でN−M人が有声
音であることを示すことになる。一方、入カバターンに
ついても各フレーム毎に有声/無声情報を付加する。こ
の場合も、有声は1、無声の場合は0を用いる。
数の話者それぞれについて、各フレーム毎にそのフレー
ムが有声音(V)か無声音(U V)かの識別をおこな
い、このV又はUVの情報としてVの場合は1.UVの
場合には0を各フレームに付加する。この様な状態でN
人の話者のタイムスペクトルパターンを加算するとN段
階のタイムスペクトルパターンを有する荷重平均辞書が
得られ、同時に、荷重平均辞書の各フレームに0〜Nま
での数値情報が付加される。この数値は有声/無声に関
する情報であり1例えば、0はN人の全員がこのフレー
ムは無声音であることを示し、一方、Nは全員がこのフ
レームは有声音であることを示している。一般的にN−
M(N≧M)なる数値はM人が無声音でN−M人が有声
音であることを示すことになる。一方、入カバターンに
ついても各フレーム毎に有声/無声情報を付加する。こ
の場合も、有声は1、無声の場合は0を用いる。
この判定方法としては種々の方式が考えられる。
つまり、波形的処理としては周期構造を有するものがV
であり、ランダムな部分がUVに相当することを利用し
て分割判定をすることが出来る。
であり、ランダムな部分がUVに相当することを利用し
て分割判定をすることが出来る。
周波数領域における処理としては、スペクトル包絡の近
似直線の傾斜がV(有声音)の場合は負であり、UV
(無声音)の場合は0または正であるという性質を利用
して分類することもできる。
似直線の傾斜がV(有声音)の場合は負であり、UV
(無声音)の場合は0または正であるという性質を利用
して分類することもできる。
第3図は、N=5の場合の荷重平均辞書の一例を示す図
で、図中、1〜15列がスペクトル情報を、16列目が
有声/無声情報を表わしている。
で、図中、1〜15列がスペクトル情報を、16列目が
有声/無声情報を表わしている。
而して、本発明は、入カバターンおよび辞書パターン双
方の有声/無声情報を用いてマツチングの際の重み付け
を与えるようにしたもので、重み付けられた類似度Sを
次式のごとくして与えている。
方の有声/無声情報を用いてマツチングの際の重み付け
を与えるようにしたもので、重み付けられた類似度Sを
次式のごとくして与えている。
S=1・α(x、y) ・・・・・・(2)α(x+y
)の選定は無数であるが、原則としてX=0のときはy
も0に近い値の時に、α(x、y)に大きな値を持たせ
る様にし、一方、x=1の時はyもNに近い大きな値の
時に、α(x、y)に大きな値を与えるようにする。
)の選定は無数であるが、原則としてX=0のときはy
も0に近い値の時に、α(x、y)に大きな値を持たせ
る様にし、一方、x=1の時はyもNに近い大きな値の
時に、α(x、y)に大きな値を与えるようにする。
〔実施例1〕
線形パラメータとしてのα(x、y)としては次式の様
な値が一例として選べる。
な値が一例として選べる。
この場合、N=5とした時のx、y、α(Xy y)の
関係を表1に示す。
関係を表1に示す。
表1
〔実施例2〕
非線形パラメータとしてのα(x、y)の極端な例は、
x=0.y=o又はx=1.y=Nの時は、α(x+y
)=1とし、それ以外のXtVの組に対してはα(x
+ y )= Oとする。
x=0.y=o又はx=1.y=Nの時は、α(x+y
)=1とし、それ以外のXtVの組に対してはα(x
+ y )= Oとする。
(実施例3〕
非線形パラメータの他の極端な例として、X=0、y=
N又はx=1’、y=oのときのみα(x。
N又はx=1’、y=oのときのみα(x。
y)=0とし、それ以外のX+’iの組に対してはα(
x + y )= 1とする。
x + y )= 1とする。
羞−一玉
以上の説明から明らかなように、本発明によると、スペ
クトルパターンを基本とした2種類のタイムスペクトル
パターン同志による2次元マツチングを用いた単語音声
認識方式において、不特定な多数の話者に対応させるた
めに複数話者のタイムスペクトルパターンを時間的に線
形伸縮して加算することにより作成した荷重平均辞書を
標準パターンとして用いる場合に、入力の2値化タイム
スペクトルパターンと該荷重平均辞書との類似度を正確
に計算することができ、マツチング精度を向上させるこ
とができる。
クトルパターンを基本とした2種類のタイムスペクトル
パターン同志による2次元マツチングを用いた単語音声
認識方式において、不特定な多数の話者に対応させるた
めに複数話者のタイムスペクトルパターンを時間的に線
形伸縮して加算することにより作成した荷重平均辞書を
標準パターンとして用いる場合に、入力の2値化タイム
スペクトルパターンと該荷重平均辞書との類似度を正確
に計算することができ、マツチング精度を向上させるこ
とができる。
第1図は、細線化パターン、第2図は、ブロードパター
ンを示す図、第3図は、荷重平均辞書の一例を示す図で
ある。 第 1 図 第 2 図 第3図
ンを示す図、第3図は、荷重平均辞書の一例を示す図で
ある。 第 1 図 第 2 図 第3図
Claims (1)
- 周波数と時間を変数とする2次元平面上で表わせるタイ
ムスペクトルパターンを基本として辞書および入力のタ
イムスペクトルパターンを2値またはそれ以上のレベル
に分割した後、これら2種の2次元パターンの重なり具
合を用いて類似度を算出する単語音声認識方式において
、辞書作成において複数人の話者のタイムスペクトルパ
ターンを加算することにより得られる重み付けされたパ
ターンを辞書パターンとして用いる場合に、フレーム毎
の有声/無声情報を類似度計算に反映させることを特徴
とする音声認識方式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5547784A JPS60198598A (ja) | 1984-03-22 | 1984-03-22 | 音声認識方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5547784A JPS60198598A (ja) | 1984-03-22 | 1984-03-22 | 音声認識方式 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPS60198598A true JPS60198598A (ja) | 1985-10-08 |
Family
ID=12999689
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP5547784A Pending JPS60198598A (ja) | 1984-03-22 | 1984-03-22 | 音声認識方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS60198598A (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO1988001090A1 (fr) * | 1986-07-30 | 1988-02-11 | Ricoh Company, Ltd. | Reconnaissance de la parole |
| US5347612A (en) * | 1986-07-30 | 1994-09-13 | Ricoh Company, Ltd. | Voice recognition system and method involving registered voice patterns formed from superposition of a plurality of other voice patterns |
-
1984
- 1984-03-22 JP JP5547784A patent/JPS60198598A/ja active Pending
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO1988001090A1 (fr) * | 1986-07-30 | 1988-02-11 | Ricoh Company, Ltd. | Reconnaissance de la parole |
| GB2202667A (en) * | 1986-07-30 | 1988-09-28 | Ricoh Kk | Voice recognition |
| GB2202667B (en) * | 1986-07-30 | 1991-03-27 | Ricoh Kk | Voice recognition |
| US5347612A (en) * | 1986-07-30 | 1994-09-13 | Ricoh Company, Ltd. | Voice recognition system and method involving registered voice patterns formed from superposition of a plurality of other voice patterns |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Slaney et al. | A perceptual pitch detector | |
| Shi et al. | On the importance of phase in human speech recognition | |
| Brown et al. | Perceptual grouping of musical sounds: A computational model | |
| JPS6184694A (ja) | 認識用辞書学習方法 | |
| US6990446B1 (en) | Method and apparatus using spectral addition for speaker recognition | |
| Yang et al. | BaNa: A noise resilient fundamental frequency detection algorithm for speech and music | |
| KR102220964B1 (ko) | 오디오 인식을 위한 방법 및 디바이스 | |
| Wen et al. | Robust audio anti-spoofing with fusion-reconstruction learning on multi-order spectrograms | |
| Semary et al. | Using voice technologies to support disabled people | |
| Dressler | Automatic transcription of the melody from polyphonic music | |
| AU2018102038A4 (en) | A Speaker Identification Method Based on DTW Algorithm | |
| Omar et al. | Feature fusion techniques based training MLP for speaker identification system | |
| Bouziane et al. | Towards an objective comparison of feature extraction techniques for automatic speaker recognition systems | |
| JP2966002B2 (ja) | 音声認識装置 | |
| JPS6148898A (ja) | 音声の有声無声判定装置 | |
| JPH0643892A (ja) | 音声認識方法 | |
| JPH07210197A (ja) | 話者識別方法 | |
| JPS6147999A (ja) | 音声認識装置 | |
| JPS60216391A (ja) | 音声認識における辞書作成方式 | |
| JP2864511B2 (ja) | 話者識別方式と装置 | |
| JP2658426B2 (ja) | 音声認識方法 | |
| CN112863487A (zh) | 语音识别方法、装置以及电子设备 | |
| Dulas | Speech recognition based on the grid method and image similarity | |
| Vysotsky | A speaker-independent discrete utterance recognition system, combining deterministic and probabilistic strategies | |
| JPS635395A (ja) | 音声認識装置 |