JPS6352200A - 音声認識装置 - Google Patents

音声認識装置

Info

Publication number
JPS6352200A
JPS6352200A JP61195386A JP19538686A JPS6352200A JP S6352200 A JPS6352200 A JP S6352200A JP 61195386 A JP61195386 A JP 61195386A JP 19538686 A JP19538686 A JP 19538686A JP S6352200 A JPS6352200 A JP S6352200A
Authority
JP
Japan
Prior art keywords
section
vowel
vowels
input
voice
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP61195386A
Other languages
English (en)
Other versions
JP2594916B2 (ja
Inventor
畑岡 信夫
義典 北原
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Ltd
Original Assignee
Hitachi Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Ltd filed Critical Hitachi Ltd
Priority to JP61195386A priority Critical patent/JP2594916B2/ja
Publication of JPS6352200A publication Critical patent/JPS6352200A/ja
Application granted granted Critical
Publication of JP2594916B2 publication Critical patent/JP2594916B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 〔産業上の利用分野〕 本発明は音声認識装置に係り、特に音声の言語的環境に
よる音響的特gL変動(例えば、無声化母音、鼻音化母
音、長母音、!@音、促音等)・D個所を検出するのに
好適な音声のセグメンテーション方式に関する。
〔従来の技術〕
連続的に音節(主として子音と母音で構成されている)
を発声した音声(例えば単語2文節2文章等)は、孤立
に音節を発声した場合に比べて。
前後の音議(母音、子音。音素とも呼ばれる)々どの言
語的な環境により音磯・固有の音響的な特徴が様々に変
化している。例としては、無声破裂音(p、  t、 
 k)や無声摩擦音(S>を子音に持つ母音i、uの無
声化現象や鼻音(n、mなど)を子音に持つ母音の鼻音
化現象などがある。機械による自動音声認識では、これ
らの音響的な変動現象を検出、認識することは非常に難
しい技術となっている。
従来の無声化等・D変動対処技術としては、α子通信学
会論文誌り、J62−D、ノM1.  pp、24〜3
1 (1979−1’)  r単語音声自!dJ認識に
おける言語清報の一利用法」に記載のように音素認識の
結果得られる音素系列に無声化処理規則を適用して、無
声化母音を検出するもの、日本音響学会講演、−向文果
2−7−17(昭和57年10月)「音素認識を用いた
単語音声認識における無声化母音対策」に記載のように
無声化現象と起こしうるとみられる音1環境を持つ単語
をあらかじめ単語辞書上で分離表記し1人力音声の音素
系列と単語辞書との[) p (Dynamic pr
ograming 、動的計向法)マツチングで対処す
るもの1日本音響学会音声研究会資料s 85−60 
(1985−12)「連続音声認識システムにおける母
音標準パターンの自動作成」に記載のように無声化等の
音響的変動を持った標準音声パターンを用意するものな
どが矧られている。
〔発明が解決しようとする問題点〕
上記従来技術の無声化処理規則と適用する方法と無声化
現象を表記した単語辞書とのDPマツチングを用いる方
法は有効な方式ではあるが、いずれも音素認識の結果得
られる音素系列を用いるので、音素認識性能に大きく依
存するものとなっていること、さらに前者は無声化処理
規則が複雑なものとなること、後者の方法は単語辞−j
lFを必要とするので認識語濾に性能が依存し、かつ語
貞が限定されること、無声化標準パターンを用いる方法
は無声化標準パターン決定自体が容易でないことなどの
問題があった。
本発明の目的は上記従来の問題を解決して、処理が簡単
でかつ確実な方法で音声の音響的変動部を検出し、誤認
識である母音の脱落(本来入力されたのに認識結果では
現われてこない誤り)や付加(脱落とは逆であり1本来
入力されていiい個所に不要な音節等が認識結果として
出力される誤り)を軽減した音声認識装置を提供するこ
とにある。
〔問題点を解決するだめの手段〕
上記目的は、音声の足常部と無音部などの持続時間長や
これらの時系列上での規則から音響的な変動部(区間)
を検出することにより達成される。
〔作用〕
本発明で使われる音声の定常部や無音部は比較的単純な
処理で碍らn、また本発明はこれらの時系列上でつ単純
な規則?用いるので他の処理への誤動作などはない。
さらに本発明は無声化現象げかりでなく、鼻音化現夫、
長母音現象(例えば音声10nsei/の/el/が/
ee/となること)、そして認識の難しい撥音(/ん/
、音声10g5ei/や促音(/)/。
学校/ gakkou / )の区間等を検出する方式
としても有効である。
〔実施例〕
以ド1本発明の一実施例を第1図により説明する。第1
図は本発明と用いた音声認識装置の一実施例?示すブロ
ック図である。アナログ入力音声1はLPF I低域通
過フィルタ)、ADC(アナログ−ディジタル変換器)
2で、サンプリングでの折り返し雑音?除去さnなから
ディジタル値へ変換される。次に、音声分析部3で音声
の特徴パラメータが所定時間(フレーム)ごとに計算さ
れ、入力音声の特徴パターンが抽出される。音声の特徴
パラメータとしては、BPF’ (帯域通過フィルタ)
出力値やLPG分析(線形予測分析)結果Oパラメータ
などが用いられる。距離計算部4では人力音声の特徴パ
ターンと標準パターンメモリ9から読み込まれた標準音
声の特徴パターンのファーム1司距離が算出され乙。セ
グメンテーション部5では、人力音声の定常部区間、遷
移部区間、そして無音部区間が検出される。さらに定常
部区間は母音性とそれ以外とに分離される。セグメンテ
ーション決定部6は本発明の主点であり、上記セグメン
テーション部5の結果から、音声の音響的な変!JJ個
所(例えば、無声化、鼻音化、長音化等の区間)や撥音
、促音区間等の検出も含めて、最終的な母音区間などの
セグメンテーションが決定される。次に、照合部7では
入力音声と標準音声(例えば音節)との照合がなさnる
。この際、セグメンテーション部で得られた結果をもと
て時間構造も含めた全体での照合値(痣距離)が算出さ
れる。判定部8では標準パターンごとのa距離値の大小
関係から、入力音声がどの標準音声に最も似ているかの
判定がなされ、認識結果を出力する。
以上の処理は制御部10で制御されながら実行される。
次に上記各部の詳細な実施例を説明する前に本発明の原
理を詳細に説明する。
日本放送協会編「日本語発音アクセント辞典」によれば
、母音の無声化現象は方言やアクセントなどによって少
し特徴を異にしてはいるが、一般に次の4つの無声化法
則に従っていると報告されている。
(例)菊/kiku/、学者/ gakusya / 
(o印が無声化個所) 但し、す行、ハ行等の摩擦音の直前では無声化しにくい
ことや無声化する狛が2つ続くときは、無声化の度合い
の弱い一方の拍の母音を無声化させiい等の例外がある
。
〔法則■〕息の段落の直前(語尾等)K@た上記但し、
アクセントの関係で強く発音される場合などが例外とな
っている。
上記無声化法則と同様に、母音の鼻音化、長音化等も一
般に法則に従っている。これらの現壕は発声器管の性質
に起因するものが多いが、言葉(!fjに日本語。仏語
母音の鼻音化もある)の聞き易さの面から起こった現象
とみられている。
しかし、機械による自動音声認識という立場から上記の
無声化、鼻音化等ととらえた場合、これらの音響的特徴
が本来の母音の特徴から大福に変動することから、こn
らの変動個所(区間)を検出、認知することは非常に難
しい技術となっている。その結果、致命的な誤認識であ
る音節等の脱落が大きな問題となっている。
第2図は音声(aikurushii /の定常部(母
音性とそれ以外とに概略的に分離)と無音部区間の検出
結果の一例を示す図である。本発明はこれら定常部と無
音部の時系列上に上記無声化等の法則を考黒した簡単な
検出規則と役けることで、音響的な特徴変動個所(区間
)を検出することに特徴がある。
検出規則の例は次のようになっている。
矢音舎的な特徴変動検出規則0例 〔規則I〕無音部直前のだ常部区間で母音性からはずれ
たものは無声化母音区間。(A付けは上記無声化法則1
.部ち、/無声化母音/+/無音部/+/p、  t、
  k行/) 部 〔規則■〕語尾の定態区間で母音性以外と判定されたも
のは無声化、鼻音化母音。(上記無声化法則■) 〔規則■〕定常都区間で2つ連続して母音性以外と判定
された場合、どちらかが無声化、鼻音化母音。(上記無
声化法則Iの例外と子音定常部の関係) 〔規則■〕ひとつの定常部区間の持続時:′B′J長が
ある閾値よりも長い場合、長母音とする。
以下、第1図で示した各処理部について詳細L′c説明
する。
第3図は音声分析部3の一実施例を詳細に示したもので
ある。実施例ではBPF分析をあげている。ディジタル
値に変換された登録音IX、は中心局仮数と帯域幅の違
うに個のBPF群31゜32に人力される。本実施例で
:は周波数分解能?あげるために2段のBPF#il成
としている。
BPF31.32は2次のバターワース型フィルタとな
っており、ガロ算器21固2乗算器41固、遅延器2個
から構成されている。BPF出力の波形は絶対値(AB
S)33にてg流され、LPF’34゜サンプリング器
35さらにLPF36にて高域周波数成分をカットされ
ながら登録音声パタンXI(i;フレーム)が求められ
て、LPF’i″1BPF’同様に周波数分w4能をめ
げるために2段構成となっており、LPF34,36は
BPF31,32同様の処理規模のバターワース型とな
っている。
尚、LPFの2段構成については、特願昭55−135
981号「ディジタル低域通過濾波回路」に詳細に説明
されている。本発明では音声分析部3の構成をBPF分
析としたが、LPC分析とすることも可能である。この
場合の詳細な実施例は文献「音声波形の、線形予測分析
VCよる音声分析と合成(3peech Analys
is and 5ynthesis byI、1nea
r  prediction  of  the  5
peech  Vll/ave)Jby B、 3.A
tal et al、 Journal of Aco
usticSociety of America、 
Vol、 50. p、 p、 637〜655 .1
971に詳細に説明されている。
第4図はフレーム間di雌計X部D−実施例を詳細に示
すものである。本実施例では絶対値距aを用いた場合と
示す。2つの音声の特徴バタンXiとyJとの絶対1直
距離d目は dIl=lXt  y+I= Σl Xh+  yi+
+lとして求まる。ここでi、Jはフレーム、にはBP
Fのチャネル数である。従って、実施例では、2つの特
徴バタンXl、  y」とが各々フレームノζタンレジ
スタ41.42を介しながら人力され。
減算器43でXkI−ykJの計算、絶対値変換器44
でl XkI−Ybj lの計算がされ、加算器45で
に=1からKまでの累積が計算されることになる。結果
dl、は距離レジスタ46に格納される。本発明の実施
例では絶対1直距離としたが、LPG分析で得られる特
徴バタンの相関尺度なども考えられる。この場合の具体
的実施例は文献[音声認識に適用した最小予測誤差原理
(MinimumPrediction Re5idu
al principle Appliedto 3p
eech l(ecognition ) J by 
F、■takuraet al、 IBEETrans
 on Acoustics、 5peechand 
Signal Processing、 vol、AS
SP−23゜p、 p、 57〜72. Feb、’ 
75  に詳細に説明されている。
第5図はセグメンテーション部5の一実施例を詳細に示
したものである。本発明では、定常部。
無音部区間の検出方法として特願昭60−189653
号「音声認識装置」に詳細に記載されている方式を用い
る。即ち、入力音声自身のフレーム間距離の累積値が小
さい範囲(区間)を定常部区間とする。さらに、特定の
母音(例えば離散発声された5母音)と入力音声とのフ
レーム間距離の累積値が小さい区間を母音性と判定する
。具体的な実施例は、距離レジスタ46から読み込まれ
た距離行列d1がNグレードバタン抽出部51罠入力さ
れる。ここでは、比較器511で距離閾値θとの大小関
係が比較され、NグレードバタンnIIがNグレードバ
タンレジスタ512に一旦格納される。次に、定常部区
間検出部52ではNグレードバタン(J淡バタ/)の値
が加算器521で累積され、比II2器522にてその
値と変化の度合が判定定数α、βと比較されて、入カフ
V−ム1を固定した場合の定常部区間候補が求められ。
レジスタ523に格納される。比較器524では最終の
定常部区間が区間長の長いIAに決定され、定常部区間
検出結果が定常部区間レジスタに格納される。一方、入
力音声と5母音とのブンーム間距離行列のNグレードバ
タンか同様に抽出され。
母音区間噴出部53では、グロ算器531.比収器53
2において母音区間が抽出され&結果が母音区間レジス
タ533に格納される3次に、定、q部区間検出部52
と母音区間検出部53で得られた定常部区間情報LLと
母音区1間候補情報LvIとが区間統合処理部54に入
力され、比較器541でL+とLvIとの共通部分とし
て最終の母音区間が抽出され、結果が人力フレームバタ
ンコードレジスタ542に格納される。入力フレームバ
タンコードレジスタL、は定常部情報(母音性とそれ以
外に分離されている)と無音部情報とを持っている。無
音部の庚出は入力音声の短時間エネルギー(パワー)の
値がある設定されたパワー閾値よりも小さい個所として
求められる。乗算器、加耳器と比較器により構成される
。
第6図は本発明の主点であるセグメ/チージョン決定部
の一実施例を詳細に説明したものである。
原理は既に述べた二うに、定濱部と無音部の時系列上で
無声化等の検出規則を用いる。入力フレームパターンコ
ードレジスタ542から読み込まれた入力フレームパタ
ーンコードL、を入力として。
区間及び区間長検出部61では、検出規則メモリ60か
ら与えられた母音コードiv(例えば/a/。
/i/、/u/、/e/、10/に対応)、定常部で母
音性以外と判定された区間/?/コード。
無音部/弄/コードとの比較により、比較器611で入
力の各区間の探索が行なわれる。その結果。
各区間の時系列情報が時系列レジスタ612に。
持続時間長が持続時間レジスタ613に格納される。検
出規則判定部62で検出規則メモリ60から与えらnた
規則を満たしているかの判定が時系列比較器621.持
続時間比較器622の結果をもとに判定器623で実行
される。時系列比較器では既に述べた音響的な特徴変動
検出規則Iから■までの比較が、持続時間比較器では持
続時間長の閾値θM(語中ン、θL(語尾)を用いて同
規則■の比較が行なわれる。判定器は各規則で設定され
ている条件を満たしているかの判定が実行される。この
結果、無声化等の可能ユのある母音区間をも含めた最終
の母音始点rsJ点1ek(kは入力始点からに番目の
母音)と母音コードivkの谷嘴報が母音情報レジスタ
63に格納される。これらの情報は照合部8と判定部9
で母音探索区間の設定に用いられる。
第7図は照合部7の一実施例を詳細に示したものである
。原理は特開昭55−2205号「連続DP法」を改良
したものである。人力音声のiフレームト標準ハターン
のjフレームとのフレーム間距離dIjをもとに、累積
距離D + 1が次の順化式を更って算出される。
以上の順化式から、入力音声の谷フレーム1ごとに、標
準パターンmに対する最適照合値D″″lJ。
が求められる(J、は標準パター7mのフレーム1゜ 照会部7の具体的々実施例は、入力音声と標準パターン
との)V−ム間距離dIIがフレーム距離レジスタ71
を介して入力され、遅延メモリ72と中間累積距離格納
メモリ77を用いて、(1)式のdl−11+−1やD
 l−111−11D I−1+ 1−11 D I−
2+ 1−1  が記憶される。各々の距離値ともとに
加算器73ではパス■のD l−1+ I−2+ dl
−1+ l−亀、加算器74ではパス■のD I−2+
 1−1 + dl−1s 1−1が算出され、パス■
のD +−1t 1−1とともに比較器75で最小値が
探索される。さらに加算器76で2d、、が最小値に加
算され、中間累積距離DIjが新たに求められる。この
結果は中間累積距離格納メモリ77に格納され、D I
+1+ j+1の算出の情報となる。照合部では入力音
声のiフレームごとに標準パターンmとの最適照合値D
iJ、を出力しくiフレームは母音区間情報i s k
% i e yの範囲内)5判定部9の入力となる。
判定部では照合値D7J、の大小関係から、入力音声が
どの標準音声に最も似ているかの判定がなされる。判定
部は単純な大小比較器で構成される。
〔発明の効果〕
本発明によれば、入力音声の音響的特徴の変動個所(例
えば無声化母音、鼻音化母音等、)が容易に検出できる
ので、致命的な誤認識である音節等の脱落?@滅する効
果がある。さらに脱落とトンードオフの関係にらる不要
な音節等の湧き出しく付加)も結果として軽減できる効
果がある。
【図面の簡単な説明】
第1図は本発明の一実施例を示す音声認識装置のブロッ
ク図、42図は本発明の原理を示す図。 第3図から第7図は本発明の一実施例である音声認識装
置の各処理部の一災南例?示すブロック図である。 6・・・セグメンテーション決定部、60・・・検出規
則メモリ、61・・・区間及び区間長検出部、62・・
・検出規則判定部。

Claims (1)

    【特許請求の範囲】
  1. 1、音声を入力する手段と、所定時間ごとに入力音声の
    特徴パターンを抽出する特徴パターン抽出手段と、入力
    音声を少なくとも定常部と無音部の区間に分割するセグ
    メンテーシヨン手段と、該セグメンテーシヨンの結果に
    基づき上記入力音声の特徴パターンと予め格納されてい
    る標準音声の特徴パターンとを照合する手段と、該照合
    結果の判定を行う手段とを有し、上記セグメンテーシヨ
    ン手段は得られた定常部と無音部の時間的な位置関係お
    よび/または持続時間長から、音声の言語的環境による
    音響的変動(例えば、無声化母音、鼻音化母音、長母音
    等)区間を検出する手段を備えていることを特徴とする
    音声認識装置。
JP61195386A 1986-08-22 1986-08-22 音声認識装置 Expired - Lifetime JP2594916B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP61195386A JP2594916B2 (ja) 1986-08-22 1986-08-22 音声認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP61195386A JP2594916B2 (ja) 1986-08-22 1986-08-22 音声認識装置

Publications (2)

Publication Number Publication Date
JPS6352200A true JPS6352200A (ja) 1988-03-05
JP2594916B2 JP2594916B2 (ja) 1997-03-26

Family

ID=16340296

Family Applications (1)

Application Number Title Priority Date Filing Date
JP61195386A Expired - Lifetime JP2594916B2 (ja) 1986-08-22 1986-08-22 音声認識装置

Country Status (1)

Country Link
JP (1) JP2594916B2 (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7647224B2 (en) 2004-11-24 2010-01-12 Kabushiki Kaisha Toshiba Apparatus, method, and computer program product for speech recognition

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6073598A (ja) * 1983-09-30 1985-04-25 株式会社日立製作所 音声認識方式

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6073598A (ja) * 1983-09-30 1985-04-25 株式会社日立製作所 音声認識方式

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7647224B2 (en) 2004-11-24 2010-01-12 Kabushiki Kaisha Toshiba Apparatus, method, and computer program product for speech recognition

Also Published As

Publication number Publication date
JP2594916B2 (ja) 1997-03-26

Similar Documents

Publication Publication Date Title
US7013276B2 (en) Method of assessing degree of acoustic confusability, and system therefor
US5333275A (en) System and method for time aligning speech
US7676365B2 (en) Method and apparatus for constructing and using syllable-like unit language models
JP3762327B2 (ja) 音声認識方法および音声認識装置および音声認識プログラム
Arora et al. Automatic speech recognition: a review
US5220639A (en) Mandarin speech input method for Chinese computers and a mandarin speech recognition machine
US5218668A (en) Keyword recognition system and method using template concantenation model
EP2048655B1 (en) Context sensitive multi-stage speech recognition
US7181395B1 (en) Methods and apparatus for automatic generation of multiple pronunciations from acoustic data
JPS6336676B2 (ja)
Lee et al. Using tone information in Cantonese continuous speech recognition
US20020116192A1 (en) Speech recognizer
Ravinder Comparison of hmm and dtw for isolated word recognition system of punjabi language
Jaradat et al. A novel human-vehicle interaction assistive device for Arab drivers using speech recognition
KR101122591B1 (ko) 핵심어 인식에 의한 음성 인식 장치 및 방법
Hirose et al. Detection of prosodic word boundaries by statistical modeling of mora transitions of fundamental frequency contours and its use for continuous speech recognition
JPS6138479B2 (ja)
JPH0558553B2 (ja)
Abdo et al. MFC peak based segmentation for continuous Arabic audio signal
JPH0950288A (ja) 音声認識装置及び音声認識方法
JP2594916B2 (ja) 音声認識装置
JP3110025B2 (ja) 発声変形検出装置
CN120431913B (zh) 一种人员密集环境下语音的语义解析方法
KR100608644B1 (ko) 가변 길이의 연결숫자음 인식방법
Huang et al. Spellmode recognition based on vector quantization