JPH0155480B2 - - Google Patents

Info

Publication number
JPH0155480B2
JPH0155480B2 JP58147310A JP14731083A JPH0155480B2 JP H0155480 B2 JPH0155480 B2 JP H0155480B2 JP 58147310 A JP58147310 A JP 58147310A JP 14731083 A JP14731083 A JP 14731083A JP H0155480 B2 JPH0155480 B2 JP H0155480B2
Authority
JP
Japan
Prior art keywords
phoneme
discriminant
diagram
segmentation
power
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired
Application number
JP58147310A
Other languages
English (en)
Other versions
JPS6039697A (ja
Inventor
Kunio Akiba
Takao Irumano
Hisanori Kanezashi
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Computer Basic Technology Research Association Corp
Original Assignee
Computer Basic Technology Research Association Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Computer Basic Technology Research Association Corp filed Critical Computer Basic Technology Research Association Corp
Priority to JP58147310A priority Critical patent/JPS6039697A/ja
Publication of JPS6039697A publication Critical patent/JPS6039697A/ja
Publication of JPH0155480B2 publication Critical patent/JPH0155480B2/ja
Granted legal-status Critical Current

Links

Description

【発明の詳細な説明】 産業上の利用分野 本発明は入力音声の音素認識を行ない、その結
果を用いて音節、単語、文章等を認識する音声認
識方法に関するものである。
従来例の構成とその問題点 第1図は従来の方法を実施するための音声認識
装置を示している。以下この従来例の構成につい
て第1図とともに説明する。第1図において、音
声は単位時間(以後フレームと称す)毎に音素識
別を行う音素識別処理部1、高域帯域フイルタ
2、低域帯域フイルタ3へ入力される。音素識別
処理部1は10ms単位に母音第1候補、母音第2
候補、子音第1候補を出力する。一方高域帯域フ
イルタ2、低域帯域フイルタ3の出力はパワーデ
イツプ検出部4,5へ送られる。
パワーデイツプ検出部4,5では各々パワーの
時間的変化からパワーの凹部(以後パワーデイツ
プと表記する)を検出し出力する。
次いで、パワーデイツプ検出部4,5の出力を
判別図6とセグメント判定部7で比較し、パワー
デイツプの位置から子音区間を検出する。
上記の如く検出された子音区間と前述したフレ
ーム毎の音素識別処理部1の出力を用いて音素認
識部8で最終的な音素認識を行う。
この方法の原理は母音―子音―母音とつながる
単語が発声された場合、一般に、子音区間におい
ては母音区間に比してパワーが小さくなるために
生じるパワーデイツプに着目して子音区間を検出
しようとするものであるが、音声はそのパワーの
変動様態が多様なために、同一音素中に生じる小
さなパワーデイツプを誤つて検出してしまうため
に生ずる音素の付加(1つの音素を2つ以上の音
素と誤認識する)又はパワーデイツプの大きさが
小さいために子音音素の存在を見落してしまうた
めに生じる音素の脱落等の誤りが生じる場合があ
る。
これらの誤りを最小限に押えるためにパワーデ
イツプの大きさに関する閾値を設け、その閾値の
範囲内に属するパワーデイツプにより子音区間を
検出する方法がとられる。
本従来例では、その閾値に対応するものとして
2次元判別図を使用している。
第2図に2次元判別図の例を示す。
この判別図の作成は、種々の音素を含む多数の
音声データの分析から統計的に求めた各種子音の
平均的なパワーデイツプの大きさをもとにして行
なわれるのが一般的である。
しかしながら、上記した従来例では以下に述べ
る欠点がある。
即ち、判別図が各種音素で生じる平均的なパワ
ーデイツプの大きさで作成されているために、あ
る音素では前後の音素の条件によつて、その判別
図との整合性が悪くなり、検出誤りが生じやすく
なる場合が生ずる。
たとえば「サツポロ(/SAQPORO/)」と発
声した場合の/ORO/の部分の/R/では他の
音素に比してデイツプの大きさが小さいために/
R/の脱落が生じ/ORO/の部分が/O/又は
長母音/OO/と誤認識される場合が多い。
発明の目的 本発明は上記従来例の欠点を除去し、音素のセ
グメンテーシヨン精度を向上させ、音素誤認識を
減少させるものである。
発明の構成 本発明は上記目的を達成するために、セグメン
ト判定及び音素認識を2回以上くり返して行なう
ものであり、セグメント判定に使用するパワーデ
イツプ判別図をあらかじめ多数用意しておき、前
段の音素認識結果に応じて後段で使用する判別図
を選択するものである。これにより認識すべき音
素、コンテキスト(音素の並び型)に応じた最適
なセグメンテーシヨンを行ない音素誤認識を減少
させるものである。
実施例の説明 以下に本発明の一実施例の構成について、図面
とともに説明する。第3図は本発明の一実施例の
方法を実行する装置のブロツク図であり、フレー
ム毎の音素識別処理部1、高域帯域フイルタ2、
低域帯域フイルタ3、パワーデイツプ検出部4,
5は第1図の従来例と同じである。セグメント判
定部、音素認識部は各々2個設定されており、前
段が第1次セグメント判定部7、第1次音素認識
部8、後段が第2次セグメント判定部10、第2
次音素認識部11である。判別図6―1、判別
図6―2,…判別図6―nは認識すべき音素
又はコンテキストに応じて設定した高域のデイツ
プ、低域のデイツプの2次元の判別図である。判
別図選択論理は第1次音素認識結果に応じて判別
図を選択するための処理を行う。
次に上記実施例の動作について説明する。第3
図において第1次セグメント判定は第1図従来例
と全く同じであり、第1次判別図12は全音素に
ついて大量データから作成した最適判別図であ
る。従つて音素又はコンテキストによつては不適
用になる場合がある。
判別図6―2は同一母音にはさまれた/R/
のセグメンテーシヨン用の判別図とする。第4図
に判別図の例を示し、第6図に判別図6―2を
選択するための論理を示す。第5図に「サツポ
ロ」と発声した場合の/ORO/の部分の適用例
を示す。同一母音にはさまれた/R/は第5図の
「高域パワー」、「低域パワー」に示すようにパワ
ーの変化が少ない。従つて第4図に示す判別図も
第2図の例に比べて子音区間とみなすデイツプの
大きさの範囲を大きくとつておく。判別図6―
2を適用するための論理は第6図に示すように、
まず第1次音素認識結果が母音で、音素長が15フ
レーム以上の場合、上記母音区間内に子音第1候
補が/R/のフレームが存在する時は判別図6
―2を適用して第2次セグメント判定及び第2次
音素認識を行う。第5図の例では第1次セグメン
ト判定では子音区間と判定されないため音素認識
結果は/O/となつているが第2次セグメント判
定では判別図6―2を適用することによりフレ
ームNO55からフレームNO59までを子音区間と
判定している。従つてその区間における子音第1
候補から/R/を認識し、従来/O/又は/
OO/と区別できなかつた/ORO/が認識された
ことになる。
発明の効果 本発明によれば音素やコンテキストに応じた精
密な音素のセグメンテーシヨンができ、音声認識
誤まりの減少に有効である。
【図面の簡単な説明】
第1図は従来の音声認識方法を実施する装置の
ブロツク図、第2図は従来例における2次元のセ
グメンテーシヨン判別図、第3図は本発明の一実
施例における音声認識方法を実施する装置のブロ
ツク図、第4図は本発明における同一母音にはさ
まれた/R/のセグメンテーシヨンを行う判別図
の例、第5図は本発明の動作説明図、第6図は本
発明における判別図選択論理の動作例を示すフロ
ーチヤートである。

Claims (1)

    【特許請求の範囲】
  1. 1 入力音声を単位時間毎に音素識別を行うと共
    に、音声スペクトルの複数の帯域パワーを求め、
    その時間変化によつて生じるデイツプの大きさを
    各帯域毎の多次元判別図に適用して音素のセグメ
    ンテーシヨンを行ない、音素識別結果とセグメン
    テーシヨン結果を併用して音素認識を行う方法に
    おいて、セグメンテーシヨン及び音素認識を複数
    回行ない、前回の音素認識結果に応じて、次回の
    セグメンテーシヨンに適用する判別図又は判別条
    件を選択することを特徴とする音声認識方法。
JP58147310A 1983-08-13 1983-08-13 音声認識方法 Granted JPS6039697A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP58147310A JPS6039697A (ja) 1983-08-13 1983-08-13 音声認識方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP58147310A JPS6039697A (ja) 1983-08-13 1983-08-13 音声認識方法

Publications (2)

Publication Number Publication Date
JPS6039697A JPS6039697A (ja) 1985-03-01
JPH0155480B2 true JPH0155480B2 (ja) 1989-11-24

Family

ID=15427299

Family Applications (1)

Application Number Title Priority Date Filing Date
JP58147310A Granted JPS6039697A (ja) 1983-08-13 1983-08-13 音声認識方法

Country Status (1)

Country Link
JP (1) JPS6039697A (ja)

Also Published As

Publication number Publication date
JPS6039697A (ja) 1985-03-01

Similar Documents

Publication Publication Date Title
Lu et al. Content analysis for audio classification and segmentation
EP0128755B1 (en) Apparatus for speech recognition
US20100121638A1 (en) System and method for automatic speech to text conversion
JPS5972496A (ja) 単音識別装置
Hoang et al. Blind phone segmentation based on spectral change detection using Legendre polynomial approximation
Absa et al. A hybrid unsupervised segmentation algorithm for arabic speech using feature fusion and a genetic algorithm (July 2018)
JPH0155480B2 (ja)
Thirumuru et al. Improved vowel region detection from a continuous speech using post processing of vowel onset points and vowel end-points
JPH0155479B2 (ja)
Faycal et al. Comparative performance study of several features for voiced/non-voiced classification
Gulzar et al. An improved endpoint detection algorithm using bit wise approach for isolated, spoken paired and Hindi hybrid paired words
JP2664136B2 (ja) 音声認識装置
JPH0398098A (ja) 音声認識装置
Kim et al. Achieving real-time lip-synch via SVM-based phoneme classification and lip shape refinement
Vysotsky A speaker-independent discrete utterance recognition system, combining deterministic and probabilistic strategies
JPH10340096A (ja) 音声認識装置
JPS6136798A (ja) 音声セグメンテ−シヨン法
JPS6310840B2 (ja)
JPS6363919B2 (ja)
JPH026078B2 (ja)
JPH0114600B2 (ja)
JPH0534677B2 (ja)
JPH0120440B2 (ja)
JPS62166400A (ja) 音声ワ−ドプロセツサ装置
JPH05297888A (ja) 音韻セグメンテーション及び分類方法