JPS6275700A - 音声認識方式 - Google Patents

音声認識方式

Info

Publication number
JPS6275700A
JPS6275700A JP60218630A JP21863085A JPS6275700A JP S6275700 A JPS6275700 A JP S6275700A JP 60218630 A JP60218630 A JP 60218630A JP 21863085 A JP21863085 A JP 21863085A JP S6275700 A JPS6275700 A JP S6275700A
Authority
JP
Japan
Prior art keywords
phoneme
syllable
section
syllables
stack
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP60218630A
Other languages
English (en)
Other versions
JPH0567036B2 (ja
Inventor
徹 上田
充宏 斗谷
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sharp Corp
Original Assignee
Sharp Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sharp Corp filed Critical Sharp Corp
Priority to JP60218630A priority Critical patent/JPS6275700A/ja
Publication of JPS6275700A publication Critical patent/JPS6275700A/ja
Publication of JPH0567036B2 publication Critical patent/JPH0567036B2/ja
Granted legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 く技術分野〉 本発明は入力音声を音節単位に認識する音声認識方式の
改良に関し、特にパターンマツチングにより得られた音
素系列から音節中に含まれない遷移状態を判定して音節
境界を決定することにより、より正確な音節区間の抽出
を行うようにしたものである0 〈従来技術〉 従来の音声波形から音節区間を抽出する方法としては、
パワー変化やスペクトル変化などの境界を示す情報と、
平均的な母音長などの時間的な情報を用いていることが
多い(特願昭59−44265号)。
しかしながら、このような平均的な母音長を用いると、
次のような場合に不都合が生じる。
例えば、1音節゛にや”と2音節パあい″ケ長さの情報
だけでは区別出来ない。なぜならば、1音節°°にゃ″
と2音節”あい”は発声速度のばらつきによって同じ長
さになることもある。これを従来の平均母音長から判定
すると、″にゃ”が2音節と判定されるか、゛あい”が
1音節と判定されるかのどちらかであり、いずれにして
も切り出す音節数を誤るという結果になる。
く目 的〉 本発明はかかる従来の欠点を補うために成されたもので
あり、一定区間(フレームとよぶ8ms程度ごとの区間
)毎にあらかじめ登録されている音素標準パターンとの
マツチングを行い、その結果出力された音素系列を判定
することで音節の境界を求め、最終的な音節区間の抽出
を行うようにした音声認識方式を提供せんとするもので
ある。
(なお、ここで音素とは、フレームごとの音響的性質を
表す記号のことで、あらかじめ登録されている特徴量と
マツチングを行うことによって出力されるものである。
これは、日本語の音節中には有り得ない音素の遷移の情
報を考慮するためである。) 〈実施例〉 以下に説明する実施例では、マツチング対象の音素を”
aiueons”の7個に限った例について述べる。(
ただし、”aiueo”は5母音の音素、′” n は
「な」「ま」 などの鼻音性音節の子音部分の音素、 
” s ” は「さ」「す」 などの摩擦性音節の子音
部分の音素を示す) また日本語の音節内での音素の遷移の条件には次のよう
なものがある。
■ 音素1− aTlは音節内では終端にしか生じない
。
■ 音素II s′l;I nIJは、音節内では始端
にしか生じない。
よって、 a−>*(*は、先行音素以外の音素すべて)*−>s
(*ば、後続音素以外の音素すべて)*−>n(*は、
後続音素以外の音素すべて)の変化が生じる地点は音節
境界である。
これは、2音素の場合にも拡張できる。
例えば、拗音では、一般に ie口 (口は、auoの内の1つの音素)と遷移する
。しかしe段の拗音は存在しないために、 e という組み合わせだけで音節を構成することはない。よ
って、1ielの連鎖が発生し、音素″i′の区間だけ
で1音節として切り出せないほどの短さであれば、その
次の音素も含めて’ie口′ という区間を抽出するこ
とで正確な区間が得られる。
以下図にもとづいて本発明方式を説明する。
第1図は本発明方式を実施した音声認識装置の全体の構
成を示すブロック図である。
図において、1は音声を入力するためのマイク、2はマ
イクIを介して入力された音声信号を増幅するアンプ、
3は上記アンプ2によって増幅された音声信号によりマ
ツチングに用いる特徴量及び切出しに用いるパワー、自
己相関係数等の特徴量を抽出する特徴抽出部から成る分
析部であり、特tて特徴抽出部は例えば24帯域フイル
タバンクより構成された周波数分析部と、該周波数分析
部の出力を一定時間保持するサンプルホールド部ト、該
サンプルホールド部の出力をデジタル信号に変換するA
/D変換部及び入力音声のパワー、ゼロクロス、自己相
関係数等の特徴量(パラメータ)を抽出するパラメータ
抽出部とから構成されている0 4は本発明に係るアルゴリズムを実現するための音声区
間抽出部、5はフレームごとにその区間の特徴量を標準
パターンとマツチングして音素記号を出力する音素マツ
チング部、6は音素の標準パターンを蓄えておくパター
ンメモリ、7は切り出された区間のパターンを音節標準
パターンとマツチングする音節マツチング部、8は音節
標準パターンを蓄えておくパターンメモリである。
第2図は上記した音声認識装置の全体の動作を示す動作
フロー図である。
今、認識すべき音声がマイク!を介して入力されると、
この入力された音声データはアンプ2で増幅されたのち
、分析部3に入力される。ここでは、まず同一音素区間
の抽出が行われる(nl)。
たとえば同一の音素が5フレーム続くとその音素を代表
音素とし、代表音素以外の音素が3フレーム続くとそこ
までを1つの音素区間としている。
その区間の代表音素は第3図(イ)に示すようなスタッ
ク構造のバッファに記憶される。この例の状態では、音
素−1nIJ、n oI+の区間がすでに入力されてい
て、まだこの区間が切り出されていないことを示してい
る。
ステップn1で同一音素区間が抽出されると、次に抽出
された音素区間の始端(ここでは、音素II i I+
の始端=フレーム番号21)が音節境界と成り得るかの
検定を行う(n2)。第3図(ロ)は同図(イ)の状態
から代表音素1− i Hの区間が抽出されスタックO
で加わったことを示している゛。スタック内の音素は始
端表と比較され、後方部分一致で検索が行われる。第4
図(イ)は上記始端表の例であり、この例ではスタック
内の音素=loil″が後方部分一致で検索される。こ
れは、音素列旧”が日本語の音節の中には存在せず、必
ず0″と °゛1″に分離されることを示している。検
索の結果、始端表に該当項目が存在すると(n3)、ス
テップn4に進み、先のスタック内の音素のうち、現区
間(音素1− i II の区間)の始端までの区間を
!音節として切り出し、その切り出した区間は音素スタ
ックから抹消する。このときの音素スタックの状態は第
3図を→に示す通シである。
一方、始端表に該当項目が存在しない場合は、終端表を
検索し同様に後方部分一致をとる(n5)。
第3図に)はここでのスタック状態を示し、これは第3
図(ハ)の状態から音素″e”と音素“0″ の区間が
入力された状態を表わしている。また、第4図(ロ)は
終端表の例であp、この例ではスタック内の音素” i
 e o ”が後方部分一致で検索される。これは、音
素列1−ieoI+が発生したときには必ずその後で音
節境界を生じることを示している。上記終端表に該当項
目が存在するとステップn6.n7と進み、スタック内
の全音素区間をまとめて1音節として切り出す。そして
先のスタックを空にし第3図(ホ)の状態にする。スタ
ックが空になることで、残っている切り出し区間がない
ことを示している。
第5図は、°゛あいパと発声したときの具体的な例であ
り、図中(イ)は音素のマツチング結果(音素系列)、
(ロ)Vi本発明方式による音節抽出区間、(ハ)は従
来方式による音節抽出区間を示している。この音声は全
体で25フレームあυ、平均母音長が18フレームであ
る。ここで、 全フレーム長〉平均母音長×1.5 の時に2音節と判定するといった従来の判定方法を用い
ると、この区間は図示の如く1音節と判定される。これ
に対し、本発明方式によれば、この区間には音素゛a″
が含まれておυ、しかも音素to aI+の後は必ず音
節境界であることから、ここで音節を2分割して正しく
2音節切シ出すことが出来る。
このように、音節内の音素の遷移の情報を使うことばよ
って、音節のセグメンテーションを正確に行うことがで
きる。
なお、本発明方式に、先のパワー変化やスペクトル変化
などの境界を示す情報さ、平均的な母音長などの時間的
な情報を用いて音節区間を抽出する方式を併用すること
だより、総ての音節をより正確に切シ出すことができる
。
く効 果〉 以上詳細に説明したように、本発明に係る音声認識方式
は、入力音声について予め登録された音素標準パターン
とのマツチングを行い、その結果得られた音素記号列中
に含まれる特定の遷移状態を判定して音節の境界を求め
、最終的な音節区間の抽出を行うようにしたから、従来
方式に比較してよ−り正確に音節のセグメンテーション
を行うことが出来る。
【図面の簡単な説明】
第1図は本発明方式を実施した音声認識装置の全体の構
成を示すブロック図、第2図は本発明を実施した装置の
動作を説明するための動作フロー図、第3図(イ)乃至
(ホ)は音素スタックの状態を示す図、第4図(イ)、
(ロ)は音素の始端・終端表を示す図、第5図(イ)、
(ロ)、(ハ)は具体的発声例に対する本発明と従来の
両方式による音節抽出区間の相違を示す図である。 1はマイク、2はアンプ、3は分析部、4は音声区間抽
出部、5は音素マツチング部、6は音素標準パターンメ
モリ、7は音節マ)チング部、8は音節標準パターンマ
ツチング部。

Claims (1)

  1. 【特許請求の範囲】 1、入力音声を音節単位で認識する音声認識方式におい
    て、 入力音声について予め登録された音素標準パターンとの
    マッチングを行い、その結果得られた音素記号系列中に
    含まれる特定の遷移状態を判定して音節の境界を求め、
    最終的な音節区間の抽出を行うようにしたことを特徴と
    する音声認識方式。
JP60218630A 1985-09-30 1985-09-30 音声認識方式 Granted JPS6275700A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP60218630A JPS6275700A (ja) 1985-09-30 1985-09-30 音声認識方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP60218630A JPS6275700A (ja) 1985-09-30 1985-09-30 音声認識方式

Publications (2)

Publication Number Publication Date
JPS6275700A true JPS6275700A (ja) 1987-04-07
JPH0567036B2 JPH0567036B2 (ja) 1993-09-24

Family

ID=16722960

Family Applications (1)

Application Number Title Priority Date Filing Date
JP60218630A Granted JPS6275700A (ja) 1985-09-30 1985-09-30 音声認識方式

Country Status (1)

Country Link
JP (1) JPS6275700A (ja)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6148896A (ja) * 1984-08-16 1986-03-10 松下電器産業株式会社 音声のセグメンテ−シヨン方法

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6148896A (ja) * 1984-08-16 1986-03-10 松下電器産業株式会社 音声のセグメンテ−シヨン方法

Also Published As

Publication number Publication date
JPH0567036B2 (ja) 1993-09-24

Similar Documents

Publication Publication Date Title
JPS58130393A (ja) 音声認識装置
JPS6147440B2 (ja)
JPS5972496A (ja) 単音識別装置
KR19980070329A (ko) 사용자 정의 문구의 화자 독립 인식을 위한 방법 및 시스템
US6546369B1 (en) Text-based speech synthesis method containing synthetic speech comparisons and updates
JPS6138479B2 (ja)
JPS5972500A (ja) 音声認識方式
JP2000099099A (ja) データ再生装置
JPH0567036B2 (ja)
JPH02124600A (ja) 音声認識装置
JP2760096B2 (ja) 音声認識方式
JPS6225796A (ja) 音声認識装置
CN85100180B (zh) 一种利用计算机对汉语语音进行识别的装置
JPS63217399A (ja) 音声区間検出装置
JPS63269200A (ja) 音声認識装置
JPS607492A (ja) 単音節音声認識方式
CN116312461A (zh) 耳语语音合成方法、装置、设备及存储介质
JPS63223696A (ja) 音声パタ−ン作成方式
JPH01158499A (ja) 定常雑音除去方式
JPH0558556B2 (ja)
JPS58176699A (ja) 音声標準パタ−ン登録方式
JPH02205898A (ja) 音声認識装置
JPS6346499A (ja) 大語▲い▼単語音声認識方式
JPS59180598A (ja) 音声入力方式
JPS6068398A (ja) 連続音声認識における表現形態の識別方法