JPS6275700A - 音声認識方式 - Google Patents
音声認識方式Info
- Publication number
- JPS6275700A JPS6275700A JP60218630A JP21863085A JPS6275700A JP S6275700 A JPS6275700 A JP S6275700A JP 60218630 A JP60218630 A JP 60218630A JP 21863085 A JP21863085 A JP 21863085A JP S6275700 A JPS6275700 A JP S6275700A
- Authority
- JP
- Japan
- Prior art keywords
- phoneme
- syllable
- section
- syllables
- stack
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
く技術分野〉
本発明は入力音声を音節単位に認識する音声認識方式の
改良に関し、特にパターンマツチングにより得られた音
素系列から音節中に含まれない遷移状態を判定して音節
境界を決定することにより、より正確な音節区間の抽出
を行うようにしたものである0 〈従来技術〉 従来の音声波形から音節区間を抽出する方法としては、
パワー変化やスペクトル変化などの境界を示す情報と、
平均的な母音長などの時間的な情報を用いていることが
多い(特願昭59−44265号)。
改良に関し、特にパターンマツチングにより得られた音
素系列から音節中に含まれない遷移状態を判定して音節
境界を決定することにより、より正確な音節区間の抽出
を行うようにしたものである0 〈従来技術〉 従来の音声波形から音節区間を抽出する方法としては、
パワー変化やスペクトル変化などの境界を示す情報と、
平均的な母音長などの時間的な情報を用いていることが
多い(特願昭59−44265号)。
しかしながら、このような平均的な母音長を用いると、
次のような場合に不都合が生じる。
次のような場合に不都合が生じる。
例えば、1音節゛にや”と2音節パあい″ケ長さの情報
だけでは区別出来ない。なぜならば、1音節°°にゃ″
と2音節”あい”は発声速度のばらつきによって同じ長
さになることもある。これを従来の平均母音長から判定
すると、″にゃ”が2音節と判定されるか、゛あい”が
1音節と判定されるかのどちらかであり、いずれにして
も切り出す音節数を誤るという結果になる。
だけでは区別出来ない。なぜならば、1音節°°にゃ″
と2音節”あい”は発声速度のばらつきによって同じ長
さになることもある。これを従来の平均母音長から判定
すると、″にゃ”が2音節と判定されるか、゛あい”が
1音節と判定されるかのどちらかであり、いずれにして
も切り出す音節数を誤るという結果になる。
く目 的〉
本発明はかかる従来の欠点を補うために成されたもので
あり、一定区間(フレームとよぶ8ms程度ごとの区間
)毎にあらかじめ登録されている音素標準パターンとの
マツチングを行い、その結果出力された音素系列を判定
することで音節の境界を求め、最終的な音節区間の抽出
を行うようにした音声認識方式を提供せんとするもので
ある。
あり、一定区間(フレームとよぶ8ms程度ごとの区間
)毎にあらかじめ登録されている音素標準パターンとの
マツチングを行い、その結果出力された音素系列を判定
することで音節の境界を求め、最終的な音節区間の抽出
を行うようにした音声認識方式を提供せんとするもので
ある。
(なお、ここで音素とは、フレームごとの音響的性質を
表す記号のことで、あらかじめ登録されている特徴量と
マツチングを行うことによって出力されるものである。
表す記号のことで、あらかじめ登録されている特徴量と
マツチングを行うことによって出力されるものである。
これは、日本語の音節中には有り得ない音素の遷移の情
報を考慮するためである。) 〈実施例〉 以下に説明する実施例では、マツチング対象の音素を”
aiueons”の7個に限った例について述べる。(
ただし、”aiueo”は5母音の音素、′” n は
「な」「ま」 などの鼻音性音節の子音部分の音素、
” s ” は「さ」「す」 などの摩擦性音節の子音
部分の音素を示す) また日本語の音節内での音素の遷移の条件には次のよう
なものがある。
報を考慮するためである。) 〈実施例〉 以下に説明する実施例では、マツチング対象の音素を”
aiueons”の7個に限った例について述べる。(
ただし、”aiueo”は5母音の音素、′” n は
「な」「ま」 などの鼻音性音節の子音部分の音素、
” s ” は「さ」「す」 などの摩擦性音節の子音
部分の音素を示す) また日本語の音節内での音素の遷移の条件には次のよう
なものがある。
■ 音素1− aTlは音節内では終端にしか生じない
。
。
■ 音素II s′l;I nIJは、音節内では始端
にしか生じない。
にしか生じない。
よって、
a−>*(*は、先行音素以外の音素すべて)*−>s
(*ば、後続音素以外の音素すべて)*−>n(*は、
後続音素以外の音素すべて)の変化が生じる地点は音節
境界である。
(*ば、後続音素以外の音素すべて)*−>n(*は、
後続音素以外の音素すべて)の変化が生じる地点は音節
境界である。
これは、2音素の場合にも拡張できる。
例えば、拗音では、一般に
ie口 (口は、auoの内の1つの音素)と遷移する
。しかしe段の拗音は存在しないために、 e という組み合わせだけで音節を構成することはない。よ
って、1ielの連鎖が発生し、音素″i′の区間だけ
で1音節として切り出せないほどの短さであれば、その
次の音素も含めて’ie口′ という区間を抽出するこ
とで正確な区間が得られる。
。しかしe段の拗音は存在しないために、 e という組み合わせだけで音節を構成することはない。よ
って、1ielの連鎖が発生し、音素″i′の区間だけ
で1音節として切り出せないほどの短さであれば、その
次の音素も含めて’ie口′ という区間を抽出するこ
とで正確な区間が得られる。
以下図にもとづいて本発明方式を説明する。
第1図は本発明方式を実施した音声認識装置の全体の構
成を示すブロック図である。
成を示すブロック図である。
図において、1は音声を入力するためのマイク、2はマ
イクIを介して入力された音声信号を増幅するアンプ、
3は上記アンプ2によって増幅された音声信号によりマ
ツチングに用いる特徴量及び切出しに用いるパワー、自
己相関係数等の特徴量を抽出する特徴抽出部から成る分
析部であり、特tて特徴抽出部は例えば24帯域フイル
タバンクより構成された周波数分析部と、該周波数分析
部の出力を一定時間保持するサンプルホールド部ト、該
サンプルホールド部の出力をデジタル信号に変換するA
/D変換部及び入力音声のパワー、ゼロクロス、自己相
関係数等の特徴量(パラメータ)を抽出するパラメータ
抽出部とから構成されている0 4は本発明に係るアルゴリズムを実現するための音声区
間抽出部、5はフレームごとにその区間の特徴量を標準
パターンとマツチングして音素記号を出力する音素マツ
チング部、6は音素の標準パターンを蓄えておくパター
ンメモリ、7は切り出された区間のパターンを音節標準
パターンとマツチングする音節マツチング部、8は音節
標準パターンを蓄えておくパターンメモリである。
イクIを介して入力された音声信号を増幅するアンプ、
3は上記アンプ2によって増幅された音声信号によりマ
ツチングに用いる特徴量及び切出しに用いるパワー、自
己相関係数等の特徴量を抽出する特徴抽出部から成る分
析部であり、特tて特徴抽出部は例えば24帯域フイル
タバンクより構成された周波数分析部と、該周波数分析
部の出力を一定時間保持するサンプルホールド部ト、該
サンプルホールド部の出力をデジタル信号に変換するA
/D変換部及び入力音声のパワー、ゼロクロス、自己相
関係数等の特徴量(パラメータ)を抽出するパラメータ
抽出部とから構成されている0 4は本発明に係るアルゴリズムを実現するための音声区
間抽出部、5はフレームごとにその区間の特徴量を標準
パターンとマツチングして音素記号を出力する音素マツ
チング部、6は音素の標準パターンを蓄えておくパター
ンメモリ、7は切り出された区間のパターンを音節標準
パターンとマツチングする音節マツチング部、8は音節
標準パターンを蓄えておくパターンメモリである。
第2図は上記した音声認識装置の全体の動作を示す動作
フロー図である。
フロー図である。
今、認識すべき音声がマイク!を介して入力されると、
この入力された音声データはアンプ2で増幅されたのち
、分析部3に入力される。ここでは、まず同一音素区間
の抽出が行われる(nl)。
この入力された音声データはアンプ2で増幅されたのち
、分析部3に入力される。ここでは、まず同一音素区間
の抽出が行われる(nl)。
たとえば同一の音素が5フレーム続くとその音素を代表
音素とし、代表音素以外の音素が3フレーム続くとそこ
までを1つの音素区間としている。
音素とし、代表音素以外の音素が3フレーム続くとそこ
までを1つの音素区間としている。
その区間の代表音素は第3図(イ)に示すようなスタッ
ク構造のバッファに記憶される。この例の状態では、音
素−1nIJ、n oI+の区間がすでに入力されてい
て、まだこの区間が切り出されていないことを示してい
る。
ク構造のバッファに記憶される。この例の状態では、音
素−1nIJ、n oI+の区間がすでに入力されてい
て、まだこの区間が切り出されていないことを示してい
る。
ステップn1で同一音素区間が抽出されると、次に抽出
された音素区間の始端(ここでは、音素II i I+
の始端=フレーム番号21)が音節境界と成り得るかの
検定を行う(n2)。第3図(ロ)は同図(イ)の状態
から代表音素1− i Hの区間が抽出されスタックO
で加わったことを示している゛。スタック内の音素は始
端表と比較され、後方部分一致で検索が行われる。第4
図(イ)は上記始端表の例であり、この例ではスタック
内の音素=loil″が後方部分一致で検索される。こ
れは、音素列旧”が日本語の音節の中には存在せず、必
ず0″と °゛1″に分離されることを示している。検
索の結果、始端表に該当項目が存在すると(n3)、ス
テップn4に進み、先のスタック内の音素のうち、現区
間(音素1− i II の区間)の始端までの区間を
!音節として切り出し、その切り出した区間は音素スタ
ックから抹消する。このときの音素スタックの状態は第
3図を→に示す通シである。
された音素区間の始端(ここでは、音素II i I+
の始端=フレーム番号21)が音節境界と成り得るかの
検定を行う(n2)。第3図(ロ)は同図(イ)の状態
から代表音素1− i Hの区間が抽出されスタックO
で加わったことを示している゛。スタック内の音素は始
端表と比較され、後方部分一致で検索が行われる。第4
図(イ)は上記始端表の例であり、この例ではスタック
内の音素=loil″が後方部分一致で検索される。こ
れは、音素列旧”が日本語の音節の中には存在せず、必
ず0″と °゛1″に分離されることを示している。検
索の結果、始端表に該当項目が存在すると(n3)、ス
テップn4に進み、先のスタック内の音素のうち、現区
間(音素1− i II の区間)の始端までの区間を
!音節として切り出し、その切り出した区間は音素スタ
ックから抹消する。このときの音素スタックの状態は第
3図を→に示す通シである。
一方、始端表に該当項目が存在しない場合は、終端表を
検索し同様に後方部分一致をとる(n5)。
検索し同様に後方部分一致をとる(n5)。
第3図に)はここでのスタック状態を示し、これは第3
図(ハ)の状態から音素″e”と音素“0″ の区間が
入力された状態を表わしている。また、第4図(ロ)は
終端表の例であp、この例ではスタック内の音素” i
e o ”が後方部分一致で検索される。これは、音
素列1−ieoI+が発生したときには必ずその後で音
節境界を生じることを示している。上記終端表に該当項
目が存在するとステップn6.n7と進み、スタック内
の全音素区間をまとめて1音節として切り出す。そして
先のスタックを空にし第3図(ホ)の状態にする。スタ
ックが空になることで、残っている切り出し区間がない
ことを示している。
図(ハ)の状態から音素″e”と音素“0″ の区間が
入力された状態を表わしている。また、第4図(ロ)は
終端表の例であp、この例ではスタック内の音素” i
e o ”が後方部分一致で検索される。これは、音
素列1−ieoI+が発生したときには必ずその後で音
節境界を生じることを示している。上記終端表に該当項
目が存在するとステップn6.n7と進み、スタック内
の全音素区間をまとめて1音節として切り出す。そして
先のスタックを空にし第3図(ホ)の状態にする。スタ
ックが空になることで、残っている切り出し区間がない
ことを示している。
第5図は、°゛あいパと発声したときの具体的な例であ
り、図中(イ)は音素のマツチング結果(音素系列)、
(ロ)Vi本発明方式による音節抽出区間、(ハ)は従
来方式による音節抽出区間を示している。この音声は全
体で25フレームあυ、平均母音長が18フレームであ
る。ここで、 全フレーム長〉平均母音長×1.5 の時に2音節と判定するといった従来の判定方法を用い
ると、この区間は図示の如く1音節と判定される。これ
に対し、本発明方式によれば、この区間には音素゛a″
が含まれておυ、しかも音素to aI+の後は必ず音
節境界であることから、ここで音節を2分割して正しく
2音節切シ出すことが出来る。
り、図中(イ)は音素のマツチング結果(音素系列)、
(ロ)Vi本発明方式による音節抽出区間、(ハ)は従
来方式による音節抽出区間を示している。この音声は全
体で25フレームあυ、平均母音長が18フレームであ
る。ここで、 全フレーム長〉平均母音長×1.5 の時に2音節と判定するといった従来の判定方法を用い
ると、この区間は図示の如く1音節と判定される。これ
に対し、本発明方式によれば、この区間には音素゛a″
が含まれておυ、しかも音素to aI+の後は必ず音
節境界であることから、ここで音節を2分割して正しく
2音節切シ出すことが出来る。
このように、音節内の音素の遷移の情報を使うことばよ
って、音節のセグメンテーションを正確に行うことがで
きる。
って、音節のセグメンテーションを正確に行うことがで
きる。
なお、本発明方式に、先のパワー変化やスペクトル変化
などの境界を示す情報さ、平均的な母音長などの時間的
な情報を用いて音節区間を抽出する方式を併用すること
だより、総ての音節をより正確に切シ出すことができる
。
などの境界を示す情報さ、平均的な母音長などの時間的
な情報を用いて音節区間を抽出する方式を併用すること
だより、総ての音節をより正確に切シ出すことができる
。
く効 果〉
以上詳細に説明したように、本発明に係る音声認識方式
は、入力音声について予め登録された音素標準パターン
とのマツチングを行い、その結果得られた音素記号列中
に含まれる特定の遷移状態を判定して音節の境界を求め
、最終的な音節区間の抽出を行うようにしたから、従来
方式に比較してよ−り正確に音節のセグメンテーション
を行うことが出来る。
は、入力音声について予め登録された音素標準パターン
とのマツチングを行い、その結果得られた音素記号列中
に含まれる特定の遷移状態を判定して音節の境界を求め
、最終的な音節区間の抽出を行うようにしたから、従来
方式に比較してよ−り正確に音節のセグメンテーション
を行うことが出来る。
第1図は本発明方式を実施した音声認識装置の全体の構
成を示すブロック図、第2図は本発明を実施した装置の
動作を説明するための動作フロー図、第3図(イ)乃至
(ホ)は音素スタックの状態を示す図、第4図(イ)、
(ロ)は音素の始端・終端表を示す図、第5図(イ)、
(ロ)、(ハ)は具体的発声例に対する本発明と従来の
両方式による音節抽出区間の相違を示す図である。 1はマイク、2はアンプ、3は分析部、4は音声区間抽
出部、5は音素マツチング部、6は音素標準パターンメ
モリ、7は音節マ)チング部、8は音節標準パターンマ
ツチング部。
成を示すブロック図、第2図は本発明を実施した装置の
動作を説明するための動作フロー図、第3図(イ)乃至
(ホ)は音素スタックの状態を示す図、第4図(イ)、
(ロ)は音素の始端・終端表を示す図、第5図(イ)、
(ロ)、(ハ)は具体的発声例に対する本発明と従来の
両方式による音節抽出区間の相違を示す図である。 1はマイク、2はアンプ、3は分析部、4は音声区間抽
出部、5は音素マツチング部、6は音素標準パターンメ
モリ、7は音節マ)チング部、8は音節標準パターンマ
ツチング部。
Claims (1)
- 【特許請求の範囲】 1、入力音声を音節単位で認識する音声認識方式におい
て、 入力音声について予め登録された音素標準パターンとの
マッチングを行い、その結果得られた音素記号系列中に
含まれる特定の遷移状態を判定して音節の境界を求め、
最終的な音節区間の抽出を行うようにしたことを特徴と
する音声認識方式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP60218630A JPS6275700A (ja) | 1985-09-30 | 1985-09-30 | 音声認識方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP60218630A JPS6275700A (ja) | 1985-09-30 | 1985-09-30 | 音声認識方式 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS6275700A true JPS6275700A (ja) | 1987-04-07 |
| JPH0567036B2 JPH0567036B2 (ja) | 1993-09-24 |
Family
ID=16722960
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP60218630A Granted JPS6275700A (ja) | 1985-09-30 | 1985-09-30 | 音声認識方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS6275700A (ja) |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6148896A (ja) * | 1984-08-16 | 1986-03-10 | 松下電器産業株式会社 | 音声のセグメンテ−シヨン方法 |
-
1985
- 1985-09-30 JP JP60218630A patent/JPS6275700A/ja active Granted
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6148896A (ja) * | 1984-08-16 | 1986-03-10 | 松下電器産業株式会社 | 音声のセグメンテ−シヨン方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPH0567036B2 (ja) | 1993-09-24 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JPS58130393A (ja) | 音声認識装置 | |
| JPS6147440B2 (ja) | ||
| JPS5972496A (ja) | 単音識別装置 | |
| KR19980070329A (ko) | 사용자 정의 문구의 화자 독립 인식을 위한 방법 및 시스템 | |
| US6546369B1 (en) | Text-based speech synthesis method containing synthetic speech comparisons and updates | |
| JPS6138479B2 (ja) | ||
| JPS5972500A (ja) | 音声認識方式 | |
| JP2000099099A (ja) | データ再生装置 | |
| JPH0567036B2 (ja) | ||
| JPH02124600A (ja) | 音声認識装置 | |
| JP2760096B2 (ja) | 音声認識方式 | |
| JPS6225796A (ja) | 音声認識装置 | |
| CN85100180B (zh) | 一种利用计算机对汉语语音进行识别的装置 | |
| JPS63217399A (ja) | 音声区間検出装置 | |
| JPS63269200A (ja) | 音声認識装置 | |
| JPS607492A (ja) | 単音節音声認識方式 | |
| CN116312461A (zh) | 耳语语音合成方法、装置、设备及存储介质 | |
| JPS63223696A (ja) | 音声パタ−ン作成方式 | |
| JPH01158499A (ja) | 定常雑音除去方式 | |
| JPH0558556B2 (ja) | ||
| JPS58176699A (ja) | 音声標準パタ−ン登録方式 | |
| JPH02205898A (ja) | 音声認識装置 | |
| JPS6346499A (ja) | 大語▲い▼単語音声認識方式 | |
| JPS59180598A (ja) | 音声入力方式 | |
| JPS6068398A (ja) | 連続音声認識における表現形態の識別方法 |