JPH03273280A - 発声練習用音声合成方式 - Google Patents
発声練習用音声合成方式Info
- Publication number
- JPH03273280A JPH03273280A JP2072888A JP7288890A JPH03273280A JP H03273280 A JPH03273280 A JP H03273280A JP 2072888 A JP2072888 A JP 2072888A JP 7288890 A JP7288890 A JP 7288890A JP H03273280 A JPH03273280 A JP H03273280A
- Authority
- JP
- Japan
- Prior art keywords
- speech
- voice
- standard
- input
- prosodic information
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 230000002194 synthesizing effect Effects 0.000 title claims abstract description 10
- 230000001755 vocal effect Effects 0.000 title claims description 25
- 238000001308 synthesis method Methods 0.000 claims description 15
- 230000002123 temporal effect Effects 0.000 claims description 9
- 238000012549 training Methods 0.000 abstract description 18
- 230000033764 rhythmic process Effects 0.000 abstract description 8
- 239000000284 extract Substances 0.000 abstract description 2
- 238000011156 evaluation Methods 0.000 description 11
- 238000000605 extraction Methods 0.000 description 10
- 238000000034 method Methods 0.000 description 10
- 230000015572 biosynthetic process Effects 0.000 description 9
- 238000003786 synthesis reaction Methods 0.000 description 9
- 238000001514 detection method Methods 0.000 description 5
- 238000010586 diagram Methods 0.000 description 5
- 238000013500 data storage Methods 0.000 description 4
- 238000004364 calculation method Methods 0.000 description 3
- 238000011161 development Methods 0.000 description 3
- 230000000694 effects Effects 0.000 description 2
- 230000000007 visual effect Effects 0.000 description 2
- 206010011878 Deafness Diseases 0.000 description 1
- 238000013459 approach Methods 0.000 description 1
- NCEXYHBECQHGNR-UHFFFAOYSA-N chembl421 Chemical compound C1=C(O)C(C(=O)O)=CC(N=NC=2C=CC(=CC=2)S(=O)(=O)NC=2N=CC=CC=2)=C1 NCEXYHBECQHGNR-UHFFFAOYSA-N 0.000 description 1
- 238000006243 chemical reaction Methods 0.000 description 1
- 238000004040 coloring Methods 0.000 description 1
- 238000004891 communication Methods 0.000 description 1
- 230000006835 compression Effects 0.000 description 1
- 238000007906 compression Methods 0.000 description 1
- 235000009508 confectionery Nutrition 0.000 description 1
- 230000008602 contraction Effects 0.000 description 1
- 230000006870 function Effects 0.000 description 1
- 238000013507 mapping Methods 0.000 description 1
- 238000011160 research Methods 0.000 description 1
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
(産業上の利用分野)
本発明は、練習者の音声を分析してその特徴を抽出し、
該練習者の音声の特徴を標準話者の音声の特徴に変換し
た合成音声を教師音声とする発声練習用音声合成方式に
関する。
該練習者の音声の特徴を標準話者の音声の特徴に変換し
た合成音声を教師音声とする発声練習用音声合成方式に
関する。
(従来の技術)
従来の発声訓練装置としては、練習者が発声する音声に
ついてそのピ・ソチ周波数やフォルマント周波数を解析
して該解析結果をモニター上に画面として表示し、前記
練習者が前記モニター上の画面を!!察しながら発声訓
練を行う訓練装置がすでに知られている。この発声訓練
装置の詳細については、梅崎氏らによる“聾唖者用発声
・発語訓練装置の開発”と題した論文(1988年3月
B本音響学会論文集1−4−11 p、297〜2
98)(文献1)に記載されている。
ついてそのピ・ソチ周波数やフォルマント周波数を解析
して該解析結果をモニター上に画面として表示し、前記
練習者が前記モニター上の画面を!!察しながら発声訓
練を行う訓練装置がすでに知られている。この発声訓練
装置の詳細については、梅崎氏らによる“聾唖者用発声
・発語訓練装置の開発”と題した論文(1988年3月
B本音響学会論文集1−4−11 p、297〜2
98)(文献1)に記載されている。
またこれ以外にも、音声学の知識に基づき練習者が発声
する音声を種々のセンサにより種々のパラメータについ
て分析して該パラメータに基づいて訓練方法を決定し、
練習者が発声する音声について各パラメータ毎に教師音
声のパラメータと比較して発声訓練を行う訓練装置が知
られている。
する音声を種々のセンサにより種々のパラメータについ
て分析して該パラメータに基づいて訓練方法を決定し、
練習者が発声する音声について各パラメータ毎に教師音
声のパラメータと比較して発声訓練を行う訓練装置が知
られている。
この装置の詳細については、山田比らによる“言語障害
者用発声訓練装置の開発(第6報)”と題しfS論文(
1988年1月 電子情報通信学会技術研究報告 ET
87−8 p、25〜30)(文献2)に記載されて
いる。
者用発声訓練装置の開発(第6報)”と題しfS論文(
1988年1月 電子情報通信学会技術研究報告 ET
87−8 p、25〜30)(文献2)に記載されて
いる。
また最近では、教師音声を聴きながらリズム・イントネ
ーション、f#音の発声練習および単語の聞き取り練習
ができ、練習者の発声した音声と教師音声を聴き比べる
ことができる発声訓練装置が実現されている。この詳細
については、高田氏らによる“英語スピーチ練習システ
ムの開発2と題した論文(1987年3月 電子情報通
信学会技術研究報告 ET86−12 p、49〜5
2)(文献3)に記載されている。
ーション、f#音の発声練習および単語の聞き取り練習
ができ、練習者の発声した音声と教師音声を聴き比べる
ことができる発声訓練装置が実現されている。この詳細
については、高田氏らによる“英語スピーチ練習システ
ムの開発2と題した論文(1987年3月 電子情報通
信学会技術研究報告 ET86−12 p、49〜5
2)(文献3)に記載されている。
(発明が解決しようとする課H)
しかしながら、文献1の発声訓a!i装置では、解析し
た入力音声すなわち練習者が発声する音声のみのイント
ネーションをデイスプレィに表示するから、入力音声が
標準的な発声からどの様にずれているかを確認すること
ができず、練習者には標準音声と自分の音声との違いが
分かりにくいという欠点があった。
た入力音声すなわち練習者が発声する音声のみのイント
ネーションをデイスプレィに表示するから、入力音声が
標準的な発声からどの様にずれているかを確認すること
ができず、練習者には標準音声と自分の音声との違いが
分かりにくいという欠点があった。
また、文献2の発声訓練装置では、練習者が発声訓練時
に種々のセンサを身につける必要があり、非常に煩わし
く、かつセンサの付加により発声の仕方が歪められると
いう欠点があった。
に種々のセンサを身につける必要があり、非常に煩わし
く、かつセンサの付加により発声の仕方が歪められると
いう欠点があった。
文v、3の発声訓練装色では、リズム・イントネーショ
ンの練習と称して、予め登録されている教師音声に合わ
せて練習者が発音すると、教師音声と練習者の発声した
音声のリズムとイントネーションをデイスプレィ上に表
示するが、表示画面を見ただけではどこをどうなおした
らよいのかわからず、ただ単に練習者の発声が標準音声
である教師音声とは違うことを示すだけであるから、実
際の発声の学習には結び付きにくいという欠点があった
。また、この訓練装置では、練習者が自分の発声と間き
比べかつ目標とする教師音声として他の話者が発声した
W準音声を使用するが、その教師音声は練習者の音声と
は音韻、韻律情報のみならず、声質等が違うから、練習
者は声質等の違いに注意を向けがちで、音韻や韻律情報
を教師音声に近づくことができるように訓練するのが難
しいという欠点があった。また、標準話者の発声速度が
、一般に一定であるから、練習者の発声速度に合わない
場合があり、練習者は言語の発声訓練時に話す速度を変
える必要があった。
ンの練習と称して、予め登録されている教師音声に合わ
せて練習者が発音すると、教師音声と練習者の発声した
音声のリズムとイントネーションをデイスプレィ上に表
示するが、表示画面を見ただけではどこをどうなおした
らよいのかわからず、ただ単に練習者の発声が標準音声
である教師音声とは違うことを示すだけであるから、実
際の発声の学習には結び付きにくいという欠点があった
。また、この訓練装置では、練習者が自分の発声と間き
比べかつ目標とする教師音声として他の話者が発声した
W準音声を使用するが、その教師音声は練習者の音声と
は音韻、韻律情報のみならず、声質等が違うから、練習
者は声質等の違いに注意を向けがちで、音韻や韻律情報
を教師音声に近づくことができるように訓練するのが難
しいという欠点があった。また、標準話者の発声速度が
、一般に一定であるから、練習者の発声速度に合わない
場合があり、練習者は言語の発声訓練時に話す速度を変
える必要があった。
そこで本発明の目的は、個々の練習者に近い声質、発声
速度を持った教師音声を生成することによって、個々の
練習者に遺した教師音声を提供し、さらに、練習者の音
声を音素毎に教師音声と比較し表示することでどの部分
に問題があるかを明瞭にし、W、冒者の発声と教師音声
の発声の距離を掌め、学習到達度を示すことにより、ど
のくらい学習効果があったかを分かりやすく表示する発
声練習用音声合成方式を提供することにある。
速度を持った教師音声を生成することによって、個々の
練習者に遺した教師音声を提供し、さらに、練習者の音
声を音素毎に教師音声と比較し表示することでどの部分
に問題があるかを明瞭にし、W、冒者の発声と教師音声
の発声の距離を掌め、学習到達度を示すことにより、ど
のくらい学習効果があったかを分かりやすく表示する発
声練習用音声合成方式を提供することにある。
(課題を解決するための手段)
本発明に係る第1の発声練習用音声合成方式は、練習者
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である標準音声の韻律情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記教師音声と前記入力音声から抽出した前記韻律情報
とを画面に出力し、前記出力において前記入力音声の音
素名と音素境界とを前記標準音声の対応する位置にそれ
ぞれ表示する手段と、を有することを特徴とする。
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である標準音声の韻律情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記教師音声と前記入力音声から抽出した前記韻律情報
とを画面に出力し、前記出力において前記入力音声の音
素名と音素境界とを前記標準音声の対応する位置にそれ
ぞれ表示する手段と、を有することを特徴とする。
本発明に係る第2の発声練習用音声合成方式は、練習者
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である!準音声の韻律情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記入力音声の分析結果から得た音!j!継続時間長と
前記標準音声の分析結果から得た甘顔II!続時開時間
長較して差異を計算し、音韻継続時間長を前記差異だけ
伸縮した標準音声を前記教師音声出力手段において用い
る標準音声として出力する手段、または、前記入力音声
と前記標準音声のそれぞれについてストレスのある母音
の継続時間長と他の母音の継続時間長との関係を求め、
前記標準音声の前記ストレスのある母音の継続時間長を
前記入力音声の母音の継続時間長に変換し、その他の母
音については前記標準音声における各母音間の継続時間
長を前記入力音声における各母音間の継続時間長に変換
し、該母音間の継続時間長を変換した前記111i準音
声を前記教師音声出力手段において用いる標準音声とし
て出力する手段と、を有することを特徴とする。
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である!準音声の韻律情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記入力音声の分析結果から得た音!j!継続時間長と
前記標準音声の分析結果から得た甘顔II!続時開時間
長較して差異を計算し、音韻継続時間長を前記差異だけ
伸縮した標準音声を前記教師音声出力手段において用い
る標準音声として出力する手段、または、前記入力音声
と前記標準音声のそれぞれについてストレスのある母音
の継続時間長と他の母音の継続時間長との関係を求め、
前記標準音声の前記ストレスのある母音の継続時間長を
前記入力音声の母音の継続時間長に変換し、その他の母
音については前記標準音声における各母音間の継続時間
長を前記入力音声における各母音間の継続時間長に変換
し、該母音間の継続時間長を変換した前記111i準音
声を前記教師音声出力手段において用いる標準音声とし
て出力する手段と、を有することを特徴とする。
本発明に係る第3の発声I[習用音声合成方式は、練習
者が発声した音声を入力音声として入力し、該入力音声
を分析して基本周波数の時間的変化や音韻継続時間長等
の韻律情報を抽出する手段と、予め分析してある標準話
者の音声である標準音声のaS情報を記録する手段と、 前記入力音声と前記tIA準音声との音素間の対応関係
をそれぞれの韻律情報から求め、前記入力音声の韻律情
報を予め分析してある前記標!#、音声の韻律情報に変
換して該入力音声と前記ll準音声とを合成し、該合成
した音声を教師音声として出力する手段と、 予め継続時間長の異なる複数の音声を記録しておき、前
記入力音声と前記標準音声の継続時間長を比較して該継
続時間長が異なる場合には前記複数の音声の中から継続
時間長が前記入力音声に最も近い音声を選択して該音声
を前記教師音声出力手段に標準音声として出力する手段
と、 を有することを特徴とする。
者が発声した音声を入力音声として入力し、該入力音声
を分析して基本周波数の時間的変化や音韻継続時間長等
の韻律情報を抽出する手段と、予め分析してある標準話
者の音声である標準音声のaS情報を記録する手段と、 前記入力音声と前記tIA準音声との音素間の対応関係
をそれぞれの韻律情報から求め、前記入力音声の韻律情
報を予め分析してある前記標!#、音声の韻律情報に変
換して該入力音声と前記ll準音声とを合成し、該合成
した音声を教師音声として出力する手段と、 予め継続時間長の異なる複数の音声を記録しておき、前
記入力音声と前記標準音声の継続時間長を比較して該継
続時間長が異なる場合には前記複数の音声の中から継続
時間長が前記入力音声に最も近い音声を選択して該音声
を前記教師音声出力手段に標準音声として出力する手段
と、 を有することを特徴とする。
本発明に係る第4の発声練習用音声合成方式は、練習者
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である標準音声の韻律情報を記録する手段と、 前記入力音声と前記標準fvMの音素間の対応間係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記入力音声と前記教師音声との韻律情報同志の距離を
計算し、該距離を学習到達度に変換して画面に出力する
手段と、 を有することを特徴とする。
が発声した音声を入力音声として入力し、該入力音声を
分析して基本周波数の時間的変化や音韻継続時間長等の
韻律情報を抽出する手段と、予め分析してある標準話者
の音声である標準音声の韻律情報を記録する手段と、 前記入力音声と前記標準fvMの音素間の対応間係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記入力音声と前記教師音声との韻律情報同志の距離を
計算し、該距離を学習到達度に変換して画面に出力する
手段と、 を有することを特徴とする。
(作用)
本発明によれば、練習者が標準話者の韻律情報、特にリ
ズム・イントネーションを正確に習得し、発声できるよ
うになる。練習には視覚的な情報と、聴覚的なIfI報
の両方を用いる。視覚的な情報を表示する画面に教師音
声と練習者の発声した音声との音素間の対応を表示する
ことにより、どの部分でどの程度違うかが確かめられる
。また、教師音声には、練習者の発声および練習者の声
質を持った音声を用いて、練習者の声と教師音声の声の
違いを少なくし、両音声の韻律情報の差を強調するから
、練習者白身が標準音声の韻律情報を正確に真似した時
のイメージをつかみながら、練習を行うことができる。
ズム・イントネーションを正確に習得し、発声できるよ
うになる。練習には視覚的な情報と、聴覚的なIfI報
の両方を用いる。視覚的な情報を表示する画面に教師音
声と練習者の発声した音声との音素間の対応を表示する
ことにより、どの部分でどの程度違うかが確かめられる
。また、教師音声には、練習者の発声および練習者の声
質を持った音声を用いて、練習者の声と教師音声の声の
違いを少なくし、両音声の韻律情報の差を強調するから
、練習者白身が標準音声の韻律情報を正確に真似した時
のイメージをつかみながら、練習を行うことができる。
例えば、イントネーションについては、練習者のイント
ネーションのどこが標準話者のイントネーションと違う
かを明確にわからせるために、画面上では標準話者のイ
ントネーションの上に練習者のイントネーションを重ね
て表示し、どの部分が違うが視覚的に練習者に知らせる
。t、た、それが何という音素であるかを表示し、より
正確に問題部分を練習者に示す、また、音素毎に音声を
評価し、教師音声と興なっている部分を示す、 練習用
の教師音声としては、練習を行いたい韻律情報について
は標準音声のものを、それ以外の声道特性と音源特性に
ついては練習者の音声のものを用いて音声合成した音声
を用いる。
ネーションのどこが標準話者のイントネーションと違う
かを明確にわからせるために、画面上では標準話者のイ
ントネーションの上に練習者のイントネーションを重ね
て表示し、どの部分が違うが視覚的に練習者に知らせる
。t、た、それが何という音素であるかを表示し、より
正確に問題部分を練習者に示す、また、音素毎に音声を
評価し、教師音声と興なっている部分を示す、 練習用
の教師音声としては、練習を行いたい韻律情報について
は標準音声のものを、それ以外の声道特性と音源特性に
ついては練習者の音声のものを用いて音声合成した音声
を用いる。
e師音声として使われる合成音声は練習したい韻律情報
以外は練習者のものであるから、練習者が自分の発声と
教師音声を聞き比べる時に、声質的な差が少なくなって
おり、両音声で練習を行いたい韻律情報の違いが分かり
やすくなり、目標とする韻律が習得しやすくなる。
以外は練習者のものであるから、練習者が自分の発声と
教師音声を聞き比べる時に、声質的な差が少なくなって
おり、両音声で練習を行いたい韻律情報の違いが分かり
やすくなり、目標とする韻律が習得しやすくなる。
さらに、練習者と標準話者の発声速度が著しく違うもの
については、標準話者の発声速度を伸縮し、!冒者の発
声速度に近づけた上で、音声合成を行うから、練習者が
教師音声の発声速度に合わせられず、正しい訓練が行え
ないという欠点は解決する。
については、標準話者の発声速度を伸縮し、!冒者の発
声速度に近づけた上で、音声合成を行うから、練習者が
教師音声の発声速度に合わせられず、正しい訓練が行え
ないという欠点は解決する。
(実施例)
次に、図面を参照して本発明について詳しく説明する。
第1図は本発明に係る第1の発声練習用音声合成方式の
一実施例を示すブロック図である。標準音声ピッチ抽出
部30は、入力端子1を介して入力する標準音声を線形
予測分析して残差特性と声道特性に分離し、さらに自己
相関法を用いて残差特性に対してピッチ抽出を行ってピ
ッチ分割位置と音素境界を抽出し、これら全てを標準音
声ファイルとする。この方法には、岩田比の“音声ピッ
チ抽出装置” (特願昭62−210690号明醪書)
(文献4)の方法を弔いる。データ保ダ部10は、標準
音声ピッチ抽出部30でビ・ソチ抽出を行った標準音声
のデータすなわち標準音声ファイルを保存する。標準音
声として既にあるデータを使用する場合に、このデータ
保育部10かち取り出す。
一実施例を示すブロック図である。標準音声ピッチ抽出
部30は、入力端子1を介して入力する標準音声を線形
予測分析して残差特性と声道特性に分離し、さらに自己
相関法を用いて残差特性に対してピッチ抽出を行ってピ
ッチ分割位置と音素境界を抽出し、これら全てを標準音
声ファイルとする。この方法には、岩田比の“音声ピッ
チ抽出装置” (特願昭62−210690号明醪書)
(文献4)の方法を弔いる。データ保ダ部10は、標準
音声ピッチ抽出部30でビ・ソチ抽出を行った標準音声
のデータすなわち標準音声ファイルを保存する。標準音
声として既にあるデータを使用する場合に、このデータ
保育部10かち取り出す。
入力音声検出部40は、入力端子6をpして入力する練
習者の音声である入力音声を線形予測分析して残差特性
と声道特性とに分離し、さらに自動音声検出を行って、
入力音声の始端・終端の位置を求める。自声検出には、
Rabiner氏らの“An Algorithm for Determining theEndp
oints of 15olatedUtterr
ances (Bell 5ystTech、J、
、Vol、 54.No、 2pp297−315
.February1975)(文献5)の方法を用い
る。
習者の音声である入力音声を線形予測分析して残差特性
と声道特性とに分離し、さらに自動音声検出を行って、
入力音声の始端・終端の位置を求める。自声検出には、
Rabiner氏らの“An Algorithm for Determining theEndp
oints of 15olatedUtterr
ances (Bell 5ystTech、J、
、Vol、 54.No、 2pp297−315
.February1975)(文献5)の方法を用い
る。
データ照合部50は、DPマツチングを用いて、入力音
声検出部40と標準音声ピッチ抽出部30とでそれぞれ
分析される入力音声と標準音声との分析結果間の距離を
求めて両音声の時間軸対応をとる。このDPマツチング
には、迫江氏らによる“動的計画法による音声バタンの
類似度評価“(I970年8月 昭和45年度電子通信
学会総合全国大会講演論文集 p136)(文献6)の
方法を用いる。tた、DPマ・yチングにより、あらか
じめ音素名と音素境界位置が入っている標準音声ファイ
ルを用いて、入力音声ファイルに入力音声における音素
境界の位置を与える。
声検出部40と標準音声ピッチ抽出部30とでそれぞれ
分析される入力音声と標準音声との分析結果間の距離を
求めて両音声の時間軸対応をとる。このDPマツチング
には、迫江氏らによる“動的計画法による音声バタンの
類似度評価“(I970年8月 昭和45年度電子通信
学会総合全国大会講演論文集 p136)(文献6)の
方法を用いる。tた、DPマ・yチングにより、あらか
じめ音素名と音素境界位置が入っている標準音声ファイ
ルを用いて、入力音声ファイルに入力音声における音素
境界の位置を与える。
分析部60は、標準音声ピッチ抽出部30で標準音声に
おけるピッチ分割位置を挿入した標準音声ファイルを、
ピッチ同期で分析する0分析した標準音声ファイルを音
素名と音素境界位置、ピッチ分割位置、継続時間長、残
差特性、声道特性などに分離し、それらを第1の合成波
形作成用ファイルに書き込む。
おけるピッチ分割位置を挿入した標準音声ファイルを、
ピッチ同期で分析する0分析した標準音声ファイルを音
素名と音素境界位置、ピッチ分割位置、継続時間長、残
差特性、声道特性などに分離し、それらを第1の合成波
形作成用ファイルに書き込む。
ピッチ抽出・分析部70は、入力音声分析部40で分析
され、かつデータ照合部50で入力音声における音素境
界を与えられた入力音声ファイルを用いて、入力音声に
対するピッチ抽出を行って、ピッチ分割位置を求め、そ
の結果を元に入力音声ファイルをピッチ同期で分析する
。この分析結果は、標準音声ファイルのピッチ同期分析
と同様に第2の合成波形作成用ファイルに書き込む。
され、かつデータ照合部50で入力音声における音素境
界を与えられた入力音声ファイルを用いて、入力音声に
対するピッチ抽出を行って、ピッチ分割位置を求め、そ
の結果を元に入力音声ファイルをピッチ同期で分析する
。この分析結果は、標準音声ファイルのピッチ同期分析
と同様に第2の合成波形作成用ファイルに書き込む。
合成部80は、第1および第2の合成波形作成用ファイ
ルを用いて、標準音声の韻律情報の少なくとも1つと、
入力音声の残差特性と声道特性を用いて音声合成を行っ
て教師音声を生成する。また、合成部80は、ピッチ分
割位置、音素境界と残差特性、声道特性等の情報を持っ
た入力音声ファイルと標準音声ファイルを用いて、目的
とする教師音声の韻律情報を標準音声のものと変換する
。
ルを用いて、標準音声の韻律情報の少なくとも1つと、
入力音声の残差特性と声道特性を用いて音声合成を行っ
て教師音声を生成する。また、合成部80は、ピッチ分
割位置、音素境界と残差特性、声道特性等の情報を持っ
た入力音声ファイルと標準音声ファイルを用いて、目的
とする教師音声の韻律情報を標準音声のものと変換する
。
このとき、ピッチ制御を用いて入力音声または標l!音
声の時間長を変換する0合成部80は、教師音声を生成
するだけではなく、標準音声、入力音声の再生も行う。
声の時間長を変換する0合成部80は、教師音声を生成
するだけではなく、標準音声、入力音声の再生も行う。
出力端子5には、これら合成された各音声が出力する6
合成波形保存部130は、教師音声を保存し、必要なと
きに該教師音声を出力する。
合成波形保存部130は、教師音声を保存し、必要なと
きに該教師音声を出力する。
画面表示部150は、データ照合部50で求めた入力音
声の音素芯と音素境界位置および合成部80で求めた教
師音声の音素芯と音素境界位置を元に、それらに対応す
る韻律情報のそれぞれの場所に、音素芯と音素境界の情
報を加えて画面に出力する。これらの画面に表示された
情報に対して。
声の音素芯と音素境界位置および合成部80で求めた教
師音声の音素芯と音素境界位置を元に、それらに対応す
る韻律情報のそれぞれの場所に、音素芯と音素境界の情
報を加えて画面に出力する。これらの画面に表示された
情報に対して。
入力端子3にキーボードやマウス等から再生する部分の
音素を指定する信号を入力すると、合成部80において
その信号に対応する部分の音声について音声合成を行い
、出力端子5から教師音声が出力する。
音素を指定する信号を入力すると、合成部80において
その信号に対応する部分の音声について音声合成を行い
、出力端子5から教師音声が出力する。
第2図は本発明に係る第2の発声練習用音声合成方式の
一実施例を示すブロック図である。第2図において、第
1図に示す実施例と同一の番号である$a戒要素は、第
1図に示す実施例のものと同一の動作をする6発声速度
変換部90は、標準音声ファイルと入力音声ファイルと
から標準音声と入力音声の全体の音韻継続時間長を比べ
、m準音声と入力音声の音韻継続時間長が著しく違う場
合には、標準音声と入力音声の音韻継続時間長の差を計
算する。この差について標?#音声の時間長の伸縮を残
差信号上で行う、この#縮にはピッチ制御法を用いる。
一実施例を示すブロック図である。第2図において、第
1図に示す実施例と同一の番号である$a戒要素は、第
1図に示す実施例のものと同一の動作をする6発声速度
変換部90は、標準音声ファイルと入力音声ファイルと
から標準音声と入力音声の全体の音韻継続時間長を比べ
、m準音声と入力音声の音韻継続時間長が著しく違う場
合には、標準音声と入力音声の音韻継続時間長の差を計
算する。この差について標?#音声の時間長の伸縮を残
差信号上で行う、この#縮にはピッチ制御法を用いる。
この方法については岩田氏の論文“残差flFJ fR
による音声合成システムの検討”(1988年10月
日本音響学会講演論文集3−2−7 p、183〜1
84ン (文y’y>に詳しく述べられている。
による音声合成システムの検討”(1988年10月
日本音響学会講演論文集3−2−7 p、183〜1
84ン (文y’y>に詳しく述べられている。
発声速度変換の別の方法としては、発声速度変換部90
において、入力音声と標準音声の分析結果である入力音
声ファイルと標準音声ファイルとから、最も強く発声す
るストレスのある母音の継続時間長と他の母音の継続時
間長との比を入力音声と標準音声のそれぞれについて求
める。さらに、標準音声における最も強く発声するスト
レスのある母音のm続開間長を、入力音声のそれに対応
する母音の部分の継続時間長に変換する0次に、標準音
声の母音同志の比を同じにするように、他の母音につい
ても継続時間長の伸縮を行う、このようにして、標準音
声の継続時間長を求め直す。
において、入力音声と標準音声の分析結果である入力音
声ファイルと標準音声ファイルとから、最も強く発声す
るストレスのある母音の継続時間長と他の母音の継続時
間長との比を入力音声と標準音声のそれぞれについて求
める。さらに、標準音声における最も強く発声するスト
レスのある母音のm続開間長を、入力音声のそれに対応
する母音の部分の継続時間長に変換する0次に、標準音
声の母音同志の比を同じにするように、他の母音につい
ても継続時間長の伸縮を行う、このようにして、標準音
声の継続時間長を求め直す。
第3図は本発明に係る第3の発声練習用音声合成方式の
一実施例を示すブロック図である。第3図において、第
1図および第2図に示す実施例と同一の番号である構成
要素は、第1図および第2図に示す実施例のものと同一
の動作をする。発声速度照合部100は、入力音声と標
準音声の時間長を比較するもので、入力音声と標準音声
の時間長が著しく異なる場合は、入力音声の時間長に近
い標準音声をデータ保存部20から呼び出し、標準音声
と入力音声の時間長と等しいものに変える。
一実施例を示すブロック図である。第3図において、第
1図および第2図に示す実施例と同一の番号である構成
要素は、第1図および第2図に示す実施例のものと同一
の動作をする。発声速度照合部100は、入力音声と標
準音声の時間長を比較するもので、入力音声と標準音声
の時間長が著しく異なる場合は、入力音声の時間長に近
い標準音声をデータ保存部20から呼び出し、標準音声
と入力音声の時間長と等しいものに変える。
第4図は本発明に係る第4の発声練習用音声合成方式の
一実施例を示すブロック図である。第4図において、第
1図、第2図および第3図に示す実施例と同一の番号で
ある構成要素は、第1図、第2図および第3図に示す実
施例のものと同一の動作をする。距離計算部120は、
教師音声と入力音声の韻律パラメータ同志の距離を求め
、その結果を、予め決めておいた評価数値対応表と照合
して評価値(例えば0〜100点)に変換する。
一実施例を示すブロック図である。第4図において、第
1図、第2図および第3図に示す実施例と同一の番号で
ある構成要素は、第1図、第2図および第3図に示す実
施例のものと同一の動作をする。距離計算部120は、
教師音声と入力音声の韻律パラメータ同志の距離を求め
、その結果を、予め決めておいた評価数値対応表と照合
して評価値(例えば0〜100点)に変換する。
画面出力部110は、距離計算部120で求めた評価値
および教師音声と入力音声の韻律パラメータの時間的変
化を表示する。評価値を表示する場合は、数値またはグ
ラフ若しくは図等を用いて視覚的に分かりやすい表示を
する。また、発声方法をアドバイスする欄を設け、例え
ば継続時間長を練習している場合は、 aの音をもっと
短く発音して下さい”1の音を少し長めに光音して下さ
い”等を表示し、ピッチの場合は“aの音は高めに発音
して下さい” uの音は低めに発音して下さい”等
を表示する0表示用の文章の中で共通の部分は、あらか
じめ画面出力部110に用意しておき、音素の部分に必
要な音素芯を挿入し、画面に表示する。従って過去の評
価値と現在の評価値を対応させることにより、練習者に
上達具合いを把握させることができる。
および教師音声と入力音声の韻律パラメータの時間的変
化を表示する。評価値を表示する場合は、数値またはグ
ラフ若しくは図等を用いて視覚的に分かりやすい表示を
する。また、発声方法をアドバイスする欄を設け、例え
ば継続時間長を練習している場合は、 aの音をもっと
短く発音して下さい”1の音を少し長めに光音して下さ
い”等を表示し、ピッチの場合は“aの音は高めに発音
して下さい” uの音は低めに発音して下さい”等
を表示する0表示用の文章の中で共通の部分は、あらか
じめ画面出力部110に用意しておき、音素の部分に必
要な音素芯を挿入し、画面に表示する。従って過去の評
価値と現在の評価値を対応させることにより、練習者に
上達具合いを把握させることができる。
評価値保存部140は、過去の評価値を保存しておき、
過去の練習結果として、画面に表示できるようにする1
画面出力端子20を介してこれら評価結果を画面に表示
する。
過去の練習結果として、画面に表示できるようにする1
画面出力端子20を介してこれら評価結果を画面に表示
する。
〈発明の効果)
以上に詳しく説明したように、本発明によれば、発声練
習を行う際に用いる教師音声の声質は練習者の声質に近
いものであり、その発声速度は練習者の音声とほぼ同じ
であるから、li習冒者とって分かりやすく個々の練習
者に適した教師音声を生成する発声練習用音声合成方式
を提供できる。また、本発明の発声練習用音声合成方式
の画面表示では、教師音声と入力音声の両方に音素境界
を表示することによって、どの音に問題があるか分かり
やすくなり、その音を練習する時の方法等も表示するか
ら、練習者が上達する上で大きな効果がある。
習を行う際に用いる教師音声の声質は練習者の声質に近
いものであり、その発声速度は練習者の音声とほぼ同じ
であるから、li習冒者とって分かりやすく個々の練習
者に適した教師音声を生成する発声練習用音声合成方式
を提供できる。また、本発明の発声練習用音声合成方式
の画面表示では、教師音声と入力音声の両方に音素境界
を表示することによって、どの音に問題があるか分かり
やすくなり、その音を練習する時の方法等も表示するか
ら、練習者が上達する上で大きな効果がある。
る。
1・・・入力端子、3・・・入力端子、5・・・出力端
子、6・・・入力端子、1o・・・データ保存部、2o
・・・画面出力端子、30・・・標準音声ピッチ抽出部
、4o・・・入力音声検出部、50・・・データ照合部
、6o・・・分析部、70・・・ピッチ抽出・分析部、
8o・・・合咬部。
子、6・・・入力端子、1o・・・データ保存部、2o
・・・画面出力端子、30・・・標準音声ピッチ抽出部
、4o・・・入力音声検出部、50・・・データ照合部
、6o・・・分析部、70・・・ピッチ抽出・分析部、
8o・・・合咬部。
90・・・発声速度変換部、100・・・発声速度照合
部、110・・・画面出力部、120・・・距離計算部
、130・・・合成波形保存部、140・・・評価値保
存部、150・・・画面表示部。
部、110・・・画面出力部、120・・・距離計算部
、130・・・合成波形保存部、140・・・評価値保
存部、150・・・画面表示部。
Claims (4)
- (1)練習者が発声した音声を入力音声として入力し、
該入力音声を分析して基本周波数の時間的変化や音韻継
続時間長等の韻律情報を抽出する手段と、 予め分析してある標準話者の音声である標準音声の韻律
情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記教師音声と前記入力音声から抽出した前記韻律情報
とを画面に出力し、前記出力において前記入力音声の音
素名と音素境界とを前記標準音声の対応する位置にそれ
ぞれ表示する手段と、を有することを特徴とする発声練
習用音声合成方式。 - (2)練習者が発声した音声を入力音声として入力し、
該入力音声を分析して基本周波数の時間的変化や音韻継
続時間長等の韻律情報を抽出する手段と、 予め分析してある標準話者の音声である標準音声の韻律
情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 前記入力音声の分析結果から得た音韻継続時間長と前記
標準音声の分析結果から得た音韻継続時間長を比較して
差異を計算し、音韻継続時間長を前記差異だけ伸縮した
標準音声を前記教師音声出力手段において用いる標準音
声として出力する手段、または、前記入力音声と前記標
準音声のそれぞれについてストレスのある母音の継続時
間長と他の母音の継続時間長との関係を求め、前記標準
音声の前記ストレスのある母音の継続時間長を前記入力
音声の母音の継続時間長に変換し、その他の母音につい
ては前記標準音声における各母音間の継続時間長を前記
入力音声における各母音間の継続時間長に変換し、該母
音間の継続時間長を変換した前記標準音声を前記教師音
声出力手段において用いる標準音声として出力する手段
と、を有することを特徴とする発声練習用音声合成方式
。 - (3)練習者が発声した音声を入力音声として入力し、
該入力音声を分析して基本周波数の時間的変化や音韻継
続時間長等の韻律情報を抽出する手段と、 予め分析してある標準話者の音声である標準音声の韻律
情報を記録する手段と、 前記入力音声と前記標準音声との音素間の対応関係をそ
れぞれの韻律情報から求め、前記入力音声の韻律情報を
予め分析してある前記標準音声の韻律情報に変換して該
入力音声と前記標準音声とを合成し、該合成した音声を
教師音声として出力する手段と、 予め継続時間長の異なる複数の音声を記録しておき、前
記入力音声と前記標準音声の継続時間長を比較して該継
続時間長が異なる場合には前記複数の音声の中から継続
時間長が前記入力音声に最も近い音声を選択して該音声
を前記教師音声出力手段に標準音声として出力する手段
と、 を有することを特徴とする発声練習用音声合成方式。 - (4)練習者が発声した音声を入力音声として入力し、
該入力音声を分析して基本周波数の時間的変化や音韻継
続時間長等の韻律情報を抽出する手段と、 予め分析してある標準話者の音声である標準音声の韻律
情報を記録する手段と、 前記入力音声と前記標準音声の音素間の対応関係をそれ
ぞれの韻律情報から求め、前記入力音声の韻律情報を予
め分析してある前記標準音声の韻律情報に変換して該入
力音声と前記標準音声とを合成し、該合成した音声を教
師音声として出力する手段と、 前記入力音声と前記教師音声との韻律情報同志の距離を
計算し、該距離を学習到達度に変換して画面に出力する
手段と、 を有することを特徴とする発声練習用音声合成方式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2072888A JP2844817B2 (ja) | 1990-03-22 | 1990-03-22 | 発声練習用音声合成方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2072888A JP2844817B2 (ja) | 1990-03-22 | 1990-03-22 | 発声練習用音声合成方式 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH03273280A true JPH03273280A (ja) | 1991-12-04 |
| JP2844817B2 JP2844817B2 (ja) | 1999-01-13 |
Family
ID=13502336
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2072888A Expired - Lifetime JP2844817B2 (ja) | 1990-03-22 | 1990-03-22 | 発声練習用音声合成方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP2844817B2 (ja) |
Cited By (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH1063287A (ja) * | 1996-08-21 | 1998-03-06 | Brother Ind Ltd | 発音訓練装置 |
| WO2002031799A1 (en) * | 2000-08-04 | 2002-04-18 | Sylvan Learning Systems, Inc. | Automated testing and electronic instructional delivery and student management system |
| US6666687B2 (en) | 1996-09-25 | 2003-12-23 | Sylvan Learning Systems, Inc. | Method for instructing a student using an automatically generated student profile |
| JP2006178214A (ja) * | 2004-12-22 | 2006-07-06 | Yamaha Corp | 語学学習装置 |
| JP2006178334A (ja) * | 2004-12-24 | 2006-07-06 | Yamaha Corp | 語学学習システム |
| JP2008513840A (ja) * | 2004-09-16 | 2008-05-01 | インフォチュア インコーポレイテッド | 状況のフィードバックを使用する学習システム及び方法 |
| US9672809B2 (en) | 2013-06-17 | 2017-06-06 | Fujitsu Limited | Speech processing device and method |
| JP2022025493A (ja) * | 2020-07-29 | 2022-02-10 | 株式会社オトデザイナーズ | 発話トレーニングシステム |
-
1990
- 1990-03-22 JP JP2072888A patent/JP2844817B2/ja not_active Expired - Lifetime
Cited By (9)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH1063287A (ja) * | 1996-08-21 | 1998-03-06 | Brother Ind Ltd | 発音訓練装置 |
| US6666687B2 (en) | 1996-09-25 | 2003-12-23 | Sylvan Learning Systems, Inc. | Method for instructing a student using an automatically generated student profile |
| US6795684B2 (en) | 1996-09-25 | 2004-09-21 | Sylvan Learning Systems, Inc. | System and method for recording teacher notes during a learning session |
| WO2002031799A1 (en) * | 2000-08-04 | 2002-04-18 | Sylvan Learning Systems, Inc. | Automated testing and electronic instructional delivery and student management system |
| JP2008513840A (ja) * | 2004-09-16 | 2008-05-01 | インフォチュア インコーポレイテッド | 状況のフィードバックを使用する学習システム及び方法 |
| JP2006178214A (ja) * | 2004-12-22 | 2006-07-06 | Yamaha Corp | 語学学習装置 |
| JP2006178334A (ja) * | 2004-12-24 | 2006-07-06 | Yamaha Corp | 語学学習システム |
| US9672809B2 (en) | 2013-06-17 | 2017-06-06 | Fujitsu Limited | Speech processing device and method |
| JP2022025493A (ja) * | 2020-07-29 | 2022-02-10 | 株式会社オトデザイナーズ | 発話トレーニングシステム |
Also Published As
| Publication number | Publication date |
|---|---|
| JP2844817B2 (ja) | 1999-01-13 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5940797A (en) | Speech synthesis method utilizing auxiliary information, medium recorded thereon the method and apparatus utilizing the method | |
| Iida et al. | A corpus-based speech synthesis system with emotion | |
| Strange et al. | Acoustic and perceptual similarity of North German and American English vowels | |
| US6865533B2 (en) | Text to speech | |
| US7890330B2 (en) | Voice recording tool for creating database used in text to speech synthesis system | |
| Cambier-Langeveld | The domain of final lengthening in the production of Dutch | |
| RU2690863C1 (ru) | Система и способ компьютеризированного обучения музыкальному языку | |
| WO2004063902A2 (en) | Speech training method with color instruction | |
| Felps et al. | Foreign accent conversion through concatenative synthesis in the articulatory domain | |
| JPH065451B2 (ja) | 発音訓練装置 | |
| KR20150076126A (ko) | 동적 발음 지원 시각화 수단을 포함하는 활용 발음 학습 지원 시스템 및 그 시스템의 발음 학습 지원 방법 | |
| Grønnum | A Danish phonetically annotated spontaneous speech corpus (DanPASS) | |
| JP2003186379A (ja) | 音声可視化処理のためのプログラム、音声可視化図形表示と音声及び動画像の再生処理のためのプログラム、及び訓練結果表示のためのプログラム、並びに発声発話訓練装置及びコンピュータ・システム | |
| Peabody et al. | Towards automatic tone correction in non-native mandarin | |
| JP2844817B2 (ja) | 発声練習用音声合成方式 | |
| JP2003162291A (ja) | 語学学習装置 | |
| JP2001249679A (ja) | 外国語自律学習システム | |
| JP2806364B2 (ja) | 発声訓練装置 | |
| JP2002525663A (ja) | ディジタル音声処理装置及び方法 | |
| JPS616732A (ja) | 発声訓練装置 | |
| Rashad et al. | Diphone speech synthesis system for Arabic using MARY TTS | |
| JPH01154189A (ja) | 発音訓練装置 | |
| KR20150075502A (ko) | 발음 학습 지원 시스템 및 그 시스템의 발음 학습 지원 방법 | |
| JPS60201376A (ja) | 発声訓練機 | |
| Tatham et al. | SPRUCE: Speech Synthesis |