JPH0836397A - 音声合成装置 - Google Patents
音声合成装置Info
- Publication number
- JPH0836397A JPH0836397A JP6169280A JP16928094A JPH0836397A JP H0836397 A JPH0836397 A JP H0836397A JP 6169280 A JP6169280 A JP 6169280A JP 16928094 A JP16928094 A JP 16928094A JP H0836397 A JPH0836397 A JP H0836397A
- Authority
- JP
- Japan
- Prior art keywords
- unit
- speech
- natural
- voice
- target
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】
【目的】 高品質で必要メモリが少なく、且つ色々な声
質などに対応できる音声合成装置の提供。 【構成】 自然音声素片格納手段と、自然音声素片セッ
トの各々の素片に対して母音定常部などの音響的特性を
特徴付けるパラメタベクトルを抽出し、その位置情報と
共に格納する特徴パラメタ格納手段とを有し、対象の自
然音声素片に対応する特徴パラメタベクトルをターゲッ
トとし、そのターゲットから所望の音韻までの音声の遷
移を音声合成手段により合成し、自然音声素片に接続す
ることにより、母音に関しては柔軟で様々な音質やイン
トネーションを付与でき、子音に関しては高品質な音声
を提供でき、音声素片の格納は小容量で実現でき、さら
に、素片間の接続が滑らかに行える。
質などに対応できる音声合成装置の提供。 【構成】 自然音声素片格納手段と、自然音声素片セッ
トの各々の素片に対して母音定常部などの音響的特性を
特徴付けるパラメタベクトルを抽出し、その位置情報と
共に格納する特徴パラメタ格納手段とを有し、対象の自
然音声素片に対応する特徴パラメタベクトルをターゲッ
トとし、そのターゲットから所望の音韻までの音声の遷
移を音声合成手段により合成し、自然音声素片に接続す
ることにより、母音に関しては柔軟で様々な音質やイン
トネーションを付与でき、子音に関しては高品質な音声
を提供でき、音声素片の格納は小容量で実現でき、さら
に、素片間の接続が滑らかに行える。
Description
【0001】
【産業上の利用分野】本発明は、音声合成装置に関し、
特に任意の内容を音声に変換する音声合成装置に関す
る。
特に任意の内容を音声に変換する音声合成装置に関す
る。
【0002】
【従来の技術】任意の内容を音声に変換する音声合成方
式には、大きく分けて2種類ある。一つは音声の発声機
構、即ち、声帯や口、喉の動きを理解し、その知識を規
則にして電気回路などを制御する合成方式である。もう
一つの方式は、音声の知識はあまり必要とせず、音声の
素片をたくさん用意して入力に応じて適した素片をつな
ぎあわせる方式である。前者には、例えばホルマント合
成方式とホルマント制御規則の組合せがよく知られてい
る。図6は、このホルマント合成方式とホルマント制御
規則の組合せの構成例である。同図において、ホルマン
ト合成器制御規則格納部9はホルマント合成器を制御す
るための複数の規則を格納する部分、ホルマント合成器
制御用係数生成部8は、前記の制御規則に基づいてホル
マント合成器を制御するための係数を生成する部分、ホ
ルマント合成器10は実際に音声を合成する部分、有声
音源部11は声帯の振動を模擬する部分、直列型ホルマ
ント合成部13はホルマント共振器を直列に接続し、母
音や鼻音などの有声音を合成する部分、無声音源部12
は摩擦音や破裂音などの合成に必要な乱流雑音源、並列
型ホルマント合成部14は共振器が並列に接続され摩擦
音や破裂音などの無声子音部分を合成する。合成部15
は直列型ホルマント合成部13の出力と並列型ホルマン
ト合成部14の出力を合成し合成音を出力する部分であ
る。
式には、大きく分けて2種類ある。一つは音声の発声機
構、即ち、声帯や口、喉の動きを理解し、その知識を規
則にして電気回路などを制御する合成方式である。もう
一つの方式は、音声の知識はあまり必要とせず、音声の
素片をたくさん用意して入力に応じて適した素片をつな
ぎあわせる方式である。前者には、例えばホルマント合
成方式とホルマント制御規則の組合せがよく知られてい
る。図6は、このホルマント合成方式とホルマント制御
規則の組合せの構成例である。同図において、ホルマン
ト合成器制御規則格納部9はホルマント合成器を制御す
るための複数の規則を格納する部分、ホルマント合成器
制御用係数生成部8は、前記の制御規則に基づいてホル
マント合成器を制御するための係数を生成する部分、ホ
ルマント合成器10は実際に音声を合成する部分、有声
音源部11は声帯の振動を模擬する部分、直列型ホルマ
ント合成部13はホルマント共振器を直列に接続し、母
音や鼻音などの有声音を合成する部分、無声音源部12
は摩擦音や破裂音などの合成に必要な乱流雑音源、並列
型ホルマント合成部14は共振器が並列に接続され摩擦
音や破裂音などの無声子音部分を合成する。合成部15
は直列型ホルマント合成部13の出力と並列型ホルマン
ト合成部14の出力を合成し合成音を出力する部分であ
る。
【0003】音声合成に必要な発音記号、アクセント位
置、イントネーションに関する情報などがホルマント合
成器制御用係数生成部8に入力されると、ホルマント合
成器制御用係数生成部8はホルマント合成器制御規則格
納部9から必要な規則を参照し、ホルマント合成器制御
用係数をホルマント合成器10に出力する。ホルマント
合成器10の内部において、以下のように動作する。有
声音源部11は母音などの有声音を合成する時に人間の
声帯で生じるパルス状の音源波形を模擬する。このパル
ス状の信号は直列型ホルマント合成部13に入力され、
直列型ホルマント合成部13は、複数のホルマント共振
器によって音源波形に母音や鼻音として適切な特徴を与
え、合成部15に出力する。一方、無声音源部12は摩
擦音や破裂音の音源となる雑音状の波形を並列型ホルマ
ント合成部14に送り、並列型ホルマント合成部14で
複数の共振器によりそれぞれの子音に必要な周波数的特
徴を瞬時に形成し、合成部15に出力する。合成部5
は、直列型ホルマント合成部13の母音や鼻音と並列型
ホルマント合成部14の子音を合成し合成音声として出
力する。
置、イントネーションに関する情報などがホルマント合
成器制御用係数生成部8に入力されると、ホルマント合
成器制御用係数生成部8はホルマント合成器制御規則格
納部9から必要な規則を参照し、ホルマント合成器制御
用係数をホルマント合成器10に出力する。ホルマント
合成器10の内部において、以下のように動作する。有
声音源部11は母音などの有声音を合成する時に人間の
声帯で生じるパルス状の音源波形を模擬する。このパル
ス状の信号は直列型ホルマント合成部13に入力され、
直列型ホルマント合成部13は、複数のホルマント共振
器によって音源波形に母音や鼻音として適切な特徴を与
え、合成部15に出力する。一方、無声音源部12は摩
擦音や破裂音の音源となる雑音状の波形を並列型ホルマ
ント合成部14に送り、並列型ホルマント合成部14で
複数の共振器によりそれぞれの子音に必要な周波数的特
徴を瞬時に形成し、合成部15に出力する。合成部5
は、直列型ホルマント合成部13の母音や鼻音と並列型
ホルマント合成部14の子音を合成し合成音声として出
力する。
【0004】この方式の長所は、音をすべて規則で作り
上げるので柔軟性に富み様々な音質やイントネーション
の音声を合成できることである。短所としては、特に子
音などのように発声メカニズムが複雑な音声は合成規則
がまだはっきりしていないのが現状で、自然な音質の子
音生成が難しい点である。
上げるので柔軟性に富み様々な音質やイントネーション
の音声を合成できることである。短所としては、特に子
音などのように発声メカニズムが複雑な音声は合成規則
がまだはっきりしていないのが現状で、自然な音質の子
音生成が難しい点である。
【0005】次に、もう一つの従来例である音声素片を
用いる方式を説明する。図7はこの方式の構成図であ
る。音声素片選択部16は入力である発音記号列やアク
セント情報から合成に必要な音声素片を音声素片データ
ベース格納部17から選択する。この場合、音声素片は
例えば線形予測係数などのような係数に圧縮されて格納
されているか、あるいは、時間波形に簡単な圧縮処理が
なされて格納されている。選択された複数の音声素片は
素片接続合成部18で接続され適切な基本周波数で音声
波形に合成される。
用いる方式を説明する。図7はこの方式の構成図であ
る。音声素片選択部16は入力である発音記号列やアク
セント情報から合成に必要な音声素片を音声素片データ
ベース格納部17から選択する。この場合、音声素片は
例えば線形予測係数などのような係数に圧縮されて格納
されているか、あるいは、時間波形に簡単な圧縮処理が
なされて格納されている。選択された複数の音声素片は
素片接続合成部18で接続され適切な基本周波数で音声
波形に合成される。
【0006】この方式の場合の長所は、音声素片が基本
的にモデルとなる自然音声から切り出されているので素
片間の滑らかな接続が出来れば合成品質は極めて高い。
一方、この方式の短所は音声素片格納に大容量の記憶装
置が必要であるのでコストが高くなる。また、モデル音
声の声質しか合成できず、柔軟性に欠けるという問題が
ある。
的にモデルとなる自然音声から切り出されているので素
片間の滑らかな接続が出来れば合成品質は極めて高い。
一方、この方式の短所は音声素片格納に大容量の記憶装
置が必要であるのでコストが高くなる。また、モデル音
声の声質しか合成できず、柔軟性に欠けるという問題が
ある。
【0007】そこで、前記の2種類の方法の融合方式と
して図8に示す方式を説明する。同図において、有声音
源部11は、声帯の振動を模擬し音源信号を生成する部
分である。直列型ホルマント合成部13は、母音などの
有声音を合成する部分である。音声素片データベース格
納部17は、自然な音声から切り出した子音の音声素片
を格納する部分、音声素片選択部16は必要な音声素片
を選択し取り出す部分、素片接続合成部18は直列型ホ
ルマント合成部13の出力と音声素片選択部16の出力
を合成し、合成音声として出力する部分である。
して図8に示す方式を説明する。同図において、有声音
源部11は、声帯の振動を模擬し音源信号を生成する部
分である。直列型ホルマント合成部13は、母音などの
有声音を合成する部分である。音声素片データベース格
納部17は、自然な音声から切り出した子音の音声素片
を格納する部分、音声素片選択部16は必要な音声素片
を選択し取り出す部分、素片接続合成部18は直列型ホ
ルマント合成部13の出力と音声素片選択部16の出力
を合成し、合成音声として出力する部分である。
【0008】上記のように構成された第3の従来例につ
いて以下にその動作を説明する。有声音源部11は、ホ
ルマント合成器制御用係数の中の基本周波数に関する情
報、音源の振幅情報に関する情報などから所望の音源信
号を生成し、直列型ホルマント合成部13に入力する。
子音区間や無声区間は、音源信号は出力されない。直列
型ホルマント合成部13は、ホルマント合成器制御用係
数の中のホルマント周波数情報、ホルマント共振峰のバ
ンド幅に関する情報、などから直列に並んだ共振器の特
性を決定し、上記の音源信号から母音などの音声信号に
変換する。直列型ホルマント合成部13の出力は素片接
続合成部18に送られる。一方、ホルマント合成器制御
用係数の中の音素に関する情報から音声素片選択部16
は、その音素が音声素片データベース格納部17に存在
するかどうかを確認して、もし存在すればその音声素片
を音声素片データベース格納部17から取り出し、素片
接続合成部18に送る。例えば、合成しようとする音素
が「k」で後続母音が「あ」の場合、音声素片選択部1
6は、音声素片データベース格納部17の中に子音
「k」で「か」から切り出した音声素片があるか検索す
る。素片接続合成部18は、直列ホルマント合成部13
からの母音信号と音声素片選択部16の子音信号を加算
処理や重ねあわせ処理などにより合成する。このように
構成することにより、母音に関してはホルマント合成方
式により柔軟で様々な音質やイントネーションを付与で
き、子音に関しては音声素片を用いた方式によりホルマ
ント合成方式では実現出来ない高品質な音声を提供でき
る。また、音声素片としての格納は持続時間の短い音節
に限るため小容量の記憶装置で実現が可能である。しか
し、ホルマント合成部からの音質と素片が持つ音質には
相当隔たりがあるため、接続部分での不自然さや劣化が
問題となる。
いて以下にその動作を説明する。有声音源部11は、ホ
ルマント合成器制御用係数の中の基本周波数に関する情
報、音源の振幅情報に関する情報などから所望の音源信
号を生成し、直列型ホルマント合成部13に入力する。
子音区間や無声区間は、音源信号は出力されない。直列
型ホルマント合成部13は、ホルマント合成器制御用係
数の中のホルマント周波数情報、ホルマント共振峰のバ
ンド幅に関する情報、などから直列に並んだ共振器の特
性を決定し、上記の音源信号から母音などの音声信号に
変換する。直列型ホルマント合成部13の出力は素片接
続合成部18に送られる。一方、ホルマント合成器制御
用係数の中の音素に関する情報から音声素片選択部16
は、その音素が音声素片データベース格納部17に存在
するかどうかを確認して、もし存在すればその音声素片
を音声素片データベース格納部17から取り出し、素片
接続合成部18に送る。例えば、合成しようとする音素
が「k」で後続母音が「あ」の場合、音声素片選択部1
6は、音声素片データベース格納部17の中に子音
「k」で「か」から切り出した音声素片があるか検索す
る。素片接続合成部18は、直列ホルマント合成部13
からの母音信号と音声素片選択部16の子音信号を加算
処理や重ねあわせ処理などにより合成する。このように
構成することにより、母音に関してはホルマント合成方
式により柔軟で様々な音質やイントネーションを付与で
き、子音に関しては音声素片を用いた方式によりホルマ
ント合成方式では実現出来ない高品質な音声を提供でき
る。また、音声素片としての格納は持続時間の短い音節
に限るため小容量の記憶装置で実現が可能である。しか
し、ホルマント合成部からの音質と素片が持つ音質には
相当隔たりがあるため、接続部分での不自然さや劣化が
問題となる。
【0009】
【発明が解決しようとする課題】上記、従来例で説明し
たように、音をすべて規則で作り上げる方式の場合は、
柔軟性に富み様々な音質やイントネーションの音声を合
成できるが、子音などのように発声メカニズムが複雑な
音声は合成規則がまだはっきりしていないので合成が難
しい。一方、音声素片を用いた方式の場合は、合成品質
は極めて高いが、音声素片格納に大容量の記憶装置が必
要という問題や、モデル音声の声質しか合成できず、柔
軟性に欠けるという問題がある。また、モデル化合成と
素片合成を融合した方式では、合成規則を用いる方式と
素片を用いる方式のそれぞれの長所を有するが、逆に、
接続部分に音質の違いが生じ、大きな音質劣化要因にな
ってしまうという問題点がある。
たように、音をすべて規則で作り上げる方式の場合は、
柔軟性に富み様々な音質やイントネーションの音声を合
成できるが、子音などのように発声メカニズムが複雑な
音声は合成規則がまだはっきりしていないので合成が難
しい。一方、音声素片を用いた方式の場合は、合成品質
は極めて高いが、音声素片格納に大容量の記憶装置が必
要という問題や、モデル音声の声質しか合成できず、柔
軟性に欠けるという問題がある。また、モデル化合成と
素片合成を融合した方式では、合成規則を用いる方式と
素片を用いる方式のそれぞれの長所を有するが、逆に、
接続部分に音質の違いが生じ、大きな音質劣化要因にな
ってしまうという問題点がある。
【0010】本発明の目的は、上記従来の音声合成装置
の課題に鑑み、(1)音質の柔軟性に富み、(2)記憶
容量も音声素片を用いる従来方式に比べて大幅に削減で
き、かつ、(3)音声素片の接続操作による音質の違い
が目立たず、合成品質の高い音声合成装置の提供を目的
とするものである。
の課題に鑑み、(1)音質の柔軟性に富み、(2)記憶
容量も音声素片を用いる従来方式に比べて大幅に削減で
き、かつ、(3)音声素片の接続操作による音質の違い
が目立たず、合成品質の高い音声合成装置の提供を目的
とするものである。
【0011】
【課題を解決するための手段】本発明の音声合成装置
は、自然音声素片セットを格納する自然音声素片格納手
段と、該自然音声素片格納手段に格納されている該自然
音声素片セットの各々の素片に対して単一あるいは複数
の位置から該位置の音響的特性を特徴付けるパラメタベ
クトルを抽出し、抽出した位置の情報と共に該特徴パラ
メタベクトルを格納する特徴パラメタ格納手段と、該自
然音声素片格納手段に格納されている該自然音声素片セ
ットのうち、ある自然音声素片に対応する該特徴パラメ
タベクトルのうちある一つをターゲットとし、該ターゲ
ットから該自然音声素片に接続せしめる所望の音韻まで
の音声の遷移を音声合成せしめる音声合成手段と、該自
然音声素片と該合成音声素片とを該ターゲットの位置近
傍において接続する音声素片接続手段とを備えており、
これにより上記目的が達成される。
は、自然音声素片セットを格納する自然音声素片格納手
段と、該自然音声素片格納手段に格納されている該自然
音声素片セットの各々の素片に対して単一あるいは複数
の位置から該位置の音響的特性を特徴付けるパラメタベ
クトルを抽出し、抽出した位置の情報と共に該特徴パラ
メタベクトルを格納する特徴パラメタ格納手段と、該自
然音声素片格納手段に格納されている該自然音声素片セ
ットのうち、ある自然音声素片に対応する該特徴パラメ
タベクトルのうちある一つをターゲットとし、該ターゲ
ットから該自然音声素片に接続せしめる所望の音韻まで
の音声の遷移を音声合成せしめる音声合成手段と、該自
然音声素片と該合成音声素片とを該ターゲットの位置近
傍において接続する音声素片接続手段とを備えており、
これにより上記目的が達成される。
【0012】前記自然音声素片セットは単音節の子音開
始から少なくとも子音母音間の過渡部あるいは母音定常
部までの素片のセットであり、前記特徴パラメタベクト
ルは少なくとも該単音節素片の子音開始位置あるいは子
音母音間の過渡部あるいは母音定常部から抽出されたベ
クトルであってもよい。
始から少なくとも子音母音間の過渡部あるいは母音定常
部までの素片のセットであり、前記特徴パラメタベクト
ルは少なくとも該単音節素片の子音開始位置あるいは子
音母音間の過渡部あるいは母音定常部から抽出されたベ
クトルであってもよい。
【0013】前記特徴パラメタ格納手段が格納する特徴
パラメタベクトルは少なくとも各ホルマント周波数、各
ホルマントバンド幅、音源の特性を有していてもよい。
パラメタベクトルは少なくとも各ホルマント周波数、各
ホルマントバンド幅、音源の特性を有していてもよい。
【0014】前記自然音声格納手段は自然音声から切り
出した複数の単音節原音素片の子音開始位置から子音と
その後続母音の渡り位置までを切りだし格納するもので
あり、前記特徴パラメタ格納手段は、該自然音声素片格
納手段に格納されている各単音節素片の子音から母音へ
の渡り位置から抽出した音響的特性を特徴付けるパラメ
タベクトルをその抽出した位置の情報と共に第1ターゲ
ットとして格納し、かつ該単音節素片に対応する該単音
節原音素片の母音定常部から抽出した音響的特性を特徴
付けるパラメタベクトルをその抽出した位置の情報と共
に第2ターゲットとして格納するものであり、前記音声
合成手段は、該第1ターゲットと該第2ターゲット間を
補間し、かつ該第2ターゲットから該単音節素片に接続
せしめる所望の音韻までの音声の遷移を音声合成するも
のであり、前記音声素片接続手段は、該単音節素片と該
音声合成手段が合成する音声素片とを該第1ターゲット
の位置近傍において接続するという構成であってよい。
出した複数の単音節原音素片の子音開始位置から子音と
その後続母音の渡り位置までを切りだし格納するもので
あり、前記特徴パラメタ格納手段は、該自然音声素片格
納手段に格納されている各単音節素片の子音から母音へ
の渡り位置から抽出した音響的特性を特徴付けるパラメ
タベクトルをその抽出した位置の情報と共に第1ターゲ
ットとして格納し、かつ該単音節素片に対応する該単音
節原音素片の母音定常部から抽出した音響的特性を特徴
付けるパラメタベクトルをその抽出した位置の情報と共
に第2ターゲットとして格納するものであり、前記音声
合成手段は、該第1ターゲットと該第2ターゲット間を
補間し、かつ該第2ターゲットから該単音節素片に接続
せしめる所望の音韻までの音声の遷移を音声合成するも
のであり、前記音声素片接続手段は、該単音節素片と該
音声合成手段が合成する音声素片とを該第1ターゲット
の位置近傍において接続するという構成であってよい。
【0015】
【実施例】以下、本発明の実施例について図面を参照し
て説明する。
て説明する。
【0016】(第1の実施例)図1は本発明の一実施例
における音声合成装置の構成を示すものである。同図に
おいて、合成制御部1は各部にタイミング信号や基本周
波数などの制御情報を送出する部分、自然音声素片格納
部2は自然音声から切りだした素片セットを正規化や圧
縮化して格納する部分であり、本実施例では単音節素片
セットで、子音開始部分から母音定常部までを有する。
特徴パラメタ格納部3は自然音声素片セットの各々の素
片に対して単一あるいは複数の位置から音響的特性を特
徴付けるパラメタベクトルを抽出し、抽出した位置の情
報と共に該特徴パラメタベクトルを格納する部分であ
り、本実施例では、各単音節素片の母音定常部のホルマ
ント周波数、ホルマントバンド幅、さらに音源特性とし
てスペクトルの平均的な傾斜をパラメタベクトルとす
る。ホルマント合成規則格納部4は、ある音素環境にお
ける適当なホルマント周波数やバンド幅などを生成する
部分、有声音源部5は、声帯の振動を模擬し音源信号を
生成する部分である。ホルマント合成部6は、母音など
の有声音の周波数的特徴を複数の共振器で模擬し合成音
声を生成する部分である。素片接続部7は、自然音声素
片とホルマント合成音声を滑らかに接続する部分であ
る。
における音声合成装置の構成を示すものである。同図に
おいて、合成制御部1は各部にタイミング信号や基本周
波数などの制御情報を送出する部分、自然音声素片格納
部2は自然音声から切りだした素片セットを正規化や圧
縮化して格納する部分であり、本実施例では単音節素片
セットで、子音開始部分から母音定常部までを有する。
特徴パラメタ格納部3は自然音声素片セットの各々の素
片に対して単一あるいは複数の位置から音響的特性を特
徴付けるパラメタベクトルを抽出し、抽出した位置の情
報と共に該特徴パラメタベクトルを格納する部分であ
り、本実施例では、各単音節素片の母音定常部のホルマ
ント周波数、ホルマントバンド幅、さらに音源特性とし
てスペクトルの平均的な傾斜をパラメタベクトルとす
る。ホルマント合成規則格納部4は、ある音素環境にお
ける適当なホルマント周波数やバンド幅などを生成する
部分、有声音源部5は、声帯の振動を模擬し音源信号を
生成する部分である。ホルマント合成部6は、母音など
の有声音の周波数的特徴を複数の共振器で模擬し合成音
声を生成する部分である。素片接続部7は、自然音声素
片とホルマント合成音声を滑らかに接続する部分であ
る。
【0017】上記のように構成された本実施例の音声合
成装置について以下にその動作を説明する。
成装置について以下にその動作を説明する。
【0018】「so ra」という言葉を例にして合成
動作を説明する。先ず、合成制御部1は、自然音声素片
格納部2から音節「so」を選択し、同時に特徴パラメ
タ格納部3から音節「so」の母音「o」の定常部に対
応するパラメタベクトルを選択する。このパラメタベク
トルの中でスペクトルの傾きに関する情報は、有声音源
部5に送られて音節「so」の母音「o」に近いスペク
トル傾斜の音源信号が生成される。さらに、パラメタベ
クトル中のホルマント周波数、バンド幅に関する情報は
ホルマント合成部6に送られ、ターゲット情報として格
納される。次に、合成制御部1は、「s−o−r」とい
う環境下での母音「o」の振る舞いを記述した規則をホ
ルマント合成規則格納部4から選択し、この規則はホル
マント合成部6に送られる。ホルマント合成部6は、先
ほどのターゲットのホルマント周波数、バンド幅の値を
開始値とし、合成規則が示す子音「r」までの遷移を合
成フィルタの係数を変化させながら音声合成する。次
に、接続部7が自然音声素片の「so」と合成音声の
「o」をパラメタベクトルの位置情報の地点で接続す
る。接続方法としては、例えば、図2に示すようにピッ
チ同期窓かけ重ね合わせ方法がある。このようにして自
然音声素片の「so」と合成音声の「o」が滑らかに接
続でるので、本実施例の音声合成装置の出力音声の自然
性、明瞭性が改善できる。図3は、接続点で自然音声素
片のスペクトルにホルマント型合成音声を整合させる様
子を示したものである。このように、パラメタベクトル
を適切に与えるとホルマント型合成音声は自然音声にか
なり良い一致を示す。以下、同様にして、合成制御部1
が「ra」を選択し、ホルマント型合成部が「a」を合
成して、全体の合成音声ができあがる。図4は、合成音
声と自然音声素片を接続する様子である。
動作を説明する。先ず、合成制御部1は、自然音声素片
格納部2から音節「so」を選択し、同時に特徴パラメ
タ格納部3から音節「so」の母音「o」の定常部に対
応するパラメタベクトルを選択する。このパラメタベク
トルの中でスペクトルの傾きに関する情報は、有声音源
部5に送られて音節「so」の母音「o」に近いスペク
トル傾斜の音源信号が生成される。さらに、パラメタベ
クトル中のホルマント周波数、バンド幅に関する情報は
ホルマント合成部6に送られ、ターゲット情報として格
納される。次に、合成制御部1は、「s−o−r」とい
う環境下での母音「o」の振る舞いを記述した規則をホ
ルマント合成規則格納部4から選択し、この規則はホル
マント合成部6に送られる。ホルマント合成部6は、先
ほどのターゲットのホルマント周波数、バンド幅の値を
開始値とし、合成規則が示す子音「r」までの遷移を合
成フィルタの係数を変化させながら音声合成する。次
に、接続部7が自然音声素片の「so」と合成音声の
「o」をパラメタベクトルの位置情報の地点で接続す
る。接続方法としては、例えば、図2に示すようにピッ
チ同期窓かけ重ね合わせ方法がある。このようにして自
然音声素片の「so」と合成音声の「o」が滑らかに接
続でるので、本実施例の音声合成装置の出力音声の自然
性、明瞭性が改善できる。図3は、接続点で自然音声素
片のスペクトルにホルマント型合成音声を整合させる様
子を示したものである。このように、パラメタベクトル
を適切に与えるとホルマント型合成音声は自然音声にか
なり良い一致を示す。以下、同様にして、合成制御部1
が「ra」を選択し、ホルマント型合成部が「a」を合
成して、全体の合成音声ができあがる。図4は、合成音
声と自然音声素片を接続する様子である。
【0019】上述したように、本発明の第1の実施例の
音声合成装置は、特徴パラメタベクトルを単音節音声の
母音定常部から得ているが、特徴ベクトルとして各音節
の子音開始位置での特徴ベクトルを持ち、ホルマント合
成部6が、ある母音から次の音節の特徴ベクトルをター
ゲットとして合成を行うことも当然可能であり、音節の
種類によっては、音質向上に大きな項かが得られる。
音声合成装置は、特徴パラメタベクトルを単音節音声の
母音定常部から得ているが、特徴ベクトルとして各音節
の子音開始位置での特徴ベクトルを持ち、ホルマント合
成部6が、ある母音から次の音節の特徴ベクトルをター
ゲットとして合成を行うことも当然可能であり、音節の
種類によっては、音質向上に大きな項かが得られる。
【0020】(第2の実施例)次に、図1および図5を
参照しながら本発明の第2の実施例の音声合成装置を説
明する。図1において、自然音声素片格納部2は自然音
声から切り出した複数の単音節原音素片の子音開始位置
から子音とその後続母音の渡り位置までを切りだし格納
するものであり、特徴パラメタ格納部3は、自然音声素
片格納部1に格納されている各単音節素片の子音から母
音への渡り位置から抽出した音響的特性を特徴付けるパ
ラメタベクトルをその抽出した位置の情報と共に第1タ
ーゲットとして格納し、かつ単音節素片に対応する単音
節原音素片の母音定常部から抽出した音響的特性を特徴
付けるパラメタベクトルをその抽出した位置の情報と共
に第2ターゲットとして格納するものとする。図5はこ
の様子を示したものである。
参照しながら本発明の第2の実施例の音声合成装置を説
明する。図1において、自然音声素片格納部2は自然音
声から切り出した複数の単音節原音素片の子音開始位置
から子音とその後続母音の渡り位置までを切りだし格納
するものであり、特徴パラメタ格納部3は、自然音声素
片格納部1に格納されている各単音節素片の子音から母
音への渡り位置から抽出した音響的特性を特徴付けるパ
ラメタベクトルをその抽出した位置の情報と共に第1タ
ーゲットとして格納し、かつ単音節素片に対応する単音
節原音素片の母音定常部から抽出した音響的特性を特徴
付けるパラメタベクトルをその抽出した位置の情報と共
に第2ターゲットとして格納するものとする。図5はこ
の様子を示したものである。
【0021】第1の実施例と同様に、「so ra」と
いう言葉を例にして合成動作を説明する。先ず、合成制
御部1は、自然音声素片格納部2から音節「so」を選
択し、同時に特徴パラメタ格納部3から音節「so」の
子音・母音間渡り部分と母音「o」の定常部に対応する
2つのパラメタベクトルをそれぞれ第1ターゲット、第
2ターゲットとして選択する。このそれぞれのパラメタ
ベクトルの成分でスペクトルの傾きに関する情報は、有
声音源部5に送られる。また、それぞれのパラメタベク
トル中のホルマント周波数、バンド幅に関する情報はホ
ルマント型音声合成部6に送られ、それぞれ第1ターゲ
ットおよび第2ターゲット情報として格納される。次
に、合成制御部1は、「s−o−r」という環境下での
母音「o」の振る舞いを記述した規則をホルマント合成
規則格納部4から選択し、この規則はホルマント合成部
6に送られる。ホルマント合成部6は、先ほどの第1タ
ーゲットのホルマント周波数、バンド幅の値を開始値と
し、第2ターゲットをそれぞれのパラメタの通過点とし
て、合成規則が示す子音「r」までの遷移を合成フィル
タの係数を変化させながら音声合成する。次に、接続部
7が自然音声素片の「so」と合成音声の「o」を第1
ターゲットの位置であるs−o間遷移部分で接続する。
図5はこの合成操作および接続操作をまとめたものであ
る。このように構成することにより、自然音声素片格納
部2に格納される音節の長さは、子音−母音わたり部分
まででよく、合成に必要な素片セットの記憶容量を大幅
に削減できる。さらに、それぞれの素片の母音定常部を
第2ターゲットにより的確にに再現出来るので、素片の
母音定常部欠落による音質劣化を防ぐことができる。同
様にして、合成制御部1が「ra」を選択し、ホルマン
ト合成部が「a」を合成して、全体の合成音声ができあ
がる。
いう言葉を例にして合成動作を説明する。先ず、合成制
御部1は、自然音声素片格納部2から音節「so」を選
択し、同時に特徴パラメタ格納部3から音節「so」の
子音・母音間渡り部分と母音「o」の定常部に対応する
2つのパラメタベクトルをそれぞれ第1ターゲット、第
2ターゲットとして選択する。このそれぞれのパラメタ
ベクトルの成分でスペクトルの傾きに関する情報は、有
声音源部5に送られる。また、それぞれのパラメタベク
トル中のホルマント周波数、バンド幅に関する情報はホ
ルマント型音声合成部6に送られ、それぞれ第1ターゲ
ットおよび第2ターゲット情報として格納される。次
に、合成制御部1は、「s−o−r」という環境下での
母音「o」の振る舞いを記述した規則をホルマント合成
規則格納部4から選択し、この規則はホルマント合成部
6に送られる。ホルマント合成部6は、先ほどの第1タ
ーゲットのホルマント周波数、バンド幅の値を開始値と
し、第2ターゲットをそれぞれのパラメタの通過点とし
て、合成規則が示す子音「r」までの遷移を合成フィル
タの係数を変化させながら音声合成する。次に、接続部
7が自然音声素片の「so」と合成音声の「o」を第1
ターゲットの位置であるs−o間遷移部分で接続する。
図5はこの合成操作および接続操作をまとめたものであ
る。このように構成することにより、自然音声素片格納
部2に格納される音節の長さは、子音−母音わたり部分
まででよく、合成に必要な素片セットの記憶容量を大幅
に削減できる。さらに、それぞれの素片の母音定常部を
第2ターゲットにより的確にに再現出来るので、素片の
母音定常部欠落による音質劣化を防ぐことができる。同
様にして、合成制御部1が「ra」を選択し、ホルマン
ト合成部が「a」を合成して、全体の合成音声ができあ
がる。
【0022】このように構成することにより、母音に関
してはホルマント合成方式により柔軟で様々な音質やイ
ントネーションを付与でき、子音に関しては音声素片を
用いた方式によりホルマント合成方式では実現出来ない
高品質な音声を提供できる。音声素片としての格納は持
続時間の短い子音に限るため小容量の記憶装置で実現が
可能である。
してはホルマント合成方式により柔軟で様々な音質やイ
ントネーションを付与でき、子音に関しては音声素片を
用いた方式によりホルマント合成方式では実現出来ない
高品質な音声を提供できる。音声素片としての格納は持
続時間の短い子音に限るため小容量の記憶装置で実現が
可能である。
【0023】
【発明の効果】以上のように本発明によれば、母音性信
号は直列型ホルマント合成方式により柔軟で様々な音質
やイントネーションを付与でき、子音性信号は音声素片
を用いた方式によりホルマント合成方式では実現出来な
い高品質な子音を提供できるので、それらを組み合わせ
た合成音は高品質で且つ色々な声質に対応できる。ま
た、従来の音声素片を用いた方式に対して、本方式の場
合、音声素片としての格納が持続時間の短い音節の子音
開始から渡り部分まででよいため小容量の記憶装置で実
現が可能である。
号は直列型ホルマント合成方式により柔軟で様々な音質
やイントネーションを付与でき、子音性信号は音声素片
を用いた方式によりホルマント合成方式では実現出来な
い高品質な子音を提供できるので、それらを組み合わせ
た合成音は高品質で且つ色々な声質に対応できる。ま
た、従来の音声素片を用いた方式に対して、本方式の場
合、音声素片としての格納が持続時間の短い音節の子音
開始から渡り部分まででよいため小容量の記憶装置で実
現が可能である。
【0024】さらに、素片の接続点で、音響的特徴を整
合させるので、接続部分の音質の違いによる劣化を大幅
に改善できる。
合させるので、接続部分の音質の違いによる劣化を大幅
に改善できる。
【図1】本発明第1および第2の実施例における音声合
成装置のブロック図
成装置のブロック図
【図2】自然音声素片「so」と合成母音「o」の接続
の様子を示す図
の様子を示す図
【図3】自然音声素片と合成音声との整合の様子を示す
図
図
【図4】自然音声素片と合成音声素片とで単語「so
ra」が合成される様子を示す図
ra」が合成される様子を示す図
【図5】本発明第2の実施例における自然音声素片と合
成音声素片の接続方法を示す図
成音声素片の接続方法を示す図
【図6】従来のホルマント合成装置の構成図
【図7】従来の音声素片を用いた音声合成装置の構成図
【図8】ホルマントと音声素片の融合により音声合成を
行う場合の装置の構成図
行う場合の装置の構成図
1 合成制御部(手段) 2 自然音声素片格納部(手段) 3 特徴パラメタ格納部(手段) 4 ホルマント合成規則格納部(手段) 5 音源部(手段) 6 ホルマント合成部(手段) 7 素片接続部(手段) 8 ホルマント合成器制御用係数生成部(手段) 9 ホルマント合成器制御規則格納部(手段) 10 ホルマント合成器(手段) 11 有声音源部(手段) 12 無声音源部(手段) 13 直列型ホルマント合成部(手段) 14 並列型ホルマント合成部(手段) 15 合成部(手段) 16 音声素片選択部(手段) 17 音声素片データベース格納部(手段) 18 素片接続合成部(手段)
Claims (4)
- 【請求項1】自然音声素片セットを格納する自然音声素
片格納手段と、該自然音声素片格納手段に格納されてい
る該自然音声素片セットの各々の素片に対して単一ある
いは複数の位置から該位置の音響的特性を特徴付けるパ
ラメタベクトルを抽出し、抽出した位置の情報と共に該
特徴パラメタベクトルを格納する特徴パラメタ格納手段
と、該自然音声素片格納手段に格納されている該自然音
声素片セットのうち、ある自然音声素片に対応する該特
徴パラメタベクトルのうちある一つをターゲットとし、
該ターゲットから該自然音声素片に接続せしめる所望の
音韻までの音声の遷移を音声合成せしめる音声合成手段
と、該自然音声素片と該合成音声素片とを該ターゲット
の位置近傍において接続する音声素片接続手段とを具備
する音声合成装置。 - 【請求項2】自然音声素片セットは単音節の子音開始か
ら少なくとも子音母音間の過渡部あるいは母音定常部ま
での素片のセットであり、前記特徴パラメタベクトルは
少なくとも該単音節素片の子音開始位置あるいは子音母
音間の過渡部あるいは母音定常部から抽出されたベクト
ルである請求項1に記載の音声合成装置。 - 【請求項3】特徴パラメタ格納手段が格納する特徴パラ
メタベクトルは少なくとも各ホルマント周波数、各ホル
マントバンド幅、音源の特性を有する請求項1に記載の
音声合成装置。 - 【請求項4】自然音声格納手段は自然音声から切り出し
た複数の単音節原音素片の子音開始位置から子音とその
後続母音の渡り位置までを切りだし格納するものであ
り、前記特徴パラメタ格納手段は、該自然音声素片格納
手段に格納されている各単音節素片の子音から母音への
渡り位置から抽出した音響的特性を特徴付けるパラメタ
ベクトルをその抽出した位置の情報と共に第1ターゲッ
トとして格納し、かつ該単音節素片に対応する該単音節
原音素片の母音定常部から抽出した音響的特性を特徴付
けるパラメタベクトルをその抽出した位置の情報と共に
第2ターゲットとして格納するものであり、前記音声合
成手段は、該第1ターゲットと該第2ターゲット間を補
間し、かつ該第2ターゲットから該単音節素片に接続せ
しめる所望の音韻までの音声の遷移を音声合成するもの
であり、前記音声素片接続手段は、該単音節素片と該音
声合成手段が合成する音声素片とを該第1ターゲットの
位置近傍において接続する請求項1に記載の音声合成装
置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP6169280A JPH0836397A (ja) | 1994-07-21 | 1994-07-21 | 音声合成装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP6169280A JPH0836397A (ja) | 1994-07-21 | 1994-07-21 | 音声合成装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH0836397A true JPH0836397A (ja) | 1996-02-06 |
Family
ID=15883593
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP6169280A Pending JPH0836397A (ja) | 1994-07-21 | 1994-07-21 | 音声合成装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH0836397A (ja) |
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR100363876B1 (ko) * | 2000-12-27 | 2002-12-11 | (주)네오싸이피아 | 음성의 특징 벡터를 이용한 문자 음성 변환 장치 및 그 방법 |
| JP2009237015A (ja) * | 2008-03-26 | 2009-10-15 | Nippon Hoso Kyokai <Nhk> | 音声素片接続装置及びプログラム |
| JP2011013534A (ja) * | 2009-07-03 | 2011-01-20 | Nippon Hoso Kyokai <Nhk> | 音声合成装置およびプログラム |
-
1994
- 1994-07-21 JP JP6169280A patent/JPH0836397A/ja active Pending
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR100363876B1 (ko) * | 2000-12-27 | 2002-12-11 | (주)네오싸이피아 | 음성의 특징 벡터를 이용한 문자 음성 변환 장치 및 그 방법 |
| JP2009237015A (ja) * | 2008-03-26 | 2009-10-15 | Nippon Hoso Kyokai <Nhk> | 音声素片接続装置及びプログラム |
| JP2011013534A (ja) * | 2009-07-03 | 2011-01-20 | Nippon Hoso Kyokai <Nhk> | 音声合成装置およびプログラム |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Tabet et al. | Speech synthesis techniques. A survey | |
| JP3408477B2 (ja) | フィルタパラメータとソース領域において独立にクロスフェードを行う半音節結合型のフォルマントベースのスピーチシンセサイザ | |
| US7010488B2 (en) | System and method for compressing concatenative acoustic inventories for speech synthesis | |
| JPH031200A (ja) | 規則型音声合成装置 | |
| JPH08110789A (ja) | 波形の連結及び部分的重複化による音声合成方法 | |
| JPH06110498A (ja) | 音声合成システムの音声断片コーディングおよびそのピッチ調節方法とその有声音合成装置 | |
| US6212501B1 (en) | Speech synthesis apparatus and method | |
| Siddhi et al. | Survey on various methods of text to speech synthesis | |
| CA2340073A1 (en) | Method and device for the concatenation of audiosegments, taking into account coarticulation | |
| JP2002202789A (ja) | テキスト音声合成装置およびプログラム記録媒体 | |
| KR100457414B1 (ko) | 음성합성방법, 음성합성장치 및 기록매체 | |
| US6424937B1 (en) | Fundamental frequency pattern generator, method and program | |
| JPH0641557A (ja) | 音声合成のための方法および装置 | |
| JP2761552B2 (ja) | 音声合成方法 | |
| JP3281266B2 (ja) | 音声合成方法及び装置 | |
| JP2904279B2 (ja) | 音声合成方法および装置 | |
| JP2005004104A (ja) | 規則音声合成装置及び規則音声合成方法 | |
| JP3089940B2 (ja) | 音声合成装置 | |
| JPH0580791A (ja) | 音声規則合成装置および方法 | |
| JP3124791B2 (ja) | 音声合成装置 | |
| JP3081300B2 (ja) | 残差駆動型音声合成装置 | |
| JP2987089B2 (ja) | 音声素片作成方法および音声合成方法とその装置 | |
| JP2577372B2 (ja) | 音声合成装置および方法 | |
| D’Souza et al. | Comparative analysis of Kannada formant synthesized utterances and their quality | |
| JPS5914752B2 (ja) | 音声合成方式 |