JP2000305582A - 音声合成装置 - Google Patents
音声合成装置Info
- Publication number
- JP2000305582A JP2000305582A JP11116263A JP11626399A JP2000305582A JP 2000305582 A JP2000305582 A JP 2000305582A JP 11116263 A JP11116263 A JP 11116263A JP 11626399 A JP11626399 A JP 11626399A JP 2000305582 A JP2000305582 A JP 2000305582A
- Authority
- JP
- Japan
- Prior art keywords
- vowel
- unit
- duration
- phoneme
- speech
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Abandoned
Links
- 230000002194 synthesizing effect Effects 0.000 title claims abstract description 12
- 238000012545 processing Methods 0.000 claims abstract description 45
- 238000012937 correction Methods 0.000 claims abstract description 43
- 230000015572 biosynthetic process Effects 0.000 claims abstract description 33
- 238000003786 synthesis reaction Methods 0.000 claims abstract description 33
- 238000000034 method Methods 0.000 claims description 48
- 230000008569 process Effects 0.000 claims description 31
- 230000008859 change Effects 0.000 claims description 5
- 238000004458 analytical method Methods 0.000 abstract description 35
- 238000004364 calculation method Methods 0.000 abstract description 17
- 230000006866 deterioration Effects 0.000 abstract description 5
- 230000008602 contraction Effects 0.000 description 20
- 238000010586 diagram Methods 0.000 description 14
- 210000001260 vocal cord Anatomy 0.000 description 11
- 238000011002 quantification Methods 0.000 description 7
- 230000033764 rhythmic process Effects 0.000 description 6
- 238000006243 chemical reaction Methods 0.000 description 5
- 230000007423 decrease Effects 0.000 description 5
- 238000007619 statistical method Methods 0.000 description 5
- 238000001308 synthesis method Methods 0.000 description 5
- 230000007704 transition Effects 0.000 description 4
- 241001417093 Moridae Species 0.000 description 3
- 240000000220 Panda oleosa Species 0.000 description 3
- 235000016496 Panda oleosa Nutrition 0.000 description 3
- 230000000737 periodic effect Effects 0.000 description 3
- 238000005316 response function Methods 0.000 description 3
- 230000002123 temporal effect Effects 0.000 description 3
- 230000001755 vocal effect Effects 0.000 description 3
- 230000002354 daily effect Effects 0.000 description 2
- 238000005516 engineering process Methods 0.000 description 2
- 230000001771 impaired effect Effects 0.000 description 2
- 238000003908 quality control method Methods 0.000 description 2
- 235000007516 Chrysanthemum Nutrition 0.000 description 1
- 244000189548 Chrysanthemum x morifolium Species 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 239000002131 composite material Substances 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 238000012217 deletion Methods 0.000 description 1
- 230000037430 deletion Effects 0.000 description 1
- 230000002542 deteriorative effect Effects 0.000 description 1
- 230000003203 everyday effect Effects 0.000 description 1
- 210000004072 lung Anatomy 0.000 description 1
- 230000000877 morphologic effect Effects 0.000 description 1
- 230000004044 response Effects 0.000 description 1
- 230000000630 rising effect Effects 0.000 description 1
- 230000035807 sensation Effects 0.000 description 1
- 238000004904 shortening Methods 0.000 description 1
- 230000002269 spontaneous effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/02—Methods for producing synthetic speech; Speech synthesisers
- G10L13/033—Voice editing, e.g. manipulating the voice of the synthesiser
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Machine Translation (AREA)
Abstract
(57)【要約】
【課題】 発声速度が遅い場合の母音無声化音節の品質
劣化を改善し、聴感品質の良い合成音声を生成すること
ができる音声合成装置を提供する。 【解決手段】 音声合成装置は、パラメータ生成部30
0が、中間言語解析部301、ピッチパタン生成部30
2、字面やアクセントなどの入力テキストのみを基準に
母音の無声化判定を行う母音無声化一次判定部303、
母音無声化一次判定結果とユーザから指定される発声速
度レベルとから最終的な無声化判定を行う母音無声化二
次判定部304、音韻パワー決定部305、音韻継続時
間算出部306、及びユーザから指定された発声速度に
応じて音韻継続時間を修正する継続時間修正部307を
備え、通常の発声速度や速い発声速度の時は従来通りの
規則に従って母音の無声化処理を施し、発声速度が遅い
時には母音の無声化処理を施さないように構成する。
劣化を改善し、聴感品質の良い合成音声を生成すること
ができる音声合成装置を提供する。 【解決手段】 音声合成装置は、パラメータ生成部30
0が、中間言語解析部301、ピッチパタン生成部30
2、字面やアクセントなどの入力テキストのみを基準に
母音の無声化判定を行う母音無声化一次判定部303、
母音無声化一次判定結果とユーザから指定される発声速
度レベルとから最終的な無声化判定を行う母音無声化二
次判定部304、音韻パワー決定部305、音韻継続時
間算出部306、及びユーザから指定された発声速度に
応じて音韻継続時間を修正する継続時間修正部307を
備え、通常の発声速度や速い発声速度の時は従来通りの
規則に従って母音の無声化処理を施し、発声速度が遅い
時には母音の無声化処理を施さないように構成する。
Description
【0001】
【発明の属する技術分野】本発明は、規則によって任意
の音声を合成する音声合成装置に関し、特に、日常読み
書きしている漠字・仮名混じり文を音声として出力する
テキスト音声変換技術に関して母音無声化時の音韻継続
時間制御を改良した音声合成装置に関する。
の音声を合成する音声合成装置に関し、特に、日常読み
書きしている漠字・仮名混じり文を音声として出力する
テキスト音声変換技術に関して母音無声化時の音韻継続
時間制御を改良した音声合成装置に関する。
【0002】
【従来の技術】テキスト音声変換技術は、我々が日常読
み書きしている漠字かな混じり文を入力し、それを音声
に変換して出力するもので、出力語彙の制限がないこと
から録音・再生型の音声合成に代わる技術として種々の
利用分野での応用が期待できる。
み書きしている漠字かな混じり文を入力し、それを音声
に変換して出力するもので、出力語彙の制限がないこと
から録音・再生型の音声合成に代わる技術として種々の
利用分野での応用が期待できる。
【0003】従来、この種の音声合成装置としては、図
6に示すような処理形態となっているものが代表的であ
る。
6に示すような処理形態となっているものが代表的であ
る。
【0004】図6は従来の音声合成装置の構成を示すブ
ロック図である。
ロック図である。
【0005】図6において、101はテキスト解析部、
102はパラメータ生成部、103は波形生成部、10
4は単語辞書、105は素片辞書である。
102はパラメータ生成部、103は波形生成部、10
4は単語辞書、105は素片辞書である。
【0006】テキスト解析部101は、漢字かな混じり
文を入力して、単語辞書を参照して形態素解析し、読
み、アクセント、イントネーションを決定し、韻律記号
付き発音記号(中間言語)を出力する。
文を入力して、単語辞書を参照して形態素解析し、読
み、アクセント、イントネーションを決定し、韻律記号
付き発音記号(中間言語)を出力する。
【0007】パラメータ生成部102は、ピッチ周波数
パターンや音韻継続時間等の設定を行い、波形生成部1
03では、音声の合成処理を行う。
パターンや音韻継続時間等の設定を行い、波形生成部1
03では、音声の合成処理を行う。
【0008】波形生成部103は、目的とする音韻系列
(中間言語)から音声合成単位を、あらかじめ蓄積され
ている音声データから選択し、パラメータ生成部で決定
したパラメータに従って、結合/変形して音声の合成処
理を行う。
(中間言語)から音声合成単位を、あらかじめ蓄積され
ている音声データから選択し、パラメータ生成部で決定
したパラメータに従って、結合/変形して音声の合成処
理を行う。
【0009】音声合成単位は、音素、音節(CV)、V
CV,CVC(C:子音、V:母音)等や、音韻連鎖を
拡張した単位がある。
CV,CVC(C:子音、V:母音)等や、音韻連鎖を
拡張した単位がある。
【0010】音声合成方法としては、あらかじめ音声波
形にピッチマーク(基準点)を付けておき、その位置を
中心に切り出して、合成時には合成ピッチ周期に合わせ
て、ピッチマーク位置を合成ピッチ周期ずらしながら重
ね合わせる合成方式が知られている。
形にピッチマーク(基準点)を付けておき、その位置を
中心に切り出して、合成時には合成ピッチ周期に合わせ
て、ピッチマーク位置を合成ピッチ周期ずらしながら重
ね合わせる合成方式が知られている。
【0011】上記構成のテキスト音声変換によって、よ
り自然性の高い合成音声を出力するには、音声素片の単
位の持ち方、素片品質、合成方式と共に、前記パラメー
タ生成部でのパラメータ(ピッチ周波数パターン、音韻
継続時間長、ポーズ、振幅)をいかに自然音声に近くな
るよう適切に制御するかが極めて重要となる。ポーズと
は、文節の前後の若干の休止区間をいう。
り自然性の高い合成音声を出力するには、音声素片の単
位の持ち方、素片品質、合成方式と共に、前記パラメー
タ生成部でのパラメータ(ピッチ周波数パターン、音韻
継続時間長、ポーズ、振幅)をいかに自然音声に近くな
るよう適切に制御するかが極めて重要となる。ポーズと
は、文節の前後の若干の休止区間をいう。
【0012】以上の構成において、日常読み書きしてい
る漠字仮名混じり文(以下、テキストという)を入力す
ると、テキスト解析部101は、文字情報から音韻・韻
律記号列を生成する。音韻・韻律記号列とは、入力文の
読み、アクセント、イントネーション等を文字列として
記述したもの(以下、中間言語という)である。単語辞
書104は、単語の読みやアクセント等が登録された発
音辞書で、テキスト解析部101はこの発音辞書を参照
しながら中間言語を生成する。
る漠字仮名混じり文(以下、テキストという)を入力す
ると、テキスト解析部101は、文字情報から音韻・韻
律記号列を生成する。音韻・韻律記号列とは、入力文の
読み、アクセント、イントネーション等を文字列として
記述したもの(以下、中間言語という)である。単語辞
書104は、単語の読みやアクセント等が登録された発
音辞書で、テキスト解析部101はこの発音辞書を参照
しながら中間言語を生成する。
【0013】テキスト解析部101で生成された中間言
語は、パラメータ生成部102で、音声素片(音の種
類)、音韻継続時間(音の長さ)、基本周波数(声の高
さ、以下ピッチという)等の各パターンからなる合成パ
ラメータを決定し、波形生成部103に送る。音声素片
とは、接続して合成波形を作るための音声の基本単位
で、音の種類等に応じて様々なものがある。
語は、パラメータ生成部102で、音声素片(音の種
類)、音韻継続時間(音の長さ)、基本周波数(声の高
さ、以下ピッチという)等の各パターンからなる合成パ
ラメータを決定し、波形生成部103に送る。音声素片
とは、接続して合成波形を作るための音声の基本単位
で、音の種類等に応じて様々なものがある。
【0014】パラメータ生成部102で生成された各種
パラメータは、波形生成部103で音声素片等を蓄積す
るROM等から構成された素片辞書105を参照しなが
ら、合成波形が生成され、スピーカを通して合成音声が
出力される。
パラメータは、波形生成部103で音声素片等を蓄積す
るROM等から構成された素片辞書105を参照しなが
ら、合成波形が生成され、スピーカを通して合成音声が
出力される。
【0015】以上がテキスト音声変換処理の流れであ
る。
る。
【0016】次に、パラメータ生成部102における処
理を図7を参照して詳細に説明する。
理を図7を参照して詳細に説明する。
【0017】図7は従来の音声合成装置のパラメータ生
成部102の構成を示すブロック図である。
成部102の構成を示すブロック図である。
【0018】図7において、パラメータ生成部102
は、中間言語解析部201、ピッチパタン生成部20
2、母音無声化判定部203、音韻パワー決定部20
4、音韻継続時間算出部205、継続時間修正部206
から構成される。
は、中間言語解析部201、ピッチパタン生成部20
2、母音無声化判定部203、音韻パワー決定部20
4、音韻継続時間算出部205、継続時間修正部206
から構成される。
【0019】パラメータ生成部102に入力される中間
言語は、アクセント位置・ポーズ位置などを含んだ音韻
文字列であり、これより、ピッチの時間的な変化(以
下、ピッチパタンという)、それぞれの音韻の継続時間
(以下、音韻継続時間という)、音声パワー等の波形を
生成する上でのパラメータ(以下、波形生成用パラメー
タという)を決定する。入力された中間言語は、中間言
語解析部201で文字列の解析が行われ、中間言語上に
記された単語区切り記号から単語境界を判定し、アクセ
ント記号からアクセント核のモーラ位置を得る。
言語は、アクセント位置・ポーズ位置などを含んだ音韻
文字列であり、これより、ピッチの時間的な変化(以
下、ピッチパタンという)、それぞれの音韻の継続時間
(以下、音韻継続時間という)、音声パワー等の波形を
生成する上でのパラメータ(以下、波形生成用パラメー
タという)を決定する。入力された中間言語は、中間言
語解析部201で文字列の解析が行われ、中間言語上に
記された単語区切り記号から単語境界を判定し、アクセ
ント記号からアクセント核のモーラ位置を得る。
【0020】アクセント核とは、アクセントが下降する
位置のことで、1モーラ目にアクセント核が存在する単
語を1型アクセント、nモーラ目にアクセント核が存在
する単語をn型アクセントと呼び、総称して起伏型アク
セント単語と呼ぶ。逆に、アクセント核の存在しない単
語(例えば「新聞」や「パソコン」)を0型アクセント
または平板型アクセント単語と呼ぶ。
位置のことで、1モーラ目にアクセント核が存在する単
語を1型アクセント、nモーラ目にアクセント核が存在
する単語をn型アクセントと呼び、総称して起伏型アク
セント単語と呼ぶ。逆に、アクセント核の存在しない単
語(例えば「新聞」や「パソコン」)を0型アクセント
または平板型アクセント単語と呼ぶ。
【0021】ピッチパタン生成部202は、中間言語上
のフレーズ記号・アクセント記号などにより、それぞれ
の応答関数のパラメータの決定を行う。またこの時、ユ
ーザからの抑揚(イントネーションの大きさ)指定や全
体的な声の高さの指定があった場合は、それに応じて、
フレーズ指令・アクセント指令の大きさを修正する。
のフレーズ記号・アクセント記号などにより、それぞれ
の応答関数のパラメータの決定を行う。またこの時、ユ
ーザからの抑揚(イントネーションの大きさ)指定や全
体的な声の高さの指定があった場合は、それに応じて、
フレーズ指令・アクセント指令の大きさを修正する。
【0022】母音無声化判定部203は、中間言語上の
音韻記号やアクセント記号などから、母音の無声化判定
を行い、その結果を音韻パワー決定部204と音韻継続
時間算出部205に送る。母音の無声化については後述
する。
音韻記号やアクセント記号などから、母音の無声化判定
を行い、その結果を音韻パワー決定部204と音韻継続
時間算出部205に送る。母音の無声化については後述
する。
【0023】音韻継続時間算出部205は、音韻文字列
からそれぞれの音韻の持続時間を計算し、継続時間修正
部206に送る。音韻継続時間の算出方法は、隣接する
音韻の種別により規則または、数量化1類などの統計的
手法を用いる。ユーザが発声速度を指定する場合は通
常、指定されたレベルに応じて、前述のしかるべき手法
により算出された音韻継続時間を継続時間修正部206
で線形伸縮する処理を行う。但し、通常、波形伸縮を行
うのは母音のみであり、それを表わしたのが図8であ
る。
からそれぞれの音韻の持続時間を計算し、継続時間修正
部206に送る。音韻継続時間の算出方法は、隣接する
音韻の種別により規則または、数量化1類などの統計的
手法を用いる。ユーザが発声速度を指定する場合は通
常、指定されたレベルに応じて、前述のしかるべき手法
により算出された音韻継続時間を継続時間修正部206
で線形伸縮する処理を行う。但し、通常、波形伸縮を行
うのは母音のみであり、それを表わしたのが図8であ
る。
【0024】図8は発声速度の違いによる波形伸縮を示
す図である。
す図である。
【0025】継続時間修正部206で発声速度レベルに
応じて伸縮された音韻継続時間は、図示していない波形
生成部に送られる。
応じて伸縮された音韻継続時間は、図示していない波形
生成部に送られる。
【0026】また、音韻パワー決定部204は、波形の
振幅値を算出し、波形生成部103(図6)へ送る。音
韻パワーは、音韻の立ち上がりの徐々に振幅値が大きく
なる区間と、定常状態にある区間と、立ち下がりの徐々
に振幅値が小さくなる区間のパワー遷移のことであり、
通常はテーブル化された係数値から算出される。
振幅値を算出し、波形生成部103(図6)へ送る。音
韻パワーは、音韻の立ち上がりの徐々に振幅値が大きく
なる区間と、定常状態にある区間と、立ち下がりの徐々
に振幅値が小さくなる区間のパワー遷移のことであり、
通常はテーブル化された係数値から算出される。
【0027】以上説明したこれらの波形生成用パラメー
タは波形生成部103へ送られ、合成波形が生成され
る。
タは波形生成部103へ送られ、合成波形が生成され
る。
【0028】さらに、母音無声化について詳細に説明す
る。
る。
【0029】人間が言葉を発する時には、肺から押し出
された空気を声帯の開閉運動により音源とし、顎・舌・
唇などを動かすことにより声道の共鳴特性を変化させて
種々の音韻を表現している。前述したピッチは、声帯の
振動周期に対応し、この時間的変化がアクセントやイン
トネーションの表現となる。このような声帯振動の他
に、舌によって声道のある部分に狭い場所を作り、そこ
を空気流が通り抜けるときに乱流を生じて雑音的な音を
生成する摩擦音や、舌や唇で声道を遮断して一時空気流
を止めた後に一気に開放してインパルス的な音を生成す
る破裂音もある。
された空気を声帯の開閉運動により音源とし、顎・舌・
唇などを動かすことにより声道の共鳴特性を変化させて
種々の音韻を表現している。前述したピッチは、声帯の
振動周期に対応し、この時間的変化がアクセントやイン
トネーションの表現となる。このような声帯振動の他
に、舌によって声道のある部分に狭い場所を作り、そこ
を空気流が通り抜けるときに乱流を生じて雑音的な音を
生成する摩擦音や、舌や唇で声道を遮断して一時空気流
を止めた後に一気に開放してインパルス的な音を生成す
る破裂音もある。
【0030】母音や破裂音「/b,d,g/」、摩擦音
「/j,z/」、「/m,n,r/」などの鼻子音・流
音といった、声帯の振動を伴う音韻を総称して有声音、
破裂音「/p,t,k/」、摩擦音「/s,h,f/」
といった、声帯の振動を伴わない音韻を無声音と呼ぶ。
特に、子音に注目して、声帯の振動を伴う子音を有声子
音、伴わない子音を無声子音と呼ぶ。有声音では、声帯
振動による周期的な波形が生成され、無声音では雑音的
な波形が生成される。
「/j,z/」、「/m,n,r/」などの鼻子音・流
音といった、声帯の振動を伴う音韻を総称して有声音、
破裂音「/p,t,k/」、摩擦音「/s,h,f/」
といった、声帯の振動を伴わない音韻を無声音と呼ぶ。
特に、子音に注目して、声帯の振動を伴う子音を有声子
音、伴わない子音を無声子音と呼ぶ。有声音では、声帯
振動による周期的な波形が生成され、無声音では雑音的
な波形が生成される。
【0031】共通語では、例えば「菊」という単語を自
然に発音すると「kiku」の最初の母音「i」は、口
構えだけを残して声帯を振動させず、息だけで発音する
現象が見られる。これが母音の無声化であり、この例を
図9に示す。
然に発音すると「kiku」の最初の母音「i」は、口
構えだけを残して声帯を振動させず、息だけで発音する
現象が見られる。これが母音の無声化であり、この例を
図9に示す。
【0032】図9は「取材した」の実発音波形を示す図
である。
である。
【0033】図9に示すように、「取材した」の「sh
i」の母音は周期的な波形として現れず、無声摩擦音
「sh」に融合された様な波形となっている。
i」の母音は周期的な波形として現れず、無声摩擦音
「sh」に融合された様な波形となっている。
【0034】テキスト音声変換システムにおいても、母
音の無声化表現は聴感品質を向上させるために必要であ
り、この判定を行うのが前記図7における母音無声化判
定部203である。ここで無声化すると判定された母音
は、音韻パワー決定部204と音韻継続時間算出部20
5において、それに応じた特殊な処理が施される。
音の無声化表現は聴感品質を向上させるために必要であ
り、この判定を行うのが前記図7における母音無声化判
定部203である。ここで無声化すると判定された母音
は、音韻パワー決定部204と音韻継続時間算出部20
5において、それに応じた特殊な処理が施される。
【0035】無声化母音は、通常の母音とは異なり、音
韻パワー0、音韻継続時間0として波形生成部103に
送られる。この場合、音韻継続時間算出部205では、
母音の継続時間が削除されるのを補うため、その分を子
音(前記図9の例の場合「sh」)の継続時間に加算す
るという操作が行われる。そして波形生成部103で
は、母音の音素片は使用せず子音素片のみで合成波形を
生成する。
韻パワー0、音韻継続時間0として波形生成部103に
送られる。この場合、音韻継続時間算出部205では、
母音の継続時間が削除されるのを補うため、その分を子
音(前記図9の例の場合「sh」)の継続時間に加算す
るという操作が行われる。そして波形生成部103で
は、母音の音素片は使用せず子音素片のみで合成波形を
生成する。
【0036】無声化判定は、通常以下の規則に従って行
われている。すなわち、 (1)無声子音(無音を含む)に挟まれた母音/i/,
/u/は無声化する (2)但し、アクセント核が存在すれば無声化しない (3)但し、前母音がすでに無声化していれば無声化し
ない (4)但し、疑問文末は無声化しない である。但し、これらは一般的な傾向から導き出された
規則であり、実際の発声では上述の規則通りに無声化が
起こるとは限らない。また、個人によっても差があるた
め、一例として示したものである。上記基本規則(1)
を満たすが、基本規則(2),(3),(4)の例外規
則により無声化しない母音は、その継続時間を短くした
り振幅値を小さくするなど、無声化に準じた取り扱いを
する場合もある。
われている。すなわち、 (1)無声子音(無音を含む)に挟まれた母音/i/,
/u/は無声化する (2)但し、アクセント核が存在すれば無声化しない (3)但し、前母音がすでに無声化していれば無声化し
ない (4)但し、疑問文末は無声化しない である。但し、これらは一般的な傾向から導き出された
規則であり、実際の発声では上述の規則通りに無声化が
起こるとは限らない。また、個人によっても差があるた
め、一例として示したものである。上記基本規則(1)
を満たすが、基本規則(2),(3),(4)の例外規
則により無声化しない母音は、その継続時間を短くした
り振幅値を小さくするなど、無声化に準じた取り扱いを
する場合もある。
【0037】ここで、母音が無声化した場合の波形伸縮
について説明する。上述したように、発声速度の変化に
よる波形伸縮は、周期的成分を持つ母音区間のみで行わ
れていた。しかし母音が無声化した場合は、母音素片は
全く使用されていないので子音区間で波形伸縮が行われ
ていた。母音(有声音)素片による波形伸長の場合は、
声帯振動を駆動源とするインパルス応答波形を繰り返し
ピッチ周期ずらして重畳することにより実現されるのに
対して、子音(無声音)素片による波形伸長の場合は、
終端を起点に折り返した波形を繋ぎあわせることで実現
していた。
について説明する。上述したように、発声速度の変化に
よる波形伸縮は、周期的成分を持つ母音区間のみで行わ
れていた。しかし母音が無声化した場合は、母音素片は
全く使用されていないので子音区間で波形伸縮が行われ
ていた。母音(有声音)素片による波形伸長の場合は、
声帯振動を駆動源とするインパルス応答波形を繰り返し
ピッチ周期ずらして重畳することにより実現されるのに
対して、子音(無声音)素片による波形伸長の場合は、
終端を起点に折り返した波形を繋ぎあわせることで実現
していた。
【0038】
【発明が解決しようとする課題】このような従来の母音
無声化時の継続時間制御方法にあっては、母音が無声化
した場合には子音区間で波形伸縮を行っているため、発
声速度を極端に遅くした場合にその子音の明瞭度が著し
く劣化するという問題点があった。
無声化時の継続時間制御方法にあっては、母音が無声化
した場合には子音区間で波形伸縮を行っているため、発
声速度を極端に遅くした場合にその子音の明瞭度が著し
く劣化するという問題点があった。
【0039】また、子音長が極端に長くなるため、発声
リズムが損なわれ、聞き苦しい合成音になるという問題
点があった。
リズムが損なわれ、聞き苦しい合成音になるという問題
点があった。
【0040】本発明は、発声速度が遅い場合の母音無声
化音節の品質劣化を改善し、聴感品質の良い合成音声を
生成することができる音声合成装置を提供することを目
的とする。
化音節の品質劣化を改善し、聴感品質の良い合成音声を
生成することができる音声合成装置を提供することを目
的とする。
【0041】また、本発明は、発声速度が遅い場合の母
音無声化音節の品質劣化を改善すると共に、発声リズム
も損なわれない聞き易い合成音声を生成することができ
る音声合成装置を提供することを目的とする。
音無声化音節の品質劣化を改善すると共に、発声リズム
も損なわれない聞き易い合成音声を生成することができ
る音声合成装置を提供することを目的とする。
【0042】
【課題を解決するための手段】本発明に係る音声合成装
置は、音声の基本単位となる音声素片が登録された素片
辞書と、音韻・韻律記号列に対して少なくとも音声素
片、音韻継続時間、基本周波数の合成パラメータを生成
するパラメータ生成部と、パラメータ生成部からの合成
パラメータを素片辞書を参照しながら波形重畳を行って
合成波形を生成する波形生成部とを備えた音声合成装置
において、パラメータ生成部は、発声速度に応じて母音
無声化処理を行うか否かの判定基準を変える母音無声化
判定手段を備えたことを特徴とする。
置は、音声の基本単位となる音声素片が登録された素片
辞書と、音韻・韻律記号列に対して少なくとも音声素
片、音韻継続時間、基本周波数の合成パラメータを生成
するパラメータ生成部と、パラメータ生成部からの合成
パラメータを素片辞書を参照しながら波形重畳を行って
合成波形を生成する波形生成部とを備えた音声合成装置
において、パラメータ生成部は、発声速度に応じて母音
無声化処理を行うか否かの判定基準を変える母音無声化
判定手段を備えたことを特徴とする。
【0043】本発明に係る音声合成装置は、音声の基本
単位となる音声素片が登録された素片辞書と、音韻・韻
律記号列に対して少なくとも音声素片、音韻継続時間、
基本周波数の合成パラメータを生成するパラメータ生成
部と、パラメータ生成部からの合成パラメータを素片辞
書を参照しながら波形重畳を行って合成波形を生成する
波形生成部とを備えた音声合成装置において、パラメー
タ生成部は、母音無声化処理を行うか否かを判定する母
音無声化判定手段と、ユーザから指定された発声速度に
応じて音韻継続時間を修正する継続時間修正手段とを備
え、母音無声化判定手段は、指定された発声速度が所定
の閾値より遅い場合に無声化処理を行わないと判定する
ことを特徴とする。
単位となる音声素片が登録された素片辞書と、音韻・韻
律記号列に対して少なくとも音声素片、音韻継続時間、
基本周波数の合成パラメータを生成するパラメータ生成
部と、パラメータ生成部からの合成パラメータを素片辞
書を参照しながら波形重畳を行って合成波形を生成する
波形生成部とを備えた音声合成装置において、パラメー
タ生成部は、母音無声化処理を行うか否かを判定する母
音無声化判定手段と、ユーザから指定された発声速度に
応じて音韻継続時間を修正する継続時間修正手段とを備
え、母音無声化判定手段は、指定された発声速度が所定
の閾値より遅い場合に無声化処理を行わないと判定する
ことを特徴とする。
【0044】本発明に係る音声合成装置は、母音無声化
判定手段が、字面やアクセントなどの入力テキストのみ
を基準に母音の無声化判定を行う第1の判定手段と、第
1の判定手段による判定結果とユーザから指定される発
声速度とから最終的な無声化判定を行う第2の判定手段
とを備えたものであってもよい。
判定手段が、字面やアクセントなどの入力テキストのみ
を基準に母音の無声化判定を行う第1の判定手段と、第
1の判定手段による判定結果とユーザから指定される発
声速度とから最終的な無声化判定を行う第2の判定手段
とを備えたものであってもよい。
【0045】本発明に係る音声合成装置は、母音無声化
判定手段が、無声化処理を行わないと判定する閾値は、
ユーザが指定できるものであってもよい。
判定手段が、無声化処理を行わないと判定する閾値は、
ユーザが指定できるものであってもよい。
【0046】本発明に係る音声合成装置は、母音無声化
判定手段が、無声化処理を行わないと判定する閾値は、
通常の発声速度の1/2であってもよい。
判定手段が、無声化処理を行わないと判定する閾値は、
通常の発声速度の1/2であってもよい。
【0047】本発明に係る音声合成装置は、音声の基本
単位となる音声素片が登録された素片辞書と、音韻・韻
律記号列に対して少なくとも音声素片、音韻継続時間、
基本周波数の合成パラメータを生成するパラメータ生成
部と、パラメータ生成部からの合成パラメータを素片辞
書を参照しながら波形重畳を行って合成波形を生成する
波形生成部とを備えた音声合成装置において、パラメー
タ生成部は、母音無声化処理を行うか否かを判定する母
音無声化判定手段と、ユーザから指定された発声速度と
母音無声化判定手段の判定結果に応じて音韻継続時間を
修正する継続時間修正手段とを備え、継続時間修正手段
は、所定の制限値を超えて無声子音の継続時間の伸長処
理を行わないことを特徴とする。
単位となる音声素片が登録された素片辞書と、音韻・韻
律記号列に対して少なくとも音声素片、音韻継続時間、
基本周波数の合成パラメータを生成するパラメータ生成
部と、パラメータ生成部からの合成パラメータを素片辞
書を参照しながら波形重畳を行って合成波形を生成する
波形生成部とを備えた音声合成装置において、パラメー
タ生成部は、母音無声化処理を行うか否かを判定する母
音無声化判定手段と、ユーザから指定された発声速度と
母音無声化判定手段の判定結果に応じて音韻継続時間を
修正する継続時間修正手段とを備え、継続時間修正手段
は、所定の制限値を超えて無声子音の継続時間の伸長処
理を行わないことを特徴とする。
【0048】本発明に係る音声合成装置は、継続時間修
正手段が、無声子音の継続時間の伸長処理を行わない制
限値を、無声子音の種別に応じて変更可能に構成したも
のであってもよい。
正手段が、無声子音の継続時間の伸長処理を行わない制
限値を、無声子音の種別に応じて変更可能に構成したも
のであってもよい。
【0049】本発明に係る音声合成装置は、継続時間修
正手段が、無声子音の継続時間の伸長処理を行わない制
限値を、素片辞書に登録された音声素片の長さに応じて
変更可能に構成したものであってもよい。
正手段が、無声子音の継続時間の伸長処理を行わない制
限値を、素片辞書に登録された音声素片の長さに応じて
変更可能に構成したものであってもよい。
【0050】
【発明の実施の形態】以下、図面を参照して本発明の実
施の形態について説明する。 第1の実施形態 図1は本発明の第1の実施形態に係る音声合成装置のパ
ラメータ生成部の構成を示すブロック図である。本発明
の特徴部分は、無声化判定手段及びその実現方法にあ
る。前記図6に示すテキスト解析部101、単語辞書1
04、波形生成部103、素片辞書105は従来技術の
ものと同一でよい。
施の形態について説明する。 第1の実施形態 図1は本発明の第1の実施形態に係る音声合成装置のパ
ラメータ生成部の構成を示すブロック図である。本発明
の特徴部分は、無声化判定手段及びその実現方法にあ
る。前記図6に示すテキスト解析部101、単語辞書1
04、波形生成部103、素片辞書105は従来技術の
ものと同一でよい。
【0051】図1において、パラメータ生成部300
は、中間言語解析部301、ピッチパタン生成部30
2、母音無声化一次判定部303(第1の判定手段)、
母音無声化二次判定部304(第2の判定手段)、音韻
パワー決定部305、音韻継続時間算出部306、及び
継続時間修正部307(継続時間修正手段)から構成さ
れる。
は、中間言語解析部301、ピッチパタン生成部30
2、母音無声化一次判定部303(第1の判定手段)、
母音無声化二次判定部304(第2の判定手段)、音韻
パワー決定部305、音韻継続時間算出部306、及び
継続時間修正部307(継続時間修正手段)から構成さ
れる。
【0052】パラメータ生成部300への入力は、従来
例と同じく韻律記号の付加された中間言語とユーザから
指定される発声速度パラメータである。また、ユーザの
好みや利用形態などにより、声の高さやイントネーショ
ンの大きさを示す抑揚などの声質パラメータを外部から
指定する場合もある。
例と同じく韻律記号の付加された中間言語とユーザから
指定される発声速度パラメータである。また、ユーザの
好みや利用形態などにより、声の高さやイントネーショ
ンの大きさを示す抑揚などの声質パラメータを外部から
指定する場合もある。
【0053】合成対象の中間言語は、中間言語解析部3
01に入力され、ユーザ指定の発声速度パラメータは、
母音無声化二次判定部304と継続時間修正部307に
入力される。中間言語解析部301からの出力データの
うち、例えば、フレーズ区切り記号、単語区切り記号、
アクセント記号といったパラメータはピッチパタン生成
部302に入力され、音韻記号列や単語区切り記号、ア
クセント記号といったパラメータは音韻パワー決定部3
05と音韻継続時間算出部306に入力され、音韻記号
列やアクセント記号といったパラメータは母音無声化一
次判定部303に入力される。
01に入力され、ユーザ指定の発声速度パラメータは、
母音無声化二次判定部304と継続時間修正部307に
入力される。中間言語解析部301からの出力データの
うち、例えば、フレーズ区切り記号、単語区切り記号、
アクセント記号といったパラメータはピッチパタン生成
部302に入力され、音韻記号列や単語区切り記号、ア
クセント記号といったパラメータは音韻パワー決定部3
05と音韻継続時間算出部306に入力され、音韻記号
列やアクセント記号といったパラメータは母音無声化一
次判定部303に入力される。
【0054】ピッチパタン生成部302は、入力された
パラメータからフレーズ指令の生起時点と大きさ、アク
セント指令の開始時点・終了時点と大きさといったデー
タを算出し、ピッチパタンを生成する。生成されたピッ
チパタンは波形生成部103(前記図6)に入力され
る。ピッチパタン生成過程については、本発明と直接関
係がないので説明を省略する。
パラメータからフレーズ指令の生起時点と大きさ、アク
セント指令の開始時点・終了時点と大きさといったデー
タを算出し、ピッチパタンを生成する。生成されたピッ
チパタンは波形生成部103(前記図6)に入力され
る。ピッチパタン生成過程については、本発明と直接関
係がないので説明を省略する。
【0055】母音無声化一次判定部303は、字面やア
クセントなどの入力テキストのみを基準に母音の無声化
判定を行い、その判定結果を母音無声化二次判定部30
4に出力する。
クセントなどの入力テキストのみを基準に母音の無声化
判定を行い、その判定結果を母音無声化二次判定部30
4に出力する。
【0056】母音無声化二次判定部304は、母音無声
化一次判定結果とユーザから指定される発声速度レベル
とから最終的な無声化判定を行い、その最終的な判定結
果を音韻パワー決定部305と音韻継続時間算出部30
6に出力する。
化一次判定結果とユーザから指定される発声速度レベル
とから最終的な無声化判定を行い、その最終的な判定結
果を音韻パワー決定部305と音韻継続時間算出部30
6に出力する。
【0057】音韻パワー決定部305は、母音無声化判
定結果と、中間言語解析部301から入力される音韻記
号列とから、音韻それぞれの振幅形状を算出し、波形生
成部103に出力する。
定結果と、中間言語解析部301から入力される音韻記
号列とから、音韻それぞれの振幅形状を算出し、波形生
成部103に出力する。
【0058】音韻継続時間算出部306は、母音無声化
判定結果と、中間言語解析部301から入力される音韻
記号列とから、音韻それぞれの継続時間を算出し、継続
時間修正部307に出力される。
判定結果と、中間言語解析部301から入力される音韻
記号列とから、音韻それぞれの継続時間を算出し、継続
時間修正部307に出力される。
【0059】継続時間修正部307は、ユーザから指定
された発声速度パラメータで音韻継続時間を修正してそ
の結果を波形生成部103に出力する。
された発声速度パラメータで音韻継続時間を修正してそ
の結果を波形生成部103に出力する。
【0060】上記母音無声化一次判定部303及び母音
無声化二次判定部304は、全体として、発声速度に応
じて母音無声化処理を行うか否かの判定基準を変える母
音無声化判定手段を構成する。
無声化二次判定部304は、全体として、発声速度に応
じて母音無声化処理を行うか否かの判定基準を変える母
音無声化判定手段を構成する。
【0061】以下、上述のように構成された音声合成装
置及び規則音声合成方法の動作を説明する。従来技術と
異なる点は、パラメータ生成部300内の処理であるの
で、それ以外の処理については省略する。
置及び規則音声合成方法の動作を説明する。従来技術と
異なる点は、パラメータ生成部300内の処理であるの
で、それ以外の処理については省略する。
【0062】まず、ユーザはあらかじめ発声速度レベル
を指定する。発声速度は通常、1分間に何モーラの割合
で発声するかといった形式のパラメータとして与えら
れ、利用便利上、5〜10段階程度に量子化してそのレ
ベル値を与える。このレベルに応じて、音韻継続時間の
伸長などの処理を行う。また、声の高さや抑揚などの声
質制御のためのパラメータなども指定することができ
る。ユーザが特に指定しない場合は、あらかじめ定めら
れた値(デフォルト値)が指定値として設定される。
を指定する。発声速度は通常、1分間に何モーラの割合
で発声するかといった形式のパラメータとして与えら
れ、利用便利上、5〜10段階程度に量子化してそのレ
ベル値を与える。このレベルに応じて、音韻継続時間の
伸長などの処理を行う。また、声の高さや抑揚などの声
質制御のためのパラメータなども指定することができ
る。ユーザが特に指定しない場合は、あらかじめ定めら
れた値(デフォルト値)が指定値として設定される。
【0063】図1に示すように、指定された発声速度制
御用パラメータがパラメータ生成部300内部の母音無
声化二次判定部304と継続時間修正部307に送られ
る。もう一方の入力の中間言語は、中間言語解析部30
1に送られ、中間言語解析部301で入力文字列の解析
が行われる。ここでの解析単位として仮に1文章単位と
する。1文章に対応する中間言語から、ピッチパタンの
生成に関わるパラメータとして例えば、フレーズ指令の
数とそれぞれのフレーズ指令のモーラ数、アクセント指
令の数とそれぞれのアクセント指令のモーラ数・アクセ
ント型などの情報がピッチパタン生成部302に送られ
る。
御用パラメータがパラメータ生成部300内部の母音無
声化二次判定部304と継続時間修正部307に送られ
る。もう一方の入力の中間言語は、中間言語解析部30
1に送られ、中間言語解析部301で入力文字列の解析
が行われる。ここでの解析単位として仮に1文章単位と
する。1文章に対応する中間言語から、ピッチパタンの
生成に関わるパラメータとして例えば、フレーズ指令の
数とそれぞれのフレーズ指令のモーラ数、アクセント指
令の数とそれぞれのアクセント指令のモーラ数・アクセ
ント型などの情報がピッチパタン生成部302に送られ
る。
【0064】ピッチパタン生成部302では、入力され
たパラメータから数量化1類などの統計的手法を用い
て、フレーズ指令・アクセント指令それぞれの大きさや
立ち上げ・立ち下げ位置などの算出を行い、あらかじめ
規定した応答関数を用いてピッチパタンの生成を行う。
ここで、数量化1類は、多変量解析の1つであり、質的
な要因に基づいて、目的となる外的基準を算出するもの
である。導出されたピッチパタンは波形生成部103
(前記図6)に送られる。ピッチパタン生成過程につい
ては本発明と直接関係がないのでここでは詳細な説明は
省略する。
たパラメータから数量化1類などの統計的手法を用い
て、フレーズ指令・アクセント指令それぞれの大きさや
立ち上げ・立ち下げ位置などの算出を行い、あらかじめ
規定した応答関数を用いてピッチパタンの生成を行う。
ここで、数量化1類は、多変量解析の1つであり、質的
な要因に基づいて、目的となる外的基準を算出するもの
である。導出されたピッチパタンは波形生成部103
(前記図6)に送られる。ピッチパタン生成過程につい
ては本発明と直接関係がないのでここでは詳細な説明は
省略する。
【0065】また、アクセント記号・音韻文字列など
は、母音無声化一次判定部303に送られ、母音の無声
化判定が行われる。一次判定では文字列の並びのみから
判定が行われ、一時的な判定結果として母音無声化二次
判定部304に送られる。
は、母音無声化一次判定部303に送られ、母音の無声
化判定が行われる。一次判定では文字列の並びのみから
判定が行われ、一時的な判定結果として母音無声化二次
判定部304に送られる。
【0066】母音無声化二次判定部304には、ユーザ
から指定される発声速度レベルも入力されており、上記
一次判定結果と併せて二次判定処理が行われる。二次判
定は、ユーザの指定した発声速度がある規定値を超えた
か否かを比較し、比較結果から発声速度が遅いと判定さ
れた場合に限り母音無声化処理を行わないようにする。
から指定される発声速度レベルも入力されており、上記
一次判定結果と併せて二次判定処理が行われる。二次判
定は、ユーザの指定した発声速度がある規定値を超えた
か否かを比較し、比較結果から発声速度が遅いと判定さ
れた場合に限り母音無声化処理を行わないようにする。
【0067】この処理が施された後が母音無声化の最終
判定となり、音韻パワー決定部305と音韻継続時間算
出部306に送られる。
判定となり、音韻パワー決定部305と音韻継続時間算
出部306に送られる。
【0068】音韻パワー決定部305では、先に中間言
語解析部301から入力された音韻文字列などのパラメ
ータから音韻あるいは音節それぞれの波形振幅値を算出
し、波形生成部103に出力する。
語解析部301から入力された音韻文字列などのパラメ
ータから音韻あるいは音節それぞれの波形振幅値を算出
し、波形生成部103に出力する。
【0069】音韻パワーは、音韻の立ち上がりの徐々に
振幅値が大きくなる区間と、定常状態にある区間と、立
ち下がりの徐々に振幅値が小さくなる区間のパワー遷移
のことで、通常、テーブル化された係数値から算出され
る。母音無声化二次判定部304からの入力が、無声化
と判定された母音に対しては、その音韻パワーは0に設
定される。
振幅値が大きくなる区間と、定常状態にある区間と、立
ち下がりの徐々に振幅値が小さくなる区間のパワー遷移
のことで、通常、テーブル化された係数値から算出され
る。母音無声化二次判定部304からの入力が、無声化
と判定された母音に対しては、その音韻パワーは0に設
定される。
【0070】音韻継続時間算出部306では、先に中間
言語解析部301から入力された音韻文字列などのパラ
メータから音韻あるいは音節それぞれの継続時間を算出
し、継続時間修正部307に出力する。音韻継続時間の
算出方法は、隣接あるいは近傍の音韻の種別により規則
または、数量化1類などの統計的手法を用いて行うのが
一般的であり、ここで算出された音韻継続時間は、通常
(デフォルト)の発声速度の場合での値である。母音無
声化二次判定部304からの入力が、無声化と判定され
た音節に対しては、算出された母音継続時間を当該子音
の音韻継続時間に加算する操作が行われる。
言語解析部301から入力された音韻文字列などのパラ
メータから音韻あるいは音節それぞれの継続時間を算出
し、継続時間修正部307に出力する。音韻継続時間の
算出方法は、隣接あるいは近傍の音韻の種別により規則
または、数量化1類などの統計的手法を用いて行うのが
一般的であり、ここで算出された音韻継続時間は、通常
(デフォルト)の発声速度の場合での値である。母音無
声化二次判定部304からの入力が、無声化と判定され
た音節に対しては、算出された母音継続時間を当該子音
の音韻継続時間に加算する操作が行われる。
【0071】継続時間修正部307では、ユーザから指
定された発声速度パラメータにより音韻継続時間の修正
が行われる。通常時の発声速度を400[モーラ/分]
とすると、ユーザからの指定値がTlevel[モーラ/
分]の場合、400/Tlevelを母音継続時間長に乗ず
る操作を行う。修正された音韻継続時間は波形生成部1
03に送られる。
定された発声速度パラメータにより音韻継続時間の修正
が行われる。通常時の発声速度を400[モーラ/分]
とすると、ユーザからの指定値がTlevel[モーラ/
分]の場合、400/Tlevelを母音継続時間長に乗ず
る操作を行う。修正された音韻継続時間は波形生成部1
03に送られる。
【0072】次に、母音無声化判定についてフローチャ
ートを参照して詳細に説明する。
ートを参照して詳細に説明する。
【0073】図2は母音無声化判定のフローチャートで
あり、母音無声化の一次・二次判定の処理を表わしてい
る。図中、STはフローの各処理ステップを示す。
あり、母音無声化の一次・二次判定の処理を表わしてい
る。図中、STはフローの各処理ステップを示す。
【0074】初期状態では、ユーザから指定される発声
速度がパラメータTlevelに設定されているものとす
る。パラメータTlevelは例えば、1分間に何モーラの
速度で発声するかという単位で設定され、ユーザからの
指定がない場合は、デフォルト値として例えば400
[モーラ/分]が設定される。
速度がパラメータTlevelに設定されているものとす
る。パラメータTlevelは例えば、1分間に何モーラの
速度で発声するかという単位で設定され、ユーザからの
指定がない場合は、デフォルト値として例えば400
[モーラ/分]が設定される。
【0075】まず、ステップST1で入力された中間言
語を音節単位に検索するための音節ポインタiを0に初
期化し、ステップST2で第i番目の音節の母音の種類
(a,i,u,e,o)をV1に設定する。
語を音節単位に検索するための音節ポインタiを0に初
期化し、ステップST2で第i番目の音節の母音の種類
(a,i,u,e,o)をV1に設定する。
【0076】次いで、ステップST3で子音の種類(無
声子音あるいは無音・有声子音)をC1に設定し、ステ
ップST4で後続音節(第i+1番目の音節)の子音の
種類をC2に設定する。
声子音あるいは無音・有声子音)をC1に設定し、ステ
ップST4で後続音節(第i+1番目の音節)の子音の
種類をC2に設定する。
【0077】次いで、ステップST5で該当母音V1が
「i」または「u」であるかの判定を行う。該当母音V
1が「i」または「u」であるときはステップST6に
進み、該当母音V1が「i」または「u」でないときは
無声化しないと判断してステップST11に進む。
「i」または「u」であるかの判定を行う。該当母音V
1が「i」または「u」であるときはステップST6に
進み、該当母音V1が「i」または「u」でないときは
無声化しないと判断してステップST11に進む。
【0078】ステップST6では、該当子音C1と後続
子音C2が無声子音かあるいは文末・ポーズなのかを判
定する。両方とも無声音かあるいは無音であればステッ
プST7に進み、ステップST7で該当音節にアクセン
ト核が存在するか否かの判定を行う。
子音C2が無声子音かあるいは文末・ポーズなのかを判
定する。両方とも無声音かあるいは無音であればステッ
プST7に進み、ステップST7で該当音節にアクセン
ト核が存在するか否かの判定を行う。
【0079】アクセント核のある音節では高ピッチから
低ピッチへの遷移が存在し、この時間的変化が聴感上の
アクセントを表現するため、ピッチ構造のない無声化処
理は行えない。例えば、「知識(chi′shik
i)」は第1音節にアクセントがあり、第1母音「i」
は無声化子音「ch」と「sh」に挟まれている。しか
し、自然発声においてはアクセント核を明示するために
意図的に声帯を振動させて先頭音節「ち」を発声する。
低ピッチへの遷移が存在し、この時間的変化が聴感上の
アクセントを表現するため、ピッチ構造のない無声化処
理は行えない。例えば、「知識(chi′shik
i)」は第1音節にアクセントがあり、第1母音「i」
は無声化子音「ch」と「sh」に挟まれている。しか
し、自然発声においてはアクセント核を明示するために
意図的に声帯を振動させて先頭音節「ち」を発声する。
【0080】該当音節にアクセント核が存在しなけれ
ば、ステップST8で前音節が無声化したか否かを判定
する。
ば、ステップST8で前音節が無声化したか否かを判定
する。
【0081】これは、無声化が連続して発生し難いこと
を表わしており、例えば「菊池(kikuchi)」の
第1母音「i」は無声化子音「k」に挟まれているので
無声化するが、第2母音「u」は同じように無声化子音
「k」と「ch」に挟まれているにもかかわらず、自然
発声においては声帯を振動させて「く」を発声する。
を表わしており、例えば「菊池(kikuchi)」の
第1母音「i」は無声化子音「k」に挟まれているので
無声化するが、第2母音「u」は同じように無声化子音
「k」と「ch」に挟まれているにもかかわらず、自然
発声においては声帯を振動させて「く」を発声する。
【0082】文先頭音節かまたは前音節が無声化してい
なければ、ステップST9で該当音節が疑問文終端であ
るか否かを判定する。
なければ、ステップST9で該当音節が疑問文終端であ
るか否かを判定する。
【0083】疑問文末はピッチの急激な上昇が起こるた
め無声化は発生しない。例えば、「〜します」と「〜し
ます?」では後者の疑問文末の音節には明らかに強調の
意図が含まれた発声になるため無声化は起こらない。
め無声化は発生しない。例えば、「〜します」と「〜し
ます?」では後者の疑問文末の音節には明らかに強調の
意図が含まれた発声になるため無声化は起こらない。
【0084】疑問文末でなければステップST10に進
み、ステップST10でユーザの指定した発声速度があ
らかじめ決められた制限値を超えているか否かの判定を
行う。ここでの制限値は200[モーラ/分]としてい
る。
み、ステップST10でユーザの指定した発声速度があ
らかじめ決められた制限値を超えているか否かの判定を
行う。ここでの制限値は200[モーラ/分]としてい
る。
【0085】ユーザ指定値Tlevelが200[モーラ/
分]以下の時、すなわち発声速度が遅い時は「無声化し
ない」ステップST11に進み、200[モーラ/分]
を超えている時、すなわち発声速度が速い時は「無声化
する」ステップST12に進む。
分]以下の時、すなわち発声速度が遅い時は「無声化し
ない」ステップST11に進み、200[モーラ/分]
を超えている時、すなわち発声速度が速い時は「無声化
する」ステップST12に進む。
【0086】上記ステップST5で該当母音V1が
「i」または「u」でないとき、上記ステップST6で
該当子音C1と後続子音C2が無声子音でないとき、上
記ステップST7で該当音節にアクセント核が存在しな
いとき、上記ステップST8で前音節が無声化したと
き、上記ステップST9で該当音節が疑問文終端である
とき、あるいは上記ステップST10でユーザの指定し
た発声速度があらかじめ決められた制限値を超えている
ときは、無声化処理を行わないと判断してステップST
11に進み、ステップST11で第i番目の母音無声化
フラグuvflag[i]を0に設定し、第i番目の音
節の処理を終了する。
「i」または「u」でないとき、上記ステップST6で
該当子音C1と後続子音C2が無声子音でないとき、上
記ステップST7で該当音節にアクセント核が存在しな
いとき、上記ステップST8で前音節が無声化したと
き、上記ステップST9で該当音節が疑問文終端である
とき、あるいは上記ステップST10でユーザの指定し
た発声速度があらかじめ決められた制限値を超えている
ときは、無声化処理を行わないと判断してステップST
11に進み、ステップST11で第i番目の母音無声化
フラグuvflag[i]を0に設定し、第i番目の音
節の処理を終了する。
【0087】一方、ステップST12では、第i番目の
母音無声化フラグuvflag[i]を1に設定し、第
i番目の音節の処理を終了する。
母音無声化フラグuvflag[i]を1に設定し、第
i番目の音節の処理を終了する。
【0088】上記ステップST11又はステップST1
2の処理を行った後、ステップST13で音節カウンタ
iを1インクリメントし、ステップST14で音節カウ
ンタiが総モーラ数sum_mora以上か(i≧su
m_moraか)否かを判別し、i<sum_mora
のときは処理が終了していないと判断してステップST
2に戻って次音節の処理を同様に繰り返していく。
2の処理を行った後、ステップST13で音節カウンタ
iを1インクリメントし、ステップST14で音節カウ
ンタiが総モーラ数sum_mora以上か(i≧su
m_moraか)否かを判別し、i<sum_mora
のときは処理が終了していないと判断してステップST
2に戻って次音節の処理を同様に繰り返していく。
【0089】上述した処理は、入力テキスト全音節に対
し行った後すなわち、ステップST14で音節カウンタ
iが総モーラ数sum_moraを超えた時点で終了す
る。
し行った後すなわち、ステップST14で音節カウンタ
iが総モーラ数sum_moraを超えた時点で終了す
る。
【0090】以上説明したように、第1の実施形態に係
る音声合成装置は、パラメータ生成部300が、中間言
語解析部301、ピッチパタン生成部302、字面やア
クセントなどの入力テキストのみを基準に母音の無声化
判定を行う母音無声化一次判定部303、母音無声化一
次判定結果とユーザから指定される発声速度レベルとか
ら最終的な無声化判定を行う母音無声化二次判定部30
4、音韻パワー決定部305、音韻継続時間算出部30
6、及びユーザから指定された発声速度に応じて音韻継
続時間を修正する継続時間修正部307を備え、通常の
発声速度や速い発声速度の時は従来通りの規則に従って
母音の無声化処理を施し、発声速度が遅い時には母音の
無声化処理を施さないように構成したので、発声速度が
遅くなったときの母音無声化処理による無声子音の明瞭
性劣化を防ぐことができ、聴感品質の良い合成音声を生
成することができる。
る音声合成装置は、パラメータ生成部300が、中間言
語解析部301、ピッチパタン生成部302、字面やア
クセントなどの入力テキストのみを基準に母音の無声化
判定を行う母音無声化一次判定部303、母音無声化一
次判定結果とユーザから指定される発声速度レベルとか
ら最終的な無声化判定を行う母音無声化二次判定部30
4、音韻パワー決定部305、音韻継続時間算出部30
6、及びユーザから指定された発声速度に応じて音韻継
続時間を修正する継続時間修正部307を備え、通常の
発声速度や速い発声速度の時は従来通りの規則に従って
母音の無声化処理を施し、発声速度が遅い時には母音の
無声化処理を施さないように構成したので、発声速度が
遅くなったときの母音無声化処理による無声子音の明瞭
性劣化を防ぐことができ、聴感品質の良い合成音声を生
成することができる。
【0091】すなわち、従来の母音無声化時の継続時間
制御方法にあっては、母音が無声化した場合には子音区
間で波形伸縮を行っているため、発声速度を極端に遅く
した場合にその子音の明瞭度が著しく劣化していた。こ
れに対して、本実施形態では、発声速度に応じて母音無
声化処理を行うか否かを決定しているので無声子音長が
極端に長くなり明瞭性が著しく劣化する不具合がなくな
り、聞き易い合成音声を生成することができる。
制御方法にあっては、母音が無声化した場合には子音区
間で波形伸縮を行っているため、発声速度を極端に遅く
した場合にその子音の明瞭度が著しく劣化していた。こ
れに対して、本実施形態では、発声速度に応じて母音無
声化処理を行うか否かを決定しているので無声子音長が
極端に長くなり明瞭性が著しく劣化する不具合がなくな
り、聞き易い合成音声を生成することができる。
【0092】なお、第1の実施形態では、無声化処理を
行わない判定基準として、通常発声速度の半分の200
[モーラ/分]としているがこれに限るものではない。
実験結果よりこの程度の値が適当であると考えられる
が、この制限値をユーザが直接指定できる構成にしても
よい。ユーザが判定基準を0に設定すると従来通りの処
理を行うことになる。
行わない判定基準として、通常発声速度の半分の200
[モーラ/分]としているがこれに限るものではない。
実験結果よりこの程度の値が適当であると考えられる
が、この制限値をユーザが直接指定できる構成にしても
よい。ユーザが判定基準を0に設定すると従来通りの処
理を行うことになる。
【0093】また、図2の無声化判定フローチャートに
おいて、ステップST6〜ステップST10における比
較処理の順番はこれに限るものではない。例えば、ステ
ップST10による発声速度レベルの比較を最初に行う
ことにより残りの処理を節約することが期待できる。こ
の場合、構成上は、母音無声化一次判定部303と母音
無声化二次判定部304の処理順序が逆になることを意
昧する。
おいて、ステップST6〜ステップST10における比
較処理の順番はこれに限るものではない。例えば、ステ
ップST10による発声速度レベルの比較を最初に行う
ことにより残りの処理を節約することが期待できる。こ
の場合、構成上は、母音無声化一次判定部303と母音
無声化二次判定部304の処理順序が逆になることを意
昧する。
【0094】また、母音無声化規則は図2に示すだけの
ものとは限らず、さらに厳密に規則化する方が好まし
い。また、本実施形態で示した通常の発声速度400
[モーラ/分]という値は、一般的に使用されている値
であり、これに限定されない。 第2の実施形態 第1の実施形態は、発声速度が遅くなったときの母音無
声化処理による無声子音の明瞭性劣化を、発声速度レベ
ルに応じて無声化判定を変えるという方法で解決した。
しかし、発声速度がある規定値を下回る速度になると、
母音の無声化が一切発生しなくなり、結果として合成音
声全体を通して聞いた時のリズムが悪くなるという問題
もあった。第2の実施形態では、母音無声化時の音韻継
続時間修正することによって、発声速度がある規定値を
下回る速度であっても母音無声化音節の品質劣化を改善
でき、発声リズムも損なわれない聞き易い合成音声を生
成するものである。
ものとは限らず、さらに厳密に規則化する方が好まし
い。また、本実施形態で示した通常の発声速度400
[モーラ/分]という値は、一般的に使用されている値
であり、これに限定されない。 第2の実施形態 第1の実施形態は、発声速度が遅くなったときの母音無
声化処理による無声子音の明瞭性劣化を、発声速度レベ
ルに応じて無声化判定を変えるという方法で解決した。
しかし、発声速度がある規定値を下回る速度になると、
母音の無声化が一切発生しなくなり、結果として合成音
声全体を通して聞いた時のリズムが悪くなるという問題
もあった。第2の実施形態では、母音無声化時の音韻継
続時間修正することによって、発声速度がある規定値を
下回る速度であっても母音無声化音節の品質劣化を改善
でき、発声リズムも損なわれない聞き易い合成音声を生
成するものである。
【0095】図3は本発明の第2の実施形態に係る音声
合成装置のパラメータ生成部の構成を示すブロック図で
ある。本発明の特徴部分は、第1の実施形態と同様に無
声化判定手段及びその実現方法にある。前記図6に示す
テキスト解析部101、単語辞書104、波形生成部1
03、素片辞書105は従来技術のものと同一でよい。
合成装置のパラメータ生成部の構成を示すブロック図で
ある。本発明の特徴部分は、第1の実施形態と同様に無
声化判定手段及びその実現方法にある。前記図6に示す
テキスト解析部101、単語辞書104、波形生成部1
03、素片辞書105は従来技術のものと同一でよい。
【0096】図3において、パラメータ生成部400
は、中間言語解析部401、ピッチパタン生成部40
2、母音無声化判定部403(母音無声化判定手段)、
音韻パワー決定部404、音韻継続時間算出部405、
継続時間修正部406、伸縮係数決定部407から構成
される。
は、中間言語解析部401、ピッチパタン生成部40
2、母音無声化判定部403(母音無声化判定手段)、
音韻パワー決定部404、音韻継続時間算出部405、
継続時間修正部406、伸縮係数決定部407から構成
される。
【0097】パラメータ生成部400への入力は従来と
同じく韻律記号の付加された中間言語とユーザから指定
される発声速度パラメータである。また、ユーザの好み
や利用形態などにより、声の高さやイントネーションの
大きさを示す抑揚などの声質パラメータを外部から指定
する場合もある。
同じく韻律記号の付加された中間言語とユーザから指定
される発声速度パラメータである。また、ユーザの好み
や利用形態などにより、声の高さやイントネーションの
大きさを示す抑揚などの声質パラメータを外部から指定
する場合もある。
【0098】合成対象の中間言語は中間言語解析部40
1に入力され、ユーザ指定の発声速度パラメータは伸縮
係数決定部407に入力される。
1に入力され、ユーザ指定の発声速度パラメータは伸縮
係数決定部407に入力される。
【0099】中間言語解析部401からの出力データの
うち、例えば、フレーズ区切り記号、単語区切り記号、
アクセント記号といったパラメータはピッチパタン生成
部402に入力され、音韻記号列や単語区切り記号、ア
クセント記号といったパラメータは音韻パワー決定部4
04と音韻継続時間算出部405に入力され、音韻記号
列やアクセント記号といったパラメータは母音無声化判
定部403に入力される。
うち、例えば、フレーズ区切り記号、単語区切り記号、
アクセント記号といったパラメータはピッチパタン生成
部402に入力され、音韻記号列や単語区切り記号、ア
クセント記号といったパラメータは音韻パワー決定部4
04と音韻継続時間算出部405に入力され、音韻記号
列やアクセント記号といったパラメータは母音無声化判
定部403に入力される。
【0100】ピッチパタン生成部402は、入力された
パラメータからフレーズ指令の生起時点と大きさ、アク
セント指令の開始時点・終了時点と大きさといったデー
タを算出し、ピッチパタンを生成する。生成されたピッ
チパタンは波形生成部(前記図6)に入力される。
パラメータからフレーズ指令の生起時点と大きさ、アク
セント指令の開始時点・終了時点と大きさといったデー
タを算出し、ピッチパタンを生成する。生成されたピッ
チパタンは波形生成部(前記図6)に入力される。
【0101】母音無声化判定部403は、字面やアクセ
ントなどの入力テキストを基準に母音の無声化判定を行
い、その判定結果を音韻パワー決定部404と継続時間
修正部406に出力する。
ントなどの入力テキストを基準に母音の無声化判定を行
い、その判定結果を音韻パワー決定部404と継続時間
修正部406に出力する。
【0102】音韻パワー決定部404は、母音無声化判
定結果と、中間言語解析部401から入力される音韻記
号列とから、音韻それぞれの振幅形状を算出し、波形生
成部103に出力する。
定結果と、中間言語解析部401から入力される音韻記
号列とから、音韻それぞれの振幅形状を算出し、波形生
成部103に出力する。
【0103】音韻継続時間算出部405は、中間言語解
析部401から入力される音韻記号列から、音韻それぞ
れの継続時間を算出し、その結果を継続時間修正部40
6に出力する。
析部401から入力される音韻記号列から、音韻それぞ
れの継続時間を算出し、その結果を継続時間修正部40
6に出力する。
【0104】伸縮係数決定部407は、ユーザから指定
された発声速度パラメータから音韻継続時間修正のため
の係数値を算出し、継続時間修正部406に出力する。
された発声速度パラメータから音韻継続時間修正のため
の係数値を算出し、継続時間修正部406に出力する。
【0105】継続時間修正部406は、母音無声化判定
部403からの出力値を勘案しつつ、音韻継続時間算出
部405からの出力値に伸縮係数決定部407の出力値
を乗じて継続時間の修正を行い、その結果を波形生成部
103に出力する。
部403からの出力値を勘案しつつ、音韻継続時間算出
部405からの出力値に伸縮係数決定部407の出力値
を乗じて継続時間の修正を行い、その結果を波形生成部
103に出力する。
【0106】上記継続時間修正部406及び伸縮係数決
定部407は、全体として、ユーザから指定された発声
速度と母音無声化判定部403の判定結果に応じて音韻
継続時間を修正する継続時間修正手段を構成する。
定部407は、全体として、ユーザから指定された発声
速度と母音無声化判定部403の判定結果に応じて音韻
継続時間を修正する継続時間修正手段を構成する。
【0107】以下、上述のように構成された音声合成装
置及び規則音声合成方法の動作を説明する。本実施形態
における特徴部分は、パラメータ生成部400内の処理
である、母音無声化時の音韻継続時間修正方法である。
置及び規則音声合成方法の動作を説明する。本実施形態
における特徴部分は、パラメータ生成部400内の処理
である、母音無声化時の音韻継続時間修正方法である。
【0108】まず、ユーザはあらかじめ発声速度レベル
を指定する。発声速度は通常、1分間に何モーラの割合
で発声するかといった形式のパラメータとして与えら
れ、利用便利上、5〜10段階程度に量子化してそのレ
ベル値を与える。このレベルに応じて、音韻継続時間の
伸長などの処理を行う。発声速度が遅くなると継続時間
は大きくなり、逆に速くなると継続時間は小さくなる。
また、声の高さや抑揚などの声質制御のためのパラメー
タなども指定することができる。ユーザが特に指定しな
い場合は、あらかじめ定められた値(デフォルト値)が
指定値として設定される。
を指定する。発声速度は通常、1分間に何モーラの割合
で発声するかといった形式のパラメータとして与えら
れ、利用便利上、5〜10段階程度に量子化してそのレ
ベル値を与える。このレベルに応じて、音韻継続時間の
伸長などの処理を行う。発声速度が遅くなると継続時間
は大きくなり、逆に速くなると継続時間は小さくなる。
また、声の高さや抑揚などの声質制御のためのパラメー
タなども指定することができる。ユーザが特に指定しな
い場合は、あらかじめ定められた値(デフォルト値)が
指定値として設定される。
【0109】図3に示すように、指定された発声速度制
御用パラメータがパラメータ生成部300内部の伸縮係
数決定部407に送られる。伸縮係数決定部407で
は、継続時間を伸縮するための乗数決定が行われる。通
常時の発声速度を400[モーラ/分]とすると、ユー
ザからの指定値がTlevel[モーラ/分]の場合、発声
速度による継続時間修正係数tpowは400/Tlevelと
する。この結果が継続時間修正部406に送られ、後述
する継続時間の線形伸縮処理に用いられる。
御用パラメータがパラメータ生成部300内部の伸縮係
数決定部407に送られる。伸縮係数決定部407で
は、継続時間を伸縮するための乗数決定が行われる。通
常時の発声速度を400[モーラ/分]とすると、ユー
ザからの指定値がTlevel[モーラ/分]の場合、発声
速度による継続時間修正係数tpowは400/Tlevelと
する。この結果が継続時間修正部406に送られ、後述
する継続時間の線形伸縮処理に用いられる。
【0110】もう一方の入力の中間言語は、中間言語解
析部401に送られ、中間言語解析部401で入力文字
列の解析が行われる。ここでの解析単位として仮に1文
章単位とする。1文章に対応する中間言語から、ピッチ
パタンの生成に関わるパラメータとして例えば、フレー
ズ指令の数とそれぞれのフレーズ指令のモーラ数、アク
セント指令の数とそれぞれのアクセント指令のモーラ数
・アクセント型などの情報がピッチパタン生成部402
に送られる。
析部401に送られ、中間言語解析部401で入力文字
列の解析が行われる。ここでの解析単位として仮に1文
章単位とする。1文章に対応する中間言語から、ピッチ
パタンの生成に関わるパラメータとして例えば、フレー
ズ指令の数とそれぞれのフレーズ指令のモーラ数、アク
セント指令の数とそれぞれのアクセント指令のモーラ数
・アクセント型などの情報がピッチパタン生成部402
に送られる。
【0111】ピッチパタン生成部402では、入力され
たパラメータから数量化1類などの統計的手法を用い
て、フレーズ指令・アクセント指令それぞれの大きさや
立ち上げ・立ち下げ位置などの算出を行い、あらかじめ
規定した応答関数を用いてピッチパタンの生成を行う。
導出されたピッチパタンは波形生成部103に送られ
る。
たパラメータから数量化1類などの統計的手法を用い
て、フレーズ指令・アクセント指令それぞれの大きさや
立ち上げ・立ち下げ位置などの算出を行い、あらかじめ
規定した応答関数を用いてピッチパタンの生成を行う。
導出されたピッチパタンは波形生成部103に送られ
る。
【0112】また、アクセント記号・音韻文字列など
は、母音無声化判定部403に送られ、母音無声化判定
部403で母音の無声化判定が行われる。母音無声化判
定規則は従来例で述べたものと同一でかまわない。判定
結果は、音韻パワー決定部404と継続時間修正部40
6に送られる。
は、母音無声化判定部403に送られ、母音無声化判定
部403で母音の無声化判定が行われる。母音無声化判
定規則は従来例で述べたものと同一でかまわない。判定
結果は、音韻パワー決定部404と継続時間修正部40
6に送られる。
【0113】音韻パワー決定部404では、先に中間言
語解析部401から入力された音韻文字列などのパラメ
ータから音韻あるいは音節それぞれの波形振幅値を算出
し、波形生成部103に出力する。音韻パワーは、音韻
の立ち上がりの徐々に振幅値が大きくなる区間と、定常
状態にある区間と、立ち下がりの徐々に振幅値が小さく
なる区間のパワー遷移のことで、通常、テーブル化され
た係数値から算出される。
語解析部401から入力された音韻文字列などのパラメ
ータから音韻あるいは音節それぞれの波形振幅値を算出
し、波形生成部103に出力する。音韻パワーは、音韻
の立ち上がりの徐々に振幅値が大きくなる区間と、定常
状態にある区間と、立ち下がりの徐々に振幅値が小さく
なる区間のパワー遷移のことで、通常、テーブル化され
た係数値から算出される。
【0114】母音無声化判定部403からの入力が、無
声化と判定された母音に対しては、その音韻パワーは0
に設定される。音韻継続時間算出部405では、先に中
間言語解析部401から入力された音韻文字列などのパ
ラメータから音韻あるいは音節それぞれの継続時間を算
出し、継続時間修正部406に出力する。音韻継続時間
の算出方法は、隣接あるいは近傍の音韻の種別により規
則または、数量化1類などの統計的手法を用いて行うの
が一般的であり、ここで算出された音韻継続時間は、通
常(デフォルト)の発声速度の場合での値である。
声化と判定された母音に対しては、その音韻パワーは0
に設定される。音韻継続時間算出部405では、先に中
間言語解析部401から入力された音韻文字列などのパ
ラメータから音韻あるいは音節それぞれの継続時間を算
出し、継続時間修正部406に出力する。音韻継続時間
の算出方法は、隣接あるいは近傍の音韻の種別により規
則または、数量化1類などの統計的手法を用いて行うの
が一般的であり、ここで算出された音韻継続時間は、通
常(デフォルト)の発声速度の場合での値である。
【0115】継続時間修正部406では、音韻継続時間
算出部405から入力された音韻継続時間を、母音無声
化判定結果と伸縮係数とから変更処理を行う。母音無声
化判定部403からの入力が「無声化しない」であれ
ば、母音継続時間に対して、伸縮係数決定部407の出
力値であるtpowを乗ずる。母音無声化判定部403か
らの入力が「無声化する」であれば、子音継続時間に母
音継続時間を加算し、さらに、伸縮係数決定部407の
出力値である継続時間修正係数tpowを乗ずる。但し、
元の子音継続時間に対して何倍かという制限値を設けて
いる。修正された音韻継続時間は、波形生成部103に
送られる。
算出部405から入力された音韻継続時間を、母音無声
化判定結果と伸縮係数とから変更処理を行う。母音無声
化判定部403からの入力が「無声化しない」であれ
ば、母音継続時間に対して、伸縮係数決定部407の出
力値であるtpowを乗ずる。母音無声化判定部403か
らの入力が「無声化する」であれば、子音継続時間に母
音継続時間を加算し、さらに、伸縮係数決定部407の
出力値である継続時間修正係数tpowを乗ずる。但し、
元の子音継続時間に対して何倍かという制限値を設けて
いる。修正された音韻継続時間は、波形生成部103に
送られる。
【0116】次に、継続時間決定方法についてフローチ
ャートを参照して詳細に説明する。
ャートを参照して詳細に説明する。
【0117】図4は音韻継続時間決定の処理を示すフロ
ーチャートである。図中、STはフローの各処理ステッ
プを示す。
ーチャートである。図中、STはフローの各処理ステッ
プを示す。
【0118】初期状態では、ユーザから指定される発声
速度がパラメータTlevelに設定されているとする(ス
テップST21)。Tlevelは、例えば1分間に何モー
ラの速度で発声するかという単位で設定され、ユーザか
らの指定がない場合は、デフォルト値として例えば40
0[モーラ/分]が設定される。
速度がパラメータTlevelに設定されているとする(ス
テップST21)。Tlevelは、例えば1分間に何モー
ラの速度で発声するかという単位で設定され、ユーザか
らの指定がない場合は、デフォルト値として例えば40
0[モーラ/分]が設定される。
【0119】次いで、ステップST22で発声速度によ
る継続時間修正係数tpowを次式(1)により求める。
る継続時間修正係数tpowを次式(1)により求める。
【0120】 tpow=400/Tlevel …(1) 次いで、ステップST23で中間言語を音節単位に検索
するための音節ポインタiを0に初期化し、ステップS
T24で第i番目の音節に対して母音無声化判定を行
い、無声化すると判定されたらuvを1に、無声化しな
いと判定されたらuvを0に設定する。
するための音節ポインタiを0に初期化し、ステップS
T24で第i番目の音節に対して母音無声化判定を行
い、無声化すると判定されたらuvを1に、無声化しな
いと判定されたらuvを0に設定する。
【0121】次いで、ステップST25で第i番目の音
節の子音長Clenを算出し、ステップST26で母音長
Vlenを算出する。これら子音長Clen及び母音長Vlen
の算出方法は特には定めない。
節の子音長Clenを算出し、ステップST26で母音長
Vlenを算出する。これら子音長Clen及び母音長Vlen
の算出方法は特には定めない。
【0122】次いで、ステップST27で、先に算出さ
れた継続時間の修正を行うため無声化判定結果の比較を
行う。該当音節が無声化しているか否かで修正処理が変
るためである。修正結果は、子音継続時間ClenはCle
n′に、母音継続時間VlenはVlen′に格納されるもの
とする。
れた継続時間の修正を行うため無声化判定結果の比較を
行う。該当音節が無声化しているか否かで修正処理が変
るためである。修正結果は、子音継続時間ClenはCle
n′に、母音継続時間VlenはVlen′に格納されるもの
とする。
【0123】まず、uv=0のときは該当音節が無声化
しないと判定された場合であり、ステップST28で、
次式(2)により母音継続時間の伸縮を行う。
しないと判定された場合であり、ステップST28で、
次式(2)により母音継続時間の伸縮を行う。
【0124】 Vlen′=Vlen×tpow …(2) また、ステップST29で子音継続時間Clenに関して
は修正は行わず(Clen′=Clen)、ステップST34
で音節カウンタiを1インクリメントして次音節の処理
へ移行する。
は修正は行わず(Clen′=Clen)、ステップST34
で音節カウンタiを1インクリメントして次音節の処理
へ移行する。
【0125】一方、uv=1のときは該当音節が無声化
すると判定された場合であり、ステップST30〜ステ
ップST33で無声子音の継続時間の伸長処理を行う。
すなわち、ステップST30で母音継続時間Vlenを0
とし、ステップST31で次式(3)により子音継続時
間Clenの伸縮処理を行う。
すると判定された場合であり、ステップST30〜ステ
ップST33で無声子音の継続時間の伸長処理を行う。
すなわち、ステップST30で母音継続時間Vlenを0
とし、ステップST31で次式(3)により子音継続時
間Clenの伸縮処理を行う。
【0126】 Clen′=(Clen+Vlen)×tpow …(3) 無声化時においては母音が子音に融合されるために、ス
テップST26で算出された母音継続時間Vlenを子音
継続時間に加えた後、修正係数tpowを乗ずるようにし
ている。
テップST26で算出された母音継続時間Vlenを子音
継続時間に加えた後、修正係数tpowを乗ずるようにし
ている。
【0127】次いで、ステップST32で、修正結果が
制限値を超えていないか(Clen′>Clen×3か)判定
を行う。ここでは制限値を、元の子音継続時間の3倍ま
でと規定している。
制限値を超えていないか(Clen′>Clen×3か)判定
を行う。ここでは制限値を、元の子音継続時間の3倍ま
でと規定している。
【0128】制限値を超えていなければ、ステップST
34で音節カウンタiを1インクリメントして次音節の
処理へ移行する。制限値を超えていれば、ステップST
33で子音継続時間を制限値に設定し直した後、ステッ
プST34で音節カウンタiを1インクリメントし、ス
テップST35で音節カウンタiが総モーラ数sum_
mora以上か(i≧sum_moraか)否かを判別
し、i<sum_moraのときは処理が終了していな
いと判断してステップST24に戻って次音節の処理を
同様に繰り返していく。
34で音節カウンタiを1インクリメントして次音節の
処理へ移行する。制限値を超えていれば、ステップST
33で子音継続時間を制限値に設定し直した後、ステッ
プST34で音節カウンタiを1インクリメントし、ス
テップST35で音節カウンタiが総モーラ数sum_
mora以上か(i≧sum_moraか)否かを判別
し、i<sum_moraのときは処理が終了していな
いと判断してステップST24に戻って次音節の処理を
同様に繰り返していく。
【0129】上述した処理は、入力テキスト全音節に対
し行った後すなわち、ステップST35で音節カウンタ
iが総モーラ数sum_moraを超えた時点で終了す
る。
し行った後すなわち、ステップST35で音節カウンタ
iが総モーラ数sum_moraを超えた時点で終了す
る。
【0130】図5は上記継続時間伸長を説明するための
図であり、図5(a)は通常の発声速度での無声化しな
い音節の波形を示す。
図であり、図5(a)は通常の発声速度での無声化しな
い音節の波形を示す。
【0131】図4の処理フローにおけるステップST2
6の終了時点での子音継続時間Clenと母音継続時間Vl
enは図5に示したようになる。この音節がユーザ指定に
よる発声速度Tlevelで修正されると、それぞれの音韻
継続時間Clen′、Vlen′は図5(b)で示す波形とな
る。ここではTlevel=200としているので、母音長
のみが2倍に伸長されることになる。これらは従来例と
変りはない。
6の終了時点での子音継続時間Clenと母音継続時間Vl
enは図5に示したようになる。この音節がユーザ指定に
よる発声速度Tlevelで修正されると、それぞれの音韻
継続時間Clen′、Vlen′は図5(b)で示す波形とな
る。ここではTlevel=200としているので、母音長
のみが2倍に伸長されることになる。これらは従来例と
変りはない。
【0132】次に、図5(a)の波形が無声化した場合
についてみると、従来では母音継続時間Vlen′を0と
し、子音素片のみで継続時間を合わせ込んでいたため、
図5(c)のようになる。無声子音の伸長は、終端を起
点として折り返し波形の継ぎ合わせで実現するため、図
5(c)図中の点線を境界に反転した波形の連続とな
る。これに対し、本実施形態では、無声子音長の伸長を
元の長さの3倍までと制限を設けたために図5(d)に
示す波形となる。したがって、図5(c)と(d)から
明らかなように、発声速度が遅くなっても無声子音長が
極端に長くなり明瞭性が著しく劣化するということがな
くなる。
についてみると、従来では母音継続時間Vlen′を0と
し、子音素片のみで継続時間を合わせ込んでいたため、
図5(c)のようになる。無声子音の伸長は、終端を起
点として折り返し波形の継ぎ合わせで実現するため、図
5(c)図中の点線を境界に反転した波形の連続とな
る。これに対し、本実施形態では、無声子音長の伸長を
元の長さの3倍までと制限を設けたために図5(d)に
示す波形となる。したがって、図5(c)と(d)から
明らかなように、発声速度が遅くなっても無声子音長が
極端に長くなり明瞭性が著しく劣化するということがな
くなる。
【0133】以上説明したように、第2の実施形態に係
る音声合成装置は、パラメータ生成部400が、ユーザ
から指定された発声速度パラメータから音韻継続時間修
正のための係数値を算出し、継続時間修正部406に出
力する伸縮係数決定部407と、母音無声化判定部40
3からの出力値を勘案しつつ、音韻継続時間算出部40
5からの出力値に伸縮係数決定部407の出力値を乗じ
て継続時間の修正を行う継続時間修正部406とを備
え、無声子音の継続時間伸長操作において制限値を設け
るように構成したので、従来例のように発声速度が遅く
なると母音無声化処理により無声子音長が極端に長くな
り明瞭性が著しく劣化する不具合をなくすことができ、
聞き易い合成音声を生成することができる。また、第1
の実施形態よりも発声リズムが安定した合成音声を生成
することが可能となる。
る音声合成装置は、パラメータ生成部400が、ユーザ
から指定された発声速度パラメータから音韻継続時間修
正のための係数値を算出し、継続時間修正部406に出
力する伸縮係数決定部407と、母音無声化判定部40
3からの出力値を勘案しつつ、音韻継続時間算出部40
5からの出力値に伸縮係数決定部407の出力値を乗じ
て継続時間の修正を行う継続時間修正部406とを備
え、無声子音の継続時間伸長操作において制限値を設け
るように構成したので、従来例のように発声速度が遅く
なると母音無声化処理により無声子音長が極端に長くな
り明瞭性が著しく劣化する不具合をなくすことができ、
聞き易い合成音声を生成することができる。また、第1
の実施形態よりも発声リズムが安定した合成音声を生成
することが可能となる。
【0134】したがって、第1の実施形態と同様に、簡
易な構成で、母音無声化時の音韻継続時間を適切に制御
でき、自然な発生リズム感の合成音声を得ることが可能
になる効果がある。
易な構成で、母音無声化時の音韻継続時間を適切に制御
でき、自然な発生リズム感の合成音声を得ることが可能
になる効果がある。
【0135】なお、第2の実施形態では、無声子音長の
伸長限界値を元の継続時間の3倍と規定しているが、こ
れには限らない。例えば、「s」などの無声摩擦音は伸
長しても品質劣化が少ないため3倍、「k」などの無声
破裂音は品質劣化が激しいので2倍までと、無声音の種
類に応じて限界値を定める方がより効果的である。ま
た、限界値は音韻継続時間算出部において数量化1類な
どの手法を用いて算出された継続時間に対する倍数とし
て規定しているが、素片辞書に格納されている時点での
素片長を基準に限界値を決定してもよい。
伸長限界値を元の継続時間の3倍と規定しているが、こ
れには限らない。例えば、「s」などの無声摩擦音は伸
長しても品質劣化が少ないため3倍、「k」などの無声
破裂音は品質劣化が激しいので2倍までと、無声音の種
類に応じて限界値を定める方がより効果的である。ま
た、限界値は音韻継続時間算出部において数量化1類な
どの手法を用いて算出された継続時間に対する倍数とし
て規定しているが、素片辞書に格納されている時点での
素片長を基準に限界値を決定してもよい。
【0136】また、図4の音韻継続時間決定フローチャ
ートにおいて、修正後の継続時間としてClen′,Vle
n′という新たな変数に値を格納しているが、Clen,V
lenを直接修正する方法でもよい。このようにすれば、
ステップST29によるClen′=Clen処理は省略でき
る。また、本実施形態で示した通常の発声速度400
[モーラ/分]という値は一般的に使用されている値で
あり、これに限定されない。
ートにおいて、修正後の継続時間としてClen′,Vle
n′という新たな変数に値を格納しているが、Clen,V
lenを直接修正する方法でもよい。このようにすれば、
ステップST29によるClen′=Clen処理は省略でき
る。また、本実施形態で示した通常の発声速度400
[モーラ/分]という値は一般的に使用されている値で
あり、これに限定されない。
【0137】また、上記各実施形態における規則音声合
成のための継続時間制御方法としては、汎用コンピュー
タによって、ソフトウェアで実現する構成にしても、専
用ハードウェア装置(例えば、テキスト音声合成LS
I)で装置を実現する構成にしてもよい。また、このよ
うなソフトウェアを格納した、フロッピー・ディスク、
CD−ROM等の記録媒体を用いて、必要に応じて読み
出して、汎用コンピュータ上で実行させるような構成に
しても、何ら差支えない。
成のための継続時間制御方法としては、汎用コンピュー
タによって、ソフトウェアで実現する構成にしても、専
用ハードウェア装置(例えば、テキスト音声合成LS
I)で装置を実現する構成にしてもよい。また、このよ
うなソフトウェアを格納した、フロッピー・ディスク、
CD−ROM等の記録媒体を用いて、必要に応じて読み
出して、汎用コンピュータ上で実行させるような構成に
しても、何ら差支えない。
【0138】また、上記各実施形態に係る音声合成装置
では、テキストデータを入力とする音声合成方法に全て
適用することができるが、規則によって任意の合成音声
を得る音声合成装置であればどのようなものでもよく、
各種端末に組み込まれる回路の一部であってもよい。
では、テキストデータを入力とする音声合成方法に全て
適用することができるが、規則によって任意の合成音声
を得る音声合成装置であればどのようなものでもよく、
各種端末に組み込まれる回路の一部であってもよい。
【0139】さらに、上記各実施形態に係る音声合成装
置を構成する辞書や各種回路部の数、モデルの形態など
は前述した各実施形態に限られない。
置を構成する辞書や各種回路部の数、モデルの形態など
は前述した各実施形態に限られない。
【0140】
【発明の効果】本発明に係る音声合成装置では、パラメ
ータ生成部が、発声速度に応じて母音無声化処理を行う
か否かの判定基準を変える母音無声化判定手段を備えて
構成したので、発声速度が遅い場合の母音無声化音節の
品質劣化を改善することができ、聴感品質の良い合成音
声を生成することができる。
ータ生成部が、発声速度に応じて母音無声化処理を行う
か否かの判定基準を変える母音無声化判定手段を備えて
構成したので、発声速度が遅い場合の母音無声化音節の
品質劣化を改善することができ、聴感品質の良い合成音
声を生成することができる。
【図面の簡単な説明】
【図1】本発明を適用した第1の実施形態に係る音声合
成装置のパラメータ生成部の構成を示すブロック図であ
る。
成装置のパラメータ生成部の構成を示すブロック図であ
る。
【図2】上記音声合成装置のパラメータ生成部の母音無
声化判定のフローチャートである。
声化判定のフローチャートである。
【図3】本発明を適用した第2の実施形態に係る音声合
成装置のパラメータ生成部の構成を示すブロック図であ
る。
成装置のパラメータ生成部の構成を示すブロック図であ
る。
【図4】上記音声合成装置のパラメータ生成部の音韻継
続時間決定の処理を示すフローチャートである。
続時間決定の処理を示すフローチャートである。
【図5】上記音声合成装置の継続時間伸長を説明するた
めの図である。
めの図である。
【図6】従来の音声合成装置の構成を示すブロック図で
ある。
ある。
【図7】従来の音声合成装置のパラメータ生成部の構成
を示すブロック図である。
を示すブロック図である。
【図8】発声速度の違いによる波形伸縮を示す図であ
る。
る。
【図9】「取材した」の実発音波形を示す図である。
101 テキスト解析部、103 波形生成部、104
単語辞書、105素片辞書、300,400 パラメ
ータ生成部、301,401 中間言語解析部、30
2,402 ピッチパタン生成部、303 母音無声化
一次判定部(第1の判定手段)、304 母音無声化二
次判定部(第2の判定手段)、305,404 音韻パ
ワー決定部、306,405 音韻継続時間算出部、3
07,406 継続時間修正部(継続時間修正手段)、
403 母音無声化判定部(母音無声化判定手段)、4
07 伸縮係数決定部
単語辞書、105素片辞書、300,400 パラメ
ータ生成部、301,401 中間言語解析部、30
2,402 ピッチパタン生成部、303 母音無声化
一次判定部(第1の判定手段)、304 母音無声化二
次判定部(第2の判定手段)、305,404 音韻パ
ワー決定部、306,405 音韻継続時間算出部、3
07,406 継続時間修正部(継続時間修正手段)、
403 母音無声化判定部(母音無声化判定手段)、4
07 伸縮係数決定部
Claims (8)
- 【請求項1】 音声の基本単位となる音声素片が登録さ
れた素片辞書と、 音韻・韻律記号列に対して少なくとも音声素片、音韻継
続時間、基本周波数の合成パラメータを生成するパラメ
ータ生成部と、 前記パラメータ生成部からの合成パラメータを前記素片
辞書を参照しながら波形重畳を行って合成波形を生成す
る波形生成部とを備えた音声合成装置において、 前記パラメータ生成部は、 発声速度に応じて母音無声化処理を行うか否かの判定基
準を変える母音無声化判定手段を備えたことを特徴とす
る音声合成装置。 - 【請求項2】 音声の基本単位となる音声素片が登録さ
れた素片辞書と、 音韻・韻律記号列に対して少なくとも音声素片、音韻継
続時間、基本周波数の合成パラメータを生成するパラメ
ータ生成部と、 前記パラメータ生成部からの合成パラメータを前記素片
辞書を参照しながら波形重畳を行って合成波形を生成す
る波形生成部とを備えた音声合成装置において、 前記パラメータ生成部は、 母音無声化処理を行うか否かを判定する母音無声化判定
手段と、 ユーザから指定された発声速度に応じて音韻継続時間を
修正する継続時間修正手段とを備え、 前記母音無声化判定手段は、指定された発声速度が所定
の閾値より遅い場合に無声化処理を行わないと判定する
ことを特徴とする音声合成装置。 - 【請求項3】 前記母音無声化判定手段は、 字面やアクセントなどの入力テキストのみを基準に母音
の無声化判定を行う第1の判定手段と、 前記第1の判定手段による判定結果とユーザから指定さ
れる発声速度とから最終的な無声化判定を行う第2の判
定手段とを備えたことを特徴とする請求項1又は2の何
れかに記載の音声合成装置。 - 【請求項4】 前記母音無声化判定手段が、無声化処理
を行わないと判定する閾値は、ユーザが指定できること
を特徴とする請求項1又は2の何れかに記載の音声合成
装置。 - 【請求項5】 前記母音無声化判定手段が、無声化処理
を行わないと判定する閾値は、通常の発声速度の1/2
であることを特徴とする請求項1又は2の何れかに記載
の音声合成装置。 - 【請求項6】 音声の基本単位となる音声素片が登録さ
れた素片辞書と、 音韻・韻律記号列に対して少なくとも音声素片、音韻継
続時間、基本周波数の合成パラメータを生成するパラメ
ータ生成部と、 前記パラメータ生成部からの合成パラメータを前記素片
辞書を参照しながら波形重畳を行って合成波形を生成す
る波形生成部とを備えた音声合成装置において、 前記パラメータ生成部は、 母音無声化処理を行うか否かを判定する母音無声化判定
手段と、 ユーザから指定された発声速度と前記母音無声化判定手
段の判定結果に応じて音韻継続時間を修正する継続時間
修正手段とを備え、 前記継続時間修正手段は、所定の制限値を超えて無声子
音の継続時間の伸長処理を行わないことを特徴とする音
声合成装置。 - 【請求項7】 前記継続時間修正手段が、無声子音の継
続時間の伸長処理を行わない制限値を、前記無声子音の
種別に応じて変更可能に構成したことを特徴とする請求
項6記載の音声合成装置。 - 【請求項8】 前記継続時間修正手段が、無声子音の継
続時間の伸長処理を行わない制限値を、前記素片辞書に
登録された音声素片の長さに応じて変更可能に構成した
ことを特徴とする請求項6記載の音声合成装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP11116263A JP2000305582A (ja) | 1999-04-23 | 1999-04-23 | 音声合成装置 |
| US09/518,275 US6470316B1 (en) | 1999-04-23 | 2000-03-03 | Speech synthesis apparatus having prosody generator with user-set speech-rate- or adjusted phoneme-duration-dependent selective vowel devoicing |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP11116263A JP2000305582A (ja) | 1999-04-23 | 1999-04-23 | 音声合成装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JP2000305582A true JP2000305582A (ja) | 2000-11-02 |
Family
ID=14682780
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP11116263A Abandoned JP2000305582A (ja) | 1999-04-23 | 1999-04-23 | 音声合成装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US6470316B1 (ja) |
| JP (1) | JP2000305582A (ja) |
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2003005775A (ja) * | 2001-06-26 | 2003-01-08 | Oki Electric Ind Co Ltd | テキスト音声変換装置における高速読上げ制御方法 |
| JP2006195207A (ja) * | 2005-01-14 | 2006-07-27 | Kenwood Corp | 音声合成装置、音声合成方法及びプログラム |
| JP2006227367A (ja) * | 2005-02-18 | 2006-08-31 | Oki Electric Ind Co Ltd | 音声合成装置 |
| JP2009003395A (ja) * | 2007-06-25 | 2009-01-08 | Fujitsu Ltd | 音声読み上げのための装置、プログラム及び方法 |
| JP2009008910A (ja) * | 2007-06-28 | 2009-01-15 | Fujitsu Ltd | 音声読み上げのための装置、プログラム及び方法 |
| JP2013205638A (ja) * | 2012-03-28 | 2013-10-07 | Yamaha Corp | 音声合成装置 |
| CN121354534A (zh) * | 2025-12-17 | 2026-01-16 | 科大讯飞股份有限公司 | 语音合成方法、装置、电子设备及存储介质 |
Families Citing this family (40)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3361291B2 (ja) * | 1999-07-23 | 2003-01-07 | コナミ株式会社 | 音声合成方法、音声合成装置及び音声合成プログラムを記録したコンピュータ読み取り可能な媒体 |
| US7941481B1 (en) | 1999-10-22 | 2011-05-10 | Tellme Networks, Inc. | Updating an electronic phonebook over electronic communication networks |
| US6807574B1 (en) | 1999-10-22 | 2004-10-19 | Tellme Networks, Inc. | Method and apparatus for content personalization over a telephone interface |
| JP3728172B2 (ja) * | 2000-03-31 | 2005-12-21 | キヤノン株式会社 | 音声合成方法および装置 |
| JP2002014952A (ja) * | 2000-04-13 | 2002-01-18 | Canon Inc | 情報処理装置及び情報処理方法 |
| US7143039B1 (en) | 2000-08-11 | 2006-11-28 | Tellme Networks, Inc. | Providing menu and other services for an information processing system using a telephone or other audio interface |
| US6873952B1 (en) * | 2000-08-11 | 2005-03-29 | Tellme Networks, Inc. | Coarticulated concatenated speech |
| US7269557B1 (en) * | 2000-08-11 | 2007-09-11 | Tellme Networks, Inc. | Coarticulated concatenated speech |
| JP2002132287A (ja) * | 2000-10-20 | 2002-05-09 | Canon Inc | 音声収録方法および音声収録装置および記憶媒体 |
| JP3673471B2 (ja) * | 2000-12-28 | 2005-07-20 | シャープ株式会社 | テキスト音声合成装置およびプログラム記録媒体 |
| US7177810B2 (en) * | 2001-04-10 | 2007-02-13 | Sri International | Method and apparatus for performing prosody-based endpointing of a speech signal |
| US6950798B1 (en) * | 2001-04-13 | 2005-09-27 | At&T Corp. | Employing speech models in concatenative speech synthesis |
| JP2002366186A (ja) * | 2001-06-11 | 2002-12-20 | Hitachi Ltd | 音声合成方法及びそれを実施する音声合成装置 |
| US7305340B1 (en) * | 2002-06-05 | 2007-12-04 | At&T Corp. | System and method for configuring voice synthesis |
| US20040102964A1 (en) * | 2002-11-21 | 2004-05-27 | Rapoport Ezra J. | Speech compression using principal component analysis |
| US7593849B2 (en) * | 2003-01-28 | 2009-09-22 | Avaya, Inc. | Normalization of speech accent |
| US20050075865A1 (en) * | 2003-10-06 | 2005-04-07 | Rapoport Ezra J. | Speech recognition |
| US20050102144A1 (en) * | 2003-11-06 | 2005-05-12 | Rapoport Ezra J. | Speech synthesis |
| WO2005088606A1 (en) * | 2004-03-05 | 2005-09-22 | Lessac Technologies, Inc. | Prosodic speech text codes and their use in computerized speech systems |
| EP1856628A2 (en) * | 2005-03-07 | 2007-11-21 | Linguatec Sprachtechnologien GmbH | Methods and arrangements for enhancing machine processable text information |
| JP2006309162A (ja) * | 2005-03-29 | 2006-11-09 | Toshiba Corp | ピッチパターン生成方法、ピッチパターン生成装置及びプログラム |
| US20060293890A1 (en) * | 2005-06-28 | 2006-12-28 | Avaya Technology Corp. | Speech recognition assisted autocompletion of composite characters |
| US8249873B2 (en) * | 2005-08-12 | 2012-08-21 | Avaya Inc. | Tonal correction of speech |
| US20070050188A1 (en) * | 2005-08-26 | 2007-03-01 | Avaya Technology Corp. | Tone contour transformation of speech |
| TWI277947B (en) * | 2005-09-14 | 2007-04-01 | Delta Electronics Inc | Interactive speech correcting method |
| JP4744338B2 (ja) * | 2006-03-31 | 2011-08-10 | 富士通株式会社 | 合成音声生成装置 |
| US20080027725A1 (en) * | 2006-07-26 | 2008-01-31 | Microsoft Corporation | Automatic Accent Detection With Limited Manually Labeled Data |
| JP4246792B2 (ja) * | 2007-05-14 | 2009-04-02 | パナソニック株式会社 | 声質変換装置および声質変換方法 |
| JP5029167B2 (ja) * | 2007-06-25 | 2012-09-19 | 富士通株式会社 | 音声読み上げのための装置、プログラム及び方法 |
| US8321225B1 (en) | 2008-11-14 | 2012-11-27 | Google Inc. | Generating prosodic contours for synthesized speech |
| JP5728913B2 (ja) * | 2010-12-02 | 2015-06-03 | ヤマハ株式会社 | 音声合成情報編集装置およびプログラム |
| JP6047922B2 (ja) * | 2011-06-01 | 2016-12-21 | ヤマハ株式会社 | 音声合成装置および音声合成方法 |
| US9824695B2 (en) * | 2012-06-18 | 2017-11-21 | International Business Machines Corporation | Enhancing comprehension in voice communications |
| JP2014038282A (ja) * | 2012-08-20 | 2014-02-27 | Toshiba Corp | 韻律編集装置、方法およびプログラム |
| US10249291B2 (en) * | 2016-05-27 | 2019-04-02 | Asustek Computer Inc. | Animation synthesis system and lip animation synthesis method |
| US10229378B2 (en) * | 2016-09-15 | 2019-03-12 | David A. DILL | System and methods for the selection, monitoring and compensation of mentors for at-risk people |
| TWI582755B (zh) * | 2016-09-19 | 2017-05-11 | 晨星半導體股份有限公司 | 文字轉語音方法及系統 |
| CN113793590B (zh) * | 2020-05-26 | 2024-07-05 | 华为技术有限公司 | 语音合成方法及装置 |
| CN116386593A (zh) * | 2023-03-08 | 2023-07-04 | 腾讯音乐娱乐科技(深圳)有限公司 | 语音合成方法、预测模型的训练方法、服务器和存储介质 |
| GB2642303A (en) * | 2024-07-01 | 2026-01-07 | Ibm | Adjusting speech rate for an audio input |
Family Cites Families (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3219093B2 (ja) * | 1986-01-03 | 2001-10-15 | モトロ−ラ・インコ−ポレ−テッド | 外部のボイシングまたはピッチ情報を使用することなく音声を合成する方法および装置 |
| US5384893A (en) * | 1992-09-23 | 1995-01-24 | Emerson & Stern Associates, Inc. | Method and apparatus for speech synthesis based on prosodic analysis |
| US5903867A (en) * | 1993-11-30 | 1999-05-11 | Sony Corporation | Information access system and recording system |
| JP3340585B2 (ja) * | 1995-04-20 | 2002-11-05 | 富士通株式会社 | 音声応答装置 |
| CA2221762C (en) * | 1995-06-13 | 2002-08-20 | British Telecommunications Public Limited Company | Ideal phonetic unit duration adjustment for text-to-speech system |
| US6240384B1 (en) * | 1995-12-04 | 2001-05-29 | Kabushiki Kaisha Toshiba | Speech synthesis method |
| US6366883B1 (en) * | 1996-05-15 | 2002-04-02 | Atr Interpreting Telecommunications | Concatenation of speech segments by use of a speech synthesizer |
| JPH1195796A (ja) | 1997-09-16 | 1999-04-09 | Toshiba Corp | 音声合成方法 |
| US6101470A (en) * | 1998-05-26 | 2000-08-08 | International Business Machines Corporation | Methods for generating pitch and duration contours in a text to speech system |
| US6185533B1 (en) * | 1999-03-15 | 2001-02-06 | Matsushita Electric Industrial Co., Ltd. | Generation and synthesis of prosody templates |
-
1999
- 1999-04-23 JP JP11116263A patent/JP2000305582A/ja not_active Abandoned
-
2000
- 2000-03-03 US US09/518,275 patent/US6470316B1/en not_active Expired - Lifetime
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2003005775A (ja) * | 2001-06-26 | 2003-01-08 | Oki Electric Ind Co Ltd | テキスト音声変換装置における高速読上げ制御方法 |
| JP2006195207A (ja) * | 2005-01-14 | 2006-07-27 | Kenwood Corp | 音声合成装置、音声合成方法及びプログラム |
| JP2006227367A (ja) * | 2005-02-18 | 2006-08-31 | Oki Electric Ind Co Ltd | 音声合成装置 |
| JP2009003395A (ja) * | 2007-06-25 | 2009-01-08 | Fujitsu Ltd | 音声読み上げのための装置、プログラム及び方法 |
| JP2009008910A (ja) * | 2007-06-28 | 2009-01-15 | Fujitsu Ltd | 音声読み上げのための装置、プログラム及び方法 |
| JP2013205638A (ja) * | 2012-03-28 | 2013-10-07 | Yamaha Corp | 音声合成装置 |
| CN121354534A (zh) * | 2025-12-17 | 2026-01-16 | 科大讯飞股份有限公司 | 语音合成方法、装置、电子设备及存储介质 |
Also Published As
| Publication number | Publication date |
|---|---|
| US6470316B1 (en) | 2002-10-22 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US6470316B1 (en) | Speech synthesis apparatus having prosody generator with user-set speech-rate- or adjusted phoneme-duration-dependent selective vowel devoicing | |
| US6499014B1 (en) | Speech synthesis apparatus | |
| US20080319755A1 (en) | Text-to-speech apparatus | |
| JP5029168B2 (ja) | 音声読み上げのための装置、プログラム及び方法 | |
| JP2000163088A (ja) | 音声合成方法および装置 | |
| JP3576840B2 (ja) | 基本周波数パタン生成方法、基本周波数パタン生成装置及びプログラム記録媒体 | |
| JPH0632020B2 (ja) | 音声合成方法および装置 | |
| US5212731A (en) | Apparatus for providing sentence-final accents in synthesized american english speech | |
| Mandal et al. | Epoch synchronous non-overlap-add (ESNOLA) method-based concatenative speech synthesis system for Bangla. | |
| JPH0580791A (ja) | 音声規則合成装置および方法 | |
| JP3233036B2 (ja) | 歌唱音合成装置 | |
| JP2848604B2 (ja) | 音声合成装置 | |
| JP3235747B2 (ja) | 音声合成装置及び音声合成方法 | |
| JP2003330482A (ja) | 基本周波数パターン生成方法、基本周波数パターン生成装置、音声合成方法、音声合成装置、基本周波数パターン生成プログラムおよび音声合成プログラム | |
| JP2006227367A (ja) | 音声合成装置 | |
| Low et al. | Application of microprosody models in text to speech synthesis. | |
| JP2004206144A (ja) | 基本周波数パタン生成方法、及びプログラム記録媒体 | |
| Chowdhury | Concatenative text-to-speech synthesis: A study on standard colloquial Bengali | |
| JPH01321496A (ja) | 音声合成装置 | |
| JP3088211B2 (ja) | 基本周波数パタン生成装置 | |
| Deng et al. | Speech Synthesis | |
| JPH09325788A (ja) | 音声合成装置及び方法 | |
| JPH0727392B2 (ja) | 音声合成装置 | |
| JPH0756591A (ja) | 音声合成装置、音声合成方法及び記録媒体 | |
| Krivnova et al. | F0 GENERATION IN TTS SYSTEM FOR RUSSIAN LANGUAGE |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20060302 |
|
| A762 | Written abandonment of application |
Free format text: JAPANESE INTERMEDIATE CODE: A762 Effective date: 20070724 |