JPH03136100A - 音声処理方法及び装置 - Google Patents

音声処理方法及び装置

Info

Publication number
JPH03136100A
JPH03136100A JP1274638A JP27463889A JPH03136100A JP H03136100 A JPH03136100 A JP H03136100A JP 1274638 A JP1274638 A JP 1274638A JP 27463889 A JP27463889 A JP 27463889A JP H03136100 A JPH03136100 A JP H03136100A
Authority
JP
Japan
Prior art keywords
speech
synthesis
voice
compression ratio
value
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP1274638A
Other languages
English (en)
Inventor
Junichi Tamura
純一 田村
Atsushi Sakurai
櫻井 穆
Tetsuo Kosaka
哲夫 小坂
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Canon Inc
Original Assignee
Canon Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Canon Inc filed Critical Canon Inc
Priority to JP1274638A priority Critical patent/JPH03136100A/ja
Priority to GB9022674A priority patent/GB2237485B/en
Priority to DE4033350A priority patent/DE4033350B4/de
Priority to FR909012962A priority patent/FR2653557B1/fr
Publication of JPH03136100A publication Critical patent/JPH03136100A/ja
Priority to US08/443,791 priority patent/US5715363A/en
Pending legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • G10L19/09—Long term prediction, i.e. removing periodical redundancies, e.g. by using adaptive codebook or pitch predictor
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/18—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being spectral information of each sub-band
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/93—Discriminating between voiced and unvoiced parts of speech signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 〔産業上の利用分野〕 本発明は音声処理方法及び装置、特に、高品質な合成音
で音声を合成したり、声質を変化させて合成できる音声
処理方法及び装置に関するものである。
〔従来の技術〕
音声合成装置の基本構成を第2図に示す。通常、音声生
成のモデルは、インパルス発生器2、ノイズ発生器3か
ら成る音源部と、音韻の特徴を示す声道の共振特性を表
わす合成フィルタ部4から成っている。前記2者にパラ
メータを送る合成パラメータ格納部lの構成は、図3の
様になっている。音声の分析は分析窓長数m % 数十
m s e c程度で行なわれ、ある分析窓において、
次の分析窓の分析が開始されるまでの区間の分析結果が
、lフレーム分のデータとして、合成パラメータ部に蓄
えられる。合成パラメータ部は、音の高低、有声無声を
表わす音源パラメータと合成フィルタ係数から成ってお
り、合成時には、これら1フレ一ム分の合成パラメータ
を任意の時間間隔(通常は一定時間間隔、分析窓の間隔
を変化させる時は任意)で出力し、合成音を得る。従来
からある音声分析法は、PARCOR,LPC。
LSP、ホルマント、ケプストラム等の方法があった。
これら数ある分析/合成方式の中で、現在、最も合成品
質が高いとされているのが、LSP方式とケプストラム
方式である。LSP方式はスペクトル包絡と、調音パラ
メータとの対応が良いが、PARCOR方式と同様に、
全極モデルに基(パラメータであるので、これを、規則
合成等に用いた場合は、少々、問題があると思われる。
一方ケブスドラム方式は、対数スペクトルのフーリエ係
数で定義されるケプストラムを合成フィルタ係数に用い
るものである。
この方式は、対数スペクトルの包絡情報を用いて、ケプ
ストラムを求めると、合成音の質は非常に良い。また線
形予測法とは異なり、伝達関数の分母。
分子の次数が同じ極零型であるので、補間特性が良く規
則合成器の合成パラメータとしても適している。
しかし、通常のケプストラムでは、質の高い合成音を出
力するためには、分析次数を高くする必要があった。こ
れは、パラメータ格納メモリの容量が増し、好ましくな
い。そこで、人間の聴覚の周波数分解能(低い周波数で
は高く、高い周波数では低い)に合わせ、非直線周波数
メモリ上の対メ 数スペクトルのフーリエ係数で定義される、6ルケブス
トラム係数がある。(つまり通常のケプストラムにメル
目盛による周波数変換(高い周波数に対応するパラメー
タの間引)を施し、抽出されたパラメータ)メル周波数
というのは、ステイーブンスにより推定された人間の聴
覚の周波数分解能を表わす非直線周波数目盛であるが、
通常オールパスフィルタ(全域通過型フィルタ)の位相
特性で近似的に表現することができる。
オールパスフィルタの伝達関数は、 z−1=(z−1−α)/(l−αZ−1)  lα1
<1・・・(1)で表わされ、その位相特性は、 Ω=Ω+2jan−’(a*sinΩ/(1−a・co
sΩ)] ・ (2)〜 jΩ      iΩ Z=e        Z=e Ω=2πfT、  Ω=2πfT ここで、Ω、 f、 Tは、それぞれ規格化角周波数、
周波数、サンプリング周期である。ここで、サン為 プリング周波数が10KHzの時、α=0.35でほぼ
メル尺度に近い周波数に変換できる。
第4図に、メルケブストラムパラメータの抽出フローと
、スペクトルをメル変換した時の様子を第5図に示す。
第5図(a)は、フーリエ変換後の対数スペクトル、第
5図(b)は、平滑化スペクトルと対数スペクトルのピ
ークを通る様なスペクトル包絡を示した。第5図(C)
は、第5図(b)のスペクトル包絡を式(1)によりα
=0.35  として、非直線周波数変換し、低い音の
周波数分解能を高くした図である。ここでは、第5図(
b)と第5図(c)のΩ目盛を等間隔にしであるので、
スペクトル包絡の曲線が低い周波数では拡大され高い周
波数では、圧縮された形になっている。従来は、合成器
側で、αの値が固定されており、合成パラメータ格納部
1からは、第3図に示す音源パラメータと合成フィルタ
係数を送っていた。
[発明が解決しようとしている問題点〕メル周波数を近
似した方式は、パラメータを効率良く圧縮できるが、周
波数領域の高域を圧縮しているので、高域に特徴のある
女声合成には好ましくないと考えられる。また、男声の
様に、低い声であっても、比較的高い周波数領域に音声
の特徴を持つ音声素片、例えば、チャ、チュ、チヨ。
ヒヤ、ヒュ、ヒョを合成した場合等、子音部の明瞭度が
低下する傾向にあった。
〔問題を解決するための手段〕
■1本発明において、音声を構成する音素を各々最適な
値で圧縮するために、音声情報を圧縮する際の非線形伝
達関数の係数である圧縮率を各々の音素に対応させた値
をとる手段を有する。
2本発明において、音声を構成する音素を各々最適な値
で圧縮するために、音声情報を圧縮する際の非線形伝達
関数の係数である圧縮率を各々の音素に対応させた値を
とる方法を用いる。
3、本発明において、音声の音色を変えるために、分析
時の圧縮率を変換し、変換後の圧縮率で音声を合成する
手段を有する。
4、本発明において、音声の音色を変えるために、分析
時の圧縮率を変換し、変換後の圧縮率で音声を合成する
方法を用いる。
実施例1 第1図は、本実施例の構成図を示すものである。
第1図(a)は音声合成装置の構成図、第1図(b)は
合成パラメータ格納部のデータ構造図、第1図(c)は
音声合成装置全体のシステム構成図である。動作の流れ
は第10図、第11図のフローチャートに従って詳細に
説明する。第1図(c)に示すシステム構成図において
、音声波形はマイク200より入力され、LPF (ロ
ー・パス・フィルタ)201によって低周波のみ通過さ
せて、A/Dコンバータ(アナログ・デジタル・コンバ
ータ)202でアナログ信号からデジタル信号に変換さ
れ、本装置全体の動作をメモリ204に従って制御する
CPU205との送受信を行なうインタフェース203
、デイスプレィ207、キーボード208とCPU20
5の送受信を行うインタフェース206、CPU205
からのデジタル信号をアナログ信号に変換するD/Aコ
ンバータ(デジタルφアナログ・コンバータ)209、
低周波のみを通過させるLPF210、増幅器211を
通り、スピーカ212より音声波形が出力される。
第1図(a)における合成装置は、第2図に示す従来の
音声合成装置と同様に、マイク200より入力された音
声波形をCPU205において分析し、分析結果である
データを1フレームずつ合成パラメータ転送制御部10
1が、一定のフレーム周期間隔で合成パラメータ部10
0から音声合成部105に送る。
音声の分析の動作の流れは第10図のフローチャートに
示し、詳細に説明する。第10図(a)は音声分析の流
れを示すメインフローチャート、第1O図(b)は音声
の分析・合成フィルタ係数の抽出動作の流れを示すフロ
ーチャート、第10図(c)は音声入力波形のスペクト
ル包絡の抽出動作の流れを示すフローチャート、第10
図(d)は音声の合成フィルタ係数の抽出動作の流れを
示すフローチャートである。入力された音声波形は、あ
る分析窓において、次の分析窓における分析が、開始さ
れるまでの区間をlツーレムとし、今後、このフレーム
を単位として分析・合成か行われる。第1O図に示すフ
ローチャートにおいて、最初、フレームナンバーiを0
とおく (SL)。次に、まず、フレームナンバーを更
新しくS2)、lフレーム分のデータがCPU205に
入力され(S3)、ここで音声入力波形の分析、合成フ
ィルタ係数の抽出が行われる(S4)。音声分析・合成
フィルタ係数の抽出には、音声入力波形のスペクトル包
絡の抽出(S8)と合成フィルタ係数の抽出(S9)が
行われる。スペクトル包絡の抽出は、第1O図(C)の
フローチャートにより示されるが、まず、入力された音
声波形は一つのフレーム長さのデータを有限長の信号と
みる為にある特定の窓がかけられ(S10)、フーリエ
変換を行い(Sll)、対数をとり(Si2)、この値
は対数スペクトルX(Ω)としてメモリ204において
格納バッファに保存される(S13)。次に逆フーリエ
変換しく514)、この値をケプストラム係数C(n)
とする。ケプストラム係数C(n)を平滑化するために
ある特定の窓で切りとり(リフタリング)(S15)、
第1O図(C)におけるiをQとしく516)、フーリ
エ変換したものが平滑化スペクトルsl (Ω)となる
(S17)。格納バッファに保存しておいたX(Ω)か
ら平滑化スペクトルsl (Ω)を引いて、負の値を削
除したものを残差スペクトルE1(Ω)としく318)
、適当な加速係数すについてEl(Ω)= (1+b)
E’ (Ω)を計算しく519)、更にこの平滑化スペ
クトル田(Ω)を求めるために逆フーリエ変換(S20
)、リフタリング(S21)、フーリエ変換(S22)
を行い、ジ(Ω)+s’ (Ω)を荘(Ω)としく52
3)、iをi+1に置き換え(S24)、iが4になる
まで(S25)51Bから324を繰り返す。iが4に
なった時(S24)の肥(Ω)の値をスペクトル包絡S
(Ω)とする。
ここで、iは3〜5回が適当である。合成フィルタ係数
の抽出は、第10図(d)のフローチャートに示すが、
第10図(c)のフローチャートで求められたスペクト
ル包絡S(Ω)を、聴覚の周波数特性であるメル周波数
に変換する。このメル周波数を近似的に表現するオール
パスフィルタの位相特性は、第(2)式に示したが、こ
の位相特性の逆関数である第(3)式 によって非線形周波数変換を行う(S27)。(ここで
、αの値はあらかじめ波形データにラベル情報(波形に
対応させた音韻記号)を付加しておき、これによって決
める)。そして非線形周波数変換後のスペクトル包絡が
求まり、これを逆フーリエ変換しく828)、ケプスト
ラム係数Ca (m)を求める。
このケプストラム係数Ca(m)で b i(m)= Ca(m)+ b(Ca(m−1)−
b(m+1)  −(4)上記(4)式によりフィルタ
係数b’ (m) (i :フレーム番号9川:次数)
を求める(S29)。
この求まったフィルタ係数b’(m)を、メモリ204
にある合成パラメータ格納部lに格納する(S5)。
この合成パラメータ格納部1の構造は第1図(b)に示
すが、フレーム番号iの1フレ一ム分の合成パラメータ
はV/Vi (Voice (有声) /Unvoic
e(無声))判別データ、ピッチ等の韻律に関する情報
、音韻を表わすフィルタ係数b’(m)の他に、周波数
変換率α、の値があり、この周波数圧縮率飢の値はCP
U205が音声入力波形分析時に個々の音素に対応させ
た最適な値となっている。ここでα、とは、第(1)式
に示したオールパスフィルタの伝達関数のα係数と定義
する(iはフレーム番号)。αが小さいと圧縮率も小さ
く、αが大きいと圧縮率も大きくなるという関係にある
。例えば男声有声ル 音をサンプリング周波数10 K Hzで分析する場合
、α=0.35程度にする。同一のサンプリング周期で
も、特に女声の場合はαの値を小さめにしてケプストラ
ム係数の次数を増やした方が女声らしい明瞭度の高い音
声が得られる。ここでは、あらかじめ作成されである第
1図(d)に示すテーブルによってαの値に対応したケ
プストラム係数の次数が決まっており、合成パラメータ
転送制御部101は、この第1図(d)に示すテーブル
を参照して次数分だけのデータを合成パラメータ格納部
100から音声合成部105に転送する。このとき、現
フレームと次フレームをサンプル単位で補間した補間デ
ータを送出すると更に良い音声を得ることができる。
ここで音声を合成する動作の流れを示すフローチャート
を第11図に示す。音声の合成時に周波数圧縮率α、と
ケプストラム係数の次数を対応させる変換テーブル10
6をメモリ204に持つ場合と持たない場合がある。ま
ず、変換テーブル106がある場合の音声の合成動作の
流れを示すフローチャートを第11図(a)に示す。ま
ず、メモリ204中の合成パラメータ格納部100から
1フレ一ム分のデータの周波数圧縮率αの値をCPU2
05に読み込み(S31)、次数参照テーブル106か
らαに対応するケプストラム係数の次数PをCPU20
5に読み込む(S32)。
合成パラメータ格納部100から次数P分だけのフィル
タ係数のデータb’(p)をCPU205に読み込み、
フレームデータの残りの部分、Q次分(30φ 次−P次=Q次)にはもを入れる(S33)。作成され
たフレームデータをメモリ204中のBuff (Ne
w)に格納する(S34)。
次に、次数参照テーブル106をメモリ204中に持た
ない場合の音声合成の動作の流れを第11図(b)のフ
ローチャートに示す。
これは合成パラメータ転送制御部101がデータを補間
しながら音声合成部105に転送する流れである。まず
、メモリ204中の合成パラメータ格納部100から開
始フレームのデータを現フレームデータとしてBuff
 (old)に入力する(S35)。次に合成パラメー
タ格納部100から次のフレーム番号のフレームデータ
をBuff(New)に格納する(S36)。
Buff (New)とBuff (old)の差を補
間するサンプル数nで割った値をBuff (diff
er)とする(S37)。現フレームデータBuff 
(old)にBuff(differ)を加えた値を現
フレームデータBuff(old)とする(S38)。
この状態で、転送要求が音声合成部105より出される
まで(S39)待つ(S40)。
転送要求が出たら、現フレームデータBuff (ol
d)を合成フィルタ104に転送する(S41)。現フ
レームデータBuff (old)と次フレームデータ
Buff(New)が同じものかどうか判断しく542
)、同じものでなければ戻ワて、Buff (old)
 =Buff (New)となるまでS38からS42
までを繰り返す。S42において、Buff (old
) =Buff (New)と判断されたならば、Bu
ff (New)を現フレームデータBuff (ol
d)として置き換える(S43)。合成パラメータ格納
部100内のフレームデータの転送がすべて終了したか
判断しく544)、終了していなければ戻り、終了する
までS36からS44を繰り返す。
次に、音声合成部105における動作の流れを示すフロ
ーチャートを第11図(C)に示す。
まず、合成パラメータ転送制御部101より音声合成部
105へと合成パラメータが入力されてくると(S45
)、U/Vデータはパルス発生器102に送られ(S4
6)、PitchデータはU/V切換器107に送られ
(S47)、フィルタ係数とαの値は合成フィルタ10
4に送られる(348)。合成フィルタ部104では合
成フィルタの計算が行われる(S49)。
ここで、合成フィルタの計算が終了しても、クロック1
08からサンプル出力タイミングパルスが出力されるま
で(S51)待つ(S52)。サンプル出力タイミング
パルスが出力されたら(S51)、合成フィルタの計算
結果をD/Aコンバータ209に出力しく552)、転
送要求を合成パラメータ転送制御部101に送出する(
S53)。
ここで、第12図にMLSAフィルタの構成を示します
カーこれは、合成フィルタ104の伝達関数をH(Z)
で表すと、 H(Z)−exp(b(0)/2)・R4(F(Z))
 ・・曲+++++++・+曲間++++++ (3)
F(Z)=Z−’(b(1)+b(2)Z−’+b(3
)Z−”+−+b(30)Z−1)−曲(4)(ここで
R4は指数関数を4次のPade  近似で表わしたも
のである)第(1)式を第(4)式に、第(4)式を第
(3)式に代入した形の合成フィルタである。第(1)
式、第(3)式、第(4)式に示すフィルタ構成で周波
数変換率αと、フィルタに与える係数の次数Pを変化さ
せることにより、入力音声は最適な周波数圧縮率で圧縮
され、作成されたフィルタ係数により、個々のフレーム
に対応した周波数伸長率で音声を合成することができる
。
また、ここでは第(1)式に示す様な1次の全域通過型
フィルタを用いて、周波数変換を行ったが、多次の全域
通過型フィルタから構成される合成フィルタを用いると
、得られたスペクトル包絡め任意の部分について周波数
の圧縮・伸長が行える。
実施例2 前記実施例1では、分析時の周波数圧縮率αとフィルタ
係数の次数Pを合成時のαとPに対応させることによっ
て高品質な音声を合成した。
本実施例では周波数圧縮率αの値を一定として分析した
合成パラメータを、合成パラメータ転送制御部101で
変換してから音声合成部105に転送することにより音
質(声色)を変化させて合成できる。αの値を変化させ
た場合の(lフレームに含まれる)スペクトルの様子を
第1図Cf1)に示す。
分析時のαの値、α、=0.35とし、合成時のαの値
を、α、=0.15. α、=0.35. α、=0.
45と変化させている。α、くα、となる様な変換を行
って合成した場合、低域に重みのかかった太い声になり
、α、〉α1の場合は、広域に重みのかかった細い声に
なる。
αの値を変換する方法としては、 1、αの値を変化させる変換テーブルを作成しておき、
変換テーブルを参照することによって得られた変換後の
αの値を合成時に用いる方式2、αの値を線形成いは非
線形の関数式により変化させた後、このαの値を用いる
方式 がある。分析時のαの値と合成時のαの値を同じに保ち
、対応させるか、異なる値に変換した後の値を対応させ
るか、対応のさせ方はいろいろある。
本実施例中では、フレーム単位で対応させていたが、こ
れは、音素単位、音節単位であっても良いし、私考単位
であっても良い。
合成時の明瞭度を向上させる為には、例えば、キャ:/
に/j/a/であるならば、キヤの子音部/に/の明瞭
度を向上させることが最も望ましい。
よって/に/部の分析時に明瞭度を向上させる為にαを
小さく、Pを大きくする。例えばα=0.21゜P=3
0次程度にして分析を行い、パラメータを合成パラメー
タ格納部100に格納しておく。717部ではαの値を
次第に大きくし、/a/部ではα=0.35. P=1
6次になる様にすればフレーム補間もスムーズに行われ
る。このフレームごとの周波数変換率αの値、合成フィ
ルタに与える係数の次数の変化を第6図に示す。
分析時のαと合成時のαを変える時の方法として前記し
た第1の方法、変換テーブルを用いてαの値を変える場
合、第7図(a)に示す様に合成器に与えるPitch
の値に対応させて、αの値を指定しておくと高いピッチ
周波数において低い周波数成分が強調された音となり、
低いピッチ周波数において、高い周波数成分が強調され
た音となる。
第7図(b)に示す様に、b (o)と対応させる事に
よって、大きな声の時は低い周波数成分を強調し、小さ
い声では高い周波数成分を強調して合成音を出力できる
。
また、第2の方法として前記した、αの値を関数によっ
て変化させる場合、例えば、分析時のαの値(説明を解
り易(するために、全フレームにおいてα=0.35.
  P=16次とする)を、合成する時に一定の周期で
変調させた値にすることができる。これは、第1図(a
)の合成パラメータ転送制御部101に変調周期、変調
周波数(例えば0.35±0.1)を入力する手段を設
けることによって、入力された音声のスペクトル分布を
時間的に変調させ、入力音声とは違った音声を出力する
ことができる。α変調の式を第8図、α変調の様子を第
9図に示す。
α変調の方法は、振幅4周波数9位相変調どれでも良い
。これに関して、音声の振幅情報(本実施例ではb (
o); O次項のフィルタ係数)の値をαの値に関連を
持たせても良い。1例をあげると第90図に示すαの値
を用いて、b″(。)=(α−0,35+1) ・b’
(o) (b’(0) ; oldb (0) B’(
o) ;newb (。))として、合成フィルタのb
 (o)の値を変化させる事もできる。
ピッチに関してもPitch”= (α−0,35+ 
1 )・Pitch’ (Pitch” : old 
; Pitch” : Hew )と関連を持たせる事
ができるし、逆に、パワー項、ピッチの値を用いてαの
値を変化させても良い。
発明の効果 1、音声情報を圧縮する際の非線形伝達関数の係数であ
る圧縮率を、音声を構成する各音素に対応させた値にと
る手段を設けることにより、音素が各々最適な値で圧縮
されるため、子音部の明瞭度が向上し、高品質な音声が
合成可能となる。
2、音声情報を圧縮する際の非線形伝達関数の係数であ
る圧縮率を、音声を構成する各音素に対応させた値にと
る方法を用いることにより、音素が各々最適な値で圧縮
されるため、子音部の明瞭度が向上し、高品質な音声が
合成可能となる。
3、音声分析時の圧縮率を変換する手段と、変換した圧
縮率を用いて音声を合成する手段を有することにより、
圧縮率を変換するだけで音声の声色を変えることが可能
となる。
4、音声分析時の圧縮率を変換する方法と、変換した圧
縮率を用いて音声を合成する方法を用いることにより、
圧縮率を変換するだけで音声の声色を変えることが可能
となる。
【図面の簡単な説明】
第1− (a)図は、本発明の主要な実施例を示す音声
合成装置の構成図、 第1− (b)図は、第1図(a)の合成パラメータ格
納部のデータ構造図、 第1− (c)図は、本発明の主要な実施例を示すシス
テム構成図、 第1−(d)図は、αiの値によりケプストラム係数の
次数を参照するためのテーブル構造図、第1− (e)
図は、第1図(b)において次数の異なるフレーム間を
補間する際にデータにφを押入した図、 第1−(f)図は、αの値が分析時と合成時で異なる場
合の原音と合成音のスペクトル図、第2図は、従来の音
声合成装置の構成図、第3図は、従来の合成パラメータ
格納部のデータ構造図、 第4図は、非線形周波数変換を行う合成パラメータ描出
分析フロー図、 第5図(a)は、第4図における対数スペクトルの図、 第5図(b)は、第4図における改良ケプストラム法に
より求めたスペクトル包絡の図、第5図(c)は、第5
図(b)におけるスペクトル包絡を非線形周波数変換を
行った図、第6図は、子音部の明瞭度を向上させるため
の、音素に対する合成パラメータの次数とαの値を対応
させた一例の図、 第7図(a)は、ピッチによりαの値を変換するテーブ
ルの図、 第7図(b)は、パワー項によりαの値を変換するテー
ブルの図、 第8図は、音声の声質を変えるためのα変調の式、第9
図は、変調の様子を示すαの波形図、第1O−(a)図
は音声分析の流れを示すメインフローチャート図 第1O−(b)図は、第10− (a)図における音声
の分析、合成フィルタ係数の抽出を示すフローチャート
図、 第1O−(c)図は、第10− (b)図における音声
入力波形のスペクトル包絡の抽出フローチャート図、 第10− (d)図は、第10− (b)図における音
声の合成フィルタ係数の抽出を示すフローチャート図、 第11図(a)は、次数変換テーブルがある場合の音声
の合成を示すフローチャート図、第11図(b)は、合
成パラメータ転送制御部のフローチャート図、 一9J12図は、ML、SAフィルタの構成図。 悌1− (し)図 功1 (C)図 哲声域形2フ ” !−” ”cx n <it t(?、、:e?;
9’r17)2’V71−JL縄J<41へ舌のスへ′
クトノC〉 喝Zの 83図 奮滞、++°ラゾーク &晒フィルタイ爪叡 今枡フ〇− 1今て 1乙の ″+者名しの明@&度同上 咥70 cX  霊−千之j゛−7リレ (山ン 冨C)図 尾8図 斐謔の表 (−伴)) (A−Of) (′f;ψ) 可t) Q−間 鵠11 ≦り (久ン

Claims (7)

    【特許請求の範囲】
  1. (1)入力された音声を分析する分析手段、該音声を分
    析して得た音声情報を非線形伝達関数に従って圧縮する
    圧縮手段、該圧縮手段の伝達関数係数である圧縮率を該
    音声を構成する各音素に最適な値に対応させる手段、該
    音声情報を格納する格納手段を有することを特徴とする
    音声処理装置。
  2. (2)入力された音声を分析して音声情報を得、該音声
    情報を圧縮する際の非線形伝達関数の係数である圧縮率
    を音声を構成する各音素に最適な値に対応させ、圧縮し
    格納する方法。
  3. (3)音声情報を読み込む手段、該音声情報における圧
    縮率を変換する変換手段、該圧縮率における非線形伝達
    関数に従って音声を合成する合成手段を有することを特
    徴とする音声処理装置。
  4. (4)音声情報を読み込み、該音声情報における圧縮率
    を変換し、該圧縮率における非線形伝達関数に従って音
    声を合成する方法。
  5. (5)特許請求の範囲第1、2、3、4項に述べた非線
    形伝達関数は、圧縮率をαとした時、 ■^−^1=(Z^−^1−α)/(1−αZ^−^1
    )で表わされること。
  6. (6)特許請求の範囲第3、4項で述べた圧縮率の変換
    には、テーブルや関数式を用いても良いこと。
  7. (7)特許請求の範囲第1、2、3、4、5項で述べた
    非線形伝達関数は圧縮率を調整することにより、人間の
    聴覚の周波数分解能に近い周波数軸をとることが可能で
    あること。(8)特許請求の範囲第3、4項に述べた合
    成手段は一次のオールパスフィルタ(全域通過型フィル
    タ)を遅延子として構成される対数スペクトル近似フィ
    ルタを用いること。
JP1274638A 1989-10-20 1989-10-20 音声処理方法及び装置 Pending JPH03136100A (ja)

Priority Applications (5)

Application Number Priority Date Filing Date Title
JP1274638A JPH03136100A (ja) 1989-10-20 1989-10-20 音声処理方法及び装置
GB9022674A GB2237485B (en) 1989-10-20 1990-10-18 Method and apparatus for processing speech
DE4033350A DE4033350B4 (de) 1989-10-20 1990-10-19 Verfahren und Vorrichtung für die Sprachverarbeitung
FR909012962A FR2653557B1 (fr) 1989-10-20 1990-10-19 Appareil et procede pour le traitement de la parole.
US08/443,791 US5715363A (en) 1989-10-20 1995-05-18 Method and apparatus for processing speech

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1274638A JPH03136100A (ja) 1989-10-20 1989-10-20 音声処理方法及び装置

Publications (1)

Publication Number Publication Date
JPH03136100A true JPH03136100A (ja) 1991-06-10

Family

ID=17544493

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1274638A Pending JPH03136100A (ja) 1989-10-20 1989-10-20 音声処理方法及び装置

Country Status (5)

Country Link
US (1) US5715363A (ja)
JP (1) JPH03136100A (ja)
DE (1) DE4033350B4 (ja)
FR (1) FR2653557B1 (ja)
GB (1) GB2237485B (ja)

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2002372982A (ja) * 2001-06-15 2002-12-26 Secom Co Ltd 音響信号分析方法及び装置
JP2007017905A (ja) * 2005-07-11 2007-01-25 Ntt Docomo Inc 信号符号化装置、信号復号化装置、信号符号化方法、及び信号復号化方法。
JP2008040157A (ja) * 2006-08-07 2008-02-21 Casio Comput Co Ltd 音声符号化装置、音声復号装置、音声符号化方法、音声復号方法、及び、プログラム

Families Citing this family (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE19616103A1 (de) * 1996-04-23 1997-10-30 Philips Patentverwaltung Verfahren zum Ableiten charakteristischer Werte aus einem Sprachsignal
US5998725A (en) * 1996-07-23 1999-12-07 Yamaha Corporation Musical sound synthesizer and storage medium therefor
DE19860133C2 (de) * 1998-12-17 2001-11-22 Cortologic Ag Verfahren und Vorrichtung zur Sprachkompression
FR2796193B1 (fr) * 1999-07-05 2001-10-05 Matra Nortel Communications Procede et dispositif de codage audio
GB2373005B (en) * 2001-03-10 2005-01-12 Roger Wilde Ltd Fire rated glass flooring
JP4256189B2 (ja) * 2003-03-28 2009-04-22 株式会社ケンウッド 音声信号圧縮装置、音声信号圧縮方法及びプログラム
JP4110573B2 (ja) * 2003-09-16 2008-07-02 横河電機株式会社 パルスパターン発生装置
US7860256B1 (en) * 2004-04-09 2010-12-28 Apple Inc. Artificial-reverberation generating device
US8249861B2 (en) * 2005-04-20 2012-08-21 Qnx Software Systems Limited High frequency compression integration
US8086451B2 (en) * 2005-04-20 2011-12-27 Qnx Software Systems Co. System for improving speech intelligibility through high frequency compression

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3681530A (en) * 1970-06-15 1972-08-01 Gte Sylvania Inc Method and apparatus for signal bandwidth compression utilizing the fourier transform of the logarithm of the frequency spectrum magnitude
US4260229A (en) * 1978-01-23 1981-04-07 Bloomstein Richard W Creating visual images of lip movements
US4304965A (en) * 1979-05-29 1981-12-08 Texas Instruments Incorporated Data converter for a speech synthesizer
EP0076234B1 (de) * 1981-09-24 1985-09-04 GRETAG Aktiengesellschaft Verfahren und Vorrichtung zur redundanzvermindernden digitalen Sprachverarbeitung
CA1243779A (en) * 1985-03-20 1988-10-25 Tetsu Taguchi Speech processing system
US4922539A (en) * 1985-06-10 1990-05-01 Texas Instruments Incorporated Method of encoding speech signals involving the extraction of speech formant candidates in real time
GB2207027B (en) * 1987-07-15 1992-01-08 Matsushita Electric Works Ltd Voice encoding and composing system
US4882754A (en) * 1987-08-25 1989-11-21 Digideck, Inc. Data compression system and method with buffer control
JP2763322B2 (ja) * 1989-03-13 1998-06-11 キヤノン株式会社 音声処理方法

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2002372982A (ja) * 2001-06-15 2002-12-26 Secom Co Ltd 音響信号分析方法及び装置
JP2007017905A (ja) * 2005-07-11 2007-01-25 Ntt Docomo Inc 信号符号化装置、信号復号化装置、信号符号化方法、及び信号復号化方法。
JP2008040157A (ja) * 2006-08-07 2008-02-21 Casio Comput Co Ltd 音声符号化装置、音声復号装置、音声符号化方法、音声復号方法、及び、プログラム

Also Published As

Publication number Publication date
DE4033350A1 (de) 1991-04-25
US5715363A (en) 1998-02-03
GB2237485A (en) 1991-05-01
FR2653557B1 (fr) 1993-04-23
GB9022674D0 (en) 1990-11-28
GB2237485B (en) 1994-07-06
DE4033350B4 (de) 2004-04-08
FR2653557A1 (fr) 1991-04-26

Similar Documents

Publication Publication Date Title
JP3985814B2 (ja) 歌唱合成装置
JP2763322B2 (ja) 音声処理方法
JP3294604B2 (ja) 波形の加算重畳による音声合成のための処理装置
US5682502A (en) Syllable-beat-point synchronized rule-based speech synthesis from coded utterance-speed-independent phoneme combination parameters
JP2003255998A (ja) 歌唱合成方法と装置及び記録媒体
US5715363A (en) Method and apparatus for processing speech
JP6821970B2 (ja) 音声合成装置および音声合成方法
JPH0160840B2 (ja)
JP2001034280A (ja) 電子メール受信装置および電子メールシステム
CN100524456C (zh) 歌唱声音合成方法和装置
JP3513414B2 (ja) フォルマント・シフト補償音響シンセサイザおよびその操作方法
JP2951514B2 (ja) 声質制御型音声合成装置
JP2612867B2 (ja) 音声ピッチ変換方法
JPH09179576A (ja) 音声合成方法
JPH1031496A (ja) 楽音発生装置
JP2583883B2 (ja) 音声分析装置および音声合成装置
JP3294192B2 (ja) 音声変換装置及び音声変換方法
JP3302075B2 (ja) 合成パラメータ変換方法および装置
JP2003066983A (ja) 音声合成装置および音声合成方法、並びに、プログラム記録媒体
JPS5880699A (ja) 音声合成方式
JP2956936B2 (ja) 音声合成装置の発声速度制御回路
JP2000003187A (ja) 音声特徴情報記憶方法および音声特徴情報記憶装置
JP2004287350A (ja) 音声変換装置、音声効果付与装置、及びプログラム
JPS5950079B2 (ja) 音声合成方法
JP2003173198A (ja) 音声辞書作成装置、音声合成装置、音声辞書作成方法、音声合成方法及びプログラム