JPS5872194A - 音声分析符号化方式 - Google Patents

音声分析符号化方式

Info

Publication number
JPS5872194A
JPS5872194A JP56170390A JP17039081A JPS5872194A JP S5872194 A JPS5872194 A JP S5872194A JP 56170390 A JP56170390 A JP 56170390A JP 17039081 A JP17039081 A JP 17039081A JP S5872194 A JPS5872194 A JP S5872194A
Authority
JP
Japan
Prior art keywords
analysis
frame
frames
speech
composite
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP56170390A
Other languages
English (en)
Inventor
櫛木好明
高井紀代
今井良彦
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Priority to JP56170390A priority Critical patent/JPS5872194A/ja
Publication of JPS5872194A publication Critical patent/JPS5872194A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 本発明は音声合成装置に与える音声データの分析符号化
方式に関するものである。
現在、線形予測や偏自己相関などを用いた音声分析合成
法が広く用いられている0第1図はその音声分析合成法
の流れ図を示したものである0入力された音声信号は例
えば10六でサンプリングさti;12ビツトで符号化
する2によシ音声ディジタルデータが得られる。得らn
た音声ディジタルデータを、線形予測や偏自己相関等を
用いて一定時間幅(分析フレームサイズ)毎に分析し、
分析時間幅(例えば20 m5ec )毎の音声の特徴
を表わすパラメータを得る。このパラメータは基本周波
数、振幅、線形予測係数あるいは偏自己相関係数、有声
・無声・無音判定値である。このパラメータに対し、符
号化による圧縮を行ない、合成時間幅毎に得られたパラ
メータを音声合成装置に供給して、音声合成を行なう。
そして従来の音声分析合成法はこの分析時間幅と合成時
間幅を等しくかつ固定とする方法が広く用いられている
。
第2図は、分析時間幅のとり方を示した図である。lは
分析時間幅が固定で長い場合(例えば20 m5ec 
)、■は分析時間幅が固定で短い場合(例えばts m
5ec )、■は音声の特徴により、て分析時間幅を変
化させる可変長フレームについて示している。第2図■
、■は、それぞn原音と合成音を示しており、I、II
および■におけるフレームとの対応で示され゛〔いる0
図中の21〜F28はフレームナンバーを表わす。同図
1で示す分析時間幅が固定で長い場合、データ量が少な
くなる利点があるが、(1)分析時間幅に満たない子音
が埋もれてしまう、(11)有声部と無声部の混在する
フレームが現れる問題点があり、これらは音質劣化、特
に子音の明瞭性劣化の原因になっている。第2図のフレ
ームF2がその例にあたる。
また第2図■の分析時間幅が固定で短かい場合、ト述し
た劣化は緩和される。たとえばフレームF2はフレーム
29〜F1204つのフレームで分析きれ、フレームF
9の子音部が埋もれてしまうことはない。
しかし第2図1の分析時間幅が固定長で長い場合に比べ
て、デー°夕量が大幅に増加(例えば4倍)する欠点が
ある。
これに対し破裂音や摩擦音などの音声信号が短かい時間
で変化する部分では短かい時間幅で分析を行ない、定常
的な状態が長く続く部分では長い時間幅で分析する方法
をとった第2図■の可変長フレーム方式は、分析部・合
成部ともに構造が複し−ム方式に比べて複雑であり、ま
たデータ量もI分析時間幅が固定長で長い場合に比べて
増加する。
本発明は、長い分析時間幅で分析した際に現れる前述し
た欠点を、データ量をほとんど増加させることなく実現
することを目的とするものである。
第3図は、本発明による音声分析符号化方式を適用した
音声分析合成の流れ図である。同図において、音声信号
人力1.音声信号の符号化2.音声分析32分分析フレ
−ム成4.パラメ]りの圧縮6.音声合成6のステップ
は従来通りであるが、音声分析は短かい時間幅で行ない
、音声分析3と符号化5のステップの間に、合成フレー
ムの作成7による合成パラメータ作成6を追加している
。なお分析時間幅は合成時間幅の整数分の−(2以上の
整数)で与えられる。
第4図は、第3図の合成フレーム作成7のステップを詳
しく示したものである。音声分析パラメータより、音声
特徴判定値を調べて連続して同じ音声特徴判定値を持つ
フレームの数を決定する(ステップ71L)。ここでは
音声特徴判定値として有声・無声・無音判定値を用いる
。連続するフレームの数が決定されると、次にステップ
7bとしてその分析フレームから生成される合成フレー
ム数の決定と1合成フレームに割りあてる分析フレーム
の数を決定する。この際、音声パラメータは時間伸縮を
受けることになる。1合成フレームに割りあてらnたい
くつかの分析フレームのパラメータ゛より、ステップ7
Cとして合成フレームのパラメータを算出する。以上の
手続きを繰り返すことによって、ステップ8として合成
パラメータを得る。
次に本発明による音声分析符号化方式を適用した第1の
実施例について説明する。
フレームサイズ20 m5150の偏自己相関を用いた
音声合成装置のデータを作成する際、従来ならば分析時
間幅も20 m5ecを採用していたが、本方式の一つ
の実施例では、その1/4の時間幅s m5ecで分析
を行ない、合成時間幅2omsecで合成を行なう。即
ち、分析時間幅t−1/4t′(合成時間幅)である。
偏自己相関法を用いて分析時間幅5m5ecで分析を行
ない、基本周波数・振幅・偏自己相関係数、有声・無声
・無音判定値(有声ならば1゜無声ならばO1無音なら
ば−1と判定されている)を得る。音声特徴判定値とし
て、有声・無声・無音判定値を用いる。有声・無声・無
音判定値が同じで連続しているフレーム(即ち判定値=
1ならば、次に0あるいは−1の判定値があられれるま
でのすべて)から、生成すべき合成フレームの数と、1
合成フレームに対する分析フレームの割りあてを決定す
る。
第6図にその割りあて法を図示する。同図において、同
じ特徴の連続する分析フレームの数をkとする。1(k
(40時、時間伸長を施して1合成フレーム作成する。
k′26のときに=4〕+a(a=4.5.6.7、)
え正の整数)と表わせる。k=4ノ+4のとき、4分析
フレームから1合成フレームを作成して、合成フレーム
を(+1個つくる。時間伸縮は行なわない。k=4)+
5のとき、4分析フレームから作成される合晟フレーム
が8個、最後に5分析フレームから時間圧縮を施して1
合成フレームを作成し、全部で6.+1個の合成フレー
ムが作成される。k=41+6のとき、最初と最後の合
成フレームが6分析フレームから作成され、その間は4
分析フレームから1合成フレームを作成し、□全部でl
+1個の合成フレームが得られる。ただしl二〇すなわ
ちに二6の場合は6分析フレームが1合成フレームに割
りあてられる。k=41 +7のとき、最初のフレーム
が3分析フレームから作成され時間伸長が施される。そ
の他の合成フレームは4分析フレームから生成され、全
部でl+2個の合成フレームを得る。
第6図1.1.1および■は本方式を採用して分析合成
した際の原音9分析フレーム、合成フレームおよび合成
音を示したもので、横軸に時間をとって示している。
なお、原音は、分析されるもとの音声波形で、な声天気
予報の一部、″°期日の天気゛の“′て゛の幅であるs
ms e a毎に音声を区切・たものである。
図中F、′〜F、6′ハ分析フレーム、F、7 ” F
 2: Id 合成フレームをそれぞれ示している。■
の合成フレームは、璽の分析フレームの同じ特徴の連続
するフレームいくつかから作成さ、ルる合成フレームを
示したもので、合成時間幅U 20 m5ecである。
分析フレームF、′〜F4′ハ合成フレ・−ム’、’y
 K 割’)あてられ、時間的な伸縮は施されない。こ
こで、フv −ム”y ;はその前後のフレーム24′
やF 6′(1) 音声波形と特徴が異なる。こ詐はt
’f声特徴判定値によって判定できる。すなわちF4′
までは無音部1、/は無声部・、F6′は有声部である
。そのためフレーム25′は他のフレームと統合される
ことなく1・分析フレームのみで1合成フレームが割シ
あてられ、4倍に時間伸長される。フレーム16′から
、7V−4F、;−dでは有声音が11フレーム連続シ
、これは第6図のに=41+3(l二1)の場合であル
。合成フレーム’+9は分析フレーム  /、F1a 
     71 F8′が、合成フレーム’2’OI ”21は各々分1
7V−3合成フレームが生成される。
なお、生成された合成フレームの音声特徴判定値以外の
音声パラメータの超は、その合成フレームに割りあてら
れた各分析フレームのパラメータの平均値で与えるもの
とする。すなわち第nフレームめの振幅値をムnとする
と、ムl−(’6+ム7A8)/3である。
第2図1vの合成音は以上の手続きで作成された合成パ
ラメータを用いて合成した音声の波形である。第6図に
のみ関して述べると、80m5eCの原音が100 m
5ecに伸長されて合成されている。
前述の試料全体としては、原音4.90秒が合成音では
4.94秒になり、時間伸縮率は1.004である。す
なわち、データ量の増加ij 1.004倍にすぎない
。
次に本発明の第2の実施例について説明する。
この第2の実施例では前述した第1の実施例と同じ試料
で、同じ条件で分析合成するものとする。
また分析フレームから合成フレームへの割りあて10・
′−°− を第7図を用いて行なうものとする。
同じ特徴の連続する分析フレ・−ムの数をkとする01
くkく4のとき、時間伸長を施して1合成フレームを作
成する。kン6C′)七き、k=4ノ十a(a=4.5
,6,7.)ニー11ミの整数)と表わせる。k=4ノ
+4のとき、4るト折フレームから1合成フレームを作
成して、合成フレームを1+1個作成する。時間伸縮は
(T r’; :bない。k=4j!+5のとき、最初
の合成フレームには2分析フレーA7%、 最後)合成
フレームには3分析フL/−ムが割りあてられ、その間
の合成フレームにはそれぞれ4分析フレームが割りあて
られ、全部でl+2個の合成フレームを作成する。k=
4ノ+6のとき、最初と最後のフレームが3分析フレー
ムから作成され全部で1+2個の合成フレームを得る。
k−4ノ+7のとき、最初の合成フレームは3分析フレ
ームから生成され、その他の合成フレームは4分析フレ
ームから作成され全部でl+2個の合成フレームを生成
する。この方法では、時間圧縮を施すことはない。
なお生成された合成ヅレームの音声特徴判定値以外の音
声パラメータの値は、第1の実施例と同様、その合成フ
レーム吟割り当てられた各分析フレームのパラメータの
平均値で与えるものとする。
この際、原音4.90秒が合成音では5.16秒になり
時間伸縮率は1.06である。すなわちデータ量の増加
は1.05倍である。
ところで第6図1の原音は“明日の天気″の“°て″の
部分である。この“て”の子音部“t”はフレー′ムF
′5 にあたるが5mBe0と短かく、従来分析で分析
時間幅を長くとった場合には、第2図のフレームF2に
示すように有声部・無声部の混在するフレームとなシ、
的確なパラメータ抽出ができないことが多く、第2図■
の合成音に示すように“t”の子音性を再現できなかっ
た。しかし上記実施例による分析合成では、第6図に示
すようにフレームF6 は時間伸長されてフレームF、
8′として存在し、“t”の明瞭性を向上させている。
上記実施例より明らかなように、本発明によれば従来の
分析時間幅・合成時間幅が等しく、一定でかつ長いこと
が原因で起゛きていた劣化の改善策を、データ量をほと
んどかえることなく(多くとも数%の増加にとどめて)
実現できたものである。
また、音声の特徴に従って各合成フレームが作成されて
おシ、有声部・無声部の混在するフレームが存在しない
ので、データ圧縮した際の劣化は従来より小ない。さら
に最終的には固定長フレームのパラメータを生成するの
で、従来の音声合成LSIをそのまま用いる事、ができ
るという利点もある。
【図面の簡単な説明】
第1図は従来の音声分析合成方式の流れ図、第2図は従
来の分析時間幅と原音および合成音の波□形を示した図
、第3図は本発明による音声分析符号化方式を適用した
音声分析合成装置の流れ図、第4図は同要部の詳細な流
れ図、第5図は同分析フレーム・合成フレームと原音お
よび合成音を示した波形図、第6図および第7図は同実
施例の合成フレーム割りあて方法を説明するための図で
ある。 第 1  し1 第21!1 第3図 第4図

Claims (1)

  1. 【特許請求の範囲】 音声合成装置にパラメータを供給する時間幅の整数分の
    −の時間幅で音声信号を分析して有声音。 無声音、無音の特徴判定値を判定し、同一の判定値が連
    続する1個以上の分析フレームを、時間軸上の伸縮を加
    えて1個あるいはそれ以上の合成フレームに割りあて、
    1合成フレームに対応する数個の分析フレームのパラメ
    ータよりその合成フレームのパラメータを算出すること
    を特徴とする音声分析符号化方式。
JP56170390A 1981-10-23 1981-10-23 音声分析符号化方式 Pending JPS5872194A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP56170390A JPS5872194A (ja) 1981-10-23 1981-10-23 音声分析符号化方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP56170390A JPS5872194A (ja) 1981-10-23 1981-10-23 音声分析符号化方式

Publications (1)

Publication Number Publication Date
JPS5872194A true JPS5872194A (ja) 1983-04-30

Family

ID=15904035

Family Applications (1)

Application Number Title Priority Date Filing Date
JP56170390A Pending JPS5872194A (ja) 1981-10-23 1981-10-23 音声分析符号化方式

Country Status (1)

Country Link
JP (1) JPS5872194A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS60224341A (ja) * 1984-04-20 1985-11-08 Nippon Telegr & Teleph Corp <Ntt> 音声符号化方法
JPS61278900A (ja) * 1985-06-05 1986-12-09 株式会社東芝 音声合成装置

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS60224341A (ja) * 1984-04-20 1985-11-08 Nippon Telegr & Teleph Corp <Ntt> 音声符号化方法
JPS61278900A (ja) * 1985-06-05 1986-12-09 株式会社東芝 音声合成装置

Similar Documents

Publication Publication Date Title
US6484137B1 (en) Audio reproducing apparatus
JP3653826B2 (ja) 音声復号化方法及び装置
US7412379B2 (en) Time-scale modification of signals
JP3321971B2 (ja) 音声信号処理方法
EP1037197A2 (en) Voicing analysis in a linear predictive speech coder
Childers et al. Voice conversion: Factors responsible for quality
JPH06266390A (ja) 波形編集型音声合成装置
WO2003010752A1 (fr) Appareil d&#39;elargissement de la largeur de bande vocale et procede d&#39;elargissement de la largeur de bande vocale
JP2002515610A (ja) 位相変化からの雑音寄与度の決定に基づく音声符号化
JP2003255973A (ja) 音声帯域拡張システムおよび方法
CN1383546A (zh) 正弦编码
JPS63192100A (ja) マルチパルス符号化装置
US6101463A (en) Method for compressing a speech signal by using similarity of the F1 /F0 ratios in pitch intervals within a frame
JP2612867B2 (ja) 音声ピッチ変換方法
JP2000267686A (ja) 信号伝送方式及び復号化装置
JPH05303399A (ja) 音声時間軸圧縮伸長装置
JPS58188000A (ja) 音声認識合成装置
JP2001147700A (ja) 音声信号の後処理方法および装置並びにプログラムを記録した記録媒体
JPS62102294A (ja) 音声符号化方式
JP2560277B2 (ja) 音声合成方式
JP2711737B2 (ja) 線形予測分析・合成方式の復号器
JPH0690638B2 (ja) 音声分析方式
JP2007505346A (ja) 遷移のオーディオ信号成分の符号化
JPH10232699A (ja) Lpcボコーダ
JPH0659700A (ja) 音声データ圧縮装置