JPH10187196A - 低ビットレートピッチ遅れコーダ - Google Patents
低ビットレートピッチ遅れコーダInfo
- Publication number
- JPH10187196A JPH10187196A JP9262289A JP26228997A JPH10187196A JP H10187196 A JPH10187196 A JP H10187196A JP 9262289 A JP9262289 A JP 9262289A JP 26228997 A JP26228997 A JP 26228997A JP H10187196 A JPH10187196 A JP H10187196A
- Authority
- JP
- Japan
- Prior art keywords
- pitch
- vector
- speech
- frame
- subframe
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/06—Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L2019/0001—Codebooks
- G10L2019/0011—Long term prediction filters, i.e. pitch estimation
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
Abstract
(57)【要約】 (修正有)
【課題】 符号化ビット要件を低減するためにピッチ遅
れ値に固有のフレーム間の相関関係を使用する、ピッチ
遅れ符号化装置および方法を提供する。 【解決手段】 ピッチ遅れ値は、所与の音声フレームに
対して抽出されて、その後、各サブフレームに対して精
製される。N個の音声のサンプルを有する各音声フレー
ムについて、LPC分析およびベクトル量子化314が
符号化フレーム全体について実行される。各フレームに
ついて得られたLPC残留316がその後処理されて、
符号化フレーム内のすべてのサブフレームに対するピッ
チ遅れ値が同時に分析される。残りの符号化パラメー
タ、すなわちコードブック探索、ゲインパラメータ、お
よび励起信号は、その後、それらそれぞれのサブフレー
ムに従って逐次分析される。
れ値に固有のフレーム間の相関関係を使用する、ピッチ
遅れ符号化装置および方法を提供する。 【解決手段】 ピッチ遅れ値は、所与の音声フレームに
対して抽出されて、その後、各サブフレームに対して精
製される。N個の音声のサンプルを有する各音声フレー
ムについて、LPC分析およびベクトル量子化314が
符号化フレーム全体について実行される。各フレームに
ついて得られたLPC残留316がその後処理されて、
符号化フレーム内のすべてのサブフレームに対するピッ
チ遅れ値が同時に分析される。残りの符号化パラメー
タ、すなわちコードブック探索、ゲインパラメータ、お
よび励起信号は、その後、それらそれぞれのサブフレー
ムに従って逐次分析される。
Description
【0001】
【発明の背景】音声信号は通常、有声領域または無声領
域のいずれかに分類することができる。ほとんどの言語
において、有声領域の方が一般に、無声領域よりも重要
である。なぜなら、人間は無声の音声でより有声の音声
での方が、音をより変化することができるためである。
このため、有声の音声の方が無声の音声よりもより多量
の情報を伝達する。したがって、高品質の有声の音声を
圧縮、伝送、および伸長できることが、現代の音声符号
化技術の最重要課題である。
域のいずれかに分類することができる。ほとんどの言語
において、有声領域の方が一般に、無声領域よりも重要
である。なぜなら、人間は無声の音声でより有声の音声
での方が、音をより変化することができるためである。
このため、有声の音声の方が無声の音声よりもより多量
の情報を伝達する。したがって、高品質の有声の音声を
圧縮、伝送、および伸長できることが、現代の音声符号
化技術の最重要課題である。
【0002】隣接する音声サンプルは、特に有声の音声
信号については高い相関関係にあることがわかってい
る。この相関関係は、音声信号のスペクトル包絡を表わ
す。線形予測符号化(LPC)と称されるある音声符号
化方法においては、特定の時間インデックスにおけるデ
ジタル化された音声サンプルの値は、先行するデジタル
化された音声サンプルの値の線形の組合せとしてモデル
化される。この関係は予測と称されるが、これは、後に
続く信号のサンプルが先の信号値に従ってこのように線
形で予測が可能なためである。この予測のために使用さ
れる係数は、単に、LPC予測係数と称される。実際の
音声サンプルと予測された音声サンプルとの差は、LP
C予測誤差、またはLPC残留信号と称される。LPC
予測はまた、短期間予測とも称される。なぜなら、この
予測プロセスは少数の隣接する音声サンプル、典型的に
は約10個の音声サンプルについてのみ行なわれるため
である。
信号については高い相関関係にあることがわかってい
る。この相関関係は、音声信号のスペクトル包絡を表わ
す。線形予測符号化(LPC)と称されるある音声符号
化方法においては、特定の時間インデックスにおけるデ
ジタル化された音声サンプルの値は、先行するデジタル
化された音声サンプルの値の線形の組合せとしてモデル
化される。この関係は予測と称されるが、これは、後に
続く信号のサンプルが先の信号値に従ってこのように線
形で予測が可能なためである。この予測のために使用さ
れる係数は、単に、LPC予測係数と称される。実際の
音声サンプルと予測された音声サンプルとの差は、LP
C予測誤差、またはLPC残留信号と称される。LPC
予測はまた、短期間予測とも称される。なぜなら、この
予測プロセスは少数の隣接する音声サンプル、典型的に
は約10個の音声サンプルについてのみ行なわれるため
である。
【0003】有声の音声信号においては、ピッチもまた
重要な情報を提供する。テープレコーダを使用してピッ
チを変化させることにより、男性の声が修正、すなわち
速度を上げられて女性の声のように聞こえる、またはそ
の逆を経験したことがあろう。これは、ピッチが人の声
の基本周波数を表わすためである。ピッチはまた、喜
び、怒り、疑問、疑惑等を表わすのに有益である声の抑
揚も伝播する。したがって、優れた音声の再生を保証す
るには、正確なピッチ情報が不可欠である。
重要な情報を提供する。テープレコーダを使用してピッ
チを変化させることにより、男性の声が修正、すなわち
速度を上げられて女性の声のように聞こえる、またはそ
の逆を経験したことがあろう。これは、ピッチが人の声
の基本周波数を表わすためである。ピッチはまた、喜
び、怒り、疑問、疑惑等を表わすのに有益である声の抑
揚も伝播する。したがって、優れた音声の再生を保証す
るには、正確なピッチ情報が不可欠である。
【0004】音声符号化の目的で、ピッチは、ピッチ遅
れとピッチ係数とによって表わされる。ピッチ遅れ評価
のさらなる説明は、ファン−ユ・ス(Huan-Yu Su)によ
って発明されて、1995年5月30日に出願された、
「線形予測符号化残留を使用したピッチ遅れ評価システ
ム(“Pitch Lag Estimation System Using Linear Pre
dictive Coding Residual ”)」と題された、同時係属
中の出願連続番号第08/454,477号に記載され
ており、この開示がここに引用により援用される。進ん
だ音声符号化システムは、音声再生モデルに従って、オ
リジナルの音声信号からLPC予測係数、ピッチ情報、
および励起信号を効率的かつ正確に抽出(または評価)
することが求められる。これら情報はその後、伝送チャ
ネル(たとえば、無線通信チャネル)または記憶チャネ
ル(たとえば、デジタルアンサリングマシン)等の媒体
の有限の利用可能な帯域幅を介して伝送される。音声信
号はその後、エンコーダ側で使用されたのと同じ音声再
生モデルを使用して、受信側で再構築される。
れとピッチ係数とによって表わされる。ピッチ遅れ評価
のさらなる説明は、ファン−ユ・ス(Huan-Yu Su)によ
って発明されて、1995年5月30日に出願された、
「線形予測符号化残留を使用したピッチ遅れ評価システ
ム(“Pitch Lag Estimation System Using Linear Pre
dictive Coding Residual ”)」と題された、同時係属
中の出願連続番号第08/454,477号に記載され
ており、この開示がここに引用により援用される。進ん
だ音声符号化システムは、音声再生モデルに従って、オ
リジナルの音声信号からLPC予測係数、ピッチ情報、
および励起信号を効率的かつ正確に抽出(または評価)
することが求められる。これら情報はその後、伝送チャ
ネル(たとえば、無線通信チャネル)または記憶チャネ
ル(たとえば、デジタルアンサリングマシン)等の媒体
の有限の利用可能な帯域幅を介して伝送される。音声信
号はその後、エンコーダ側で使用されたのと同じ音声再
生モデルを使用して、受信側で再構築される。
【0005】コード励起線形予測(CELP)符号化
は、最も広く使用されているLPCベースの音声符号化
方法のうちの1つである。図1に、音声再生モデルが示
される。予め記憶されたイノベーションコードブック1
14から出力された(116を介して)ゲインがスケー
リングされたイノベーションベクトル115は、ピッチ
予測112の出力に付加されて、励起信号120が形成
される。これは、その後LPC合成フィルタ110を通
してフィルタリングされて、出力音声が得られる。
は、最も広く使用されているLPCベースの音声符号化
方法のうちの1つである。図1に、音声再生モデルが示
される。予め記憶されたイノベーションコードブック1
14から出力された(116を介して)ゲインがスケー
リングされたイノベーションベクトル115は、ピッチ
予測112の出力に付加されて、励起信号120が形成
される。これは、その後LPC合成フィルタ110を通
してフィルタリングされて、出力音声が得られる。
【0006】再構築された出力音声の品質のよさを保証
するには、CELPデコーダがLPCフィルタパラメー
タ、ピッチ予測パラメータ、イノベーションインデック
ス、およびゲインの適切な組合せを有することが不可欠
である。したがって、入力音声と出力音声との間の知覚
的な差が最小限に抑えられるという意味で、最良のパラ
メータの組合せを決定することが、CELPエンコーダ
(または音声符号化方法全般)の目的である。しかし、
実際には、複雑さの制限および遅延の制約のために、パ
ラメータの最良の組合せを全数的に探索することは、非
常に困難であることがわかった。
するには、CELPデコーダがLPCフィルタパラメー
タ、ピッチ予測パラメータ、イノベーションインデック
ス、およびゲインの適切な組合せを有することが不可欠
である。したがって、入力音声と出力音声との間の知覚
的な差が最小限に抑えられるという意味で、最良のパラ
メータの組合せを決定することが、CELPエンコーダ
(または音声符号化方法全般)の目的である。しかし、
実際には、複雑さの制限および遅延の制約のために、パ
ラメータの最良の組合せを全数的に探索することは、非
常に困難であることがわかった。
【0007】中〜低ビットレート(4〜16kbits
/sec)で動作する提案されるほとんどの音声コーデ
ック(コーダ/デコーダ)は、デジタル化された音声サ
ンプルを10〜40msecのブロックに分けなおす。
この各ブロックは、音声符号化フレームと称される。図
2から図5に示されるように、前処理210の後、LP
C分析および量子化212が符号化フレームごとに実行
され、ピッチ分析およびイノベーション信号(コードベ
クトル)分析がサブフレーム216(2〜8msec)
ごとに実行される。典型的に、各フレームは2から4の
サブフレームを含む。この方法は、LPC情報が音声内
でピッチ情報またはイノベーション情報に比べてより遅
く変化するという認識に基づいている。したがって、広
域の知覚的に重み付けされた符号化エラーの最小化は、
ばらばらの時間間隔にわたる一連のより小さな寸法での
最小化に置き換えられる。この手順により、CELP音
声符号化システムを実現するための複雑さの要件は、大
いに減じられる結果となる。しかし、この方法には、ピ
ッチ遅れ情報を伝送するのに必要とされるビットレート
が低ビットレート応用にとって高すぎるという欠点を有
する。たとえば、良い音声再生を維持するのに十分なピ
ッチ遅れ情報を提供するためには、通常、1.3kb/
sの典型的なレートが必要である。帯域幅におけるこの
ような要件は、8kb/s以上のビットレートで動作す
る音声符号化システムにおいては充足することは困難で
はないが、たとえば4kb/sの低ビットレート符号化
応用においては過大な要求である。
/sec)で動作する提案されるほとんどの音声コーデ
ック(コーダ/デコーダ)は、デジタル化された音声サ
ンプルを10〜40msecのブロックに分けなおす。
この各ブロックは、音声符号化フレームと称される。図
2から図5に示されるように、前処理210の後、LP
C分析および量子化212が符号化フレームごとに実行
され、ピッチ分析およびイノベーション信号(コードベ
クトル)分析がサブフレーム216(2〜8msec)
ごとに実行される。典型的に、各フレームは2から4の
サブフレームを含む。この方法は、LPC情報が音声内
でピッチ情報またはイノベーション情報に比べてより遅
く変化するという認識に基づいている。したがって、広
域の知覚的に重み付けされた符号化エラーの最小化は、
ばらばらの時間間隔にわたる一連のより小さな寸法での
最小化に置き換えられる。この手順により、CELP音
声符号化システムを実現するための複雑さの要件は、大
いに減じられる結果となる。しかし、この方法には、ピ
ッチ遅れ情報を伝送するのに必要とされるビットレート
が低ビットレート応用にとって高すぎるという欠点を有
する。たとえば、良い音声再生を維持するのに十分なピ
ッチ遅れ情報を提供するためには、通常、1.3kb/
sの典型的なレートが必要である。帯域幅におけるこの
ような要件は、8kb/s以上のビットレートで動作す
る音声符号化システムにおいては充足することは困難で
はないが、たとえば4kb/sの低ビットレート符号化
応用においては過大な要求である。
【0008】低ビットレート音声符号化分野において
は、進んだ高品質パラメータ量子化方式が広く使用さ
れ、不可欠となっている。ベクトル量子化(VQ)は、
低ビットレート音声符号化の達成に寄与する、最も重要
な要素のうちの1つである。簡単なスカラ量子化(S
Q)方式と比較して、VQは同じビットレートではるか
に高い品質、またははるかに低いビットレートで同じ品
質をもたらす。残念なことに、VQは現時点におけるC
ELP音声符号化モデルに従ったピッチ遅れ情報量子化
に適用できない。このことをよりよく説明するために、
CELPコーダにおけるピッチ遅れに対するパラメータ
生成手順を以下に説明する。
は、進んだ高品質パラメータ量子化方式が広く使用さ
れ、不可欠となっている。ベクトル量子化(VQ)は、
低ビットレート音声符号化の達成に寄与する、最も重要
な要素のうちの1つである。簡単なスカラ量子化(S
Q)方式と比較して、VQは同じビットレートではるか
に高い品質、またははるかに低いビットレートで同じ品
質をもたらす。残念なことに、VQは現時点におけるC
ELP音声符号化モデルに従ったピッチ遅れ情報量子化
に適用できない。このことをよりよく説明するために、
CELPコーダにおけるピッチ遅れに対するパラメータ
生成手順を以下に説明する。
【0009】再び図2から図5を参照して、ピッチ予測
手順はフィードバックプロセスであることが示される。
これは、ピッチ予測モジュールへの入力として過去の励
起信号を取り、現時点の励起に対するピッチ予測寄与分
を生成する(214)。このピッチ予測は音声信号の低
周期性にならうため、予測期間がLPCの予測期間より
も長いことから、長期予測とも称される。所与のサブフ
レームに対して、ピッチ遅れは、人間の音声の変化の大
半をカバーする、典型的に18個から150個の音声サ
ンプルの範囲について探索される。この探索は、探索ス
テップ分布に従って行なわれる。この分布は、高い時間
分解能要件と低いビットレート要件との間の妥協によっ
て予め定められる。
手順はフィードバックプロセスであることが示される。
これは、ピッチ予測モジュールへの入力として過去の励
起信号を取り、現時点の励起に対するピッチ予測寄与分
を生成する(214)。このピッチ予測は音声信号の低
周期性にならうため、予測期間がLPCの予測期間より
も長いことから、長期予測とも称される。所与のサブフ
レームに対して、ピッチ遅れは、人間の音声の変化の大
半をカバーする、典型的に18個から150個の音声サ
ンプルの範囲について探索される。この探索は、探索ス
テップ分布に従って行なわれる。この分布は、高い時間
分解能要件と低いビットレート要件との間の妥協によっ
て予め定められる。
【0010】たとえば、北米デジタルセルラー標準IS
−54(the North American Digital Cellular Standa
rd IS-54)においては、ピッチ遅れ探索範囲は、20か
ら146のサンプルと予め定められ、ステップのサイズ
は1サンプルである。たとえば、30の音声サンプルに
ついて可能なピッチ遅れ選択は、28、29、30、3
1および32である。最適なピッチ遅れが発見される
と、その値、たとえば29に関連してインデックスが得
られる。別の音声符号化標準、すなわち、国際電気通信
連合(ITU)G.729音声符号化標準においては、
ピッチ遅れ探索範囲は[19 1/3,143]と設定
され、1/3のステップサイズが[191/3,84
2/3]の範囲内で使用される。したがって、30に対
して可能なピッチ遅れ値は、29、29 1/3、29
2/3、30 30 1/3、30 2/3、31等
であり得る。この場合、29 1/3のピッチ遅れがお
そらくは、29のピッチ遅れよりも現時点の音声サブフ
レームにとってはより好適であろう。
−54(the North American Digital Cellular Standa
rd IS-54)においては、ピッチ遅れ探索範囲は、20か
ら146のサンプルと予め定められ、ステップのサイズ
は1サンプルである。たとえば、30の音声サンプルに
ついて可能なピッチ遅れ選択は、28、29、30、3
1および32である。最適なピッチ遅れが発見される
と、その値、たとえば29に関連してインデックスが得
られる。別の音声符号化標準、すなわち、国際電気通信
連合(ITU)G.729音声符号化標準においては、
ピッチ遅れ探索範囲は[19 1/3,143]と設定
され、1/3のステップサイズが[191/3,84
2/3]の範囲内で使用される。したがって、30に対
して可能なピッチ遅れ値は、29、29 1/3、29
2/3、30 30 1/3、30 2/3、31等
であり得る。この場合、29 1/3のピッチ遅れがお
そらくは、29のピッチ遅れよりも現時点の音声サブフ
レームにとってはより好適であろう。
【0011】現時点の音声サブフレームに対するピッチ
遅れが発見されると(218)、ピッチ予測寄与分が決
定される(218)。このピッチ寄与分を考慮に入れ
て、イノベーションコードブック分析(224)が行な
われ得る。ここで、イノベーションコードベクトルの決
定は、現時点のサブフレームのピッチ寄与分に依存す
る。サブフレームのための現時点の励起信号(228)
は、これら2つの寄与分(イノベーションコードベクト
ルおよびピッチ寄与分)の、ゲインがスケーリングされ
た線形の組合せである。これが、後に続くサブフレーム
230、232に対する次のピッチ分析214等のため
の入力信号となる。周知のように、閉ループ分析とも称
されるこのパラメータ決定手順は、因果関係のシステム
となる。すなわち、特定のサブフレームのパラメータの
決定は、その直前のサブフレームのパラメータに依存す
る。したがって、たとえばサブフレームiのパラメータ
が選択されると、それらの量子化は後続のサブフレーム
i+1のパラメータ決定に影響を及ぼす。この方法の欠
点は、しかし、パラメータの組が互いに高いレベルで依
存し合うことである。サブフレームi+1のためのパラ
メータが一旦決定されると、先のサブフレームiのパラ
メータは音声の質に悪影響を及ぼすことなく修正するこ
とはできなくなる。このように、ベクトル量子化は無損
失の量子化方式ではないため、この抽出方式によって得
られたピッチ遅れはスカラ量子化されねばならず、結果
として効率の悪い量子化となる。
遅れが発見されると(218)、ピッチ予測寄与分が決
定される(218)。このピッチ寄与分を考慮に入れ
て、イノベーションコードブック分析(224)が行な
われ得る。ここで、イノベーションコードベクトルの決
定は、現時点のサブフレームのピッチ寄与分に依存す
る。サブフレームのための現時点の励起信号(228)
は、これら2つの寄与分(イノベーションコードベクト
ルおよびピッチ寄与分)の、ゲインがスケーリングされ
た線形の組合せである。これが、後に続くサブフレーム
230、232に対する次のピッチ分析214等のため
の入力信号となる。周知のように、閉ループ分析とも称
されるこのパラメータ決定手順は、因果関係のシステム
となる。すなわち、特定のサブフレームのパラメータの
決定は、その直前のサブフレームのパラメータに依存す
る。したがって、たとえばサブフレームiのパラメータ
が選択されると、それらの量子化は後続のサブフレーム
i+1のパラメータ決定に影響を及ぼす。この方法の欠
点は、しかし、パラメータの組が互いに高いレベルで依
存し合うことである。サブフレームi+1のためのパラ
メータが一旦決定されると、先のサブフレームiのパラ
メータは音声の質に悪影響を及ぼすことなく修正するこ
とはできなくなる。このように、ベクトル量子化は無損
失の量子化方式ではないため、この抽出方式によって得
られたピッチ遅れはスカラ量子化されねばならず、結果
として効率の悪い量子化となる。
【0012】さらに、典型的なCELP符号化システム
においては、エンコーダは、「最良の」励起信号また
は、同等に、所与のサブフレームのための励起信号を規
定する最良のパラメータの組を抽出する必要がある。こ
のタスクはしかし、計算上の問題から機能的に実行可能
ではない。たとえば、αの最小数は50でなければなら
ず、βは20を上回り、Lagは最小が200でなけれ
ばならず、500のコードベクトルが合理的な質の符号
化音声を得るために必要であることはよく理解されてい
る。さらに、この評価は、約200/秒程度のサブフレ
ーム周波数で行なわれなければならない。このため、簡
単な評価方法でも、1秒あたり1010を超えるベクトル
走査が必要であることは容易に判断できる。
においては、エンコーダは、「最良の」励起信号また
は、同等に、所与のサブフレームのための励起信号を規
定する最良のパラメータの組を抽出する必要がある。こ
のタスクはしかし、計算上の問題から機能的に実行可能
ではない。たとえば、αの最小数は50でなければなら
ず、βは20を上回り、Lagは最小が200でなけれ
ばならず、500のコードベクトルが合理的な質の符号
化音声を得るために必要であることはよく理解されてい
る。さらに、この評価は、約200/秒程度のサブフレ
ーム周波数で行なわれなければならない。このため、簡
単な評価方法でも、1秒あたり1010を超えるベクトル
走査が必要であることは容易に判断できる。
【0013】
【発明の概要】したがって、この発明の1つの目的は、
低ビットレートを要し、かつ過去のシステムよりも精密
性の高い、修正されたピッチ遅れ抽出プロセスおよび適
応性のある重み付きベクトル量子化とを組込む、ピッチ
遅れ情報の非常に低いビットレートの符号化のための方
式を提供することである。特定の実施例においてはこの
発明は、CELP技術内で使用されて、さまざまな音声
符号化構成に適用が可能である、ピッチ遅れ符号化の装
置および方法に向けられる。
低ビットレートを要し、かつ過去のシステムよりも精密
性の高い、修正されたピッチ遅れ抽出プロセスおよび適
応性のある重み付きベクトル量子化とを組込む、ピッチ
遅れ情報の非常に低いビットレートの符号化のための方
式を提供することである。特定の実施例においてはこの
発明は、CELP技術内で使用されて、さまざまな音声
符号化構成に適用が可能である、ピッチ遅れ符号化の装
置および方法に向けられる。
【0014】この発明の1実施例に従って、これらおよ
び他の目的は、ピッチ遅れ情報の正確な符号化を素早く
かつ効率的に可能にし、それにより、音声の良好な再生
および再生成を可能とする、ピッチ遅れ評価および符号
化方式によって達成される。この発明の実施例に従っ
て、正確なピッチ遅れ値が、現時点の符号化フレーム内
のすべてのサブフレームに対して同時に得られる。ま
ず、ピッチ遅れ値が所与の音声フレームのために抽出さ
れて、その後、各サブフレームのために精製される。
び他の目的は、ピッチ遅れ情報の正確な符号化を素早く
かつ効率的に可能にし、それにより、音声の良好な再生
および再生成を可能とする、ピッチ遅れ評価および符号
化方式によって達成される。この発明の実施例に従っ
て、正確なピッチ遅れ値が、現時点の符号化フレーム内
のすべてのサブフレームに対して同時に得られる。ま
ず、ピッチ遅れ値が所与の音声フレームのために抽出さ
れて、その後、各サブフレームのために精製される。
【0015】より特定的には、N個の音声サンプルを有
する各音声フレームに対して、LPC分析が実行され
る。LPC分析およびフィルタリングは、符号化フレー
ムに対して実行される。フレームに対して得られたLP
C残留がその後処理されて、各サブフレームに対するピ
ッチ遅れ評価およびLPCベクトル量子化がなされる。
符号化フレーム内のすべてのサブフレームに対して評価
されたピッチ遅れ値は、並行に分析される。残りの符号
化パラメータ、すなわちコードブック探索、ゲインパラ
メータ、および励起信号は、その後、各サブフレームに
対して逐次分析される。その結果、ピッチ遅れのフレー
ム間の強い相関関係を利用して、効率的なピッチ遅れ符
号化が、実質的に低ビットレートで高い精密度で実行さ
れることが可能となる。
する各音声フレームに対して、LPC分析が実行され
る。LPC分析およびフィルタリングは、符号化フレー
ムに対して実行される。フレームに対して得られたLP
C残留がその後処理されて、各サブフレームに対するピ
ッチ遅れ評価およびLPCベクトル量子化がなされる。
符号化フレーム内のすべてのサブフレームに対して評価
されたピッチ遅れ値は、並行に分析される。残りの符号
化パラメータ、すなわちコードブック探索、ゲインパラ
メータ、および励起信号は、その後、各サブフレームに
対して逐次分析される。その結果、ピッチ遅れのフレー
ム間の強い相関関係を利用して、効率的なピッチ遅れ符
号化が、実質的に低ビットレートで高い精密度で実行さ
れることが可能となる。
【0016】
【好ましい実施例の詳細な説明】線形予測理論に基づい
て、特定の時間におけるデジタル化された音声信号は、
励起信号によって励起されて、線形予測フィルタの出力
として、簡単にモデル化することができる。したがっ
て、LPCベースの音声符号化システムは、合成フィル
タ1/A(z)および励起信号e(n)の抽出および効
率的な伝送(または記憶)を要する。これらのパラメー
タが更新される頻度は典型的に、符号化システムの所望
されるビットレートおよび、所望される音声品質を維持
するための更新レートの最小要件に依存する。この発明
の好ましい実施例においては、LPC合成フィルタパラ
メータは、たとえば(5msから40msの)音声符号
化フレームのように、所定の期間ごとに量子化および伝
送され、これに対し、励起信号情報は、2.5msから
10msの、より高い頻度で更新される。
て、特定の時間におけるデジタル化された音声信号は、
励起信号によって励起されて、線形予測フィルタの出力
として、簡単にモデル化することができる。したがっ
て、LPCベースの音声符号化システムは、合成フィル
タ1/A(z)および励起信号e(n)の抽出および効
率的な伝送(または記憶)を要する。これらのパラメー
タが更新される頻度は典型的に、符号化システムの所望
されるビットレートおよび、所望される音声品質を維持
するための更新レートの最小要件に依存する。この発明
の好ましい実施例においては、LPC合成フィルタパラ
メータは、たとえば(5msから40msの)音声符号
化フレームのように、所定の期間ごとに量子化および伝
送され、これに対し、励起信号情報は、2.5msから
10msの、より高い頻度で更新される。
【0017】音声エンコーダは、デジタル化された入力
音声サンプルを受取って、符号化システムのフレームサ
イズに従って音声サンプルをまとめなおし、入力音声か
らパラメータを抽出し、かつそれらパラメータを量子化
してからデコーダに伝送しなければならない。デコーダ
においては、受取られた情報を使用して、再生モデルに
従って音声が再生成される。
音声サンプルを受取って、符号化システムのフレームサ
イズに従って音声サンプルをまとめなおし、入力音声か
らパラメータを抽出し、かつそれらパラメータを量子化
してからデコーダに伝送しなければならない。デコーダ
においては、受取られた情報を使用して、再生モデルに
従って音声が再生成される。
【0018】図6および図7に、この発明の好ましい実
施例に従った音声符号化システム300が示される。入
力音声310は記憶されて、エンコーダ300内でフレ
ームごとに処理される。ある実施例においては、処理の
各単位の長さ、すなわち符号化フレーム長さは15ms
であり、したがって、1フレームが例えば8kHzサン
プリングレートにおいては120個の音声サンプルから
なる。好ましくは、入力音声信号310はハイパスフィ
ルタを介して予め処理される(312)。その後LPC
分析およびLPC量子化(314)が実行されて、LP
C合成フィルタが得られ、これは下の式(7)で表わさ
れる。この式で、n番目のサンプルは、式(8)によっ
て予測することが可能である。値npは、LPC予測位
数(典型的に約10)であって、y(n)はサンプリン
グされた音声データ、nは時間インデックスを表わす。
LPCの等式は、過去のサンプルの線形の組合せに従っ
た現時点のサンプルの評価(または予測)を示す。これ
らの間の差はLPC残留r(n)と称され、これが下の
式(9)で表わされる。LPC予測係数a1 、a2、
…、anpは、量子化されて、信号を予測するのに使用さ
れる。ここで、npはLPC位数を表わす。この発明に
従って、LPC残留信号が最良の励起信号であることが
わかった。なぜなら、このような励起信号を使用して、
オリジナルの入力音声信号が下の式(10)で表わされ
るように合成フィルタの出力として得ることが可能なた
めである。もっとも、低帯域幅でこのような励起信号を
伝送することは非常に困難であろう。事実、オリジナル
信号を得るためにこのような励起を伝送するのに必要と
される帯域幅は、オリジナルの音声信号を伝送するのに
必要とされる帯域幅よりも実際に高いものである。すな
わち、オリジナルの各音声サンプルは通常12〜16ビ
ット/サンプルでPCMフォーマット化されるが、LP
C残留は通常、浮動小数点値であって、したがって、1
2〜16ビット/サンプルよりも高い精密度を要する。
施例に従った音声符号化システム300が示される。入
力音声310は記憶されて、エンコーダ300内でフレ
ームごとに処理される。ある実施例においては、処理の
各単位の長さ、すなわち符号化フレーム長さは15ms
であり、したがって、1フレームが例えば8kHzサン
プリングレートにおいては120個の音声サンプルから
なる。好ましくは、入力音声信号310はハイパスフィ
ルタを介して予め処理される(312)。その後LPC
分析およびLPC量子化(314)が実行されて、LP
C合成フィルタが得られ、これは下の式(7)で表わさ
れる。この式で、n番目のサンプルは、式(8)によっ
て予測することが可能である。値npは、LPC予測位
数(典型的に約10)であって、y(n)はサンプリン
グされた音声データ、nは時間インデックスを表わす。
LPCの等式は、過去のサンプルの線形の組合せに従っ
た現時点のサンプルの評価(または予測)を示す。これ
らの間の差はLPC残留r(n)と称され、これが下の
式(9)で表わされる。LPC予測係数a1 、a2、
…、anpは、量子化されて、信号を予測するのに使用さ
れる。ここで、npはLPC位数を表わす。この発明に
従って、LPC残留信号が最良の励起信号であることが
わかった。なぜなら、このような励起信号を使用して、
オリジナルの入力音声信号が下の式(10)で表わされ
るように合成フィルタの出力として得ることが可能なた
めである。もっとも、低帯域幅でこのような励起信号を
伝送することは非常に困難であろう。事実、オリジナル
信号を得るためにこのような励起を伝送するのに必要と
される帯域幅は、オリジナルの音声信号を伝送するのに
必要とされる帯域幅よりも実際に高いものである。すな
わち、オリジナルの各音声サンプルは通常12〜16ビ
ット/サンプルでPCMフォーマット化されるが、LP
C残留は通常、浮動小数点値であって、したがって、1
2〜16ビット/サンプルよりも高い精密度を要する。
【0019】
【数7】
【0020】LPC残留信号316が一旦得られると、
励起信号を最終的に導出することができる(340)。
結果として得られる励起信号は通常、下の式(11)で
示されるように、2つの寄与分の線形組合せとしてモデ
ル化される。寄与分c(n)はコードブック寄与分また
はイノベーション信号と称されて、固定されたコードブ
ックまたは擬似ランダムソース(または発生器)から得
られる。e(n−Lag)はいわゆるピッチ予測寄与分
であって、Lagはピッチ遅れと称される制御パラメー
タである。パラメータαおよびβはそれぞれ、コードブ
ックゲインおよびピッチ予測係数(時にピッチゲインと
称される)である。励起信号をモデル化するこの特定の
形は、対応する符号化技術のための用語、すなわち「コ
ード励起線形予測(CELP)符号化」を説明する。こ
の発明の実施例の実現はCELP符号化システムに関し
て説明がなされているが、好ましい実施例はCELPへ
の応用に限定されるものではない。
励起信号を最終的に導出することができる(340)。
結果として得られる励起信号は通常、下の式(11)で
示されるように、2つの寄与分の線形組合せとしてモデ
ル化される。寄与分c(n)はコードブック寄与分また
はイノベーション信号と称されて、固定されたコードブ
ックまたは擬似ランダムソース(または発生器)から得
られる。e(n−Lag)はいわゆるピッチ予測寄与分
であって、Lagはピッチ遅れと称される制御パラメー
タである。パラメータαおよびβはそれぞれ、コードブ
ックゲインおよびピッチ予測係数(時にピッチゲインと
称される)である。励起信号をモデル化するこの特定の
形は、対応する符号化技術のための用語、すなわち「コ
ード励起線形予測(CELP)符号化」を説明する。こ
の発明の実施例の実現はCELP符号化システムに関し
て説明がなされているが、好ましい実施例はCELPへ
の応用に限定されるものではない。
【0021】
【数8】
【0022】前述の数式において、現時点の励起信号e
(n)は先の励起信号e(n−Lag)から予測され
る。ピッチ予測パラメータ励起を得るために過去の励起
を使用するこの方法は、統合による分析メカニズムの一
部であり、ここでエンコーダはデコーダと同じコピーを
有する。したがって、デコーダの動作はパラメータ抽出
段階で考えられる。この統合による分析の方法の利点
は、符号化の劣化の知覚的な打撃が、励起信号を規定す
るパラメータの抽出の中で考えられることである。これ
に対し、欠点は、その抽出が逐次的に行なわれなければ
ならないことである。すなわち、各サブフレームについ
て、最良のピッチLagが予め定められたスカラ量子化
スケールに従って最初に発見されて、その後、選ばれた
Lagについて、関連するピッチゲインβが計算され、
その後、それらLagおよびβが与えられた場合の最良
のコードベクトルcおよびそれに関連するゲインαが決
定されるのである。
(n)は先の励起信号e(n−Lag)から予測され
る。ピッチ予測パラメータ励起を得るために過去の励起
を使用するこの方法は、統合による分析メカニズムの一
部であり、ここでエンコーダはデコーダと同じコピーを
有する。したがって、デコーダの動作はパラメータ抽出
段階で考えられる。この統合による分析の方法の利点
は、符号化の劣化の知覚的な打撃が、励起信号を規定す
るパラメータの抽出の中で考えられることである。これ
に対し、欠点は、その抽出が逐次的に行なわれなければ
ならないことである。すなわち、各サブフレームについ
て、最良のピッチLagが予め定められたスカラ量子化
スケールに従って最初に発見されて、その後、選ばれた
Lagについて、関連するピッチゲインβが計算され、
その後、それらLagおよびβが与えられた場合の最良
のコードベクトルcおよびそれに関連するゲインαが決
定されるのである。
【0023】この発明の好ましい実施例に従って、符号
化フレーム内のすべてのサブフレームに対する量子化さ
れていないピッチ遅れ値は、適応できる開ループ探索方
法を介して同時に得られる。すなわち、各サブフレーム
について、過去の励起信号ではなく理想的な励起信号
(LPC残留)が使用されて、ピッチ予測分析がなされ
るのである。その後、遅れベクトルが構築され(32
2)、その遅れベクトルにベクトル量子化(324)が
加えられて、ベクトル量子化された遅れベクトルが得ら
れる。各サブフレームに対して決定されたピッチ遅れ値
はその後、量子化された遅れベクトルによって確定され
る。次に、量子化されたピッチ遅れによって規定される
ピッチ寄与分が構築され(326)、フィルタリングさ
れて、第1のサブフレームのためのPLag が得られる。
量子化されたLagを有することによって、上述のよう
に、対応するβを発見することができ(328)、さら
にコードベクトルci (330)を、またゲインα(3
32)を発見することができる。
化フレーム内のすべてのサブフレームに対する量子化さ
れていないピッチ遅れ値は、適応できる開ループ探索方
法を介して同時に得られる。すなわち、各サブフレーム
について、過去の励起信号ではなく理想的な励起信号
(LPC残留)が使用されて、ピッチ予測分析がなされ
るのである。その後、遅れベクトルが構築され(32
2)、その遅れベクトルにベクトル量子化(324)が
加えられて、ベクトル量子化された遅れベクトルが得ら
れる。各サブフレームに対して決定されたピッチ遅れ値
はその後、量子化された遅れベクトルによって確定され
る。次に、量子化されたピッチ遅れによって規定される
ピッチ寄与分が構築され(326)、フィルタリングさ
れて、第1のサブフレームのためのPLag が得られる。
量子化されたLagを有することによって、上述のよう
に、対応するβを発見することができ(328)、さら
にコードベクトルci (330)を、またゲインα(3
32)を発見することができる。
【0024】より特定的には、適応できる開ループ探索
技術および低ビットレートピッチ遅れ符号化を達成する
ためのベクトル量子化方式(324)の利用は、以下の
とおりである。
技術および低ビットレートピッチ遅れ符号化を達成する
ためのベクトル量子化方式(324)の利用は、以下の
とおりである。
【0025】(1) 図6および図7を参照して、符号
化フレームのためのLPC残留信号316は、上に「発
明の背景」部分で述べたたように、ピッチ遅れ評価方法
を使用して、固定開ループピッチ遅れLagop317を
決定するのに使用される。開ループピッチ遅れ評価の他
の方法もまた、開ループピッチ遅れLagopを決定する
のに使用されてもよい。
化フレームのためのLPC残留信号316は、上に「発
明の背景」部分で述べたたように、ピッチ遅れ評価方法
を使用して、固定開ループピッチ遅れLagop317を
決定するのに使用される。開ループピッチ遅れ評価の他
の方法もまた、開ループピッチ遅れLagopを決定する
のに使用されてもよい。
【0026】(2) 好ましい実施例においては、各サ
ブフレームについて同時に、LPC残留信号ベクトル3
16が下の式(12)に従って構築される。ここでnは
サブフレームの第1のサンプルである。このベクトルR
は合成フィルタ1/A(z)(図には示されていない)
を介してフィルタリングされ、その後、知覚的重み付け
フィルタW(z)を介してフィルタリングされる。この
知覚的重み付けフィルタW(z)は下の式(13)の一
般的な形を取る。ここで、0≦γ2 ≦γ1 ≦1は制御係
数であって、0≦λ≦1はそのサブフレームのためのタ
ーゲット信号Tgを得るためのものである。
ブフレームについて同時に、LPC残留信号ベクトル3
16が下の式(12)に従って構築される。ここでnは
サブフレームの第1のサンプルである。このベクトルR
は合成フィルタ1/A(z)(図には示されていない)
を介してフィルタリングされ、その後、知覚的重み付け
フィルタW(z)を介してフィルタリングされる。この
知覚的重み付けフィルタW(z)は下の式(13)の一
般的な形を取る。ここで、0≦γ2 ≦γ1 ≦1は制御係
数であって、0≦λ≦1はそのサブフレームのためのタ
ーゲット信号Tgを得るためのものである。
【0027】
【数9】
【0028】(3) 単一のピッチ遅れ値Lag∈[m
inLag,maxLag]が考えられ、ここで、mi
nLagおよびmaxLagは、特定の符号化システム
における最小許容ピッチ遅れ値および最大許容ピッチ遅
れ値である。ピッチ予測ベクトル、または励起ベクトル
RLag がその後、上述のように第1のサブフレームを除
けばすべてのサブフレームに対して入手不可能である過
去の励起信号の代わりに過去のLPC残留を使用して得
られる(318)。これが下の式(14)で表わされ
る。ここでNはサンプル内のサブフレームの長さであ
る。このピッチ予測ベクトルRLag はW(z)/A
(z)を通してフィルタリングされて(320)、知覚
的にフィルタリングされたピッチ予測ベクトルP′Lag
が得られる。次の式(15)から決定される遅れ値La
gは、現時点のサブフレームに対する量子化されていな
いピッチ遅れ322として保持される。
inLag,maxLag]が考えられ、ここで、mi
nLagおよびmaxLagは、特定の符号化システム
における最小許容ピッチ遅れ値および最大許容ピッチ遅
れ値である。ピッチ予測ベクトル、または励起ベクトル
RLag がその後、上述のように第1のサブフレームを除
けばすべてのサブフレームに対して入手不可能である過
去の励起信号の代わりに過去のLPC残留を使用して得
られる(318)。これが下の式(14)で表わされ
る。ここでNはサンプル内のサブフレームの長さであ
る。このピッチ予測ベクトルRLag はW(z)/A
(z)を通してフィルタリングされて(320)、知覚
的にフィルタリングされたピッチ予測ベクトルP′Lag
が得られる。次の式(15)から決定される遅れ値La
gは、現時点のサブフレームに対する量子化されていな
いピッチ遅れ322として保持される。
【0029】
【数10】
【0030】実際には、複雑性の懸念から、ステップ
(1)で得られた開ループピッチ遅れ317が探索の範
囲を制限するために加えられる。たとえば、[minL
ag,maxLag]を通じて探索するのではなく、探
索は[Lagop−3,Lagop+3]の間に限定されて
もよい。このような2ステップの探索手順が、ピッチ予
測分析の複雑性を著しく減じることがわかった。
(1)で得られた開ループピッチ遅れ317が探索の範
囲を制限するために加えられる。たとえば、[minL
ag,maxLag]を通じて探索するのではなく、探
索は[Lagop−3,Lagop+3]の間に限定されて
もよい。このような2ステップの探索手順が、ピッチ予
測分析の複雑性を著しく減じることがわかった。
【0031】(4) 現時点の符号化フレーム内の各サ
ブフレームに対するピッチLagが得られると(32
2)、以下の式(16)で表わされるピッチ遅れベクト
ルを得ることができる。ここで、Lagi はサブフレー
ムiからの量子化されていないLagであって、Mは1
つの符号化フレーム内のサブフレームの数である。
ブフレームに対するピッチLagが得られると(32
2)、以下の式(16)で表わされるピッチ遅れベクト
ルを得ることができる。ここで、Lagi はサブフレー
ムiからの量子化されていないLagであって、Mは1
つの符号化フレーム内のサブフレームの数である。
【0032】
【数11】
【0033】(5) ベクトル量子化器324が使用さ
れて遅れベクトルVLag が量子化される。さまざまな進
んだベクトル量子化(VQ)方式が高性能のベクトル量
子化を達成するために実現され得る。好ましくは、高品
質の量子化を実現するためには、高品質の予め記憶され
た量子化テーブルが重要である。ベクトル量子化器の構
造は、たとえば、多段階VQ、分割VQ等を含んでもよ
く、これらはすべて、複雑性、メモリの利用、およびそ
の他の考慮事項の種々の要件を達成するために、さまざ
まな状況で使用され得る。たとえば、1段階ダイレクト
CQがここで考えられる。ベクトル量子化の後に、下の
式(17)で表わされる量子化ベクトルが得られる。各
サブフレームのための量子化されたピッチ遅れは、上に
詳細に記載したように、音声コーデックによって使用さ
れる。その後、フレーム内の後続の各サブフレームにつ
いて、相互作用するサブフレーム分析が続行され得る。
れて遅れベクトルVLag が量子化される。さまざまな進
んだベクトル量子化(VQ)方式が高性能のベクトル量
子化を達成するために実現され得る。好ましくは、高品
質の量子化を実現するためには、高品質の予め記憶され
た量子化テーブルが重要である。ベクトル量子化器の構
造は、たとえば、多段階VQ、分割VQ等を含んでもよ
く、これらはすべて、複雑性、メモリの利用、およびそ
の他の考慮事項の種々の要件を達成するために、さまざ
まな状況で使用され得る。たとえば、1段階ダイレクト
CQがここで考えられる。ベクトル量子化の後に、下の
式(17)で表わされる量子化ベクトルが得られる。各
サブフレームのための量子化されたピッチ遅れは、上に
詳細に記載したように、音声コーデックによって使用さ
れる。その後、フレーム内の後続の各サブフレームにつ
いて、相互作用するサブフレーム分析が続行され得る。
【0034】
【数12】
【0035】(6) このように、公知の符号化技術を
使用して、量子化されたピッチ遅れおよび(LPC残留
信号ではなく)過去の励起信号を用いて、下の式(1
8)で示されるピッチ寄与ベクトルELag が得られる
(326)。このピッチ寄与ベクトルはW(z)/A
(z)を通してフィルタリングされて、知覚的にフィル
タリングされたピッチ寄与ベクトルPLag が得られる。
最適なピッチ予測係数βは下の式(19)に従って決定
され(328)、これは下の式(20)で示される誤り
規準を最小限に抑える。ここで、Tgは知覚的にフィル
タリングされた入力信号を表わすターゲット信号であ
る。
使用して、量子化されたピッチ遅れおよび(LPC残留
信号ではなく)過去の励起信号を用いて、下の式(1
8)で示されるピッチ寄与ベクトルELag が得られる
(326)。このピッチ寄与ベクトルはW(z)/A
(z)を通してフィルタリングされて、知覚的にフィル
タリングされたピッチ寄与ベクトルPLag が得られる。
最適なピッチ予測係数βは下の式(19)に従って決定
され(328)、これは下の式(20)で示される誤り
規準を最小限に抑える。ここで、Tgは知覚的にフィル
タリングされた入力信号を表わすターゲット信号であ
る。
【0036】
【数13】
【0037】固定されたコードブックを使用してj番目
のコードベクトルCjが得られ(330)、コードベク
トルはW(z)/A(z)を通してフィルタリングされ
て、C′j が決定される。最良のコードベクトルCi お
よびそれに関連するゲインαは、下の式(21)を最小
限にすることによって発見され得る(332)。ここ
で、Ncはコードブックのサイズ(またはコードベクト
ルの数)である。コードベクトルゲインαおよびピッチ
予測ゲインβがその後量子化されて(334)、下の式
(22)に従って現時点のサブフレームに対する励起e
(n)を生成する(340)のに利用される。現時点の
サブフレームの励起シーケンスe(n)は過去の励起信
号の一部として保持されて、後に続くサブフレーム34
2、344に与えられる。符号化手順は、現時点の符号
化フレームのすべてのサブフレームに対して繰返され
る。
のコードベクトルCjが得られ(330)、コードベク
トルはW(z)/A(z)を通してフィルタリングされ
て、C′j が決定される。最良のコードベクトルCi お
よびそれに関連するゲインαは、下の式(21)を最小
限にすることによって発見され得る(332)。ここ
で、Ncはコードブックのサイズ(またはコードベクト
ルの数)である。コードベクトルゲインαおよびピッチ
予測ゲインβがその後量子化されて(334)、下の式
(22)に従って現時点のサブフレームに対する励起e
(n)を生成する(340)のに利用される。現時点の
サブフレームの励起シーケンスe(n)は過去の励起信
号の一部として保持されて、後に続くサブフレーム34
2、344に与えられる。符号化手順は、現時点の符号
化フレームのすべてのサブフレームに対して繰返され
る。
【0038】
【数14】
【0039】(7) 音声デコーダにおいて、LPC係
数aK 、ベクトル量子化ピッチ遅れ、ピッチ予測ゲイン
β、コードベクトルインデックスi、およびコードベク
トルゲインαが、逆量子化によって、伝送されるビット
ストリームから検索される。各サブフレームに対する励
起信号は、下の式(23)に示すように、エンコーダ内
で実行されたように単に繰返される。したがって、出力
音声は最終的に下の式(24)によって合成される。
数aK 、ベクトル量子化ピッチ遅れ、ピッチ予測ゲイン
β、コードベクトルインデックスi、およびコードベク
トルゲインαが、逆量子化によって、伝送されるビット
ストリームから検索される。各サブフレームに対する励
起信号は、下の式(23)に示すように、エンコーダ内
で実行されたように単に繰返される。したがって、出力
音声は最終的に下の式(24)によって合成される。
【0040】
【数15】
【図1】CELP音声モデルのブロック図である。
【図2】従来のCELPモデルのブロック図の一部分の
図である。
図である。
【図3】従来のCELPモデルのブロック図の一部分の
図である。
図である。
【図4】従来のCELPモデルのブロック図の一部分の
図である。
図である。
【図5】従来のCELPモデルのブロック図の残りの部
分を示す図である。
分を示す図である。
【図6】この発明の好ましい実施例に従った音声コーダ
のブロック図の一部分を示す図である。
のブロック図の一部分を示す図である。
【図7】この発明の好ましい実施例に従った音声コーダ
のブロック図の残りの部分を示す図である。
のブロック図の残りの部分を示す図である。
300 音声符号化システム 310 入力音声 312 前処理 314 LPC分析および量子化 316 LPC残留信号
───────────────────────────────────────────────────── フロントページの続き (72)発明者 トム・ホン・リ アメリカ合衆国、60030 イリノイ州、グ レイズレイク、カントリー・ドライブ、 1905、ナンバー・303
Claims (14)
- 【請求項1】 関連する特性パラメータを有する入力音
声(310)のフレームを符号化するための音声エンコ
ーダであって、符号化された音声はデコーダによって復
号化され、前記音声エンコーダは、 入力音声(310)を定められたデジタル化音声サンプ
ルにデジタル化するための手段と、 デジタル化音声サンプルを符号化フレーム内のサブフレ
ームにまとめるための手段と、 入力音声の特性パラメータを抽出し(322)、かつ特
性パラメータを量子化する(324)ための手段と、 量子化されたパラメータをデコーダに伝送するための手
段とを含み、デコーダは量子化されたパラメータに鑑み
て入力音声を再生成する、音声エンコーダ。 - 【請求項2】 特性パラメータはピッチ遅れ(322)
およびピッチゲインを含む、請求項1に記載の音声エン
コーダ。 - 【請求項3】 音声を符号化するためのシステムであっ
て、音声はフレームに分離された複数の音声サンプルと
して表わされ、フレームは複数のサブフレームから形成
され、フレーム内の音声サンプルの線形予測符号化(L
PC)分析および量子化が行なわれてLPC残留信号が
決定され、前記システムは、 フレーム内の各サブフレームに対して所定の最小許容ピ
ッチ遅れおよび所定の最大許容ピッチ遅れ内の量子化さ
れていないピッチ遅れ値を評価するための遅れ手段(3
20)と、 フレーム内の各サブフレームに対して量子化されていな
いピッチ遅れ値を含むピッチ遅れベクトルを得るための
手段(322)と、 ピッチ遅れベクトルを量子化して量子化ピッチ遅れベク
トルを生成するためのベクトル量子化器(324)と、 現時点のサブフレームのピッチ寄与ベクトルを決定する
ための手段(326)とを含み、ピッチ寄与ベクトルは
量子化ピッチ遅れベクトルに適合され、さらに、 現時点のサブフレームの音声サンプルを表わす励起信号
を生成するためのコードブック手段(330)と、 現時点の各サブフレームの励起信号を後続のサブフレー
ムに供給して、フレームのための符号化音声を提供する
ための手段(340)とを含む、システム。 - 【請求項4】 前記システムはさらに、 音声のフレームのために、LPC残留信号(316)に
基づいて開ループピッチ遅れ値を評価するための手段
(317)と、 フレーム内の第1の現時点のサブフレームの音声サンプ
ルを表わす励起ベクトルを生成するための手段(31
8)とを含み、前記励起ベクトルを生成するための手段
は、 LPC残留信号ベクトルを構築するための手段と、 信号ベクトルをフィルタリングしてターゲット信号を生
成するための少なくとも1つのフィルタと、 所定の最小および最大許容ピッチ遅れ内のピッチ遅れ値
を検討して、過去のLPC残留信号と検討されたピッチ
遅れ値とに従って励起ベクトルが得られるようにするた
めの手段とを含み、前記システムはさらに、 ピッチ予測ベクトルを得るために励起ベクトルをフィル
タリングするための知覚的フィルタ(320)を含み、
量子化されていないピッチ遅れ値はピッチ予測ベクトル
およびターゲット信号に従って評価される、請求項3に
記載のシステム。 - 【請求項5】 コードブック手段(330)は音声の特
性を個々に表わす複数のコードベクトルを有するコード
ブックを含み、各コードベクトルは関連するゲイン(3
32)を有し、さらに、現時点のサブフレーム内の音声
サンプルを最もよく表わすコードベクトルが選択されて
励起信号が生成される(340)、請求項3に記載のシ
ステム。 - 【請求項6】 前記システムはさらに、 符号化音声を伝送するための手段と、 符号化された音声を受取りかつ処理するためのデコーダ
とを含み、前記デコーダは、 ベクトル量子化ピッチ遅れ(324)、ピッチ予測係数
(328)、およびコードベクトルとゲイン(332)
を検索するための手段と、 検索されたベクトル量子化ピッチ遅れと、ピッチ予測係
数と、コードベクトルおよびゲインとを逆量子化して合
成音声を生成するための手段とを含む、請求項5に記載
のシステム。 - 【請求項7】 音声を符号化するためのシステムであっ
て、音声はフレームに分離された複数の音声サンプルと
して表わされ、フレームは複数のサブフレームから形成
され、LPC残留信号r(n)を決定するためにフレー
ム内の音声サンプルの線形予測符号化(LPC)分析お
よび量子化(314)が行なわれ、前記システムは、 音声のフレームのためにLPC残留信号(316)に基
づいて開ループピッチ遅れ値Lagopを評価するための
手段(317)と、 フレーム内の第1のサブフレームの音声サンプルを表わ
すピッチ予測ベクトルRLag を生成するための手段(3
18)とを含み、前記ピッチ予測ベクトルRLa g を生成
するための手段は、 下の式(1)で表わされるLPC残留信号ベクトルを構
築するための手段と、 【数1】 LPC残留信号ベクトルをフィルタリングしてターゲッ
ト信号Tgを生成するための少なくとも1つのフィルタ
とを含み、前記システムはさらに、 ピッチ予測ベクトルRLag をフィルタリングしてフィル
タリングされたピッチ予測ベクトルP′Lag を得るため
の第1の知覚的フィルタ(320)と、 各サブフレームのために、下の式(2)に従って所定の
最小許容ピッチ遅れおよび所定の最大許容ピッチ遅れ内
の量子化されていないピッチ遅れ値Lagを決定するた
めの遅れ手段(322)と、 【数2】 フレーム内の各サブフレームに対して決定された量子化
されていないピッチ遅れ値を含むピッチ遅れベクトルを
得るための手段と、 ピッチ遅れベクトルを量子化して量子化ピッチ遅れベク
トルを生成するためのベクトル量子化器(324)と、 現時点のサブフレームのために、量子化されたピッチ遅
れベクトルに適合されるピッチ寄与ベクトルELag およ
び励起ベクトルを決定するための手段(326)と、 ピッチ寄与ベクトルをフィルタリングして知覚的にフィ
ルタリングされたピッチ寄与ベクトルPLag を得るため
の第2の知覚的フィルタと、 下の式(3)に従ってピッチ予測係数βを決定するため
の手段(328)と、 【数3】 現時点のサブフレームのために励起シーケンスe(n)
を生成するためのコードブックC(330)とを含み、
前記コードブックは入力音声を表わし、前記コードブッ
クは入力音声の特性を個々に表わす複数のコードベクト
ルを有し、各コードベクトルは関連するゲインαおよび
インデックスjを有し、ここで下の式(4)が成り立
ち、 【数4】 さらに、 現時点のサブフレームの励起シーケンスe(n)を後続
のサブフレームに与えて符号化音声を提供するための手
段(340)を含む、システム。 - 【請求項8】 ピッチ予測係数(328)は下の式
(5)で表わされる誤り規準を最小限にするよう選択さ
れる、請求項7に記載のシステム。 【数5】 - 【請求項9】 インデックスiおよびそれに関連するゲ
インαを有する代表的コードベクトルは下の式(6)を
最小限にすることによって計算される(332)、請求
項7に記載のシステム。 【数6】 - 【請求項10】 前記システムは音声シンセサイザ内に
含まれ、さらに、 符号化音声を伝送するための手段と、 符号化音声を受取りかつ処理するためのデコーダとを含
み、前記デコーダは、 ベクトル量子化ピッチ遅れ(324)と、ピッチ予測係
数(328)と、コードベクトルインデックスiおよび
ゲイン(332)とを検索するための手段と、 検索されたベクトル量子化ピッチ遅れ、ピッチ予測係
数、およびコードベクトルインデックスとゲインを逆量
子化して、合成された音声を生成するための手段とを含
む、請求項7に記載の音声を符号化するシステム。 - 【請求項11】 フレーム内の各サブフレームのための
量子化されていない遅れ値Lagは、適応できる開ルー
プ探索技術を使用してすべてのサブフレームに対して同
時に決定される(322)、請求項7に記載のシステ
ム。 - 【請求項12】 ピッチ遅れ情報を使用して入力音声を
符号化する方法であって、音声は複数のLPC残留サン
プルによって規定される線形予測符号化(LPC)残留
信号(316)を有し、現時点のLPC残留サンプルは
過去のLPC残留サンプルの線形の組合せに従って時間
領域内で決定され、さらに、入力音声はピッチ遅れ値の
最小および最大範囲内にあるピッチ遅れを有し、前記方
法は、 入力音声を処理する(312)ステップと、 入力音声のN個のサンプルを1フレーム内に分離するス
テップと、 フレームを複数のサブフレームに分割するステップと、 各フレームのためにLPC残留信号(316)を決定す
るステップと、 フレームのためのLPC残留信号に基づいて、フレーム
内の各サブフレームのためにピッチ遅れの最小および最
大範囲内の量子化されていないピッチ遅れ値を評価する
ための遅れ手段(320)と、 フレーム内の各サブフレームのために量子化されていな
いピッチ遅れ値を含むピッチ遅れベクトルを得る(32
2)ステップと、 量子化ピッチ遅れベクトルを生成する(324)ステッ
プと、 現時点のサブフレームのためにピッチ寄与ベクトルを決
定する(326)ステップとを含み、ピッチ寄与ベクト
ルは量子化ピッチ遅れベクトルに適合され、さらに、 現時点のサブフレームの音声サンプルを表わす励起信号
を生成する(340)ステップと、 現時点の各サブフレームの励起信号を後続のサブフレー
ムに与えてフレームのための符号化音声を提供するステ
ップとを含む、方法。 - 【請求項13】 音声のフレームのためにLPC残留信
号(316)に基づいて開ループピッチ遅れ値を評価す
るステップと、 フレーム内の現時点の第1のサブフレームの音声サンプ
ルを表わす励起ベクトルを生成する(318)ステップ
とをさらに含み、前記励起ベクトルを生成するステップ
は、 LPC残留信号ベクトルを構築するステップと、 信号ベクトルをフィルタリングしてターゲット信号を生
成するステップと、 所定の最小および最大ピッチ遅れ範囲内のピッチ遅れ値
を検討して、先のLPC残留信号および検討されたピッ
チ遅れ値に従って励起ベクトルが得られるようにするス
テップとを含み、前記方法はさらに、 励起ベクトルをフィルタリングしてピッチ予測ベクトル
を得る(320)ステップを含み、量子化されていない
ピッチ遅れ値はピッチ予測ベクトルおよびターゲット信
号に従って評価される、請求項12に記載の方法。 - 【請求項14】 前記方法は、 符号化音声を伝送するステップと、 符号化音声を復号化するステップとをさらに含み、前記
復号化するステップは、 符号化音声を受取りかつ処理するステップと、 ベクトル量子化ピッチ遅れおよびピッチ予測係数を検索
するステップと、 検索されたベクトル量子化ピッチ遅れおよびピッチ予測
係数を逆量子化して、合成された音声を生成するステッ
プとを含む、請求項12に記載の方法。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US08/721410 | 1996-09-26 | ||
| US08/721,410 US6014622A (en) | 1996-09-26 | 1996-09-26 | Low bit rate speech coder using adaptive open-loop subframe pitch lag estimation and vector quantization |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH10187196A true JPH10187196A (ja) | 1998-07-14 |
Family
ID=24897881
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP9262289A Withdrawn JPH10187196A (ja) | 1996-09-26 | 1997-09-26 | 低ビットレートピッチ遅れコーダ |
Country Status (3)
| Country | Link |
|---|---|
| US (2) | US6014622A (ja) |
| EP (1) | EP0833305A3 (ja) |
| JP (1) | JPH10187196A (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2010506221A (ja) * | 2006-10-06 | 2010-02-25 | クゥアルコム・インコーポレイテッド | フレーム消去回復のシステム、方法、および装置 |
| JP2010181890A (ja) * | 1998-08-24 | 2010-08-19 | Mindspeed Technologies Inc | 音声符号化用開ループピッチ処理 |
Families Citing this family (30)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6006174A (en) * | 1990-10-03 | 1999-12-21 | Interdigital Technology Coporation | Multiple impulse excitation speech encoder and decoder |
| EP1553564A3 (en) * | 1996-08-02 | 2005-10-19 | Matsushita Electric Industrial Co., Ltd. | Voice encoding device, voice decoding device, recording medium for recording program for realizing voice encoding /decoding and mobile communication device |
| US6199037B1 (en) * | 1997-12-04 | 2001-03-06 | Digital Voice Systems, Inc. | Joint quantization of speech subframe voicing metrics and fundamental frequencies |
| US7392180B1 (en) * | 1998-01-09 | 2008-06-24 | At&T Corp. | System and method of coding sound signals using sound enhancement |
| US6182033B1 (en) * | 1998-01-09 | 2001-01-30 | At&T Corp. | Modular approach to speech enhancement with an application to speech coding |
| US6470309B1 (en) * | 1998-05-08 | 2002-10-22 | Texas Instruments Incorporated | Subframe-based correlation |
| US6113653A (en) * | 1998-09-11 | 2000-09-05 | Motorola, Inc. | Method and apparatus for coding an information signal using delay contour adjustment |
| JP3942760B2 (ja) * | 1999-02-03 | 2007-07-11 | 富士通株式会社 | 情報収集装置 |
| US6260009B1 (en) * | 1999-02-12 | 2001-07-10 | Qualcomm Incorporated | CELP-based to CELP-based vocoder packet translation |
| US6449592B1 (en) * | 1999-02-26 | 2002-09-10 | Qualcomm Incorporated | Method and apparatus for tracking the phase of a quasi-periodic signal |
| US6640209B1 (en) * | 1999-02-26 | 2003-10-28 | Qualcomm Incorporated | Closed-loop multimode mixed-domain linear prediction (MDLP) speech coder |
| US6782360B1 (en) * | 1999-09-22 | 2004-08-24 | Mindspeed Technologies, Inc. | Gain quantization for a CELP speech coder |
| US6377916B1 (en) | 1999-11-29 | 2002-04-23 | Digital Voice Systems, Inc. | Multiband harmonic transform coder |
| EP1308927B9 (en) * | 2000-08-09 | 2009-02-25 | Sony Corporation | Voice data processing device and processing method |
| US7133823B2 (en) * | 2000-09-15 | 2006-11-07 | Mindspeed Technologies, Inc. | System for an adaptive excitation pattern for speech coding |
| US6937978B2 (en) * | 2001-10-30 | 2005-08-30 | Chungwa Telecom Co., Ltd. | Suppression system of background noise of speech signals and the method thereof |
| WO2004084182A1 (en) * | 2003-03-15 | 2004-09-30 | Mindspeed Technologies, Inc. | Decomposition of voiced speech for celp speech coding |
| US20040208169A1 (en) * | 2003-04-18 | 2004-10-21 | Reznik Yuriy A. | Digital audio signal compression method and apparatus |
| US7742926B2 (en) * | 2003-04-18 | 2010-06-22 | Realnetworks, Inc. | Digital audio signal compression method and apparatus |
| US20050091044A1 (en) * | 2003-10-23 | 2005-04-28 | Nokia Corporation | Method and system for pitch contour quantization in audio coding |
| US20050091041A1 (en) * | 2003-10-23 | 2005-04-28 | Nokia Corporation | Method and system for speech coding |
| US7752039B2 (en) | 2004-11-03 | 2010-07-06 | Nokia Corporation | Method and device for low bit rate speech coding |
| US9058812B2 (en) * | 2005-07-27 | 2015-06-16 | Google Technology Holdings LLC | Method and system for coding an information signal using pitch delay contour adjustment |
| DE602006015328D1 (de) * | 2006-11-03 | 2010-08-19 | Psytechnics Ltd | Abtastfehlerkompensation |
| US8990094B2 (en) * | 2010-09-13 | 2015-03-24 | Qualcomm Incorporated | Coding and decoding a transient frame |
| US9082416B2 (en) | 2010-09-16 | 2015-07-14 | Qualcomm Incorporated | Estimating a pitch lag |
| US8620660B2 (en) | 2010-10-29 | 2013-12-31 | The United States Of America, As Represented By The Secretary Of The Navy | Very low bit rate signal coder and decoder |
| CN104115220B (zh) * | 2011-12-21 | 2017-06-06 | 华为技术有限公司 | 非常短的基音周期检测和编码 |
| CN103426441B (zh) | 2012-05-18 | 2016-03-02 | 华为技术有限公司 | 检测基音周期的正确性的方法和装置 |
| CN109003621B (zh) * | 2018-09-06 | 2021-06-04 | 广州酷狗计算机科技有限公司 | 一种音频处理方法、装置及存储介质 |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5307441A (en) * | 1989-11-29 | 1994-04-26 | Comsat Corporation | Wear-toll quality 4.8 kbps speech codec |
| EP1998319B1 (en) * | 1991-06-11 | 2010-08-11 | Qualcomm Incorporated | Variable rate vocoder |
| TW224191B (ja) * | 1992-01-28 | 1994-05-21 | Qualcomm Inc | |
| US5495555A (en) * | 1992-06-01 | 1996-02-27 | Hughes Aircraft Company | High quality low bit rate celp-based speech codec |
| US5734789A (en) * | 1992-06-01 | 1998-03-31 | Hughes Electronics | Voiced, unvoiced or noise modes in a CELP vocoder |
| CA2154911C (en) * | 1994-08-02 | 2001-01-02 | Kazunori Ozawa | Speech coding device |
-
1996
- 1996-09-26 US US08/721,410 patent/US6014622A/en not_active Expired - Lifetime
-
1997
- 1997-09-26 EP EP97116815A patent/EP0833305A3/en not_active Withdrawn
- 1997-09-26 JP JP9262289A patent/JPH10187196A/ja not_active Withdrawn
-
1999
- 1999-11-02 US US09/433,002 patent/US6345248B1/en not_active Expired - Lifetime
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2010181890A (ja) * | 1998-08-24 | 2010-08-19 | Mindspeed Technologies Inc | 音声符号化用開ループピッチ処理 |
| JP2010506221A (ja) * | 2006-10-06 | 2010-02-25 | クゥアルコム・インコーポレイテッド | フレーム消去回復のシステム、方法、および装置 |
| US8825477B2 (en) | 2006-10-06 | 2014-09-02 | Qualcomm Incorporated | Systems, methods, and apparatus for frame erasure recovery |
Also Published As
| Publication number | Publication date |
|---|---|
| US6014622A (en) | 2000-01-11 |
| US6345248B1 (en) | 2002-02-05 |
| EP0833305A3 (en) | 1999-01-13 |
| EP0833305A2 (en) | 1998-04-01 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US6345248B1 (en) | Low bit-rate speech coder using adaptive open-loop subframe pitch lag estimation and vector quantization | |
| EP1273005B1 (en) | Wideband speech codec using different sampling rates | |
| EP0409239B1 (en) | Speech coding/decoding method | |
| KR100264863B1 (ko) | 디지털 음성 압축 알고리즘에 입각한 음성 부호화 방법 | |
| KR100304682B1 (ko) | 음성 코더용 고속 여기 코딩 | |
| JPH1130997A (ja) | 音声符号化復号装置 | |
| JP3180786B2 (ja) | 音声符号化方法及び音声符号化装置 | |
| US6768978B2 (en) | Speech coding/decoding method and apparatus | |
| JP2002268686A (ja) | 音声符号化装置及び音声復号化装置 | |
| US6330531B1 (en) | Comb codebook structure | |
| JPH0341500A (ja) | 低遅延低ビツトレート音声コーダ | |
| KR20040045586A (ko) | 서로 다른 대역폭을 갖는 켈프 방식 코덱들 간의상호부호화 장치 및 그 방법 | |
| US20030055633A1 (en) | Method and device for coding speech in analysis-by-synthesis speech coders | |
| EP0745972B1 (en) | Method of and apparatus for coding speech signal | |
| EP1187337B1 (en) | Speech coding processor and speech coding method | |
| KR100550003B1 (ko) | 상호부호화기에서 개회로 피치 추정 방법 및 그 장치 | |
| JP3319396B2 (ja) | 音声符号化装置ならびに音声符号化復号化装置 | |
| JP2736157B2 (ja) | 符号化装置 | |
| JP2853170B2 (ja) | 音声符号化復号化方式 | |
| Gersho | Speech coding | |
| JP3192051B2 (ja) | 音声符号化装置 | |
| JPH09179593A (ja) | 音声符号化装置 | |
| Tseng | An analysis-by-synthesis linear predictive model for narrowband speech coding | |
| JP3071800B2 (ja) | 適応ポストフィルタ | |
| WO2001009880A1 (en) | Multimode vselp speech coder |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A300 | Application deemed to be withdrawn because no request for examination was validly filed |
Free format text: JAPANESE INTERMEDIATE CODE: A300 Effective date: 20041207 |