JP2004506355A - ウェーブレット分解に基づくビデオ符号化方法 - Google Patents
ウェーブレット分解に基づくビデオ符号化方法 Download PDFInfo
- Publication number
- JP2004506355A JP2004506355A JP2002518087A JP2002518087A JP2004506355A JP 2004506355 A JP2004506355 A JP 2004506355A JP 2002518087 A JP2002518087 A JP 2002518087A JP 2002518087 A JP2002518087 A JP 2002518087A JP 2004506355 A JP2004506355 A JP 2004506355A
- Authority
- JP
- Japan
- Prior art keywords
- sub
- encoding
- decomposition
- encoding method
- standard deviation
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
- 238000000034 method Methods 0.000 title claims abstract description 42
- 238000000354 decomposition reaction Methods 0.000 title claims abstract description 34
- 230000002123 temporal effect Effects 0.000 claims description 14
- 238000004364 calculation method Methods 0.000 description 6
- 238000001914 filtration Methods 0.000 description 3
- 239000011159 matrix material Substances 0.000 description 3
- 238000013139 quantization Methods 0.000 description 3
- 230000009466 transformation Effects 0.000 description 3
- 230000006835 compression Effects 0.000 description 2
- 238000007906 compression Methods 0.000 description 2
- 230000009977 dual effect Effects 0.000 description 2
- 238000005516 engineering process Methods 0.000 description 2
- 230000015572 biosynthetic process Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000005457 optimization Methods 0.000 description 1
- 238000000638 solvent extraction Methods 0.000 description 1
- 238000003786 synthesis reaction Methods 0.000 description 1
- 230000000007 visual effect Effects 0.000 description 1
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/60—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding
- H04N19/61—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding in combination with predictive coding
- H04N19/615—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding in combination with predictive coding using motion compensated temporal filtering [MCTF]
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/10—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding
- H04N19/169—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the coding unit, i.e. the structural portion or semantic portion of the video signal being the object or the subject of the adaptive coding
- H04N19/177—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the coding unit, i.e. the structural portion or semantic portion of the video signal being the object or the subject of the adaptive coding the unit being a group of pictures [GOP]
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/60—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding
- H04N19/61—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding in combination with predictive coding
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/60—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding
- H04N19/63—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding using sub-band based transform, e.g. wavelets
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/60—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding
- H04N19/63—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding using sub-band based transform, e.g. wavelets
- H04N19/635—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding using sub-band based transform, e.g. wavelets characterised by filter definition or implementation details
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/10—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding
- H04N19/102—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the element, parameter or selection affected or controlled by the adaptive coding
- H04N19/13—Adaptive entropy coding, e.g. adaptive variable length coding [AVLC] or context adaptive binary arithmetic coding [CABAC]
Landscapes
- Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Compression Or Coding Systems Of Tv Signals (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
本発明は、フレーム群に再分割されるビデオシーケンスを符号化する方法に関する。この方法は、三次元ウェーブレット分解が最適の重み付け定数を使用してリフティング方式で双直交フィルタバンクに関連して実施されるオンラインプロシージャを含む。これらの定数は、いかなる重み付け定数も用いずに同様の分解が実施される付加的なオフラインプロシージャにより決定される。
Description
【0001】
【発明の属する技術分野】
本発明は、フレーム群(GOF)に再分割されるビデオシーケンスに適用される符号化方法であって、
−符号化プロセスに関して入力パラメータを規定するための初期化ステップと、
−連続したフレームの対の間で動き推定及び補償を実施するための動き推定/補償ステップと、
−初期化ステップで規定された重み付け定数を使用していわゆるリフティング方式で双直交フィルタバンクを使用して3次元(3D)ウェーブレット分解を実行するための空間的時間的分解ステップと、
−こうして得られた変換係数を、3D分解に適応化された符号化方法によって符号化するための符号化ステップと、
を含むオンラインプロシージャに基づく符号化方法に関する。
【0002】
【従来の技術】
ビデオ圧縮方式で、時間冗長性の低減は、主に2つのタイプの方法によって達成される。第1の方法であるいわゆる「ハイブリッド」又は予測的方法では、現在のフレームの予測は、以前に伝送されたフレームに基づいて計算され、予測誤差のみがイントラ符号化され、伝送される。第2の方法において、時間冗長性は、時間的変換である3D(又は2D+t)方法によって利用される。この方法は、冗長性を取り除くための空間的技法と同様である。この後者の方法によれば、フレームのシーケンスは、3Dボリュームとして処理される、こうして、画像符号化において多く使用される古典的なサブバンド分解は、分離可能な変換(例えばフィルタバンクにより実現されるウェーブレット又はウェーブレットパケット変換)を使用することにより3次元の空間的時間的データに拡張されることができる。3D構造には異方性があることは明らかであるが、これは、時間的及び空間的な方向において異なるフィルタバンクを使用することにより考慮することができる(通常、より長いフィルタを使用することの付加的な遅延は望ましくないので、ハール(Haar)フィルタが時間フィルタリングのために使用される。更にこれらは2タップフィルタであり、境界効果を示さない唯一の完全な再現直交フィルタである)。
【0003】
この3D符号化方式の符号化効率は、時間分解のそれぞれのレベルで、低い時間的サブバンドで動き推定/補償を実施することにより改善されることができる。3Dサブバンド分解は、補償されたフレーム群に適用される(このフレーム群は、2の累乗のフレーム数を含まなければならず、通常は16である)。最後の時間分解レベルでは、最も低い時間的サブバンド内に2つのフレームがある。時間的サブバンドのそれぞれのフレームでは、空間分解が実施される。
【0004】
データの3次元構造をサブバンド符号化することは、空間的なサブバンド符号化技法の拡張として実現されることができる。画像圧縮のための最も効果的なウェーブレットに基づく方式の1つは、A. Said及びW.A. Pearlmanによる「A new, fast, and efficient image codec based on set partitioning in hierarchical trees (= SPIHT)」(IEEE Transactions on Circuits and Systems for Video Technology, vol.6, June 1996, pp.243−250)に詳細に記載された2D SPIHTアルゴリズムに基づくものであり、最近では3D構造にまで拡張されている。3D符号化技法において使用される基礎的な概念は、以下の通りである。同じ位置に対応する空間的時間的ツリーが、ウェーブレットドメインにおいて形成され、これらのツリーにおけるウェーブレット変換係数は、それらの大きさのビットプレーン表現における最高位ビットのレベルにより規定される組に区分される。最終的に、最上位の残りのビットプレーンが符号化され、結果として得られたビットが伝送される。
【0005】
元のSPIHTアルゴリズムは、直交分解の仮説に基づくものであり、この仮説によれば、再現誤差は、サブバンド歪みの和として測定される量子化誤差に等しい(こういうわけで、各サブバンドのエネルギーに基づきビットバジェットを分散することが可能である)。更に、画像及びビデオ符号化における最善の結果は、直交フィルタを使用して達成されるのではなく、双直交フィルタを使用して達成されることが確認された(これは、双直交フィルタの対称性がペアレントと同じ空間位置にウェーブレット係数を生じさせるという事実による)。しかしながら、双直交フィルタは量子化誤差のL2ノルムを保たないので、直交変換について導き出されるビット配分(repartition)は最小の再現誤差をもたらさない。
【0006】
更に、双直交フィルタは乗算定数まで決定される。従って、完全な再現条件だけが課されるときには無限数のフィルタバンクが設計されうる。フィルタバンクのリフティングインプリメンテーションが使用される場合、ポリフェーズマトリクスP(z)は常にファクタ(因数)に分解することが可能であることが知られている。
【数1】
ここで、ti及びsiは、Laurent多項式であり、Kは実定数である。この場合、合成部分に対応するデュアルポリフェーズマトリクスは次式により与えられる。
【数2】
下式により、すべてのKについて完全な再現が保証される。
【数3】
【0007】
【発明が解決しようとする課題】
この分解は、図1及び図2に示されるデュアル方式を通して実現される。従って、異なる因数分解及び定数Kの異なる価値に対応して無限数のインプリメンテーションが存在する。符号化の観点から、これらのフィルタバンクがすべて同等というわけではない。この乗算定数を選ぶための通常の基準は、1に等しいポリフェーズマトリクスの行列式を課すことであるが、この選択は、符号化性能にとって最善ではないことがある(こういうわけで、大部分の通常のアルゴリズムは概ね直交する双直交変換に基づく)。
【0008】
従って本発明の目的は、3Dウェーブレット分解及び自動ビット割当て機構に基づいて、ビデオ符号化方式に関して高度な非直交ウェーブレット変換の適用可能性を改善するための技法を提案することである。
【0009】
【課題を解決するための手段】
このために、本発明は、この説明の冒頭部分に述べたような符号化方法であって、この符号化方法が更に、
−重み付け定数を除いて、オフライン計算に関して同じタイプの入力パラメータを規定し、
−生成されるGOFが元のシーケンスの表現に適応化される平均値及び標準偏差の白色ガウスノイズを含む、ランダム的なGOF生成サブステップを実行し、
−前記リフティング方式に基づき且ついかなる重み付け定数ももたない同じフィルタバンクを使用して、3Dウェーブレット分解を実現し、
−前記3D分解に起因する空間的時間的サブバンドの標準偏差を計算し、
−前記標準偏差をノイズの標準偏差で除算する、サブステップを含むオフライン計算からなるオフラインプロシージャを含み、最適の重み付け定数が、前記除算サブステップの出力において利用可能であり、空間的時間的サブバンドの出力を重み付けすることを可能にするために前記フィルタバンクに向けて送られることを特徴とする、符号化方法に関する。
【0010】
こうして、サブバンドにおけるエネルギー配分に基づいて、3D分解における双直交フィルタに関する最適の重みが決定される。画像符号化のフレームワークにおいてこれらの定数を選ぶために、緩和アルゴリズムに基づくいくつかの複雑な方法が文献において既に使用されており、例としてP. Moulinによる「A multiscale relaxation algorithm for SNR maximization in non−orthogonal subband coding」(IEEE Transactions on Image Processing, vol.4, n゜9, September 1995, pp.1269−1281)に記載されている方法がある。再現誤差を主観的により許容可能なものにするために人間の視覚システムを利用する技法が存在し、例えばP. Desarte他による「Signal−adapted multiresolution transform for image coding」(IEEE Transactions on Information Theory, vol.38, n゜2, March 1992, pp.897−904)に記載されているような技法がある。しかし、すべてのこれらの既存のアルゴリズムは、画像符号化に関連している。ここで提案される方法、つまり以前の研究の3Dウェーブレット分解のケースへの拡張は、ビデオ符号化のためのものである。この方法は、いかなるタイプの線形フィルタに適用されてもよく、具体的には動き補償された時間フィルタリングのフレームワークにおいて適用されてもよい。
【0011】
【発明の実施の形態】
以下、本発明について添付の図面を参照して例示により説明する。
【0012】
図1には、SPIHTのような符号化アルゴリズムがあとに続く3Dウェーブレット分解に基づく従来のビデオ符号化方式が示されている。連続したフレームF(1)、F(2)、…、F(n)、…を含む元のビデオシーケンスは、ガウスの白色ノイズ(通常の法則に従う独立同分布の確率変数)を含む、圧縮する際に使用されるものと同じサイズのフレーム群(GOF、group of frames)に再分割される。入力パラメータが、初期化ステップ11(INIT)で規定される(GOFフレームの数、ウェーブレットタイプ、サブ最適の重み)。符号化方式は更に、動き推定/補償ステップ12(MECP,motion estimation/compensation)と、サブ最適定数をもつフィルタバンクを使用する3D空間的時間的分解ステップ13(STDE,spatio−temporal decomposition)と、SPIHTのような符号化ステップ14(SENC)と、を連続して含む。符号化ステップ14の出力において、符号化されたビットストリーム(ENCB)が利用可能となる。
【0013】
本発明による包括的なビデオ符号化方式が図2に示されている。このビデオ符号化方式は、上述したステップ11乃至14と同様のステップ21、22、23、24を含み、以下のやり方で変更されている。図1の連続したステップに従って実行されるオンライン計算ONLCに関して、3D空間的時間的分解ステップで使用される重み付け係数の計算処理を最適化するために、オフライン計算が導入される。この分解ステップ23は、最適の定数をもつ重み付けされたフィルタバンクを使用する。図2の左側部分のモジュール230に表されているこれらのオフライン計算OFLCについてここで説明する。
【0014】
まず、図1の方式に関して上述したように、入力パラメータが、規定サブステップ231(INIT)の間に規定され(GOFフレーム数、ウェーブレットタイプ、…)、そののちランダムなGOF生成サブステップ232(GOFG)が続く。ガウスのホワイトノイズに関して、元の画像は、8ビットで(すなわち0から255までの範囲の値により)表現されるので、128に等しい平均値及び32に等しい標準偏差をもつガウス分布が選択された。従って、それぞれのフレーム内の値は、以下の方程式を満たす。
F(m, n) = (32 x N(m, n)) + 128
ここで、N(m,n)は、ゼロ平均値及び一標準偏差をもつガウスのホワイトノイズである。この条件は、ほぼすべての生成された値が係数の入力値が位置する間隔(0,255)の中にあることを確実にする(それにもかかわらず、係数のダイナミックレンジのほぼ全体を便利な信頼区間に含める条件が満たされるとすぐに、分布の平均値及び標準偏差の正確な値は重要でなくなることに注意されたい)。
【0015】
そののちウェーブレット分解サブステップ233(WAVD)が与えられる。このステップは、例えばI. Daubechies及びW. Sweldensによる「Factoring wavelet transforms into lifting steps」(Bell Laboratories technical report, Lucent Technologies, 1996)に記載されているリフティング方式を使用する。ランダム的に生成されたGOFは、いかなる重み付け定数ももたないフィルタ(K=1)を使用して分解される。そののちサブステップ234(STDC)は、結果として得られる空間的時間的サブバンドの標準偏差を計算することを可能にする。これらの標準偏差は、除算サブステップ235(DIV)の出力において分解ステップ23に送信されるべき最適の重み付けを得るために、32(ノイズの標準偏差)で除算される(実際に、各サブバンドにおける係数を当該サブバンドに対応する標準偏差で除算することにより、それぞれのサブバンドの一標準偏差を与える。これは、正規直交分解の場合のように、各サブバンドにおけるエネルギーが1に等しいことを意味する)。
【0016】
この最適のエネルギー配分は、最終的に、正規直交分解によって暗示されるものと同じ仮説の下で、符号化ステップ24においてSPIHTアルゴリズムを使用することを可能にする。係数は、ビットプレーン毎に送信され、再現誤差は、量子化誤差に等しい。これは、所与のフィルタバンクについて最大の符号化利得をもたらす。
【0017】
上述したように、本技法は、重み付け係数を計算するために、動き推定及び補償をもたない元のランダム的GOFに適用された。これらの定数が一旦得られると、空間的時間的分解が動き補償されたGOFに適用される。この技法は、時間分解が動きの方向において直交する必要があるという事実により正当化される。実際に、動き補償の後に時間フィルタリングを実施することにより、同じ軌跡に属するポイントのみが共にフィルタリングされる。
【図面の簡単な説明】
【図1】SPIHTのような符号化アルゴリズムがあとに続く3Dウェーブレット分解に基づく包括的なビデオ符号化方式を示す図。
【図2】本発明により、3D空間的時間的分解に関して最適の重み付け定数を計算するために実行される連続する演算に再分割されるフィルタバンク最適化ステップを含む包括的なビデオ符号化方式を示す図。
【発明の属する技術分野】
本発明は、フレーム群(GOF)に再分割されるビデオシーケンスに適用される符号化方法であって、
−符号化プロセスに関して入力パラメータを規定するための初期化ステップと、
−連続したフレームの対の間で動き推定及び補償を実施するための動き推定/補償ステップと、
−初期化ステップで規定された重み付け定数を使用していわゆるリフティング方式で双直交フィルタバンクを使用して3次元(3D)ウェーブレット分解を実行するための空間的時間的分解ステップと、
−こうして得られた変換係数を、3D分解に適応化された符号化方法によって符号化するための符号化ステップと、
を含むオンラインプロシージャに基づく符号化方法に関する。
【0002】
【従来の技術】
ビデオ圧縮方式で、時間冗長性の低減は、主に2つのタイプの方法によって達成される。第1の方法であるいわゆる「ハイブリッド」又は予測的方法では、現在のフレームの予測は、以前に伝送されたフレームに基づいて計算され、予測誤差のみがイントラ符号化され、伝送される。第2の方法において、時間冗長性は、時間的変換である3D(又は2D+t)方法によって利用される。この方法は、冗長性を取り除くための空間的技法と同様である。この後者の方法によれば、フレームのシーケンスは、3Dボリュームとして処理される、こうして、画像符号化において多く使用される古典的なサブバンド分解は、分離可能な変換(例えばフィルタバンクにより実現されるウェーブレット又はウェーブレットパケット変換)を使用することにより3次元の空間的時間的データに拡張されることができる。3D構造には異方性があることは明らかであるが、これは、時間的及び空間的な方向において異なるフィルタバンクを使用することにより考慮することができる(通常、より長いフィルタを使用することの付加的な遅延は望ましくないので、ハール(Haar)フィルタが時間フィルタリングのために使用される。更にこれらは2タップフィルタであり、境界効果を示さない唯一の完全な再現直交フィルタである)。
【0003】
この3D符号化方式の符号化効率は、時間分解のそれぞれのレベルで、低い時間的サブバンドで動き推定/補償を実施することにより改善されることができる。3Dサブバンド分解は、補償されたフレーム群に適用される(このフレーム群は、2の累乗のフレーム数を含まなければならず、通常は16である)。最後の時間分解レベルでは、最も低い時間的サブバンド内に2つのフレームがある。時間的サブバンドのそれぞれのフレームでは、空間分解が実施される。
【0004】
データの3次元構造をサブバンド符号化することは、空間的なサブバンド符号化技法の拡張として実現されることができる。画像圧縮のための最も効果的なウェーブレットに基づく方式の1つは、A. Said及びW.A. Pearlmanによる「A new, fast, and efficient image codec based on set partitioning in hierarchical trees (= SPIHT)」(IEEE Transactions on Circuits and Systems for Video Technology, vol.6, June 1996, pp.243−250)に詳細に記載された2D SPIHTアルゴリズムに基づくものであり、最近では3D構造にまで拡張されている。3D符号化技法において使用される基礎的な概念は、以下の通りである。同じ位置に対応する空間的時間的ツリーが、ウェーブレットドメインにおいて形成され、これらのツリーにおけるウェーブレット変換係数は、それらの大きさのビットプレーン表現における最高位ビットのレベルにより規定される組に区分される。最終的に、最上位の残りのビットプレーンが符号化され、結果として得られたビットが伝送される。
【0005】
元のSPIHTアルゴリズムは、直交分解の仮説に基づくものであり、この仮説によれば、再現誤差は、サブバンド歪みの和として測定される量子化誤差に等しい(こういうわけで、各サブバンドのエネルギーに基づきビットバジェットを分散することが可能である)。更に、画像及びビデオ符号化における最善の結果は、直交フィルタを使用して達成されるのではなく、双直交フィルタを使用して達成されることが確認された(これは、双直交フィルタの対称性がペアレントと同じ空間位置にウェーブレット係数を生じさせるという事実による)。しかしながら、双直交フィルタは量子化誤差のL2ノルムを保たないので、直交変換について導き出されるビット配分(repartition)は最小の再現誤差をもたらさない。
【0006】
更に、双直交フィルタは乗算定数まで決定される。従って、完全な再現条件だけが課されるときには無限数のフィルタバンクが設計されうる。フィルタバンクのリフティングインプリメンテーションが使用される場合、ポリフェーズマトリクスP(z)は常にファクタ(因数)に分解することが可能であることが知られている。
【数1】
ここで、ti及びsiは、Laurent多項式であり、Kは実定数である。この場合、合成部分に対応するデュアルポリフェーズマトリクスは次式により与えられる。
【数2】
下式により、すべてのKについて完全な再現が保証される。
【数3】
【0007】
【発明が解決しようとする課題】
この分解は、図1及び図2に示されるデュアル方式を通して実現される。従って、異なる因数分解及び定数Kの異なる価値に対応して無限数のインプリメンテーションが存在する。符号化の観点から、これらのフィルタバンクがすべて同等というわけではない。この乗算定数を選ぶための通常の基準は、1に等しいポリフェーズマトリクスの行列式を課すことであるが、この選択は、符号化性能にとって最善ではないことがある(こういうわけで、大部分の通常のアルゴリズムは概ね直交する双直交変換に基づく)。
【0008】
従って本発明の目的は、3Dウェーブレット分解及び自動ビット割当て機構に基づいて、ビデオ符号化方式に関して高度な非直交ウェーブレット変換の適用可能性を改善するための技法を提案することである。
【0009】
【課題を解決するための手段】
このために、本発明は、この説明の冒頭部分に述べたような符号化方法であって、この符号化方法が更に、
−重み付け定数を除いて、オフライン計算に関して同じタイプの入力パラメータを規定し、
−生成されるGOFが元のシーケンスの表現に適応化される平均値及び標準偏差の白色ガウスノイズを含む、ランダム的なGOF生成サブステップを実行し、
−前記リフティング方式に基づき且ついかなる重み付け定数ももたない同じフィルタバンクを使用して、3Dウェーブレット分解を実現し、
−前記3D分解に起因する空間的時間的サブバンドの標準偏差を計算し、
−前記標準偏差をノイズの標準偏差で除算する、サブステップを含むオフライン計算からなるオフラインプロシージャを含み、最適の重み付け定数が、前記除算サブステップの出力において利用可能であり、空間的時間的サブバンドの出力を重み付けすることを可能にするために前記フィルタバンクに向けて送られることを特徴とする、符号化方法に関する。
【0010】
こうして、サブバンドにおけるエネルギー配分に基づいて、3D分解における双直交フィルタに関する最適の重みが決定される。画像符号化のフレームワークにおいてこれらの定数を選ぶために、緩和アルゴリズムに基づくいくつかの複雑な方法が文献において既に使用されており、例としてP. Moulinによる「A multiscale relaxation algorithm for SNR maximization in non−orthogonal subband coding」(IEEE Transactions on Image Processing, vol.4, n゜9, September 1995, pp.1269−1281)に記載されている方法がある。再現誤差を主観的により許容可能なものにするために人間の視覚システムを利用する技法が存在し、例えばP. Desarte他による「Signal−adapted multiresolution transform for image coding」(IEEE Transactions on Information Theory, vol.38, n゜2, March 1992, pp.897−904)に記載されているような技法がある。しかし、すべてのこれらの既存のアルゴリズムは、画像符号化に関連している。ここで提案される方法、つまり以前の研究の3Dウェーブレット分解のケースへの拡張は、ビデオ符号化のためのものである。この方法は、いかなるタイプの線形フィルタに適用されてもよく、具体的には動き補償された時間フィルタリングのフレームワークにおいて適用されてもよい。
【0011】
【発明の実施の形態】
以下、本発明について添付の図面を参照して例示により説明する。
【0012】
図1には、SPIHTのような符号化アルゴリズムがあとに続く3Dウェーブレット分解に基づく従来のビデオ符号化方式が示されている。連続したフレームF(1)、F(2)、…、F(n)、…を含む元のビデオシーケンスは、ガウスの白色ノイズ(通常の法則に従う独立同分布の確率変数)を含む、圧縮する際に使用されるものと同じサイズのフレーム群(GOF、group of frames)に再分割される。入力パラメータが、初期化ステップ11(INIT)で規定される(GOFフレームの数、ウェーブレットタイプ、サブ最適の重み)。符号化方式は更に、動き推定/補償ステップ12(MECP,motion estimation/compensation)と、サブ最適定数をもつフィルタバンクを使用する3D空間的時間的分解ステップ13(STDE,spatio−temporal decomposition)と、SPIHTのような符号化ステップ14(SENC)と、を連続して含む。符号化ステップ14の出力において、符号化されたビットストリーム(ENCB)が利用可能となる。
【0013】
本発明による包括的なビデオ符号化方式が図2に示されている。このビデオ符号化方式は、上述したステップ11乃至14と同様のステップ21、22、23、24を含み、以下のやり方で変更されている。図1の連続したステップに従って実行されるオンライン計算ONLCに関して、3D空間的時間的分解ステップで使用される重み付け係数の計算処理を最適化するために、オフライン計算が導入される。この分解ステップ23は、最適の定数をもつ重み付けされたフィルタバンクを使用する。図2の左側部分のモジュール230に表されているこれらのオフライン計算OFLCについてここで説明する。
【0014】
まず、図1の方式に関して上述したように、入力パラメータが、規定サブステップ231(INIT)の間に規定され(GOFフレーム数、ウェーブレットタイプ、…)、そののちランダムなGOF生成サブステップ232(GOFG)が続く。ガウスのホワイトノイズに関して、元の画像は、8ビットで(すなわち0から255までの範囲の値により)表現されるので、128に等しい平均値及び32に等しい標準偏差をもつガウス分布が選択された。従って、それぞれのフレーム内の値は、以下の方程式を満たす。
F(m, n) = (32 x N(m, n)) + 128
ここで、N(m,n)は、ゼロ平均値及び一標準偏差をもつガウスのホワイトノイズである。この条件は、ほぼすべての生成された値が係数の入力値が位置する間隔(0,255)の中にあることを確実にする(それにもかかわらず、係数のダイナミックレンジのほぼ全体を便利な信頼区間に含める条件が満たされるとすぐに、分布の平均値及び標準偏差の正確な値は重要でなくなることに注意されたい)。
【0015】
そののちウェーブレット分解サブステップ233(WAVD)が与えられる。このステップは、例えばI. Daubechies及びW. Sweldensによる「Factoring wavelet transforms into lifting steps」(Bell Laboratories technical report, Lucent Technologies, 1996)に記載されているリフティング方式を使用する。ランダム的に生成されたGOFは、いかなる重み付け定数ももたないフィルタ(K=1)を使用して分解される。そののちサブステップ234(STDC)は、結果として得られる空間的時間的サブバンドの標準偏差を計算することを可能にする。これらの標準偏差は、除算サブステップ235(DIV)の出力において分解ステップ23に送信されるべき最適の重み付けを得るために、32(ノイズの標準偏差)で除算される(実際に、各サブバンドにおける係数を当該サブバンドに対応する標準偏差で除算することにより、それぞれのサブバンドの一標準偏差を与える。これは、正規直交分解の場合のように、各サブバンドにおけるエネルギーが1に等しいことを意味する)。
【0016】
この最適のエネルギー配分は、最終的に、正規直交分解によって暗示されるものと同じ仮説の下で、符号化ステップ24においてSPIHTアルゴリズムを使用することを可能にする。係数は、ビットプレーン毎に送信され、再現誤差は、量子化誤差に等しい。これは、所与のフィルタバンクについて最大の符号化利得をもたらす。
【0017】
上述したように、本技法は、重み付け係数を計算するために、動き推定及び補償をもたない元のランダム的GOFに適用された。これらの定数が一旦得られると、空間的時間的分解が動き補償されたGOFに適用される。この技法は、時間分解が動きの方向において直交する必要があるという事実により正当化される。実際に、動き補償の後に時間フィルタリングを実施することにより、同じ軌跡に属するポイントのみが共にフィルタリングされる。
【図面の簡単な説明】
【図1】SPIHTのような符号化アルゴリズムがあとに続く3Dウェーブレット分解に基づく包括的なビデオ符号化方式を示す図。
【図2】本発明により、3D空間的時間的分解に関して最適の重み付け定数を計算するために実行される連続する演算に再分割されるフィルタバンク最適化ステップを含む包括的なビデオ符号化方式を示す図。
Claims (3)
- フレーム群に再分割されるビデオシーケンスに適用されるとともに、
符号化プロセスに関して入力パラメータを規定するための初期化ステップと、
連続するフレームの対の間で動き推定及び補償を実施するための動き推定/補償ステップと、
前記初期化ステップで規定される重み付け定数を使用していわゆるリフティング方式で双直交フィルタバンクを使用して三次元ウェーブレット分解を実行するための空間的時間的分解ステップと、
このように得られた変換係数を符号化するための符号化ステップと、
を含むオンラインプロシージャに基づく符号化方法であって、前記符号化方法が更に、
前記重み付け定数を除き、オフラインプロシージャに関して同じタイプの入力パラメータを規定するサブステップと、
生成されるフレーム群が、元のシーケンスの表現に適応化された平均値及び標準偏差の白色ガウスノイズを含む、ランダム的なフレーム群生成サブステップを実行するサブステップと、
前記リフティング方式に基づき、いかなる重み付け定数ももたない同じフィルタバンクを使用して、三次元ウェーブレット分解を実現するサブステップと、
前記三次元分解に起因する空間的時間的サブバンドの標準偏差を計算するサブステップと、
前記標準偏差をノイズの標準偏差で除算するサブステップと、
を含むオフライン計算からなるオフラインプロシージャを含み、最適な重み付け定数は、前記除算サブステップの出力で利用可能であり、前記空間的時間的サブバンドの出力を重み付けすることを可能にするために前記フィルタバンクに向けて送られることを特徴とする、符号化方法。 - 前記符号化方法がいわゆるSPIHTアルゴリズムである、請求項1に記載の符号化方法。
- 0から255までの値をもつ8ビットで表現される元のビデオシーケンスに関して、輝度成分について128の平均値及び32の標準偏差が使用され、クロミナンス成分について128の平均値及び20の標準偏差が使用される、請求項1又は2に記載の符号化方法。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP00402246 | 2000-08-08 | ||
| PCT/EP2001/008539 WO2002013536A2 (en) | 2000-08-08 | 2001-07-23 | Video encoding method based on a wavelet decomposition |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JP2004506355A true JP2004506355A (ja) | 2004-02-26 |
Family
ID=8173802
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2002518087A Withdrawn JP2004506355A (ja) | 2000-08-08 | 2001-07-23 | ウェーブレット分解に基づくビデオ符号化方法 |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US6782051B2 (ja) |
| EP (1) | EP1310101A2 (ja) |
| JP (1) | JP2004506355A (ja) |
| KR (1) | KR20020064791A (ja) |
| CN (1) | CN1180630C (ja) |
| WO (1) | WO2002013536A2 (ja) |
Cited By (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2006060790A (ja) * | 2004-07-12 | 2006-03-02 | Microsoft Corp | 動き補償時間フィルタリングにおける適応アップデート |
| US8213503B2 (en) | 2008-09-05 | 2012-07-03 | Microsoft Corporation | Skip modes for inter-layer residual video coding and decoding |
| US8340177B2 (en) | 2004-07-12 | 2012-12-25 | Microsoft Corporation | Embedded base layer codec for 3D sub-band coding |
| US8374238B2 (en) | 2004-07-13 | 2013-02-12 | Microsoft Corporation | Spatial scalability in 3D sub-band decoding of SDMCTF-encoded video |
| US8493513B2 (en) | 2006-01-06 | 2013-07-23 | Microsoft Corporation | Resampling and picture resizing operations for multi-resolution video coding and decoding |
| US8711948B2 (en) | 2008-03-21 | 2014-04-29 | Microsoft Corporation | Motion-compensated prediction of inter-layer residuals |
| US8953673B2 (en) | 2008-02-29 | 2015-02-10 | Microsoft Corporation | Scalable video coding and decoding with sample bit depth and chroma high-pass residual layers |
| US9571856B2 (en) | 2008-08-25 | 2017-02-14 | Microsoft Technology Licensing, Llc | Conversion operations in scalable video encoding and decoding |
Families Citing this family (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2003055119A2 (en) * | 2001-12-06 | 2003-07-03 | New York University | Logic arrangement, data structure, system and method for multilinear representation of multimodal data ensembles for synthesis, recognition and compression |
| US7321625B2 (en) * | 2002-12-13 | 2008-01-22 | Ntt Docomo, Inc. | Wavelet based multiresolution video representation with spatially scalable motion vectors |
| KR20050022160A (ko) * | 2003-08-26 | 2005-03-07 | 삼성전자주식회사 | 스케일러블 비디오 코딩 및 디코딩 방법, 및 스케일러블비디오 엔코더 및 디코더 |
| WO2005084005A1 (en) * | 2004-02-17 | 2005-09-09 | Koninklijke Philips Electronique N.V. | Method of visualizing a large still picture on a small-size display. |
| KR100697516B1 (ko) * | 2004-10-27 | 2007-03-20 | 엘지전자 주식회사 | 3차원 웨이블릿 변환 기반의 동영상 코딩 방법 |
| US8279918B2 (en) * | 2005-07-15 | 2012-10-02 | Utc Fire & Security Americas Corporation, Inc. | Method and apparatus for motion compensated temporal filtering using residual signal clipping |
| US8483277B2 (en) * | 2005-07-15 | 2013-07-09 | Utc Fire & Security Americas Corporation, Inc. | Method and apparatus for motion compensated temporal filtering using split update process |
| TWI362844B (en) * | 2007-05-07 | 2012-04-21 | Realtek Semiconductor Corp | Wireless communication apparatus with built-in channel emulator/noise generator |
| US9531915B2 (en) | 2013-12-04 | 2016-12-27 | Aspeed Technology Inc. | Image encoding system and method thereof |
| CN110068816B (zh) * | 2019-05-10 | 2023-04-28 | 长沙理工大学 | 一种基于提升格式的探地雷达信号用小波基构造方法 |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5262958A (en) * | 1991-04-05 | 1993-11-16 | Texas Instruments Incorporated | Spline-wavelet signal analyzers and methods for processing signals |
| AU1727495A (en) * | 1994-01-14 | 1995-08-01 | Houston Advanced Research Center | Boundary-spline-wavelet compression for video images |
| US5881176A (en) * | 1994-09-21 | 1999-03-09 | Ricoh Corporation | Compression and decompression with wavelet style and binary style including quantization by device-dependent parser |
| US5870502A (en) * | 1996-04-08 | 1999-02-09 | The Trustees Of Columbia University In The City Of New York | System and method for a multiresolution transform of digital image information |
| US5757309A (en) * | 1996-12-18 | 1998-05-26 | The United States Of America As Represented By The Secretary Of The Navy | Spatial frequency feature extraction for a classification system using wavelets |
| US6211515B1 (en) * | 1998-10-19 | 2001-04-03 | Raytheon Company | Adaptive non-uniformity compensation using feedforward shunting and wavelet filter |
| WO2001078402A1 (en) * | 2000-04-11 | 2001-10-18 | Koninklijke Philips Electronics N.V. | Video encoding and decoding method |
-
2001
- 2001-07-23 JP JP2002518087A patent/JP2004506355A/ja not_active Withdrawn
- 2001-07-23 CN CNB018029671A patent/CN1180630C/zh not_active Expired - Fee Related
- 2001-07-23 WO PCT/EP2001/008539 patent/WO2002013536A2/en not_active Ceased
- 2001-07-23 EP EP01967218A patent/EP1310101A2/en not_active Withdrawn
- 2001-07-23 KR KR1020027004441A patent/KR20020064791A/ko not_active Withdrawn
- 2001-08-06 US US09/923,867 patent/US6782051B2/en not_active Expired - Fee Related
Cited By (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8340177B2 (en) | 2004-07-12 | 2012-12-25 | Microsoft Corporation | Embedded base layer codec for 3D sub-band coding |
| US8442108B2 (en) | 2004-07-12 | 2013-05-14 | Microsoft Corporation | Adaptive updates in motion-compensated temporal filtering |
| JP2006060790A (ja) * | 2004-07-12 | 2006-03-02 | Microsoft Corp | 動き補償時間フィルタリングにおける適応アップデート |
| US8374238B2 (en) | 2004-07-13 | 2013-02-12 | Microsoft Corporation | Spatial scalability in 3D sub-band decoding of SDMCTF-encoded video |
| US9319729B2 (en) | 2006-01-06 | 2016-04-19 | Microsoft Technology Licensing, Llc | Resampling and picture resizing operations for multi-resolution video coding and decoding |
| US8493513B2 (en) | 2006-01-06 | 2013-07-23 | Microsoft Corporation | Resampling and picture resizing operations for multi-resolution video coding and decoding |
| US8780272B2 (en) | 2006-01-06 | 2014-07-15 | Microsoft Corporation | Resampling and picture resizing operations for multi-resolution video coding and decoding |
| US8953673B2 (en) | 2008-02-29 | 2015-02-10 | Microsoft Corporation | Scalable video coding and decoding with sample bit depth and chroma high-pass residual layers |
| US8711948B2 (en) | 2008-03-21 | 2014-04-29 | Microsoft Corporation | Motion-compensated prediction of inter-layer residuals |
| US8964854B2 (en) | 2008-03-21 | 2015-02-24 | Microsoft Corporation | Motion-compensated prediction of inter-layer residuals |
| US9571856B2 (en) | 2008-08-25 | 2017-02-14 | Microsoft Technology Licensing, Llc | Conversion operations in scalable video encoding and decoding |
| US10250905B2 (en) | 2008-08-25 | 2019-04-02 | Microsoft Technology Licensing, Llc | Conversion operations in scalable video encoding and decoding |
| US8213503B2 (en) | 2008-09-05 | 2012-07-03 | Microsoft Corporation | Skip modes for inter-layer residual video coding and decoding |
Also Published As
| Publication number | Publication date |
|---|---|
| CN1393110A (zh) | 2003-01-22 |
| EP1310101A2 (en) | 2003-05-14 |
| US6782051B2 (en) | 2004-08-24 |
| CN1180630C (zh) | 2004-12-15 |
| WO2002013536A2 (en) | 2002-02-14 |
| WO2002013536A3 (en) | 2002-04-11 |
| KR20020064791A (ko) | 2002-08-09 |
| US20020101922A1 (en) | 2002-08-01 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US6782051B2 (en) | Video encoding method based on a wavelet decomposition | |
| US7042946B2 (en) | Wavelet based coding using motion compensated filtering based on both single and multiple reference frames | |
| JP2003504987A (ja) | ビデオシーケンスを圧縮する符号化方法 | |
| US7023923B2 (en) | Motion compensated temporal filtering based on multiple reference frames for wavelet based coding | |
| KR20040106417A (ko) | 다중 참조 프레임들에 기초하여 움직임 보상 시간필터링을 사용하는 스케일링 가능 웨이블릿 기반 코딩 | |
| CN100411441C (zh) | 用于三维子带视频编码的方法和设备 | |
| US20050047509A1 (en) | Scalable video coding and decoding methods, and scalable video encoder and decoder | |
| KR20050085385A (ko) | 비디오 코딩 방법 및 장치 | |
| JP2005533431A (ja) | ビデオ符号化方法及び装置 | |
| EP1504608A2 (en) | Motion compensated temporal filtering based on multiple reference frames for wavelet coding | |
| JP2006501750A (ja) | ウェーブレットベースの符号化において、動き補償された時間フィルタリングのための、フィルタリングされた領域とフィルタリングされない領域とを両方備えるlフレーム | |
| Wang et al. | Rate-distortion modeling for wavelet video coders | |
| Tillier et al. | 3-band motion-compensated temporal structures for scalable video coding | |
| Zan et al. | Comparison of wavelets for multiresolution motion estimation | |
| Atta et al. | Spatio-temporal scalability-based motion-compensated 3-d subband/dct video coding | |
| KR100582024B1 (ko) | 웨이블렛 변환 기반 동영상 부호화를 위한 3차원 블록분할방식 | |
| Calvagno et al. | Computation of the coding gain for subband coders | |
| Seran et al. | Quality variation control for three-dimensional wavelet-based video coders | |
| André et al. | (N, 0) motion-compensated lifting-based wavelet transform | |
| Kassim et al. | 3D color set partitioning in hierarchical trees | |
| Agostini et al. | Motion-adapted weighted lifting scheme for MCWT video coders | |
| Lee et al. | Inter-subband redundancy prediction using neural network for video coding | |
| Verdicchio et al. | Architectural aspects of scalable wavelet video coding | |
| Darazi et al. | Lifting scheme-based method for joint coding 3D stereo digital cinema with luminace correction and optimized prediction | |
| Basha et al. | Scalable Video Coding Using Accordion Discrete Wavelet Transform and Tucker Decomposition for Multimedia Applications |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A300 | Application deemed to be withdrawn because no request for examination was validly filed |
Free format text: JAPANESE INTERMEDIATE CODE: A300 Effective date: 20081007 |
