JP3616111B2 - 異なる焦点距離又は異なる視域の複数の像を使用した高解像度静止画像を得る方法及び装置 - Google Patents
異なる焦点距離又は異なる視域の複数の像を使用した高解像度静止画像を得る方法及び装置 Download PDFInfo
- Publication number
- JP3616111B2 JP3616111B2 JP29449192A JP29449192A JP3616111B2 JP 3616111 B2 JP3616111 B2 JP 3616111B2 JP 29449192 A JP29449192 A JP 29449192A JP 29449192 A JP29449192 A JP 29449192A JP 3616111 B2 JP3616111 B2 JP 3616111B2
- Authority
- JP
- Japan
- Prior art keywords
- image
- images
- frame
- focal length
- sequence
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Fee Related
Links
Images
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T3/00—Geometric image transformations in the plane of the image
- G06T3/40—Scaling of whole images or parts thereof, e.g. expanding or contracting
- G06T3/4038—Image mosaicing, e.g. composing plane images from plane sub-images
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T3/00—Geometric image transformations in the plane of the image
- G06T3/40—Scaling of whole images or parts thereof, e.g. expanding or contracting
- G06T3/4053—Scaling of whole images or parts thereof, e.g. expanding or contracting based on super-resolution, i.e. the output image resolution being higher than the sensor resolution
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/20—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using video object coding
- H04N19/23—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using video object coding with coding of regions that are present throughout a whole video segment, e.g. sprites, background or mosaic
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/50—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding
- H04N19/503—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding involving temporal prediction
- H04N19/51—Motion estimation or motion compensation
- H04N19/53—Multi-resolution motion estimation; Hierarchical motion estimation
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N23/00—Cameras or camera modules comprising electronic image sensors; Control thereof
- H04N23/60—Control of cameras or camera modules
- H04N23/698—Control of cameras or camera modules for achieving an enlarged field of view, e.g. panoramic image capture
Landscapes
- Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Closed-Circuit Television Systems (AREA)
Description
【産業上の利用分野】
本発明は基本的には異なる焦点距離の複数の像及び装置を使用して高解像度静止画像を創作する方法に関するものである。特には、本発明はズームビデオシークエンス(sequence)等の複数の異なる焦点距離像(イメージ)を使用した固定焦点距離像である静止高解像画像を創出する方法に関するものである。本発明はまた静止パノラマ像のものよりも狭い視域の複数像から静止パノラマ像(イメージ)を創作する技術にも関するものである。
【0002】
【従来の技術】
画像処理分野においては、あるシーン(scene) の静止画像を得ることがしばしば望まれる。たいていの場合においては、その静止画像は記録手段の性能及びその静止画像を撮像する装置の焦点距離により決定される解像度を有する。ビデオ装置は現在比較的安価であり、多くの人々が使用できるほどに単純構造である。ビデオ記録装置はスチール写真のような静止画像描出と較べてある意味の利点を備えている。始動したビデオカメラはその焦点領域内にある全出来事を撮影することができるが、一方普通のスチール写真の場合には写真家がシャッターを押すことで選択した被写体のみを撮影する。よって、スポーツイベントのごとき高速で移動する被写体を撮影する場合、又は結婚式や報道ドキュメンタリーのごとき予期しない事態が発生するような状況下ではビデオを常時撮影状態にセットしておき、事後に望むスチールを選択することが往々にして便利である。しかしながら、ビデオ信号の解像度は1ピクチャー高あたり480本程度のライン(走査線)と1ピクチャー幅あたり640程度のサンプル(sample)に制限されている。(ビデオ信号自体はスキャンラインを通じて連続的である。しかしながら、ディスプレーするためにスキャンライン方向にサンプル化されている。)多くの場合においてこの程度の解像度では高画質を与えるには不充分である。特に、もしオリジナルの被写体像が比較的短い焦点距離で撮影されたものである場合において不足する。像が拡大されるとその像は相当に不鮮明になる。同様に、映画や8ミリ撮影のごとき他の撮影技術の場合にもそれらに特有の解像度に限定される。像の拡大は画像全体にわたり単位面積あたりの解像度を必然的に劣化させる。
【0003】
例えば、ステージ上のピアノの前で聴衆に向かって演奏しているソロの演奏家をその聴衆と共に撮影することが望まれる場合がある。もし撮像装置がビデオ装置であれば、聴衆を映し出しているワイドアングル画像は前記の標準ビデオ解像度に見合った解像度となる。画面全体にわたる解像度も同じである。よって、ソロピアニストの像はそのシーンの残り部分と同様な粗さとなる。たとえば、もしそのソロリスト像が全画面の1/16のスペースを取っているとすれば、垂直方向に120本のラインと、水平方向に160のサンプルを使用していることになる。この場合、たとえば会場の後方にある空席等のあまり重要でないシーンも同一の解像度となる。図1は異なる2焦点距離に関する1焦平面上に、あるシーンの焦点合わせを略図的に示すものである。もし焦点距離fw が比較的短ければ、像2の全幅は焦平面4上に焦点が合う。
【0004】
もちろん、ソロリストにズームインし、さらに長い焦点距離でソロリストの像を撮影することでそのソロリストをより鮮明(即ち、垂直方向にさらに多数のラインと水平方向にさらに多数のピクセル(pixel))に映し出すことは可能である。図1に示すごとく、焦点距離fTはfwよりも長い。しかしながら、像2の中央部6のみが焦平面4に焦点が合わせされている。焦平面の範囲外で焦点されているので他のほとんどのシーンは犠牲になっている。ソロリスト像はさらに拡大されて大きなスペースを占め、元の像の輪郭の一部は写らない。
【0005】
2チャンネルのデータを結合させて画像データを増強する(enhance)技術は周知である。その第1チャンネルは空間的高解像度(即ち、単位長さあたりに比較的多くの画素)及び比較的時間的低解像度(即ち、単位時間あたりに比較的少ないフレーム数)を有するものであり、その第2チャンネルは空間的低解像度及び時間的高解像度を有する。その結合の結果、空間的及び時間的解像度はそれらの高いほうに近づき、普通の状態で時間的及び空間的高解像度を有するシングル像シークエンス(single image sequence) を伝達するのに要する情報よりも少ない情報伝達で済む。1988年5月に合衆国のマサチューセッツ工科大学(Massachusetts Institute of Technology) 電気工学及びコンピュータ科学部に提出されたB.S.論文であるクレーマン ローレンス エヌ(Claman,Lawrence N.)の「2チャンネル空間−時間エンコーダ(A Two−Channel Spatio−Temporal Encoder)」 を参照されたい。
【0006】
静止画像の種々な空間的部分の解像増強のごとく、最短焦点距離で撮影したものを映写化するのに今日利用可能な技術は見当らない。クレーマンの論文は固定焦点距離像とベクトル量子化を利用しており、その結果オリジナルの空間的高解像度像のものを越えない解像度及び視域のスチールフレームを提供している。
【0007】
【発明が解決しようとする課題】
パノラマビュー(view)の一部から他のパノラマビューの一部にかけて実質的に共通な1焦点距離を維持しつつ、あるシーンのパノラマビューを提供できることもまた望ましいことである。これを行う従来の方法はビデオカメラをパノラマシーンの片側から別側に移動することであり、本質的には前後のフレームから各々ほんの少々異なる数多くのフレームを撮ることである。その隣接するフレームに関して、各フレームは右側と左側のエッジ部分が異なるのみである。フレームを形成している像の大部分は隣接するフレームの像と同一である。パノラマシーンを形成するこれらの種々な像を保存し、ナビゲートするには多量のデータ保存及びデータアクセスが必要とされる。データ保存及びアクセスには多額の費用を要するのでこの従来技術は望ましいものとはいえない。また、保存及びアクセスされたデータの大部分が実用性を有しない。パノラマ的空間を撮影するのに現在使用されている撮影装置にはグルブスコープ(glubuscope)又はボルピ(volpi)レンズの移動が含まれる。
1シーンの1位置から別位置へパン(pan)し、同時にズームできることも望ましいことである。従来技術の欠点はそのような組み合わせにおいて望ましくない結果をもたらすことである。
【0008】
よって、本発明の目的は、以下の利点を備えた比較的に高解像度を有する静止画像を創作する方法及び装置を提供することである:
1)像全体にわたり高解像度で情報を取得する必要がない。
2)あまり重要ではない像の大部分に関して情報を収集する必要がない。
3)種々な焦点距離又は視域の標準的ビデオ像のシークエンスを入力要素として取得できる。
4)標準的フィルム像のシークエンスを入力要素として取得できる。
5)望む像のいかなる部分でもその解像度を増強する。
6)適正にプログラムされた汎用デジタルコンピュータ及び標準型ビデオ又は映画装置が使用可能である。
【0009】
本発明の別目的は過剰なデータ保存及びアクセス能力を要せず、あるシーンのパノラマビューを観察者に提供し、その観察者にそのシーンの1位置から他の位置までのナビゲーションを可能とする方法を提供することである。本発明のさらに別目的はデジタル化されたいかなる形態の像データであろうとも前記能力を発揮させることである。
【0010】
【課題を解決するための手段】
上記課題を解決するための本発明を要約すれば、本発明は静止画像を発生させる方法であって、複数の像を創出するステップを有しており、各像は他と異なる焦点距離にて創出されており、さらに、その各像を共通の焦点距離にスケールするステップと、その各スケールされた像を1焦点距離の最終像に組み合わせるステップを有しており、その最終像の部分はそのオリジナルシークエンスと比較して相対的に高い解像度を有している。本発明はさらに、変化する視域の静止画像のシークエンスを全体的視域のパノラマ像に組み入れるステップをも有している。異なる視域にて発生された像を組み合わせることに加えて、本発明の方法はパノラマシーンのごとき全体的シーンの異なる視域に関して発生した像を組み合わされたパノラマ視域に組み合わせることにも使用可能である。本発明のこの特質は変化する焦点距離のものとも結合可能である。
【0011】
本発明はまた静止画像を発生させる装置であって、複数の像を創出する手段を有しており、各像は他と異なる焦点距離にて創出されたものであり、さらに、各像を共通の焦点距離にスケールする手段とスケールされた像をそれぞれ1焦点距離の1像に組み入れる手段とを有している。本発明の装置はさらに全体的シーンの異なる視域に関して発生した像を組み合わされたパノラマ視域に組み入れる装置を含んでいる。
【0012】
次に、最初の実施例を解説する。ここでは本発明は静止画像(イメージ)を発生させる方法であって、以下のステップから成り立っている:
1)それぞれ異なる焦点距離で創出された複数の像をそれぞれ代表する複数の信号を発生させるステップ
2)共通の焦点距離にスケール(scale)された対応する像を代表するように各信号を変換するステップ
3)各変換した信号を組み合わせ、オリジナルシークエンスの像と比較して部分的には比較的に高解像度であるスケールされた像を1焦点距離の最終像とする組み合わせを代表した信号を得るステップ。
【0013】
別の実施例を解説する。ここでは本発明は静止画像を発生させる装置であって、以下の手段から成り立っている:
1)それぞれ互いに異なる焦点距離にて創出された複数の像を創出する手段。
2)異なる焦点距離のそれぞれの像を代表する複数の信号を発生させる手段。
3)共通の焦点距離にスケールされた対応する像を代表するように複数の信号の各々を変換する手段
4)各変換した信号を組み合わせ、スケールされた像を1焦点距離の1像とする組み合わせを代表した信号を得る手段。
【0014】
さらに別の実施例を解説する。ここでは本発明は静止画像を発生させる方法であって、以下のステップから成る:
1)それぞれ異なる視域で創出された複数の像をそれぞれ代表する複数の信号を発生させるステップ
2)共通のパノラマ視域内で1位置にトランスレート(translate) された対応する像を代表するように各信号を変換するステップ
3)各変換した信号を組み合わせ、オリジナルシークエンスの像と比較してさらに大きな視域をカバーする1パノラマ視域の最終像とするトランスレートされた像の組み合わせを代表した信号を得るステップ。
【0015】
またさらに別の実施例を解説する。ここでは本発明は静止画像を発生させる装置であって、以下の手段から成り立っている:
1)それぞれ互いに異なる視域にて創出された複数の像を創出する手段
2)それぞれ異なる視域の複数の像の1つを代表する複数の信号を発生させる手段
3)共通のパノラマ視域内の1位置にトランスレートされた対応する像を代表するように複数の信号の各々を変換する手段
4)各変換した信号を組み合わせ、1パノラマ視域の1像とするトランスレートされた像の組み合わせを代表した信号を得る手段。
【0016】
さらにまた別の実施例を解説する。ここでは本発明は静止画像を発生させる方法であって、以下のステップから成る:
1)それぞれ異なる視域にて創出された複数の像の1つを各々代表する複数の信号を発生させるステップ
2)共通のパノラマ視域内の1位置にトランスレートされ、共通の焦点距離にスケールされた対応する像を代表するように各信号を変換するステップ
3)各変換した信号を組み合わせ、部分的にはオリジナルシークエンスの像よりも高い解像度であり、オリジナルシークエンス及び1焦点距離の像と比較してさらに大きな視域をカバーする1パノラマ視域の最終像とするトランスレートされ、スケールされた像の組み合わせを代表した信号を得るステップ。
【0017】
【作用】
上記構成により、以下の利点を備えた比較的に高解像度を有する静止画像を創作する方法及び装置が提供される。
1)像全体にわたり高解像度で情報を取得する必要がない。
2)あまり重要ではない像の大部分に関して情報を収集する必要がない。
3)種々な焦点距離又は視域の標準的ビデオ像のシークエンスを入力要素として取得できる。
4)標準的フィルム像のシークエンスを入力要素として取得できる。
5)望む像のいかなる部分でもその解像度を増強する。
6)適正にプログラムされた汎用デジタルコンピュータ及び標準型ビデオ又は映画装置が使用可能である。
【0018】
さらに、過剰なデータ保存及びアクセス能力を要せず、あるシーンのパノラマビューが観察者に提供され、その観察者にそのシーンの1位置から他の位置までのナビゲーションを可能とする方法が提供される。
又、デジタル化されたいかなる形態の像データであろうとも前記能力を発揮させることができる。
【0019】
【実施例】
以下、本発明の実施例につき詳細に説明する。
典型的なビデオ像はフィールドのシークエンスにより創出される。各フィールドは画像化されるシーンの静止画像を代表する。インターレース(interlace) によって連続的フィールド間に1/2のスキャンラインの垂直方向のずれが生じる。(表示システムによってはインターレースなくスキャンされており、その場合にはフィールド間の垂直方向のずれは生じない。)一般的に毎秒50又は60フィールドの割合でこのような静止フィールドのシークエンスを表示することにより、モーション又は変化は人の視覚システムの心理的精神肉体的特性によって表出される。各フィールドのペアは前述したごとくにラインで満ちたスクリーンで構成され、各ラインはそれぞれ画素(ピクセル)により構成されている。各ピクセルは、コンピュータメモリー又は他の適当なデジタル記録媒体内に特定のレンジである信号値により代表される。カラー像においては、このレンジは典型的には色の3要素(component) の各々に対して0−255であり、グレースケール(grayscale) 像に対してはこのレンジは1要素あたり特徴的には0−255である。サテライト映像又はX線のような像源は0−4096ほどの大きさのレンジを有することもある。ピクセル値はフレーム内のそれらの位置に何らかの手段にて対応する形状でメモリー内に保存される。ビデオ像に対してなされる全操作は典型的には個々のピクセル要素の値を代表する信号に対して行われる。
【0020】
像のモノクロ記録の場合には、各ピクセル要素は単独の個別的(discrete)な要素である。像のカラー記録の場合には、1セットのチャンネル又はピクセルのグループが各ピクチャー要素に対して使用される。例えば、RGBとして知られる表色スキーム(color value scheme)において、各色は赤(R)、緑(G)及び青(B)の色量の組み合わせにより代表される。これら3色の各々の色「チャンネル」が別々に提供される。RGBシステムにおいて、各チャンネルはスキャンラインごとに同数のピクセルとスクリーンごとに同数のスキャンラインを有する。下記他のカラー値システムは異なるチャンネルに対してスキャンラインごとに異なる数のサンプルを有する。ピクセルの要素は典型的には表示装置上に相互に隣接して位置しており、同時に表示されるときには(観察者にとってはそのように錯覚する)結合してオリジナルの色を形成する。ピクセルの時間シークエンス(time sequential) ディスプレー等の他のスキームも利用可能である。
【0021】
RGBカラー値スキームは特定の使用には役立つが、カラー値の数学的操作には必ずしも最適ではない。他のカラースキームの方がさらに有用であり、特には像の輝度を表しているチャンネルを含むものが有効である。一般的に輝度とは所定方向における単位あたりの知覚面積から出される、又は反射された光の強さとして記述される。一般的に、輝度及び2つの他のディメンション(dimension) により定義される3チャンネルカラースペースはRGBカラースペースと等価である。典型的な輝度カラースペースは、アメリカ合衆国のテレビ放送用テレビ基準委員会により使用されているY(輝度)、i(位相)及びq(クワドラチャー(quadrature))カラースペースである。他の輝度カラースペースはCIE(Commission International de l′Eclairage)、Y、x、y(輝度及び2クロミナンスチャンネル)及びそのバリアント(variants)、さらにY、u、v(輝度及び2クロミナンスチャンネル)並びに他にも多数存在している。
【0022】
本発明においては、たいていの処理は1チャンネル又は1コンポーネントで充分である。全てのデータ計算及び操作はまずカラー像のYチャンネルに対してのみ実施される。Yチャンネルが選択される理由は普通、Yチャンネルがビデオシステムにおいて最も高い信号対ノイズ比を有しているからであり、さらに、Yチャンネルは、たいていの場合にクロミナンスよりも高い空間(spatial) 周波数にてサンプルされるからである。Yチャンネルに関して必要な変換が決定された後、同一の変換が位相及びクワドラチャーのクロミナンスチャンネルのような残りのチャンネルに対して適用される。これらの変換の特徴を以下にて述べる。
【0023】
ビデオ像は通常一連のフレームと見なされているが、実際にはそのような「フレーム」はいかなるときにも存在していない。フレームとして人たる観察者及び当該分野の技術者に考えられているのは、実際には「フィールド」の1ペアのことである。各フィールドは偶数列のスキャンライン、又は奇数列のスキャンラインにより成り立つ。偶数のフィールドは奇数列のスキャンラインから垂直方向に1本のスキャンラインの半分だけオフセット(offset)されている。1ペアのフィールドはインターレース(interlace) されて1フレームを形成している。
【0024】
フィールドペア101と102は図2において略図的に示されている。フィールド101は像の奇数列のスキャンラインのみを含んでおり、フィールド102は像の偶数列のスキャンラインのみを含んでいる。ビデオ装置はこれらのフィールドを連続的に別々に記録する。よって、各フィールドは潜在的に多少とも異なる像を記録することとなり、それはフィールドの記録に要する時間に関連するシーン又はカメラのモーションによる。また、ビデオ装置はフィールドを連続的に素早くディスプレーし、その速度は典型的には毎秒50から60フィールドである。この速度でフィールドがディスプレーされるとき、観察者は組み合わされて1つになったフレーム110であるフィールドを「見る」こととなる。各フィールド(シークエンスの最初と最後を除いて)は各連続した2フレームのコンポーネントであることが理解されよう。図3に示すように、フィールド102はフレーム110の第2フィールドとフレーム112の第1フィールドを形成する。同様に、フィールド103はフレーム112の第2フィールドとフレーム114の第1フィールドを形成する。人たる観察者により組み合わされる以外は、フレームは個々の信号要素としては実際に存在しないことがこれで理解されよう。
【0025】
本発明の方法はフレームのシークエンス、特にはビデオ像のシークエンスを使用する。本発明実施化には、フレームコンポーネントの脱インターレース(de−interlace)が必要である。脱インターレースとは、奇数列又は偶数列のラインだけではなく、像の各ラインのピクセル値を含む、特にコンピュータメモリーオンリーにおけるピクセル要素からなる実際のフレームを表す信号を構成することを意味している。本発明はまたインターレース技術を利用することなく記録されたデータに対しても適用が可能である。しかし、インターレースされる材料は共通なので、それを脱インターレースできることが重要である。
【0026】
本発明によれば、脱インターレースはデータ信号にメジアン(median)フィルターを適用することで達成される。例えば、時間tで脱インターレースされたフレームの7番目のスキャンラインを創出するには4個の値のメジアンが使用される。即ち、時間t−1におけるフィールドの7番ラインの各ピクセル要素に対する値と、時間t+1におけるフィールドの7番ラインの対応ピクセル要素に対する値と、時間tにおけるフィールドの6番ラインの対応ピクセル要素に対する値と、時間tにおけるフィールドの8番ラインの対応ピクセル要素に対する値である。これらの4個のメジアンは脱インターレースされたシークエンスのフレームの7番ラインにおける対応ピクセル要素に対する値として割り当てられる。
【0027】
同じプロセスがスキャンラインの各ピクセルと、そのフィールドの各奇数列のスキャンラインに対して繰り返される。偶数列のスキャンラインは単に時間tにおけるフィールドから採用される。この脱インターレースされたフレームはいかなるオリジナルシークエンスのフレームとも異なることを指摘する必要がある。なぜならば、奇数列スキャンラインを形成しているピクセル要素は前後のフィールドと時間tでのフィールドとの結合により創出されるからである。
【0028】
第2の脱インターレースされたフレームを創出するにはこのプロセスが繰り返されるが、偶数列のスキャンラインはフィールドt及びt+2からの偶数列スキャンラインのメジアンを使用することで形成され、奇数列のスキャンラインは関係するスキャンラインの上下に存在するフィールドt+1から形成される。奇数列のスキャンラインは時間t+1でのフィールドから直接的に採用される。
【0029】
フレームが脱インターレースされた後、一連のフレームが得られ、それらはそれぞれ偶数列と奇数列のスキャンラインの全必要数から構成されており、フィールドのシークエンスを観察している人たる観察者により感知される1フレーム内のものと同数のスキャンラインを有しているものとなる。
【0030】
他の脱インターレース方法もまた利用でき、本発明の思想の範囲内である。しかし、これら他の方法は前述の脱インターレース技術程には優れた結果を提供するとは考えられていない。その1つの方法は1フィールド内の各ペアのライン間において、データの新ラインを合成するために各フィールド内のスキャンライン間のリニアインタポレーション(linear interpolation)を行うことである。この技術は動きのない像の部分において明らかに空間的解像度(spatial resolution)のロスを導く。別の方法としては、そのときのフィールドの前後のフィールド間でインタポレーションを行うことである。この技術は動きのある像の部分の時間的解像度を犠牲にする。別々のフィールドに対してデータ操作を施し、1フィールドを次のフィールドにワープさせるためのアファイン変換を利用することも可能である。しかしながら、フィールドのアファイン変換はインターレースによる空間的時間エイリアシング(temporal aliasing) により脱インターレースされたフレームにアファイン変換を施すほどには良好な結果を提供しない。
【0031】
本発明の方法に使用されるフレームのシークエンスは、典型的にはズームシークエンスであり、これは長い焦点距離から短い焦点距離、又はその逆のズーミングを意味する。又、ズーミング中にパン(水平モーション)又はジブ(jib) (垂直モーション)することもできる。脱インターレースされた100のフレームのシークエンス200が図4において略図的に示されている。そのシークエンスは比較的短い焦点距離でワイドなアングルのフレーム201から比較的長い焦点距離でクローズアップのフレーム300までのズームにより構成されている。フレーム201において一連の文字が略図的に表されている。フレーム300においてはフレーム201の中央に位置しているアルファベット「X」の部分のみがフレームに含まれている。
【0032】
シークエンス200の各フレームは同数のピクセル要素及びスキャンラインから構成されている。従って、中央の文字Xのクロス部分がフレーム201のズームにおいて50のピクセルを使用しているものと仮定すれば、そのクロス部分はフレーム300でのズームにおいては300のピクセルを使用していることになる。1の典型的なズームは、シークエンスの最初から最後のフレームにかけて4:1以上のスケーリングファクター(scaling factor)をもたらす。フレーム300のズームからのクロス部分の映像化は明らかにフレーム201のズームからのクロス部分の映像化よりも多くの情報提供が可能となる。しかし、例えば他の文字のごとき当初のシーンの他の被写体を映像化するのに必要な情報はフレーム300からはまったく得られない。なぜなら、これらのものはフレーム300には存在しないからである。よって、本発明の1つの目的はシークエンスの別々のフレームから得られる情報を1つの組み合わせ像に形成することであり、そのシーンの大部分についての充分な情報を提供することである。
【0033】
個々のフレームとオリジナルシーンの間の関係は図5にて略図的に示されている。フレーム201は全オリジナルシーンを映し出している。フレーム202は領域202s内部に見合うだけのオリジナルシーンのみを映像化しており、それはフレーム201よりも小さいものである。フレーム203は領域203sに見合うだけのオリジナルシーンのみを映像化しており、このように順番に領域300sまで続く。従って、オリジナルシーンはズーム201によりマッピング(mapping)された全シーンのデータスペースと同一サイズであるデータスペース内に徐々により小さな部分へとマッピングされてゆく。(このデータスペースは「小」データスペースという。本方法に関する他のデータスペースと比べて最小だからである。)
【0034】
本発明の目的は各ズームフレームから得られるだけの出来るかぎり多量の情報を利用することである。各ズームフレームは拡大され、最長の焦点距離のフレーム、即ちフレーム299と同じスケールを有することとなる。図6において略図的に示されているように、拡大されたフレームは相互に積み重ねられる。オリジナルフレーム201はオリジナルサイズの何倍にも拡大される。各連続するフレーム202、203・・・等は徐々に多少とも少なめに拡大され、最終フレーム299はまったく拡大されない。各フレームの像が他の全フレームシーンの同一部分と実質的にぴったりと重なるように重ね合わせることは可能である。もし各フレームの像部分が不鮮明であれば、シーンの見える部分(フレーム299の全部及び他の全フレームの輪郭部)は最も高い解像度を有するフレームから構成される。
【0035】
各フレームのスケールアップは、各フレームを代表するデータ信号の変換操作と、その変換データを一連のデータスペースにマッピングする操作とを経て、究極的に最終データスペースにマッピングされたデータを代表する信号を発生させる操作により達成される。この最終データスペースは、前記小データスペースよりもずっと大きく、よって大データスペースと呼ばれる。(実際各フレームは全大スペース内に構成されており、最大に拡大されたフレーム201と同じデータスペースを占めている。しかし、フレーム201を除く全フレームに対しては、フレームの輪郭部はゼロの値を有するピクセルにより形成されている。)
【0036】
各拡張フレームの解像度はもちろん互いに異なっており、ある部分、例えば、フレーム201からの中央文字Xにおいて得られる情報の詳細はフレーム203又は299から得られるシーンの同じ部分における情報の詳細よりもずっと少ないであろう。言い換えるならば、フレーム201の拡大像はピクセル間の情報ギャップの影響を受ける。フレーム300からの像はこれらの情報ギャップの影響をまったく受けない。この情報ギャップは以下に説明するごとく、データを取得可能なピクセル間のインタポレーションにより満たされる。
【0037】
上記したように、もしフレームが同じサイズにスケールされ、各々のデータが他のデータに重ねられると、それらは良く重なり合うが、実質的に重なり合っているのみであり、必ずしも厳密な意味で重なり合っているわけではない。これはカメラのモーションやシーンの要素のモーションのためである。比較的高い解像度の静止画像を創出するためにフレームのシークエンスを利用する過程でこれらのモーションを考慮に入れることも重要である。
【0038】
本発明の方法を以下、詳細に説明する。前記スキームを特定の手段にて活用するには、本発明の方法は、まず各フレームを同じディメンション(大データスペース)のデータスペースにマッピング(map) 又は「ワーピング」する必要がある。そのワーピング後にシークエンスの個々のフレームに対して、ウエイトを与えられた、すなわち、重み付けされた( weighted )時間メジアン操作を施し、その操作を施されたフレームを結合して合成画を作成する。
【0039】
各フレームを大データスペースにマッピング又はワーピングするには、ズームのフレームシリーズが実質的に一定な焦点距離のフレームのシリーズとしてモデル化(modelled)され、1又は2の動いている被写体を記録する。その状況は相互的(reciprocal)なものである。記録装置の焦点距離を変化するものとして処理するかわりに、シーン全体が固定焦点距離レンズの記録装置に近づくか、又は遠ざかるものとして処理しても同じことである。
【0040】
以下の説明において本発明方法の基本的ステップを紹介する。基本ステップを最初に紹介するのは説明を目的としたものであって、決して本発明方法のステップ順を示しているのではない。そのステップの順は基本的概念を紹介した後で説明する。
【0041】
本発明の基本的ステップはカメラのズームモーションをリカバー(recover) するためのものである。本発明の方法は、水平方向、鉛直方向及びスケール方向(水平/鉛直平面に垂直)における像の速度成分としてのカメラズームに影響を受ける連続的フレーム間の変化をモデル化するものである。そのような像ポーションに対するフレーム間の速度はこれらの3方向各々について決定される。その結果どのフレームのいかなるピクセル値も、多重速度(連続的多重フレームのペアを表しているもの)をオリジナル像ポーション(部分)を表しているデータに適用することで異なる焦点距離の1フレーム内の対応位置にワーピング可能である。これに関連する技術は1990年4月に発表されたニュージャージー州プリンストンにあるデイビッド サーノフ リサーチセンター(David Sarnoff Research Center)のバーゲン ジェイ(Bergen,J.)、バート ピー(Burt,P.)、 ヒンゴラニ アール(Hingorani,R.)及びペレグ エス(Peleg,S.)らによる表題『3フレームからの2モーション計算』にて開示されている。以下の基本的説明の多くは実質的には前記バーゲン他の論文から借用したものである。
【0042】
ある像領域のモーションに対する単純で閉じた系での形態予想法は前記バーゲン他により導き出されたものである。まず、像の部分的な小移動は、像シークエンスであるフレームI(x,y,t−1)及びI(x,y,t)間で生じると考えることができる。このI(x,y,t)は、時間tにおけるx(水平)及びy(鉛直)方向に延びている観察像であり、例えば、フレーム299にて示されている。I(x,y,t−1)は時間t−1における観察像であり、例えば、フレーム298である。いかなるときにもP(x,y)として表されるxとyのパターンはすべてのピクセルの速度フィールドである速度p(x,y)で移動しており、x方向とy方向双方のモーション成分を有している。モーションフィールドp(x,y)はxとyにおける変位による以下で表される。
p(x,y)=(px(x,y),py(x,y)) (1)
このpx(x,y)はx方向(xとyの関数)の変位であり、py(x,y)はy方向(xとyの関数)の変位である。よって、以下の式が導かれる。
I(x,y,t)=P(x−tpx,y−tpy) (2)
I(x,y,t)=I(x−px,y−py,t−1) (3)
【0043】
前記フレームのインターバルを時間の1ユニットとすることで表記を単純化することができる。最小平方誤差(least squared error)技法に従い、測定値とフィールドpを使用した計算値との間の平方誤差を最小とするモーションフィールドp=(px,py)を求めるのが有益である。
【0044】
【数1】
1フレームから次のフレームまでの偏差が小さいと仮定すれば、等式(4)はI(x,y,t)の省略テーラーシリーズエクスパンション(truncated Taylor series expansion)により単純化することが可能である。
【0045】
【数2】
ここにおいて、
【数3】
であり、従って、
【数4】
となる。
【0046】
像モーションは速度成分の各パラメータ(parameter)に関して等式(6)の導関数(derivatives) をゼロにセットし(誤差は導関数がゼロのときに最小だからである)、得られる等式システムを解くことで得られる。
もし、像ポーションのモーションが単純移動(simple translation) によりモデル化されるなら、p=(ax,ay)となり、このax及びayはピクセルのユニットにおいて定数となり、光学的フロー(flow)等式は以下のようになる。
【0047】
【数5】
【0048】
本発明方法の特徴的な適用ケースにおいては、モーションは単純移動によってはモデル化できないことが理解されよう。なぜなら、単純移動は焦点レンズのズームのようにスケール変化のリカバリー又はモデル化を行わないからである。その代わりに、像のモーションは、アファイン変換(即ち直線を直線に、平行線を平行線に変換するが、ポイント間の距離と、ライン間のアングルを変化させる可能性のある変換)としてさらに典型的に正確にモデル化される。この場合、モーションフィールドpは6個のパラメータであるax,bx,cx,ay,by及びcyを有しており、それらは次のように適用される。
【0049】
【数6】
【0050】
ここで、ax及びayは上記のごとくであり、bx はx方向のxのパーセンテージスケールファクターであり、cx はxのパーセンテージローテーションファクターであり、y位置に関係する(depending on)ものである。by はyのパーセンテージローテーションファクターであり、x位置に関係し、cy はyのパーセンテージスケーリングファクターである。ズームにおける1フレームから次のフレームへのax とay の通常のレンジは、数個のピクセル程度である。残余ファクターの普通のレンジは0.001から0.1程度である。もし、等式(6)の誤差がこれらの6個のパラメータの各々に関して微分(differentiated)されると、6個の未知数ax,bx,cx,ay,by及びcyを持つ6個の等式システムが得られる。即ち、
【0051】
【数7】
である。
【0052】
このシステムは係数ax,bx,cx,ay,by及びcyについて解かれなければならない。解を得ることは可能である。なぜなら、Ix,Iy,及びIt、即ち、x、y及びtに関する像の部分的導関数は時間t及び時間t+1の像値から決定可能だからである。It は時間t+1のピクセル値を時間tにおける対応ピクセル値から差し引くことで決定される。Ix は時間tのピクセル値と時間t+1の対応ピクセル値を加えて、xにおける導関数フィルター(filter)を介してその合計をラン(run)させることで決定される。Iyはその得られた合計をyの導関数フィルターを介してランさせることで決定される。これらの3個の値が像内のすべてのピクセルに対して決定されたならば、等式(10)のシステムは、係数ax,bx,cx,ay,by及びcyについて解かれる。これらの係数を知れば、1つのフレームから次のフレームまでの像の特殊なアスペクト(aspect)を代表する与えられたピクセル値の位置の変化を決定することが可能となる。
【0053】
従って、フレーム201のピクセル値の位置を決定するために、像のポーションをワープされていないフレーム202の像の対応ポーションと合致させるためにフレーム201が1ステップ分だけワーピングされた後に、等式9xと9yの変換がフレーム201の各ピクセル値に適用される。図7に示すように、ポイント(x,y)、ピクセル位置(20、30)の像ポーションを考慮されたい。(図7はスケールするためものではない。)図7においてオリジナル位置におけるフレーム201は、符号201にて表される。フレーム202のスケールにワーピングされた後、フレーム201は2012 として表される。フレーム203のスケールにワーピングされた後には2013 として表され、この要領でフレーム20199まで続行する。スケールの増加率10%(1フレームから次のフレームに対するものとしては大きい率)と5個のピクセルの右側へのパンに対しては、フレーム201とフレーム202間の典型的な係数は以下の値を有している。
【0054】
【数8】
フレーム201のピクセル(20、30)での値のx方向におけるフレーム201からフレーム2012 へのずれは、5+(.1×20)+(0×30)=7となる。その値はxの正の方向に7ピクセル分移動させ、x位置27にくることを意味する。y方向のずれは、0+(0×20)+(.1×30)=3となり、yの方向に3ピクセル分移動してy位置33にくることを意味する。これは図7にて略図的に示されており、フレーム201のピクセル位置(x,y)からフレーム2012 の別位置(その像の同一箇所)へ向かう曲矢印Aである。
【0055】
同様に、同じピクセル値をフレーム2013 にて占める位置にワーピングするには、フレーム202と203との間で6つの等式(10)のセットを解くことで得られる係数ax,bx,cx,ay,byとcyを使用してフレーム2012 のピクセル座標(coordinates)に変換等式(9x)と(9y)を適用することが必要である。それらの係数は、フレーム201とフレーム202との間で得られたものとは異なるかもしれない。
【0056】
その変換等式は1次式(linear)であり、よってリバース可能(reversible)である。フレーム201のスケールからフレーム202のスケールへの変換には係数ax,bx,cx,ay,by及びcyが使用される。フレーム202のスケールからフレーム201のスケールに変換するには、これらの係数の1次逆元(linear inverse)が使用される。
【0057】
以上説明したように、フレーム201のポイント(x,y)からのピクセル値はフレーム2012 の新位置にワーピングされる。ポイント(x+1,y)からのピクセル値もフレーム2012 の新位置にワーピングされるが、その位置は典型的にはピクセル(x,y)の値に対応するワーピング位置に隣接することはない。もしこれ以上何の操作もしなければ、フレーム2012 のこれら2ポイント間のスペースはブランク又は値なしの状態となる。このスペースに情報を入力するには何らかのインタポレーションが必要となる。1次及び双1次(bilinear)インタポレーションを含む種々な技法が可能である。双1次インタポレーションは効果的に使用されている。
【0058】
バーゲン、バート他により説明されているように、前記のモーション予想法はズームシークエンスの1フレームから次のフレームまでの像のずれが少ない(1ピクセル以下)前記の省略テーラーシリーズ近似法が適しているの時のみにおいて正確である。図8において略図的に示されている多重解析(ピラミッド)構造(multiresolution structure) を使用することでさらに良い結果が得られ、その技法はより一般的な大きな移動の場合にも適用可能である。
【0059】
アファイン変換パラメータax,bx,cx,ay,byとcyを決定する過程においてガウスのピラミッド(pyramid) Gは、例えばフレーム201と202である像フレームペアの各フレームに対して構築される。シークエンスの各メンバーに対して、その解析及びそのサンプルデンシティ(density )が平方根で減じられている(reduced by a power of 2) オリジナル像の修正コピーのシークエンスによりそのピラミッドは形成される。シークエンス200のフレームの1つがガウスピラミッドシークエンスのベースレベルを形成していることを除けば、例えばG201,0、G201,1、G201,2 、G201,I 等のガウスピラミッドシークエンスのメンバーはシークエンス200のメンバーとは全く異なっていることが特記されなければならない。
【0060】
レゾリューション(resolution)を減少させるために、データはローパスフィルターを通過させられる。このローパスフィルターを通過させることで像の小さな又は素早い移動に関連したデータを排除する。従って、大きなモーションはレゾリューションが最も大きく減少したレベルにて検知される。ローパスフィルターがデータ内の偏差の大部分を排除しているので、存在する全ピクセルに対する計算をする必要性はなくなる。よって、操作対象のピクセル数を減少させるために2程度のサブサンプリング(sub−sampling)が適用される。このサブサンプリングは計算の能率を高め、操作のスピード向上に寄与する。サブサンプリングの特徴的なパターンは隔行及び隔列を無視することである。
【0061】
ピラミッドの各レベルIは、ローパスフィルターの効果を発揮させるために小核(kernel)フィルターωで先行するレベルのデータを収束させることで取得され、続いてサブサンプリングを行う。Gt,l=[Gt,l−1 * ω]↓2 ここでのGt,l は像I(x,y,t)に対するIthのピラミッドレベルである。上記↓2 は、括弧内の量がxとyに対して2でサブサンプルされていることを示している。例えば、G201,1を得るにはG201,0をフィルターωで収束し、その結果をサブサンプリングする。
【0062】
変換の分析は像ピラミッドの低レゾリューションレベル、例えばレベル3にて開始される。480スキャンラインと640ピクセルにより定義されるオリジナル像に対しては、典型的にはレベル3の分析は良好な結果をもたらす。レベルIのサンプル距離はオリジナル像のサンプル距離の2I 倍である。従って、この関係で大きくなる像速度が予想可能となる。追跡手順の各連続的反復にて、分析は次の段階のレゾリューションピラミッドレベルへと移動してオリジナルに近づいて行く。
【0063】
従って、アファイン変換パラメータの決定は、例えばレベル2にて開始する。まず、ピラミッドG201 とピラミッドG202 の間でax、bx、cx、ay、by 及びcy に対する等式(10)を解く必要がある。これは2ステップで行われる。まず、アファイン変換p2のシード(seed)セットが選択される。このシードは全部ゼロであっても、ズームによるスケーリングファクター若しくは知られたパン又はジブによるトランスレーションのような変換の知られているアスペクトに近似して選択されたものであっても構わない。これらのアファイン変換はレベル2でのワーピングされた像を得るためにW2においてG201,2に適用される。これは図8において歪んだ方形G201,2wにより図示されている。たいていの場合には、このワーピングは次の時間インターバルt+1、即ちG202,2でのガウスメンバーを正確には提供しないであろう。よって、第2のステップでは調整用アファインパラメータΔp2 のセットが像の値G202,2とG201,2w 間で予想される。これらは前述で解説されたごとくに予想されるものである。
【0064】
まず、ローパスフィルタリング及びサブサンプリングを介さずにフレームに対して上記したようにIx、Iy及びItを解くことが必要である。Ix、Iy及びItは、さらに小さくローパスフィルタリングされたデータのサブサンプルセットが使用されることを除けば、同様に計算される。フレーム202からフレーム201に対する値を引く代わりに、ワーピングされたピラミッドフレームG201,2wからの値がピラミッドフレームG202,2に対する値から引かれる。このようにして、レベル2の部分的導関数(partial derivative)が決定され、その後にこのレベル用の調整用アファインパラメータax、bx、cx、ay、by及びcyが決定可能となる。調整用アファインパラメータは図8においてΔp2 として集合的(collectively)に示されている。
【0065】
調整用アファインパラメータのセットは、ガウスシークエンスピラミッド201における先行するレベルからのアファインパラメータp2 と結合されてレベル1、即ちp1 用のアファインパラメータを形成する。この結合は単純な加算ではない。例えば、新axタームは時間tにおけるaxターム(ピラミッドG202) や時間t−1におけるax ターム(ピラミッドG201) 及びx方向における他の変化に基づくものである。以下の式はこの関係を説明している。
【0066】
【数9】
【0067】
このプロセスは繰り返されるが、今回はレベル1であり、フレーム201及び202に対する操作過程でアファイン変換パラメータax、bx、cx、ay、by 及びcy がオリジナルレベルにて取得されるまで全レベルを通して実施される。アファインパラメータは最も正確なところで収束(converge) するので、ΔpIタームはゼロとなる傾向にある。
【0068】
従って、いかなるフレームのスケールからの1フレーム(例えば、フレーム226から次のフレーム227のスケール)を変換するワーピングファクターを決定するには、前述の操作が実施される。よって、フレームスケールの各ペアに対して、アファイン変換パラメータax、bx、cx、ay、by及びcyのセットが計算される。その後、1フレーム、例えばフレーム251を適当なサイズに変換するには、まずフレーム251と252に対する先行する分析により決定されたアファイン変換パラメータax、bx、cx、ay、by及びcyを使用してフレーム252のスケールに変換される。次に、その変換されたフレーム2512 はフレーム252と253に対する先行する分析により決定されたアファイン変換パラメータax、bx、cx、ay、by及びcyを使用してフレーム253のスケールに変換される。このプロセスは繰り返され、フレーム300のスケールにて大データスペースにそのフレームが変換されてしまうまで継続される。
【0069】
前記の方法は、もしカメラ又は被写体(どちらでもよい)間の相対的モーションがほとんど存在しないか又はまったく存在しないならば良好に作用し、唯一の像変化はズーミングによるものとなる。しかしながら、実際上はそのようなモーションを排除できることが望ましい。いくつかの方法が考えられる。基本的ではあるが効果的な方法は全フレームを視覚的に検査することであり、視域を横切る人のように大きなモーションを特定することである。モーションが各フレームにおいて生じる領域をカバーするためにマスクが利用可能であり、この領域は変換時には無視することができる。最終的なピクチャーのマスク位置を設定するのに望ましいピクセル値をオペレータは手動にて選択する。
【0070】
別の方法は図9にて略図的に示すように、2つのモーションを追跡するバーゲンとバート他により解説されている技法を利用することである。データはモーションのペアに照らし合わせて評価される。ここでの像I(x,y,t)はそれぞれ独立したモーションpとqを有する異なる像パターンP及びQの組み合わせとしてモデル化される。I、P及びQ間の関係は以下のごとくである。
【0071】
【数10】
上記等式中の○と+を重ねた記号は、以下において便宜上(+)と表記する。
【0072】
ここでは、オペレータ(+)は、加算又は掛け算のごとき2モーションを結合させるためのオペレーションを表し、Ptpは時間tを通じてモーションpにより変換されたパターンPを表しており、バーゲン及びバート他は、もしモーション成分の1つ、及び結合ルール(+)が知られていれば、パターンP及びQの性質について予想をたてることなく、前述の1成分モーション技法を活用して他のモーションを計算することが可能であることを示している。もし、モーションpが知られていれば、モーションqのみを決定すればよく、その逆のこともある。速度pで移動しているパターンPの成分は各像フレームをpによりシフトし、そのシフトしたフレーム値を次のフレームから差し引くことにより像シークエンスから排除することが可能である。得られる差(difference)シークエンスは速度qにて移動しているパターンのみを含んでいる。
【0073】
特殊な場合には、結合オペレーション(+)は加算である。シークエンス200の3フレームI(1)、I(2)及びI(3)の場合について考えてみよう。変数D1及びD2をそれぞれそれらのフレーム間で発生した差フレームに当てはめてみよう。等式11は以下のようになる。
【0074】
【数11】
【0075】
これは1ステップにてパターンPを変換するための302におけるI(1)のワープとして図9において略図的に示されている。この次の段階はパターンPのモーションの影響を取り除くための304におけるI(2)の減算である。その結果得られるものはD1、即ち差(difference) シークエンスの1要素である。D2 はパターンPのモーションにより306でワーピングされたI(3)とI(2)間の308における差により同様に形成される。
【0076】
変更シークエンスは1モーションqで移動する新パターンQq−Qp から構成されることになる。
【数12】
【0077】
従って、モーションqは前述の1モーション予想技法を活用して2つの差(difference images) 像D1とD2を間で計算可能となる。このことが図9にて310で略図的に示されている。同様に、モーションpはqが知られているときにリカバー可能となる。観察された像I(x,y,t)はqによりシフトされ、新しい差シークエンスが形成される。
【0078】
【数13】
このシークエンスは速度pにて移動しているパターンPp−Pq である。
【数14】
よって、pは1モーション予想技法を活用してリカバー可能となる。
【0079】
このシフト及び減法手順はパターンに関わりなく、又はパターンを決定することなく像シークエンスから1つの移動パターンを取り去る。実際上はpもqも最初は知られていない。しかしながら、最初に非常におおまかな予想値を選択したとしても、それらの両方ともが前記の技法を反復することによりリカバー可能である。この反復手順は1モーション技法を反復的に適用する。モーションpを定義するパラメータのおおまかな予想値で始めても、qの予想値は取り出され、312にてワーピングステップの302と306にリターンされる。予想値qから改善予想値pが取り出され、312にてワーピングステップ302と306にリターンされる。この手順を繰り返す。この手順にて正確な予想値に素早く収束する。本当の像シークエンスを使用して、3から12サイクル後には要求を満たす変換が可能になる。
【0080】
本発明のこの部分のステップを要約すると以下のごとくとなる。
1。パターンPのモーションp0に対する(ついて)初期予想値を決定する。
2。最新のpn予想値を使用して等式(12)における差像(difference images)D1及びD2を形成する。
3。1(シングル)モーションエスチメータをD1とD2に適用してqn+1 の予想値を得る。
4。予想値qn+1を使用して新差像D1及びD2を形成する。
5。1(シングル)モーションエスチメータを新しいD1とD2に適用して新pn+2を取得する。
6。ステップ2から手順を繰り返す。
【0081】
この2モーション技法に従って取り出された2セットのアファインパラメータを観察することで、移動シーン又はカメラモーションを特定することが可能となる。一般的に、ズームワーピングのみに関係するパラメータは1フレームから次のフレームにスムーズに、またほんの少々変化するだけである。像モーション又はカメラモーションに関係するパラメータはズームによるものとは異なる変化を示す。これらの相違する変化は検査により観察可能である。
【0082】
1フレームペアから次のフレームペアまでのアファインパラメータを自動的に比較し、その変化が予め設定したレベルを越えるときには遮光装置を機能させる(triggering a flag) ことでシーン又はカメラのモーションの特定を自動化することは理論的には可能である。1つの可能性を有する技法はフレームの2ペアのアファインパラメータ間の差を設定した数の先行フレームペアの標準偏差(standard deviation)と比較することである。例えば、70のフレームのシークエンスに対しては、少なくとも10のフレームペアの標準偏差を決定することが一般的である。
【0083】
もし、カメラとシーン内の要素の両方ともが移動しているとき、2個以上のモーションが存在し、カメラモーションを排除するためのさらに一段上の方法が便利である。前述したアファインの2モーション予想法とマスキング技法を組み合わせると便利な結果をもたらすことが発見されている。像内のずれベクトルの確率デンシティ関数を決定することもまた便利であろう。一般的な理解には、1990年6月にアメリカ合衆国マサチューセッツ州ケープコッドにて開催されたアメリカ光学学会の『機械理解及び機械視覚総会』の議事録内にあるギロッド ビー(Girod,B.)とクオ デー(Kuo,D.)による「ずれヒストグラムの直接的予想法(Direct Estimation of Displacement Histograms)」を参照するのがよい。ここにはフレーム間で移動する異なる被写体の数と、それらに対応するずれベクトルがどのようなものであるのかについての情報が掲載されている。ローカルブロックマッチングエスチメータ(local block matching estimator)がそれらの移動被写体を空間的に位置取りさせるのに使用されている。移動被写体の領域は計算によりマスク処理が施され、その後にアファイン予想値が計算される。
【0084】
フレームペア間のずれが小さいものであって、突き当たったり、焦点距離の急激な変動のごとき予期しないカメラ移動がまったく存在しないと仮定すれば、アファインパラメータはフレームペア間ではあまり異なるものではない。前述のごとくにパラメータが決定された後、その係数は見せ掛けの値を取り除くために簡略化される。
シークエンス200の各フレームからのYチャンネルデータがワーピングされれば、決定されたアファインパラメータはフルカラー映写の変換を提供するために、例えば位相及び求積法(phase and quadrature)で他のチャンネルに適用される。
【0085】
ワーピングされた短焦点距離フレーム201のフルラスタ(full raster) が満たされた後、1フレームから次のフレームまでのアパーチャ設定の変分のごときトーンに影響を及ぼす変化を補うためにトーンスケール補正を実施することができる。中央の像から始めて、2つの像が隣接する箇所周辺で光度のサンプルが採られる。データにスプライン(spline)がフィットされ、大きい方の像(低めの解像度)のピクセルが小さい方の像のピクセルに変更される。その後にこの補正像のトーンスケールは次の大きさのワーピングされた像との比較に用いられ、最大の像までこの手順が繰り返される。
【0086】
シークエンス200の各フレームからのフルカラーデータが同じデータスペースにワーピングされたら、各ピクセルに対する1フレームからのデータは他の全フレームのデータと組み合わせる必要がある。いくつかの技法が可能である。最も基本的な技法は最高の解像度を有するフレームから最終合成ピクチャー用のピクセル値を選択することである。図6において示されているように、フレーム299がワーピングされたものであるフレーム299wが一般的にその合成ピクチャーの中央部を占め、このフレームはその像の中央部に関して最も高い解像度となるであろう。フレーム298からの情報は中央部の環状方形部位を占め、この情報はこの部分に可能な最高の解像度となる。フレーム297からの情報はフレーム298wの環状領域周辺の多少大きな軸の環状方形部位を占め、このようにして第1フレーム201wの環状周囲がワーピングされた像(figure)の最も外部を占めるまで続けられる。
【0087】
上記手順にて好ましい結果が得られるが、明瞭なエッジ部が現れ種々のフレームから発生した領域間の境界線を際立たせる。この理由によりあるピクセルに対してシークエンスのワーピングされた全フレームにウエイト関数(weighting function)が適用されそのピクセルの値としてウエイト値のメジアンがとられる。図10に示すようにピクセルの位置はベクトルVにより示され、像の同一位置にワーピングされた全フレーム、即ち201wから299wまでを突き抜ける。前記ウエイトファンクションはベクトルVに沿ってその像値(image values)に適用される。典型的なウエイト関数は図11のグラフにて示されている。図から分かるように、そのウエイト関数は上向きに凹形状であり、クロースインズームショット(close in zoom shot)からのピクセル値は最大のウエイト、おそらく100%が付与される。望む効果に応じて種々のウエイト関数が適用可能となる。一般的には低い方の解像度を有するフレームよりも高い解像度を有するフレームに対してさらにヘビーなウエイトが付与される。
【0088】
多少不自然ではあるが低い方の解像度を有するフレームのシークエンスから、高い解像度を有する1静止画像を得る方法のブロック作成について述べてきた。図13には、実質的に好ましい順序でその方法のステップが示されている。ビデオフィールドのシークエンスは402にてとられる。フィールドは一連のフレームを作成するために404で脱インターレースされる。このポイントで交互的パス(alternate path) が取得可能となる。被写体又はカメラモーションは、406にてズームモーションから分離することができ、その後にアファイン変換係数ax、bx、cx、ay、by及びcyを発生させるために光学系フロー分析がなされる。404においてステップ408に分岐(branch)することが可能であり、それにより光学系フロー分析と、被写体又はズームモーションからのカメラモーション分離とを結合させる。この分岐は、また係数ax、bx、cx、ay、by 及びcy を生じさせる。次に412においてそのアファイン変換が各フレームに対して必要な回数だけ適用され、各フレームに対して高い解像度ラスタ(raster)での対応フレームが創出される。図11に示す時間メジアンフィルターは、414にて全フレームに適用され、最終合成は416にて高解像度ラスタでの各ピクセル位置で時間メジアンフィルターによりフィルターされているワーピングされた各フレーム201w、202w等に対するそのピクセルでの値を加算することで形成される。
【0089】
本発明装置の好適実施例は図14において略図的に示されている。シーンから反射した光、又はシーンにより伝達される光を採り入れてビデオカメラ等の入力装置500はシーン502に適用される。その光は前記入力装置又は標準コンバーター504により電気信号に変換される。コンバーター504又は入力装置500から、データはメモリー装置506又はデータプロセスユニット508を通過する。メモリー装置506はフィールド(field) によって、またさらにデータが変換されるどのような他の形状(configurations)にも従ってデータを記録することができる。前記データプロセスユニットは、典型的には適正にプログラムされた汎用デジタルコンピュータである。オペレータはコンピュータキーボード等の入力装置510を介してデータプロセスユニット508にコマンドを発する。これらのコマンドは前述の本発明方法のステップを行使するようにコンピュータに対して指示する。指示の内容は、例えば、そのフィールドの脱インターレーシング、差シークエンス(difference sequences)を創出することによる2又はそれ以上の移動被写体の特定、アファイン変換係数の計算、全フレームを望むデータスペースにワーピングすること、ウエイトされた時間メジアンフィルターに従いワーピングされたフレームからのデータを結合させ合成ピクチャー映像に導く、等々である。各ステップでの変換されたデータはメモリ装置506に記録可能であり、プリンター、ビデオディスプレー装置又は他の適当な出力装置等の一般的な出力装置512に出力可能である。さらに、データは追加的操作を施したり、蓄積又はディスプレーを行うために遠隔地(remote location) に伝達することもできる。
【0090】
尚、比較的低解像度でワイドアングルを有するショットにおいては、多くの箇所は不鮮明である。一方、本発明の方法に従って作成された合成ピクチャーの中央部は鮮明で焦点がぴったりと合っており、詳細までくまなく示している。
【0091】
以上の解説は本発明の説明を目的としたものであり、発明の限定を意図したものではない。ビデオ以外においても、静止画像のシークエンスを利用するいかなる記録技術でも使用可能である。もしその記録技術がピクセル値を発生しないならば、その記録装置により発生されたデータは周知である本分野技術の方法に従いピクセル又は等価なデータスペースにコンバートすることが可能であり、また有効である。ここに紹介した技法に加え、ズームモーションからのカメラモーション又はシーン内のモーションを分離するための種々な技法が適用可能である。さらに、アファイン変換係数を計算するのにガウスピラミッドのステップを利用する必要もない。その計算はそのフル(full)高解像度フレームに対して施されるもののごとき他の方法によっても可能である。
【0092】
本発明の方法はズームからの1静止画像の場合以外に一連のパンショット及びジブショットからの1パノラマ静止画像を創出する場合にも利用可能である。そのような場合には、全フレームは全パノラマシーンと同じスペースを有するデータスペースにワーピングされることになる。互いに重なり合った焦点距離の異なるピクチャーの山とはならないであろう。むしろ、エッジ部がオーバーラップした一連のピクチャーとなるであろう。ズームシークエンスに適用された実施例においては、ワーピングの主要な要素は各フレームからのデータを拡大してシーンの像を互いに整合させることである。シーンの全像が互いにアラインするようにデータをワーピングすることはまたズーム系適用の1重要面である。この特徴により、例えばカメラモーション又は被写体のモーションによるモーションを取り去ることができる。
【0093】
パノラマ系適用においては、この拡大する特徴は重要ではなく、たいていの場合には使用されもしない。しかしながら、そのアライメントの観点からは大変重要であり、パノラマシーンの全域的視域が連続的データスペースとして表されているならば、各フレームはその全域的視域の限られた部分を取り上げることになる。ズーム系適用の場合とは異なり、パノラマ系適用における各フレームは同じ焦点距離で創出される。各フレームの像が別のフィールドの同一像と合致するように、全域的データスペースでのフレームからのデータをアラインするために本発明の方法を使用するこが必要である。本発明の方法は、主にショット間のつなぎ目に適用される。もしパンのスピードがフレーム周波数に比べてゆっくりならば、つなぎ目におけるフレーム間のオーバーラップは非常に大きくなる。
【0094】
パノラマシーンの特定部分でさらに鮮明な画像を得るためにズーム処理をパノラマ処理と結合させることは本発明の思想内である。
本発明の技術を被写体とビデオの非連続的なセグメントからのフレームと結合させるために使用することも可能である。
【0095】
本発明はビデオカメラにより得られたデータの範囲にて記述されてきたが、本分野の通常の技術者であれば、本発明の方法は、いかにして得られたものであろうともデジタル像を表すデータにも使用可能であることが理解されるであろう。例えば、異なる焦点距離で撮影された一連のスチール写真は前述した方法により組み合わせて特定の部分の像を補強した1像を形成することができる。同様に、パノラマスペース内で種々な位置を描写している一組みのスチール写真を本発明の技法に従って組み合わせ、1枚のパノラマ像を作成することができる。この中ではその種々な像部分はリカバーすることが可能であり、共通な焦点距離であるが異なる視域を有する1組みのばらばらとなった静止画像内にはパノラマ像の元の人工的要素はほとんど示されていない。
【0096】
本発明は「特許請求の範囲」により特定された全実施例を含む明細書中の記載に照らし合わせて考慮されるべきものであり、さらに合理的範囲内でのそれらの等価形態をも併せて考慮されるべきである。
【0097】
【発明の効果】
以上詳述したように、本発明は、以下の利点を備えた比較的に高解像度を有する静止画像を創作する方法及び装置を提供することができる。
1)像全体にわたり高解像度で情報を取得する必要がない。
2)あまり重要ではない像の大部分に関して情報を収集する必要がない。
3)種々な焦点距離又は視域の標準的ビデオ像のシークエンスを入力要素として取得できる。
4)標準的フィルム像のシークエンスを入力要素として取得できる。
5)望む像のいかなる部分でもその解像度を増強する。
6)適正にプログラムされた汎用デジタルコンピュータ及び標準型ビデオ又は映画装置が使用可能である。
【0098】
さらに、本発明によれば、過剰なデータ保存及びアクセス能力を要せず、あるシーンのパノラマビューを観察者に提供し、その観察者にそのシーンの1位置から他の位置までのナビゲーションを可能とする方法を提供することができる。
又、デジタル化されたいかなる形態の像データであろうとも前記能力を発揮させることができるという優れた効果を奏する。
【図面の簡単な説明】
【図1】撮像装置の焦点距離と撮影されたシーン部分との関係を略図的に示す図である。
【図2】ビデオフィールドとビデオフレームのペアの概略を示す図である。
【図3】組み合わされてビデオフレームを構成する典型的なビデオフィールドのペアのインターレーシング(interlacing)を示す図である。
【図4】実質的に同じシーンのビデオフレームのシークエンスを略図的に示したものであり、短い焦点距離から比較的長い焦点距離にズームインした状態を表す図である。
【図5】最も短い焦点距離(ワイドアングルな視域)のビデオフレーム内シーンの部分の概略を示す図であり、徐々に長くなる焦点距離のフレームのシークエンスの残りメンバー内に供給されている。
【図6】図4において示すシークエンスの各ビデオ像(図6の左側に示されている)の同一サイズデータスペースにマップ(map)又はワープ(warp)した状態の概略を示す図であり、そのサイズは拡大されたサイズの最も低い解像度フレームである。
【図7】元は比較的短い焦点距離で記録された1フレームをそのシーンの連続的拡大関与するデータスペースにワープしている状態の概略を示す図である。
【図8】シークエンスにおける複数のフレーム間の荒いモーション及び繊細なモーション両方を特定する方法の概略を示す図である。
【図9】フレームのシークエンスにおける2つの移動する被写体のモーションを特定する方法の概略を示す図である。
【図10】同一データスペース内にワープされた後のシークエンスの各フレームの概略を示す図であり、最終的映像化に再構築されるようにアラインされている状態を表し、各フレームの共通ポイントを通るベクトルが示されている。
【図11】最終的な像を構築するのに使用されるウエイト因子(weighting factor)とそのウエイト因子が適用されているワープされたフレームの元の焦点距離との間の関係を示すグラフ図である。
【図12】最終的な再構築像とその構築要素の概略を示す図である。
【図13】本発明の方法の好適実施例を説明するフローチャート図である。
【図14】本発明の装置の好適実施例の概略を示す図である。
【符号の説明】
2 像
4 焦平面
6 中央部
Claims (14)
- あるシーンの静止画像を発生させる方法であって、以下記載のステップから成り立っていることを特徴とする静止画像発生方法:
a。互いに異なる焦点距離にて創出されている複数の像を得るステップ
b。前記各像に対してその像を表す信号を発生させるステップ
c。共通の焦点距離にスケールされたそれぞれ対応する像を表すように前記各信号を変換するステップ
d。前記スケールされた各像が1つの画像に組み合わせられるように、前記変換された各信号を結合するステップ。 - 前記各信号の変換ステップは以下のステップから成り立っていることを特徴とする請求項1記載の静止画像発生方法:
a。前記各像を表す信号に少なくとも1のアファイン変換を施すステップ
b。前記変換された複数の像をそれぞれ表す信号を発生させるステップ。 - 前記少なくとも1のアファイン変換を施すステップは、解像度が減じられた修正フレームのシークエンスを発生させ、サンプル化し、当該修正フレームに対して少なくとも1のアファイン変換を施すステップを有していることを特徴とする請求項2記載の方法。
- 前記少なくとも1のアファイン変換を施すステップは、以下記載のステップから成り立っていることを特徴とする請求項2記載の方法:
a。前記複数の像をシークエンス内で並べ替えるステップ
b。前記シークエンス内の各像ペアに対して、当該ペアの第1像から第2像への変換を実質的に定義する1組のアファインパラメータを決定するステップ
c。前記複数の像のそれぞれに対して、前記アファインパラメータの複数組を結合し、1組のアファインパラメータに合成するステップ
d。それぞれ対応する前記合成された1組のアファインパラメータを利用して、アファイン変換を前記各像に対して施すステップ。 - 前記結合ステップは、各スケールされた像を表す信号に時間メジアンフィルターを適用するステップを有していることを特徴とする請求項1記載の方法。
- 前記時間メジアンフィルターを適用するステップは、各スケールされた像からの対応する信号に、ウエイトを与えられた時間メジアンフィルターを適用するステップを有することを特徴とする請求項5記載の方法。
- 前記ウエイトを与えられた時間メジアンフィルターは、比較的短い焦点距離で創出された像に対するよりも、比較的長い焦点距離で創出された像に対して大きなウエイトを割り当てるフィルターを有していることを特徴とする請求項6記載の方法。
- 変換ステップの前に信号ペア間の変化を特定するステップをさらに含み、当該変化は当該信号により表されている像を創出する手段のモーションと、シーン内の要素のモーションにより引き起こされるものであって、像間の焦点距離の差により引き起こされるものではないことを特徴とする請求項1記載の方法。
- 複数の像を得る前記ステップは複数のビデオ像を記録するステップを有していることを特徴とする請求項1記載の方法。
- 前記変換ステップは、互いにアラインされたそれぞれの像を表すように各信号を変換するステップをさらに有していることを特徴とする請求項1記載の方法。
- 結合ステップの前に、2つの像が相違する焦点距離にて創出された事実以外の要因による像ペア間の相対的モーションを特定するステップをさらに有していることを特徴とする請求項1記載の方法。
- 前記相対的モーションを特定するステップは以下記載のステップから成り立っていることを特徴とする請求項11記載の方法:
a。あるペアの両像の第1パターン部分の第1相対的モーションを予想するステップ
b。両像の第2パターン部分の第2相対的モーションを決定するために前記予想された第1相対的モーションを利用するステップ
c。相対的モーションの満足できる解像度が得られるまで以下のステップを繰り返すステップ;
i。前記第1パターン部分の前記第1相対的モーションをさらに正確に特定するために前記第2相対的モーションを使用するステップ
ii。前記第2パターン部分の前記第2相対的モーションをさらに正確に特定するために前記第1相対的モーションのさらに正確なスペックを使用するステップ。 - あるシーンの静止画像を発生させる装置であって、以下記載の手段から成り立っていることを特徴とする静止画像発生装置:
a。複数の像を創出する手段であって、当該複数の像のそれぞれは他と異なる焦点距離にて創出されたものであることを特徴とする像創出手段
b。前記各像に対してその像を表す信号を発生させる手段
c。共通の焦点距離にスケールされたそれぞれに対応する像を表すように各信号を変換する手段
d。前記各スケールされた像を1焦点距離の1画像に結合させてなる最終的な信号を示すように前記各変換された信号を結合する手段。 - 前記複数の像を創出する手段はビデオ記録装置から構成されることを特徴とする請求項13記載の装置。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US78669891A | 1991-11-01 | 1991-11-01 | |
| US786698 | 1997-01-23 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH05304675A JPH05304675A (ja) | 1993-11-16 |
| JP3616111B2 true JP3616111B2 (ja) | 2005-02-02 |
Family
ID=25139354
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP29449192A Expired - Fee Related JP3616111B2 (ja) | 1991-11-01 | 1992-11-02 | 異なる焦点距離又は異なる視域の複数の像を使用した高解像度静止画像を得る方法及び装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP3616111B2 (ja) |
Families Citing this family (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE69732089T2 (de) | 1996-10-04 | 2005-12-08 | Nippon Telegraph And Telephone Corp. | Vorrichtung und verfahren zur zeitlichen und räumlichen integration und verwaltung einer vielzahl von videos sowie speichermedium zur speicherung eines programms dafür |
| US7805020B2 (en) * | 2006-07-25 | 2010-09-28 | Itt Manufacturing Enterprises, Inc. | Motion compensated image registration for overlaid/fused video |
| CN105208259B (zh) * | 2014-06-17 | 2019-12-03 | 中兴通讯股份有限公司 | 相机自动对焦优化的方法及相机 |
| US11134262B2 (en) * | 2019-02-28 | 2021-09-28 | Tencent America LLC | Method and apparatus for video coding |
| CN111724381B (zh) * | 2020-06-24 | 2022-11-01 | 武汉互创联合科技有限公司 | 基于多视图交叉验证的显微图像细胞计数与姿态识别方法 |
-
1992
- 1992-11-02 JP JP29449192A patent/JP3616111B2/ja not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| JPH05304675A (ja) | 1993-11-16 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP3590631B2 (ja) | 複数の画像を利用した高解像静止画像を創出する方法及び装置 | |
| US6198505B1 (en) | High resolution, high speed digital camera | |
| CN101743755B (zh) | 图像处理装置、图像处理方法 | |
| US7162083B2 (en) | Image segmentation by means of temporal parallax difference induction | |
| US7868927B2 (en) | Image data generating apparatus, method and program | |
| JP4317586B2 (ja) | 撮像処理装置および撮像装置、画像処理方法およびコンピュータプログラム | |
| US6118488A (en) | Method and apparatus for adaptive edge-based scan line interpolation using 1-D pixel array motion detection | |
| KR20090009114A (ko) | 합성 이미지 구성 방법 | |
| KR20100052563A (ko) | 화상 생성 방법, 장치 및 그 프로그램과 프로그램을 기록한 기록매체 | |
| GB2231228A (en) | Video signal to photographic film conversion | |
| JP2011211556A (ja) | 画像生成装置、画像生成方法、及びプログラム | |
| JPH06209926A (ja) | X線動画像撮影装置 | |
| JPH05304675A (ja) | 異なる焦点距離又は異なる視域の複数の像を使用した高解像度静止画像を得る方法及び装置 | |
| Deng et al. | Generating panorama photos | |
| JP4377656B2 (ja) | インテグラルフォトグラフィ撮影装置およびインテグラルフォトグラフィ表示装置 | |
| JP3325823B2 (ja) | 映像静止画表示方法及び装置並びに映像静止画表示プログラム格納記録媒体 | |
| JP2005275765A (ja) | 画像処理装置、画像処理方法、画像処理プログラムおよびそのプログラムを記録した記録媒体 | |
| Tschumperlé et al. | High quality deinterlacing using inpainting and shutter-model directed temporal interpolation | |
| JP2716979B2 (ja) | ブレ画像の処理方法及びそれを実施するための装置 | |
| Thomas | Motion-compensated matteing | |
| JP4733448B2 (ja) | 視差生成装置及び視差生成プログラム | |
| US20080055414A1 (en) | Modified Baird sequential detail scanning system | |
| JP2638495B2 (ja) | 撮影装置 | |
| US20080063275A1 (en) | Image segmentation by means of temporal parallax difference induction | |
| Gutiérrez et al. | Using Super-Resolution |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A911 | Transfer to examiner for re-examination before appeal (zenchi) |
Free format text: JAPANESE INTERMEDIATE CODE: A911 Effective date: 20040216 |
|
| A912 | Re-examination (zenchi) completed and case transferred to appeal board |
Free format text: JAPANESE INTERMEDIATE CODE: A912 Effective date: 20040430 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20040916 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20041104 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20081112 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20091112 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20091112 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20101112 Year of fee payment: 6 |
|
| LAPS | Cancellation because of no payment of annual fees |
