JP4732660B2 - ビジュアルアテンションシステム - Google Patents
ビジュアルアテンションシステム Download PDFInfo
- Publication number
- JP4732660B2 JP4732660B2 JP2001560954A JP2001560954A JP4732660B2 JP 4732660 B2 JP4732660 B2 JP 4732660B2 JP 2001560954 A JP2001560954 A JP 2001560954A JP 2001560954 A JP2001560954 A JP 2001560954A JP 4732660 B2 JP4732660 B2 JP 4732660B2
- Authority
- JP
- Japan
- Prior art keywords
- pixel
- image
- pixels
- test
- comparison
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Images
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T7/00—Image analysis
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/40—Extraction of image or video features
- G06V10/46—Descriptors for shape, contour or point-related descriptors, e.g. scale invariant feature transform [SIFT] or bags of words [BoW]; Salient regional features
- G06V10/462—Salient features, e.g. scale invariant feature transforms [SIFT]
Landscapes
- Engineering & Computer Science (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Multimedia (AREA)
- Image Analysis (AREA)
- Image Processing (AREA)
- Compression Or Coding Systems Of Tv Signals (AREA)
- Color Television Systems (AREA)
Description
【発明の属する技術分野】
この発明は静止画像もしくはビデオシーケンス内部に含まれている目立ったオブジェクトの位置決めをするためのシステムに係り、限定するわけではないが、とくに画像圧縮システムにより使用されるシステムに関する。
【0002】
【従来の技術】
人間の視覚に係る眼と脳との知覚系(human visual eye-brain perceptual system)は提示されたシーン(情景)の一番重要な特徴を識別、同定するのに非常に優れていて、大部分の自動化システムにとって必要とされているような予備的な学習訓練なしでも、背景とか周囲の分布(ポピュレーション)からある種の違いがあるオブジェクトを識別するのに非常によくできている。しかし、オートメーションが望まれる若干の応用が存在し、例えば作業が非常に頻繁に反復されるとか、データ量が莫大な場合である。特定の例は医学的な顕微鏡の検鏡板に塗った少量の(smear)サンプルを癌細胞識別のために検査することである。このような情況下では、大きな数のサンプルが検査されなければならず、しかも異常はまれであり、人間である観察者の注意が緩んでしまって、探しているその特徴を見過してしまうことがある。
【0003】
区別することができる画像内のオブジェクトを自動的に識別するシステムは、また視覚上の情景(ビジュアルシーン、以下、visualを目視上とか目視可能なと訳出する)内の重要な主体(principal subject)の位置の識別同定、情報サイン(標識)の設計と位置決め、また目視可能な表示装置の長ったらしくしかも高価な人間的因子の試行に代るものといった例のように数多くの他の目的にとっても望ましいこととされている。
【0004】
【発明が解決しようとする課題】
目視上注目されるところを測定するための既存のシステムは、画像から前もって特定した特徴(フィーチャ、例えば色、強度、配向)を抽出し、つぎに分類器(例えばニューラル網)を学習訓練させて、大きく注目を集めるところ(ハイアテンション)の領域を識別、同定する。これらの学習訓練ができるモデルは、その画像内で探し求められている特徴の選択に大きく依存していて、システムの設計と試験とのために使用されたものと殆んど類似性のないような新しい目視可能な素材を処理することができない。逆説的な(パラドキシカルな)言い方をすると、ある特徴は、学習訓練をしたシステムによってそうと同定されることになるには奇形変形の仕方が過度であると単純にされるものである。このようなシステムはまた予め選定した特徴を処理するためにかなりの計算処理資源を必要としており、さらに加えて、このような負荷は処理の範囲が拡大されて、もっと特徴が加えられるのに伴って無制限に増加するものである。
【0005】
既知の画像圧縮システムの大部分は画像を一定の圧縮レートでしたがって一定の圧縮品質でだけ圧縮できるという不都合を備えている。既知の可変レート圧縮システムは画像内の関心のある領域に従り圧縮レートを自動的に変えることができない。大部分の場合には、関心のある領域だけを高品質で圧縮しながら、画像のその余の部分(背景のようなところ)を低品質でのみ圧縮することで十分であろう。圧縮品質と画像ファイルサイズとは互に他に依存しているので、これは圧縮された画像ファイルにとって必要とされるスペース(空間)の全体量を減らすことになる。職業的な(プロフェッショナルの)Web設計者により使用されている一つの技術は、JPEGでの圧縮前に画像の背景を単純にぼんやりさせる(blur)ことである。これは背景が連続しているトーンで作られるように強制し、それによって画像内の空間周波数量を低減する。このように前処理された画像はその記憶要件を最大30%まで減らされていて、この量はぼんやりさせていない画像に対して比較したぼんやりしている量に依存している。手によって画像をぼんやりさせることは大層労働力を意識させるものであり、画像によっては価値あるほどに十分なスペースを節減できないことになりかねない。
【0006】
ジョイント・ピクチャ・専門家集団(JPEG)は新しい画像圧縮規格、JPEG2000について作業を進めており、これはまた画像内で関心のある特定領域を画像のその余の部分よりも高品質で圧縮できるようにしている。しかしながら、関心のある領域の自動識別、同定は依然として問題となっている。
【0007】
【課題を解決するための手段】
この発明によると、目視上注目される領域を識別するために、目視可能な画像を処理する方法が提供されていて、この方法は、各ピクセルが値を有しているピクセルのアレイとして画像を記憶する段階と、該アレイから試験ピクセルを選択する段階と、各試験ピクセルについて、該試験ピクセルの近隣にあるいくつかの近隣シーケンスのピクセルを選択する段階と、該アレイから比較ピクセルを選択する段階と、選ばれた近隣シーケンスのピクセルが該試験ピクセルに対してもっているのと同じそれぞれの位置関係を、該比較ピクセルに対して、もっているとして選ばれた比較ピクセルの近隣にあるピクセルのシーケンスを識別する段階と、該選ばれた近隣シーケンスの値を、該識別されたシーケンスの値と、所定の整合規準に従り比較する段階と、各試験ピクセルについての目視上注目される測度を、比較結果が不整合となった相手である試験ピクセルについて行なわれた比較の回数に依存して生成する段階とを備えた方法である。
【0008】
この方法はまた画像のシーケンスにも適用できる。
【0009】
好ましい構成では、各比較ピクセルについて、試験ピクセルに隣接している選ばれたピクセルのいくつかが、比較ピクセルに隣接している対応するピクセルと実質的には類似していない強度値を有しているとすると、異常値(anomaly value)がインクレメントされ、別の比較ピクセルを用いて同じ試験ピクセルとの比較が繰返されて、比較ピクセルが選ばれるまで続き、選ばれた比較ピクセルについては、すべての選ばれたピクセルが試験ピクセルの近隣にある対応するピクセルと実質的に類似している強度値をもつものとなり、この場合、別の近隣のシーケンスが選ばれて処理が繰返される。
【0010】
前に大きな異常値を発生したことがある近隣ピクセルシーケンスが後の試験ピクセルの解析用に選ばれるとするとこの処理は最も効率的に動作することが見付かっている。そこで好ましいのは、処理が大きな異常値が生成された対象となっている近隣シーケンスパターンを記憶する段階と、後の試験ピクセルについて、後の試験ピクセルとのそれぞれの位置関係として該記憶された近隣シーケンスと同じ位置関係をもつ近隣シーケンスを選ぶ段階とを含むことである。
【0011】
この発明の別な特徴によると、目視可能な画像もしくはこの種の画像のシーケンスを目視上注目される領域を位置決めするために処理する装置が提供されていて、この装置は、各ピクセルが値を有しているピクセルのアレイとして画像を記憶する手段と、該アレイから試験ピクセルを選択する手段と、該試験ピクセルの近隣にあるピクセルについての近隣シーケンスを選択する手段と、該アレイから比較ピクセルを選択する手段と、選ばれたピクセルについての近隣シーケンスが該試験ピクセルに対してもっているのと同じそれぞれの位置関係を、該比較ピクセルに対してもっているとして選ばれた比較ピクセルの近隣にあるピクセルのシーケンスを識別する手段と、該選ばれた近隣シーケンスの値を、該識別されたシーケンスの値と、所定の整合規準に従り比較する手段と、各試験ピクセルについての目視上注目される測定を、不整合シーケンスと識別する比較数に依存して、生成する手段とを備えた装置である。
【0012】
この装置は、適切にプログラムされた、汎用計算機として実施されているのがよい。
【0013】
この発明はまたこの発明の方法を実行するためにプログラムされた計算機と、ディジタル計算機の内部メモリ内に直接ロードできる計算機プログラム製品にまで展開され、そこにはソフトウェアコード部分があって、上記で特定した段階を実行するのにあてられる。
【0014】
また別な特徴によると、この発明は次のものを用意している。すなわち、計算機で使用可能な媒体上に記憶された計算機プログラム製品であって、計算機をして各ピクセルが値を有しているピクセルのアレイとして画像を記憶するようにさせる計算機が読取り可能なプログラム手段と、該計算機をして該アレイから試験ピクセルを選ぶようにさせる計算機が読取り可能なプログラム手段と、該計算機をして、各試験ピクセルについて、該試験ピクセルの近隣にあるピクセルについての近隣シーケンスを選ぶようにさせる計算機が読取り可能なプログラム手段と、計算機をして該アレイから比較ピクセルを選ぶようにさせる計算機が読取り可能なプログラム手段と、計算機をして、該試験ピクセルに対してピクセルについての選ばれた近隣シーケンスと同じそれぞれの位置関係を比較ピクセルに対してもっている、選ばれた比較ピクセルの近隣にある該ピクセルについてのシーケンスを識別させる計算機が読取り可能なプログラム手段と、計算機をして、該選ばれた近隣シーケンスの値を該識別されたシーケンスと所定の整合規準に従り比較させる計算機が読取り可能なプログラム手段と、計算機をして各試験ピクセルについての目視上注意される測度を、該比較で不整合となった比較の数に依存して、生成させる計算機が読取り可能なプログラム手段とを備えた計算機プログラム製品である。
【0015】
この発明は目視可能なシーン内部の重要な主体を識別、同定(アイデンティファイ)するために使用できるものであり、一番大きな異常値を有するピクセルを含んでいる領域を識別することによっている。目視可能なシーンの中の所与のオブジェクトに与えられているビジュアル・アテンション(目視上注目されるところ)についての測度(あるいは尺度、メジャー)を判断するために使用されてもよく、ここではそのシーンの他の部分について生成された異常値をそのオブジェクトを表わしているピクセルについて生成された異常値と比較することにより測度が決められる。
【0016】
この処理(プロセス)が繰返されるという性質をもっていることが並列処理に手助けをしていて、いくつかの試験ピクセルが互に並列に処理されること、また各試験ピクセルについて、近隣ピクセルのいくつかのシーケンスが並列に処理されてもよいことに注目されたい。
【0017】
シーンについての他の類似の要素間での強度についての小さな変動を許すようにするために、値の比較は値についての小さな差異は二つのピクセルが整合と考えられるようにできることが好ましく、また“実質的に類似している(同じもの)(substantially similar)”と上述したのはこの意味であると理解されるべきことである。このしきい値差についての値は異なるサイクルで変えることができ、これらの値は記憶されて処理の後のサイクルで再使用される要素間で適切な差別(違い)を作っている。
【0018】
カラー画像については、強度値は三要素(赤,緑,青;RGB)ベクトルであってよい。代って他の色空間である色相(hue)、飽和(saturation)、ルミナンス(luminance)などが使用されてもよい。
【0019】
この発明はシーン内の近隣間での類似度(similarity)を見付ける際の困難さを測定することによって目視可能なシーン内での顕著性(saliency;突出度)を識別、同定する。ある領域のピクセルは、その領域がシーンの他のかなりの部分と類似していれば目視上注目されることでは低い測度の得点とすることになる。これに対して、画像の他の部分とは数多くの非類似をもつ領域は、得点される異常値が大きくなるので、目視上注目されることでは高い測定を誘引することになる。
【0020】
この発明は試行錯誤処理を使用して画像の部分間での非類似を見出すようにし、かつ顕著性を判断するために異常の性質についての前もっての知識を必要としていない。この方法はピクセル間での処理の依存性を使用することを避けていて、各ピクセルについて直截的な並列実施を可能にしている。
【0021】
【発明の実施の形態】
添付の図面を参照して、例をあげて、好ましい実施例を記述して行く。
【0022】
図4に示した部品は、スキャナ(走査器)のような入力手段41と、中央処理装置(CPU)42と、ビデオディスプレイユニット(VDU)とかプリンタのような出力ユニット43と、メモリ44と、計算処理装置(計算プロセッサ)45とを備えている。メモリ(記憶装置)にはメモリ(ストア)440,444〜446と、レジスタ441,447〜449と、カウンタ442,443とが含まれている。データとプログラムで計算機を制御するためのものがメモリ44内に記憶される。CPU42はこの情報を用いて計算機の機能を制御する。
【0023】
ここで図1と4とを考察すると、解析対象の画像40は入力手段によってアクセスされて、画像メモリ440内にディジタル形式で記憶され、記憶はピクセルxのアレイAとして行なわれ、ここで各ピクセルは色(カラー)強度(rx,gx,bx)としてピクセルの属性となっているものを有していて、グレイレベル画像の場合には単一のグレイスケール強度値txを有することになる。
【0024】
ピクセルxはそこでアレイAから選ばれて(段階1)、その強度値(rx,gx,bx)もしくはtxが試験ピクセルレジスタ441内に記憶される。いくつかの試験ピクセルが並列に処理されてよいが、例示の目的では一つだけがここでは考察されることになる。
【0025】
異常カウントcxは異常カウンタ442に記憶されていて、ピクセル比較Ixの数のカウント(計数値)は比較カウンタ443内に記憶されていて、その両方がゼロに設定される(段階2)。
【0026】
サーチ戦略(ストラテジィ)が次にCPU42により選ばれて(段階3,4,5)、近隣グループ定義メモリ444に送られる。各サーチ戦略は一組の色差しきい値(Δrx,Δgx ,Δbx)(あるいはグレイレベルの場合には単一のしきい値Δtx)(段階3)と近隣グループ定義(段階4,5)とを備えている。
【0027】
色相、飽和、値(HSV)空間内でカラー画像に作用するこの発明の別な実施例では、Δhx,Δsx,Δvx色差しきい値が使用されており、これについてはもう少し詳しく後で述べる。カラー画像についてこの発明の実施例で使用されるしきい値は、ピクセル間の比較が実行されるカラー空間に依存することになる。
【0028】
この発明の別の実施例では色差しきい値は前もって決められていて、新しい近隣グループ定義戦略の選定毎に変わることはない。
【0029】
最初にサーチ戦略がCPU42によってランダムに生成されることになり、もしその戦略が差を識別するのに不適当であるとすると、そのサイクルは排斥され(段階9以降)、新しい戦略が選ばれる。成功する戦略はサーチ戦略メモリ445内に後続の再使用のために記憶されるようにできる(段階11)。
【0030】
段階3で選んだ色差しきい値は二つのピクセルが類似していると考えられるべきかどうかを決める。この差しきい値はある最小値を越えていなければならず、そうでないと類似が何も見付からないことになるのであるが、そうかといって大きすぎると、多すぎるくらいの類似が見付かることになる。
【0031】
近隣グループを定義するために、半径uxがある境界内でランダムに選ばれる(段階4)。この値はxの近隣の拡がり(範囲)を決めており、この中ではピクセル類似比較が計算プロセッサ45により行なわれる。ux上の境界は目視上の注目を設定する特徴(フィーチャ)のスケール(寸法)によって決められ、このスケールは画像が解析される目的に依存することになる。差しきい値のように、選定はこういった限界の内部ではランダムであり、区別を与えることに失敗する選定は排斥される(段階9)。
【0032】
試験ピクセルxの近隣の中の中でn個のピクセルxjのシーケンスが画像メモリ440から選ばれる(段階5)。ここでもまた、選定はランダムであり、選定は次による。
【0033】
dist(xj,x( j−1)<ux
ここでj=1,…,nであり、またx0=xである。
【0034】
選定がランダムであるから、このようなピクセルのシーケンスは必ずしも互に近隣にある必要はないし、いかなる意味でも連続しているということにならない。
【0035】
このようなシーケンスの例が図2に示されていて、ここでは試験ピクセル(箱で示す)はそれと関係しているシーケンス(陰影はつけていない)を有している。一般にn=3で、ux=1である。ある場合には、uxはjとともに変る。これはピクセルが広い領域から選ばれるようにしながら、選ばれたピクセルのいくつかが試験ピクセルxjに近くにあることを確かにしている。dist(xj,x( j−1 ))の値は何でもよい適当な単位で定義でき、例えばピクセルの寸法でよい。近隣シーケンスの定義は近隣グループ定義メモリ444内に記憶される。
【0036】
この発明の他の実施例では、n個のピクセルxjのシーケンスで試験ピクセルxの近隣にあるものが画像メモリ440から選ばれ(段階5)、選定は次による。
【0037】
dist(x0,xj)<ux
ここでj=1,…,nであり、またx0=xである。
【0038】
前に生成されたサーチ戦略は、CPU42によって先取り選択されてよい。これらのサーチ戦略は、(1)近隣ピクセルシーケンス定義xjと、(2)関係する色差しきい値(Δrx,Δgx,Δbx)であって、サーチ戦略メモリ445内に記憶されている。この記憶は、後に論じられる段階11での、先行する試験ピクセルについての大きな異常に関する得点を得るという結果として行われる。この戦略はランダムに生成された候補をプロセッサ42が現在の近隣グルーム定義メモリに向けて、条件が満足されるときに供給される。この条件は、このような記憶された規準(すなわち、戦略)が使い尽くされることとなっている。
【0039】
同じように、たくさんの類似の画像を処理するときには、(例えば動いている画像の中とか、医学的な微量の試料を塗った顕微鏡用検顕板(smear)の試験のような類似画像の大量組の処理では)、先行する試験について大きな異常得点を得ている試験シーケンスがサーチ戦略メモリ445から検索読出し(レトリーブ)されてよい。
【0040】
ピクセルyはランダムに選ばれて(段階6)、現在の比較ピクセルとなるようにされ(これは図2の箱で示されている)このアイデンテティ(識別子ID)が比較ピクセルレジスタ447内に記憶される。
【0041】
比較カウンタ443に記憶されているIxの値はインクレメントされる(段階7)。近隣グループ定義レジスタ444のコンテンツ(内容)はそこで計算プロセッサ45により使用されて、試験グループxjを形成する一組のピクセル(レジスタ448)と、比較グループyjを形成する一組のピクセル(レジスタ449)とを定義し、比較グループの各ピクセルyjは、試験ピクセルxに対して試験グループ内の対応するピクセルxjがもっているのと同じ位置関係を比較ピクセルyに対して持つことになる(段階9)。計算プロセッサ45はそこで各ピクセルxj(図2で陰影のあるもの)を対応するピクセルyj(これも陰影がある)と比較し、この比較には近隣グループ定義メモリ444から検索読取られたしきい値が用いられる。
ピクセルyは試験ピクセルxと類似しているとして識別されるが、その条件は、|ry−rx|<Δrx,|gy−gx|<Δgx,及び|by−bx|<Δbxである。
すべてのグレイレベル画像については|ty−tx|<Δtxである。
別の実施例では、計算がHSV色空間(カラースペース)で実行され、ピクセルyは試験ピクセルxと類似しているとして識別され、その条件は、
|vy−vx|<Δvx,|sy−sx|<Δsx,及び|hy−hx|<Δhxであり、ここでΔhx=Z*(2−vx)*(2−sx)である。Zはhxに依存しているしきい値の経験的テーブル内に記憶されている。これがvxとsxとの小さい値に対してΔhxが大きくなるという結果をもたらしている。二値画像についてこの発明の方法の動作を加速するために、比較ピクセルyは試験ピクセルxと整合するように選ばれてよい(すなわち、“白”とか“黒”とかである背景ピクセルを無視することである)。
【0042】
カラーもしくはグレイレベル画像については、動作速度は比較ピクセルメモリ446内に記憶されるようにしてよい比較グループから比較ピクセルyを選ぶことによって増大されるようにできる。比較グループは図12に示したように選ぶことができる。目視上注目されるところの測度が比較グループ内のピクセルの全てについて生成されると、新しい比較グループが、ピクセルは一番大きな目視上注目されるところの測度を生成しているピクセルの近くにある、ピクセル(複数)から選ばれてよい。
【0043】
試験グループ内のピクセルのすべてが比較グループ内の対応するピクセルyjと類似であるとすると、処理は新しい比較規準を選び(段階4,5)、また新しい比較ピクセルyを選ぶ(段階6)によって繰返される。もし(図2に示したように)試験グループ内でいくつかのピクセルxjが上述の類似性定義に従り、比較グループ内でのカウントcxで異常カウントレジスタ442に記憶されているものがインクレメントされる(段階10)。別の比較ピクセルyがランダムに選ばれて、比較ピクセルレジスタ447内に記憶され(段階6に戻る)、近隣グループ定義メモリ444から検索された近隣グループ定義が使用され、新しい比較近隣グループを比較グループレジスタ449に向けて供給して、試験グループレジスタ448内に記憶された試験グループとの比較にあてられる。一組のピクセルxjが試験グループレジスタ448内に保存されていて、その期間は画像の他の部分との整合に失敗するまで続く。このような組はxの在る場所(locality)についての区別できる顕著な特徴を表わしていて、整合の失敗が起れば起るほど顕著性があることになる。もっと多くの比較ピクセルyが試験ピクセルxとの整合に失敗するとなると、異常カウンタ442内に記憶されている異常値cxがもっと大きくなる。逆に、試験ピクセルxがより多くの整合を生じさせると、しきい値Lが比較カウンタ443によって到達されるときには異常値についての値がより低いものとなる。エル(l)回の比較がされる度毎に、この処理によりもたらされる結果の異常値cxは、試験ピクセルxについて整合がとれなかったランダムに選ばれたピクセルの割合の測度であると考えられてよい。
【0044】
処理が継続するにつれて、成功するサーチ規準が次第に明らかになる。このサーチ規準は言い換えるとΔrx,Δgx,Δbxとuxの値と、近隣シーケンスの組合せであって、大きなcxの値を生成するものである。もし、n個のピクセルxjのシーケンスと、対応する色差しきい値(Δrx,Δgx,Δbx)が異常カウンタ442内に記憶されたcxの異常値をして、整合が見付かる前に、しきい値Mと到達するようにさせるものであるとすると、近隣グループ定義メモリ444内に記憶されたサーチ戦略はサーチ戦略メモリ445にコピィされて(段階11)将来の使用にあてられるが、これはすでに記憶されていないことを条件とする。大きな異常値を生成した規準はこうしてサーチ戦略メモリ445で利用可能であり、別なサイクルでの適当な値を選択するために使用される(段落4,5)。一旦、整合が見付かると、処理が再開され、新しいサーチ戦略(色差しきい値及び近隣の組)で近隣グループ定義メモリ444に記憶されているものが使用される(段階9)。ここではサーチ戦略メモリ445からの検索か、ランダム生成されたものかのいずかが使用される。
【0045】
反復値Ixで比較カウンタ443内に記憶されているものがしきい値Lに到達するときには、反復処理は停止し(段階8)、現在の異常値cxであって異常カウンタ442内に記憶されているものが出力ユニット43でピクセルxについての異常値として出力される。最終の異常値cxは試験ピクセルxについての目視上注目される測度であり、これは全体でL回の試行となるうちの試行の数であって、この数はランダムに選ばれたピクセルyについての対応している近隣との整合に失敗したピクセルxのランダムに選ばれた近隣の本来の特性(すなわちカラー)についての試行数である。cxについての大きな値はピクセルxがその画像のその余の部分と不整合の程度が大きいことを示しており、その結果、ピクセルxが目視上注目に値するオブジェクトの一部であることを示している。
【0046】
出力ユニット43は一般に記憶媒体であり、この媒体はプリンタとか、目視可能な表示ユニットなどによる表示用にあるいは後続の処理のために各ピクセルの異常値を記憶するのであって、例えば、後の処理は画像圧縮であって、これは後で図5〜11を参照して記述することにする。
【0047】
この発明は三つの値(R,G,B/H,S,V)あるいは単一の値(グレイレベル)をもつポイント(点)の二次元画像を参照して記述されてきたのであるが、この方法はpの値をもつポイントを有するn次元画像にも拡張できることは理解できよう。
【0048】
pの値があるポイントを使用する場合には二つのピクセルが類似しているかどうかを、上述の段階9でグレイレベル、RGB及びHSV画像についてした評価のための機能はpの値についての比較に拡張されることになる。
【0049】
n次元画像の場合には近隣ピクセルの選択はn次元距離測度を用いて行なわれ、段階5で近隣グループを選ぶようにする。このようにして、この発明の方法をビデオシーケンス内の継続するフレームのシーケンスに対して応用することができ、この例では使用される次元の一つが時間となっている。
【0050】
この発明の二つの単純化した例で使用されているものについて記述することにする。図2aはモノクローム画像であり、いくつかの垂直方向特徴と一個の対角特徴を有しているものを示す。図2aから見とれることは、垂直方向特徴の一つからのあるピクセルについての近隣の組を形成しているピクセルのグループが他の垂直方向の特徴からの近隣のピクセルのグループと整合することになるということである。しかしながら、対角特徴のピクセル形成部分は他の特徴からのピクセルと整合がとれそうもない。対角特徴内での別のピクセルについても、試験ピクセルか比較ピクセルのいずれかの近隣ピクセルがこの特徴の端を越えて延びているとすると整合をとるのに失敗することになる。そこで、いずれかの近隣組について整合を得る確率は、垂直特徴の一つについての形成部分と比較すると、対角特徴のピクセル形成部分については極めて僅かなものになる。
【0051】
例示の実施形態では、ピクセルは規則的な直線で囲まれた図形による埋めつくし(regular rectilinear tessellation)を形成しているが、この処理はピクセルの他の構成についても適切とされる。もしアレイが不規則であると各ピクセルyjの比較ピクセルyに対する位置関係は、各ピクセルxjの試験ピクセルxに対する位置関係と正確に同じでなくてよいが、それぞれはできる限り正確に対応している位置に密接するようにする。
【0052】
この処理には他のプロセスよりも好都合ないくつかの点がある。第一に、この処理は画像のコンテンツについて何の仮定も置いておらず、測定処理の一部としてコンテンツに関係する有用な特徴を抽出できて、これによりどんな画像中の素材(マテリアル)にも適応することができる。第二に、このプロセスはどんなピクセルの構成にも等しく応用されることであり、ピクセルが矩形のアレイに並べられていても、ら線状のアレイでも、あるいは不規則パターンであってもよい。第三に、この処理は各ピクセルxiに応用できることであり、この際には他のピクセルと関係している計算に何ら依存しないので、それにより数多くのピクセルに同時に並列に適用してよい。これが意味するところは、並列実施では、結果がビデオ素材から実時間すなわちずっと高速で得られることである。第四に、このアルゴリズムは進化したプロセスに基づいているので、このプロセスでは試行が規則上厳格な励行を求められる(rigor)正規に許されているソフトウェアプロセスで用意されなければならないということがないという好都合さがある。若干のサイクルは有用な結果を作り出さないことがあり、例えば結果に明らかな冗長さが含まれていることが理由となっている(例をあげると、同じピクセルを一度ならず含んでいる近隣ピクセルxjのシーケンスがある)。このようなサイクルは顕著な特徴を識別とそこなった他のサイクルと同じように排斥され、その際にはこのようなシーケンスを識別することが必要とされている特種排斥プロセスを用いなくてよい。これが試行について顕著な候補を正確に構築するために求められる計算処理上の負荷を取除いている。
【0053】
以下の簡単化した例では、この処理が黒白画像に応用され、しかもこの画像が完全に1と0との画像である。この場合にはΔti =1/2,n=3,L=100,またuj=1である。第一の例(図2a,2b)は“ポップアウト(popout)”(注:見たときに、とくに目立つ形のこと)についての古典的な問題をあげていて、この問題では形状についてのある種の形式が異なる形状で囲まれているときに登場する。
【0054】
図2aの各ピクセルに属している目視上注目される測度は図2bのチャートに示されている。たて軸は異常値(試行数Lの百分率としてある)を各ピクセルについて示している。異常値ci は垂直方向バーについてよりも対角バーについて非常に高いものとなっている。
【0055】
図3aは目視上注目されるところでのクラスタ化の効果を示すもので、ここでは垂直方向線のグループ形成がもっと広幅に分離されている他部の中に置かれている。この発明の処理を用いる結果が図3bに示されている。ここでもまたクラスタ化したラインがより大きな異常得点を得ている。
【0056】
この処理は予備的な前もっての知識をサーチされる異常についての性質について求めていない。異常は方向であってよいし(図2のような場合)、間隔であってよいし(図3aのような場合)、形状、長さ、色、もしくは他の特性であってよい。
【0057】
この発明は多数の分野で広範囲の応用をもつものである。第一に、目視可能なシーンの中での重要な主体の識別は、フィルタをかけていない目視可能なコンテンツの分類における第一の本質的な段階である。このことはまた最もむづかしいものでもある。一度この段階が達成されると、手操作によるタグ付けが続き、あるいはいろいろな範囲のテンプレートマッチングとか他の自動化技術であって、このように識別された特徴の認識にあてられるものとかが続く。
【0058】
この発明の方法を用いる画像圧縮の方法を図5ないし11を参照して記述して行くことにするが、最初はこの発明による画像データの圧縮方法の概観を図5a,5bを参照して用意することとする。
【0059】
離散的余弦変換(Discrete Cosine Transform)を用いる画像の圧縮は既知である。数多くの画像圧縮アルゴリズムは、JPEGがその例であるが、このような圧縮を使用し、またよく動作することが証明済みである。DCTを用いる原理は、画像内のピクセルが二次元信号として取扱えるということであり、これがDCTによって周波数ドメインに変換される。色と輝度に変化がほとんどない画像内の領域は、低い空間周波数をもつ領域であり、これに対して、色と輝度とに大きな変化をもつ領域は高い空間周波数をもつ領域である。研究により示されたところは、人間の眼は高い空間周波数に対しては非常に敏感であるというのではないことと、この事実が圧縮に使えるということであった。さらにもっと重要なことは低い空間周波数についての情報をもつことであり、それによって高い空間周波数はもとの画像を合理的な妥当な品質で回復するために伝送されたり記憶されたりする必要がないということである。高圧縮率(レート)については空間周波数に対する人間の感度のモデルが使用され、これがある周波数についてのフィルタとして取扱うことができる。
【0060】
標準的な圧縮アルゴリズムは関心のある領域が画像内で自動的に特定できて、それにより、その領域が背景よりも高品質で圧縮できるということを許さないので圧縮は最適とはならない。もしある画像がnバイトの寸法をもつことを求められるとすると、全体の画像が求められたファイル寸法に適するように同じ品質で圧縮されなければならないが、これがときによっては品質が非常に貧弱で不満足なものであることを意味しかねない。画像の中にはいつもある部分があって、そこが他よりもっと関心のあるところとなっていて、またそうではなく僅かな関心しかない部分もある。通常は人物に関心があり、背景には関心がない。したがって、背景を非常に高い圧縮率で(低品質で)、また画像のその余の部分を非常に低い圧縮率(高品質)で圧縮するのが好都合ということになる。もし平均の圧縮率が一定の圧縮率で圧縮された画像についてと同じであるとすると、結果としてのファイルサイズは同じことになる。しかし、可変圧縮率で圧縮した画像は、看者に対して、この画像の方が全体の画像について一定の圧縮率で圧縮したものよりも、よい印象を与えることになる。
【0061】
この発明の方法は、ユーザがある画像を圧縮するのに、その画像の異なる部分について異なる品質レベルを用いてすることができるようにしている。品質のレベルはビジュアル・アテンション・マップ(VA−マップ)30を用いて画像内のある領域について判断される。このマップは簡単に作れる。圧縮後にはVA−マップ30は圧縮された画像データの一部を形成することになる。
【0062】
入力画像はRGB画像であり、言い換えると、そのピクセルは三原色R,G,B(赤緑青)の和として表わされる。この三原色の各々が0〜255の間の整数とにより表わされる。もともモノクローム画像も等しく使用されてよい。
【0063】
入力画像はYCbCrカラー空間に変換され、同時に成分であるルミナンス(Y)とクロミナンス(CbとCr)とに分解される。人間の眼はカラー(色)の変化よりも輝度(ブライトネス)の変化により敏感であるから、二色成分Cb,Crが4:1:1ダウンサンプリング機構を用いてダウンサンプルされる。
【0064】
次にこれらの成分が8×8ピクセルブロック32に区分され、各ブロックは圧縮アルゴリズムにより個別に取扱いがされる。すべての成分(Y,Cb,Cr)について各方向のサンプルの数が8の倍数でなければならず、それで後の処理のための完全なピクセルブロックが用意される。入力画像がこの要件に適っていないとすると、追加のサンプルが人為的に作り出されてブロック内の空になっているピクセル空間内に充填される。ダウンサンプリングが理由となって、x方向とy方向とのブロックの数はY成分について2の倍数でなければならず、このことは後に説明する。
【0065】
あるブロックが周波数ドメインにFDCT(フォワードDCT)14により変換される。結果の係数はそこで量子化器16によって量子化される。量子化はデータの低減に通じ、画像圧縮に対する鍵(キー)となっている。量子化後となると、画像は誤差(エラー)なしには再構築することができない。しかし量子化テーブル18を用いることによって、このテーブルが人間の空間周波数に対する感度を実現するものとなっていて、エラーは認知することができない程小さいものとすることができる。量子化のレベルは量子化係数20により影響を受けていて、この係数20が使用された、その画像についてのVAマップ30により可変品質レベルを作るようにしている。
【0066】
量子化の後に、各ブロックはジグザグスキャナ22により64次元ベクトルに変換される。これが低い空間周波数についての係数をベクトルの始め(低インデックス)に置き、また高い空間周波数についての係数を終り(高インデックス)に置く。高周波数についての係数は量子化の結果としてゼロとなるから、ゼロの長いシーケンスがジグザグスキャニングプロセスによって作られる。ジグザグベクトルはそこでランレングスエンコーダ24でエンコードされて、その結果が二つのアレイ、すなわちランレングスアレイ26とレベルアレイ28の中に記憶される。最後に、すべてのブロックが処理されてしまうと、こういった二つのアレイがエントロピィコーダ50によってエントロピーコーデングされ、結果のバイトアレイ52が出力ファイルにVA−マップ30と画像についての一般情報と一緒に出力ファイルに書込まれる。ファイルフォーマットについては後述する。
【0067】
画像のデコード(解圧縮)をここで図6a,6bを参照して記述することとし、それからコーダとエンコーダとの個々の部分の機能について図7ない11を参照して記述する。
【0068】
画像データのデコードと画像の再構成とは上述のコーデング処理の逆となっている。バイトアレイ52内の画像データはまずエントロピィデコードがエントロピーデコーダ60によつて行なわれ、結果が単一の8×8ブロックについてのアレイに区分される。単一のブロック26,28についてのアレイは次にランレングスデコーダ62によりランレングスデコードされ逆ジグザグスキャナ64を用いて8×8サンプルマトリックスとして記録されて、解量子化器(デクオンタイザ)66により量子化が解かれ、その際には適切な量子化テーブル18がVA−マップ30から得られた情報と一緒に用いられている。次にデータが周波数ドメインから成分サンプル値に戻る変換にかけられ、ここでは逆DCT67が使用され、結果が各成分について異なるアレイ内に記憶される。最期に、三つの成分アレイが使用されて最終画像が編成される。CbとCrとの成分は線形補間フィルタ68,69を用いてアップサンプルされる。結果として得られた画像はもとの画像よりも大きくなりそうであり、その理由としてブロックパッデング(block padding)があげられ、また画像はもとのサイズにクロップ(crop,トリミング)されなければならない。
【0069】
もとのRGB画像から8×8ピクセルブロック32(図5,6)を形成することについて、図7と8を参照してより詳細に記述して行く。
【0070】
RGB値からY,Cb,Cr値への変換は次の式で与えられる。
【0071】
Y=rnd(0.299・R+0.587・G+0.114・B)
Cb=「−0.1687・R−0.3313・G+0.5・B+128」
Cr=「0.5・R−0.4187・G−0.0813・B+128」
ここでR,G,Bは[0,255]の範囲内にあり、Y,Cb,Crもまた[0,255]の範囲内にある。R,G,BとY,Cb,Crとは整数である。
【0072】
CbとCr成分は4:1:1ダウンサンプラ機構を用いてダウンサンプルされる。xとyとの方向で毎第二のピクセルについて、三成分のすべてが記憶される。他のピクセルについてはY成分だけが記憶される。これが意味するのは毎四つのYサンプルについて一つのCbサンプルと一つのCrサンプルとがあることである。このダウンサンプリングが模式的に図7に示されている。こうしてCbとCrとのアレイがYアレイの大きさのちょうど1/4となる。これができるのは人間の眼がカラー(Cb,Cr)よりも輝度(Y)での変化にずっと敏感であることによる。
【0073】
前述しているようにダウンサンプリングはデータ量をファクタ2だけ減らす。ダウンサンプリングとすべての成分が8×8ピクセルブロックに分けられるという事実とが理由となって、後の処理にとって必要とされるサンプルの数はすべての成分についてxとyとの方向で8の倍数となる必要がある。
【0074】
図7に示されるように、8×8サンプルのブロックを形成するためには、8×8入力サンプル(RGBサンプル)のアレイはY成分について必要とされ、また、16×16入力サンプル(RGBサンプル)のアレイがCbとCrとの成分について必要とされる。16×16入力サンプルアレイはマクロブロックと呼ばれる。空へ成分についての関心のレベルは、マクロブロックを形成している四つのサンプルブロックのVA−マップ内で定義される関心についての最大レベルとして定義される。
【0075】
xとyとの方向の8×8ピクセルブロックの数は[数1]で与えられる。
【0076】
【数1】
【0077】
これらの式でwidth(幅)は入力画像のx方向における入力サンプル(ピクセル)の数であり、またheight(高さ)はy方向における入力サンプル(ピクセル)の数である。サンプルが境界で加えられた後に画像内で必要とされるサンプルの全数は[数2]によって計算される。
【0078】
【数2】
【0079】
境界で加えられることになるサンプルの数は[数3]によって計算される。
【数3】
【0080】
ここでwidthは幅をheightは高さをそれぞれ表わす。
【0081】
追加のサンプルは高い空間周波数が何も生成されないように加えられなければならない。これが行なわれるのは、境界サンプルで拡張することによる。このことは簡単に実施され、また水平または垂直の周波数のいずれかがない形で自動的に作り出せる。しかしながら、その境界における画像のコンテンツに依存して、一方向における高い周波数は依然として作られてよい。まず、すべての行が境界における最新のサンプルでパッド(詰めること)され、次に列が後でパッドされる。画像からの8×8ピクセルブロックの編成(フォーメーション)が模式的に図8に示されている。
【0082】
画像の圧縮を解くために、上述のカラー変換の逆が[数4]で定義される。
【0083】
【数4】
【0084】
逆カラー変換については、R,G,Bについての結果値は、丸めが理由となって[0,255]の有効範囲を越えてもよい。したがって、超過した値はそれぞれ最小値及び最大値まで切り詰められる(クランプされる)。
【0085】
離散的余弦変換(DCT)がサンプルを周波数ドメインに変換するために使用される。フォワード離散的余弦変換(FDCT)で変換器14により使用されるものが[数5]によって定義される。
【0086】
【数5】
【0087】
ここで成分サンプルsx , yはFDCTの計算に先立ってDCレベルシフトされていて、各サンプルから128を原産することによってゼロの周りにそれらの中心が来るようにしている。
【0088】
この画像の圧縮を解くために逆離散的余弦変換(IDCT)が逆離散的余弦変換器67によって使用され、この変換が[数6]で定義される。
【0089】
【数6】
【0090】
DCレベルシフトを戻すために、128が各サンプルsx , yにIDCTの計算の後で加えられる。
【0091】
量子化器16は次のように動作する。変換器16からの64のDCT係数の各々は量子化器16によって、量子化テーブル18内に記憶されている値を用いて量子化される。各係数についての量子化器ステップサイズSu,vが量子化テーブルからの対応する要素Qu,vに量子化係数を乗算した値から計算される。ここで乗数である係数はVA−マップ30によって定義された品質のレベルを表わしている。量子化テーブルは人間の眼の空間周波数感度を反映していて、経験的に求められる。二つの異なる量子化テーブルは一つがルミナンス成分(Y)についてであり、また一つがクロミナンス成分(CbとCr)についてのものである。一般に、クロミナンス係数の量子化のためのステップサイズはルミナンス係数のためのものよりも大きく、その理由は、人間の眼がルミナンスの誤差に対して、クロミナンスの誤差に対するよりも、敏感であることによる。
【0092】
量子化は[数7]により定義される。
【0093】
【数7】
【0094】
ここで因子qlはVA−マップ10によって定義される品質レベル因子である。この発明の実施例ではVA−マップは品質についての四つのレベルをサポートしていて、これが2ビットを用いて記憶されていて、これらのレベルが品質レベル因子を定義する適切な数に写像される。品質についての個々のレベルについての品質レベル因子は圧縮された画像ファイル内に記憶される。
【0095】
画像の解圧縮については、逆量子化関数が[数8]により与えられる。
【0096】
【数8】
【0097】
この発明の実施例では、ルミナンス係数についての量子化テーブルは表1で定義される。
【0098】
【表1】
【0099】
また、クロミナンス係数についての量子化テーブルは表2で定義される。
【0100】
【表2】
【0101】
量子化の後には、64の係数は数多くのゼロを含むことになり、とくに高い周波数係数についてはそれが言える。ゼロの長いシーケンスを作るためには、この64の係数は8×8マトリックスから64次元ベクトルzに変換されて、図9に模式的に示すように、ジグザグスキャナ22によってジグザグシーケンスに再順序付けされる。
【0102】
ジグザク走査(スキャニング)から生じたベクトルがゼロの長いシーケンスを含んでいることから、ランレングスコーデングがデータ量を減らすために使用される。
【0103】
このベクトル内の各値は二つの出力値であって、ランレベルコンビネーション(組合せ)と呼ばれているものにより表わされ、一つは先行するゼロの数を定義し、一つはゼロのシーケンスの後に続くゼロでない値のレベル(数値)を定義する。最後にランレングスエンコードした値に続くすべての値がそのベクトル内でゼロであれば、(0,0)である特別のランレングス組合せが使用される。この特殊組合せはブロックの終り(EOB,エンドオブブロック)組合せと呼ばれる。
【0104】
DCTの性質が原因となって、ベクトルの第一の要素は変換された画像データのDC係数となっている。このDC係数はAC係数とは違った取扱いを受ける。エンコードされることになる値は、前のDC項からの現在のDC項の差である。これがエンコードすべき数をより小さいものとして、これが後続のエントロピーコーデングにおけるデータ量を減らすのに役立つことになる。ランとレベルとについての二つの値は二つのアレイとしてランレングスエンコーダ24により出力される。二つのアレイはランレングスアレイ26とレベルアレイ28であって、これらは8×8ピクセルブロックのすべてが一旦処理されると、エントロピーエンコーダ50によって使用されて、データ量をさらに減らすようにする。
【0105】
レベルは[数9]によって計算される。
【0106】
【数9】
【0107】
また解圧縮のために、逆レベルエンコーデングが[数10]により計算される。
【0108】
【数10】
【0109】
ランレングスエンコーデングの例は次による。この例ではランレベル組合せは(r,l)と書かれ、ここでrはゼロのランレングスであり、またlはこのゼロに続くレベルである。
ランレングスエンデングについての入力レベルが、
{-126,26,43,2,2,1,1,0,0,0,1,0,0,-1,-1,0,0,0,0,0,…,0}(全部で64の値)であり、また先のDC項−119である。ランレングスエンコードしたデータはそこで次になる。
(0,-7),(0,26),(0,13),(0,2),(0,2),(0,1),(0,1),(3,1),(2,-1),(0,-1),(0,0)
二つの出力ベクトルは次のように見えることになる(グレイ値は前のブロックからの値である)
{…2,4,0,23,0,0,0,0,0,0,0,0,3,2,0,0,}(ランベクトル)
また、
{…-1,1,2,-1,0,-7,26,43,2,2,1,1,1,-1,-1,0}(レベルベクトル)。
【0110】
ランレングスエンコーデングの後で、ランベクトルとレベルベクトルとは組合されてエントロピーエンコーダによってエントロピイエンコードされることは図5bで前に示した通りである。これはピクセル当りのビット数を減らす。エントロピイエンコーデングは一番頻繁に発生するランレベル組合せについての修正されたHuffman(ハフマン)テーブルによって行なわれる。頻繁に発生する組合せを表わすのに使用されるコードについてのビット数が小さくなると、ラン・レベル組合せが発生する頻度は高くなる。画像ファイルサイズを最少に保つために、固定のテーブルが使用される。このテーブルは試験画像の大きな組から経験的に得られたものである。ある画像については、ダイナミック(動的)ハフマンコードテーブルがより小さなファイルサイズに導くことができるが、しかし大部分の場合にはこの発明のこの実施例で使用されるハフマンコートテーブルは一番小さなファイルサイズに導くものとなっている。
【0111】
ランレベル組合せは次のやり方を用いてエンコードされる:
エンコードのためにラン・レベル組合せについてハフマンコードテーブル内にエントリィがあるとすると、そのときはこのテーブルからのコードが使用される。正と負とのレベルをエンコードするために、符号ビットがテーブルから採用されたコードの先頭に置かれる;
・ある種のラン・レベル組合せについてハフマンテーブル内にエントリィがなければそのときは次の標準コーデングのやり方が使用されなければならない。
【0112】
標準コーデングは符号ビットを“1”に設定し、続いて二つの可能なエスケープ(ESC1,ESC2マーカ)の一つを設定することによって達成される。次の6ビットは符号なし二値コードとしてランレングスを表わし、また最後にレベルが続く。このレベルは符号付き二値コードとしてエンコードされることになる。もし、レベルが[−127,127]の中にあれば、ESC1マーカが使用されて、8ビットを用いてレベルがエンコードされる。もし、レベルが[−255,255]の中にあれば、ESC2マーカが使用されて、9ビットを用いてレベルがエンコードされる。この段階では、レベルは[−255,255]をはみ出すことができず、これが最大9ビットだけでレベルをエンコードするのに十分であるという理由となっている。事実上、係数の最大絶対値は200よりも小さいものとなることになる。
【0113】
最も普通のラン・レベル組合せについては、次の表3〜7で定義されるようなハフマンコードが使用される。このテーブルはランとレベルとで種分けされていて、エンコード用に使用できる。エンコーダはラン・レベル組合せを用いて対応するハフマンコードを一覧参照(ルックアップ)する。
【0114】
【表3】
【0115】
【表4】
【0116】
【表5】
【0117】
【表6】
【0118】
同じ情報が画像データをデコードするために使用されるる表3〜6はコードレングスによって種分けされている。この表はエントロピーデコーダ60(図6b)により使用され、このデコーダ60は受取ったコードとそのコードレングス(コード長)とを用いてラン・レベル組合せをルックアップする。
【0119】
【表7】
【0120】
【表8】
【0121】
【表9】
【0122】
【表10】
【0123】
ハフマンコードの若干のサンプルを表11に示す。
【0124】
【表11】
【0125】
この発明のこの実施例で使用される方法により圧縮された画像の全成分は下から上へまた左から右へ(ボトム・アップ・レフト・トウ・ライト)のやり方で処理される。これが意味することは、ある成分の第一のブロックが入力画像の下左隅にあり、次のブロックがその右にあるというふうにそのブロックラインの端まで進ということであり、次のブロックラインは前のブロックラインの上にあり、すべてのブロックラインは左で始まるということである。このプロセスは図10に示されている。
【0126】
各ブロックはエントロピーエンコーデングまでは個別に取扱われるのでブロックデータ流(ストリーム)を作ることの異なるやり方がたくさん存在する。すべての画像データを実際に受取る前に画像はデコードされる必要がないのでインターリーブがされていない構造が選ばれており、その理由はアルゴリズムを単純にすることと、処理時間を短縮することがあげられる。これが意味するところは、Y成分の全ブロックが先ず処理されて記憶され、それに続いてCb成分についての全ブロックが、そして最後にCr成分についての全ブロックが処理されて記憶されることである。進行形のデコード/エンコードがまた可能であり、後に記述される。結果のデータ流を図11に示す。
【0127】
この発明の方法に用いて圧縮された画像はこの実施例では次のようなファイルフォーマット(ここではVACIMGファイルと呼ぶ)で記憶される。
【0128】
この発明のこの実施例はビジュアルアテンションマップ(VA−マップ)を用いて画像を圧縮し、このマップが関心のある異なるレベルで圧縮すべき画像内の異なる領域を定義する。四つのレベルがこの実施例で使用されているが、もっとレベルあっても少いレベルでも望むところにより使用可能である。関心のある各レベルに対応する領域は各々がそれ自体の圧縮レートで圧縮され、これによって背景は画像の他の部分よりも高い圧縮率で(かつ低品質で)圧縮できるようになる。圧縮された画像はそこでファイル内に記憶され、このファイルも、VA−マップを含んでいる。高い圧縮率というのがこの発明のこの実施例の目標の一つであるから、画像についての情報は必要最小限がファイルに記憶される。画像についての一般的な情報のすべてが先ずファイルに来て、次にVA−マップが続き、それから圧縮された画像データがファイルに来る。画像についての一般的な情報はx及びy方向におけるサンプル数と、四つの可能なレベルのすべてについての品質のレベルとで構成されている。あるファイルがVACIMGファイルであるかどうかを応用が検出できるようにするために、ファイルシグネチャが一般的な画像情報の前部に挿入される。
【0129】
表12はVACIMG画像により使用されるファイルフォーマットの概要を与えている。
【0130】
【表12】
【0131】
すべてのバイトはバイト内の標準のウインドウズビットアラインメントを用いてファイルに書込まれる。このファイルは文字“V”,“A”,“C”,“I”,“M”及び“G”を表わしている6バイトで始まる。次にサンプル数、幅と高さとが続く。両方とも符号なしの16ビット整数として記憶される。最高位(最重要度)バイトが最初に来る。これに四つの品質レベルが続き、これらが符号なしの8ビット整数として記憶される。次にVA−マップが来て、このマップは関心のあるレベル(と、したがって、圧縮のレベル)を記憶する。VA−マップは8×8ピクセルブロックについて2ビットで表わされている。x及びy方向のブロック数は前記の式で与えられ、この式が使用されて、VA−マップにより使用されるバイト数が次のように計算される。すなわち、
k=bxYbyY/4
最後にすべての圧縮された画像データが続く。圧縮された画像データについて使用されたバイトの数はデコーダにとっては不知である。デコーダに与えられたすべてのバイトを使用して画像を再構築しなければならず、ファイルの終りに到達したときには自動的にデコードを終結させなければならない。
【0132】
VA−マップを用いることは、画像について進行形の(プログレッシブ)デコーデングを可能とし、この場合には画像の一番関心のある部分が先ずデコードされる。画像成分のDCT係数を記憶するために非インターリーブ構造を用いるのに代って、インターリーブした構造を用いることができ、それによってあるブロックを再構成するためのすべての情報がデータ流の中で一緒に接近するようにする。これが受信側にとって受取った画像を完全なファイルを受取る前に、解圧縮を開始して、組み上げることができるようにする。これはワールドワイドウエブ(WWW)、無線応用プロトコル(WAP)電話、あるいはビデオフォンにとってもいえることであるが、こういった技術にとって極めて有用となる。JPEGはすでに進行形のエンコーデングを提供しているが、ビジュアルアテンション(目視上注目)に基づいた画像圧縮を用いることから得ることができる利点が存在する。最も重要とされているブロック(レベル3のブロック)が最初におくられるようにでき、それにレベル2のブロック、レベル1のブロックが続き、最後に背景ブロック(レベル0のブロック)が続く。これが意味することは、受信側が画像の“メッセージ”をかなり早くに得て、受信者が十分な情報を受取ってしまうと、データ流を切断することを決意することもできるということである。大部分の応用では、画像はピクセルの固定シーケンスとして送られていて、例えば左下隅で始まってライン毎に上方へ画像が走査される。したがって、画像の“メッセージ”を得るためには、全体の画像が送られて再構成されるまで待たなければならないことになる。VA−マップを用いることは、重要なピクセルを先ず送り、それに続いて次に重要なピクセルをという順序で続くことができ、それによってメッセージを得るのに十分な情報があるところでデータ流を切断することができる。この技術はビデオ流の送りを、狭い帯域幅の網上で、妥当な品質で可能としている。とくに、ビデオフォンにとっては、この技術は多少の背景情報の損失を伴うものの低い帯域幅で画像を提供することになる。
【0133】
もし帯域幅が全体の画像を送るのに狭すぎるときにはデコーダとエンコーダとがいつでもブロックの送りを停止でき、このときは一番重要なブロックの送信だけが行なわれる。受信側で改良された画像を得るためには。全体の画像は背景もまた更新するために毎度しばしば送られねばならない。しかしながら、ほとんどのときには一番重要なブロックだけを置換すれば十分であり、新しいブロックで置換えできないときには前の画像の背景ブロックを用いることで足りる。
【0134】
また自動的にブロックをぼんやりさせることも可能であり、対象となるブロックはVA−マップ内での低いVAレベルが原因となって量子化が低いレベルでデコードされたものである。これはメモリや帯域幅のオーバーヘッド(計算機負荷)を伴わずにデコードされた画像の知覚上の品質を改善する。
【0135】
この発明の別な応用には設計と警告標識(例えば道路標識)の位置についての人間工学的な考慮を含んでいて、その目的とするところは標識を目立つように描くことであり、このことは試行錯誤のプロセスとしばしばなっているところであり、これが公衆にとって危険をその間に与えることがある。目視上の注目についての客観的な測度(言い換えれば、提案された環境の中にある、意図された観衆の視ている標識の中で標識とかあるいはその他の何かが主要な主体となっているかどうかを識別する測度)が設計プロセスを改良して、不十分な目立ち方の試験標識によって生ずる事故の危険を減らすことになる。他の識別たとえば広告のようなものと、インターネット“ウエブサイト”のような表示スクリーンの配置といったものの目視上のインパクトもまたこのプロセスを用いて最適化されて、特定の場所での注目度を最大のものとする。
【0136】
この発明はまた背景もしくは周辺の密度分布(ポピュレーション)からある点で異なっているオブジェクトを識別することもできる。例えば、癌にかかった細胞は周辺の健康な細胞内には存在しない特徴を有していることにより識別できる。眼によるこのような以上の識別は非常に労力を要するプロセスであり、その理由には多数のサンプルが調べられることと、癌細胞の比較的希有なこと(rarity)とが挙げられる。人間の観察者は眼にかかるひずみ(ストレイン,いわゆるストレス)と疲労との結果として注意が変えることが知られている。
【0137】
別な例として素粒子物理学者により使用される泡箱写真では、新しいしかも異常な粒子軌跡のパターンがこのプロセスによって識別できる。関心のある大部分の軌跡はこれまでに未発見の粒子で未知の性質をもつものによって生成されたものであるから、このようなサーチのためのテンプレートを工夫することは不可能である。
【0138】
他の例には、繊維製品等のテクスチャの目視的な提示における欠陥の客観的な検出であり、これが織物やマイクロチップ配置の製造プロセスについて、あるいは他のプロセスで表面欠陥が避けられないものの品質力保証を改善する。
【0139】
その他の応用では周囲と正号していないオブジェクトの存在の認識がセキュリティサーベイランス(安全調査)の分野で数多くの応用を有している。このような対象(オブジェクト)は保安要員が早くに注目しないとすると、重大な危害をもたらすことになる。同じように、衛星画像内に存在する異常なオブジェクトは生態系(エコロジー)の局所的変化とか有用な知的情報を顕在化できる。
【0140】
この発明はまた人間の視覚のモデルとして役立つものであり、いろいろな課題への応用をもち、この課題の中では人間の挙動性質を長くしかも経費を要する人間因子についての試行に代るものとしてエミュレートするのが必要とされている。
【0141】
この発明が応用を見出すことができる他の分野にはビデオ素材についての改善された描画が含まれ、ここでは知覚上重要な領域がより詳細に描画され、学生生徒の注目を集めるために教材を強調したり、高い注目をもつオブジェクトについての外形線をつけるように画像編集をしたりして、それにより切断されて例えば複合用に使用されるようにしたり、また鉄道、道路上の安全信号を、目視上注目されるレベルについての自動監視を介して、自動チェックすることが含まれている。
【図面の簡単な説明】
【図1】 プロセスを模式的に示す図。
【図2】 この発明による方法で処理されることになる画像を表わし、ピクセルxj,yjの二つの組についての比較プロセスを示す図(図2a)と、これらの画像について生成された異常値の写像を示す図(図2b)。
【図3】 この発明による方法で処理されることになる第二の画像を表わす図(図3a)、およびこれらの画像について生成された異常値の写像を示す図(図3b)。
【図4】 この発明を実行できる汎用計算機の基本的な部品を模式的に示す図。
【図5】 ともにこの発明による画像コーダを示す図(図5a、b)。
【図6】 ともにこの発明による画像デコーダを示す図(図6a、b、c)。
【図7】 4:1:1ダウンサンプリング技術を示す図。
【図8】 ある画像をブロックとブロックパッデングに分けることを示す図。
【図9】 ジグザグ走査を示す図。
【図10】 画像ボトムアップ及び左から右への処理を示す図。
【図11】 インターリーブされていないデータ流の例を示す図。
【図12】 処理速度を高めるために比較ピクセル群を選択する例を示す図。
Claims (8)
- ビジュアル画像を処理して、ビジュアル・アテンションの領域を識別する方法であって、
各ピクセルがピクセル値を有しているピクセルのアレイとして画像を記憶するステップと、
該アレイから試験ピクセルを選択するステップと、
各試験ピクセルについて、該試験ピクセルの近隣にあるピクセルの1つ以上の近隣グループを選択するステップと、
該アレイから比較ピクセルを選択するステップと、
選ばれた近隣グループのピクセルが該試験ピクセルに対してもっているのと同じそれぞれの位置関係を、該比較ピクセルに対してもっているとして、選ばれた比較ピクセルの近隣にあるピクセルのグループを識別するステップと、
該選ばれた近隣グループのピクセル値を、該識別されたグループのピクセル値と、所定の整合規準に従って比較するステップと、
各試験ピクセルについてのビジュアル・アテンションのメジャーを、比較結果が不整合となった試験ピクセルについて行なわれた比較の回数に依存して生成するステップとを備えた方法。 - 前記比較するステップは、更に、
各試験ピクセルについて、該試験ピクセルの近隣の該選ばれたピクセルの1つ以上が該比較ピクセルの近隣の対応するピクセルのピクセル値と実質的には同じでないピクセル値をもっているときには、異常値をインクレメントするステップを含み、
ビジュアル・アテンションのメジャーは、前記異常値に基づいて生成され、
前記方法は、更に、
比較ピクセルが選ばれるまで、同じ試験ピクセルを有する別の比較ピクセルを用いて繰り返して、これによってすべての選ばれたピクセルが試験ピクセルの近隣の該対応するピクセルと実質的に同じとなるピクセル値をもつことになり、この場合に別の近隣グループが選ばれて、処理が繰返されるステップを含む、請求項1記載の方法。 - 前記ピクセル値がカラー画像を表わしている三要素ベクトルである、請求項1または2記載の方
法。 - 高い異常値が生成されたサーチ規準についてのピクセル値を記憶し、かつ後続の試験ピクセルについて同じサーチ規準を選ぶステップを含んでいる、請求項1ないし3のいずれか1項に記載の方法。
- ビジュアルシーン内の重要な対象が一番大きな異常値をもつピクセルを含んでいる領域の識別によって識別される、請求項1ないし4のいずれか1項に記載の方法。
- ビジュアルシーン内の所与のオブジェクトに対して与えられるビジュアル・アテンションのメジャーが、そのオブジェクトを表わしているピクセルについて生成された異常値と、該シーンの他の部分について生成された異常値との比較によって判断される、請求項1ないし4のいずれか1項に記載の方法。
- 請求項1ないし6のいずれか1項により、画像を処理して、ビジュアル・アテンションの領域を位置決めするステップと、
ビジュアル・アテンションの位置決めされた領域に従り該画像を、ビジュアル・アテンションの高い領域をビジュアル・アテンションの低い領域を備えた該画像の領域よりもより高精度でコード化するようにコード化するステップとを備えた画像圧縮方法。 - ビジュアル画像もしくはこの種の画像のグループを処理して、ビジュアル・アテンションの領域を位置決めする装置であって、
各ピクセルがピクセル値を有しているピクセルのアレイとして画像を記憶する手段と、
該アレイから試験ピクセルを選択する手段と、
該試験ピクセルの近隣にあるピクセルについての近隣グループを選択する手段と、
該アレイから比較ピクセルを選択する手段と、
選ばれた近隣グループのピクセルが該試験ピクセルに対してもっているのと同じそれぞれの位置関係を、該比較ピクセルに対してもっているとして、選ばれた比較ピクセルの近隣にあるピクセルのグループを識別する手段と、
該選ばれた近隣グループのピクセル値を、該識別されたグループのピクセル値と、所定の整合規準に従って比較する手段と、
各試験ピクセルについてのビジュアル・アテンションのメジャーを、不整合グループを識別する比較の回数に依存して生成する手段とを備えた装置。
Applications Claiming Priority (5)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP00301262A EP1126411A1 (en) | 2000-02-17 | 2000-02-17 | Visual attention location system |
| EP00301262.2 | 2000-02-17 | ||
| EP00307771.6 | 2000-09-08 | ||
| EP00307771 | 2000-09-08 | ||
| PCT/GB2001/000504 WO2001061648A2 (en) | 2000-02-17 | 2001-02-08 | Visual attention location system |
Publications (3)
| Publication Number | Publication Date |
|---|---|
| JP2003523587A JP2003523587A (ja) | 2003-08-05 |
| JP2003523587A5 JP2003523587A5 (ja) | 2008-03-27 |
| JP4732660B2 true JP4732660B2 (ja) | 2011-07-27 |
Family
ID=26073010
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2001560954A Expired - Lifetime JP4732660B2 (ja) | 2000-02-17 | 2001-02-08 | ビジュアルアテンションシステム |
Country Status (8)
| Country | Link |
|---|---|
| US (1) | US6934415B2 (ja) |
| EP (1) | EP1281164B1 (ja) |
| JP (1) | JP4732660B2 (ja) |
| KR (1) | KR100821847B1 (ja) |
| CN (1) | CN1214349C (ja) |
| AU (1) | AU2001232029A1 (ja) |
| CA (1) | CA2400085C (ja) |
| WO (1) | WO2001061648A2 (ja) |
Families Citing this family (74)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2001061648A2 (en) * | 2000-02-17 | 2001-08-23 | British Telecommunications Public Limited Company | Visual attention location system |
| US20020154833A1 (en) * | 2001-03-08 | 2002-10-24 | Christof Koch | Computation of intrinsic perceptual saliency in visual environments, and applications |
| US6870956B2 (en) | 2001-06-14 | 2005-03-22 | Microsoft Corporation | Method and apparatus for shot detection |
| AU2003215755A1 (en) | 2002-03-22 | 2003-10-08 | British Telecommunications Public Limited Company | Comparing patterns |
| CA2478243C (en) | 2002-03-22 | 2012-07-24 | British Telecommunications Public Limited Company | Anomaly recognition |
| US7098117B2 (en) * | 2002-10-18 | 2006-08-29 | The Regents Of The University Of Michigan | Method of fabricating a package with substantially vertical feedthroughs for micromachined or MEMS devices |
| US20040088723A1 (en) * | 2002-11-01 | 2004-05-06 | Yu-Fei Ma | Systems and methods for generating a video summary |
| US7116716B2 (en) * | 2002-11-01 | 2006-10-03 | Microsoft Corporation | Systems and methods for generating a motion attention model |
| US7274741B2 (en) | 2002-11-01 | 2007-09-25 | Microsoft Corporation | Systems and methods for generating a comprehensive user attention model |
| US7130461B2 (en) * | 2002-12-18 | 2006-10-31 | Xerox Corporation | Systems and method for automatically choosing visual characteristics to highlight a target against a background |
| GB0229625D0 (en) | 2002-12-19 | 2003-01-22 | British Telecomm | Searching images |
| US7164798B2 (en) * | 2003-02-18 | 2007-01-16 | Microsoft Corporation | Learning-based automatic commercial content detection |
| US7260261B2 (en) * | 2003-02-20 | 2007-08-21 | Microsoft Corporation | Systems and methods for enhanced image adaptation |
| US7369167B2 (en) * | 2003-06-02 | 2008-05-06 | Micron Technology, Inc. | Photo diode ID for CMOS imagers |
| US7400761B2 (en) * | 2003-09-30 | 2008-07-15 | Microsoft Corporation | Contrast-based image attention analysis framework |
| US7471827B2 (en) | 2003-10-16 | 2008-12-30 | Microsoft Corporation | Automatic browsing path generation to present image areas with high attention value as a function of space and time |
| JP4396430B2 (ja) * | 2003-11-25 | 2010-01-13 | セイコーエプソン株式会社 | 視線誘導情報生成システムおよび視線誘導情報生成プログラム、並びに視線誘導情報生成方法 |
| AU2004233453B2 (en) * | 2003-12-03 | 2011-02-17 | Envysion, Inc. | Recording a sequence of images |
| GB0328326D0 (en) | 2003-12-05 | 2004-01-07 | British Telecomm | Image processing |
| JP4207883B2 (ja) * | 2004-03-24 | 2009-01-14 | セイコーエプソン株式会社 | 視線誘導度算出システム |
| US9053754B2 (en) * | 2004-07-28 | 2015-06-09 | Microsoft Technology Licensing, Llc | Thumbnail generation and presentation for recorded TV programs |
| US7986372B2 (en) * | 2004-08-02 | 2011-07-26 | Microsoft Corporation | Systems and methods for smart media content thumbnail extraction |
| CN101057172B (zh) * | 2004-09-03 | 2015-07-15 | 优卡西公司 | 用于改进视觉的系统和方法 |
| US7620249B2 (en) | 2004-09-17 | 2009-11-17 | British Telecommunications Public Limited Company | Analysis of patterns |
| US7562056B2 (en) * | 2004-10-12 | 2009-07-14 | Microsoft Corporation | Method and system for learning an attention model for an image |
| EP1732030A1 (en) | 2005-06-10 | 2006-12-13 | BRITISH TELECOMMUNICATIONS public limited company | Comparison of patterns |
| CN101248457B (zh) | 2005-07-28 | 2011-07-27 | 英国电讯有限公司 | 图像分析方法 |
| US7860180B2 (en) * | 2005-10-21 | 2010-12-28 | Amimon Ltd | OFDM modem for transmission of continuous complex numbers |
| US20070297612A1 (en) * | 2005-10-21 | 2007-12-27 | Meir Feder | Method, device and system of encrypted wireless communication |
| US8559525B2 (en) * | 2005-10-21 | 2013-10-15 | Amimon Ltd. | Apparatus and method for uncompressed, wireless transmission of video |
| EP1938624A4 (en) * | 2005-10-21 | 2009-10-28 | Amimon Ltd | APPARATUS AND METHOD FOR WIRELESS TRANSMISSION OF UNCOMPRESSED VIDEO |
| US7773813B2 (en) * | 2005-10-31 | 2010-08-10 | Microsoft Corporation | Capture-intention detection for video content analysis |
| US8180826B2 (en) | 2005-10-31 | 2012-05-15 | Microsoft Corporation | Media sharing and authoring on the web |
| US8196032B2 (en) * | 2005-11-01 | 2012-06-05 | Microsoft Corporation | Template-based multimedia authoring and sharing |
| EP1798961A1 (en) | 2005-12-19 | 2007-06-20 | BRITISH TELECOMMUNICATIONS public limited company | Method for focus control |
| US20070156382A1 (en) * | 2005-12-29 | 2007-07-05 | Graham James L Ii | Systems and methods for designing experiments |
| US7599918B2 (en) * | 2005-12-29 | 2009-10-06 | Microsoft Corporation | Dynamic search with implicit user intention mining |
| JP2007241479A (ja) * | 2006-03-06 | 2007-09-20 | Toshiba Corp | 変動領域検出装置及びその方法 |
| US7809170B2 (en) * | 2006-08-10 | 2010-10-05 | Louisiana Tech University Foundation, Inc. | Method and apparatus for choosing and evaluating sample size for biometric training process |
| TWI324326B (en) * | 2006-11-03 | 2010-05-01 | Univ Nat Taipei Technology | A mura defect detection algorithm for flat panel displays |
| US8132096B1 (en) * | 2007-03-26 | 2012-03-06 | Hewlett-Packard Development Company, L.P. | Image composition evaluation |
| US7940985B2 (en) * | 2007-06-06 | 2011-05-10 | Microsoft Corporation | Salient object detection |
| WO2009006546A2 (en) * | 2007-07-03 | 2009-01-08 | 3M Innovative Properties Company | System and method for assigning pieces of content to time-slots samples for measuring effects of the assigned content |
| WO2009006542A2 (en) * | 2007-07-03 | 2009-01-08 | 3M Innovative Properties Company | System and method for assessing effectiveness of communication content |
| EP2179393A4 (en) * | 2007-07-03 | 2012-05-30 | 3M Innovative Properties Co | SYSTEM AND METHOD FOR PRODUCING TIMELINE SAMPLES TO WHICH CONTENT MAY BE ASSIGNED, FOR MEASURING EFFECTS OF THE CONTENTS OF THE CONTENTS |
| EP2101503A1 (en) | 2008-03-11 | 2009-09-16 | British Telecommunications Public Limited Company | Video coding |
| US8326061B2 (en) * | 2008-05-12 | 2012-12-04 | Google Inc. | Fast visual degrading of images |
| WO2010039966A1 (en) * | 2008-10-03 | 2010-04-08 | 3M Innovative Properties Company | Systems and methods for optimizing a scene |
| AU2010203781B9 (en) * | 2009-01-07 | 2013-12-05 | 3M Innovative Properties Company | System and method for concurrently conducting cause-and-effect experiments on content effectiveness and adjusting content distribution to optimize business objectives |
| KR101584115B1 (ko) * | 2009-03-31 | 2016-01-12 | 삼성전자주식회사 | 시각적 관심맵 생성 장치 및 방법 |
| WO2011152893A1 (en) * | 2010-02-10 | 2011-12-08 | California Institute Of Technology | Methods and systems for generating saliency models through linear and/or nonlinear integration |
| US8542875B2 (en) | 2010-09-17 | 2013-09-24 | Honeywell International Inc. | Image processing based on visual attention and reduced search based generated regions of interest |
| US8977629B2 (en) * | 2011-05-24 | 2015-03-10 | Ebay Inc. | Image-based popularity prediction |
| US8504912B2 (en) * | 2011-07-15 | 2013-08-06 | Neodata Group S.R.L. | System to forecast performance of online news articles to suggest the optimal homepage layout to maximize article readership and readers stickiness |
| CN102568016B (zh) * | 2012-01-03 | 2013-12-25 | 西安电子科技大学 | 基于视觉注意的压缩感知图像目标重构方法 |
| US9042648B2 (en) * | 2012-02-23 | 2015-05-26 | Microsoft Technology Licensing, Llc | Salient object segmentation |
| US8705870B2 (en) | 2012-03-02 | 2014-04-22 | Microsoft Corporation | Image searching by approximate κ-NN graph |
| US9710493B2 (en) | 2013-03-08 | 2017-07-18 | Microsoft Technology Licensing, Llc | Approximate K-means via cluster closures |
| US9866900B2 (en) * | 2013-03-12 | 2018-01-09 | The Nielsen Company (Us), Llc | Methods, apparatus and articles of manufacture to detect shapes |
| US9128994B2 (en) * | 2013-03-14 | 2015-09-08 | Microsoft Technology Licensing, Llc | Visually representing queries of multi-source data |
| US10074034B2 (en) | 2013-06-14 | 2018-09-11 | Intel Corporation | Image processing including adjoin feature based object detection, and/or bilateral symmetric object segmentation |
| US9245192B2 (en) | 2013-09-20 | 2016-01-26 | Here Global B.V. | Ad collateral detection |
| US9373057B1 (en) | 2013-11-01 | 2016-06-21 | Google Inc. | Training a neural network to detect objects in images |
| US10026010B2 (en) | 2014-05-14 | 2018-07-17 | At&T Intellectual Property I, L.P. | Image quality estimation using a reference image portion |
| US12099357B1 (en) * | 2014-08-24 | 2024-09-24 | AI Incorporated | Method for robotic devices to authenticate users |
| EP3475785A4 (en) * | 2016-04-22 | 2020-05-13 | SZ DJI Technology Co., Ltd. | Systems and methods for processing image data based on region-of-interest (roi) of a user |
| US10776659B2 (en) | 2016-08-26 | 2020-09-15 | Goodrich Corporation | Systems and methods for compressing data |
| US10685432B2 (en) * | 2017-01-18 | 2020-06-16 | Ricoh Company, Ltd. | Information processing apparatus configured to determine whether an abnormality is present based on an integrated score, information processing method and recording medium |
| US10901726B2 (en) | 2018-10-12 | 2021-01-26 | International Business Machines Corporation | Intelligent visual regression system |
| US20200160089A1 (en) * | 2018-11-15 | 2020-05-21 | International Business Machines Corporation | Visual pattern recognition with selective illumination for assisted inspection |
| CN111079740A (zh) * | 2019-12-02 | 2020-04-28 | 咪咕文化科技有限公司 | 图像的质量评价方法、电子设备和计算机可读存储介质 |
| US20250272826A1 (en) * | 2022-04-18 | 2025-08-28 | Ai Qualisense 2021 Ltd | Similarity map-based outliers detection |
| CN115171328B (zh) * | 2022-06-30 | 2023-11-10 | 国网北京市电力公司 | 基于视频压缩编码的烟火识别方法、装置、设备及介质 |
| CN119559639B (zh) * | 2024-11-14 | 2025-10-14 | 电子科技大学 | 一种基于图的视觉注意编码方法 |
Family Cites Families (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5113454A (en) * | 1988-08-19 | 1992-05-12 | Kajaani Electronics Ltd. | Formation testing with digital image analysis |
| US5200820A (en) * | 1991-04-26 | 1993-04-06 | Bell Communications Research, Inc. | Block-matching motion estimator for video coder |
| JPH08248303A (ja) * | 1995-03-07 | 1996-09-27 | Minolta Co Ltd | 焦点検出装置 |
| JP3580670B2 (ja) * | 1997-06-10 | 2004-10-27 | 富士通株式会社 | 入力画像を基準画像に対応付ける方法、そのための装置、及びその方法を実現するプログラムを記憶した記憶媒体 |
| US6078680A (en) * | 1997-07-25 | 2000-06-20 | Arch Development Corporation | Method, apparatus, and storage medium for detection of nodules in biological tissue using wavelet snakes to characterize features in radiographic images |
| US6282317B1 (en) * | 1998-12-31 | 2001-08-28 | Eastman Kodak Company | Method for automatic determination of main subjects in photographic images |
| EP1126411A1 (en) | 2000-02-17 | 2001-08-22 | BRITISH TELECOMMUNICATIONS public limited company | Visual attention location system |
| WO2001061648A2 (en) * | 2000-02-17 | 2001-08-23 | British Telecommunications Public Limited Company | Visual attention location system |
-
2001
- 2001-02-08 WO PCT/GB2001/000504 patent/WO2001061648A2/en not_active Ceased
- 2001-02-08 EP EP01904110.2A patent/EP1281164B1/en not_active Expired - Lifetime
- 2001-02-08 CA CA002400085A patent/CA2400085C/en not_active Expired - Fee Related
- 2001-02-08 JP JP2001560954A patent/JP4732660B2/ja not_active Expired - Lifetime
- 2001-02-08 AU AU2001232029A patent/AU2001232029A1/en not_active Abandoned
- 2001-02-08 KR KR1020027010652A patent/KR100821847B1/ko not_active Expired - Lifetime
- 2001-02-08 CN CNB018051618A patent/CN1214349C/zh not_active Expired - Lifetime
- 2001-10-16 US US09/977,263 patent/US6934415B2/en not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| WO2001061648A2 (en) | 2001-08-23 |
| WO2001061648A3 (en) | 2002-03-21 |
| EP1281164A2 (en) | 2003-02-05 |
| CA2400085C (en) | 2008-02-19 |
| CN1430767A (zh) | 2003-07-16 |
| CN1214349C (zh) | 2005-08-10 |
| US20020081033A1 (en) | 2002-06-27 |
| KR20020075918A (ko) | 2002-10-07 |
| US6934415B2 (en) | 2005-08-23 |
| AU2001232029A1 (en) | 2001-08-27 |
| KR100821847B1 (ko) | 2008-04-11 |
| EP1281164B1 (en) | 2015-05-27 |
| JP2003523587A (ja) | 2003-08-05 |
| CA2400085A1 (en) | 2001-08-23 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP4732660B2 (ja) | ビジュアルアテンションシステム | |
| JP3373008B2 (ja) | 画像像域分離装置 | |
| TWI426774B (zh) | 用於針對jpeg壓縮歷史紀錄分類為壓縮影像的方法、及用於針對影像是否已經過jpeg壓縮而分類影像的設備及影像分類方法 | |
| JP2005141758A (ja) | Jpeg2000圧縮領域からの文書の検索及び類似度マッチングのための特徴を生成する方法、装置及び製造物品 | |
| JP2000508488A (ja) | ディジタル画像情報の多重解像度変換のシステム及び方法 | |
| KR20120003909A (ko) | 이미지 압축을 위한 시스템 및 방법 | |
| JP2002541738A (ja) | 画像圧縮 | |
| US20160241884A1 (en) | Selective perceptual masking via scale separation in the spatial and temporal domains for use in data compression with motion compensation | |
| KR102177247B1 (ko) | 조작 이미지 판별 장치 및 방법 | |
| Kumar et al. | Near lossless image compression using parallel fractal texture identification | |
| US20150326878A1 (en) | Selective perceptual masking via scale separation in the spatial and temporal domains using intrinsic images for use in data compression | |
| CN110930287A (zh) | 一种图像隐写检测方法、装置及计算机设备、存储介质 | |
| Wang et al. | Image representation using block pattern models and its image processing applications | |
| US7106908B2 (en) | Method and apparatus for selecting a format in which to re-encode a quantized image | |
| Simard et al. | A foreground-background separation algorithm for image compression | |
| EP0833518B1 (en) | Compression of image data with associated cost data | |
| Fahmy et al. | Texture characterization for joint compression and classification based on human perception in the wavelet domain | |
| Zhang et al. | Local binary pattern statistics feature for reduced reference image quality assessment | |
| CN121121426B (zh) | 一种jpeg压缩伪影学习模块及图像篡改检测系统 | |
| Osina et al. | Text detection algorithm on real scenes images and videos on the base of discrete cosine transform and convolutional neural network | |
| Bell et al. | Progressive technique for human face image archiving and retrieval | |
| JP4006276B2 (ja) | 画像認識方法、画像認識装置及びコンピュータプログラム | |
| Bell et al. | Progressive technique for human face image archiving and retrieval | |
| CN120658889A (zh) | 一种基于ai的图像及视频压缩系统 | |
| Tsai et al. | Content-based progressive transmission of 2-DGE images |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20080205 |
|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20080205 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20100413 |
|
| A601 | Written request for extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A601 Effective date: 20100709 |
|
| A602 | Written permission of extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A602 Effective date: 20100716 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20101013 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20110322 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20110421 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20140428 Year of fee payment: 3 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 Ref document number: 4732660 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| EXPY | Cancellation because of completion of term |
