JP2014010633A - 画像認識装置、画像認識方法、及び画像認識プログラム - Google Patents
画像認識装置、画像認識方法、及び画像認識プログラム Download PDFInfo
- Publication number
- JP2014010633A JP2014010633A JP2012146969A JP2012146969A JP2014010633A JP 2014010633 A JP2014010633 A JP 2014010633A JP 2012146969 A JP2012146969 A JP 2012146969A JP 2012146969 A JP2012146969 A JP 2012146969A JP 2014010633 A JP2014010633 A JP 2014010633A
- Authority
- JP
- Japan
- Prior art keywords
- image
- pixels
- feature amount
- pixel
- value
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000000034 method Methods 0.000 title claims description 86
- 238000012545 processing Methods 0.000 claims abstract description 65
- 238000004364 calculation method Methods 0.000 claims abstract description 30
- 230000008569 process Effects 0.000 claims description 40
- 230000004044 response Effects 0.000 claims description 36
- 230000010354 integration Effects 0.000 claims description 16
- 230000008859 change Effects 0.000 claims description 4
- 230000009467 reduction Effects 0.000 claims description 2
- 238000010586 diagram Methods 0.000 description 25
- 230000006870 function Effects 0.000 description 17
- 239000013598 vector Substances 0.000 description 16
- 238000003909 pattern recognition Methods 0.000 description 15
- 238000012986 modification Methods 0.000 description 14
- 230000004048 modification Effects 0.000 description 14
- 239000000284 extract Substances 0.000 description 5
- 238000012706 support-vector machine Methods 0.000 description 5
- 238000004422 calculation algorithm Methods 0.000 description 3
- 238000005516 engineering process Methods 0.000 description 3
- 230000003044 adaptive effect Effects 0.000 description 2
- 238000004891 communication Methods 0.000 description 2
- 238000004590 computer program Methods 0.000 description 2
- 230000003247 decreasing effect Effects 0.000 description 2
- 238000009826 distribution Methods 0.000 description 2
- 230000002093 peripheral effect Effects 0.000 description 2
- 239000007787 solid Substances 0.000 description 2
- 238000012935 Averaging Methods 0.000 description 1
- 230000001174 ascending effect Effects 0.000 description 1
- 238000013461 design Methods 0.000 description 1
- 238000001514 detection method Methods 0.000 description 1
- 238000006073 displacement reaction Methods 0.000 description 1
- 238000009499 grossing Methods 0.000 description 1
- 230000003449 preventive effect Effects 0.000 description 1
- 239000004065 semiconductor Substances 0.000 description 1
Landscapes
- Traffic Control Systems (AREA)
- Image Analysis (AREA)
Abstract
【課題】画像認識において認識精度を向上させる。
【解決手段】特徴量算出部は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出し、物体認識部は、特徴量算出部が算出した特徴量に基づいて目標物体を認識する。
【選択図】図2
【解決手段】特徴量算出部は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出し、物体認識部は、特徴量算出部が算出した特徴量に基づいて目標物体を認識する。
【選択図】図2
Description
本発明は、画像認識装置、画像認識方法、及び画像認識プログラムに関する。
本発明は、画像認識装置、画像認識方法、およびこれに用いるコンピュータプログラムに関し、特にターゲットとする物体の認識に用いられる装置、方法、及びこれに用いるコンピュータプログラムに関する。
近年、車両の運転支援装置や予防安全装置として、車間距離制御装置(ACC)や前方車両衝突警報装置、衝突回避・軽減装置等があり、車載カメラを備えた経済的な装置の普及が期待されている。車載カメラによる目標物体の認識には、パターン認識が用いられている。パターン認識では、認識させようとする目標物体の特徴量を予め学習し、学習によって得られた特徴量からなる辞書を生成する。生成した辞書を参照して、撮影した画像から目標物体の画像を認識する。
パターン認識の手法として、例えば、非特許文献1に示されるように輝度値に基づくHaar−like特徴量とAdaBoostの識別器を組み合わせて用いるアルゴリズムが提案されている。非特許文献1で提案されているアルゴリズムでは、信号値として輝度値を有する輝度画像から輝度値を空間的に積分した積分値を有する積分画像(インテグラルイメージ)を生成している。また、AdaBoostの識別器をカスケードに接続して演算処理の高速化が図られている。特許文献1には非特許文献1に記載のアルゴリズムを車載用カメラで撮影された画像に対する物体認識に応用した例が記載されている。
輝度値に基づく特徴量として、非特許文献2に記載のピクセル差分特徴量や非特許文献3に記載されているローカル・バイナリ・パターン(LBP、Local Binary Pattern)特徴量を用いることができる。ピクセル差分特徴量とは、互いに離れた任意の画素(ピクセル)間における輝度値の差分に基づく画像特徴量である。LBP特徴量とは、注目画素と、隣接する8個の隣接画素の各々の間の輝度値の大小関係を示す画像特徴量である。
輝度値に基づく特徴量として、非特許文献2に記載のピクセル差分特徴量や非特許文献3に記載されているローカル・バイナリ・パターン(LBP、Local Binary Pattern)特徴量を用いることができる。ピクセル差分特徴量とは、互いに離れた任意の画素(ピクセル)間における輝度値の差分に基づく画像特徴量である。LBP特徴量とは、注目画素と、隣接する8個の隣接画素の各々の間の輝度値の大小関係を示す画像特徴量である。
Paul Viola, Michael Jones、"Rapid Object Detection using a Boosted Cascade of Simple Features"、「Computer Vision and Pattern Recognition 2001」、IEEE Computer Society、8−14 December 2001、(1)、511−518
佐部浩太郎、日台健一、「ピクセル差分特徴を用いた実時間任意姿勢顔検出器の学習」、第10回画像センシングシンポジウム(SSII)発表予稿集、画像センシング技術研究会、2004、547−552
T.Ojala,Pietikainen,and D.Harwood、"A Comparative Study of Texture Measures with Classification Based on Feature Distributions"、Pattern Recognition、Elsevier、1996、vol.29、51−59
しかしながら、ピクセル差分特徴量は、2個の画素間の信号値に基づく特徴を示すのに対し、認識対象となる目標物体の画像において2個より多い複数の画素間で信号値の関連性を有することがある。LBP特徴量は、注目画素と当該注目画素に隣接する8個の隣接画素との間における信号値に基づく特徴を示す。しかし、LBP特徴量は、注目画素の信号値と、当該注目画素から隔てた任意の画素の信号値との関連性を示すことができない。そのため、ピクセル差分特徴量やLBP特徴量を用いても画像認識における認識精度が十分に向上することができなかった。
本発明は上記の点に鑑みてなされたものであり、画像認識において認識精度を向上させる。画像認識装置、画像認識方法、及び画像認識プログラムを提供する。
(1)本発明は上記の課題を解決するためになされたものであり、本発明の一態様は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する特徴量算出部と、前記特徴量算出部が算出した特徴量に基づいて目標物体を認識する物体認識部と、を備えることを特徴とする画像認識装置である。
(2)本発明のその他の態様は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する特徴量算出部と、前記特徴量算出部が算出した特徴量に基づいて目標物体を認識する物体認識部と、を備えることを特徴とする画像認識装置である。
(3)本発明のその他の態様は、上述の画像認識装置であって、前記特徴量は、前記大小関係を示す符号を前記第2の個数の画素の全てについて配列した符号列が示す値であることを特徴とする。
(4)本発明のその他の態様は、上述の画像認識装置であって、前記特徴量に対応付けて前記目標物体の確率を含むパターン情報を記憶しているパターン記憶部を備え、前記物体認識部は、前記特徴量算出部が算出した特徴量に基づいて前記パターン記憶部から読み出したパターン情報を用いて前記目標物体の尤度を示す応答値を算出することを特徴とする。
(5)本発明のその他の態様は、上述の画像認識装置であって、前記パターン記憶部には、前記特徴量に係る前記第2の個数を示す情報、及び前記基準画素ならびに前記第2の個数の参照画素それぞれの位置を示す情報が記憶されていることを特徴とする。
(6)本発明のその他の態様は、上述の画像認識装置であって、前記パターン情報に係る処理領域の大きさと、前記画像に対する処理領域の大きさが一致するように、前記パターン情報に係る処理領域の大きさ、前記画像に対する処理領域の大きさ、又は両方の大きさを変更するリサイズ部、を備えることを特徴とする。
(7)本発明のその他の態様は、上述の画像認識装置であって、前記基準画素の座標と前記第2の個数の参照画素の位置がそれぞれ一致するように、前記パターン情報に係る処理領域の大きさ、前記画像に対する処理領域の大きさ、又は当該大きさのいずれも変更するリサイズ部、を備えることを特徴とする。
(8)本発明のその他の態様は、上述の画像認識装置であって、前記リサイズ部は、前記画像から抽出された処理領域を複数の予め定めた比率でそれぞれ縮小した縮小処理領域の画像を生成し、前記生成した縮小処理領域の画像の中でその大きさが前記パターン情報に係る処理領域の大きさに等しい又は最も近似する縮小処理領域の画像を、大きさを変更した処理領域の画像として選択することを特徴とする。
(9)本発明のその他の態様は、上述の画像認識装置であって、前記特徴量算出部は、前記画像の画素毎の信号値を空間的に積分した積分値を画素毎に有する積分画像に対して、前記パターン情報における基準画素及び前記第2の個数の参照画素のそれぞれに対応する画素を含む領域の頂点における積分値に基づいて当該領域における信号値の総和を各々算出し、各々算出した総和を前記画像に対する基準画素及び前記第2の個数の参照画素毎の信号値として前記特徴量を算出することを特徴とする。
(10)本発明のその他の態様は、画像認識装置における画像認識方法であって、前記画像認識装置は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の過程と、前記画像認識装置は、前記第1の過程において算出した特徴量に基づいて目標物体を認識する第2の過程と、を有することを特徴とする画像認識方法である。
(11)本発明のその他の態様は、画像認識装置における画像認識方法であって、前記画像認識装置は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の過程と、前記画像認識装置は、前記第1の過程において算出した特徴量に基づいて目標物体を認識する第2の過程と、を有することを特徴とする画像認識方法である。
(12)本発明のその他の態様は、画像認識装置のコンピュータに、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の手順、前記第1の手順において算出した特徴量に基づいて目標物体を認識する第2の手順、を実行させるための画像認識プログラムである。
(13)本発明のその他の態様は、画像認識装置のコンピュータに、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の手順、前記第1の手順において算出した特徴量に基づいて目標物体を認識する第2の手順、を実行させることを特徴とする画像認識プログラムである。
本発明によれば、画像認識において認識精度を向上させることができる。
[用語の説明]
本願において、矩形とは、長方形ばかりではなく、正方形も含む。
本願において、勾配強度とは、画像における輝度の空間的な変化の度合いを示す係数である。勾配強度として、勾配強度を示す値よりも情報量が低減された勾配度数を用いてもよい。本願では、勾配強度と勾配度数を含む、広義の勾配値を勾配量と呼ぶ。
本願において、積分勾配画像は、画像の輝度について勾配方向と勾配強度(または、度数)を算出して、それぞれの勾配方向毎に勾配強度(または、度数)を積分した結果(積分勾配値)を示す画像である。この積分は、例えば、積分勾配画像を求める対象となる領域に含まれる全ての画素について行われる。
識別器として、例えば、AdaBoostの識別器、Real AdaBoost識別器、SVM(Support Vector Machine)の識別器等の画像のパターン認識に係る処理を行う識別器を用いてもよい。
識別器の下位概念として、アンサンブル学習を行う識別器があり、その下位概念として、Boostingの識別器があり、さらにBoostingの識別器の下位概念として、AdaBoostの識別器等がある。さらにAdaBoostの識別器の下位概念としてReal AdaBoostの識別器等がある。
Boostingとは、学習サンプル毎に複数の弱識別器を用いてアンサンブル学習する統計的学習手法のことである。AdaBoostとは、Boostingにおいて、学習に用いる学習サンプルに対し、正しく識別した学習サンプルに対して重みを増加させるように適応的に更新する。AdaBoostの識別器は、弱識別器からの応答値を重み付き平均して最終的な応答値を得る。Real AdaBoostとは、AdaBoostにおいて、弱識別器からの応答値を学習サンプルの特徴量の分布に基づいて実数化する統計的学習手法である。Real AdaBoostの識別器は、識別対象データの特徴量に応じた分布値(確率密度、ヒストグラム、等)に基づいて弱識別器毎に応答値を算出する。
本願において、矩形とは、長方形ばかりではなく、正方形も含む。
本願において、勾配強度とは、画像における輝度の空間的な変化の度合いを示す係数である。勾配強度として、勾配強度を示す値よりも情報量が低減された勾配度数を用いてもよい。本願では、勾配強度と勾配度数を含む、広義の勾配値を勾配量と呼ぶ。
本願において、積分勾配画像は、画像の輝度について勾配方向と勾配強度(または、度数)を算出して、それぞれの勾配方向毎に勾配強度(または、度数)を積分した結果(積分勾配値)を示す画像である。この積分は、例えば、積分勾配画像を求める対象となる領域に含まれる全ての画素について行われる。
識別器として、例えば、AdaBoostの識別器、Real AdaBoost識別器、SVM(Support Vector Machine)の識別器等の画像のパターン認識に係る処理を行う識別器を用いてもよい。
識別器の下位概念として、アンサンブル学習を行う識別器があり、その下位概念として、Boostingの識別器があり、さらにBoostingの識別器の下位概念として、AdaBoostの識別器等がある。さらにAdaBoostの識別器の下位概念としてReal AdaBoostの識別器等がある。
Boostingとは、学習サンプル毎に複数の弱識別器を用いてアンサンブル学習する統計的学習手法のことである。AdaBoostとは、Boostingにおいて、学習に用いる学習サンプルに対し、正しく識別した学習サンプルに対して重みを増加させるように適応的に更新する。AdaBoostの識別器は、弱識別器からの応答値を重み付き平均して最終的な応答値を得る。Real AdaBoostとは、AdaBoostにおいて、弱識別器からの応答値を学習サンプルの特徴量の分布に基づいて実数化する統計的学習手法である。Real AdaBoostの識別器は、識別対象データの特徴量に応じた分布値(確率密度、ヒストグラム、等)に基づいて弱識別器毎に応答値を算出する。
(本発明の実施形態)
以下、図面を参照しながら本発明の実施形態について説明する。
本実施形態では、車両に搭載される車載用の画像認識システムを例にとって説明する。
図1は、本実施形態に係る画像認識システムの構成を示す概略図である。
本画像認識システムは、カメラECU(Electronic Control Unit)1、警報装置2、ACC(Adaptive Cruise Control、適応巡行制御、車間距離制御ともいう)−ECU3、及び衝突回避制御−ECU4を備える。
カメラECU1は、画像認識装置の1つの態様である。カメラECU1は、カメラ11、画像取得部12、物体認識部13、及び制御部14を含んで構成される。
以下、図面を参照しながら本発明の実施形態について説明する。
本実施形態では、車両に搭載される車載用の画像認識システムを例にとって説明する。
図1は、本実施形態に係る画像認識システムの構成を示す概略図である。
本画像認識システムは、カメラECU(Electronic Control Unit)1、警報装置2、ACC(Adaptive Cruise Control、適応巡行制御、車間距離制御ともいう)−ECU3、及び衝突回避制御−ECU4を備える。
カメラECU1は、画像認識装置の1つの態様である。カメラECU1は、カメラ11、画像取得部12、物体認識部13、及び制御部14を含んで構成される。
カメラ11は、車両に設置され、予め定めた方向、例えばその車両の前方、左側方、右側方、又は後方の画像を撮影する。カメラ11は、撮影した画像を示す画像信号を画像取得部12に出力する。
画像取得部12は、カメラ11から画像信号を取り込み、取り込んだ画像信号を物体認識部13に出力する。
画像取得部12は、カメラ11から画像信号を取り込み、取り込んだ画像信号を物体認識部13に出力する。
物体認識部13は、画像取得部12から入力された画像信号に対して物体認識のための画像処理及びパターン認識に係る処理を行い、パターン認識の結果を示す認識データを制御部14に出力する。この画像処理は、例えば、後述するラスタスキャン、積分画像の生成である。認識データは、例えば、入力された画像信号が示す画像内の目標物体に係るデータ(目標物体それぞれの種別、位置、等)である。
物体認識部13は、FPGA(Field Programmable Gate Array)21の機能と、マイクロコンピュータ22の機能を用いて構成される。物体認識部13は、FPGA21の機能の代わりに、又はFPGA21の機能とともにDSP(Digital Signal Processor)の機能が用いられていてもよい。
物体認識部13は、FPGA(Field Programmable Gate Array)21の機能と、マイクロコンピュータ22の機能を用いて構成される。物体認識部13は、FPGA21の機能の代わりに、又はFPGA21の機能とともにDSP(Digital Signal Processor)の機能が用いられていてもよい。
制御部14は、物体認識部13から入力された認識データに基づいて予め定められた処理を行い、その処理結果を示す処理データを警報装置2、ACC−ECU3及び衝突回避制御−ECU4に出力する。予め定めた処理として、目標物体との間のTTC(Time to Collision、到達時間)や距離を算出する処理、目標物体を追跡する処理がある。制御部14は、他の装置やECU(図1に示す例では、警報装置2、ACC−ECU3又は衝突回避制御−ECU4)で実行されているアプリケーション機能との間でデータを入力又は出力する。
制御部14は、マイクロコンピュータ22の機能を用いて構成される。制御部14は、マイクロコンピュータ22の機能の代わりにCPU(Central Processing Unit)の機能が用いられてもよい。
制御部14は、マイクロコンピュータ22の機能を用いて構成される。制御部14は、マイクロコンピュータ22の機能の代わりにCPU(Central Processing Unit)の機能が用いられてもよい。
物体認識部13及び制御部14のメモリ23及び周辺回路は、FPGA21もしくはDSP、マイクロコンピュータ22もしくはCPUのうち少なくともいずれかの集積回路に格納されているものであってもよいし、それらの外部に設けられているものであってもよい。
物体認識部13及び制御部14において、FPGA21もしくはDSP、マイクロコンピュータ22もしくはCPUといったデバイスの個数は、各々1個に限られず1個より多い任意の数でよい。また、それらのデバイスの全てが、物体認識部13及び制御部14として用いられていてもよいし、それらのデバイスのうち任意の個数、例えば1個又は2個が用いられていてもよい。
メモリ23は、物体認識部13や制御部14が行った処理によって生成されたデータや、 目標物体のパターン認識に用いるパターン情報(例えば、辞書データ)を目標物体毎に記憶している。
物体認識部13及び制御部14において、FPGA21もしくはDSP、マイクロコンピュータ22もしくはCPUといったデバイスの個数は、各々1個に限られず1個より多い任意の数でよい。また、それらのデバイスの全てが、物体認識部13及び制御部14として用いられていてもよいし、それらのデバイスのうち任意の個数、例えば1個又は2個が用いられていてもよい。
メモリ23は、物体認識部13や制御部14が行った処理によって生成されたデータや、 目標物体のパターン認識に用いるパターン情報(例えば、辞書データ)を目標物体毎に記憶している。
警報装置2、ACC−ECU3及び衝突回避制御−ECU4は、制御部14とデータを入力又は出力して、それぞれのアプリケーション機能を実行する。
警報装置2は、制御部14から入力されるデータに基づいて、利用者に注意を促すための情報を提示する。例えば、認識された目標物体が前方の車両である場合、その情報は前方車両衝突警報である。目標物体が歩行者である場合、その情報は歩行者衝突警報である。前方車両衝突警報とは、その前方の車両に接触又は衝突する可能性が高いことを示す情報である。また、歩行者衝突警報とは、歩行者に接触又は衝突する可能性が高いことを示す情報である。
警報装置2は、制御部14から入力されるデータに基づいて、利用者に注意を促すための情報を提示する。例えば、認識された目標物体が前方の車両である場合、その情報は前方車両衝突警報である。目標物体が歩行者である場合、その情報は歩行者衝突警報である。前方車両衝突警報とは、その前方の車両に接触又は衝突する可能性が高いことを示す情報である。また、歩行者衝突警報とは、歩行者に接触又は衝突する可能性が高いことを示す情報である。
ACC−ECU3は、制御部14から入力されるデータに基づいて、例えば、目標物体が前方の車両である場合、車間距離制御を行う。車間距離制御には、例えば、その前方の車両との距離を一定に保つようにエンジンの出力を増加又は減少させる制御や、ブレーキの動作を開始又は停止する制御がある。
衝突回避制御−ECU4は、制御部14から入力されるデータに基づいて、例えば、目標物体に対する衝突回避制御を行う。衝突回避制御には、例えば、目標物体との距離が予め定めた距離よりも減少した場合、エンジンの出力を減少させる制御、又はその制御とともにブレーキの動作を開始させる制御がある。
衝突回避制御−ECU4は、制御部14から入力されるデータに基づいて、例えば、目標物体に対する衝突回避制御を行う。衝突回避制御には、例えば、目標物体との距離が予め定めた距離よりも減少した場合、エンジンの出力を減少させる制御、又はその制御とともにブレーキの動作を開始させる制御がある。
(画像認識処理の基本的態様)
次に、本実施形態に係る画像認識処理の基本的な態様について説明する。
物体認識部13は、画像探索部、リサイズ部、特徴量算出部及び画像識別部(いずれも図示せず)を含んで構成される。画像探索部が以下のステップS101、S105を、リサイズ部がステップS102を、特徴量算出部がステップS103を、画像識別部がS104、S106を実行する。
次に、本実施形態に係る画像認識処理の基本的な態様について説明する。
物体認識部13は、画像探索部、リサイズ部、特徴量算出部及び画像識別部(いずれも図示せず)を含んで構成される。画像探索部が以下のステップS101、S105を、リサイズ部がステップS102を、特徴量算出部がステップS103を、画像識別部がS104、S106を実行する。
図2は、本実施形態に係る画像認識処理を示すフローチャートである。
(ステップS101)画像探索部は、画像取得部12から入力された画像(以下、入力画像と呼ぶ)から目標物体の画像を示す領域を探索(ラスタスキャン)する。ここで、1フレームの画像が予め定めた時間(フレーム時刻)毎に入力されるが、現フレームとは現在処理対象となるフレームである。画像探索部は、探索において現フレームの画像から予め定めた大きさ(スケール)の領域の画像を抽出する。この予め定めたスケールの領域をウィンドウ(検出窓)という。ラスタスキャンの一環として、画像探索部は、ウィンドウの位置を予め定めた変位量(移動ステップ幅)だけ変位させ、変位させたウィンドウに含まれる画像を抽出する。抽出した画像をウィンドウ画像と呼ぶ。但し、処理開始時において、画像探索部は、ウィンドウの位置を予め定めた初期位置(例えば、画像フレームの左上端)に定める。その後、ステップS102に進む。
(ステップS101)画像探索部は、画像取得部12から入力された画像(以下、入力画像と呼ぶ)から目標物体の画像を示す領域を探索(ラスタスキャン)する。ここで、1フレームの画像が予め定めた時間(フレーム時刻)毎に入力されるが、現フレームとは現在処理対象となるフレームである。画像探索部は、探索において現フレームの画像から予め定めた大きさ(スケール)の領域の画像を抽出する。この予め定めたスケールの領域をウィンドウ(検出窓)という。ラスタスキャンの一環として、画像探索部は、ウィンドウの位置を予め定めた変位量(移動ステップ幅)だけ変位させ、変位させたウィンドウに含まれる画像を抽出する。抽出した画像をウィンドウ画像と呼ぶ。但し、処理開始時において、画像探索部は、ウィンドウの位置を予め定めた初期位置(例えば、画像フレームの左上端)に定める。その後、ステップS102に進む。
(ステップS102)リサイズ部は、画像探索部が位置を定めたウィンドウのスケールとメモリ23に記憶されたパターン情報に係る目標物体の画像のスケールが一致するか否かを判断する。一致しないと判断された場合には、両者が一致するように、ウィンドウ画像のスケール、パターン情報に係る目標物体の画像のスケール又は、その両者のスケールを変更(リサイズ)する。リサイズに係る処理については後述する。その後、ステップS103に進む。
(ステップS103)特徴量算出部は、画像探索部が抽出したウィンドウ画像又はリサイズ部がリサイズしたウィンドウ画像に基づいて所定の特徴量を算出する。本明細書では、この特徴量をCBP(Constellation Binary Pattern、コンステレイション・バイナリ・パターン、配置点二値パターン)特徴量と呼ぶ。CBP特徴量は、予め定めた個数(画素数)の画素からなる画像ブロック毎に算出される特徴量である。1つのウィンドウには、予め定めた数(画像ブロック数)の画像ブロックが含まれる。特徴量算出部は、ブロック毎のCBP特徴量を要素値として有する特徴量ベクトル(CBP特徴量ベクトル)を算出する。つまり、特徴量ベクトルの次元数は、1つのウィンドウに含まれる画像ブロックの数になる。CBP特徴量については後述する。その後、ステップS104に進む。
(ステップS104)画像識別部は、特徴量算出部が算出した特徴量ベクトルに基づいてパターン認識処理を行って目標物体を識別する。パターン認識処理を行う構成として、画像識別部は、例えば、AdaBoost識別器を用いる。AdaBoost識別器を用いたパターン認識処理については、後述する。その後、ステップS105に進む。
(ステップS105)画像探索部は、現フレームの画像についてラスタスキャンが終了したか否かを判断する。画像探索部は、例えば、現フレームの画像において未処理の領域がある場合、つまりウィンドウが予め定めた最終位置(画像フレームの右下端)に到達していない場合、ラスタスキャンが終了していないと判断する。画像探索部は、例えば、現フレームの画像において未処理の領域がない場合、つまりウィンドウが予め定めた最終位置に到達したとき、ラスタスキャンが終了したと判断する。ラスタスキャンが終了したと判断された場合、(ステップS105 YES)、ステップS106に進む。ラスタスキャンが終了していないと判断された場合、(ステップS105 NO)、ステップS101に進む。
(ステップS106)画像識別部は、識別された目標物体の画像を示すウィンドウについてクラスタリングを行う。クラスタリングとは、同種の目標物体の画像を示すウィンドウのうち、例えば、予め定められた範囲の位置及びスケールをもつウィンドウのグループに分類することである。画像識別部は、1つのグループに分類されたウィンドウが複数ある場合には、そのグループに係る目標物体の画像を示す1個のウィンドウを算出する。その1個のウィンドウを算出する際、画像識別部は、例えば、そのグループに分類された複数のウィンドウそれぞれの位置の重心点及びそれぞれのスケールの平均値をとる。その後、処理を終了する。
(CBP特徴量)
次に、本実施形態に係るCBP特徴量について説明する。
CBP特徴量は、a個(第1の個数)の画素からなる画像ブロックに含まれる1個の基準画素の信号値と、そのブロックに含まれるb個(第2の個数)の参照画素それぞれの信号値に基づいて定められる特徴量である。aは、2よりも大きい予め定められた第1の整数である。bは、aよりも小さい整数であって、予め定められた1又は1よりも大きい第2の整数である。基準画素と参照画素を併せて配置点(コンステレーション、constellation)と総称する。
CBP特徴量は、各参照画素の信号値と基準画素の大小関係を二値(例えば、1又は0)で示したb個のビット(相対ビット)の全てを一連に配列して得られる相対ビット列、又はその相対ビット列が示す数値である。
次に、本実施形態に係るCBP特徴量について説明する。
CBP特徴量は、a個(第1の個数)の画素からなる画像ブロックに含まれる1個の基準画素の信号値と、そのブロックに含まれるb個(第2の個数)の参照画素それぞれの信号値に基づいて定められる特徴量である。aは、2よりも大きい予め定められた第1の整数である。bは、aよりも小さい整数であって、予め定められた1又は1よりも大きい第2の整数である。基準画素と参照画素を併せて配置点(コンステレーション、constellation)と総称する。
CBP特徴量は、各参照画素の信号値と基準画素の大小関係を二値(例えば、1又は0)で示したb個のビット(相対ビット)の全てを一連に配列して得られる相対ビット列、又はその相対ビット列が示す数値である。
ここで、CBP特徴量の具体例について説明する。
図3は、画像ブロックの一例(画像ブロック31)を示す図である。
図3において、画像ブロック31に含まれる破線の四角形p0は基準画素を示し、3個の実線の四角形p1〜p3のそれぞれは参照画素を示す。
図4は、基準画素と参照画素の信号値の一例を示す概念図である。
図4において、破線の四角形p0に囲まれる数値は、基準画素p0の信号値が189であることを示す。実線の四角形p1〜p3にそれぞれ囲まれる数値は、参照画素p1、p2、p3の信号値がそれぞれ85、205、112であることを示す。破線の四角形p0と実線の四角形p1〜p3のそれぞれとの間の両矢印は、基準画素p0の信号値と参照画素p1〜p3の信号値それぞれの信号値との間で大小関係が判断されることを示す。図4が示す信号値は、画素毎の輝度値である。
図3は、画像ブロックの一例(画像ブロック31)を示す図である。
図3において、画像ブロック31に含まれる破線の四角形p0は基準画素を示し、3個の実線の四角形p1〜p3のそれぞれは参照画素を示す。
図4は、基準画素と参照画素の信号値の一例を示す概念図である。
図4において、破線の四角形p0に囲まれる数値は、基準画素p0の信号値が189であることを示す。実線の四角形p1〜p3にそれぞれ囲まれる数値は、参照画素p1、p2、p3の信号値がそれぞれ85、205、112であることを示す。破線の四角形p0と実線の四角形p1〜p3のそれぞれとの間の両矢印は、基準画素p0の信号値と参照画素p1〜p3の信号値それぞれの信号値との間で大小関係が判断されることを示す。図4が示す信号値は、画素毎の輝度値である。
図5は、各参照画素の相対ビットとCBP特徴量の一例を示す概念図である。
図5において、破線の四角形p0に囲まれるthは、基準画素p0の信号値が基準値(閾値、threshold)であって、この基準値と各参照画素の信号値との大小関係が判定されることを示す。実線の四角形p1、p2、p3にそれぞれ囲まれる数値0、1、0は、それぞれ基準画素p1、p2、p3に対応する相対ビットが0、1、0であることを示す。ここで、相対ビットが1とは、参照画素の信号値が、基準画素の信号値と等しいか、その基準画素の信号値よりも大きいことを示す。相対ビットが0とは、参照画素の信号値が、基準画素の信号値よりも小さいことを示す。図5の下段の右向きのブロック矢印は、3個の参照画素p1、p2、p3にそれぞれ対応する相対ビット0、1、0を順に配列して、CBP特徴量010を算出することを示す。
図5において、破線の四角形p0に囲まれるthは、基準画素p0の信号値が基準値(閾値、threshold)であって、この基準値と各参照画素の信号値との大小関係が判定されることを示す。実線の四角形p1、p2、p3にそれぞれ囲まれる数値0、1、0は、それぞれ基準画素p1、p2、p3に対応する相対ビットが0、1、0であることを示す。ここで、相対ビットが1とは、参照画素の信号値が、基準画素の信号値と等しいか、その基準画素の信号値よりも大きいことを示す。相対ビットが0とは、参照画素の信号値が、基準画素の信号値よりも小さいことを示す。図5の下段の右向きのブロック矢印は、3個の参照画素p1、p2、p3にそれぞれ対応する相対ビット0、1、0を順に配列して、CBP特徴量010を算出することを示す。
図6は、画像ブロックの他の例(画像ブロック32)を示す図である。
図6において、画像ブロック32に含まれる破線の四角形p0は基準画素を示し、8個の実線の四角形p1〜p8のそれぞれは参照画素を示す。
図7は、基準画素と参照画素の信号値の他の例を示す概念図である。
図7において、破線の四角形p0に囲まれる数値は、基準画素p0の信号値が189であることを示す。実線の四角形p1〜p8にそれぞれ囲まれる数値は、参照画素p1〜p8の信号値がそれぞれ85、205、112、101、213、73、99、191であることを示す。破線の四角形p0と実線の四角形p1〜p8のそれぞれとの間の両矢印は、基準画素p0の信号値と参照画素p1〜p8の信号値それぞれの信号値との間で大小関係が判断されることを示す。また、図7が示す信号値は、画素毎の輝度値である。
図6において、画像ブロック32に含まれる破線の四角形p0は基準画素を示し、8個の実線の四角形p1〜p8のそれぞれは参照画素を示す。
図7は、基準画素と参照画素の信号値の他の例を示す概念図である。
図7において、破線の四角形p0に囲まれる数値は、基準画素p0の信号値が189であることを示す。実線の四角形p1〜p8にそれぞれ囲まれる数値は、参照画素p1〜p8の信号値がそれぞれ85、205、112、101、213、73、99、191であることを示す。破線の四角形p0と実線の四角形p1〜p8のそれぞれとの間の両矢印は、基準画素p0の信号値と参照画素p1〜p8の信号値それぞれの信号値との間で大小関係が判断されることを示す。また、図7が示す信号値は、画素毎の輝度値である。
図8は、各参照画素の相対ビットとCBP特徴量の他の例を示す概念図である。
図8において、破線の四角形p0に囲まれるthは、基準画素p0の信号値が基準値であって、この基準値と各参照画素の信号値との大小関係が判定されることを示す。実線の四角形p1〜p8にそれぞれ囲まれる数値0、1、0、0、1、0、0、1は、それぞれ参照画素p1〜p8に対応する相対ビットが0、1、0、0、1、0、0、1であることを示す。図8の下段の右向きのブロック矢印は、8個の参照画素p1〜p8にそれぞれ対応する相対ビット0、1、0、0、1、0、0、1を順に配列して、CBP特徴量01001001を算出することを示す。
図8において、破線の四角形p0に囲まれるthは、基準画素p0の信号値が基準値であって、この基準値と各参照画素の信号値との大小関係が判定されることを示す。実線の四角形p1〜p8にそれぞれ囲まれる数値0、1、0、0、1、0、0、1は、それぞれ参照画素p1〜p8に対応する相対ビットが0、1、0、0、1、0、0、1であることを示す。図8の下段の右向きのブロック矢印は、8個の参照画素p1〜p8にそれぞれ対応する相対ビット0、1、0、0、1、0、0、1を順に配列して、CBP特徴量01001001を算出することを示す。
CBP特徴量は、上述のように二値化された相対ビットの配列である相対ビット列を2進数のままで表されるようにしてもよいし、その相対ビット列が示す数値、例えば8進数、10進数、16進数等であってもよい。例えば、図5の2進数で表されたCBP特徴量010を、8進数、10進数、16進数で、いずれも2と表してもよい。図8に示す2進数で表されたCBP特徴量01001001を、8進数、10進数、16進数で、それぞれ111、73、49と表してもよい。
なお、特徴量算出部は、大小関係を判定する際、上述のように参照画素の信号値が基準画素の信号値と等しい場合に相対ビットを1と定めるのではなく、相対ビットを0と定めるようにしてもよい。
なお、特徴量算出部は、大小関係を判定する際、上述のように参照画素の信号値が基準画素の信号値と等しい場合に相対ビットを1と定めるのではなく、相対ビットを0と定めるようにしてもよい。
また、上述のように、信号値が画素毎の輝度値である場合に限らず、他の種類の信号値、例えば、カラー画像の色空間モデルにおける色及び明るさを示す成分毎の色空間値であってもよい。例えば、RGB色空間モデルにおける、各色、つまり赤(R、Red)、緑(G、Green)、青(B、Blue)のそれぞれの色空間値(輝度)であってもよい。また、HSV色空間モデルにおける、各色空間、つまり色相(H、Hue)、彩度(S、Saturation Chroma)、明度(V、Brightness Lightness Value)のそれぞれの色空間値であってもよい。
その他、CBP特徴量を算出するための信号値は、勾配方向毎の勾配強度値、等であってもよい。
その他、CBP特徴量を算出するための信号値は、勾配方向毎の勾配強度値、等であってもよい。
CBP特徴量には、大きく分けて次の2つの形態I、IIがある。
形態Iは、b個の参照画素のうち少なくとも1個の参照画素が基準画素とは隣接せず、基準画素から少なくとも1画素隔てた位置にある場合に算出される相対ビット列である。図5、図8に示すCBP特徴量は、いずれも形態IのCBP特徴量である。
形態IIは、b個の参照画素がいずれも基準画素に隣接する全8個の隣接画素のうちの一部の隣接画素である場合に算出される相対ビット列である。この場合、bは1又は1よりも大きく8よりも小さい整数である。従って、形態IのCBP特徴量も、形態IIのCBP特徴量も、LBP特徴量とは異なる画像特徴量である。
形態Iは、b個の参照画素のうち少なくとも1個の参照画素が基準画素とは隣接せず、基準画素から少なくとも1画素隔てた位置にある場合に算出される相対ビット列である。図5、図8に示すCBP特徴量は、いずれも形態IのCBP特徴量である。
形態IIは、b個の参照画素がいずれも基準画素に隣接する全8個の隣接画素のうちの一部の隣接画素である場合に算出される相対ビット列である。この場合、bは1又は1よりも大きく8よりも小さい整数である。従って、形態IのCBP特徴量も、形態IIのCBP特徴量も、LBP特徴量とは異なる画像特徴量である。
LBP特徴量とは、基準画素に隣接する8個の隣接画素のそれぞれの輝度値と基準画素の輝度値との大小関係を示す計8個の相対ビットを、順に配列した相対ビット列である。この画素毎の大小関係をLBP(ローカル・バイナリ・パターン、Local Binary Pattern)と呼ぶ。
ここで、LBP特徴量の算出方法について説明する。
図18は、入力画像(画像41)から抽出されるセル44の一例を示す図である。
図19は、セル(セル44)の構成の一例を示す図である。
セル44は、その中心に基準画素を有し、基準画素に隣接する8個の隣接画素を有する。図19において、セル44に含まれる9個の四角形は、それぞれ基準画素又は隣接画素を示す。それぞれの四角形に囲まれる数値は、各画素の輝度値を示す。
図18は、入力画像(画像41)から抽出されるセル44の一例を示す図である。
図19は、セル(セル44)の構成の一例を示す図である。
セル44は、その中心に基準画素を有し、基準画素に隣接する8個の隣接画素を有する。図19において、セル44に含まれる9個の四角形は、それぞれ基準画素又は隣接画素を示す。それぞれの四角形に囲まれる数値は、各画素の輝度値を示す。
図20は、LBPの一例(LBP45)を示す図である。
LBP45は、図19が示す画素毎の輝度値に基づくLBPである。LBP45の中心に示されているthは、その画素が基準画素であり、その画素の輝度値が隣接画素の輝度値との比較対象となる基準値であることを示す。図20において、相対ビットは、左上端から破線の矢印の順に、0、0、0、0、1、1、0、0である。これらは、図19に示される隣接画素と基準画素との大小関係を示す。
LBP45は、図19が示す画素毎の輝度値に基づくLBPである。LBP45の中心に示されているthは、その画素が基準画素であり、その画素の輝度値が隣接画素の輝度値との比較対象となる基準値であることを示す。図20において、相対ビットは、左上端から破線の矢印の順に、0、0、0、0、1、1、0、0である。これらは、図19に示される隣接画素と基準画素との大小関係を示す。
このように、LBP特徴量は、基準画素と隣接画素との信号値の関連性を示すに過ぎないのに対し、CBP特徴量は、多様な配置関係にある各2画素間における信号値の関連性を総括する。特に形態IのCBP特徴量は、空間的に離散した画素間における信号値の関連性を包括的に示す。また、形態IIのCBP特徴量は、隣接する画素間における信号値の異方性を包括的に示す。信号値の異方性とは、基準画素と隣接画素との信号値の関連性が、基準画素を基準とした隣接画素の方向によって異なる性質である。例えば、基準画素がエッジの終端である場合、基準画素がエッジの頂点もしくは交点である場合に、信号値の異方性が表れる。
また、CBP特徴量は、2個の画素それぞれの信号値についての差分値を示すピクセル差分特徴量とも異なる。ピクセル差分特徴量は、基準画素の信号値から参照画素の信号値との差分である。これに対し、CBP特徴量は、基準画素の信号値と各参照画素の信号値との間の大小関係を示す相対ビットからなる相対ビット列である。
図21は、画像41の一部であるウィンドウ画像42から選択される2個の画素46、47の例を示す図である。
図22は、選択された2個の画素46、47それぞれの信号値の一例を示す図である。
図22において、画素46、47を示す四角形に囲まれた数値220、65は、それぞれの画素に係る信号値を示す。画素46、47がそれぞれ基準画素、参照画素である場合、ピクセル差分特徴量は、155(=220−65)である。
このように、ピクセル差分特徴量には、基準画素の信号値から1個の隣接画素の信号値を減算した値であるのに対し、CBP特徴量には、基準画素とb個の参照画素それぞれの信号値の大小関係を包括的に表すという差異点がある。
図22は、選択された2個の画素46、47それぞれの信号値の一例を示す図である。
図22において、画素46、47を示す四角形に囲まれた数値220、65は、それぞれの画素に係る信号値を示す。画素46、47がそれぞれ基準画素、参照画素である場合、ピクセル差分特徴量は、155(=220−65)である。
このように、ピクセル差分特徴量には、基準画素の信号値から1個の隣接画素の信号値を減算した値であるのに対し、CBP特徴量には、基準画素とb個の参照画素それぞれの信号値の大小関係を包括的に表すという差異点がある。
上述したように、CBP特徴量は、a個の画素からなる画像ブロックにおける1個の基準画素ならびにb個の参照画素それぞれの信号値に基づいて定められる。そのため、CBP特徴量は、1個の画像ブロックにおいて(a−b)・aCb通りの自由度を有する。この(a−b)・aCb通りの自由度は、1個の画像ブロックにおいてa個の画素から1個の基準画素を選択するa通りの自由度と、残りのa−1の画素からb個の基準画素を選択するa−1Cb通りの自由度との積である。つまり、CBP特徴量は、画像ブロックにおける基準画素及びb個の参照画素の配置に依存する。但し、b個の参照画素間の相対ビット列における順列は互いに区別せず、b個の参照画素の各組み合わせについて1つの順序(例えば、画像ブロックにおける画素のインデックスの昇順)を予め定めておく。そこで、パターン認識において用いるパターン情報には、画像ブロック毎に基準画素の位置、参照画素の個数b、及び各参照画素の位置からなるセットが対応付けられるように予め学習しておく。この基準画素の位置、参照画素の個数b、及び各参照画素の位置からなるセットを配置点セットと呼ぶ。
パターン認識に係る処理において、特徴量算出部は、メモリ23から目標物体に係るパターン情報と対応付けた配置点セットを読み出し、読み出した配置点セットに基づいてウィンドウ画像に対するCBP特徴量の組である特徴量ベクトルを算出する。
なお、パターン情報には、各画像ブロックibについて各1個の配置点セットが対応付けられていてもよいし、予め定めた複数(例えば、5個)nib個の配置点セットが対応付けられていてもよい。特徴量算出部は、それぞれの画像ブロックにおける配置点セットの組み合わせ毎(nibが1より大きい場合)に特徴量ベクトルを算出する。算出される特徴量ベクトルの数は、画像ブロック毎の配置点セット数nibの積Πib=1nibとなり、算出される特徴量ベクトルの数が多くなることがある。
なお、パターン情報には、各画像ブロックibについて各1個の配置点セットが対応付けられていてもよいし、予め定めた複数(例えば、5個)nib個の配置点セットが対応付けられていてもよい。特徴量算出部は、それぞれの画像ブロックにおける配置点セットの組み合わせ毎(nibが1より大きい場合)に特徴量ベクトルを算出する。算出される特徴量ベクトルの数は、画像ブロック毎の配置点セット数nibの積Πib=1nibとなり、算出される特徴量ベクトルの数が多くなることがある。
そこで、パターン情報として、ウィンドウ画像iw毎に、それぞれの画像ブロックにおける配置点セットの組み合わせである配置点セット構造体をniw個(niwは予め定めた数、例えば、5個)学習によって予め定めておいてもよい。その場合、特徴量算出部は、ウィンドウ画像iw毎に、配置点セット構造体のそれぞれに対応する特徴量ベクトルをniw個算出する。
なお、ウィンドウ毎に1個の画像ブロックが含まれる場合には、特徴量算出部はウィンドウ毎に1個のCBP特徴量を算出する。この場合、特徴量算出部が算出するCBP特徴量ベクトルの次元数は1である。画像識別部は算出したCBP特徴量を用いて目標物体を識別する。
なお、ウィンドウ毎に1個の画像ブロックが含まれる場合には、特徴量算出部はウィンドウ毎に1個のCBP特徴量を算出する。この場合、特徴量算出部が算出するCBP特徴量ベクトルの次元数は1である。画像識別部は算出したCBP特徴量を用いて目標物体を識別する。
(リサイズ)
次に、リサイズに係る処理の一例について説明する。
予め記憶されたパターン情報には、1種類の目標物体を示す画像のスケールが、予め定めた1通り又は限られた数(例えば、2通り)しか含まれていないことがある。これに対して、撮影される物体を示す画像の大きさは、その物体までの距離等の位置関係によって種々異なる。そのため、画像認識において、複数のスケールのウィンドウそれぞれについてラスタスキャンを行う。その場合、リサイズ部は、ウィンドウのスケールが目標物体の画像のスケールに一致するように、ウィンドウで抽出されたウィンドウ画像のスケールを変更する。
次に、リサイズに係る処理の一例について説明する。
予め記憶されたパターン情報には、1種類の目標物体を示す画像のスケールが、予め定めた1通り又は限られた数(例えば、2通り)しか含まれていないことがある。これに対して、撮影される物体を示す画像の大きさは、その物体までの距離等の位置関係によって種々異なる。そのため、画像認識において、複数のスケールのウィンドウそれぞれについてラスタスキャンを行う。その場合、リサイズ部は、ウィンドウのスケールが目標物体の画像のスケールに一致するように、ウィンドウで抽出されたウィンドウ画像のスケールを変更する。
図9は、ラスタスキャンにおける入力画像の一例(画像41)を示す図である。
画像41の左上端の破線で示される四角形は、初期位置にあるウィンドウ49を示す。ウィンドウ49の中心部を起点とする右向きの矢印は、ラスタスキャンにおいてウィンドウ49の位置を右端まで予め定めたステップ幅(水平方向)で順次移動させることを示す。右端とは、ウィンドウ49の全領域が画像41に含まれている範囲において、可能な限り右側に移動させることができる位置である。画像41の中段の左側を起点とする右向きの矢印は、ウィンドウ49の位置が右端に達し、ウィンドウ49の位置を予め定めたステップ幅(垂直方向)だけ下方でかつ左端に移動させた後、再度右方に順次移動させることを示す。右端とは、ウィンドウ49の右辺と画像41の右辺が一致する位置である。この矢印の終点が、ある時点におけるウィンドウの重心点の位置を示す。その時点においてウィンドウに示されている画像が、ウィンドウ画像42である。
画像41の左上端の破線で示される四角形は、初期位置にあるウィンドウ49を示す。ウィンドウ49の中心部を起点とする右向きの矢印は、ラスタスキャンにおいてウィンドウ49の位置を右端まで予め定めたステップ幅(水平方向)で順次移動させることを示す。右端とは、ウィンドウ49の全領域が画像41に含まれている範囲において、可能な限り右側に移動させることができる位置である。画像41の中段の左側を起点とする右向きの矢印は、ウィンドウ49の位置が右端に達し、ウィンドウ49の位置を予め定めたステップ幅(垂直方向)だけ下方でかつ左端に移動させた後、再度右方に順次移動させることを示す。右端とは、ウィンドウ49の右辺と画像41の右辺が一致する位置である。この矢印の終点が、ある時点におけるウィンドウの重心点の位置を示す。その時点においてウィンドウに示されている画像が、ウィンドウ画像42である。
図10は、ウィンドウ画像の一例(ウィンドウ画像42)を示す図である。
ウィンドウ画像42は、水平(左右)方向にX画素、垂直(上下)方向にX画素の大きさを有する画像である。ここで、Xは、画素数、つまりスケールを示す整数である。認識対象の目標物体を表す画像の領域の大きさは、カメラ11からの距離等によって異なるため、画像探索部は予め複数通りのスケールを設定しておく。本実施形態では、各スケールのウィンドウについて上述のステップS101〜S105の処理を行う。
ウィンドウ画像42は、水平(左右)方向にX画素、垂直(上下)方向にX画素の大きさを有する画像である。ここで、Xは、画素数、つまりスケールを示す整数である。認識対象の目標物体を表す画像の領域の大きさは、カメラ11からの距離等によって異なるため、画像探索部は予め複数通りのスケールを設定しておく。本実施形態では、各スケールのウィンドウについて上述のステップS101〜S105の処理を行う。
図11は、目標物体の画像の一例(画像48)を示す図である。
画像48は、水平方向32画素、垂直方向32画素の大きさを有する画像である。画像48は、メモリ23に予め記憶されたパターン情報に係る目標物体として車両を示す画像である。
リサイズ部は、ウィンドウ画像42のスケールと画像48のスケールが一致しているか否かを判断し、両者が一致していない場合に、ウィンドウ画像42のスケールを画像48のスケール(水平方向32画素、垂直方向32画素)に拡大又は縮小する。
画像48は、水平方向32画素、垂直方向32画素の大きさを有する画像である。画像48は、メモリ23に予め記憶されたパターン情報に係る目標物体として車両を示す画像である。
リサイズ部は、ウィンドウ画像42のスケールと画像48のスケールが一致しているか否かを判断し、両者が一致していない場合に、ウィンドウ画像42のスケールを画像48のスケール(水平方向32画素、垂直方向32画素)に拡大又は縮小する。
ウィンドウ画像42のスケールを変更する際、リサイズ部は既知の補間方法を用いて、リサイズ後の各画素の信号値を算出する。既知の補間方法として、例えば、ニアレストネイバー(NN、Nearest Neighbor、最近傍補間)法、バイリニア(bilinear、線形補間)法、等の方法を用いることができるが、これらには限られない。
また、本実施形態において、リサイズ後のウィンドウ画像42に含まれる全ての画素について信号値を算出する必要はなく、各画像ブロックにおける基準画素及び参照画素のそれぞれについてのみ信号値を算出してもよい。これにより、リサイズに係る処理を低減することができる。
また、本実施形態において、リサイズ後のウィンドウ画像42に含まれる全ての画素について信号値を算出する必要はなく、各画像ブロックにおける基準画素及び参照画素のそれぞれについてのみ信号値を算出してもよい。これにより、リサイズに係る処理を低減することができる。
次に、ニアレストネイバー法について説明する。
ニアレストネイバー法とは、リサイズ前の位置からリサイズによって変更された位置が、リサイズ後の各1画素に最も近接する位置にある画素の信号値を、そのリサイズ後の各1画素の信号値として採用する方法である。
ニアレストネイバー法とは、リサイズ前の位置からリサイズによって変更された位置が、リサイズ後の各1画素に最も近接する位置にある画素の信号値を、そのリサイズ後の各1画素の信号値として採用する方法である。
図23は、ニアレストネイバー法を説明する図である。
図23は、互いに隣接する水平方向2画素、垂直方向2画素の領域を示す。4個の×印は、それぞれリサイズ前の各画素の中心点を示す。それぞれ×印の近傍に示されている数値163、198、178、222は、それぞれ各画素の信号値を示す。4個の×印を頂点とする四角形の内部の○印は、リサイズ後に設定される1つの画素の中心点を示す。この中心点は、リサイズ後の画素間間隔(画素ピッチ)で配置されるが、リサイズ前の対応する座標は、リサイズ前のいずれかの画素の中心点にはなるとは限らない。○印の近傍のxは、その画素の信号値を示す。○印を起点とし左下の×印を終点とする矢印は、この中心点の信号値xとして、4個の画素のうち、その中心点に最も近接する左下の画素の信号値を採用することを示す。図23に示す例では、x=178である。
図23は、互いに隣接する水平方向2画素、垂直方向2画素の領域を示す。4個の×印は、それぞれリサイズ前の各画素の中心点を示す。それぞれ×印の近傍に示されている数値163、198、178、222は、それぞれ各画素の信号値を示す。4個の×印を頂点とする四角形の内部の○印は、リサイズ後に設定される1つの画素の中心点を示す。この中心点は、リサイズ後の画素間間隔(画素ピッチ)で配置されるが、リサイズ前の対応する座標は、リサイズ前のいずれかの画素の中心点にはなるとは限らない。○印の近傍のxは、その画素の信号値を示す。○印を起点とし左下の×印を終点とする矢印は、この中心点の信号値xとして、4個の画素のうち、その中心点に最も近接する左下の画素の信号値を採用することを示す。図23に示す例では、x=178である。
次に、バイリニア法について説明する。
バイリニア法とは、リサイズ後の各1画素の信号値を、当該各1画素から予め定めた範囲における位置であって、リサイズ前の位置からリサイズによって変更された位置にある画素に係る信号値を線形補間して算出する方法である。予め定めた範囲とは、例えば、水平方向及び垂直方向に互いに隣接する各4画素についてリサイズ後のそれぞれの位置を頂点とする範囲であって、リサイズ後の各1画素を含む範囲である。
バイリニア法とは、リサイズ後の各1画素の信号値を、当該各1画素から予め定めた範囲における位置であって、リサイズ前の位置からリサイズによって変更された位置にある画素に係る信号値を線形補間して算出する方法である。予め定めた範囲とは、例えば、水平方向及び垂直方向に互いに隣接する各4画素についてリサイズ後のそれぞれの位置を頂点とする範囲であって、リサイズ後の各1画素を含む範囲である。
図24は、バイリニア法を説明する図である。
図24における各画素、×印、○印、の位置関係は、図23における位置関係と同様である。水平方向に延びる2つの両矢印それぞれの近傍に示されているα、1−αは、○印の水平方向の座標値が、左側の×印、右側の×印の水平方向の座標値間をα:1−αで内分する内分点であることを示す。垂直方向に延びる2つの両矢印それぞれの近傍に示されているβ、1−βは、○印の垂直方向の座標値が、下方の×印、上方の×印の垂直方向の座標値間をβ:1−βで内分する内分点であることを示す。バイリニア法では、信号値xを、4個のリサイズ前の各画素の中心点の信号値を、水平方向及び垂直方向の内分比で線形補間した値である。図24に示す例では、x=163・α・(1−β)+198・(1−α)・(1−β)+178・α・β+222・(1−α)・βである。
図24における各画素、×印、○印、の位置関係は、図23における位置関係と同様である。水平方向に延びる2つの両矢印それぞれの近傍に示されているα、1−αは、○印の水平方向の座標値が、左側の×印、右側の×印の水平方向の座標値間をα:1−αで内分する内分点であることを示す。垂直方向に延びる2つの両矢印それぞれの近傍に示されているβ、1−βは、○印の垂直方向の座標値が、下方の×印、上方の×印の垂直方向の座標値間をβ:1−βで内分する内分点であることを示す。バイリニア法では、信号値xを、4個のリサイズ前の各画素の中心点の信号値を、水平方向及び垂直方向の内分比で線形補間した値である。図24に示す例では、x=163・α・(1−β)+198・(1−α)・(1−β)+178・α・β+222・(1−α)・βである。
(パターン認識処理)
次に、AdaBoost識別器を用いたパターン認識処理について説明する。以下に説明する例では、画像識別部は、AdaBoost識別器の一種であるReal AdaBoostの識別器を備える。
Real AdaBoostの識別器は、複数の強識別器をカスケード接続したカスケード型の構成をとりコンパクトな構成で多段の識別を実現する。カスケード型の構成として、例えば、非特許文献1に記載と同様な構成を用いることができる。Real AdaBoostの識別器では、カスケード型の構成における強識別器の段数を増加することにより識別性能を向上し、処理時間を短縮できる。強識別器は、それぞれ目標物体の画像を識別する。本実施形態では、強識別器毎に異なる目標物体の画像を識別対象としてもよいし、一部の強識別器間で共通する目標物体の画像を識別対象としてもよい。
強識別器は、複数の弱識別器を含んで構成される。本実施形態では、弱識別器毎に異なる画像ブロックにおける画像を識別対象としてもよいし、一部の弱識別器間で共通する画像ブロックにおける画像を識別対象としてもよい。一般に、各段における弱識別器の個数を多くすることで識別精度を向上することができる。
次に、AdaBoost識別器を用いたパターン認識処理について説明する。以下に説明する例では、画像識別部は、AdaBoost識別器の一種であるReal AdaBoostの識別器を備える。
Real AdaBoostの識別器は、複数の強識別器をカスケード接続したカスケード型の構成をとりコンパクトな構成で多段の識別を実現する。カスケード型の構成として、例えば、非特許文献1に記載と同様な構成を用いることができる。Real AdaBoostの識別器では、カスケード型の構成における強識別器の段数を増加することにより識別性能を向上し、処理時間を短縮できる。強識別器は、それぞれ目標物体の画像を識別する。本実施形態では、強識別器毎に異なる目標物体の画像を識別対象としてもよいし、一部の強識別器間で共通する目標物体の画像を識別対象としてもよい。
強識別器は、複数の弱識別器を含んで構成される。本実施形態では、弱識別器毎に異なる画像ブロックにおける画像を識別対象としてもよいし、一部の弱識別器間で共通する画像ブロックにおける画像を識別対象としてもよい。一般に、各段における弱識別器の個数を多くすることで識別精度を向上することができる。
次に、Real AdaBoostの識別器を用いて目標物体を識別する処理について説明する。
(1)弱識別器は、それぞれメモリ23に予め記憶させたパターン情報と対応付けられて記憶された確率密度関数(事前確率)から、対応する画像ブロックについて算出されたCBP特徴量に対応する確率密度値を読み出す。
当該確率密度関数は、目標物体に該当することを示すPOS(肯定Positive)の確率値ならびに目標物体に該当しないことを示すNEG(否定Negative)の確率値とCBP特徴量とを対応付ける関数(ヒストグラム)である。
(1)弱識別器は、それぞれメモリ23に予め記憶させたパターン情報と対応付けられて記憶された確率密度関数(事前確率)から、対応する画像ブロックについて算出されたCBP特徴量に対応する確率密度値を読み出す。
当該確率密度関数は、目標物体に該当することを示すPOS(肯定Positive)の確率値ならびに目標物体に該当しないことを示すNEG(否定Negative)の確率値とCBP特徴量とを対応付ける関数(ヒストグラム)である。
(2)弱識別器は、読み出した確率密度値としてPOSの確率値とNEGの確率値に基づいて画像ブロック毎のCBP特徴量に係る弱識別器の応答値h’を算出する。
弱識別器は、応答値h’として、例えば、読み出した確率密度値としてPOSの確率値からNEGの確率値を減算した値pdf[POS]−pdf[NEG]を算出する。即ち、応答値h’は、肯定応答を与える確率と否定応答を与える確率との大小関係を示す変数である。弱識別器は、算出した応答値h’について画像ウィンドウに含まれる複数の画像ブロックについての総和を算出して応答値hを算出する。画像ウィンドウが1個の画像ブロックを有する場合には、算出した応答値h’を応答値hと定める。
弱識別器は、応答値h’を、例えば0.5×log((pdf[POS]+ε)/pdf[NEG]+ε))と算出してもよい。εは、予め定めた定数である。pdf(…)は、変数…に対する確率値(probability density function)を示す。
弱識別器は、応答値h’として、例えば、読み出した確率密度値としてPOSの確率値からNEGの確率値を減算した値pdf[POS]−pdf[NEG]を算出する。即ち、応答値h’は、肯定応答を与える確率と否定応答を与える確率との大小関係を示す変数である。弱識別器は、算出した応答値h’について画像ウィンドウに含まれる複数の画像ブロックについての総和を算出して応答値hを算出する。画像ウィンドウが1個の画像ブロックを有する場合には、算出した応答値h’を応答値hと定める。
弱識別器は、応答値h’を、例えば0.5×log((pdf[POS]+ε)/pdf[NEG]+ε))と算出してもよい。εは、予め定めた定数である。pdf(…)は、変数…に対する確率値(probability density function)を示す。
(3)強識別器は、自己が備える各弱識別器が算出した応答値hの合計値を応答値Hとして算出する。画像探索部は、強識別器が算出した応答値Hが予め定めた閾値THよりも大きい場合、対応する目標物体が認識対象(True)であると判断し、それ以外の場合には非認識対象(False)であると判定する。なお、強識別器は、各弱識別器が算出した応答値hに弱識別器毎の重み係数を乗じた値の合計値(重み付け加算)を強識別器の応答値Hとして算出してもよい。ここで、弱識別器毎の重み係数として、例えば、事前学習において応答値hが低い弱識別器ほど低くなる値を定めておいても、応答値hが予め定めた閾値よりも低くなる場合にゼロを定めておいてもよい。また、重み係数としてゼロを定める代わりに、当該弱識別器を重み付け加算の対象から除外してもよい。除外される弱識別器では応答値h’の算出を行わなくてもよい。
これにより、強識別器は、それぞれ目標物体の特徴量ベクトルとウィンドウ画像に関する特徴量ベクトルとの相関性、つまり尤度を示す応答値Hを算出し、算出した応答値Hが予め定めた閾値THよりも大きい場合に目標物体の画像と判断する。各強識別器は、算出した応答値Hが予め定めた閾値THと同等か、より低い場合に目標物体の画像を識別できなかったと判断し、当該ウィンドウ画像を棄却する。
これにより、強識別器は、それぞれ目標物体の特徴量ベクトルとウィンドウ画像に関する特徴量ベクトルとの相関性、つまり尤度を示す応答値Hを算出し、算出した応答値Hが予め定めた閾値THよりも大きい場合に目標物体の画像と判断する。各強識別器は、算出した応答値Hが予め定めた閾値THと同等か、より低い場合に目標物体の画像を識別できなかったと判断し、当該ウィンドウ画像を棄却する。
ある目標物体について画像ブロック毎の配置点セットを事前学習によって定める際には、例えば、目標物体に係るウィンドウ画像(正解画像)と、目標物体以外のウィンドウ画像(不正解画像)とを、それぞれ十分な数だけ準備し、それらを学習画像として用いる。そして、画像ブロック毎にCBP特徴量に係るPOSの確率値ならびにNEGの確率値を求め、これらの確率値に基づいて応答値h’をCBP特徴量毎にそれぞれ算出する。CBP特徴量に基づく応答値h’は、ウィンドウ画像においてCBP特徴量が示す基準画素と各基準画素との大小関係のパターンとの相関性を示す指標値である。画像ブロック毎にcib個の配置点セットを定めるためには、算出した(a−b)・aCb個の応答値h’のうち、最大値から降順に第cib番目に大きい応答値h’を与えるCBP特徴量に係る配置点セットをそれぞれ採用する。
上述の事前学習は、基準画素の個数bが予め定めた整数値である場合について行ってもよいが、これには限られない。個数bが0より大きくaより小さい任意の整数値の範囲内で、個数b毎に上述の事前学習を行って、応答値h’が最大となる個数bを定めるようにしてもよい。
また、画像ウィンドウ毎にniw個の配置点セット構造体を定めるためには、画像ブロックそれぞれの配置点セットの組み合わせ毎に、応答値h’の画像ブロック間の総和である応答値hを算出する。そして、算出した応答値hのうち、最大値から降順に第niw番目に大きい応答値hを与える配置点セットの組み合わせのそれぞれを配置点セット構造体と定める。
また、画像ウィンドウ毎にniw個の配置点セット構造体を定めるためには、画像ブロックそれぞれの配置点セットの組み合わせ毎に、応答値h’の画像ブロック間の総和である応答値hを算出する。そして、算出した応答値hのうち、最大値から降順に第niw番目に大きい応答値hを与える配置点セットの組み合わせのそれぞれを配置点セット構造体と定める。
(変形例1)
次に、本実施形態に係る一変形例(変形例1)について説明する。上述と同一の構成については同一の符号を付する。
図12は、本変形例に係る画像認識処理を示すフローチャートである。
本変形例において、ステップS202、S204、S205、S206、S207は、特に言及しない限り、それぞれ、ステップS101、S103、S104、S105、S106と同様な処理を含む。まず、ステップS201について説明する。
次に、本実施形態に係る一変形例(変形例1)について説明する。上述と同一の構成については同一の符号を付する。
図12は、本変形例に係る画像認識処理を示すフローチャートである。
本変形例において、ステップS202、S204、S205、S206、S207は、特に言及しない限り、それぞれ、ステップS101、S103、S104、S105、S106と同様な処理を含む。まず、ステップS201について説明する。
(ステップS201)リサイズ部は、画像取得部12から入力された入力画像に基づいてピラミッド画像を生成する。ピラミッド画像とは、入力画像を予め定めた複数の比率のうちの1つの比率でそれぞれ縮小して生成された縮小画像のセットである。その複数の比率は、例えば等比級数である。この縮小画像のセットは、画像ピラミッドともいう。ここで、比率とは、縮小画像のスケールを入力画像の対応するスケールで除算した値、つまり拡大率である。個々の縮小画像を階層(レイヤ)で区別し、各レイヤの次数を比率の降順に定めておく。例えば、比率1/2、1/4、…で縮小した縮小画像を順に、レイヤ1、レイヤ2、…と呼んで区別する。入力画像もレイヤ0の画像としてピラミッド画像の一部とする。ピラミッド画像の例については後述する。その後、ステップS202に進む。
(ステップS202)画像探索部は、入力画像についてステップS101と同様にウィンドウの位置を変更し、ウィンドウ画像を抽出する。画像探索部は、入力画像におけるウィンドウの位置と対応する位置において、縮小画像からウィンドウ画像をレイヤ毎に抽出する。ここで、レイヤ毎のウィンドウの大きさ、移動ステップ幅を、それぞれ対応するレイヤの比率に比例するように予め定めておいてもよい。その後、ステップS203に進む。
(ステップS203)リサイズ部は、抽出したウィンドウ画像のうち、パターン情報に係る目標物体の画像のスケールが一致又は最も近似するレイヤのウィンドウ画像を選択する。ここで、パターン情報に係る目標物体の画像のスケールと選択したウィンドウ画像のスケールが一致していない場合には、両者が一致するように選択したウィンドウ画像のスケールをリサイズしてもよい。その後、ステップS204に進む。
これにより、選択された(リサイズされた場合にはリサイズされた)ウィンドウ画像に基づいてCBP特徴量(ベクトル)が算出される。算出されたCBP特徴量(ベクトル)は、目標物体の識別のために用いられる。
これにより、選択された(リサイズされた場合にはリサイズされた)ウィンドウ画像に基づいてCBP特徴量(ベクトル)が算出される。算出されたCBP特徴量(ベクトル)は、目標物体の識別のために用いられる。
(ピラミッド画像の例)
次に、本変形例に係るピラミッド画像の例について説明する。
図13は、ピラミッド画像の例を示す概念図である。
図13において、画像41、41−1、41−2、41−3は、それぞれ、入力画像(レイヤ0)、対応するレイヤ1の縮小画像、レイヤ2の縮小画像、レイヤ3の縮小画像を示す。ウィンドウ49、及び2本の破線の矢印は、図9に示すものと位置関係、役割が同様である。画像41−1、41−2、41−3のほぼ中央部に示されているウィンドウ画像42−1、42−2、42−3は、それぞれウィンドウ画像42に対応するウィンドウ画像である。なお、図13に示す例では、レイヤ1、2、3に係る比率は、それぞれ1/2、1/4、1/8、…である。
次に、本変形例に係るピラミッド画像の例について説明する。
図13は、ピラミッド画像の例を示す概念図である。
図13において、画像41、41−1、41−2、41−3は、それぞれ、入力画像(レイヤ0)、対応するレイヤ1の縮小画像、レイヤ2の縮小画像、レイヤ3の縮小画像を示す。ウィンドウ49、及び2本の破線の矢印は、図9に示すものと位置関係、役割が同様である。画像41−1、41−2、41−3のほぼ中央部に示されているウィンドウ画像42−1、42−2、42−3は、それぞれウィンドウ画像42に対応するウィンドウ画像である。なお、図13に示す例では、レイヤ1、2、3に係る比率は、それぞれ1/2、1/4、1/8、…である。
ピラミッド画像では、高次のレイヤ(比率が低い)の縮小画像は、より低次のレイヤ(比率が高い)の縮小画像における画素毎の信号値が空間的に平均化(平滑化)された信号値を有する。
図14は、ピラミッド画像における信号値の一例を示す概念図である。
図14において、画像41、41−1、41−2、ウィンドウ画像42、42−1、42−2は、図13と同様である。
図14は、ウィンドウ画像42(レイヤ0)の左上のセル43、ウィンドウ画像42−1(レイヤ1)の左上のセル43−1、ウィンドウ画像42−2(レイヤ2)の左上のセル43−2を、右列にそれぞれ拡大して示す。ここで、セル43−1、セル43−2は、それぞれセル43が示す領域と同一の領域を示す。
セル43は、水平方向4画素、垂直方向4画素を含む領域である。セル43−1は、水平方向2画素、垂直方向2画素を含む領域である、セル43−2は、1個の画素を含む領域である。各セル内の四角形の領域に囲まれる符号q0,1,1等は、各画素を識別するインデックスである。
図14は、ピラミッド画像における信号値の一例を示す概念図である。
図14において、画像41、41−1、41−2、ウィンドウ画像42、42−1、42−2は、図13と同様である。
図14は、ウィンドウ画像42(レイヤ0)の左上のセル43、ウィンドウ画像42−1(レイヤ1)の左上のセル43−1、ウィンドウ画像42−2(レイヤ2)の左上のセル43−2を、右列にそれぞれ拡大して示す。ここで、セル43−1、セル43−2は、それぞれセル43が示す領域と同一の領域を示す。
セル43は、水平方向4画素、垂直方向4画素を含む領域である。セル43−1は、水平方向2画素、垂直方向2画素を含む領域である、セル43−2は、1個の画素を含む領域である。各セル内の四角形の領域に囲まれる符号q0,1,1等は、各画素を識別するインデックスである。
上述のように縮小画像は、入力画像に含まれる画素毎の信号値を補間した値を画素毎に有するため、高次のレイヤにおける信号値は、低次のレイヤにおける信号値を空間的に平均した値又はその値に近似する。例えば、セル43−1の画素q1,1,1の信号値は、セル43の画素q0,1,1、q0,1,2、q0,2,1、q0,2,2間の信号値の平均値にほぼ等しくなる。セル43−2の画素q2,1,1の信号値は、セル43−1の画素q1,1,1、q1,1,2、q1,2,1、q1,2,2間の信号値の平均値にほぼ等しくなる。また、セル43−2の画素q2,1,1の信号値は、セル43の画素q0,1,1、q0,1,2、…、q0,3,4、q0,4,4間の信号値の平均値にほぼ等しくなる。
(変形例2)
次に、本実施形態に係る他の変形例(変形例2)について説明する。上述と同一の構成については同一の符号を付する。
図15は、本変形例に係る画像認識処理を示すフローチャートである。
本変形例において、ステップS302、S304、S305、S306は、特に言及しない限り、それぞれ、ステップS101、S104、S105、S106と同様な処理である。本変形例では、物体認識部13は積分部を備える。以下、積分部が行うステップS301について説明する。
次に、本実施形態に係る他の変形例(変形例2)について説明する。上述と同一の構成については同一の符号を付する。
図15は、本変形例に係る画像認識処理を示すフローチャートである。
本変形例において、ステップS302、S304、S305、S306は、特に言及しない限り、それぞれ、ステップS101、S104、S105、S106と同様な処理である。本変形例では、物体認識部13は積分部を備える。以下、積分部が行うステップS301について説明する。
(ステップS301)積分部は、画像取得部12から入力された入力画像に基づいて積分画像を生成する。積分画像とは、入力画像の基準点(例えば、左上端の画素)から注目する画素までの画素値の総和、つまり積分値を信号値として有する画像である。積分領域は、基準点と注目する画素との間の線分を対角線とする四角形の領域である。積分画像の例については後述する。その後、ステップS302に進む。
(ステップS303)特徴量算出部は、画像探索部が抽出した積分画像に基づいてCBP特徴量を算出する。特徴量算出部は、メモリ23に目標物体毎及び画像ブロック毎に記憶されたパターン情報に対応付けられた配置点セットを読み出す。特徴量算出部は、読み出した配置点セットから基準画素、b個の参照画素、それぞれの座標を抽出する。
特徴量算出部は、抽出した座標を含む予め定めた大きさの矩形の領域(以下、矩形領域)に係る頂点にある画素の積分値に基づいて、その矩形領域における(積分前の)信号値の総和をそれぞれ算出する。特徴量算出部は、それぞれ算出した総和に基づいてCBP特徴量を算出し、算出したCBP特徴量を画像ブロック間で統合してCBP特徴量ベクトルを算出する。その後、ステップS304に進む。
特徴量算出部は、抽出した座標を含む予め定めた大きさの矩形の領域(以下、矩形領域)に係る頂点にある画素の積分値に基づいて、その矩形領域における(積分前の)信号値の総和をそれぞれ算出する。特徴量算出部は、それぞれ算出した総和に基づいてCBP特徴量を算出し、算出したCBP特徴量を画像ブロック間で統合してCBP特徴量ベクトルを算出する。その後、ステップS304に進む。
次に、本変形例に係る積分画像の例について説明する。
図16は、積分画像の一例(画像51)を示す。
画像51の中央部の四角形は、ウィンドウ画像52を示す。ウィンドウ画像52には、3個の矩形領域53、54、55を含む。矩形領域53、54、55は、それぞれ基準画素qa、参照画素qb1、参照画素qb2を中心に含む矩形領域である。図16の右側に、矩形領域53、54、55の詳細を示す。図16の例では、矩形領域53、54、55は、それぞれ水平方向3画素、垂直方向3画素を含む領域である
矩形領域53の左上端、右上端、左下端、右下端の符号qa1、qa2、qa3、qa4は、それぞれの画素のインデックスである。矩形領域54の左上端、右上端、左下端、右下端の符号qb1,1、qb1,2、qb1,3、qb1,4は、それぞれの画素のインデックスである。矩形領域55の左上端、右上端、左下端、右下端の符号qb2,1、qb2,2、qb2,3、qb2,4は、それぞれの画素のインデックスである。
図16は、積分画像の一例(画像51)を示す。
画像51の中央部の四角形は、ウィンドウ画像52を示す。ウィンドウ画像52には、3個の矩形領域53、54、55を含む。矩形領域53、54、55は、それぞれ基準画素qa、参照画素qb1、参照画素qb2を中心に含む矩形領域である。図16の右側に、矩形領域53、54、55の詳細を示す。図16の例では、矩形領域53、54、55は、それぞれ水平方向3画素、垂直方向3画素を含む領域である
矩形領域53の左上端、右上端、左下端、右下端の符号qa1、qa2、qa3、qa4は、それぞれの画素のインデックスである。矩形領域54の左上端、右上端、左下端、右下端の符号qb1,1、qb1,2、qb1,3、qb1,4は、それぞれの画素のインデックスである。矩形領域55の左上端、右上端、左下端、右下端の符号qb2,1、qb2,2、qb2,3、qb2,4は、それぞれの画素のインデックスである。
ここで、矩形領域53における(積分前の)信号値の総和saは、I(qa1)+I(qa4)−I(qa2)−I(qa3)のように、左上端の画素における積分値と右下端の画素における積分値との和から、左下端の画素における積分値と右上端の画素における積分値を減算した値である。この総和saは、矩形領域53における信号値の平均値と矩形領域53に含まれる画素数との積である。同様に、矩形領域54における(積分前の)信号値の総和sb1は、I(qb1,1)+I(qb1,4)−I(qb1,2)−I(qb1,3)である。矩形領域55における(積分前の)信号値の総和sb2は、I(qb2,1)+I(qb2,4)−I(qb2,2)−I(qb2,3)である。
特徴量算出部は、基準画素qaにおける信号値として信号値の総和saを、参照画素qb1における信号値として信号値の総和sb1を、参照画素qb2における信号値として信号値の総和sb2を用いてCBP特徴量を算出する。CBP特徴量では、基準画素における信号値と参照画素における信号値との大小関係を問題にしているため、本実施形態では、信号値の総和の代わりに平均値を用いてもよい。この平均値は、信号値の総和を矩形領域53、54、55に共通な画素数(図16の例では、9個)で正規化(除算)して与えられる値である。本実施形態では、矩形領域53、54、55における信号値の総和又は和とは、その信号値の平均値も含む概念である。
これにより、本変形例では、CBP特徴量を算出する前に、ウィンドウ画像のスケールとパターン情報に係る目標物体の画像のスケールが異なっていても、ウィンドウ画像をリサイズする処理を省略することができる。そのため、処理にかかる負荷を軽減することができる。
これにより、本変形例では、CBP特徴量を算出する前に、ウィンドウ画像のスケールとパターン情報に係る目標物体の画像のスケールが異なっていても、ウィンドウ画像をリサイズする処理を省略することができる。そのため、処理にかかる負荷を軽減することができる。
(従来の画像認識処理)
これに対して、従来の画像認識処理において、画像特徴量としてHOG(Histograms of Oriented Gradients)特徴量、LBP特徴量、ピクセル差分特徴量等を用いていた。以下では、HOG特徴量を用いる場合を例にとって、その処理の概要を説明する。
これに対して、従来の画像認識処理において、画像特徴量としてHOG(Histograms of Oriented Gradients)特徴量、LBP特徴量、ピクセル差分特徴量等を用いていた。以下では、HOG特徴量を用いる場合を例にとって、その処理の概要を説明する。
図17は、従来の画像認識処理の一例を示すフローチャートである。
(ステップS401)入力画像においてウィンドウを移動させる(ラスタスキャン)。その後、ステップS402に進む。
(ステップS402)入力画像から抽出したウィンドウ画像に基づいてHOG特徴量(ベクトル)の特徴量を算出する。その後、ステップS403に進む。
(ステップS403)算出した特徴量に基づいてAdaBoost識別器により目標物体を識別する。その後、ステップS404に進む。
(ステップS404)ラスタスキャンの終了判定を行い、終了した場合には(ステップS404 YES)、S405に進む。終了していない場合には(ステップS404 NO)、ステップS401に戻る。
(ステップS405)目標物体が識別されたウィンドウを、所定の範囲内にあるスケール、位置のウィンドウをクラスタリングする。その後、処理を終了する。
(ステップS401)入力画像においてウィンドウを移動させる(ラスタスキャン)。その後、ステップS402に進む。
(ステップS402)入力画像から抽出したウィンドウ画像に基づいてHOG特徴量(ベクトル)の特徴量を算出する。その後、ステップS403に進む。
(ステップS403)算出した特徴量に基づいてAdaBoost識別器により目標物体を識別する。その後、ステップS404に進む。
(ステップS404)ラスタスキャンの終了判定を行い、終了した場合には(ステップS404 YES)、S405に進む。終了していない場合には(ステップS404 NO)、ステップS401に戻る。
(ステップS405)目標物体が識別されたウィンドウを、所定の範囲内にあるスケール、位置のウィンドウをクラスタリングする。その後、処理を終了する。
HOG特徴量は、画素毎の輝度値の空間変化の統計的な性質を示す特徴量である。LBP特徴量、ピクセル差分特徴量についても、上述したように、CBP特徴量のように、互いに離れた画素間の信号値の関連性でも、隣接する画素間における信号値の異方性を抽出するものではない。
(まとめ)
従来の画像認識処理に対して、本実施形態では、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値それぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す画像特徴量を、入力画像から抽出した処理領域内の画像に対して算出し算出した画像特徴量に基づいて目標物体を認識する。従って、本実施形態では、空間的に離散した画素間における信号値の関連性を包括的に抽出できるので、認識精度が向上する。
従来の画像認識処理に対して、本実施形態では、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値それぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す画像特徴量を、入力画像から抽出した処理領域内の画像に対して算出し算出した画像特徴量に基づいて目標物体を認識する。従って、本実施形態では、空間的に離散した画素間における信号値の関連性を包括的に抽出できるので、認識精度が向上する。
また、本実施形態では、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値それぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す画像特徴量を、入力画像から抽出した処理領域内の画像に対して算出し、算出した画像特徴量に基づいて目標物体を認識する。従って、本実施形態では、隣接する画素間における信号値の異方性を抽出することができるので、例えば特徴点やその付近における認識精度が向上する。
なお、上述した実施形態では、ラスタスキャンやトラッキング等におけるパターン認識において、必ずしもAdaBoostの認識器やReal AdaBoostの認識器を用いる必要はなく、他の方法を用いてもよい。本実施形態では、例えば、サポートベクタマシン(Support Vector Machine、SVM)を用いた方法、ブロックマッチングを用いた方法、等を用いてもよい。
なお、上述した実施形態におけるカメラECU1、即ち画像認識装置の一部、例えば、物体認識部13及び制御部14をコンピュータで実現するようにしても良い。その場合、この制御機能を実現するためのプログラムをコンピュータ読み取り可能な記録媒体に記録して、この記録媒体に記録されたプログラムをコンピュータシステムに読み込ませ、実行することによって実現しても良い。なお、ここでいう「コンピュータシステム」とはカメラECU1に内蔵されたコンピュータシステムであって、OSや周辺機器等のハードウェアを含むものとする。また、「コンピュータ読み取り可能な記録媒体」とは、フレキシブルディスク、光磁気ディスク、ROM、CD−ROM等の可搬媒体、コンピュータシステムに内蔵されるハードディスク等の記憶装置のことをいう。さらに「コンピュータ読み取り可能な記録媒体」とは、インターネット等のネットワークや電話回線等の通信回線を介してプログラムを送信する場合の通信線のように、短時間、動的にプログラムを保持するもの、その場合のサーバやクライアントとなるコンピュータシステム内部の揮発性メモリのように、一定時間プログラムを保持しているものも含んでも良い。また上記プログラムは、前述した機能の一部を実現するためのものであっても良く、さらに前述した機能をコンピュータシステムにすでに記録されているプログラムとの組み合わせで実現できるものであっても良い。
また、上述した実施形態におけるカメラECU1の一部、または全部を、LSI(Large Scale Integration)等の集積回路として実現しても良い。カメラECU1の各機能ブロックは個別にプロセッサ化してもよいし、一部、または全部を集積してプロセッサ化しても良い。また、集積回路化の手法はLSIに限らず専用回路、または汎用プロセッサで実現しても良い。また、半導体技術の進歩によりLSIに代替する集積回路化の技術が出現した場合、当該技術による集積回路を用いても良い。
また、上述した実施形態におけるカメラECU1の一部、または全部を、LSI(Large Scale Integration)等の集積回路として実現しても良い。カメラECU1の各機能ブロックは個別にプロセッサ化してもよいし、一部、または全部を集積してプロセッサ化しても良い。また、集積回路化の手法はLSIに限らず専用回路、または汎用プロセッサで実現しても良い。また、半導体技術の進歩によりLSIに代替する集積回路化の技術が出現した場合、当該技術による集積回路を用いても良い。
以上、図面を参照してこの発明の一実施形態について詳しく説明してきたが、具体的な構成は上述のものに限られることはなく、この発明の要旨を逸脱しない範囲内において様々な設計変更等をすることが可能である。
1…カメラECU、
2…警報装置
3…ACC−ECU
4…衝突回避制御−ECU
11…カメラ、
12…画像取得部、
13…物体認識部、
14…制御部、
21…FPGA
22…マイクロコンピュータ、
23…メモリ
2…警報装置
3…ACC−ECU
4…衝突回避制御−ECU
11…カメラ、
12…画像取得部、
13…物体認識部、
14…制御部、
21…FPGA
22…マイクロコンピュータ、
23…メモリ
Claims (13)
- 予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する特徴量算出部と、
前記特徴量算出部が算出した特徴量に基づいて目標物体を認識する物体認識部と、
を備えることを特徴とする画像認識装置。 - 予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する特徴量算出部と、
前記特徴量算出部が算出した特徴量に基づいて目標物体を認識する物体認識部と、
を備えることを特徴とする画像認識装置。 - 前記特徴量は、前記大小関係を示す符号を前記第2の個数の画素の全てについて配列した符号列が示す値であることを特徴とする請求項1又は2に記載の画像認識装置。
- 前記特徴量に対応付けて前記目標物体の確率を含むパターン情報を記憶しているパターン記憶部を備え、
前記物体認識部は、前記特徴量算出部が算出した特徴量に基づいて前記パターン記憶部から読み出したパターン情報を用いて前記目標物体の尤度を示す応答値を算出することを特徴とする請求項3に記載の画像認識装置。 - 前記パターン記憶部には、前記特徴量に係る前記第2の個数を示す情報、及び前記基準画素ならびに前記第2の個数の参照画素それぞれの位置を示す情報が記憶されていることを特徴とする請求項4に記載の画像認識装置。
- 前記パターン情報に係る処理領域の大きさと、前記画像に対する処理領域の大きさが一致するように、前記パターン情報に係る処理領域の大きさ、前記画像に対する処理領域の大きさ、又は両方の大きさを変更するリサイズ部、
を備えることを特徴とする請求項4又は5に記載の画像認識装置。 - 前記基準画素の座標と前記第2の個数の参照画素の位置がそれぞれ一致するように、前記パターン情報に係る処理領域の大きさ、前記画像に対する処理領域の大きさ、又は当該大きさのいずれも変更するリサイズ部、
を備えることを特徴とする請求項4又は5に記載の画像認識装置。 - 前記リサイズ部は、前記画像から抽出された処理領域を複数の予め定めた比率でそれぞれ縮小した縮小処理領域の画像を生成し、前記生成した縮小処理領域の画像の中でその大きさが前記パターン情報に係る処理領域の大きさに等しい又は最も近似する縮小処理領域の画像を、大きさを変更した処理領域の画像として選択することを特徴とする請求項6に記載の画像認識装置。
- 前記特徴量算出部は、前記画像の画素毎の信号値を空間的に積分した積分値を画素毎に有する積分画像に対して、前記パターン情報における基準画素及び前記第2の個数の参照画素のそれぞれに対応する画素を含む領域の頂点における積分値に基づいて当該領域における信号値の総和を各々算出し、各々算出した総和を前記画像に対する基準画素及び前記第2の個数の参照画素毎の信号値として前記特徴量を算出することを特徴とする請求項4又は5に記載の画像認識装置。
- 画像認識装置における画像認識方法であって、
前記画像認識装置は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の過程と、
前記画像認識装置は、前記第1の過程において算出した特徴量に基づいて目標物体を認識する第2の過程と
を有することを特徴とする画像認識方法。 - 画像認識装置における画像認識方法であって、
前記画像認識装置は、予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の過程と、
前記画像認識装置は、前記第1の過程において算出した特徴量に基づいて目標物体を認識する第2の過程と
を有することを特徴とする画像認識方法。 - 画像認識装置のコンピュータに、
予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記第1の個数の画素のうちの第2の個数の画素であって、当該第2の個数の画素のうち少なくとも1個の画素が前記基準画素から少なくとも1画素隔てた位置にある画素である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の手順、
前記第1の手順において算出した特徴量に基づいて目標物体を認識する第2の手順、
を実行させるための画像認識プログラム。 - 画像認識装置のコンピュータに、
予め定めた第1の個数の画素のうち1個の基準画素の信号値と、前記基準画素に隣接する全ての隣接画素のうちの一部である第2の個数の参照画素の信号値のそれぞれとの大小関係を、前記第2の個数の参照画素の全てについて示す特徴量を、処理領域内の画像に対して算出する第1の手順、
前記第1の手順において算出した特徴量に基づいて目標物体を認識する第2の手順
を実行させることを特徴とする画像認識プログラム。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2012146969A JP2014010633A (ja) | 2012-06-29 | 2012-06-29 | 画像認識装置、画像認識方法、及び画像認識プログラム |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2012146969A JP2014010633A (ja) | 2012-06-29 | 2012-06-29 | 画像認識装置、画像認識方法、及び画像認識プログラム |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JP2014010633A true JP2014010633A (ja) | 2014-01-20 |
Family
ID=50107299
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2012146969A Pending JP2014010633A (ja) | 2012-06-29 | 2012-06-29 | 画像認識装置、画像認識方法、及び画像認識プログラム |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP2014010633A (ja) |
Cited By (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2016018538A (ja) * | 2014-07-11 | 2016-02-01 | キヤノン株式会社 | 画像認識装置、方法及びプログラム |
| JP2016076758A (ja) * | 2014-10-03 | 2016-05-12 | 株式会社東芝 | 再生装置、符号化装置、および再生方法 |
| JP2017516197A (ja) * | 2015-03-31 | 2017-06-15 | バイドゥ オンライン ネットワーク テクノロジー (ベイジン) カンパニー リミテッド | 交通標識を認識する方法及び装置 |
| US9898973B2 (en) | 2015-04-13 | 2018-02-20 | Japan Display Inc. | Display device, electronic apparatus and method of driving display device |
| KR20210152025A (ko) * | 2020-04-24 | 2021-12-14 | 주식회사 스트라드비젼 | 자율주행 자동차의 퍼셉션 네트워크를 학습시키기 위한 온-비히클 액티브 러닝 방법 및 장치 |
-
2012
- 2012-06-29 JP JP2012146969A patent/JP2014010633A/ja active Pending
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2016018538A (ja) * | 2014-07-11 | 2016-02-01 | キヤノン株式会社 | 画像認識装置、方法及びプログラム |
| US10204283B2 (en) | 2014-07-11 | 2019-02-12 | Canon Kabushiki Kaisha | Image recognizing apparatus, image recognizing method, and storage medium |
| JP2016076758A (ja) * | 2014-10-03 | 2016-05-12 | 株式会社東芝 | 再生装置、符号化装置、および再生方法 |
| JP2017516197A (ja) * | 2015-03-31 | 2017-06-15 | バイドゥ オンライン ネットワーク テクノロジー (ベイジン) カンパニー リミテッド | 交通標識を認識する方法及び装置 |
| US9898973B2 (en) | 2015-04-13 | 2018-02-20 | Japan Display Inc. | Display device, electronic apparatus and method of driving display device |
| KR20210152025A (ko) * | 2020-04-24 | 2021-12-14 | 주식회사 스트라드비젼 | 자율주행 자동차의 퍼셉션 네트워크를 학습시키기 위한 온-비히클 액티브 러닝 방법 및 장치 |
| KR102589764B1 (ko) | 2020-04-24 | 2023-10-17 | 주식회사 스트라드비젼 | 자율주행 자동차의 퍼셉션 네트워크를 학습시키기 위한 온-비히클 액티브 러닝 방법 및 장치 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Jiao et al. | A configurable method for multi-style license plate recognition | |
| US10216979B2 (en) | Image processing apparatus, image processing method, and storage medium to detect parts of an object | |
| US9824294B2 (en) | Saliency information acquisition device and saliency information acquisition method | |
| EP2063393B1 (en) | Color classifying method, color recognizing method, color classifying device, color recognizing device, color recognizing system, computer program, and recording medium | |
| JP5714599B2 (ja) | イメージ認識のための記述子パッチの高速部分空間射影 | |
| EP2528017B1 (en) | Image identification device, image identification method, image identification program, and recording medium | |
| US9934446B2 (en) | Object detecting apparatus and method | |
| US9317784B2 (en) | Image processing apparatus, image processing method, and program | |
| US8805077B2 (en) | Subject region detecting apparatus | |
| JP5500024B2 (ja) | 画像認識方法及び装置並びにプログラム | |
| US20170111576A1 (en) | Image processing apparatus, method, and medium for extracting feature amount of image | |
| KR101896357B1 (ko) | 객체를 검출하는 방법, 디바이스 및 프로그램 | |
| JP4933186B2 (ja) | 画像処理装置、画像処理方法、プログラム及び記憶媒体 | |
| JP6095817B1 (ja) | 物体検出装置 | |
| JP2017005389A (ja) | 画像認識装置、画像認識方法及びプログラム | |
| US20120257822A1 (en) | Image processing apparatus, image processing method, and computer readable medium | |
| JP6492746B2 (ja) | 画像処理プログラム、画像処理装置、及び画像処理方法 | |
| WO2011092865A1 (ja) | 物体検出装置及び物体検出方法 | |
| JPWO2012046426A1 (ja) | 物体検出装置、物体検出方法および物体検出プログラム | |
| CN103093245B (zh) | 视频图像中识别信号灯的方法 | |
| JP2014048702A (ja) | 画像認識装置、画像認識方法、及び画像認識プログラム | |
| CN103295186B (zh) | 图像描述符生成方法和系统、图像检测方法和系统 | |
| CN112926463A (zh) | 一种目标检测方法和装置 | |
| JP5335554B2 (ja) | 画像処理装置及び画像処理方法 | |
| US10115195B2 (en) | Method and apparatus for processing block to be processed of urine sediment image |