ITTO990996A1 - Metodo di classificazione di immagini digitali in base al loro contenuto. - Google Patents
Metodo di classificazione di immagini digitali in base al loro contenuto. Download PDFInfo
- Publication number
- ITTO990996A1 ITTO990996A1 IT1999TO000996A ITTO990996A ITTO990996A1 IT TO990996 A1 ITTO990996 A1 IT TO990996A1 IT 1999TO000996 A IT1999TO000996 A IT 1999TO000996A IT TO990996 A ITTO990996 A IT TO990996A IT TO990996 A1 ITTO990996 A1 IT TO990996A1
- Authority
- IT
- Italy
- Prior art keywords
- image
- descriptors
- color
- classification
- images
- Prior art date
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/50—Information retrieval; Database structures therefor; File system structures therefor of still image data
- G06F16/55—Clustering; Classification
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/50—Information retrieval; Database structures therefor; File system structures therefor of still image data
- G06F16/58—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
- G06F16/583—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using metadata automatically derived from the content
- G06F16/5838—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using metadata automatically derived from the content using colour
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Library & Information Science (AREA)
- Data Mining & Analysis (AREA)
- Databases & Information Systems (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Image Analysis (AREA)
- Investigating Or Analysing Biological Materials (AREA)
- Measuring And Recording Apparatus For Diagnosis (AREA)
Description
D E S C R I Z I O N E
del brevetto per invenzione industriale
La presente invenzione è relativa ad un metodo di classificazione di immagini digitali in base al loro contenuto .
In particolare, la presente invenzione trova vantaggiosa, ma non esclusiva, applicazione nella classificazione di immagini digitali secondo le seguenti tre classi di immagine: fotografie, testi e grafici, cui la trattazione che segue farà riferimento senza per questo perdere in generalità.
Come è noto, Internet e il Web sono diventati gli abilitatori chiave che hanno motivato e reso possibile la rivoluzione nella gestione di tutti i passi necessari per l'utilizzo di immagini in formato digitale. Questa emergente struttura di gestione delle immagini in formato digitale dipende dall'effettiva realizzazione di tre fasi fondamentali: l'acquisizione delle immagini, il cosiddetto "digitai way-in", la riutilizzazione dell'immagine, il cosiddetto "digitai recirculation", ed il "rendere" le immagini fra dispositivi eterogenei (monitor, stampante, eco.), il cosiddetto "digitai wayout", ossia l'elaborazione delle immagini per un fine specifico, come ad esempio la stampa o l'archiviazione.
Una classificazione delle immagini digitali in base al loro contenuto è diventata ormai una esigenza irrinunciabile per un'accurata descrizione ed uso delle immagini digitali stesse, in particolare modo per l'adozione delle strategie di elaborazione delle immagini più adatte per soddisfare la sempre maggiore richiesta di qualità dell'immagine, velocità di trasmissione e facilità d'uso in applicazioni basate su Internet, quali, ad esempio, il miglioramento delle immagini digitali stesse, ossia il cosiddetto "image enhancement", il processamento del colore, la compressione di immagine, ecc.
Attualmente, una delle metodologie utilizzate per la classificazione delle immagini in formato digitale in base al loro contenuto è essenzialmente basata su un approccio di tipo euristico implementato mediante sistemi esperti. In altre parole, tale metodologia prevede in sostanza di determinare il contenuto dell'immagine analizzando l'immagine digitale 'in regioni di dimensioni variabili secondo direzioni e regole di scansione prefissate mediante un algoritmo del tipo "if... then... else...", ossia valutando il significato della regione di interesse alla luce delle caratteristiche delle regioni precedenti o adiacenti, nonché tramite la verifica di una sequenza strutturata di condizioni di appartenenza a una o più regole.
Sebbene largamente utilizzata, questa metodologia presenta alcuni inconvenienti: il primo inconveniente è costituito dalla complessi-tà computazionale richiesta per l'analisi dell'elevato numero di pixel di una immagine, con gli ulteriori evidenti inconvenienti in termini di tempi e costi ad essa associati; il secondo inconveniente è costituito dalla estremamente complessa ottimizzazione a cui tale metodologia può essere soggetta; il terzo inconveniente è costituito dalla sostanziale impossibilità di ottimizzare l'analisi utilizzando architetture di tipo parallelo; ed il quarto inconveniente è dovuto alla non estremamente elevata *robustezza" intrinseca della metodologia, causata dalla ineliminabile possibilità di non considerare, nell'algoritmo del tipo M f... then... else...", particolari casistiche che possono presentarsi nelle immagini.
Scopo della presente invenzione è quello di realizzare un metodo di classificazione di immagini digitali in base al loro contenuto esente dagli inconvenienti dei metodi noti.
Secondo la presente invenzione viene realizzato un metodo di classificazione di immagini digitali in base al loro contenuto, come definito nella rivendicazione 1.
Per una migliore comprensione della presente invenzione viene ora descritta una forma di realizzazione preferita, a puro titolo di esempio non limitativo e con riferimento alle figure allegate, in cui:
- la figura 1 mostra un diagramma di flusso relativo al metodo di classificazione di immagini digitali oggetto della presente invenzione; e
- la figura 2 mostra un diagramma di flusso relativo alla costruzione di un classificatore strutturato ad albero binario utilizzato nel presente metodo di classificazione.
Sì sottolinea innanzitutto il fatto che nella seguente trattazione il termine *immagini" indicherà non soltanto le immagine complete ma anche le sottoimmagini ottenute suddividendo una immagine.
Nella figura 1 è illustrato un diagramma di flusso relativo al metodo di classificazione di immagini digitali oggetto della presente invenzione.
Secondo quanto illustrato in tale figura, il presente metodo di classificazione prevede di:
- definire un set di N descrittori a basso livello (’low-level features") descriventi, nel loro insieme, il contenuto semantico di un'immagine, i quali sono costituiti da grandezze ricavabili dall'immagine tramite espressioni logico-matematiche note a priori e la loro scelta dipende dalle classi di immagine utilizzate per la classificazione (blocco 10);
- indicizzare quindi l'immagine da classificare allo scopo di estrarre da essa un vettore di descrittori X=[X1, X2, XN] formato dai valori assunti, in detta immagine, dagli N descrittori (blocco 20); ed
- elaborare, nel modo descritto più in dettaglio in seguito, il vettore dei descrittori X secondo un algoritmo di elaborazione al fine di identificare la classe dell'immagine (blocchi 30-50).
In particolare, la scelta dei descrittori è un fattore essenziale per una buona classificazione dell'immagine in base al suo contenuto pittorico ("pictorial content"). I seguenti criteri di scelta hanno pilotato lo studio sistematico effettuato dalla richiedente al fine di determinare i descrittori dell'immagine più adatti a descriverne il contenuto-in termini di colore, contrasto e forma (si vedano anche le pubblicazioni 1) "A relevance feedback mechanism for content-based image retrievial" di P. Ciocca e R. Schettini, Information Processing and Management 35, pp. 605632, 1999 e 2) "A method for thè automatic indexing of color images for effective image retrievial" di I. Gagliardi e R. Schettini, The New Review of Hypermedia and Multimedia 3, pp. 201-224, 1997):
- potere discriminante (il parametro caratteristico presenta una varianza piccola all'interno di ciascuna classe e le distanze fra i suoi valori medi in classi differenti sono elevate) ; e
- efficienza (il parametro caratteristico può essere rapidamente processato) .
Lo studio effettuato dalla richiedente utilizzando i criteri di scelta sopra menzionati ha portato all'individuazione dei descrittori qui di seguito elencati, i quali, secondo un aspetto della presente invenzione, costituiscono una sorta di libreria di descrittori fra i quali vengono scelti, in funzione delle classi di immagine fra cui si vuole effettuare la classificazione, gli N descrittori utilizzati per l'indicizzazione dell'immagine:
a) 1'istogramma di colore nello spazio di colore HSV {dall'inglese Hue Sa.turation Value) quantizzato a 64 colori ;
b) i vettori di coerenza di colore (CCV, dall'inglese Color Coherence Verctors) nello spazio di colore HSV quantizzato a 64 colori; i pixel di colore vengono definiti coerenti o incoerenti a seconda che essi appartengano o meno a regioni similmente colorate (ossia di uno stesso colore) aventi un'ampiezza maggiore di una soglia; per maggiori dettagli si veda ad esempio "Comparing Images Using Color Coherence Vectors" di G. Pass, R. Zabih ed J. Miller, ACM Multimedia 96, pp . 65-73, 1996;
c) 1'istogramma della transizione di colore quantizzato a 11 colori nello spazio di colore HSV (in particolare rosso, arancione, giallo, verde, blu, porpora,, rosa, marrone, nero, grigio e bianco); per maggiori dettagli si veda ad esempio "A method for thè automatic indexing of color images for effective image retrievial" di I. Gagliardi e R. Schettini, The New Review o.f Hypermedia and Multimedia 3, pp. 201-224, 1997;
d) i momenti di inerzia della distribuzione dei colori nello spazio colore HSV non quantizzato; per maggiori dettagli si veda ad esempio "Similarity of Color Images" di M.A. Stricker e M. Orengo, Paper presented at thè SPIE Storage and Retrieval for Image and Video Databases III Conference, 1995;
e) i momenti di inerzia (valore medio, varianza e "skewness") e la curtosi della luminanza dell'immagine;
f) la percentuale di pixel non colorati nell' immagine;
g) il numero di colori dell'immagine nello spazio di colore HSV quantizzato a 64 colori;
h) le informazioni statistiche sui bordi dell'immagine estratti per mezzo dell'algoritmo di Canny, in particolare:
hi) la percentuale di pixel di bordo a basso, medio ed alto contrasto nell'immagine;
h2) le soglie parametriche sul modulo del vettore gradiente corrispondente a bordi a medio ed alto contrasto;
h3) il numero di regioni connesse identificate da contorni chiusi ad alto contrasto; e
h4) la percentuale di pixel di bordo a medio contrasto connessi a bordi ad alto contrasto;
i) 1'istogramma delle direzioni dei bordi estratte per mezzo del rilevatore di bordo di Canny (quindici barre o intervalli, avente ciascuna una ampiezza angolare di 12°, sono state usate per rappresentare 1'istogramma) ; per maggiori dettagli si veda ad esempio "A r.elevance feedback mechanism for content-based image retrievial" di P. Ciocca e R. Schettini, Information Processing and Management 35, pp. 605-632, 1999;
j ) il valor medio e la varianza dei valori assoluti dei coefficienti delle sottoimmagini dei primi tre livelli di risoluzione della trasformata ’wavelet" con base di Daubechies della luminanza dell'immagine; per maggiori dettagli si veda ad esempio *Wavelet-based Texture Analysis" di P. Scheunders, S. Livens, G. Van de Wouwer, P. Vautrot e D. Van Dyke, International Journal Computer Science and Information management, 1997;
k) la stima delle caratteristiche di tessitura dell'immagine basate sulla matrice NGTDM (dall'inglese Neighborhood Gray-Tone Difference Matrix) , in particolare la granulosità ('coarseness" ), il contrasto ('contrast" ), la rumorosità ("busyness" ), la complessità ('complexity" ). e lo 'strenght" (grandezza utilizzata nell'analisi della tessitura dell'immagine); per maggiori dettagli si veda ad esempio 1) 'Textural features corresponding to textural properties" di M. Amadasun e R. King, IEEE Transaction on System, Man and Cybernetics 19, pp. 1264-1274, 1989; e 2) 'Textural features corresponding to visual perception" di H. Tamura, S.'Mori e T. Yamawaki, IEEE Transaction on System, Man and Cybernetics 8, pp. 460-473, 1978);
m) 1'istogramma cromatico-spaziale delle regioni di colore identificate per mezzo del.processo di quantizzazione a 11 colori dello spazio HSV (per maggiori dettagli si veda la summenzionata pubblicazione Ά relevance feedback mechanism for content-based image retrievial" ), in particolare:
mi) le coordinate del baricentro dei colori; e m.2) la dispersione delle regioni di colore (regioni di pixel con lo stesso colore) rispetto ai loro baricentri;
n) la composizione spaziale delle regioni di colore identificate per mezzo del processo di quantizzazione a 11 colori (per maggiori dettagli si veda la summenzionata pubblicazione Ά relevance feedback mechanism for content-based image retrievial), in particolare:
ni) la frammentazione (il numero di regioni di colore);
n2) la distribuzione delle regioni di colore rispetto al centro dell'immagine; e
n3) la distribuzione delle regioni di colore rispetto all'asse x e rispetto all'asse y.
Come si può osservare, il numero totale di descrittori è relativamente elevato (389) - ma non necessariamente vincolato - dato che sono usati alcuni istogrammi di direzione e colore che hanno dimensioni intrinsecamente grandi; tuttavia, la natura estremamente differente dei descrittori consente di limitare il rischio di avere immagini molto differenti fra loro che vengano classificate nella medesima classe.
Come precedentemente detto, successivamente alla indicizzazione dell'immagine da classificare, il vettore dei descrittori X viene elaborato secondo un algoritmo di elaborazione al fine di identificare la classe dell'immagine.
In particolare, l'elaborazione del vettore dei descrittori X prevede di:
- suddividere lo spazio dei descrittori (spazio vettoriale), definito dagli N descrittori selezionati, in un numero finito di regioni di classificazione, a ciascuna delle quali è associata una rispettiva classe di immagine e ciascuna delle quali è il luogo dei punti dello spazio dei descrittori definito da un insieme finito di 'condizioni poste su una o più componenti del vettore dei descrittori X, ossia, in altri termini, il luogo dei punti dello spazio dei descrittori in cui i valori assunti da una o più componenti del vettore dei descrittori X soddisfano predeterminate relazioni con rispettivi valori di soglia (blocco 30);
- associare il vettore dei descrittori X estratto dall'immagine da classificare allo spazio dei descrittori ed identificare quindi, fra le varie regioni di classificazione in cui lo spazio dei descrittori è suddiviso, una specifica regione di classificazione contenente il vettore dei descrittori X (blocco 40); e
- identificare la classe di immagine associata alla specifica regione di classificazione identificata (blocco 50), la classe dell'immagine sottoposta a classificazione essendo quindi quella associata alla specifica regione di classificazione identificata.
La metodologia di classificazione descritta con riferimento ai blocchi 30-50 viene nella pratica implementata utilizzando un classificatore strutturato ad albero binario, il quale viene convenientemente costruito secondo la nota metodologia "Cart"; per una trattazione dettagliata di questa metodologia si rimanda ai seguenti testi :
1) "Classification and Regression Trees" di L. Breiman, J.H. Friedman, R .A. Olshen e C.J Stone, Wadsworth and Brooks/Cole, Pacific Grove, California, 1984; e
2) "Pattern Recognition and Neural Networks" di B.D Ripley, Cambridge University Press, Cambridge, 1996.
È stata scelta la metodologia Cart in quanto essa consente di gestire qualsiasi combinazione di descrittori scelti fra il suddetto elenco e la coesistenza di relazioni diverse fra i descrittori in differenti regioni di classificazione dello spazio delle caratteristiche di immagine .
Inoltre, la metodologia Cart fornisce una chiara caratterizzazione delle condizioni che pilotano la classificazione, cioè delle condizioni che determinano quando una immagine appartiene ad una determinata classe di immàgini piuttosto che ad un'altra.
La procedura di costruzione del classificatore strutturato ad albero prevede essenzialmente di effettuare una partizione binaria recursiva dello spazio dei descrittori secondo un criterio di partizione binario predeterminato, dal quale vengono desunte le summenzionate condizioni che pilotano la suddivisione dello spazio dei descrittori nelle regioni di classificazione.
In particolare, con riferimento alla figura 2, la costruzione del classificatore strutturato ad albero binario prevede di:
- definire un set di immagini di addestramento comprendente, per ciascuna classe di immagine, una pluralità di immagini aventi differenti caratteristiche (blocco 70) ;
- indicizzare ciascuna delle immagini di addestramento per estrarre da ciascuna di esse un rispettivo vettore dei descrittori, le cui componenti sono costituite dai valori assunti, per detta immagine di addestramento, dai suddetti N descrittori (blocco 80); e - costrui-re il suddetto classificatore strutturato ad albero binario effettuando una procedura di partizione binaria recursiva basata sui vettori dei descrittori estratti dalle immagini di addestramento e su di un criterio di partizione prefissato (blocco 90).
Nella terminologia propria dei processi di costruzione degli alberi, lo spazio dei descrittori definito dagli N descrittori è il nodo radice mentre le varie regioni di classificazione sono i nodi terminali o foglie dell'albero, ciascuno dei quali è etichettato con una relativa classe di immagine.
La classificazione di una immagine viene in pratica effettuata fornendo in ingresso al classificatore strutturato ad albero binario il vettore dei descrittori X di una immagine, percorrendo quindi il classificatore fino a giungere ad un nodo terminale e di associare all'immagine sottoposta a classificazione la classe di immagine costituita dall'etichetta attaccata al nodo terminale entro il quale il vettore dei descrittori X è finito.
La procedura di costruzione di un classificatore strutturato ad albero binario è sostanzialmente definita da tre regole:
- il criterio di suddivisione dei nodi adottato; - il criterio di terminazione della procedura di costruzione; e
- il criterio di etichettamento dei nodi terminali. In particolare:
- il criterio di etichettamento dei nodi terminali è tale da minimizzare la probabilità di errata classificazione delle immagini oppure i costi attesi derivanti da una errata classificazione delle immagini;
- il criterio di suddivisione è tale da rendere più omogenei al loro interno i due nodi figli derivati da un nodo padre in termini di tipologia di immagini in essi contenute; e
- il criterio di terminazione della procedura di costruzione è definito dal raggiungimento di una dimensione minima dei nodi (ossia il raggiungimento di un numero minimo di immagini all'interno di ciascun nodo).
Uno dei problemi chiave del processo di suddivisione dei nodi è come definire la bontà della suddivisione. L'approccio più largamente utilizzato è quello di selezionare la suddivisione che faccia sì che i dati contenuti nei nodi figli siano più "omogenei" dei dati contenuti nel nodo padre. Una funzione che definisce una misura della bontà della suddivisione è la funzione "impurità dei nodi", la quale misura in pratica il "disordine" delle classi di immagine all'interno del nodo e tanto più piccola è l'impurità di un nodo tanto più elevata è la bontà della suddivisione.
In altri termini, per effettuare la suddivisione di un nodo vengono prima di tutto generate una pluralità di possibili suddivisioni imponendo un insieme finito di condizioni su ogni componente del vettore dei descrittori e fra le varie possibilità di suddivisione viene scelta quella che massimizza la differenza fra l'impurità del nodo padre e le impurità dei nodi figli.
Un'altra funzione utilizzabile per misurare la bontà di una suddivisione di un nodo è la riduzione della devianza; per una trattazione più dettagliata si rimanda ai seguenti testi:
1) "Tree-based models" di L.A. Clark e D. Pregibon, Statistical Models in S., J.M. Chambers and T.J. Hastie (eds.), pp. 377-419, Chapman and Hall, London, 1992; e 2) "Generalized Linear Models" di P. McCullagh e J.A. Nelder, Chapman and Hall, London, 1989.
In generale, i classificatori strutturati ad albero possono essere molto grossi,,sovraccarichi di dati anche se definenti modelli poveri della struttura del problema. Uno dei vantaggi significativi della metodologia Cart è che "l'albero esplorativo" ottenuto originariamente può essere sfoltito e la procedura di sfoltimento produce una sequenza di sottoalberi, le prestazioni di ciascuno dei quali, in termini di probabilità di errata classificazione, o di costi attesi derivanti da una errata classificazione, sono valutate sulla base di set di immagini di test non presenti nel set di immagini di addestramento o per mezzo del cosiddetto approccio di validazione incrociata ("cross-validation approach" ) applicato al set di immagini di addestramento.
L'utilizzo, come classificatori, degli alberi migliori della sequenza di alberi sfoltiti, invece degli alberi esplorativi, fornisce classificatori più economici e riduce la forte dipendenza delle predizioni dal set di immagini di addestramento.
Il presente metodo di classificazione è stato sottoposto dalla richiedente ad un test su problema di classificazione cosiddetto ad alto livello in cui occorreva distinguere fotografie da grafici e testi.
In particolare, il test è stato effettuato utilizzando sia il set di immagini di addestramento utilizzate per la costruzione del classificatore sia un set di immagini di set del tutto scorrelato ed indipendente dal set di immagini di addestramento.
In dettaglio, per il test è stato utilizzato un database di immagini formato da 4500 immagini provenienti da varie sorgenti: immagini scaricate dal Web o acquisite per mezzo di uno scanner e versioni 'bitmap" di pagine elettroniche. In particolare, il database di immagini comprendeva 2600 fotografie, 1300 grafici e 700 testi.
Le varie immagini differivano nella dimensione (variabile fra 120x120 e 1500x1500 pixel), nella risoluzione e nella profondità tonale. Le classi di fotografie includevano fotografie di scene realizzate in interni e in esterni, paesaggi, gente e cose; la classe di grafici comprendeva stendardi, logotipi, mappe, schizzi e grafici fotorealistici; la classe dei testi comprendeva invece testi manoscritti digitalizzati, testi in bianco e nero e a colori, scannerizzati o generati a computer in vari caratteri. Le classi dei testi e dei grafici comprendevano immagini, quali ad esempio testi con sfondo altamente colorato, o solamente poche parole in larghi caratteri, e grafici fotorealistici, la cui classificazione può essere particolarmente difficoltosa.
Inizialmente sono stati costruiti alcuni alberi esplorativi utilizzando diversi set di immagini di addestramento composti da circa 1600 immagini (circa 700 fotografie, 600 grafici e 300 testi) estratte casualmente dal suddetto database; in tutti gli esperimenti le immagini non comprese nel set di immagini di addestramento sono 'state usate per formare un set di immagini di test.
Negli esperimenti effettuati utilizzando il set di immagini di addestramento e gli alberi esplorativi, le percentuali di corretta classificazione delle immagini sono state le seguenti: fotografie 95%-97%; grafici 91%-93%; testi 94%-97%, mentre negli esperimenti effettuati utilizzando il set di immagini di test e gli alberi esplorativi, le percentuali di corretta classificazione delle immagini sono state le seguenti: fotografie 90%91%; grafici 801-85%; testi 89%-91%.
Sono poi stati ripetuti tali esperimenti utilizzando alberi sfoltiti ottenuti eliminando quei descrittori che catturavano caratteristiche puramente locali, quali, ad esempio, gli istogrammi dei colori e delle direzioni dei bordi, ottenendo così un set di 72 descrittori.
Negli esperimenti effettuati utilizzando gli alberi sfoltiti si è avuto un aumento medio della probabilità di corretta classificazione del 4% per le foto e del 3% per i grafici; in particolare, utilizzando il set di immagini di addestramento, le percentuali di corretta classificazione delle immagini sono aumentate e sono state le seguenti: fotografie 97%-98%; grafici 93%-95%; testi 93%-96%, mentre il set di immagini di test, le percentuali di corretta classificazione delle immagini sono state le seguenti: fotografie 94%-95%; grafici 84%-87%; testi 88%-91%.
Da un esame delle caratteristiche del metodo di classificazione realizzato secondo la presente invenzione sono evidenti i vantaggi che esso consente di ottenere .
In particolare, si sottolinea il fatto che i risultati sorprendenti sopra illustrati sono ottenibili con uno sfruttamento delle risorse computazionali molto inferiore a quello necessario per 1'implementazione dei metodi secondo l'arte nota-in quanto l'unico vero sforzo computazionale è costituito dalla costruzione del classificatore strutturato ad albero, la quale avviene una volta sola ed al di fuori del flusso di esecuzione in fase di utilizzo del metodo.
Inoltre il presente metodo di classificazione è altamente ottimizzabile e modulare, si presta ad una implementazione attraverso strutture architetturali di tipo parallelo ed è estremamente 'robusto", in quanto l'utilizzo di un classificatore' strutturato ad albero elimina del tutto la possibilità di non prendere in considerazione particolari casistiche che possono presentarsi nelle immagini.
Risulta infine chiaro che al metodo di classificazione qui descritto ed illustrato possono essere apportate modifiche e varianti senza per questo uscire dall'ambito protettivo della presente invenzione.
Claims (9)
- R I V E N D I C A Z I O N I 1. Metodo di classificazione di immagini in formato digitale in base al loro contenuto, caratterizzato dal fatto di comprendere le fasi di: - definire un set di descrittori a basso livello adescriventi il contenuto semantico dell'immagine, detti descrittori essendo grandezze ricavabili dall'immagine tramite espressioni logico-matematiche note a priori e la scelta di detti descrittori dipendendo dalle classi di immagine utilizzate nella classificazione; - suddividere lo spazio dei descrittori definito da detti descrittori in un numero finito di regioni di classificazione, a ciascuna di dette regioni di classificazione essendo associata una rispettiva classe di immagine e ciascuna di dette regioni di classificazione essendo il luogo dei punti di detto spazio dei descrittori definito da un insieme finito di condizioni poste su almeno una componente di detto vettore dei descrittori; indicizzare una immagine da classificare per estrarre da essa un vettore dei descrittori le cui componenti sono costituite dai valori assunti, in detta immagine, da detti descrittori; - identificare, fra dette regioni di classificazione, una specifica regione di classificazione contenente detto vettore dei descrittori; e - identificare la classe di immagine associata a detta specifica regione di classificazione.
- 2. Metodo di classificazione secondo la rivendicazione 1, caratterizzato dal fatto che.detti‘descrittori di detto set sono scelti nel gruppo comprendente: a) 1'istogramma di colore nello spazio di colore HSV quantizzato a 64 colori; b) i vettori di coerenza di colore nello spazio di colore HSV quantizzato a 64 colori; c) 1'istogramma della transizione di colore quantizzato a 11 colori nello spazio di colore HSV; d) i momenti di inerzia della distribuzione dei colori nello spazio di colore HSV non quantizzato; e) i momenti di inerzia e la curtosi della luminanza dell'immagine; f) la percentuale di pixel non colorati nell'immagine; g) il numero di colori dell'immagine nello spazio di colore HSV quantizzato à 64 colori; h) le informazioni statistiche sui bordi dell'immagine estratti per mezzo dell'algoritmo di Canny, in particolare: hi) la percentuale di pixel di bordo a basso, medio ed alto contrasto nell'immagine; h2) le soglie parametriche sull'intensità del gradiente corrispondente a bordi a medio ed alto contrasto; h3) il numero di regioni connesse identificate da contorni chiusi ad alto contrasto; e h4) la percentuale di pixel di bordo a medio contrasto connessi a bordi ad alto contrasto; i) 1'istogramma delle direzioni dei bordi estratte per mezzo del rilevatore di bordo di Canny; j) il valor medio e la varianza dei valori assoluti dei coefficienti delle sottoimmagini dei primi tre livelli di risoluzione della trasformata "wavelet" con base di Daube'chies della luminanza dell'immagine; k) la stima delle caratteristiche di tessitura dell'imagine basate sulla matrice NGTDM (Neighborhood Gray-Tone Difference Matrix), in particolare la granulosità, il contrasto, la rumorosità, la complessità e lo *strenght" ; m)-l'istogramma cromatico-spaziale delle regioni di colore identificate per mezzo del processo di quantizzazione a 11 colori dello spazio HSV, in particolare: mi) le coordinate del baricentro dei colori; e m2) la dispersione delle regioni di colore rispetto ai loro baricentri; n) la composizione spaziale delle regioni di colore identificate per mezzo del processo di quantizzazione a 11 colori, in particolare: ni) frammentazione; n2) distribuzioni delle regioni di colore rispetto al centro dell'immagine; e n3) distribuzione delle regioni di colore rispetto all'asse x e rispetto all'asse y.
- 3. Metodo di classificazione secondo la rivendicazione 1 o 2, caratterizzato dal fatto che detta fase di suddividere detto spazio dei descrittori comprende la fase di: - costruire un classificatore strutturato ad albero partizionando recursivamente detto spazio dei descrittori secondo un determinato criterio di partizione.
- 4. Metodo di classificazione secondo la rivendicazione 3, caratterizzato dal fatto che detto classificatore è un classificatore strutturato ad albero binario.
- 5. Metodo di classificazione secondo la rivendicazione 3 o 4, caratterizzato dal fatto che detto classificatore strutturato ad albero è costruito utilizzando la metodologia Cart.
- 6. Metodo di classificazione secondo una qualsiasi delle rivendicazioni da 3 a 5, caratterizzato dal fatto che detta fase di costruire un classificatore strutturato ad albero comprende le fasi di: - definire un set di immagini di addestramento comprendente, per ciascuna classe di immagine, una pluralità di immagini aventi differenti caratteristiche; - indicizzare ciascuna di dette immagini di addestramento per estrarre, da ciascuna di esse, un rispettivo detto vettore dei descrittori; - costruire detto classificatore strutturato ad albero a partire dai vettori di immagine estratti da dette immagini di addestramento e a detto determinato criterio di partizione.
- 7. Metodo di classificazione secondo la rivendicazione 6, caratterizzato dal fatto che detta fase di costruire detto classificatore strutturato ad albero comprende la fase di: - etichettare nodi terminali di detto classificatore secondo un criterio di etichettamento minimizzante la probabilità 'di classificazione errata di una immagine.
- 8. Metodo di classificazione secondo una qualsiasi delle rivendicazioni da 3 a 7, caratterizzato dal fatto che detto criterio di partizione è 'tale da rendere più omogenei al loro interno i due nodi figli derivanti dalla suddivisione di un nodo padre in termini di tipologia di immagini in essi contenute.
- 9. Metodo di classificazione di una immagine in formato digitale in base al suo contenuto, sostanzialmente come descritto con riferimento ai disegni allegati
Priority Applications (4)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| IT1999TO000996A IT1311443B1 (it) | 1999-11-16 | 1999-11-16 | Metodo di classificazione di immagini digitali in base al lorocontenuto. |
| EP00830029A EP1102180A1 (en) | 1999-11-16 | 2000-01-20 | Content-based digital-image classification method |
| US09/714,843 US8452088B1 (en) | 1999-11-16 | 2000-11-15 | Content-based digital-image classification method |
| JP2000350169A JP3481911B2 (ja) | 1999-11-16 | 2000-11-16 | 内容別デジタルイメージ分類方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| IT1999TO000996A IT1311443B1 (it) | 1999-11-16 | 1999-11-16 | Metodo di classificazione di immagini digitali in base al lorocontenuto. |
Publications (3)
| Publication Number | Publication Date |
|---|---|
| ITTO990996A0 ITTO990996A0 (it) | 1999-11-16 |
| ITTO990996A1 true ITTO990996A1 (it) | 2001-05-16 |
| IT1311443B1 IT1311443B1 (it) | 2002-03-12 |
Family
ID=11418221
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| IT1999TO000996A IT1311443B1 (it) | 1999-11-16 | 1999-11-16 | Metodo di classificazione di immagini digitali in base al lorocontenuto. |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US8452088B1 (it) |
| EP (1) | EP1102180A1 (it) |
| IT (1) | IT1311443B1 (it) |
Families Citing this family (18)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20050163378A1 (en) * | 2004-01-22 | 2005-07-28 | Jau-Yuen Chen | EXIF-based imaged feature set for content engine |
| US20100312609A1 (en) * | 2009-06-09 | 2010-12-09 | Microsoft Corporation | Personalizing Selection of Advertisements Utilizing Digital Image Analysis |
| KR101165357B1 (ko) * | 2011-02-14 | 2012-07-18 | (주)엔써즈 | 이미지 특징 데이터 생성 장치 및 방법 |
| KR101794910B1 (ko) * | 2011-06-07 | 2017-11-07 | 삼성전자주식회사 | 다차원 데이터에 관한 영역 질의의 선택도를 계산하는 장치 및 방법 |
| US8903182B1 (en) * | 2012-03-08 | 2014-12-02 | Google Inc. | Image classification |
| CN102855492B (zh) * | 2012-07-27 | 2015-02-04 | 中南大学 | 基于矿物浮选泡沫图像的分类方法 |
| JP5897445B2 (ja) * | 2012-09-28 | 2016-03-30 | 富士フイルム株式会社 | 分類装置、分類プログラムおよび分類装置の動作方法 |
| CN103488689B (zh) * | 2013-09-02 | 2017-09-12 | 新浪网技术(中国)有限公司 | 基于聚类的邮件分类方法和系统 |
| CN103743293B (zh) * | 2013-12-31 | 2015-07-22 | 华中科技大学 | 一种利用大型植被区域前视红外制导的参考图制备方法 |
| US10235338B2 (en) * | 2014-09-04 | 2019-03-19 | Nvidia Corporation | Short stack traversal of tree data structures |
| US9552664B2 (en) | 2014-09-04 | 2017-01-24 | Nvidia Corporation | Relative encoding for a block-based bounding volume hierarchy |
| CN107992887B (zh) * | 2017-11-28 | 2021-02-19 | 东软集团股份有限公司 | 分类器生成方法、分类方法、装置、电子设备及存储介质 |
| US11182424B2 (en) | 2018-05-08 | 2021-11-23 | Spotify Ab | Image based content search and recommendations |
| US11263493B2 (en) * | 2019-06-25 | 2022-03-01 | Spotify Ab | Automatic metadata detector based on images |
| CN111127476B (zh) * | 2019-12-06 | 2024-01-26 | Oppo广东移动通信有限公司 | 一种图像处理方法、装置、设备及存储介质 |
| CN112967191B (zh) * | 2021-02-19 | 2023-12-05 | 泰康保险集团股份有限公司 | 图像处理方法、装置、电子设备和存储介质 |
| US12596766B2 (en) * | 2021-06-02 | 2026-04-07 | Adobe Inc. | Automatically generating an image dataset based on object instance similarity |
| CN117173426B (zh) * | 2023-09-28 | 2025-09-23 | 江西万泰铝业有限公司 | 一种基于图像识别的废旧有色金属碎料识别方法及装置 |
Family Cites Families (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5280547A (en) * | 1990-06-08 | 1994-01-18 | Xerox Corporation | Dense aggregative hierarhical techniques for data analysis |
| US5546474A (en) | 1993-12-21 | 1996-08-13 | Hewlett-Packard Company | Detection of photo regions in digital images |
| US5963966A (en) | 1995-11-08 | 1999-10-05 | Cybernet Systems Corporation | Automated capture of technical documents for electronic review and distribution |
| JP2737734B2 (ja) | 1995-12-13 | 1998-04-08 | 日本電気株式会社 | 指紋分類装置 |
| US5963670A (en) * | 1996-02-12 | 1999-10-05 | Massachusetts Institute Of Technology | Method and apparatus for classifying and identifying images |
| US5915250A (en) | 1996-03-29 | 1999-06-22 | Virage, Inc. | Threshold-based comparison |
| US6229923B1 (en) * | 1998-01-21 | 2001-05-08 | Xerox Corporation | Method and system for classifying and processing of pixels of image data |
| US6347153B1 (en) * | 1998-01-21 | 2002-02-12 | Xerox Corporation | Method and system for classifying and processing of pixels of image data |
| US6549658B1 (en) * | 1998-01-21 | 2003-04-15 | Xerox Corporation | Method and system for classifying and processing of pixels of image data |
| US6185328B1 (en) * | 1998-01-21 | 2001-02-06 | Xerox Corporation | Method and system for classifying and processing of pixels of image data |
| US6240424B1 (en) * | 1998-04-22 | 2001-05-29 | Nbc Usa, Inc. | Method and system for similarity-based image classification |
| US6480627B1 (en) * | 1999-06-29 | 2002-11-12 | Koninklijke Philips Electronics N.V. | Image classification using evolved parameters |
| US6580824B2 (en) * | 2001-05-14 | 2003-06-17 | Hewlett-Packard Development Company, L.P. | Classification of photos with sepia tones |
-
1999
- 1999-11-16 IT IT1999TO000996A patent/IT1311443B1/it active
-
2000
- 2000-01-20 EP EP00830029A patent/EP1102180A1/en not_active Ceased
- 2000-11-15 US US09/714,843 patent/US8452088B1/en not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| ITTO990996A0 (it) | 1999-11-16 |
| US8452088B1 (en) | 2013-05-28 |
| EP1102180A1 (en) | 2001-05-23 |
| IT1311443B1 (it) | 2002-03-12 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN109829914A (zh) | 检测产品缺陷的方法和装置 | |
| US8995761B2 (en) | Image processing apparatus, image processing method, and computer-readable medium | |
| Liang et al. | Multi-spectral fusion based approach for arbitrarily oriented scene text detection in video images | |
| US20140093163A1 (en) | Perceptually lossless color compression | |
| Greenfield | Image recoloring induced by palette color associations | |
| US8452088B1 (en) | Content-based digital-image classification method | |
| CN114170418B (zh) | 一种以图搜图的汽车线束连接器多特征融合图像检索方法 | |
| CN105844675A (zh) | 色织物的颜色聚类分析方法 | |
| KR20050006089A (ko) | 칼라 이미지에서 얼굴들을 검출하기 위한 방법 및 디바이스 | |
| Oliva et al. | Image processing | |
| Ajallouian et al. | A novel method for the identification of weave repeat through image processing | |
| CN101802844A (zh) | 将分割引擎应用于数字图像的不同映射 | |
| Zhang et al. | Automatic detection of layout of color yarns of yarn‐dyed fabric. Part 2: Region segmentation of double‐system‐Mélange color fabric | |
| CN103279960B (zh) | 一种基于x射线背散射图像的人体隐藏物的图像分割方法 | |
| CN115761341A (zh) | 基于图像识别的纺织废料自动分类方法及装置 | |
| CN115082741A (zh) | 基于图像处理的废旧纺织品分类方法 | |
| Sahib et al. | Deep learning for image forgery classification based on modified Xception net and dense net | |
| US20250086994A1 (en) | Methods and systems for determining an object map | |
| Carro-Calvo et al. | An incremental-encoding evolutionary algorithm for color reduction in images | |
| Moustafa et al. | Reconstructed color image segmentation | |
| Ouzounis | Segmentation strategies for the alpha-tree data structure | |
| Dahan et al. | COFGA: A dataset for fine grained classification of objects from aerial imagery | |
| Uma et al. | Detection of shapes and counting in toy manufacturing industry with help of Phython | |
| Togban et al. | Identifying color space for improved image display | |
| Havlíček et al. | Optimized texture spectral similarity criteria |