ITRM960796A1 - Tecnica di reperimento dei dati in sistemi per la gestione automatiz zata delle informazioni mediante riconoscimento vocale delle richie - Google Patents

Tecnica di reperimento dei dati in sistemi per la gestione automatiz zata delle informazioni mediante riconoscimento vocale delle richie Download PDF

Info

Publication number
ITRM960796A1
ITRM960796A1 IT96RM000796A ITRM960796A ITRM960796A1 IT RM960796 A1 ITRM960796 A1 IT RM960796A1 IT 96RM000796 A IT96RM000796 A IT 96RM000796A IT RM960796 A ITRM960796 A IT RM960796A IT RM960796 A1 ITRM960796 A1 IT RM960796A1
Authority
IT
Italy
Prior art keywords
information
database
voice recognition
alphabetic
requests
Prior art date
Application number
IT96RM000796A
Other languages
English (en)
Inventor
Cataldo Adamo
Original Assignee
Cirte Manifatturiera Spa
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Cirte Manifatturiera Spa filed Critical Cirte Manifatturiera Spa
Priority to IT96RM000796A priority Critical patent/IT1290785B1/it
Publication of ITRM960796A0 publication Critical patent/ITRM960796A0/it
Priority to EP97830594A priority patent/EP0844574A3/en
Publication of ITRM960796A1 publication Critical patent/ITRM960796A1/it
Application granted granted Critical
Publication of IT1290785B1 publication Critical patent/IT1290785B1/it

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/903Querying
    • G06F16/90335Query processing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L2015/085Methods for reducing search complexity, pruning

Landscapes

  • Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Telephonic Communication Services (AREA)

Description

Descrizione dell'invenzione avente per titolo:
"TECNICA DI REPERIMENTO DEI DATI IN SISTEMI PER LA GESTIONE AUTOMATIZZATA DELLE INFORMAZIONI MEDIANTE RICONOSCIMENTO VOCALE DELLE RICHIESTE DI TIPO ALFABETICO"
DESCRIZIONE
L'invenzione fa riferimento in generale alle tecniche di registrazione e reperimento automatizzato di informazioni in archivi di tipo informatico, e più in particolare essa tratta di una tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale fonetico delle richieste alfabetiche basato su algoritmi di tipo statistico.
E' bene premettere che esiste una distinzione fra "riconoscimento" della voce e "comprensione" delle voci . Riconoscere una parola (o una sillaba o un fonema, o una frase) significa attribuire una "etichetta" ad un segmento di segnale vocale sulla base di una precedente classificazione. Il processo di comprensione parte da tali etichette per giungere ad una rappresentazione formale del significato della frase.
Anche limitandosi al solo riconoscimento tuttavia il principale ostacolo per realizzare un riconoscitore di parlato é l'estrema variabilità del segnale vocale. L'uomo é in grado di riconoscere il parlato di persone differenti, con accenti diversi ed in presenza di segnali disturbanti, inoltre é in grado di riconoscere una parola sia quando é pronunciata singolarmente sia quando é appena accennata nel contesto di una frase. Un riconoscitore non é in generale, capace di identificare segnali tanto diversi, né di scomporre nelle singole parole un parlato fluente. Si può pertanto affermare che il problema del riconoscimento del parlato non é nella sua generalità affatto risolto.
Le cause della variabilità del segnale vocale vengono usualmente suddivise in fattori di produzione, quali il parlatore, il messaggio stesso, e fattori di post-produzione, il canale di comunicazione.
Per "dipendenza dal parlatore" si intende che la ripetizione di un messaggio da parte di una stessa persona o di persone diverse, porta a produrre due segnali acustici tra loro differenti. Naturalmente queste differenze saranno piccole nel caso di ripetizione da parte dello stesso parlatore e assai'maggiori quando il messaggio viene ripetuto da un parlatore diverso.
Per "dipendenza dal messaggio" si designano le cause di variabilità di tipo linguistico, o meglio contestuale. Il segnale acustico relativo ad una parola o, in misura ancor più rilevante, il segnale acustico relativo ad una sillaba o ad un fonema, risulta essere assai diverso quando la parola viene pronunciata isolatamente, cioè da sola in un contesto di silenzio, rispetto a quando la parola viene "immersa" nel contesto di una frase o di un discorso.
Per "dipendenza dal canale" si intende l'alterazione introdotta nel segnale vocale durante il passaggio dal parlatore all'ascoltatore alterazione dovuta alla presenza contemporanea del rumore ambiente (rumore dovuto ad altre sorgenti e/o riverberazioni del locale in cui avviene l'emissione ed alle alterazioni proprie del mezzo trasmissivo, quale ad esempio il collegamento telefonico) .
Gli approcci per risolvere il problema del riconoscimento del parlato sono molteplici ma possono esser ricondotti alle quattro tipologie seguenti.
Un primo approccio, quello oggi usato nei riconoscitori commerciali si basa sull'estrazione di alcuni parametri tipici del segnale, e sul confronto con un certo numero di maschere memorizzate nella fase di apprendimento. Questo approccio al problema definito di tipo globale presenta però numerosi inconvenienti: difatti esso richiede la memorizzazione di una o più maschere per ogni parola da riconoscere e richiede il confronto di tutte le maschere con il segnale in ingresso.
Un altro approccio al problema, é quello "fonetico" o "segmentale": l'obiettivo di questa metodologia é il riconoscimento del fonema, ossia dell'elemento minimo che entra nella composizione del linguaggio articolato. Attraverso questo riconoscimento é possibile ricostruire le singole parole e da queste il discorso avvicinandosi notevolmente all'obiettivo ultimo del riconoscimento del parlato. I fonemi hanno un alto grado di variabilità nelle loro realizzazioni acustiche, variabilità legate essenzialmente alle loro variazioni contestuali e pertanto il riconoscimento risulta essere al quanto complesso.
Un'altra metodologia per il riconoscimento vocale é quella dei modelli statistici Markoviani . Seguendo questo approccio, l'intero canale di comunicazione viene scomposto in due distinti modelli, il modello del canale acustico che tiene conto delle variazioni del segnale acustico relativo ai singoli fonemi, ed il modello del linguaggio che tiene conto delle variazioni del testo.
Infine un ultimo approccio al problema del riconoscimento vocale é quello che si basa su reti neuronali. L'approccio neuronaie tenta una modellazione computazionale dei meccanismi della percezione.
Lo scopo della presente invenzione é quello di fornire una veloce ed efficiente tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico, basata su criteri di selezione di tipo statistico e che sintetizzando gli aspetti più favorevoli delle varie tecniche sunnominate possa tenere debitamente in considerazione l'attendibilità fonetica, le classi di confusibilità e le informazioni di tipo linguistico relative al sistema di reperimento dei dati da implementare
E' ulteriore scopo della presente invenzione quello di fornire una tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico che sia di fatto immune da eventi di disturbo penalizzanti l'efficienza del riconoscimento vocale e del reperimento dei dati.
E' infine scopo della presente invenzione quello di fornire un apparato che realizzi una tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale della richiesta di tipo alfabetico impiegante un'architettura modulare allo scopo di adattarsi con facilità alle varie situazioni di impiego; inoltre si vuole che l'architettura sia di tipo "aperto" al fine di integrare altre funzionalità che la tecnologia metterà via via a disposizione. Più in generale l'invenzione si pone l'obiettivo di impiegare procedure e tecnologie standard nell'ambito delle costruzioni telematiche al fine di rendere l'apparato di costo contenuto e di facile manutenzione.
Questi ed altri scopi che saranno chiari nel corso della descrizione vengono ottenuti con una tecnica in cui il reperimento dei dati avviene mediante il riconoscimento vocale delle richieste di tipo alfabetico e la successiva estrazione dal database di D record unici, di una serie di possibili alternative; tali alternative di record canditati sono ordinate per ciascun campo richiesto in base all'applicazione di un algoritmo di gestione dell'incertezza nella ricerca che valuta la probabilità che nessun record del database si trovi nella lista di lunghezza W dei migliori sulla base del prodotto:
dove N é il numero totale dei record che il database può contenere ed e' D W < = N. Secondo tale tecnica viene quindi scelto un numero predeterminato di record candidati con le migliori probabilità per una successiva ricerca incrociata sullo stesso database, venendo da tali ricerche generate tutte le combinazioni possibili dalle quali si selezionano solo quelle di fatto presenti nel database.
Al solo scopo esemplificativo e senza con ciò voler limitare la generalità ed i possibili campi di applicazione, di seguito viene descritta una realizzazione preferita dell'invenzione con riferimento alla Figura allegata in cui é riportato uno schema a blocchi delle varie unità funzionali costituenti l'apparato secondo la presente invenzione.
In detta Figura si distinguono i blocchi funzionali di seguito specificati.
Il riconoscimento vocale 1 effettua il riconoscimento del parlato, per esempio di tipo telefonico, indipendentemente dal soggetto, utilizzando un processo di riconoscimento dei fonemi basato su tecniche di individuazione di tipo statistico. La qualità del riconoscimento é ulteriormente incrementata grazie all'uso di vocabolari attivi, forniti dal sistema di gestione del dialogo che sfrutta le previsioni dipendenti dal contesto della conversazione.
Il gestore del dialogo 2 esercita il controllo principale sul sistema intrattenendo dialoghi pilotati (determinati al raggiungimento dell'obiettivo) anche attraverso richieste di conferma e chiarificazione di dubbi. Gli stili del dialogo sono variabili, dipendono dalla specifica interazione uomo-computer, e consentono un dialogo veloce nel caso di utenti esperti . Nel caso in cui le richieste non possono essere soddisfatte, il sistema si congeda cordialmente, trasferendo la chiamata all'operatore e comunicandogli la storia del dialogo avvenuto fino a quel momento.
Il modulo di accesso al database 4 assicura un rapido accesso alla base di dati 5 e permette di effettuare una ricerca su qualunque campo componente il record .
La ricerca é effettuata utilizzando specifiche informazioni, ed inoltre é possibile effettuare richieste anche facendo uso di caratteri "wildcard" od alternativi. I record probabili individuati sono classificati in base al numero di campi che hanno soddisfatto i parametri di ricerca, e vengono ordinati in base a questa classificazione. Questo assicura che il sistema di gestione del dialogo abbia a disposizione il massimo numero di informazioni possibile per decidere quale dialogo avviare, allo scopo di completare con successo la richiesta di informazioni; così come verrà esposto più specificamente di seguito nella descrizione del tipo di gestione dell'incertezza nella ricerca sul database.
Il sintetizzatore vocale 3 é in grado di generare in maniera dinamica, cioè ih tempo reale,·parole basandosi. su fonemi.
Il gestore del database 6 fornisce la possibilità di aggiornare la base di dati.senza richiedere un addestramento successivo. Questa gestione costituisce un'attività supplementare a quella principale di richiesta di informazioni all'elenco, ed é stata specificatamente progettata per l'aggiornamento delle informazioni del database e la generazione di nuovi dati per il sistema (es. aggiornamento del dizionario delle pronunce 7).
In una applicazione immediata, quale può essere il servizio di richiesta di numeri telefonici da un elenco abbonati l'utente attraverso un telefono connesso alla rete telefonica commutata, effettua la selezione del numero telefonico al quale é connesso il sistema. Dopo un messaggio di presentazione il sistema chiede all'utente di pronunciare delle informazioni quali il nome della città e successivamente il cognome.
Il sistema di riconoscimento estrae dal database 3 una serie di alternative. I candidati individuati per ogni campo richiesto sono ordinati in base alla probabilità di corretto riconoscimento; tali probabilità sono il risultato di algoritmi che tengono in considerazione l'attendibilità fonetica, le classi di confusibilità e le informazioni di tipo linguistico. Questi algoritmi sono stati progettati su base teorica ed arricchiti su base euristica ed infine ottimizzati usando tecniche di apprendimento adattativo .
In particolare se si assume che n·1, n2, n3, n4 e n5 siano il numero di unici nomi di città, cognomi, nomi propri, nomi di strade e numeri civici, rispettivamente e si assume inoltre che w ,1w2, w3, e siano il numero di unici nomi di città, cognomi, nomi propri, nomi di strade e numeri civici, rispettivamente, che si trovano nella lista degli n-migliori, il numero totale di records (indirizzi cotnpleti) possibili é:
N = n1.n2 ,n3 .n4 .n5
ed il numero totale di records che possono essere prodotti da tutte le combinazioni disponibili nella lista degli n-migliori é:
W = w1.w2.w3.w4.w5
Per cui se si ha un database contenente D record unici, definita:
P = la probabilità che nessun elemento di D si trovi in W, se il database contiene un solo record, la probabilità che quel record non sia nell'insieme W
Se il database contiene due records, la probabilità che nessuno dei due sia nell'insieme W é: la probabilità che il primo record non sia in W, moltiplicata per la probabilità che il secondo record non sia in W, cioè:
Va notato che, nel secondo termine dell'espressione, il numero totale di records che possono essere uguali al secondo record del database é ridotto di uno; la ragione é che, dopo il controllo per il primo record del database, sappiamo che quel primo record deve essere ignorato nella ricerca successiva (dato che i record del database sono unici).
Dunque, nel caso generale in cui ci sono D records nel database, si ha che il valore di P si calcola come segue:
In un caso di base si é considerato un database costituito da mille records con liste di 30 città, 50 nomi propri, 150 cognomi, 120 nomi di strade e 10 numeri civi. Posto che il numero di records unici contenuti nella lista n-migliori sia 10 in tutti i casi, eccetto che per il numero civico, per il quale siassume che sia 1, la probabilità che nessun elemento del database contenga, in ciascuno dei suoi cinque campi, un elemento presente nella rispettiva lista n-migliore é 0.9636.
Più semplicemente, ciò vuol dire che é estremamente improbabile che un record generato a caso nelle circostanze descritte corrisponda ad un record realmente presente nel database.
Tale probabilità é infatti pari alla:
Probabilità di una corrispondenza casuale = 1 -0.9636 = 0.0364
Ora, il sistema di riconoscimento é sufficientemente potente da riconoscere, in media, il 60 per cento dei fonemi originali. Questo vuol dire che, su una lista n-migliore di lunghezza sufficiente (empiricamente fissata al momento a 20), la probabilità che la parola originale sia nella lista é molto alta (circa nel 70 per cento dei casi la parola originale é in ognuna delle cinque liste che contribuiscono ai cinque campi del database). D'altro canto, data la lunghezza delle liste w, é chiaro che molte altre combinazioni saranno riconosciute (W). E' dunque necessario assicurarsi che tali combinazioni, nella stragrande maggioranza dei casi, non si trovino nel database originario casualmente. La probabilità P assicura tali presupposti.
Lo studio probabilistico é stato quindi condotto valutando i cambiamenti all'aumentare del numero dei vari dati nel database. Per i casi in esame la dimensione del database é stata fissata a 10000 records, il che ha fornito una probabilità di corrispondenza casuale completa di 1 - 0.6905 = 0.3095.
Questa figura é piuttosto alta ma, naturalmente, é improbabile che tale aumento nelle dimensioni del database si verifichi senza un corrispondente aumento dei dati di partenza.
Per quel che riguarda l'effetto di un corrispondente aumento nei dati di partenza, i calcoli dimostrano che, aumentando la dimensione del database di un fattore 10, e aumentando il numero di nomi e cognomi di un fattore 10 ciascuno, la probabilità di corrispondenza casuale completa discende da 0.3095 a 0.0037; aumentando il numero delle città (n-^) da 30 a 100 si ottiene una riduzione della probabilità di corrispondenza casuale completa da 0.3095 a 0.1052; aumentando ulterìoremente n1 fino a 1000 risulta in una riduzione fino a 0.0110; e quando n2 raggiunge 100000, la probabilità di corrispondenza casuale completa é solamente 0.0001.
Riassumendo si ha che un numero Nc di candidati con le migliori probabilità vengono scelti dal sistema per la fase successiva di ricerca incrociata nel database, ed anche allargando notevolmente la scala del sistema, Nc rimane comunque un valore dello stesso ordine. A questo punto gli insiemi di candidati (città e cognomi) ognuno al massimo di dimensione Nc, vengono utilizzati per "generare" tutte le combinazioni possibili, dalle quali vengono selezionate solo quelle presenti nel database. Successivamente il sistema richiede informazioni particolari (o il nome proprio oppure la via), a seconda di cosa sia ritenuto più utile.
I candidati globali (cioè quelli presenti nel database) ereditano le probabilità combinate dei campi costituenti. Da notare che l'assenza di un campo non inficia la ricerca del candidato globale, ma determina solo la penalizzazione probabilistica. In questo modo, il sistema è in grado di funzionare anche nel caso di eventi traumatici (per esempio, rumore di linea, colpo di tosse, ecc.).
Ad ogni informazione che l'utente introduce si restringe l'insieme dei records possibili, fino a giungere eventualmente ad un numero ristretto di candidati globali (da 1 a 6), le cui probabilità sono almeno l'85% migliori che per il resto. Tali candidati sono proposti all'utente per una conferma (fornendogli i dati necessari per eliminare eventuali ambiguità finale, che possono variare dall'intero record alla conferma di un solo campo) prima di passare alla lettura della corrispondente informazione ricercata. Non é detto comunque che il sistema possa giungere sempre ad un ristretto campo di candidati, in tal caso la chiamata è trasferita ad un eventuale operatore. E' da sottolineare che con tale approccio viene richiesto all'utente una sola fase di conferma in tutta la sessione.
In un'analisi più dettagliata delle funzionalità dei vari blocchi costitutivi il sistema di riconoscimento vanno distinte le fasi che seguono.
A) Riconoscitore vocale
La funzione di riconoscimento vocale elabora dialoghi sostenuti in modo continuo,- indipendentemente dal parlatore, e produce un numero predefinito di parole e/o frasi che coincideranno con i fonemi riconosciuti. L'utente si pone in ingresso al riconoscitore vocale 1 sottoforma di dialogo di tipo telefonico sia con parole consecutive sia con parole isolate; nel dialogo possono essere presenti disconnessioni. Inoltre dei dati dal dizionario delle pronuncie 7 vengono trasferiti al riconoscitore vocale 1 sottoforma di parole e trascrizioni in fonemi. Sempre in ingresso al riconoscitore vocale sono previste delle informazioni di controllo dal sistema di gestione del dialogo 2 (per esempio la specifreazione del vocabolario attivo).
La funzione elaborativa vera e propria del riconoscitore vocale, prevede che il parlato in ingresso venga trasformato in una o più parole e che il silenzio continuato sia rappresentato da un valore nullo .
L'uscita verso il sistema della gestione del dialogo 2 conterrà la lista delle parole e/o frasi migliori che sono state riconosciute ed un punteggio associato, oppure eventualmente un valore nullo.
B) Sistema di gestione del dialogo (SGD)
Il sistema di gestione del dialogo 2 decide lo stile ed il contenuto dei dialoghi tra uomo e computer. Esso fornisce vocabolari attivi per incrementare l'accuratezza del riconoscimento vocale riducendo lo spazio di ricerca, ed inoltre esercita il controllo dell'accesso al database 5 ed alle funzioni di generazione del discorso, tramite le sezioni relative all'elaboratore del linguaggio 2a, all'attuatore delle decisioni 2b, ed al generatore di testo 2c. I - Ingresso al SGD
- Un dato quale per esempio, il numero di telefono relativo alle richieste di informazioni in archivio (inizializzazione del sistema).
- Un valore nullo dal riconoscitore vocale, rappresentante assenza di dialogo.
- Le parole/frasi migliori dal sistema di riconoscimento vocale.
- Il testo o l'informazione trovata dal sistema di accesso al database 4.
- Un valore nullo dal sistema di accesso al database 4, rappresentante una ricerca fallita.
II - Elaborazione all'interno del SGD
Quando l'utente accede al sistema, il SGD 2 presenta un messaggio di apertura comprensivo di opzioni di menù relative al tipo di informazione richiesta. Al termine del dialogo conclusosi con successo, il sistema chiede all'utente se vuole effettuare una nuova ricerca. Se la risposta é affermativa, il ciclo di elaborazione ricomincia. Altrimenti viene inviato in uscita un messaggio di commiato.
II.1 - Interazione del SGD 2 con il Riconoscitore Vocale 1.
Il SGD controlla il dialogo tra uomo e computer, ad esempio dando il via al riconoscitore vocale quando é il "turno" dell'utente, ed arrestandolo quando il sistema deve rispondere.
Il SGD 2, quando é in attesa di dialogo da parte dell'utente, invia informazioni di controllo (es. un vocabolario attivo) al riconoscitore vocale 1. Il vocabolario dipende dalla natura del discorso atteso; ad esempio chiarificazione di informazioni già ricevute, opzioni associate ad un menu, richieste per informazioni specifiche, etc.
Se il riconoscitore riceve un valore nullo, si darà il via ad un dialogo per la richiesta di informazioni;
- se le informazioni vengono successivamente ricevute, si procederà con la normale elaborazione;
- altrimenti, la chiamata verrà terminata dopo un numero predefinito di "battute" di dialogo.
Quando le parole/frasi migliori vengono inviate dal riconoscitore vocale, allora si procede alla loro analisi :
- se esse non hanno rilevanza nel sistema, allora si dà il via ad un dialogo richiedente ulteriori informazioni ;
se vengono ricevute informazioni rilevanti, si procede con la normale elaborazione?
- altrimenti il sistema interrompe ogni tipo di dialogo e la chiamata viene trasferita all'operatore (dopo un numero predefinito di "battute" di dialogo o dopo un predefinito lasso di tempo);
- se l'informazione ricevuta é insufficiente per effettuare una corretta ricerca, si dà il via ad un dialogo per richiedere ulteriori informazioni: - se si ricevono sufficienti informazioni, si procede con la normale elaborazione;
- altrimenti il sistema valuta i dati ricevuti, elaborando i valori nulli o le informazioni irrilevanti come descritto in precedenza, o trasferendo la chiamata all'operatore dopo un numero predefinito di "battute" unitamente alla storia del dialogo effettuato fino a quel momento;
- se si ricevono sufficienti informazioni, esse verranno associate ai campi che costituiscono la richiesta, ed inviate al sistema di accesso al database .
II.2 - Interazione del SGD 2 con il modulo di accesso al database 4.
Se si riceve un valore nullo dal modulo di accesso al database, si dà il via ad un dialogo con l'utente per ottenere ulteriori informazioni:
- se si riceve un numero predefinito di valori nulli, allora la chiamata sarà trasferita all'operatore insieme alla "storia" del dialogo. Se si riceve un singolo valore come risposta alla specifica informazione richiesta, allora questa informazione, integrata con le necessarie informazioni per il formato della risposta, viene inviata al sintetizzatore vocale 3.
Se si ricevono un numero di possibili valori come risposta all'informazione richiesta, allora si dà il via ad un dialogo con l'utente per cercare di specificare ulteriormente l'informazione, inviando le necessarie informazioni di controllo al riconoscitore vocale;
- se dopo questo ulteriore dialogo vi saranno ancora diversi possibili valori, allora la chiamata verrà trasferita all'operatore.
III. Uscite,dal SGD 2
- Testo al sistema di sintesi vocale 3.
- Schemi di testo parzialmente.riempiti, contenenti informazioni sui campi di ricerca, inviati al modulo di accesso al database.
- Informazioni di controllo (es. vocabolario attivo) al riconoscitore vocale.
- Connessione con l'operatore ed invio della storia del dialogo.
- Segnale di fine chiamata.
C) Accesso al database 4
Il modulo di accesso al database effettua una scansione dei campi selezionati nel database e individua i record contenenti informazioni che coincidono con quelle specificate.
In ingresso a tale modulo provenienti dal sistema per la gestione del dialogo 2 si hanno gli schemi parzialmente riempiti e contenenti una combinazione dei campi.
L'elaborazione nel sistema di accesso al database 4 prevede una ricerca sui campi chiave rilevanti del database per identificare l'informazione richiesta.
Il caso relativo ad una ricerca con insuccesso viene rappresentato cori un valore nullo.
In uscita verso il sistema della gestione del dialogo 2 vengono forniti i record individuati, ordinati in base al loro grado di probabilità di riconoscimento, e contenenti le informazioni relative a ciascun campo specifico unitamente al punteggio relativo basato sul numero di campi contenenti informazioni coincidenti con quella specificata, oppure viene fornito un valore nullo, che indica che nessun record é stato trovato.
D) Sintesi vocale 3.
La funzione di sintesi vocale 3 genera le parole in maniera dinamica dal testo. Il testo in ingresso proveniente dal sistema per la gestione del dialogo 2 viene trasformato in discorso parlato nella fase elaborativa vera e propria, utilizzando la generazione dinamica della voce. In uscita verso il cliente viene fornita quindi la sintesi vocale relativa. E) Gestore del database 6.
Nella funzione di controllo del database 5 e del dizionario della pronunce 7, e' previsto che una nuova informazione sia aggiunta al database informatico e/o una nuova rappresentazione fonetica sia aggiunta al dizionario delle pronunce. Per cui il risultato di questa fase sarà un database 5 aggiornato così come pure un dizionario della pronunce 7 aggiornato.
Il sistema realizzato in una applicazione specifica permette l'automazione parziale del servizio informazioni sull'elenco degli abbonati telefonici, utilizzando la tecnologia del riconoscimento vocale. Il prodotto in particolare é stato realizzato utilizzando un'architettura basata su due personal computer connessi in rete LAN, al primo dei quali sono devoluti compiti di interfaccia del sistema alla linea telefonica e la conversione di stringhe di testo in voce ed al secondo dei quali compete il processo di riconoscimento vocale.
Il sistema realizzato introduce un'integrazione funzionale tra ambiente telefonico e ambiente informatico, esaltandone le loro prestazioni. Tale integrazione appartiene ad una branca della telematica denominata CIT (Computer Intergrated Telephony) che si pone l'obiettivo di fornire una piattaforma standard per realizzare in maniera efficiente una serie di servizi ad alto valore aggiuntivo.
L'adozione della piattaforma CIT consente al sistema secondo la presente invenzione, l'apertura verso una prevedibile ed auspicabile crescita sia funzionale che qualitativa. Tutta la struttura del sistema é realizzata da moduli specializzati per funzioni o gruppi di'essi .

Claims (9)

  1. RIVENDICAZIONI 1 . Tecnica di reperimento dei dati in sistemi per la gestione automatizzata dalle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico caratterizzata dal fatto che in seguito alla acquisizione delle richieste di tipo alfabetico un sistema di riconoscimento estragga dal database di D record unici, una serie di possibili alternative e tali alternative di record candidati siano ordinate per ogni campo richiesto in base all'applicazione di un algoritmo di gestione dell'incertezza nella ricerca che valuta la probabilità che nessun record del database si trovi nella lista di lunghezza W dei migliori sulla base del prodotto
    essendo N il numero totale di record che il database, può contenere ed essendo D W < = N; e che venga quindi scelto un numero predeterminato di record candidati con le migliori probabilità per una successiva ricerca incrociata sullo stesso database, venendo da tali ricerche generate tutte le combinazioni possibili dalle quale si selezionino soltanto quelle che di fatto sono presenti nel database stesso .
  2. 2 . Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 1 caratterizzata dal fatto che all'aumentare delle dimensioni D del database la percentuale del numero dei record candidati con le migliori probabilità permane comunque nello stesso ordine di grandezza rapportata alla dimensione del database.
  3. 3. Tecnica di reperimento dei dati in sistemi·per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 1 caratterizzata dal fatto che, nel caso sia necessario, possono essere richieste in modo interattivo le informazioni inerenti specifici campi del record da ricercare al fine di giungere alla de terminazione di detto record.
  4. 4. Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione precedente caratterizzata dal fatto che la mancata acquisizione delle informazioni relative ad un campo del record ricercato non inficia la ricerca globale e determina solo una penalizzazione probabilistica.
  5. 5 . Apparato attuante la tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo le rivendicazioni precedenti, caratterizzato dal fatto di comprendere ; - un modulo di riconoscimento vocale (1) comprendente a sua volta un riconoscitore di fonemi (la) ed un riconoscitore di parole (lb); - un modulo di gestione del dialogo (2) comprendente a sua volta un elaboratore del linguaggio (2a), un attuatore delle decisioni (2b) ed un generatore di testo (2c); - un sintetizzatore vocale (3); - un modulo di accesso al database (4),· - un database (5); - un gestore del database (6); e - un dizionario delle pronunce (7).
  6. 6. Apparato attuante la tecnica di reperimento dei dati in sistemi per la gestione automatizzata nelle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 5, caratterizzato dal fatto che il modulo di rinoscimento vocale (1) effettui il riconoscimento del parlato indipendentemente dal soggetto, utilizzando un processo di riconoscimento dei fonemi basato su tecniche di individuazioni di tipo statistico, la qualità del riconoscimento essendo ulteriormente incrementata grazie all'uso di vocabolari attivi, forniti dal sistema di gestione del dialogo (2) sulla base delle previsioni dipendenti dal contesto della conversazione.
  7. 7. Apparato attuante la tecnica di reperimento dei dati in sistemi per la gestione automatizzata per le informazioni mediante il riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 5, caratterizzato dal fatto che il modulo di gestione del dialogo (2) eserciti il controllo di base sul sistema intrattenendo dialoghi intelligenti ed interattivi attraverso richieste di conferma e chiarificazione .
  8. 8 . Apparato attuante la tecnica di reperimento dei dati in sistema per la gestione automatizzata per le informazioni mediante il riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 5 caratterizzato dal fatto che la ricerca sia effettuata considerando la classifica dei record più probabili in base al numero dei campi che hanno soddisfatto i parametri di ricerca, assicurando con ciò che il sistema di gestione del dialogo abbia a disposizione il massimo numero di informazioni possibile per decidere quale dialogo avviare allo scopo di completare con successo la richiesta di informazioni .
  9. 9 . Apparato attuante la tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle richieste di tipo alfabetico secondo la rivendicazione 5, caratterizzato dal fatto che il modulo di gestione del database (6) operi sulla base dei dati senza richiedere un addestramento successivo, attuando l'aggiornamento delle informazioni contenute nel database stesso (5) e generando i nuovi dati per il sistema.
IT96RM000796A 1996-11-21 1996-11-21 Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle IT1290785B1 (it)

Priority Applications (2)

Application Number Priority Date Filing Date Title
IT96RM000796A IT1290785B1 (it) 1996-11-21 1996-11-21 Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle
EP97830594A EP0844574A3 (en) 1996-11-21 1997-11-13 A method of data search by vocal recognition of alphabetic type requests

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
IT96RM000796A IT1290785B1 (it) 1996-11-21 1996-11-21 Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle

Publications (3)

Publication Number Publication Date
ITRM960796A0 ITRM960796A0 (it) 1996-11-21
ITRM960796A1 true ITRM960796A1 (it) 1998-05-21
IT1290785B1 IT1290785B1 (it) 1998-12-10

Family

ID=11404544

Family Applications (1)

Application Number Title Priority Date Filing Date
IT96RM000796A IT1290785B1 (it) 1996-11-21 1996-11-21 Tecnica di reperimento dei dati in sistemi per la gestione automatizzata delle informazioni mediante riconoscimento vocale delle

Country Status (2)

Country Link
EP (1) EP0844574A3 (it)
IT (1) IT1290785B1 (it)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1047256A3 (en) * 1999-04-23 2002-08-14 Cirte Manifatturiera S.p.A. Automatic access method in subscriber information lists
EP1363271A1 (de) 2002-05-08 2003-11-19 Sap Ag Verfahren und System zur Verarbeitung und Speicherung von Sprachinformationen eines Dialogs
DE10220524B4 (de) 2002-05-08 2006-08-10 Sap Ag Verfahren und System zur Verarbeitung von Sprachdaten und zur Erkennung einer Sprache
CN119181360B (zh) * 2024-09-05 2025-05-16 广州医科大学附属第二医院 一种肢体偏瘫语言障碍交互机器人

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO1994014270A1 (en) * 1992-12-17 1994-06-23 Bell Atlantic Network Services, Inc. Mechanized directory assistance

Also Published As

Publication number Publication date
EP0844574A2 (en) 1998-05-27
IT1290785B1 (it) 1998-12-10
EP0844574A3 (en) 1999-07-28
ITRM960796A0 (it) 1996-11-21

Similar Documents

Publication Publication Date Title
US12230268B2 (en) Contextual voice user interface
US11138974B2 (en) Privacy mode based on speaker identifier
US11798556B2 (en) Configurable output data formats
JP4267081B2 (ja) 分散システムにおけるパターン認識登録
US6243680B1 (en) Method and apparatus for obtaining a transcription of phrases through text and spoken utterances
US20200143814A1 (en) Speaker based anaphora resolution
US10453117B1 (en) Determining domains for natural language understanding
US6208964B1 (en) Method and apparatus for providing unsupervised adaptation of transcriptions
Riley et al. Stochastic pronunciation modelling from hand-labelled phonetic corpora
JP2001005488A (ja) 音声対話システム
US7286989B1 (en) Speech-processing system and method
US5761637A (en) Dialogue-sound processing apparatus and method
US20020087311A1 (en) Computer-implemented dynamic language model generation method and system
EP0570660A1 (en) Speech recognition system for natural language translation
KR102915192B1 (ko) 대화 시스템, 대화 처리 방법 및 전자 장치
US10515637B1 (en) Dynamic speech processing
US10832668B1 (en) Dynamic speech processing
WO2002054384A1 (en) Computer-implemented language model partitioning method and system
US20020087317A1 (en) Computer-implemented dynamic pronunciation method and system
Rabiner et al. Speech recognition: Statistical methods
CN111128175B (zh) 口语对话管理方法及系统
ITRM960796A1 (it) Tecnica di reperimento dei dati in sistemi per la gestione automatiz zata delle informazioni mediante riconoscimento vocale delle richie
Lin et al. The design of a multi-domain Mandarin Chinese spoken dialogue system.
Niemann et al. The interaction of word recognition and linguistic processing in speech understanding
Kuo et al. Advances in natural language call routing

Legal Events

Date Code Title Description
0001 Granted