ES2233954T3 - Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias. - Google Patents
Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias.Info
- Publication number
- ES2233954T3 ES2233954T3 ES96301905T ES96301905T ES2233954T3 ES 2233954 T3 ES2233954 T3 ES 2233954T3 ES 96301905 T ES96301905 T ES 96301905T ES 96301905 T ES96301905 T ES 96301905T ES 2233954 T3 ES2233954 T3 ES 2233954T3
- Authority
- ES
- Spain
- Prior art keywords
- asr
- entry
- supplementary
- database
- spoken
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 title claims abstract description 50
- 238000013518 transcription Methods 0.000 claims abstract description 11
- 230000035897 transcription Effects 0.000 claims abstract description 11
- 238000012545 processing Methods 0.000 claims description 4
- 230000008569 process Effects 0.000 description 23
- 230000001419 dependent effect Effects 0.000 description 12
- 238000012549 training Methods 0.000 description 9
- 238000004891 communication Methods 0.000 description 7
- 230000002452 interceptive effect Effects 0.000 description 4
- 238000006243 chemical reaction Methods 0.000 description 3
- 238000010586 diagram Methods 0.000 description 3
- 238000005516 engineering process Methods 0.000 description 3
- 238000012795 verification Methods 0.000 description 3
- 230000009471 action Effects 0.000 description 2
- 230000001186 cumulative effect Effects 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 238000013459 approach Methods 0.000 description 1
- 230000005540 biological transmission Effects 0.000 description 1
- 239000002131 composite material Substances 0.000 description 1
- 238000013500 data storage Methods 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 238000011084 recovery Methods 0.000 description 1
- 230000003252 repetitive effect Effects 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
- G10L15/063—Training
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/38—Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections
- H04M3/382—Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/42204—Arrangements at the exchange for service or number selection by voice
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04Q—SELECTING
- H04Q3/00—Selecting arrangements
- H04Q3/42—Circuit arrangements for indirect selecting controlled by common circuits, e.g. register controller, marker
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2201/00—Electronic components, circuits, software, systems or apparatus used in telephone systems
- H04M2201/40—Electronic components, circuits, software, systems or apparatus used in telephone systems using speech recognition
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2201/00—Electronic components, circuits, software, systems or apparatus used in telephone systems
- H04M2201/60—Medium conversion
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2242/00—Special services or facilities
- H04M2242/22—Automatic class or number identification arrangements
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/38—Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections
- H04M3/382—Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords
- H04M3/385—Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords using speech signals
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/42025—Calling or Called party identification service
- H04M3/42034—Calling party identification service
- H04M3/42059—Making use of the calling party identifier
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/487—Arrangements for providing information services, e.g. recorded voice services or time announcements
- H04M3/493—Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/487—Arrangements for providing information services, e.g. recorded voice services or time announcements
- H04M3/493—Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
- H04M3/4931—Directory assistance systems
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04Q—SELECTING
- H04Q3/00—Selecting arrangements
- H04Q3/72—Finding out and indicating number of calling subscriber
Landscapes
- Engineering & Computer Science (AREA)
- Signal Processing (AREA)
- Computer Networks & Wireless Communication (AREA)
- Computer Security & Cryptography (AREA)
- Artificial Intelligence (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Telephonic Communication Services (AREA)
- Document Processing Apparatus (AREA)
- Machine Translation (AREA)
Abstract
SE PRESENTA UN METODO Y UN SISTEMA PARA HACER POSIBLE QUE UN SISTEMA DE RECONOCIMIENTO AUTOMATICO DEL HABLA (ASR) RECONOZCA PALABRAS ARBITRARIAS, ACCEDIENDO A LA INFORMACION EN UNA BASE DE DATOS SUPLEMENTARIA. LA BASE DE DATOS SUPLEMENTARIA ES ACCEDIDA PARA RECUPERAR INFORMACION TEXTUAL SUPLEMENTARIA, TAL COMO UN NOMBRE PROPIO. SE UTILIZA UN MEDIO DE TEXTO-A-HABLA PARA GENERAR UNA TRANSCRIPCION DE FONEMAS DEL TEXTO RECUPERADO DE LA BASE DE DATOS SUPLEMENTARIA, DE MANERA QUE PUEDA UTILIZARSE LA TRANSCRIPCION COMO PLANTILLA INDEPENDIENTE DE LA PERSONA QUE HABLA POR EL SISTEMA ASR PARA RECONOCER UNA PALABRA HABLADA.
Description
Método para reconocimiento de voz automático de
palabras habladas arbitrarias.
La presente invención se refiere al
reconocimiento de voz automático. Más en particular, la invención se
refiere a un método de utilizar información suplementaria recuperada
de una base de datos en unión con una red telefónica para ayudar a
un sistema de reconocimiento de voz automático (ASR) a reconocer una
palabra hablada por el usuario.
Para muchas aplicaciones, es ventajosos utilizar
ordenadores para automatizar tareas repetitivas de modo que estas
tareas puedan ser realizadas con más rapidez y eficacia. El
reconocimiento de voz, un tipo de tecnología vocal, permite que la
gente interactúe con ordenadores utilizando palabras habladas. Sin
embargo, el reconocimiento de voz es todo un reto debido a las
variaciones de voz inherentes entre personas diferentes.
Una aplicación del reconocimiento de voz es una
red telefónica. Utilizando sistemas de reconocimiento de voz
automático (ASR), la gente puede comunicarse por teléfono de modo
que se puedan realizar tareas sencillas sin intervención del
operador. Por ejemplo, el reconocimiento de voz puede utilizarse
para marcar de modo que el usuario del teléfono no necesite
recordar, buscar o pedir un número telefónico. La capacidad de
utilizar voz en vez de una manipulación física de un interfaz de
usuario ha mantenido alta la demanda de tecnología ASR a la vez que
continúan los avances en telecomunicaciones. Generalmente, hay dos
tipos de sistemas de ASR utilizados en telecomunicaciones:
dependiente del interlocutor e independiente del interlocutor.
Una implementación común de un sistema de
reconocimiento de voz automático dependiente del interlocutor
utiliza un ordenador que ha sido "entrenado" por un
interlocutor particular para que responda a patrones de voz del
interlocutor. El proceso de entrenamiento comprende la vocalización
de un sonido (es decir, una palabra) para generar una entrada de voz
analógica, la conversión de la entrada de voz en señales digitales,
la generación de una plantilla representativa del sonido y el
almacenamiento de la plantilla indexada para datos de respuesta
específicos apropiados, tales como una instrucción de ordenador para
instigar una acción.
Durante operaciones en tiempo real, las palabras
habladas por el interlocutor entrenador son digitalizadas y
comparadas con el conjunto de plantillas dependientes del
interlocutor en el sistema de ASR de modo que una coincidencia entre
las palabras habladas y una plantilla pueda disparar una respuesta
particular por parte del ordenador. Los sistemas de ASR dependientes
del interlocutor se usan primordialmente allí donde pueda estar
justificado el proceso de entrenamiento, por ejemplo allí donde los
mismos individuos acceden al sistema en muchas ocasiones.
Para aplicaciones en las que no pueda estar
justificado un entrenamiento individual, se ha de utilizar un ASR
independiente del interlocutor. Una implementación común de un
sistema de ASR independiente del interlocutor utiliza un ordenador
para almacenar una plantilla compuesta o una agrupación de
plantillas que representen una palabra hablada por una pluralidad de
personas diferentes. Las plantillas se derivan de numerosas muestras
de datos (es decir, palabras habladas por una pluralidad de
interlocutores) que representan una amplia gama de pronunciaciones y
variaciones en las características de la voz. Los sistemas de
reconocimiento de voz independientes del interlocutor pueden
interactuar con una amplia diversidad de personas sin entrenamiento
específico del interlocutor.
Se conocen en la técnica aplicaciones telefónicas
que utilizan ASR independiente del interlocutor para reconocer
números hablados. Estas aplicaciones son especialmente útiles cuando
el vocabulario del interlocutor se limita a unas pocas órdenes y/o
números de menú (por ejemplo, 0-9). Sin embargo, es
muy difícil letras habladas (A-Z) por la red
telefónica. De hecho, debido a diversos tipos de ruido y
limitaciones de ancho de banda, acoplados con la amplia diversidad
de patrones de voz entre interlocutores individuales, el ambiente
telefónico hace que todas las aplicaciones de ASR (dependientes del
interlocutor e independientes del interlocutor) sean propensas a
error.
No obstante, una aplicación comercial muy
perseguida de ASR es la automatización de tareas asociadas con
transacciones comerciales, por ejemplo transacciones de tarjetas de
crédito, hechas a través de la red telefónica. Por ejemplo, si un
cliente desea comprar productos o servicios por teléfono, se podría
utilizar el ASR para recoger la información pertinente y autorizar
la transacción rápida y eficazmente con intervención mínima del
operador.
Las compras telefónicas de productos o servicios
hechas utilizando una tarjeta de crédito/débito pueden requerir que
el cliente proporcione su nombre (u otra información predeterminada)
como un paso en la transacción. Desgraciadamente, es el
reconocimiento de la información de palabras habladas arbitrarias
(tal como el nombre de cliente) el que ha inhibido el uso de
tecnología ASR por aquellas entidades que más la necesitan, tales
como negocios de alto volumen.
Esto se debe a que los negocios de alto volumen
no sólo requieren un sistema de ASR para reconocer palabras habladas
arbitrarias (por ejemplo, nombres propios), sino que requieren
también un acceso ubicuo al sistema de ASR. Por ejemplo, para
atender a las necesidades de un negocio de alto volumen con clientes
potenciales en todo un país utilizando sistemas de ASR
convencionales, se habrían de crear y almacenar utilizando las
técnicas descritas más arriba plantillas independientes del
interlocutor correspondientes al nombre de cada persona en todo el
país. Sin embargo, los presentes sistemas de ASR del estado de la
técnica son incapaces de casar un nombre hablado con uno de los
millones de posibles nombres correspondientes a las plantillas
almacenadas.
Por tanto existe una necesidad en la técnica de
mejoras en sistemas de ASR que permitirán que tales sistemas
reconozcan automáticamente palabras habladas con una capacidad
incrementada.
El documento
WO-A-91 18386 se dirige al
reconocimiento y verificación simultáneos de voz, independientes del
interlocutor, en una red telefónica, en los que son reconocidas
cadenas alfanuméricas habladas por la red telefónica. El llamador es
invitado a pronunciar cada carácter de una cadena, usándose un
algoritmo de reconocimiento de voz independiente del interlocutor
para reconocer cada carácter pronunciado. Las diferencias de
reconocimiento acumulativas son almacenadas a medida que cada
carácter es pronunciado y casado con un conjunto posible de
caracteres alfanuméricos. Después de que todos los caracteres han
sido pronunciados, se declara que la cadena de referencia con la
diferencia acumulativa más baja es la cadena reconocida.
Un método y un sistema según la invención se
exponen en las reivindicaciones independientes. Formas preferidas se
exponen en las reivindicaciones dependientes.
Se aborda esta necesidad y se logra una avance
técnico en la materia por un método y un sistema de utilizar datos
suplementarios para aumentar la capacidad de un sistema de ASR de
modo que el sistema pueda rápida y precisamente reconocer palabras
habladas arbitrarias, tales como nombres propios.
Es una práctica común en aplicaciones de
telefonía de un sistema de ASR solicitar un número de teléfono a un
llamador. El número de teléfono del llamador puede obtenerse por voz
u otros métodos conocidos, tal como una entrada de ID o de tono de
pulsación del llamador. Por tanto, según una realización ejemplar
del método y sistema de la presente invención, el número de teléfono
del llamador sirve como un índice para recuperar texto (es decir, el
nombre del llamador) de una base de datos. El texto se usa entonces
para limitar o especificar las opciones disponibles de un sistema de
ASR.
Más particularmente, el número de teléfono del
llamador se usa para acceder a una base de datos suplementaria para
recuperar texto asociado con el número de teléfono. En la
realización ejemplar antes mencionada, se recupera texto que
contiene el nombre del usuario de la base de datos suplementaria. El
texto del nombre del usuario comprende una representación
alfanumérica digitalizada del nombre propio del llamador. Se usa un
sistema de texto a voz para transcribir el texto del nombre de
llamador a una transcripción de fonemas, según se conoce en la
técnica. La transcripción de fonemas del nombre es almacenada en el
sistema de ASR como una plantilla independiente del interlocutor de
modo que se pueda reconocer voz - que se ajuste a la transcripción -
por el sistema de ASR. La recuperación y conversión de los datos
textuales suplementarios en una transcripción de fonemas permite que
el sistema de ASR responda inmediatamente a palabras habladas que se
ajusten a la transcripción de los datos recuperados en ausencia de
entrenamiento específico del interlocutor.
Durante aplicaciones en tiempo real de la
realización ejemplar anterior, se recibe una llamada telefónica por
un proveedor de servicios que mantiene un sistema de ASR según la
presente invención. El llamador que desea hacer una compra con
tarjeta de crédito de un producto o servicio es invitado a que
proporcione un número de teléfono y un nombre. Basándose en el
número de teléfono proporcionado por el llamador, se accede a una
base de datos suplementaria (por ejemplo, un directorio telefónico
electrónico) para recuperar el texto de un nombre asociado con el
número de teléfono. Se crea una transcripción de fonemas del texto
del nombre recuperado de la base de datos por medio de un sistema de
texto a voz. La transcripción de fonemas se almacena entonces como
una plantilla independiente del interlocutor para que el sistema de
ASR la use para reconocer el nombre tal como fue pronunciado por el
llamador.
Si el nombre pronunciado por el llamador no es
reconocido por el sistema de ASR debido a una pronunciación inusual
de nombres, pobre calidad de la transmisión telefónica, llamadores
cuyas voces son difíciles de reconocer, etc., se invita al llamador
que proporcione un deletreo de su nombre, letra por letra. El
sistema de texto a voz puede usarse para crear una transcripción de
fonemas del deletreo del nombre escrito tal como es recuperado de la
base de datos. El deletreo del nombre recuperado de la base de datos
también se almacena como una plantilla independiente del
interlocutor en el sistema de ASR de modo que el sistema puede
intentar reconocer el deletreo del nombre del llamador (según es
pronunciado por el llamador). Si no hay coincidencia entre la
expresión hablada del nombre del usuario y la transcripción de
fonemas (basándose en los algoritmos de reconocimiento de voz
establecidos), la llamada es canalizada hacia un asistente
humano.
La figura 1 es un diagrama de bloques
simplificado de sistemas interactivos de teléfono y usuario
asociados con un sistema de ASR según una realización ejemplar de la
presente invención;
La figura 2 es un diagrama de bloques
simplificado del sistema de ASR de la figura 1 que se usa para
proporcionar reconocimiento y verificación de voz según una
realización ejemplar de la presente invención; y
La figura 3 es un diagrama de flujo de un método
ejemplar según la presente invención.
La figura 1 muestra dos sistemas 100A y 100B
según una realización ejemplar de la presente invención. El sistema
telefónico de voz 100A incluye una estación de llamada 102, líneas
de telecomunicaciones 103A y 103B y un punto de servicio de
conmutación (SSP) 105 que está localizado en una red telefónica
conmutada pública 107. Por claridad, se muestra un solo punto de
servicio de conmutación, pero una red telefónica conmutada pública
operacional comprende una red interconectada de SSPs. Una línea de
interfaz de línea telefónica 108 protege el equipo del sistema de
ASR 110 frente a funcionamientos deficientes de la red, tales como
fuertes fluctuaciones de potencia, y digitaliza la voz entrante de
la estación de llamada 102, si la voz originaria no está ya
digitalizada, antes de su entrega al sistema.
El SSP 105 es un conmutador digital local de
control distribuido, tal como un conmutador 5ESS® según se describe
en AT&T Technical Journal, Vol. 64, Nº 6,
julio-agosto de 1985, páginas
1303-1564, noviembre de 1981, Bell Laboratories
Record, página 258, y diciembre de 1981, Bell Laboratories
Record, página 290, y fabricado por AT&T. Alternativamente,
el SSP 105 puede ser un conmutador analógico o digital de control
distribuido, tal como un sistema de conmutación ISDN según se
describe en la patente norteamericana número 4.592.048, expedida a
M. W. Beckner y otros el 27 de mayo de 1986. En la figura 1, el SSP
105 está conectado a través de líneas 103 identificadas por clientes
a la estación de llamada 102 y también está en comunicación con un
ordenador principal 124 a través de un línea 121B según se describe
a continuación.
Según se muestra también en la figura 1, el
sistema 100B interactivo con el usuario incluye un micrófono 104 y
una unidad de interfaz 109 de micrófono. El micrófono 104 se puede
disponer en un kiosco o una máquina pagadora automatizada (no
mostrada) mantenida por el proveedor de servicios como un enlace
entre el sistema de ASR y el cliente, según se conoce en la
técnica.
La voz entrante es transformada en señales
eléctricas por el micrófono 104 y entregada a la unidad de interfaz
109 de micrófono a través de un enlace de comunicaciones 106A. La
unidad de interfaz 109 de micrófono convierte las señales de voz
entrante en datos digitales antes de entregarlas al sistema de ASR
110 a través del enlace de comunicaciones 106B.
El sistema de ASR 110 (descrito a continuación
con detalle en la figura 2) está en comunicación con el ordenador
principal 124 a través de un bus de datos 125. El ordenador
principal 124 incluye una unidad de procesamiento central (CPU) 126
para controlar el funcionamiento global del ordenador, una memoria
de acceso aleatorio (RAM) 128 para almacenamiento temporal de datos,
una memoria de sólo lectura (ROM) 130 para almacenamiento permanente
de datos y una base de datos no volátil 134 para almacenar programas
de control asociados con el ordenador principal 124. La CPU 126 se
comunica con la RAM 128 y la ROM 130 a través de unos buses de datos
132. Igualmente, la CPU 126 se comunica con la base de datos no
volátil 134 a través de un bus de datos 133. Un interfaz de
entrada/salida (I/O) 136 está conectado al ordenador principal 124 a
través del bus de datos 135 para facilitar el flujo de datos desde
una red de área local (LAN) 138 que está en comunicación con el
interfaz I/O 136 a través del enlace de datos 139, una base de datos
suplementaria 140 que está en comunicación con el interfaz I/O 136 a
través del enlace de datos 141 y una red de servicio de datos 142
que transmite datos digitales al ordenador principal 124 a través de
la línea de telecomunicaciones 121A, el SSP 105 y el enlace de datos
121B, según se describe a continuación.
La figura 2 muestra un diagrama de bloques
simplificado de una realización ejemplar de un sistema de ASR 110
según se muestra en la figura 1. El sistema de ASR 110, que es capaz
de reconocimiento de voz independiente del interlocutor o
dependiente del interlocutor incluye una CPU 202 para controlar el
funcionamiento global del sistema. La CPU 202 tiene una serie de
buses de datos representados generalmente por el número de
referencia 203. Asimismo, se muestran una memoria de acceso
aleatorio (RAM) 204, una memoria de sólo lectura (ROM) 206, una
unidad generadora de voz 218 para emitir salutaciones e invitaciones
a un llamador y un sistema de texto a voz (TTS) 219 (que se comunica
con la CPU 202 y la RAM 204) para transcribir texto escrito en una
transcripción de fonemas, según se conoce en la técnica.
La RAM 204 está conectada a la CPU 202 por un bus
203 y proporciona almacenamiento temporal de datos de voz, tales
como palabras habladas por un llamador en la estación de llamada 102
o en la estación 104 de micrófono, plantillas 214 dependientes del
interlocutor y plantillas 216 independientes del interlocutor. La
ROM 206, también conectada a la CPU 202 por el bus de datos 203,
proporciona almacenamiento permanente de datos de reconocimiento y
verificación de voz, incluyendo un algoritmo de reconocimiento de
voz 208 y modelos de fonemas 210. En esta realización ejemplar, se
utiliza un algoritmo de reconocimiento de voz 208 basado en fonemas,
aunque se conocen en la técnica otros muchos enfoques útiles de
reconocimiento de voz.
Un fonema es un término del ramo que se refiere a
una de un conjunto de unidades de voz muy pequeñas que pueden
combinarse con otras de tales unidades para formar segmentos de voz
más grandes, por ejemplo morfemas. Por ejemplo, los segmentos
fonéticos de la palabra hablada "operator" pueden representarse
por una combinación de fonemas tales como "aa", "p",
"axr", "ey", "dx" y "axr". Los modelos de
fonemas 210 son compilados usando datos de clase de reconocimiento
de voz que se derivan de las elocuciones de una muestra de
interlocutores en un proceso anterior fuera de línea. Durante el
proceso, se hablan palabras seleccionadas para representar todos los
fonemas del lenguaje por parte de un gran número de interlocutores
de entrenamiento (por ejemplo, 1000). Las elocuciones se procesan
por un individuo entrenado que genera un texto escrito del contenido
de esas elocuciones.
El texto escrito de la palabra se recibe entonces
por una unidad de texto a voz, tal como el sistema de TTS 219, de
modo que pueden crear una transcripción de fonemas del texto escrito
usando reglas de conversión de texto a voz, según se conoce en la
técnica. La transcripción de fonemas del texto escrito se compara
entonces con los fonemas derivados del funcionamiento del algoritmo
de reconocimiento de voz 208, que compara las elocuciones con los
modelos de fonemas 210. Los modelos de fonemas 210 se ajustan
durante este proceso de "entrenamiento de modelos" hasta que se
obtiene una coincidencia adecuada entre el fonema derivado de la
transcripción de texto a voz de las elocuciones y fonemas
reconocidos por el algoritmo de reconocimiento de voz 208, usando
técnicas de ajuste según se conoce en la técnica.
Los modelos de fonemas 210 se usan junto con el
algoritmo de reconocimiento de voz 208 durante el proceso de
reconocimiento. Más particularmente, el algoritmo de reconocimiento
de voz 208 empareja una palabra hablada con modelos de fonemas
establecidos. Si el algoritmo de reconocimiento de voz determina que
existe una coincidencia (es decir, si la elocución hablada coincide
estadísticamente con los modelos de fonemas según parámetros
predefinidos), se genera una lista de fonemas.
Dado que los modelos de fonemas 210 representan
una distribución de características de una palabra hablada en una
población grande de interlocutores, los modelos se pueden usar para
un acceso ubicuo a un sistema de ASR que atiende a la misma
población de interlocutores representada por los interlocutores de
entrenamiento (es decir, americanos nativos, poblaciones de habla
hispana, etc.).
La plantilla 216 independiente del interlocutor
es una lista de fonemas que representan una elocución o frase
esperada. Una plantilla 216 independiente del interlocutor es creada
procesando texto escrito a través del sistema de TTS 219 para
generar una lista de fonemas que ejemplifican las pronunciaciones
esperadas de la palabra o frase escrita. En general, se almacenan
plantillas múltiples en la memoria RAM 204 de modo que estén
disponibles para el algoritmo de reconocimiento de voz 208. La tarea
del algoritmo 208 es elegir que plantilla coincide en mayor grado
con los fonemas de una elocución hablada.
Las plantillas 214 dependientes del interlocutor
se generan haciendo que el interlocutor proporcione una elocución de
una palabra o frase, y procesando la elocución usando el algoritmo
de reconocimiento de voz 208 y los modelos de fonemas 210 para
producir una lista de fonemas que comprende los fonemas reconocidos
por el algoritmo. Esta lista de fonemas es la plantilla 214
dependiente del interlocutor para esa elocución particular.
Durante operaciones de reconocimiento de voz en
tiempo real, se procesa una elocución por el algoritmo de
reconocimiento de voz 208 usando modelos de fonemas 210 de tal modo
que se genere una lista de fonemas. Esta lista de fonemas se
empareja con la lista proporcionada por las plantillas 216
independientes del interlocutor y las plantillas 214 dependientes
del interlocutor, usando técnicas según se conoce en la materia. El
algoritmo de reconocimiento de voz 208 reporta los resultados del
emparejamiento.
La figura 3 es un diagrama de flujo que describe
las acciones adoptadas en el sistema de ASR 110 cuando el sistema
está desarrollando en un modo independiente del interlocutor una
realización ejemplar del método de la presente invención.
Como ejemplo de una aplicación comercial de la
presente invención, supóngase que un cliente está llamando desde un
teléfono particular (estación de llamada 102) y desea hacer una
compra con tarjeta de crédito de un servicio ofrecido por un
proveedor de servicios que usa el sistema de ASR 110 y el ordenador
principal 124. En este ejemplo, el cliente no ha adquirido
previamente el servicio, por lo que el sistema de ASR 110 no está
entrenado para reconocer los patrones de voz particulares del
cliente (es decir, no existen plantillas 214 dependientes del
interlocutor establecidas por este cliente). Sin embargo, con el fin
de autorizar la transacción de la tarjeta de crédito el sistema de
ASR 110 debe recibir y reconocer el nombre del cliente.
El ejemplo comienza cuando en el paso 300 el
sistema de ASR 110 recibe una llamada entrante originada por un
cliente canalizada a través de las líneas de telecomunicaciones
103A, 103B y el SSP 105 de la red telefónica conmutada pública
107.
Alternativamente, el cliente podría poner una
orden de servicio desde un kiosco que aloja un sistema interactivo
con el usuario que incluye la estación 104 de micrófono. Si es así,
se recibe una "llamada" entrante por el sistema de ASR 110
cuando se detecta una entrada de cliente (por ejemplo, voz) en la
estación 104 de micrófono y se entrega ésta al sistema a través del
enlace de comunicaciones 106B.
Tanto en el sistema telefónico como en el sistema
interactivo con el usuario, la llamada entrante es procesada por una
unidad de interfaz (es decir, la unidad de interfaz 108 de la línea
telefónica y la unidad de interfaz 109 del micrófono,
respectivamente) para garantizar que toda entrada recibida en el
sistema de ASR 110 está en un formato digital común.
Según se muestra en el paso 302, la unidad
generadora de voz 218 del sistema de ASR 110 emite una salutación e
invita al usuario a que haga una entrada tal como un índice
predeterminado (por ejemplo, número de teléfono particular), un
nombre asociado con el índice y, posiblemente, un deletreo del
nombre. Alternativamente, el sistema podría diferir la invitación a
que el usuario deletree el nombre hasta que éste sea necesario en el
proceso, según se describe a continuación.
El proceso continúa hasta el paso de
determinación 304 en donde se determina si se recibió la entrada
solicitada. Si el resultado del paso 304 es una decisión "NO",
el procedimiento continúa hasta el paso 306 en donde la llamada es
canalizada hacia un asistente humano y el proceso termina en el paso
final 308.
Si el resultado en el paso 304 es una decisión
"SÍ", el proceso continúa hasta el paso 318 en donde la
elocución del cliente del índice, nombre y deletreo del nombre son
almacenados en la RAM 204 del sistema de ASR 110. En el ejemplo
anterior, el cliente proporcionó el índice hablando. Cuando el
índice es el número de teléfono particular del cliente, se puede
recuperar por otras técnicas conocidas, tales como una entrada de ID
o de tono de pulsación del llamador.
El proceso continúa hasta el paso 310 en donde
hay un intento de reconocer el índice del llamador usando el
algoritmo de reconocimiento de voz 208 y los fonemas modelo (para
dígitos) 210. El índice se usa para recuperar información de una
base de datos suplementaria, según se describe a continuación. Si
existe incertidumbre sobre determinados dígitos del índice, puede
programarse el sistema para que reconozca posibilidades múltiples.
En el paso de determinación 314, se determina si el índice del
cliente se reconoció en el paso anterior. Si el resultado del paso
de determinación es una decisión "NO", el proceso continúa
hasta el paso 306 en donde la llamada se canaliza hacia un asistente
humano y el proceso termina en el paso final 308.
Si el resultado en el paso de determinación 314
es una decisión "SÍ", el proceso continúa hasta el paso 316 en
donde la CPU 202 del sistema de ASR 110 hace una petición al
ordenador principal 124 de datos suplementarios. En el ejemplo
anterior, los datos suplementarios deseados son una representación
digitalmente almacenada del nombre del cliente (por ejemplo, el
nombre asociado al número de teléfono particular recibido por el
cliente), tal como en formato de texto ASCII.
Cuando la solicitud de datos suplementarios se
recibe en la CPU 126 del ordenador principal 124, la CPU 126
determina a qué datos suplementarios debe accederse, usando el
índice (por ejemplo, el número de teléfono proporcionado por el
cliente), para recuperar una representación digital (por ejemplo,
formato de texto ASCII) del nombre del cliente. La CPU 126 hace la
determinación basándose en instrucciones recibidas de la base de
datos no volátil 134.
Por ejemplo, si el proveedor de servicios es una
entidad grande, puede mantener una base de datos auxiliar 140, tal
como una base de datos en CD-ROM, que se comunica
con el ordenador principal 124 a través del enlace de datos 141 y el
interfaz I/O 136. La base de datos 140 podría contener información
comprensiva de clientes, tal como direcciones y nombres de clientes,
números de cuenta de tarjetas de crédito e historial de
adquisiciones, indexada por el número de teléfono. Sin embargo, si
el proveedor de servicio es una entidad pequeña con una base de
clientes que cambia rápidamente, puede estar almacenada una limitada
base de datos suplementaria dentro del ordenador principal 124 (por
ejemplo, en la RAM 128).
Alternativamente, algunos proveedores de
servicios pueden mantener una red de ordenadores (por ejemplo, la
LAN 138) desde la cual se pueden descargar datos suplementarios al
ordenador principal 124 a través del enlace de datos 139 y el
interfaz I/O 136.
En el ejemplo anterior, supóngase que el
proveedor de servicios se suscribe a un servicio de datos ofrecido
por la red de telecomunicaciones que mantiene la red telefónica de
conmutación pública 107. El servicio de datos 142 incluye una base
de datos en la cual almacena un directorio telefónico electrónico
que incluye el número de teléfono y los nombres de clientes
correspondientes de todos los teléfonos residenciales de los Estados
Unidos. En el ejemplo anterior, el servicio de datos 142 envía
paquetes de datos digitales de información (por ejemplo, un texto de
un nombre de cliente) a través de la línea de telecomunicaciones
121A al SSP 105. El SSP 105 entrega la información digital al
ordenador principal 124 a través de la línea de telecomunicaciones
121B que va al interfaz I/O 136 de modo que se pueda recuperar un
texto del nombre del cliente por el ordenador principal 124 y
almacenarlo en la RAM 128. Si se recuperan múltiples nombres (debido
a posibilidades múltiples de números telefónicos particulares o
nombres múltiples asociados con el número telefónico), se
proporcionan todos los posibles nombres al ordenador principal.
El proceso continúa en el paso 318 en donde, en
respuesta a una petición recibida desde la CPU 202, el(los)
texto(s) del nombre recuperado(s) de la base de datos
suplementaria se recuperan de la RAM 128 y se procesan por el
sistema de TTS 219 de modo que se genere y se almacene una
transcripción de fonemas del texto como una plantilla independiente
del interlocutor en la RAM 204. Según se muestra en el paso 320, se
intenta el reconocimiento del nombre del llamador tal como fue
pronunciado por el mismo (y almacenado en la RAM 204) usando el
algoritmo de voz 208, los modelos de fonemas 210 y la(s)
plantilla(s) independiente(s) del interlocutor
creada(s) en el paso 318.
En el paso de determinación 322, se hace una
determinación de si tuvo lugar un reconocimiento en el paso 320. Si
el resultado del paso 322 es una decisión "SÍ", el proceso
continúa hasta el paso 324 en donde la transacción es autorizada y
el proceso termina en el paso 326. Si el resultado del paso 322 es
una decisión "NO", el proceso continúa hasta el paso 328 en
donde se crea una transcripción de fonemas del deletreo del nombre
recuperado del cliente (según se recupera de la base de datos) por
el sistema de TTS 219 y se almacena ésta como segunda plantilla
independiente del interlocutor. En el paso 330, se intenta el
reconocimiento del deletreo del nombre del cliente, tal como fue
pronunciado por el mismo, usando el algoritmo de reconocimiento de
voz 208, los modelos de fonemas 210 y la segunda plantilla
independiente del interlocutor creada en el paso 328. El proceso
continúa hasta el paso de determinación 332 en donde se determina si
se reconoció el deletreo del nombre del llamador. Si se adopta una
decisión "NO" en el paso 332, el proceso va al paso 306 en
donde la llamada se canaliza hacia un asistente humano y el proceso
termina en el paso 308. Si se toma una decisión de "SÍ" en el
paso 332, el proceso continúa hasta el paso 324 en donde se autoriza
la transacción y el proceso finaliza en el paso 326.
El ejemplo anterior ilustra interacciones en
tiempo real entre un cliente que usa un teléfono o un sistema
interactivo con el usuario, el sistema de ASR 110, el ordenador
principal 124 y una base de datos suplementaria. Sin embargo,
existen otras realizaciones en las cuales el sistema de ASR 110 es
accedido por la LAN 138 o realizaciones en las cuales se registran y
almacenan nombres de clientes en una base de datos durante un
período de tiempo y se accede periódicamente al servicio de datos
proporcionado por la base de datos 142 por parte del sistema de ASR
110 y el ordenador principal 124.
El método y sistema de la presente invención
logra ventajas sobre la técnica anterior porque un sistema de ASR
puede reconocer palabras habladas arbitrarias sin entrenamiento
específico del interlocutor. Ha de entenderse que las realizaciones
antes descritas tienen finalidad únicamente ilustrativa y pueden
idearse otras numerosas realizaciones de la invención por los
versados en la técnica sin apartarse del alcance de la invención
según se define por las reivindicaciones anexas.
Claims (10)
1. Un método realizado en un sistema de
reconocimiento automático de voz, ASR, (110), que tiene una primera
base de datos (204, 206) que almacena modelos de palabras y datos de
correlación en los cuales se basan al menos parcialmente decisiones
de reconocimiento de palabras, utilizando el método información
almacenada en una segunda base de datos suplementaria (128, 140)
para aumentar la capacidad del sistema de ASR, comprendiendo dicho
método:
recibir (304) una entrada de un usuario, teniendo
dicha entrada partes primera y segunda;
almacenar (310) la entrada obtenida del usuario
en el sistema de ASR;
reconocer (312), por el sistema de ASR, la
primera parte de la entrada recuperada del usuario;
identificar y recuperar (318) información
suplementaria almacenada en la base de datos suplementaria
relacionada con la primera parte de la entrada;
crear una plantilla (320) derivada de la
información recuperada de la base de datos suplementaria; y
usar la plantilla (322) para reconocer la segunda
parte de la entrada según fue hablada por el usuario.
2. El método según la reivindicación 1, en el que
el paso de recibir una entrada de un usuario comprende el paso de
recibir un número hablado y un nombre hablado correspondientes a
dichas partes primera y segunda de la entrada, respectivamente.
3. El método según la reivindicación 2, en el que
el paso de usar la plantilla para reconocer la segunda parte
comprende el paso de usar un algoritmo de reconocimiento de voz para
reconocer el nombre hablado.
4. El método según la reivindicación 1, en el que
el paso de crear una plantilla comprende el paso de usar un sistema
(219) de texto a voz para generar una transcripción de fonemas de la
segunda parte de la entrada.
5. El método según la reivindicación 1, en el que
el paso de recibir una entrada de un usuario comprende el paso de
recibir un índice y una elocución hablada (310) correspondiente a
las partes primera y segunda de la entrada, respectivamente.
6. Un sistema de reconocimiento automático de
voz, ASR, (110), para uso en unión de una red telefónica (100A),
comprendiendo el sistema de ASR:
una estación de llamada (102) atendida por un
punto de servicio de conmutación (105);
medios (103B, 106B) para recibir una entrada;
una unidad de interfaz de línea telefónica (108)
para entregar la entrada recibida de la estación de llamada a una
memoria de acceso aleatorio (128) de un ordenador principal
(124);
una unidad de procesamiento central (126) en el
ordenador principal para recuperar información suplementaria de una
base de datos suplementaria (128, 140);
unos medios de texto a voz (219) para crear una
transcripción de fonemas de la información suplementaria recuperada
de la base de datos suplementaria; y
unos medios de reconocimiento de voz (110) para
reconocer una elocución asociada con la información
suplementaria.
7. El sistema de ASR según la reivindicación 6,
en el que la base de datos suplementaria es una base de datos (140)
mantenida por un proveedor de servicios de datos.
8. El sistema de ASR según la reivindicación 6,
en el que la transcripción de fonemas se usa como una plantilla
independiente del interlocutor.
9. El sistema de ASR según la reivindicación 6,
en el que los medios para recibir una entrada son un servicio de ID
del llamador y unos medios de entrada de tono de pulsación.
10. El sistema de ASR según la reivindicación 6,
en el que los medios de reconocimiento de voz comprenden un
algoritmo para comparar fonemas modelo con elocuciones habladas.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US413330 | 1989-09-27 | ||
| US08/413,330 US5724481A (en) | 1995-03-30 | 1995-03-30 | Method for automatic speech recognition of arbitrary spoken words |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2233954T3 true ES2233954T3 (es) | 2005-06-16 |
Family
ID=23636825
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES96301905T Expired - Lifetime ES2233954T3 (es) | 1995-03-30 | 1996-03-20 | Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias. |
Country Status (5)
| Country | Link |
|---|---|
| US (1) | US5724481A (es) |
| EP (1) | EP0735736B1 (es) |
| JP (1) | JP3561076B2 (es) |
| DE (1) | DE69633883T2 (es) |
| ES (1) | ES2233954T3 (es) |
Families Citing this family (54)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5822727A (en) | 1995-03-30 | 1998-10-13 | At&T Corp | Method for automatic speech recognition in telephony |
| JPH10105368A (ja) * | 1996-07-12 | 1998-04-24 | Senshu Ginkou:Kk | 音声による処理依頼受付装置及び方法 |
| WO1998035491A1 (en) * | 1997-02-05 | 1998-08-13 | British Telecommunications Public Limited Company | Voice-data interface |
| GR1003372B (el) * | 1997-09-23 | 2000-05-04 | Συσκευη καταχωρησης ψηφιοποιημενων φωνητικων πληροφοριων και ανακτησης τους μεσω τηλεφωνου με αναγνωριση φωνης | |
| US6404876B1 (en) * | 1997-09-25 | 2002-06-11 | Gte Intelligent Network Services Incorporated | System and method for voice activated dialing and routing under open access network control |
| EP0943139B1 (en) * | 1997-10-07 | 2003-12-03 | Koninklijke Philips Electronics N.V. | A method and device for activating a voice-controlled function in a multi-station network through using both speaker-dependent and speaker-independent speech recognition |
| US6058364A (en) * | 1997-11-20 | 2000-05-02 | At&T Corp. | Speech recognition of customer identifiers using adjusted probabilities based on customer attribute parameters |
| EP0942575A3 (en) * | 1998-03-12 | 2001-11-14 | Novcom N.V. | Adaptive telephone answering system |
| US6278771B1 (en) * | 1998-03-19 | 2001-08-21 | Ameritech Corporation | Method and system for providing enhanced call waiting with verification and name change service |
| US6963871B1 (en) * | 1998-03-25 | 2005-11-08 | Language Analysis Systems, Inc. | System and method for adaptive multi-cultural searching and matching of personal names |
| US8855998B2 (en) | 1998-03-25 | 2014-10-07 | International Business Machines Corporation | Parsing culturally diverse names |
| US8812300B2 (en) | 1998-03-25 | 2014-08-19 | International Business Machines Corporation | Identifying related names |
| US6798868B1 (en) * | 1998-11-02 | 2004-09-28 | Verizon Services Corp. | Call notification service for use with call waiting |
| FR2786600B1 (fr) * | 1998-11-16 | 2001-04-20 | France Telecom | Procede de recherche par le contenu de documents textuels utilisant la reconnaissance vocale |
| US7263489B2 (en) * | 1998-12-01 | 2007-08-28 | Nuance Communications, Inc. | Detection of characteristics of human-machine interactions for dialog customization and analysis |
| US6691089B1 (en) * | 1999-09-30 | 2004-02-10 | Mindspeed Technologies Inc. | User configurable levels of security for a speaker verification system |
| US20030191625A1 (en) * | 1999-11-05 | 2003-10-09 | Gorin Allen Louis | Method and system for creating a named entity language model |
| US7286984B1 (en) | 1999-11-05 | 2007-10-23 | At&T Corp. | Method and system for automatically detecting morphemes in a task classification system using lattices |
| US8392188B1 (en) | 1999-11-05 | 2013-03-05 | At&T Intellectual Property Ii, L.P. | Method and system for building a phonotactic model for domain independent speech recognition |
| US6513003B1 (en) | 2000-02-03 | 2003-01-28 | Fair Disclosure Financial Network, Inc. | System and method for integrated delivery of media and synchronized transcription |
| US6690772B1 (en) * | 2000-02-07 | 2004-02-10 | Verizon Services Corp. | Voice dialing using speech models generated from text and/or speech |
| US6473734B1 (en) * | 2000-03-27 | 2002-10-29 | Motorola, Inc. | Methodology for the use of verbal proxies for dynamic vocabulary additions in speech interfaces |
| US8290768B1 (en) | 2000-06-21 | 2012-10-16 | International Business Machines Corporation | System and method for determining a set of attributes based on content of communications |
| US6408277B1 (en) | 2000-06-21 | 2002-06-18 | Banter Limited | System and method for automatic task prioritization |
| US9699129B1 (en) | 2000-06-21 | 2017-07-04 | International Business Machines Corporation | System and method for increasing email productivity |
| US6778640B1 (en) * | 2000-08-09 | 2004-08-17 | Bellsouth Intellectual Property Corporation | Network and method for providing a user interface for a simultaneous ring telecommunications service with automatic speech recognition capability |
| US6907111B1 (en) | 2000-08-09 | 2005-06-14 | Bellsouth Intellectual Property Corporation | Network and method for providing a name and number delivery telecommunications services with automatic speech recognition capability |
| US6873686B1 (en) * | 2000-08-09 | 2005-03-29 | Bellsouth Intellectual Property Corporation | Network and method for providing a calling name telecommunications service with automatic speech recognition capability |
| US6826529B1 (en) | 2000-08-09 | 2004-11-30 | Bellsouth Intellectual Property Corporation | Network and method for providing a call screening telecommunications service with automatic speech recognition capability |
| US6505163B1 (en) * | 2000-08-09 | 2003-01-07 | Bellsouth Intellectual Property Corporation | Network and method for providing an automatic recall telecommunications service with automatic speech recognition capability |
| US8041023B1 (en) | 2000-09-29 | 2011-10-18 | Aspect Software, Inc. | System and method of using a phone to access information in a call center |
| US7644057B2 (en) | 2001-01-03 | 2010-01-05 | International Business Machines Corporation | System and method for electronic communication management |
| US7127397B2 (en) * | 2001-05-31 | 2006-10-24 | Qwest Communications International Inc. | Method of training a computer system via human voice input |
| US20040002850A1 (en) * | 2002-03-14 | 2004-01-01 | Shaefer Leonard Arthur | System and method for formulating reasonable spelling variations of a proper name |
| US7389230B1 (en) | 2003-04-22 | 2008-06-17 | International Business Machines Corporation | System and method for classification of voice signals |
| US8495002B2 (en) * | 2003-05-06 | 2013-07-23 | International Business Machines Corporation | Software tool for training and testing a knowledge base |
| US20050187913A1 (en) | 2003-05-06 | 2005-08-25 | Yoram Nelken | Web-based customer service interface |
| US7073203B2 (en) * | 2003-08-08 | 2006-07-11 | Simms Fishing Products Corporation | Foot-covering component of a stocking foot wader including gravel guard and method for manufacturing |
| US20050065789A1 (en) * | 2003-09-23 | 2005-03-24 | Sherif Yacoub | System and method with automated speech recognition engines |
| US7440895B1 (en) | 2003-12-01 | 2008-10-21 | Lumenvox, Llc. | System and method for tuning and testing in a speech recognition system |
| US20070005586A1 (en) * | 2004-03-30 | 2007-01-04 | Shaefer Leonard A Jr | Parsing culturally diverse names |
| DE602004024172D1 (de) * | 2004-05-21 | 2009-12-31 | Harman Becker Automotive Sys | Automatische Erzeugung einer Wortaussprache für die Spracherkennung |
| US7099445B2 (en) * | 2004-06-22 | 2006-08-29 | International Business Machines Corporation | Name-alias based delivery of subscriber services |
| US8923838B1 (en) | 2004-08-19 | 2014-12-30 | Nuance Communications, Inc. | System, method and computer program product for activating a cellular phone account |
| US7533018B2 (en) * | 2004-10-19 | 2009-05-12 | Motorola, Inc. | Tailored speaker-independent voice recognition system |
| US7669614B2 (en) * | 2006-08-21 | 2010-03-02 | Dan Cohen | Systems and methods for installation inspection in pipeline rehabilitation |
| EP1895748B1 (en) | 2006-08-30 | 2008-08-13 | Research In Motion Limited | Method, software and device for uniquely identifying a desired contact in a contacts database based on a single utterance |
| US9386154B2 (en) | 2007-12-21 | 2016-07-05 | Nuance Communications, Inc. | System, method and software program for enabling communications between customer service agents and users of communication devices |
| US8484034B2 (en) * | 2008-03-31 | 2013-07-09 | Avaya Inc. | Arrangement for creating and using a phonetic-alphabet representation of a name of a party to a call |
| US8391464B1 (en) | 2010-06-24 | 2013-03-05 | Nuance Communications, Inc. | Customer service system, method, and software program product for responding to queries using natural language understanding |
| US9118669B2 (en) | 2010-09-30 | 2015-08-25 | Alcatel Lucent | Method and apparatus for voice signature authentication |
| CN102479508B (zh) * | 2010-11-30 | 2015-02-11 | 国际商业机器公司 | 用于将文本转换成语音的方法和系统 |
| US9058586B2 (en) | 2011-07-29 | 2015-06-16 | International Business Machines Corporation | Identification of a person located proximite to a contact identified in an electronic communication client |
| JP5818271B2 (ja) * | 2013-03-14 | 2015-11-18 | Necフィールディング株式会社 | 情報処理装置、情報処理システム、情報処理方法及びプログラム |
Family Cites Families (9)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB8809898D0 (en) * | 1988-04-27 | 1988-06-02 | British Telecomm | Voice-operated service |
| US5127043A (en) * | 1990-05-15 | 1992-06-30 | Vcs Industries, Inc. | Simultaneous speaker-independent voice recognition and verification over a telephone network |
| US5303299A (en) * | 1990-05-15 | 1994-04-12 | Vcs Industries, Inc. | Method for continuous recognition of alphanumeric strings spoken over a telephone network |
| US5125022A (en) * | 1990-05-15 | 1992-06-23 | Vcs Industries, Inc. | Method for recognizing alphanumeric strings spoken over a telephone network |
| US5165095A (en) * | 1990-09-28 | 1992-11-17 | Texas Instruments Incorporated | Voice telephone dialing |
| US5212730A (en) * | 1991-07-01 | 1993-05-18 | Texas Instruments Incorporated | Voice recognition of proper names using text-derived recognition models |
| CA2088080C (en) * | 1992-04-02 | 1997-10-07 | Enrico Luigi Bocchieri | Automatic speech recognizer |
| US5297183A (en) * | 1992-04-13 | 1994-03-22 | Vcs Industries, Inc. | Speech recognition system for electronic switches in a cellular telephone or personal communication network |
| US5479489A (en) * | 1994-11-28 | 1995-12-26 | At&T Corp. | Voice telephone dialing architecture |
-
1995
- 1995-03-30 US US08/413,330 patent/US5724481A/en not_active Expired - Lifetime
-
1996
- 1996-03-20 ES ES96301905T patent/ES2233954T3/es not_active Expired - Lifetime
- 1996-03-20 EP EP96301905A patent/EP0735736B1/en not_active Expired - Lifetime
- 1996-03-20 DE DE69633883T patent/DE69633883T2/de not_active Expired - Lifetime
- 1996-04-01 JP JP07856496A patent/JP3561076B2/ja not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| EP0735736B1 (en) | 2004-11-24 |
| DE69633883T2 (de) | 2005-11-17 |
| US5724481A (en) | 1998-03-03 |
| JPH08320696A (ja) | 1996-12-03 |
| JP3561076B2 (ja) | 2004-09-02 |
| EP0735736A2 (en) | 1996-10-02 |
| EP0735736A3 (en) | 1998-10-07 |
| DE69633883D1 (de) | 2004-12-30 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2233954T3 (es) | Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias. | |
| CA2202663C (en) | Voice-operated services | |
| US9088652B2 (en) | System and method for speech-enabled call routing | |
| US6219407B1 (en) | Apparatus and method for improved digit recognition and caller identification in telephone mail messaging | |
| US8494848B2 (en) | Methods and apparatus for generating, updating and distributing speech recognition models | |
| US7873149B2 (en) | Systems and methods for gathering information | |
| EP0780829B1 (en) | Method for automatic speech recognition in telephony | |
| TW424221B (en) | An automated hotel attendant using speech recognition | |
| US7966176B2 (en) | System and method for independently recognizing and selecting actions and objects in a speech recognition system | |
| US20030101045A1 (en) | Method and apparatus for playing recordings of spoken alphanumeric characters | |
| US20090067590A1 (en) | System and method of utilizing a hybrid semantic model for speech recognition | |
| EP1099146A2 (en) | Methods and systems for accessing information from an information source | |
| US20060259294A1 (en) | Voice recognition system and method | |
| AU763704B2 (en) | A transaction processing system with voice recognition and verification | |
| US20020076009A1 (en) | International dialing using spoken commands | |
| JPH04167749A (ja) | 音声応答装置 | |
| Lundin | The Swedish Automatic reverse directory service | |
| JPS6348599A (ja) | 音声認識応答システム | |
| JPH06208390A (ja) | 音声認識装置および音声認識方法 | |
| WO2004055781A2 (en) | Voice recognition system and method | |
| JPH03174596A (ja) | 音声応答装置 | |
| MXPA97005352A (es) | Generacion automatica de vocabulario para la marcacion mediante la voz a base de red de telecomunicaciones | |
| CA2438926A1 (en) | Voice recognition system | |
| JPH04200050A (ja) | 電話音声応答装置 |