ES2233954T3 - Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias. - Google Patents

Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias.

Info

Publication number
ES2233954T3
ES2233954T3 ES96301905T ES96301905T ES2233954T3 ES 2233954 T3 ES2233954 T3 ES 2233954T3 ES 96301905 T ES96301905 T ES 96301905T ES 96301905 T ES96301905 T ES 96301905T ES 2233954 T3 ES2233954 T3 ES 2233954T3
Authority
ES
Spain
Prior art keywords
asr
entry
supplementary
database
spoken
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES96301905T
Other languages
English (en)
Inventor
Roger Borgan Garberg
Michael Allen Yudkowsky
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
AT&T Corp
Original Assignee
AT&T Corp
AT&T IPM Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by AT&T Corp, AT&T IPM Corp filed Critical AT&T Corp
Application granted granted Critical
Publication of ES2233954T3 publication Critical patent/ES2233954T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/38Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections
    • H04M3/382Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/42Systems providing special services or facilities to subscribers
    • H04M3/42204Arrangements at the exchange for service or number selection by voice
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04QSELECTING
    • H04Q3/00Selecting arrangements
    • H04Q3/42Circuit arrangements for indirect selecting controlled by common circuits, e.g. register controller, marker
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M2201/00Electronic components, circuits, software, systems or apparatus used in telephone systems
    • H04M2201/40Electronic components, circuits, software, systems or apparatus used in telephone systems using speech recognition
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M2201/00Electronic components, circuits, software, systems or apparatus used in telephone systems
    • H04M2201/60Medium conversion
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M2242/00Special services or facilities
    • H04M2242/22Automatic class or number identification arrangements
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/38Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections
    • H04M3/382Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords
    • H04M3/385Graded-service arrangements, i.e. some subscribers prevented from establishing certain connections using authorisation codes or passwords using speech signals
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/42Systems providing special services or facilities to subscribers
    • H04M3/42025Calling or Called party identification service
    • H04M3/42034Calling party identification service
    • H04M3/42059Making use of the calling party identifier
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/42Systems providing special services or facilities to subscribers
    • H04M3/487Arrangements for providing information services, e.g. recorded voice services or time announcements
    • H04M3/493Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/42Systems providing special services or facilities to subscribers
    • H04M3/487Arrangements for providing information services, e.g. recorded voice services or time announcements
    • H04M3/493Interactive information services, e.g. directory enquiries ; Arrangements therefor, e.g. interactive voice response [IVR] systems or voice portals
    • H04M3/4931Directory assistance systems
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04QSELECTING
    • H04Q3/00Selecting arrangements
    • H04Q3/72Finding out and indicating number of calling subscriber

Landscapes

  • Engineering & Computer Science (AREA)
  • Signal Processing (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Computer Security & Cryptography (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Telephonic Communication Services (AREA)
  • Document Processing Apparatus (AREA)
  • Machine Translation (AREA)

Abstract

SE PRESENTA UN METODO Y UN SISTEMA PARA HACER POSIBLE QUE UN SISTEMA DE RECONOCIMIENTO AUTOMATICO DEL HABLA (ASR) RECONOZCA PALABRAS ARBITRARIAS, ACCEDIENDO A LA INFORMACION EN UNA BASE DE DATOS SUPLEMENTARIA. LA BASE DE DATOS SUPLEMENTARIA ES ACCEDIDA PARA RECUPERAR INFORMACION TEXTUAL SUPLEMENTARIA, TAL COMO UN NOMBRE PROPIO. SE UTILIZA UN MEDIO DE TEXTO-A-HABLA PARA GENERAR UNA TRANSCRIPCION DE FONEMAS DEL TEXTO RECUPERADO DE LA BASE DE DATOS SUPLEMENTARIA, DE MANERA QUE PUEDA UTILIZARSE LA TRANSCRIPCION COMO PLANTILLA INDEPENDIENTE DE LA PERSONA QUE HABLA POR EL SISTEMA ASR PARA RECONOCER UNA PALABRA HABLADA.

Description

Método para reconocimiento de voz automático de palabras habladas arbitrarias.
Campo de la invención
La presente invención se refiere al reconocimiento de voz automático. Más en particular, la invención se refiere a un método de utilizar información suplementaria recuperada de una base de datos en unión con una red telefónica para ayudar a un sistema de reconocimiento de voz automático (ASR) a reconocer una palabra hablada por el usuario.
Antecedentes de la invención
Para muchas aplicaciones, es ventajosos utilizar ordenadores para automatizar tareas repetitivas de modo que estas tareas puedan ser realizadas con más rapidez y eficacia. El reconocimiento de voz, un tipo de tecnología vocal, permite que la gente interactúe con ordenadores utilizando palabras habladas. Sin embargo, el reconocimiento de voz es todo un reto debido a las variaciones de voz inherentes entre personas diferentes.
Una aplicación del reconocimiento de voz es una red telefónica. Utilizando sistemas de reconocimiento de voz automático (ASR), la gente puede comunicarse por teléfono de modo que se puedan realizar tareas sencillas sin intervención del operador. Por ejemplo, el reconocimiento de voz puede utilizarse para marcar de modo que el usuario del teléfono no necesite recordar, buscar o pedir un número telefónico. La capacidad de utilizar voz en vez de una manipulación física de un interfaz de usuario ha mantenido alta la demanda de tecnología ASR a la vez que continúan los avances en telecomunicaciones. Generalmente, hay dos tipos de sistemas de ASR utilizados en telecomunicaciones: dependiente del interlocutor e independiente del interlocutor.
Una implementación común de un sistema de reconocimiento de voz automático dependiente del interlocutor utiliza un ordenador que ha sido "entrenado" por un interlocutor particular para que responda a patrones de voz del interlocutor. El proceso de entrenamiento comprende la vocalización de un sonido (es decir, una palabra) para generar una entrada de voz analógica, la conversión de la entrada de voz en señales digitales, la generación de una plantilla representativa del sonido y el almacenamiento de la plantilla indexada para datos de respuesta específicos apropiados, tales como una instrucción de ordenador para instigar una acción.
Durante operaciones en tiempo real, las palabras habladas por el interlocutor entrenador son digitalizadas y comparadas con el conjunto de plantillas dependientes del interlocutor en el sistema de ASR de modo que una coincidencia entre las palabras habladas y una plantilla pueda disparar una respuesta particular por parte del ordenador. Los sistemas de ASR dependientes del interlocutor se usan primordialmente allí donde pueda estar justificado el proceso de entrenamiento, por ejemplo allí donde los mismos individuos acceden al sistema en muchas ocasiones.
Para aplicaciones en las que no pueda estar justificado un entrenamiento individual, se ha de utilizar un ASR independiente del interlocutor. Una implementación común de un sistema de ASR independiente del interlocutor utiliza un ordenador para almacenar una plantilla compuesta o una agrupación de plantillas que representen una palabra hablada por una pluralidad de personas diferentes. Las plantillas se derivan de numerosas muestras de datos (es decir, palabras habladas por una pluralidad de interlocutores) que representan una amplia gama de pronunciaciones y variaciones en las características de la voz. Los sistemas de reconocimiento de voz independientes del interlocutor pueden interactuar con una amplia diversidad de personas sin entrenamiento específico del interlocutor.
Se conocen en la técnica aplicaciones telefónicas que utilizan ASR independiente del interlocutor para reconocer números hablados. Estas aplicaciones son especialmente útiles cuando el vocabulario del interlocutor se limita a unas pocas órdenes y/o números de menú (por ejemplo, 0-9). Sin embargo, es muy difícil letras habladas (A-Z) por la red telefónica. De hecho, debido a diversos tipos de ruido y limitaciones de ancho de banda, acoplados con la amplia diversidad de patrones de voz entre interlocutores individuales, el ambiente telefónico hace que todas las aplicaciones de ASR (dependientes del interlocutor e independientes del interlocutor) sean propensas a error.
No obstante, una aplicación comercial muy perseguida de ASR es la automatización de tareas asociadas con transacciones comerciales, por ejemplo transacciones de tarjetas de crédito, hechas a través de la red telefónica. Por ejemplo, si un cliente desea comprar productos o servicios por teléfono, se podría utilizar el ASR para recoger la información pertinente y autorizar la transacción rápida y eficazmente con intervención mínima del operador.
Las compras telefónicas de productos o servicios hechas utilizando una tarjeta de crédito/débito pueden requerir que el cliente proporcione su nombre (u otra información predeterminada) como un paso en la transacción. Desgraciadamente, es el reconocimiento de la información de palabras habladas arbitrarias (tal como el nombre de cliente) el que ha inhibido el uso de tecnología ASR por aquellas entidades que más la necesitan, tales como negocios de alto volumen.
Esto se debe a que los negocios de alto volumen no sólo requieren un sistema de ASR para reconocer palabras habladas arbitrarias (por ejemplo, nombres propios), sino que requieren también un acceso ubicuo al sistema de ASR. Por ejemplo, para atender a las necesidades de un negocio de alto volumen con clientes potenciales en todo un país utilizando sistemas de ASR convencionales, se habrían de crear y almacenar utilizando las técnicas descritas más arriba plantillas independientes del interlocutor correspondientes al nombre de cada persona en todo el país. Sin embargo, los presentes sistemas de ASR del estado de la técnica son incapaces de casar un nombre hablado con uno de los millones de posibles nombres correspondientes a las plantillas almacenadas.
Por tanto existe una necesidad en la técnica de mejoras en sistemas de ASR que permitirán que tales sistemas reconozcan automáticamente palabras habladas con una capacidad incrementada.
El documento WO-A-91 18386 se dirige al reconocimiento y verificación simultáneos de voz, independientes del interlocutor, en una red telefónica, en los que son reconocidas cadenas alfanuméricas habladas por la red telefónica. El llamador es invitado a pronunciar cada carácter de una cadena, usándose un algoritmo de reconocimiento de voz independiente del interlocutor para reconocer cada carácter pronunciado. Las diferencias de reconocimiento acumulativas son almacenadas a medida que cada carácter es pronunciado y casado con un conjunto posible de caracteres alfanuméricos. Después de que todos los caracteres han sido pronunciados, se declara que la cadena de referencia con la diferencia acumulativa más baja es la cadena reconocida.
Sumario de la invención
Un método y un sistema según la invención se exponen en las reivindicaciones independientes. Formas preferidas se exponen en las reivindicaciones dependientes.
Se aborda esta necesidad y se logra una avance técnico en la materia por un método y un sistema de utilizar datos suplementarios para aumentar la capacidad de un sistema de ASR de modo que el sistema pueda rápida y precisamente reconocer palabras habladas arbitrarias, tales como nombres propios.
Es una práctica común en aplicaciones de telefonía de un sistema de ASR solicitar un número de teléfono a un llamador. El número de teléfono del llamador puede obtenerse por voz u otros métodos conocidos, tal como una entrada de ID o de tono de pulsación del llamador. Por tanto, según una realización ejemplar del método y sistema de la presente invención, el número de teléfono del llamador sirve como un índice para recuperar texto (es decir, el nombre del llamador) de una base de datos. El texto se usa entonces para limitar o especificar las opciones disponibles de un sistema de ASR.
Más particularmente, el número de teléfono del llamador se usa para acceder a una base de datos suplementaria para recuperar texto asociado con el número de teléfono. En la realización ejemplar antes mencionada, se recupera texto que contiene el nombre del usuario de la base de datos suplementaria. El texto del nombre del usuario comprende una representación alfanumérica digitalizada del nombre propio del llamador. Se usa un sistema de texto a voz para transcribir el texto del nombre de llamador a una transcripción de fonemas, según se conoce en la técnica. La transcripción de fonemas del nombre es almacenada en el sistema de ASR como una plantilla independiente del interlocutor de modo que se pueda reconocer voz - que se ajuste a la transcripción - por el sistema de ASR. La recuperación y conversión de los datos textuales suplementarios en una transcripción de fonemas permite que el sistema de ASR responda inmediatamente a palabras habladas que se ajusten a la transcripción de los datos recuperados en ausencia de entrenamiento específico del interlocutor.
Durante aplicaciones en tiempo real de la realización ejemplar anterior, se recibe una llamada telefónica por un proveedor de servicios que mantiene un sistema de ASR según la presente invención. El llamador que desea hacer una compra con tarjeta de crédito de un producto o servicio es invitado a que proporcione un número de teléfono y un nombre. Basándose en el número de teléfono proporcionado por el llamador, se accede a una base de datos suplementaria (por ejemplo, un directorio telefónico electrónico) para recuperar el texto de un nombre asociado con el número de teléfono. Se crea una transcripción de fonemas del texto del nombre recuperado de la base de datos por medio de un sistema de texto a voz. La transcripción de fonemas se almacena entonces como una plantilla independiente del interlocutor para que el sistema de ASR la use para reconocer el nombre tal como fue pronunciado por el llamador.
Si el nombre pronunciado por el llamador no es reconocido por el sistema de ASR debido a una pronunciación inusual de nombres, pobre calidad de la transmisión telefónica, llamadores cuyas voces son difíciles de reconocer, etc., se invita al llamador que proporcione un deletreo de su nombre, letra por letra. El sistema de texto a voz puede usarse para crear una transcripción de fonemas del deletreo del nombre escrito tal como es recuperado de la base de datos. El deletreo del nombre recuperado de la base de datos también se almacena como una plantilla independiente del interlocutor en el sistema de ASR de modo que el sistema puede intentar reconocer el deletreo del nombre del llamador (según es pronunciado por el llamador). Si no hay coincidencia entre la expresión hablada del nombre del usuario y la transcripción de fonemas (basándose en los algoritmos de reconocimiento de voz establecidos), la llamada es canalizada hacia un asistente humano.
Breve descripción de los dibujos
La figura 1 es un diagrama de bloques simplificado de sistemas interactivos de teléfono y usuario asociados con un sistema de ASR según una realización ejemplar de la presente invención;
La figura 2 es un diagrama de bloques simplificado del sistema de ASR de la figura 1 que se usa para proporcionar reconocimiento y verificación de voz según una realización ejemplar de la presente invención; y
La figura 3 es un diagrama de flujo de un método ejemplar según la presente invención.
Descripción detallada
La figura 1 muestra dos sistemas 100A y 100B según una realización ejemplar de la presente invención. El sistema telefónico de voz 100A incluye una estación de llamada 102, líneas de telecomunicaciones 103A y 103B y un punto de servicio de conmutación (SSP) 105 que está localizado en una red telefónica conmutada pública 107. Por claridad, se muestra un solo punto de servicio de conmutación, pero una red telefónica conmutada pública operacional comprende una red interconectada de SSPs. Una línea de interfaz de línea telefónica 108 protege el equipo del sistema de ASR 110 frente a funcionamientos deficientes de la red, tales como fuertes fluctuaciones de potencia, y digitaliza la voz entrante de la estación de llamada 102, si la voz originaria no está ya digitalizada, antes de su entrega al sistema.
El SSP 105 es un conmutador digital local de control distribuido, tal como un conmutador 5ESS® según se describe en AT&T Technical Journal, Vol. 64, Nº 6, julio-agosto de 1985, páginas 1303-1564, noviembre de 1981, Bell Laboratories Record, página 258, y diciembre de 1981, Bell Laboratories Record, página 290, y fabricado por AT&T. Alternativamente, el SSP 105 puede ser un conmutador analógico o digital de control distribuido, tal como un sistema de conmutación ISDN según se describe en la patente norteamericana número 4.592.048, expedida a M. W. Beckner y otros el 27 de mayo de 1986. En la figura 1, el SSP 105 está conectado a través de líneas 103 identificadas por clientes a la estación de llamada 102 y también está en comunicación con un ordenador principal 124 a través de un línea 121B según se describe a continuación.
Según se muestra también en la figura 1, el sistema 100B interactivo con el usuario incluye un micrófono 104 y una unidad de interfaz 109 de micrófono. El micrófono 104 se puede disponer en un kiosco o una máquina pagadora automatizada (no mostrada) mantenida por el proveedor de servicios como un enlace entre el sistema de ASR y el cliente, según se conoce en la técnica.
La voz entrante es transformada en señales eléctricas por el micrófono 104 y entregada a la unidad de interfaz 109 de micrófono a través de un enlace de comunicaciones 106A. La unidad de interfaz 109 de micrófono convierte las señales de voz entrante en datos digitales antes de entregarlas al sistema de ASR 110 a través del enlace de comunicaciones 106B.
El sistema de ASR 110 (descrito a continuación con detalle en la figura 2) está en comunicación con el ordenador principal 124 a través de un bus de datos 125. El ordenador principal 124 incluye una unidad de procesamiento central (CPU) 126 para controlar el funcionamiento global del ordenador, una memoria de acceso aleatorio (RAM) 128 para almacenamiento temporal de datos, una memoria de sólo lectura (ROM) 130 para almacenamiento permanente de datos y una base de datos no volátil 134 para almacenar programas de control asociados con el ordenador principal 124. La CPU 126 se comunica con la RAM 128 y la ROM 130 a través de unos buses de datos 132. Igualmente, la CPU 126 se comunica con la base de datos no volátil 134 a través de un bus de datos 133. Un interfaz de entrada/salida (I/O) 136 está conectado al ordenador principal 124 a través del bus de datos 135 para facilitar el flujo de datos desde una red de área local (LAN) 138 que está en comunicación con el interfaz I/O 136 a través del enlace de datos 139, una base de datos suplementaria 140 que está en comunicación con el interfaz I/O 136 a través del enlace de datos 141 y una red de servicio de datos 142 que transmite datos digitales al ordenador principal 124 a través de la línea de telecomunicaciones 121A, el SSP 105 y el enlace de datos 121B, según se describe a continuación.
La figura 2 muestra un diagrama de bloques simplificado de una realización ejemplar de un sistema de ASR 110 según se muestra en la figura 1. El sistema de ASR 110, que es capaz de reconocimiento de voz independiente del interlocutor o dependiente del interlocutor incluye una CPU 202 para controlar el funcionamiento global del sistema. La CPU 202 tiene una serie de buses de datos representados generalmente por el número de referencia 203. Asimismo, se muestran una memoria de acceso aleatorio (RAM) 204, una memoria de sólo lectura (ROM) 206, una unidad generadora de voz 218 para emitir salutaciones e invitaciones a un llamador y un sistema de texto a voz (TTS) 219 (que se comunica con la CPU 202 y la RAM 204) para transcribir texto escrito en una transcripción de fonemas, según se conoce en la técnica.
La RAM 204 está conectada a la CPU 202 por un bus 203 y proporciona almacenamiento temporal de datos de voz, tales como palabras habladas por un llamador en la estación de llamada 102 o en la estación 104 de micrófono, plantillas 214 dependientes del interlocutor y plantillas 216 independientes del interlocutor. La ROM 206, también conectada a la CPU 202 por el bus de datos 203, proporciona almacenamiento permanente de datos de reconocimiento y verificación de voz, incluyendo un algoritmo de reconocimiento de voz 208 y modelos de fonemas 210. En esta realización ejemplar, se utiliza un algoritmo de reconocimiento de voz 208 basado en fonemas, aunque se conocen en la técnica otros muchos enfoques útiles de reconocimiento de voz.
Un fonema es un término del ramo que se refiere a una de un conjunto de unidades de voz muy pequeñas que pueden combinarse con otras de tales unidades para formar segmentos de voz más grandes, por ejemplo morfemas. Por ejemplo, los segmentos fonéticos de la palabra hablada "operator" pueden representarse por una combinación de fonemas tales como "aa", "p", "axr", "ey", "dx" y "axr". Los modelos de fonemas 210 son compilados usando datos de clase de reconocimiento de voz que se derivan de las elocuciones de una muestra de interlocutores en un proceso anterior fuera de línea. Durante el proceso, se hablan palabras seleccionadas para representar todos los fonemas del lenguaje por parte de un gran número de interlocutores de entrenamiento (por ejemplo, 1000). Las elocuciones se procesan por un individuo entrenado que genera un texto escrito del contenido de esas elocuciones.
El texto escrito de la palabra se recibe entonces por una unidad de texto a voz, tal como el sistema de TTS 219, de modo que pueden crear una transcripción de fonemas del texto escrito usando reglas de conversión de texto a voz, según se conoce en la técnica. La transcripción de fonemas del texto escrito se compara entonces con los fonemas derivados del funcionamiento del algoritmo de reconocimiento de voz 208, que compara las elocuciones con los modelos de fonemas 210. Los modelos de fonemas 210 se ajustan durante este proceso de "entrenamiento de modelos" hasta que se obtiene una coincidencia adecuada entre el fonema derivado de la transcripción de texto a voz de las elocuciones y fonemas reconocidos por el algoritmo de reconocimiento de voz 208, usando técnicas de ajuste según se conoce en la técnica.
Los modelos de fonemas 210 se usan junto con el algoritmo de reconocimiento de voz 208 durante el proceso de reconocimiento. Más particularmente, el algoritmo de reconocimiento de voz 208 empareja una palabra hablada con modelos de fonemas establecidos. Si el algoritmo de reconocimiento de voz determina que existe una coincidencia (es decir, si la elocución hablada coincide estadísticamente con los modelos de fonemas según parámetros predefinidos), se genera una lista de fonemas.
Dado que los modelos de fonemas 210 representan una distribución de características de una palabra hablada en una población grande de interlocutores, los modelos se pueden usar para un acceso ubicuo a un sistema de ASR que atiende a la misma población de interlocutores representada por los interlocutores de entrenamiento (es decir, americanos nativos, poblaciones de habla hispana, etc.).
La plantilla 216 independiente del interlocutor es una lista de fonemas que representan una elocución o frase esperada. Una plantilla 216 independiente del interlocutor es creada procesando texto escrito a través del sistema de TTS 219 para generar una lista de fonemas que ejemplifican las pronunciaciones esperadas de la palabra o frase escrita. En general, se almacenan plantillas múltiples en la memoria RAM 204 de modo que estén disponibles para el algoritmo de reconocimiento de voz 208. La tarea del algoritmo 208 es elegir que plantilla coincide en mayor grado con los fonemas de una elocución hablada.
Las plantillas 214 dependientes del interlocutor se generan haciendo que el interlocutor proporcione una elocución de una palabra o frase, y procesando la elocución usando el algoritmo de reconocimiento de voz 208 y los modelos de fonemas 210 para producir una lista de fonemas que comprende los fonemas reconocidos por el algoritmo. Esta lista de fonemas es la plantilla 214 dependiente del interlocutor para esa elocución particular.
Durante operaciones de reconocimiento de voz en tiempo real, se procesa una elocución por el algoritmo de reconocimiento de voz 208 usando modelos de fonemas 210 de tal modo que se genere una lista de fonemas. Esta lista de fonemas se empareja con la lista proporcionada por las plantillas 216 independientes del interlocutor y las plantillas 214 dependientes del interlocutor, usando técnicas según se conoce en la materia. El algoritmo de reconocimiento de voz 208 reporta los resultados del emparejamiento.
La figura 3 es un diagrama de flujo que describe las acciones adoptadas en el sistema de ASR 110 cuando el sistema está desarrollando en un modo independiente del interlocutor una realización ejemplar del método de la presente invención.
Como ejemplo de una aplicación comercial de la presente invención, supóngase que un cliente está llamando desde un teléfono particular (estación de llamada 102) y desea hacer una compra con tarjeta de crédito de un servicio ofrecido por un proveedor de servicios que usa el sistema de ASR 110 y el ordenador principal 124. En este ejemplo, el cliente no ha adquirido previamente el servicio, por lo que el sistema de ASR 110 no está entrenado para reconocer los patrones de voz particulares del cliente (es decir, no existen plantillas 214 dependientes del interlocutor establecidas por este cliente). Sin embargo, con el fin de autorizar la transacción de la tarjeta de crédito el sistema de ASR 110 debe recibir y reconocer el nombre del cliente.
El ejemplo comienza cuando en el paso 300 el sistema de ASR 110 recibe una llamada entrante originada por un cliente canalizada a través de las líneas de telecomunicaciones 103A, 103B y el SSP 105 de la red telefónica conmutada pública 107.
Alternativamente, el cliente podría poner una orden de servicio desde un kiosco que aloja un sistema interactivo con el usuario que incluye la estación 104 de micrófono. Si es así, se recibe una "llamada" entrante por el sistema de ASR 110 cuando se detecta una entrada de cliente (por ejemplo, voz) en la estación 104 de micrófono y se entrega ésta al sistema a través del enlace de comunicaciones 106B.
Tanto en el sistema telefónico como en el sistema interactivo con el usuario, la llamada entrante es procesada por una unidad de interfaz (es decir, la unidad de interfaz 108 de la línea telefónica y la unidad de interfaz 109 del micrófono, respectivamente) para garantizar que toda entrada recibida en el sistema de ASR 110 está en un formato digital común.
Según se muestra en el paso 302, la unidad generadora de voz 218 del sistema de ASR 110 emite una salutación e invita al usuario a que haga una entrada tal como un índice predeterminado (por ejemplo, número de teléfono particular), un nombre asociado con el índice y, posiblemente, un deletreo del nombre. Alternativamente, el sistema podría diferir la invitación a que el usuario deletree el nombre hasta que éste sea necesario en el proceso, según se describe a continuación.
El proceso continúa hasta el paso de determinación 304 en donde se determina si se recibió la entrada solicitada. Si el resultado del paso 304 es una decisión "NO", el procedimiento continúa hasta el paso 306 en donde la llamada es canalizada hacia un asistente humano y el proceso termina en el paso final 308.
Si el resultado en el paso 304 es una decisión "SÍ", el proceso continúa hasta el paso 318 en donde la elocución del cliente del índice, nombre y deletreo del nombre son almacenados en la RAM 204 del sistema de ASR 110. En el ejemplo anterior, el cliente proporcionó el índice hablando. Cuando el índice es el número de teléfono particular del cliente, se puede recuperar por otras técnicas conocidas, tales como una entrada de ID o de tono de pulsación del llamador.
El proceso continúa hasta el paso 310 en donde hay un intento de reconocer el índice del llamador usando el algoritmo de reconocimiento de voz 208 y los fonemas modelo (para dígitos) 210. El índice se usa para recuperar información de una base de datos suplementaria, según se describe a continuación. Si existe incertidumbre sobre determinados dígitos del índice, puede programarse el sistema para que reconozca posibilidades múltiples. En el paso de determinación 314, se determina si el índice del cliente se reconoció en el paso anterior. Si el resultado del paso de determinación es una decisión "NO", el proceso continúa hasta el paso 306 en donde la llamada se canaliza hacia un asistente humano y el proceso termina en el paso final 308.
Si el resultado en el paso de determinación 314 es una decisión "SÍ", el proceso continúa hasta el paso 316 en donde la CPU 202 del sistema de ASR 110 hace una petición al ordenador principal 124 de datos suplementarios. En el ejemplo anterior, los datos suplementarios deseados son una representación digitalmente almacenada del nombre del cliente (por ejemplo, el nombre asociado al número de teléfono particular recibido por el cliente), tal como en formato de texto ASCII.
Cuando la solicitud de datos suplementarios se recibe en la CPU 126 del ordenador principal 124, la CPU 126 determina a qué datos suplementarios debe accederse, usando el índice (por ejemplo, el número de teléfono proporcionado por el cliente), para recuperar una representación digital (por ejemplo, formato de texto ASCII) del nombre del cliente. La CPU 126 hace la determinación basándose en instrucciones recibidas de la base de datos no volátil 134.
Por ejemplo, si el proveedor de servicios es una entidad grande, puede mantener una base de datos auxiliar 140, tal como una base de datos en CD-ROM, que se comunica con el ordenador principal 124 a través del enlace de datos 141 y el interfaz I/O 136. La base de datos 140 podría contener información comprensiva de clientes, tal como direcciones y nombres de clientes, números de cuenta de tarjetas de crédito e historial de adquisiciones, indexada por el número de teléfono. Sin embargo, si el proveedor de servicio es una entidad pequeña con una base de clientes que cambia rápidamente, puede estar almacenada una limitada base de datos suplementaria dentro del ordenador principal 124 (por ejemplo, en la RAM 128).
Alternativamente, algunos proveedores de servicios pueden mantener una red de ordenadores (por ejemplo, la LAN 138) desde la cual se pueden descargar datos suplementarios al ordenador principal 124 a través del enlace de datos 139 y el interfaz I/O 136.
En el ejemplo anterior, supóngase que el proveedor de servicios se suscribe a un servicio de datos ofrecido por la red de telecomunicaciones que mantiene la red telefónica de conmutación pública 107. El servicio de datos 142 incluye una base de datos en la cual almacena un directorio telefónico electrónico que incluye el número de teléfono y los nombres de clientes correspondientes de todos los teléfonos residenciales de los Estados Unidos. En el ejemplo anterior, el servicio de datos 142 envía paquetes de datos digitales de información (por ejemplo, un texto de un nombre de cliente) a través de la línea de telecomunicaciones 121A al SSP 105. El SSP 105 entrega la información digital al ordenador principal 124 a través de la línea de telecomunicaciones 121B que va al interfaz I/O 136 de modo que se pueda recuperar un texto del nombre del cliente por el ordenador principal 124 y almacenarlo en la RAM 128. Si se recuperan múltiples nombres (debido a posibilidades múltiples de números telefónicos particulares o nombres múltiples asociados con el número telefónico), se proporcionan todos los posibles nombres al ordenador principal.
El proceso continúa en el paso 318 en donde, en respuesta a una petición recibida desde la CPU 202, el(los) texto(s) del nombre recuperado(s) de la base de datos suplementaria se recuperan de la RAM 128 y se procesan por el sistema de TTS 219 de modo que se genere y se almacene una transcripción de fonemas del texto como una plantilla independiente del interlocutor en la RAM 204. Según se muestra en el paso 320, se intenta el reconocimiento del nombre del llamador tal como fue pronunciado por el mismo (y almacenado en la RAM 204) usando el algoritmo de voz 208, los modelos de fonemas 210 y la(s) plantilla(s) independiente(s) del interlocutor creada(s) en el paso 318.
En el paso de determinación 322, se hace una determinación de si tuvo lugar un reconocimiento en el paso 320. Si el resultado del paso 322 es una decisión "SÍ", el proceso continúa hasta el paso 324 en donde la transacción es autorizada y el proceso termina en el paso 326. Si el resultado del paso 322 es una decisión "NO", el proceso continúa hasta el paso 328 en donde se crea una transcripción de fonemas del deletreo del nombre recuperado del cliente (según se recupera de la base de datos) por el sistema de TTS 219 y se almacena ésta como segunda plantilla independiente del interlocutor. En el paso 330, se intenta el reconocimiento del deletreo del nombre del cliente, tal como fue pronunciado por el mismo, usando el algoritmo de reconocimiento de voz 208, los modelos de fonemas 210 y la segunda plantilla independiente del interlocutor creada en el paso 328. El proceso continúa hasta el paso de determinación 332 en donde se determina si se reconoció el deletreo del nombre del llamador. Si se adopta una decisión "NO" en el paso 332, el proceso va al paso 306 en donde la llamada se canaliza hacia un asistente humano y el proceso termina en el paso 308. Si se toma una decisión de "SÍ" en el paso 332, el proceso continúa hasta el paso 324 en donde se autoriza la transacción y el proceso finaliza en el paso 326.
El ejemplo anterior ilustra interacciones en tiempo real entre un cliente que usa un teléfono o un sistema interactivo con el usuario, el sistema de ASR 110, el ordenador principal 124 y una base de datos suplementaria. Sin embargo, existen otras realizaciones en las cuales el sistema de ASR 110 es accedido por la LAN 138 o realizaciones en las cuales se registran y almacenan nombres de clientes en una base de datos durante un período de tiempo y se accede periódicamente al servicio de datos proporcionado por la base de datos 142 por parte del sistema de ASR 110 y el ordenador principal 124.
El método y sistema de la presente invención logra ventajas sobre la técnica anterior porque un sistema de ASR puede reconocer palabras habladas arbitrarias sin entrenamiento específico del interlocutor. Ha de entenderse que las realizaciones antes descritas tienen finalidad únicamente ilustrativa y pueden idearse otras numerosas realizaciones de la invención por los versados en la técnica sin apartarse del alcance de la invención según se define por las reivindicaciones anexas.

Claims (10)

1. Un método realizado en un sistema de reconocimiento automático de voz, ASR, (110), que tiene una primera base de datos (204, 206) que almacena modelos de palabras y datos de correlación en los cuales se basan al menos parcialmente decisiones de reconocimiento de palabras, utilizando el método información almacenada en una segunda base de datos suplementaria (128, 140) para aumentar la capacidad del sistema de ASR, comprendiendo dicho método:
recibir (304) una entrada de un usuario, teniendo dicha entrada partes primera y segunda;
almacenar (310) la entrada obtenida del usuario en el sistema de ASR;
reconocer (312), por el sistema de ASR, la primera parte de la entrada recuperada del usuario;
identificar y recuperar (318) información suplementaria almacenada en la base de datos suplementaria relacionada con la primera parte de la entrada;
crear una plantilla (320) derivada de la información recuperada de la base de datos suplementaria; y
usar la plantilla (322) para reconocer la segunda parte de la entrada según fue hablada por el usuario.
2. El método según la reivindicación 1, en el que el paso de recibir una entrada de un usuario comprende el paso de recibir un número hablado y un nombre hablado correspondientes a dichas partes primera y segunda de la entrada, respectivamente.
3. El método según la reivindicación 2, en el que el paso de usar la plantilla para reconocer la segunda parte comprende el paso de usar un algoritmo de reconocimiento de voz para reconocer el nombre hablado.
4. El método según la reivindicación 1, en el que el paso de crear una plantilla comprende el paso de usar un sistema (219) de texto a voz para generar una transcripción de fonemas de la segunda parte de la entrada.
5. El método según la reivindicación 1, en el que el paso de recibir una entrada de un usuario comprende el paso de recibir un índice y una elocución hablada (310) correspondiente a las partes primera y segunda de la entrada, respectivamente.
6. Un sistema de reconocimiento automático de voz, ASR, (110), para uso en unión de una red telefónica (100A), comprendiendo el sistema de ASR:
una estación de llamada (102) atendida por un punto de servicio de conmutación (105);
medios (103B, 106B) para recibir una entrada;
una unidad de interfaz de línea telefónica (108) para entregar la entrada recibida de la estación de llamada a una memoria de acceso aleatorio (128) de un ordenador principal (124);
una unidad de procesamiento central (126) en el ordenador principal para recuperar información suplementaria de una base de datos suplementaria (128, 140);
unos medios de texto a voz (219) para crear una transcripción de fonemas de la información suplementaria recuperada de la base de datos suplementaria; y
unos medios de reconocimiento de voz (110) para reconocer una elocución asociada con la información suplementaria.
7. El sistema de ASR según la reivindicación 6, en el que la base de datos suplementaria es una base de datos (140) mantenida por un proveedor de servicios de datos.
8. El sistema de ASR según la reivindicación 6, en el que la transcripción de fonemas se usa como una plantilla independiente del interlocutor.
9. El sistema de ASR según la reivindicación 6, en el que los medios para recibir una entrada son un servicio de ID del llamador y unos medios de entrada de tono de pulsación.
10. El sistema de ASR según la reivindicación 6, en el que los medios de reconocimiento de voz comprenden un algoritmo para comparar fonemas modelo con elocuciones habladas.
ES96301905T 1995-03-30 1996-03-20 Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias. Expired - Lifetime ES2233954T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US413330 1989-09-27
US08/413,330 US5724481A (en) 1995-03-30 1995-03-30 Method for automatic speech recognition of arbitrary spoken words

Publications (1)

Publication Number Publication Date
ES2233954T3 true ES2233954T3 (es) 2005-06-16

Family

ID=23636825

Family Applications (1)

Application Number Title Priority Date Filing Date
ES96301905T Expired - Lifetime ES2233954T3 (es) 1995-03-30 1996-03-20 Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias.

Country Status (5)

Country Link
US (1) US5724481A (es)
EP (1) EP0735736B1 (es)
JP (1) JP3561076B2 (es)
DE (1) DE69633883T2 (es)
ES (1) ES2233954T3 (es)

Families Citing this family (54)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5822727A (en) 1995-03-30 1998-10-13 At&T Corp Method for automatic speech recognition in telephony
JPH10105368A (ja) * 1996-07-12 1998-04-24 Senshu Ginkou:Kk 音声による処理依頼受付装置及び方法
WO1998035491A1 (en) * 1997-02-05 1998-08-13 British Telecommunications Public Limited Company Voice-data interface
GR1003372B (el) * 1997-09-23 2000-05-04 Συσκευη καταχωρησης ψηφιοποιημενων φωνητικων πληροφοριων και ανακτησης τους μεσω τηλεφωνου με αναγνωριση φωνης
US6404876B1 (en) * 1997-09-25 2002-06-11 Gte Intelligent Network Services Incorporated System and method for voice activated dialing and routing under open access network control
EP0943139B1 (en) * 1997-10-07 2003-12-03 Koninklijke Philips Electronics N.V. A method and device for activating a voice-controlled function in a multi-station network through using both speaker-dependent and speaker-independent speech recognition
US6058364A (en) * 1997-11-20 2000-05-02 At&T Corp. Speech recognition of customer identifiers using adjusted probabilities based on customer attribute parameters
EP0942575A3 (en) * 1998-03-12 2001-11-14 Novcom N.V. Adaptive telephone answering system
US6278771B1 (en) * 1998-03-19 2001-08-21 Ameritech Corporation Method and system for providing enhanced call waiting with verification and name change service
US6963871B1 (en) * 1998-03-25 2005-11-08 Language Analysis Systems, Inc. System and method for adaptive multi-cultural searching and matching of personal names
US8855998B2 (en) 1998-03-25 2014-10-07 International Business Machines Corporation Parsing culturally diverse names
US8812300B2 (en) 1998-03-25 2014-08-19 International Business Machines Corporation Identifying related names
US6798868B1 (en) * 1998-11-02 2004-09-28 Verizon Services Corp. Call notification service for use with call waiting
FR2786600B1 (fr) * 1998-11-16 2001-04-20 France Telecom Procede de recherche par le contenu de documents textuels utilisant la reconnaissance vocale
US7263489B2 (en) * 1998-12-01 2007-08-28 Nuance Communications, Inc. Detection of characteristics of human-machine interactions for dialog customization and analysis
US6691089B1 (en) * 1999-09-30 2004-02-10 Mindspeed Technologies Inc. User configurable levels of security for a speaker verification system
US20030191625A1 (en) * 1999-11-05 2003-10-09 Gorin Allen Louis Method and system for creating a named entity language model
US7286984B1 (en) 1999-11-05 2007-10-23 At&T Corp. Method and system for automatically detecting morphemes in a task classification system using lattices
US8392188B1 (en) 1999-11-05 2013-03-05 At&T Intellectual Property Ii, L.P. Method and system for building a phonotactic model for domain independent speech recognition
US6513003B1 (en) 2000-02-03 2003-01-28 Fair Disclosure Financial Network, Inc. System and method for integrated delivery of media and synchronized transcription
US6690772B1 (en) * 2000-02-07 2004-02-10 Verizon Services Corp. Voice dialing using speech models generated from text and/or speech
US6473734B1 (en) * 2000-03-27 2002-10-29 Motorola, Inc. Methodology for the use of verbal proxies for dynamic vocabulary additions in speech interfaces
US8290768B1 (en) 2000-06-21 2012-10-16 International Business Machines Corporation System and method for determining a set of attributes based on content of communications
US6408277B1 (en) 2000-06-21 2002-06-18 Banter Limited System and method for automatic task prioritization
US9699129B1 (en) 2000-06-21 2017-07-04 International Business Machines Corporation System and method for increasing email productivity
US6778640B1 (en) * 2000-08-09 2004-08-17 Bellsouth Intellectual Property Corporation Network and method for providing a user interface for a simultaneous ring telecommunications service with automatic speech recognition capability
US6907111B1 (en) 2000-08-09 2005-06-14 Bellsouth Intellectual Property Corporation Network and method for providing a name and number delivery telecommunications services with automatic speech recognition capability
US6873686B1 (en) * 2000-08-09 2005-03-29 Bellsouth Intellectual Property Corporation Network and method for providing a calling name telecommunications service with automatic speech recognition capability
US6826529B1 (en) 2000-08-09 2004-11-30 Bellsouth Intellectual Property Corporation Network and method for providing a call screening telecommunications service with automatic speech recognition capability
US6505163B1 (en) * 2000-08-09 2003-01-07 Bellsouth Intellectual Property Corporation Network and method for providing an automatic recall telecommunications service with automatic speech recognition capability
US8041023B1 (en) 2000-09-29 2011-10-18 Aspect Software, Inc. System and method of using a phone to access information in a call center
US7644057B2 (en) 2001-01-03 2010-01-05 International Business Machines Corporation System and method for electronic communication management
US7127397B2 (en) * 2001-05-31 2006-10-24 Qwest Communications International Inc. Method of training a computer system via human voice input
US20040002850A1 (en) * 2002-03-14 2004-01-01 Shaefer Leonard Arthur System and method for formulating reasonable spelling variations of a proper name
US7389230B1 (en) 2003-04-22 2008-06-17 International Business Machines Corporation System and method for classification of voice signals
US8495002B2 (en) * 2003-05-06 2013-07-23 International Business Machines Corporation Software tool for training and testing a knowledge base
US20050187913A1 (en) 2003-05-06 2005-08-25 Yoram Nelken Web-based customer service interface
US7073203B2 (en) * 2003-08-08 2006-07-11 Simms Fishing Products Corporation Foot-covering component of a stocking foot wader including gravel guard and method for manufacturing
US20050065789A1 (en) * 2003-09-23 2005-03-24 Sherif Yacoub System and method with automated speech recognition engines
US7440895B1 (en) 2003-12-01 2008-10-21 Lumenvox, Llc. System and method for tuning and testing in a speech recognition system
US20070005586A1 (en) * 2004-03-30 2007-01-04 Shaefer Leonard A Jr Parsing culturally diverse names
DE602004024172D1 (de) * 2004-05-21 2009-12-31 Harman Becker Automotive Sys Automatische Erzeugung einer Wortaussprache für die Spracherkennung
US7099445B2 (en) * 2004-06-22 2006-08-29 International Business Machines Corporation Name-alias based delivery of subscriber services
US8923838B1 (en) 2004-08-19 2014-12-30 Nuance Communications, Inc. System, method and computer program product for activating a cellular phone account
US7533018B2 (en) * 2004-10-19 2009-05-12 Motorola, Inc. Tailored speaker-independent voice recognition system
US7669614B2 (en) * 2006-08-21 2010-03-02 Dan Cohen Systems and methods for installation inspection in pipeline rehabilitation
EP1895748B1 (en) 2006-08-30 2008-08-13 Research In Motion Limited Method, software and device for uniquely identifying a desired contact in a contacts database based on a single utterance
US9386154B2 (en) 2007-12-21 2016-07-05 Nuance Communications, Inc. System, method and software program for enabling communications between customer service agents and users of communication devices
US8484034B2 (en) * 2008-03-31 2013-07-09 Avaya Inc. Arrangement for creating and using a phonetic-alphabet representation of a name of a party to a call
US8391464B1 (en) 2010-06-24 2013-03-05 Nuance Communications, Inc. Customer service system, method, and software program product for responding to queries using natural language understanding
US9118669B2 (en) 2010-09-30 2015-08-25 Alcatel Lucent Method and apparatus for voice signature authentication
CN102479508B (zh) * 2010-11-30 2015-02-11 国际商业机器公司 用于将文本转换成语音的方法和系统
US9058586B2 (en) 2011-07-29 2015-06-16 International Business Machines Corporation Identification of a person located proximite to a contact identified in an electronic communication client
JP5818271B2 (ja) * 2013-03-14 2015-11-18 Necフィールディング株式会社 情報処理装置、情報処理システム、情報処理方法及びプログラム

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
GB8809898D0 (en) * 1988-04-27 1988-06-02 British Telecomm Voice-operated service
US5127043A (en) * 1990-05-15 1992-06-30 Vcs Industries, Inc. Simultaneous speaker-independent voice recognition and verification over a telephone network
US5303299A (en) * 1990-05-15 1994-04-12 Vcs Industries, Inc. Method for continuous recognition of alphanumeric strings spoken over a telephone network
US5125022A (en) * 1990-05-15 1992-06-23 Vcs Industries, Inc. Method for recognizing alphanumeric strings spoken over a telephone network
US5165095A (en) * 1990-09-28 1992-11-17 Texas Instruments Incorporated Voice telephone dialing
US5212730A (en) * 1991-07-01 1993-05-18 Texas Instruments Incorporated Voice recognition of proper names using text-derived recognition models
CA2088080C (en) * 1992-04-02 1997-10-07 Enrico Luigi Bocchieri Automatic speech recognizer
US5297183A (en) * 1992-04-13 1994-03-22 Vcs Industries, Inc. Speech recognition system for electronic switches in a cellular telephone or personal communication network
US5479489A (en) * 1994-11-28 1995-12-26 At&T Corp. Voice telephone dialing architecture

Also Published As

Publication number Publication date
EP0735736B1 (en) 2004-11-24
DE69633883T2 (de) 2005-11-17
US5724481A (en) 1998-03-03
JPH08320696A (ja) 1996-12-03
JP3561076B2 (ja) 2004-09-02
EP0735736A2 (en) 1996-10-02
EP0735736A3 (en) 1998-10-07
DE69633883D1 (de) 2004-12-30

Similar Documents

Publication Publication Date Title
ES2233954T3 (es) Metodo para reconocimiento de voz automatico de palabras habladas arbitrarias.
CA2202663C (en) Voice-operated services
US9088652B2 (en) System and method for speech-enabled call routing
US6219407B1 (en) Apparatus and method for improved digit recognition and caller identification in telephone mail messaging
US8494848B2 (en) Methods and apparatus for generating, updating and distributing speech recognition models
US7873149B2 (en) Systems and methods for gathering information
EP0780829B1 (en) Method for automatic speech recognition in telephony
TW424221B (en) An automated hotel attendant using speech recognition
US7966176B2 (en) System and method for independently recognizing and selecting actions and objects in a speech recognition system
US20030101045A1 (en) Method and apparatus for playing recordings of spoken alphanumeric characters
US20090067590A1 (en) System and method of utilizing a hybrid semantic model for speech recognition
EP1099146A2 (en) Methods and systems for accessing information from an information source
US20060259294A1 (en) Voice recognition system and method
AU763704B2 (en) A transaction processing system with voice recognition and verification
US20020076009A1 (en) International dialing using spoken commands
JPH04167749A (ja) 音声応答装置
Lundin The Swedish Automatic reverse directory service
JPS6348599A (ja) 音声認識応答システム
JPH06208390A (ja) 音声認識装置および音声認識方法
WO2004055781A2 (en) Voice recognition system and method
JPH03174596A (ja) 音声応答装置
MXPA97005352A (es) Generacion automatica de vocabulario para la marcacion mediante la voz a base de red de telecomunicaciones
CA2438926A1 (en) Voice recognition system
JPH04200050A (ja) 電話音声応答装置