ES2330669T3 - Procedimiento y sistema de dialogo de voz. - Google Patents

Procedimiento y sistema de dialogo de voz. Download PDF

Info

Publication number
ES2330669T3
ES2330669T3 ES06739119T ES06739119T ES2330669T3 ES 2330669 T3 ES2330669 T3 ES 2330669T3 ES 06739119 T ES06739119 T ES 06739119T ES 06739119 T ES06739119 T ES 06739119T ES 2330669 T3 ES2330669 T3 ES 2330669T3
Authority
ES
Spain
Prior art keywords
variable
instantiated
phrase
acoustic
voice
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES06739119T
Other languages
English (en)
Inventor
Changxue C. Ma
Yan M. Cheng
Chen Liu
Ted Mazurkiewicz
Steven J. Nowlan
James R. Talley
Yuan-Jun Wei
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Motorola Solutions Inc
Original Assignee
Motorola Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Motorola Inc filed Critical Motorola Inc
Application granted granted Critical
Publication of ES2330669T3 publication Critical patent/ES2330669T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/26Recognition of special voice characteristics, e.g. for use in lie detectors; Recognition of animal voices
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/02Methods for producing synthetic speech; Speech synthesisers
    • G10L13/033Voice editing, e.g. manipulating the voice of the synthesiser
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computational Linguistics (AREA)
  • Telephonic Communication Services (AREA)
  • Machine Translation (AREA)
  • Communication Control (AREA)
  • Medicines Containing Material From Animals Or Micro-Organisms (AREA)

Abstract

Un método (100) para diálogo de voz, incluyendo: recibir (105) una frase vocal que incluye una frase de petición que incluye una variable instanciada; generar (115) características de entonación y sonoridad de la variable instanciada; realizar (125) reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y generar (140) una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.

Description

Procedimiento y sistema de diálogo de voz.
Campo de la invención
La presente invención pertenece al campo de los sistemas de diálogo de voz, y más específicamente al campo de la confirmación de frases pronunciadas por un usuario.
Antecedentes
Los sistemas de diálogo corrientes utilizan a menudo voz como modalidades de entrada y salida. Se utiliza una función de reconocimiento de voz para convertir la entrada de voz a texto y se usa una función de texto a voz (TTS) para presentar texto como salida de voz. En muchos sistemas de diálogo, este TTS se usa primariamente para proporcionar realimentación audio para confirmar la entrada de voz. Por ejemplo, en dispositivos de comunicación de mano, un usuario puede usar la entrada de voz para marcación de nombres. Se mejora la fiabilidad cuando se usa TTS para confirmar la entrada de voz. Sin embargo, el desarrollo de las funciones de confirmación convencionales que usan TTS ocupa una cantidad significativa de tiempo y recursos para cada idioma y también consume cantidades significativas de recursos de memoria en los dispositivos de comunicación de mano. Éste es un problema principal para el despliegue mundial de dispositivos en múltiples lenguas que usan tales sistemas de diálogo.
WO 97/43756 describe un sistema para conversión de voz a voz donde se extrae información prosódica de voz de entrada y se usa para obtener a partir de la voz información dialectal y de entonación de la frase.
WO 2004/109658 describe un sistema automático de respuesta vocal que tiene un servidor de aplicación y un servidor de voz. El servidor de aplicación tiene archivos de voz primero y segundo e información de voz. El servidor de voz incluye medios de procesado de archivo de voz, medios de reconocimiento de voz que realizan reconocimiento de voz en base a la gramática, y medios de procesado de voz.
WO 99/57714 describe una interface de usuario de voz en que se selecciona una sugerencia en base a varias situaciones contextuales.
Breve descripción de los dibujos
La presente invención se ilustra a modo de ejemplo y no de limitación en las figuras acompañantes, en que referencias análogas indican elementos similares, y donde:
La figura 1 es un diagrama de flujo que representa un método de diálogo de voz según algunas realizaciones de la presente invención.
La figura 2 es un diagrama de un análisis de una frase vocal ejemplar según algunas realizaciones de la presente invención.
La figura 3 es un diagrama de bloques de un dispositivo electrónico que realiza diálogo de voz, según algunas realizaciones de la presente invención.
Y la figura 4 es un diagrama de flujo que representa un diálogo de voz
Los expertos en la técnica apreciarán que los elementos de las figuras se ilustran a efectos de simplicidad y claridad y no se representan necesariamente a escala. Por ejemplo, las dimensiones de algunos elementos en las figuras pueden haberse exagerado con relación a otros elementos para ayudar a mejorar la comprensión de las realizaciones de la presente invención.
Descripción detallada de los dibujos
Antes de describir en detalle las realizaciones particulares de los sistemas de diálogo de voz según la presente invención, se deberá observar que las realizaciones de la presente invención residen primariamente en combinaciones de pasos del método y componentes del aparato relacionados con sistemas de diálogo de voz. Consiguientemente, los componentes del aparato y pasos del método se han representado donde sea apropiado con símbolos convencionales en los dibujos, que representan solamente los detalles específicos que son pertinentes para la comprensión de la presente invención de modo que no se oscurezca la descripción con detalles que serán fácilmente evidentes a los expertos en la técnica que conozcan esta descripción.
También se entenderá que los términos y frases aquí usados tienen el significado ordinario que se otorga a tales términos y frases con respecto a sus respectivos ámbitos de consulta y estudio correspondientes, excepto donde aquí se exponen significados específicos.
\newpage
En este documento, términos relacionales como primero y segundo, superior e inferior, y análogos, pueden ser usados únicamente para distinguir una entidad o acción de otra entidad o acción sin requerir o implicar necesariamente ninguna relación real u orden entre tales entidades o acciones. Se ha previsto que los términos "incluye", "incluyendo" o cualquier otra variación de los mismos cubran una inclusión no exclusiva, de tal manera que un proceso, método, artículo, o aparato que incluya una lista de elementos, no incluya solamente los elementos, sino que pueda incluir otros elementos no expresamente enumerados o inherentes a tal proceso, método, artículo o aparato. Un elemento precedido de "incluye... un" no excluye, sin más limitaciones, la existencia de elementos idénticos adicionales en el proceso, método, artículo o aparato que incluya el elemento.
Un "conjunto" en el sentido en que se usa en este documento puede significar un conjunto vacío. El término "otro", en el sentido en que se usa aquí, se define como al menos un segundo o más. Los términos "incluyendo" y/o "teniendo", en el sentido en que se usa aquí, se definen como incluir. El término "acoplado", en el sentido en que se usa aquí con referencia a tecnología electroóptica, se define como conectado, aunque no necesariamente directamente, y no necesariamente mecánicamente. El término "programa", en el sentido en que se usa aquí, se define como una secuencia de instrucciones diseñadas para ejecución en un sistema informático. Un "programa", o "programa de ordenador", puede incluir una subrutina, una función, un procedimiento, un método objeto, una implementación objeto, una aplicación ejecutable, un applet, un servlet, código fuente, código objeto, una librería compartida/librería de carga dinámica y/u otra secuencia de instrucciones diseñadas para ejecución en un sistema informático.
Con referencia a las figuras 1, 2 y 3 se representan un diagrama de flujo 100 (figura 1) de algunos pasos usados en un método para diálogo de voz, un diagrama de un análisis de una frase vocal, y un diagrama de bloques de un dispositivo electrónico 300 (figura 3), según algunas realizaciones de la presente invención. En el paso 105
(figura 1), una frase vocal pronunciada por un usuario durante un diálogo es recibida por un micrófono 305 (figura 3) del dispositivo electrónico 300 y convertida a una señal eléctrica digital muestreada 307 por el dispositivo electrónico 300 usando una técnica convencional. La frase vocal incluye una frase de petición que incluye una variable instanciada, y puede incluir además un segmento no variable. En un ejemplo usado en la figura 2, la frase vocal es "Marcar Tom MacTavish". En esta frase vocal, "Marcar" es una palabra que es un segmento no variable y "Tom MacTavish" es un nombre que es una variable instanciada (es decir, es un valor concreto de una variable). El segmento no variable en este ejemplo es una orden <Marcar>, y la variable en este ejemplo tiene un tipo variable que es <nombre marcado>. La frase vocal puede incluir alternativamente ningún segmento no variable o más de un segmento no variable, y puede incluir más de una variable instanciada. Por ejemplo, en respuesta al ejemplo de frase vocal recibido representado en la figura 2, el dispositivo electrónico puede sintetizar una respuesta "Por favor, repita el nombre", para lo que una frase vocal válida puede incluir solamente el nombre, y ningún segmento no variable. En otro ejemplo, la frase vocal puede ser "Enviar por correo electrónico la imagen a Jim Lamb". En este ejemplo, "Enviar por correo electrónico" es un segmento no variable, "imagen" es una variable instanciada de tipo <correo electrónico objeto>, y "Jim Lamb" es una variable instanciada del tipo <nombre marcado>. El dispositivo electrónico 300 guarda modelos matemáticos de conjuntos de valores de las variables y segmentos no variables de manera convencional, tal como en un modelo Markov ocultado (HMM). Puede haber más que un HMM, tal como uno para segmentos no variables y uno para cada uno de varios tipos de variables, o el HMM puede ser un modelo combinado para todos los tipos de variables y segmentos no variables. En el paso 110 (figura 1), una función de reconocimiento de voz 310 (figura 3) del dispositivo electrónico 300 procesa la señal electrónica digitalizada de la frase vocal a intervalos regulares 220 (figura 2), tal como 10 milisegundos, y genera características de entonación y sonoridad 315 y genera vectores acústicos de la frase vocal. Los vectores acústicos pueden ser coeficientes cepstrales de frecuencia Mel (MFCC) o pueden ser vectores de características de otro tipo convencional (o no convencional). Estos se pueden describir más generalmente como tipos de características acústicas. En el ejemplo ilustrado por la figura 2, los vectores acústicos se representan por una serie de recuadros 225 y las características de entonación y sonoridad se representan por una serie de recuadros 230. Usando un modelo almacenado de estados acústicos derivado de estados acústicos para un conjunto de valores (tal como Tom MacTavish, Tom Lynch, Steve Nowlan, Changxue Ma, ...) de al menos un tipo de variable (tal como <nombre marcado>), la función de reconocimiento de voz 310 selecciona un conjunto de estados acústicos del modelo almacenado que son muy probablemente representativos de los vectores acústicos recibidos para cada variable instanciada y segmento no variable (cuando existe un segmento no variable). En un ejemplo, el modelo almacenado es un modelo Markov ocultado (HMM) convencional, aunque se podría usar otros modelos. En el caso más general, los estados que representan los valores almacenados de las variables se definen de modo que puedan ser usados por el modelo matemático para hallar una adaptación próxima a un conjunto de características acústicas tomadas de un segmento del audio recibido a un conjunto de estados que representa un valor de una variable. Aunque el modelo HMM se utiliza ampliamente en sistemas convencionales de reconocimiento de voz para esta finalidad, se conocen otros modelos y se pueden desarrollar otros modelos; cualquiera de ellos puede ser usado ventajosamente en realizaciones de la presente invención. El conjunto seleccionado de estados acústicos para un segmento no variable identifica el valor 325 (figura 3) del segmento no variable, completando un reconocimiento de voz del segmento no variable en el paso 120. El conjunto de estados acústicos que más probablemente representa una variable instanciada se denomina el conjunto más probable de estados acústicos 320 (figura 3) para la variable instanciada, y la selección del conjunto más probable de estados acústicos completa los aspectos de reconocimiento de voz para la variable instanciada en el paso 125. En el ejemplo de la figura 2, el conjunto más probable de estados para la variable instanciada "Tom MacTavish" se representa como una serie de estados acústicos 235.
Según algunas realizaciones, un determinador de frase de respuesta 330 (figura 3) determina una frase de respuesta usando el valor identificado 325 del segmento no variable (cuando existe en la frase vocal) en unión con una historia de diálogo generada por una función de historia de diálogo 327 (figura 3). En el ejemplo representado en la figura 2, el valor no variable <Marcar> ha sido determinado y puede ser usado sin una historia de diálogo para determinar qué audio para una frase de respuesta "Desea llamar" 240 a generar. En algunas realizaciones, un conjunto de estados acústicos para cada valor de frases de respuesta se guarda en el dispositivo electrónico 300, y se usa con valores de entonación y sonoridad guardados para generar una señal audio digital 331 de la frase de respuesta por técnicas convencionales de síntesis de voz, que se representa en la figura 2 como un conjunto de vectores acústicos 245 y características asociadas de entonación y sonoridad 250. En otras realizaciones, muestras audio digitalizadas de las frases de respuesta se guardan y usan directamente para generar la señal audio digital 331 de la frase de respuesta. El dispositivo electrónico 300 incluye además un generador de variable instanciada sintetizada 335 que genera una señal audio digitalizada 336 de una variable instanciada sintetizada del conjunto más probable de estados acústicos alineado con las características de entonación y sonoridad de la frase audio recibida, representadas en la figura 2 por vectores acústicos 255, y las características de entonación y sonoridad 260. La duración de las características de entonación y sonoridad se expande o contrae durante la alineación para adaptarla a los vectores acústicos generados a partir del conjunto más probable de estados acústicos. Un combinador de flujo de datos 340 combina secuencialmente las señales audio digitalizadas de la frase de respuesta y la variable instanciada sintetizada en un orden apropiado. Durante el proceso de combinación, las características de entonación y sonoridad de la frase de respuesta pueden ser modificadas con respecto a las almacenadas con el fin de mezclarlas bien con las usadas para la variable instanciada sintetizada.
En el ejemplo ilustrado en la figura 2, cuando el conjunto más probable seleccionado de estados acústicos es para el valor del nombre llamado que es Tom MacTavish, la presentación de la frase de respuesta y la variable instanciada sintetizada "Tom MacTavish" 265 sería típicamente bastante comprensible para el usuario en la mayoría de las circunstancias, permitiendo al usuario afirmar la corrección de la selección. Por otra parte, cuando el conjunto más probable seleccionado de estados acústicos es para un valor del nombre llamado que es, por ejemplo, Tom Lynch, la presentación de la frase de respuesta y la variable instanciada sintetizada "Tom Lynch" 270 sería típicamente de equivocación más difícil para el usuario que el deseado Tom MacTavish porque no solamente se seleccionaría y usaría el valor erróneo, se presenta al usuario en la mayoría de las circunstancias con características erróneas de entonación y sonoridad, permitiendo al usuario negar más fácilmente la selección. Esencialmente, usando la entonación y sonoridad de la frase recibida, se exageran las diferencias entre un valor de una variable que es correcta y un valor de la variable que es fonéticamente cercana, pero incorrecta.
En algunas realizaciones, una función opcional de determinación de calidad 345 (figura 3) del dispositivo electrónico 300 determina una calidad métrica del conjunto más probable de estados acústicos, y cuando la calidad métrica cumple un criterio, la función de determinación de calidad 345 controla un selector 350 para acoplar la señal audio digital salida del combinador de flujo de datos a una función de altavoz que convierte la señal audio digital a una señal analógica y la usa para activar un altavoz. La determinación y el control realizados por la función de determinación de calidad 345 (figura 3) se llevan a cabo como paso opcional 130 (figura 1), en que se determina si una métrica del conjunto más probable de vectores acústicos cumple un criterio. El aspecto de generar la señal audio digital de frase de respuesta 331 (figura 3) por el determinador de frase de respuesta 330 se realiza como el paso 135 (figura 1), en que se presenta una frase de respuesta acústicamente almacenada. El aspecto de generar una señal audio digitalizada 336 de una variable instanciada sintetizada usando el conjunto más probable de estados acústicos y las características de entonación y sonoridad de la variable instanciada es realizado como el paso 140 (figura 1).
En las realizaciones en que la función opcional de determinación de calidad 345 (figura 3) determina una calidad métrica del conjunto más probable de estados acústicos, cuando la calidad métrica no cumple el criterio, la función de determinación de calidad 345 controla un selector opcional 350 para acoplar una señal audio digitalizada de una función audio de respuesta fuera de vocabulario (OOV) 360 a la función de altavoz 355 que presenta una frase a un usuario en el paso 145 (figura 1) que es una observación fuera de vocabulario. Por ejemplo, la observación fuera de vocabulario puede ser "Por favor, repita su última frase". De la misma manera que para las frases de respuesta, esta frase OOV puede ser almacenada como muestras digitales o vectores acústicos con características de entonación y sonoridad, o formas similares.
En realizaciones que no usan una métrica para determinar si presentar la frase OOV, la salida de la función del combinador de flujo de datos 340 se acopla directamente a la función de altavoz 355, y se eliminan los pasos 130 y 145 (figura 1).
La métrica que se usa en las realizaciones en que se determina si presentar una frase OOV, puede ser una métrica que representa una confianza de que se ha efectuado una selección correcta del conjunto más probable de estados acústicos. Por ejemplo, la métrica puede ser una métrica de una distancia entre el conjunto de vectores acústicos que representan una variable instanciada y el conjunto más probable seleccionado de estados acústicos.
Con referencia a la figura 4, se representa un diagrama de flujo de un método para diálogo de voz, según algunas realizaciones de la presente invención. Los pasos 105-125 se han descrito anteriormente con referencia a la figura 1. En el paso 410, las variables instanciadas que se determina que corresponden correctamente a valores únicos para al menos una variable, se guardan en una base de datos de atributos de valor, estando asociado cada valor identificado con el conjunto de estados acústicos más probable guardado y las características de entonación y sonoridad de la variable instanciada a partir de la que se identificó el valor. En el paso 415 se recibe una nueva frase vocal que incluye una nueva frase de petición que incluye una nueva variable instanciada. En el paso 420 se determina un valor reconocido por reconocimiento de voz de la segunda variable instanciada. Se determina al menos un conjunto muy probable de estados acústicos y características de entonación y sonoridad a partir de la asociación de la base de datos de atributos de valor con el valor reconocido en el paso 425 que tiene una probabilidad de eliminar la ambigüedad del valor reconocido. En el paso 430, se genera una respuesta usando el conjunto más probable de estados acústicos y las características de entonación y sonoridad asociadas con el valor reconocido en la base de datos de atributos de valor. Se apreciará que, con este método, los estados acústicos y la entonación y sonoridad asociadas con una o más variables previamente recibidas pueden ser usados en lugar de una variable instanciada nuevamente recibida, con el fin de eliminar ventajosamente la ambigüedad de la variable instanciada.
Las realizaciones de los métodos de diálogo de voz 100, 400 y del dispositivo electrónico 300 descrito aquí pueden ser usadas en una amplia variedad de aparatos electrónicos como, aunque sin limitación, un teléfono celular, un dispositivo de entretenimiento personal, un busca, un convertidor-decodificador de televisión, una unidad de control remoto de equipo electrónico, un ordenador portátil o de sobremesa o mainframe, o un equipo electrónico de prueba. Las realizaciones proporcionan la ventaja de menos tiempo de desarrollo y requieren menos recursos de procesado que las técnicas de la técnica anterior que implican reconocimiento de voz hasta la determinación de una versión de texto de la variable instanciada más probable y la síntesis de texto a voz para la variable instanciada sintetizada. Estos beneficios son parcialmente el resultado de evitar el desarrollo de los sistemas de software de texto a voz para síntesis de las variables sintetizadas para diferentes idiomas hablados para las realizaciones aquí descritas.
Se apreciará que las realizaciones de diálogo de voz aquí descritas pueden estar compuestas de uno o más procesadores convencionales e instrucciones de programa almacenadas únicas que controlen el único o más procesadores para implementar, en unión con algunos circuitos no de procesador, algunas, la mayoría o todas las funciones de las realizaciones de diálogo de voz aquí descritas. Los programas almacenados únicos se pueden transmitir en medios tal como un disco floppy o una señal de datos que descarga un archivo incluyendo las instrucciones de programación únicas. Los circuitos no de procesador pueden incluir, aunque sin limitación, un receptor radio, un transmisor radio, conductores de señal, circuitos de reloj, circuitos de fuente de potencia, y dispositivos de entrada de usuario. Como tal, estas funciones pueden ser interpretadas como pasos de un método para acceder a un sistema de comunicación. Alternativamente, algunas o todas las funciones podrían ser implementadas por una máquina de estado que no tengan instrucciones de programa almacenadas, en la que cada función o algunas combinaciones de algunas funciones son implementadas como lógica personalizada. Naturalmente, se podría usar una combinación de ambos acercamiento. Así, los métodos y medios para estar funciones se han descrito aquí.
En la memoria descriptiva anterior se han descrito la invención y sus beneficios y ventajas con referencia a realizaciones específicas. Sin embargo, los expertos en la técnica apreciarán que se puede hacer varias modificaciones y cambios sin apartarse del alcance de la presente invención expuesta en las reivindicaciones siguientes. Consiguientemente, la memoria descriptiva y las figuras se han de considerar en sentido ilustrativo más bien que restrictivo, y se ha previsto que todas las modificaciones queden incluidas dentro del alcance de la presente invención. Algunos aspectos de las realizaciones se describen anteriormente como convencionales, pero se apreciará que tales aspectos también se puede obtener usando aparatos y/o técnicas actualmente no conocidos. Los beneficios, las ventajas, las soluciones a problemas, y cualquier elemento o elementos que puedan hacer que se produzca algún beneficio, ventaja, o solución o que sea más intenso, no se han de interpretar como características o elementos críticos, requeridos o esenciales de alguna o todas las reivindicaciones.

Claims (11)

1. Un método (100) para diálogo de voz, incluyendo:
recibir (105) una frase vocal que incluye una frase de petición que incluye una variable instanciada;
generar (115) características de entonación y sonoridad de la variable instanciada;
realizar (125) reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y
generar (140) una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.
2. Un método (100) para diálogo de voz según la reivindicación 1, donde la frase de petición incluye además un segmento no variable que está asociado con la variable instanciada, incluyendo además:
realizar (120) reconocimiento de voz del segmento no variable; y
presentar una frase de respuesta acústicamente almacenada.
3. El método (100) para diálogo de voz según la reivindicación 1, donde la realización del reconocimiento de voz de la variable instanciada incluye:
determinar características acústicas de la variable instanciada; y
usar un modelo matemático de valores de consulta almacenados y las características acústicas para determinar el conjunto más probable de estados acústicos.
4. El método (100) para diálogo de voz según la reivindicación 3, donde el modelo matemático de valores de consulta almacenados es un modelo Markov ocultado.
5. El método (100) para diálogo de voz según la reivindicación 1, donde la generación del valor sintetizado de la variable instanciada se realiza cuando una métrica del conjunto más probable de estados acústicos cumple un criterio, e incluyendo además:
presentar una frase de respuesta fuera de vocabulario, acústicamente almacenada, cuando la métrica del conjunto más probable de estados acústicos no cumple el criterio.
6. Un dispositivo de almacenamiento que incorpora código de software dispuesto para realizar el paso de alguna de las reivindicaciones precedentes.
7. Un dispositivo electrónico para diálogo de voz, incluyendo:
medios (305) para recibir una frase vocal que incluye una frase de petición que incluye una variable instanciada;
medios para generar características de entonación y sonoridad de la variable instanciada;
medios (310) para realizar reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y
medios (335) para generar una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.
8. El dispositivo electrónico para diálogo de voz según la reivindicación 7, donde la frase de petición incluye además un segmento no variable que está asociado con la variable instanciada, incluyendo además:
medios para realizar reconocimiento de voz del segmento no variable; y
medios para presentar una frase de respuesta acústicamente almacenada.
9. El dispositivo electrónico para diálogo de voz según la reivindicación 7, donde la realización del reconocimiento de voz de la variable instanciada incluye:
medios para determinar características acústicas de la variable instanciada; y
medios para usar un modelo almacenado de estados acústicos y las características acústicas para determinar el conjunto más probable de estados acústicos.
10. El dispositivo electrónico para diálogo de voz según la reivindicación 7, donde la generación del valor sintetizado de la variable instanciada se lleva a cabo cuando una métrica del conjunto más probable de estados acústicos cumple un criterio, e incluyendo además:
medios para presentar una frase de respuesta fuera de vocabulario, acústicamente almacenada, cuando la métrica del conjunto más probable de estados acústicos no cumple el criterio.
11. Un método (400) para diálogo de voz, incluyendo:
recibir (105) una o más frases vocales que incluyen una o más variables instanciadas;
generar (115) características de entonación y sonoridad de la una o más variables instanciadas;
realizar (125) reconocimiento de voz de las variables instanciadas para determinar un conjunto muy probable de estados acústicos para cada una de la una o más variables instanciadas;
almacenar (410) conjuntos muy probables de estados acústicos y características de entonación y sonoridad de la una o más variables instanciadas que se determinan de manera que correspondan correctamente a un único valor de una variable en una base de datos de atributos de valor, almacenándose cada uno de los conjuntos muy probables de estados acústicos y características de entonación y sonoridad en asociación con el valor único al que corresponda;
recibir (415) una nueva frase vocal que incluye una nueva frase de petición que incluye una nueva variable instanciada;
determinar (420) un valor reconocido por reconocimiento de voz de la nueva variable instanciada;
determinar (425) un conjunto muy probable de estados acústicos y características de entonación y sonoridad de la base de datos de atributos de valor que tiene una probabilidad de eliminar la ambigüedad del valor reconocido;
generar (430) una respuesta usando el conjunto más probable de estados acústicos y las características de entonación y sonoridad asociadas con el valor reconocido en la base de datos de atributos de valor.
ES06739119T 2005-04-29 2006-03-20 Procedimiento y sistema de dialogo de voz. Expired - Lifetime ES2330669T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US118670 1987-11-09
US11/118,670 US7181397B2 (en) 2005-04-29 2005-04-29 Speech dialog method and system

Publications (1)

Publication Number Publication Date
ES2330669T3 true ES2330669T3 (es) 2009-12-14

Family

ID=37235571

Family Applications (1)

Application Number Title Priority Date Filing Date
ES06739119T Expired - Lifetime ES2330669T3 (es) 2005-04-29 2006-03-20 Procedimiento y sistema de dialogo de voz.

Country Status (7)

Country Link
US (1) US7181397B2 (es)
EP (1) EP1899955B1 (es)
CN (1) CN101253547B (es)
AT (1) ATE441918T1 (es)
DE (1) DE602006008946D1 (es)
ES (1) ES2330669T3 (es)
WO (1) WO2006118683A1 (es)

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20070055524A1 (en) * 2005-09-08 2007-03-08 Zhen-Hai Cao Speech dialog method and device
US8688451B2 (en) * 2006-05-11 2014-04-01 General Motors Llc Distinguishing out-of-vocabulary speech from in-vocabulary speech
CN103871410B (zh) * 2012-12-11 2017-09-29 联想(北京)有限公司 一种数据处理方法和装置
CN105247609B (zh) * 2013-05-31 2019-04-12 雅马哈株式会社 利用言语合成对话语进行响应的方法及装置
US9430186B2 (en) * 2014-03-17 2016-08-30 Google Inc Visual indication of a recognized voice-initiated action
KR101594835B1 (ko) * 2014-11-05 2016-02-17 현대자동차주식회사 음성인식 기능을 갖는 차량 및 헤드유닛과 이를 위한 음성 인식방법

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0619913B1 (en) * 1991-12-31 2002-03-06 Unisys PulsePoint Communications Voice controlled messaging system and processing method
SE9601811L (sv) * 1996-05-13 1997-11-03 Telia Ab Metod och system för tal-till-tal-omvandling med extrahering av prosodiinformation
KR980013124A (ko) * 1996-07-31 1998-04-30 김광호 다수 사설교환시스템의 네트워킹화 방법
US6144938A (en) * 1998-05-01 2000-11-07 Sun Microsystems, Inc. Voice user interface with personality
US6463412B1 (en) * 1999-12-16 2002-10-08 International Business Machines Corporation High performance voice transformation apparatus and method
US6934756B2 (en) * 2000-11-01 2005-08-23 International Business Machines Corporation Conversational networking via transport, coding and control conversational protocols
WO2004109658A1 (ja) 2003-06-02 2004-12-16 International Business Machines Corporation 音声応答システム、音声応答方法、音声サーバ、音声ファイル処理方法、プログラム及び記録媒体
US7013005B2 (en) * 2004-02-11 2006-03-14 Hewlett-Packard Development Company, L.P. System and method for prioritizing contacts

Also Published As

Publication number Publication date
CN101253547B (zh) 2011-07-06
EP1899955A4 (en) 2008-10-29
US20060247921A1 (en) 2006-11-02
WO2006118683A1 (en) 2006-11-09
DE602006008946D1 (de) 2009-10-15
CN101253547A (zh) 2008-08-27
US7181397B2 (en) 2007-02-20
EP1899955B1 (en) 2009-09-02
ATE441918T1 (de) 2009-09-15
EP1899955A1 (en) 2008-03-19

Similar Documents

Publication Publication Date Title
KR102496817B1 (ko) 모델 트레이닝 방법, 음성 합성 방법, 장치, 기기 및 저장 매체
CN112309366B (zh) 语音合成方法、装置、存储介质及电子设备
US11450313B2 (en) Determining phonetic relationships
CN112331176B (zh) 语音合成方法、装置、存储介质及电子设备
US8290775B2 (en) Pronunciation correction of text-to-speech systems between different spoken languages
JP6434948B2 (ja) 名前発音システム及び方法
CN114242035B (zh) 语音合成方法、装置、介质以及电子设备
JP7557085B2 (ja) 対話中のテキスト-音声の瞬時学習
CN111369971A (zh) 语音合成方法、装置、存储介质和电子设备
WO2023160553A1 (zh) 语音合成方法、装置、计算机可读介质及电子设备
CN115578995A (zh) 面向语音对话场景的语音合成方法、系统及存储介质
CN112309367A (zh) 语音合成方法、装置、存储介质及电子设备
US20160104477A1 (en) Method for the interpretation of automatic speech recognition
WO2008147649A1 (en) Method for synthesizing speech
JP5688761B2 (ja) 音響モデル学習装置、および音響モデル学習方法
CN112133285B (zh) 语音识别方法、装置、存储介质和电子设备
ES2330669T3 (es) Procedimiento y sistema de dialogo de voz.
US11176930B1 (en) Storing audio commands for time-delayed execution
US20070055524A1 (en) Speech dialog method and device
Freitas Interface de Fala para Dispositivos Móveis
Riccardi et al. Spoken dialog systems: From theory to technology
Salinas Vila Adaptation of voice sever to automotive environment