ES2330669T3 - Procedimiento y sistema de dialogo de voz. - Google Patents
Procedimiento y sistema de dialogo de voz. Download PDFInfo
- Publication number
- ES2330669T3 ES2330669T3 ES06739119T ES06739119T ES2330669T3 ES 2330669 T3 ES2330669 T3 ES 2330669T3 ES 06739119 T ES06739119 T ES 06739119T ES 06739119 T ES06739119 T ES 06739119T ES 2330669 T3 ES2330669 T3 ES 2330669T3
- Authority
- ES
- Spain
- Prior art keywords
- variable
- instantiated
- phrase
- acoustic
- voice
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L17/00—Speaker identification or verification techniques
- G10L17/26—Recognition of special voice characteristics, e.g. for use in lie detectors; Recognition of animal voices
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/02—Methods for producing synthetic speech; Speech synthesisers
- G10L13/033—Voice editing, e.g. manipulating the voice of the synthesiser
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
Landscapes
- Engineering & Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Computational Linguistics (AREA)
- Telephonic Communication Services (AREA)
- Machine Translation (AREA)
- Communication Control (AREA)
- Medicines Containing Material From Animals Or Micro-Organisms (AREA)
Abstract
Un método (100) para diálogo de voz, incluyendo: recibir (105) una frase vocal que incluye una frase de petición que incluye una variable instanciada; generar (115) características de entonación y sonoridad de la variable instanciada; realizar (125) reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y generar (140) una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.
Description
Procedimiento y sistema de diálogo de voz.
La presente invención pertenece al campo de los
sistemas de diálogo de voz, y más específicamente al campo de la
confirmación de frases pronunciadas por un usuario.
Los sistemas de diálogo corrientes utilizan a
menudo voz como modalidades de entrada y salida. Se utiliza una
función de reconocimiento de voz para convertir la entrada de voz a
texto y se usa una función de texto a voz (TTS) para presentar
texto como salida de voz. En muchos sistemas de diálogo, este TTS se
usa primariamente para proporcionar realimentación audio para
confirmar la entrada de voz. Por ejemplo, en dispositivos de
comunicación de mano, un usuario puede usar la entrada de voz para
marcación de nombres. Se mejora la fiabilidad cuando se usa TTS
para confirmar la entrada de voz. Sin embargo, el desarrollo de las
funciones de confirmación convencionales que usan TTS ocupa una
cantidad significativa de tiempo y recursos para cada idioma y
también consume cantidades significativas de recursos de memoria en
los dispositivos de comunicación de mano. Éste es un problema
principal para el despliegue mundial de dispositivos en múltiples
lenguas que usan tales sistemas de diálogo.
WO 97/43756 describe un sistema para conversión
de voz a voz donde se extrae información prosódica de voz de
entrada y se usa para obtener a partir de la voz información
dialectal y de entonación de la frase.
WO 2004/109658 describe un sistema automático de
respuesta vocal que tiene un servidor de aplicación y un servidor
de voz. El servidor de aplicación tiene archivos de voz primero y
segundo e información de voz. El servidor de voz incluye medios de
procesado de archivo de voz, medios de reconocimiento de voz que
realizan reconocimiento de voz en base a la gramática, y medios de
procesado de voz.
WO 99/57714 describe una interface de usuario de
voz en que se selecciona una sugerencia en base a varias situaciones
contextuales.
La presente invención se ilustra a modo de
ejemplo y no de limitación en las figuras acompañantes, en que
referencias análogas indican elementos similares, y donde:
La figura 1 es un diagrama de flujo que
representa un método de diálogo de voz según algunas realizaciones
de la presente invención.
La figura 2 es un diagrama de un análisis de una
frase vocal ejemplar según algunas realizaciones de la presente
invención.
La figura 3 es un diagrama de bloques de un
dispositivo electrónico que realiza diálogo de voz, según algunas
realizaciones de la presente invención.
Y la figura 4 es un diagrama de flujo que
representa un diálogo de voz
Los expertos en la técnica apreciarán que los
elementos de las figuras se ilustran a efectos de simplicidad y
claridad y no se representan necesariamente a escala. Por ejemplo,
las dimensiones de algunos elementos en las figuras pueden haberse
exagerado con relación a otros elementos para ayudar a mejorar la
comprensión de las realizaciones de la presente invención.
Antes de describir en detalle las realizaciones
particulares de los sistemas de diálogo de voz según la presente
invención, se deberá observar que las realizaciones de la presente
invención residen primariamente en combinaciones de pasos del
método y componentes del aparato relacionados con sistemas de
diálogo de voz. Consiguientemente, los componentes del aparato y
pasos del método se han representado donde sea apropiado con
símbolos convencionales en los dibujos, que representan solamente
los detalles específicos que son pertinentes para la comprensión de
la presente invención de modo que no se oscurezca la descripción con
detalles que serán fácilmente evidentes a los expertos en la
técnica que conozcan esta descripción.
También se entenderá que los términos y frases
aquí usados tienen el significado ordinario que se otorga a tales
términos y frases con respecto a sus respectivos ámbitos de consulta
y estudio correspondientes, excepto donde aquí se exponen
significados específicos.
\newpage
En este documento, términos relacionales como
primero y segundo, superior e inferior, y análogos, pueden ser
usados únicamente para distinguir una entidad o acción de otra
entidad o acción sin requerir o implicar necesariamente ninguna
relación real u orden entre tales entidades o acciones. Se ha
previsto que los términos "incluye", "incluyendo" o
cualquier otra variación de los mismos cubran una inclusión no
exclusiva, de tal manera que un proceso, método, artículo, o
aparato que incluya una lista de elementos, no incluya solamente los
elementos, sino que pueda incluir otros elementos no expresamente
enumerados o inherentes a tal proceso, método, artículo o aparato.
Un elemento precedido de "incluye... un" no excluye, sin más
limitaciones, la existencia de elementos idénticos adicionales en
el proceso, método, artículo o aparato que incluya el elemento.
Un "conjunto" en el sentido en que se usa
en este documento puede significar un conjunto vacío. El término
"otro", en el sentido en que se usa aquí, se define como al
menos un segundo o más. Los términos "incluyendo" y/o
"teniendo", en el sentido en que se usa aquí, se definen como
incluir. El término "acoplado", en el sentido en que se usa
aquí con referencia a tecnología electroóptica, se define como
conectado, aunque no necesariamente directamente, y no
necesariamente mecánicamente. El término "programa", en el
sentido en que se usa aquí, se define como una secuencia de
instrucciones diseñadas para ejecución en un sistema informático. Un
"programa", o "programa de ordenador", puede incluir una
subrutina, una función, un procedimiento, un método objeto, una
implementación objeto, una aplicación ejecutable, un applet, un
servlet, código fuente, código objeto, una librería
compartida/librería de carga dinámica y/u otra secuencia de
instrucciones diseñadas para ejecución en un sistema
informático.
Con referencia a las figuras 1, 2 y 3 se
representan un diagrama de flujo 100 (figura 1) de algunos pasos
usados en un método para diálogo de voz, un diagrama de un análisis
de una frase vocal, y un diagrama de bloques de un dispositivo
electrónico 300 (figura 3), según algunas realizaciones de la
presente invención. En el paso 105
(figura 1), una frase vocal pronunciada por un usuario durante un diálogo es recibida por un micrófono 305 (figura 3) del dispositivo electrónico 300 y convertida a una señal eléctrica digital muestreada 307 por el dispositivo electrónico 300 usando una técnica convencional. La frase vocal incluye una frase de petición que incluye una variable instanciada, y puede incluir además un segmento no variable. En un ejemplo usado en la figura 2, la frase vocal es "Marcar Tom MacTavish". En esta frase vocal, "Marcar" es una palabra que es un segmento no variable y "Tom MacTavish" es un nombre que es una variable instanciada (es decir, es un valor concreto de una variable). El segmento no variable en este ejemplo es una orden <Marcar>, y la variable en este ejemplo tiene un tipo variable que es <nombre marcado>. La frase vocal puede incluir alternativamente ningún segmento no variable o más de un segmento no variable, y puede incluir más de una variable instanciada. Por ejemplo, en respuesta al ejemplo de frase vocal recibido representado en la figura 2, el dispositivo electrónico puede sintetizar una respuesta "Por favor, repita el nombre", para lo que una frase vocal válida puede incluir solamente el nombre, y ningún segmento no variable. En otro ejemplo, la frase vocal puede ser "Enviar por correo electrónico la imagen a Jim Lamb". En este ejemplo, "Enviar por correo electrónico" es un segmento no variable, "imagen" es una variable instanciada de tipo <correo electrónico objeto>, y "Jim Lamb" es una variable instanciada del tipo <nombre marcado>. El dispositivo electrónico 300 guarda modelos matemáticos de conjuntos de valores de las variables y segmentos no variables de manera convencional, tal como en un modelo Markov ocultado (HMM). Puede haber más que un HMM, tal como uno para segmentos no variables y uno para cada uno de varios tipos de variables, o el HMM puede ser un modelo combinado para todos los tipos de variables y segmentos no variables. En el paso 110 (figura 1), una función de reconocimiento de voz 310 (figura 3) del dispositivo electrónico 300 procesa la señal electrónica digitalizada de la frase vocal a intervalos regulares 220 (figura 2), tal como 10 milisegundos, y genera características de entonación y sonoridad 315 y genera vectores acústicos de la frase vocal. Los vectores acústicos pueden ser coeficientes cepstrales de frecuencia Mel (MFCC) o pueden ser vectores de características de otro tipo convencional (o no convencional). Estos se pueden describir más generalmente como tipos de características acústicas. En el ejemplo ilustrado por la figura 2, los vectores acústicos se representan por una serie de recuadros 225 y las características de entonación y sonoridad se representan por una serie de recuadros 230. Usando un modelo almacenado de estados acústicos derivado de estados acústicos para un conjunto de valores (tal como Tom MacTavish, Tom Lynch, Steve Nowlan, Changxue Ma, ...) de al menos un tipo de variable (tal como <nombre marcado>), la función de reconocimiento de voz 310 selecciona un conjunto de estados acústicos del modelo almacenado que son muy probablemente representativos de los vectores acústicos recibidos para cada variable instanciada y segmento no variable (cuando existe un segmento no variable). En un ejemplo, el modelo almacenado es un modelo Markov ocultado (HMM) convencional, aunque se podría usar otros modelos. En el caso más general, los estados que representan los valores almacenados de las variables se definen de modo que puedan ser usados por el modelo matemático para hallar una adaptación próxima a un conjunto de características acústicas tomadas de un segmento del audio recibido a un conjunto de estados que representa un valor de una variable. Aunque el modelo HMM se utiliza ampliamente en sistemas convencionales de reconocimiento de voz para esta finalidad, se conocen otros modelos y se pueden desarrollar otros modelos; cualquiera de ellos puede ser usado ventajosamente en realizaciones de la presente invención. El conjunto seleccionado de estados acústicos para un segmento no variable identifica el valor 325 (figura 3) del segmento no variable, completando un reconocimiento de voz del segmento no variable en el paso 120. El conjunto de estados acústicos que más probablemente representa una variable instanciada se denomina el conjunto más probable de estados acústicos 320 (figura 3) para la variable instanciada, y la selección del conjunto más probable de estados acústicos completa los aspectos de reconocimiento de voz para la variable instanciada en el paso 125. En el ejemplo de la figura 2, el conjunto más probable de estados para la variable instanciada "Tom MacTavish" se representa como una serie de estados acústicos 235.
(figura 1), una frase vocal pronunciada por un usuario durante un diálogo es recibida por un micrófono 305 (figura 3) del dispositivo electrónico 300 y convertida a una señal eléctrica digital muestreada 307 por el dispositivo electrónico 300 usando una técnica convencional. La frase vocal incluye una frase de petición que incluye una variable instanciada, y puede incluir además un segmento no variable. En un ejemplo usado en la figura 2, la frase vocal es "Marcar Tom MacTavish". En esta frase vocal, "Marcar" es una palabra que es un segmento no variable y "Tom MacTavish" es un nombre que es una variable instanciada (es decir, es un valor concreto de una variable). El segmento no variable en este ejemplo es una orden <Marcar>, y la variable en este ejemplo tiene un tipo variable que es <nombre marcado>. La frase vocal puede incluir alternativamente ningún segmento no variable o más de un segmento no variable, y puede incluir más de una variable instanciada. Por ejemplo, en respuesta al ejemplo de frase vocal recibido representado en la figura 2, el dispositivo electrónico puede sintetizar una respuesta "Por favor, repita el nombre", para lo que una frase vocal válida puede incluir solamente el nombre, y ningún segmento no variable. En otro ejemplo, la frase vocal puede ser "Enviar por correo electrónico la imagen a Jim Lamb". En este ejemplo, "Enviar por correo electrónico" es un segmento no variable, "imagen" es una variable instanciada de tipo <correo electrónico objeto>, y "Jim Lamb" es una variable instanciada del tipo <nombre marcado>. El dispositivo electrónico 300 guarda modelos matemáticos de conjuntos de valores de las variables y segmentos no variables de manera convencional, tal como en un modelo Markov ocultado (HMM). Puede haber más que un HMM, tal como uno para segmentos no variables y uno para cada uno de varios tipos de variables, o el HMM puede ser un modelo combinado para todos los tipos de variables y segmentos no variables. En el paso 110 (figura 1), una función de reconocimiento de voz 310 (figura 3) del dispositivo electrónico 300 procesa la señal electrónica digitalizada de la frase vocal a intervalos regulares 220 (figura 2), tal como 10 milisegundos, y genera características de entonación y sonoridad 315 y genera vectores acústicos de la frase vocal. Los vectores acústicos pueden ser coeficientes cepstrales de frecuencia Mel (MFCC) o pueden ser vectores de características de otro tipo convencional (o no convencional). Estos se pueden describir más generalmente como tipos de características acústicas. En el ejemplo ilustrado por la figura 2, los vectores acústicos se representan por una serie de recuadros 225 y las características de entonación y sonoridad se representan por una serie de recuadros 230. Usando un modelo almacenado de estados acústicos derivado de estados acústicos para un conjunto de valores (tal como Tom MacTavish, Tom Lynch, Steve Nowlan, Changxue Ma, ...) de al menos un tipo de variable (tal como <nombre marcado>), la función de reconocimiento de voz 310 selecciona un conjunto de estados acústicos del modelo almacenado que son muy probablemente representativos de los vectores acústicos recibidos para cada variable instanciada y segmento no variable (cuando existe un segmento no variable). En un ejemplo, el modelo almacenado es un modelo Markov ocultado (HMM) convencional, aunque se podría usar otros modelos. En el caso más general, los estados que representan los valores almacenados de las variables se definen de modo que puedan ser usados por el modelo matemático para hallar una adaptación próxima a un conjunto de características acústicas tomadas de un segmento del audio recibido a un conjunto de estados que representa un valor de una variable. Aunque el modelo HMM se utiliza ampliamente en sistemas convencionales de reconocimiento de voz para esta finalidad, se conocen otros modelos y se pueden desarrollar otros modelos; cualquiera de ellos puede ser usado ventajosamente en realizaciones de la presente invención. El conjunto seleccionado de estados acústicos para un segmento no variable identifica el valor 325 (figura 3) del segmento no variable, completando un reconocimiento de voz del segmento no variable en el paso 120. El conjunto de estados acústicos que más probablemente representa una variable instanciada se denomina el conjunto más probable de estados acústicos 320 (figura 3) para la variable instanciada, y la selección del conjunto más probable de estados acústicos completa los aspectos de reconocimiento de voz para la variable instanciada en el paso 125. En el ejemplo de la figura 2, el conjunto más probable de estados para la variable instanciada "Tom MacTavish" se representa como una serie de estados acústicos 235.
Según algunas realizaciones, un determinador de
frase de respuesta 330 (figura 3) determina una frase de respuesta
usando el valor identificado 325 del segmento no variable (cuando
existe en la frase vocal) en unión con una historia de diálogo
generada por una función de historia de diálogo 327 (figura 3). En
el ejemplo representado en la figura 2, el valor no variable
<Marcar> ha sido determinado y puede ser usado sin una
historia de diálogo para determinar qué audio para una frase de
respuesta "Desea llamar" 240 a generar. En algunas
realizaciones, un conjunto de estados acústicos para cada valor de
frases de respuesta se guarda en el dispositivo electrónico 300, y
se usa con valores de entonación y sonoridad guardados para generar
una señal audio digital 331 de la frase de respuesta por técnicas
convencionales de síntesis de voz, que se representa en la figura 2
como un conjunto de vectores acústicos 245 y características
asociadas de entonación y sonoridad 250. En otras realizaciones,
muestras audio digitalizadas de las frases de respuesta se guardan y
usan directamente para generar la señal audio digital 331 de la
frase de respuesta. El dispositivo electrónico 300 incluye además
un generador de variable instanciada sintetizada 335 que genera una
señal audio digitalizada 336 de una variable instanciada
sintetizada del conjunto más probable de estados acústicos alineado
con las características de entonación y sonoridad de la frase audio
recibida, representadas en la figura 2 por vectores acústicos 255,
y las características de entonación y sonoridad 260. La duración de
las características de entonación y sonoridad se expande o contrae
durante la alineación para adaptarla a los vectores acústicos
generados a partir del conjunto más probable de estados acústicos.
Un combinador de flujo de datos 340 combina secuencialmente las
señales audio digitalizadas de la frase de respuesta y la variable
instanciada sintetizada en un orden apropiado. Durante el proceso
de combinación, las características de entonación y sonoridad de la
frase de respuesta pueden ser modificadas con respecto a las
almacenadas con el fin de mezclarlas bien con las usadas para la
variable instanciada sintetizada.
En el ejemplo ilustrado en la figura 2, cuando
el conjunto más probable seleccionado de estados acústicos es para
el valor del nombre llamado que es Tom MacTavish, la presentación de
la frase de respuesta y la variable instanciada sintetizada "Tom
MacTavish" 265 sería típicamente bastante comprensible para el
usuario en la mayoría de las circunstancias, permitiendo al usuario
afirmar la corrección de la selección. Por otra parte, cuando el
conjunto más probable seleccionado de estados acústicos es para un
valor del nombre llamado que es, por ejemplo, Tom Lynch, la
presentación de la frase de respuesta y la variable instanciada
sintetizada "Tom Lynch" 270 sería típicamente de equivocación
más difícil para el usuario que el deseado Tom MacTavish porque no
solamente se seleccionaría y usaría el valor erróneo, se presenta al
usuario en la mayoría de las circunstancias con características
erróneas de entonación y sonoridad, permitiendo al usuario negar más
fácilmente la selección. Esencialmente, usando la entonación y
sonoridad de la frase recibida, se exageran las diferencias entre
un valor de una variable que es correcta y un valor de la variable
que es fonéticamente cercana, pero incorrecta.
En algunas realizaciones, una función opcional
de determinación de calidad 345 (figura 3) del dispositivo
electrónico 300 determina una calidad métrica del conjunto más
probable de estados acústicos, y cuando la calidad métrica cumple
un criterio, la función de determinación de calidad 345 controla un
selector 350 para acoplar la señal audio digital salida del
combinador de flujo de datos a una función de altavoz que convierte
la señal audio digital a una señal analógica y la usa para activar
un altavoz. La determinación y el control realizados por la función
de determinación de calidad 345 (figura 3) se llevan a cabo como
paso opcional 130 (figura 1), en que se determina si una métrica
del conjunto más probable de vectores acústicos cumple un criterio.
El aspecto de generar la señal audio digital de frase de respuesta
331 (figura 3) por el determinador de frase de respuesta 330 se
realiza como el paso 135 (figura 1), en que se presenta una frase de
respuesta acústicamente almacenada. El aspecto de generar una señal
audio digitalizada 336 de una variable instanciada sintetizada
usando el conjunto más probable de estados acústicos y las
características de entonación y sonoridad de la variable
instanciada es realizado como el paso 140 (figura 1).
En las realizaciones en que la función opcional
de determinación de calidad 345 (figura 3) determina una calidad
métrica del conjunto más probable de estados acústicos, cuando la
calidad métrica no cumple el criterio, la función de determinación
de calidad 345 controla un selector opcional 350 para acoplar una
señal audio digitalizada de una función audio de respuesta fuera de
vocabulario (OOV) 360 a la función de altavoz 355 que presenta una
frase a un usuario en el paso 145 (figura 1) que es una observación
fuera de vocabulario. Por ejemplo, la observación fuera de
vocabulario puede ser "Por favor, repita su última frase". De
la misma manera que para las frases de respuesta, esta frase OOV
puede ser almacenada como muestras digitales o vectores acústicos
con características de entonación y sonoridad, o formas
similares.
En realizaciones que no usan una métrica para
determinar si presentar la frase OOV, la salida de la función del
combinador de flujo de datos 340 se acopla directamente a la función
de altavoz 355, y se eliminan los pasos 130 y 145 (figura 1).
La métrica que se usa en las realizaciones en
que se determina si presentar una frase OOV, puede ser una métrica
que representa una confianza de que se ha efectuado una selección
correcta del conjunto más probable de estados acústicos. Por
ejemplo, la métrica puede ser una métrica de una distancia entre el
conjunto de vectores acústicos que representan una variable
instanciada y el conjunto más probable seleccionado de estados
acústicos.
Con referencia a la figura 4, se representa un
diagrama de flujo de un método para diálogo de voz, según algunas
realizaciones de la presente invención. Los pasos
105-125 se han descrito anteriormente con referencia
a la figura 1. En el paso 410, las variables instanciadas que se
determina que corresponden correctamente a valores únicos para al
menos una variable, se guardan en una base de datos de atributos de
valor, estando asociado cada valor identificado con el conjunto de
estados acústicos más probable guardado y las características de
entonación y sonoridad de la variable instanciada a partir de la que
se identificó el valor. En el paso 415 se recibe una nueva frase
vocal que incluye una nueva frase de petición que incluye una nueva
variable instanciada. En el paso 420 se determina un valor
reconocido por reconocimiento de voz de la segunda variable
instanciada. Se determina al menos un conjunto muy probable de
estados acústicos y características de entonación y sonoridad a
partir de la asociación de la base de datos de atributos de valor
con el valor reconocido en el paso 425 que tiene una probabilidad
de eliminar la ambigüedad del valor reconocido. En el paso 430, se
genera una respuesta usando el conjunto más probable de estados
acústicos y las características de entonación y sonoridad asociadas
con el valor reconocido en la base de datos de atributos de valor.
Se apreciará que, con este método, los estados acústicos y la
entonación y sonoridad asociadas con una o más variables previamente
recibidas pueden ser usados en lugar de una variable instanciada
nuevamente recibida, con el fin de eliminar ventajosamente la
ambigüedad de la variable instanciada.
Las realizaciones de los métodos de diálogo de
voz 100, 400 y del dispositivo electrónico 300 descrito aquí pueden
ser usadas en una amplia variedad de aparatos electrónicos como,
aunque sin limitación, un teléfono celular, un dispositivo de
entretenimiento personal, un busca, un
convertidor-decodificador de televisión, una unidad
de control remoto de equipo electrónico, un ordenador portátil o de
sobremesa o mainframe, o un equipo electrónico de prueba. Las
realizaciones proporcionan la ventaja de menos tiempo de desarrollo
y requieren menos recursos de procesado que las técnicas de la
técnica anterior que implican reconocimiento de voz hasta la
determinación de una versión de texto de la variable instanciada más
probable y la síntesis de texto a voz para la variable instanciada
sintetizada. Estos beneficios son parcialmente el resultado de
evitar el desarrollo de los sistemas de software de texto a voz
para síntesis de las variables sintetizadas para diferentes idiomas
hablados para las realizaciones aquí descritas.
Se apreciará que las realizaciones de diálogo de
voz aquí descritas pueden estar compuestas de uno o más procesadores
convencionales e instrucciones de programa almacenadas únicas que
controlen el único o más procesadores para implementar, en unión
con algunos circuitos no de procesador, algunas, la mayoría o todas
las funciones de las realizaciones de diálogo de voz aquí
descritas. Los programas almacenados únicos se pueden transmitir en
medios tal como un disco floppy o una señal de datos que descarga un
archivo incluyendo las instrucciones de programación únicas. Los
circuitos no de procesador pueden incluir, aunque sin limitación, un
receptor radio, un transmisor radio, conductores de señal,
circuitos de reloj, circuitos de fuente de potencia, y dispositivos
de entrada de usuario. Como tal, estas funciones pueden ser
interpretadas como pasos de un método para acceder a un sistema de
comunicación. Alternativamente, algunas o todas las funciones
podrían ser implementadas por una máquina de estado que no tengan
instrucciones de programa almacenadas, en la que cada función o
algunas combinaciones de algunas funciones son implementadas como
lógica personalizada. Naturalmente, se podría usar una combinación
de ambos acercamiento. Así, los métodos y medios para estar
funciones se han descrito aquí.
En la memoria descriptiva anterior se han
descrito la invención y sus beneficios y ventajas con referencia a
realizaciones específicas. Sin embargo, los expertos en la técnica
apreciarán que se puede hacer varias modificaciones y cambios sin
apartarse del alcance de la presente invención expuesta en las
reivindicaciones siguientes. Consiguientemente, la memoria
descriptiva y las figuras se han de considerar en sentido
ilustrativo más bien que restrictivo, y se ha previsto que todas
las modificaciones queden incluidas dentro del alcance de la
presente invención. Algunos aspectos de las realizaciones se
describen anteriormente como convencionales, pero se apreciará que
tales aspectos también se puede obtener usando aparatos y/o técnicas
actualmente no conocidos. Los beneficios, las ventajas, las
soluciones a problemas, y cualquier elemento o elementos que puedan
hacer que se produzca algún beneficio, ventaja, o solución o que sea
más intenso, no se han de interpretar como características o
elementos críticos, requeridos o esenciales de alguna o todas las
reivindicaciones.
Claims (11)
1. Un método (100) para diálogo de voz,
incluyendo:
- recibir (105) una frase vocal que incluye una frase de petición que incluye una variable instanciada;
- generar (115) características de entonación y sonoridad de la variable instanciada;
- realizar (125) reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y
- generar (140) una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.
2. Un método (100) para diálogo de voz según la
reivindicación 1, donde la frase de petición incluye además un
segmento no variable que está asociado con la variable instanciada,
incluyendo además:
- realizar (120) reconocimiento de voz del segmento no variable; y
- presentar una frase de respuesta acústicamente almacenada.
3. El método (100) para diálogo de voz según la
reivindicación 1, donde la realización del reconocimiento de voz de
la variable instanciada incluye:
- determinar características acústicas de la variable instanciada; y
- usar un modelo matemático de valores de consulta almacenados y las características acústicas para determinar el conjunto más probable de estados acústicos.
4. El método (100) para diálogo de voz según la
reivindicación 3, donde el modelo matemático de valores de consulta
almacenados es un modelo Markov ocultado.
5. El método (100) para diálogo de voz según la
reivindicación 1, donde la generación del valor sintetizado de la
variable instanciada se realiza cuando una métrica del conjunto más
probable de estados acústicos cumple un criterio, e incluyendo
además:
- presentar una frase de respuesta fuera de vocabulario, acústicamente almacenada, cuando la métrica del conjunto más probable de estados acústicos no cumple el criterio.
6. Un dispositivo de almacenamiento que
incorpora código de software dispuesto para realizar el paso de
alguna de las reivindicaciones precedentes.
7. Un dispositivo electrónico para diálogo de
voz, incluyendo:
- medios (305) para recibir una frase vocal que incluye una frase de petición que incluye una variable instanciada;
- medios para generar características de entonación y sonoridad de la variable instanciada;
- medios (310) para realizar reconocimiento de voz de la variable instanciada para determinar un conjunto muy probable de estados acústicos; y
- medios (335) para generar una frase de respuesta que incluye un valor sintetizado de la variable instanciada, generándose dicho valor sintetizado a partir del conjunto más probable de estados acústicos que se alinean con las características de entonación y sonoridad de la variable instanciada.
8. El dispositivo electrónico para diálogo de
voz según la reivindicación 7, donde la frase de petición incluye
además un segmento no variable que está asociado con la variable
instanciada, incluyendo además:
- medios para realizar reconocimiento de voz del segmento no variable; y
- medios para presentar una frase de respuesta acústicamente almacenada.
9. El dispositivo electrónico para diálogo de
voz según la reivindicación 7, donde la realización del
reconocimiento de voz de la variable instanciada incluye:
- medios para determinar características acústicas de la variable instanciada; y
- medios para usar un modelo almacenado de estados acústicos y las características acústicas para determinar el conjunto más probable de estados acústicos.
10. El dispositivo electrónico para diálogo de
voz según la reivindicación 7, donde la generación del valor
sintetizado de la variable instanciada se lleva a cabo cuando una
métrica del conjunto más probable de estados acústicos cumple un
criterio, e incluyendo además:
- medios para presentar una frase de respuesta fuera de vocabulario, acústicamente almacenada, cuando la métrica del conjunto más probable de estados acústicos no cumple el criterio.
11. Un método (400) para diálogo de voz,
incluyendo:
- recibir (105) una o más frases vocales que incluyen una o más variables instanciadas;
- generar (115) características de entonación y sonoridad de la una o más variables instanciadas;
- realizar (125) reconocimiento de voz de las variables instanciadas para determinar un conjunto muy probable de estados acústicos para cada una de la una o más variables instanciadas;
- almacenar (410) conjuntos muy probables de estados acústicos y características de entonación y sonoridad de la una o más variables instanciadas que se determinan de manera que correspondan correctamente a un único valor de una variable en una base de datos de atributos de valor, almacenándose cada uno de los conjuntos muy probables de estados acústicos y características de entonación y sonoridad en asociación con el valor único al que corresponda;
- recibir (415) una nueva frase vocal que incluye una nueva frase de petición que incluye una nueva variable instanciada;
- determinar (420) un valor reconocido por reconocimiento de voz de la nueva variable instanciada;
- determinar (425) un conjunto muy probable de estados acústicos y características de entonación y sonoridad de la base de datos de atributos de valor que tiene una probabilidad de eliminar la ambigüedad del valor reconocido;
- generar (430) una respuesta usando el conjunto más probable de estados acústicos y las características de entonación y sonoridad asociadas con el valor reconocido en la base de datos de atributos de valor.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US118670 | 1987-11-09 | ||
| US11/118,670 US7181397B2 (en) | 2005-04-29 | 2005-04-29 | Speech dialog method and system |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2330669T3 true ES2330669T3 (es) | 2009-12-14 |
Family
ID=37235571
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES06739119T Expired - Lifetime ES2330669T3 (es) | 2005-04-29 | 2006-03-20 | Procedimiento y sistema de dialogo de voz. |
Country Status (7)
| Country | Link |
|---|---|
| US (1) | US7181397B2 (es) |
| EP (1) | EP1899955B1 (es) |
| CN (1) | CN101253547B (es) |
| AT (1) | ATE441918T1 (es) |
| DE (1) | DE602006008946D1 (es) |
| ES (1) | ES2330669T3 (es) |
| WO (1) | WO2006118683A1 (es) |
Families Citing this family (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20070055524A1 (en) * | 2005-09-08 | 2007-03-08 | Zhen-Hai Cao | Speech dialog method and device |
| US8688451B2 (en) * | 2006-05-11 | 2014-04-01 | General Motors Llc | Distinguishing out-of-vocabulary speech from in-vocabulary speech |
| CN103871410B (zh) * | 2012-12-11 | 2017-09-29 | 联想(北京)有限公司 | 一种数据处理方法和装置 |
| CN105247609B (zh) * | 2013-05-31 | 2019-04-12 | 雅马哈株式会社 | 利用言语合成对话语进行响应的方法及装置 |
| US9430186B2 (en) * | 2014-03-17 | 2016-08-30 | Google Inc | Visual indication of a recognized voice-initiated action |
| KR101594835B1 (ko) * | 2014-11-05 | 2016-02-17 | 현대자동차주식회사 | 음성인식 기능을 갖는 차량 및 헤드유닛과 이를 위한 음성 인식방법 |
Family Cites Families (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0619913B1 (en) * | 1991-12-31 | 2002-03-06 | Unisys PulsePoint Communications | Voice controlled messaging system and processing method |
| SE9601811L (sv) * | 1996-05-13 | 1997-11-03 | Telia Ab | Metod och system för tal-till-tal-omvandling med extrahering av prosodiinformation |
| KR980013124A (ko) * | 1996-07-31 | 1998-04-30 | 김광호 | 다수 사설교환시스템의 네트워킹화 방법 |
| US6144938A (en) * | 1998-05-01 | 2000-11-07 | Sun Microsystems, Inc. | Voice user interface with personality |
| US6463412B1 (en) * | 1999-12-16 | 2002-10-08 | International Business Machines Corporation | High performance voice transformation apparatus and method |
| US6934756B2 (en) * | 2000-11-01 | 2005-08-23 | International Business Machines Corporation | Conversational networking via transport, coding and control conversational protocols |
| WO2004109658A1 (ja) | 2003-06-02 | 2004-12-16 | International Business Machines Corporation | 音声応答システム、音声応答方法、音声サーバ、音声ファイル処理方法、プログラム及び記録媒体 |
| US7013005B2 (en) * | 2004-02-11 | 2006-03-14 | Hewlett-Packard Development Company, L.P. | System and method for prioritizing contacts |
-
2005
- 2005-04-29 US US11/118,670 patent/US7181397B2/en not_active Expired - Lifetime
-
2006
- 2006-03-20 AT AT06739119T patent/ATE441918T1/de active
- 2006-03-20 EP EP06739119A patent/EP1899955B1/en not_active Expired - Lifetime
- 2006-03-20 WO PCT/US2006/010206 patent/WO2006118683A1/en not_active Ceased
- 2006-03-20 DE DE602006008946T patent/DE602006008946D1/de not_active Expired - Lifetime
- 2006-03-20 ES ES06739119T patent/ES2330669T3/es not_active Expired - Lifetime
- 2006-03-20 CN CN2006800144001A patent/CN101253547B/zh not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| CN101253547B (zh) | 2011-07-06 |
| EP1899955A4 (en) | 2008-10-29 |
| US20060247921A1 (en) | 2006-11-02 |
| WO2006118683A1 (en) | 2006-11-09 |
| DE602006008946D1 (de) | 2009-10-15 |
| CN101253547A (zh) | 2008-08-27 |
| US7181397B2 (en) | 2007-02-20 |
| EP1899955B1 (en) | 2009-09-02 |
| ATE441918T1 (de) | 2009-09-15 |
| EP1899955A1 (en) | 2008-03-19 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR102496817B1 (ko) | 모델 트레이닝 방법, 음성 합성 방법, 장치, 기기 및 저장 매체 | |
| CN112309366B (zh) | 语音合成方法、装置、存储介质及电子设备 | |
| US11450313B2 (en) | Determining phonetic relationships | |
| CN112331176B (zh) | 语音合成方法、装置、存储介质及电子设备 | |
| US8290775B2 (en) | Pronunciation correction of text-to-speech systems between different spoken languages | |
| JP6434948B2 (ja) | 名前発音システム及び方法 | |
| CN114242035B (zh) | 语音合成方法、装置、介质以及电子设备 | |
| JP7557085B2 (ja) | 対話中のテキスト-音声の瞬時学習 | |
| CN111369971A (zh) | 语音合成方法、装置、存储介质和电子设备 | |
| WO2023160553A1 (zh) | 语音合成方法、装置、计算机可读介质及电子设备 | |
| CN115578995A (zh) | 面向语音对话场景的语音合成方法、系统及存储介质 | |
| CN112309367A (zh) | 语音合成方法、装置、存储介质及电子设备 | |
| US20160104477A1 (en) | Method for the interpretation of automatic speech recognition | |
| WO2008147649A1 (en) | Method for synthesizing speech | |
| JP5688761B2 (ja) | 音響モデル学習装置、および音響モデル学習方法 | |
| CN112133285B (zh) | 语音识别方法、装置、存储介质和电子设备 | |
| ES2330669T3 (es) | Procedimiento y sistema de dialogo de voz. | |
| US11176930B1 (en) | Storing audio commands for time-delayed execution | |
| US20070055524A1 (en) | Speech dialog method and device | |
| Freitas | Interface de Fala para Dispositivos Móveis | |
| Riccardi et al. | Spoken dialog systems: From theory to technology | |
| Salinas Vila | Adaptation of voice sever to automotive environment |