ES2291440T3 - Procedimiento, modulo, dispositivo y servidor para reconocimiento de voz. - Google Patents
Procedimiento, modulo, dispositivo y servidor para reconocimiento de voz. Download PDFInfo
- Publication number
- ES2291440T3 ES2291440T3 ES02703691T ES02703691T ES2291440T3 ES 2291440 T3 ES2291440 T3 ES 2291440T3 ES 02703691 T ES02703691 T ES 02703691T ES 02703691 T ES02703691 T ES 02703691T ES 2291440 T3 ES2291440 T3 ES 2291440T3
- Authority
- ES
- Spain
- Prior art keywords
- data
- expressions
- terminal
- recognized
- expression
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 title claims abstract description 42
- 230000014509 gene expression Effects 0.000 claims abstract description 136
- 238000012937 correction Methods 0.000 claims abstract description 50
- 230000005540 biological transmission Effects 0.000 claims abstract description 29
- 238000004458 analytical method Methods 0.000 claims abstract description 10
- 238000001514 detection method Methods 0.000 claims abstract description 4
- 230000015654 memory Effects 0.000 description 10
- 238000012545 processing Methods 0.000 description 9
- 241000282414 Homo sapiens Species 0.000 description 8
- 230000000875 corresponding effect Effects 0.000 description 8
- 238000010586 diagram Methods 0.000 description 6
- 230000008520 organization Effects 0.000 description 6
- 238000004422 calculation algorithm Methods 0.000 description 5
- 230000008901 benefit Effects 0.000 description 4
- 230000000295 complement effect Effects 0.000 description 4
- 230000001755 vocal effect Effects 0.000 description 4
- 238000004364 calculation method Methods 0.000 description 3
- 238000004891 communication Methods 0.000 description 3
- 230000003993 interaction Effects 0.000 description 3
- 238000012986 modification Methods 0.000 description 3
- 230000004048 modification Effects 0.000 description 3
- 238000007619 statistical method Methods 0.000 description 3
- 238000012360 testing method Methods 0.000 description 3
- 238000013519 translation Methods 0.000 description 3
- 239000013598 vector Substances 0.000 description 3
- 238000006243 chemical reaction Methods 0.000 description 2
- 230000001427 coherent effect Effects 0.000 description 2
- 238000011161 development Methods 0.000 description 2
- 230000006870 function Effects 0.000 description 2
- 206010011878 Deafness Diseases 0.000 description 1
- 241000282412 Homo Species 0.000 description 1
- 230000009471 action Effects 0.000 description 1
- 238000013459 approach Methods 0.000 description 1
- 238000004590 computer program Methods 0.000 description 1
- 238000010276 construction Methods 0.000 description 1
- 238000013500 data storage Methods 0.000 description 1
- 230000007547 defect Effects 0.000 description 1
- 238000012217 deletion Methods 0.000 description 1
- 230000037430 deletion Effects 0.000 description 1
- 238000010295 mobile communication Methods 0.000 description 1
- 230000008447 perception Effects 0.000 description 1
- 230000008569 process Effects 0.000 description 1
- 230000000717 retained effect Effects 0.000 description 1
- 238000006467 substitution reaction Methods 0.000 description 1
- 230000001629 suppression Effects 0.000 description 1
- 238000010998 test method Methods 0.000 description 1
- 238000011144 upstream manufacturing Methods 0.000 description 1
- 238000012795 verification Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/28—Constructional details of speech recognition systems
- G10L15/30—Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Artificial Intelligence (AREA)
- Machine Translation (AREA)
- Telephonic Communication Services (AREA)
Abstract
Procedimiento para reconocimiento de voz ejecutado al menos en un terminal (114), utilizando dicho procedimiento para reconocimiento de voz un modelo de lenguaje (311) caracterizado porque comprende las siguientes etapas: - detección (502) de al menos una expresión no reconocida en uno de dichos terminales; - grabación (503) en dicho terminal de datos representativos de dicha expresión no reconocida (309); - transmisión (603) de dichos datos grabados desde dicho terminal a un servidor remoto (116), a través de un primer canal de transmisión (121); - análisis (803), desde dicho servidor remoto, de dichos datos y la información generada (805) para corregir el modelo de lenguaje, teniendo en cuenta al menos una parte de dichas expresiones no reconocidas; y - transmisión (806) a través de un segundo canal de transmisión (115, 119, 120) de dicho servidor, al menos a un terminal (114, 117, 118), de dicha información de corrección, a fin de permitir reconocer en el futuro al menos algunas de dichas expresiones no reconocidas.
Description
Procedimiento, módulo, dispositivo y servidor
para reconocimiento de voz.
La presente invención se refiere al ámbito de
los interfaces de voz.
Más específicamente, la invención se refiere a
la utilización de modelos de lenguaje y/o de unidades fonéticas en
terminales que utilizan el reconocimiento de voz.
Los sistemas de información o de control
utilizan con cada vez mayor frecuencia un interfaz de voz para
agilizar y/o hacer más intuitiva la interacción con el usuario.
Debido a la creciente complejidad de estos sistemas, las exigencias
en lo tocante al reconocimiento de voz son cada vez mayores, tanto
en lo que se refiere a la amplitud del reconocimiento (un
vocabulario muy grande) como a la rapidez del reconocimiento (en
tiempo real).
En el estado actual de la técnica se conocen
procedimientos de reconocimiento de voz basados en la utilización
de modelos de lenguaje (probabilidad de que una palabra dada del
vocabulario de la aplicación siga a otra palabra o grupo de
palabras en el orden cronológico de la frase) y de unidades
fonéticas. Estas técnicas se describen especialmente en la obra de
Frederik Jelinek "Statistical Methods for Speech Recognition"
(o "métodos estadísticos de reconocimiento de voz") publicado
en la editorial MIT Press en 1997.
Estas técnicas se basan en unos modelos de
lenguaje y en unas unidades fonéticas que se generan a partir de
muestras de voz representativas (resultantes, por ejemplo, de una
población de usuarios de un terminal a los que se hacen pronunciar
los comandos).
En la práctica, los modelos de lenguaje deben
tener en cuenta el estilo de locución normalmente utilizado por un
usuario del sistema, y concretamente, de sus "defectos":
titubeos, falsos inicios, cambios de parecer,...
La calidad de un modelo de lenguaje utilizado
influye enormemente en la fiabilidad del reconocimiento de voz.
Esta calidad se mide normalmente mediante un índice denominado
perplejidad del modelo de lenguaje, y que representa
esquemáticamente el número de elecciones que debe efectuar el
sistema para cada palabra decodificada. Cuanto más baja sea dicha
perplejidad, mayor será la calidad.
El modelo de lenguaje es necesario para traducir
la señal de voz en una sucesión textual de palabras, una etapa que
a menudo es utilizada por los sistemas de diálogo. Por tanto, es
necesario construir una lógica de comprensión que permita
comprender la solicitud para responder a la misma.
- el denominado método estadístico
N-grama que normalmente utiliza un
bi-grama o tri-grama, y que consiste
en suponer que la probabilidad de que se de una palabra en la frase
depende exclusivamente de las N palabras que la preceden,
independientemente de su contexto dentro de la frase.
Si tomamos el ejemplo del
tri-grama para un vocabulario de 1000 palabras,
sería necesario definir 1000^{3} probabilidades para definir el
modelo de lenguaje, lo cual es imposible. Las palabras se agrupan
entonces en conjuntos que bien son definidos explícitamente por el
diseñador del modelo o bien son deducidos mediante métodos
auto-organizativos.
Este modelo de lenguaje se construye
automáticamente a partir de un corpus de texto.
Este tipo de modelo de lenguaje se utiliza
principalmente para los sistemas de dictado de voz, cuya
funcionalidad última es traducir la señal de voz en un texto, sin
que sea necesaria una fase de comprensión.
- El segundo método consiste en describir la
sintaxis por medio de una gramática probabilística, normalmente una
gramática no contextual definida en virtud de una serie de reglas
descritas en la llamada Notación de Backus Naur o notación BNF, o
una extensión de esta forma a las gramáticas contextuales. Las
reglas que describen gramáticas suelen estar manuscritas. Este tipo
de modelo de lenguaje es apropiado para las aplicaciones de comando
y control, en las que la etapa de reconocimiento está seguida por
una etapa para control de un aparato o de búsqueda de información
en una base de datos.
El modelo de lenguaje de una aplicación describe
el conjunto de las expresiones (por ejemplo, frases) que se va a
hacer que reconozca la aplicación. Un inconveniente de la técnica
anterior es que si el modelo de lenguaje es de mala calidad, el
sistema de reconocimiento, aunque tenga muy buenas prestaciones a
nivel de descodificación acústico-fonética, tendrá
unas mediocres prestaciones con determinadas expresiones.
Los modelos de lenguaje de tipo estocástico no
tienen, por decirlo adecuadamente, una definición clara de las
expresiones que se encuentran en el modelo de lenguaje, ni de
aquellas que se encuentran fuera de él. Simplemente, algunas
expresiones tienen una probabilidad de darse que a priori es
mayor que la de otras.
Los modelos de lenguaje basados en una gramática
probabilística proponen una clara diferencia entre expresiones
pertenecientes a los modelos de lenguaje y expresiones externas al
modelo de lenguaje. En estos modelos existen expresiones que no
podrán ser reconocidas jamás, independientemente de la calidad de
los modelos fonéticos utilizados. Normalmente, son expresiones que
no tienen ningún sentido o cuyo sentido escapa al ámbito de
aplicación del sistema desarrollado.
El documento
EP-A-945851 utiliza un sistema
cliente-servidor para adaptar el vocabulario
disponible y distribuirlo a todos los clientes cuando uno de los
clientes desea añadir una palabra al vocabulario.
Puede comprobarse que los modelos de lenguaje de
tipo probabilista y sus derivados son los más eficaces para las
aplicaciones de comando y control. Estas gramáticas suelen ser
manuscritas, y una de las principales dificultades del desarrollo
de los sistemas de diálogos es proponer un modelo de lenguaje de
buena calidad.
En particular, en lo que respecta a los modelos
basados en gramática, no es posible definir de forma exhaustiva un
lenguaje, sobre todo si este último es susceptible de ser utilizado
por una gran población (por ejemplo, el caso de un mando a
distancia para electrodomésticos). No es posible tener en cuenta
todas las expresiones y giros posibles (desde el estilo elevado al
argot) y/o errores gramaticales...
La invención se refiere a un procedimiento y un
sistema de reconocimiento de voz que permite modificar y mejorar a
distancia un modelo de lenguaje, a partir de la grabación de
expresiones no reconocidas por el sistema.
Más concretamente, la invención tiene por objeto
un procedimiento para reconocimiento de voz ejecutado al menos en
un terminal, utilizando dicho procedimiento para reconocimiento de
voz un modelo de lenguaje caracterizado porque comprende las
siguientes etapas:
- detección de al menos una expresión no
reconocida en uno de los terminales;
- grabación en el terminal de datos
representativos de la expresión no reconocida;
- transmisión de los datos grabados desde el
terminal a un servidor remoto, a través de un primer canal de
transmisión;
- análisis, desde el servidor remoto, de los
datos y la información generada para la corrección del modelo de
lenguaje, teniendo en cuenta al menos una parte de las expresiones
no reconocidas; y
- transmisión a través de un segundo canal de
transmisión del servidor, al menos a un terminal, de la información
de corrección, a fin de permitir reconocer en el futuro al menos
determinadas expresiones no reconocidas.
De este modo, la invención se basa en un enfoque
nuevo e inventivo del reconocimiento de voz, que permite actualizar
los diferentes elementos que permiten el reconocimiento de voz en
función de expresiones no reconocidas a nivel local, ya que el
servidor remoto dispone de importantes recursos (por ejemplo,
humanos y/o capacidades de cálculo) que generan las informaciones
de corrección.
Se observa que en este caso los modelos de
lenguaje comprenden:
- los modelos de lenguaje en sentido estricto
(este es el caso, por ejemplo, cuando los datos que constituyen el
objeto del reconocimiento son de tipo puramente textual);
- los modelos formados por uno o varios modelos
de lenguaje en el sentido estricto y por uno o varios conjuntos de
unidades fonéticas (lo que se corresponde, concretamente, con el
caso general de un reconocimiento de voz aplicado a muestras de
voz).
La invención va más allá de la mera
actualización de un vocabulario. Efectivamente, es posible que dicha
expresión no sea reconocida aunque todas las palabras de una
expresión figuren en el vocabulario utilizado por el modelo de
lenguaje del terminal. Únicamente la actualización del propio modelo
de lenguaje permite entonces reconocer esta expresión
posteriormente. La actualización del vocabulario, que es una de las
informaciones de las que se deriva el modelo de lenguaje, no es
suficiente.
En este caso, las expresiones deben tomarse en
un sentido amplio, y se refieren a cualquier expresión de voz que
permita la interacción entre un terminal y su usuario. Las
expresiones (en inglés, "utterance") incluyen, concretamente,
las frases, las locuciones, las palabras aisladas o no, palabras de
códigos específicos del terminal, instrucciones, comandos...
Las informaciones de corrección pueden incluir
concretamente informaciones que permitan modificar parcial o
totalmente el modelo de lenguaje y/o unidades fonéticas presentes en
cada terminal suprimiendo, remplazando o añadiendo elementos.
El servidor puede recibir de cada terminal unos
datos que le permitan mejorar el modelo de lenguaje y/o las
unidades fonéticas presentes en el terminal transmisor de datos,
pero también en el resto de los terminales, ya que cada uno de los
terminales se beneficia de la experiencia común adquirida por el
servidor a partir de todos los terminales.
\global\parskip0.930000\baselineskip
De este modo, la invención permite tener en
cuenta estilos de lenguaje o giros propios de determinados usuarios
(por ejemplo, la expresión "20 horas de la tarde" (un pleonasmo
difícilmente previsible a priori) en lugar de "las 20
horas" o "las 8 de la tarde") y que no habían sido previstos
durante la construcción del modelo de lenguaje ejecutado.
Por otra parte, la invención tiene en cuenta la
evolución de las lenguas vivas (nuevos giros o expresiones...).
Debe observarse que la invención se aplica
igualmente a los modelos de lenguaje de tipo estocástico y a los
modelos de lenguaje de tipo gramático probabilista. Cuando la
invención se aplica a los modelos de lenguaje de tipo estocástico,
los datos de corrección suelen ser muy numerosos para influir sobre
el reconocimiento, mientras que los datos de corrección para un
modelo basado en una gramática probabilista pueden ser poco
numerosos y tener una importante influencia sobre la eficacia y la
fiabilidad del reconocimiento.
De acuerdo con una característica específica, el
procedimiento se caracteriza porque los datos representativos de
las expresiones no reconocidas incluyen una grabación vocal
comprimida representativa de parámetros descriptivos de la señal
acústica.
De este modo, la invención permite tener en
cuenta ventajosamente los datos vocales emitidos en origen mediante
un análisis detallado a nivel del servidor, limitando el volumen de
los datos transmitidos al servidor remoto.
De acuerdo con una característica específica, el
procedimiento se caracteriza porque durante la etapa de transmisión
mediante el terminal, este transmite adicionalmente al servidor, al
menos, una de las informaciones que forman parte del grupo, y que
incluyen:
- informaciones de contexto de utilización del
procedimiento para reconocimiento de voz cuando no se reconoce una
expresión; e
- informaciones relativas al interlocutor que ha
pronunciado una expresión no reconocida.
De este modo, se facilita el reconocimiento de
voz de las expresiones no reconocidas por el terminal, que puede
efectuarse a distancia.
Asimismo, puede efectuarse en función del
contexto una verificación de la validez del contenido de las
expresiones no reconocidas. (por ejemplo, un comando "grabación
de la emisión" tiene sentido y por tanto es válido cuando el
terminal al que se dirige es un magnetoscopio, y no tiene sentido en
caso de un teléfono móvil).
De acuerdo con una característica específica, el
procedimiento se caracteriza porque ejecuta una encriptación y/o
codificación de los datos grabados y/o de las informaciones de
corrección.
De este modo, los datos se aseguran eficazmente
y permanecen confidenciales.
La invención se refiere también a un módulo para
reconocimiento de voz que utiliza un modelo de lenguaje, y que
incluye:
- un analizador adaptado para detectar
expresiones no reconocidas;
- un grabador de los datos representativos de al
menos una expresión no reconocida;
- un transmisor adaptado para transmitir los
datos grabados a un servidor remoto; y
- un receptor de informaciones de corrección que
permite corregir el modelo de lenguaje transmitido al módulo, y que
permite reconocer en el futuro, al menos, ciertas expresiones no
reconocidas por el módulo, habiendo sido transmitidas las
informaciones de corrección por el servidor remoto, tras analizar
los datos al nivel del servidor remoto, y tras generar
informaciones de corrección del modelo de lenguaje que tienen en
cuenta al menos una parte de las expresiones no reconocidas.
La invención también se refiere a un dispositivo
de reconocimiento de voz que utiliza un modelo de lenguaje,
caracterizado porque comprende:
- un analizador adaptado para detectar
expresiones no reconocidas;
- un grabador de los datos representativos de al
menos una expresión no reconocida;
- un transmisor adaptado para transmitir los
datos grabados a un servidor remoto; y
- un receptor de informaciones de corrección que
permite corregir el modelo de lenguaje transmitido al dispositivo,
y que permite reconocer en el futuro, al menos, ciertas expresiones
no reconocidas por el dispositivo, habiendo sido transmitidas las
informaciones de corrección por el servidor remoto, tras analizar
los datos al nivel del servidor remoto, y tras generar
informaciones de corrección del modelo de lenguaje que tienen en
cuenta al menos una parte de las expresiones no reconocidas.
La invención también se refiere a un servidor de
reconocimiento de voz, ejecutándose el reconocimiento en un
conjunto formado por, al menos, un terminal remoto, utilizando un
modelo de lenguaje, caracterizado porque comprende los medios
siguientes:
- un receptor de datos representativos de, al
menos, una expresión no reconocida por al menos un terminal que
forma parte del conjunto formado por, al menos, un terminal remoto y
que ha detectado la expresión no reconocida al realizar una
operación de reconocimiento de voz; y
- un transmisor adaptado para transmitir hacia
el conjunto formado, al menos, por un terminal remoto informaciones
de corrección obtenidas a partir de un análisis de los datos
recibidos a nivel del servidor, permitiendo las informaciones de
corrección corregir, para cada uno de los terminales del conjunto,
el modelo de lenguaje que permite reconocer en el futuro, al menos,
parte de las expresiones no reconocidas.
Las características específicas y las ventajas
del módulo, del dispositivo y del servidor de reconocimiento de
voz, dado que son similares a las del procedimiento para
reconocimiento de voz no se recuerdan en este documento.
Se apreciarán más claramente otras
características y ventajas de la invención mediante la lectura de la
siguiente descripción de un modo preferido de realización,
facilitado a título de mero ejemplo ilustrativo y no limitativo, y
las figuras adjuntas, en las cuales:
- la figura 1 presenta un diagrama general de un
sistema que incluye un mando de control por voz, en el que puede
ejecutarse la técnica de la invención;
- la figura 2 presenta un diagrama del sistema
de control por voz del sistema de la figura 1;
- la figura 3 describe un esquema electrónico de
un sistema de reconocimiento de voz que ejecuta el diagrama de la
figura 2;
La figura 4 presenta un diagrama del servidor
del sistema de la figura 1;
La figura 5 representa un organigrama del
procedimiento de prueba de expresión y grabación de datos relativos
a expresiones no reconocidas, como el ejecutado por el motor de
reconocimiento de la figura 2;
La figura 6 representa un organigrama del
procedimiento de transmisión de datos relativos a expresiones no
reconocidas, como el ejecutado por el módulo de rechazo de la figura
2;
La figura 7 representa un organigrama del
procedimiento de recepción de datos de corrección, como el ejecutado
por el módulo de carga de los módulos de lenguaje de la figura 2;
y
La figura 8 representa un organigrama del
procedimiento de recepción y de procesamiento de los datos de
corrección, como el ejecutado en el servidor remoto de la figura
4.
Por lo tanto, el principio general de la
invención se basa en un reconocimiento de voz ejecutado en los
terminales, utilizando el procedimiento para reconocimiento vocal
un modelo de lenguaje y/o un conjunto de unidades fonéticas que
pueden ser ejecutadas por un servidor remoto, cuando este último lo
considere necesario.
En términos generales, cada terminal puede
reconocer expresiones (por ejemplo, frases o comandos) formuladas
por un interlocutor y ejecutar la correspondiente acción.
No obstante, a menudo se observa que ciertas
expresiones, perfectamente comprensibles por un ser humano, no son
reconocidas por el dispositivo o el módulo que ejecutan el
reconocimiento de voz.
El fracaso del reconocimiento puede deberse a
múltiples razones:
- el vocabulario utilizando por el interlocutor
no forma parte del modelo de lenguaje;
- pronunciación particular (con acento, por
ejemplo);
- giros específicos de expresión no previstos
por el dispositivo o módulo para reconocimiento de voz;
- ...
Efectivamente, los modelos de lenguaje y los
conjuntos de unidades fonéticas se construyen frecuentemente a
partir de datos estadísticos que tengan en cuenta unas muestras de
expresiones habitualmente utilizadas por una población típica, no
siendo entonces tenidas en cuenta (o no pudiendo serlo) determinadas
palabras del vocabulario, pronunciaciones y/o giros de frases.
La invención se basa, ante todo, en la detección
de expresiones no reconocidas por el módulo o dispositivo de
reconocimiento de voz.
\global\parskip1.000000\baselineskip
Cuando una expresión no ha sido reconocida, el
terminal graba datos representativos de la señal correspondiente a
las expresiones no reconocidas (como por ejemplo una grabación
digital de voz correspondiente a la expresión) para su transmisión
a un servidor remoto.
Al nivel del servidor remoto que centraliza las
expresiones no reconocidas de un conjunto de terminales, un
operador humano puede entonces analizar las expresiones no
reconocidas.
Algunas de ellas podrán resultar incomprensibles
y/o no utilizables, por lo que serán descartadas.
En cambio, otras serán perfectamente
comprensibles por el operador, que podrá, si lo considera
conveniente, mediante la interacción hombre/máquina "traducir"
dichas expresiones hasta entonces no reconocidas por los
terminales, en un código que sea comprensible para el servidor.
El servidor podrá entonces tener en cuenta estas
expresiones con su traducción, para generar informaciones de
corrección del modelo de lenguaje y/o del conjunto de unidades
fonéticas.
Se observará que la corrección se entiende aquí
como:
- modificación del modelo; y/o
- complemento del modelo.
El servidor transmite entonces las informaciones
de corrección a cada uno de los terminales, que puede actualizar su
modelo de lenguaje y/o conjunto de unidades fonéticas, enriquecido
con numerosas expresiones no reconocidas por él o por otros
terminales.
De este modo, mejora el reconocimiento de voz de
cada uno de los terminales, beneficiándose de la experiencia común
a todos los terminales.
De acuerdo con un modo particular de la
invención, el análisis no se efectúa a través de un operador, sino
por el propio servidor, que puede disponer de recursos mucho más
importantes que un simple terminal.
De acuerdo con unos modos específicos de
realización, los terminales transmiten al servidor unos datos de
contexto (por ejemplo, la hora, la fecha, un comando transmitido
manualmente o a través de la voz tras el fracaso de un comando de
voz, la ubicación, el tipo de terminal,...) con los datos
representativos de la señal correspondiente a las señales no
reconocidas.
Esto puede facilitar el trabajo de análisis del
operador y/o del servidor.
Se presenta, en relación con la figura 1, un
diagrama general de un sistema que incluye un mando de comandos de
voz, en el que puede ejecutarse la técnica de la invención.
Este sistema incluye, especialmente:
- un servidor remoto 116 controlado por un
operador humano 122; y
- una pluralidad de sistemas de usuarios 114,
117 y 118.
El servidor remoto 116 está conectado a cada uno
de los sistemas de usuario 114, 117 y 118 a través de enlaces de
comunicaciones descendentes, respectivamente 115, 119 y 120.
Estos enlaces pueden ser permanentes o
temporales, y ser de cualquier tipo bien conocido por cualquier
experto en la materia. Concretamente, pueden ser del tipo de
difusión y estar basados en canales hertzianos, vía satélite o por
cable, utilizados por la televisión o de cualquier otro tipo, como
por ejemplo, una conexión de tipo Internet.
La figura 1 describe, concretamente, el sistema
de usuario 114, que está conectado a través de un enlace 121 de
comunicaciones ascendente con el servidor 116. Esta conexión puede
ser también de cualquier tipo conocido por los expertos en la
materia (concretamente, telefónico, por Internet,...).
El sistema de usuario 114 incluye:
- una fuente de voz 100, que puede estar
constituida por un micrófono, destinado a captar una señal de voz
generada por un interlocutor;
- un sistema de reconocimiento de voz 102;
- un sistema de control 105 destinado a
controlar un aparato 107;
- un aparato controlado 107, como por ejemplo,
un televisor, magnetoscopio o terminal de telecomunicaciones
móviles;
- una unidad de almacenamiento 109 de las
expresiones detectadas como no reconocidas;
- un interfaz 112 que permite las comunicaciones
de subida y bajada hacia el servidor 116.
La fuente 100 está conectada al sistema de
control de reconocimiento de voz 102, a través de una conexión 101
que le permite transmitir una onda fuente analógica representativa
de una señal de voz hacia el sistema de control 102.
El sistema de control 102 puede recuperar las
informaciones de contexto 104 (como por ejemplo, el tipo de aparato
107 que puede estar controlado por el sistema de control de comandos
105 o la lista de códigos de comandos) mediante una conexión 104 y
transmitir comandos al sistema de control de comandos 105 a través
de un enlace 103.
El sistema de control de comandos 105 transmite
comandos a través de una conexión 106, por ejemplo, de infrarrojos,
hacia el aparato 107, en función de las informaciones que reconoce
en función del modelo de lenguaje y de su diccionario.
El sistema de control de comandos 105 detecta
las expresiones que no reconoce, y en lugar de limitarse a
rechazarlas, emitiendo una señal de falta de reconocimiento,
efectúa una grabación de estas expresiones en la unidad de
almacenamiento 109 a través de una conexión 108.
La unidad de almacenamiento 109 de las
expresiones no reconocidas transmite los datos representativos hacia
el interfaz 112 a través de una conexión 111, que los transmite
hacia el servidor 116 a través de la conexión 121. Tras una
transmisión correcta, el interfaz 110 puede transmitir una señal 110
hacia la unidad de almacenamiento 109, que puede entonces borrar
los datos transmitidos.
El sistema de control de comandos 105 recibe,
por otra parte, los datos de corrección del interfaz 112 a través
de una conexión 113, que ha recibido el propio interfaz 112 del
servidor remoto a través de la conexión 115. Estos datos de
corrección son tenidos en cuenta por el sistema de control de
comandos 105 para la actualización de modelos de lenguajes y/o de
conjuntos de unidades fonéticas.
De acuerdo con el modo de realización
considerado como origen 100, el sistema de control de reconocimiento
de voz 102, el sistema de control de comandos 105, la unidad de
almacenamiento 109 y el interfaz 112 forman parte de un mismo
dispositivo, y de este modo, las conexiones 101, 103, 104, 108, 11,
110 y 113 son conexiones internas del dispositivo. La conexión 106
es típicamente una conexión inalámbrica.
De acuerdo con una primera variante de
realización de la invención descrita en la figura 1, los elementos
100, 102, 105, 109 y 112 están parcial o completamente separados y
no forman parte de un mismo dispositivo. En este caso, las
conexiones 101, 103, 104, 108, 111, 110 y 113 son conexiones
externas inalámbricas o no.
De acuerdo con una segunda variante, la fuente
100, los sistemas de control 102 y 105, la unidad de almacenamiento
109 y el interfaz 112, así como el aparato 107 forman parte de un
mismo dispositivo y están conectados entre sí mediante buses
internos (conexiones 101, 103, 104, 108, 111, 110, 113 y 106). Esta
variante resulta especialmente interesante cuando el dispositivo
es, por ejemplo, un teléfono móvil o un terminal de
telecomunicaciones portátil.
La figura 2 presenta un organigrama de un
sistema de control de comandos de voz como el sistema de control
102 mostrado en relación con la figura 2.
Se observa que el sistema de control 102 recibe
del exterior la onda fuente analógica 101 que es procesada por un
Decodificador Acústico-Fonético 200 o DAP
(denominado "front end" en inglés). El DAP 200 muestrea a
intervalos regulares (normalmente cada 10 ms) la onda fuente 101
para generar unos vectores reales o pertenecientes a unos libros de
código (o "code books" en inglés) que representan típicamente
resonancias bucales transmitidas a través de una conexión 201 hacia
un motor de reconocimiento 203. El DAP se basa, por ejemplo, en una
PLP (en inglés "Perceptual Linear Prediction [predicción lineal
de percepción]") descrita especialmente en el artículo
"Perceptual Linear Prediction (PLP) analysis of speech [predicción
lineal de percepción de análisis de voz]" descrito por Hynek
Hermansky y publicado en el "Journal of the Acoustical Society of
America" Vol. 97, nº 4, 1990, páginas
1738-1752.
1738-1752.
Con la ayuda de un diccionario 202, el motor de
reconocimiento 203 analiza los vectores reales recibidos utilizando
sobre todo modelos de Markov ocultos o HMM (en inglés "Hidden
Markov Models") y modelos de lenguaje (que representan la
probabilidad de que una palabra siga a otra palabra). Los motores de
reconocimiento se describen en detalle en el libro "Statistical
Methods for Speech Recognition", escrito por Frederick Jelinek y
publicado por ediciones MIT Press en 1997.
El modelo de lenguaje permite al motor de
reconocimiento 203 (que puede utilizar redes de Markov ocultas)
determinar qué palabras pueden seguir a una palabra dada en
cualquier expresión utilizable por el interlocutor en una
aplicación dada y ofrecer la probabilidad asociada. Las palabras en
cuestión pertenecen al vocabulario de la aplicación que puede ser,
independientemente del modelo de lenguaje, de pequeñas dimensiones
(normalmente de 10 a 300 palabras) o de grandes dimensiones (por
ejemplo con un tamaño superior a 300.000 palabras).
La solicitud de patente PCT/FR00/03329 de fecha
29 de noviembre de 1999 presentada en nombre de THOMSON MULTIMEDIA
y publicada con el número de publicación
WO-A-01/41125, describe un modelo de
lenguaje que incluye una pluralidad de bloques sintácticos. La
utilización de la invención que constituye el objeto de la presente
solicitud resulta especialmente ventajosa cuando se combina con
este tipo de modelo de lenguaje modular, pues los módulos
pueden actualizarse por separado, lo que evita la carga remota de archivos con unas dimensiones demasiado grandes.
pueden actualizarse por separado, lo que evita la carga remota de archivos con unas dimensiones demasiado grandes.
Los modelos de lenguaje se transmiten mediante
un módulo 207 de carga de modelo de lenguaje. El propio módulo 207
recibe modelos de lenguaje, actualizaciones o correcciones de modelo
de lenguaje y/o de unidades fonéticas transmitidas desde el
servidor a través de la conexión 113.
Cabe señalar que el diccionario 202 pertenece al
modelo de lenguaje que hace referencia a palabras del diccionario.
De este modo, el propio diccionario 202 puede ser actualizado y/o
corregido a través de un modelo de lenguaje cargado por el módulo
207.
Tras la ejecución de una operación de
reconocimiento basada en la utilización de un algoritmo de Viterbi,
el motor de reconocimiento 203 facilita al módulo de rechazo 211 una
lista ordenada de secuencias de palabras acordes con el modelo de
lenguaje, que presenta la mejor valoración para la expresión
pronunciada.
El módulo de rechazo 211 se ejecuta con
posterioridad al motor de reconocimiento 203 y opera de acuerdo con
uno o varios de los siguientes principios:
- A veces, por razones propias del algoritmo de
Viterbi, este no puede generar una lista coherente, ya que las
puntuaciones son tan reducidas que se sobrepasa el límite de las
precisiones aceptables para la máquina de cálculo aritmético. Por
tanto, no se dispone de una proposición completa coherente. De este
modo, cuando el módulo de rechazo 211 detecta una o varias
puntuaciones inferiores a un límite aceptable predeterminado, se
rechaza la expresión.
Cada elemento de la lista calculada mediante el
algoritmo de Viterbi se ha retenido debido a que la puntuación
asociada se encontraba entre las puntuaciones relativas más altas de
todas las expresiones posibles, de acuerdo con el modelo de
lenguaje. Por otra parte, la red de Markov asociada a cada una de
estas expresiones permite evaluar la probabilidad intrínseca de que
la red en cuestión genere la expresión asociada con la puntuación
constatada. El módulo de rechazo 211 analiza esta probabilidad y si
esta es inferior a un límite inferior predeterminado de
aceptabilidad de la probabilidad, se rechaza la expresión.
De acuerdo con otro método, para las mejores
proposiciones, obtenidas mediante el algoritmo de Viterbi, el
módulo de rechazo 211 lleva a cabo un procesamiento complementario
de las expresiones, utilizando unos criterios que no se habían
tenido en cuenta durante el desarrollo del algoritmo de Viterbi. Por
ejemplo, verifica que las partes de la señal que deben ser sordas
porque están asociadas a vocales, lo son efectivamente. Si las
expresiones propuestas no cumplen estas condiciones, son
rechazadas.
Cuando el módulo de rechazo 211 rechaza una
expresión, como se ha mostrado anteriormente, la expresión se
clasifica como no reconocida y se transmite una señal indicadora de
la expresión rechazada al motor de reconocimiento 203.
Paralelamente, el módulo de rechazo transmite una grabación de la
expresión no reconocida a la unidad de almacenamiento 109 a través
de la conexión 108.
El motor de reconocimiento 203 se encarga del
reconocimiento de las expresiones transmitidas por el DAP 200 en
forma de muestras fonéticas. De este modo, el motor de
reconocimiento 203 utiliza:
- las unidades fonéticas para construir la
representación fonética de una palabra en forma de un modelo de
Markov, pudiendo poseer cada palabra del diccionario 202 varias
"vocalizaciones" y simultáneamente,
- el modelo de lenguaje en el sentido estricto
para reconocer expresiones más o menos complejas.
El motor de reconocimiento 203 facilita
expresiones que han sido reconocidas (es decir, no rechazadas por
el módulo 211) y que este ha identificado a partir de los vectores
recibidos por un medio 205 de conversión de estas expresiones en
comandos que puedan ser comprendidos por el aparato 107. Este medio
205 utiliza un procedimiento de traducción mediante inteligencia
artificial que él mismo tiene en cuenta y un contexto 104
suministrado por el sistema de control 105 antes de transmitir uno o
varios comandos 103 al sistema de control 105.
La figura 3 muestra esquemáticamente un módulo o
dispositivo de reconocimiento de voz 102 como el mostrado en
relación con la figura 1 y que ejecuta el diagrama de la figura
2.
El sistema de control 102 incluye, conectados
entre sí mediante un bus de direcciones y de datos:
- un interfaz de voz 301;
- un convertidor
analógico-digital 302;
- un procesador 304;
- una memoria no volátil 305;
- una memoria RAM 306;
- un módulo de recepción 312;
- un módulo de transmisión 313; y
- un interfaz de entrada/salida 307.
Todos los elementos mostrados en la figura 3 son
bien conocidos por cualquier experto en la materia. Estos elementos
comunes no se describirán aquí.
Por otra parte se observa que la palabra
"registro" utilizada en toda la descripción designa en cada una
de las memorias mencionadas tanto un área de memoria de poca
capacidad (algunos datos binarios) como un área de memoria de gran
capacidad (que permite almacenar todo un programa o la totalidad de
una secuencia de datos de operaciones).
La memoria no volátil 305 (o ROM) conserva el
programa de operación del procesador 304 en un registro
"prog" 308.
La memoria RAM 306 conserva datos variables y
resultados intermedios de procesamiento en registros que por
comodidad poseen los mismos nombres que los datos que conservan y
que incluyen:
- un registro 309 en el que se conservan
grabaciones de expresiones no reconocidas, Exp_Non_Rec;
- un contador 310 de frases no reconocidas
Nb_Exp_Non_Rec; y
- un modelo de lenguaje en un registro 311,
Modèle_Langage.
Por otra parte se observa que los módulos de
recepción 312 y de transmisión 313 son módulos que permiten la
transmisión de datos respectivamente a partir de o hacia el servidor
remoto 116. Las técnicas de recepción y de transmisión por cable o
inalámbricas son bien conocidas por cualquier experto en
telecomunicaciones por lo que no serán detalladas.
La figura 4 presenta el servidor 116 del sistema
mostrado en relación con la figura 1.
Se observa que el servidor 116 está controlado
por un operador humano 122 mediante un interfaz
hombre-máquina 404 cualquiera (por ejemplo, del
tipo de teclado y pantalla).
El servidor 116 también incluye:
- un receptor 400;
- un analizador 401;
- un módulo 402 de construcción de corrección de
modelo de lenguaje y/o de un conjunto de unidades fonéticas; y
- un transmisor 403.
El receptor 400 es compatible con el transmisor
313 de un terminal y puede recibir de cada terminal datos
representativos (por ejemplo grabaciones) de expresiones no
reconocidas mediante la conexión 121 y eventualmente datos
complementarios (por ejemplo contextuales).
El analizador 401 recibe el conjunto de estos
datos del receptor 400 a través de una conexión 121 y lo transmite
al operador 122 a través de un interfaz que es, por ejemplo, un
terminal equipado con:
- una pantalla y un teclado que permiten
dialogar con el servidor 116 y controlarlo;
- altavoces o auriculares que permiten la
escucha de las grabaciones no reconocidas.
Este interfaz también permite al analizador 401
recibir una información del operador 122 que indique:
- que una expresión no reconocida y no incluida
en el modelo de lenguaje sigue siendo incomprensible, no tiene
sentido en el contexto de la aplicación al terminal y/o no se
refiere al terminal (por tanto no debe incluirse en el modelo de
lenguaje), no teniéndose entonces en cuenta esta expresión para la
corrección del modelo de lenguaje y siendo descartada por el
analizador 401;
- que una expresión no reconocida pertenece no
obstante al modelo de lenguaje en sentido estricto (se trata pues
de un problema de reconocimiento puro); en este caso, habrá que
modificar las unidades fonéticas y no el modelo de lenguaje en
sentido estricto; o
- una traducción, por ejemplo en forma de código
de comando, tras la identificación del contenido de una expresión
por el operador, no perteneciendo al modelo de lenguaje la expresión
no reconocida y teniendo sentido para el terminal al cual estaba
destinada; por tanto habrá de corregirse el modelo de lenguaje en
sentido estricto.
Es posible una combinación de la segunda y
tercera solución; en este caso será necesario modificar
simultáneamente las unidades fonéticas y el modelo de lenguaje en
sentido estricto.
Este modo de realización corresponde a un
procesamiento manual de las expresiones no reconocidas. Según este
modo de realización, el operador humano escucha la expresión no
reconocida y analiza las razones de su rechazo. El operador 122
determina si la expresión pertenece o no al modelo de lenguaje. En
el caso de que la expresión pertenezca al modelo de lenguaje, el
operador analiza la expresión para identificar el problema de
reconocimiento intrínseco (expresión que pertenece al modelo de
lenguaje y que debería haber sido reconocida y que no lo ha sido
por otras razones: ruido, acento del interlocutor...).
De acuerdo con una primera variante, el
procesamiento es automático y no se produce la intervención de un
operador humano. En este caso, el servidor 116, y concretamente el
analizador 401, poseen una potencia de cálculo relativamente
importante que puede ser mucho mayor que la de un terminal. Según
esta variante, el analizador 401 analiza cada expresión no
reconocida de forma más adecuada de lo que podría hacerlo un
terminal utilizando, por ejemplo, un modelo de lenguaje más rico
y/o unos modelos fonéticos más complejos. Al no estar sometido a
unas exigencias de cálculo en tiempo real tan estrictas como a las
que podría estarlo un terminal (que a menudo precisa un tiempo de
reacción rápido a un comando de voz), el analizador 401 también
puede, por ejemplo, permitir un reconocimiento que requiera un
tiempo de procesamiento más largo que en el caso de un
terminal.
De acuerdo con una segunda variante, el
procesamiento es semiautomático y la intervención de un operador
humano se limita a los casos que no puede resolver el
analizador.
La estructura general de un servidor 116 es,
según el modo preferido de realización descrito en este documento,
similar a la de un terminal como el descrito en relación con la
figura 3 e incluye, conectados entre sí mediante un bus de
direcciones y de datos:
- un procesador;
- una memoria RAM;
- una memoria no volátil;
- un módulo de transmisión adaptado;
- un módulo de recepción; y
- un interfaz
hombre-máquina.
De acuerdo con la figura 5 que representa un
organigrama de prueba de expresión y de grabación de datos relativos
a expresiones no reconocidas como el ejecutado por el motor de
reconocimiento 203 de la figura 2, durante una primera etapa de
inicialización 500 el microprocesador 304 comienza la ejecución del
programa 308 e inicializa las variables de la memoria RAM 306.
Posteriormente, durante una etapa 501 de espera
de expresiones, está a la espera y recibe una expresión transmitida
por un interlocutor.
Seguidamente, durante una prueba 502, tras haber
ejecutado una operación de reconocimiento de voz de la expresión
recibida, determina si la expresión ha sido reconocida o no de
acuerdo con uno o varios criterios mostrados con respecto a la
descripción del modelo de rechazo 211 de la figura 2.
En caso afirmativo, durante una fase 504 de
comando, el terminal 102 tiene en cuenta el resultado del
reconocimiento de voz aplicado a la expresión recibida y ejecuta la
acción apropiada como por ejemplo un comando.
En caso negativo, durante una fase 503 de
grabación de la expresión, la expresión no reconocida se comprime y
graba en la unidad de almacenamiento 109 a la espera de una
transmisión hacia el servidor remoto 116 como se muestra con
respecto a la figura 6.
Al final de una de las etapas 503 o 504, se
repite la etapa 501 de espera de expresiones.
La figura 6 representa un organigrama de
transmisión de datos relativos a expresiones no reconocidas como el
ejecutado por el módulo de rechazo de la figura 2. Durante una
primera etapa de inicialización 600, el microprocesador 304 inicia
la ejecución del programa 308 e inicializa las variables de la
memoria RAM 306.
Posteriormente, durante una etapa 601 de espera
de expresiones no reconocidas por el módulo para reconocimiento de
voz 102, el microprocesador 304 espera y posteriormente recibe
grabaciones de las expresiones no reconocidas.
Más tarde, durante una etapa 602, el terminal
114 se conecta al servidor remoto 116 de acuerdo con unos métodos
bien conocidos por cualquier experto en telecomunicaciones.
Seguidamente, durante una etapa 603, las
grabaciones de expresiones no reconocidas se formatean y transmiten
al servidor remoto 116.
A continuación, durante una etapa 604 de
desconexión, el termina se desconecta del servidor remoto 116 y se
transmite un señal entre el interfaz 112 con el servidor remoto y la
unidad 109 de almacenamiento de los datos correspondientes a las
expresiones no reconocidas, indicando la transmisión de las
grabaciones de expresiones. Los datos correspondientes a estas
expresiones son entonces borrados de la unidad de almacenamiento
109.
Finalmente, se repite la etapa 601.
La figura 7 representa un organigrama de
recepción de los datos de corrección, como el ejecutado por el
módulo 207 de carga de los modelos de lenguaje de la figura 2.
Tras una primera etapa 700 de inicialización, y
durante una fase etapa, el terminal se pone a la espera de los
datos de corrección transmitidos por un servidor 116 a una
pluralidad de terminales.
Seguidamente, en una etapa 702, el terminal
tiene en cuenta los datos de corrección para actualizar el modelo
de lenguaje y/o su conjunto de unidades fonéticas utilizadas por el
modulo de reconocimiento de voz. En función de la naturaleza de los
datos de corrección, estos datos pueden:
- sustituir los datos existentes en el modelo de
lenguaje y/o su conjunto de unidades fonéticas;
- modificar los datos existentes;
- completar los datos existentes, y/o
- provocar la supresión de los datos
existentes.
Tras la ejecución de la etapa 702, se repite la
etapa 703.
La figura 8 representa un organigrama de
recepción y procesamiento de los datos de corrección, como el
ejecutado en el servidor remoto de la figura 4.
Tras una primera etapa 800 de inicialización de
los parámetros y de ejecución de un programa de gestión del
servidor, el servidor 116 se pone a la espera de una petición de
conexión procedente de un terminal (que ejecuta una etapa 602
mostrada en la figura 6) y establece una conexión con el terminal de
acuerdo con unos métodos bien conocidos por cualquier experto en
telecomunicaciones.
Posteriormente, durante una etapa 802, el
servidor 116 recibe los datos procedentes del terminal conectado
que ejecuta la etapa 603 descrita anteriormente. Estos datos
contienen principalmente grabaciones de una o varias expresiones
rechazadas por el terminal al no haber sido reconocidas por un
módulo para reconocimiento de voz ejecutado en el terminal. Cuando
se reciben todos los datos, se interrumpe la conexión entre el
terminal y el servidor 116.
Seguidamente, durante una etapa 803 de
procesamiento de los datos recibidos, al nivel del servidor 116,
cada una de las grabaciones de expresiones recibidas se procesa
bien manualmente a través del operador 122 o bien automática o
semi-automáticamente mediante diferentes variantes
mostradas en relación con la figura 4.
Posteriormente, durante una prueba 804, el
servidor 116 determina si una o varias de las expresiones recibidas
han podido comprenderse y son pertinentes para el terminal que ha
transmitido esta expresión o expresiones. En este caso será
necesario actualizar los modelos de lenguajes y/o de unidades
fonéticas.
En caso contrario, se repetirá la etapa de
espera 801.
En caso afirmativo, el servidor 116 construye
una corrección del modelo de lenguaje que puede adoptar varias
formas que permitan una etapa 607 (mostrada anteriormente) en los
terminales tras la recepción de los datos de corrección. Estos
datos de corrección incluyen:
- un indicador que precise la naturaleza de la
corrección (a saber, sustitución, modificación, complemento o
supresión); y
- los datos de las propias correcciones en
función del indicador.
Se observa que si el modelo de lenguaje incluye
una pluralidad de bloques sintácticos (como es el caso de los
modelos de lenguaje descritos en la solicitud internacional
WO-A-01/41125 mencionada
anteriormente), cada módulo podrá corregirse por separado. En este
caso, los datos de corrección también incluyen un indicador del
módulo o módulos que deben corregirse).
Después, durante una etapa 806, el servidor 116
transmite los datos de corrección hacia un terminal, o
preferiblemente un conjunto de terminales que pueden actualizar su
modelo de lenguaje y/o conjunto de unidades fonéticas de acuerdo
con una etapa 607.
A continuación se repite la etapa 801.
Por ello el proceso es iterativo y puede
repetirse varias veces. También permite que la aplicación evolucione
al añadir nuevas solicitudes.
Es evidente que la invención no se limita a los
ejemplos de realización mencionados anteriormente.
Concretamente, cualquier experto en la materia
podrá introducir cualquier variante en la definición de los
terminales que ejecutan la invención, dado que la invención se
refiere a cualquier tipo de dispositivo y/o módulo que utilice o
pueda utilizar un procedimiento para reconocimiento de voz (por
ejemplo ser del tipo terminal multimedia, televisor, magnetoscopio,
decodificador digital multimedia (en inglés "set top box"),
equipo de audio o vídeo, terminal fijo o móvil...).
Igualmente, la invención se refiere a cualquier
tipo de servidor remoto (por ejemplo, servidores de Internet,
equipos conectados a transmisores de programas de televisión,
equipos conectados a redes de comunicaciones móviles, equipos de
proveedores de servicios...).
Además, de acuerdo con la invención, el canal de
transmisión de los datos correspondientes a las frases no
reconocidas y el canal de transmisión de los datos de corrección de
los modelos de lenguajes y/o unidades fonéticas puede ser de
cualquier tipo e incluyen:
- las vías de transmisiones por ondas
hertzianas;
- las vías de transmisión por satélite;
- los canales de redes de transmisión de
televisión;
- los canales de redes de tipo Internet;
- los canales de redes telefónicas;
- los canales de redes móviles; y
- los soportes de medios removibles.
Asimismo, cabe señalar que la invención no se
refiere solamente a las frases no reconocidas sino a cualquier tipo
de expresión de voz, como por ejemplo una o varias frases, una
palabra aislada o no, una locución y un código de voz que permita
el diálogo entre una máquina y su usuario. Estas expresiones
verbales pueden estar asociadas no solamente a comandos sino a
cualquier tipo de datos que puedan constituir el objeto de un
diálogo entre una máquina y su usuario, como por ejemplo datos de
informaciones que el usuario puede transmitir a la máquina, de
configuración, de programación...
También debe señalarse que el método de
actualización de los modelos de lenguaje descrito en la patente se
aplica no sólo a los procedimientos de reconocimiento de voz en
sentido estricto sino que también se aplica a procedimientos de
reconocimiento de textos introducidos que soporten faltas de
ortografía y/o mecanografía, basados también en procedimientos
Markovianos o modelos de lenguaje en sentido estricto como los
descritos en la patente.
Se observará que la invención no se limita a una
ejecución puramente física, sino que también puede ejecutarse en
forma de una secuencia de instrucciones de un programa informático o
en cualquier forma que combine una parte física y una parte lógica.
En el caso de que la invención se ejecute total o parcialmente en
forma de software, la correspondiente secuencia de instrucciones
podrá almacenarse en un medio de almacenamiento removible (como por
ejemplo un disquete, un CD-ROM o un
DVD-ROM) o no, pudiendo dicho medio de
almacenamiento ser leído total o parcialmente por un ordenador o un
microprocesador. La invención está limitada exclusivamente por el
texto de las reivindicaciones adjuntas.
\vskip1.000000\baselineskip
La lista de referencias citada por el
solicitante lo es solamente para utilidad del lector, no formando
parte de los documentos de patente europeos. Aún cuando las
referencias han sido cuidadosamente recopiladas, no pueden
excluirse errores u omisiones y la OEP rechaza toda responsabilidad
a este respecto.
- \bullet EP 945851 A [0016]
- \bullet WO 0141125 A [0077] [0126]
\bullet FR 0003329 W, THOMSON MULTIMEDIA
[0077]
\bullet FREDERIK JELINEK. Statistical
methods for speech recognition. MIT Press, 1997 [0004]
\bullet FREDERICK JELINEK. Statistical
Methods for Speech Recognition. MIT Press, 1997 [0075]
\bullet HYNEK HERMANSKY. Perceptual
Linear Prediction (PLP) analysis of speech. Journal of the
Acoustical Society of America, 1990, vol. 97 (4),
1738-1752 [0074]
Claims (7)
1. Procedimiento para reconocimiento de voz
ejecutado al menos en un terminal (114), utilizando dicho
procedimiento para reconocimiento de voz un modelo de lenguaje
(311) caracterizado porque comprende las siguientes
etapas:
- detección (502) de al menos una expresión no
reconocida en uno de dichos terminales;
- grabación (503) en dicho terminal de datos
representativos de dicha expresión no reconocida (309);
- transmisión (603) de dichos datos grabados
desde dicho terminal a un servidor remoto (116), a través de un
primer canal de transmisión (121);
- análisis (803), desde dicho servidor remoto,
de dichos datos y la información generada (805) para corregir el
modelo de lenguaje, teniendo en cuenta al menos una parte de dichas
expresiones no reconocidas; y
- transmisión (806) a través de un segundo canal
de transmisión (115, 119, 120) de dicho servidor, al menos a un
terminal (114, 117, 118), de dicha información de corrección, a fin
de permitir reconocer en el futuro al menos algunas de dichas
expresiones no reconocidas.
2. Procedimiento de acuerdo con la
reivindicación 1, caracterizado porque dichos datos
representativos de dichas expresiones no reconocidas (309) incluyen
una grabación de voz comprimida que representa parámetros
descriptivos de la señal acústica.
3. Procedimiento de acuerdo con cualquiera de
las reivindicaciones 1 y 2, caracterizado porque durante
dicha fase de transmisión a través de dicho terminal, este
transmite también a dicho servidor al menos una de las
informaciones que forman parte de un grupo que comprende:
- informaciones de contexto de utilización de
dicho procedimiento para reconocimiento de voz cuando no se ha
reconocido una expresión; e
- informaciones relativas al interlocutor que ha
pronunciado una expresión no reconocida.
4. Procedimiento de acuerdo con cualquiera de
las reivindicaciones 1 a 3, caracterizado porque ejecuta un
encriptación y/o codificación de dichos datos grabados y/o de dichas
informaciones de corrección.
5. Módulo para reconocimiento de voz (102) que
utiliza un modelo de lenguaje, caracterizado porque
incluye:
- un analizador adaptado para detectar las
expresiones no reconocidas;
- un grabador de datos representativos de al
menos una expresión no reconocida;
- un transmisor adaptado para transmitir dichos
datos grabados a un servidor remoto; y
- un receptor de informaciones de corrección que
permite corregir dicho modelo de lenguaje transmitido hacia dicho
módulo y que permite reconocer en el futuro al menos algunas de
dichas expresiones no reconocidas por dicho módulo, habiendo sido
transmitidas las informaciones de corrección por el servidor remoto
después de analizar en dicho servidor remoto dichos datos y tras
generar informaciones de corrección de dicho modelo de lenguaje,
teniendo en cuenta al menos una parte de las expresiones no
reconocidas.
6. Dispositivo de reconocimiento de voz (102)
que utiliza un modelo de lenguaje, caracterizado porque
incluye:
- un analizador adaptado para detectar las
expresiones no reconocidas;
- un grabador de datos representativos de al
menos una expresión no reconocida;
- un transmisor adaptado para transmitir dichos
datos grabados a un servidor remoto; y
- un receptor de informaciones de corrección que
permite la corrección de dicho modelo de lenguaje transmitido hacia
dicho módulo y que permite reconocer en el futuro al menos algunas
de dichas expresiones no reconocidas por dicho módulo, habiendo
sido transmitidas las informaciones de corrección por el servidor
remoto después de analizar en dicho servidor remoto dichos datos y
tras generar informaciones de corrección de dicho modelo de
lenguaje teniendo en cuenta al menos parte de las expresiones no
reconocidas.
7. Servidor de reconocimiento de voz (116),
ejecutándose dicho reconocimiento en un conjunto formado al menos
por un terminal remoto, utilizando un modelo de lenguaje,
caracterizado porque incluye los medios siguientes:
- un receptor de datos representativos de al
menos una expresión no reconocida por al menos un terminal que
forma parte de dicho conjunto y que ha detectado dicha expresión no
reconocida durante una operación de reconocimiento de voz; y
- un transmisor adaptado para transmitir a dicho
conjunto formado, al menos, por un terminal remoto, informaciones
de corrección obtenidas a partir de un análisis de dichos datos
recibidos por dicho servidor, permitiendo dichas informaciones de
corrección corregir dicho modelo de lenguaje por parte de cada uno
de los terminales de dicho conjunto, y permitiendo dicho modelo de
lenguaje reconocer en el futuro al menos parte de las expresiones
no reconocidas.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0101910A FR2820872B1 (fr) | 2001-02-13 | 2001-02-13 | Procede, module, dispositif et serveur de reconnaissance vocale |
| FR0101910 | 2001-02-13 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2291440T3 true ES2291440T3 (es) | 2008-03-01 |
Family
ID=8859932
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES02703691T Expired - Lifetime ES2291440T3 (es) | 2001-02-13 | 2002-02-12 | Procedimiento, modulo, dispositivo y servidor para reconocimiento de voz. |
Country Status (10)
| Country | Link |
|---|---|
| US (1) | US7983911B2 (es) |
| EP (1) | EP1362343B1 (es) |
| JP (1) | JP4751569B2 (es) |
| KR (1) | KR100908358B1 (es) |
| CN (1) | CN1228762C (es) |
| DE (1) | DE60222093T2 (es) |
| ES (1) | ES2291440T3 (es) |
| FR (1) | FR2820872B1 (es) |
| MX (1) | MXPA03007178A (es) |
| WO (1) | WO2002065454A1 (es) |
Families Citing this family (76)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20030182113A1 (en) * | 1999-11-22 | 2003-09-25 | Xuedong Huang | Distributed speech recognition for mobile communication devices |
| JP4267385B2 (ja) | 2003-06-30 | 2009-05-27 | インターナショナル・ビジネス・マシーンズ・コーポレーション | 統計的言語モデル生成装置、音声認識装置、統計的言語モデル生成方法、音声認識方法、およびプログラム |
| US8954325B1 (en) * | 2004-03-22 | 2015-02-10 | Rockstar Consortium Us Lp | Speech recognition in automated information services systems |
| US7542904B2 (en) * | 2005-08-19 | 2009-06-02 | Cisco Technology, Inc. | System and method for maintaining a speech-recognition grammar |
| EP1760566A1 (en) * | 2005-08-29 | 2007-03-07 | Top Digital Co., Ltd. | Voiceprint-lock system for electronic data |
| US20070136069A1 (en) * | 2005-12-13 | 2007-06-14 | General Motors Corporation | Method and system for customizing speech recognition in a mobile vehicle communication system |
| US8510109B2 (en) | 2007-08-22 | 2013-08-13 | Canyon Ip Holdings Llc | Continuous speech transcription performance indication |
| EP2008193B1 (en) | 2006-04-05 | 2012-11-28 | Canyon IP Holdings LLC | Hosted voice recognition system for wireless devices |
| US8214213B1 (en) * | 2006-04-27 | 2012-07-03 | At&T Intellectual Property Ii, L.P. | Speech recognition based on pronunciation modeling |
| US8917876B2 (en) | 2006-06-14 | 2014-12-23 | Personics Holdings, LLC. | Earguard monitoring system |
| WO2008095167A2 (en) | 2007-02-01 | 2008-08-07 | Personics Holdings Inc. | Method and device for audio recording |
| TWI321313B (en) * | 2007-03-03 | 2010-03-01 | Ind Tech Res Inst | Apparatus and method to reduce recognization errors through context relations among dialogue turns |
| US11750965B2 (en) | 2007-03-07 | 2023-09-05 | Staton Techiya, Llc | Acoustic dampening compensation system |
| US8352264B2 (en) * | 2008-03-19 | 2013-01-08 | Canyon IP Holdings, LLC | Corrective feedback loop for automated speech recognition |
| US9973450B2 (en) | 2007-09-17 | 2018-05-15 | Amazon Technologies, Inc. | Methods and systems for dynamically updating web service profile information by parsing transcribed message strings |
| US11317202B2 (en) | 2007-04-13 | 2022-04-26 | Staton Techiya, Llc | Method and device for voice operated control |
| US11217237B2 (en) | 2008-04-14 | 2022-01-04 | Staton Techiya, Llc | Method and device for voice operated control |
| US11856375B2 (en) | 2007-05-04 | 2023-12-26 | Staton Techiya Llc | Method and device for in-ear echo suppression |
| US11683643B2 (en) | 2007-05-04 | 2023-06-20 | Staton Techiya Llc | Method and device for in ear canal echo suppression |
| US10009677B2 (en) | 2007-07-09 | 2018-06-26 | Staton Techiya, Llc | Methods and mechanisms for inflation |
| US8335829B1 (en) | 2007-08-22 | 2012-12-18 | Canyon IP Holdings, LLC | Facilitating presentation by mobile device of additional content for a word or phrase upon utterance thereof |
| US9053489B2 (en) | 2007-08-22 | 2015-06-09 | Canyon Ip Holdings Llc | Facilitating presentation of ads relating to words of a message |
| US9129599B2 (en) * | 2007-10-18 | 2015-09-08 | Nuance Communications, Inc. | Automated tuning of speech recognition parameters |
| US8326631B1 (en) * | 2008-04-02 | 2012-12-04 | Verint Americas, Inc. | Systems and methods for speech indexing |
| JP5327838B2 (ja) * | 2008-04-23 | 2013-10-30 | Necインフロンティア株式会社 | 音声入力分散処理方法及び音声入力分散処理システム |
| US8600067B2 (en) | 2008-09-19 | 2013-12-03 | Personics Holdings Inc. | Acoustic sealing analysis system |
| US9129291B2 (en) | 2008-09-22 | 2015-09-08 | Personics Holdings, Llc | Personalized sound management and method |
| US8374872B2 (en) * | 2008-11-04 | 2013-02-12 | Verizon Patent And Licensing Inc. | Dynamic update of grammar for interactive voice response |
| US20120215528A1 (en) * | 2009-10-28 | 2012-08-23 | Nec Corporation | Speech recognition system, speech recognition request device, speech recognition method, speech recognition program, and recording medium |
| US9842591B2 (en) * | 2010-05-19 | 2017-12-12 | Sanofi-Aventis Deutschland Gmbh | Methods and systems for modifying operational data of an interaction process or of a process for determining an instruction |
| US20110307250A1 (en) * | 2010-06-10 | 2011-12-15 | Gm Global Technology Operations, Inc. | Modular Speech Recognition Architecture |
| US9484018B2 (en) * | 2010-11-23 | 2016-11-01 | At&T Intellectual Property I, L.P. | System and method for building and evaluating automatic speech recognition via an application programmer interface |
| US12349097B2 (en) | 2010-12-30 | 2025-07-01 | St Famtech, Llc | Information processing using a population of data acquisition devices |
| US9472185B1 (en) | 2011-01-05 | 2016-10-18 | Interactions Llc | Automated recognition system for natural language understanding |
| US9245525B2 (en) | 2011-01-05 | 2016-01-26 | Interactions Llc | Automated speech recognition proxy system for natural language understanding |
| JP5837341B2 (ja) * | 2011-06-24 | 2015-12-24 | 株式会社ブリヂストン | 路面状態判定方法とその装置 |
| GB2493413B (en) | 2011-07-25 | 2013-12-25 | Ibm | Maintaining and supplying speech models |
| JP2013127536A (ja) * | 2011-12-19 | 2013-06-27 | Sharp Corp | 音声出力装置、当該音声出力装置を備える通信端末、当該音声出力装置を備える補聴器、音声出力装置を制御するためのプログラム、音声出力装置の使用者に応じた音声を提供するための方法、および、音声出力装置の変換データを更新するためのシステム |
| AU2018202888B2 (en) * | 2013-01-17 | 2020-07-02 | Samsung Electronics Co., Ltd. | Image processing apparatus, control method thereof, and image processing system |
| JP6025785B2 (ja) * | 2013-07-08 | 2016-11-16 | インタラクションズ リミテッド ライアビリティ カンパニー | 自然言語理解のための自動音声認識プロキシシステム |
| US9305554B2 (en) * | 2013-07-17 | 2016-04-05 | Samsung Electronics Co., Ltd. | Multi-level speech recognition |
| DE102013216427B4 (de) * | 2013-08-20 | 2023-02-02 | Bayerische Motoren Werke Aktiengesellschaft | Vorrichtung und Verfahren zur fortbewegungsmittelbasierten Sprachverarbeitung |
| WO2015030474A1 (ko) | 2013-08-26 | 2015-03-05 | 삼성전자 주식회사 | 음성 인식을 위한 전자 장치 및 방법 |
| US10885918B2 (en) | 2013-09-19 | 2021-01-05 | Microsoft Technology Licensing, Llc | Speech recognition using phoneme matching |
| US9167082B2 (en) | 2013-09-22 | 2015-10-20 | Steven Wayne Goldstein | Methods and systems for voice augmented caller ID / ring tone alias |
| DE102013219649A1 (de) * | 2013-09-27 | 2015-04-02 | Continental Automotive Gmbh | Verfahren und System zum Erstellen oder Ergänzen eines benutzerspezifischen Sprachmodells in einem mit einem Endgerät verbindbaren lokalen Datenspeicher |
| US10043534B2 (en) | 2013-12-23 | 2018-08-07 | Staton Techiya, Llc | Method and device for spectral expansion for an audio signal |
| DE102014200570A1 (de) * | 2014-01-15 | 2015-07-16 | Bayerische Motoren Werke Aktiengesellschaft | Verfahren und System zur Erzeugung eines Steuerungsbefehls |
| US9601108B2 (en) * | 2014-01-17 | 2017-03-21 | Microsoft Technology Licensing, Llc | Incorporating an exogenous large-vocabulary model into rule-based speech recognition |
| CN103956168A (zh) * | 2014-03-29 | 2014-07-30 | 深圳创维数字技术股份有限公司 | 一种语音识别方法、装置及终端 |
| US10749989B2 (en) | 2014-04-01 | 2020-08-18 | Microsoft Technology Licensing Llc | Hybrid client/server architecture for parallel processing |
| KR102225404B1 (ko) | 2014-05-23 | 2021-03-09 | 삼성전자주식회사 | 디바이스 정보를 이용하는 음성인식 방법 및 장치 |
| JP2016009193A (ja) * | 2014-06-23 | 2016-01-18 | ハーマン インターナショナル インダストリーズ インコーポレイテッド | ユーザ適合音声認識 |
| US10163453B2 (en) | 2014-10-24 | 2018-12-25 | Staton Techiya, Llc | Robust voice activity detector system for use with an earphone |
| DE112014007123T5 (de) * | 2014-10-30 | 2017-07-20 | Mitsubishi Electric Corporation | Dialogsteuersystem und Dialogsteuerverfahren |
| US9711141B2 (en) * | 2014-12-09 | 2017-07-18 | Apple Inc. | Disambiguating heteronyms in speech synthesis |
| KR102325724B1 (ko) * | 2015-02-28 | 2021-11-15 | 삼성전자주식회사 | 다수의 기기에서 텍스트 데이터 동기화 |
| US20160274864A1 (en) * | 2015-03-20 | 2016-09-22 | Google Inc. | Systems and methods for enabling user voice interaction with a host computing device |
| CN104758075B (zh) * | 2015-04-20 | 2016-05-25 | 郑洪� | 基于语音识别控制的家用口腔护理工具 |
| US10325590B2 (en) * | 2015-06-26 | 2019-06-18 | Intel Corporation | Language model modification for local speech recognition systems using remote sources |
| US10616693B2 (en) | 2016-01-22 | 2020-04-07 | Staton Techiya Llc | System and method for efficiency among devices |
| US9858918B2 (en) * | 2016-03-15 | 2018-01-02 | GM Global Technology Operations LLC | Root cause analysis and recovery systems and methods |
| US9761227B1 (en) * | 2016-05-26 | 2017-09-12 | Nuance Communications, Inc. | Method and system for hybrid decoding for enhanced end-user privacy and low latency |
| US10971157B2 (en) * | 2017-01-11 | 2021-04-06 | Nuance Communications, Inc. | Methods and apparatus for hybrid speech recognition processing |
| US10229682B2 (en) | 2017-02-01 | 2019-03-12 | International Business Machines Corporation | Cognitive intervention for voice recognition failure |
| US10636423B2 (en) | 2018-02-21 | 2020-04-28 | Motorola Solutions, Inc. | System and method for managing speech recognition |
| CN108683937B (zh) * | 2018-03-09 | 2020-01-21 | 百度在线网络技术(北京)有限公司 | 智能电视的语音交互反馈方法、系统及计算机可读介质 |
| US10951994B2 (en) | 2018-04-04 | 2021-03-16 | Staton Techiya, Llc | Method to acquire preferred dynamic range function for speech enhancement |
| KR102544250B1 (ko) | 2018-07-03 | 2023-06-16 | 삼성전자주식회사 | 소리를 출력하는 디바이스 및 그 방법 |
| US11087739B1 (en) * | 2018-11-13 | 2021-08-10 | Amazon Technologies, Inc. | On-device learning in a hybrid speech processing system |
| CN110473530B (zh) * | 2019-08-21 | 2021-12-07 | 北京百度网讯科技有限公司 | 指令分类方法、装置、电子设备及计算机可读存储介质 |
| KR102332565B1 (ko) * | 2019-12-13 | 2021-11-29 | 주식회사 소리자바 | 음성 인식 힌트 적용 장치 및 방법 |
| CN113052191A (zh) * | 2019-12-26 | 2021-06-29 | 航天信息股份有限公司 | 一种神经语言网络模型的训练方法、装置、设备及介质 |
| US12198689B1 (en) * | 2020-08-10 | 2025-01-14 | Summer Institute of Linguistics, Inc. | Systems and methods for multilingual dialogue interactions using dynamic automatic speech recognition and processing |
| US11552966B2 (en) | 2020-09-25 | 2023-01-10 | International Business Machines Corporation | Generating and mutually maturing a knowledge corpus |
| DE102023128287A1 (de) * | 2023-10-16 | 2025-04-17 | Bayerische Motoren Werke Aktiengesellschaft | Steuervorrichtung und verfahren zur steuerung einer funktion eines kraftfahrzeugs auf basis einer spracheingabe eines nutzers |
Family Cites Families (25)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5384892A (en) * | 1992-12-31 | 1995-01-24 | Apple Computer, Inc. | Dynamic language model for speech recognition |
| ZA948426B (en) * | 1993-12-22 | 1995-06-30 | Qualcomm Inc | Distributed voice recognition system |
| JPH07222248A (ja) | 1994-02-08 | 1995-08-18 | Hitachi Ltd | 携帯型情報端末における音声情報の利用方式 |
| US5852801A (en) * | 1995-10-04 | 1998-12-22 | Apple Computer, Inc. | Method and apparatus for automatically invoking a new word module for unrecognized user input |
| US6058363A (en) * | 1997-01-02 | 2000-05-02 | Texas Instruments Incorporated | Method and system for speaker-independent recognition of user-defined phrases |
| US6173259B1 (en) * | 1997-03-27 | 2001-01-09 | Speech Machines Plc | Speech to text conversion |
| US6078886A (en) * | 1997-04-14 | 2000-06-20 | At&T Corporation | System and method for providing remote automatic speech recognition services via a packet network |
| US5953700A (en) * | 1997-06-11 | 1999-09-14 | International Business Machines Corporation | Portable acoustic interface for remote access to automatic speech/speaker recognition server |
| EP0979497A1 (en) * | 1997-10-08 | 2000-02-16 | Koninklijke Philips Electronics N.V. | Vocabulary and/or language model training |
| US5937385A (en) * | 1997-10-20 | 1999-08-10 | International Business Machines Corporation | Method and apparatus for creating speech recognition grammars constrained by counter examples |
| US6195641B1 (en) * | 1998-03-27 | 2001-02-27 | International Business Machines Corp. | Network universal spoken language vocabulary |
| US6157910A (en) * | 1998-08-31 | 2000-12-05 | International Business Machines Corporation | Deferred correction file transfer for updating a speech file by creating a file log of corrections |
| US6185535B1 (en) * | 1998-10-16 | 2001-02-06 | Telefonaktiebolaget Lm Ericsson (Publ) | Voice control of a user interface to service applications |
| US6275803B1 (en) * | 1999-02-12 | 2001-08-14 | International Business Machines Corp. | Updating a language model based on a function-word to total-word ratio |
| US6195636B1 (en) * | 1999-02-19 | 2001-02-27 | Texas Instruments Incorporated | Speech recognition over packet networks |
| EP1088299A2 (en) * | 1999-03-26 | 2001-04-04 | Scansoft, Inc. | Client-server speech recognition |
| US6408272B1 (en) * | 1999-04-12 | 2002-06-18 | General Magic, Inc. | Distributed voice user interface |
| US6463413B1 (en) * | 1999-04-20 | 2002-10-08 | Matsushita Electrical Industrial Co., Ltd. | Speech recognition training for small hardware devices |
| US6360201B1 (en) * | 1999-06-08 | 2002-03-19 | International Business Machines Corp. | Method and apparatus for activating and deactivating auxiliary topic libraries in a speech dictation system |
| JP2001013985A (ja) | 1999-07-01 | 2001-01-19 | Meidensha Corp | 音声認識システムの辞書管理方式 |
| US6484136B1 (en) * | 1999-10-21 | 2002-11-19 | International Business Machines Corporation | Language model adaptation via network of similar users |
| US20030182113A1 (en) * | 1999-11-22 | 2003-09-25 | Xuedong Huang | Distributed speech recognition for mobile communication devices |
| JP3728177B2 (ja) * | 2000-05-24 | 2005-12-21 | キヤノン株式会社 | 音声処理システム、装置、方法及び記憶媒体 |
| JP2003036088A (ja) * | 2001-07-23 | 2003-02-07 | Canon Inc | 音声変換の辞書管理装置 |
| US7016849B2 (en) * | 2002-03-25 | 2006-03-21 | Sri International | Method and apparatus for providing speech-driven routing between spoken language applications |
-
2001
- 2001-02-13 FR FR0101910A patent/FR2820872B1/fr not_active Expired - Fee Related
-
2002
- 2002-02-12 WO PCT/FR2002/000518 patent/WO2002065454A1/fr not_active Ceased
- 2002-02-12 CN CNB028049195A patent/CN1228762C/zh not_active Expired - Fee Related
- 2002-02-12 MX MXPA03007178A patent/MXPA03007178A/es active IP Right Grant
- 2002-02-12 KR KR1020037010428A patent/KR100908358B1/ko not_active Expired - Fee Related
- 2002-02-12 US US10/467,586 patent/US7983911B2/en not_active Expired - Fee Related
- 2002-02-12 EP EP02703691A patent/EP1362343B1/fr not_active Expired - Lifetime
- 2002-02-12 DE DE60222093T patent/DE60222093T2/de not_active Expired - Lifetime
- 2002-02-12 JP JP2002565299A patent/JP4751569B2/ja not_active Expired - Fee Related
- 2002-02-12 ES ES02703691T patent/ES2291440T3/es not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| JP2004530149A (ja) | 2004-09-30 |
| WO2002065454A1 (fr) | 2002-08-22 |
| EP1362343A1 (fr) | 2003-11-19 |
| EP1362343B1 (fr) | 2007-08-29 |
| CN1491412A (zh) | 2004-04-21 |
| DE60222093D1 (de) | 2007-10-11 |
| JP4751569B2 (ja) | 2011-08-17 |
| KR20030076661A (ko) | 2003-09-26 |
| CN1228762C (zh) | 2005-11-23 |
| DE60222093T2 (de) | 2008-06-05 |
| MXPA03007178A (es) | 2003-12-04 |
| FR2820872A1 (fr) | 2002-08-16 |
| US7983911B2 (en) | 2011-07-19 |
| US20050102142A1 (en) | 2005-05-12 |
| KR100908358B1 (ko) | 2009-07-20 |
| FR2820872B1 (fr) | 2003-05-16 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2291440T3 (es) | Procedimiento, modulo, dispositivo y servidor para reconocimiento de voz. | |
| EP1575030B1 (en) | New-word pronunciation learning using a pronunciation graph | |
| KR101183344B1 (ko) | 사용자 정정들을 이용한 자동 음성 인식 학습 | |
| US6973427B2 (en) | Method for adding phonetic descriptions to a speech recognition lexicon | |
| CN1655235B (zh) | 基于话音特征自动标识电话呼叫者 | |
| Sainath et al. | No need for a lexicon? evaluating the value of the pronunciation lexica in end-to-end models | |
| US8275618B2 (en) | Mobile dictation correction user interface | |
| US6067514A (en) | Method for automatically punctuating a speech utterance in a continuous speech recognition system | |
| Wang et al. | Complete recognition of continuous Mandarin speech for Chinese language with very large vocabulary using limited training data | |
| EP1551007A1 (en) | Language model creation/accumulation device, speech recognition device, language model creation method, and speech recognition method | |
| US20160147740A1 (en) | Adapting machine translation data using damaging channel model | |
| US20050203737A1 (en) | Speech recognition device | |
| US7076422B2 (en) | Modelling and processing filled pauses and noises in speech recognition | |
| KR20170022445A (ko) | 통합 모델 기반의 음성 인식 장치 및 방법 | |
| WO2001022400A1 (en) | Iterative speech recognition from multiple feature vectors | |
| JPH08278794A (ja) | 音声認識装置および音声認識方法並びに音声翻訳装置 | |
| CN113160804B (zh) | 混合语音的识别方法及装置、存储介质、电子装置 | |
| KR101153078B1 (ko) | 음성 분류 및 음성 인식을 위한 은닉 조건부 랜덤 필드모델 | |
| CN100354929C (zh) | 语音处理设备、语言处理方法 | |
| JP2010091675A (ja) | 音声認識装置 | |
| CN1223984C (zh) | 基于客户机-服务器的分布式语音识别系统 | |
| KR100726875B1 (ko) | 구두 대화에서의 전형적인 실수에 대한 보완적인 언어모델을 갖는 음성 인식 디바이스 | |
| CN113421587B (zh) | 语音评测的方法、装置、计算设备及存储介质 | |
| CN112133285B (zh) | 语音识别方法、装置、存储介质和电子设备 | |
| KR102299269B1 (ko) | 음성 및 스크립트를 정렬하여 음성 데이터베이스를 구축하는 방법 및 장치 |