ES2327468T3 - Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. - Google Patents

Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. Download PDF

Info

Publication number
ES2327468T3
ES2327468T3 ES07756698T ES07756698T ES2327468T3 ES 2327468 T3 ES2327468 T3 ES 2327468T3 ES 07756698 T ES07756698 T ES 07756698T ES 07756698 T ES07756698 T ES 07756698T ES 2327468 T3 ES2327468 T3 ES 2327468T3
Authority
ES
Spain
Prior art keywords
speaker
pitch
classification
height
voice
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES07756698T
Other languages
English (en)
Inventor
Ruxin Chen
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sony Interactive Entertainment Inc
Original Assignee
Sony Computer Entertainment Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sony Computer Entertainment Inc filed Critical Sony Computer Entertainment Inc
Application granted granted Critical
Publication of ES2327468T3 publication Critical patent/ES2327468T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/065Adaptation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/90Pitch determination of speech signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Complex Calculations (AREA)
  • Telephonic Communication Services (AREA)
  • Electrically Operated Instructional Devices (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Image Analysis (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • User Interface Of Digital Computer (AREA)
  • Circuits Of Receivers In General (AREA)

Abstract

Un método de reconocimiento de voz, comprendiendo el método: obtener (102) una señal de voz de una pronunciación de un hablante; determinar (104) una altura de tono de ejecución de la señal de la pronunciación; clasificar (106) el hablante basándose en la altura de tono de ejecución; ajustar (108) uno o más parámetros del modelo acústico basándose en la clasificación del hablante; y realizar (110) un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.

Description

Reconocimiento de voz con adaptación del hablante basándose en la clasificación del tono.
Campo del invento
Esta aplicación se refiere al reconocimiento de voz y más específicamente a los sistemas de reconocimiento de voz que se adaptan a hablantes basándose en la altura de tono.
Antecedentes del invento
Las tecnologías de reconocimiento de voz y habla permiten que los ordenadores y otros dispositivos electrónicos equipados con una fuente de entrada de sonido, tal como un micrófono, interpretar el habla humana, por ejemplo para transcripción o como un método alternativo de interacción con un ordenador. Se están desarrollando soportes lógicos de reconocimiento de habla para uso en dispositivos electrónicos de consumo tales como teléfonos móviles, consolas para juegos, ordenadores personales y asistentes digitales personales. En un algoritmo típico de reconocimiento de habla, una señal de dominio de tiempo que representa el habla humana es partida en varias ventanas de tiempo y cada ventana es convertida en una señal de dominio de frecuencia, por ejemplo por la transformación rápida de Fourier (FFT). Esta señal de frecuencia o de dominio espectral es comprimida a continuación tomando un logaritmo de la señal de dominio espectral y después realizando otra FFT. Del espectro comprimido (denominado también un cepstrum), se puede usar un modelo estadístico para determinar los fenómenos y el contexto dentro del habla representado por la señal. El cepstrum puede ser visto como información sobre la tasa de cambio de las diferentes bandas espectrales dentro de la señal de habla. Para aplicaciones de reconocimiento de habla el espectro es usualmente transformado primero usando las bandas de Frecuencia Mel. El resultado se denomina los Coeficientes Cepstral de Frecuencia Mel o MFCCs. Una frecuencia f en hercios (ciclos por segundo) puede convertirse en una frecuencia mel m de acuerdo con: m=(1127,01048 Hz)log_{e}(1+f/700). Igualmente una frecuencia mel m puede convertirse en una frecuencia f en hercios usando f=(700 Hz)(e^{m/1127,01048}-1).
En el reconocimiento de voz el espectro es a menudo filtrado usando un conjunto de funciones de filtro de forma triangular. Las funciones de filtro dividen el espectro en un conjunto de bandas que se solapan parcialmente y que se encuentran entre una frecuencia mínima f_{min} y una frecuencia máxima f_{max}. Cada función de filtro está centrada en una determinada frecuencia dentro de una gama de frecuencias de interés. Cuando se ha convertido a la escala de frecuencias mel cada función de filtro puede ser expresada como un conjunto de baterías de filtros mel, en donde cada batería de filtros MFB está dada por:
\vskip1.000000\baselineskip
1
\vskip1.000000\baselineskip
en donde el índice i se refiere al número de batería de filtros y mf_{min} y mf_{max} son las frecuencias mel que corresponden a f_{min} y f_{max}.
La elección de f_{min} y f_{max} determina las baterías de filtros que son usadas por un algoritmo de reconocimiento de voz. Típicamente, f_{min} y f_{max} son fijadas por el modelo de reconocimiento de voz que se está usando. Un problema con el reconocimiento de voz es que los diferentes hablantes pueden tener longitudes diferentes del tracto vocal y producir señales de voz con las correspondientes gamas de frecuencia diferentes. Para compensar lo anterior, los sistemas de reconocimiento de voz pueden realizar una normalización del tracto vocal de la señal de voz antes del filtrado. A modo de ejemplo, la normalización puede usar una función del tipo:
\vskip1.000000\baselineskip
2
\vskip1.000000\baselineskip
en donde f' es la frecuencia normalizada y \alpha es un parámetro que ajusta una curvatura de la función de normalización.
Los componentes de una señal de habla que tiene N bandas diferentes de frecuencia mel pueden ser representados como un vector A que tiene N componentes. Cada componente del vector A es un coeficiente de frecuencia mel de la señal de habla. La normalización del vector A típicamente implica una matriz de transformación del tipo:
\newpage
F'=[M]\cdotF+B, en donde [M] es una matriz NxN dada por:
\vskip1.000000\baselineskip
3
\vskip1.000000\baselineskip
y B es un vector de polarización dado por:
\vskip1.000000\baselineskip
4
\vskip1.000000\baselineskip
F' y F son vectores de la forma:
\vskip1.000000\baselineskip
5
\vskip1.000000\baselineskip
en donde los coeficientes M_{ij} de la matriz y los componentes B_{i} del vector se calculan fuera de línea para maximizar la probabilidad de una secuencia de habla observada en un sistema HMM. Usualmente, para una trama dada y una característica dada F', la probabilidad observada es la calculada por una función Gaussiana:
\vskip1.000000\baselineskip
6
\vskip1.000000\baselineskip
Cada componente del vector normalizado F' es un componente de la frecuencia mel de la señal de habla.
Se sabe que los hablantes hombre y mujer producen señales de voz caracterizadas por coeficientes de frecuencia mel diferentes (MFCC). En la técnica anterior, los sistemas de reconocimiento de voz han realizado un entrenamiento para diferenciar si el hablante es hombre o mujer y ajustar el modelo acústico usado en el reconocimiento de voz basado en si el hablante es hombre o mujer. Típicamente, el modelo acústico se ensaya haciendo que un número, por ejemplo 10, de hablantes hombre y un número igual de hablantes mujer digan las mismas palabras para producir muestras de voz. Los análisis de características basados en muestras de voz dicen las mismas palabras para producir muestras de voces. Los análisis de características basados en muestras de voz se combinan conjuntamente en un supermodelo de reconocimiento de voz.
Una desventaja importante de la normalización anterior es que el vector F puede tener hasta 40 componentes. Por lo tanto, la matriz [M] podría tener hasta 1.600 coeficientes. El cálculo de un número tan alto de coeficientes puede emplear mucho tiempo para adaptar el algoritmo de reconocimiento de voz.
Además, como los sistemas y métodos de reconocimiento de voz de la técnica anterior usan valores fijos de f_{min}, f_{max}, mf_{min} y mf_{max} para filtrado y normalización, no tienen en cuenta adecuadamente las variaciones en la longitud del tracto vocal entre hablantes. Por lo tanto, la precisión en el reconocimiento de habla puede ser menor que la óptima. Por tanto, existe la necesidad de sistemas y métodos de reconocimiento de voz que superen tales desventajas.
Posteriores disposiciones de la técnica anterior se discuten en el documento EP-A-0.866.442, la ponencia "Normalización de hablantes usando los procedimientos eficientes de distorsión de frecuencia", Li Lee y otros, Proc 1996 IEEE Conferencia Internacional sobre procedimientos de Acústica, Habla y Señales, vol 1, Conf 21, páginas 353-356, y la ponencia "Normalización de hablantes basada en establecimiento de escalas no uniformes", Proc 2002 IEEE Conferencia Internacional sobre Procedimientos de Acústica, Habla y Señales, vol 4, páginas 1-589.
Compendio del invento
Los diferentes aspectos referentes al invento están definidos en las reivindicaciones que se acompañan.
Las desventajas asociadas con la técnica anterior están superadas, o al menos atenuadas por realizaciones del presente invento dirigidas a métodos y sistemas de reconocimiento de voz. De acuerdo con realizaciones del invento se obtiene una señal de voz a partir de una pronunciación de un hablante. Se determina una altura de tono de ejecución a partir de la señal de voz de la pronunciación. El hablante es clasificado basándose en la altura de tono de ejecución y se ajustan uno o más parámetros de modelos acústicos basándose en una clasificación del hablante. A continuación se realiza un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.
Breve descripción de los dibujos
A continuación se describen las realizaciones del invento, solamente a modo de ejemplo, haciendo referencia a los dibujos que se acompañan, en los que:
la Figura 1 es un diagrama de flujos que ilustra un algoritmo de reconocimiento de voz de acuerdo con una realización del presente invento,
la Figura 2 es un diagrama de bloques que ilustra un sistema de reconocimiento de voz de acuerdo con una realización del presente invento.
Descripción de las realizaciones específicas
Aunque la descripción detallada que sigue contiene muchos detalles específicos para los fines de ilustración, cualquier persona con un conocimiento normal de la técnica observará que muchas variaciones y alteraciones en los siguientes detalles están dentro del alcance del invento. Por lo tanto, las realizaciones del invento que se describen más adelante se exponen sin ninguna pérdida de generalidad a, y sin imponer limitaciones sobre, el invento reivindicado.
De acuerdo con una realización del presente invento, un método de reconocimiento de voz 100 puede seguir su curso como está ilustrado en la Figura 1A. En 102, se obtiene una señal de voz a partir de una pronunciación de un hablante. La señal de voz puede ser obtenida de cualquier forma convencional, por ejemplo usando un micrófono y un codificador digital de la forma de la onda para poner la señal de voz en formato digital. La señal de voz puede obtenerse por sobremuestreo de la señal de voz en una frecuencia de muestreo que es mayor que la frecuencia de análisis de una característica de trabajo. En particular, la frecuencia de muestreo puede ser mayor que la tasa de muestreo de habla durante un tiempo de ensayo. A modo de ejemplo, y sin limitación, si la señal de voz está caracterizada por una frecuencia de análisis de característica de trabajo de 12 kilohercios, la señal puede ser muestreada a una frecuencia de muestreo de, por ejemplo, 16-22 kilohercios.
En 104, se determina un valor de altura de tono de ejecución p_{run} de la pronunciación. Existen varias formas de determinar la altura de tono de ejecución p_{run}. Por ejemplo, p_{run} puede ser una altura de tono media móvil p_{avg}(t) que puede ser calculada a lo largo de una ventana de tiempo dada que incluye el tiempo t por:
\vskip1.000000\baselineskip
7
\vskip1.000000\baselineskip
en donde la suma se realiza sobre una cantidad de NP medidas de altura de tono tomadas en los momentos t_{i} = {t-(NP-1), t-(NP-2), ..., t} durante la ventana de tiempo para probabilidades de altura de tono por encima de un umbral predeterminado. Una forma sencilla de calcular la probabilidad de altura de tono es
\vskip1.000000\baselineskip
8
\vskip1.000000\baselineskip
donde
\vskip1.000000\baselineskip
9
es la correlación de la señal de habla de análisis. Alternativamente, la altura de tono de ejecución p_{run} puede estar relacionada con la altura de tono actual, por ejemplo, por:
10
en donde c es una constante entre 0 y 1 y p(t) es un valor actual de la altura de tono en el momento t. El valor de la constante c está relacionado con el tamaño de la ventana. Por ejemplo, un valor de c=0 corresponde a no ventana (en cuyo caso p_{run}(t)= p(t)) y un valor de c=1 corresponde con una ventana infinita (en cuyo caso p_{run}(t)=p(t-1)). Adviértase que para valores de t>0, los valores de altura de tono para momentos anteriores a t contribuyen al valor de la altura de tono p_{run}(t). Esto puede ser ilustrado con un ejemplo numérico en el que c=0,6. En tal caso, la ecuación 2 da:
11
\vskip1.000000\baselineskip
En algunas realizaciones del invento p_{run}(t) puede ser calculado de acuerdo con la Ecuación 2 si la probabilidad de altura de tono está por encima de algún umbral, por ejemplo, por encima de aproximadamente 0,4.
A modo de ejemplo, la clasificación del hablante realizada en 106 de la Figura 1A puede estar basada en la edad del hablante y/o en el género. Por ejemplo, a partir de los datos de entrenamiento se puede determinar que la altura de tono media de hombres, mujeres y niños se encuentra en diferentes gamas. El hablante puede ser clasificado a partir de la gama en la que se encuentra la altura de tono actual de la señal de voz. A modo de ejemplo, un hablante varón adulto tiene una altura de tono media entre aproximadamente 120 Hz y aproximadamente 160 Hz, un hablante hembra adulto tiene una altura de tono media entre aproximadamente 180 Hz y aproximadamente 220 Hz, y un hablante niño tiene una altura de tono media mayor de 220 Hz. Si la altura de tono actual es 190 Hz, el hablante sería clasificado como un hablante hembra. En algunos casos la altura de tono media de un hablante puede estar incluida como una característica en el vector F.
Una vez que el hablante ha sido clasificado, los parámetros del modelo acústico pueden ser seleccionados de acuerdo con lo indicado en 108. Estos parámetros se usan después en un análisis de reconocimiento de voz en 110. La elección de parámetros depende del tipo de modelo acústico usado en el análisis de reconocimiento de voz. Por ejemplo, el análisis de reconocimiento de voz puede filtrar la señal de voz usando un conjunto de funciones de filtro. Las funciones de filtro, por ejemplo las funciones de filtro de forma triangular, dividen el espectro en un conjunto de bandas que se solapan parcialmente. Cada análisis de reconocimiento de voz usa una batería de filtros definida por una frecuencia máxima f_{max} diferente y una frecuencia mínima f_{min} diferente. Las f_{max} y f_{min} pueden ser frecuencias en la escala de Hertz o alturas de tono en la escala mel. La frecuencia máxima f_{max} se refiere a un límite superior de la gama de frecuencias de la batería de filtros, y la frecuencia mínima f_{min} se refiere a un límite inferior de la gama de frecuencias de la batería de filtros. Los valores de los parámetros f_{max} y f_{min} pueden ajustarse dinámicamente en cualquier momento durante el análisis de reconocimiento de voz, por ejemplo, para cualquier ventana de tiempo durante el análisis de reconocimiento de voz. El análisis de reconocimiento de voz produce una probabilidad de reconocimiento P, de reconocimiento de una o más unidades de habla. Las unidades de habla pueden ser frases, palabras, o subunidades de palabras, tales como fonemas.
A modo de ejemplo, una vez que el hablante ha sido clasificado como un varón, hembra o niño, los valores de f_{max} y f_{min} para análisis de reconocimiento de voz de la pronunciación pueden ser por lo tanto seleccionados. Por ejemplo, si se acepta que el hablante es un hombre, f_{max} puede ser aproximadamente 70 Hz y f_{min} puede ser aproximadamente 3.800 Hz. Si se supone que el hablante es una mujer, f_{max} puede ser aproximadamente 70 Hz y f_{min} puede ser aproximadamente 4.200 Hz. Si se supone que el hablante es un niño, f_{max} puede ser aproximadamente 90 Hz y f_{min} puede ser aproximadamente 4.400 Hz.
En 110, una probabilidad P de reconocimiento procede de un análisis de voz de la pronunciación basado en los parámetros del modelo de ajuste. A modo de ejemplo, y sin pérdida de generalidad, el análisis de reconocimiento de voz puede usar un Modelo de Markov Hidden (HMM) para determinar las unidades de habla en una señal de voz dada. Las unidades de habla pueden ser palabras, combinaciones de dos palabras o unidades de subpalabras y similares. El HMM puede estar caracterizado por:
L, que representa varios posibles estados del sistema;
M, que representa el número total de Gaussianos que existen en el sistema;
N, que representa el número de características distintas observables en un instante dado; pudiendo estas características ser espectrales (por ejemplo, dominio de frecuencia) o temporal (dominio de tiempo) de la señal del habla;
A={a_{ij}}, una distribución de probabilidad de transición de estado, en la que cada a_{ij} representa la probabilidad de que el sistema pase del estado j^{th} en el instante t+1 si el sistema está inicialmente en el estado j^{th} en el instante t;
B={b_{j}(k)}, una distribución de probabilidad de característica de observación del estado j^{th}, en el que cada b_{j}(k) representa la distribución de probabilidad de los valores observados de la característica k^{th} cuando el sistema está en el estado j^{th}; y
\pi={\pi_{j}}, una distribución de estados iniciales, en donde cada componente \pi_{j} representa la probabilidad de que el sistema esté en el estado j^{th} en algún momento inicial.
Los Modelos Markov Hidden pueden aplicarse a la señal de voz para resolver uno o más problemas básicos, que incluyen: (1) la probabilidad de una secuencia dada de observaciones obtenidas de la señal de voz; (2) dada la secuencia de observaciones, qué secuencia de estado correspondiente explica mejor la secuencia de observaciones; y (3) cómo ajustar el conjunto de parámetros modelo A, B, \pi para maximizar la probabilidad de una secuencia de observaciones dada.
La aplicación de HMMs para el reconocimiento de habla es descrita con detalle, por ejemplo, por Lawrence Rabiner en "Un curso de enseñanza sobre modelos de Markov Hidden y en Aplicaciones Seleccionadas sobre Reconocimiento de Habla" en las Actas del IEEE, Vol 77, Nº 2, 2 de febrero de 1989.
Los análisis de reconocimiento de habla realizados en 110 pueden caracterizar el habla mediante varios patrones reconocibles conocidos como fonemas. Cada uno de estos fonemas puede ser dividido en varias partes, por ejemplo, una parte inicial, media y final. Se ha observado que la parte media es típicamente la más estable ya que la parte inicial está a menudo afectada por el fonema anterior y la parte final está afectada por el fonema que sigue. Las diferentes partes de los fonemas están caracterizadas por características de dominio de frecuencia que pueden ser reconocidas por un análisis estadístico apropiado de la señal. El modelo estadístico usa a menudo funciones de distribución de probabilidad Gaussianas para predecir la probabilidad de cada estado diferente de las características que constituyen partes de la señal correspondientes a las diferentes partes de los diferentes fonemas. Un estado HMM puede contener uno o más Gaussianos. Un Gaussiano determinado para un estado posible dado, por ejemplo, el Gaussiano k^{th} puede ser representado por un conjunto de N valores medios \mu_{ki} y por las varianzas \sigma_{ki}. En un algoritmo de reconocimiento de habla típico uno determina cuál de los Gaussianos para una ventana de tiempo dada es el mayor. A partir del Gaussiano mayor se puede deducir el fonema más probable para la ventana de tiempo.
A modo de ejemplo, el análisis de reconocimiento de voz en 110 puede analizar una señal de dominio de tiempo para obtener N características de señal observables diferentes x_{0}...x_{n}, en donde n=N-1. La característica observada del sistema puede ser representada como un vector que tiene los componentes x_{0}...x_{n}. Estos componentes pueden ser características espectrales, cepstrales, o temporales de un señal de habla observada dada.
A modo de ejemplo, y sin limitación de las realizaciones del invento, los componentes x_{0}...x_{n} pueden ser coeficientes cepstrales de frecuencia mel (MFFCs) de la señal de voz obtenida en 102. Un cepstrum es el resultado de tomar la transformación de Fourier (FT) del espectro de decibelios como si fuera una señal. El cepstrum de una señal de habla del dominio de tiempo puede ser definido verbalmente como la transformada de Fourier del log (con fase no desarrollada) de la transformación de Fourier de la señal del dominio de tiempo. El cepstrum de una señal del dominio de tiempo S(t) puede representarse matemáticamente como FT(log(FT(S(t)))+j2\piq), en donde q es el entero necesario para desarrollar apropiadamente el ángulo o parte imaginaria de la función logarítmica compleja. Algorítmicamente, el cepstrum puede ser generado por la secuencia de operaciones: señal -> FT -> log -> desarrollo de fase -> FT -> cepstrum.
Hay un cepstrum complejo y un cepstrum real. El cepstrum real usa la función logarítmica definida de valores reales, mientras que el cepstrum complejo usa la función logarítmica definida de valores complejos también. El cepstrum complejo contiene información sobre la magnitud y fase del espectro inicial, que permite la reconstrucción de la señal. El cepstrum real solamente usa la información de la magnitud del espectro. A modo de ejemplo, y sin pérdida de generalidad, el análisis de reconocimiento de voz realizado en 110 puede usar el cepstrum real.
\newpage
Ciertos patrones de combinaciones de componentes x_{0}...x_{n} corresponden a unidades de habla (por ejemplo palabras o frases) o a subunidades, tales como sílabas, fonemas u otras subunidades de palabras. Cada unidad o subunidad puede ser considerada como un estado del sistema. La función de densidad de probabilidad f_{k}(x_{0}...x_{n}) de un Gaussiano dado del sistema (el Gaussiano k^{th}) puede ser cualquier tipo de función de densidad de probabilidad f_{k}(x_{0}...x_{n}), por ejemplo una función Gaussiana que tenga la siguiente forma:
\vskip1.000000\baselineskip
12
\vskip1.000000\baselineskip
en donde
\vskip1.000000\baselineskip
13
\vskip1.000000\baselineskip
En las ecuaciones anteriores "i" es un índice de característica y "k" es un índice de Gaussiano. En la ecuación (1) el subíndice k es un índice de la función Gaussiana. Puede haber de varios cientos a varios cientos de miles de Gaussianos usados por el algoritmo de reconocimiento de habla. La cantidad \mu_{ki} es un valor medio de la característica x_{i} en el Gaussiano k^{th} del sistema. La cantidad \sigma_{ki}^{2} es la varianza de x_{i} en el Gaussiano k^{th}. Uno o más Gaussianos pueden estar asociados con uno o más estados diferentes. Por ejemplo, puede haber L estados diferentes que contienen un número total de M Gaussianos en el sistema. La cantidad \mu_{ki} es la media de todas las medidas de x_{i} que pertenecen a f_{k}(x_{0}...x_{N}) a lo largo de todas las ventanas de tiempo de datos de preparación y \sigma_{ki} es la varianza de las medidas correspondientes usadas para calcular \mu_{ki}.
La probabilidad de que cada Gaussiano pueda ser calculado por la ecuación (1) para dar una probabilidad de reconocimiento correspondiente es P_{r'}. A partir del Gaussiano que tiene la probabilidad máxima uno puede construir un estado, palabra, fonema, carácter, etc más probable para esa determinada ventana de tiempo. Se debe observar que también es posible usar el estado más probable de una ventana de tiempo dada para ayudar a determinar el estado más probable de las ventanas de tiempo anteriores o posteriores, ya que éstas pueden determinar un contexto en el que ocurre el estado.
De acuerdo con realizaciones del presente invento, un método de reconocimiento (por ejemplo un método de reconocimiento de voz) del tipo representado en la Figura 1A o Figura 1B que funciona como se ha descrito antes puede ser realizado como parte de un aparato 200 de procesamiento de señal, como se ha representado en la Figura 2. El sistema 200 puede incluir un procesador 202 y una memoria 202 (por ejemplo RAM, DRAM, ROM, y similares). Además, el aparato de procesamiento de la señal 200 puede tener muchos procesadores 201 si se tiene que realizar un procesamiento paralelo. La memoria 202 incluye datos y códigos configurados como se ha descrito anteriormente. Específicamente, la memoria incluye datos que representan características 204 de la señal, y funciones de probabilidad 206, cada una de las cuales puede incluir códigos, datos o alguna combinación de códigos y datos.
El aparato 200 puede también incluir funciones de soporte bien conocidas 210, tal como los elementos entrada/salida (I/O) 211, suministros de potencia (P/S) 212, un reloj (CLK) 213 y memoria oculta 214. El aparato 200 puede opcionalmente incluir un dispositivo de almacenamiento masivo 215 tal como una unidad de disco, unidad de CD-ROM, unidad de cinta, o similar para almacenar programas y/o datos. El controlador puede también incluir opcionalmente una unidad de visualización 216 y una unidad de interfaz de usuario 218 para facilitar la interacción entre el controlador 200 y un usuario. La unidad de visualización 216 puede estar en la forma de un tubo de rayos catódicos (CRT) o de pantalla de panel plano que visualiza texto, números, símbolos gráficos o imágenes. La interfaz de usuario 218 puede incluir un teclado, un ratón, una palanca de control de mando, un lápiz óptico u otro dispositivo. Además, la interfaz de usuario 218 puede incluir un micrófono, una videocámara o cualquier otro dispositivo transductor de la señal para facilitar la captación directa de una señal para ser analizada. El procesador 201, la memoria 202 y los otros componentes del sistema 200 pueden intercambiar señales (por ejemplo, instrucciones de códigos y datos) entre sí a través de una vía de distribución 220 como se muestra en la Figura 2. Un micrófono 222 puede ser acoplado al aparato 200 a través de las funciones I/O 211.
Como se ha usado aquí, el término I/O generalmente se refiere a cualquier programa, operación o dispositivo que transfiera datos a o desde el sistema 200 y a o desde un dispositivo periférico. Cada transferencia es una salida de un dispositivo y una entrada a otro. Los dispositivos periféricos incluyen dispositivos de entrada solamente, tales como teclados o ratones, dispositivos de salida solamente, tales como impresoras así como dispositivos tales como CD-ROM grabables que pueden actuar como un dispositivo de entrada y un dispositivo de salida. El término "dispositivo periférico" incluye dispositivos externos, tales como un ratón, un teclado, una impresora, un monitor, un micrófono, una cámara, una unidad de compresión externa o explorador así como dispositivos externos, tales como una unidad de CD-ROM, una unidad de CD-R o un modem interno u otro periférico tal como un lector/escritor de memoria instantáneo, una unidad de disco duro.
El procesador 201 puede realizar el reconocimiento de señal de los datos de las señales 206 y/o la probabilidad en las instrucciones de códigos de un programa 204 almacenado y recuperado por la memoria 202 y ejecutado por el módulo procesador 201. Las partes de código del programa 203 pueden adaptarse a cualquiera de varios lenguajes de programación diferentes tales como Assembly, C++, JAVA o varios otros lenguajes. El módulo de procesador 201 forma un ordenador de uso general que se convierte en un ordenador de uso específico cuando ejecuta programas tales como el código de programa 204. Aunque el código de programa 204 se describe aquí como realizado en soporte lógico y ejecutado en un ordenador de uso general, los expertos en la técnica advertirán que el método de gestión de tareas podría alternativamente realizarse usando un soporte físico tal como un circuito integrado específico de la aplicación (ASIC) u otros circuitos de soporte físico. Como tal, se debería entender que las realizaciones del invento pueden realizarse, total o parcialmente, en soporte lógico, soporte físico o en una combinación de ambos.
En una realización, entre otras, el código de programa 204 puede incluir un conjunto de instrucciones leíbles por un procesador que realiza un método que tiene características en común con el método 100 de la Figura 1A o el método 110 de la Figura 1B. El programa 204 puede incluir generalmente una o más instrucciones que dirigen el procesador 201 para obtener una señal de voz para una pronunciación de un hablante; determinar una altura de tono de ejecución de la señal de voz de la pronunciación; clasificar el hablante basándose en la altura de tono de ejecución; ajustar uno o más parámetros de modelo acústico basándose en una clasificación del hablante; y realizar un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.
A modo de ejemplo, el programa 204 puede ser parte de un programa total mayor tal como un programa para un juego de ordenador. En ciertas realizaciones del invento el código de programa 204 puede hacer que un hablante diga una palabra o frase (por ejemplo, el nombre del hablante) durante una fase de iniciación (por ejemplo, al comienzo de un juego) para proporcionar un ejemplo de habla. A partir de esta muestra el programa 204 puede avanzar como se ha descrito anteriormente con respecto a la Figura 1 para encontrar parámetros óptimos (por ejemplo, f_{min} y f_{max}) de ese hablante y ejecutar el reconocimiento de voz en 110 usando esos parámetros. Los parámetros pueden ser guardados después de la conclusión del programa y ser usados cuando ese hablante use el programa.
Las realizaciones del presente invento facilitan un reconocimiento de voz más consistente y más preciso. En un ejemplo de reconocimiento de voz que emplea la selección del parámetro de modelo acústico usando la clasificación del hablante basándose en la altura de tono con un hablante hembra único produjo el 94,8% de precisión de palabras. Un algoritmo de reconocimiento de voz convencional que no emplea selección de parámetro de modelo acústico usando la clasificación del hablante basándose en la altura de tono con un hablante hembra único consiguió solamente el 86,3% de precisión de palabras con el mismo hablante hembra.
Mientras que lo anterior es una descripción completa de la realización preferida del presente invento, es posible usar diferentes alternativas, modificaciones y equivalentes.
El alcance del invento está definido por las reivindicaciones anejas.

Claims (15)

1. Un método de reconocimiento de voz, comprendiendo el método:
obtener (102) una señal de voz de una pronunciación de un hablante;
determinar (104) una altura de tono de ejecución de la señal de la pronunciación;
clasificar (106) el hablante basándose en la altura de tono de ejecución;
ajustar (108) uno o más parámetros del modelo acústico basándose en la clasificación del hablante; y
realizar (110) un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.
2. El método de la reivindicación 1 en el que la determinación de la altura de tono de ejecución incluye la determinación de una altura de tono media p_{avg}(t) en el instante t dado por:
14
en donde la suma está tomada a lo largo de un número NP de medidas de altura de tono tomadas en los instantes t_{j} durante una ventana de tiempo.
3. El método de la reivindicación 2 en el que cada una de las alturas de tono p(t_{j}) está por encima de un umbral predeterminado.
4. El método de la reivindicación 2 en el que la determinación de la altura de tono de ejecución incluye un cálculo del tipo:
15
en donde c es una constante entre 0 y 1, y p(t) es un valor actual de la altura de tono en el instante t.
5. El método de la reivindicación 1 en el que la clasificación del hablante incluye determinar la edad y/o género del hablante.
6. El método de la reivindicación 5 en el que la determinación de la edad y/o género del hablante incluye determinar si la altura de tono de ejecución está situada en una gama, en la que la gama depende de la edad y/o género del hablante.
7. El método de la reivindicación 5 en el que la determinación de la edad y/o género del hablante incluye determinar a partir de la altura de tono si el hablante es hombre, mujer o niño.
8. El método de la reivindicación 1 en el que uno o más modelos acústicos incluyen una frecuencia máxima f_{max} y una frecuencia mínima f_{min} de una batería de filtros usada en la realización del análisis de reconocimiento de voz.
9. El método de la reivindicación 8 en el que los valores de f_{max} y f_{min} son elegidos basándose en un género y/o una edad del hablante determinada durante la clasificación del hablante basada en la altura de tono de ejecución.
10. El método de la reivindicación 8 en el que los valores de f_{max} y f_{min} se eligen basándose en si el hablante es hombre, mujer o niño durante la clasificación del hablante basada en la altura de tono de ejecución.
11. El método de la reivindicación 8 en el que los valores de f_{max} y f_{min} se ajustan dinámicamente en cualquier momento durante el reconocimiento.
12. El método de la reivindicación 1 que además comprende almacenar la clasificación del hablante y/o uno o más parámetros de modelos acústicos basándose en la clasificación del hablante, y asociando la clasificación del hablante y/o uno o más parámetros del modelo acústico basándose en la clasificación del hablante con un determinado hablante.
13. El método de la reivindicación 11 que además comprende usar la clasificación del hablante almacenada y/o uno o más parámetros del modelo acústico basándose en la clasificación del hablante durante un análisis posterior de reconocimiento de voz del hablante.
14. Soporte lógico de ordenador que tiene un código de programa que, cuando es ejecutado por un ordenador, hace que el ordenador realice un método de acuerdo con cualquiera de las reivindicaciones 1 a 13.
15. Un sistema de reconocimiento de voz que comprende:
una interfaz (211) adaptada para obtener una señal de voz;
uno o más procesadores (20) acoplados a la interfaz; y
una memoria (202) acoplada a la interfaz y al procesador, teniendo la memoria incorporado en ella un conjunto de instrucciones leíbles por el procesador, configurada para realizar un método de reconocimiento de voz, incluyendo las instrucciones leíbles por el procesador:
una instrucción para obtener una señal de voz de una pronunciación de un hablante;
una instrucción para determinar una altura de tono de ejecución a partir de la señal de voz de la pronunciación;
una instrucción para clasificar el hablante basada en la altura de tono de ejecución;
una instrucción para ajustar uno o más parámetros del modelo acústico basada en una clasificación del hablante; y
una instrucción para realizar un análisis de reconocimiento de voz de la pronunciación basada en los parámetros del modelo acústico.
ES07756698T 2006-02-21 2007-02-06 Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. Active ES2327468T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US11/358,001 US7778831B2 (en) 2006-02-21 2006-02-21 Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch
US358001 2006-02-21

Publications (1)

Publication Number Publication Date
ES2327468T3 true ES2327468T3 (es) 2009-10-29

Family

ID=38043008

Family Applications (1)

Application Number Title Priority Date Filing Date
ES07756698T Active ES2327468T3 (es) 2006-02-21 2007-02-06 Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono.

Country Status (8)

Country Link
US (2) US7778831B2 (es)
EP (1) EP1979894B1 (es)
JP (1) JP4959727B2 (es)
CN (1) CN101390155B (es)
AT (1) ATE434252T1 (es)
DE (1) DE602007001338D1 (es)
ES (1) ES2327468T3 (es)
WO (1) WO2007098316A1 (es)

Families Citing this family (54)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9240188B2 (en) 2004-09-16 2016-01-19 Lena Foundation System and method for expressive language, developmental disorder, and emotion assessment
US10223934B2 (en) 2004-09-16 2019-03-05 Lena Foundation Systems and methods for expressive language, developmental disorder, and emotion assessment, and contextual feedback
US9355651B2 (en) 2004-09-16 2016-05-31 Lena Foundation System and method for expressive language, developmental disorder, and emotion assessment
US8078465B2 (en) * 2007-01-23 2011-12-13 Lena Foundation System and method for detection and analysis of speech
US8938390B2 (en) 2007-01-23 2015-01-20 Lena Foundation System and method for expressive language and developmental disorder assessment
US7778831B2 (en) * 2006-02-21 2010-08-17 Sony Computer Entertainment Inc. Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch
CN101051464A (zh) * 2006-04-06 2007-10-10 株式会社东芝 说话人认证的注册和验证方法及装置
CA2676380C (en) 2007-01-23 2015-11-24 Infoture, Inc. System and method for detection and analysis of speech
JP2009020291A (ja) * 2007-07-11 2009-01-29 Yamaha Corp 音声処理装置および通信端末装置
US20090287489A1 (en) * 2008-05-15 2009-11-19 Palm, Inc. Speech processing for plurality of users
US8442833B2 (en) * 2009-02-17 2013-05-14 Sony Computer Entertainment Inc. Speech processing with source location estimation using signals from two or more microphones
US8442829B2 (en) * 2009-02-17 2013-05-14 Sony Computer Entertainment Inc. Automatic computation streaming partition for voice recognition on multiple processors with limited memory
US8788256B2 (en) * 2009-02-17 2014-07-22 Sony Computer Entertainment Inc. Multiple language voice recognition
JP2011101110A (ja) * 2009-11-04 2011-05-19 Ricoh Co Ltd 撮像装置
US8831942B1 (en) * 2010-03-19 2014-09-09 Narus, Inc. System and method for pitch based gender identification with suspicious speaker detection
BR112013011312A2 (pt) * 2010-11-10 2019-09-24 Koninl Philips Electronics Nv método para estimar um padrão em um sinal (s) tendo um componente periódico, semiperiódico ou virtualmente periódico, dispositivo para estimar um padrão em um sinal (s) tendo um componente periódico, semiperiódico ou virtualmente periódico e programa de computador
US8756062B2 (en) * 2010-12-10 2014-06-17 General Motors Llc Male acoustic model adaptation based on language-independent female speech data
CN103282960B (zh) * 2011-01-04 2016-01-06 富士通株式会社 声音控制装置、声音控制方法以及声音控制程序
US8639508B2 (en) * 2011-02-14 2014-01-28 General Motors Llc User-specific confidence thresholds for speech recognition
US20120226500A1 (en) * 2011-03-02 2012-09-06 Sony Corporation System and method for content rendering including synthetic narration
US9224384B2 (en) * 2012-06-06 2015-12-29 Cypress Semiconductor Corporation Histogram based pre-pruning scheme for active HMMS
US9514739B2 (en) * 2012-06-06 2016-12-06 Cypress Semiconductor Corporation Phoneme score accelerator
US9105268B2 (en) * 2012-09-19 2015-08-11 24/7 Customer, Inc. Method and apparatus for predicting intent in IVR using natural language queries
US9319816B1 (en) * 2012-09-26 2016-04-19 Amazon Technologies, Inc. Characterizing environment using ultrasound pilot tones
GB2508417B (en) * 2012-11-30 2017-02-08 Toshiba Res Europe Ltd A speech processing system
KR20140079092A (ko) * 2012-12-18 2014-06-26 한국전자통신연구원 음향그룹의 전이확률을 활용한 문맥독립 성별인식 방법 및 장치
CN103236259B (zh) * 2013-03-22 2016-06-29 乐金电子研发中心(上海)有限公司 语音识别处理及反馈系统、语音回复方法
JP2015040903A (ja) * 2013-08-20 2015-03-02 ソニー株式会社 音声処理装置、音声処理方法、及び、プログラム
US20150154002A1 (en) * 2013-12-04 2015-06-04 Google Inc. User interface customization based on speaker characteristics
CN103714812A (zh) * 2013-12-23 2014-04-09 百度在线网络技术(北京)有限公司 一种语音识别方法及装置
CN104795067B (zh) 2014-01-20 2019-08-06 华为技术有限公司 语音交互方法及装置
US9412358B2 (en) 2014-05-13 2016-08-09 At&T Intellectual Property I, L.P. System and method for data-driven socially customized models for language generation
US10127927B2 (en) 2014-07-28 2018-11-13 Sony Interactive Entertainment Inc. Emotional speech processing
CN105895078A (zh) * 2015-11-26 2016-08-24 乐视致新电子科技(天津)有限公司 动态选择语音模型的语音识别方法及装置
WO2017187712A1 (ja) * 2016-04-26 2017-11-02 株式会社ソニー・インタラクティブエンタテインメント 情報処理装置
CN105895105B (zh) * 2016-06-06 2020-05-05 北京云知声信息技术有限公司 语音处理方法及装置
US9818406B1 (en) * 2016-06-23 2017-11-14 Intuit Inc. Adjusting user experience based on paralinguistic information
US10135989B1 (en) 2016-10-27 2018-11-20 Intuit Inc. Personalized support routing based on paralinguistic information
US10515632B2 (en) * 2016-11-15 2019-12-24 At&T Intellectual Property I, L.P. Asynchronous virtual assistant
US10431236B2 (en) * 2016-11-15 2019-10-01 Sphero, Inc. Dynamic pitch adjustment of inbound audio to improve speech recognition
WO2018164699A1 (en) * 2017-03-10 2018-09-13 James Jordan Rosenberg System and method for relative enhancement of vocal utterances in an acoustically cluttered environment
US10468032B2 (en) * 2017-04-10 2019-11-05 Intel Corporation Method and system of speaker recognition using context aware confidence modeling
US10331402B1 (en) * 2017-05-30 2019-06-25 Amazon Technologies, Inc. Search and knowledge base question answering for a voice user interface
US10529357B2 (en) 2017-12-07 2020-01-07 Lena Foundation Systems and methods for automatic determination of infant cry and discrimination of cry from fussiness
US10818296B2 (en) 2018-06-21 2020-10-27 Intel Corporation Method and system of robust speaker recognition activation
KR102783672B1 (ko) * 2019-06-28 2025-03-21 엘지전자 주식회사 로봇, 그와 연결되는 서버, 및 로봇을 이용한 음성 인식 방법
CN110808052A (zh) * 2019-11-12 2020-02-18 深圳市瑞讯云技术有限公司 语音识别方法、装置及电子设备
US11664033B2 (en) * 2020-06-15 2023-05-30 Samsung Electronics Co., Ltd. Electronic apparatus and controlling method thereof
US11620990B2 (en) * 2020-12-11 2023-04-04 Google Llc Adapting automated speech recognition parameters based on hotword properties
CN114974227B (zh) * 2021-02-24 2026-01-06 华为技术有限公司 语音识别及其模型训练方法
CN117083669A (zh) 2021-05-28 2023-11-17 微软技术许可有限责任公司 检测和改进单词实时误读的方法和系统
US12361936B2 (en) 2021-08-24 2025-07-15 Microsoft Technology Licensing, Llc Method and system of automated question generation for speech assistance
US12175307B2 (en) 2022-02-21 2024-12-24 Bank Of America Corporation System and method of automated processing for dynamic API generation
US20250384891A1 (en) * 2024-06-18 2025-12-18 Huawei Technologies Co., Ltd. High privacy dsp-based audio anonymization with audio segmentation and randomization

Family Cites Families (131)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
USRE33597E (en) 1982-10-15 1991-05-28 Hidden Markov model speech recognition arrangement
JPS6075898A (ja) * 1983-09-30 1985-04-30 三菱電機株式会社 単語音声認識装置
JPH0646359B2 (ja) * 1984-02-10 1994-06-15 三菱電機株式会社 単語音声認識装置
US4956865A (en) 1985-01-30 1990-09-11 Northern Telecom Limited Speech recognition
JPH01102599A (ja) 1987-10-12 1989-04-20 Internatl Business Mach Corp <Ibm> 音声認識方法
US5129002A (en) 1987-12-16 1992-07-07 Matsushita Electric Industrial Co., Ltd. Pattern recognition apparatus
JPH0293597A (ja) 1988-09-30 1990-04-04 Nippon I B M Kk 音声認識装置
JPH02273798A (ja) * 1989-04-14 1990-11-08 Sekisui Chem Co Ltd 話者認識方式
US5228087A (en) 1989-04-12 1993-07-13 Smiths Industries Public Limited Company Speech recognition apparatus and methods
US4977598A (en) 1989-04-13 1990-12-11 Texas Instruments Incorporated Efficient pruning algorithm for hidden markov model speech recognition
US5509104A (en) 1989-05-17 1996-04-16 At&T Corp. Speech recognition employing key word modeling and non-key word modeling
CA2015410C (en) 1989-05-17 1996-04-02 Chin H. Lee Speech recognition employing key word modeling and non-key word modeling
US5148489A (en) 1990-02-28 1992-09-15 Sri International Method for spectral estimation to improve noise robustness for speech recognition
US5794190A (en) 1990-04-26 1998-08-11 British Telecommunications Public Limited Company Speech pattern recognition using pattern recognizers and classifiers
US5345536A (en) 1990-12-21 1994-09-06 Matsushita Electric Industrial Co., Ltd. Method of speech recognition
US5268990A (en) 1991-01-31 1993-12-07 Sri International Method for recognizing speech using linguistically-motivated hidden Markov models
JP3050934B2 (ja) 1991-03-22 2000-06-12 株式会社東芝 音声認識方式
US5222190A (en) 1991-06-11 1993-06-22 Texas Instruments Incorporated Apparatus and method for identifying a speech pattern
JP2662120B2 (ja) 1991-10-01 1997-10-08 インターナショナル・ビジネス・マシーンズ・コーポレイション 音声認識装置および音声認識用処理ユニット
US5502790A (en) 1991-12-24 1996-03-26 Oki Electric Industry Co., Ltd. Speech recognition method and system using triphones, diphones, and phonemes
JPH05257492A (ja) 1992-03-13 1993-10-08 Toshiba Corp 音声認識方式
JPH0782348B2 (ja) 1992-03-21 1995-09-06 株式会社エイ・ティ・アール自動翻訳電話研究所 音声認識用サブワードモデル生成方法
JP2795058B2 (ja) 1992-06-03 1998-09-10 松下電器産業株式会社 時系列信号処理装置
US5455888A (en) 1992-12-04 1995-10-03 Northern Telecom Limited Speech bandwidth extension method and apparatus
JP3272842B2 (ja) 1992-12-17 2002-04-08 ゼロックス・コーポレーション プロセッサベースの判定方法
US5438630A (en) 1992-12-17 1995-08-01 Xerox Corporation Word spotting in bitmap images using word bounding boxes and hidden Markov models
US5535305A (en) 1992-12-31 1996-07-09 Apple Computer, Inc. Sub-partitioned vector quantization of probability density functions
US5473728A (en) 1993-02-24 1995-12-05 The United States Of America As Represented By The Secretary Of The Navy Training of homoscedastic hidden Markov models for automatic speech recognition
US5459798A (en) 1993-03-19 1995-10-17 Intel Corporation System and method of pattern recognition employing a multiprocessing pipelined apparatus with private pattern memory
JPH0728487A (ja) 1993-03-26 1995-01-31 Texas Instr Inc <Ti> 音声認識方法
JPH09500223A (ja) 1993-07-13 1997-01-07 ボルドー、テオドール・オースチン 多言語音声認識システム
US5627939A (en) 1993-09-03 1997-05-06 Microsoft Corporation Speech recognition system and method employing data compression
AU7802194A (en) 1993-09-30 1995-04-18 Apple Computer, Inc. Continuous reference adaptation in a pattern recognition system
US5615296A (en) 1993-11-12 1997-03-25 International Business Machines Corporation Continuous speech recognition and voice response system and method to enable conversational dialogues with microprocessors
ZA948426B (en) 1993-12-22 1995-06-30 Qualcomm Inc Distributed voice recognition system
JP2737624B2 (ja) 1993-12-27 1998-04-08 日本電気株式会社 音声認識装置
FI98162C (fi) 1994-05-30 1997-04-25 Tecnomen Oy HMM-malliin perustuva puheentunnistusmenetelmä
WO1995034884A1 (en) 1994-06-13 1995-12-21 Matsushita Electric Industrial Co., Ltd. Signal analyzer
US5825978A (en) 1994-07-18 1998-10-20 Sri International Method and apparatus for speech recognition using optimized partial mixture tying of HMM state functions
US5602960A (en) 1994-09-30 1997-02-11 Apple Computer, Inc. Continuous mandarin chinese speech recognition system having an integrated tone classifier
JP3581401B2 (ja) 1994-10-07 2004-10-27 キヤノン株式会社 音声認識方法
US5680506A (en) 1994-12-29 1997-10-21 Lucent Technologies Inc. Apparatus and method for speech signal analysis
DE19501599C1 (de) 1995-01-20 1996-05-02 Daimler Benz Ag Verfahren zur Spracherkennung
US5680510A (en) 1995-01-26 1997-10-21 Apple Computer, Inc. System and method for generating and using context dependent sub-syllable models to recognize a tonal language
US5751905A (en) * 1995-03-15 1998-05-12 International Business Machines Corporation Statistical acoustic processing method and apparatus for speech recognition using a toned phoneme system
US5617509A (en) 1995-03-29 1997-04-01 Motorola, Inc. Method, apparatus, and radio optimizing Hidden Markov Model speech recognition
US5719996A (en) 1995-06-30 1998-02-17 Motorola, Inc. Speech recognition in selective call systems
KR19990043998A (ko) 1995-08-24 1999-06-25 세모스 로버트 어니스트 빅커스 패턴인식시스템
JPH0981183A (ja) 1995-09-14 1997-03-28 Pioneer Electron Corp 音声モデルの作成方法およびこれを用いた音声認識装置
GB2305288A (en) 1995-09-15 1997-04-02 Ibm Speech recognition system
US6067520A (en) 1995-12-29 2000-05-23 Lee And Li System and method of recognizing continuous mandarin speech utilizing chinese hidden markou models
GB9602691D0 (en) 1996-02-09 1996-04-10 Canon Kk Word model generation
US5696873A (en) * 1996-03-18 1997-12-09 Advanced Micro Devices, Inc. Vocoder system and method for performing pitch estimation using an adaptive correlation sample window
US5880788A (en) 1996-03-25 1999-03-09 Interval Research Corporation Automated synchronization of video image sequences to new soundtracks
US5913193A (en) * 1996-04-30 1999-06-15 Microsoft Corporation Method and system of runtime acoustic unit selection for speech synthesis
US5937384A (en) 1996-05-01 1999-08-10 Microsoft Corporation Method and system for speech recognition using continuous density hidden Markov models
US5860062A (en) 1996-06-21 1999-01-12 Matsushita Electric Industrial Co., Ltd. Speech recognition apparatus and speech recognition method
US5963903A (en) 1996-06-28 1999-10-05 Microsoft Corporation Method and system for dynamically adjusted training for speech recognition
JP3302266B2 (ja) 1996-07-23 2002-07-15 沖電気工業株式会社 ヒドン・マルコフ・モデルの学習方法
US5835890A (en) 1996-08-02 1998-11-10 Nippon Telegraph And Telephone Corporation Method for speaker adaptation of speech models recognition scheme using the method and recording medium having the speech recognition method recorded thereon
JPH10149187A (ja) * 1996-11-19 1998-06-02 Yamaha Corp 音声情報抽出装置
JP3501199B2 (ja) * 1997-02-17 2004-03-02 日本電信電話株式会社 音響信号分離方法
US5930753A (en) 1997-03-20 1999-07-27 At&T Corp Combining frequency warping and spectral shaping in HMM based speech recognition
GB9706174D0 (en) 1997-03-25 1997-11-19 Secr Defence Recognition system
JP3033514B2 (ja) 1997-03-31 2000-04-17 日本電気株式会社 大語彙音声認識方法及び装置
US5893059A (en) 1997-04-17 1999-04-06 Nynex Science And Technology, Inc. Speech recoginition methods and apparatus
US6456965B1 (en) * 1997-05-20 2002-09-24 Texas Instruments Incorporated Multi-stage pitch and mixed voicing estimation for harmonic speech coders
US5963906A (en) 1997-05-20 1999-10-05 At & T Corp Speech recognition training
US6032116A (en) 1997-06-27 2000-02-29 Advanced Micro Devices, Inc. Distance measure in a speech recognition system for speech recognition using frequency shifting factors to compensate for input signal frequency shifts
US6009390A (en) 1997-09-11 1999-12-28 Lucent Technologies Inc. Technique for selective use of Gaussian kernels and mixture component weights of tied-mixture hidden Markov models for speech recognition
US6151573A (en) 1997-09-17 2000-11-21 Texas Instruments Incorporated Source normalization training for HMM modeling of speech
FR2769118B1 (fr) 1997-09-29 1999-12-03 Matra Communication Procede de reconnaissance de parole
FR2769117B1 (fr) 1997-09-29 2000-11-10 Matra Comm Procede d'apprentissage dans un systeme de reconnaissance de parole
US5983180A (en) 1997-10-23 1999-11-09 Softsound Limited Recognition of sequential data using finite state sequence models organized in a tree structure
US6188982B1 (en) 1997-12-01 2001-02-13 Industrial Technology Research Institute On-line background noise adaptation of parallel model combination HMM with discriminative learning using weighted HMM for noisy speech recognition
US6151574A (en) 1997-12-05 2000-11-21 Lucent Technologies Inc. Technique for adaptation of hidden markov models for speech recognition
JP2965537B2 (ja) 1997-12-10 1999-10-18 株式会社エイ・ティ・アール音声翻訳通信研究所 話者クラスタリング処理装置及び音声認識装置
US6226612B1 (en) 1998-01-30 2001-05-01 Motorola, Inc. Method of evaluating an utterance in a speech recognition system
US6148284A (en) 1998-02-23 2000-11-14 At&T Corporation Method and apparatus for automatic speech recognition using Markov processes on curves
JP3412496B2 (ja) 1998-02-25 2003-06-03 三菱電機株式会社 話者適応化装置と音声認識装置
US6112175A (en) 1998-03-02 2000-08-29 Lucent Technologies Inc. Speaker adaptation using discriminative linear regression on time-varying mean parameters in trended HMM
JP2986792B2 (ja) 1998-03-16 1999-12-06 株式会社エイ・ティ・アール音声翻訳通信研究所 話者正規化処理装置及び音声認識装置
ATE235733T1 (de) 1998-05-11 2003-04-15 Siemens Ag Anordnung und verfahren zur erkennung eines vorgegebenen wortschatzes in gesprochener sprache durch einen rechner
US6832190B1 (en) 1998-05-11 2004-12-14 Siemens Aktiengesellschaft Method and array for introducing temporal correlation in hidden markov models for speech recognition
JP3156668B2 (ja) 1998-06-19 2001-04-16 日本電気株式会社 音声認識装置
US6980952B1 (en) 1998-08-15 2005-12-27 Texas Instruments Incorporated Source normalization training for HMM modeling of speech
US6138095A (en) 1998-09-03 2000-10-24 Lucent Technologies Inc. Speech recognition
JP3000999B1 (ja) 1998-09-08 2000-01-17 セイコーエプソン株式会社 音声認識方法および音声認識装置ならびに音声認識処理プログラムを記録した記録媒体
DE69939124D1 (de) 1998-09-09 2008-08-28 Asahi Chemical Ind Spracherkenner und spracherkennungsverfahren
US6766288B1 (en) * 1998-10-29 2004-07-20 Paul Reed Smith Guitars Fast find fundamental method
US6292776B1 (en) 1999-03-12 2001-09-18 Lucent Technologies Inc. Hierarchial subband linear predictive cepstral features for HMM-based speech recognition
GB2348035B (en) 1999-03-19 2003-05-28 Ibm Speech recognition system
US6526380B1 (en) 1999-03-26 2003-02-25 Koninklijke Philips Electronics N.V. Speech recognition system having parallel large vocabulary recognition engines
US7058573B1 (en) * 1999-04-20 2006-06-06 Nuance Communications Inc. Speech recognition system to selectively utilize different speech recognition techniques over multiple speech recognition passes
US6405168B1 (en) 1999-09-30 2002-06-11 Conexant Systems, Inc. Speaker dependent speech recognition training using simplified hidden markov modeling and robust end-point detection
JP3632529B2 (ja) 1999-10-26 2005-03-23 日本電気株式会社 音声認識装置及び方法ならびに記録媒体
CN1141698C (zh) 1999-10-29 2004-03-10 松下电器产业株式会社 对输入语音进行语音识别的音程标准化装置
US6442519B1 (en) * 1999-11-10 2002-08-27 International Business Machines Corp. Speaker model adaptation via network of similar users
US6829578B1 (en) * 1999-11-11 2004-12-07 Koninklijke Philips Electronics, N.V. Tone features for speech recognition
JP3814459B2 (ja) 2000-03-31 2006-08-30 キヤノン株式会社 音声認識方法及び装置と記憶媒体
US6629073B1 (en) 2000-04-27 2003-09-30 Microsoft Corporation Speech recognition method and apparatus utilizing multi-unit models
US7272561B2 (en) * 2000-07-13 2007-09-18 Asahi Kasei Kabushiki Kaisha Speech recognition device and speech recognition method
US6671669B1 (en) 2000-07-18 2003-12-30 Qualcomm Incorporated combined engine system and method for voice recognition
TW473704B (en) 2000-08-30 2002-01-21 Ind Tech Res Inst Adaptive voice recognition method with noise compensation
DE10043946C2 (de) 2000-09-06 2002-12-12 Siemens Ag Komprimieren von HMM-Prototypen
JP3932789B2 (ja) 2000-09-20 2007-06-20 セイコーエプソン株式会社 Hmmの出力確率計算方法および音声認識装置
US6681207B2 (en) 2001-01-12 2004-01-20 Qualcomm Incorporated System and method for lossy compression of voice recognition models
US20020169604A1 (en) * 2001-03-09 2002-11-14 Damiba Bertrand A. System, method and computer program product for genre-based grammars and acoustic models in a speech recognition framework
JP2002366187A (ja) 2001-06-08 2002-12-20 Sony Corp 音声認識装置および音声認識方法、並びにプログラムおよび記録媒体
US6701293B2 (en) * 2001-06-13 2004-03-02 Intel Corporation Combining N-best lists from multiple speech recognizers
US6493668B1 (en) * 2001-06-15 2002-12-10 Yigal Brandman Speech feature extraction system
JP2003066991A (ja) * 2001-08-22 2003-03-05 Seiko Epson Corp 音声認識結果出力方法および音声認識結果出力装置ならびに音声認識結果出力処理プログラムを記録した記録媒体
CA2359544A1 (en) 2001-10-22 2003-04-22 Dspfactory Ltd. Low-resource real-time speech recognition system using an oversampled filterbank
US6721699B2 (en) * 2001-11-12 2004-04-13 Intel Corporation Method and system of Chinese speech pitch extraction
US20030220788A1 (en) * 2001-12-17 2003-11-27 Xl8 Systems, Inc. System and method for speech recognition and transcription
JP2005227794A (ja) * 2002-11-21 2005-08-25 Matsushita Electric Ind Co Ltd 標準モデル作成装置及び標準モデル作成方法
US7133535B2 (en) 2002-12-21 2006-11-07 Microsoft Corp. System and method for real time lip synchronization
JP2004297273A (ja) * 2003-03-26 2004-10-21 Kenwood Corp 音声信号雑音除去装置、音声信号雑音除去方法及びプログラム
US7389230B1 (en) * 2003-04-22 2008-06-17 International Business Machines Corporation System and method for classification of voice signals
US7499857B2 (en) * 2003-05-15 2009-03-03 Microsoft Corporation Adaptation of compressed acoustic models
KR100511248B1 (ko) * 2003-06-13 2005-08-31 홍광석 음성인식에서 화자 내 정규화를 위한 진폭 변경 방법
US7328154B2 (en) 2003-08-13 2008-02-05 Matsushita Electrical Industrial Co., Ltd. Bubble splitting for compact acoustic modeling
US20050065789A1 (en) 2003-09-23 2005-03-24 Sherif Yacoub System and method with automated speech recognition engines
JP2005164988A (ja) * 2003-12-03 2005-06-23 Xanavi Informatics Corp 周波数切替装置および情報処理装置
JP2005173008A (ja) * 2003-12-09 2005-06-30 Canon Inc 音声解析処理およびそれを用いた音声処理装置および媒体
JP2005215888A (ja) * 2004-01-28 2005-08-11 Yasunori Kobori テキスト文の表示装置
EP1723636A1 (de) * 2004-03-12 2006-11-22 Siemens Aktiengesellschaft Benutzer- und vokabularadaptive bestimmung von konfidenz- und rückweisungsschwellen
US7844045B2 (en) 2004-06-16 2010-11-30 Panasonic Corporation Intelligent call routing and call supervision method for call centers
KR100655491B1 (ko) * 2004-12-21 2006-12-11 한국전자통신연구원 음성인식 시스템에서의 2단계 발화 검증 방법 및 장치
US7970613B2 (en) 2005-11-12 2011-06-28 Sony Computer Entertainment Inc. Method and system for Gaussian probability data bit reduction and computation
US7778831B2 (en) * 2006-02-21 2010-08-17 Sony Computer Entertainment Inc. Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch

Also Published As

Publication number Publication date
CN101390155B (zh) 2012-08-15
EP1979894A1 (en) 2008-10-15
JP2009527801A (ja) 2009-07-30
JP4959727B2 (ja) 2012-06-27
US20070198263A1 (en) 2007-08-23
DE602007001338D1 (de) 2009-07-30
US8050922B2 (en) 2011-11-01
EP1979894B1 (en) 2009-06-17
WO2007098316A1 (en) 2007-08-30
US7778831B2 (en) 2010-08-17
US20100324898A1 (en) 2010-12-23
CN101390155A (zh) 2009-03-18
ATE434252T1 (de) 2009-07-15

Similar Documents

Publication Publication Date Title
ES2327468T3 (es) Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono.
ES2311872T3 (es) Sistema y procedimiento de reconocimiento vocal automatico.
CN109545243B (zh) 发音质量评价方法、装置、电子设备及存储介质
CN107610717B (zh) 基于语音后验概率的多对一语音转换方法
Justin et al. Speaker de-identification using diphone recognition and speech synthesis
US20110218802A1 (en) Continuous Speech Recognition
Stuttle A Gaussian mixture model spectral representation for speech recognition
Sajjan et al. Continuous Speech Recognition of Kannada language using triphone modeling
Vlasenko et al. Vowels formants analysis allows straightforward detection of high arousal emotions
Dey et al. Mizo phone recognition system
Maseri et al. Performance analysis of implemented MFCC and HMM-based speech recognition system
Kumar et al. Development of speaker-independent automatic speech recognition system for Kannada language
Bhable et al. Automatic speech recognition (ASR) of isolated words in Hindi low resource language
JP5007401B2 (ja) 発音評定装置、およびプログラム
Yavuz et al. A phoneme-based approach for eliminating out-of-vocabulary problem of Turkish speech recognition using Hidden Markov Model.
US20100305948A1 (en) Phoneme Model for Speech Recognition
JP4753412B2 (ja) 発音評定装置、およびプログラム
JP2007316330A (ja) 韻律識別装置及び方法、並びに音声認識装置及び方法
Dalva Automatic speech recognition system for Turkish spoken language
Pasricha et al. Hybrid architecture for robust speech recognition system
Do et al. Development of high-performance and large-scale vietnamese automatic speech recognition systems
Prasad et al. Gender based emotion recognition system for telugu rural dialects using hidden markov models
Kurian et al. Automated Transcription System for Malayalam Language
Abida Fuzzy gmm-based confidence measure towards keywords spotting application
Kayte Marathi speech recognition system using hidden Markov model toolkit