ES2327468T3 - Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. - Google Patents
Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. Download PDFInfo
- Publication number
- ES2327468T3 ES2327468T3 ES07756698T ES07756698T ES2327468T3 ES 2327468 T3 ES2327468 T3 ES 2327468T3 ES 07756698 T ES07756698 T ES 07756698T ES 07756698 T ES07756698 T ES 07756698T ES 2327468 T3 ES2327468 T3 ES 2327468T3
- Authority
- ES
- Spain
- Prior art keywords
- speaker
- pitch
- classification
- height
- voice
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 230000006978 adaptation Effects 0.000 title description 2
- 238000000034 method Methods 0.000 claims abstract description 31
- 238000004458 analytical method Methods 0.000 claims description 22
- 238000005259 measurement Methods 0.000 claims 1
- 238000012545 processing Methods 0.000 abstract description 4
- 230000006870 function Effects 0.000 description 20
- 239000013598 vector Substances 0.000 description 10
- 238000001228 spectrum Methods 0.000 description 8
- 238000010606 normalization Methods 0.000 description 6
- 230000003595 spectral effect Effects 0.000 description 5
- 239000011159 matrix material Substances 0.000 description 4
- 230000002093 peripheral effect Effects 0.000 description 4
- 238000005070 sampling Methods 0.000 description 4
- 230000009466 transformation Effects 0.000 description 4
- 230000001755 vocal effect Effects 0.000 description 3
- 238000001914 filtration Methods 0.000 description 2
- 230000003993 interaction Effects 0.000 description 2
- 238000013179 statistical model Methods 0.000 description 2
- 230000002123 temporal effect Effects 0.000 description 2
- 238000012549 training Methods 0.000 description 2
- 238000012546 transfer Methods 0.000 description 2
- 241000699666 Mus <mouse, genus> Species 0.000 description 1
- 241000699670 Mus sp. Species 0.000 description 1
- 230000004075 alteration Effects 0.000 description 1
- 230000002238 attenuated effect Effects 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 230000006835 compression Effects 0.000 description 1
- 238000007906 compression Methods 0.000 description 1
- 238000011161 development Methods 0.000 description 1
- 238000010586 diagram Methods 0.000 description 1
- 238000005315 distribution function Methods 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 230000000977 initiatory effect Effects 0.000 description 1
- 238000007726 management method Methods 0.000 description 1
- 238000012986 modification Methods 0.000 description 1
- 230000004048 modification Effects 0.000 description 1
- 230000010287 polarization Effects 0.000 description 1
- 238000002360 preparation method Methods 0.000 description 1
- 238000007619 statistical method Methods 0.000 description 1
- 238000013518 transcription Methods 0.000 description 1
- 230000035897 transcription Effects 0.000 description 1
- 230000007704 transition Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
- G10L15/065—Adaptation
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L17/00—Speaker identification or verification techniques
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/90—Pitch determination of speech signals
Landscapes
- Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Computational Linguistics (AREA)
- Artificial Intelligence (AREA)
- Complex Calculations (AREA)
- Telephonic Communication Services (AREA)
- Electrically Operated Instructional Devices (AREA)
- Circuit For Audible Band Transducer (AREA)
- Image Analysis (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
- User Interface Of Digital Computer (AREA)
- Circuits Of Receivers In General (AREA)
Abstract
Un método de reconocimiento de voz, comprendiendo el método: obtener (102) una señal de voz de una pronunciación de un hablante; determinar (104) una altura de tono de ejecución de la señal de la pronunciación; clasificar (106) el hablante basándose en la altura de tono de ejecución; ajustar (108) uno o más parámetros del modelo acústico basándose en la clasificación del hablante; y realizar (110) un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.
Description
Reconocimiento de voz con adaptación del
hablante basándose en la clasificación del tono.
Esta aplicación se refiere al reconocimiento de
voz y más específicamente a los sistemas de reconocimiento de voz
que se adaptan a hablantes basándose en la altura de tono.
Las tecnologías de reconocimiento de voz y habla
permiten que los ordenadores y otros dispositivos electrónicos
equipados con una fuente de entrada de sonido, tal como un
micrófono, interpretar el habla humana, por ejemplo para
transcripción o como un método alternativo de interacción con un
ordenador. Se están desarrollando soportes lógicos de
reconocimiento de habla para uso en dispositivos electrónicos de
consumo tales como teléfonos móviles, consolas para juegos,
ordenadores personales y asistentes digitales personales. En un
algoritmo típico de reconocimiento de habla, una señal de dominio
de tiempo que representa el habla humana es partida en varias
ventanas de tiempo y cada ventana es convertida en una señal de
dominio de frecuencia, por ejemplo por la transformación rápida de
Fourier (FFT). Esta señal de frecuencia o de dominio espectral es
comprimida a continuación tomando un logaritmo de la señal de
dominio espectral y después realizando otra FFT. Del espectro
comprimido (denominado también un cepstrum), se puede usar un
modelo estadístico para determinar los fenómenos y el contexto
dentro del habla representado por la señal. El cepstrum puede ser
visto como información sobre la tasa de cambio de las diferentes
bandas espectrales dentro de la señal de habla. Para aplicaciones de
reconocimiento de habla el espectro es usualmente transformado
primero usando las bandas de Frecuencia Mel. El resultado se
denomina los Coeficientes Cepstral de Frecuencia Mel o MFCCs. Una
frecuencia f en hercios (ciclos por segundo) puede convertirse en
una frecuencia mel m de acuerdo con: m=(1127,01048
Hz)log_{e}(1+f/700). Igualmente una
frecuencia mel m puede convertirse en una frecuencia f
en hercios usando f=(700
Hz)(e^{m/1127,01048}-1).
En el reconocimiento de voz el espectro es a
menudo filtrado usando un conjunto de funciones de filtro de forma
triangular. Las funciones de filtro dividen el espectro en un
conjunto de bandas que se solapan parcialmente y que se encuentran
entre una frecuencia mínima f_{min} y una frecuencia máxima
f_{max}. Cada función de filtro está centrada en una
determinada frecuencia dentro de una gama de frecuencias de interés.
Cuando se ha convertido a la escala de frecuencias mel cada función
de filtro puede ser expresada como un conjunto de baterías de
filtros mel, en donde cada batería de filtros MFB está dada por:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
en donde el índice i se refiere al
número de batería de filtros y mf_{min} y
mf_{max} son las frecuencias mel que corresponden a
f_{min} y
f_{max}.
La elección de f_{min} y
f_{max} determina las baterías de filtros que son usadas
por un algoritmo de reconocimiento de voz. Típicamente,
f_{min} y f_{max} son fijadas por el modelo de
reconocimiento de voz que se está usando. Un problema con el
reconocimiento de voz es que los diferentes hablantes pueden tener
longitudes diferentes del tracto vocal y producir señales de voz con
las correspondientes gamas de frecuencia diferentes. Para compensar
lo anterior, los sistemas de reconocimiento de voz pueden realizar
una normalización del tracto vocal de la señal de voz antes del
filtrado. A modo de ejemplo, la normalización puede usar una función
del tipo:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
en donde f' es la frecuencia
normalizada y \alpha es un parámetro que ajusta una curvatura de
la función de
normalización.
Los componentes de una señal de habla que tiene
N bandas diferentes de frecuencia mel pueden ser representados como
un vector A que tiene N componentes. Cada componente del vector A es
un coeficiente de frecuencia mel de la señal de habla. La
normalización del vector A típicamente implica una matriz de
transformación del tipo:
\newpage
F'=[M]\cdotF+B, en donde [M] es una
matriz NxN dada por:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
y B es un vector de polarización
dado
por:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
F' y F son vectores de la forma:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
en donde los coeficientes M_{ij} de la
matriz y los componentes B_{i} del vector se calculan fuera
de línea para maximizar la probabilidad de una secuencia de habla
observada en un sistema HMM. Usualmente, para una trama dada y una
característica dada F', la probabilidad observada es la calculada
por una función Gaussiana:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
Cada componente del vector normalizado F' es un
componente de la frecuencia mel de la señal de habla.
Se sabe que los hablantes hombre y mujer
producen señales de voz caracterizadas por coeficientes de
frecuencia mel diferentes (MFCC). En la técnica anterior, los
sistemas de reconocimiento de voz han realizado un entrenamiento
para diferenciar si el hablante es hombre o mujer y ajustar el
modelo acústico usado en el reconocimiento de voz basado en si el
hablante es hombre o mujer. Típicamente, el modelo acústico se
ensaya haciendo que un número, por ejemplo 10, de hablantes hombre
y un número igual de hablantes mujer digan las mismas palabras para
producir muestras de voz. Los análisis de características basados en
muestras de voz dicen las mismas palabras para producir muestras de
voces. Los análisis de características basados en muestras de voz se
combinan conjuntamente en un supermodelo de reconocimiento de
voz.
Una desventaja importante de la normalización
anterior es que el vector F puede tener hasta 40 componentes. Por
lo tanto, la matriz [M] podría tener hasta 1.600 coeficientes. El
cálculo de un número tan alto de coeficientes puede emplear mucho
tiempo para adaptar el algoritmo de reconocimiento de voz.
Además, como los sistemas y métodos de
reconocimiento de voz de la técnica anterior usan valores fijos de
f_{min}, f_{max}, mf_{min} y
mf_{max} para filtrado y normalización, no tienen en cuenta
adecuadamente las variaciones en la longitud del tracto vocal entre
hablantes. Por lo tanto, la precisión en el reconocimiento de habla
puede ser menor que la óptima. Por tanto, existe la necesidad de
sistemas y métodos de reconocimiento de voz que superen tales
desventajas.
Posteriores disposiciones de la técnica anterior
se discuten en el documento
EP-A-0.866.442, la ponencia
"Normalización de hablantes usando los procedimientos eficientes
de distorsión de frecuencia", Li Lee y otros, Proc 1996 IEEE
Conferencia Internacional sobre procedimientos de Acústica, Habla y
Señales, vol 1, Conf 21, páginas 353-356, y la
ponencia "Normalización de hablantes basada en establecimiento de
escalas no uniformes", Proc 2002 IEEE Conferencia Internacional
sobre Procedimientos de Acústica, Habla y Señales, vol 4, páginas
1-589.
Los diferentes aspectos referentes al invento
están definidos en las reivindicaciones que se acompañan.
Las desventajas asociadas con la técnica
anterior están superadas, o al menos atenuadas por realizaciones
del presente invento dirigidas a métodos y sistemas de
reconocimiento de voz. De acuerdo con realizaciones del invento se
obtiene una señal de voz a partir de una pronunciación de un
hablante. Se determina una altura de tono de ejecución a partir de
la señal de voz de la pronunciación. El hablante es clasificado
basándose en la altura de tono de ejecución y se ajustan uno o más
parámetros de modelos acústicos basándose en una clasificación del
hablante. A continuación se realiza un análisis de reconocimiento de
voz de la pronunciación basándose en los parámetros del modelo
acústico.
A continuación se describen las realizaciones
del invento, solamente a modo de ejemplo, haciendo referencia a los
dibujos que se acompañan, en los que:
la Figura 1 es un diagrama de flujos que ilustra
un algoritmo de reconocimiento de voz de acuerdo con una
realización del presente invento,
la Figura 2 es un diagrama de bloques que
ilustra un sistema de reconocimiento de voz de acuerdo con una
realización del presente invento.
Aunque la descripción detallada que sigue
contiene muchos detalles específicos para los fines de ilustración,
cualquier persona con un conocimiento normal de la técnica observará
que muchas variaciones y alteraciones en los siguientes detalles
están dentro del alcance del invento. Por lo tanto, las
realizaciones del invento que se describen más adelante se exponen
sin ninguna pérdida de generalidad a, y sin imponer limitaciones
sobre, el invento reivindicado.
De acuerdo con una realización del presente
invento, un método de reconocimiento de voz 100 puede seguir su
curso como está ilustrado en la Figura 1A. En 102, se obtiene una
señal de voz a partir de una pronunciación de un hablante. La señal
de voz puede ser obtenida de cualquier forma convencional, por
ejemplo usando un micrófono y un codificador digital de la forma de
la onda para poner la señal de voz en formato digital. La señal de
voz puede obtenerse por sobremuestreo de la señal de voz en una
frecuencia de muestreo que es mayor que la frecuencia de análisis
de una característica de trabajo. En particular, la frecuencia de
muestreo puede ser mayor que la tasa de muestreo de habla durante
un tiempo de ensayo. A modo de ejemplo, y sin limitación, si la
señal de voz está caracterizada por una frecuencia de análisis de
característica de trabajo de 12 kilohercios, la señal puede ser
muestreada a una frecuencia de muestreo de, por ejemplo,
16-22 kilohercios.
En 104, se determina un valor de altura de tono
de ejecución p_{run} de la pronunciación. Existen varias
formas de determinar la altura de tono de ejecución
p_{run}. Por ejemplo, p_{run} puede ser una
altura de tono media móvil p_{avg}(t) que puede ser
calculada a lo largo de una ventana de tiempo dada que incluye el
tiempo t por:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
en donde la suma se realiza sobre una cantidad
de NP medidas de altura de tono tomadas en los momentos
t_{i} = {t-(NP-1),
t-(NP-2), ..., t} durante la ventana de tiempo para
probabilidades de altura de tono por encima de un umbral
predeterminado. Una forma sencilla de calcular la probabilidad de
altura de tono es
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
donde
\vskip1.000000\baselineskip
es la correlación de la señal de
habla de análisis. Alternativamente, la altura de tono de ejecución
p_{run} puede estar relacionada con la altura de tono
actual, por ejemplo,
por:
en donde c es una constante entre 0 y 1 y
p(t) es un valor actual de la altura de tono en el
momento t. El valor de la constante c está relacionado con
el tamaño de la ventana. Por ejemplo, un valor de c=0
corresponde a no ventana (en cuyo caso p_{run}(t)=
p(t)) y un valor de c=1 corresponde con una
ventana infinita (en cuyo caso
p_{run}(t)=p(t-1)).
Adviértase que para valores de t>0, los valores de altura de tono
para momentos anteriores a t contribuyen al valor de la
altura de tono p_{run}(t). Esto puede ser ilustrado
con un ejemplo numérico en el que c=0,6. En tal caso, la
ecuación 2 da:
\vskip1.000000\baselineskip
En algunas realizaciones del invento
p_{run}(t) puede ser calculado de acuerdo con la
Ecuación 2 si la probabilidad de altura de tono está por encima de
algún umbral, por ejemplo, por encima de aproximadamente 0,4.
A modo de ejemplo, la clasificación del hablante
realizada en 106 de la Figura 1A puede estar basada en la edad del
hablante y/o en el género. Por ejemplo, a partir de los datos de
entrenamiento se puede determinar que la altura de tono media de
hombres, mujeres y niños se encuentra en diferentes gamas. El
hablante puede ser clasificado a partir de la gama en la que se
encuentra la altura de tono actual de la señal de voz. A modo de
ejemplo, un hablante varón adulto tiene una altura de tono media
entre aproximadamente 120 Hz y aproximadamente 160 Hz, un hablante
hembra adulto tiene una altura de tono media entre aproximadamente
180 Hz y aproximadamente 220 Hz, y un hablante niño tiene una
altura de tono media mayor de 220 Hz. Si la altura de tono actual es
190 Hz, el hablante sería clasificado como un hablante hembra. En
algunos casos la altura de tono media de un hablante puede estar
incluida como una característica en el vector F.
Una vez que el hablante ha sido clasificado, los
parámetros del modelo acústico pueden ser seleccionados de acuerdo
con lo indicado en 108. Estos parámetros se usan después en un
análisis de reconocimiento de voz en 110. La elección de parámetros
depende del tipo de modelo acústico usado en el análisis de
reconocimiento de voz. Por ejemplo, el análisis de reconocimiento
de voz puede filtrar la señal de voz usando un conjunto de
funciones de filtro. Las funciones de filtro, por ejemplo las
funciones de filtro de forma triangular, dividen el espectro en un
conjunto de bandas que se solapan parcialmente. Cada análisis de
reconocimiento de voz usa una batería de filtros definida por una
frecuencia máxima f_{max} diferente y una frecuencia
mínima f_{min} diferente. Las f_{max} y
f_{min} pueden ser frecuencias en la escala de Hertz o
alturas de tono en la escala mel. La frecuencia máxima
f_{max} se refiere a un límite superior de la gama de
frecuencias de la batería de filtros, y la frecuencia mínima
f_{min} se refiere a un límite inferior de la gama de
frecuencias de la batería de filtros. Los valores de los parámetros
f_{max} y f_{min} pueden ajustarse dinámicamente
en cualquier momento durante el análisis de reconocimiento de voz,
por ejemplo, para cualquier ventana de tiempo durante el análisis de
reconocimiento de voz. El análisis de reconocimiento de voz produce
una probabilidad de reconocimiento P, de reconocimiento de
una o más unidades de habla. Las unidades de habla pueden ser
frases, palabras, o subunidades de palabras, tales como
fonemas.
A modo de ejemplo, una vez que el hablante ha
sido clasificado como un varón, hembra o niño, los valores de
f_{max} y f_{min} para análisis de reconocimiento
de voz de la pronunciación pueden ser por lo tanto seleccionados.
Por ejemplo, si se acepta que el hablante es un hombre,
f_{max} puede ser aproximadamente 70 Hz y f_{min}
puede ser aproximadamente 3.800 Hz. Si se supone que el hablante es
una mujer, f_{max} puede ser aproximadamente 70 Hz y
f_{min} puede ser aproximadamente 4.200 Hz. Si se supone
que el hablante es un niño, f_{max} puede ser
aproximadamente 90 Hz y f_{min} puede ser aproximadamente
4.400 Hz.
En 110, una probabilidad P de
reconocimiento procede de un análisis de voz de la pronunciación
basado en los parámetros del modelo de ajuste. A modo de ejemplo, y
sin pérdida de generalidad, el análisis de reconocimiento de voz
puede usar un Modelo de Markov Hidden (HMM) para determinar las
unidades de habla en una señal de voz dada. Las unidades de habla
pueden ser palabras, combinaciones de dos palabras o unidades de
subpalabras y similares. El HMM puede estar caracterizado por:
L, que representa varios posibles estados del
sistema;
M, que representa el número total de Gaussianos
que existen en el sistema;
N, que representa el número de características
distintas observables en un instante dado; pudiendo estas
características ser espectrales (por ejemplo, dominio de
frecuencia) o temporal (dominio de tiempo) de la señal del
habla;
A={a_{ij}}, una distribución de probabilidad
de transición de estado, en la que cada a_{ij} representa la
probabilidad de que el sistema pase del estado j^{th} en el
instante t+1 si el sistema está inicialmente en el estado j^{th}
en el instante t;
B={b_{j}(k)}, una distribución de
probabilidad de característica de observación del estado j^{th},
en el que cada b_{j}(k) representa la distribución de
probabilidad de los valores observados de la característica
k^{th} cuando el sistema está en el estado j^{th}; y
\pi={\pi_{j}}, una distribución de estados
iniciales, en donde cada componente \pi_{j} representa la
probabilidad de que el sistema esté en el estado j^{th} en algún
momento inicial.
Los Modelos Markov Hidden pueden aplicarse a la
señal de voz para resolver uno o más problemas básicos, que
incluyen: (1) la probabilidad de una secuencia dada de observaciones
obtenidas de la señal de voz; (2) dada la secuencia de
observaciones, qué secuencia de estado correspondiente explica mejor
la secuencia de observaciones; y (3) cómo ajustar el conjunto de
parámetros modelo A, B, \pi para maximizar la probabilidad de una
secuencia de observaciones dada.
La aplicación de HMMs para el reconocimiento de
habla es descrita con detalle, por ejemplo, por Lawrence Rabiner en
"Un curso de enseñanza sobre modelos de Markov Hidden y en
Aplicaciones Seleccionadas sobre Reconocimiento de Habla" en las
Actas del IEEE, Vol 77, Nº 2, 2 de febrero de 1989.
Los análisis de reconocimiento de habla
realizados en 110 pueden caracterizar el habla mediante varios
patrones reconocibles conocidos como fonemas. Cada uno de estos
fonemas puede ser dividido en varias partes, por ejemplo, una parte
inicial, media y final. Se ha observado que la parte media es
típicamente la más estable ya que la parte inicial está a menudo
afectada por el fonema anterior y la parte final está afectada por
el fonema que sigue. Las diferentes partes de los fonemas están
caracterizadas por características de dominio de frecuencia que
pueden ser reconocidas por un análisis estadístico apropiado de la
señal. El modelo estadístico usa a menudo funciones de distribución
de probabilidad Gaussianas para predecir la probabilidad de cada
estado diferente de las características que constituyen partes de
la señal correspondientes a las diferentes partes de los diferentes
fonemas. Un estado HMM puede contener uno o más Gaussianos. Un
Gaussiano determinado para un estado posible dado, por ejemplo, el
Gaussiano k^{th} puede ser representado por un conjunto de N
valores medios \mu_{ki} y por las varianzas \sigma_{ki}. En
un algoritmo de reconocimiento de habla típico uno determina cuál
de los Gaussianos para una ventana de tiempo dada es el mayor. A
partir del Gaussiano mayor se puede deducir el fonema más probable
para la ventana de tiempo.
A modo de ejemplo, el análisis de reconocimiento
de voz en 110 puede analizar una señal de dominio de tiempo para
obtener N características de señal observables diferentes
x_{0}...x_{n}, en donde n=N-1. La
característica observada del sistema puede ser representada como un
vector que tiene los componentes x_{0}...x_{n}.
Estos componentes pueden ser características espectrales,
cepstrales, o temporales de un señal de habla observada dada.
A modo de ejemplo, y sin limitación de las
realizaciones del invento, los componentes
x_{0}...x_{n} pueden ser coeficientes cepstrales
de frecuencia mel (MFFCs) de la señal de voz obtenida en 102. Un
cepstrum es el resultado de tomar la transformación de Fourier (FT)
del espectro de decibelios como si fuera una señal. El cepstrum de
una señal de habla del dominio de tiempo puede ser definido
verbalmente como la transformada de Fourier del log (con fase no
desarrollada) de la transformación de Fourier de la señal del
dominio de tiempo. El cepstrum de una señal del dominio de tiempo
S(t) puede representarse matemáticamente como
FT(log(FT(S(t)))+j2\piq), en donde q
es el entero necesario para desarrollar apropiadamente el ángulo o
parte imaginaria de la función logarítmica compleja.
Algorítmicamente, el cepstrum puede ser generado por la secuencia de
operaciones: señal -> FT -> log -> desarrollo de fase
-> FT -> cepstrum.
Hay un cepstrum complejo y un cepstrum real. El
cepstrum real usa la función logarítmica definida de valores
reales, mientras que el cepstrum complejo usa la función logarítmica
definida de valores complejos también. El cepstrum complejo
contiene información sobre la magnitud y fase del espectro inicial,
que permite la reconstrucción de la señal. El cepstrum real
solamente usa la información de la magnitud del espectro. A modo de
ejemplo, y sin pérdida de generalidad, el análisis de
reconocimiento de voz realizado en 110 puede usar el cepstrum
real.
\newpage
Ciertos patrones de combinaciones de componentes
x_{0}...x_{n} corresponden a unidades de habla
(por ejemplo palabras o frases) o a subunidades, tales como sílabas,
fonemas u otras subunidades de palabras. Cada unidad o subunidad
puede ser considerada como un estado del sistema. La función de
densidad de probabilidad
f_{k}(x_{0}...x_{n}) de un Gaussiano dado
del sistema (el Gaussiano k^{th}) puede ser cualquier tipo de
función de densidad de probabilidad
f_{k}(x_{0}...x_{n}), por ejemplo una
función Gaussiana que tenga la siguiente forma:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
en donde
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
En las ecuaciones anteriores "i" es un
índice de característica y "k" es un índice de Gaussiano. En la
ecuación (1) el subíndice k es un índice de la función Gaussiana.
Puede haber de varios cientos a varios cientos de miles de
Gaussianos usados por el algoritmo de reconocimiento de habla. La
cantidad \mu_{ki} es un valor medio de la característica
x_{i} en el Gaussiano k^{th} del sistema. La
cantidad \sigma_{ki}^{2} es la varianza de x_{i} en
el Gaussiano k^{th}. Uno o más Gaussianos pueden estar
asociados con uno o más estados diferentes. Por ejemplo, puede
haber L estados diferentes que contienen un número total de M
Gaussianos en el sistema. La cantidad \mu_{ki} es la media de
todas las medidas de x_{i} que pertenecen a
f_{k}(x_{0}...x_{N}) a lo largo de todas
las ventanas de tiempo de datos de preparación y \sigma_{ki} es
la varianza de las medidas correspondientes usadas para calcular
\mu_{ki}.
La probabilidad de que cada Gaussiano pueda ser
calculado por la ecuación (1) para dar una probabilidad de
reconocimiento correspondiente es P_{r'}. A partir del
Gaussiano que tiene la probabilidad máxima uno puede construir un
estado, palabra, fonema, carácter, etc más probable para esa
determinada ventana de tiempo. Se debe observar que también es
posible usar el estado más probable de una ventana de tiempo dada
para ayudar a determinar el estado más probable de las ventanas de
tiempo anteriores o posteriores, ya que éstas pueden determinar un
contexto en el que ocurre el estado.
De acuerdo con realizaciones del presente
invento, un método de reconocimiento (por ejemplo un método de
reconocimiento de voz) del tipo representado en la Figura 1A o
Figura 1B que funciona como se ha descrito antes puede ser
realizado como parte de un aparato 200 de procesamiento de señal,
como se ha representado en la Figura 2. El sistema 200 puede
incluir un procesador 202 y una memoria 202 (por ejemplo RAM, DRAM,
ROM, y similares). Además, el aparato de procesamiento de la señal
200 puede tener muchos procesadores 201 si se tiene que realizar un
procesamiento paralelo. La memoria 202 incluye datos y códigos
configurados como se ha descrito anteriormente. Específicamente, la
memoria incluye datos que representan características 204 de la
señal, y funciones de probabilidad 206, cada una de las cuales
puede incluir códigos, datos o alguna combinación de códigos y
datos.
El aparato 200 puede también incluir funciones
de soporte bien conocidas 210, tal como los elementos entrada/salida
(I/O) 211, suministros de potencia (P/S) 212, un reloj (CLK) 213 y
memoria oculta 214. El aparato 200 puede opcionalmente incluir un
dispositivo de almacenamiento masivo 215 tal como una unidad de
disco, unidad de CD-ROM, unidad de cinta, o similar
para almacenar programas y/o datos. El controlador puede también
incluir opcionalmente una unidad de visualización 216 y una unidad
de interfaz de usuario 218 para facilitar la interacción entre el
controlador 200 y un usuario. La unidad de visualización 216 puede
estar en la forma de un tubo de rayos catódicos (CRT) o de pantalla
de panel plano que visualiza texto, números, símbolos gráficos o
imágenes. La interfaz de usuario 218 puede incluir un teclado, un
ratón, una palanca de control de mando, un lápiz óptico u otro
dispositivo. Además, la interfaz de usuario 218 puede incluir un
micrófono, una videocámara o cualquier otro dispositivo transductor
de la señal para facilitar la captación directa de una señal para
ser analizada. El procesador 201, la memoria 202 y los otros
componentes del sistema 200 pueden intercambiar señales (por
ejemplo, instrucciones de códigos y datos) entre sí a través de una
vía de distribución 220 como se muestra en la Figura 2. Un
micrófono 222 puede ser acoplado al aparato 200 a través de las
funciones I/O 211.
Como se ha usado aquí, el término I/O
generalmente se refiere a cualquier programa, operación o
dispositivo que transfiera datos a o desde el sistema 200 y a o
desde un dispositivo periférico. Cada transferencia es una salida
de un dispositivo y una entrada a otro. Los dispositivos periféricos
incluyen dispositivos de entrada solamente, tales como teclados o
ratones, dispositivos de salida solamente, tales como impresoras así
como dispositivos tales como CD-ROM grabables que
pueden actuar como un dispositivo de entrada y un dispositivo de
salida. El término "dispositivo periférico" incluye
dispositivos externos, tales como un ratón, un teclado, una
impresora, un monitor, un micrófono, una cámara, una unidad de
compresión externa o explorador así como dispositivos externos,
tales como una unidad de CD-ROM, una unidad de
CD-R o un modem interno u otro periférico tal como
un lector/escritor de memoria instantáneo, una unidad de disco
duro.
El procesador 201 puede realizar el
reconocimiento de señal de los datos de las señales 206 y/o la
probabilidad en las instrucciones de códigos de un programa 204
almacenado y recuperado por la memoria 202 y ejecutado por el
módulo procesador 201. Las partes de código del programa 203 pueden
adaptarse a cualquiera de varios lenguajes de programación
diferentes tales como Assembly, C++, JAVA o varios otros lenguajes.
El módulo de procesador 201 forma un ordenador de uso general que
se convierte en un ordenador de uso específico cuando ejecuta
programas tales como el código de programa 204. Aunque el código de
programa 204 se describe aquí como realizado en soporte lógico y
ejecutado en un ordenador de uso general, los expertos en la técnica
advertirán que el método de gestión de tareas podría
alternativamente realizarse usando un soporte físico tal como un
circuito integrado específico de la aplicación (ASIC) u otros
circuitos de soporte físico. Como tal, se debería entender que las
realizaciones del invento pueden realizarse, total o parcialmente,
en soporte lógico, soporte físico o en una combinación de
ambos.
En una realización, entre otras, el código de
programa 204 puede incluir un conjunto de instrucciones leíbles por
un procesador que realiza un método que tiene características en
común con el método 100 de la Figura 1A o el método 110 de la
Figura 1B. El programa 204 puede incluir generalmente una o más
instrucciones que dirigen el procesador 201 para obtener una señal
de voz para una pronunciación de un hablante; determinar una altura
de tono de ejecución de la señal de voz de la pronunciación;
clasificar el hablante basándose en la altura de tono de ejecución;
ajustar uno o más parámetros de modelo acústico basándose en una
clasificación del hablante; y realizar un análisis de
reconocimiento de voz de la pronunciación basándose en los
parámetros del modelo acústico.
A modo de ejemplo, el programa 204 puede ser
parte de un programa total mayor tal como un programa para un juego
de ordenador. En ciertas realizaciones del invento el código de
programa 204 puede hacer que un hablante diga una palabra o frase
(por ejemplo, el nombre del hablante) durante una fase de iniciación
(por ejemplo, al comienzo de un juego) para proporcionar un ejemplo
de habla. A partir de esta muestra el programa 204 puede avanzar
como se ha descrito anteriormente con respecto a la Figura 1 para
encontrar parámetros óptimos (por ejemplo, f_{min} y
f_{max}) de ese hablante y ejecutar el reconocimiento de
voz en 110 usando esos parámetros. Los parámetros pueden ser
guardados después de la conclusión del programa y ser usados cuando
ese hablante use el programa.
Las realizaciones del presente invento facilitan
un reconocimiento de voz más consistente y más preciso. En un
ejemplo de reconocimiento de voz que emplea la selección del
parámetro de modelo acústico usando la clasificación del hablante
basándose en la altura de tono con un hablante hembra único produjo
el 94,8% de precisión de palabras. Un algoritmo de reconocimiento
de voz convencional que no emplea selección de parámetro de modelo
acústico usando la clasificación del hablante basándose en la altura
de tono con un hablante hembra único consiguió solamente el 86,3%
de precisión de palabras con el mismo hablante hembra.
Mientras que lo anterior es una descripción
completa de la realización preferida del presente invento, es
posible usar diferentes alternativas, modificaciones y
equivalentes.
El alcance del invento está definido por las
reivindicaciones anejas.
Claims (15)
1. Un método de reconocimiento de voz,
comprendiendo el método:
- obtener (102) una señal de voz de una pronunciación de un hablante;
- determinar (104) una altura de tono de ejecución de la señal de la pronunciación;
- clasificar (106) el hablante basándose en la altura de tono de ejecución;
- ajustar (108) uno o más parámetros del modelo acústico basándose en la clasificación del hablante; y
- realizar (110) un análisis de reconocimiento de voz de la pronunciación basándose en los parámetros del modelo acústico.
2. El método de la reivindicación 1 en el que la
determinación de la altura de tono de ejecución incluye la
determinación de una altura de tono media p_{avg}(t)
en el instante t dado por:
en donde la suma está tomada a lo
largo de un número NP de medidas de altura de tono tomadas en
los instantes t_{j} durante una ventana de
tiempo.
3. El método de la reivindicación 2 en el que
cada una de las alturas de tono p(t_{j}) está por
encima de un umbral predeterminado.
4. El método de la reivindicación 2 en el que la
determinación de la altura de tono de ejecución incluye un cálculo
del tipo:
en donde c es una constante entre 0
y 1, y p(t) es un valor actual de la altura de tono en
el instante
t.
5. El método de la reivindicación 1 en el que la
clasificación del hablante incluye determinar la edad y/o género
del hablante.
6. El método de la reivindicación 5 en el que la
determinación de la edad y/o género del hablante incluye determinar
si la altura de tono de ejecución está situada en una gama, en la
que la gama depende de la edad y/o género del hablante.
7. El método de la reivindicación 5 en el que la
determinación de la edad y/o género del hablante incluye determinar
a partir de la altura de tono si el hablante es hombre, mujer o
niño.
8. El método de la reivindicación 1 en el que
uno o más modelos acústicos incluyen una frecuencia máxima
f_{max} y una frecuencia mínima f_{min} de una
batería de filtros usada en la realización del análisis de
reconocimiento de voz.
9. El método de la reivindicación 8 en el que
los valores de f_{max} y f_{min} son elegidos
basándose en un género y/o una edad del hablante determinada
durante la clasificación del hablante basada en la altura de tono
de ejecución.
10. El método de la reivindicación 8 en el que
los valores de f_{max} y f_{min} se eligen
basándose en si el hablante es hombre, mujer o niño durante la
clasificación del hablante basada en la altura de tono de
ejecución.
11. El método de la reivindicación 8 en el que
los valores de f_{max} y f_{min} se ajustan
dinámicamente en cualquier momento durante el reconocimiento.
12. El método de la reivindicación 1 que además
comprende almacenar la clasificación del hablante y/o uno o más
parámetros de modelos acústicos basándose en la clasificación del
hablante, y asociando la clasificación del hablante y/o uno o más
parámetros del modelo acústico basándose en la clasificación del
hablante con un determinado hablante.
13. El método de la reivindicación 11 que además
comprende usar la clasificación del hablante almacenada y/o uno o
más parámetros del modelo acústico basándose en la clasificación del
hablante durante un análisis posterior de reconocimiento de voz del
hablante.
14. Soporte lógico de ordenador que tiene un
código de programa que, cuando es ejecutado por un ordenador, hace
que el ordenador realice un método de acuerdo con cualquiera de las
reivindicaciones 1 a 13.
15. Un sistema de reconocimiento de voz que
comprende:
- una interfaz (211) adaptada para obtener una señal de voz;
- uno o más procesadores (20) acoplados a la interfaz; y
- una memoria (202) acoplada a la interfaz y al procesador, teniendo la memoria incorporado en ella un conjunto de instrucciones leíbles por el procesador, configurada para realizar un método de reconocimiento de voz, incluyendo las instrucciones leíbles por el procesador:
- una instrucción para obtener una señal de voz de una pronunciación de un hablante;
- una instrucción para determinar una altura de tono de ejecución a partir de la señal de voz de la pronunciación;
- una instrucción para clasificar el hablante basada en la altura de tono de ejecución;
- una instrucción para ajustar uno o más parámetros del modelo acústico basada en una clasificación del hablante; y
- una instrucción para realizar un análisis de reconocimiento de voz de la pronunciación basada en los parámetros del modelo acústico.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US11/358,001 US7778831B2 (en) | 2006-02-21 | 2006-02-21 | Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch |
| US358001 | 2006-02-21 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2327468T3 true ES2327468T3 (es) | 2009-10-29 |
Family
ID=38043008
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES07756698T Active ES2327468T3 (es) | 2006-02-21 | 2007-02-06 | Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. |
Country Status (8)
| Country | Link |
|---|---|
| US (2) | US7778831B2 (es) |
| EP (1) | EP1979894B1 (es) |
| JP (1) | JP4959727B2 (es) |
| CN (1) | CN101390155B (es) |
| AT (1) | ATE434252T1 (es) |
| DE (1) | DE602007001338D1 (es) |
| ES (1) | ES2327468T3 (es) |
| WO (1) | WO2007098316A1 (es) |
Families Citing this family (54)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US9240188B2 (en) | 2004-09-16 | 2016-01-19 | Lena Foundation | System and method for expressive language, developmental disorder, and emotion assessment |
| US10223934B2 (en) | 2004-09-16 | 2019-03-05 | Lena Foundation | Systems and methods for expressive language, developmental disorder, and emotion assessment, and contextual feedback |
| US9355651B2 (en) | 2004-09-16 | 2016-05-31 | Lena Foundation | System and method for expressive language, developmental disorder, and emotion assessment |
| US8078465B2 (en) * | 2007-01-23 | 2011-12-13 | Lena Foundation | System and method for detection and analysis of speech |
| US8938390B2 (en) | 2007-01-23 | 2015-01-20 | Lena Foundation | System and method for expressive language and developmental disorder assessment |
| US7778831B2 (en) * | 2006-02-21 | 2010-08-17 | Sony Computer Entertainment Inc. | Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch |
| CN101051464A (zh) * | 2006-04-06 | 2007-10-10 | 株式会社东芝 | 说话人认证的注册和验证方法及装置 |
| CA2676380C (en) | 2007-01-23 | 2015-11-24 | Infoture, Inc. | System and method for detection and analysis of speech |
| JP2009020291A (ja) * | 2007-07-11 | 2009-01-29 | Yamaha Corp | 音声処理装置および通信端末装置 |
| US20090287489A1 (en) * | 2008-05-15 | 2009-11-19 | Palm, Inc. | Speech processing for plurality of users |
| US8442833B2 (en) * | 2009-02-17 | 2013-05-14 | Sony Computer Entertainment Inc. | Speech processing with source location estimation using signals from two or more microphones |
| US8442829B2 (en) * | 2009-02-17 | 2013-05-14 | Sony Computer Entertainment Inc. | Automatic computation streaming partition for voice recognition on multiple processors with limited memory |
| US8788256B2 (en) * | 2009-02-17 | 2014-07-22 | Sony Computer Entertainment Inc. | Multiple language voice recognition |
| JP2011101110A (ja) * | 2009-11-04 | 2011-05-19 | Ricoh Co Ltd | 撮像装置 |
| US8831942B1 (en) * | 2010-03-19 | 2014-09-09 | Narus, Inc. | System and method for pitch based gender identification with suspicious speaker detection |
| BR112013011312A2 (pt) * | 2010-11-10 | 2019-09-24 | Koninl Philips Electronics Nv | método para estimar um padrão em um sinal (s) tendo um componente periódico, semiperiódico ou virtualmente periódico, dispositivo para estimar um padrão em um sinal (s) tendo um componente periódico, semiperiódico ou virtualmente periódico e programa de computador |
| US8756062B2 (en) * | 2010-12-10 | 2014-06-17 | General Motors Llc | Male acoustic model adaptation based on language-independent female speech data |
| CN103282960B (zh) * | 2011-01-04 | 2016-01-06 | 富士通株式会社 | 声音控制装置、声音控制方法以及声音控制程序 |
| US8639508B2 (en) * | 2011-02-14 | 2014-01-28 | General Motors Llc | User-specific confidence thresholds for speech recognition |
| US20120226500A1 (en) * | 2011-03-02 | 2012-09-06 | Sony Corporation | System and method for content rendering including synthetic narration |
| US9224384B2 (en) * | 2012-06-06 | 2015-12-29 | Cypress Semiconductor Corporation | Histogram based pre-pruning scheme for active HMMS |
| US9514739B2 (en) * | 2012-06-06 | 2016-12-06 | Cypress Semiconductor Corporation | Phoneme score accelerator |
| US9105268B2 (en) * | 2012-09-19 | 2015-08-11 | 24/7 Customer, Inc. | Method and apparatus for predicting intent in IVR using natural language queries |
| US9319816B1 (en) * | 2012-09-26 | 2016-04-19 | Amazon Technologies, Inc. | Characterizing environment using ultrasound pilot tones |
| GB2508417B (en) * | 2012-11-30 | 2017-02-08 | Toshiba Res Europe Ltd | A speech processing system |
| KR20140079092A (ko) * | 2012-12-18 | 2014-06-26 | 한국전자통신연구원 | 음향그룹의 전이확률을 활용한 문맥독립 성별인식 방법 및 장치 |
| CN103236259B (zh) * | 2013-03-22 | 2016-06-29 | 乐金电子研发中心(上海)有限公司 | 语音识别处理及反馈系统、语音回复方法 |
| JP2015040903A (ja) * | 2013-08-20 | 2015-03-02 | ソニー株式会社 | 音声処理装置、音声処理方法、及び、プログラム |
| US20150154002A1 (en) * | 2013-12-04 | 2015-06-04 | Google Inc. | User interface customization based on speaker characteristics |
| CN103714812A (zh) * | 2013-12-23 | 2014-04-09 | 百度在线网络技术(北京)有限公司 | 一种语音识别方法及装置 |
| CN104795067B (zh) | 2014-01-20 | 2019-08-06 | 华为技术有限公司 | 语音交互方法及装置 |
| US9412358B2 (en) | 2014-05-13 | 2016-08-09 | At&T Intellectual Property I, L.P. | System and method for data-driven socially customized models for language generation |
| US10127927B2 (en) | 2014-07-28 | 2018-11-13 | Sony Interactive Entertainment Inc. | Emotional speech processing |
| CN105895078A (zh) * | 2015-11-26 | 2016-08-24 | 乐视致新电子科技(天津)有限公司 | 动态选择语音模型的语音识别方法及装置 |
| WO2017187712A1 (ja) * | 2016-04-26 | 2017-11-02 | 株式会社ソニー・インタラクティブエンタテインメント | 情報処理装置 |
| CN105895105B (zh) * | 2016-06-06 | 2020-05-05 | 北京云知声信息技术有限公司 | 语音处理方法及装置 |
| US9818406B1 (en) * | 2016-06-23 | 2017-11-14 | Intuit Inc. | Adjusting user experience based on paralinguistic information |
| US10135989B1 (en) | 2016-10-27 | 2018-11-20 | Intuit Inc. | Personalized support routing based on paralinguistic information |
| US10515632B2 (en) * | 2016-11-15 | 2019-12-24 | At&T Intellectual Property I, L.P. | Asynchronous virtual assistant |
| US10431236B2 (en) * | 2016-11-15 | 2019-10-01 | Sphero, Inc. | Dynamic pitch adjustment of inbound audio to improve speech recognition |
| WO2018164699A1 (en) * | 2017-03-10 | 2018-09-13 | James Jordan Rosenberg | System and method for relative enhancement of vocal utterances in an acoustically cluttered environment |
| US10468032B2 (en) * | 2017-04-10 | 2019-11-05 | Intel Corporation | Method and system of speaker recognition using context aware confidence modeling |
| US10331402B1 (en) * | 2017-05-30 | 2019-06-25 | Amazon Technologies, Inc. | Search and knowledge base question answering for a voice user interface |
| US10529357B2 (en) | 2017-12-07 | 2020-01-07 | Lena Foundation | Systems and methods for automatic determination of infant cry and discrimination of cry from fussiness |
| US10818296B2 (en) | 2018-06-21 | 2020-10-27 | Intel Corporation | Method and system of robust speaker recognition activation |
| KR102783672B1 (ko) * | 2019-06-28 | 2025-03-21 | 엘지전자 주식회사 | 로봇, 그와 연결되는 서버, 및 로봇을 이용한 음성 인식 방법 |
| CN110808052A (zh) * | 2019-11-12 | 2020-02-18 | 深圳市瑞讯云技术有限公司 | 语音识别方法、装置及电子设备 |
| US11664033B2 (en) * | 2020-06-15 | 2023-05-30 | Samsung Electronics Co., Ltd. | Electronic apparatus and controlling method thereof |
| US11620990B2 (en) * | 2020-12-11 | 2023-04-04 | Google Llc | Adapting automated speech recognition parameters based on hotword properties |
| CN114974227B (zh) * | 2021-02-24 | 2026-01-06 | 华为技术有限公司 | 语音识别及其模型训练方法 |
| CN117083669A (zh) | 2021-05-28 | 2023-11-17 | 微软技术许可有限责任公司 | 检测和改进单词实时误读的方法和系统 |
| US12361936B2 (en) | 2021-08-24 | 2025-07-15 | Microsoft Technology Licensing, Llc | Method and system of automated question generation for speech assistance |
| US12175307B2 (en) | 2022-02-21 | 2024-12-24 | Bank Of America Corporation | System and method of automated processing for dynamic API generation |
| US20250384891A1 (en) * | 2024-06-18 | 2025-12-18 | Huawei Technologies Co., Ltd. | High privacy dsp-based audio anonymization with audio segmentation and randomization |
Family Cites Families (131)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| USRE33597E (en) | 1982-10-15 | 1991-05-28 | Hidden Markov model speech recognition arrangement | |
| JPS6075898A (ja) * | 1983-09-30 | 1985-04-30 | 三菱電機株式会社 | 単語音声認識装置 |
| JPH0646359B2 (ja) * | 1984-02-10 | 1994-06-15 | 三菱電機株式会社 | 単語音声認識装置 |
| US4956865A (en) | 1985-01-30 | 1990-09-11 | Northern Telecom Limited | Speech recognition |
| JPH01102599A (ja) | 1987-10-12 | 1989-04-20 | Internatl Business Mach Corp <Ibm> | 音声認識方法 |
| US5129002A (en) | 1987-12-16 | 1992-07-07 | Matsushita Electric Industrial Co., Ltd. | Pattern recognition apparatus |
| JPH0293597A (ja) | 1988-09-30 | 1990-04-04 | Nippon I B M Kk | 音声認識装置 |
| JPH02273798A (ja) * | 1989-04-14 | 1990-11-08 | Sekisui Chem Co Ltd | 話者認識方式 |
| US5228087A (en) | 1989-04-12 | 1993-07-13 | Smiths Industries Public Limited Company | Speech recognition apparatus and methods |
| US4977598A (en) | 1989-04-13 | 1990-12-11 | Texas Instruments Incorporated | Efficient pruning algorithm for hidden markov model speech recognition |
| US5509104A (en) | 1989-05-17 | 1996-04-16 | At&T Corp. | Speech recognition employing key word modeling and non-key word modeling |
| CA2015410C (en) | 1989-05-17 | 1996-04-02 | Chin H. Lee | Speech recognition employing key word modeling and non-key word modeling |
| US5148489A (en) | 1990-02-28 | 1992-09-15 | Sri International | Method for spectral estimation to improve noise robustness for speech recognition |
| US5794190A (en) | 1990-04-26 | 1998-08-11 | British Telecommunications Public Limited Company | Speech pattern recognition using pattern recognizers and classifiers |
| US5345536A (en) | 1990-12-21 | 1994-09-06 | Matsushita Electric Industrial Co., Ltd. | Method of speech recognition |
| US5268990A (en) | 1991-01-31 | 1993-12-07 | Sri International | Method for recognizing speech using linguistically-motivated hidden Markov models |
| JP3050934B2 (ja) | 1991-03-22 | 2000-06-12 | 株式会社東芝 | 音声認識方式 |
| US5222190A (en) | 1991-06-11 | 1993-06-22 | Texas Instruments Incorporated | Apparatus and method for identifying a speech pattern |
| JP2662120B2 (ja) | 1991-10-01 | 1997-10-08 | インターナショナル・ビジネス・マシーンズ・コーポレイション | 音声認識装置および音声認識用処理ユニット |
| US5502790A (en) | 1991-12-24 | 1996-03-26 | Oki Electric Industry Co., Ltd. | Speech recognition method and system using triphones, diphones, and phonemes |
| JPH05257492A (ja) | 1992-03-13 | 1993-10-08 | Toshiba Corp | 音声認識方式 |
| JPH0782348B2 (ja) | 1992-03-21 | 1995-09-06 | 株式会社エイ・ティ・アール自動翻訳電話研究所 | 音声認識用サブワードモデル生成方法 |
| JP2795058B2 (ja) | 1992-06-03 | 1998-09-10 | 松下電器産業株式会社 | 時系列信号処理装置 |
| US5455888A (en) | 1992-12-04 | 1995-10-03 | Northern Telecom Limited | Speech bandwidth extension method and apparatus |
| JP3272842B2 (ja) | 1992-12-17 | 2002-04-08 | ゼロックス・コーポレーション | プロセッサベースの判定方法 |
| US5438630A (en) | 1992-12-17 | 1995-08-01 | Xerox Corporation | Word spotting in bitmap images using word bounding boxes and hidden Markov models |
| US5535305A (en) | 1992-12-31 | 1996-07-09 | Apple Computer, Inc. | Sub-partitioned vector quantization of probability density functions |
| US5473728A (en) | 1993-02-24 | 1995-12-05 | The United States Of America As Represented By The Secretary Of The Navy | Training of homoscedastic hidden Markov models for automatic speech recognition |
| US5459798A (en) | 1993-03-19 | 1995-10-17 | Intel Corporation | System and method of pattern recognition employing a multiprocessing pipelined apparatus with private pattern memory |
| JPH0728487A (ja) | 1993-03-26 | 1995-01-31 | Texas Instr Inc <Ti> | 音声認識方法 |
| JPH09500223A (ja) | 1993-07-13 | 1997-01-07 | ボルドー、テオドール・オースチン | 多言語音声認識システム |
| US5627939A (en) | 1993-09-03 | 1997-05-06 | Microsoft Corporation | Speech recognition system and method employing data compression |
| AU7802194A (en) | 1993-09-30 | 1995-04-18 | Apple Computer, Inc. | Continuous reference adaptation in a pattern recognition system |
| US5615296A (en) | 1993-11-12 | 1997-03-25 | International Business Machines Corporation | Continuous speech recognition and voice response system and method to enable conversational dialogues with microprocessors |
| ZA948426B (en) | 1993-12-22 | 1995-06-30 | Qualcomm Inc | Distributed voice recognition system |
| JP2737624B2 (ja) | 1993-12-27 | 1998-04-08 | 日本電気株式会社 | 音声認識装置 |
| FI98162C (fi) | 1994-05-30 | 1997-04-25 | Tecnomen Oy | HMM-malliin perustuva puheentunnistusmenetelmä |
| WO1995034884A1 (en) | 1994-06-13 | 1995-12-21 | Matsushita Electric Industrial Co., Ltd. | Signal analyzer |
| US5825978A (en) | 1994-07-18 | 1998-10-20 | Sri International | Method and apparatus for speech recognition using optimized partial mixture tying of HMM state functions |
| US5602960A (en) | 1994-09-30 | 1997-02-11 | Apple Computer, Inc. | Continuous mandarin chinese speech recognition system having an integrated tone classifier |
| JP3581401B2 (ja) | 1994-10-07 | 2004-10-27 | キヤノン株式会社 | 音声認識方法 |
| US5680506A (en) | 1994-12-29 | 1997-10-21 | Lucent Technologies Inc. | Apparatus and method for speech signal analysis |
| DE19501599C1 (de) | 1995-01-20 | 1996-05-02 | Daimler Benz Ag | Verfahren zur Spracherkennung |
| US5680510A (en) | 1995-01-26 | 1997-10-21 | Apple Computer, Inc. | System and method for generating and using context dependent sub-syllable models to recognize a tonal language |
| US5751905A (en) * | 1995-03-15 | 1998-05-12 | International Business Machines Corporation | Statistical acoustic processing method and apparatus for speech recognition using a toned phoneme system |
| US5617509A (en) | 1995-03-29 | 1997-04-01 | Motorola, Inc. | Method, apparatus, and radio optimizing Hidden Markov Model speech recognition |
| US5719996A (en) | 1995-06-30 | 1998-02-17 | Motorola, Inc. | Speech recognition in selective call systems |
| KR19990043998A (ko) | 1995-08-24 | 1999-06-25 | 세모스 로버트 어니스트 빅커스 | 패턴인식시스템 |
| JPH0981183A (ja) | 1995-09-14 | 1997-03-28 | Pioneer Electron Corp | 音声モデルの作成方法およびこれを用いた音声認識装置 |
| GB2305288A (en) | 1995-09-15 | 1997-04-02 | Ibm | Speech recognition system |
| US6067520A (en) | 1995-12-29 | 2000-05-23 | Lee And Li | System and method of recognizing continuous mandarin speech utilizing chinese hidden markou models |
| GB9602691D0 (en) | 1996-02-09 | 1996-04-10 | Canon Kk | Word model generation |
| US5696873A (en) * | 1996-03-18 | 1997-12-09 | Advanced Micro Devices, Inc. | Vocoder system and method for performing pitch estimation using an adaptive correlation sample window |
| US5880788A (en) | 1996-03-25 | 1999-03-09 | Interval Research Corporation | Automated synchronization of video image sequences to new soundtracks |
| US5913193A (en) * | 1996-04-30 | 1999-06-15 | Microsoft Corporation | Method and system of runtime acoustic unit selection for speech synthesis |
| US5937384A (en) | 1996-05-01 | 1999-08-10 | Microsoft Corporation | Method and system for speech recognition using continuous density hidden Markov models |
| US5860062A (en) | 1996-06-21 | 1999-01-12 | Matsushita Electric Industrial Co., Ltd. | Speech recognition apparatus and speech recognition method |
| US5963903A (en) | 1996-06-28 | 1999-10-05 | Microsoft Corporation | Method and system for dynamically adjusted training for speech recognition |
| JP3302266B2 (ja) | 1996-07-23 | 2002-07-15 | 沖電気工業株式会社 | ヒドン・マルコフ・モデルの学習方法 |
| US5835890A (en) | 1996-08-02 | 1998-11-10 | Nippon Telegraph And Telephone Corporation | Method for speaker adaptation of speech models recognition scheme using the method and recording medium having the speech recognition method recorded thereon |
| JPH10149187A (ja) * | 1996-11-19 | 1998-06-02 | Yamaha Corp | 音声情報抽出装置 |
| JP3501199B2 (ja) * | 1997-02-17 | 2004-03-02 | 日本電信電話株式会社 | 音響信号分離方法 |
| US5930753A (en) | 1997-03-20 | 1999-07-27 | At&T Corp | Combining frequency warping and spectral shaping in HMM based speech recognition |
| GB9706174D0 (en) | 1997-03-25 | 1997-11-19 | Secr Defence | Recognition system |
| JP3033514B2 (ja) | 1997-03-31 | 2000-04-17 | 日本電気株式会社 | 大語彙音声認識方法及び装置 |
| US5893059A (en) | 1997-04-17 | 1999-04-06 | Nynex Science And Technology, Inc. | Speech recoginition methods and apparatus |
| US6456965B1 (en) * | 1997-05-20 | 2002-09-24 | Texas Instruments Incorporated | Multi-stage pitch and mixed voicing estimation for harmonic speech coders |
| US5963906A (en) | 1997-05-20 | 1999-10-05 | At & T Corp | Speech recognition training |
| US6032116A (en) | 1997-06-27 | 2000-02-29 | Advanced Micro Devices, Inc. | Distance measure in a speech recognition system for speech recognition using frequency shifting factors to compensate for input signal frequency shifts |
| US6009390A (en) | 1997-09-11 | 1999-12-28 | Lucent Technologies Inc. | Technique for selective use of Gaussian kernels and mixture component weights of tied-mixture hidden Markov models for speech recognition |
| US6151573A (en) | 1997-09-17 | 2000-11-21 | Texas Instruments Incorporated | Source normalization training for HMM modeling of speech |
| FR2769118B1 (fr) | 1997-09-29 | 1999-12-03 | Matra Communication | Procede de reconnaissance de parole |
| FR2769117B1 (fr) | 1997-09-29 | 2000-11-10 | Matra Comm | Procede d'apprentissage dans un systeme de reconnaissance de parole |
| US5983180A (en) | 1997-10-23 | 1999-11-09 | Softsound Limited | Recognition of sequential data using finite state sequence models organized in a tree structure |
| US6188982B1 (en) | 1997-12-01 | 2001-02-13 | Industrial Technology Research Institute | On-line background noise adaptation of parallel model combination HMM with discriminative learning using weighted HMM for noisy speech recognition |
| US6151574A (en) | 1997-12-05 | 2000-11-21 | Lucent Technologies Inc. | Technique for adaptation of hidden markov models for speech recognition |
| JP2965537B2 (ja) | 1997-12-10 | 1999-10-18 | 株式会社エイ・ティ・アール音声翻訳通信研究所 | 話者クラスタリング処理装置及び音声認識装置 |
| US6226612B1 (en) | 1998-01-30 | 2001-05-01 | Motorola, Inc. | Method of evaluating an utterance in a speech recognition system |
| US6148284A (en) | 1998-02-23 | 2000-11-14 | At&T Corporation | Method and apparatus for automatic speech recognition using Markov processes on curves |
| JP3412496B2 (ja) | 1998-02-25 | 2003-06-03 | 三菱電機株式会社 | 話者適応化装置と音声認識装置 |
| US6112175A (en) | 1998-03-02 | 2000-08-29 | Lucent Technologies Inc. | Speaker adaptation using discriminative linear regression on time-varying mean parameters in trended HMM |
| JP2986792B2 (ja) | 1998-03-16 | 1999-12-06 | 株式会社エイ・ティ・アール音声翻訳通信研究所 | 話者正規化処理装置及び音声認識装置 |
| ATE235733T1 (de) | 1998-05-11 | 2003-04-15 | Siemens Ag | Anordnung und verfahren zur erkennung eines vorgegebenen wortschatzes in gesprochener sprache durch einen rechner |
| US6832190B1 (en) | 1998-05-11 | 2004-12-14 | Siemens Aktiengesellschaft | Method and array for introducing temporal correlation in hidden markov models for speech recognition |
| JP3156668B2 (ja) | 1998-06-19 | 2001-04-16 | 日本電気株式会社 | 音声認識装置 |
| US6980952B1 (en) | 1998-08-15 | 2005-12-27 | Texas Instruments Incorporated | Source normalization training for HMM modeling of speech |
| US6138095A (en) | 1998-09-03 | 2000-10-24 | Lucent Technologies Inc. | Speech recognition |
| JP3000999B1 (ja) | 1998-09-08 | 2000-01-17 | セイコーエプソン株式会社 | 音声認識方法および音声認識装置ならびに音声認識処理プログラムを記録した記録媒体 |
| DE69939124D1 (de) | 1998-09-09 | 2008-08-28 | Asahi Chemical Ind | Spracherkenner und spracherkennungsverfahren |
| US6766288B1 (en) * | 1998-10-29 | 2004-07-20 | Paul Reed Smith Guitars | Fast find fundamental method |
| US6292776B1 (en) | 1999-03-12 | 2001-09-18 | Lucent Technologies Inc. | Hierarchial subband linear predictive cepstral features for HMM-based speech recognition |
| GB2348035B (en) | 1999-03-19 | 2003-05-28 | Ibm | Speech recognition system |
| US6526380B1 (en) | 1999-03-26 | 2003-02-25 | Koninklijke Philips Electronics N.V. | Speech recognition system having parallel large vocabulary recognition engines |
| US7058573B1 (en) * | 1999-04-20 | 2006-06-06 | Nuance Communications Inc. | Speech recognition system to selectively utilize different speech recognition techniques over multiple speech recognition passes |
| US6405168B1 (en) | 1999-09-30 | 2002-06-11 | Conexant Systems, Inc. | Speaker dependent speech recognition training using simplified hidden markov modeling and robust end-point detection |
| JP3632529B2 (ja) | 1999-10-26 | 2005-03-23 | 日本電気株式会社 | 音声認識装置及び方法ならびに記録媒体 |
| CN1141698C (zh) | 1999-10-29 | 2004-03-10 | 松下电器产业株式会社 | 对输入语音进行语音识别的音程标准化装置 |
| US6442519B1 (en) * | 1999-11-10 | 2002-08-27 | International Business Machines Corp. | Speaker model adaptation via network of similar users |
| US6829578B1 (en) * | 1999-11-11 | 2004-12-07 | Koninklijke Philips Electronics, N.V. | Tone features for speech recognition |
| JP3814459B2 (ja) | 2000-03-31 | 2006-08-30 | キヤノン株式会社 | 音声認識方法及び装置と記憶媒体 |
| US6629073B1 (en) | 2000-04-27 | 2003-09-30 | Microsoft Corporation | Speech recognition method and apparatus utilizing multi-unit models |
| US7272561B2 (en) * | 2000-07-13 | 2007-09-18 | Asahi Kasei Kabushiki Kaisha | Speech recognition device and speech recognition method |
| US6671669B1 (en) | 2000-07-18 | 2003-12-30 | Qualcomm Incorporated | combined engine system and method for voice recognition |
| TW473704B (en) | 2000-08-30 | 2002-01-21 | Ind Tech Res Inst | Adaptive voice recognition method with noise compensation |
| DE10043946C2 (de) | 2000-09-06 | 2002-12-12 | Siemens Ag | Komprimieren von HMM-Prototypen |
| JP3932789B2 (ja) | 2000-09-20 | 2007-06-20 | セイコーエプソン株式会社 | Hmmの出力確率計算方法および音声認識装置 |
| US6681207B2 (en) | 2001-01-12 | 2004-01-20 | Qualcomm Incorporated | System and method for lossy compression of voice recognition models |
| US20020169604A1 (en) * | 2001-03-09 | 2002-11-14 | Damiba Bertrand A. | System, method and computer program product for genre-based grammars and acoustic models in a speech recognition framework |
| JP2002366187A (ja) | 2001-06-08 | 2002-12-20 | Sony Corp | 音声認識装置および音声認識方法、並びにプログラムおよび記録媒体 |
| US6701293B2 (en) * | 2001-06-13 | 2004-03-02 | Intel Corporation | Combining N-best lists from multiple speech recognizers |
| US6493668B1 (en) * | 2001-06-15 | 2002-12-10 | Yigal Brandman | Speech feature extraction system |
| JP2003066991A (ja) * | 2001-08-22 | 2003-03-05 | Seiko Epson Corp | 音声認識結果出力方法および音声認識結果出力装置ならびに音声認識結果出力処理プログラムを記録した記録媒体 |
| CA2359544A1 (en) | 2001-10-22 | 2003-04-22 | Dspfactory Ltd. | Low-resource real-time speech recognition system using an oversampled filterbank |
| US6721699B2 (en) * | 2001-11-12 | 2004-04-13 | Intel Corporation | Method and system of Chinese speech pitch extraction |
| US20030220788A1 (en) * | 2001-12-17 | 2003-11-27 | Xl8 Systems, Inc. | System and method for speech recognition and transcription |
| JP2005227794A (ja) * | 2002-11-21 | 2005-08-25 | Matsushita Electric Ind Co Ltd | 標準モデル作成装置及び標準モデル作成方法 |
| US7133535B2 (en) | 2002-12-21 | 2006-11-07 | Microsoft Corp. | System and method for real time lip synchronization |
| JP2004297273A (ja) * | 2003-03-26 | 2004-10-21 | Kenwood Corp | 音声信号雑音除去装置、音声信号雑音除去方法及びプログラム |
| US7389230B1 (en) * | 2003-04-22 | 2008-06-17 | International Business Machines Corporation | System and method for classification of voice signals |
| US7499857B2 (en) * | 2003-05-15 | 2009-03-03 | Microsoft Corporation | Adaptation of compressed acoustic models |
| KR100511248B1 (ko) * | 2003-06-13 | 2005-08-31 | 홍광석 | 음성인식에서 화자 내 정규화를 위한 진폭 변경 방법 |
| US7328154B2 (en) | 2003-08-13 | 2008-02-05 | Matsushita Electrical Industrial Co., Ltd. | Bubble splitting for compact acoustic modeling |
| US20050065789A1 (en) | 2003-09-23 | 2005-03-24 | Sherif Yacoub | System and method with automated speech recognition engines |
| JP2005164988A (ja) * | 2003-12-03 | 2005-06-23 | Xanavi Informatics Corp | 周波数切替装置および情報処理装置 |
| JP2005173008A (ja) * | 2003-12-09 | 2005-06-30 | Canon Inc | 音声解析処理およびそれを用いた音声処理装置および媒体 |
| JP2005215888A (ja) * | 2004-01-28 | 2005-08-11 | Yasunori Kobori | テキスト文の表示装置 |
| EP1723636A1 (de) * | 2004-03-12 | 2006-11-22 | Siemens Aktiengesellschaft | Benutzer- und vokabularadaptive bestimmung von konfidenz- und rückweisungsschwellen |
| US7844045B2 (en) | 2004-06-16 | 2010-11-30 | Panasonic Corporation | Intelligent call routing and call supervision method for call centers |
| KR100655491B1 (ko) * | 2004-12-21 | 2006-12-11 | 한국전자통신연구원 | 음성인식 시스템에서의 2단계 발화 검증 방법 및 장치 |
| US7970613B2 (en) | 2005-11-12 | 2011-06-28 | Sony Computer Entertainment Inc. | Method and system for Gaussian probability data bit reduction and computation |
| US7778831B2 (en) * | 2006-02-21 | 2010-08-17 | Sony Computer Entertainment Inc. | Voice recognition with dynamic filter bank adjustment based on speaker categorization determined from runtime pitch |
-
2006
- 2006-02-21 US US11/358,001 patent/US7778831B2/en active Active
-
2007
- 2007-02-06 EP EP07756698A patent/EP1979894B1/en active Active
- 2007-02-06 JP JP2008556492A patent/JP4959727B2/ja active Active
- 2007-02-06 WO PCT/US2007/061707 patent/WO2007098316A1/en not_active Ceased
- 2007-02-06 AT AT07756698T patent/ATE434252T1/de not_active IP Right Cessation
- 2007-02-06 DE DE602007001338T patent/DE602007001338D1/de active Active
- 2007-02-06 ES ES07756698T patent/ES2327468T3/es active Active
- 2007-02-06 CN CN2007800061003A patent/CN101390155B/zh active Active
-
2010
- 2010-07-21 US US12/841,101 patent/US8050922B2/en not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| CN101390155B (zh) | 2012-08-15 |
| EP1979894A1 (en) | 2008-10-15 |
| JP2009527801A (ja) | 2009-07-30 |
| JP4959727B2 (ja) | 2012-06-27 |
| US20070198263A1 (en) | 2007-08-23 |
| DE602007001338D1 (de) | 2009-07-30 |
| US8050922B2 (en) | 2011-11-01 |
| EP1979894B1 (en) | 2009-06-17 |
| WO2007098316A1 (en) | 2007-08-30 |
| US7778831B2 (en) | 2010-08-17 |
| US20100324898A1 (en) | 2010-12-23 |
| CN101390155A (zh) | 2009-03-18 |
| ATE434252T1 (de) | 2009-07-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2327468T3 (es) | Reconocimiento de voz con adaptacion del hablante basandose en la clasificacion del tono. | |
| ES2311872T3 (es) | Sistema y procedimiento de reconocimiento vocal automatico. | |
| CN109545243B (zh) | 发音质量评价方法、装置、电子设备及存储介质 | |
| CN107610717B (zh) | 基于语音后验概率的多对一语音转换方法 | |
| Justin et al. | Speaker de-identification using diphone recognition and speech synthesis | |
| US20110218802A1 (en) | Continuous Speech Recognition | |
| Stuttle | A Gaussian mixture model spectral representation for speech recognition | |
| Sajjan et al. | Continuous Speech Recognition of Kannada language using triphone modeling | |
| Vlasenko et al. | Vowels formants analysis allows straightforward detection of high arousal emotions | |
| Dey et al. | Mizo phone recognition system | |
| Maseri et al. | Performance analysis of implemented MFCC and HMM-based speech recognition system | |
| Kumar et al. | Development of speaker-independent automatic speech recognition system for Kannada language | |
| Bhable et al. | Automatic speech recognition (ASR) of isolated words in Hindi low resource language | |
| JP5007401B2 (ja) | 発音評定装置、およびプログラム | |
| Yavuz et al. | A phoneme-based approach for eliminating out-of-vocabulary problem of Turkish speech recognition using Hidden Markov Model. | |
| US20100305948A1 (en) | Phoneme Model for Speech Recognition | |
| JP4753412B2 (ja) | 発音評定装置、およびプログラム | |
| JP2007316330A (ja) | 韻律識別装置及び方法、並びに音声認識装置及び方法 | |
| Dalva | Automatic speech recognition system for Turkish spoken language | |
| Pasricha et al. | Hybrid architecture for robust speech recognition system | |
| Do et al. | Development of high-performance and large-scale vietnamese automatic speech recognition systems | |
| Prasad et al. | Gender based emotion recognition system for telugu rural dialects using hidden markov models | |
| Kurian et al. | Automated Transcription System for Malayalam Language | |
| Abida | Fuzzy gmm-based confidence measure towards keywords spotting application | |
| Kayte | Marathi speech recognition system using hidden Markov model toolkit |