ES2274606T3 - Procedimiento y aparato para obtener datos de fuente y filtro basados en formantes, para codificacion y sintesis, utilizando funcion de coste y filtrado inverso. - Google Patents
Procedimiento y aparato para obtener datos de fuente y filtro basados en formantes, para codificacion y sintesis, utilizando funcion de coste y filtrado inverso. Download PDFInfo
- Publication number
- ES2274606T3 ES2274606T3 ES99309294T ES99309294T ES2274606T3 ES 2274606 T3 ES2274606 T3 ES 2274606T3 ES 99309294 T ES99309294 T ES 99309294T ES 99309294 T ES99309294 T ES 99309294T ES 2274606 T3 ES2274606 T3 ES 2274606T3
- Authority
- ES
- Spain
- Prior art keywords
- filter
- residual signal
- signal
- source
- parameters
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/02—Methods for producing synthetic speech; Speech synthesisers
- G10L13/04—Details of speech synthesis systems, e.g. synthesiser structure or memory management
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/06—Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
- G10L25/15—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being formant information
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Electrophonic Musical Instruments (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Auxiliary Devices For Music (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
Abstract
Un procedimiento para obtener una señal fuente basada en formantes y en parámetros de filtrado a partir de una señal vocal, que comprende: a. definir (50) un modelo de filtro del tipo que tiene un conjunto asociado de parámetros de filtrado, b. proporcionar (54) un primer filtro basado en dicho modelo de filtro (12), c. suministrar (60) dicha señal vocal a dicho primer filtro para generar una señal residual, d. procesar (66) dicha señal residual para obtener un conjunto de puntos de datos que definen una línea de segmentos múltiples y calcular una medida de longitud de dicha línea con el fin de determinar un parámetro de coste asociado a dicha señal residual, e. ajustar selectivamente (74) dichos parámetros de filtrado para producir una reducción resultante de dicho parámetro de coste, f. repetir de manera iterativa (76) las etapas c - e hasta que dicho parámetro de coste se reduzca al mínimo y, posteriormente, utilizar dicha señal residual, para representar una señal fuente obtenida y losparámetros de filtrado.
Description
Procedimiento y aparato para obtener datos de
fuente y filtro basados en formantes, para codificación y síntesis,
utilizando función de coste y filtrado inverso.
La presente invención se refiere, en general, a
síntesis del habla y de formas de onda. Además, la invención se
refiere a la obtención de datos de fuente y filtro, basados en
formantes, a partir de formas de onda complejas. La tecnología de la
invención se puede usar para construir sintetizadores de música y de
texto a habla y sistemas de codificación del habla. Además, la
tecnología se puede usar para realizar un rastreo de tonos de
elevada calidad y un marcado de intervalos de tonos. Las funciones
de coste utilizadas por la presente invención se pueden usar como
funciones discriminatorias o detectores de características en el
etiquetado del habla y el reconocimiento del
habla.
habla.
Un modo de analizar y sintetizar formas de onda
complejas, tales como formas de onda que representan habla
sintetizada o instrumentos musicales, es utilizar un modelo de
fuente y filtro. Usando el modelo de fuente y filtro, se genera una
señal fuente y, posteriormente, se pasa por un filtro que añade
resonancias y coloración a la señal fuente. La combinación de fuente
y filtro, si se selecciona adecuadamente, puede producir una forma
de onda compleja que simula el habla humana o el sonido de un
instrumento musical.
En los modelos de fuente y filtro, la forma de
onda fuente puede ser comparativamente simple, por ejemplo, ruido
blanco o un tren de impulsos simple. En tal caso, normalmente el
filtro es complejo. El filtro complejo es necesario porque es el
efecto acumulativo de fuente y filtro que produce la forma de onda
compleja. Alternativamente, la forma de onda fuente puede ser
comparativamente compleja, en cuyo caso, el filtro puede ser más
simple. En términos generales, la configuración fuente y filtro
ofrece varias opciones de diseño.
Se prefiere un modelo que representa más
rigurosamente el grado natural de separación entre una fuente glotal
humana y el filtro del conducto vocal. Cuando se analiza la forma de
onda compleja vocal humana, supone un gran reto determinar qué
aspectos de la forma de onda se pueden atribuir a la fuente glotal y
qué aspectos se pueden atribuir al filtro del conducto vocal. Se
especula, en incluso se espera, que haya una interacción acústica
entre el conducto vocal y la naturaleza de la forma de onda glotal
que se genera en la glotis. En muchos casos dicha interacción puede
ser insignificante, por consiguiente, en la síntesis es normal
ignorar esta interacción, como si la fuente y el filtro fueran
independientes.
Se considera que muchos sistemas de síntesis
fallan debido a un modelo de fuente y filtro con un equilibrio
insuficiente entre la complejidad de la fuente y la complejidad del
filtro. Con frecuencia es la facilidad de generación, en lugar de la
calidad de sonido, la que establece el modelo de fuente. Por
ejemplo, la codificación predictiva lineal (LPC) se puede entender
en términos de un modelo de fuente y filtro en el que la fuente
suele ser blanca (es decir, espectro plano). Este modelo se elimina
considerablemente de la separación natural entre el conducto vocal
humano y la fuente glotal y tiene como resultado cálculos
insuficientes del primer formante y muchas discontinuidades en los
parámetros de filtrado.
Hasta este momento, un enfoque, tomado como una
alternativa de la LPC para solucionar las deficiencias de la LPC,
conlleva un procedimiento denominado "análisis mediante
síntesis". El análisis mediante síntesis es un enfoque
paramétrico que conlleva seleccionar un conjunto de parámetros de
fuente y un conjunto de parámetros de filtrado y, posteriormente,
usar dichos parámetros para generar una forma de onda fuente.
Posteriormente, la forma de onda fuente se pasa a través del filtro
correspondiente y la forma de onda de salida se compara con la forma
de onda original mediante una medición de distancia. Posteriormente,
se prueban conjuntos de parámetros diferentes hasta que la distancia
se reduce a un mínimo. El conjunto de parámetros que consigue el
mínimo se usa entonces como una forma codificada de la señal de
entrada.
Si bien el análisis mediante síntesis realiza un
buen trabajo de optimización de una fuente paramétrica de voz con un
filtro de modelado del conducto vocal, impone un supuesto de modelo
de fuente paramétrica con el que resulta difícil trabajar.
El documento de Matsui y col, "Improving
naturalness in text-to-speech
synthesis using natural glottal source", 1991 ICASSP New
York, páginas 769-772, describe un procedimiento
para obtener una fuente glotal natural a partir de señales vocales
mediante una técnica de filtrado inverso.
La presente invención, según se reivindica,
adopta un enfoque diferente. La presente invención utiliza un filtro
y un filtro inverso. El filtro tiene un conjunto asociado de
parámetros de filtrado, por ejemplo, la frecuencia central y el
ancho de banda de cada resonador. El filtro inverso está diseñado
como el inverso del filtro (por ejemplo, los polos de uno son ceros
del otro y viceversa). Por lo tanto, el filtro inverso tiene
parámetros que presentan una relación respecto a los parámetros del
filtro. Se suministra una señal vocal al filtro inverso para generar
una señal residual. La señal residual se procesa para obtener un
conjunto de puntos de datos que definen una línea o curva (por
ejemplo, forma de onda) que se puede representar como segmentos
múltiples.
En función de la aplicación, se pueden utilizar
etapas de procesamiento diferentes para obtener y analizar los
puntos de datos. Dichas etapas de procesamiento incluyen obtener
datos de dominio temporal a partir de la señal residual y obtener
datos de dominio frecuencial a partir de la señal residual, ya sean
llevadas a cabo por separado o en combinación con otras etapas de
procesamiento de señales.
Las etapas de procesamiento conllevan un cálculo
de coste en función de una medida de longitud de la línea o forma de
onda que en la presente memoria descriptiva se denomina "longitud
de arco". La longitud de arco o su cuadrado se calcula y usa como
un parámetro de coste asociado a la señal residual. Los parámetros
de filtrado se ajustan selectivamente mediante iteración hasta que
se reduce al mínimo el parámetro de coste. Una vez reducido al
mínimo el parámetro de coste, la señal residual se usa para
representar una señal fuente obtenida. Los parámetros de filtrado,
asociados al parámetro de coste reducido al mínimo, también se
pueden usar para construir el filtro de un sintetizador de modelos
de fuente y filtro.
El uso de este procedimiento tiene como
resultado una suavidad o continuidad de los parámetros de salida.
Cuando dichos parámetros se usan para construir un sintetizador de
modelos de fuente y filtro, la forma de onda sintetizada suena
extraordinariamente natural, sin distorsiones debidas a
discontinuidades. Para poner en práctica la invención se puede usar
una clase de funciones de coste, basada en la medida de longitud de
arco. En la siguiente memoria descriptiva se describen varios
elementos de esta clase. Otros resultarán evidentes para los
expertos en la materia.
Para un entendimiento más completo de la
invención, sus objetivos y ventajas, véase la siguiente memoria
descriptiva y los dibujos adjuntos.
Figura 1 es un diagrama de bloques del aparato
que se prefiere actualmente para la práctica de la invención.
Figura 2 es un diagrama de flujo que ilustra el
procedimiento de conformidad con la invención.
Figura 3 es un diagrama de formas de onda que
ilustra el cálculo de longitud de arco aplicado a una señal residual
de ejemplo.
Figura 4a ilustra el resultado de un función de
coste de longitud elevada al cuadrado de una frase hablada de
ejemplo, que ilustra frecuencias derivadas de formantes frente a
tiempo.
Figura 4b ilustra el resultado conseguido usando
una convencional codificación predictiva lineal (LPC) sobre la frase
de ejemplo utilizada en la Figura 4a.
Figura 5 ilustra varias funciones
discriminatorias de líneas etiquetadas por separado, representando
la línea A la longitud de arco media de la forma de onda de dominio
temporal, representando la línea B la longitud de onda media de la
forma de onda de filtrado inverso, ilustrando la línea C el índice
de cruce de curvas en punto cero, ilustrando la línea D la
diferencia ampliada de los parámetros que se muestran en las líneas
A y B.
Las técnicas de la invención dan por supuesto un
modelo de fuente y filtro de producción de habla (u otra forma de
onda compleja, tal como una forma de onda que produce un instrumento
musical). Un modelo de filtro, del tipo que tiene un conjunto
asociado de parámetros de filtrado, define el modelo. Por ejemplo,
el filtro puede ser una cascada de filtros de resonancia IIR
(también conocido como un filtro para todo polo). En tal caso, los
parámetros de filtrado pueden ser, por ejemplo, la frecuencia
central y el ancho de banda de cada resonador de la cascada.
Asimismo se pueden usar otros tipos de modelos de filtros.
Con frecuencia, el modelo de filtro también
incluye, de manera explícita o implícita, una restricción que se
puede describir fácilmente en términos matemáticos o cuantitativos.
Un ejemplo de dicha restricción se produce cuando una cantidad que
se puede medir se mantiene constante incluso cuando se cambian los
parámetros de filtrado a cualquiera de sus valores posibles.
Ejemplos específicos de dichas restricciones incluyen:
- (1)
- se ahorra energía cuando atraviesa el filtro
- (2)
- una señal de CC se atraviesa sin cambios (es decir, una ganancia en CC de 1) o, más en general,
- (3)
- la función de transferencia de filtros, H(z), siempre es 1 en algún punto determinado del plano Z.
La presente invención utiliza una función de
coste diseñada para favorecer propiedades de una fuente real. En el
caso del habla, la fuente real es una onda de presión asociada a la
fuente glotal durante la entonación. Tiene propiedades de
continuidad, cuasi-periodicidad y, con frecuencia,
un punto de concentración (o intervalos de tonos) cuando la glotis
se cierra momentáneamente entre cada abertura de la glotis. En el
caso de un instrumento musical, la fuente real puede ser la onda de
presión asociada a una lengüeta vibrante, por ejemplo, de un
instrumento de viento.
La propiedad más importante que la función de
coste de la presente invención intenta cuantificar es la presencia
de resonancias inducidas por el conducto vocal o el cuerpo de
instrumento musical. La función de coste se aplica a la residual del
filtrado inverso de la señal musical o vocal original. Dado que el
filtro inverso se ajusta de manera iterativa, se llegará a un punto
en el que se habrán eliminado las resonancias y, por consiguiente,
la función de coste estará a un mínimo. La función de coste debería
ser sensible a las resonancias inducidas por el conducto vocal o el
cuerpo de instrumento, pero debería ser insensible a las resonancias
inherentes de la fuente glotal o de la fuente sonora del
instrumento. Esta distinción se puede conseguir dado que sólo las
resonancias inducidas dan lugar a una perturbación oscilatoria en la
forma de onda residual del dominio temporal o a incursiones externas
en la curva de dominio frecuencial. En cualquier caso, se detecta un
aumento de la longitud de arco de la forma de onda o curva. Por el
contrario, la LPC no hace esta distinción y, por consiguiente, usa
partes del filtro para modelar características de la fuente glotal o
de la fuente sonora del instrumento.
La Figura 1 ilustra un sistema según la
invención mediante el cual se puede obtener la forma de onda fuente
a partir de una señal compleja de entrada. En el proceso de
obtención se usa un par de filtro inverso/filtro.
En la Figura 1, el filtro 10 está definido por
su modelo de filtro 12 y por parámetros de filtrado 14. Asimismo, la
presente invención utiliza un filtro inverso 16 que corresponde al
inverso del filtro 10. Por ejemplo, el filtro 16 tendría los mismos
parámetros de filtrado que el filtro 10, pero en cada posición en la
que el filtro 10 tiene polos se reemplazarían por ceros. Por lo
tanto, el filtro 10 y el filtro inverso 16 definen un sistema
recíproco en el cual el efecto del filtro 10 invalida o invierte el
efecto del filtro inverso 16. Por consiguiente, como se ilustra, una
forma de onda vocal introducida en el filtro inverso 16 y,
posteriormente, procesada por medio del filtro 10 tiene como
resultado una forma de onda de salida que, en teoría, es idéntica a
la forma de onda de entrada. En la práctica, ligeras variaciones en
la tolerancia del filtro o ligeras diferencias entre los filtros 16
y 10 tendrían como resultado una forma de onda de salida que se
desvía en cierto modo de la concordancia idéntica de la forma de
onda de
entrada.
entrada.
Cuando una forma de onda vocal (u otra forma de
onda compleja) se procesa a través del filtro inverso 16, la señal
residual de salida en el nodo 20 se procesa utilizando una función
de coste 22. En términos generales, dicha función de coste analiza
la señal residual según una o más de una pluralidad de funciones de
procesamiento, que se describen detalladamente más adelante, para
producir un parámetro de coste. El parámetro de coste se usa
entonces en posteriores etapas de procesamiento para ajustar los
parámetros de filtrado 14 en un esfuerzo de reducir al mínimo el
parámetro de coste. En la Figura 1, el bloque para reducir al mínimo
el coste 24 representa esquemáticamente el procedimiento mediante el
cual los parámetros de filtrado se ajustan selectivamente para
producir una reducción resultante del parámetro de coste. Esto se
puede llevar a cabo de manera iterativa, usando un algoritmo que
ajusta de manera incremental los parámetros de filtrado a la vez que
busca el coste mínimo.
Una vez conseguido el coste mínimo, la señal
residual resultante en el nodo 20 se puede usar entonces para
representar una señal de fuente obtenida para síntesis posterior de
modelos de fuente y filtro. Los parámetros de filtrado 14 que
producen el coste mínimo se usan como los parámetros de filtrado
para definir el filtro 10 para uso en síntesis posterior de modelos
de fuente y filtro.
La Figura 2 ilustra el procedimiento mediante el
cual se obtiene la señal de formantes, y se identifican los
parámetros de filtrado, para conseguir un sistema de síntesis de
modelos de fuente y filtro de conformidad con la invención.
En primer lugar, en la etapa 50, se define un
modelo de filtro. Se puede usar cualquier modelo de filtro adecuado
que se preste a una representación parametrizada. Posteriormente,
en la etapa 52, se suministra un conjunto inicial de parámetros. Se
debe tener en cuenta que el conjunto inicial de parámetros se
modificará de manera iterativa en etapas posteriores de
procesamiento para buscar los parámetros que corresponden a una
función de coste reducida al mínimo. Se pueden usar técnicas
diferentes para evitar una solución sub-óptima correspondiente a
mínimos locales. Por ejemplo, el conjunto inicial de parámetros que
se usa en la etapa 52 se puede seleccionar de un conjunto o matriz
de parámetros diseñados para suministrar varios puntos de partida
diferentes a fin de evitar los mínimos locales. Por lo tanto, en la
Figura 2, se debe tener en cuenta que la etapa 52 se puede llevar a
cabo varias veces para diferentes conjuntos iniciales de
parámetros.
El modelo de filtro definido en la etapa 50 y el
conjunto inicial de parámetros definido en la etapa 52 se usan
entonces en la etapa 54 para construir un filtro (como en la etapa
56) y un filtro inverso (como en la etapa 58).
A continuación, la señal vocal se aplica al
filtro inverso en la etapa 60 para obtener una señal residual como
en la etapa 64. Como se ilustra, la forma de realización preferida
usa una ventana Hanning centrada en los intervalos actuales de tonos
y ajustada de modo que cubre períodos de dos tonos. También son
posibles otras ventanas. En la etapa 66 se procesa la señal residual
para obtener puntos de datos para uso en el cálculo de la longitud
de arco.
La señal residual se puede procesar de varias
maneras diferentes para obtener los puntos de datos. Como se ilustra
en la etapa 68, el procedimiento puede bifurcarse a una o más de una
clase seleccionada de rutinas de procesamiento. Ejemplos de tales
rutinas se ilustran en la etapa 70. A continuación, en la etapa 72,
se lleva a cabo el cálculo de la longitud de arco (o longitud al
cuadrado). El valor resultante hace las veces de un parámetro
de
coste.
coste.
Tras calcular el parámetro de coste del conjunto
inicial de parámetros de filtrado, en la etapa 74 se ajustan
selectivamente los parámetros de filtrado y se repite el
procedimiento de manera iterativa como se representa en la etapa 76
hasta que se consigue un coste mínimo.
Una vez conseguido el coste mínimo, la señal
residual obtenida correspondiente a ese coste mínimo se usa en la
etapa 78 como la señal fuente. Los parámetros de filtrado asociados
al coste mínimo se usan como los parámetros de filtrado (etapa 80)
de un modelo de fuente y filtro.
Los datos de entrada de la forma de onda vocal
se pueden analizar en tramas usando una ventana móvil para
identificar entramados sucesivos. Actualmente, a tal efecto, se
prefiere el uso de una ventana Hanning. La ventana Hanning se puede
modificar para que sea asimétrica. Se centra en intervalos actuales
de tonos y llega a cero en intervalos de tonos adyacentes, cubriendo
de ese modo períodos de dos tonos. Si se desea, se puede incluir un
componente multiplicador lineal adicional para compensar la mayor o
menor amplitud de la señal vocal
entonada.
entonada.
El procedimiento iterativo que se usa para
identificar el coste mínimo puede adoptar varios enfoques
diferentes. Un enfoque es una búsqueda exhaustiva. Otro es una
aproximación a una búsqueda exhaustiva utilizando un algoritmo de
búsqueda de descenso más pronunciado. El algoritmo de búsqueda se
debería construir de tal manera que no se eligieran los mínimos
locales como el valor mínimo de coste. Para evitar el problema de
los mínimos locales se pueden seleccionar diferentes puntos de
partida y ejecutarlos de manera iterativa hasta que se llega a una
solución. Posteriormente, se selecciona la mejor solución (valor de
coste inferior). Alternativamente, o además, se pueden usar
algoritmos heurísticos de suavizado para eliminar algunos de los
mínimos locales. Estos algoritmos se describen detalladamente a
continuación.
Se pueden usar uno o más elementos de una clase
de funciones de coste para descubrir la señal residual que
representa mejor la señal fuente. Común a la familia o clase de
funciones de coste es un concepto que se denomina "longitud de
arco". La longitud de arco corresponde a la longitud de la línea
que se puede trazar para representar la forma de onda en un espacio
multidimensional. La señal residual se puede procesar mediante una
serie de técnicas diferentes (se describen más adelante) para
obtener un conjunto de puntos de datos que representan una curva.
Dicha representación consiste en una secuencia de puntos que definen
una serie de segmentos rectilíneos que dan una aproximación lineal
por segmentos rectilíneos de la curva. Esto se ilustra en la Figura
3. La curva también se puede representar usando aproximaciones por
interpolación o líneas curvas. (El término longitud de arco no
pretende dar a entender que los segmentos son sólo líneas curvas).
El cálculo de la longitud de arco conlleva calcular la suma de las
longitudes de segmentos múltiples para, de ese modo, determinar la
longitud de la línea. La forma de realización que se prefiere
actualmente usa un cálculo pitagórico para medir la longitud de
arco. Por lo tanto, la longitud de arco se puede medir utilizando la
siguiente ecuación:
longitud \ de
\ arco = \sum\limits_{n = 1}^{N} \sqrt{(x_{n} - x_{n - 1})^{2} +
(y_{n} - y_{n -
1})^{2}}
Alternativamente, el término longitud de arco,
según se usa en la presente memoria descriptiva, puede incluir la
longitud al cuadrado:
longitud \ al
\ cuadrado = \sum\limits_{n = 1}^{N} \{(x_{n} - x_{n - 1})^{2} +
(y_{n} - y_{n -
1})^{2}\}
En las ecuaciones anteriores (x_{n}, y_{n})
es una secuencia de puntos de datos.
Existe una clase de funciones de coste, basada
en la longitud de arco, que se pueden usar para obtener una señal de
formantes. Elementos de la clase incluyen:
- (1)
- longitud de arco de la forma de onda residual con ventana frente a tiempo
- (2)
- longitud al cuadrado de la forma de onda residual con ventana frente a tiempo,
- (3)
- longitud de arco de la magnitud espectral logarítmica de la residual con ventana frente a frecuencia mel,
- (4)
- longitud de arco en el plano z del espectro complejo de la residual con ventana, parametrizada por frecuencia,
- (5)
- longitud al cuadrado en el plano z del espectro complejo de la residual con ventana, parametrizada por frecuencia,
- (6)
- longitud de arco en el plano z del logaritmo complejo del espectro complejo de la residual con ventana, parametrizada por frecuencia.
Si bien en este caso se analizan explícitamente
seis elementos de la clase, también se prevén otras aplicaciones que
conllevan el cálculo de longitud de arco o de longitud al
cuadrado.
Los últimos cuatro elementos que se han
enumerado anteriormente se calculan en el dominio frecuencial usando
una FFT de tamaño adecuado para calcular el espectro. Por ejemplo,
respecto al elemento 6 anterior, si Y_{n}=
R_{n}*exp(j*\theta_{n}) es la FFT de tamaño N.
\vskip1.000000\baselineskip
coste =
\sum\limits_{n = 1}^{N} \sqrt{log^{2} + \left(\frac{R_{n}}{R_{n -
1}}\right) + (\theta_{n} - \theta_{n -
1})^{2}}
\vskip1.000000\baselineskip
En funciones de coste que incluyen el espectro
de magnitud logarítmica, el suavizado puede eliminar algunos
problemas relacionados con los mínimos locales, eliminando los
efectos de armónicos o ceros marcados. Una función de suavizado
adecuada a tal efecto puede ser un FIR de 3, 5 y 7 puntos, una LPC y
un suavizado Cepstral, con suavizado heurístico para eliminar
inclinaciones. La función de suavizado se puede poner en práctica
como sigue: en ventanas de 3, 5 ó 7 puntos del espectro de magnitud
logarítmica, los valores bajos se reemplazan por la media de dos
puntos circundantes superiores o, en caso de que no existieran los
puntos superiores, el punto deseado se deja sin cambios.
Los procedimientos que se han descrito
anteriormente para obtener señales de formantes son intrínsecamente
sincrónicos de tonos. Por consiguiente, es necesaria una estimación
inicial de intervalos de tonos. En aplicaciones en las que el
objetivo es la síntesis de texto a habla, puede ser aconsejable
tener un marcado de los intervalos de tonos muy preciso a fin de
llevar a cabo una modificación prosódica posterior. Se ha observado
que los procedimientos que se han descrito anteriormente funcionan
bien en la obtención de tonos y en el marcado de intervalos.
Específicamente, el seguimiento de tonos se
puede llevar a cabo mejor aplicando una longitud de arco de la forma
de onda residual con ventana frente a tiempo (1) con la restricción
de que la salida de filtro se normaliza de manera que la magnitud
máxima es constante. Esto suaviza la forma de onda residual, pero
mantiene el tamaño del pico de tono. Por lo tanto, se puede aplicar
la autocorrelación y es menos probable que experimente armónicos
superiores.
La forma de onda residual pico con frecuencia es
una aproximación coherente al intervalo de tonos, no obstante, a
menudo dicho tono es estridente o desigual, provocando falta de
precisión. Se ha descubierto que cuando el filtro inverso suprimía
satisfactoriamente los formantes, la fase de la residual se
aproximaba a una fase lineal (al menos en las frecuencias más
bajas). Si el original del análisis FFT se centra en el tiempo
aproximado de intervalos, la fase es prácticamente plana.
Beneficiándose de esto, el punto de intervalos
puede ser uno de los parámetros del espacio de reducción al mínimo
cuando la función de coste incluye fase. Las funciones de coste (3),
(4) y (5) que se han enumerado anteriormente incluyen fase. Por lo
tanto, en estos casos, el tiempo de intervalos se puede incluir como
un parámetro en la optimización. Esto produce resultados muy
coherentes de marcado de intervalos, siempre que la señal vocal no
sea demasiado baja. Además, la precisión de la estimación de valores
de formantes correspondientes a funciones de coste de dominio
frecuencial se puede mejorar considerablemente mediante la
optimización simultánea del punto de intervalos de tonos y la
alineación correspondiente de la ventana de análisis.
Algunas de las funciones de coste, tales como la
función de coste (5), se prestan a soluciones analíticas. Por
ejemplo, la función de coste (5) con una restricción lineal de los
coeficientes de filtro se puede solucionar analíticamente. Asimismo,
se puede encontrar una solución analítica aproximada usando la
función (4). Esto puede ser importante en algunas aplicaciones para
conseguir velocidad y fiabilidad.
Respecto al caso de función de coste (5)
define
\vskip1.000000\baselineskip
P_{i, j} =
\sum\limits_{k = 0}^{N - 1} X_{k - 1} \cdot X_{k -j} \cdot
\left(1 - cos \left(\frac{2\pi (k - cntr}{N}\right)
\right)
\vskip1.000000\baselineskip
En la que X_{n} es la forma de onda residual,
M es el orden de análisis, N es el tamaño en puntos de la ventana de
análisis y cntr es el índice de puntos de muestra calculado de
intervalos de tonos.
Por lo tanto, si A_{i} es la secuencia de
coeficientes de filtro inverso y B_{i} es una secuencia de
constantes que definen una restricción lineal de los coeficientes
A_{i}, de tal manera que B_{0}*A_{0}+ ... + B_{M}*A_{M}=1,
entonces A_{i} se puede resolver en la siguiente ecuación
matricial:
\vskip1.000000\baselineskip
Fijando B_{I}=1 para i=0,... M da una
restricción (A). Fijando B_{I}=1 y B_{i}=0 para i=1,... M da una
restricción (B).
Para hallar una solución aproximada para la
función de coste (4) en la ecuación matricial anterior, se
reemplaza
P_{i,} _{j} por:
P_{i,} _{j} por:
P_{i, j} =
\sum\limits_{k, 1 = 0}^{N - 1} \left\{X_{k - 1} \cdot X_{1 - j}
\cdot cos \left(\pi \frac{k - 1}{N}\right) - cos \left(\pi \frac{k +
1 - 2.cntr}{N}\right) \cdot S_{k -
1}\right\}
en la
que
S_{m} =
\sum\limits_{n = 0}^{N12 - 1} \left\{(n + 1)^{a} \cdot cos
\left(2\pi \frac{(n +
0.5)m}{N}\right)\right\}
En esta ecuación, el término,
(n+1)^{\Lambda}, representa una fuente idealizada. Cuando
alfa es igual a cero, la ecuación se reduce a la de la función de
coste (5). Fijando \Lambda = 2 da, aproximadamente, resultados
equivalentes a la función de coste (4).
El procedimiento anterior se centra en el efecto
de un filtro de resonancia en una fuente ideal. Una fuente ideal
tiene fase lineal y una envolvente espectral de caída suave. Cuando
una fuente ideal de este tipo se aplica a un filtro de resonancia el
filtro produce un rodeo circular en el corto recorrido del espectro
complejo. La técnica de reducción al mínimo de la longitud de arco
pretende eliminar el rodeo usando tanto información de fase como de
magnitud. Es por esto por lo que las funciones de coste de dominio
frecuencial funcionan bien. En comparación, la LPC convencional da
por supuesto una fuente blanca e intenta alisar el espectro de
magnitud. No obstante, no tiene en cuenta la fase y, por lo tanto,
predice resonancias para modelar las características de fuente.
Quizás una de las funciones de coste más sólida
es utilizar simultáneamente tanto información de fase como de
magnitud. Para utilizar información de fase y de magnitud simultánea
en una función de coste de dominio frecuencial se tienen en cuenta
otros supuestos acerca del filtro. Se da por supuesto que el filtro
es una cascada de polos y ceros (resonancias de segundo orden y
anti-resonancias). Se trata de un supuesto razonable
dado que un tubo ideal tiene la acústica de una cascada de polos,
mientras que un tubo con una abertura lateral (tal como la cavidad
nasal) se puede modelar añadiendo ceros a la cascada.
Diseñar la función de coste para utilizar tanto
información de fase como de magnitud conlleva tener en cuenta cómo
un único polo afectará al espectro complejo (transformada de
Fourier) de una fuente ideal que se da por supuesto que tiene una
fase casi plana, casi lineal y una magnitud de caída lenta y suave
con una frecuencia básica muy por debajo de la frecuencia del polo.
La función de coste debería rechazar los efectos del polo.
Si se tiene en cuenta la trayectoria del
espectro complejo, continuando desde la frecuencia cero hasta el
ancho de banda límite, se observa que adopta un recorrido sinuoso
que depende de la forma de onda. Si la forma de onda es de una
fuente ideal, el recorrido es bastante simple. Se inicia cerca del
origen del acceso real y se mueve rápidamente, en una línea recta,
hacia un punto cuya distancia refleja la intensidad de la frecuencia
básica. Posteriormente, retorna muy lentamente, en una línea recta
de vuelta hacia el origen. Cuando se aplica a la fuente un único
polo, la trayectoria toma un rodeo en un recorrido circular en el
sentido de las agujas del reloj y luego continua. Dicho rodeo es
conforme a la respuesta de frecuencia conocida de un polo. Según
aumenta la intensidad del polo (es decir, ancho de banda más
estrecho) aumenta el tamaño del rodeo circular. Nuevamente, se puede
aplicar la longitud de arco para reducir al mínimo el rodeo y
mejorar, de ese modo, el rendimiento de la función de coste. Una
función de coste basada en la longitud de arco del espectro complejo
en el plano Z, parametrizada por frecuencia, hace las veces de una
función de coste especialmente ventajosa para analizar
formantes.
Asimismo, se ha observado que otras dos
funciones de coste del mismo tipo tienen excelentes resultados. La
primera se define añadiendo la distancia al cuadrado de cada etapa
cuando se cruza el recorrido del espectro. Esta es realmente más
sencilla, desde el punto de vista del cálculo, que algunas otras
técnicas, dado que no exige sacar una raíz cuadrada. La segunda de
dichas funciones de coste se define tomando el logaritmo del
espectro complejo y calculando la longitud de arco de esa
trayectoria en el plano Z. Dicha función de coste es más equilibrada
en su sensibilidad a polos y ceros.
Todas las funciones de coste de "recorrido del
espectro" anteriores parecen funcionar muy bien. Dado que tienen
características diferentes, una u otra pueden ser más útiles para
una aplicación específica. Las que son susceptibles de una solución
analítica matemática pueden representar la mejor elección cuando es
necesario fiabilidad y velocidad de cálculo.
La Figura 4a muestra el resultado de función de
coste de la longitud elevada al cuadrado de la frase "coming
up". Se trata de un gráfico de frecuencias derivadas de
formantes frente a tiempo. Asimismo, se incluye el ancho de banda
como la longitud de las pequeñas líneas transversales. Obsérvese que
no existen señales deformadas ni desplazamientos de filtro, tal como
normalmente aparecen en el análisis LPC.
En la Figura 4b se muestra la misma frase,
analizada usando LPC. En cada gráfico, la forma de onda se muestra
en la parte superior y el gráfico encima de la forma de onda es el
tono que se obtiene usando el filtro inverso con
autocorrelación.
La Figura 5 muestra varias funciones
discriminatorias. La función (A) es la longitud de arco media de la
forma de onda de dominio temporal. La función (B) es la longitud de
arco media de la forma de onda de filtrado inverso. La función (C)
ilustra el índice de cruce de curvas en punto cero (una propiedad no
directamente aplicable en este caso, pero que se muestra a efectos
de perfección). La función (D) es la diferencia ampliada de los
parámetros (A) y (B). La función de diferencia (D) parece tomar un
valor bajo o negativo, dependiendo de cómo están de constreñidos los
articuladores. En particular, se debe tener en cuenta que durante la
"m" contenida dentro de la frase "coming up" los
articuladores están constreñidos. Esta característica se puede usar
para detectar nasales y los limites entre nasales y vocales.
Se desarrolló un tipo de filtrado previo para
análisis que aumentaba considerablemente la precisión, especialmente
de marcado de intervalos de tonos. Esto se aplica cuando el análisis
usa una función de coste no logarítmica del dominio frecuencial. En
ese caso, el análisis es muy sensible a las bajas frecuencias y, por
lo tanto, se encontraron alteraciones derivadas de un soplo de aire
u otras fuentes de baja frecuencia. Un simple filtrado de paso alto
con filtros FIR parecía empeorar las cosas.
Se puso en práctica la siguiente solución:
Durante la optimización de una función de coste, la forma de onda
vocal original, con ventana en dos impulsos glotales, se filtra
inversamente de manera repetida. La forma de onda de entrada,
x[n], se modifica restando un polinomio en n, A*n*n + B*n +
C, en la que n=0 es el punto de intervalos, así como el origen de la
FFT que se usa en la función de coste. Esto significa que se da por
supuesto que la distorsión a baja frecuencia se aproxima mediante
una forma de onda polinomial aditiva sobre la ventana de dos
períodos. Para hallar A, B, C, los mismos se incluyen en la
optimización con el objetivo de reducir al mínimo la función de
coste. Se observó que un modo no incurría en demasiado cálculo
adicional. El resultado fue un efecto de paso elevado que mejoró el
análisis y el marcado de intervalos en partes de baja amplitud de la
forma de onda.
Para evaluar la precisión se pusieron en
práctica dos medidas de distancia espectral y se realizó una prueba
de comparación del habla sintética. La primera medida se basa en la
distancia, en el plano Z, entre el polo deseado y el polo que se
calculó mediante el procedimiento de análisis. La distancia se
calculó de manera independiente para los formantes uno a cuatro, así
como también para la suma de los cuatro, y se acumuló a toda la
expresión de prueba.
La segunda medida es la medida de distorsión de
sumas de la potencia de la raíz (RPS) (sensibilidad espectral
pico), definida por
dist =
\sum\limits_{k = 1}^{N} (k \cdot (cl_{k} -
c2_{k}))^{2}
en la que cl_{k} y c2_{k} son
el coeficiente cepstral kth del espectro deseado y del espectro
analizado, respectivamente, y N se eligió lo suficientemente grande
como para que representara de manera adecuada el espectro
logarítmico.
El análisis se llevó a cabo en una oración
completamente entonada, "Where were you a year ago?" que
se produjo mediante un sintetizador de formantes basado en reglas.
Se enfatizaron varias palabras para provocar un patrón de entonación
bastante extremo. El sintetizador de formantes produjo seis
formantes, y cada procedimiento de análisis localizó seis, no
obstante, en las medidas de distancia sólo se tuvieron en cuenta los
cuatro primeros formantes. Los parámetros de formantes conocidos del
sintetizador hicieron las veces de valores deseados.
Como referencia, la oración se analizó mediante
LPC estándar de orden 16, usando el procedimiento de estimación de
autocorrelación. La LPC se realizó sincrónicamente por tonos,
similar a los otros procedimientos y la ventana fue una ventana
Hanning centrada en períodos de dos tonos. Los polos de modelado de
formantes se separaron de los polos de modelado de fuentes
seleccionando las resonancias más intensas (es decir, los anchos de
banda más estrechos). El análisis LPC cometió varios errores de
discontinuidad, sin embargo para las mediciones de precisión, dichos
errores se corrigieron manualmente mediante la reasignación de
formantes.
Para el análisis se puede usar cualquier
combinación de función de coste y restricción de filtro, no
obstante, algunas de dichas combinaciones dan resultados muy
insuficientes. Las combinaciones no productivas no se tuvieron en
cuenta. Combinaciones con un rendimiento bastante bueno, como se
enumera en la Tabla 1, para compararlas con ellas mismas y con LPC.
La escala o unidades asociadas a estos números es arbitraria, pero
los valores relativos dentro de una columna son comparables.
Distancia de polos del plano Z correspondiente a
formantes.
Suponiendo que dichas medidas de distancia son
válidas, en general, se llega a la conclusión de que las funciones
de coste a partir del dominio frecuencial y el uso del
constreñimiento de ganancia unidad en CC superan la precisión de la
LPC. Especialmente perceptible es su mejora respecto a la precisión
del primer formante.
Se puede llegar a la conclusión de que los
procedimientos (3A), (4A) y (6A) son, igualmente, posibles
candidatos para una aplicación de análisis, no obstante, se deben
tener en cuenta factores adicionales. Los mismos se refieren a
mínimos locales y convergencia. Los procedimientos (3A) y (6A), que
conllevan el logaritmo, tienen muchas más probabilidades de
encontrar mínimos locales y converger más lentamente. Esto es poco
acertado dado también son los que tienen más posibilidades de
rastrear ceros.
Los procedimientos (4A) y (5A) casi nunca
encuentran mínimos locales, de hecho, respecto al procedimiento (5A)
todavía no se han observado mínimos locales. Por otro lado, dichos
procedimientos suelen calcular anchos de banda demasiado estrechos.
Por lo tanto, respecto a los mismos, se añadía una pequeña
desventaja a la función de coste para rechazar anchos de banda
demasiado estrechos. Si bien, en general, el procedimiento (5A) es
inferior, puede ser muy útil dado que rastrea de manera precisa el
formante uno con convergencia más rápida y sin mínimos locales.
Si bien la invención se ha descrito en su forma
preferida de realización en la actualidad, se entenderá que la
invención permite ciertas modificaciones sin apartarse del alcance
de la invención según se expone en las reivindicaciones
adjuntas.
Claims (7)
1. Un procedimiento para obtener una señal
fuente basada en formantes y en parámetros de filtrado a partir de
una señal vocal, que comprende:
- a.
- definir (50) un modelo de filtro del tipo que tiene un conjunto asociado de parámetros de filtrado,
- b.
- proporcionar (54) un primer filtro basado en dicho modelo de filtro (12),
- c.
- suministrar (60) dicha señal vocal a dicho primer filtro para generar una señal residual,
- d.
- procesar (66) dicha señal residual para obtener un conjunto de puntos de datos que definen una línea de segmentos múltiples y calcular una medida de longitud de dicha línea con el fin de determinar un parámetro de coste asociado a dicha señal residual,
- e.
- ajustar selectivamente (74) dichos parámetros de filtrado para producir una reducción resultante de dicho parámetro de coste,
- f.
- repetir de manera iterativa (76) las etapas c - e hasta que dicho parámetro de coste se reduzca al mínimo y, posteriormente, utilizar dicha señal residual, para representar una señal fuente obtenida y los parámetros de filtrado.
2. El procedimiento de la reivindicación 1 que
comprende además proporcionar un segundo filtro correspondiente al
inverso de dicho primer filtro para uso en el procesamiento de dicha
señal fuente obtenida para generar habla sintetizada.
3. El procedimiento de la reivindicación 1 en el
que dicha etapa d se lleva a cabo obteniendo (70) datos de dominio
temporal a partir de dicha señal residual.
4. El procedimiento de la reivindicación 1 en el
que dicha etapa d se lleva a cabo obteniendo (70) datos de dominio
temporal a partir de dicha señal residual y calculando la longitud
al cuadrado de la distancia a través de dichos datos de dominio
temporal.
5. El procedimiento de la reivindicación 1 en el
que dicha etapa d se lleva a cabo obteniendo (70) la magnitud
espectral logarítmica de dicha señal residual en el dominio
frecuencial.
6. El procedimiento de la reivindicación 1 en el
que dicha etapa d se lleva a cabo obteniendo (70) el espectro
complejo del plano z de dicha señal residual parametrizada por
frecuencia.
7. El procedimiento de la reivindicación 1 en el
que dicha etapa d se lleva a cabo obteniendo (70) el logaritmo
complejo del plano z del espectro complejo de dicha señal residual
parametrizada por frecuencia.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US200335 | 1988-05-31 | ||
| US09/200,335 US6195632B1 (en) | 1998-11-25 | 1998-11-25 | Extracting formant-based source-filter data for coding and synthesis employing cost function and inverse filtering |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2274606T3 true ES2274606T3 (es) | 2007-05-16 |
Family
ID=22741284
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES99309294T Expired - Lifetime ES2274606T3 (es) | 1998-11-25 | 1999-11-22 | Procedimiento y aparato para obtener datos de fuente y filtro basados en formantes, para codificacion y sintesis, utilizando funcion de coste y filtrado inverso. |
Country Status (5)
| Country | Link |
|---|---|
| US (1) | US6195632B1 (es) |
| EP (1) | EP1005021B1 (es) |
| JP (1) | JP3298857B2 (es) |
| DE (1) | DE69933188T2 (es) |
| ES (1) | ES2274606T3 (es) |
Families Citing this family (34)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR100308016B1 (ko) | 1998-08-31 | 2001-10-19 | 구자홍 | 압축 부호화된 영상에 나타나는 블럭현상 및 링현상 제거방법및 영상 복호화기 |
| US6535643B1 (en) * | 1998-11-03 | 2003-03-18 | Lg Electronics Inc. | Method for recovering compressed motion picture for eliminating blocking artifacts and ring effects and apparatus therefor |
| US6725190B1 (en) * | 1999-11-02 | 2004-04-20 | International Business Machines Corporation | Method and system for speech reconstruction from speech recognition features, pitch and voicing with resampled basis functions providing reconstruction of the spectral envelope |
| EP1160764A1 (en) * | 2000-06-02 | 2001-12-05 | Sony France S.A. | Morphological categories for voice synthesis |
| EP1160766B1 (en) * | 2000-06-02 | 2005-08-10 | Sony France S.A. | Coding the expressivity in voice synthesis |
| US6963839B1 (en) | 2000-11-03 | 2005-11-08 | At&T Corp. | System and method of controlling sound in a multi-media communication application |
| JP2003241777A (ja) * | 2001-01-09 | 2003-08-29 | Kawai Musical Instr Mfg Co Ltd | 楽音のフォルマント抽出方法、記録媒体及び楽音のフォルマント抽出装置 |
| US7366712B2 (en) * | 2001-05-31 | 2008-04-29 | Intel Corporation | Information retrieval center gateway |
| KR100525785B1 (ko) * | 2001-06-15 | 2005-11-03 | 엘지전자 주식회사 | 이미지 화소 필터링 방법 |
| CN100367677C (zh) * | 2001-08-23 | 2008-02-06 | 西门子公司 | 用于在移动无线通信系统中无线信号滤波的适配滤波方法和滤波器 |
| US6721699B2 (en) | 2001-11-12 | 2004-04-13 | Intel Corporation | Method and system of Chinese speech pitch extraction |
| CN1302555C (zh) * | 2001-11-15 | 2007-02-28 | 力晶半导体股份有限公司 | 非易失性半导体存储单元结构及其制作方法 |
| US7062444B2 (en) * | 2002-01-24 | 2006-06-13 | Intel Corporation | Architecture for DSR client and server development platform |
| US20030139929A1 (en) * | 2002-01-24 | 2003-07-24 | Liang He | Data transmission system and method for DSR application over GPRS |
| WO2004010665A2 (en) * | 2002-07-18 | 2004-01-29 | Qualcomm Incorporated | Method and apparatus for hybrid decision feedback equalization |
| EP1439525A1 (de) * | 2003-01-16 | 2004-07-21 | Siemens Aktiengesellschaft | Optimierung der Übergangsstörung |
| US6965859B2 (en) * | 2003-02-28 | 2005-11-15 | Xvd Corporation | Method and apparatus for audio compression |
| US6988068B2 (en) * | 2003-03-25 | 2006-01-17 | International Business Machines Corporation | Compensating for ambient noise levels in text-to-speech applications |
| EP1665228A1 (en) * | 2003-08-11 | 2006-06-07 | Faculté Polytechnique de Mons | Method for estimating resonance frequencies |
| KR100511316B1 (ko) * | 2003-10-06 | 2005-08-31 | 엘지전자 주식회사 | 음성신호의 포만트 주파수 검출방법 |
| US7596494B2 (en) * | 2003-11-26 | 2009-09-29 | Microsoft Corporation | Method and apparatus for high resolution speech reconstruction |
| US20050171774A1 (en) * | 2004-01-30 | 2005-08-04 | Applebaum Ted H. | Features and techniques for speaker authentication |
| US7565213B2 (en) * | 2004-05-07 | 2009-07-21 | Gracenote, Inc. | Device and method for analyzing an information signal |
| DE102004044649B3 (de) * | 2004-09-15 | 2006-05-04 | Siemens Ag | Verfahren zur integrierten Sprachsynthese |
| JP5042485B2 (ja) * | 2005-11-09 | 2012-10-03 | ヤマハ株式会社 | 音声特徴量算出装置 |
| CN101051464A (zh) | 2006-04-06 | 2007-10-10 | 株式会社东芝 | 说话人认证的注册和验证方法及装置 |
| CA2724753A1 (en) | 2008-05-30 | 2009-12-03 | Nokia Corporation | Method, apparatus and computer program product for providing improved speech synthesis |
| ES2364401B2 (es) * | 2011-06-27 | 2011-12-23 | Universidad Politécnica de Madrid | Método y sistema para la estimación de parámetros fisiológicos de la fonación. |
| JP5093387B2 (ja) * | 2011-07-19 | 2012-12-12 | ヤマハ株式会社 | 音声特徴量算出装置 |
| JP5605731B2 (ja) * | 2012-08-02 | 2014-10-15 | ヤマハ株式会社 | 音声特徴量算出装置 |
| US8927847B2 (en) * | 2013-06-11 | 2015-01-06 | The Board Of Trustees Of The Leland Stanford Junior University | Glitch-free frequency modulation synthesis of sounds |
| US9484044B1 (en) | 2013-07-17 | 2016-11-01 | Knuedge Incorporated | Voice enhancement and/or speech features extraction on noisy audio signals using successively refined transforms |
| US9530434B1 (en) * | 2013-07-18 | 2016-12-27 | Knuedge Incorporated | Reducing octave errors during pitch determination for noisy audio signals |
| CN112270934B (zh) * | 2020-09-29 | 2023-03-28 | 天津联声软件开发有限公司 | 一种nvoc低速窄带声码器的语音数据处理方法 |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| USRE32124E (en) * | 1980-04-08 | 1986-04-22 | At&T Bell Laboratories | Predictive signal coding with partitioned quantization |
| US4944013A (en) * | 1985-04-03 | 1990-07-24 | British Telecommunications Public Limited Company | Multi-pulse speech coder |
| US5029211A (en) * | 1988-05-30 | 1991-07-02 | Nec Corporation | Speech analysis and synthesis system |
-
1998
- 1998-11-25 US US09/200,335 patent/US6195632B1/en not_active Expired - Lifetime
-
1999
- 1999-11-22 DE DE69933188T patent/DE69933188T2/de not_active Expired - Fee Related
- 1999-11-22 EP EP99309294A patent/EP1005021B1/en not_active Expired - Lifetime
- 1999-11-22 ES ES99309294T patent/ES2274606T3/es not_active Expired - Lifetime
- 1999-11-24 JP JP33261299A patent/JP3298857B2/ja not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| EP1005021A3 (en) | 2002-11-27 |
| US6195632B1 (en) | 2001-02-27 |
| EP1005021B1 (en) | 2006-09-13 |
| EP1005021A2 (en) | 2000-05-31 |
| JP2000231394A (ja) | 2000-08-22 |
| DE69933188D1 (de) | 2006-10-26 |
| DE69933188T2 (de) | 2007-08-02 |
| JP3298857B2 (ja) | 2002-07-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US6195632B1 (en) | Extracting formant-based source-filter data for coding and synthesis employing cost function and inverse filtering | |
| Cook | Identification of control parameters in an articulatory vocal tract model, with applications to the synthesis of singing | |
| Hess | Pitch determination of speech signals: algorithms and devices | |
| Johnson | Acoustic and auditory phonetics | |
| Childers | Glottal source modeling for voice conversion | |
| Kob | Physical modeling of the singing voice | |
| Lu | Toward a high-quality singing synthesizer with vocal texture control | |
| Gully et al. | Diphthong synthesis using the dynamic 3D digital waveguide mesh | |
| Degottex | Glottal source and vocal-tract separation | |
| Kim et al. | TAPS: Throat and acoustic paired speech dataset for deep learning-based speech enhancement | |
| Yoneyama et al. | Wavehax: Aliasing-free neural waveform synthesis based on 2D convolution and harmonic prior for reliable complex spectrogram estimation | |
| ES2374008A1 (es) | Codificación, modificación y síntesis de segmentos de voz. | |
| Agiomyrgiannakis et al. | ARX-LF-based source-filter methods for voice modification and transformation | |
| Jayan | Speech and Audio Signal Processing | |
| Kawahara et al. | Higher order waveform symmetry measure and its application to periodicity detectors for speech and singing with fine temporal resolution | |
| Bonada | Voice processing and synthesis by performance sampling and spectral models | |
| Höge | Evaluation of pitch marking algorithms | |
| OʼShaughnessy | Formant estimation and tracking | |
| Koreman | Decoding linguistic information in the glottal airflow | |
| Maison | Towards the characterization of dynamical resonators: measuring vocal tract resonances in singing | |
| CN120564735B (zh) | 基于人工智能的音频实时转换与分析管理系统及方法 | |
| Del Pozo | Voice source and duration modelling for voice conversion and speech repair | |
| i Barrobes | Voice Conversion applied to Text-to-Speech systems | |
| Kafentzis | Adaptive sinusoidal models for speech with applications in speech modifications and audio analysis | |
| Rugchatjaroen | Articulatory-Based English Consonant Synthesis in 2-D Digital Waveguide Mesh |