ES2364005T3 - PROCEDURE, DEVICE AND MEANS OF THE COMPUTER PROGRAM CODE FOR VOICE CONVERSION. - Google Patents

PROCEDURE, DEVICE AND MEANS OF THE COMPUTER PROGRAM CODE FOR VOICE CONVERSION. Download PDF

Info

Publication number
ES2364005T3
ES2364005T3 ES08804436T ES08804436T ES2364005T3 ES 2364005 T3 ES2364005 T3 ES 2364005T3 ES 08804436 T ES08804436 T ES 08804436T ES 08804436 T ES08804436 T ES 08804436T ES 2364005 T3 ES2364005 T3 ES 2364005T3
Authority
ES
Spain
Prior art keywords
parameters
wave
vocal tract
lsf
vector
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES08804436T
Other languages
Spanish (es)
Inventor
María Arantzazu DEL POZO ECHEZARRETA
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Del Pozo Echezarreta Maria Arantzazu
Fundacion Centro de Tecnologias de Interaccion Visual y Comunicaciones Vicomtech
Original Assignee
Del Pozo Echezarreta Maria Arantzazu
Fundacion Centro de Tecnologias de Interaccion Visual y Comunicaciones Vicomtech
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Del Pozo Echezarreta Maria Arantzazu, Fundacion Centro de Tecnologias de Interaccion Visual y Comunicaciones Vicomtech filed Critical Del Pozo Echezarreta Maria Arantzazu
Application granted granted Critical
Publication of ES2364005T3 publication Critical patent/ES2364005T3/en
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • G10L21/0364Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude for improving intelligibility
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/003Changing voice quality, e.g. pitch or formants
    • G10L21/007Changing voice quality, e.g. pitch or formants characterised by the process used
    • G10L21/013Adapting to target pitch
    • G10L2021/0135Voice conversion or morphing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/04Time compression or expansion
    • G10L21/057Time compression or expansion for improving intelligibility
    • G10L2021/0575Aids for the handicapped in speaking

Landscapes

  • Engineering & Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • Physics & Mathematics (AREA)
  • Quality & Reliability (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Numerical Control (AREA)
  • Auxiliary Devices For Music (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)

Abstract

Un procedimiento para convertir una señal de habla de un hablante fuente en un a señal de voz convertida, que comprende los pasos de: - una etapa de entrenamiento, en la cual: - dada una base de datos de entrenamiento de datos fuente y diana paralelos, para cada período de tono de dicha base de datos de entrenamiento: - modelar cada período de tono por medio de una onda glotal y un filtro de tracto glotal de acuerdo con el modelo de Lu y Smith, para obtener un conjunto de parámetros Liljencrants - Fant LF, dicho conjunto de parámetros LF comprende un parámetro de fuerza de excitación E e y un conjunto de parámetros T, T p, T e, T a, T c que modelan una onda glotal y un conjunto de coeficientes de filtro de tracto vocal omnipolar (α1...α p); - convertir dichos parámetros T, T p, T e, T a, T c en parámetros R g, R k, R a; - convertir dichos coeficientes de filtro de tracto vocal omnipolar (α 1...α p) en frecuencias espectrales en línea en la escala de Bark lsf 1...lsf p; - definir un vector glotal G a convertir; - definir un vector de tracto vocal de LSF a convertir, dicho vector de tracto vocal de LSF comprende dichas frecuencias espectrales en línea en la escala de Bark lsf 1...lsf p; - aplicar la eliminación del ruido de la ondícula para obtener una obtener una estimación del ruido de aspiración glotal; - a partir del conjunto de vectores de tracto vocal de LSF obtenidos para cada período de tono de dicha base de datos de entrenamiento, estimar una función de transformación lineal probabilística continua del tracto vocal usando el criterio de error cuadrático mínimo; el procedimiento se caracteriza porque dicha etapa de modelado comprende además los pasos de: - modelar dicha estimación del ruido de aspiración modulando el ruido gaussiano de la varianza unitaria próxima a cero con la mencionada onda glotal modelada y ajustando su energía ANE para coincidir con la mencionada estimación del ruido de aspiración; dicho vector glotal G a convertir comprende dicho parámetro de fuerza de excitación E e, dichos parámetros R, R g, R k , R a y dicha energía ANE de la estimación del ruido de aspiración, el procedimiento comprende además: - una etapa de conversión en la cual una onda de habla de prueba dada se modela y se transforma en un conjunto de parámetros E e', R g', R k, R a', ANE', LSF'; - una etapa de síntesis en la cual una onda de habla convertida se sintetiza a partir de dicho conjunto de parámetros convertidos E e', R g', R k, R a', ANE', LSF'.A method for converting a speech signal from a source speaker into a converted voice signal, comprising the steps of: - a training stage, in which: - given a training database of parallel source and target data , for each tone period of said training database: - model each tone period by means of a glotal wave and a glotal tract filter according to the Lu and Smith model, to obtain a set of Liljencrants parameters - Fant LF, said set of parameters LF comprises an excitation force parameter E e and a set of parameters T, T p, T e, T a, T c that model a glottal wave and a set of omnipolar vocal tract filter coefficients (α1 ... α p); - converting said parameters T, T p, T e, T a, T c into parameters R g, R k, R a; - converting said omnipolar vocal tract filter coefficients (α 1 ... α p) into in-line spectral frequencies on the Bark scale lsf 1 ... lsf p; - define a glotal vector G to convert; - defining an LSF vocal tract vector to be converted, said LSF vocal tract vector comprises said in-line spectral frequencies on the Bark scale lsf 1 ... lsf p; - apply the elimination of noise from the wavelet to obtain an estimate of the glotal aspiration noise; - from the set of LSF vocal tract vectors obtained for each tone period of said training database, estimate a function of continuous probabilistic linear transformation of the vocal tract using the minimum quadratic error criterion; The procedure is characterized in that said modeling step further comprises the steps of: - modeling said estimation of the aspiration noise by modulating the Gaussian noise of the unit variance close to zero with the aforementioned modeled glotal wave and adjusting its ANE energy to coincide with the aforementioned suction noise estimation; said glotal vector G to be converted comprises said excitation force parameter E e, said parameters R, R g, R k, R a and said ANE energy of the aspiration noise estimation, the method further comprises: - a conversion stage in which a given test speech wave is modeled and transformed into a set of parameters E e ', R g', R k, R a ', ANE', LSF '; - a synthesis stage in which a converted speech wave is synthesized from said set of converted parameters E e ', R g', R k, R a ', ANE', LSF '.

Description

Campo de la invención Field of the Invention

La presente invención se refiere a procedimientos y sistemas para la conversión de voz. The present invention relates to procedures and systems for voice conversion.

Estado de la técnica State of the art

La Conversión de Voz se dirige a la transformación del habla de un hablante fuente para que suene como un hablante diana diferente. Los sintetizadores de texto a voz, sistemas de diálogo y reparación del habla están entre las numerosas aplicaciones que pueden beneficiarse gratamente del desarrollo de la tecnología de la conversión de voz. Voice Conversion is aimed at transforming the speech of a source speaker to sound like a different target speaker. Text-to-speech synthesizers, dialogue systems and speech repair are among the many applications that can benefit greatly from the development of voice conversion technology.

Las representaciones de las señales de voz más ampliamente usadas son el Modelo Fuente - Filtro y el Modelo Sinusoidal. La representación Fuente - Filtro (G, Fant, Acoustic Theory of Speech Production, ISBN 9027916004) se basa en un modelo de producción simple compuesto de una onda fuente glotal que excita un filtro variable en el tiempo cargado en su salida por la radiación de los labios. El principal reto en el modelo Fuente - Filtro es la estimación de la onda glotal y los parámetros del filtro del tracto vocal de la señal del habla. Representations of the most widely used voice signals are the Source - Filter Model and the Sinusoidal Model. The Source - Filter representation (G, Fant, Acoustic Theory of Speech Production, ISBN 9027916004) is based on a simple production model composed of a glotal source wave that excites a variable filter in the time charged at its output by radiation from the lips. The main challenge in the Source - Filter model is the estimation of the glottal wave and the parameters of the vocal tract filter of the speech signal.

Entre las parametrizaciones existentes de la onda glotal, el modelo Liljencrants-Fant (LF) (The LF-model revisited. Transformation and frequency domain analysis, STL – QPSR, vol. 36, núm. 2 – 3, 1995, pág. 119 – 156) se ha convertido en el modelo de elección para la investigación sobre la fuente glotal. Ha demostrado ser capaz de modelar una amplia gama de fonaciones que se producen de forma natural y los efectos de las variaciones de sus parámetros son fáciles de entender. Explota la linealidad de las propiedades de la invariancia en el tiempo de la representación Fuente - Filtro y asume la conmutación de los filtros del tracto vocal y de la radiación de los labios para combinar el modelo de excitación fuente y la radiación de los labios en la parametrización de la derivada de la onda glotal. Among the existing parameterizations of the glottal wave, the Liljencrants-Fant (LF) model (The LF-model revisited. Transformation and frequency domain analysis, STL - QPSR, vol. 36, No. 2 - 3, 1995, p. 119 - 156) has become the model of choice for research on the glottal source. He has proven to be able to model a wide range of phonations that occur naturally and the effects of variations in their parameters are easy to understand. It exploits the linearity of the properties of the invariance over time of the Source - Filter representation and assumes the switching of the filters of the vocal tract and the radiation of the lips to combine the source excitation model and the radiation of the lips in the parameterization of the derivative of the glottal wave.

La Predicción Lineal (LP) es una técnica popular usada para obtener una parametrización combinada de los componentes de la fuente glotal, el tracto vocal y de la radiación de los labios en un único filtro omnipolar H(z). Dicho filtro se excita, tal como se muestra en la figura 1, por una secuencia de impulsos separados en el período fundamental To durante el habla sonora y mediante el ruido gaussiano blanco durante el habla no sonora. Si la señal del habla fuera realmente la respuesta de un filtro omnipolar, el error o residual de LP sería un tren de impulsos separados en los instantes de excitación sonora y el modelo de la fuente de voz de impulso/ruido sería exacto. En la práctica, sin embargo, el residuo de LP se parece más a una señal de ruido blanco con valores mayores alrededor de los instantes de excitación. Aunque la excitación del filtro de LP con el residuo de LP da como resultado un habla que es indistinguible del original, usando un tren de impulsos como excitación sonora se produce un habla con una calidad muy zumbante. La fuerza de la LP descansa en su capacidad para estimar automáticamente un conjunto de coeficientes de filtro que representan de forma compacta la cubierta del espectro del habla, haciéndolo popular en aplicaciones en las que las características espectrales de la onda de la voz necesitan ser capturadas con un pequeño número de parámetros. Su principal inconveniente, por otra parte, proviene del modelo sobre–simplificado de la onda glotal que evita su uso en sistemas que requieran salidas de voz de alta calidad. Linear Prediction (LP) is a popular technique used to obtain a combined parameterization of the components of the glottal source, the vocal tract and the radiation of the lips in a single omnipolar filter H (z). Said filter is excited, as shown in Figure 1, by a sequence of pulses separated in the fundamental period To during the sound speech and by the white Gaussian noise during the non-sound speech. If the speech signal were really the response of an omnipolar filter, the LP error or residual would be a separate pulse train at the moments of sound excitation and the model of the impulse / noise voice source would be accurate. In practice, however, the LP residue looks more like a white noise signal with higher values around the moments of excitation. Although the excitation of the LP filter with the LP residue results in speech that is indistinguishable from the original, using a pulse train as sound excitation produces speech with a very buzzing quality. The strength of the LP rests on its ability to automatically estimate a set of filter coefficients that compactly represent the speech spectrum cover, making it popular in applications where the spectral characteristics of the voice wave need to be captured with A small number of parameters. Its main drawback, on the other hand, comes from the over-simplified model of the glottal wave that avoids its use in systems that require high quality voice outputs.

Como alternativa a la LP, H. Lu y colaboradores han propuesto un procedimiento de optimización convexa para estimar automáticamente el filtro del tracto vocal y la onda glotal conjuntamente (Joint estimation of vocal tract filter and glottal source waveform via convex optimization, Proc, 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, Nueva York, oct. 17 – 20, 1999). El mejor modelo de la fuente glotal empleado por esta aproximación da como resultado un habla que tiene una mejor calidad que la de la LP. Además, la parametrización de la onda glotal permite su modificación paramétrica, que puede explotarse en aplicaciones de conversión de voz. As an alternative to LP, H. Lu et al. Have proposed a convex optimization procedure to automatically estimate the vocal tract filter and the glottal wave together (Joint estimation of vocal tract filter and glottal source waveform via convex optimization, Proc, 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, New York, Oct. 17-20, 1999). The best model of the glottal source used by this approach results in speech that has a better quality than that of LP. In addition, the parameterization of the glottal wave allows its parametric modification, which can be exploited in voice conversion applications.

Los Modelos Sinusoidales asumen que la onda del habla está compuesta de la suma de un pequeño número de sinusoides con amplitudes, frecuencias y fases variables en el tiempo. Dicho modelo fue principalmente desarrollado por McAulay y Quatieri (Speech Analysis/Synthesis Based on a Sinusoidal Representation, IEEE Transactions on Acoustics, Speech and Signal Processing, pág. 744 – 754, 1986) a mediados de los 80 y ha demostrado ser capaz de producir un habla de alta calidad incluso después de transformaciones de tono y escala de tiempo. Sin embargo, a causa del alto número de amplitudes sinusoidales, frecuencias y fases involucradas, el modelo sinusoidal resulta menos flexible que la representación de Fuente - Filtro para modificar características espectrales. Sinusoidal Models assume that the speech wave is composed of the sum of a small number of sinusoids with varying amplitudes, frequencies and phases over time. This model was mainly developed by McAulay and Quatieri (Speech Analysis / Synthesis Based on a Sinusoidal Representation, IEEE Transactions on Acoustics, Speech and Signal Processing, p. 744-754, 1986) in the mid-1980s and has proven capable of producing High quality speech even after tone and time scale transformations. However, due to the high number of sinusoidal amplitudes, frequencies and phases involved, the sinusoidal model is less flexible than the Source - Filter representation to modify spectral characteristics.

Para obtener un habla convertida de alta calidad, las implementaciones de conversión de voz (VC) de la técnica actual emplean principalmente variaciones y extensiones del modelo sinusoidal original. Además, generalmente adoptan una formulación de Fuente - Filtro basada en la LP para llevar a cabo las transformaciones espectrales. To obtain high-quality converted speech, voice conversion (VC) implementations of the current technique mainly employ variations and extensions of the original sinusoidal model. In addition, they generally adopt a Source-Filter formulation based on LP to carry out the spectral transformations.

Las cubiertas espectrales están generalmente codificadas en frecuencias espectrales en línea (LSF) para la conversión de voz, ya que las LSF han demostrado poseer muy buenas características de interpolación lineal y relacionarse bien con la asignación de formatos y ancho de banda. Ya que la resolución de frecuencia del oído humano es mayor a bajas frecuencias que a altas frecuencias, las cubiertas espectrales a menudo se envuelven en una escala no lineal, por ejemplo, la escala de Bark, tomando en cuenta la sensibilidad no uniforme del oído humano. Habitualmente solo se transforman las cubiertas espectrales de segmentos de habla sonora, ya que los sonidos no sonoros contienen poca información del tracto vocal y sus cubiertas espectrales presentan altas variaciones. Entre las diferentes técnicas de conversión de cubiertas espectrales existentes, se ha hallado que las transformaciones lineales de probabilidad continua son más robustas y eficientes. Estas pueden obtenerse a través de al menos una minimización del error cuadrático de las bases de datos de entrenamiento de fuente y diana o usando marcos generales de transformación de probabilidad máxima (Ye, H. y Young, S. Quality-enhanced Voice Morphing using Maximum Likelihood Transformations, IEEE Audio Speech and Language Processing, vol. 14, núm. 4, pág. 1301 – 1312, 2006). Un problema de la compartición de todos los procedimientos de conversión de cubiertas espectrales es la ampliación de los picos espectrales, la expansión de los anchos de banda formantes y la sobre-suavización provocada por el efecto de promediación de las interpolaciones de los parámetros. El fenómeno hace que el sonido del habla convertida sea ligeramente apagado. Para resolver este asunto, a menudo se aplica un post-filtrado como etapa de post-procesamiento para anchos de banda de formantes estrechos y se suprime el ruido en los valles espectrales como, por ejemplo, en Ye, H. y Young, S. Quality-enhanced Voice Morphing using Maximum Likelihood Transformations, IEEE Audio Speech and Language Processing, vol. 14, núm. 4, pág. 1301 – 1312, 2006. Spectral covers are generally encoded in line spectral frequencies (LSF) for voice conversion, since LSFs have proven to have very good linear interpolation characteristics and relate well to format allocation and bandwidth. Since the frequency resolution of the human ear is higher at low frequencies than at high frequencies, spectral covers are often wrapped in a nonlinear scale, for example, the Bark scale, taking into account the non-uniform sensitivity of the human ear . Usually only the spectral covers of segments of sound speech are transformed, since the non-sound sounds contain little information of the vocal tract and its spectral covers present high variations. Among the different conversion techniques of existing spectral covers, it has been found that linear transformations of continuous probability are more robust and efficient. These can be obtained through at least a minimization of the quadratic error of the source and target training databases or using general frameworks of maximum probability transformation (Ye, H. and Young, S. Quality-enhanced Voice Morphing using Maximum Likelihood Transformations, IEEE Audio Speech and Language Processing, vol. 14, No. 4, p. 1301-1312, 2006). A problem of the sharing of all spectral cover conversion procedures is the expansion of the spectral peaks, the expansion of the forming bandwidths and the over-smoothing caused by the averaging effect of the parameter interpolations. The phenomenon causes the converted speech sound to be slightly muted. To resolve this issue, post-filtering is often applied as a post-processing stage for narrow bandwidth bandwidths and noise in the spectral valleys is suppressed, such as in Ye, H. and Young, S. Quality-enhanced Voice Morphing using Maximum Likelihood Transformations, IEEE Audio Speech and Language Processing, vol. 14, no. 4, p. 1301-1312, 2006.

Como para la conversión de residuos de LP, los sistemas sinusoidales de VC han desarrollado procedimientos de predicción y selección de residuos (D. Suendermann, A. Bonafonte, H. Ney, y J. Hoege, A study on residual prediction techniques for voice conversion, in Proc. ICASSP, 2005, pág. 13 – 16) basados en la correlación entre la cubierta espectral y los residuos de LP. Estos procedimientos reintroducen el detalle espectral diana perdido después de la conversión de la cubierta. Ya que los residuos contienen los errores introducidos por la parametrización de LP, se ha hallado que las técnicas de predicción de residuos mejoran el rendimiento de la conversión. Sin embargo, los residuos de LP no constituyen un modelo exacto de fuente de voz y la predicción de residuos sola no es capaz de modificar la calidad de la fuente de voz. Esto no permite su uso en aplicaciones que requieran modificaciones de la claridad de la voz tales como, por ejemplo, la reparación del habla. As for the conversion of LP residues, VC sinusoidal systems have developed procedures for prediction and selection of residues (D. Suendermann, A. Bonafonte, H. Ney, and J. Hoege, A study on residual prediction techniques for voice conversion , in Proc. ICASSP, 2005, p. 13-16) based on the correlation between the spectral cover and the LP residues. These procedures reintroduce the spectral target detail lost after the cover conversion. Since the residues contain the errors introduced by the LP parameterization, it has been found that the waste prediction techniques improve the conversion efficiency. However, LP residues do not constitute an exact voice source model and waste prediction alone is not able to modify the quality of the voice source. This does not allow its use in applications that require voice clarity modifications such as, for example, speech repair.

La solicitud de patente WO 2008/018653 A1 presenta una técnica adicional de conversión de voz que usa los parámetros de Liljencrants-Fant de la onda glotal. Patent application WO 2008/018653 A1 presents an additional voice conversion technique that uses the Liljencrants-Fant parameters of the glottal wave.

Resumen de la invención Summary of the Invention

Por lo tanto es un objeto de la presente invención suministrar un procedimiento de conversión de voz basado en un modelo de Fuente - Filtro que use una representación de la fuente glotal más exacta que los residuos de LP. Esto permite el uso de transformaciones lineales probabilísticas continuas para la conversión de la fuente de voz. It is therefore an object of the present invention to provide a voice conversion method based on a Source-Filter model that uses a more accurate representation of the glottal source than LP residues. This allows the use of continuous probabilistic linear transformations for the conversion of the voice source.

En particular, es un objeto de la presente invención un procedimiento para convertir una señal de voz de un hablante en una señal de voz convertida, que comprende una etapa de entrenamiento, una etapa de conversión y una etapa de síntesis. In particular, an object of the present invention is a method for converting a speaker's voice signal into a converted voice signal, which comprises a training stage, a conversion stage and a synthesis stage.

La etapa de entrenamiento comprende, dada una base de datos de entrenamiento de datos fuente y diana paralelos, para cada período de tono de dicha base de datos de entrenamiento: el modelado de cada período de tono por medio de una onda glotal y de un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, para obtener un conjunto de parámetros de LF, dicho conjunto de parámetros de LF comprende un parámetro de fuerza de excitación y un conjunto de parámetros T que modela una onda glotal, y un conjunto de coeficientes de filtro de tracto vocal omnipolar; que convierten dichos parámetros T en parámetros R; convirtiendo dichos coeficientes de filtro de tracto vocal omnipolar en frecuencias espectrales en línea en la escala de Bark; definiendo un vector glotal a convertir; definiendo un vector de tracto vocal a convertir, comprendiendo dicho vector de tracto vocal dichas frecuencias espectrales en línea en la escala de Bark, aplicando eliminación del ruido de la ondícula para obtener una estimación de un ruido de aspiración glotal. The training stage comprises, given a training database of parallel source and target data, for each tone period of said training database: the modeling of each tone period by means of a glottal wave and a filter of the vocal tract according to the Lu and Smith model, to obtain a set of LF parameters, said set of LF parameters comprises an excitation force parameter and a set of T parameters that models a glottal wave, and a set of omnipolar vocal tract filter coefficients; which convert said parameters T into parameters R; converting said omnipolar vocal tract filter coefficients into in-line spectral frequencies on the Bark scale; defining a glotal vector to convert; defining a vocal tract vector to be converted, said vocal tract vector comprising said spectral frequencies in line on the Bark scale, applying elimination of noise from the wavelet to obtain an estimate of a glotal aspiration noise.

La etapa de entrenamiento también comprende, a partir de un conjunto de vectores de tracto vocal obtenidos para cada período de tono de dicha base de datos de entrenamiento, la estimación de una función de transformación lineal probabilística continua de tracto vocal que usa el criterio del error cuadrático mínimo. The training stage also comprises, from a set of vocal tract vectors obtained for each tone period of said training database, the estimation of a continuous probabilistic linear transformation function of vocal tract using the error criterion minimum quadratic.

La etapa previa de modelado comprende además los pasos de modelar dicha estimación de ruido de aspiración modulando el ruido gaussiano de varianza unitaria cercano a cero con la mencionada onda glotal modelada y ajustar su energía para coincidir con la de la mencionada estimación del ruido de aspiración. Además, el vector glotal a convertir comprende dicho parámetro de fuerza de excitación, dichos parámetros R y dicha energía de estimación del ruido de aspiración. The previous modeling stage also includes the steps of modeling said estimation of aspiration noise by modulating the Gaussian noise of unit variance close to zero with the aforementioned modeled glotal wave and adjusting its energy to coincide with that of said estimation of aspiration noise. In addition, the glotal vector to be converted comprises said excitation force parameter, said R parameters and said aspiration noise estimation energy.

En la etapa de conversión, una onda de voz de prueba se modifica y se transforma en un conjunto de parámetros convertidos. In the conversion stage, a test voice wave is modified and transformed into a set of converted parameters.

En la etapa de síntesis, una onda de voz convertida se sintetiza a partir de dicho conjunto de parámetros convertidos. In the synthesis stage, a converted voice wave is synthesized from said set of converted parameters.

Preferiblemente, la etapa de entrenamiento comprende además: a partir del conjunto de vectores glotales obtenidos para cada período de tono de la mencionada base de datos de entrenamiento, la estimación de una función de transformación lineal probabilística continua de la onda glotal usando el criterio de error cuadrático mínimo. Preferably, the training stage further comprises: from the set of glottal vectors obtained for each tone period of said training database, the estimation of a continuous probabilistic linear transformation function of the glottal wave using the error criterion minimum quadratic.

El paso de modelado de cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, comprende preferiblemente los pasos de: modelar la onda glotal usando el modelo de Rosenberg-Klatt; usar optimización convexa para obtener un conjunto de parámetros de ondas glotales de Rosenberg-Klatt y todos los coeficientes de filtro de tracto vocal omnipolar, en donde dicho paso de usar optimización convexa comprende un paso de pre-énfasis adaptativo para estimar y eliminar la contribución del filtro de inclinación espectral de la onda del habla antes de la optimización convexa. Además, el paso de modelar cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, comprende además los pasos de: obtener una onda glotal derivada mediante el filtrado inverso de dicho período de tono usando dichos coeficientes de filtro de tracto vocal omnipolar, ajustando dicho conjunto de parámetros de LF a dicha onda glotal derivada filtrada mediante estimación directa y optimización no lineal constreñida. The modeling step of each tone period by means of a glottal wave and a vocal tract filter according to the Lu and Smith model, preferably comprises the steps of: modeling the glottal wave using the Rosenberg-Klatt model; using convex optimization to obtain a set of Rosenberg-Klatt glottal wave parameters and all omnipolar vocal tract filter coefficients, wherein said step of using convex optimization comprises an adaptive pre-emphasis step to estimate and eliminate the contribution of the Spectrum tilt filter of the speech wave before convex optimization. In addition, the step of modeling each tone period by means of a glottal wave and a vocal tract filter according to the Lu and Smith model, further comprises the steps of: obtaining a glottal wave derived by inverse filtering of said period of tone using said omnipolar vocal tract filter coefficients, said set of LF parameters adjusting to said derived glotal wave filtered by direct estimation and constrained nonlinear optimization.

La etapa de conversión comprende preferiblemente, para cada período de tono de dicha de onda de voz de prueba: la obtención de un vector glotal a convertir, comprendiendo dicho vector glotal un parámetro de fuerza de excitación, un conjunto de parámetros R y la energía de dicha estimación de ruido de aspiración; la obtención el vector de tracto vocal a convertir, comprendiendo dicho vector de tracto vocal un conjunto de frecuencias espectrales en línea en la escala de Bark; la aplicación de dicha función de transformación lineal probabilística continua de tracto vocal estimada durante la etapa de entrenamiento para obtener un vector de parámetros de tracto vocal convertidos; la transformación de dicho vector glotal usando dicha función de transformación lineal probabilística continua de la onda glotal estimada durante la etapa de entrenamiento obteniendo así un vector glotal convertido que comprende un conjunto de parámetros convertidos. The conversion stage preferably comprises, for each tone period of said test voice wave: obtaining a glotal vector to be converted, said glotal vector comprising an excitation force parameter, a set of R parameters and the energy of said estimate of suction noise; obtaining the vocal tract vector to be converted, said vocal tract vector comprising a set of spectral frequencies in line on the Bark scale; the application of said continuous probabilistic linear transformation of vocal tract function estimated during the training stage to obtain a vector of converted vocal tract parameters; the transformation of said glotal vector using said continuous probabilistic linear transformation function of the estimated glottal wave during the training stage thus obtaining a converted glotal vector comprising a set of converted parameters.

En particular, esas etapas de obtención de un vector glotal a convertir y de un vector de tracto vocal a convertir comprenden además los pasos de: modelar cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, para obtener un conjunto de parámetros de LF, dicho conjunto de parámetros de LF comprende un parámetro de fuerza de excitación y un conjunto de parámetros T que modelan una onda glotal y un conjunto de coeficientes de filtro de tracto vocal omnipolar; convertir dichos coeficientes de filtro de tracto vocal omnipolar en frecuencias espectrales en línea en la escala de Bark; convertir dichos parámetros T en parámetros R; definir un vector glotal a convertir; y definir un vector de tracto vocal a convertir. In particular, these steps of obtaining a glotal vector to be converted and a vocal tract vector to be converted further comprise the steps of: modeling each tone period by means of a glotal wave and a vocal tract filter according to the model of Lu and Smith, to obtain a set of LF parameters, said set of LF parameters comprises an excitation force parameter and a set of T parameters that model a glottal wave and a set of omnipolar vocal tract filter coefficients; converting said omnipolar vocal tract filter coefficients into in-line spectral frequencies on the Bark scale; converting said parameters T into parameters R; define a glotal vector to convert; and define a vocal tract vector to convert.

Preferiblemente, la etapa de conversión comprende además un paso de post-filtrado de dicho vector de parámetros de tracto vocal convertido. Preferably, the conversion step further comprises a post-filtering step of said converted vocal tract parameter vector.

La etapa de síntesis, en la cual dicha onda de voz convertida se sintetiza a partir de dicho conjunto de parámetros convertidos, comprende preferiblemente los pasos de: interpolar las trayectorias de dichos parámetros convertidos de cada período de tono, obteniendo así un conjunto de parámetros interpolados que comprenden parámetros R interpolados, energía interpolada y un vector de tracto vocal interpolado, convertir dicho vector de tracto vocal interpolado en un vector de coeficientes de filtro omnipolar; convertir dichos parámetros R interpolados en parámetros T interpolados; para cada marco de dicha onda de voz de prueba, generando una señal de excitación. The synthesis step, in which said converted voice wave is synthesized from said set of converted parameters, preferably comprises the steps of: interpolating the paths of said converted parameters of each tone period, thus obtaining a set of interpolated parameters comprising interpolated R parameters, interpolated energy and an interpolated vocal tract vector, converting said interpolated vocal tract vector into an omnipolar filter coefficient vector; converting said interpolated R parameters into interpolated T parameters; for each frame of said test voice wave, generating an excitation signal.

Preferiblemente, la etapa de generar una señal de excitación comprende, para cada uno de dichos marcos: si dicho marco es sonoro: a partir de dichos parámetros T interpolados y de dicho parámetro de fuerza de excitación, generar una onda glotal; a partir de dicho parámetro de energía de ruido de aspiración interpolado generar ruido de aspiración interpolado; generar dicha señal de excitación sonora añadiendo dicha onda glotal interpolada y dicho ruido de aspiración interpolado. Y, si dicho marco no es sonoro: generar dicha señal de excitación no sonora a partir de una fuente de ruido gaussiano. Preferably, the step of generating an excitation signal comprises, for each of said frames: if said frame is sound: from said interpolated parameters T and said excitation force parameter, generate a glottal wave; from said interpolated aspiration noise energy parameter generate interpolated aspiration noise; generating said sound excitation signal by adding said interpolated glotal wave and said interpolated aspiration noise. And, if said frame is not sound: generate said non-sound excitation signal from a Gaussian noise source.

Además, la etapa de síntesis comprende adicionalmente: la generación de una contribución sintética de cada marco filtrando dicha señal de excitación con dicho vector de coeficientes de filtro omnipolar, la multiplicación de dicha contribución sintética mediante una ventana de Hamming, la superposición y la adición, para generar la señal de voz convertida. In addition, the synthesis step further comprises: the generation of a synthetic contribution of each frame by filtering said excitation signal with said omnipolar filter coefficient vector, the multiplication of said synthetic contribution by means of a Hamming window, the superposition and the addition, to generate the converted voice signal.

La presente invención también suministra un procedimiento aplicable a transformaciones de calidad de voz, tales como la reparación del habla traqueo-esofágica, que comprende al menos algunos de los pasos del procedimiento antes mencionado. The present invention also provides a method applicable to voice quality transformations, such as repair of tracheo-esophageal speech, comprising at least some of the steps of the aforementioned procedure.

Otro objeto de la presente invención es suministrar un dispositivo que comprende medios para llevar a cabo el procedimiento antes mencionado. Another object of the present invention is to provide a device comprising means for carrying out the aforementioned procedure.

Finalmente, un objeto adicional de la presente invención es suministrar medios de código de programa informático adaptados para realizar los pasos del procedimiento previamente mencionado cuando dicho programa se ejecuta en un ordenador, un procesador de señales digitales, una matriz de puertas programables por campo, un circuito integrado específico para la aplicación, un microprocesador, un microcontrolador o cualquier otra forma de hardware programable. Finally, a further object of the present invention is to provide computer program code means adapted to perform the steps of the aforementioned procedure when said program is executed in a computer, a digital signal processor, an array of field-programmable doors, a application-specific integrated circuit, a microprocessor, a microcontroller or any other form of programmable hardware.

Las ventajas de la invención propuesta serán evidentes en la descripción siguiente. The advantages of the proposed invention will be apparent in the following description.

Breve descripción de los dibujos Brief description of the drawings

Para completar la descripción y para proporcionar una mejor comprensión de la invención, se suministra un conjunto de dibujos. Dichos dibujos forman parte integral de la descripción e ilustran una realización preferida de la invención, que no debe interpretarse como restrictiva del alcance de la invención sino, al contrario, como ejemplo de cómo puede realizarse la invención. Los dibujos comprenden las siguientes figuras: To complete the description and to provide a better understanding of the invention, a set of drawings is provided. Said drawings form an integral part of the description and illustrate a preferred embodiment of the invention, which should not be construed as restricting the scope of the invention but, on the contrary, as an example of how the invention can be realized. The drawings comprise the following figures:

La figura 1 muestra un diagrama esquemático convencional del modelo de LP. Figure 1 shows a conventional schematic diagram of the LP model.

La figura 2 muestra un diagrama esquemático del modelo de síntesis de análisis de estimación conjunta (JEAS) de acuerdo con una realización de la presente invención. La figura 3 muestra un diagrama esquemático del modelado de la onda glotal. La figura 4 muestra un diagrama esquemático del modelado de la onda glotal derivada. La figura 5 muestra impulsos de LF típicos que se corresponden con las ondas glotal y glotal derivada. La figura 6 muestra un modelo convencional de la fuente de voz. La figura 7 muestra un ejemplo de estimación conjunta: a) período de habla, b) espectro de habla y cubierta espectral Figure 2 shows a schematic diagram of the joint estimation analysis synthesis model (JEAS) of according to an embodiment of the present invention. Figure 3 shows a schematic diagram of the modeling of the glottal wave. Figure 4 shows a schematic diagram of the modeling of the derived glottal wave. Figure 5 shows typical LF pulses that correspond to the derived glotal and glotal waves. Figure 6 shows a conventional model of the voice source. Figure 7 shows an example of a joint estimate: a) speech period, b) speech spectrum and spectral cover

conjuntamente estimada, c) residuo filtrado inverso y onda RK conjuntamente estimados. La figura 8 muestra una onda glotal derivada RK. La figura 9 muestra un diagrama esquemático de un modelo convencional de la inclinación espectral. La figura 10 muestra los efectos del pre-énfasis adaptativo. La figura 11 muestra un ejemplo de ajuste de LF en fonaciones normal, entrecortada y forzada. La figura 12 muestra un resultado típico de eliminación de ruido. La figura 13 muestra parámetros del modelo del ruido de aspiración estándar. La figura 14 muestra la modulación del ruido gaussiano mediante una onda LF. La figura 15 muestra un diagrama esquemático de una aproximación de modelado del ruido de aspiración de acuerdo con jointly estimated, c) inverse filtered residue and RK wave jointly estimated. Figure 8 shows a glotal wave derived RK. Figure 9 shows a schematic diagram of a conventional model of the spectral inclination. Figure 10 shows the effects of adaptive pre-emphasis. Figure 11 shows an example of LF adjustment in normal, chopped and forced phonations. Figure 12 shows a typical noise elimination result. Figure 13 shows parameters of the standard suction noise model. Figure 14 shows the modulation of Gaussian noise by an LF wave. Figure 15 shows a schematic diagram of a suction noise modeling approach according to

una realización de la presente invención. La figura 16 muestra un diagrama esquemático del esquema de síntesis de superposición – adición empleado. La figura 17 ilustra el nuevo muestreo del contorno del tamaño del marco. La figura 18 muestra las cubiertas espectrales de JEAS frente a PSHM. La figura 19 muestra la transformación lineal probabilística continua de las ondas glotales LF An embodiment of the present invention. Figure 16 shows a schematic diagram of the overlay-addition synthesis scheme employed. Figure 17 illustrates the new sampling of the frame size contour. Figure 18 shows the spectral covers of JEAS versus PSHM. Figure 19 shows the continuous probabilistic linear transformation of the LF glottal waves

La figura 20 muestra las relaciones de distorsión RLSF de las cubiertas espectrales de PSHM y de JEAS convertidas. Figure 20 shows the RLSF distortion ratios of the spectral shells of PSHM and converted JEAS.

La figura 21 muestra las relaciones de distorsión de RLSD de los espectros predicho residual (RP) y convertido de onda glotal (GWC). La figura 22 muestra los resultados de la prueba ABX. La figura 23 muestra el resultado de la prueba de comparación de calidad. Figure 21 shows the RLSD distortion ratios of the predicted residual (RP) and wave converted spectra glottal (GWC). Figure 22 shows the results of the ABX test. Figure 23 shows the result of the quality comparison test.

Descripción detallada de la invención Detailed description of the invention

Definiciones Definitions

En el contexto de la presente invención, el término “aproximadamente” y los términos del subgrupo (tales como “aproximado”, “aproximación”, etc) deben entenderse como valores o formas indicativas muy cerca de aquellos que acompañan al término antes mencionado. Es decir, puede aceptarse una desviación de un valor exacto dentro de límites razonables, ya que cualquier experto en la técnica entenderá que dicha desviación de los valores o formas indicados es inevitable debido a las inexactitudes de las mediciones, etc. Lo mismo se aplica al término “cercano”. In the context of the present invention, the term "approximately" and the subgroup terms (such as "approximate", "approximation", etc.) should be understood as indicative values or forms very close to those that accompany the aforementioned term. That is, a deviation from an exact value can be accepted within reasonable limits, since any person skilled in the art will understand that said deviation from the indicated values or forms is inevitable due to the inaccuracies of the measurements, etc. The same applies to the term "close."

En el contexto de la presente invención, los siguientes términos se definen como sigue: In the context of the present invention, the following terms are defined as follows:

La expresión “periodo del tono” significa un segmento de una onda de voz que comprende un período de la frecuencia fundamental. The term "tone period" means a segment of a voice wave that comprises a period of the fundamental frequency.

El término “marco” significa un segmento de una onda de voz, que se corresponde con el período del tono en las partes sonoras y con una cantidad fija de tiempo en las partes no sonoras. En una realización preferida de la presente invención, que no debe interpretarse como una limitación de la presente invención, un marco se corresponde con 10 milisegundos en las partes no sonoras. The term "frame" means a segment of a voice wave, which corresponds to the period of the tone in the sound parts and with a fixed amount of time in the non-sound parts. In a preferred embodiment of the present invention, which should not be construed as a limitation of the present invention, a frame corresponds to 10 milliseconds in the non-sound parts.

La expresión “datos fuente” se refiere a una colección de ondas de voz lanzadas por un hablante fuente, mientras la expresión “datos diana” se refiere a una colección de ondas de voz lanzadas por un hablante diana. Además, la expresión “datos fuente y diana paralelos” se refiere a una colección de ondas de voz lanzadas por los hablantes tanto fuente como diana. The expression "source data" refers to a collection of voice waves launched by a source speaker, while the expression "target data" refers to a collection of voice waves launched by a target speaker. In addition, the expression "parallel source and target data" refers to a collection of voice waves launched by both source and target speakers.

En este texto, el término “comprende” y sus derivados (tales como “comprendiendo”, etc) no debe entenderse en un sentido excluyente, es decir, estos términos no deben interpretarse como que excluyen la posibilidad de que lo que se describe y define pueda incluir elementos o pasos adicionales. In this text, the term "comprises" and its derivatives (such as "understanding", etc.) should not be understood in an exclusive sense, that is, these terms should not be construed as excluding the possibility that what is described and defined may include additional elements or steps.

1. Síntesis del Análisis de estimación conjunta 1. Summary of the Joint Estimation Analysis

A continuación se describe un procedimiento de modelado del habla para el análisis, modificación y síntesis del habla. El modelo se denomina síntesis de análisis de estimación conjunta (JEAS). Su mayor ventaja es la parametrización automática y simultánea del tracto vocal y de la fuente de voz, que permite la manipulación no solo de las cubiertas espectrales, sino también de características glotales. Además, también soporta tono de alta calidad y modificaciones en la escala de tiempo. A continuación, se describe el modelo de fuente de voz empleado y la técnica de deconvolución del filtro de la fuente y se implementan el análisis de modo, transformaciones de síntesis y prosódicas. Next, a speech modeling procedure for speech analysis, modification and synthesis is described. The model is called synthesis of joint estimation analysis (JEAS). Its greatest advantage is the automatic and simultaneous parameterization of the vocal tract and the voice source, which allows the manipulation not only of the spectral covers, but also of glottal characteristics. In addition, it also supports high quality tone and modifications in the time scale. Next, the voice source model used and the deconvolution technique of the source filter are described and mode analysis, synthesis and prosodic transformations are implemented.

1.1 Modelo del habla 1.1 Speech model

La figura 2 muestra un diagrama esquemático del modelo JEAS. Se basa en una representación general de Fuente - Filtro. Emplea ruido gaussiano blanco y gaussiano blanco modulado en amplitud para modular los componentes del ruido de turbulencia y aspiración respectivamente, Un diferenciador para la Radiación de los Labios y un Filtro omnipolar para representar el Tracto Vocal. Además, se adopta el modelo Liljencrants – Fant (LF) para capturar mejor las características de la onda glotal derivada. Entonces, para estimar las diferentes parametrizaciones de los componentes del modelo de la onda del habla, se aplica una técnica de estimación de los parámetros de la fuente de voz de unión y del tracto vocal basándose en la Optimización Convexa. Figure 2 shows a schematic diagram of the JEAS model. It is based on a general representation of Source - Filter. It employs white Gaussian and white Gaussian amplitude modulated noise to modulate the components of turbulence and aspiration noise respectively, A differentiator for Lip Radiation and an omnipolar filter to represent the Vocal Tract. In addition, the Liljencrants - Fant (LF) model is adopted to better capture the characteristics of the derived glottal wave. Then, to estimate the different parameterizations of the components of the speech wave model, a technique of estimating the parameters of the union voice source and the vocal tract is applied based on Convex Optimization.

Después, se explica el modelado de la fuente de voz. Then, the modeling of the voice source is explained.

Se han propuesto numerosos modelos paramétricos de la fuente glotal en la literatura. A pesar de sus diferencias, todos comparten muchas características comunes y pueden describirse mediante un pequeño conjunto de parámetros. En la mayoría de los casos, explotan las propiedades de linealidad e invarianza del tiempo en la representación de Fuente - Filtro y asumen la conmutación de los filtros del tracto vocal y de la radiación de los labios para combinar el modelo de la excitación fuente y de la radiación de los labios en la parametrización de la derivada de la onda glotal tal como se muestra en la figura 4. Numerous parametric models of the glottal source have been proposed in the literature. Despite their differences, they all share many common characteristics and can be described by a small set of parameters. In most cases, the properties of linearity and time invariance are exploited in the representation of Source - Filter and assume the switching of the filters of the vocal tract and the radiation of the lips to combine the model of the source excitation and of the radiation of the lips in the parameterization of the derivative of the glottal wave as shown in Figure 4.

El presente procedimiento adopta el modelo LF bien conocido, que es un modelo de dominio de tiempo de cuatro parámetros de un ciclo de la onda glotal derivada. Los impulsos típicos LF que se corresponden con las ondas glotal y glotal derivada se muestran en la figura 5. Matemáticamente, puede describirse como The present procedure adopts the well-known LF model, which is a four-parameter time domain model of a derived glotal wave cycle. Typical LF pulses that correspond to the derived glotal and glotal waves are shown in Figure 5. Mathematically, it can be described as

imagen1image 1

El modelo consta de dos segmentos: el primero caracteriza la onda glotal derivada a partir del instante de la apertura glotal hasta el instante de excitación principal Te, donde la amplitud alcanza el máximo valor negativo –Ee. The model consists of two segments: the first characterizes the glottal wave derived from the instant of the glottal opening to the moment of main excitation Te, where the amplitude reaches the maximum negative value –Ee.

Según se muestra en la ecuación 1, el segmento es una función sinusoidal que crece exponencialmente en amplitud, Siendo la frecuencia de la función del seno y determinando α la tasa de incremento de amplitud. E0 es un factor de escala usado para asegurar que la señal esté próxima a cero. El parámetro de sincronización imagen1 Tp se relaciona con la frecuencia sinusoidal a través de As shown in equation 1, the segment is a sinusoidal function that grows exponentially in amplitude, the frequency of the sine function being and determining α the rate of amplitude increase. E0 is a scale factor used to ensure that the signal is close to zero. The synchronization parameter image 1 Tp is related to the sinusoidal frequency through

imagen1image 1

5 y denota el instante de máximo flujo glotal. Ee está estrechamente relacionado con la fuerza de la excitación de la fuente y la determinante principal de la intensidad de la señal del habla. Su variación afecta las amplitudes armónicas totales, excepto a los componentes muy bajos que están más determinados por la forma del impulso. 5 and denotes the moment of maximum glottal flow. Ee is closely related to the force of the excitation of the source and the main determinant of the intensity of the speech signal. Its variation affects the total harmonic amplitudes, except for very low components that are more determined by the shape of the pulse.

El segundo segmento modela la fase de cierre o retorno desde la excitación principal Te hasta el instante de cierre total Tc usando una función exponencial. La duración de la fase de retorno se determina de esta forma mediante Tc-Te. El The second segment models the closing or return phase from the main excitation Te to the moment of total closing Tc using an exponential function. The duration of the return phase is determined in this way by Tc-Te. He

10 parámetro principal que caracteriza este segmento es Ta, que representa la “duración efectiva” de la fase de retorno. Esta se define mediante la duración desde Te hasta el punto en el que una tangente ajustada en el inicio de la fase de retorno cruza cero. ε-1 es la constante de tiempo de la función exponencial y puede determinarse iterativamente a partir de Ta, Te y Tc a través de The main parameter that characterizes this segment is Ta, which represents the “effective duration” of the return phase. This is defined by the duration from Te to the point where a tangent set at the start of the return phase crosses zero. ε-1 is the time constant of the exponential function and can be determined iteratively from Ta, Te and Tc through

imagen1image 1

15 To se corresponde con el período fundamental. Generalmente Tc se hace coincidir con la apertura del siguiente impulso. Este hecho podría sugerir que el modelo no toma en cuenta la fase cerrada de la onda glotal. Sin embargo, para valores razonablemente pequeños de Ta la función exponencial ajustará muy cerca de la línea del cero que suministra una fase cerrada sin la necesidad de parámetros de control adicionales. 15 To corresponds to the fundamental period. Generally Tc is made to coincide with the opening of the next impulse. This fact could suggest that the model does not take into account the closed phase of the glottal wave. However, for reasonably small values of Ta the exponential function will adjust very close to the zero line that supplies a closed phase without the need for additional control parameters.

Junto con la fuerza de excitación Ee, el impulso LF puede determinarse únicamente mediante los parámetros T (Tp, Te, Ta, Together with the excitation force Ee, the pulse LF can only be determined by the parameters T (Tp, Te, Ta,

20 Tc). Estos parámetros pueden identificarse fácilmente a partir de la onda glotal derivada estimada. Por lo tanto, se obtienen generalmente primero y entonces los parámetros de síntesis, a partir de los cuales puede calcularse la onda LF directamente, (E0, α; ωg; ε) se derivan tomando en cuenta las siguientes restricciones: 20 Tc). These parameters can be easily identified from the estimated derived glottal wave. Therefore, the synthesis parameters are usually obtained first and then, from which the LF wave can be calculated directly, (E0, α; ωg; ε) are derived taking into account the following restrictions:

imagen1image 1

Otro conjunto importante de parámetros LF son los parámetros R (Rg, Rk, Ra), que se normalizan respecto a T0 y se correlacionan con los fenómenos glotales más sobresalientes, es decir, la anchura del impulso glotal y la asimetría y brusquedad del cierre Another important set of parameters LF are the parameters R (Rg, Rk, Ra), which are normalized with respect to T0 and correlate with the most outstanding glottal phenomena, that is, the width of the glotal impulse and the asymmetry and abruptness of the closure

imagen1image 1

Rg es una versión normalizada de la frecuencia del formante glotal Fg que se define como la inversa de dos veces la duración de la fase de apertura Tp. Rk es el parámetro de LF que captura la asimetría glotal. Se define como la razón entre las veces de apertura y cierre de las ramas del impulso glotal, y cuanto más grande sea su valor, más simétrico es el impulso. La relación entre Rg, Rk y el Cociente de Apertura OQ es: OQ = (1 + Rk) / (2 Rg). Así, OQ se correlaciona positivamente con Rk y se correlaciona negativamente con Rg. El parámetro Ra se corresponde con el “tiempo de retorno” efectivo Ta normalizado por el período fundamental y captura las diferencias relativas a la inclinación espectral. Rg is a normalized version of the frequency of the glotal formant Fg which is defined as the inverse of twice the duration of the opening phase Tp. Rk is the parameter of LF that captures the glotal asymmetry. It is defined as the ratio between the times of opening and closing of the branches of the glotal impulse, and the larger its value, the more symmetrical is the impulse. The relationship between Rg, Rk and the Opening Ratio OQ is: OQ = (1 + Rk) / (2 Rg). Thus, OQ correlates positively with Rk and correlates negatively with Rg. The Ra parameter corresponds to the effective “return time” Ta normalized by the fundamental period and captures the differences related to the spectral inclination.

Después, se aplica el procedimiento adoptado para la deconvolución de la fuente glotal y del filtro de tracto vocal: Then, the procedure adopted for the deconvolution of the glottal source and the vocal tract filter is applied:

El objetivo de la deconvolución de Fuente - Filtro es obtener estimaciones de los componentes de la fuente glotal y del filtro del tracto vocal a partir de la onda del habla. Existen dos aproximaciones principales de deconvolución. Antes de que se desarrollaran los modelos paramétricos de la onda glotal, el Filtrado Inverso (IF) era el procedimiento de deconvolución más comúnmente empleado. Se basa en el cálculo de una función de transferencia del filtro de tracto vocal, cuya inversa se utiliza para obtener la estimación de la onda glotal que luego puede parametrizarse. The objective of the Source - Filter deconvolution is to obtain estimates of the components of the glottal source and the vocal tract filter from the speech wave. There are two main approaches to deconvolution. Before the parametric models of the glottal wave were developed, Reverse Filtering (IF) was the most commonly used deconvolution procedure. It is based on the calculation of a transfer function of the vocal tract filter, whose inverse is used to obtain the estimate of the glottal wave that can then be parameterized.

Un enfoque diferente comprende el modelado tanto de la fuente glotal como del filtro del tracto vocal, y de técnicas de desarrollo para estimar conjuntamente los parámetros de los modelos de la fuente y del tracto a partir de la fuente del habla. Los procedimientos de Estimación conjunta son completamente automáticos. Esta es una condición importante que un modelo matemático orientado al análisis, síntesis y modificación de la señal del habla debe satisfacer. Debido a las características de la fuente de voz matemática y de las descripciones del tracto vocal, dicha aproximación es un problema complejo no lineal. Por esta razón, el uso de la LP se ha desarrollado más ampliamente que un método más simple para obtener una parametrización de Fuente - Filtro directa y eficiente de la señal de voz. Su pobre modelado de la fuente de voz no ha limitado su aplicación en el contexto de la codificación del habla y representa eficientemente el espectro del habla con un pequeño número de parámetros. Sin embargo, se ha evitado su uso en aplicaciones de síntesis y transformación del habla. Los avances en la conversión de voz y en la síntesis del habla del Modelo Hidden Marco (HMM) en los últimos años ha enfatizado la importancia de la codificación redefinida de la voz, y así, ha ganado un renovado interés el problema de la estimación conjunta automática de los parámetros de fuente de voz y filtro de tracto vocal. A different approach includes modeling both the glottal source and the vocal tract filter, and development techniques to jointly estimate the parameters of the source and tract models from the speech source. The joint estimation procedures are completely automatic. This is an important condition that a mathematical model oriented to the analysis, synthesis and modification of the speech signal must satisfy. Due to the characteristics of the mathematical voice source and the descriptions of the vocal tract, such an approach is a complex nonlinear problem. For this reason, the use of the LP has been developed more widely than a simpler method to obtain a parameterization of Source - Direct and efficient filter of the voice signal. Its poor modeling of the voice source has not limited its application in the context of speech coding and efficiently represents the speech spectrum with a small number of parameters. However, its use in speech synthesis and transformation applications has been avoided. Advances in voice conversion and speech synthesis of the Hidden Marco Model (HMM) in recent years have emphasized the importance of redefined voice coding, and thus, the problem of joint estimation has gained renewed interest Automatic voice source and vocal tract filter parameters.

El procedimiento empleado para obtener los parámetros de fuente de voz JEAS y del modelo del tracto vocal a partir de la onda del habla sigue la segunda aproximación de deconvolución y se basa en la estimación conjunta del filtro del tracto vocal y de la onda glotal propuesta por Lu y Smith (Proc. 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, Nueva York, Oct. 17 – 20, 1999). The procedure used to obtain the JEAS voice source and vocal tract model parameters from the speech wave follows the second deconvolution approach and is based on the joint estimation of the vocal tract filter and the glotal wave proposed by Lu and Smith (Proc. 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, New York, Oct. 17-20, 1999).

1.2 Análisis dentro del Modelo de Síntesis de Análisis de Estimación Conjunta 1.2 Analysis within the Joint Estimate Analysis Synthesis Model

Durante el análisis, los segmentos del habla sonoros y no sonoros se procesan diferentemente debido a sus diversas características de fuente. Mientras que la fuente sonora en el habla sonora se representa mediante una combinación de LF y de modelos del ruido de aspiración, el ruido gaussiano blanco se utiliza para excitar el filtro de tracto vocal en los marcos no sonoros (consulte la figura 2). Su diferente modelado requiere un paso de pre-procesamiento en el que se determinan las secciones de voz sonoras y no sonoras y los instantes de cierre glotal (GCI) de los segmentos de voz. Entonces, se obtienen los parámetros de fuente de voz y de tracto vocal a través de una estimación de Fuente - Filtro conjunta y una reparametrización LF en las secciones sonoras (V) y a través de la LP de autocorrelación estándar y la energía del ruido gaussiano que concuerdan en las partes no sonoras (U). During the analysis, the sound and non-sound speech segments are processed differently due to their different source characteristics. While the sound source in the speech is represented by a combination of LF and suction noise models, white Gaussian noise is used to excite the vocal tract filter in the non-sound frames (see Figure 2). Its different modeling requires a preprocessing step in which the sound and non-sound voice sections and the glottal closing moments (GCI) of the voice segments are determined. Then, the voice source and vocal tract parameters are obtained through a Source - Joint filter estimate and a LF reparameterization in the sound sections (V) and through the standard autocorrelation LP and Gaussian noise energy that agree on the non-sound parts (U).

Se usa un algoritmo, tal como el bien conocido algoritmo de pendiente de fase proyectada de programación dinámica (DYPSA) para la estimación de GCI. Se emplea la función de retardo de grupo en combinación con un procedimiento de proyección de pendiente de fase para determinar los candidatos GCI, más programación dinámica N-best para seleccionar los candidatos más probables de acuerdo con una función de coste que toma en cuenta la similitud de la onda, la desviación del tono, la energía normalizada y la desviación de la pendiente de fase ideal. An algorithm is used, such as the well-known projected dynamic programming phase slope (DYPSA) algorithm for GCI estimation. The group delay function is used in combination with a phase slope projection procedure to determine GCI candidates, plus N-best dynamic programming to select the most likely candidates according to a cost function that takes the similarity into account of the wave, the tone deviation, the normalized energy and the deviation of the ideal phase slope.

La decisión de reproducción se toma basándose en la información de la energía, el cruce por cero y GCI. Los segmentos sonoros se procesan entonces en sincronía con el tono mientras que los marcos no sonoros se extraen periódicamente. En una realización particular, se extraen cada 10 milisegundos. The reproduction decision is made based on energy information, zero crossing and GCI. The sound segments are then processed in synchrony with the tone while the non-sound frames are periodically extracted. In a particular embodiment, they are extracted every 10 milliseconds.

El procedimiento empleado por la invención para obtener los parámetros de los modelos de la fuente de voz JEAS y del tracto vocal comprende el uso de un modelo de fuente de voz lo suficientemente simple como para permitir que la deconvolución del filtro de la fuente se formule como un problema de Optimización Convexa. Entonces, la onda glotal derivada obtenida mediante filtrado inverso (IF) con los coeficientes de filtro estimados se reparametriza mediante ajuste del modelo LF. The method used by the invention to obtain the parameters of the JEAS voice source and vocal tract models comprises the use of a voice source model simple enough to allow the deconvolution of the source filter to be formulated as a Convex Optimization problem. Then, the derived glotal wave obtained by inverse filtering (IF) with the estimated filter coefficients is reparameterized by adjusting the LF model.

5 El éxito de la técnica descansa en el suministro de una restricción de la onda glotal derivada cuando se estima el filtro de tracto vocal. A causa de ello, la onda glotal derivada del IF resultante está más cerca de la excitación glotal verdadera y su ajuste con un modelo LF es menos susceptible de errores. 5 The success of the technique relies on the supply of a restriction of the derived glottal wave when the vocal tract filter is estimated. Because of this, the glottal wave derived from the resulting IF is closer to true glottal excitation and its adjustment with an LF model is less susceptible to errors.

El algoritmo de estimación conjunta modela la fuente de voz usando el modelo bien conocido de Rosenberg – Klatt (RK), que consiste en una onda de reproducción básica que describe la forma de la onda glotal derivada y un filtro de The joint estimation algorithm models the voice source using the well-known Rosenberg-Klatt (RK) model, which consists of a basic reproduction wave that describes the shape of the derived glottal wave and a filter of

10 paso bajo, con μ > 0, según muestra en la figura 6. La derivada RK de la onda glotal viene dada por 10 low pass, with μ> 0, as shown in figure 6. The RK derivative of the glottal wave is given by

imagen2image2

imagen1image 1

donde To se corresponde con el período de tono y nc se representa la duración de la fase cerrada, que también puede expresarse como where To corresponds to the tone period and nc represents the duration of the closed phase, which can also be expressed as

imagen1image 1

siendo OQ el cociente abierto, es decir, la fracción del período de tono en el cual está abierta la glotis. Además, los parámetros a y b necesitan ser siempre positivos y mantener la siguiente relación, where OQ is the open quotient, that is, the fraction of the tone period in which the glottis is open. In addition, parameters a and b need to always be positive and maintain the following relationship,

imagen1image 1

para mantener una forma de onda adecuada. to maintain a proper waveform.

La deconvolución de Fuente - Filtro a través de la optimización convexa se realiza minimizando el error cuadrático entre las ondas glotales moderadas y derivadas verdaderas. La onda glotal derivada modelada ĝ(n) se corresponde con la de la ecuación 7, mientras que la onda glotal derivada verdadera g(n) se obtiene a través de un filtrado inverso tal como Source - Filter deconvolution through convex optimization is done by minimizing the quadratic error between moderate and true derived glottal waves. The modeled derived glottal wave ĝ (n) corresponds to that of equation 7, while the true derived glottal wave g (n) is obtained through inverse filtering such as

imagen1image 1

donde s(n) es la onda del habla y αk son los coeficientes del filtro omnipolar del tracto vocal. El error entre las ondas glotales modelada y derivada verdadera e(n) puede calcularse sustrayendo las ecuaciones (7) y where s (n) is the speech wave and αk are the omnipolar filter coefficients of the vocal tract. The error between the modeled and true derivative glottal waves e (n) can be calculated by subtracting equations (7) and

imagen3image3

expresión anterior y reescribiéndola en forma de matriz tenemos previous expression and rewriting it in matrix form we have

imagen1image 1

donde X = [α1…αp a b]T es el vector de parámetros a estimar de manera que se minimice la suma de los cuadrados del error E de la ecuación, es decir where X = [α1… αp a b] T is the vector of parameters to be estimated so that the sum of the squares of the error E of the equation is minimized, that is to say

imagen1image 1

H. Lu y colaboradores demostraron (Proc. 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, Nueva York, Oct. 17 – 20, 1999) que la simplicidad del modelo glotal RK garantiza que esta optimización sea convexa, es decir, que tenga solamente un mínimo que se corresponde con la solución óptima, y así, pueda resolverse de forma eficiente a través de Programación Cuadrática. Un problema cuadrático se define como sigue H. Lu et al. Demonstrated (Proc. 1999 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, New Paltz, New York, Oct. 17-20, 1999) that the simplicity of the RK glotal model ensures that this optimization is convex, that is, that it has only a minimum that corresponds to the optimal solution, and thus, can be solved efficiently through Quadratic Programming. A quadratic problem is defined as follows

imagen1image 1

La ecuación (12 ) puede resolverse usando programación cuadrática si se expande para que tenga su forma, es decir Equation (12) can be solved using quadratic programming if it expands so that it has its shape, that is

imagen1image 1

definiendo defining

imagen1image 1

e ignorando el término STS, que siempre es positivo, para propósitos de minimización. Además, la ecuación 9 impone las siguientes restricciones de igualdad y desigualdad and ignoring the term STS, which is always positive, for minimization purposes. In addition, equation 9 imposes the following restrictions on equality and inequality

imagen1image 1

El programa cuadrático derivado puede resolverse usando un número de algoritmos numéricos iterativos existentes. En la implementación desarrollada se ha empleado la función de programación cuadrática del MATLAB Optimization Toolbox. El resultado del problema de minimización es la estimación simultánea de los parámetros del modelo RK a y b y los coeficientes de filtro omnipolar αk. La figura 7 muestra un ejemplo de estimación conjunta para un período de tono. The derived quadratic program can be solved using a number of existing iterative numerical algorithms. In the developed implementation, the quadratic programming function of the MATLAB Optimization Toolbox has been used. The result of the minimization problem is the simultaneous estimation of the parameters of the RK model a and b and the omnipolar filter coefficients αk. Figure 7 shows an example of a joint estimate for a tone period.

El proceso de estimación conjunta descrito asume que las fases cerrada y abierta están definidas, aunque en la práctica el parámetro que delimita el final de la fase cerrada y el inicio de la fase abierta nc se desconoce. Su valor óptimo se halla muestreando uniformemente los posibles valores de nc (empíricamente mostrados para que varíen entre un 0% y un 60% del período del tono To), resolviendo el problema cuadrático en cada valor de nc muestreado y seleccionando la estimación que da como resultado el error mínimo. The joint estimation process described assumes that the closed and open phases are defined, although in practice the parameter that defines the end of the closed phase and the beginning of the open phase is not known. Its optimal value is uniformly sampling the possible values of nc (empirically shown to vary between 0% and 60% of the To tone period), solving the quadratic problem in each sampled nc value and selecting the estimate given as Minimum error result.

Como puede verse en la figura 8, la onda básica de reproducción RK de la ecuación (7) no modela explícitamente la fase de retorno de la onda glotal derivada y cambia bruscamente en los instantes del cierre glotal. Por esta razón, se añade un filtro de paso bajo al modelo básico, con el propósito de reducir la brusquedad del cierre glotal. En el dominio de frecuencias, el coeficiente de filtro μ es responsable del control de la inclinación del espectro de la fuente. As can be seen in Figure 8, the basic reproduction wave RK of equation (7) does not explicitly model the return phase of the derived glottal wave and changes abruptly at the moments of the glottal closure. For this reason, a low-pass filter is added to the basic model, with the purpose of reducing the abruptness of the glottal closure. In the frequency domain, the filter coefficient μ is responsible for controlling the inclination of the source spectrum.

Para permitir la formulación del problema de optimización convexa, el filtro de inclinación espectral se separa del modelo de la fuente y se incorpora en el modelo del tracto vocal añadiendo un polo extra al filtro omnipolar tal como se muestra en la figura 9. Esto implica que los coeficientes del filtro de tracto vocal estimados usando esta fórmula también codifican la información de la pendiente espectral de la fuente de voz. Como resultado, las ondas glotales derivadas obtenidas usando esta aproximación fallan en la captura adecuada de las variaciones de la fase de retorno de la fuente glotal. To allow the formulation of the convex optimization problem, the spectral tilt filter is separated from the source model and incorporated into the vocal tract model by adding an extra pole to the omnipolar filter as shown in Figure 9. This implies that The vocal tract filter coefficients estimated using this formula also encode the spectral slope information of the voice source. As a result, derived glottal waves obtained using this approach fail to properly capture the variations of the return phase of the glottal source.

La presente invención utiliza pre-énfasis adaptativo para estimar y eliminar la contribución del filtro de inclinación espectral de la onda del habla antes de la optimización convexa. Para que se aplique un análisis de LP e IF para estimar y eliminar la pendiente espectral de los marcos de voz bajo análisis, el efecto del pre-énfasis adaptativo se ilustra en la figura 10: a) espectro del habla y cubierta espectral estimada, b) onda glotal derivada IF y onda LF ajustada, c) espectro de onda glotal derivada y espectro de onda LF ajustada. Las estimaciones de la cubierta del filtro del tracto vocal obtenidas de esta forma no codifican las características de inclinación espectral de la fuente, que se reflejan en la fase de cierre de las ondas glotales derivadas resultantes. Esto mejora el ajuste de la fase de retorno del modelo LF y así, de las altas frecuencias de la fuente glotal. The present invention uses adaptive pre-emphasis to estimate and eliminate the contribution of the spectral inclination filter of the speech wave before convex optimization. For an LP and IF analysis to be applied to estimate and eliminate the spectral slope of the voice frames under analysis, the effect of adaptive pre-emphasis is illustrated in Figure 10: a) Speech spectrum and estimated spectral cover, b ) IF-derived glottal wave and LF wave adjusted, c) Glottal wave-derived spectrum and LF wave spectrum adjusted. The estimates of the vocal tract filter cover obtained in this way do not encode the spectral inclination characteristics of the source, which are reflected in the closing phase of the resulting derived glottal waves. This improves the adjustment of the return phase of the LF model and thus of the high frequencies of the glottal source.

El modelo LF es capaz de describir más exactamente la onda de la derivada glotal que el modelo RK. Sin embargo, su formulación no lineal más compleja no cumple la condición de convexidad y evita su uso en el algoritmo de estimación de parámetros conjuntos de la fuente de voz y del filtro del tracto vocal. Al contrario, el modelo RK se emplea durante la deconvolución de la Fuente - Filtro y el modelo LF se usa entonces para reparametrizar la onda glotal derivada obtenida mediante filtrado inverso de la onda del habla con los coeficientes de filtro conjuntamente estimados. The LF model is able to more accurately describe the wave of the glotal derivative than the RK model. However, its more complex nonlinear formulation does not meet the convexity condition and avoids its use in the algorithm for estimating joint parameters of the voice source and the vocal tract filter. On the contrary, the RK model is used during the Source-Filter deconvolution and the LF model is then used to reparameterize the derived glotal wave obtained by inverse filtering of the speech wave with the jointly estimated filter coefficients.

El ajuste del modelo LF se lleva a cabo en dos pasos: primero, las estimaciones iniciales de los parámetros T de LF (Tp, Te, Ta, Tc) y la fuerza de excitación glotal Ee se obtienen a partir de la onda de la fuente de voz IF del dominio de tiempo mediante procedimientos de estimación directos convencionales. Entonces, se redefinen sus valores usando la técnica de optimización no lineal constreñida convencional. El procedimiento completo es como sigue. The adjustment of the LF model is carried out in two steps: first, the initial estimates of the T parameters of LF (Tp, Te, Ta, Tc) and the glotal excitation force Ee are obtained from the source wave IF voice of the time domain by conventional direct estimation procedures. Then, their values are redefined using the conventional constrained nonlinear optimization technique. The complete procedure is as follows.

Primero se localizan la fuerza de excitación glotal Ee y su índice de tiempo Te hallando el mínimo de la onda glotal derivada IF. Entonces, se determinan Tp y Tc como los primeros cruces por cero antes y después de Te respectivamente. Se estima Ta como Ta = (Tc -Te) 2/3. Se redefinen Tp y Ta usando minimización no lineal constreñida. Ya que las estimaciones iniciales de Ee, Te y Tc son bastantes fiables, sus valores se mantienen sin cambios durante su optimización. Ta se restringe para que varíe entre 0 y Tc -Te y Tp hasta b dentro de ± 20% de su estimación inicial. Las fases de retorno y apertura se optimizan separada y secuencialmente. En ambos casos, la función de minimización es la suma del error cuadrático entre la onda glotal derivada IF y la estimación ajustada para la fase particular. La figura 11 muestra un ejemplo de ajuste de LF en fonaciones normal, entrecortada y forzada. First, the glottal excitation force Ee and its time index are located, finding the minimum of the derived glotal wave IF. Then, Tp and Tc are determined as the first zero crossings before and after Te respectively. Ta is estimated as Ta = (Tc -Te) 2/3. Tp and Ta are redefined using constrained nonlinear minimization. Since the initial estimates of Ee, Te and Tc are quite reliable, their values remain unchanged during optimization. Ta is restricted to vary between 0 and Tc -Te and Tp to b within ± 20% of its initial estimate. The return and opening phases are optimized separately and sequentially. In both cases, the minimization function is the sum of the quadratic error between the derived glotal wave IF and the adjusted estimate for the particular phase. Figure 11 shows an example of LF adjustment in normal, chopped and forced phonations.

Ya que la parametrización de LF no modela el ruido de aspiración glotal, el componente estocástico presente en la onda glotal derivada IF no se captura durante el ajuste de IF. Sin embargo, perceptualmente, la falta de ruido de aspiración da como resultado una calidad del habla no natural y así, se ha desarrollado una metodología para su extracción y parametrización dentro del marco JEAS. Since the LF parameterization does not model the glotal aspiration noise, the stochastic component present in the derivative glotal wave IF is not captured during the IF adjustment. However, perceptually, the lack of aspiration noise results in an unnatural speech quality and thus, a methodology for its extraction and parameterization within the JEAS framework has been developed.

Se usa la eliminación del ruido de la ondícula para extraer el ruido de aspiración glotal de la estimación de la onda glotal derivada IF. En una realización preferida, la técnica de eliminación del ruido de la ondícula que se utiliza es el Análisis de Paquetes de Ondícula, que se ha hallado que obtiene estimaciones de ruido de aspiración más fiables en comparación con otras técnicas empleadas para identificar y separar los componentes periódicos y aperiódicos de las señales cuasi-periódicas, tales como el análisis de transformación de frecuencia o la predicción periódica. El Análisis de Paquetes de Ondícula se realiza preferiblemente a nivel 4 con la ondícula de Daubechies de 7º orden, usando umbralización virtual y el criterio de evaluación de umbral de la Estimación de Riesgos Insesgada de Stein. La figura 12 muestra un resultado típico de eliminación de ruido: a) onda glotal derivada IF original y con el ruido eliminado, b) estimación de ruido. The elimination of the noise of the wavelet is used to extract the noise of glotal aspiration from the estimation of the derived glotal wave IF. In a preferred embodiment, the technique of eliminating the noise of the wavelet that is used is the Analysis of Ripple Packages, which has been found to obtain more reliable suction noise estimates compared to other techniques used to identify and separate the components. newspapers and aperiodic of quasi-periodic signals, such as frequency transformation analysis or periodic prediction. The Ripple Packet Analysis is preferably performed at level 4 with the 7th order Daubechies wavelet, using virtual thresholding and the threshold evaluation criterion of the Stein Unexpected Risk Estimate. Figure 12 shows a typical noise elimination result: a) the original IF derived glottal wave and with the noise removed, b) noise estimation.

Una vez que se ha extraído una estimación del ruido de aspiración, es necesario que se parametrice. Estudios sobre el ruido de aspiración han mostrado que éste es síncrono con la onda glotal y es probable que presente ráfagas de ruido en el cierre glotal y a menudo también en la apertura glotal. La mayoría de los modelos descuida la naturaleza del impulso de apertura glotal y se aproximan a él como ruido gaussiano modulado en amplitud síncrono con el tono, con mayor energía cerca de los instantes de cierre glotal. La amplitud de la ráfaga de ruido se modula habitualmente usando ventanas Rectangulares, de Hanning o de Hamming. Algunas veces se incluye un filtro de conformación espectral para tener en cuenta la densidad espectral media del ruido de aspiración y el filtrado de paso alto introducido por la conmutación de los filtros de tracto vocal y de radiación. Sin embargo, algunos modelos también desatienden el filtro de conformación espectral ya que se ha encontrado que no es perceptualmente importante. Estas aproximaciones de ruido gaussiano modulado en amplitud síncrono en el tono requiere la determinación de los siguientes parámetros ilustrados en la figura 13 del componente del ruido de aspiración: Once an estimate of the suction noise has been extracted, it must be parameterized. Studies on aspiration noise have shown that it is synchronous with the glottal wave and is likely to present bursts of noise at the glottal closure and often also at the glottal opening. Most models neglect the nature of the glottal opening impulse and approach it as a Gaussian noise modulated in synchronous amplitude with the tone, with greater energy near the instants of glottal closure. The amplitude of the noise burst is usually modulated using Rectangular, Hanning or Hamming windows. Sometimes a spectral shaping filter is included to take into account the average spectral density of the suction noise and the high-pass filtering introduced by the switching of the vocal tract and radiation filters. However, some models also neglect the spectral conformation filter since it has been found to be not significantly important. These approximations of Gaussian noise modulated in synchronous amplitude in the tone require the determination of the following parameters illustrated in Figure 13 of the suction noise component:

-Umbral mínimo del ruido (Nf): el umbral mínimo del ruido de aspiración; -Minimal noise threshold (Nf): the minimum suction noise threshold;

-Amplitud del impulso del ruido (NPa): el índice de modulación de amplitud del impulso del ruido -Noise pulse amplitude (NPa): the amplitude modulation index of the noise impulse

-Posición del impulso del ruido (NPp): la posición del centro de la ventana del impulso del ruido en el período glotal - Noise impulse position (NPp): the position of the center of the noise impulse window in the glottal period

-Anchura del impulso del ruido (NPw): la anchura de la ventana del impulso del ruido. -Noise pulse width (NPw): the width of the noise impulse window.

Desafortunadamente, el cálculo automático de los anteriores parámetros a partir de los componentes del ruido de aspiración estimados es problemático en muchos casos. Para evitar estos errores, en la presente invención se sigue una aproximación diferente y, en particular, en la implementación JEAS. Aunque todavía la aproximación al componente de aspiración es el ruido gaussiano modulado en amplitud síncrono con el tono, se emplea una función alternativa que no requiere la estimación de Nf, Npa, NPp y NPw para modular su amplitud: la onda LF. De hecho, la forma de la onda LF sigue la mayoría de las características de modulación de amplitud saliente del ruido de aspiración glotal, es decir, la magnitud de su amplitud aumenta durante la fase abierta y es máxima en el cierre glotal. Si se modula ruido gaussiano estacionario con una onda LF, la señal resultante presentará las dos ráfagas probables de ruido de aspiración cerca de la apertura glotal y del cierre glotal según se muestra en la figura 14 (a) fuente de ruido gaussiano, b) onda LF, c) ruido gaussiano modulado). De acuerdo con pruebas de audición informal, esta aproximación es comparable a las previamente descritas técnicas de modelado basadas en ventanas. Unfortunately, the automatic calculation of the above parameters from the estimated suction noise components is problematic in many cases. To avoid these errors, a different approach is followed in the present invention and, in particular, in the JEAS implementation. Although the approach to the aspiration component is still the Gaussian noise modulated in synchronous amplitude with the tone, an alternative function is used that does not require the estimation of Nf, Npa, NPp and NPw to modulate its amplitude: the LF wave. In fact, the shape of the LF wave follows most of the outgoing amplitude modulation characteristics of the glotal aspiration noise, that is, the magnitude of its amplitude increases during the open phase and is maximal in the glottal closure. If stationary Gaussian noise is modulated with an LF wave, the resulting signal will present the two probable bursts of aspiration noise near the glottal opening and the glottal closure as shown in Figure 14 (a) Gaussian noise source, b) wave LF, c) modulated Gaussian noise). According to informal hearing tests, this approach is comparable to the previously described window-based modeling techniques.

Así, la presente invención, la estimación del ruido de aspiración obtenida para un período de tono particular durante el análisis JEAS se parametriza como sigue. Primero, se modula el ruido gaussiano de varianza unitaria próximo a cero con la onda LF ya ajustada para ese período de tono. Entonces, se ajusta su energía para que concuerde con la estimación del ruido de aspiración (ANE). Ya que se ha hallado informalmente que el uso de un filtro de conformación espectral no efectúa una diferencia perceptual, no se incluye en la paremetrización. La figura 15 muestra un diagrama de la aproximación de modelado del ruido de aspiración que se ha empleado. Thus, the present invention, the estimation of the aspiration noise obtained for a particular tone period during the JEAS analysis is parameterized as follows. First, the Gaussian noise of unit variance close to zero is modulated with the LF wave already set for that tone period. Then, its energy is adjusted to match the estimate of the suction noise (ANE). Since it has been found informally that the use of a spectral conformation filter does not make a perceptual difference, it is not included in the paremetrization. Figure 15 shows a diagram of the suction noise modeling approach that has been used.

1.3 Síntesis dentro del modelo de Síntesis de Análisis de Estimación Conjunta 1.3 Synthesis within the Joint Estimate Analysis Synthesis model

La síntesis se efectúa siguiendo el Modelo JEAS de la figura 2 y aplicando los parámetros estimados durante el análisis. En teoría, cada marco K de la onda de habla, que se corresponde con un período de tono en segmentos sonoros y con un segmento fijo (en un ejemplo particular, un segmento fijo de 10 milisegundos) en partes no sonoras, puede generarse filtrando la señal estimada de excitación sonora y no sonora e(n) con el filtro del tracto vocal vt para ese marco particular The synthesis is carried out following the JEAS Model of Figure 2 and applying the parameters estimated during the analysis. In theory, each frame K of the speech wave, which corresponds to a tone period in sound segments and with a fixed segment (in a particular example, a fixed segment of 10 milliseconds) in non-sound parts, can be generated by filtering the estimated sound and non-sound excitation signal e (n) with the vocal tract filter vt for that particular frame

imagen1image 1

donde p es el orden del filtro y Nk es el número de muestras en el marco. La señal de excitación se construye bien mediante la adición de las estimaciones ajustadas del ruido LF y de aspiración, 1f(n) y un (n), o bien generando simplemente una fuente de ruido gaussiano, gn(n), en los segmentos sonoros (V) y no sonoros (U), respectivamente. where p is the order of the filter and Nk is the number of samples in the frame. The excitation signal is constructed well by adding the adjusted estimates of the LF and suction noise, 1f (n) and one (n), or simply by generating a source of Gaussian noise, gn (n), in the sound segments (V) and non-sound (U), respectively.

imagen1image 1

5 en la práctica, ya que el análisis JEAS descrito se hace independientemente para cada marco, la continuidad de los parámetros estimados entre marcos adyacentes no está garantizada, particularmente dentro de los segmentos sonoros. Como resultado, se producen distorsiones preceptúales cuando los parámetros cambian demasiado bruscamente de marco a marco. Para reducir este problema, las trayectorias de los parámetros de la fuente glotal sonora y del tracto vocal se suavizan antes de la resíntesis. 5 in practice, since the JEAS analysis described is done independently for each frame, the continuity of the parameters estimated between adjacent frames is not guaranteed, particularly within the sound segments. As a result, preceptual distortions occur when the parameters change too sharply from frame to frame. To reduce this problem, the trajectories of the parameters of the glottal sound source and the vocal tract are smoothed before resynthesis.

10 Con respecto al tracto vocal, los coeficientes de filtro conjuntamente estimados (α1…αp) se convierten primero en Frecuencias Espectrales en Línea (LSF) debido a sus mejores propiedades de interpolación. Entonces, cada conjunto de los coeficientes LSF LSFP (lsf1…lsfP) se promedian con los de los marcos anterior y siguiente para obtener una estimación de filtro de tracto vocal más suave para la síntesis 10 With respect to the vocal tract, the jointly estimated filter coefficients (α1… αp) are first converted to in-line Spectral Frequencies (LSF) due to their better interpolation properties. Then, each set of LSF LSFP coefficients (lsf1… lsfP) is averaged with those of the previous and next frames to obtain a smoother vocal tract filter estimate for synthesis

15 fifteen

imagen1image 1

Como para la fuente glotal, se sigue una aproximación similar. Primero, los parámetros T de LF ajustados (Tp, Te, Ta, Tc) se convierten en parámetros R (Rg, Rk, Ra) que son más adecuados para la interpolación ya que están normalizados con As for the glottal source, a similar approach is followed. First, the adjusted T parameters of LF (Tp, Te, Ta, Tc) become R parameters (Rg, Rk, Ra) that are more suitable for interpolation since they are normalized with

20 respecto al período fundamental. De nuevo, para suavizar sus trayectorias, cada conjunto de parámetros R se promedia con los de los marcos anterior y siguiente. Las trayectorias de la ANE de la energía del ruido de la aspiración se suavizan de la misma forma 20 regarding the fundamental period. Again, to soften its trajectories, each set of R parameters is averaged with those of the previous and next frames. The ANE trajectories of the aspiration noise energy are smoothed in the same way

25 Una vez que los parámetros fuente (Rg, Rk, Ra, ANE) han sido promediados, se usan para recalcular las ondas glotales derivadas de LF suavizadas If (n) y las estimaciones del ruido de aspiración modulado en amplitud an (n) a utilizar como filtro de excitación e (n) para la resíntesis. 25 Once the source parameters (Rg, Rk, Ra, ANE) have been averaged, they are used to recalculate glottal waves derived from smoothed LF If (n) and estimates of modulated suction noise in amplitude an (n) to use as excitation filter e (n) for resynthesis.

imagen1image 1

30 Para resintetizar la onda del habla, se emplea el esquema de superposición – adición de la ecuación 21 30 To resynthesize the speech wave, the overlay-addition scheme of equation 21 is used

imagen1image 1

donde K es el número total de marcos Wk es la ventana de Hamming de forma que where K is the total number of frames Wk is the Hamming window so that

imagen4image4

y SCk es la contribución sintética de longitud MkSC = Nk-1 + Nk generada por and SCk is the synthetic contribution of length MkSC = Nk-1 + Nk generated by

imagen1image 1

5 5

10 10

15 fifteen

20 twenty

25 25

30 30

35 35

40 de manera que el K-esimo marco de síntesis de las muestras Nk se obtenga como 40 so that the K-th synthesis frame of the Nk samples is obtained as

imagen1image 1

La figura 16 muestra un diagrama esquemático del esquema de síntesis de superposición – adición empleado. Figure 16 shows a schematic diagram of the overlay-addition synthesis scheme employed.

1.4 Modificación de tono y de escala de tiempo 1.4 Modification of tone and time scale

Debido al modelado explícito e independiente del período fundamental y a las posibilidades de interpolación de las parametrizaciones del tracto vocal y de la fuente glotal empleadas, se implementan fácilmente las modificaciones de tono y de escala de tiempo dentro del marco JEAS. Due to the explicit and independent modeling of the fundamental period and the interpolation possibilities of the vocal tract and glotal source parameters used, tone and time scale modifications are easily implemented within the JEAS framework.

Ambas transformaciones de tono y de escala de tiempo se basan en una aproximación de interpolación de trayectoria de parámetros, en la que la primera tarea comprende el cálculo del número de marcos requeridos en un segmento particular para conseguir las modificaciones deseadas. Una vez calculado el número modificado de marcos, los contornos del tamaño de los marcos, la excitación y las trayectorias de los parámetros del tracto vocal son nuevamente muestreados en el número modificado de marcos usando, por ejemplo, interpolación de ajustador cúbico. Ya que el modelo JEAS es síncrono en el tono, los tamaños de los marcos se corresponden con los períodos del tono en los segmentos sonoros mientras que son fijos en los segmentos no sonoros. Debido a sus mejores características de interpolación, se emplean coeficientes de LSF y parámetros R durante las transformaciones de tono y de escala de tiempo para representar respectivamente los parámetros del tracto vocal y de la fuente glotal, además de las energías de la ANE de aspiración y de ruido GNE gaussiano. Both tone and time scale transformations are based on a parameter path interpolation approach, in which the first task involves calculating the number of frames required in a particular segment to achieve the desired modifications. Once the modified number of frames is calculated, the contours of the frame size, the excitation and the trajectories of the vocal tract parameters are again sampled in the modified number of frames using, for example, cubic adjuster interpolation. Since the JEAS model is synchronous in tone, the frame sizes correspond to the periods of tone in the sound segments while they are fixed in the non-sound segments. Due to their better interpolation characteristics, LSF coefficients and R parameters are used during tone and time scale transformations to respectively represent the parameters of the vocal tract and the glottal source, in addition to the energies of the aspiration ANE and of Gaussian GNE noise.

La modificación de escala de tiempo se lleva a cabo aumentando o disminuyendo el número de marcos por segmento e interpolando consecuentemente las pistas de los parámetros. Por ejemplo, para aumentar la duración de un segmento sonoro de f marcos en un 25%, el número modificado de marcos se calcula como mf = f + 0,25f. Entonces, se muestrea nuevamente el contorno del período del tono del punto f en el nuevo conjunto de puntos mf uniformemente separados, según se muestra en la figura 17. De esta forma, se conserva el contorno del período fundamental, es decir, la entonación, mientras se ralentiza su variación. Es necesario aplicar la misma repetición del muestreo a cada coeficiente LSF, parámetro R y pistas de ANE, para sintetizar el habla modificada en el tiempo. Los segmentos no sonoros también pueden escalarse en el tiempo usando el procedimiento descrito. En este caso, las trayectorias de los parámetros de excitación para el nuevo muestreo son las energías de GNE de la fuente de ruido gaussiano. The time scale modification is carried out by increasing or decreasing the number of frames per segment and consequently interpolating the parameter tracks. For example, to increase the duration of a sound segment of frames by 25%, the modified number of frames is calculated as mf = f + 0.25f. Then, the contour of the period of the tone of the point f is again sampled in the new set of uniformly separated mf points, as shown in Figure 17. In this way, the contour of the fundamental period is preserved, that is, intonation while its variation slows down. It is necessary to apply the same repetition of sampling to each LSF coefficient, parameter R and ANE tracks, to synthesize the modified speech over time. Non-sound segments can also be scaled over time using the procedure described. In this case, the paths of the excitation parameters for the new sampling are the GNE energies of the Gaussian noise source.

El tono puede alterarse multiplicando simplemente el contorno del período fundamental por un factor de escalado. The tone can be altered by simply multiplying the contour of the fundamental period by a scaling factor.

Por ejemplo, si un contorno de período de tono dado de f marcos T = {T1, T2,…,Tf} se multiplica por 0,5, el habla sintetizada con el contorno modificado T = 0,5 T = {T’1, T’2,…,T’f} podría percibirse como que tiene el doble de la frecuencia fundamental original. Sin embargo, su duración también podría percibirse como la mitad del original. La escalado de los períodos fundamentales comprende la modificación de los tamaños de los marcos y, como consecuencia, las duraciones de los segmentos. Por esta razón, también es necesario modificar el número de marcos en un segmento cuando se escala el tono si se quiere mantener su duración. El número modificado de marcos mf en los períodos fundamentales escalados cuya duración se aproxima al original puede calcularse como For example, if a given tone period contour of f frames T = {T1, T2,…, Tf} is multiplied by 0.5, the speech synthesized with the modified contour T = 0.5 T = {T'1 , T'2, ..., T'f} could be perceived as having twice the original fundamental frequency. However, its duration could also be perceived as half of the original. The scaling of the fundamental periods includes the modification of the frame sizes and, as a consequence, the durations of the segments. For this reason, it is also necessary to modify the number of frames in a segment when the tone is scaled if its duration is to be maintained. The modified number of mf frames in the scaled fundamental periods whose duration approximates the original can be calculated as

imagen1image 1

donde T es el período fundamental medio original, T ’ es el período fundamental medio escalado. Una vez que se ha calculado mf, el contorno del período del tono escalado T´, los coeficientes de LSF, los parámetros R y las trayectorias de ANE deben muestrearse de nuevo en el nuevo número de marcos antes de resintetizar la onda del habla modificada en el tono. where T is the original mean fundamental period, T ’is the scaled average fundamental period. Once mf has been calculated, the contour of the scaled tone period T ', the LSF coefficients, the R parameters and the ANE trajectories must be sampled again in the new number of frames before resynthesizing the modified speech wave in the tone.

5 5

10 10

15 fifteen

20 twenty

25 25

30 30

35 35

40 40

2. Conversión de voz 2. Voice conversion

En esta sección, se explora el uso de la parametrización de la fuente glotal JEAS y las transformaciones lineales probabilísticas continuas para la conversión de la voz y el rendimiento del Marco de Conversión de Voz JEAS resultante se compara con el de un sistema de VC Sinusoidal convencional (H. Ye y S. Young, High Quality Voice Morphing in Proc. ICASSP, volumen 1, pág. 1-9-12, 2004), referenciado como PSHM. La primera sección detalla el modelo del habla y las técnicas de transformación de características empleadas en la implementación de VC de JEAS. A continuación se presenta la medición objetiva de su cubierta espectral y el rendimiento de la conversión de la fuente de voz y la evaluación subjetiva de la capacidad de reconocimiento y la calidad de la salida convertida. In this section, the use of the JEAS glottal source parameterization and the continuous probabilistic linear transformations for the voice conversion is explored and the resulting JEAS Voice Conversion Frame performance is compared with that of a conventional Sinusoidal VC system (H. Ye and S. Young, High Quality Voice Morphing in Proc. ICASSP, volume 1, p. 1-9-12, 2004), referenced as PSHM. The first section details the speech model and the characteristics transformation techniques used in the JEAS VC implementation. The objective measurement of its spectral cover and the conversion performance of the voice source and the subjective evaluation of the recognition capacity and the quality of the converted output are presented below.

2.1 Conversión de Voz JEAS 2.1 JEAS Voice Conversion

A continuación se describen los procedimientos de transformación de la cubierta espectral y de la onda glotal empleados en la conversión de voz JEAS. Aunque la conversión de la cubierta espectral se hace de una forma similar a la implementación de conversión de voz sinusoidal ya conocida, la principal ventaja del modelo JEAS, es decir, la parametrización de la fuente de voz, permite que las características de la fuente se transformen también para coincidir con la diana. Al igual que ofrece el potencial para mejorar la fidelidad en la identidad de la diana, esto también evita la necesidad de procedimientos convencionales de predicción residual. Además, ya que la parametrización JEAS no implica una división de magnitud y fase del espectro, no se producen los defectos debidos a las discordancias de magnitud y fase convertidas y, así, no se requiere el uso de técnicas adicionales, tales como la predicción de fase. The following describes the procedures for transforming the spectral sheath and the glottal wave used in JEAS voice conversion. Although the conversion of the spectral cover is done in a manner similar to the implementation of known sinusoidal voice conversion, the main advantage of the JEAS model, that is, the parameterization of the voice source, allows the characteristics of the source to be also transform to match the target. As it offers the potential to improve fidelity in the target's identity, this also avoids the need for conventional residual prediction procedures. In addition, since JEAS parameterization does not imply a division of magnitude and phase of the spectrum, defects due to converted magnitude and phase mismatches do not occur and, thus, the use of additional techniques, such as the prediction of phase.

2.1.1 Conversión de Cubierta Espectral 2.1.1 Spectral Cover Conversion

Los coeficientes de filtro de tracto vocal omnipolar de JEAS conjuntamente estimados (α1…αp) se convierten en parámetros de LSF mediante escalado de Bark para la transformación de las cubiertas espectrales JEAS. Primero, se calcula la respuesta de frecuencia lineal del filtro de tracto vocal conjuntamente estimado. Este se muestrea nuevamente de acuerdo con la escala de Bark, usando por ejemplo, la técnica de interpolación de ajustador cúbico ya conocida. Entonces se calculan los coeficientes de filtro omnipolar distorsionados aplicando, por ejemplo, el algoritmo convencional de Levinson – Durbin a la secuencia de autocorrelación del espectro de potencia distorsionado, entonces los coeficientes de filtro se transforman en LSF para la conversión. The jointly estimated JEAS vocal tract filter coefficients (α1… αp) are converted into LSF parameters by Bark scaling for the transformation of the JEAS spectral shells. First, the linear frequency response of the jointly estimated vocal tract filter is calculated. This is sampled again according to the Bark scale, using, for example, the already known cubic adjuster interpolation technique. The distorted omnipolar filter coefficients are then calculated by applying, for example, the conventional Levinson-Durbin algorithm to the autocorrelation sequence of the distorted power spectrum, then the filter coefficients are transformed into LSF for conversion.

Se emplea una función de transformación lineal probabilística continua para convertir las cubiertas espectrales LSF. Se usan Modelos de Mezclas Gaussianas (GMK) para describir los espacios vectoriales de las características glotales de la fuente y de la diana, clasificarlas en M clases y preparar las transformaciones lineales específicas para las clases. Entonces se emplea una suma ponderada de las transformaciones lineales para convertir cada vector x de características de la fuente glotal. A continuous probabilistic linear transformation function is used to convert the LSF spectral shells. Gaussian Mixture Models (GMK) are used to describe the vector spaces of the glottal characteristics of the source and target, classify them into M classes and prepare specific linear transformations for the classes. A weighted sum of the linear transformations is then used to convert each vector x of characteristics of the glottal source.

imagen1image 1

en la que X es el vector de características extendido X = [x ’ ; 1]’ y _m es el peso de la interpolación de la matriz de transformación Wm, su valor viene dado por la probabilidad del vector x que pertenece a la clase Cm. where X is the extended feature vector X = [x ’; 1] ’y _m is the interpolation weight of the transformation matrix Wm, its value is given by the probability of the vector x belonging to the class Cm.

imagen1image 1

siendo αm, μm y Σm los pesos, medias y varianzas de los componentes GMM respectivamente y N() representa la Distribución Normal. Las matrices de transformación Wm se estiman usando datos de entrenamiento paralelos de la fuente y de la diana y un criterio de error cuadrático mínimo. where αm, μm and Σm are the weights, means and variances of the GMM components respectively and N () represents the Normal Distribution. Wm transformation matrices are estimated using parallel training data from the source and target and a minimum quadratic error criterion.

Después de la conversión, los nuevos parámetros de LSF se transforman en coeficientes de filtro omnipolar y se muestrean nuevamente para la escala lineal antes de la síntesis. Ya que el uso de las transformaciones lineales ensanchan los formantes del habla convertida, se aplica un post filtro perceptual para estrechar los anchos de banda de los formantes, aumentar los valles espectrales y afilar los picos de los formantes. After conversion, the new LSF parameters are transformed into omnipolar filter coefficients and are sampled again for the linear scale before synthesis. Since the use of linear transformations widens the formants of converted speech, a perceptual post filter is applied to narrow the bandwidths of the formants, increase the spectral valleys and sharpen the peaks of the formants.

La figura 18 ilustra el JEAS frente a las cubiertas espectrales PSHM, y en ella puede verse que las cubiertas PSHM capturan la inclinación espectral pero en JEAS se codifica mediante ondas glotales en su lugar. Además, aunque ambos procedimientos están dirigidos a representar los formantes más importantes, existen pequeñas diferencias en sus amplitudes, frecuencias y/o anchos banda. Figure 18 illustrates the JEAS versus the PSHM spectral decks, and it can be seen that the PSHM decks capture the spectral inclination but in JEAS it is encoded by glottal waves instead. In addition, although both procedures are aimed at representing the most important formants, there are small differences in their amplitudes, frequencies and / or bandwidths.

2.1.2 Conversión de la Onda Glotal 2.1.2 Conversion of the Glotal Wave

El trabajo previo sobre la conversión de la onda glotal ha demostrado que la cuantificación de los parámetros glotales es posible y capaz de capturar diferencias de la calidad de la fuente de voz. Por ejemplo, Childers y colaboradores (Glottal source modelling for voice conversión, Speech Communication, 16:127 – 138, 1995) crearon códigos de 32 entradas de parámetros polinómicos de fuente de voz a partir de frases producidas con diferentes calidades de voz y dirigidas a conseguir la conversión entre fonaciones modales, rotas, entrecortadas, ásperas, en falsete, susurrantes y roncas. Sin embargo, experimentos que implicaban transformaciones entre fonaciones más similares, es decir, diferentes hablantes modales o procedimientos de conversión alternativos todavía no se han explorado. Tampoco se ha investigado el uso de la parametrización glotal de LF. Previous work on the conversion of the glottal wave has shown that quantification of the glottal parameters is possible and able to capture differences in the quality of the voice source. For example, Childers and collaborators (Glottal source modeling for voice conversion, Speech Communication, 16: 127-138, 1995) created codes of 32 voice source polynomial parameter inputs from phrases produced with different voice qualities and aimed at get the conversion between modal, broken, choppy, rough, falsetto, whispering and hoarse phonations. However, experiments involving transformations between more similar phonations, that is, different modal speakers or alternative conversion procedures have not yet been explored. Nor has the use of glotal parameterization of LF been investigated.

La aproximación de mutación de la onda glotal adoptada en la conversión de voz de JEAS emplea Transformaciones Lineales Probabilísticas continuas para mapear parámetros LF glotales de diferentes hablantes modales masculinos y femeninos, que son los tipos de hablantes más comúnmente utilizados en las aplicaciones de conversión de voz. The approximation of the mutation of the glottal wave adopted in the JEAS voice conversion uses Continuous Probabilistic Linear Transformations to map glottal LF parameters of different male and female modal speakers, which are the types of speakers most commonly used in voice conversion applications. .

Las transformaciones lineales probabilísticas continuas se han seleccionado para ser la aproximación más robusta y eficiente encontrada para convertir cubiertas espectrales. Las limitaciones de los procedimientos de conversión basados en códigos para transformaciones de cubiertas, es decir las discontinuidades provocadas por el uso de un número discreto de entradas de código, también pueden interpolarse para la modificación de ondas glotales. Así, el uso del modelo probabilístico continuo y de las transformaciones se espera que consiga también mejores conversiones glotales. Continuous probabilistic linear transformations have been selected to be the most robust and efficient approximation found to convert spectral decks. The limitations of the code-based conversion procedures for roof transformations, that is the discontinuities caused by the use of a discrete number of code entries, can also be interpolated for the modification of glottal waves. Thus, the use of the continuous probabilistic model and the transformations is expected to also achieve better glottal conversions.

Los vectores de características empleados para convertir las características de la fuente glotal se derivan a partir de los parámetros del modelo JEAS enlazado con la fuente de voz de cada período de tono, es decir, la fuerza de excitación glotal Ee y los parámetros T ((Tp, Te, Ta, Tc) obtenidos a partir del procedimiento de ajuste de LF y de la energía de la estimación del ruido de aspiración (ANE) usada para ajustar la del ruido gaussiano modulado en amplitud síncrono en tono modelado. Para normalizar los parámetros T dependientes de To para la conversión, se transforman en parámetros R (Rg, Rk, Ra), dando como resultado el vector de características de dimensión cinco (Ee, Rg, Rk, Ra, ANE) para la conversión de la onda glotal. Según se muestra en la figura 19, la aproximación de conversión glotal descrita es capaz de llevar los contornos de los parámetros del vector de característica de la fuente más cerca de la diana que, como consecuencia, también produce formas glotales convertidas más similares a la diana. En particular, la figura 19 muestra la transformación lineal de las Ondas Glotales LF: a) ondas glotales LF fuente, diana y derivada convertida; b) trayectorias fuente, diana y convertida de los parámetros del vector de características glotales (Ee, Rg, Rk, Ra, ANE). The feature vectors used to convert the characteristics of the glottal source are derived from the parameters of the JEAS model linked to the voice source of each tone period, that is, the glottal excitation force Ee and the T parameters (( Tp, Te, Ta, Tc) obtained from the LF adjustment procedure and the aspiration noise estimation (ANE) energy used to adjust the modulated Gaussian noise in synchronous amplitude in modeled tone. T-dependent T for the conversion, are transformed into parameters R (Rg, Rk, Ra), resulting in the vector of characteristics of dimension five (Ee, Rg, Rk, Ra, ANE) for the conversion of the glottal wave. As shown in Figure 19, the described glotal conversion approach is capable of bringing the contours of the parameters of the source characteristic vector closer to the target which, as a consequence, also produces more converted glottals more similar to the target. In particular, Figure 19 shows the linear transformation of the LF Glottal Waves: a) converted, source and target LF glottal waves; b) source, target and converted trajectories of the glottal characteristics vector parameters (Ee, Rg, Rk, Ra, ANE).

2.2 Experimento: comparación entre un procedimiento de conversión de voz sinusoidal convencional y un procedimiento de Conversión de Voz JEAS 2.2 Experiment: comparison between a conventional sinusoidal voice conversion procedure and a JEAS Voice Conversion procedure

A continuación, se describe un experimento, en el cual un procedimiento de conversión de voz sinusoidal convencional (H. Ye y S. Young, High Quality Voice Morphing en Proc. ICASSP, volumen 1, pág. 1-9-12, 2004), denominado PSHM se compara con el rendimiento del procedimiento JEAS. Ambos procedimientos se han evaluado en una tarea de conversión basada en la base de datos VOICES (A. Kain, High Resolution voice transformation, thesis PhD , Oregon Health and Science University, 2001). Específicamente diseñado para propósitos de conversión de voz, el corpus se compone de tres ejemplos de 50 frases fonéticamente ricas habladas por 10 hablantes (5 hombres, 5 mujeres), es decir, un total de 150 palabras por hablante. Los datos del habla se grabaron usando una aproximación de “mimetización” que dio como resultado un alineamiento temporal natural entre frases idénticas producidas por los diferentes hablantes y sin tomar en consideración las referencias prosódicas de la identidad del hablante en alguna extensión. Para cada frase también se suministraron los instantes de cierre glotal derivados de las señales laringográficas y se han usado para el análisis síncrono de tono tanto de PSHM como de JEAS. Se han investigado cuatro experimentos diferentes de conversión de voz: transformaciones de hombre en hombre (MM), hombre en mujer (MF), mujer en hombre (FM) y mujer en mujer (FF). Las primeras 120 frases se utilizan para entrenamiento y las 30 restantes para comprobar cada conversión de par de hablantes. An experiment is described below, in which a conventional sinusoidal voice conversion procedure (H. Ye and S. Young, High Quality Voice Morphing in Proc. ICASSP, volume 1, p. 1-9-12, 2004) , called PSHM is compared to the performance of the JEAS procedure. Both procedures have been evaluated in a conversion task based on the VOICES database (A. Kain, High Resolution voice transformation, thesis PhD, Oregon Health and Science University, 2001). Specifically designed for voice conversion purposes, the corpus is composed of three examples of 50 phonetically rich phrases spoken by 10 speakers (5 men, 5 women), that is, a total of 150 words per speaker. Speech data was recorded using a "mimicry" approach that resulted in a natural temporal alignment between identical phrases produced by different speakers and without taking into account the prosodic references of the speaker's identity to some extent. For each phrase, the instants of the glottal closure derived from the laryngographic signals were also supplied and have been used for synchronous tone analysis of both PSHM and JEAS. Four different voice conversion experiments have been investigated: transformations of man in man (MM), man in woman (MF), woman in man (FM) and woman in woman (FF). The first 120 sentences are used for training and the remaining 30 to check each speaker pair conversion.

A todo lo largo de los experimentos de conversión se han empleado vectores espectrales de LSF de orden 30 para entrenar 8 transformaciones de cubierta espectral entre cada par de hablantes fuente y diana usando datos de entrenamiento paralelos de VOICES. Este número se ha seleccionado por ser capaz de conseguir pequeñas relaciones de distorsión espectral al mismo tiempo que se generaliza para los datos de prueba. Se obtuvieron pares de vectores fuente – diana aplicando alineamiento forzado para marcar los límites subfónicos y usando Distorsión de Tiempo Dinámica para constreñir adicionalmente su alineamiento de tiempo. Para la predicción residual y de fase, se han construido GMM de diana y códigos de 40 clases y entradas. Finalmente, se han llevado también a cabo conversiones de onda glotal usando 8 transformaciones lineales por cada par de hablantes. Se han utilizado evaluaciones objetivas y subjetivas para comparar el rendimiento de los dos procedimientos. Throughout the conversion experiments, LSF spectral vectors of order 30 have been used to train 8 spectral cover transformations between each pair of source and target speakers using parallel VOICES training data. This number has been selected for being able to achieve small spectral distortion ratios at the same time as it is generalized for the test data. Source-target vector pairs were obtained by applying forced alignment to mark the subphonic boundaries and using Dynamic Time Distortion to further constrain their time alignment. For residual and phase prediction, GMM target and codes of 40 classes and inputs have been constructed. Finally, glotal wave conversions have also been carried out using 8 linear transformations for each pair of speakers. Objective and subjective evaluations have been used to compare the performance of the two procedures.

5 5

10 10

15 fifteen

20 twenty

25 25

30 30

35 35

2.2.1 Evaluación de Objetivos 2.2.1 Objective Evaluation 2.2.1.1 Conversión de Cubierta Espectral 2.2.1.1 Spectral Cover Conversion

Ya que actualmente se aplican transformaciones de cubierta espectral lineal a los vectores de LSF, su rendimiento de conversión puede evaluarse fácilmente comparando las distancias de los vectores de LSF fuente, diana y convertido. Si la distancia entre dos vectores de LSF lsf1 y lsf2 se define como Since linear spectral sheath transformations are currently applied to LSF vectors, their conversion performance can be easily evaluated by comparing the distances of source, target and converted LSF vectors. If the distance between two LSF vectors lsf1 and lsf2 is defined as

imagen1image 1

puede usarse la siguiente relación de distorsión RLSF como una medida de objetivos de cómo cerrar los vectores fuente que se han convertido en la diana The following RLSF distortion ratio can be used as a measure of objectives of how to close the source vectors that have become the target

imagen1image 1

donde lsfsrc-(t), lsftgt(t) y lsfconv(t) son respectivamente los vectores de LSF fuente, diana y convertido y se calcula la suma sobre los datos de prueba alineados en el tiempo, siendo L el número total de vectores de prueba después del alineamiento. Observe que una relación de distorsión del 100% se corresponde con la distorsión entre la fuente y la diana. where lsfsrc- (t), lsftgt (t) and lsfconv (t) are respectively the source, target and converted LSF vectors and the sum is calculated over the time-aligned test data, where L is the total number of vectors of test after alignment. Note that a 100% distortion ratio corresponds to the distortion between the source and the target.

Se han calculado las relaciones RLSF para las conversiones de cubierta espectral PSHM y JEAS sobre el conjunto de prueba de VOICES. La figura 20 muestra los resultados obtenidos. Aunque las diferencias son pequeñas, se ha encontrado que JEAS funciona ligeramente mejor que PSHM con relaciones de distorsión de LSF de un 3% menor en todas las tareas de conversión. Esto podría deberse al hecho de que las cubiertas espectrales de JEAS no codifican información de inclinación espectral, lo que reduce las variaciones de LSF provocadas por las diferencias de inclinación dando como resultado mapeos más exactos. The RLSF ratios for the PSHM and JEAS spectral cover conversions on the VOICES test set have been calculated. Figure 20 shows the results obtained. Although the differences are small, JEAS has been found to work slightly better than PSHM with 3% lower LSF distortion ratios in all conversion tasks. This could be due to the fact that JEAS spectral covers do not encode spectral inclination information, which reduces LSF variations caused by inclination differences resulting in more accurate mappings.

2.2.1.2 Conversión de Fuente de Voz 2.2.1.2 Voice Source Conversion

También pueden utilizarse medidas similares de distorsión de objetivos par evaluar la conversión de las características de la fuente de voz, es decir, Predicción Residual y Conversión de Onda Glotal en implementaciones PSHM y JEAS, respectivamente. Similar measures of objective distortion can also be used to evaluate the conversion of the characteristics of the voice source, that is, Residual Prediction and Conversion of the Glotal Wave in PSHM and JEAS implementations, respectively.

La Predicción Residual reintroduce los detalles espectrales de la diana no capturados por la conversión de la cubierta espectral, dando como resultado unos espectros convertidos del habla más cercanos a la diana. La Conversión de Onda Glotal, por otra parte, mapea representaciones del dominio de tiempo de las ondas glotales lo que en el dominio de frecuencia da como resultado una mejor concordancia de los formantes glotales y las inclinaciones espectrales de los espectros convertidos. Aunque los procedimientos son diferentes, su efecto espectral es similar, es decir se dirigen a reducir las diferencias entre los espectros del habla convertida y diana. The Residual Prediction reintroduces the spectral details of the target not captured by the conversion of the spectral envelope, resulting in converted spectra closest to the target. The Glottal Wave Conversion, on the other hand, maps representations of the time domain of the glottal waves which in the frequency domain results in a better concordance of the glottal formants and the spectral inclinations of the converted spectra. Although the procedures are different, their spectral effect is similar, that is, they are aimed at reducing the differences between the spectra of converted and target speech.

Una forma de evaluar si los procedimientos de conversión de la fuente de voz consiguen el efecto deseado es medir las distancias espectrales logarítmicas (LSD) entre los espectros convertido y diana antes y después de la conversión de la fuente de voz. Si la distancia espectral logarítmica RMS entre dos espectros se define como One way to assess whether the voice source conversion procedures achieve the desired effect is to measure the logarithmic spectral distances (LSD) between the converted and target spectra before and after the voice source conversion. If the RMS logarithmic spectral distance between two spectra is defined as

imagen1image 1

donde {ampk} son amplitudes armónicas nuevamente muestreadas a partir del espectro S en los puntos K sobre la escala de frecuencias de Bark (K se ha fijado en 100 puntos en este trabajo). Entonces, puede usarse una relación de distorsión RLSD similar a RLSF para comparar las distancias espectrales logarítmicas convertida – diana con y sin conversión de la fuente de voz. where {ampk} are harmonic amplitudes again sampled from the S spectrum at points K on the Bark frequency scale (K has been set at 100 points in this work). Then, an RLSD distortion ratio similar to RLSF can be used to compare the converted log-target spectral distances with and without voice source conversion.

imagen1image 1

En la que Sconv(t) y Sorig(t) son los espectros convertidos respectivamente con y sin conversión de fuente de voz y Stgt(t) es el espectro de la diana. Así, una relación del 100% se corresponde con la distorsión entre los espectros convertidos de la cubierta espectral sin transformación de la fuente de voz y los espectros diana. In which Sconv (t) and Sorig (t) are the spectra converted respectively with and without voice source conversion and Stgt (t) is the spectrum of the target. Thus, a ratio of 100% corresponds to the distortion between the spectral spectra converted without transformation of the voice source and the target spectra.

La figura 21 ilustra las relaciones RLSD calculadas para Predicción Residual y Conversión de Onda Glotal sobre el conjunto de prueba. Los resultados muestran que ambas técnicas de conversión de fuente de voz reducen las distorsiones entre los espectros del habla convertido y diana. La Predicción Residual funciona ligeramente mejor, principalmente a causa de que el algoritmo está diseñado para producir residuos que minimizan la distancia espectral logarítmica representada en RLSD. En contraste, la conversión de onda glotal está dirigida a minimizar el error de conversión de los parámetros glotales sobre los datos de entrenamiento y no la distancia espectral logarítmica. No obstante, ambos procedimientos tienen éxito al llevar los espectros convertidos cerca de la diana. Figure 21 illustrates the RLSD ratios calculated for Residual Prediction and Glottal Wave Conversion over the test set. The results show that both voice source conversion techniques reduce distortions between spectra of converted and target speech. The Residual Prediction works slightly better, mainly because the algorithm is designed to produce residues that minimize the logarithmic spectral distance represented in RLSD. In contrast, the glottal wave conversion is aimed at minimizing the error of conversion of the glottal parameters on the training data and not the logarithmic spectral distance. However, both procedures are successful in bringing the converted spectra near the target.

2.2.2 Evaluación Subjetiva 2.2.2 Subjective Evaluation

Para comparar perceptualmente los sistemas de conversión de voz PSHM y JEAS, se llevó a cabo un ensayo de audición para comprobar su rendimiento en términos de capacidad de reconocimiento y calidad. 12 sujetos tomaron parte en el estudio perceptual que constó de dos partes. To significantly compare the PSHM and JEAS voice conversion systems, a hearing test was conducted to check their performance in terms of recognition ability and quality. 12 subjects took part in the perceptual study that consisted of two parts.

La primera parte fue una prueba ABX en la cual se presentaron a los sujetos palabras convertidas con PSHM (A), convertidas con JEAS (B) y diana (X) y se les pidió que seleccionaran la muestra A o B que ellos encontraban más similar a la diana X en términos de identidad del hablante. Las características de las cubiertas espectrales y de la fuente de voz se transformaron con los procedimientos descritos anteriormente para cada sistema, es decir se usaron predicción de conversión, de residuo y de fase de cubierta espectral para transformaciones PSHM y conversión de cubierta espectral y de onda glotal para transformaciones JEAS. Además, se empleó la prosodia de la diana para sintetizar las frases convertidas para normalizar las diferencias de tono, duración y energía entre los hablantes fuente y diana para la comparación perceptual. Se presentaron 10 palabras de cada tipo de conversión (MM, MF, FM, FF). El orden de las muestras en términos de tipo de conversión y sistema de conversión fue aleatorio. Una audición informal de las palabras transformadas usando los sistemas de conversión PSHM y JEAS reveló que a menudo fue muy difícil escoger de forma convincente entre los sistemas en términos de identidad del hablante. Por esta razón, también se permitió a los sujetos seleccionar una opción “SIN PREFERENCIA CLARA” cuando encontraron difícil la selección o no tenían una preferencia clara hacia una de las muestras de habla A o B presentadas. The first part was an ABX test in which subjects converted with PSHM (A), converted with JEAS (B) and target (X) were presented to the subjects and were asked to select sample A or B that they found most similar to target X in terms of speaker identity. The characteristics of the spectral covers and the voice source were transformed with the procedures described above for each system, that is, prediction of conversion, residue and spectral cover phase were used for PSHM transformations and conversion of spectral and wave cover. Gotal for JEAS transformations. In addition, the prosody of the target was used to synthesize the converted phrases to normalize the differences in tone, duration and energy between the source and target speakers for perceptual comparison. There were 10 words of each type of conversion (MM, MF, FM, FF). The order of the samples in terms of conversion type and conversion system was random. An informal hearing of the transformed words using the PSHM and JEAS conversion systems revealed that it was often very difficult to choose convincingly among the systems in terms of speaker identity. For this reason, the subjects were also allowed to select an option “WITHOUT CLEAR PREFERENCE” when they found the selection difficult or did not have a clear preference towards one of the A or B speech samples presented.

La figura 22 muestra los resultados de la prueba ABX. En todos los tipos de conversión, se prefirieron las muestras convertidas con JEAS en vez de las convertidas con PSHM, pero la diferencia de preferencia varía dependiendo del tipo de conversión, siendo por ejemplo casi la misma para las transformaciones FM. Sin embargo, la opción “SIN PREFERENCIA CLARA” (NSP) se ha seleccionado casi tan a menudo como las palabras convertidas con JEAS en general, lo que revela que los sujetos hallaron realmente difícil distinguir entre los sistemas de conversión en términos de identidad del hablante. Ya que las señales más importantes de identificación del hablante, es decir las cubiertas espectrales, se transforman usando el mismo procedimiento en las dos implementaciones de conversión, se espera que ambos sistemas funcionen igual en términos de capacidad de reconocimiento del hablante. Además, los resultados obtenidos muestran que las técnicas de Predicción Residual y Conversión de Onda Glotal también son comparables en términos de transformación de la identidad perceptual del hablante. Figure 22 shows the results of the ABX test. In all types of conversion, samples converted with JEAS were preferred instead of those converted with PSHM, but the difference in preference varies depending on the type of conversion, being for example almost the same for FM transformations. However, the option “WITHOUT CLEAR PREFERENCE” (NSP) has been selected almost as often as words converted with JEAS in general, which reveals that the subjects found it really difficult to distinguish between conversion systems in terms of speaker identity . Since the most important speaker identification signals, ie spectral covers, are transformed using the same procedure in the two conversion implementations, both systems are expected to function the same in terms of speaker recognition capability. In addition, the results obtained show that the techniques of Residual Prediction and Conversion of the Glotal Wave are also comparable in terms of transformation of the perceptual identity of the speaker.

El segundo ensayo de audición se dirigía a determinar qué sistema produce un habla con una mayor calidad. Se presentó a los sujetos pares de sonidos del habla convertidos con PSHM y JEAS y se les pidió que seleccionaran el que pensaban que tenían una mejor calidad de habla. Los resultados se ilustran en la figura 23. Hay una preferencia clara por las palabras convertidas usando el procedimiento JEAS, seleccionado un 75,7% de media, lo que se desprendía de la diferencia de calidad claramente distinguible entre las muestras transformadas con PSHM y JEAS. Los sonidos obtenidos después de la conversión con PSHM tenían una calidad “ruidosa” provocada por las discontinuidades de fase que todavía existen a pesar de la Predicción de Fase. Comparativamente, las palabras convertidas con JEAS suenan más fluidas. Esta diferencia de calidad se piensa que también desvió ligeramente la preferencia para la conversión con JEAS en el ensayo ABX. The second hearing test was aimed at determining which system produces speech with a higher quality. Pairs of speech sounds converted with PSHM and JEAS were presented to the subjects and asked to select the one they thought had a better speech quality. The results are illustrated in Figure 23. There is a clear preference for words converted using the JEAS procedure, selected 75.7% on average, which resulted from the clearly distinguishable quality difference between samples transformed with PSHM and JEAS . The sounds obtained after the conversion with PSHM had a "noisy" quality caused by the phase discontinuities that still exist despite the Phase Prediction. Comparatively, words converted with JEAS sound more fluid. This difference in quality is thought to also slightly offset the preference for conversion with JEAS in the ABX trial.

Entre otros, el procedimiento y el dispositivo de conversión de voz de la presente invención es aplicable a marcos que requieran transformaciones de claridad de voz. Como una de tales aplicaciones, puede mencionarse su uso para reparar las características de la fuente de voz anormal del habla traqueo-esofágica. Among others, the method and the voice conversion device of the present invention is applicable to frames that require voice clarity transformations. As one such application, its use to repair the characteristics of the abnormal voice source of tracheo-esophageal speech can be mentioned.

La invención obviamente no está limitada a las realizaciones específicas aquí descritas, sino que comprende cualquier variación que pueda ser considerada por cualquier persona experta en la materia (por ejemplo, con respecto a la selección de componentes, configuración, etc), dentro del alcance general de la invención tal como se define en las reivindicaciones adjuntas. The invention is obviously not limited to the specific embodiments described herein, but includes any variation that may be considered by any person skilled in the art (for example, with respect to component selection, configuration, etc.), within the general scope of the invention as defined in the appended claims.

Claims (12)

REIVINDICACIONES 1. Un procedimiento para convertir una señal de habla de un hablante fuente en un a señal de voz convertida, que comprende los pasos de: 1. A method for converting a speech signal from a source speaker into a converted voice signal, comprising the steps of: -una etapa de entrenamiento, en la cual: -a training stage, in which: - dada una base de datos de entrenamiento de datos fuente y diana paralelos, para cada período de tono de dicha base de datos de entrenamiento: - given a training database of parallel source and target data, for each tone period of said training database:
--
modelar cada período de tono por medio de una onda glotal y un filtro de tracto glotal de acuerdo con el modelo de Lu y Smith, para obtener un conjunto de parámetros Liljencrants – Fant LF, dicho conjunto de parámetros LF comprende un parámetro de fuerza de excitación Ee y un conjunto de parámetros T, Tp, Te, Ta, Tc que modelan una onda glotal y un conjunto de coeficientes de filtro de tracto vocal omnipolar (α1…αp);  model each tone period by means of a glottal wave and a glottal tract filter according to the Lu and Smith model, to obtain a set of Liljencrants - Fant LF parameters, said set of LF parameters comprises an excitation force parameter Ee and a set of parameters T, Tp, Te, Ta, Tc that model a glottal wave and a set of omnipolar vocal tract filter coefficients (α1… αp);
--
convertir dichos parámetros T, Tp, Te, Ta, Tc en parámetros Rg, Rk, Ra;  converting said parameters T, Tp, Te, Ta, Tc into parameters Rg, Rk, Ra;
--
convertir dichos coeficientes de filtro de tracto vocal omnipolar (α1…αp) en frecuencias espectrales en línea en la escala de Bark lsf1…lsfp;  converting said omnipolar vocal tract filter coefficients (α1… αp) into in-line spectral frequencies on the Bark scale lsf1… lsfp;
-definir un vector glotal G a convertir; -define a glotal vector G to convert;
--
definir un vector de tracto vocal de LSF a convertir, dicho vector de tracto vocal de LSF comprende dichas frecuencias espectrales en línea en la escala de Bark lsf1…lsfp;  defining a vocal tract vector of LSF to be converted, said vocal tract vector of LSF comprises said spectral frequencies in line on the Bark scale lsf1… lsfp;
--
aplicar la eliminación del ruido de la ondícula para obtener una obtener una estimación del ruido de aspiración glotal;  apply the elimination of the noise of the wavelet to obtain an estimate of the noise of glotal aspiration;
-a partir del conjunto de vectores de tracto vocal de LSF obtenidos para cada período de tono de dicha base de datos de entrenamiento, estimar una función de transformación lineal probabilística continua del tracto vocal usando el criterio de error cuadrático mínimo; -from the set of LSF vocal tract vectors obtained for each tone period of said training database, estimate a continuous probabilistic linear transformation function of the vocal tract using the minimum quadratic error criterion; el procedimiento se caracteriza porque dicha etapa de modelado comprende además los pasos de: The procedure is characterized in that said modeling step further comprises the steps of: - modelar dicha estimación del ruido de aspiración modulando el ruido gaussiano de la varianza unitaria próxima a cero con la mencionada onda glotal modelada y ajustando su energía ANE para coincidir con la mencionada estimación del ruido de aspiración; - modeling said estimation of the aspiration noise by modulating the Gaussian noise of the unit variance close to zero with the aforementioned modeled glotal wave and adjusting its ANE energy to coincide with the said estimation of the aspiration noise; dicho vector glotal G a convertir comprende dicho parámetro de fuerza de excitación Ee, dichos parámetros R, Rg, Rk , Ra y dicha energía ANE de la estimación del ruido de aspiración, said glotal vector G to be converted comprises said excitation force parameter Ee, said parameters R, Rg, Rk, Ra and said ANE energy of the aspiration noise estimate, el procedimiento comprende además: The procedure also includes:
--
una etapa de conversión en la cual una onda de habla de prueba dada se modela y se transforma en un conjunto de parámetros Ee´, Rg´, Rk, Ra´, ANE´, LSF´;  a conversion stage in which a given test speech wave is modeled and transformed into a set of parameters Ee´, Rg´, Rk, Ra´, ANE´, LSF´;
--
una etapa de síntesis en la cual una onda de habla convertida se sintetiza a partir de dicho conjunto de parámetros convertidos Ee´, Rg´, Rk, Ra´, ANE´, LSF´.  a synthesis stage in which a converted speech wave is synthesized from said set of converted parameters Ee´, Rg´, Rk, Ra´, ANE´, LSF´.
2. El procedimiento de acuerdo con la reivindicación 1, en el que dicha etapa de entrenamiento comprende además: 2. The method according to claim 1, wherein said training step further comprises: - a partir del conjunto de vectores glotales G obtenidos para cada período de tono de dicha base de datos de entrenamiento, estimar una función de transformación lineal probabilística continua de la onda glotal usando el criterio de error cuadrático mínimo. - from the set of Glottal vectors G obtained for each tone period of said training database, estimate a function of continuous probabilistic linear transformation of the glottal wave using the minimum quadratic error criterion. 3. El procedimiento de acuerdo con la reivindicación bien 1 ó bien 2, en el que dicho paso de modelar cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, comprende los pasos de: 3. The method according to claim 1 or 2, wherein said step of modeling each tone period by means of a glottal wave and a vocal tract filter according to the Lu and Smith model, comprises the Steps of: -modelar la onda glotal usando el modelo de Rosenberg – Klatt; -model the glottal wave using the Rosenberg model - Klatt; - usar optimización convexa para obtener un conjunto de parámetros glotales de Rosenberg – Klatt y los coeficientes del filtro de tracto vocal omnipolar α1…αp en el que dicho paso de usar optimización convexa comprende un paso de pre-énfasis adaptativo para estimar y eliminar la contribución de filtro de inclinación espectral de la onda del habla antes de la optimización convexa. - using convex optimization to obtain a set of Rosenberg glottal parameters - Klatt and the coefficients of the omnipolar vocal tract filter α1… αp in which said step of using convex optimization comprises an adaptive pre-emphasis step to estimate and eliminate the contribution of spectral inclination filter of the speech wave before convex optimization. 4. El procedimiento de acuerdo con la reivindicación 3, en el que dicho paso de modelar cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, comprende además los pasos de: 4. The method according to claim 3, wherein said step of modeling each tone period by means of a glottal wave and a vocal tract filter according to the Lu and Smith model, further comprises the steps of: - obtener una onda glotal derivada mediante el filtrado inverso de dicho período de tono usando dichos coeficientes de filtro de tracto vocal omnipolar α1…αp; - obtaining a glotal wave derived by inverse filtering of said tone period using said omnipolar vocal tract filter coefficients α1… αp; -ajustar dicho conjunto de parámetros LF a dicha onda glotal derivada de filtrado inverso mediante estimación directa y optimización no lineal constreñida. - adjusting said set of LF parameters to said glotal wave derived from inverse filtering by direct estimation and constrained nonlinear optimization. 5. El procedimiento de acuerdo con cualquier reivindicación precedente, en el que dicha etapa de conversión comprende, para cada período de tono de dicha onda de habla de prueba: 5. The method according to any preceding claim, wherein said conversion stage comprises, for each tone period of said test speech wave: - obtener un vector glotal G a convertir, comprendiendo dicho vector glotal un parámetro de fuerza de excitación Ee, un conjunto de parámetros R, Rg, Rk, Ra y la energía ANE de dicha estimación de ruido de aspiración; - obtaining a glotal vector G to be converted, said glotal vector comprising an excitation force parameter Ee, a set of parameters R, Rg, Rk, Ra and the ANE energy of said aspiration noise estimate; - obtener el vector de tracto vocal de LSF a convertir, dicho vector de tracto vocal de LSF comprende un conjunto de frecuencias espectrales en línea en la escala de Bark lsf1…lsfp; - obtaining the LSF vocal tract vector to be converted, said LSF vocal tract vector comprises a set of in-line spectral frequencies on the Bark scale lsf1… lsfp; - aplicar dicha función de transformación lineal probabilística continua del tracto vocal estimada durante la etapa de entrenamiento para obtener un vector de parámetros de LSF de tracto vocal convertidos; - applying said continuous probabilistic linear transformation function of the vocal tract estimated during the training stage to obtain a vector of converted vocal tract LSF parameters; -transformar dicho vector glotal G usando dicha función de transformación lineal probabilística continua de onda glotal estimada durante la etapa de entrenamiento, obteniendo así un vector glotal convertido G´ que comprende un conjunto de parámetros convertidos Ee´, Rg´, Rk, Ra´, ANE´, LSF´; -transform said glotal vector G using said continuous probabilistic linear transformation function of the glotal wave estimated during the training stage, thereby obtaining a converted glotal vector G 'comprising a set of converted parameters Ee´, Rg´, Rk, Ra´, ANE´, LSF´; 6. El procedimiento de acuerdo con la reivindicación 5, en el que dichas etapas de obtener un vector glotal G a convertir y un vector de tracto vocal de LSF a convertir comprende además los pasos de: 6. The method according to claim 5, wherein said steps of obtaining a glotal vector G to be converted and a vocal tract vector of LSF to be converted further comprise the steps of:
--
modelar cada período de tono por medio de una onda glotal y un filtro de tracto vocal de acuerdo con el modelo de Lu y Smith, para obtener un conjunto de parámetros LF, comprendiendo dicho conjunto de parámetros LF un parámetro de fuerza de excitación Ee y un conjunto de parámetros T, Tp, Te, Ta, Tc que modelan la onda glotal, y un conjunto de coeficientes de filtro de tracto vocal omnipolar α1…αp;  model each tone period by means of a glottal wave and a vocal tract filter according to the Lu and Smith model, to obtain a set of parameters LF, said set of parameters LF comprising an excitation force parameter Ee and a set of parameters T, Tp, Te, Ta, Tc that model the glottal wave, and a set of omnipolar vocal tract filter coefficients α1… αp;
--
convertir dichos coeficientes de filtro de tracto vocal omnipolar en frecuencias espectrales en línea en la escala de Bark lsf1…lsfp;  converting said omnipolar vocal tract filter coefficients into in-line spectral frequencies on the Bark scale lsf1… lsfp;
--
convertir dichos parámetros T en parámetros R, Rg, Rk, Ra;  converting said parameters T into parameters R, Rg, Rk, Ra;
--
definir un vector glotal G a convertir; define a glotal vector G to convert;
--
definir un vector de tracto vocal de LSF a convertir. Define an LSF vocal tract vector to convert.
7. 7.
El procedimiento de acuerdo con la reivindicación bien 5 o bien 6, en el que dicha etapa de conversión comprende además un paso de post-filtrado de dicho vector de parámetros convertidos de tracto vocal de LSF´. The method according to claim 5 or 6, wherein said conversion step further comprises a post-filtering step of said converted vector of LSF 'vocal tract parameters.
8. 8.
El procedimiento de acuerdo con cualquier reivindicación precedente, en el que dicha etapa de síntesis, en la cual se sintetiza dicha onda de habla convertida a partir de dicho conjunto de parámetros convertidos Ee´, Rg´, Rk, Ra´, ANE´, LSF´; comprende los pasos de: The method according to any preceding claim, wherein said synthesis step, in which said converted speech wave is synthesized from said set of converted parameters Ee´, Rg´, Rk, Ra´, ANE´, LSF ´; Understand the steps of:
- interpolar las trayectorias de dichos parámetros convertidos Rg´, Rk, Ra´, ANE´, LSF´; de cada período de tono, obteniendo así un conjunto de parámetros interpolados Rg”, Rk”, Ra”, ANE”, LSF”; que comprende los parámetros Rg”, Rk”, Ra”, energía interpolada (ANE) y un vector de tracto vocal interpolado de LSF”; - interpolate the paths of said converted parameters Rg´, Rk, Ra´, ANE´, LSF´; of each tone period, thus obtaining a set of interpolated parameters Rg ", Rk", Ra ", ANE", LSF "; comprising the parameters Rg ", Rk", Ra ", interpolated energy (ANE) and an interpolated vocal tract vector of LSF";
--
convertir dicho vector de tracto vocal interpolado de LSF” en un vector de coeficientes de filtro omnipolar A”; converting said interpolated vocal tract vector of LSF "into a vector of omnipolar filter coefficients A";
--
convertir dichos parámetros R interpolados Rg”, Rk”, Ra” en parámetros T interpolados Tp”, Te”, Ta”, Tc” ; converting said interpolated R parameters Rg ", Rk", Ra "into interpolated T parameters Tp", Te ", Ta", Tc ";
- para cada marco de dicha onda de voz de prueba, generar una señal de excitación ek(n), en la que k indica el kenésimo marco. - for each frame of said test voice wave, generate an excitation signal ek (n), in which k indicates the kinth frame.
9. El procedimiento de acuerdo con la reivindicación 8, en el que dicha etapa de generar una señal de excitación comprende, para cada uno de dichos marcos: 9. The method according to claim 8, wherein said step of generating an excitation signal comprises, for each of said frames: -si dicho marco es sonoro: -if that frame is sound:
--
a partir de dichos parámetros T interpolados Tp”, Te”, Ta”, Tc” y de dicho parámetro de fuerza de excitación Ee  from said interpolated parameters Tp ", Te", Ta ", Tc" and said excitation force parameter Ee
generar una onda glotal interpolada lfk(n); generate an interpolated glottal wave lfk (n);
--
a partir de dicho parámetro de energía interpolado ANE”, generar un ruido de aspiración interpolado ank(n);  from said parameter of interpolated energy ANE ”, generate an interpolated suction noise ank (n);
--
generar dicha señal de excitación sonora ek(n) añadiendo dicha onda glotal interpolada lfk(n) y dicho ruido de aspiración interpolado ank(n);  generating said sound excitation signal ek (n) by adding said interpolated glottal wave lfk (n) and said interpolated aspiration noise ank (n);
5 - si dicho marco no es sonoro: 5 - if said frame is not sound: -generar dicha señal de excitación no sonora ek(n) a partir de una fuente de ruido gaussiano gnk(n). -generate said non-sound excitation signal ek (n) from a Gaussian noise source gnk (n).
10. El procedimiento de acuerdo con la reivindicación bien 8 o bien 9 en el que dicha etapa de síntesis comprende además: 10. The method according to claim 8 or 9 wherein said synthesis step further comprises: - generar una contribución sintética de cada marco filtrando dicha señal de excitación ek(n) con dicho vector de 10 coeficientes de filtro omnipolar A”; - generating a synthetic contribution of each frame by filtering said excitation signal ek (n) with said vector of 10 omnipolar filter coefficients A ”; - multiplicar dicha contribución sintética por una ventana de Hamming, superponer y añadir, para generar la señal de habla convertida. - multiply this synthetic contribution by a Hamming window, superimpose and add, to generate the converted speech signal. 11. Un procedimiento aplicable a transformaciones de calidad de voz, tales como la reparación del habla traqueoesofágica, que comprende los pasos de procedimiento de cualquier reivindicación precedente. 11. A method applicable to voice quality transformations, such as tracheoesophageal speech repair, comprising the procedural steps of any preceding claim. 15 12. Un dispositivo que comprende medios adaptados para llevar a cabo los pasos del procedimiento de cualquier reivindicación precedente. A device comprising means adapted to carry out the steps of the procedure of any preceding claim. 13. Un medio de código de programa informático adaptado para realizar los pasos del procedimiento de cualquier reivindicación 1 – 11, cuando dicho programa se ejecuta en un ordenador, un procesador de señales digitales, una matriz de puertas programables por campo, un circuito integrado específico para la aplicación, un microprocesador, un 13. A computer program code medium adapted to perform the steps of the procedure of any claim 1-11, when said program is executed on a computer, a digital signal processor, an array of field-programmable gates, a specific integrated circuit for the application, a microprocessor, a 20 microcontrolador o cualquier otra forma de hardware programable. 20 microcontroller or any other form of programmable hardware.
ES08804436T 2008-09-19 2008-09-19 PROCEDURE, DEVICE AND MEANS OF THE COMPUTER PROGRAM CODE FOR VOICE CONVERSION. Active ES2364005T3 (en)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
PCT/EP2008/062502 WO2010031437A1 (en) 2008-09-19 2008-09-19 Method and system of voice conversion

Publications (1)

Publication Number Publication Date
ES2364005T3 true ES2364005T3 (en) 2011-08-22

Family

ID=40277465

Family Applications (1)

Application Number Title Priority Date Filing Date
ES08804436T Active ES2364005T3 (en) 2008-09-19 2008-09-19 PROCEDURE, DEVICE AND MEANS OF THE COMPUTER PROGRAM CODE FOR VOICE CONVERSION.

Country Status (5)

Country Link
EP (1) EP2215632B1 (en)
AT (1) ATE502380T1 (en)
DE (1) DE602008005641D1 (en)
ES (1) ES2364005T3 (en)
WO (1) WO2010031437A1 (en)

Families Citing this family (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
RU2427044C1 (en) * 2010-05-14 2011-08-20 Закрытое акционерное общество "Ай-Ти Мобайл" Text-dependent voice conversion method
CN101901598A (en) * 2010-06-30 2010-12-01 北京捷通华声语音技术有限公司 Humming synthesis method and system
ES2364401B2 (en) * 2011-06-27 2011-12-23 Universidad Politécnica de Madrid METHOD AND SYSTEM FOR ESTIMATING PHYSIOLOGICAL PARAMETERS OF THE FONATION.
RU2510954C2 (en) * 2012-05-18 2014-04-10 Александр Юрьевич Бредихин Method of re-sounding audio materials and apparatus for realising said method
US9607610B2 (en) 2014-07-03 2017-03-28 Google Inc. Devices and methods for noise modulation in a universal vocoder synthesizer
WO2020062217A1 (en) * 2018-09-30 2020-04-02 Microsoft Technology Licensing, Llc Speech waveform generation
US20220148570A1 (en) * 2019-02-25 2022-05-12 Technologies Of Voice Interface Ltd. Speech interpretation device and system
EP3839947A1 (en) 2019-12-20 2021-06-23 SoundHound, Inc. Training a voice morphing apparatus
US11600284B2 (en) 2020-01-11 2023-03-07 Soundhound, Inc. Voice morphing apparatus having adjustable parameters
CN113780107B (en) * 2021-08-24 2024-03-01 电信科学技术第五研究所有限公司 Radio signal detection method based on deep learning dual-input network model
CN115641858B (en) * 2022-10-27 2026-04-21 深圳市中科蓝讯科技股份有限公司 Voice changing processing methods, storage media, chips and electronic devices

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100809368B1 (en) * 2006-08-09 2008-03-05 한국과학기술원 Voice conversion system using vocal cords

Also Published As

Publication number Publication date
DE602008005641D1 (en) 2011-04-28
WO2010031437A1 (en) 2010-03-25
ATE502380T1 (en) 2011-04-15
EP2215632A1 (en) 2010-08-11
EP2215632B1 (en) 2011-03-16

Similar Documents

Publication Publication Date Title
ES2364005T3 (en) PROCEDURE, DEVICE AND MEANS OF THE COMPUTER PROGRAM CODE FOR VOICE CONVERSION.
Erro et al. Voice conversion based on weighted frequency warping
Arslan Speaker transformation algorithm using segmental codebooks (STASC)
ES2274606T3 (en) PROCEDURE AND APPLIANCE TO OBTAIN SOURCE AND FILTER DATA BASED ON FORMATORS, FOR CODING AND SYNTHESIS, USING COST FUNCTION AND REVERSED FILTERING.
Childers Glottal source modeling for voice conversion
Akande et al. Estimation of the vocal tract transfer function with application to glottal wave analysis
Cabral et al. Towards an improved modeling of the glottal source in statistical parametric speech synthesis
Degottex et al. Phase minimization for glottal model estimation
Chappell et al. A comparison of spectral smoothing methods for segment concatenation based speech synthesis
Erro et al. Weighted frequency warping for voice conversion.
Cabral et al. Glottal spectral separation for parametric speech synthesis
Nercessian Differentiable WORLD synthesizer-based neural vocoder with application to end-to-end audio style transfer
Ohtsuka et al. TRANSLATED PAPER
Schleusing et al. Joint source-filter optimization for accurate vocal tract estimation using differential evolution
Degottex Glottal source and vocal-tract separation
Roebel et al. Analysis and modification of excitation source characteristics for singing voice synthesis
JP4999757B2 (en) Speech analysis / synthesis apparatus, speech analysis / synthesis method, computer program, and recording medium
Lu et al. Glottal source modeling for singing voice synthesis
Agiomyrgiannakis et al. ARX-LF-based source-filter methods for voice modification and transformation
Childers et al. Factors in voice quality: acoustic features related to gender
Cabral et al. Towards a better representation of the envelope modulation of aspiration noise
Del Pozo Voice source and duration modelling for voice conversion and speech repair
Gowda et al. Quasi closed phase analysis of speech signals using time varying weighted linear prediction for accurate formant tracking
Erro et al. A pitch-asynchronous simple method for speech synthesis by diphone concatenation using the deterministic plus stochastic model
Parthasarathy et al. Articulatory analysis and synthesis of speech