ES2743197T3 - Corrección de pérdida de trama perfeccionada con información de sonoridad - Google Patents
Corrección de pérdida de trama perfeccionada con información de sonoridad Download PDFInfo
- Publication number
- ES2743197T3 ES2743197T3 ES15725801T ES15725801T ES2743197T3 ES 2743197 T3 ES2743197 T3 ES 2743197T3 ES 15725801 T ES15725801 T ES 15725801T ES 15725801 T ES15725801 T ES 15725801T ES 2743197 T3 ES2743197 T3 ES 2743197T3
- Authority
- ES
- Spain
- Prior art keywords
- signal
- frame
- decoding
- components
- period
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 238000012937 correction Methods 0.000 title description 11
- 238000000034 method Methods 0.000 claims abstract description 35
- 230000015572 biosynthetic process Effects 0.000 claims abstract description 20
- 238000003786 synthesis reaction Methods 0.000 claims abstract description 20
- 230000003595 spectral effect Effects 0.000 claims abstract description 18
- 238000004458 analytical method Methods 0.000 claims abstract description 8
- 230000005236 sound signal Effects 0.000 claims abstract description 8
- 238000001228 spectrum Methods 0.000 claims description 13
- 238000012545 processing Methods 0.000 claims description 4
- 238000010276 construction Methods 0.000 claims description 3
- 238000004590 computer program Methods 0.000 claims description 2
- 238000006467 substitution reaction Methods 0.000 abstract 1
- 238000000576 coating method Methods 0.000 description 10
- 239000011248 coating agent Substances 0.000 description 9
- 238000011282 treatment Methods 0.000 description 8
- 238000012512 characterization method Methods 0.000 description 6
- 239000000243 solution Substances 0.000 description 4
- 230000008901 benefit Effects 0.000 description 3
- 238000004891 communication Methods 0.000 description 3
- 238000012986 modification Methods 0.000 description 3
- 230000004048 modification Effects 0.000 description 3
- 230000009466 transformation Effects 0.000 description 3
- 230000001052 transient effect Effects 0.000 description 3
- 239000000706 filtrate Substances 0.000 description 2
- 238000001914 filtration Methods 0.000 description 2
- 230000006870 function Effects 0.000 description 2
- 238000002347 injection Methods 0.000 description 2
- 239000007924 injection Substances 0.000 description 2
- 238000005259 measurement Methods 0.000 description 2
- 230000008569 process Effects 0.000 description 2
- 238000000926 separation method Methods 0.000 description 2
- 238000012360 testing method Methods 0.000 description 2
- 241001362574 Decodes Species 0.000 description 1
- 238000012952 Resampling Methods 0.000 description 1
- 238000013459 approach Methods 0.000 description 1
- 230000005540 biological transmission Effects 0.000 description 1
- 238000004364 calculation method Methods 0.000 description 1
- 230000001186 cumulative effect Effects 0.000 description 1
- 230000007547 defect Effects 0.000 description 1
- 230000001419 dependent effect Effects 0.000 description 1
- 238000011049 filling Methods 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 238000002156 mixing Methods 0.000 description 1
- 238000011002 quantification Methods 0.000 description 1
- 230000007704 transition Effects 0.000 description 1
- 238000005303 weighing Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/005—Correction of errors induced by the transmission channel, if related to the coding algorithm
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/028—Noise substitution, i.e. substituting non-tonal spectral components by noisy source
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
- G10L25/81—Detection of presence or absence of voice signals for discriminating voice from music
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/18—Vocoders using multiple modes
- G10L19/20—Vocoders using multiple modes using sound class specific coding, hybrid encoders or object based coding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/93—Discriminating between voiced and unvoiced parts of speech signals
- G10L2025/932—Decision in previous or following frames
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/93—Discriminating between voiced and unvoiced parts of speech signals
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
Abstract
Procedimiento de tratamiento de una señal de audio digital que incluye una sucesión de muestras repartidas en tramas sucesivas, implementándose el procedimiento durante una decodificación de dicha señal para sustituir al menos una trama de señal perdida en la decodificación, incluyendo el procedimiento las etapas: a) búsqueda, en un segmento de señal válida disponible en la decodificación (Nc), de al menos un periodo de la señal, determinado en función de dicha señal válida, b) análisis de la señal en dicho periodo, para una determinación de componentes espectrales de la señal en dicho periodo, c) síntesis de al menos una trama de sustitución de la trama perdida, por construcción de una señal de síntesis a partir: - de una adición de componentes seleccionados entre dichos componentes espectrales determinados y - de un ruido añadido a la adición de componentes, en el que la cantidad de ruido añadida a la adición de componentes se pondera en función de una información de sonoridad de la señal válida, determinándose dicha información de sonoridad por un codificador y suministrándose posteriormente en un flujo codificado, correspondiente a dicha señal, entregado por dicho codificador y recibido en la decodificación, de manera que, en caso de pérdida de trama en la decodificación, se utilice la información de sonoridad contenida en una trama de señal válida precedente a la trama perdida.
Description
DESCRIPCIÓN
Corrección de pérdida de trama perfeccionada con información de sonoridad
La presente invención se refiere al campo de la codificación/decodificación de telecomunicaciones y, más particularmente, al de la corrección de la pérdida de trama en la decodificación.
Se entiende por "trama" un segmento de audio compuesto por al menos una muestra (aunque la invención se aplica tanto a la pérdida de una o varias muestras en la codificación según la norma G.711 como a una pérdida de uno o varios paquetes de muestras en codificación según las normas G.723, G.729, etc.).
Las pérdidas de tramas de audio se dan cuando una comunicación en tiempo real que utiliza un codificador y un decodificador es perturbada por las condiciones de una red de telecomunicación (problemas de radiofrecuencia, congestión de la red de acceso, etc.). En este caso, el decodificador utiliza los mecanismos de corrección de pérdida de tramas para intentar sustituir la señal faltante por una señal reconstruida utilizando informaciones disponibles en el decodificador (por ejemplo la señal de audio ya decodificada para una o varias tramas pasadas). Esta técnica puede mantener una calidad de servicio a pesar de rendimientos de la red degradados.
Las técnicas de corrección de pérdida de tramas son muy frecuentemente dependientes del tipo de codificación utilizado.
En el caso de una codificación CELP, es normal repetir ciertos parámetros decodificados en la trama precedente (envolvente espectral, tono, ganancias de diccionarios), con unos ajustes como una modificación de la envolvente espectral para converger hacia una envolvente media o la utilización de un diccionario fijo aleatorio.
La técnica más empleada para corregir la pérdida de trama en el caso de una codificación por transformada, consiste en repetir la última trama recibida si se pierde una trama y poner la trama repetida a cero a partir de que se pierda más de una trama. Esta técnica se encuentra en varias codificaciones normalizadas (G.719, G.722.1, G.722.1C). Se puede citar también el caso de la codificación normalizada G.711, para la que un ejemplo de corrección de pérdida de trama descrito en el apéndice I de G.711 consiste en identificar un periodo fundamental (llamado "tono") en la señal decodificada y en repetirla teniendo cuidado de hacer una adición con recubrimiento (llamada "overlap-add") entre la señal ya decodificada y la señal repetida. Esta adición con recubrimiento permite "borrar" las artificiosidades de audio pero necesita, para implementarse, un retardo suplementario en el decodificador (correspondiente a la duración del recubrimiento).
Por otra parte, en el caso de la codificación normalizada G.722.1, una transformada modulada con superposición (o MLT por "Modulated Lapped T ransform"), con una adición con recubrimiento del 50 % y unas ventanas sinusoidales que permiten asegurar una transición entre la última trama perdida y la trama repetida que sea suficientemente lenta para borrar las artificiosidades vinculadas a la simple repetición de la trama en el caso de una única trama perdida. Contrariamente a la corrección de la pérdida de trama descrita en la norma G.711 (Apéndice I), esta realización no necesita retardo suplementario puesto que aprovecha el retardo existente y el repliegue temporal de la transformada MLT para hacer una adición con recubrimiento con la señal reconstituida.
Esta técnica es muy poco costosa pero tiene como principal defecto una incoherencia entre la señal decodificada antes de la pérdida de trama y la señal repetida. De donde resulta una discontinuidad de fase que puede producir artificiosidades de audio importantes si la duración del recubrimiento entre las dos tramas es reducida, tal como es el caso cuando las ventanas utilizadas para la transformada MLT son "de reducido retardo" como se describe en el documento FR 1350845 con referencia a las figuras 1A y 1B de ese documento. En este caso, incluso una solución que combinara una búsqueda de tono, en el caso del codificador según la norma G.711 (Apéndice I) y una adición con recubrimiento según la ventana de la transformada MLT no es suficiente para suprimir las artificiosidades de audio.
El documento FR 1350845 propone un método híbrido que combina las ventajas de los dos métodos permitiendo mantener la continuidad de fase en el dominio transformado. La presente invención se inscribe en este marco. Una descripción detallada de la solución objeto de este documento FR 1350845 se describe más adelante con referencia a la figura 1.
Esta solución, incluso aunque es particularmente prometedora, queda por perfeccionar porque, cuando la señal codificada no incluye más que un periodo fundamental ("mono tono") como por ejemplo un segmento sonoro de una señal de voz, la calidad de audio después de la corrección de trama perdida puede estar degradada y peor que con una corrección de pérdida de trama mediante un modelo de voz de tipo CELP por ejemplo (por "Code-Excited Linear Prediction"). Otra solución se describe en PARIKH V. N. ET AL., "Frame erasure concealment using sinusoidal analysis synthesis and its application to MDCT-based codees", ACOUSTICS, SPEECH, AND SIGNAL PROCESSING, 2000. ICASSP '00. PROCEEDINGS. 2000 IEEE INTERNATIONAL CONFERENCE EL 5-9 DE JUNIO DE 2000, PISCATAWAY, Nueva Jersey, Estados Unidos, IEEE, vol. 2, 5 de junio de 2000, páginas 905-908.
La invención se dirige a la mejora de la situación.
Propone con este fin un procedimiento de tratamiento de la señal de audio digital tal como en la reivindicación 1 incluyendo una sucesión de muestras repartidas en tramas sucesivas, implementándose el procedimiento durante una decodificación de dicha señal para sustituir al menos una trama de señal perdida en la decodificación.
De este modo, la invención se dirige a mejorar el estado de la técnica en el sentido del documento FR 1350845 modificando diferentes etapas del tratamiento presentado en ese documento (búsqueda de tono, selección de los componentes, inyección de ruido) pero no obstante función en particular de las características de la señal original.
Estas características de la señal original pueden codificarse como una información particular en el flujo de datos hacia el decodificador (o "bitstream") en función de la clasificación de la voz y/o de la música y si es necesario de la clase de voz en particular.
Esta información en el flujo de la decodificación permite optimizar el compromiso entre complejidad y calidad y, conjuntamente:
- modificar la ganancia del ruido a inyectar en la suma de los componentes espectrales seleccionados para construir la señal de síntesis que reemplaza la trama perdida,
- modificar el número de componentes seleccionados para la síntesis,
- modificar la duración del segmento de búsqueda del tono.
Una realización de ese tipo puede implementarse en un codificador para la determinación de la información de sonoridad, y más particularmente en un decodificador, particularmente en el caso de pérdida de trama. Puede implementarse en la forma de software en una realización de una codificación/decodificación para los servicios de voz enriquecidos (o "EVS" por "Enhanced Voice Services") especificado por el grupo 3GPP (SA4).
Con este fin la presente invención se dirige también a un programa informático tal como en la reivindicación 13. Un ejemplo de ordinograma de un programa de ese tipo se presenta en la descripción detallada a continuación con referencia a la figura 4 para la decodificación en el sentido de la invención y con referencia a la figura 3 para la codificación útil para la invención.
La presente invención se dirige también a un dispositivo de decodificación de una señal de audio digital tal como en la reivindicación 14 que incluye una sucesión de muestras repartidas en tramas sucesivas.
Aparecerán otras características y ventajas de la invención con el examen de la descripción detallada que sigue y de los dibujos adjuntos en los que:
- la figura 1 recuerda las principales etapas del procedimiento de corrección de pérdida de trama en el sentido del documento FR 1350845;
- la figura 2 ilustra esquemáticamente las principales etapas de un procedimiento útil para la invención;
- la figura 3 ilustra un ejemplo de etapas implementadas en la codificación, en una forma de realización útil para la invención;
- la figura 4 ilustra un ejemplo de etapas implementadas en la decodificación, en una forma de realización en el sentido de la invención;
- la figura 5 ilustra un ejemplo de etapas implementadas en la decodificación, para la búsqueda de tono en un segmento de señal válida Nc;
- la figura 6 ilustra esquemáticamente un ejemplo de dispositivo codificador útil para la invención y decodificador en el sentido de la invención.
Se hace referencia a la figura 1 en la que se han ilustrado las principales etapas descritas en el documento FR 1350845. En la primera etapa S1, se memoriza en una memoria tampón del decodificador (o "buffer") una sucesión de N muestras de audio, indicada por b(n) en lo que sigue. Estas muestras corresponden a unas muestras ya decodificadas y están por tanto accesibles para la corrección de pérdida de trama en el decodificador. Si la primera muestra a sintetizar es la muestra N, la memoria tampón de audio corresponde a las muestras 0 a N-1 precedentes. En el caso de una codificación por transformada, la memoria tampón de audio corresponde a las muestras de la trama precedente y no son modificables porque este tipo de codificación/decodificación no prevé retardo en la restitución de la señal, de manera que no está previsto realizar un fundido encadenado de duración suficiente para cubrir una pérdida de trama.
A continuación, se procede a una etapa de filtrado en frecuencia S2, en el curso de la que la memoria tampón de audio b(n) se separa en dos bandas, una banda baja BB y una banda alta BA, con una frecuencia de separación indicada por Fc (por ejemplo Fc=4 kHz). Este filtrado es de manera preferente un filtrado sin retardo. El tamaño de la memoria tampón de audio se reduce ahora a N' = N*Fc/fs siguiendo el diezmado de fs en Fc. En variantes de la invención, esta etapa de filtrado puede ser opcional, realizándose las etapas siguientes en banda completa.
La etapa siguiente S3 consiste en buscar en la banda baja un punto de bucle y un segmento p(n) correspondiente al
periodo fundamental (o "tono" en lo que sigue) en el seno de la memoria tampón b(n) remuestreada a la frecuencia Fc. Esta realización permite tener en cuenta la continuidad del tono en la o las trama(s) perdida(s) a reconstruir. La etapa S4 consiste en descomponer el segmento p(n) en una suma de componentes sinusoidales. Por ejemplo, se puede calcular la transformada de Fourier discreta (DFT) de la señal p(n) en una duración correspondiente a la longitud de la señal. Se obtiene así la frecuencia, la fase y la amplitud de cada una de las componentes sinusoidales (o "pics") que componen la señal. Son posibles otras transformadas distintas a la DFT. Por ejemplo, pueden implementarse unas transformadas de tipo DCT, MDCT o MCLT.
La etapa S5 es una etapa de selección de K componentes sinusoidales de manera que mantenga únicamente los componentes mayores. En un modo de realización particular, la selección de los componentes corresponde primariamente a seleccionar las amplitudes A(n) para las que A(n)>A(n-1) y A(n)>A(n+1) siendo n e = [ 0 ; y ] - 1 , lo que asegura que las amplitudes corresponden a unos pics espectrales.
Para hacer esto, las muestras del segmento p(n) se interpolan de manera que se obtenga un segmento p'(n) compuesto de P' muestras siendo °P'°= 2tech°(log2(P)) >°P, en la que techo(x) es el entero superior o igual a x. El análisis por transformada de Fourier FFT se realiza por tanto de manera más eficaz sobre una longitud que sea una potencia de 2, sin modificar el periodo de tono efectivo (debido a la interpolación). Se calcula la transformada FFT de p'(n): n(k) =°FFT(p'(n)); y, a partir de la transformada FFT, se obtienen directamente las fases °9 (k) y amplitudes °A(k) de las componentes sinusoidales, viniendo dadas en este caso las frecuencias normalizadas entre 0 y 1 por:
m - 2- f k e [ 0 ; - j - 1
A continuación, entre las amplitudes de esta primera selección, se seleccionan las componentes por orden decreciente de amplitud, de manera que la amplitud acumulada de los pics seleccionados sea de al menos el x % (por ejemplo x=70 %) de la amplitud acumulada sobre típicamente la mitad del espectro en la trama actual.
Es también posible además, limitar el número de componentes (por ejemplo 20) de manera que se haga la síntesis menos compleja.
La etapa S6 de síntesis sinusoidal consiste en generar un segmento s(n) de longitud al menos igual al tamaño de la trama perdida (T). La señal de síntesis s(n) se calcula como una suma de las componentes sinuosidades seleccionadas:
s(n) = £fc=o A(k)sen(n f (k)n q>{k)) n e [0;2T y ]
en la que k es el índice de los K pics seleccionados de la etapa S5.
La etapa S7 consiste en "inyectar ruido" (llenar las zonas espectrales correspondientes a las rayas no seleccionadas) de manera que se compense la pérdida de energía vinculada a la omisión de ciertos pics de frecuencia en la banda baja. Un modo de realización particular consiste en calcular el residuo r(n) entre el segmento correspondiente al tono p(n) y la señal sintetizada
s(n), siendo n e [0; P°- 1], tal que:
r(n) = p(n)-s(n) n e [0; P-1]
Este residuo de tamaño P se transforma, por ejemplo en ventana y se repite haciendo unos recubrimientos entre unas ventanas de tamaños variables, como se describe en el documento FR 1353551:
r'(fc) = / ( r ( n ) ) n e [0;P —1]y k e 0;2T —
la señal s(n) se combina a continuación en la señal r'(n):
LF
s(n) = s(n) r ’(n) n e [0; 2T + — ]
La etapa S8 aplicada sobre la banda alta puede consistir simplemente en repetir la señal pasada.
En una etapa S9, la señal se sintetiza remuestreando la banda baja a su frecuencia fc de origen, después de haberse mezclado en la etapa S8 a la banda alta filtrada (simplemente repetida en la etapa S11).
La etapa S10 es una adición con recubrimiento que permite asegurar la continuidad entre la señal anterior a la pérdida de trama y la señal sintetizada.
Se describen ahora los elementos añadidos al procedimiento de la figura 1, en una realización útil para la invención. Según un planteamiento general presentado en la figura 2, una información de sonoridad de la señal antes de la pérdida de trama, transmitida a al menos una velocidad del codificador, se utiliza en la decodificación (etapa DI-1) para
determinar cuantitativamente una proporción de ruido a añadir a la señal de síntesis que sustituye una o varias tramas perdidas. De este modo, el decodificador utiliza la información de sonoridad, para disminuir, en función de la sonoridad, la cantidad general de ruido mezclado a la señal de síntesis (asignando una ganancia G(res) más reducida a la señal de ruido r'(k) procedente de un residuo en la etapa DI-3 y/o seleccionando por adelantado componentes de amplitudes A(k) a utilizar para la construcción de la señal de síntesis en la etapa DI-4).
El decodificador puede ajustar además sus parámetros, particularmente la búsqueda de tono, para optimizar el compromiso calidad/complejidad del tratamiento, en función de la información de sonoridad. Por ejemplo, para la búsqueda de tono, si la señal es sonora, la ventana de búsqueda de tono Nc puede ser mayor (en la etapa DI-5), como se verá más adelante con referencia a la figura 5.
Para la determinación de la sonoridad, puede suministrarse por el codificador una información, de dos maneras, a al menos una velocidad del codificador:
- en la forma de un bit de valor 1 o 0 según un grado de sonoridad identificado en el codificador (recibido del codificador en la etapa DI-1 y leído en la etapa DI-2 en caso de pérdida de trama para el tratamiento posterior), o
- en la forma de un valor de amplitud media de los pics que componen la señal en la codificación, comparada con un ruido de fondo.
Este dato de "planitud" Pl del espectro puede recibirse sobre varios bits en el decodificador en la etapa opcional DI-10 de la figura 2, y posteriormente compararse con un umbral en la etapa DI-11, lo que se convierte en determinar en las etapas DI-1 y DI-2 si la sonoridad es superior o inferior a un umbral y deducir los tratamientos adecuados, particularmente para la selección de pics y para la elección de duración del segmento de búsqueda de tono.
Esta información (tanto si está bajo la forma de un bit único o de un valor sobre varios bits) se recibe del codificador (al menos a una velocidad de la codificación), en el ejemplo descrito en el presente documento.
En efecto, con referencia a la figura 3, en el codificador, la señal de entrada presentada en la forma de tramas C1 se analiza en la etapa C2. La etapa de análisis consiste en determinar si la señal de audio de la trama actual presenta características que necesitarían un tratamiento particular en caso de pérdida de tramas en el decodificador, como es el caso por ejemplo de las señales de voz sonoras.
En un modo de realización particular, se utiliza ventajosamente una clasificación (voz/música u otras) ya efectuada en el codificador de manera que no se aumente la complejidad global del tratamiento. En efecto, en el caso de codificadores de conmutación de modos de codificación entre la voz o la música, una clasificación en el codificador permite ya adaptar la técnica empleada para la codificación en función de la naturaleza de la señal (voz o música). Asimismo, en el caso de la voz, unos codificadores de tipo predictivo como por ejemplo el codificador según la norma G.718 utiliza también una clasificación de manera que se adapten los parámetros del codificador a la naturaleza de la señal (sonidos sonoros / no sonoros, transitorios, genéricos, inactivos).
En un primer modo particular de realización, no se reserva más que un único bit de "caracterización para la pérdida de trama". Se añade al flujo codificado (o "bitstream") en la etapa C3 para indicar si la señal es una señal de voz (sonora o genérica). Este bit se pone por ejemplo a 1 o a 0 según el caso de la tabla a continuación:
• de la decisión del clasificador voz/música,
• y además de la decisión del clasificador sobre el modo de codificación de la voz.
Se entiende en este caso por "genérica" una señal de la voz habitual (que no es un transitorio vinculado a la pronunciación de una plosiva, que no es inactivo y que no es necesariamente puramente sonora como la pronunciación de una vocal sin consonante).
En un segundo modo de realización, alternativo, La información transmitida al decodificador en el flujo codificado no es binaria sino que corresponde a una cuantificación de la relación entre los niveles de pics y los niveles de valles en el espectro. Esta relación puede expresarse por una medida de "plenitud" del espectro, indicada por Pl:
En esta expresión, x(k) es el espectro de amplitud de tamaño N resultante del análisis de la trama actual en el dominio de la frecuencia (después de la FFT).
En una alternativa, está disponible un análisis sinusoidal que descompone la señal en el codificador en componentes sinusoidales y ruido y la medida de la planitud se obtiene por relación entre los componentes sinusoidales y la energía global en la trama.
A continuación en la etapa C3 (que incluye la información de sonoridad en un único bit o por la medida de planitud sobre varios bits), la memoria tampón de audio del codificador se codifica clásicamente en una etapa C4 antes de la transmisión posterior eventual al decodificador.
Se hace referencia ahora a la figura 4 para describir las etapas implementadas en el decodificador, en un ejemplo de realización de la invención.
En el caso en el que no hay pérdidas de trama en la etapa D1 (flecha KO en la salida de la prueba D1 de la figura 4), el decodificador lee las informaciones contenidas en el flujo codificado, comprendidas las informaciones de "caracterización para la pérdida de trama" en la etapa D2 (al menos a una velocidad de la codificación). Estas últimas se almacenan en la memoria de manera que se reutilicen en el caso de que faltara una trama siguiente. El decodificador continúa entonces las etapas clásicas de la decodificación D3, etc. de manera que obtenga la trama de salida sintetizada FR SYNTH.
En el caso en el que interviene una pérdida de trama(s) (flecha OK en la salida de la prueba D1), se aplican las etapas D4, D5, D6, D7, D8 y D12, correspondientes respectivamente a las etapas S2, S3, S4, S5, S6 y S11 de la figura 1. No obstante, se realizan algunas modificaciones con relación a las etapas S3 y S5, respectivamente a las etapas D5 (búsqueda de un punto de bucle para la determinación del tono) y D7 (elección de las componentes sinusoidales). Por otra parte, la inyección de ruido en la etapa S7 de la figura 1 se realiza con una determinación de ganancia según dos etapas D9 y D10 en la figura 4 del decodificador en el sentido de la invención.
En efecto, en el caso en el que la información de "caracterización para la pérdida de trama" es conocida (cuando se ha recibido la trama precedente), la invención consiste en modificar el tratamiento de las etapas D5, D7 y D9-D10, como sigue.
En un primer ejemplo de realización, la información de "caracterización para la pérdida de trama" es binaria y de valor:
- igual a 0 en el caso de la señal no sonora, de tipo música, de tipo transitoria,
- igual a 1 si no (tabla anterior).
La etapa D5 consiste en buscar un punto de bucle y un segmento p(n) correspondiente al tono en el seno de la memoria tampón de audio remuestreada a la frecuencia Fc. Esta técnica, descrita en el documento FR 1350845, se ilustra en la figura 5, en la que:
- la memoria tampón de audio en el decodificador es de tamaño de muestras N',
- se determina el tamaño de la memoria tampón objetivo BC de Ns muestras,
- la búsqueda de correlación se efectúa sobre Nc muestras,
- la curva de correlación "Correl" presenta un máximo en mc,
- el punto de bucle se designa Pt Bucl y se sitúa a Ns muestras del máximo de correlación,
- el tono se determina entonces sobre las p(n) muestras restantes a N'-1.
Se calcula en particular una correlación normalizada corr(n) entre el segmento de memoria tampón objetivo de tamaño Ns comprendido entre N'-Ns y N'-1 (de una duración por ejemplo de 6 ms) y el segmento deslizante de tamaño Ns que comienza entre la muestra 0 y Nc (siendo Nc>N'-Ns):
n k)b(N' — Ns + fe)
:n £ [0;Wc]
Para señales de música, debido a la naturaleza de la señal, el valor Nc no tienen necesidad de ser demasiado grande (por ejemplo Nc=28 ms). Esta limitación permite economizar la complejidad del cálculo durante la búsqueda de tono.
Por el contrario, la información de sonoridad de la última trama válidamente recibida anteriormente permite determinar si la señal que se busca reconstruir es una señal de voz sonora (mono tono). Es posible por tanto, en este caso y gracias a esta información, aumentar el tamaño del segmento Nc (por ejemplo Nc=33 ms) de manera que se optimice la búsqueda de tono (y potencialmente encontrar un valor de correlación más elevado).
Por otra parte, en la etapa D7 de la figura 4, se seleccionan unas componentes sinusoidales de manera que se mantengan únicamente las componentes mayores. En un modo de realización particular presentado también en el documento FR 1350845, la primera selección de componentes se convierte en seleccionar las amplitudes A(n) para las que A(n)>A(n-1) y A(n)>A(n+1) siendo
P'
n £ [ ^ y - 1]
En el caso de la invención, se sabe ventajosamente si la señal que se busca reconstruir es una señal de voz (sonora o genérica) por tanto con unos pics marcados y un reducido nivel de ruido. En estas condiciones, es preferible seleccionar no solamente los pics A(n) para los que A(n)>A(n-1) y A(n)>A(n+1) como se ha presentado anteriormente, sino también ampliar la selección A(n-1) y A(n+1) de manera que los pics seleccionados representen una gran parte de la energía total del espectro. Esta modificación permite particularmente reducir el nivel de ruido (y particularmente el nivel de ruido inyectado en las etapas D9 y D10 presentadas a continuación) con relación al nivel de la señal sintetizada por síntesis sinusoidal en la etapa D8, mientras se conserva un nivel global de energía suficiente para no provocar artificiosidades audibles vinculadas a fluctuaciones de energía.
A continuación, en el caso en que la señal está exenta de ruido (al menos en las bajas frecuencias), tal como es el caso en una señal de voz sonora o genérica, se observa que la adición de ruido correspondiente al residuo transformado r'(n) en el sentido del documento FR 1350845, degrada de hecho la calidad.
De este modo, se utiliza en este caso ventajosamente la información de sonoridad para atenuar el ruido aplicándole una ganancia G en la etapa D10. La señal s(n) procedente de la etapa D8 se mezcla a la señal de ruido r'(n) procedente de la etapa D9 aplicando sin embargo en este caso una ganancia G que depende de la información de "caracterización para la pérdida de trama" procedente del flujo codificado de la trama precedente, es decir:
LF
s(n) = s (n ) G x r '(r i) n £ 0;2T + —
En este modo de realización particular, G puede ser una constante igual a 1 o 0,25 en función de la naturaleza sonora o no sonora de la señal de la trama precedente, según la tabla dada a continuación a título de ejemplo:
En el modo de realización alternativo en el que la información de "caracterización para la pérdida de trama" posee varios niveles discretos que caracterizan la planitud Pl del espectro. La ganancia G puede expresarse directamente en función del valor Pl. Es lo mismo para el límite del segmento Nc para la búsqueda de tono y/o el número de pics An a tener en cuenta para la síntesis de la señal.
Se puede definir a título de ejemplo un tratamiento como sigue.
Se define ya la ganancia G directamente en función del valor Pl: G(Pl) - 2Pl
Además, se compara el valor Pl con un valor medio 3 dB, entendiéndose que el valor 0 corresponde a un espectro plano y -5 dB corresponde a un espectro de pics pronunciados.
Si el valor Pl es inferior al valor medio de umbral -3 dB (correspondiente por tanto a un espectro de pics pronunciados, típicamente de una señal sonora), entonces se puede fijar la duración del segmento de búsqueda de tono Nc a 33 ms y seleccionar los pics A(n) tales que A(n)>A(n-1) y A(n)>A(n+1), así como los pics primeros vecinos A(n-1) y A(n+1).
Si no (si el valor Pl es superior al umbral, lo que corresponde a unos pics menos marcados, más el ruido de fondo como por ejemplo una señal de música), la duración Nc puede elegirse más corta, por ejemplo de 25 ms y solo se
seleccionan los pics A(n) tales que A(n)>A(n-1) y A(n)>A(n+1).
La decodificación puede proseguirse a continuación mediante la mezcla de ruido cuya ganancia se obtiene así con los componentes de ese modo seleccionados para obtener la señal de síntesis en las bajas frecuencias en la etapa D13, que se añade a la señal de síntesis en las altas frecuencias obtenida en la etapa D14, para obtener en la etapa D15 la señal global sintetizada.
Con referencia a la figura 6, se ha ilustrado una implementación posible en la que, un decodificador DECOD (que incluye por ejemplo software y hardware tal como una memoria MEM razonablemente programada y un procesador PROC que coopera con esta memoria o como variante un componente tal como un ASIC u otro, así como una interfaz de comunicación COM) implantado por ejemplo en un dispositivo de telecomunicación tal como un teléfono TEL, utiliza, para la implementación del procedimiento de la figura 4, una información de sonoridad que recibe de un codificador COD. Este codificador incluye por ejemplo un software y hardware tal como una memoria MEM razonablemente programada para determinar la información de sonoridad y un procesador PROC' que coopera con esta memoria o, como variante, un componente tal como un ASIC u otro, así como una interfaz de comunicación COM'. El codificador COD se implanta en un dispositivo de telecomunicación tal como un teléfono TEL'.
Por supuesto, la presente invención no se limita a las formas de realización descritas anteriormente a título de ejemplo; se extiende a otras variantes.
De este modo, por ejemplo, se comprenderá que la información sobre la sonoridad puede tomar diferentes formas susceptibles de variantes. En el ejemplo anteriormente descrito, se puede tratar de un valor binario sobre un único bit (sonoridad o no) o también un valor sobre varios bits que puede ser relativo a un parámetro tal como la planitud del espectro de la señal o cualquier otro parámetro que permita caracterizar (cuantitativamente o cualitativamente) una sonoridad. Aún más, este parámetro puede determinarse en la decodificación, por ejemplo en función del grado de correlación que puede medirse durante la identificación del periodo de tono.
Por otra parte, se ha presentado anteriormente a título de ejemplo una realización que incluye una separación en una banda de frecuencias altas y una banda de frecuencias bajas, de la señal procedente de tramas válidas precedentes, en particular una selección de los componentes espectrales en la banda de frecuencias bajas. No obstante, esta realización es opcional aunque ventajosa en el sentido de que permite reducir la complejidad del tratamiento. El procedimiento de sustitución de trama asistido por la información de sonoridad en el sentido de la invención puede sin embargo realizarse considerando todo el espectro de la señal válida, como variante.
Por otra parte, se ha descrito anteriormente un ejemplo de realización en el que la invención se implementaba en el marco de una codificación por transformada con adición y recubrimiento. No obstante, ese tipo de procedimiento puede adaptarse a cualquier otro tipo de codificación (particularmente CELP).
Se ha de observar que en el marco de una codificación por transformada con adición y recubrimiento (en el que típicamente la señal de síntesis se construye sobre al menos dos duraciones de tramas debido al recubrimiento), la señal de ruido antes citada puede obtenerse por el residuo (entre la señal válida y la suma de los pics) ponderando este residuo temporalmente. Puede ponderarse por ejemplo mediante unas ventanas de recubrimiento, como en el marco habitual de una codificación/decodificación por transformada con recubrimiento.
Se entenderá entonces que la aplicación de la ganancia en función de la información de sonoridad tiende a añadirse además a otra ponderación, esta vez en función de la sonoridad.
Claims (14)
1. Procedimiento de tratamiento de una señal de audio digital que incluye una sucesión de muestras repartidas en tramas sucesivas, implementándose el procedimiento durante una decodificación de dicha señal para sustituir al menos una trama de señal perdida en la decodificación,
incluyendo el procedimiento las etapas:
a) búsqueda, en un segmento de señal válida disponible en la decodificación (Nc), de al menos un periodo de la señal, determinado en función de dicha señal válida,
b) análisis de la señal en dicho periodo, para una determinación de componentes espectrales de la señal en dicho periodo,
c) síntesis de al menos una trama de sustitución de la trama perdida, por construcción de una señal de síntesis a partir:
- de una adición de componentes seleccionados entre dichos componentes espectrales determinados y - de un ruido añadido a la adición de componentes,
en el que la cantidad de ruido añadida a la adición de componentes se pondera en función de una información de sonoridad de la señal válida, determinándose dicha información de sonoridad por un codificador y suministrándose posteriormente en un flujo codificado, correspondiente a dicha señal, entregado por dicho codificador y recibido en la decodificación, de manera que, en caso de pérdida de trama en la decodificación, se utilice la información de sonoridad contenida en una trama de señal válida precedente a la trama perdida.
2. Procedimiento según la reivindicación 1, caracterizado por que una señal de ruido añadida a la adición de componentes se pondera mediante una ganancia más pequeña en caso de sonoridad de la señal válida.
3. Procedimiento según la reivindicación 2, caracterizado por que la señal de ruido se obtiene por un residuo entre la señal válida y la adición de los componentes seleccionados.
4. Procedimiento según una de las reivindicaciones anteriores, caracterizado por que el número de componentes seleccionados para la adición es mayor en caso de sonoridad de la señal válida.
5. Procedimiento según una de las reivindicaciones anteriores, caracterizado por que, en la etapa a), el periodo se busca en un segmento de señal válida (Nc) de duración mayor en caso de sonoridad de la señal válida.
6. Procedimiento según una de las reivindicaciones anteriores, caracterizado por que la información de sonoridad se codifica sobre un único bit en el flujo codificado.
7. Procedimiento según la reivindicación 6, tomada en combinación con la reivindicación 2, caracterizado por que, si la señal es sonora, el valor de la ganancia es de 0,25 y es de 1 si no.
8. Procedimiento según una de las reivindicaciones anteriores, caracterizado por que la información de sonoridad procede de un codificador que determina un valor de planitud del espectro (Pl), obtenido por comparación con un ruido de fondo de las amplitudes de los componentes espectrales de la señal, entregando el codificador dicho valor en la forma binaria en el flujo codificado.
9. Procedimiento según una de las reivindicaciones anteriores, tomada en combinación con la reivindicación 2, caracterizado por que el valor de la ganancia es función de dicho valor de planitud.
10. Procedimiento según una de las reivindicaciones 8 y 9, caracterizado por que dicho valor de planitud se compara con un umbral para determinar:
- que la señal es sonora si el valor de planitud es inferior al umbral y
- que la señal no es sonora si no.
11. Procedimiento según una de las reivindicaciones 6 y 10, tomadas en combinación con la reivindicación 4, caracterizado por que:
- si la señal es sonora, se seleccionan las componentes espectrales cuyas amplitudes son superiores a las de las primeras componentes espectrales vecinas, así como las primeras componentes espectrales vecinas y
- no se seleccionan más que los componentes espectrales cuyas amplitudes son superiores a las de las primeras componentes espectrales vecinas, si no.
12. Procedimiento según una de las reivindicaciones 6 y 10, tomada en combinación con la reivindicación 5, caracterizado por que:
- si la señal es sonora, el periodo se busca en un segmento de señal válida de duración superior a 30 milisegundos, - y, si no, el periodo se busca en un segmento de señal válida de duración inferior a 30 milisegundos.
13. Programa informático caracterizado por que incluye unas instrucciones para la implementación del procedimiento según una de las reivindicaciones 1 a 12, cuando este programa es ejecutado por un procesador.
14. Dispositivo de decodificación de una señal de audio digital que incluye una sucesión de muestras repartidas en tramas sucesivas, incluyendo el dispositivo unos medios (MEM, PROC) para sustituir al menos una trama de señal perdida, por:
a) búsqueda, en un segmento de señal válida disponible en la decodificación (Nc), de al menos un periodo de la señal, determinado en función de dicha señal válida,
b) análisis de la señal en dicho periodo, para una determinación de componentes espectrales de la señal en dicho periodo,
c) síntesis de al menos una trama de sustitución de la trama perdida, por construcción de una señal de síntesis a partir:
- de una adición de componentes seleccionados entre dichos componentes espectrales determinados y - de un ruido añadido a la adición de componentes,
ponderándose la cantidad de ruido añadida a la adición de componentes en función de una información de sonoridad de la señal válida, determinándose dicha información de sonoridad por un codificador y suministrándose posteriormente en un flujo codificado, correspondiente a dicha señal, entregada por dicho codificador y recibida en la decodificación de manera que, en caso de pérdida de trama en la decodificación, se utilice la información de sonoridad contenida en una trama de señal válida precedente a la trama perdida.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR1453912A FR3020732A1 (fr) | 2014-04-30 | 2014-04-30 | Correction de perte de trame perfectionnee avec information de voisement |
| PCT/FR2015/051127 WO2015166175A1 (fr) | 2014-04-30 | 2015-04-24 | Correction de perte de trame perfectionnée avec information de voisement |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2743197T3 true ES2743197T3 (es) | 2020-02-18 |
Family
ID=50976942
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES15725801T Active ES2743197T3 (es) | 2014-04-30 | 2015-04-24 | Corrección de pérdida de trama perfeccionada con información de sonoridad |
Country Status (12)
| Country | Link |
|---|---|
| US (1) | US10431226B2 (es) |
| EP (1) | EP3138095B1 (es) |
| JP (1) | JP6584431B2 (es) |
| KR (3) | KR20170003596A (es) |
| CN (1) | CN106463140B (es) |
| BR (1) | BR112016024358B1 (es) |
| ES (1) | ES2743197T3 (es) |
| FR (1) | FR3020732A1 (es) |
| MX (1) | MX368973B (es) |
| RU (1) | RU2682851C2 (es) |
| WO (1) | WO2015166175A1 (es) |
| ZA (1) | ZA201606984B (es) |
Families Citing this family (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR3020732A1 (fr) * | 2014-04-30 | 2015-11-06 | Orange | Correction de perte de trame perfectionnee avec information de voisement |
| EP3389043A4 (en) * | 2015-12-07 | 2019-05-15 | Yamaha Corporation | VOICE INTERACTION DEVICE AND VOICE INTERACTION METHOD |
| US12154582B2 (en) * | 2019-07-08 | 2024-11-26 | Voiceage Corporation | Method and system for coding metadata in audio streams and for efficient bitrate allocation to audio streams coding |
| CN111883171B (zh) * | 2020-04-08 | 2023-09-22 | 珠海市杰理科技股份有限公司 | 音频信号的处理方法及系统、音频处理芯片、蓝牙设备 |
Family Cites Families (43)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR1350845A (fr) | 1962-12-20 | 1964-01-31 | Procédé de classement visible sans index | |
| FR1353551A (fr) | 1963-01-14 | 1964-02-28 | Fenêtre destinée en particulier à être montée sur des roulottes, des caravanes ou installations analogues | |
| US5504833A (en) * | 1991-08-22 | 1996-04-02 | George; E. Bryan | Speech approximation using successive sinusoidal overlap-add models and pitch-scale modifications |
| US5956674A (en) * | 1995-12-01 | 1999-09-21 | Digital Theater Systems, Inc. | Multi-channel predictive subband audio coder using psychoacoustic adaptive bit allocation in frequency, time and over the multiple channels |
| US5799271A (en) * | 1996-06-24 | 1998-08-25 | Electronics And Telecommunications Research Institute | Method for reducing pitch search time for vocoder |
| JP3364827B2 (ja) * | 1996-10-18 | 2003-01-08 | 三菱電機株式会社 | 音声符号化方法、音声復号化方法及び音声符号化復号化方法並びにそれ等の装置 |
| US6233550B1 (en) * | 1997-08-29 | 2001-05-15 | The Regents Of The University Of California | Method and apparatus for hybrid coding of speech at 4kbps |
| ATE302991T1 (de) * | 1998-01-22 | 2005-09-15 | Deutsche Telekom Ag | Verfahren zur signalgesteuerten schaltung zwischen verschiedenen audiokodierungssystemen |
| US6640209B1 (en) * | 1999-02-26 | 2003-10-28 | Qualcomm Incorporated | Closed-loop multimode mixed-domain linear prediction (MDLP) speech coder |
| US6138089A (en) * | 1999-03-10 | 2000-10-24 | Infolio, Inc. | Apparatus system and method for speech compression and decompression |
| US6691092B1 (en) * | 1999-04-05 | 2004-02-10 | Hughes Electronics Corporation | Voicing measure as an estimate of signal periodicity for a frequency domain interpolative speech codec system |
| US6912496B1 (en) * | 1999-10-26 | 2005-06-28 | Silicon Automation Systems | Preprocessing modules for quality enhancement of MBE coders and decoders for signals having transmission path characteristics |
| US7016833B2 (en) * | 2000-11-21 | 2006-03-21 | The Regents Of The University Of California | Speaker verification system using acoustic data and non-acoustic data |
| US20030028386A1 (en) * | 2001-04-02 | 2003-02-06 | Zinser Richard L. | Compressed domain universal transcoder |
| JP4089347B2 (ja) * | 2002-08-21 | 2008-05-28 | 沖電気工業株式会社 | 音声復号装置 |
| US7970606B2 (en) * | 2002-11-13 | 2011-06-28 | Digital Voice Systems, Inc. | Interoperable vocoder |
| DE10254612A1 (de) * | 2002-11-22 | 2004-06-17 | Humboldt-Universität Zu Berlin | Verfahren zur Ermittlung spezifisch relevanter akustischer Merkmale von Schallsignalen für die Analyse unbekannter Schallsignale einer Schallerzeugung |
| KR20050086761A (ko) * | 2002-11-27 | 2005-08-30 | 코닌클리케 필립스 일렉트로닉스 엔.브이. | 사운드 프레임을 정현파 성분 및 잔류 노이즈로 분리하기위한 방법 |
| JP3963850B2 (ja) * | 2003-03-11 | 2007-08-22 | 富士通株式会社 | 音声区間検出装置 |
| US7318035B2 (en) * | 2003-05-08 | 2008-01-08 | Dolby Laboratories Licensing Corporation | Audio coding systems and methods using spectral component coupling and spectral component regeneration |
| US7825321B2 (en) * | 2005-01-27 | 2010-11-02 | Synchro Arts Limited | Methods and apparatus for use in sound modification comparing time alignment data from sampled audio signals |
| US7930176B2 (en) * | 2005-05-20 | 2011-04-19 | Broadcom Corporation | Packet loss concealment for block-independent speech codecs |
| KR100744352B1 (ko) * | 2005-08-01 | 2007-07-30 | 삼성전자주식회사 | 음성 신호의 하모닉 성분을 이용한 유/무성음 분리 정보를추출하는 방법 및 그 장치 |
| US7720677B2 (en) * | 2005-11-03 | 2010-05-18 | Coding Technologies Ab | Time warped modified transform coding of audio signals |
| US8255207B2 (en) * | 2005-12-28 | 2012-08-28 | Voiceage Corporation | Method and device for efficient frame erasure concealment in speech codecs |
| US8135047B2 (en) * | 2006-07-31 | 2012-03-13 | Qualcomm Incorporated | Systems and methods for including an identifier with a packet associated with a speech signal |
| US20090210239A1 (en) * | 2006-11-24 | 2009-08-20 | Lg Electronics Inc. | Method for Encoding and Decoding Object-Based Audio Signal and Apparatus Thereof |
| KR100964402B1 (ko) * | 2006-12-14 | 2010-06-17 | 삼성전자주식회사 | 오디오 신호의 부호화 모드 결정 방법 및 장치와 이를 이용한 오디오 신호의 부호화/복호화 방법 및 장치 |
| US8060363B2 (en) * | 2007-02-13 | 2011-11-15 | Nokia Corporation | Audio signal encoding |
| ES2533358T3 (es) * | 2007-06-22 | 2015-04-09 | Voiceage Corporation | Procedimiento y dispositivo para estimar la tonalidad de una señal de sonido |
| CN100524462C (zh) * | 2007-09-15 | 2009-08-05 | 华为技术有限公司 | 对高带信号进行帧错误隐藏的方法及装置 |
| US20090180531A1 (en) * | 2008-01-07 | 2009-07-16 | Radlive Ltd. | codec with plc capabilities |
| US8036891B2 (en) * | 2008-06-26 | 2011-10-11 | California State University, Fresno | Methods of identification using voice sound analysis |
| PL2352147T3 (pl) * | 2008-07-11 | 2014-02-28 | Fraunhofer Ges Forschung | Urządzenie i sposób kodowania sygnału audio |
| KR101261677B1 (ko) * | 2008-07-14 | 2013-05-06 | 광운대학교 산학협력단 | 음성/음악 통합 신호의 부호화/복호화 장치 |
| US8718804B2 (en) * | 2009-05-05 | 2014-05-06 | Huawei Technologies Co., Ltd. | System and method for correcting for lost data in a digital audio signal |
| FR2966634A1 (fr) * | 2010-10-22 | 2012-04-27 | France Telecom | Codage/decodage parametrique stereo ameliore pour les canaux en opposition de phase |
| WO2014036263A1 (en) * | 2012-08-29 | 2014-03-06 | Brown University | An accurate analysis tool and method for the quantitative acoustic assessment of infant cry |
| US8744854B1 (en) * | 2012-09-24 | 2014-06-03 | Chengjun Julian Chen | System and method for voice transformation |
| FR3001593A1 (fr) | 2013-01-31 | 2014-08-01 | France Telecom | Correction perfectionnee de perte de trame au decodage d'un signal. |
| US9564141B2 (en) * | 2014-02-13 | 2017-02-07 | Qualcomm Incorporated | Harmonic bandwidth extension of audio signals |
| FR3020732A1 (fr) * | 2014-04-30 | 2015-11-06 | Orange | Correction de perte de trame perfectionnee avec information de voisement |
| US9697843B2 (en) * | 2014-04-30 | 2017-07-04 | Qualcomm Incorporated | High band excitation signal generation |
-
2014
- 2014-04-30 FR FR1453912A patent/FR3020732A1/fr active Pending
-
2015
- 2015-04-24 ES ES15725801T patent/ES2743197T3/es active Active
- 2015-04-24 US US15/303,405 patent/US10431226B2/en active Active
- 2015-04-24 KR KR1020167033307A patent/KR20170003596A/ko not_active Ceased
- 2015-04-24 KR KR1020237028912A patent/KR102808307B1/ko active Active
- 2015-04-24 EP EP15725801.3A patent/EP3138095B1/fr active Active
- 2015-04-24 BR BR112016024358-7A patent/BR112016024358B1/pt active IP Right Grant
- 2015-04-24 WO PCT/FR2015/051127 patent/WO2015166175A1/fr not_active Ceased
- 2015-04-24 RU RU2016146916A patent/RU2682851C2/ru active
- 2015-04-24 CN CN201580023682.0A patent/CN106463140B/zh active Active
- 2015-04-24 KR KR1020227011341A patent/KR102808306B1/ko active Active
- 2015-04-24 JP JP2016565232A patent/JP6584431B2/ja active Active
- 2015-04-24 MX MX2016014237A patent/MX368973B/es active IP Right Grant
-
2016
- 2016-10-11 ZA ZA2016/06984A patent/ZA201606984B/en unknown
Also Published As
| Publication number | Publication date |
|---|---|
| WO2015166175A1 (fr) | 2015-11-05 |
| MX2016014237A (es) | 2017-06-06 |
| ZA201606984B (en) | 2018-08-30 |
| EP3138095A1 (fr) | 2017-03-08 |
| KR102808306B1 (ko) | 2025-05-15 |
| RU2016146916A3 (es) | 2018-10-26 |
| KR20220045260A (ko) | 2022-04-12 |
| BR112016024358B1 (pt) | 2022-09-27 |
| CN106463140B (zh) | 2019-07-26 |
| CN106463140A (zh) | 2017-02-22 |
| JP6584431B2 (ja) | 2019-10-02 |
| JP2017515155A (ja) | 2017-06-08 |
| US10431226B2 (en) | 2019-10-01 |
| KR20170003596A (ko) | 2017-01-09 |
| RU2016146916A (ru) | 2018-05-31 |
| KR20230129581A (ko) | 2023-09-08 |
| EP3138095B1 (fr) | 2019-06-05 |
| MX368973B (es) | 2019-10-23 |
| RU2682851C2 (ru) | 2019-03-21 |
| BR112016024358A2 (pt) | 2017-08-15 |
| US20170040021A1 (en) | 2017-02-09 |
| FR3020732A1 (fr) | 2015-11-06 |
| KR102808307B1 (ko) | 2025-05-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2661732T3 (es) | Decodificador de audio y método para proporcionar una información de audio decodificada usando una ocultación de error que modifica una señal de excitación de dominio de tiempo | |
| ES2746034T3 (es) | Decodificador de audio y método para proporcionar una información de audio decodificada usando un ocultamiento de error sobre la base de una señal de excitación de dominio de tiempo | |
| ES2960089T3 (es) | Procedimiento y aparato para la ocultación de errores de trama y procedimiento y aparato para la decodificación de audio | |
| ES2349554T3 (es) | Codificación de señales. | |
| CN101627423B (zh) | 有音调周期的校正的数字音频信号丢失块的合成 | |
| ES2968886T3 (es) | Decodificador de extensión de audio de ancho de banda, procedimiento correspondiente y programa de ordenador | |
| ES2547457T3 (es) | Generación de ruido de confort | |
| ES2685574T3 (es) | Control dependiente de la armonicidad de una herramienta de filtro de armónicos | |
| US20170125022A1 (en) | Position-Dependent Hybrid Domain Packet Loss Concealment | |
| US9761230B2 (en) | Frame loss correction by weighted noise injection | |
| ES2724576T3 (es) | Extensión mejorada de la banda de frecuencia en un decodificador de señales de audiofrecuencia | |
| KR102510685B1 (ko) | 오디오 신호 디코더에서의 개선된 주파수 대역 확장 | |
| KR20170117621A (ko) | 대역폭 확장 방법 및 장치 | |
| ES2994065T3 (en) | Pitch lag estimation | |
| ES2870959T3 (es) | Unidad de ocultación de error, decodificador de audio y método relacionado y programa informático que usa características de una representación decodificada de una trama de audio decodificada apropiadamente | |
| ES2968821T3 (es) | Codificación y decodificación de señales de audio | |
| ES2378972T3 (es) | Atenuación de la sobresonorización, en particular para la generación de una excitación en un decodificador, en ausencia de información | |
| BR112015017632B1 (pt) | Aparelho e método para gerar um sinal melhorado da frequência utilizando nivelamento temporal de sub-bandas | |
| US20180182408A1 (en) | Determining a budget for lpd/fd transition frame encoding | |
| RU2682851C2 (ru) | Усовершенствованная коррекция потери кадров с помощью речевой информации | |
| US20090234653A1 (en) | Audio decoding device and audio decoding method | |
| HK1224795A1 (en) | Harmonic bandwidth extension of audio signals |



