ES2547457T3 - Generación de ruido de confort - Google Patents
Generación de ruido de confort Download PDFInfo
- Publication number
- ES2547457T3 ES2547457T3 ES13720430.1T ES13720430T ES2547457T3 ES 2547457 T3 ES2547457 T3 ES 2547457T3 ES 13720430 T ES13720430 T ES 13720430T ES 2547457 T3 ES2547457 T3 ES 2547457T3
- Authority
- ES
- Spain
- Prior art keywords
- parameters
- frames
- subset
- sid
- active
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 238000012423 maintenance Methods 0.000 claims abstract description 55
- 239000000872 buffer Substances 0.000 claims abstract description 51
- 238000000034 method Methods 0.000 claims abstract description 18
- 238000003780 insertion Methods 0.000 claims abstract description 5
- 230000037431 insertion Effects 0.000 claims abstract description 5
- 239000013598 vector Substances 0.000 claims description 23
- 238000004590 computer program Methods 0.000 claims description 12
- 230000003595 spectral effect Effects 0.000 claims description 8
- 230000007704 transition Effects 0.000 claims description 7
- 238000005516 engineering process Methods 0.000 description 34
- 238000010586 diagram Methods 0.000 description 14
- 230000015654 memory Effects 0.000 description 14
- 230000000694 effects Effects 0.000 description 9
- 238000009499 grossing Methods 0.000 description 7
- 230000005284 excitation Effects 0.000 description 6
- 230000008859 change Effects 0.000 description 5
- 230000005540 biological transmission Effects 0.000 description 3
- 230000015572 biosynthetic process Effects 0.000 description 3
- 230000015556 catabolic process Effects 0.000 description 3
- 238000006731 degradation reaction Methods 0.000 description 3
- 238000012545 processing Methods 0.000 description 3
- 238000003786 synthesis reaction Methods 0.000 description 3
- 206010019133 Hangover Diseases 0.000 description 2
- 230000003044 adaptive effect Effects 0.000 description 2
- 230000009286 beneficial effect Effects 0.000 description 2
- 230000008901 benefit Effects 0.000 description 2
- 238000004891 communication Methods 0.000 description 2
- 238000001914 filtration Methods 0.000 description 2
- 230000006870 function Effects 0.000 description 2
- 230000007774 longterm Effects 0.000 description 2
- 238000005259 measurement Methods 0.000 description 2
- 230000009467 reduction Effects 0.000 description 2
- 238000012935 Averaging Methods 0.000 description 1
- 101710148054 Ketol-acid reductoisomerase (NAD(+)) Proteins 0.000 description 1
- 101710099070 Ketol-acid reductoisomerase (NAD(P)(+)) Proteins 0.000 description 1
- 101710151482 Ketol-acid reductoisomerase (NADP(+)) Proteins 0.000 description 1
- 230000001133 acceleration Effects 0.000 description 1
- 238000004458 analytical method Methods 0.000 description 1
- 238000003491 array Methods 0.000 description 1
- 230000006399 behavior Effects 0.000 description 1
- 230000000295 complement effect Effects 0.000 description 1
- 230000001143 conditioned effect Effects 0.000 description 1
- 238000005520 cutting process Methods 0.000 description 1
- 230000001419 dependent effect Effects 0.000 description 1
- 230000001771 impaired effect Effects 0.000 description 1
- 238000012986 modification Methods 0.000 description 1
- 230000004048 modification Effects 0.000 description 1
- 230000008447 perception Effects 0.000 description 1
- 238000013139 quantization Methods 0.000 description 1
- 238000009877 rendering Methods 0.000 description 1
- 230000008672 reprogramming Effects 0.000 description 1
- 238000001228 spectrum Methods 0.000 description 1
- 230000003068 static effect Effects 0.000 description 1
- 238000006467 substitution reaction Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/012—Comfort noise or silence coding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/06—Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
- G10L19/07—Line spectrum pair [LSP] vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Signal Processing (AREA)
- Acoustics & Sound (AREA)
- Computational Linguistics (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Noise Elimination (AREA)
- Soundproofing, Sound Blocking, And Sound Damping (AREA)
- Data Exchanges In Wide-Area Networks (AREA)
- Mobile Radio Communication Systems (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
- User Interface Of Digital Computer (AREA)
- Cable Transmission Systems, Equalization Of Radio And Reduction Of Echo (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
Método de generación de parámetros de control de Ruido de Confort, CN, que comprende almacenar (S1; 1a) parámetros de CN (**Fórmula** ) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M); determinar (S2, 1b, 2) un subconjunto de parámetros de CN (QS, ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales; usar (S3, 3, 4) el subconjunto de parámetros de CN determinado (QS, ES) para determinar los parámetros de control de CN (**Fórmula** ) para una primera trama de SID ("Primera SID") que sucede a una trama de señal activa, actualizando (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos (**Fórmula** ); caracterizado por: actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas; seleccionar (2) el subconjunto de parámetros de CN (QS, ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales; determinar (3) parámetros de CN representativos (**Fórmula** ) a partir del subconjunto de parámetros de CN (QS, ES); e interpolar los parámetros de CN representativos (**Fórmula** ) con parámetros de CN decodificados (**Fórmula** ).
Description
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
DESCRIPCIÓN
Generación de ruido de confort
Campo técnico
La tecnología propuesta se refiere en general a la generación de ruido de confort (CN), y en particular a la generación de parámetros de control del ruido de confort.
Antecedentes
En los sistemas de codificación usados para habla conversacional es común utilizar la transmisión discontinua (DTX) para aumentar la eficiencia de la codificación. Esto viene motivado por las grandes cantidades de pausas insertadas en el habla conversacional, por ejemplo, mientras una persona habla la otra escucha. Utilizando la DTX, el codificador de habla puede estar activo sólo aproximadamente el 50 por ciento del tiempo por término medio. Los ejemplos de códecs que presentan esta característica son el códec de Banda Estrecha Multi-Velocidad Adaptativa (AMR NB) del 3GPP y el códec G.718 de la ITU-T.
En el funcionamiento DTX, las tramas activas se codifican en los modos de códec normales, mientras que los periodos de señales inactivas entre regiones activas se representan con ruido de confort. Los parámetros que describen la señal se extraen y codifican en el codificador y se transmiten al decodificador en tramas de descripción de inserción de silencios (SID). Las tramas de SID se transmiten con una velocidad de tramas reducida y una velocidad de bits inferior a la utilizada para el(los) modo(s) de codificación de habla activo(s). Entre las tramas de SID no se transmite información sobre las características de la señal. Debido a la baja velocidad de SID, el ruido de confort únicamente puede representar propiedades relativamente estacionarias en comparación con la codificación de tramas de señales activas. En el decodificador, los parámetros recibidos se decodifican y se utilizan para caracterizar el ruido de confort.
Para el funcionamiento DTX de alta calidad, es decir, sin calidad de habla deteriorada, es importante detectar los periodos de habla en la señal de entrada. Esto se realiza utilizando un detector de actividad vocal (VAD) o un detector de actividad sonora (SAD). La Fig. 1 muestra un diagrama de bloques de un VAD generalizado, el cual analiza la señal de entrada en tramas de datos (de entre 5 y 30 ms en función de la implementación), y produce una decisión de actividad para cada trama.
En un detector 12 de voz primario se toma una decisión de actividad preliminar (Decisión de VAD Primaria) mediante la comparación de características correspondientes a la trama actual estimadas por un extractor 10 de características y características de fondo estimadas a partir de tramas de entrada previas mediante un bloque 14 de estimación de fondo. Una diferencia mayor que un umbral especificado provoca la decisión primaria de actividad. En un bloque 16 de adición de periodos de mantenimiento (hangover) la decisión primaria se extiende sobre la base de decisiones primarias pasadas con el fin de formar la decisión de actividad final (Decisión de VAD Final). El motivo principal para usar el mantenimiento (hangover) es reducir el riesgo de recortes de partes centrales y posteriores en segmentos de habla.
Para códecs de habla basados en predicción lineal (LP), por ejemplo el G.718, resulta razonable modelar la energía de la envolvente y de las tramas utilizando una representación similar a la de las tramas activas. Esto resulta beneficioso puesto que los requisitos de memoria y la complejidad del códec se pueden reducir mediante una funcionalidad común entre los diferentes modos en el funcionamiento DTX.
Para dichos códecs, el ruido de confort se puede representar con sus coeficientes de LP (conocidos también como coeficientes autorregresivos (AR)) y la energía del residuo de LP, es decir la señal que como entrada en el modelo de LP proporciona el segmento de audio de referencia. En el decodificador, en el generador de excitación se genera una señal residual como ruido aleatorio que se conforma por medio de los parámetros de CN para constituir el ruido de confort.
Los coeficientes de LP se obtienen típicamente calculando las autocorrelaciones r[k] de los segmentos de audio enventanados x[n], n = 0,..., N-1 de acuerdo con:
donde P es el orden del modelo pre-definido. A continuación, los coeficientes de LP ak se obtienen a partir de la secuencia de autocorrelación utilizando, por ejemplo, el algoritmo de Levinson-Durbin.
En un sistema de comunicaciones en el que se utiliza un códec del tipo mencionado, los coeficientes de LP se deberían transmitir eficientemente desde el codificador al decodificador. Por este motivo, se utilizan comúnmente representaciones más compactas que pueden resultar menos sensibles al ruido de cuantificación. Por ejemplo, los
5
10
15
20
25
30
35
40
E13720430
16-09-2015
coeficientes de LP se pueden transformar en pares espectrales lineales (LSP). En implementaciones alternativas, los coeficientes de LP se pueden convertir en cambio a los dominios de pares espectrales de inmitancia (ISP), frecuencias de espectro de líneas (LSF) o frecuencias espectrales de inmitancia (ISF).
El residuo de LP se obtiene filtrando la señal de referencia a través de un filtro de síntesis de LP inverso A[z] definido por:
La señal residual filtrada s[n] viene dada consecuentemente por:
para el cual la energía se define como:
Debido a la baja velocidad de transmisión de tramas de SID, los parámetros de CN deberían evolucionar lentamente con el fin de no cambiar las características de ruido de manera rápida. Por ejemplo, el códec de G.718 limita el cambio de energía entre tramas de SID e interpola los coeficientes de LSP para gestionar esto.
Para hallar parámetros de CN representativos en las tramas de SID, se calculan coeficientes de LSP y la energía residual para cada trama, incluyendo tramas que no son de datos (así, para tramas que no son de datos los parámetros mencionados se determinan pero no se transmiten). En la trama de SID, se calculan, se codifican y se transmiten al decodificador las medianas de los coeficientes de LSP y la energía residual media. Para que el ruido de confort no sea extrañamente estático, se pueden añadir variaciones aleatorias a los parámetros de ruido de confort, por ejemplo, una variación de la energía residual. Esta técnica se usa, por ejemplo, en el códec G.718.
Adicionalmente, las características del ruido de confort no están siempre bien emparejadas con el ruido de fondo de referencia, y una ligera atenuación del ruido de confort puede reducir la atención del escuchante a este. Consecuentemente, la calidad de audio percibida puede resultar mayor. Adicionalmente, el ruido codificado en tramas de señales activas podría tener una energía menor que el ruido de referencia no codificado. Por tanto, la atenuación también puede ser deseable para una mejor adaptación de energía de la representación de ruido en tramas activas e inactivas. La atenuación está típicamente en el intervalo de 0 a 5 dB, y puede ser fija o dependiente de las velocidades de bits del(de los) modo(s) de codificación activo(s).
En sistemas de DTX de gran eficiencia se podría usar un VAD más agresivo y por consiguiente partes de alta energía de la señal (con respecto al nivel de ruido de fondo) se pueden representar con ruido de confort. En ese caso, la limitación del cambio de energía entre las tramas de SID provocaría una degradación de la percepción. Para gestionar mejor los segmentos de alta energía, el sistema puede permitir mayores cambios instantáneos de parámetros de CN para estas circunstancias.
El filtrado paso bajo o la interpolación de los parámetros de CN se lleva a cabo en las tramas inactivas con el fin de obtener una dinámica suave natural del ruido de confort. Para la primera trama de SID tras una o varias tramas activas (la cual se indica a partir de ahora simplemente como “primera SID”), el mejor fundamento para la interpolación de LSP y la suavización de energía sería los parámetros de CN de tramas inactivas previas, es decir, anteriores al segmento de señal activo.
Para cada trama inactiva, SID o sin datos, el vector de LSP qi se puede interpolar a partir de coeficientes de LSP previos de acuerdo con:
donde i es el número de trama correspondiente a tramas inactivas, α [0, 1] es el factor de suavización y
La energía residual Ei se interpola de manera similar en la SID o tramas que no son de datos de acuerdo con:
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
donde β [0, 1] es el factor de suavización y
Un problema con la interpolación descrita es que, para la primera SID, las memorias de interpolación (Ei-1y qi-1) se pueden referir a tramas de alta energía previas, es decir, tramas de voz sorda, que se clasifican como inactivas por parte del VAD. En ese caso, la primera interpolación de SID comenzaría a partir de características de ruido que no son representativas del ruido codificado en las tramas de mantenimiento de modo activo próximas. Se produce el mismo problema si las características del ruido de fondo se cambian durante segmentos de señal activos, por ejemplo, segmentos de una señal de habla.
En la Fig. 2 se muestra un ejemplo de los problemas relacionados con tecnologías de la técnica anterior. El espectrograma de una señal de habla con ruido codificada en el funcionamiento DTX presenta dos segmentos de ruido de confort antes y después de un segmento de audio codificado activo (tal como habla). Puede observarse que, cuando las características de ruido del primer segmento de CN se usan para la interpolación en la primera SID, se produce un cambio brusco de las características de ruido. Después de cierto tiempo, el ruido de confort se corresponde mejor con el final del audio codificado activo, pero la transición mala provoca una degradación clara de la calidad de audio percibida.
El uso de factores de suavización mayores α y β centraría los parámetros de CN en las características de la SID actual, pero esto seguiría provocando problemas. Puesto que los parámetros en la primera SID no se pueden promediar durante un periodo de ruido, tal como sí pueden hacer las tramas de SID siguientes, y los parámetros de CN se basan únicamente en las propiedades de la señal en la trama actual. Dichos parámetros podrían representar el ruido de fondo en la trama actual mejor que la característica de largo plazo en las memorias de interpolación. No obstante, es posible que estos parámetros de SID sean valores atípicos, y no representen las características de ruido a largo plazo. Eso daría como resultado, por ejemplo, cambios poco naturales rápidos de las características de ruido, y una calidad de audio percibida inferior.
El documento US 6 606 593 B1 (JARVINEN KARI [FI] ET AL) describe una generación de ruido de confort para transmisión discontinua, donde los parámetros de ruido se estiman sobre la base del promediado de parámetros de configuración de habla de tramas previas, y los parámetros de ruido mal condicionados se eliminan o sustituyen mediante la aplicación de un método de sustitución de medianas.
Sumario
Un objetivo de la tecnología propuesta es superar por lo menos uno de los problemas antes mencionado.
Un primer aspecto de la tecnología propuesta conlleva un método de generación de parámetros de control de CN según define la reivindicación 1.
Un segundo aspecto de la tecnología propuesta implica un problema de ordenador para generar parámetros de control de CN según define la reivindicación 6.
Un tercer aspecto de la tecnología propuesta implica un producto de programa de ordenador, que comprende un soporte legible por ordenador y un programa de ordenador de acuerdo con el segundo aspecto, almacenado en el soporte legible por ordenador.
Un cuarto aspecto de la tecnología propuesta implica un controlador de ruido de confort para generar parámetros de control de CN según define la reivindicación 8.
Un quinto aspecto de la tecnología propuesta implica un decodificador que incluye un controlador de ruido de confort de acuerdo con el cuarto aspecto.
Un sexto aspecto de la tecnología propuesta implica un nodo de red que incluye un decodificador según el quinto aspecto.
Un séptimo aspecto de la tecnología propuesta implica un nodo de red que incluye un controlador de ruido de confort de acuerdo con el cuarto aspecto.
Una ventaja de la tecnología propuesta es que mejora la calidad de audio para conmutar entre modos de codificación activos e inactivos para códecs que funcionan en el modo DTX. La energía de la envolvente y de la señal del ruido de confort se adaptan a características de señal previas de energías similares en tramas de mantenimiento de VAD y de SID previas.
Breve descripción de los dibujos
La tecnología propuesta, junto con otros de sus objetivos y ventajas, se puede entender mejor haciendo referencia a
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
la siguiente descripción considerada conjuntamente con los dibujos adjuntos, en los cuales:
la Fig. 1 es un diagrama de bloques de un VAD genérico;
la Fig. 2 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con soluciones de DTX de la técnica anterior;
la Fig. 3 es un diagrama de bloques de un sistema de codificador en un códec;
la Fig. 4 es un diagrama de bloques de una realización ejemplificativa de un decodificador que implementa el método de generación de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 5 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con la tecnología propuesta,
la Fig. 6 es un diagrama de flujo que ilustra una realización ejemplificativa del método según la tecnología propuesta;
la Fig. 7 es un diagrama de flujo que ilustra otra realización ejemplificativa del método de acuerdo con la tecnología propuesta;
la Fig. 8 es un diagrama de bloques que ilustra una realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 9 es un diagrama de bloques que ilustra otra realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 10 es un diagrama de bloques que ilustra otra realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 11 es un diagrama esquemático que muestra algunos componentes de una realización ejemplificativa de un decodificador, en donde la funcionalidad del decodificador se implementa con un ordenador; y
la Fig. 12 es un diagrama de bloques que ilustra un nodo de red que incluye un controlador de ruido de confort de acuerdo con la tecnología propuesta.
Descripción detallada
Las realizaciones que se describen a continuación se refieren a un sistema de codificador y decodificador de audio destinado principalmente a aplicaciones de comunicación de habla que utilizan la DTX con ruido de confort para la representación de señales inactivas. El sistema que está bajo consideración utiliza LP para la codificación de tramas de señales tanto activas como inactivas, en donde se utiliza un VAD para las decisiones de la actividad.
En el decodificador ilustrado en la Fig. 3, un VAD 18 da salida a una decisión de actividad que es usada para la codificación por un codificador 20. Adicionalmente, la decisión de mantenimiento del VAD se coloca en el flujo continuo de bits por medio de un multiplexor de flujos continuos de bits (MUX) 22 y se transmite al decodificador junto con los parámetros codificados de tramas activas (tramas de mantenimiento y que no son de mantenimiento) y tramas de SID.
Las realizaciones dadas a conocer son parte de un decodificador de audio. Dicho decodificador 100 se ilustra esquemáticamente en la figura 4. Un demultiplexor de flujos continuos de bits (DEMUX) 24 demultiplexa el flujo continuo de bits recibido en parámetros codificados y decisiones de mantenimiento del VAD. Las señales demultiplexadas se reenvían a un selector 26 de modo. En un decodificador 28 de parámetros se decodifican parámetros codificados recibidos. Los parámetros decodificados son utilizados por un decodificador 30 de tramas activas para decodificar tramas activas del selector 26 de modo.
El decodificador 100 incluye también una memoria intermedia 200 de un tamaño predeterminado M y configurada para recibir y almacenar parámetros de CN para tramas de SID y de traspaso de modo activo, una unidad 300 configurada para determinar cuáles de los parámetros de CN almacenados son relevantes para la SID sobre la base de la antigüedad de parámetros de CN almacenados, una unidad 400 configurada para determinar cuáles de los parámetros de CN determinados son relevantes para la SID sobre la base de mediciones de energía residual, y una unidad 500 configurada para usar los parámetros de CN determinados que son relevantes para la SID para la primera trama de SID tras la(s) trama(s) de señales activos.
Para que los parámetros de las memorias intermedias sean relevantes se impone que sean recientes. De este modo, los tamaños de las memorias intermedias usadas para la selección de subconjuntos de memorias intermedias relevantes se reducen durante periodos más prolongados de codificación activa. Adicionalmente, los parámetros almacenados se sustituyen por valores más nuevos durante tramas de SID y de mantenimiento codificadas activamente.
5
10
15
20
25
30
35
40
45
E13720430
16-09-2015
Utilizando memorias intermedias circulares se puede reducir la complejidad y el requisito de memoria para la gestión de memorias intermedias. En una implementación de este tipo, los elementos ya almacenados no se deben mover cuando se adiciona un elemento nuevo. La posición del último parámetro adicionado, o conjunto de parámetros, se usa junto con el tamaño de la memoria intermedia para colocar elementos nuevos. Cuando se adicionan elementos nuevos, se podrían sobrescribir elementos antiguos.
Puesto que las memorias intermedias contienen parámetros de tramas anteriores de SID y mantenimiento, describen características de señales de tramas de audio previas que contienen probablemente, aunque no de forma necesaria, ruido de fondo. El número de parámetros que se consideran relevantes queda definido por el tamaño de la memoria intermedia y el tiempo, o número correspondiente de tramas, transcurrido desde que se almacenó la información.
La tecnología dada a conocer en la presente se puede describir en varias etapas algorítmicas, por ejemplo ejecutadas en el lado del decodificador que se ilustra en la Fig. 4. Estas etapas son:
1a. Etapa 1a (llevada a cabo por la unidad que se indica como etapa 1a en la Fig. 4) – Actualización de memoria intermedia para tramas de SID y de mantenimiento:
Para cada trama de SID y de mantenimiento activo, el vector de coeficientes de LSP cuantificado q y la energía
se almacenan (en la memoria intermedia 200) en memorias intermedias
, es decir
El índice de posición de memoria intermedia j [0, M-1] se incrementa en uno antes de cada actualización de memoria intermedia y se reinicializa si el índice supera el tamaño de memoria intermedia M, es decir
Tal como se describirá posteriormente, los subconjuntos QK y EK de los últimos K0 elementos almacenados en QM y EM, respectivamente, definen los conjuntos de parámetros almacenados.
1b. Etapa 1b (ejecutada por la unidad indicada como etapa 1b en la Fig. 4) – Actualización de memoria intermedia para tramas activas que no son de mantenimiento
Durante la decodificación de tramas activas, el tamaño de los subconjuntos QK y EK se decrementa a una velocidad de -1 elementos por cada trama de acuerdo con:
donde K0 es el número de elementos almacenados en tramas previas de SID y de mantenimiento,
(9) se puede escribir de una forma más compacta como:
donde
K0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia 200,
es una constante predeterminada,
es un entero no negativo.
10
15
20
25
30
35
E13720430
16-09-2015
2. Etapa 2 (llevada a cabo por la unidad indicada como etapa 2 en la Fig. 4) – Selección de elementos de memoria intermedia relevantes
En la primera SID después de tramas activas se selecciona un subconjunto de la memoria intermedia EK basándose en las energías residuales. El subconjunto
de tamaño L se define como:
donde
1y 2 son un límite inferior y superior predeterminado, respectivamente, para energías residuales que se consideran como representativas del ruido en una transición de tramas activas a inactivas (por ejemplo 1= 200 y 2 = 20),
k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el más antiguo.
Típicamente, 2 se selecciona del intervalo 2 [0,100] ya que valores más grandes incluirían energías residuales elevadas en comparación con la última energía residual almacenada
Debería indicarse que las energías
en el dominio lineal como:
donde
3. Etapa 3 (llevada a cabo por la unidad indicada como etapa 3 en la Fig. 4) – Determinación de parámetros de ruido de confort representativos
Para hallar una energía residual representativa la media ponderada del subconjunto ES se calcula como:
donde
Para un tamaño de memoria intermedia máxima M = 8, un conjunto adecuado de pesos es: wM = {0,2, 0,16, 0,128, 0,1024, 0,08192, 0,065536, 0,0524288, 0,01048576}
Esto significa que las energías recientes reciben un peso mayor en la media de energía residual , lo cual hace que la transición de energía entre tramas activas e inactivas sea más suave. Entre los vectores de LSP en el subconjunto QS, la mediana de los vectores de LSP se selecciona calculando las
distancias entre todos los vectores de LSP en la memoria intermedia de subconjunto ES según:
5
10
15
20
25
30
35
40
E13720430
16-09-2015
Para cada vector de LSP, se suma la distancia a los otros vectores, es decir
La mediana de los vectores de LSP viene dada por el vector con la distancia más pequeña a los otros vectores en la memoria intermedia del subconjunto, es decir
Si varios vectores tienen una distancia total igual, la mediana se puede seleccionar arbitrariamente entre dichos vectores.
Como alternativa, un vector de LSP representativo se puede determinar como el vector medio del subconjunto QS .
4. Etapa 4 (llevada a cabo por la unidad indicada como etapa 4 en la Fig. 4) – Interpolación de parámetros de ruido de confort para la primera trama de SID
En la interpolación de parámetros de CN en la primera trama de SID se usan la mediana del vector o vector medio imagen41 del LSP
[0,1] y β [0,1] pueden ser, para la primera trama de SID, diferentes con respecto a los factores utilizados en la interpolación de parámetros de CN de tramas de SID sucesivas y tramas que no sean de datos. Adicionalmente, los factores podrían depender por ejemplo de una medida que describa adicionalmente la fiabilidad de los parámetros imagen41 determinados
Si los subconjuntos QS y ES están vacíos, se pueden usar directamente los últimos parámetros de SID extraídos sin interpolación a partir de parámetros de ruido más antiguos.
El vector de LSP transmitido
se obtiene preferentemente utilizando parámetros de LP correspondientes a los parámetros de LSP usados para la síntesis de señales en el decodificador. Estos parámetros de LSP se pueden obtener en el codificador llevando a cabo las etapas 1 a 4 con una memoria intermedia correspondiente del lado del codificador. Este funcionamiento del codificador implica que la energía de la salida del decodificador se puede emparejar con la energía de la señal de entrada mediante el control de la energía residual codificada y transmitida puesto que los parámetros de LP de síntesis del decodificador son conocidos en el codificador.
La Fig. 5 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con la tecnología propuesta. El espectrograma se corresponde con el espectrograma de la Fig. 2, es decir, se basa en la misma señal de entrada del lado del codificador. Comparando los espectrogramas de la técnica anterior (Fig. 2) y la solución propuesta (Fig. 5), se observa claramente que la transición entre el audio codificado activamente y la segunda región de ruido de confort es más suave para esta última. En este ejemplo, para obtener la transición suave se utiliza un subconjunto de las características de la señal en las tramas de mantenimiento del VAD. Para otras señales con segmentos de tramas activas más cortos, las memorias intermedias de parámetros también podrían contener parámetros de tramas de SID más próximas en el tiempo.
Aunque es cierto que habrá solamente una primera trama de SID tras una trama de señal activa, esto afectará indirectamente a los parámetros de CN en tramas de SID sucesivas debido a la suavización/interpolación.
5
10
15
20
25
30
35
40
45
50
55
60
E13720430
16-09-2015
La Fig. 6 es un diagrama de flujo que ilustra una realización ejemplificativa del método de acuerdo con la tecnología propuesta. La etapa S1 almacena parámetros de CN para tramas de SID y tramas de mantenimiento activas en una memoria intermedia de un tamaño predeterminado. La etapa S2 determina un subconjunto de parámetros de CN relevante para tramas de SID basándose en la antigüedad de los parámetros de CN almacenados y energías residuales. La etapa S3 utiliza el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa (en otras palabras, determina los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa sobre la base del subconjunto de parámetros de CN determinado).
La Fig. 7 es un diagrama de flujo que ilustra otra realización ejemplificativa del método de acuerdo con la tecnología propuesta. La figura ilustra las etapas de método llevadas a cabo para cada trama. Partes diferentes de la memoria intermedia (por ejemplo 200 en la Fig. 4) se actualizan en función de si la trama es una trama activa que no es de mantenimiento o una trama de SID/mantenimiento (lo cual se decide en la etapa A que se corresponde con el selector 26 de modo en la Fig. 4). Si la trama es una trama de SID o de mantenimiento, la etapa 1a (correspondiente a la unidad que se indica como etapa 1a en la Fig. 4) actualiza la memoria intermedia con parámetros de CN nuevos, por ejemplo, según se describe bajo la subsección 1a anterior. Si la trama es una trama activa que no es de mantenimiento, la etapa 1b (que se corresponde con la unidad que se indica como etapa 1b en la Fig. 4) actualiza el tamaño de un subconjunto, restringido en cuanto a antigüedad, de los parámetros de CN almacenados basándose en el número de tramas activas consecutivas que no son de mantenimiento, por ejemplo según se describe bajo la subsección 1b anterior. La etapa 2 (correspondiente a la unidad que se indica como etapa 2 en la Fig. 4) selecciona el subconjunto de parámetros de CN a partir del subconjunto restringido en cuanto a antigüedad, sobre la base de energías residuales, por ejemplo tal como se describe bajo la subsección 2 anterior. La etapa 3 (correspondiente a la unidad que se indica como etapa 3 en la Fig. 4) determina parámetros de CN representativos a partir del subconjunto de parámetros de CN, por ejemplo tal como se describe bajo la subsección 3 anterior. La etapa 4 (correspondiente a la unidad que se indica como etapa 4 en la Fig. 4) interpola los parámetros de CN representativos con parámetros de CN decodificados, por ejemplo tal como se describe bajo la subsección 4 anterior. La etapa B sustituye la trama actual con la trama siguiente, y a continuación el procedimiento se repite con esa trama.
La Fig. 8 es un diagrama de bloques que ilustra una realización ejemplificativa del controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Una memoria intermedia 200 de un tamaño predeterminado está configurada para almacenar parámetros de CN para tramas de SID y tramas de mantenimiento activas. Un selector 50A de subconjuntos está configurado para determinar un subconjunto de parámetros de CN relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales. Un extractor 50B de parámetros de control de ruido de confort está configurado para utilizar el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa.
La Fig. 9 es un diagrama de bloques que ilustra otra realización de ejemplo del controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Un módulo 52 de actualización de memorias intermedias de tramas de SID y de mantenimiento está configurado para actualizar, para tramas de SID y tramas de mantenimiento activas, la memoria intermedia 200 con parámetros de CN nuevos imagen49 ,
a partir del subconjunto de parámetros de CN QS , ES, por ejemplo tal como se ha descrito bajo la subsección 3 anterior. Un módulo 500 de interpolación de parámetros de ruido de confort está configurado para interpolar los parámetros de CN representativos imagen52 ,
-
imagen55 - ,
- por ejemplo tal como se describe bajo la subsección 4 anterior. A continuación, los parámetros de control de ruido de confort obtenidos
-
imagen56 - ,
- correspondientes a la primera trama de SID son utilizados por el generador 32 de ruido de confort para controlar el llenado de tramas que no son de datos con ruido, sobre la base de excitaciones provenientes del generador 34 de excitaciones.
Las etapas, funciones, procedimientos y/o bloques descritos en la presente se pueden implementar en hardware utilizando cualquier tecnología convencional, tal como tecnología de circuitos discretos o circuitos integrados, incluyendo tanto circuitería electrónica de propósito general como circuitería específica de la aplicación.
Alternativamente, por lo menos algunas de las etapas, funciones, procedimientos y/o bloques descritos en la presente se pueden implementar en software para su ejecución por parte de equipos de procesado adecuados. Estos equipos pueden incluir, por ejemplo, uno o varios microprocesadores, uno o varios Procesadores de Señal Digital (DSP), uno o varios Circuitos Integrados de Aplicación Específica (ASIC), hardware con aceleración de vídeo
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
o uno o varios dispositivos lógicos programables adecuados, tales como Matrices de Puertas Programables in Situ (FPAG). También son viables combinaciones de dichos elementos de procesado.
Debe entenderse también que puede resultar posible reutilizar las capacidades de procesado general ya presentes en un nodo de red, tal como un terminal móvil o un PC. Esto se puede realizar, por ejemplo, volviendo a programar el software existente o añadiendo componentes de software nuevos.
La Fig. 10 es un diagrama de bloques que ilustra otra realización ejemplificativa de un controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Esta realización se basa en un procesador 62, por ejemplo un microprocesador, que ejecuta un programa de ordenador para generar parámetros de control de CN. El programa está almacenado en la memoria 64. El programa incluye una unidad de código 66 para almacenar parámetros de CN para tramas de SID y tramas de mantenimiento activas en una memoria intermedia de tamaño predeterminado, una unidad de código 68 para determinar un subconjunto de parámetros de CN relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y energías residuales, y una unidad de código 70 para utilizar el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa. El procesador 62 se comunica con la imagen60 memoria 64 a través de un bus de sistema. Las entradas
son recibidas por un controlador 72 de entrada/salida (I/O) que controla un bus de I/O, al cual están conectados el procesador 62 y la memoria 64. A los parámetros de control de CN
- imagen62
- obtenidos a partir del programa se les da salida desde la memoria 64 por medio del controlador 72 de I/O a través del bus de I/O.
Según un aspecto de las realizaciones, se proporciona un decodificador para generar ruido de confort que representa una señal inactiva. El decodificador puede funcionar en modo DTX y se puede implementar en un terminal móvil y mediante un producto de programa de ordenador el cual se puede implementar en el terminal móvil
- o en un PC. El producto de programa de ordenador se puede descargar desde un servidor al terminal móvil.
La Figura 11 es un diagrama esquemático que muestra algunos componentes de una realización ejemplificativa de un decodificador 100 en donde la funcionalidad del decodificador se implementa por medio de un ordenador. El ordenador comprende un procesador 62 el cual tiene la capacidad de ejecutar instrucciones de software contenidas en un programa de ordenador almacenado en un producto de programa de ordenador. Además, el ordenador comprende por lo menos un producto de programa de ordenador en forma de una memoria no volátil 64 ó memoria volátil, por ejemplo, una EEPROM (Memoria de Solo Lectura Programable y Borrable Eléctricamente), una memoria flash, una unidad de disco o una RAM (Memoria de acceso aleatorio). El programa de ordenador permite almacenar parámetros de CN para tramas de SID y de mantenimiento en modo activo en una memoria intermedia de un tamaño predeterminado, determinar cuáles de los parámetros de CN almacenados son relevantes para la SID sobre la base de la antigüedad de los parámetros de CN almacenados y de mediciones de energía residual, y utilizar los parámetros de CN determinados que son relevantes para la SID con el fin de estimar los parámetros de CN en la primera trama de SID que sucede a una(s) trama(s) de señal activa.
La Fig. 12 es un diagrama de bloques que ilustra un nodo 80 de red que incluye un controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. El nodo 80 de red es típicamente un Equipo de Usuario (UE), tal como un terminal móvil o PC. El controlador 50 de ruido de confort se puede proporcionar en un decodificador 100, tal como se indica mediante las líneas discontinuas. Como alternativa, se puede proporcionar en un codificador, según se ha expuesto anteriormente en líneas generales.
En las realizaciones de la tecnología propuesta que se ha descrito anteriormente, los coeficientes de LP ak se transforman a un dominio de LSP. No obstante, se pueden aplicar también los mismos principios a coeficientes de LP que se transforman a un dominio de LSF, ISP o ISF.
Para códecs con atenuación del ruido de confort, puede resultar beneficioso atenuar gradualmente la señal codificada activamente durante tramas de mantenimiento del VAD. La energía para el ruido de confort se correspondería entonces mejor con la última trama codificada activamente, lo cual hace que mejore adicionalmente la calidad de audio percibida. Se puede calcular un factor de atenuación y el mismo se puede aplicar al residuo de LP para cada trama de mantenimiento mediante:
donde pHO es el número de tramas de mantenimiento de VAD consecutivas. Como alternativa se puede calcular como:
5
10
15
20
25
30
35
E13720430
16-09-2015
donde L = 0,6 y L0 = 6 controlan la atenuación máxima y la velocidad de atenuación. La atenuación máxima se puede seleccionar típicamente en el intervalo L = [0,5, 1) y el parámetro de control de velocidad L0 se puede
seleccionar por ejemplo de tal manera que
, donde es el número de tramas necesario para la atenuación máxima. se podría fijar por ejemplo al número promedio o máximo de tramas de mantenimiento de VAD consecutivas que es posible (debido a la adición del periodo de mantenimiento en el VAD). Típicamente estaría en el intervalo de
Debe entenderse que la tecnología descrita en la presente puede funcionar conjuntamente con otras soluciones que gestionan las primeras tramas de CN que suceden a segmentos de señal activa. Por ejemplo, puede complementar un algoritmo en donde se permite un cambio grande de los parámetros de CN para tramas de alta energía (con respecto al nivel del ruido de fondo). Para estas tramas, las características de ruido previas podrían no afectar mucho a la actualización en la trama de SID actual. La tecnología descrita se puede usar entonces para tramas que no son detectadas como tramas de alta energía.
Aquellos versados en la materia entenderán que se pueden realizar varias modificaciones y cambios en la tecnología propuesta sin desviarse con respecto a su alcance, el cual queda definido por las reivindicaciones adjuntas.
Abreviaturas
- ACELP
- Predicción Lineal con Excitación por Código Algebraico
- AMR
- Multi-Velocidad Adaptativa
- AMR NB
- Banda Estrecha AMR
- AR
- Autorregresivo
- ASIC
- Circuitos Integrados de Aplicación Específica
- CN
- Ruido de Confort
- DFT
- Transformada Discreta de Fourier
- DSP
- Procesadores de Señal Digital
- DTX
- Transmisión Discontinua
- EEPROM
- Memoria de Solo Lectura Programable y Borrable Eléctricamente
- FPGA
- Matrices de Puertas Programables in Situ
- ISF
- Frecuencias Espectrales de Inmitancia
- ISP
- Pares Espectrales de Inmitancia
- LP
- Predicción Lineal
- LSF
- Frecuencias Espectrales de Líneas
- LSP
- Pares Espectrales de Líneas
- MDCT
- Transformada de Coseno Discreta Modificada
- RAM
- Memoria de acceso aleatorio
- SAD
- Detector de Actividad Sonora
- SID
- Descriptor de Inserción de Silencios
- UE
- Equipo de Usuario
E13720430
16-09-2015
VAD Detector de Actividad Vocal
Claims (14)
- 510152025303540REIVINDICACIONES1. Método de generación de parámetros de control de Ruido de Confort, CN, que comprende almacenar (S1; 1a) parámetros de CN (
imagen1 ) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M);determinar (S2, 1b, 2) un subconjunto de parámetros de CN (QS , ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;usar (S3, 3, 4) el subconjunto de parámetros de CN determinado (QS , ES) para determinar los parámetros de control de CN (imagen2 ) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa, actualizando (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos ( ); caracterizado por:actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas;seleccionar (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales;determinar (3) parámetros de CN representativos (interpolar los parámetros de CN representativos ( - 2. Método de la reivindicación 1, caracterizado por actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K del subconjunto restringido en cuanto a antigüedad (QK, EK) de acuerdo con:
imagen3 dondeK0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia (200), es una constante predeterminada, es un entero no negativo. - 3. Método de la reivindicación 1 ó 2, caracterizado por seleccionar (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) incluyendo solamente parámetros de CN para los cuales:
imagen4 dondeimagen5 es la última energía residual almacenada,1y 2 son límites inferior y superior predeterminados, respectivamente, para energías residuales que se consideran como representativas de ruido en una transición de tramas activas a inactivas,k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el más antiguo. - 4. Método de la reivindicación 1, 2 ó 3, caracterizado por determinar (3) parámetros de CN representativosa partir del subconjunto de parámetros de CN (QS , ES), dondees la mediana de los vectores correspondiente a un conjunto QS de vectores en el subconjunto de parámetros de CN (QS , ES) que representan coeficientes Autorregresivos, AR, yE es una energía residual media ponderada de un conjunto ES de energías residuales en el subconjunto de parámetros de CN seleccionados (QS , ES).
- 5. Método de la reivindicación 4, caracterizado por que la mediana de vectores
imagen6 representa los coeficientes AR como Pares Espectrales de Líneas.imagen7 imagen8 imagen9 imagen10 1351015202530354045 - 6. Programa de ordenador para generar parámetros de control de Ruido de Confort, CN, que comprende unidades de código legibles por ordenador las cuales, cuando se ejecutan en un ordenador (60), provocan que el ordenador:almacene (66; S1; 1a) parámetros de CN (
imagen11 ) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M);determine (68; S2; 1b, 2) un subconjunto de parámetros de CN (QS , ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;use (68; S3; 3, 4) el subconjunto de parámetros de CN determinado (QS , ES) para determinar los parámetros de control de CN (imagen12 ) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa,actualice (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia con parámetros de CN nuevos (actualice (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas;seleccione (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales;determine (3) parámetros de CN representativos (interpole los parámetros de CN representativos ( -
- 7.
- Producto de programa de ordenador, que comprende un soporte legible por ordenador y un programa de ordenador de acuerdo con la reivindicación 6 almacenado en el soporte legible por ordenador.
-
- 8.
- Controlador (50) de ruido de confort para generar parámetros de control de Ruido de Confort, CN, que comprende:
una memoria intermedia (200) de un tamaño predeterminado (M) configurada para almacenar parámetros de CN ) para tramas de SID y tramas de mantenimiento activas;un selector (50A; 54, 300) de subconjuntos configurado para determinar un subconjunto de parámetros de CN (QS , ES) relevante para tramas de Descriptores de Inserción de Silencios, SID, sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;un extractor (50B; 400, 500) de parámetros de control de ruido de confort configurado para usar el subconjunto de parámetros de CN determinado (QS , ES) con el fin de determinar los parámetros de control de CN (imagen13 ) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa; caracterizado por:un módulo (52) de actualización de memorias intermedias de tramas de SID y de mantenimiento, configurado para actualizar, para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos ();un módulo (54) de actualización de memorias intermedias de tramas que no son de mantenimiento configurado para actualizar, para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK , EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas consecutivas que no son de mantenimiento;un selector (300) de elementos de memoria intermedia configurado para seleccionar el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK , EK) sobre la base de energías residuales;un módulo (400) de estimación de parámetros de ruido de confort configurado para determinar (3) parámetros de CNimagen14 imagen15 representativos () a partir del subconjunto de parámetros de CN (QS , ES);un módulo (500) de interpolación de parámetros de ruido de confort, configurado para interpolar los parámetros de CN representativos (imagen16 ) con parámetros de CN decodificados ( ). - 9. Controlador (50) de la reivindicación 8, caracterizado por que el selector (300) de elementos de memoria intermedia está configurado para actualizar, para tramas activas que no son de mantenimiento, el tamaño K del subconjunto restringido en cuanto a antigüedad (QK, EK) de acuerdo con:
imagen17 imagen18 imagen19 imagen20 imagen16 imagen21 14dondeK0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia (200), es una constante predeterminada, es un entero no negativo. - 10. Controlador (50) de la reivindicación 8 ó 9, caracterizado por que el selector (300) de elementos de memoria intermedia está configurado para seleccionar el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) incluyendo solamente parámetros de CN para los cuales:
imagen22 10 dondeimagen23 es la última energía residual almacenada,1y 2 son límites inferior y superior predeterminados, respectivamente, para energías residuales que se consideran como representativas de ruido en una transición de tramas activas a inactivas,k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el 15 más antiguo. - 11. Controlador (50) de la reivindicación 8, 9 ó 10, caracterizado por que el módulo (400) de estimación de parámetros de ruido de confort está configurado para determinar parámetros de CN representativosa partir del subconjunto de parámetros de CN (QS , ES), donde
imagen24 es la mediana de los vectores correspondiente a un conjunto QS de vectores en el subconjunto de parámetros de 20 CN (QS , ES) que representan coeficientes Autorregresivos, AR, yimagen25 es una energía residual media ponderada de un conjunto ES de energías residuales en el subconjunto de parámetros de CN seleccionados (QS , ES). - 12. Decodificador (100) que incluye un controlador (50) de ruido de confort de acuerdo con cualquiera de las reivindicaciones anteriores 8 a 11.25 13. Nodo (80) de red que incluye un decodificador (100) de acuerdo con la reivindicación 12.
-
- 14.
- Nodo (80) de red que incluye un controlador (50) de ruido de confort de acuerdo con cualquiera de las reivindicaciones anteriores 8 a 11.
-
- 15.
- Nodo (80) de red de cualquiera de las reivindicaciones anteriores 13 a 14, en donde el nodo de red es un terminal móvil.
30imagen26 15
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US201261699448P | 2012-09-11 | 2012-09-11 | |
| US201261699448P | 2012-09-11 | ||
| PCT/EP2013/059514 WO2014040763A1 (en) | 2012-09-11 | 2013-05-07 | Generation of comfort noise |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2547457T3 true ES2547457T3 (es) | 2015-10-06 |
Family
ID=48289221
Family Applications (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES13720430.1T Active ES2547457T3 (es) | 2012-09-11 | 2013-05-07 | Generación de ruido de confort |
| ES15168231.7T Active ES2642574T3 (es) | 2012-09-11 | 2013-05-07 | Generación de ruido de confort |
Family Applications After (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES15168231.7T Active ES2642574T3 (es) | 2012-09-11 | 2013-05-07 | Generación de ruido de confort |
Country Status (23)
| Country | Link |
|---|---|
| US (5) | US9443526B2 (es) |
| EP (2) | EP2927905B1 (es) |
| JP (1) | JP5793636B2 (es) |
| KR (1) | KR101648290B1 (es) |
| CN (1) | CN104584120B (es) |
| AP (1) | AP2015008251A0 (es) |
| AU (1) | AU2013314636B2 (es) |
| BR (1) | BR112015002826B1 (es) |
| CA (1) | CA2884471C (es) |
| CL (1) | CL2015000540A1 (es) |
| DK (1) | DK2823479T3 (es) |
| ES (2) | ES2547457T3 (es) |
| HU (1) | HUE027963T2 (es) |
| IN (1) | IN2014DN08789A (es) |
| MA (1) | MA37890B1 (es) |
| MX (1) | MX340634B (es) |
| MY (1) | MY185490A (es) |
| PH (1) | PH12014502232A1 (es) |
| PL (2) | PL2927905T3 (es) |
| PT (1) | PT2823479E (es) |
| RU (2) | RU2658544C1 (es) |
| SG (1) | SG11201500595TA (es) |
| WO (1) | WO2014040763A1 (es) |
Families Citing this family (11)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| PL2927905T3 (pl) * | 2012-09-11 | 2017-12-29 | Telefonaktiebolaget Lm Ericsson (Publ) | Generowanie szumu komfortowego |
| US10319386B2 (en) * | 2013-02-22 | 2019-06-11 | Telefonaktiebolaget Lm Ericsson (Publ) | Methods and apparatuses for DTX hangover in audio coding |
| CN105225668B (zh) * | 2013-05-30 | 2017-05-10 | 华为技术有限公司 | 信号编码方法及设备 |
| US9775110B2 (en) * | 2014-05-30 | 2017-09-26 | Apple Inc. | Power save for volte during silence periods |
| KR101895391B1 (ko) | 2014-07-29 | 2018-09-07 | 텔레호낙티에볼라게트 엘엠 에릭슨(피유비엘) | 오디오 신호의 배경 잡음 추정 |
| GB2532041B (en) * | 2014-11-06 | 2019-05-29 | Imagination Tech Ltd | Comfort noise generation |
| EP4270390B1 (en) * | 2018-06-28 | 2025-10-22 | Telefonaktiebolaget LM Ericsson (publ) | Adaptive comfort noise parameter determination |
| US10805191B2 (en) | 2018-12-14 | 2020-10-13 | At&T Intellectual Property I, L.P. | Systems and methods for analyzing performance silence packets |
| KR20230023725A (ko) | 2020-06-11 | 2023-02-17 | 돌비 레버러토리즈 라이쎈싱 코오포레이션 | 다중-채널 입력 신호 내의 공간 배경 잡음을 인코딩 및/또는 디코딩하기 위한 방법 및 디바이스 |
| CN116348951A (zh) | 2020-07-30 | 2023-06-27 | 弗劳恩霍夫应用研究促进协会 | 用于编码音频信号或用于解码经编码音频场景的设备、方法及计算机程序 |
| CN119895493A (zh) * | 2022-09-13 | 2025-04-25 | 瑞典爱立信有限公司 | 自适应声道间时间差估计 |
Family Cites Families (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5630016A (en) | 1992-05-28 | 1997-05-13 | Hughes Electronics | Comfort noise generation for digital communication systems |
| US5794199A (en) * | 1996-01-29 | 1998-08-11 | Texas Instruments Incorporated | Method and system for improved discontinuous speech transmission |
| US6269331B1 (en) * | 1996-11-14 | 2001-07-31 | Nokia Mobile Phones Limited | Transmission of comfort noise parameters during discontinuous transmission |
| US5960389A (en) * | 1996-11-15 | 1999-09-28 | Nokia Mobile Phones Limited | Methods for generating comfort noise during discontinuous transmission |
| CN1149534C (zh) | 1998-12-07 | 2004-05-12 | 三菱电机株式会社 | 声音解码装置和声音解码方法 |
| GB2356538A (en) * | 1999-11-22 | 2001-05-23 | Mitel Corp | Comfort noise generation for open discontinuous transmission systems |
| US7610197B2 (en) * | 2005-08-31 | 2009-10-27 | Motorola, Inc. | Method and apparatus for comfort noise generation in speech communication systems |
| WO2008121035A1 (en) | 2007-03-29 | 2008-10-09 | Telefonaktiebolaget Lm Ericsson (Publ) | Method and speech encoder with length adjustment of dtx hangover period |
| CN101335000B (zh) * | 2008-03-26 | 2010-04-21 | 华为技术有限公司 | 编码的方法及装置 |
| JP6110314B2 (ja) * | 2011-02-14 | 2017-04-05 | フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン | 整列したルックアヘッド部分を用いてオーディオ信号を符号化及び復号するための装置並びに方法 |
| KR101999563B1 (ko) * | 2011-02-15 | 2019-07-15 | 보이세지 코포레이션 | 켈프 코덱에 있어서 여기의 적응 및 고정 기여의 이득을 양자화 하기 위한 장치 및 방법 |
| PL2927905T3 (pl) * | 2012-09-11 | 2017-12-29 | Telefonaktiebolaget Lm Ericsson (Publ) | Generowanie szumu komfortowego |
-
2013
- 2013-05-07 PL PL15168231T patent/PL2927905T3/pl unknown
- 2013-05-07 WO PCT/EP2013/059514 patent/WO2014040763A1/en not_active Ceased
- 2013-05-07 AU AU2013314636A patent/AU2013314636B2/en active Active
- 2013-05-07 US US14/427,272 patent/US9443526B2/en active Active
- 2013-05-07 HU HUE13720430A patent/HUE027963T2/en unknown
- 2013-05-07 ES ES13720430.1T patent/ES2547457T3/es active Active
- 2013-05-07 SG SG11201500595TA patent/SG11201500595TA/en unknown
- 2013-05-07 MY MYPI2015700031A patent/MY185490A/en unknown
- 2013-05-07 DK DK13720430.1T patent/DK2823479T3/en active
- 2013-05-07 MX MX2015003060A patent/MX340634B/es active IP Right Grant
- 2013-05-07 PL PL13720430T patent/PL2823479T3/pl unknown
- 2013-05-07 EP EP15168231.7A patent/EP2927905B1/en active Active
- 2013-05-07 AP AP2015008251A patent/AP2015008251A0/xx unknown
- 2013-05-07 PT PT137204301T patent/PT2823479E/pt unknown
- 2013-05-07 ES ES15168231.7T patent/ES2642574T3/es active Active
- 2013-05-07 RU RU2016151325A patent/RU2658544C1/ru active
- 2013-05-07 RU RU2014150326A patent/RU2609080C2/ru active
- 2013-05-07 CA CA2884471A patent/CA2884471C/en active Active
- 2013-05-07 MA MA37890A patent/MA37890B1/fr unknown
- 2013-05-07 KR KR1020147036471A patent/KR101648290B1/ko active Active
- 2013-05-07 CN CN201380043927.7A patent/CN104584120B/zh active Active
- 2013-05-07 JP JP2015520857A patent/JP5793636B2/ja active Active
- 2013-05-07 EP EP13720430.1A patent/EP2823479B1/en active Active
- 2013-05-07 BR BR112015002826-8A patent/BR112015002826B1/pt active IP Right Grant
-
2014
- 2014-10-03 PH PH12014502232A patent/PH12014502232A1/en unknown
- 2014-10-20 IN IN8789DEN2014 patent/IN2014DN08789A/en unknown
-
2015
- 2015-03-04 CL CL2015000540A patent/CL2015000540A1/es unknown
-
2016
- 2016-06-07 US US15/175,826 patent/US9779741B2/en active Active
-
2017
- 2017-08-22 US US15/682,961 patent/US10381014B2/en active Active
-
2019
- 2019-06-28 US US16/455,849 patent/US10891964B2/en active Active
-
2020
- 2020-12-10 US US17/117,722 patent/US11621004B2/en active Active
Also Published As
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2642574T3 (es) | Generación de ruido de confort | |
| ES2625895T3 (es) | Método y dispositivo para la ocultación eficiente del borrado de tramas en códecs de voz basados en la predicción lineal | |
| ES2733099T3 (es) | Sistemas, procedimientos y aparatos para la detección de cambio de señal | |
| ES2434947T3 (es) | Procedimiento y dispositivo para la ocultación eficiente de un borrado de trama en códecs de voz | |
| ES2760573T3 (es) | Decodificador de audio y método para proveer una información de audio decodificada usando un ocultamiento de error que modifica una señal de excitación de dominio de tiempo | |
| ES2659177T3 (es) | Codificador de audio, descodificador de audio, método para proveer una información de audio codificada, método para proveer una información de audio descodificada, programa informático y representación codificada utilizando una ampliación de ancho de banda adaptable a la señal | |
| JP5019479B2 (ja) | ボコーダにおけるフレームの位相整合のための方法および装置 | |
| ES2968821T3 (es) | Codificación y decodificación de señales de audio | |
| BRPI0715978A2 (pt) | quadros de alinhamento temporal de vocoder de banda larga | |
| KR101409305B1 (ko) | 정보의 부재 시에 디코더측에서의 여기를 생성하기 위한 과유성음화의 감쇄 | |
| US11380341B2 (en) | Selecting pitch lag | |
| HK1206861B (en) | Generation of comfort noise |