ES2547457T3 - Generación de ruido de confort - Google Patents

Generación de ruido de confort Download PDF

Info

Publication number
ES2547457T3
ES2547457T3 ES13720430.1T ES13720430T ES2547457T3 ES 2547457 T3 ES2547457 T3 ES 2547457T3 ES 13720430 T ES13720430 T ES 13720430T ES 2547457 T3 ES2547457 T3 ES 2547457T3
Authority
ES
Spain
Prior art keywords
parameters
frames
subset
sid
active
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES13720430.1T
Other languages
English (en)
Inventor
Tomas JANSSON TOFTGÅRD
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Telefonaktiebolaget LM Ericsson AB
Original Assignee
Telefonaktiebolaget LM Ericsson AB
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Telefonaktiebolaget LM Ericsson AB filed Critical Telefonaktiebolaget LM Ericsson AB
Application granted granted Critical
Publication of ES2547457T3 publication Critical patent/ES2547457T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/012Comfort noise or silence coding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/06Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
    • G10L19/07Line spectrum pair [LSP] vocoders
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Signal Processing (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Noise Elimination (AREA)
  • Soundproofing, Sound Blocking, And Sound Damping (AREA)
  • Data Exchanges In Wide-Area Networks (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • User Interface Of Digital Computer (AREA)
  • Cable Transmission Systems, Equalization Of Radio And Reduction Of Echo (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

Método de generación de parámetros de control de Ruido de Confort, CN, que comprende almacenar (S1; 1a) parámetros de CN (**Fórmula** ) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M); determinar (S2, 1b, 2) un subconjunto de parámetros de CN (QS, ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales; usar (S3, 3, 4) el subconjunto de parámetros de CN determinado (QS, ES) para determinar los parámetros de control de CN (**Fórmula** ) para una primera trama de SID ("Primera SID") que sucede a una trama de señal activa, actualizando (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos (**Fórmula** ); caracterizado por: actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas; seleccionar (2) el subconjunto de parámetros de CN (QS, ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales; determinar (3) parámetros de CN representativos (**Fórmula** ) a partir del subconjunto de parámetros de CN (QS, ES); e interpolar los parámetros de CN representativos (**Fórmula** ) con parámetros de CN decodificados (**Fórmula** ).

Description

5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
DESCRIPCIÓN
Generación de ruido de confort
Campo técnico
La tecnología propuesta se refiere en general a la generación de ruido de confort (CN), y en particular a la generación de parámetros de control del ruido de confort.
Antecedentes
En los sistemas de codificación usados para habla conversacional es común utilizar la transmisión discontinua (DTX) para aumentar la eficiencia de la codificación. Esto viene motivado por las grandes cantidades de pausas insertadas en el habla conversacional, por ejemplo, mientras una persona habla la otra escucha. Utilizando la DTX, el codificador de habla puede estar activo sólo aproximadamente el 50 por ciento del tiempo por término medio. Los ejemplos de códecs que presentan esta característica son el códec de Banda Estrecha Multi-Velocidad Adaptativa (AMR NB) del 3GPP y el códec G.718 de la ITU-T.
En el funcionamiento DTX, las tramas activas se codifican en los modos de códec normales, mientras que los periodos de señales inactivas entre regiones activas se representan con ruido de confort. Los parámetros que describen la señal se extraen y codifican en el codificador y se transmiten al decodificador en tramas de descripción de inserción de silencios (SID). Las tramas de SID se transmiten con una velocidad de tramas reducida y una velocidad de bits inferior a la utilizada para el(los) modo(s) de codificación de habla activo(s). Entre las tramas de SID no se transmite información sobre las características de la señal. Debido a la baja velocidad de SID, el ruido de confort únicamente puede representar propiedades relativamente estacionarias en comparación con la codificación de tramas de señales activas. En el decodificador, los parámetros recibidos se decodifican y se utilizan para caracterizar el ruido de confort.
Para el funcionamiento DTX de alta calidad, es decir, sin calidad de habla deteriorada, es importante detectar los periodos de habla en la señal de entrada. Esto se realiza utilizando un detector de actividad vocal (VAD) o un detector de actividad sonora (SAD). La Fig. 1 muestra un diagrama de bloques de un VAD generalizado, el cual analiza la señal de entrada en tramas de datos (de entre 5 y 30 ms en función de la implementación), y produce una decisión de actividad para cada trama.
En un detector 12 de voz primario se toma una decisión de actividad preliminar (Decisión de VAD Primaria) mediante la comparación de características correspondientes a la trama actual estimadas por un extractor 10 de características y características de fondo estimadas a partir de tramas de entrada previas mediante un bloque 14 de estimación de fondo. Una diferencia mayor que un umbral especificado provoca la decisión primaria de actividad. En un bloque 16 de adición de periodos de mantenimiento (hangover) la decisión primaria se extiende sobre la base de decisiones primarias pasadas con el fin de formar la decisión de actividad final (Decisión de VAD Final). El motivo principal para usar el mantenimiento (hangover) es reducir el riesgo de recortes de partes centrales y posteriores en segmentos de habla.
Para códecs de habla basados en predicción lineal (LP), por ejemplo el G.718, resulta razonable modelar la energía de la envolvente y de las tramas utilizando una representación similar a la de las tramas activas. Esto resulta beneficioso puesto que los requisitos de memoria y la complejidad del códec se pueden reducir mediante una funcionalidad común entre los diferentes modos en el funcionamiento DTX.
Para dichos códecs, el ruido de confort se puede representar con sus coeficientes de LP (conocidos también como coeficientes autorregresivos (AR)) y la energía del residuo de LP, es decir la señal que como entrada en el modelo de LP proporciona el segmento de audio de referencia. En el decodificador, en el generador de excitación se genera una señal residual como ruido aleatorio que se conforma por medio de los parámetros de CN para constituir el ruido de confort.
Los coeficientes de LP se obtienen típicamente calculando las autocorrelaciones r[k] de los segmentos de audio enventanados x[n], n = 0,..., N-1 de acuerdo con:
imagen1
donde P es el orden del modelo pre-definido. A continuación, los coeficientes de LP ak se obtienen a partir de la secuencia de autocorrelación utilizando, por ejemplo, el algoritmo de Levinson-Durbin.
En un sistema de comunicaciones en el que se utiliza un códec del tipo mencionado, los coeficientes de LP se deberían transmitir eficientemente desde el codificador al decodificador. Por este motivo, se utilizan comúnmente representaciones más compactas que pueden resultar menos sensibles al ruido de cuantificación. Por ejemplo, los
5
10
15
20
25
30
35
40
E13720430
16-09-2015
coeficientes de LP se pueden transformar en pares espectrales lineales (LSP). En implementaciones alternativas, los coeficientes de LP se pueden convertir en cambio a los dominios de pares espectrales de inmitancia (ISP), frecuencias de espectro de líneas (LSF) o frecuencias espectrales de inmitancia (ISF).
El residuo de LP se obtiene filtrando la señal de referencia a través de un filtro de síntesis de LP inverso A[z] definido por:
imagen2
La señal residual filtrada s[n] viene dada consecuentemente por:
imagen3
para el cual la energía se define como:
imagen4
Debido a la baja velocidad de transmisión de tramas de SID, los parámetros de CN deberían evolucionar lentamente con el fin de no cambiar las características de ruido de manera rápida. Por ejemplo, el códec de G.718 limita el cambio de energía entre tramas de SID e interpola los coeficientes de LSP para gestionar esto.
Para hallar parámetros de CN representativos en las tramas de SID, se calculan coeficientes de LSP y la energía residual para cada trama, incluyendo tramas que no son de datos (así, para tramas que no son de datos los parámetros mencionados se determinan pero no se transmiten). En la trama de SID, se calculan, se codifican y se transmiten al decodificador las medianas de los coeficientes de LSP y la energía residual media. Para que el ruido de confort no sea extrañamente estático, se pueden añadir variaciones aleatorias a los parámetros de ruido de confort, por ejemplo, una variación de la energía residual. Esta técnica se usa, por ejemplo, en el códec G.718.
Adicionalmente, las características del ruido de confort no están siempre bien emparejadas con el ruido de fondo de referencia, y una ligera atenuación del ruido de confort puede reducir la atención del escuchante a este. Consecuentemente, la calidad de audio percibida puede resultar mayor. Adicionalmente, el ruido codificado en tramas de señales activas podría tener una energía menor que el ruido de referencia no codificado. Por tanto, la atenuación también puede ser deseable para una mejor adaptación de energía de la representación de ruido en tramas activas e inactivas. La atenuación está típicamente en el intervalo de 0 a 5 dB, y puede ser fija o dependiente de las velocidades de bits del(de los) modo(s) de codificación activo(s).
En sistemas de DTX de gran eficiencia se podría usar un VAD más agresivo y por consiguiente partes de alta energía de la señal (con respecto al nivel de ruido de fondo) se pueden representar con ruido de confort. En ese caso, la limitación del cambio de energía entre las tramas de SID provocaría una degradación de la percepción. Para gestionar mejor los segmentos de alta energía, el sistema puede permitir mayores cambios instantáneos de parámetros de CN para estas circunstancias.
El filtrado paso bajo o la interpolación de los parámetros de CN se lleva a cabo en las tramas inactivas con el fin de obtener una dinámica suave natural del ruido de confort. Para la primera trama de SID tras una o varias tramas activas (la cual se indica a partir de ahora simplemente como “primera SID”), el mejor fundamento para la interpolación de LSP y la suavización de energía sería los parámetros de CN de tramas inactivas previas, es decir, anteriores al segmento de señal activo.
Para cada trama inactiva, SID o sin datos, el vector de LSP qi se puede interpolar a partir de coeficientes de LSP previos de acuerdo con:
imagen5
donde i es el número de trama correspondiente a tramas inactivas, α  [0, 1] es el factor de suavización y
imagen6son las medianas de coeficientes de LSP calculadas con parámetros de la SID actual y todas las tramas que no son de datos desde la trama de SID previa. Para el códec G.718 se utiliza un factor de suavización α = 0,1.
La energía residual Ei se interpola de manera similar en la SID o tramas que no son de datos de acuerdo con:
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
imagen7
donde β  [0, 1] es el factor de suavización y
imagen8es la energía promediada para tramas de SID actual y que no son de datos desde la trama de SID previa. Para el códec G.718 se utiliza un factor de suavización β = 0, 3.
Un problema con la interpolación descrita es que, para la primera SID, las memorias de interpolación (Ei-1y qi-1) se pueden referir a tramas de alta energía previas, es decir, tramas de voz sorda, que se clasifican como inactivas por parte del VAD. En ese caso, la primera interpolación de SID comenzaría a partir de características de ruido que no son representativas del ruido codificado en las tramas de mantenimiento de modo activo próximas. Se produce el mismo problema si las características del ruido de fondo se cambian durante segmentos de señal activos, por ejemplo, segmentos de una señal de habla.
En la Fig. 2 se muestra un ejemplo de los problemas relacionados con tecnologías de la técnica anterior. El espectrograma de una señal de habla con ruido codificada en el funcionamiento DTX presenta dos segmentos de ruido de confort antes y después de un segmento de audio codificado activo (tal como habla). Puede observarse que, cuando las características de ruido del primer segmento de CN se usan para la interpolación en la primera SID, se produce un cambio brusco de las características de ruido. Después de cierto tiempo, el ruido de confort se corresponde mejor con el final del audio codificado activo, pero la transición mala provoca una degradación clara de la calidad de audio percibida.
El uso de factores de suavización mayores α y β centraría los parámetros de CN en las características de la SID actual, pero esto seguiría provocando problemas. Puesto que los parámetros en la primera SID no se pueden promediar durante un periodo de ruido, tal como sí pueden hacer las tramas de SID siguientes, y los parámetros de CN se basan únicamente en las propiedades de la señal en la trama actual. Dichos parámetros podrían representar el ruido de fondo en la trama actual mejor que la característica de largo plazo en las memorias de interpolación. No obstante, es posible que estos parámetros de SID sean valores atípicos, y no representen las características de ruido a largo plazo. Eso daría como resultado, por ejemplo, cambios poco naturales rápidos de las características de ruido, y una calidad de audio percibida inferior.
El documento US 6 606 593 B1 (JARVINEN KARI [FI] ET AL) describe una generación de ruido de confort para transmisión discontinua, donde los parámetros de ruido se estiman sobre la base del promediado de parámetros de configuración de habla de tramas previas, y los parámetros de ruido mal condicionados se eliminan o sustituyen mediante la aplicación de un método de sustitución de medianas.
Sumario
Un objetivo de la tecnología propuesta es superar por lo menos uno de los problemas antes mencionado.
Un primer aspecto de la tecnología propuesta conlleva un método de generación de parámetros de control de CN según define la reivindicación 1.
Un segundo aspecto de la tecnología propuesta implica un problema de ordenador para generar parámetros de control de CN según define la reivindicación 6.
Un tercer aspecto de la tecnología propuesta implica un producto de programa de ordenador, que comprende un soporte legible por ordenador y un programa de ordenador de acuerdo con el segundo aspecto, almacenado en el soporte legible por ordenador.
Un cuarto aspecto de la tecnología propuesta implica un controlador de ruido de confort para generar parámetros de control de CN según define la reivindicación 8.
Un quinto aspecto de la tecnología propuesta implica un decodificador que incluye un controlador de ruido de confort de acuerdo con el cuarto aspecto.
Un sexto aspecto de la tecnología propuesta implica un nodo de red que incluye un decodificador según el quinto aspecto.
Un séptimo aspecto de la tecnología propuesta implica un nodo de red que incluye un controlador de ruido de confort de acuerdo con el cuarto aspecto.
Una ventaja de la tecnología propuesta es que mejora la calidad de audio para conmutar entre modos de codificación activos e inactivos para códecs que funcionan en el modo DTX. La energía de la envolvente y de la señal del ruido de confort se adaptan a características de señal previas de energías similares en tramas de mantenimiento de VAD y de SID previas.
Breve descripción de los dibujos
La tecnología propuesta, junto con otros de sus objetivos y ventajas, se puede entender mejor haciendo referencia a
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
la siguiente descripción considerada conjuntamente con los dibujos adjuntos, en los cuales:
la Fig. 1 es un diagrama de bloques de un VAD genérico;
la Fig. 2 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con soluciones de DTX de la técnica anterior;
la Fig. 3 es un diagrama de bloques de un sistema de codificador en un códec;
la Fig. 4 es un diagrama de bloques de una realización ejemplificativa de un decodificador que implementa el método de generación de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 5 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con la tecnología propuesta,
la Fig. 6 es un diagrama de flujo que ilustra una realización ejemplificativa del método según la tecnología propuesta;
la Fig. 7 es un diagrama de flujo que ilustra otra realización ejemplificativa del método de acuerdo con la tecnología propuesta;
la Fig. 8 es un diagrama de bloques que ilustra una realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 9 es un diagrama de bloques que ilustra otra realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 10 es un diagrama de bloques que ilustra otra realización ejemplificativa del controlador de ruido de confort de acuerdo con la tecnología propuesta;
la Fig. 11 es un diagrama esquemático que muestra algunos componentes de una realización ejemplificativa de un decodificador, en donde la funcionalidad del decodificador se implementa con un ordenador; y
la Fig. 12 es un diagrama de bloques que ilustra un nodo de red que incluye un controlador de ruido de confort de acuerdo con la tecnología propuesta.
Descripción detallada
Las realizaciones que se describen a continuación se refieren a un sistema de codificador y decodificador de audio destinado principalmente a aplicaciones de comunicación de habla que utilizan la DTX con ruido de confort para la representación de señales inactivas. El sistema que está bajo consideración utiliza LP para la codificación de tramas de señales tanto activas como inactivas, en donde se utiliza un VAD para las decisiones de la actividad.
En el decodificador ilustrado en la Fig. 3, un VAD 18 da salida a una decisión de actividad que es usada para la codificación por un codificador 20. Adicionalmente, la decisión de mantenimiento del VAD se coloca en el flujo continuo de bits por medio de un multiplexor de flujos continuos de bits (MUX) 22 y se transmite al decodificador junto con los parámetros codificados de tramas activas (tramas de mantenimiento y que no son de mantenimiento) y tramas de SID.
Las realizaciones dadas a conocer son parte de un decodificador de audio. Dicho decodificador 100 se ilustra esquemáticamente en la figura 4. Un demultiplexor de flujos continuos de bits (DEMUX) 24 demultiplexa el flujo continuo de bits recibido en parámetros codificados y decisiones de mantenimiento del VAD. Las señales demultiplexadas se reenvían a un selector 26 de modo. En un decodificador 28 de parámetros se decodifican parámetros codificados recibidos. Los parámetros decodificados son utilizados por un decodificador 30 de tramas activas para decodificar tramas activas del selector 26 de modo.
El decodificador 100 incluye también una memoria intermedia 200 de un tamaño predeterminado M y configurada para recibir y almacenar parámetros de CN para tramas de SID y de traspaso de modo activo, una unidad 300 configurada para determinar cuáles de los parámetros de CN almacenados son relevantes para la SID sobre la base de la antigüedad de parámetros de CN almacenados, una unidad 400 configurada para determinar cuáles de los parámetros de CN determinados son relevantes para la SID sobre la base de mediciones de energía residual, y una unidad 500 configurada para usar los parámetros de CN determinados que son relevantes para la SID para la primera trama de SID tras la(s) trama(s) de señales activos.
Para que los parámetros de las memorias intermedias sean relevantes se impone que sean recientes. De este modo, los tamaños de las memorias intermedias usadas para la selección de subconjuntos de memorias intermedias relevantes se reducen durante periodos más prolongados de codificación activa. Adicionalmente, los parámetros almacenados se sustituyen por valores más nuevos durante tramas de SID y de mantenimiento codificadas activamente.
5
10
15
20
25
30
35
40
45
E13720430
16-09-2015
Utilizando memorias intermedias circulares se puede reducir la complejidad y el requisito de memoria para la gestión de memorias intermedias. En una implementación de este tipo, los elementos ya almacenados no se deben mover cuando se adiciona un elemento nuevo. La posición del último parámetro adicionado, o conjunto de parámetros, se usa junto con el tamaño de la memoria intermedia para colocar elementos nuevos. Cuando se adicionan elementos nuevos, se podrían sobrescribir elementos antiguos.
Puesto que las memorias intermedias contienen parámetros de tramas anteriores de SID y mantenimiento, describen características de señales de tramas de audio previas que contienen probablemente, aunque no de forma necesaria, ruido de fondo. El número de parámetros que se consideran relevantes queda definido por el tamaño de la memoria intermedia y el tiempo, o número correspondiente de tramas, transcurrido desde que se almacenó la información.
La tecnología dada a conocer en la presente se puede describir en varias etapas algorítmicas, por ejemplo ejecutadas en el lado del decodificador que se ilustra en la Fig. 4. Estas etapas son:
1a. Etapa 1a (llevada a cabo por la unidad que se indica como etapa 1a en la Fig. 4) – Actualización de memoria intermedia para tramas de SID y de mantenimiento:
Para cada trama de SID y de mantenimiento activo, el vector de coeficientes de LSP cuantificado q y la energía
se almacenan (en la memoria intermedia 200) en memorias intermedias
, es decir
imagen9
imagen10
El índice de posición de memoria intermedia j  [0, M-1] se incrementa en uno antes de cada actualización de memoria intermedia y se reinicializa si el índice supera el tamaño de memoria intermedia M, es decir
imagen11
Tal como se describirá posteriormente, los subconjuntos QK y EK de los últimos K0 elementos almacenados en QM y EM, respectivamente, definen los conjuntos de parámetros almacenados.
1b. Etapa 1b (ejecutada por la unidad indicada como etapa 1b en la Fig. 4) – Actualización de memoria intermedia para tramas activas que no son de mantenimiento
Durante la decodificación de tramas activas, el tamaño de los subconjuntos QK y EK se decrementa a una velocidad de -1 elementos por cada trama de acuerdo con:
imagen12
donde K0 es el número de elementos almacenados en tramas previas de SID y de mantenimiento,
imagen13 imagen14y pA es el número de tramas activas consecutivas que no son de mantenimiento. La velocidad de decremento está relacionada con el tiempo, donde  = 25 es factible para tramas de 20 ms. Esto se corresponde con una reducción de un elemento cada medio segundo mientras se decodifican tramas activas. La constante de velocidad de decremento  se puede definir potencialmente como cualquier valor
imagen15 imagen16, aunque se debería seleccionar de tal manera que, de los subconjuntos QK y EK se excluyan características de ruido antiguas que es probable que no representen el ruido imagen17de fondo actual. El valor se podría escoger por ejemplo basándose en la dinámica esperada del ruido de fondo. Adicionalmente, se pueden considerar la longitud natural de ráfagas de voz y el comportamiento del VAD, ya que las secuencias largas de tramas activas consecutivas son improbables. Típicamente la constante estaría en el intervalo de  ≤ 500 para tramas de 20 ms, lo cual se corresponde con menos de 10 segundos. Como alternativa, la ecuación
(9) se puede escribir de una forma más compacta como:
imagen18
donde
K0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia 200,
 es una constante predeterminada,
 es un entero no negativo.
10
15
20
25
30
35
E13720430
16-09-2015
imagen19
imagen20
2. Etapa 2 (llevada a cabo por la unidad indicada como etapa 2 en la Fig. 4) – Selección de elementos de memoria intermedia relevantes
En la primera SID después de tramas activas se selecciona un subconjunto de la memoria intermedia EK basándose en las energías residuales. El subconjunto
de tamaño L se define como:
donde
imagen21es la última energía residual almacenada,
1y 2 son un límite inferior y superior predeterminado, respectivamente, para energías residuales que se consideran como representativas del ruido en una transición de tramas activas a inactivas (por ejemplo 1= 200 y 2 = 20),
k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el más antiguo.
Típicamente, 2 se selecciona del intervalo 2  [0,100] ya que valores más grandes incluirían energías residuales elevadas en comparación con la última energía residual almacenada
imagen22. Esto podría provocar un aumento significativo de la energía del ruido de confort lo cual provocaría una degradación audible. También resulta deseable excluir características de la señal de tramas de habla, las cuales en general tienen una energía mayor, ya que estas características generalmente no representan bien el ruido de fondo. 1 se puede seleccionar ligeramente mayor que 2, por ejemplo del intervalo 1  [50,500], ya que una reducción de la energía habitualmente resulta menos molesta. Adicionalmente, la probabilidad de incluir características de señales de habla es generalmente menor para tramas con una energía residual inferior a
imagen23de lo que lo es para tramas con una energía residual mayor que
imagen24.
Debería indicarse que las energías
imagen25se pueden representar tanto en el dominio lineal como en un dominio logarítmico, por ejemplo, dB. Con energías en el dominio logarítmico, la selección de elementos de memoria imagen26intermedia relevantes, según se especifica en la ecuación (11), se describe de manera equivalente a energías
en el dominio lineal como:
imagen27
imagen28
donde
imagen29y
imagen30. Límites adecuados que especifican el subconjunto de la memoria intermedia EK vienen dados por ejemplo por 1= 0,7 y 2 = 1,03 ó
imagen31 [0,5, 0,9] y
imagen32 [1,0, 1,25]. Los vectores correspondientes en la memoria intermedia de LSP QK definen el subconjunto
3. Etapa 3 (llevada a cabo por la unidad indicada como etapa 3 en la Fig. 4) – Determinación de parámetros de ruido de confort representativos
Para hallar una energía residual representativa la media ponderada del subconjunto ES se calcula como:
imagen33
imagen34
donde
imagen35son los elementos en el subconjunto de pesos:
imagen36
Para un tamaño de memoria intermedia máxima M = 8, un conjunto adecuado de pesos es: wM = {0,2, 0,16, 0,128, 0,1024, 0,08192, 0,065536, 0,0524288, 0,01048576}
Esto significa que las energías recientes reciben un peso mayor en la media de energía residual , lo cual hace que la transición de energía entre tramas activas e inactivas sea más suave. Entre los vectores de LSP en el subconjunto QS, la mediana de los vectores de LSP se selecciona calculando las
distancias entre todos los vectores de LSP en la memoria intermedia de subconjunto ES según:
imagen37
5
10
15
20
25
30
35
40
E13720430
16-09-2015
imagen38
Para cada vector de LSP, se suma la distancia a los otros vectores, es decir
imagen39
La mediana de los vectores de LSP viene dada por el vector con la distancia más pequeña a los otros vectores en la memoria intermedia del subconjunto, es decir
imagen40
Si varios vectores tienen una distancia total igual, la mediana se puede seleccionar arbitrariamente entre dichos vectores.
Como alternativa, un vector de LSP representativo se puede determinar como el vector medio del subconjunto QS .
4. Etapa 4 (llevada a cabo por la unidad indicada como etapa 4 en la Fig. 4) – Interpolación de parámetros de ruido de confort para la primera trama de SID
En la interpolación de parámetros de CN en la primera trama de SID se usan la mediana del vector o vector medio imagen41del LSP
imagen42y la energía residual promediada
imagen43según se describe en las ecuaciones (5) y (6) con:
imagen44
imagen45
[0,1] y β  [0,1] pueden ser, para la primera trama de SID, diferentes con respecto a los factores utilizados en la interpolación de parámetros de CN de tramas de SID sucesivas y tramas que no sean de datos. Adicionalmente, los factores podrían depender por ejemplo de una medida que describa adicionalmente la fiabilidad de los parámetros imagen41determinados
imagen46y imagen47, por ejemplo, el tamaño de los subconjuntos QS y ES. Son valores adecuados por ejemplo α=0,2 y β=0,2 ó β=0,05. A continuación, los parámetros de ruido de confort para la primera trama de SID son utilizados por un generador 32 de ruido de confort para controlar el llenado de tramas que no son de datos del selector 26 de modo, con ruido sobre la base de excitaciones provenientes del generador 34 de excitaciones.
Si los subconjuntos QS y ES están vacíos, se pueden usar directamente los últimos parámetros de SID extraídos sin interpolación a partir de parámetros de ruido más antiguos.
El vector de LSP transmitido
imagen48que se utiliza en la interpolación se obtiene habitualmente en el codificador de manera directa a partir del análisis de LP de la trama actual, es decir, no se consideran tramas previas. La energía residual transmitida
se obtiene preferentemente utilizando parámetros de LP correspondientes a los parámetros de LSP usados para la síntesis de señales en el decodificador. Estos parámetros de LSP se pueden obtener en el codificador llevando a cabo las etapas 1 a 4 con una memoria intermedia correspondiente del lado del codificador. Este funcionamiento del codificador implica que la energía de la salida del decodificador se puede emparejar con la energía de la señal de entrada mediante el control de la energía residual codificada y transmitida puesto que los parámetros de LP de síntesis del decodificador son conocidos en el codificador.
La Fig. 5 es un ejemplo de un espectrograma de una señal de habla con ruido que se ha decodificado de acuerdo con la tecnología propuesta. El espectrograma se corresponde con el espectrograma de la Fig. 2, es decir, se basa en la misma señal de entrada del lado del codificador. Comparando los espectrogramas de la técnica anterior (Fig. 2) y la solución propuesta (Fig. 5), se observa claramente que la transición entre el audio codificado activamente y la segunda región de ruido de confort es más suave para esta última. En este ejemplo, para obtener la transición suave se utiliza un subconjunto de las características de la señal en las tramas de mantenimiento del VAD. Para otras señales con segmentos de tramas activas más cortos, las memorias intermedias de parámetros también podrían contener parámetros de tramas de SID más próximas en el tiempo.
Aunque es cierto que habrá solamente una primera trama de SID tras una trama de señal activa, esto afectará indirectamente a los parámetros de CN en tramas de SID sucesivas debido a la suavización/interpolación.
5
10
15
20
25
30
35
40
45
50
55
60
E13720430
16-09-2015
La Fig. 6 es un diagrama de flujo que ilustra una realización ejemplificativa del método de acuerdo con la tecnología propuesta. La etapa S1 almacena parámetros de CN para tramas de SID y tramas de mantenimiento activas en una memoria intermedia de un tamaño predeterminado. La etapa S2 determina un subconjunto de parámetros de CN relevante para tramas de SID basándose en la antigüedad de los parámetros de CN almacenados y energías residuales. La etapa S3 utiliza el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa (en otras palabras, determina los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa sobre la base del subconjunto de parámetros de CN determinado).
La Fig. 7 es un diagrama de flujo que ilustra otra realización ejemplificativa del método de acuerdo con la tecnología propuesta. La figura ilustra las etapas de método llevadas a cabo para cada trama. Partes diferentes de la memoria intermedia (por ejemplo 200 en la Fig. 4) se actualizan en función de si la trama es una trama activa que no es de mantenimiento o una trama de SID/mantenimiento (lo cual se decide en la etapa A que se corresponde con el selector 26 de modo en la Fig. 4). Si la trama es una trama de SID o de mantenimiento, la etapa 1a (correspondiente a la unidad que se indica como etapa 1a en la Fig. 4) actualiza la memoria intermedia con parámetros de CN nuevos, por ejemplo, según se describe bajo la subsección 1a anterior. Si la trama es una trama activa que no es de mantenimiento, la etapa 1b (que se corresponde con la unidad que se indica como etapa 1b en la Fig. 4) actualiza el tamaño de un subconjunto, restringido en cuanto a antigüedad, de los parámetros de CN almacenados basándose en el número de tramas activas consecutivas que no son de mantenimiento, por ejemplo según se describe bajo la subsección 1b anterior. La etapa 2 (correspondiente a la unidad que se indica como etapa 2 en la Fig. 4) selecciona el subconjunto de parámetros de CN a partir del subconjunto restringido en cuanto a antigüedad, sobre la base de energías residuales, por ejemplo tal como se describe bajo la subsección 2 anterior. La etapa 3 (correspondiente a la unidad que se indica como etapa 3 en la Fig. 4) determina parámetros de CN representativos a partir del subconjunto de parámetros de CN, por ejemplo tal como se describe bajo la subsección 3 anterior. La etapa 4 (correspondiente a la unidad que se indica como etapa 4 en la Fig. 4) interpola los parámetros de CN representativos con parámetros de CN decodificados, por ejemplo tal como se describe bajo la subsección 4 anterior. La etapa B sustituye la trama actual con la trama siguiente, y a continuación el procedimiento se repite con esa trama.
La Fig. 8 es un diagrama de bloques que ilustra una realización ejemplificativa del controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Una memoria intermedia 200 de un tamaño predeterminado está configurada para almacenar parámetros de CN para tramas de SID y tramas de mantenimiento activas. Un selector 50A de subconjuntos está configurado para determinar un subconjunto de parámetros de CN relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales. Un extractor 50B de parámetros de control de ruido de confort está configurado para utilizar el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa.
La Fig. 9 es un diagrama de bloques que ilustra otra realización de ejemplo del controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Un módulo 52 de actualización de memorias intermedias de tramas de SID y de mantenimiento está configurado para actualizar, para tramas de SID y tramas de mantenimiento activas, la memoria intermedia 200 con parámetros de CN nuevos imagen49,
imagen50, por ejemplo tal como se describe bajo la subsección 1a anterior. Un módulo 54 de actualización de memorias intermedias de tramas que no son de mantenimiento está configurado para actualizar, para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad QK, EK de los parámetros de CN almacenados sobre la base del número pA de tramas activas consecutivas que no son de mantenimiento, por ejemplo tal como se describe bajo la subsección 1b anterior. Un selector 300 de elementos de memoria intermedia está configurado para seleccionar el subconjunto de parámetros de CN QS , ES a partir del subconjunto restringido en cuanto a antigüedad QK , EK sobre la base de energías residuales, por ejemplo tal como se describe bajo la subsección 2 anterior. Un módulo 400 de estimación de parámetros de ruido de confort está configurado para determinar parámetros de CN representativos
imagen51
imagen41
a partir del subconjunto de parámetros de CN QS , ES, por ejemplo tal como se ha descrito bajo la subsección 3 anterior. Un módulo 500 de interpolación de parámetros de ruido de confort está configurado para interpolar los parámetros de CN representativos imagen52,
imagen53con parámetros de CN decodificados
imagen54,
imagen55
,
por ejemplo tal como se describe bajo la subsección 4 anterior. A continuación, los parámetros de control de ruido de confort obtenidos
imagen56
,
correspondientes a la primera trama de SID son utilizados por el generador 32 de ruido de confort para controlar el llenado de tramas que no son de datos con ruido, sobre la base de excitaciones provenientes del generador 34 de excitaciones.
imagen57
Las etapas, funciones, procedimientos y/o bloques descritos en la presente se pueden implementar en hardware utilizando cualquier tecnología convencional, tal como tecnología de circuitos discretos o circuitos integrados, incluyendo tanto circuitería electrónica de propósito general como circuitería específica de la aplicación.
Alternativamente, por lo menos algunas de las etapas, funciones, procedimientos y/o bloques descritos en la presente se pueden implementar en software para su ejecución por parte de equipos de procesado adecuados. Estos equipos pueden incluir, por ejemplo, uno o varios microprocesadores, uno o varios Procesadores de Señal Digital (DSP), uno o varios Circuitos Integrados de Aplicación Específica (ASIC), hardware con aceleración de vídeo
imagen58
imagen59
imagen41
5
10
15
20
25
30
35
40
45
50
E13720430
16-09-2015
o uno o varios dispositivos lógicos programables adecuados, tales como Matrices de Puertas Programables in Situ (FPAG). También son viables combinaciones de dichos elementos de procesado.
Debe entenderse también que puede resultar posible reutilizar las capacidades de procesado general ya presentes en un nodo de red, tal como un terminal móvil o un PC. Esto se puede realizar, por ejemplo, volviendo a programar el software existente o añadiendo componentes de software nuevos.
La Fig. 10 es un diagrama de bloques que ilustra otra realización ejemplificativa de un controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. Esta realización se basa en un procesador 62, por ejemplo un microprocesador, que ejecuta un programa de ordenador para generar parámetros de control de CN. El programa está almacenado en la memoria 64. El programa incluye una unidad de código 66 para almacenar parámetros de CN para tramas de SID y tramas de mantenimiento activas en una memoria intermedia de tamaño predeterminado, una unidad de código 68 para determinar un subconjunto de parámetros de CN relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y energías residuales, y una unidad de código 70 para utilizar el subconjunto de parámetros de CN determinado con el fin de determinar los parámetros de control de CN para una primera trama de SID que sucede a una trama de señal activa. El procesador 62 se comunica con la imagen60memoria 64 a través de un bus de sistema. Las entradas
son recibidas por un controlador 72 de entrada/salida (I/O) que controla un bus de I/O, al cual están conectados el procesador 62 y la memoria 64. A los parámetros de control de CN
imagen61,
imagen62
obtenidos a partir del programa se les da salida desde la memoria 64 por medio del controlador 72 de I/O a través del bus de I/O.
Según un aspecto de las realizaciones, se proporciona un decodificador para generar ruido de confort que representa una señal inactiva. El decodificador puede funcionar en modo DTX y se puede implementar en un terminal móvil y mediante un producto de programa de ordenador el cual se puede implementar en el terminal móvil
o en un PC. El producto de programa de ordenador se puede descargar desde un servidor al terminal móvil.
imagen41
imagen63
La Figura 11 es un diagrama esquemático que muestra algunos componentes de una realización ejemplificativa de un decodificador 100 en donde la funcionalidad del decodificador se implementa por medio de un ordenador. El ordenador comprende un procesador 62 el cual tiene la capacidad de ejecutar instrucciones de software contenidas en un programa de ordenador almacenado en un producto de programa de ordenador. Además, el ordenador comprende por lo menos un producto de programa de ordenador en forma de una memoria no volátil 64 ó memoria volátil, por ejemplo, una EEPROM (Memoria de Solo Lectura Programable y Borrable Eléctricamente), una memoria flash, una unidad de disco o una RAM (Memoria de acceso aleatorio). El programa de ordenador permite almacenar parámetros de CN para tramas de SID y de mantenimiento en modo activo en una memoria intermedia de un tamaño predeterminado, determinar cuáles de los parámetros de CN almacenados son relevantes para la SID sobre la base de la antigüedad de los parámetros de CN almacenados y de mediciones de energía residual, y utilizar los parámetros de CN determinados que son relevantes para la SID con el fin de estimar los parámetros de CN en la primera trama de SID que sucede a una(s) trama(s) de señal activa.
La Fig. 12 es un diagrama de bloques que ilustra un nodo 80 de red que incluye un controlador 50 de ruido de confort de acuerdo con la tecnología propuesta. El nodo 80 de red es típicamente un Equipo de Usuario (UE), tal como un terminal móvil o PC. El controlador 50 de ruido de confort se puede proporcionar en un decodificador 100, tal como se indica mediante las líneas discontinuas. Como alternativa, se puede proporcionar en un codificador, según se ha expuesto anteriormente en líneas generales.
En las realizaciones de la tecnología propuesta que se ha descrito anteriormente, los coeficientes de LP ak se transforman a un dominio de LSP. No obstante, se pueden aplicar también los mismos principios a coeficientes de LP que se transforman a un dominio de LSF, ISP o ISF.
Para códecs con atenuación del ruido de confort, puede resultar beneficioso atenuar gradualmente la señal codificada activamente durante tramas de mantenimiento del VAD. La energía para el ruido de confort se correspondería entonces mejor con la última trama codificada activamente, lo cual hace que mejore adicionalmente la calidad de audio percibida. Se puede calcular un factor de atenuación  y el mismo se puede aplicar al residuo de LP para cada trama de mantenimiento mediante:
imagen41
imagen41
imagen64
donde pHO es el número de tramas de mantenimiento de VAD consecutivas. Como alternativa  se puede calcular como:
5
10
15
20
25
30
35
E13720430
16-09-2015
imagen65
imagen66
donde L = 0,6 y L0 = 6 controlan la atenuación máxima y la velocidad de atenuación. La atenuación máxima se puede seleccionar típicamente en el intervalo L = [0,5, 1) y el parámetro de control de velocidad L0 se puede
seleccionar por ejemplo de tal manera que
, donde es el número de tramas necesario para la atenuación máxima. se podría fijar por ejemplo al número promedio o máximo de tramas de mantenimiento de VAD consecutivas que es posible (debido a la adición del periodo de mantenimiento en el VAD). Típicamente estaría en el intervalo de
Debe entenderse que la tecnología descrita en la presente puede funcionar conjuntamente con otras soluciones que gestionan las primeras tramas de CN que suceden a segmentos de señal activa. Por ejemplo, puede complementar un algoritmo en donde se permite un cambio grande de los parámetros de CN para tramas de alta energía (con respecto al nivel del ruido de fondo). Para estas tramas, las características de ruido previas podrían no afectar mucho a la actualización en la trama de SID actual. La tecnología descrita se puede usar entonces para tramas que no son detectadas como tramas de alta energía.
Aquellos versados en la materia entenderán que se pueden realizar varias modificaciones y cambios en la tecnología propuesta sin desviarse con respecto a su alcance, el cual queda definido por las reivindicaciones adjuntas.
Abreviaturas
ACELP
Predicción Lineal con Excitación por Código Algebraico
AMR
Multi-Velocidad Adaptativa
AMR NB
Banda Estrecha AMR
AR
Autorregresivo
ASIC
Circuitos Integrados de Aplicación Específica
CN
Ruido de Confort
DFT
Transformada Discreta de Fourier
DSP
Procesadores de Señal Digital
DTX
Transmisión Discontinua
EEPROM
Memoria de Solo Lectura Programable y Borrable Eléctricamente
FPGA
Matrices de Puertas Programables in Situ
ISF
Frecuencias Espectrales de Inmitancia
ISP
Pares Espectrales de Inmitancia
LP
Predicción Lineal
LSF
Frecuencias Espectrales de Líneas
LSP
Pares Espectrales de Líneas
MDCT
Transformada de Coseno Discreta Modificada
RAM
Memoria de acceso aleatorio
SAD
Detector de Actividad Sonora
SID
Descriptor de Inserción de Silencios
UE
Equipo de Usuario
E13720430
16-09-2015
VAD Detector de Actividad Vocal

Claims (14)

  1. 5
    10
    15
    20
    25
    30
    35
    40
    REIVINDICACIONES
    1. Método de generación de parámetros de control de Ruido de Confort, CN, que comprende almacenar (S1; 1a) parámetros de CN (
    imagen1) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M);
    determinar (S2, 1b, 2) un subconjunto de parámetros de CN (QS , ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;
    usar (S3, 3, 4) el subconjunto de parámetros de CN determinado (QS , ES) para determinar los parámetros de control de CN (
    imagen2) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa, actualizando (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos ( ); caracterizado por:
    actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas;
    seleccionar (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales;
    determinar (3) parámetros de CN representativos (
    interpolar los parámetros de CN representativos (
  2. 2. Método de la reivindicación 1, caracterizado por actualizar (1b), para tramas activas que no son de mantenimiento, el tamaño K del subconjunto restringido en cuanto a antigüedad (QK, EK) de acuerdo con:
    imagen3
    donde
    K0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia (200),  es una constante predeterminada,  es un entero no negativo.
  3. 3. Método de la reivindicación 1 ó 2, caracterizado por seleccionar (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) incluyendo solamente parámetros de CN para los cuales:
    imagen4
    donde
    imagen5es la última energía residual almacenada,
    1y 2 son límites inferior y superior predeterminados, respectivamente, para energías residuales que se consideran como representativas de ruido en una transición de tramas activas a inactivas,
    k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el más antiguo.
  4. 4. Método de la reivindicación 1, 2 ó 3, caracterizado por determinar (3) parámetros de CN representativos
    a partir del subconjunto de parámetros de CN (QS , ES), donde
    es la mediana de los vectores correspondiente a un conjunto QS de vectores en el subconjunto de parámetros de CN (QS , ES) que representan coeficientes Autorregresivos, AR, y
    E es una energía residual media ponderada de un conjunto ES de energías residuales en el subconjunto de parámetros de CN seleccionados (QS , ES).
  5. 5. Método de la reivindicación 4, caracterizado por que la mediana de vectores
    imagen6representa los coeficientes AR como Pares Espectrales de Líneas.
    imagen7
    imagen8
    imagen9
    imagen10
    13
    5
    10
    15
    20
    25
    30
    35
    40
    45
  6. 6. Programa de ordenador para generar parámetros de control de Ruido de Confort, CN, que comprende unidades de código legibles por ordenador las cuales, cuando se ejecutan en un ordenador (60), provocan que el ordenador:
    almacene (66; S1; 1a) parámetros de CN (
    imagen11) para tramas de Descriptores de Inserción de Silencios, SID, y tramas de mantenimiento activas en una memoria intermedia (200) de un tamaño predeterminado (M);
    determine (68; S2; 1b, 2) un subconjunto de parámetros de CN (QS , ES) relevante para tramas de SID sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;
    use (68; S3; 3, 4) el subconjunto de parámetros de CN determinado (QS , ES) para determinar los parámetros de control de CN (
    imagen12) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa,
    actualice (1a), para tramas de SID y tramas de mantenimiento activas, la memoria intermedia con parámetros de CN nuevos (
    actualice (1b), para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK, EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas que no son de mantenimiento consecutivas;
    seleccione (2) el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) sobre la base de energías residuales;
    determine (3) parámetros de CN representativos (
    interpole los parámetros de CN representativos (
  7. 7.
    Producto de programa de ordenador, que comprende un soporte legible por ordenador y un programa de ordenador de acuerdo con la reivindicación 6 almacenado en el soporte legible por ordenador.
  8. 8.
    Controlador (50) de ruido de confort para generar parámetros de control de Ruido de Confort, CN, que comprende:
    una memoria intermedia (200) de un tamaño predeterminado (M) configurada para almacenar parámetros de CN ) para tramas de SID y tramas de mantenimiento activas;
    un selector (50A; 54, 300) de subconjuntos configurado para determinar un subconjunto de parámetros de CN (QS , ES) relevante para tramas de Descriptores de Inserción de Silencios, SID, sobre la base de la antigüedad de los parámetros de CN almacenados y de energías residuales;
    un extractor (50B; 400, 500) de parámetros de control de ruido de confort configurado para usar el subconjunto de parámetros de CN determinado (QS , ES) con el fin de determinar los parámetros de control de CN (
    imagen13) para una primera trama de SID (“Primera SID”) que sucede a una trama de señal activa; caracterizado por:
    un módulo (52) de actualización de memorias intermedias de tramas de SID y de mantenimiento, configurado para actualizar, para tramas de SID y tramas de mantenimiento activas, la memoria intermedia (200) con parámetros de CN nuevos (
    );
    un módulo (54) de actualización de memorias intermedias de tramas que no son de mantenimiento configurado para actualizar, para tramas activas que no son de mantenimiento, el tamaño K de un subconjunto restringido en cuanto a antigüedad (QK , EK) de los parámetros de CN almacenados sobre la base del número pA de tramas activas consecutivas que no son de mantenimiento;
    un selector (300) de elementos de memoria intermedia configurado para seleccionar el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK , EK) sobre la base de energías residuales;
    un módulo (400) de estimación de parámetros de ruido de confort configurado para determinar (3) parámetros de CN imagen14 imagen15representativos (
    ) a partir del subconjunto de parámetros de CN (QS , ES);
    un módulo (500) de interpolación de parámetros de ruido de confort, configurado para interpolar los parámetros de CN representativos (
    imagen16) con parámetros de CN decodificados ( ).
  9. 9. Controlador (50) de la reivindicación 8, caracterizado por que el selector (300) de elementos de memoria intermedia está configurado para actualizar, para tramas activas que no son de mantenimiento, el tamaño K del subconjunto restringido en cuanto a antigüedad (QK, EK) de acuerdo con:
    imagen17
    imagen18
    imagen19
    imagen20
    imagen16
    imagen21
    14
    donde
    K0 es el número de parámetros de CN para tramas de SID y tramas de mantenimiento activas almacenadas en la memoria intermedia (200),  es una constante predeterminada,  es un entero no negativo.
  10. 10. Controlador (50) de la reivindicación 8 ó 9, caracterizado por que el selector (300) de elementos de memoria intermedia está configurado para seleccionar el subconjunto de parámetros de CN (QS , ES) a partir del subconjunto restringido en cuanto a antigüedad (QK, EK) incluyendo solamente parámetros de CN para los cuales:
    imagen22
    10 donde
    imagen23es la última energía residual almacenada,
    1y 2 son límites inferior y superior predeterminados, respectivamente, para energías residuales que se consideran como representativas de ruido en una transición de tramas activas a inactivas,
    k0,..., kK-1 se ordenan de tal manera que k0 se corresponde con el último parámetro de CN almacenado y kK-1 con el 15 más antiguo.
  11. 11. Controlador (50) de la reivindicación 8, 9 ó 10, caracterizado por que el módulo (400) de estimación de parámetros de ruido de confort está configurado para determinar parámetros de CN representativos
    a partir del subconjunto de parámetros de CN (QS , ES), donde
    imagen24es la mediana de los vectores correspondiente a un conjunto QS de vectores en el subconjunto de parámetros de 20 CN (QS , ES) que representan coeficientes Autorregresivos, AR, y
    imagen25es una energía residual media ponderada de un conjunto ES de energías residuales en el subconjunto de parámetros de CN seleccionados (QS , ES).
  12. 12. Decodificador (100) que incluye un controlador (50) de ruido de confort de acuerdo con cualquiera de las reivindicaciones anteriores 8 a 11.
    25 13. Nodo (80) de red que incluye un decodificador (100) de acuerdo con la reivindicación 12.
  13. 14.
    Nodo (80) de red que incluye un controlador (50) de ruido de confort de acuerdo con cualquiera de las reivindicaciones anteriores 8 a 11.
  14. 15.
    Nodo (80) de red de cualquiera de las reivindicaciones anteriores 13 a 14, en donde el nodo de red es un terminal móvil.
    30
    imagen26
    15
ES13720430.1T 2012-09-11 2013-05-07 Generación de ruido de confort Active ES2547457T3 (es)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US201261699448P 2012-09-11 2012-09-11
US201261699448P 2012-09-11
PCT/EP2013/059514 WO2014040763A1 (en) 2012-09-11 2013-05-07 Generation of comfort noise

Publications (1)

Publication Number Publication Date
ES2547457T3 true ES2547457T3 (es) 2015-10-06

Family

ID=48289221

Family Applications (2)

Application Number Title Priority Date Filing Date
ES13720430.1T Active ES2547457T3 (es) 2012-09-11 2013-05-07 Generación de ruido de confort
ES15168231.7T Active ES2642574T3 (es) 2012-09-11 2013-05-07 Generación de ruido de confort

Family Applications After (1)

Application Number Title Priority Date Filing Date
ES15168231.7T Active ES2642574T3 (es) 2012-09-11 2013-05-07 Generación de ruido de confort

Country Status (23)

Country Link
US (5) US9443526B2 (es)
EP (2) EP2927905B1 (es)
JP (1) JP5793636B2 (es)
KR (1) KR101648290B1 (es)
CN (1) CN104584120B (es)
AP (1) AP2015008251A0 (es)
AU (1) AU2013314636B2 (es)
BR (1) BR112015002826B1 (es)
CA (1) CA2884471C (es)
CL (1) CL2015000540A1 (es)
DK (1) DK2823479T3 (es)
ES (2) ES2547457T3 (es)
HU (1) HUE027963T2 (es)
IN (1) IN2014DN08789A (es)
MA (1) MA37890B1 (es)
MX (1) MX340634B (es)
MY (1) MY185490A (es)
PH (1) PH12014502232A1 (es)
PL (2) PL2927905T3 (es)
PT (1) PT2823479E (es)
RU (2) RU2658544C1 (es)
SG (1) SG11201500595TA (es)
WO (1) WO2014040763A1 (es)

Families Citing this family (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
PL2927905T3 (pl) * 2012-09-11 2017-12-29 Telefonaktiebolaget Lm Ericsson (Publ) Generowanie szumu komfortowego
US10319386B2 (en) * 2013-02-22 2019-06-11 Telefonaktiebolaget Lm Ericsson (Publ) Methods and apparatuses for DTX hangover in audio coding
CN105225668B (zh) * 2013-05-30 2017-05-10 华为技术有限公司 信号编码方法及设备
US9775110B2 (en) * 2014-05-30 2017-09-26 Apple Inc. Power save for volte during silence periods
KR101895391B1 (ko) 2014-07-29 2018-09-07 텔레호낙티에볼라게트 엘엠 에릭슨(피유비엘) 오디오 신호의 배경 잡음 추정
GB2532041B (en) * 2014-11-06 2019-05-29 Imagination Tech Ltd Comfort noise generation
EP4270390B1 (en) * 2018-06-28 2025-10-22 Telefonaktiebolaget LM Ericsson (publ) Adaptive comfort noise parameter determination
US10805191B2 (en) 2018-12-14 2020-10-13 At&T Intellectual Property I, L.P. Systems and methods for analyzing performance silence packets
KR20230023725A (ko) 2020-06-11 2023-02-17 돌비 레버러토리즈 라이쎈싱 코오포레이션 다중-채널 입력 신호 내의 공간 배경 잡음을 인코딩 및/또는 디코딩하기 위한 방법 및 디바이스
CN116348951A (zh) 2020-07-30 2023-06-27 弗劳恩霍夫应用研究促进协会 用于编码音频信号或用于解码经编码音频场景的设备、方法及计算机程序
CN119895493A (zh) * 2022-09-13 2025-04-25 瑞典爱立信有限公司 自适应声道间时间差估计

Family Cites Families (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5630016A (en) 1992-05-28 1997-05-13 Hughes Electronics Comfort noise generation for digital communication systems
US5794199A (en) * 1996-01-29 1998-08-11 Texas Instruments Incorporated Method and system for improved discontinuous speech transmission
US6269331B1 (en) * 1996-11-14 2001-07-31 Nokia Mobile Phones Limited Transmission of comfort noise parameters during discontinuous transmission
US5960389A (en) * 1996-11-15 1999-09-28 Nokia Mobile Phones Limited Methods for generating comfort noise during discontinuous transmission
CN1149534C (zh) 1998-12-07 2004-05-12 三菱电机株式会社 声音解码装置和声音解码方法
GB2356538A (en) * 1999-11-22 2001-05-23 Mitel Corp Comfort noise generation for open discontinuous transmission systems
US7610197B2 (en) * 2005-08-31 2009-10-27 Motorola, Inc. Method and apparatus for comfort noise generation in speech communication systems
WO2008121035A1 (en) 2007-03-29 2008-10-09 Telefonaktiebolaget Lm Ericsson (Publ) Method and speech encoder with length adjustment of dtx hangover period
CN101335000B (zh) * 2008-03-26 2010-04-21 华为技术有限公司 编码的方法及装置
JP6110314B2 (ja) * 2011-02-14 2017-04-05 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン 整列したルックアヘッド部分を用いてオーディオ信号を符号化及び復号するための装置並びに方法
KR101999563B1 (ko) * 2011-02-15 2019-07-15 보이세지 코포레이션 켈프 코덱에 있어서 여기의 적응 및 고정 기여의 이득을 양자화 하기 위한 장치 및 방법
PL2927905T3 (pl) * 2012-09-11 2017-12-29 Telefonaktiebolaget Lm Ericsson (Publ) Generowanie szumu komfortowego

Also Published As

Publication number Publication date
AP2015008251A0 (en) 2015-02-28
CN104584120A (zh) 2015-04-29
EP2823479A1 (en) 2015-01-14
US20160293170A1 (en) 2016-10-06
PL2823479T3 (pl) 2015-10-30
WO2014040763A1 (en) 2014-03-20
JP2015525896A (ja) 2015-09-07
US20170352354A1 (en) 2017-12-07
US20150235648A1 (en) 2015-08-20
US10891964B2 (en) 2021-01-12
EP2927905A1 (en) 2015-10-07
PH12014502232B1 (en) 2014-12-15
RU2658544C1 (ru) 2018-06-22
MX340634B (es) 2016-07-19
SG11201500595TA (en) 2015-04-29
US20190318752A1 (en) 2019-10-17
MA37890A1 (fr) 2016-12-30
US9443526B2 (en) 2016-09-13
MX2015003060A (es) 2015-07-14
KR101648290B1 (ko) 2016-08-12
EP2823479B1 (en) 2015-07-08
US11621004B2 (en) 2023-04-04
ES2642574T3 (es) 2017-11-16
CA2884471A1 (en) 2014-03-20
US20210166704A1 (en) 2021-06-03
RU2014150326A (ru) 2016-07-10
HUE027963T2 (en) 2016-11-28
PH12014502232A1 (en) 2014-12-15
KR20150054716A (ko) 2015-05-20
BR112015002826A2 (pt) 2018-05-22
CL2015000540A1 (es) 2015-07-31
HK1206861A1 (zh) 2016-01-15
CN104584120B (zh) 2016-08-31
BR112015002826B1 (pt) 2021-05-04
AU2013314636A1 (en) 2015-03-19
US10381014B2 (en) 2019-08-13
CA2884471C (en) 2016-12-20
MY185490A (en) 2021-05-19
DK2823479T3 (en) 2015-10-12
EP2927905B1 (en) 2017-07-12
AU2013314636B2 (en) 2016-02-25
MA37890B1 (fr) 2017-11-30
PT2823479E (pt) 2015-10-08
IN2014DN08789A (es) 2015-05-22
US9779741B2 (en) 2017-10-03
JP5793636B2 (ja) 2015-10-14
RU2609080C2 (ru) 2017-01-30
PL2927905T3 (pl) 2017-12-29

Similar Documents

Publication Publication Date Title
ES2642574T3 (es) Generación de ruido de confort
ES2625895T3 (es) Método y dispositivo para la ocultación eficiente del borrado de tramas en códecs de voz basados en la predicción lineal
ES2733099T3 (es) Sistemas, procedimientos y aparatos para la detección de cambio de señal
ES2434947T3 (es) Procedimiento y dispositivo para la ocultación eficiente de un borrado de trama en códecs de voz
ES2760573T3 (es) Decodificador de audio y método para proveer una información de audio decodificada usando un ocultamiento de error que modifica una señal de excitación de dominio de tiempo
ES2659177T3 (es) Codificador de audio, descodificador de audio, método para proveer una información de audio codificada, método para proveer una información de audio descodificada, programa informático y representación codificada utilizando una ampliación de ancho de banda adaptable a la señal
JP5019479B2 (ja) ボコーダにおけるフレームの位相整合のための方法および装置
ES2968821T3 (es) Codificación y decodificación de señales de audio
BRPI0715978A2 (pt) quadros de alinhamento temporal de vocoder de banda larga
KR101409305B1 (ko) 정보의 부재 시에 디코더측에서의 여기를 생성하기 위한 과유성음화의 감쇄
US11380341B2 (en) Selecting pitch lag
HK1206861B (en) Generation of comfort noise