ES2206667T3 - Procedimiento para generar ruido de bienestar durante una transmision discontinua. - Google Patents

Procedimiento para generar ruido de bienestar durante una transmision discontinua.

Info

Publication number
ES2206667T3
ES2206667T3 ES97309213T ES97309213T ES2206667T3 ES 2206667 T3 ES2206667 T3 ES 2206667T3 ES 97309213 T ES97309213 T ES 97309213T ES 97309213 T ES97309213 T ES 97309213T ES 2206667 T3 ES2206667 T3 ES 2206667T3
Authority
ES
Spain
Prior art keywords
parameters
voice
noise
voice coding
period
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES97309213T
Other languages
English (en)
Inventor
Kari Jarvinen
Pekka Kapanen
Vesa Ruoppila
Jani Rotola-Pukkila
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Nokia Inc
Original Assignee
Nokia Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nokia Inc filed Critical Nokia Inc
Application granted granted Critical
Publication of ES2206667T3 publication Critical patent/ES2206667T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/012Comfort noise or silence coding

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Telephone Function (AREA)

Abstract

UN PROCEDIMIENTO MEJORADO PARA GENERAR RUIDO DE BIENESTAR (CN) EN UN TERMINAL MOVIL, FUNCIONANDO EN UN MODO DE TRANSMISION DISCONTINUA (DTX). EN UNA REALIZACION, LA INVENCION PROPORCIONA UN PROCEDIMIENTO MEJORADO PARA LA GENERACION DE RUIDO DE BIENESTAR, EN EL QUE SE MODIFICA UNA EXCITACION ALEATORIA, MEDIANTE UN FILTRO ESPECTRAL DE CONTROL, DE MANERA QUE EL CONTENIDO EN FRECUENCIA DEL RUIDO DE BIENESTAR Y EL RUIDO DE FONDO LLEGUE A SER SIMILAR. EN OTRA REALIZACION DE LA INVENCION, EL TRANSMISOR IDENTIFICA LOS PARAMETROS DE CODIFICACION DEL HABLA QUE NO SON REPRESENTATIVOS DEL RUIDO DE FONDO VERDADERO, Y REEMPLAZA LOS PARAMETROS IDENTIFICADOS, CON PARAMETROS QUE TENGAN UN VALOR MEDIO. DE ESTA MANERA, LOS PARAMETROS NO REPRESENTATIVOS NO DISTORSIONAN EL RESULTADO DE UN FUNCIONAMIENTO PROMEDIAL.

Description

Procedimiento para generar ruido de bienestar durante una transmisión discontinua.
Esta invención se refiere generalmente al campo de la comunicación de voz y, más particularmente, a la transmisión discontinua (DTX) y a mejorar la calidad de ruido de bienestar (CN) durante transmisión discontinua.
La transmisión discontinua es utilizada en sistemas de comunicación móvil para desconectar el transmisor de radio durante las pausas de voz. El uso de DTX ahorra energía en la estación móvil e incrementa el tiempo requerido entre la recarga de batería. Reduce, además, el nivel de interferencia general y mejora, por tanto, la calidad de transmisión.
No obstante, durante las pausas de voz, el ruido de fondo que es transmitido con la voz desaparece también si el canal es interrumpido completamente. El resultado es una señal de audio que suena no natural (silencio) en el extremo de recepción de la comunicación.
Se conoce en la técnica, en lugar de desconectar completamente la transmisión durante pausas de voz, generar parámetros que caractericen el ruido de fondo, y enviar estos parámetros por el interfaz hertziano a una velocidad baja en las tramas de Descriptor de Silencio (SID). Estos parámetros son utilizados en el lado de recepción para regenerar el ruido de fondo que se refleja, así como sea posible, el contenido temporal y espectral del ruido de fondo en el lado de transmisión. Estos parámetros que caracterizan el ruido de fondo son referidos como parámetros de ruido de bienestar (CN). Los parámetros de ruido de bienestar incluyen típicamente un subconjunto de parámetros de codificación de voz: en particular, los coeficientes de filtro de síntesis y los parámetros de ganancia.
No obstante, debería indicarse que en muchos esquemas de evaluación de ruido de bienestar de algunos codec (codificador-decodificador) de voz, parte de los parámetros de ruido de bienestar son derivados de parámetros de codificación de voz, mientras que otro(s) parámetro(s) de ruido de bienestar son derivados, por ejemplo, de señales que están disponibles en el codificador de voz, pero que no son transmitidas por el interfaz hertziano.
Se supone en los sistemas DTX de la técnica anterior, que la excitación puede aproximarse suficientemente bien mediante ruido espectralmente plano (por ejemplo, ruido blanco). En los sistemas DTX de la técnica anterior, el ruido de bienestar es generado por la alimentación de ruido espectralmente plano, generado localmente, a través de un filtro de síntesis de codificador de voz. No obstante, tales secuencias de ruido blanco son incapaces de producir ruido de bienestar de alta calidad. Esto es debido a que las secuencias de excitación óptimas no son espectralmente planas, pero pueden tener inclinación espectral o incluso una desviación más fuerte a partir de las características espectrales planas. Dependiendo del tipo de ruido de fondo, los espectros de las secuencias de excitación óptimas pueden tener, por ejemplo, características de paso bajo o paso alto. Debido a este desajuste entre la excitación aleatoria y la excitación correcta u óptima, el ruido de bienestar generado en los sonidos del lado de recepción diferentes del ruido de fondo sobre el lado de transmisión. El ruido de bienestar generado puede sonar, por ejemplo, considerablemente "más animado" o "más oscuro" que lo que debería. Durante el DTX, el contenido espectral del ruido de fondo cambia, por tanto, entre voz activa (es decir, codificación de voz conectada), y pausas de voz (es decir, generación ruido de bienestar conectada). Esta diferencia audible en el ruido de bienestar provoca, por tanto, una reducción en la calidad de transmisión que puede ser percibida por el usuario.
En los sistemas de codificación de voz, tales como en los canales de voz de régimen completo (FR), régimen medio (HR), y régimen completo mejorado (EFR) del sistema GSM, los parámetros de ruido de bienestar son transmitidos a una velocidad baja. Por ejemplo, en los canales FR y EFR, esta velocidad es solamente una vez por cada 24 tramas (es decir, cada 480 milisegundos). Esto significa que los parámetros de ruido de bienestar están actualizados solamente aproximadamente dos veces por segundo. Esta velocidad de transmisión baja no puede representar de forma exacta las características espectrales y temporales del ruido de fondo y, por tanto, es inevitable cierta degradación en la calidad del ruido de fondo durante DTX.
Un problema adicional que surge durante DTX en los sistemas celulares digitales, tales como GSM, se refiere a un periodo de persistencia de algunas tramas de voz que se introduce después de una ráfaga de voz, y antes de que se termine la transmisión real. Si la ráfaga de voz está por debajo de cierta duración umbral, puede interpretarse como un pico de ruido de fondo, y en este caso, la ráfaga de voz no está seguido por un periodo de pausa. El periodo de pausa es utilizado para calcular una estimación de las características del ruido de fondo sobre el lado de transmisión que debe ser transmitido hasta el lado de recepción en un mensaje de parámetro de ruido de bienestar (o trama (SID) Descriptor de Silencio), antes de que se finalice la transmisión. Como se describió anteriormente, la estimación de ruido de fondo transmitido es utilizada sobre el lado de recepción para generar el ruido de bienestar con las características similares al ruido de fondo del lado de transmisión en el momento en el que se termina la transmisión.
En tipos conocidos de mecanismos DTX, similares a los de GSM FR y HR, se emplean los esquemas de cuantificación de ruido de bienestar de predicción. Debido a esto, el lado de recepción no tiene que conocer si existe un periodo pausa al final de una ráfaga de voz. No obstante, en GSM EFR, se emplean los esquemas de cuantificación de ruido de bienestar de predicción, y se evalúa localmente la existencia de un periodo pausa en el lado de recepción para contribuir en la descuantificación del ruido de bienestar. Esto implica una pequeña carga de cálculo y que debe ejecutarse un número de instrucciones del programa.
Surge otro problema si el ruido de fondo sobre el lado de transmisión no está estacionario, sino que varía considerablemente. En este caso, puede existir un solo trama o un pequeño número de tramas dentro de un periodo promediado, para el que algunos o todos los parámetros de codificación de voz proporcionan una caracterización pobre del ruido de fondo típico. Puede producirse una situación similar cuando una Detección de Actividad de Voz o algoritmo VAD interpreta el extremo sin voz del periodo de voz activa como "no voz", o el ruido de fondo estacionario contiene ráfagas de ruido del tipo de impulso fuerte. Debido a la corta duración de los periodos de promedio en los tipos conocidos de sistemas DTX, tales parámetros de codificación de voz mal acondicionados pueden cambiar el resultado del promedio de forma significativa lo suficiente, de modo que los parámetros CN promediados resultantes no caracterizan de forma exacta el ruido de fondo. Esto da lugar a un desajuste o bien en el nivel o en el espectro, o ambos, entre el ruido de fondo y el ruido de bienestar. La calidad de la transmisión se ve perjudicada, por tanto, a medida que el ruido de fondo suena diferente para el usuario dependiendo de si es recibido durante la voz (codificación de voz normal de voz y ruido de fondo) o durante las pausas de voz (producido por generación de ruido de bienestar).
Más detalladamente, durante el periodo de pausa DTX, algunas tramas declarados por el algoritmo VAD como tramas de "no voz" son enviados por el interfaz hertziano, y los parámetros de codificación de voz son memorizados temporalmente para ser capaces de evaluar los parámetros de ruido de bienestar para un primer trama SID. El primer trama SID es transmitido inmediatamente después del final del periodo pausa DTX. La longitud del periodo de pausa DTX es determinada, por tanto, por la longitud del periodo promediado. De este modo, para reducir al mínimo la actividad del canal del sistema, debería fijarse el periodo promediado a una longitud relativamente corta.
Antes de describir la presente invención, será instructivo revistar los circuitos y métodos convencionales para generar los parámetros de ruido de bienestar sobre el lado de transmisión y generar ruido de bienestar sobre el lado de recepción. A este respecto, se hace en primer lugar referencia a las figuras 1a-1d.
Con referencia a la figura 1a, se calculan los parámetros espectrales a corto plazo 102 a partir de una señal de voz 100 en un bloque de análisis de Codificación Predictiva Lineal (LPC) 101. La LPC es un método bien conocido en la técnica anterior. Para simplicidad, se describe aquí solamente el caso donde el filtro de síntesis tiene solamente un filtro de síntesis a corto plazo, interpretándose que la mayoría de los sistemas de la técnica anterior, tales como en GSM FR, HR y codificadores EFR, el filtro de síntesis está construido como una cascada de un filtro de síntesis a corto plazo y un filtro de síntesis a largo plazo. No obstante, para los fines de esta descripción, no es necesaria una descripción del filtro de síntesis a largo plazo. Adicionalmente, el filtro de síntesis a largo plazo está desconectado típicamente durante la generación de ruido de bienestar en los sistemas DTX de la técnica anterior.
El análisis LPC produce un conjunto de parámetros espectrales a corto plazo 102 una vez para cada trama de transmisión. La duración de la trama depende del sistema. Por ejemplo, en todos los canales GSM, el tamaño de la trama es ajustado a 20 milisegundos.
La señal de voz es alimentada a través de un filtro inverso 103 para producir una señal residual 104. El filtro inverso es de la forma:
(1)A(z)=1-\sum\limits^{M}_{i=1}a(i)z^{-1}
Los coeficientes del filtro a(i), i=1,..., M son producidos en el análisis LPC y son actualizados una vez para cada trama. La interpolación, como se conoce en la codificación de voz de la técnica anterior, puede aplicarse en el filtro inverso 103 para obtener un cambio uniforme en los parámetros de filtro entre las tramas. El filtro inverso 103 produce la señal residual 104 que es la señal de excitación óptima, y que genera la señal de voz exacta 100, cuando se alimenta a través del filtro de síntesis 1/A(z) 112 sobre el lado de recepción (ver figura 1b). Se mide la energía de la secuencia de excitación y se calcula la ganancia de escala 106 para cada trama de transmisión en el bloque de cálculo de ganancia de excitación 105.
La ganancia de excitación 106 y los coeficientes espectrales 102 a corto plazo son promediados en varios tramas de transmisión para obtener una caracterización del contenido espectral medio y temporal del ruido de fondo. El promedio se lleva a cabo típicamente sobre cuatro tramas para el canal GSM FR a ocho tramas, como es el caso para el canal GSM EFR. Los parámetros que deben promediarse son memorizados temporalmente en una duración del periodo promediado en los bloques 107a y 108a (ver figura 1d). El proceso de promedio se lleva a cabo en los bloques 107 y 108, y se generan, por tanto, los parámetros medios que caracterizan el ruido de fondo. Existe ganancia de excitación media g_{mean}y los coeficientes espectrales medios a corto plazo. En los codec de voz modernos, existen típicamente 10 coeficientes espectrales a corto plazo (M=10) que son representados normalmente como coeficientes de pareja de líneas espectrales (LSP) f_{mean}(i), i = 1,..., M, como en el sistema GSM EFR DTX. Aunque estos parámetros se cuantifican típicamente antes de la transmisión, la cuantificación es ignorada en esta descripción por simplicidad, puesto que el tipo exacto de cuantificación que se realiza es irrelevante para un entendimiento del funcionamiento de la invención como se describe a continuación.
Haciendo referencia brevemente a la figura 1d, se muestra que los bloques de promedio 107 y 108 incluye cada uno las memorias temporales respectivas 107a y 108a, que emiten las señales memorizadas temporalmente 107b y 108b, respectivamente, a los bloques de promedio. Se pondrá mayor atención a las memorias temporales 107a y 108a a continuación cuando se describen las formas de realización de la invención mostradas en las figuras 4 y 5.
El cálculo y el promedio de los parámetros de ruido de bienestar se explica en detalle en la recomendación GSM: GSM 06.62 "Comfort noise aspects for Enhanced Full Rate (EFR) speech traffic channels". Además, por ejemplo, se explica la transmisión discontinua en la recomendación GSM: GSM 06.81 "Discontinnuos Transmission (DTX) for Enahnced Full Rate (EFR) for speech traffic channels", y se explica la detección e la actividad de voz (VAD) en la recomendación GSM: GSM 06.82 "Voice Activity Detection (VAD) for Enhanced Full Rate (EFR) speech channels". Como tal, no se describen adicionalmente aquí los detalles de estas varias funciones.
Haciendo referencia a la figura 1b, se muestra un diagrama de bloques de un decodificador convencional sobre el lado de recepción que se utiliza para generar el ruido de bienestar en el sistema de comunicación de voz la técnica anterior. El decodificador recibe los dos parámetros de ruido de bienestar, la ganancia de excitación media g_{mean} y el conjunto de los coeficientes espectrales medios a corto plazo f_{mean}(i), i=1,..., M, y basado en los parámetros del decodificador genera el ruido de bienestar. La operación de generación de ruido de bienestar sobre el lado de recepción es similar a la decodificación de voz, excepto que los parámetros son utilizados a una velocidad inferior significativamente (por ejemplo, una vez cada 480 milisegundos, como en los canales GSM FR y EFR), y no se recibe señal de excitación desde el codificador de voz. Durante la decodificación de voz, se obtiene la excitación sobre el lado de recepción desde un libro de códigos que contiene una pluralidad de posibles secuencias de excitación, y un índice para el vector de excitación particular en el libro de códigos es transmitido junto con los otros parámetros de codificación de voz. Para una descripción detallada de la decodificación de voz y el uso de referencia de los libros de código puede hacerse referencia, por ejemplo, a la Patente US Nº 5.327.519, titulada "Pulse Pattern Excited Linear Prediction Voice Coder", por Jari Hagqvist, Kari Järvinen, Kari-Pekka Estola, y Jukka Ranta; que debería leerse en unión con este documento.
No obstante, durante la generación de ruido de bienestar, no se transmite el índice al libro de códigos, y, se obtiene la excitación en lugar de un número aleatorio o generador de excitación (RE) 110. El generador RE 110 genera vectores de excitación 114 que tienen un espectro plano. Los vectores de excitación 114 son escalados entonces por la ganancia de excitación media g_{mean}, en la unidad de escala 115, de forma que su energía se corresponde con la ganancia media de la excitación 104 sobre el lado de transmisión. Se introduce entonces una secuencia de excitación aleatoria escalada resultante 111 al filtro de síntesis de voz 112 para generar la señal de salida del ruido de bienestar 113. Los coeficientes espectrales medios a corto plazo f_{mean}(i) son utilizados en el filtro de síntesis de voz 112.
La figura 1c ilustra el espectro asociado con la señal en diferentes partes del decodificador de la técnica anterior de la figura 1b. El generador RE 110 produce las secuencias de excitación del número aleatorio 114 (y la excitación escalada 111) que tienen un espectro plano. Este espectro es mostrado por la curva A. El filtro de síntesis de espectro 112 modifica entonces la excitación para producir un espectro no plano como se muestra en la curva B.
Como se describió anteriormente, existen varios problemas con respecto a las técnicas de generación de ruido de bienestar convencionales. Estos problemas incluyen el desajuste entre la excitación aleatoria y la excitación correcta u óptima que da lugar al ruido de bienestar generado en el lado de recepción que suena diferente del ruido de fondo real en el lado de transmisión. Es un objeto de esta invención reducir o eliminar estos problemas.
Esta invención aborda el problema de generar ruido de bienestar durante la transmisión discontinua para reducir al mínimo una pérdida de la calidad de la señal debido al uso de transmisión discontinua. De acuerdo con la invención, están previstos un método de acuerdo con la reivindicación 1 y un aparato de acuerdo con la reivindicación 21.
Las formas de realización de esta invención proporcionan los métodos de generación de ruido de bienestar que son capaces de caracterizar mejor el ruido de fondo, y que proporcionan adicionalmente una calidad mejorada del ruido de bienestar y una calidad mejorada de la transmisión durante la transmisión discontinua.
Las formas de realización de esta invención proporcionan una técnica de generación de ruido de bienestar que elimina o reduce al mínimo la generación de ruido de bienestar no representativo, y que emplea un tiempo promedio reducido.
De acuerdo con una forma de realización preferida de esta invención, todos o un número predeterminado de los parámetros de codificación mal acondicionados dentro de un periodo promediado son eliminados, o sustituidos mediante la aplicación de un método de substitución por la media, cuando son promediados los parámetros. En esta forma de realización de la invención, son ejecutadas las etapas de medición de las distancias de los parámetros de codificación de voz entre sí entre las tramas individuales dentro de un periodo promediado, ordenado estos parámetros de acuerdo con las distancias medidas, encontrando los parámetros que presentan las mayores distancias con respecto a otros parámetros dentro del periodo promediado, y, si las distancias exceden un umbral predeterminado, sustituir estos parámetros con un parámetro que tiene una distancia medida más pequeña (es decir, un valor medio) respecto a los otros parámetros dentro del periodo promediado. El parámetro de valor medio es considerado por tener un valor que es la representación exacta de las características del ruido de fondo entre los parámetros dentro del periodo promediado. Después de este procedimiento, el promedio de los parámetros de codificación de voz puede realizarse de cualquier manera deseada. Adicionalmente, la enseñanza de esta forma de realización de la invención no cambia el modo en el que se reciben los parámetros CN y se utilizan sobre el lado de recepción del sistema DTX.
Adicionalmente, para eliminar los parámetros CN mal acondicionados del periodo promediado, y mejorar así la calidad del ruido de bienestar, esta forma de realización de la invención proporciona otras ventajas. Por ejemplo, en los sistemas DTX de la técnica anterior, se requiere un periodo promediado más largo que debe utilizares con el fin de reducir el efecto de los parámetros mal acondicionados en el promedio. EL uso de esta invención permite de forma beneficiosa el uso de un periodo promediado más corto que en los sistemas de DTX de la técnica anterior, puesto que se reduce el efecto de los parámetros mal acondicionados en la operación de promedio. Además, en los sistemas DTX de la técnica anterior, se requiere un periodo de pausa más largo debido l periodo promediado más largo, incrementando así la actividad del canal. El periodo promediado más corto hecho posible por esta forma de realización de la invención, permite también que sea reducido el periodo de pausa DTX, y así se reduce la actividad del canal. Adicionalmente, en los sistemas DTX de la técnica anterior, debido al periodo promediado más largo empleado, se requiere una cantidad significativa de memoria estática por el algoritmo de promedio CN. Una ventaja adicional del periodo promediado más corto alcanzado por esta invención es una reducción en una cantidad de memoria estática requerida por el algoritmo de promedio CN.
Las formas de realización ejemplares de la invención se describen de aquí en adelante con referencia a los dibujos que acompañan, en los que:
La figura 1a es un diagrama de bloques de circuito convencional para generar parámetros de ruido de bienestar en el lado de transmisión.
La figura 1b es un diagrama de bloques de un decodificador convencional en el lado de recepción que es utilizado para generar ruido de bienestar.
La figura 1c ilustra el espectro asociado con la señal en diferentes partes del decodificador de la técnica anterior de la figura 1b.
La figura 1d ilustra más detalladamente los bloques de promedio mostrados en la figura 1a.
La figura 2a es un diagrama de bloques de circuito para generar parámetros de ruido confort en el lado de transmisión.
La figura 2b es un diagrama de bloques de un decodificador en el lado de recepción que es utilizado para generar el ruido de bienestar.
La figura 2c ilustra el espectro asociado con el decodificador de la figura 2b.
La figura 3a es un diagrama de bloques de una segunda forma de realización de circuitos para generar los parámetros de ruido de bienestar en el lado de transmisión.
La figura 3b es un diagrama de bloques de una segunda forma de realización del decodificador en el lado de recepción.
Las figuras 4 y 5 son cada una de ellas un diagrama de bloques de circuitos para evaluar los parámetros de ruido de bienestar en el lado de transmisión de un sistema de comunicaciones digitales DTX de acuerdo con las formas de realización de esta invención.
La figura 6 es un diagrama de bloques de un codificador de voz convencional.
Las figuras 7 y 8 son diagramas de sincronización que ilustran la salida del codificador de voz convencional de la figura 6.
La figura 9 es un diagrama de bloques de un decodificador de voz convencional, todos ellos son útiles en la explicación del decodificador de voz mostrado en la figura 10, que ilustra una forma de realización adicional de esta invención.
Las figuras 11a-11g ilustran respuestas de frecuencia ejemplares del filtro RESC.
La figura 12 ilustra una estación móvil adecuada para poner en práctica esta invención, mientras que la Figura 13 ilustra el terminal móvil acoplado a una estación de base de un sistema de comunicación inalámbrico que es adecuado también para poner en práctica esta invención.
La figura 14 es un diagrama de sincronización que ilustra un procedimiento pausa normal, donde el N_{transcurrido} indica un número de tramas transcurridos desde el último caso de parámetros de ruido de bienestar actualizados (CN), y donde N_{transcurrido} es igual o mayor de 24.
La figura 15 es un diagrama de sincronización que ilustra la manipulación de las ráfagas de voz cortas, donde N_{transcurrido} es menor de 24.
Se realizó previamente una descripción de una técnica convencional tanto para codificación como decodificación de ruido de bienestar. Se hace referencia ahora a las figuras 2a-2c para mostrar una primera forma de realización de circuitos y un método de acuerdo con esta invención. En las figuras 2a y 2b, estos elementos que aparecen también en las figuras 1a y 1b son numerados, por consiguiente.
Hay que indicar, en primer lugar, que el "periodo promediado SID" es una frase relacionada con GSM, mientras que el "periodo promediado de ruido de bienestar" o "periodo promediado CN" es un IS-641, Rev. A es una frase relacionada. Para los fines de esta invención, estas dos frases pueden utilizarse de forma intercambiable en la siguiente descripción. De igual modo, pueden utilizarse de forma intercambiable las frases "trama SID" y "mensaje de parámetro de ruido de bienestar" o "mensaje del parámetro CN".
En la figura 2a, se muestra un diagrama de bloques del aparato para producir parámetros de ruido de bienestar en el lado de transmisión. Las nuevas operaciones en este diagrama de bloques del aparato son separadas de las conocidas en la técnica anterior por una línea de trazos 204.
La señal residual 104 emitida desde el filtro inverso 103 es sometida a un análisis adicional (tal como análisis LPC) para producir otro conjunto de coeficientes de filtro. El segundo análisis, que es referido aquí como excitación aleatoria (RE), el análisis LPC 200, es típicamente de un grado menor que el análisis LPC llevado a cabo en el bloque 101. Se obtienen los parámetros de control espectral de excitación aleatoria (RESC) r_{mean}(i), i=1,..., R, mediante el promedio de los parámetros espectrales 201 a partir del bloque de análisis RE LPC 200 sobre varios tramas consecutivos en el bloque de promedio 203. Los parámetros RESC caracterizan el espectro de la excitación.
Debería indicarse que los parámetros RESC no son un subconjunto de los parámetros de codificación de voz, sino que son generados y utilizados solamente durante la generación de ruido de bienestar. Los técnicos de la invención han encontrado que el análisis LPC de primer o segundo orden es suficiente para generar los parámetros RESC (R=1 ó 2). No obstante, pueden utilizarse también los modelos espectrales diferentes al modelo de todos los polos de la técnica LPC. El promedio puede llevarse a cabo alternativamente por el bloque del análisis RE LPC 200 haciendo el promedio de los coeficientes de auto-correlación dentro del cálculo del parámetro LPC, o por cualquier otra técnica de promedio adecuada dentro del cálculo del coeficiente LPC. El periodo promediado para los parámetros RESC puede ser igual al utilizado para otros parámetros CN, pero no está limitado solamente al mismo promedio. Por ejemplo, se ha encontrado que puede ser ventajoso el promedio más largo que se utiliza para los parámetros CN convencionales, Por tanto, en lugar de utilizar un periodo promediado de siete tramas, puede ser preferido un periodo promediado más largo (por ejemplo, de 10-12 tramas).
Antes de calcular la ganancia de excitación, la señal residual-LPC 104 es alimentada a través de un segundo filtro inverso H_{RESC}(z) 202. Este filtro produce una señal residual controlada por espectro 205 que tiene generalmente un espectro más plano que la señal residual LPC 104. El filtro inverso H_{RESC}(z) del control espectral de excitación aleatoria (RESC) puede ser de forma de un filtro todo cero (pero no limitado solamente a esta forma):
(2)H_{RESC}(z)=1-\sum\limits^{R}_{i=1}b(i)z^{-1},
La ganancia de excitación es calculada a partir de la señal residual aplanada por espectro 205. De otra manera, las operaciones en la figura 2a son similares a las descritas anteriormente con respecto a la figura 1a.
Haciendo referencia a hora a la figura 2b, se muestra un diagrama de bloques del decodificador en el lado de recepción que es utilizado para generar el ruido de bienestar de cuerdo con la presente invención. En el decodificador, la excitación 212 está formada generando, en primer lugar, la secuencia de excitación de ruido blanco 114 con el generador de excitación aleatorio 110, que es escalado entonces por g_{mean} en el bloque de escala 115.
La secuencia de ruido plano de forma espectral 111 es procesada entonces en un filtro 211 de control espectral de excitación aleatoria (RESC) que produce una excitación que tiene un contenido espectral correcto. El filtro de control espectral RE 211 realiza la operación inversa respecto al filtro inverso RESC 202 empleado en el codificador de la figura 2a. Utilizando el filtro inverso RESC de la ecuación (2) en el lado de transmisión, el filtro de control espectral RE 211 utilizado en el lado de recepción es de la forma de
(3)1/H_{RESC}(z)= \frac{1}{1-\sum\limits^{R}_{i=1}b(i)z^{-1}}
Los parámetros RESC r_{mean}(i), i=1,..., R que definen los coeficientes de filtro b(i), i=1,..., R son transmitidos como parte de los parámetros CN al lado de recepción, y son utilizados en el filtro de control espectral RE 211, de forma que la excitación para el filtro de síntesis 112 es ponderada de forma espectral adecuadamente, y así no es generalmente plana de forma espectral.
Los parámetros RESC r_{mean}(i), i=1,..., R pueden ser iguales a los coeficientes del filtro b(i), i=1,..., R, o pueden utilizar alguna representación de otro parámetro que permita una cuantificación eficiente para la transmisión, tal como coeficientes LSP. Las figuras 11a-11g ilustran las respuestas de frecuencia ejemplar del filtro RESC 211.
En resumen, el generador de excitación CN 210 genera una excitación aleatoria espectralmente plana en el generador RE 110. La excitación espectralmente plana es entonces escalada adecuadamente por el escalador de ganancia medio 115. Para producir el espectro correcto para el ruido de bienestar, y evitar un desajuste entre el espectro del ruido de bienestar y el del ruido de fondo, se alimenta la excitación aleatoria a través del filtro de control espectral RE 211. La excitación controlada de forma espectral 212 es utilizada entonces en el filtro de síntesis de voz 112 para producir el ruido de bienestar que tiene un ajuste mejorado con respecto al espectro del ruido de fondo que está presente en el lado de transmisión.
Los parámetros RESC no son un subconjunto de los parámetros de codificación de voz que son utilizados durante el procesamiento de señales de voz, sino que en su lugar son calculados solamente durante el cálculo de ruido de bienestar. Los parámetros RESC son calculados y transmitidos solamente para los fines de generar excitación mejorada para el ruido de bienestar durante las pausas de voz. El filtro inverso RESC 202 en el codificador y el filtro RESC 211 en el decodificador son utilizados solamente para los fines de control del espectro de la excitación aleatoria.
La figura 2c ilustra el espectro de ciertas señales dentro del decodificador de la figura 2b durante la generación de ruido de bienestar. El generador RE 110 produce las secuencias de número aleatorio que tienen el espectro plano mostrado en la curva A. Este espectro es idéntico al mostrado en la curva A de la figura 1c. Las señales 114 y 111 tienen ambas este espectro plano, siendo indicado que la escala de ganancia que se produce en el bloque 115 no afecta a la configuración del espectro. La secuencia de ruido blanco 111 es alimentada entonces a través del filtro de control de espectro RE 211 para producir la excitación 212 al filtro de síntesis LPC. La secuencia de excitación mejorada 212 tiene generalmente un espectro no plano (curva C), y el efecto de este espectro no plano es observado en el espectro de la señal de salida 113 del filtro de síntesis 112 (curva D). La secuencia de excitación 212 puede ser del tipo de paso bajo o de paso alto, puede mostrar un contenido de frecuencia más sofisticado (dependiendo del grado del filtro RESC). El control de espectro es determinado por los parámetros RESC, que son calculados en el lado de transmisión y son transmitidos como parte del ruido de bienestar al lado de recepción, como se describió anteriormente.
Contrastando la figura 3a con la figura 2a, puede observarse que el cálculo de la ganancia de excitación se lleva a cabo desde la señal residual LPC 104, y no desde la señal residual del filtro inverso RESC 202. El filtro inverso RESC 202 no es requerido en la figura 3a, y puede eliminarse. El decodificador en el lado de recepción para uso con el codificador de la figura 3a se muestra en la figura 3b. Cuando se compara con la figura 2b, puede indicarse que la escala (bloque 115) de la excitación se mueve hasta la salida del filtro de control de espectro RE 211. De otro modo, la operación del codificador y decodificador de las figuras 3a y 3b es similar a la mostrada en las figuras 2a y 2b.
Haciendo referencia a la figura 4, se muestra un diagrama de bloques de circuitos para evaluar los parámetros de ruido en el lateral TX de acuerdo con una forma de realización de esta invención. Esta forma de realización considera los problemas mencionados anteriormente que surgen cuando existe un solo trama o un número pequeño de tramas dentro de un periodo promediado para el que algunos o todos los parámetros de codificación de voz ofrecen una caracterización pobre del ruido de fondo típico. Las operaciones de acuerdo con esta forma de realización de la invención están separadas de las conocidas de la técnica anterior por las líneas de trazos 300 y 310. De acuerdo con esta forma de realización de la invención, los parámetros de codificación de voz, que son memorizados temporalmente en el bloque 107a y 108a, son sometidos a un proceso de sustitución de umbral medio antes de ser aplicados a los bloques de promedio 107 y 108 para calcular la ganancia de excitación media g_{mean} y los coeficientes de espectro medio a corto plazo f_{mean} (i). En este proceso, son substituidos los parámetros dentro del periodo promediado que tienen valores no típicos del ruido de fondo, si se cumplen las condiciones específicas por los valores de parámetro que son considerados como típicos del ruido de fondo real, es decir, los valores medianos.
En primer lugar, se describen las operaciones indicadas por el bloque 300 que son realizadas en los parámetros de ganancia de excitación de valor escalar g antes del promedio en el bloque 107. El conjunto de los valores de ganancia de excitación 107b memorizado temporalmente en el bloque 107a en el periodo promediado son enviados al bloque 301, en el que son ordenados de acuerdo con sus valores. Cada uno de los valores de ganancia de excitación tiene su propio índice dentro del conjunto. El conjunto ordenado de parámetros de ganancia 302 es considerado con un bloque de substitución por la media 303, en el que estos valores de ganancia de excitación L se diferencian de la mayoría del valor medio, mientras que la diferencia excede el valor umbral predeterminado, son sustituidos por el valor medio del conjunto de parámetros. Son calculadas las diferencias entre cada valor de parámetro individual y el valor medio en el bloque 304, y los índices de los valores de ganancia de excitación para los que el valor absoluto de esta diferencia calculada excede un umbral, son comunicados como la señal 305 hasta el bloque de substitución por la media 303.
La longitud N del periodo promediado es preferentemente un número impar. En este caso, el mediano del conjunto ordenado es su elemento ((N+1)/2). La variable L, que determina el número de los parámetros sustituidos, puede asumir un valor entre 0 y N-1. L puede ser también un valor predeterminado (es decir, una constante).
Si existen valores de ganancia de excitación individual, de forma que la diferencia entre el valor de ganancia de excitación y el valor medio exceda el umbral predeterminado, el selector 307 es conmutado hasta la posición en la que los valores de ganancia de excitación 309 para el bloque de promedio 107 se obtienen a partir del bloque de substitución por la media 303 como la señal 308. No obstante, si para cada uno de los valores de ganancia de excitación, la diferencia entre el valor de ganancia y el valor medio no excede el umbral predeterminado, el selector 307 es conmutado de forma que los parámetros 309 introducidos al bloque de promedio 107 se obtienen directamente desde el bloque de memoria temporal 107a.
El estado de conmutación del selector 307 es controlado por el bloque umbral 304 con la señal 306.
A continuación, las operaciones del bloque 310 se describen con respecto a los coeficientes LSP f(k), k=1,..., M, antes del promedio en el bloque 108. El conjunto de los coeficientes LSP 108b memorizados temporalmente en el bloque 108a durante el periodo promediado son enviados al bloque 311. La distancia espectral de los coeficientes LSP f_{i}(k) de la trama i en el periodo promediado, respecto de los coeficientes LSP f_{j}(k) de la trama j en el periodo promediado, es aproximada de acuerdo con la siguiente ecuación:
(4)\Delta R_{ij}=\sum\limits^{M}_{k=1}(f_{i}(k)-f_{j}(k))^{2}
donde M es el grado del modelo LPC, y f_{i}(k) es el parámetro LSP k de la trama i en el periodo promediado.
Para encontrar la distancia espectral \DeltaS_{i} de los coeficientes LSP f_{i}(k) de la trama i respecto a los coeficientes LSP de todas las demás tramas j=1,...,N, i\neqj, dentro del periodo promediado de la longitud N, se calcula la suma de las distancias espectrales \DeltaR_{ij}, como sigue:
(5)\Delta S_{i}=\sum\limits^{N}_{j=1,j\neq i}\Delta R_{ij},
para todo i = 1,...,N \DeltaR_{ij} = 0 (es decir, la distancia de un parámetro de sí mismo es cero). Se llevan a cabo las operaciones expresadas en las ecuaciones (4) y (5) en el bloque 311.
La distancia espectral puede aproximarse utilizando un número de otras representaciones del filtro LPC, por ejemplo, ver A.H. Gray, Jr. y J.D. Markel, "Distance measures for speech processing", IEEE Transactions on Acoustics, Speech, and Signal Processing, Vol. 24, pp. 380-391, 1976. Además, pueden utilizarse "Immittance Spectral Pairs" (ISP) de forma similar a las parejas espectrales de línea, por ejemplo, ver Y. Bistritz and S. Peller, "Immitance spectral pairs" (ISP) para codificación de voz, en Proceedings of IEEE International Conference on Acoustics, Speech, and Signal Processing , Minneapolis, Minnesota, Vol. 2, pp. 9-12, 27-30 de Abril de 1993.
Después de hallar las distancias espectrales \DeltaS_{i} en el bloque 311 para cada uno de los vectores LSP f_{i} dentro del periodo promediado, estas distancias 312 son enviadas al bloque 313. En el bloque de ordenación 313, las distancias espectrales son ordenadas de acuerdo con sus valores. Cada uno de los valores de distancia espectral está relacionado por un índice a un vector LSP dentro del periodo promediado. El vector f_{i} que presenta la menor distancia \DeltaS_{i} dentro del periodo promediado i=1,2,..., N es considerado como el vector medio f_{med} del periodo promediado. Su distancia se designa como \DeltaS_{med}.
El conjunto de los vectores de coeficiente LSP f_{i} dentro del periodo promediado son ordenados en el bloque 313 de acuerdo con la ordenación encontrada para las distancias espectrales. Este conjunto ordenado de vectores LSP 314 obtenidos del bloque 313 es enviado al bloque de substitución por la media 315. En el bloque 315, los vectores
\hbox{ P(O \leq P \leq N-1) }
LSP f_{i} son sustituidos por el f_{med}mediano. Los índices de estos vectores P son determinados comparando \DeltaS_{i} para i=1, 2,..., N con el \DeltaS_{med} mediano en el bloque 316. De ahí que los índices de f_{i}, para los que \DeltaS_{i} - \DeltaS_{med} es mayor que un umbral, son comunicados por la señal 317 al bloque de substitución por la media 315.
Si la diferencia \DeltaS_{i} - \DeltaS_{med} es mayor que un umbral para cierto i= 1,2,...,N, el selector 319 es conmutado en una posición tal que el bloque de promedio 108 recibe los parámetros 321 desde el bloque de substitución por la media 315 como la señal 320.
No obstante, si \DeltaS_{i}-\DeltaS_{med} es más pequeño que un umbral para todo i=1,2,...,N, el selector 319 está conmutado a la posición en la que la señal de entrada 321 al bloque de promedio 108 se obtiene directamente desde el bloque de memoria temporal 108(a) a través de la señal 108(b).
El selector 319 es controlado por el bloque umbral 316 con la señal 318.
La figura 5 muestra otra forma de realización de la invención. En esta forma de realización, las operaciones de acuerdo con esta invención se distinguen a partir estas conocidas de la técnica anterior por la línea de trazos 400. Aunque en la forma de realización mostrada en la figura 4, y descrita anteriormente, se realizan las operaciones medianas independientemente para los valores de ganancia de excitación g y los vectores LSP f_{i}, en la forma de realización de la figura 5, estos dos conjuntos de parámetros son manejados juntos como sigue.
Se determina que los parámetros en una trama individual a sustituir por los valores medianos, entonces, tanto el valor de ganancia de excitación g como los vectores LSP f_{i} de la trama, son sustituidos por los parámetros respectivos de la trama que contiene los parámetros medianos.
Con el fin de encontrar la ordenación de las tramas para la substitución por la media, la ecuación (4) de la distancia aproximada \DeltaR_{ij} entre los parámetros de la trama i, la trama j del periodo promediado es revisado para tener en cuenta tanto el valor de ganancia de excitación g como el vector LSP f_{i} como sigue:
(6)\Delta T_{V}=\sum\limits^{M}_{k=1}(f_{i}(k)-f_{j}(k))^{2}+w(g_{i}- g_{j})^{2},
donde M es el grado del modelo LPC, f_{i}(k) es el parámetro LSP k de la trama i del periodo promediado, y g_{i} es el parámetro de ganancia de excitación de la trama i.
Para encontrar la distancia \DeltaS_{i} de los parámetros de trama i, para todos i=1,..., N, hasta los parámetros de todas las demás tramas j= 1,...,N, i\neqj dentro del periodo promediado de longitud N, se aplica la ecuación (5) después de calcular \DeltaT_{ij}. La distancia \DeltaT_{ij} es utilizada entonces en lugar de la distancia \DeltaR_{ij} en la ecuación (5). Los procedimientos expresados por las ecuaciones (5) y (6) se llevan a cabo en el bloque 401. El factor de ponderación w es elegido para obtener un compromiso preferido subjetivamente entre la realización de la substitución por la media de acuerdo con los valores de ganancia de excitación o de acuerdo con las distancias espectrales. El compromiso preferido subjetivamente se encuentra llevando a cabo los ensayos con usuarios típicos.
Después, las distancias \DeltaS_{i} han sido encontradas en el bloque 401 para cada uno de las tramas dentro del periodo promediado, estas distancias 402 son enviadas al bloque de ordenación 403. En el bloque de ordenación 403, las distancias son ordenadas de acuerdo con sus valores. Cada una de las distancias está relacionada por un índice a una trama dentro del periodo promediado. La trama que presenta la menor distancia \DeltaS_{i} dentro del periodo promediado i=1,2,..., N es considerado como la trama mediano del periodo promediado, con parámetros g_{med} y f_{med}. Su distancia es designada como \DeltaS_{med}.
Los valores de ganancia de excitación que deben ser ordenados en el bloqueo 403 son enviados al bloque por la señal 107b desde la memoria temporal 107a, y los coeficientes LSP son enviados al bloque por la señal 108b desde la memoria intermedia 108a. Como se indicó anteriormente, el conjunto de parámetros dentro del periodo promediado son ordenados en el bloque 403 de acuerdo con la ordenación encontrada para sus distancias espectrales \DeltaS_{i}. El conjunto de parámetros ordenado obtenido a partir del bloque 403 es enviado como señales 404 y en 405 al bloque de substitución por la media 406. En el bloque 406, los parámetros g_{i} y f_{i} de tramas L(O\leqL\leqN-1) son sustituidos por los parámetros g_{med} y f_{med} de la trama media. Los índices de estos vectores L son determinados comparando \DeltaS_{i} para i=1,2,...,N con el \DeltaS_{med} mediano en el bloque 407, y en comunicación con el bloque de substitución por la media 406 como la señal 408. Si la diferencia \DeltaS_{i}-\DeltaS_{med} es mayor que un umbral en el bloque 407, los parámetros g_{i} y f_{i} son sustituidos por g_{med} y f_{med} en el bloque de substitución por la media 406. El valor de L puede estar unido por los valores mínimo y máximo predeterminado.
Si la diferencia \DeltaS_{i}-\DeltaS_{med} es mayor que un umbral para i=1,2,..., N, el selector 410 es conmutado de forma que el bloque de promedio 108 recibe los parámetros 321 desde el bloque de substitución por la media 406 como la señal 411, y el bloque de promedio 107 recibe los parámetros 309 desde el bloque de substitución por la media 406 como la señal 412. No obstante, si \DeltaS_{i}-\DeltaS_{med} es más pequeño que un umbral para todo i=1,2,..., N, el selector 410 está conmutado de forma que la señal de entrada 321 al bloque de promedio 108 se obtiene directamente desde el bloque de memoria temporal 108a a través de la señal 108b, y la señal de salida 309 hasta el bloque de promedio 107 se obtiene directamente desde el bloque de memoria temporal 107a a través de la señal 107b. El selector 410 es controlado por el bloque umbral 407 con la señal 409.
Además de restar la distancia mediana de una distancia individual (es decir, calculando \DeltaS_{i}-\DeltaS_{med}), las diferencias entre cada distancia individual y la distancia mediana pueden calcularse en los bloques 316 y 407, por ejemplo, dividiendo una distancia individual por la distancia mediana (es decir, calculando \DeltaS_{i}/\DeltaS_{med}). Este puede ser un método preferido en la mayoría de los casos, puesto que encuentra una desviación relativa o normalizada de una distancia individual desde la distancia mediana, independiente de los valores absolutos de las distancias \DeltaS_{i} y \DeltaS_{med}.
Antes de describir ahora una forma de realización adicional de esta invención, se hace referencia a la figura 6 que es un diagrama de bloques simplificado del sistema de codificador de voz DTX del lado de transmisión (TX). La señal de entrada 601 de un convertidor analógico-a-digital 600 es procesada trama por trama en el codificador de voz 602. Como antes, la longitud de la trama es típicamente de 20 mseg. La frecuencia de muestreo de la señal de voz 601 es generalmente de 8 kHz. El codificador de voz 602 codifica trama por trama la voz de entrada en un conjunto de parámetros 603 que son enviados al subsistema de radio 611 de la unidad de radio móvil digital para la transmisión del lado de recepción (RX).
El funcionamiento del mecanismo DTX está controlado de forma indirecta por una detección de actividad de voz (VAD) realizada sobre el lateral TX. La función básica de la VAD 604 es distinguir entre ruido con voz presente y ruido sin voz presente. La VAD 604 funciona de forma continua para evaluar si la señal de entrada contiene voz o no contiene voz. La operación de la VAD 604 está basada en el codificador de voz 602 y sus variables internas 605. La salida de la VAD 604 es un indicador de VAD binario 606 que es igual a uno cuando está presente voz, y que es igual a cero cuando la voz no está presente. El VAD 604 funciona sobre una base de trama a trama, como se especifica, por ejemplo, en GSM 06.82.
El gestor del codificador de voz DTX 612 pasa continuamente tramas de tráfico, marcados individualmente por un indicador SP binario 607, al subsistema de radio 611. El indicador SP 607 indica al subsistema de radio 611 si una trama de tráfico que ha pasado por el gestor DTX 612 es una trama de voz (indicador SP = "1") o un denominador trama Descriptor Silenciador (SID) (o mensaje de Parámetro de Ruido de bienestar) indicador SP = "O"). El subsistema de radio 611 controla el esquema de las tramas para la transmisión en el interfaz hertziano, basado en el estado del indicador SP 607.
Un problema fundamental asociado con el uso precedente del DTX es que el ruido acústico de fondo, que es transmitido junto con la voz, puede desaparecer cuando se termina la transmisión por el interfaz hertziano, dando lugar a discontinuidades del ruido de fondo sobre el lateral RX. Puesto que puede producirse rápidamente la conmutación DTX, se ha encontrado que este efecto puede ser desagradable para el oyente. Esto es particularmente cierto en entornos con un nivel de ruido de fondo alto, tal como un vehículo. En el peor de los casos, este efecto puede dar lugar a que la voz sea inteligible.
Una solución actualmente preferida para este problema es generar, en el lateral RX, ruido sintético (es decir, ruido de bienestar) similar al ruido de fondo del lateral TX cuando se termina la transmisión. Como se describió anteriormente, los parámetros requeridos para la generación de ruido de bienestar son evaluados en el codificador de voz en el lateral TX (bloque 608 en la figura 6), y son transmitidos al lateral RX en las tramas SID antes de que se desconecte la transmisión de radio, y a una velocidad repetitiva baja después. Esto permite que el ruido de bienestar generado durante la inactividad de voz en el lateral RX se adapte a los cambios del ruido de fondo en el lateral TX.
Se ha encontrado que el ruido de bienestar de calidad buena subjetiva puede ser generado en el lateral RX si los parámetros de ruido de bienestar evaluados en el lateral TX representan, adecuadamente, el nivel y la envoltura espectral del ruido de fondo acústico. Estas características de ruido de fondo varían, con frecuencia, ligeramente en el tiempo, y por tanto, con el fin de obtener una buena representación, los parámetros del codificador de voz que describen el nivel y la envoltura espectral del ruido de fondo necesitan ser promediados sobre algunas tramas de voz. En los sistemas DTX de los codificadores de voz de régimen completo GSM y de régimen completo mejorado (ver GSM 06.31 y GSM 06.81), la longitud del periodo promediado SID es cuatro tramas de voz y ocho tramas de voz, de 20 milisegundos de duración, respectivamente.
Con el fin de evaluar y transmitir el primer trama SID que contiene los parámetros de ruido de bienestar al lateral RX al final de una ráfaga de voz, antes de la transmisión, se desconecta antes de la transmisión, se introduce el periodo de pausa mencionado anteriormente. El periodo de pausa es un periodo durante el cual se ha detectado la inactividad de voz por la VAD 604 (es decir, indicador de VAD 606 = "0"), pero la transmisión de tramas de voz no se ha desconectado todavía, (es decir, indicador SP 607 = "1"). La referencia a este respecto puede hacerse también a la figura 7. Durante el periodo de pausa, puesto que VAD 604 ha detectado la inactividad de voz, se garantiza que las tramas de voz contienen cualquier ruido (y no voz), y por tanto, que estos tramas de pausa pueden utilizarse para el promedio de parámetros de codificador de voz para evaluar los parámetros de ruido de bienestar.
La longitud del periodo de pausa es determinada por la longitud del periodo promediado SID, es decir, la longitud del periodo de pausa debe ser lo suficientemente larga para completar el promedio de los parámetros antes de que sean transmitidos los parámetros de ruido de bienestar resultantes en una trama SID. En el sistema DTX del codificador de voz de régimen completo GSM, la longitud del periodo de pausa es igual a cuatro tramas (la longitud del periodo promediado SID), puesto que la técnica de evaluación de ruido de bienestar utiliza solamente los parámetros procedentes de las tramas previos para hacer disponible la trama SID actualizado. En el sistema DTX, del codificador de voz de régimen completo mejorado GSM, la longitud del periodo de pausa es igual a siete tramas (la longitud del periodo promediado SID menos uno), puesto que los parámetros del octavo trama del periodo promediado SID pueden obtenerse a partir del codificador de voz mientras se procesa el primer trama SID. La figura 7 ilustra los conceptos del periodo de pausa y los periodos de promedio SID en el sistema DTX del codificador de voz de régimen completo mejorado GSM.
Al final del periodo de pausa, el primer trama SID es transmitido, y el algoritmo de evaluación de ruido de bienestar continúa evaluando las características del ruido de fondo y pasa las tramas SID actualizados al subsistema de radio 611 trama por trama, mientras que la VAD 604 continúa detectando la inactividad de voz. El gestor TX DTX 612 informa al algoritmo de evaluación de ruido de bienestar 608 de la terminación del periodo promediado SID utilizando un indicador 609. El indicador 609 es repuesto a "O", y es elevado a "1" cuando un cuando una trama SID actualizado debe pasar al subsistema de radio 611. Cuando el indicador 609 es elevado, el algoritmo de evaluación de ruido de bienestar 608 realiza el promedio de los parámetros para hacer disponible una trama SID actualizado para el subsistema de radio 611. Las tramas SID actualizados son enviados al subsistema de radio 611, así como escritos a un bloque de memoria SID 610, que memoriza la trama SID más reciente para uso posterior.
\newpage
Si, al final de la ráfaga de voz, han transcurrido menos de 24 tramas desde que se calculó la trama SID y pasó al subsistema de radio, entonces, el último trama SID es buscado repetidamente desde la memoria SID 610 y pasa hasta el subsistema de radio 611. Esto se produce hasta que esté disponible un nuevo trama SID actualizado, es decir, este proceso continúa hasta que se completa de nuevo el periodo promediado SID. Esta técnica reduce la actividad de transmisión en casos donde se interpretan los picos de ruido de fondo cortos como voz, puesto que no existe necesidad de insertar el periodo de pausa al final de la ráfaga de voz para poder calcular un nuevo trama SID.
La figura 8 muestra un ejemplo de la ráfaga de voz más larga posible sin pausa. El indicador binario 613 es utilizado para señalizar la memoria SID 610 cuando se memoriza el nuevo trama SID actualizado en la memoria SID 610, y cuando se envía la trama SID actualizado más reciente desde la memoria SID 610 al subsistema de radio 611. La memoria SID 610 determina si se memoriza o envía la trama SID durante cada trama cuando el indicador SP 607 es un "0".
El indicador binario 614 es necesario también, en el sistema DTX del codificador de voz de velocidad completa mejorada GSM para informar del algoritmo de evaluación de ruido aproximadamente al final del periodo de pausa. El indicador 614 es repuesto normalmente a "0", y es elevado a "1" en una duración de una trama cuando debe enviarse el primer trama SID después de una ráfaga de voz, si es precedido por el periodo de pausa.
La figura 9 es un diagrama de bloques del decodificador de voz del lado de recepción (RX) del sistema DTX. El conjunto de entrada de los parámetros del codificador de voz 701 procedente del subsistema de radio 700 de la unidad de radio móvil digital es procesado trama por trama en el decodificador de voz 702 para sintetizar una señal de señal 703 que es proporcionada a un convertidor digital a analógico 704. El convertidor digital-a-analógico 704 genera una señal audio para el usuario oyente.
El sistema RX DTX recibe del subsistema de radio el indicador SP binario 705, que refleja la operación del indicador SP del lado TX, es decir, el indicador SP = "1" cuando se recibe la trama de voz, y el indicador SP = "0" cuando o bien se recibe la trama SID, o se termina la transmisión. El indicador binario 706, recibido desde el subsistema de radio 700, informa al algoritmo de generación de ruido de bienestar 707 de la existencia de un nuevo trama SID recibido, es decir, el indicador es repuesto normalmente a "0", y es elevado a un "1" cuando el indicador SP 705 es "0" y se recibe un nuevo trama SID.
Cuando el indicador SP 705 = "0", es decir, la transmisión discontinua está activa, el bloque de generación de ruido de bienestar 707 del decodificador de voz 702 genera el ruido de bienestar basado en la representación de las características del ruido de fondo en el lateral TX, como se recibe en las tramas SID. Las tramas SID actualizados son recibidos a una velocidad baja repetitiva durante la transmisión discontinua, y los parámetros de ruido de bienestar decodificados don interpolados entre las tramas SID actualizados para proporcionar transiciones uniformes en las características del ruido de bienestar.
En el sistema DTX del codificador de voz de régimen completo GSM, cuando debe calcularse un nuevo trama SID actualizado y debe enviarse al subsistema de radio 611 (Figura 6), los parámetros que describen las características (el nivel y el espectro) el ruido de fondo son promediados en un periodo promediado SID y cuantificados de forma escalar, utilizando los mismos esquemas de cuantificación como se utiliza para cuantificar en el modo de codificación de voz normal. De igual modo, cuando una trama SID llega al decodificador de voz de régimen completo GSM 702, se decodifican los parámetros descriptores de silencio utilizando los mismos esquemas de des-cuantificación que los utilizados en el modo de decodificación de voz normal (por ejemplo, ver, GSM 06.12).
En el sistema DTX del codificador de voz de régimen completo mejorado GSM, los parámetros que describen el espectro del ruido de fondo (los parámetros LSP) son promediados en el periodo promediado SID cuando debe calcularse un nuevo trama SID, y el vector cuantificado que utiliza tablas de cuantificación de predicción que son utilizadas también para la cuantificación de estos parámetros en el modo de codificación de voz normal. En el decodificador 702, estos parámetros espectrales son des- cuantificados utilizando las mismas tablas de des-cuantificación de predicción que las utilizadas en el modo de decodificación de voz normal. Los parámetros que describen el nivel del ruido de fondo (la ganancia del libro de códigos fijo) son promediados en el periodo promediado SID cuando debe calcularse un nuevo trama SID, y cuantificarse utilizando la tabla de cuantificación de predicción escalar que es utilizada también para cuantificación de estos parámetros en el modo de codificación de voz normal. En el decodificador, estos parámetros de ganancia son des-cuantificados utilizando la misma tabla de des- cuantificación de predicción utilizada en el modo de decodificación de voz ordinario (ver GSM 06.62).
No obstante, la adaptación de los cuantificadores de predicción hace difícil emplear este tipo de esquema de cuantificación para cuantificar los parámetros de ruido de bienestar que se envían las tramas SID. Puesto que se termina la transmisión durante la inactividad de voz, no existe modo de mantener los elementos de predicción en el cuantificador y el des-cuantificador del codificador y decodificador, respectivamente, sincronizados en una base de trama por trama. No obstante, los valores del elemento de predicción para los cuantificadores puede evaluarse localmente en el codificador y decodificador del mismo modo que sigue. El LSP cuantificado y los parámetros de ganancia de libro de códigos fijo de los siete tramas de voz más recientes son memorizados localmente tanto en el codificador 602 como en el decodificador 702. Cuando el periodo de pausa al final de la ráfaga de voz ha finalizado, son promediados estos parámetros memorizados, Los parámetros promediados obtenidos, que son el vector de parámetro LSP de referencia f^{ref} y la ganancia de libro de códigos fijo de referencia g_{c}^{ref}, entonces, tienen los mismos valores tanto en el codificador 602 como en el decodificador 702, puesto que, debido a la cuantificación, están disponibles los mismos valores de ganancia de libro de códigos fijo y LSP cuantificados durante el modo de codificación de voz normal (suponiendo una transmisión libre de errores). Los valores promediados del vector de parámetro de referencia LSP f^{ref} y la ganancia de libro de códigos fijo de referencia g_{c}^{ref}, son entonces congelados hasta el siguiente momento en el que se produzca el periodo de pausa después de una ráfaga de voz, y se utilizan en lugar de los elementos de predicción normales en los algoritmos de cuantificación para cuantificación de los parámetros de ruido de bienestar.
Con referencia una vez más a la figura 9, un gestor RX DTX 708 recibe el indicador SP 705 como entrada, y emite el indicador binario 709, que es repuesto normalmente a "0", y que es ajustado a "1" para la duración de una trama cuando ha transcurrido el periodo de pausa después de una ráfaga de voz. El indicador 709 es requerido en el sistema DTX del decodificador de voz de régimen completo mejorado GSM 702 para informar del algoritmo de generación de ruido de bienestar 707 cuando se realice el promedio para actualizar el vector del parámetro de referencia LSP f^{ref} y la ganancia del libro de códigos fijo de referencia g_{c}^{ref} (ver GSM 06.62). Se describe un método para determinar el valor del indicador 709 en una solicitud patente Finlandesa presentada anteriormente FI953252, y en la Solicitud de Patente US correspondiente S.N. 08/672.932, presentada el 28 de Junio de 1996, y en la solicitud PCT "PCT/FI96/00369", que debería leerse en unión con este documento.
En resumen, en muchos codificadores de voz modernos, los parámetros de codificación de voz son cuantificados utilizando métodos de predicción. Esto implica que en el cuantificador, se hace un intento por predecir el valor que debe ser cuantificado tanto estrechamente como sea posible. En estos tipos de cuantificadores de predicción, la diferencia o el cociente entre el valor del parámetro real y el valor del parámetro pronosticado es cuantificado típicamente y enviado al lado de recepción. En el lado de recepción, el des-cuantificador correspondiente tiene un elemento de predicción similar al cuantificador. Como tal, el valor de parámetro cuantificado en el lateral TX puede reproducirse añadiendo o multiplicando la diferencia recibida o valor cociente, respectivamente, con el valor pronosticado.
En tales cuantificadores de predicción, el elemento de predicción se hace adaptable típicamente de forma que el resultado de la cuantificación se utiliza para actualizar el elemento de predicción después de cada cuantificación.
Los elementos de predicción del cuantificador y el des-cuantificador son ambos actualizados utilizando el valor reproducido del parámetro cuantificado, con el fin de mantener los elementos de predicción sincronizados.
La capacidad de adaptación de los cuantificadores de predicción hace difícil emplear el tipo de esquema de cuantificación para cuantificar los parámetros de ruido de bienestar que son enviados en las tramas SID. Puesto que se termina la transmisión durante cada inactividad, no existe modo de mantener los elementos de predicción en el cuantificador y el des-cuantificador del codificador 602 y el decodificador 702 sincronizados en una base de trama por trama.
No obstante, sería deseable poder emplear las mismas tablas de cuantificación para cuantificar los parámetros de ruido de bienestar, como se utilizan por los cuantificadores de predicción en el modo de codificación de voz ordinario. Esto requeriría que se realizase la predicción en un modo no adaptable durante la transmisión discontinua. Los elementos de predicción deberían tener valores tan próximos como sea posible a los valores de parámetro medio del ruido de fondo presente, con el fin de que los cuantificadores sean capaces de codificar las fluctuaciones en los valores del parámetro debido a los cambios en las características del ruido de fondo. Los mismos valores de predicción deberían estar disponibles preferentemente en el cuantificador y en el des-cuantificador.
Como se indica previamente, una técnica para obtener buenos valores pronosticados para cuantificar el ruido de bienestar que debe enviarse en las tramas SID es almacenar los valores de parámetro cuantificado en el modo de codificación de voz normal durante el periodo de pausa, y calcular una media de los valores del parámetro cuantificado al final del periodo de pausa. Los valores del elemento de predicción promediados son entonces congelados hasta que se produzca el siguiente periodo de pausa. No obstante, un problema con este método es que el decodificador de voz 702, en estas técnicas DTX que son similares a las de GSM, no conocen cuando existe un periodo de pausa al final de una ráfaga de voz.
Un aspecto de esta invención es, por tanto, proporcionar una técnica para informar al decodificador de voz 702 de la existencia de un periodo de pausa al final de la ráfaga de voz. Esto se alcanza, preferentemente, enviando la información del periodo de pausa como información secundaria en la trama SID (o mensaje de parámetro de ruido de bienestar) desde el codificador de voz 602 hasta el decodificador de voz 702.
Para ilustrar el método de acuerdo con este aspecto de la invención, se hace referencia a la figura 10. En la figura 10, el indicador binario 709 no es generado ya por el gestor RX DTX, sino que en su lugar es transmitido desde el codificador 602 y es recibido desde el canal de transmisión en el primer trama SID. El bloque del gestor RX DTX 708 no es requerido por tanto ya para los fines de des-cuantificación utilizando los métodos descritos en esta invención, puesto que el indicador 709 no es requerido para ser generador localmente en el decodificador 702. De acuerdo con este aspecto de la invención, el indicador 709 es elevado a "1" en el primer trama SID, si el primer trama SID está precedido por un periodo de pausa. Si el primer trama SID no está precedido por un periodo de pausa, el indicador 709 en el primer trama SID es repuesto a "0". En el segundo y adicionales tramas SID del periodo de inserción de ruido de bienestar, el indicador 709 es siempre repuesto a "0".
\newpage
Una ventaja de este aspecto de la invención es que no existe necesidad de que el gestor DTX del decodificador de voz 708 determine localmente la existencia del periodo de pausa al final de la ráfaga de voz. Esto elimina una parte de la carga de cálculo del decodificador de voz 702, y reduce el número de instrucciones del programa utilizadas por el gestor RX DTX 708.
Una ventaja adicional, relacionada con proporcionar el decodificador 702 la información referente a la existencia del periodo de pausa, es que es posible ahora re-inicializar los generadores de excitación de pseudo-ruido de forma síncrona en el codificador 602 y el decodificador 702, cada vez que finaliza un periodo de pausa.
Otra ventaja relacionada con proporcionar al decodificador 702 la información referente a la existencia del periodo de pausa es que puede realizarse la interpolación de los parámetros de ruido de bienestar recibidos de varias formas diferentes, dependiendo de si está presente o no el periodo de pausa al final de una ráfaga de voz, con el fin de reducir los cambios similares a pico de etapa percibida en el nivel o espectro de ruido de bienestar cuando se producen las ráfagas de voz cortas.
Antes de describir adicionalmente la operación de esta invención detalladamente, se hace referencia a las figuras 12 y 13 para ilustrar la estación móvil o terminal de usuario inalámbrico 10, tal como pero sin limitarse a un radioteléfono celular o un comunicador personal, que es adecuado para poner en práctica esta invención. La estación móvil 10 incluye una antena 12 para transmitir las señales y para recibir las señales desde un sitio de base o estación de base 30. La estación de base 30 es una parte de una red celular que puede incluir una función de Estación Base/Centro de Conmutación Móvil/Interconexión (BMI) 32 que incluye un centro de conmutación móvil (MSC) 34. El MSC 34 proporciona una conexión con enlaces de línea terrestre cuando la estación móvil 10 está implicada en una llamada. En el contexto de esta descripción, la estación móvil 10 puede referirse como el lado de transmisión y l estación base como el lado de recepción. La estación base 30 se supone que incluye receptores adecuados y decodificadores de voz para recibir y procesar los parámetros de voz codificados y también los parámetros de ruido de bienestar DTX, como se describe a continuación.
La estación móvil incluye un modulador (MOD) 14A, un transmisor 14, un receptor 16, un demodulador (DEMOD) 16A, y un controlador 18 que proporciona señales hasta y recibe señales desde el transmisor 14 y el receptor 16, respectivamente. Estas señales incluyen información de señalización de acuerdo con la norma de interfaz hertziano del sistema celular aplicable, y también la voz de usuario y/o los datos generados por el usuario. La norma de interfaz hertziano es asumida por esta invención por incluir una estructura de trama física y lógica, aunque no se pretende que la enseñanza de esta invención esté limitada a cualquier estructura específica, o para uso solamente con un IS-136 o estación móvil compatible similar, o para uso solamente en los sistemas de tipo TDMA. La norma de interfaz hertziano es asumida también para soportar un modo de operación DTX.
Debe entenderse que el controlador 18 incluye también los circuitos requeridos para ejecutar las funciones audio y lógica de la estación móvil. Por ejemplo, el controlador 18 puede estar compuesto de un dispositivo procesador de señales digitales, un dispositivo microprocesador, y varios convertidores analógico a digital, convertidores digital a analógico, y otros circuitos de soporte. Las funciones de control y de procesamiento de señales de la estación móvil son asignadas entre estos dispositivos de acuerdo con sus capacidades respectivas. El controlador 18 es asumido para los fines de esta descripción para incluir el codificador de voz necesario y otras funciones para ejecutar la generación de ruido de bienestar mejorado y métodos DTX y aparato de esta invención. Estas funciones pueden ejecutarse de forma completa en software, completamente hardware, o en una mezcla de hardware y software.
Una interfaz de usuario incluye un auricular o altavoz convencional 17, un transductor de voz tal como un micrófono convencional 19 en combinación con un convertidor A/D y un codificador de voz, una pantalla 20, y un dispositivo de entrada de usuario, típicamente un teclado 22, todos los cuales están acoplados al controlador 18. El teclado 22 incluye las teclas numérica convencional (0-9) y teclas relacionadas (#, *) 22a, y otras teclas 22b utilizadas para funcionamiento de la estación móvil 10. Estas otras teclas 22b pueden incluir, por ejemplo, una tecla SEND, varias teclas de menú de desplazamiento en la pantalla y de función, y una tecla PWR. La estación móvil 10 incluye también una batería 26 para activar varios circuitos que son necesarios para accionar la estación móvil.
La estación móvil 10 incluye también varias memorias, mostrado colectivamente como la memoria 24, donde son memorizadas una pluralidad de constantes y variables que son utilizadas por el controlador 18 durante la operación de la estación móvil. Por ejemplo, la memoria 24 memoriza los valores de varios parámetros del sistema celular y el módulo de asignación del número (NAM). Un programa de funcionamiento para controlar la operación del controlador 18 es memorizada también en la memoria 24 (típicamente en un dispositivo ROM). La memoria 24 puede almacenar también datos, incluyendo mensajes de usuario, que se recibe desde el BMI 32 antes de la representación de los mensajes al usuario. La memoria 24 incluye también rutas para ejecutar los métodos descritos a continuación con respecto a la transmisión de parámetros de ruido de bienestar durante la operación DTX.
Debería entenderse que la estación móvil 10 puede ser un vehículo montado o un dispositivo portátil. Debería apreciarse adicionalmente que la estación móvil 10 puede ser capaz de funcionar con una o más normas de interfaz hertziano, tipos de modulación, y tipos de acceso. Por ejemplo, la estación móvil puede ser capaz de funcionar con cualquier número de otras normas además de la IS-136, tal como GSM. Debería estar claro, por tanto, que la enseñanza de esta invención no está producida para limitarse a ningún tipo particular de estación móvil o norma de interfaz hertziano.
Aunque la invención se describe a continuación de forma específica en el contexto de una forma de realización IS-136, se indica de nuevo que la enseñanza de esta invención no está limitada solamente a una norma de interfaz hertziano.
Con respecto a DTX en un canal de tráfico digital (IS-136.1, Rev. A. Section 2.3.11.2), cuando en el estado DTX-Alto, el transmisor 14 irradia a un nivel de potencia indicado por el orden de control de potencia más reciente (Initial Traffic Channel, Designation message, Digital Traffic Channel (DTC) Designation message, Handoff message, Dedicated DTC Handoff message, o Physical Layer Control message) recibido por la estación móvil 10.
En el estado de DTX-Bajo, el transmisor 14 permanece desconectado. El CDVCC no es enviado, excepto para la transmisión de los mensajes del Canal de Control Asociado Rápido (FACCH). Todos los mensajes (SACCH) de Canal de Control Asociados Lentos que deben trasmitirse por la estación móvil 10, mientras que en el estado de DTX-Bajo, son enviados como un mensaje FACCH, después de lo cual, el transmisor 14 retorna de nuevo al estado desconectado a menos que se haya inhibido de otro modo la Transmisión Discontinua (DTX).
Cuando la estación móvil 10 desea conmutar desde el estado DTX-Alto hasta el estado DTX-Bajo, puede completar todos los mensajes SACCH en progreso en el estado de DTX-Alto, o terminar la transmisión de mensaje SACCH y reenviar los mensajes SACCH interrumpidos, en su totalidad, como mensajes FACCH en el estado de DTX- Bajo.
Cuando una estación móvil se conmuta desde el estado DTX-Alto hasta el estado DTX-Bajo, debe pasar a través de un estado de transición en el que la potencia transmitida está en el nivel de DTX-Alto hasta que se han transmitido completamente todos los mensajes FACCH.
En una forma de realización preferida de esta invención, la estación móvil 10 permanece en el estado de transición hasta que ha sido transmitido completamente un Bloque de Ruido de Comfort (compuesto de seis divisiones de pausa DTX, y el mensaje de Parámetro de Ruido de bienestar relacionado). El Bloque de Ruido de bienestar es enviado sin interrupción. Si coinciden muchas otras muescas de mensaje FACCH con el envío del Bloque de Ruido de bienestar, la estación móvil 10 retrasa la transmisión o bien del mensaje FACCH o del Bloque de Ruido de bienestar para transmitir uno antes del otro, pero en cualquier caso, los mensajes FACCH son agrupados o segregados efectivamente de forma que no interrumpen o roban las muescas utilizadas para la transmisión del Bloque de Ruido de bienestar. Esto asegura la mejor calidad disponible del ruido de bienestar que se genera en una voz de estación base/decodificador de ruido de bienestar.
La referencia a este respecto se realiza a la solicitud de patente US cedida comúnmente y pendiente S.N.
08/936.755, presentada el 25/9/97, titulada "Transmission of Comfort Noise Parameters During Discontinous Transmission", por Seppo Alanärä; y Pekka Kapanen.
De acuerdo con una forma de realización específica, el Mensaje de Parámetro de Ruido de bienestar (CN), mostrado a continuación en la Tabla 1, es transmitido en el canal de tráfico digital inverso (RDTC), específicamente, el canal lógico FACCH, y contiene 38 bits, de los cuales 26 bits contienen un vector residual LSF que es cuantificado utilizando el mismo libro de códigos de cuantificación de vector dividido (SVQ) como se utiliza en el codec de voz IS-641. Los algoritmos de cuantificación/des-cuantificación del codec de voz son modificados para hacer posible el uso de este libro de códigos. Los parámetros LSF ofrecen una estimación de la envoltura espectral del ruido de fondo en el lado de transmisión utilizando, preferentemente, un modelo de espectro LPC de orden 10.
Los siguientes 8 bits contienen un índice de cuantificación de energía de ruido de bienestar, que describe la energía del ruido de fondo en el lado de transmisión. Los 4 bits restantes en el mensaje son utilizados para la transmisión de un elemento de información de Control Espectral de Excitación Aleatorio (RESC).
TABLA 1 Formato de mensaje
Elemento de Información Tipo Longitud (bits)
Discriminador de Protocolo M 2
Tipo de Mensaje M 8
Vector Residual LSF M 26
Índice de Cuantificación de energía CN M 8
Parámetros RESC M 4
\newpage
Para resumir, los problemas descritos en la sección de Fondo de esta solicitud de patente son considerados generando, en el lado de recepción, un ruido sintético similar al ruido de fondo lado de transmisión. Los parámetros de ruido de bienestar (CN) son estimados en el lado de transmisión y transmitidos hasta el lado de recepción antes de que se desconecte la transmisión, y después de esto a un régimen regular bajo. Esto permite que el ruido de bienestar se adapte a los cambios del ruido en el lado de transmisión. El mecanismo DTX de acuerdo con esta invención emplea: una función de Detector de Actividad de Voz (VAD) 21 (Figura 12) en el lado de transmisión; una evaluación en el controlador 18 del ruido acústico de fondo en el lado de transmisión; con el fin de transmitir los parámetros característicos en el lado de recepción; y una generación en el lado de recepción de un ruido similar, referido como ruido de bienestar, durante periodos donde se desconecta la transmisión de radio.
Además de estas funciones, si los parámetros que llegan al lado de recepción son encontrados por estar seriamente corrompidos por errores, la voz o el ruido de bienestar es generado en su lugar de los datos substituidos con el fin de evitar la generación de efectos de audio de aturdimiento para el oyente.
La función DTX del lado de transmisión pasa continuamente las tramas de tráfico, cada uno marcado por un indicador SP, al transmisor de radio 14, donde el indicador SP = "1" indica una trama de voz, y donde el indicador SP = "0" indica un conjunto codificado de parámetros de Ruido de bienestar. La disposición de las tramas para la transmisión en el interfaz hertziano es controlada por el transmisor de radio 14, a partir del indicador SP.
En una forma de realización preferida de esta invención, y para permitir una verificación exacta de las funciones DTX del lado de transmisión, todos las tramas antes de la reposición de la estación móvil 10 son tratados como si fueran tramas de voz durante un tiempo infinitamente largo. Por tanto, los primeros 6 tramas después de la reposición son marcados siempre con el indicador SP = "1", incluso si el indicador VAD = "0" (periodo de pausa, ver figura 14).
El Detector de la Actividad de Voz (VAD) 21 funciona de forma continua para determinar si la señal de entrada procedente del micrófono 19 contiene voz. La salida es un indicador binario (indicador VAD = "1" o indicador VAD = "0", respectivamente) sobre un base de trama por trama.
El indicador VAD controla indirectamente, a través de las operaciones del gestor DTX del lado de transmisión descritas a continuación, la operación general DTX en el lado de transmisión.
Cuando el indicador VAD = "1", la trama de salida codificado de voz pasa directamente al transmisor de radio 14, marcado con el indicador SP = "1".
Al final de una ráfaga de voz (indicador VAD de transición = "1" al indicador VAD = "0"), requiere siete tramas consecutivos para tener disponible un nuevo conjunto actualizado de parámetros CN. Normalmente, los primeros seis tramas de salida del codificador de voz después del final de la ráfaga de voz pasan directamente al transmisor de radio 14, marcado con el indicador SP = "1", formado de este modo el "periodo de pausa". El primer nuevo conjunto de parámetros CN pasa entonces hasta el transmisor de radio 14 como el siete trama después del final de la ráfaga de voz, marcado con el indicador SP = "0" (ver Figura 14).
No obstante, si al final de la ráfaga de voz, han transcurrido menos de 24 tramas desde que fue calculado y pasó el último conjunto de parámetros CN al transmisor de radio 14, entonces, se pasa de forma repetida el último conjunto de parámetros CN al transmisor de radio 14, hasta que está disponible un conjunto nuevo actualizado de parámetros CN (siete tramas consecutivos marcados con indicador VAD = "0"). Esto reduce la actividad en el interfaz hertziano, en casos los picos de ruido de fondo cortos son interpretados como voz, evitando la espera de "pausa" para el cálculo del parámetro CN. La figura 15 muestra como ejemplo la ráfaga de voz lo más larga posible sin pausa.
Una vez que el primer conjunto de parámetros CN después del final de una ráfaga de voz se ha calculado y pasado al transmisor de radio 14, el gestor DTX del lado de transmisión calcula continuamente y pasa los conjuntos actualizados de parámetros CN al transmisor de radio 14, marcado con el indicador SP = "0", mientras que el indicador VAD = "0".
El codificador de voz es accionado en un modo de codificación de voz normal si el indicador SP = "1" y en un modo simplificado si el indicador SP = "0", puesto que no se requieren todas las funciones del codificador para la evaluación del os parámetros CN.
En el transmisor de radio 14, se disponen los siguientes tramas de tráfico para la transmisión: todos las tramas marcados con el indicador SP = "1"; el primer trama marcado con el indicador SP = "0", después uno o más tramas con el indicador SP = "1"; estos tramas marcados con SP = "0" y dispuestos para transmisión de los mensajes de actualización del parámetro CN.
Esto tiene el efecto general de transición hasta el estado de bajo DTX después de la transmisión de un mensaje de parámetro CN cuando el altavoz interrumpe la conversación. Durante las pausas de voz, la transmisión se retoma, por ejemplo, a intervalos regulares para la transmisión de un mensaje de parámetro CN, con el fin de actualizar el ruido de bienestar generado en el lado de recepción.
El algoritmo de evaluación de ruido de bienestar utiliza los parámetros de Predicción Lineal (LP) no cuantificados y cuantificador (por ejemplo) del codificador de voz, utilizando la representación de Pareja Espectral Lineal (LSP), donde el vector de la Frecuencia Espectral Lineal no cuantificada (LSF) se da por f^{t} = [f_{1} f_{2} ...f_{10}] y el vector LSF cuantificado por f^{t} = [f_{1} f_{2} ...f_{10}], designando transpuesto. El algoritmo utiliza también la señal residual LP r(n) de cada sub-trama para calcular la ganancia de excitación aleatoria y los parámetros de Control Espectral de Excitación Aleatorio (RESC).
El algoritmo calcula los siguientes parámetros para contribuir en la generación de ruido de bienestar: el vector de parámetro LSF de referencia f^{ref} (promedio de los parámetros LSF cuantificados del periodo de pausa); el vector del parámetro LSF promediado f^{mean}(media de los parámetros LSF de los siete tramas más recientes); la ganancia de excitación aleatoria promediada g^{mean}_{cn} (media de los valores de ganancia de excitación aleatoria de los siete tramas más recientes); la ganancia de excitación aleatoria g_{cn}; y los parámetros RESC \Lambda.
Estos parámetros ofrecen información sobre el espectro (f, f, f^{ref}, f^{mean}, \Lambda) y el nivel (g_{cn}, g^{mean}_{cn}) del ruido de fondo.
Tres de los parámetros de ruido de bienestar evaluados (f^{mean}, \Lambda y g^{mean}_{cn}) son codificados en un mensaje FACCH especial, referido aquí como el mensaje de parámetro de Ruido de bienestar (CN), para la transmisión al lado de recepción. Puesto que el vector del parámetro LSF de referencia f^{ref} puede evaluarse del mismo modo en el codificador y el decodificador, como se describe a continuación, no es necesaria una transmisión de este vector del parámetro.
El mensaje de parámetro CN sirve también para iniciar la generación de ruido de bienestar en el lado de recepción, a medida que un mensaje de parámetro CN es enviado siempre al final de una ráfaga de voz, es decir, antes de que se termine la transmisión de radio.
La disposición de los mensajes de parámetro CN o tramas de voz en la trayectoria de radio se describió anteriormente con referencia a las figuras 7 y 8.
La evaluación de ruido de fondo implica calcular tres tipos diferentes de parámetros promediados: los parámetros LSF, el parámetro de ganancia de excitación aleatoria, y los parámetros RESC. Los parámetros de ruido de bienestar que deben codificarse en un mensaje de parámetro de Ruido de bienestar son calculados en el periodo promediado CN de N=7 tramas consecutivos marcados con VAD = "0", como se describe más detalladamente a continuación.
Antes de realizar el promedio de los parámetros LSF en el periodo promediado CN, se realiza una substitución por la media en el conjunto de parámetros LSF que deben ser promediados, para eliminar los parámetros que no son característicos del ruido de fondo en el lado de transmisión. En primer lugar, las distancias espectrales desde cada uno de los vectores de parámetro LSF f(i) a los otros vectores de parámetro LSF f(j), i = 0...6, j = 0...6, i\neqj, dentro del periodo promediado CN son aproximados de acuerdo con la ecuación:
(4)\Delta R_{ij}=\sum\limits^{10}_{k=1}(f_{i}(k)-f_{j}(k))^{2}
donde f_{i}(k) es el parámetro k LSF del vector parámetro LSF f(i) en la trama i.
Para encontrar la distancia espectral \DeltaS_{i} del vector de parámetro LSF f(i) a los vectores de parámetro LSF f(j) de todas las demás tramas j= 0...6, j\neqi, dentro del periodo promediado CN, la suma de las distancias espectrales \DeltaR_{ij} es calculado como sigue:
(5)\Delta S_{i}=\sum\limits^{6}_{j=0,j\neq i}\Delta R_{ij}
para todo i = 0...6, i\neqj.
El vector de parámetro LSF f(i) con la distancia espectral más pequeña \DeltaS_{i} de todos los vectores de parámetros LSF dentro del periodo promediado CN es considerado como el vector de parámetro LSF f_{med} del periodo promediado, y su distancia espectral es designada como \DeltaS_{med}. El vector de parámetro LSF es considerado por contener la mejor representación del detalle espectral a corto plazo del ruido de fondo de todos los vectores de parámetro LSF dentro del periodo promediado. Si existieran vectores de parámetro LSF f(j) dentro del periodo promediado CN con:
(6)\frac{\Delta S_{i}}{\Delta S_{med}}> TH_{med}
donde TH_{med}= 2,25 es el umbral de substitución por la media, entonces como máximo dos de estos vectores de parámetro LSF (los vectores de parámetro LSF que provocan TH_{med} que se excede lo máximo) son sustituidos por el vector de parámetro LSF mediano antes de calcular el vector de parámetro LSF promediado f^{mean}.
El conjunto de los vectores de parámetro LSF obtenidos como resultado de la substitución por la media son designados como f'(n-i), donde n es el índice de la trama actual, e i es el índice del periodo promediado (i=0....6).
Cuando la substitución por la media es realizada al final del periodo de pausa (primera actualización CN), todos los vectores del parámetro LSF f(n-i) de los seis tramas previos (el periodo de pausa, i=1...6) tienen valores cuantificados, mientras que el vector de parámetro LSF f(n) en la trama más reciente n tiene valores no cuantificados. En la siguiente actualización CN, los vectores del parámetro LSF del periodo promediado CN en estos tramas que se solapan con el periodo de pausa tienen valores cuantificados, mientras que los vectores del parámetro de tramas más recientes del periodo promediado CN tienen valores no cuantificados. Si el periodo de los siete tramas más recientes no está solapándose con el periodo de pausa, la substitución por la media de los parámetros LSF se realiza utilizando solamente los valores del parámetro no cuantificado.
El vector del parámetro LSF promediado f^{mean} (n) en la trama n es calculado de acuerdo con la ecuación:
(7)f^{mean}(n)=\frac{1}{7}\sum\limits^{6}_{i=0}f'(n-i)
donde f'(n-i) es el vector del parámetro LSF de uno de los siete tramas más recientes (i=0...6) después de realizar la substitución por la media, es el índice del periodo promediado, y n es el índice de la trama.
El vector del parámetro LSF promediado f^{mean}(n) en la trama n es cuantificado preferentemente utilizando las mismas tablas de cuantificación que se utilizan también por el codificador de voz para la cuantificación de los vectores del parámetro LSF no promediados en el modo de codificación de voz normal, pero el algoritmo de cuantificación es modificado con el fin de soportar la cuantificación del ruido de bienestar. La señal residual de predicción LSF que debe cuantificarse es obtenida de acuerdo con la siguiente ecuación:
(8)r(n)=f^{mean}(n)-\hat{f}^{ref}
donde f^{mean}(n) es el vector del parámetro LSF promediado en la trama n, f^{ref} es el vector del parámetro LSF de referencia, r(n) es el vector residual de predicción LSF calculado en el cuando n, y n es el índice de la trama.
El cálculo del vector del parámetro LSF de referencia f^{ref} se realiza a partir de los parámetros LSF cuantificados f haciendo el promedio de estos parámetros sobre el periodo de pausa de seis tramas de acuerdo con la siguiente ecuación:
(9)\hat{f}=\frac{1}{6}\sum\limits^{6}_{i=1}\hat{f}(n-i)
donde f(n-i) es el vector del parámetro LSF cuantificado de uno de las tramas del periodo de pausa (i=1...6), i es el índice de trama de periodo de pausa, y n es el índice de la trama. Debería indicarse que los vectores del parámetro LSF cuantificados f(n-i) utilizados para calcular f^{ref} no están sometidos a substitución por la media antes del promedio.
Para cada periodo de generación CN, el cálculo del vector del parámetro LSF de referencia f^{ref} se realiza solamente una vez al final del periodo de pausa, y para el resto del periodo de generación CN, f^{ref} está congelado. El vector del parámetro LSF de referencia f^{ref} es evaluado en el decodificador del mismo modo que en el codificador, puesto que durante el periodo de pausa, están disponibles los mismos vectores de parámetro LSF f en el codificador y el decodificador. Una excepción a esto son los casos donde los errores de transmisión son lo suficientemente graves como para provocar que los parámetros estén inutilizados, y se activa un procedimiento de sustitución de trama. En estos casos, los parámetros modificados obtenidos a partir del procedimiento de sustitución de tramas son utilizados en lugar de los parámetros recibidos.
Se calcula la ganancia de excitación aleatoria para cada sub-trama, basada en la energía de la señal residual LP del sub-trama, de acuerdo con la siguiente ecuación:
(10)g_{cn}(j)=\text{1.286}\sqrt{\frac{\sum\limits^{39}_{i=0}r(i)^2}{10}}
donde g_{cn}(j) es la ganancia de excitación aleatoria calculada del sub-trama j, r(I) es la muestra I de la señal residual LP del sub-trama j, e I es el índice de muestras (I = 0....39). El factor de escala de 1.286 es utilizado para hacer del nivel del ruido de bienestar coincidente con el ruido de fondo codificador por el codec de voz. El uso de este valor de factor de escala particular no debería interpretarse como una limitación de la práctica de esta invención.
La energía calculada de la señal residual LP es dividida por el valor de 10 para producir la energía para un impulso de excitación aleatorio, puesto que durante la generación de ruido de bienestar, la señal de excitación del sub-trama (pseudo- ruido), tiene 10 muestras no cero, cuyas amplitudes pueden tomar valores de +1 ó -1.
Los valores de ganancia de excitación aleatoria calculados son promediados y actualizados en el primer subt-rama de cada trama n marcada con SP = "0", cuando se requiere un conjunto actualizado de parámetros CN, de acuerdo con la ecuación:
(11)g^{mean}_{cn}(n)=\frac{1}{25}g_{cn}(n)(1)+ \frac{1}{\text{6.25}}\sum\limits^{6}_{i=1}(\frac{1}{4}\sum\limits^{4}_{j=1}g_{cn}(n-i)(j))
donde g_{cn} (n)(1) es la ganancia de excitación aleatoria calculada en el primer sub-trama de la trama n, g_{cn} (n-i)(j) es la ganancia de excitación aleatoria calculada en el sub-trama j de uno de las tramas pasados (i=1...6), y n es el índice de la trama. Puesto que la ganancia de excitación aleatoria de solamente el primer sub-trama de la trama actual es utilizada en el promedio, es posible disponer del conjunto actualizado de parámetros CN para la transmisión después de que se ha procesado el primer sub-trama de la trama actual.
La ganancia de excitación aleatoria promediada está unida por g^{mean}_{cn} \leq 4032.0 y cuantificada con un cuantificador algorítmico no uniforme de 8 bit en el dominio logarítmico, requiriendo el no almacenamiento de una tabla de cuantificación.
Con respecto al cálculo de los parámetros RESC, puesto que la señal residual LP r(n) se desvía bastante de las características espectrales planas, se dará lugar a cierta pérdida en la calidad el ruido de bienestar (desajuste espectral entre el ruido de fondo y el ruido de bienestar) cuando se utiliza una excitación aleatoria espectralmente plana para sintetizar el ruido de bienestar en el lado de recepción. Para proporcionar un ajuste especial mejorado, se realiza un análisis LP de segundo orden adicional para la señal residual LP en el periodo promediado CN, y los coeficientes LP promediados resultantes son transmitidos al lado de recepción en el mensaje del parámetro CN que debe utilizarse en la generación del ruido de bienestar. Este método es referido como el control espectral de excitación aleatoria (RESC), y los coeficientes LP obtenidos son referidos como los parámetros RESC \Lambda
Las señales residuales LP r(n) de cada sub-trama en una trama son concatenadas para calcular las auto-correlaciones r_{res}(k), k = 0...2, de la señal residual LP de la trama 20 ms de acuerdo con la ecuación:
(12)r_{res}(k)=\sum\limits^{159}_{n=k}r(n)r(n-k),k=0,...,2
Después de calcular las auto-correlaciones de acuerdo con la ecuación precedentes, se normalizan las auto-correlaciones para obtener las auto-correlaciones normalizadas r'_{res}(k).
Para la trama más reciente del periodo promediado CN, las auto- correlaciones procedentes solamente del primer sub-trama son utilizadas para hacer el promedio, haciendo posible preparar el conjunto actualizado de los parámetros CN para la transmisión después de que se ha procesado el primer sub-trama de la trama actual.
Las auto-correlaciones normalizadas calculadas son promediadas y actualizadas en el primer sub-trama de cada trama n marcado con SP = "0", cuando se requiere un conjunto actualizado de parámetros CN, de acuerdo con la ecuación:
(13)r^{mean}_{res}(n)=\frac{1}{25}r'_{res}(n)(1)+\frac{1}{\text{6.25}}\sum\limits^{6}_{i=1}r'_{res}(n-i)
donde r'_{res} (n)(1) son las auto-correlaciones normalizadas en el primer sub-trama de la trama n, r'_{res} (n-i) son las auto-correlaciones normalizadas de uno de los últimos tramas (i= 1...6) y n es el índice de la trama.
Las auto-correlaciones promediadas, calculadas r^{mean}_{ref} son introducidas en un algoritmo recursivo de Schur para calcular los dos primeros coeficientes de reflexión, es decir, los parámetros RESC \Lambda, ó \lambda(i), i=1, 2. Cada uno de los dos parámetros RESC son codificados utilizando un cuantificador escalar de 2-bit.
La modificación del algoritmo de codificación de voz durante la operación DTX es como sigue. Cuando el indicador SP es igual a "0", el algoritmo de codificación de voz es modificado del siguiente modo. Los parámetros LP no promediados que son utilizados para derivar los coeficientes de filtro del filtro de síntesis a corto plazo H(z) del codificador de voz no son cuantificados, y la memoria del filtro de ponderación W(z) no está actualizada, sino en su lugar ajustada a cero. Se realiza una búsqueda de paso de circuito abierto, pero la búsqueda de intervalo de paso de circuito cerrado está inactiva y la ganancia del libro de códigos adaptable es ajustada a cero. Si la ejecución VAD no utiliza el parámetro de retraso del libro de códigos adaptable para tomar la decisión VAD, puede desconectarse también la búsqueda de intervalo de paso del circuito abierto. No se realiza una búsqueda de libro de códigos fija. En cada sub-trama, el vector de excitación del libro de códigos fijo del decodificador de voz normal es sustituido por un vector de excitación aleatorio que contiene 10 impulsos no cero. Se define a continuación, el algoritmo de generación de excitación aleatorio. La excitación aleatoria es filtrada por el filtro de síntesis RESC, como se describe a continuación, para mantener los contenidos de la memoria temporal de excitación pasada tan iguales como sea posible tanto en el codificador como en el decodificador, para permitir un inicio rápido de la búsqueda del libro de códigos adaptable cuando la actividad de la voz comienza después del periodo de generación de ruido de bienestar. El algoritmo de cuantificación de parámetro LP del modo de codificación de voz está inactivado. Al final del periodo de pausa, el vector del parámetro LSF de referencia f^{ref} es calculado como se define anteriormente. Para el resto del periodo de inserción de ruido de bienestar f^{ref} está congelado. El vector del parámetro LSF promediado f^{mean} es calculado cada vez que debe prepararse un nuevo conjunto de parámetros CN. Este vector de parámetro es codificado en parámetro CN, el mensaje fue como se define anteriormente. El algoritmo de cuantificación de ganancia de excitación del modo de codificación de voz está también inactivo. El valor de ganancia de excitación aleatoria de promedio g^{mean}_{cn} es calculado cada vez que debe prepararse un nuevo conjunto de parámetros CN. Este valor de ganancia es codificado en el mensaje de parámetro CN como se define previamente. El cálculo de la ganancia de excitación aleatoria se realiza basado en la energía de la señal residual LP, como se define anteriormente. Las memorias del elemento de predicción de la cuantificación de parámetro LP ordinario y los algoritmos de cuantificación de ganancia del libro de códigos fijo son repuestos cuando el indicador SP = "0", de forma que los cuantificadores se inician a partir de sus estados iniciales cuando la actividad de la voz comienza de nuevo. Y, finalmente, el cálculo de los parámetros RESC está basado en el contenido espectral de la señal residual LP, como se define anteriormente. Los parámetros RESC son calculados cada vez que debe prepararse un nuevo conjunto de parámetros CN.
El algoritmo de codificación de ruido de bienestar produce 38 bits para cada mensaje de parámetro CN, como se muestra en la Tabla 2. Estos bits son referidos como un vector cn[0...37]. Los bits de ruido de bienestar cn[0...37] son suministrados al codificador de canal FACCH en el orden presentado en la Tabla 2 (es decir, no se realiza la ordenación de acuerdo con la importancia subjetiva de los bits).
TABLA 2 Asignación detallada de bit de parámetros de ruido de bienestar
Índice (vector para codificador de canal FACCH) Descripción Parámetro
cn0-cn7 Índice de primer subvector LSF Índice VQ de r[1...3]
cn8-cn16 Índice de segundo subvector LSF Índice VQ de r[4...6]
cn17-cn25 Índice de tercer subvector LSF Índice VQ de r[7...10]
cn26-cn33 Ganancia de excitación aleatoria Índice de g^{mean}_{cn}
cn34-cn35 Índice de primer parámetro RESC Índice de \lambda(1)
cn36-cn37 Índice de segundo parámetro RESC Índice de \lambda(2)
Independientemente de su contexto (voz, mensaje de parámetro CN, otros mensajes FACCH o ninguno), el receptor de radio de la estación de base 30 pasa continuamente las tramas de tráfico recibidos hasta el gestor DTX del lado de recepción, marcados continuamente por varias funciones de pre-procesamiento con tres indicadores. Estos son el indicador del Indicador de Trama Erróneo (BFI), el indicador de Indicador de Trama Erróneo de parámetro de ruido de bienestar (BFI_CN), y el Indicador de Actualización de Ruido de bienestar (CNU) descrito a continuación y en la Tabla 3. Estos indicadores sirven para clasificar las tramas de tráfico de acuerdo con su fin. Esta clasificación, resumida en la Tabla 3, permite que el gestor DTX del lado de recepción determine, de un modo simple, cómo debe procesarse la trama recibido.
TABLA 3 Clasificación de tramas de tráfico
BFI_CN
BFI 0 1
0 Combinación No válida Trama de voz bueno
1 Mensaje de parámetro CN válido Trama No utilizable
Los indicadores binarios BFI y BFI_CN indican si la trama de tráfico es considerado por contener bits de información valiosa (indicador BFI = "0" y el indicador BFI_CN = "1", o indicador BFI = "1" e indicador BFI CN = "0") o no (indicador BFI = "1" e indicador BFI_CN = "1", o indicador BFI = "0" e indicador BFI_CN = "0"). En el contexto de esta descripción, una trama FACCH es considerado no por contener bits valioso a menos que contenga un mensaje de parámetro CN, y es por tanto, marcado con el indicador BFI SP = "1" y el indicador BFI CN = "1".
El indicador CNU binario marca con CNU = "1" aquellas tramas que están alineados con los casos de transmisión de la información de calidad del canal enviada sobre el FACCH.
El gestor DTX del lado de recepción es responsable de toda la operación DTX en el lado de recepción. La operación DTX en el lado de recepción es como sigue: si se detecta un buen trama de voz, el gestor DTX pasa directamente sobre el decodificador de voz; cuando son detectados las tramas de voz perdidos o los mensajes de parámetro CN perdidos, se aplica la sustitución y el procedimiento de silenciamiento; las tramas de mensajes de parámetros CN válidos dan lugar a la generación de ruido de bienestar hasta que se espera el siguiente mensaje de parámetro CN (CNU = "1") o se detectan nuevos tramas de voz. Durante este periodo, el gestor del lado de recepción DTX ignora cualquiera de las tramas inutilizados suministrados por el receptor de radio. Las siguientes dos operaciones son opcionales; los parámetros al primer mensaje de parámetro CN perdido son sustituidos por los parámetros del último mensaje de parámetro CN válido, y se aplica el procedimiento para el mensaje del parámetro CN; y después del a recepción de un segundo mensaje de parámetro CN perdido, se aplica el silenciamiento.
Con respecto al promedio y a la decodificación de los parámetros LP, cuando las tramas de voz son recibidos por el decodificador, los parámetros LP de los últimos seis tramas de voz se mantienen en la memoria. El decodificador calcula el número de tramas transcurridos desde que el último conjunto de parámetros CN fue actualizado y pasó al transmisor de radio por el codificador. Basado en este recuento, el decodificador determina si existe o no un periodo de pausa al final de la ráfaga de voz (si han pasado al menos 30 tramas desde la última actualización de parámetro CN cuando lleva el primer mensaje de parámetro CN después de una ráfaga de voz, se determina el periodo de pausa que ha existido al final de la ráfaga de voz).
Tan pronto como se recibe un mensaje de parámetro CN, y se detecta el periodo de pausa al final de la ráfaga de voz, los parámetros LP memorizados son promediados para obtener el vector del parámetro LSF de referencia f^{ref}. El vector del parámetro de referencia LSF es congelado y utilizado para el periodo de generación de ruido de bienestar real.
El procedimiento de promedio para obtener los parámetros de referencia es como sigue:
Cuando se recibe una trama de voz, los parámetros LSF son decodificados y memorizados en la memoria. Cuando se recibe el primer mensaje de parámetro CN, y se detecta el periodo de pausa al final de la ráfaga de voz, los parámetros LSF memorizados son promediados del mismo modo que el codificador de voz, como sigue:
(14)\hat{f}^{ref}=\frac{1}{6}\sum\limits^{6}_{i=1}\hat{f}(n-i)
donde f(n-i) es el vector del parámetro LSF cuantificado de uno de las tramas del periodo pausa (i=1...6), y n es el índice de la trama.
Una vez que se ha calculado el vector del parámetro LSF de referencia, el vector del parámetro LSF promediado f^{mean}(n) en la trama n (codificado en el mensaje del parámetro CN) puede reproducirse en el decodificador cada vez que se recibe un mensaje de actualización CN de acuerdo con la ecuación:
(15)\hat{f}^{mean}(n)=\hat{r}(n)+\hat{f}^{ref}
\newpage
donde f^{mean} (n) es el vector del parámetro LSF promediado, cuantificado en la trama n, f^{ref} es el vector del parámetro LSF de referencia, r(n) es el vector residual de predicción LSF cuantificado, recibido en la trama n, y n es el índice de la trama.
En cada sub-trama, el vector de excitación del libro de códigos fijo del decodificador de voz normal que contiene cuatro impulsos no cero es sustituido durante la inactividad de voz por un vector de excitación aleatorio que contiene 10 impulsos no cero. Las posiciones de impulso y los signos de la excitación aleatoria son generados localmente utilizando números pseudo-aleatorios distribuidos de manera uniforme. Los impulsos de excitación toman valores de +1 y -1 en el vector de excitación aleatorio. El algoritmo de generación de excitación aleatorio funciona de acuerdo con los siguientes pseudo-códigos.
Pseudo-Código
23
donde el código [0...39] es la memoria temporal de excitación del libro de códigos fijo, y (k) aleatorio genera los valores de entero pseudo-aleatorio, distribuido uniformemente sobre el intervalo [0...k-1).
Los índices de parámetro RESC recibidos son decodificados para obtener los parámetros RESC recibidos \lambda(i), i = 1, 2. Después de que se ha generado la excitación aleatoria, se filtra por el filtro de síntesis RESC, definido como sigue:
(16)H^{syn}_{RESC}(z)=\frac{1}{1+\sum\limits^{2}_{i=1}\hat{\lambda}(i)z^{-1}}
El filtro de síntesis RESC es ejecutado preferentemente utilizado un método de filtración de celosía. Después de la filtración de síntesis RESC, la excitación aleatoria está sometida a escala y la filtración de síntesis LP.
El procedimiento de generación de ruido de bienestar utiliza el algoritmo del decodificador de voz con las siguientes modificaciones. Los valores de ganancia del libro de códigos fijo son sustituidos por el valor de ganancia de excitación aleatorio recibido en el mensaje del parámetro CN, y la excitación del libro de códigos fijo es sustituida por la excitación aleatoria generada localmente como fue descrita anteriormente. La excitación aleatoria es filtrada por el filtro de síntesis RESC, como se describió también anteriormente. El valor de ganancia del libro de códigos adaptable en cada sub- trama es ajustado a 0. El valor de retraso de paso en cada sub-trama es ajustado a 60, por ejemplo. Los parámetros de filtro LP utilizados son aquellos recibidos en el mensaje del parámetro CN. Las memorias elemento de predicción del parámetro LP ordinario y los algoritmos de cuantificación de ganancia de libro de códigos fijo son repuestos cuando el indicador SP = "0", de forma que los cuantificadores comienzan desde sus estados iniciales cuando la actividad de voz comienza de nuevo. Con estos parámetros, el decodificador de voz comienza ahora sus operaciones estándar y sintetiza el ruido de bienestar. La actualización de los parámetros de ruido de bienestar (ganancia de excitación aleatoria, parámetros RESC, y parámetros de filtro LP) se produce cada vez que se recibe un mensaje de parámetro CN válido, como se describe anteriormente. Cuando se actualiza el ruido de bienestar, los parámetros precedentes son interpolados sobre el periodo de actualización CN para obtener las transiciones uniformes.
El mensaje del parámetro CN perdido es definido como una trama inutilizable que es recibido cuando el gestor DTX del lado de recepción está generando ruido de bienestar y se espera un mensaje de parámetro CN (indicador de Actualización de Ruido de bienestar, CNU = "1").
Los parámetros del último mensaje de parámetro CN individual son substituidos por los parámetros del último mensaje de parámetro CN válido y se aplica el procedimiento para los parámetros CN válidos. Para el segundo mensaje de parámetro CN perdido, se utiliza una técnica de silenciamiento para el ruido de bienestar que disminuye gradualmente el nivel de salida (-3 dB/trama), dando lugar al silenciamiento eventual de la salida del decodificador. El silenciamiento se alcanza por el descenso de la ganancia de excitación aleatoria con un valor constante de -3 dB en cada trama bajando hasta un valor mínimo de 0. Este valor es mantenido si se producen mensajes de parámetro CN perdidos adicionales.
Aunque se ha descrito un número de formas de realización preferidas actualmente de esta invención con respecto a los valores específicos de las duraciones de tramas, números de tramas, tipos de mensajes específicos (por ejemplo, FACCH), y similares, debería tenerse en cuenta que los números de tramas, la duración de las tramas, duración del periodo de pausa, duración del periodo promediado, tipos de mensaje, etc., pueden variarse de acuerdo con las especificaciones y requerimientos de los diferentes tipos de sistemas de comunicaciones móviles digitales. Adicionalmente, y aunque la invención se ha descrito en el contexto de los diagramas de bloque de circuito, tales como los mostrados en las figuras 2a, 2b, 3a, 3b, 4, 5 y 10, se apreciará que algunos de los bloques del circuito ilustrados son ejecutados por un procesador de datos digitales programado adecuadamente (por ejemplo, el controlador 18 de la figura 12) que forma una porción del teléfono celular digital 10. Pueden ejecutarse completamente en software por ejemplo, solamente los selectores 307, 319 y 410 de las figuras 4 y 5, aunque mostrados como conmutadores.
Además, hay que indicar que existen esquemas de generación de Ruido de bienestar en muchos sistemas donde los bits de reserva no están disponibles en el mensaje del parámetro CN (o trama SID) para transmitir los parámetros RESC desde el lado de transmisión hasta el lado de recepción. En estos casos, el filtro RESC podría sustituirse por un filtro de síntesis con coeficientes fijos. Los coeficientes de filtro fijo son entonces optimizados para provocar la respuesta de frecuencia del filtro de síntesis para tener una respuesta media del filtro RESC normal con coeficientes transmitidos. Los coeficientes del filtro podrían seleccionarse también para ofrecer una respuesta de filtro que proporciona una calidad de percepción preferida (subjetivamente) del ruido de bienestar.
Por tanto, aunque se ha mostrado y descrito particularmente la invención con respecto a sus formas de realización preferidas, se entenderá por los técnicos en la materia que pueden realizarse cambios en la forma y detalle sin separarnos del alcance de la invención, como se define por las reivindicaciones adjuntas.

Claims (25)

1. Método para generar ruido de bienestar (CN) en un terminal móvil digital que utiliza una transmisión discontinua, comprendiendo las etapas de:
en respuesta a una pausa de voz, almacenar temporalmente un conjunto de parámetros de codificación de voz;
dentro de un periodo promediado, sustituir los parámetros de codificación de voz del conjunto que no son representativos de ruido de fondo, por los parámetros de codificación de voz que son representativos del ruido de fondo; y
realizar un promedio del conjunto de los parámetros de codificación de voz.
2. Método de acuerdo con la reivindicación 1, donde la etapa de sustitución incluye las etapas de:
medir las distancias relativas de los parámetros de codificación de voz entre las tramas individuales dentro del periodo promediado;
identificar los parámetros de codificación de voz que presentan las mayores distancias respecto a otros parámetros dentro del periodo promediado; y
si las distancias exceden un umbral predeterminado, sustituir un parámetro de codificación de voz identificado por un parámetro de codificación de voz que presente la menor distancia medida respecto a otros parámetros de codificación de voz dentro del periodo promediado.
3. Método de acuerdo con la reivindicación 1, donde la etapa de sustitución incluye las etapas de:
medir las distancias relativas de los parámetros de codificación de voz entre las tramas individuales dentro del periodo promediado;
identificar los parámetros de codificación de voz que presenten las distancias mayores con respecto a otros parámetros dentro del periodo promediado; y
si las distancias exceden un umbral predeterminado, sustituir un parámetro de codificación de voz identificado por un parámetro de codificación de voz que presente un valor medio.
4. Método de acuerdo con la reivindicación 1, donde la etapa de realización de promedio incluye una etapa de cálculo de una ganancia de excitación media g_{mean} y la media de los coeficientes de espectro a corto plazo f_{mean}(i).
5. Método de acuerdo con la reivindicación 1, donde la etapa de sustitución incluye las etapas de:
formar un conjunto de valores de ganancia de excitación memorizados temporalmente en el periodo promediado;
ordenar el conjunto de valores de ganancia de excitación memorizados temporalmente; y
realizar una operación de substitución por la media en la que estos valores de ganancia de excitación L que se diferencian más que el valor medio, cuando la diferencia excede un valor umbral predeterminado, son sustituidos por el valor medio del conjunto.
6. Método de acuerdo con la reivindicación 5, donde una longitud N del periodo promediado es un número impar, y donde la media del conjunto ordenado es el elemento ((N+1)/2)^{esimo} del conjunto.
7. Método de acuerdo con la reivindicación 1, y que comprende adicionalmente una etapa de:
formar un conjunto de coeficientes de Pareja de líneas espectrales memorizados temporalmente (LSP) f(k), k = 1, ..., M en el periodo promediado; y
determinar una distancia espectral de los coeficientes LSP f_{i}(k) de la trama i^{esima} en el periodo promediado, respecto de los coeficientes LSP f_{j}(k) de la trama j^{esima} en el periodo promediado.
8. Método según la reivindicación 7, donde la etapa de determinación de la distancia espectral se realiza de acuerdo con la expresión
\Delta R_{ij}=\sum\limits^{M}_{k=1}(f_{i}(k)-f_{j}(k))^{2},
donde M es el grado del modelo LPC, y f_{i}(k) es el parámetro LSP k^{esimo} de la trama i^{esimo} en el periodo promediado.
9. Método según la reivindicación 7, y que comprende adicionalmente una etapa de determinación de la distancia espectral \DeltaS_{i} de los coeficientes LSP f_{j}(k) de la trama i respecto de los coeficientes LSP de todas las demás tramas j = 1,..., N, i\neqj, dentro del periodo promediado de longitud N.
10. Método de acuerdo con la reivindicación 9, donde la etapa de determinación de la distancia espectral se realiza determinando la suma de las distancias espectrales \DeltaR_{ij} de acuerdo con
\Delta S_{i}=\sum\limits^{N}_{j=1,i\neq1}\Delta R_{ij},
para todo i = 1,..., N.
11. Método según la reivindicación 9, y que comprende adicionalmente las etapas de:
después de hallar las distancias espectrales \DeltaS_{i} para cada uno de los vectores LSP, f_{j} dentro del periodo promediado, ordenar las distancias espectrales de acuerdo con sus valores;
considerar un vector f_{i} que presenta la menor distancia \DeltaS_{i} dentro del periodo promediado i = 1,2,..., N que sea un vector medio f_{med} del periodo promediado que tiene una distancia designada como \DeltaS_{med}; y
realizar una substitución por la media de los vectores P (O\leqP\leqN- 1) LSP f_{i} con el vector medio f_{med}.
12. Método de acuerdo con la reivindicación 2, donde las etapas de identificación y sustitución se realizan independientemente por valores de ganancia de excitación g y vectores de Pareja de líneas espectrales (LSP) f_{i}.
13. Método de acuerdo con la reivindicación 2, donde las etapas de identificación y sustitución se combinan conjuntamente para valores de ganancia de excitación g y vectores de Pareja de líneas espectrales (LSP) f_{i}.
14. Método de acuerdo con la reivindicación 13, que comprende las etapas de:
en respuesta a la determinación de que los parámetros de codificación de voz de una trama individual a sustituir por valores medios de los parámetros, sustituir tanto el valor de ganancia de excitación g y el vector LSP f_{i} de este trama por los parámetros respectivos de la trama que contiene los parámetros medios.
15. Método de acuerdo con la reivindicación 14, y que comprende las etapas iniciales de:
determinación de una distancia \DeltaT_{ij} entre los parámetros de la trama i^{esima} y la trama j^{esima} del periodo promediado de acuerdo con la expresión
\Delta T_{ij}=\sum\limits^{M}_{k=1}(f_{i}(k)-f_{j}(k))^{2}+ w(g_{i}- g_{j})^{2},
donde M es el grado del modelo LPC, f_{i}(k) es el parámetro LSP k^{esimo} de la trama i^{esima} del periodo promediado, y g_{i} es el parámetro de la ganancia de excitación de la trama i^{esima}.
16. Método de acuerdo con la reivindicación 15, y que comprende adicionalmente una etapa de:
determinación de una distancia \DeltaS_{i} de los parámetros de codificación de voz de la trama i, para todo i = 1,...,N, respecto de los parámetros de codificación de voz de todas las demás tramas j=1,...,N, i\neqj, dentro del periodo promediado de longitud N, de acuerdo con
\Delta S_{i}=\sum\limits^{N}_{j=1,j\neq1}\Delta T_{ij},
para todo i = 1,..., N.
17. Método de acuerdo con la reivindicación 16, donde después de determinar las distancias \DeltaS_{i} para uno de las tramas dentro del periodo promediado, que comprende adicionalmente las etapas de:
ordenar las distancias de acuerdo con sus valores; y
considerar una trama que presenta la menor distancia \DeltaS_{i} dentro de periodo promediado i=1,2,..., N como trama media, que tiene la distancia \DeltaS_{med}, del periodo medio, teniendo la trama media los parámetros de codificación de voz g_{med} y f_{med}.
18. Método de acuerdo con la reivindicación 17, y que comprende una etapa de realizar la substitución por la media en las tramas de parámetros de codificación de voz dentro del periodo promediado i = 1,2,..., N, en el que los parámetros g_{i} y f_{i} de las L(O\leqL\leqN-1) tramas son sustituidos por los parámetros g_{med} y f_{med} de la trama media.
19. Método de acuerdo con la reivindicación 17, donde las diferencias entre cada distancia individual y la distancia media son determinadas dividiendo una distancia individual por la distancia media de acuerdo con \DeltaS_{i}/\DeltaS_{med}.
20. Método de acuerdo con la reivindicación 11, donde las diferencias entre cada distancia individual y la distancia media se determinan dividiendo una distancia individual por la distancia media de acuerdo con \DeltaS_{i}/\DeltaS_{med}.
21. Aparato para generar ruido de bienestar (CN) en un sistema que tiene un terminal móvil digital que utiliza una transmisión discontinua a una red, que comprende:
medios de procesamiento de datos incluidos en dicho terminal móvil digital que son sensibles a una pausa de voz para almacenar temporalmente un conjunto de parámetros de codificación de voz y, dentro de un periodo promediado, sustituir los parámetros de codificación de voz del conjunto que no son representativos del ruido de fondo por los parámetros de codificación de voz que son representativos del ruido de fondo, realizando dichos medios de procesamiento de datos un promedio del conjunto de parámetros de codificación de voz y transmitiendo a la red el conjunto promediado de los parámetros de codificación de voz.
22. Aparato de acuerdo con la reivindicación 21, donde dicho procesador de datos sustituye los parámetros de codificación de voz del conjunto ordenando el conjunto y midiendo las distancias relativas de los parámetros de codificación de voz entre tramas individuales dentro del periodo promediado, identificando estos parámetros de codificación de voz que presenten las distancias mayores con respecto a otros parámetros dentro del periodo promediado; y, cuando las distancias exceden un umbral predeterminado, sustituir los parámetros de codificación de voz identificados por un parámetro de codificación de voz que presente la menor distancia medida con respecto a los parámetros de codificación de voz dentro del periodo promediado.
23. Aparato de acuerdo con la reivindicación 21, donde dicho procesador de datos sustituye los parámetros de codificación de voz del conjunto mediante la ordenación del conjunto y medición de las distancias relativas de los parámetros de codificación de voz entre las tramas individuales dentro del periodo promediado; identificación de estos parámetros de codificación de voz que presentan las mayores distancias respecto a otros parámetros dentro del periodo promediado; y si las distancias exceden un umbral predeterminado, sustituir un parámetro de codificación de voz por un parámetro de codificación de voz que presente un valor medio.
24. Aparato de acuerdo con la reivindicación 21, donde dichos medios de procesamiento de datos identifican y sustituyen los parámetros de codificación de voz independientemente por valores de ganancia de excitación g y un vector f_{i} de Pareja de líneas espectrales (LSP).
25. Aparato de acuerdo con la reivindicación 21, donde dichos medios de procesamiento de datos identifican y sustituyen los parámetros de codificación de voz conjuntamente por valores de ganancia de excitación g y un vector f_{i} de Pareja de Espectral de Línea (LSP).
ES97309213T 1996-11-15 1997-11-14 Procedimiento para generar ruido de bienestar durante una transmision discontinua. Expired - Lifetime ES2206667T3 (es)

Applications Claiming Priority (6)

Application Number Priority Date Filing Date Title
US3104796P 1996-11-15 1996-11-15
US31047P 1996-11-15
US3132196P 1996-11-19 1996-11-19
US31321P 1996-11-19
US08/965,303 US5960389A (en) 1996-11-15 1997-11-06 Methods for generating comfort noise during discontinuous transmission
US965303 1997-11-06

Publications (1)

Publication Number Publication Date
ES2206667T3 true ES2206667T3 (es) 2004-05-16

Family

ID=27363777

Family Applications (1)

Application Number Title Priority Date Filing Date
ES97309213T Expired - Lifetime ES2206667T3 (es) 1996-11-15 1997-11-14 Procedimiento para generar ruido de bienestar durante una transmision discontinua.

Country Status (8)

Country Link
US (2) US5960389A (es)
EP (1) EP0843301B1 (es)
CN (1) CN100350807C (es)
AR (1) AR010612A1 (es)
AT (1) ATE249671T1 (es)
BR (1) BR9705747B1 (es)
DE (1) DE69724739T2 (es)
ES (1) ES2206667T3 (es)

Families Citing this family (119)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6269331B1 (en) 1996-11-14 2001-07-31 Nokia Mobile Phones Limited Transmission of comfort noise parameters during discontinuous transmission
FI104872B (fi) * 1997-04-11 2000-04-14 Nokia Networks Oy Menetelmä matkaviestinjärjestelmän kuormituksen hallitsemiseksi
US6286122B1 (en) * 1997-07-03 2001-09-04 Nokia Mobile Phones Limited Method and apparatus for transmitting DTX—low state information from mobile station to base station
US6233451B1 (en) * 1997-07-14 2001-05-15 Hughes Electronics Corporation Spot beam selection in a mobile satellite communication system
US6347081B1 (en) * 1997-08-25 2002-02-12 Telefonaktiebolaget L M Ericsson (Publ) Method for power reduced transmission of speech inactivity
US6269093B1 (en) * 1997-12-16 2001-07-31 Nokia Mobile Phones Limited Adaptive removal of disturbance in TDMA acoustic peripheral devices
FI116642B (fi) * 1998-02-09 2006-01-13 Nokia Corp Puheparametrien käsittelymenetelmä, puhekoodauksen käsittely-yksikkö ja verkkoelementti
TW376611B (en) 1998-05-26 1999-12-11 Koninkl Philips Electronics Nv Transmission system with improved speech encoder
US6810377B1 (en) * 1998-06-19 2004-10-26 Comsat Corporation Lost frame recovery techniques for parametric, LPC-based speech coding systems
US6122531A (en) * 1998-07-31 2000-09-19 Motorola, Inc. Method for selectively including leading fricative sounds in a portable communication device operated in a speakerphone mode
US7072832B1 (en) * 1998-08-24 2006-07-04 Mindspeed Technologies, Inc. System for speech encoding having an adaptive encoding arrangement
US6275798B1 (en) * 1998-09-16 2001-08-14 Telefonaktiebolaget L M Ericsson Speech coding with improved background noise reproduction
SE9803698L (sv) 1998-10-26 2000-04-27 Ericsson Telefon Ab L M Metoder och anordningar i ett telekommunikationssystem
US7124079B1 (en) * 1998-11-23 2006-10-17 Telefonaktiebolaget Lm Ericsson (Publ) Speech coding with comfort noise variability feature for increased fidelity
BRPI9915652B1 (pt) * 1998-11-24 2016-09-06 Ericsson Telefon Ab L M processo para realizar transmissão descontínua num sistema de comunicações, e, sistema de comunicações de fala
US6691084B2 (en) * 1998-12-21 2004-02-10 Qualcomm Incorporated Multiple mode variable rate speech coding
SE9903553D0 (sv) * 1999-01-27 1999-10-01 Lars Liljeryd Enhancing percepptual performance of SBR and related coding methods by adaptive noise addition (ANA) and noise substitution limiting (NSL)
IL129752A (en) * 1999-05-04 2003-01-12 Eci Telecom Ltd Telecommunication method and system for using same
GB2350532B (en) * 1999-05-28 2001-08-08 Mitel Corp Method to generate telephone comfort noise during silence in a packetized voice communication system
JP3451998B2 (ja) * 1999-05-31 2003-09-29 日本電気株式会社 無音声符号化を含む音声符号化・復号装置、復号化方法及びプログラムを記録した記録媒体
JP4464484B2 (ja) * 1999-06-15 2010-05-19 パナソニック株式会社 雑音信号符号化装置および音声信号符号化装置
US6782361B1 (en) 1999-06-18 2004-08-24 Mcgill University Method and apparatus for providing background acoustic noise during a discontinued/reduced rate transmission mode of a voice transmission system
FI991605L (fi) * 1999-07-14 2001-01-15 Nokia Networks Oy Menetelmä puhekodaukseen ja puhekoodaukseen tarvittavan laskentakapasi teetin vähentämiseksi ja verkkoelementti
JP3417362B2 (ja) * 1999-09-10 2003-06-16 日本電気株式会社 音声信号復号方法及び音声信号符号化復号方法
US6708024B1 (en) * 1999-09-22 2004-03-16 Legerity, Inc. Method and apparatus for generating comfort noise
US6959274B1 (en) * 1999-09-22 2005-10-25 Mindspeed Technologies, Inc. Fixed rate speech compression system and method
JP3478209B2 (ja) * 1999-11-01 2003-12-15 日本電気株式会社 音声信号復号方法及び装置と音声信号符号化復号方法及び装置と記録媒体
GB2356538A (en) 1999-11-22 2001-05-23 Mitel Corp Comfort noise generation for open discontinuous transmission systems
US6826527B1 (en) * 1999-11-23 2004-11-30 Texas Instruments Incorporated Concealment of frame erasures and method
US7263074B2 (en) * 1999-12-09 2007-08-28 Broadcom Corporation Voice activity detection based on far-end and near-end statistics
US6510409B1 (en) * 2000-01-18 2003-01-21 Conexant Systems, Inc. Intelligent discontinuous transmission and comfort noise generation scheme for pulse code modulation speech coders
KR100875781B1 (ko) 2000-03-13 2008-12-24 소니 가부시끼 가이샤 콘텐츠 공급 장치 및 방법과, 기록 매체
KR20030007483A (ko) * 2000-03-31 2003-01-23 텔레폰악티에볼라겟엘엠에릭슨(펍) 음성 정보를 송신하는 방법 및 음성 정보 송신용 전자통신 장치
EP1139337A1 (en) * 2000-03-31 2001-10-04 Telefonaktiebolaget L M Ericsson (Publ) A method of transmitting voice information and an electronic communications device for transmission of voice information
DE10017646A1 (de) * 2000-04-08 2001-10-11 Alcatel Sa Geräuschunterdrückung im Zeitbereich
US7075907B1 (en) 2000-06-06 2006-07-11 Nokia Corporation Method for signalling DTX periods and allocation of new channels in a statistical multiplexed radio interface
US7146176B2 (en) 2000-06-13 2006-12-05 Shared Spectrum Company System and method for reuse of communications spectrum for fixed and mobile applications with efficient method to mitigate interference
JP3670217B2 (ja) * 2000-09-06 2005-07-13 国立大学法人名古屋大学 雑音符号化装置、雑音復号装置、雑音符号化方法および雑音復号方法
US6829577B1 (en) * 2000-11-03 2004-12-07 International Business Machines Corporation Generating non-stationary additive noise for addition to synthesized speech
US6662155B2 (en) * 2000-11-27 2003-12-09 Nokia Corporation Method and system for comfort noise generation in speech communication
US7505594B2 (en) * 2000-12-19 2009-03-17 Qualcomm Incorporated Discontinuous transmission (DTX) controller system and method
US6708147B2 (en) * 2001-02-28 2004-03-16 Telefonaktiebolaget Lm Ericsson(Publ) Method and apparatus for providing comfort noise in communication system with discontinuous transmission
US7012901B2 (en) * 2001-02-28 2006-03-14 Cisco Systems, Inc. Devices, software and methods for generating aggregate comfort noise in teleconferencing over VoIP networks
US7031916B2 (en) * 2001-06-01 2006-04-18 Texas Instruments Incorporated Method for converging a G.729 Annex B compliant voice activity detection circuit
US20030120484A1 (en) 2001-06-12 2003-06-26 David Wong Method and system for generating colored comfort noise in the absence of silence insertion description packets
US20020198708A1 (en) * 2001-06-21 2002-12-26 Zak Robert A. Vocoder for a mobile terminal using discontinuous transmission
JP4518714B2 (ja) * 2001-08-31 2010-08-04 富士通株式会社 音声符号変換方法
US7177801B2 (en) * 2001-12-21 2007-02-13 Texas Instruments Incorporated Speech transfer over packet networks using very low digital data bandwidths
GB2384946B (en) 2002-01-31 2005-11-09 Samsung Electronics Co Ltd Communications terminal
ATE322732T1 (de) * 2002-07-02 2006-04-15 Teltronic S A U Verfahren zur erzeugung von komfortgeräusch- rahmen (cnf)
DE60210437D1 (de) * 2002-07-02 2006-05-18 Teltronic S A U Verfahren zur Synthese von Komfortgeräusch-Rahmen
KR100556831B1 (ko) * 2003-03-25 2006-03-10 한국전자통신연구원 전역 펄스 교체를 통한 고정 코드북 검색 방법
US7243065B2 (en) * 2003-04-08 2007-07-10 Freescale Semiconductor, Inc Low-complexity comfort noise generator
US7379473B2 (en) * 2003-06-03 2008-05-27 Motorola, Inc. Method and system for providing integrated data services to increase spectrum efficiency
US7409010B2 (en) 2003-06-10 2008-08-05 Shared Spectrum Company Method and system for transmitting signals with reduced spurious emissions
US7570937B2 (en) * 2003-08-21 2009-08-04 Acoustic Technologies, Inc. Comfort noise generator
US20050078629A1 (en) * 2003-10-14 2005-04-14 Hao Bi Channel allocation extension in wireless communications networks and methods
US7465413B2 (en) * 2004-05-11 2008-12-16 Panasonic Corporation Phosphor and plasma display panel using the same
EP1775717B1 (en) * 2004-07-20 2013-09-11 Panasonic Corporation Speech decoding apparatus and compensation frame generation method
US8670988B2 (en) * 2004-07-23 2014-03-11 Panasonic Corporation Audio encoding/decoding apparatus and method providing multiple coding scheme interoperability
US7917356B2 (en) 2004-09-16 2011-03-29 At&T Corporation Operating method for voice activity detection/silence suppression system
US8265929B2 (en) * 2004-12-08 2012-09-11 Electronics And Telecommunications Research Institute Embedded code-excited linear prediction speech coding and decoding apparatus and method
DE102004063290A1 (de) * 2004-12-29 2006-07-13 Siemens Ag Verfahren zur Anpassung von Comfort Noise Generation Parametern
FR2881867A1 (fr) * 2005-02-04 2006-08-11 France Telecom Procede de transmission de marques de fin de parole dans un systeme de reconnaissance de la parole
US7983906B2 (en) * 2005-03-24 2011-07-19 Mindspeed Technologies, Inc. Adaptive voice mode extension for a voice activity detector
CA2612903C (en) * 2005-06-20 2015-04-21 Telecom Italia S.P.A. Method and apparatus for transmitting speech data to a remote device in a distributed speech recognition system
US7610197B2 (en) 2005-08-31 2009-10-27 Motorola, Inc. Method and apparatus for comfort noise generation in speech communication systems
US20070136055A1 (en) * 2005-12-13 2007-06-14 Hetherington Phillip A System for data communication over voice band robust to noise
US7599430B1 (en) * 2006-02-10 2009-10-06 Xilinx, Inc. Fading channel modeling
US7831420B2 (en) * 2006-04-04 2010-11-09 Qualcomm Incorporated Voice modifier for speech processing systems
US8326313B2 (en) 2006-05-12 2012-12-04 Shared Spectrum Company Method and system for dynamic spectrum access using detection periods
US8027249B2 (en) 2006-10-18 2011-09-27 Shared Spectrum Company Methods for using a detector to monitor and detect channel occupancy
US8997170B2 (en) * 2006-12-29 2015-03-31 Shared Spectrum Company Method and device for policy-based control of radio
US7564816B2 (en) * 2006-05-12 2009-07-21 Shared Spectrum Company Method and system for determining spectrum availability within a network
US9538388B2 (en) 2006-05-12 2017-01-03 Shared Spectrum Company Method and system for dynamic spectrum access
US8184653B2 (en) 2007-08-15 2012-05-22 Shared Spectrum Company Systems and methods for a cognitive radio having adaptable characteristics
US8155649B2 (en) 2006-05-12 2012-04-10 Shared Spectrum Company Method and system for classifying communication signals in a dynamic spectrum access system
US8055204B2 (en) 2007-08-15 2011-11-08 Shared Spectrum Company Methods for detecting and classifying signals transmitted over a radio frequency spectrum
WO2008007700A1 (en) 2006-07-12 2008-01-17 Panasonic Corporation Sound decoding device, sound encoding device, and lost frame compensation method
US8725499B2 (en) * 2006-07-31 2014-05-13 Qualcomm Incorporated Systems, methods, and apparatus for signal change detection
CN101246688B (zh) * 2007-02-14 2011-01-12 华为技术有限公司 一种对背景噪声信号进行编解码的方法、系统和装置
AU2008221657B2 (en) * 2007-03-05 2010-12-02 Telefonaktiebolaget Lm Ericsson (Publ) Method and arrangement for smoothing of stationary background noise
WO2008121035A1 (en) * 2007-03-29 2008-10-09 Telefonaktiebolaget Lm Ericsson (Publ) Method and speech encoder with length adjustment of dtx hangover period
US8412209B2 (en) * 2007-06-18 2013-04-02 Motorola Mobility Llc Use of the physical uplink control channel in a 3rd generation partnership project communication system
US20090043577A1 (en) * 2007-08-10 2009-02-12 Ditech Networks, Inc. Signal presence detection using bi-directional communication data
CN101335003B (zh) * 2007-09-28 2010-07-07 华为技术有限公司 噪声生成装置、及方法
CN100555414C (zh) * 2007-11-02 2009-10-28 华为技术有限公司 一种dtx判决方法和装置
US8483854B2 (en) * 2008-01-28 2013-07-09 Qualcomm Incorporated Systems, methods, and apparatus for context processing using multiple microphones
DE102008009719A1 (de) 2008-02-19 2009-08-20 Siemens Enterprise Communications Gmbh & Co. Kg Verfahren und Mittel zur Enkodierung von Hintergrundrauschinformationen
CN100550133C (zh) * 2008-03-20 2009-10-14 华为技术有限公司 一种语音信号处理方法及装置
CN101335000B (zh) 2008-03-26 2010-04-21 华为技术有限公司 编码的方法及装置
WO2010003556A1 (en) * 2008-07-11 2010-01-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder, methods for encoding and decoding an audio signal, audio stream and computer program
EP2319260A2 (en) 2008-08-19 2011-05-11 Shared Spectrum Company Method and system for dynamic spectrum access using specialty detectors and improved networking
US8688045B2 (en) * 2008-11-19 2014-04-01 Qualcomm Incorporated FM transmitter and non-FM receiver integrated on single chip
TWI488177B (zh) 2011-02-14 2015-06-11 Fraunhofer Ges Forschung 使用頻譜域雜訊整形之基於線性預測的編碼方案
CN102959620B (zh) 2011-02-14 2015-05-13 弗兰霍菲尔运输应用研究公司 利用重迭变换的信息信号表示
TWI488176B (zh) 2011-02-14 2015-06-11 Fraunhofer Ges Forschung 音訊信號音軌脈衝位置之編碼與解碼技術
ES2588483T3 (es) * 2011-02-14 2016-11-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Decodificador de audio que comprende un estimador de ruido de fondo
KR101551046B1 (ko) 2011-02-14 2015-09-07 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 저-지연 통합 스피치 및 오디오 코딩에서 에러 은닉을 위한 장치 및 방법
RU2586597C2 (ru) 2011-02-14 2016-06-10 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Кодирование и декодирование позиций импульсов дорожек аудиосигнала
JP6110314B2 (ja) 2011-02-14 2017-04-05 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン 整列したルックアヘッド部分を用いてオーディオ信号を符号化及び復号するための装置並びに方法
CN103534754B (zh) * 2011-02-14 2015-09-30 弗兰霍菲尔运输应用研究公司 在不活动阶段期间利用噪声合成的音频编解码器
CN103493129B (zh) 2011-02-14 2016-08-10 弗劳恩霍夫应用研究促进协会 用于使用瞬态检测及质量结果将音频信号的部分编码的装置与方法
BR112013020239B1 (pt) * 2011-02-14 2021-12-21 Fraunhofer-Gellschaft Zur Förderung Der Angewandten Forschung E.V. Geração de ruído em codecs de áudio
PL2676268T3 (pl) 2011-02-14 2015-05-29 Fraunhofer Ges Forschung Urządzenie i sposób przetwarzania zdekodowanego sygnału audio w domenie widmowej
JP6019969B2 (ja) * 2011-11-22 2016-11-02 ヤマハ株式会社 音響処理装置
PL2927905T3 (pl) * 2012-09-11 2017-12-29 Telefonaktiebolaget Lm Ericsson (Publ) Generowanie szumu komfortowego
CN105225668B (zh) * 2013-05-30 2017-05-10 华为技术有限公司 信号编码方法及设备
CN104978970B (zh) * 2014-04-08 2019-02-12 华为技术有限公司 一种噪声信号的处理和生成方法、编解码器和编解码系统
US9666204B2 (en) 2014-04-30 2017-05-30 Qualcomm Incorporated Voice profile management and speech signal generation
US9775110B2 (en) * 2014-05-30 2017-09-26 Apple Inc. Power save for volte during silence periods
EP2980790A1 (en) * 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for comfort noise generation mode selection
EP2980796A1 (en) * 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Method and apparatus for processing an audio signal, audio decoder, and audio encoder
GB2532041B (en) * 2014-11-06 2019-05-29 Imagination Tech Ltd Comfort noise generation
US10332520B2 (en) 2017-02-13 2019-06-25 Qualcomm Incorporated Enhanced speech generation
US10978096B2 (en) * 2017-04-25 2021-04-13 Qualcomm Incorporated Optimized uplink operation for voice over long-term evolution (VoLte) and voice over new radio (VoNR) listen or silent periods
US10855841B1 (en) * 2019-10-24 2020-12-01 Qualcomm Incorporated Selective call notification for a communication device
CN116348951A (zh) 2020-07-30 2023-06-27 弗劳恩霍夫应用研究促进协会 用于编码音频信号或用于解码经编码音频场景的设备、方法及计算机程序
CN116229993B (zh) * 2021-12-02 2026-04-03 腾讯科技(深圳)有限公司 信号传输方法、装置、电子设备和计算机可读存储介质

Family Cites Families (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4969192A (en) * 1987-04-06 1990-11-06 Voicecraft, Inc. Vector adaptive predictive coder for speech and audio
CA2010830C (en) * 1990-02-23 1996-06-25 Jean-Pierre Adoul Dynamic codebook for efficient speech coding based on algebraic codes
FI98104C (fi) * 1991-05-20 1997-04-10 Nokia Mobile Phones Ltd Menetelmä herätevektorin generoimiseksi ja digitaalinen puhekooderi
FI95085C (fi) * 1992-05-11 1995-12-11 Nokia Mobile Phones Ltd Menetelmä puhesignaalin digitaaliseksi koodaamiseksi sekä puhekooderi menetelmän suorittamiseksi
US5630016A (en) * 1992-05-28 1997-05-13 Hughes Electronics Comfort noise generation for digital communication systems
FI99066C (fi) * 1995-01-31 1997-09-25 Nokia Mobile Phones Ltd Tiedonsiirtomenetelmä
SE9500858L (sv) * 1995-03-10 1996-09-11 Ericsson Telefon Ab L M Anordning och förfarande vid talöverföring och ett telekommunikationssystem omfattande dylik anordning
WO1996034382A1 (en) * 1995-04-28 1996-10-31 Northern Telecom Limited Methods and apparatus for distinguishing speech intervals from noise intervals in audio signals
FR2739995B1 (fr) 1995-10-13 1997-12-12 Massaloux Dominique Procede et dispositif de creation d'un bruit de confort dans un systeme de transmission numerique de parole
US5794199A (en) * 1996-01-29 1998-08-11 Texas Instruments Incorporated Method and system for improved discontinuous speech transmission
US6269331B1 (en) * 1996-11-14 2001-07-31 Nokia Mobile Phones Limited Transmission of comfort noise parameters during discontinuous transmission

Also Published As

Publication number Publication date
DE69724739T2 (de) 2004-07-22
DE69724739D1 (de) 2003-10-16
US5960389A (en) 1999-09-28
EP0843301B1 (en) 2003-09-10
BR9705747A (pt) 1999-03-30
BR9705747B1 (pt) 2011-11-01
EP0843301A2 (en) 1998-05-20
CN100350807C (zh) 2007-11-21
CN1200000A (zh) 1998-11-25
EP0843301A3 (en) 1999-05-06
ATE249671T1 (de) 2003-09-15
US6606593B1 (en) 2003-08-12
AR010612A1 (es) 2000-06-28

Similar Documents

Publication Publication Date Title
EP0843301B1 (en) Methods for generating comfort noise during discontinous transmission
US6816832B2 (en) Transmission of comfort noise parameters during discontinuous transmission
US5812965A (en) Process and device for creating comfort noise in a digital speech transmission system
EP1337999B1 (en) Method and system for comfort noise generation in speech communication
ES2299175T3 (es) Procedimiento y aparato para realizar vocodificacion con tasa reducida y tasa variable.
US5835889A (en) Method and apparatus for detecting hangover periods in a TDMA wireless communication system using discontinuous transmission
ES2212642T3 (es) Dispositivo de codificacion perceptual y metodo para la codificacion eficaz de señales de banda ancha.
ES2217772T3 (es) Tecnicas mejoradas de recuperacion de tramas perdidas para sistemas parametricos de codificacion predictiva de voz.
EP0544101B1 (en) Method and apparatus for the transmission of speech signals
JP3432822B2 (ja) 可変速度ボコーダ
ES2266003T3 (es) Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha.
EP0848374B1 (en) A method and a device for speech encoding
RU2284664C2 (ru) Способ улучшенного обнаружения ошибок скорости в приемниках с переменной скоростью и устройство для его осуществления
EP1089257A2 (en) Header data formatting for a vocoder
EP1093113A2 (en) Method and apparatus for dynamic segmentation of a low bit rate digital voice message
EP1091348A2 (en) Method and apparatus for non-speech activity reduction of a low bit rate digital voice message
EP1089255A2 (en) Method and apparatus for pitch determination of a low bit rate digital voice message
JP3464371B2 (ja) 不連続伝送中に快適雑音を発生させる改善された方法
TWI333640B (en) Method and information processing system for quantizing pitch information of audio
KR100763325B1 (ko) 분산 음성 인식을 위한 클래스 양자화
US6240383B1 (en) Celp speech coding and decoding system for creating comfort noise dependent on the spectral envelope of the speech signal
EP1199710A1 (en) Device for encoding/decoding voice and for voiceless encoding, decoding method, and recorded medium on which program is recorded
JP3055608B2 (ja) 音声符号化方法および装置
JP3279288B2 (ja) デジタル移動通信方式
JP3593183B2 (ja) 音声復号装置