ES2261619T3 - Metodo de generacion de tramas de ruido aceptable. - Google Patents

Metodo de generacion de tramas de ruido aceptable.

Info

Publication number
ES2261619T3
ES2261619T3 ES02380144T ES02380144T ES2261619T3 ES 2261619 T3 ES2261619 T3 ES 2261619T3 ES 02380144 T ES02380144 T ES 02380144T ES 02380144 T ES02380144 T ES 02380144T ES 2261619 T3 ES2261619 T3 ES 2261619T3
Authority
ES
Spain
Prior art keywords
frames
code
voice
parameters
block
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES02380144T
Other languages
English (en)
Inventor
Paloma Garcia
Enrique Masgrau Gomez
Eduardo Lleida Solano
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Teltronic SA
Original Assignee
Teltronic SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Teltronic SA filed Critical Teltronic SA
Application granted granted Critical
Publication of ES2261619T3 publication Critical patent/ES2261619T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/012—Comfort noise or silence coding
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16—Vocoder architecture
    • G10L19/173—Transcoding, i.e. converting between two coded representations avoiding cascaded coding-decoding

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
  • Audible-Bandwidth Dynamoelectric Transducers Other Than Pickups (AREA)
  • Soundproofing, Sound Blocking, And Sound Damping (AREA)

Abstract

Método de generación de tramas de ruido aceptable (CNF, Comfort Noise Frame), aplicable concretamente en combinación con un terminal de emisión, en el que dicha generación se lleva a cabo aplicando un algoritmo a los parámetros proporcionados por el terminal (1) del codificador de voz al bloque (2) de control del codificador de voz, siendo este terminal de codificador de voz un codificador de voz del tipo ACELP (Algebraic Code Exciting Linear Predictive, codificación algebraica por excitación lineal predictiva), cada una con tramas de 30 ms divididas en cuatro tramas secundarias de 7, 5 ms, y que aceptan muestras de voz cuantificadas de 16 bits, incluyendo dicho bloque (2) de control del codificador de voz un bloque (2e) de detector de actividad vocal (VAD, Vocal Activity Detector) y un bloque (2d) de cálculo de parámetros de ruido aceptable, comprendiendo adicionalmente el método las siguientes fases: a) detectar por medio del detector VAD la falta de actividad de voz en una señal de transmisión enviada por el terminal de emisión, b) calcular la trama CNF como un conjunto de parámetros LSP, ganancias de código y tono que deben transmitirse periódicamente desde el emisor durante el estado de silencio de este último, y caracterizado por c) alternar valores de cuantificación de la energía que va a codificarse en las cuatro últimas tramas disponibles, de tal manera que el promedio de los valores para las cuatro tramas sea lo más próximo posible a la energía deseada, y d) con una transmisión de los valores del índice del código algebraico y adaptativo correspondientes a los calculados en la última trama.

Description

Método de generación de tramas de ruido aceptable.
Objetivo de la invención
La presente invención se refiere a un método de generación de tramas de ruido aceptable (CNF, Comfort Noise Frame) que proporciona características novedosas fundamentales y ventajas significativas con respecto a los medios conocidos y utilizados para los mismos propósitos en el estado actual de la técnica.
Más específicamente, la invención propone el desarrollo de un método mediante el cual sea posible llevar a cabo la generación de tramas capaces de utilizarse en la generación de ruido de fondo en un receptor con el fin de la transmisión intermitente desde un emisor en los sistemas TETRA, es decir, durante los periodos de tiempo en los que dicho emisor se encuentra en silencio, obteniéndose este ruido de dichas tramas CNF. El método desarrolla un algoritmo para la generación de dichas tramas. El campo de aplicación de la invención se encuentra dentro del campo de las telecomunicaciones en general y, más específicamente, en el sector de las radiocomunicaciones.
Antecedentes y sumario de la invención
Expertos en la materia conocen las características que definen el estándar TETRA basado en la ejecución intermitente de una emisión desde un dispositivo de emisión adecuado, cuya emisión debe recibirse y completarse en el dispositivo receptor correspondiente. En realidad, dicho sistema TETRA permite, como una opción de funcionamiento, que, mientras una persona que está hablando desde un dispositivo de emisión se mantiene en silencio (ausencia de voz o tonos), el dispositivo de emisión envíe periódicamente una trama, denominada una "trama de ruido aceptable (CNF)", en la que las características espectrales del ruido ambiental se parametrizan como si fuesen una señal de voz normal, de tal manera que al cesar de emitir durante periodos de tiempo alternantes, se logra un ahorro considerable de las baterías de alimentación del terminal, así como también una reducción de las interferencias co-canal con el resto de los usuarios del sistema. El envío de esta trama se le indica al receptor mediante la inserción de una instrucción CNF en la primera mitad de una ranura, reservando la segunda mitad de la ranura para la inclusión de la parametrización del ruido.
EL dispositivo de emisión no transmite esta información de ruido de fondo durante varias tramas subsiguientes, número de tramas que es un compromiso entre la frecuencia deseada actualizada, el peligro de desconexión de la base debido a la ausencia de la señal en el enlace ascendente y el nivel deseado de ahorro energético y la reducción de interferencia co-canal. En el momento en el que el detector de actividad vocal (VAD, Vocal Activity Detector) de dicho dispositivo de emisión detecta la presencia de una señal de información, inmediatamente éste conmuta al modo de transmisión normal.
En lo relativo al dispositivo de recepción, éste debe poder reconstruir la señal de ruido ambiental a partir de dicha trama periódica mientras se mantiene el silencio en el dispositivo de emisión. La reconstrucción de dicha señal se lleva a cabo mediante la recepción de una instrucción CNF, aplicando un algoritmo a los parámetros CNF recibidos para la generación de la trama con la información del ruido recibido, y se llevará a cabo una síntesis en las tramas subsiguientes basándose en un determinado algoritmo. Cuando se recibe una nueva trama de ruido, éste procede de la misma manera que con la primera instrucción CNF y se actualizan determinados parámetros utilizados en la síntesis.
Algunos métodos y dispositivos ya se conocen en el estado de la técnica, mediante los cuales se llevan a cabo determinados aspectos de la síntesis y análisis del habla, su codificación y descodificación. En este sentido, se citan más adelante aquellos que actualmente constituyen la técnica anterior más relevante.
La patente internacional PCT número WO 00/11648 se refiere a un decodificador de voz que utiliza un detector de actividad vocal en la codificación del ruido. Dicho documento propone varios métodos para generar la señal de voz en caso de ausencia de actividad vocal, entre los que existe un método basado en la generación de una secuencia de excitación aleatoria que puede generarse en el decodificador de voz. Otros métodos propuestos se basan en el uso de información relativa al nivel de energía o al perfil espectral.
La patente estadounidense número 5.642.464 describe métodos y aparatos para el acondicionamiento del ruido en los sistemas digitales de compresión de voz mediante el uso de codificación lineal predictiva, y propone un método de procesamiento (ausencia de voz) de señales de ruido que consiste en el cálculo de los coeficientes LPC (Lineal Predictive Coding, codificación lineal predictiva), y prevé para ello muestras de ese intervalo de ruido y muestras de una pluralidad de intervalos de señal anteriores.
La patente estadounidense número 6.240.383 se refiere a un sistema de codificación y decodificación de voz para la creación de ruido aceptable en función de la envolvente espectral de la señal de voz mediante medios de almacenamiento de los parámetros LPC de la primera señal no de voz antes de conmutar a no-voz.
La presente invención se refiere a un método de generación de tramas de ruido aceptable (CNF), que tiene el objetivo de obtener este tipo de tramas en la terminal de recepción durante los periodos de inactividad de voz del emisor mediante la aplicación de un algoritmo apropiado.
De este modo, en el caso de la presente invención y ya que la técnica utilizada puede usarse también en la transmisión de señales GSM (Global System for Mobile Communications, sistema global para comunicaciones móviles), el método prevé, por un lado, la adaptación de un detector de actividad de voz (VAD, Voice Activity Detector) de manera que puede utilizarse en terminales TETRA y, por otro lado, el desarrollo y la utilización de estrategias algorítmicas capaces de llevarse a cabo mediante el bloque de cálculo de parámetros de ruido aceptable para generar los parámetros CNF que van a transmitirse periódicamente durante los periodos de silencio.
En correspondencia, la presente invención se refiere a un método de generación de tramas de ruido aceptable (CNF) según se indica en la reivindicación 1.
Breve descripción de los dibujos
Estas y otras características y ventajas de la invención resultarán evidentes de forma más clara basándose en la siguiente descripción detallada de una realización preferida, dada solamente como un ejemplo ilustrativo, mas no limitativo, con referencia a los dibujos adjuntos en los que:
las figuras 1 y 2 muestran representaciones gráficas ilustrativas de los bloques de los dispositivos de codificación y decodificación respectivamente, de acuerdo a ese estándar abarcado por el estándar TETRA;
la figura 3 muestra un diagrama ilustrativo de la operación del codificador vocal TETRA cuando la función de ruido aceptable está activa;
la figura 4 muestra una representación esquemática de un decodificador de actividad de voz (VAD) del tipo GSM;
la figura 5 muestra finalmente una representación de un codificador TETRA con indicación de los puntos de extracción de los parámetros necesitados por el detector VAD.
Descripción de un ejemplo de realización preferido
Tal como se ha indicado anteriormente, la descripción detallada de la realización preferida de la invención se llevará a cabo mediante el uso de los dibujos adjuntos con los fines de proporcionar, en primer lugar, y con fines ilustrativos, las representaciones de la técnica convencional que aparece en las figuras 1 y 2.
Como puede observarse, el diagrama de bloques de la figura 1 corresponde a un codificador estructurado en el terminal de emisión de acuerdo con el estándar TETRA e incluye un bloque 1 codificador de voz y un bloque 2 de control del codificador de voz, incluyendo este último varios bloques secundarios entre los que se distingue un bloque 2a secundario para funciones en modo de prueba, un bloque 2b secundario para la función de reinicio del codificador 1, un bloque 2c secundario para la función de toma de la trama, un bloque 2d secundario responsable de la función de ruido aceptable, un bloque 2e secundario para la función de importancia de la voz, y, por último, un bloque 2f secundario de interfaz de cifrado. Los bloques afectados por la introducción del ruido aceptable son, en particular, aquellos indicados como bloque 2d secundario de función de control de ruido y el bloque 2e secundario de función de importancia de la voz. La detección de la actividad de voz se lleva a cabo en este último bloque secundario, mientras que el bloque 2d secundario de función de ruido aceptable es responsable de llevar a cabo los cálculos de los parámetros del ruido aceptable que van a enviarse en la ranura CNF basándose en los parámetros proporcionados por el codificador 1 de voz.
En lo que concierne al dispositivo decodificador de acuerdo al estándar TETRA, incorporado en el terminal de recepción y mostrado esquemáticamente en el dibujo de la figura 2, éste incluye un bloque 3 de control del decodificador de voz y un bloque 4 decodificador de voz. En el bloque 3 de control se distinguen varios bloques secundarios, tales como el bloque 3a secundario de interfaz de cifrado, el bloque 3b secundario de función de reinicio del decodificador 4, el bloque 3c secundario de generación de trama faltante, el bloque 3d secundario de sustitución de trama faltante y el bloque 3e secundario destinado a las funciones de modo de prueba. En este caso, los bloques afectados por el ruido aceptable son, particularmente, el bloque 3c secundario, correspondiente a al generación de trama faltante, que detecta la presencia de una ranura CNF y lleva acabo la síntesis de las tramas de ruido, y el bloque 3d secundario de sustitución de trama faltante con el que la trama proporcionada por el bloque 3c secundario de generación de trama faltante simplemente se introduce en la trama alimentada a dicho decodificador 4 de voz.
De acuerdo con la invención, el método propuesto consiste precisamente en la generación de un algoritmo para generar las tramas de ruido aceptable (CNF) en el terminal de recepción y, con este fin, se desarrollan las estrategias algorítmicas que se definirán más adelante. En cualquier caso, los bloques secundarios emisores que intervienen en la implementación del método corresponden a los indicados mediante las referencias numéricas 2d y 2e, es decir, los bloques secundarios de la función del ruido aceptable y la función de la importancia de la voz, respectivamente, que aparecen en el esquema de al figura 1. De éstos, el bloque 2e secundario de la función de importancia de la voz corresponde en realidad al detector de actividad de voz (VAD). El detector VAD utilizado por la invención se basa en el estándar GSM [véase: Digital cellular telecomunications system (phase 2); Voice Activity Decoder (VAD) for enhanced full rate (EFR) speech traffic channels (GSM 06.82 version 4.01). Documento ETSI EN 301 249 v4.0.1. (12-1997)] [1]. Sin embargo, la invención prevé la introducción de variaciones en el VAD del tipo GSM con el fin de adaptarlo a las peculiaridades del codificador de voz según el estándar TETRA.
Por otra parte, el bloque 2d de la función de ruido aceptable es responsable de llevar a cabo el cálculo de los parámetros que van a enviarse a una trama correspondiente a una ranura CNF.
La figura 3 muestra esquemáticamente el modo de operación del codificador de voz TETRA cuando la capacidad de ruido está activa. En esta figura, las ranuras 5 no sombreadas corresponden a ranuras de voz o ranuras, CFN mientras que las ranuras 6 (sombreadas a rayas) sombreadas corresponden a los periodos de inactividad del transmisor. Cuando se transmite una trama CNF, se suspende temporalmente la transmisión (ranuras 6 sombreadas) hasta que una ranura 5 de voz transmita nuevamente, o la información CNF deba actualizarse al receptor (periodo de actualización CNF indicado con "T" en la figura 3).
Como se indica previamente, el método de la invención prevé la introducción de modificaciones en el sistema VAD según el estándar GSM para su adaptación a las particularidades del codificador de voz TETRA de acuerdo con la descripción siguiente. Las particularidades y características del detector VAD correspondientes a dicho GSM estándar se describen detalladamente en el documento [1] que se ha mencionado anteriormente.
El codificador de voz TETRA funciona con tramas de 30 ms divididas cada una de ellas en 4 tramas secundarias de 7,5 ms, mientras que el codificador de voz según el estándar GSM funciona con tramas de 20 ms cada una de ellas con cuatro tramas secundarias de 5 ms. Además, el codificador de voz TETRA acepta muestras de voz cuantificadas en 16 bits (15 más uno de signo), cuya proporción se cambia a continuación en 2, lo que implica 15 bits. En cambio, el codificador de voz GSM acepta muestras en 13 bits. Ambas diferencias afectan a los niveles de energía por trama que en el caso de TETRA, serán 1,5x(4)2=24 veces más grandes que el del GSM. Tantas veces como los cálculos VAD requieran el uso de magnitudes dependientes de la energía de las tramas, será preciso adaptarlas a la longitud de la trama TETRA.
El detector VAD GSM estándar consiste básicamente en un detector de energía mediante umbral (un alto nivel de energía indica voz; un bajo nivel de energía indica silencio). Esta detección se lleva a cabo mediante una señal de indicación por medio de un filtrado adaptado a las características del ruido, empleando un umbral de decisión adaptado de forma continua de acuerdo con las características de la presente señal.
La figura 4 muestra un esquema de bloques del detector VAD del sistema GSM con las siguientes funcionalidades: bloque 7a, filtrado adaptativo y cálculo de energía; bloque 7b, detección periódica; bloque 7c, detección del tono; bloque 7d, ACF promediada; bloque 7e, cálculo de valores de predicción; bloque 7f, comparación espectral; bloque 7g, adaptación del umbral; bloque 7h, decisión VAD; y bloque 7i, adición de persistencia VAD. También puede observarse la existencia de tres entradas, indicadas respectivamente como E_{1}, E_{2} y E_{3}, procedentes del codificador de voz TETRA, al tiempo que proporciona una salida sencilla, indicada como S1, que consiste en una variable de indicador vad que adopta un valor de "1" en el caso de la presencia de voz, y un valor de "0" en el caso de silencio. Las tres entradas E_{1} a E_{3}, asociadas con los bloques 7a, 7b y 7c son, respectivamente, los 8 coeficientes de autocorrelación de la trama actual (acf) (podrían ser hasta 10, que son los calculados por el codificador de voz TETRA; sin embargo, en el caso de la presente invención, se ha elegido mantener el número 8, tal como en el estándar GSM, dado que el cálculo más costoso es el de los coeficientes LPC que debe llevarse a cabo específicamente en el detector VAD); los cuatro retardos del código adaptativo, correspondientes a cada una de las cuatro tramas secundarias, muestran un valor estimado de la periodicidad o altura de la señal (retardos); y los primeros cuatro coeficientes de reflexión LPC (rc).
Los coeficientes acf de la entrada E1 proporcionan la información necesaria para llevar a cabo un filtrado de indicación de la señal de entrada, mejorando su relación SNR (Signal-Noise Ratio, relación señal a ruido), e intervienen en decidir si adapta el umbral de energía de ruido: sí, en el caso de clasificar previamente la trama actual como ruido; no, en el caso de clasificarla previamente como una señal de información (habla o tonos). Los valores de retardo de la entrada E_{2} permiten detectar tramas de voz audibles con una periodicidad bien definida, en cuyo caso no actualiza el umbral de decisión. Los cuatro primeros coeficientes de reflexión a través de la entrada E_{3} permiten detectar de forma eficaz la presencia de tonos, que también determina no actualizar el umbral. Es interesante señalar que los tres tipos de señal intervienen en la decisión de actualizar o no actualizar el umbral de energía, pero sólo los coeficientes acf de la entrada E_{1} son los utilizados para obtener el nivel de energía, para tomar la decisión final y en el cálculo del filtro de indicación.
Para fines ilustrativos se muestra a continuación una tabla con los valores adoptados por los diferentes parámetros del detector VAD GSM estándar.
Parámetro Valor
Pth 130000*1,5
Plev 130000*1,5
Adp 6
Dec 16
(Continuación)
Parámetro Valor
Inc 8
Fac 2
Margen 150000000*1,5
Umbral (comparación espectral) 0,056
FREQTH (detección de tono) 0,0973
PREDTH (detección de tono) 0,0447
LTHRESH (detección de periodicidad) 2
NTHRESH 6
Cte. Hang (persistencia VAD) 10
Cte. ráfaga (persistencia VAD) 3
La figura 5 muestra una vista esquemática de un diagrama de bloques correspondiente a un codificador de voz TETRA constituido por un número de bloques secundarios que no se describirán en detalle dado que son conocidos en sí mismos y de los cuales sólo se hará referencia a los que intervienen en el desarrollo del método de la invención para extraer la información útil requerida por el detector VAD para tomar su decisión. Para este propósito es necesario mencionar los bloques 8a secundarios de autocorrelación y selección de ventana, 8b de la función algorítmica Levinson-Durbin y 8c de la búsqueda del mejor retardo y ganancia. Un primer punto P_{1} de extracción situado entre los bloques 8a y 8b permite obtener los 8 coeficientes de autocorrelación acf(i)=R(i) que van a aplicarse a la entrada E_{1.} Un segundo punto P_{2}, asociado con el bloque 8c, permite extraer los valores de retardo (i) de la periodicidad correspondientes a las cuatro tramas secundarias de 7,5 ms en las que se divide cada trama para aplicarse a la entrada E_{2}. Finalmente, un tercer punto P_{3}, asociado al bloque 8b, permite extraer los cuatro primeros coeficientes de reflexión, que son magnitudes intermedias obtenidas en el cálculo de los A(z) coeficientes de predicción LPC mediante el algoritmo de Levinson-Durbin.
La segunda estrategia algorítmica según la invención consiste en el cálculo de la trama CNF (parámetros LSP y ganancias Rp y Rc). El cálculo de los parámetros que caracterizan el ruido aceptable se describe a continuación. La estructura de la trama tiene una apariencia similar a la de la trama de habla, cambiando la forma de calcular los parámetros que la representan. Esta ranura CNF se envía con una velocidad de transferencia de un número N determinado de tramas (semi-ranuras).
A continuación se muestra una tabla con la estructura de una trama del codificador de voz TETRA que contiene los dos parámetros que van a modificarse y los que se proporcionan al codificador de voz TETRA sin ninguna modificación.
Clase de Desplazamiento de Nombre del parámetro
parámetro memoria intermedia
Filtro +0 Índice de código: LSP1 a LSP3
+1 Índice de código: LSP4 a LSP6
+2 Índice de código: LSP7 a LSP10
Trama +3 Retardo de tono
secundaria #1 +4 Índice de código: impulso 4
Índice de código: impulso 3
Índice de código: impulso 2
Índice de código: impulso 1
Signo de impulso global
+5 Desfase entre impulsos
+6 Índice de código: ganancias
+7
(Continuación)
Clase de Desplazamiento de Nombre del parámetro
parámetro memoria intermedia
Trama +8 Retardo de tono
secundaria #2 +9 Índice de código: impulso 4
Índice de código: impulso 3
Índice de código: impulso 2
Índice de código: impulso 1
Signo de impulso global
+10 Desfase entre impulsos
+11 Índice de código de ganancias: ganancias
+12
Trama +13 Retardo de tono
secundaria #3 +14 Índice de código: impulso 4
Índice de código: impulso 3
Índice de código: impulso 2
Índice de código: impulso 1
Signo de impulso global
+15 Desfase entre impulsos
+16 Índice de código: ganancias
+17
Trama +18 Retardo de tono
secundaria #4 +19 Índice de código: impulso 4
Índice de código: impulso 3
Índice de código: impulso 2
Índice de código: impulso 1
Signo de impulso global
+20 Desfase entre impulsos
+21 Índice de código: ganancias
+22
Los parámetros LSP son el resultado de cuantificar el promedio de los parámetros LSP de las cuatro últimas tramas disponibles: la actual y las tres inmediatamente anteriores a la decisión de silencio por parte del detector VAD. Estas tres tramas son las tres últimas de las 10 que componen la persistencia del eco (persistencia, bloque 7i) incluida en el detector VAD.
Las ganancias Rp y Rc diferenciales, correspondientes a los índices adaptativo (tono) y algebraico, no se promedian de forma convencional. Esto sucede debido a que se ha observado que estos valore varían en gran medida de una trama de ruido a otra, aunque tenga características similares. Un promedio convencional de Rp y Rc proporcionaría valores de éstas que producirían una trama de ruido de energía muy diferente de la real. De forma alternativa, las energías de tono Ep y código Ec de dichas cuatro últimas tramas son promedios, y se calculan los parámetros Rp y Rc correspondientes a esta energía. De forma específica, se toman los valores que proporcionan constantemente las energías Ep y Ec medias. Las expresiones resultantes de Rp y Rc son las siguientes:
Rc = 0,5 Ec - 0,25 Ep + 3
Rp = 0,5 Ep - 0,25 Ec + 3
Éstas se obtienen de las expresiones (35) a (36) de la sección 4.2.2.6 del documento [2]: TETRA: Speech codec for full-rate traffic channel; parte 2; TETRA codec. Documento ETS 300 395-2. Febrero, 1998 (p. 22). Estos parámetros Rp y Rc se cuantifican normalmente por medio del libro de códigos de 64 códigos del codificador TETRA.
Como índices del código algebraico y del código adaptativo, los cálculos se toman en la última trama.
Durante un número determinado de tramas subsiguientes no se envían datos. Una vez ha transcurrido este número de tramas, se transmite una nueva trama CNF actualizada, calculada de la misma manera.
\newpage
Finalmente, como una tercera estrategia algorítmica, el método de la invención prevé realizar un promedio de las ganancias. En realidad, con el esquema mostrado en la sección anterior del promedio de las energías, tienen lugar problemas de saltos repentinos de energía entre periodos CNF contiguos en el proceso de síntesis llevado a cabo en el receptor. El esquema mostrado a continuación es responsable de llevar a cabo un determinado procesamiento de las energías para el objetivo de reducir este efecto indeseado.
Esta nueva alternativa saca provecho de la existencia de 4 tramas secundarias para cada trama de habla para codificar diferentes valores de energía (por medio de Rp y Rc), consiguiendo así que la energía media total de la trama codificada se aproxime con mayor exactitud a la energía total deseada (obtenida a partir del promedio de las 4 tramas de ruido).
El principal problema que surge consiste en la falta de precisión de la codificación vectorial (6 bits) de manera que la diferencia entre un valor del cuantificador y el siguiente podría ser de una unidad, correspondiente a un factor de multiplicación 2 de la energía (recuérdese que las energías se codifican en log2). Debido a esto, el trabajo está ahora con los dos valores del cuantificador más próximos al valor de la energía respecto al código (uno por encima de dicho valor, y el otro por debajo), alternando dichos valores en las tramas secundarias de tal manera que el promedio de las 4 tramas secundarias es lo más próximo posible a la energía deseada. Es decir, la situación es del tipo que se explica a continuación:
1
Donde (E1 + E2 + E3 + E4)/4 es un valor próximo a Et (energía deseada), y donde E1, E2, E3 y E4 sólo pueden tomar dos valores posibles, es decir, el valor inmediatamente superior y el valor inmediatamente inferior a E).
El valor Et corresponde a la energía total de la trama y se obtiene a partir del promedio de las cuatro últimas tramas de ruido de la siguiente manera:
Et = log_{2}\left(2^{\overline{E\overline{p}}} + 2^{\overline{E\overline{c}}}\right)
El siguiente diagrama realiza una comparación entre una situación en la que se aproxima Et empleando el mismo valor para las cuatro tramas secundarias, y otra en la que se permiten dos valores en relación con el valor que va a cuantificarse.
La energía Et que va a cuantificarse se muestra con una línea discontinua, y una línea continua muestra el valor cuantificado. Puede observarse cómo, de media, la energía Et se cuantifica de forma más precisa en la segunda situación.
2
Como puede comprenderse, la explicación anterior corresponde únicamente a una realización preferida de la invención, por tanto, son posibles diferentes variantes y modificaciones sin modificar el alcance de la invención, limitada únicamente por el contenido de las siguientes reivindicaciones.

Claims (4)

1. Método de generación de tramas de ruido aceptable (CNF, Comfort Noise Frame), aplicable concretamente en combinación con un terminal de emisión, en el que dicha generación se lleva a cabo aplicando un algoritmo a los parámetros proporcionados por el terminal (1) del codificador de voz al bloque (2) de control del codificador de voz, siendo este terminal de codificador de voz un codificador de voz del tipo ACELP (Algebraic Code Exciting Linear Predictive, codificación algebraica por excitación lineal predictiva), cada una con tramas de 30 ms divididas en cuatro tramas secundarias de 7,5 ms, y que aceptan muestras de voz cuantificadas de 16 bits, incluyendo dicho bloque (2) de control del codificador de voz un bloque (2e) de detector de actividad vocal (VAD, Vocal Activity Detector) y un bloque (2d) de cálculo de parámetros de ruido aceptable, comprendiendo adicionalmente el método las siguientes fases:
a)
detectar por medio del detector VAD la falta de actividad de voz en una señal de transmisión enviada por el terminal de emisión,
b)
calcular la trama CNF como un conjunto de parámetros LSP, ganancias de código y tono que deben transmitirse periódicamente desde el emisor durante el estado de silencio de este último, y caracterizado por
c)
alternar valores de cuantificación de la energía que va a codificarse en las cuatro últimas tramas disponibles, de tal manera que el promedio de los valores para las cuatro tramas sea lo más próximo posible a la energía deseada, y
d)
con una transmisión de los valores del índice del código algebraico y adaptativo correspondientes a los calculados en la última trama.
2. Método según la reivindicación 1, caracterizado porque el detector VAD se opera con la disposición de tres entradas (E_{1}, E_{2}, E_{3}) correspondientes respectivamente a
a)
entrada de coeficientes de autocorrelación de la trama actual;
b)
entrada de los retardos de código adaptativo para cada una de las cuatro tramas secundarias y
c)
entrada de los cuatro primeros coeficientes de reflexión LPC.
3. Método según la reivindicación 1, caracterizado porque el cálculo de los parámetros se lleva a cabo de tal manera que: los parámetros LSP son el resultado de cuantificar el promedio de los parámetros LSP de las cuatro últimas tramas disponibles, es decir, la actual y las tres inmediatamente anteriores, y los parámetros Rp y Rc, representativos de los índices adaptativo (tono) y algebraico, respectivamente, se calculan teniendo en cuenta las energías de tono (Ep) y código (Ec), aplicando las siguientes expresiones:
Rc = 0,5 Ec - 0,25 Ep + 3
Rp = 0,5 Ep - 0,25 Ec + 3.
4. Método según la reivindicación 1, caracterizado porque el promedio de las ganancias, llevado a cabo con el objetivo de impedir saltos repentinos de energía entre periodos CNF contiguos, se lleva a cabo sacando provecho de la existencia de 4 tramas secundarias para cada trama de habla, realizando el promedio aritmético de las cuatro energías (E_{1}, E_{2}, E_{3,} E_{4}) respectivas correspondientes a dichas tramas secundarias, y de tal manera que el valor de la energía Et total de la trama responda a la siguiente fórmula:
Et = log_{2}\left(2^{\overline{E\overline{p}}} + 2^{\overline{E\overline{c}}}\right)
donde Ep representa la energía de tono y Ec representa la energía de código.
ES02380144T 2002-07-02 2002-07-02 Metodo de generacion de tramas de ruido aceptable. Expired - Lifetime ES2261619T3 (es)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
EP02380144A EP1378887B1 (en) 2002-07-02 2002-07-02 Generation method of comfort noise frames (CNF)

Publications (1)

Publication Number Publication Date
ES2261619T3 true ES2261619T3 (es) 2006-11-16

Family

ID=29719797

Family Applications (1)

Application Number Title Priority Date Filing Date
ES02380144T Expired - Lifetime ES2261619T3 (es) 2002-07-02 2002-07-02 Metodo de generacion de tramas de ruido aceptable.

Country Status (4)

Country Link
EP (1) EP1378887B1 (es)
AT (1) ATE322732T1 (es)
DE (1) DE60210435D1 (es)
ES (1) ES2261619T3 (es)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR101700855B1 (ko) * 2012-10-01 2017-01-31 니폰 덴신 덴와 가부시끼가이샤 부호화 방법, 부호화 장치, 프로그램 및 기록 매체

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5960389A (en) * 1996-11-15 1999-09-28 Nokia Mobile Phones Limited Methods for generating comfort noise during discontinuous transmission

Also Published As

Publication number Publication date
DE60210435D1 (de) 2006-05-18
ATE322732T1 (de) 2006-04-15
EP1378887B1 (en) 2006-04-05
EP1378887A1 (en) 2004-01-07

Similar Documents

Publication Publication Date Title
ES2206667T3 (es) Procedimiento para generar ruido de bienestar durante una transmision discontinua.
ES2349554T3 (es) Codificación de señales.
EP2535893B1 (en) Device and method for lost frame concealment
ES2298261T3 (es) Disimulacion de errores de transmision en una señal de audio.
ES2266281T3 (es) Metodo y sistema para ocultacion de error en tramas de voz en la decodificacion de voz.
ES2527697T3 (es) Corrección directa de errores en la codificación vocal
ES2621417T3 (es) Sistema, procedimientos, aparato y medios legibles por ordenador para la asignación de bits para la transmisión redundante de datos de audio
ES2343948T3 (es) Procedimiento y aparato para realizar vocodificacion con tasa reducida y tasa variable.
ES2266003T3 (es) Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha.
JP5405456B2 (ja) ピッチ調整コーディング及び非ピッチ調整コーディングを使用する信号符号化
JP4927257B2 (ja) 可変レートスピーチ符号化
ES2217772T3 (es) Tecnicas mejoradas de recuperacion de tramas perdidas para sistemas parametricos de codificacion predictiva de voz.
KR100742443B1 (ko) 손실 프레임을 처리하기 위한 음성 통신 시스템 및 방법
ES2401171T3 (es) Procedimiento, aparato y producto de programa de ordenador para reconstruir una trama de voz borrada
ES2688021T3 (es) Adición de ruido de confort para modelar ruido de fondo a bajas tasas de bits
EP3700111B1 (en) Systems and methods of communicating redundant frame information
ES2956797T3 (es) Determinación de parámetros de ruido de confort adaptable
ES2287150T3 (es) Metodo y sistema para estimacion artificial de una señal de banda alta en un codificador-decodificador de voz.
US20010046843A1 (en) Transmission of comfort noise parameters during discontinuous transmission
WO1997041662A1 (en) Source/channel encoding mode control method and apparatus
JPH11514168A (ja) 不連続送信における音声デコーダのハングオーバー期間を評価する方法および音声エンコーダおよびトランシーバ
KR100439652B1 (ko) 음성 복호화 장치, 부호 오류 보상 방법 및 기록 매체
EP1224663B1 (en) A predictive speech coder using coding scheme selection patterns to reduce sensitivity to frame errors
EP0910066A2 (en) Coding method and apparatus, and decoding method and apparatus
JP2000512025A (ja) 受信音声信号の再構成方法および装置