ES2261619T3 - Metodo de generacion de tramas de ruido aceptable. - Google Patents
Metodo de generacion de tramas de ruido aceptable.Info
- Publication number
- ES2261619T3 ES2261619T3 ES02380144T ES02380144T ES2261619T3 ES 2261619 T3 ES2261619 T3 ES 2261619T3 ES 02380144 T ES02380144 T ES 02380144T ES 02380144 T ES02380144 T ES 02380144T ES 2261619 T3 ES2261619 T3 ES 2261619T3
- Authority
- ES
- Spain
- Prior art keywords
- frames
- code
- voice
- parameters
- block
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/012—Comfort noise or silence coding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/173—Transcoding, i.e. converting between two coded representations avoiding cascaded coding-decoding
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
- Audible-Bandwidth Dynamoelectric Transducers Other Than Pickups (AREA)
- Soundproofing, Sound Blocking, And Sound Damping (AREA)
Abstract
Método de generación de tramas de ruido aceptable (CNF, Comfort Noise Frame), aplicable concretamente en combinación con un terminal de emisión, en el que dicha generación se lleva a cabo aplicando un algoritmo a los parámetros proporcionados por el terminal (1) del codificador de voz al bloque (2) de control del codificador de voz, siendo este terminal de codificador de voz un codificador de voz del tipo ACELP (Algebraic Code Exciting Linear Predictive, codificación algebraica por excitación lineal predictiva), cada una con tramas de 30 ms divididas en cuatro tramas secundarias de 7, 5 ms, y que aceptan muestras de voz cuantificadas de 16 bits, incluyendo dicho bloque (2) de control del codificador de voz un bloque (2e) de detector de actividad vocal (VAD, Vocal Activity Detector) y un bloque (2d) de cálculo de parámetros de ruido aceptable, comprendiendo adicionalmente el método las siguientes fases: a) detectar por medio del detector VAD la falta de actividad de voz en una señal de transmisión enviada por el terminal de emisión, b) calcular la trama CNF como un conjunto de parámetros LSP, ganancias de código y tono que deben transmitirse periódicamente desde el emisor durante el estado de silencio de este último, y caracterizado por c) alternar valores de cuantificación de la energía que va a codificarse en las cuatro últimas tramas disponibles, de tal manera que el promedio de los valores para las cuatro tramas sea lo más próximo posible a la energía deseada, y d) con una transmisión de los valores del índice del código algebraico y adaptativo correspondientes a los calculados en la última trama.
Description
Método de generación de tramas de ruido
aceptable.
La presente invención se refiere a un método de
generación de tramas de ruido aceptable (CNF, Comfort Noise Frame)
que proporciona características novedosas fundamentales y ventajas
significativas con respecto a los medios conocidos y utilizados para
los mismos propósitos en el estado actual de la técnica.
Más específicamente, la invención propone el
desarrollo de un método mediante el cual sea posible llevar a cabo
la generación de tramas capaces de utilizarse en la generación de
ruido de fondo en un receptor con el fin de la transmisión
intermitente desde un emisor en los sistemas TETRA, es decir,
durante los periodos de tiempo en los que dicho emisor se encuentra
en silencio, obteniéndose este ruido de dichas tramas CNF. El método
desarrolla un algoritmo para la generación de dichas tramas. El
campo de aplicación de la invención se encuentra dentro del campo de
las telecomunicaciones en general y, más específicamente, en el
sector de las radiocomunicaciones.
Expertos en la materia conocen las
características que definen el estándar TETRA basado en la ejecución
intermitente de una emisión desde un dispositivo de emisión
adecuado, cuya emisión debe recibirse y completarse en el
dispositivo receptor correspondiente. En realidad, dicho sistema
TETRA permite, como una opción de funcionamiento, que, mientras una
persona que está hablando desde un dispositivo de emisión se
mantiene en silencio (ausencia de voz o tonos), el dispositivo de
emisión envíe periódicamente una trama, denominada una "trama de
ruido aceptable (CNF)", en la que las características espectrales
del ruido ambiental se parametrizan como si fuesen una señal de voz
normal, de tal manera que al cesar de emitir durante periodos de
tiempo alternantes, se logra un ahorro considerable de las baterías
de alimentación del terminal, así como también una reducción de las
interferencias co-canal con el resto de los usuarios
del sistema. El envío de esta trama se le indica al receptor
mediante la inserción de una instrucción CNF en la primera mitad de
una ranura, reservando la segunda mitad de la ranura para la
inclusión de la parametrización del ruido.
EL dispositivo de emisión no transmite esta
información de ruido de fondo durante varias tramas subsiguientes,
número de tramas que es un compromiso entre la frecuencia deseada
actualizada, el peligro de desconexión de la base debido a la
ausencia de la señal en el enlace ascendente y el nivel deseado de
ahorro energético y la reducción de interferencia
co-canal. En el momento en el que el detector de
actividad vocal (VAD, Vocal Activity Detector) de dicho dispositivo
de emisión detecta la presencia de una señal de información,
inmediatamente éste conmuta al modo de transmisión normal.
En lo relativo al dispositivo de recepción, éste
debe poder reconstruir la señal de ruido ambiental a partir de dicha
trama periódica mientras se mantiene el silencio en el dispositivo
de emisión. La reconstrucción de dicha señal se lleva a cabo
mediante la recepción de una instrucción CNF, aplicando un algoritmo
a los parámetros CNF recibidos para la generación de la trama con la
información del ruido recibido, y se llevará a cabo una síntesis en
las tramas subsiguientes basándose en un determinado algoritmo.
Cuando se recibe una nueva trama de ruido, éste procede de la misma
manera que con la primera instrucción CNF y se actualizan
determinados parámetros utilizados en la síntesis.
Algunos métodos y dispositivos ya se conocen en
el estado de la técnica, mediante los cuales se llevan a cabo
determinados aspectos de la síntesis y análisis del habla, su
codificación y descodificación. En este sentido, se citan más
adelante aquellos que actualmente constituyen la técnica anterior
más relevante.
La patente internacional PCT número WO 00/11648
se refiere a un decodificador de voz que utiliza un detector de
actividad vocal en la codificación del ruido. Dicho documento
propone varios métodos para generar la señal de voz en caso de
ausencia de actividad vocal, entre los que existe un método basado
en la generación de una secuencia de excitación aleatoria que puede
generarse en el decodificador de voz. Otros métodos propuestos se
basan en el uso de información relativa al nivel de energía o al
perfil espectral.
La patente estadounidense número 5.642.464
describe métodos y aparatos para el acondicionamiento del ruido en
los sistemas digitales de compresión de voz mediante el uso de
codificación lineal predictiva, y propone un método de procesamiento
(ausencia de voz) de señales de ruido que consiste en el cálculo de
los coeficientes LPC (Lineal Predictive Coding, codificación lineal
predictiva), y prevé para ello muestras de ese intervalo de ruido y
muestras de una pluralidad de intervalos de señal anteriores.
La patente estadounidense número 6.240.383 se
refiere a un sistema de codificación y decodificación de voz para la
creación de ruido aceptable en función de la envolvente espectral de
la señal de voz mediante medios de almacenamiento de los parámetros
LPC de la primera señal no de voz antes de conmutar a
no-voz.
La presente invención se refiere a un método de
generación de tramas de ruido aceptable (CNF), que tiene el objetivo
de obtener este tipo de tramas en la terminal de recepción durante
los periodos de inactividad de voz del emisor mediante la aplicación
de un algoritmo apropiado.
De este modo, en el caso de la presente
invención y ya que la técnica utilizada puede usarse también en la
transmisión de señales GSM (Global System for Mobile Communications,
sistema global para comunicaciones móviles), el método prevé, por un
lado, la adaptación de un detector de actividad de voz (VAD, Voice
Activity Detector) de manera que puede utilizarse en terminales
TETRA y, por otro lado, el desarrollo y la utilización de
estrategias algorítmicas capaces de llevarse a cabo mediante el
bloque de cálculo de parámetros de ruido aceptable para generar los
parámetros CNF que van a transmitirse periódicamente durante los
periodos de silencio.
En correspondencia, la presente invención se
refiere a un método de generación de tramas de ruido aceptable (CNF)
según se indica en la reivindicación 1.
Estas y otras características y ventajas de la
invención resultarán evidentes de forma más clara basándose en la
siguiente descripción detallada de una realización preferida, dada
solamente como un ejemplo ilustrativo, mas no limitativo, con
referencia a los dibujos adjuntos en los que:
las figuras 1 y 2 muestran representaciones
gráficas ilustrativas de los bloques de los dispositivos de
codificación y decodificación respectivamente, de acuerdo a ese
estándar abarcado por el estándar TETRA;
la figura 3 muestra un diagrama ilustrativo de
la operación del codificador vocal TETRA cuando la función de ruido
aceptable está activa;
la figura 4 muestra una representación
esquemática de un decodificador de actividad de voz (VAD) del tipo
GSM;
la figura 5 muestra finalmente una
representación de un codificador TETRA con indicación de los puntos
de extracción de los parámetros necesitados por el detector VAD.
Tal como se ha indicado anteriormente, la
descripción detallada de la realización preferida de la invención se
llevará a cabo mediante el uso de los dibujos adjuntos con los fines
de proporcionar, en primer lugar, y con fines ilustrativos, las
representaciones de la técnica convencional que aparece en las
figuras 1 y 2.
Como puede observarse, el diagrama de bloques de
la figura 1 corresponde a un codificador estructurado en el terminal
de emisión de acuerdo con el estándar TETRA e incluye un bloque 1
codificador de voz y un bloque 2 de control del codificador de voz,
incluyendo este último varios bloques secundarios entre los que se
distingue un bloque 2a secundario para funciones en modo de prueba,
un bloque 2b secundario para la función de reinicio del codificador
1, un bloque 2c secundario para la función de toma de la trama, un
bloque 2d secundario responsable de la función de ruido aceptable,
un bloque 2e secundario para la función de importancia de la voz, y,
por último, un bloque 2f secundario de interfaz de cifrado. Los
bloques afectados por la introducción del ruido aceptable son, en
particular, aquellos indicados como bloque 2d secundario de función
de control de ruido y el bloque 2e secundario de función de
importancia de la voz. La detección de la actividad de voz se lleva
a cabo en este último bloque secundario, mientras que el bloque 2d
secundario de función de ruido aceptable es responsable de llevar a
cabo los cálculos de los parámetros del ruido aceptable que van a
enviarse en la ranura CNF basándose en los parámetros proporcionados
por el codificador 1 de voz.
En lo que concierne al dispositivo decodificador
de acuerdo al estándar TETRA, incorporado en el terminal de
recepción y mostrado esquemáticamente en el dibujo de la figura 2,
éste incluye un bloque 3 de control del decodificador de voz y un
bloque 4 decodificador de voz. En el bloque 3 de control se
distinguen varios bloques secundarios, tales como el bloque 3a
secundario de interfaz de cifrado, el bloque 3b secundario de
función de reinicio del decodificador 4, el bloque 3c secundario de
generación de trama faltante, el bloque 3d secundario de sustitución
de trama faltante y el bloque 3e secundario destinado a las
funciones de modo de prueba. En este caso, los bloques afectados por
el ruido aceptable son, particularmente, el bloque 3c secundario,
correspondiente a al generación de trama faltante, que detecta la
presencia de una ranura CNF y lleva acabo la síntesis de las tramas
de ruido, y el bloque 3d secundario de sustitución de trama faltante
con el que la trama proporcionada por el bloque 3c secundario de
generación de trama faltante simplemente se introduce en la trama
alimentada a dicho decodificador 4 de voz.
De acuerdo con la invención, el método propuesto
consiste precisamente en la generación de un algoritmo para generar
las tramas de ruido aceptable (CNF) en el terminal de recepción y,
con este fin, se desarrollan las estrategias algorítmicas que se
definirán más adelante. En cualquier caso, los bloques secundarios
emisores que intervienen en la implementación del método
corresponden a los indicados mediante las referencias numéricas 2d y
2e, es decir, los bloques secundarios de la función del ruido
aceptable y la función de la importancia de la voz, respectivamente,
que aparecen en el esquema de al figura 1. De éstos, el bloque 2e
secundario de la función de importancia de la voz corresponde en
realidad al detector de actividad de voz (VAD). El detector VAD
utilizado por la invención se basa en el estándar GSM [véase:
Digital cellular telecomunications system (phase 2); Voice Activity
Decoder (VAD) for enhanced full rate (EFR) speech traffic channels
(GSM 06.82 version 4.01). Documento ETSI EN 301 249 v4.0.1.
(12-1997)] [1]. Sin embargo, la invención prevé la
introducción de variaciones en el VAD del tipo GSM con el fin de
adaptarlo a las peculiaridades del codificador de voz según el
estándar TETRA.
Por otra parte, el bloque 2d de la función de
ruido aceptable es responsable de llevar a cabo el cálculo de los
parámetros que van a enviarse a una trama correspondiente a una
ranura CNF.
La figura 3 muestra esquemáticamente el modo de
operación del codificador de voz TETRA cuando la capacidad de ruido
está activa. En esta figura, las ranuras 5 no sombreadas
corresponden a ranuras de voz o ranuras, CFN mientras que las
ranuras 6 (sombreadas a rayas) sombreadas corresponden a los
periodos de inactividad del transmisor. Cuando se transmite una
trama CNF, se suspende temporalmente la transmisión (ranuras 6
sombreadas) hasta que una ranura 5 de voz transmita nuevamente, o la
información CNF deba actualizarse al receptor (periodo de
actualización CNF indicado con "T" en la figura 3).
Como se indica previamente, el método de la
invención prevé la introducción de modificaciones en el sistema VAD
según el estándar GSM para su adaptación a las particularidades del
codificador de voz TETRA de acuerdo con la descripción siguiente.
Las particularidades y características del detector VAD
correspondientes a dicho GSM estándar se describen detalladamente en
el documento [1] que se ha mencionado anteriormente.
El codificador de voz TETRA funciona con tramas
de 30 ms divididas cada una de ellas en 4 tramas secundarias de 7,5
ms, mientras que el codificador de voz según el estándar GSM
funciona con tramas de 20 ms cada una de ellas con cuatro tramas
secundarias de 5 ms. Además, el codificador de voz TETRA acepta
muestras de voz cuantificadas en 16 bits (15 más uno de signo), cuya
proporción se cambia a continuación en 2, lo que implica 15 bits. En
cambio, el codificador de voz GSM acepta muestras en 13 bits. Ambas
diferencias afectan a los niveles de energía por trama que en el
caso de TETRA, serán 1,5x(4)2=24 veces más grandes que
el del GSM. Tantas veces como los cálculos VAD requieran el uso de
magnitudes dependientes de la energía de las tramas, será preciso
adaptarlas a la longitud de la trama TETRA.
El detector VAD GSM estándar consiste
básicamente en un detector de energía mediante umbral (un alto nivel
de energía indica voz; un bajo nivel de energía indica silencio).
Esta detección se lleva a cabo mediante una señal de indicación por
medio de un filtrado adaptado a las características del ruido,
empleando un umbral de decisión adaptado de forma continua de
acuerdo con las características de la presente señal.
La figura 4 muestra un esquema de bloques del
detector VAD del sistema GSM con las siguientes funcionalidades:
bloque 7a, filtrado adaptativo y cálculo de energía; bloque 7b,
detección periódica; bloque 7c, detección del tono; bloque 7d, ACF
promediada; bloque 7e, cálculo de valores de predicción; bloque 7f,
comparación espectral; bloque 7g, adaptación del umbral; bloque 7h,
decisión VAD; y bloque 7i, adición de persistencia VAD. También
puede observarse la existencia de tres entradas, indicadas
respectivamente como E_{1}, E_{2} y E_{3}, procedentes del
codificador de voz TETRA, al tiempo que proporciona una salida
sencilla, indicada como S1, que consiste en una variable de
indicador vad que adopta un valor de "1" en el caso de la
presencia de voz, y un valor de "0" en el caso de silencio. Las
tres entradas E_{1} a E_{3}, asociadas con los bloques 7a, 7b y
7c son, respectivamente, los 8 coeficientes de autocorrelación de la
trama actual (acf) (podrían ser hasta 10, que son los calculados por
el codificador de voz TETRA; sin embargo, en el caso de la presente
invención, se ha elegido mantener el número 8, tal como en el
estándar GSM, dado que el cálculo más costoso es el de los
coeficientes LPC que debe llevarse a cabo específicamente en el
detector VAD); los cuatro retardos del código adaptativo,
correspondientes a cada una de las cuatro tramas secundarias,
muestran un valor estimado de la periodicidad o altura de la señal
(retardos); y los primeros cuatro coeficientes de reflexión LPC
(rc).
Los coeficientes acf de la entrada E1
proporcionan la información necesaria para llevar a cabo un filtrado
de indicación de la señal de entrada, mejorando su relación SNR
(Signal-Noise Ratio, relación señal a ruido), e
intervienen en decidir si adapta el umbral de energía de ruido: sí,
en el caso de clasificar previamente la trama actual como ruido; no,
en el caso de clasificarla previamente como una señal de información
(habla o tonos). Los valores de retardo de la entrada E_{2}
permiten detectar tramas de voz audibles con una periodicidad bien
definida, en cuyo caso no actualiza el umbral de decisión. Los
cuatro primeros coeficientes de reflexión a través de la entrada
E_{3} permiten detectar de forma eficaz la presencia de tonos, que
también determina no actualizar el umbral. Es interesante señalar
que los tres tipos de señal intervienen en la decisión de actualizar
o no actualizar el umbral de energía, pero sólo los coeficientes acf
de la entrada E_{1} son los utilizados para obtener el nivel de
energía, para tomar la decisión final y en el cálculo del filtro de
indicación.
Para fines ilustrativos se muestra a
continuación una tabla con los valores adoptados por los diferentes
parámetros del detector VAD GSM estándar.
| Parámetro | Valor |
| Pth | 130000*1,5 |
| Plev | 130000*1,5 |
| Adp | 6 |
| Dec | 16 |
(Continuación)
| Parámetro | Valor |
| Inc | 8 |
| Fac | 2 |
| Margen | 150000000*1,5 |
| Umbral (comparación espectral) | 0,056 |
| FREQTH (detección de tono) | 0,0973 |
| PREDTH (detección de tono) | 0,0447 |
| LTHRESH (detección de periodicidad) | 2 |
| NTHRESH | 6 |
| Cte. Hang (persistencia VAD) | 10 |
| Cte. ráfaga (persistencia VAD) | 3 |
La figura 5 muestra una vista esquemática de un
diagrama de bloques correspondiente a un codificador de voz TETRA
constituido por un número de bloques secundarios que no se
describirán en detalle dado que son conocidos en sí mismos y de los
cuales sólo se hará referencia a los que intervienen en el
desarrollo del método de la invención para extraer la información
útil requerida por el detector VAD para tomar su decisión. Para este
propósito es necesario mencionar los bloques 8a secundarios de
autocorrelación y selección de ventana, 8b de la función algorítmica
Levinson-Durbin y 8c de la búsqueda del mejor
retardo y ganancia. Un primer punto P_{1} de extracción situado
entre los bloques 8a y 8b permite obtener los 8 coeficientes de
autocorrelación acf(i)=R(i) que van a aplicarse a la
entrada E_{1.} Un segundo punto P_{2}, asociado con el bloque
8c, permite extraer los valores de retardo (i) de la periodicidad
correspondientes a las cuatro tramas secundarias de 7,5 ms en las
que se divide cada trama para aplicarse a la entrada E_{2}.
Finalmente, un tercer punto P_{3}, asociado al bloque 8b, permite
extraer los cuatro primeros coeficientes de reflexión, que son
magnitudes intermedias obtenidas en el cálculo de los A(z)
coeficientes de predicción LPC mediante el algoritmo de
Levinson-Durbin.
La segunda estrategia algorítmica según la
invención consiste en el cálculo de la trama CNF (parámetros LSP y
ganancias Rp y Rc). El cálculo de los parámetros que caracterizan el
ruido aceptable se describe a continuación. La estructura de la
trama tiene una apariencia similar a la de la trama de habla,
cambiando la forma de calcular los parámetros que la representan.
Esta ranura CNF se envía con una velocidad de transferencia de un
número N determinado de tramas (semi-ranuras).
A continuación se muestra una tabla con la
estructura de una trama del codificador de voz TETRA que contiene
los dos parámetros que van a modificarse y los que se proporcionan
al codificador de voz TETRA sin ninguna modificación.
| Clase de | Desplazamiento de | Nombre del parámetro |
| parámetro | memoria intermedia | |
| Filtro | +0 | Índice de código: LSP1 a LSP3 |
| +1 | Índice de código: LSP4 a LSP6 | |
| +2 | Índice de código: LSP7 a LSP10 | |
| Trama | +3 | Retardo de tono |
| secundaria #1 | +4 | Índice de código: impulso 4 |
| Índice de código: impulso 3 | ||
| Índice de código: impulso 2 | ||
| Índice de código: impulso 1 | ||
| Signo de impulso global | ||
| +5 | Desfase entre impulsos | |
| +6 | Índice de código: ganancias | |
| +7 |
(Continuación)
| Clase de | Desplazamiento de | Nombre del parámetro |
| parámetro | memoria intermedia | |
| Trama | +8 | Retardo de tono |
| secundaria #2 | +9 | Índice de código: impulso 4 |
| Índice de código: impulso 3 | ||
| Índice de código: impulso 2 | ||
| Índice de código: impulso 1 | ||
| Signo de impulso global | ||
| +10 | Desfase entre impulsos | |
| +11 | Índice de código de ganancias: ganancias | |
| +12 | ||
| Trama | +13 | Retardo de tono |
| secundaria #3 | +14 | Índice de código: impulso 4 |
| Índice de código: impulso 3 | ||
| Índice de código: impulso 2 | ||
| Índice de código: impulso 1 | ||
| Signo de impulso global | ||
| +15 | Desfase entre impulsos | |
| +16 | Índice de código: ganancias | |
| +17 | ||
| Trama | +18 | Retardo de tono |
| secundaria #4 | +19 | Índice de código: impulso 4 |
| Índice de código: impulso 3 | ||
| Índice de código: impulso 2 | ||
| Índice de código: impulso 1 | ||
| Signo de impulso global | ||
| +20 | Desfase entre impulsos | |
| +21 | Índice de código: ganancias | |
| +22 |
Los parámetros LSP son el resultado de
cuantificar el promedio de los parámetros LSP de las cuatro últimas
tramas disponibles: la actual y las tres inmediatamente anteriores a
la decisión de silencio por parte del detector VAD. Estas tres
tramas son las tres últimas de las 10 que componen la persistencia
del eco (persistencia, bloque 7i) incluida en el detector VAD.
Las ganancias Rp y Rc diferenciales,
correspondientes a los índices adaptativo (tono) y algebraico, no se
promedian de forma convencional. Esto sucede debido a que se ha
observado que estos valore varían en gran medida de una trama de
ruido a otra, aunque tenga características similares. Un promedio
convencional de Rp y Rc proporcionaría valores de éstas que
producirían una trama de ruido de energía muy diferente de la real.
De forma alternativa, las energías de tono Ep y código Ec de dichas
cuatro últimas tramas son promedios, y se calculan los parámetros Rp
y Rc correspondientes a esta energía. De forma específica, se toman
los valores que proporcionan constantemente las energías Ep y Ec
medias. Las expresiones resultantes de Rp y Rc son las
siguientes:
Rc = 0,5 Ec -
0,25 Ep +
3
Rp = 0,5 Ep -
0,25 Ec +
3
Éstas se obtienen de las expresiones (35) a (36)
de la sección 4.2.2.6 del documento [2]: TETRA: Speech codec for
full-rate traffic channel; parte 2; TETRA codec.
Documento ETS 300 395-2. Febrero, 1998 (p. 22).
Estos parámetros Rp y Rc se cuantifican normalmente por medio del
libro de códigos de 64 códigos del codificador TETRA.
Como índices del código algebraico y del código
adaptativo, los cálculos se toman en la última trama.
Durante un número determinado de tramas
subsiguientes no se envían datos. Una vez ha transcurrido este
número de tramas, se transmite una nueva trama CNF actualizada,
calculada de la misma manera.
\newpage
Finalmente, como una tercera estrategia
algorítmica, el método de la invención prevé realizar un promedio de
las ganancias. En realidad, con el esquema mostrado en la sección
anterior del promedio de las energías, tienen lugar problemas de
saltos repentinos de energía entre periodos CNF contiguos en el
proceso de síntesis llevado a cabo en el receptor. El esquema
mostrado a continuación es responsable de llevar a cabo un
determinado procesamiento de las energías para el objetivo de
reducir este efecto indeseado.
Esta nueva alternativa saca provecho de la
existencia de 4 tramas secundarias para cada trama de habla para
codificar diferentes valores de energía (por medio de Rp y Rc),
consiguiendo así que la energía media total de la trama codificada
se aproxime con mayor exactitud a la energía total deseada (obtenida
a partir del promedio de las 4 tramas de ruido).
El principal problema que surge consiste en la
falta de precisión de la codificación vectorial (6 bits) de manera
que la diferencia entre un valor del cuantificador y el siguiente
podría ser de una unidad, correspondiente a un factor de
multiplicación 2 de la energía (recuérdese que las energías se
codifican en log2). Debido a esto, el trabajo está ahora con los dos
valores del cuantificador más próximos al valor de la energía
respecto al código (uno por encima de dicho valor, y el otro por
debajo), alternando dichos valores en las tramas secundarias de tal
manera que el promedio de las 4 tramas secundarias es lo más próximo
posible a la energía deseada. Es decir, la situación es del tipo
que se explica a continuación:
Donde (E1 + E2 + E3 + E4)/4 es un valor próximo
a Et (energía deseada), y donde E1, E2, E3 y E4 sólo pueden tomar
dos valores posibles, es decir, el valor inmediatamente superior y
el valor inmediatamente inferior a E).
El valor Et corresponde a la energía total de la
trama y se obtiene a partir del promedio de las cuatro últimas
tramas de ruido de la siguiente manera:
Et =
log_{2}\left(2^{\overline{E\overline{p}}} +
2^{\overline{E\overline{c}}}\right)
El siguiente diagrama realiza una comparación
entre una situación en la que se aproxima Et empleando el mismo
valor para las cuatro tramas secundarias, y otra en la que se
permiten dos valores en relación con el valor que va a
cuantificarse.
La energía Et que va a cuantificarse se muestra
con una línea discontinua, y una línea continua muestra el valor
cuantificado. Puede observarse cómo, de media, la energía Et se
cuantifica de forma más precisa en la segunda situación.
Como puede comprenderse, la explicación anterior
corresponde únicamente a una realización preferida de la invención,
por tanto, son posibles diferentes variantes y modificaciones sin
modificar el alcance de la invención, limitada únicamente por el
contenido de las siguientes reivindicaciones.
Claims (4)
1. Método de generación de tramas
de ruido aceptable (CNF, Comfort Noise Frame), aplicable
concretamente en combinación con un terminal de emisión, en el que
dicha generación se lleva a cabo aplicando un algoritmo a los
parámetros proporcionados por el terminal (1) del codificador de voz
al bloque (2) de control del codificador de voz, siendo este
terminal de codificador de voz un codificador de voz del tipo ACELP
(Algebraic Code Exciting Linear Predictive, codificación algebraica
por excitación lineal predictiva), cada una con tramas de 30 ms
divididas en cuatro tramas secundarias de 7,5 ms, y que aceptan
muestras de voz cuantificadas de 16 bits, incluyendo dicho bloque
(2) de control del codificador de voz un bloque (2e) de detector de
actividad vocal (VAD, Vocal Activity Detector) y un bloque (2d) de
cálculo de parámetros de ruido aceptable, comprendiendo
adicionalmente el método las siguientes fases:
- a)
- detectar por medio del detector VAD la falta de actividad de voz en una señal de transmisión enviada por el terminal de emisión,
- b)
- calcular la trama CNF como un conjunto de parámetros LSP, ganancias de código y tono que deben transmitirse periódicamente desde el emisor durante el estado de silencio de este último, y caracterizado por
- c)
- alternar valores de cuantificación de la energía que va a codificarse en las cuatro últimas tramas disponibles, de tal manera que el promedio de los valores para las cuatro tramas sea lo más próximo posible a la energía deseada, y
- d)
- con una transmisión de los valores del índice del código algebraico y adaptativo correspondientes a los calculados en la última trama.
2. Método según la reivindicación
1, caracterizado porque el detector VAD se opera con la
disposición de tres entradas (E_{1}, E_{2}, E_{3})
correspondientes respectivamente a
- a)
- entrada de coeficientes de autocorrelación de la trama actual;
- b)
- entrada de los retardos de código adaptativo para cada una de las cuatro tramas secundarias y
- c)
- entrada de los cuatro primeros coeficientes de reflexión LPC.
3. Método según la reivindicación 1,
caracterizado porque el cálculo de los parámetros se lleva a
cabo de tal manera que: los parámetros LSP son el resultado de
cuantificar el promedio de los parámetros LSP de las cuatro últimas
tramas disponibles, es decir, la actual y las tres inmediatamente
anteriores, y los parámetros Rp y Rc, representativos de los índices
adaptativo (tono) y algebraico, respectivamente, se calculan
teniendo en cuenta las energías de tono (Ep) y código (Ec),
aplicando las siguientes expresiones:
Rc = 0,5 Ec -
0,25 Ep +
3
Rp = 0,5 Ep -
0,25 Ec +
3.
4. Método según la reivindicación 1,
caracterizado porque el promedio de las ganancias, llevado a
cabo con el objetivo de impedir saltos repentinos de energía entre
periodos CNF contiguos, se lleva a cabo sacando provecho de la
existencia de 4 tramas secundarias para cada trama de habla,
realizando el promedio aritmético de las cuatro energías (E_{1},
E_{2}, E_{3,} E_{4}) respectivas correspondientes a dichas
tramas secundarias, y de tal manera que el valor de la energía Et
total de la trama responda a la siguiente fórmula:
Et =
log_{2}\left(2^{\overline{E\overline{p}}} +
2^{\overline{E\overline{c}}}\right)
donde Ep representa la energía de
tono y Ec representa la energía de
código.
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP02380144A EP1378887B1 (en) | 2002-07-02 | 2002-07-02 | Generation method of comfort noise frames (CNF) |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2261619T3 true ES2261619T3 (es) | 2006-11-16 |
Family
ID=29719797
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES02380144T Expired - Lifetime ES2261619T3 (es) | 2002-07-02 | 2002-07-02 | Metodo de generacion de tramas de ruido aceptable. |
Country Status (4)
| Country | Link |
|---|---|
| EP (1) | EP1378887B1 (es) |
| AT (1) | ATE322732T1 (es) |
| DE (1) | DE60210435D1 (es) |
| ES (1) | ES2261619T3 (es) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR101700855B1 (ko) * | 2012-10-01 | 2017-01-31 | 니폰 덴신 덴와 가부시끼가이샤 | 부호화 방법, 부호화 장치, 프로그램 및 기록 매체 |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5960389A (en) * | 1996-11-15 | 1999-09-28 | Nokia Mobile Phones Limited | Methods for generating comfort noise during discontinuous transmission |
-
2002
- 2002-07-02 AT AT02380144T patent/ATE322732T1/de not_active IP Right Cessation
- 2002-07-02 EP EP02380144A patent/EP1378887B1/en not_active Expired - Lifetime
- 2002-07-02 ES ES02380144T patent/ES2261619T3/es not_active Expired - Lifetime
- 2002-07-02 DE DE60210435T patent/DE60210435D1/de not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| DE60210435D1 (de) | 2006-05-18 |
| ATE322732T1 (de) | 2006-04-15 |
| EP1378887B1 (en) | 2006-04-05 |
| EP1378887A1 (en) | 2004-01-07 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2206667T3 (es) | Procedimiento para generar ruido de bienestar durante una transmision discontinua. | |
| ES2349554T3 (es) | Codificación de señales. | |
| EP2535893B1 (en) | Device and method for lost frame concealment | |
| ES2298261T3 (es) | Disimulacion de errores de transmision en una señal de audio. | |
| ES2266281T3 (es) | Metodo y sistema para ocultacion de error en tramas de voz en la decodificacion de voz. | |
| ES2527697T3 (es) | Corrección directa de errores en la codificación vocal | |
| ES2621417T3 (es) | Sistema, procedimientos, aparato y medios legibles por ordenador para la asignación de bits para la transmisión redundante de datos de audio | |
| ES2343948T3 (es) | Procedimiento y aparato para realizar vocodificacion con tasa reducida y tasa variable. | |
| ES2266003T3 (es) | Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha. | |
| JP5405456B2 (ja) | ピッチ調整コーディング及び非ピッチ調整コーディングを使用する信号符号化 | |
| JP4927257B2 (ja) | 可変レートスピーチ符号化 | |
| ES2217772T3 (es) | Tecnicas mejoradas de recuperacion de tramas perdidas para sistemas parametricos de codificacion predictiva de voz. | |
| KR100742443B1 (ko) | 손실 프레임을 처리하기 위한 음성 통신 시스템 및 방법 | |
| ES2401171T3 (es) | Procedimiento, aparato y producto de programa de ordenador para reconstruir una trama de voz borrada | |
| ES2688021T3 (es) | Adición de ruido de confort para modelar ruido de fondo a bajas tasas de bits | |
| EP3700111B1 (en) | Systems and methods of communicating redundant frame information | |
| ES2956797T3 (es) | Determinación de parámetros de ruido de confort adaptable | |
| ES2287150T3 (es) | Metodo y sistema para estimacion artificial de una señal de banda alta en un codificador-decodificador de voz. | |
| US20010046843A1 (en) | Transmission of comfort noise parameters during discontinuous transmission | |
| WO1997041662A1 (en) | Source/channel encoding mode control method and apparatus | |
| JPH11514168A (ja) | 不連続送信における音声デコーダのハングオーバー期間を評価する方法および音声エンコーダおよびトランシーバ | |
| KR100439652B1 (ko) | 음성 복호화 장치, 부호 오류 보상 방법 및 기록 매체 | |
| EP1224663B1 (en) | A predictive speech coder using coding scheme selection patterns to reduce sensitivity to frame errors | |
| EP0910066A2 (en) | Coding method and apparatus, and decoding method and apparatus | |
| JP2000512025A (ja) | 受信音声信号の再構成方法および装置 |