ES2284473T3 - Metodo y aparato para determinar parametros de codificacion de voz. - Google Patents
Metodo y aparato para determinar parametros de codificacion de voz. Download PDFInfo
- Publication number
- ES2284473T3 ES2284473T3 ES00901158T ES00901158T ES2284473T3 ES 2284473 T3 ES2284473 T3 ES 2284473T3 ES 00901158 T ES00901158 T ES 00901158T ES 00901158 T ES00901158 T ES 00901158T ES 2284473 T3 ES2284473 T3 ES 2284473T3
- Authority
- ES
- Spain
- Prior art keywords
- samples
- frame
- voice
- slope
- noise
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 title claims abstract description 44
- 230000009467 reduction Effects 0.000 claims abstract description 52
- 230000003466 anti-cipated effect Effects 0.000 claims abstract description 18
- 238000012545 processing Methods 0.000 claims abstract description 13
- 230000008569 process Effects 0.000 claims description 8
- 230000015572 biosynthetic process Effects 0.000 claims description 5
- 239000003638 chemical reducing agent Substances 0.000 claims description 5
- 238000012937 correction Methods 0.000 claims description 5
- 238000007781 pre-processing Methods 0.000 claims description 4
- 230000006870 function Effects 0.000 description 18
- 231100000572 poisoning Toxicity 0.000 description 18
- 230000000607 poisoning effect Effects 0.000 description 18
- 238000010586 diagram Methods 0.000 description 7
- 230000001934 delay Effects 0.000 description 4
- 238000010295 mobile communication Methods 0.000 description 4
- 230000002301 combined effect Effects 0.000 description 3
- 238000004891 communication Methods 0.000 description 3
- 238000013459 approach Methods 0.000 description 2
- 230000005540 biological transmission Effects 0.000 description 2
- 230000000694 effects Effects 0.000 description 2
- 238000001914 filtration Methods 0.000 description 2
- 230000001629 suppression Effects 0.000 description 2
- 238000012546 transfer Methods 0.000 description 2
- 230000003044 adaptive effect Effects 0.000 description 1
- 230000001174 ascending effect Effects 0.000 description 1
- 238000004364 calculation method Methods 0.000 description 1
- 230000003111 delayed effect Effects 0.000 description 1
- 230000005284 excitation Effects 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 239000002574 poison Substances 0.000 description 1
- 231100000614 poison Toxicity 0.000 description 1
- 238000012805 post-processing Methods 0.000 description 1
- 230000002035 prolonged effect Effects 0.000 description 1
- 230000004044 response Effects 0.000 description 1
- 230000002441 reversible effect Effects 0.000 description 1
- 230000008054 signal transmission Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/26—Pre-filtering or post-filtering
- G10L19/265—Pre-filtering, e.g. high frequency emphasis prior to encoding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
- G10L19/025—Detection of transients or attacks for time/frequency resolution switching
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Devices For Executing Special Programs (AREA)
- Reduction Or Emphasis Of Bandwidth Of Signals (AREA)
Abstract
Método para generar una trama de codificación de voz (44), comprendiendo el método las siguientes etapas: formar una serie de primeras tramas parcialmente superpuestas (18) que contienen muestras de voz; procesar una primera trama de entre la serie de primeras tramas (18) por medio de una primera función de ventana para producir una segunda trama, enventanada, que tiene una primera pendiente; realizar una reducción de ruido sobre la segunda trama para producir una tercera trama (19; 45) que comprende muestras de voz de ruido reducido; y formar una trama de codificación de voz (44) que comprende muestras de ruido reducido de dos terceras tramas sucesivas (45, 46), sumadas por lo menos parcialmente entre sí; caracterizado porque el método comprende además las siguientes etapas: formar la trama de codificación de voz (44) de manera que la misma presenta una parte anticipada (42) que está formada por lo menos parcialmente por muestras de voz de ruido reducido de la primera pendiente (41), no sumándose estas muestras de voz de ruido reducido de la primera pendiente con ningunas otras muestras de voz de ruido reducido de la trama de codificación de voz (44) a formar.
Description
Método y aparato para determinar parámetros de
codificación de voz.
La presente invención se refiere a la
codificación de la voz y en particular a la formación de tramas de
codificación de voz.
En general un retardo es un periodo entre un
acontecimiento y otro acontecimiento relacionado con el primero. En
los sistemas de comunicaciones móviles, se produce un retardo entre
la transmisión de una señal y su recepción, siendo dicho retardo el
resultado de la interacción de una serie de factores diferentes, por
ejemplo, la codificación de la voz, la codificación de los canales
y el retardo de propagación de la señal. Los tiempos de respuesta
largos producen una sensación artificial en la conversación y, por
esta razón, un retardo provocado por el sistema hace siempre que la
comunicación resulte más difícil. De este modo, se pretende
minimizar el retardo en todas las partes del sistema.
Una de las fuentes de retardos es el enventanado
usado en el procesado de la señal. La finalidad del enventanado es
conformar la señal de manera que adopte una forma requerida en el
procesado posterior. Por ejemplo, los reductores de ruido usados
típicamente en los sistemas de comunicaciones móviles funcionan
principalmente en el dominio de la frecuencia y, por esta razón,
una señal cuyo ruido se va a reducir se transforma habitualmente
trama a trama desde el dominio del tiempo al dominio de la
frecuencia usando una Transformada Rápida de Fourier (FFT). Para
que la FFT funcione según la manera deseada, a las muestras
divididas en tramas se les debería aplicar un enventanado antes que
la FFT.
La Figura 1 ilustra el procedimiento mostrando
como ejemplo el enventanado de una trama F(n) en una forma
trapecial. En el enventanado, el conjunto de muestras contenido en
la trama F(n) se multiplica por una función de ventana de
manera que una ventana W(n) 19 resultante de esta operación
comprende una primera pendiente 10 (a la que en lo sucesivo se le
hará referencia como pendiente anterior), que contiene muestras más
recientes de la trama, una segunda pendiente 11 (a la que en lo
sucesivo se le hará referencia como pendiente posterior), que
contiene muestras más antiguas de la trama, y una parte de ventana
restante 12 entre las dos primeras. En el enventanado del ejemplo,
las muestras de la parte de ventana 12 que se sitúa entre la primera
y la segunda pendientes se multiplican por 1, es decir, su valor
permanece invariable. Las muestras de la pendiente anterior 10 se
multiplican por una función descendente en la que el coeficiente de
las muestras más antiguas de la pendiente anterior 10 se aproxima a
uno y el coeficiente de las muestras más nuevas se aproxima a cero.
De forma correspondiente, las muestras de la pendiente posterior 11
se multiplican por una función ascendente en la que el coeficiente
de las muestras más antiguas de la pendiente posterior 11 se
aproxima a cero y el coeficiente de las muestras más nuevas se
aproxima a uno.
Para la reducción de ruido de los codificadores
de voz, la trama de reducción de ruido F(n) (referencia 18)
está formada típicamente por una trama de entrada 16, formada por
muestras nuevas, y por un conjunto de las muestras más antiguas 15
de la trama de entrada anterior. De este modo, en la formación de
dos tramas de entradas sucesivas se usan las muestras 17. La Figura
1 ilustra también el método de suma con superposición usado
frecuentemente en relación con el enventanado con respecto a las
FFT. En dicho método, parte de las muestras de ruido reducido de
las tramas de reducción de ruido sucesivas sometidas al enventanado
se suma entre sí para mejorar los ajustes entre tramas
consecutivas. En el ejemplo mostrado en la Figura 1, las muestras de
ruido reducido de las pendientes 10 y 13 de las tramas sucesivas
F(n) y F(n+1) se suman de manera que los datos de la
pendiente anterior 10, calculados a partir de las muestras más
nuevas de la trama F(n), se suman muestra a muestra con la
pendiente 13, calculada a partir de las muestras más antiguas de la
trama F(n+1), de modo que la suma de los coeficientes de las
pendientes superpuestas es 1. No obstante, debido al método de suma
con superposición, la sección representada por la pendiente
anterior 10 no se puede transmitir más allá a partir de la reducción
del ruido antes de que se realice la reducción del ruido para la
siguiente trama completa F(n+1) y tampoco se puede dar inicio
a la reducción de ruido de la siguiente trama F(n+1) antes
de que se reciba la siguiente trama completa. De este modo, el uso
del método de suma con superposición en el procesado de una señal
provoca un retardo adicional D1, el cual es igual a la longitud de
la pendiente 10.
El diagrama de bloques simplificado de la Figura
2 ilustra las fases del procesado para una señal que está formada
por muestras divididas en tramas, según la técnica anterior. En
bloque 21 representa el enventanado de una trama, tal como se ha
presentado anteriormente, y el bloque 22 representa la ejecución de
algoritmos de reducción de ruido para tramas enventanadas, que
comprenden por lo menos una FFT que se ejecuta sobre los datos
enventanados y su transformada inversa. El bloque 23 representa las
operaciones realizadas según un enventanado de suma con
superposición en el que los datos de ruido reducido se almacenan
para las primeras pendientes 10, 14 de la ventana, con vistas a
esperar al procesado de la siguiente trama, y en el que los datos
almacenados se suman con los datos de las segundas pendientes 13 de
la siguiente trama. El bloque 24 representa el preprocesado de la
señal relacionado con la codificación de la voz, el cual comprende
típicamente un filtrado pasa-altas y un escalado de
la señal para la codificación de la voz. Desde el bloque 24, los
datos se transfieren a un bloque 25 para la codificación de la
voz.
Los códecs de voz (por ejemplo, CELP, ACELP),
usados en los sistemas actuales de telefonía móvil, se basan en la
predicción lineal (CELP= Predicción Lineal con Excitación por
Código). En la predicción lineal, una señal se codifica trama a
trama. Los datos contenidos en las tramas se someten a un
enventanado y sobre la base de los datos enventanados, se calcula
un conjunto de coeficientes de autocorrelación, los cuales se usarán
para determinar los coeficientes de una función de predicción
lineal que se usarán como parámetros de codificación.
El documento
US-A-5839101 (Vähätalo et al)
da a conocer una combinación de supresión de ruido en el dominio de
la frecuencia y codificación de voz que minimiza el retardo total:
la longitud de trama procesada en el bloque de supresión de ruido
es un coeficiente exacto de la longitud de trama utilizada por el
codificador de voz.
La anticipación (lookahead) es un
procedimiento conocido usado en la transmisión de datos, en el que,
por ejemplo, en un procedimiento aplicado a una trama de voz se
utilizan típicamente datos más nuevos que no pertenecen a la trama
a procesar. En algunos algoritmos de codificación de voz, tales como
los algoritmos según la norma IS-641 especificada
por la Asociación de Industrias Electrónicas/Asociación de
Industrias de Telecomunicaciones (EIA/TIA), se calculan parámetros
de predicción lineal (LP) para la codificación de la voz a partir
de una ventana que contiene, además de la trama a analizar, muestras
que pertenecen a la trama anterior y a la siguiente. A las muestras
que pertenecen a la trama siguiente se le denominan muestras
anticipadas. Se ha propuesto además una disposición correspondiente
para ser usada, por ejemplo, en relación con códecs de
Multivelocidad Adaptativa (AMR).
La Figura 3 ilustra la anticipación tal como se
usa en la predicción lineal según la norma IS-641. A
cada trama de voz 30 de 20 ms de largo se le aplica un enventanado
en una ventana asimétrica 31 que contiene también muestras
pertenecientes a la trama anterior y a la siguiente. A la parte de
ventana 31 formada por muestras más nuevas se le denomina parte
anticipada 32. Se realiza un análisis LP una vez por cada ventana.
Tal como puede observarse en la Figura 3, el enventanado
relacionado con la anticipación provoca un retardo algorítmico D2
en la señal correspondiente a la longitud de la parte anticipada 32.
Como la llegada de la señal para la codificación de voz ya se ha
retardado en un periodo D1 como consecuencia del enventanado de
reducción de ruido, el retardo D2 se suma con el retardo adicional
D1 de reducción de ruido previamente descrito.
Según la invención, se proporciona un método
para generar una trama de codificación de voz, comprendiendo el
método las siguientes etapas:
formar una serie de primeras tramas parcialmente
superpuestas que contienen muestras de voz;
procesar una primera trama de entre la serie de
primeras tramas por medio de una primera función de ventana para
producir una segunda trama enventanada que tiene una primera
pendiente;
realizar una reducción de ruido sobre la segunda
trama para producir una tercera trama que comprende muestras de voz
de ruido reducido; y
formar una trama de codificación de voz que
comprende muestras de ruido reducido de dos terceras tramas
sucesivas, sumadas por lo menos parcialmente entre sí
caracterizado porque el método comprende además
las siguientes etapas:
formar la trama de codificación de voz de manera
que la misma presenta una parte anticipada que está formada por lo
menos parcialmente por muestras de voz de ruido reducido de la
primera pendiente, no sumándose estas muestras de voz de ruido
reducido de la primera pendiente con ningunas otras muestras de voz
de ruido reducido de la trama de codificación de voz a formar.
De forma ventajosa, el efecto combinado antes
descrito de los retardos algorítmicos se puede reducir a través del
método de la invención y de un aparato que implementa el método.
De forma ventajosa, utilizando el enventanado ya
ejecutado en la reducción de ruido en el enventanado de codificación
de voz, los retardos algorítmicos provocados por fases del
procesado no se suman entre sí.
En la reivindicación 10 se describe un
codificador de voz según la invención y en la reivindicación 13 se
describe una estación móvil según la invención. En las
reivindicaciones subordinadas se describen las formas de
realización de la invención.
A continuación se explicará más detalladamente
la invención haciendo referencia a los dibujos adjuntos, en los
cuales
la Figura 1 ilustra un enventanado presentando,
como ejemplo, el enventanado de una trama F en una forma trapecial
(técnica anterior);
la Figura 2 ilustra el procesado de una señal
formada por muestras dividas en tramas en forma de un diagrama de
bloques (técnica anterior);
la Figura 3 ilustra la anticipación en una
predicción lineal según la norma IS-641 (técnica
anterior);
la Figura 4 ilustra el principio de
funcionamiento de la invención de una forma simplificada;
la Figura 5 ilustra el método según la invención
en forma de un diagrama de flujo;
la Figura 6 ilustra las funcionalidades de un
codificador de voz según la invención en forma de un diagrama de
bloques; y
la Figura 7 ilustra una estación móvil según la
invención en forma de un diagrama de bloques.
Las Figuras 1 a 3 se han descrito
anteriormente.
La Figura 4 ilustra, de una forma simplificada,
el principio de reducción del retardo algorítmico en la codificación
de voz según la invención. El eje de tiempo NR describe el
enventanado usado en la reducción de ruido 22 y el eje de tiempo SC
describe el enventanado a usar en la codificación de voz 25. La
relación entre las longitudes de las tramas usadas en la reducción
de ruido y la codificación de voz no es relevante para la invención,
aunque preferentemente la longitud de una trama de codificación de
voz es un múltiplo de la suma de la pendiente posterior 11 y la
parte de ventana 12 de la trama de reducción de ruido 19. De este
modo, la longitud de una trama de codificación de voz es dicha suma
multiplicada por un entero N=1,2,.... En la forma de realización
presentada, se usa un enventanado de codificación de voz según la
norma IS-641 y se considera que el enventanado
usado en la reducción de ruido es tal que la longitud de la trama
usada en la codificación de voz es dos veces la longitud de la
trama usada en la reducción de ruido, sin limitar la invención a las
longitudes seleccionadas o a su relación. En la forma de
realización presentada, en la pendiente de la ventana de reducción
de ruido se usa una función con una forma cosenoidal y la ventana
de codificación de voz es una ventana asimétrica formada a partir
de una ventana Hamming y una función de ventana formada usando la
función coseno:
en la que n es el índice de una
muestra en la ventana, L_{1}=200,
L_{2}=40.
En una de las soluciones según la técnica
anterior, el retardo D1 provocado por el enventanado de suma con
superposición, de reducción de ruido, correspondiente a la longitud
de la pendiente 41 y el retardo D2 requerido para la anticipación
de la longitud de la pendiente 42 en la codificación de voz afectan
al procesado de una señal. En una de las soluciones según la
invención, la pendiente 41 calculada en el enventanado de reducción
de ruido se utiliza en la anticipación de la codificación de voz,
con lo cual una trama de voz se puede analizar y codificar
inmediatamente en cuanto las muestras de ruido reducido a codificar
y la pendiente 41 obtenida a partir del enventanado de reducción de
ruido relacionado con las mismas se reciben en el bloque de
codificación de voz 25. En este caso, el retardo D1 provocado por
la reducción de ruido no se suma con el retardo D2 provocado por el
enventanado de codificación de voz sino que, en su lugar, el primero
se funde con el retardo algorítmico provocado por la anticipación,
de tal manera que el retardo algorítmico global de los procesos es
menor que en la solución según la técnica anterior. La disposición
según la invención es posible gracias a que, en la anticipación,
las muestras contenidas en la parte anticipada se usan únicamente
como información auxiliar cuando se analiza la trama a codificar,
es decir, no se forma expresamente una señal de salida sobre la base
de muestras contenidas en la parte
anticipada.
anticipada.
Para lograr el efecto que se produce según la
invención, la pendiente 41 del enventanado de reducción de ruido
referente a las muestras más nuevas 43 de la trama de codificación
de voz a formar se transfiere junto con muestras de ruido reducido
40, 43 para la codificación de voz. El enventanado de reducción de
ruido y el enventanado de codificación de voz están dispuestos
preferentemente de manera que se superponen en el tiempo para que
por lo menos una pendiente 41 del enventanado de reducción de ruido
coincida por lo menos parcialmente con la parte anticipada 42 de
cada trama de codificación de voz.
En la forma de realización mostrada en la Figura
4, las pendientes anteriores de la ventana usada en la codificación
de voz y de la ventana usada en la reducción de ruido tienen la
misma longitud y para las pendientes anteriores se usa la misma
función de enventanado, es decir, las pendientes son idénticas. Por
lo que a la invención respecta, dicha opción es una alternativa
preferida en cuanto al cálculo ya que, en este caso, la pendiente
obtenida a partir del enventanado de reducción de ruido se puede
utilizar directamente como parte anticipada de la codificación de
voz y el retardo algorítmico se reduce sin necesidad de un procesado
adicional. Por ejemplo, en el caso mostrado en la Figura 4, se
forma una ventana de codificación de voz 44, según la invención, a
partir de las muestras de ruido reducido 40 de una ventana
w(n-2) 47, a partir de las muestras de ruido
reducido 43 de dos ventanas de reducción de ruido w(n),
w(n-1) (referencias 46, 45) y de la pendiente
(41) del enventanado de ruido reducido referente a las muestras de
la ventana w(n) 45. Las muestras de ruido reducido 40, 43 se
procesan por medio de la función de enventanado de codificación de
voz y se realiza un análisis de autocorrelación basándose en la
ventana 44 formada a partir de las muestras enventanadas 40, 43 y de
dicha pendiente 41. En este caso, el retardo cuya longitud es la
correspondiente a la pendiente 41, provocado por la reducción de
ruido, se funde con el retardo provocado por la anticipación de la
codificación de voz, y se reduce su efecto combinado.
El diagrama de bloques de la Figura 5 ilustra un
método, según la invención, para procesar voz. La etapa 51
representa un preprocesado de la señal en relación con la
codificación de voz, el cual se sabe que en la técnica anterior
comprende un filtrado pasa-altas y un escalado de la
señal para la fase de codificación de voz. En la etapa 52, las
muestras preprocesadas se procesan por medio de una primera función
de ventana tal como se ha presentado anteriormente. La etapa 53
describe la ejecución de los algoritmos de reducción de ruido para
tramas enventanadas, que comprenden por lo menos una FFT y su
transformada inversa que se ejecuta sobre los datos enventanados.
La etapa 54 describe operaciones según el método de suma con
superposición, en las que las muestras de ruido reducido y
enventanadas se almacenan y suman tal como se ha presentado
anteriormente. Después de la etapa 54, el método comprende dos vías
diferentes, una primera vía 55 la cual comprende algoritmos de
codificación de voz, en la que la trama no es necesario que se
someta a un enventanado, y una segunda vía 56, 57 que comprende
algoritmos de codificación de voz (por ejemplo, LPC), en la que es
necesario un enventanado.
En la segunda vía de codificación de voz, se
forma una segunda ventana (etapa 56) utilizando muestras de ruido
reducido. En el método según la invención, la segunda ventana se
forma a partir de un número determinado de muestras de ruido
reducido recibidas y a partir de la pendiente anterior del
enventanado de reducción de ruido correspondiente a las muestras
recibidas más nuevas. De este modo, como el preprocesado de una
pendiente de ruido reducido requeriría varias etapas adicionales,
el preprocesado se lleva a cabo en la etapa 51 antes que el
enventanado de reducción de ruido y la reducción de ruido a
diferencia de la técnica anterior. Se calcula un conjunto de
parámetros de codificación de voz p_{j} (por ejemplo, parámetros
LP) basándose (etapa 57) en la segunda ventana, transfiriéndose
dichos parámetros hacia la primera vía de codificación de voz 55
para otros algoritmos de codificación de voz. Los parámetros de
codificación de voz r_{j} generados en la primera vía 55 permiten
la reconstrucción de la voz con un decodificador correspondiente a
un codificador, según la técnica anterior.
No obstante, la utilización de la invención no
se limita simplemente a ventanas uniformes sino que también son
posibles diferentes relaciones de longitud y forma (es decir, de las
funciones de enventanado usadas en las pendientes). Si la duración
de la pendiente anterior 41 que contiene las muestras más nuevas de
reducción de ruido es tan prolongada como la parte anticipada 42 de
codificación de voz, aunque dicha pendiente anterior 41 y la parte
anticipada 42 tienen una forma diferente, la pendiente anterior 41 a
transferir se debe multiplicar muestra por muestra en el bloque 54
o la pendiente anterior transferida 41 se debe multiplicar en el
bloque 56 por una función de corrección que compense la diferencia
entre las funciones usadas en el enventanado. En este caso, la
reducción del retardo algorítmico provoca un retardo computacional
en el proceso el cual, no obstante, presenta típicamente un efecto
menor que el retardo algorítmico a reducir.
Las longitudes de la pendiente anterior de
reducción de ruido y de la parte anticipada pueden ser diferentes
entre sí. Si la pendiente anterior del reductor de ruido es más
prolongada que la parte anticipada, el retardo algorítmico se
determina naturalmente según dicha pendiente anterior.
Adicionalmente, las muestras de la pendiente anterior, o la parte
de la pendiente anterior que se utiliza en la anticipación, se deben
multiplicar muestra a muestra por una función de corrección que
compense la diferencia entre las funciones usadas en el enventanado.
Si la pendiente anterior 41 de un reductor de ruido es más corta
que la parte anticipada 42, dicha pendiente anterior 41 y el número
requerido de muestras nuevas que vienen tras ellas se transfieren
para la codificación de voz 25 con vistas a completar la longitud
de la parte anticipada. La pendiente anterior obtenida a partir de
la reducción de ruido y las muestras sucesivas deben procesarse
nuevamente por medio de una función de corrección que compense la
diferencia.
El diagrama de bloques de la Figura 6 ilustra
las funcionalidades de un codificador de voz según la invención. El
codificador 60 comprende una entrada 61 para recibir una trama
F_{j}, que contiene muestras determinadas a partir de la voz, y
una salida 62 para proporcionar parámetros de voz r_{j},
determinados sobre la base de las muestras. La entrada 61 está
dispuesta para preprocesar las tramas recibidas con vistas a la
codificación de voz y para enventanar las tramas en una forma
preferida con vistas a la reducción de ruido. El codificador
comprende además medios de procesado 63 adaptados para efectuar
operaciones con vistas a determinar los parámetros de voz sobre la
base de las tramas de reducción de ruido enventanadas recibidas
desde la entrada 61. Los medios de procesado comprenden un reductor
de ruido 64, en el que las tramas de reducción de ruido recibidas
son procesadas por un algoritmo específico de reducción de ruido.
Las tramas de ruido reducido se envían a un sumador 65 el cual está
conectado a una memoria 69 para almacenar muestras contenidas en
tramas sucesivas de reducción de ruido, por lo menos en relación
con las pendientes anteriores del enventanado de reducción de
ruido. Las muestras de tramas sucesivas de reducción de ruido son
sumadas entre sí por medio del sumador 65 para mejorar la forma en
la que las tramas sucesivas encajan unas con otras, preferentemente
la pendiente anterior 10 de la trama de reducción de ruido anterior
se suma con la pendiente posterior 13 de la trama de reducción de
ruido a procesar. Los medios de procesado comprenden también un
elemento de codificación 66. El elemento de codificación 66, según
la invención, comprenden dos vías diferentes, una primera vía 67 la
cual comprende algoritmos de codificación de voz en la que no es
necesario someter a enventanado una trama, y una segunda vía 68 que
comprende algoritmos de codificación de voz (por ejemplo, LPC) en la
que es necesario un enventanado. El sumador 65, según la invención,
está dispuesto para transferir la pendiente anterior 10 de la
ventana de reducción de ruido correspondiente a las muestras más
nuevas de la trama de codificación de voz a formar por lo menos
hacia la segunda vía 68 del elemento de codificación 66 para el
enventanado de la segunda vía de codificación de voz. En la segunda
vía 68, dicha pendiente se utiliza tal como se ha presentado
anteriormente en la formación de una segunda ventana, tras lo cual
se reduce el efecto combinado de los retardos algorítmicos
provocados por el enventanado de reducción de ruido y el enventanado
de codificación de voz. Por medio de dichos algoritmos de
codificación de voz a ejecutar en la primera 67 y la segunda 68 vías
de análisis, los parámetros de codificación de voz r_{j} se
determinan según una forma conocida para un experto en la materia,
permitiendo la reconstrucción de la voz mediante un decodificador
correspondiente al codificador. Se puede encontrar una descripción
más detallada de las funcionalidades de la técnica anterior antes
presentada, por ejemplo, en la Norma IS-641
EIA/TIA.
El diagrama de bloques de la Figura 7 ilustra
una estación móvil 70 según la invención. La estación móvil
comprende una unidad de procesado central 71 la cual controla las
diversas funciones de la estación móvil, una interfaz de usuario 72
(típicamente por lo menos un teclado, una pantalla, un micrófono, y
un altavoz) para permitir la comunicación con un usuario, y una
memoria 73 la cual típicamente está formada por al menos una
memoria no volátil y una memoria volátil. Adicionalmente, la
estación móvil comprende una parte de radiocomunicaciones 74 para
permitir la comunicación con la parte de red de un sistema de
comunicaciones móviles. En los sistemas de comunicaciones móviles,
la voz se transfiere en un formato codificado y, por lo tanto, se
dispone preferentemente de un códec 75 entre la parte de
radiocomunicaciones 74 y la interfaz de usuario 72, comprendiendo el
códec un codificador para codificar la voz y un decodificador para
decodificar la voz. Basándose en las muestras tomadas de una señal
de voz recibida a través de la interfaz de usuario 72, el
codificador calcula un conjunto de parámetros de voz para la
transmisión hacia un receptor a través de la parte de
radiocomunicaciones 74. De forma correspondiente, los parámetros de
voz recibidos a través de la parte de radiocomunicaciones son
decodificados y, basándose en los parámetros decodificados, la voz
recibida se reconstruye para darle salida a través de la interfaz
de usuario 72. Tal como se ha presentado anteriormente, el códec de
una estación móvil, según la invención, comprende medios 63, 69
para utilizar una primera pendiente de enventanado determinada en
la reducción de ruido cuando se realiza un enventanado en relación
con algoritmos de codificación de voz.
Este documento presenta la implementación y
formas de realización de la presente invención con la ayuda de
ejemplos. Un experto en la materia apreciará que la presente
invención no está limitada a los detalles de las formas de
realización presentadas previamente, y que la invención también se
puede implementar de otras maneras. Las formas de realización
presentadas anteriormente deberían considerarse ilustrativas, pero
no limitativas. Por lo tanto, las posibilidades de implementación y
uso de la invención están limitadas únicamente por las
reivindicaciones adjuntas.
Claims (13)
1. Método para generar una trama de codificación
de voz (44), comprendiendo el método las siguientes etapas:
formar una serie de primeras tramas parcialmente
superpuestas (18) que contienen muestras de voz;
procesar una primera trama de entre la serie de
primeras tramas (18) por medio de una primera función de ventana
para producir una segunda trama, enventanada, que tiene una primera
pendiente;
realizar una reducción de ruido sobre la segunda
trama para producir una tercera trama (19; 45) que comprende
muestras de voz de ruido reducido; y
formar una trama de codificación de voz (44) que
comprende muestras de ruido reducido de dos terceras tramas
sucesivas (45, 46), sumadas por lo menos parcialmente entre sí;
caracterizado porque el método comprende
además las siguientes etapas:
formar la trama de codificación de voz (44) de
manera que la misma presenta una parte anticipada (42) que está
formada por lo menos parcialmente por muestras de voz de ruido
reducido de la primera pendiente (41), no sumándose estas muestras
de voz de ruido reducido de la primera pendiente con ningunas otras
muestras de voz de ruido reducido de la trama de codificación de
voz (44) a formar.
2. Método según la reivindicación 1,
caracterizado porque antes de la formación de dicha trama de
codificación de voz, dichas muestras de ruido reducido (40, 43) son
procesadas por una segunda función de ventana.
3. Método según la reivindicación 2,
caracterizado porque la primera función de ventana y la
segunda función de ventana están dispuestas para producir el mismo
resultado cuando van dirigidas a las muestras de la primera
pendiente.
4. Método según cualquiera de las
reivindicaciones 1 a 3, caracterizado porque por lo menos
algunas de las muestras de voz de ruido reducido de la parte
anticipada son iguales a las muestras de voz de ruido reducido de
la primera pendiente.
5. Método según cualquiera de las
reivindicaciones 1 a 3, caracterizado porque la tercera trama
(19) comprende una segunda pendiente (11) que se corresponde con la
primera pendiente (10), procesada a partir de muestras anteriores
de la trama, y porque el método comprende además:
sumar las muestras de la segunda pendiente (11)
de la tercera trama (19) a procesar con las muestras de ruido
reducido de la primera pendiente de la tercera trama anterior.
6. Método según la reivindicación 2,
caracterizado porque la primera función de ventana y la
segunda función de ventana están dispuestas para producir un
resultado diferente cuando van dirigidas a las muestras de la
primera pendiente con lo cual, también en el método, las muestras de
la primera pendiente (41) son procesadas por una función de
corrección específica.
7. Método según la reivindicación 1 ó 2,
caracterizado porque por lo menos algunas de las muestras de
voz de ruido reducido de la parte anticipada se forman con una
función de corrección de las muestras de voz de ruido reducido de
la primera pendiente.
8. Método según cualquiera de las
reivindicaciones anteriores, caracterizado porque se
determina un conjunto de parámetros de predicción lineal (LP)
basándose en la trama de codificación de voz (44).
9. Método según cualquiera de las
reivindicaciones anteriores, caracterizado porque antes que
la reducción de ruido se realiza un preprocesado de muestras de
voz.
10. Codificador de voz (60) que comprende
un elemento de entrada (61) para formar una
serie de primeras tramas parcialmente superpuestas (18) que
contienen muestras de voz;
unos medios para procesar una primera trama de
entre la serie de primeras tramas (18) por medio de una primera
función de ventana para formar una segunda trama, enventanada, que
tiene una primera pendiente;
un reductor de ruido (64) para realizar una
reducción de ruido sobre la segunda trama con vistas a formar una
tercera trama (19) que comprende muestras de ruido reducido;
un elemento de codificación (66) el cual
comprende unos medios (65, 68) para formar una trama de codificación
de voz (44), comprendiendo la trama de codificación de voz (44)
muestras de ruido reducido de dos terceras tramas sucesivas (45)
sumadas por lo menos parcialmente entre sí, y medios (68) para
determinar parámetros de codificación de voz (p_{j}) basándose en
dicha trama de codificación de voz (44);
caracterizado porque
el elemento de codificación (66) comprende
además unos medios (65, 68) para formar la trama de codificación de
voz (44) de manera que la trama de codificación de voz (44) presenta
una parte anticipada (42) la cual está formada por lo menos
parcialmente por la primera pendiente (41), no sumándose las
muestras de voz de ruido reducido de la primera pendiente con
ningunas otras muestras de voz de ruido reducido de la trama de
codificación de voz (44) a formar.
11. Codificador de voz según la reivindicación
10, caracterizado porque dicho elemento de codificación (66)
comprende unos medios (68) para procesar dichas muestras de ruido
reducido (40, 43) mediante una segunda función de ventana en
relación con la formación de la trama de codificación de voz
(44).
12. Codificador según la reivindicación 10 u 11,
caracterizado porque la tercera trama (19) comprende una
segunda pendiente (11) que se corresponde con la primera pendiente
(10), procesada a partir de muestras anteriores, y el codificador
comprende además un sumador (65) para sumar las muestras de ruido
reducido de la segunda pendiente (11) de la tercera trama (19) a
procesar con las muestras de ruido reducido de la primera pendiente
de la tercera trama anterior.
13. Estación móvil (70) que comprende un
codificador de voz (60) según la reivindicación 10.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FI19990033 | 1999-01-08 | ||
| FI990033A FI114833B (fi) | 1999-01-08 | 1999-01-08 | Menetelmä, puhekooderi ja matkaviestin puheenkoodauskehysten muodostamiseksi |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2284473T3 true ES2284473T3 (es) | 2007-11-16 |
Family
ID=8553299
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES00901158T Expired - Lifetime ES2284473T3 (es) | 1999-01-08 | 2000-01-04 | Metodo y aparato para determinar parametros de codificacion de voz. |
Country Status (11)
| Country | Link |
|---|---|
| US (1) | US6587817B1 (es) |
| EP (1) | EP1145221B1 (es) |
| JP (1) | JP4545941B2 (es) |
| CN (1) | CN1132155C (es) |
| AT (1) | ATE360249T1 (es) |
| AU (1) | AU2112700A (es) |
| DE (1) | DE60034429T2 (es) |
| ES (1) | ES2284473T3 (es) |
| FI (1) | FI114833B (es) |
| HK (1) | HK1042578B (es) |
| WO (1) | WO2000041163A2 (es) |
Families Citing this family (20)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR100452109B1 (ko) * | 2002-10-07 | 2004-10-12 | 주식회사 아큐죤 | 음성신호 추적장치 및 그 방법 |
| EP1626504A1 (en) | 2003-05-21 | 2006-02-15 | Sony Corporation | Data processing device, encoding device, encoding method, decoding device, decoding method, and program |
| FR2875633A1 (fr) * | 2004-09-17 | 2006-03-24 | France Telecom | Procede et dispositif d'evaluation de l'efficacite d'une fonction de reduction de bruit destinee a etre appliquee a des signaux audio |
| FR2882458A1 (fr) * | 2005-02-18 | 2006-08-25 | France Telecom | Procede de mesure de la gene due au bruit dans un signal audio |
| PL3848928T3 (pl) | 2006-10-25 | 2023-07-17 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Urządzenie i sposób do generowania wartości podpasm audio o wartościach zespolonych |
| USRE50158E1 (en) | 2006-10-25 | 2024-10-01 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Apparatus and method for generating audio subband values and apparatus and method for generating time-domain audio samples |
| WO2008069593A1 (en) | 2006-12-07 | 2008-06-12 | Lg Electronics Inc. | A method and an apparatus for processing an audio signal |
| GB2466675B (en) | 2009-01-06 | 2013-03-06 | Skype | Speech coding |
| GB2466671B (en) | 2009-01-06 | 2013-03-27 | Skype | Speech encoding |
| GB2466670B (en) | 2009-01-06 | 2012-11-14 | Skype | Speech encoding |
| GB2466673B (en) | 2009-01-06 | 2012-11-07 | Skype | Quantization |
| US8452606B2 (en) | 2009-09-29 | 2013-05-28 | Skype | Speech encoding using multiple bit rates |
| TWI479478B (zh) * | 2011-02-14 | 2015-04-01 | 弗勞恩霍夫爾協會 | 用以使用對齊的預看部分將音訊信號解碼的裝置與方法 |
| MY165853A (en) | 2011-02-14 | 2018-05-18 | Fraunhofer Ges Forschung | Linear prediction based coding scheme using spectral domain noise shaping |
| BR112013020324B8 (pt) | 2011-02-14 | 2022-02-08 | Fraunhofer Ges Forschung | Aparelho e método para supressão de erro em fala unificada de baixo atraso e codificação de áudio |
| TWI564882B (zh) | 2011-02-14 | 2017-01-01 | 弗勞恩霍夫爾協會 | 利用重疊變換之資訊信號表示技術(一) |
| EP2676267B1 (en) | 2011-02-14 | 2017-07-19 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Encoding and decoding of pulse positions of tracks of an audio signal |
| WO2012110448A1 (en) | 2011-02-14 | 2012-08-23 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for coding a portion of an audio signal using a transient detection and a quality result |
| KR101699898B1 (ko) | 2011-02-14 | 2017-01-25 | 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. | 스펙트럼 영역에서 디코딩된 오디오 신호를 처리하기 위한 방법 및 장치 |
| CN111415674A (zh) * | 2020-05-07 | 2020-07-14 | 北京声智科技有限公司 | 语音降噪方法及电子设备 |
Family Cites Families (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5774846A (en) * | 1994-12-19 | 1998-06-30 | Matsushita Electric Industrial Co., Ltd. | Speech coding apparatus, linear prediction coefficient analyzing apparatus and noise reducing apparatus |
| US5732389A (en) * | 1995-06-07 | 1998-03-24 | Lucent Technologies Inc. | Voiced/unvoiced classification of speech for excitation codebook selection in celp speech decoding during frame erasures |
| FI100840B (fi) * | 1995-12-12 | 1998-02-27 | Nokia Mobile Phones Ltd | Kohinanvaimennin ja menetelmä taustakohinan vaimentamiseksi kohinaises ta puheesta sekä matkaviestin |
| GB2326572A (en) * | 1997-06-19 | 1998-12-23 | Softsound Limited | Low bit rate audio coder and decoder |
-
1999
- 1999-01-08 FI FI990033A patent/FI114833B/fi not_active IP Right Cessation
-
2000
- 2000-01-04 AU AU21127/00A patent/AU2112700A/en not_active Abandoned
- 2000-01-04 ES ES00901158T patent/ES2284473T3/es not_active Expired - Lifetime
- 2000-01-04 AT AT00901158T patent/ATE360249T1/de active
- 2000-01-04 CN CN008026408A patent/CN1132155C/zh not_active Expired - Lifetime
- 2000-01-04 HK HK02104319.4A patent/HK1042578B/zh not_active IP Right Cessation
- 2000-01-04 EP EP00901158A patent/EP1145221B1/en not_active Expired - Lifetime
- 2000-01-04 JP JP2000592817A patent/JP4545941B2/ja not_active Expired - Lifetime
- 2000-01-04 DE DE60034429T patent/DE60034429T2/de not_active Expired - Lifetime
- 2000-01-04 WO PCT/FI2000/000006 patent/WO2000041163A2/en not_active Ceased
- 2000-01-07 US US09/478,877 patent/US6587817B1/en not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| FI990033A0 (fi) | 1999-01-08 |
| DE60034429D1 (de) | 2007-05-31 |
| CN1337042A (zh) | 2002-02-20 |
| JP2004513381A (ja) | 2004-04-30 |
| WO2000041163A3 (en) | 2005-03-10 |
| HK1042578B (zh) | 2005-03-04 |
| ATE360249T1 (de) | 2007-05-15 |
| CN1132155C (zh) | 2003-12-24 |
| EP1145221A3 (en) | 2005-04-27 |
| HK1042578A1 (en) | 2002-08-16 |
| DE60034429T2 (de) | 2008-01-03 |
| US6587817B1 (en) | 2003-07-01 |
| FI990033L (fi) | 2000-07-09 |
| WO2000041163A2 (en) | 2000-07-13 |
| FI114833B (fi) | 2004-12-31 |
| AU2112700A (en) | 2000-07-24 |
| JP4545941B2 (ja) | 2010-09-15 |
| EP1145221B1 (en) | 2007-04-18 |
| EP1145221A2 (en) | 2001-10-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2284473T3 (es) | Metodo y aparato para determinar parametros de codificacion de voz. | |
| ES2380307T3 (es) | Esquema de codificación/decodificación de audio de tasa de transmisión de bits baja con preprocesamiento común. | |
| ES2625952T3 (es) | Método para la generación de tramas de ocultación en sistema de comunicación | |
| ES2797525T3 (es) | Conformación simultánea de ruido en el dominio del tiempo y el dominio de la frecuencia para transformaciones TDAC | |
| ES2338117T3 (es) | Codificacion de audio con diferentes longitudes de trama de codificacion. | |
| ES2266003T3 (es) | Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha. | |
| KR101092167B1 (ko) | 피치-조정 및 비-피치-조정 코딩을 이용한 신호 인코딩 | |
| KR101437127B1 (ko) | 가중 윈도우들을 사용한 저-지연 변환 코딩 | |
| EP2747079B1 (en) | Encoding device | |
| ES2354427T3 (es) | Mejora de la calidad de audio decodificado mediante la adición de ruido. | |
| KR101668401B1 (ko) | 오디오 신호를 인코딩하기 위한 방법 및 장치 | |
| JP6450802B2 (ja) | 音声符号化装置および方法 | |
| EP2492911B1 (en) | Audio encoding apparatus, decoding apparatus, method, circuit and program | |
| KR101067514B1 (ko) | 버퍼 조정을 이용하는 예측 코딩 데이터의 디코딩 | |
| CA2457988A1 (en) | Methods and devices for audio compression based on acelp/tcx coding and multi-rate lattice vector quantization | |
| JP2011123506A (ja) | 可変レートスピーチ符号化 | |
| ES2378972T3 (es) | Atenuación de la sobresonorización, en particular para la generación de una excitación en un decodificador, en ausencia de información | |
| JP2004287397A (ja) | 相互使用可能なボコーダ | |
| US20210134309A1 (en) | Audio coder window and transform implementations | |
| Iyengar et al. | A low delay 16 kb/s speech coder | |
| KR100915726B1 (ko) | 잡음 억제 방법 및 장치 | |
| KR102230089B1 (ko) | 오디오 신호의 은닉된 오디오 신호 부분으로부터 후속하는 오디오 신호 부분까지의 전이를 개선하기 위한 장치 및 방법 | |
| KR20030011912A (ko) | 오디오 코딩 | |
| RU2682851C2 (ru) | Усовершенствованная коррекция потери кадров с помощью речевой информации | |
| US20110058678A1 (en) | Stereo signal conversion device, stereo signal inverse conversion device, and method thereof |