ES2284473T3 - Metodo y aparato para determinar parametros de codificacion de voz. - Google Patents

Metodo y aparato para determinar parametros de codificacion de voz. Download PDF

Info

Publication number
ES2284473T3
ES2284473T3 ES00901158T ES00901158T ES2284473T3 ES 2284473 T3 ES2284473 T3 ES 2284473T3 ES 00901158 T ES00901158 T ES 00901158T ES 00901158 T ES00901158 T ES 00901158T ES 2284473 T3 ES2284473 T3 ES 2284473T3
Authority
ES
Spain
Prior art keywords
samples
frame
voice
slope
noise
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES00901158T
Other languages
English (en)
Inventor
Antti Vahatalo
Erkki Paajanen
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Nokia Inc
Original Assignee
Nokia Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nokia Inc filed Critical Nokia Inc
Application granted granted Critical
Publication of ES2284473T3 publication Critical patent/ES2284473T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/26Pre-filtering or post-filtering
    • G10L19/265Pre-filtering, e.g. high frequency emphasis prior to encoding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/022Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
    • G10L19/025Detection of transients or attacks for time/frequency resolution switching

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Devices For Executing Special Programs (AREA)
  • Reduction Or Emphasis Of Bandwidth Of Signals (AREA)

Abstract

Método para generar una trama de codificación de voz (44), comprendiendo el método las siguientes etapas: formar una serie de primeras tramas parcialmente superpuestas (18) que contienen muestras de voz; procesar una primera trama de entre la serie de primeras tramas (18) por medio de una primera función de ventana para producir una segunda trama, enventanada, que tiene una primera pendiente; realizar una reducción de ruido sobre la segunda trama para producir una tercera trama (19; 45) que comprende muestras de voz de ruido reducido; y formar una trama de codificación de voz (44) que comprende muestras de ruido reducido de dos terceras tramas sucesivas (45, 46), sumadas por lo menos parcialmente entre sí; caracterizado porque el método comprende además las siguientes etapas: formar la trama de codificación de voz (44) de manera que la misma presenta una parte anticipada (42) que está formada por lo menos parcialmente por muestras de voz de ruido reducido de la primera pendiente (41), no sumándose estas muestras de voz de ruido reducido de la primera pendiente con ningunas otras muestras de voz de ruido reducido de la trama de codificación de voz (44) a formar.

Description

Método y aparato para determinar parámetros de codificación de voz.
La presente invención se refiere a la codificación de la voz y en particular a la formación de tramas de codificación de voz.
En general un retardo es un periodo entre un acontecimiento y otro acontecimiento relacionado con el primero. En los sistemas de comunicaciones móviles, se produce un retardo entre la transmisión de una señal y su recepción, siendo dicho retardo el resultado de la interacción de una serie de factores diferentes, por ejemplo, la codificación de la voz, la codificación de los canales y el retardo de propagación de la señal. Los tiempos de respuesta largos producen una sensación artificial en la conversación y, por esta razón, un retardo provocado por el sistema hace siempre que la comunicación resulte más difícil. De este modo, se pretende minimizar el retardo en todas las partes del sistema.
Una de las fuentes de retardos es el enventanado usado en el procesado de la señal. La finalidad del enventanado es conformar la señal de manera que adopte una forma requerida en el procesado posterior. Por ejemplo, los reductores de ruido usados típicamente en los sistemas de comunicaciones móviles funcionan principalmente en el dominio de la frecuencia y, por esta razón, una señal cuyo ruido se va a reducir se transforma habitualmente trama a trama desde el dominio del tiempo al dominio de la frecuencia usando una Transformada Rápida de Fourier (FFT). Para que la FFT funcione según la manera deseada, a las muestras divididas en tramas se les debería aplicar un enventanado antes que la FFT.
La Figura 1 ilustra el procedimiento mostrando como ejemplo el enventanado de una trama F(n) en una forma trapecial. En el enventanado, el conjunto de muestras contenido en la trama F(n) se multiplica por una función de ventana de manera que una ventana W(n) 19 resultante de esta operación comprende una primera pendiente 10 (a la que en lo sucesivo se le hará referencia como pendiente anterior), que contiene muestras más recientes de la trama, una segunda pendiente 11 (a la que en lo sucesivo se le hará referencia como pendiente posterior), que contiene muestras más antiguas de la trama, y una parte de ventana restante 12 entre las dos primeras. En el enventanado del ejemplo, las muestras de la parte de ventana 12 que se sitúa entre la primera y la segunda pendientes se multiplican por 1, es decir, su valor permanece invariable. Las muestras de la pendiente anterior 10 se multiplican por una función descendente en la que el coeficiente de las muestras más antiguas de la pendiente anterior 10 se aproxima a uno y el coeficiente de las muestras más nuevas se aproxima a cero. De forma correspondiente, las muestras de la pendiente posterior 11 se multiplican por una función ascendente en la que el coeficiente de las muestras más antiguas de la pendiente posterior 11 se aproxima a cero y el coeficiente de las muestras más nuevas se aproxima a uno.
Para la reducción de ruido de los codificadores de voz, la trama de reducción de ruido F(n) (referencia 18) está formada típicamente por una trama de entrada 16, formada por muestras nuevas, y por un conjunto de las muestras más antiguas 15 de la trama de entrada anterior. De este modo, en la formación de dos tramas de entradas sucesivas se usan las muestras 17. La Figura 1 ilustra también el método de suma con superposición usado frecuentemente en relación con el enventanado con respecto a las FFT. En dicho método, parte de las muestras de ruido reducido de las tramas de reducción de ruido sucesivas sometidas al enventanado se suma entre sí para mejorar los ajustes entre tramas consecutivas. En el ejemplo mostrado en la Figura 1, las muestras de ruido reducido de las pendientes 10 y 13 de las tramas sucesivas F(n) y F(n+1) se suman de manera que los datos de la pendiente anterior 10, calculados a partir de las muestras más nuevas de la trama F(n), se suman muestra a muestra con la pendiente 13, calculada a partir de las muestras más antiguas de la trama F(n+1), de modo que la suma de los coeficientes de las pendientes superpuestas es 1. No obstante, debido al método de suma con superposición, la sección representada por la pendiente anterior 10 no se puede transmitir más allá a partir de la reducción del ruido antes de que se realice la reducción del ruido para la siguiente trama completa F(n+1) y tampoco se puede dar inicio a la reducción de ruido de la siguiente trama F(n+1) antes de que se reciba la siguiente trama completa. De este modo, el uso del método de suma con superposición en el procesado de una señal provoca un retardo adicional D1, el cual es igual a la longitud de la pendiente 10.
El diagrama de bloques simplificado de la Figura 2 ilustra las fases del procesado para una señal que está formada por muestras divididas en tramas, según la técnica anterior. En bloque 21 representa el enventanado de una trama, tal como se ha presentado anteriormente, y el bloque 22 representa la ejecución de algoritmos de reducción de ruido para tramas enventanadas, que comprenden por lo menos una FFT que se ejecuta sobre los datos enventanados y su transformada inversa. El bloque 23 representa las operaciones realizadas según un enventanado de suma con superposición en el que los datos de ruido reducido se almacenan para las primeras pendientes 10, 14 de la ventana, con vistas a esperar al procesado de la siguiente trama, y en el que los datos almacenados se suman con los datos de las segundas pendientes 13 de la siguiente trama. El bloque 24 representa el preprocesado de la señal relacionado con la codificación de la voz, el cual comprende típicamente un filtrado pasa-altas y un escalado de la señal para la codificación de la voz. Desde el bloque 24, los datos se transfieren a un bloque 25 para la codificación de la voz.
Los códecs de voz (por ejemplo, CELP, ACELP), usados en los sistemas actuales de telefonía móvil, se basan en la predicción lineal (CELP= Predicción Lineal con Excitación por Código). En la predicción lineal, una señal se codifica trama a trama. Los datos contenidos en las tramas se someten a un enventanado y sobre la base de los datos enventanados, se calcula un conjunto de coeficientes de autocorrelación, los cuales se usarán para determinar los coeficientes de una función de predicción lineal que se usarán como parámetros de codificación.
El documento US-A-5839101 (Vähätalo et al) da a conocer una combinación de supresión de ruido en el dominio de la frecuencia y codificación de voz que minimiza el retardo total: la longitud de trama procesada en el bloque de supresión de ruido es un coeficiente exacto de la longitud de trama utilizada por el codificador de voz.
La anticipación (lookahead) es un procedimiento conocido usado en la transmisión de datos, en el que, por ejemplo, en un procedimiento aplicado a una trama de voz se utilizan típicamente datos más nuevos que no pertenecen a la trama a procesar. En algunos algoritmos de codificación de voz, tales como los algoritmos según la norma IS-641 especificada por la Asociación de Industrias Electrónicas/Asociación de Industrias de Telecomunicaciones (EIA/TIA), se calculan parámetros de predicción lineal (LP) para la codificación de la voz a partir de una ventana que contiene, además de la trama a analizar, muestras que pertenecen a la trama anterior y a la siguiente. A las muestras que pertenecen a la trama siguiente se le denominan muestras anticipadas. Se ha propuesto además una disposición correspondiente para ser usada, por ejemplo, en relación con códecs de Multivelocidad Adaptativa (AMR).
La Figura 3 ilustra la anticipación tal como se usa en la predicción lineal según la norma IS-641. A cada trama de voz 30 de 20 ms de largo se le aplica un enventanado en una ventana asimétrica 31 que contiene también muestras pertenecientes a la trama anterior y a la siguiente. A la parte de ventana 31 formada por muestras más nuevas se le denomina parte anticipada 32. Se realiza un análisis LP una vez por cada ventana. Tal como puede observarse en la Figura 3, el enventanado relacionado con la anticipación provoca un retardo algorítmico D2 en la señal correspondiente a la longitud de la parte anticipada 32. Como la llegada de la señal para la codificación de voz ya se ha retardado en un periodo D1 como consecuencia del enventanado de reducción de ruido, el retardo D2 se suma con el retardo adicional D1 de reducción de ruido previamente descrito.
Según la invención, se proporciona un método para generar una trama de codificación de voz, comprendiendo el método las siguientes etapas:
formar una serie de primeras tramas parcialmente superpuestas que contienen muestras de voz;
procesar una primera trama de entre la serie de primeras tramas por medio de una primera función de ventana para producir una segunda trama enventanada que tiene una primera pendiente;
realizar una reducción de ruido sobre la segunda trama para producir una tercera trama que comprende muestras de voz de ruido reducido; y
formar una trama de codificación de voz que comprende muestras de ruido reducido de dos terceras tramas sucesivas, sumadas por lo menos parcialmente entre sí
caracterizado porque el método comprende además las siguientes etapas:
formar la trama de codificación de voz de manera que la misma presenta una parte anticipada que está formada por lo menos parcialmente por muestras de voz de ruido reducido de la primera pendiente, no sumándose estas muestras de voz de ruido reducido de la primera pendiente con ningunas otras muestras de voz de ruido reducido de la trama de codificación de voz a formar.
De forma ventajosa, el efecto combinado antes descrito de los retardos algorítmicos se puede reducir a través del método de la invención y de un aparato que implementa el método.
De forma ventajosa, utilizando el enventanado ya ejecutado en la reducción de ruido en el enventanado de codificación de voz, los retardos algorítmicos provocados por fases del procesado no se suman entre sí.
En la reivindicación 10 se describe un codificador de voz según la invención y en la reivindicación 13 se describe una estación móvil según la invención. En las reivindicaciones subordinadas se describen las formas de realización de la invención.
A continuación se explicará más detalladamente la invención haciendo referencia a los dibujos adjuntos, en los cuales
la Figura 1 ilustra un enventanado presentando, como ejemplo, el enventanado de una trama F en una forma trapecial (técnica anterior);
la Figura 2 ilustra el procesado de una señal formada por muestras dividas en tramas en forma de un diagrama de bloques (técnica anterior);
la Figura 3 ilustra la anticipación en una predicción lineal según la norma IS-641 (técnica anterior);
la Figura 4 ilustra el principio de funcionamiento de la invención de una forma simplificada;
la Figura 5 ilustra el método según la invención en forma de un diagrama de flujo;
la Figura 6 ilustra las funcionalidades de un codificador de voz según la invención en forma de un diagrama de bloques; y
la Figura 7 ilustra una estación móvil según la invención en forma de un diagrama de bloques.
Las Figuras 1 a 3 se han descrito anteriormente.
La Figura 4 ilustra, de una forma simplificada, el principio de reducción del retardo algorítmico en la codificación de voz según la invención. El eje de tiempo NR describe el enventanado usado en la reducción de ruido 22 y el eje de tiempo SC describe el enventanado a usar en la codificación de voz 25. La relación entre las longitudes de las tramas usadas en la reducción de ruido y la codificación de voz no es relevante para la invención, aunque preferentemente la longitud de una trama de codificación de voz es un múltiplo de la suma de la pendiente posterior 11 y la parte de ventana 12 de la trama de reducción de ruido 19. De este modo, la longitud de una trama de codificación de voz es dicha suma multiplicada por un entero N=1,2,.... En la forma de realización presentada, se usa un enventanado de codificación de voz según la norma IS-641 y se considera que el enventanado usado en la reducción de ruido es tal que la longitud de la trama usada en la codificación de voz es dos veces la longitud de la trama usada en la reducción de ruido, sin limitar la invención a las longitudes seleccionadas o a su relación. En la forma de realización presentada, en la pendiente de la ventana de reducción de ruido se usa una función con una forma cosenoidal y la ventana de codificación de voz es una ventana asimétrica formada a partir de una ventana Hamming y una función de ventana formada usando la función coseno:
100
en la que n es el índice de una muestra en la ventana, L_{1}=200, L_{2}=40.
En una de las soluciones según la técnica anterior, el retardo D1 provocado por el enventanado de suma con superposición, de reducción de ruido, correspondiente a la longitud de la pendiente 41 y el retardo D2 requerido para la anticipación de la longitud de la pendiente 42 en la codificación de voz afectan al procesado de una señal. En una de las soluciones según la invención, la pendiente 41 calculada en el enventanado de reducción de ruido se utiliza en la anticipación de la codificación de voz, con lo cual una trama de voz se puede analizar y codificar inmediatamente en cuanto las muestras de ruido reducido a codificar y la pendiente 41 obtenida a partir del enventanado de reducción de ruido relacionado con las mismas se reciben en el bloque de codificación de voz 25. En este caso, el retardo D1 provocado por la reducción de ruido no se suma con el retardo D2 provocado por el enventanado de codificación de voz sino que, en su lugar, el primero se funde con el retardo algorítmico provocado por la anticipación, de tal manera que el retardo algorítmico global de los procesos es menor que en la solución según la técnica anterior. La disposición según la invención es posible gracias a que, en la anticipación, las muestras contenidas en la parte anticipada se usan únicamente como información auxiliar cuando se analiza la trama a codificar, es decir, no se forma expresamente una señal de salida sobre la base de muestras contenidas en la parte
anticipada.
Para lograr el efecto que se produce según la invención, la pendiente 41 del enventanado de reducción de ruido referente a las muestras más nuevas 43 de la trama de codificación de voz a formar se transfiere junto con muestras de ruido reducido 40, 43 para la codificación de voz. El enventanado de reducción de ruido y el enventanado de codificación de voz están dispuestos preferentemente de manera que se superponen en el tiempo para que por lo menos una pendiente 41 del enventanado de reducción de ruido coincida por lo menos parcialmente con la parte anticipada 42 de cada trama de codificación de voz.
En la forma de realización mostrada en la Figura 4, las pendientes anteriores de la ventana usada en la codificación de voz y de la ventana usada en la reducción de ruido tienen la misma longitud y para las pendientes anteriores se usa la misma función de enventanado, es decir, las pendientes son idénticas. Por lo que a la invención respecta, dicha opción es una alternativa preferida en cuanto al cálculo ya que, en este caso, la pendiente obtenida a partir del enventanado de reducción de ruido se puede utilizar directamente como parte anticipada de la codificación de voz y el retardo algorítmico se reduce sin necesidad de un procesado adicional. Por ejemplo, en el caso mostrado en la Figura 4, se forma una ventana de codificación de voz 44, según la invención, a partir de las muestras de ruido reducido 40 de una ventana w(n-2) 47, a partir de las muestras de ruido reducido 43 de dos ventanas de reducción de ruido w(n), w(n-1) (referencias 46, 45) y de la pendiente (41) del enventanado de ruido reducido referente a las muestras de la ventana w(n) 45. Las muestras de ruido reducido 40, 43 se procesan por medio de la función de enventanado de codificación de voz y se realiza un análisis de autocorrelación basándose en la ventana 44 formada a partir de las muestras enventanadas 40, 43 y de dicha pendiente 41. En este caso, el retardo cuya longitud es la correspondiente a la pendiente 41, provocado por la reducción de ruido, se funde con el retardo provocado por la anticipación de la codificación de voz, y se reduce su efecto combinado.
El diagrama de bloques de la Figura 5 ilustra un método, según la invención, para procesar voz. La etapa 51 representa un preprocesado de la señal en relación con la codificación de voz, el cual se sabe que en la técnica anterior comprende un filtrado pasa-altas y un escalado de la señal para la fase de codificación de voz. En la etapa 52, las muestras preprocesadas se procesan por medio de una primera función de ventana tal como se ha presentado anteriormente. La etapa 53 describe la ejecución de los algoritmos de reducción de ruido para tramas enventanadas, que comprenden por lo menos una FFT y su transformada inversa que se ejecuta sobre los datos enventanados. La etapa 54 describe operaciones según el método de suma con superposición, en las que las muestras de ruido reducido y enventanadas se almacenan y suman tal como se ha presentado anteriormente. Después de la etapa 54, el método comprende dos vías diferentes, una primera vía 55 la cual comprende algoritmos de codificación de voz, en la que la trama no es necesario que se someta a un enventanado, y una segunda vía 56, 57 que comprende algoritmos de codificación de voz (por ejemplo, LPC), en la que es necesario un enventanado.
En la segunda vía de codificación de voz, se forma una segunda ventana (etapa 56) utilizando muestras de ruido reducido. En el método según la invención, la segunda ventana se forma a partir de un número determinado de muestras de ruido reducido recibidas y a partir de la pendiente anterior del enventanado de reducción de ruido correspondiente a las muestras recibidas más nuevas. De este modo, como el preprocesado de una pendiente de ruido reducido requeriría varias etapas adicionales, el preprocesado se lleva a cabo en la etapa 51 antes que el enventanado de reducción de ruido y la reducción de ruido a diferencia de la técnica anterior. Se calcula un conjunto de parámetros de codificación de voz p_{j} (por ejemplo, parámetros LP) basándose (etapa 57) en la segunda ventana, transfiriéndose dichos parámetros hacia la primera vía de codificación de voz 55 para otros algoritmos de codificación de voz. Los parámetros de codificación de voz r_{j} generados en la primera vía 55 permiten la reconstrucción de la voz con un decodificador correspondiente a un codificador, según la técnica anterior.
No obstante, la utilización de la invención no se limita simplemente a ventanas uniformes sino que también son posibles diferentes relaciones de longitud y forma (es decir, de las funciones de enventanado usadas en las pendientes). Si la duración de la pendiente anterior 41 que contiene las muestras más nuevas de reducción de ruido es tan prolongada como la parte anticipada 42 de codificación de voz, aunque dicha pendiente anterior 41 y la parte anticipada 42 tienen una forma diferente, la pendiente anterior 41 a transferir se debe multiplicar muestra por muestra en el bloque 54 o la pendiente anterior transferida 41 se debe multiplicar en el bloque 56 por una función de corrección que compense la diferencia entre las funciones usadas en el enventanado. En este caso, la reducción del retardo algorítmico provoca un retardo computacional en el proceso el cual, no obstante, presenta típicamente un efecto menor que el retardo algorítmico a reducir.
Las longitudes de la pendiente anterior de reducción de ruido y de la parte anticipada pueden ser diferentes entre sí. Si la pendiente anterior del reductor de ruido es más prolongada que la parte anticipada, el retardo algorítmico se determina naturalmente según dicha pendiente anterior. Adicionalmente, las muestras de la pendiente anterior, o la parte de la pendiente anterior que se utiliza en la anticipación, se deben multiplicar muestra a muestra por una función de corrección que compense la diferencia entre las funciones usadas en el enventanado. Si la pendiente anterior 41 de un reductor de ruido es más corta que la parte anticipada 42, dicha pendiente anterior 41 y el número requerido de muestras nuevas que vienen tras ellas se transfieren para la codificación de voz 25 con vistas a completar la longitud de la parte anticipada. La pendiente anterior obtenida a partir de la reducción de ruido y las muestras sucesivas deben procesarse nuevamente por medio de una función de corrección que compense la diferencia.
El diagrama de bloques de la Figura 6 ilustra las funcionalidades de un codificador de voz según la invención. El codificador 60 comprende una entrada 61 para recibir una trama F_{j}, que contiene muestras determinadas a partir de la voz, y una salida 62 para proporcionar parámetros de voz r_{j}, determinados sobre la base de las muestras. La entrada 61 está dispuesta para preprocesar las tramas recibidas con vistas a la codificación de voz y para enventanar las tramas en una forma preferida con vistas a la reducción de ruido. El codificador comprende además medios de procesado 63 adaptados para efectuar operaciones con vistas a determinar los parámetros de voz sobre la base de las tramas de reducción de ruido enventanadas recibidas desde la entrada 61. Los medios de procesado comprenden un reductor de ruido 64, en el que las tramas de reducción de ruido recibidas son procesadas por un algoritmo específico de reducción de ruido. Las tramas de ruido reducido se envían a un sumador 65 el cual está conectado a una memoria 69 para almacenar muestras contenidas en tramas sucesivas de reducción de ruido, por lo menos en relación con las pendientes anteriores del enventanado de reducción de ruido. Las muestras de tramas sucesivas de reducción de ruido son sumadas entre sí por medio del sumador 65 para mejorar la forma en la que las tramas sucesivas encajan unas con otras, preferentemente la pendiente anterior 10 de la trama de reducción de ruido anterior se suma con la pendiente posterior 13 de la trama de reducción de ruido a procesar. Los medios de procesado comprenden también un elemento de codificación 66. El elemento de codificación 66, según la invención, comprenden dos vías diferentes, una primera vía 67 la cual comprende algoritmos de codificación de voz en la que no es necesario someter a enventanado una trama, y una segunda vía 68 que comprende algoritmos de codificación de voz (por ejemplo, LPC) en la que es necesario un enventanado. El sumador 65, según la invención, está dispuesto para transferir la pendiente anterior 10 de la ventana de reducción de ruido correspondiente a las muestras más nuevas de la trama de codificación de voz a formar por lo menos hacia la segunda vía 68 del elemento de codificación 66 para el enventanado de la segunda vía de codificación de voz. En la segunda vía 68, dicha pendiente se utiliza tal como se ha presentado anteriormente en la formación de una segunda ventana, tras lo cual se reduce el efecto combinado de los retardos algorítmicos provocados por el enventanado de reducción de ruido y el enventanado de codificación de voz. Por medio de dichos algoritmos de codificación de voz a ejecutar en la primera 67 y la segunda 68 vías de análisis, los parámetros de codificación de voz r_{j} se determinan según una forma conocida para un experto en la materia, permitiendo la reconstrucción de la voz mediante un decodificador correspondiente al codificador. Se puede encontrar una descripción más detallada de las funcionalidades de la técnica anterior antes presentada, por ejemplo, en la Norma IS-641 EIA/TIA.
El diagrama de bloques de la Figura 7 ilustra una estación móvil 70 según la invención. La estación móvil comprende una unidad de procesado central 71 la cual controla las diversas funciones de la estación móvil, una interfaz de usuario 72 (típicamente por lo menos un teclado, una pantalla, un micrófono, y un altavoz) para permitir la comunicación con un usuario, y una memoria 73 la cual típicamente está formada por al menos una memoria no volátil y una memoria volátil. Adicionalmente, la estación móvil comprende una parte de radiocomunicaciones 74 para permitir la comunicación con la parte de red de un sistema de comunicaciones móviles. En los sistemas de comunicaciones móviles, la voz se transfiere en un formato codificado y, por lo tanto, se dispone preferentemente de un códec 75 entre la parte de radiocomunicaciones 74 y la interfaz de usuario 72, comprendiendo el códec un codificador para codificar la voz y un decodificador para decodificar la voz. Basándose en las muestras tomadas de una señal de voz recibida a través de la interfaz de usuario 72, el codificador calcula un conjunto de parámetros de voz para la transmisión hacia un receptor a través de la parte de radiocomunicaciones 74. De forma correspondiente, los parámetros de voz recibidos a través de la parte de radiocomunicaciones son decodificados y, basándose en los parámetros decodificados, la voz recibida se reconstruye para darle salida a través de la interfaz de usuario 72. Tal como se ha presentado anteriormente, el códec de una estación móvil, según la invención, comprende medios 63, 69 para utilizar una primera pendiente de enventanado determinada en la reducción de ruido cuando se realiza un enventanado en relación con algoritmos de codificación de voz.
Este documento presenta la implementación y formas de realización de la presente invención con la ayuda de ejemplos. Un experto en la materia apreciará que la presente invención no está limitada a los detalles de las formas de realización presentadas previamente, y que la invención también se puede implementar de otras maneras. Las formas de realización presentadas anteriormente deberían considerarse ilustrativas, pero no limitativas. Por lo tanto, las posibilidades de implementación y uso de la invención están limitadas únicamente por las reivindicaciones adjuntas.

Claims (13)

1. Método para generar una trama de codificación de voz (44), comprendiendo el método las siguientes etapas:
formar una serie de primeras tramas parcialmente superpuestas (18) que contienen muestras de voz;
procesar una primera trama de entre la serie de primeras tramas (18) por medio de una primera función de ventana para producir una segunda trama, enventanada, que tiene una primera pendiente;
realizar una reducción de ruido sobre la segunda trama para producir una tercera trama (19; 45) que comprende muestras de voz de ruido reducido; y
formar una trama de codificación de voz (44) que comprende muestras de ruido reducido de dos terceras tramas sucesivas (45, 46), sumadas por lo menos parcialmente entre sí;
caracterizado porque el método comprende además las siguientes etapas:
formar la trama de codificación de voz (44) de manera que la misma presenta una parte anticipada (42) que está formada por lo menos parcialmente por muestras de voz de ruido reducido de la primera pendiente (41), no sumándose estas muestras de voz de ruido reducido de la primera pendiente con ningunas otras muestras de voz de ruido reducido de la trama de codificación de voz (44) a formar.
2. Método según la reivindicación 1, caracterizado porque antes de la formación de dicha trama de codificación de voz, dichas muestras de ruido reducido (40, 43) son procesadas por una segunda función de ventana.
3. Método según la reivindicación 2, caracterizado porque la primera función de ventana y la segunda función de ventana están dispuestas para producir el mismo resultado cuando van dirigidas a las muestras de la primera pendiente.
4. Método según cualquiera de las reivindicaciones 1 a 3, caracterizado porque por lo menos algunas de las muestras de voz de ruido reducido de la parte anticipada son iguales a las muestras de voz de ruido reducido de la primera pendiente.
5. Método según cualquiera de las reivindicaciones 1 a 3, caracterizado porque la tercera trama (19) comprende una segunda pendiente (11) que se corresponde con la primera pendiente (10), procesada a partir de muestras anteriores de la trama, y porque el método comprende además:
sumar las muestras de la segunda pendiente (11) de la tercera trama (19) a procesar con las muestras de ruido reducido de la primera pendiente de la tercera trama anterior.
6. Método según la reivindicación 2, caracterizado porque la primera función de ventana y la segunda función de ventana están dispuestas para producir un resultado diferente cuando van dirigidas a las muestras de la primera pendiente con lo cual, también en el método, las muestras de la primera pendiente (41) son procesadas por una función de corrección específica.
7. Método según la reivindicación 1 ó 2, caracterizado porque por lo menos algunas de las muestras de voz de ruido reducido de la parte anticipada se forman con una función de corrección de las muestras de voz de ruido reducido de la primera pendiente.
8. Método según cualquiera de las reivindicaciones anteriores, caracterizado porque se determina un conjunto de parámetros de predicción lineal (LP) basándose en la trama de codificación de voz (44).
9. Método según cualquiera de las reivindicaciones anteriores, caracterizado porque antes que la reducción de ruido se realiza un preprocesado de muestras de voz.
10. Codificador de voz (60) que comprende
un elemento de entrada (61) para formar una serie de primeras tramas parcialmente superpuestas (18) que contienen muestras de voz;
unos medios para procesar una primera trama de entre la serie de primeras tramas (18) por medio de una primera función de ventana para formar una segunda trama, enventanada, que tiene una primera pendiente;
un reductor de ruido (64) para realizar una reducción de ruido sobre la segunda trama con vistas a formar una tercera trama (19) que comprende muestras de ruido reducido;
un elemento de codificación (66) el cual comprende unos medios (65, 68) para formar una trama de codificación de voz (44), comprendiendo la trama de codificación de voz (44) muestras de ruido reducido de dos terceras tramas sucesivas (45) sumadas por lo menos parcialmente entre sí, y medios (68) para determinar parámetros de codificación de voz (p_{j}) basándose en dicha trama de codificación de voz (44);
caracterizado porque
el elemento de codificación (66) comprende además unos medios (65, 68) para formar la trama de codificación de voz (44) de manera que la trama de codificación de voz (44) presenta una parte anticipada (42) la cual está formada por lo menos parcialmente por la primera pendiente (41), no sumándose las muestras de voz de ruido reducido de la primera pendiente con ningunas otras muestras de voz de ruido reducido de la trama de codificación de voz (44) a formar.
11. Codificador de voz según la reivindicación 10, caracterizado porque dicho elemento de codificación (66) comprende unos medios (68) para procesar dichas muestras de ruido reducido (40, 43) mediante una segunda función de ventana en relación con la formación de la trama de codificación de voz (44).
12. Codificador según la reivindicación 10 u 11, caracterizado porque la tercera trama (19) comprende una segunda pendiente (11) que se corresponde con la primera pendiente (10), procesada a partir de muestras anteriores, y el codificador comprende además un sumador (65) para sumar las muestras de ruido reducido de la segunda pendiente (11) de la tercera trama (19) a procesar con las muestras de ruido reducido de la primera pendiente de la tercera trama anterior.
13. Estación móvil (70) que comprende un codificador de voz (60) según la reivindicación 10.
ES00901158T 1999-01-08 2000-01-04 Metodo y aparato para determinar parametros de codificacion de voz. Expired - Lifetime ES2284473T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FI19990033 1999-01-08
FI990033A FI114833B (fi) 1999-01-08 1999-01-08 Menetelmä, puhekooderi ja matkaviestin puheenkoodauskehysten muodostamiseksi

Publications (1)

Publication Number Publication Date
ES2284473T3 true ES2284473T3 (es) 2007-11-16

Family

ID=8553299

Family Applications (1)

Application Number Title Priority Date Filing Date
ES00901158T Expired - Lifetime ES2284473T3 (es) 1999-01-08 2000-01-04 Metodo y aparato para determinar parametros de codificacion de voz.

Country Status (11)

Country Link
US (1) US6587817B1 (es)
EP (1) EP1145221B1 (es)
JP (1) JP4545941B2 (es)
CN (1) CN1132155C (es)
AT (1) ATE360249T1 (es)
AU (1) AU2112700A (es)
DE (1) DE60034429T2 (es)
ES (1) ES2284473T3 (es)
FI (1) FI114833B (es)
HK (1) HK1042578B (es)
WO (1) WO2000041163A2 (es)

Families Citing this family (20)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100452109B1 (ko) * 2002-10-07 2004-10-12 주식회사 아큐죤 음성신호 추적장치 및 그 방법
EP1626504A1 (en) 2003-05-21 2006-02-15 Sony Corporation Data processing device, encoding device, encoding method, decoding device, decoding method, and program
FR2875633A1 (fr) * 2004-09-17 2006-03-24 France Telecom Procede et dispositif d'evaluation de l'efficacite d'une fonction de reduction de bruit destinee a etre appliquee a des signaux audio
FR2882458A1 (fr) * 2005-02-18 2006-08-25 France Telecom Procede de mesure de la gene due au bruit dans un signal audio
PL3848928T3 (pl) 2006-10-25 2023-07-17 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Urządzenie i sposób do generowania wartości podpasm audio o wartościach zespolonych
USRE50158E1 (en) 2006-10-25 2024-10-01 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus and method for generating audio subband values and apparatus and method for generating time-domain audio samples
WO2008069593A1 (en) 2006-12-07 2008-06-12 Lg Electronics Inc. A method and an apparatus for processing an audio signal
GB2466675B (en) 2009-01-06 2013-03-06 Skype Speech coding
GB2466671B (en) 2009-01-06 2013-03-27 Skype Speech encoding
GB2466670B (en) 2009-01-06 2012-11-14 Skype Speech encoding
GB2466673B (en) 2009-01-06 2012-11-07 Skype Quantization
US8452606B2 (en) 2009-09-29 2013-05-28 Skype Speech encoding using multiple bit rates
TWI479478B (zh) * 2011-02-14 2015-04-01 弗勞恩霍夫爾協會 用以使用對齊的預看部分將音訊信號解碼的裝置與方法
MY165853A (en) 2011-02-14 2018-05-18 Fraunhofer Ges Forschung Linear prediction based coding scheme using spectral domain noise shaping
BR112013020324B8 (pt) 2011-02-14 2022-02-08 Fraunhofer Ges Forschung Aparelho e método para supressão de erro em fala unificada de baixo atraso e codificação de áudio
TWI564882B (zh) 2011-02-14 2017-01-01 弗勞恩霍夫爾協會 利用重疊變換之資訊信號表示技術(一)
EP2676267B1 (en) 2011-02-14 2017-07-19 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Encoding and decoding of pulse positions of tracks of an audio signal
WO2012110448A1 (en) 2011-02-14 2012-08-23 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for coding a portion of an audio signal using a transient detection and a quality result
KR101699898B1 (ko) 2011-02-14 2017-01-25 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 스펙트럼 영역에서 디코딩된 오디오 신호를 처리하기 위한 방법 및 장치
CN111415674A (zh) * 2020-05-07 2020-07-14 北京声智科技有限公司 语音降噪方法及电子设备

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5774846A (en) * 1994-12-19 1998-06-30 Matsushita Electric Industrial Co., Ltd. Speech coding apparatus, linear prediction coefficient analyzing apparatus and noise reducing apparatus
US5732389A (en) * 1995-06-07 1998-03-24 Lucent Technologies Inc. Voiced/unvoiced classification of speech for excitation codebook selection in celp speech decoding during frame erasures
FI100840B (fi) * 1995-12-12 1998-02-27 Nokia Mobile Phones Ltd Kohinanvaimennin ja menetelmä taustakohinan vaimentamiseksi kohinaises ta puheesta sekä matkaviestin
GB2326572A (en) * 1997-06-19 1998-12-23 Softsound Limited Low bit rate audio coder and decoder

Also Published As

Publication number Publication date
FI990033A0 (fi) 1999-01-08
DE60034429D1 (de) 2007-05-31
CN1337042A (zh) 2002-02-20
JP2004513381A (ja) 2004-04-30
WO2000041163A3 (en) 2005-03-10
HK1042578B (zh) 2005-03-04
ATE360249T1 (de) 2007-05-15
CN1132155C (zh) 2003-12-24
EP1145221A3 (en) 2005-04-27
HK1042578A1 (en) 2002-08-16
DE60034429T2 (de) 2008-01-03
US6587817B1 (en) 2003-07-01
FI990033L (fi) 2000-07-09
WO2000041163A2 (en) 2000-07-13
FI114833B (fi) 2004-12-31
AU2112700A (en) 2000-07-24
JP4545941B2 (ja) 2010-09-15
EP1145221B1 (en) 2007-04-18
EP1145221A2 (en) 2001-10-17

Similar Documents

Publication Publication Date Title
ES2284473T3 (es) Metodo y aparato para determinar parametros de codificacion de voz.
ES2380307T3 (es) Esquema de codificación/decodificación de audio de tasa de transmisión de bits baja con preprocesamiento común.
ES2625952T3 (es) Método para la generación de tramas de ocultación en sistema de comunicación
ES2797525T3 (es) Conformación simultánea de ruido en el dominio del tiempo y el dominio de la frecuencia para transformaciones TDAC
ES2338117T3 (es) Codificacion de audio con diferentes longitudes de trama de codificacion.
ES2266003T3 (es) Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha.
KR101092167B1 (ko) 피치-조정 및 비-피치-조정 코딩을 이용한 신호 인코딩
KR101437127B1 (ko) 가중 윈도우들을 사용한 저-지연 변환 코딩
EP2747079B1 (en) Encoding device
ES2354427T3 (es) Mejora de la calidad de audio decodificado mediante la adición de ruido.
KR101668401B1 (ko) 오디오 신호를 인코딩하기 위한 방법 및 장치
JP6450802B2 (ja) 音声符号化装置および方法
EP2492911B1 (en) Audio encoding apparatus, decoding apparatus, method, circuit and program
KR101067514B1 (ko) 버퍼 조정을 이용하는 예측 코딩 데이터의 디코딩
CA2457988A1 (en) Methods and devices for audio compression based on acelp/tcx coding and multi-rate lattice vector quantization
JP2011123506A (ja) 可変レートスピーチ符号化
ES2378972T3 (es) Atenuación de la sobresonorización, en particular para la generación de una excitación en un decodificador, en ausencia de información
JP2004287397A (ja) 相互使用可能なボコーダ
US20210134309A1 (en) Audio coder window and transform implementations
Iyengar et al. A low delay 16 kb/s speech coder
KR100915726B1 (ko) 잡음 억제 방법 및 장치
KR102230089B1 (ko) 오디오 신호의 은닉된 오디오 신호 부분으로부터 후속하는 오디오 신호 부분까지의 전이를 개선하기 위한 장치 및 방법
KR20030011912A (ko) 오디오 코딩
RU2682851C2 (ru) Усовершенствованная коррекция потери кадров с помощью речевой информации
US20110058678A1 (en) Stereo signal conversion device, stereo signal inverse conversion device, and method thereof