ES2212642T3 - Dispositivo de codificacion perceptual y metodo para la codificacion eficaz de señales de banda ancha. - Google Patents

Dispositivo de codificacion perceptual y metodo para la codificacion eficaz de señales de banda ancha.

Info

Publication number
ES2212642T3
ES2212642T3 ES99952201T ES99952201T ES2212642T3 ES 2212642 T3 ES2212642 T3 ES 2212642T3 ES 99952201 T ES99952201 T ES 99952201T ES 99952201 T ES99952201 T ES 99952201T ES 2212642 T3 ES2212642 T3 ES 2212642T3
Authority
ES
Spain
Prior art keywords
signal
gamma
filter
perceptual weighting
emphasis
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES99952201T
Other languages
English (en)
Inventor
Bruno Bessette
Redwan Salami
Roch Lefebvre
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
VoiceAge Corp
Original Assignee
VoiceAge Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Family has litigation
First worldwide family litigation filed litigation Critical https://patents.darts-ip.com/?family=4162966&utm_source=google_patent&utm_medium=platform_link&utm_campaign=public_patent_search&patent=ES2212642(T3) "Global patent litigation dataset” by Darts-ip is licensed under a Creative Commons Attribution 4.0 International License.
Application filed by VoiceAge Corp filed Critical VoiceAge Corp
Application granted granted Critical
Publication of ES2212642T3 publication Critical patent/ES2212642T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/90Pitch determination of speech signals
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/26Pre-filtering or post-filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L2019/0001Codebooks
    • G10L2019/0011Long term prediction filters, i.e. pitch estimation

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computational Linguistics (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
  • Reduction Or Emphasis Of Bandwidth Of Signals (AREA)
  • Optical Recording Or Reproduction (AREA)
  • Signal Processing For Digital Recording And Reproducing (AREA)
  • Dc Digital Transmission (AREA)
  • Arrangements For Transmission Of Measured Signals (AREA)
  • Error Detection And Correction (AREA)
  • Filters That Use Time-Delay Elements (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Preliminary Treatment Of Fibers (AREA)
  • Television Systems (AREA)
  • Networks Using Active Elements (AREA)
  • Installation Of Indoor Wiring (AREA)
  • Tone Control, Compression And Expansion, Limiting Amplitude (AREA)
  • Measuring Frequencies, Analyzing Spectra (AREA)
  • Measuring Pulse, Heart Rate, Blood Pressure Or Blood Flow (AREA)
  • Stereo-Broadcasting Methods (AREA)
  • Package Frames And Binding Bands (AREA)
  • Measurement And Recording Of Electrical Phenomena And Electrical Characteristics Of The Living Body (AREA)
  • Optical Communication System (AREA)
  • Stabilization Of Oscillater, Synchronisation, Frequency Synthesizers (AREA)
  • Radar Systems Or Details Thereof (AREA)
  • Inorganic Insulating Materials (AREA)
  • Parts Printed On Printed Circuit Boards (AREA)
  • Coils Or Transformers For Communication (AREA)
  • Image Processing (AREA)

Abstract

Un dispositivo de ponderación perceptual para generar una señal perceptualmente ponderada como respuesta a una señal de banda ancha con el fin de reducir una diferencia entre una señal ponderada de banda ancha y una señal de banda ancha ponderada sintetizada posteriormente, comprendiendo dicho dispositivo de ponderación perceptual: a) un filtro (103) de pre-énfasis de señales que responde a la señal de banda ancha para reforzar el contenido de alta frecuencia de la señal de banda ancha para generar así una señal (S) pre-enfatizada; b) un calculador (104) de filtro de síntesis que responde a dicha señal pre-enfatizada para generar coeficientes (A(z)) del filtro de síntesis; y c) un filtro (105) de ponderación perceptual, que responde a dicha señal (S) pre-enfatizada y a dichos coeficientes (A(z)) del filtro de síntesis, para filtrar dicha señal pre-enfatizada en relación con dichos coeficientes del filtro de síntesis para generar así la señal (Sw) ponderada perceptualmente; teniendo dichofiltro de ponderación perceptual una función de transferencia con un denominador fijo por lo que la ponderación de dicha señal de banda ancha en una región de formación está sustancialmente desacoplada de una inclinación espectral de dicha señal de banda ancha.

Description

Dispositivo de codificación perceptual y método para la codificación eficaz de señales de banda ancha.
Antecedentes de la invención 1. Campo de la invención
La presente invención está relacionada con un dispositivo de ponderación perceptual y con un método para generar una señal perceptualmente ponderada como respuesta a una señal de banda ancha (0-7000 Hz) con el fin de reducir una diferencia entre una señal ponderada de banda ancha y una señal de banda ancha ponderada sintetizada posteriormente.
2. Breve descripción de la técnica anterior
La demanda de técnicas de codificación eficientes de habla/audio digitales de banda ancha, con un buen equilibrio subjetivo de calidad/velocidad de bits, está aumentando en numerosas aplicaciones tales como las teleconferencias de audio/vídeo, multimedia y aplicaciones inalámbricas, así como en aplicaciones de Internet y redes de paquetes. Hasta muy recientemente, las anchuras de banda de telefonía filtradas en el rango de 200-3400 Hz fueron utilizadas principalmente en aplicaciones de codificación del habla. Sin embargo, hay una demanda creciente de aplicaciones del habla en banda ancha con el fin de aumentar la inteligibilidad y la naturalidad de las señales del habla. Se ha averiguado que una anchura de banda en el rango de 50-7000 Hz fue suficiente para entregar una calidad del habla de presencia real. Para las señales de audio, este rango ofrece una calidad de audio aceptable, pero todavía inferior a la calidad de CD que funciona en el rango de 20-20000 Hz.
Un codificador del habla convierte una señal del habla en una cadena digital de bits que es transmitida por un canal de comunicaciones (o almacenado en un medio de almacenamiento). La señal del habla es digitalizada (muestreada y cuantificada con 16 bits por muestra usualmente) y el codificador del habla tiene el papel de representar estas muestras digitales con un número menor de bits al tiempo que mantiene una buena calidad subjetiva del habla. El descodificador o sintetizador del habla opera con la cadena de bits transmitida o almacenada y la vuelve a convertir en una señal de sonido.
Una de las mejores técnicas anteriores capaces de conseguir un buen equilibrio de la relación calidad/bits es la denominada técnica de Predicción Lineal Excitada por Código (CELP). De acuerdo con esta técnica, la señal del habla muestreada es procesada en bloques sucesivos de L muestras usualmente denominadas tramas, donde L es algún número predeterminado (correspondiente a 10-30 ms del habla). En CELP, se calcula y se transmite en cada trama un filtro de síntesis de predicción lineal (LP). La trama de L muestras es dividida después en bloques más pequeños denominados subtramas de un tamaño de N muestras, donde L = kN y k es el número de subtramas en una trama (N corresponde usualmente a 4-10 ms del habla). En cada subtrama se determina una señal de excitación, que consiste usualmente en dos componentes: uno de la excitación pasada (denominada también contribución de tono, o libro de código adaptativo), y el otro de un libro de código innovador (denominado también libro de código fijo). Esta señal de excitación es transmitida y utilizada en el descodificador como entrada del filtro de síntesis de LP con el fin de obtener el habla sintetizada.
Un libro de código innovador en el contexto del CELP, es un conjunto indexado de secuencias de Nmuestras de largo que serán denominadas vectores de código N-dimensionales. Cada secuencia de libro de código está indexada por un entero k que va desde 1 a M, donde M representa el tamaño del libro de código que se expresa a menudo como un número de bits b, donde M = 2^{b}.
Para sintetizar el habla de acuerdo con la técnica CELP, cada bloque de N muestras es sintetizado filtrando un vector de código apropiado de un libro de código a través de filtros que varían en el tiempo que efectúan un modelo de las características espectrales de la señal del habla. En el extremo del codificador, se calcula la salida de la síntesis para todos, o para un subconjunto, de los vectores de código del libro de códigos (búsqueda del libro de código). El vector de código retenido es el que produce la salida de la síntesis más cercana a la señal del habla original, de acuerdo con una medida perceptual de distorsión ponderada. Esta ponderación perceptual se realiza utilizando el denominado filtro de ponderación perceptual, que se obtiene usualmente del filtro de síntesis de LP.
El modelo CELP ha tenido mucho éxito para codificar las señales de sonido de la banda telefónica, y existen varios estándares basados en CELP en un amplio rango de aplicaciones, especialmente en las aplicaciones celulares digitales. En la banda telefónica, la señal de sonido está limitada a la banda de 200-3400 Hz y es muestreada a 8000 muestras/segundo. En aplicaciones de banda ancha del habla/audio, la señal de sonido está limitada a la banda de 50-7000 Hz y es muestreada a 16000 muestras por segundo.
Cuando se aplica el modelo CELP optimizado de banda telefónica a señales de banda ancha, surgen algunas dificultades, y es necesario añadir características adicionales al modelo con el fin de obtener señales de banda ancha de alta calidad. Las señales de banda ancha presentan un rango dinámico mucho más amplio en comparación con las señales de la banda telefónica, lo que da como resultado problemas de precisión cuando se requiere una implantación de coma fija en el algoritmo (que es esencial en las aplicaciones inalámbricas). Además, el modelo CELP gastará a menudo la mayoría sus los bits de codificación en la región de baja frecuencia, que tiene normalmente un mayor contenido de energía, dando como resultado una señal de salida de paso-bajo. Para superar este problema, el filtro de ponderación perceptual ha de ser modificado con el fin de adecuarse a las señales de banda ancha, y las técnicas de pre-énfasis que realzan las regiones de alta frecuencia se hacen importantes para reducir el rango dinámico, conduciendo a una implantación de coma fija más sencilla, y para asegurar una mejor codificación del contenido de las frecuencias más altas de la señal.
En los codificadores tipo CELP, se buscan los parámetros óptimos de tono e innovadores haciendo mínimo el error cuadrático medio entre el habla de entrada y el habla sintetizada en un dominio perceptiblemente ponderado. Esto es equivalente a hacer mínimo el error entre el habla de entrada ponderada y el habla de síntesis ponderada, donde la ponderación se realiza utilizando un filtro que tiene una función de transferencia W(z) de la forma:
W(z) = A(z/g_{1}) / A(z/g_{2}) \ donde \ 0 < \Gamma_{2} < \Gamma_{1} \leq 1
En codificadores de análisis-por-síntesis (AbS), el análisis muestra que el error de cuantificación es ponderado por la inversa del filtro de ponderación, W^{-1}(z), que presenta algo de la estructura que forma la señal de entrada. Así, se explota la propiedad de enmascaramiento del oído humano dándole forma al error, de manera que tenga más energía en las regiones de formación, donde será enmascarado por la fuerte energía de la señal presente en esas regiones. La cantidad de ponderación está controlada por los factores \Gamma_{1} y \Gamma_{2}.
Este filtro funciona bien con señales de la banda telefónica. Sin embargo, se ha averiguado que este filtro no es adecuado para una ponderación perceptual eficiente cuando se aplicó a señales de banda ancha. Se ha averiguado que este filtro tiene limitaciones inherentes al modelar la estructura de formación y la inclinación espectral requerida concurrentemente. La inclinación espectral es más pronunciada en señales de banda ancha debido al amplio rango dinámico entre frecuencias bajas y altas. Se ha sugerido la adición de un filtro de inclinación en el filtro W(z) con el fin de controlar la inclinación y ponderación de formación separadamente.
En el documento EP-A-04650757 se divulga un conocido dispositivo de ponderación perceptual, que comprende un filtro de ponderación perceptual y una sección de un filtro adicional en serie para controlar la inclinación del filtro de ponderación compuesta.
Objeto de la invención
Un objeto de la presente invención es, por tanto, proporcionar un dispositivo de ponderación perceptual y un método adaptado a señales de banda ancha, utilizando un filtro de ponderación perceptual modificado para obtener una señal reconstruida de alta calidad, permitiendo este dispositivo y este método la implantación algorítmica de coma fija.
Sumario de la invención
Más específicamente, de acuerdo con la presente invención, se proporciona un dispositivo de ponderación perceptual para generar una señal ponderada perceptualmente como respuesta a una señal de banda ancha con el fin de reducir una diferencia entre una señal ponderada de banda ancha y una señal de banda ancha ponderada sintetizada posteriormente. Este dispositivo de ponderación perceptual comprende:
a) un filtro de pre-énfasis de señales que responde a una señal de banda ancha para reforzar el contenido de alta frecuencia de la señal de banda ancha para generar así una señal pre-enfatizada;
b) un calculador de filtro de síntesis que responde a una señal pre-enfatizada para generar coeficientes del filtro de síntesis; y
c) un filtro de ponderación perceptual, que responde a la señal pre-enfatizada y a los coeficientes del filtro de síntesis, para filtrar la señal pre-enfatizada en relación con los coeficientes del filtro de síntesis para generar así la señal ponderada perceptualmente. El filtro de ponderación perceptual tiene una función de transferencia con un denominador fijo por lo que la ponderación de la señal de banda ancha en una región de formación está sustancialmente desacoplada de una inclinación espectral de esa señal de banda ancha.
La presente invención está relacionada también con un método para generar una señal ponderada perceptualmente como respuesta a una señal de banda ancha con el fin de reducir una diferencia entre una señal ponderada de banda ancha y una señal ponderada de banda ancha sintetizada posteriormente. Este método comprende: filtrar la señal de banda ancha para generar una señal pre-enfatizada con un contenido reforzado de alta frecuencia; calcular, a partir de la señal pre-enfatizada, los coeficientes del filtro de síntesis; y filtrar la señal pre-enfatizada en relación con los coeficientes del filtro de síntesis para generar así una señal de habla ponderada perceptualmente. El filtrado comprende el tratamiento de la señal de pre-énfasis a través de un filtro de ponderación perceptual que tiene una función de transferencia con denominador fijo, por lo que la ponderación de la señal de banda ancha en la región de formación está sustancialmente desacoplada de la inclinación espectral de la señal de banda ancha.
De acuerdo con modos de realización preferidos de la presente invención:
- la reducción del rango dinámico comprende el filtrado de la señal de banda ancha a través de una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1;
- el factor \mu de pre-énfasis es 0,7;
- el filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación; y
- la variable \gamma_{2} se fija igual a \mu.
Por tanto, la ponderación perceptual global del error de cuantificación se obtiene por una combinación de un filtro de pre-énfasis y un filtro modificado de ponderación para permitir una alta calidad subjetiva de la señal de sonido de banda ancha descodificada en el filtro W(z) con el fin de controlar la inclinación y la ponderación de formación separadamente.
La solución al problema expuesto en la breve descripción de la técnica anterior es introducir, consecuentemente, un filtro de pre-énfasis en la entrada, calcular los coeficientes del filtro de síntesis basándose en la señal pre-enfatizada y utilizar un filtro de ponderación perceptual modificado fijando su denominador. Al reducir el rango dinámico de la señal de banda ancha, el filtro de pre-énfasis convierte la señal de banda ancha haciéndola más adecuada para la implantación en coma fija, y mejora la codificación del contenido de alta frecuencia del espectro.
La presente invención está relacionada además con un codificador para codificar una señal de banda ancha que comprende: a) un dispositivo de ponderación perceptual como se ha descrito anteriormente en este documento; b) un dispositivo de búsqueda del libro de código de tono que responda a la señal ponderada perceptualmente para generar parámetros de libro de código de tono y un vector innovador objetivo de búsqueda; c) un dispositivo de búsqueda de libro de código innovador, que responda a los coeficientes del filtro de síntesis y al vector innovador objetivo de búsqueda, para generar parámetros del libro de código innovador; y d) un dispositivo de formación de la señal para generar una señal de banda ancha codificada que comprenda los parámetros del libro de código de tono, los parámetros del libro de código innovador y los coeficientes del filtro de síntesis.
Se proporciona también, de acuerdo con la presente invención:
- un sistema de comunicaciones celulares para dar servicio a un área geográfica grande dividida en una pluralidad de células, que comprende: a) unidades móviles transmisoras/receptoras; b) estaciones base celulares situadas respectivamente en las células; c) un terminal de control para controlar la comunicación entre las estaciones base celulares; d) un subsistema bidireccional de comunicaciones inalámbricas entre cada unidad móvil situada en una célula y la estación base celular de esta célula, comprendiendo este subsistema bidireccional de comunicaciones inalámbricas, tanto en la unidad móvil como en la estación base celular:
i)
un transmisor que incluye un codificador como se ha descrito anteriormente para codificar una señal de banda ancha y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
ii)
un receptor que incluye un circuito receptor para recibir una señal de banda ancha codificada trasmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
- una unidad móvil celular transmisora/receptora que comprende:
a) un transmisor que incluye un codificador como se ha descrito anteriormente para codificar una señal de banda ancha y un circuito de transmisión para trasmitir la señal de banda ancha codificada; y
b) un receptor que incluye un circuito receptor para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada transmitida;
- un elemento de red celular que comprende:
a) un transmisor que incluye un codificador como se ha descrito anteriormente, para codificar una señal de banda ancha y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
\newpage
b) un receptor que incluye un circuito de recepción para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada recibida; y
- un subsistema bidireccional de comunicaciones inalámbricas entre cada una de las unidades móviles situada en una célula y la estación base celular de esta célula, comprendiendo este subsistema bidireccional de comunicaciones inalámbricas, tanto en la unidad móvil como en la estación base celular:
a) un transmisor que incluye un codificador como se ha descrito anteriormente, para codificar una señal de banda ancha y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
b) un receptor que incluye un circuito de recepción para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
Los objetos ventajas y otras características de la presente invención serán más evidentes con la lectura de la siguiente descripción no restrictiva de modos de realización preferidos de la misma, ofrecidos a modo de ejemplo solamente con referencia a los dibujos que se acompañan.
Breve descripción de los dibujos
En los dibujos anexos:
La figura 1 es un diagrama esquemático de bloques de un modo de realización preferido del dispositivo de codificación de banda ancha;
La figura 2 es un diagrama esquemático de bloques de un modo de realización preferido del dispositivo de descodificación de banda ancha;
La figura 3 es un diagrama esquemático de bloques de un modo de realización preferido de un dispositivo de análisis de tono; y
La figura 4 es un diagrama esquemático simplificado de bloques de un sistema de comunicación celular en el cual puede utilizarse el dispositivo de codificación de banda ancha de la figura 1 y el dispositivo de decodificación de banda ancha de la figura 2.
Descripción detallada del modo de realización preferido
Como es bien sabido por los expertos ordinarios en la técnica, un sistema de comunicación celular, tal como el 401 (véase la figura 4), proporciona un servicio de telecomunicaciones en un área geográfica grande, dividiendo ese área geográfica grande en cierto número C de células más pequeñas. Las C células más pequeñas son servidas por las respectivas estaciones base celulares 402_{1}, 402_{2},...402_{C} para proporcionar a cada célula los canales de señalización de radio, de audio y de datos.
Los canales de señalización de radio se utilizan para hacer radiobúsquedas a radioteléfonos móviles (unidades móviles transmisoras/receptoras) tales como 403, dentro de los límites de la zona de cobertura (célula) de la estación base celular 402, y para hacer llamadas a otros radioteléfonos 403 situados dentro o fuera de la célula de la estación base o a otra red tal como la Red Telefónica Pública Conmutada (RTPC) 404.
Una vez que un radioteléfono 403 ha hecho o ha recibido con éxito una llamada, se establece un canal de datos o audio entre este radioteléfono 403 y la estación base celular 402 correspondiente a la célula en la cual está situado el radioteléfono 403, y la comunicación entre la estación base 402 y el radioteléfono 403 se realiza por el canal de audio o de datos. El radioteléfono 403 puede recibir también información de control o de tiempos por un canal de señalización cuando la llamada está en curso.
Si un radioteléfono 403 abandona una célula y se introduce en otra célula contigua cuando hay una llamada en curso, el radioteléfono 403 conmuta la llamada a un canal disponible de audio o de datos de la estación base 402 de la nueva célula. Si un radioteléfono 403 abandona una célula y entra en otra célula contigua cuando no hay una llamada en curso, el radioteléfono 403 envía un mensaje de control por el canal de señalización para registrarse en la estación base 402 de la nueva célula. De esta manera, es posible la comunicación móvil por un área geográfica amplia.
El sistema 401 de comunicación celular comprende además un terminal 405 de control para controlar la comunicación entre las estaciones base celulares 402 y la RTPC 404, por ejemplo durante una comunicación entre un radioteléfono 403 y la RTPC 404, o entre un radioteléfono 403 situado en una primera célula y un radioteléfono 403 situado en una segunda célula.
Naturalmente, se requiere un subsistema bidireccional de comunicaciones inalámbricas por radio para establecer un canal de audio o de datos entre una estación base 402 de una célula y un radioteléfono 403 situado en esa célula. Como se ilustra de una manera muy simplificada en la figura 4, tal subsistema bidireccional de comunicaciones inalámbricas por radio comprende típicamente en el radioteléfono 403:
-
un transmisor 406 que incluye:
-
un codificador 407 para codificar la señal de voz; y
-
un circuito 408 de transmisión para transmitir la señal de voz codificada desde el codificador 407 a través de una antena tal como 409; y
-
un receptor 410 que incluye:
-
un circuito receptor 411 para recibir una señal de voz codificada transmitida normalmente a través de la misma antena 409; y
-
un descodificador 412 para descodificar la señal de voz codificada recibida desde el circuito 411 de recepción.
El radioteléfono comprende además otros circuitos convencionales 413 de radioteléfono a los cuales están conectados el codificador 407 y el descodificador 412 y para procesar señales de ellos, siendo estos circuitos 413 bien conocidos por los expertos ordinarios en la técnica y, consecuentemente, no serán descritos con más detalle en la presente memoria.
Además, tal subsistema bidireccional de comunicación inalámbrica por radio comprende típicamente en la estación base 402:
-
un transmisor 414 que incluye:
-
un codificador 415 para codificar la señal de voz; y
-
un circuito 416 de transmisión para transmitir la señal de voz codificada desde el codificador 415 a través de una antena tal como la 417; y
-
un receptor 418 que incluye:
-
un circuito receptor 419 para recibir una señal de voz codificada transmitida a través de la misma antena 417 o a través de otra antena (no ilustrada); y
-
un descodificador 420 para descodificar la señal de voz codificada recibida desde el circuito 419 de recepción.
La estación base 402 incluye además, típicamente, un controlador 421 de estación base, junto con su base de datos asociada 422, para controlar la comunicación entre el terminal 405 de control y el transmisor 414 y el receptor 418.
Como es bien sabido por los expertos ordinarios en la técnica, se requiere la codificación de voz con el fin de reducir la anchura de banda necesaria para transmitir la señal de sonido, por ejemplo la señal de voz tal como el habla, a través del subsistema bidireccional de comunicación inalámbrica por radio, es decir, entre un radioteléfono 403 y una estación base 402.
Los codificadores LP de voz (tales como el 415 y el 407), que funcionan típicamente a 13 kbits/segundo y por debajo, tal como los codificadores de Predicción Lineal Excitados por Código (CELP), utilizan típicamente un filtro de síntesis LP para hacer un modelo de la envolvente espectral de corta duración de la señal de voz. La información LP se transmite, típicamente, cada 10 ó 20 ms al descodificador (tal como el 420 y 412) y es extraída en el extremo del descodificador.
Las nuevas técnicas descritas en la presente memoria pueden ser aplicadas a distintos sistemas de codificación basados en LP. Sin embargo, se utiliza un sistema de codificación del tipo CELP en el modo de realización preferido con el propósito de presentar una ilustración no limitativa de estas técnicas. De la misma manera, tales técnicas pueden ser utilizadas con señales de sonido distintas a la de voz y del habla así como con otros tipos de señales de banda ancha.
La figura 1 muestra un diagrama general de bloques de un dispositivo 100 de codificación del habla de tipo CELP, modificado para acomodar mejor las señales de banda ancha.
La señal muestreada 114 del habla de entrada es dividida en bloques sucesivos de L muestras denominados "tramas". En cada trama, se calculan, codifican y transmiten distintos parámetros que representan la señal del habla en la trama. Los parámetros LP que representan el filtro de síntesis LP son calculados usualmente una vez por trama. La trama se divide además en bloques más pequeños de N muestras (bloques de longitud N), en los cuales se determinan los parámetros de excitación (tono e innovación). En documentos publicados sobre CELP, estos bloques de longitud N son denominados "subtramas" y las señales de N muestras de las subtramas son denominadas vectores N-dimensionales. En este modo de realización preferido, la longitud N corresponde a 5 ms, mientras que la longitud L corresponde a 20 ms, lo cual significa que una trama contiene cuatro subtramas (N = 80) a la velocidad de muestreo de 16kHz y 64 al hacer un muestreo hacia abajo a 12,8 kHz). En el procedimiento de codificación tienen lugar varios vectores N-dimensionales. A continuación se ofrece una lista de vectores que aparecen en las figuras 1 y 2, así como una lista de parámetros transmitidos:
Lista de los principales vectores N-dimensionales
s
vector de habla de entrada de la señal de banda ancha (tras un muestreo reducido, un preproceso y un pre-énfasis);
s_{w}
vector de habla ponderado;
s_{0}
respuesta de entrada cero del filtro de síntesis ponderado;
s_{P}
Señal pre-procesada con muestreo reducido;
señal de habla sintetizada sobre-muestreada;
s'
Señal de síntesis antes del de-énfasis;
s_{d}
Señal de síntesis desenfatizada;
s_{h}
Señal de síntesis tras el de-énfasis y el post-proceso;
x
Vector objetivo para la búsqueda de tono;
x'
Vector objetivo para búsqueda de innovación;
h
Respuesta de impulso del filtro de síntesis ponderado;
v_{T}
Vector de libro de código adaptativo (tono) con retardo T;
y_{T}
Vector de libro de código de tono filtrado (convolución de v_{T} con h);
c_{k}
Vector de código innovador en el índice k (entrada de orden k en el libro de código de innovación);
c_{f}
Vector de código innovador con modificación de escala aumentada;
u
Señal de excitación (vectores de código de innovación y de tono con modificación de escala);
u'
Excitación aumentada;
z
Secuencia de ruido de paso de banda;
w'
Secuencia de ruido blanco; y
w
Secuencia de ruido con escala modificada.
Lista de parámetros transmitidos
STP
Parámetros de predicción de corta duración (que definen A(z));
T
Retardo de tono (o índice de libro de código de tono);
b
Ganancia de tono (o ganancia de libro de código de tonos);
j
Índice del filtro paso-bajo utilizado en el vector de código de tono;
k
Índice del vector de código (entrada del libro de código de innovación); y
g
Ganancia del libro de código de innovación
En este modo de realización preferido, los parámetros STP son transmitidos una vez por trama y el resto de los parámetros son transmitidos cuatro veces por trama (cada subtrama).
Lado del codificador
La señal del habla muestreada es codificada en base a bloques por medio del dispositivo 100 de codificación de la figura 1, que es dividido en once módulos numerados del 101 al 111.
El habla de entrada es procesada en los bloques de L muestras mencionados anteriormente, llamados tramas.
Haciendo referencia a la figura 1, la señal 114 de habla de entrada muestreada es de muestreo reducido en un módulo 101 de muestreo reducido. Por ejemplo, la señal se muestrea hacia abajo desde 16 Khz. a 12,8 Khz., utilizando técnicas bien conocidas para los expertos ordinarios en la técnica. Naturalmente, se puede concebir el muestreo reducido a otra frecuencia. El muestreo reducido aumenta la eficiencia de la codificación, ya que se codifica una menor anchura de banda de frecuencias. Esto reduce también la complejidad algorítmica, ya que el número de muestras en una trama disminuye. El uso del muestreo reducido se hace significativo cuando la tasa de bits se reduce por debajo de 16 kbits/segundo, aunque el muestreo reducido no es esencial por encima de 16 kbits/s.
Tras el muestreo reducido, la trama de 320 muestras de 20 ms se reduce a una trama de 256 muestras (la relación de muestreo reducido es de 4/5).
La trama de entrada es suministrada después al bloque opcional 102 de pre-proceso. El bloque 102 de pre-proceso puede consistir en un filtro paso-alto con un frecuencia de corte de 50 Hz. El filtro 102 de paso-alto elimina las componentes de sonido no deseadas por debajo de 50 Hz.
La señal preprocesada de muestreo reducido se denota como S_{p}(n), n = 0,1,2,...L-1, donde L es la longitud de la trama (256 a un frecuencia de muestreo de 12,8 kHz). En un modo de realización preferido del filtro 103 de pre-énfasis la señal S_{p}(n) es pre-enfatizada utilizando un filtro que tiene la siguiente función de transferencia:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis con un valor situado entre 0 y 1 (un valor típico es \mu = 0,7). También puede usarse un filtro de orden superior. Debe indicarse que pueden intercambiarse un filtro 102 de paso-alto y un filtro 103 de pre-énfasis para obtener unas realizaciones de coma fija más eficientes.
La función del filtro 103 de pre-énfasis es aumentar el contenido de alta frecuencia de la señal de entrada. También reduce el rango dinámico de la señal de habla de entrada, que la hace más adecuada para la realización de coma fija. Sin el pre-énfasis, el análisis de LP en coma fija utilizando la aritmética de precisión simple es difícil de llevar a cabo.
El pre-énfasis juega también un papel importante para conseguir una ponderación perceptual global apropiada del error de cuantificación, lo cual contribuye a una calidad de sonido mejorada. Esto será explicado con más detalle a continuación.
La salida del filtro 103 de pre-énfasis se denota como s(n). Esta señal se utiliza para efectuar el análisis LP en el módulo calculador 104. El análisis LP es una técnica bien conocida por los expertos ordinarios en la técnica. En este modo de realización preferido, se utiliza la solución de la autocorrelación. En la solución de la autocorrelación, se toman ventanas de la señal s(n) utilizando una ventana de Hamming (que tiene usualmente una longitud del orden de 30-40 ms). Las autocorrelaciones son calculadas a partir de la señal con ventanas, y se utiliza la acción recurrente (recursión) de Levinson-Durbin para calcular los coeficientes del filtro LP, a_{j}, donde j = 1,...p, y donde p es el orden de LP, que es típicamente 16 en la codificación de banda ancha. Los parámetros a_{j} son los coeficientes de la función de transferencia del filtro LP, que viene dada por la relación siguiente:
A(z) = 1 + \sum\limits^{p}_{j = 1} {a}_{j} z^{-1}
El análisis LP se efectúa en el módulo calculador 104, que realiza también la cuantificación e interpolación de los coeficientes del filtro LP. Los coeficientes del filtro LP son transformados primero en otro dominio equivalente más adecuado para fines de cuantificación e interpolación. Los dominios de la pareja espectral de línea (LSP) y la pareja espectral de inmitancia (ISP) son dos dominios en los cuales puede realizarse eficientemente la cuantificación y la interpolación. Los 16 coeficientes del filtro LP, a_{j}, pueden ser cuantificados en el orden de 30 a 50 bits utilizando la cuantificación repartida o de etapas múltiples, o una combinación de las mismas. El propósito de la interpolación es permitir la actualización de los coeficientes del filtro LP en cada subtrama al tiempo que se transmiten una vez por trama, lo cual mejora el rendimiento del codificador sin aumentar la tasa de bits. Se cree que la cuantificación e interpolación de los coeficientes del filtro LP es por otra parte bien conocida por los expertos ordinarios en la técnica y, consecuentemente, no será descrita con más detalle en la presente memoria.
Los párrafos siguientes describirán el resto de las operaciones de codificación realizadas en base a subtramas. En la descripción siguiente, el filtro A(z) denota el filtro LP interpolado sin cuantificar de la subtrama, y el filtro Â(z) indica el filtro LP interpolado cuantificado de la subtrama.
Ponderación perceptual
En los codificadores de análisis por síntesis, los parámetros óptimos de tono e innovación se buscan minimizando el error cuadrático medio entre el habla de entrada y el habla sintetizada en un dominio perceptual ponderado. Esto es equivalente a hacer mínimo el error entre el habla de entrada ponderada y el habla de síntesis ponderada.
La señal ponderada s_{w}(n) se calcula en un filtro 105 de ponderación perceptual. Tradicionalmente, la señal ponderada s_{w}(n) se calculaba por medio de un filtro de ponderación que tenía una función de transferencia W(z) de la forma:
W(z) = A(z/\gamma_{1}) \ / \ A(z/\gamma_{2}) \ donde \ 0 < \gamma_{2} < \gamma_{1} \leq 1
Como es bien sabido por los expertos ordinarios en la técnica, en los codificadores de análisis por síntesis (AbS) de la técnica anterior, el análisis demuestra que el error de cuantificación es ponderado por una función de transferencia W^{-1}(z), que es la inversa de la función de transferencia del filtro 105 de ponderación perceptual. Este resultado está bien descrito por B.S. Atal y M.R. Schroeder en "Codificación predecible del habla y criterios subjetivos de error", en IEEE Transaction ASSP, vol. 27. núm. 3, páginas 247-254 de Junio de 1979. La función de transferencia W^{-1}(z) presenta algo de la estructura que forma la señal del habla de entrada. Así, la propiedad de enmascaramiento del oído humano es explotada conformando el error de cuantificación de manera que tenga más energía en las regiones de formación donde estará enmascarado por la fuerte energía de la señal presente en estas regiones. La cantidad de ponderación está controlada por los factores \gamma_{1} y \gamma_{2}.
El filtro 105 de ponderación perceptual tradicional anterior funciona bien con señales en la banda de telefonía. Sin embargo, se ha averiguado que este filtro 105 de ponderación perceptual tradicional no es adecuado para una ponderación perceptual eficiente de las señales de banda ancha. También se ha averiguado que el filtro 105 de ponderación perceptual tradicional tiene limitaciones inherentes para efectuar un modelo de la estructura de formación y de la inclinación espectral requerida concurrentemente. La inclinación espectral es más pronunciada en señales de banda ancha debido al amplio rango dinámico entre bajas y altas frecuencias. La técnica anterior sugería añadir un filtro de inclinación en W(z) con el fin de controlar la inclinación y la ponderación de formación de la señal de entrada de banda ancha separadamente.
Una solución nueva para este problema es, de acuerdo con la presente invención, introducir el filtro 103 de pre-énfasis en la entrada, calcular la A(z) del filtro LP basándose en el habla pre-enfatizada s(n), y utilizar una W(z) de filtro modificado fijando su denominador.
El análisis LP se efectúa en el módulo 104 sobre la señal pre-enfatizada s(n) para obtener la A(z) del filtro LP. Además, se utiliza un nuevo filtro 105 de ponderación perceptual con denominador fijo. Un ejemplo de la función de transferencia para el filtro 104 de ponderación perceptual viene dado por la relación siguiente:
W(z) = A (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1}) \ donde \ 0 < \gamma_{2} < \gamma_{1} \leq 1
En el denominador se puede utilizar un orden superior. Esta estructura desacopla sustancialmente la ponderación de formación de la inclinación.
Obsérvese que debido a que A(z) se calcula basándose en la señal s(n) del habla pre-enfatizada, la inclinación del filtro 1/A(z/\gamma_{1}) es menos pronunciada en comparación con el caso en que A(z) es calculada basándose en el habla original. Como el de-énfasis se efectúa en el extremo del descodificador utilizando un filtro que tiene la función de transferencia:
P^{-1}(z) = 1/(1-\mu z^{-1}),
el espectro de error de cuantificación toma la forma que le da un filtro con una función de transferencia W^{-1}(z)P^{-1}(z). Cuando \gamma_{2} es fijada igual a \mu, que es el caso típico, el espectro del error de cuantificación adopta la forma que le da un filtro cuya función de transferencia es 1/A(z/\gamma_{1}), siendo calculada A(z) en base a la señal del habla pre-enfatizada. La escucha subjetiva demostró que esta estructura para conseguir la conformación del error por combinación del pre-énfasis y el filtrado de ponderación modificada es muy eficiente para codificar señales de banda ancha, además de las ventajas de la facilidad de implantación algorítmica de coma fija.
Análisis de tono
Con el fin de simplificar el análisis del tono, se estima primero un retardo T_{OL} de tono en bucle abierto en el módulo 106 de búsqueda de tono en bucle abierto, utilizando la señal s_{W}(n) del habla ponderada. Después, el análisis de tono en bucle cerrado, que es realizado en el módulo 107 de búsqueda de tono en bucle cerrado en base a subtramas, queda restringido alrededor del retardo T_{OL} de tono en bucle abierto que reduce significativamente la complejidad de la búsqueda de los parámetros LTP, T y b (retardo de tono y ganancia de tono). El análisis de tono en bucle abierto se realiza usualmente en el módulo 106 una vez cada 10 ms (dos subtramas) utilizando técnicas bien conocidas por los expertos ordinarios en la técnica.
Se calcula primero el vector objetivo x para el análisis LTP (Predicción a largo plazo). Esto se hace usualmente restando la respuesta s_{0} de entrada cero del filtro W(z)/Â(z) de síntesis ponderado a partir de la señal s_{W}(n) del habla ponderada. Esta respuesta s_{0} de entrada cero se calcula por medio de un calculador 108 de respuestas de entrada cero. Más específicamente, el vector objetivo x se calcula utilizando la relación siguiente:
x = s_{W} - s_{0}
donde x es el vector objetivo N-dimensional, s_{W} es el vector del habla ponderado en la subtrama, y s_{0} es la respuesta de entrada cero del filtro W(z)/Â(z), que es la salida del filtro combinado W(z)Â(z) debido a sus estados iniciales. El calculador 108 de respuestas de entrada cero origina respuestas al filtro LP interpolado cuantificado Â(z) a partir del análisis LP, del calculador 104 de cuantificación e interpolación y a los estados iniciales del filtro W(z)Â(z) de síntesis ponderado almacenado en el módulo 111 de memoria, para calcular la respuesta s_{0} de entrada cero (que es la parte de la respuesta debida a los estados iniciales según se determinan al fijar las entradas igual a cero) del filtro W(z)Â(z). Esta operación es bien conocida por los expertos ordinarios en la técnica y, consecuentemente, no será descrito con más detalle.
Naturalmente, pueden utilizarse enfoques matemáticamente equivalentes para calcular el vector objetivo x.
En el generador 109 de respuestas de impulsos se calcula un vector N-dimensional h de respuesta de impulsos del filtro de síntesis ponderado W(z)Â(z), utilizando los coeficientes A(z) y Â(z) del filtro LP a partir del módulo 104. Nuevamente, esta operación es bien conocida por los expertos ordinarios en la técnica y, consecuentemente, no será descrita con más detalles en la presente memoria.
Los parámetros b, T y j del tono de bucle cerrado (o libro de código del tono) son calculados en el módulo 107 de búsqueda de tono en bucle cerrado, que utiliza el vector objetivo x, el vector h de respuesta de impulsos y el retardo T_{OL} de tono en bucle abierto como entradas. Tradicionalmente, la predicción del tono ha sido representada por un filtro de tonos que tiene la siguiente función de transferencia:
1 \ / \ (1-bz^{-T})
donde b es la ganancia de tono y T es el retardo o retraso del tono. En este caso, la contribución del tono a la señal u(n) de excitación viene dada por bu(n-T), donde la excitación total viene dada por
u(n) = bu(n-T) + gc_{k}(n)
siendo g la ganancia del libro de código innovador y c_{k}(n) el vector de código innovador en el índice k.
Esta representación tiene limitaciones si el retardo T del tono es más corto que la longitud N de la subtrama. En otra representación, la contribución del tono puede ser vista como un libro de código de tono que contiene la señal de excitación anterior. Generalmente, cada vector del libro de código de tono es una versión desplazada en uno del vector anterior (descartando una muestra y añadiendo una nueva muestra). Para retardos de tono T > N, el libro de código de tono es equivalente a la estructura de filtro (1/(1-bz^{-T}), y un vector v_{T}(n) del libro de código de tono con el retardo de tono T viene dado por
v_{T}(n) = u(n-T),
\hskip2cm
n = 0,...N-1
Para retardos T de tono más cortos que N, se construye un vector v_{T}(n) repitiendo las muestras disponibles a partir de la excitación anterior hasta que se completa el vector (esto no es equivalente a la estructura del filtro).
En codificadores recientes, se utiliza una resolución de tono más alta que mejora significativamente la calidad de los segmentos de sonidos de voz. Esto se consigue haciendo un sobre-muestreo de la señal de excitación anterior utilizando filtros de interpolación de varias fases. En este caso, el vector v_{T}(n) corresponde usualmente a una versión interpolada de la excitación anterior, siendo el retardo T de tono un retardo no entero (por ejemplo, 50,25).
La búsqueda de tono consiste en encontrar el mejor retardo T de tono y la mejor ganancia b que hagan mínimo el error cuadrático medio ponderado E entre el vector objetivo x y la excitación filtrada anterior con escala modificada. El error E viene expresado por:
E = | | x-by_{T} | | ^{2}
donde y_{T} es el vector de código de tono filtrado con el retardo de tono T:
y_{T}(n) = v_{T} (n) \text{*} h (n) = \sum\limits^{n}_{i = 0} v_{T} (i) h (n - i) ,
\hskip2cm
n = 0,..., N-1
Puede demostrarse que el error E se hace mínimo haciendo máximo el criterio de búsqueda
C = \frac{x^{t} \ y_{T}}{\sqrt{y^{t}_{T} \ y_{T}}}
donde t indica la transposición del vector.
En el modo de realización preferido de la presente invención, se utiliza una resolución de tono de 1/3 de sub-muestra, y la búsqueda de tono (libro de código de tono) está compuesta por tres etapas.
En la primera etapa, se estima el retardo T_{OL} de tono en bucle abierto en el módulo 106 de búsqueda de tono en bucle abierto, como respuesta a la señal s_{w}(n) del habla ponderada. Como se ha indicado en la descripción precedente, este análisis del tono en bucle abierto se realiza usualmente una vez cada 10 ms (dos subtramas) utilizando técnicas bien conocidas para los expertos ordinarios en la técnica.
En la segunda etapa, se busca el criterio C de búsqueda en el módulo 107 de búsqueda de tono de bucle cerrado para retardos de tono enteros alrededor del retardo estimado T_{OL} de tono en bucle abierto (usualmente \pm5), que simplifica significativamente el procedimiento de búsqueda. Se utiliza un procedimiento sencillo para actualizar el vector de código filtrado y_{T} sin necesidad de calcular le convolución para cada retardo de tono.
Una vez encontrado un retardo entero óptimo en la segunda etapa, una tercera etapa de la búsqueda (módulo 107) comprueba las fracciones alrededor de ese retardo de tono entero óptimo.
Cuando el predictor de tono está representado por un filtro de la forma 1/(1-bz^{-T}), que es una suposición válida para retardos de tono T > N, el espectro del filtro de tono presenta una estructura armónica en todo el rango de frecuencias, con una frecuencia armónica relacionada con 1/T. En el caso de señales de banda ancha, esta estructura no es muy eficiente ya que la estructura armónica en las señales de banda ancha no cubre todo el espectro ampliado. La estructura armónica existe solamente hasta una cierta frecuencia, dependiendo del segmento del habla. Así, con el fin de conseguir una representación eficiente de la contribución del tono en los segmentos de voz del habla de banda ancha, el filtro de predicción de tono necesita tener la flexibilidad de variar la cantidad de periodicidad en todo el espectro de banda ancha.
En la presente memoria se describe un nuevo método que consigue un modelo eficaz de estructura armónica del espectro del habla en las señales de banda ancha, por el cual se aplican varias formas de filtros de paso-bajo a la excitación anterior y se selecciona el filtro con ganancia de predicción más alta.
Cuando se utiliza la resolución de tono de una sub-muestra, pueden incorporarse los filtros de paso-bajo en los filtros de interpolación utilizados para obtener la resolución de tono más alta. En este caso, la tercera etapa de la búsqueda de tono, en la cual se comprueban las fracciones alrededor del retardo de tono entero elegido, se repite para los distintos filtros de interpolación que tienen características diferentes de paso-bajo y se selecciona la fracción y el índice del filtro que hace máximo el criterio C de búsqueda.
Un enfoque más sencillo es completar la búsqueda en las tres etapas descritas anteriormente para determinar el retardo fraccionario óptimo de tono utilizando solamente un filtro de interpolación con una cierta respuesta de frecuencias, y seleccionar la forma óptima del filtro paso-bajo al final, aplicando los distintos filtros paso-bajo predeterminados al vector v_{T} del libro de código de tono elegido y seleccionando el filtro de paso-bajo que hace mínimo el error de predicción de tono. Este enfoque se describe en detalle a continuación.
La figura 3 ilustra un diagrama esquemático de bloques de un modo de realización preferido del enfoque propuesto.
En el módulo 303 de memoria, se almacena la señal u(n), n > 0, de la excitación anterior. El módulo 301 de búsqueda del libro de código de tono origina respuestas al vector objetivo x, al retardo T_{OL} de tono en bucle abierto y a la señal u(n), n > 0 , de la excitación anterior, procedente del módulo 303 de memoria para llevar a cabo una búsqueda del libro de código de tono (libro de código de tono) que haga mínimo el criterio C de búsqueda definido anteriormente. A partir del resultado de la búsqueda llevada a cabo en el módulo 301, el módulo 302 genera el vector óptimo v_{T} del libro de código de tono. Obsérvese que como se utiliza una resolución de tono de sub-muestra (tono fraccionario), la señal de excitación anterior u(n), n < 0, es interpolada y el vector v_{T} del libro de código de tono corresponde a la señal de excitación anterior interpolada. En este modo de realización preferido, el filtro de interpolación (en el módulo 301, pero no ilustrado), tiene una característica de filtro de paso-bajo que elimina el contenido de frecuencias por encima de 7000 Hz.
En un modo de realización preferido, se utilizan las características del filtro K; estas características de filtro podrían ser características de filtro de paso-bajo o de paso-banda. Una vez determinado el vector de código óptimo v_{T} y suministrado al generador 302 de vectores de código de tono, se calculan K versiones filtradas de v_{T}, respectivamente, utilizando K filtros de conformación de frecuencias diferentes tales como 305^{(j)}, donde j = 1,2,...,K. Estas versiones filtradas se denotan como v_{f}^{(j)}, donde j = 1,2,...,K. Los diferentes vectores v_{f}^{(j)} sufren una convolución en los respectivos módulos 304^{(j)}, donde j = 1,2,...,K, con la respuesta h de impulsos para obtener los vectores y^{(j)} donde j = 1,2,...,K. Para calcular el error cuadrático medio de predicción de tono para cada vector y^{(j)}, el valor y^{(j)} es multiplicado por la ganancia b por medio de un amplificador correspondiente 307^{(j)}y el valor by^{(j)} es restado del vector objetivo x por medio de un restador correspondiente 308^{(j)}. El selector 309 selecciona el filtro 305^{(j)} de conformación de frecuencia que hace mínimo el error cuadrático medio de predicción de tono.
e^{(j)} = | | x-b^{(j)}y^{(j)} | | ^{2},
\hskip2cm
j = 1, 2, ..., K
Para calcular el error cuadrático medio e^{(j)} de predicción de tono para cada valor de y^{(j)}, el valor de y^{(j)} es multiplicado por la ganancia b por medio de un correspondiente amplificador 307^{(j)} y el valor b^{(j)}y^{(j)} es restado del vector objetivo x por medio de los restadores 308^{(j)}. Cada ganancia b^{(j)} es calculada en un correspondiente calculador 306^{(j)} de ganancia en asociación con el filtro de conformación de frecuencia en el índice j, utilizando la relación siguiente:
b^{(j)} = x^{t}y^{(j)} / | | y^{(j)} | | ^{2}
En el selector 309, se eligen los parámetros b, T y j basándose en el v_{T} o v_{f}^{(j)} que hace mínimo el error cuadrático medio e de predicción del tono.
Volviendo a hacer referencia a la figura 1, el índice T del libro de código de tono es codificado y transmitido al multiplexor 112. La ganancia b del tono es cuantificada y transmitida al multiplexor 112. Con este nuevo enfoque, se necesita información adicional para codificar el índice j del filtro de conformación de frecuencia seleccionado en el multiplexor 112. Por ejemplo, si se utilizan tres filtros, (j = 0, 1, 2, 3), se necesitan dos bits para representar esta información. La información j del índice del filtro puede ser codificada también conjuntamente con la ganancia b del tono.
Búsqueda del libro de código innovador
Una vez que el tono, o los parámetros LTP (Predicción a largo plazo) b, T y j están determinados, el paso siguiente es buscar la excitación innovadora óptima por medio del módulo 110 de búsqueda de la figura 1. En primer lugar, se actualiza el vector objetivo x restando la contribución LTP:
x' = x - by_{T}
donde b es la ganancia de tono e y_{T} es el vector del libro de código de tono filtrado (la excitación anterior con retardo T filtrada con el filtro paso-bajo seleccionado y en convolución con la respuesta h de impulsos descrita con referencia a la figura 3).
El procedimiento de búsqueda en CELP se realiza buscando el vector de código c_{k} de excitación óptimo y la ganancia g que hacen mínimo el error cuadrático medio entre el vector objetivo y el vector de código filtrado con escala modificada
E = ||x'-gHc_{k}||^{2}
donde H es una matriz de convolución triangular inferior obtenida del vector h de respuesta de impulsos.
En el modo de realización preferido de la presente invención, la búsqueda del libro de código innovador se realiza en el módulo 110 por medio de un libro de código algebraico según se describe en las patentes de Estados Unidos núms. 5.444.816 (Adoul y otros) publicada el 22 de Agosto de 1995; 5.699.482, concedida a Adoul y otros el 17 de Diciembre de 1997; 5.754.976 concedida a Adoul y otros el 19 de Mayo de 1998 y 5.701.392 (Adoul y otros) con fecha 23 de Diciembre de 1997.
Una vez el vector de código c_{k} de excitación óptimo y su ganancia g son elegidas por el módulo 110, el índice k del libro de código y la ganancia g son codificadas y transmitidas al multiplexor 112.
Haciendo referencia a la figura 1, los parámetros b, T, j, Â(z), k y g son multiplexados a través del multiplexor 112 antes de ser transmitidos a través de un canal de comunicaciones.
Actualización de memoria
En el módulo 111 de memoria (figura 1), los estados del filtro de síntesis ponderado W(z)/Â(z) son actualizados filtrando la señal de excitación u = gc_{k} + bv_{T} a través del filtro de síntesis ponderado. Tras este filtrado, los estados del filtro son memorizados y utilizados en la siguiente subtrama como estados iniciales para calcular la respuesta de entrada cero en el módulo calculador 108.
Como en el caso del vector objetivo x, pueden utilizarse otras alternativas matemáticamente equivalentes bien conocidas por los expertos ordinarios en la técnica para actualizar los estados del filtro.
Lado del descodificador
El dispositivo 200 de descodificación del habla de la figura 2 ilustra los diversos pasos llevados a cabo entre la entrada digital 222 (cadena de entrada al desmultiplexor 217) y el habla muestreada de salida 223 (salida del sumador 221).
El desmultiplexor 217 extrae los parámetros del modelo de síntesis de la información binaria recibida desde un canal de entrada digital. De cada trama binaria recibida, los parámetros extraídos son:
- los parámetros de predicción de corta duración (STP) Â(z) (una vez por trama);
- los parámetros de predicción a largo plazo (LTP) T, b y j (para cada subtrama); y
- el índice k del libro de código de innovación y la ganancia g (para cada subtrama).
La señal del habla en curso es sintetizada basándose en estos parámetros como será explicado a continuación.
El libro de código innovador 218 origina respuestas al índice k para generar el vector de código innovador c_{k}, cuya escala se modifica por el factor de ganancia g descodificado a través de un amplificador 224. En el modo de realización preferido, se utiliza un libro de código innovador 218 como se describe en las patentes de Estados Unidos antes mencionadas 5.444.816, 5.699.482, 5.754.976 y 5.701.392, para representar el vector de código innovador c_{k}.
El vector de código innovador gc_{k} generado, en la salida del amplificador 224, es procesado a través del filtro de innovación 205.
Aumento de la periodicidad
El vector de código con escala modificada generado en la salida del amplificador 224 es procesado a través del aumentador 205 de tono dependiente de la frecuencia.
Al aumentar la periodicidad de la señal u de excitación se mejora la calidad en el caso de segmentos de voz. Esto se hizo en el pasado filtrando el vector de innovación del libro de código innovador (libro de código fijo) 218 a través de un filtro de la forma 1/(1-\varepsilonbz^{-T}) donde \varepsilon es un factor por debajo de 0,5 que controla la cantidad de periodicidad introducida. Esta solución es menos eficaz en el caso de señales de banda ancha ya que introduce periodicidad en todo el espectro. Se divulga una nueva solución alternativa, que es parte de la presente invención, por la que el aumento de la periodicidad se consigue filtrando el vector de código innovador c_{k} del libro de código innovador (fijo) a través de un filtro 205 de innovación (F(z)) cuya respuesta de frecuencias enfatiza más las frecuencias más altas que las frecuencias más bajas. Los coeficientes de F(z) están relacionados con la cantidad de periodicidad de la señal u de excitación.
Hay disponibles muchos métodos conocidos para los expertos ordinarios en la técnica para obtener coeficientes de periodicidad válidos. Por ejemplo, el valor de la ganancia b proporciona una indicación de la periodicidad. Es decir, si la ganancia b está próxima a 1, la periodicidad de la señal u de excitación es alta, y si la ganancia b es menor que 0,5, la periodicidad es baja.
Otra forma eficaz de obtener los coeficientes del filtro F(z) utilizados en un modo de realización preferido, es relacionarlos con la cantidad de contribución del tono en la señal total u de excitación. Esto da como resultado una respuesta de frecuencias que depende de la periodicidad de la subtrama, donde las frecuencias más altas son enfatizadas con mayor fuerza (pendiente global más fuerte) para ganancias de tono más altas. El filtro 205 de innovación tiene el efecto de disminuir la energía del vector de código innovador c_{k} a frecuencias bajas cuando la señal u de excitación es más periódica, lo cual aumenta más la periodicidad de la señal u de excitación a frecuencias más bajas que a las frecuencias más altas. Las formas sugeridas del filtro 205 de innovación son
(1) \ \ F(z) = 1 - \sigma z^{-1} ,
\hskip0.5cm
o \ \ bien
\hskip0.5cm
(2) \ \ F(z) = - \alpha z + 1- \alpha z^{-1}
donde \sigma y \alpha son factores de periodicidad obtenidos a partir del nivel de periodicidad de la señal u de excitación.
La segunda forma de tres términos de F(z) se utiliza en un modo de realización preferido. El factor \alpha de periodicidad es calculado en el generador 204 de factores de voz. Pueden utilizarse varios métodos para obtener el factor \alpha de periodicidad de la señal u de excitación. A continuación se presentan dos métodos.
Método 1
Se calcula primero la relación de la contribución del tono a la señal u de excitación total en el generador 204 de factores de voz por medio de
R_{p} = \frac{b^{2}{v_{T}{}^{t}} \ v_{T}}{u^{t} \ u} = \frac{b^{2}\sum\limits^{N-1}_{n = 0}v^{2}_{T}(n)}{\sum\limits^{N-1}_{n = 0}u^{2}(n)}
donde v_{T} es el vector de código de tono, b es la ganancia de tono y u es la señal de excitación entregada en la salida del sumador 219 por
u = gc_{k} + bv_{T}
Obsérvese que el término bv_{T} tiene su fuente en el libro de código del tono (libro de código del tono) 201 como respuesta al retardo T del tono y el valor anterior de u almacenado en la memoria 203. El vector de código de tono v_{T} del libro de código 201 de tono es procesado después a través de un filtro de paso-bajo 202 cuya frecuencia de corte es ajustada por medio del índice j del desmultiplexor 217. El vector de código v_{T} resultante es multiplicado después por la ganancia b del desmultiplexor 217 a través de un amplificador 226 para obtener la señal bv_{T}.
El factor \alpha se calcula en el generador 204 de factores de voz por medio de
\alpha = qR_{p} \ limitado \ por \ \alpha < q
donde q es un factor que controla la cantidad de aumento (q es fijado en 0,25 en este modo de realización preferido).
Método 2
A continuación se describe otro método utilizado en un modo de realización preferido de la invención para calcular el factor \alpha de periodicidad.
En primer lugar, se calcula un factor r_{v} de voz en el generador 204 de factores de voz por medio de
r_{v} = (E_{v} - E_{c}) \ / \ (E_{v} + E_{c})
donde E_{v} es la energía del vector de código bv_{T} de tono con escala modificada y E_{c} es la energía del vector de código innovador gc_{k} con escala modificada. Es decir
E_{v} = b^{2}v_{T}^{t}v_{T} = b^{2}\sum\limits^{N-1}_{n = 0}v_{T}{}^{2}(n)
y
E_{C} = g^{2}c_{k}^{t}c_{k} = g^{2}\sum\limits^{N-1}_{n = 0}C_{k}{}^{2}(n)
Obsérvese que el valor de r_{v} cae entre -1 y 1 (1 corresponde a señales puras de voz y -1 corresponde a señales puras sin voz).
En este modo de realización preferido, el factor \alpha se calcula después en el generador 204 de factores de voz por medio de
\alpha = 0,125 \ (1 + r_{v})
que corresponde a un valor de 0 para señales puras no de voz y a 0,25 para señales puras de voz.
En la primera forma de dos términos de F(z), el factor \sigma de periodicidad puede ser aproximado utilizando \sigma = 2\alpha en los métodos 1 y 2 anteriores. En tal caso, el factor \sigma de periodicidad se calcula como sigue en el método 1 anterior:
\sigma = 2qR_{p} \ limitado \ por \ \sigma < 2q.
En el método 2, el factor \sigma de periodicidad se calcula como sigue:
\sigma = 0,25 \ (1 + r_{v}).
La señal aumentada c_{f} se calcula por tanto filtrando el vector de código innovador gc_{k} a través del filtro 205 de innovación (F(z)).
La señal u' de excitación aumentada es calculada por el sumador 220 como:
u' = c_{f} + bv_{T}
Obsérvese que este proceso no se realiza en el codificador 100. Por tanto, es esencial actualizar el contenido del libro de código 201 de tono utilizando la señal u de excitación sin aumentar para mantener el sincronismo entre el codificador 100 y el descodificador 200. Por tanto, la señal u de excitación se utiliza para actualizar la memoria 203 del libro de código 201 de tono y la señal u' de excitación aumentada se utiliza en la entrada del filtro de síntesis 206 de LP.
Síntesis y de-énfasis
La señal sintetizada s' se calcula filtrando la señal u' de excitación aumentada a través del filtro de síntesis 206 de LP que tiene la forma 1/Â(z), donde Â(z) es el filtro LP interpolado en la subtrama en curso. Como puede verse en la figura 2, los coeficientes de LP cuantificados Â(z) en la línea 225 del desmultiplexor 217 son suministrados al filtro de síntesis 206 de LP para ajustar consecuentemente los parámetros del filtro de síntesis 206 de LP. El filtro 207 de de-énfasis es la inversa del filtro 103 de pre-énfasis de la figura 1. La función de transferencia del filtro 207 de de-énfasis viene dada por
D(z) = 1 \ / \ (1 - \mu z^{-1})
donde \mu es un factor de pre-énfasis con un valor situado entre 0 y 1 (un valor típico es \mu = 0,7). También podría usarse un filtro de orden superior.
El vector s' se filtra a través del filtro D(z) de de-énfasis (módulo 207) para obtener el vector s_{d}, que se hace pasar a través del filtro 208 de paso-alto para eliminar las frecuencias no deseadas por debajo de 50 Hz y obtener así s_{h}.
Sobre-muestreo y regeneración de alta frecuencia
El módulo 209 de sobre-muestreo lleva a cabo el proceso inverso del módulo 101 de muestreo reducido de la figura 1. En este modo de realización preferido, el sobre-muestreo convierte la tasa de muestreo de 12,8 kHz a la tasa de muestreo original de 16 kHz, utilizando técnicas bien conocidas para los expertos ordinarios en la técnica. La señal de síntesis sobre-muestreada se denota como \hat{s}. La señal \hat{s} es denominada también señal intermedia de banda ancha sintetizada.
La señal \hat{s} de síntesis sobre-muestreada no contiene los componentes de frecuencias más altas que se perdieron en el proceso de muestreo reducido (módulo 101 de la figura 1) en el codificador 100. Esto confiere una percepción de paso-bajo a la señal del habla sintetizada. Para restaurar la banda completa de la señal original, se divulga un procedimiento de generación de alta frecuencia. Este procedimiento se efectúa en los módulos 210 a 216, y en el sumador 221, y requiere la entrada del generador 204 de factores de voz (figura 2).
En este nuevo enfoque, el contenido de alta frecuencia es generado rellenando la parte superior del espectro con un ruido blanco con modificación de escala apropiada en el dominio de la excitación, convertido después al dominio del habla, preferiblemente conformándolo con el mismo filtro de síntesis LP utilizado para sintetizar la señal de muestreo reducido \hat{s}.
Se describe a continuación el procedimiento de generación de alta frecuencia de acuerdo con la invención.
El generador 213 de ruido aleatorio genera una secuencia w' de ruido blanco con un espectro plano en toda la anchura de banda de frecuencias, utilizando técnicas bien conocidas por los expertos ordinarios en la técnica. La secuencia generada es de longitud N' que es la longitud de la subtrama en el dominio original. Obsérvese que N es la longitud de la subtrama en el dominio del muestreo reducido. En este modo de realización preferido, N = 64 y N' = 80, lo cual corresponde a 5 ms.
La escala de la secuencia de ruido blanco se modifica apropiadamente en el módulo 214 de ajuste de ganancia. El ajuste de ganancia comprende los pasos siguientes. En primer lugar se fija la energía de la secuencia w' de ruido generado igual a la energía de la señal u' de excitación aumentada calculada por un módulo 210 de cálculo de energía, y la secuencia de ruido resultante con escala modificada viene dada por
w(n) = w{'}(n)\sqrt{\frac{\sum\limits^{N-1}_{n = 0}u{'}^{2}(n)}{\sum\limits^{N'-1}_{n = 0} w{'}^{2}(n)}},
\hskip2cm
n = 0,...,N{'}-1
El segundo paso en la modificación de escala de la ganancia es tener en cuenta el contenido de altas frecuencias de la señal sintetizada en la salida del generador 204 de factores de voz, de manera que se reduce la energía del ruido generado en el caso de segmentos de voz (donde hay presente menos energía en altas frecuencias en comparación con los segmentos sin voz). En este modo de realización preferido, la medición del contenido de alta frecuencia se realiza midiendo la inclinación de la señal de síntesis a través de un calculador espectral 212 de inclinación y reduciendo la energía de manera consecuente. Pueden utilizarse igualmente otras medidas tales como las medidas del cruce con cero. Cuando la inclinación es muy fuerte, lo cual corresponde a segmentos de voz, la energía del ruido se reduce aún más. El factor de inclinación se calcula en el módulo 212 como el primer coeficiente de correlación de la señal s_{h} de síntesis y viene dada por:
inclinación = \frac{\sum\limits^{N-1}_{n = 1}S_{h} (n) S_{h} \ (n - 1)}{\sum\limits^{N - 1}_{n = 0} S_{h}{}^{2} \ (n)}, condicionada \ por \ inclinación \geq 0 \ e \ inclinación \geq r_{v},
donde el factor de voz r_{v} viene dado por
r_{v} = (E_{v} - E_{c}) \ / \ (E_{v} + E_{c})
donde E_{v} es la energía del vector de código bv_{T} de tono con escala modificada y E_{c} es la energía del vector de código innovador gc_{k} con escala modificada, como se ha descrito anteriormente. El factor de voz r_{v} es muy frecuentemente menor que la inclinación pero esta condición fue introducida por precaución contra los tonos de alta frecuencia donde el valor de la inclinación es negativo y el valor de r_{v} es alto. Por tanto, esta condición reduce la energía del ruido para tales señales de tono.
El valor de la inclinación es 0 en el caso de espectro plano y 1 en el caso de señales con contenido fuerte de voz, y es negativo en el caso de señales sin voz donde hay más energía presente a altas frecuencias.
Pueden utilizarse distintos métodos para obtener el factor de modificación de escala g_{t} a partir de la cantidad de contenido de altas frecuencias. En esta invención, se ofrecen dos métodos basándose en la inclinación de la señal descrita anteriormente.
Método 1
El factor de modificación de escala g_{t} se obtiene de la inclinación por medio de
g_{t} = 1 - inclinación \ limitado \ por \ 0,2 \leq g_{t} \leq 1,0
Para señales con fuerte contenido de voz donde la inclinación se aproxima a 1, g_{t} es 0,2 y para señales sin un fuerte contenido de voz, g_{t} toma el valor 1,0.
Método 2
Se restringe primero el factor g_{t} de inclinación para que sea mayor o igual que cero, después se obtiene el factor de modificación de escala a partir de la inclinación por medio de:
g_{t} = 10^{-0,6 \ inclinación}
La secuencia w_{g} de ruido con escala modificada generada en el módulo 214 de ajuste de ganancia viene dada por tanto por:
w_{g} = g_{t} \ w.
Cuando la inclinación está próxima a cero, el factor g_{t} de modificación de escala está próximo a 1, lo cual no da como resultado una reducción de la energía. Cuando el valor de la inclinación es 1, el factor g_{t} de modificación de escala da como resultado una reducción de 12dB en la energía del ruido generado.
Una vez que la escala del ruido se ha modificado apropiadamente (w_{g}), se lleva al dominio del habla utilizando el conformador espectral 215. En el modo de realización preferido, esto se consigue filtrando el ruido w_{g} a través de una versión ampliada de anchura de banda del mismo filtro de síntesis de LP utilizado en el dominio de muestreo reducido (1/Â(z/0,8)). Los correspondientes coeficientes del filtro de LP de anchura de banda ampliada son calculados en el conformador espectral 215.
La secuencia filtrada w_{f} de ruido con escala modificada es filtrada después en banda de paso para el rango de frecuencias requerido que ha de restaurarse utilizando el filtro 216 de paso-banda. En el modo de realización preferido, el filtro 216 de paso-banda restringe la secuencia de ruido al rango de frecuencias de 5,6-7,2 kHz. La secuencia resultante z de ruido filtrado de paso-banda es sumada en el sumador 221 con la señal \hat{s} de habla sintetizada con sobre-muestreo para obtener la señal final reconstruida s_{out} en la salida 223.
Aunque la presente invención ha sido descrita en lo que antecede a manera de modo de realización preferido de la misma, este modo de realización puede modificarse a voluntad, dentro del alcance de las reivindicaciones anexas. Aún cuando el modo de realización preferido describe el uso de señales de habla de banda ancha, será obvio para los expertos en la técnica que la invención del objeto está dirigida también a otros modos de realización que utilizan señales de banda ancha en general y que no está necesariamente limitada a aplicaciones del habla.

Claims (49)

1. Un dispositivo de ponderación perceptual para generar una señal perceptualmente ponderada como respuesta a una señal de banda ancha con el fin de reducir una diferencia entre una señal ponderada de banda ancha y una señal de banda ancha ponderada sintetizada posteriormente, comprendiendo dicho dispositivo de ponderación perceptual:
a) un filtro (103) de pre-énfasis de señales que responde a la señal de banda ancha para reforzar el contenido de alta frecuencia de la señal de banda ancha para generar así una señal (S) pre-enfatizada;
b) un calculador (104) de filtro de síntesis que responde a dicha señal pre-enfatizada para generar coeficientes (A(z)) del filtro de síntesis; y
c) un filtro (105) de ponderación perceptual, que responde a dicha señal (S) pre-enfatizada y a dichos coeficientes (A(z)) del filtro de síntesis, para filtrar dicha señal pre-enfatizada en relación con dichos coeficientes del filtro de síntesis para generar así la señal (S_{w}) ponderada perceptualmente; teniendo dicho filtro de ponderación perceptual una función de transferencia con un denominador fijo por lo que la ponderación de dicha señal de banda ancha en una región de formación está sustancialmente desacoplada de una inclinación espectral de dicha señal de banda ancha.
2. Un dispositivo de ponderación perceptual como se ha definido en la reivindicación 1, en el que dicho filtro de pre-énfasis de señales tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
3. Un dispositivo de ponderación perceptual como se define en la reivindicación 2, en el que dicho factor \mu de pre-énfasis es 0,7.
4. Un dispositivo de ponderación perceptual como se define en la reivindicación 2, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
5. Un dispositivo de ponderación perceptual como se define en la reivindicación 4, donde \gamma_{2} se fija igual a \mu.
6. Un dispositivo de ponderación perceptual como se define en la reivindicación 1, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
7. Un dispositivo de ponderación perceptual como se define en la reivindicación 6, donde \gamma_{2} se fija igual a \mu.
8. Un método para generar una señal ponderada perceptualmente como respuesta a una señal de banda ancha con el fin de reducir una diferencia entre una señal de banda ancha ponderada y una señal de banda ancha ponderada sintetizada posteriormente, comprendiendo dicho método:
a) filtrar la señal de banda ancha para generar una señal pre-enfatizada con un contenido reforzado de alta frecuencia;
b) calcular, a partir de dicha señal pre-enfatizada, coeficientes del filtro de síntesis; y
c) filtrar dicha señal pre-enfatizada en relación con dichos coeficientes del filtro de síntesis para generar así una señal de habla ponderada perceptualmente, donde dicho filtrado comprende el tratamiento de la señal de pre-énfasis a través de un filtro de ponderación perceptual que tiene una función de transferencia con denominador fijo, por lo que la ponderación de dicha señal de banda ancha en una región de formación está sustancialmente desacoplada de la inclinación espectral de dicha señal de banda ancha.
9. Un método para generar una señal ponderada perceptualmente, como se define en la reivindicación 8, en el que el filtrado de dicha señal de banda ancha comprende el filtrado a través de una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
10. Un método para generar una señal ponderada perceptualmente como se define en la reivindicación 9, en el que dicho factor \mu de pre-énfasis es 0,7.
11. Un método para generar una señal ponderada perceptualmente como se define en la reivindicación 9, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
12. Un método para generar una señal ponderada perceptualmente como se define en la reivindicación 11, donde \gamma_{2} se fija igual a \mu.
13. Un método para generar una señal ponderada perceptualmente, como se define en la reivindicación 8, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
14. Un método para generar una señal ponderada perceptualmente como se define en la reivindicación 13, donde \gamma_{2} se fija igual a \mu.
15. Un codificador para codificar una señal de banda ancha que comprende:
a) un dispositivo de ponderación perceptual como se ha descrito en la reivindicación 1;
b) un dispositivo de búsqueda del libro de código de tono que responde a dicha señal ponderada perceptualmente para generar parámetros de libro de código de tono y un vector innovador objetivo de búsqueda;
c) un dispositivo de búsqueda de libro de código innovador, que responda a los coeficientes del filtro de síntesis y al vector innovador objetivo de búsqueda, para generar parámetros del libro de código innovador; y
d) un dispositivo de formación de la señal para generar una señal de banda ancha codificada que comprende dichos parámetros del libro de código de tono, dichos parámetros del libro de código innovador y dichos coeficientes del filtro de síntesis.
16. Un codificador como se ha definido en la reivindicación 15, en el que dicho filtro de señal de pre-énfasis tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
17. Un codificador como se define en la reivindicación 16, en el que dicho factor \mu de pre-énfasis es 0,7.
18. Un codificador como se define en la reivindicación 16, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
19. Un codificador como se define en la reivindicación 18, donde \gamma_{2} se fija igual a \mu.
20. Un codificador como se define en la reivindicación 15, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
21. Un codificador como se define en la reivindicación 20, donde \mu se fija igual a \gamma_{2}.
22. Un sistema de comunicaciones celulares para dar servicio a un área geográfica grande dividida en una pluralidad de células, que comprende:
a)
unidades móviles transmisoras/receptoras;
b)
estaciones base celulares situadas respectivamente en dichas células;
c)
un terminal de control para controlar la comunicación entre las estaciones base celulares;
d)
un subsistema bidireccional de comunicaciones inalámbricas entre cada unidad móvil situada en una célula y la estación base celular de dicha célula, comprendiendo este subsistema bidireccional de comunicaciones inalámbricas, tanto en la unidad móvil como en la estación base celular:
i)
un transmisor que incluye un codificador para codificar una señal de banda ancha como se ha descrito en la reivindicación 15 y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
ii)
un receptor que incluye un circuito receptor para recibir una señal de banda ancha codificada trasmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
23. Un sistema de comunicaciones celulares como se ha definido en la reivindicación 22, en el que dicho filtro de pre-énfasis de la señal tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
24. Un sistema de comunicaciones celulares como se define en la reivindicación 23, en el que dicho factor \mu de pre-énfasis es 0,7.
25. Un sistema de comunicaciones celulares como se define en la reivindicación 23, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
26. Un sistema de comunicaciones celulares como se define en la reivindicación 25, donde \mu se fija igual a \gamma_{2}.
27. Un sistema de comunicaciones celulares como se define en la reivindicación 22, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
28. Un sistema de comunicaciones celulares como se define en la reivindicación 27, donde \gamma_{2} se fija igual a \mu.
29. Una unidad celular móvil transmisora/receptora que comprende:
a) un transmisor que incluye un codificador para codificar una señal de banda ancha como se ha descrito en la reivindicación 15, y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
b) un receptor que incluye un circuito de recepción para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
30. Una unidad celular móvil transmisora/receptora como se ha definido en la reivindicación 29, en la que dicho filtro de pre-énfasis de la señal tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
31. Una unidad celular móvil transmisora/receptora como se define en la reivindicación 30, en la que dicho factor \mu de pre-énfasis es 0,7.
32. Una unidad celular móvil transmisora/receptora como se define en la reivindicación 30, en la que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
33. Una unidad celular móvil transmisora/receptora como se define en la reivindicación 32, donde \gamma_{2} se fija igual a \mu.
34. Una unidad celular móvil transmisora/receptora como se define en la reivindicación 29, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
35. Una unidad celular móvil transmisora/receptora como se define en la reivindicación 34, donde \gamma_{2} se fija igual a \mu.
36. Un elemento de red celular que comprende:
a) un transmisor que incluye un codificador para codificar una señal de banda ancha, como se ha descrito en la reivindicación 15, y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
b) un receptor que incluye un circuito de recepción para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
37. Un elemento de red celular como se ha definido en la reivindicación 36, en el que dicho filtro de pre-énfasis de la señal tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
38. Un elemento de red celular como se define en la reivindicación 37, en el que dicho factor \mu de pre-énfasis es 0,7.
39. Un elemento de red celular como se define en la reivindicación 37, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
40. Un elemento de red celular como se define en la reivindicación 39, donde \gamma_{2} se fija igual a \mu.
41. Un elemento de red celular como se define en la reivindicación 36, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
42. Un elemento de red celular como se define en la reivindicación 41, donde \mu se fija igual a \gamma_{2}
43. En un sistema de comunicaciones celulares para dar servicio a un área geográfica grande dividida en una pluralidad de células, que comprende: unidades móviles transmisoras/receptoras, estaciones base celulares, situadas respectivamente en dichas células, y un terminal de control para controlar la comunicación entre las estaciones base celulares:
un subsistema bidireccional de comunicaciones inalámbricas entre cada una de las unidades móviles situada en una célula y la estación base celular de dicha célula, comprendiendo este subsistema bidireccional de comunicaciones inalámbricas, tanto en la unidad móvil como en la estación base celular:
a) un transmisor que incluye un codificador para codificar una señal de banda ancha como se ha descrito en la reivindicación 15, y un circuito de transmisión para transmitir la señal de banda ancha codificada; y
b) un receptor que incluye un circuito de recepción para recibir una señal de banda ancha codificada transmitida y un descodificador para descodificar la señal de banda ancha codificada recibida.
44. Un subsistema bidireccional de comunicaciones inalámbricas como se ha definido en la reivindicación 43, en el que dicho filtro de pre-énfasis de la señal tiene una función de transferencia de la forma:
P(z) = 1 - \mu z^{-1}
donde \mu es un factor de pre-énfasis que tiene un valor situado entre 0 y 1.
45. Un subsistema bidireccional de comunicaciones inalámbricas como se define en la reivindicación 44, en el que dicho factor \mu de pre-énfasis es 0,7.
46. Un subsistema bidireccional de comunicaciones inalámbricas como se define en la reivindicación 44, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
47. Un subsistema bidireccional de comunicaciones inalámbricas como se define en la reivindicación 46, donde \mu se fija igual a \gamma_{2}.
48. Un subsistema bidireccional de comunicaciones inalámbricas como se define en la reivindicación 43, en el que dicho filtro de ponderación perceptual tiene una función de transferencia de la forma:
W(z) = A \ (z/\gamma_{1}) \ / \ (1-\gamma_{2}z^{-1})
donde 0 < \gamma_{2} < \gamma_{1} \leq 1 y \gamma_{2} y \gamma_{1} son valores de control de ponderación.
49. Un subsistema bidireccional de comunicaciones inalámbricas como se define en la reivindicación 48, donde \gamma_{2} se fija igual a \mu.
ES99952201T 1998-10-27 1999-10-27 Dispositivo de codificacion perceptual y metodo para la codificacion eficaz de señales de banda ancha. Expired - Lifetime ES2212642T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CA002252170A CA2252170A1 (en) 1998-10-27 1998-10-27 A method and device for high quality coding of wideband speech and audio signals
CA2252170 1998-10-27

Publications (1)

Publication Number Publication Date
ES2212642T3 true ES2212642T3 (es) 2004-07-16

Family

ID=4162966

Family Applications (4)

Application Number Title Priority Date Filing Date
ES99952201T Expired - Lifetime ES2212642T3 (es) 1998-10-27 1999-10-27 Dispositivo de codificacion perceptual y metodo para la codificacion eficaz de señales de banda ancha.
ES99952199T Expired - Lifetime ES2205891T3 (es) 1998-10-27 1999-10-27 Un metodo y un dispositivo para una busqueda adaptativa de tono de ancho de banda al codificar señales de banda ancha.
ES99952200T Expired - Lifetime ES2205892T3 (es) 1998-10-27 1999-10-27 Aumento de la periodicidad al descodificar señales de banda ancha.
ES99952183T Expired - Lifetime ES2207968T3 (es) 1998-10-27 1999-10-27 Metodo de recuperacion de contenidos de alta frecuencia y dispositivo para una señal sintetizada, sobremuestreada de banda ancha.

Family Applications After (3)

Application Number Title Priority Date Filing Date
ES99952199T Expired - Lifetime ES2205891T3 (es) 1998-10-27 1999-10-27 Un metodo y un dispositivo para una busqueda adaptativa de tono de ancho de banda al codificar señales de banda ancha.
ES99952200T Expired - Lifetime ES2205892T3 (es) 1998-10-27 1999-10-27 Aumento de la periodicidad al descodificar señales de banda ancha.
ES99952183T Expired - Lifetime ES2207968T3 (es) 1998-10-27 1999-10-27 Metodo de recuperacion de contenidos de alta frecuencia y dispositivo para una señal sintetizada, sobremuestreada de banda ancha.

Country Status (20)

Country Link
US (8) US7151802B1 (es)
EP (4) EP1125276B1 (es)
JP (4) JP3566652B2 (es)
KR (3) KR100417635B1 (es)
CN (4) CN1165891C (es)
AT (4) ATE246836T1 (es)
AU (4) AU6455599A (es)
BR (2) BR9914890B1 (es)
CA (5) CA2252170A1 (es)
DE (4) DE69910058T2 (es)
DK (4) DK1125285T3 (es)
ES (4) ES2212642T3 (es)
HK (1) HK1043234B (es)
MX (2) MXPA01004181A (es)
NO (4) NO318627B1 (es)
NZ (1) NZ511163A (es)
PT (4) PT1125276E (es)
RU (2) RU2217718C2 (es)
WO (4) WO2000025303A1 (es)
ZA (2) ZA200103366B (es)

Families Citing this family (120)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CA2252170A1 (en) * 1998-10-27 2000-04-27 Bruno Bessette A method and device for high quality coding of wideband speech and audio signals
US6704701B1 (en) * 1999-07-02 2004-03-09 Mindspeed Technologies, Inc. Bi-directional pitch enhancement in speech coding systems
CN1432176A (zh) * 2000-04-24 2003-07-23 高通股份有限公司 用于预测量化有声语音的方法和设备
JP3538122B2 (ja) * 2000-06-14 2004-06-14 株式会社ケンウッド 周波数補間装置、周波数補間方法及び記録媒体
US7010480B2 (en) * 2000-09-15 2006-03-07 Mindspeed Technologies, Inc. Controlling a weighting filter based on the spectral content of a speech signal
US6691085B1 (en) * 2000-10-18 2004-02-10 Nokia Mobile Phones Ltd. Method and system for estimating artificial high band signal in speech codec using voice activity information
JP3582589B2 (ja) * 2001-03-07 2004-10-27 日本電気株式会社 音声符号化装置及び音声復号化装置
SE0202159D0 (sv) 2001-07-10 2002-07-09 Coding Technologies Sweden Ab Efficientand scalable parametric stereo coding for low bitrate applications
US8605911B2 (en) 2001-07-10 2013-12-10 Dolby International Ab Efficient and scalable parametric stereo coding for low bitrate audio coding applications
JP2003044098A (ja) * 2001-07-26 2003-02-14 Nec Corp 音声帯域拡張装置及び音声帯域拡張方法
KR100393899B1 (ko) * 2001-07-27 2003-08-09 어뮤즈텍(주) 2-단계 피치 판단 방법 및 장치
US7680665B2 (en) * 2001-08-24 2010-03-16 Kabushiki Kaisha Kenwood Device and method for interpolating frequency components of signal adaptively
WO2003046891A1 (en) * 2001-11-29 2003-06-05 Coding Technologies Ab Methods for improving high frequency reconstruction
US7240001B2 (en) 2001-12-14 2007-07-03 Microsoft Corporation Quality improvement techniques in an audio encoder
US6934677B2 (en) 2001-12-14 2005-08-23 Microsoft Corporation Quantization matrices based on critical band pattern information for digital audio wherein quantization bands differ from critical bands
JP2003255976A (ja) * 2002-02-28 2003-09-10 Nec Corp 音声素片データベースの圧縮伸張を行なう音声合成装置及び方法
US8463334B2 (en) * 2002-03-13 2013-06-11 Qualcomm Incorporated Apparatus and system for providing wideband voice quality in a wireless telephone
CA2388352A1 (en) * 2002-05-31 2003-11-30 Voiceage Corporation A method and device for frequency-selective pitch enhancement of synthesized speed
CA2388439A1 (en) 2002-05-31 2003-11-30 Voiceage Corporation A method and device for efficient frame erasure concealment in linear predictive based speech codecs
CA2392640A1 (en) 2002-07-05 2004-01-05 Voiceage Corporation A method and device for efficient in-based dim-and-burst signaling and half-rate max operation in variable bit-rate wideband speech coding for cdma wireless systems
JP4676140B2 (ja) * 2002-09-04 2011-04-27 マイクロソフト コーポレーション オーディオの量子化および逆量子化
US7299190B2 (en) * 2002-09-04 2007-11-20 Microsoft Corporation Quantization and inverse quantization for audio
US7502743B2 (en) 2002-09-04 2009-03-10 Microsoft Corporation Multi-channel audio encoding and decoding with multi-channel transform selection
SE0202770D0 (sv) 2002-09-18 2002-09-18 Coding Technologies Sweden Ab Method for reduction of aliasing introduces by spectral envelope adjustment in real-valued filterbanks
US7254533B1 (en) * 2002-10-17 2007-08-07 Dilithium Networks Pty Ltd. Method and apparatus for a thin CELP voice codec
JP4433668B2 (ja) * 2002-10-31 2010-03-17 日本電気株式会社 帯域拡張装置及び方法
KR100503415B1 (ko) * 2002-12-09 2005-07-22 한국전자통신연구원 대역폭 확장을 이용한 celp 방식 코덱간의 상호부호화 장치 및 그 방법
CA2415105A1 (en) * 2002-12-24 2004-06-24 Voiceage Corporation A method and device for robust predictive vector quantization of linear prediction parameters in variable bit rate speech coding
CN100531259C (zh) * 2002-12-27 2009-08-19 冲电气工业株式会社 语音通信设备
US7039222B2 (en) * 2003-02-28 2006-05-02 Eastman Kodak Company Method and system for enhancing portrait images that are processed in a batch mode
US6947449B2 (en) * 2003-06-20 2005-09-20 Nokia Corporation Apparatus, and associated method, for communication system exhibiting time-varying communication conditions
KR100651712B1 (ko) * 2003-07-10 2006-11-30 학교법인연세대학교 광대역 음성 부호화기 및 그 방법과 광대역 음성 복호화기및 그 방법
WO2005027095A1 (ja) * 2003-09-16 2005-03-24 Matsushita Electric Industrial Co., Ltd. 符号化装置および復号化装置
US7792670B2 (en) * 2003-12-19 2010-09-07 Motorola, Inc. Method and apparatus for speech coding
US7460990B2 (en) * 2004-01-23 2008-12-02 Microsoft Corporation Efficient coding of digital media spectral data using wide-sense perceptual similarity
KR101213840B1 (ko) * 2004-05-14 2012-12-20 파나소닉 주식회사 복호화 장치 및 복호화 방법, 및 복호화 장치를 구비하는 통신 단말 장치 및 기지국 장치
WO2005112001A1 (ja) * 2004-05-19 2005-11-24 Matsushita Electric Industrial Co., Ltd. 符号化装置、復号化装置、およびこれらの方法
WO2006028010A1 (ja) * 2004-09-06 2006-03-16 Matsushita Electric Industrial Co., Ltd. スケーラブル符号化装置およびスケーラブル符号化方法
DE102005000828A1 (de) * 2005-01-05 2006-07-13 Siemens Ag Verfahren zum Codieren eines analogen Signals
CN102592604A (zh) * 2005-01-14 2012-07-18 松下电器产业株式会社 可扩展性解码装置及可扩展性解码方法
CN100592389C (zh) 2008-01-18 2010-02-24 华为技术有限公司 合成滤波器状态更新方法及装置
EP1895516B1 (en) 2005-06-08 2011-01-19 Panasonic Corporation Apparatus and method for widening audio signal band
FR2888699A1 (fr) * 2005-07-13 2007-01-19 France Telecom Dispositif de codage/decodage hierachique
US7562021B2 (en) * 2005-07-15 2009-07-14 Microsoft Corporation Modification of codewords in dictionary used for efficient coding of digital media spectral data
US7539612B2 (en) * 2005-07-15 2009-05-26 Microsoft Corporation Coding and decoding scale factor information
US7630882B2 (en) * 2005-07-15 2009-12-08 Microsoft Corporation Frequency segmentation to obtain bands for efficient coding of digital media
FR2889017A1 (fr) * 2005-07-19 2007-01-26 France Telecom Procedes de filtrage, de transmission et de reception de flux video scalables, signal, programmes, serveur, noeud intermediaire et terminal correspondants
US8417185B2 (en) 2005-12-16 2013-04-09 Vocollect, Inc. Wireless headset and method for robust voice data communication
US7773767B2 (en) 2006-02-06 2010-08-10 Vocollect, Inc. Headset terminal with rear stability strap
US7885419B2 (en) 2006-02-06 2011-02-08 Vocollect, Inc. Headset terminal with speech functionality
WO2007121778A1 (en) * 2006-04-24 2007-11-01 Nero Ag Advanced audio coding apparatus
US20090281813A1 (en) * 2006-06-29 2009-11-12 Nxp B.V. Noise synthesis
US8358987B2 (en) * 2006-09-28 2013-01-22 Mediatek Inc. Re-quantization in downlink receiver bit rate processor
US7966175B2 (en) * 2006-10-18 2011-06-21 Polycom, Inc. Fast lattice vector quantization
CN101192410B (zh) * 2006-12-01 2010-05-19 华为技术有限公司 一种在编解码中调整量化质量的方法和装置
GB2444757B (en) * 2006-12-13 2009-04-22 Motorola Inc Code excited linear prediction speech coding
US8688437B2 (en) 2006-12-26 2014-04-01 Huawei Technologies Co., Ltd. Packet loss concealment for speech coding
GB0704622D0 (en) * 2007-03-09 2007-04-18 Skype Ltd Speech coding system and method
WO2008114075A1 (en) * 2007-03-16 2008-09-25 Nokia Corporation An encoder
US20110022924A1 (en) * 2007-06-14 2011-01-27 Vladimir Malenovsky Device and Method for Frame Erasure Concealment in a PCM Codec Interoperable with the ITU-T Recommendation G. 711
US7761290B2 (en) 2007-06-15 2010-07-20 Microsoft Corporation Flexible frequency and time partitioning in perceptual transform coding of audio
US8046214B2 (en) 2007-06-22 2011-10-25 Microsoft Corporation Low complexity decoder for complex transform coding of multi-channel sound
US7885819B2 (en) 2007-06-29 2011-02-08 Microsoft Corporation Bitstream syntax for multi-process audio decoding
EP2172928B1 (en) * 2007-07-27 2013-09-11 Panasonic Corporation Audio encoding device and audio encoding method
TWI346465B (en) * 2007-09-04 2011-08-01 Univ Nat Central Configurable common filterbank processor applicable for various audio video standards and processing method thereof
US8249883B2 (en) * 2007-10-26 2012-08-21 Microsoft Corporation Channel extension coding for multi-channel source
US8300849B2 (en) * 2007-11-06 2012-10-30 Microsoft Corporation Perceptually weighted digital audio level compression
JP5326311B2 (ja) * 2008-03-19 2013-10-30 沖電気工業株式会社 音声帯域拡張装置、方法及びプログラム、並びに、音声通信装置
WO2010003543A1 (en) * 2008-07-11 2010-01-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for calculating bandwidth extension data using a spectral tilt controlling framing
USD605629S1 (en) 2008-09-29 2009-12-08 Vocollect, Inc. Headset
KR20100057307A (ko) * 2008-11-21 2010-05-31 삼성전자주식회사 노래점수 평가방법 및 이를 이용한 가라오케 장치
CN101599272B (zh) * 2008-12-30 2011-06-08 华为技术有限公司 基音搜索方法及装置
CN101770778B (zh) * 2008-12-30 2012-04-18 华为技术有限公司 一种预加重滤波器、感知加权滤波方法及系统
CN101604525B (zh) * 2008-12-31 2011-04-06 华为技术有限公司 基音增益获取方法、装置及编码器、解码器
GB2466672B (en) * 2009-01-06 2013-03-13 Skype Speech coding
GB2466674B (en) 2009-01-06 2013-11-13 Skype Speech coding
GB2466669B (en) * 2009-01-06 2013-03-06 Skype Speech coding
GB2466671B (en) * 2009-01-06 2013-03-27 Skype Speech encoding
GB2466673B (en) * 2009-01-06 2012-11-07 Skype Quantization
GB2466675B (en) * 2009-01-06 2013-03-06 Skype Speech coding
GB2466670B (en) * 2009-01-06 2012-11-14 Skype Speech encoding
US8983831B2 (en) * 2009-02-26 2015-03-17 Panasonic Intellectual Property Corporation Of America Encoder, decoder, and method therefor
EP2402938A1 (en) * 2009-02-27 2012-01-04 Panasonic Corporation Tone determination device and tone determination method
US8160287B2 (en) 2009-05-22 2012-04-17 Vocollect, Inc. Headset with adjustable headband
US8452606B2 (en) * 2009-09-29 2013-05-28 Skype Speech encoding using multiple bit rates
US20120203548A1 (en) * 2009-10-20 2012-08-09 Panasonic Corporation Vector quantisation device and vector quantisation method
US8484020B2 (en) * 2009-10-23 2013-07-09 Qualcomm Incorporated Determining an upperband signal from a narrowband signal
US8438659B2 (en) 2009-11-05 2013-05-07 Vocollect, Inc. Portable computing device and headset interface
IN2012DN05235A (es) 2010-01-08 2015-10-23 Nippon Telegraph & Telephone
CN101854236B (zh) 2010-04-05 2015-04-01 中兴通讯股份有限公司 一种信道信息反馈方法和系统
CN102844810B (zh) * 2010-04-14 2017-05-03 沃伊斯亚吉公司 用于在码激励线性预测编码器和解码器中使用的灵活和可缩放的组合式创新代码本
KR102138320B1 (ko) 2011-10-28 2020-08-11 한국전자통신연구원 통신 시스템에서 신호 코덱 장치 및 방법
CN105761724B (zh) * 2012-03-01 2021-02-09 华为技术有限公司 一种语音频信号处理方法和装置
CN105469805B (zh) 2012-03-01 2018-01-12 华为技术有限公司 一种语音频信号处理方法和装置
US9070356B2 (en) * 2012-04-04 2015-06-30 Google Technology Holdings LLC Method and apparatus for generating a candidate code-vector to code an informational signal
US9263053B2 (en) * 2012-04-04 2016-02-16 Google Technology Holdings LLC Method and apparatus for generating a candidate code-vector to code an informational signal
CN103928029B (zh) * 2013-01-11 2017-02-08 华为技术有限公司 音频信号编码和解码方法、音频信号编码和解码装置
KR101737254B1 (ko) 2013-01-29 2017-05-17 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 오디오 신호, 디코더, 인코더, 시스템 및 컴퓨터 프로그램을 합성하기 위한 장치 및 방법
US9728200B2 (en) 2013-01-29 2017-08-08 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for adaptive formant sharpening in linear prediction coding
US12483851B2 (en) * 2013-09-05 2025-11-25 Dm-Dsp, Llc Automatic level-dependent pitch correction of digital audio
US9620134B2 (en) 2013-10-10 2017-04-11 Qualcomm Incorporated Gain shape estimation for improved tracking of high-band temporal characteristics
US10614816B2 (en) 2013-10-11 2020-04-07 Qualcomm Incorporated Systems and methods of communicating redundant frame information
US10083708B2 (en) 2013-10-11 2018-09-25 Qualcomm Incorporated Estimation of mixing factors to generate high-band excitation signal
US9384746B2 (en) 2013-10-14 2016-07-05 Qualcomm Incorporated Systems and methods of energy-scaled signal processing
PL3058568T3 (pl) * 2013-10-18 2021-07-05 Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. Koncepcja kodowania sygnału audio i dekodowania sygnału audio z wykorzystaniem związanych z mową informacji kształtowania widmowego
ES3042587T3 (en) 2013-10-18 2025-11-21 Fraunhofer Ges Forschung Concept of encoding an audio signal and decoding an audio signal using deterministic and noise like information
CN105745706B (zh) * 2013-11-29 2019-09-24 索尼公司 用于扩展频带的装置、方法和程序
US10163447B2 (en) 2013-12-16 2018-12-25 Qualcomm Incorporated High-band signal modeling
KR102251833B1 (ko) * 2013-12-16 2021-05-13 삼성전자주식회사 오디오 신호의 부호화, 복호화 방법 및 장치
US9697843B2 (en) * 2014-04-30 2017-07-04 Qualcomm Incorporated High band excitation signal generation
CN105336339B (zh) * 2014-06-03 2019-05-03 华为技术有限公司 一种语音频信号的处理方法和装置
CN105047201A (zh) * 2015-06-15 2015-11-11 广东顺德中山大学卡内基梅隆大学国际联合研究院 一种基于分段扩展的宽带激励信号合成方法
US9837089B2 (en) * 2015-06-18 2017-12-05 Qualcomm Incorporated High-band signal generation
US10847170B2 (en) 2015-06-18 2020-11-24 Qualcomm Incorporated Device and method for generating a high-band signal from non-linearly processed sub-ranges
US9407989B1 (en) 2015-06-30 2016-08-02 Arthur Woodrow Closed audio circuit
JP6611042B2 (ja) * 2015-12-02 2019-11-27 パナソニックIpマネジメント株式会社 音声信号復号装置及び音声信号復号方法
CN106601267B (zh) * 2016-11-30 2019-12-06 武汉船舶通信研究所 一种基于超短波fm调制的语音增强方法
US10573326B2 (en) * 2017-04-05 2020-02-25 Qualcomm Incorporated Inter-channel bandwidth extension
CN113324546B (zh) * 2021-05-24 2022-12-13 哈尔滨工程大学 罗经失效下的多潜航器协同定位自适应调节鲁棒滤波方法
US12562939B2 (en) * 2022-04-05 2026-02-24 Qualcomm Incorporated Beam selection using oversampled beamforming codebooks and channel estimates

Family Cites Families (43)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
NL8500843A (nl) * 1985-03-22 1986-10-16 Koninkl Philips Electronics Nv Multipuls-excitatie lineair-predictieve spraakcoder.
JPH0738118B2 (ja) * 1987-02-04 1995-04-26 日本電気株式会社 マルチパルス符号化装置
EP0331858B1 (en) * 1988-03-08 1993-08-25 International Business Machines Corporation Multi-rate voice encoding method and device
US5359696A (en) * 1988-06-28 1994-10-25 Motorola Inc. Digital speech coder having improved sub-sample resolution long-term predictor
JP2621376B2 (ja) 1988-06-30 1997-06-18 日本電気株式会社 マルチパルス符号化装置
JP2900431B2 (ja) 1989-09-29 1999-06-02 日本電気株式会社 音声信号符号化装置
JPH03123113A (ja) 1989-10-05 1991-05-24 Fujitsu Ltd ピッチ周期探索方式
US5307441A (en) * 1989-11-29 1994-04-26 Comsat Corporation Wear-toll quality 4.8 kbps speech codec
CA2010830C (en) 1990-02-23 1996-06-25 Jean-Pierre Adoul Dynamic codebook for efficient speech coding based on algebraic codes
US5701392A (en) 1990-02-23 1997-12-23 Universite De Sherbrooke Depth-first algebraic-codebook search for fast coding of speech
US5754976A (en) 1990-02-23 1998-05-19 Universite De Sherbrooke Algebraic codebook with signal-selected pulse amplitude/position combinations for fast coding of speech
CN1062963C (zh) * 1990-04-12 2001-03-07 多尔拜实验特许公司 用于产生高质量声音信号的解码器和编码器
US5113262A (en) * 1990-08-17 1992-05-12 Samsung Electronics Co., Ltd. Video signal recording system enabling limited bandwidth recording and playback
US6134373A (en) * 1990-08-17 2000-10-17 Samsung Electronics Co., Ltd. System for recording and reproducing a wide bandwidth video signal via a narrow bandwidth medium
US5235669A (en) * 1990-06-29 1993-08-10 At&T Laboratories Low-delay code-excited linear-predictive coding of wideband speech at 32 kbits/sec
US5392284A (en) * 1990-09-20 1995-02-21 Canon Kabushiki Kaisha Multi-media communication device
JP2626223B2 (ja) * 1990-09-26 1997-07-02 日本電気株式会社 音声符号化装置
US6006174A (en) * 1990-10-03 1999-12-21 Interdigital Technology Coporation Multiple impulse excitation speech encoder and decoder
US5235670A (en) * 1990-10-03 1993-08-10 Interdigital Patents Corporation Multiple impulse excitation speech encoder and decoder
JP3089769B2 (ja) 1991-12-03 2000-09-18 日本電気株式会社 音声符号化装置
GB9218864D0 (en) * 1992-09-05 1992-10-21 Philips Electronics Uk Ltd A method of,and system for,transmitting data over a communications channel
JP2779886B2 (ja) * 1992-10-05 1998-07-23 日本電信電話株式会社 広帯域音声信号復元方法
IT1257431B (it) 1992-12-04 1996-01-16 Sip Procedimento e dispositivo per la quantizzazione dei guadagni dell'eccitazione in codificatori della voce basati su tecniche di analisi per sintesi
US5455888A (en) * 1992-12-04 1995-10-03 Northern Telecom Limited Speech bandwidth extension method and apparatus
US5621852A (en) * 1993-12-14 1997-04-15 Interdigital Technology Corporation Efficient codebook structure for code excited linear prediction coding
DE4343366C2 (de) * 1993-12-18 1996-02-29 Grundig Emv Verfahren und Schaltungsanordnung zur Vergrößerung der Bandbreite von schmalbandigen Sprachsignalen
US5450449A (en) * 1994-03-14 1995-09-12 At&T Ipm Corp. Linear prediction coefficient generation during frame erasure or packet loss
US5956624A (en) * 1994-07-12 1999-09-21 Usa Digital Radio Partners Lp Method and system for simultaneously broadcasting and receiving digital and analog signals
JP3483958B2 (ja) 1994-10-28 2004-01-06 三菱電機株式会社 広帯域音声復元装置及び広帯域音声復元方法及び音声伝送システム及び音声伝送方法
FR2729247A1 (fr) 1995-01-06 1996-07-12 Matra Communication Procede de codage de parole a analyse par synthese
AU696092B2 (en) 1995-01-12 1998-09-03 Digital Voice Systems, Inc. Estimation of excitation parameters
EP0732687B2 (en) 1995-03-13 2005-10-12 Matsushita Electric Industrial Co., Ltd. Apparatus for expanding speech bandwidth
JP3189614B2 (ja) 1995-03-13 2001-07-16 松下電器産業株式会社 音声帯域拡大装置
US5664055A (en) * 1995-06-07 1997-09-02 Lucent Technologies Inc. CS-ACELP speech compression system with adaptive pitch prediction filter gain based on a measure of periodicity
EP0763818B1 (en) * 1995-09-14 2003-05-14 Kabushiki Kaisha Toshiba Formant emphasis method and formant emphasis filter device
US5819213A (en) * 1996-01-31 1998-10-06 Kabushiki Kaisha Toshiba Speech encoding and decoding with pitch filter range unrestricted by codebook range and preselecting, then increasing, search candidates from linear overlap codebooks
JP3357795B2 (ja) * 1996-08-16 2002-12-16 株式会社東芝 音声符号化方法および装置
JPH10124088A (ja) * 1996-10-24 1998-05-15 Sony Corp 音声帯域幅拡張装置及び方法
JP3063668B2 (ja) 1997-04-04 2000-07-12 日本電気株式会社 音声符号化装置及び復号装置
US5999897A (en) * 1997-11-14 1999-12-07 Comsat Corporation Method and apparatus for pitch estimation using perception based analysis by synthesis
US6449590B1 (en) * 1998-08-24 2002-09-10 Conexant Systems, Inc. Speech encoder using warping in long term preprocessing
US6104992A (en) * 1998-08-24 2000-08-15 Conexant Systems, Inc. Adaptive gain reduction to produce fixed codebook target signal
CA2252170A1 (en) * 1998-10-27 2000-04-27 Bruno Bessette A method and device for high quality coding of wideband speech and audio signals

Also Published As

Publication number Publication date
US6795805B1 (en) 2004-09-21
DK1125284T3 (da) 2003-12-01
NO20012066D0 (no) 2001-04-26
NO20012067L (no) 2001-06-27
BR9914890B1 (pt) 2013-09-24
JP2002528775A (ja) 2002-09-03
KR100417836B1 (ko) 2004-02-05
EP1125285A1 (en) 2001-08-22
JP3490685B2 (ja) 2004-01-26
KR100417634B1 (ko) 2004-02-05
EP1125286B1 (en) 2003-12-17
DE69910058T2 (de) 2004-05-19
PT1125284E (pt) 2003-12-31
EP1125276B1 (en) 2003-08-06
WO2000025298A1 (en) 2000-05-04
MXPA01004137A (es) 2002-06-04
CN1165891C (zh) 2004-09-08
RU2219507C2 (ru) 2003-12-20
WO2000025304A1 (en) 2000-05-04
CN1328682A (zh) 2001-12-26
CN1328683A (zh) 2001-12-26
ATE246389T1 (de) 2003-08-15
CN1172292C (zh) 2004-10-20
AU763471B2 (en) 2003-07-24
ES2207968T3 (es) 2004-06-01
EP1125286A1 (en) 2001-08-22
ATE246836T1 (de) 2003-08-15
US7260521B1 (en) 2007-08-21
NZ511163A (en) 2003-07-25
NO317603B1 (no) 2004-11-22
DE69910058D1 (de) 2003-09-04
US20050108007A1 (en) 2005-05-19
US6807524B1 (en) 2004-10-19
NO20012068L (no) 2001-06-27
PT1125276E (pt) 2003-12-31
HK1043234B (zh) 2004-07-16
JP3566652B2 (ja) 2004-09-15
NO319181B1 (no) 2005-06-27
EP1125284A1 (en) 2001-08-22
AU6457199A (en) 2000-05-15
AU6457099A (en) 2000-05-15
CA2347743C (en) 2005-09-27
CA2252170A1 (en) 2000-04-27
JP3936139B2 (ja) 2007-06-27
CA2347667C (en) 2006-02-14
PT1125285E (pt) 2003-12-31
BR9914889A (pt) 2001-07-17
EP1125276A1 (en) 2001-08-22
KR20010090803A (ko) 2001-10-19
NO20012066L (no) 2001-06-27
PT1125286E (pt) 2004-05-31
WO2000025303A1 (en) 2000-05-04
AU6456999A (en) 2000-05-15
CA2347668A1 (en) 2000-05-04
DK1125276T3 (da) 2003-11-17
CA2347735C (en) 2008-01-08
DE69910240T2 (de) 2004-06-24
AU6455599A (en) 2000-05-15
US20060277036A1 (en) 2006-12-07
EP1125285B1 (en) 2003-07-30
DK1125285T3 (da) 2003-11-10
EP1125284B1 (en) 2003-08-06
CN1127055C (zh) 2003-11-05
US8036885B2 (en) 2011-10-11
ATE246834T1 (de) 2003-08-15
WO2000025305A1 (en) 2000-05-04
CA2347668C (en) 2006-02-14
CA2347735A1 (en) 2000-05-04
NO318627B1 (no) 2005-04-18
ES2205891T3 (es) 2004-05-01
BR9914889B1 (pt) 2013-07-30
DE69910239T2 (de) 2004-06-24
NO20045257L (no) 2001-06-27
CN1328684A (zh) 2001-12-26
US20100174536A1 (en) 2010-07-08
DE69910239D1 (de) 2003-09-11
JP2002528983A (ja) 2002-09-03
DK1125286T3 (da) 2004-04-19
KR20010099763A (ko) 2001-11-09
KR100417635B1 (ko) 2004-02-05
ATE256910T1 (de) 2004-01-15
ES2205892T3 (es) 2004-05-01
DE69913724D1 (de) 2004-01-29
JP3869211B2 (ja) 2007-01-17
HK1043234A1 (en) 2002-09-06
ZA200103367B (en) 2002-05-27
CA2347743A1 (en) 2000-05-04
DE69910240D1 (de) 2003-09-11
NO20012068D0 (no) 2001-04-26
CN1328681A (zh) 2001-12-26
US20050108005A1 (en) 2005-05-19
JP2002528777A (ja) 2002-09-03
BR9914890A (pt) 2001-07-17
CN1165892C (zh) 2004-09-08
RU2217718C2 (ru) 2003-11-27
KR20010099764A (ko) 2001-11-09
ZA200103366B (en) 2002-05-27
NO20012067D0 (no) 2001-04-26
US7151802B1 (en) 2006-12-19
DE69913724T2 (de) 2004-10-07
MXPA01004181A (es) 2003-06-06
JP2002528776A (ja) 2002-09-03
US7672837B2 (en) 2010-03-02
AU752229B2 (en) 2002-09-12
CA2347667A1 (en) 2000-05-04

Similar Documents

Publication Publication Date Title
ES2205892T3 (es) Aumento de la periodicidad al descodificar señales de banda ancha.
ES2266003T3 (es) Suavizador de la ganancia en un descodificador de señal de habla y audio de banda ancha.
US7280959B2 (en) Indexing pulse positions and signs in algebraic codebooks for coding of wideband signals