ES2261637T3 - Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso. - Google Patents

Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso.

Info

Publication number
ES2261637T3
ES2261637T3 ES02708594T ES02708594T ES2261637T3 ES 2261637 T3 ES2261637 T3 ES 2261637T3 ES 02708594 T ES02708594 T ES 02708594T ES 02708594 T ES02708594 T ES 02708594T ES 2261637 T3 ES2261637 T3 ES 2261637T3
Authority
ES
Spain
Prior art keywords
speech
processor
encoder
phase
coding system
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES02708594T
Other languages
English (en)
Inventor
Ercan F. Gigi
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Koninklijke Philips NV
Original Assignee
Koninklijke Philips Electronics NV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Koninklijke Philips Electronics NV filed Critical Koninklijke Philips Electronics NV
Application granted granted Critical
Publication of ES2261637T3 publication Critical patent/ES2261637T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04B—TRANSMISSION
    • H04B14/00—Transmission systems not characterised by the medium used for transmission
    • H04B14/02—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation
    • H04B14/04—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation using pulse code modulation
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04B—TRANSMISSION
    • H04B1/00—Details of transmission systems, not covered by a single one of groups H04B3/00 - H04B13/00; Details of transmission systems not characterised by the medium used for transmission
    • H04B1/66—Details of transmission systems, not covered by a single one of groups H04B3/00 - H04B13/00; Details of transmission systems not characterised by the medium used for transmission for reducing bandwidth of signals; for improving efficiency of transmission
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/26—Pre-filtering or post-filtering
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04B—TRANSMISSION
    • H04B14/00—Transmission systems not characterised by the medium used for transmission
    • H04B14/02—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation
    • H04B14/06—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation using differential modulation, e.g. delta modulation

Landscapes

  • Engineering & Computer Science (AREA)
  • Signal Processing (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Magnetic Resonance Imaging Apparatus (AREA)

Abstract

Sistema de codificación del habla con un codificador del habla y un decodificador del habla que actúan conjuntamente con dicho codificador del habla, comprendiendo el codificador del habla un procesador previo y un codificador ADPCM (modulación por codificación de impulsos diferencial adaptativa) con un cuantificador y medios de adaptación de dimensión de paso, y comprendiendo el decodificador del habla un decodificador ADPCM con medios de adaptación de dimensión de paso similares a los del codificador ADPCM y un procesador posterior, caracterizado porque el procesador previo está dotado de medios de filtrado de difuminado de fase para suavizar el efecto de los cambios de energía altos y / o rápidos en la entrada del cuantificador, y el procesador posterior está dotado de medios de filtrado inversos a dichos medios de filtrado de difuminado de fase.

Description

Sistema de codificación del habla ADPCM, con filtros de difuminado de fase y difuminado de fase inverso.
La presente invención se refiere a un sistema de codificación del habla con un codificador del habla y un decodificador del habla que actúa conjuntamente con dicho codificador del habla, comprendiendo el codificador del habla un procesador previo y un codificador ADPCM (Adaptative Differential Pulse Code Modulation, modulación por codificación de impulsos diferencial adaptativa) con un cuantificador y medios de adaptación de dimensión de paso, y comprendiendo el decodificador del habla un decodificador ADPCM con medios de adaptación de dimensión de paso similares a los del codificador ADPCM, y un procesador posterior.
Se ha observado que las grabaciones de voz cercanas al micrófono reducen o eliminan el efecto de la acústica de la sala en una señal de voz al minimizar la distancia de la fuente de voz (la boca) respecto al micrófono, tal como en un microteléfono. Cuando estas señales de voz se procesan en el codificador de un sistema de codificación de audio estándar P^{2}CM, es decir, un codificador ADCM procesado previamente, surgen problemas en relación con la reproducción del impulso como carácter de la grabación de voz cercana al micrófono en comparación con la grabación desde una distancia mayor. Un codificador ADPCM está dotado de un cuantificador en el que la señal de entrada del mismo, es decir, la diferencia entre una señal de entrada de audio muestreada y un valor cuantificado y predicho de la misma, se cuantifica con una dimensión de paso que está adaptada a la señal de entrada del cuantificador. En las regiones de impulsos similares en la grabación de voz cercana al micrófono, la señal de entrada para el cuantificador en el codificador ADPCM puede ser demasiado alta y demasiado rápida para que el cuantificador adapte su dimensión de paso. Las reverberaciones en la sala difuminan la energía de la señal de voz respecto al tiempo, permitiendo una adaptación más lenta de la dimensión de paso.
Por tanto, para mejorar el rendimiento del sistema de codificación de audio P^{2}CM para las señales de impulsos similares, la señal de entrada del codificador ADPCM ha de procesarse de tal manera que la entrada para el cuantificador esté libre de incrementos rápidos de energía en breves marcos de tiempo. No obstante, la salida del decodificador de habla debería sonar como el original, sin ningún artefacto. Por tanto, la opción de simular el efecto de la sala para producir una versión distante de la grabación original y aplicar la codificación a esta señal no es suficientemente buena.
El objetivo de la invención es mitigar el problema anterior y proporcionar un sistema de codificación del habla con una grabación y reproducción mejoradas, particularmente para señales de voz de impulsos similares.
Según la invención, el sistema de codificación del habla, tal como se ha descrito en el párrafo introductorio, se caracteriza porque el procesador previo está dotado de medios de filtrado del difuminado de fase (phase-smearing) para suavizar el efecto de cambios altos y/o rápidos de energía en la entrada del cuantificador y el procesador posterior está dotado de medios de filtrado inversos a dichos medios de filtrado del difuminado de fase.
Aunque el filtrado del difuminado de fase puede realizarse en el dominio temporal, se prefiere realizar este filtrado, en el caso de que el procesador previo y el procesador posterior estén dotados de medios de distorsión previa de la amplitud espectral y medios para deshacer el efecto de una distorsión previa de este tipo, respectivamente, en el dominio de frecuencia dado que dichos medios de distorsión previa e inversión de la distorsión previa pueden operar en el dominio de frecuencia. Por tanto, particularmente, el difuminado de fase y la distorsión previa se llevan a cabo en el mismo bloque de procesamiento, así como también el difuminado de fase inverso y la distorsión previa inversa. Dado que el difuminado de fase es un proceso lineal mientras que la distorsión previa de la amplitud espectral es un proceso no lineal, los dos procesos no están integrados entre sí, sino que se realizan uno tras el otro en el dominio de frecuencia; las señales filtradas se someten a la distorsión previa. La distorsión previa de la amplitud espectral es conocida en sí misma; véase R. Lefebre, C. Laflamme; "Spectral Amplitude Warping (SAW) for Noise Spectrum Shaping in Audio Coding", ICASSP, núm. 1, pp. 335-338, 1997.
Estos y otros aspectos de la invención resultarán evidentes y se dilucidarán en relación con el dibujo y la realización descrita a continuación. En el dibujo:
la figura 1 muestra un diagrama de bloques de un sistema de codificación P^{2}CM con medios para el procesamiento previo y posterior, incluyendo medios de filtrado de difuminado de fase y medios de filtrado de difuminado de fase inversos, respectivamente, que pueden operar en el dominio de tiempo;
las figuras 2A, 2B son diagramas de bloques de un codificador ADPCM y un decodificador ADPCM, respectivamente;
las figuras 3A-3D muestran varias características de una primera realización de un filtro de difuminado de fase;
las figuras 4A-4D muestran varias características de una segunda realización de un filtro de difuminado de fase;
la figura 5 es un diagrama de bloques de un procesador previo/posterior para un codificador y decodificador de audio P^{2}CM en el que el difuminado de fase puede operarse en el dominio de frecuencia; y
la figura 6 muestra la representación en cuadros y ventanas del procesador previo.
El sistema de codificación de audio P^{2}CM en la figura 1 está constituido por un codificador 1 y un decodificador 2. El codificador 1 comprende un procesador 3 previo y un codificador 4 ADPCM, mientras que el decodificador 2 está dotado de un decodificador 5 ADPCM y un procesador 6 posterior. El codificador 4 ADPCM se ilustra en la figura 2A y el decodificador 5 ADPCM en la figura 2B.
Como ejemplo, en el codificador 1 de audio P^{2}CM una señal de entrada PCM se segmenta en cuadros de, por ejemplo, 10 milisegundos. Con una secuencia de muestreo de, por ejemplo, 8 kHZ, un cuadro se compone de 80 muestras. Cada muestra se representa por 16 bits, por ejemplo. Esta señal de entrada se alimenta al procesador 3 previo, mientras que la señal de salida obtenida como respuesta a la misma se alimenta al codificador 4 ADPCM. Una señal de entrada adicional para el codificador 4 ADPCM se forma mediante un señal de modo códec (CMS, codec mode signal) que determina la asignación de bits para las palabras de código en la salida del flujo de bits del codificador 4 ADPCM. El codificador 4 ADPCM produce una palabra de código para cada muestra en el cuadro de señal previamente procesada. Las palabras de código se empaquetan entonces en cuadros, en el presente ejemplo, de 80 códigos. Dependiendo del modo códec elegido, el flujo de bits resultante tiene una tasa de transferencia de bits de, por ejemplo, 11,2, 12,8, 16, 19,2, 21,6, 24 o 32 kbits/s.
En el decodificador 2 de audio P^{2}CM, la entrada del codificador ADPCM se forma por un flujo de bits de cuadros de código y el modo códec. En el presente ejemplo, los cuadros de código consisten en 80 códigos que se decodifican mediante el decodificador 5 ADPCM para formar un cuadro de salida PCM de 80 muestras que se someten a un procesamiento posterior en el procesador 6 posterior.
En el procesador 3 previo las características de la señal se modifican de tal manera que la señal resultante está mejor adaptada para la codificación. El procesamiento previo modifica el espectro de la señal antes de la codificación. Por tanto, una transformación no lineal, por ejemplo, una transformación por raíz cuadrada, puede aplicarse a las amplitudes espectrales. Mediante una transformación de este tipo, denominada "distorsión previa de amplitud espectral" (spectral amplitude warping), se incrementan amplitudes espectrales relativamente pequeñas en relación con amplitudes espectrales relativamente intensas para mantener una parte importante de ellas por encima del ruido del cuantificador introducido en el codificador 4 ADPCM. Para modificar el espectro de la señal de esta manera, el procesador 3 previo comprende un dispositivo 7 de procesamiento con una unidad de transformación tiempo a frecuencia para transformar cuadros de muestras de dominio de tiempo de señales de audio al dominio de frecuencia, medios de distorsión previa de la amplitud espectral, y una unidad de transformación de frecuencia a tiempo para transformar las señales de audio distorsionadas previamente desde el dominio de frecuencia al dominio de tiempo. Esta transformación es reversible en el lado del codificador de audio P^{2}MC sin necesidad de que se envíen bits adicionales. Por tanto, el procesador 6 posterior comprende medios 8 de procesamiento con una unidad de transformación tiempo a frecuencia para transformar cuadros de muestras de señales de audio del dominio de tiempo al dominio de frecuencia, medios para deshacer el efecto de la distorsión previa de la amplitud espectral realizado en el procesador previo del lado del codificador y una unidad de transformación de frecuencia a tiempo para transformar las señales de audio no distorsionadas previamente del dominio de frecuencia al dominio de tiempo.
El codificador 4 ADPCM, tal como se ilustra en la figura 2A, comprende un bloque 9 cuantificador, un bloque 10 de adaptación de dimensión de paso, un bloque 11 decodificador y un bloque 12 de predicción. La entrada para el codificador 4 ADPCM es una señal de audio muestreada proporcionada por el procesador 3 previo. Cuando una muestra n tiene un valor s(n), para cada valor s(n) de entrada la diferencia entre este valor y el valor s(n-1) estimado (predicho) se toma como una señal e(n) de error que después se cuantifica y codifica mediante el bloque 9 cuantificador dando lugar al código c(n) de salida. El código c(n) de salida forma un flujo de bits que se envía o transmite y recibe por el decodificador 5 ADPCM del codificador de audio P^{2}MC. Esto se indica en la figura 1 mediante la línea discontinua 13. El código c(n) de salida también se utiliza para la adaptación de la dimensión de paso \Deltan del cuantificador por el bloque 10 y también lo utiliza el bloque 11 decodificador para obtener una señal e'(n) de error cuantificada. La señal e'(n) de error cuantificada se añade al valor s(n-1) predicho que da como resultado el valor s'(n) de entrada cuantificado. El bloque 12 de predicción utiliza el valor s'(n) para adaptar sus coeficientes de predic-
ción.
El decodificador 5 ADPCM es precisamente un subconjunto del decodificador 4; éste lee el código c(n) cuantificado a partir del flujo de bits y utiliza el mismo que el codificador 4 para actualizar sus variables internas. Por tanto, el decodificador ADPCM comprende un bloque 14 de adaptación de dimensión de paso, un bloque 15 decodificador y un bloque 16 de predicción. La salida del bloque 15 decodificador es la señal e'(n) de error cuantificada que, tras añadirse al valor s(n-1) predicho, da la señal s'(n) de audio cuantificada.
Aunque no se indica adicionalmente en las figuras 2A y 2B, la señal CMS de modo códec también forma una señal de entrada para el bloque 11 decodificador en el codificador ADPCM y para el bloque 15 decodificador en el decodificador 5 ADPCM.
En lugar del codificador y el decodificador ADPCM anteriores, también podrán aplicarse otros codificadores y decodificadores.
Tal como ya se ha mencionado en la parte introductoria de la descripción, surgen problemas en relación con la reproducción del carácter de impulso similar de la grabación cercana al micrófono en comparación con la grabación desde una distancia mayor. En las regiones de impulsos similares en la grabación cercana al micrófono, la señal de entrada para el bloque 9 cuantificador se vuelve demasiado alta y demasiado rápida para que el cuantificador adapte su dimensión de paso \Deltan.
Según la invención, la solución a este problema es emplear un filtro de difuminado de fase en el codificador 1 de audio P^{2}CM. Este filtro tiene una característica de todo paso, lo que significa que la energía de la señal permanece invariable para todas las frecuencias. También es fácil de invertir nuevamente a la forma original no filtrada mediante la inversión invertida en el tiempo del mismo filtro en el decodificador 2 de audio P^{2}CM. La figura 1 muestra el filtro 17 de difuminado de fase. La entrada del mismo está formada por las señales de entrada PCM del codificador 1 de audio P^{2}CM, mientras que las señales de salida filtradas se alimentan al bloque 7 de procesamiento. En el filtro 17 de difuminado de fase se lleva a cabo una operación de filtrado de respuesta de impulsos finitos (FIR, Finite Impulse Response) con p(m) como la respuesta de impulsos del filtro, L como la longitud del filtro, s(n) como la señal de entrada y s_{p}(n) como la señal de salida filtra de acuerdo con la relación:
(A)s_{p} (n) = \sum\limits^{L-1}_{m=0} s(n-m) \cdot p(m)
El difuminado de fase inverso se realiza por medio del filtro 18 de difuminado de fase inverso a la salida del bloque 8 de procesamiento en el decodificador 2 de audio P^{2}CM con el mismo filtro, pero con orden temporal inverso según la relación:
(B)s'(n) = \sum\limits^{L-1}_{m=0} s_{p}' (n-m) \cdot p(L-1-m)
donde s_{p}'(n) es la señal de entrada y s'(n) es la señal de salida filtrada. Esta operación dará como resultado un retardo total de la longitud L en la salida. No se desea un largo retardo de procesamiento si el codificador se utiliza para la comunicación, por ejemplo, servicios telefónicos. Por tanto, la longitud L del filtro debe mantenerse lo más reducida posible.
Dado que el filtrado en el dominio de tiempo requiere una longitud del filtro relativamente larga, se prefiere realizar el filtrado en el dominio de frecuencia. A continuación se proporciona un ejemplo de un filtro de difuminado de fase en el que el filtro está construido en el dominio de frecuencia empleando una amplitud constante y una fase variable para cada componente de frecuencia. La respuesta de frecuencia de este filtro está de acuerdo con la relación:
(C)P(k) = exp[- j\pi \cdot k(k - 1/2 \ N) N^{-1}]
\hskip0,5cm
donde
\hskip0,5cm
0 \leq k \leq 1/2 \ N.
Para datos de valor real, el eje de frecuencia negativo debe ser el simétrico:
(D),R\{P(k)\} = R\{P(N-k)\}
\hskip0,5cm
e
\hskip0,5cm
I\{P(k)\} = -I\{P(N-k)\}
\hskip0,5cm
donde
\hskip0,5cm
1/2 \ N < k < N,
donde R e I son respectivamente las partes real e imaginaria del espectro. La transformación en el dominio de tiempo es según la relación:
(E)P(n + 1/2 \ L) = 1/N \cdot \sum\limits^{N-1}_{k=0} P(k) \cdot exp[2\pi jkn/N]
\hskip0,5cm
donde
\hskip0,5cm
-1/2 \ L \leq n < 1/2 \ L.
La longitud N y la longitud L del filtro de la transformada discreta de Fourier (DTF) pueden ajustarse las dos al mismo valor. De hecho, el filtro es una sinusoide con una frecuencia que aumenta de forma lineal entre 0 y la frecuencia f_{N} de Nyquist. Las características del filtro se ilustran en las figuras 3A-3D. La figura 3A muestra la dependencia amplitud - tiempo, la figura 3B, la dependencia amplitud - frecuencia, la figura 3C, la dependencia frecuencia - tiempo y la figura 3D, la relación de la fase no distorsionada previamente respecto a la frecuencia.
Aunque este filtro funciona bastante bien, no es óptimo. Existen dos criterios que han de tenerse en cuenta en el diseño del filtro: uno es que, en general, las frecuencias más bajas en el habla (inferiores a 1 kHz) ya están difuminadas en el tiempo debido a la forma de impulsos glótica. Otro es que para altas frecuencias (superiores a 3 kHz), la energía del habla es relativamente baja. Asimismo, el filtrado paso bajo realizado en múltiples áreas de aplicación, tal como en las conversaciones telefónicas entre 300 y 3400 Hz, sugiere un uso más eficaz de la longitud de filtro disponible mediante la aplicación de más difuminado de fase entre 1 y 3 kHz.
Por tanto, en una realización preferida se utiliza la siguiente respuesta de frecuencia en P^{2}CM para generar el filtro de difuminado de fase:
(F)P(k) = exp[Aj\pi sin(2\pi kN^{-1})
\hskip0,5cm
donde
\hskip0,5cm
0 \leq k \leq 1/2 \ N.
La constante A dependerá del difuminado deseado, concretamente de la longitud del filtro y, por tanto, de la segmentación en ventanas empleada. Las características de un filtro de este tipo se ilustran en las figuras 4A-4D. Estas figuras se corresponden con las figuras 3A-3D.
La longitud de la transformada discreta de Fourier puede estar ajustada a 256. La longitud efectiva del filtro es de aproximadamente 96 (12 milisegundos). Con esta longitud del filtro una elección favorable de la constante A es 6,44. El valor de 96 procede de la diferencia entre la longitud (256) de ventana de entrada empleada y la longitud (160) de ventana de salida del procesador previo y posterior. Esto permite la inclusión del filtro de difuminado de fase dentro del bloque 7 de procesamiento y el filtro inverso en el bloque 8 de procesamiento, como se explicará de forma más detallada a continuación.
La figura 5 muestra un diagrama de bloques de un procesador 3 previo. El procesador previo comprende una unidad 19 de formación de ventanas de entrada, una unidad 20 de transformada rápida de Fourier (FFT), una unidad 21 de filtrado de difuminado de fase y distorsión previa de la amplitud espectral, una unidad 22 de transformada rápida de Fourier inversa (IFFT), una unidad 23 de formación de ventanas de salida y una unidad 24 de solapamiento y adición. En el presente ejemplo, los cuadros de entrada de 80 muestras de la unidad 19 de formación de ventanas de entrada se desplazan en una memoria intermedia de 256 muestras para formar la ventana s(n) de entrada (véase la figura 6). El tipo de ventana de entrada es un rectángulo con la misma longitud que la ventana de entrada, por tanto, no se necesitan operaciones adicionales para la ponderación. El espectro S(k) se calcula empleando una transformada 20 rápida de Fourier de 256 puntos. Tras someter la señal S(k) a un difuminado de fase y una distorsión previa de la amplitud espectral sucesivamente, la señal S_{fw}(k) obtenida se transforma en la transformada 22 rápida de Fourier inversa, obteniendo con ello la representación s_{fw}(n) temporal de esta señal. Para permitir una suave transición entre dos cuadros sucesivos, se utiliza el solapamiento y adición con una ventana de salida Hanning de 20 ms (160 muestras). Esta ventana de salida está centrada dentro de la memoria intermedia FFT de 256 muestras. Se añade un retardo adicional de 32 muestras para obtener un múltiplo de la longitud de cuadro (160 muestras) como el retardo total de este proceso. Este retardo de alineación sólo se necesita para que el procesador previo garantice la segmentación en cuadros sincrónica de los datos entre el procesador previo y el procesador posterior. La construcción del procesador posterior es la misma que el procesador previo con la única diferencia de que en una unidad correspondiente con la unidad 21 se deshace el efecto de la distorsión previa de la amplitud espectral y se aplica sucesivamente un filtro de difuminado de fase inverso. Dado que la distorsión previa de la amplitud espectral y la distorsión previa inversa de la amplitud espectral operan ambas en el dominio de frecuencia, el difuminado de fase y el procesamiento inverso correspondiente también pueden realizarse en el dominio de frecuencia. Aunque una transformación exacta del dominio de tiempo al dominio de frecuencia para la operación del filtro implicaría bloques de procesamiento independientes, ésta puede aproximarse mediante la inclusión dentro del bloque de distorsión previa/distorsión previa inversa existente. De esta manera, no sólo se reduce el tiempo de procesamiento del filtro, también puede eliminarse el retardo de procesamiento adicional. La operación de filtrado del dominio de tiempo de las fórmulas (A) y (B) se sustituye por la operación de filtrado del dominio de frecuencia de las fórmulas (G) para el procesador previo y las fórmulas (H) para el procesador posterior:
\vskip1.000000\baselineskip
R\{S_{p}(k)\} = R\{S(k)\}\cdot R\{P(k)\} - I\{S(k)\}\cdot I\{P(k)\}
(G)I\{S_{p}(k)\} = I\{S(k)\}\cdot R\{P(k)\} - I\{S(k)\}\cdot I\{P(k)\}
y
R\{S_{p}(k)\} = R\{S(k)\}\cdot R\{P(k)\} + I\{S(k)\}\cdot I\{P(k)\}
(H)I\{S_{p}(k)\} = I\{S(k)\}\cdot R\{P(k)\} - R\{S(k)\}\cdot I\{P(k)\}
donde 0 \leq k < 1/2 N.
\vskip1.000000\baselineskip
S(k), P(k) y S_{p}(k) son las transformadas de Fourier de las correspondientes funciones s(n), p(n) y s_{p}(k), respectivamente, en las fórmulas (A) y (B), y R e I son las partes real e imaginaria de estas señales.
Debe aclararse que esta aproximación a los bloques de procesamiento independientes para el filtrado tiene una desventaja: La operación de distorsión previa de la amplitud espectral dentro del procesador previo se realiza utilizando valores de amplitud procedentes de ventanas de entrada no procesadas, mientras que la operación de distorsión previa inversa dentro del procesador posterior se realiza empleando valores de amplitud procedentes de la versión de fase difuminada de esta señal. Si la correlación entre cuadros sucesivos es baja, esto puede introducir artefactos. En la práctica, sin embargo, esta correlación parece suficientemente alta para que la degradación de la calidad debido a esta aproximación siga siendo despreciable.
Otra simplificación se realiza reduciendo el retardo adicional que se añade en la salida del procesador previo. Este retardo se introdujo para sincronizar las entradas para el procesador previo y el procesador posterior. Debido al difuminado de fase insertado, esta sincronización ya no es posible dado que cada uno de los componentes de frecuencia tiene un retardo diferente.
La realización descrita anteriormente se lleva a cabo mediante un algoritmo que puede estar en la forma de un programa informático capaz de ejecutarse en medios de procesamiento de señales en un codificador y decodificador de audio P^{2}CM. En la medida en que partes de las figuras muestran unidades para llevar a cabo ciertas funciones programables, estas unidades deben considerarse como partes secundarias del programa informático.
La invención descrita no está limitada a las realizaciones descritas. Son posibles modificaciones en la misma. Particularmente, puede observarse que las funciones de respuesta de frecuencia y los valores mencionados en las realizaciones descritas sólo son a título ilustrativo; son posibles otras funciones de respuesta de frecuencia y otros valores.

Claims (7)

1. Sistema de codificación del habla con un codificador del habla y un decodificador del habla que actúan conjuntamente con dicho codificador del habla, comprendiendo el codificador del habla un procesador previo y un codificador ADPCM (modulación por codificación de impulsos diferencial adaptativa) con un cuantificador y medios de adaptación de dimensión de paso, y comprendiendo el decodificador del habla un decodificador ADPCM con medios de adaptación de dimensión de paso similares a los del codificador ADPCM y un procesador posterior, caracterizado porque el procesador previo está dotado de medios de filtrado de difuminado de fase para suavizar el efecto de los cambios de energía altos y/o rápidos en la entrada del cuantificador, y el procesador posterior está dotado de medios de filtrado inversos a dichos medios de filtrado de difuminado de fase.
2. Sistema de codificación del habla según la reivindicación 1, caracterizado porque el procesador previo y el procesador posterior comprenden una unidad de transformación tiempo a frecuencia para transformar cuadros de muestras de señales de audio del dominio de tiempo al dominio de frecuencia, medios de procesamiento para procesar las muestras en el dominio de frecuencia y una unidad de transformación de frecuencia a tiempo para transformar las últimas muestras procesadas al dominio de tiempo. Estando dotados los medios de procesamiento en el procesador previo de medios de filtrado de difuminado de fase y de distorsión previa, y estando dotados los medios de procesamiento en el procesador posterior de medios de distorsión previa inversa y difuminado de fase inverso.
3. Sistema de codificación del habla según la reivindicación 2, caracterizado porque los medios de filtrado de difuminado de fase comprenden un filtro con una característica de amplitud fundamentalmente constante y una característica de fase variable ambas en el dominio de frecuencia.
4. Sistema de codificación del habla según la reivindicación 2 ó 3, caracterizado porque en el procesador previo los medios de filtrado y los medios de distorsión previa están acoplados unos tras otros.
5. Sistema de codificación del habla según la reivindicación 2, 3 ó 4, caracterizado porque en el procesador posterior los medios de distorsión previa inversa y los medios de filtrado inversos están acoplados unos tras otros.
6. Sistema de codificación del habla según cualquiera de las reivindicaciones precedentes, caracterizado porque la respuesta de frecuencia de los medios de filtrado de difuminado de fase es según la relación
P(k) = exp[- j\pi \cdot k(k - 1/2 \ N)N^{-1}]
\hskip0,5cm
donde
\hskip0,5cm
0 \leq k \leq 1/2 \ N.
7. Sistema de codificación del habla según cualquiera de las reivindicaciones 1 - 5, caracterizado porque la respuesta de frecuencia del filtrado de difuminado de fase está de acuerdo con la relación:
P(k) = exp[Aj\pi sin(2\pi kN^{-1})
\hskip0,5cm
donde
\hskip0,5cm
0 \leq k \leq 1/2 \ N
y A es una constante dependiente del difuminado deseado.
ES02708594T 2001-04-09 2002-03-27 Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso. Expired - Lifetime ES2261637T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP01201301 2001-04-09
EP01201301 2001-04-09

Publications (1)

Publication Number Publication Date
ES2261637T3 true ES2261637T3 (es) 2006-11-16

Family

ID=8180123

Family Applications (1)

Application Number Title Priority Date Filing Date
ES02708594T Expired - Lifetime ES2261637T3 (es) 2001-04-09 2002-03-27 Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso.

Country Status (9)

Country Link
US (1) US20020173949A1 (es)
EP (1) EP1395982B1 (es)
JP (1) JP2004519736A (es)
KR (1) KR20030009517A (es)
CN (1) CN1221941C (es)
AT (1) ATE323935T1 (es)
DE (1) DE60210766T2 (es)
ES (1) ES2261637T3 (es)
WO (1) WO2002082426A1 (es)

Families Citing this family (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
TWI226035B (en) * 2003-10-16 2005-01-01 Elan Microelectronics Corp Method and system improving step adaptation of ADPCM voice coding
EP1846920B1 (en) 2005-01-31 2017-04-19 Skype Method for generating concealment frames in communication system
TWI285568B (en) * 2005-02-02 2007-08-21 Dowa Mining Co Powder of silver particles and process
ES2332108T3 (es) * 2005-07-14 2010-01-26 Koninklijke Philips Electronics N.V. Sintesis de señal de audio.
AU2010233863B2 (en) 2009-04-08 2013-09-26 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus, method and computer program for upmixing a downmix audio signal using a phase value smoothing

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5558612A (en) * 1978-10-26 1980-05-01 Kokusai Denshin Denwa Co Ltd <Kdd> Delay circuit
JPS587935A (ja) * 1981-07-07 1983-01-17 Kokusai Denshin Denwa Co Ltd <Kdd> トランスバーサル形スミアデスミアフイルタ
NL8700075A (nl) * 1987-01-14 1988-08-01 Philips Nv Datatransmissiestelsel voorzien van versmeringsfilters.
US5231484A (en) * 1991-11-08 1993-07-27 International Business Machines Corporation Motion video compression system with adaptive bit allocation and quantization
US5511095A (en) * 1992-04-15 1996-04-23 Sanyo Electric Co., Ltd. Audio signal coding and decoding device
US5754974A (en) * 1995-02-22 1998-05-19 Digital Voice Systems, Inc Spectral magnitude representation for multi-band excitation speech coders
US5956674A (en) * 1995-12-01 1999-09-21 Digital Theater Systems, Inc. Multi-channel predictive subband audio coder using psychoacoustic adaptive bit allocation in frequency, time and over the multiple channels
AU3372199A (en) * 1998-03-30 1999-10-18 Voxware, Inc. Low-complexity, low-delay, scalable and embedded speech and audio coding with adaptive frame loss concealment

Also Published As

Publication number Publication date
EP1395982A1 (en) 2004-03-10
KR20030009517A (ko) 2003-01-29
CN1221941C (zh) 2005-10-05
DE60210766T2 (de) 2007-02-08
WO2002082426A1 (en) 2002-10-17
DE60210766D1 (de) 2006-05-24
ATE323935T1 (de) 2006-05-15
EP1395982B1 (en) 2006-04-19
US20020173949A1 (en) 2002-11-21
CN1461469A (zh) 2003-12-10
JP2004519736A (ja) 2004-07-02

Similar Documents

Publication Publication Date Title
ES2340975T3 (es) Metodo y aparato para obtener un factor de atenuacion.
US20230197089A1 (en) Harmonic transposition in an audio coding method and system
US8738385B2 (en) Pitch-based pre-filtering and post-filtering for compression of audio signals
US7379866B2 (en) Simple noise suppression model
US6144937A (en) Noise suppression of speech by signal processing including applying a transform to time domain input sequences of digital signals representing audio information
RU2419171C2 (ru) Способ переключения скорости передачи битов при аудиодекодировании с масштабированием скорости передачи битов и масштабированием полосы пропускания
EP1356454B1 (en) Wideband signal transmission system
JP6271531B2 (ja) デジタル音声信号における効果的なプレエコー減衰
BRPI0311314B1 (pt) Método e dispositivo para aperfeiçoamento da altura de som seletivo por freqüência de fala sintetizada
BRPI0116844B1 (pt) Processo e dispositivo de redução de ruído
US20110054889A1 (en) Enhancing Receiver Intelligibility in Voice Communication Devices
Makhoul et al. Time-scale modification in medium to low rate speech coding
US20030065507A1 (en) Network unit and a method for modifying a digital signal in the coded domain
EP1190495A1 (en) Coded domain echo control
JP2003533902A5 (es)
CN101595523A (zh) 信号处理装置和方法以及程序
WO1998006090A1 (en) Speech/audio coding with non-linear spectral-amplitude transformation
EP1395982B1 (en) Adpcm speech coding system with phase-smearing and phase-desmearing filters
US6141639A (en) Method and apparatus for coding of signals containing speech and background noise
JP6718670B2 (ja) Adpcmコーデックでのパケット損失隠蔽方法及びplc回路を備えるadpcm復号器
JP2016105168A5 (es)
WO2008086920A1 (en) Disturbance reduction in digital signal processing