ES2261637T3 - Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso. - Google Patents
Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso.Info
- Publication number
- ES2261637T3 ES2261637T3 ES02708594T ES02708594T ES2261637T3 ES 2261637 T3 ES2261637 T3 ES 2261637T3 ES 02708594 T ES02708594 T ES 02708594T ES 02708594 T ES02708594 T ES 02708594T ES 2261637 T3 ES2261637 T3 ES 2261637T3
- Authority
- ES
- Spain
- Prior art keywords
- speech
- processor
- encoder
- phase
- coding system
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000003874 inverse correlation nuclear magnetic resonance spectroscopy Methods 0.000 title 1
- 238000001914 filtration Methods 0.000 claims abstract description 22
- 230000006978 adaptation Effects 0.000 claims abstract description 9
- 230000000694 effects Effects 0.000 claims abstract description 8
- 230000003044 adaptive effect Effects 0.000 claims abstract description 4
- 238000012545 processing Methods 0.000 claims description 19
- 230000009466 transformation Effects 0.000 claims description 12
- 230000004044 response Effects 0.000 claims description 9
- 230000005236 sound signal Effects 0.000 claims description 6
- 238000000034 method Methods 0.000 claims description 5
- 230000008569 process Effects 0.000 claims description 5
- 230000001419 dependent effect Effects 0.000 claims 1
- 230000001131 transforming effect Effects 0.000 claims 1
- 230000003595 spectral effect Effects 0.000 description 16
- 230000002441 reversible effect Effects 0.000 description 11
- 238000001228 spectrum Methods 0.000 description 5
- 238000010586 diagram Methods 0.000 description 4
- 230000015572 biosynthetic process Effects 0.000 description 3
- 230000002123 temporal effect Effects 0.000 description 3
- IAZDPXIOMUYVGZ-UHFFFAOYSA-N Dimethylsulphoxide Chemical compound CS(C)=O IAZDPXIOMUYVGZ-UHFFFAOYSA-N 0.000 description 2
- 238000013459 approach Methods 0.000 description 2
- 238000004590 computer program Methods 0.000 description 2
- 230000011218 segmentation Effects 0.000 description 2
- 101000802640 Homo sapiens Lactosylceramide 4-alpha-galactosyltransferase Proteins 0.000 description 1
- 102100035838 Lactosylceramide 4-alpha-galactosyltransferase Human genes 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 238000004891 communication Methods 0.000 description 1
- 238000010276 construction Methods 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 238000013461 design Methods 0.000 description 1
- 230000002349 favourable effect Effects 0.000 description 1
- 238000012986 modification Methods 0.000 description 1
- 230000004048 modification Effects 0.000 description 1
- 238000007781 pre-processing Methods 0.000 description 1
- 238000005316 response function Methods 0.000 description 1
- 238000005070 sampling Methods 0.000 description 1
- 238000007493 shaping process Methods 0.000 description 1
- 230000001360 synchronised effect Effects 0.000 description 1
- 238000012546 transfer Methods 0.000 description 1
- 230000007704 transition Effects 0.000 description 1
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04B—TRANSMISSION
- H04B14/00—Transmission systems not characterised by the medium used for transmission
- H04B14/02—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation
- H04B14/04—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation using pulse code modulation
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04B—TRANSMISSION
- H04B1/00—Details of transmission systems, not covered by a single one of groups H04B3/00 - H04B13/00; Details of transmission systems not characterised by the medium used for transmission
- H04B1/66—Details of transmission systems, not covered by a single one of groups H04B3/00 - H04B13/00; Details of transmission systems not characterised by the medium used for transmission for reducing bandwidth of signals; for improving efficiency of transmission
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/26—Pre-filtering or post-filtering
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04B—TRANSMISSION
- H04B14/00—Transmission systems not characterised by the medium used for transmission
- H04B14/02—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation
- H04B14/06—Transmission systems not characterised by the medium used for transmission characterised by the use of pulse modulation using differential modulation, e.g. delta modulation
Landscapes
- Engineering & Computer Science (AREA)
- Signal Processing (AREA)
- Computer Networks & Wireless Communication (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Magnetic Resonance Imaging Apparatus (AREA)
Abstract
Sistema de codificación del habla con un codificador del habla y un decodificador del habla que actúan conjuntamente con dicho codificador del habla, comprendiendo el codificador del habla un procesador previo y un codificador ADPCM (modulación por codificación de impulsos diferencial adaptativa) con un cuantificador y medios de adaptación de dimensión de paso, y comprendiendo el decodificador del habla un decodificador ADPCM con medios de adaptación de dimensión de paso similares a los del codificador ADPCM y un procesador posterior, caracterizado porque el procesador previo está dotado de medios de filtrado de difuminado de fase para suavizar el efecto de los cambios de energía altos y / o rápidos en la entrada del cuantificador, y el procesador posterior está dotado de medios de filtrado inversos a dichos medios de filtrado de difuminado de fase.
Description
Sistema de codificación del habla ADPCM, con
filtros de difuminado de fase y difuminado de fase inverso.
La presente invención se refiere a un sistema de
codificación del habla con un codificador del habla y un
decodificador del habla que actúa conjuntamente con dicho
codificador del habla, comprendiendo el codificador del habla un
procesador previo y un codificador ADPCM (Adaptative Differential
Pulse Code Modulation, modulación por codificación de impulsos
diferencial adaptativa) con un cuantificador y medios de adaptación
de dimensión de paso, y comprendiendo el decodificador del habla un
decodificador ADPCM con medios de adaptación de dimensión de paso
similares a los del codificador ADPCM, y un procesador
posterior.
Se ha observado que las grabaciones de voz
cercanas al micrófono reducen o eliminan el efecto de la acústica
de la sala en una señal de voz al minimizar la distancia de la
fuente de voz (la boca) respecto al micrófono, tal como en un
microteléfono. Cuando estas señales de voz se procesan en el
codificador de un sistema de codificación de audio estándar
P^{2}CM, es decir, un codificador ADCM procesado previamente,
surgen problemas en relación con la reproducción del impulso como
carácter de la grabación de voz cercana al micrófono en comparación
con la grabación desde una distancia mayor. Un codificador ADPCM
está dotado de un cuantificador en el que la señal de entrada del
mismo, es decir, la diferencia entre una señal de entrada de audio
muestreada y un valor cuantificado y predicho de la misma, se
cuantifica con una dimensión de paso que está adaptada a la señal de
entrada del cuantificador. En las regiones de impulsos similares en
la grabación de voz cercana al micrófono, la señal de entrada para
el cuantificador en el codificador ADPCM puede ser demasiado alta y
demasiado rápida para que el cuantificador adapte su dimensión de
paso. Las reverberaciones en la sala difuminan la energía de la
señal de voz respecto al tiempo, permitiendo una adaptación más
lenta de la dimensión de paso.
Por tanto, para mejorar el rendimiento del
sistema de codificación de audio P^{2}CM para las señales de
impulsos similares, la señal de entrada del codificador ADPCM ha de
procesarse de tal manera que la entrada para el cuantificador esté
libre de incrementos rápidos de energía en breves marcos de tiempo.
No obstante, la salida del decodificador de habla debería sonar
como el original, sin ningún artefacto. Por tanto, la opción de
simular el efecto de la sala para producir una versión distante de
la grabación original y aplicar la codificación a esta señal no es
suficientemente buena.
El objetivo de la invención es mitigar el
problema anterior y proporcionar un sistema de codificación del
habla con una grabación y reproducción mejoradas, particularmente
para señales de voz de impulsos similares.
Según la invención, el sistema de codificación
del habla, tal como se ha descrito en el párrafo introductorio, se
caracteriza porque el procesador previo está dotado de medios de
filtrado del difuminado de fase (phase-smearing)
para suavizar el efecto de cambios altos y/o rápidos de energía en
la entrada del cuantificador y el procesador posterior está dotado
de medios de filtrado inversos a dichos medios de filtrado del
difuminado de fase.
Aunque el filtrado del difuminado de fase puede
realizarse en el dominio temporal, se prefiere realizar este
filtrado, en el caso de que el procesador previo y el procesador
posterior estén dotados de medios de distorsión previa de la
amplitud espectral y medios para deshacer el efecto de una
distorsión previa de este tipo, respectivamente, en el dominio de
frecuencia dado que dichos medios de distorsión previa e inversión
de la distorsión previa pueden operar en el dominio de frecuencia.
Por tanto, particularmente, el difuminado de fase y la distorsión
previa se llevan a cabo en el mismo bloque de procesamiento, así
como también el difuminado de fase inverso y la distorsión previa
inversa. Dado que el difuminado de fase es un proceso lineal
mientras que la distorsión previa de la amplitud espectral es un
proceso no lineal, los dos procesos no están integrados entre sí,
sino que se realizan uno tras el otro en el dominio de frecuencia;
las señales filtradas se someten a la distorsión previa. La
distorsión previa de la amplitud espectral es conocida en sí misma;
véase R. Lefebre, C. Laflamme; "Spectral Amplitude Warping (SAW)
for Noise Spectrum Shaping in Audio Coding", ICASSP, núm. 1, pp.
335-338, 1997.
Estos y otros aspectos de la invención
resultarán evidentes y se dilucidarán en relación con el dibujo y la
realización descrita a continuación. En el dibujo:
la figura 1 muestra un diagrama de bloques de un
sistema de codificación P^{2}CM con medios para el procesamiento
previo y posterior, incluyendo medios de filtrado de difuminado de
fase y medios de filtrado de difuminado de fase inversos,
respectivamente, que pueden operar en el dominio de tiempo;
las figuras 2A, 2B son diagramas de bloques de
un codificador ADPCM y un decodificador ADPCM, respectivamente;
las figuras 3A-3D muestran
varias características de una primera realización de un filtro de
difuminado de fase;
las figuras 4A-4D muestran
varias características de una segunda realización de un filtro de
difuminado de fase;
la figura 5 es un diagrama de bloques de un
procesador previo/posterior para un codificador y decodificador de
audio P^{2}CM en el que el difuminado de fase puede operarse en el
dominio de frecuencia; y
la figura 6 muestra la representación en cuadros
y ventanas del procesador previo.
El sistema de codificación de audio P^{2}CM en
la figura 1 está constituido por un codificador 1 y un decodificador
2. El codificador 1 comprende un procesador 3 previo y un
codificador 4 ADPCM, mientras que el decodificador 2 está dotado de
un decodificador 5 ADPCM y un procesador 6 posterior. El codificador
4 ADPCM se ilustra en la figura 2A y el decodificador 5 ADPCM en la
figura 2B.
Como ejemplo, en el codificador 1 de audio
P^{2}CM una señal de entrada PCM se segmenta en cuadros de, por
ejemplo, 10 milisegundos. Con una secuencia de muestreo de, por
ejemplo, 8 kHZ, un cuadro se compone de 80 muestras. Cada muestra
se representa por 16 bits, por ejemplo. Esta señal de entrada se
alimenta al procesador 3 previo, mientras que la señal de salida
obtenida como respuesta a la misma se alimenta al codificador 4
ADPCM. Una señal de entrada adicional para el codificador 4 ADPCM se
forma mediante un señal de modo códec (CMS, codec mode signal) que
determina la asignación de bits para las palabras de código en la
salida del flujo de bits del codificador 4 ADPCM. El codificador 4
ADPCM produce una palabra de código para cada muestra en el cuadro
de señal previamente procesada. Las palabras de código se empaquetan
entonces en cuadros, en el presente ejemplo, de 80 códigos.
Dependiendo del modo códec elegido, el flujo de bits resultante
tiene una tasa de transferencia de bits de, por ejemplo, 11,2, 12,8,
16, 19,2, 21,6, 24 o 32 kbits/s.
En el decodificador 2 de audio P^{2}CM, la
entrada del codificador ADPCM se forma por un flujo de bits de
cuadros de código y el modo códec. En el presente ejemplo, los
cuadros de código consisten en 80 códigos que se decodifican
mediante el decodificador 5 ADPCM para formar un cuadro de salida
PCM de 80 muestras que se someten a un procesamiento posterior en
el procesador 6 posterior.
En el procesador 3 previo las características de
la señal se modifican de tal manera que la señal resultante está
mejor adaptada para la codificación. El procesamiento previo
modifica el espectro de la señal antes de la codificación. Por
tanto, una transformación no lineal, por ejemplo, una transformación
por raíz cuadrada, puede aplicarse a las amplitudes espectrales.
Mediante una transformación de este tipo, denominada "distorsión
previa de amplitud espectral" (spectral amplitude warping), se
incrementan amplitudes espectrales relativamente pequeñas en
relación con amplitudes espectrales relativamente intensas para
mantener una parte importante de ellas por encima del ruido del
cuantificador introducido en el codificador 4 ADPCM. Para modificar
el espectro de la señal de esta manera, el procesador 3 previo
comprende un dispositivo 7 de procesamiento con una unidad de
transformación tiempo a frecuencia para transformar cuadros de
muestras de dominio de tiempo de señales de audio al dominio de
frecuencia, medios de distorsión previa de la amplitud espectral, y
una unidad de transformación de frecuencia a tiempo para transformar
las señales de audio distorsionadas previamente desde el dominio de
frecuencia al dominio de tiempo. Esta transformación es reversible
en el lado del codificador de audio P^{2}MC sin necesidad de que
se envíen bits adicionales. Por tanto, el procesador 6 posterior
comprende medios 8 de procesamiento con una unidad de transformación
tiempo a frecuencia para transformar cuadros de muestras de señales
de audio del dominio de tiempo al dominio de frecuencia, medios para
deshacer el efecto de la distorsión previa de la amplitud espectral
realizado en el procesador previo del lado del codificador y una
unidad de transformación de frecuencia a tiempo para transformar las
señales de audio no distorsionadas previamente del dominio de
frecuencia al dominio de tiempo.
El codificador 4 ADPCM, tal como se ilustra en
la figura 2A, comprende un bloque 9 cuantificador, un bloque 10 de
adaptación de dimensión de paso, un bloque 11 decodificador y un
bloque 12 de predicción. La entrada para el codificador 4 ADPCM es
una señal de audio muestreada proporcionada por el procesador 3
previo. Cuando una muestra n tiene un valor s(n), para cada
valor s(n) de entrada la diferencia entre este valor y el
valor s(n-1) estimado (predicho) se toma como
una señal e(n) de error que después se cuantifica y codifica
mediante el bloque 9 cuantificador dando lugar al código c(n)
de salida. El código c(n) de salida forma un flujo de bits
que se envía o transmite y recibe por el decodificador 5 ADPCM del
codificador de audio P^{2}MC. Esto se indica en la figura 1
mediante la línea discontinua 13. El código c(n) de salida
también se utiliza para la adaptación de la dimensión de paso
\Deltan del cuantificador por el bloque 10 y también lo utiliza el
bloque 11 decodificador para obtener una señal e'(n) de error
cuantificada. La señal e'(n) de error cuantificada se añade al valor
s(n-1) predicho que da como resultado el
valor s'(n) de entrada cuantificado. El bloque 12 de predicción
utiliza el valor s'(n) para adaptar sus coeficientes de
predic-
ción.
ción.
El decodificador 5 ADPCM es precisamente un
subconjunto del decodificador 4; éste lee el código c(n)
cuantificado a partir del flujo de bits y utiliza el mismo que el
codificador 4 para actualizar sus variables internas. Por tanto, el
decodificador ADPCM comprende un bloque 14 de adaptación de
dimensión de paso, un bloque 15 decodificador y un bloque 16 de
predicción. La salida del bloque 15 decodificador es la señal e'(n)
de error cuantificada que, tras añadirse al valor
s(n-1) predicho, da la señal s'(n) de audio
cuantificada.
Aunque no se indica adicionalmente en las
figuras 2A y 2B, la señal CMS de modo códec también forma una señal
de entrada para el bloque 11 decodificador en el codificador ADPCM y
para el bloque 15 decodificador en el decodificador 5 ADPCM.
En lugar del codificador y el decodificador
ADPCM anteriores, también podrán aplicarse otros codificadores y
decodificadores.
Tal como ya se ha mencionado en la parte
introductoria de la descripción, surgen problemas en relación con
la reproducción del carácter de impulso similar de la grabación
cercana al micrófono en comparación con la grabación desde una
distancia mayor. En las regiones de impulsos similares en la
grabación cercana al micrófono, la señal de entrada para el bloque 9
cuantificador se vuelve demasiado alta y demasiado rápida para que
el cuantificador adapte su dimensión de paso \Deltan.
Según la invención, la solución a este problema
es emplear un filtro de difuminado de fase en el codificador 1 de
audio P^{2}CM. Este filtro tiene una característica de todo paso,
lo que significa que la energía de la señal permanece invariable
para todas las frecuencias. También es fácil de invertir nuevamente
a la forma original no filtrada mediante la inversión invertida en
el tiempo del mismo filtro en el decodificador 2 de audio
P^{2}CM. La figura 1 muestra el filtro 17 de difuminado de fase.
La entrada del mismo está formada por las señales de entrada PCM
del codificador 1 de audio P^{2}CM, mientras que las señales de
salida filtradas se alimentan al bloque 7 de procesamiento. En el
filtro 17 de difuminado de fase se lleva a cabo una operación de
filtrado de respuesta de impulsos finitos (FIR, Finite Impulse
Response) con p(m) como la respuesta de impulsos del filtro,
L como la longitud del filtro, s(n) como la señal de entrada
y s_{p}(n) como la señal de salida filtra de acuerdo con la
relación:
(A)s_{p} (n) =
\sum\limits^{L-1}_{m=0}
s(n-m) \cdot
p(m)
El difuminado de fase inverso se realiza por
medio del filtro 18 de difuminado de fase inverso a la salida del
bloque 8 de procesamiento en el decodificador 2 de audio P^{2}CM
con el mismo filtro, pero con orden temporal inverso según la
relación:
(B)s'(n) =
\sum\limits^{L-1}_{m=0} s_{p}' (n-m)
\cdot
p(L-1-m)
donde s_{p}'(n) es la señal de
entrada y s'(n) es la señal de salida filtrada. Esta operación dará
como resultado un retardo total de la longitud L en la salida. No
se desea un largo retardo de procesamiento si el codificador se
utiliza para la comunicación, por ejemplo, servicios telefónicos.
Por tanto, la longitud L del filtro debe mantenerse lo más reducida
posible.
Dado que el filtrado en el dominio de tiempo
requiere una longitud del filtro relativamente larga, se prefiere
realizar el filtrado en el dominio de frecuencia. A continuación se
proporciona un ejemplo de un filtro de difuminado de fase en el que
el filtro está construido en el dominio de frecuencia empleando una
amplitud constante y una fase variable para cada componente de
frecuencia. La respuesta de frecuencia de este filtro está de
acuerdo con la relación:
(C)P(k)
= exp[- j\pi \cdot k(k - 1/2 \ N) N^{-1}]
\hskip0,5cmdonde
\hskip0,5cm0 \leq k \leq 1/2 \ N.
Para datos de valor real, el eje de frecuencia
negativo debe ser el simétrico:
(D),R\{P(k)\} =
R\{P(N-k)\}
\hskip0,5cme
\hskip0,5cmI\{P(k)\} = -I\{P(N-k)\}
\hskip0,5cmdonde
\hskip0,5cm1/2 \ N < k < N,
donde R e I son respectivamente las
partes real e imaginaria del espectro. La transformación en el
dominio de tiempo es según la
relación:
(E)P(n
+ 1/2 \ L) = 1/N \cdot \sum\limits^{N-1}_{k=0}
P(k) \cdot exp[2\pi jkn/N]
\hskip0,5cmdonde
\hskip0,5cm-1/2 \ L \leq n < 1/2 \ L.
La longitud N y la longitud L del filtro de la
transformada discreta de Fourier (DTF) pueden ajustarse las dos al
mismo valor. De hecho, el filtro es una sinusoide con una frecuencia
que aumenta de forma lineal entre 0 y la frecuencia f_{N} de
Nyquist. Las características del filtro se ilustran en las figuras
3A-3D. La figura 3A muestra la dependencia amplitud
- tiempo, la figura 3B, la dependencia amplitud - frecuencia, la
figura 3C, la dependencia frecuencia - tiempo y la figura 3D, la
relación de la fase no distorsionada previamente respecto a la
frecuencia.
Aunque este filtro funciona bastante bien, no es
óptimo. Existen dos criterios que han de tenerse en cuenta en el
diseño del filtro: uno es que, en general, las frecuencias más bajas
en el habla (inferiores a 1 kHz) ya están difuminadas en el tiempo
debido a la forma de impulsos glótica. Otro es que para altas
frecuencias (superiores a 3 kHz), la energía del habla es
relativamente baja. Asimismo, el filtrado paso bajo realizado en
múltiples áreas de aplicación, tal como en las conversaciones
telefónicas entre 300 y 3400 Hz, sugiere un uso más eficaz de la
longitud de filtro disponible mediante la aplicación de más
difuminado de fase entre 1 y 3 kHz.
Por tanto, en una realización preferida se
utiliza la siguiente respuesta de frecuencia en P^{2}CM para
generar el filtro de difuminado de fase:
(F)P(k)
= exp[Aj\pi sin(2\pi kN^{-1})
\hskip0,5cmdonde
\hskip0,5cm0 \leq k \leq 1/2 \ N.
La constante A dependerá del difuminado deseado,
concretamente de la longitud del filtro y, por tanto, de la
segmentación en ventanas empleada. Las características de un filtro
de este tipo se ilustran en las figuras 4A-4D. Estas
figuras se corresponden con las figuras 3A-3D.
La longitud de la transformada discreta de
Fourier puede estar ajustada a 256. La longitud efectiva del filtro
es de aproximadamente 96 (12 milisegundos). Con esta longitud del
filtro una elección favorable de la constante A es 6,44. El valor de
96 procede de la diferencia entre la longitud (256) de ventana de
entrada empleada y la longitud (160) de ventana de salida del
procesador previo y posterior. Esto permite la inclusión del filtro
de difuminado de fase dentro del bloque 7 de procesamiento y el
filtro inverso en el bloque 8 de procesamiento, como se explicará de
forma más detallada a continuación.
La figura 5 muestra un diagrama de bloques de un
procesador 3 previo. El procesador previo comprende una unidad 19 de
formación de ventanas de entrada, una unidad 20 de transformada
rápida de Fourier (FFT), una unidad 21 de filtrado de difuminado de
fase y distorsión previa de la amplitud espectral, una unidad 22 de
transformada rápida de Fourier inversa (IFFT), una unidad 23 de
formación de ventanas de salida y una unidad 24 de solapamiento y
adición. En el presente ejemplo, los cuadros de entrada de 80
muestras de la unidad 19 de formación de ventanas de entrada se
desplazan en una memoria intermedia de 256 muestras para formar la
ventana s(n) de entrada (véase la figura 6). El tipo de
ventana de entrada es un rectángulo con la misma longitud que la
ventana de entrada, por tanto, no se necesitan operaciones
adicionales para la ponderación. El espectro S(k) se calcula
empleando una transformada 20 rápida de Fourier de 256 puntos. Tras
someter la señal S(k) a un difuminado de fase y una
distorsión previa de la amplitud espectral sucesivamente, la señal
S_{fw}(k) obtenida se transforma en la transformada 22
rápida de Fourier inversa, obteniendo con ello la representación
s_{fw}(n) temporal de esta señal. Para permitir una suave
transición entre dos cuadros sucesivos, se utiliza el solapamiento y
adición con una ventana de salida Hanning de 20 ms (160 muestras).
Esta ventana de salida está centrada dentro de la memoria intermedia
FFT de 256 muestras. Se añade un retardo adicional de 32 muestras
para obtener un múltiplo de la longitud de cuadro (160 muestras)
como el retardo total de este proceso. Este retardo de alineación
sólo se necesita para que el procesador previo garantice la
segmentación en cuadros sincrónica de los datos entre el procesador
previo y el procesador posterior. La construcción del procesador
posterior es la misma que el procesador previo con la única
diferencia de que en una unidad correspondiente con la unidad 21 se
deshace el efecto de la distorsión previa de la amplitud espectral y
se aplica sucesivamente un filtro de difuminado de fase inverso.
Dado que la distorsión previa de la amplitud espectral y la
distorsión previa inversa de la amplitud espectral operan ambas en
el dominio de frecuencia, el difuminado de fase y el procesamiento
inverso correspondiente también pueden realizarse en el dominio de
frecuencia. Aunque una transformación exacta del dominio de tiempo
al dominio de frecuencia para la operación del filtro implicaría
bloques de procesamiento independientes, ésta puede aproximarse
mediante la inclusión dentro del bloque de distorsión
previa/distorsión previa inversa existente. De esta manera, no sólo
se reduce el tiempo de procesamiento del filtro, también puede
eliminarse el retardo de procesamiento adicional. La operación de
filtrado del dominio de tiempo de las fórmulas (A) y (B) se
sustituye por la operación de filtrado del dominio de frecuencia de
las fórmulas (G) para el procesador previo y las fórmulas (H) para
el procesador posterior:
\vskip1.000000\baselineskip
R\{S_{p}(k)\}
= R\{S(k)\}\cdot R\{P(k)\} - I\{S(k)\}\cdot
I\{P(k)\}
(G)I\{S_{p}(k)\} =
I\{S(k)\}\cdot R\{P(k)\} - I\{S(k)\}\cdot
I\{P(k)\}
y
R\{S_{p}(k)\}
= R\{S(k)\}\cdot R\{P(k)\} + I\{S(k)\}\cdot
I\{P(k)\}
(H)I\{S_{p}(k)\} =
I\{S(k)\}\cdot R\{P(k)\} - R\{S(k)\}\cdot
I\{P(k)\}
donde 0 \leq k < 1/2
N.
\vskip1.000000\baselineskip
S(k), P(k) y S_{p}(k) son
las transformadas de Fourier de las correspondientes funciones
s(n), p(n) y s_{p}(k), respectivamente, en
las fórmulas (A) y (B), y R e I son las partes real e imaginaria de
estas señales.
Debe aclararse que esta aproximación a los
bloques de procesamiento independientes para el filtrado tiene una
desventaja: La operación de distorsión previa de la amplitud
espectral dentro del procesador previo se realiza utilizando
valores de amplitud procedentes de ventanas de entrada no
procesadas, mientras que la operación de distorsión previa inversa
dentro del procesador posterior se realiza empleando valores de
amplitud procedentes de la versión de fase difuminada de esta señal.
Si la correlación entre cuadros sucesivos es baja, esto puede
introducir artefactos. En la práctica, sin embargo, esta correlación
parece suficientemente alta para que la degradación de la calidad
debido a esta aproximación siga siendo despreciable.
Otra simplificación se realiza reduciendo el
retardo adicional que se añade en la salida del procesador previo.
Este retardo se introdujo para sincronizar las entradas para el
procesador previo y el procesador posterior. Debido al difuminado de
fase insertado, esta sincronización ya no es posible dado que cada
uno de los componentes de frecuencia tiene un retardo diferente.
La realización descrita anteriormente se lleva a
cabo mediante un algoritmo que puede estar en la forma de un
programa informático capaz de ejecutarse en medios de procesamiento
de señales en un codificador y decodificador de audio P^{2}CM. En
la medida en que partes de las figuras muestran unidades para llevar
a cabo ciertas funciones programables, estas unidades deben
considerarse como partes secundarias del programa informático.
La invención descrita no está limitada a las
realizaciones descritas. Son posibles modificaciones en la misma.
Particularmente, puede observarse que las funciones de respuesta de
frecuencia y los valores mencionados en las realizaciones descritas
sólo son a título ilustrativo; son posibles otras funciones de
respuesta de frecuencia y otros valores.
Claims (7)
1. Sistema de codificación del habla con un
codificador del habla y un decodificador del habla que actúan
conjuntamente con dicho codificador del habla, comprendiendo el
codificador del habla un procesador previo y un codificador ADPCM
(modulación por codificación de impulsos diferencial adaptativa) con
un cuantificador y medios de adaptación de dimensión de paso, y
comprendiendo el decodificador del habla un decodificador ADPCM con
medios de adaptación de dimensión de paso similares a los del
codificador ADPCM y un procesador posterior, caracterizado
porque el procesador previo está dotado de medios de filtrado de
difuminado de fase para suavizar el efecto de los cambios de energía
altos y/o rápidos en la entrada del cuantificador, y el procesador
posterior está dotado de medios de filtrado inversos a dichos medios
de filtrado de difuminado de fase.
2. Sistema de codificación del habla según la
reivindicación 1, caracterizado porque el procesador previo
y el procesador posterior comprenden una unidad de transformación
tiempo a frecuencia para transformar cuadros de muestras de señales
de audio del dominio de tiempo al dominio de frecuencia, medios de
procesamiento para procesar las muestras en el dominio de frecuencia
y una unidad de transformación de frecuencia a tiempo para
transformar las últimas muestras procesadas al dominio de tiempo.
Estando dotados los medios de procesamiento en el procesador previo
de medios de filtrado de difuminado de fase y de distorsión previa,
y estando dotados los medios de procesamiento en el procesador
posterior de medios de distorsión previa inversa y difuminado de
fase inverso.
3. Sistema de codificación del habla según la
reivindicación 2, caracterizado porque los medios de
filtrado de difuminado de fase comprenden un filtro con una
característica de amplitud fundamentalmente constante y una
característica de fase variable ambas en el dominio de
frecuencia.
4. Sistema de codificación del habla según la
reivindicación 2 ó 3, caracterizado porque en el procesador
previo los medios de filtrado y los medios de distorsión previa
están acoplados unos tras otros.
5. Sistema de codificación del habla según la
reivindicación 2, 3 ó 4, caracterizado porque en el
procesador posterior los medios de distorsión previa inversa y los
medios de filtrado inversos están acoplados unos tras otros.
6. Sistema de codificación del habla según
cualquiera de las reivindicaciones precedentes, caracterizado
porque la respuesta de frecuencia de los medios de filtrado de
difuminado de fase es según la relación
P(k) =
exp[- j\pi \cdot k(k - 1/2 \ N)N^{-1}]
\hskip0,5cmdonde
\hskip0,5cm0 \leq k \leq 1/2 \ N.
7. Sistema de codificación del habla según
cualquiera de las reivindicaciones 1 - 5, caracterizado
porque la respuesta de frecuencia del filtrado de difuminado de fase
está de acuerdo con la relación:
P(k) =
exp[Aj\pi sin(2\pi kN^{-1})
\hskip0,5cmdonde
\hskip0,5cm0 \leq k \leq 1/2 \ N
y A es una constante dependiente
del difuminado
deseado.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP01201301 | 2001-04-09 | ||
| EP01201301 | 2001-04-09 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2261637T3 true ES2261637T3 (es) | 2006-11-16 |
Family
ID=8180123
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES02708594T Expired - Lifetime ES2261637T3 (es) | 2001-04-09 | 2002-03-27 | Sistema de codificacion del habla adpcm, con filtros de difuminado de fase y difuminado de fase inverso. |
Country Status (9)
| Country | Link |
|---|---|
| US (1) | US20020173949A1 (es) |
| EP (1) | EP1395982B1 (es) |
| JP (1) | JP2004519736A (es) |
| KR (1) | KR20030009517A (es) |
| CN (1) | CN1221941C (es) |
| AT (1) | ATE323935T1 (es) |
| DE (1) | DE60210766T2 (es) |
| ES (1) | ES2261637T3 (es) |
| WO (1) | WO2002082426A1 (es) |
Families Citing this family (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TWI226035B (en) * | 2003-10-16 | 2005-01-01 | Elan Microelectronics Corp | Method and system improving step adaptation of ADPCM voice coding |
| EP1846920B1 (en) | 2005-01-31 | 2017-04-19 | Skype | Method for generating concealment frames in communication system |
| TWI285568B (en) * | 2005-02-02 | 2007-08-21 | Dowa Mining Co | Powder of silver particles and process |
| ES2332108T3 (es) * | 2005-07-14 | 2010-01-26 | Koninklijke Philips Electronics N.V. | Sintesis de señal de audio. |
| AU2010233863B2 (en) | 2009-04-08 | 2013-09-26 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Apparatus, method and computer program for upmixing a downmix audio signal using a phase value smoothing |
Family Cites Families (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5558612A (en) * | 1978-10-26 | 1980-05-01 | Kokusai Denshin Denwa Co Ltd <Kdd> | Delay circuit |
| JPS587935A (ja) * | 1981-07-07 | 1983-01-17 | Kokusai Denshin Denwa Co Ltd <Kdd> | トランスバーサル形スミアデスミアフイルタ |
| NL8700075A (nl) * | 1987-01-14 | 1988-08-01 | Philips Nv | Datatransmissiestelsel voorzien van versmeringsfilters. |
| US5231484A (en) * | 1991-11-08 | 1993-07-27 | International Business Machines Corporation | Motion video compression system with adaptive bit allocation and quantization |
| US5511095A (en) * | 1992-04-15 | 1996-04-23 | Sanyo Electric Co., Ltd. | Audio signal coding and decoding device |
| US5754974A (en) * | 1995-02-22 | 1998-05-19 | Digital Voice Systems, Inc | Spectral magnitude representation for multi-band excitation speech coders |
| US5956674A (en) * | 1995-12-01 | 1999-09-21 | Digital Theater Systems, Inc. | Multi-channel predictive subband audio coder using psychoacoustic adaptive bit allocation in frequency, time and over the multiple channels |
| AU3372199A (en) * | 1998-03-30 | 1999-10-18 | Voxware, Inc. | Low-complexity, low-delay, scalable and embedded speech and audio coding with adaptive frame loss concealment |
-
2002
- 2002-03-27 DE DE60210766T patent/DE60210766T2/de not_active Expired - Lifetime
- 2002-03-27 ES ES02708594T patent/ES2261637T3/es not_active Expired - Lifetime
- 2002-03-27 EP EP02708594A patent/EP1395982B1/en not_active Expired - Lifetime
- 2002-03-27 WO PCT/IB2002/001009 patent/WO2002082426A1/en not_active Ceased
- 2002-03-27 CN CNB028011287A patent/CN1221941C/zh not_active Expired - Fee Related
- 2002-03-27 JP JP2002580311A patent/JP2004519736A/ja active Pending
- 2002-03-27 KR KR1020027016633A patent/KR20030009517A/ko not_active Abandoned
- 2002-03-27 AT AT02708594T patent/ATE323935T1/de not_active IP Right Cessation
- 2002-04-04 US US10/116,600 patent/US20020173949A1/en not_active Abandoned
Also Published As
| Publication number | Publication date |
|---|---|
| EP1395982A1 (en) | 2004-03-10 |
| KR20030009517A (ko) | 2003-01-29 |
| CN1221941C (zh) | 2005-10-05 |
| DE60210766T2 (de) | 2007-02-08 |
| WO2002082426A1 (en) | 2002-10-17 |
| DE60210766D1 (de) | 2006-05-24 |
| ATE323935T1 (de) | 2006-05-15 |
| EP1395982B1 (en) | 2006-04-19 |
| US20020173949A1 (en) | 2002-11-21 |
| CN1461469A (zh) | 2003-12-10 |
| JP2004519736A (ja) | 2004-07-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2340975T3 (es) | Metodo y aparato para obtener un factor de atenuacion. | |
| US20230197089A1 (en) | Harmonic transposition in an audio coding method and system | |
| US8738385B2 (en) | Pitch-based pre-filtering and post-filtering for compression of audio signals | |
| US7379866B2 (en) | Simple noise suppression model | |
| US6144937A (en) | Noise suppression of speech by signal processing including applying a transform to time domain input sequences of digital signals representing audio information | |
| RU2419171C2 (ru) | Способ переключения скорости передачи битов при аудиодекодировании с масштабированием скорости передачи битов и масштабированием полосы пропускания | |
| EP1356454B1 (en) | Wideband signal transmission system | |
| JP6271531B2 (ja) | デジタル音声信号における効果的なプレエコー減衰 | |
| BRPI0311314B1 (pt) | Método e dispositivo para aperfeiçoamento da altura de som seletivo por freqüência de fala sintetizada | |
| BRPI0116844B1 (pt) | Processo e dispositivo de redução de ruído | |
| US20110054889A1 (en) | Enhancing Receiver Intelligibility in Voice Communication Devices | |
| Makhoul et al. | Time-scale modification in medium to low rate speech coding | |
| US20030065507A1 (en) | Network unit and a method for modifying a digital signal in the coded domain | |
| EP1190495A1 (en) | Coded domain echo control | |
| JP2003533902A5 (es) | ||
| CN101595523A (zh) | 信号处理装置和方法以及程序 | |
| WO1998006090A1 (en) | Speech/audio coding with non-linear spectral-amplitude transformation | |
| EP1395982B1 (en) | Adpcm speech coding system with phase-smearing and phase-desmearing filters | |
| US6141639A (en) | Method and apparatus for coding of signals containing speech and background noise | |
| JP6718670B2 (ja) | Adpcmコーデックでのパケット損失隠蔽方法及びplc回路を備えるadpcm復号器 | |
| JP2016105168A5 (es) | ||
| WO2008086920A1 (en) | Disturbance reduction in digital signal processing |