MX2011000366A - Codificador y decodificador de audio para codificar y decodificar muestras de audio. - Google Patents
Codificador y decodificador de audio para codificar y decodificar muestras de audio.Info
- Publication number
- MX2011000366A MX2011000366A MX2011000366A MX2011000366A MX2011000366A MX 2011000366 A MX2011000366 A MX 2011000366A MX 2011000366 A MX2011000366 A MX 2011000366A MX 2011000366 A MX2011000366 A MX 2011000366A MX 2011000366 A MX2011000366 A MX 2011000366A
- Authority
- MX
- Mexico
- Prior art keywords
- decoder
- encoder
- audio
- aliasing
- window
- Prior art date
Links
- 230000004044 response Effects 0.000 claims abstract description 23
- 238000012216 screening Methods 0.000 claims description 43
- 230000008859 change Effects 0.000 claims description 39
- 238000000034 method Methods 0.000 claims description 34
- 230000000630 rising effect Effects 0.000 claims description 14
- 238000004590 computer program Methods 0.000 claims description 10
- 230000001131 transforming effect Effects 0.000 claims description 4
- 238000009432 framing Methods 0.000 abstract 4
- 230000007704 transition Effects 0.000 description 35
- 230000005284 excitation Effects 0.000 description 25
- 230000003595 spectral effect Effects 0.000 description 22
- 230000015572 biosynthetic process Effects 0.000 description 21
- 238000003786 synthesis reaction Methods 0.000 description 21
- 230000005236 sound signal Effects 0.000 description 18
- 238000004458 analytical method Methods 0.000 description 16
- 230000006870 function Effects 0.000 description 15
- 238000005562 fading Methods 0.000 description 14
- 230000001755 vocal effect Effects 0.000 description 12
- 238000013139 quantization Methods 0.000 description 11
- 230000009466 transformation Effects 0.000 description 10
- 238000013459 approach Methods 0.000 description 8
- 230000008901 benefit Effects 0.000 description 8
- 230000003044 adaptive effect Effects 0.000 description 7
- 230000007774 longterm Effects 0.000 description 7
- 239000013598 vector Substances 0.000 description 7
- 230000000295 complement effect Effects 0.000 description 5
- 238000012986 modification Methods 0.000 description 5
- 230000004048 modification Effects 0.000 description 5
- 238000010606 normalization Methods 0.000 description 5
- 238000004422 calculation algorithm Methods 0.000 description 4
- 230000000873 masking effect Effects 0.000 description 4
- 230000002441 reversible effect Effects 0.000 description 4
- 238000001228 spectrum Methods 0.000 description 4
- 238000009826 distribution Methods 0.000 description 3
- 230000000694 effects Effects 0.000 description 3
- 230000015654 memory Effects 0.000 description 3
- 230000000737 periodic effect Effects 0.000 description 3
- 238000012545 processing Methods 0.000 description 3
- 238000003860 storage Methods 0.000 description 3
- 230000005540 biological transmission Effects 0.000 description 2
- 230000006835 compression Effects 0.000 description 2
- 238000007906 compression Methods 0.000 description 2
- 230000001419 dependent effect Effects 0.000 description 2
- 238000013461 design Methods 0.000 description 2
- 238000010586 diagram Methods 0.000 description 2
- 238000004880 explosion Methods 0.000 description 2
- 238000001914 filtration Methods 0.000 description 2
- 238000004519 manufacturing process Methods 0.000 description 2
- 238000011084 recovery Methods 0.000 description 2
- 230000009467 reduction Effects 0.000 description 2
- 238000005070 sampling Methods 0.000 description 2
- 210000001260 vocal cord Anatomy 0.000 description 2
- 101000822695 Clostridium perfringens (strain 13 / Type A) Small, acid-soluble spore protein C1 Proteins 0.000 description 1
- 101000655262 Clostridium perfringens (strain 13 / Type A) Small, acid-soluble spore protein C2 Proteins 0.000 description 1
- 101000655256 Paraclostridium bifermentans Small, acid-soluble spore protein alpha Proteins 0.000 description 1
- 101000655264 Paraclostridium bifermentans Small, acid-soluble spore protein beta Proteins 0.000 description 1
- 230000006978 adaptation Effects 0.000 description 1
- 230000002730 additional effect Effects 0.000 description 1
- 230000002776 aggregation Effects 0.000 description 1
- 238000004220 aggregation Methods 0.000 description 1
- 230000000903 blocking effect Effects 0.000 description 1
- 210000000481 breast Anatomy 0.000 description 1
- 238000004364 calculation method Methods 0.000 description 1
- 238000006243 chemical reaction Methods 0.000 description 1
- 238000004891 communication Methods 0.000 description 1
- 230000008878 coupling Effects 0.000 description 1
- 238000010168 coupling process Methods 0.000 description 1
- 238000005859 coupling reaction Methods 0.000 description 1
- 230000007812 deficiency Effects 0.000 description 1
- 238000012217 deletion Methods 0.000 description 1
- 230000037430 deletion Effects 0.000 description 1
- 238000009795 derivation Methods 0.000 description 1
- 230000004069 differentiation Effects 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 210000004704 glottis Anatomy 0.000 description 1
- 230000000977 initiatory effect Effects 0.000 description 1
- 238000007689 inspection Methods 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 238000012886 linear function Methods 0.000 description 1
- 238000012423 maintenance Methods 0.000 description 1
- 210000000214 mouth Anatomy 0.000 description 1
- MOXZPMYMMBOUJY-UHFFFAOYSA-N n-[2-(2-aminoethylsulfanyl)ethyl]-5-(dimethylamino)naphthalene-1-sulfonamide Chemical compound C1=CC=C2C(N(C)C)=CC=CC2=C1S(=O)(=O)NCCSCCN MOXZPMYMMBOUJY-UHFFFAOYSA-N 0.000 description 1
- 230000008447 perception Effects 0.000 description 1
- 210000003800 pharynx Anatomy 0.000 description 1
- 238000012805 post-processing Methods 0.000 description 1
- 238000007781 pre-processing Methods 0.000 description 1
- 238000011045 prefiltration Methods 0.000 description 1
- 230000008569 process Effects 0.000 description 1
- 238000011002 quantification Methods 0.000 description 1
- 238000012552 review Methods 0.000 description 1
- 238000010187 selection method Methods 0.000 description 1
- 230000011664 signaling Effects 0.000 description 1
- 230000002123 temporal effect Effects 0.000 description 1
- 238000012360 testing method Methods 0.000 description 1
- 238000000844 transformation Methods 0.000 description 1
- 230000001052 transient effect Effects 0.000 description 1
- 238000011282 treatment Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/18—Vocoders using multiple modes
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/18—Vocoders using multiple modes
- G10L19/20—Vocoders using multiple modes using sound class specific coding, hybrid encoders or object based coding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
- G10L19/12—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a code excitation, e.g. in code excited linear prediction [CELP] vocoders
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
Un codificador de audio (100) para codificar muestras de audio, que comprenden un primer codificador introductor de aliasing en dominio de tiempo (110) para decodificar muestras de audio en un primer dominio de codificación, el primer codificador introductor de aliasing en dominio de tiempo (110) que tiene una primera regla de tramado, una ventana de inicio y una ventana de detención. El codificador de audio (100) además comprende un segundo codificador (120) para codificar muestras en un segundo dominio de codificación, el segundo codificador (120) que tiene un número de muestras de audio de tamaño de trama predeterminado, y un número de muestras de audio de periodo de puesta a punto de codificación, el segundo codificador (120) que tiene una segunda regla de tramado diferente, una trama del segundo codificador (120) que es una representación codificada de un número de muestras de audio posteriores en el tiempo, el número que es igual al número de muestras de audio de tamaño de trama predeterminado. El codificador de audio (100) además comprende un controlador (130) que cambia del primer codificador (110) al segundo codificador (120) en respuesta a una característica de las muestras de audio, y para modificar la segunda regla de tramado en respuesta al cambio del primer codificador (110) al segundo codificador (120) o para modificar la ventana de inicio o la ventana de detención del primer codificador (110), en donde la segunda regla de tramado permanece sin modificaciones.
Description
CODIFICADOR Y DECOD1FICADOR DE AUDIO PARA CODIFICAR Y
DECODIFICAR MUESTRAS DE AUDIO
Memoria Descriptiva
La presente invención se encuentra dentro del campo de la codificación de audio en diferentes dominios de codificación, por ejemplo, en el dominio de tiempo y dominio de transformación.
En el contexto de audio de baja tasa de bits y tecnología de codificación del habla, se han empleado tradicionalmente diferentes técnicas de codificación a los fines de lograr codificación de baja tasa de bits de dichas señales con la mejor calidad subjetiva posible a una tasa de bits dada. Los codificadores para música general / señales de sonido buscan optimizar la calidad subjetiva por medio de dar una forma espectral (y temporal) del error de cuantificación de acuerdo con una curva del umbral de enmascaramiento que se estima de la señal de entrada por medio del modelo perceptual ("codificación de audio perceptual"). Por otro lado, se ha demostrado que la codificación del habla en bajas tasas de bits funciona de manera eficiente cuando se basa en un modelo de producción del habla humano, es decir, emplear Codificación de Predicción Lineal (LPC, por sus siglas en inglés) para modelar efectos resonantes del tracto vocal humano junto con una codificación eficiente de la señal de excitación residual.
Como consecuencia de estos dos enfoques diferentes, los codificadores de audio generales, como MPEG-1 Capa 3 (MPEG = Moving Pictures Expert Group), o MPEG-2/4 Codificación de Audio Avanzado (AAC, por sus siglas en inglés),
generalmente, no funcionan tan bien para las señales del habla a muy bajas tasas de datos muy bajas como los codificadores de habla basados en LPC dedicados debido a la falta de explotación de un modelo fuente de habla. Por el contrario, los codificadores de habla basados en LPC, generalmente, no alcanzan resultados convincentes cuando se aplican a señales de música generales por su incapacidad de dar forma flexiblemente al envolvente espectral de la distorsión de codificación de acuerdo con una curva de umbral de enmascaramiento. A continuación, se describen conceptos que combinan las ventajas de la codificación basada en LPC y la codificación de audio perceptual en un mismo marco y por lo tanto se describe una codificación de audio unificada que es eficiente tanto para el audio general como para las señales del habla.
Tradicionalmente, los codificadores de audio perceptuales usan un enfoque basado en filtro de banco para codificar de manera eficiente señales de audio y dar forma a la distorsión de cuantificación de acuerdo con una estimación de la curva de enmascaramiento.
La Fig. 16a muestra un diagrama de bloque básico de un sistema de codificación perceptual monofónico. Se usa un banco de filtro de análisis 1600 para delinear las muestras de dominio de tiempo en componentes espectrales submuestreados. Dependiendo del número de componentes espectrales, también se hace referencia al sistema como codificador de subbandas (número pequeño de sub-bandas, por ejemplo, 32) o un codificador transformador (gran número de líneas de frecuencia, por ejemplo, 512). Se utiliza un modelo perceptual ("psicoacústico") 1602 para estimar el umbral de enmascaramiento dependiente
de tiempo real. Los componentes espectrales ("subbanda" o "dominio de frecuencia") se cuantifican y codifican 1604 de manera que el ruido de cuantificación se esconde bajo la señal transmitida realmente y no es perceptible después de la decodificación. Esto se logra mediante la variación de la granularidad de cuantificación de los valores espectrales sobre el tiempo y la frecuencia.
Los coeficientes espectrales cuantificados y codificados por entropía o valores de subbanda son, además de información complementaria, entrada en un formateador de secuencia de bits 1606, que proporciona una señal de audio codificada que es adecuada para transmitirse o almacenarse. La secuencia de bits de salida del bloque 1606 puede transmitirse por medio de internet o puede almacenarse en cualquier potador de datos legible por máquina.
En el lado de decodificador, una interfaz de entrada de decodificador 1610 recibe la serie de bits codificada. El bloque 1610 separa los valores espectrales/ subbanda codificados por entropía y cuantificados de la información complementaria. Los valores espectrales codificados se ingresan en un decodificador entrópico como un decodificador de Huffman, que se posiciona entre 1610 y 1620. Las salidas de este decodificador de entropía son valores espectrales cuantificados. Los valores espectrales cuantificados se ingresan en un recuantificador, que realiza una cuantificación "inversa" como se indica en 1620 en la Fig. 16a. La salida del bloque 1620 se ingresa en un filtro de banco de síntesis 1622, que realiza una filtración de síntesis incluida una transformación frecuencia/ tiempo y, típicamente, una operación de cancelación de "aliasíng" (generación de señal ajena - efecto producido por la distorsión que se genera en la digitalización de una señal de audio cuando la frecuencia de muestreo es insuficiente) de dominio de tiempo como una superposición o agregado y/o una operación de ventana de síntesis complementaria para obtener finalmente la señal de audio de salida.
Tradicionalmente, la codificación del habla eficiente se ha basado en la Codificación de Predicción Lineal (LPC) para modelar los efectos resonantes del tracto vocal humano junto con una codificación eficiente de la señal de excitación residual. Tanto los parámetros de LPC como de excitación se transmiten del codificador al decodificador. Este principio se ilustra en las Figs. 17a y 17b.
La Fig. 17a indica el lado codificador de un sistema de codificación/ decodificación basado en la codificación de predicción lineal. La entrada de habla es la entrada en un analizador LPC 1701 , que proporciona, en su salida, coeficientes de filtro LPC. En base a estos coeficientes de filtro LPC, se ajusta un filtro LPC 1703. El filtro LPC emite una señal de audio espectralmente blanqueada, que también se denomina "señal de error de predicción". Esta señal de audio espectralmente blanqueada se ingresa en ün codificador residual/ excitación 1705, que genera parámetros de excitación. Por lo tanto, la entrada del habla se codifica en parámetros de excitación, por un lado, y coeficientes de LPC, por otro lado.
En el lado de decodificador ilustrado en la Fig; 17b, los parámetros de excitación se ingresan en el decodificador de excitación 1707, que genera una señal de excitación, que puede ingresarse en un filtro de síntesis LPC. El filtro de síntesis de LPC se ajusta usando los coeficientes de filtro de LPC transmitidos.
Por lo tanto, el filtro de síntesis de LPC 1709 genera una señal de salida de habla reconstruida o sintetizada.
A través del tiempo, muchos métodos se han propuesto respecto de una representación eficiente y perceptualmente convincente de la señal residual (de excitación), como Excitación de Multi-Pulso (MPE, por sus siglas en inglés),
Excitación de Pulso Regular (RPE, por sus siglas en inglés), y Predicción Lineal
Excitada por Código (CELP, por sus siglas en inglés).
La Codificación de Predicción Lineal intenta producir una estimación del valor de muestra actual de una secuencia basada en la observación de un cierto número de valores pasados como una combinación lineal de las observaciones pasadas. A los fines de reducir redundancias en la señal de entrada, el filtro de codificador de LPC "blanquea" la señal de entrada en su envolvente espectral, es decir, es un modelo del inverso del envolvente espectral de la señal. Por el contrario, el filtro de síntesis del LPC del decodificador es un modelo del envolvente espectral de la señal. Específicamente, el muy conocido análisis predictivo lineal autorregresivo (ARj se sabe que modela el envolvente espectral de señal por medio de una aproximación todo polo.
Típicamente, codificadores de habla de banda angosta (es decir, codificadores de habla con tasa de muestreo de 8kHz) emplean un filtro de LPC con una orden entre 8 y 12. Debido a la naturaleza del filtro de LPC, una resolución de frecuencia uniforme es efectiva a través del rango de frecuencia completa. Esto no se corresponde con una escala de frecuencia perceptual.
A los fines de combinar las fuerzas de la codificación basada en LPC/CELP tradicional (mejor calidad para señales de habla) y el enfoque de codificación de audio perceptual basado en filtro de banco tradicional (mejor para música^ se ha propuesto una codificación combinada entre estas arquitecturas. En el codificador AMR-WB+ (AMR-WB = Adaptivo Multivelocidad Banda ancha) B. Bessette, R. Lefebvre, R. Salami, "UNIVERSAL SPEECH/AUDIO CODING USING HYBRID ACELP/TCX TECHNIQUES," Proc. IEEE ICASSP 2005, pp. 301 - 304, 2005 dos núcleos de codificación alternativos operan en una señal residual del LPC. Una está basada en ACELP (ACELP = Predicción Lineal por Excitación con Código Algebraico) y, por lo tanto, es extremadamente eficiente para la codificación de señales del habla. El otro núcleo de codificación está basado en TCX (TCX = Excitación Codificada de Transformación), es decir, un enfoque de codificación basado en filtro de banco que se asemeja a las técnicas de codificación de audio tradicionales a los fines de lograr buena calidad para las señales musicales. Dependiendo de las características de las señales de entrada, uno de los dos modos de codificación se selecciona por un periodo corto de tiempo para transmitir la señal residual de LPC. De esta forma, tramas de 80ms de duración pueden dividirse en subtramas de 40ms o 20ms en las que se toma una decisión entre los dos modos de codificación.
El AMR-WB+ (AMR-WB + = códec de Multivelocidad Adaptivo extendido), cf .
3GPP (3GPP = Proyecto de Asociación de Tercera Generación) especificación técnica número 26.290, versión 6.3.0, junio 2005, puede cambiar entres dos modos esencialmente diferentes ACELP y TCX. El modo ACELP una señal de
dominio de tiempo se codifica por la excitación de código algebraico. En el modo TCX se usa una transformada de Fourier (FFT = transformada de Fourier rápida) y los valores espectrales de la señal ponderada de LPC (de la que puede derivarse la excitación de LPC) se codifican en base a una cuantificación de vector.
La decisión, de que modos usar, puede tomarse probando y decodificando las dos opciones y comparando las relaciones de señal/ ruido segmentarias (SNR = Relación Señal/ Ruido).
Este caso también se llama decisión de circuito cerrado, ya que hay un circuito de control cerrado, evaluando el funcionamiento de codificación o eficiencias, respectivamente, y luego elegir la que tenga mejor SNR.
Se sabe que para las aplicaciones de codificación de audio y habla un transformador de bloque sin ventana no es posible. Por lo tanto, para el modo TCX la señal se divide por ventana con ventana de superposición baja con una superposición de 1/8. Esta región de superposición es necesaria a los fines del desvanecimiento de un bloque anterior o trama mientras que se funde en el próximo, por ejemplo, para suprimir artefactos ("artifacts" - en este contexto se refiere a errores de conversión) debido al ruido de cuantificación no correlacionado en tramas de audio consecutivas. De esta manera, la sobrecarga comparada con la muestra no crítica se mantiene razonablemente baja y la decodificación necesaria para la decisión de circuito cerrado reconstruye al menos 7/8 de las muestras de la trama actual.
El AMR-WB+ introduce 1/8 de sobrecarga en el modo TCX, es decir, el número de valores espectrales a codificarse es 1/8 mayor que el número de
muestras de entrada. Esto proporciona la desventaja de una sobrecarga de datos mayor. Asimismo, la respuesta de frecuencia de los filtros de pase de banda correspondientes no es ventajosa debido a la profunda región de superposición de 1/8 de las tramas consecutivas.
A los fines de detallar más una sobrecarga de código y superposición de tramas consecutivas, la Fig. 18 ilustra una definición de parámetros de ventana. La ventana que se muestra en la Fig. 18 tiene una parte de flanco de subida en el lado izquierdo, que se denomina "L" y también se llama región de superposición izquierda, una región central que se denomina con "1", que también se llama región de 1 o parte de sobrepaso (bypass), y una parte de flanco de bajada, que se denomina "R" y también se llama la región de superposición derecha. Además, la Fig. 18 muestra una flecha que indica la región "PR" de reconstrucción perfecta dentro de una trama. Además, la Fig. 18 muestra una flecha que indica la longitud del núcleo de transformación, que se denomina "T".
La Fig. 19 muestra un gráfico de una secuencia de ventanas AMR-WB+ y al final una tabla de un parámetro de ventana de acuerdo con la Fig. 18. La secuencia de ventanas que se muestra en la parte superior de la Fig. 19 es ACELP, TCX20 (para una trama de 20ms de duración), TCX20, TCX40 (para una trama de 40ms de duración), TCX80 (para una trama de 80ms de duración), TCX20, TCX20, ACELP, ACELP.
De la secuencia de ventanas pueden verse las regiones de superposición variadas, que se superponen 1/8 exacto de la parte central M. La tabla en la parte inferior de la Fig. 19 también muestra que la longitud de transformación "T" es siempre 1/8 más grande que la región de muestras nuevas perfectamente reconstruidas "PR". Asimismo, debe notarse que no es solamente el caso de transiciones ACELP a TCX, pero también para transiciones de TCXx a TCXx (en donde "x" indica tramas TCX de longitud arbitraria). Por lo tanto, en cada bloque se introduce una sobrecarga de 1/8, es decir, la muestra crítica nunca se alcanza.
Cuando se cambia de TCX a ACELP las muestras de ventana se descartan de la trama FFT-TCX en la región de superposición, como se indica, por ejemplo, en la parte superior de la Fig. 19 mediante la región marcada con 1900. Cuando se cambia de ACELP a TCX la respuesta de entrada cero (ZIR = respuesta entrada cero), que también se indica por la línea punteada 1910 en la parte superior de la Fig. 19, se elimina en el codificador antes de la división en ventanas y se agrega al decodificador para la recuperación. Cuando se cambia de tramas TCX a TCX las muestras divididas en ventanas se usan para desvanecimiento cruzado. Dado que las tramas TCX puede cuantificarse de manera diferente, el error de cuantificación o ruido de cuantificación entre tramas consecutivas puede ser diferente y/o independiente. Por tanto, cuando se cambia de una trama a la otra sin desvanecimiento cruzado, pueden ocurrir artefactos notables y, en consecuencia, el desvanecimiento cruzado es necesario para adquirir una calidad determinada.
De la tabla en la parte inferior de la Fig. 19 se puede ver que la región de desvanecimiento cruzado crece con una longitud creciente de la trama. La Fig. 20 proporciona otra tabla con ilustraciones de las diferentes ventanas para las transiciones posibles en AMR-WB+. Cuando se transita de TCX a ACELP las
muestras de superposición pueden descartarse. Cuando se transita de ACELP a TCX, la respuesta de entrada cero desde el ACELP puede eliminarse en el codificador y se agrega al decodificador para la recuperación.
A continuación se explicará la codificación de audio, que utiliza codificación de dominio de tiempo (TD = Dominio de Tiempo) y dominio de frecuencia (FD = Dominio de Frecuencia). Asimismo, entre los dos dominio de codificación, se puede utilizar el cambio. En la Fig. 21 , se muestra una línea de tiempo durante la cual una primera trama 2101 es codificada por un codificador FD seguida por otra trama 2103, que es codificada por un codificador TD y que se superpone en la región 2102 con la primer trama 2101. La trama codificada de dominio de tiempo 2103 es seguida por una trama 2105, que es codificada en el dominio de frecuencia nuevamente y que se superpone en la región 2104 con la trama precedente 2103. Las regiones de superposición 2102 y 2104 ocurren siempre que el dominio de codificación se cambie.
El fin de estas regiones de superposición es suavizar las transiciones. Sin embargo, las regiones de superposición pueden aún ser susceptibles a una pérdida de la eficiencia de codificación y artefactos. Por lo tanto, las regiones de superposición o transiciones son, generalmente, elegidas como un compromiso entre alguna sobrecarga de la información trasmitida, es decir, eficiencia de codificación y la calidad de la transición, es decir, la calidad de audio de la señal decodificada. A los fines de establecer este compromiso, se debe tener cuidado cuando se manipulan las transiciones y se diseñan las ventanas de transición 2111 , 2113 y 2115 como se indica en la Fig. 21.
Los conceptos convencionales relativos a la manipulación de transiciones entre los modos de codificación del dominio de frecuencia y el dominio de tiempo son, por ejemplo, el uso de ventanas de desvanecimiento cruzado, es decir, introducir una sobrecarga tan grande como la región de superposición. Se utiliza una ventana de desvanecimiento cruzado, el desvanecimiento de la trama precedente e intensificación la siguiente trama en forma simultánea. Este enfoque, debido a la sobrecarga, introduce deficiencias en una eficiencia de decodificación, dado que siempre que se lleve a cabo una transición, la señal no continua siendo muestreada críticamente. Las transformaciones solapadas muestreadas críticamente se describen, por ejemplo, en J. Princen, A. Bradley, "Analysis/Synthesis Filter Bank Design Based on Time Domain Aliasing Cancellation", IEEE Trans. ASSP, ASSP-34(5):1 153-1 161 , 1986, y se utilizan, por ejemplo, en AAC (AAC = Codificación de Audio Avanzada), cf. Codificación Genérica de Imágenes de Movimiento y Audio Asociado: Codificación de Audio Avanzado, Estándar Internacional 13818-7, ISO/IEC JTC1/SC29/WG11 MPEG, 1997.
Asimismo, las transiciones de desvanecimiento cruzado sin aliasing se describen en Fielder, Louis D., Todd, Craig C, "The Design of a Video Friendly Audio Coding System for Distribution Applications", Escrito número 17-008, La Conferencia Internacional 17 de AES: Codificación de Audio de Alta Calidad (agosto de 1999) y en Fielder, Louis D., Davidson, Grant A., "Audio Coding Tools for Digital Televisión Distribution", Número de preimpresión 5104, Convención 108 de la AES (enero de 2000).
La WO 2008/071353 describe un concepto para cambiar entre un codificador de dominio de tiempo y de dominio de frecuencia. El concepto podría aplicarse a cualquier códec en base a un cambio de dominio de tiempo/ dominio de frecuencia. Por ejemplo, el concepto podría aplicarse a la codificación de dominio de tiempo de acuerdo con el modo ACELP del códec AMR-WB+ y la AAC como un ejemplo del códec de dominio de frecuencia. La Fig. 22 muestra un diagrama de bloque de un codificador convencional que utiliza un decodificador de dominio de frecuencia en la rama superior y un decodificador de dominio de tiempo en la rama inferior. La parte de decodificación de frecuencia se ejemplifica por un decodificador de AAC, que comprende un bloque de recuantificación 2202 y un bloque de transformada del coseno discreta modificada 2204. En AAC la transformada del coseno discreta modificada (MDCT = Transformada del Coseno Discreta Modificada) se usa como una transformación entre el dominio de tiempo y el dominio de frecuencia. En la Fig. 22 el camino de decodificación de dominio de tiempo se ejemplifica como un decodificador AMR-WB+ 2206 seguido por un bloque de MDCT 2208, a los fines de combinar el resultado del decodificador 2206 con el resultado del recuantificador 2202 en el dominio de frecuencia.
Esto permite una combinación en el dominio de frecuencia, mientras que la etapa de superposición y agregado, que no se muestra en la Fig. 22, puede usarse luego de la MDCT inversa 2204, a los fines de combinar los bloques adyacentes de desvanecimiento cruzado, sin considerar si han sido codificados en el dominio de tiempo o el dominio de frecuencia.
En otro enfoque convencional que se describe en WO2008/071353 es para evitar la MDCT 2208 en la Fig. 22, es decir, DCT-IV e IDCT-IV para el caso de la decodificación de dominio de tiempo, puede usarse otro enfoque de la llamada cancelación de aliasing de dominio de tiempo (TDAC = Cancelación de Aliasing de Dominio de Tiempo). Esto se muestra en la Fig. 23. La Fig. 23 muestra otro decodificador que tiene un decodificador de dominio de frecuencia ejemplificado como un decodificador AAC que comprende un bloque de recuantificación 2302 y un bloque de IMDCT 2304. El camino del dominio de tiempo es nuevamente ejemplificado por un decodificador AMR-WB+ 2306 y el bloque TDAC 2308. El decodificador que se muestra en la Fig. 23 permite una combinación de bloques decodificados en el dominio de tiempo, es decir, luego de IMDCT 2304, dado que la TDAC 2308 introduce el aliasing de tiempo necesario para la combinación apropiada, es decir, para la cancelación de aliasing en tiempo, directamente en el dominio de tiempo. Para ahorrar algunos cálculos en lugar'de usar MDCT en cada primera y última supertrama, es decir, en cada 1024muestras, de cada segmento AMR-WB+, TDAC puede usarse solamente en las zonas de superposición o regiones en 128 muestras. El aliasing en dominio de tiempo normal introducido por el procesamiento AAC puede mantenerse, mientras que el aliasing en dominio de tiempo inverso en las partes AMR-WB+ es introducido.
Las ventanas de desvanecimiento cruzado no sujetas a aliasing tienen la desventaja que no son eficientes en codificación, porque generan coeficientes codificados no muestreados críticamente, y agregan una sobrecarga de información para codificar. La introducción de TDA (TDA = Aliasing en Dominio de Tiempo) en el decodificador de dominio de tiempo, por ejemplo, en WO 2008/071353, reduce esta sobrecarga, pero podría aplicarse solamente a medida que las tramas temporales de los dos codificadores se unen unas con las otras. De otro modo,, la eficiencia de codificación se reduce nuevamente. Además, el TDA en el lado del decodificador puede ser problemático, especialmente en el punto de partida de un codificador de dominio de tiempo. Luego de un reseteado potencial, un codificador o decodificador de dominio de tiempo producirá, generalmente, una explosión (burst) de ruido de cuantificación debido al vacío de memorias del codificador o decodificador de dominio de tiempo usando, por ejemplo, LPC (LPC = Codificación de Predicción Lineal). El decodificador luego tomará cierto tiempo antes de estar en un estado permanente o estable y proporcionar un ruido de cuantificación más uniforme en el tiempo. Este error de explosión no es ventajoso, ya que generalmente es audible.
Por lo tanto, es objeto de la presente invención proporcionar un concepto mejorado para cambiar de codificación de audio en dominios múltiples.
El objetivo se logra mediante un codificador de acuerdo con la reivindicación 1 , y métodos para codificar de acuerdo con la reivindicación 16, un decodificador de audio de acuerdo con la reivindicación 18 y un método para decodificación de audio de acuerdo con la reivindicación 32.
Es un hallazgo de la presente invención que un cambio mejorado en un concepto de codificación de audio que utiliza codificación de dominio de tiempo y dominio de frecuencia puede lograrse, cuando se adapta el tramado de los dominios de codificación correspondientes o se utilizan ventanas de
desvanecimiento cruzado modificadas. En una realización, por ejemplo, puede usarse AMR-WB+ como códec de dominio de tiempo y AAC puede utilizarse como un ejemplo de códec de dominio de frecuencia, puede lograse un cambio más eficiente entre los dos codees mediante realizaciones, ya sea mediante la adaptación del tramado de la parte de AMR-WB+ o mediante el uso de ventanas de inicio o detención para la parte de codificación AAC respectiva.
Es otro hallazgo de la invención que TDAC puede aplicarse en el decodificador y pueden utilizarse ventanas de desvanecimiento cruzado sin aliasing.
Las realizaciones de la presente invención pueden proporcionar la ventaja que puede reducirse una sobrecarga de información, introducida en una transición superpuesta, mientras que se mantienen regiones de desvanecimiento cruzado moderado moderadas lo que asegura la calidad del desvanecimiento cruzado. Las realizaciones de la presente invención se detallarán usando las figuras adjuntas, en las cuales
La Fig. 1a muestra una realización de un codificador de audio;
La Fig. 1 b muestra una realización de un decodificador de audio;
Las Figs. 2a-2j muestran ecuaciones para la MDCT/IMDCT;
La Fig. 3 muestra una realización que utiliza tramado modificado;
La Fig. 4a muestra una señal cuasi periódica en el dominio de tiempo;
La Fig. 4b muestra una señal sonora en el dominio de frecuencia;
La Fig. 5a muestra una señal como de sonido en un dominio de tiempo; La Fig. 5b muestra una señal no sonora en el dominio de frecuencia;
La Fig. 6 muestra un análisis por síntesis CELP;
La Fig. 7 ilustra un ejemplo de una etapa de análisis LPC en una realización;
La Fig. 8a muestra una realización con una ventana de detención modificada;
La Fig. 8b muestra una realización con una ventana de inicio-detención modificada;
La Fig. 9 muestra una ventana de principio;
La Fig. 10 muestra una ventana más avanzada;
La Fig. 11 muestra una realización de una ventana de detención modificada;
La Fig. 12 ilustra una realización con diferentes zonas o regiones de superposición;
La Fig. 13 ilustra una realización de una ventana de inicio modificada;
La Fig.14 muestra una realización de una ventana de detención modificada libre de aliasing aplicada a un codificador;
La Fig. 15 muestra una ventana de detención modificada libre de aliasing aplicada en el decodificador;
La Fig. 16 ilustra ejemplos de codificador y decodificador convencionales;
Las Figs. 17a, 17b ilustran LPC para señales sonoras y no sonoras;
La Fig. 18 ilustra una ventana de desvanecimiento cruzado de la técnica anterior;
La Fig. 19 ilustra una secuencia de la técnica anterior de ventanas de AMR- WB+;
La Fig. 20 ilustra ventanas usadas para transmitir en AMR-WB+ entre ACELP y TCX;
La Fig. 21 muestra un ejemplo de una secuencia de tramas de audio consecutivas en diferentes dominios de codificación;
La Fig. 22 ilustra el enfoque convencional para la decodificación de audio en diferentes dominios; y
La Fig. 23 ilustra un ejemplo de cancelación de aliasing en dominio de tiempo.
La Fig. 1a muestra un codificador de audio 100 para codificar muestras de audio. El codificador de audio 100 comprende un primer codificador introductor de aliasing en dominio de tiempo 110 para codificar muestras de audio en un primer dominio de codificación, el primer codificador introductor de aliasing en dominio de tiempo 110 tiene una primera regla de tramado, una ventana de inicio y una ventana de detención. Asimismo, el codificador de audio 100 comprende un segundo codificador 120 para codificar muestras de audio en el segundo dominio de codificación. El segundo codificador 120 tiene un número de muestras de audio de tamaño de trama predeterminado y un número de muestras de audio de periodo de puesta a punto de codificación. El periodo de puesta a punto de codificación puede ser cierto o predeterminado, puede ser dependiente de las muestras de audio, una trama de muestras de audio o una secuencia de señales de audio. El segundo codificador 120 tiene una segunda regla de tramado
diferente. Una trama del segundo codificador 120 es una representación codificada de un número de muestras de audio posteriores en el tiempo, el número que es igual al número de muestras de audio de tamaño de trama predeterminado.
El codificador de audio 100 además comprende un controlador 130 para cambiar del primer codificador introductor de aliasing en dominio de tiempo 110 al segundo codificador. 120 en respuesta a una característica de las muestras de audio y para modificar la segunda regla de tramado én respuesta a un cambio del primer codificador introductor de aliasing en dominio de tiempo 110 al segundo codificador 120 o para modificar la ventana de inicio o ventana de detención del primer codificador introductor de aliasing en dominio de tiempo 110, en donde la segunda regla de tramado permanece sin modificaciones.
En realizaciones el controlador 130 puede adaptarse para determinar la característica de las muestras de audio en base a las muestras de audio de entrada o en base a la salida del primer codificador introductor de aliasing en dominio de tiempo 110 o el segundo codificador 120. Esto se indica por la línea punteada en la Fig. 1a, a través de la cual las muestras de audio de entrada pueden ser proporcionadas por el controlador 130. Más detalles de la decisión de cambio se describirán a continuación. .
En las realizaciones el controlador 130 puede controlar el primer codificador introductor de aliasing en dominio de tiempo 110 y el segundo codificador 120 de una manera, que ambos codifican las muestras de audio en paralelo, y el controlador 130 toma la decisión de cambio en base al resultado respectivo, lleva a cabo las modificaciones antes del cambio. En otras realizaciones el controlador 130 puede analizar las características de las muestras de audio y decidir que rama de codificación usar, pero apagando la otra rama. En tal realización el periodo de puesta a punto de codificación del segundo codificador 120 se vuelve relevante, como antes del cambio, el periodo de puesta a punto de codificación tiene que tomarse en consideración, lo que se detallará a continuación.
En realizaciones el primer introductor de aliasing en dominio de tiempo 1 10 puede comprender un transformador de dominio de frecuencia para transformar la primera trama de muestras de audio posteriores a dominio de frecuencia. El primer codificador introductor de aliasing en dominio de tiempo 110 puede adaptarse para ponderar la primera trama codificada con la ventana de inicio, cuando la trama posterior es codificada por el segundo codificador 120 y puede adaptarse además para ponderar la primera trama codificada con la ventana de detención cuando una trama precedente va a codificarse por un segundo codificador 120.
Debe notarse que pueden usarse diferentes notaciones, el primer codificador introductor de aliasing en dominio de tiempo 110 aplica una ventana de inicio o una ventana de detención. Aquí, y para el resto se asume que una ventana de inicio se aplica antes del cambio al segundo codificador 120 y cuando se cambia nuevamente del segundo codificador 120 al primer codificador introductor de aliasing en dominio de tiempo 120 la ventana de detención se aplica en un primer codificador introductor de aliasing en dominio de tiempo 110. Sin pérdida de generalidad, la expresión podría usarse viceversa en referencia al segundo codificador 120. A los fines de evitar confusión, aquí las expresiones "inicio" y "detención" se refieren a ventanas aplicadas al primer codificador 1 10, cuándo el segundo codificador 120 se inicia o luego de que se detuvo.
En realizaciones el transformador de dominio de frecuencia como se usa en el primer codificador de aliasing en dominio de tiempo 1 10 puede adaptarse para transformar la primera trama en el dominio de frecuencia en base a una MDCT y el primer codificador introductor de aliasing en dominio de tiempo 1 10 puede adaptarse para adaptar un tamaño de MDCT a las ventanas de inicio y detención o inicio y detención modificadas. Los detalles para la MDCT y su tamaño se establecerán a continuación.
En realizaciones, el primer codificador introductor de aliasing en dominio de tiempo 1 10 puede adaptarse, en consecuencia, para usar una ventana de inicio y/o detención que tiene un parte libre de aliasing, es decir, dentro de la ventana hay una parte, sin aliasing en dominio de tiempo. Asimismo, el primer codificador introductor de aliasing en dominio de tiempo 1 10 puede adaptarse para usar una ventana de inicio y/o una ventana de detención que tiene una parte libre de aliasing en una parte de flanco de subida de la ventana, cuando la trama precedente es codificada por el segundo codificador 120, es decir, el primer codificador introductor de aliasing en dominio de tiempo 1 10 utiliza una ventana de detención, que tiene una parte de flanco de subida que está libre de aliasing. En consecuencia, puede adaptarse el primer codificador introductor de aliasing en dominio de tiempo 1 10 para utilizar una ventana que tiene una parte de flanco de bajada que está libre de aliasing, cuando una trama posterior es codificada por el segundo codificador 120, es decir, usando una ventana de detención con una parte de flanco de bajada, que está libre de aliasing.
En realizaciones, el controlador 130 puede adaptarse para iniciar el segundo codificador 120 de manera que una primera trama de una secuencia de tramas del segundo codificador 120 comprende una representación codificada de las muestras procesadas en la parte libre de aliasing precedente del primer codificador de aliasing en dominio de tiempo 110. En otras palabras, la salida del primer codificador introductor de aliasing en dominio de tiempo 110 y el segundo codificador 120 pueden coordinarse por el controlador 130 de manera que la parte libre de aliasing de las muestras de audio codificadas del primer codificador introductor de aliasing en dominio de tiempo 110 se superpone con la salida de muestras de audio codificadas por el segundo codificador 120. El controlador 130 además puede adaptarse para el desvanecimiento cruzado, es decir, desvanecimiento de un codificador mientras se intensifica el otro codificador.
El controlador 130 puede adaptarse para iniciar el segundo codificador 120 de manera que el número de muestras del periodo de puesta a punto de codificación se superpone con la parte libre de aliasing de la ventana de inicio del primer codificador introductor de aliasing en dominio de tiempo 110 y una trama posterior del segundo codificador 120 se superpone con la parte de aliasing de la ventana de detención. En otras palabras, el controlador 130 puede coordinar el segundo codificador 120 de manera que las muestras de audio sin aliasing del periodo de puesta a punto de codificación estén disponibles del primer codificador 110, y cuando solo las muestras de audio de aliasing están disponibles del primer codificador introductor de aliasing en dominio de tiempo 110, el periodo de puesta a punto del segundo codificador 120 ha terminado y codificado las muestras de audio están disponibles en la salida del segundo codificador 120 en una manera regular.
El controlador 130 puede adaptarse además para iniciar el segundo codificador 120 de manera que el periodo de puesta a punto de codificación se superpone con la parte de aliasing de la ventana de inicio. En esta realización, durante la parte de superposición, las muestras de audio de aliasing están disponibles de la salida del primer codificador introductor de aliasing en dominio de tiempo 110, y a la salida del segundo codificador 120 muestras de audio codificadas del periodo de puesta a punto, que pueden tener un ruido de cuantificación aumentado, pueden estar disponibles. El controlador 130 puede aún adaptarse para desvanecimiento cruzado entre dos secuencias de audio codificadas de manera suboptima durante el periodo de superposición.
En otras realizaciones, el controlador 130 puede además adaptarse para el cambio del primer codificador 110 en respuesta a una característica diferente de las muestras de audio y para modificar la segunda regla de tramado en respuesta al cambio del primer codificador introductor de aliasing en dominio de tiempo 110 al segundo codificador 120 o para modificar la venta de inicio o la ventana de detención del primer codificador, en donde la segunda regla de tramado permanece sin modificaciones. En otras palabras, el controlador 130 puede adaptarse para cambiar hacia adelante y hacia atrás entre los dos codificadores de audio.
En otras realizaciones el controlador 130 puede adaptarse para iniciar el primer codificador introductor de aliasing en dominio de tiempo 110 de manera que la parte libre de aliasing de la ventana de detención se superpone con la trama del segundo codificador 120. En otras palabras, en realizaciones, el controlador puede adaptarse para el desvanecimiento cruzado entre las salidas de los dos codificadores. En algunas realizaciones, la salida del segundo codificador se desvanece, mientras que solo la codificada de manera suboptima, es decir, las muestras de audio de aliasing del primer codificador introductor de aliasing en dominio de tiempo 110 se intensifican. En otras realizaciones, el controlador 130 puede adaptarse para el desvanecimiento cruzado entre una trama del segundo codificador 120 y tramas sin aliasing del primer codificador 110.
En realizaciones, el primer codificador introductor de aliasing en dominio de tiempo 110 puede comprender un codificador AAC de acuerdo con la Codificación Genérica de Imágenes de Movimiento y Audio Asociado: Codificación de Audio Avanzado, Estándar Internacional 13818-7, ISO/IEC JTC1/SC29/WG11 MPEG, 1997.
En realizaciones, el segundo codificador 120 puede comprender un codificador AMR-WB+ de acuerdo con 3GPP (3GPP = Proyecto de Asociación de Tercera Generación), Especificación Técnica 26.290, Versión 6.3.0 a partir de junio de 2005 "Función de Procesamiento dé Códec de Audio; Códec de Banda Ancha de Multivelocidad Adaptivo Extendido; Funciones de Transcodificación", emisión 6.
El controlador 130 puede adaptarse para modificar la regla de tramado AMR o AMR-WB+ de manera que una primera supertrama AMR comprende cinco tramas AMR, donde de acuerdo con la especificación técnica anteriormente mencionada, una supertrama comprende cuatro tramas AMR regulares, compárese la Fig. 4, Tabla 10 en la página 18 y la Fig. 5 en la página 20 de la Especificación Técnica anteriormente mencionada. Como se detallará más adelante, el controlador 130 puede adaptarse para agregar una trama extra a una supertrama AMR. Debe notarse que en las realizaciones la supertrama puede modificarse mediante una trama adjunta al comienzo o final de cualquier supertrama, es decir, las reglas de tramado pueden también unirse al final de una supertrama.
La Fig. 1 b muestra una realización de un decodificador de audio 150 para . decodificar tramas codificadas de muestras de audio. El decodificador de audio 150 comprende un primer decodificador introductor de aliasing en dominio de tiempo 160 para decodificar muestras de audio en un primer dominio de decodificación. El primer codificador introductor de aliasing en dominio de tiempo 160 tiene una primera regla de tramado, una ventana de inicio y una ventana de detención. El decodificador de audio 150, además, comprende un segundo decodificador 170 para decodificar muestras de audio en un segundo dominio de decodificación. El segundo decodificador 170 tiene un número de muestras de audio de tamaño, de trama predeterminado y un número de muestras de audio de periodo de puesta a punto de codificación. Asimismo, el segundo decodificador 170 tiene una segunda regla de tramado diferente. Una trama del segundo
decodificador 170 puede corresponder a una representación decodificada de un número de muestras de audio posteriores en el tiempo, donde el número es igual al número de muestras de audio de tamaño de trama predeterminado.
El decodificador de audio 150 además comprende un controlador 180 para cambiar del primer decodificador introductor de aliasing en dominio de tiempo 160 al el segundo decodificador 170 en base a una indicación en la trama codificada de las muestras de audio, en donde se adapta el controlador 180 para modificar la segunda regla de tramado en respuesta al cambio del primer decodificador introductor en dominio de tiempo 160 al segundo decodificador 170 o para modificar la ventana de inicio o la ventana de detención del primer decodificador 160, en donde la segunda regla de tramado permanece sin modificaciones.
De acuerdo con la descripción anterior, por ejemplo, en el codificador y decodificador AAC, las ventanas de inicio y detención se aplican tanto en el codificador como en el decodificador. De acuerdo con la descripción anterior del codificador de audio 100, el decodificador de audio 150 proporciona los componentes de decodificación correspondientes. La indicación de cambio del controlador 180 puede proporcionarse en términos de un bit, una bandera o cualquier información complementaria junto con las tramas codificadas.
En ciertas realizaciones, el primer decodificador 160 puede comprender un transformador de dominio de tiempo para la transformación de una primera trama de muestras de audio decodificadas al dominio de tiempo. Se puede adaptar el primer decodificador introductor de aliasing en dominio de tiempo 160 para ponderar la primera trama decodificada con la ventana de inicio cuando una trama posterior es decodificada mediante el segundo decodificador 170 y/o para ponderar la primera trama decodificada con la ventana de detención cuando una trama precedente debe ser decodificada mediante el segundo decodificador 170. El transformador de dominio de tiempo puede adaptarse para transformar la primera trama al dominio de tiempo en base a una MDCT inversa (IMDCT = MDCT inversa) y/ o el primer decodificador introductor de aliasing en dominio de tiempo 160 puede adaptarse para adaptar un tamaño de I DCT a las ventanas de inicio y/ o detención o inicio y/ o detención modificadas. Los tamaños de IMDCT se detallarán más adelante.
En ciertas realizaciones, el primer decodificador introductor de aliasing en dominio de tiempo 160 puede adaptarse mediante el uso de una ventana dé inicio y/ o una ventana de detención que sean libres de aliasing o que contengan una parte libre de aliasing. El primer decodificador introductor de aliasing en dominio de tiempo 160 puede adaptarse aún más mediante el uso de una ventana de detención que contenga una parte libre de aliasing en la parte de subida de la ventana cuando la trama precedente se ha decodificado mediante el segundo decodificador 170 y/ o el primer decodificador introductor de aliasing en dominio de tiempo 160 puede tener una ventana de inicio que tiene una parte libre de aliasing en el flanco de bajada cuando la trama posterior es decodificada por el segundo decodificador 170.
En lo concerniente a las realizaciones anteriormente descriptas del codificador de audio 100, se puede adaptar el controlador 180 para iniciar el segundo decodificador 170 de modo tal que la primera trama de una secuencia de tramas del segundo decodificador 170 comprende una representación decodificada de una muestra procesada en la parte libre de aliasing precedente del primer decodificador 160. El controlador 180 puede adaptarse iniciar el segundo decodificador 170 de modo tal que el número de muestras de aüdio de periodo de puesta a punto de codificación se superpone con la parte libre de aliasing de la ventana de inicio del primer decodificador introductor de aliasing en dominio de tiempo 160 y una trama posterior del segundo decodificador 170 se superpone con la parte de aliasing de la ventana de detención.
En otras realizaciones, el controlador 180 puede adaptarse para iniciar el segundo decodificador 170 de modo tal que el período de puesta a punto de codificación se superpone con la parte de aliasing de la ventana de inicio.
En otras realizaciones, el controlador 180 pude adaptarse aún más para cambiar del segundo decodificador 170 al primer decodificador 160 en respuesta a una indicación de las muestras de audio codificadas y para modificar la segunda regla de tramado en respuesta al cambio del segundo decodificador 170 al primer decodificador 160 o para modificar la ventana de inicio o la ventana de detención del primer decodificador 160, donde la segunda regla de tramado permanece sin modificaciones. Se puede proporcionar la indicación en términos de una bandera, un bit o toda información complementaria junto con las tramas codificadas.
En ciertas realizaciones, el controlador 180 puede adaptarse para iniciar el primer decodificador introductor de aliasing en dominio de tiempo 160 de modo tal que la parte de aliasing de la ventana de detención se superpone con una trama del segundo decodificador 170.
El controlador 180 puede adaptarse para aplicar un desvanecimiento cruzado entre tramas consecutivas de las muestras de audio decodificadas de los decodificadores diferentes. Asimismo, el controlador 180 puede adaptarse para determinar aliasing en una parte de aliasing de la ventana de inicio o ventana de detención de una trama decodificado del segundo decodificador 170 y el controlador 180 pude adaptarse para reducir el aliasing en la parte de aliasing en base al aliasing determinado.
En ciertas realizaciones, el controlador 180 puede adaptarse aún más por descartar el período de puesta a punto de codificación de las muestras de audio del segundo decodificador 170.
A continuación, se explicará en mayor detalle la transformada del coseno discreta modificada (MDCT = Transformada del Coseno Discreta Modificada) y se describirá la IMDCT. La MDCT se explicará más detalladamente con la ayuda de las ecuaciones ilustradas en las Figuras 2a-2j. La transformada del coseno discreta modificada es una transformada relacionada con Fourier basada en la transformada de coseno discreta de tipo IV (DCT-IV = Transformada de Coseno Discreta de Tipo IV), con la propiedad adicional de ser solapada, es decir, está diseñada para llevarse a cabo en bloques consecutivos de un conjunto de datos más grande, donde bloques subsiguientes se superposicionan de manera que, por ejemplo, (a última mitad de un bloque coincide con la primera mitad del bloque siguiente. Esta superposición, además de las cualidades de comprensión de energía de la DCT, hace a la MDCT especialmente atractiva para las aplicaciones de comprensión de señal, dado que ayuda a evitar artefactos salgan de los límites del bloque. Por lo tanto, se emplea una MDCT en MP3 (MP3 = MPEG2/4 capa 3), AC-3 (AC-3 = Códec de Audio 3 por Dolby), Ogg Vorbis, y AAC (AAC = Codificación de Audio Avanzada) para compresión de audio, por ejemplo.
MDCT fue propuesta por Princen, Johnson, y Bradley en 1987, con posterioridad al trabajo anterior (1986) por Princen y Bradley para desarrollar el -principio subyacente de la MDCT de la cancelación de aliasing en dominio de tiempo (TDAC, por sus siglas en inglés), que se describe a continuación. También existe una transformada análoga, la MDST (MDST= DST Modificada, DST= Transformada del Seno Discreta), basada en la transformada del seno discreta, así como otras formas, raramente usadas, de la MDCT basadas en tipos de combinaciones de DCT o combinaciones DCT/DST, que también pueden usarse en realizaciones por el transformador introductor de aliasing en dominio de tiempo.
En MP3, la MDCT no se aplica a la señal de audio directamente, pero a una salida de un banco de filtro de cuadratura de polifase de 32 bandas (PQF = Filtro de Cuadratura de Polifase). La salida de esta MDCT se postprocesa por una fórmula de reducción de alias para reducir el , aliasing típico del banco de filtro PQF. Dicha combinación de un filtro de banco con una MDCT se llama un banco de filtro híbrido o una MDCT de subbanda. AAC, por otro lado, usa normalmente una MDCT pura; solo la variante de MPEG-4 AAC-SSR (raramente usada) (por Sony) usa un banco PQF de cuatro bandas seguido por una MDCT. ATRAC (ATRAC = Codificación de Audio Transformada Adaptiva) usa filtros espejo en cuadratura apilados (QMF) seguido por una MDCT.
Como una transformada solapada, la MDCT es un poco inusual en comparación con las otras transformadas relacionadas con Fourier en que tiene la mitad de salidas que entradas (en lugar que el mismo número). En particular, es una función lineal F : R2N -> RN, donde R denota el set de números reales. Los números reales 2N xo X2N-1 se transforman en los números reales de N Xo,
XN-I de acuerdo con la fórmula en la Fig. 2a.
El coeficiente de normalización frente a esta transformada, aquí unidad, es una convención arbitraria y difiere entre tratamientos. Solo el producto de las normalizaciones de la MDCT y la IMDCT, a continuación, se constriñe.
La inversa de MDCT se conoce como la IMDCT! Dado que hay diferentes números de entradas y salidas, en principio puede parecer que la MDCT no debería ser invertible. Sin embargo, se alcanza la invertibilidad perfecta mediante el agregado de IMDCT superpuestas de bloques superpuestos subsiguientes, lo que causa los errores para cancelar y los datos originales a recuperarse; esta técnica se conoce como cancelación de aliasing en dominio de tiempo (TDAC).
La IMDCT transforma números reales N Xo XN-I en números reales 2N yo y2N-i de acuerdo con la fórmula en Fig. 2b. Al igual que para DCT-IV, una transformada ortogonal, la inversa tiene la misma forma que la transformada directa.
En el caso de MDCT dividida por ventanas con la normalización de ventana usual (ver a continuación), el coeficiente de normalización frente a la IMDCT debe multiplicarse por 2, es decir, se torna 2/N.
A pesar de la aplicación directa de la fórmula de la MDCT requeriría operaciones 0(N2), es posible computar la misma cosa con solo complejidad 0(N log N) mediante la factorización recursiva de la computación, como en la transformada de Fourier rápida (FFT). Uno también puede computar las MDCT a través de otras transformadas, típicamente una DFT (FFT) o una DCT, combinada con O(N) pasos de procesamiento previos y posteriores. También, cómo se describe a continuación, cualquier algoritmo para la DCT-IV proporciona inmediatamente un método para computar la MDCT e IMDCT de igual tamaño.
En aplicaciones de compresión de señal típicas, las propiedades de transformada se mejoran asimismo usando una función de ventana wn (n = 0, .... 2N-1) que multiplica con xn y yn en las fórmulas de MDCT e IMDCT más arriba a los fines de evitar discontinuidades en los límites n = 0 y 2N al hacer que la función vaya suavemente de cero a aquellos puntos. Es decir, la información se divide por ventanas antes de la MDCT y después de la IMDCT. En principio, x e y podrían tener diferentes funciones de ventana, y la función de ventana también podría cambiar de un bloque al próximo, especialmente para el caso en donde se combinan los bloques de datos de diferentes tamaño, pero para la simplicidad el caso común de las funciones de ventana idénticas para bloques de igual tamaño se considera primero.
La transformada permanece invertible, es decir, funciona TDAC para una ventana simétrica wn = w2N-i-n, siempre que w cumpla con la condición de Princen-Bradley de acuerdo con la Fig. 2c.
Las varias funciones de ventana diferente son comunes, se da un ejemplo en la Fig. 2d para MP3 y MPEG-2 AAC, y en Fig. 2e para Vorbis. AC-3 usa una ventana derivada (KBD = Derivada de Kaiser-Bessel), y MPEG-4 AAC también puede usar una ventana KBD.
Nótese que las ventanas aplicadas a la MDCT son diferentes de las ventanas usadas para otros tipos de análisis de señal, dado que deben cumplir con la condición de Princen-Bradley. Una de las razones para esta diferencia es que las ventanas de MDCT se aplican dos veces, para la MDCT (filtro de análisis) y la IMDCT (filtro de síntesis).
Como puede verse a partir de la inspección de las definiciones, para N iguales la MDCT es esencialmente equivalente a DCT-IV, en donde la entrada se cambia por N/2 y dos bloques N de datos se transforman inmediatamente. Mediante el examen de esta equivalencia de forma más cuidadosa, propiedades importantes como TDAC pueden derivarse fácilmente.
A los fines de definir la relación precisa a la DCT-IV, uno debe darse cuenta que la DCT-IV corresponde con alternar condiciones límites pares/ impares, es par en su límite izquierdo (aproximadamente n=-1/2), impar en su límite derecho (aproximadamente n=N-1/2), y así sucesivamente (en lugar de limites periódicos como para una DFT). Esto sigue de las identidades dadas en la Fig. 2f. Por lo tanto, si sus entradas con un orden x de longitud N, imagine extender este orden a (x, -XR, -x, XR, ...) y así sucesivamente puede imaginarse, donde X denota x en un orden reverso.
Considérese una MDCT con entradas 2N y salidas N, donde las entradas pueden dividirse en cuatro bloques (a, b, c, d) cada uno de tamaño N/2. Si estos se cambian por N/2 (desde el término +N/2 en la definición MDCT), luego (b, c, d) se extiende pasado el extremo de las entradas N DCT-IV, por lo tanto, deben "doblarse" de nuevo de acuerdo con las condiciones límites descriptas anteriormente.
Por lo tanto, la MDCT de entradas 2N (a, b, c, d) es exactamente equivalente a una DCT-IV de las entradas N: (-C -d, a-bf , donde R denota inversión como antes. De esta manera, cualquier algoritmo para computar la DCT-IV puede aplicarse trivialmente a la MDCT.
En forma similar, la fórmula de IMDCT, como se mencionó anteriormente, es precisamente 1/2 de la DCT-IV (que es su propia inversa), donde la salida se cambia por N/2 y se extiende (a través de las condiciones límites) a una longitud de 2N. La inversa de DCT-IV simplemente requeriría devolver las entradas (-CR-d, a-bR) de lo anterior. Cuando esto se cambia y se extiende a través de las condiciones límite, uno obtiene el resultado que se muestra en la Fig. 2g. La mitad de las salidas de IMDCT son por lo tanto redundantes.
Uno puede entender cómo funciona la TDAC. Supóngase que uno computa la MDCT del subsiguiente, 50% superpuesto, bloque 2N (c, d, e, f). La. IMDCT entonces rendirá, análogo a lo anterior: (c-dR, d-cR, e+ÍR, eR+f) / 2. Cuando esto se agrega con el anterior resultado de IMDCT en la mitad superpuesta, los términos reversos cancelan y uno obtiene simplemente (c, d), recuperando los datos originales.
El origen de la frase "cancelación de aliasing en dominio de tiempo" ahora está claro. El uso de datos de entrada que se extienden más allá de los límites de la DCT-IV lógica produce que los datos estén sujetos a aliasing en exactamente la misma manera que las frecuencias más allá de la frecuencia Nyquist están sujetas a aliasing con frecuencias más bajas, excepto que este aliasing ocurre en el dominio de tiempo en lugar del dominio de frecuencia. Por lo tanto, las combinaciones c-dR y siguientes, que tienen precisamente los signos correctos para las combinaciones para cancelar cuando se agregan.
Para el N impar (que raramente se usa en la práctica), N/2 no es un entero de manera que la MDCT no es simplemente una permutación de cambio de una DCT-IV. En este caso, el cambio adicional por media muestra significa que la MDCT/IMDCT se torna equivalente a DCT-lll/ll, y el análisis es análogo al anterior.
Más arriba la propiedad de TDAC se probó para la MDCT común lo que muestra que agregar las IMDCT a bloques posteriores en su mitad de superposición recupera los datos originales. La derivación de esta propiedad inversa para la MDCT dividida por ventanas es un poco más complicada.
Recuérdese de lo anterior que cuando (a,b,c,d) y (c,d,e,f) son sujetas a MDCT, IMDCT, y agregadas a su mitad superpuesta, obtenemos (c + dR,cR + d) / 2 + (c - dR,d - cR) / 2 = (c,d), los datos originales.
Ahora, multiplicando las entradas MDCT y las salidas IMDCT por una función de ventana de longitud 2N se supone. Como antes, asumimos una función de ventana simétrica, que es, por lo tanto, de la forma (W,Z,ZR,WR), donde w y z son vectores de longitud-N/2 y R denota inverso como antes. Entonces ia condición Princen-Bradley puede escribirse
w2 + zR2 = (1, 1, . . . \
con las multiplicaciones y sumas realizadas por elemento, o en forma equivalente
¦«4 + ** = (1, 1, . . .)
invirtiendo w y z.
Por lo tanto, en lugar de someter a MDCT (a,b,c,d), MDCT (wa,zb,ZRC,WRd) es sometida a MDCT con todas las multiplicaciones realizadas por elemento. Cuando esto es sometido a IMDCT y multiplicado nuevamente (por elemento) por la función de ventana, los resultados de mitad de última N se muestran en la Fig. 2h.
Nótese que la multiplicación por ½ no está más presente, porque la normalización de IMDCT difiere por un factor de 2 en el caso de ventana. En forma similar, la MDCT e IMDCT divididas por ventana de (c, d, e, f) rinde, en su mitad primera N de acuerdo con la Fig. 2i. Cuando estas dos mitades se suman juntas, los resultados de Fig. 2j se obtienen, recuperando los datos originales.
A continuación, se detallará una realización en la que el controlador 130 del lado del codificador y el controlador 180 del lado del decodificador,
respectivamente, modificarán la segunda regla de tramado en respuesta al cambio del primer dominio de codificación al segundo dominio de codificación. En la realización, una transición suave en un codificador cambiado, es decir, cambiando entre codificación AMR-WB+ y AAC. A los efectos de tener una transición suave, se utiliza cierta superposición, es decir, un segmento corto de una señal o una cantidad de muestras de audio, a las que se aplican ambos modos de codificación. En otras palabras, en la siguiente descripción, se proporciona una realización, en donde el primer codificador de aliasing en dominio de tiempo 110 y el primer decodificador de aliasing en dominio de tiempo 160 corresponden a la codificación y la decodificación AAC. El segundo codificador 120 y decodificador 170 corresponden a AMR-WB+ en modo ACELP. La realización corresponde a una opción de los controladores respectivos 130 y 180 en los que se modifica el tramado de la AMR-WB+, es decir, la segunda regla de tramado.
La Fig. 3 muestra una línea de tiempo en la que se muestra un número de ventanas y tramas. En la Fig. 3, una ventana regular AAC 301 es seguida por una ventana de inicio AAC 302. En la AAC, la ventana de inicio 302 AAC se utiliza entre tramas largas y cortas. A los efectos de ilustrar el legado de tramado AAC, es decir, la primera regla de tramado del codificador introductor de aliasing en dominio de tiempo 1 10 y decodificador 160, también se muestra una secuencia de ventanas AAC cortas 303en la Fig. 3. La secuencia de ventanas cortas AAC 303 se termina con una ventana de detención AAC 304, que inicia una secuencia de ventanas largas AAC. De acuerdo con la descripción que aparece más arriba, se asume en la presente realización que el segundo codificador 120, decodificador 170, respectivamente, utilizan el modo ACELP de la AMR-WB+. La AMR-WB+ utiliza tramas de igual tamaño de la cual una secuencia 320 se muestra en la Fig. 3. La Fig. 3 muestra una secuencia de tramas de prefiltro de diferentes tipos de acuerdo con ACELP en AMR-WB+. Con anterioridad a cambiar AAC por ACELP, el controlador 130 o 180 modifica la trama de la ACELP de modo tal que la primera supertrama 320 se compone de cinco tramas en lugar de cuatro. Por ende, los datos ACE 314 se encuentran disponibles en el decodificador, mientras que los datos AAC decodificados también se encuentran disponibles. Por ende, la primera parte también puede ser descartada en el decodificador, dado que este se refiere al período de puesta a punto de codificación del segundo codificador 120, el segundo decodificador 170, respectivamente. En general, en otras realizaciones la supertrama AMR-WB+ puede extenderse mediante el anexo de tramas también al final de la supertrama.
La Fig. 3 muestra dos transiciones de modo, es decir, de AAC a AMR-WB+ y de AMR-WB+ a AAC. En una realización, se utilizan las típicas ventanas de inicio/ detención 302 y 304 del códec AAC y la longitud de trama del códéc AMR-WB+ se incrementa para superponerse con la parte de desvanecimiento de la ventana de inicio/ detención del códec AAC, es decir, se modifica la segunda regla de trama. De acuerdo con la Fig. 3, las transiciones de AAC a AMR-WB+, es decir, del primer codificador de introducción de aliasing en tiempo 1 10 al segundo codificador 120 o el primer decodificador introductor de aliasing en tiempo 160 al segundo decodificador 170, respectivamente, se maneja mediante el mantenimiento de la trama AAC y la extensión de la trama de dominio de tiempo en la transición a los efectos de cubrir la superposición. La supertrama AMR-WB+ en la transición, es decir, la primera supertrama 320 en la Fig. 3, utiliza cinco tramas en lugar de cuatro; la quinta cubre la superposición. Esto introduce una sobrecarga de datos, sin embargo, la realización proporciona la ventaja de que se asegure una transición suave entre los modos AAC y AMR-WB+.
Tal como se ha mencionado anteriormente, el controlador 130 puede adaptarse para hacer el cambio entre los dos dominios de codificación en base a la característica de las muestras de audio en donde resultan concebibles un análisis u opciones diferentes. Por ejemplo, el controlador 130 puede cambiar el modo de codificación en base a una fracción estacionaria o transiente de la señal. Otra opción consistiría en que se efectúe el cambio en base a si las muestras de audio corresponden a una señal de habla más sonora o no sonora. A los efectos de proporcionar una realización detallada para determinar las características de las muestras de audio, en los siguientes, una realización del controlador 130, que cambia en base a la similitud de voz de la señal.
A título ejemplificativo, se hace referencia a las Fig. 4a y 4b, 5a y 5b, respectivamente. Los segmentos de señal o porciones de señal de impulso cuasi-periódicos y los segmentos de señal o porciones de señal de ruido se tratan a título ejemplificativo. Generalmente, los controladores 130, 180 pueden adaptarse para decidir en base a criterios diferentes, tales como, estacionalidad, transitoriedad, blancura espectral, etc. A continuación, se da un criterio ejemplar como parte de una realización. Específicamente, se ilustra un habla sonora en la Fig. 4a en el dominio de tiempo y en la Fig. 4b en el dominio de frecuencia y se explica como un ejemplo para una porción de señal de impulso cuasi-periódica y un segmento de habla no sonora como un ejemplo de una porción de señal de ruido se explica en conexión con las Figs. 5a y 5b.
Generalmente, el habla puede clasificarse en sonora, no sonora o mixta. El habla sonora es cuasi periódico en el dominio de tiempo y armónicamente estructurado en el dominio de frecuencia, mientras que el habla no sonora es aleatoria y de banda ancha. Además, la energía de los segmentos sonoros es, generalmente, mayor que la energía de los segmentos no sonoros. El espectro de corto plazo del habla sonoro se caracteriza por su estructura fina y formante. La estructura armónica fina es una consecuencia de la cuasi periodicidad del habla y puede atribuirse a las cuerdas vocales vibrantes. La estructura formante, que también se llama envolvente espectral, se debe a la interacción de la fuente y los tractos vocales. Los tractos vocales consisten de faringe y cavidad bucal. La forma del envolvente espectral que "encaja" el espectro a corto plazo del habla sonora está asociada con las características de transferencia del tracto vocal y la inclinación espectral (6 dB/octava) debido al pulso de glotis.
El envolvente espectral está caracterizado por un set de picos, que se llaman formantes. Los formantes son los modos resonantes del tracto vocal. Para el tracto vocal promedio hay de 3 a 5 formantes debajo de 5 kHz. Las amplitudes y ubicaciones de los primeros tres formantes, generalmente, ocurren debajo de 3 kHz son bastante importantes, ambos, en la síntesis del habla y percepción. Los formantes más altos son también importantes para la banda ancha y representaciones de habla no sonora. Las propiédades del habla están
relacionadas con los sistemas de producción del habla físicos como a continuación. La excitación del tracto vocal con pulsos de aire de glotis cuasi periódicos mediante la vibración de las cuerdas vocales produce el habla sonora. Se hace referencia a la frecuencia de los pulsos periódicos como la frecuencia fundamental o tono. Forzar aire a través de una constricción en el tracto vocal produce un habla no sonora. Los sonidos nasales se deben al acoplamiento acústico del tracto nasal al tracto vocal, y los sonidos oclusivos se reducen mediante la reducción abrupta de la presión de aire, que se construyó detrás del cierre del tracto.
Por lo tanto, una poción de ruido de la señal de audio puede ser una porción estacionaria en el dominio de tiempo como se ilustra en la Fig. 5a o una porción estacionaria en el dominio de frecuencia, que es diferente de la porción de impuso cuasi-periódica como se ilustra en el ejemplo en la Fig. 4a, debido al hecho de que la porción estacionaria en el dominio de tiempo no muestra pulsos de repetición permanente. Como se describirá luego, sin embargo, la diferenciación entre las porciones de ruido y las porciones de impulso cuasi-periódicas también pueden observarse con posterioridad al LPC a los efectos de la excitación de la señal. El LPC es un método que modela el tracto vocal y la excitación de los tractos vocales. Cuando el dominio de frecuencia de la señal se considera, las señales de impulso muestran una apariencia prominente de los formantes individuales, es decir, picos prominentes en la Fig. 4b, mientras que el espectro estacionario tiene un espectro bastante ancho como se ilustra en la Fig. 5b, o en el caso de las señales armónicas, un piso de ruido bastante continuo que tiene picos prominentes que representan tonos específicos que ocurren, por ejemplo, en la señal de música, pero que no tienen la distancia regular de uno al otro como la señal de impulso en la Fig. 4b.
Además, las porciones de impulso cuasi-periódicas y las porciones de ruido pueden ocurrir en el tiempo, es decir, esto significa que una porción de la señal de audio en tiempo es ruidosa y otra porción de la señal de audio en tiempo es cuasi-periódica, es decir, tonal. En forma alternativa o adicional, la característica de una señal puede ser diferente en diferentes bandas de frecuencia. Por lo tanto, la determinación, si una señal de audio es ruidosa o tonal, puede llevarse a cabo por una frecuencia de selección de manera una cierta banda de frecuencia o varias ciertas bandas de frecuencia se consideren ruidosas y otras bandas de frecuencia se consideren tonales. En este caso, una cierta porción de tiempo de la señal de audio puede incluir componentes tonales y componentes ruidosos.
Luego, se analizará el codificador CELP de análisis por síntesis con respecto a la Fig. 6. Los detalles de un codificador CELP también se pueden encontrar en "Speech Coding: A tutorial review", Andreas Spanias, Proceedings of IEEE, Vol. 84, N.°. 10, Octubre 1994, pp. 1541-1582. El codificador CELP como se ilustra en la Fig. 6 incluye un componente de predicción a largo plazo 60 y un componente de predicción a corto plazo 62. Además, se usa un libro de códigos que se usa como se indica en 64. Un filtro de ponderación perceptual W(z) se implementa en 66, y un controlador de minimización de error se proporciona en 68. s(n) es la señal de audio de entrada en dominio de tiempo. Luego de haber ponderado perceptualmente, la señal ponderada se ingresa en un sustractor 69,
que calcula el error entre la señal de síntesis ponderada en salida de bloque 66 y la señal ponderada real Sw(n).
Generalmente, la predicción de corto plazo A(z) se calcula por una etapa de análisis LPC que se explicará más adelante. Dependiendo de esta información, la predicción a largo plazo AL(z) incluye la ganancia de predicción a largo plazo b y retardo T (también conocido como ganancia de tono y retardo de tono). Entonces, el algoritmo de CELP codifica la señal residual obtenida luego de las predicciones de corto y largo plazo usando un libro de códigos de, por ejemplo, secuencias Gaussian. El algoritmo de ACELP, donde "A" significa "algebraico" tiene un libro de códigos especifico diseñado algebraicamente.
El libro de códigos puede contener más o menos vectores cada vector tiene una longitud de acuerdo con un número de muestras. Un factor de ganancia g escala el vector de código y las muestras codificadas ganadas se filtran por el filtro de síntesis a largo plazo y el filtro de síntesis de predicción a corto plazo. El vector de código "óptimo" se selecciona de manera tal que el error cuadrado promedio ponderado perceptualmente se minimice. El proceso de búsqueda en CELP es evidente a partir del esquema de análisis por síntesis ilustrado en la Fig. 6. Debe notarse que la Fig. 6 solo ¡lustra un ejemplo de un CELP análisis por síntesis y que las realizaciones no deben limitarse a la estructura que se muestra en la Fig. 6.
En CELP, el predictor de largo plazo se implementa, generalmente, como un libro de códigos adaptivo que contiene la señal de excitación previa. El retardo de predicción a largo plazo y ganancia se representan por un índice de libro de códigos adaptivo y ganancia, que también se seleccionan por la minimización del
error ponderado cuadrado promedio. En este caso la señal de excitación consiste en la adición de dos vectores de ganancia escalada, uno de un libro de códigos adaptivo y otro de un libro de códigos fijo. El filtro de ponderación perceptual en AMR-WB+ está basado en el filtro LPC, por lo tanto la señal perceptualmente ponderada está en una forma de una señal de dominio LPC. En el codificador de dominio de transformación usado en AMR-WB+, la transformación se aplica a la señal ponderada. En el decodificador, la señal de excitación puede obtenerse mediante la filtración de la señal ponderada decodificada a través de un filtro que consiste de la inversa de filtros de síntesis y ponderación.
La funcionalidad de una realización de una etapa de análisis de codificación predictiva 12 se analizará posteriormente de acuerdo con la realización que se muestra en las Figs. 7, usando análisis LPC y síntesis LPC en los controladores 130,180 en las realizaciones correspondientes.
La Fig. 7 ilustra una implementación más detallada de una realización de un bloque de análisis LPC. La señal de audio se ingresa en un bloque de determinación de filtro, que determina la información de filtro A(z), es decir, la información sobre los coeficientes para el filtro de síntesis. La información es cuantificada y se produce la salida como la información de predicción de corto plazo requerida por el decodificador. En un sustractor 786, una muestra actual de señal se ingresa y un valor de predicción para la muestra actual se sustrae de tal manera para la muestra, la señal de error de predicción se genera en la línea 784. Nótese que la señal de error de predicción también puede llamarse señal de excitación o trama de excitación (generalmente después de codificarse).
La Fig. 8a muestra otra secuencia de tiempo de ventanas que se logra con otra realización. En la realización considerada a continuación, el códec AMR-WB+ corresponde al segundo codificador 120 y el códec AAC corresponde al primer codificador introductor de aliasing en dominio de tiempo 110. La siguiente realización mantiene la trama del códec AMR-WB+, es decir, la segunda regla de tramado permanece sin modificaciones, pero se modifica la división en ventanas en la transición del códec AMR-WB+ al códec AAC, se manipulan las ventana de inicio/ detención del códec AAC. En otras palabras, la división en ventanas del códec AAC será más larga en la transición.
Las Fig. 8a y 8b ilustran esta realización. Ambas Figuras muestran una secuencia de ventanas AAC convencionales 801 en las que, en la Fig. 8a se introduce una nueva ventana de detención modificada 802 y en la Fig. 8b, una nueva ventana de detención/ inicio 803. En lo que respecta al ACELP, se muestra un tramado similar tal como se ha descripto respecto de la realización utilizada en la Fig. 3. En la realización que resulta en la secuencia de ventana tal como se muestra en las Figs. 8a y 8b, se asume que el tramado de códec AAC normal no se mantiene, es decir, se utilizan las ventanas de inicio, la detención o inicio/ detención modificadas. La primera ventana que aparece en las Figs. 8a es para la transición de AMR-WB+ a AAC, donde el códec AAC utilizará una ventana de detención larga 802. Se describirá otra ventana con la ayuda de la Fig. 8b, que muestra la transición de AMR-WB+ a AAC cuando el códec AAC utilizará una ventana corta, usando una ventana AAC larga para esta transición, según lo indica la Fig. 8b. La Fig. 8a muestra que la primera supertrama 820 del ACELP
comprende cuatro tramas, es decir, es acorde al tramado ACELP convencional, es decir, la segunda regla de tramado. A los efectos de mantener la regla dé tramado ACELP, es decir la segunda regla de tramado se mantiene sin modificaciones, se utilizan las ventanas modificadas 802 y 803 según lo indican las Figs. 8a y 8b.
Por ende, a continuación, se introducirán, en general, algunos detalles respecto de la división de ventanas.
La Fig. 9 muestra una ventana rectangular general, en la que la información de la secuencia de ventana puede comprender una primera parte cero, en la que la ventana enmascara muestras, una segunda parte de bypass (sobrepaso), en la que las muestras de una trama, es decir, una trama de dominio de tiempo de entrada o una trama de dominio de tiempo superpuesta puede pasar no modificada, y una tercera parte cero, que nuevamente enmascara muestras al final de la trama. En otras palabras, las funciones de ventana puede aplicarse, lo que suprime un número de muestras de una trama en la primer parte cero, pasa a través de las muestras en la segunda parte de bypass, y luego suprime muestras al final de la trama en una tercera parte cero. En este contexto, supresión también se puede referir a adjuntar una secuencia de ceros al comienzo y/o final de la parte de bypass de la ventana. La segunda parte de bypass puede ser tal que la función de ventana simplemente tiene un valor de 1 , es decir, las muestras pasan sin modificaciones, es decir, la función de ventana cambia a través de las muestras de la trama.
La Fig. 10 muestra otra realización de una secuencia de ventana o función de ventana, en donde la secuencia de ventana además comprende una parte de
flanco de subida entre la primera parte cero y la segunda parte de bypass y una parte de flanco de bajada entre la segunda parte de bypass y la tercera parte cero. La parte de flanco de subida también puede considerarse como una parte de intensificación y el flanco de bajada puede considerarse como la parte de desvanecimiento. En realizaciones, la segunda parte de bypass puede comprender una secuencia de unos por no modificar de ningún modo las muestras de una trama de excitación.
Volviendo a la realización que se muestra en la Fig. 8a, la ventana de detención modificada, tal como se utiliza en la realización que transita entre el AMR-WB+ y AAC, cuando transita de AMR-WB+ a AAC se muestra más detalladamente en la Fig. 1 1. La Fig. 11 muestra las tramas ACELP 1101 , 1 102, 1103 y 1104. La ventana de detención modificada 802 es entonces usada para transitar a AAC, es decir, al primer codificador introductor de aliasing en dominio de tiempo 110, decodificador 160, respectivamente. De acuerdo con los detalles del MDCT establecidos anteriormente, la ventana ya se inicia en la mitad de la trama 1 102, con una primera parte cero de 512 muestras. A esta parte la sigue la parte de flanco de subida de la ventana, que se extiende a través de 128 muestras seguidas por la segunda parte de bypass que, en esta realización, se extiende a 576, es decir, 512 muestras luego de que la parte de flanco de subida a la que la primera parte cero se dobla, seguido de 64 muestras más de la segunda parte de bypass, que resulta de la tercera parte cero al final de la ventana extendida a través de 64 muestras. La parte de flanco de bajada de dicha ventana resulta en 1024 muestras, que deben superponerse con la siguiente ventana.
La realización puede describirse también utilizando un seudo código, que se ejemplifica mediante:
/* Cambio de bloques basados en ataques */
Si( hay un ataque) {
nextwindowSequence = SHORT_WINDOW;
}
o {
nextwindowSequence = LONG_WINDOW;
}
/* Cambio de bloque en base a Decisión de Cambio ACELP */
si (la próxima trama es AMR) {
nextwindowSequence = SHORT_WINDOW;
}
/* Cambio de bloque en base a Decisión de cambio ACELP para
STOP_WINDOW_1152 */
si (el nombre real es AMR && próxima trama no es AMR) {
nextwindowSequence = STOP_WINDOW_1 152;
}
/'Cambio de bloque para STOPSTART_WINDOW_1152
si (nextwindowSequence == SHORT_WINDOW) {
si (windowSequence == STOP_WINDOW_1152) {
windowSequence = STOPSTART_WINDOW_1152;
}
}
Volviendo a la realización que se muestra en la Fig. 11 , existe una sección de doblaje de aliasing de tiempo dentro de la parte del flanco de subida de la ventana, que se extiende a través de 128 muestras. Dado que esta sección se superpone con la última trama ACELP 1104, la salida de la trama ACELP 1104 puede utilizarse para la cancelación de aliasing en tiempo en la parte de flanco de subida. La cancelación de aliasing puede efectuarse en el dominio de tiempo o en el dominio de frecuencia, en línea con los ejemplos descriptos anteriormente. En otras palabras, la salida de la última trama ACELP puede transformarse al dominio de frecuencia y puede luego superponerse con la parte de flanco de subida de la ventana de detención modificada 802. De manera alternativa, TDA o TDAC pueden aplicarse a la última trama ACELP antes de superponerse con la parte de flanco de subida de la ventana de detención modificada 802.
La realización anteriormente descripta reduce la sobrecarga generada en las transiciones. También elimina la necesidad de que se efectúen modificaciones al tramado del código de dominio de tiempo, es decir la segunda regla de trama. Asimismo, también adapta el codificador de dominio de frecuencia, es decir, el codificador introductor de aliasing en dominio de tiempo 110 (AAC), que generalmente es más flexible en términos de distribución de bits y cantidad de coeficientes a transmitir que un codificador de dominio de tiempo, es decir, el segundo codificador 120. >
Posteriormente, se describirá otra realización, que proporciona un desvanecimiento cruzado libre de aliasing cuando se produce el cambio entre el primer codificador introductor de aliasing en dominio de tiempo que 1 10 y el segundo codificador 120, los decodificadores 160 y 170, respectivamente. Esta realización proporciona la ventaja de que se evite el ruido debido a TDAC, especialmente en bajas tasas de bit, en caso de procedimientos de inicio o de reinicio. La ventaja se logra mediante una realización que tiene una ventana de inicio AAC modificada sin aliasing en tiempo en la parte derecha o en la parte del flanco de bajada de la ventana. La ventana de inicio modificada constituye una ventana asimétrica, esto es, la parte derecha o la parte del flanco de bajada de la ventana termina antes del punto de punto de doblaje de la MDCT. En consecuencia, la ventana es libre de aliasing en tiempo. Al mismo tiempo, la región de superposición puede reducirse mediante realizaciones a 64 muestras en lugar de 128 muestras.
En ciertas realizaciones, el codificador de audio 100 o el decodificador de audio 150 puede tomar cierto tiempo antes de entrar en un estado permanente o estable. En otras palabras, durante el período de inicio del codificador de dominio de tiempo, es decir, el segundo codificador 120 y también el decodificador 170, se necesita cierta cantidad de tiempo a los efectos de iniciar, por ejemplo, los coeficientes de una LPC. A los efectos de suavizar el error en el caso del reseteo, en ciertas realizaciones, la parte izquierda de una señal de entrada AMR-WB+ puede dividirse en ventanas con una ventana de seno corta en el codificador 120, por ejemplo, que tiene un largo de 64 muestras. Asimismo, la parte izquierda de la señal se síntesis puede dividirse en ventanas con la misma señal en el segundo decodificador 170. De este modo, la ventana de seno cuadrado puede aplicarse de un modo similar a AAC, aplicando el seno cuadrado a la parte derecha de su ventana de inicio.
Mediante el uso de esta división en ventanas, en una realización, la transición de AAC a AMR-WB+ puede efectuarse sin aliasing en tiempo y puede efectuarse mediante una ventana de seno de desvanecimiento cruzado tal como, por ejemplo, 64 muestras. La Fig. 12 muestra una línea de tiempo que ejemplifica una transición de AAC a AMR-WB+ y de vuelta a AAC. La Fig. 12 muestra una ventana de inicio AAC 1201 seguida de la parte AMR-WB+ 1203 que se superpone con la ventana AAC 1201 y con la región 1202, que se extiende a través de 64 muestras. La parte AMR-WB+ es seguida por una ventana de detención AAC 1205, que se superpone con 128 muestras.
De acuerdo con la Fig. 12, la realización aplica a la ventana libre de aliasing respectiva en la transición de AAC a AMR-WB+.
La Fig. 13 muestra la ventana de inicio modificada, tal como se aplica cuando se transita de AAC a AMR-WB+ en ambos lados en el codificador 100 y el decodificador 150, el codificador 110 y el decodificador 160, respectivamente.
La ventana que aparece en la Fig. 13 muestra que la primera parte cero no se encuentra presente. La ventana se inicia directamente con la parte de flanco de subida, que se extiende a través de 1024 muestras, es decir, el eje de doblaje se encuentra en la mitad del intervalo 1024 que aparece en la Fig. 13. La simetría axial aparece entonces en el lado derecho del intervalo 1024. Tal como puede verse en la Fig. 13, la tercera parte cero se extiende a 512 muestras, es decir, no hay aliasing en la parte de mano derecha de la ventana entera, es decir la parte de bypass se extiende desde el centro hacia el comienzo del intervalo de la muestra 64. También se puede observar que la parte de flanco de bajada se extiende a través de 64 muestras, lo que proporciona la ventaja de que la sección cruzada sea angosta. El intervalo de muestra 64 se utiliza para desvanecimiento cruzado, sin embargo, no se encuentra presente aliasing en este intervalo. Por ende, solamente se introduce una sobrecarga baja.
Las realizaciones con las ventanas modificadas anteriormente descriptas pueden evitar codificar demasiada información de sobrecarga, es decir, codificar algunas muestras dos veces. De acuerdo con la descripción que aparece anteriormente, las ventanas diseñadas de manera similar pueden aplicarse opcionalmente a la transición de AMR-WB+ a AAC de acuerdo con una realización donde modificar nuevamente la ventana AAC, también reducir la superposición a 64 muestras.
Por ende, la ventana de detención modificada se alarga a 2304 muestras en una realización y se utiliza en un punto 1152 MDCT. La parte izquierda de la ventana puede realizarse libre de aliasing de tiempo mediante el comienzo del desvanecimiento luego del eje de doblaje MDCT. En otras palabras, mediante la realización de la primera parte cero más grande que un cuarto del tamaño entero de MDTC. La ventana de seno cuadrado complementaria entonces se aplica a las últimas 64 muestras decodificadas del segmento AMR-WB+. Estas dos ventanas de desvanecimiento cruzado permiten obtener una transición suave de AMR-WB+ a AAC mediante la limitación de la información transmitida de la sobrecarga.
La Fig. 14 ilustra la ventana para la transición de AMR-WB+ a AAC tal como habría sido aplicada en el lado del codificador 100 en una realización. Puede verse que el eje de doblaje es posterior a.576 muestras, es decir, la primera parte cero se extiende a través de de 576 muestras. Estas consecuencias en la parte izquierda de la ventana entera son libres de aliasing. El desvanecimiento cruzado arranca en el segundo cuarto de la ventana, es decir luego de 576 muestras o, en otras palabras, justo más allá del eje de doblaje. La sección de desvanecimiento cruzado, es decir, la parte de flanco de subida de la ventana puede achicarse a 64 muestras de acuerdo con la Fig. 14.
La Fig. 15 muestra la ventana para la transición de AMR-WB+ a ACC aplicada al lado del decodificador 150 en una realización. La ventana es similar a la ventana descripta en la Fig. 14, de modo tal que la aplicación de ambas ventanas a través de muestras codificadas y luego decodificadas nuevamente resulta en una ventana de seno cuadrado.
El siguiente seudo código describe una realización de un procedimiento de selección de ventana de arranque, cuando ocurre el cambio de AAC a AMR-WB+.
Estás realizaciones también pueden describirse mediante el uso de un seudo código tal como, por ejemplo:
/* Ajustar a una Secuencia de Ventana permitida */
si(nextw¡ndowSequence == SHORT_WINDOW) {
si(window¿equence == LONG_WINDOW){
si(la trama real no es AMR && próxima trama es AMR) {
windowSequence = START_W I N DOW_AM R;
}
°{
windowSequence = START_WINDOW;
}
}
Las realizaciones tal como se describen anteriormente reducen la sobrecarga de información mediante el uso de pequeñas regiones de superposición en ventanas consecutivas durante la transición. Lo que es más, estas realizaciones proporcionan la ventaja de que estas regiones de superposición pequeñas todavía bastan para suavizar los artefactos de bloqueo, es decir tener un desvanecimiento cruzado suave. Asimismo, reduce el impacto de la explosión de error debido al inicio del codificador de dominio de tiempo, es decir, el segundo codificador 120, decodificador 170, respectivamente, mediante iniciación con una entrada de desvanecimiento.
Resumir las realizaciones de la presente invención proporciona la ventaja de que las regiones cruzadas suavizadas pueden realizarse en un concepto de codificación de audio de modo múltiple a una alta eficiencia de codificación, es decir, las ventanas de transición introducen solamente una sobrecarga baja en términos de información adicional a ser transmitida. Incluso, las realizaciones permiten el uso de codificadores de modo múltiple, mientras que adaptan la trama o la división de. ventana de un modo a otro.
A pesar de que se hubieran descripto algunos aspectos en el contexto de un aparato, resulta claro que estos aspectos también representan una descripción del método correspondiente, donde un bloque o aparato corresponde a un paso de un método o a una característica de un paso de un método. De forma análoga, los aspectos descriptos en el contexto de un paso de un método también representan una descripción de un bloque o elemento o característica correspondiente de un aparato correspondiente.
La señal de audio codificada inventiva puede guardarse en un medio de almacenamiento digital o bien, puede transmitirse en un medio de transmisión tal como un medio de transmisión inalámbrica o alambica, como internet.
Con sujeción a ciertos requerimientos de implementación, las realizaciones de esta invención pueden implementarse en hardware o en software. La implementación puede realizarse mediante el uso de un medio de almacenamiento digital, por ejemplo un disco floppy, un DVD, un CD, un ROM, un PROM, un EPROM, un EEPROM o una memoria FLASH, con señales de control legibles electrónicamente allí almacenadas, que cooperan (o que pueden cooperar) con un sistema de computación programable de modo tal que el método respectivo se efectúe.
Algunas realizaciones de acuerdo con la invención comprenden un transportador de datos que tienen señales de control legibles electrónicamente, capaces de cooperar con un sistema informático programable, de modo tal que se realice uno de los métodos descriptos en el presente.
En general, las realizaciones de la presente invención pueden implementarse como un producto de programa de computación con un código de programa, que resulta operativo para efectuar uno de los métodos cuando el producto del programa de informático funciona en una computadora. El código del programa puede, por ejemplo, guardarse en un portador legible por máquina.
Otras realizaciones comprenden al programa informático para realizar uno de los métodos descriptos en el presente/almacenados en un portador legible por máquina.
En otras palabras, una realización del método de invención constituye, por ende, un programa informático que tiene un código de programa para efectuar uno de los métodos descriptos en el presente, cuando el programa de computación opera en la computadora.
Otra realización de los métodos de la invención constituye, por ende, un portador de datos (o un medio de almacenamiento digital, o un medio legible por computadora) que comprende, almacenado allí, al programa informático para realizar uno de los métodos descriptos en el presente.
Otra realización de los métodos de la invención constituye, por ende, un flujo de datos o una secuencia de señales que representan el programa informático para realizar uno de los métodos descriptos en el presente. El flujo de datos o la secuencia de señales pueden, por ejemplo, configurarse para ser transferidos vía una conexión de comunicación de datos, por ejemplo, vía internet.
Otra realización comprende un medio de procesamiento, por ejemplo, una computadora, o un dispositivo lógico programable, configurado o adaptado para realizar unos de los métodos descriptos en el presente.
Otra realización comprende una computadora que tenga instalado el programa de computación para realizar uno de los métodos descriptos en el presente.
En algunas realizaciones, un dispositivo lógico programable (por ejemplo, una matriz de puertas programable en el campo) puede utilizarse para realizar algunas o la totalidad de las funcionalidades de los métodos descriptos en el presente. En algunas realizaciones, una matriz de puertas programable puede cooperar con un microprocesador a los efectos de realizar uno de los métodos descriptos en el presente. En general, los métodos son preferentemente realizados por un aparato de hardware.
Las realizaciones descriptas anteriormente simplemente ¡lustran los principios de la presente invención. Se entiende que las modificaciones y variaciones de los arreglos y los detalles descriptos en el presente resultarán aparentes para otros versados en la técnica. Por ende, se intenta encontrar un límite solamente en el alcance de las reivindicaciones de la presente patente y no en los detalles específicos presentados por medio de una descripción y explicación de las realizaciones que se encuentran en el presente.
Claims (33)
1. Un codificador de audio (100) para codificar muestras de audio, que comprende: un primer codificador introductor de aliasing en dominio de tiempo (110) para codificar muestras de audio en un primer dominio de codificación, el primer codificador introductor de aliasing en dominio de tiempo (110) que tiene una primer regla de tramado, una ventana de inicio y una ventana de detención; un segundo codificador (120) para codificar muestras en un segundo dominio de codificación, el segundo codificador (120) que tiene un número de muestras de audio de tamaño de trama predeterminado, y un número de muestras de audio de periodo de puesta a punto de codificación, y el segundo codificador (120) que tiene una segunda regla de tramado diferente, una trama del segundo codificador (120) que es una representación codificada de un número de muestras de audio posteriores en el tiempo, el número es igual al número de muestras de audio de tamaño de trama predeterminado; y un controlador (130) para cambiar del primer codificador (110) al segundo codificador (120) en respuesta a una característica de las muestras de audio, y para modificar la segunda regla de tramado en respuesta al cambio del primer codificador (110) al segundo codificador (120) o para modificar la ventana de inicio o la ventana de detención del primer codificador (110), en donde la segunda regla de tramado permanece sin modificaciones.
2. El codificador de audio (100) de la reivindicación 1 , en donde el primer codificador introductor de aliasing en dominio de tiempo (110) comprende un transformador de dominio de frecuencia para transformar una primera trama de muestras de audio posteriores al dominio de frecuencia.
3. El codificador de audio (100) de la reivindicación 2, en donde se adapta el primer codificador introductor de aliasing en dominio de tiempo (110) para la ponderar la última trama con la ventana de inicio cuando una trama posterior es codificada por el segundo codificador (120) y/o para ponderar la primera trama con la ventana de detención cuando una trama precedente va a ser codificada por el segundo codificador (120).
4. El codificador de audio (100) de una de las reivindicaciones 2 o 3, en donde se adapta el transformador de dominio de frecuencia para transformar la primer trama al dominio de frecuencia en base a una tránsformada del coseno discreta modificada (MDCT) y en donde se adapta el primer codificador introductor de aliasing en dominio de tiempo (110) para adaptar un tamaño de MDCT a las ventanas de inicio y/o detención y/o inicio y/o detención modificadas.
5. El codificador de audio (100) de una de las reivindicaciones 1 a 4, en donde se adapta el primer codificador introductor de aliasing en dominio de tiempo (110) para utilizar una ventana de inicio y/o detención que tiene una parte de aliasing y/o parte libre de aliasing.
6. El codificador de audio (100) de una de las reivindicaciones de 1 a 5, en donde se adapta el primer codificador introductor de aliasing en dominio de tiempo (110) para utilizar una ventana de inicio y/o ventana de detención que tiene una parte libre de aliasing como una parte de flanco de •subida de la ventana cuando la trama precedente es codificada por el segundo codificador (120) y en una parte de flanco de bajada cuando la trama posterior es codificada por el segundo codificador (120).
7. El codificador de audio (100) de una de las reivindicaciones 5 o 6, en donde se adapta el controlador (130) para iniciar el segundo codificador (120), de manera que la primer trama de una secuencia de tramas del segundo codificador (120) comprende una representación codificada de una muestra procesada en la parte libre de aliasing precedente del primer codificador (110).
8. El codificador de audio (100) de una de las reivindicaciones 5 o 6, en donde se adapta el controlador (130) para iniciar el segundo codificador (120), de manera que el número de muestras de audio de periodo de puesta a punto de codificación se superpone con la parte libre de aliasing de la ventana de inicio del primer codificador introductor de aliasing en dominio en tiempo (110) y la trama posterior del segundo codificador (120) se superpone con la parte de aliasing de la ventana de detención.
9. El codificador de audio (100) de una de las reivindicaciones 5 a 7, en donde se adapta el controlador (130) para iniciar el segundo codificador (120), de manera que el periodo de puesta a punto de codificación se superpone con la parte de aliasing de la ventana de inicio.
10. El codificador de audio (100) de una de las reivindicaciones de 1 a 9, en donde además se adapta el controlador (130) para cambiar del segundo codificador (120) al primer codificador (110) en respuesta a una característica diferente de las muestras de audio y para modificar la segunda regla de tramado en respuesta al cambio del segundo codificador (120) al primer codificador (110) o para modificar la ventana de inicio o la ventana de detención del primer codificador (110), en donde la segunda regla de tramado permanece sin modificaciones.
11. El codificador de audio de la reivindicación 10, en donde se adapta el controlador (130) para iniciar el primer codificador de aliasing en dominio de tiempo (110), de manera que la parte de aliasing de la ventana de detención se superpone con la trama del segundo codificador (120).
12. El codificador de audio (100) de la reivindicación 11 , en donde se adapta el controlador (130) para iniciar el primer codificador introductor de aliasing en dominio de tiempo (110), de manera que la parte libre de aliasing de la ventana de detención se superpone con una trama del segundo codificador (120).
13. El codificador de audio (100) de una de las reivindicaciones 1 a 12, en donde el primer codificador de aliasing en dominio de tiempo (110) comprende un codificador AAC de acuerdo con la Codificación Genérica de Imágenes de Movimiento y Audio Asociado: Codificación de Audio Avanzado, Estándar Internacional 13818-7, ISO/IEC JTC1/SC29/WG11 MPEG, 1997.
14. El codificador de audio (100) de una de las reivindicaciones 1 a 13, en donde el segundo codificador comprende un codificador AMR o AMR-WB+ de acuerdo con el Proyecto de Asociación de Tercera Generación (3GPP), especificación técnica (TS), 26.290, versión 6.3.0 a partir de junio de 2005.
15. El codificador de audio de la reivindicación 14, en donde se adapta el controlador para modificar la regla de tramado AMR, de manera que la primera supertrama AMR comprende cinco tramas AMR.
16. Un método para codificar las tramas de audio, que comprende los pasos de: codificar las muestras de audio en un primer dominio de codificación usando una primer regla de tramado, una ventana de inicio y una ventana de detención; codificar muestras de audio en un segundo dominio de codificación usando un número de muestras de audio de tamaño de trama predeterminado y un número de muestras de audio de periodo de puesta a punto de codificación y usar una segunda regla de tramado diferente, la trama del segundo dominio de codificación que es una representación codificada de un número de muestras de audio posteriores en el tiempo, el número que es igual al número de muestras de audio de tamaño de trama predeterminado; cambiar del primer dominio de codificación al segundo dominio de codificación; y modificar la segunda regla de tramado en respuesta al cambio del primer al segundo dominio de codificación modificar la ventana de inicio o la ventana de detención del primer dominio de codificación, en donde la segunda regla de tramado permanece sin modificaciones.
17. Un programa informático que tiene un código de programa para llevar a cabo el método de la reivindicación 16, cuando el código de programa funciona en una computadora o procesador.
18. Un decodificador de audio (150) para decodificar tramas codificadas de muestras de audio, que comprende: un primer decodificador introductor de aliasing en dominio de tiempo (160) para decodificar muestras de audio en un primer dominio de decodificación, el decodificador introductor de aliasing en dominio de tiempo (160) que tiene una primera regla de tramado, una ventana de inicio y una ventana de detención; un segundo decodificador (170) para decodificar muestras de audio en un segundo dominio de decodificación y el segundo decodificador (170) que tiene un número de muestras de audio de tamaño de trama predeterminado y un número de muestras dé audio de periodo de puesta a punto de codificación, el segundo decodificador (170) que tiene un segunda regla de tramado diferente, una trama del segundo codificador (170) que es representación codificada de un número de muestras de audio posteriores en el tiempo, el número que es igual al número de muestras de audio de tamaño de trama predeterminado; y un controlador (180) para cambiar del primer decodificador (160) al segundo decodificador (170) en base a una indicación en la trama codificada de las muestras de audio, en donde se adapta el controlador (180) para, modificar la segunda regla de tramado en respuesta al cambio del primer decodificador (160) al segundo decodificador (170) o para modificar la ventana de inicio o la ventana de detención del primer decodificador (160), en donde la segunda regla de tramado permanece sin modificaciones.
19. El decodificador de audio (150) de la reivindicación 19, en donde el primer decodificador (160) comprende un transformador de dominio de tiempo para transformar una primera trama de muestras de audio decodificadas al dominio de tiempo.
20. El decodificador de audio (150) de una de las reivindicaciones 18 o 19, en donde se adapta el primer decodificador (160) para ponderar la última trama decodificada con la ventana de inicio cuando la trama posterior es decodificada por el segundo decodificador (170) y/o para ponderar la primera trama decodificada con la ventana de detención cuando la trama precedente va a ser decodificada por el segundo decodificador (170).
21. El decodificador de audio (150) de una de las reivindicaciones 19 o 20, en donde se adapta el transformador de dominio de tiempo para transformar la primer trama al dominio de tiempo en base a la MDCT inversa (IMDCT) y en donde se adapta el primer decodificador introductor de allasing en dominio de tiempo (160) para adaptar un tamaño de IMDCT a las ventanas de inicio y/ o detención o inicio y/o detención modificadas.
22. El decodificador de audio (150) de una de las reivindicaciones 18 a 21 , en donde se adapta el primer decodificador introductor de aliasing en dominio de tiempo (160) para utilizar una ventana de inicio y/o ventana de detención que tiene una parte de aliasing y un parte libre de aliasing.
23. El decodificador de audio (150) de una de las reivindicaciones 18 a 22, en donde se adapta el primer decodificador introductor de aliasing en dominio de tiempo (110) para utilizar una ventana de inicio y/o una ventana de detención que tiene una parte libre de aliasing en una parte de flanco de subida de la ventana cuando la trama precedente es decodificada por el segundo decodificador (170) y una parte de flanco de bajada cuando la trama posterior es codificada por el segundo decodificador (170).
24. El decodificador de audio (150) de acuerdo con una de las reivindicaciones 22 o 23, en donde se adapta el controlador (180) para iniciar el segundo decodificador (170), de manera que la primera trama de la secuencia de tramas del segundo decodificador (170) comprende una representación codificada de una muestra procesada en la parte libre de aliasing precedente del primer codificador (160).
25. El decodificador de audio (150) de una de las reivindicaciones 22 a 24, en donde se adapta el controlador (180) para iniciar el segundo decodificador (170), de manera que el número de muestras de audio del periodo de puesta punto de codificación se superpone con la parte libre de aliasing de la ventana de inicio del primer decodificador introductor de aliasing en dominio de tiempo (160) y la trama posterior del segundo decodificador (170) se superpone con la parte de aliasing de la ventana de detención.
26. El decodificador de audio (150) de una de las reivindicaciones 22 a 24, en donde se adapta el controlador (180) para iniciar el segundo decodificador (170), de manera que el periodo de puesta a punto de codificación se superpone con la parte de aliasing de la ventana de detención.
27. El decodificador (150) de una de las reivindicaciones 18 a 26, en donde además se adapta el controlador (180) para cambiar del segundo decodificador (170) al primer decodificador (160) en respuesta a una indicación de las muestras de audio y para modificar la segunda regla de tramado en respuesta al cambio del segundo decodificador (170) al primer decodificador (160) o para modificar la ventana de inicio o la ventana de detención del primer decodificador (160), en donde la segunda regla de tramado permanece sin modificaciones.
28. El decodificador de audio (150) de la reivindicación 27, en donde se adapta el controlador (180) para iniciar el primer decodificador introductor de aliasing en dominio de tiempo (160), de manera que la parte de aliasing de la ventana de detención se superpone con una trama del segundo decodificador (170).
29. El decodificador de audio (150) de una de las reivindicaciones 18 a 28, en donde se adapta el controlador (180) para aplicar un desvanecimiento cruzado entre tramas consecutivas de muestras de audio decodificadas de diferentes decodificadores.
30. El decodificador de audio (150) de una de las reivindicaciones 18 a 29, en donde se adapta el controlador (180) para determinar un aliasing en un parte de aliasing de la ventana de inicio o detención de una trama decodificada del segundo decodificador (170) y para reducir el aliasing en la parte de aliasing en base al aliasing determinado.
31. El decodificador de audio (150) de una de las reivindicaciones 18 a 30, en donde se adapta el controlador (180) para descartar el periodo de puesta a punto de codificación de las muestras de audio del segundo decodificador (170).
32. Un método para decodificar tramas codificadas de muestras de audio, que comprende los pasos de decodificar muestras de audio en un primer dominio de decodificación, el primer dominio de decodificación que introduce aliasing en tiempo y que tiene una primera regla de tramado, una ventana de inicio y una ventana de detención; decodificar muestras de audio en un segundo dominio de decodificación, el segundo dominio de decodificación que tiene un número de muestras de audio de tamaño de trama predeterminado y un número de muestras de audio de período de puesta a punto de codificación, el segundo dominio de decodificación que tiene una regla de tramado diferente, una trama del segundo dominio de decodificación que es una representación decodificada de un número de muestras de audio posteriores en el tiempo, el número que es igual al número de muestras de audio de tamaño de trama predeterminado; y cambiar del primer dominio de decodificación al segundo dominio de decodificación en base a una indicación de la trama codificada de muestras de audio; modificar la segunda regla de tramado en respuesta al cambio del primer dominio de codificación al segundo dominio de codificación o modificar la ventana de inicio y/o la ventana de detención del primer dominio de decodificación, en donde la segunda regla de tramado permanece sin modificaciones.
33. Un programa informático que tiene un código de programa para llevar a cabo el método de la reivindicación 32, cuando el código de programa funciona en una computadora o procesador.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US7985608P | 2008-07-11 | 2008-07-11 | |
| US10382508P | 2008-10-08 | 2008-10-08 | |
| PCT/EP2009/004651 WO2010003563A1 (en) | 2008-07-11 | 2009-06-26 | Audio encoder and decoder for encoding and decoding audio samples |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| MX2011000366A true MX2011000366A (es) | 2011-04-28 |
Family
ID=40951598
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| MX2011000366A MX2011000366A (es) | 2008-07-11 | 2009-06-26 | Codificador y decodificador de audio para codificar y decodificar muestras de audio. |
Country Status (21)
| Country | Link |
|---|---|
| US (1) | US8892449B2 (es) |
| EP (2) | EP3002750B1 (es) |
| JP (2) | JP5551695B2 (es) |
| KR (1) | KR101325335B1 (es) |
| CN (1) | CN102089811B (es) |
| AR (1) | AR072738A1 (es) |
| AU (1) | AU2009267466B2 (es) |
| BR (1) | BRPI0910512B1 (es) |
| CA (3) | CA2871498C (es) |
| CO (1) | CO6351837A2 (es) |
| EG (1) | EG26653A (es) |
| ES (2) | ES2657393T3 (es) |
| HK (1) | HK1223453A1 (es) |
| MX (1) | MX2011000366A (es) |
| MY (3) | MY159110A (es) |
| PL (2) | PL2311032T3 (es) |
| PT (1) | PT3002750T (es) |
| RU (1) | RU2515704C2 (es) |
| TW (1) | TWI459379B (es) |
| WO (1) | WO2010003563A1 (es) |
| ZA (1) | ZA201100089B (es) |
Families Citing this family (62)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP5328804B2 (ja) * | 2007-12-21 | 2013-10-30 | フランス・テレコム | 適応型ウィンドウを有する変換ベースの符号化/復号化 |
| MX2011000375A (es) * | 2008-07-11 | 2011-05-19 | Fraunhofer Ges Forschung | Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada. |
| CN104240713A (zh) | 2008-09-18 | 2014-12-24 | 韩国电子通信研究院 | 编码方法和解码方法 |
| KR101649376B1 (ko) | 2008-10-13 | 2016-08-31 | 한국전자통신연구원 | Mdct 기반 음성/오디오 통합 부호화기의 lpc 잔차신호 부호화/복호화 장치 |
| WO2010044593A2 (ko) | 2008-10-13 | 2010-04-22 | 한국전자통신연구원 | Mdct 기반 음성/오디오 통합 부호화기의 lpc 잔차신호 부호화/복호화 장치 |
| US9384748B2 (en) * | 2008-11-26 | 2016-07-05 | Electronics And Telecommunications Research Institute | Unified Speech/Audio Codec (USAC) processing windows sequence based mode switching |
| KR101622950B1 (ko) * | 2009-01-28 | 2016-05-23 | 삼성전자주식회사 | 오디오 신호의 부호화 및 복호화 방법 및 그 장치 |
| US8457975B2 (en) * | 2009-01-28 | 2013-06-04 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio decoder, audio encoder, methods for decoding and encoding an audio signal and computer program |
| US8892427B2 (en) | 2009-07-27 | 2014-11-18 | Industry-Academic Cooperation Foundation, Yonsei University | Method and an apparatus for processing an audio signal |
| PL2471061T3 (pl) | 2009-10-08 | 2014-03-31 | Fraunhofer Ges Forschung | Działający w wielu trybach dekoder sygnału audio, działający w wielu trybach koder sygnału audio, sposoby i program komputerowy stosujące kształtowanie szumu oparte o kodowanie z wykorzystaniem predykcji liniowej |
| CN102844810B (zh) * | 2010-04-14 | 2017-05-03 | 沃伊斯亚吉公司 | 用于在码激励线性预测编码器和解码器中使用的灵活和可缩放的组合式创新代码本 |
| WO2011158485A2 (ja) | 2010-06-14 | 2011-12-22 | パナソニック株式会社 | オーディオハイブリッド符号化装置およびオーディオハイブリッド復号装置 |
| KR101456639B1 (ko) * | 2010-07-08 | 2014-11-04 | 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. | 포워드 앨리어싱 취소를 이용한 코더 |
| CN102332266B (zh) * | 2010-07-13 | 2013-04-24 | 炬力集成电路设计有限公司 | 一种音频数据的编码方法及装置 |
| CN103282958B (zh) | 2010-10-15 | 2016-03-30 | 华为技术有限公司 | 信号分析器、信号分析方法、信号合成器、信号合成方法、变换器和反向变换器 |
| CN102959620B (zh) | 2011-02-14 | 2015-05-13 | 弗兰霍菲尔运输应用研究公司 | 利用重迭变换的信息信号表示 |
| RU2586597C2 (ru) | 2011-02-14 | 2016-06-10 | Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. | Кодирование и декодирование позиций импульсов дорожек аудиосигнала |
| KR101551046B1 (ko) | 2011-02-14 | 2015-09-07 | 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. | 저-지연 통합 스피치 및 오디오 코딩에서 에러 은닉을 위한 장치 및 방법 |
| TWI488177B (zh) | 2011-02-14 | 2015-06-11 | Fraunhofer Ges Forschung | 使用頻譜域雜訊整形之基於線性預測的編碼方案 |
| JP6110314B2 (ja) * | 2011-02-14 | 2017-04-05 | フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン | 整列したルックアヘッド部分を用いてオーディオ信号を符号化及び復号するための装置並びに方法 |
| PL2676268T3 (pl) | 2011-02-14 | 2015-05-29 | Fraunhofer Ges Forschung | Urządzenie i sposób przetwarzania zdekodowanego sygnału audio w domenie widmowej |
| TWI488176B (zh) | 2011-02-14 | 2015-06-11 | Fraunhofer Ges Forschung | 音訊信號音軌脈衝位置之編碼與解碼技術 |
| CN103493129B (zh) | 2011-02-14 | 2016-08-10 | 弗劳恩霍夫应用研究促进协会 | 用于使用瞬态检测及质量结果将音频信号的部分编码的装置与方法 |
| CN103534754B (zh) | 2011-02-14 | 2015-09-30 | 弗兰霍菲尔运输应用研究公司 | 在不活动阶段期间利用噪声合成的音频编解码器 |
| RU2464649C1 (ru) * | 2011-06-01 | 2012-10-20 | Корпорация "САМСУНГ ЭЛЕКТРОНИКС Ко., Лтд." | Способ обработки звукового сигнала |
| CN105163398B (zh) | 2011-11-22 | 2019-01-18 | 华为技术有限公司 | 连接建立方法和用户设备 |
| US9043201B2 (en) * | 2012-01-03 | 2015-05-26 | Google Technology Holdings LLC | Method and apparatus for processing audio frames to transition between different codecs |
| CN103219009A (zh) * | 2012-01-20 | 2013-07-24 | 旭扬半导体股份有限公司 | 音频数据处理装置及其方法 |
| JP2013198017A (ja) * | 2012-03-21 | 2013-09-30 | Toshiba Corp | 復号装置及び通信装置 |
| WO2013168414A1 (ja) * | 2012-05-11 | 2013-11-14 | パナソニック株式会社 | 音信号ハイブリッドエンコーダ、音信号ハイブリッドデコーダ、音信号符号化方法、及び音信号復号方法 |
| KR101726205B1 (ko) | 2012-11-07 | 2017-04-12 | 돌비 인터네셔널 에이비 | 감소된 복잡성 변환기 snr 계산 |
| CN103915100B (zh) * | 2013-01-07 | 2019-02-15 | 中兴通讯股份有限公司 | 一种编码模式切换方法和装置、解码模式切换方法和装置 |
| CN105264597B (zh) | 2013-01-29 | 2019-12-10 | 弗劳恩霍夫应用研究促进协会 | 感知转换音频编码中的噪声填充 |
| EP2954635B1 (en) | 2013-02-19 | 2021-07-28 | Huawei Technologies Co., Ltd. | Frame structure for filter bank multi-carrier (fbmc) waveforms |
| CN105074819B (zh) | 2013-02-20 | 2019-06-04 | 弗劳恩霍夫应用研究促进协会 | 使用多重叠部分来生成经编码的信号或对经编码的音频信号进行解码的设备及方法 |
| EP3011561B1 (en) | 2013-06-21 | 2017-05-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for improved signal fade out in different domains during error concealment |
| EP2830055A1 (en) | 2013-07-22 | 2015-01-28 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Context-based entropy coding of sample values of a spectral envelope |
| US9418671B2 (en) * | 2013-08-15 | 2016-08-16 | Huawei Technologies Co., Ltd. | Adaptive high-pass post-filter |
| US20150100324A1 (en) * | 2013-10-04 | 2015-04-09 | Nvidia Corporation | Audio encoder performance for miracast |
| EP2863386A1 (en) * | 2013-10-18 | 2015-04-22 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder |
| KR101498113B1 (ko) * | 2013-10-23 | 2015-03-04 | 광주과학기술원 | 사운드 신호의 대역폭 확장 장치 및 방법 |
| CN104751849B (zh) | 2013-12-31 | 2017-04-19 | 华为技术有限公司 | 语音频码流的解码方法及装置 |
| EP3095244A4 (en) | 2014-01-13 | 2017-11-15 | LG Electronics Inc. | Apparatuses and methods for transmitting or receiving a broadcast content via one or more networks |
| EP2980797A1 (en) * | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio decoder, method and computer program using a zero-input-response to obtain a smooth transition |
| CN107369453B (zh) * | 2014-03-21 | 2021-04-20 | 华为技术有限公司 | 语音频码流的解码方法及装置 |
| EP2980795A1 (en) * | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoding and decoding using a frequency domain processor, a time domain processor and a cross processor for initialization of the time domain processor |
| CN104143335B (zh) * | 2014-07-28 | 2017-02-01 | 华为技术有限公司 | 音频编码方法及相关装置 |
| BR112015029172B1 (pt) | 2014-07-28 | 2022-08-23 | Fraunhofer-Gesellschaft zur Föerderung der Angewandten Forschung E.V. | Aparelho e método para selecionar um dentre um primeiro algoritmo de codificação e um segundo algoritmo de codificação com o uso de redução de harmônicos |
| EP2980794A1 (en) | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder and decoder using a frequency domain processor and a time domain processor |
| FR3024581A1 (fr) * | 2014-07-29 | 2016-02-05 | Orange | Determination d'un budget de codage d'une trame de transition lpd/fd |
| EP2988300A1 (en) | 2014-08-18 | 2016-02-24 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Switching of sampling rates at audio processing devices |
| EP3067889A1 (en) * | 2015-03-09 | 2016-09-14 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Method and apparatus for signal-adaptive transform kernel switching in audio coding |
| CN107667400B (zh) | 2015-03-09 | 2020-12-18 | 弗劳恩霍夫应用研究促进协会 | 片段对准的音频编码 |
| EP3067887A1 (en) * | 2015-03-09 | 2016-09-14 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder for encoding a multichannel signal and audio decoder for decoding an encoded audio signal |
| EP3107096A1 (en) * | 2015-06-16 | 2016-12-21 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Downscaled decoding |
| CN109691043B (zh) * | 2016-09-06 | 2021-02-23 | 联发科技股份有限公司 | 无线通信系统中有效编码切换方法、用户设备及相关存储器 |
| EP3306609A1 (en) * | 2016-10-04 | 2018-04-11 | Fraunhofer Gesellschaft zur Förderung der Angewand | Apparatus and method for determining a pitch information |
| CN114005455A (zh) | 2017-08-10 | 2022-02-01 | 华为技术有限公司 | 时域立体声编解码方法和相关产品 |
| CN109787675A (zh) * | 2018-12-06 | 2019-05-21 | 安徽站乾科技有限公司 | 一种基于卫星语音通道的数据解析方法 |
| CN114007176B (zh) * | 2020-10-09 | 2023-12-19 | 上海又为智能科技有限公司 | 用于降低信号延时的音频信号处理方法、装置及存储介质 |
| RU2756934C1 (ru) * | 2020-11-17 | 2021-10-07 | Ордена Трудового Красного Знамени федеральное государственное образовательное бюджетное учреждение высшего профессионального образования Московский технический университет связи и информатики (МТУСИ) | Способ и устройство измерения спектра информационных акустических сигналов с компенсацией искажений |
| US20250201255A1 (en) * | 2023-12-13 | 2025-06-19 | Qualcomm Incorporated | Content-based switchable audio codec |
Family Cites Families (33)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5848391A (en) | 1996-07-11 | 1998-12-08 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Method subband of coding and decoding audio signals using variable length windows |
| ATE302991T1 (de) * | 1998-01-22 | 2005-09-15 | Deutsche Telekom Ag | Verfahren zur signalgesteuerten schaltung zwischen verschiedenen audiokodierungssystemen |
| US6226608B1 (en) * | 1999-01-28 | 2001-05-01 | Dolby Laboratories Licensing Corporation | Data framing for adaptive-block-length coding system |
| KR100472442B1 (ko) * | 2002-02-16 | 2005-03-08 | 삼성전자주식회사 | 웨이브렛 패킷 변환을 이용한 오디오 압축 방법 및 그시스템 |
| US8090577B2 (en) * | 2002-08-08 | 2012-01-03 | Qualcomm Incorported | Bandwidth-adaptive quantization |
| EP1394772A1 (en) * | 2002-08-28 | 2004-03-03 | Deutsche Thomson-Brandt Gmbh | Signaling of window switchings in a MPEG layer 3 audio data stream |
| US7876966B2 (en) * | 2003-03-11 | 2011-01-25 | Spyder Navigations L.L.C. | Switching between coding schemes |
| DE10345995B4 (de) * | 2003-10-02 | 2005-07-07 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum Verarbeiten eines Signals mit einer Sequenz von diskreten Werten |
| DE10345996A1 (de) * | 2003-10-02 | 2005-04-28 | Fraunhofer Ges Forschung | Vorrichtung und Verfahren zum Verarbeiten von wenigstens zwei Eingangswerten |
| US7739120B2 (en) * | 2004-05-17 | 2010-06-15 | Nokia Corporation | Selection of coding models for encoding an audio signal |
| CA2566372A1 (en) * | 2004-05-17 | 2005-11-24 | Nokia Corporation | Audio encoding with different coding models |
| DE602004025517D1 (de) * | 2004-05-17 | 2010-03-25 | Nokia Corp | Audiocodierung mit verschiedenen codierungsrahmenlängen |
| US7596486B2 (en) * | 2004-05-19 | 2009-09-29 | Nokia Corporation | Encoding an audio signal using different audio coder modes |
| KR100668319B1 (ko) * | 2004-12-07 | 2007-01-12 | 삼성전자주식회사 | 오디오 신호의 변환방법 및 장치와 오디오 신호에적응적인 부호화방법 및 장치, 오디오 신호의 역변환 방법및 장치와 오디오 신호에 적응적인 복호화 방법 및 장치 |
| US20070055510A1 (en) * | 2005-07-19 | 2007-03-08 | Johannes Hilpert | Concept for bridging the gap between parametric multi-channel audio coding and matrixed-surround multi-channel coding |
| WO2007080211A1 (en) * | 2006-01-09 | 2007-07-19 | Nokia Corporation | Decoding of binaural audio signals |
| KR101434198B1 (ko) * | 2006-11-17 | 2014-08-26 | 삼성전자주식회사 | 신호 복호화 방법 |
| BRPI0718738B1 (pt) | 2006-12-12 | 2023-05-16 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Codificador, decodificador e métodos para codificação e decodificação de segmentos de dados representando uma corrente de dados de domínio de tempo |
| EP2015293A1 (en) * | 2007-06-14 | 2009-01-14 | Deutsche Thomson OHG | Method and apparatus for encoding and decoding an audio signal using adaptively switched temporal resolution in the spectral domain |
| MX2011000375A (es) * | 2008-07-11 | 2011-05-19 | Fraunhofer Ges Forschung | Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada. |
| EP2346029B1 (en) * | 2008-07-11 | 2013-06-05 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder, method for encoding an audio signal and corresponding computer program |
| EP2144230A1 (en) * | 2008-07-11 | 2010-01-13 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Low bitrate audio encoding/decoding scheme having cascaded switches |
| BRPI0910793B8 (pt) * | 2008-07-11 | 2021-08-24 | Fraunhofer Ges Forschung | Método e discriminador para a classificação de diferentes segmentos de um sinal |
| CN102105930B (zh) * | 2008-07-11 | 2012-10-03 | 弗朗霍夫应用科学研究促进协会 | 用于编码采样音频信号的帧的音频编码器和解码器 |
| ES2592416T3 (es) * | 2008-07-17 | 2016-11-30 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Esquema de codificación/decodificación de audio que tiene una derivación conmutable |
| KR101315617B1 (ko) * | 2008-11-26 | 2013-10-08 | 광운대학교 산학협력단 | 모드 스위칭에 기초하여 윈도우 시퀀스를 처리하는 통합 음성/오디오 부/복호화기 |
| CA2750795C (en) * | 2009-01-28 | 2015-05-26 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio encoder, audio decoder, encoded audio information, methods for encoding and decoding an audio signal and computer program |
| US8457975B2 (en) * | 2009-01-28 | 2013-06-04 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio decoder, audio encoder, methods for decoding and encoding an audio signal and computer program |
| JP5699141B2 (ja) * | 2009-06-23 | 2015-04-08 | ヴォイスエイジ・コーポレーション | 重み付けされた信号領域またはオリジナルの信号領域で適用される順方向時間領域エイリアシング取り消し |
| PL2471061T3 (pl) * | 2009-10-08 | 2014-03-31 | Fraunhofer Ges Forschung | Działający w wielu trybach dekoder sygnału audio, działający w wielu trybach koder sygnału audio, sposoby i program komputerowy stosujące kształtowanie szumu oparte o kodowanie z wykorzystaniem predykcji liniowej |
| BR112012009032B1 (pt) * | 2009-10-20 | 2021-09-21 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e. V. | Codificador de sinal de áudio, decodificador de sinal de áudio, método para prover uma representação codificada de um conteúdo de áudio, método para prover uma representação decodificada de um conteúdo de áudio para uso em aplicações de baixo retardamento |
| WO2011048117A1 (en) * | 2009-10-20 | 2011-04-28 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio signal encoder, audio signal decoder, method for encoding or decoding an audio signal using an aliasing-cancellation |
| WO2011086067A1 (en) * | 2010-01-12 | 2011-07-21 | Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder, audio decoder, method for encoding and decoding an audio information, and computer program obtaining a context sub-region value on the basis of a norm of previously decoded spectral values |
-
2009
- 2009-06-26 RU RU2011104003/08A patent/RU2515704C2/ru active
- 2009-06-26 ES ES15193588.9T patent/ES2657393T3/es active Active
- 2009-06-26 CA CA2871498A patent/CA2871498C/en active Active
- 2009-06-26 MY MYPI2011000041A patent/MY159110A/en unknown
- 2009-06-26 PT PT151935889T patent/PT3002750T/pt unknown
- 2009-06-26 CA CA2730204A patent/CA2730204C/en active Active
- 2009-06-26 JP JP2011516995A patent/JP5551695B2/ja active Active
- 2009-06-26 PL PL09776858T patent/PL2311032T3/pl unknown
- 2009-06-26 MY MYPI2015000252A patent/MY181231A/en unknown
- 2009-06-26 CN CN2009801270965A patent/CN102089811B/zh active Active
- 2009-06-26 EP EP15193588.9A patent/EP3002750B1/en active Active
- 2009-06-26 AU AU2009267466A patent/AU2009267466B2/en active Active
- 2009-06-26 EP EP09776858.4A patent/EP2311032B1/en active Active
- 2009-06-26 CA CA2871372A patent/CA2871372C/en active Active
- 2009-06-26 ES ES09776858.4T patent/ES2564400T3/es active Active
- 2009-06-26 PL PL15193588T patent/PL3002750T3/pl unknown
- 2009-06-26 KR KR1020117003176A patent/KR101325335B1/ko active Active
- 2009-06-26 MY MYPI2015000253A patent/MY181247A/en unknown
- 2009-06-26 WO PCT/EP2009/004651 patent/WO2010003563A1/en not_active Ceased
- 2009-06-26 MX MX2011000366A patent/MX2011000366A/es active IP Right Grant
- 2009-06-26 BR BRPI0910512-3A patent/BRPI0910512B1/pt active IP Right Grant
- 2009-07-10 TW TW098123427A patent/TWI459379B/zh active
- 2009-07-13 AR ARP090102625A patent/AR072738A1/es active IP Right Grant
-
2011
- 2011-01-04 ZA ZA2011/00089A patent/ZA201100089B/en unknown
- 2011-01-10 EG EG2011010060A patent/EG26653A/en active
- 2011-01-11 US US13/004,400 patent/US8892449B2/en active Active
- 2011-02-11 CO CO11016281A patent/CO6351837A2/es active IP Right Grant
-
2013
- 2013-06-18 JP JP2013127397A patent/JP5551814B2/ja active Active
-
2016
- 2016-09-30 HK HK16111486.0A patent/HK1223453A1/en unknown
Also Published As
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| AU2009267466B2 (en) | Audio encoder and decoder for encoding and decoding audio samples | |
| CA2730195C (en) | Audio encoder and decoder for encoding and decoding frames of a sampled audio signal | |
| EP3503098B1 (en) | Apparatus and method decoding an audio signal using an aligned look-ahead portion | |
| MX2011000375A (es) | Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada. | |
| AU2013200679B2 (en) | Audio encoder and decoder for encoding and decoding audio samples | |
| EP3002751A1 (en) | Audio encoder and decoder for encoding and decoding audio samples | |
| HK1223452B (en) | Audio encoder and decoder for encoding and decoding audio samples | |
| HK1155552B (en) | Audio encoder and decoder for encoding and decoding audio samples | |
| HK1158333B (en) | Audio encoder and decoder for encoding and decoding frames of sampled audio signal |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| GB | Transfer or rights |
Owner name: FRAUNHOFER-GESELLSCHAFT ZUR FOERDERUNG DER ANGEWAN |
|
| FG | Grant or registration |