ES3053797T3 - Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain - Google Patents

Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain

Info

Publication number
ES3053797T3
ES3053797T3 ES21207282T ES21207282T ES3053797T3 ES 3053797 T3 ES3053797 T3 ES 3053797T3 ES 21207282 T ES21207282 T ES 21207282T ES 21207282 T ES21207282 T ES 21207282T ES 3053797 T3 ES3053797 T3 ES 3053797T3
Authority
ES
Spain
Prior art keywords
spectral
frequency
portions
representation
resolution
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES21207282T
Other languages
English (en)
Inventor
Sascha Disch
Frederik Nagel
Ralf Geiger
Balaji Nagendran Thoshkahna
Konstantin Schmidt
Stefan Bayer
Christian Neukam
Bernd Edler
Christian Helmrich
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Application granted granted Critical
Publication of ES3053797T3 publication Critical patent/ES3053797T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0204Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0204Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
    • G10L19/0208Subband vocoders
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0212Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using orthogonal transformation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/022Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/022Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
    • G10L19/025Detection of transients or attacks for time/frequency resolution switching
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/028Noise substitution, i.e. substituting non-tonal spectral components by noisy source
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/03Spectral prediction for preventing pre-echo; Temporary noise shaping [TNS], e.g. in MPEG2 or MPEG4
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/032Quantisation or dequantisation of spectral components
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/06Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/038Speech enhancement, e.g. noise reduction or echo cancellation using band spreading techniques
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/038Speech enhancement, e.g. noise reduction or echo cancellation using band spreading techniques
    • G10L21/0388Details of processing therefor
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/06Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being correlation coefficients
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/18Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being spectral information of each sub-band
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/21Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being power information
    • HELECTRICITY
    • H03ELECTRONIC CIRCUITRY
    • H03MCODING; DECODING; CODE CONVERSION IN GENERAL
    • H03M7/00Conversion of a code where information is represented by a given sequence or number of digits to a code where the same, similar or subset of information is represented by a different sequence or number of digits
    • H03M7/30Compression; Expansion; Suppression of unnecessary data, e.g. redundancy reduction
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S1/00Two-channel systems
    • H04S1/007Two-channel systems in which the audio signals are in digital form
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Computational Linguistics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Health & Medical Sciences (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Quality & Reliability (AREA)
  • Mathematical Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Stereophonic System (AREA)

Abstract

Un aparato para decodificar una señal de audio codificada, comprende un decodificador de audio de dominio espectral (112) para generar una primera representación decodificada de un primer conjunto de primeras porciones espectrales, teniendo la representación decodificada una primera resolución espectral; un decodificador paramétrico (114) para generar una segunda representación decodificada de un segundo conjunto de segundas porciones espectrales que tienen una segunda resolución espectral menor que la primera resolución espectral; un regenerador de frecuencia (116) para regenerar cada segunda porción espectral construida que tiene la primera resolución espectral utilizando una primera porción espectral e información de envolvente espectral para la segunda porción espectral; y un convertidor de tiempo de espectro (118) para convertir la primera representación decodificada y la segunda porción espectral reconstruida en una representación de tiempo. (Traducción automática con Google Translate, sin valor legal)

Description

[0001] DESCRIPCIÓN
[0002] Aparato y método para codificar o decodificar una señal de audio con relleno inteligente de espacios en el dominio espectral
[0003] La presente invención se refiere a codificación/decodificación de audio y, particularmente, a codificación de audio mediante el relleno inteligente de espacios (IGF).
[0004] La codificación de audio es el dominio de la compresión de la señal que trata el aprovechamiento de la redundancia y la irrelevancia de señales de audio utilizando el conocimiento psicoacústico. Actualmente, los códecs de audio generalmente necesitan alrededor de 60 kbps/canal para la codificación perceptual transparente de casi cualquier tipo de señal de audio. Los códecs más nuevos tienen como objetivo reducir la tasa de bits de codificación aprovechando las similitudes espectrales en la señal y utilizando técnicas tales como la extensión de ancho de banda (BWE, por sus siglas en inglés). Un esquema de extensión de ancho de banda (BWE) utiliza un parámetro bajo de tasa de bits establecido para representar los componentes de alta frecuencia (HF) de una señal de audio. El espectro de alta frecuencia (HF) se rellena con el contenido espectral de regiones de baja frecuencia (LF) y la forma espectral, pendiente y continuidad temporal se ajustan para mantener el timbre y el color de la señal original. Estos métodos de extensión de ancho de banda (BWE) permiten que los códecs de audio retengan buena calidad a tasas de bits incluso bajas de alrededor de 24 kbps/canal.
[0005] El almacenamiento o la transmisión de señales de audio a menudo están sujetos a estrictas limitaciones de tasas de bits. En el pasado, los codificadores se vieron obligados a reducir drásticamente el ancho de banda de audio transmitida cuando solo estaba disponible una tasa de bits muy baja.
[0006] Los códecs de audio modernos ahora son capaces de codificar señales de banda ancha utilizando los métodos de extensión de ancho de banda (BWE) [1]. Estos algoritmos se basan en una representación paramétrica del contenido de alta frecuencia (HF) - que se genera a partir de la parte de baja frecuencia (LF) codificada en forma de onda de la señal decodificada por medio de transposición a la región espectral de alta frecuencia (HF) ("interconexión") y la aplicación de un procesamiento posterior basado en parámetros. En los esquemas de extensión de ancho de banda (BWE), la reconstrucción de la región espectral de alta frecuencia (HF) por encima de una así denominada frecuencia de cruce determinada se basa a menudo en la interconexión espectral. En general, la región de alta frecuencia HF consta de múltiples conexiones adyacentes y cada una de estas conexiones se obtiene de regiones de paso de banda (BP) del espectro de baja frecuencia LF por debajo de la frecuencia de cruce determinada. Los sistemas del estado actual de la técnica desempeñan con eficiencia la interconexión dentro de una representación de bancos de filtros, por ejemplo, banco de filtros espejo en cuadratura (QMF, por sus siglas en inglés), copiando un conjunto de coeficientes de sub-bandas adyacentes desde una región de origen a la región de destino.
[0007] Otra técnica que se encuentra en los códecs de audio actuales que aumenta la eficiencia de compresión y permite así el ancho de banda de audio extendida en tasas de bits bajas es el reemplazo sintético basado en parámetros de porciones apropiadas de los espectros de audio. Por ejemplo, las porciones de la señal tipo ruido de la señal de audio original pueden ser reemplazadas sin pérdida sustancial de calidad subjetiva por ruido artificial generado en el decodificador y ajustado a escala por parámetros de información lateral. Un ejemplo es la herramienta de sustitución de ruido perceptual (PNS, por sus siglas en inglés) contenida en la codificación avanzada de audio MPEG-4 (AAC, por sus siglas en inglés) [5].
[0008] Otra disposición que también permite un ancho de banda de audio extendida en tasas de bits bajas es la técnica de relleno de ruido contenida en el sistema unificado de codificación de voz y Audio MPEG-D (USAC, por sus siglas en inglés) [7]. Los espacios espectrales (ceros) que se deducen por la zona muerta del cuantificador debido a una cuantificación demasiado gruesa, posteriormente se llenan de ruido artificial en el decodificador y se ajustan a escala por un procesamiento posterior basado en parámetros.
[0009] Otro sistema del estado actual de la técnica se denomina reemplazo espectral preciso (ASR, por sus siglas en inglés) [2-4]. Además de un códec de forma de onda, el reemplazo espectral preciso (ASR) emplea una etapa de síntesis de señal dedicada que restaura perceptualmente porciones sinusoidales importantes de la señal en el decodificador. Asimismo, un sistema descrito en [5] se basa en el modelado sinusoidal en la región de alta frecuencia (HF) de un codificador de forma de onda para permitir que el ancho de banda de audio extendido tenga una calidad perceptual adecuada a tasas de bits bajas. Todos estos métodos implican la transformación de los datos en un segundo dominio aparte de la transformada coseno discreta modificada (MDCT, por sus siglas en inglés) y también etapas de análisis/síntesis bastante complejas para la conservación de componentes sinusoidales de alta frecuencia (HF). La figura 13a ilustra un diagrama esquemático de un codificador de audio para una tecnología de extensión de ancho de banda como, por ejemplo, la que se utiliza en la Codificación Avanzada de Audio de Alta Eficiencia (HE-AAC, por sus siglas en inglés). Una señal de audio en la línea 1300 se introduce en un sistema de filtro que comprende un paso bajo 1302 y un paso alto 1304. La señal emitida por el filtro de paso alto 1304 es introducida en un extractor/codificador de parámetros 1306. El extractor/codificador de parámetros 1306 está configurado para calcular y codificar parámetros tales como, por ejemplo, un parámetro de envolvente espectral, un parámetro de adición de ruido, un parámetro de armónicos faltantes, o un parámetro de filtrado inverso. Estos parámetros extraídos se introducen en un multiplexor de corriente de bits 1308. La señal de salida de paso bajo se introduce en un procesador que generalmente comprende la funcionalidad de un muestreador descendente 1310 y un codificador central 1312. El paso bajo 1302 restringe el ancho de banda para ser codificado en un ancho de banda significativamente menor que el producido en la señal de audio de entrada original en la línea 1300. Esto proporciona una ganancia de codificación significativa debido al hecho de que la totalidad de las funcionalidades que se producen en el codificador central solo tienen que operar en una señal con un ancho de banda reducido. Cuando, por ejemplo, el ancho de banda de la señal de audio en la línea 1300 es de 20 kHz y cuando el filtro de paso bajo 1302 tiene a modo de ejemplo un ancho de banda de 4 kHz, con el fin de cumplir el teorema de muestreo, es teóricamente suficiente que la señal subsiguiente al muestreador descendente tenga una frecuencia de muestreo de 8 kHz, que es una reducción sustancial de la tasa de muestreo requerida para la señal de audio 1300 que tiene que ser de al menos 40 kHz.
[0011] La figura 13b ilustra un diagrama esquemático de un decodificador de extensión de ancho de banda respectivo. El decodificador comprende un multiplexor de corriente de bits 1320. El demultiplexor de corriente de bits 1320 extrae una señal de entrada para un decodificador central 1322 y una señal de entrada para un decodificador de parámetros 1324. Una señal de salida del decodificador central tiene, en el ejemplo anterior, una tasa de muestreo de 8 kHz y, por lo tanto, un ancho de banda de 4 kHz mientras que, para una reconstrucción completa de ancho de banda, la señal de salida de un reconstructor de alta frecuencia 1330 debe ser de 20 kHz lo que requiere una tasa de muestreo de al menos 40 kHz. Con el fin de hacer esto posible, se requiere un procesador de decodificador que tenga la funcionalidad de un muestreador ascendente 1325 y un banco de filtros 1326. El reconstructor de alta frecuencia 1330 recibe entonces la señal de baja frecuencia analizada por frecuencia emitida por el banco de filtros 1326 y reconstruye el intervalo de frecuencias definido por el filtro de paso alto 1304 de la figura 13a utilizando la representación paramétrica de la banda de alta frecuencia. El reconstructor de alta frecuencia 1330 tiene varias funcionalidades tales como la regeneración del intervalo de frecuencias superior que utiliza el intervalo de origen en el intervalo de baja frecuencia, un ajuste de envolvente espectral, una funcionalidad de adición de ruido y una funcionalidad para introducir armónicos faltantes en el intervalo de frecuencia superior y, si se aplica y calcula en el codificador de la figura 13a, una operación de filtrado inverso con el fin de tener en cuenta el hecho de que el intervalo de frecuencia superior normalmente no es tan tonal como el intervalo de frecuencia inferior. En la codificación avanzada de audio de alta eficiencia (HE-AAC), los armónicos faltantes se resintetizan en el lado del decodificador y se colocan exactamente en el medio de una banda de reconstrucción. Por lo tanto, todas las líneas de armónicos faltantes que se han determinado en una cierta banda de reconstrucción no se colocan en los valores de frecuencia en donde estaban ubicadas en la señal original. En cambio, dichas líneas de armónicos faltantes se colocan en frecuencias en el centro de la banda determinada. Por lo tanto, cuando una línea de armónico que falta en la señal original se colocó muy cerca del límite de la banda de reconstrucción en la señal original, el error en la frecuencia introducida al colocar esta línea de armónico que falta en la señal reconstruida en el centro de la banda está cerca de 50 % de la banda de reconstrucción individual, para la que se han generado y transmitido parámetros.
[0013] Además, a pesar de que los codificadores centrales de audio típicos operan en el dominio espectral, el decodificador central, no obstante, genera una señal de dominio temporal que, a continuación, es convertida nuevamente en un dominio espectral por la funcionalidad del banco de filtros 1326. Esto introduce retardos de procesamiento adicionales, puede introducir fallos debido al procesamiento en tándem de la transformación en primer lugar del dominio espectral en el dominio de frecuencia y nuevamente la transformación en generalmente un dominio de frecuencia diferente y, por supuesto, esto también requiere una cantidad sustancial de complejidad computacional y, por lo tanto, energía eléctrica, que representa básicamente un problema cuando se aplica la tecnología de extensión de ancho de banda en dispositivos móviles como, por ejemplo, teléfonos móviles, tabletas u ordenadores portátiles, etc.
[0015] Los códecs de audio actuales llevan a cabo la codificación de audio de baja tasa de bits utilizando la extensión de ancho de banda (BWE) como parte integral del esquema de codificación. Sin embargo, las técnicas de extensión de ancho de banda (BWE) se limitan a reemplazar solo contenido de alta frecuencia (HF). Asimismo, no permiten la codificación de forma de onda del contenido perceptivamente importante por encima de una frecuencia de cruce determinada. Por lo tanto, los códecs de audio contemporáneos, ya sea pierden detalle de alta frecuencia (HF) o timbre cuando se implementa la extensión de ancho de banda (BWE), ya que la alineación exacta de los armónicos tonales de la señal no se tiene en cuenta en la mayoría de los sistemas.
[0017] Otra desventaja de los sistemas de extensión de ancho de banda (BWE) del estado actual de la técnica es la necesidad de transformación de la señal de audio en un nuevo dominio para la implementación de la BWE (por ejemplo, transformación de la transformada coseno discreta modificada (MDCT) al dominio de filtros espejo en cuadratura (QMF). Esto genera complicaciones de sincronización, complejidad computacional adicional y aumento de requisitos de memoria.
[0019] El documento US 2010241437 A1 da a conocer un método para la decodificación espectral perceptual. El método comprende la decodificación de coeficientes espectrales recuperados de un flujo binario en coeficientes espectrales decodificados de un conjunto inicial de coeficientes espectrales. El conjunto inicial de coeficientes espectrales está relleno de espectro. El relleno de espectro comprende el relleno de ruido de espacios espectrales estableciendo coeficientes espectrales en el conjunto inicial de coeficientes espectrales que no se decodifican del flujo binario iguales a elementos derivados de los coeficientes espectrales decodificados. El conjunto de coeficientes espectrales reconstruidos de un dominio de frecuencia formado por el relleno del espectro se convierte en una señal de audio de un dominio de tiempo. Un decodificador espectral perceptual comprende un relleno de ruido, que funciona de acuerdo con el método para decodificación espectral perceptual.
[0021] El documento US 2012029923 A1 da a conocer un esquema para codificar un conjunto de coeficientes de transformada que representan un intervalo de audiofrecuencia de una señal. El esquema utiliza un modelo armónico para parametrizar una relación entre las ubicaciones de regiones de energía significativa en el dominio de frecuencia.
[0022] Es un objeto de la presente invención proporcionar un concepto mejorado para decodificar o codificar una señal de audio.
[0024] Este objetivo se logra mediante un aparato para decodificar una señal de audio codificada de la reivindicación 1, un aparato para codificar una señal de audio de la reivindicación 2, un método para decodificar una señal de audio codificada de la reivindicación 10, un método para codificar una señal de audio de la reivindicación 11 o un programa informático de la reivindicación 12.
[0026] La presente invención se basa en el descubrimiento de que los problemas relacionados con la separación de la extensión de ancho de banda por un lado y la codificación central por otro lado se pueden abordar y superar llevando a cabo la extensión de ancho de banda en el mismo dominio espectral en el que opera el decodificador central. Por lo tanto, se proporciona un decodificador central de tasa completa que codifica y decodifica todo el intervalo de la señal de audio. Esto no genera la necesidad de un muestreador descendente en el lado del codificador y un muestreador ascendente en el lado del decodificador. En cambio, todo el procesamiento se lleva a cabo en toda la tasa de muestreo o en todo el dominio de ancho de banda. Con el fin de obtener una alta ganancia de codificación, la señal de audio se analiza con el fin de encontrar un primer conjunto de primeras porciones espectrales que tiene que ser codificado con una alta resolución, en donde este primer conjunto de primeras porciones espectrales puede incluir, en una realización, porciones tonales de la señal de audio. Por otra parte, los componentes no tonales o ruidosos en la señal de audio que constituyen un segundo conjunto de segunda porciones espectrales son codificados paramétricamente con baja resolución espectral. Entonces, la señal de audio codificada solo requiere que el primer conjunto de primeras porciones espectrales esté codificado de manera que conserve la forma de onda con una alta resolución espectral y, adicionalmente, que el segundo conjunto de segundas porciones espectrales esté codificado paramétricamente con una baja resolución utilizando "mosaicos" de frecuencia obtenidos del primer conjunto. En el lado del decodificador, el decodificador central, que es un decodificador de banda completa, reconstruye el primer conjunto de primeras porciones espectrales de manera que conserve la forma de onda, es decir, desconociendo si hay una regeneración de frecuencia adicional. Sin embargo, el espectro así generado tiene muchos espacios espectrales. Estos espacios se rellenan posteriormente con la tecnología de relleno inteligente de espacios (IGF, por sus siglas en inglés) de la invención utilizando una regeneración de frecuencia que aplica datos paramétricos, por un lado, y que utiliza un intervalo espectral de origen, es decir, primeras porciones espectrales reconstruidas por el decodificador de audio de tasa completa por otro lado.
[0028] En otras realizaciones, las porciones espectrales, que son reconstruidas por relleno de ruido solamente en lugar de replicación de ancho de banda o relleno de mosaicos de frecuencia, constituyen un tercer conjunto de terceras porciones espectrales. Debido al hecho de que el concepto de codificación opera en un dominio único para la codificación/decodificación central por un lado, y la regeneración de frecuencia por otro lado, el relleno inteligente de espacios (IGF) no solo se limita a llenar un intervalo de frecuencia superior sino que puede rellenar intervalos de frecuencia inferiores, ya sea por relleno de ruido sin regeneración de frecuencia o por regeneración de frecuencia utilizando un mosaico de frecuencia en un intervalo de frecuencia diferente.
[0030] Asimismo, se insiste en que una información sobre potencias espectrales, una información sobre potencias individuales o una información de energía individual, una información sobre una energía de conservación o una información de energía de conservación, una información sobre una energía de mosaico o una información de energía de mosaico, o una información sobre una energía que falta o una información de energía que falta pueden comprender no solo un valor de energía sino también un valor de amplitud (por ejemplo, absoluto), un valor de nivel o cualquier otro valor, del que se puede obtener un valor de energía final. Por lo tanto, la información sobre una energía puede comprender, por ejemplo, el valor de energía propiamente dicho, y/o un valor de un nivel y/o de una amplitud y/o de una amplitud absoluta.
[0032] Un aspecto adicional se basa en el descubrimiento de que la situación de correlación no solo es importante para el intervalo de origen, sino también es importante para el intervalo de destino. Además, la presente invención reconoce el hecho de que pueden ocurrir diferentes situaciones de correlación en el intervalo de origen y en el intervalo de destino. Cuando se considera, por ejemplo, una señal de voz con ruido de alta frecuencia, puede ocurrir que la banda de baja frecuencia que comprende la señal de voz con un pequeño número de armónicos superiores está altamente correlacionada en el canal izquierdo y el canal derecho, cuando el altavoz se coloca en el medio. La porción de alta frecuencia, sin embargo, puede estar fuertemente correlacionada debido al hecho de que podría haber un ruido de alta frecuencia diferente en el lado izquierdo en comparación con otro ruido de alta frecuencia o ningún ruido de alta frecuencia en el lado derecho. Por lo tanto, cuando se lleva a cabo una operación simple de relleno de espacios que ignora esta situación, entonces la porción de alta frecuencia estaría correlacionada también, y esto podría generar graves fallos de segregación espacial en la señal reconstruida. Con el fin de abordar esta cuestión, los datos paramétricos para una banda de reconstrucción o, en general, para el segundo conjunto de segundas porciones espectrales que tiene que ser reconstruido utilizando un primer conjunto de primeras porciones espectrales, se calculan para identificar, ya sea una primera o una segunda representación de dos canales diferente para la segunda porción espectral o, dicho de otra manera, para la banda de reconstrucción. Por lo tanto, en el lado del codificador se calcula una identificación de dos canales para las segundas porciones espectrales, es decir, para las porciones para las que se calcula adicionalmente la información de energía para las bandas de reconstrucción. A continuación, un regenerador de frecuencia en el lado del decodificador regenera una segunda porción espectral en función de una primera porción del primer conjunto de primeras porciones espectrales, es decir, el intervalo de origen y los datos paramétricos para la segunda porción tal como la información de energía de la envolvente espectral o cualquier otro dato de la envolvente espectral y, adicionalmente, depende de la identificación de dos canales para la segunda porción, es decir, para esta banda de reconstrucción bajo reconsideración.
[0034] La identificación de dos canales se transmite preferentemente como una etiqueta para cada banda de reconstrucción y estos datos se transmiten desde un codificador a un decodificador y el decodificador luego decodifica la señal central indicada preferentemente por etiquetas calculadas para las bandas centrales. A continuación, en una implementación, la señal central se almacena en ambas representaciones estéreo (por ejemplo, izquierda/derecha y media/lateral) y, para el relleno de mosaicos de frecuencia de relleno inteligente de espacios (IGF), se elige la representación de mosaicos de origen para adaptar la representación de mosaicos de destino indicada por las etiquetas de identificación de dos canales para el relleno inteligente de espacios o las bandas de reconstrucción, es decir, para el intervalo de destino.
[0036] Se hace hincapié en que este procedimiento no solo funciona para las señales estéreo, es decir, por un canal izquierdo y el canal derecho, sino que también funciona para las señales multicanal. En el caso de las señales multicanal se pueden procesar varios pares de canales diferentes, por ejemplo, como un canal izquierdo y un canal derecho como un primer par, un canal envolvente izquierdo y un canal envolvente derecho como el segundo par y un canal central y un canal LFE como el tercer par.
[0038] Otras formaciones de pares se pueden determinar para los formatos de canal de salida superiores tales como 7.1, 11.1 y así sucesivamente.
[0040] Un aspecto adicional se basa en el descubrimiento de que la calidad de audio de la señal reconstruida se puede mejorar a través de IGF ya que todo el espectro es accesible para el codificador central de manera que, por ejemplo, las porciones tonales perceptualmente importantes en un alto intervalo espectral todavía pueden ser codificadas por el codificador central en lugar de la sustitución paramétrica. Adicionalmente se lleva a cabo la operación de relleno de espacios que utiliza mosaicos de frecuencia de un primer conjunto de primeras porciones espectrales que es, por ejemplo, un conjunto de porciones tonales generalmente de un intervalo de frecuencia inferior, pero también de un intervalo de frecuencia superior, si está disponible. Sin embargo, para el ajuste de envolvente espectral en el lado del decodificador, las porciones espectrales del primer conjunto de porciones espectrales ubicadas en la banda de reconstrucción no se procesan posteriormente otra vez por el ajuste de la envolvente espectral, por ejemplo. Solo los valores espectrales restantes en la banda de reconstrucción que no provienen del decodificador central deben ajustarse por la envolvente utilizando información de envolvente. Preferiblemente, la información de envolvente es una información de la envolvente de banda completa que representa la energía del primer conjunto de primeras porciones espectrales en la banda de reconstrucción y el segundo conjunto de segundas porciones espectrales en la misma banda de reconstrucción, en donde los últimos valores espectrales en el segundo conjunto de segunda porciones espectrales se indican como cero y, por lo tanto, no están codificados por el codificador central, pero están paramétricamente codificados con información de energía de baja resolución.
[0042] Se ha descubierto que los valores absolutos de energía, ya sea normalizados o no con respecto al ancho de banda de la banda correspondiente, son útiles y muy eficientes en una aplicación en el lado del decodificador. Esto se aplica especialmente cuando los factores de ganancia tienen que calcularse sobre la base de una energía residual en la banda de reconstrucción, la energía que falta en la banda de reconstrucción y la información de mosaicos de frecuencia en la banda de reconstrucción.
[0044] Asimismo, se prefiere que la corriente de bits codificada no solo abarque información de energía para las bandas de reconstrucción sino, además, factores de ajuste de escala para bandas de factor de escala que se extienden hasta la frecuencia máxima. Esto asegura que, para cada banda de reconstrucción, para la que está disponible una cierta porción tonal, es decir, una primera porción espectral, este primer conjunto de primera porción espectral pueda ser decodificado realmente con la amplitud correcta. Por otra parte, además del factor de escala para cada banda de reconstrucción, una energía para esta banda de reconstrucción es generada en un codificador y transmitida a un decodificador. Además, se prefiere que las bandas de reconstrucción coincidan con las bandas de factor de escala o en el caso de agrupamiento de energía, al menos los límites de una banda de reconstrucción coincidan con los límites de las bandas de factor de escala.
[0045] Otro aspecto se basa en el hallazgo de que ciertas degradaciones en la calidad de audio se pueden remediar mediante la aplicación de un esquema de relleno de señal de frecuencia adaptable. Con este fin, se realiza un análisis en el lado del codificador con el fin de encontrar la región de origen más adecuada para una determinada región de destino. Una información coincidente que identifica, para una región de destino, cierta región de origen junto con, opcionalmente, alguna información adicional, se genera y se transmite como información lateral al decodificador. El decodificador aplica entonces una operación de relleno de mosaicos de frecuencia utilizando la información de adaptación. Con este fin, el decodificador lee la información coincidente del flujo de datos transmitido o del archivo de datos y accede a la región de origen identificada para una determinada banda de reconstrucción y, si se indica en la información coincidente, realiza adicionalmente algún procesamiento de los datos de esta región de origen para generar datos espectrales brutos para la banda de reconstrucción. Entonces, este resultado de la operación de llenado de mosaicos de frecuencia, es decir, los datos espectrales en bruto para la banda de reconstrucción, se modela utilizando información de la envolvente espectral con el fin de obtener finalmente una banda de reconstrucción que comprenda las primeras porciones espectrales, así como las porciones tonales. Estas porciones tonales, sin embargo, no se generan por el esquema de relleno de mosaicos adaptativo, pero estas primeras porciones espectrales son emitidas por el decodificador de audio o el decodificador central directamente.
[0046] El esquema de selección espectral adaptativa de baldosas puede operar con una baja granularidad. En esta implementación, una región de procedencia se subdivide en regiones de origen típicamente superpuestas y la región de destino o las bandas de reconstrucción están dadas por regiones de destino de frecuencia no superpuesta. Entonces, las similitudes entre cada región de origen y cada región de destino se determinan en el lado del codificador y el mejor par de una región de origen y la región de destino se identifican por la información de coincidencia y, en el lado del decodificador, la región de origen identificada en la información coincidente se utiliza para generar los datos espectrales brutos para la banda de reconstrucción.
[0047] Con el fin de obtener una mayor granularidad, se permite que cada región de origen cambie para obtener un cierto retardo donde las similitudes son máximas. Este retardo puede ser tan fino como un compartimento de frecuencias y permite una mejor correspondencia entre una región de origen y la región de destino.
[0048] Asimismo, además de identificar sólo un par coincidente mejor, este retardo de correlación también puede ser transmitido dentro de la información correspondiente y, adicionalmente, incluso una señal puede ser transmitida. Cuando se determina que el signo es negativo en el lado del codificador, también se transmite un indicador de señal correspondiente dentro de la información de correspondencia y, en el lado del decodificador, los valores espectrales de la región de origen se multiplican por "-1" o, en una representación compleja, son "girados" 180 grados.
[0049] Una implementación adicional de esta invención aplica una operación de blanqueo de mosaicos. El blanqueo de un espectro quita la información de envolvente espectral en bruto y enfatiza la estructura fina espectral que es de interés principal para la evaluación de la similitud de mosaicos. Por lo tanto, un mosaico de frecuencia por un lado y/o la señal de origen por otro lado se blanquean antes de calcular una medida de correlación cruzada. Cuando sólo se blanquea el mosaico utilizando un procedimiento predefinido, se transmite una etiqueta de blanqueo que indica al decodificador que se aplicará el mismo proceso de blanqueo predefinido al mosaico de frecuencia dentro de IGF.
[0050] En cuanto a la selección de mosaicos, es preferente utilizar el retardo de la correlación para desplazar espectralmente el espectro regenerado mediante un número entero de intervalos de transformación. Dependiendo de la transformación subyacente, el desplazamiento espectral puede requerir correcciones adicionales. En caso de retardos impares, el mosaico se modula adicionalmente a través de la multiplicación por una secuencia temporal alternativa de -1/1 para compensar la representación de frecuencia inversa de cualquier otra banda dentro de la transformada coseno discreta modificada MDCT. Asimismo, el signo del resultado de la correlación se aplica al generar el mosaico de frecuencias. Asimismo, se prefiere utilizar el recorte y la estabilización de mosaicos con el fin de asegurar que se evitan los fallos creados por el cambio rápido de regiones de origen para la misma región de reconstrucción o la región de destino. Para ello se lleva a cabo un análisis de similitud entre las diferentes regiones de origen identificadas y cuando un mosaico de origen es similar a otros mosaicos de origen con una similitud por encima de un umbral, entonces este mosaico de origen se puede retirar del conjunto de mosaicos de origen potenciales, ya que está muy correlacionada con otros mosaicos de origen. Además, como un tipo de estabilización de selección de mosaicos, se prefiere mantener el orden de la trama anterior si ninguna de los mosaicos de origen en la trama actual se correlaciona (mejor que un umbral determinado) con los mosaicos de destino en la trama actual.
[0051] Un aspecto adicional se basa en el descubrimiento de que una mejora de la calidad y la reducción de la tasa de bits específicamente para señales que comprenden porciones de transición, como ocurre muy a menudo en las señales de audio, se obtiene combinando la tecnología de modelado de ruido temporal (TNS, por sus siglas en inglés) o modelado de mosaico temporal (TTS, por sus siglas en inglés) con reconstrucción de alta frecuencia. El procesamiento de modelado de ruido temporal (TNS)/modelado de mosaico temporal (TTS) en el lado del codificador implementado por una predicción sobre la frecuencia reconstruye la envolvente de tiempo de la señal de audio. Dependiendo de la implementación, es decir, cuando el filtro de modelado de ruido temporal se determina dentro de un intervalo de frecuencia no solo abarcando el intervalo de frecuencia de origen sino también el intervalo de frecuencia de destino para ser reconstruido en un decodificador de regeneración de frecuencia, la envolvente temporal se aplica no solo a la señal de audio central hasta una frecuencia de inicio de relleno de espacios, sino que también se aplica la envolvente temporal a los intervalos espectrales de segundas porciones espectrales reconstruidas. Por lo tanto, los pre-ecos o los post-ecos que se producirían sin el modelado de mosaico temporal se reducen o eliminan. Esto se logra aplicando una predicción inversa sobre la frecuencia no solo dentro del intervalo de frecuencia central hasta una cierta frecuencia de inicio de relleno de espacios sino también dentro de un intervalo de frecuencia por encima del intervalo de frecuencia central. Para este fin, la regeneración de frecuencia o la generación de mosaicos de frecuencia se llevan a cabo en el lado del decodificador antes de aplicar una predicción sobre la frecuencia. Sin embargo, la predicción sobre la frecuencia se puede aplicar, ya sea antes o después del modelado de la envolvente espectral, dependiendo de si el cálculo de información de energía se ha llevado a cabo sobre los valores espectrales residuales posteriores al filtrado o los valores espectrales (completos) antes del modelado de la envolvente.
[0052] El procesamiento del modelado de mosaico temporal (TTS) sobre uno o más mosaicos de frecuencia establece adicionalmente una continuidad de correlación entre el intervalo de origen y el intervalo de reconstrucción o en dos intervalos de reconstrucción adyacentes o mosaicos de frecuencia.
[0053] En una implementación, se prefiere utilizar el filtrado complejo de modelado de ruido temporal (TNS)/modelado de mosaico temporal (TTS). De este modo se evitan los fallos de solapamiento (temporales) de una representación real muestreado críticamente, como la transformada coseno discreta modificada (MDCT). Un filtro complejo de modelado de ruido temporal (TNS) se puede calcular en el lado del codificador aplicando no solo una transformada de coseno discreta modificada, sino también una transformada sinusoidal discreta modificada para obtener adicionalmente una transformada modificada compleja. Sin embargo, solo se transmiten los valores de la transformada de coseno discreta modificada, es decir, la parte real de la transformada compleja. Sin embargo, en el lado del decodificador, es posible estimar la parte imaginaria de la transformada utilizando los espectros de la MDCT de cuadros anteriores o posteriores de modo que, en el lado del decodificador, el filtro complejo se puede aplicar nuevamente en la predicción inversa sobre la frecuencia y, específicamente, la predicción sobre el límite entre el intervalo de origen y el intervalo de reconstrucción y también sobre el límite entre los mosaicos de frecuencia adyacentes de la frecuencia dentro del intervalo de reconstrucción.
[0054] El sistema de codificación de audio de la invención codifica de manera eficiente las señales de audio arbitrarias en un intervalo amplio de tasas de bits. Por consiguiente, para las tasas altas de bits, el sistema de la invención converge con la transparencia, para tasas bajas de bits se reduce al mínimo la molestia perceptual. Por lo tanto, la parte principal de tasa de bits disponible se utiliza para codificar en forma de onda solo la estructura perceptualmente más relevante de la señal en el codificador, y los espacios espectrales resultantes se rellenan en el decodificador con el contenido de la señal que se aproxima en líneas generales al espectro original. Un presupuesto de bits muy limitado se consume para controlar el así denominado relleno inteligente de espacios (IGF) basado en parámetros por información lateral dedicada transmitida desde el codificador al decodificador.
[0055] A continuación, realizaciones preferidas de la presente invención se describirán con referencia a los dibujos adjuntos, en los cuales:
[0056] la figura 1a ilustra un aparato para codificar una señal de audio;
[0057] la figura 1b ilustra un decodificador para decodificar una señal de audio codificada que concuerda con el codificador de la figura 1a;
[0058] la figura 2a ilustra una implementación preferida del decodificador;
[0059] la figura 2b ilustra una implementación preferida del codificador;
[0060] la figura 3a ilustra una representación esquemática de un espectro generado por el decodificador de dominio espectral de la figura 1b;
[0061] la figura 3b ilustra una tabla que indica la relación entre los factores de ajuste de escala para las bandas de factor de escala y las energías para las bandas de reconstrucción y la información de relleno de ruido para una banda de relleno de ruido;
[0062] la figura 4a ilustra la funcionalidad del codificador de dominio espectral para aplicar la selección de porciones espectrales en los conjuntos primero y segundo de porciones espectrales;
[0063] la figura 4b ilustra una implementación de la funcionalidad de la Fig.4a;
[0064] la figura 5a ilustra una funcionalidad de un codificador de la transformada coseno discreta modificada MDCT; la figura 5b ilustra una funcionalidad del decodificador con una tecnología de MDCT;
[0065] la figura 5c ilustra una implementación del regenerador de frecuencia;
[0066] la figura 6a ilustra un codificador de audio con la funcionalidad de modelado de ruido temporal/modelado de mosaico temporal;
[0067] la figura 6b ilustra un decodificador con la tecnología de modelado de ruido temporal/modelado de mosaico temporal; la figura 6c ilustra una funcionalidad adicional de modelado de ruido temporal/modelado de mosaico temporal con un orden diferente del filtro de predicción espectral y el modelador espectral;
[0068] la figura 7a ilustra una implementación de la funcionalidad del modelado de mosaico temporal (TTS);
[0069] la figura 7b ilustra un decodificador que concuerda con el codificador de la figura 7a;
[0070] la figura 7c ilustra una comparación de una señal original (panel izquierdo) y una señal extendida sin modelado de mosaico temporal TTS;
[0071] la figura 7d ilustra una representación de frecuencia que ilustra la correspondencia entre las frecuencias de relleno inteligente de espacios y las energías de modelado de mosaico temporal;
[0072] la figura 7e ilustra una comparación de una señal original (panel izquierdo) y una señal extendida sin modelado de mosaico temporal TTS;
[0073] la figura 8a ilustra un decodificador de dos canales con regeneración de frecuencia;
[0074] la figura 8b ilustra una tabla que ilustra combinaciones diferentes de las representaciones y los intervalos de origen/destino;
[0075] la figura 8c ilustra un diagrama de flujo que ilustra la funcionalidad del decodificador de dos canales con regeneración de frecuencia de la figura 8a;
[0076] la figura 8d ilustra una implementación más detallada del decodificador de la figura 8a;
[0077] la figura 8e ilustra una implementación de un codificador para el procesamiento de dos canales que será decodificado por el decodificador de la figura 8a:
[0078] la figura 9a ilustra un decodificador con la tecnología de regeneración de frecuencia utilizando valores de energía para el intervalo de frecuencia de regeneración;
[0079] la figura 9b ilustra una implementación más detallada del regenerador de frecuencia de la figura 9a;
[0080] la figura 9c ilustra un esquema que ilustra la funcionalidad de la figura 9b;
[0081] la figura 9d ilustra una implementación adicional del decodificador de la figura 9a;
[0082] la figura 10a ilustra un diagrama de bloques de un codificador que concuerda con el decodificador de la figura 9a; la figura 10b ilustra un diagrama de bloques para ilustrar una funcionalidad adicional de la calculadora de parámetros de la figura 10a;
[0083] la figura 10c ilustra un diagrama de bloques para ilustrar una funcionalidad adicional de la calculadora de parámetros de la figura 10a;
[0084] la figura 10d ilustra un diagrama de bloques para ilustrar una funcionalidad adicional de la calculadora de parámetros de la figura 10a;
[0085] la figura 11a ilustra un decodificador adicional que tiene una identificación específica del intervalo de origen para una operación de relleno de mosaicos espectrales en el decodificador;
[0086] la figura 11b ilustra la funcionalidad adicional del regenerador de frecuencia de la figura 11a;
[0087] la figura 11c ilustra un codificador utilizado para cooperar con el decodificador de la figura 11a;
[0088] la figura 11d ilustra un diagrama de bloques de una implementación de la calculadora de parámetros de la figura 11c; las figuras 12a y 12b ilustran esquemas de frecuencia para ilustrar un intervalo de origen y un intervalo de destino; la figura 12c ilustra un esquema de ejemplo de correlación de dos señales;
[0089] la figura 13a ilustra un codificador de la técnica anterior con extensión de ancho de banda; y
[0090] la figura 13b ilustra un decodificador de la técnica anterior con extensión de ancho de banda.
[0091] La figura 1a ilustra un aparato para codificar una señal de audio 99. La señal de audio 99 se introduce en un convertidor de espectro de tiempo 100 para convertir una señal de audio que tiene una tasa de muestreo en una representación espectral 101 emitida por el convertidor de espectro de tiempo. El espectro 101 se introduce en un analizador espectral 102 para analizar la representación espectral 101. El analizador espectral 101 está configurado para determinar un primer conjunto de primeras porciones espectrales 103 para ser codificado con una primera resolución espectral y un segundo conjunto diferente de segundas porciones espectrales 105 para ser codificado con una segunda resolución espectral. La segunda resolución espectral es más pequeña que la primera resolución espectral. El segundo conjunto de segundas porciones espectrales 105 se introduce en una calculadora de parámetros o codificador paramétrico 104 para calcular la información de envolvente espectral que tiene la segunda resolución espectral. Asimismo, se proporciona un codificador de audio de dominio espectral 106 para generar una primera representación codificada 107 del primer conjunto de primeras porciones espectrales que tiene la primera resolución espectral. Además, la calculadora de parámetros/codificador paramétrico 104 está configurado para generar una segunda representación codificada 109 del segundo conjunto de segundas porciones espectrales. La primera representación codificada 107 y la segunda representación codificada 109 se introducen en un multiplexor de corriente de bits o formador de corriente de bits 108 y el bloque 108 finalmente emite la señal de audio codificada para la transmisión o el almacenamiento en un dispositivo de almacenamiento.
[0092] Típicamente, una primera porción espectral tal como 306 de la figura 3a estará rodeada por dos segundas porciones espectrales tales como 307a, 307b. Esto no se aplica en la Codificación Avanzada de Audio de Alta Eficiencia (HE AAC), en donde el intervalo de frecuencia del codificador central es de banda limitada.
[0093] La figura 1b ilustra un decodificador que concuerda con el codificador de la figura 1a. La primera representación codificada 107 se introduce en un decodificador de audio de dominio espectral 112 para generar una primera representación decodificada de un primer conjunto de primeras porciones espectrales, en donde la representación decodificada tiene una primera resolución espectral. Además, la segunda representación codificada 109 se introduce en un decodificador paramétrico 114 para generar una segunda representación decodificada de un segundo conjunto de segundas porciones espectrales que tiene una segunda resolución espectral que es más baja que la primera resolución espectral.
[0094] El decodificador comprende además un regenerador de frecuencia 116 para regenerar una segunda porción espectral reconstruida que tiene la primera resolución espectral que utiliza una primera porción espectral. El regenerador de frecuencia 116 lleva a cabo una operación de relleno de mosaicos, es decir utiliza un mosaico o una porción del primer conjunto de primeras porciones espectrales y copia este primer conjunto de primeras porciones espectrales en el intervalo de reconstrucción o banda de reconstrucción que tiene la segunda porción espectral y generalmente lleva a cabo el modelado de la envolvente espectral u otra operación indicada por la segunda representación decodificada emitida por el decodificador paramétrico 114, es decir utilizando la información sobre el segundo conjunto de segundas porciones espectrales. El primer conjunto decodificado de primeras porciones espectrales y el segundo conjunto reconstruido de porciones espectrales indicado en la salida del regenerador de frecuencia 116 en la línea 117 se introduce en un convertidor de espectro-tiempo 118 configurado para convertir la primera representación decodificada y la segunda porción espectral reconstruida en una representación de tiempo 119, en donde la representación de tiempo tiene una tasa alta de muestreo determinada.
[0095] La figura 2b ilustra una implementación del codificador de la figura 1a. Una señal de entrada de audio 99 se introduce en un banco de filtros de análisis 220 correspondiente al convertidor de espectro de tiempo 100 de la figura 1a. A continuación, se lleva a cabo la operación de modelado de ruido temporal en el bloque de modelado de ruido temporal TNS 222. Por lo tanto, la entrada en el analizador espectral 102 de la figura 1a correspondiente a un enmascaramiento tonal de bloque 226 de la figura 2b puede ser, ya sea un valor espectral completo, cuando no se aplica la operación de modelado de ruido temporal/modelado de mosaico temporal o puede ser un valor residual espectral, cuando se aplica la operación de modelado de ruido temporal (TNS) como se ilustra en la figura 2b, bloque 222. Para las señales de dos canales o señales multicanal se puede llevar a cabo además una codificación conjunta de canal 228, por lo que el codificador de dominio espectral 106 de la figura 1a puede comprender el bloque de codificación conjunta de canal 228. Asimismo, se proporciona un codificador por entropía 232 para llevar a cabo una compresión de datos sin pérdidas que es también una porción del codificador de dominio espectral 106 de la figura 1a.
[0097] El analizador espectral/enmascaramiento tonal 226 separa la salida del bloque de modelado de ruido temporal (TNS) 222 en la banda central y los componentes tonales correspondientes al primer conjunto de primeras porciones espectrales 103 y los componentes residuales correspondientes al segundo conjunto de segundas porciones espectrales 105 de la figura 1a. El bloque 224 indicado como la codificación de extracción de parámetros de relleno inteligente de espacios (IGF) corresponde al codificador paramétrico 104 de la figura 1a y el multiplexor de la corriente de bits 230 corresponde al multiplexor de corriente de bits 108 de la figura 1a.
[0099] Preferiblemente, el banco de filtros de análisis 222 se implementa como un MDCT (banco de filtros de la transformada coseno discreta modificada) y la MDCT se utiliza para transformar la señal 99 en un dominio de frecuencia temporal con la transformada coseno discreta modificada que actúa como la herramienta de análisis de frecuencia.
[0101] El analizador espectral 226 aplica preferiblemente un enmascaramiento de tonalidad. Esta etapa de estimación de enmascaramiento de tonalidad se utiliza para separar los componentes tonales de los componentes tipo ruido en la señal. Esto permite que el codificador central 228 codifique todos los componentes tonales con un módulo psicoacústico. La etapa de estimación de enmascaramiento de tonalidad se puede implementar de muchas maneras diferentes y se implementa preferentemente de manera similar en su funcionalidad a la etapa de estimación de pista sinusoidal utilizada en el modelado sinusoidal y de ruido para la codificación de voz/audio [8, 9] o un codificador de audio basado en el modelo HILN descrito en [10]. Preferiblemente se utiliza una implementación que es fácil de implementar sin la necesidad de mantener trayectorias de nacimiento–muerte, pero también se puede utilizar cualquier otro detector de tonalidad o ruido.
[0103] El módulo de relleno inteligente de espacios IGF calcula la similitud que existe entre una región de origen y una región de destino. La región de destino estará representada por el espectro de la región de origen. La medida de la similitud entre las regiones de origen y de destino se realiza utilizando una estrategia de correlación cruzada. La región de destino se divide enn Tarmosaicos de frecuencia que no se superponen. Para cada mosaico en la región de destino,nSrcse crea un mosaico de origen a partir de una frecuencia fija de inicio. Estos mosaicos de origen se superponen por un factor entre 0 y 1, donde 0 significa 0 % de solapamiento y 1 significa 100 % de solapamiento. Cada uno de estos mosaicos de origen está correlacionada con el mosaico de destino en diversos retardos para encontrar el mosaico de origen que se adapte mejor al mosaico de destino. El mejor número de mosaico de adaptación se almacena enNummosaico[idx_tar], el retardo en el que se correlaciona mejor con el objetivo se almacena enxcorr_retardo[idx_tar][idx_src]y el signo de la correlación se almacena enxcorr_signo[idx_tar][idx_src]. En caso de que la correlación sea muy negativa, el mosaico de origen debe ser multiplicada por -1 antes del proceso de relleno de mosaico en el decodificador. El módulo de relleno inteligente de espacios IGF también se encarga de no sobrescribir los componentes tonales en el espectro ya que los componentes tonales se conservan utilizando el enmascaramiento de tonalidad. Se utiliza un parámetro de energía por bandas para almacenar la energía de la región de destino que permita reconstruir el espectro con precisión.
[0105] Este método tiene ciertas ventajas en comparación con la SBR clásica [1] en donde la cuadrícula de armónicos de una señal multitono es conservada por el codificador central en tanto que solo los espacios entre las sinusoides se llenan con el mejor "ruido modelado" de adaptación de la región de origen. Otra ventaja de este sistema en comparación con ASR (reemplazo espectral preciso) [2-4] es la ausencia de una etapa de síntesis de la señal que crea las porciones importantes de la señal en el decodificador. En cambio, esta tarea es asumida por el codificador central, lo que permite la conservación de los componentes importantes del espectro. Otra ventaja del sistema propuesto es la escalabilidad continua que ofrecen las características. Solo el uso deNummosaico[idx_tar]. y xcorr_retardo=0,para cada mosaico se denomina adaptación de granularidad en bruto y se puede utilizar para tasas bajas de bits mientras que el uso de la variablexcorr_retardopara cada mosaico permite adaptar mejor los espectros de destino y de origen.
[0107] Además, se propone una técnica de estabilización de elección de mosaicos que elimina los fallos de dominio de frecuencia tales como trino y ruido musical.
[0109] En caso de pares de canales estéreo se aplica un procesamiento de estéreo conjunto adicional. Esto es necesario, ya que, para un determinado intervalo de destino, la señal puede ser una fuente de sonido panoramizada y altamente correlacionada. En caso de que las regiones de origen elegidas para esta región en particular no estén bien correlacionadas, a pesar de que las energías se adaptan a las regiones de destino, la imagen espacial puede sufrir debido a las regiones de origen no correlacionadas. El codificador analiza cada banda de energía de la región de destino, por lo general llevando a cabo una correlación cruzada de los valores espectrales y si se supera un determinado umbral, establece una etiqueta conjunta para esta banda de energía. En el decodificador, las bandas de energía de los canales izquierdo y derecho se tratan individualmente si no se establece esta etiqueta conjunta de estéreo. En caso de que se establezca la etiqueta de estéreo conjunto, tanto las energías como la interconexión se llevan a cabo en el dominio de estéreo conjunto. La información de estéreo conjunto para las regiones de relleno inteligente de espacios IGF se señala de manera similar a la información conjunta de estéreo para la codificación central, que incluye una etiqueta que indica en el caso de la predicción si la dirección de la predicción es de mezcla descendente a residual o viceversa.
[0110] Las energías pueden calcularse a partir de las energías transmitidas en el dominio L/R.
[0111] Nrg [k] medio = Nrg[k] izquierdo Nrg[k] derecho
[0112] Nrg[k] lateral = Nrg[k] izquierdo Nrg[k] derecho;
[0114] donde k es el índice de frecuencia en el dominio de la transformada.
[0115] Otra solución consiste en calcular y transmitir las energías directamente en el dominio de estéreo conjunto para las bandas donde el estéreo conjunto está activo, por lo que no es necesaria la transformación de energía adicional en el lado del decodificador.
[0116] Los mosaicos de origen se crean siempre según la Matriz Media/Lateral:
[0118] mosaico medio[k]=0,5·(mosaico izquierdo[k]+mosaico derecho[k]) mosaico lateral[k]=0,5·(mosaico izquierdo[k]+mosaico derecho[k])
[0119] Ajuste de energía:
[0120] mosaico medio[k] = mosaico medio[k] * Nrg[k] medio;
[0121] mosaico lateral[k] = mosaico lateral[k] * Nrg[k] lateral;
[0122] Transformación conjunta de estéreo –> LR:
[0123] Si no se codifica ningún parámetro de predicción adicional:
[0124] mosaico izquierdo[k] = mosaico medio [k] mosaico lateral[k] mosaico derecho [k] = mosaico medio [k] mosaico lateral[k]
[0125] Si se codifica un parámetro de predicción adicional y si la dirección señalada es del medio al lateral:
[0126] mosaico lateral[k]=mosaico lateral[k] – coef. de predicción · mosaico medio[k] mosaico izquierdo[k]=mosaico medio[k] mosaico lateral[k]
[0127] mosaico derecho[k]=mosaico medio[k] – mosaico lateral[k]
[0129] Si la dirección señalada es del lateral al medio:
[0130] mosaico medio1[k]=mosaico medio[k] – coef. de predicción · mosaico lateral[k] mosaico izquierdo[k]=mosaico medio1[k] – mosaico lateral[k] mosaico derecho [k]=mosaico medio[k] mosaico lateral[k]
[0131] Este procesamiento asegura que a partir de los mosaicos utilizadas para regenerar regiones de destino altamente correlacionadas y regiones de destino panoramizadas, los canales izquierdo y derecho resultantes siguen representando una fuente de sonido correlacionada y panoramizada incluso si las regiones de origen no están correlacionadas, conservando la imagen estéreo para tales regiones.
[0132] En otras palabras, en la corriente de bits se transmiten etiquetas conjuntas de estéreo que indican si se utilizará L/R o M/S como un ejemplo para la codificación conjunta de estéreo general. En el decodificador, en primer lugar, la señal central se decodifica como lo indican las etiquetas conjuntas de estéreo para las bandas centrales. En segundo lugar, la señal central se almacena en ambas representaciones L/R y M/S. Para el relleno de mosaicos del relleno inteligente de espacios IGF, la representación de mosaicos de origen se selecciona para ajustar la representación de mosaicos de destino como lo indica la información conjunta de estéreo para las bandas de IGF.
[0134] El modelado de ruido temporal (TNS) es una técnica estándar y forma parte de la Codificación Avanzada de Audio (AAC) [11 – 13]. El modelado de ruido temporal TNS se puede considerar como una extensión del esquema básico de un codificador perceptual, mediante la inserción de una etapa de procesamiento opcional entre el banco de filtros y la fase de cuantificación. La tarea principal del módulo de modelado de ruido temporal TNS consiste en ocultar el ruido de cuantificación producido en la región de enmascaramiento temporal de señales de transición y, por lo tanto, produce un esquema de codificación más eficaz. En primer lugar, el modelado de ruido temporal TNS calcula un conjunto de coeficientes de predicción utilizando "predicción directa" en el dominio de la transformada, por ejemplo, la transformada coseno discreta modificada MDCT. Estos coeficientes se utilizan a continuación para aplanar la envolvente temporal de la señal. A medida que la cuantificación afecta al espectro filtrado del modelado de ruido temporal TNS, también el ruido de cuantificación es temporalmente plano. Mediante la aplicación del filtrado inverso del modelado de ruido temporal TNS en el lado del decodificador, el ruido de cuantificación se modela según la envolvente temporal del filtro de TNS y, por lo tanto, el ruido de cuantificación es enmascarado por el transitorio.
[0135] El relleno inteligente de espacios IGF se basa en una representación de MDCT. Preferiblemente, para una codificación eficaz se tienen que utilizar bloques largos de aproximadamente 20 ms. Si la señal dentro de dicho bloque largo contiene transitorios, en las bandas espectrales del relleno inteligente de espacios IGF ocurren pre– y pos–ecos audibles debido al relleno de mosaicos. La figura 7c muestra un efecto de pre-eco típico antes del inicio del transitorio debido al relleno inteligente de espacios IGF. En el lado izquierdo se muestra el espectrograma de la señal original y en el lado derecho se muestra el espectrograma de la señal extendida de ancho de banda sin filtrado del modelado de ruido temporal TNS.
[0137] Este efecto de pre–eco se reduce utilizando TNS en el contexto del relleno inteligente de espacios IGF. En esta instancia, el TNS se utiliza como una herramienta de modelado de mosaico temporal (TTS) ya que la regeneración espectral en el decodificador se lleva a cabo sobre la señal residual del TNS. Los coeficientes de predicción del TTS requeridos se calculan y aplican utilizando el espectro completo en el lado del codificador como es habitual. Las frecuencias de inicio y fin del modelado de ruido temporal (TNS)/modelado de mosaico temporal (TTS) no resultan afectadas por la frecuencia de inicio del relleno inteligente de espacios (IGF)fIGFiniciode la herramienta de IGF. En comparación con el modelado de ruido temporal (TNS) de la técnica anterior, la frecuencia de fin del modelado de mosaico temporal (TTS) aumenta a la frecuencia de fin de la herramienta de relleno inteligente de espacios (IGF), que es mayor quefIGFinicio. En el lado del decodificador se aplican los coeficientes de TNS/TTS sobre el espectro completo nuevamente, es decir el espectro central más el espectro regenerado más los componentes tonales del mapa de tonalidad (véase la figura 7e). La aplicación de modelado de mosaico temporal TTS es necesaria para formar la envolvente temporal del espectro regenerado para adaptarse de nuevo a la envolvente de la señal original. Por lo tanto, los pre–ecos ilustrados se reducen. Adicionalmente, todavía modela el ruido de cuantificación en la señal por debajofIGFiniciocomo es habitual en el modelado de ruido temporal (TNS).
[0139] En los decodificadores de la técnica anterior, la interconexión espectral en una señal de audio altera la correlación espectral en los límites de interconexión y, por lo tanto, afecta a la envolvente temporal de la señal de audio introduciendo dispersión. Por lo tanto, otra ventaja de la aplicación del relleno de mosaicos del relleno inteligente de espacios IGF en la señal residual es que, tras la aplicación del filtro de modelado, los límites del mosaico se correlacionan perfectamente, lo que resulta en una reproducción temporal más fiel de la señal.
[0141] En un codificador de la invención, el espectro que ha sido sometido al filtrado de TNS/TTS, el procesamiento de enmascaramiento de tonalidad y la estimación de parámetros de relleno inteligente de espacios IGF, carece de cualquier señal por encima de la frecuencia de inicio de IGF excepto los componentes tonales. Este espectro disperso está codificado ahora por el codificador central utilizando los principios de codificación aritmética y codificación predictiva. Estos componentes codificados junto con los bits de señalización forman la corriente de bits del audio.
[0142] La figura 2a ilustra la implementación correspondiente del decodificador. La corriente de bits en la figura 2a correspondiente a la señal de audio codificada se introduce en el demultiplexor/decodificador que estaría conectado, con respecto a la figura 1b, a los bloques 112 y 114. El demultiplexor de corriente de bits separa la señal de audio de entrada en la primera representación codificada 107 de la figura 1b y la segunda representación codificada 109 de la figura 1b. La primera representación codificada que tiene el primer conjunto de primeras porciones espectrales se introduce en el bloque de decodificación conjunta de canales 204 correspondiente al decodificador de dominio espectral 112 de la figura 1b. La segunda representación codificada se introduce en el decodificador paramétrico 114 que no se ilustra en la figura 2a y luego se introduce en el bloque de relleno inteligente de espacios (IGF) 202 correspondiente al regenerador de frecuencia 116 de la figura 1b. El primer conjunto de primeras porciones espectrales necesario para la regeneración de frecuencia se introduce en el bloque de IGF 202 a través de la línea 203. Asimismo, tras la decodificación conjunta de canales 204, la decodificación central específica se aplica en el bloque de enmascaramiento tonal 206 de manera que la salida del enmascaramiento tonal 206 corresponda a la salida del decodificador de dominio espectral 112. A continuación, el combinador 208 lleva a cabo una combinación, es decir una construcción de tramas donde la salida del combinador 208 tiene ahora el espectro de intervalo completo, pero todavía en el dominio filtrado de modelado de ruido temporal TNS/modelado de mosaico temporal TTS. Posteriormente, en el bloque 210 se lleva a cabo una operación inversa de TNS/TTS utilizando información de filtro de TNS/TTS proporcionada a través de la línea 109, es decir la información lateral de TTS está incluida preferiblemente en la primera representación codificada generada por el codificador de dominio espectral 106 que puede ser, por ejemplo, un codificador central de codificación avanzada de audio AAC directa o codificación unificada de voz y audio USAC, o puede estar incluida también en la segunda representación codificada. En la salida del bloque 210 se proporciona un espectro completo hasta la frecuencia máxima que es la frecuencia de intervalo completo definida por la tasa de muestreo de la señal de entrada original. A continuación se lleva a cabo una conversión de espectro/tiempo en el banco de filtros de síntesis 212 para obtener finalmente la señal de salida de audio.
[0144] La figura 3a ilustra una representación esquemática del espectro. El espectro se subdivide en bandas de factor de escala SCB en donde hay siete bandas de factor de escala SCB1 a SCB7 en el ejemplo ilustrado de la figura 3a. Las bandas de factor de escala pueden ser bandas de factor de escala de codificación avanzada de audio AAC que están definidas en la norma AAC y tienen un ancho de banda cada vez mayor hasta frecuencias superiores como se ilustra en la figura 3a esquemáticamente. Se prefiere llevar a cabo el relleno inteligente de espacios IGF no desde el comienzo del espectro, es decir a bajas frecuencias, sino iniciar la operación de IGF a una frecuencia de inicio de IGF ilustrada en 309. Por lo tanto, la banda de frecuencia central se extiende desde la frecuencia más baja a la frecuencia de inicio de IGF. Por encima de la frecuencia de inicio de IGF se aplica el análisis de espectro para separar los componentes espectrales de alta resolución 304, 305, 306, 307 (el primer conjunto de primeras porciones espectrales) de componentes de baja resolución representados por el segundo conjunto de segundas porciones espectrales. La figura 3a ilustra un espectro que se introduce a modo de ejemplo en el codificador de dominio espectral 106 o en el codificador conjunto de canales 228, es decir, el codificador central opera en todo el intervalo, pero codifica una cantidad significativa de valores espectrales cero, es decir estos valores espectrales cero se cuantifican a cero o se fijan en cero antes de la cuantificación o luego de la cuantificación. De todos modos, el codificador central opera en el intervalo completo, es decir, como si el espectro fuera como el ilustrado, es decir, el decodificador central no necesariamente tiene que estar al tanto de cualquier relleno inteligente de espacios del segundo conjunto de segunda porciones espectrales con una resolución espectral inferior.
[0146] Preferiblemente, la alta resolución está definida por una codificación por líneas de líneas espectrales, tales como las líneas de la transformada coseno directa modificada MDCT, mientras que la segunda resolución o baja resolución se define, por ejemplo, calculando sólo un único valor espectral por banda de factor de escala, donde una banda de factor de escala abarca varias líneas de frecuencia. Por lo tanto, la segunda resolución baja, con respecto a su resolución espectral, mucho menor que la primera o alta resolución definida por la codificación por líneas es generalmente aplicada por el codificador central tal como un codificador central de codificación avanzada de audio AAC o codificación unificada de voz y audio USAC.
[0148] En cuanto al factor de ajuste de escala o cálculo de energía, la situación se ilustra en la figura 3b. Debido al hecho de que el codificador es un codificador central y debido al hecho de que puede haber, pero no necesariamente, componentes del primer conjunto de porciones espectrales en cada banda, el codificador central calcula un factor de ajuste de escala para cada banda no solo en el intervalo central por debajo de la frecuencia de inicio de relleno inteligente de espacios (IGF) 309, sino también por encima de la frecuencia de inicio de IGF hasta la frecuencia máximafIGFparadaque es menor o igual a la mitad de la frecuencia de muestreo, es decir, f<s/2>. Por lo tanto, las porciones tonales codificadas 302, 304, 305, 306, 307 de la figura 3a y, en esta realización junto con los factores de ajuste de escala SCB1 a SCB7 corresponden a los datos espectrales de alta resolución. Los datos espectrales de baja resolución se calculan a partir de la frecuencia de inicio de IGF y corresponden a los valores de información de energía E<1>, E<2>, E<3>, E<4>, que se transmiten junto con los factores de ajuste de escala SF4 a SF7.
[0150] En particular, cuando el codificador central se encuentra en una condición de baja tasa de bits se puede aplicar además la operación de relleno de ruido adicional en la banda central, es decir una frecuencia inferior a la frecuencia de inicio del relleno inteligente de espacios IGF, es decir, en las bandas de factor de escala SCB1 a SCB3. En el relleno de ruido, existen varias líneas espectrales adyacentes que han sido cuantificadas a cero. En el lado del decodificador, estos valores espectrales cuantificados a cero se re–sintetizan y los valores espectrales re–sintetizados se ajustan en su magnitud utilizando una energía de relleno de ruido tal como NF<2>ilustrada en 308 en la figura 3b. La energía de relleno de ruido, que se puede dar en términos absolutos o en términos relativos particularmente con respecto al factor de ajuste de escala como en la codificación unificada de voz y audio USAC corresponde a la energía del conjunto de valores espectrales cuantificados a cero. Estas líneas espectrales de relleno de ruido también pueden ser consideradas un tercer conjunto de terceras porciones espectrales que son regeneradas por la síntesis de relleno de ruido simple sin ninguna operación de relleno inteligente de espacios IGF basada en la regeneración de frecuencia utilizando mosaicos de frecuencia de otras frecuencias para la reconstrucción de mosaicos de frecuencia utilizando valores espectrales de un intervalo de origen y la información de energía E<1>, E<2>, E<3>, E<4>.
[0151] Preferiblemente, las bandas para las cuales se calcula la información de energía coinciden con las bandas de factor de escala. En otras realizaciones se aplica un agrupamiento de valores de información de energía de manera que, por ejemplo, para las bandas de factor de escala 4 y 5 sólo se transmite un único valor de información de energía, pero incluso en esta realización, los límites de las bandas de reconstrucción agrupadas coincide con los límites de las bandas de factor de escala. Si se aplican diferentes separaciones de bandas, entonces se pueden aplicar nuevos cálculos o cálculos de sincronización, y esto puede tener sentido en función de la implementación determinada. Preferiblemente, el codificador de dominio espectral 106 de la figura 1a es un codificador activado psicoacústicamente como se ilustra en la figura 4a. Generalmente, como se ilustra por ejemplo en la norma MPEG2/4 AAC o MPEG1/2, Capa 3, la señal de audio para codificar después de haber sido transformada en el intervalo espectral (401 en la Figura.4a) se envía a una calculadora de factor de escala 400. La calculadora de factor de ajuste de escala se controla mediante un modelo psico-acústico que recibe adicionalmente la señal de audio para cuantificar o recibe, como en la norma MPEG1/2 Capa 3 o MPEG AAC, una representación espectral compleja de la señal de audio. El modelo psicoacústico calcula, para cada banda de factor de escala, un factor de escala que representa el umbral psico-acústico. Adicionalmente, los factores de ajuste de escala se ajustan, a continuación, por la cooperación bien conocida de los bucles de iteración interna y externa o por cualquier otro procedimiento de codificación adecuado de manera que se cumplan determinadas condiciones de tasas de bits. A continuación, los valores espectrales para cuantificar por un lado, y los factores de ajuste de escala calculados por otro lado se introducen en un procesador cuantificador 404. En la operación de codificación de audio simple, los valores espectrales que se van a cuantificar son ponderados por los factores de ajuste de escala y los valores espectrales ponderados se introducen a continuación en un cuantificador fijo que generalmente tiene una funcionalidad de compresión para intervalos de amplitud superiores. Entonces, en la salida del procesador cuantificador sí existen índices de cuantificación que se envían a continuación a un codificador por entropía que generalmente tiene codificación específica y muy eficiente para un conjunto de índices de cuantificación cero para valores de frecuencia adyacentes o, como también se denomina en la técnica, un "recorrido" de valores cero.
[0152] En el codificador de audio de la figura 1a, sin embargo, el procesador cuantificador generalmente recibe información sobre las segundas porciones espectrales del analizador espectral. Por lo tanto, el procesador cuantificador 404 se asegura de que, en la salida del procesador cuantificador 404, las segundas porciones espectrales identificadas por el analizador espectral 102 son cero o tienen una representación reconocida por un codificador o un decodificador como una representación cero que puede ser codificada de manera muy eficaz, específicamente cuando existen "recorridos" de valores cero en el espectro.
[0153] La figura 4b ilustra una implementación del procesador cuantificador. Los valores espectrales de la transformada coseno discreta modificada MDCT se pueden introducir en un bloque fijado en cero 410. Posteriormente, las segundas porciones espectrales ya se fijan en cero antes de llevar a cabo una ponderación por los factores de ajuste de escala en el bloque 412. En una implementación adicional, el bloque 410 no se proporciona, pero la cooperación fijada en cero se lleva a cabo en el bloque 418 posterior al bloque de ponderación 412. Incluso en otra implementación, la operación fijada en cero también se puede llevar a cabo en un bloque fijado en cero 422 posterior a una cuantificación en el bloque cuantificador 420. En esta implementación, los bloques 410 y 418 no estarían presentes. En general se proporcionan al menos uno de los bloques 410, 418, 422 dependiendo de la implementación específica.
[0154] Entonces, en la salida del bloque 422 se obtiene un espectro cuantificado correspondiente a lo que se ilustra en la figura 3a. Este espectro cuantificado se introduce entonces en un codificador por entropía tal como 232 en la figura 2b que puede ser un codificador Huffman o un codificador aritmético como se define, por ejemplo, en la norma de codificación unificada de voz y audio (USAC).
[0155] Los bloques fijados en cero 410, 418, 422, que se proporcionan alternativamente entre sí o en paralelo son controlados por el analizador espectral 424. El analizador espectral comprende preferiblemente cualquier implementación de un detector de tonalidad bien conocido o comprende cualquier tipo diferente de detector operativo para separar un espectro en componentes que se van a codificar con una alta resolución y componentes que se van a codificar con una baja resolución. Otros de estos algoritmos implementados en el analizador espectral pueden ser un detector de actividad de voz, un detector de ruido, un detector de voz o cualquier otro detector que determine, en función de la información espectral o metadatos asociados, los requisitos de resolución para diferentes porciones espectrales. La figura 5a ilustra una implementación preferida del convertidor de espectro de tiempo 100 de la figura 1a como se implementa, por ejemplo, en la codificación avanzada de audio (AAC) o en la codificación unificada de voz y audio (USAC). El convertidor de espectro de tiempo 100 comprende un formador de ventanas 502 controlado por un detector de transitorios 504. Cuando el detector de transitorios 504 detecta un transitorio, entonces señala un intercambio de ventanas largas a ventanas cortas al formador de ventanas. A continuación, el divisor de ventanas 502 calcula para los bloques superpuestos, tramas divididas en ventanas, en donde cada trama dividida en ventanas normalmente tiene dos valores N como, por ejemplo, los valores 2048. Luego se lleva a cabo una transformación dentro de un transformador de bloques 506, y generalmente este transformador de bloques proporciona además una eliminación de manera que realiza una eliminación/transformada combinada para obtener una trama espectral con valores N tales como los valores espectrales de la transformada de coseno discreta modificada (MDCT). Por lo tanto, para una operación de ventanas largas, la trama en la entrada del bloque 506 comprende dos valores N como, por ejemplo, 2048 valores y una trama espectral entonces tiene 1024 valores. Sin embargo, a continuación, se lleva a cabo un intercambio en los bloques cortos, es decir cuando se llevan a cabo ocho bloques cortos donde cada bloque corto tiene 1/8 valores de dominio temporal formados en ventanas en comparación con una ventana larga y cada bloque espectral tiene 1/8 valores espectrales en comparación con un bloque largo. Por lo tanto, cuando esta eliminación se combina con una operación del 50 % de solapamiento del formador de ventanas, el espectro es una versión muestreada críticamente de la señal de audio de dominio temporal 99.
[0157] Posteriormente se hace referencia a la figura 5b que ilustra una implementación específica del regenerador de frecuencia 116 y el convertidor de tiempo de espectro 118 de la figura 1b, o de la operación combinada de los bloques 208, 212 de la figura 2a. En la figura 5b se ilustra una banda de reconstrucción específica tal como la banda de factor de escala 6 de la figura 3a. La primera porción espectral en esta banda de reconstrucción, es decir, la primera porción espectral 306 de la Fig. 3a se introduce en el bloque constructor/regulador de tramas 510. Asimismo, una segunda porción espectral reconstruida para la banda de factor de escala 6 se introduce también en el constructor/regulador de tramas 510. Además, la información de la energía tal como E<3>de la figura 3b para una banda de factor de escala 6 también se introduce en el bloque 510. La segunda porción espectral reconstruida en la banda de reconstrucción ya ha sido generada por el relleno de mosaicos de frecuencia utilizando un intervalo de origen y la banda de reconstrucción luego corresponde al intervalo de destino. En esta instancia se lleva a cabo un ajuste de energía de la trama para obtener finalmente la trama reconstruida completa que tiene los valores N como, por ejemplo, los que se obtienen en la salida del combinador 208 de la figura 2a. A continuación, en el bloque 512 se lleva a cabo una transformada/interpolación inversa de bloques para obtener 248 valores de dominio temporal para los 124 valores espectrales, por ejemplo, en la entrada del bloque 512. A continuación, en el bloque 514 se lleva a cabo una operación de síntesis de formación de ventanas que está controlada de nuevo por una indicación de ventana larga/ventana corta transmitida como información lateral en la señal de audio codificada. Luego, en el bloque 516 se lleva a cabo una operación de solapamiento/adición con una trama de tiempo anterior. Preferiblemente, la transformada de coseno discreta modificada (MDCT) aplica un solapamiento del 50 % de manera que, para cada nueva trama de tiempo de valores 2N se emiten finalmente los valores de dominio temporal N. Se prefiere un solapamiento del 50 % debido al hecho de que proporciona un muestreo crítico y un cruce continuo de una trama a la trama siguiente debido a la operación de solapamiento/adición del bloque 516.
[0159] Tal como se ilustra en 301 en la figura 3a se puede aplicar adicionalmente una operación de relleno de ruido, no solo por debajo de la frecuencia de inicio de relleno inteligente de espacios (IGF) sino también por encima de la frecuencia de inicio de IGF como para la banda de reconstrucción contemplada coincidiendo con la banda de factor de escala 6 de la figura 3a. A continuación, los valores espectrales de relleno de ruido también se pueden introducir en el constructor/regulador de tramas 510 y el ajuste de los valores espectrales de relleno de ruido también se puede aplicar dentro de este bloque o los valores espectrales de relleno de ruido ya se pueden ajustar utilizando la energía de relleno de ruido antes de ser introducidos en el constructor/regulador de tramas 510.
[0161] Preferiblemente, una operación de IGF, es decir una operación de relleno de mosaicos de frecuencia que utiliza valores espectrales de otras porciones se puede aplicar en el espectro completo. Por lo tanto, una operación de relleno de mosaicos espectrales no solo se puede aplicar en la banda alta por encima de una frecuencia de inicio de relleno inteligente de espacios IGF sino que también se puede aplicar en la banda baja. Asimismo, el relleno de ruido sin relleno de mosaicos de frecuencia también se puede aplicar no solo por debajo de la frecuencia de inicio de relleno inteligente de espacios IGF sino también por encima de la frecuencia de inicio de IGF. Sin embargo, se ha descubierto que la alta calidad y la alta eficiencia de la codificación de audio se pueden obtener cuando la operación de relleno de ruido está limitada al intervalo de frecuencia por debajo de la frecuencia de inicio de IGF y cuando la operación de relleno de mosaicos de frecuencia está limitada al intervalo de frecuencia por encima de la frecuencia de inicio de IGF, como se ilustra en la figura 3a.
[0163] Preferiblemente, los mosaicos de destino (TT) (que tienen frecuencias superiores a la frecuencia de inicio de IGF están sujetos a los límites de la banda de factor de escala del codificador de tasa completa. Los mosaicos de origen (ST), de los cuales se obtiene información, es decir para frecuencias inferiores a la frecuencia de inicio de IGF no están sujetos a los límites de la banda de factor de escala. El tamaño de los mosaicos de origen ST debe corresponder al tamaño del mosaico de destino TT asociado. Esto se demuestra utilizando el siguiente ejemplo. TT[0] tiene una longitud de 10 Intervalos de MDCT. Esto corresponde exactamente a la longitud de dos SBC posteriores (tal como 4 6). Entonces, todos los mosaicos de origen (ST) posibles que deben correlacionarse con TT[0], también tienen una longitud de 10 intervalos. Un segundo mosaico de destino TT[1] que es adyacente a TT[0] tiene una longitud de 15 intervalos 1 (SCB tiene una longitud de 7 8). Entonces, el mosaico de origen ST para lo anterior tiene una longitud de 15 intervalos en lugar de 10 intervalos como para TT[0].
[0165] En caso de que no se pueda encontrar un mosaico de destino (TT) para un mosaico de origen (ST) con la longitud del mosaico de destino (por ejemplo, cuando la longitud del TT es mayor que el intervalo de origen disponible), entonces no se calcula una correlación y el intervalo de origen se copia un número de veces en este TT (la copia se lleva a cabo una después de la otra de manera que una línea de frecuencia para la frecuencia más baja de la segunda copia sigue inmediatamente - en la frecuencia - la línea de frecuencia para la frecuencia más alta de la primera copia), hasta que mosaico de destino (TT) se rellene completamente.
[0167] Posteriormente se hace referencia a la figura 5c que ilustra una realización preferida adicional del regenerador de frecuencia 116 de la figura 1b o el bloque de relleno inteligente de espacios (IGF) 202 de la figura 2a.2a. El bloque 522 es un generador de mosaicos de frecuencia que no solo recibe una ID de la banda de destino, sino que además recibe una ID de la banda de origen. A modo de ejemplo, se ha determinado en el lado del codificador que la banda de factor de escala 3 de la figura 3a es muy adecuada para la reconstrucción de la banda de factor de escala 7. Por lo tanto, la ID de la banda de origen sería 2 y la ID de la banda de destino sería 7. Basándose en esta información, el generador de mosaicos de frecuencia 522 aplica una operación de copiado o de relleno de mosaicos de armónicos o cualquier otra operación de relleno de mosaicos para generar la segunda porción en bruto de los componentes espectrales 523. La segunda porción en bruto de los componentes espectrales tiene una resolución de frecuencia idéntica a la resolución de frecuencia incluida en el primer conjunto de primeras porciones espectrales.
[0169] Entonces, la primera porción espectral de la banda de reconstrucción tal como 307 de la Fig. 3a se introduce en un constructor de tramas 524 y la segunda porción en bruto 523 se introduce también en el constructor de tramas 524. Luego, la trama es reconstruida es ajustada por el regulador 526 utilizando un factor de ganancia para la banda de reconstrucción calculada por la calculadora de factor de ganancia 528. Es importante destacar, sin embargo, que la primera porción espectral en la trama no resulta afectada por el regulador 526, sino que solo la segunda porción en bruto para la trama de reconstrucción resulta afectada por el regulador 526. Para este fin, la calculadora del factor de ganancia 528 analiza la banda de origen o la segunda porción en bruto 523 y además analiza la primera porción espectral en la banda de reconstrucción para encontrar finalmente el factor de ganancia correcto 527 de manera que la energía de la trama ajustada emitida por el regulador 526 tiene la energía E<4>cuando se contempla una banda de factor de escala 7.
[0171] En este contexto, es muy importante evaluar la precisión de la reconstrucción de alta frecuencia de la presente invención en comparación con la codificación avanzada de audio de alta eficiencia HE-AAC. Esto se explica con respecto a la banda de factor de escala 7 en la figura 3a. Se supone que un codificador de la técnica anterior ilustrado en la figura 13a detectaría la porción espectral 307 a codificar con una alta resolución como un "armónico que falta". Entonces, la energía de este componente espectral se transmitiría junto con una información de la envolvente espectral para la banda de reconstrucción tal como la banda de factor de escala 7 al decodificador. A continuación, el decodificador recrearía el armónico que falta. Sin embargo, el valor espectral, en el que el armónico que falta 307 sería reconstruido por el decodificador de la técnica anterior de la figura 13b estaría en el medio de la banda 7 a una frecuencia indicada por la frecuencia de reconstrucción 390. Por lo tanto, la presente invención evita un error de frecuencia 391 que sería introducido por el decodificador de la técnica anterior de la figura 13d.
[0173] En una implementación, el analizador espectral también se implementa para el cálculo de similitudes entre primeras porciones espectrales y segundas porciones espectrales y para determinar, sobre la base de las similitudes calculadas, para una segunda porción espectral en un intervalo de reconstrucción una primera porción espectral que se adapte a la segunda porción espectral tanto como sea posible. Entonces, en esta implementación de intervalo de origen/intervalo de destino variable, el codificador paramétrico introducirá además en la segunda representación codificada una información de adaptación que indica un intervalo de origen de adaptación para cada intervalo de destino. En el lado del descodificador, esta información luego podría ser utilizada por un generador de mosaicos de frecuencia 522 de la figura 5c que ilustra una generación de una segunda porción en bruto 523 sobre la base de una ID de la banda de origen y una ID de la banda de destino.
[0175] Asimismo, tal como se ilustra en la figura 3a, el analizador espectral está configurado para analizar la representación espectral hasta una frecuencia máxima de análisis que es solo una pequeña cantidad por debajo de la mitad de la frecuencia de muestreo y que es preferentemente al menos un cuarto de la frecuencia de muestreo o generalmente superior.
[0177] Tal como se ilustra, el codificador opera sin reducción de muestreo y el decodificador opera sin funciona sin muestreo ascendente. En otras palabras, el codificador de audio de dominio espectral está configurado para generar una representación espectral que tiene una frecuencia de Nyquist definida por la tasa de muestreo de la señal de audio introducida originalmente.
[0179] Asimismo, tal como se ilustra en la figura 3a, el analizador espectral está configurado para analizar la representación espectral que se inicia con una frecuencia de relleno de espacios y que termina con una frecuencia máxima representada por una frecuencia máxima incluida en la representación espectral, en donde una porción espectral que se extiende desde una frecuencia mínima hasta la frecuencia de inicio de relleno de espacios pertenece al primer conjunto de porciones espectrales y en donde otra porción espectral tal como 304, 305, 306, 307 que tiene valores de frecuencia por encima de la frecuencia de relleno de espacios, está incluida adicionalmente en el primer conjunto de primeras porciones espectrales.
[0180] Como se explicó, el decodificador de audio de dominio espectral 112 está configurado de manera que una frecuencia máxima representada por un valor espectral en la primera representación decodificada es igual a una frecuencia máxima incluida en la representación de tiempo que tiene la tasa de muestreo, en donde el valor espectral para la frecuencia máxima en el primer conjunto de primeras porciones espectrales es cero o diferente de cero. De todos modos, para esta frecuencia máxima en el primer conjunto de componentes espectrales existe un factor de ajuste de escala para la banda de factor de escala, que es generado y transmitido sin importar si todos los valores espectrales en esta banda de factor de escala se fijan en cero o no, como se describe en el contexto de las figura.3a y 3b. Por lo tanto, la invención es ventajosa con respecto a otras técnicas paramétricas para aumentar la eficiencia de compresión, por ejemplo, la sustitución de ruido y el relleno de ruido (estas técnicas son exclusivamente para la representación eficiente de contenido de señal local tipo ruido), por lo que la invención permite una reproducción de frecuencia precisa de componentes tonales. Hasta la fecha, ningún método del estado actual de la técnica aborda la representación paramétrica eficiente del contenido arbitrario de la señal por relleno de espacios espectrales sin la restricción de una división fija a priori en la banda baja (LF) y en la banda alta (HF).
[0181] Realizaciones del sistema de la invención mejoran los enfoques del estado actual de la técnica y, por lo tanto, proporcionan una alta eficiencia de compresión, ninguna o solo una pequeña molestia perceptual y ancho de banda de audio completo, incluso para tasas bajas de bits.
[0182] El sistema general consiste en
[0183] • codificación central de banda completa
[0184] • relleno inteligente de espacios (relleno de mosaicos o relleno de ruido)
[0185] • partes tonales dispersas en núcleo, seleccionadas por enmascaramiento tonal
[0186] • codificación conjunta de par de estéreo para la banda completa, incluyendo el relleno de mosaicos
[0187] • TNS en el mosaico
[0188] • blanqueo espectral en el intervalo de relleno inteligente de espacios (IGF)
[0189] Una primera etapa hacia un sistema más eficiente consiste en eliminar la necesidad de transformar datos espectrales en un segundo dominio de transformada diferente del dominio del codificador central. Como la mayoría de los códecs de audio tal como, por ejemplo, la codificación avanzada de audio AAC, utilizan la transformada coseno discreta modificada MDCT como transformada básico, también es útil llevar a cabo la extensión de ancho de banda BWE en el dominio de la MDCT. Un segundo requisito para el sistema de BWE sería la necesidad de conservar la cuadrícula tonal mediante la cual se conservan incluso componentes tonales de alta frecuencia HF y, por lo tanto, la calidad del audio codificado es superior a los sistemas existentes. Para tener en cuenta ambos requisitos mencionados anteriormente para un esquema de extensión de ancho de banda BWE se propone un nuevo sistema denominado relleno inteligente de espacios (IGF). La figura 2b muestra el diagrama de bloques del sistema propuesto en el lado del codificador y la figura 2a muestra el sistema en el lado del decodificador.
[0190] La figura 6a ilustra un aparato para decodificar una señal de audio codificada en otra implementación de la presente invención. El aparato para decodificar comprende un decodificador de audio de dominio espectral 602 para generar una primera representación decodificada de un primer conjunto de porciones espectrales y como el regenerador de frecuencia 604 conectado corriente abajo del decodificador de audio de dominio espectral 602 para generar una segunda porción espectral reconstruida utilizando una primera porción espectral del primer conjunto de primeras porciones espectrales. Como se ilustra en 603, los valores espectrales en la primera porción espectral y en la segunda porción espectral son valores residuales de predicción espectral. Con el fin de transformar estos valores residuales de predicción espectral en una representación espectral completa se proporciona un filtro de predicción espectral 606. Este filtro de predicción inversa está configurado para llevar a cabo una predicción inversa sobre la frecuencia utilizando los valores residuales espectrales para el primer conjunto de la primera frecuencia y las segundas porciones espectrales reconstruidas. El filtro de predicción inversa espectral 606 está configurado por la información de filtro incluida en la señal de audio codificada. La figura 6b ilustra una implementación más detallada de la realización de la figura 6a. Los valores residuales de predicción espectral 603 se introducen en un generador de mosaicos de frecuencia 612 que genera valores espectrales en bruto para una banda de reconstrucción o para una determinada segunda porción de frecuencia y estos datos en bruto que ahora tienen la misma resolución que la primera representación espectral de alta resolución se introducen en el modelador espectral 614. El modelador espectral ahora modela el espectro utilizando información de la envolvente transmitida en la corriente de bits y los datos modelados espectralmente luego se aplican al filtro de predicción espectral 616 generando finalmente una trama de valores espectrales completos utilizando la información de filtro 607 transmitida desde el codificador al decodificador a través de la corriente de bits.
[0192] En la figura 6b se supone que, en el lado del codificador, el cálculo de la información de filtro transmitida a través de la corriente de bits y utilizada a través de la línea 607 se lleva a cabo con posterioridad al cálculo de la información de la envolvente. Por lo tanto, en otras palabras, un codificador que concuerda con el decodificador de la figura 6b primero calcularía los valores residuales espectrales y luego calcularía la información de la envolvente con los valores residuales espectrales tal como se ilustra, por ejemplo, en la figura 7a. Sin embargo, la otra implementación también es útil para ciertas implementaciones, cuando la información de la envolvente se calcula antes de llevar a cabo el filtrado de modelado de ruido temporal TNS o de modelado de mosaico temporal TTS en el lado del codificador. A continuación, el filtro de predicción espectral 622 se aplica antes de llevar a cabo el modelado espectral en el bloque 624. Por lo tanto, en otras palabras, los valores espectrales (completos) se generan antes de aplicar la operación de modelado espectral 624.
[0194] Preferiblemente, se calcula un filtro de TNS o un filtro de TTS de valor complejo. Esto se ilustra en la figura 7a. La señal de audio original se introduce en un bloque de transformada de coseno discreta modificada (MDCT) compleja 702. Luego se lleva a cabo el cálculo del filtro de TTS y el filtrado de TTS en el dominio complejo. A continuación, en el bloque 706 se calcula la información lateral del relleno inteligente de espacios IGF y también se calcula cualquier otra operación tal como el análisis espectral para la codificación, etc. Posteriormente, el primer conjunto de primera porción espectral generado por el bloque 706 se codifica con un codificador activado por modelo psicoacústico que se ilustra en 708 para obtener el primer conjunto de primeras porciones espectrales indicado en X(k) en la figura 7a y todos estos datos se envían al multiplexor de corriente de bits 710.
[0196] En el lado del decodificador, los datos codificados se introducen en un demultiplexor 720 para separar la información lateral de IGF, por un lado, la información lateral de TTS por otro lado y la representación codificada del primer conjunto de primeras porciones espectrales.
[0198] Entonces, el bloque 724 se utiliza para calcular un espectro complejo a partir de uno o más espectros de valor real. A continuación, tanto los espectros de valor real como los espectros complejos se introducen en el bloque 726 para generar valores de frecuencia reconstruidos en el segundo conjunto de segundas porciones espectrales para una banda de reconstrucción. Entonces, en la trama de banda completa obtenido completamente y relleno de mosaicos se lleva a cabo la operación inversa de modelado de mosaico temporal (TTS) 728 y, en el lado del decodificador se lleva a cabo una operación inversa final de MDCT compleja en el bloque 730. Por lo tanto, el uso de la información de filtro de TNS complejo permite generar automáticamente, cuando se aplica no solo dentro de la banda central o dentro de las bandas de mosaicos por separado sino también sobre los límites centrales/de mosaicos o sobre los límites de mosaicos/mosaicos, un procesamiento de límites de mosaicos que finalmente vuelve a introducir una correlación espectral entre los mosaicos. Esta correlación espectral sobre los límites de los mosaicos no se obtiene generando solamente mosaicos de frecuencia y llevando a cabo un ajuste de la envolvente espectral en estos datos en bruto de los mosaicos de frecuencia.
[0200] La figura 7c ilustra una comparación de una señal original (panel izquierdo) y una señal extendida sin Modelado de Mosaico Temporal (TTS). Se puede observar que hay fallos fuertes ilustrados por las porciones ampliadas en el intervalo de frecuencias superior ilustrado en 750. Esto, sin embargo, no ocurre en la figura 7e cuando la misma porción espectral en 750 se compara con el componente relacionado con los fallos 750 de la figura 7c.
[0202] Las realizaciones o el sistema de codificación de audio de la invención utilizan la parte principal de tasa de bits disponible para codificar en forma de onda solo la estructura perceptualmente más relevante de la señal en el codificador, y los espacios espectrales resultantes se rellenan en el decodificador con el contenido de la señal que se aproxima en líneas generales al espectro original. Un presupuesto de bits muy limitado se consume para controlar el así denominado relleno inteligente de espacios (IGF) basado en parámetros por información lateral dedicada transmitida desde el codificador al decodificador.
[0204] El almacenamiento o la transmisión de señales de audio a menudo están sujetos a estrictas limitaciones de tasas de bits. En el pasado, los codificadores se vieron obligados a reducir drásticamente el ancho de banda de audio transmitida cuando solo estaba disponible una tasa de bits muy baja. Los códecs de audio modernos ahora son capaces de codificar señales de banda ancha utilizando los métodos de extensión de ancho de banda (BWE) tales como la replicación de ancho de banda espectral (SBR, por sus siglas en inglés) [1]. Estos algoritmos se basan en una representación paramétrica del contenido de alta frecuencia (HF) - que se genera a partir de la parte de baja frecuencia (LF) codificada en forma de onda de la señal decodificada por medio de transposición a la región espectral de alta frecuencia (HF) ("interconexión") y la aplicación de un procesamiento posterior basado en parámetros. En los esquemas de extensión de ancho de banda (BWE), la reconstrucción de la región espectral de alta frecuencia (HF) por encima de una así denominada frecuencia de cruce determinada se basa a menudo en la interconexión espectral. En general, la región de alta frecuencia HF consta de múltiples conexiones adyacentes y cada una de estas conexiones se obtiene de regiones de paso de banda (BP) del espectro de baja frecuencia LF por debajo de la frecuencia de cruce determinada. Los sistemas del estado actual de la técnica desempeñan con eficiencia la interconexión dentro de una representación de bancos de filtros copiando un conjunto de coeficientes de sub-bandas adyacentes desde una región de origen a la región de destino.
[0205] Si se implementa un sistema de BWE en un banco de filtros o el dominio de la transformada de tiempo-frecuencia, solo hay una posibilidad limitada para controlar la forma temporal de la señal de extensión de ancho de banda. Generalmente, la granularidad temporal está limitada por el tamaño de salto utilizado entre ventanas adyacentes de la transformada. Esto puede conducir a pre o pos-ecos no deseados en el intervalo espectral de la extensión de ancho de banda (BWE).
[0206] A partir de la codificación de audio perceptual, se sabe que la forma de la envolvente temporal de una señal de audio se puede restaurar utilizando técnicas de filtrado espectral como el modelado de la envolvente temporal (TNS) [14]. Sin embargo, el filtro del TNS conocido del estado actual de la técnica es un filtro de valor real en los espectros de valor real. Dicho filtro de valor real en los espectros de valor real puede verse seriamente afectado por fallos de solapamiento, especialmente si la transformada real subyacente es una transformada coseno discreta modificada (MDCT).
[0207] El modelado de mosaicos de la envolvente temporal aplica filtrado complejo en espectros de valor complejo, tales como los obtenidos, por ejemplo, a través de una transformada coseno discreta modificada compleja (CMDCT). De esta manera se evitan los fallos de solapamiento.
[0208] El modelado de mosaicos temporal consiste en
[0209] • estimación de coeficientes de filtro complejo y aplicación de un filtro de aplanamiento en el espectro de la señal original en el codificador
[0210] • transmisión de los coeficientes de filtro en la información lateral
[0211] • aplicación de un filtro de modelado en el espectro reconstruido relleno de mosaicos en el decodificador
[0212] La invención extiende la técnica del estado actual de la técnica conocida a partir de la codificación por transformada de audio, específicamente el modelado de ruido temporal (TNS) por predicción lineal a lo largo de la dirección de la frecuencia, para el uso en una forma modificada en el contexto de extensión de ancho de banda.
[0213] Asimismo, el algoritmo de extensión de ancho de banda de la invención se basa en un relleno inteligente de espacios (IGF), pero emplea una transformada de valor complejo (CMDCT) sobremuestreada en oposición a la configuración estándar de relleno inteligente de espacios (IGF) que se basa en una representación de la transformada de coseno discreta modificada MDCT críticamente muestreada de valor real de una señal. La CMDCT puede ser vista como la combinación de los coeficientes de la MDCT en la parte real y los coeficientes de la transformada sinusoidal discreta modificada (MDST) en la parte imaginaria de cada coeficiente espectral de valor complejo.
[0214] Aunque el nuevo enfoque se describe en el contexto de IGF, el procesamiento de la invención puede utilizarse en combinación con cualquier método de extensión de ancho de banda BWE que se basa en una representación de bancos de filtros de la señal de audio.
[0215] En este nuevo contexto, la predicción lineal a lo largo de la dirección de la frecuencia no se utiliza como modelado de ruido temporal, sino más bien como una técnica de modelado de mosaico temporal (TTS). El cambio de nombre se justifica por el hecho de que los componentes de la señal rellenos de mosaicos se modelan temporalmente por TTS en comparación con el modelado de ruido de cuantificación por TNS en los códecs de la transformada perceptual del estado actual de la técnica.
[0216] La figura 7a muestra un diagrama de bloques de un codificador de BWE que utiliza IGF y el nuevo enfoque de TTS. Por lo tanto, el esquema básico de codificación funciona de la siguiente manera:
[0217] - calcular la CMDCT de una señal de dominio temporalx(n)para obtener la señal de dominio de frecuenciaX(k)- calcular el filtro de TTS de valor complejo
[0218] - obtener la información lateral para la BWE y eliminar la información espectral que tiene que ser replicada por el decodificador
[0219] - aplicar la cuantificación utilizando el módulo psicoacústico (PAM, por sus siglas en inglés) -almacenar/transmitir los datos, solo se transmiten los coeficientes de MDCT de valor real
[0220] La figura 7b muestra el decodificador correspondiente. Este invierte principalmente las etapas realizadas en el codificador.
[0221] En esta instancia, el esquema básico de decodificación funciona de la siguiente manera:
[0222] - estimar los coeficientes de la transformada sinusoidal discreta modificada MDST partir de los valores de la transformada de coseno discreta modificada MDCT (este procesamiento agrega un retardo de decodificador de bloques) y combinar los coeficientes de la MDCT y la MDST en coeficientes de la transformada de coseno discreta modificada compleja (MDCT de valor complejo
[0223] - llevar a cabo el relleno de mosaicos con su procesamiento posterior
[0224] - aplicar el filtrado de modelado de mosaico temporal TTS inverso con los coeficientes transmitidos del filtro de TTS - calcular la CMDCT inversa
[0225] Alternativamente, cabe destacar que el orden de la síntesis de TTS y el procesamiento posterior de IGF también se puede invertir en el decodificador si el análisis de TTS y la estimación de parámetros de IGF se invierten sistemáticamente en el codificador.
[0226] Para una codificación de transformada eficiente se deben utilizar preferentemente los así denominados "bloques largos" de aproximadamente 20 ms para lograr una ganancia de transformada razonable. Si la señal dentro de dicho bloque largo contiene transitorios, en las bandas espectrales reconstruidas ocurren pre- y pos-ecos audibles debido al relleno de mosaicos. La figura 7c muestra efectos típicos de pre-y post-ecos que alteran los transitorios debido al relleno inteligente de espacios (IGF). En el panel izquierdo de la figura 7c se muestra el espectrograma de la señal original y en el panel derecho se muestra el espectrograma de la señal de relleno de mosaicos sin el filtrado del modelado de mosaico temporal (TTS) de la invención. En este ejemplo, la frecuencia de inicio de IGFfIGFiniicoo f<División>entre la banda central y la banda rellena de mosaicos se selecciona comofs/4. En el panel derecho de la figura 7c se observan distintos pre-y post-ecos alrededor de los transitorios, especialmente prominentes en el extremo espectral superior de la región de frecuencia replicada.
[0227] La tarea principal del módulo de TTS consiste en restringir estos componentes de señal no deseados en estrecha proximidad alrededor de un transitorio y de ese modo ocultarlos en la región temporal gobernada por el efecto de enmascaramiento temporal de la percepción humana. Por lo tanto, los coeficientes de predicción necesarios de TTS se calculan y aplican utilizando "predicción directa" en el dominio de la CMDCT.
[0228] En una realización que combina TTS e IGF en un códec, es importante alinear determinados parámetros de TTS y parámetros de IGF de manera que un mosaico de IGF se filtre completamente por un filtro de TTS (filtro de aplanamiento o modelado) o no. Por lo tanto, todas las frecuencias TTS<inicio>[..] o TTS<parada>[..] no estarán comprendidas dentro de un mosaico de IGF, sino más bien estarán alineadas con las frecuenciasfIGF…respectivas. La figura 7d muestra un ejemplo de áreas operativas de TTS e IGF para un conjunto de tres filtros de TTS.
[0229] La frecuencia de fin del modelado de mosaico temporal TTS se ajusta a la frecuencia de fin de la herramienta de relleno inteligente de espacios IGF, que es mayor quefIGFinicio. Si el modelado de mosaico temporal TTS utiliza más de un filtro tiene que asegurarse de que la frecuencia de cruce entre dos filtros de TTS tiene que coincidir con la frecuencia dividida del relleno inteligente de espacios IGF. De lo contrario, un sub-filtro de TTS se excederá del límitefIGFiniciolo que producirá fallos no deseados como, por ejemplo, sobremodelado.
[0230] En la variante de implementación representada en la figura 7a y en la figura 7b, se debe tener especial cuidado de que en ese decodificador, las potencias de IGF estén ajustadas correctamente. Esto ocurre especialmente si, en el curso del procesamiento de TTS e IGF, diferentes filtros de TTS que tienen diferentes ganancias de predicción se aplican a la región de origen (como un filtro de aplanamiento) y a la región espectral de destino (como un filtro de modelado que no es la contrapartida exacta de dicho filtro de aplanamiento) de un mosaico del IGF. En este caso, la relación de la ganancia de predicción de los dos filtros de TTS aplicados ya no es igual a uno y, por lo tanto, debe aplicarse un ajuste de energía por esta relación.
[0231] En la variante de implementación alternativa, el orden de procesamiento posterior de IGF y TTS se invierte. En el decodificador, esto significa que el ajuste de energía por el procesamiento posterior de IGF se calcula después del filtrado de TTS y, de este modo, es la etapa de procesamiento final antes de la transformada de síntesis. Por lo tanto, independientemente de las diferentes ganancias de filtro de TTS aplicadas a un mosaico durante la codificación, la energía final se ajusta siempre correctamente por el procesamiento de IGF.
[0232] En el lado del decodificador se aplican los coeficientes de filtro de TTS en todo el espectro completo nuevamente, es decir el espectro central extendido por el espectro regenerado. La aplicación de modelado de mosaico temporal TTS es necesaria para formar la envolvente temporal del espectro regenerado para adaptarse a la envolvente de la señal original nuevamente. Por lo tanto, los pre–ecos ilustrados se reducen. Adicionalmente, todavía modela temporalmente el ruido de cuantificación en la señal por debajofIGFiniciocomo es habitual en el modelado de ruido temporal TNS de la técnica anterior.
[0233] En los codificadores de la técnica anterior, la interconexión espectral de una señal de audio (por ejemplo, la replicación de ancho de banda espectral (SBR)) altera la correlación espectral en los límites de interconexión y, por lo tanto, afecta la envolvente temporal de la señal de audio introduciendo dispersión. Por lo tanto, otra ventaja de la aplicación del relleno de mosaicos del relleno inteligente de espacios IGF en la señal residual es que, luego de la aplicación del filtro de modelado de mosaico temporal TTS, los límites del mosaico se correlacionan perfectamente, lo que resulta en una reproducción temporal más fiel de la señal.
[0234] El resultado de la señal procesada correspondiente se muestra en la figura 7e. En comparación, la versión sin filtrar (figura 7c, panel derecho) la señal filtrada de TTS muestra una buena reducción de pre- y post-ecos no deseados (figura 7e, panel derecho).
[0235] Asimismo, de acuerdo con la descripción, la figura 7a ilustra un codificador que concuerda con el decodificador de la figura 7b o el decodificador de la figura 6a. Básicamente, un aparato para codificar una señal de audio comprende un convertidor de espectro de tiempo tal como 702 para la conversión de una señal de audio en una representación espectral. La representación espectral puede ser una representación espectral de valor real o, como se ilustra en el bloque 702, una representación espectral de valor complejo. Además, se proporciona un filtro de predicción tal como 704 para llevar a cabo una predicción sobre la frecuencia para generar valores residuales espectrales, en donde el filtro de predicción 704 se define por la información del filtro de predicción obtenida de la señal de audio y enviada a un multiplexor de corriente de bits 710, como se ilustra en 714 en la figura 7a. Asimismo, se proporciona un codificador de audio tal como el codificador de audio activado psicoacústicamente 704. El codificador de audio está configurado para codificar un primer conjunto de primeras porciones espectrales de los valores residuales espectrales para obtener un primer conjunto codificado de primeros valores espectrales. Adicionalmente, un codificador paramétrico tal como el que se ilustra en 706 en la figura 7a se proporciona para codificar un segundo conjunto de segundas porciones espectrales. Preferiblemente, el primer conjunto de primeras porciones espectrales se codifica con resolución espectral superior en comparación con el segundo conjunto de segundas porciones espectrales.
[0236] Finalmente, tal como se ilustra en la figura 7a, se proporciona una interfaz de salida para emitir la señal codificada que comprende el segundo conjunto paramétricamente codificado de segundas porciones espectrales, el primer conjunto codificado de primeras porciones espectrales y la información del filtro ilustrada como "información lateral de modelado de mosaico temporal (TTS)" en 714 en la figura 7a.
[0237] Preferiblemente, el filtro de predicción 704 comprende una calculadora de información de filtro configurado para utilizar los valores espectrales de la representación espectral para calcular la información de filtro. Asimismo, el filtro de predicción está configurado para calcular los valores residuales espectrales utilizando los mismos valores espectrales de la representación espectral utilizada para calcular la información de filtro.
[0238] Preferiblemente, el filtro de TTS 704 está configurado de la misma manera conocida para los codificadores de audio de la técnica anterior que aplican la herramienta de modelado de ruido temporal TNS de acuerdo con la norma de codificación avanzada de audio AAC.
[0239] Posteriormente, una aplicación adicional que utiliza la decodificación de dos canales se analiza en el contexto de las figura.8a a 8e. Además, se hace referencia a la descripción de los elementos correspondientes en el contexto de las figuras 2a, 2b (codificación conjunta de canales 228 y decodificación conjunta de canales 204).
[0240] La figura 8a ilustra un decodificador de audio para generar una señal decodificada de dos canales. El decodificador de audio comprende cuatro decodificadores de audio 802 para decodificar una señal codificada de dos canales para obtener un primer conjunto de primeras porciones espectrales y adicionalmente un decodificador paramétrico 804 para proporcionar datos paramétricos para un segundo conjunto de segundas porciones espectrales y, adicionalmente, una identificación de dos canales que identifica, ya sea una primera o una segunda representación diferente de dos canales para las segundas porciones espectrales. Adicionalmente, se proporciona un regenerador de frecuencia 806 para regenerar una segunda porción espectral en función de una primera porción espectral del primer conjunto de primeras porciones espectrales y datos paramétricos para la segunda porción y la identificación de dos canales para la segunda porción. La figura 8b ilustra diferentes combinaciones para las representaciones de dos canales en el intervalo de origen y en el intervalo de destino. El intervalo de origen puede estar en la primera representación de dos canales y el intervalo de destino también puede estar en la primera representación de dos canales. Alternativamente, el intervalo de origen puede estar en la primera representación de dos canales y el intervalo de destino puede estar en la segunda representación de dos canales. Además, el intervalo de origen puede estar en la segunda representación de dos canales y el intervalo de destino puede estar en la primera representación de dos canales como se indica en la tercera columna de la figura 8b. Por último, tanto el intervalo de origen como el intervalo de destino pueden estar en la segunda representación de dos canales. En una realización, la primera representación de dos canales es una representación de dos canales por separado, en donde los dos canales de la señal de dos canales están representados individualmente. Entonces, la segunda representación de dos canales es una representación conjunta en donde los dos canales de la representación de dos canales están representados en forma conjunta, es decir, cuando un procesamiento posterior o la transformada de representación son necesarios para recalcular una representación de dos canales por separado que es necesaria para la salida a los altavoces correspondientes.
[0242] En una implementación, la primera representación de dos canales puede ser una representación izquierda/derecha (L/R) y la segunda representación de dos canales es una representación conjunta de estéreo. Sin embargo, otras representaciones de dos canales además de izquierda/derecha o M/S o la predicción estéreo se pueden aplicar y utilizar para la presente invención.
[0244] La figura 8c ilustra un diagrama de flujo para las operaciones llevadas a cabo por el decodificador de audio de la figura 8a. En una etapa 812, el decodificador de audio 802 lleva a cabo una decodificación del intervalo de origen. El intervalo de origen puede comprender, con respecto a la figura 3a, bandas de factor de escala SCB1 a SCB3. Asimismo, puede haber una identificación de dos canales para cada banda de factor de escala y la banda de factor de escala 1 puede estar, por ejemplo, en la primera representación (tal como L/R) y la tercera banda de factor de escala puede estar en la segundo representación de dos canales tal como M/S o predicción de mezcla descendente/residual. Por lo tanto, la etapa 812 puede resultar en diferentes representaciones para diferentes bandas. Entonces, en la etapa 814, el regenerador de frecuencia 806 está configurado para seleccionar un intervalo de origen para una regeneración de frecuencia. En la etapa 816, el regenerador de frecuencia 806 comprueba entonces la representación del intervalo de origen y en el bloque 818, el regenerador de frecuencia 806 compara la representación de dos canales del intervalo de origen con la representación de dos canales del intervalo de destino. Si ambas representaciones son idénticas, el regenerador de frecuencia 806 proporciona una frecuencia de regeneración por separado para cada canal de la señal de dos canales. Cuando, sin embargo, ambas representaciones detectadas en el bloque 818 no son idénticas, entonces se toma el flujo de la señal 824 y el bloque 822 calcula la otra representación de dos canales del intervalo de origen y utiliza esta otra representación calculada de dos canales para la regeneración del intervalo de destino. Por lo tanto, el decodificador de la figura 8a hace que sea posible regenerar un intervalo de destino que se indica que tiene la segunda identificación de dos canales utilizando un intervalo de origen que está en la primera representación de dos canales. Naturalmente, la presente invención permite regenerar, además, un intervalo de destino utilizando un intervalo de origen que tiene la misma identificación de dos canales. Y, adicionalmente, la presente invención permite regenerar un intervalo de destino que tiene una identificación de dos canales que indica una representación conjunta de dos canales y a continuación transformar esta representación en una representación de canales por separado, necesaria para el almacenamiento o la transmisión a los altavoces correspondientes para la señal de dos canales.
[0245] Se hace hincapié en que los dos canales de la representación de dos canales pueden ser dos canales estéreo, tales como el canal izquierdo y el canal derecho. Sin embargo, la señal también puede ser una señal multicanal que tiene, por ejemplo, cinco canales y un canal de altavoz de graves o que tiene incluso más canales. Entonces, un procesamiento de dos canales por pares descrito en el contexto de la figura 8a a 8e se puede llevar a cabo cuando los pares pueden ser, por ejemplo, un canal izquierdo y un canal derecho, canal envolvente izquierdo y un canal envolvente derecho y un canal central y un canal LFE (altavoz de graves). Cualquier otra formación de pares se puede utilizar con el fin de representar, por ejemplo, seis canales de entrada por tres procedimientos de procesamiento de dos canales.
[0247] La figura 8d ilustra un diagrama de bloques de un decodificador de la invención correspondiente a la figura 8a. Un intervalo de origen o un decodificador central 830 pueden corresponder al decodificador de audio 802. Los otros bloques 832, 834, 836, 838, 840, 842 y 846 pueden ser porciones del regenerador de frecuencia 806 de la figura 8a. En particular, el bloque 832 es un transformador de representación para transformar representaciones del intervalo de origen en bandas individuales de manera que, en la salida del bloque 832 está presente un conjunto completo del intervalo de origen en la primera representación por un lado y en la segunda representación de dos canales por otro lado. Estas dos representaciones completas del intervalo de origen se pueden almacenar en el almacenamiento 834 para ambas representaciones del intervalo de origen.
[0249] Entonces, el bloque 836 aplica una generación de mosaicos de frecuencia utilizando, como entrada, una ID del intervalo de origen y utilizando, además, una ID de dos canales como entrada para el intervalo de destino. Sobre la base de la ID de dos canales para el intervalo de destino, el generador de mosaicos de frecuencia accede al almacenamiento 834 y recibe la representación de dos canales del intervalo de origen que concuerda con la ID de dos canales para el intervalo de destino introducido en el generador de mosaicos de frecuencia en 835. Por lo tanto, cuando la ID de dos canales para el intervalo de destino indica el procesamiento conjunto de estéreo, entonces el generador de mosaicos de frecuencia 836 accede al almacenamiento 834 con el fin de obtener la representación conjunta de estéreo del intervalo de origen indicado por la ID del intervalo de origen 833.
[0250] El generador de mosaicos de frecuencia 836 lleva a cabo esta operación para cada intervalo de destino y la salida del generador de mosaicos de frecuencia es tal que cada canal de la representación de canales identificada por la identificación de dos canales está presente. Luego un regulador de envolventes 838 lleva a cabo un ajuste de la envolvente. El ajuste de envolvente se lleva a cabo en el dominio de dos canales identificado por la identificación de dos canales. Para este fin se requieren parámetros de ajuste de la envolvente y estos parámetros se transmiten desde el codificador al decodificador en la misma representación de dos canales descrita. Cuando la identificación de dos canales en el intervalo de destino para procesar por el regulador de envolventes tiene una identificación de dos canales que indica una representación de dos canales diferentes de los datos de la envolvente para este intervalo de destino, a continuación, un transformador de parámetros 840 transforma los parámetros de la envolvente en la representación de dos canales requerida. Cuando, por ejemplo, la identificación de dos canales para una banda indica la codificación conjunta de estéreo y cuando los parámetros para este intervalo de destino han sido transmitidos como parámetros de la envolvente L/R, entonces el transformador parámetro calcula los parámetros conjuntos de la envolvente estéreo a partir de los parámetros de la envolvente L/R descrita de manera que la representación paramétrica correcta se utiliza para el ajuste de la envolvente espectral de un intervalo de destino.
[0251] En otra realización preferida, los parámetros de la envolvente ya se transmiten como parámetros conjuntos de estéreo cuando se utiliza el estéreo conjunto en una banda de destino.
[0252] Cuando se supone que la entrada en el regulador de la envolvente 838 es un conjunto de intervalos de destino que tienen diferentes representaciones de dos canales, entonces la salida del regulador de la envolvente 838 también es un conjunto de intervalos de destino en diferentes representaciones de dos canales. Cuando un intervalo de destino tiene una representación conjunta tal como M/S, entonces este intervalo de destino es procesado por un transformador de representaciones 842 para calcular la representación por separado necesaria para un almacenamiento o la transmisión a los altavoces. Sin embargo, cuando un intervalo de destino ya tiene una representación por separado se toma el flujo de la señal 844 y se evita el transformador de representaciones 842. En la salida del bloque 842 se obtiene una representación espectral de dos canales que es una representación de dos canales por separado que luego se puede procesar adicionalmente como lo indica el bloque 846, en donde este procesamiento adicional puede ser, por ejemplo, una conversión de frecuencia/tiempo o cualquier otro procesamiento requerido.
[0253] Preferiblemente, las segundas porciones espectrales corresponden a las bandas de frecuencia, y la identificación de dos canales se proporciona como un arreglo de etiquetas correspondientes a la tabla de la figura 8b, en donde existe una etiqueta para cada banda de frecuencia. Entonces, el decodificador paramétrico está configurado para comprobar si la etiqueta se ha fijado o no y para controlar el regenerador de frecuencia 106 de acuerdo con una etiqueta para utilizar, ya sea una primera representación o una segunda representación de la primera porción espectral.
[0254] En una realización, solo el intervalo de reconstrucción que se inicia con la frecuencia de inicio del relleno inteligente de espacios (IGF) 309 de la figura 3a tiene identificaciones de dos canales para diferentes bandas de reconstrucción. En otra realización, esto también se aplica para el intervalo de frecuencia por debajo de la frecuencia de inicio de IGF 309.
[0255] En una realización adicional, la identificación de la banda de origen y la identificación de la banda de destino se pueden determinar de forma adaptativa por un análisis de similitud. Sin embargo, el procesamiento de dos canales de la invención también se puede aplicar cuando hay una asociación fija de un intervalo de origen a un intervalo de destino. Un intervalo de origen se puede utilizar para recrear, con respecto a la frecuencia, un intervalo de destino más amplio, ya sea por una operación de relleno de mosaicos de frecuencia de armónicos o una operación de relleno de mosaicos de frecuencia de copiado utilizando dos o más operaciones de relleno de mosaicos de frecuencia similares al procesamiento para múltiples interconexiones conocidas a partir del procesamiento de codificación avanzada de audio (AAC) de alta eficiencia.
[0256] La figura 8e ilustra un codificador de audio para codificar una señal de audio de dos canales. El codificador comprende un convertidor de espectro de tiempo 860 para convertir la señal de audio de dos canales en una representación espectral. Asimismo, un analizador espectral 866 para convertir la señal de audio de canal de audio de dos canales en una representación espectral. Además, se proporciona un analizador espectral 866 para llevar a cabo un análisis con el fin de determinar las porciones espectrales que serán codificadas con una alta resolución, es decir para descubrir el primer conjunto de primeras porciones espectrales y para descubrir adicionalmente el segundo conjunto de segundas porciones espectrales.
[0257] Adicionalmente, se proporciona un analizador de dos canales 864 para analizar el segundo conjunto de segundas porciones espectrales para determinar una identificación de dos canales que identifica una primera representación de dos canales o una segunda representación de dos canales.
[0258] Dependiendo del resultado del analizador de dos canales, una banda en la segunda representación espectral es parametrizada utilizando la primera representación de dos canales o la segunda representación de dos canales, y esto se lleva a cabo mediante un codificador de parámetros 868. El intervalo de frecuencia central, es decir la banda de frecuencia por debajo de la frecuencia de inicio del relleno inteligente de espacios IGF 309 de la figura 3a es codificado por un codificador central 870. El resultado de los bloques 868 y 870 se introduce en una interfaz de salida 872. Como se indicó anteriormente, el analizador de dos canales proporciona una identificación de dos canales para cada banda, ya sea por encima de la frecuencia de inicio de IGF o para todo el intervalo de frecuencia, y esta identificación de dos canales también se envía a la interfaz de salida 872 de manera que estos datos también están incluidos en una señal codificada 873 emitida por la interfaz de salida 872.
[0259] Asimismo, se prefiere que el codificador de audio comprenda un transformador por bandas 862. Sobre la base de la decisión del analizador de dos canales 862, la señal de salida del convertidor de espectro de tiempo 862 se transforma en una representación indicada por el analizador de dos canales y, en particular, por la ID de dos canales 835. Por lo tanto, una salida del transformador por bandas 862 es un conjunto de bandas de frecuencia en donde cada banda de frecuencia puede estar en la primera representación de dos canales o en la segunda representación diferente de dos canales. Cuando se aplica la presente invención en banda completa, es decir cuando ambos intervalos, el intervalo de origen y el intervalo de reconstrucción, son procesados por el transformador por bandas, el analizador espectral 860 puede analizar esta representación. Alternativamente, sin embargo, el analizador espectral 860 también puede analizar la salida de la señal por el convertidor de espectro de tiempo indicado por la línea de control 861. Por lo tanto, el analizador espectral 860 puede aplicar el análisis de tonalidad preferido en la salida del transformador por bandas 862 o la salida del convertidor de espectro de tiempo 860 antes de haber sido procesada por el transformador por bandas 862. Asimismo, el analizador espectral puede aplicar la identificación del mejor intervalo de origen de adaptación para un cierto intervalo de destino, ya sea en el resultado del transformador por bandas 862 o en el resultado del convertidor de espectro de tiempo 860.
[0260] Posteriormente se hace referencia a las figuras 9a a 9d para ilustrar un cálculo preferido de los valores de información de energía ya analizados en el contexto de la figura 3a y en la figura 3b.
[0261] Los codificadores de audio del estado moderno de la técnica aplican diversas técnicas para reducir al mínimo la cantidad de datos que representan una señal de audio determinada. Los codificadores de audio como, por ejemplo, la codificación unificada de voz y audio (USAC) [1] aplican una transformación de tiempo a frecuencia como la transformada de coseno discreta modificada MDCT para obtener una representación espectral de una señal de audio determinada. Estos coeficientes de la MDCT se cuantifican aprovechando los aspectos psicoacústicos del sistema auditivo humano. Si se reduce la tasa de bits disponible, la cuantificación se vuelve más gruesa introduciendo un gran número de valores espectrales reducidos a cero que generan fallos audibles en el lado del decodificador. Para mejorar la calidad de percepción, los decodificadores del estado de la técnica llenan estas porciones espectrales reducidas a cero con ruido aleatorio. El método de relleno inteligente de espacios IGF recolecta mosaicos de la señal que no es cero restantes para llenar esos espacios en el espectro. Es crucial para la calidad perceptual de la señal de audio decodificada que la envolvente espectral y la distribución de energía de los coeficientes espectrales se conserven. El método de ajuste de energía presentado en la presente invención utiliza la información lateral transmitida para reconstruir la envolvente espectral de la MDCT de la señal de audio.
[0262] Dentro de la replicación de ancho de banda espectral eSBR [15] la señal de audio se submuestrea al menos por un factor de dos y la parte de alta frecuencia del espectro se reduce completamente a cero [1, 17]. Esta parte eliminada se sustituye por técnicas paramétricas, eSBR, en el lado del decodificador. La eSBR implica el uso de una transformada adicional, la transformación de filtros espejo en cuadratura QMF que se utiliza para sustituir la parte de alta frecuencia vacía y para volver a muestrear la señal de audio [17]. Esto agrega complejidad computacional y consumo de memoria a un codificador de audio.
[0263] El codificador de USAC [15] ofrece la posibilidad de llenar espacios espectrales (líneas espectrales reducidas a cero) con ruido aleatorio, pero presenta los siguientes inconvenientes: el ruido aleatorio no puede conservar la estructura fina temporal de una señal transitoria y no se puede conservar la estructura armónica de una señal tonal.
[0264] El área donde opera la eSBR en el lado del decodificador fue completamente eliminada por el codificador [1]. Por lo tanto, la eSBR tiende a eliminar líneas tonales en la región de alta frecuencia o distorsionar las estructuras armónicas de la señal original. Como la resolución de frecuencia de filtros espejo en cuadratura (QMF) de la replicación de ancho de banda espectral (eSBR) es muy baja y la reinserción de componentes sinusoidales solo es posible en la resolución gruesa del banco de filtros subyacente, la regeneración de componentes tonales en la eSBR en el intervalo de frecuencia replicado tiene muy poca precisión.
[0265] La eSBR utiliza técnicas para ajustar las potencias de las áreas interconectadas, el ajuste de la envolvente espectral [1]. Esta técnica utiliza los valores de energía transmitidos en una cuadrícula de tiempo de frecuencia de QMF para remodelar la envolvente espectral. Este estado de la técnica no se ocupa de espectros parcialmente eliminados y debido a la alta resolución temporal tiende a necesitar una cantidad relativamente grande de bits para transmitir valores de energía apropiados o para aplicar una cuantificación gruesa a los valores de energía.
[0266] El método de IGF no necesita una transformación adicional, ya que utiliza la transformación de la MDCT de la técnica anterior que se calcula como se describe en [15].
[0267] El método de ajuste de energía presentado en la presente invención utiliza la información lateral generada por el codificador para reconstruir la envolvente espectral de la señal de audio. Esta información lateral es generada por el codificador como se indica a continuación:
[0268] a) aplicar una transformada coseno discreta modificada MDCT formada en ventanas a la señal de audio de entrada [16, sección 4.6], opcionalmente calcular una transformada sinusoidal discreta modificada MDST formada en ventanas, o estimar una MDST formada en ventanas a partir de la MDCT calculada.
[0269] b) aplicar modelado de ruido temporal TNS/modelado de mosaico temporal TTS en los coeficientes de la MDCT [15, sección 7.8]
[0270] c) calcular la energía media para cada banda de factor de escala de la MDCT por encima de la frecuencia de inicio de relleno inteligente de espacios (IGF) (fIGFinicio) a la frecuencia de fin de IGF (fIGFparada)
[0271] d) cuantificar los valores medios de energía
[0272] fIGFinicio and fIGFparadason parámetros dados por el usuario.
[0273] Los valores calculados en la etapa c) y d) están codificados sin pérdidas y se transmiten como información lateral con la corriente de bits al decodificador.
[0274] El decodificador recibe los valores transmitidos y los utiliza para ajustar la envolvente espectral.
[0275] a) Decuantificar los valores transmitidos de la MDCT
[0276] b) Aplicar el relleno de ruido de la codificación unificada de voz y audio USAC de la técnica anterior si está indicado c) Aplicar el relleno de mosaicos del relleno inteligente de espacios IGF
[0277] d) Decuantificar los valores de energía transmitidos
[0278] e) Ajustar la envolvente espectral por banda de factor de escala
[0279] f) Aplicar TNS/TTS si se indica
[0281] Dejar que sea la transformada MDCT, la representación espectral de valor real de una señal de audio formada en ventanas de longitud de ventana 2N. Esta transformación se describe en [16]. El codificador aplica opcionalmente TNS enx̂.
[0282] En [16, 4.6.2] se describe una partición de x̂ en bandas de factor de escala. Las bandas de factor de escala son un conjunto de un conjunto de índices y se indican en este texto conscb.
[0283] Los límites de cadascbk con k = 0,1,2 … max_sfbestán definidos por un conjunto swb_intervalo (16, 4.6.2), dondeswb_intervalo[k] y swb_intervalo[k+1]-1definen el primer y el último índice para la línea de coeficiente espectral más baja y más alta contenida enscbk.La banda de factor de escalascbkse indica de la siguiente manera: ={swb_intervalo[k],1+ swb_intervalo[k],2+ swb_intervalo[k], ... , swb_intervalo[k+1]-1}
[0284] Si la herramienta de IGF es utilizada por el codificador, el usuario define una frecuencia de inicio de IGF y una frecuencia de fin de IGF. Estos dos valores se asignan al índice de banda de factor de escala de ajuste óptimoigfInicioSfbyigfParadaSfb. Ambos son enviados en la corriente de bits al decodificador.
[0285] [16] Describe una transformación de bloque largo y de bloque corto. Para los bloques largos solo se transmite un conjunto de coeficientes espectrales junto con un conjunto de factores de escala al decodificador. Para los bloques cortos se calculan ocho ventanas cortas con ocho conjuntos diferentes de coeficientes espectrales. Para guardar la tasa de bits, los factores de escala de dichas ocho ventanas de bloques cortos son agrupados por el codificador. En el caso del relleno inteligente de espacios IGF, el método presentado en esta invención utiliza bandas de factor de escala de la técnica anterior para agrupar valores espectrales que son transmitidos al decodificador:
[0288]
[0289] Dondek=igfInicioSfb,1igfInicioSfb, 2igfInicioSfb, ... ,igfFinSfb.
[0290] Para cuantificar
[0293]
[0295] se calcula. Todos los valoresÊkson transmitidos al decodificador.
[0296] Se supone que el codificador decide agrupar los conjuntos de factor de escalanúm_grupo_ventana. Se indica con w este agrupamiento–partición del conjunto {0,1,2, ..,7} que son los índices de las ocho ventanas cortas.wlindica ell– ésimo subconjunto dew, dondelindica el índice del grupo de ventana, 0 ≤l<núm_grupo_ventana.
[0297] Para el cálculo de bloques cortos, el usuario definió que la frecuencia de inicio/fin de IGF se asigna a bandas de factor de escala apropiadas. Sin embargo, por razones de simplicidad también se indica para bloques cortosk=igfInicioSfb,1igfInicioSfb,2igfInicioSfb,... ,igfFinSfbtambién.
[0298] El cálculo de la energía de IGF utiliza la información de agrupamiento para agrupar los valoresEk,l:
[0301]
[0303] Para cuantificar
[0306]
[0308] se calcula. Todos los valoresÊk,lson transmitidos al decodificador.
[0309] Las fórmulas de codificación mencionadas anteriormente operan utilizando solo coeficientes de la MDCT de valor real x̂. Para obtener una distribución de energía más estable en el intervalo de IGF, es decir para reducir las fluctuaciones de amplitud temporal, se puede utilizar un método alternativo para calcular los valores Ê<k>:
[0311] Dejar que
sea la transformada MDCT, la representación espectral de valor real de una señal de audio formada en ventanas de longitud de ventana 2N, y la representación espectral de la transformada MDST de valor real de la misma porción de la señal de audio. La representación espectral de la transformada sinusoidal discreta modificada MDST x̂<i>podría calcularse o estimarse exactamente a partir de x̂<r>.
[0313] indica la representación espectral compleja de la señal de audio formada en ventanas, que tiene x̂<r>como su parte real y x̂<i>como su parte imaginaria. El codificador aplica opcionalmente modelado de ruido temporal (TNS) en x̂<r>y x̂<i>.
[0314] Ahora, la energía de la señal en el intervalo de IGF se puede medir con
[0317]
[0319] Las potencias de valor real y complejo de la banda de reconstrucción, es decir el mosaico que se debe utilizar en el lado del decodificador en la reconstrucción del intervalo de IGF scb<k>, se calcula con:
[0322]
[0324] donde tr<k>es un conjunto de índices - el intervalo de mosaico de origen asociado, en función de scb<k>. En las dos fórmulas anteriores, en lugar del conjunto de índices scb<k>se podría utilizar el conjunto scb<k>(definido más adelante en este texto) para crear tr<k>para lograr valores más precisos E<t>y E<r>.
[0325] Calcular
[0328]
[0329]
[0331] Con
[0334]
[0336] ahora se calcula una versión más estable de E<k>ya que un cálculo de E<k>con los valores de MDCT sólo se ve afectado por el hecho de que los valores de MDCT no obedecen el teorema de Parseval y, por lo tanto, no reflejan la información de energía completa de los valores espectrales. Ê<k>se calcula como se indicó anteriormente.
[0337] Como se indicó anteriormente, para los bloques cortos se supone que el codificador decide agrupar los conjuntos de factor de escalanúm_grupo_ventana. Como anteriormente,wlindica ell-ésimo subconjunto dew, en dondelindica el índice del grupo de ventana, 0 ≤l<núm_grupo_ventana.
[0338] Una vez más podría aplicarse la versión alternativa descrita anteriormente para calcular una versión más estable de E<k,>. Con las definiciones de
que es la transformada coseno discreta modificada (MDCT) y que es la señal de audio formada en ventanas de longitud 2N de la transformada sinusoidal discreta modificada MDST, calcular
[0341]
[0343] Calcular de manera análoga
[0345] y continuar con el factor
[0348]
[0350] que se utiliza para ajustar E<rk,l>: calculado anteriormente:
[0353]
[0355] Ê<k,l>se calcula como se indicó anteriormente.
[0356] El procedimiento que no sólo utiliza la energía de la banda de reconstrucción, ya sea derivado de la banda de reconstrucción compleja o de los valores de la MDCT, sino que también utiliza una información de energía del intervalo de origen proporciona una reconstrucción de energía mejorada.
[0357] Específicamente, la calculadora de parámetros 1006 está configurado para calcular la información de energía para la banda de reconstrucción utilizando información sobre la energía de la banda de reconstrucción y utilizando, además, la información sobre una energía de un intervalo de origen para ser utilizado para la reconstrucción de la banda de reconstrucción.
[0358] Asimismo, la calculadora de parámetros 1006 está configurado para calcular una información de energía (E<ok>) en la banda de reconstrucción de un espectro complejo de la señal original, para calcular una información de energía adicional (E<rk>) en un intervalo de origen de una parte de valor real del espectro complejo de la señal original para ser utilizada para reconstruir la banda de reconstrucción, y en el que la calculadora de parámetros está configurada para calcular la información de energía para la banda de reconstrucción utilizando la información de energía (E<ok>) y la información de energía adicional (E<rk>).
[0359] Además, la calculadora de parámetros 1006 está configurada para determinar una primera información de energía (E<ok>) en una banda de factor de escala que debe ser reconstruida de un espectro complejo de la señal original, para determinar una segunda información de energía (E<tk>) en un intervalo de origen del espectro complejo de la señal original para ser utilizada para reconstruir la banda de factor de escala que debe ser reconstruida, para determinar una tercera información de energía (E<rk>) en un intervalo de origen de una parte de valor real del espectro complejo de la señal original para ser utilizada para reconstruir la banda de factor de escala que debe ser reconstruida, para determinar una información de ponderación sobre la base de una relación entre al menos dos de la primera información de energía, la segunda información de energía, y la tercera información de energía, y para ponderar una de la primera información de energía y la tercera información de energía utilizando la información de ponderación para obtener una información de energía ponderada y para utilizar la información de energía ponderada como la información de energía para la banda de reconstrucción.
[0361] A continuación, se presentan ejemplos para los cálculos si bien muchos otros ejemplos pueden quedar a criterio de los expertos en la técnica en vista del principio general anterior:
[0363] A)
[0365]
[0368] Todos estos ejemplos confirman que, aunque solo se procesan valores reales de la MDCT en el lado del decodificador, el cálculo real es - debido al solapamiento y la adición - del procedimiento de cancelación de solapamiento de dominio temporal realizado implícitamente utilizando números complejos. Sin embargo, en particular, la determinación 918 de la información de energía de mosaico de las porciones espectrales adicionales 922, 923 de la banda de reconstrucción 920, para valores de frecuencia diferentes de la primera porción espectral 921 que tiene frecuencias en la banda de reconstrucción 920, se basa en valores reales de la MDCT. Por lo tanto, la información de energía transmitida al decodificador será generalmente menor que la información de energía E<ok>sobre la banda de reconstrucción del espectro complejo de la señal original. Por ejemplo, para el caso C anterior, esto significa que el factor f_k (información de ponderación) será menor que 1.
[0370] En el lado del decodificador, si la herramienta de relleno inteligente de espacios IGF se señala como ON, los valores transmitidosÊkse obtienen a partir de la corriente de bits y serán decuantificados con
[0372]
[0375] Para todosk=igfInicioSfb,1igfIncioSfb, 2igfIniciotSfb, ... ,igfFinSfb.
[0377] Un decodificador decuantifica los valores transmitidos de la MDCT a
y calcula la energía de conservación restante:
[0380]
[0382] donde k está en el intervalo definido anteriormente.
[0383] Indicamos quescbk= {i|i∈scbk∧xi= 0}. Este conjunto contiene todos los índices de la banda de factor de escalascbkque han sido cuantificados a cero por el codificador.
[0385] El método de sub-banda de relleno inteligente de espacios (IGF) (no descrito en el presente documento) se utiliza para llenar espacios espectrales que resultan de una cuantificación gruesa de los valores espectrales de la MDCT en el lado del codificador utilizando valores no cero de la MDCT transmitida. x contendrá adicionalmente los valores que reemplazan a todos los valores anteriores reducidos a cero. La energía del mosaico se calcula por:
[0388]
[0390] donde k está en el intervalo definido anteriormente.
[0391] La energía que falta en la banda de reconstrucción se calcula por:
[0394]
[0396] Y el factor de ganancia para el ajuste se obtiene por:
[0399]
[0402] Con
[0405]
[0407] El ajuste de la envolvente espectral que utiliza el factor de ganancia es:
[0409] para todos losi∈scbkykestá en el intervalo definido anteriormente.
[0410] Esto remodela la envolvente espectral de x a la forma de la envolvente espectral original x̂.
[0411] En principio, con la secuencia de ventanas cortas, todos los cálculos definidos anteriormente permanecen igual, pero se tiene en cuenta el agrupamiento de bandas de factor de escala. Se indica comoEk,llos valores de energía agrupados y decuantificados, obtenidos de la corriente de bits. Calcular
[0413] y
[0415] El índicejdescribe el índice de ventanas de la secuencia de bloques cortos.
[0416] Calcular
[0418]
[0421] Con
[0422] Aplicar
[0425]
[0427] para todos losi∈scbk,l.
[0429] Para las aplicaciones de tasas bajas de bits es posible un agrupamiento por pares de los valoresEksin perder demasiada precisión. Este método se aplica solo con bloques largos:
[0432]
[0435] dondek=igfInicioSfb,2igfInicioSfb, 4igfInicioSfb, ... ,igfFinSfb.
[0437] Nuevamente, luego de la decuantificación, todos los valoresEk>>1
son transmitidos al decodificador.
[0439] La figura 9a ilustra un aparato para decodificar una señal de audio codificada que comprende una representación codificada de un primer conjunto de primeras porciones espectrales y una representación codificada de datos paramétricos que indica las potencias espectrales para un segundo conjunto de segundas porciones espectrales. El primer conjunto de primeras porciones espectrales se indica en 901a en la figura 9a, y la representación codificada de los datos paramétricos se indica en 901b en la figura 9a. Un decodificador de audio 900 se proporciona para decodificar la representación codificada 901a del primer conjunto de primeras porciones espectrales para obtener un primer conjunto decodificado de primeras porciones espectrales 904 y para decodificar la representación codificada de los datos paramétricos para obtener datos paramétricos decodificados 902 para el segundo conjunto de segundas porciones espectrales que indican las potencias individuales para las bandas de reconstrucción, en donde las segundas porciones espectrales están ubicadas en las bandas de reconstrucción. Además, se proporciona un regenerador de frecuencia 906 para reconstruir valores espectrales de una banda de reconstrucción que comprende una segunda porción espectral. El regenerador de frecuencia 906 utiliza una primera porción espectral del primer conjunto de primeras porciones espectrales y una información de energía individual para la banda de reconstrucción, en donde la banda de reconstrucción comprende una primera porción espectral y la segunda porción espectral. El regenerador de frecuencia 906 comprende una calculadora 912 para determinar una información de energía de conservación que comprende una energía acumulada de la primera porción espectral que tiene frecuencias en la banda de la reconstrucción. Asimismo, el regenerador de frecuencia 906 comprende una calculadora 918 para determinar una información de energía de mosaico de otras porciones espectrales de la banda de reconstrucción y para valores de frecuencia que son diferentes de la primera porción espectral, en donde estos valores de frecuencia tienen frecuencias en la banda de reconstrucción, en donde las otras porciones espectrales deben ser generadas por la regeneración de frecuencia utilizando una primera porción espectral diferente de la primera porción espectral en la banda de reconstrucción.
[0441] El regenerador de frecuencia 906 comprende además una calculadora 914 para una energía que falta en la banda de reconstrucción, y la calculadora 914 funciona utilizando la energía individual para la banda de reconstrucción y la energía de conservación generada por el bloque 912. Además, el regenerador 906 de frecuencia comprende un regulador de la envolvente espectral 916 para el ajuste de las porciones espectrales adicionales en la banda de reconstrucción sobre la base de la información de energía que falta y la información de energía de mosaicos generada por el bloque 918.
[0443] Con referencia a la figura 9c, allí se ilustra una cierta banda de reconstrucción 920. La banda de reconstrucción comprende una primera porción espectral en la banda de reconstrucción tal como la primera porción espectral 306 en la figura 3a ilustrada esquemáticamente en 921. Asimismo, el resto de los valores espectrales en la banda de reconstrucción 920 se debe generar utilizando una región de origen, por ejemplo, de la banda de factor de escala 1, 2, 3 por debajo de la frecuencia de inicio del relleno inteligente de espacios 309 de la figura 3a. El regenerador de frecuencia 906 está configurado para generar valores espectrales en bruto para las segundas porciones espectrales 922 y 923. Luego se calcula un factor de ganancia g como se ilustra en la figura 9c con el fin de ajustar finalmente los valores espectrales en bruto en las bandas de frecuencia 922, 923 con el fin de obtener las segundas porciones espectrales reconstruidas y ajustadas en la banda de reconstrucción 920, que ahora tienen la misma resolución espectral, es decir, la misma distancia de línea que la primera porción espectral 921. Es importante entender que la primera porción espectral en la banda de reconstrucción ilustrada en 921 en la figura 9c está decodificada por el decodificador de audio 900 y no está influenciada por el ajuste de la envolvente llevado a cabo por el bloque 916 de la figura 9b. En cambio, la primera porción espectral en la banda de reconstrucción indicada en 921 se deja como está, ya que esta primera porción espectral es emitida por el decodificador de ancho de banda completa o de audio de tasa completa 900 a través de la línea 904.
[0445] A continuación, se analizará un ejemplo determinado con números reales. La energía de conservación restante calculada por el bloque 912, por ejemplo, es de cinco unidades de energía y esta energía es la energía de las cuatro líneas espectrales indicadas a modo de ejemplo en la primera porción espectral 921.
[0447] Asimismo, el valor de la energía E3 para la banda de reconstrucción que corresponde a la banda de factor de escala 6 de la figura 3b o la figura 3a es igual a 10 unidades. Es importante destacar que el valor de la energía no solo comprende la energía de las porciones espectrales 922, 923, sino también la energía total de la banda de reconstrucción 920 calculada en el lado del codificador, es decir, antes de llevar a cabo el análisis espectral, utilizando, por ejemplo, el enmascaramiento de la tonalidad. Por lo tanto, las diez unidades de energía abarcan las primeras y las segundas porciones espectrales en la banda de reconstrucción. Entonces, se supone que la energía de los datos del intervalo de origen para los bloques 922, 923 o de los datos en bruto del intervalo de destino para el bloque 922, 923 es igual a ocho unidades de energía. Por lo tanto, se calcula una energía que falta de cinco unidades.
[0449] Se calcula un factor de ganancia de 0,79 sobre la base de la energía que falta dividida por la energía de mosaico tEk. Entonces, las líneas espectrales en bruto para las segundas porciones espectrales 922, 923 se multiplican por el factor de ganancia calculado. De este modo, solo se ajustan los valores espectrales para las segundas porciones espectrales 922, 923 y las líneas espectrales para la primera porción espectral 921 no están influenciadas por este ajuste de la envolvente. Después de la multiplicación de los valores espectrales en bruto para las segundas porciones espectrales 922, 923 se ha calculado una banda de reconstrucción completa que consta de las primeras porciones espectrales en la banda de reconstrucción, y que consta de líneas espectrales en las segundas porciones espectrales 922, 923 en la banda de reconstrucción 920.
[0451] Preferiblemente, el intervalo de origen para generar los datos espectrales en bruto en las bandas 922, 923 está, con respecto a la frecuencia, por debajo de la frecuencia de inicio del relleno inteligente de espacios IGF 309 y la banda de reconstrucción 920 está por encima de la frecuencia de inicio de IGF 309.
[0453] Además, se prefiere que los límites de la banda de reconstrucción coincidan con los límites de la banda de factor de escala. Por lo tanto, una banda de reconstrucción tiene, en una realización, el tamaño de las bandas de factor de escala respectivas del decodificador de audio central o se dimensiona de manera que, cuando se aplica la formación de pares de energía, un valor de energía para una banda de reconstrucción proporciona la energía de dos o un número entero superior de bandas de factor de escala. Por lo tanto, cuando se supone que la acumulación de energía es llevada a cabo para la banda de factor de escala 4, la banda de factor de escala 5 y la banda de factor de escala 6, entonces el límite de frecuencia inferior de la banda de reconstrucción 920 es igual al límite inferior de la banda de factor de escala 4 y el límite de energía superior de la banda de reconstrucción 920 coincide con el límite superior de la banda de factor de escala 6.
[0455] A continuación, se describe la figura 9d con el fin de mostrar las funcionalidades adicionales del decodificador de la figura 9a. El decodificador de audio 900 recibe los valores espectrales decuantificados correspondientes a las primeras porciones espectrales del primer conjunto de porciones espectrales y, adicionalmente, los factores de escala para las bandas de factor de escala, tal como se ilustra en la figura 3b se proporcionan a un bloque de ajuste de escala inverso 940. El bloque de ajuste de escala inverso 940 proporciona todos los primeros conjuntos de primeras porciones espectrales por debajo de la frecuencia de inicio de IGF 309 de la figura 3a y, adicionalmente, las primeras porciones espectrales por encima de la frecuencia de inicio de IGF, es decir, las primeras porciones espectrales 304, 305, 306, 307 de la figura 3a que están todas ubicadas en una banda de reconstrucción ilustrada en 941 en la figura 9d. Por otra parte, las primeras porciones espectrales en la banda de origen para el relleno de mosaicos de frecuencia en la banda de la reconstrucción se proporcionan al regulador/calculadora de la envolvente 942 y este bloque recibe además la información de energía para la banda de reconstrucción proporcionada como información lateral paramétrica de la señal de audio codificada ilustrada en 943 en la figura 9d. Luego, el regulador/calculadora de la envolvente 942 proporciona las funcionalidades de la figura 9b y 9c y por último emite los valores espectrales ajustados para las segundas porciones espectrales en la banda de reconstrucción. Estos valores espectrales ajustados 922, 923 para las segundas porciones espectrales en la banda de reconstrucción y las primeras porciones espectrales 921 en la banda de reconstrucción indicada en la línea 941 en la figura 9d representan conjuntamente la representación espectral completa de la banda de reconstrucción.
[0457] Posteriormente se hace referencia a las figuras 10a a 10b para explicar las realizaciones preferidas de un codificador de audio que codifica una señal de audio para proporcionar o generar una señal de audio codificada. El codificador comprende un convertidor de tiempo/espectro 1002 que alimenta un analizador espectral 1004, y el analizador espectral 1004 está conectado a una calculadora de parámetros 1006 por un lado y a un codificador de audio 1008 por otro lado. El codificador de audio 1008 proporciona la representación codificada de un primer conjunto de primeras porciones espectrales y no abarca el segundo conjunto de segundas porciones espectrales. Por otra parte, la calculadora de parámetros 1006 proporciona información de la energía para una banda de reconstrucción que abarca las primeras y las segundas porciones espectrales. Asimismo, el codificador de audio 1008 está configurado para generar una primera representación codificada del primer conjunto de primeras porciones espectrales que tiene la primera resolución espectral, donde el codificador de audio 1008 proporciona factores de ajuste de escala para todas las bandas de la representación espectral generada por el bloque 1002. Adicionalmente, tal como se ilustra en la figura 3b, el codificador proporciona información de la energía al menos para las bandas de reconstrucción ubicadas, con respecto a la frecuencia, por encima de la frecuencia de inicio de IGF 309 como se ilustra en la figura 3a. Por lo tanto, para que las bandas de reconstrucción coincidan preferentemente con las bandas de factor de escala o con grupos de bandas de factor de escala, se proporcionan dos valores, es decir, el factor de ajuste de escala correspondiente del codificador de audio 1008 y, adicionalmente, la información de la energía emitida por la calculadora de parámetros 1006.
[0459] Preferiblemente, el codificador de audio tiene bandas de factor de escala con diferentes anchos de banda de frecuencia, es decir, con un número diferente de valores espectrales. Por lo tanto, la calculadora paramétrica comprende un normalizador 1012 para normalizar las potencias para el ancho de banda diferente con respecto al ancho de banda de la banda de reconstrucción específica. Para este fin, el normalizador 1012 recibe, como entradas, una energía en la banda y un número de valores espectrales en la banda y el normalizador 1012 luego emite una energía normalizada por banda de reconstrucción/banda de factor de escala.
[0461] Además, la calculadora paramétrica 1006a de la figura 10a comprende una calculadora de valor de la energía que recibe información de control del codificador de audio o central 1008 como se ilustra en la línea 1007 en la figura 10a. Esta información de control puede comprender información sobre los bloques largos/cortos utilizados por el codificador de audio y/o información de agrupamiento. Por consiguiente, mientras que la información sobre los bloques largos/cortos y la información de agrupamiento sobre ventanas cortas se refieren a un agrupamiento "temporal", la información de agrupamiento puede referirse además a un agrupamiento espectral, es decir, el agrupamiento de dos bandas de factor de escala en una sola banda de reconstrucción. Por lo tanto, la calculadora del valor de energía 1014 emite un único valor de energía para cada banda agrupada que abarca una primera y una segunda porción espectral cuando solo se han agrupado las porciones espectrales.
[0463] La figura 10d ilustra una realización adicional para la implementación del agrupamiento espectral. Para este fin, el bloque 1016 está configurado para calcular los valores de la energía para dos bandas adyacentes. A continuación, en el bloque 1018 se comparan los valores de la energía para las bandas adyacentes y, cuando los valores de la energía no son tan diferentes o menos diferentes que lo definido, por ejemplo, por un umbral, entonces se genera un único valor (normalizado) para ambas bandas como se indica en el bloque 1020. Como se ilustra en la línea 1019, el bloque 1018 se puede omitir. Asimismo, la generación de un valor único para dos o más bandas que se lleva a cabo en el bloque 1020 puede ser controlado por un control de tasa de bits del codificador 1024. Por lo tanto, cuando la tasa de bits se debe reducir, el control codificado de tasa de bits 1024 controla al bloque 1020 para generar un único valor normalizado para dos o más bandas, incluso cuando la comparación en el bloque 1018 no habría sido permitida para agrupar los valores de información de la energía.
[0465] En caso de que el codificador de audio lleve a cabo el agrupamiento de dos o más ventanas cortas, este agrupamiento se aplica también para la información de la energía. Cuando el codificador central lleva a cabo un agrupamiento de dos o más bloques cortos, entonces, para estos dos o más bloques, se calcula y se transmite solamente un único conjunto de factores de ajuste de escala. En el lado del decodificador, el decodificador de audio luego aplica el mismo conjunto de factores de ajuste de escala para ambas ventanas agrupadas.
[0467] En cuanto al cálculo de la información de la energía, los valores espectrales en la banda de la reconstrucción se acumulan sobre dos o más ventanas cortas. En otras palabras, esto significa que los valores espectrales en una determinada banda de reconstrucción para un bloque corto y para el bloque corto posterior se acumulan y solo se transmite un valor único de información de la energía para esta banda de reconstrucción que abarca dos bloques cortos. A continuación, en el lado del decodificador, el ajuste de la envolvente que se describe en la figura 9a a 9d no se lleva a cabo individualmente para cada bloque corto, pero se lleva a cabo conjuntamente para el conjunto de ventanas cortas agrupadas.
[0469] Luego se aplica nuevamente la normalización correspondiente de manera que, aunque se haya llevado a cabo cualquier agrupamiento en la frecuencia o agrupamiento temporal, la normalización permite fácilmente que, para el cálculo de la información del valor de energía en el lado del decodificador, solo debe conocerse el valor de la información de energía por un lado y la cantidad de líneas espectrales en la banda de reconstrucción o en el conjunto de bandas de reconstrucción agrupadas.
[0470] En los esquemas de extensión de ancho de banda BWE del estado de la técnica, la reconstrucción de la región espectral de alta frecuencia HF por encima de una así denominada frecuencia de cruce determinada se basa a menudo en la interconexión espectral. En general, la región de alta frecuencia HF consta de múltiples conexiones adyacentes y cada una de estas conexiones se obtiene de regiones de paso de banda (BP) del espectro de baja frecuencia LF por debajo de la frecuencia de cruce determinada. Dentro de una representación de banco de filtros de la señal, dichos sistemas copian un conjunto de coeficientes de sub-bandas adyacentes del espectro de baja frecuencia LF en la región de destino. Los límites de los conjuntos seleccionados suelen depender del sistema y no dependen de la señal. Para algunos contenidos de la señal, esta selección de interconexión estática puede provocar un timbre desagradable y la coloración de la señal reconstruida.
[0471] Otros enfoques transfieren la señal de baja frecuencia LF a la alta frecuencia HF a través de una modulación de banda lateral única adaptativa de la señal (SSB). Dichos enfoques son de alta complejidad computacional en comparación con [1] ya que operan a alta velocidad de muestreo en muestras de dominio temporal. Además, la interconexión puede volverse inestable, especialmente para señales no tonales (por ejemplo, de voz sorda) y, por lo tanto, la interconexión adaptativa del estado de la técnica puede introducir alteraciones en la señal.
[0472] El enfoque de la invención se denomina relleno inteligente de espacios (IGF) y, en su configuración preferida, se aplica en un sistema de extensión de ancho de banda BWE sobre la base de una transformada de frecuencia temporal como, por ejemplo, la transformada coseno discreta codificada (MDCT). Sin embargo, las enseñanzas de la invención son de aplicación general, por ejemplo, de manera análoga dentro de un sistema basado en el banco de filtros espejo en cuadratura (QMF).
[0473] Una ventaja de la configuración de IGF basado en la MDCT es la integración perfecta en los codificadores de audio basados en la MDCT, por ejemplo, la codificación avanzada de audio (AAC) de MPEG. Compartiendo la misma transformada para la codificación de audio de forma de onda y para BWE reduce significativamente la complejidad computacional general para el códec de audio.
[0474] Por otra parte, la invención proporciona una solución para los problemas inherentes de estabilidad que se encuentran en los esquemas de interconexión adaptativa del estado de la técnica.
[0475] El sistema propuesto se basa en la observación de que, para algunas señales, una selección de interconexión sin guía puede generar cambios de timbre y coloraciones en la señal. Si una señal que es tonal en la región espectral de origen (SSR) pero es tipo ruido en la región espectral de destino (STR), la interconexión de la STR tipo ruido por la SSR tonal puede generar un timbre antinatural. El timbre de la señal también puede cambiar ya que la estructura tonal de la señal podría desalinearse o incluso destruirse por el proceso de interconexión.
[0476] El sistema de IGF propuesto lleva a cabo una selección inteligente de mosaicos utilizando la correlación cruzada como medida de similitud entre una SSR en particular y una STR específica. La correlación cruzada de dos señales proporciona una medida de similitud de esas señales y también el retardo de correlación máxima y su signo. Por lo tanto, el enfoque de una selección de mosaicos basada en la correlación también se puede utilizar para ajustar con precisión el desplazamiento espectral del espectro copiado para que esté tan cerca como sea posible de la estructura espectral original.
[0477] La contribución fundamental del sistema propuesto es la elección de una medida de similitud adecuada, y también técnicas para estabilizar el proceso de selección de mosaicos. La técnica propuesta proporciona un equilibrio óptimo entre la adaptación de la señal instantánea y, al mismo tiempo, la estabilidad temporal. La provisión de estabilidad temporal es especialmente importante para las señales que tienen poca similitud de SSR y STR y que, por lo tanto, exhiben valores bajos de correlación cruzada o cuando se emplean medidas de similitud que son ambiguas. En dichos casos, la estabilización impide el comportamiento pesado-aleatorio de la selección adaptativa de mosaicos.
[0478] Por ejemplo, una clase de señales que a menudo plantea problemas para la extensión de ancho de banda del estado de la técnica se caracteriza por una concentración distinta de la energía en regiones espectrales arbitrarias, tal como se muestra en la figura 12a (a la izquierda). Aunque hay procedimientos disponibles para ajustar la envolvente espectral y la tonalidad del espectro reconstruido en la región de destino, para algunas señales, estos procedimientos no son capaces de conservar bien el timbre como se muestra en la figura 12a (a la derecha). Aunque hay métodos disponibles para ajustar la envolvente espectral y la tonalidad del espectro reconstruido en la región de destino, para algunas señales, estos métodos no son capaces de conservar bien el timbre como se muestra en la figura 12a (a la derecha). Por el contrario, en el espectro reconstruido (figura 12a, a la derecha) hay un conjunto distinto de pendientes y picos que se percibe como un fallo de coloración del timbre.
[0479] Una etapa importante de la nueva estrategia consiste en definir un conjunto de mosaicos entre los que puede tener lugar la elección basada en la similitud posterior. En primer lugar, los límites de los mosaicos, tanto de la región de origen como de la región de destino, tienen que estar definidos unos con otros. Por lo tanto, la región de destino entre la frecuencia de inicio de IGF del codificador centralfIGFinicioy una frecuencia más alta disponiblefIGFparadase divide en un número entero arbitrarionTarde mosaicos, cada uno de los cuales tiene un tamaño individual predefinido. Entonces, para cada mosaico de destinotar[idx_tar] se genera un conjunto de mosaicos de origen de igual tamañosrc[idx_src]. Por lo anterior se determina el grado básico de libertad del sistema de IGF. El número total de mosaicos de origennSrcestá determinado por el ancho de banda de la región de origen,
[0480] bw<src>= (f<IGFinicio>– f<IGFmín>)
[0481] dondefIGFmínes la frecuencia más baja disponible para la selección de mosaicos de manera que un número enteronSrcde mosaicos de origen se adapta enbwsrc. El número mínimo de mosaicos de origen es 0.
[0482] Para aumentar aún más el grado de libertad para la selección y el ajuste, se puede definir que los mosaicos de origen se superponen entre sí por un factor de solapamiento entre 0 y 1, en donde 0 significa ningún solapamiento y 1 significa 100 % de solapamiento. El caso de 100 % de solapamiento implica que solo uno o ningún mosaico de origen está disponible.
[0483] La figura 12b muestra un ejemplo de los límites de mosaicos de un conjunto de mosaicos. En este caso, todos los mosaicos de destino están correlacionados con cada uno de los mosaicos de origen. En este ejemplo, los mosaicos de origen se solapan en un 50 %.
[0484] Para un mosaico de destino, la correlación cruzada se calcula con varios mosaicos de origen en retardos de hastaxcorr_maxRetardointervalos. Para un mosaico de destino determinado idx_tary un mosaico de origenidx_scr,xcorr_val[idx_tar[idx_src] proporciona el valor máximo de la correlación cruzada absoluta entre los mosaicos, mientras quexcvorr_retardo[idx_tar][idx_src]: proporciona el retardo en el que se produce este máximo yxcorr_sign[idx_tar][idx_src]proporciona el signo de la correlación cruzada enxcorr_retardo[idx_tar][iidx_src].
[0485] El parámetroxcorr_lagse utiliza para controlar la proximidad de la coincidencia entre el mosaico de origen y el mosaico de destino. Este parámetro da lugar a una reducción de fallos y ayuda a conservar mejor el timbre y el color de la señal.
[0486] En algunos casos puede ocurrir que el tamaño de un mosaico de destino específico es mayor que el tamaño de los mosaicos de origen disponibles. En este caso, el mosaico de origen disponible se repite tan a menudo como sea necesario para llenar completamente el mosaico de destino específico. Todavía es posible llevar a cabo la correlación cruzada entre el mosaico grande de destino y el mosaico de origen más pequeño con el fin de obtener la mejor posición del mosaico de origen en el mosaico de destino en términos del retardo de la correlación cruzada xcorr_retardo y el signo xcorr_sign.
[0487] La correlación cruzada de los mosaicos espectrales en bruto y la señal original pueden no ser la medida de similitud más adecuada aplicada a los espectros de audio con una estructura fuerte de formantes. El blanqueo de un espectro quita la información de la envolvente en bruto y, por lo tanto, enfatiza la estructura fina espectral que es de interés principal para la evaluación de la similitud de mosaicos. El blanqueo también ayuda en un modelado fácil de la envolvente fácil de la región espectral de destino STR en el decodificador para las regiones procesadas por IGF. Por lo tanto, opcionalmente, el mosaico y la señal de origen se blanquean antes de calcular la correlación cruzada. En otras configuraciones, solo se blanquea el mosaico utilizando un procedimiento predefinido. Una etiqueta de "blanqueo" transmitida indica al decodificador que se aplicará el mismo proceso de blanqueo predefinido al mosaico de frecuencia dentro del relleno inteligente de espacios IGF.
[0488] Para blanquear la señal, primero se calcula una estimación de la envolvente espectral. A continuación, el espectro de la MDCT se divide por la envolvente espectral. La estimación de la envolvente espectral se puede estimar en el espectro de la MDCT, las potencias del espectro de la MDCT, las estimaciones del espectro de energía complejo basado en la MDCT o las estimaciones del espectro de energía. La señal en la que se estima la envolvente se llamaráseñal de basede aquí en adelante.
[0489] Las envolventes calculadas sobre estimaciones de espectro de energía complejo basado en la MDCT o el espectro de energía como señal de base tienen la ventaja de no tener fluctuación temporal en los componentes tonales. Si la señal de base está en un dominio de energía, el espectro de la MDCT tiene que dividirse por la raíz cuadrada de la envolvente para blanquear la señal correctamente.
[0490] Existen diferentes métodos para calcular la envolvente:
[0491] • transformando la señal de base con una transformada de coseno discreta (DCT), reteniendo solo los coeficientes más bajos de la DCT (fijando la más alta en cero) y luego calculando una DCT inversa
[0492] • calculando una envolvente espectral de un conjunto de coeficientes de predicción lineal (LPC, por sus siglas en inglés) calculado sobre la trama de audio de dominio temporal
[0493] • filtrando la señal de base con un filtro de paso bajo
[0494] Preferiblemente, se elige el último enfoque. Para aplicaciones que requieren baja complejidad computacional se puede llevar a cabo una cierta simplificación para el blanqueo de un espectro de la MDCT: En primer lugar, la envolvente se calcula por medio de una media móvil. Esto solo necesita dos ciclos de procesador por intervalo de la MDCT. Entonces, con el fin de evitar el cálculo de la división y la raíz cuadrada, la envolvente espectral se aproxima por 2n, en donde n es el logaritmo de número entero de la envolvente. En este dominio, la operación de raíz cuadrada se convierte simplemente en una operación de desplazamiento y, además, la división por la envolvente se puede llevar a cabo por otra operación de desplazamiento.
[0495] Después de calcular la correlación de cada mosaico de origen con cada mosaico de destino, para todos los mosaicos de destinonTarse selecciona el mosaico de origen con la correlación más alta para que lo sustituya. Para coincidir mejor con la estructura espectral original, el retardo de la correlación se utiliza para modular el espectro replicado por un número entero de intervalos de la transformada. En caso de retardos impares, el mosaico se modula adicionalmente a través de la multiplicación por una secuencia temporal alternativa de -1/1 para compensar la representación de frecuencia inversa de cualquier otra banda dentro de la transformada coseno discreta modificada MDCT.
[0496] La figura 12c muestra un ejemplo de una correlación entre un mosaico de origen y un mosaico de destino. En este ejemplo, el retardo de la correlación es 5, por lo que el mosaico de origen tiene que modularse por 5 intervalos hacia los intervalos de frecuencia más altos en la etapa de copiado del algoritmo de extensión de ancho de banda BWE. Adicionalmente, el signo del mosaico tiene que invertirse ya que el valor máximo de correlación es negativo y una modulación adicional como se describió anteriormente representa el retardo impar.
[0497] Por lo tanto, la cantidad total de información lateral para transmitir desde el codificador al decodificador podría constar de los siguientes datos:
[0498] • Númmosaico[nTar]: índice del mosaico de origen seleccionado por mosaico de destino
[0499] • Signomosaico[nTar]: signo del mosaico de destino
[0500] • Modmosaico[nTar]: retardo de la correlación por mosaico de destino
[0501] El recorte y la estabilización de mosaicos constituyen un paso importante en el relleno inteligente de espacios IGF. Su necesidad y ventajas se explican con un ejemplo, en el supuesto de una señal de audio tonal estacionaria como, por ejemplo, una nota de altura de tono estable. La lógica determina que se introducen menos fallos si, para una región de destino determinada, siempre se seleccionan los mosaicos de origen de la misma región de origen a través de las tramas. A pesar de que se supone que la señal es estacionaria, esta condición no se aplicaría bien en cada trama ya que la medida de similitud (por ejemplo, correlación) de otra región de origen similar igual podría dominar el resultado de la similitud (por ejemplo, correlación cruzada). Esto hace queNúmmosaico[nTar]entre tramas adyacentes dude entre dos o tres opciones muy similares. Este puede ser el origen de un fallo de tipo de ruido musical molesto. Con el fin de eliminar este tipo de fallos, el conjunto de mosaicos de origen se recortará de manera que los elementos restantes del conjunto de origen sean máximamente disímiles. Esto se logra a través de un conjunto de mosaicos de origen
[0503] de la siguiente manera. Para cualquier mosaico de origen s<i>, lo correlacionamos con todos los otros mosaicos de origen, encontrando la mejor correlación entre s<i>y s<j>y almacenándola en una matriz S<x>. Aquí, S<x>[i][j] contiene el valor máximo absoluto de correlación cruzada entre s<i>y s<j>. La adición de la matriz S<x>a lo largo de las columnas, proporciona la suma de las correlaciones cruzadas de un mosaico de origen s<i>con todos los otros mosaicos de origen T.
[0505]
[0507] Aquí, T representa una buena medida de similitud entre un mosaico de origen y otros mosaicos de origen. Si, para cualquier mosaico de origen i,
[0508] umbral T>
[0509] el mosaico de origen i puede ser retirado del conjunto de fuentes potenciales, ya que está muy correlacionado con otras fuentes. El mosaico que tiene la correlación más baja del conjunto de mosaicos que cumple la condición en la ecuación 1 se elige como un mosaico representativo para este subconjunto. De este modo, nos aseguramos de que los mosaicos de origen sean máximamente disímiles entre sí.
[0510] El método de recorte de mosaicos implica también una memoria del conjunto de mosaicos recortados utilizados en la trama anterior. Los mosaicos que estuvieron activos en la trama anterior se retienen en la siguiente trama si existen también candidatos alternativos para el recorte.
[0511] Dejar que los mosaicos s<3>, s<4>y s<5>estén activos a partir de los mosaicos {s<1>, s<2>..., s<5>} en la trama k, luego en la trama k+1, incluso si los mosaicos s<1>, s<3>y s<2>compiten por ser recortados en donde s<3>está correlacionado máximamente con los otros, s<3>se retiene ya que fue un mosaico de origen útil en la trama anterior y, por lo tanto, su retención en el conjunto de mosaicos de origen es beneficioso para reforzar la continuidad temporal en la selección de mosaicos. Este método se aplica preferentemente si la correlación cruzada entre el origen i y el destino j, representada como T<x>[i][j] es alta
[0512] Un método adicional para la estabilización de mosaicos consiste en retener el orden de los mosaicos de la trama k-1 anterior si ninguno de los mosaicos de origen en la trama k actual se correlaciona bien con los mosaicos de destino. Esto puede suceder si la correlación cruzada entre el origen i y el destino j, representada como T<x>[i][j] es muy baja para todos los i, j
[0513] Por ejemplo, si
[0515]
[0517] entonces se utiliza un umbral provisorio, luego
[0518] nummosaico[nTar]<k>= nummosaico[nTar]<k–1>
[0519] para todos los nTar de esta trama k.
[0520] Las dos técnicas anteriores reducen en gran medida los fallos que se producen a partir del cambio rápido de números de mosaicos fijos a través de las tramas. Otra ventaja adicional de este recorte y estabilización de mosaicos es que no se necesita enviar información extra al decodificador y tampoco se necesita un cambio de arquitectura del decodificador. Esta propuesta de recorte de mosaicos resulta una manera elegante de reducir el ruido musical energía en forma de fallos o ruido excesivo en las regiones espectrales de los mosaicos.
[0521] La figura 11a ilustra un decodificador de audio para decodificar una señal de audio codificada. El primer decodificador de audio comprende un decodificador de audio (central) 1102 para generar una primera representación decodificada de un primer conjunto de primeras porciones espectrales, en donde la representación decodificada tiene una primera resolución espectral.
[0522] Asimismo, el decodificador de audio comprende un decodificador paramétrico 1104 para generar una segunda representación decodificada de un segundo conjunto de segundas porciones espectrales que tiene una segunda resolución espectral que es más baja que la primera resolución espectral. Además, se proporciona un regenerador de frecuencia 1106 que recibe, como una primera entrada 1101, primeras porciones espectrales decodificadas y como una segunda entrada en 1103 la información paramétrica que incluye, para cada mosaico de frecuencia de destino o banda de reconstrucción de destino, una información de intervalo de origen. El regenerador de frecuencia de 1106 luego aplica la regeneración de frecuencia utilizando valores espectrales del intervalo de origen identificado por la información de adaptación con el fin de generar los datos espectrales para el intervalo de destino. A continuación, las primeras porciones espectrales 1101 y la salida del regenerador de frecuencia 1107 se introducen ambas en un convertidor de espectro-tiempo 1108 para generar finalmente la señal de audio decodificada.
[0523] Preferiblemente, el decodificador de audio 1102 es un decodificador de audio de dominio espectral, aunque el decodificador de audio también se puede implementar como cualquier otro decodificador de audio tal como, por ejemplo, un decodificador de audio de dominio temporal o paramétrico.
[0524] Como se indica en la figura 11b, el regenerador de frecuencia 1106 puede comprender las funcionalidades del bloque 1120 que ilustra un modulador de mosaicos - selector del intervalo de origen para retardos impares, un filtro blanqueado 1122, cuando se proporciona una etiqueta de blanqueo 1123 y, adicionalmente, una envolvente espectral con funcionalidades de ajuste implementadas como se ilustra en el bloque 1128 utilizando datos espectrales en bruto generados por cualquiera de los bloques 1120 o 1122 o la cooperación de ambos bloques. De todos modos, el regenerador de frecuencia 1106 puede comprender un conmutador 1124 reactivo a una etiqueta de blanqueo recibida 1123. Cuando se fija la etiqueta de blanqueo, la salida del selector de intervalo de origen/modulador de mosaicos para retardos impares se introduce en el filtro de blanqueo 1122. Sin embargo, la etiqueta de blanqueo 1123 no se fija para una cierta banda de reconstrucción, por lo que entonces se activa una línea de desvío 1126 de manera que la salida del bloque 1120 se proporciona al bloque de ajuste de la envolvente espectral 1128 sin ningún blanqueo.
[0525] Puede haber más de un nivel de blanqueo (1123) señalado en la corriente de bits y estos niveles pueden estar señalados por mosaico. En caso de que haya tres niveles señalados por mosaico, los niveles se codificarán de la siguiente manera:
[0527] bit = Bitdelectura(1);
[0528] si(bit == 1) {
[0529] para(índice_mosaico = 0..nT)
[0530] /*los mismos niveles que la última trama*/
[0531] nivel_blanqueamiento[índice_mosaico] = trama_prev_nivel_blanqueamiento[índice_mosaico];
[0532] } o bien {
[0533] /*primer mosaico:*/
[0534] índice_mosaico = 0;
[0535] bit = Bitdelectura(1);
[0536] si(bit == 1) {
[0537] nivel_blanqueamiento[índice_mosaico] = BLANQUEAMIENTO_MEDIO;
[0538] } o bien {
[0539] bit = Bitdelectura(1);
[0540] si(bit == 1) {
[0541] nivel_blanqueamiento[índice_mosaico] = BLANQUEAMIENTO_FUERTE;
[0542] } o bien {
[0543] nivel_blanqueamiento[índice_mosaico] = OFF; /*sin blanqueo*/
[0544] }
[0545] }
[0546] /*mosaicos restantes:*/
[0547] bit = Bitdelectura(1);
[0548] si(bit == 1) {
[0549] /*los niveles de aplanamiento para los mosaicos restantes son iguales que para el primero.*/
[0550] /*No tienen que leerse otros intervalos*/
[0551] para(índice_mosaico = 1..nT)
[0552] nivel_blanqueamiento[índice_mosaico] = nivel_blanqueamiento[0];
[0553] } o bien {
[0554] /*bits leídos para los mosaicos restantes como para el primer mosaico*/
[0555] para(índice_mosaico = 1..nT) {
[0556] bit = Bitdelectura(1);
[0557] si(bit == 1) {
[0558] nivel_blanqueamiento[índice_mosaico] = BLANQUEAMIENTO_MEDIO;
[0559] } o bien {
[0560] bit = Bitdelectura (1);
[0561] si(bit == 1) {
[0562] nivel_blanqueamiento[índice_mosaico] = BLANQUEAMIENTO_FUERTE;
[0563] } o bien {
[0564] nivel_blanqueamiento[índice_mosaico] = DESCONECTADO; /*sin blanqueo*/
[0565] }
[0566] }
[0567] }
[0568] }
[0569] }
[0570] MID_WHITENING y STRONG_WHITENING se refieren a distintos filtros de blanqueo (1122) que pueden diferir en la forma en que se calcula la envolvente (como se describió anteriormente).
[0571] El regenerador de frecuencia del lado del decodificador puede ser controlado por una ID de intervalo de origen 1121 cuando se aplica solo un esquema de selección de mosaicos espectrales en bruto. Sin embargo, cuando se aplica un esquema de selección de mosaicos espectrales de sincronización precisa, entonces se proporciona además un retardo de intervalo de origen 1119. Asimismo, siempre que el cálculo de la correlación proporcione un resultado negativo, entonces, adicionalmente se puede aplicar también un signo de la correlación al bloque 1120 de manera que cada una de las líneas espectrales de datos de página se multiplican por "-1" para representar el signo negativo.
[0572] Por lo tanto, la presente invención tal como se describe en la figura 11a, 11b garantiza la obtención de una calidad óptima de audio debido al hecho de que el mejor intervalo de origen coincidente para un destino determinado o intervalo de destino se calcula en el lado del codificador y se aplica en el lado del decodificador.
[0573] La figura 11c es un codificador de audio determinado para codificar una señal de audio que comprende un convertidor de tiempo-espectro 1130, un analizador espectral conectado posteriormente 1132 y, adicionalmente, una calculadora de parámetros 1134 y un codificador central 1136. El codificador central 1136 emite intervalos de origen codificados y la calculadora de parámetros 1134 emite información de adaptación para intervalos de destino.
[0574] Los intervalos de origen codificados se transmiten a un decodificador junto con información de adaptación para los intervalos de destino de manera que el decodificador ilustrado en la figura 11a se encuentra en la posición para llevar a cabo una regeneración de frecuencia.
[0576] La calculadora de parámetros 1134 está configurada para calcular similitudes entre primeras porciones espectrales y segundas porciones espectrales y para determinar, sobre la base de las similitudes calculadas para una segunda porción espectral, una primera porción espectral coincidente que se adapte a la segunda porción espectral. Preferiblemente, los resultados de adaptación para diferentes intervalos de origen e intervalos de destino, como se ilustra en las figuras 12a, 12b para determinar un par de adaptación seleccionado comprenden la segunda porción espectral, y la calculadora de parámetros está configurada para proporcionar esta información de adaptación que identifica el par de adaptación en una señal de audio codificada. Preferiblemente, la calculadora de parámetros 1134 de la presente invención está configurada para utilizar regiones de destino predefinidas en el segundo conjunto de segundas porciones espectrales o regiones de origen predefinidas en el primer conjunto de primeras porciones espectrales como se ilustra, por ejemplo, en la figura 12b. Preferiblemente, las regiones de destino predefinidas no se solapan o las regiones de origen predefinidas se solapan. Cuando las regiones de origen predefinidas son un subconjunto del primer conjunto de primeras porciones espectrales por debajo de una frecuencia de inicio de relleno de espacios 309 de la figura 3a, y preferentemente, la región de destino predefinida que abarca una región espectral inferior coincide, con su límite de frecuencia inferior, con la frecuencia de inicio de relleno de espacios de manera que cualquier intervalo de destino se encuentra por encima de la frecuencia de inicio de relleno de espacios y los intervalos de origen se encuentran por debajo de la frecuencia de inicio de relleno de espacios.
[0578] Como se explicó anteriormente, una granularidad fina se obtiene comparando una región de destino con una región de origen sin ningún retardo en la región de origen y la misma región de origen, pero con un cierto retardo. Estos retardos se aplican en la calculadora de correlación cruzada 1140 de la figura 11d y la selección de pares de adaptación es llevada a cabo finalmente por el selector de mosaicos 1144.
[0580] Además, se prefiere llevar a cabo un blanqueo de intervalos de origen y/o intervalos de destino como se ilustra en el bloque 1142. A continuación, este bloque 1142 proporciona una etiqueta de blanqueo a la corriente de bits que se utiliza para controlar el conmutador del lado del decodificador 1123 de la figura 11b. Asimismo, si la calculadora de correlación cruzada 1140 proporciona un resultado negativo, entonces este resultado negativo también se señala a un decodificador. Por lo tanto, en una realización preferida, el selector de mosaicos emite una ID de intervalo de origen para un intervalo de destino, un retardo, un signo y el bloque 1142 proporciona además una etiqueta de blanqueo.
[0581] Asimismo, la calculadora de parámetros 1134 está configurada para llevar a cabo un recorte de mosaicos de origen 1146 reduciendo el número de intervalos de origen potenciales por lo que una interconexión de origen se retira de un conjunto de mosaicos de origen potenciales sobre la base de un umbral de similitud. Por lo tanto, cuando dos mosaicos de origen son más similares o iguales a un umbral de similitud, entonces uno de estos dos mosaicos de origen se retira del conjunto de fuentes potenciales y el mosaico de origen eliminado ya no se utiliza para el procesamiento posterior y, específicamente, no puede ser seleccionado por el selector de mosaicos 1144 o no se utiliza para el cálculo de la correlación cruzada entre diferentes intervalos de origen e intervalos de destino como se llevó a cabo en el bloque 1140.
[0583] Se han descrito diferentes implementaciones con respecto a diferentes figuras. Las figuras 1a-5c se refieren a un esquema de codificador/decodificador de ancho de banda completa o de tasa completa. Las figuras 6a-7e se refieren a un esquema de codificador/decodificador con procesamiento de modelado de ruido temporal TNS o modelo de mosaico temporal TTS. Las figuras 8a-8e se refieren a un esquema de codificador/decodificador con procesamiento específico de dos canales. Las figuras 9a-10d se refieren a un cálculo específico de información de energía y la aplicación, y las figura.11a-12c se refieren a un modo específico de selección de mosaicos.
[0585] Todos estos aspectos diferentes pueden ser de uso inventivo y son independientes entre sí pero, adicionalmente, también se pueden aplicar juntos como se ilustra básicamente en la figura 2a y 2b. Sin embargo, el procesamiento específico de dos canales se puede aplicar también a un esquema de codificador/descodificador ilustrado en la figura 13, y esto mismo se aplica al procesamiento de TNS/TTS, al cálculo de información de energía de la envolvente y la aplicación en la banda de reconstrucción o la identificación del intervalo de origen de adaptación y la aplicación correspondiente en el lado del decodificador. Por otro lado, el aspecto de tasa completa se puede aplicar con o sin procesamiento de TNS/TTS, con o sin procesamiento de dos canales, con o sin una identificación del intervalo de origen de adaptación o con otros tipos de cálculos de energía para la representación de la envolvente espectral. Por lo tanto, es evidente que las características de uno de estos aspectos individuales se pueden aplicar también en otros aspectos.
[0587] Aunque algunos aspectos se han descrito en el contexto de un aparato para codificar o decodificar, es evidente que estos aspectos también representan una descripción del método correspondiente, en donde un bloque o dispositivo corresponde a una etapa del método o a una característica de una etapa del método. En forma análoga, los aspectos descritos en el contexto de una etapa del método también representan una descripción de un bloque o elemento o característica correspondiente de un aparato respectivo. Algunos o todas las etapas del método pueden ser ejecutados por medio de (o utilizando) un aparato de hardware, como por ejemplo, un microprocesador, un ordenador programable o un circuito electrónico. En algunas realizaciones, alguna o varias de las etapas metodológicas más importantes pueden ser ejecutadas por dicho aparato.
[0588] Dependiendo de ciertos requisitos de implementación, las realizaciones de la invención se pueden implementar en hardware o en software. La implementación se puede llevar a cabo utilizando un medio de almacenamiento no transitorio tal como un medio de almacenamiento digital, por ejemplo un disco flexible, un Disco Duro (HDD), un DVD, un Blu–Ray, un CD, una memoria ROM, una memoria PROM, y una memoria EPROM, una memoria EEPROM o una memoria FLASH, que tienen señales de control de lectura electrónica almacenadas en ellos, que cooperan (o son capaces de cooperar) con un sistema informático programable de tal forma que se lleva a cabo el procedimiento respectivo. Por lo tanto, el medio de almacenamiento digital puede ser legible por ordenador.
[0589] Algunas realizaciones según la invención comprenden un soporte de datos que tiene señales de control de lectura electrónica, que son capaces de cooperar con un sistema de ordenador programable, de tal manera que se realice uno de los procedimientos descritos en esta invención.
[0590] En general, las realizaciones de la presente invención pueden ser implementadas en forma de producto de programa informático con un código de programa, donde el código de programa cumple la función de ejecutar uno de los métodos al ejecutarse el programa informático en un ordenador. El código de programa se puede por ejemplo almacenar en un portador legible por máquina.
[0591] Otras realizaciones comprenden el programa informático para ejecutar uno de los métodos descritos en el presente documento, almacenado en un portador legible por una máquina.
[0592] En otras palabras, una realización del método de la invención es, por lo tanto, un programa informático que tiene un código de programa para realizar uno de los métodos descriptos en el presente documento, cuando el programa informático se ejecuta en un ordenador.
[0593] Por lo tanto, otra realización del procedimiento de la invención es un soporte de datos (o un medio de almacenamiento digital, o un medio legible por ordenador) que comprende, grabado en el mismo, el programa informático para llevar a cabo uno de los procedimientos descritos en esta invención. El soporte de datos, el medio de almacenamiento digital o el medio grabado son generalmente tangibles y/o no transitorios.
[0594] Por lo tanto, una realización adicional de la invención es una corriente de datos o una secuencia de señales que representan el programa informático para llevar a cabo uno de los procedimientos descritos en esta invención. La corriente de datos o la secuencia de señales, por ejemplo, pueden estar configuradas para transferirse por medio de una conexión de comunicación de datos, por ejemplo, por medio de Internet.
[0595] Una realización adicional comprende un medio de procesamiento, por ejemplo, un ordenador, o un dispositivo lógico programable, configurado o adaptado para llevar a cabo uno de los métodos que se describen en el presente documento.
[0596] Otra realización comprende un ordenador que tiene instalado en él el programa informático para realizar uno de los métodos descritos en el presente documento.
[0597] Otra realización de acuerdo con la invención comprende un aparato o un sistema configurado para transferir (por ejemplo, electrónica u ópticamente) un programa informático para realizar uno de los métodos descritos en el presente documento a un receptor. El receptor puede ser, por ejemplo, un ordenador, un dispositivo móvil, un dispositivo de memoria o similar. El aparato o sistema puede, por ejemplo, comprender un servidor de archivos para transferir el programa informático al receptor.
[0598] En algunas realizaciones, se puede utilizar un dispositivo lógico programable (por ejemplo, una matriz de puertas programable en campo) para realizar algunas o todas las funcionalidades de los métodos descritos en el presente documento. En algunas realizaciones, una matriz de puertas programables en campo puede cooperar con un microprocesador para realizar uno de los métodos descritos en el presente documento. En general, los métodos se llevan a cabo, preferentemente, por cualquier aparato de hardware.
[0599] Las realizaciones anteriormente descritas son meramente ilustrativas de los principios de la presente invención. Se entiende que modificaciones y variaciones de las disposiciones y los detalles aquí descritos resultarán evidentes para los expertos en la técnica. Es la intención, por lo tanto, de que la invención esté limitada solamente por el alcance de las reivindicaciones inminentes de la patente y no por los detalles específicos presentados a modo de descripción y explicación de las realizaciones del presente documento.
[0600] Lista de Referencias
[0601] [1] Dietz, L. Liljeryd, K. Kjörling and O. Kunz, “Spectral Band Replication, a novel approach in audio coding,” in 112th AES Convention, Munich, mayo de 2002.
[0602] [2] Ferreira, D. Sinha, “Accurate Spectral Replacement”, Audio Engineering Society Convention, Barcelona, España 2005.
[0603] [3] D. Sinha, A. Ferreira1 and E. Harinarayanan, “A Novel Integrated Audio Bandwidth Extension Toolkit (ABET)”, Audio Engineering Society Convention, Paris, Francia 2006.
[0604] [4] R. Annadana, E. Harinarayanan, A. Ferreira and D. Sinha, “New Results in Low Bit Rate Speech Coding and Bandwidth Extension”, Audio Engineering Society Convention, San Francisco, EE.UU.2006.
[0605] [5] T. Żernicki, M. Bartkowiak, “Audio bandwidth extension by frequency scaling of sinusoidal partials”, Audio Engineering Society Convention, San Francisco, EE.UU.2008.
[0606] [6] J. Herre, D. Schulz, Extending the MPEG-4 AAC Codec by Perceptual Noise Substitution, 104th AES Convention, Amsterdam, 1998, Preprint 4720.
[0607] [7] M. Neuendorf, M. Multrus, N. Rettelbach, et al., MPEG Unified Speech and Audio Coding-The ISO/MPEG Standard for High-Efficiency Audio Coding of all Content Types, 132nd AES Convention, Budapest, Hungary, abril de 2012.
[0608] [8] McAulay, Robert J., Quatieri, Thomas F. “Speech Analysis/Synthesis Based on a Sinusoidal Representation”. IEEE Transactions on Acoustics, Speech, And Signal Processing, Vol 34(4), agosto de 1986.
[0609] [9] Smith, J.O., Serra, X. “PARSHL: An analysis/synthesis program for non-harmonic sounds based on a sinusoidal representation”, Proceedings of the International Computer Music Conference, 1987.
[0610] [10] Purnhagen, H.; Meine, Nikolaus, "HILN-the MPEG-4 parametric audio coding tools," Circuits and Systems, 2000. Proceedings. ISCAS 2000 Ginebra. The 2000 IEEE International Symposium on, vol.3, no., pp.201, 204 vol.3, 2000
[0611] [11] International Standard ISO/IEC 13818-3, Generic Coding of Moving Pictures and Associated Audio: Audio", Ginebra, 1998.
[0612] [12] M. Bosi, K. Brandenburg, S. Quackenbush, L. Fielder, K. Akagiri, H. Fuchs, M. Dietz, J. Herre, G. Davidson, Oikawa: "MPEG-2 Advanced Audio Coding", 101st AES Convention, Los Angeles 1996
[0613] [13] J. Herre, “Temporal Noise Shaping, Quantization and Coding methods in Perceptual Audio Coding: A Tutorial introduction”, 17th AES International Conference on High Quality Audio Coding, agosto de 1999
[0614] [14] J. Herre, “Temporal Noise Shaping, Quantization and Coding methods in Perceptual Audio Coding: A Tutorial introduction”, 17th AES International Conference on High Quality Audio Coding, agosto de 1999
[0615] [15] International Standard ISO/IEC 23001-3:2010, Unified speech and audio coding Audio, Ginebra, 2010.
[0616] [16] International Standard ISO/IEC 14496-3: 2005, Information technology - Coding of audio-visual objects - Part 3: Audio, Ginebra, 2005.
[0617] P. Ekstrand, “Bandwidth Extension of Audio Signals by Spectral Band Replication”, in Proceedings of 1st IEEE Benelux Workshop on MPCA, Leuven, noviembre de 2002
[0618] F. Nagel, S. Disch, S. Wilde, A continuous modulated single sideband bandwidth extension, ICASSP International Conference on Acoustics, Speech and Signal Processing, Dallas, Texas (EE.UU.), abril de 2010

Claims (12)

1. REIVINDICACIONES
1. Aparato para decodificar una señal de audio codificada, que comprende:
un decodificador de audio de dominio espectral (112) configurado para generar una primera representación decodificada (904) de un primer conjunto de primeras porciones espectrales a partir de una primera representación codificada (107) del primer conjunto de primeras porciones espectrales (103), teniendo la primera representación decodificada (904) una primera resolución espectral;
un decodificador paramétrico (114) configurado para generar una segunda representación decodificada de un segundo conjunto de segundas porciones espectrales, comprendiendo la segunda representación decodificada información de envolvente espectral (902) que tiene una segunda resolución espectral que es menor que la primera resolución espectral, en donde la primera resolución espectral se define por una codificación por líneas de líneas espectrales, y en el que la segunda resolución espectral se define por un único valor espectral por una banda de factor de escala, en el que una banda de factor de escala abarca varias líneas espectrales;
un regenerador de frecuencia (116, 906) configurado para regenerar una segunda porción espectral reconstruida (117) que tiene la primera resolución espectral usando una primera porción espectral fuente del primer conjunto de primeras porciones espectrales y la información de envolvente espectral (902) para una segunda porción espectral del segundo conjunto de segundas porciones espectrales,
en donde el aparato de decodificación se configura para realizar un ajuste de envolvente espectral (916) en una banda de reconstrucción (920) que comprende la segunda porción espectral reconstruida (117), en donde una o más porciones espectrales del primer conjunto de primeras porciones espectrales ubicadas en la banda de reconstrucción (920) no se pos-procesan adicionalmente por el ajustador de envolvente espectral (916), y donde solo los valores espectrales restantes en la banda de reconstrucción (920) que no se originan a partir del decodificador de audio de dominio espectral (112) se ajustan de envolvente usando la información de envolvente espectral (902); y
un convertidor de tiempo de espectro (118) para convertir la primera representación decodificada (904) y la segunda porción espectral reconstruida (117) en una representación de tiempo (119).
2. Aparato para codificar una señal de audio (99), que comprende:
un convertidor de tiempo de espectro (100) configurado para convertir la señal de audio (99) que tiene una frecuencia de muestreo en una representación espectral (101);
un analizador espectral (102) configurado para analizar la representación espectral (101) para determinar porciones tonales (302, 304, 305, 306, 307) que representa un primer conjunto de primeras porciones espectrales (103) a codificar con una primera resolución espectral y un segundo conjunto diferente de segundas porciones espectrales (105) a codificar con una segunda resolución espectral, siendo la segunda resolución espectral menor que la primera resolución espectral, en donde los componentes no tonales o ruidosos en la señal de audio (99) constituyen el segundo conjunto de segundas porciones espectrales (105), y en el que una primera porción espectral (306) del primer conjunto de primeras porciones espectrales (103) se coloca, con respecto a la frecuencia, entre dos segundas porciones espectrales (307a, 307b) del segundo conjunto de segundas porciones espectrales (105);
un codificador de audio de dominio espectral (106) configurado para generar una primera representación codificada (107) del primer conjunto de primeras porciones espectrales (103) que tienen la primera resolución espectral,
en donde el codificador de audio de dominio espectral (106) está configurado para calcular un factor de escala (SF1, SF2, SF3) para cada banda de factor de escala (SCB1, SCB2, SCB3) en un intervalo de núcleo por debajo de una frecuencia de inicio de relleno de espacios de frecuencia (309), y para calcular un factor de escala (SF4, SF5, SF6, SF7) para cada banda de factor de escala (SCB4, SCB5, SCB6, SCB7) por encima de la frecuencia de inicio de relleno de espacios de frecuencia (309) hasta una frecuencia máxima ((fIGFparada), siendo la frecuencia máxima menor o igual a la mitad de la frecuencia de muestreo (f<s/2>) de la señal de audio (99), y en el que el codificador de audio de dominio espectral (106) comprende un módulo psicoacústico (402) para cuantificar el primer conjunto de primeras porciones espectrales (103) en consideración de un umbral de enmascaramiento determinado en el módulo psicoacústico (402), los factores de escala (SF1, SF2, SF3, SF4, SF5, SF6, SF7) que representan el umbral de enmascaramiento,
en donde las porciones tonales codificadas (302, 304, 305, 306, 307) que representan el primer conjunto de
primeras porciones espectrales (103) junto con los factores de escala (SF1, SF2, SF3, SF4, SF5, SF6, SF7) para cada banda de factor de escala corresponden a la primera representación codificada (107) que tiene la primera resolución espectral; y
un codificador paramétrico (104) configurado para calcular información de envolvente espectral para el segundo conjunto de segundas porciones espectrales (105), teniendo la información de envolvente espectral la segunda resolución espectral,
en donde el codificador paramétrico (104) se configura para calcular, como la información de envolvente espectral, un valor de información de energía (E<1>, E<2>, E<3>, E<4>) para cada banda de factor de escala (SCB4, SCB5, SCB6, SCB7) por encima de la frecuencia de inicio de relleno de espacios de frecuencia (309) hasta la frecuencia máxima ((fIGFparada) e indicando una energía de las porciones espectrales primera y segunda en la banda de factor de escala (SCB4, SCB5, SCB6, SCB7).
3. Aparato de acuerdo con la reivindicación 2, en donde el codificador paramétrico (104) está configurado para calcular similitudes entre intervalos de fuente que tienen primeras porciones espectrales del primer conjunto de primeras porciones espectrales (103) e intervalos objetivo que tienen segundas porciones espectrales del segundo conjunto de segundas porciones espectrales (105) y para determinar, basándose en similitudes calculadas, para una segunda porción espectral del segundo conjunto de segundas porciones espectrales (105), una primera porción espectral del primer conjunto de primeras porciones espectrales (103) que coincide con la segunda porción espectral y para proporcionar la información de coincidencia en la primera porción espectral que coincide con la segunda porción espectral en una representación codificada.
4. Aparato de una de las reivindicaciones 2 o 3,
en donde el codificador de audio de dominio espectral (106) está configurado para procesar una secuencia de tramas de valores espectrales para cuantificación y codificación por entropía, en donde, en una trama, los valores espectrales del segundo conjunto de segundas porciones espectrales (105) se establecen a cero o en donde, en una trama de la secuencia de tramas, los valores espectrales del primer conjunto de primeras porciones espectrales (103) y el segundo conjunto de segundas porciones espectrales (105) están presentes y en donde, durante el procesamiento o después del procesamiento, los valores espectrales en el segundo conjunto de segundas porciones espectrales (105) se establecen a cero (410, 418, 422).
5. Aparato de una de las reivindicaciones 2 a 4,
en donde el codificador de audio de dominio espectral (106) está configurado para proporcionar la primera representación codificada (107) de modo que, para una trama de la señal de audio (99) que se muestrea, la primera representación codificada (107) comprende el primer conjunto de primeras porciones espectrales (103) y el segundo conjunto de segundas porciones espectrales (105), en el que los valores espectrales en el segundo conjunto de segundas porciones espectrales (105) se codifican como valores cero o como valores de ruido.
6. Aparato de una de las reivindicaciones 2 a 5,
en donde el analizador espectral (102) está configurado para analizar la representación espectral (101) comenzando con la frecuencia de inicio de llenado de espacios de frecuencia (309), y terminando con una frecuencia máxima (<fmáx>) representada por una frecuencia máxima incluida en la representación espectral (101), y
en donde una porción espectral que se extiende desde una frecuencia mínima hasta la frecuencia de inicio de llenado de espacio de frecuencia (309) pertenece al primer conjunto de primeras porciones espectrales (103) a codificar por el codificador de audio de dominio espectral (106).
7. Aparato de una de las reivindicaciones 2 a 6,
en donde el analizador espectral (102) está configurado para separar porciones espectrales que tienen componentes tonales de porciones espectrales que tienen los componentes no tonales en la representación espectral (101),
en donde el analizador espectral (102) se configura para analizar adicionalmente las porciones espectrales que tienen los componentes no tonales a reconstruir usando una porción espectral del primer conjunto de porciones espectrales, en donde el analizador espectral (102) se configura para determinar porciones espectrales de tipo ruido correspondientes a los componentes ruidosos en los componentes no tonales a reconstruir mediante llenado con ruido,
en donde el primer conjunto de primeras porciones espectrales (103) comprende los componentes tonales, en donde el segundo conjunto de segundas porciones espectrales (105) comprende las porciones espectrales que tienen los componentes no tonales, y en donde un tercer conjunto de terceras porciones espectrales comprende las porciones espectrales de tipo ruido que van a reconstruirse mediante llenado con ruido, en donde el codificador paramétrico (104) está configurado para introducir una información de energía para las porciones espectrales de tipo ruido en la segunda representación codificada (109).
8. Aparato de una de las reivindicaciones 2 a 7,
en donde el analizador espectral (102) se configura para analizar la representación espectral (101) en un intervalo de frecuencias que comienza a partir de la frecuencia de inicio de relleno de espacios de frecuencia (309) y se extiende a frecuencias superiores a la frecuencia de inicio de relleno de espacios de frecuencia (309), y
en donde el codificador de audio de dominio espectral (106) está configurado para codificar al menos una tercera porción espectral en la representación espectral (101) que tiene frecuencias por debajo de la frecuencia de inicio de relleno de espacios de frecuencia (309) con una resolución espectral inferior a la primera resolución espectral estableciendo valores espectrales en la tercera porción espectral a cero y calculando y codificando la información de envolvente espectral (308) que indica una energía en la tercera porción espectral.
9. Aparato de la reivindicación 2,
en donde codificador paramétrico (104) se configura para calcular los valores de información de energía (E<1>, E<2>, E<3>, E<4>) para las bandas de factor de escala como valores de medios de energía para cada banda de factor de escala de MDCT por encima de la frecuencia de inicio de relleno de espacios de frecuencia (309) hasta una frecuencia de parada de relleno de espacios de frecuencia y una cuantificación de los valores medios de energía .
10. Método para decodificar una señal de audio codificada, que comprende:
generar (112) una primera representación decodificada (904) de un primer conjunto de primeras porciones espectrales a partir de una primera representación codificada (107) del primer conjunto de primeras porciones espectrales (103), teniendo la primera representación decodificada (904) una primera resolución espectral; generar (114) una segunda representación decodificada de un segundo conjunto de segundas porciones espectrales, comprendiendo la segunda representación decodificada información de envolvente espectral (902) que tiene una segunda resolución espectral que es menor que la primera resolución espectral, en donde la primera resolución espectral se define por una codificación por líneas de líneas espectrales, y en el que la segunda resolución espectral se define por un único valor espectral por una banda de factor de escala, en el que una banda de factor de escala abarca varias líneas espectrales;
regenerar (116) una segunda porción espectral reconstruida (117) que tiene la primera resolución espectral usando una primera porción espectral del primer conjunto de primeras porciones espectrales y la información de envolvente espectral (902) para una segunda porción espectral del segundo conjunto de segundas porciones espectrales,
en donde el método de decodificación comprende realizar un ajuste de envolvente espectral (916) en una banda de reconstrucción (920) que comprende la segunda parte espectral reconstruida (117), en el que una o más porciones espectrales del primer conjunto de primeras porciones espectrales ubicadas en la banda de reconstrucción (920) no se pos-procesan adicionalmente por el ajustador de envolvente espectral (916), y donde solo los valores espectrales restantes en la banda de reconstrucción (920) que no se originan a partir de la generación (112) de una primera representación decodificada (904) se ajustan mediante la información de la envolvente espectral (902); y
Convertir (118) la primera representación decodificada (904) y la segunda porción espectral reconstruida (117) en una representación de tiempo (119).
11. Método para codificar una señal de audio (99), que comprende:
convertir (100) la señal de audio (99) que tiene una frecuencia de muestreo en una representación espectral (101);
analizar (102) la representación espectral (101) para determinar porciones tonales (302, 304, 305, 306, 307) que representa un primer conjunto de primeras porciones espectrales (103) a codificar con una primera resolución espectral y un segundo conjunto diferente de segundas porciones espectrales (105) a codificar con una segunda resolución espectral, siendo la segunda resolución espectral menor que la primera resolución espectral, en donde los componentes no tonales o ruidosos en la señal de audio (99) constituyen el segundo conjunto de segundas porciones espectrales (105),y en donde una banda de factor de escala abarca varias líneas espectrales, y en donde una primera porción espectral (306, 921), del primer conjunto de primeras porciones espectrales (103) se coloca, con respecto a la frecuencia, entre dos segundas porciones espectrales (307a, 307b, 922, 923) del segundo conjunto de segundas porciones espectrales (105); generar (106) una primera representación codificada (107) del primer conjunto de primeras porciones espectrales (103) que tienen la primera resolución espectral,
en donde la generación (106) comprende calcular un factor de escala (SF1, SF2, SF3) para cada banda de factor de escala (SCB1, SCB2, SCB3) en un intervalo de núcleo por debajo de una frecuencia de inicio de relleno de espacios de frecuencia (309), y para calcular un factor de escala (SF4, SF5, SF6, SF7) para cada banda de factor de escala (SCB4, SCB5, SCB6, SCB7) por encima de la frecuencia de inicio de relleno de espacios de frecuencia (309) hasta una frecuencia máxima ((fIGFparada), siendo la frecuencia máxima menor o igual a la mitad de la frecuencia de muestreo (f<s/2>) de la señal de audio (99), y en donde la generación (106) comprende el uso de un módulo psicoacústico (402) para cuantificar el primer conjunto de primeras porciones espectrales (103) en consideración de un umbral de enmascaramiento determinado en el módulo psicoacústico (402), los factores de escala (SF1, SF2, SF3, SF4, SF5, SF6, SF7) que representan el umbral de enmascaramiento,
en donde las porciones tonales codificadas (302, 304, 305, 306, 307) que representan el primer conjunto de primeras porciones espectrales (103) junto con los factores de escala (SF1, SF2, SF3, SF4, SF5, SF6, SF7) para cada banda de factor de escala corresponden a la primera representación codificada (107) que tiene la primera resolución espectral; y
calcular (104) información de envolvente espectral para el segundo conjunto de segundas porciones espectrales (105), teniendo la información de envolvente espectral la segunda resolución espectral, en donde el cálculo (104) comprende calcular, como información de envolvente espectral, un valor de información de energía (E<1>, E<2>, E<3>, E<4>) para cada banda de factor de escala (SCB4, SCB5, SCB6, SCB7) por encima de la frecuencia de inicio de relleno de espacios de frecuencia (309) hasta la frecuencia máxima (fIGFparada) e indicando una energía de las porciones espectrales primera y segunda en la banda de factor de escala (SCB4, SCB5, SCB6, SCB7).
12. Programa informático que comprende instrucciones que, cuando el programa se ejecuta en un ordenador o un procesador hace que el ordenador o el procesador, lleven a cabo el procedimiento de la reivindicación 10 o el procedimiento de la reivindicación 11.
ES21207282T 2013-07-22 2014-07-15 Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain Active ES3053797T3 (en)

Applications Claiming Priority (5)

Application Number Priority Date Filing Date Title
EP13177346 2013-07-22
EP13177353 2013-07-22
EP13177350 2013-07-22
EP13177348 2013-07-22
EP13189362.0A EP2830056A1 (en) 2013-07-22 2013-10-18 Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain

Publications (1)

Publication Number Publication Date
ES3053797T3 true ES3053797T3 (en) 2026-01-26

Family

ID=49385156

Family Applications (10)

Application Number Title Priority Date Filing Date
ES14738853T Active ES2908624T3 (es) 2013-07-22 2014-07-15 Aparato y procedimiento para codificar y decodificar una señal de audio con relleno inteligente de espacios en el dominio espectral
ES14738857.3T Active ES2599007T3 (es) 2013-07-22 2014-07-15 Aparato y método para codificar y decodificar una señal de audio codificada utilizando modelado de ruido/parche temporal
ES14739160T Active ES2698023T3 (es) 2013-07-22 2014-07-15 Decodificador de audio y método relacionado que usan procesamiento de dos canales dentro de un marco de relleno inteligente de huecos
ES14739161.9T Active ES2667221T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar y codificar una señal de audio utilizando selección de mosaicos espectrales adaptativos
ES14738854T Active ES2728329T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar o codificar una señal de audio utilizando valores de información para una banda de reconstrucción
ES18180168T Active ES2827774T3 (es) 2013-07-22 2014-07-15 Codificador de audio y método relacionado usando procesamiento de dos canales dentro de un marco de referencia de relleno inteligente de espacios
ES14741264.7T Active ES2638498T3 (es) 2013-07-22 2014-07-15 Aparato y procedimiento para decodificar una señal de audio codificada mediante un filtro de cruce en torno a una frecuencia de transición
ES14739811T Active ES2813940T3 (es) 2013-07-22 2014-07-15 Aparato, método y programa informático para decodificar una señal de audio codificada
ES21207282T Active ES3053797T3 (en) 2013-07-22 2014-07-15 Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain
ES19157850T Active ES2959641T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar o codificar una señal de audio utilizando valores de información para una banda de reconstrucción

Family Applications Before (8)

Application Number Title Priority Date Filing Date
ES14738853T Active ES2908624T3 (es) 2013-07-22 2014-07-15 Aparato y procedimiento para codificar y decodificar una señal de audio con relleno inteligente de espacios en el dominio espectral
ES14738857.3T Active ES2599007T3 (es) 2013-07-22 2014-07-15 Aparato y método para codificar y decodificar una señal de audio codificada utilizando modelado de ruido/parche temporal
ES14739160T Active ES2698023T3 (es) 2013-07-22 2014-07-15 Decodificador de audio y método relacionado que usan procesamiento de dos canales dentro de un marco de relleno inteligente de huecos
ES14739161.9T Active ES2667221T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar y codificar una señal de audio utilizando selección de mosaicos espectrales adaptativos
ES14738854T Active ES2728329T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar o codificar una señal de audio utilizando valores de información para una banda de reconstrucción
ES18180168T Active ES2827774T3 (es) 2013-07-22 2014-07-15 Codificador de audio y método relacionado usando procesamiento de dos canales dentro de un marco de referencia de relleno inteligente de espacios
ES14741264.7T Active ES2638498T3 (es) 2013-07-22 2014-07-15 Aparato y procedimiento para decodificar una señal de audio codificada mediante un filtro de cruce en torno a una frecuencia de transición
ES14739811T Active ES2813940T3 (es) 2013-07-22 2014-07-15 Aparato, método y programa informático para decodificar una señal de audio codificada

Family Applications After (1)

Application Number Title Priority Date Filing Date
ES19157850T Active ES2959641T3 (es) 2013-07-22 2014-07-15 Aparato y método para decodificar o codificar una señal de audio utilizando valores de información para una banda de reconstrucción

Country Status (19)

Country Link
US (24) US10332539B2 (es)
EP (20) EP2830054A1 (es)
JP (12) JP6310074B2 (es)
KR (7) KR101774795B1 (es)
CN (12) CN111554310B (es)
AU (7) AU2014295296B2 (es)
BR (12) BR122022011231B1 (es)
CA (8) CA2886505C (es)
ES (10) ES2908624T3 (es)
MX (7) MX356161B (es)
MY (6) MY180759A (es)
PL (9) PL3407350T3 (es)
PT (7) PT3017448T (es)
RU (7) RU2649940C2 (es)
SG (7) SG11201600401RA (es)
TR (1) TR201816157T4 (es)
TW (7) TWI545561B (es)
WO (7) WO2015010949A1 (es)
ZA (5) ZA201502262B (es)

Families Citing this family (116)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH0726265Y2 (ja) 1986-06-20 1995-06-14 三菱自動車工業株式会社 スイングア−ム式パ−ツ搬送装置
CN104221082B (zh) 2012-03-29 2017-03-08 瑞典爱立信有限公司 谐波音频信号的带宽扩展
TWI546799B (zh) 2013-04-05 2016-08-21 杜比國際公司 音頻編碼器及解碼器
EP2830054A1 (en) 2013-07-22 2015-01-28 Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder and related methods using two-channel processing within an intelligent gap filling framework
EP2830051A3 (en) 2013-07-22 2015-03-04 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder, methods and computer program using jointly encoded residual signals
RU2639952C2 (ru) 2013-08-28 2017-12-25 Долби Лабораторис Лайсэнзин Корпорейшн Гибридное усиление речи с кодированием формы сигнала и параметрическим кодированием
FR3011408A1 (fr) * 2013-09-30 2015-04-03 Orange Re-echantillonnage d'un signal audio pour un codage/decodage a bas retard
EP3117432B1 (en) 2014-03-14 2019-05-08 Telefonaktiebolaget LM Ericsson (publ) Audio coding method and apparatus
EP2980794A1 (en) * 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder and decoder using a frequency domain processor and a time domain processor
EP2980795A1 (en) 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoding and decoding using a frequency domain processor, a time domain processor and a cross processor for initialization of the time domain processor
CN107004417B (zh) 2014-12-09 2021-05-07 杜比国际公司 Mdct域错误掩盖
WO2016142002A1 (en) 2015-03-09 2016-09-15 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio encoder, audio decoder, method for encoding an audio signal and method for decoding an encoded audio signal
TWI879690B (zh) 2015-03-13 2025-04-01 瑞典商杜比國際公司 音訊處理單元、用於將經編碼的音訊位元流解碼之方法以及非暫態電腦可讀媒體
GB201504403D0 (en) 2015-03-16 2015-04-29 Microsoft Technology Licensing Llc Adapting encoded bandwidth
EP3107096A1 (en) * 2015-06-16 2016-12-21 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Downscaled decoding
US10847170B2 (en) * 2015-06-18 2020-11-24 Qualcomm Incorporated Device and method for generating a high-band signal from non-linearly processed sub-ranges
EP3171362B1 (en) * 2015-11-19 2019-08-28 Harman Becker Automotive Systems GmbH Bass enhancement and separation of an audio signal into a harmonic and transient signal component
EP3182411A1 (en) * 2015-12-14 2017-06-21 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for processing an encoded audio signal
RU2704733C1 (ru) 2016-01-22 2019-10-30 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Устройство и способ кодирования или декодирования многоканального сигнала с использованием параметра широкополосного выравнивания и множества параметров узкополосного выравнивания
KR102230668B1 (ko) * 2016-01-22 2021-03-22 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 미드/사이드 결정이 개선된 전역 ild를 갖는 mdct m/s 스테레오의 장치 및 방법
EP3208800A1 (en) 2016-02-17 2017-08-23 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for stereo filing in multichannel coding
DE102016104665A1 (de) 2016-03-14 2017-09-14 Ask Industries Gmbh Verfahren und Vorrichtung zur Aufbereitung eines verlustbehaftet komprimierten Audiosignals
CA3018039C (en) * 2016-03-24 2023-08-29 Harman International Industries, Incorporated Signal quality-based enhancement and compensation of compressed audio signals
US10141005B2 (en) 2016-06-10 2018-11-27 Apple Inc. Noise detection and removal systems, and related methods
JP6976277B2 (ja) 2016-06-22 2021-12-08 ドルビー・インターナショナル・アーベー 第一の周波数領域から第二の周波数領域にデジタル・オーディオ信号を変換するためのオーディオ・デコーダおよび方法
US10249307B2 (en) 2016-06-27 2019-04-02 Qualcomm Incorporated Audio decoding using intermediate sampling rate
US10812550B1 (en) * 2016-08-03 2020-10-20 Amazon Technologies, Inc. Bitrate allocation for a multichannel media stream
EP3288031A1 (en) * 2016-08-23 2018-02-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding an audio signal using a compensation value
US9679578B1 (en) 2016-08-31 2017-06-13 Sorenson Ip Holdings, Llc Signal clipping compensation
EP3306609A1 (en) 2016-10-04 2018-04-11 Fraunhofer Gesellschaft zur Förderung der Angewand Apparatus and method for determining a pitch information
US10362423B2 (en) 2016-10-13 2019-07-23 Qualcomm Incorporated Parametric audio decoding
EP3324406A1 (en) 2016-11-17 2018-05-23 Fraunhofer Gesellschaft zur Förderung der Angewand Apparatus and method for decomposing an audio signal using a variable threshold
JP6769299B2 (ja) * 2016-12-27 2020-10-14 富士通株式会社 オーディオ符号化装置およびオーディオ符号化方法
US10090892B1 (en) * 2017-03-20 2018-10-02 Intel Corporation Apparatus and a method for data detecting using a low bit analog-to-digital converter
US10304468B2 (en) 2017-03-20 2019-05-28 Qualcomm Incorporated Target sample generation
US10354668B2 (en) 2017-03-22 2019-07-16 Immersion Networks, Inc. System and method for processing audio data
EP3382703A1 (en) 2017-03-31 2018-10-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and methods for processing an audio signal
EP3382701A1 (en) * 2017-03-31 2018-10-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for post-processing an audio signal using prediction based shaping
EP3382700A1 (en) 2017-03-31 2018-10-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for post-processing an audio signal using a transient location detection
WO2018211050A1 (en) 2017-05-18 2018-11-22 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Managing network device
US11550665B2 (en) * 2017-06-02 2023-01-10 Apple Inc. Techniques for preserving clone relationships between files
EP3642839B1 (en) * 2017-06-19 2022-04-13 Rtx A/S Audio signal encoding and decoding
CN110998722B (zh) 2017-07-03 2023-11-10 杜比国际公司 低复杂性密集瞬态事件检测和译码
JP6904209B2 (ja) * 2017-07-28 2021-07-14 富士通株式会社 オーディオ符号化装置、オーディオ符号化方法およびオーディオ符号化プログラム
JP7214726B2 (ja) * 2017-10-27 2023-01-30 フラウンホッファー-ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ ニューラルネットワークプロセッサを用いた帯域幅が拡張されたオーディオ信号を生成するための装置、方法またはコンピュータプログラム
EP3483886A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Selecting pitch lag
EP3483880A1 (en) * 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Temporal noise shaping
EP3483878A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio decoder supporting a set of different loss concealment tools
WO2019091576A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoders, audio decoders, methods and computer programs adapting an encoding and decoding of least significant bits
WO2019091573A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding and decoding an audio signal using downsampling or interpolation of scale parameters
EP3483883A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio coding and decoding with selective postfiltering
EP3483884A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Signal filtering
EP3483882A1 (en) * 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Controlling bandwidth in encoders and/or decoders
EP3483879A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Analysis/synthesis windowing function for modulated lapped transformation
US11771779B2 (en) * 2018-01-26 2023-10-03 Hadasit Medical Research Services & Development Limited Non-metallic magnetic resonance contrast agent
TWI869186B (zh) * 2018-01-26 2025-01-01 瑞典商都比國際公司 用於執行一音訊信號之高頻重建之方法、音訊處理單元及非暫時性電腦可讀媒體
JPWO2019155603A1 (ja) * 2018-02-09 2020-06-11 三菱電機株式会社 音響信号処理装置及び音響信号処理方法
US10950251B2 (en) * 2018-03-05 2021-03-16 Dts, Inc. Coding of harmonic signals in transform-based audio codecs
IL313348B2 (en) * 2018-04-25 2025-08-01 Dolby Int Ab Integration of high frequency reconstruction techniques with reduced post-processing delay
IL313391B2 (en) 2018-04-25 2025-05-01 Dolby Int Ab Integrating high-frequency audio restoration techniques
EP3576088A1 (en) * 2018-05-30 2019-12-04 Fraunhofer Gesellschaft zur Förderung der Angewand Audio similarity evaluator, audio encoder, methods and computer program
ES3059239T3 (en) 2018-07-04 2026-03-19 Fraunhofer Ges Forschung Multisignal encoder, multisignal decoder, and related methods using signal whitening or signal post processing
CN109088617B (zh) * 2018-09-20 2021-06-04 电子科技大学 比率可变数字重采样滤波器
US10957331B2 (en) 2018-12-17 2021-03-23 Microsoft Technology Licensing, Llc Phase reconstruction in a speech decoder
US10847172B2 (en) * 2018-12-17 2020-11-24 Microsoft Technology Licensing, Llc Phase quantization in a speech encoder
EP3671741A1 (en) * 2018-12-21 2020-06-24 FRAUNHOFER-GESELLSCHAFT zur Förderung der angewandten Forschung e.V. Audio processor and method for generating a frequency-enhanced audio signal using pulse processing
BR112021012753A2 (pt) * 2019-01-13 2021-09-08 Huawei Technologies Co., Ltd. Método implementado por computador para codificação de áudio, dispositivo eletrônico e meio legível por computador não transitório
JP7262593B2 (ja) * 2019-01-13 2023-04-21 華為技術有限公司 ハイレゾリューションオーディオ符号化
EP3928315A4 (en) * 2019-03-14 2022-11-30 Boomcloud 360, Inc. SPATIALLY AWARENESS MULTI-BAND COMPRESSION SYSTEM WITH PRIORITY
WO2020207593A1 (en) 2019-04-11 2020-10-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio decoder, apparatus for determining a set of values defining characteristics of a filter, methods for providing a decoded audio representation, methods for determining a set of values defining characteristics of a filter and computer program
CN110265043B (zh) * 2019-06-03 2021-06-01 同响科技股份有限公司 自适应有损或无损的音频压缩和解压缩演算方法
WO2020253941A1 (en) * 2019-06-17 2020-12-24 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder with a signal-dependent number and precision control, audio decoder, and related methods and computer programs
IL289450B2 (en) 2019-07-30 2026-01-01 Dolby Laboratories Licensing Corp Acoustic echo cancellation control for distributed audio devices
US11527252B2 (en) 2019-08-30 2022-12-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. MDCT M/S stereo
MX2022005146A (es) 2019-10-30 2022-05-30 Dolby Laboratories Licensing Corp Distribucion de tasa de bits en servicios inmersivos de voz y audio.
TWI702780B (zh) * 2019-12-03 2020-08-21 財團法人工業技術研究院 提升共模瞬變抗擾度的隔離器及訊號產生方法
CN111862953B (zh) * 2019-12-05 2023-08-22 北京嘀嘀无限科技发展有限公司 语音识别模型的训练方法、语音识别方法及装置
US11158297B2 (en) * 2020-01-13 2021-10-26 International Business Machines Corporation Timbre creation system
CN113192517B (zh) * 2020-01-13 2024-04-26 华为技术有限公司 一种音频编解码方法和音频编解码设备
US20230085013A1 (en) * 2020-01-28 2023-03-16 Hewlett-Packard Development Company, L.P. Multi-channel decomposition and harmonic synthesis
CN111199743B (zh) * 2020-02-28 2023-08-18 Oppo广东移动通信有限公司 音频编码格式确定方法、装置、存储介质及电子设备
CN111429925B (zh) * 2020-04-10 2023-04-07 北京百瑞互联技术有限公司 一种降低音频编码速率的方法及系统
CN113593586B (zh) * 2020-04-15 2025-01-10 华为技术有限公司 音频信号编码方法、解码方法、编码设备以及解码设备
CN113539281B (zh) * 2020-04-21 2024-09-06 华为技术有限公司 音频信号编码方法和装置
CN111371459B (zh) * 2020-04-26 2023-04-18 宁夏隆基宁光仪表股份有限公司 一种适用于智能电表的多操作高频替换式数据压缩方法
CN113782040B (zh) * 2020-05-22 2024-07-30 华为技术有限公司 基于心理声学的音频编码方法及装置
CN113808596B (zh) 2020-05-30 2025-01-03 华为技术有限公司 一种音频编码方法和音频编码装置
CN113808597B (zh) * 2020-05-30 2024-10-29 华为技术有限公司 一种音频编码方法和音频编码装置
DK4165629T3 (da) * 2020-06-11 2025-06-02 Dolby Laboratories Licensing Corp Fremgangsmåder og indretninger til kodning og afkodning af rumlig baggrundsstøj i et multikanalsindgangssignal
CN114945981B (zh) * 2020-06-24 2025-08-08 华为技术有限公司 一种音频信号处理方法和装置
WO2022046155A1 (en) * 2020-08-28 2022-03-03 Google Llc Maintaining invariance of sensory dissonance and sound localization cues in audio codecs
WO2022065981A1 (ko) * 2020-09-28 2022-03-31 삼성전자 주식회사 동영상 처리 장치 및 방법
EP4465294A3 (en) 2020-10-13 2024-12-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding a plurality of audio objects or apparatus and method for decoding using two or more relevant audio objects
CN116648931A (zh) * 2020-10-13 2023-08-25 弗劳恩霍夫应用研究促进协会 在下混期间使用方向信息对多个音频对象进行编码的装置和方法或使用优化的协方差合成进行解码的装置和方法
EP4730326A3 (en) 2020-12-02 2026-04-29 Dolby Laboratories Licensing Corporation Spatial noise filling in multi-channel codec
EP4264962A4 (en) * 2020-12-16 2024-11-13 LISN Technologies Inc. PSYCHOACOUSTIC SOUND LOCALIZATION SYSTEM FOR STEREO HEADPHONES AND METHOD FOR RECONSTRUCTING STEREO PSYCHOACOUSTIC SOUND SIGNALS USING SAME
CN113113033B (zh) * 2021-04-29 2025-03-07 腾讯音乐娱乐科技(深圳)有限公司 一种音频处理方法、设备及可读存储介质
CN113365189B (zh) * 2021-06-04 2022-08-05 上海傅硅电子科技有限公司 多声道无缝切换方法
CN115472171B (zh) * 2021-06-11 2024-11-22 华为技术有限公司 编解码方法、装置、设备、存储介质及计算机程序
CN117751405A (zh) * 2021-06-24 2024-03-22 弗劳恩霍夫应用研究促进协会 用于去除不期望的听觉粗糙度的装置和方法
EP4120253A1 (en) * 2021-07-14 2023-01-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Integral band-wise parametric coder
US11838732B2 (en) 2021-07-15 2023-12-05 Boomcloud 360 Inc. Adaptive filterbanks using scale-dependent nonlinearity for psychoacoustic frequency range extension
CN113593604B (zh) * 2021-07-22 2024-07-19 腾讯音乐娱乐科技(深圳)有限公司 检测音频质量方法、装置及存储介质
CN115691521B (zh) * 2021-07-29 2026-03-13 华为技术有限公司 一种音频信号的编解码方法和装置
CN115691514B (zh) * 2021-07-29 2026-01-02 华为技术有限公司 一种多声道信号的编解码方法和装置
TWI794002B (zh) * 2022-01-28 2023-02-21 緯創資通股份有限公司 多媒體系統以及多媒體操作方法
US20250191596A1 (en) * 2022-02-08 2025-06-12 Panasonic Intellectual Property Corporation Of America Encoding device and encoding method
FR3133265A1 (fr) * 2022-03-02 2023-09-08 Orange Codage et décodage optimisé d’un signal audio utilisant un auto-encodeur à base de réseau de neurones
CN114582361B (zh) * 2022-04-29 2022-07-08 北京百瑞互联技术有限公司 基于生成对抗网络的高解析度音频编解码方法及系统
CN119137662A (zh) * 2022-05-17 2024-12-13 谷歌有限责任公司 用于在编码和解码时间加窗以用于音频压缩的非对称且自适应强度
EP4303872A1 (de) * 2022-07-07 2024-01-10 Technische Universität München Kodierungsvorrichtung und kodierungsverfahren zur mehrkanalkodierung von vibrotaktilen signalen sowie dekodierung und dekodierungsverfahren
WO2024085551A1 (ko) * 2022-10-16 2024-04-25 삼성전자주식회사 패킷 손실 은닉을 위한 전자 장치 및 방법
EP4710466A2 (en) * 2023-05-08 2026-03-18 APS Technology 1 LLC Parallel data encoding and decoding
US20240379090A1 (en) * 2023-05-12 2024-11-14 Gaudio Lab, Inc. Audio signal processing method and apparatus
CN116612782B (zh) * 2023-05-26 2025-09-26 平安科技(深圳)有限公司 基于自注意力的音频美化方法、装置、设备及存储介质
CN121188579B (zh) * 2025-11-24 2026-04-03 内蒙古电力(集团)有限责任公司鄂尔多斯供电分公司 无源光纤多参量数字孪生驱动异常根因定位方法及系统

Family Cites Families (266)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS62234435A (ja) * 1986-04-04 1987-10-14 Kokusai Denshin Denwa Co Ltd <Kdd> 符号化音声の復号化方式
US6289308B1 (en) 1990-06-01 2001-09-11 U.S. Philips Corporation Encoded wideband digital transmission signal and record carrier recorded with such a signal
JP3465697B2 (ja) * 1993-05-31 2003-11-10 ソニー株式会社 信号記録媒体
ES2165389T3 (es) 1993-05-31 2002-03-16 Sony Corp Aparato y metodo para codificar o descodificar señales, y medio de grabacion.
TW272341B (es) * 1993-07-16 1996-03-11 Sony Co Ltd
GB2281680B (en) * 1993-08-27 1998-08-26 Motorola Inc A voice activity detector for an echo suppressor and an echo suppressor
BE1007617A3 (nl) * 1993-10-11 1995-08-22 Philips Electronics Nv Transmissiesysteem met gebruik van verschillende codeerprincipes.
US5502713A (en) * 1993-12-07 1996-03-26 Telefonaktiebolaget Lm Ericsson Soft error concealment in a TDMA radio system
JPH07336231A (ja) * 1994-06-13 1995-12-22 Sony Corp 信号符号化方法及び装置、信号復号化方法及び装置、並びに記録媒体
EP0732687B2 (en) * 1995-03-13 2005-10-12 Matsushita Electric Industrial Co., Ltd. Apparatus for expanding speech bandwidth
AU5663296A (en) 1995-04-10 1996-10-30 Corporate Computer Systems, Inc. System for compression and decompression of audio signals fo r digital transmission
JP3747492B2 (ja) 1995-06-20 2006-02-22 ソニー株式会社 音声信号の再生方法及び再生装置
JP3246715B2 (ja) * 1996-07-01 2002-01-15 松下電器産業株式会社 オーディオ信号圧縮方法,およびオーディオ信号圧縮装置
JPH10124088A (ja) * 1996-10-24 1998-05-15 Sony Corp 音声帯域幅拡張装置及び方法
SE512719C2 (sv) * 1997-06-10 2000-05-02 Lars Gustaf Liljeryd En metod och anordning för reduktion av dataflöde baserad på harmonisk bandbreddsexpansion
DE19730130C2 (de) * 1997-07-14 2002-02-28 Fraunhofer Ges Forschung Verfahren zum Codieren eines Audiosignals
US6253172B1 (en) * 1997-10-16 2001-06-26 Texas Instruments Incorporated Spectral transformation of acoustic signals
US5913191A (en) 1997-10-17 1999-06-15 Dolby Laboratories Licensing Corporation Frame-based audio coding with additional filterbank to suppress aliasing artifacts at frame boundaries
DE19747132C2 (de) * 1997-10-24 2002-11-28 Fraunhofer Ges Forschung Verfahren und Vorrichtungen zum Codieren von Audiosignalen sowie Verfahren und Vorrichtungen zum Decodieren eines Bitstroms
US6029126A (en) * 1998-06-30 2000-02-22 Microsoft Corporation Scalable audio coder and decoder
US6253165B1 (en) * 1998-06-30 2001-06-26 Microsoft Corporation System and method for modeling probability distribution functions of transform coefficients of encoded signal
US6453289B1 (en) 1998-07-24 2002-09-17 Hughes Electronics Corporation Method of noise reduction for speech codecs
US6061555A (en) 1998-10-21 2000-05-09 Parkervision, Inc. Method and system for ensuring reception of a communications signal
US6400310B1 (en) * 1998-10-22 2002-06-04 Washington University Method and apparatus for a tunable high-resolution spectral estimator
SE9903553D0 (sv) 1999-01-27 1999-10-01 Lars Liljeryd Enhancing percepptual performance of SBR and related coding methods by adaptive noise addition (ANA) and noise substitution limiting (NSL)
JP3762579B2 (ja) 1999-08-05 2006-04-05 株式会社リコー デジタル音響信号符号化装置、デジタル音響信号符号化方法及びデジタル音響信号符号化プログラムを記録した媒体
US6978236B1 (en) 1999-10-01 2005-12-20 Coding Technologies Ab Efficient spectral envelope coding using variable time/frequency resolution and time/frequency switching
EP1147514B1 (en) * 1999-11-16 2005-04-06 Koninklijke Philips Electronics N.V. Wideband audio transmission system
US7742927B2 (en) 2000-04-18 2010-06-22 France Telecom Spectral enhancing method and device
SE0001926D0 (sv) 2000-05-23 2000-05-23 Lars Liljeryd Improved spectral translation/folding in the subband domain
AU2001284910B2 (en) * 2000-08-16 2007-03-22 Dolby Laboratories Licensing Corporation Modulating one or more parameters of an audio or video perceptual coding system in response to supplemental information
US7003467B1 (en) 2000-10-06 2006-02-21 Digital Theater Systems, Inc. Method of decoding two-channel matrix encoded audio to reconstruct multichannel audio
SE0004163D0 (sv) 2000-11-14 2000-11-14 Coding Technologies Sweden Ab Enhancing perceptual performance of high frequency reconstruction coding methods by adaptive filtering
US20020128839A1 (en) 2001-01-12 2002-09-12 Ulf Lindgren Speech bandwidth extension
KR100601748B1 (ko) 2001-01-22 2006-07-19 카나스 데이터 코포레이션 디지털 음성 데이터의 부호화 방법 및 복호화 방법
JP2002268693A (ja) 2001-03-12 2002-09-20 Mitsubishi Electric Corp オーディオ符号化装置
SE522553C2 (sv) * 2001-04-23 2004-02-17 Ericsson Telefon Ab L M Bandbreddsutsträckning av akustiska signaler
US6934676B2 (en) 2001-05-11 2005-08-23 Nokia Mobile Phones Ltd. Method and system for inter-channel signal redundancy removal in perceptual audio coding
SE0202159D0 (sv) * 2001-07-10 2002-07-09 Coding Technologies Sweden Ab Efficientand scalable parametric stereo coding for low bitrate applications
JP2003108197A (ja) * 2001-07-13 2003-04-11 Matsushita Electric Ind Co Ltd オーディオ信号復号化装置およびオーディオ信号符号化装置
EP1351401B1 (en) * 2001-07-13 2009-01-14 Panasonic Corporation Audio signal decoding device and audio signal encoding device
DE60220307T2 (de) * 2001-10-25 2008-02-07 Koninklijke Philips Electronics N.V. Verfahren zur übertragung breitbandiger tonsignale über einen übertragungskanal mit verminderter bandbreite
JP3923783B2 (ja) * 2001-11-02 2007-06-06 松下電器産業株式会社 符号化装置及び復号化装置
JP4308229B2 (ja) 2001-11-14 2009-08-05 パナソニック株式会社 符号化装置および復号化装置
PT1423847E (pt) * 2001-11-29 2005-05-31 Coding Tech Ab Reconstrucao de componentes de frequencia elevada
US7240001B2 (en) * 2001-12-14 2007-07-03 Microsoft Corporation Quality improvement techniques in an audio encoder
US7146313B2 (en) 2001-12-14 2006-12-05 Microsoft Corporation Techniques for measurement of perceptual audio quality
US6934677B2 (en) 2001-12-14 2005-08-23 Microsoft Corporation Quantization matrices based on critical band pattern information for digital audio wherein quantization bands differ from critical bands
US7206740B2 (en) * 2002-01-04 2007-04-17 Broadcom Corporation Efficient excitation quantization in noise feedback coding with general noise shaping
EP1470550B1 (en) 2002-01-30 2008-09-03 Matsushita Electric Industrial Co., Ltd. Audio encoding and decoding device and methods thereof
US20030187663A1 (en) * 2002-03-28 2003-10-02 Truman Michael Mead Broadband frequency translation for high frequency regeneration
EP1500085B1 (en) 2002-04-10 2013-02-20 Koninklijke Philips Electronics N.V. Coding of stereo signals
US20030220800A1 (en) * 2002-05-21 2003-11-27 Budnikov Dmitry N. Coding multichannel audio signals
US7447631B2 (en) * 2002-06-17 2008-11-04 Dolby Laboratories Licensing Corporation Audio coding system using spectral hole filling
AU2003232175A1 (en) 2002-06-12 2003-12-31 Equtech Aps Method of digital equalisation of a sound from loudspeakers in rooms and use of the method
KR100462615B1 (ko) * 2002-07-11 2004-12-20 삼성전자주식회사 적은 계산량으로 고주파수 성분을 복원하는 오디오 디코딩방법 및 장치
US7502743B2 (en) * 2002-09-04 2009-03-10 Microsoft Corporation Multi-channel audio encoding and decoding with multi-channel transform selection
DE60330198D1 (de) 2002-09-04 2009-12-31 Microsoft Corp Entropische Kodierung mittels Anpassung des Kodierungsmodus zwischen Niveau- und Lauflängenniveau-Modus
US7299190B2 (en) * 2002-09-04 2007-11-20 Microsoft Corporation Quantization and inverse quantization for audio
KR100501930B1 (ko) * 2002-11-29 2005-07-18 삼성전자주식회사 적은 계산량으로 고주파수 성분을 복원하는 오디오 디코딩방법 및 장치
US7318027B2 (en) 2003-02-06 2008-01-08 Dolby Laboratories Licensing Corporation Conversion of synthesized spectral components for encoding and low-complexity transcoding
FR2852172A1 (fr) * 2003-03-04 2004-09-10 France Telecom Procede et dispositif de reconstruction spectrale d'un signal audio
RU2244386C2 (ru) 2003-03-28 2005-01-10 Корпорация "Самсунг Электроникс" Способ восстановления высокочастотной составляющей аудиосигнала и устройство для его реализации
EP1618763B1 (en) 2003-04-17 2007-02-28 Koninklijke Philips Electronics N.V. Audio signal synthesis
US7318035B2 (en) * 2003-05-08 2008-01-08 Dolby Laboratories Licensing Corporation Audio coding systems and methods using spectral component coupling and spectral component regeneration
US20050004793A1 (en) 2003-07-03 2005-01-06 Pasi Ojala Signal adaptation for higher band coding in a codec utilizing band split coding
CN1839426A (zh) * 2003-09-17 2006-09-27 北京阜国数字技术有限公司 多分辨率矢量量化的音频编解码方法及装置
DE10345996A1 (de) * 2003-10-02 2005-04-28 Fraunhofer Ges Forschung Vorrichtung und Verfahren zum Verarbeiten von wenigstens zwei Eingangswerten
US7447317B2 (en) 2003-10-02 2008-11-04 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V Compatible multi-channel coding/decoding by weighting the downmix channel
DE10345995B4 (de) 2003-10-02 2005-07-07 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Verarbeiten eines Signals mit einer Sequenz von diskreten Werten
ES2282899T3 (es) 2003-10-30 2007-10-16 Koninklijke Philips Electronics N.V. Codificacion o descodificacion de señales de audio.
US7460990B2 (en) * 2004-01-23 2008-12-02 Microsoft Corporation Efficient coding of digital media spectral data using wide-sense perceptual similarity
DE102004007191B3 (de) * 2004-02-13 2005-09-01 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audiocodierung
DE102004007200B3 (de) 2004-02-13 2005-08-11 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audiocodierung
DE102004007184B3 (de) 2004-02-13 2005-09-22 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Verfahren und Vorrichtung zum Quantisieren eines Informationssignals
CA2457988A1 (en) * 2004-02-18 2005-08-18 Voiceage Corporation Methods and devices for audio compression based on acelp/tcx coding and multi-rate lattice vector quantization
ATE390683T1 (de) 2004-03-01 2008-04-15 Dolby Lab Licensing Corp Mehrkanalige audiocodierung
US7739119B2 (en) 2004-03-02 2010-06-15 Ittiam Systems (P) Ltd. Technique for implementing Huffman decoding
US7392195B2 (en) * 2004-03-25 2008-06-24 Dts, Inc. Lossless multi-channel audio codec
EP1852851A1 (en) * 2004-04-01 2007-11-07 Beijing Media Works Co., Ltd An enhanced audio encoding/decoding device and method
CN1677491A (zh) * 2004-04-01 2005-10-05 北京宫羽数字技术有限责任公司 一种增强音频编解码装置及方法
CN1677493A (zh) * 2004-04-01 2005-10-05 北京宫羽数字技术有限责任公司 一种增强音频编解码装置及方法
CN1677492A (zh) * 2004-04-01 2005-10-05 北京宫羽数字技术有限责任公司 一种增强音频编解码装置及方法
CN1938760B (zh) * 2004-04-05 2012-05-23 皇家飞利浦电子股份有限公司 多通道编码器
US7668711B2 (en) 2004-04-23 2010-02-23 Panasonic Corporation Coding equipment
JP4546464B2 (ja) * 2004-04-27 2010-09-15 パナソニック株式会社 スケーラブル符号化装置、スケーラブル復号化装置、およびこれらの方法
DE102004021403A1 (de) * 2004-04-30 2005-11-24 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Informationssignalverarbeitung durch Modifikation in der Spektral-/Modulationsspektralbereichsdarstellung
WO2005112001A1 (ja) * 2004-05-19 2005-11-24 Matsushita Electric Industrial Co., Ltd. 符号化装置、復号化装置、およびこれらの方法
US7649988B2 (en) 2004-06-15 2010-01-19 Acoustic Technologies, Inc. Comfort noise generator using modified Doblinger noise estimate
JP2006003580A (ja) * 2004-06-17 2006-01-05 Matsushita Electric Ind Co Ltd オーディオ信号符号化装置及びオーディオ信号符号化方法
CA2572805C (en) * 2004-07-02 2013-08-13 Matsushita Electric Industrial Co., Ltd. Audio signal decoding device and audio signal encoding device
US7465389B2 (en) 2004-07-09 2008-12-16 Exxonmobil Research And Engineering Company Production of extra-heavy lube oils from Fischer-Tropsch wax
US6963405B1 (en) 2004-07-19 2005-11-08 Itt Manufacturing Enterprises, Inc. Laser counter-measure using fourier transform imaging spectrometers
KR100608062B1 (ko) * 2004-08-04 2006-08-02 삼성전자주식회사 오디오 데이터의 고주파수 복원 방법 및 그 장치
TWI393120B (zh) 2004-08-25 2013-04-11 Dolby Lab Licensing Corp 用於音訊信號編碼及解碼之方法和系統、音訊信號編碼器、音訊信號解碼器、攜帶有位元流之電腦可讀取媒體、及儲存於電腦可讀取媒體上的電腦程式
US7983904B2 (en) 2004-11-05 2011-07-19 Panasonic Corporation Scalable decoding apparatus and scalable encoding apparatus
JP4977471B2 (ja) * 2004-11-05 2012-07-18 パナソニック株式会社 符号化装置及び符号化方法
KR100721537B1 (ko) * 2004-12-08 2007-05-23 한국전자통신연구원 광대역 음성 부호화기의 고대역 음성 부호화 장치 및 그방법
KR20070085982A (ko) * 2004-12-10 2007-08-27 마츠시타 덴끼 산교 가부시키가이샤 광대역 부호화 장치, 광대역 lsp 예측 장치, 대역스케일러블 부호화 장치 및 광대역 부호화 방법
KR100707174B1 (ko) * 2004-12-31 2007-04-13 삼성전자주식회사 광대역 음성 부호화 및 복호화 시스템에서 고대역 음성부호화 및 복호화 장치와 그 방법
US20070147518A1 (en) * 2005-02-18 2007-06-28 Bruno Bessette Methods and devices for low-frequency emphasis during audio compression based on ACELP/TCX
UA94041C2 (ru) * 2005-04-01 2011-04-11 Квелкомм Инкорпорейтед Способ и устройство для фильтрации, устраняющей разреженность
US8260611B2 (en) * 2005-04-01 2012-09-04 Qualcomm Incorporated Systems, methods, and apparatus for highband excitation generation
US7983922B2 (en) 2005-04-15 2011-07-19 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus and method for generating multi-channel synthesizer control signal and apparatus and method for multi-channel synthesizing
EP1829424B1 (en) * 2005-04-15 2009-01-21 Dolby Sweden AB Temporal envelope shaping of decorrelated signals
PT1875463T (pt) 2005-04-22 2019-01-24 Qualcomm Inc Sistemas, métodos e aparelho para nivelamento de fator de ganho
US7698143B2 (en) 2005-05-17 2010-04-13 Mitsubishi Electric Research Laboratories, Inc. Constructing broad-band acoustic signals from lower-band acoustic signals
JP2006323037A (ja) * 2005-05-18 2006-11-30 Matsushita Electric Ind Co Ltd オーディオ信号復号化装置
JP5118022B2 (ja) 2005-05-26 2013-01-16 エルジー エレクトロニクス インコーポレイティド オーディオ信号の符号化/復号化方法及び符号化/復号化装置
WO2006134992A1 (ja) * 2005-06-17 2006-12-21 Matsushita Electric Industrial Co., Ltd. ポストフィルタ、復号化装置及びポストフィルタ処理方法
US7548853B2 (en) * 2005-06-17 2009-06-16 Shmunk Dmitry V Scalable compressed audio bit stream and codec using a hierarchical filterbank and multichannel joint coding
US8494667B2 (en) 2005-06-30 2013-07-23 Lg Electronics Inc. Apparatus for encoding and decoding audio signal and method thereof
US7411528B2 (en) * 2005-07-11 2008-08-12 Lg Electronics Co., Ltd. Apparatus and method of processing an audio signal
KR100803205B1 (ko) 2005-07-15 2008-02-14 삼성전자주식회사 저비트율 오디오 신호 부호화/복호화 방법 및 장치
US7539612B2 (en) * 2005-07-15 2009-05-26 Microsoft Corporation Coding and decoding scale factor information
CN100539437C (zh) 2005-07-29 2009-09-09 上海杰得微电子有限公司 一种音频编解码器的实现方法
JP4640020B2 (ja) 2005-07-29 2011-03-02 ソニー株式会社 音声符号化装置及び方法、並びに音声復号装置及び方法
CA2620627C (en) 2005-08-30 2011-03-15 Lg Electronics Inc. Apparatus for encoding and decoding audio signal and method thereof
US7974713B2 (en) 2005-10-12 2011-07-05 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Temporal and spatial shaping of multi-channel audio signals
JP5507844B2 (ja) * 2005-10-20 2014-05-28 エルジー エレクトロニクス インコーポレイティド マルチチャンネルオーディオ信号の符号化及び復号化方法とその装置
US8620644B2 (en) 2005-10-26 2013-12-31 Qualcomm Incorporated Encoder-assisted frame loss concealment techniques for audio coding
KR20070046752A (ko) * 2005-10-31 2007-05-03 엘지전자 주식회사 신호 처리 방법 및 장치
US7720677B2 (en) * 2005-11-03 2010-05-18 Coding Technologies Ab Time warped modified transform coding of audio signals
KR100717058B1 (ko) * 2005-11-28 2007-05-14 삼성전자주식회사 고주파 성분 복원 방법 및 그 장치
US8255207B2 (en) 2005-12-28 2012-08-28 Voiceage Corporation Method and device for efficient frame erasure concealment in speech codecs
US7831434B2 (en) 2006-01-20 2010-11-09 Microsoft Corporation Complex-transform channel coding with extended-band frequency coding
US7711552B2 (en) * 2006-01-27 2010-05-04 Dolby International Ab Efficient filtering with a complex modulated filterbank
EP1852848A1 (en) 2006-05-05 2007-11-07 Deutsche Thomson-Brandt GmbH Method and apparatus for lossless encoding of a source signal using a lossy encoded data stream and a lossless extension data stream
KR20070115637A (ko) * 2006-06-03 2007-12-06 삼성전자주식회사 대역폭 확장 부호화 및 복호화 방법 및 장치
US7873511B2 (en) * 2006-06-30 2011-01-18 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio encoder, audio decoder and audio processor having a dynamically variable warping characteristic
US8682652B2 (en) * 2006-06-30 2014-03-25 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio encoder, audio decoder and audio processor having a dynamically variable warping characteristic
EP3739752B1 (en) * 2006-07-04 2021-12-15 Dolby International AB Filter system comprising a filter converter and a filter compressor and method for operating the filter system
US9454974B2 (en) * 2006-07-31 2016-09-27 Qualcomm Incorporated Systems, methods, and apparatus for gain factor limiting
US8135047B2 (en) 2006-07-31 2012-03-13 Qualcomm Incorporated Systems and methods for including an identifier with a packet associated with a speech signal
US8260609B2 (en) * 2006-07-31 2012-09-04 Qualcomm Incorporated Systems, methods, and apparatus for wideband encoding and decoding of inactive frames
EP2062255B1 (en) 2006-09-13 2010-03-31 Telefonaktiebolaget LM Ericsson (PUBL) Methods and arrangements for a speech/audio sender and receiver
KR101012259B1 (ko) 2006-10-16 2011-02-08 돌비 스웨덴 에이비 멀티채널 다운믹스된 객체 코딩의 개선된 코딩 및 파라미터 표현
PL3848928T3 (pl) 2006-10-25 2023-07-17 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Urządzenie i sposób do generowania wartości podpasm audio o wartościach zespolonych
US20080243518A1 (en) * 2006-11-16 2008-10-02 Alexey Oraevsky System And Method For Compressing And Reconstructing Audio Files
US8170359B2 (en) 2006-11-28 2012-05-01 Panasonic Corporation Encoding device and encoding method
US8160890B2 (en) 2006-12-13 2012-04-17 Panasonic Corporation Audio signal coding method and decoding method
US8200351B2 (en) 2007-01-05 2012-06-12 STMicroelectronics Asia PTE., Ltd. Low power downmix energy equalization in parametric stereo encoders
RU2466469C2 (ru) 2007-01-10 2012-11-10 Конинклейке Филипс Электроникс Н.В. Аудиодекодер
EP2115743A1 (en) 2007-02-26 2009-11-11 QUALCOMM Incorporated Systems, methods, and apparatus for signal separation
US20080208575A1 (en) * 2007-02-27 2008-08-28 Nokia Corporation Split-band encoding and decoding of an audio signal
JP5294713B2 (ja) 2007-03-02 2013-09-18 パナソニック株式会社 符号化装置、復号装置およびそれらの方法
KR101355376B1 (ko) 2007-04-30 2014-01-23 삼성전자주식회사 고주파수 영역 부호화 및 복호화 방법 및 장치
KR101411900B1 (ko) 2007-05-08 2014-06-26 삼성전자주식회사 오디오 신호의 부호화 및 복호화 방법 및 장치
CN101067931B (zh) * 2007-05-10 2011-04-20 芯晟(北京)科技有限公司 一种高效可配置的频域参数立体声及多声道编解码方法与系统
TWI527473B (zh) 2007-06-08 2016-03-21 杜比實驗室特許公司 用以獲得環繞音效音訊頻道之方法、適於執行該方法之裝置、及相關電腦程式
US7774205B2 (en) 2007-06-15 2010-08-10 Microsoft Corporation Coding of sparse digital media spectral data
CN101325059B (zh) * 2007-06-15 2011-12-21 华为技术有限公司 语音编解码收发方法及装置
US7885819B2 (en) * 2007-06-29 2011-02-08 Microsoft Corporation Bitstream syntax for multi-process audio decoding
US8428957B2 (en) * 2007-08-24 2013-04-23 Qualcomm Incorporated Spectral noise shaping in audio coding based on spectral dynamics in frequency sub-bands
DK2186089T3 (en) * 2007-08-27 2019-01-07 Ericsson Telefon Ab L M Method and apparatus for perceptual spectral decoding of an audio signal including filling in spectral holes
DK2571024T3 (en) * 2007-08-27 2015-01-05 Ericsson Telefon Ab L M Adaptive transition frequency between the noise filling and bandwidth extension
DE102007048973B4 (de) 2007-10-12 2010-11-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Erzeugen eines Multikanalsignals mit einer Sprachsignalverarbeitung
US8527265B2 (en) * 2007-10-22 2013-09-03 Qualcomm Incorporated Low-complexity encoding/decoding of quantized MDCT spectrum in scalable speech and audio codecs
KR101373004B1 (ko) * 2007-10-30 2014-03-26 삼성전자주식회사 고주파수 신호 부호화 및 복호화 장치 및 방법
US9177569B2 (en) * 2007-10-30 2015-11-03 Samsung Electronics Co., Ltd. Apparatus, medium and method to encode and decode high frequency signal
JP5547081B2 (ja) * 2007-11-02 2014-07-09 華為技術有限公司 音声復号化方法及び装置
EP2218068A4 (en) 2007-11-21 2010-11-24 Lg Electronics Inc METHOD AND APPARATUS FOR SIGNAL PROCESSING
US8688441B2 (en) * 2007-11-29 2014-04-01 Motorola Mobility Llc Method and apparatus to facilitate provision and use of an energy value to determine a spectral envelope shape for out-of-signal bandwidth content
JP5485909B2 (ja) * 2007-12-31 2014-05-07 エルジー エレクトロニクス インコーポレイティド オーディオ信号処理方法及び装置
ATE518224T1 (de) * 2008-01-04 2011-08-15 Dolby Int Ab Audiokodierer und -dekodierer
US20090180531A1 (en) 2008-01-07 2009-07-16 Radlive Ltd. codec with plc capabilities
KR101413967B1 (ko) 2008-01-29 2014-07-01 삼성전자주식회사 오디오 신호의 부호화 방법 및 복호화 방법, 및 그에 대한 기록 매체, 오디오 신호의 부호화 장치 및 복호화 장치
WO2009096898A1 (en) * 2008-01-31 2009-08-06 Agency For Science, Technology And Research Method and device of bitrate distribution/truncation for scalable audio coding
CN101946526B (zh) * 2008-02-14 2013-01-02 杜比实验室特许公司 声音再现方法和系统以及立体声扩展方法
RU2562395C2 (ru) * 2008-03-04 2015-09-10 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Микширование входящих информационных потоков
JP5247826B2 (ja) * 2008-03-05 2013-07-24 ヴォイスエイジ・コーポレーション 復号化音調音響信号を増強するためのシステムおよび方法
EP2104096B1 (en) 2008-03-20 2020-05-06 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for converting an audio signal into a parameterized representation, apparatus and method for modifying a parameterized representation, apparatus and method for synthesizing a parameterized representation of an audio signal
KR20090110244A (ko) 2008-04-17 2009-10-21 삼성전자주식회사 오디오 시맨틱 정보를 이용한 오디오 신호의 부호화/복호화 방법 및 그 장치
ES2613693T3 (es) 2008-05-09 2017-05-25 Nokia Technologies Oy Aparato de audio
US20090319263A1 (en) 2008-06-20 2009-12-24 Qualcomm Incorporated Coding of transitional speech frames for low-bit-rate applications
ES2683077T3 (es) * 2008-07-11 2018-09-24 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada
BRPI0904958B1 (pt) 2008-07-11 2020-03-03 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Aparelho e método para calcular dados de extensão de largura de banda usando um quadro controlado por inclinação espectral
EP2304719B1 (en) 2008-07-11 2017-07-26 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, methods for providing an audio stream and computer program
PL2346029T3 (pl) 2008-07-11 2013-11-29 Fraunhofer Ges Forschung Koder sygnału audio, sposób kodowania sygnału audio i odpowiadający mu program komputerowy
RU2494477C2 (ru) 2008-07-11 2013-09-27 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Устройство и способ генерирования выходных данных расширения полосы пропускания
CA2730198C (en) 2008-07-11 2014-09-16 Frederik Nagel Audio signal synthesizer and audio signal encoder
RU2621965C2 (ru) * 2008-07-11 2017-06-08 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Передатчик сигнала активации с деформацией по времени, кодер звукового сигнала, способ преобразования сигнала активации с деформацией по времени, способ кодирования звукового сигнала и компьютерные программы
EP2144230A1 (en) * 2008-07-11 2010-01-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Low bitrate audio encoding/decoding scheme having cascaded switches
JP5606433B2 (ja) 2008-07-11 2014-10-15 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン オーディオエンコーダ及びオーディオデコーダ
EP2154911A1 (en) 2008-08-13 2010-02-17 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. An apparatus for determining a spatial output multi-channel audio signal
WO2010028292A1 (en) 2008-09-06 2010-03-11 Huawei Technologies Co., Ltd. Adaptive frequency prediction
US8463603B2 (en) * 2008-09-06 2013-06-11 Huawei Technologies Co., Ltd. Spectral envelope coding of energy attack signal
US8577673B2 (en) 2008-09-15 2013-11-05 Huawei Technologies Co., Ltd. CELP post-processing for music signals
RU2481650C2 (ru) * 2008-09-17 2013-05-10 Франс Телеком Ослабление опережающих эхо-сигналов в цифровом звуковом сигнале
EP2224433B1 (en) * 2008-09-25 2020-05-27 Lg Electronics Inc. An apparatus for processing an audio signal and method thereof
US9947340B2 (en) * 2008-12-10 2018-04-17 Skype Regeneration of wideband speech
PL4231295T3 (pl) 2008-12-15 2024-05-06 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Sposób dekodowania powiększania szerokości pasma audio oraz program komputerowy
JP5423684B2 (ja) * 2008-12-19 2014-02-19 富士通株式会社 音声帯域拡張装置及び音声帯域拡張方法
ES3023486T3 (en) 2009-01-16 2025-06-02 Dolby Int Ab Cross product enhanced harmonic transposition
JP4977157B2 (ja) * 2009-03-06 2012-07-18 株式会社エヌ・ティ・ティ・ドコモ 音信号符号化方法、音信号復号方法、符号化装置、復号装置、音信号処理システム、音信号符号化プログラム、及び、音信号復号プログラム
CN105225667B (zh) * 2009-03-17 2019-04-05 杜比国际公司 编码器系统、解码器系统、编码方法和解码方法
EP2239732A1 (en) 2009-04-09 2010-10-13 Fraunhofer-Gesellschaft zur Förderung der Angewandten Forschung e.V. Apparatus and method for generating a synthesis audio signal and for encoding an audio signal
JP4932917B2 (ja) * 2009-04-03 2012-05-16 株式会社エヌ・ティ・ティ・ドコモ 音声復号装置、音声復号方法、及び音声復号プログラム
CN101521014B (zh) * 2009-04-08 2011-09-14 武汉大学 音频带宽扩展编解码装置
US8391212B2 (en) * 2009-05-05 2013-03-05 Huawei Technologies Co., Ltd. System and method for frequency domain audio post-processing based on perceptual masking
EP2249333B1 (en) * 2009-05-06 2014-08-27 Nuance Communications, Inc. Method and apparatus for estimating a fundamental frequency of a speech signal
CN101556799B (zh) 2009-05-14 2013-08-28 华为技术有限公司 一种音频解码方法和音频解码器
TWI591625B (zh) * 2009-05-27 2017-07-11 杜比國際公司 從訊號的低頻成份產生該訊號之高頻成份的系統與方法,及其機上盒、電腦程式產品、軟體程式及儲存媒體
CN101609680B (zh) * 2009-06-01 2012-01-04 华为技术有限公司 压缩编码和解码的方法、编码器和解码器以及编码装置
ES2400661T3 (es) 2009-06-29 2013-04-11 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Codificación y decodificación de extensión de ancho de banda
JP5671530B2 (ja) 2009-07-07 2015-02-18 エックストラリス・テクノロジーズ・リミテッド チャンバコンディション
US8793617B2 (en) * 2009-07-30 2014-07-29 Microsoft Corporation Integrating transport modes into a communication stream
US9031834B2 (en) 2009-09-04 2015-05-12 Nuance Communications, Inc. Speech enhancement techniques on the power spectrum
GB2473267A (en) 2009-09-07 2011-03-09 Nokia Corp Processing audio signals to reduce noise
ES2441069T3 (es) * 2009-10-08 2014-01-31 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Decodificador multimodo para señal de audio, codificador multimodo para señal de audio, procedimiento y programa de computación que usan un modelado de ruido en base a linealidad-predicción-codificación
KR101137652B1 (ko) 2009-10-14 2012-04-23 광운대학교 산학협력단 천이 구간에 기초하여 윈도우의 오버랩 영역을 조절하는 통합 음성/오디오 부호화/복호화 장치 및 방법
WO2011048094A1 (en) 2009-10-20 2011-04-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Multi-mode audio codec and celp coding adapted therefore
MX2012004648A (es) 2009-10-20 2012-05-29 Fraunhofer Ges Forschung Codificacion de señal de audio, decodificador de señal de audio, metodo para codificar o decodificar una señal de audio utilizando una cancelacion del tipo aliasing.
ES3051141T3 (en) * 2009-10-21 2025-12-26 Dolby Int Ab Oversampling in a combined transposer filter bank
US8484020B2 (en) * 2009-10-23 2013-07-09 Qualcomm Incorporated Determining an upperband signal from a narrowband signal
EP2502230B1 (en) 2009-11-19 2014-05-21 Telefonaktiebolaget L M Ericsson (PUBL) Improved excitation signal bandwidth extension
CN102081927B (zh) 2009-11-27 2012-07-18 中兴通讯股份有限公司 一种可分层音频编码、解码方法及系统
WO2011071610A1 (en) 2009-12-07 2011-06-16 Dolby Laboratories Licensing Corporation Decoding of multichannel aufio encoded bit streams using adaptive hybrid transformation
KR101764926B1 (ko) 2009-12-10 2017-08-03 삼성전자주식회사 음향 통신을 위한 장치 및 방법
MX2012006823A (es) * 2009-12-16 2012-07-23 Dolby Int Ab Mezcla descendente de parametros de corriente de bits sbr.
KR101423737B1 (ko) * 2010-01-21 2014-07-24 한국전자통신연구원 오디오 신호의 디코딩 방법 및 장치
CN102194457B (zh) * 2010-03-02 2013-02-27 中兴通讯股份有限公司 音频编解码方法、系统及噪声水平估计方法
AU2011226212B2 (en) * 2010-03-09 2014-03-27 Dolby International Ab Apparatus and method for processing an input audio signal using cascaded filterbanks
EP2369861B1 (en) 2010-03-25 2016-07-27 Nxp B.V. Multi-channel audio signal processing
EP2375409A1 (en) 2010-04-09 2011-10-12 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder and related methods for processing multi-channel audio signals using complex prediction
KR101698439B1 (ko) * 2010-04-09 2017-01-20 돌비 인터네셔널 에이비 Mdct-기반의 복소수 예측 스테레오 코딩
ES2911893T3 (es) 2010-04-13 2022-05-23 Fraunhofer Ges Forschung Codificador de audio, decodificador de audio y métodos relacionados para procesar señales de audio estéreo usando una dirección de predicción variable
US8886523B2 (en) 2010-04-14 2014-11-11 Huawei Technologies Co., Ltd. Audio decoding based on audio class with control code for post-processing modes
CN102947882B (zh) 2010-04-16 2015-06-17 弗劳恩霍夫应用研究促进协会 使用制导带宽扩展和盲带宽扩展生成宽带信号的装置、方法
US8600737B2 (en) 2010-06-01 2013-12-03 Qualcomm Incorporated Systems, methods, apparatus, and computer program products for wideband speech coding
US9093080B2 (en) 2010-06-09 2015-07-28 Panasonic Intellectual Property Corporation Of America Bandwidth extension method, bandwidth extension apparatus, program, integrated circuit, and audio decoding apparatus
US9047875B2 (en) 2010-07-19 2015-06-02 Futurewei Technologies, Inc. Spectrum flatness control for bandwidth extension
US8924222B2 (en) * 2010-07-30 2014-12-30 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for coding of harmonic signals
JP6075743B2 (ja) 2010-08-03 2017-02-08 ソニー株式会社 信号処理装置および方法、並びにプログラム
US8489403B1 (en) 2010-08-25 2013-07-16 Foundation For Research and Technology—Institute of Computer Science ‘FORTH-ICS’ Apparatuses, methods and systems for sparse sinusoidal audio processing and transmission
KR101826331B1 (ko) 2010-09-15 2018-03-22 삼성전자주식회사 고주파수 대역폭 확장을 위한 부호화/복호화 장치 및 방법
AU2012217162B2 (en) * 2011-02-14 2015-11-26 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Noise generation in audio codecs
US9135929B2 (en) 2011-04-28 2015-09-15 Dolby International Ab Efficient content classification and loudness estimation
WO2012158333A1 (en) 2011-05-19 2012-11-22 Dolby Laboratories Licensing Corporation Forensic detection of parametric audio coding schemes
US9311923B2 (en) 2011-05-19 2016-04-12 Dolby Laboratories Licensing Corporation Adaptive audio processing based on forensic detection of media processing history
US20130006644A1 (en) 2011-06-30 2013-01-03 Zte Corporation Method and device for spectral band replication, and method and system for audio decoding
DE102011106033A1 (de) * 2011-06-30 2013-01-03 Zte Corporation Verfahren und System zur Audiocodierung und -decodierung und Verfahren zur Schätzung des Rauschpegels
WO2013002623A2 (ko) 2011-06-30 2013-01-03 삼성전자 주식회사 대역폭 확장신호 생성장치 및 방법
JP5942358B2 (ja) 2011-08-24 2016-06-29 ソニー株式会社 符号化装置および方法、復号装置および方法、並びにプログラム
JP6037156B2 (ja) * 2011-08-24 2016-11-30 ソニー株式会社 符号化装置および方法、並びにプログラム
KR20130022549A (ko) 2011-08-25 2013-03-07 삼성전자주식회사 마이크 노이즈 제거 방법 및 이를 지원하는 휴대 단말기
CN103718240B (zh) 2011-09-09 2017-02-15 松下电器(美国)知识产权公司 编码装置、解码装置、编码方法和解码方法
US9319159B2 (en) 2011-09-29 2016-04-19 Dolby International Ab High quality detection in FM stereo radio signal
PT3321931T (pt) * 2011-10-28 2020-02-25 Fraunhofer Ges Forschung Aparelho de codificação e método de codificação
EP3279895B1 (en) * 2011-11-02 2019-07-10 Telefonaktiebolaget LM Ericsson (publ) Audio encoding based on an efficient representation of auto-regressive coefficients
WO2013079524A2 (en) * 2011-11-30 2013-06-06 Dolby International Ab Enhanced chroma extraction from an audio codec
JP5817499B2 (ja) 2011-12-15 2015-11-18 富士通株式会社 復号装置、符号化装置、符号化復号システム、復号方法、符号化方法、復号プログラム、及び符号化プログラム
CN103165136A (zh) * 2011-12-15 2013-06-19 杜比实验室特许公司 音频处理方法及音频处理设备
JP6082703B2 (ja) 2012-01-20 2017-02-15 パナソニック インテレクチュアル プロパティ コーポレーション オブ アメリカPanasonic Intellectual Property Corporation of America 音声復号装置及び音声復号方法
KR101398189B1 (ko) 2012-03-27 2014-05-22 광주과학기술원 음성수신장치 및 음성수신방법
CN104221082B (zh) 2012-03-29 2017-03-08 瑞典爱立信有限公司 谐波音频信号的带宽扩展
ES2703873T3 (es) 2012-03-29 2019-03-12 Ericsson Telefon Ab L M Codificación/descodificación de la transformada de señales armónicas de audio
CN102750955B (zh) * 2012-07-20 2014-06-18 中国科学院自动化研究所 基于残差信号频谱重构的声码器
US9589570B2 (en) 2012-09-18 2017-03-07 Huawei Technologies Co., Ltd. Audio classification based on perceptual quality for low or medium bit rates
CN107731237B (zh) 2012-09-24 2021-07-20 三星电子株式会社 时域帧错误隐藏设备
US9129600B2 (en) 2012-09-26 2015-09-08 Google Technology Holdings LLC Method and apparatus for encoding an audio signal
US9135920B2 (en) 2012-11-26 2015-09-15 Harman International Industries, Incorporated System for perceived enhancement and restoration of compressed audio signals
RU2641461C2 (ru) 2013-01-29 2018-01-17 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Аудиокодер, аудиодекодер, способ обеспечения кодированной аудиоинформации, способ обеспечения декодированной аудиоинформации, компьютерная программа и кодированное представление с использованием сигнально-адаптивного расширения полосы пропускания
EP2830054A1 (en) * 2013-07-22 2015-01-28 Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder and related methods using two-channel processing within an intelligent gap filling framework
EP2830055A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Context-based entropy coding of sample values of a spectral envelope
EP2980795A1 (en) 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoding and decoding using a frequency domain processor, a time domain processor and a cross processor for initialization of the time domain processor

Also Published As

Publication number Publication date
JP2018077487A (ja) 2018-05-17
ES2638498T3 (es) 2017-10-23
US20170154631A1 (en) 2017-06-01
CN110660410B (zh) 2023-10-24
PT3017448T (pt) 2020-10-08
ES2908624T3 (es) 2022-05-03
PL3025340T3 (pl) 2019-09-30
BR122022011238B1 (pt) 2023-12-19
US10515652B2 (en) 2019-12-24
MY177860A (en) 2020-09-23
EP3506260C0 (en) 2023-08-16
WO2015010947A1 (en) 2015-01-29
US10347274B2 (en) 2019-07-09
KR101774795B1 (ko) 2017-09-05
BR112016001072A2 (es) 2017-08-22
US20220270619A1 (en) 2022-08-25
KR101822032B1 (ko) 2018-03-08
US11996106B2 (en) 2024-05-28
WO2015010954A1 (en) 2015-01-29
BR112016001398B1 (pt) 2021-12-28
MX354657B (es) 2018-03-14
TWI545560B (zh) 2016-08-11
TWI549121B (zh) 2016-09-11
BR112016000740B1 (pt) 2022-12-27
AU2014295296A1 (en) 2016-03-10
US20160140980A1 (en) 2016-05-19
US11769513B2 (en) 2023-09-26
ES2698023T3 (es) 2019-01-30
US10147430B2 (en) 2018-12-04
EP3407350B1 (en) 2020-07-29
EP2830059A1 (en) 2015-01-28
KR101764723B1 (ko) 2017-08-14
CA2918810C (en) 2020-04-28
JP6705787B2 (ja) 2020-06-03
US20180102134A1 (en) 2018-04-12
CN105453176A (zh) 2016-03-30
BR112016001398A2 (pt) 2017-08-22
JP6306702B2 (ja) 2018-04-04
MX2016000943A (es) 2016-07-05
US11289104B2 (en) 2022-03-29
CN104769671A (zh) 2015-07-08
BR122022010960B1 (pt) 2023-04-04
EP3025344B1 (en) 2017-06-21
PT2883227T (pt) 2016-11-18
BR112015007533B1 (pt) 2022-09-27
JP6321797B2 (ja) 2018-05-09
MX2016000935A (es) 2016-07-05
US20160140979A1 (en) 2016-05-19
KR101681253B1 (ko) 2016-12-01
EP3025343B1 (en) 2018-02-14
JP6186082B2 (ja) 2017-08-23
MX354002B (es) 2018-02-07
MX2016000924A (es) 2016-05-05
BR112016001125A2 (es) 2017-08-22
JP2016527557A (ja) 2016-09-08
CN105453176B (zh) 2019-08-23
JP2018013796A (ja) 2018-01-25
CA2973841A1 (en) 2015-01-29
WO2015010950A1 (en) 2015-01-29
CA2918804C (en) 2018-06-12
EP3506260B1 (en) 2023-08-16
RU2649940C2 (ru) 2018-04-05
RU2016105619A (ru) 2017-08-23
CN111179963A (zh) 2020-05-19
KR20160024924A (ko) 2016-03-07
JP6310074B2 (ja) 2018-04-11
EP2830064A1 (en) 2015-01-28
US20190198029A1 (en) 2019-06-27
RU2635890C2 (ru) 2017-11-16
RU2651229C2 (ru) 2018-04-18
TW201517023A (zh) 2015-05-01
PT3025328T (pt) 2018-11-27
EP4246512A2 (en) 2023-09-20
EP4246512A3 (en) 2023-12-13
US20190371355A1 (en) 2019-12-05
PT3025340T (pt) 2019-06-27
EP3025328B1 (en) 2018-08-01
EP3975180B1 (en) 2025-10-15
EP3025340B1 (en) 2019-03-27
PL2883227T3 (pl) 2017-03-31
BR112016001125B1 (pt) 2022-01-04
US11049506B2 (en) 2021-06-29
BR122022010958B1 (pt) 2024-01-30
AU2014295297A1 (en) 2016-03-10
CN105580075A (zh) 2016-05-11
TWI541797B (zh) 2016-07-11
AU2014295298B2 (en) 2017-05-25
EP3025344A1 (en) 2016-06-01
RU2016105759A (ru) 2017-08-25
CN110660410A (zh) 2020-01-07
AU2014295300A1 (en) 2016-03-10
US20190043522A1 (en) 2019-02-07
CN105518777A (zh) 2016-04-20
ES2667221T3 (es) 2018-05-10
CA2918807C (en) 2019-05-07
EP2830065A1 (en) 2015-01-28
MX2016000857A (es) 2016-05-05
PL3025328T3 (pl) 2019-02-28
CA2918804A1 (en) 2015-01-29
CN112466312B (zh) 2025-02-21
US20160210974A1 (en) 2016-07-21
WO2015010953A1 (en) 2015-01-29
MX2015004022A (es) 2015-07-06
RU2015112591A (ru) 2016-10-27
KR20160034975A (ko) 2016-03-30
PL3975180T3 (pl) 2026-03-09
BR112016000852B1 (pt) 2021-12-28
US12142284B2 (en) 2024-11-12
EP3975180A1 (en) 2022-03-30
AU2014295300B2 (en) 2017-05-25
CN104769671B (zh) 2017-09-26
AU2014295295B2 (en) 2017-10-19
US20220139407A1 (en) 2022-05-05
CN111179963B (zh) 2024-11-22
AU2014295302A1 (en) 2015-04-02
MX356161B (es) 2018-05-16
EP2830061A1 (en) 2015-01-28
PL3017448T3 (pl) 2020-12-28
JP2016530556A (ja) 2016-09-29
EP2830056A1 (en) 2015-01-28
KR101807836B1 (ko) 2018-01-18
EP3723091A1 (en) 2020-10-14
BR112016000852A2 (pt) 2017-08-22
CN105453175B (zh) 2020-11-03
JP6691093B2 (ja) 2020-04-28
EP2830063A1 (en) 2015-01-28
US20190074019A1 (en) 2019-03-07
TWI555009B (zh) 2016-10-21
AU2014295302B2 (en) 2016-06-30
MY187943A (en) 2021-10-30
AU2014295301B2 (en) 2017-05-25
CN110310659B (zh) 2023-10-24
RU2640634C2 (ru) 2018-01-10
PL3506260T3 (pl) 2024-02-19
SG11201502691QA (en) 2015-05-28
US10332539B2 (en) 2019-06-25
US10573334B2 (en) 2020-02-25
CN105556603A (zh) 2016-05-04
ES2813940T3 (es) 2021-03-25
TW201523590A (zh) 2015-06-16
US11922956B2 (en) 2024-03-05
MX340575B (es) 2016-07-13
CA2918524A1 (en) 2015-01-29
MX353999B (es) 2018-02-07
WO2015010949A1 (en) 2015-01-29
KR20160030193A (ko) 2016-03-16
TW201517019A (zh) 2015-05-01
SG11201600506VA (en) 2016-02-26
CN111554310B (zh) 2023-10-20
AU2014295297B2 (en) 2017-05-25
EP3017448A1 (en) 2016-05-11
EP3025337B1 (en) 2021-12-08
CN105518776B (zh) 2019-06-14
TW201517024A (zh) 2015-05-01
WO2015010948A1 (en) 2015-01-29
ZA201601010B (en) 2017-11-29
SG11201600496XA (en) 2016-02-26
US11769512B2 (en) 2023-09-26
BR112015007533A2 (es) 2017-08-22
CA2918701C (en) 2020-04-14
RU2607263C2 (ru) 2017-01-10
PT3025337T (pt) 2022-02-23
MX355448B (es) 2018-04-18
CN105556603B (zh) 2019-08-27
PL3407350T3 (pl) 2020-12-28
US20210065723A1 (en) 2021-03-04
CA2918524C (en) 2018-05-22
MX2016000854A (es) 2016-06-23
SG11201600494UA (en) 2016-02-26
ES2599007T3 (es) 2017-01-31
CA2918835A1 (en) 2015-01-29
BR122022011231B1 (pt) 2024-01-30
KR20160046804A (ko) 2016-04-29
US20160133265A1 (en) 2016-05-12
KR20160042890A (ko) 2016-04-20
CA2918835C (en) 2018-06-26
BR112016001072B1 (pt) 2022-07-12
JP2016529545A (ja) 2016-09-23
EP2830054A1 (en) 2015-01-28
CA2886505C (en) 2017-10-31
JP2022123060A (ja) 2022-08-23
CA2918701A1 (en) 2015-01-29
JP6568566B2 (ja) 2019-08-28
US20220157325A1 (en) 2022-05-19
EP3025343A1 (en) 2016-06-01
TW201523589A (zh) 2015-06-16
CA2918810A1 (en) 2015-01-29
EP3723091C0 (en) 2024-09-11
TWI545561B (zh) 2016-08-11
US20200082841A1 (en) 2020-03-12
RU2646316C2 (ru) 2018-03-02
US20160140981A1 (en) 2016-05-19
JP2016525713A (ja) 2016-08-25
JP2020060792A (ja) 2020-04-16
JP7092809B2 (ja) 2022-06-28
SG11201600401RA (en) 2016-02-26
TW201513098A (zh) 2015-04-01
US10332531B2 (en) 2019-06-25
US10847167B2 (en) 2020-11-24
CA2886505A1 (en) 2015-01-29
AU2014295296B2 (en) 2017-10-19
JP2018041100A (ja) 2018-03-15
JP6144773B2 (ja) 2017-06-07
MY184847A (en) 2021-04-27
US10276183B2 (en) 2019-04-30
KR101826723B1 (ko) 2018-03-22
JP6389254B2 (ja) 2018-09-12
CN105580075B (zh) 2020-02-07
EP2883227B1 (en) 2016-08-17
AU2014295301A1 (en) 2016-03-10
BR112016000947B1 (pt) 2022-06-21
ZA201502262B (en) 2016-09-28
RU2016105473A (ru) 2017-08-23
WO2015010952A9 (en) 2017-10-26
TW201514974A (zh) 2015-04-16
ZA201601111B (en) 2017-08-30
CN110310659A (zh) 2019-10-08
US20160140973A1 (en) 2016-05-19
CN105518776A (zh) 2016-04-20
US10134404B2 (en) 2018-11-20
EP3025328A1 (en) 2016-06-01
EP3506260A1 (en) 2019-07-03
CN112466312A (zh) 2021-03-09
PT3025343T (pt) 2018-05-18
EP3723091B1 (en) 2024-09-11
US10593345B2 (en) 2020-03-17
US20210295853A1 (en) 2021-09-23
CN111554310A (zh) 2020-08-18
CN105518777B (zh) 2020-01-31
US11250862B2 (en) 2022-02-15
US10311892B2 (en) 2019-06-04
US11735192B2 (en) 2023-08-22
US20180268842A1 (en) 2018-09-20
BR122022010965B1 (pt) 2023-04-04
BR112016000947A2 (es) 2017-08-22
PT3407350T (pt) 2020-10-27
PL3025337T3 (pl) 2022-04-11
KR20150060752A (ko) 2015-06-03
JP2016529546A (ja) 2016-09-23
BR112016000740A2 (pt) 2017-08-22
TWI555008B (zh) 2016-10-21
EP3407350A1 (en) 2018-11-28
TWI545558B (zh) 2016-08-11
MX362036B (es) 2019-01-04
US20210217426A1 (en) 2021-07-15
HK1211378A1 (en) 2016-05-20
CA2973841C (en) 2019-08-20
EP3025337A1 (en) 2016-06-01
JP2016527556A (ja) 2016-09-08
EP3742444A1 (en) 2020-11-25
EP3975180C0 (en) 2025-10-15
JP2015535620A (ja) 2015-12-14
JP6400702B2 (ja) 2018-10-03
MY180759A (en) 2020-12-08
US20180144760A1 (en) 2018-05-24
TR201816157T4 (tr) 2018-11-21
EP3025340A1 (en) 2016-06-01
SG11201600422SA (en) 2016-02-26
US11257505B2 (en) 2022-02-22
US11222643B2 (en) 2022-01-11
JP7483792B2 (ja) 2024-05-15
US20150287417A1 (en) 2015-10-08
RU2016105618A (ru) 2017-08-28
US10002621B2 (en) 2018-06-19
KR101809592B1 (ko) 2018-01-18
RU2643641C2 (ru) 2018-02-02
US20190251986A1 (en) 2019-08-15
ZA201601011B (en) 2017-05-31
ES2827774T3 (es) 2021-05-24
EP3017448B1 (en) 2020-07-08
AU2014295295A1 (en) 2016-03-10
MX2016000940A (es) 2016-04-25
EP2883227A1 (en) 2015-06-17
US20230352032A1 (en) 2023-11-02
WO2015010952A1 (en) 2015-01-29
ZA201601046B (en) 2017-05-31
CA2918807A1 (en) 2015-01-29
RU2016105613A (ru) 2017-08-28
AU2014295298A1 (en) 2016-03-10
US10984805B2 (en) 2021-04-20
CN105453175A (zh) 2016-03-30
ES2728329T3 (es) 2019-10-23
KR20160041940A (ko) 2016-04-18
PL3025343T3 (pl) 2018-10-31
SG11201600464WA (en) 2016-02-26
MY175978A (en) 2020-07-19
ES2959641T3 (es) 2024-02-27
MY182831A (en) 2021-02-05
RU2016105610A (ru) 2017-08-25

Similar Documents

Publication Publication Date Title
ES3053797T3 (en) Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain
HK40069303B (en) Apparatus and method for encoding or decoding an audio signal with intelligent gap filling in the spectral domain
HK40010190A (en) Apparatus and method for decoding or encoding an audio signal using energy information values for a reconstruction band
HK40010190B (en) Apparatus and method for decoding or encoding an audio signal using energy information values for a reconstruction band
HK1225155B (en) Apparatus and method for decoding or encoding an audio signal using energy information values for a reconstruction band