ES2294703T3 - Metodo para representar señales de audio multicanal. - Google Patents

Metodo para representar señales de audio multicanal. Download PDF

Info

Publication number
ES2294703T3
ES2294703T3 ES05735201T ES05735201T ES2294703T3 ES 2294703 T3 ES2294703 T3 ES 2294703T3 ES 05735201 T ES05735201 T ES 05735201T ES 05735201 T ES05735201 T ES 05735201T ES 2294703 T3 ES2294703 T3 ES 2294703T3
Authority
ES
Spain
Prior art keywords
channel
parameter
channels
equilibrium
balance
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES05735201T
Other languages
English (en)
Inventor
Heiko Purnhagen
Lars Villemoes
Jonas Engdegard
Jonas Roden
Kristofer Kjorling
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Coding Technologies Sweden AB
Original Assignee
Coding Technologies Sweden AB
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Coding Technologies Sweden AB filed Critical Coding Technologies Sweden AB
Application granted granted Critical
Publication of ES2294703T3 publication Critical patent/ES2294703T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04RLOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
    • H04R5/00Stereophonic arrangements
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0204Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/032Quantisation or dequantisation of spectral components
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/167Audio streaming, i.e. formatting and decoding of an encoded audio signal representation into a data stream for transmission or storage purposes
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/26Pre-filtering or post-filtering
    • HELECTRICITY
    • H03ELECTRONIC CIRCUITRY
    • H03MCODING; DECODING; CODE CONVERSION IN GENERAL
    • H03M7/00Conversion of a code where information is represented by a given sequence or number of digits to a code where the same, similar or subset of information is represented by a different sequence or number of digits
    • H03M7/30Compression; Expansion; Suppression of unnecessary data, e.g. redundancy reduction
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S3/00Systems employing more than two channels, e.g. quadraphonic
    • H04S3/02Systems employing more than two channels, e.g. quadraphonic of the matrix type, i.e. in which input signals are combined algebraically, e.g. after having been phase shifted with respect to each other
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S5/00Pseudo-stereo systems, e.g. in which additional channel signals are derived from monophonic signals by means of phase shifting, time delay or reverberation 
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/01Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/03Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2420/00Techniques used stereophonic systems covered by H04S but not provided for in its groups
    • H04S2420/03Application of parametric coding in stereophonic audio systems

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Signal Processing (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Multimedia (AREA)
  • Mathematical Physics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Algebra (AREA)
  • Mathematical Optimization (AREA)
  • Mathematical Analysis (AREA)
  • Pure & Applied Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Stereophonic System (AREA)
  • Stereo-Broadcasting Methods (AREA)
  • Radio Relay Systems (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • Circuits Of Receivers In General (AREA)

Abstract

Aparato para generar una representación de parámetros de una señal de entrada multicanal que presenta canales originales, incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (E) posterior derecho, que comprende: un generador (203) de parámetros para generar un primer parámetro (r1) de equilibrio, un primer parámetro de coherencia o un primer parámetro de diferencia de tiempo entre un primer par de canales, para generar un segundo parámetro (r2) de equilibrio entre un segundo par de canales, y para generar un tercer parámetro (r3) de equilibrio entre un tercer par de canales, formando los parámetros de equilibrio, los parámetros de coherencia o los parámetros de tiempo la representación de parámetros, en el que cada canal del par de dos canales es uno de los canales originales o una combinación ponderada o no ponderada de los canales originales, y en el que el primer parámetro (r1) de equilibrio esun parámetro de equilibrio izquierdo/derecho, y en el que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho en el que el segundo parámetro (r2) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central, y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho, y en el que el tercer parámetro (r3) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho.

Description

Método para representar señales de audio multicanal.
Campo técnico
La presente invención se refiere a la codificación de representaciones multicanal de señales de audio utilizando parámetros espaciales. La presente invención enseña nuevos métodos para estimar y definir parámetros apropiados para recrear una señal multicanal a partir de un número de canales que es menor que el número de canales de salida. En particular, tiene como objetivo minimizar la tasa de bits para la representación multicanal, y proporcionar una representación codificada de la señal multicanal permitiendo una codificación y descodificación fáciles de los datos para todas las posibles configuraciones de canales.
Antecedentes de la invención
Se ha mostrado en el documento WO-A-03/007656 "Efficient and scalable Parametric Stereo Coding for Low Bit rate Audio Coding Applications", que es posible recrear una imagen estéreo que se parece mucho a la imagen estéreo original a partir de una señal mono dada una representación muy compacta de la imagen estéreo. El principio básico es dividir la señal de entrada en bandas de frecuencia y segmentos de tiempo, y para estas bandas de frecuencia y segmentos de tiempo, estimar la diferencia de intensidad entre canales (IID, inter channel intensity difference), y coherencia entre canales (ICC, inter channel coherence). El primer parámetro es una medición de la distribución de potencia entre los dos canales en la banda de frecuencia específica y el segundo parámetro es una estimación de la correlación entre los dos canales para la banda de frecuencia específica. En el lado del descodificador, la imagen estéreo se recrea a partir de la señal mono distribuyendo la señal mono entre los dos canales de salida según los datos IID, y sumando una señal descorrelacionada con el fin de conservar la correlación de canales de los canales estéreo originales.
Para un caso multicanal (significando multicanal en este contexto más de dos canales de salida), tienen que tomarse en cuenta varios problemas adicionales. Existen diversas configuraciones multicanal. La más comúnmente conocida es la configuración 5.1 (canal central, delantero izquierdo/derecho, envolvente izquierdo/derecho, y el canal LFE). Sin embargo, existen muchas otras configuraciones. Desde el punto de vista de sistemas de codificador/descodificador completos, es deseable tener un sistema que pueda utilizar el mismo conjunto de parámetros (por ejemplo, IID e ICC) o subconjuntos de los mismos para todas las configuraciones de canales. ITU-R BS.775 define varios esquemas de downmix (esquemas de conversión de señal envolvente a señal mono o estéreo) que pueden obtener una configuración de canales que comprende menos canales a partir de una configuración de canales dada. En lugar de tener que descodificar siempre todos los canales y basarse en un downmix, puede ser deseable tener una representación multicanal que permita a un receptor extraer de antemano los parámetros relevantes para la configuración de canales, antes de descodificar los canales. Además, es deseable un conjunto de parámetros escalable de manera inherente desde un punto de vista de codificación embebida o escalable, en el que es posible, por ejemplo, almacenar los datos correspondientes a los canales envolventes en una capa de mejora en el flujo de bits.
Contrariamente a lo anterior, también puede ser deseable poder utilizar diferentes definiciones de parámetros basándose en las características de la señal que está procesándose, con el fin de conmutar entre la parametrización que da como resultado la sobrecarga de tasa de bits más baja para el segmento de señal actual que está procesándose.
Otra representación de señales multicanal utilizando una señal de suma o señal de downmix e información lateral paramétrica adicional se conoce en la técnica como codificación de indicación binaural (BCC, binaural cue coding). Esta técnica se describe en "Binaural Cue Coding - Part 1: Psycho-Acoustic Fundamentals and Design Principles", IEE Transactions on Speech and Audio Processing, volumen 11, número 6, noviembre de 2003, F. Baumgarte, C. Faller, y "Binaural Cue Coding. Part II: Schemes and Applications", IEEE Transactions on Speech and Audio Processing volumen 11, número 6, noviembre de 2003, C. Faller y F. Baumgarte.
Generalmente, la codificación de indicación binaural es un método para la interpretación espacial multicanal basándose en un canal de audio de downmix e información lateral. Varios parámetros que van a calcularse mediante un codificador BCC y que van a utilizarse por un descodificador BCC para la reconstrucción de audio o la interpretación de audio incluyen diferencias de nivel entre canales, diferencias de tiempo entre canales, y parámetros de coherencia entre canales. Estas indicaciones entre canales son el factor determinante para la percepción de una imagen espacial. Estos parámetros se dan para bloques de muestras de tiempo de la señal multicanal original y también se dan como selectivos en función de las frecuencias de tal modo que cada bloque de muestras de señal multicanal presenta varias indicaciones para varias bandas de frecuencia. En el caso general de canales C de reproducción, las diferencias de nivel entre canales y las diferencias de tiempo entre canales se consideran en cada subbanda entre pares de canales, es decir, para cada canal respecto a un canal de referencia. Un canal se define como el canal de referencia para cada diferencia de nivel entre canales. Con las diferencias de nivel entre canales y las diferencias de tiempo entre canales, es posible interpretar una fuente hacia cualquier dirección entre uno de los pares de altavoces de una disposición de reproducción que se utiliza. Para determinar el ancho o el carácter difuso de una fuente interpretada, es suficiente considerar un parámetro por subbanda para todos los canales de audio. Este parámetro es el parámetro de coherencia entre canales. El ancho de la fuente interpretada se controla modificando las señales de subbanda de tal modo que todos los posibles pares de canales presentan el mismo parámetro de coherencia entre canales.
En la codificación BCC, todas las diferencias de nivel entre canales se determinan entre el canal 1 de referencia y cualquier otro canal. Cuando, por ejemplo, se determina que el canal central es el canal de referencia, se calculan una primera diferencia de nivel entre canales entre el canal izquierdo y el canal central, una segunda diferencia de nivel entre canales entre el canal derecho y el canal central, una tercera diferencia de nivel entre canales entre el canal envolvente izquierdo y el canal central, y una cuarta diferencia de nivel entre canales entre el canal envolvente izquierdo y el canal central. Este escenario describe un esquema de cinco canales. Cuando el esquema de cinco canales incluye adicionalmente un canal de mejora de bajas frecuencias, que también se conoce como un canal "de altavoz de graves" ("sub-woofer"), se calcula una quinta diferencia de nivel entre canales entre el canal de mejora de bajas frecuencias y el canal central, que es el único canal de referencia.
Cuando se reconstruye la señal multicanal original utilizando el canal de downmix único, que también se denomina como el canal "mono", y las indicaciones transmitidas tales como ICLD (diferencia de nivel entre canales, Interchannel Level Difference), ICTD (diferencia de tiempo entre canales, Interchannel Time Difference) e ICC (coherencia entre canales, Interchannel Coherente), los coeficientes espectrales de la señal mono se modifican utilizando estas indicaciones. La modificación de nivel se realiza utilizando un número real positivo que determina la modificación de nivel para cada coeficiente espectral. La diferencia de tiempo entre canales se genera utilizando un número complejo de magnitud de uno que determina una modificación de fase para cada coeficiente espectral. Otra función determina la influencia de la coherencia. Los factores para las modificaciones de nivel de cada canal se calculan calculando en primer lugar el factor para el canal de referencia. El factor para el canal de referencia se calcula de manera que para cada partición de frecuencia, la suma de la potencia de todos los canales es la misma que la potencia de la señal de suma. Entonces, basándose en el factor de modificación de nivel para el canal de referencia, se calculan los factores de modificación de nivel para los otros canales utilizando los parámetros ICLD respectivos.
Por tanto, con el fin de realizar síntesis BCC, ha de calcularse el factor de modificación de nivel para el canal de referencia. Para este cálculo, son necesarios todos los parámetros ICLD para una banda de frecuencia. Entonces, basándose en esta modificación de nivel para el canal único, pueden calcularse los factores de modificación de nivel para los otros canales, es decir, los canales que no son el canal de referencia.
Este enfoque no es ventajoso porque, para una reconstrucción perfecta, se necesita todas y cada una de las diferencias de nivel entre canales. Este requisito es incluso más problemático cuando está presente un canal de transmisión propenso a errores. Cada error dentro de una diferencia de nivel entre canales transmitida dará como resultado un error en la señal multicanal reconstruida, puesto que se requiere cada diferencia de nivel entre canales para calcular cada una de las señales de salida multicanal. Adicionalmente, no es posible la reconstrucción cuando se ha perdido durante la transmisión una diferencia de nivel entre canales, aunque esta diferencia de nivel entre canales sólo sea necesaria para, por ejemplo, el canal envolvente izquierdo o el canal envolvente derecho, canales que no son muy importantes para la reconstrucción multicanal, puesto que la mayoría de la información está incluida en el canal delantero izquierdo, al que posteriormente se le llama el canal izquierdo, en el canal delantero derecho, al que posteriormente se le llama el canal derecho, o en el canal central. Esta situación se vuelve incluso peor cuando la diferencia de nivel entre canales del canal de mejora de bajas frecuencias se ha perdido durante la transmisión. En esta situación, no es posible ninguna o sólo una reconstrucción multicanal errónea, aunque el canal de mejora de bajas frecuencias no es tan decisivo para la comodidad de escucha de los oyentes. Por tanto, los errores en una única diferencia de nivel entre canales se propagan a errores dentro de cada uno de los canales de salida reconstruidos.
Adicionalmente, el esquema BCC existente, que también se describe en el documento 5574 de la convención AES, "Binaural Cue Coding applied to Stereo and Multi-channel Audio Compression", C. Faller, F. Baumgarte, 10 a 13 de mayo de 2002, Munich, Alemania, no es tan adecuado cuando se considera un escenario de escucha intuitivo debido al canal de referencia único. No es natural para un ser humano, lo que es, por supuesto, el fin último del procesamiento de audio completo, que todo se refiera a un canal de referencia único. En su lugar, un ser humano tiene dos oídos, que están situados en lados diferentes de la cabeza de un ser humano. Por tanto, una impresión de escucha natural de un ser humano es si una señal se equilibra más hacia la izquierda o más hacia la derecha, o se equilibra entre la parte delantera y la parte trasera. Contrariamente a lo anterior, no es natural para un ser humano sentir si una cierta fuente de sonido en el campo de audición está en un cierto equilibrio entre cada altavoz con respecto a un altavoz de referencia único. Esta divergencia entre la impresión de escucha natural, por un lado, y el modelo matemático/físico de BCC, por otro lado, puede llevar a consecuencias negativas del esquema de codificación, cuando se consideran requisitos de tasa de bits, requisitos de escalabilidad, requisitos de flexibilidad, requisitos de artefactos de reconstrucción, o requisitos de robustez ante errores.
Otra técnica de codificación estéreo se da a conocer por J. Herre et al: "INTENSITY STEREO CODING" PREPRINTS OF PAPERS PRESENTED AT THE AES CONVENTION, volumen 96, nº 3799, 26 de febrero de 1994 (26-02-1994), páginas 1 a 10, XP009025131.
Sumario de la invención
Es un objetivo de la presente invención proporcionar un concepto mejorado para presentar señales de audio multicanal.
Este objetivo se consigue mediante un aparato para generar una representación de parámetros de una señal de entrada multicanal según la reivindicación 1, un aparato para generar una representación multicanal reconstruida según la reivindicación 16, un método según las reivindicaciones 23 ó 24, un programa informático según la reivindicación 25, o una representación de parámetros según la reivindicación 26.
La presente invención se basa en el descubrimiento de que, para una representación multicanal, hay de basarse en parámetros de equilibrio entre pares de canales. Adicionalmente, se ha descubierto que es posible una representación de parámetros de señal multicanal proporcionando al menos dos parámetros de equilibrio diferentes que indican un equilibrio entre dos pares de canales diferentes. En particular, la flexibilidad, escalabilidad, robustez ante errores, e incluso la eficacia de tasa de bits son el resultado del hecho de que el primer par de canales, que es la base para el primer parámetro de equilibrio, sea diferente del segundo par de canales, que es la base para el segundo parámetro de equilibrio, donde los cuatro canales que forman estos pares de canales son todos diferentes entre sí.
Por tanto, el concepto inventivo se aparta del concepto de canal de referencia único y utiliza un concepto de multiequilibrio o superequilibrio, que es más intuitivo y más natural para la impresión de sonido de un ser humano. En particular, los pares de canales que subyacen a los primeros y segundos parámetros de equilibrio pueden incluir canales originales, canales de downmix o preferiblemente, ciertas combinaciones entre canales de entrada.
Se ha descubierto que un parámetro de equilibrio derivado a partir del canal central como el primer canal y una suma del canal original izquierdo y el canal original derecho como el segundo canal del par de canales es especialmente útil para proporcionar una distribución de energía exacta entre el canal central y los canales izquierdo y derecho. Ha de observarse en este contexto que estos tres canales normalmente incluyen la mayoría de la información de la escena de audio, en el que particularmente la localización estéreo izquierda-derecha no sólo está influenciada por el equilibrio entre izquierda y derecha sino también por el equilibrio entre el centro y la suma de izquierda y derecha. Esta observación se refleja utilizando este parámetro de equilibrio según una realización preferida de la presente invención.
Preferiblemente, cuando se transmite una única señal de downmix mono, se ha descubierto que, además del parámetro de equilibrio centro/izquierdo más derecho, un parámetro de equilibrio izquierdo/derecho, un parámetro de equilibrio posterior izquierdo/posterior derecho, y un parámetro de equilibrio delantero/trasero son una solución óptima para una representación de parámetros eficaz en la tasa de bits, que es flexible, robusta ante errores y en gran medida está libre de artefactos.
En el lado del receptor, a diferencia de la síntesis BCC en la que cada canal se calcula sólo mediante la información transmitida, la representación multiequilibrio inventiva hace uso adicionalmente de información sobre el esquema de downmix utilizado para generar el (los) canal(es) de downmix. Por tanto, según la presente invención, la información sobre el esquema de downmix, que no se utiliza en sistemas de la técnica anterior, también se utiliza para realizar upmix (conversión de señal mono o estéreo en señal envolvente) además del parámetro de equilibrio. Por lo tanto, la operación de upmix se realiza de tal manera que el equilibrio entre los canales dentro de una señal multicanal reconstruida que forma un par de canales para un parámetro de equilibrio se determina mediante el parámetro de equilibrio.
Este concepto, es decir, presentar diferentes pares de canales para diferentes parámetros de equilibrio, hace posible generar algunos canales sin el conocimiento de todos y cada uno de los parámetros de equilibrio transmitidos. En particular, según la presente invención, los canales izquierdo, derecho y central pueden reconstruirse sin ningún conocimiento sobre algún equilibrio trasero izquierdo/trasero derecho o sin ningún conocimiento sobre un equilibrio delantero/trasero. Este efecto permite la escalabilidad afinada muy precisa, ya que extraer un parámetro adicional de un flujo de bits o transmitir un parámetro de equilibrio adicional a un receptor permite por consiguiente la reconstrucción de uno o más canales adicionales. Esto se deferencia del sistema de referencia única de la técnica anterior, en el que se necesitaban todas y cada una de las diferencias de nivel entre canales para reconstruir todos o sólo un subgrupo de todos los canales de salida reconstruidos.
El concepto inventivo también es flexible porque la elección de los parámetros de equilibrio puede adaptarse a un cierto entorno de reconstrucción. Por ejemplo, cuando una disposición de cinco canales forma la disposición de señal multicanal original, y cuando una disposición de cuatro canales forma una disposición multicanal de reconstrucción, que presenta sólo un único altavoz envolvente, que está situado por ejemplo detrás del oyente, un parámetro de equilibrio delantero-trasero permite calcular el canal envolvente combinado sin ningún conocimiento sobre el canal envolvente izquierdo y el canal envolvente derecho. Esto se diferencia de un sistema de canal de referencia único, en el que se tiene que extraer una diferencia de nivel entre canales para el canal envolvente izquierdo y una diferencia de nivel entre canales para el canal envolvente derecho a partir del flujo de datos. Entonces, se tiene que calcular el canal envolvente izquierdo y el canal envolvente derecho. Finalmente, se tienen que sumar ambos canales para obtener el canal de altavoz envolvente único para una disposición de reproducción de cuatro canales. Todas estas etapas no tienen que realizarse en la representación de parámetros de equilibrio más dirigida al usuario y más intuitiva, ya que esta representación entrega automáticamente el canal envolvente combinado debido a la representación de parámetros de equilibrio, que no está ligada a un canal de referencia único, sino que también permite utilizar una combinación de canales originales como un canal de un par de canales de parámetros de equilibrio.
La presente invención se refiere al problema de una representación multicanal parametrizada de señales de audio. Proporciona una manera eficaz de definir los parámetros apropiados para la representación multicanal y también la capacidad de extraer los parámetros que representan la configuración de canales deseada sin tener que descodificar todos los canales. La invención resuelve además el problema de elegir la configuración de parámetros óptima para un segmento de señal dado con el fin de minimizar la tasa de bits requerida para codificar los parámetros espaciales para el segmento de señal dado. La presente invención también expone cómo aplicar previamente los métodos de descorrelación sólo aplicables para el caso de dos canales en un entorno multicanal general.
En realizaciones preferidas la presente invención comprende las siguientes características:
- realizar downmix sobre la señal multicanal para obtener una representación de uno o dos canales en el lado de los codificadores;
- dada la señal multicanal, definir los parámetros que representan las señales multicanal, de manera o bien flexible o bien por trama con el fin de minimizar la tasa de bits o con el fin de permitir al descodificador extraer la configuración de canales en un nivel de flujo de bits;
- en el lado del descodificador, extraer el conjunto de parámetros relevantes dada la configuración de canales soportada actualmente por el descodificador;
- crear el número requerido de señales mutuamente descorrelacionadas dada la presente configuración de canales;
- recrear las señales de salida dado el conjunto de parámetros descodificados a partir de los datos de flujo de bits y las señales descorrelacionadas.
- definición de una parametrización de la señal de audio multicanal, de tal manera que los mismos parámetros o un subconjunto de los parámetros pueden utilizarse independientemente de la configuración de canales.
- definición de una parametrización de la señal de audio multicanal, de tal manera que los parámetros pueden utilizarse en un esquema de codificación escalable, en el que se transmiten subconjuntos del conjunto de parámetros en diferentes capas del flujo escalable.
- definición de una parametrización de la señal de audio multicanal, de tal manera que la reconstrucción de energía de las señales de salida del descodificador no se ve afectada por el códec de audio subyacente utilizado para codificar la señal de downmix.
- conmutación entre diferentes parametrizaciones de la señal de audio multicanal, de tal manera que se minimiza la sobrecarga de tasa de bits para codificar la parametrización.
- definición de una parametrización de la señal de audio multicanal, en la que se incluye un parámetro que representa el factor de corrección de energía para la señal de downmix.
- utilización de varios descorreladores mutuamente descorrelacionados para recrear la señal multicanal.
- recrear la señal multicanal a partir de una matriz H de upmix que se calcula basándose en el conjunto de parámetros transmitidos.
Breve descripción de los dibujos
La presente invención se describirá a continuación a modo de ejemplos ilustrativos que no limitan el alcance o espíritu de la invención, con referencia a los dibujos adjuntos, en los que:
la figura 1 ilustra una nomenclatura utilizada para una configuración de 5,1 canales tal como se utiliza en la presente invención;
la figura 2 ilustra una posible implementación de codificador de la presente invención;
la figura 3 ilustra una posible implementación de descodificador de la presente invención;
la figura 4 ilustra una parametrización preferida de la señal multicanal según la presente invención;
la figura 5 ilustra una parametrización preferida de la señal multicanal según la presente invención;
la figura 6 ilustra una parametrización preferida de la señal multicanal según la presente invención;
la figura 7 ilustra una disposición esquemática para un esquema de downmix que genera un canal base único o dos canales base;
la figura 8 ilustra una representación esquemática de un esquema de upmix, que se basa en los parámetros de equilibrio inventivos y en información sobre el esquema de downmix;
la figura 9a ilustra una determinación de un parámetro de nivel en un lado de codificador;
la figura 9b ilustra la utilización del parámetro de nivel en el lado del codificador;
la figura 10a ilustra un flujo de bits escalable que presenta diferentes partes de la parametrización multicanal en diferentes capas del flujo de bits;
la figura 10b ilustra una tabla de escalabilidad que indica qué canales pueden construirse utilizando qué parámetros de equilibrio, y qué parámetros de equilibrio y canales no se utilizan o calculan; y
la figura 11 ilustra la aplicación de la matriz de upmix según la presente invención.
Descripción de realizaciones preferidas
Las realizaciones descritas posteriormente son meramente ilustrativas para los principios de la presente invención sobre representación multicanal de señales de audio. Se entiende que las modificaciones y variaciones de las disposiciones y los detalles descritos en el presente documento serán evidentes para otros expertos en la técnica. Por lo tanto, la intención es estar limitada sólo por el alcance de las reivindicaciones de patente inminentes y no por los detalles específicos presentados a modo de descripción y explicación de las realizaciones del presente documento.
En la siguiente descripción de la presente invención que expone cómo parametrizar parámetros IID e ICC y cómo aplicarlos con el fin de recrear una representación multicanal de señales de audio, se supone que todas las señales a las que se hace referencia son señales de subbanda en un banco de filtros o alguna otra representación selectiva en función de la frecuencia de una parte del intervalo total de frecuencia para el canal correspondiente. Por lo tanto, se entiende que la presente invención no se limita a un banco de filtros específico, y que la presente invención se expone posteriormente para una banda de frecuencia de la representación de subbandas de la señal, y que las mismas operaciones se aplican a todas las señales de subbanda.
Aunque un parámetro de equilibrio también se denomina un parámetro de "diferencia de intensidad entre canales (IDD)", ha de resaltarse que un parámetro de equilibrio entre un par de canales no tiene necesariamente que ser la relación entre la energía o intensidad en el primer canal del par de canales y la energía o intensidad del segundo canal en el par de canales. Generalmente, el parámetro de equilibrio indica la localización de una fuente de sonido entre los dos canales del par de canales. Aunque esta localización viene dada normalmente por diferencias de energía/nivel/intensidad, pueden utilizarse otras características de una señal tales como una medida de potencia para ambos canales o envolventes de frecuencia o tiempo de los canales, etc.
En la figura 1 se visualizan los diferentes canales para una configuración de 5,1 canales, donde a(t) 101 representa el canal envolvente izquierdo, b(t) 102 representa el canal delantero izquierdo, c(t) 103 representa el canal central, d(t) 104 representa el canal delantero derecho, e(t) 105 representa el canal envolvente derecho y f(t) 106 representa el canal LFE (efectos de bajas frecuencias, low frequency effects).
Suponiendo que el operador de esperanza se define como
1
y por tanto las energías para los canales expuestos anteriormente pueden definirse según (mostrado a modo de ejemplo en este caso mediante el canal envolvente izquierdo):
2
En el lado del codificador se realiza downmix sobre los cinco canales para obtener una representación de dos canales o una representación de un canal. Esto puede realizarse de varias maneras y una comúnmente utilizada es el downmix ITU definido según:
el downmix de 5,1 a dos canales:
3
y el downmix de 5,1 a un canal:
4
Valores utilizados comúnmente para las constantes \alpha, \beta, \gamma y \delta son
5
Los parámetros IID se definen como relaciones de energía de dos canales elegidos arbitrariamente o grupos de canales ponderados. Dadas las energías de los canales expuestos anteriormente para la configuración de 5,1 canales pueden definirse varios conjuntos de parámetros IID.
La figura 7 indica un elemento 700 de downmix general que utiliza las ecuaciones a las que se hizo referencia anteriormente para calcular un canal m único o dos canales I_{d} y r_{d} preferiblemente estéreo. Generalmente, el elemento de downmix utiliza cierta información de downmix. En la realización preferida de un downmix lineal, esta información de downmix incluye factores de ponderación \alpha, \beta, \gamma y \delta. En la técnica se conoce que pueden utilizarse factores de ponderación más o menos constantes o no constantes.
En un downmix recomendado por ITU, \alpha se fija a 1, \beta y \gamma se fijan para que sean iguales e iguales a la raíz cuadrada de 0,5, y \delta se fija a 0. Generalmente, el factor \alpha puede variar entre 1,5 y 0,5. Adicionalmente, los factores \beta y \gamma pueden ser diferentes entre sí y variar entre 0 y 1. Lo mismo se cumple para el canal f(t) de mejora de bajas frecuencias. El factor \delta para este canal puede variar entre 0 y 1. Adicionalmente, los factores para el downmix izquierdo y el downmix derecho no tienen que ser iguales entre sí. Esto se vuelve claro cuando se considera un downmix no automático que, por ejemplo, realiza un ingeniero de sonido. El ingeniero de sonido se dedica más a realizar un downmix creativo más que un downmix que se guía por cualquier ley matemática. En su lugar, el ingeniero de sonido se guía por su propio sentimiento creativo. Cuando este downmix "creativo" se graba por un cierto conjunto de parámetros, se utilizará según la presente invención mediante un elemento de upmix inventivo tal como se muestra en la figura 8, que no sólo se guía por los parámetros, sino también por la información adicional sobre el esquema de downmix.
Cuando se ha realizado un downmix lineal tal como en la figura 7, los parámetros de ponderación son la información preferida sobre el esquema de downmix para utilizarse por el elemento de upmix. Sin embargo, cuando está presente otra información, que se utiliza en el esquema de downmix, también puede utilizarse esta otra información por un elemento de upmix como la información sobre el esquema de downmix. Tal otra información puede, por ejemplo, ser ciertos elementos de matriz o ciertos factores o funciones dentro de los elementos de matriz de una matriz de upmix tal como, por ejemplo, se indica en la figura 11.
Dada la configuración de 5,1 canales expuesta en la figura 1 y observando cómo otras configuraciones de canales se relacionan con la configuración de 5,1 canales para un caso de tres canales en el que no hay disponible ningún canal envolvente, es decir, B, C y D están disponibles según la notación anterior. Para una configuración de cuatro canales, B, C y D están disponibles pero también una combinación de A y E que representa el canal envolvente único, o denotado más comúnmente denominado en este contexto, el canal trasero.
La presente invención define parámetros IID que se aplican a todos estos canales, es decir, el subconjunto de cuatro canales de la configuración de 5,1 canales presenta un subconjunto correspondiente dentro del conjunto de parámetros IID que describe los 5,1 canales. El siguiente conjunto de parámetros IID resuelve este problema:
6
60
Es evidente que el parámetro r_{1} corresponde a la relación de energía entre el canal de downmix izquierdo y el canal de downmix derecho. El parámetro r_{2} corresponde a la relación de energía entre el canal central y los canales delanteros izquierdo y derecho. El parámetro r_{3} corresponde a la relación de energía entre los tres canales delanteros y los dos canales envolventes. El parámetro r_{4} corresponde a la relación de energía entre los dos canales envolventes. El parámetro r_{5} corresponde a la relación de energía entre el canal LFE y todos los demás canales.
En la figura 4 se ilustran las relaciones de energía tal como se explicó anteriormente. Los diferentes canales de salida se indican por 101 a 105 y son los mismos que en la figura 1 y por tanto no se detallan adicionalmente en este momento. La disposición de altavoces está dividida en una mitad izquierda y una derecha, en la que el canal 103 central es parte de ambas mitades. La relación de energía entre el plano de la mitad izquierda y el plano de la mitad derecha es exactamente el parámetro denominado como r_{1} según la presente invención. Esto se indica mediante la línea continua por debajo de r_{1} en la figura 4. Además, la distribución de energía entre el canal 103 central y el canal 102 delantero izquierdo y el canal 103 delantero derecho se indica por r_{2} según la presente invención. Finalmente, la distribución de energía entre toda la disposición de canales delanteros (102, 103 y 104) y los canales traseros (101 y 105) se ilustra mediante la flecha en la figura 5 por el parámetro r_{3}.
Dada la parametrización anterior y la energía del canal de downmix único transmitido:
7
las energías de los canales reconstruidos pueden expresarse como:
8
9
Por tanto, la energía de la señal M puede distribuirse a los canales reconstruidos dando como resultado canales reconstruidos que presentan las mismas energías que los canales originales.
El esquema anterior preferido de upmix se ilustra en la figura 8. Se vuelve claro a partir de las ecuaciones para F, A, E, C, B y D que la información sobre el esquema de downmix que va a utilizarse por el elemento de upmix son los factores \alpha, \beta, \gamma y \delta de ponderación, que se utilizan para ponderar los canales originales antes de que tales canales ponderados o no ponderados se sumen juntos o se resten entre sí con el fin de llegar a un número de canales de downmix, que es menor que el número de canales originales. Por tanto, a partir de la figura 8 está claro que según la presente invención, las energías de los canales reconstruidos no sólo se determinan por los parámetros de equilibrio transmitidos desde un lado de codificador a un lado de descodificador, sino que también se determinan por el factor \alpha, \beta, \gamma y \delta de downmix.
Cuando se considera la figura 8, se vuelve claro que, para calcular las energías B y D izquierda y derecha, las energías F, A, E, C de canales ya calculadas se utilizan dentro de la ecuación. Sin embargo, esto no implica necesariamente un esquema de upmix secuencial. En su lugar, para obtener un esquema de upmix completamente paralelo que, por ejemplo, se realiza utilizando una cierta matriz de upmix que presenta ciertos elementos de matriz de upmix, las ecuaciones para A, C, E y F se insertan en las ecuaciones B y D. Por tanto, se vuelve claro que la energía de canales reconstruidos sólo se determina por los parámetros de equilibrio, el (los) canal(es) de downmix y la información sobre el esquema de downmix tal como los factores de downmix.
Dados los parámetros IID anteriores es evidente que se ha resuelto el problema de definir un conjunto de parámetros de parámetros IID que puede utilizarse para varias configuraciones de canales tal como será obvio a partir de lo comentado posteriormente. Como un ejemplo, observando la configuración de tres canales (es decir, recreando tres canales delanteros a partir de un canal disponible), es evidente que los parámetros r_{3}, r_{4} y r_{5} están obsoletos puesto que los canales A, E y f no existen. También es evidente que los parámetros r_{1} y r_{2} son suficientes para recrear los tres canales a partir de un canal único de downmix ya que r_{1} describe la relación de energía entre los canales delanteros izquierdo y derecho, y r_{2} describe la relación de energía entre el canal central y los canales delanteros izquierdo y derecho.
En el caso más general se observa fácilmente que los parámetros IID (r_{1}...r_{5}), tal como se definieron anteriormente, se aplican a todos los subconjuntos de recreación de n canales a partir de m canales donde m<n\leq6. Observando la figura 4 puede decirse que:
- para un sistema que recrea 2 canales a partir de 1 canal, se obtiene suficiente información a partir del parámetro r_{1} para conservar la relación de energía correcta entre los canales;
- para un sistema que recrea 3 canales a partir de 1 canal, se obtiene suficiente información a partir de los parámetros r_{1} y r_{2} para conservar la relación de energía correcta entre los canales;
- para un sistema que recrea 4 canales a partir de 1 canal, se obtiene suficiente información a partir de los parámetros r_{1}, r_{2} y r_{3} para conservar la relación de energía correcta entre los canales;
- para un sistema que recrea 5 canales a partir de 1 canal, se obtiene suficiente información a partir de los parámetros r_{1}, r_{2}, r_{3} y r_{4} para conservar la relación de energía correcta entre los canales;
- para un sistema que recrea 5,1 canales a partir de 1 canal, se obtiene suficiente información a partir de los parámetros r_{1}, r_{2}, r_{3}, r_{4} y r_{5} para conservar la relación de energía correcta entre los canales;
- para un sistema que recrea 5,1 canales a partir de 2 canales, se obtiene suficiente información a partir de los parámetros r_{2}, r_{3}, r_{4} y r_{5} para conservar la relación de energía correcta entre los canales.
La característica de escalabilidad descrita anteriormente se ilustra mediante la tabla en la figura 10b. El flujo de bits escalable ilustrado en la figura 10a y explicado posteriormente también puede adaptarse a la tabla de la figura 10b para obtener una escalabilidad más precisa que la mostrada en la figura 10a.
El concepto inventivo es especialmente ventajoso porque los canales izquierdo y derecho pueden reconstruirse fácilmente a partir de un único parámetro r_{1} de equilibrio sin conocimiento o extracción de cualquier otro parámetro de equilibrio. Con este fin, en las ecuaciones para B, D en la figura 8, los canales A, C, F y E se fijan simplemente a cero.
Como alternativa, cuando sólo se considera el parámetro r_{2} de equilibrio, los canales reconstruidos son por un lado la suma entre el canal central y el canal de bajas frecuencias (cuando este canal no se fija a cero) y por otro lado la suma entre los canales izquierdo y derecho. Por tanto, el canal central por un lado y la señal mono por otro lado pueden reconstruirse utilizando sólo un único parámetro. Esta característica ya puede ser útil para una representación de 3 canales sencilla, en la que las señales izquierda y derecha se derivan a partir de la suma de la parte izquierda y la parte derecha dividida por dos, y en la que la energía entre la parte central y la suma de la parte izquierda y la parte derecha se determina exactamente por el parámetro r_{2} de equilibrio.
En este contexto, los parámetros r_{1} y r_{2} de equilibrio se sitúan en una capa de escalado inferior.
\newpage
En cuanto a la segunda entrada en la tabla de la figura 10b, que indica cómo pueden generarse 3 canales B, D y la suma entre C y F utilizando sólo dos parámetros de equilibrio en lugar de todos los 5 parámetros de equilibrio, uno de esos parámetros r_{1} y r_{2} ya puede estar en una capa de escalado superior que el parámetro r_{1} o r_{2}, que está situado en la capa de escalado inferior.
Cuando se consideran las ecuaciones en la figura 8, se vuelve claro que, para calcular C, el parámetro r_{5} no extraído y el otro parámetro r_{3} no extraído se fijan a cero. Adicionalmente, los canales A, E, F no utilizados también se fijan a 0, de tal modo que pueden calcularse los 3 canales B, D y la combinación entre el canal C central y el canal F de mejora de bajas frecuencias.
Cuando va a realizarse upmix sobre una representación de 4 canales, es suficiente extraer sólo los parámetros r_{1}, r_{2} y r_{3} del flujo de datos de parámetros. En este contexto, r_{3} podría estar en una capa de escalado próxima superior que el otro parámetro r_{1} o r_{2}. La configuración de 4 canales es especialmente adecuada en conexión con la representación de parámetros de superequilibrio de la presente invención puesto que, tal como se describirá posteriormente en conexión con la figura 6, el tercer parámetro r_{3} de equilibrio ya se deriva a partir de una combinación de los canales delanteros por un lado y los canales traseros por otro lado. Esto se debe al hecho de que el parámetro r_{3} es un parámetro de equilibrio delantero-trasero, que se deriva a partir del par de canales que presenta, como un primer canal, una combinación de los canales A y E traseros, y que presenta, como los canales delanteros, una combinación del canal B izquierdo, el canal E derecho, y el canal C central.
Por tanto, la energía del canal combinado de ambos canales envolventes se obtiene automáticamente sin ningún cálculo aparte y combinación posterior, tal como sería el caso en una disposición de canal de referencia único.
Cuando tienen que recrearse 5 canales a partir de un canal único, es necesario el parámetro r_{4} de equilibrio adicional. Este parámetro r_{4} puede de nuevo estar en una capa de escalado próxima superior.
Cuando tiene que realizarse una reconstrucción 5.1, se requiere cada parámetro de equilibrio. Por tanto, una capa de escalado próxima superior que incluya el siguiente parámetro r_{5} de equilibrio tendrá que transmitirse a un receptor y evaluarse por el receptor.
Sin embargo, utilizando el mismo enfoque de ampliar los parámetros IID según el número ampliado de canales, los parámetros IID anteriores pueden ampliarse para cubrir configuraciones de canales con un número mayor de canales que la configuración 5.1. Por tanto, la presente invención no se limita a los ejemplos expuestos anteriormente.
Obsérvese ahora el caso en el que la configuración de canales es una configuración de 5,1 canales siendo éste uno de los casos más comúnmente utilizados. Además, supóngase que los 5,1 canales se recrean a partir de dos canales. Puede definirse para este caso un conjunto de parámetros diferente sustituyendo los parámetros r_{3} y r_{4} por:
10
\vskip1.000000\baselineskip
11
\vskip1.000000\baselineskip
Los parámetros q_{3} y q_{4} representan la relación de energía entre los canales izquierdos delantero y trasero, y la relación de energía entre los canales derechos delantero y posterior. Pueden preverse varias otras parametrizaciones.
En la figura 5 se visualiza la parametrización modificada. En lugar de tener un parámetro que representa la distribución de energía entre los canales delantero y trasero (tal como se representó mediante r_{3} en la figura 4) y un parámetro que describe la distribución de energía entre el canal envolvente izquierdo y el canal envolvente derecho (tal como se representó mediante r_{4} en la figura 4) los parámetros q_{3} y q_{4} se utilizan para describir la relación de energía entre el canal 102 delantero izquierdo y el canal 101 envolvente izquierdo, y la relación de energía entre el canal 104 delantero derecho y el canal 105 envolvente derecho.
La presente invención enseña que puedan utilizarse varios conjuntos de parámetros para representar las señales multicanal. Una característica adicional de la presente invención es que pueden elegirse diferentes parametrizaciones dependiendo del tipo de cuantificación de los parámetros que se utilice.
Como un ejemplo, en un sistema que utiliza cuantificación aproximada de la parametrización, debido a limitaciones de alta tasa de bits, debería utilizarse una parametrización que no amplificase errores durante el proceso de upmix.
\newpage
Obsérvense dos de las expresiones anteriores para las energías reconstruidas en un sistema que recrea 5,1 canales a partir de un canal:
12
\vskip1.000000\baselineskip
13
Es evidente que las restas pueden dar lugar a grandes variaciones de las energías B y D debido a efectos de cuantificación bastante pequeños de los parámetros M, A, C y F.
Según la presente invención, debería utilizarse una parametrización diferente que sea menos sensible a la cuantificación de los parámetros. Por tanto, si se utiliza cuantificación aproximada, el parámetro r_{1} tal como se definió anteriormente:
14
\vskip1.000000\baselineskip
puede sustituirse por la definición alternativa según:
15
\vskip1.000000\baselineskip
Esto da lugar a ecuaciones para las energías reconstruidas según:
16
\vskip1.000000\baselineskip
17
y las ecuaciones para las energías reconstruidas de A, E, C y F siguen siendo las mismas que anteriormente. Es evidente que esta parametrización representa un sistema mejor acondicionado desde un punto de vista de la cuantificación.
En la figura 6 se ilustran las relaciones de energía tal como se explicaron anteriormente. Los diferentes canales de salida se indican por 101 a 105 y son los mismos que en la figura 1 y por tanto no se detallan en este momento. La disposición de altavoces está dividida en una parte delantera y una parte trasera. La distribución de energía entre toda la disposición de canales (102, 103 y 104) delanteros y los canales (101 a 105) traseros se ilustra mediante la flecha en la figura 6 indicada por en parámetro r_{3}.
Otra característica notable e importante de la presente invención es que cuando se observa la parametrización
18
\vskip1.000000\baselineskip
19
no es sólo un sistema mejor acondicionado desde un punto de vista de la cuantificación. La parametrización anterior también tiene la ventaja de que los parámetros utilizados para reconstruir los tres canales delanteros se derivan sin ninguna influencia de los canales envolventes. Podría preverse un parámetro r_{2} que describa la relación entre el canal central y todos los demás canales. Sin embargo, esto tendría la desventaja de que los canales envolventes se incluirían en la estimación de los parámetros que describen los canales delanteros.
Recuérdese que, en la presente invención, la parametrización descrita también puede aplicarse a mediciones de correlación o coherencia entre canales, es evidente que incluir los canales traseros en el cálculo de r_{2} puede tener influencia negativa significativa en el éxito de recrear con precisión los canales delanteros.
Como ejemplo, podría imaginarse una situación con la misma señal en todos los canales delanteros y señales completamente no correlacionadas en los canales traseros. Esto no es infrecuente, dado que los canales posteriores se utilizan frecuentemente para recrear información de ambiente del sonido original.
Si el canal central se describe en relación a todos los demás canales, la medida de correlación entre el central y la suma de todos los demás canales será bastante baja, puesto que los canales traseros están completamente no correlacionados. Lo mismo será cierto para un parámetro que estima la correlación entre los canales delanteros izquierdo/derecho y los canales traseros izquierdo/derecho.
Por tanto, se llega a una parametrización que puede reconstruir las energías correctamente, pero que no incluye la información de que todos los canales delanteros fuesen idénticos, es decir, fuertemente correlacionados. Incluye la información de que los canales delanteros izquierdo y derecho están descorrelacionados con los canales posteriores, y que el canal central también está correlacionado con los canales posteriores. Sin embargo, el hecho de que todos los canales delanteros son los mismos no puede derivarse a partir de una parametrización de este tipo.
Esto se resuelve utilizando la parametrización
20
\vskip1.000000\baselineskip
21
tal como se enseña mediante la presente invención, puesto que los canales traseros no están incluidos en la estimación de los parámetros utilizados en el lado del descodificador para recrear los canales delanteros.
La distribución de energía entre el canal 103 central y el canal 102 delantero izquierdo y el canal 103 delantero derecho se indica por r_{2} según la presente invención. La distribución de energía entre el canal 101 envolvente izquierdo y el canal 105 envolvente derecho se ilustra por r_{4}. Finalmente, la distribución de energía entre el canal 102 delantero izquierdo y el canal 104 delantero derecho se da mediante r_{1}. Como es evidente, todos los parámetros son los mismos que los representados en la figura 4 aparte de r_{1} que en este caso corresponde a la distribución de energía entre el altavoz delantero izquierdo y el altavoz delantero derecho, como opuestos a todo el lado izquierdo y a todo el lado derecho. Para terminar, también se da el parámetro r5 que representa la distribución de energía entre el canal 103 central y el canal 106 lfe.
La figura 6 muestra una perspectiva general de la realización de parametrización preferida de la presente invención. El primer parámetro r_{1} de equilibrio (indicado por la línea continua) constituye un parámetro de equilibrio delantero izquierdo/delantero derecho. El segundo parámetro r_{2} de equilibrio es un parámetro de equilibrio izquierdo-derecho. El tercer parámetro r_{3} de equilibrio constituye un parámetro de equilibrio delantero/trasero. El cuarto parámetro r_{4} de equilibrio constituye un parámetro de equilibrio posterior izquierdo/posterior derecho. Finalmente, el quinto parámetro r_{5} de equilibrio constituye un parámetro de equilibrio centro/lfe.
La figura 4 muestra una situación relacionada. El primer parámetro r_{1} de equilibrio, que se ilustra en la figura 4 mediante líneas continuas en el caso de un equilibrio izquierdo/derecho de downmix puede sustituirse por un parámetro de equilibrio delantero izquierdo/delantero derecho original definido entre los canales B y D como el par de canales subyacentes. Esto se ilustra mediante la línea r_{1} discontinua en la figura 4 y corresponde a la línea r_{1} continua en la figura 5 y en la figura 6.
En una situación de dos canales base, los parámetros r_{3} y r_{4}, es decir, el parámetro de equilibrio delantero/trasero y el parámetro de equilibrio posterior izquierdo/derecho se sustituyen por dos parámetros delantero/posterior de un único lado. El primer parámetro q_{3} delantero/posterior de un único lado también puede denominarse como el primer parámetro de equilibrio, que se deriva a partir del par de canales que está constituido por el canal A envolvente izquierdo y el canal B izquierdo. El segundo parámetro de equilibrio delantero/izquierdo de un único lado es el parámetro q_{4}, que puede denominarse como el segundo parámetro, que se basa en el segundo par de canales que está constituido por el canal D derecho y el canal E envolvente derecho. De nuevo, ambos pares de canales son independientes entre sí. Lo mismo es cierto para el parámetro r_{2} de equilibrio centro/izquierdo-derecho, que presenta, como un primer canal, un canal C central, y como un segundo canal, la suma de los canales B y D izquierdo y derecho.
Otra parametrización que se presta adecuadamente para la cuantificación aproximada para un sistema que recrea 5,1 canales a partir de uno o dos canales se define posteriormente según la presente invención.
Para el caso de 1 a 5,1 canales:
22
\vskip1.000000\baselineskip
Y para el caso de dos a 5,1 canales:
23
Es evidente que las parametrizaciones anteriores incluyen más parámetros de lo que se requiere desde el punto de vista estrictamente teórico para redistribuir correctamente la energía de las señales transmitidas a las señales recreadas. Sin embargo, la parametrización es muy insensible a errores de cuantificación.
El conjunto de parámetros al que se hizo referencia anteriormente para una disposición de dos canales base, hace uso de varios canales de referencia. Sin embargo, a diferencia de la configuración de parámetros en la figura 6, el conjunto de parámetros en la figura 7 se basa únicamente en canales de downmix en vez de en canales originales como canales de referencia. Los parámetros q_{1}, q_{3} y q_{4} de equilibrio se derivan a partir de pares de canales completamente diferentes.
Aunque se han descrito varias realizaciones inventivas, en las que los pares de canales para derivar parámetros de equilibrio incluyen sólo canales originales (figura 4, figura 5, figura 6) o incluyen canales originales así como canales de downmix (figura 4, figura 5) o únicamente se basan en canales de downmix como los canales de referencia tal como se indica en la parte inferior de la figura 7, se prefiere que el generador de parámetros incluido dentro del codificador 206 de datos envolventes de la figura 2 esté operativo para utilizar sólo canales originales o combinaciones de canales originales en lugar de un canal base o una combinación de canales base para los canales en los pares de canales, en los que se basan los parámetros de equilibrio. Esto se debe al hecho de que no puede garantizarse completamente que no se producirá un cambio de energía para el único canal base o los dos canales base estéreo durante su transmisión desde un codificador envolvente hasta un descodificador envolvente. Tales variaciones de energía para los canales de downmix o el canal de downmix único pueden provocarse por un codificador 205 de audio (figura 2) o un descodificador 302 de audio (figura 3) que funcionan bajo una condición de tasa de bits baja. Tales situaciones pueden dar como resultado la manipulación de la energía del canal de downmix mono o los canales de downmix estéreo, manipulación que puede ser diferente entre los canales de downmix estéreo izquierdo y derecho, o incluso puede ser selectivo en función de la frecuencia y en función del tiempo.
Con el fin de estar completamente seguro frente a tales variaciones de energía, se transmite un parámetro de nivel adicional para cada bloque y banda de frecuencia para todos los canales de downmix según la presente invención. Cuando los parámetros de equilibrio se basan en la señal original en lugar de en la señal de downmix, un factor de corrección único es suficiente para cada banda, puesto que cualquier corrección de energía no influirá en una situación de equilibrio entre los canales originales. Incluso cuando no se transmite ningún parámetro de nivel adicional, cualquier variación de energía de canal de downmix no dará como resultado una ubicación distorsionada de fuentes de sonido en la imagen de audio sino que sólo dará como resultado una variación de sonoridad general, que no es tan desagradable como una migración de una fuente de sonido provocada por condiciones de equilibrio variables.
Es importante observar que se necesita tener cuidado de tal modo que la energía M (de los canales de downmix), sea la suma de las energías B, D, A, E, C y F tal como se expuso anteriormente. Este no es siempre el caso debido a dependencias de fase entre los diferentes canales sobre los que se está realizando downmix para obtener un canal. El factor de corrección de energía puede transmitirse como un parámetro r_{M} adicional, y la energía de la señal de downmix recibida en el lado del descodificador se define por tanto como:
24
En la figura 9 se representa la aplicación del parámetro r_{M} adicional. La señal de entrada de downmix se modifica por el parámetro r_{M} en 901 antes de enviarla hacia los módulos 701 a 705 de upmix. Éstos son los mismos que en la figura 7 y por lo tanto no se detallarán en lo sucesivo. Para los expertos en la técnica es obvio que el parámetro rM para el ejemplo de downmix de canal único anterior puede ampliarse a un parámetro por canal de downmix, y, por tanto, no está limitado a un canal de downmix único.
La figura 9a ilustra un calculador 900 de parámetro de nivel inventivo, mientras que la figura 9b indica un corrector 902 de nivel inventivo. La figura 9a indica la situación en el lado del codificador y la figura 9b ilustra la situación correspondiente en el lado del descodificador. El parámetro de nivel o parámetro r_{M} "adicional" es un factor de corrección que da una cierta relación de energía. Para explicar esto, se supone el siguiente escenario a modo de ejemplo. Para una cierta señal multicanal original, existe un "downmix maestro" por un lado y un "downmix de parámetros" por el otro. El downmix maestro lo ha generado un ingeniero de sonido en un estudio de sonido basándose en, por ejemplo, impresiones de calidad subjetivas. Adicionalmente, un cierto medio de almacenamiento de audio también incluye el downmix de parámetros que se ha realizado mediante, por ejemplo, el codificador 203 envolvente de la figura 2. El downmix de parámetros incluye un canal base o dos canales base, canales base que forman la base para la reconstrucción multicanal utilizando el conjunto de parámetros de equilibrio o cualquier otra representación paramétrica de la señal multicanal original.
Puede darse el caso, por ejemplo, de que un radiodifusor desee no transmitir el downmix de parámetros sino el downmix maestro desde un transmisor hasta un receptor. Adicionalmente, para mejorar el downmix maestro a una representación multicanal, el radiodifusor también transmite una representación paramétrica de la señal multicanal original. Puesto que la energía (en una banda y en un bloque) puede variar (y normalmente lo hará) entre el downmix maestro y el downmix de parámetros, se genera un parámetro r_{M} de nivel relativo en el bloque 900 y se transmite al receptor como un parámetro adicional. El parámetro de nivel se deriva a partir del downmix maestro y el downmix de parámetros y es, preferiblemente, una relación entre las energías dentro de un bloque y una banda del downmix maestro y el downmix de parámetros.
Generalmente, el parámetro de nivel se calcula como la relación de la suma de las energías (E_{orig}) de los canales originales y la energía del (de los) canal(es) de downmix, en la que este (estos) canal(es) de downmix puede(n) ser el downmix (E_{PD}) de parámetros o el downmix (E_{MD}) maestro o cualquier otra señal de downmix. Normalmente, se utiliza la energía de la señal de downmix específica, que se transmite desde un codificador hasta un descodificador.
La figura 9b ilustra una implementación del lado del descodificador de la utilización del parámetro de nivel. El parámetro de nivel así como la señal de downmix se introducen en el bloque 902 corrector de nivel. El corrector de nivel corrige el canal base único o los diversos canales base dependiendo del parámetro de nivel. Puesto que el parámetro r_{M} adicional es un valor relativo, este valor relativo se multiplica por la energía del canal base correspondiente.
Aunque las figuras 9a y 9b indican una situación en la que se aplica la corrección de nivel al canal de downmix o a los canales de downmix, el parámetro de nivel también puede integrarse en la matriz de upmix. Con este fin, cada vez que aparece M en las ecuaciones de la figura 8 se sustituye por el término "r_{M}M".
Estudiando el caso cuando se recrean 5,1 canales a partir de 2 canales, se realiza la siguiente observación.
Si la presente invención se utiliza con un códec de audio subyacente tal como se representa en la figura 2 y en la figura 3 por 205 y 302, se necesita realizar algunas consideraciones más. Obsérvese que los parámetros IID, tal como se definieron anteriormente, donde r_{1} se definió según
25
este parámetro está disponible implícitamente en el lado del descodificador puesto que el sistema está recreando 5,1 canales a partir de 2 canales, siempre que los dos canales transmitidos sean el downmix estéreo de los canales envolventes.
Sin embargo, el códec de audio que funciona bajo una limitación de tasa de bits puede modificar la distribución espectral de tal modo que las energías L y R tal como se miden en el descodificador difieren de sus valores en el lado del codificador. Según la presente invención tal influencia sobre la distribución de energía de los canales recreados se desvanece transmitiendo el parámetro
26
también para el caso cuando se reconstruyen 5,1 canales a partir de dos canales.
\global\parskip0.900000\baselineskip
Si se proporcionan medios de señalización, el codificador puede codificar el presente segmento de señal utilizando diferentes conjuntos de parámetros y elegir el conjunto de parámetros IID que dan la sobrecarga más baja para el segmento de señal particular que está procesándose. Es posible que los niveles de energía entre los canales delantero y trasero derechos sean similares, y que los niveles de energía entre el canal izquierdo delantero y trasero sean similares pero significativamente diferentes a los niveles en el canal delantero y trasero derecho. Dada la codificación delta de parámetros y posteriormente la codificación de entropía, puede ser más eficaz utilizar los parámetros q_{3} y q_{4} en lugar de r_{3} y r_{4}. Para otro segmento de señal con características diferentes, un conjunto de parámetros diferente puede dar una sobrecarga de tasa de bits inferior. La presente invención permite conmutar libremente entre diferentes representaciones de parámetros con el fin de minimizar la sobrecarga de tasa de bits para el segmento de señal codificado actualmente dadas las características del segmento de señal. La capacidad para conmutar entre diferentes parametrizaciones de los parámetros IID con el fin de obtener la sobrecarga de tasa de bits más baja posible y proporcionar medios de señali-
zación para indicar qué parametrización se utiliza actualmente, es una característica esencial de la presente invención.
Además, la codificación delta de los parámetros puede realizarse en o bien la dirección de frecuencia o bien en la dirección del tiempo, así como codificación delta entre diferentes parámetros. Según la presente invención, un parámetro puede codificarse mediante codificación delta con respecto a cualquier otro parámetro, dado que se proporcionan medios de señalización que indican la codificación delta particular utilizada.
Una característica interesante para cualquier esquema de codificación es la capacidad para realizar codificación escalable. Esto significa que el flujo de bits codificado puede dividirse en varias capas diferentes. La capa de núcleo puede descodificarse por sí misma y las capas superiores pueden descodificarse para mejorar la señal de capa de núcleo codificada. Por diferentes circunstancias, el número de capas disponibles puede variar, pero mientras que la capa de núcleo esté disponible el descodificador puede producir muestras de salida. La parametrización para la codificación multicanal, tal como se expuso anteriormente utilizando los parámetros r_{1} a r_{5,} es muy adecuada para la codificación escalable. Por tanto, es posible almacenar los datos para, por ejemplo, los dos canales (A y E) envolventes en una capa de mejora, es decir, los parámetros r_{3} y r_{4}, y los parámetros correspondientes a los canales delanteros en una capa de núcleo, representados por los parámetros r_{1} y r_{2}.
En la figura 10 se representa una implementación de flujo de bits escalable según la presente invención. Las capas de flujos de bits se ilustran por 1001 y 1002, donde 1001 es la capa de núcleo que aloja las señales de downmix codificadas por forma de onda y los parámetros r1 y r2 requeridos para recrear los canales (102, 103 y 104) delanteros. La capa de mejora ilustrada por 1002 aloja los parámetros para recrear los canales (101 y 105) posteriores.
Otro aspecto importante de la presente invención es la utilización de descorreladores en una configuración multicanal. El concepto de utilizar un descorrelador se detalló para el caso de uno a dos canales en el documento PCT/SE02/01372. Sin embargo, cuando se amplía esta teoría a más de dos canales, surgen varios problemas que resuelve la presente invención.
La matemática elemental muestra que con el fin de conseguir M señales mutuamente descorrelacionadas a partir de N señales, se requieren M-N descorreladores, donde todos los diferentes correladores son funciones que crean señales de salida mutuamente ortogonales a partir de una señal de entrada común. Un descorrelador es normalmente un filtro de todo paso o casi de todo paso que dada una entrada x(t) produce una salida y(t) con E-[|y|^{2}]= E[|x|^{2}] y casi correlación cruzada desvaneciente E[yx^{\text{*}}]. Criterios de percepción adicionales entran en el diseño de un buen correlador, pudiéndose también utilizar algunos ejemplos de métodos de diseño para minimizar el carácter de filtro de peine cuando se suma la señal original a la señal descorrelacionada y para minimizar el efecto de una respuesta de impulso a veces demasiado larga en señales transitorias. Algunos descorreladores de la técnica anterior utilizan un reverberador artificial para la descorrelación. La técnica anterior también incluye retardos fraccionales, por ejemplo modificando la fase de las muestras de subbanda complejas, para conseguir densidad de eco superior y por tanto más dispersión de tiempo.
La presente invención sugiere métodos de modificación de un descorrelador basado en reverberaciones con el fin de conseguir que múltiples descorreladores creen señales de salida mutuamente descorrelacionadas a partir de una señal de entrada común. Dos correladores están mutuamente descorrelacionados si sus salidas y_{1}(y) e y_{2}(t) presentan una correlación cruzada desvaneciente o casi desvaneciente dada la misma entrada. Suponiendo que la entrada es ruido blanco estacionario, se sigue que las respuestas h_{1} y h_{2} de impulso deben ser ortogonales en el sentido de que E[h_{1}h_{2}^{\text{*}}] sea desvaneciente o casi desvaneciente. Pueden construirse de varias maneras conjuntos de descorreladores mutuamente descorrelacionados por pares de varias maneras. Una manera eficaz de realizar tales modificaciones es alterar el factor q de rotación de fase que es parte del retardo fraccional.
\global\parskip1.000000\baselineskip
La presente invención estipula que los factores de rotación de fase pueden ser parte de las líneas de retardo en los filtros de todo paso o simplemente un retardo fraccional total. En el último caso, este método no está limitado a filtros de tipo de todo paso o de reverberación, sino que también puede aplicarse a, por ejemplo, retardos sencillos que incluyen una parte de retardo fraccional. Un enlace de filtro de todo paso en el descorrelador puede describirse en el dominio Z como:
27
donde q es el factor (|q|=1) de rotación de fase de valor complejo, m es la longitud de línea de retardo en muestras y a es el coeficiente de filtro. Por razones de estabilidad, la magnitud del coeficiente de filtro tiene que limitarse a |a|<1. Sin embargo, utilizando el coeficiente a'=-a de filtro alternativo, se define un nuevo reverberador que presenta las mismas propiedades de decaimiento de reverberación pero con una salida significativamente no correlacionada con la salida del reverberador no modificado. Además, puede realizarse una modificación del factor q de rotación de fase, por ejemplo añadiendo un desfase de fase constante, q'=qe^{iC}. La constante C puede utilizarse como un desfase de fase constante o podría escalarse de una manera que correspondería a un desfase de tiempo constante para todas las bandas de frecuencia sobre las que se aplica. La constante C de desfase de fase también puede ser un valor aleatorio que sea diferente para todas las bandas de frecuencia.
Según la presente invención, la generación de n canales a partir de m canales se realiza aplicando una matriz H de upmix de tamaño n\times(m+p) a un vector columna de tamaño (m+p)\times1 de señales
28
en el que m son las m señales codificadas y de downmix, y las p señales en s están descorrelacionadas y mutuamente descorrelacionadas de todas las señales en m. Estas señales descorrelacionadas se producen a partir de las señales en m mediante los descorreladores. Las n señales a', b',... reconstruidas están entonces contenidas en el vector columna
29
Lo anterior se ilustra mediante la figura 11, donde las señales descorrelacionadas se crean mediante los descorreladores 1102, 1103 y 1104. La matriz H de upmix se da mediante 1101 operando sobre el vector y dando la señal x' de salida.
Sea R=E[xx^{\text{*}}] la matriz de correlación del vector de señal origina, sea R'=E[x'x'^{\text{*}}] la matriz de correlación de la señal reconstruida. En este caso y en lo sucesivo, para una matriz o un vector X con entradas complejas, X^{\text{*}} denota la matriz adjunta, el complejo conjugado traspuesto de X.
La diagonal de R contiene los valores A, B, C, ... de energía y pueden descodificarse hasta un nivel de energía total a partir de las cantidades de energía definidas anteriormente. Puesto que R^{\text{*}}=R, sólo hay n(n-1)/2 valores de correlación cruzada fuera de la diagonal diferentes que contienen información que va a reconstruirse completa o parcialmente ajustando la matriz H de upmix. Una reconstrucción de la estructura de correlación completa corresponde al caso R'=R. La reconstrucción de niveles de energía correctos sólo corresponde al caso en el que R' y R son iguales en sus diagonales.
En el caso de n canales a partir de m=1 canal, se consigue una reconstrucción de la estructura de correlación completa utilizando p=n-1 descorreladores mutuamente descorrelacionados, una matriz H de upmix que satisface la condición
30
donde M es la energía de la señal transmitida única.
Puesto que R es semidefinida positiva, es ampliamente conocido que existe una solución de este tipo. Además, se dejan n(n-1)/2 grados de libertad para el diseño de H, que se utilizan en la presente invención para obtener propiedades deseables adicionales de la matriz de upmix. Un criterio de diseño central es que la dependencia de H sobre los datos de correlación transmitidos deberá ser suave.
Una manera conveniente de parametrizar la matriz de upmix es H=UDV donde U y V son matrices ortogonales y D es una matriz diagonal. Los cuadrados de los valores absolutos de D pueden elegirse igual a los autovalores de R/M. Omitir V y clasificar los autovalores de tal modo que el valor más grande se aplique a la primera coordenada minimizará la energía total de señales descorrelacionadas en la salida. La matriz U ortogonal se parametriza en el caso real por n(n-1)/2 ángulos de rotación. Transmitir datos de correlación en la forma de esos ángulos y los n valores diagonales de D daría inmediatamente la dependencia suave deseada de H. Sin embargo, puesto que los datos de energía tienen que transformarse en autovalores, en este enfoque se sacrifica la escalabilidad.
Un segundo método enseñado por la presente invención consiste en separar la parte de energía de la parte de correlación en R definiendo una matriz R_{0} de correlación normalizada mediante R=GR_{0}G donde G es una matriz diagonal con los valores diagonales iguales a las raíces cuadradas de las entradas diagonales de R, es decir,
\sqrt{A}, \sqrt{B}..., y R_{0} presenta unos en la diagonal. Sea H_{0} una matriz de upmix ortogonal que define el upmix normalizado preferido en el caso de señales no correlacionadas totalmente de igual energía. Ejemplos de tales matrices de upmix preferidas son
31
El upmix se define entonces por H = GSH_{0}/\sqrt{M}, donde la matriz S resuelve SS^{\text{*}}=R_{0}. La dependencia de esta solución sobre los valores de correlación cruzada normalizada en R_{0} se elige para que sea continua y de manera que S sea igual a la matriz I identidad en el caso R_{0}=I.
Dividir los n canales en grupos de menos canales es una manera conveniente para reconstruir la estructura de correlación cruzada parcial. Según la presente invención, un agrupamiento ventajoso particular para el caso de 5,1 canales a partir de 1 canal es {a,e},{c},{b,d},{f}, donde no se aplica descorrelación para los grupos {c},{f} y los grupos {a,e},{b,d} se producen mediante upmix del mismo par de downmix/descorrelacionado. Para estos dos subsistemas, los upmix normalizados preferidos en el caso de no totalmente correlacionados deben elegirse como
32
respectivamente. Por tanto, sólo se transmitirán y reconstruirán dos de la totalidad de 15 correlaciones cruzadas, concretamente aquellas entre los canales {a,e} y {b,d}. En la terminología utilizada anteriormente, esto es un ejemplo de un diseño pare el caso n=6, m=1 y p=1. La matriz H de upmix es de tamaño 6\times2 con ceros en las dos entradas en la segunda columna en las filas 3 y 6 correspondientes a las salidas c' y f'.
Un tercer enfoque enseñado por la presente invención para incorporar señales descorrelacionadas es el punto de vista más sencillo en el que cada canal de salida presente un descorrelador diferente ocasionando señales s_{a}, s_{b}, ... descorrelacionadas. Las señales reconstruidas se forman entonces como
33
etc...
Los parámetros \varphi_{a}, \varphi_{b},... controlan la cantidad de señal descorrelacionada presente en los canales a', b',... de salida. Los datos de descorrelación se transmiten en forma de estos ángulos. Es fácil calcular que la correlación cruzada normalizada resultante entre, por ejemplo, el canal a' y el b' es igual al producto cos\varphi_{a}cos\varphi_{b}. Puesto que el número de correlaciones cruzadas por pares es n(n-1)/2 y que hay n descorreladores, no será posible en general con este enfoque ajustarse a una estructura de correlación dada si n>3, pero las ventajas son un método de descodificación estable y muy simple, y el control directo sobre la cantidad producida de señal descorrelacionada presente en cada canal de salida. Esto permite que el mezclado de señales descorrelacionadas se base en criterios de percepción que incorporan, por ejemplo, diferencias de nivel de energía de pares de canales.
Para el caso de n canales a partir de m>1 canales, la matriz R_{y}=E[yy^{\text{*}}] de correlación ya no puede suponerse diagonal, y esto tiene que tenerse en cuenta en el ajuste de R'=HR_{y}H^{\text{*}} para la R objetivo. Se produce una simplificación, puesto que R_{y} presenta la estructura de matriz de bloque
34
donde R_{m}=E[mn^{\text{*}}] y R_{s}=E[ss^{\text{*}}]. Además, suponiendo descorreladores mutuamente descorrelacionados, la matriz R_{s} es diagonal. Obsérvese que esto también afecta al diseño de upmix con respecto a la reconstrucción de energías correctas. La solución es calcular en el descodificador, o transmitir desde el codificador, información acerca de la estructura R_{m} de correlación de las señales de downmix.
Para el caso de 5,1 canales a partir de 2 canales un método preferido para downmix es
35
donde s_{1} se obtiene a partir de la descorrelación de m_{1}=I_{d} y s_{2} se obtiene a partir de la descorrelación de m_{2}=r_{d}.
En este caso los grupos {a,b}y {d,e} se tratan como sistemas de canales 1\rightarrow2 separados tomando en cuenta las correlaciones cruzadas por pares. Para los canales c y f, las ponderaciones han de ajustarse de tal manera que
36
\vskip1.000000\baselineskip
37
La presente invención puede implementarse tanto en chips de hardware como en DSP, para diversos tipos de sistemas, para almacenamiento o transmisión de señales, analógicas o digitales, utilizando códecs arbitrarios. La figura 2 y la figura 3 muestran una posible implementación de la presente invención. En este ejemplo, se muestra un sistema que funciona sobre seis señales de entrada (una configuración de 5,1 canales). En la figura 2 se muestra el lado del codificador y las señales de entrada analógicas para los canales individuales se convierten en una señal 201 digital y se analizan utilizando un banco de filtros para cada canal 202. La salida de los bancos de filtros se alimenta al codificador 203 envolvente que incluye un generador de parámetros que realiza un downmix que crea el uno o los dos canales codificados por el codificador 205 de audio. Además, los parámetros envolventes tales como los parámetros IID e ICC se extraen según la presente invención, y los datos de control que representan la cuadrícula de frecuencia de tiempo de los datos, así como qué parametrización se utilizó, se extraen 204 según la presente invención. Los parámetros extraídos se codifican 206 tal como se enseña mediante la presente invención, o bien conmutando entre diferentes parametrizaciones o bien disponiendo los parámetros en una forma escalable. Los parámetros 207 envolventes, las señales de control y las señales 208 de downmix codificadas se multiplexan 209 en un flujo de bits serie.
En la figura 3 se muestra una implementación de descodificador típica, es decir, un aparato para generar reconstrucción multicanal. En este caso se supone que el descodificador de audio emite una señal en una representación en el dominio de frecuencia, por ejemplo, la salida del descodificador AAC de alta eficacia MPEG-4 antes del banco de filtros de síntesis QMF. El flujo de bits serie se desmultiplexa 301 y los datos envolventes codificados se alimentan al descodificador 303 de datos envolventes y los canales codificados de downmix se alimentan al descodificador 302 de audio, en este ejemplo un descodificador AAC de alta eficacia MPEG-4. El descodificador de datos envolventes descodifica los datos envolventes y los alimenta al descodificador 305 envolvente, que incluye un elemento de upmix, que recrea seis canales basándose en los canales de downmix descodificados y los datos envolventes y las señales de control. La salida del dominio de la frecuencia del descodificador envolvente se sintetiza 306 a señales del dominio de tiempo que se convierten posteriormente en señales analógicas mediante el DAC 307.
Aunque la presente invención se ha descrito principalmente con referencia a la generación y utilización de parámetros de equilibrio, ha se resaltarse en este momento que también se utiliza preferiblemente el mismo agrupamiento de pares de canales para derivar parámetros de equilibrio para calcular parámetros de coherencia entre canales o parámetros de "ancho" entre estos pares de dos canales. Adicionalmente, también pueden derivarse diferencias de tiempo entre canales o un tipo de "indicaciones de fase" utilizando los mismos pares de canales que los utilizados para el cálculo de parámetros de equilibrio. En el lado del receptor, estos parámetros pueden utilizarse además de o como una alternativa a los parámetros de equilibrio para generar una reconstrucción multicanal. Como alternativa, los parámetros de coherencia entre canales o incluso las diferencias de tiempo entre canales también pueden utilizarse además de otras diferencias de nivel entre canales determinadas por otros canales de referencia. En vista de la característica de escalabilidad de la presente invención, tal como se comentó en conexión con la figura 10a y la figura 10b, se prefiere, sin embargo, utilizar los mismos pares de canales para todos los parámetros de tal modo que, en un flujo de bits escalables, cada capa de escalado incluye todos los parámetros para reconstruir el subgrupo de canales de salida, que pueden generarse mediante la capa de escalado respectiva tal como se expone en la penúltima columna de la tabla de la figura 10b. La presente invención es útil cuando sólo se calculan y transmite a un descodificador los parámetros de coherencia o los parámetros de diferencia de tiempo entre los respectivos pares de canales. En este caso, los parámetros de nivel ya existen en el descodificador para su utilización cuando se realiza una reconstrucción multicanal.
Dependiendo de ciertos requisitos de implementación de los métodos inventivos, los métodos inventivos pueden implementarse en hardware o en software. La implementación puede realizarse utilizando un medio de almacenamiento digital, en particular un disco o un CD que presente señales de control legibles electrónicamente almacenadas sobre el mismo, que actúe conjuntamente con un sistema informático programable de tal forma que se realicen los métodos inventivos. Por lo tanto, generalmente la presente invención es un producto de programa informático con un código de programa almacenado en un portador legible por máquina, estando operativo el código del programa para realizar los métodos inventivos cuando el producto de programa informático se ejecuta en un ordenador. Dicho de otro modo, los métodos inventivos son, por lo tanto, un programa informático que presenta un código de programa para realizar al menos uno de los métodos inventivos cuando el programa informático se ejecuta en un ordenador.

Claims (27)

1. Aparato para generar una representación de parámetros de una señal de entrada multicanal que presenta canales originales, incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (E) posterior derecho, que comprende:
un generador (203) de parámetros para generar un primer parámetro (r_{1}) de equilibrio, un primer parámetro de coherencia o un primer parámetro de diferencia de tiempo entre un primer par de canales, para generar un segundo parámetro (r_{2}) de equilibrio entre un segundo par de canales, y para generar un tercer parámetro (r_{3}) de equilibrio entre un tercer par de canales, formando los parámetros de equilibrio, los parámetros de coherencia o los parámetros de tiempo la representación de parámetros,
en el que cada canal del par de dos canales es uno de los canales originales o una combinación ponderada o no ponderada de los canales originales, y
en el que el primer parámetro (r_{1}) de equilibrio es un parámetro de equilibrio izquierdo/derecho, y en el que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho
en el que el segundo parámetro (r_{2}) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central, y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho, y
en el que el tercer parámetro (r_{3}) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho.
2. Aparato según la reivindicación 1, en el que los canales originales incluyen adicionalmente un canal de mejora de bajas frecuencias, y en el que la combinación de canales de canales originales que incluye el canal central incluye una combinación del canal central y el canal de mejora de bajas frecuencias.
3. Aparato según la reivindicación 1, en el que el generador de parámetros está operativo para calcular el parámetro de equilibrio central según la siguiente ecuación
38
en la que r_{2} es el parámetro de equilibrio central, en la que C representa el canal central, en la que B representa el canal izquierdo, en la que D representa el canal derecho, y en la que \gamma y \alpha representan factores de downmix.
4. Aparato según la reivindicación 1, en el que el generador de parámetros está operativo para calcular el primer parámetro de equilibrio según la siguiente ecuación:
39
en la que r_{1} es el primer parámetro de equilibrio, en la que L es un primer canal de downmix, en la que R es un segundo canal de downmix, en la que B representa el canal izquierdo, en la que D representa el canal derecho, en la que A representa el canal posterior izquierdo, en la que E representa el canal posterior derecho, en la que C representa el canal central, en la que F representa un canal de mejora de bajas frecuencias, y en la que \alpha, \beta, \gamma y \delta son factores de downmix.
5. Aparato según la reivindicación 1, en el que el generador de parámetros está operativo para calcular el parámetro (r_{3}) delantero/trasero basándose en la siguiente ecuación:
40
en la que r_{3} es el parámetro de equilibrio delantero/trasero,
en la que A es el canal posterior izquierdo, en la que E es el canal posterior derecho, en la que B representa el canal izquierdo, en la que D representa el canal derecho,
en la que C representa el canal central, y en la que \alpha, \beta, \gamma y \delta son factores de downmix.
6. Aparato según una de las reivindicaciones anteriores,
en el que el generador de parámetros está operativo para generar, como un parámetro de equilibrio adicional, un parámetro (r_{4}) de equilibrio trasero izquierdo/derecho entre un par de canales traseros izquierdo/derecho que presenta, como el primer canal, el canal posterior izquierdo y, como un segundo canal, el canal posterior derecho.
7. Aparato según una de las reivindicaciones anteriores, en el que la señal multicanal original incluye adicionalmente un canal de mejora de bajas frecuencias,
en el que el generador de parámetros está operativo para generar, como un parámetro de equilibrio adicional un parámetro (r_{5}) de equilibrio de mejora de bajas frecuencias entre un par de canales de mejora de bajas frecuencias que presenta, como un primer canal, el canal de mejora de bajas frecuencias y, como un segundo canal, el canal central o una combinación de canales que incluye el canal central y un canal izquierdo y uno derecho de los canales originales.
8. Aparato según la reivindicación 7, en el que el generador de parámetros está operativo para calcular el parámetro de equilibrio de mejora de bajas frecuencias, según la siguiente ecuación:
41
en la que A corresponde al canal posterior izquierdo, en la que E corresponde al canal posterior derecho, en la que B corresponde al canal izquierdo, en la que D corresponde al canal derecho, en la que C corresponde al canal central, en la que F corresponde al canal de mejora de bajas frecuencias, en la que \alpha, \beta, \gamma y \delta son factores de downmix, y en la que r_{5} es el parámetro de equilibrio de mejora de bajas frecuencias.
9. Aparato según una de las reivindicaciones anteriores, que comprende además un generador de flujo de datos para generar un flujo (1001, 1002) de datos escalable, estando operativo el generador de flujo de datos para introducir el primer o el segundo parámetro de equilibrio en una capa de escalado inferior y cualquier parámetro adicional en una capa de escalado superior.
10. Aparato según la reivindicación 9, en el que el generador de parámetros está operativo para generar uno o más parámetros de equilibrio además del primer o el segundo parámetro de equilibrio, y en el que el generador de flujo de datos está operativo para introducir el uno o más parámetros de equilibrio adicionales en una única o en una pluralidad de capas de escalado superior.
11. Aparato según la reivindicación 10, en el que el generador de flujo de datos está operativo para introducir cada parámetro adicional en una capa de escalado dedicado.
12. Aparato según una de las reivindicaciones anteriores, en el que el generador de parámetros está operativo para generar como un cuarto parámetro de equilibrio un parámetro de equilibrio posterior izquierdo/derecho, y como un quinto parámetro de equilibrio, un parámetro de equilibrio de mejora de bajas frecuencias, y
en el que el generador de flujo de datos está operativo para introducir el primer y segundo parámetro de equilibrio en una capa de escalado inferior y para introducir del tercer al cuarto parámetro de equilibrio o parámetros de coherencia correspondientes o diferencias de tiempo correspondientes en una o más capas de escalado superior.
13. Aparato según una de las reivindicaciones anteriores, en el que el generador de parámetros está operativo para generar, como un parámetro de equilibrio adicional, al menos un parámetro (q_{3}, q_{4}) de equilibrio delantero/trasero de un único lado entre un par de canales delantero/trasero de un único lado que presenta, como un primer canal, un canal posterior izquierdo y, como un segundo canal, un canal izquierdo o, como un primer canal, un canal posterior derecho y, como un segundo canal, un canal derecho.
14. Aparato según una de las reivindicaciones anteriores, que comprende además:
un codificador de parámetros para generar una versión codificada de los parámetros de equilibrio, los parámetros de coherencia, o las diferencia de tiempo entre canales, incluyendo el codificador de parámetros el cuantificador.
15. Aparato según una de las reivindicaciones anteriores,
en el que el generador de parámetros está operativo para generar diferentes conjuntos de parámetros, incluyendo cada conjunto al menos dos parámetros, en el que los pares de canales utilizados para calcular los parámetros en los diferentes conjuntos son diferentes entre sí,
en el que el generador de parámetros está operativo además para seleccionar un conjunto de los diferentes conjuntos para la salida, lo que da como resultado una tasa de bits inferior dado un cierto esquema de codificación de parámetros,
comprendiendo además el aparato un codificador de parámetros para codificar el conjunto seleccionado utilizando un cierto esquema de codificación de parámetros; y
un generador de información de control de parámetros para generar información de control que indica una característica del esquema de parámetros seleccionado.
16. Aparato para generar una representación multicanal reconstruida de una señal multicanal original que presenta canales originales incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (D) posterior derecho, utilizando uno o más canales base que se generan convirtiendo la señal multicanal original utilizando un esquema de downmix, y utilizando un primer parámetro de equilibrio, entre un primer par de canales, un segundo parámetro de equilibrio entre un segundo par de canales, y un tercer parámetro de equilibrio entre un tercer par de canales, en el que el primer parámetro (r_{1}) de equilibrio es un parámetro de equilibrio izquierdo/derecho, y en el que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho,
en el que el segundo parámetro (r_{2}) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho, y en el que el tercer parámetro (r_{3}) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho, comprendiendo el aparato:
un elemento (305) de upmix para generar un número de canales de upmix, siendo el número de canales de upmix mayor que el número de canales base y menor que o igual a un número de canales originales,
en el que el elemento de upmix está operativo para generar canales reconstruidos basándose en información sobre el esquema de downmix y utilizando el primer, segundo y tercer parámetro de equilibrio,
en el que el elemento de upmix está operativo para generar un canal central reconstruido basándose en el segundo parámetro (r_{2}) de equilibrio,
en el que el elemento de upmix está operativo para generar un canal izquierdo reconstruido y un canal derecho reconstruido basándose en el primer parámetro (r_{1}), y
en el que el elemento de upmix está operativo para reconstruir canales posteriores utilizando el parámetro (r_{3}) de equilibrio delantero/trasero.
17. Aparato según la reivindicación 16, en el que la representación de parámetros incluye como un parámetro de equilibrio adicional un parámetro (r_{4}) de equilibrio trasero izquierdo/derecho entre un par de canales traseros izquierdo/derecho que presenta, como el primer canal, el canal posterior izquierdo y, como un segundo canal, el canal posterior derecho, y
en el que el elemento de upmix está operativo para generar un canal posterior izquierdo reconstruido y un canal posterior derecho reconstruido basándose en el parámetro de equilibrio trasero izquierdo/derecho.
18. Aparato según la reivindicación 16 ó 17,
en el que una información de parámetros incluye además como un quinto parámetro de equilibrio, un parámetro de equilibrio de mejora de bajas frecuencias, y en el que un flujo de datos incluye el primer y segundo parámetro de equilibrio en una capa de escalado inferior y el tercer y cuarto parámetro de equilibrio o parámetros de coherencia correspondientes o diferencias de tiempo correspondientes en una o más capas de escalado superior, y
en el que el elemento de upmix está operativo para utilizar el primer parámetro de equilibrio y el segundo parámetro de equilibrio para generar un canal de salida izquierdo, un canal de salida derecho, y un canal de salida que incluye el canal central, o
en el que el elemento de upmix está operativo para utilizar adicionalmente el parámetro de equilibrio delantero/trasero para reconstruir adicionalmente una suma entre el canal posterior izquierdo y construir una suma entre el canal posterior izquierdo y el canal posterior derecho; o
en el que el elemento de upmix está operativo para utilizar, además, el parámetro de equilibrio posterior izquierdo/derecho para reconstruir un canal posterior izquierdo y un canal posterior derecho.
19. Aparato según la reivindicación 18, en el que el elemento de upmix está operativo para generar la señal multicanal reconstruida de tal manera que se cumplen las siguientes ecuaciones:
42
43
en las que F corresponde a un canal de mejora de bajas frecuencias, en las que A corresponde a un canal envolvente izquierdo, en las que E corresponde a un canal envolvente derecho, en las que C corresponde a un canal central, en las que B corresponde a un canal izquierdo, en las que D corresponde a un canal derecho, en las que r_{1} es un parámetro de equilibrio izquierdo/derecho, en las que r_{2} es un parámetro de equilibrio central/izquierdo-derecho, en las que r_{3} es un parámetro de equilibrio delantero/derecho, en las que r_{4} es un parámetro de equilibrio posterior izquierdo/derecho, en las que r5 es un parámetro de equilibrio central/mejora de bajas frecuencias, y en las que \alpha, \beta, \gamma y \delta son factores de downmix.
20. Aparato según una de las reivindicaciones 16 a 19,
en el que el número de canales base es mayor que o igual a dos, y en el que la representación de parámetros incluye, como un parámetro de equilibrio adicional al menos un parámetro (q_{3}, q_{4}) de equilibrio delantero/trasero de un único lado entre un par de canales delantero/trasero de un único lado que presenta, como un primer canal, un canal posterior izquierdo y, como un segundo canal, un canal izquierdo o, como un primer canal, un canal posterior derecho y, como un segundo canal, un canal derecho, y
en el que el elemento de upmix está operativo para generar un canal posterior izquierdo reconstruido o un canal posterior derecho reconstruido basándose en un canal izquierdo o en un canal derecho y en el parámetro de equilibrio delantero/trasero de un único lado correspondiente.
21. Aparato según una de las reivindicaciones 16 a 20, en el que los parámetros de equilibrio son parte de un flujo de bits escalable que presenta, en la capa de escalado inferior, el primer y el segundo parámetro de equilibrio y, en al menos una capa de escalado superior, al menos un parámetro de equilibrio adicional, y
que comprende además un extractor de flujo de datos para extraer la capa de escalado inferior y un número de capas de escalado superior, estando el número de capas de escalado superior entre 0 y un número menor que un número completo de capas de escalado,
en el que el extractor de flujo de datos está operativo para extraer el número de capas de escalado superior dependiendo de una configuración de canales de salida asociada con el aparato, presentando la configuración de canales menos canales que una configuración de canales de la señal multicanal original.
22. Aparato según una de las reivindicaciones 16 a 21, que comprende además:
un selector de esquema de parámetros para controlar el elemento de upmix de tal manera que el elemento de upmix aplica un esquema de parámetros indicado por la información de control de esquema de parámetros.
23. Método de generación de una representación de parámetros de una señal de entrada multicanal que presenta canales originales, incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (E) posterior derecho, que comprende:
generar (203) un primer parámetro de equilibrio, en el que el primer parámetro (r_{1}) de equilibrio es un parámetro de equilibrio izquierdo/derecho, y en el que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho,
generar un segundo parámetro de equilibrio, en el que el segundo parámetro (r_{2}) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho,
generar un tercer parámetro de equilibrio, en el que el tercer parámetro (r_{3}) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho, y
en el que cada canal del par de dos canales es uno de los canales originales, una combinación ponderada o no ponderada de los canales originales, un canal de downmix, o una combinación ponderada o no ponderada de al menos dos canales de downmix.
24. Método de generación de una representación multicanal reconstruida de una señal multicanal original que presenta canales originales, incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (E) posterior derecho, utilizando uno o más canales base que se generan convirtiendo la señal multicanal original utilizando un esquema de downmix, y utilizando un primer parámetro de equilibrio, entre un primer par de canales, un segundo parámetro de equilibrio entre un segundo par de canales, y un tercer parámetro de equilibrio entre un tercer par de canales, en el que el primer parámetro (r_{1}) de equilibrio es un parámetro de equilibrio izquierdo/derecho, y en el que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho,
en el que el segundo parámetro (r_{2}) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho, y en el que el tercer parámetro (r_{3}) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho, comprendiendo el método:
generar (305) un número de canales de upmix, siendo el número de canales de upmix mayor que el número de canales base y menor que o igual a un número de canales originales,
en el que la etapa de generación incluye generar canales reconstruidos basándose en información sobre el esquema de downmix y utilizando el primer, segundo y tercer parámetro de equilibrio, generando un canal central reconstruido basándose en el segundo parámetro (r_{2}) de equilibrio, generando un canal izquierdo reconstruido y un canal derecho reconstruido basándose en el primer parámetro (r_{1}), y reconstruyendo canales posteriores utilizando el parámetro (r_{3}) de equilibrio delantero/trasero.
25. Programa informático que presenta instrucciones legibles por máquina adaptadas para realizar un método según la reivindicación 23 ó 24, cuando se ejecuta en un ordenador.
26. Representación de parámetros de una señal de entrada multicanal que presenta canales originales, incluyendo los canales originales un canal (B) izquierdo, un canal (D) derecho, un canal (C) central, un canal (A) posterior izquierdo, y un canal (E) posterior derecho, que comprende: un primer parámetro de equilibrio entre un primer par de canales, un segundo parámetro de equilibrio entre un segundo par de canales, y un tercer parámetro de equilibrio entre un tercer par de canales,
en la que cada canal del par de dos canales es uno de los canales originales, una combinación ponderada o no ponderada de los canales originales, un canal de downmix, o una combinación ponderada o no ponderada de al menos dos canales de downmix, y
en la que el primer parámetro (r_{1}) de equilibrio es un parámetro de equilibrio izquierdo/derecho, y en la que el primer par de canales incluye, como un primer canal, un canal izquierdo o un canal de downmix izquierdo y, como un segundo canal, un canal derecho, o un canal de downmix derecho
en la que el segundo parámetro (r_{2}) de equilibrio es un parámetro de equilibrio central y el segundo par de canales incluye, como un primer canal, el canal central o una combinación de canales de canales originales que incluye el canal central y, como un segundo canal, una combinación de canales que incluye el canal izquierdo y el canal derecho, y
en la que el tercer parámetro (r_{3}) de equilibrio es un parámetro de equilibrio delantero/trasero y el tercer par de canales presenta, como un primer canal, una combinación de canales que incluye el canal posterior izquierdo y el canal posterior derecho y, como un segundo canal, una combinación de canales que incluye un canal izquierdo y un canal derecho.
27. Representación de parámetros según la reivindicación 26, para controlar una reconstrucción multicanal cuando se introduce en un aparato según la reivindicación 16.
ES05735201T 2004-04-16 2005-04-12 Metodo para representar señales de audio multicanal. Expired - Lifetime ES2294703T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
SE0400998A SE0400998D0 (sv) 2004-04-16 2004-04-16 Method for representing multi-channel audio signals
SE0400998 2004-04-16

Publications (1)

Publication Number Publication Date
ES2294703T3 true ES2294703T3 (es) 2008-04-01

Family

ID=32294334

Family Applications (2)

Application Number Title Priority Date Filing Date
ES05743164T Expired - Lifetime ES2293578T3 (es) 2004-04-16 2005-04-12 Aparato y metodo para generar un parametro de nivel y aparato y metodo para generar una representacion multicanal.
ES05735201T Expired - Lifetime ES2294703T3 (es) 2004-04-16 2005-04-12 Metodo para representar señales de audio multicanal.

Family Applications Before (1)

Application Number Title Priority Date Filing Date
ES05743164T Expired - Lifetime ES2293578T3 (es) 2004-04-16 2005-04-12 Aparato y metodo para generar un parametro de nivel y aparato y metodo para generar una representacion multicanal.

Country Status (12)

Country Link
US (24) US8223976B2 (es)
EP (2) EP1695338B1 (es)
JP (4) JP4589962B2 (es)
KR (2) KR100848365B1 (es)
CN (4) CN102157155B (es)
AT (2) ATE376240T1 (es)
DE (2) DE602005002942T2 (es)
ES (2) ES2293578T3 (es)
PL (2) PL1735775T3 (es)
SE (1) SE0400998D0 (es)
TW (1) TWI334736B (es)
WO (2) WO2005101370A1 (es)

Families Citing this family (171)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE60129742T2 (de) * 2000-12-19 2008-04-30 Azoteq (Proprietary) Ltd. Verfahren und vorrichtung zum datentransfer
SE0400998D0 (sv) 2004-04-16 2004-04-16 Cooding Technologies Sweden Ab Method for representing multi-channel audio signals
ES2333137T3 (es) * 2004-07-14 2010-02-17 Koninklijke Philips Electronics N.V. Conversion de canal de audio.
TWI393120B (zh) * 2004-08-25 2013-04-11 Dolby Lab Licensing Corp 用於音訊信號編碼及解碼之方法和系統、音訊信號編碼器、音訊信號解碼器、攜帶有位元流之電腦可讀取媒體、及儲存於電腦可讀取媒體上的電腦程式
SE0402649D0 (sv) * 2004-11-02 2004-11-02 Coding Tech Ab Advanced methods of creating orthogonal signals
SE0402650D0 (sv) * 2004-11-02 2004-11-02 Coding Tech Ab Improved parametric stereo compatible coding of spatial audio
US7787631B2 (en) * 2004-11-30 2010-08-31 Agere Systems Inc. Parametric coding of spatial audio with cues based on transmitted channels
EP1691348A1 (en) * 2005-02-14 2006-08-16 Ecole Polytechnique Federale De Lausanne Parametric joint-coding of audio sources
KR101315077B1 (ko) * 2005-03-30 2013-10-08 코닌클리케 필립스 일렉트로닉스 엔.브이. 멀티-채널 오디오 데이터를 인코딩 및 디코딩하기 위한 방법, 및 인코더들 및 디코더들
EP1866913B1 (en) * 2005-03-30 2008-08-27 Koninklijke Philips Electronics N.V. Audio encoding and decoding
PL1866912T3 (pl) 2005-03-30 2011-03-31 Koninl Philips Electronics Nv Kodowanie wielokanałowego sygnału audio
US7961890B2 (en) 2005-04-15 2011-06-14 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung, E.V. Multi-channel hierarchical audio coding with compact side information
JP4988716B2 (ja) 2005-05-26 2012-08-01 エルジー エレクトロニクス インコーポレイティド オーディオ信号のデコーディング方法及び装置
WO2006126844A2 (en) 2005-05-26 2006-11-30 Lg Electronics Inc. Method and apparatus for decoding an audio signal
US8270439B2 (en) * 2005-07-08 2012-09-18 Activevideo Networks, Inc. Video game system using pre-encoded digital audio mixing
US8626503B2 (en) * 2005-07-14 2014-01-07 Erik Gosuinus Petrus Schuijers Audio encoding and decoding
US8074248B2 (en) 2005-07-26 2011-12-06 Activevideo Networks, Inc. System and method for providing video content associated with a source image to a television in a communication network
CN101253556B (zh) * 2005-09-02 2011-06-22 松下电器产业株式会社 能量整形装置以及能量整形方法
JP5507844B2 (ja) 2005-10-20 2014-05-28 エルジー エレクトロニクス インコーポレイティド マルチチャンネルオーディオ信号の符号化及び復号化方法とその装置
CN1993002B (zh) * 2005-12-28 2010-06-16 雅马哈株式会社 声像定位设备
KR100803212B1 (ko) 2006-01-11 2008-02-14 삼성전자주식회사 스케일러블 채널 복호화 방법 및 장치
KR101218776B1 (ko) 2006-01-11 2013-01-18 삼성전자주식회사 다운믹스된 신호로부터 멀티채널 신호 생성방법 및 그 기록매체
WO2007083952A1 (en) 2006-01-19 2007-07-26 Lg Electronics Inc. Method and apparatus for processing a media signal
CN101410891A (zh) * 2006-02-03 2009-04-15 韩国电子通信研究院 使用空间线索控制多目标或多声道音频信号的渲染的方法和装置
KR100902899B1 (ko) 2006-02-07 2009-06-15 엘지전자 주식회사 부호화/복호화 장치 및 방법
KR100773560B1 (ko) 2006-03-06 2007-11-05 삼성전자주식회사 스테레오 신호 생성 방법 및 장치
KR100773562B1 (ko) * 2006-03-06 2007-11-07 삼성전자주식회사 스테레오 신호 생성 방법 및 장치
ATE447224T1 (de) * 2006-03-13 2009-11-15 France Telecom Gemeinsame schallsynthese und -spatialisierung
JP5173795B2 (ja) * 2006-03-17 2013-04-03 パナソニック株式会社 スケーラブル符号化装置およびスケーラブル符号化方法
RU2406262C2 (ru) * 2006-03-29 2010-12-10 Долби Свидн Аб Декодирование уменьшенного количества каналов
US7965848B2 (en) 2006-03-29 2011-06-21 Dolby International Ab Reduced number of channels decoding
US8619998B2 (en) * 2006-08-07 2013-12-31 Creative Technology Ltd Spatial audio enhancement processing method and apparatus
CN101578654B (zh) * 2006-07-04 2013-04-24 韩国电子通信研究院 用于恢复多通道音频信号的设备和方法
USRE50721E1 (en) 2006-07-07 2025-12-30 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Concept for combining multiple parametrically coded audio sources
EP2038878B1 (en) 2006-07-07 2012-01-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for combining multiple parametrically coded audio sources
FR2903562A1 (fr) * 2006-07-07 2008-01-11 France Telecom Spatialisation binaurale de donnees sonores encodees en compression.
KR100763920B1 (ko) 2006-08-09 2007-10-05 삼성전자주식회사 멀티채널 신호를 모노 또는 스테레오 신호로 압축한 입력신호를 2채널의 바이노럴 신호로 복호화하는 방법 및 장치
WO2008032255A2 (en) * 2006-09-14 2008-03-20 Koninklijke Philips Electronics N.V. Sweet spot manipulation for a multi-channel signal
JP4946305B2 (ja) * 2006-09-22 2012-06-06 ソニー株式会社 音響再生システム、音響再生装置および音響再生方法
KR100917843B1 (ko) * 2006-09-29 2009-09-18 한국전자통신연구원 다양한 채널로 구성된 다객체 오디오 신호의 부호화 및복호화 장치 및 방법
MX2008012315A (es) 2006-09-29 2008-10-10 Lg Electronics Inc Metodos y aparatos para codificar y descodificar señales de audio basados en objeto.
US20100146139A1 (en) * 2006-09-29 2010-06-10 Avinity Systems B.V. Method for streaming parallel user sessions, system and computer software
KR101012259B1 (ko) * 2006-10-16 2011-02-08 돌비 스웨덴 에이비 멀티채널 다운믹스된 객체 코딩의 개선된 코딩 및 파라미터 표현
JP5337941B2 (ja) * 2006-10-16 2013-11-06 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ マルチチャネル・パラメータ変換のための装置および方法
WO2008069593A1 (en) 2006-12-07 2008-06-12 Lg Electronics Inc. A method and an apparatus for processing an audio signal
RU2466469C2 (ru) * 2007-01-10 2012-11-10 Конинклейке Филипс Электроникс Н.В. Аудиодекодер
WO2008088772A2 (en) 2007-01-12 2008-07-24 Ictv, Inc. Mpeg objects and systems and methods for using mpeg objects
US9826197B2 (en) 2007-01-12 2017-11-21 Activevideo Networks, Inc. Providing television broadcasts over a managed network and interactive content over an unmanaged network to a client device
WO2008100067A1 (en) * 2007-02-13 2008-08-21 Lg Electronics Inc. A method and an apparatus for processing an audio signal
EP2130304A4 (en) * 2007-03-16 2012-04-04 Lg Electronics Inc METHOD AND DEVICE FOR PROCESSING AN AUDIO SIGNAL
US8612237B2 (en) * 2007-04-04 2013-12-17 Apple Inc. Method and apparatus for determining audio spatial quality
EP2278582B1 (en) * 2007-06-08 2016-08-10 LG Electronics Inc. A method and an apparatus for processing an audio signal
US20090037459A1 (en) * 2007-08-03 2009-02-05 Theobald Dietmar C Annotation data handlers for data stream processing
US8295494B2 (en) 2007-08-13 2012-10-23 Lg Electronics Inc. Enhancing audio with remixing capability
KR101464977B1 (ko) * 2007-10-01 2014-11-25 삼성전자주식회사 메모리 관리 방법, 및 멀티 채널 데이터의 복호화 방법 및장치
GB2467247B (en) * 2007-10-04 2012-02-29 Creative Tech Ltd Phase-amplitude 3-D stereo encoder and decoder
DE102007048973B4 (de) 2007-10-12 2010-11-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Erzeugen eines Multikanalsignals mit einer Sprachsignalverarbeitung
JPWO2009050896A1 (ja) * 2007-10-16 2011-02-24 パナソニック株式会社 ストリーム合成装置、復号装置、方法
KR101505831B1 (ko) * 2007-10-30 2015-03-26 삼성전자주식회사 멀티 채널 신호의 부호화/복호화 방법 및 장치
WO2009068087A1 (en) * 2007-11-27 2009-06-04 Nokia Corporation Multichannel audio coding
WO2009069228A1 (ja) * 2007-11-30 2009-06-04 Pioneer Corporation センターチャンネル定位装置
US8615088B2 (en) 2008-01-23 2013-12-24 Lg Electronics Inc. Method and an apparatus for processing an audio signal using preset matrix for controlling gain or panning
WO2009093867A2 (en) 2008-01-23 2009-07-30 Lg Electronics Inc. A method and an apparatus for processing audio signal
KR101452722B1 (ko) * 2008-02-19 2014-10-23 삼성전자주식회사 신호 부호화 및 복호화 방법 및 장치
WO2009125046A1 (en) * 2008-04-11 2009-10-15 Nokia Corporation Processing of signals
KR101381513B1 (ko) 2008-07-14 2014-04-07 광운대학교 산학협력단 음성/음악 통합 신호의 부호화/복호화 장치
US8639368B2 (en) * 2008-07-15 2014-01-28 Lg Electronics Inc. Method and an apparatus for processing an audio signal
TWI559786B (zh) 2008-09-03 2016-11-21 杜比實驗室特許公司 增進多聲道之再生
EP2175670A1 (en) * 2008-10-07 2010-04-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Binaural rendering of a multi-channel audio signal
EP2345027B1 (en) 2008-10-10 2018-04-18 Telefonaktiebolaget LM Ericsson (publ) Energy-conserving multi-channel audio coding and decoding
DE102008056704B4 (de) * 2008-11-11 2010-11-04 Institut für Rundfunktechnik GmbH Verfahren zum Erzeugen eines abwärtskompatiblen Tonformates
CN102272830B (zh) * 2009-01-13 2013-04-03 松下电器产业株式会社 音响信号解码装置及平衡调整方法
AU2015246158B2 (en) * 2009-03-17 2017-10-26 Dolby International Ab Advanced stereo coding based on a combination of adaptively selectable left/right or mid/side stereo coding and of parametric stereo coding.
GB2470059A (en) * 2009-05-08 2010-11-10 Nokia Corp Multi-channel audio processing using an inter-channel prediction model to form an inter-channel parameter
CN101556799B (zh) * 2009-05-14 2013-08-28 华为技术有限公司 一种音频解码方法和音频解码器
CN102428512A (zh) * 2009-06-02 2012-04-25 松下电器产业株式会社 下混装置、编码装置以及其方法
US20100322446A1 (en) * 2009-06-17 2010-12-23 Med-El Elektromedizinische Geraete Gmbh Spatial Audio Object Coding (SAOC) Decoder and Postprocessor for Hearing Aids
US9393412B2 (en) 2009-06-17 2016-07-19 Med-El Elektromedizinische Geraete Gmbh Multi-channel object-oriented audio bitstream processor for cochlear implants
US20100324915A1 (en) * 2009-06-23 2010-12-23 Electronic And Telecommunications Research Institute Encoding and decoding apparatuses for high quality multi-channel audio codec
US8194862B2 (en) * 2009-07-31 2012-06-05 Activevideo Networks, Inc. Video game system with mixing of independent pre-encoded digital audio bitstreams
JP2011066868A (ja) * 2009-08-18 2011-03-31 Victor Co Of Japan Ltd オーディオ信号符号化方法、符号化装置、復号化方法及び復号化装置
US8786852B2 (en) 2009-12-02 2014-07-22 Lawrence Livermore National Security, Llc Nanoscale array structures suitable for surface enhanced raman scattering and methods related thereto
TWI444989B (zh) * 2010-01-22 2014-07-11 Dolby Lab Licensing Corp 針對改良多通道上混使用多通道解相關之技術
CN102859590B (zh) 2010-02-24 2015-08-19 弗劳恩霍夫应用研究促进协会 产生增强下混频信号的装置、产生增强下混频信号的方法以及计算机程序
JP5604933B2 (ja) * 2010-03-30 2014-10-15 富士通株式会社 ダウンミクス装置およびダウンミクス方法
DE102010015630B3 (de) * 2010-04-20 2011-06-01 Institut für Rundfunktechnik GmbH Verfahren zum Erzeugen eines abwärtskompatiblen Tonformates
CN102314882B (zh) * 2010-06-30 2012-10-17 华为技术有限公司 声音信号通道间延时估计的方法及装置
JP5753899B2 (ja) * 2010-07-20 2015-07-22 ファーウェイ テクノロジーズ カンパニー リミテッド オーディオ信号合成器
US8908874B2 (en) * 2010-09-08 2014-12-09 Dts, Inc. Spatial audio encoding and reproduction
KR101697550B1 (ko) * 2010-09-16 2017-02-02 삼성전자주식회사 멀티채널 오디오 대역폭 확장 장치 및 방법
KR20130138263A (ko) 2010-10-14 2013-12-18 액티브비디오 네트웍스, 인코포레이티드 케이블 텔레비전 시스템을 이용하는 비디오 장치들 간의 디지털 비디오의 스트리밍
CN103649706B (zh) 2011-03-16 2015-11-25 Dts(英属维尔京群岛)有限公司 三维音频音轨的编码及再现
WO2012138660A2 (en) 2011-04-07 2012-10-11 Activevideo Networks, Inc. Reduction of latency in video distribution networks using adaptive bit rates
TWI450266B (zh) * 2011-04-19 2014-08-21 Hon Hai Prec Ind Co Ltd 電子裝置及音頻資料的解碼方法
EP2523472A1 (en) 2011-05-13 2012-11-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method and computer program for generating a stereo output signal for providing additional output channels
EP2530956A1 (en) * 2011-06-01 2012-12-05 Tom Van Achte Method for generating a surround audio signal from a mono/stereo audio signal
MY207992A (en) 2011-07-01 2025-04-03 Dolby Laboratories Licensing Corp System and method for adaptive audio signal generation, coding and rendering
CN103636235B (zh) * 2011-07-01 2017-02-15 杜比实验室特许公司 用于扬声器阵列的均衡和/或低音管理的方法和装置
KR101842257B1 (ko) * 2011-09-14 2018-05-15 삼성전자주식회사 신호 처리 방법, 그에 따른 엔코딩 장치, 및 그에 따른 디코딩 장치
JP5505395B2 (ja) * 2011-10-28 2014-05-28 ヤマハ株式会社 音響処理装置
JP6096789B2 (ja) * 2011-11-01 2017-03-15 コーニンクレッカ フィリップス エヌ ヴェKoninklijke Philips N.V. オーディオオブジェクトのエンコーディング及びデコーディング
CN103188595B (zh) * 2011-12-31 2015-05-27 展讯通信(上海)有限公司 处理多声道音频信号的方法和系统
WO2013106390A1 (en) 2012-01-09 2013-07-18 Activevideo Networks, Inc. Rendering of an interactive lean-backward user interface on a television
CN103220058A (zh) * 2012-01-20 2013-07-24 旭扬半导体股份有限公司 音频数据与视觉数据同步装置及其方法
US9436929B2 (en) * 2012-01-24 2016-09-06 Verizon Patent And Licensing Inc. Collaborative event playlist systems and methods
ITTO20120067A1 (it) 2012-01-26 2013-07-27 Inst Rundfunktechnik Gmbh Method and apparatus for conversion of a multi-channel audio signal into a two-channel audio signal.
US9395304B2 (en) 2012-03-01 2016-07-19 Lawrence Livermore National Security, Llc Nanoscale structures on optical fiber for surface enhanced Raman scattering and methods related thereto
US9800945B2 (en) 2012-04-03 2017-10-24 Activevideo Networks, Inc. Class-based intelligent multiplexing over unmanaged networks
US9123084B2 (en) 2012-04-12 2015-09-01 Activevideo Networks, Inc. Graphical application integration with MPEG objects
TWI618050B (zh) 2013-02-14 2018-03-11 杜比實驗室特許公司 用於音訊處理系統中之訊號去相關的方法及設備
TWI618051B (zh) 2013-02-14 2018-03-11 杜比實驗室特許公司 用於利用估計之空間參數的音頻訊號增強的音頻訊號處理方法及裝置
US9830917B2 (en) 2013-02-14 2017-11-28 Dolby Laboratories Licensing Corporation Methods for audio signal transient detection and decorrelation control
WO2014126684A1 (en) * 2013-02-14 2014-08-21 Dolby Laboratories Licensing Corporation Time-varying filters for generating decorrelation signals
EP2956935B1 (en) 2013-02-14 2017-01-04 Dolby Laboratories Licensing Corporation Controlling the inter-channel coherence of upmixed audio signals
US9093064B2 (en) 2013-03-11 2015-07-28 The Nielsen Company (Us), Llc Down-mixing compensation for audio watermarking
WO2014145921A1 (en) 2013-03-15 2014-09-18 Activevideo Networks, Inc. A multiple-mode system and method for providing user selectable video content
US9478224B2 (en) * 2013-04-05 2016-10-25 Dolby International Ab Audio processing system
EP2989631A4 (en) * 2013-04-26 2016-12-21 Nokia Technologies Oy AUDIO SIGNAL ENCODER
MY204539A (en) 2013-05-24 2024-09-03 Dolby Int Ab Coding of audio scenes
CN105229731B (zh) 2013-05-24 2017-03-15 杜比国际公司 根据下混的音频场景的重构
WO2014191793A1 (en) * 2013-05-28 2014-12-04 Nokia Corporation Audio signal encoder
US9294785B2 (en) 2013-06-06 2016-03-22 Activevideo Networks, Inc. System and method for exploiting scene graph information in construction of an encoded video sequence
US9326047B2 (en) 2013-06-06 2016-04-26 Activevideo Networks, Inc. Overlay rendering of user interface onto source video
US9219922B2 (en) 2013-06-06 2015-12-22 Activevideo Networks, Inc. System and method for exploiting scene graph information in construction of an encoded video sequence
US9386558B2 (en) * 2013-06-27 2016-07-05 Microsoft Technology Licensing, Llc Radio channel utilization
CN105408955B (zh) * 2013-07-29 2019-11-05 杜比实验室特许公司 用于降低去相关器电路中瞬态信号的时间伪差的系统和方法
CN103413553B (zh) * 2013-08-20 2016-03-09 腾讯科技(深圳)有限公司 音频编码方法、音频解码方法、编码端、解码端和系统
ES3061991T3 (en) 2013-09-12 2026-04-08 Dolby Laboratories Licensing Corp Dynamic range control for a wide variety of playback environments
CN110675883B (zh) * 2013-09-12 2023-08-18 杜比实验室特许公司 用于下混合音频内容的响度调整
WO2015036350A1 (en) 2013-09-12 2015-03-19 Dolby International Ab Audio decoding system and audio encoding system
KR102244379B1 (ko) * 2013-10-21 2021-04-26 돌비 인터네셔널 에이비 오디오 신호들의 파라메트릭 재구성
KR101805327B1 (ko) * 2013-10-21 2017-12-05 돌비 인터네셔널 에이비 오디오 신호들의 파라메트릭 재구성을 위한 역상관기 구조
EP2866227A1 (en) 2013-10-22 2015-04-29 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Method for decoding and encoding a downmix matrix, method for presenting audio content, encoder and decoder for a downmix matrix, audio encoder and audio decoder
US9391575B1 (en) * 2013-12-13 2016-07-12 Amazon Technologies, Inc. Adaptive loudness control
WO2015089468A2 (en) * 2013-12-13 2015-06-18 Wu Tsai-Yi Apparatus and method for sound stage enhancement
WO2015104447A1 (en) 2014-01-13 2015-07-16 Nokia Technologies Oy Multi-channel audio signal classifier
US9779739B2 (en) 2014-03-20 2017-10-03 Dts, Inc. Residual encoding in an object-based audio system
US9788029B2 (en) 2014-04-25 2017-10-10 Activevideo Networks, Inc. Intelligent multiplexing using class-based, multi-dimensioned decision logic for managed networks
EP2980789A1 (en) * 2014-07-30 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for enhancing an audio signal, sound enhancing system
US10140996B2 (en) 2014-10-10 2018-11-27 Qualcomm Incorporated Signaling layers for scalable coding of higher order ambisonic audio data
US9984693B2 (en) * 2014-10-10 2018-05-29 Qualcomm Incorporated Signaling channels for scalable coding of higher order ambisonic audio data
HK1245671A1 (zh) 2015-05-29 2018-08-31 Armo Biosciences, Inc. 使用白细胞介素-10治疗疾病和病症的方法
US12125492B2 (en) 2015-09-25 2024-10-22 Voiceage Coproration Method and system for decoding left and right channels of a stereo sound signal
US10319385B2 (en) 2015-09-25 2019-06-11 Voiceage Corporation Method and system for encoding left and right channels of a stereo sound signal selecting between two and four sub-frames models depending on the bit budget
EP3369257B1 (en) * 2015-10-27 2021-08-18 Ambidio, Inc. Apparatus and method for sound stage enhancement
JP7008716B2 (ja) 2016-11-08 2022-01-25 フラウンホファー ゲセルシャフト ツール フェールデルンク ダー アンゲヴァンテン フォルシュンク エー.ファオ. サイドゲインおよび残余ゲインを使用してマルチチャネル信号を符号化または復号するための装置および方法
US10979844B2 (en) * 2017-03-08 2021-04-13 Dts, Inc. Distributed audio virtualization systems
CN108665902B (zh) 2017-03-31 2020-12-01 华为技术有限公司 多声道信号的编解码方法和编解码器
CN109215667B (zh) * 2017-06-29 2020-12-22 华为技术有限公司 时延估计方法及装置
EP3422738A1 (en) * 2017-06-29 2019-01-02 Nxp B.V. Audio processor for vehicle comprising two modes of operation depending on rear seat occupation
CN110998721B (zh) * 2017-07-28 2024-04-26 弗劳恩霍夫应用研究促进协会 用于使用宽频带滤波器生成的填充信号对已编码的多声道信号进行编码或解码的装置
US10535357B2 (en) 2017-10-05 2020-01-14 Qualcomm Incorporated Encoding or decoding of audio signals
GB201718341D0 (en) 2017-11-06 2017-12-20 Nokia Technologies Oy Determination of targeted spatial audio parameters and associated spatial audio playback
GB2572650A (en) 2018-04-06 2019-10-09 Nokia Technologies Oy Spatial audio parameters and associated spatial audio playback
GB2574239A (en) 2018-05-31 2019-12-04 Nokia Technologies Oy Signalling of spatial audio parameters
GB2574667A (en) * 2018-06-15 2019-12-18 Nokia Technologies Oy Spatial audio capture, transmission and reproduction
GB2580057A (en) * 2018-12-20 2020-07-15 Nokia Technologies Oy Apparatus, methods and computer programs for controlling noise reduction
EP3719799A1 (en) * 2019-04-04 2020-10-07 FRAUNHOFER-GESELLSCHAFT zur Förderung der angewandten Forschung e.V. A multi-channel audio encoder, decoder, methods and computer program for switching between a parametric multi-channel operation and an individual channel operation
FR3101741A1 (fr) * 2019-10-02 2021-04-09 Orange Détermination de corrections à appliquer à un signal audio multicanal, codage et décodage associés
KR102751332B1 (ko) 2019-11-18 2025-01-07 삼성전자주식회사 메모리 컨트롤러, 메모리 시스템 및 이의 동작 방법
WO2021252795A2 (en) 2020-06-11 2021-12-16 Dolby Laboratories Licensing Corporation Perceptual optimization of magnitude and phase for time-frequency and softmask source separation systems
WO2022097239A1 (ja) * 2020-11-05 2022-05-12 日本電信電話株式会社 音信号精製方法、音信号復号方法、これらの装置、プログラム及び記録媒体
EP4243014A4 (en) 2021-01-25 2024-07-17 Samsung Electronics Co., Ltd. DEVICE AND METHOD FOR PROCESSING A MULTI-CHANNEL AUDIO SIGNAL
EP4243015A4 (en) 2021-01-27 2024-04-17 Samsung Electronics Co., Ltd. AUDIO PROCESSING APPARATUS AND METHOD
US11451919B2 (en) 2021-02-19 2022-09-20 Boomcloud 360, Inc. All-pass network system for colorless decorrelation with constraints
EP4320615B1 (en) * 2021-04-06 2025-12-03 Dolby International AB Coding of envelope information of an audio downmix signal
CN113301329B (zh) * 2021-05-21 2022-08-05 康佳集团股份有限公司 基于图像识别的电视声场校正方法、装置及显示设备
KR20250052461A (ko) 2021-07-08 2025-04-18 붐클라우드 360 인코포레이티드 올패스 필터 네트워크를 사용한 고도 지각적 큐의 무색 생성
CN116962955A (zh) * 2022-04-15 2023-10-27 华为技术有限公司 多通道的混音方法、设备及介质
CN117730367A (zh) * 2023-10-31 2024-03-19 北京小米移动软件有限公司 分组方法、编码器、解码器以及存储介质
CN120388584B (zh) * 2025-06-27 2025-09-23 西南科技大学 一种针对工业设备作业过程中的声音异常监测处理方法和系统

Family Cites Families (48)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5091945A (en) * 1989-09-28 1992-02-25 At&T Bell Laboratories Source dependent channel coding with error protection
KR100228688B1 (ko) * 1991-01-08 1999-11-01 쥬더 에드 에이. 다차원 음장용 인코우더/디코우더
US5291557A (en) * 1992-10-13 1994-03-01 Dolby Laboratories Licensing Corporation Adaptive rematrixing of matrixed audio signals
DE4409368A1 (de) * 1994-03-18 1995-09-21 Fraunhofer Ges Forschung Verfahren zum Codieren mehrerer Audiosignale
EP0688113A2 (en) * 1994-06-13 1995-12-20 Sony Corporation Method and apparatus for encoding and decoding digital audio signals and apparatus for recording digital audio
JP3397001B2 (ja) * 1994-06-13 2003-04-14 ソニー株式会社 符号化方法及び装置、復号化装置、並びに記録媒体
US6029129A (en) * 1996-05-24 2000-02-22 Narrative Communications Corporation Quantizing audio data using amplitude histogram
JP3887827B2 (ja) * 1997-04-10 2007-02-28 ソニー株式会社 符号化方法及び装置、復号化方法及び装置、並びに記録媒体
US5890125A (en) 1997-07-16 1999-03-30 Dolby Laboratories Licensing Corporation Method and apparatus for encoding and decoding multiple audio channels at low bit rates using adaptive selection of encoding method
US6437944B2 (en) 1997-10-20 2002-08-20 Fujitsu Limited Head slider supporting device, disk device and suspension
US6122619A (en) 1998-06-17 2000-09-19 Lsi Logic Corporation Audio decoder with programmable downmixing of MPEG/AC-3 and method therefor
US6322189B1 (en) 1999-01-13 2001-11-27 Hewlett-Packard Company Multiple printhead apparatus with temperature control and method
US6578074B1 (en) 1999-06-25 2003-06-10 Mediaone Group, Inc. Provisioning server enhancement
JP2001100792A (ja) * 1999-09-28 2001-04-13 Sanyo Electric Co Ltd 符号化方法、符号化装置およびそれを備える通信システム
JP4424566B2 (ja) 1999-10-26 2010-03-03 ザ・インクテック株式会社 アルカリ可溶性接着剤
JP2002175097A (ja) * 2000-12-06 2002-06-21 Yamaha Corp 音声信号のエンコード/圧縮装置およびデコード/伸長装置
JP3951690B2 (ja) * 2000-12-14 2007-08-01 ソニー株式会社 符号化装置および方法、並びに記録媒体
US7292901B2 (en) * 2002-06-24 2007-11-06 Agere Systems Inc. Hybrid multi-channel/cue coding/decoding of audio signals
US7583805B2 (en) 2004-02-12 2009-09-01 Agere Systems Inc. Late reverberation-based synthesis of auditory scenes
SE0202159D0 (sv) * 2001-07-10 2002-07-09 Coding Technologies Sweden Ab Efficientand scalable parametric stereo coding for low bitrate applications
TW569551B (en) 2001-09-25 2004-01-01 Roger Wallace Dressler Method and apparatus for multichannel logic matrix decoding
GB0124580D0 (en) 2001-10-12 2001-12-05 Univ Reading New composition
BR0206611A (pt) 2001-11-23 2004-02-17 Koninkl Philips Electronics Nv Método usando fontes de ruìdo sintéticas em um sistema de codificação de áudio de multi-canais para codificar um conjunto de sinais de áudio, codificador, para codificar canais de áudio codificados, decodificador para receber canais de áudio codificados e transformados, e, portador de dados
US6890125B1 (en) 2002-01-30 2005-05-10 Calder Brothers Corporation Adjustable screed system
KR20040091110A (ko) 2002-03-07 2004-10-27 코닌클리케 필립스 일렉트로닉스 엔.브이. 사용자 제어 다중-채널 오디오 변환 시스템
JP4805541B2 (ja) * 2002-04-10 2011-11-02 コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ ステレオ信号の符号化
US7933415B2 (en) * 2002-04-22 2011-04-26 Koninklijke Philips Electronics N.V. Signal synthesizing
JP4714415B2 (ja) * 2002-04-22 2011-06-29 コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ パラメータによるマルチチャンネルオーディオ表示
EP1500084B1 (en) * 2002-04-22 2008-01-23 Koninklijke Philips Electronics N.V. Parametric representation of spatial audio
EP1502361B1 (en) * 2002-05-03 2015-01-14 Harman International Industries Incorporated Multi-channel downmixing device
BR0305434A (pt) * 2002-07-12 2004-09-28 Koninkl Philips Electronics Nv Métodos e arranjos para codificar e para decodificar um sinal de áudio multicanal, aparelhos para fornecer um sinal de áudio codificado e um sinal de áudio decodificado, sinal de áudio multicanal codificado, e, meio de armazenagem
AU2003259213A1 (en) 2002-07-23 2004-02-09 Cargill, Incorporated Process for treating corn and millets
KR20040043743A (ko) * 2002-11-19 2004-05-27 주식회사 디지털앤디지털 멀티채널 검색장치와 방법
RU2006111442A (ru) 2003-09-10 2006-09-10 Эй.Ди.Ай. ВИДЕО ТЕКНОЛОДЖИЗ ЛТД. (IL) Устройство, система и способ многоканальной обработки
US7447317B2 (en) * 2003-10-02 2008-11-04 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V Compatible multi-channel coding/decoding by weighting the downmix channel
US7394903B2 (en) * 2004-01-20 2008-07-01 Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. Apparatus and method for constructing a multi-channel output signal or for generating a downmix signal
US20050169846A1 (en) 2004-01-31 2005-08-04 Bart Kennington Enhancement of fragrance release from candles
US7805313B2 (en) * 2004-03-04 2010-09-28 Agere Systems Inc. Frequency-based coding of channels in parametric multi-channel coding systems
SE0400998D0 (sv) 2004-04-16 2004-04-16 Cooding Technologies Sweden Ab Method for representing multi-channel audio signals
US7508947B2 (en) * 2004-08-03 2009-03-24 Dolby Laboratories Licensing Corporation Method for combining audio signals using auditory scene analysis
US7961890B2 (en) 2005-04-15 2011-06-14 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung, E.V. Multi-channel hierarchical audio coding with compact side information
JP2007096002A (ja) * 2005-09-29 2007-04-12 Matsushita Electric Ind Co Ltd 半導体装置の製造方法および半導体装置
WO2007083952A1 (en) * 2006-01-19 2007-07-26 Lg Electronics Inc. Method and apparatus for processing a media signal
JP2008003007A (ja) * 2006-06-23 2008-01-10 Fujitsu Ltd 個体認識方法及び装置、個体認識範囲調整方法、及びプログラム
JP5228305B2 (ja) 2006-09-08 2013-07-03 ソニー株式会社 表示装置、表示方法
JP5337941B2 (ja) 2006-10-16 2013-11-06 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ マルチチャネル・パラメータ変換のための装置および方法
JP5883561B2 (ja) 2007-10-17 2016-03-15 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ アップミックスを使用した音声符号器
JP5428564B2 (ja) 2009-06-18 2014-02-26 東洋紡株式会社 車両内装材用部材およびそれを用いた車両用内装材

Also Published As

Publication number Publication date
US9972329B2 (en) 2018-05-15
US20190320263A1 (en) 2019-10-17
US20130236021A1 (en) 2013-09-12
US20180054676A9 (en) 2018-02-22
KR100848365B1 (ko) 2008-07-24
HK1093594A1 (en) 2007-03-02
US20160203822A1 (en) 2016-07-14
PL1735775T3 (pl) 2009-04-30
US20220159379A1 (en) 2022-05-19
US20170229131A1 (en) 2017-08-10
US10499155B2 (en) 2019-12-03
US10015597B2 (en) 2018-07-03
JP2007531027A (ja) 2007-11-01
JP4603037B2 (ja) 2010-12-22
EP1735775B8 (en) 2008-11-19
EP1695338B1 (en) 2007-09-12
JP5185340B2 (ja) 2013-04-17
US20200304913A1 (en) 2020-09-24
KR20070001226A (ko) 2007-01-03
US20170229127A1 (en) 2017-08-10
ATE373301T1 (de) 2007-09-15
US20070002971A1 (en) 2007-01-04
US20160203823A1 (en) 2016-07-14
KR20070001162A (ko) 2007-01-03
KR100848367B1 (ko) 2008-07-24
US8693696B2 (en) 2014-04-08
JP5185337B2 (ja) 2013-04-17
TWI334736B (en) 2010-12-11
HK1144043A1 (zh) 2011-01-21
SE0400998D0 (sv) 2004-04-16
DE602005002942D1 (de) 2007-11-29
EP1735775B1 (en) 2007-10-17
PL1695338T3 (pl) 2008-02-29
US10440474B2 (en) 2019-10-08
EP1735775A1 (en) 2006-12-27
US20170229130A1 (en) 2017-08-10
US20230345176A1 (en) 2023-10-26
US20110002470A1 (en) 2011-01-06
US20170238113A1 (en) 2017-08-17
ES2293578T3 (es) 2008-03-16
US20170229126A1 (en) 2017-08-10
DE602005002451T2 (de) 2008-06-12
US9972330B2 (en) 2018-05-15
US10250985B2 (en) 2019-04-02
DE602005002942T2 (de) 2008-07-24
US10129645B2 (en) 2018-11-13
US10244321B2 (en) 2019-03-26
DE602005002451D1 (de) 2007-10-25
US20170229128A1 (en) 2017-08-10
CN1965351A (zh) 2007-05-16
US20110075848A1 (en) 2011-03-31
US7986789B2 (en) 2011-07-26
US20070258607A1 (en) 2007-11-08
CN1965351B (zh) 2011-05-11
JP4589962B2 (ja) 2010-12-01
EP1695338A1 (en) 2006-08-30
US10271142B2 (en) 2019-04-23
US20170148450A1 (en) 2017-05-25
JP2007532960A (ja) 2007-11-15
JP2011018060A (ja) 2011-01-27
US20170238112A1 (en) 2017-08-17
US9743185B2 (en) 2017-08-22
WO2005101370A1 (en) 2005-10-27
CN1930608A (zh) 2007-03-14
US8223976B2 (en) 2012-07-17
US11184709B2 (en) 2021-11-23
CN1930608B (zh) 2010-05-05
US9621990B2 (en) 2017-04-11
US8538031B2 (en) 2013-09-17
US20170236523A1 (en) 2017-08-17
JP2011030228A (ja) 2011-02-10
ATE376240T1 (de) 2007-11-15
US11647333B2 (en) 2023-05-09
US12075224B2 (en) 2024-08-27
US20170229129A1 (en) 2017-08-10
HK1163911A1 (en) 2012-09-14
WO2005101371A1 (en) 2005-10-27
CN102157155A (zh) 2011-08-17
US20140236604A1 (en) 2014-08-21
US10244319B2 (en) 2019-03-26
CN101860784B (zh) 2016-02-17
US9972328B2 (en) 2018-05-15
US20200021915A1 (en) 2020-01-16
CN102157155B (zh) 2014-07-02
TW200637415A (en) 2006-10-16
US10244320B2 (en) 2019-03-26
US10623860B2 (en) 2020-04-14
US10250984B2 (en) 2019-04-02
US20170229132A1 (en) 2017-08-10
US9635462B2 (en) 2017-04-25
CN101860784A (zh) 2010-10-13

Similar Documents

Publication Publication Date Title
ES2294703T3 (es) Metodo para representar señales de audio multicanal.
HK1093594B (en) Apparatus and method for generating a level parameter and apparatus and method for generating a multi-channel representation