ES2995102T3 - Concept for audio decoding for audio channels and audio objects - Google Patents

Concept for audio decoding for audio channels and audio objects Download PDF

Info

Publication number
ES2995102T3
ES2995102T3 ES22159568T ES22159568T ES2995102T3 ES 2995102 T3 ES2995102 T3 ES 2995102T3 ES 22159568 T ES22159568 T ES 22159568T ES 22159568 T ES22159568 T ES 22159568T ES 2995102 T3 ES2995102 T3 ES 2995102T3
Authority
ES
Spain
Prior art keywords
audio
channels
objects
decoder
encoded
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES22159568T
Other languages
English (en)
Inventor
Alexander Adami
Christian Borss
Sascha Dick
Christian Ertel
Simone NEUKAM
Jürgen Herre
Johannes Hilpert
Andreas Hölzer
Michael Kratschmer
Fabian Küch
Achim Kuntz
Adrian Murtaza
Jan Plogsties
Andreas Silzle
Hanne Stenzel
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Application granted granted Critical
Publication of ES2995102T3 publication Critical patent/ES2995102T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/028Noise substitution, i.e. substituting non-tonal spectral components by noisy source
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • G10L19/20Vocoders using multiple modes using sound class specific coding, hybrid encoders or object based coding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • G10L19/22Mode decision, i.e. based on audio signal content versus external parameters
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S3/00Systems employing more than two channels, e.g. quadraphonic
    • H04S3/008Systems employing more than two channels, e.g. quadraphonic in which the audio signals are in digital form, i.e. employing more than two discrete digital channels
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/03Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/11Positioning of individual sound objects, e.g. moving airplane, within a sound field

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Acoustics & Sound (AREA)
  • Health & Medical Sciences (AREA)
  • Human Computer Interaction (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • Mathematical Physics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Stereophonic System (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Management Or Editing Of Information On Record Carriers (AREA)
  • Circuit For Audible Band Transducer (AREA)

Abstract

Descodificador de audio para decodificar datos de audio codificados, que comprende: una interfaz de entrada (1100) para recibir los datos de audio codificados, comprendiendo los datos de audio codificados una pluralidad de canales codificados o una pluralidad de objetos codificados o metadatos comprimidos relacionados con la pluralidad de objetos; un decodificador central (1300) para decodificar la pluralidad de canales codificados y la pluralidad de objetos codificados; un descompresor de metadatos (1400) para descomprimir los metadatos comprimidos; un procesador de objetos (1200) para procesar la pluralidad de objetos decodificados utilizando los metadatos descomprimidos para obtener un número de canales de salida (1205) que comprenden datos de audio de los objetos y los canales decodificados; y un postprocesador (1700) para convertir el número de canales de salida (1205) en un formato de salida, en donde el decodificador de audio está configurado para omitir el procesador de objetos y para alimentar una pluralidad de canales decodificados al postprocesador (1700), cuando los datos de audio codificados no contienen ningún objeto de audio y para alimentar la pluralidad de objetos decodificados y la pluralidad de canales decodificados al procesador de objetos (1200), cuando los datos de audio codificados comprenden canales codificados y objetos codificados. (Traducción automática con Google Translate, sin valor legal)

Description

DESCRIPCIÓN
Concepto para descodificación de audio para canales de audio y objetos de audio
Especificación
[0001]La presente invención se refiere a codificación/ descodificación de audio y, en particular, a codificación de audio espacial y codificación de un objeto de audio espacial.
[0002]Las herramientas de codificación de audio espacial son bien conocidas en la técnica y están, por ejemplo, estandarizadas en el estándar envolvente MPEG. La codificación de audio espacial comienza con canales de entrada originales, tales como cinco o siete canales que se identifican por su colocación en una configuración de reproducción, es decir, un canal izquierdo, un canal central, un canal derecho, un canal envolvente izquierdo, un canal envolvente derecho y un canal de realce de baja frecuencia. Un codificador de audio espacial normalmente deriva uno o más canales dedownmixde los canales originales y, de forma adicional, deriva datos paramétricos relacionados con señales espaciales, tales como diferencias de nivel entre canales en los valores de coherencia de canal, diferencias de fase entre canales, diferencias de tiempo entre canales, etc. Los uno o más canales dedownmixse transmiten junto con la información lateral paramétrica que indica las señales espaciales a un descodificador de audio espacial que descodifica el canal dedownmixy los datos paramétricos asociados con el fin de obtener finalmente canales de salida que son una versión aproximada de los canales de entrada originales. La colocación de los canales en la configuración de salida es normalmente fija y es, por ejemplo, un formato 5.1, un formato 7.1, etc.
[0003]De forma adicional, las herramientas de codificación de un objeto de audio espacial son bien conocidas en la técnica y están estandarizadas en el estándar SAOC de MPEG (SAOC: del inglés«Spatial Audio Object Coding»,codificación de un objeto de audio espacial, MPEG: del inglés«Moving Picture Experts Group»,grupo de expertos en imágenes en movimiento). A diferencia de una codificación de audio espacial que se inicia en canales originales, la codificación de un objeto de audio espacial comienza con objetos de audio que no se dedican automáticamente a una determinada configuración de la reproducción de renderizado. En su lugar, la colocación de los objetos de audio en la escena de reproducción es flexible y puede ser determinada por el usuario al introducir determinada información de renderizado en un descodificador de codificación de objetos de audio espacial. De forma alternativa o adicional, la información de renderizado, es decir, la información en cuya posición en la configuración de reproducción deberá colocarse un determinado objeto de audio normalmente con el paso del tiempo puede transmitirse como información lateral adicional o metadatos. Con el fin de obtener una determinada compresión de datos, una cantidad de objetos de audio se codifican por medio de un codificador de SAOC que calcula, a partir de los objetos de entrada, uno o más canales de transporte mediantedownmixingde los objetos según determinada información del proceso dedownmix.Además, el codificador de SAOC calcula información lateral paramétrica que representa señales entre objetos, tales como diferencias en el nivel de objetos (OLD, por sus siglas en inglés), valores de coherencia de objetos, etc. Como ocurre en SAC (del inglés«Spatial Audio Coding»,codificación de audio espacial), los datos paramétricos entre objetos se calculan para bloques individuales de tiempo/frecuencia, es decir, para un determinado cuadro de la señal de audio que comprende, por ejemplo, 1024 o 2048 muestras, se tienen en cuenta 24, 32, o 64, etc., bandas de frecuencia de modo que, al final, existen datos paramétricos para cada cuadro y cada banda de frecuencia. Como ejemplo, cuando una pieza de audio tiene 20 cuadros y cuando cada cuadro se subdivide en 32 bandas de frecuencia, la cantidad de bloques de tiempo/frecuencia es de 640.
[0004]Hasta ahora no existe una tecnología flexible que combine codificación de canales por un lado y codificación de objetos por otro, de modo que se obtengan calidades de audio aceptables a bajas tasas de bits.
[0005]El documento WO 201212544 A1 describe una solución integral para crear, codificar, transmitir, descodificar y reproducir bandas sonoras de audio espacial. El formato de codificación de bandas sonoras proporcionado es compatible con los formatos de codificación de sonido envolvente heredados, de modo que las bandas sonoras codificadas en el nuevo formato pueden descodificarse y reproducirse en equipos de reproducción heredados sin pérdida de calidad en comparación con los formatos heredados. Los objetos de audio se incluyen en undownmixbase en el lado del codificador, y eldownmixasí obtenido y los objetos de audio codificados explícitamente se transmiten a un lado del descodificador. En el lado del descodificador, los objetos se eliminan deldownmixtransmitido y se renderizan y combinan por separado con eldownmixresidual correspondiente aldownmixbase.
[0006]El documento US 2010324915 A1 describe un aparato de codificación para un códec de audio multicanal de alta calidad (HQMAC, por sus siglas en inglés) y un aparato de descodificación para dicho HQMAC. Los aparatos de codificación/descodificación del HQMAC pueden realizar una codificación basada en canales del códec de audio multicanal de alta calidad (HQMAC-CB, por sus siglas en inglés) o una descodificación HQMAC-CB según las características de las señales de audio de entrada para proporcionar compatibilidad con un canal inferior.
[0007]Es un objeto de la presente invención proporcionar un concepto mejorado para la descodificación de audio.
[0008]Este objeto se logra mediante un descodificador de audio según la reivindicación 1, un procedimiento de descodificación de audio según la reivindicación 16 o un programa informático según la reivindicación 17.
[0009]La presente invención se basa en el hallazgo de que un sistema óptimo que sea flexible por un lado y proporcione una buena eficiencia de compresión con una buena calidad de audio por otro, se logra mediante la combinación de la codificación de audio espacial, es decir, la codificación de audio basada en canales, con la codificación de un objeto de audio espacial, es decir, la codificación basada en objetos. En particular, proporcionar un mezclador para mezclar los objetos y los canales que ya se encuentran en el lado del codificador proporciona una buena flexibilidad, particularmente para aplicaciones de baja tasa de bits, dado que, en ese caso, puede resultar innecesaria cualquier transmisión de objetos, o la cantidad de objetos que deben transmitirse puede reducirse. Por otro lado, se requiere flexibilidad para que el codificador de audio pueda controlarse en dos modos diferentes, es decir, en un modo donde los objetos se mezclan con los canales antes de someterse a codificación principal, mientras que, en el otro modo, los datos de objetos, por un lado, y los datos de canal, por otro lado, se someten directamente a codificación principal sin ninguna mezcla entre ambos.
[0010]Esto garantiza que el usuario pueda separar los objetos y canales procesados en el lado del codificador de modo que se disponga de una flexibilidad total en el lado del descodificador, aunque a cambio de una mayor tasa de bits. Por otro lado, cuando los requisitos de tasa de bits son más rigurosos, la presente invención ya permite realizar una mezcla/prerrenderizado en el lado del codificador, es decir, que algunos o todos los objetos de audio ya se encuentran mezclados con los canales, de modo que el codificador principal únicamente codifica datos de canal y no se requieren bits para transmitir datos de objeto de audio, ni en forma dedownmixni en forma de datos paramétricos entre objetos requieren.
[0011]En el lado del descodificador, el usuario una vez más tiene una alta flexibilidad debido a que el mismo descodificador de audio permite el funcionamiento en dos modos diferentes, es decir, en un primer modo donde se realiza la codificación de objetos y canales individuales o separados y el descodificador tiene total flexibilidad para renderizar los objetos y mezclarlos con los datos de canal. Por otro lado, cuando ya se ha realizado una mezcla/renderizado previo en el lado del codificador, el descodificador se configura para realizar un posprocesamiento sin procesamiento intermedio de objetos. Por otro lado, el posprocesamiento también puede aplicarse a los datos en el otro modo, es decir, cuando el renderizado/la mezcla de objetos se realiza en el lado del descodificador. De este modo, la presente invención permite un marco de tareas de procesamiento que permite una gran reutilización de recursos, no solamente en el lado del codificador, sino también en el lado del descodificador. El posprocesamiento puede referirse aldownmixingy binauralización o cualquier otro procesamiento para obtener un escenario final de canales, tal como una disposición de reproducción pretendida.
[0012]Además, en caso de unos muy bajos requisitos de tasa de bits, la presente invención proporciona al usuario la suficiente flexibilidad para reaccionar a dichos bajos requisitos de tasa de bits, es decir, mediante renderizado previo en el lado del codificador, de modo que, aunque a cambio de cierta flexibilidad, se obtiene, no obstante, una muy buena calidad de audio en el lado del descodificador debido a que los bits que se han ahorrado al dejar de proporcionar datos de objetos del codificador al descodificador pueden usarse para codificar mejor los datos de canal, tal como mediante una cuantificación más precisa de los datos de canal o por otros medios, para mejorar la calidad o para reducir la pérdida por codificación cuando se encuentran disponibles bits suficientes.
[0013]En una realización preferida de la presente invención, el codificador comprende de forma adicional un codificador de SAOC y, además, permite no solo codificar la entrada de objetos en el codificador, sino también codificar datos de canal mediante SAOC con el fin de obtener una buena calidad de audio, incluso con requisitos de tasa de bits más bajos. Otras realizaciones de la presente invención permiten una funcionalidad de posprocesamiento que comprende un renderizador binaural y/o un conversor de formato. Además, se prefiere que todo el procesamiento en el lado del descodificador ya se realice para una determinada cantidad elevada de altavoces, tal como una configuración de altavoces de 22 o 32 canales. Sin embargo, a continuación, el conversor de formato, por ejemplo, determina que únicamente se requiere una salida de 5.1, es decir, una salida para una disposición de reproducción que tenga una cantidad menor que la cantidad máxima de canales. En ese caso, se prefiere que el conversor de formato controle o bien el descodificador de USAC o el descodificador de SAOC, o ambos dispositivos, para restringir la operación de descodificación principal y la operación de descodificación de SAOC de modo que cualquier canal que, al final, no obstante, se someta adownmixingen una conversión de formato no se genere en la descodificación. Normalmente, la generación de canales sometidos aupmixingrequiere procesamiento de decorrelación, y cada procesamiento de decorrelación introduce cierto nivel de artefactos. Por lo tanto, al controlar el descodificador principal y/o el descodificador de SAOC mediante el formato de salida finalmente requerido, se ahorra una gran cantidad de procesamiento de decorrelación adicional en comparación con una situación donde no existe esta interacción. Esto no solo se traduce en una mejora de la calidad de audio, sino que también se traduce en una menor complejidad del descodificador y, al final, en un menor consumo de energía, lo cual resulta particularmente útil para dispositivos móviles que alberguen el codificador o el descodificador inventivo. No obstante, los codificadores/descodificadores inventivos no solo pueden introducirse en dispositivos móviles, tales como teléfonos móviles, teléfonos inteligentes, ordenadores portátiles(notebooks)o dispositivos de navegación, sino que también pueden usarse en ordenadores de escritorio sencillos o cualquier otro aparato no móvil.
[0014]La implementación anterior, es decir, no generar algunos canales, puede no resultar óptima, dado que puede perderse cierta información (tal como la diferencia de nivel entre los canales que se sometan adownmixing).Dicha información de diferencia de nivel puede no ser crítica, pero puede producir una señal de salida dedownmixdiferente, si eldownmixingaplica diferentes ganancias dedownmixa los canales sometidos adownmixing.Una solución mejorada únicamente desactiva la decorrelación en laupmix,pero sigue generando todos los canales deupmixcon las diferencies de nivel correctas (como señaliza la SAC paramétrica). La segunda solución produce una mejor calidad de audio, pero la primera solución se traduce en una mayor reducción de la complejidad.
[0015]A continuación, se describen las realizaciones preferidas haciendo referencia a los dibujos adjuntos, donde:
La FIG. 1 ilustra un primer ejemplo de un codificador;
La FIG. 2 ilustra una primera realización de un descodificador;
La FIG. 3 ilustra un segundo ejemplo de un codificador;
La FIG. 4 ilustra una segunda realización de un descodificador;
La FIG. 5 ilustra un tercer ejemplo de un codificador;
La FIG. 6 ilustra una tercera realización de un descodificador;
La FIG. 7 ilustra un mapa que indica los distintos modos de funcionamiento de los codificadores/descodificadores según las realizaciones de la presente invención;
La FIG. 8 ilustra una implementación específica del conversor de formato;
La FIG. 9 ilustra una implementación específica del conversor binaural;
La FIG. 10 ilustra una implementación específica del descodificador principal; y
La FIG. 11 ilustra una implementación específica de un codificador para procesar un elemento de cuádruple canal (QCE, por sus siglas en inglés) y el correspondiente descodificador QCE.
[0016]La Figura 1 ilustra un codificador según un ejemplo de la presente invención. El codificador se configura para codificar datos de entrada de audio 101 para obtener datos de salida de audio 501. El codificador comprende una interfaz de salida para recibir una pluralidad de canales de audio indicados como CH y una pluralidad de objetos de audio indicados como OBJ. Además, como se ilustra en la Figura 1, la interfaz de entrada 100, de forma adicional, recibe metadatos relacionados con uno o más de la pluralidad de objetos de audio OBJ. Además, el codificador comprende un mezclador 200 para mezclar la pluralidad de objetos y la pluralidad de canales con el fin de obtener una pluralidad de canales previamente mezclados, donde cada canal previamente mezclado comprende datos de audio de un canal y datos de audio de al menos un objeto.
[0017]Además, el codificador comprende un codificador principal 300 para realizar la codificación principal de datos de entrada del codificador principal y un compresor de metadatos 400 para comprimir los metadatos relacionados con uno o más de la pluralidad de objetos de audio. Además, el codificador puede comprender un controlador de modos 600 para controlar el mezclador, el codificador principal y/o una interfaz de salida 500 en uno de varios modos de funcionamiento, donde en el primer modo, el codificador principal se configura para codificar la pluralidad de canales de audio y la pluralidad de objetos de audio recibidos por la interfaz de entrada 100 sin ninguna interacción del mezclador, es decir, sin que el mezclador 200 realice ninguna mezcla. Sin embargo, en un segundo modo donde el mezclador 200 está activo, el codificador principal codifica la pluralidad de canales mezclados, es decir, la salida generada por el bloque 200. En este último caso, se prefiere no codificar datos de objetos adicionales. En su lugar, el mezclador 200 ya utiliza los metadatos que indican las posiciones de los objetos de audio para renderizar los objetos en los canales, tal y como indican los metadatos. Dicho de otro modo, el mezclador 200 utiliza los metadatos relacionados con la pluralidad de objetos de audio para prerrenderizar los objetos de audio y, a continuación, los objetos de audio previamente renderizados se mezclan con los canales para obtener canales mezclados en la salida del mezclador. En este ejemplo, es posible que no se transmitan necesariamente objetos, y esto también se aplica a los metadatos comprimidos como salida por el bloque 400. No obstante, si no se mezclan todos los objetos introducidos en la interfaz 100, sino únicamente una determinada cantidad de objetos, solo se transmiten de todas formas al codificador principal 300 o al compresor de metadatos 400, respectivamente, los objetos no mezclados anteriormente y los metadatos asociados.
[0018]La Figura 3 ilustra un ejemplo adicional de un codificador que, de forma adicional, comprende un codificador de SAOC 800. El codificador de SAOC 800 se configura para generar uno o más canales de transporte y datos paramétricos a partir de los datos de entrada del codificador de objetos de audio espacial. Como se ilustra en la Figura 3, los datos de entrada del codificador de objeto de audio espaciales son objetos que no han sido procesados por el prerrenderizador/ mezclador. Alternativamente, siempre que se haya omitido el prerrenderizador/ mezclador, como en el modo uno, donde está activa una codificación de objetos/canales individuales, todas las entradas de objetos en la interfaz de entrada 100 se codifican por medio del codificador de SAOC 800.
[0019]Además, como se ilustra en la Figura 3, el codificador principal 300 se implementa preferentemente como un codificador USAC, es decir, como un codificador tal y como se define y estandariza en el estándar MPEG-USAC (del inglés«Unified Speech and Audio Coding»,codificación unificada de voz y audio). La salida del codificador completo que se ilustra en la Figura 3 es un flujo de datos MPEG 4 que tiene estructuras similares a un contenedor para distintos tipos de datos. Además, los metadatos se indican como datos «OAM» y el compresor de metadatos 400 de la Figura 1 corresponde al codificador OAM 400 para obtener datos OAM comprimidos que se introducen en el codificador de USAC 300 que, como puede observarse en la Figura 3, comprende de forma adicional la interfaz de salida para obtener el flujo de datos de salida MP4, que no solo contiene los datos de objeto/canal codificados, sino que también contiene los datos OAM comprimidos.
[0020]La Figura 5 ilustra un ejemplo adicional del codificador, donde a diferencia de la Figura 3, el codificador de SAOC puede configurarse de forma indistinta para codificar, con el algoritmo de codificación de SAOC, los canales provistos en el prerrenderizador/mezclador 200 que no están activos en este modo o, alternativamente, para codificar mediante SAOC los canales previamente renderizados más los objetos. De este modo, en la Figura 5, el codificador de SAOC 800 puede funcionar con tres clases diferentes de datos de entrada, es decir, canales sin ningún objeto previamente renderizado, canales y objetos previamente renderizados, o únicamente objetos. Además, se prefiere proporcionar un descodificador OAM adicional 420 en la Figura 5, de modo que el codificador de SAOC 800 use, para su procesamiento, los mismos datos que en el lado del descodificador, es decir, datos obtenidos por una compresión con pérdida en lugar de los datos OAM originales.
[0021]El codificador de la Figura 5 puede funcionar en varios modos distintos.
[0022]Además del primero y segundo modo, como se mencionó en relación con la Figura 1, el codificador de la Figura 5 puede funcionar, de forma adicional, en un tercer modo donde el codificador principal genera los uno o más canales de transporte a partir de los objetos individuales cuando el prerrenderizador/mezclador 200 no estaba activo. De forma alternativa o adicional, en este tercer modo el codificador de SAOC 800 puede generar uno o más canales de transporte alternativos o adicionales a los canales originales, es decir, de nuevo cuando el prerrenderizador/mezclador 200 correspondiente al mezclador 200 de la Figura 1 no estaba activo.
[0023]Por último, el codificador de SAOC 800 puede codificar, cuando el codificador se configura en el cuarto modo, los canales más objetos previamente renderizados según los genera el prerrenderizador /mezclador. De este modo, en el cuarto modo, las aplicaciones con menor tasa de bits ofrecerán buena calidad dado que los canales y objetos se han transformado por completo en canales de transporte de SAOC individuales y la información lateral asociada, que se indica como «SAOC-SI» en las Figuras 3 y 5, y, de forma adicional, no tienen por qué transmitirse metadatos no comprimidos en este cuarto modo.
[0024]La Figura 2 ilustra un descodificador según una realización de la presente invención. El descodificador recibe, como entrada, los datos de audio codificados, es decir, los datos 501 de la Figura 1. El descodificador comprende un descompresor de metadatos 1400, un descodificador principal 1300, un procesador de objetos 1200, un controlador de modos 1600 y un posprocesador 1700.
[0025]Específicamente, el descodificador de audio configura para descodificar datos de audio codificados y la interfaz de entrada se configura para recibir los datos de audio codificados, comprendiendo los datos de audio codificados una pluralidad de canales codificados y la pluralidad de objetos codificados y metadatos comprimidos relacionados con la pluralidad de objetos en un determinado modo.
[0026]Además, el descodificador principal 1300 se configura para descodificar la pluralidad de canales codificados y la pluralidad de objetos codificados y, de forma adicional, el descompresor de metadatos se configura para descomprimir los metadatos comprimidos.
[0027]Además, el procesador de objetos 1200 se configura para procesar la pluralidad de objetos descodificados según los genera el descodificador principal 1300 utilizando los metadatos descomprimidos para obtener una cantidad predeterminada de canales de salida que comprende datos de objeto y los canales descodificados. Estos canales de salida, tal y como se indica en 1205, a continuación, se introducen en un posprocesador 1700. El posprocesador 1700 se configura para convertir la cantidad de canales de salida 1205 en un determinado formato de salida, que puede ser un formato de salida binaural o un formato de salida por altavoz, tal como un formato de salida 5.1, 7.1, etc.
[0028]El descodificador comprende un controlador de modos 1600 que se configura para analizar los datos codificados para detectar una indicación de modo. Por lo tanto, el controlador de modos 1600 está conectado a la interfaz de entrada 1100 en la Figura 2. El descodificador de audio de la Figura 2 y, controlado por el controlador de modos 1600, se configura para omitir el procesador de objetos y para introducir la pluralidad de canales descodificados al posprocesador 1700. Este es el funcionamiento en el modo 2, es decir, donde solo se reciben canales previamente renderizados, es decir, cuando se ha aplicado el modo 2 en el codificador de la Figura 1. Alternativamente, cuando se ha aplicado el modo 1 en el codificador, es decir, cuando el codificador ha realizado la codificación de canales/objetos individuales, no se omite el procesador de objetos 1200, sino que la pluralidad de canales descodificados y la pluralidad de objetos descodificados se introducen en el procesador de objetos 1200 junto con los metadatos descomprimidos generados por el descompresor de metadatos 1400.
[0029]Según la invención, la indicación de si debe aplicarse el modo 1 o el modo 2 se incluye los datos de audio codificados y luego el controlador de modos 1600 analiza los datos codificados para detectar una indicación de modo. Se usa el modo 1 cuando la indicación de modo indica que los datos de audio codificados comprenden canales codificados y objetos codificados y se aplica el modo 2 cuando la indicación de modo indica que los datos de audio codificados no contienen ningún objeto de audio, es decir, únicamente contienen canales previamente renderizados obtenidos mediante el modo 2 del codificador de la Figura 1.
[0030]La Figura 4 ilustra una realización preferida comparada con la del descodificador de la Figura 2, y la realización de la Figura 4 corresponde al codificador de la Figura 3. Además de la implementación del descodificador de la Figura 2, el descodificador de la Figura 4 comprende un descodificador de SAOC 1800. Además, el procesador de objetos 1200 de la Figura 2 se implementa como un renderizador de objetos por separado 1210 y el mezclador 1220 mientras que, dependiendo del modo, la funcionalidad del renderizador de objetos 1210 también puede implementarse mediante el descodificador de SAOC 1800.
[0031]Además, el posprocesador 1700 puede implementarse como un renderizador binaural 1710 o un conversor de formato 1720. Alternativamente, una salida directa de datos 1205 de la Figura 2 también puede implementarse como se ilustra por medio de 1730. Por lo tanto, se prefiere realizar el procesamiento en el descodificador sobre la cantidad más elevada de canales, tales como 22,2 o 32, con el fin de tener flexibilidad y posprocesar a continuación si se requiere un formato más pequeño. Sin embargo, cuando resulte obvio desde el principio que únicamente se requiere un formato pequeño, tal como un formato 5.1, se prefiere, como se indica en la Figura 2 o 6 mediante el «atajo» 1727, que pueda aplicarse un determinado control sobre el descodificador de SAOC y/o el descodificador de USAC aplicarse con el fin de evitar operaciones deupmixinginnecesarias y las posteriores operaciones dedownmixing.
[0032]En una realización preferida de la presente invención, el procesador de objetos 1200 comprende el descodificador de SAOC 1800 y el descodificador de SAOC se configura para descodificar uno o más canales de transporte emitidos por el descodificador principal y los datos paramétricos asociados y, utilizando los metadatos descomprimidos, para obtener la pluralidad de objetos de audio renderizados. Para este fin, la salida de OAM se conecta al módulo 1800.
[0033]Además, el procesador de objetos 1200 se configura para renderizar objetos descodificados emitidos por el descodificador principal que no se codifican en los canales de transporte de SAOC, sino que se codifican individualmente, normalmente en elementos de un solo canal, como indica el renderizador de objetos 1210. Además, el descodificador comprende una interfaz de salida que corresponde a la salida 1730 para emitir una salida del mezclador a los altavoces.
[0034]En una realización adicional, el procesador de objetos 1200 comprende un descodificador de codificación de objetos de audio espaciales 1800 para descodificar uno o más canales de transporte y la información lateral paramétrica asociada que representa objetos de audio codificados o canales de audio codificados, donde el descodificador de codificación de objetos de audio espaciales se configura para transcodificar la información paramétrica asociada y los metadatos descomprimidos en información lateral paramétrica transcodificada susceptible de usarse para renderizar directamente el formato de salida, como se define, por ejemplo, en una versión anterior de SAOC. El posprocesador 1700 se configura para calcular canales de audio del formato de salida utilizando los canales de transporte descodificados y la información lateral paramétrica transcodificada. El procesamiento realizado por el posprocesador puede ser similar al procesamiento MPEG Surround o puede tratarse de cualquier otro procesamiento, tal como procesamiento BCC y similares.
[0035]En una realización adicional, el procesador de objetos 1200 comprende un descodificador de codificación de objetos de audio espaciales 1800 configurado para someter directamente aupmixingy renderizar señales de canal para el formato de salida utilizando los canales de transporte descodificados (por el descodificador principal) y la información lateral paramétrica.
De forma adicional e importante, el procesador de objetos 1200 de la Figura 2 comprende, de forma adicional, el mezclador 1220 que recibe, como entrada, datos generados por el descodificador de USAC 1300 directamente cuando existen objetos previamente renderizados mezclados con canales, es decir, cuando el mezclador 200 de la Figura 1 estaba activo. De forma adicional, el mezclador 1220 recibe datos del renderizador de objetos que realiza el renderizado de objetos sin descodificación de SAOC. Además, el mezclador recibe datos de salida del descodificador de SAOC, es decir, objetos renderizados mediante SAOC.
[0036]El mezclador 1220 se conecta a la interfaz de salida 1730, el renderizador binaural 1710 y el conversor de formato 1720. El renderizador binaural 1710 se configura para renderizar los canales de salida en dos canales binaurales utilizando funciones de transferencia relacionadas con la cabeza o respuestas binaurales a los impulsos en el espacio (BRIR, por sus siglas en inglés). El conversor de formato 1720 se configura para convertir los canales de salida en un formato de salida que tenga una cantidad menor de canales que los canales de salida 1205 del mezclador, y el conversor de formato 1720 requiere información sobre la disposición de reproducción, tal como altavoces 5.1 y similares.
[0037] El descodificador de la Figura 6 se diferencia del descodificador de la Figura 4 en el hecho de que el descodificador de SAOC no solo puede generar objetos renderizados, sino también canales renderizados, como sucede cuando se ha utilizado el codificador de la Figura 5 y la conexión 900 entre los canales/objetos previamente renderizados y la interfaz de entrada del codificador de SAOC 800 está activa.
[0038] Además, se configura una etapa de paneo de amplitud basado en vectores (VBAP, por sus siglas en inglés) 1810 que recibe, del descodificador de SAO<c>, información sobre la disposición de reproducción y que emite una matriz de renderizado al descodificador de SAOC, de modo que el descodificador de SAOC puede, al final, proporcionar canales renderizados sin un funcionamiento adicional del mezclador en el formato de canal alto de 1205, es decir, 32 altavoces.
[0039] El bloque de VBAP recibe preferentemente los datos OAM descodificados para derivar las matrices de renderizado. Más en general, requiere preferentemente información geométrica, no solo de la disposición de reproducción, sino también de las posiciones donde deben renderizarse las señales de entrada en la disposición de reproducción. Estos datos de entrada geométricos pueden ser datos OAM para los objetos, o información de posición de canal para canales que se hayan transmitido mediante SAOC.
[0040] Sin embargo, si solo se requiere una interfaz de salida específica, el estado de VBAP 1810 ya puede proporcionar la matriz de renderizado requerida para la salida, por ejemplo, 5.1. A continuación, el descodificador de SAOC 1800 realiza un renderizado directo de los canales de transporte de SAOC, los datos paramétricos asociados y los metadatos descomprimidos, un renderizado directo en el formato de salida requerido sin ninguna interacción del mezclador 1220. Sin embargo, cuando se aplica una determinada mezcla entre modos, es decir, cuando varios canales se codifican con SAOC, pero no todos los canales se codifican con SAOC, o cuando varios objetos se codifican con SAOC, pero no todos los objetos se codifican con SAOC, o cuando solo una determinada cantidad de objetos previamente renderizados con canales se descodifican con SAOC y los canales restantes no se procesan con SAOC, el mezclador unificará los datos procedentes de las distintas porciones de entrada, es decir, directamente del descodificador principal 1300, del renderizador de objetos 1210 y del descodificador de SAOC 1800.
[0041] A continuación, se describe la Figura 7 para indicar determinados modos de codificador/descodificador que puede aplicar el concepto de codificador/descodificador de audio sumamente flexible y de alta calidad de la invención.
[0042] Según el primer modo de codificación, se omite el mezclador 200 del codificador de la Figura 1 y, por lo tanto, no se omite el procesador de objetos del descodificador de la Figura 2.
[0043] En el segundo modo, el mezclador 200 de la Figura 1 está activo y se omite el procesador de objetos de la Figura 2.
[0044] A continuación, en el tercer modo de codificación, el codificador de SAOC de la Figura 3 está activo, pero SAOC codifica únicamente los objetos, en lugar de los canales o los canales emitidos por el mezclador. Por lo tanto, el modo 3 requiere que, en el lado del descodificador que se ilustra en la Figura 4, el descodificador de SAOC solo esté activo para los objetos y genere objetos renderizados.
[0045] En un cuarto modo de codificación, como se ilustra en la Figura 5, el codificador de SAOC se configura para codificar mediante SAOC canales previamente renderizados; es decir, el mezclador está activo como en el segundo modo. En el lado del descodificador, se realiza la descodificación mediante SAOC para objetos previamente renderizados. de modo que se omite el procesador de objetos como en el segundo modo de codificación.
[0046] Además, existe un quinto modo de codificación, que puede realizarse mezclando cualquiera de los modos 1 a 4. En particular, existirá un modo de codificación por mezclado cuando el mezclador 1220 de la Figura 6 reciba canales directamente del descodificador de USAC y, de forma adicional, reciba canales con objetos previamente renderizados del descodificador de USAC. Además, en este modo de codificación por mezclado, los objetos se codifican directamente utilizando, preferentemente, un elemento de un solo canal del descodificador de USAC. En este contexto, el renderizador de objetos 1210 a continuación renderizará estos objetos descodificados y los enviará al mezclador 1220. Además, se codifican adicionalmente varios objetos mediante un codificador de SAO<c>, de modo que el descodificador de SAOC generará objetos renderizados al mezclador y/o canales renderizados cuando existan varios canales codificados mediante tecnología SAOC.
[0047] A continuación, cada porción de entrada del mezclador 1220 puede, ejemplarmente, tener al menos potencial para recibir la cantidad de canales, tal como 32, que se indica en 1205. De este modo, básicamente, el mezclador podría recibir 32 canales del descodificador de USAC y, de forma adicional, 32 canales previamente renderizados/mezclados del descodificador de USAC y, de forma adicional, 32 «canales» del renderizador de objetos y, de forma adicional, 32 «canales» del descodificador de SAOC, donde cada «canal» entre los bloques 1210 y 1218, por un lado, y el bloque 1220, por otro, tiene una contribución de los correspondientes objetos en un canal de altavoz correspondiente y, a continuación, el mezclador 1220 mezcla, es decir, agrega las distintas contribuciones para cada canal de altavoz.
[0048]En una realización preferida de la presente invención, el sistema de codificación/descodificación se basa en un códec de USAC MPEG-D para codificar las señales de canal y objeto. Para aumentar la eficiencia para codificar una gran cantidad de objetos, se ha adaptado tecnología SAOC MPEG. Tres tipos de renderizadores realizan la tarea de renderizar objetos a los canales, renderizar canales a auriculares, o renderizar canales a una configuración de altavoces distinta. Cuando las señales de objeto se transmiten explícitamente o se codifican paramétricamente mediante SAOC, la correspondiente información de metadatos de objetos se comprime y multiplexa en los datos de salida codificados.
[0049]En una realización, el prerrenderizador/mezclador 200 se utiliza para convertir una escena de entrada de objeto más canal en una escena de canal antes de la codificación. Funcionalmente, es idéntica a la combinación de renderizador/mezclador de objetos en el lado del descodificador que se ilustra en la Figura 4 o la Figura 6 y que se indica mediante el procesador de objetos 1200 de la Figura 2. El renderizado previo de objetos garantía una entropía de señal determinista en la entrada del codificador que es básicamente independiente de la cantidad de señales de objeto simultáneamente activas. Con el renderizado previo de objetos, no es necesario transmitir metadatos de objetos. Las señales discretas de objeto se renderizan en la disposición de canales que el codificador esté configurado para usar. El peso de los objetos para cada canal se obtiene de los metadatos de objeto OAM asociados, como indica la flecha 402.
[0050]Como codificador/descodificador/principal para señales de canal de altavoz, señales discretas de objeto, señales dedownmixde objetos y señales previamente renderizadas, se prefiere una tecnología USAC. Realiza la codificación de la multitud de señales creando información de mapeo de canal y objeto (la información geométrica y semántica de la asignación de objeto y canal de entrada). Dicha información de mapeo describe cómo los canales y objetos de entrada se asignan a elementos de canal de USAC como se ilustra en la Figura 10, es decir, elementos de par de canales (CPE, por sus siglas en inglés), elementos de un solo canal (SCE), elementos de cuádruple canal (QCE), y la correspondiente información se transmite al descodificador principal desde el codificador principal. Todas las cargas útiles adicionales, como datos SAOC o metadatos de objetos, se han pasado a través de elementos de extensión y se han tenido en cuenta en el control de tasa del codificador.
[0051]Es posible realizar la codificación de objetos de distintas maneras, dependiendo de los requisitos de tasa/distorsión y los requisitos de interactividad del renderizador. Son posibles las siguientes variantes de codificación de objetos:
- Objetos previamente renderizados: las señales de objeto se renderizan previamente y se mezclan con las señales del canal 22.2 antes de codificar. La posterior cadena de codificación ve señales del canal 22.2.
- Formas de onda de objetos discretos: los objetos se suministran al codificador como formas de onda monofónicas. El codificador usa elementos de un solo canal SCE para transmitir los objetos además de las señales de canal. Los objetos descodificados se renderizan y se mezclan en el lado del receptor. La información de metadatos comprimidos de objetos se transmite al receptor/renderizador junto con estos.
- Formas de onda de objetos paramétricos: las propiedades de los objetos y su relación mutua se describen por medio de parámetros de SAOC. Ladownmixde las señales de objeto se codifica con USAC. La información paramétrica se transmite junto con esta. La cantidad de canales dedownmixse elige dependiendo de la cantidad de objetos y la tasa de datos total. La información de metadatos comprimidos de objetos se transmite al renderizador de SAOC.
[0052]El codificador y descodificador de SAOC para las señales de objeto se basan en tecnología MPEG SAOC. El sistema es capaz de recrear, modificar y renderizar una cantidad de objetos de audio basándose en una menor cantidad de canales transmitidos y datos paramétricos adicionales (OLD, IOC (del inglés«Inter Object Coherence»,coherencia entre objetos), DMG (del inglés«Down Mix Gains»,ganancias dedownmix)).Los datos paramétricos adicionales muestran una tasa de datos considerablemente más baja que la requerida para transmitir todos los objetos de forma individual, lo que hace que la codificación sea muy eficiente.
[0053]El codificador de SAOC toma como entrada las señales de objeto/canal como formas de onda monofónicas y genera la información paramétrica (que se empaqueta en el flujo de bits de Audio 3D) y los canales de transporte de SAOC (que se codifican mediante elementos de un solo canal y se transmiten).
[0054]El descodificador de SAOC reconstruye las señales de objeto/canal a partir de los canales de transporte de SAOC descodificados y la información paramétrica, y genera la escena de audio de salida según la disposición de reproducción, la información de metadatos descomprimidos de objetos y, opcionalmente, la información de interacción con el usuario.
[0055]Para cada objeto, los metadatos asociados que especifican la posición geométrica y el volumen del objeto en el espacio 3D se codifican eficazmente por cuantificación de las propiedades del objeto en el tiempo y el espacio. Los metadatos comprimidos de objetos cOAM se transmiten al receptor en forma de información lateral. El volumen del objeto puede comprender información sobre un grado espacial y/o información sobre el nivel de señal de la señal de audio de dicho objeto de audio.
[0056]El renderizador de objetos utiliza los metadatos comprimidos de objetos para generar formas de onda de objeto según el formato de reproducción dado. Cada objeto se renderiza en determinados canales de salida según sus metadatos. La salida de este bloque es el resultado de la suma de los resultados parciales.
[0057]Si se descodifican tanto contenidos basados en canales como objetos discretos/paramétricos, las formas de onda basadas en canales y las formas de onda del objeto renderizado se mezclan antes de generar las formas de onda resultantes (o antes de introducirlas en un módulo posprocesador, como el renderizador binaural o el módulo renderizador de altavoces).
[0058]El módulo del renderizador binaural produce undownmixbinaural del material de audio multicanal, de modo que cada canal de entrada está representado por una fuente de sonido virtual. El procesamiento se realiza cuadro a cuadro en el dominio de QMF (del inglés«Quadrature Mirror Filterbank»,banco de filtros espejo en cuadratura).
[0059]La binauralización se basa en repuestas binaurales medidas a los impulsos en el espacio
La Figura 8 ilustra una realización preferida del conversor de formato 1720. El renderizador de altavoces o conversor de formato convierte entre la configuración de canal transmisor y el formato de reproducción deseado. Dicho conversor de formato realiza conversiones hacia una cantidad menor de canales de salida, es decir, creadownmixes.Para este fin, undownmixer1722 que funciona preferentemente en el dominio de QMF recibe señales de salida del mezclador 1205 y genera señales de altavoz. Preferentemente, se proporciona un controlador 1724 para configurar eldownmixer1722 que recibe, como entrada de control, una disposición de salida del mezclador, es decir, la disposición para lo que se determinan los datos 1205, y normalmente se ha introducido una disposición de reproducción deseada en el bloque de conversión de formato 1720 que se ilustra en la Figura 6. Basándose esta información, el controlador 1724 genera, preferentemente de forma automática, matrices dedownmixoptimizadas para la combinación dada de formatos de entrada y salida y aplica dichas matrices en el bloque deldownmixer1722 en el proceso dedownmix.El conversor de formato permite tanto las configuraciones de altavoces estándar como configuraciones aleatorias con posiciones de altavoz no estándar.
[0060]Como se ilustra en relación con la Figura 6, el descodificador de SAOC está diseñado para renderizar en la disposición de canales predefinida, como 22.2, con una conversión posterior de formato a la disposición de reproducción buscada. No obstante, y de forma alternativa, el descodificador de SAOC se implementa para admitir el modo de «baja energía», donde el descodificador de SAOC se configura para descodificar directamente a la disposición de reproducción, sin la posterior conversión de formato. En esta implementación, el descodificador de SAOC 1800 genera directamente la señal de altavoz, como las señales de altavoz 5.1, y el descodificador de SAOC 1800 requiere la información de la disposición de reproducción y la matriz de renderizado para que pueda funcionar el paneo de amplitud basado en vectores o cualquier otra clase de procesador para generar información dedonwmix.
[0061]La Figura 9 ilustra una realización adicional del renderizador binaural 1710 de la Figura 6. Específicamente para dispositivos móviles, se requiere el renderizado binaural para auriculares conectados a dichos dispositivos móviles o para altavoces directamente conectados a dispositivos móviles normalmente pequeños. Para dichos dispositivos móviles, pueden existir restricciones que limiten la complejidad del descodificador y el renderizado. Además de omitir la decorrelación en este tipo de escenario de procesamiento, se prefiere realizar primerodownmixingmediante eldownmixer1712 a undownmixintermedio, es decir, a una cantidad menor de canales de salida, que a su vez se traduce en una menor cantidad de canales de entrada para el conversor binaural 1714. Ejemplarmente, eldownmixer1712 somete adownmixingel material del canal 22.2 para crear undownmixintermedio 5.1 o, alternativamente, eldownmixintermedio se calcula directamente mediante el descodificador de SAOC 1800 de la Figura 6 en una especie de «atajo». A continuación, el renderizado binaural únicamente tiene que aplicar diez funciones HRTF (funciones de transferencia relacionadas con la cabeza) o BRIR para renderizar los cinco canales individuales en diferentes posiciones, en comparación con aplicar 44 HRTF para funciones BRIR si los canales de entrada 22.2 ya se hubiesen renderizado directamente. Específicamente, las operaciones de convolución necesarias para un renderizado binaural requieren una gran capacidad de procesamiento y, por lo tanto, la reducción de dicha capacidad de procesamiento mientras se sigue obteniendo una calidad de audio aceptable resulta particularmente útil para dispositivos móviles.
[0062]Preferentemente, el «atajo» que se ilustra mediante la línea de control 1727 comprende controlar el descodificador 1300 para descodificar a una cantidad menor de canales, es decir, omitir el bloque de procesamiento OTT completo en el descodificador o una conversión de formato a una cantidad menor de canales y, como se ilustra en la Figura 9, el renderizado binaural se realiza para la menor cantidad de canales. El mismo procesamiento puede aplicarse no solamente al procesamiento binaural, sino también a una conversión de formato, como se ilustra mediante la línea 1727 en la Figura 6.
[0063] En una realización adicional, se requiere una interfaz eficiente entre bloques de procesamiento. En particular en la Figura 6, se representa la ruta de la señal de audio entre los diferentes bloques de procesamiento. Tanto el renderizador binaural 1710 como el conversor de formato 1720, el descodificador de SAOC 1800 y el descodificador de USAC 1300, en caso de que se aplique SBR (del inglés«Spectral Band Replication»,replicación de la banda espectral), funcionan en un dominio QMF o QMF híbrido. Según una realización, todos estos bloques de procesamiento proporcionan una interfaz QMF o QMF híbrida para permitir el pase de señales de audio entre sí en el dominio QMF de forma eficiente. De forma adicional, se prefiere implementar el módulo del mezclador y el módulo del renderizador de objetos para que también funcionen en el QMF o dominio QMF híbrido. Como consecuencia, pueden evitarse etapas de síntesis y análisis separadas de QMF o QMF híbrido, lo que se traduce en un ahorro significativo de complejidad y, a continuación, únicamente se requiere una etapa de síntesis de QMF final para generar los altavoces que se indican en 1730, o para generar los datos binaurales en la salida del bloque 1710, o para generar las señales de altavoz de disposición de reproducción en la salida del bloque 1720.
[0064] Posteriormente, se hace referencia a la Figura 11 con el fin de explicar los elementos de cuádruple canal (QCE). A diferencia de un elemento de par de canales, tal y como se define en el estándar US AC-MPEG, un elemento de cuádruple canal requiere cuatro canales de entrada 90 y genera un elemento QCE codificado 91. En una realización, se proporciona una jerarquía de dos módulos MPEG Surround en Modo 2-1-2 o dos módulo TTO (del inglés«Two To One»,dos a uno) y herramientas adicionales de codificación de Joint Stereo (por ejemplo, MS-Stereo), como se define en MPEG USAC o MPEG Surround, y el elemento QCE no solamente comprende dos canales dedownmixcodificados en Joint Stereo y opcionalmente, dos canales residuales codificados en Joint Stereo y, de forma adicional, datos paramétricos derivados de los, por ejemplo, dos módulos TTO. En el lado del descodificador, se aplica una estructura donde se aplica la descodificación de Joint Stereo de los dos canales dedownmixy, opcionalmente, de los dos canales residuales y, en una segunda etapa con dos módulos OTT, los canales dedownmixy canales residuales opcionales se someten aupmixinghasta los cuatro canales de salida. Sin embargo, pueden aplicarse operaciones de procesamiento alternativas para un codificador QCE en lugar del funcionamiento jerárquico. De este modo, además de la codificación de canal conjunta de un grupo de dos canales, el codificador/descodificador principal utiliza adicionalmente una codificación de canal conjunta de un grupo de cuatro canales.
[0065] Además, se prefiere realizar un procedimiento de relleno de ruido optimizado para permitir la codificación de banda completa sin pérdidas (18 kHz) a 1200 kbps.
[0066] El codificador se ha utilizado en un modo de «tasa constante con reserva de bits», utilizando un máximo de 6144 bits por canal como buffer de tasa para los datos dinámicos.
[0067] Todas las cargas útiles adicionales, como datos de SAOC o metadatos de objetos, se han pasado a través de elementos de extensión y se han tenido en cuenta en el control de tasa del codificador.
[0068] Con el fin de aprovechar las funcionalidades de SAOC también para el contenido de audio 3D, se han implementado las siguientes extensiones de MPEG SAOC:
-Downmixinga una cantidad arbitraria de canales de transporte de SAOC.
- Renderizado optimizado para configuraciones de salida con un número elevado de altavoces (hasta 22.2).
[0069] El módulo del renderizador binaural produce undownmixbinaural del material de audio multicanal, de modo que cada canal de entrada (sin incluir los canales LFE) está representado por una fuente de sonido virtual. El procesamiento se realiza cuadro a cuadro en el dominio QMF.
[0070] La binauralización se basa en repuestas binaurales medidas a los impulsos en el espacio. El sonido directo y las reflexiones tempranas quedan grabados en el material de audio mediante un enfoque de convolución en un dominio pseudo FFT utilizando una convolución rápida sobre el dominio QMF.
[0071] Aunque algunos aspectos se han descrito en relación con un aparato, resulta evidente que dichos aspectos también representan una descripción del procedimiento correspondiente, donde un bloque o dispositivo corresponde a una etapa del procedimiento o una característica de una etapa del procedimiento. De forma similar, los aspectos descritos en relación con una etapa del procedimiento también representan una descripción de un bloque o elemento o característica correspondiente de un aparato correspondiente. Algunas o todas las etapas del procedimiento pueden ejecutarse mediante (o utilizando) un aparato dehardware,como, por ejemplo, un microprocesador, un ordenador programable o un circuito electrónico. En algunas realizaciones, alguna o más de las etapas más importantes del procedimiento pueden ser ejecutadas por dicho aparato.
[0072] Dependiendo de determinados requisitos de implementación, las realizaciones de la invención pueden implementarse enhardwareo ensoftware.La implementación puede realizarse utilizando un medio de almacenamiento no transitorio, tal como un medio de almacenamiento digital, por ejemplo, un disco flexible, un DVD, un Blu-Ray, un CD, una ROM, una PROM, y EPROM, una memoria EEPROM o flash, que tenga almacenadas en su interior señales de control legibles de manera electrónica, que cooperan (o son capaces de cooperar) con un sistema informático programare, de modo que se realice el respectivo procedimiento. Por lo tanto, el medio de almacenamiento digital puede ser legible por ordenador.
[0073]Algunas realizaciones según la invención comprenden un soporte de datos que tiene señales de control legibles de manera electrónica, que son capaces de cooperar con un sistema informático programable, de modo que se realice uno de los procedimientos descritos en esta invención.
[0074]En general, las realizaciones de la presente invención pueden implementarse como un producto de programa informático con un código de programa, estando operativo el código de programa para realizar uno de los procedimientos cuando el producto de programa informático se ejecuta en un ordenador. El código de programa puede, por ejemplo, almacenarse en un soporte legible por máquina.
[0075]Otras realizaciones comprenden el programa informático para realizar uno de los procedimientos descritos en esta invención, almacenado en un soporte legible por máquina.
[0076]Dicho de otro modo, una realización del procedimiento inventivo es, por lo tanto, un programa informático que tiene un código de programa para realizar uno de los procedimientos descritos en esta invención, cuando el programa informático se ejecuta en un ordenador.
[0077]Una realización adicional del procedimiento inventivo es, por lo tanto, un soporte de datos (o un medio de almacenamiento digital, o un medio legible por ordenador) que comprende, grabado en este, el programa informático para realizar uno de los procedimientos descritos en esta invención. El soporte de datos, el medio de almacenamiento digital o el medio grabado normalmente son tangibles y/o no transitorios.
[0078]Una realización adicional del procedimiento inventivo es, por lo tanto, un flujo de datos o una secuencia de señales que representan el programa informático para realizar uno de los procedimientos descritos en esta invención. El flujo de datos o la secuencia de señales pueden, por ejemplo, configurarse para transferirse a través de una conexión de comunicación de datos, por ejemplo, a través de la Internet.
[0079]Una realización adicional comprende un medio de procesamiento, por ejemplo, un ordenador o un dispositivo lógico programable, configurado para, o adaptado para, realizar uno de los procedimientos descritos en esta invención.
[0080]Una realización adicional comprende un ordenador que tiene instalado en este el programa informático para realizar uno de los procedimientos descritos en esta invención.
[0081]Una realización adicional según la invención comprende un aparato o un sistema configurado para transferir (por ejemplo, electrónicamente u ópticamente) un programa informático para realizar uno de los procedimientos descritos en esta invención a un receptor. El receptor puede, por ejemplo, ser un ordenador, un dispositivo móvil, un dispositivo de memoria o similares. El aparato o sistema puede, por ejemplo, comprender un servidor de archivos para transferir el programa informático al receptor.
[0082]En algunas realizaciones, puede usarse un dispositivo lógico programable (por ejemplo, una matriz de puertas programables en campo) para realizar todas o algunas de las funcionalidades de los procedimientos descritos en esta invención. En algunas realizaciones, una matriz de puertas programables en campo puede cooperar con un microprocesador para realizar uno de los procedimientos descritos en esta invención. En general, los procedimientos se realizan preferentemente mediante cualquier aparato dehardware.
[0083]Las realizaciones anteriormente descritas son meramente ilustrativas de los principios de la presente invención. Se entiende que las modificaciones y variaciones de las disposiciones y los detalles descritos en esta invención resultarán evidentes a otros expertos en la materia. Por lo tanto, se pretende quedar limitado únicamente por el alcance de las reivindicaciones de patente en curso y no por los detalles específicos presentados a modo de descripción y explicación de las realizaciones de esta invención.

Claims (16)

REIVINDICACIONES
1. Codificador de audio para descodificar datos de audio codificados, que comprende:
una interfaz de entrada (1100) configurada para recibir los datos de audio codificados, comprendiendo los datos de audio codificados una pluralidad de canales de audio codificados o una pluralidad de objetos de audio codificados y metadatos comprimidos relacionados con la pluralidad de objetos de audio, y una indicación de modo; un descodificador principal (1300) configurado para descodificar la pluralidad de canales de audio codificados y la pluralidad de objetos de audio codificados;
un descompresor de metadatos (1400) configurado para descomprimir los metadatos comprimidos;
un procesador de objetos (1200) configurado para procesar la pluralidad de objetos de audio descodificados utilizando los metadatos descomprimidos para obtener una cantidad de canales de audio de salida (1205) que comprende datos de audio a partir de los objetos de audio y los canales de audio descodificados;
un controlador de modos (1600) conectado a la interfaz de entrada (1100) y configurado para analizar los datos de audio codificados para detectar la indicación de modo que indique un primer modo o un segundo modo, donde, en el primer modo, los datos de audio codificados comprenden canales de audio codificados y objetos de audio codificados y donde, en el segundo modo, los datos de audio codificados comprenden únicamente la pluralidad de canales de audio codificados; y
un posprocesador (1700) configurado para convertir la cantidad de canales de audio de salida (1205) en un formato de salida,
donde el descodificador de audio, controlado por el controlador de modo (1600), está configurado para omitir el procesador de objetos (1200) y para introducir una pluralidad de canales descodificados en el posprocesador (1700) cuando el controlador de modo (1600) ha detectado el segundo modo, y para introducir la pluralidad de objetos de audio descodificados y la pluralidad de canales de audio descodificados en el procesador de objetos (1200) cuando el controlador de modo (1600) ha detectado el primer modo.
2. El descodificador de audio según la reivindicación 1, donde el posprocesador (1700) configurado para convertir la cantidad de canales de audio de salida (1205) en una representación binaural o en un formato de reproducción que tiene una menor cantidad de canales de audio que la cantidad de canales de audio de salida (1205), y
donde el descodificador de audio está configurado para controlar el posprocesador (1700) según una entrada de control derivada de una interfaz del usuario o extraída de los datos de audio codificados.
3. El descodificador de audio según la reivindicación 1 o 2, donde el procesador de objetos (1200) comprende:
un renderizador de objetos (1210) para renderizar los objetos de audio descodificados con el fin de obtener objetos de audio renderizados utilizando los metadatos descomprimidos; y
un mezclador (1220) para mezclar los objetos de audio renderizados y los canales de audio descodificados para obtener la cantidad de canales de audio de salida (1205).
4. El descodificador de audio según cualquiera de las reivindicaciones 1 a 3, donde el procesador de objetos (1200) comprende:
un descodificador de codificación de objetos de audio espaciales (1800) para descodificar uno o más canales de transporte y la información lateral paramétrica asociada que representa objetos de audio codificados, donde el descodificador de codificación de objetos de audio espaciales (1800) está configurado para renderizar los objetos de audio codificados según la información de renderizado relacionada con una colocación de los objetos de audio para obtener los objetos de audio renderizados y para controlar el procesador de objetos (1200) con el fin de mezclar los objetos de audio renderizados y los canales de audio descodificados para obtener la cantidad de canales de audio de salida (1205).
5. El descodificador de audio según cualquiera de las reivindicaciones 1 a 3, donde el procesador de objetos (1200) comprende un descodificador de codificación de objetos de audio espaciales (1800) para descodificar uno o más canales de transporte y la información lateral paramétrica asociada que representa objetos de audio codificados y canales de audio codificados,
donde el descodificador de codificación de objetos de audio espaciales (1800) está configurado para descodificar los objetos de audio codificados y canales de audio codificados utilizando los uno o más canales de transporte y la información lateral paramétrica, y
donde el procesador de objetos (1200) está configurado para renderizar la pluralidad de objetos de audio utilizando los metadatos descomprimidos para obtener objetos de audio renderizados y para descodificar los canales de audio y para mezclar los canales de audio con los objetos de audio renderizados para obtener la cantidad de canales de audio de salida (1205).
6. El descodificador de audio según cualquiera de las reivindicaciones 1 a 3, donde el procesador de objetos (1200) comprende un descodificador de codificación de objetos de audio espaciales (1800) para descodificar uno o más canales de transporte y la información lateral paramétrica asociada que representa objetos de audio codificados o canales de audio codificados,
donde el descodificador de codificación de objetos de audio espaciales (1800) está configurado para transcodificar la información paramétrica asociada y los metadatos descomprimidos en información lateral paramétrica transcodificada susceptible de usarse para renderizar directamente el formato de salida, y donde el posprocesador (1700) está configurado para calcular canales de audio del formato de salida utilizando los canales de transporte descodificados y la información lateral paramétrica transcodificada, o
donde el descodificador de codificación de objetos de audio espaciales (1800) está configurado para someter directamente aupmixingy renderizar señales de canal para el formato de salida utilizando los canales de transporte descodificados y la información paramétrica lateral.
7. El descodificador de audio según cualquiera de las reivindicaciones anteriores,
donde el procesador de objetos (1200) comprende un descodificador de codificación de objetos de audio espaciales (1800) para descodificar uno o más canales de transporte generados por el descodificador principal (1300) y la información lateral paramétrica asociada y los metadatos descomprimidos para obtener una pluralidad de objetos de audio renderizados,
donde el procesador de objetos (1200) comprende un renderizador de objetos (1210) que está configurado para renderizar los objetos de audio descodificados generados por el descodificador principal (1300) para obtener objetos de audio descodificados renderizados;
donde el procesador de objetos (1200) comprende un mezclador (1220) que está configurado para mezclar los objetos de audio renderizados descodificados y la pluralidad de objetos de audio renderizados con los canales de audio descodificados,
donde el descodificador de audio comprende, además, una interfaz de salida (1730) para generar una salida del mezclador (1220) a los altavoces;
donde el posprocesador (1700) comprende, además:
un renderizador binaural (1700) para renderizar los canales de audio de salida (1205) en dos canales binaurales utilizando funciones de transferencia relacionadas con la cabeza o respuestas binaurales a los impulsos, representando los dos canales binaurales la representación binaural, y
un conversor de formato (1720) para convertir los canales de audio de salida (1205) en el formato de salida que tiene una cantidad menor de canales de audio que los canales de audio de salida (1205) del mezclador utilizando información sobre una disposición de reproducción.
8. El descodificador de audio según cualquiera de las reivindicaciones 1 a 7,
donde la pluralidad de canales de audio codificados o la pluralidad de objetos de audio codificados se codifican como elementos de par de canales, elementos de un solo canal, elementos de baja frecuencia o elementos de cuádruple canal, donde un elemento de cuádruple canal comprende cuatro canales de audio u objetos de audio originales, y
donde el descodificador principal (1300) está configurado para descodificar los elementos de par de canales, los elementos de un solo canal, los elementos de baja frecuencia, o los elementos de cuádruple canal según la información lateral incluida en los datos de audio codificados que indica un elemento de par de canales, un elemento de un solo canal, un elemento de baja frecuencia, o un elemento de cuádruple canal.
9. El descodificador de audio según cualquiera de las reivindicaciones 1 a 8,
donde el descodificador principal (1300) está configurado para aplicar una operación de descodificación de banda completa utilizando una operación de relleno de ruido.
10. El descodificador de audio según la reivindicación 7, donde los elementos que comprenden el renderizador binaural (1710), el conversor de formato (1720), el mezclador (1220), el descodificador de SAOC (1800) y el descodificador principal (1300) y el renderizador de objetos (1210) funcionan en un dominio de banco de filtros espejo en cuadratura (QMF) y donde los datos del dominio de filtros espejo en cuadratura se transmiten de uno de los elementos a otro de los elementos sin ningún banco de filtros de síntesis ni procesamiento posterior de análisis mediante banco de filtros.
11. El descodificador de audio según cualquiera de las reivindicaciones 1a 10,
donde el posprocesador (1700) está configurado para someter adownmixingla cantidad de canales de audio de salida (1205) generados por el procesador de objetos (1200) hasta un formato que tiene tres o más canales de audio y que tiene menos canales de audio que la cantidad de canales de audio de salida (1205) generados por el procesador de objetos (1200) para obtener canales de undownmixintermedio, y para renderizar binauralmente (1710) los canales deldownmixintermedio en la representación binaural que tiene una señal de salida binaural de dos canales.
12. El descodificador de audio según cualquiera de las reivindicaciones 1 a 8, donde el posprocesador (1700) comprende:
undownmixercontrolado (1722) para aplicar una matriz dedownmix;y
un controlador (1724) para determinar una matriz dedownmixingespecífica utilizando información sobre una configuración de canales de una salida del procesador de objetos (1200) e información sobre una disposición de reproducción pretendida.
13. El descodificador de audio según cualquiera de las reivindicaciones 1 a 12,
donde el descodificador principal (1300) o el procesador de objetos (1200) son controlables, y
donde el posprocesador (1700) está configurado para controlar el descodificador principal (1300) o el procesador de objetos (1200) según información sobre el formato de salida, de modo que se reduce o elimina un renderizado que conlleve el procesamiento de decorrelación de objetos de audio o canales de audio que no aparecen como canales de audio separados en el formato de salida, o de modo que, para los objetos de audio o canales de audio que no aparecen como los canales de audio separados en el formato de salida, se realizan operaciones deupmixingo descodificación como si los objetos de audio o canales de audio aparecieran como los canales separados en el formato de salida, excepto que se desactiva todo procesamiento de decorrelación de los objetos de audio o los canales de audio que no aparecen como los canales de audio separados en el formato de salida.
14. El descodificador de audio según la reivindicación 8,
donde el descodificador principal (1300) está configurado para realizar descodificación por transformación y una descodificación con replicación de la banda espectral para el elemento de un solo canal, y para realizar descodificación por transformación, descodificación estéreo paramétrica y descodificación con reproducción de la banda espectral para los elementos de par de canales y los elementos de cuádruple canal.
15. Procedimiento de descodificación de datos de audio codificados, que comprende:
la recepción (1100) de los datos de audio codificados, comprendiendo los datos de audio codificados o bien una pluralidad de canales de audio codificados y una pluralidad de objetos de audio codificados y metadatos comprimidos relacionados con la pluralidad de objetos de audio, o una pluralidad de canales de audio codificados sin objetos de audio codificados, y una indicación de modo;
la descodificación principal (1300) de la pluralidad de canales de audio codificados y la pluralidad de objetos de audio codificados;
la descompresión (1400) de los metadatos comprimidos;
el procesamiento (1200) de la pluralidad de objetos de audio descodificados utilizando los metadatos comprimidos para obtener una cantidad de canales de audio de salida (1205) que comprende datos de audio de los objetos de audio y los canales de audio descodificados;
el análisis, mediante un controlador de modos (1600), de los datos de audio codificados para detectar una indicación de modo que indique un primer modo o un segundo modo, donde, en el primer modo, los datos de audio codificados comprenden canales de audio codificados y objetos de audio codificados y donde, en el segundo modo, los datos de audio codificados comprenden únicamente la pluralidad de canales de audio codificados; y la conversión (1700) de la cantidad de canales de audio de salida (1205) en un formato de salida,
donde, en el procedimiento de descodificación de audio y controlado por el controlador de modos (1600), se omite el procesamiento (1200) de la pluralidad de objetos descodificados y se introduce una pluralidad de canales descodificados en la conversión (1700) cuando el controlador de modo (1600) ha detectado el segundo modo, y donde la pluralidad de objetos de audio descodificados y la pluralidad de canales de audio descodificados se introducen en el procesamiento (1200) la pluralidad de objetos descodificados, cuando el controlador de modo (1600) ha detectado el primer modo.
16. Un programa informático que comprende instrucciones que, cuando el programa se ejecuta mediante un ordenador o un procesador, hacen que el ordenador o procesador ejecute el procedimiento según la reivindicación 15.
ES22159568T 2013-07-22 2014-07-16 Concept for audio decoding for audio channels and audio objects Active ES2995102T3 (en)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
EP20130177378 EP2830045A1 (en) 2013-07-22 2013-07-22 Concept for audio encoding and decoding for audio channels and audio objects

Publications (1)

Publication Number Publication Date
ES2995102T3 true ES2995102T3 (en) 2025-02-06

Family

ID=48803456

Family Applications (2)

Application Number Title Priority Date Filing Date
ES14739196T Active ES2913849T3 (es) 2013-07-22 2014-07-16 Concepto para codificación y decodificación de audio para canales de audio y objetos de audio
ES22159568T Active ES2995102T3 (en) 2013-07-22 2014-07-16 Concept for audio decoding for audio channels and audio objects

Family Applications Before (1)

Application Number Title Priority Date Filing Date
ES14739196T Active ES2913849T3 (es) 2013-07-22 2014-07-16 Concepto para codificación y decodificación de audio para canales de audio y objetos de audio

Country Status (18)

Country Link
US (3) US10249311B2 (es)
EP (4) EP2830045A1 (es)
JP (1) JP6268286B2 (es)
KR (2) KR101943590B1 (es)
CN (2) CN110942778B (es)
AR (1) AR097003A1 (es)
AU (1) AU2014295269B2 (es)
BR (1) BR112016001143B1 (es)
CA (3) CA3251768A1 (es)
ES (2) ES2913849T3 (es)
MX (1) MX359159B (es)
PL (2) PL4033485T3 (es)
PT (1) PT3025329T (es)
RU (1) RU2641481C2 (es)
SG (1) SG11201600476RA (es)
TW (1) TWI566235B (es)
WO (1) WO2015010998A1 (es)
ZA (1) ZA201601076B (es)

Families Citing this family (42)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP2830047A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for low delay object metadata coding
EP2830045A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Concept for audio encoding and decoding for audio channels and audio objects
EP2830051A3 (en) 2013-07-22 2015-03-04 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder, methods and computer program using jointly encoded residual signals
WO2015147435A1 (ko) * 2014-03-25 2015-10-01 인텔렉추얼디스커버리 주식회사 오디오 신호 처리 시스템 및 방법
EP4601259A3 (en) * 2014-09-30 2025-09-24 Sony Group Corporation Transmitting device, transmission method, receiving device, and receiving method
EP3360135B1 (en) 2015-10-08 2020-03-11 Dolby International AB Layered coding for compressed sound or sound field representations
EP3208800A1 (en) * 2016-02-17 2017-08-23 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for stereo filing in multichannel coding
US10386496B2 (en) * 2016-03-18 2019-08-20 Deere & Company Navigation satellite orbit and clock determination with low latency clock corrections
EP3469589B1 (en) * 2016-06-30 2024-06-19 Huawei Technologies Duesseldorf GmbH Apparatuses and methods for encoding and decoding a multichannel audio signal
US9913061B1 (en) 2016-08-29 2018-03-06 The Directv Group, Inc. Methods and systems for rendering binaural audio content
EP3566473B8 (en) * 2017-03-06 2022-06-15 Dolby International AB Integrated reconstruction and rendering of audio signals
US11074921B2 (en) 2017-03-28 2021-07-27 Sony Corporation Information processing device and information processing method
GB2563635A (en) 2017-06-21 2018-12-26 Nokia Technologies Oy Recording and rendering audio signals
JP6888172B2 (ja) * 2018-01-18 2021-06-16 ドルビー ラボラトリーズ ライセンシング コーポレイション 音場表現信号を符号化する方法及びデバイス
JP7261807B2 (ja) * 2018-02-01 2023-04-20 フラウンホーファー-ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン ハイブリッドエンコーダ/デコーダ空間解析を使用する音響シーンエンコーダ、音響シーンデコーダおよびその方法
JP7396267B2 (ja) * 2018-03-29 2023-12-12 ソニーグループ株式会社 情報処理装置、情報処理方法、及びプログラム
WO2019197349A1 (en) 2018-04-11 2019-10-17 Dolby International Ab Methods, apparatus and systems for a pre-rendered signal for audio rendering
IL319278A (en) 2018-07-02 2025-04-01 Dolby Laboratories Licensing Corp Methods and devices for generating or decoding a bit sequence comprising embedded audio signals
JP7413267B2 (ja) 2018-10-16 2024-01-15 ドルビー ラボラトリーズ ライセンシング コーポレイション 低音マネジメントのための方法及び装置
GB2578625A (en) * 2018-11-01 2020-05-20 Nokia Technologies Oy Apparatus, methods and computer programs for encoding spatial metadata
US11929082B2 (en) * 2018-11-02 2024-03-12 Dolby International Ab Audio encoder and an audio decoder
EP4462821A3 (en) 2018-11-13 2024-12-25 Dolby Laboratories Licensing Corporation Representing spatial audio by means of an audio signal and associated metadata
EP3881559B1 (en) 2018-11-13 2024-02-14 Dolby Laboratories Licensing Corporation Audio processing in immersive audio services
BR112021009306A2 (pt) * 2018-11-20 2021-08-10 Sony Group Corporation dispositivo e método de processamento de informações, e, programa.
CN109448741B (zh) * 2018-11-22 2021-05-11 广州广晟数码技术有限公司 一种3d音频编码、解码方法及装置
PL3938914T3 (pl) 2019-03-15 2025-03-31 Intel Corporation Dynamiczna rekonfiguracja pamięci
GB2582910A (en) * 2019-04-02 2020-10-14 Nokia Technologies Oy Audio codec extension
US11545166B2 (en) 2019-07-02 2023-01-03 Dolby International Ab Using metadata to aggregate signal processing operations
EP3809709A1 (en) * 2019-10-14 2021-04-21 Koninklijke Philips N.V. Apparatus and method for audio encoding
US11861761B2 (en) 2019-11-15 2024-01-02 Intel Corporation Graphics processing unit processing and caching improvements
EP3857919B1 (en) * 2019-12-02 2022-05-18 Dolby Laboratories Licensing Corporation Methods and apparatus for conversion from channel-based audio to object-based audio
CN113724717B (zh) * 2020-05-21 2023-07-14 成都鼎桥通信技术有限公司 车载音频处理系统、方法、车机控制器和车辆
JP7434610B2 (ja) 2020-05-26 2024-02-20 ドルビー・インターナショナル・アーベー 効率的なダッキング利得適用による改善されたメイン‐関連オーディオ体験
EP4465294A3 (en) 2020-10-13 2024-12-18 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding a plurality of audio objects or apparatus and method for decoding using two or more relevant audio objects
AU2021359777B2 (en) 2020-10-13 2024-09-12 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding a plurality of audio objects using direction information during a downmixing or apparatus and method for decoding using an optimized covariance synthesis
CN116529815A (zh) * 2020-10-13 2023-08-01 弗劳恩霍夫应用研究促进协会 对多个音频对象进行编码的装置和方法以及使用两个或更多个相关音频对象进行解码的装置和方法
CN114822564B (zh) * 2021-01-21 2025-06-06 华为技术有限公司 音频对象的比特分配方法和装置
WO2022262758A1 (zh) * 2021-06-15 2022-12-22 北京字跳网络技术有限公司 音频渲染系统、方法和电子设备
JP7753511B2 (ja) * 2021-07-29 2025-10-14 ドルビー・インターナショナル・アーベー オブジェクトベースのオーディオ及びチャネルベースのオーディオを処理するための方法及び装置
CN115552518B (zh) * 2021-11-02 2024-06-25 北京小米移动软件有限公司 一种信号编解码方法、装置、用户设备、网络侧设备及存储介质
US20240404531A1 (en) * 2023-06-03 2024-12-05 Apple Inc. Method and System for Coding Audio Data
CN118869668A (zh) * 2024-09-24 2024-10-29 音王电声股份有限公司 一种三维声编解码元数据的方法

Family Cites Families (89)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US2605361A (en) 1950-06-29 1952-07-29 Bell Telephone Labor Inc Differential quantization of communication signals
JP3576936B2 (ja) 2000-07-21 2004-10-13 株式会社ケンウッド 周波数補間装置、周波数補間方法及び記録媒体
EP1427252A1 (en) * 2002-12-02 2004-06-09 Deutsche Thomson-Brandt Gmbh Method and apparatus for processing audio signals from a bitstream
EP1571768A3 (en) * 2004-02-26 2012-07-18 Yamaha Corporation Mixer apparatus and sound signal processing method
GB2417866B (en) 2004-09-03 2007-09-19 Sony Uk Ltd Data transmission
US7720230B2 (en) * 2004-10-20 2010-05-18 Agere Systems, Inc. Individual channel shaping for BCC schemes and the like
SE0402651D0 (sv) 2004-11-02 2004-11-02 Coding Tech Ab Advanced methods for interpolation and parameter signalling
SE0402649D0 (sv) 2004-11-02 2004-11-02 Coding Tech Ab Advanced methods of creating orthogonal signals
SE0402652D0 (sv) 2004-11-02 2004-11-02 Coding Tech Ab Methods for improved performance of prediction based multi- channel reconstruction
EP1691348A1 (en) 2005-02-14 2006-08-16 Ecole Polytechnique Federale De Lausanne Parametric joint-coding of audio sources
PL1866912T3 (pl) 2005-03-30 2011-03-31 Koninl Philips Electronics Nv Kodowanie wielokanałowego sygnału audio
EP1866913B1 (en) 2005-03-30 2008-08-27 Koninklijke Philips Electronics N.V. Audio encoding and decoding
US7548853B2 (en) * 2005-06-17 2009-06-16 Shmunk Dmitry V Scalable compressed audio bit stream and codec using a hierarchical filterbank and multichannel joint coding
CN101288116A (zh) * 2005-10-13 2008-10-15 Lg电子株式会社 用于处理信号的方法和装置
KR100888474B1 (ko) 2005-11-21 2009-03-12 삼성전자주식회사 멀티채널 오디오 신호의 부호화/복호화 장치 및 방법
CN101410891A (zh) 2006-02-03 2009-04-15 韩国电子通信研究院 使用空间线索控制多目标或多声道音频信号的渲染的方法和装置
CN101390443B (zh) * 2006-02-21 2010-12-01 皇家飞利浦电子股份有限公司 音频编码和解码
EP2005787B1 (en) 2006-04-03 2012-01-25 Srs Labs, Inc. Audio signal processing
US8027479B2 (en) 2006-06-02 2011-09-27 Coding Technologies Ab Binaural multi-channel decoder in the context of non-energy conserving upmix rules
EP2036204B1 (en) * 2006-06-29 2012-08-15 LG Electronics Inc. Method and apparatus for an audio signal processing
EP3739752B1 (en) 2006-07-04 2021-12-15 Dolby International AB Filter system comprising a filter converter and a filter compressor and method for operating the filter system
MX2008012315A (es) 2006-09-29 2008-10-10 Lg Electronics Inc Metodos y aparatos para codificar y descodificar señales de audio basados en objeto.
KR100917843B1 (ko) 2006-09-29 2009-09-18 한국전자통신연구원 다양한 채널로 구성된 다객체 오디오 신호의 부호화 및복호화 장치 및 방법
KR101012259B1 (ko) * 2006-10-16 2011-02-08 돌비 스웨덴 에이비 멀티채널 다운믹스된 객체 코딩의 개선된 코딩 및 파라미터 표현
EP2095365A4 (en) 2006-11-24 2009-11-18 Lg Electronics Inc METHOD FOR ENCODING AND DECODING AUDIO SIGNALS BASED ON OBJECTS AND APPARATUS THEREOF
WO2008069593A1 (en) 2006-12-07 2008-06-12 Lg Electronics Inc. A method and an apparatus for processing an audio signal
CN103137130B (zh) 2006-12-27 2016-08-17 韩国电子通信研究院 用于创建空间线索信息的代码转换设备
RU2406165C2 (ru) 2007-02-14 2010-12-10 ЭлДжи ЭЛЕКТРОНИКС ИНК. Способы и устройства для кодирования и декодирования объектно-базированных аудиосигналов
CN101542595B (zh) 2007-02-14 2016-04-13 Lg电子株式会社 用于编码和解码基于对象的音频信号的方法和装置
EP2111617B1 (en) 2007-02-14 2013-09-04 LG Electronics Inc. Audio decoding method and corresponding apparatus
KR20080082917A (ko) 2007-03-09 2008-09-12 엘지전자 주식회사 오디오 신호 처리 방법 및 이의 장치
WO2008111773A1 (en) 2007-03-09 2008-09-18 Lg Electronics Inc. A method and an apparatus for processing an audio signal
EP2130304A4 (en) 2007-03-16 2012-04-04 Lg Electronics Inc METHOD AND DEVICE FOR PROCESSING AN AUDIO SIGNAL
US7991622B2 (en) * 2007-03-20 2011-08-02 Microsoft Corporation Audio compression and decompression using integer-reversible modulated lapped transforms
EP3712888B1 (en) 2007-03-30 2024-05-08 Electronics and Telecommunications Research Institute Apparatus and method for coding and decoding multi object audio signal with multi channel
JP5133401B2 (ja) 2007-04-26 2013-01-30 ドルビー・インターナショナル・アクチボラゲット 出力信号の合成装置及び合成方法
EP2165328B1 (en) 2007-06-11 2018-01-17 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Encoding and decoding of an audio signal having an impulse-like portion and a stationary portion
US7885819B2 (en) 2007-06-29 2011-02-08 Microsoft Corporation Bitstream syntax for multi-process audio decoding
JP5883561B2 (ja) 2007-10-17 2016-03-15 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ アップミックスを使用した音声符号器
EP2218068A4 (en) 2007-11-21 2010-11-24 Lg Electronics Inc METHOD AND APPARATUS FOR SIGNAL PROCESSING
KR100998913B1 (ko) 2008-01-23 2010-12-08 엘지전자 주식회사 오디오 신호의 처리 방법 및 이의 장치
KR101061129B1 (ko) 2008-04-24 2011-08-31 엘지전자 주식회사 오디오 신호의 처리 방법 및 이의 장치
CA2730198C (en) 2008-07-11 2014-09-16 Frederik Nagel Audio signal synthesizer and audio signal encoder
EP2144231A1 (en) * 2008-07-11 2010-01-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Low bitrate audio encoding/decoding scheme with common preprocessing
EP2144230A1 (en) * 2008-07-11 2010-01-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Low bitrate audio encoding/decoding scheme having cascaded switches
ES2592416T3 (es) 2008-07-17 2016-11-30 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Esquema de codificación/decodificación de audio que tiene una derivación conmutable
US8315396B2 (en) 2008-07-17 2012-11-20 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus and method for generating audio output signals using object based metadata
KR101108061B1 (ko) 2008-09-25 2012-01-25 엘지전자 주식회사 신호 처리 방법 및 이의 장치
US8798776B2 (en) 2008-09-30 2014-08-05 Dolby International Ab Transcoding of audio metadata
MX2011011399A (es) 2008-10-17 2012-06-27 Univ Friedrich Alexander Er Aparato para suministrar uno o más parámetros ajustados para un suministro de una representación de señal de mezcla ascendente sobre la base de una representación de señal de mezcla descendete, decodificador de señal de audio, transcodificador de señal de audio, codificador de señal de audio, flujo de bits de audio, método y programa de computación que utiliza información paramétrica relacionada con el objeto.
EP2194527A3 (en) * 2008-12-02 2013-09-25 Electronics and Telecommunications Research Institute Apparatus for generating and playing object based audio contents
KR20100065121A (ko) 2008-12-05 2010-06-15 엘지전자 주식회사 오디오 신호 처리 방법 및 장치
EP2205007B1 (en) 2008-12-30 2019-01-09 Dolby International AB Method and apparatus for three-dimensional acoustic field encoding and optimal reconstruction
WO2010085083A2 (en) 2009-01-20 2010-07-29 Lg Electronics Inc. An apparatus for processing an audio signal and method thereof
WO2010087627A2 (en) 2009-01-28 2010-08-05 Lg Electronics Inc. A method and an apparatus for decoding an audio signal
US8504184B2 (en) 2009-02-04 2013-08-06 Panasonic Corporation Combination device, telecommunication system, and combining method
CN105225667B (zh) * 2009-03-17 2019-04-05 杜比国际公司 编码器系统、解码器系统、编码方法和解码方法
WO2010105695A1 (en) 2009-03-20 2010-09-23 Nokia Corporation Multi channel audio coding
CN102449689B (zh) 2009-06-03 2014-08-06 日本电信电话株式会社 编码方法、编码装置、编码程序、以及它们的记录介质
TWI404050B (zh) * 2009-06-08 2013-08-01 Mstar Semiconductor Inc 多聲道音頻信號解碼方法與裝置
US20100324915A1 (en) * 2009-06-23 2010-12-23 Electronic And Telecommunications Research Institute Encoding and decoding apparatuses for high quality multi-channel audio codec
KR101283783B1 (ko) * 2009-06-23 2013-07-08 한국전자통신연구원 고품질 다채널 오디오 부호화 및 복호화 장치
WO2010149700A1 (en) 2009-06-24 2010-12-29 Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. Audio signal decoder, method for decoding an audio signal and computer program using cascaded audio object processing stages
JP5793675B2 (ja) 2009-07-31 2015-10-14 パナソニックIpマネジメント株式会社 符号化装置および復号装置
KR101805212B1 (ko) 2009-08-14 2017-12-05 디티에스 엘엘씨 객체-지향 오디오 스트리밍 시스템
PT2483887T (pt) 2009-09-29 2017-10-23 Dolby Int Ab Descodificador de sinal de áudio mpeg-saoc, método para fornecer uma representação de sinal de mistura ascendente usando descodificação mpeg-saoc e programa de comutador usando um valor comum de parâmetros de correlação inter-objetos dependente de tempo/frequência
WO2011048067A1 (en) 2009-10-20 2011-04-28 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E. V. Apparatus for providing an upmix signal representation on the basis of a downmix signal representation, apparatus for providing a bitstream representing a multichannel audio signal, methods, computer program and bitstream using a distortion control signaling
US9117458B2 (en) 2009-11-12 2015-08-25 Lg Electronics Inc. Apparatus for processing an audio signal and method thereof
TWI557723B (zh) 2010-02-18 2016-11-11 杜比實驗室特許公司 解碼方法及系統
CN113490133B (zh) * 2010-03-23 2023-05-02 杜比实验室特许公司 音频再现方法和声音再现系统
US8675748B2 (en) 2010-05-25 2014-03-18 CSR Technology, Inc. Systems and methods for intra communication system information transfer
US8755432B2 (en) 2010-06-30 2014-06-17 Warner Bros. Entertainment Inc. Method and apparatus for generating 3D audio positioning using dynamically optimized audio 3D space perception cues
CN103080623A (zh) 2010-07-20 2013-05-01 欧文斯科宁知识产权资产有限公司 阻燃聚合物护套
US8908874B2 (en) 2010-09-08 2014-12-09 Dts, Inc. Spatial audio encoding and reproduction
ES2525839T3 (es) 2010-12-03 2014-12-30 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Adquisición de sonido mediante la extracción de información geométrica de estimativos de dirección de llegada
TWI896112B (zh) 2010-12-03 2025-09-01 美商杜比實驗室特許公司 音頻解碼裝置、音頻解碼方法及音頻編碼方法
US9165558B2 (en) * 2011-03-09 2015-10-20 Dts Llc System for dynamically creating and rendering audio objects
CN103649706B (zh) 2011-03-16 2015-11-25 Dts(英属维尔京群岛)有限公司 三维音频音轨的编码及再现
US9754595B2 (en) * 2011-06-09 2017-09-05 Samsung Electronics Co., Ltd. Method and apparatus for encoding and decoding 3-dimensional audio signal
MY207992A (en) * 2011-07-01 2025-04-03 Dolby Laboratories Licensing Corp System and method for adaptive audio signal generation, coding and rendering
PL2727381T3 (pl) 2011-07-01 2022-05-02 Dolby Laboratories Licensing Corporation Sposób i urządzenie do renderowania obiektów audio
JP5740531B2 (ja) 2011-07-01 2015-06-24 ドルビー ラボラトリーズ ライセンシング コーポレイション オブジェクトベースオーディオのアップミキシング
CN102931969B (zh) 2011-08-12 2015-03-04 智原科技股份有限公司 数据提取的方法与装置
EP2560161A1 (en) 2011-08-17 2013-02-20 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Optimal mixing matrices and usage of decorrelators in spatial audio processing
JP6096789B2 (ja) 2011-11-01 2017-03-15 コーニンクレッカ フィリップス エヌ ヴェKoninklijke Philips N.V. オーディオオブジェクトのエンコーディング及びデコーディング
EP2721610A1 (en) 2011-11-25 2014-04-23 Huawei Technologies Co., Ltd. An apparatus and a method for encoding an input signal
CN105229731B (zh) * 2013-05-24 2017-03-15 杜比国际公司 根据下混的音频场景的重构
EP2830045A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Concept for audio encoding and decoding for audio channels and audio objects
EP2830047A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for low delay object metadata coding

Also Published As

Publication number Publication date
US11227616B2 (en) 2022-01-18
US20220101867A1 (en) 2022-03-31
EP4033485B1 (en) 2024-10-16
EP3025329A1 (en) 2016-06-01
US11984131B2 (en) 2024-05-14
AU2014295269A1 (en) 2016-03-10
PT3025329T (pt) 2022-06-24
US20160133267A1 (en) 2016-05-12
EP3025329B1 (en) 2022-03-23
RU2641481C2 (ru) 2018-01-17
CN110942778B (zh) 2024-07-02
CN105612577B (zh) 2019-10-22
PL4033485T3 (pl) 2025-02-24
EP4462820A3 (en) 2024-12-25
AU2014295269B2 (en) 2017-06-08
BR112016001143B1 (pt) 2022-03-03
US20190180764A1 (en) 2019-06-13
KR20180019755A (ko) 2018-02-26
ZA201601076B (en) 2017-08-30
CA3251771A1 (en) 2025-10-30
CN110942778A (zh) 2020-03-31
MX2016000910A (es) 2016-05-05
PL3025329T3 (pl) 2022-07-18
RU2016105518A (ru) 2017-08-25
CN105612577A (zh) 2016-05-25
KR20160033769A (ko) 2016-03-28
EP2830045A1 (en) 2015-01-28
KR101979578B1 (ko) 2019-05-17
EP4033485A1 (en) 2022-07-27
KR101943590B1 (ko) 2019-01-29
CA3251768A1 (en) 2025-03-17
US10249311B2 (en) 2019-04-02
TWI566235B (zh) 2017-01-11
CA2918148A1 (en) 2015-01-29
TW201528252A (zh) 2015-07-16
MX359159B (es) 2018-09-18
EP4462820A2 (en) 2024-11-13
JP2016525715A (ja) 2016-08-25
ES2913849T3 (es) 2022-06-06
BR112016001143A2 (es) 2017-07-25
AR097003A1 (es) 2016-02-10
WO2015010998A1 (en) 2015-01-29
JP6268286B2 (ja) 2018-01-24
EP4033485C0 (en) 2024-10-16
SG11201600476RA (en) 2016-02-26

Similar Documents

Publication Publication Date Title
ES2995102T3 (en) Concept for audio decoding for audio channels and audio objects
ES2650544T3 (es) Codificador de audio, decodificador de audio, procedimientos y programa informático que utiliza señales residuales codificadas conjuntamente
ES2959236T3 (es) Aparato y método para codificación mejorada de objetos de audio espacial
JP6134867B2 (ja) レンダラ制御式空間アップミックス
HK40078686B (en) Concept for audio decoding for audio channels and audio objects
HK40117863A (en) Concept for audio encoding and decoding for audio channels and audio objects
HK40078686A (en) Concept for audio decoding for audio channels and audio objects
HK1225497A1 (en) Concept for audio encoding and decoding for audio channels and audio objects
HK1225497B (en) Concept for audio encoding and decoding for audio channels and audio objects