ES2705100T3 - Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto - Google Patents

Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto Download PDF

Info

Publication number
ES2705100T3
ES2705100T3 ES16193463T ES16193463T ES2705100T3 ES 2705100 T3 ES2705100 T3 ES 2705100T3 ES 16193463 T ES16193463 T ES 16193463T ES 16193463 T ES16193463 T ES 16193463T ES 2705100 T3 ES2705100 T3 ES 2705100T3
Authority
ES
Spain
Prior art keywords
information
preset information
preset
audio signal
audio
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES16193463T
Other languages
English (en)
Inventor
Jeong-Il Seo
Seung-Kwon Beack
Tae-Jin Lee
Yong-Ju Lee
Dae-Young Jang
Kyeongok Kang
Jin-Woo Hong
Jin-Woong Kim
Chieteuk Ahn
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Electronics and Telecommunications Research Institute ETRI
Original Assignee
Electronics and Telecommunications Research Institute ETRI
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Electronics and Telecommunications Research Institute ETRI filed Critical Electronics and Telecommunications Research Institute ETRI
Application granted granted Critical
Publication of ES2705100T3 publication Critical patent/ES2705100T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S5/00Pseudo-stereo systems, e.g. in which additional channel signals are derived from monophonic signals by means of phase shifting, time delay or reverberation 
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S7/00Indicating arrangements; Control arrangements, e.g. balance control
    • H04S7/30Control circuits for electronic adaptation of the sound field
    • H04S7/308Electronic adaptation dependent on speaker or headphone connection
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/03Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/11Positioning of individual sound objects, e.g. moving airplane, within a sound field

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Signal Processing (AREA)
  • Acoustics & Sound (AREA)
  • Mathematical Physics (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Multimedia (AREA)
  • Stereophonic System (AREA)
  • Signal Processing For Digital Recording And Reproducing (AREA)

Abstract

Aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto, que comprende: una unidad de entrada de flujo de bits de información lateral configurada para recibir el flujo de bits de información lateral; un extractor de información de referencia espacial configurado para extraer información de referencia espacial basándose en el flujo de bits de información lateral; y un extractor de información preestablecida configurado para extraer información preestablecida e información preestablecida por defecto basándose en el flujo de bits de información lateral, en el que el flujo de bits de información lateral incluye una región de cabecera y una región de trama, en el que la región de trama incluye la información preestablecida y la región de cabecera incluye la información preestablecida por defecto para usar al menos una de la información preestablecida y la información preestablecida por defecto para renderizar la señal de audio multiobjeto que corresponde a la región de trama, en el que la información preestablecida incluye un diseño de un sistema de reproducción para que sea un sistema mono, un sistema estéreo o un sistema multicanal, una ubicación de objeto de audio y un nivel de objeto de audio, y en el que la información preestablecida se expresa en forma de matriz.

Description

DESCRIPCIÓN
Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto
Campo técnico
La presente invención se refiere a un método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto.
Este trabajo fue apoyado por el programa IT R&D de MIC/IITA [2008-F-011-01, Developing Next Generation DTV Core Technology (Standardization Linkage), Developing Autostereoscopic Personal 3-D Broadcasting Technology (Continued)].
Antecedentes de la técnica
Una tecnología convencional para codificar y descodificar una señal de audio no combina diferentes tipos de objetos de audio tales como un objeto de audio de canal mono, un objeto de audio de canal estéreo, y un objeto de audio multicanal. Es decir, la tecnología de codificación y descodificación de señal de audio convencional no permitía al usuario consumir un tipo de contenidos de audio en diversas maneras. Por consiguiente, un usuario ha consumido pasivamente los contenidos de audio.
Una tecnología de codificación de audio espacial (SAC) codifica una señal de audio multicanal en una señal de canal mono sometida a mezcla descendente o una señal de canal estéreo sometida a mezcla descendente con información de referencia espacial y transmite una señal multicanal de alta calidad incluso a una velocidad de bit baja. La tecnología SAC también analiza una señal de audio por cada subbanda y restaura una señal de audio multicanal original de la señal de canal mono sometida a mezcla descendente o la señal de canal estéreo sometida a mezcla descendente basándose en información de referencia espacial que corresponde a cada subbanda. La información de referencia espacial incluye información para restaurar una señal original en un procedimiento de descodificación y decide la calidad de una señal de audio que va a reproducirse en un aparato de descodificación SAC. El MPEG ha progresado la estandarización de la tecnología SAC como MPEG envolvente (MPS) y ha usado la diferencia de nivel de canal como una referencia espacial principal.
Ya que la tecnología SAC permite codificar y descodificar una señal de audio multicanal formada de un solo tipo de objeto de audio, es imposible codificar o descodificar una señal de audio que tenga diversos tipos de objetos de audio tales como un objeto de audio de canal mono, un objeto de audio de canal estéreo, o un objeto de audio multicanal tal como canales 5.1 que usan la tecnología SAC.
Se introdujo una tecnología de codificación de referencia binaural (BCC) según la técnica anterior para codificar o descodificar una señal de audio multiobjeto formada de objetos de audio de canal mono. Sin embargo, una señal de audio multiobjeto formada de objetos de audio de canal múltiples no podía codificarse o descodificarse usando la tecnología de codificación de referencia binaural BCC.
Tal como se describe anteriormente, las tecnologías de codificación y descodificación de audio convencionales no pueden usarse para codificar o descodificar una señal de audio multiobjeto que tiene objetos de audio multicanal aunque sea una única señal de audio objeto formada de objetos de audio de multicanal o una señal de audio multiobjeto formada de objetos de audio de canal mono. Por tanto, una pluralidad de diferentes objetos de audio de canal no puede combinarse basándose en las tecnologías de codificación y descodificación de audio convencionales. Es decir, un usuario no podría consumir un tipo de contenidos de audio en diversas maneras. La tecnología de codificación y descodificación de audio convencional permite a un usuario solo consumir pasivamente contenidos de audio.
Los enfoques para codificación de audio multiobjeto se dan a conocer por ejemplo en los documentos WO 2008/111770 A1 y WO 2008/078973 A1.
Divulgación
Problema técnico
Una realización de la presente invención está dirigida a proporcionar un método y aparato para cambiar la configuración de información de escena de audio (por ejemplo preestablecer) según la intención de un ingeniero de sonido o un editor mientras se reproduce una señal de audio multiobjeto incluyendo información preestablecida en una región de trama del flujo de bits de información lateral que se genera cuando se codifica la señal de audio multiobjeto.
Pueden entenderse otros objetos y ventajas de la presente invención a partir de la siguiente descripción, y resultan evidentes con referencia a las realizaciones de la presente invención. También, es obvio para aquellos expertos en la técnica de la presente invención que los objetos y ventajas de la presente invención pueden realizarse mediante los medios reivindicados y combinaciones de los mismos.
Solución técnica
Según aspectos de la presente invención, se proporciona un aparato y un método para analizar un flujo de bits de información lateral de una señal de audio multiobjeto según las reivindicaciones 1 y 6.
Efectos ventajosos
Un método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto según una realización de la presente invención permite ventajosamente el cambio de configuración de información de escena de audio según la intención de un editor o un ingeniero de sonido mientras se reproduce una señal de audio multiobjeto incluyendo información preestablecida en una región de trama de un flujo de bits de información lateral generado cuando se codifica una señal de audio multiobjeto.
Breve descripción de los dibujos
La figura 1 es un diagrama que describe codificar, descodificar, y renderizar una señal de audio multiobjeto según una realización de la presente invención.
La figura 2 ilustra una estructura de un flujo de bits de información lateral generado usando una señal de audio multiobjeto.
La figura 3 ilustra una estructura de un flujo de bits de información lateral según una realización de la presente invención.
La figura 4 ilustra una estructura de un flujo de bits de información lateral según otra realización de la presente invención.
La figura 5 ilustra una estructura de un flujo de bits de información lateral según aún otra realización de la presente invención.
Mejor modo para la invención
Las ventajas, características y aspectos de la invención resultarán evidentes a partir de la siguiente descripción de las realizaciones con referencia a los dibujos adjuntos, que se expone a continuación en el presente documento. Cuando se considera que una descripción detallada de una técnica anterior puede impedir ver claramente un punto de la presente invención, la descripción no se proporcionará en el presente documento.
La presente invención se refiere a una tecnología para comprimir y descomprimir una señal de audio multicanal/multiobjeto. La codificación de audio multiobjeto es una tecnología para comprimir diferentes objetos de audio juntos y transmitir los objetos de audio comprimidos. La tecnología de codificación de audio multiobjeto se desarrolló basándose en una tecnología de codificación de audio espacial (SAC).
En un procedimiento de descodificación de una señal de audio multiobjeto, se somete a mezcla descendente y se transmite una señal de audio de entrada formada de múltiples objetos a un aparato descodificador. Aquí, se transmite un flujo de bits de información lateral con la señal sometida a mezcla descendente. El flujo de bits de información lateral incluye información necesaria para reproducir una señal de audio multiobjeto. La información para reproducir una señal de audio multiobjeto incluye información de escena de audio preestablecida (ASI preestablecida). El público de una señal de audio multiobjeto puede disfrutar diversas escenas de audio usando la información preestablecida configurada y proporcionada por un editor o un ingeniero de sonido.
El flujo de bits de información lateral está dividido en una región de cabecera y una región de trama. La información preestablecida solo está incluida en la región de cabecera. Por consiguiente, a un público solo se le proporciona información preestablecida por defecto almacenada en la región de cabecera. Después de proporcionar la información preestablecida por defecto, es imposible actualizar la información preestablecida.
Con el fin de superar el problema, una realización de la presente invención proporciona una tecnología para proporcionar escenas de audio realistas al público actualizando la información preestablecida mientras se reproduce una señal de audio multiobjeto. Con el fin de actualizar la información preestablecida, un método y aparato para generar un flujo de bits de información lateral según un ejemplo incluye la información preestablecida en una región de trama del flujo de bits de subinformación. Es decir, un método y aparato para generar un flujo de bits de información lateral según el ejemplo permite a un público recibir no solo información preestablecida por defecto incluida en una región de cabecera sino también información preestablecida opcional incluida en cada trama incluyendo la información preestablecida en la región de trama y transmitiendo la información preestablecida con la región de trama.
Por ejemplo, una fuente de sonido de coro está ubicada en la parte frontal de un escenario con una fuente de sonido vocal principal cuando se reproduce inicialmente una señal de audio correspondiente. La información preestablecida actualizada puede reubicar la fuente de sonido de coro en la parte posterior del escenario en un tiempo predeterminado durante la reproducción de la señal de audio. Como otro ejemplo, es posible mover una ubicación de una fuente de sonido de coro desde la parte frontal de un escenario o la parte trasera del escenario según el tiempo durante la reproducción de la señal de audio. El método y aparato para analizar un flujo de bits de información lateral según la presente invención pueden mejorar un campo de sonido de una señal de audio o formar una escena de sonido dinámica.
A continuación en el presente documento, se describirá con referencia a los dibujos adjuntos un método y aparato para generar un flujo de bits de información lateral según un ejemplo. Referencias numéricas parecidas denotan elementos parecidos en todos los dibujos adjuntos.
La figura 1 es un diagrama para describe codificar, descodificar, y renderizar una señal de audio multiobjeto según una realización de la presente invención.
Haciendo referencia a la figura 1, se codifica, descodifica, y renderiza una señal de audio multiobjeto a través de un codificador SAOC 102, un formateador de flujo de bits 104, un descodificador SAOC 106, un analizador de flujo de bits 108, un generador de matriz de renderización 110, y un renderizador 112 según la presente realización.
En un codificador de objeto de audio espacial multiobjeto (SAOC), se codifica una señal introducida como objeto de audio. Cada uno de los objetos de audio se restaura mediante un descodificador. Los objetos restaurados no se reproducen independientemente. Los objetos restaurados están renderizados basándose en información sobre objetos de audio para formar una escena de audio específica y emitida como una señal de audio multiobjeto. Por tanto, es necesario tener un aparato para renderizar información sobre objetos de audio de entrada con el fin de obtener una escena de audio predeterminada basándose en una señal de audio multiobjeto.
El codificador SAOC 102 es un codificador basado en referencia espacial y codifica una señal de audio de entrada como objeto de audio. Aquí, el objeto de audio introducido al codificador SAOC 102 puede ser una señal de audio de canal mono o una señal de audio de canal estéreo. El codificador SAOC 102 emite una señal sometida a mezcla descendente codificando más de un objeto de audio. La señal sometida a mezcla descendente emitida puede ser una señal mono o una señal estéreo. El codificador SAOC 102 extrae parámetros de referencia espacial relacionados con el multiobjeto necesario para descodificar la señal sometida a mezcla descendente. El codificador SAOC 102 puede analizar una señal de objeto de audio de entrada basándose en un esquema de diseño heterogéneo SAOC o un esquema de Faller.
El parámetro de referencia espacial extraído incluye información de referencia espacial. La referencia espacial se analiza y extrae mediante una unidad de una subbanda de dominio de frecuencias. La referencia espacial es información usada para codificar y descodificar una señal de audio. La referencia espacial se extrae de un dominio de frecuencia e incluye información sobre diferencia de amplitud, diferencia de retardo, y correlación entre dos señales. Por ejemplo, la referencia espacial incluye diferencia de nivel de canal (CLD), diferencia de nivel intercanal (ICLD), diferencia de tiempo intercanal (ICTD), correlación intercanal (ICC), e información de ubicación de fuente virtual. Sin embargo, la presente invención no se limita a esto.
El parámetro de referencia espacial incluye información para restaurar y controlar la referencia espacial y una señal de audio. Particularmente, información de cabecera incluida en un parámetro de referencia espacial incluye información para restaurar y reproducir una señal de audio multiobjeto formada de diversos objetos de audio de tipo canal y define información de canal sobre un objeto de audio y una ID de un objeto de audio correspondiente, proporcionando de ese modo información de descodificación sobre objetos de audio de canal mono, objetos de audio de canal estéreo, y objetos de audio multicanal. Por ejemplo, la información de cabecera puede incluir información de identificación (ID) o un objeto que permite identificar si un objeto de audio codificado es una señal de audio de canal mono o una señal de audio de canal estéreo.
El formateador de flujo de bits 104 genera un flujo de bits de información lateral (flujo de bits SAOC) basándose en información preestablecida (ASI preestablecida) de un dispositivo externo y los parámetros de referencia espacial transferidos desde el codificador SAOC 102.
El descodificador SAOC 106 restaura la señal sometida a mezcla descendente del codificador SAOC 102 como una señal de audio multiobjeto que usa el parámetro de referencia espacial emitido del analizador de flujo de bits 108. El descodificador SAOC 106 puede sustituirse con un descodificador MPEG envolvente y un descodificador BCC. El analizador de flujo de bits 108 extrae parámetros de referencia espacial e información preestablecida analizando el flujo de bits de información lateral emitido del formateador de flujo de bits 104. Los parámetros de referencia espacial extraídos se transfieren al descodificador SAOC 106, y la información preestablecida se transfiere a un generador de matriz de renderización 110.
El generador de matriz de renderización 110 genera una matriz de renderización usando información preestablecida emitida del analizador de flujo de bits 108 y control de usuario introducido de un dispositivo externo. Si la información preestablecida no se transmite del analizador de flujo de bits 108, se configura por defecto la información preestablecida.
El renderizador 112 renderiza una señal de audio multiobjeto emitida del descodificador SAOC 106 para dar una señal de audio multicanal usando la matriz renderizada emitida del generador de matriz de renderización 110.
Aunque se ha descrito la codificación, descodificación, y renderización de la señal de audio multiobjeto según la presente realización con referencia a la figura 1, el flujo de bits de información lateral según la presente invención no se limita a esto. Es decir, la presente invención puede aplicarse de manera idéntica a cualquier estructura para renderizar señales multiobjeto basándose en información preestablecida incluida en la señal de objeto de audio. La figura 2 es un diagrama para describir una estructura de un flujo de bits de información lateral generado usando una señal de audio multiobjeto.
Tal como se muestra en la figura 2, el flujo de bits de información lateral incluye una región de cabecera y una región de trama. La región de cabecera incluye información de cabecera, información de canal de un objeto de audio, información de la ID de un objeto de audio correspondiente, el número de objetos de audio por un canal. La región de trama incluye información sobre una señal de audio real, por ejemplo, información de referencia espacial.
La información preestablecida significa información de control de objeto de audio e información de diseño de altavoz. En más detalle, la información preestablecida incluye información de diseño de altavoz, información de ubicación de objeto de audio, e información de nivel con el fin de producir una escena de audio de manera adecuada. La información preestablecida puede expresarse directamente o, según la invención, expresarse en una formación de matriz.
Cuando la información preestablecida se expresa directamente, la información preestablecida puede incluir información sobre un diseño de un sistema de reproducción tal como un sistema mono, un sistema estéreo, y un sistema multicanal, una ID de objeto de audio, un diseño de objeto de audio (mono o estéreo), una ubicación de objeto de audio, azimut tal como de 0 grados a 360 grados, elevación tal como de -50 grados a 90 grados, y un nivel de objeto de audio tal como de -50 dB a 50dB.
Cuando la información preestablecida se expresa en una formación de matriz, la información preestablecida puede tener una forma de una matriz P tal como se muestra en la Ec. 1. La información preestablecida expresada en la matriz incluye información de ganancia de potencia que se asignará a un canal de salida o información de fase como vectores de elementos.
Figure imgf000005_0001
La información preestablecida puede definir diversas escenas de audio del mismo contenido de audio para adecuarse a diferentes escenarios de reproducción. Por ejemplo, puede generarse una pluralidad de información preestablecida configurada para sistemas de reproducción estéreo o multicanal tales como sistemas de reproducción de canal 5.1 y canal 7.1 para adecuarse al objetivo de un servicio de reproducción o a la intención de un productor de contenidos. Un usuario puede seleccionar una información de escena de audio de entre más de una información de escena de audio (ASI) incluida en la información preestablecida. La información de escena de audio seleccionada se usa para renderizar una señal de audio multiobjeto de contenidos de audio correspondientes.
El flujo de bits de información lateral incluye información preestablecida para renderizar una señal de audio multiobjeto. Una información preestablecida de este tipo no estaba incluida en una región de trama según la técnica anterior. La información preestablecida solo estaba incluida convencionalmente en una región de cabecera. Por tanto, solo se permitía disfrutar de manera limitada de una señal de audio multiobjeto a un usuario o un público usando solamente información preestablecida por defecto incluida en la región de cabecera.
La figura 3 ilustra una estructura de un flujo de bits de información lateral según una realización de la presente invención.
Haciendo referencia de nuevo a la figura 2, la información preestablecida por defecto solo está incluida en la región de cabecera en la técnica anterior. Por tanto, es imposible proporcionar diversa información preestablecida configurada de manera adecuada con respecto a un entorno variable durante la reproducción de una señal de audio o configurada de manera adecuada con respecto a las múltiples intenciones de un productor de contenidos, un editor, o un ingeniero de sonido. Con el fin de superar tal inconveniente, el flujo de bits de información lateral según la presente realización incluye información preestablecida no solo en una región de cabecera sino también en una región de trama. Por tanto, el flujo de bits de información lateral según la presente realización permite proporcionar información preestablecida diferente de la información preestablecida por defecto incluida en una región de cabecera en un punto (o trama) de tiempo predeterminado mientras se reproduce una imagen multiobjeto.
Haciendo referencia a la figura 3, un flujo de bits de información lateral según la presente realización incluye una región de cabecera y una región de trama. La región de cabecera incluye información de cabecera e información preestablecida por defecto. Ya que la información de cabecera ya se ha descrito en detalle, está omitida la descripción detallada de la misma. Puede proporcionarse a un usuario la información preestablecida por defecto en una fase inicial de la reproducción de una señal de audio multiobjeto.
La región de trama incluye más de una trama. Tal como se muestra en la figura 3, la región de trama incluye una primera trama, una segunda trama, ..., y una enésima trama. Cada una de las tramas puede incluir una pluralidad de información. La figura 3 muestra la región de trama que incluye información de referencia espacial e información preestablecida por comodidad. Tal como se muestra en la figura 3, una primera trama puede incluir no solo primera información de referencia espacial sino también primera información preestablecida. De manera similar, la segunda trama incluye segunda información de referencia espacial con segunda información preestablecida.
Es posible proporcionar información preestablecida de una trama correspondiente mientras se reproduce una señal de audio multiobjeto mediante la asignación de un espacio en cada trama para incluir información preestablecida. Por ejemplo, el analizador de flujo de bits 108 de la figura 1 analiza secuencialmente un flujo de bits de información lateral del formateador de flujo de bits 104. El analizador de flujo de bits 108 extrae información preestablecida por defecto analizando la región de cabecera y extrayendo continuamente información preestablecida incluida en una región de trama analizando la región de trama. El analizador de flujo de bits 108 transmite la información preestablecida extraída al generador de matriz de renderización 110. Por tanto, el analizador de flujo de bits 108 según la presente realización puede extraer nueva información preestablecida siempre que el analizador de flujo de bits 108 analiza cada región de trama y usa la nueva información preestablecida extraída para renderizar una señal de audio multiobjeto correspondiente a una trama correspondiente.
La información preestablecida puede usarse en diversas maneras proporcionando la información preestablecida por cada trama. Por ejemplo, si se recibe una trama que incluye nueva información preestablecida mientras se renderiza cada trama basándose en la información preestablecida por defecto de la región de cabecera en una fase inicial de reproducción de una señal de audio correspondiente, la nueva información preestablecida solo puede aplicarse para renderizar la trama correspondiente o la nueva información preestablecida puede aplicarse para renderizar las tramas restantes.
Si se recibe otra trama que incluye diferente información preestablecida después de aplicar la nueva información preestablecida, se aplicará la información preestablecida de la trama recién recibida a una trama correspondiente. Como método de usar la información preestablecida por defecto incluida en la región de cabecera, es posible proporcionar diversa información preestablecida a un usuario proporcionando toda la información preestablecida por defecto de la región de cabecera y la nueva información preestablecida incluida en tramas correspondientes.
La figura 4 es un diagrama que ilustra una estructura de un flujo de bits de información lateral según otra realización de la presente invención.
Haciendo referencia a la figura 4, el flujo de bits de información lateral incluye una región de cabecera y una región de trama. La región de cabecera incluye información de cabecera e información preestablecida por defecto. La región de trama incluye más de una trama tal como una primera trama, una segunda trama, ..., y una enésima trama.
En la figura 4, la primera trama incluye una pluralidad de información preestablecida tal como primera información preestablecida y segunda información preestablecida. Según el flujo de bits de información lateral según la presente realización, un usuario recibe información preestablecida más diversa en un periodo correspondiente a la primera trama que cualquier otro periodo incluyendo una pluralidad de información preestablecida en una trama tal como se muestra en la figura 4.
Aunque no se muestra en la figura 4, la segunda trama también puede tener una pluralidad de información preestablecida como la primera trama. O, la segunda trama puede no incluir cualquier información preestablecida. Aunque no se muestra en la figura 4, es posible incluir información preestablecida en cada trama en un patrón regular. Por ejemplo, la primera trama incluye tres informaciones preestablecidas, la segunda trama no incluye información preestablecida, la tercera trama incluye tres tramas de nuevo, y la cuarta trama no incluye información preestablecida.
Adicionalmente, es posible incluir información preestablecida solo en una región de trama particular tal como se muestra en la figura 4. Además, puede incluirse más de una trama en la región de trama basándose en diversos patrones aplicables.
Mediante la configuración de diversas regiones para incluir información preestablecida por cada trama tal como se ha descrito anteriormente, es posible proporcionar diversa información de escena de audio sobre una señal de audio multiobjeto correspondiente a cada trama.
La figura 5 es un diagrama que ilustra una estructura de un flujo de bits de información lateral según otra realización de la presente invención.
Haciendo referencia a la figura 5, el flujo de bits de información lateral (flujo de bits SAOC) incluye una región de información preestablecida. (Región ASI preestablecida). La región de información preestablecida incluye una pluralidad de información preestablecida tal como ASI preestablecida (por defecto), a Si preestablecida (1) a (N). Una información preestablecida incluye información de control de objeto de audio e información de diseño de altavoz. Tal como se ha descrito anteriormente, la información preestablecida puede expresarse directamente o expresarse en una formación de matriz. En caso de expresarse directamente, la información preestablecida incluye una ID de objeto, un tipo de objeto, una ubicación, un diseño de altavoz, e información de nivel de sonido en la misma cantidad que el número de objetos. Tal como se muestra en la figura 5, puede expresarse la información preestablecida en una matriz que tiene tales elementos como vectores de elementos.
El método descrito anteriormente según la presente invención puede realizarse como un programa y almacenarse en un medio de grabación legible por ordenador. El medio de grabación legible por ordenador es cualquier dispositivo de almacenamiento de datos que puede almacenar datos que el sistema informático puede leer después. El medio de grabación legible por ordenador incluye una memoria de solo lectura (ROM), una memoria de acceso aleatorio (RAM), un CD-ROM, un disquete, un disco duro y un disco magneto-óptico.
La presente solicitud incluye contenido relacionado con la solicitud de patente coreana n.° 2008-0029562, presentada en la oficina de propiedad intelectual coreana el 31 de marzo de 2008, y la solicitud de patente coreana n.° 2008-0034161, presentada en la oficina de propiedad intelectual coreana el 14 de abril de 2008.
Aunque se ha descrito la presente invención con respecto a las realizaciones específicas, resultará evidente para los expertos en la técnica que pueden realizarse diversos cambios y modificaciones sin apartarse del alcance de la invención tal como se define en las siguientes reivindicaciones.

Claims (10)

  1. REIVINDICACIONES
    i. Aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto, que comprende:
    una unidad de entrada de flujo de bits de información lateral configurada para recibir el flujo de bits de información lateral;
    un extractor de información de referencia espacial configurado para extraer información de referencia espacial basándose en el flujo de bits de información lateral; y
    un extractor de información preestablecida configurado para extraer información preestablecida e información preestablecida por defecto basándose en el flujo de bits de información lateral, en el que el flujo de bits de información lateral incluye una región de cabecera y una región de trama, en el que la región de trama incluye la información preestablecida y la región de cabecera incluye la información preestablecida por defecto para usar al menos una de la información preestablecida y la información preestablecida por defecto para renderizar la señal de audio multiobjeto que corresponde a la región de trama,
    en el que la información preestablecida incluye un diseño de un sistema de reproducción para que sea un sistema mono, un sistema estéreo o un sistema multicanal, una ubicación de objeto de audio y un nivel de objeto de audio, y
    en el que la información preestablecida se expresa en forma de matriz.
  2. 2. Aparato según la reivindicación 1, en el que la región de trama incluye una o más tramas y al menos una de las tramas incluye una o más información preestablecida.
  3. 3. Aparato según la reivindicación 1, en el que la información preestablecida expresada en forma de matriz incluye información de ganancia de potencia que se asignará a un canal de salida con respecto a cada objeto de audio.
  4. 4. Aparato según la reivindicación 1, en el que la información de referencia espacial se extrae de un dominio de frecuencia.
  5. 5. Aparato según la reivindicación 1, en el que la información de referencia espacial incluye información sobre diferencia de amplitud, diferencia de retardo, y correlación entre dos señales de objeto.
  6. 6. Método para analizar un flujo de bits de información lateral de una señal de audio multiobjeto, que comprende:
    recibir el flujo de información lateral;
    extraer información de referencia espacial basándose en el flujo de bits de información lateral; y extraer información preestablecida e información preestablecida por defecto basándose en el flujo de bits de información lateral,
    en el que el flujo de bits de información lateral incluye una región de cabecera y una región de trama, en el que la región de trama incluye la información preestablecida y la región de cabecera incluye la información preestablecida por defecto para usar al menos una de la información preestablecida y la información preestablecida por defecto para renderizar la señal de audio multiobjeto que corresponde a la región de trama,
    en el que la información preestablecida incluye un diseño de un sistema de reproducción para que sea un sistema mono, un sistema estéreo o un sistema multicanal, una ubicación de objeto de audio y un nivel de objeto de audio, y
    en el que la información preestablecida se expresa en forma de matriz.
  7. 7. Método según la reivindicación 6, en el que la región de trama incluye una o más tramas y al menos una de las tramas incluye una o más información preestablecida.
  8. 8. Método según la reivindicación 6, en el que la información preestablecida expresada en forma de matriz incluye información de ganancia de potencia que se asignará a un canal de salida con respecto a cada objeto de audio.
  9. 9. Método según la reivindicación 6, en el que la información de referencia espacial se extrae de un dominio de frecuencia.
  10. 10. Método según la reivindicación 6, en el que la información de referencia espacial incluye información sobre diferencia de amplitud, diferencia de retardo, y correlación entre dos señales.
ES16193463T 2008-03-31 2009-03-30 Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto Active ES2705100T3 (es)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
KR20080029562 2008-03-31
KR20080034161 2008-04-14
KR1020090024374A KR101461685B1 (ko) 2008-03-31 2009-03-23 다객체 오디오 신호의 부가정보 비트스트림 생성 방법 및 장치

Publications (1)

Publication Number Publication Date
ES2705100T3 true ES2705100T3 (es) 2019-03-21

Family

ID=41136037

Family Applications (2)

Application Number Title Priority Date Filing Date
ES09727018.5T Active ES2622060T3 (es) 2008-03-31 2009-03-30 Método y aparato para generar flujo de bits de información adicional de señal de audio multiobjeto
ES16193463T Active ES2705100T3 (es) 2008-03-31 2009-03-30 Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto

Family Applications Before (1)

Application Number Title Priority Date Filing Date
ES09727018.5T Active ES2622060T3 (es) 2008-03-31 2009-03-30 Método y aparato para generar flujo de bits de información adicional de señal de audio multiobjeto

Country Status (6)

Country Link
US (2) US9299352B2 (es)
EP (2) EP2273492B1 (es)
KR (2) KR101461685B1 (es)
CN (3) CN102800321B (es)
ES (2) ES2622060T3 (es)
WO (1) WO2009123409A2 (es)

Families Citing this family (23)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN103137130B (zh) * 2006-12-27 2016-08-17 韩国电子通信研究院 用于创建空间线索信息的代码转换设备
US20100324915A1 (en) * 2009-06-23 2010-12-23 Electronic And Telecommunications Research Institute Encoding and decoding apparatuses for high quality multi-channel audio codec
CN102630385B (zh) * 2009-11-30 2015-05-27 诺基亚公司 音频场景内的音频缩放处理的方法、装置及系统
EP2511908A4 (en) * 2009-12-11 2013-07-31 Korea Electronics Telecomm AUDIO AUTOMATION DEVICE AND AUDIO REPRODUCTION DEVICE FOR A OBJECT-BASED AUDIO DEVICE AND AUDIO-AUTO PROCESS AND AUDIO REPRODUCTION PROCESS THEREWITH
ES2525839T3 (es) * 2010-12-03 2014-12-30 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Adquisición de sonido mediante la extracción de información geométrica de estimativos de dirección de llegada
KR20120071072A (ko) * 2010-12-22 2012-07-02 한국전자통신연구원 객체 기반 오디오를 제공하는 방송 송신 장치 및 방법, 그리고 방송 재생 장치 및 방법
SG194199A1 (en) 2011-03-18 2013-12-30 Fraunhofer Ges Forschung Frame element positioning in frames of a bitstream representing audio content
RU2630754C2 (ru) 2013-05-24 2017-09-12 Долби Интернешнл Аб Эффективное кодирование звуковых сцен, содержащих звуковые объекты
CN105229731B (zh) 2013-05-24 2017-03-15 杜比国际公司 根据下混的音频场景的重构
BR112015029113B1 (pt) * 2013-05-24 2022-03-22 Dolby International Ab Método para a codificação de objetos de áudio como um fluxo de dados, método para a reconstrução de objetos de áudio com base em um fluxo de dados e decodificador para reconstruir objetos de áudio com base em um fluxo de dados
MY204539A (en) 2013-05-24 2024-09-03 Dolby Int Ab Coding of audio scenes
KR102243395B1 (ko) * 2013-09-05 2021-04-22 한국전자통신연구원 오디오 부호화 장치 및 방법, 오디오 복호화 장치 및 방법, 오디오 재생 장치
WO2015150384A1 (en) * 2014-04-01 2015-10-08 Dolby International Ab Efficient coding of audio scenes comprising audio objects
US9955278B2 (en) 2014-04-02 2018-04-24 Dolby International Ab Exploiting metadata redundancy in immersive audio metadata
EP3196876B1 (en) * 2014-09-04 2020-11-18 Sony Corporation Transmitting device, transmitting method, receiving device and receiving method
US9774974B2 (en) 2014-09-24 2017-09-26 Electronics And Telecommunications Research Institute Audio metadata providing apparatus and method, and multichannel audio data playback apparatus and method to support dynamic format conversion
KR102717784B1 (ko) 2017-02-14 2024-10-16 한국전자통신연구원 스테레오 오디오 신호에 대한 태그 삽입 장치 및 태그 삽입 방법, 그리고, 태그 추출 장치 및 태그 추출 방법
EP3566473B8 (en) * 2017-03-06 2022-06-15 Dolby International AB Integrated reconstruction and rendering of audio signals
CN108550369B (zh) * 2018-04-14 2020-08-11 全景声科技南京有限公司 一种可变长度的全景声信号编解码方法
GB2575305A (en) * 2018-07-05 2020-01-08 Nokia Technologies Oy Determination of spatial audio parameter encoding and associated decoding
US11750745B2 (en) * 2020-11-18 2023-09-05 Kelly Properties, Llc Processing and distribution of audio signals in a multi-party conferencing environment
KR20220151953A (ko) 2021-05-07 2022-11-15 한국전자통신연구원 부가 정보를 이용한 오디오 신호의 부호화 및 복호화 방법과 그 방법을 수행하는 부호화기 및 복호화기
WO2022245076A1 (ko) * 2021-05-21 2022-11-24 삼성전자 주식회사 다채널 오디오 신호 처리 장치 및 방법

Family Cites Families (33)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6624873B1 (en) * 1998-05-05 2003-09-23 Dolby Laboratories Licensing Corporation Matrix-encoded surround-sound channels in a discrete digital sound format
US6931371B2 (en) * 2000-08-25 2005-08-16 Matsushita Electric Industrial Co., Ltd. Digital interface device
US7378586B2 (en) * 2002-10-01 2008-05-27 Yamaha Corporation Compressed data structure and apparatus and method related thereto
EP1427252A1 (en) * 2002-12-02 2004-06-09 Deutsche Thomson-Brandt Gmbh Method and apparatus for processing audio signals from a bitstream
PL1647010T3 (pl) * 2003-07-21 2018-02-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Sposób konwersji formatu pliku audio
JP2005149608A (ja) * 2003-11-14 2005-06-09 Renesas Technology Corp 音声データ記録/再生システムとその音声データ記録媒体
DE10355146A1 (de) * 2003-11-26 2005-07-07 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Erzeugen eines Tieftonkanals
US8214221B2 (en) * 2005-06-30 2012-07-03 Lg Electronics Inc. Method and apparatus for decoding an audio signal and identifying information included in the audio signal
KR20070005468A (ko) * 2005-07-05 2007-01-10 엘지전자 주식회사 부호화된 오디오 신호의 생성방법, 그 부호화된 오디오신호를 생성하는 인코딩 장치 그리고 그 부호화된 오디오신호를 복호화하는 디코딩 장치
WO2007040357A1 (en) * 2005-10-05 2007-04-12 Lg Electronics Inc. Method and apparatus for signal processing and encoding and decoding method, and apparatus therefor
WO2007083958A1 (en) * 2006-01-19 2007-07-26 Lg Electronics Inc. Method and apparatus for decoding a signal
CN101410891A (zh) * 2006-02-03 2009-04-15 韩国电子通信研究院 使用空间线索控制多目标或多声道音频信号的渲染的方法和装置
KR100902899B1 (ko) 2006-02-07 2009-06-15 엘지전자 주식회사 부호화/복호화 장치 및 방법
CA2646278A1 (en) * 2006-02-09 2007-08-16 Lg Electronics Inc. Method for encoding and decoding object-based audio signal and apparatus thereof
KR20070088958A (ko) * 2006-02-27 2007-08-30 한국전자통신연구원 다채널 오디오 신호 시각화 방법과 공간큐를 이용한음상정보 변환 방법 및 그 장치
ATE527833T1 (de) * 2006-05-04 2011-10-15 Lg Electronics Inc Verbesserung von stereo-audiosignalen mittels neuabmischung
US8379868B2 (en) * 2006-05-17 2013-02-19 Creative Technology Ltd Spatial audio coding based on universal spatial cues
US20080004729A1 (en) * 2006-06-30 2008-01-03 Nokia Corporation Direct encoding into a directional audio coding format
WO2008039045A1 (en) * 2006-09-29 2008-04-03 Lg Electronics Inc., Apparatus for processing mix signal and method thereof
JP5337941B2 (ja) * 2006-10-16 2013-11-06 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ マルチチャネル・パラメータ変換のための装置および方法
KR101012259B1 (ko) * 2006-10-16 2011-02-08 돌비 스웨덴 에이비 멀티채널 다운믹스된 객체 코딩의 개선된 코딩 및 파라미터 표현
WO2008069593A1 (en) * 2006-12-07 2008-06-12 Lg Electronics Inc. A method and an apparatus for processing an audio signal
CN103137130B (zh) 2006-12-27 2016-08-17 韩国电子通信研究院 用于创建空间线索信息的代码转换设备
EP2111617B1 (en) * 2007-02-14 2013-09-04 LG Electronics Inc. Audio decoding method and corresponding apparatus
KR20080082917A (ko) * 2007-03-09 2008-09-12 엘지전자 주식회사 오디오 신호 처리 방법 및 이의 장치
JP5133401B2 (ja) * 2007-04-26 2013-01-30 ドルビー・インターナショナル・アクチボラゲット 出力信号の合成装置及び合成方法
US8055708B2 (en) * 2007-06-01 2011-11-08 Microsoft Corporation Multimedia spaces
US8073125B2 (en) * 2007-09-25 2011-12-06 Microsoft Corporation Spatial audio conferencing
JP5883561B2 (ja) * 2007-10-17 2016-03-15 フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ アップミックスを使用した音声符号器
US20090136087A1 (en) * 2007-11-28 2009-05-28 Joseph Oren Replacement Based Watermarking
JP5243554B2 (ja) * 2008-01-01 2013-07-24 エルジー エレクトロニクス インコーポレイティド オーディオ信号の処理方法及び装置
EP2250821A1 (en) * 2008-03-03 2010-11-17 Nokia Corporation Apparatus for capturing and rendering a plurality of audio channels
US8229191B2 (en) * 2008-03-05 2012-07-24 International Business Machines Corporation Systems and methods for metadata embedding in streaming medical data

Also Published As

Publication number Publication date
EP2273492A2 (en) 2011-01-12
CN101981617A (zh) 2011-02-23
WO2009123409A2 (ko) 2009-10-08
CN102800321B (zh) 2017-04-12
KR20140028094A (ko) 2014-03-07
KR20090104674A (ko) 2009-10-06
EP3147899B1 (en) 2018-11-07
ES2622060T3 (es) 2017-07-05
EP3147899A1 (en) 2017-03-29
CN102800320A (zh) 2012-11-28
EP2273492A4 (en) 2012-06-13
US20160165375A1 (en) 2016-06-09
KR101506837B1 (ko) 2015-03-31
KR101461685B1 (ko) 2014-11-19
CN102800320B (zh) 2017-04-12
CN102800321A (zh) 2012-11-28
EP2273492B1 (en) 2017-01-11
US20110015770A1 (en) 2011-01-20
WO2009123409A3 (ko) 2009-11-26
US9299352B2 (en) 2016-03-29
CN101981617B (zh) 2012-08-29

Similar Documents

Publication Publication Date Title
ES2705100T3 (es) Método y aparato para analizar un flujo de bits de información lateral de una señal de audio multiobjeto
JP5646699B2 (ja) マルチチャネル・パラメータ変換のための装置および方法
US8712784B2 (en) Encoding method and encoding device, decoding method and decoding device and transcoding method and transcoder for multi-object audio signals
RU2617553C2 (ru) Система и способ для генерирования, кодирования и представления данных адаптивного звукового сигнала
US9754595B2 (en) Method and apparatus for encoding and decoding 3-dimensional audio signal
EP2194527A2 (en) Apparatus for generating and playing object based audio contents
JP7358986B2 (ja) 復号装置および方法、並びにプログラム
KR102149411B1 (ko) 오디오 데이터 생성 장치 및 방법, 오디오 데이터 재생 장치 및 방법
KR20070047192A (ko) 객체기반 오디오 전송/수신 시스템 및 그 방법
US20140310010A1 (en) Apparatus for encoding and apparatus for decoding supporting scalable multichannel audio signal, and method for apparatuses performing same
JP7816443B2 (ja) 信号処理装置および方法、並びにプログラム
KR102243395B1 (ko) 오디오 부호화 장치 및 방법, 오디오 복호화 장치 및 방법, 오디오 재생 장치
KR20200130644A (ko) 메타데이터를 이용하는 오디오 신호 처리 방법 및 장치
KR101114431B1 (ko) 실시간 스트리밍을 위한 오디오 생성장치, 오디오 재생장치 및 그 방법
HK40098875A (en) Concept for bridging the gap between parametric multi-channel audio coding and matrixed-surround multi-channel coding
HK40098875B (en) Concept for bridging the gap between parametric multi-channel audio coding and matrixed-surround multi-channel coding
HK40098876B (en) Concept for bridging the gap between parametric multi-channel audio coding and matrixed-surround multi-channel coding
HK40098876A (en) Concept for bridging the gap between parametric multi-channel audio coding and matrixed-surround multi-channel coding
KR20090066190A (ko) 대화형 오디오 송/수신 장치 및 그 방법
KR20140128562A (ko) 사용자의 재생 채널의 위치에 따른 객체 신호 복호화 방법
KR20140128563A (ko) 복호화 객체 리스트 갱신 방법
KR20140128561A (ko) 사용자의 재생 채널 환경에 따른 선택적 객체 복호화 방법
KR20080030847A (ko) 오디오 신호 인코딩 및 디코딩 방법