ES3064493T3 - The merging of spatial audio parameters - Google Patents
The merging of spatial audio parametersInfo
- Publication number
- ES3064493T3 ES3064493T3 ES20907123T ES20907123T ES3064493T3 ES 3064493 T3 ES3064493 T3 ES 3064493T3 ES 20907123 T ES20907123 T ES 20907123T ES 20907123 T ES20907123 T ES 20907123T ES 3064493 T3 ES3064493 T3 ES 3064493T3
- Authority
- ES
- Spain
- Prior art keywords
- frequency band
- fused
- cartesian
- vector
- energy
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/008—Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/002—Dynamic bit allocation
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S7/00—Indicating arrangements; Control arrangements, e.g. balance control
- H04S7/30—Control circuits for electronic adaptation of the sound field
- H04S7/302—Electronic adaptation of stereophonic sound system to listener position or orientation
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/01—Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/15—Aspects of sound capture and related signal processing for recording or reproduction
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/03—Application of parametric coding in stereophonic audio systems
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Multimedia (AREA)
- Mathematical Physics (AREA)
- Stereophonic System (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
Se ha divulgado, entre otras cosas, un aparato para la codificación de audio espacial que comprende: medios para determinar al menos dos de un tipo de parámetro de audio espacial para una o más señales de audio, donde un primer tipo de parámetro de audio espacial está asociado con un primer grupo de muestras en un dominio de la o más señales de audio y un segundo tipo de parámetro de audio espacial está asociado con un segundo grupo de muestras en el dominio de la o más señales de audio; y medios para fusionar el primero de los parámetros de audio espacial y el segundo de los parámetros de audio espacial en un parámetro de audio espacial fusionado. (Traducción automática con Google Translate, sin valor legal)
Description
[0001] DESCRIPCIÓN
[0002] Fusión de parámetros de audio espacial
[0003] Campo
[0004] La presente solicitud se refiere a aparatos y métodos para una codificación de parámetros relacionados con el campo de sonido, pero no exclusivamente para una codificación de parámetros relacionados con la dirección en el dominio de tiempo-frecuencia para un codificador y un decodificador de audio.
[0005] Antecedentes
[0006] El procesamiento de audio espacial paramétrico es un campo de procesamiento de señales de audio donde el aspecto espacial del sonido se describe utilizando un conjunto de parámetros. Por ejemplo, en la captación de audio espacial paramétrica a partir de redes de micrófonos, una elección típica y efectiva es estimar, a partir de las señales de red de micrófonos, un conjunto de parámetros tales como unas direcciones del sonido en unas bandas de frecuencia y los coeficientes entre las partes direccionales y no direccionales del sonido captado en unas bandas de frecuencia. Se sabe que estos parámetros describen bien las propiedades espaciales perceptuales del sonido captado en la posición de la red de micrófonos. Estos parámetros pueden utilizarse en la síntesis del sonido espacial, por consiguiente, para auriculares de forma binaural, para altavoces o para otros formatos, tales como Ambisonics.
[0007] Por lo tanto, las direcciones y las relaciones de energía directa con respecto a total en bandas de frecuencia son de este modo una parametrización que es especialmente eficaz para la captación de audio espacial.
[0008] También puede utilizarse un conjunto de parámetros que consiste en un parámetro de dirección en bandas de frecuencia y un parámetro de relación de energía en bandas de frecuencia (que indica la direccionalidad del sonido) como metadatos espaciales (que también pueden incluir otros parámetros tales como la coherencia envolvente, coherencia de propagación, número de direcciones, distancia, etc.) para un códec de audio. Por ejemplo, estos parámetros pueden estimarse a partir de señales de audio captadas en matriz de micrófonos y, por ejemplo, se puede generar una señal estéreo o mono a partir de las señales de matriz de micrófonos que se transportan con los metadatos espaciales. La señal estéreo podría codificarse, por ejemplo, con un codificador AAC y la señal mono podría codificarse con un codificador EVS. Un decodificador puede decodificar las señales de audio para dar señales de PCM y procesar el sonido en bandas de frecuencia (utilizando los metadatos espaciales) para obtener la salida espacial, por ejemplo, una salida binaural.
[0009] La solución mencionada anteriormente es especialmente adecuada para codificar sonido espacial capturado a partir de matrices de micrófonos (por ejemplo, en teléfonos móviles, cámaras de RV, matrices de micrófono independientes). Sin embargo, puede ser deseable que un codificador así tenga también otros tipos de entrada aparte de las señales captadas por red de micrófonos, por ejemplo, señales de altavoz, señales de objeto de audio o señales ambisónicas. El análisis de entradas ambisónicas (FOA) de primer orden para la extracción de metadatos espaciales se ha documentado completamente en la literatura científica relacionada con la codificación de audio direccional (DirAC) y la expansión en ondas planas armónicas (Harpex). Esto es así dado que existen redes de micrófono que proporcionan directamente una señal FOA (de forma más precisa: su variante, la señal de formato B) y el análisis de una entrada así ha sido, por tanto, un punto de estudio en el campo. Además, el análisis de la entrada ambisónica de orden superior (HOA) para la extracción de metadatos espaciales multidireccionales también se ha documentado en la bibliografía científica relacionada con la codificación de audio direccional de orden superior (HO-DirAC).
[0010] Una entrada adicional para el codificador también es la entrada de altavoz multicanal, tal como las entradas envolventes de canales 5.1 o 7.1 y objetos de audio.
[0011] Sin embargo, con respecto a los componentes de los metadatos espaciales, la compresión y codificación de los parámetros de audio espacial tienen considerable interés para minimizar el número total de bits requeridos para representar los parámetros de audio espacial.
[0012] La publicación de patente WO2019/097018 describe un método para codificar de manera eficiente los parámetros de audio espacial de DirAC de difusión y dirección. En particular, la publicación enseña la combinación de los parámetros de dirección y difusión en múltiples mosaicos de tiempo-frecuencia.
[0013] La publicación de patente US2016/078877 describe la selección y el agrupamiento de diferencias entre canales (tales como ILD e ITD) en subbandas sucesivas con el objetivo de reducir la velocidad de bits global codificando cada grupo de diferencias entre canales como un único valor codificado.
[0014] La publicación de patente GB2574238 describe un método para fusionar flujos de audio espacial codificados separados en uno sin la necesidad de convertir el flujo en un formato no paramétrico común.
[0015] La publicación de patente WO2014/099285 describe un sistema de audio adaptativo que reduce la cantidad de información requerida para codificar una escena de audio espacial que comprende una mezcla de objetos de audio y canales de audio. La publicación describe una técnica para agrupar objetos de audio similares en grupos que luego reemplazan los objetos de audio originales.
[0016] Resumen
[0017] Según un primer aspecto, se proporciona un aparato para la codificación de audio espacial tal como se establece en las reivindicaciones adjuntas.
[0018] Según un segundo aspecto, existe un método para la codificación de audio espacial tal como se establece en las reivindicaciones adjuntas.
[0019] Un producto de programa informático almacenado en un medio puede hacer que un aparato realice el método tal como se establece en las reivindicaciones adjuntas.
[0020] Un dispositivo electrónico puede comprender un aparato tal como se establece en las reivindicaciones adjuntas. Un conjunto de chips puede comprender un aparato tal como se establece en las reivindicaciones adjuntas.
[0021] Las realizaciones de la presente solicitud tienen como objetivo abordar problemas asociados con el estado de la técnica.
[0022] Resumen de las figuras
[0023] Para una mejor comprensión de la presente solicitud, ahora se hará referencia a modo de ejemplo a los dibujos adjuntos, en los que:
[0024] la figura 1 muestra esquemáticamente un sistema de aparato adecuado para implementar algunas realizaciones; la figura 2 muestra esquemáticamente el codificador de metadatos según algunas realizaciones;
[0025] la figura 3 muestra un diagrama de flujo de la operación del procesador de análisis como se muestra en la figura 2 según algunas realizaciones; y
[0026] la figura 4 muestra esquemáticamente un dispositivo de ejemplo adecuado para implementar el aparato mostrado. Realizaciones de la solicitud
[0027] A continuación se describe con más detalle un aparato adecuado y mecanismos posibles para la provisión de parámetros de metadatos obtenidos por análisis espacial efectivos. En las siguientes explicaciones, se analiza un sistema multicanal con respecto a una implementación de micrófono multicanal. Sin embargo, tal y como se discutió anteriormente, el formato de entrada puede ser cualquier formato de entrada adecuado, tal como un altavoz multicanal, Ambisonics (FOA/HOA), etc. Se entiende que en algunas realizaciones la ubicación de canal se basa en una ubicación del micrófono o es una ubicación o dirección virtual. Además, la salida del sistema de ejemplo es una disposición de altavoces multicanal. Sin embargo, se entiende que la salida puede hacerse al usuario mediante medios que no sean altavoces. Además, las señales de altavoces multicanal pueden generalizarse para ser dos o más señales de audio de reproducción. Un sistema de este tipo está siendo estandarizado actualmente por el organismo de estandarización del 3GPP como el Servicio Inmersivo de Voz y Audio (IVAS). El IVAS pretende ser una extensión del códec del Servicio de Voz Mejorado (EVS) de 3GPP existente para facilitar los servicios de voz y audio inmersivos a través de redes móviles (celulares) y de línea fija existentes y futuras. Una aplicación de IVAS puede ser el suministro de servicios de voz y audio inmersivos a través de redes de 3GPP de cuarta generación (4G) y de quinta generación (5G). Además, el códec de IVAS como una extensión a EVS se puede utilizar en aplicaciones de almacenamiento y reenvío en las que el contenido de audio y voz se codifica y almacena en un archivo para su reproducción. Se ha de apreciar que el IVAS se puede utilizar junto con otras tecnologías de codificación de audio y voz que tienen la funcionalidad de codificar las muestras de señales de audio y voz.
[0028] Los metadatos consisten en al menos direcciones esféricas (elevación, acimut), al menos una relación de energía de una dirección resultante, una coherencia de propagación y una coherencia envolvente independiente de la dirección, para cada bloque o mosaico de tiempo-frecuencia (TF) considerado, en otras palabras, una subbanda de tiempo/frecuencia. En total, IVAS puede tener un número de tipos diferentes de parámetros de metadatos para cada mosaico de tiempo-frecuencia (TF). Los tipos de parámetros de audio espacial que pueden constituir los metadatos de IVAS se muestran en la Tabla 1 a continuación.
[0029] Estos datos pueden codificarse y transmitirse (o almacenarse) por el codificador para poder reconstruir la señal espacial en el decodificador.
[0030] Además, en algunos casos, el audio espacial asistido por metadatos (MASA) puede admitir hasta 2 direcciones para cada mosaico de TF, lo que requeriría que los parámetros anteriores se codificaran y transmitieran para cada dirección por mosaico de TF. De este modo, se duplica potencialmente la velocidad de bits requerida según la Tabla 1.
[0032]
[0035] Estos datos pueden codificarse y transmitirse (o almacenarse) por el codificador para poder reconstruir la señal espacial en el decodificador.
[0037] La velocidad de bits asignada para los metadatos en un códec práctico de comunicaciones de audio inmersivo puede variar considerablemente. Las velocidades de bits operativas generales típicas del códec pueden dejar únicamente entre 2 y 10 kbps para la transmisión/almacenamiento de metadatos espaciales. Sin embargo, algunas
implementaciones adicionales pueden permitir hasta 30 kbps o superior para la transmisión/almacenamiento de metadatos espaciales. La codificación de los parámetros de dirección y los componentes de relación de energía se ha examinado anteriormente junto con la codificación de los datos de coherencia. Sin embargo, sea cual sea la velocidad de bits de transmisión/almacenamiento asignada a los metadatos espaciales, siempre será necesario utilizar la menor cantidad de bits posible para representar estos parámetros, especialmente cuando un mosaico de TF puede soportar múltiples direcciones correspondientes a diferentes fuentes de sonido en la escena de audio espacial.
[0038] El concepto, tal como se explica a continuación, es codificar los parámetros de audio espacial de los metadatos para cada mosaico de TF mediante la fusión de parámetros espaciales a través de una serie de bandas de frecuencia de una subtrama/trama temporal y/o mediante la fusión de los parámetros espaciales a través de una serie de subtramas/tramas temporales para una banda de frecuencias particular.
[0039] En consecuencia, la invención parte de la consideración de que la velocidad de bits por mosaico de TF puede reducirse mediante la fusión de los parámetros de audio espacial asociados a cada mosaico de TF, ya sea en varias bandas de frecuencia y/o en un número de subtramas/tramas temporales.
[0040] En este sentido, la figura 1 representa un aparato de ejemplo y sistema para implementar realizaciones de la solicitud. El sistema 100 se muestra con una parte 121 de ‘análisis’ y una parte 131 de ‘síntesis’. La parte 121 de “análisis” es la parte desde la recepción de las señales de altavoces de múltiples canales hasta la codificación de los metadatos y la señal de mezcla descendente; y la parte 131 de “síntesis” es la parte de una decodificación de los metadatos codificados y la señal de mezcla descendente a la presentación de la señal regenerada (por ejemplo, en forma de altavoces de múltiples canales).
[0041] La entrada al sistema 100 y la parte 121 de análisis son las señales multicanal 102. En los siguientes ejemplos, se describe una entrada de señal de canal de micrófono, aunque puede implementarse cualquier formato de entrada (o multicanal sintético) adecuado en otras realizaciones. Por ejemplo, en algunas realizaciones, el analizador espacial y el análisis espacial pueden implementarse de forma externa al codificador. Por ejemplo, en algunas realizaciones, los metadatos espaciales asociados con las señales de audio pueden proporcionarse a un codificador como un flujo de bits separado. En algunas realizaciones, los metadatos espaciales pueden proporcionarse como un conjunto de valores de índice espacial (dirección). Estos son ejemplos de un formato de entrada de audio basado en metadatos. Las señales multicanal se pasan a un mezclador de señales de transporte 103 y a un procesador 105 de análisis. En algunas realizaciones, el generador 103 de señal de transporte está configurado para recibir las señales multicanal y generar una señal de transporte adecuada formada por un número determinado de canales y emitir las señales 104 de transporte. Por ejemplo, el generador 103 de señales de transporte puede configurarse para generar una mezcla de canales de audio 2 de las señales multicanal. El número determinado de canales puede ser cualquier número adecuado de canales. El generador de señales de transporte en algunas realizaciones está configurado para seleccionar o combinar de otro modo, por ejemplo, mediante técnicas de formación de haces las señales de audio de entrada al número determinado de canales y emitir estas como señales de transporte.
[0042] En algunas realizaciones, el mezclador de señales de transporte 103 es opcional y las señales multicanal se pasan sin procesar a un codificador 107 de la misma manera que la señal de transporte en este ejemplo.
[0043] En algunas realizaciones, el procesador 105 de análisis también está configurado para recibir las señales multicanal y analizar las señales para producir metadatos 106 asociados con las señales multicanal y, por lo tanto, asociarse con las señales 104 de transporte. El procesador 105 de análisis puede configurarse para generar los metadatos que pueden comprender, para cada intervalo de análisis de tiempo-frecuencia, un parámetro de dirección 108, un parámetro 110 de relación de energía y un parámetro de coherencia 112 (y en algunas realizaciones un parámetro de difusión). La dirección, la relación de energía y los parámetros de coherencia pueden considerarse en algunas realizaciones como parámetros de audio espacial. En otras palabras, los parámetros de audio espacial comprenden parámetros que tienen como objetivo caracterizar el campo de sonido creado/capturado por las señales multicanal (o dos o más señales de audio en general).
[0044] En algunas realizaciones, los parámetros generados pueden diferir entre las bandas de frecuencia. Por lo tanto, por ejemplo, en la banda X todos los parámetros se generan y transmiten, mientras que en la banda Y solo se genera y transmite uno de los parámetros, y además en la banda Z no se generan o transmiten parámetros. Un ejemplo práctico de esto es que para algunas bandas de frecuencia, tales como la banda más alta, no se requieren algunos de los parámetros por motivos perceptuales. Las señales 104 de transporte y los metadatos 106 pueden pasarse a un codificador 107.
[0045] El codificador 107 puede comprender un núcleo de codificador de audio 109 que está configurado para recibir las señales de transporte (para un ejemplo de mezcla descendente) 104 y generar una codificación adecuada de estas señales de audio. En algunas realizaciones, el codificador 107 puede ser un ordenador (que ejecuta un software adecuado almacenado en una memoria y en al menos un procesador) o, de forma alternativa, un dispositivo específico que utiliza, por ejemplo, FPGA o ASIC. La codificación puede implementarse utilizando cualquier esquema adecuado.
[0046] El codificador 107 puede comprender además un codificador/cuantificador 111 de metadatos que está configurado para recibir los metadatos y dar salida a una forma codificada o comprimida de la información. En algunas realizaciones, el codificador 107 puede además intercalar, multiplexar a un flujo de datos individual o incorporar los metadatos dentro de las señales de mezcla descendente codificadas antes de la transmisión o el almacenamiento mostrado en la figura 1 por la línea discontinua. La multiplexación puede implementarse utilizando cualquier esquema adecuado.
[0047] En el lado del decodificador, los datos recibidos o recuperados (flujo) pueden ser recibidos por un decodificador/demultiplexor 133. El decodificador/demultiplexor 133 puede demultiplexar los flujos codificados y pasar la corriente codificada de audio a un extractor 135 de transporte que está configurado para decodificar las señales de audio para obtener las señales de transporte. De manera similar, el decodificador/demultiplexor 133 puede comprender un extractor 137 de metadatos que está configurado para recibir los metadatos codificados y generar metadatos. En algunas realizaciones, el decodificador/demultiplexor 133 puede ser un ordenador (que ejecuta un software adecuado almacenado en la memoria y en al menos un procesador) o, de forma alternativa, un dispositivo específico que utiliza, por ejemplo, FPGA o ASIC.
[0048] Las señales de audio de transporte y metadatos decodificados pueden pasarse a un procesador 139 de síntesis. La parte 131 de “síntesis” del sistema 100 muestra además un procesador 139 de síntesis configurado para recibir los datos de transporte y los metadatos, y para volver a crear en cualquier formato adecuado un audio espacial sintetizado en forma de señales multicanal 110 (que pueden estar en formato de altavoces multicanal o, en algunas realizaciones, en cualquier formato de salida adecuado tales como señales binaural o ambisónica, dependiendo del caso de uso) en función de las señales de transporte y los metadatos.
[0049] Por lo tanto, en resumen, el sistema (parte de análisis) está configurado para recibir señales de audio multicanal. A continuación, el sistema (parte de análisis) está configurado para generar una señal de audio de transporte adecuada (por ejemplo, seleccionando o mezclando de manera descendente algunos de los canales de señal de audio) y los parámetros de audio espacial como metadatos.
[0050] El sistema se configura después para codificar para su almacenamiento/transmisión la señal de transporte y los metadatos.
[0051] Después de esto, el sistema puede almacenar/transmitir los datos de transporte codificado y los metadatos.
[0052] El sistema puede recuperar/recibir los datos de transporte codificado y los metadatos.
[0053] Posteriormente, el sistema se configura para extraer los datos de transporte y los metadatos de los parámetros codificados de transporte y metadatos, por ejemplo demultiplexar y decodificar los parámetros codificados de transporte y metadatos.
[0054] El sistema (parte de síntesis) está configurado para sintetizar una señal de audio multicanal de salida basándose en señales de audio de transporte extraídas y en metadatos.
[0055] Con respecto a la figura 2, se describe con más detalle un procesador 105 de análisis y un codificador/cuantificador 111 de metadatos de ejemplo (como se muestra en la figura 1) según algunas realizaciones.
[0056] Las figuras 1 y 2 representan el codificador/cuantificador de metadatos 111 y el procesador de análisis 105 acoplados entre sí. Sin embargo, debe apreciarse que algunas realizaciones pueden no acoplar tan estrechamente estas dos entidades de procesamiento respectivas de tal modo que el procesador 105 de análisis pueda existir en un dispositivo diferente del codificador/cuantificador 111 de metadatos. En consecuencia, a un dispositivo que comprende el codificador/cuantificador de metadatos 111 se le pueden presentar las señales de transporte y los flujos de metadatos para su procesamiento y codificación independientemente del proceso de captura y análisis. En este caso, el estimador 205 de energía puede configurarse para formar parte del codificador/cuantificador 111 de metadatos.
[0057] El procesador 105 de análisis en algunas realizaciones comprende un transformador 201 de dominio de tiempofrecuencia.
[0058] En algunas realizaciones, el transformador 201 de dominio de tiempo-frecuencia está configurado para recibir las señales multicanal 102 y aplicar una transformación de dominio de tiempo a dominio de frecuencia adecuada, tal como una transformación de Fourier de tiempo corto (STFT), para convertir las señales en el dominio del tiempo de entrada en señales de tiempo-frecuencia adecuadas. Estas señales de tiempo-frecuencia pueden pasar a un analizador espacial 203.
[0059] Por lo tanto, por ejemplo, las señales 202 de tiempo-frecuencia pueden representarse en la representación del dominio de tiempo-frecuencia mediante
[0060] s<i>(b, n),
[0061] donde b es el índice del intervalo de frecuencia y n es el índice del bloque de frecuencia (trama) e i es el índice de canal. En otra expresión, n puede considerarse un índice de tiempo con una tasa de muestreo más baja que la de las señales originales en el dominio del tiempo. Estos segmentos de frecuencia pueden agruparse en subbandas que forman uno o más de los segmentos en una subbanda de un índice de banda K = 0,..., K-1. Cada subbanda k tiene un segmento b<k,bajo>más bajo y un segmento b<k,alto>más alto, y la subbanda contiene todos los segmentos desde b<k,bajo>a b<k,alto>. Las anchuras de las subbandas pueden aproximarse a cualquier distribución adecuada. Por ejemplo, la escala de ancho de banda rectangular equivalente (ERB) o la escala Bark.
[0062] Un mosaico (o bloque) de frecuencia de tiempo (TF) es, por lo tanto, una subbanda específica dentro de una subtrama de la trama.
[0063] Se puede apreciar que el número de bits requerido para representar los parámetros de audio espacial puede depender, al menos en parte, de la resolución de los mosaicos de tiempo-frecuencia (TF) (es decir, del número de subtramas o mosaicos de TF). Por ejemplo, una trama de audio de 20 ms puede dividirse en 4 subtramas en el dominio del tiempo de 5 ms por pieza y cada subtrama en el dominio del tiempo puede tener hasta 24 subbandas de frecuencia divididas en el dominio de la frecuencia según una escala Bark, una aproximación de la misma o cualquier otra división adecuada. En este ejemplo particular, la trama de audio puede dividirse en 96 subtramas/mosaicos de TF; dicho de otro modo, 4 subtramas en el dominio del tiempo con 24 subbandas de frecuencia. Por lo tanto, la cantidad de bits requerida para representar los parámetros de audio espacial para una trama de audio puede depender de la resolución del mosaico TF. Por ejemplo, si cada mosaico de TF se codificara según la distribución de la Tabla 1 anterior, entonces cada mosaico de TF requeriría 64 bits (para una dirección de fuente de sonido por mosaico TF).
[0064] Las realizaciones tienen como objetivo reducir el número de bits por trama mediante la combinación de mosaicos de TF en el dominio del tiempo o el dominio de la frecuencia.
[0065] Volviendo a la Figura 2, las señales 202 de frecuencia temporal pueden pasarse a un estimador 205 de energía, por lo que puede determinarse la energía de cada subbanda k de frecuencia para todos los canales i de las señales 202 de frecuencia temporal. En realizaciones, esta operación se puede expresar según lo siguiente:
[0068]
[0070] Cuando las señales de audio de tiempo-frecuencia se indican comoS(i, b, n), ies el índice de canal, b es el índice de intervalo de frecuencia ynes el índice de subtrama temporal,bk, bajoes el intervalo más bajo de la banda k ybk,altoes el intervalo más alto.
[0071] Las energías de cada subbanda k dentro de una subtrama temporal n pueden transmitirse entonces al fusionador 207 de parámetros espaciales.
[0072] En realizaciones, el procesador 105 de análisis puede comprender un analizador espacial 203. El analizador espacial 203 puede configurarse para recibir las señales 202 de tiempo-frecuencia y, basándose en estas señales, estimar unos parámetros 108 de dirección. Los parámetros de dirección se pueden determinar basándose en cualquier determinación de “dirección” basada en audio.
[0073] Por ejemplo, en algunas realizaciones, el analizador espacial 203 está configurado para estimar la dirección de una fuente de sonido con dos o más entradas de señal.
[0074] El analizador espacial 203 puede configurarse por lo tanto para proporcionar al menos un acimut y una elevación para cada banda de frecuencias y bloque de tiempo-frecuencia temporal dentro de una trama de una señal de audio, indicado como acimut ϕ(k, n), y elevación θ(k, n).Los parámetros 108 de dirección para la subtrama temporal también pueden pasarse al fusionador 207 de parámetros espaciales.
[0075] El analizador especial 203 también puede configurarse para determinar un parámetro 110 de relación de energía. Se puede considerar que la relación de energía es una determinación de la energía de la señal de audio que puede considerarse que llega desde una dirección. La relación entre energía directa y totalr(k,n)puede estimarse, p. ej., utilizando una medida de estabilidad de la estimación direccional, o utilizando cualquier medida de correlación, o cualquier otro método adecuado para obtener un parámetro de relación. Cada relación entre energía directa y total corresponde a una dirección espacial específica y describe qué cantidad de energía proviene de la dirección espacial específica en comparación con la energía total. Este valor también puede representarse para cada panel de tiempofrecuencia por separado. Los parámetros de dirección espacial y la relación entre energía directa y total describen qué
parte de la energía total de cada panel de tiempo-frecuencia proviene de la dirección específica. En general, un parámetro de dirección espacial también se puede considerar como la dirección de llegada (DOA).
[0076] En algunas realizaciones, el parámetro de relación entre energía directa y total se puede estimar en función del parámetrocor'(k, n) de correlación cruzada normalizado entre un par de micrófonos en la banda k, estando el valor del parámetro de correlación cruzada entre -1 y 1. El parámetro de relación de energía directa a total r(k, n) puede determinarse comparando el parámetro de correlación cruzada normalizado a un parámetro de correlación cruzada
[0078] normalizado de campo difuso
. La relación entre energía directa y total se explica con más detalle en la publicación PCT WO2017/005978. La relación de energía puede pasarse al fusionador 207 de parámetros espaciales.
[0079] El analizador espacial 203 puede configurarse además para determinar un número de parámetros 112 de coherencia que pueden incluircoherencia circundante(γ(k, n) ycoherencia extendida(ζ(k, n)),ambas analizadas en el dominio de tiempo-frecuencia.
[0080] A continuación se analiza cada uno de los parámetros de coherencia antes mencionados. Todo el procesamiento se realiza en el dominio de tiempo-frecuencia, por lo que los índices de tiempo-frecuencia k ynse descartan cuando es necesario por motivos de brevedad.
[0081] Consideremos primero la situación en que el sonido se reproduce de manera coherente utilizando dos altavoces espaciados (por ejemplo, los frontales izquierdo y derecho) en lugar de un solo altavoz. El analizador de coherencia puede configurarse para detectar que dicho método se ha aplicado en la mezcla envolvente.
[0082] Debe entenderse que las siguientes secciones explican el análisis de las coherencias de propagación y envolvente en términos de una entrada de señal de altavoz multicanal.
[0083] Sin embargo, se pueden aplicar prácticas similares cuando la entrada comprende la matriz de micrófonos como entrada.
[0084] Por lo tanto, en algunas realizaciones, el analizador espacial 203 puede configurarse para calcular la matriz C de covarianzas para el intervalo de análisis dado, que consiste en uno o más índices n de tiempo y segmentos b de frecuencia. El tamaño de la matriz esNLxNL,y las entradas se indican comocij, dondeNLes el número de canales de altavoz e i yjson índices de canales de altavoz.
[0085] A continuación, el analizador espacial 203 puede configurarse para determinar el canal de altavozicmás cercano a la dirección estimada (que en este ejemplo es el acimut θ).
[0087]
[0089] donde αies el ángulo del altavoz i.
[0090] Además, en tales realizaciones, el analizador espacial 203 se configura para determinar los altavoces más cercanos en el lado izquierdoily el lado derechoirdel altavozic.
[0091] Una coherencia normalizada entre los altavoces i yjse indica como
[0094]
[0096] usando esta ecuación, el analizador espacial 203 puede configurarse para calcular una coherencia normalizadac'lrentreileir.En otras palabras, para calcular
[0099]
[0101] Además, el analizador espacial 203 puede configurarse para determinar la energía de los canales de altavoz i usando las entradas diagonales de la matriz de covarianzas.
[0103]
[0105] y para determinar una relación entre las energías de los altavocesileiry de los altavoces i<l>,ir,eiccomo
[0106]
[0109] El analizador espacial 203 puede usar después estas variables determinadas para generar un parámetro de “estereofonía”.
[0112]
[0115] Este parámetro de “estereofonía” tiene un valor entre 0 y 1. Un valor de 1 significa que hay un sonido coherente en los altavocesil e ir, y que este sonido domina la energía de este sector. La razón de esto podría ser, por ejemplo, que la mezcla en los altavoces utilizó técnicas de panoramización de amplitud para crear una percepción “con aire” del sonido. Un valor de 0 significa que no se ha aplicado ninguna técnica de este tipo y, por ejemplo, el sonido puede simplemente posicionarse en el altavoz más cercano.
[0117] Además, el analizador espacial 203 puede configurarse para detectar, o al menos identificar, una situación en que el sonido se reproduzca de manera coherente usando tres (o más) altavoces para crear una percepción “cercana” (por ejemplo, usar el frontal izquierdo, el frontal derecho y el central en lugar de solo el central). Esto puede suceder si un ingeniero de mezcla de sonido genera una situación de este tipo al producir la mezcla envolvente de los altavoces multicanal.
[0119] En tales realizaciones, el analizador de coherencia usa los mismos altavocesil, ireicidentificados anteriormente para determinar los valores de coherencia normalizadosc'cl y c'crusando la determinación de coherencia normalizada descrita anteriormente. En otras palabras, se calculan los siguientes valores:
[0122]
[0125] El analizador espacial 203 puede después determinar un valor de coherencia normalizado c'<clr>que representa la coherencia entre estos altavoces usando la siguiente expresión:
[0128]
[0131] Además, el analizador espacial 203 puede configurarse para determinar un parámetro que represente cómo de uniformemente se distribuye la energía entre los canales i<l>,ireic.
[0134]
[0137] Usando estas variables, el analizador espacial 203 puede determinar un nuevo parámetro de panoramización coherente κ como,
[0140]
[0143] Este parámetro de panoramización coherente κ tiene valores entre 0 y 1. Un valor de 1 significa que hay un sonido coherente en todos los altavocesil, ir,yic,y que la energía de este sonido se distribuye uniformemente entre estos altavoces. La razón de esto podría deberse, por ejemplo, a que la mezcla de altavoces se generó utilizando técnicas de mezcla de estudio para crear la percepción de que una fuente de sonido está más cerca. Un valor de 0 significa que no se ha aplicado ninguna técnica de este tipo y, por ejemplo, el sonido puede simplemente posicionarse en el altavoz más cercano.
[0145] El analizador espacial 203 determinó el parámetro de “estereofonía”µ, que mide la cantidad de sonido coherente enileir(pero no enic),y el parámetro de panoramización coherente κ que mide la cantidad de sonido coherente enil, ir,eicestá configurado para usarlos para determinar los parámetros de coherencia que se emitirán como metadatos.
[0146] Por lo tanto, el analizador espacial 203 está configurado para combinar el parámetro de “estereofonía”µy el parámetro de panoramización coherente para formarunparámetro decoherencia de propagaciónζ, que tiene valores de 0 a 1. Un valor decoherencia de propagaciónζ de 0 indica una fuente puntual; en otras palabras, el sonido debe reproducirse con el menor número posible de altavoces (por ejemplo, utilizando solo el altavozic).A medida que aumenta el valor de lacoherencia de propagaciónζ, se propaga más energía a los altavoces que rodean el altavozic;hasta el valor 0,5, la energía se propaga uniformemente entre los altavocesil, ir,eic.A medida que el valor de lacoherencia de propagaciónζ aumenta por encima de 0,5, la energía del altavozicdisminuye; hasta el valor 1, no hay energía en el altavozic,y toda la energía está en los altavocesileir.
[0147] Usando los parámetrosµy κ anteriormente mencionados, en algunas realizaciones el analizador espacial 203 se configura para determinar un parámetro de coherencia de propagación ζ, usando la siguiente expresión:
[0150]
[0152] La expresión anterior es solo un ejemplo y debe tenerse en cuenta que el analizador espacial 203 puede estimar el parámetro de coherencia de propagación ζ de cualquier otra manera, siempre que cumpla con la definición anterior del parámetro.
[0153] Además de estar configurado para detectar las situaciones anteriores, el analizador espacial 203 puede configurarse para detectar, o al menos identificar, la situación en que el sonido se reproduce de manera coherente desde todos (o casi todos) los altavoces para crear una percepción “dentro de la cabeza” o “por encima de la cabeza”.
[0154] En algunas realizaciones, el analizador espacial 203 puede configurarse para clasificar las energíasEiy el canal de altavoziecon el valor más grande determinado.
[0155] El analizador espacial 203 puede configurarse después para determinar la coherencia normalizadac'ijentre este canal yMLotros canales con volumen más alto. A continuación, pueden monitorizarse estos valores de coherencia normalizadosc'ijentre este canal yMLotros canales con volumen más alto. En algunas realizaciones,MLpuede serNL-1, lo que significaría monitorizar la coherencia entre los canales de altavoz con volumen más alto y todos los demás canales de altavoz. Sin embargo, en algunas realizaciones,MLpuede ser un número menor, por ejemplo,NL-2. Usando estos valores de coherencia normalizados, el analizador de coherencia puede configurarse para determinar un parámetro de coherencia envolvente γ usando la siguiente expresión:
[0158]
[0161] donde son las coherencias normalizadas entre el canal con más volumen y losMLsiguientes canales con más volumen.
[0162] El parámetro de coherencia envolvente γ tiene valores de 0 a 1. Un valor de 1 significa que hay coherencia entre todos los canales de altavoces (o casi todos). Un valor de 0 significa que no hay coherencia entre todos los canales de altavoces (o incluso casi todos).
[0163] La expresión anterior es solo un ejemplo de una estimación de un parámetro de coherencia envolvente γ, y se puede utilizar cualquier otra forma, siempre que cumpla con la definición anterior del parámetro.
[0164] El analizador espacial 203 puede configurarse para enviar los parámetros de coherencia determinados, el parámetro de coherencia de propagación ζ y el parámetro de coherencia circundante y al fusionador 207 de parámetros espaciales.
[0165] Por lo tanto, para cada subbanda k habrá una colección de parámetros de audio espacial asociados con la subbanda. En este caso, cada subbanda k puede tener los siguientes parámetros espaciales asociados a ella; al menos un acimut y una elevación indicados como acimut ϕ(k,n) y elevación θ(k,n),coherencia circundante (y(k, n))ycoherencia de propagación(ζ(k,n)), y un parámetro de relación entre energía directa y energía totalr(k,n). En algunos ejemplos, el fusionador 207 de parámetros espaciales puede disponerse para combinar (o fusionar) un número de cada uno de los parámetros anteriormente mencionados en un número menor de bandas de frecuencia. Por ejemplo, tomando el ejemplo de un mosaico de TF que tiene 24 bandas de frecuencia, es decir, k se extiende de 0 a 23. Los valores de los parámetros espaciales para cada una de las 24 bandas de frecuencia se combinan en valores asociados con un número menor de bandas, donde cada una de las menos bandas abarca un número contiguo de las 24 bandas originales.
[0166] A este respecto, la Figura 3 representa algunas de las etapas de procesamiento en las que puede disponerse el fusionador 207 de parámetros espaciales para realizar en algunas realizaciones.
[0167] El fusionador 207 de parámetros espaciales realiza la fusión anterior tomando inicialmente la componente de dirección esférica de acimut (φ(k,n) y elevación θ(k,n) para cada una de las K subbandas y convirtiendo cada componente de dirección en su vector de coordenadas cartesianas respectivo. Cada vector de coordenadas cartesianas para la subbanda k se pondera entonces mediante la energía respectivaE(k, n) (del estimador 205 de energía) y el parámetro de relación entre energía directa y totalr(k, n)para la subbanda k.
[0168] La operación de conversión para un componente de acimut φ (k, n) y dirección de elevación θ (k, n) de la subbanda k para dar el componente de dirección del eje X como
[0169]
[0171] el componente del eje Y como
[0173]
[0175] y el componente del eje Z como
[0177]
[0179] La operación anterior puede realizarse para todas las subbandas k = 0 a K-1.
[0180] La etapa de convertir la componente de dirección esférica para cada subbanda k de una subtrama n en su coordenada cartesiana equivalente x, y, z se muestra como la etapa 301 de procesamiento en la Figura 3.
[0181] La etapa de ponderar cada coordenada cartesiana x, y, z por el parámetro de energía y energía directa con respecto a la energía total para la subbanda k se muestra como la etapa 303 de procesamiento en la Figura 3.
[0182] A este respecto, la Figura 3 también representa la etapa de recibir la energía para cada subbanda desde el estimador 205 de energía. Esto se muestra como la etapa 315 de procesamiento. La energía respectiva de cada subbanda se muestra como utilizada en la etapa 303.
[0183] El fusionador 207 de parámetros espaciales puede disponerse entonces para fusionar las coordenadas cartesianas anteriores para varias de las subbandas 0 a K-1 en una única banda de frecuencias «fusionada». Este proceso de fusión puede repetirse para una pluralidad de agrupaciones de subbandas consecutivas de manera que todas las subbandas 0 a K-1 se hayan fusionado en menos bandas de frecuencia fusionadas p = 0 a P-1, donde P<K.
[0184] Por ejemplo, el proceso de fusión para la primera banda de frecuencias fusionada p = 0 puede comprender una agrupación de las coordenadas cartesianas para las primeras bandas de frecuencia k1 (0 a k1-1) de las subbandas 0 a K-1, la segunda banda de frecuencias fusionada p = 1 puede comprender una agrupación de las coordenadas cartesianas para las segundas bandas de frecuencia k1 (k1 a 2*k1-1) de las subbandas 0 a K-1, la tercera fusionada la banda de frecuencias p = 2 puede comprender una agrupación de las coordenadas cartesianas para las terceras bandas de frecuencia k1 (2*k1 a 3*k1-1) de las subbandas 0 a K-1, y así sucesivamente hasta que una banda de frecuencias fusionada final p=P-1 comprende las coordenadas cartesianas de las últimas subbandas de las K subbandas.
[0185] Debe observarse que el número de subbandas que se agrupan puede no estar necesariamente fijado en k1, sino que puede variar de una banda de frecuencias fusionada a otra. En otras palabras, la primera banda de frecuencias fusionada p=0 puede comprender las coordenadas cartesianas de las primeras subbandas k1 y la segunda banda de frecuencias fusionada p=1 puede comprender las coordenadas cartesianas de las siguientes subbandas k2, donde k1 no es el mismo número que k2.
[0186] En realizaciones, el mecanismo de agrupamiento (o fusión) puede comprender una etapa de suma en la que las coordenadas cartesianas se suman para el conjunto de subbandas que se asignan a la banda de frecuencias fusionada particular.
[0187] Volviendo al ejemplo anterior de una subtrama n que tiene 24 subbandas. El fusionador 207 de parámetros espaciales puede disponerse para fusionar las coordenadas cartesianas de las 24 subbandas en 4 bandas de frecuencia fusionadas, comprendiendo cada banda de frecuencias fusionada las coordenadas cartesianas fusionadas de 6 subbandas. En este ejemplo, el proceso de fusión de coordenadas cartesianas x realizado por el fusionador 207 de parámetros espaciales para puede expresarse para la primera banda de frecuencias fusionada como
[0190]
[0192] La segunda banda de frecuencias fusionada en este ejemplo se puede dar como
[0195]
[0197] La tercera banda de frecuencias fusionada en este ejemplo se puede dar como
[0198]
[0200] La cuarta banda de frecuencias fusionada en este ejemplo se puede dar como
[0203]
[0205] Las etapas algorítmicas anteriores pueden repetirse para las coordenadas cartesianas y y z, para obteneryMF(p,n) yzMF(p,n) para p = 0 a 3. Obsérvese que en las expresiones anterioresnes el índice de subtramas temporales. En general, para una banda fusionada p, el ejemplo anterior se puede expresar como
[0208]
[0210] Dondekp.bajaes la subbanda de baja frecuencia de la banda de frecuencias fusionada p, ykp.altaes la subbanda de alta frecuencia de la banda de frecuencias fusionada p.
[0211] La etapa de fusionar conjuntos de coordenadas cartesianas en una pluralidad de bandas de frecuencia fusionadas, donde cada banda de frecuencias combinada comprende las coordenadas cartesianas de varias subbandas k contiguas, se muestra en la Figura 3 como etapa 305 de procesamiento.
[0212] Una vez que las coordenadas cartesianas x, y, z para las subbandas k = 0 a K-1 se han fusionado en las coordenadas cartesianas x<MF>, y<MF>y z<MF>para las bandas de frecuencia fusionadas p = 0 a P-1, donde P<K (según las etapas del procedimiento descritas anteriormente), las coordenadas cartesianas fusionadas x<MF>, y<MF>y z<MF>se convierten a sus componentes de dirección equivalentes fusionadas de acimut ϕMF(p,n) y elevación esférica θMF(p,n). En realizaciones, esta conversión puede realizarse para cada una de las P coordenadas cartesianas fusionadas X<MF>, y<MF>y z<MF>mediante el uso de las siguientes expresiones;
[0215]
[0217] donde la función atan es la variante computacional arcotangente que detecta automáticamente el cuadrante correcto para el ángulo.
[0218] La etapa de convertir las coordenadas cartesianas fusionadas en sus coordenadas esféricas combinadas equivalentes para cada banda de frecuencias fusionada se muestra como la etapa 307 de procesamiento en la Figura 3.
[0219] A partir de lo anterior, se determina una relación correspondiente entre la energía directa y la energía totalrMF(p,n) para cada banda de frecuencias fusionada p tomando la longitud del vector formado a partir de las coordenadas cartesianas anteriores para la banda de frecuencias fusionada p y normalizando la longitud del vector por la energía de la banda de frecuencias fusionada p. En las realizaciones, la relación entre la energía directa y la energía totalrMF(p,n) para la banda de frecuencias fusionada p puede expresarse como
[0222]
[0225] Donde, como
se indicó anteriormente, es la energía de la señal contenida en las bandas de frecuencia originaleskp.bajaakp.altapara la p-ésima banda de frecuencias fusionada.
[0226] La etapa de determinar la relación de energía directa a total combinadarMFpara cada banda de frecuencias combinada (con la entrada de la etapa 315 de procesamiento) se muestra como la etapa 309 de procesamiento.
[0227] Además, algunas realizaciones pueden derivar una coherencia de propagación fusionada para cada banda de frecuencias fusionada p usando los valores de coherencia de propagación ζ(k,n) calculados para cada subbanda k. La coherencia de propagación fusionada ζMF(p,n) para una banda de frecuencias fusionada p puede calcularse como un promedio ponderado en energía de los valores de coherencia de propagación de las subbandas de frecuencia que componen la banda de frecuencias fusionada p. En realizaciones, la coherencia de propagación fusionada para una banda de frecuencias fusionada p puede expresarse como
[0230]
[0232] La etapa de determinar el valor de coherencia de propagación fusionado ζMFpara cada banda de frecuencias fusionada se muestra como la etapa 311 de procesamiento (con la entrada de la etapa 315 de procesamiento).
[0233] De manera similar, algunas realizaciones pueden derivar una coherencia envolvente fusionada para cada banda de frecuencias fusionada p utilizando los valores de coherencia envolvente γ(k, n) calculados para cada subbanda k. La coherencia de propagación fusionada γMF(k,n) para una banda de frecuencias fusionada p puede calcularse como un promedio ponderado en energía de los valores de coherencia envolvente de las subbandas de frecuencia que componen la banda de frecuencias fusionada p. En algunos ejemplos, la coherencia de propagación fusionada para una banda de frecuencias fusionada p puede expresarse como
[0236]
[0238] La etapa de determinar el valor de coherencia envolvente γMFpara cada banda de frecuencias fusionada se muestra como la etapa 313 de procesamiento (con la entrada de la etapa 315 de procesamiento).
[0239] En otras realizaciones, el fusionador 207 de parámetros espaciales también puede configurarse para combinar parámetros espaciales tales como el acimut ϕ(k,n) y la elevación θ(k,n), la coherencia circundante (γ(k,n)) y la coherencia de propagación (ζ(k,n)), y un parámetro de relación entre la energía directa y la energía totalr(k,n) a lo largo de una serie de subtramos de tiempo n. Por ejemplo, un parámetro espacial para una banda de frecuencias k puede combinarse (o fusionarse) a lo largo de una serie de subtramas n 0 a N-1. En este caso, los valores de parámetros espaciales para una serie de subtramas temporales pueden fusionarse en valores combinados asociados con un número menor de subtramas temporales contiguas.
[0240] En el corolario de la etapa 305, el fusionador 207 de parámetros espaciales puede disponerse para combinar valores de elevación de acimut φ(k,n),y elevación θ(k,n) en múltiples grupos contiguos de múltiples subtramas n para una subbanda de frecuencias k particular. De manera similar a la de la etapa 301, el fusionador de parámetros espaciales puede convertir los valores de acimut ϕ(k,n) y elevación θ(k,n) para n = 0 a N-1 subtramas para una subbanda k particular a su respectivo vector de coordenadas cartesianas para el subtrama n. A continuación, cada coordenada cartesiana para la subtrama n puede ponderarse mediante la energía respectiva E(k,n) (generada por el estimador 205 de energía) y el parámetro de energía directa-total r(k,n) para la subtrama particular n.
[0241] Las coordenadas cartesianasx(k,n), y(k,n) yz(k,n) pueden determinarse calculando las ecuaciones (1) (2) y (3) para una subbanda k durante la subtrama (o trama) temporal de los índices n=0 a N-1.
[0242] El fusionador 207 de parámetros espaciales puede disponerse entonces para fusionar las coordenadas cartesianas de varias subtramas en una única trama temporal fusionada q. De manera similar a la realización del proceso de fusión de frecuencias descrita anteriormente, este proceso de fusión puede repetirse para una pluralidad de agrupaciones de subtramas consecutivas, de modo que todas las subtramas 0 a N-1 se hayan fusionado en menos subtramas fusionadas de q = 0 a Q-1, donde Q<N.
[0243] Por ejemplo, el proceso de fusión para la primera trama temporal fusionada q =0 puede comprender una agrupación de las coordenadas cartesianas para las primeras subtramas temporales n1 (0 a n1-1) de las subtramas 0 a N-1, la segunda trama temporal fusionada q = 1 puede comprender una agrupación de las coordenadas cartesianas para las segundas subtramas n1 (n1 a 2*n1-1) de las subtramas 0 a N-1, la tercera trama temporal fusionada q = 2 puede comprender una agrupación de las coordenadas cartesianas para las terceras subtramas n1 (2*n1 a 3*n1-1) de las subtramas 0 a N-1, y así sucesivamente hasta que una trama temporal fusionada final Q=q-1 comprende coordenadas cartesianas de las últimas subtramas de las N subtramas.
[0244] Debe observarse que el número de subtramas n que se fusionan puede no estar necesariamente fijado en n1, sino que puede variar de una trama fusionada a otra. En otras palabras, la primera trama fusionada q=0 puede comprender las coordenadas cartesianas de las primeras n1 subtramas y la segunda trama fusionada q =1 puede comprender las coordenadas cartesianas de las siguientes n2 subtramas, donde n1 no es el mismo número que n2.
[0245] De manera similar, en estas realizaciones, el mecanismo de agrupamiento también puede comprender una etapa de suma en la que las coordenadas cartesianas de una trama temporal fusionada particular se suman para el conjunto de subtramas que se asignan a la trama temporal fusionada particular.
[0246] Por lo tanto, las coordenadas x, y y z,xMT,yMT,zMTde una trama temporal fusionada q se pueden expresar como
[0249]
[0251] Dondenq.bajaes la subtrama numerada más baja de la trama fusionada q, ynq.altaes la subtrama numerada más alta de la trama fusionada q.
[0252] En el corolario de la etapa 307 de procesamiento, las coordenadas cartesianas de la subtrama temporal x<MT>, y<MT>y z<MT>para las tramas temporales fusionadas q = 0 a Q-1, donde Q<N, también pueden convertirse en sus componentes de dirección esférica equivalentes fusionadas de acimut ϕMT(k,q) y elevación θMT(k,q). En realizaciones, esta conversión puede realizarse para cada una de las Q coordenadas cartesianas fusionadas x<MT>, y<MT>y z<MT>usando las siguientes expresiones;
[0255]
[0257] Como antes la función atan la variante computacional arcotangente que detecta automáticamente el cuadrante correcto para el ángulo.
[0258] De una manera similar a la realización anterior, en la que el procedimiento de fusión es a través de las subbandas de frecuencia, la relación entre energía directa y total correspondienter MT(k, q)para la trama temporal fusionada q se puede dar como
[0261]
[0264] Donde
es la energía de la señal contenida en las bandas de subtramas originalesnq.bajaanq.altapara la q-ésima subtrama fusionada de la subbanda k.
[0265] Además, la coherencia de propagación fusionada para cada trama temporal fusionada q para la subbanda k se puede obtener usando los valores de coherencia de propagación γ(k,n) calculados a lo largo de las subtramas del trama temporal fusionada q
[0266]
[0268] y de manera similar, la coherencia envolvente fusionada para cada trama temporal fusionada a para la subbanda k se puede derivar utilizando los valores de coherencia envolvente γ(k, n) calculados a lo largo de las subtramas de la trama temporal fusionada q.
[0271]
[0273] La salida del fusionador 207 de parámetros espaciales puede comprender entonces los parámetros de audio espacial fusionados que pueden disponerse para pasarse al codificador/cuantificador 111 de metadatos para su codificación y cuantificación.
[0274] En algunas realizaciones, los parámetros espaciales fusionados pueden comprender los parámetros de banda de frecuencias fusionados θMF,φMF, rMF,γMF,ζMFpara cada una de las bandas de frecuencia fusionadas por subtrama. En otras realizaciones, los parámetros espaciales fusionados pueden comprender los parámetros de trama temporal fusionados θMT,φMT, rMT,γMT,ζMTpara cada subbanda k.
[0275] En otras realizaciones, el fusionador 207 de parámetros espaciales puede disponerse de manera que el proceso de fusión se realice en cascada, de modo que los parámetros espaciales puedan fusionarse primero según el proceso de fusión basado en bandas de frecuencias anterior, seguido del proceso de fusión basado en tramas temporales anteriores. Alternativamente, el proceso de fusión en cascada realizado por el fusionador 207 de parámetros espaciales puede invertirse de manera que el proceso de fusión basado en la trama temporal anterior vaya seguido del proceso de fusión basado en la banda de frecuencias anterior.
[0276] En otras realizaciones adicionales, el fusionador 207 de parámetros espaciales puede disponerse de manera que el proceso de fusión se realice de manera que los parámetros puedan fusionarse según el proceso de fusión basado en bandas de frecuencias anterior junto con el proceso de fusión basado en tramas temporales. Esto se puede realizar usando las ecuaciones de fusión anteriores según los límites denq.bajaynq.alta, kp.bajaykp.alta.
[0277] En realizaciones, el fusionador 207 de parámetros espaciales puede tener un elemento funcional adicional que proporcione una estimación (o medida) de la importancia (en efecto, un estimador de importancia) de tener el número total de conjuntos de parámetros espaciales (o direcciones) por mosaico de TF, en lugar de un número reducido de conjuntos de parámetros espaciales combinados (y, por lo tanto, un número reducido de direcciones por trama). Además, el estimador de importancia puede usarse para determinar si las subbandas y/o subtramas temporales particulares deben comprender parámetros de audio espacial fusionados o no fusionados.
[0278] La estimación de importancia puede enviarse a un elemento funcional de decisión dentro del fusionador 207 de parámetros espaciales que decide si la salida (que se codificará posteriormente) puede comprender los parámetros de audio espacial para cada mosaico TF o si la salida comprende parámetros de audio espacial fusionados, o de hecho si un grupo particular de subbandas y/o subtramas en una trama temporal debería tener parámetros de audio espacial fusionados o no fusionados.
[0279] Utilizando el ejemplo anterior, en el que conjuntos de parámetros espaciales se fusionan a través de bandas de frecuencia y/o a través de subtramas en el tiempo. A la luz de esto, la función del estimador de importancia puede ser estimar la importancia para la calidad de audio percibida de usar un conjunto de parámetros de audio espaciales (sin fusionar) para cada mosaico de TF, en lugar de usar un conjunto de parámetros de audio espacial que se han fusionado en múltiples bandas de frecuencia y/o múltiples subtramas temporales.
[0280] Con este fin, la medida de importancia puede estimarse comparando la longitud del vector de coordenadas cartesianas fusionadas calculado (tal como se derivó anteriormente) con la suma de las longitudes vectoriales de las coordenadas cartesianas (no fusionadas), sumadas sobre las subbandas fusionadas y/o las subtramas fusionadas.
[0281] Volviendo al ejemplo de fusión basado en bandas de frecuencias anterior, la suma de las longitudes vectoriales de las coordenadas cartesianas (no fusionadas), sumadas sobre las subbandas que se fusionaron en la banda de frecuencias p, se puede expresar como
[0282]
[0284] La longitud del vector de coordenadas cartesianas fusionado calculado para la banda de frecuencias fusionada p se puede escribir como
[0286]
[0288] La estimación (o medida) de importancia λ(p,n) para la banda de frecuencias fusionada p-ésima se puede expresar entonces como
[0291]
[0293] En este caso, la selección de si codificar y transmitir conjuntos de parámetros de audio espacial fusionados o no fusionados puede basarse en una comparación de si la medida de importancia λ(p,n) supera un valor umbral λth. De tal manera que si λ(p,n) > λth, se puede tomar la decisión de codificar y transmitir parámetros de audio espacial no fusionados como metadatos.
[0294] Si λ(p,n) ≤ λth, se puede tomar la decisión de codificar y transmitir los parámetros de audio espacial combinados como metadatos.
[0295] En el caso de una decisión de transmitir parámetros de audio espacial no fusionados como metadatos, el fusionador 207 de parámetros espaciales puede configurarse para emitir los conjuntos originales de parámetros de audio espacial. Por ejemplo, si la comparación anterior indicara que sería ventajoso generar los parámetros de audio espacial no fusionados en lugar de los parámetros de audio espacial fusionados para la banda de frecuencias fusionada p-ésima, entonces los siguientes parámetros de audio espacial ϕ(k,n),θ(k,n), (y(k, n)),(ζ(k,n)) yr(k,n) para las subbandaskp,altaakp,altapueden formar la salida para la banda de frecuencias fusionada p-ésima.
[0296] En el caso de que se decida transmitir parámetros de audio espacial fusionados como metadatos, es decir, un conjunto de parámetros de audio espacial para un conjunto fusionado de subbandas y/o un conjunto fusionado de subtramas, el fusionador 207 de parámetros espaciales puede configurarse para emitir el parámetro de audio espacial fusionado, y en el caso de la banda de frecuencias fusionada p, los parámetros de salida pueden comprender el conjunto θMF,ϕMF, rMF,γMF,ζMF.
[0297] En otras realizaciones, se puede determinar un valor de importancia promedio para un número de subtramas y/o subbandas. Esto puede lograrse tomando la media de la medida de importancia sobre un grupo de medidas de importancia. Tales como
[0300]
[0302] Donde N en este caso es el número de subtramas en una trama m, sin embargo, el promedio podría tomarse sobre varias subbandas, o en otras realizaciones, el promedio puede tomarse para las medidas de importancia en una combinación de bandas de frecuencia y tramas temporales. El uso de un valor promedio para la medida de importancia tiene la ventaja de que solo se requiere un bit de señalización para un grupo de tramas y/o banda de frecuencias fusionadas en lugar de un bit de señalización para cada trama temporal y/o banda de frecuencias combinados. Debe apreciarse que, en las circunstancias anteriores, puede ser necesario incluir un bit de señalización en los metadatos para indicar si los parámetros de audio espacial están fusionados o no fusionados.
[0303] La medida de importancia puede tener la característica de que cuando todas las direcciones (sobre las subtramas y/o subbandas fusionadas) apuntan aproximadamente en la misma dirección, la medida de importancia tenderá a tener un valor bajo (que se aproxima al valor de cero). Sin embargo, por el contrario, si todas las direcciones tienden a apuntar en direcciones opuestas y las proporciones de energía directa a total asociadas con cada una de las direcciones son aproximadamente las mismas, entonces la medida de importancia puede tender a tener el valor de 1. Otra característica mostrada por la medida de importancia puede ser tal que si una de las subbandas/subtramas tiene una relación entre energía directa y total significativamente mayor que cualquiera de las otras, entonces la medida de importancia también tenderá a tener un valor bajo.
[0304] En realizaciones, el valor elegido como umbral λthpuede ser fijo, y la experimentación ha descubierto que un valor de 0,3 proporciona un resultado ventajoso.
[0305] En otras realizaciones, el umbral de importancia λthpuede determinarse para una trama ordenando el número de medidas de importancia λ(k,n) para un número de subbandas y/o subtramas fusionadas en orden ascendente y determinando el umbral como el valor de la medida de importancia que da un número específico de medidas de importancia (y, por lo tanto, subbandas y/o subtramas fusionadas) por encima del umbral, por ejemplo, la medida de umbral puede seleccionarse sobre la base de que hay un númeroIde subtramas y/o subbandas fusionadas en la trama cuya medida de importancia está por encima del umbral seleccionado.
[0306] En otras realizaciones, el umbral de importancia λthpuede adaptarse a un valor medio continuo de medidas de importancia durante las últimas N subtramas temporales (por ejemplo, las últimas 20 subtramas). De tal manera que λmed(n) puede indicar el valor medio para la subtrama n de las medidas de importancia sobre las últimas N subtramas en todas las bandas de frecuencia. El umbral de importancia λth(n) para la subtrama n puede expresarse entonces como λth(n) =cthλmed(n) dondecthes un coeficiente que controla el valor del umbral de importancia, por ejemplo,cthpuede asignarse el valor 0,5.
[0307] Además, es posible que algunas realizaciones no desplieguen un valor umbral. En estas realizaciones, varios de los mosaicos de TF más importantes de la trama/subtrama pueden disponerse para usar direcciones no combinadas, y el número restante de mosaicos de TF en la trama/subtrama está dispuesto para usar direcciones combinadas.
[0308] El codificador/cuantificador 111 de metadatos puede comprender un codificador de dirección. El codificador 205 de dirección está configurado para recibir los parámetros de dirección fusionados (tales como el acimut ϕMFo ϕMTy la elevación) (y en algunas realizaciones una asignación de bits esperada), y generar a partir de esto una salida codificada adecuada. En algunas realizaciones, la codificación se basa en una disposición de esferas que forman una retícula esférica dispuesta en anillos en una esfera de “superficie” que se define por una tabla de consulta definida por la resolución de cuantificación determinada. En otras palabras, la retícula esférica utiliza la idea de cubrir una esfera con esferas más pequeñas y considerar los centros de las esferas más pequeñas como puntos que definen una retícula de direcciones casi equidistantes. Por lo tanto, las esferas más pequeñas definen conos o ángulos sólidos alrededor del punto central que pueden indexarse según cualquier algoritmo de indexación adecuado. Aunque aquí se describa una cuantificación esférica, se puede usar cualquier cuantificación lineal o no lineal adecuada.
[0309] El codificador/cuantificador 111 de metadatos puede comprender un codificador de relación de energía. El codificador de relación de energía puede estar configurado para recibir las relaciones de energía fusionadasrMForMTy determinar una codificación adecuada para comprimir las relaciones de energía para las subbandas fusionadas y los bloques de tiempo-frecuencia fusionados.
[0310] De manera similar, el codificador/cuantificador 111 de metadatos también puede comprender un codificador de coherencia que está configurado para recibir los valores de coherencia envolvente fusionados γMFo γMTy los valores de coherencia extendida ζMFo ζMT, y determinar una codificación adecuada para comprimir los valores de coherencia envolvente y extendida para las subbandas fusionadas y/o los bloques de tiempo-frecuencia fusionados.
[0311] La dirección fusionada codificada, las proporciones de energía y los valores de coherencia pueden pasarse al combinador 211. El combinador está configurado para recibir los parámetros direccionales fusionados codificados (o cuantificados/comprimidos), parámetros de relación de energía y parámetros de coherencia y combinar estos para generar una salida adecuada (por ejemplo, un flujo de bits de metadatos que puede combinarse con la señal de transporte o transmitirse o almacenarse por separado desde la señal de transporte).
[0312] En algunas realizaciones, el flujo de datos codificado se pasa al decodificador/demultiplexor 133. El decodificador/demultiplexor 133 demultiplexa los índices de dirección fusionados codificados, los índices de relación de energía fusionados y los índices de coherencia fusionados y los pasa al extractor 137 de metadatos, y además, en algunas realizaciones, el decodificador/demultiplexor 133 puede extraer las señales de audio de transporte al extractor de transporte para su decodificación y extracción.
[0313] En realizaciones, el decodificador/demultiplexor 133 puede disponerse para recibir y decodificar el bit de señalización que indica que los parámetros de audio espacial codificados recibidos son parámetros de audio espacial fusionados codificados para un grupo de subbandas y/o subtramas fusionadas o que los parámetros de audio espacial codificado recibidos son varios conjuntos de parámetros de audio espacial codificados, correspondiendo cada conjunto a una subbanda o una subtrama.
[0314] Los índices de relación de energía, los índices de dirección y los índices de coherencia combinados pueden decodificarse mediante sus respectivos descodificadores para generar las relaciones de energía, direcciones y coherencias combinadas para la subtrama cuando la fusión se produce en las bandas de frecuencia de la subtrama o para una subbanda particular cuando la fusión se produce en subtramas temporales consecutivas. Esto se puede realizar aplicando la inversa de los diversos procesos de codificación empleados en el codificador.
[0315] En el caso de que el bit de señalización indique que los parámetros de audio espacial no están fusionados, los conjuntos de parámetros de audio espacial recibidos pueden pasarse directamente a los diversos decodificadores para su decodificación.
[0316] Los parámetros espaciales fusionados pueden pasarse a un expansor de parámetros espaciales (que en algunas realizaciones puede formar parte del extractor 137 de metadatos) que está configurado para expandir los parámetros espaciales fusionados de manera que las resoluciones temporales y de frecuencia de los parámetros espaciales originales se reproduzcan en el descodificador para su posterior procesamiento y síntesis.
[0317] En el caso de que los parámetros espaciales fusionados estén compuestos por los parámetros de banda de frecuencias fusionados θMF,φMF,γMF,ζMF,el proceso de expansión puede comprender replicar los parámetros espaciales fusionados en las bandas de frecuencia originales k sobre las que se fusionaron los parámetros espaciales. Por ejemplo, en el caso del componente de elevación fusionado θMF(p,n), el proceso de expansión puede consistir simplemente en replicar el valor θMF(p,n)sobre las subbandas de frecuencia originaleskp.bajaakp.altapara la banda de frecuencias fusionada p-ésima.
[0318] En otras palabras, en relación con una pésima banda de frecuencias fusionada, los valores espaciales expandidos θ(k,n) asociados con las subbandas que abarcan la pésima banda de frecuencias fusionada se pueden expresar como
[0321]
[0323] Obviamente, esto puede repetirse para cada banda de frecuencias fusionada p = 0 a P-1, para proporcionar un valor para todas las subbandas k = 0 a K-1.
[0324] Este proceso de expansión anterior se puede realizar para todos los parámetros de banda de frecuencias fusionados θMF,ϕMF,γMF,ζMFpara proporcionar los parámetros espaciales θ(k,n),ϕ(k,n),γ(k,n),ζ(k,n) para cada subbanda k =0 a K-1.
[0325] En el caso de que los parámetros espaciales fusionados estén compuestos por los parámetros de banda de frecuencias fusionados θMT,φMT,γMT,ζMT,el proceso de expansión puede comprender replicar los parámetros espaciales fusionados en las subtramas n originales sobre las que se fusionaron los parámetros espaciales. De modo que, en el caso del componente de elevación fusionado θMT(k,q), el proceso de expansión puede consistir simplemente en replicar el valor θMT(k,q)sobre las subtramas originalesnq.bajaanq.altapara la trama temporal fusionada q-ésima. En otras palabras, en relación con una trama temporal fusionada de tipo qésimo, los valores espaciales expandidos θ(k, n) asociados con las subtramas que abarcan la trama temporal fusionada de tipo qésimo se pueden expresar como
[0328]
[0330] Obviamente, esto puede repetirse para cada trama temporal fusionada q = 0 a Q-1, para proporcionar un valor para todas las subtramas n = 0 a N-1.
[0331] En el corolario, el proceso de expansión anterior se puede realizar para todos los parámetros de trama temporal fusionados θMT,ϕMT,γMT,ζMTpara proporcionar los parámetros espaciales θ(k,n),ϕ(k,n),y(k,n),ζ(k,n) para cada subtrama n = 0 a N-1 (para una banda k particular).
[0332] Los parámetros espaciales decodificados y expandidos pueden después formar la salida de metadatos decodificados del extractor 137 de metadatos y pasarse al procesador 139 de síntesis para formar las señales multicanal 110. Con respecto a la figura 4, en ella se muestra un dispositivo electrónico de ejemplo que puede utilizarse como dispositivo de análisis o síntesis. El dispositivo puede ser cualquier dispositivo o aparato electrónico adecuado. Por ejemplo, en algunas realizaciones, el dispositivo 1400 es un dispositivo móvil, un equipo de usuario, un ordenador de tipo tableta, un ordenador, un aparato de reproducción de audio, etc.
[0333] En algunas realizaciones, el dispositivo 1400 comprende al menos un procesador o unidad 1407 de procesamiento central. El procesador 1407 puede estar configurado para ejecutar diversos códigos de programa, tales como los métodos que se han descrito en la presente memoria.
[0334] En algunas realizaciones, el dispositivo 1400 comprende una memoria 1411. En algunas realizaciones, el al menos un procesador 1407 está acoplado a la memoria 1411. La memoria 1411 puede ser cualquier medio de almacenamiento adecuado. En algunas realizaciones, la memoria 1411 comprende una sección de códigos de programa para almacenar códigos de programa que pueden implementarse en el procesador 1407. Además, en algunas realizaciones, la memoria 1411 puede comprender además una sección de datos almacenados para
almacenar datos, por ejemplo datos que se han procesado o que van a procesarse según las realizaciones como se describe en la presente memoria. El código de programa implementado almacenado dentro de la sección de códigos de programa y los datos almacenados dentro de la sección de datos almacenados pueden ser recuperados por el procesador 1407 siempre que sea necesario a través del acoplamiento memoria-procesador.
[0335] En algunas realizaciones, el dispositivo 1400 comprende una interfaz 1405 de usuario. En algunas realizaciones, la interfaz 1405 de usuario puede estar acoplada al procesador 1407. En algunas realizaciones, el procesador 1407 puede controlar el funcionamiento de la interfaz 1405 de usuario y recibir entradas de la interfaz 1405 de usuario. En algunas realizaciones, la interfaz 1405 de usuario puede permitir que un usuario introduzca comandos en el dispositivo 1400, por ejemplo, a través de un teclado numérico. En algunas realizaciones, la interfaz 1405 de usuario puede permitir que el usuario obtenga información del dispositivo 1400. Por ejemplo, la interfaz 1405 de usuario puede comprender un elemento de visualización configurado para visualizar información del dispositivo 1400 al usuario. En algunas realizaciones, la interfaz 1405 de usuario puede comprender una pantalla táctil o una interfaz táctil capaz tanto de permitir introducir información en el dispositivo 1400 como, además, de mostrar información al usuario del dispositivo 1400. En algunas realizaciones, la interfaz 1405 de usuario puede ser la interfaz de usuario para comunicarse con el determinador de posición que se describe en la presente memoria.
[0336] En algunas realizaciones, el dispositivo 1400 comprende un puerto 1409 de entrada/salida. En algunas realizaciones, el puerto 1409 de entrada/salida comprende un transceptor. En tales realizaciones, el transceptor puede estar acoplado al procesador 1407 y configurado para permitir una comunicación con otros aparatos o dispositivos electrónicos, por ejemplo, a través de una red de comunicaciones inalámbrica. En algunas realizaciones, el transceptor o cualquier medio transceptor o transmisor y/o receptor adecuado puede(n) estar configurado(s) para comunicarse con otros dispositivos o aparatos electrónicos a través de un cable o un acoplamiento cableado.
[0337] El transceptor puede comunicarse con otros aparatos mediante cualquier protocolo de comunicaciones conocido adecuado. Por ejemplo, en algunas realizaciones, el transceptor puede utilizar un protocolo de sistema universal de telecomunicaciones móviles (UMTS), un protocolo de red de área local inalámbrica (WLAN), tal como, por ejemplo, el IEEE 802.X, un protocolo de comunicación de radiofrecuencia de corto alcance adecuado, tal como Bluetooth, o una ruta de comunicación de datos por infrarrojos (IRDA).
[0338] El puerto 1409 de entrada/salida del transceptor puede estar configurado para recibir las señales y, en algunas realizaciones, determinar los parámetros que se describen en la presente memoria utilizando el procesador 1407 que ejecuta un código adecuado. Además, el dispositivo puede generar una salida de señal de mezcla descendente y de parámetros adecuada que va a transmitirse al dispositivo de síntesis.
[0339] En algunas realizaciones, el dispositivo 1400 puede emplearse como al menos parte del dispositivo de síntesis. Como tal, el puerto 1409 de entrada/salida puede estar configurado para recibir las señales de mezcla descendente y, en algunas realizaciones, los parámetros determinados en el dispositivo de captación o dispositivo de procesamiento que se describe en la presente memoria y generar una salida en formato de señal de audio adecuada utilizando el procesador 1407 que ejecuta un código adecuado. El puerto 1409 de entrada/salida puede acoplarse a cualquier salida de audio adecuada, por ejemplo, a un sistema de altavoces multicanal y/o auriculares o similares.
[0340] En general, las diversas realizaciones de la invención pueden implementarse en hardware o en unos circuitos, software o lógica de propósito especial o en cualquier combinación de los mismos. Por ejemplo, algunos aspectos pueden implementarse en hardware, mientras que otros aspectos pueden implementarse en un firmware o software que puede ser ejecutado por un controlador, microprocesador u otro dispositivo informático, aunque la invención no está limitada a los mismos. Aunque diversos aspectos de la invención puedan ilustrarse y describirse como diagramas de bloques o diagramas de flujo, o utilizando alguna otra representación gráfica, se entiende claramente que estos bloques, aparatos, sistemas, técnicas o métodos descritos en la presente memoria pueden implementarse, como ejemplos no limitativos, en hardware, software, firmware, circuitos o una lógica de propósito especial, un hardware de propósito general o un controlador u otros dispositivos informáticos, o alguna combinación de los mismos.
[0341] Las realizaciones de esta invención pueden ser implementadas por un software informático ejecutable por un procesador de datos del dispositivo móvil, tal como en la entidad procesador, o por hardware, o por una combinación de software y hardware. Además, en este sentido, cabe señalar que cualesquiera bloques del flujo lógico como en las figuras pueden representar etapas de programa, o circuitos, bloques y funciones lógicos interconectados, o una combinación de etapas de programa y circuitos, bloques y funciones lógicos. El software puede almacenarse en medios físicos tales como chips de memoria o en bloques de memoria implementados dentro del procesador, medios magnéticos tales como un disco duro o disquetes y medios ópticos tales como, por ejemplo, DVD y las variantes de datos del mismo, CD.
[0342] La memoria puede ser de cualquier tipo adecuado para el entorno técnico local y puede implementarse utilizando cualquier tecnología de almacenamiento de datos adecuada, tal como dispositivos de memoria basados en semiconductores, dispositivos y sistemas de memoria magnética, dispositivos y sistemas de memoria óptica, una memoria fija y una memoria extraíble. Los procesadores de datos pueden ser de cualquier tipo adecuado para el entorno técnico local, y pueden incluir uno o más de ordenadores de propósito general, ordenadores de propósito
especial, microprocesadores, procesadores de señales digitales (DSP), circuitos integrados específicos de aplicación (ASIC), circuitos a nivel de compuerta y procesadores basados en una arquitectura de procesador multinúcleo, como ejemplos no limitativos.
[0343] Las realizaciones de las invenciones pueden ponerse en práctica en diversos componentes tales como módulos de circuito integrado. El diseño de circuitos integrados es, en gran medida, un proceso altamente automatizado. Hay herramientas de software complejas y potentes disponibles para convertir un diseño de nivel lógico en un diseño de circuito de semiconductores listo para grabarse y formarse en un sustrato semiconductor.
[0344] Los programas pueden enrutar conductores y ubicar componentes en un chip semiconductor, utilizando reglas de diseño bien establecidas, así como bibliotecas de módulos de diseño previamente almacenados. Una vez que se ha completado el diseño para un circuito de semiconductor, el diseño resultante, en un formato electrónico normalizado, puede transmitirse a una instalación de fabricación de semiconductores o “fáb.” para su fabricación.
[0345] La descripción anterior ha proporcionado, a modo de ejemplos ilustrativos y no limitativos, una descripción completa e informativa de la realización ilustrativa de esta invención. Sin embargo, diversas modificaciones y adaptaciones pueden resultar evidentes a los expertos en las técnicas relevantes en vista de la descripción anterior, cuando se lea en combinación con los dibujos adjuntos y las reivindicaciones adjuntas. Sin embargo, todas estas modificaciones y similares de las enseñanzas de la presente invención seguirán estando dentro del alcance de la presente invención como se define en las reivindicaciones adjuntas.
Claims (9)
1. REIVINDICACIONES
1. Un aparato para la codificación de audio espacial, que comprende:
medios para determinar o recibir (105) (107) al menos dos vectores de dirección esféricos, en donde un primer vector de dirección esférico está asociado a una primera banda de frecuencias y un segundo vector de dirección esférico está asociado a una segunda banda de frecuencias;
medios para determinar o recibir una energía (205) (315) de la primera banda de frecuencias y una energía de la segunda banda de frecuencias;
medios para fusionar (207) el primer vector de dirección esférico y el segundo vector de dirección esférico en un vector de dirección esférico fusionado mediante el aparato que comprende:
medios para convertir (301) el primer vector de dirección esférico en un primer vector cartesiano que convierten el segundo vector de dirección esférico en un segundo vector cartesiano, en donde el primer vector de dirección cartesiano y el segundo vector de dirección cartesiano comprenden cada uno un componente del eje x, un componente del eje y y un componente del eje z, en donde para cada componente respectivo el aparato comprende:
medios para ponderar (303) el componente respectivo del primer vector cartesiano mediante la energía de la primera banda de frecuencias y una relación entre energía directa y total calculada para la primera banda de frecuencias;
medios para ponderar (303) el componente respectivo del segundo vector cartesiano mediante la energía de la segunda banda de frecuencias y una relación entre energía directa y total calculada para la segunda banda de frecuencias; y
medios para sumar (305), el componente ponderado respectivo del primer vector cartesiano y el componente ponderado respectivo del segundo vector cartesiano para dar un componente cartesiano fusionado respectivo;
medios para convertir (307) el componente de eje x cartesiano fusionado, el componente de eje y cartesiano fusionado y el componente de eje z cartesiano fusionado en el vector de dirección esférico fusionado; y en dondeel aparato se caracteriza portener medios para fusionar (309) la relación de energía directa a total para la primera banda de frecuencias y la relación de energía directa a total de la segunda banda de frecuencias en una relación de energía directa con respecto a la energía total fusionada mediante la determinación de la longitud del vector cartesiano fusionado y la normalización de la longitud del vector cartesiano fusionado mediante la suma de la energía de la primera banda de frecuencias y la energía de la segunda banda de frecuencias.
2. El aparato según la reivindicación 1, en donde el aparato comprende además los medios para determinar si el vector de dirección esférico fusionado está codificado para su almacenamiento y/o transmisión o si los al menos dos vectores de dirección esféricos están codificados para su almacenamiento y/o transmisión.
3. El aparato según la reivindicación 2, en donde el aparato comprende además:
medios para determinar una métrica para la primera banda de frecuencias y la segunda banda de frecuencias; medios para comparar la métrica con un valor umbral, en donde los medios para determinar si el vector de dirección esférico fusionado está codificado para almacenamiento y/o transmisión o si los al menos dos vectores de dirección esféricos están codificados para almacenamiento y/o transmisión comprenden: medios para determinar que, cuando la métrica está por encima del valor umbral, determinar entonces que los al menos dos vectores de dirección esféricos están codificados para su almacenamiento y/o transmisión; y
medios para determinar que cuando la métrica está por debajo o es igual al valor umbral, determinar entonces que el vector de dirección esférico fusionado está codificado para su almacenamiento y/o transmisión.
4. El aparato según las reivindicaciones 1 a 3, en donde el aparato comprende además:
medios para determinar un primer parámetro de coherencia de propagación asociado con la primera banda de frecuencias y un segundo parámetro de coherencia de propagación asociado con la segunda banda de frecuencias; y
medios para fusionar (311) el primer parámetro de coherencia de propagación y el segundo parámetro de coherencia de propagación en un parámetro de coherencia de propagación fusionado.
5. El aparato según la reivindicación 4, en donde los medios para fusionar el primer parámetro de coherencia de propagación y el segundo parámetro de coherencia de propagación en un parámetro de coherencia de propagación fusionado comprenden:
medios para ponderar el primer parámetro de coherencia de propagación por la energía de la primera banda de frecuencias;
medios para ponderar el segundo parámetro de coherencia de propagación por la energía de la segunda banda de frecuencias;
medios para sumar el primer parámetro de coherencia de propagación ponderado y el segundo parámetro de coherencia de propagación ponderado para obtener una suma resultante; y
medios para normalizar la suma resultante mediante la suma de la energía de la primera banda de frecuencias y la energía de la segunda banda de frecuencias para obtener el parámetro de coherencia de propagación fusionado.
6. El aparato según las reivindicaciones 1 a 3, en donde el aparato comprende además:
medios para determinar un primer parámetro de coherencia envolvente asociado a la primera banda de frecuencias y un segundo parámetro de coherencia envolvente asociado a la segunda banda de frecuencias; y
medios para fusionar (313) el primer parámetro de coherencia envolvente y el segundo parámetro de coherencia envolvente en un parámetro de coherencia envolvente fusionado.
7. El aparato según la reivindicación 6, en donde los medios para fusionar el primer parámetro de coherencia envolvente y el segundo parámetro de coherencia envolvente en un parámetro de coherencia envolvente fusionado comprenden:
medios para ponderar el primer parámetro de coherencia envolvente por la energía de la primera banda de frecuencias;
medios para ponderar el segundo parámetro de coherencia envolvente por la energía de la segunda banda de frecuencias;
medios para sumar el primer parámetro de coherencia envolvente ponderado y el segundo parámetro de coherencia envolvente ponderado para obtener una suma resultante; y
medios para normalizar la suma resultante mediante la suma de la energía de la primera banda de frecuencias y la energía de la segunda banda de frecuencias para obtener el parámetro de coherencia envolvente fusionado.
8. El aparato según la reivindicación 3, en donde los medios para determinar una métrica comprenden:
medios para determinar una suma de la longitud del primer vector cartesiano y la longitud del segundo vector cartesiano; y
medios para determinar una diferencia entre la longitud del vector cartesiano fusionado y la suma.
9. Un método para la codificación de audio espacial, que comprende:
determinar o recibir (105) (107) al menos dos vectores de dirección esféricos, en donde un primer vector de dirección esférico está asociado a una primera banda de frecuencias y un segundo vector de dirección esférico está asociado a una segunda banda de frecuencias;
determinar o recibir (205) (315) una energía de la primera banda de frecuencias y una energía de la segunda banda de frecuencias;
fusionar (207) el primer vector de dirección esférico y el segundo vector de dirección esférico en un vector de dirección esférico fusionado mediante el método que comprende:
convertir (301) el primer vector de dirección esférico en un primer vector cartesiano convertir el segundo vector de dirección esférico en un segundo vector cartesiano, en donde el primer vector de dirección cartesiano y el segundo vector de dirección cartesiano comprenden cada uno un componente del eje x, un componente del eje y y un componente del eje z, en donde para cada componente respectivo el método comprende:
ponderar (303) el componente respectivo del primer vector cartesiano mediante la energía de la primera banda de frecuencias y una relación entre energía directa y total calculada para la primera banda de frecuencias;
ponderar (303) el componente respectivo del segundo vector cartesiano mediante la energía de la segunda banda de frecuencias y una relación entre energía directa y total calculada para la segunda banda de frecuencias; y
sumar (305) el componente ponderado respectivo del primer vector cartesiano y el componente ponderado respectivo del segundo vector cartesiano para dar un componente cartesiano fusionado respectivo; convertir (307) el componente de eje x cartesiano fusionado, el componente de eje y cartesiano fusionado y el componente de eje z cartesiano fusionado en el vector de dirección esférico fusionado; y
en dondeel método se caracteriza porfusionar (309) la relación de energía directa a total para la primera banda de frecuencia y la relación de energía directa a total de la segunda banda de frecuencia en una relación de energía directa con respecto a la energía total fusionada mediante la determinación de la longitud del vector cartesiano fusionado y la normalización de la longitud del vector cartesiano fusionado mediante la suma de la energía de la primera banda de frecuencia y la energía de la segunda banda de frecuencia.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| GB1919130.3A GB2590650A (en) | 2019-12-23 | 2019-12-23 | The merging of spatial audio parameters |
| PCT/FI2020/050750 WO2021130404A1 (en) | 2019-12-23 | 2020-11-13 | The merging of spatial audio parameters |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES3064493T3 true ES3064493T3 (en) | 2026-04-27 |
Family
ID=69322834
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES20907123T Active ES3064493T3 (en) | 2019-12-23 | 2020-11-13 | The merging of spatial audio parameters |
Country Status (7)
| Country | Link |
|---|---|
| US (2) | US12243540B2 (es) |
| EP (2) | EP4718880A3 (es) |
| CN (1) | CN114846541B (es) |
| ES (1) | ES3064493T3 (es) |
| GB (1) | GB2590650A (es) |
| PL (1) | PL4082009T3 (es) |
| WO (1) | WO2021130404A1 (es) |
Families Citing this family (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| GB2590651A (en) | 2019-12-23 | 2021-07-07 | Nokia Technologies Oy | Combining of spatial audio parameters |
| GB2590913A (en) | 2019-12-31 | 2021-07-14 | Nokia Technologies Oy | Spatial audio parameter encoding and associated decoding |
| GB2595871A (en) | 2020-06-09 | 2021-12-15 | Nokia Technologies Oy | The reduction of spatial audio parameters |
| GB2598932A (en) | 2020-09-18 | 2022-03-23 | Nokia Technologies Oy | Spatial audio parameter encoding and associated decoding |
| AU2021357364B2 (en) | 2020-10-09 | 2024-06-27 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method, or computer program for processing an encoded audio scene using a parameter smoothing |
| AU2021357840B2 (en) | 2020-10-09 | 2024-06-27 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method, or computer program for processing an encoded audio scene using a bandwidth extension |
| JP7787169B2 (ja) * | 2020-10-09 | 2025-12-16 | フラウンホーファー-ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン | パラメータ変換を用いて符号化されたオーディオシーンを処理するための装置、方法、またはコンピュータプログラム |
| CN113012690B (zh) * | 2021-02-20 | 2023-10-10 | 苏州协同创新智能制造装备有限公司 | 一种支持领域定制语言模型的解码方法及装置 |
| GB2611357A (en) * | 2021-10-04 | 2023-04-05 | Nokia Technologies Oy | Spatial audio filtering within spatial audio capture |
| US20240412739A1 (en) * | 2021-10-21 | 2024-12-12 | Beijing Xiaomi Mobile Software Co., Ltd. | Signal coding and decoding method and apparatus, and coding device, decoding device and storage medium |
| WO2023088560A1 (en) * | 2021-11-18 | 2023-05-25 | Nokia Technologies Oy | Metadata processing for first order ambisonics |
| EP4612681A1 (en) * | 2022-10-31 | 2025-09-10 | Dolby Laboratories Licensing Corporation | Low bitrate scene-based audio coding |
| CN120226076A (zh) | 2022-11-21 | 2025-06-27 | 诺基亚技术有限公司 | 确定空间音频参数的频率子带 |
Family Cites Families (29)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP1921606B1 (en) * | 2005-09-02 | 2011-10-19 | Panasonic Corporation | Energy shaping device and energy shaping method |
| WO2011076285A1 (en) | 2009-12-23 | 2011-06-30 | Nokia Corporation | Sparse audio |
| DE102010001084A1 (de) * | 2010-01-21 | 2011-07-28 | Höhne, Jens, Dr., 80331 | Simulator und Verfahren zur Simulation der Behandlung eines biologischen Gewebes |
| IN2014CN03413A (es) * | 2011-11-01 | 2015-07-03 | Koninkl Philips Nv | |
| EP2600343A1 (en) * | 2011-12-02 | 2013-06-05 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for merging geometry - based spatial audio coding streams |
| JP5724044B2 (ja) * | 2012-02-17 | 2015-05-27 | 華為技術有限公司Huawei Technologies Co.,Ltd. | 多重チャネル・オーディオ信号の符号化のためのパラメトリック型符号化装置 |
| US9761229B2 (en) * | 2012-07-20 | 2017-09-12 | Qualcomm Incorporated | Systems, methods, apparatus, and computer-readable media for audio object clustering |
| BR112015004625B1 (pt) * | 2012-09-03 | 2021-12-07 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Aparelho e método para fornecer uma estimativa de probabilidade de presença de voz multicanal informada. |
| WO2014099285A1 (en) * | 2012-12-21 | 2014-06-26 | Dolby Laboratories Licensing Corporation | Object clustering for rendering object-based audio content based on perceptual criteria |
| US9659569B2 (en) | 2013-04-26 | 2017-05-23 | Nokia Technologies Oy | Audio signal encoder |
| RU2745832C2 (ru) * | 2013-05-24 | 2021-04-01 | Долби Интернешнл Аб | Эффективное кодирование звуковых сцен, содержащих звуковые объекты |
| WO2014191793A1 (en) * | 2013-05-28 | 2014-12-04 | Nokia Corporation | Audio signal encoder |
| KR102294767B1 (ko) * | 2013-11-27 | 2021-08-27 | 디티에스, 인코포레이티드 | 고채널 카운트 멀티채널 오디오에 대한 멀티플렛 기반 매트릭스 믹싱 |
| US9502045B2 (en) * | 2014-01-30 | 2016-11-22 | Qualcomm Incorporated | Coding independent frames of ambient higher-order ambisonic coefficients |
| CN105989852A (zh) * | 2015-02-16 | 2016-10-05 | 杜比实验室特许公司 | 分离音频源 |
| GB2540175A (en) | 2015-07-08 | 2017-01-11 | Nokia Technologies Oy | Spatial audio processing apparatus |
| US10249312B2 (en) * | 2015-10-08 | 2019-04-02 | Qualcomm Incorporated | Quantization of spatial vectors |
| GB2554446A (en) * | 2016-09-28 | 2018-04-04 | Nokia Technologies Oy | Spatial audio signal format generation from a microphone array using adaptive capture |
| GB2556093A (en) | 2016-11-18 | 2018-05-23 | Nokia Technologies Oy | Analysis of spatial metadata from multi-microphones having asymmetric geometry in devices |
| US10674301B2 (en) * | 2017-08-25 | 2020-06-02 | Google Llc | Fast and memory efficient encoding of sound objects using spherical harmonic symmetries |
| GB201718341D0 (en) | 2017-11-06 | 2017-12-20 | Nokia Technologies Oy | Determination of targeted spatial audio parameters and associated spatial audio playback |
| BR112020011035A2 (pt) | 2017-11-17 | 2020-11-17 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e. V. | aparelho e método para codificar ou decodificar parâmetros de codificação de áudio direcional com o uso de diferentes resoluções de tempo frequência |
| GB2574238A (en) * | 2018-05-31 | 2019-12-04 | Nokia Technologies Oy | Spatial audio parameter merging |
| EP3804334A4 (en) | 2018-06-04 | 2022-04-20 | Nokia Technologies Oy | DEVICE, METHOD AND COMPUTER PROGRAM FOR VOLUMETRIC VIDEO |
| GB2575305A (en) | 2018-07-05 | 2020-01-08 | Nokia Technologies Oy | Determination of spatial audio parameter encoding and associated decoding |
| GB2577698A (en) | 2018-10-02 | 2020-04-08 | Nokia Technologies Oy | Selection of quantisation schemes for spatial audio parameter encoding |
| US12009001B2 (en) | 2018-10-31 | 2024-06-11 | Nokia Technologies Oy | Determination of spatial audio parameter encoding and associated decoding |
| GB2582749A (en) | 2019-03-28 | 2020-10-07 | Nokia Technologies Oy | Determination of the significance of spatial audio parameters and associated encoding |
| GB2587196A (en) | 2019-09-13 | 2021-03-24 | Nokia Technologies Oy | Determination of spatial audio parameter encoding and associated decoding |
-
2019
- 2019-12-23 GB GB1919130.3A patent/GB2590650A/en not_active Withdrawn
-
2020
- 2020-11-13 US US17/786,088 patent/US12243540B2/en active Active
- 2020-11-13 PL PL20907123.2T patent/PL4082009T3/pl unknown
- 2020-11-13 WO PCT/FI2020/050750 patent/WO2021130404A1/en not_active Ceased
- 2020-11-13 EP EP26151318.8A patent/EP4718880A3/en active Pending
- 2020-11-13 ES ES20907123T patent/ES3064493T3/es active Active
- 2020-11-13 CN CN202080089375.3A patent/CN114846541B/zh active Active
- 2020-11-13 EP EP20907123.2A patent/EP4082009B1/en active Active
-
2025
- 2025-01-28 US US19/039,218 patent/US20250174238A1/en active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| EP4718880A2 (en) | 2026-04-01 |
| US20250174238A1 (en) | 2025-05-29 |
| CN114846541A (zh) | 2022-08-02 |
| WO2021130404A1 (en) | 2021-07-01 |
| US20230197086A1 (en) | 2023-06-22 |
| EP4082009A1 (en) | 2022-11-02 |
| EP4082009A4 (en) | 2024-01-17 |
| PL4082009T3 (pl) | 2026-04-20 |
| GB201919130D0 (en) | 2020-02-05 |
| CN114846541B (zh) | 2025-09-05 |
| EP4718880A3 (en) | 2026-04-08 |
| US12243540B2 (en) | 2025-03-04 |
| GB2590650A (en) | 2021-07-07 |
| EP4082009B1 (en) | 2026-02-11 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP4082009B1 (en) | The merging of spatial audio parameters | |
| ES3012258T3 (en) | Determination of the significance of spatial audio parameters and associated encoding | |
| US12243553B2 (en) | Combining of spatial audio parameters | |
| JP7142109B2 (ja) | 空間オーディオパラメータのシグナリング | |
| ES3037973T3 (en) | Spatial parameter signalling | |
| EP4315324A1 (en) | Combining spatial audio streams | |
| US12548576B2 (en) | Reduction of spatial audio parameters | |
| JP7855672B2 (ja) | 空間音声パラメータの量子化 | |
| US20210250717A1 (en) | Spatial audio Capture, Transmission and Reproduction | |
| ES3037774T3 (en) | Quantizing spatial audio parameters | |
| JP2026511173A (ja) | 低コーディングレートのパラメータ空間オーディオ符号化 | |
| ES3005057T3 (en) | Quantisation of audio parameters | |
| US12412585B2 (en) | Transforming spatial audio parameters |