ES3037973T3 - Spatial parameter signalling - Google Patents
Spatial parameter signallingInfo
- Publication number
- ES3037973T3 ES3037973T3 ES19855639T ES19855639T ES3037973T3 ES 3037973 T3 ES3037973 T3 ES 3037973T3 ES 19855639 T ES19855639 T ES 19855639T ES 19855639 T ES19855639 T ES 19855639T ES 3037973 T3 ES3037973 T3 ES 3037973T3
- Authority
- ES
- Spain
- Prior art keywords
- parameter
- frequency bands
- audio signal
- frequency band
- energy
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/008—Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/0204—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Mathematical Physics (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Stereophonic System (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Circuit For Audible Band Transducer (AREA)
Abstract
Un aparato que comprende medios para: obtener al menos una señal de audio; obtener al menos un parámetro respectivamente para cada una de al menos dos bandas de frecuencia asociadas con la al menos una señal de audio; y seleccionar una banda de frecuencia de las al menos dos bandas de frecuencia basándose en la comparación de al menos un parámetro respectivo adicional para cada una de las al menos dos bandas de frecuencia en donde el al menos un parámetro respectivo adicional se determina a partir de cada una de las al menos dos bandas de frecuencia; generar una salida que comprende una selección del al menos un parámetro asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia, de tal manera que la selección del al menos un parámetro asociado con la banda de frecuencia seleccionada está configurada para reducir una tasa de bits o tamaño de la salida y en donde el al menos un parámetro de la banda de frecuencia seleccionada está configurado para representar parámetros respectivos de las al menos dos bandas de frecuencia. (Traducción automática con Google Translate, sin valor legal)
Description
DESCRIPCIÓN
Señalización de parámetros espaciales
Campo
La presente solicitud se refiere a aparatos y métodos para la señalización de parámetros espaciales, pero no exclusivamente para la señalización de parámetros espaciales dentro y entre codificadores y decodificadores de audio espacial.
Antecedentes
El procesamiento de audio espacial paramétrico es un campo de procesamiento de señales de audio donde el aspecto espacial del sonido se describe usando un conjunto de parámetros. Por ejemplo, en la captura de audio espacial paramétrica a partir de matrices de micrófonos, una elección típica y efectiva es estimar, a partir de las señales de matriz de micrófonos, un conjunto de parámetros tales como direcciones del sonido en bandas de frecuencia, y los coeficientes entre las partes direccionales y no direccionales del sonido capturado en las bandas de frecuencia. Se sabe que estos parámetros describen bien las propiedades espaciales perceptuales del sonido captado en la posición de la matriz de micrófonos. Estos parámetros pueden usarse en la síntesis del sonido espacial, por consiguiente, para auriculares de manera binaural, para altavoces o para otros formatos, tales como ambisónico.
“Multi-channel Object-based spatial parameter compression approach for 3D audio”, Yang y col., PCM 2015, 16 de septiembre de 2015, págs.354-364, describe un enfoque de compresión de parámetros espaciales para disminuir las tasas de bits de los parámetros espaciales para audio en 3D.
La patente CN106023999 describe un método y un sistema de codificación y decodificación para mejorar la relación de compresión de parámetros espaciales de audio tridimensional. La señal de audio de un audio tridimensional, la información lateral espacial del audio tridimensional y el número del objeto de audio de los parámetros espaciales se introducen cuando se lleva a cabo la codificación; cuando se lleva a cabo la codificación, el agrupamiento, la cuantificación, la codificación intratrama y la codificación diferencial entre tramas se llevan a cabo sucesivamente en los parámetros espaciales; cuando se lleva a cabo la decodificación, se llevan a cabo sucesivamente la decodificación diferencial entre tramas, la decodificación intratrama, la cuantificación inversa y el mapeo de parámetros espaciales. Basándose en la característica de que diferentes parámetros espaciales de subbanda en la misma fuente de sonido y la misma trama tienen similitudes, se adopta un método de agrupamiento de parámetros espaciales para mejorar la relación de compresión de los parámetros espaciales de audio tridimensionales, y la relación de compresión de los parámetros espaciales de audio tridimensionales es alta.
La patente CN103928030 describe un sistema y método de codificación de audio escalable basándose en medidas de atención espacial de subbanda, que incluye calcular y clasificar exhaustivamente las medidas de importancia de subbanda de cada subbanda basándose en la energía, la frecuencia y la información espacial, y clasificar el bit según los resultados de clasificación de las medidas integrales. Utiliza la información de energía, frecuencia y espacio como una estrategia de asignación de prioridades de subbanda, que tiene una importancia orientativa más obvia que simplemente utilizar la energía o la frecuencia como medida de percepción.
La patente US-2006235679 describe un método basado en el descubrimiento de que los parámetros que incluyen un primer conjunto de parámetros de una representación de una primera parte de una señal original y que incluyen un segundo conjunto de parámetros de una representación de una segunda parte de la señal original pueden codificarse de manera eficiente, cuando los parámetros están dispuestos en una primera secuencia de tuplas y en una segunda secuencia de tuplas, en donde la primera secuencia de tuplas comprende tuplas de parámetros que tienen dos parámetros de una sola parte de la señal original y en donde la segunda secuencia de las tuplas comprenden tuplas de parámetros que tienen un parámetro de la primera parte y un parámetro de la segunda parte de la señal original. Se puede lograr una codificación eficiente utilizando un estimador de bits para estimar el número de bits necesarios para codificar la primera y la segunda secuencia de tuplas, en donde solo se codifica la secuencia de tuplas, lo que da como resultado un menor número de bits.
La patente WO 2014/191793 describe un aparato que comprende: un determinador de parámetros configurado para determinar, para una trama de al menos una señal de audio, un conjunto de parámetros multicanal de señal de audio de trama; un selector de parámetros configurado para seleccionar para la trama un subconjunto del conjunto de parámetros multicanal de señal de audio de trama basándose en un valor de error asociado al subconjunto del conjunto de parámetros multicanal de señal de audio de trama; y un codificador de parámetros configurado para generar un parámetro multicanal de señal de audio de trama codificado basándose en el subconjunto seleccionado del conjunto de parámetros multicanal de señal de audio de trama.
La patente WO 2012/058805 describe un codificador paramétrico para codificar una señal de audio multicanal que tiene una primera señal de audio y se proporciona una segunda señal de audio. El codificador paramétrico tiene un transformador (101) para transformar la primera señal de audio en el dominio de frecuencia para obtener una primera señal de audio transformada y para transformar la segunda señal de audio en el dominio de frecuencia para obtener una segunda señal de audio transformada, un generador (107) de parámetros para generar un primer parámetro de codificación a partir de la primera señal de audio transformada y de la segunda señal de audio transformada a una primera frecuencia y para generar un segundo parámetro de codificación a partir de la primera señal de audio transformada y a partir del segundo audio transformado. señal a una segunda frecuencia y un combinador (109) de parámetros para combinar el primer parámetro de codificación y el segundo parámetro de codificación para obtener un parámetro de codificación combinado.
La patente US-2009/006103 describe que un decodificador de audio proporciona una combinación de componentes de decodificación que incluyen componentes que implementan técnicas de decodificación de banda base, decodificación de picos espectrales, decodificación de extensión de frecuencia y decodificación de extensión de canal. El decodificador de audio decodifica un flujo de bits comprimido estructurado mediante un esquema sintáctico de flujo de bits para permitir que los diversos componentes de decodificación extraigan los parámetros apropiados para su técnica de decodificación respectiva.
“Perceptual Compression Methods for Metadata in Directional Audio Coding Applied to Audiovisual Teleconference”, Hirvonen, Toni, Ahonen, Jukka, Pulkki, Ville, AES Convention 126; mayo de 2009, 01-05-2009, AES, 60 East 42nd Street, Room 2520 New York 10165-2520, describe métodos de compresión perceptual para metadatos en la codificación de audio direccional.
Resumen
La invención proporciona un aparato según la reivindicación 1 y un método según la reivindicación 8.
Las realizaciones de la presente solicitud tienen como objetivo abordar problemas asociados con el estado de la técnica.
Resumen de las figuras
Para una mejor comprensión de la presente solicitud, ahora se hará referencia a modo de ejemplo a los dibujos adjuntos, en los que:
la figura 1 muestra esquemáticamente un sistema de aparato adecuado para implementar algunas realizaciones; la figura 2 muestra un diagrama de flujo de la operación del sistema como se muestra en la figura 1 según algunas realizaciones;
la figura 3 muestra esquemáticamente el aparato de captura/codificación;
la figura 4 muestra un diagrama de flujo de la operación del aparato de captura/codificación como se muestra en la figura 3;
la figura 5 muestra esquemáticamente un aparato de captura/codificación según algunas realizaciones;
la figura 6 muestra un diagrama de flujo de la operación del aparato de captura/codificación como se muestra en la figura 5 según algunas realizaciones;
la figura 7 muestra un diagrama de flujo de la operación del aparato de codificación que codifica las señales de transporte y los metadatos obtenidos según algunas realizaciones;
la figura 8 muestra un diagrama de flujo de la operación de selección de banda del aparato de captura/codificación como se muestra en la figura 5 según algunas realizaciones; y
la figura 9 muestra esquemáticamente un dispositivo ilustrativo adecuado para implementar el aparato mostrado.Realizaciones de la solicitud
A continuación, se describe con más detalle un aparato adecuado y mecanismos posibles para la provisión de parámetros de metadatos derivados de análisis espacial eficaces asociados con relaciones de energía para señales de audio de matriz de micrófonos y otros formatos de entrada.
El aparato se ha diseñado para transmitir un modelado de audio espacial de un campo de sonido utilizando Q (que es de forma típica 2) señales de audio de transporte y metadatos espaciales. Las señales de audio de transporte se comprimen típicamente con un esquema de codificación de audio adecuado (por ejemplo, codificación de audio avanzada (AAC) o servicios de voz mejorados (códecs EVS)). Los metadatos espaciales pueden contener parámetros tales como la dirección (por ejemplo, acimut, elevación) en el dominio de tiempo-frecuencia.
Además, otros parámetros que pueden determinarse y señalizarse a un renderizador o receptor son una o más relaciones de energía directa a total (en el dominio de tiempo-frecuencia) que representan la distribución de energía entre cada dirección específica y la energía de audio total. Otro parámetro puede ser una relación entre energía difusa y total (o más cuando sea práctico) (en el dominio de tiempo-frecuencia) que representa la distribución de energía entre la señal ambiental o difusa (es decir, una señal no direccional como la reverberación) y la energía total.
Las señales de audio espaciales paramétricas pueden representarse como canales Q metadatos. Este formato se puede comprimir en la codificación para almacenarlo de manera eficiente para su posterior recuperación o transmitirlo a través de un canal de transmisión adecuado. Se pueden utilizar diversos métodos según la configuración de los canales y el contenido de los metadatos.
Un procedimiento habitual es definir un presupuesto de tasa de bits constante para todo el flujo de bits que contiene los canales de audio y los metadatos. Este presupuesto de tasa de bits se puede dividir entonces de forma estática o adaptativa (dinámica) entre los canales de audio y los metadatos.
Por ejemplo, un presupuesto de tasa de bits de 64 kb/s para 2 canales metadatos podría utilizarse de diversas maneras. El uso de los 64 kb/s completos para los 2 canales de audio ofrecería una muy buena calidad para codificar la señal estéreo (por ejemplo, con un códec EVS), pero en este ejemplo no se transmitirían los metadatos. El uso de 56 kb/s para el audio y 8 kb/s para los metadatos usualmente proporcionaría una calidad general más alta, ya que la diferencia en la calidad de la codificación del audio no es grande, pero los metadatos señalizados pueden proporcionar una reproducción envolvente 3D completa.
Con tasas de bits más bajas, dividir el presupuesto de tasas de bits se vuelve aún más difícil. Por ejemplo, con un presupuesto de 16 kb/s, pueden existir los siguientes modos de codificación:
• Audio de un canal de 16 kb/s
• Audio de un canal de 15 kb/s metadatos de 1 kb/s
• Audio de un canal de 11 kb/s metadatos de 5 kb/s
• Audio de dos canales de 16 kb/s
• Audio de dos canales de 15 kb/s metadatos de 1 kb/s
• Audio de dos canales de 11 kb/s metadatos de 5 kb/s
La optimización entre estos modos de ejemplo puede requerir experimentos de escucha. Sin embargo, experimentos anteriores han demostrado que, con tasas de bits tan bajas, ofrecer una mayor tasa de bits a la calidad del audio sin procesar en múltiples canales tiende a ofrecer una mejor calidad percibida. El efecto de la presupuestación de la tasa de bits de los metadatos es que se considera un buen objetivo reducir la tasa de bits de los metadatos, de tal modo que la señal de audio reciba al menos el 90 % del presupuesto total de la tasa de bits.
Sin embargo, la cantidad de metadatos generados y, por lo tanto, la cantidad de datos que definen los parámetros espaciales está relacionada con la banda de frecuencia. Por ejemplo, para las bandas de frecuencia B (p. ej., 5, 10, 20 o 30) y dos parámetros (dirección y relación de energía) para cada trama de tiempo, puede haber como mínimo 2*B*K (K es el número de bits por parámetro) bits de metadatos por trama de tiempo. Suponiendo el número común de 50 tramas por segundo, B = 5 y K = 10, es posible que se generen metadatos de 5 kb/s. Con aplicaciones de baja tasa de bits (tales como IVAS), la tasa de bits objetivo total con audio puede ser tan baja como 14 kb/s, por lo que los metadatos ocuparían una gran parte del presupuesto de tasa de bits incluso después de la codificación por entropía (lo que puede reducir la tasa de bits a la mitad del total generado).
Actualmente, los intentos de reducir lo generado incluyen reducir la precisión de bits por parámetro o incluso eliminar los parámetros menos importantes cuando el presupuesto de tasa de bits es bajo. Otro enfoque es reducir el número de bandas de frecuencia para los metadatos, por ejemplo, generando solo un parámetro por período de tiempo y, por lo tanto, produciendo una reducción de los metadatos generados en B. Un método para lograr esto es realizar un análisis de banda ancha (en otras palabras, suponer solo una banda de frecuencia para todo el rango de frecuencias audibles) y codificar este grupo de banda ancha.
El concepto descrito en la presente memoria intenta mejorar estos métodos y, en particular, en lugar del análisis de banda ancha, intenta:
• requerir un único sistema de análisis para diferentes tasas de bits (y, por lo tanto, no un análisis de banda para tasas de bits bajas, análisis de múltiples bandas para tasas de bits altas); y
• mejorar la resolución tiempo-frecuencia de la escena sonora de una manera práctica adecuada para el rango auditivo humano.
Por lo tanto, el concepto, como se describe con más detalle en las realizaciones de la presente memoria, implementa un sistema de análisis con múltiples bandas y, a continuación, selecciona la mejor banda de frecuencia para representar el período de tiempo actual.
Por lo tanto, las realizaciones descritas en la presente memoria intentan reducir la tasa de bits seleccionando una banda de frecuencia de los metadatos analizados para representar todas las bandas de frecuencia. Esto reduce el uso de la tasa de bits en un factor de B (donde B es el número original de bandas de frecuencia). El proceso de selección en algunas realizaciones se refiere a la codificación de audio y puede referirse (en aspectos no cubiertos por las reivindicaciones) a la decodificación mediante una parametrización referida al campo sonoro (p. ej., dirección(es) y relación(es) de energía directa a total en las bandas de frecuencia), donde se proporciona una solución para reducir automáticamente la tasa de bits de los parámetros de dirección transmitiendo solo un valor de dirección para todas las bandas de frecuencia y cuando el valor de una dirección transmitido se determina por medio de: Obtener de señales de audio;
determinar las direcciones (parámetros espaciales) y las relaciones entre energía directa y total en las bandas de frecuencia;
determinar la energía normalizada en las bandas de frecuencia;
determinar el factor de ponderación de energía direccional (p. ej., la energía multiplicada por la relación entre energía directa y energía total);
determinar la banda de frecuencia más alta con un factor de ponderación de energía direccional por encima de un umbral;
codificar/almacenar/transmitir solo la dirección de la banda determinada.
Esto puede ampliarse o detallarse aún más como un aparato de análisis configurado para:
obtener señales de audio multicanal (por ejemplo, capturar señales de audio espaciales);
aplicar la transformación de tiempo-frecuencia a las señales de audio multicanal;
realizar un análisis espacial de la señal transformada;
calcular la energía normalizada para cada banda de frecuencia para la señal transformada;
calcular el factor de ponderación de la banda de frecuencia para cada banda (energía multiplicada por la relación de energía) para la señal transformada;
elegir o seleccionar una banda más alta que tenga un factor de ponderación por encima del límite definido (p. ej., 0,5); descartar otros metadatos y guardar solo los metadatos de la banda de frecuencia elegida;
crear señales de transporte;
codificar y transmitir/almacenar señales de transporte y metadatos.
Con respecto al aparato de síntesis, se configura entonces para:
obtener (recibir/recuperar) las señales de transporte y los metadatos transmitidos/almacenados;
replicar los metadatos seleccionados/elegidos en todas las bandas de frecuencia; y
sintetizar la salida mediante señales de transporte y metadatos replicados.
Las direcciones y las relaciones entre energía directa y total se pueden estimar utilizando cualquier método adecuado (p. ej., SPAC) y dependen del tipo de señales de audio (p. ej., matriz de micrófonos, ambisónica, señales de audio multicanal).
La energía normalizada se puede estimar como se describe en las realizaciones de la presente memoria de una manera adecuada. Por ejemplo, calculando la suma de los cuadrados de las muestras en el dominio de la frecuencia y dividiéndolos por la energía más grande.
En algunas realizaciones, el valor umbral puede determinarse, por ejemplo, multiplicando la energía normalizada promedio por un factor.
Además de la dirección, también todos los demás parámetros (p. ej., las relaciones de energía directa con respecto a la energía total) pueden codificarse utilizando el mismo esquema. En otras palabras, transmitir solo un valor de parámetro para todas las bandas de frecuencia. El valor que se va a transmitir se puede seleccionar utilizando el mismo procedimiento.
La decodificación se puede realizar usando cualquier método adecuado, por ejemplo, usando el mismo valor de parámetro en todas las bandas de frecuencia.
En algunas realizaciones, en la codificación, la banda de frecuencia seleccionada se puede utilizar como una banda de referencia y se puede determinar una codificación de diferencia de tasa de bits muy baja referida a ella para otras bandas.
Con respecto a la figura 1, se muestran un aparato y un sistema de ejemplo para implementar realizaciones de la solicitud. El sistema 171 se muestra con una parte 121 de “análisis” y una parte 131 de “síntesis”. La parte 121 de “análisis” es la parte desde la recepción de las señales 100 de audio de entrada (altavoz multicanal, matriz de micrófonos, ambisónica o captura de dispositivos móviles) hasta la codificación de los metadatos y la señal 102 de transporte que puede transmitirse o almacenarse 104. La parte 131 de “síntesis” puede ser la parte desde una decodificación de los metadatos codificados y la señal 104 de transporte hasta la presentación de la señal sintetizada (por ejemplo, en forma de altavoz multicanal 106 a través de altavoces 107 o formatos binaurales o ambisónicos). La entrada al sistema 171 y la parte 121 “de análisis” son, por lo tanto, señales 100 de audio. Estas pueden ser señales de audio de altavoces multicanal de entrada adecuadas, señales de audio de matriz de micrófonos, señales de audio ambisónicas o señales de audio capturadas móviles.
Las señales 100 de audio de entrada pueden pasarse a un procesador 101 de análisis. El procesador 101 de análisis puede estar configurado para recibir las señales de audio de entrada y generar un flujo 104 de datos adecuado que comprenda señales de transporte adecuadas. Las señales de audio de transporte también pueden conocerse como señales de audio asociadas y estar basadas en las señales de audio. Por ejemplo, en algunas realizaciones, el generador 103 de señales de transporte está configurado para mezclar de manera descendente o seleccionar o combinar de otro modo, por ejemplo, mediante técnicas de formación de haces las señales de audio de entrada a un número determinado de canales y emitir estas como señales de transporte. En algunas realizaciones, el procesador de análisis está configurado para generar una salida de 2 canales de audio de las señales de audio de matriz de micrófonos. El número determinado de canales puede ser dos o cualquier número adecuado de canales.
En algunas realizaciones, el procesador de análisis está configurado para pasar las señales 100 de audio de entrada recibidas sin procesar a un codificador de la misma manera que las señales de transporte. En algunas realizaciones, el procesador 101 de análisis está configurado para seleccionar una o más de las señales de audio de micrófono y emitir la selección como las señales 104 de transporte. En algunas realizaciones, el procesador 101 de análisis está configurado para aplicar cualquier codificación o cuantificación adecuada a las señales de audio de transporte. En algunas realizaciones, el procesador 101 de análisis también está configurado para analizar las señales 100 de audio de entrada para producir metadatos asociados con las señales de audio de entrada (y, por lo tanto, asociados con las señales de transporte). El procesador 101 de análisis puede, por ejemplo, ser un ordenador (que ejecuta un software adecuado almacenado en una memoria y en al menos un procesador), un dispositivo móvil o, alternativamente, un dispositivo específico que utilice, por ejemplo, FPGA o ASIC. Como se muestra en la presente memoria con más detalle, los metadatos pueden comprender, para cada intervalo de análisis de tiempo-frecuencia, al menos un parámetro de dirección y al menos un parámetro de relación de energía. El al menos un parámetro de dirección y el al menos un parámetro de relación de energía pueden considerarse, en algunas realizaciones, parámetros de audio espaciales. Dicho de otro modo, los parámetros de audio espacial comprenden parámetros que tienen como objetivo caracterizar el campo sonoro de las señales de audio de entrada.
En algunas realizaciones, los parámetros generados pueden diferir de una banda de frecuencia a otra y pueden depender de la tasa de bits de transmisión. Por lo tanto, por ejemplo, en la banda X todos los parámetros se generan y transmiten, mientras que en la banda Y solo se genera y transmite uno de los parámetros, y además en la banda Z cualquier otro número de parámetros se generan o transmiten. Un ejemplo práctico de esto es que para algunas bandas de frecuencia, tales como la banda más alta, no se requieren algunos de los parámetros por motivos perceptuales.
Las señales 102 de transporte y los metadatos pueden transmitirse o almacenarse y esto se muestra en la figura 1 mediante la línea discontinua 104. Antes de que las señales de transporte y los metadatos se transmitan o almacenen, en algunas realizaciones pueden codificarse para reducir la tasa de bits y multiplexarse en un flujo. La codificación y la multiplexación pueden implementarse utilizando cualquier esquema adecuado.
En el lado 131 de decodificador, los datos recibidos o recuperados (flujo) pueden introducirse en un procesador 105 de síntesis. El procesador 105 de síntesis puede estar configurado para demultiplexar los datos (flujo) en transporte y metadatos codificados. El procesador 105 de síntesis puede después decodificar cualquier flujo codificado para obtener las señales de transporte y los metadatos.
El procesador 105 de síntesis puede estar configurado después para recibir las señales de transporte y los metadatos y crear una salida 106 de señal de audio multicanal adecuada (que puede ser cualquier formato de salida adecuado, tal como señales binaurales, altavoz multicanal o ambisónica, según el caso de uso) en función de las señales de transporte y los metadatos. En algunas realizaciones con reproducción de auriculares o altavoces, se reproduce un campo de sonido físico real (utilizando el dispositivo 107 de salida, por ejemplo, altavoces/auriculares, etc.) que tiene las propiedades perceptivas deseadas. En otras realizaciones, se puede entender que la reproducción de un campo sonoro se refiere a la reproducción de las propiedades perceptuales de un campo sonoro por otros medios distintos de la reproducción de un campo sonoro físico real en un espacio. Por ejemplo, las propiedades perceptuales deseadas de un campo sonoro se pueden reproducir con auriculares utilizando los métodos de reproducción binaural descritos en la presente memoria. En otro ejemplo, las propiedades perceptuales de un campo sonoro podrían reproducirse como una señal de salida ambisónica y estas señales ambisónicas pueden reproducirse con métodos de decodificación ambisónica para proporcionar, por ejemplo, una salida binaural con las propiedades perceptuales deseadas.
En algunas realizaciones, el procesador 105 de síntesis puede ser un ordenador (que ejecuta un software adecuado almacenado en una memoria y en al menos un procesador), un dispositivo móvil o, alternativamente, un dispositivo específico que utilice, por ejemplo, FPGA o ASIC.
Con respecto a la figura 2, se muestra un diagrama de flujo de ejemplo de la descripción general mostrada en la figura 1.
En primer lugar, el sistema (parte de análisis) está configurado para recibir señales de audio de entrada como se muestra en la figura 2 mediante la etapa 201.
A continuación, el sistema (parte de análisis) está configurado para generar canales de señal de transporte o señales de transporte (por ejemplo, mezcla descendente/selección/formación de haces en función de las señales de audio de entrada multicanal), como se muestra en la figura 2 en la etapa 203.
También, el sistema (parte de análisis) está configurado para analizar las señales de audio para generar metadatos: Direcciones; Relaciones de energía, como se muestra en la figura 2 mediante el paso 205.
A continuación, el sistema es configurado para codificar (opcionalmente) para el almacenamiento/transmisión las señales de transporte y los metadatos, como se muestra en la figura 2 mediante el paso 207.
Después de esto, el sistema puede almacenar/transmitir las señales de transporte y los metadatos, como se muestra en la figura 2 mediante el paso 209.
El sistema puede recuperar/recibir las señales de transporte y metadatos, como se muestra en la figura 2 mediante la etapa 211.
A continuación, el sistema está configurado para extraer a partir de las señales de transporte y los metadatos, como se muestra en la figura 2 mediante la etapa 213.
El sistema (parte de síntesis) está configurado para sintetizar señales de audio espacial de salida (que, como se ha descrito anteriormente, pueden ser cualquier formato de salida adecuado, tal como señales binaurales, altavoces multicanal o ambisónica, según el caso de uso) en función de las señales de audio y los metadatos extraídos, como se muestra en la figura 2 mediante la etapa 215.
Con respecto a la figura 3, se muestra un procesador 101 de análisis ilustrativo, donde la señal de audio de entrada se proporciona desde una fuente 301 de audio que en este ejemplo es un dispositivo de captura espacial configurado para generar señales de audio multicanal desde múltiples micrófonos. Las señales de audio multicanal en este ejemplo se pasan a un generador 311 de señales (audio) de transporte. El generador 311 de señales de audio de transporte está configurado para generar las señales de audio de transporte según cualquiera de las opciones descritas anteriormente. Por ejemplo, las señales de transporte pueden mezclarse de manera descendente a partir de las señales de entrada. La cantidad de señales de audio de transporte puede ser cualquier cantidad y puede ser 2 o más o menos de 2.
En el ejemplo mostrado en la figura 3, las señales de audio multicanal también se introducen en una transformada 303 de tiempo-frecuencia. La transformada 303 de tiempo-frecuencia puede configurarse para generar representaciones de tiempo-frecuencia adecuadas de las señales de audio multicanal y pasarlas a un procesador 307 de banda de frecuencia.
El procesador 305 de banda de frecuencia está configurado para generar salidas de metadatos espaciales, como las que se muestran como las direcciones, las relaciones entre energía directa y total y, en algunas realizaciones, otros tipos de relaciones de energía, como la (las) relación(es) entre energía difusa y total y la (las) relación(es) entre energía restante y total.
La implementación del análisis puede ser cualquier implementación adecuada que produzca las salidas de metadatos descritas.
Por lo tanto, por ejemplo, en algunas realizaciones, el procesador 305 de banda de frecuencia comprende un analizador 307 de dirección configurado para generar los metadatos de dirección y un analizador 309 de relación de energía configurado para generar los metadatos de relación de energía.
Los metadatos de dirección y relación de energía para todas las bandas de frecuencia analizadas pueden pasarse entonces a un codificador 313 de transmisión/almacenamiento. El codificador 313 de transmisión/almacenamiento puede configurarse para combinar y codificar las señales de transporte, las direcciones y las relaciones de energía para generar el flujo 102 de datos.
Por ejemplo, en algunas realizaciones, el codificador 313 de transmisión/almacenamiento puede comprender un compresor/codificador de señales de transporte adecuado configurado para comprimir las señales de audio utilizando un códec adecuado (p. ej., AAC o EVS).
Con respecto a la figura 4, se muestra un diagrama de flujo de la operación del procesador de análisis.
La primera operación es una de recibir las señales de audio (altavoz multicanal u otro), como se muestra en la figura 4 mediante el paso 401.
En algunas realizaciones, las señales de audio se procesan de alguna forma para generar las señales de audio de transporte como se muestra en la figura 4 mediante el paso 403.
La siguiente operación puede ser una de analizar espacialmente las señales (altavoz multicanal) para determinar los metadatos de dirección, como se muestra en la figura 4 mediante el paso 405.
A continuación, las relaciones de energía (por ejemplo, las relaciones de energía directa, difusa y restante) se determinan, como se muestra en la figura 4 mediante el paso 407.
En algunas modalidades, los metadatos y las señales de audio de transporte se procesan (comprimen/codifican). Por ejemplo, el número de direcciones y proporciones se controla además (y se puede seleccionar y/o combinar). El procesamiento de las señales de audio de metadatos/transporte se muestra en la figura 4 mediante el paso 409. Las señales de audio de transporte procesadas y los metadatos pueden combinarse además para generar un flujo de datos adecuado como se muestra en la figura 4 mediante el paso 411.
Con respecto a la figura 5, se muestra un procesador 101 de análisis ilustrativo adecuado para implementar algunas realizaciones con adiciones respecto al ejemplo proporcionado en la figura 3.
El procesador 101 de análisis ilustrativo se muestra de nuevo con la señal de audio de entrada proporcionada desde una fuente 301 de audio que también en este ejemplo es un dispositivo de captura espacial configurado para generar señales de audio multicanal desde múltiples micrófonos. Por ejemplo, la captura de una señal de audio espacial se puede realizar con cualquier dispositivo de captura conocido. Por ejemplo, son adecuados un teléfono móvil Eigenmike o Nokia 8. Como se describió anteriormente, la señal de audio multicanal (espacial) puede ser cualquier formato, tal como contenido mixto (p. ej., un formato de audio multicanal, tal como 5.1) y contenido ambisónico que pueda producir los parámetros de audio espacial relevantes.
Las señales de audio multicanal en este ejemplo se pasan a un generador 311 de señales (audio) de transporte. El generador 311 de señales de transporte similar al ejemplo en la figura 3 está configurado para generar las señales de audio de transporte según cualquiera de las opciones descritas anteriormente. Por ejemplo, las señales de transporte pueden mezclarse de manera descendente a partir de las señales de entrada. La cantidad de señales de audio de transporte puede ser cualquier cantidad y puede ser 2 o más o menos de 2.
En el ejemplo mostrado en la figura 5, las señales de audio multicanal también se introducen en una transformada 303 de tiempo-frecuencia. La transformada 303 de tiempo-frecuencia puede configurarse para generar representaciones de tiempo-frecuencia adecuadas de las señales de audio multicanal y pasarlas a un procesador 505 de banda de frecuencia.
El procesador 505 de banda de frecuencia está configurado para generar salidas de metadatos espaciales, como las que se muestran como las direcciones, las relaciones entre energía directa y total y, en algunas realizaciones, otros tipos de relaciones de energía, como la (las) relación(es) entre energía difusa y total y la (las) relación(es) entre energía restante y total.
La implementación del análisis puede ser cualquier implementación adecuada que produzca las salidas de metadatos descritas.
Por lo tanto, por ejemplo, en algunas realizaciones, el procesador 505 de banda de frecuencia comprende un analizador 307 de dirección configurado para generar los metadatos de dirección y un analizador 309 de relación de energía configurado para generar los metadatos de relación de energía.
Estos pueden determinarse realizando un análisis espacial en la señal de audio multicanal transformada en tiempofrecuencia.
Un ejemplo de análisis espacial puede ser, por ejemplo, el análisis espacial DirAC (codificación de audio direccional). DirAC puede estimar las direcciones y las relaciones de difusividad (información equivalente a un parámetro de relación directa a total) de una señal ambisónica de primer orden (FOA, por sus siglas en inglés), o su variante, la señal de formato B.
Las señales de se transforman en bandas de frecuencia, por ejemplo, mediante STFT, lo que da como resultado señales de tiempo-frecuencia w(k,n), x(k,n), y(k,n), z(k,n), donde k es el índice de bin de frecuencia y n es el índice de tiempo. DirAC estima el vector de intensidad mediante
donde Re significa parte real, y asterisco * significa conjugado complejo.
El parámetro de dirección es opuesto a la dirección de la parte real del vector de intensidad. El vector de intensidad puede promediarse a lo largo de varios índices de tiempo y/o frecuencia antes de la determinación del parámetro de dirección.
DirAC determina la difusividad como
La difusividad es un valor de relación que es 1 cuando el sonido es completamente ambiental, y 0 cuando el sonido es completamente direccional. De nuevo, todos los parámetros en la ecuación se promedian de forma típica con el tiempo y/o la frecuencia. El operador de expectativa E[ ] puede reemplazarse por un operador promedio en sistemas prácticos.
Cuando se promedian, los parámetros de difusividad (y dirección) de forma típica se determinan en bandas de frecuencia que combinan varios bins de frecuencia k, por ejemplo, aproximándose a la resolución de frecuencia de Bark.
DirAC, como se determinó anteriormente, es solo una de las opciones para determinar los metadatos direccionales y de relación, y claramente se pueden utilizar otros métodos para determinar los metadatos, por ejemplo, utilizando un algoritmo de captura de audio espacial (SPAC, por sus siglas en inglés) con señales de matriz de micrófonos (reales o simuladas). Además, también hay muchas variantes del análisis de DirAC en la literatura. Por ejemplo, cuando el contenido de entrada no es FOA, se puede realizar una modificación adecuada para convertir la señal en formato FOA para realizar el análisis. También se pueden aplicar otros métodos de análisis siempre que produzcan los metadatos de la relación direccional y de energía.
Los metadatos de dirección y relación de energía para todas las bandas de frecuencia analizadas se pasan entonces a un selector 521 de metadatos.
Además, la salida del analizador 309 de relación de energía se envía a un determinador 517 de factor de ponderación. Además, el procesador 505 de banda de frecuencia comprende un determinador 515 de energía normalizado configurado para generar una determinación de energía normalizada y pasarla a un determinador 517 de factor de ponderación y a un determinador 519 de límite de ponderación.
En algunas realizaciones, la determinación de energía normalizada puede realizarse como una operación de dos pasos. Un primer paso es calcular la energía promedio para cada banda de frecuencia en este instante de tiempo, por ejemplo, con la siguiente ecuación:
dondeNes el número de muestras de tiempo en este período de tiempo,KbyKtson los intervalos de frecuencia inferior y superior de la banda de frecuencia actual, eIes el número de canales de entrada en la señal.S(i,k,n)es la representación en el dominio de tiempo-frecuencia de la señal de transporte.
El segundo paso puede ser normalizar las energías promedio de cada banda de frecuencia para encontrar la energía más grande de cualquier banda de frecuencia y luego dividir todas las energías con el mayor valor de energía. Esto puede verse como que la energía más grande de una banda de frecuencia es (siempre) 1 y otras bandas de frecuencia tienen menos energía o se representan como una ecuación como:
En algunas realizaciones, se puede emplear cualquier método de normalización alternativo adecuado (p. ej., normalizar con la energía total en lugar de la energía más grande) y se puede utilizar, pero el parámetro límite (como se describe a continuación) está ajustado adecuadamente. Además, en algunas realizaciones se puede emplear energía no normalizada, pero el parámetro límite requiere un ajuste aún más cuidadoso.
El procesador 505 de banda de frecuencia en algunas realizaciones comprende además un determinador 517 de factores de ponderación configurado para recibir la energía normalizada y las relaciones de energía y determinar al menos un factor de ponderación que se envía al selector 521 de metadatos.
Con la energía normalizada conocida, el factor de ponderación puede determinarse basándose en el producto de la relación de energía y la energía normalizada en la banda de frecuencia. Por lo tanto, el factor de ponderación puede determinarse mediante la ecuación:
donderes el parámetro de relación de relación de energía.
Este factor de ponderación es un número entre 0 y 1. Será un valor muy alto cuando haya un inicio impulsivo direccional presente en la escena, ya que tanto la relación de energía como la energía normalizada serán altas. Del mismo modo, si no hay ningún inicio presente, estos valores tienden a ser más bajos para las frecuencias más altas. El uso del producto garantiza que, por ejemplo, una relación de energía normalizada alta pero baja energía (es decir, una fuerte reverberación) no produzca valores de ponderación altos, ya que la dirección y los metadatos en este caso no son los más representativos.
En algunas realizaciones, este factor de ponderación puede ser cualquier otro factor de ponderación adecuado, tal como solo el parámetro de relación de energíar.
El procesador 101 de análisis en algunas realizaciones comprende un determinador 519 de límite de ponderación configurado para recibir la determinación de energía normalizada y enviar un valor límite de ponderación al selector 521 de metadatos.
El límite de ponderación puede ser un valor constante (p. ej., 0,5) o puede basarse en la energía normalizada promedio de todas las bandas de frecuencia en el período de tiempo (p. ej., la energía normalizada promedio multiplicada por una constante como 0,5). Se prefiere la última opción y se forma de la siguiente manera:
donde c es una constante de umbral ajustada, tal como 0,5, y B es el número total de bandas de frecuencia.
En algunas modalidades, este límite de peso puede ser cualquier otro valor adecuado.
En algunas realizaciones, el procesador 101 de análisis comprende un selector 521 de metadatos configurado para recibir la salida del analizador 307 de dirección (metadatos de dirección para cada banda), el analizador 309 de relación de energía (metadatos de relación de energía para cada banda), el determinador 517 de factor de ponderación (factor de ponderación) y el determinador 519 de límite de ponderación. A continuación, el selector 521 de metadatos es configurado para seleccionar una de las direcciones y relaciones de energía basándose en el factor de ponderación y el límite del factor de ponderación y pasar los metadatos seleccionados a un codificador 513 de transmisión/almacenamiento.
El selector de metadatos puede configurarse para elegir o seleccionar la banda de frecuencia más alta que tiene un factor de ponderación por encima del límite de ponderación. Si por alguna razón ninguna banda tiene ponderación por encima del límite, el selector de metadatos en algunas realizaciones está configurado para seleccionar la banda de frecuencia más baja.
En algunas realizaciones, una vez que el selector de metadatos determina la banda de frecuencia seleccionada, puede configurarse para descartar los metadatos asociados con las otras bandas.
En algunas realizaciones, el selector de metadatos está configurado para priorizar y descartar solo parte de los metadatos. Por ejemplo, en algunas realizaciones, la información de dirección para las otras bandas se descarta, pero los parámetros de relación de energía se mantienen para todas las bandas de frecuencia.
En algunas modalidades, se seleccionan dos o más bandas de frecuencia (pero menos que el número total de bandas de frecuencia) para representar las otras bandas de frecuencia. Por ejemplo, se pueden seleccionar dos bandas de frecuencia de tal modo que se seleccionen dos bandas de frecuencia más altas (o N donde N es menor que el número total de bandas de frecuencia) con ponderaciones por encima del umbral (o límite de ponderación). A continuación, los parámetros asociados con la banda de frecuencia más alta seleccionada se utilizan para representar parámetros para las bandas de frecuencia por encima de ella, y los parámetros asociados con la banda de frecuencia más baja se utilizan para representar parámetros para las bandas de frecuencia por debajo de ella, y ambos se utilizan para representar las bandas de frecuencia entre ellas.
En algunas realizaciones, se selecciona la “mejor” banda de frecuencia, pero se emplea una técnica de codificación por diferencias para representar las otras bandas de frecuencia.
Por ejemplo, para cada banda de frecuencia:
• La dirección se puede codificar por separado para el acimut y la elevación
∘ El acimut tiene 2 bits y representa desplazamientos de 0°, 90°, 180° o 270° con respecto al acimut de la banda elegida
∘ La elevación tiene 2 bits y representa desplazamientos de 0°, 45° y -45° (no se utiliza un valor)
• Cada parámetro de relación tiene 2 bits y representa compensaciones de 0, 0,25, -0,25, - 0,5
En algunas modalidades, se usan unos pocos bits para señalar qué banda de frecuencia es la banda de referencia para la codificación por diferencia. El uso de este método sigue reduciendo significativamente la tasa de bits, pero ofrece una representación más precisa.
En algunas realizaciones, se selecciona la banda de frecuencia más alta y los metadatos asociados con la banda de frecuencia más alta se utilizan para “representar” todas las bandas de frecuencia. Su calidad es menos óptima, pero su implementación es más eficiente desde el punto de vista computacional.
El procesador de análisis 101 puede comprender además un codificador de transmisión/almacenamiento 513. El codificador 513 de transmisión/almacenamiento puede configurarse para combinar y codificar las señales de transporte, la dirección seleccionada y la relación de energía para generar el flujo 102 de datos.
Por ejemplo, en algunas realizaciones, el codificador 513 de transmisión/almacenamiento puede comprender un compresor/codificador de señales de transporte adecuado configurado para comprimir las señales de audio usando un códec adecuado (p. ej., AAC o EVS) y codificar metadatos utilizando métodos de codificación por entropía (p. ej., codificación de libro de códigos).
Con respecto a la figura 6 se muestra un diagrama de flujo de la operación del procesador de análisis que se muestra en la figura 5 (y adicionalmente el procesador de síntesis que se muestra en la figura 1).
La primera operación es una de obtener las señales de audio (altavoz multicanal u otro), como se muestra en la figura 6 mediante el paso 601.
Las señales de audio se pueden procesar mediante la aplicación de una transformación de tiempo-frecuencia como se muestra en la figura 6 mediante el paso 603.
En algunas realizaciones, las señales de audio en el dominio de tiempo-frecuencia se procesan de alguna forma para generar las señales de transporte como se muestra en la figura 6 mediante el paso 617.
Además, en algunas realizaciones, las señales de audio en el dominio de tiempo-frecuencia se procesan y se realiza un análisis espacial para determinar parámetros tales como la (s) dirección(es) (y/o distancia) y la (las) relación(es) de energía para cada banda, como se muestra en la figura 6 mediante el paso 607.
Además, en algunas realizaciones, las señales de audio en el dominio de tiempo-frecuencia se procesan y se calcula una energía normalizada por banda, como se muestra en la figura 6 mediante el paso 605.
Habiendo determinado la energía normalizada por banda y el análisis espacial, en algunas realizaciones el factor de ponderación por banda se forma o determina, como se muestra en la figura 6 mediante el paso 609.
También habiendo determinado la energía normalizada por banda en algunas realizaciones, el límite del factor de ponderación se forma o determina, como se muestra en la figura 6 mediante el paso 611.
Basándose en el factor de ponderación por banda y el límite del factor de ponderación, se elige una banda más alta con una ponderación por encima del límite, como se muestra en la figura 6 mediante el paso 613.
A continuación, los otros metadatos se descartan y los metadatos de la banda elegida se guardan, como se muestra en la figura 6 mediante el paso 615.
Los metadatos y las señales de transporte seleccionados se comprimen/codifican (y combinan) antes de almacenarse y/o transmitirse, como se muestra en la figura 6, mediante el paso 619.
Con respecto a las operaciones del procesador de síntesis, la señal transmitida/recuperada se decodifica y los metadatos se replican para todas las bandas de frecuencia, como se muestra en la figura 6 mediante el paso 621. A continuación, se realiza una síntesis espacial adecuada, como se muestra en la figura 6 mediante el paso 623. Como se ha descrito anteriormente, el formato de entrada de la señal de audio puede ser cualquier formato adecuado. Por ejemplo, con respecto a la figura 7, se muestra un diagrama de flujo de la operación de un codificador adecuado para codificar una señal de audio de transporte y metadatos obtenidos. En tal realización, el procesador de banda de frecuencia puede comprender solo el determinador de energía normalizado y el determinador del factor de ponderación a medida que se hayan determinado las relaciones de dirección y energía.
La primera operación es una de obtener las señales de audio de transporte y los metadatos, como se muestra en la figura 7 mediante el paso 701.
En este ejemplo, se han obtenido los parámetros tales como la (s) dirección(es) (y/o distancia) y la (las) relación(es) de energía para cada banda y se ha calculado una energía normalizada por banda como se muestra en la figura 7 mediante el paso 705.
Habiendo determinado la energía normalizada por banda y el análisis espacial, en algunas realizaciones el factor de ponderación por banda se forma o determina, como se muestra en la figura 7 mediante el paso 709.
También habiendo determinado la energía normalizada por banda en algunas realizaciones, el límite del factor de ponderación se forma o determina, como se muestra en la figura 7 mediante el paso 711.
Basándose en el factor de ponderación por banda y el límite del factor de ponderación, se elige la banda más alta con una ponderación por encima del límite, como se muestra en la figura 7 mediante el paso 713.
A continuación, los otros metadatos se descartan y los metadatos de la banda elegida se guardan, como se muestra en la figura 7 mediante el paso 715.
Los metadatos y las señales de transporte seleccionados se comprimen/codifican (y combinan) antes de almacenarse y/o transmitirse, como se muestra en la figura 7, mediante el paso 719.
Con respecto a las operaciones del procesador de síntesis, la señal transmitida/recuperada se decodifica y los metadatos se replican para todas las bandas de frecuencia, como se muestra en la figura 7 mediante el paso 721. A continuación, se realiza una síntesis espacial adecuada, como se muestra en la figura 7 mediante el paso 723. Con respecto a la figura 8, se muestra con más detalle una operación ilustrativa del selector de metadatos. La primera operación es iniciar y recibir las entradas, tales como factores de ponderación, límites de ponderación y parámetros, como se muestra en la figura 8 mediante el paso 801.
La siguiente operación es establecer un índice i=B, como se muestra en la figura 8 mediante el paso 803.
La siguiente operación es probar el factor de ponderación de índice wicontra el límite de ponderación wumbral, como se muestra en la figura 8 mediante el paso 803.
Si wi> wumbral, entonces la siguiente operación determina i es la banda de frecuencia seleccionada, como se muestra en la figura 8 mediante el paso 809, y a continuación finalizar la operación, como se muestra en la figura 8 mediante el paso 813.
Si wino es > wumbral, la siguiente operación es disminuir i en 1, como se muestra en la figura 8 mediante el paso 807. A continuación, habiendo disminuido i en 1, la siguiente operación es comprobar si i = 1, como se muestra en la figura 8 mediante el paso 811.
Si i=1, entonces la siguiente operación es determinar que i es la banda de frecuencia seleccionada, como se muestra en la figura 8 mediante el paso 809, y a continuación finalizar la operación, como se muestra en la figura 8 mediante el paso 813.
Cuando i no es = 1, la operación puede entonces probar el nuevo índice, el factor de ponderación de índice wicontra el límite de ponderación wumbral, como se muestra en la figura 8 mediante el paso 803, y el proceso puede continuar hasta wi> wumbral, para el índice o el índice = 1.
Lo anterior supone que la indexación de la banda de frecuencia comienza desde 1. Lo anterior se puede modificar para adaptarse a cualquier otro sistema de indexación (tal como empezar desde 0).
Con respecto al procesador de síntesis, los valores de metadatos de banda única pueden obtenerse y luego replicarse para todas las bandas de frecuencia. Esto da como resultado un conjunto completo normal de metadatos que se pueden utilizar en síntesis posteriores.
La operación de síntesis puede utilizar las señales de transporte y los metadatos replicados para generar una representación adecuada de las señales de audio. Este procedimiento puede realizarse utilizando cualquier medio adecuado, por ejemplo, con métodos tales como la síntesis de señales de audio espaciales basadas en DirAC. Un procedimiento ilustrativo para sintetizar señales de audio para altavoces es que las direcciones se sintetizan en direcciones específicas utilizando técnicas de panorámica 3D, como la panorámica de amplitud de base vectorial (VBAP, por sus siglas en inglés) multiplicada por , y la señal ambiental no direccional no se correlaciona con un
filtro de aleatorización de fase y se reproduce en todas las direcciones multiplicadas por donderes el parámetro de relación de energía y C es el número de canales del altavoz.
De tal manera, se pueden implementar algunas realizaciones que reducen el uso de la tasa de bits y, al mismo tiempo, ofrecen una calidad que, en muchos casos, es al menos razonable y puede ser casi transparente (y en muchos casos lo es) para una transmisión completa de metadatos con muchas señales. La reducción de la tasa de bits con el método principal es por un factor de B, donde B es el número original de bandas de frecuencia. Es decir, si la tasa de bits de los metadatos originales es de 5 kb/s y B = 5, entonces este método logra una tasa de bits de 1 kb/s.
Además, tales realizaciones pueden producir una señal que sea al menos tan buena o mejor que utilizar un análisis paramétrico de banda ancha única.
Además, en algunas realizaciones, la implementación es un método computacionalmente eficiente para reducir la tasa de bits, ya que solo requiere una determinación de las energías (esto ya suele ser parte del análisis) y los factores de ponderación y, a continuación, descartar los datos.
En algunas realizaciones, el almacenamiento de la transmisión espacial de sonido se puede lograr incluso a tasas de bits muy bajas.
Por ejemplo, un sistema de teleconferencia puede utilizar un audio espacial paramétrico, p. ej., DirAC, como método principal de análisis y síntesis. La captura espacial se puede obtener con un Eigenmike que produce ambisónicas de primer orden para este uso. El audio espacial se analiza en el dominio de tiempo-frecuencia (trama de 20 ms y 30 bandas de frecuencia) y produce parámetros de dirección como acimut y elevación, y un parámetro de relación de energía en forma de difusividad. En lugar de codificar estos parámetros utilizando un número determinado de bits por parámetro, es decir, 8 bits, para producir metadatos a una tasa de bits de 36 kb/s (antes de otra compresión), la aplicación de algunas realizaciones puede resultar en una tasa de bits de solo 1,2 kb/s para los metadatos (antes de otra compresión). Esto deja más bits para utilizar para la codificación de la señal de audio, lo que resulta directamente en una mejor calidad de audio percibida.
Otro ejemplo sería el uso de una resolución de tiempo-frecuencia, como un período de tiempo de 10 ms y 12 bandas de frecuencia, lo que daría como resultado las siguientes tasas de bits de comparación.24 kb/s en comparación con 2,4 kb/s según algunas modalidades.
Como la reducción de la tasa de bits de los metadatos es bastante grande, beneficia especialmente al caso de uso en donde el presupuesto de tasa de bits es muy bajo. Por ejemplo, 24 kb/s suele estar en el dominio de la mezcla descendente mono o estéreo muy comprimido si solo se utiliza codificación de audio sin procesar. Si los metadatos espaciales se introducen utilizando, por ejemplo, la segunda resolución de tiempo-frecuencia anterior, sería difícil ajustar todos los metadatos espaciales al presupuesto de tasa de bits, incluso después de codificarlos por entropía del 50 % (los metadatos tardarían 12 kb/s de los 24 kb/s disponibles). Sin embargo, utilizando las realizaciones presentadas, es posible reducir los metadatos hasta una quinta parte y, en este caso, logramos una división muy razonable de la tasa de bits después de la codificación por entropía (1,2 kb/s para los metadatos, 22,8 kb/s para el audio), ofreciendo por lo tanto un audio espacial completo incluso a tasas de bits bajas en lugar de mono o estéreo. Esto significa que a tasas de bits bajas, es posible lograr un aumento significativo de la calidad del sonido en comparación con el envío de metadatos completos.
Con respecto a la Figura 9, se muestra un dispositivo electrónico de ejemplo que puede usarse como dispositivo de análisis o síntesis. El dispositivo puede ser cualquier dispositivo o aparato electrónico adecuado. Por ejemplo, en algunas realizaciones, el dispositivo 1900 es un dispositivo móvil, un equipo de usuario, un ordenador de tipo tableta, un ordenador, un aparato de reproducción de audio, etc.
En algunas realizaciones, el dispositivo 1900 comprende al menos un procesador o unidad 1907 de procesamiento central. El procesador 1907 puede estar configurado para ejecutar diversos códigos de programa tales como los métodos tales como los descritos en la presente memoria.
En algunas realizaciones, el dispositivo 1900 comprende una memoria 1911. En algunas realizaciones, el al menos un procesador 1907 está acoplado a la memoria 1911. La memoria 1911 puede ser cualquier medio de almacenamiento adecuado. En algunas realizaciones, la memoria 1911 comprende una sección de código de programa para almacenar códigos de programa que pueden implementarse en el procesador 1907. Además, en algunas realizaciones, la memoria 1911 puede comprender además una sección de datos almacenados para almacenar datos, por ejemplo datos que se han procesado o que van a procesarse según las realizaciones como se describe en la presente memoria. El código de programa implementado almacenado dentro de la sección de código de programa y los datos almacenados dentro de la sección de datos almacenados pueden recuperarse por el procesador 1907 siempre que sea necesario a través del acoplamiento de memoria-procesador.
En algunas realizaciones, el dispositivo 1900 comprende una interfaz 1905 de usuario. En algunas realizaciones, la interfaz 1905 de usuario puede estar acoplada al procesador 1907. En algunas realizaciones, el procesador 1907 puede controlar el funcionamiento de la interfaz 1905 de usuario y recibir entradas de la interfaz 1905 de usuario. En algunas realizaciones, la interfaz 1905 de usuario puede permitir que un usuario introduzca comandos al dispositivo 1900, por ejemplo, a través de un teclado. En algunas realizaciones, la interfaz 1905 de usuario puede permitir que el usuario obtenga información a partir del dispositivo 1900. Por ejemplo, la interfaz 1905 de usuario puede comprender un elemento de visualización configurado para visualizar información del dispositivo 1900 al usuario. En algunas realizaciones, la interfaz 1905 de usuario puede comprender una pantalla táctil o una interfaz táctil que puede tanto permitir introducir información al dispositivo 1900 como visualizar adicionalmente información al usuario del dispositivo 1900.
En algunas realizaciones, el dispositivo 1900 comprende un puerto 1909 de entrada/salida. En algunas realizaciones, el puerto 1909 de entrada/salida comprende un transceptor. En tales realizaciones, el transceptor puede estar acoplado al procesador 1907 y configurado para permitir una comunicación con otros aparatos o dispositivos electrónicos, por ejemplo, a través de una red de comunicación inalámbrica. En algunas realizaciones, el transceptor o cualquier transceptor o medios de transmisor y/o receptor adecuado puede estar configurado para comunicarse con otros dispositivos o aparatos electrónicos a través de un cable o acoplamiento por cable.
El transceptor puede comunicarse con un aparato adicional mediante cualquier protocolo de comunicaciones conocido adecuado. Por ejemplo, en algunas realizaciones, el transceptor o medios de transceptor, pueden utilizar un protocolo adecuado del sistema universal de telecomunicaciones móviles (UMTS), un protocolo de red de área local inalámbrica (WLAN), tal como, por ejemplo, IEEE 802.X, un protocolo adecuado de comunicación por radiofrecuencia de corto alcance, tal como Bluetooth, o una ruta de comunicación de datos por infrarrojos (IRDA).
El puerto 1909 de entrada/salida del transceptor puede estar configurado para recibir las señales de altavoz (u otras señales de audio de formato de entrada) y, en algunas realizaciones, determinar los parámetros como se describe en la presente memoria mediante el uso del procesador 1907 que ejecuta un código adecuado. Además, el dispositivo puede generar una salida de señal de transporte y de parámetros adecuada que va a transmitirse al dispositivo de síntesis.
En algunas realizaciones, el dispositivo 1900 puede emplearse como al menos parte del dispositivo de síntesis. Como tal, el puerto 1909 de entrada/salida puede estar configurado para recibir las señales de transporte y, en algunas realizaciones, los parámetros determinados en el dispositivo de captación o dispositivo de procesamiento como se describe en la presente memoria, y generar una salida de formato de señal de audio adecuada mediante el uso del procesador 1907 que ejecuta un código adecuado. El puerto 1909 de entrada/salida puede acoplarse a cualquier salida de audio adecuada, por ejemplo, a un sistema de altavoces multicanal y/o auriculares o similar.
En general, las diversas realizaciones de la invención pueden implementarse en hardware o circuitos de propósito especial, software, lógica o cualquier combinación de los mismos. Por ejemplo, algunos aspectos pueden implementarse en hardware, mientras que otros aspectos pueden implementarse en firmware o software que puede ejecutarse por un controlador, microprocesador u otro dispositivo informático, aunque la invención no se limita a los mismos. Aunque diversos aspectos de la invención pueden ilustrarse y describirse como diagramas de bloques, diagramas de flujo, o usando alguna otra representación gráfica, se entiende que estos bloques, aparatos, sistemas, técnicas o métodos descritos en la presente memoria pueden estar implementados, como ejemplos no limitativos, en hardware, software, firmware, circuitos o lógica de propósito especial, hardware de propósito general o controlador u otros dispositivos informáticos, o alguna combinación de los mismos.
Las realizaciones de esta invención pueden implementarse mediante software informático ejecutable por un procesador de datos del dispositivo móvil, tal como en la entidad de procesador, o mediante hardware, o mediante una combinación de software y hardware. Además, en este sentido, cabe señalar que cualesquiera bloques del flujo lógico como en las figuras puede representar etapas del programa, o circuitos lógicos interconectados, bloques y funciones, o una combinación de etapas de programa y circuitos lógicos, bloques y funciones. El software puede almacenarse en medios físicos tales como chips de memoria, o bloques de memoria implementados dentro del procesador, medios magnéticos tales como disco duro o disquetes, y medios ópticos tales como, por ejemplo, DVD y sus variantes de datos, CD.
La memoria puede ser de cualquier tipo adecuado para el entorno técnico local y puede implementarse usando cualquier tecnología de almacenamiento de datos adecuada, tal como dispositivos de memoria basados en semiconductores, dispositivos y sistemas de memoria magnéticos, dispositivos y sistemas de memoria ópticos, memoria fija y memoria extraíble. Los procesadores de datos pueden ser de cualquier tipo adecuado para el entorno técnico local, y pueden incluir uno o más de ordenadores de propósito general, ordenadores de propósito especial, microprocesadores, digital signal processors (procesadores de señales digitales - DSP), application specific integrated circuits (circuitos integrados específicos de aplicación - ASIC), circuitos de nivel de puerta y procesadores basados en arquitectura de procesador de múltiples núcleos, como ejemplos no limitativos.
Las realizaciones de las invenciones pueden ponerse en práctica en diversos componentes tales como módulos de circuito integrado. El diseño de circuitos integrados es, en gran medida, un proceso altamente automatizado. Hay herramientas de software complejas y potentes disponibles para convertir un diseño de nivel lógico en un diseño de circuito de semiconductores listo para grabarse y formarse en un sustrato semiconductor.
Los programas, tales como los proporcionados por Synopsys, Inc. de Mountain View, California y Cadence Design, de San Jose, California, enrutan automáticamente conductores y localizan componentes en un chip de semiconductor usando reglas de diseño bien establecidas, así como bibliotecas de módulos de diseño previamente almacenados. Una vez que se ha completado el diseño para un circuito de semiconductor, el diseño resultante, en un formato electrónico normalizado (p. ej., Opus, GDSII o similar) puede transmitirse a una instalación de fabricación de semiconductores o “fab” para su fabricación.
La descripción anterior ha proporcionado, a modo de ejemplo y como ejemplos no limitativos, una descripción completa e informativa de la realización ilustrativa de esta invención. Sin embargo, diversas modificaciones y adaptaciones pueden resultar evidentes para los expertos en las técnicas relevantes a la vista de la descripción anterior, cuando se lee junto con los dibujos adjuntos y las reivindicaciones adjuntas. Sin embargo, todas estas modificaciones y similares de las enseñanzas de la presente invención seguirán estando dentro del alcance de la presente invención como se define en las reivindicaciones adjuntas.
Claims (14)
1. Un aparato que comprende medios configurados para:
obtener (301) al menos una señal de audio;
obtener (505) al menos un parámetro para las al menos dos bandas de frecuencia respectivas asociadas con la al menos una señal de audio;
el aparato estácaracterizado por quelos medios están configurados además para: seleccionar una banda de frecuencia de las al menos dos bandas de frecuencia basándose en comparar al menos un parámetro adicional para las al menos dos bandas de frecuencia respectivas, en donde el al menos un parámetro adicional se determina a partir de las al menos dos bandas de frecuencia respectivas, en donde los medios para seleccionar la banda de frecuencia de las al menos dos bandas de frecuencia son para:
seleccionar al menos un parámetro para la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia; y
descartar cualquier otro del al menos un parámetro para las al menos dos bandas de frecuencia; y
generar (513) una salida que comprende una selección del al menos un parámetro asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia, en donde la salida comprende el al menos un parámetro seleccionado para la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia y no el otro parámetro descartado de al menos un parámetro para las al menos dos bandas de frecuencia, de tal modo que la selección del al menos un parámetro asociado con la banda de frecuencia seleccionada está configurada para reducir una tasa de bits o un tamaño de la salida y en donde al menos un parámetro de la banda de frecuencia seleccionada está configurado para representar los parámetros respectivos de las al menos dos bandas de frecuencia.
2. El aparato según la reivindicación 1, en donde los medios para obtener el al menos un parámetro es además para obtener una relación (309) de energía y una energía (515) respectivamente para cada una de las al menos dos bandas de frecuencia, y en donde los medios para seleccionar la banda de frecuencia de las al menos dos bandas de frecuencia son además para:
determinar (517) un factor de ponderación de energía para las al menos dos bandas de frecuencia respectivas, basándose en la relación de energía y la energía, para las al menos dos bandas de frecuencia respectivas, en donde el factor de ponderación de energía es el al menos un parámetro adicional para las al menos dos bandas de frecuencia respectivas;
determinar (519) un factor de límite de ponderación basándose en una energía promediada; comparar el factor de ponderación de energía para al menos dos bandas de frecuencia respectivas con el factor límite de ponderación; y
seleccionar una banda de frecuencia más alta donde el factor de ponderación de energía sea mayor que el factor de límite de ponderación.
3. El aparato según la reivindicación 1, en donde los medios para seleccionar una banda de frecuencia de las al menos dos bandas de frecuencia sirven además para seleccionar una banda de frecuencia más alta de las al menos dos bandas de frecuencia.
4. El aparato según cualquiera de las reivindicaciones 1 a 3, en donde los medios para obtener (505), respectivamente, el al menos un parámetro para las al menos dos bandas de frecuencia sirven además para obtener al menos una de:
un parámetros direccional (307);
un parámetro de distancia;
un parámetro de energía; y
un parámetro de relación de energía.
5. El aparato según cualquiera de las reivindicaciones 1 a 4, en donde los medios son además para generar (311) al menos una señal de audio de transporte basándose en la al menos una señal de audio y en donde los medios para generar la salida (513) son además para generar un flujo de datos para almacenamiento/transmisión basándose en una combinación de el al menos un parámetro y la al menos una señal de audio de transporte.
6. El aparato según la reivindicación 5, en donde los medios para generar el flujo de datos para almacenamiento/transmisión son además para al menos uno de:
codificar la al menos una señal de audio de transporte;
codificar al menos un parámetro asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia; y
combinar la señal de audio de transporte codificada y el al menos un parámetro codificado asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia.
7. El aparato según cualquiera de las reivindicaciones 5 y 6, en donde los medios para generar la al menos una señal de audio de transporte son adicionales para al menos una de:
mezclar de manera descendente la al menos una señal de audio;
seleccionar al menos una señal de audio de la al menos una señal de audio, cuando la al menos una señal de audio comprende dos o más señales de audio;
generar señales direccionales dirigidas a diferentes direcciones, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden;
generar señales cardioides dirigidas a diferentes direcciones, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden;
generar señales cardioides dirigidas en direcciones opuestas, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden; y
hacer pasar la al menos una señal de audio de transporte, cuando la al menos una señal de audio comprende la al menos una señal de audio de transporte.
8. Un método que comprende:
obtener (601) al menos una señal de audio;
obtener (607, 605) al menos un parámetro para las al menos dos bandas de frecuencia respectivas asociadas con la al menos una señal de audio; estando el métodocaracterizado por quecomprende, además:
seleccionar una banda de frecuencia de las al menos dos bandas de frecuencia basándose en la comparación de al menos otro parámetro para las al menos dos bandas de frecuencia respectivas, en donde seleccionar la banda de frecuencia de las al menos dos bandas de frecuencia comprende, además:
seleccionar (615) el al menos un parámetro para la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia; y
descartar (615) cualquier otro del al menos un parámetro para las al menos dos bandas de frecuencia; y
generar una salida que comprende una selección del al menos un parámetro asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia, en donde la salida comprende el al menos un parámetro seleccionado para la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia y no el otro parámetro descartado del al menos un parámetro para las al menos dos bandas de frecuencia, de tal modo que la selección del al menos un parámetro asociado con la banda de frecuencia seleccionada está configurada para reducir la tasa de bits o el tamaño de la salida y en donde al menos un parámetro de la banda de frecuencia seleccionada está configurado para representar los parámetros respectivos de las al menos dos bandas de frecuencia.
9. El método según la reivindicación 8, en donde obtener el al menos un parámetro comprende además obtener una relación (309) de energía y energía (515) respectivamente para cada una de las al menos dos bandas de frecuencia, y en donde seleccionar la banda de frecuencia de las al menos dos bandas de frecuencia comprende, además:
determinar (517) un factor de ponderación de energía para al menos dos bandas de frecuencia respectivas basándose en la relación de energía y la energía para las al menos dos bandas de frecuencia respectivas, en donde el factor de ponderación de energía es el al menos un parámetro adicional para las al menos dos bandas de frecuencia respectivas;
determinar (519) un factor de límite de ponderación basándose en una energía promediada; comparar el factor de ponderación de energía para al menos dos bandas de frecuencia respectivas con el factor límite de ponderación; y
seleccionar una banda de frecuencia más alta donde el factor de ponderación de energía sea mayor que el factor de límite de ponderación.
10. El método según la reivindicación 9, en donde seleccionar una banda de frecuencia de las al menos dos bandas de frecuencia comprende además seleccionar una banda de frecuencia más alta de las al menos dos bandas de frecuencia.
11. El método según cualquiera de las reivindicaciones 8 a 10, en donde obtener respectivamente el al menos un parámetro para las al menos dos bandas de frecuencia comprende además obtener al menos una de:
un parámetro direccional;
un parámetro de distancia;
un parámetro de energía; y
un parámetro de relación de energía.
12. El método según cualquiera de las reivindicaciones 8 a 11, que comprende además generar al menos una señal de audio de transporte basándose en la al menos una señal de audio y en donde generar la salida comprende además generar un flujo de datos para almacenamiento/transmisión basándose en una combinación del al menos un parámetro y la al menos una señal de audio de transporte.
13. El método según la reivindicación 12, en donde generar el flujo de datos para almacenamiento/transmisión comprende además al menos uno de:
codificar la al menos una señal de audio de transporte;
codificar al menos un parámetro asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia; y
combinar la señal de audio de transporte codificada y el al menos un parámetro codificado asociado con la banda de frecuencia seleccionada de las al menos dos bandas de frecuencia.
14. El método según cualquiera de las reivindicaciones 12 y 13, en donde generar la al menos una señal de audio de transporte comprende además al menos una de:
mezclar de manera descendente la al menos una señal de audio;
seleccionar al menos una señal de audio de la al menos una señal de audio, cuando la al menos una señal de audio comprende dos o más señales de audio;
generar señales direccionales dirigidas a diferentes direcciones, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden;
generar señales cardioides dirigidas a diferentes direcciones, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden;
generar señales cardioides dirigidas en direcciones opuestas, cuando al menos una señal de audio comprende señales de audio ambisónicas de primer orden; y
hacer pasar al menos una señal de audio de transporte, cuando la al menos una señal de audio comprende la al menos una señal de audio de transporte.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| GB1814227.3A GB2576769A (en) | 2018-08-31 | 2018-08-31 | Spatial parameter signalling |
| PCT/FI2019/050581 WO2020043935A1 (en) | 2018-08-31 | 2019-08-08 | Spatial parameter signalling |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES3037973T3 true ES3037973T3 (en) | 2025-10-08 |
Family
ID=63920928
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES19855639T Active ES3037973T3 (en) | 2018-08-31 | 2019-08-08 | Spatial parameter signalling |
Country Status (7)
| Country | Link |
|---|---|
| US (2) | US12327569B2 (es) |
| EP (2) | EP4598061A3 (es) |
| CN (2) | CN112970062B (es) |
| ES (1) | ES3037973T3 (es) |
| GB (1) | GB2576769A (es) |
| PL (1) | PL3844748T3 (es) |
| WO (1) | WO2020043935A1 (es) |
Families Citing this family (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| MX2021006572A (es) | 2018-12-07 | 2021-08-11 | Fraunhofer Ges Forschung | Aparato, metodo y programa de computadora para codificacion, decodificacion, procesamiento de escenas y otros procedimientos relacionados con codificacion de audio espacial basada en dirac que utiliza generadores de componentes de bajo, medio y alto orden. |
| BR112021014135A2 (pt) * | 2019-01-21 | 2021-09-21 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Sinal de áudio codificado, aparelho e método para codificação de uma representação de áudio espacial ou aparelho e método para decodificação de um sinal de áudio codificado |
| US12073842B2 (en) * | 2019-06-24 | 2024-08-27 | Qualcomm Incorporated | Psychoacoustic audio coding of ambisonic audio data |
| GB2598932A (en) * | 2020-09-18 | 2022-03-23 | Nokia Technologies Oy | Spatial audio parameter encoding and associated decoding |
| CN116762127A (zh) * | 2020-12-15 | 2023-09-15 | 诺基亚技术有限公司 | 量化空间音频参数 |
Family Cites Families (29)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| SE0202159D0 (sv) | 2001-07-10 | 2002-07-09 | Coding Technologies Sweden Ab | Efficientand scalable parametric stereo coding for low bitrate applications |
| JP4676140B2 (ja) * | 2002-09-04 | 2011-04-27 | マイクロソフト コーポレーション | オーディオの量子化および逆量子化 |
| US7899191B2 (en) | 2004-03-12 | 2011-03-01 | Nokia Corporation | Synthesizing a mono audio signal |
| JP4917039B2 (ja) | 2004-10-28 | 2012-04-18 | ディーティーエス ワシントン,エルエルシー | 音響空間環境エンジン |
| US7991610B2 (en) * | 2005-04-13 | 2011-08-02 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Adaptive grouping of parameters for enhanced coding efficiency |
| US7961890B2 (en) * | 2005-04-15 | 2011-06-14 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung, E.V. | Multi-channel hierarchical audio coding with compact side information |
| US7831434B2 (en) * | 2006-01-20 | 2010-11-09 | Microsoft Corporation | Complex-transform channel coding with extended-band frequency coding |
| US9159333B2 (en) * | 2006-06-21 | 2015-10-13 | Samsung Electronics Co., Ltd. | Method and apparatus for adaptively encoding and decoding high frequency band |
| CN100419790C (zh) * | 2006-09-30 | 2008-09-17 | 中山大学 | 一种带参变量的数据分解重构方法 |
| US7885819B2 (en) | 2007-06-29 | 2011-02-08 | Microsoft Corporation | Bitstream syntax for multi-process audio decoding |
| JP5267362B2 (ja) | 2009-07-03 | 2013-08-21 | 富士通株式会社 | オーディオ符号化装置、オーディオ符号化方法及びオーディオ符号化用コンピュータプログラムならびに映像伝送装置 |
| CN102714036B (zh) * | 2009-12-28 | 2014-01-22 | 松下电器产业株式会社 | 语音编码装置和语音编码方法 |
| ES2553398T3 (es) | 2010-11-03 | 2015-12-09 | Huawei Technologies Co., Ltd. | Codificador paramétrico para codificar una señal de audio multicanal |
| EP2450880A1 (en) | 2010-11-05 | 2012-05-09 | Thomson Licensing | Data structure for Higher Order Ambisonics audio data |
| KR101606665B1 (ko) * | 2012-04-05 | 2016-03-25 | 후아웨이 테크놀러지 컴퍼니 리미티드 | 파라미터 공간 오디오 코딩 및 디코딩을 위한 방법, 파라미터 공간 오디오 코더 및 파라미터 공간 오디오 디코더 |
| US9570081B2 (en) * | 2012-04-26 | 2017-02-14 | Nokia Technologies Oy | Backwards compatible audio representation |
| CN103778918B (zh) | 2012-10-26 | 2016-09-07 | 华为技术有限公司 | 音频信号的比特分配的方法和装置 |
| TWI618051B (zh) * | 2013-02-14 | 2018-03-11 | 杜比實驗室特許公司 | 用於利用估計之空間參數的音頻訊號增強的音頻訊號處理方法及裝置 |
| US9715880B2 (en) * | 2013-02-21 | 2017-07-25 | Dolby International Ab | Methods for parametric multi-channel encoding |
| US9659569B2 (en) * | 2013-04-26 | 2017-05-23 | Nokia Technologies Oy | Audio signal encoder |
| WO2014191793A1 (en) | 2013-05-28 | 2014-12-04 | Nokia Corporation | Audio signal encoder |
| CN104282309A (zh) * | 2013-07-05 | 2015-01-14 | 杜比实验室特许公司 | 丢包掩蔽装置和方法以及音频处理系统 |
| US10163447B2 (en) * | 2013-12-16 | 2018-12-25 | Qualcomm Incorporated | High-band signal modeling |
| CN103824557B (zh) * | 2014-02-19 | 2016-06-15 | 清华大学 | 一种具有自定义功能的音频检测分类方法 |
| WO2015150384A1 (en) * | 2014-04-01 | 2015-10-08 | Dolby International Ab | Efficient coding of audio scenes comprising audio objects |
| CN103928030B (zh) | 2014-04-30 | 2017-03-15 | 武汉大学 | 基于子带空间关注测度的可分级音频编码系统及方法 |
| US10049684B2 (en) * | 2015-04-05 | 2018-08-14 | Qualcomm Incorporated | Audio bandwidth selection |
| FR3048808A1 (fr) * | 2016-03-10 | 2017-09-15 | Orange | Codage et decodage optimise d'informations de spatialisation pour le codage et le decodage parametrique d'un signal audio multicanal |
| CN106023999B (zh) | 2016-07-11 | 2019-06-11 | 武汉大学 | 用于提高三维音频空间参数压缩率的编解码方法及系统 |
-
2018
- 2018-08-31 GB GB1814227.3A patent/GB2576769A/en not_active Withdrawn
-
2019
- 2019-08-08 CN CN201980070712.1A patent/CN112970062B/zh active Active
- 2019-08-08 WO PCT/FI2019/050581 patent/WO2020043935A1/en not_active Ceased
- 2019-08-08 EP EP25182792.9A patent/EP4598061A3/en active Pending
- 2019-08-08 CN CN202411391576.5A patent/CN119252267A/zh active Pending
- 2019-08-08 US US17/270,354 patent/US12327569B2/en active Active
- 2019-08-08 EP EP19855639.1A patent/EP3844748B1/en active Active
- 2019-08-08 PL PL19855639.1T patent/PL3844748T3/pl unknown
- 2019-08-08 ES ES19855639T patent/ES3037973T3/es active Active
-
2025
- 2025-05-01 US US19/196,641 patent/US20250259636A1/en active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| EP4598061A3 (en) | 2025-09-03 |
| CN112970062B (zh) | 2024-10-18 |
| GB2576769A (en) | 2020-03-04 |
| EP3844748A1 (en) | 2021-07-07 |
| EP3844748B1 (en) | 2025-07-23 |
| EP3844748A4 (en) | 2022-06-01 |
| US20210319799A1 (en) | 2021-10-14 |
| PL3844748T3 (pl) | 2025-09-15 |
| CN112970062A (zh) | 2021-06-15 |
| GB201814227D0 (en) | 2018-10-17 |
| EP4598061A2 (en) | 2025-08-06 |
| WO2020043935A1 (en) | 2020-03-05 |
| US20250259636A1 (en) | 2025-08-14 |
| CN119252267A (zh) | 2025-01-03 |
| US12327569B2 (en) | 2025-06-10 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES3064493T3 (en) | The merging of spatial audio parameters | |
| ES2922532T3 (es) | Codificador de escena de audio, decodificador de escena de audio y procedimientos relacionados que utilizan el análisis espacial híbrido de codificador / decodificador | |
| JP7223872B2 (ja) | 空間音声パラメータの重要度の決定および関連符号化 | |
| ES2339888T3 (es) | Codificacion y decodificacion de audio. | |
| CN117560615A (zh) | 目标空间音频参数和相关联的空间音频播放的确定 | |
| EP3844748B1 (en) | Spatial parameter signalling | |
| US12452619B2 (en) | Spatial audio representation and rendering | |
| EP3818730A1 (en) | Energy-ratio signalling and synthesis | |
| US20210250717A1 (en) | Spatial audio Capture, Transmission and Reproduction | |
| US20250157475A1 (en) | Parametric spatial audio rendering | |
| US20250349303A1 (en) | Spatial audio parameter encoding and associated decoding | |
| US20230410823A1 (en) | Spatial audio parameter encoding and associated decoding | |
| GB2582748A (en) | Sound field related rendering | |
| CN116547749B (zh) | 音频参数的量化 | |
| US20250210049A1 (en) | Parametric spatial audio encoding | |
| JP2026509128A (ja) | 空間オーディオのオーディオレンダリング |