ES2808096T3 - Método y aparato para el control adaptativo de los filtros de decorrelación - Google Patents
Método y aparato para el control adaptativo de los filtros de decorrelación Download PDFInfo
- Publication number
- ES2808096T3 ES2808096T3 ES17803944T ES17803944T ES2808096T3 ES 2808096 T3 ES2808096 T3 ES 2808096T3 ES 17803944 T ES17803944 T ES 17803944T ES 17803944 T ES17803944 T ES 17803944T ES 2808096 T3 ES2808096 T3 ES 2808096T3
- Authority
- ES
- Spain
- Prior art keywords
- decorrelation
- length
- control parameter
- parameter
- audio
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 238000000034 method Methods 0.000 title claims abstract description 47
- 230000003044 adaptive effect Effects 0.000 title description 6
- 230000005236 sound signal Effects 0.000 claims abstract description 20
- 238000003672 processing method Methods 0.000 claims abstract description 5
- 230000006870 function Effects 0.000 claims description 14
- 238000004590 computer program Methods 0.000 claims description 7
- 230000006978 adaptation Effects 0.000 claims description 5
- 238000004458 analytical method Methods 0.000 claims description 4
- 230000001427 coherent effect Effects 0.000 description 12
- 238000009499 grossing Methods 0.000 description 9
- 230000015572 biosynthetic process Effects 0.000 description 5
- 230000008569 process Effects 0.000 description 5
- 238000012545 processing Methods 0.000 description 5
- 238000003786 synthesis reaction Methods 0.000 description 5
- 230000005540 biological transmission Effects 0.000 description 4
- 238000010586 diagram Methods 0.000 description 4
- 238000001914 filtration Methods 0.000 description 4
- 239000011159 matrix material Substances 0.000 description 4
- 239000000203 mixture Substances 0.000 description 4
- 238000004364 calculation method Methods 0.000 description 3
- 230000008859 change Effects 0.000 description 3
- 238000005259 measurement Methods 0.000 description 3
- 238000002156 mixing Methods 0.000 description 3
- 230000003595 spectral effect Effects 0.000 description 3
- 239000002131 composite material Substances 0.000 description 2
- 238000005314 correlation function Methods 0.000 description 2
- 230000007423 decrease Effects 0.000 description 2
- 238000005516 engineering process Methods 0.000 description 2
- 238000012986 modification Methods 0.000 description 2
- 230000004048 modification Effects 0.000 description 2
- 230000008447 perception Effects 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 230000002123 temporal effect Effects 0.000 description 2
- 238000012935 Averaging Methods 0.000 description 1
- 241001025261 Neoraja caerulea Species 0.000 description 1
- 230000003190 augmentative effect Effects 0.000 description 1
- 230000006399 behavior Effects 0.000 description 1
- 230000009286 beneficial effect Effects 0.000 description 1
- ZYXYTGQFPZEUFX-UHFFFAOYSA-N benzpyrimoxan Chemical compound O1C(OCCC1)C=1C(=NC=NC=1)OCC1=CC=C(C=C1)C(F)(F)F ZYXYTGQFPZEUFX-UHFFFAOYSA-N 0.000 description 1
- 230000008878 coupling Effects 0.000 description 1
- 238000010168 coupling process Methods 0.000 description 1
- 238000005859 coupling reaction Methods 0.000 description 1
- 238000000354 decomposition reaction Methods 0.000 description 1
- 230000003247 decreasing effect Effects 0.000 description 1
- 230000001934 delay Effects 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
- 238000009472 formulation Methods 0.000 description 1
- 238000012805 post-processing Methods 0.000 description 1
- 238000009877 rendering Methods 0.000 description 1
- 230000013707 sensory perception of sound Effects 0.000 description 1
- 238000012546 transfer Methods 0.000 description 1
- 230000007704 transition Effects 0.000 description 1
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S5/00—Pseudo-stereo systems, e.g. in which additional channel signals are derived from monophonic signals by means of phase shifting, time delay or reverberation
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/008—Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/26—Pre-filtering or post-filtering
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
- G10L25/81—Detection of presence or absence of voice signals for discriminating voice from music
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S3/00—Systems employing more than two channels, e.g. quadraphonic
- H04S3/008—Systems employing more than two channels, e.g. quadraphonic in which the audio signals are in digital form, i.e. employing more than two discrete digital channels
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/01—Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/03—Application of parametric coding in stereophonic audio systems
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/07—Synergistic effects of band splitting and sub-band processing
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Signal Processing (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Human Computer Interaction (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- Mathematical Physics (AREA)
- Stereophonic System (AREA)
- Circuit For Audible Band Transducer (AREA)
- Filters That Use Time-Delay Elements (AREA)
Abstract
Un método de procesamiento de señal de audio (500, 600) realizado por un decodificador de audio, para ajustar adaptativamente un decodificador, comprendiendo el método: obtener (501, 601) un parámetro de control; calcular (502, 602) la media del parámetro de control; calcular (504, 604) la variación del parámetro de control; calcular (506, 606) relación de la variación y la media del parámetro de control; y calcular (508, 608) un parámetro de decorrelación basado en dicha relación.
Description
DESCRIPCIÓN
Método y aparato para el control adaptativo de los filtros de decorrelación
Campo técnico
La presente solicitud se refiere a la codificación y composición (rendering, en inglés) de audio espacial.
Antecedentes
El audio espacial o 3D es una formulación genérica, que designa diversos tipos de señales de audio de múltiples canales. Dependiendo de los métodos de captura y composición, la escena de audio está representada mediante un formato de audio espacial. Los formatos de audio espacial habituales definidos por el método de captura (micrófonos) se designan, por ejemplo, como estéreo, binaural, ambisónico, etc. Los sistemas de reproducción de audio espacial (auriculares o altavoces) pueden representar escenas de audio espacial con señales de audio de múltiples canales estéreo (canales 2.0 izquierdo y derecho) o más avanzadas (2.1,5.1,7.1, etc.).
Las recientes tecnologías para la transmisión y manipulación de dichas señales de audio permiten al usuario final tener una experiencia de audio mejorada con una mayor calidad espacial, lo que a menudo resulta en una mejor inteligibilidad, así como en una realidad aumentada. Las técnicas de codificación de audio espacial, tales como MPEG de Sonido envolvente (Surround, en inglés) o MPEG-H 3D Audio, generan una representación compacta de señales de audio espacial que es compatible con aplicaciones de limitación de la velocidad de datos, tales como la transmisión por Internet, por ejemplo. Sin embargo, la transmisión de señales de audio espacial está limitada cuando la limitación de la velocidad de datos es fuerte y, por lo tanto, también se utiliza el procesamiento posterior de los canales de audio decodificados para mejorar la reproducción de audio espacial. Las técnicas de uso común son, por ejemplo, capaces de mezclar a ciegas señales mono o estéreo decodificadas en audio de múltiples canales (canales 5.1 o más).
Con el fin de representar de manera eficiente escenas de audio espacial, las tecnologías de codificación y procesamiento de audio espacial hacen uso de las características espaciales de la señal de audio de múltiples canales. En particular, las diferencias de tiempo y nivel entre los canales de la captura de audio espacial se utilizan para aproximar las señales inter-aurales, que caracterizan nuestra percepción de los sonidos direccionales en el espacio. Puesto que las diferencias de tiempo y nivel entre canales son solo una aproximación de lo que el sistema auditivo puede detectar (es decir, las diferencias de tiempo y nivel entre canales en las entradas del oído), es de gran importancia que la diferencia de tiempo entre canales sea relevante desde un aspecto perceptivo. Las diferencias de tiempo y nivel entre canales (ICTD, InterChannel Time Difference e ICLD, Inter-Channel Level Difference) se utilizan comúnmente para modelizar las componentes direccionales de las señales de audio de múltiples canales, mientras que la correlación cruzada entre canales (ICC, Inter-Channel Cross Correlation), que modeliza la correlación cruzada inter-aural (IACC, Inter-Aural Cross Correlation), se utiliza para caracterizar el ancho de la imagen de audio. Especialmente para frecuencias más bajas, la imagen estéreo también puede ser modelizada con diferencias de fase entre canales (ICPD, Inter-Channel Phase Differences).
Se debe observar que las señales binaurales relevantes para la percepción auditiva espacial se denominan diferencia de nivel inter-aural (ILD, Inter-aural Level Difference), diferencia de tiempo inter-aural (ITD, Inter-aural Time Difference) y coherencia o correlación inter-aural (IC, Inter-aural Coherence o IACC). Cuando se consideran las señales de múltiples canales generales, las señales correspondientes relacionadas con los canales son la diferencia de nivel entre canales (ICLD), la diferencia de tiempo entre canales (ICTD) y la coherencia o correlación entre canales (ICC). Puesto que el procesamiento de audio espacial funciona principalmente en los canales de audio capturados, la “C” a veces se omite y los términos ITD, ILD e IC a menudo se utilizan también cuando se refieren a canales de audio. La figura 1 da una ilustración de estos parámetros. En la figura 1 se muestra una reproducción de audio espacial con un sistema de sonido envolvente 5.1 (efecto 5 discreto 1 de baja frecuencia). Los parámetros entre canales tales como ICTD, ICLD e ICC son extraídos de los canales de audio para aproximar la ITD, la ILD y la IACC, que modeliza la percepción humana del sonido en el espacio.
En la figura 2, se muestra una configuración habitual que emplea el análisis de audio espacial paramétrico. La figura 2 ilustra un diagrama de bloques básico de un codificador estéreo paramétrico. Se introducen un par de señales estéreo en el codificador estéreo 201. La extracción de parámetros 202 ayuda al proceso de mezcla descendente, donde un mezclador descendente 204 prepara una representación de canal único de los dos canales de entrada para ser codificados con un codificador mono 206. Los parámetros extraídos son codificados mediante un codificador de parámetros 208. Es decir, los canales estéreo se mezclan de manera descendente en una señal mono 207 que es codificada y transmitida al decodificador 203 junto con los parámetros codificados 205 que describen la imagen espacial. Normalmente, algunos de los parámetros estéreo se representan en subbandas espectrales en una escala de frecuencia perceptiva, tal como la escala equivalente de ancho de banda rectangular (ERB, Equivalent Rectangular Bandwidth). El decodificador realiza una síntesis estéreo basada en la señal mono decodificada y en los parámetros transmitidos. Es decir, el decodificador reconstruye el canal individual utilizando un decodificador mono 210, y sintetiza los canales estéreo utilizando la representación paramétrica. La señal mono decodificada y los parámetros codificados recibidos son introducidos en una unidad de síntesis paramétrica 212, o proceso que decodifica los parámetros, sintetiza los canales estéreo utilizando los parámetros decodificados y genera un par de señales estéreo sintetizadas.
Puesto que los parámetros codificados se utilizan para representar audio espacial para el sistema auditivo humano, es importante que los parámetros entre canales sean extraídos y codificados con consideraciones perceptivas para una calidad percibida maximizada.
Puesto que el canal lateral puede no estar codificado de manera explícita, el canal lateral puede ser aproximado mediante la decorrelación del canal medio. La técnica de decorrelación es habitualmente un método de filtrado utilizado para generar una señal de salida que es incoherente con la señal de entrada desde un punto de vista de estructura fina. Las envolventes espectrales y temporales de la señal decorrelacionada permanecerán de manera ideal. Los filtros de decorrelación suelen ser filtros pasa todo con modificaciones de fase de la señal de entrada.
El documento US 2016/0005406 A1 da a conocer un método de procesamiento de señal de audio para determinar los parámetros del filtro de decorrelación para un correlacionador de decodificación. El método implica calcular los coeficientes de frecuencia combinados de un canal de acoplamiento compuesto en base a los coeficientes de frecuencia de dos o más canales, y calcular los coeficientes de correlación cruzada entre los coeficientes de frecuencia de un primer canal y los coeficientes de frecuencia combinados. El método comprende promediar los coeficientes de correlación cruzada y determinar una varianza de los coeficientes de correlación cruzada.
Compendio
La esencia de las realizaciones es un control adaptativo del carácter de un decorrelacionador para la representación de las componentes de señal no coherentes utilizadas en un decodificador de audio de múltiples canales. La adaptación se basa en una medida del rendimiento transmitida, y en cómo varía en el tiempo. Los diferentes aspectos del decorrelacionador pueden ser controlados de manera adaptativa utilizando el mismo método básico para que coincida con el carácter de la señal de entrada. Uno de los aspectos más importantes del carácter de decorrelación es la elección de la longitud del filtro del decorrelacionador, que se describe en la descripción detallada. Otros aspectos del decorrelacionador pueden ser controlados de manera adaptativa de manera similar, tal como el control de la fuerza de la componente decorrelacionada u otros aspectos que pueden necesitar un control adaptativo para que coincidan con el carácter de la señal de entrada.
Se da a conocer un método para la adaptación de una longitud del filtro de decorrelación. El método comprende recibir u obtener un parámetro de control, y calcular la media y la variación del parámetro de control. Se calcula la relación de la variación y la media del parámetro de control, y se calcula una longitud óptima u objetivo del filtro de decorrelación en base a la relación actual. La longitud óptima o específica del filtro de decorrelación es aplicada o proporcionada a un decorrelacionador.
La invención está definida mediante un método según la reivindicación 1, un aparato según la reivindicación 11 y un programa informático según la reivindicación 14.
Según un primer aspecto, se presenta un método de procesamiento de señal de audio realizado por un decodificador de audio para ajustar adaptativamente un decodificador. El método comprende obtener un parámetro de control y calcular la media y la variación del parámetro de control. Se calcula la relación de la variación y la media del parámetro de control, y se calcula un parámetro de decorrelación en base a dicha relación. A continuación, el parámetro de decorrelación es proporcionado luego a un decorrelacionador.
El parámetro de control puede ser una medida del rendimiento. La medida del rendimiento se puede obtener a partir de la longitud de reverberación estimada, las medidas de correlación, la estimación del ancho espacial o la ganancia de predicción.
El parámetro de control es recibido de un codificador, tal como un codificador estéreo paramétrico, u obtenido a partir de información ya disponible en un decodificador, o mediante una combinación de la información disponible y la transmitida (es decir, la información recibida por el decodificador).
La adaptación de la longitud del filtro de decorrelación se puede realizar en al menos dos subbandas, para que cada banda de frecuencia pueda tener la longitud óptima del filtro de decorrelación. Esto significa que se pueden utilizar filtros más cortos o más largos que la longitud objetivo para ciertas subbandas o coeficientes de frecuencia.
El método lo realiza un decodificador estéreo paramétrico o un códec de audio estéreo.
Según un segundo aspecto, se da a conocer un aparato para ajustar adaptativamente un decorrelacionador. El aparato comprende un procesador y una memoria, comprendiendo dicha memoria instrucciones ejecutables por dicho procesador mediante las cuales dicho aparato puede funcionar para obtener un parámetro de control y calcular la media y la variación del parámetro de control. El aparato puede funcionar para calcular la relación de la variación y la media del parámetro de control, y para calcular un parámetro de decorrelación en base a dicha relación. El aparato puede funcionar, además, para proporcionar el parámetro de decorrelación a un decorrelacionador.
Según un tercer aspecto, se da a conocer un programa informático que comprende instrucciones que, cuando son ejecutadas por un procesador, hacen que un aparato realice las acciones del método del primer aspecto.
Según un cuarto aspecto, se da a conocer un producto de programa informático, incorporado en un medio legible por ordenador, no transitorio, que comprende código informático que incluye instrucciones ejecutables por un ordenador que hacen que un procesador realice los procesos del primer aspecto.
Según un quinto aspecto, se da a conocer un método de procesamiento de señal de audio para ajustar adaptativamente un decodificador. El método comprende obtener un parámetro de control y calcular un parámetro de decorrelación objetivo en base a la variación de dicho parámetro de control.
Según un sexto aspecto, se da a conocer un códec de audio de múltiples canales que comprende medios para realizar el método del quinto aspecto.
Breve descripción de los dibujos
Para una comprensión más completa de las realizaciones de ejemplo de la presente invención, a continuación, se hace referencia a las siguientes descripciones tomadas en relación con los dibujos adjuntos, en los que:
La figura 1 ilustra la reproducción de audio espacial con un sistema de sonido envolvente 5.1.
La figura 2 ilustra un diagrama de bloques básico de un codificador estéreo paramétrico.
La figura 3 ilustra el ancho del objeto auditivo en función de la IACC.
La figura 4 muestra un ejemplo de una señal de audio.
La figura 5 es un diagrama de bloques que describe el método según una realización.
La figura 6 es un diagrama de bloques que describe el método según una realización alternativa.
La figura 7 muestra un ejemplo de un aparato.
La figura 8 muestra un dispositivo que comprende una calculadora de longitud del filtro de decorrelación.
Descripción detallada
Un ejemplo de realización de la presente invención y sus ventajas potenciales se entienden haciendo referencia a las figuras 1 a 8 de los dibujos.
Las soluciones existentes para la representación de componentes de señal no coherentes se basan en filtros de decorrelación invariables en el tiempo, y la cantidad de componentes no coherentes en el audio de múltiples canales decodificado se controla mediante la mezcla de componentes de señal decorrelacionadas y no decorrelacionadas. Un problema de dichos filtros de decorrelación invariables en el tiempo es que la señal decorrelacionada no se adaptará a las propiedades de las señales de entrada que se ven afectadas por las variaciones en la escena auditiva. Por ejemplo, el ambiente en una grabación de una sola fuente de voz en un entorno de baja reverberación estaría representado por componentes de señal decorrelacionadas del mismo filtro que para una grabación de una orquesta sinfónica en una gran sala de conciertos, con una reverberación significativamente mayor. Incluso si la cantidad de componentes decorrelacionadas es controlada en el tiempo, la longitud de reverberación y otras propiedades de la decorrelación no se controlan. Esto puede causar que el ambiente para el sonido de grabación de baja reverberación sea demasiado espacioso, mientras que la escena auditiva para la grabación de alta reverberación se percibe demasiado estrecha. Una longitud de reverberación corta, que es deseable para grabaciones de baja reverberación, a menudo da como resultado un ambiente metálico y antinatural para grabaciones de grabaciones más espaciosas. La solución propuesta mejora el control de las señales de audio no coherentes teniendo en cuenta cómo varía el audio no coherente a lo largo del tiempo, y utiliza esa información para controlar de manera adaptativa el carácter de la decorrelación, por ejemplo, la longitud de la reverberación, en la representación de componentes no coherentes en una señal de audio de múltiples canales decodificada y compuesta.
La adaptación puede estar basada en las propiedades de señal de las señales de entrada en el codificador, y ser controlada mediante la transmisión de uno o varios parámetros de control al decodificador. Alternativamente, puede ser controlada sin la transmisión de un parámetro de control explícito, sino a partir de la información ya disponible en el decodificador, o mediante una combinación de la información disponible y transmitida (es decir, la información recibida por el decodificador desde el codificador).
Un parámetro de control transmitido puede estar basado, por ejemplo, en un rendimiento estimado de la descripción paramétrica de las propiedades espaciales, es decir, la imagen estéreo en caso de entrada de dos canales. Es decir, el parámetro de control puede ser una medida del rendimiento. La medida del rendimiento se puede obtener a partir de la longitud de reverberación estimada, de las medidas de correlación, de la estimación del ancho espacial o de la ganancia de predicción.
La solución proporciona un mejor control de la reverberación en las señales de audio decodificadas que mejoran la
calidad percibida para una variedad de tipos de señales, tales como señales de voz limpias con baja reverberación o señales de música espaciosas con gran reverberación y una amplia escena de audio.
La esencia de las realizaciones es un control adaptativo de una longitud del filtro de decorrelación para la representación de componentes de señal no coherentes utilizadas en un decodificador de audio de múltiples canales. La adaptación se basa en una medida del rendimiento transmitida y en cómo varía en el tiempo. Además, la intensidad de la componente decorrelacionada puede ser controlada en base al mismo parámetro de control que la longitud de la decorrelación.
La solución propuesta puede funcionar en tramas o muestras en el dominio del tiempo, en bandas de frecuencia en un banco de filtros, o en el dominio de las transformadas, por ejemplo, utilizando la Transformada discreta de Fourier (DFT, Discrete Fourier Transform), para procesar coeficientes de frecuencia de bandas de frecuencia. Las operaciones realizadas en un dominio pueden ser realizadas igualmente en otro dominio y las realizaciones dadas no están limitadas al dominio ejemplificado.
En una realización, la solución propuesta se utiliza para un códec de audio estéreo con un canal de mezcla descendente codificado y una descripción paramétrica de las propiedades espaciales, es decir, tal como se ilustra en la figura 2. El análisis paramétrico puede extraer uno o más parámetros que describen componentes no coherentes entre los canales, que pueden ser utilizadas para ajustar adaptativamente la cantidad percibida de componentes no coherentes en el audio estéreo sintetizado. Tal como se ilustra en la figura 3, la IACC, es decir, la coherencia entre los canales, afectará al ancho percibido de un objeto o escena auditiva espacial. Cuando la IACC disminuye, el ancho de la fuente aumenta hasta que el sonido se percibe como dos fuentes de audio distintas no correlacionadas. Para poder representar un ambiente amplio en una grabación estéreo, se deben sintetizar componentes no coherentes entre los canales en el decodificador.
Un canal de mezcla descendente de dos canales de entrada. X e Y se puede obtener a partir de
donde M es el canal de mezcla descendente y S es el canal lateral. La matriz de mezcla descendente U1 puede ser elegida de tal manera que la energía del canal M se maximiza y la energía del canal S se minimiza. La operación de mezcla descendente puede incluir la alineación de fase o tiempo de las señales de entrada. Un ejemplo de mezcla descendente pasiva viene dado por
El canal lateral S puede no estar codificado de manera explícita, sino modelizado de manera paramétrica, por ejemplo, utilizando un filtro de predicción donde S es predicho desde el canal medio M decodificado y utilizado en el decodificador para síntesis espacial. En este caso, los parámetros de predicción, por ejemplo, los coeficientes del filtro de predicción pueden ser codificados y transmitidos al decodificador.
Otra manera de modelizar el canal lateral es aproximarlo mediante la decorrelación del canal medio. La técnica de decorrelación es habitualmente un método de filtrado utilizado para generar una señal de salida que es incoherente con la señal de entrada desde un punto de vista de estructura fina. Las envolventes espectrales y temporales de la señal decorrelacionada permanecerán de manera ideal. Los filtros de decorrelación suelen ser filtros pasa todo con modificaciones de fase de la señal de entrada.
En esta realización, la solución propuesta se utilizada para ajustar de manera adaptativa un decorrelacionador utilizado para síntesis espacial en un decodificador estéreo paramétrico.
La representación espacial (mezcla ascendente) del canal M mono codificado se obtiene mediante
donde U2 es una matriz de mezcla ascendente y D idealmente no está correlacionado con M desde un punto de vista de estructura fina. La matriz de mezcla ascendente controla la cantidad de M y D en los canales izquierdo (X) y derecho (f ) sintetizados. señalarse debe observar que la mezcla ascendente también puede involucrar componentes de señal adicionales, tal como una señal residual codificada.
Un ejemplo de una matriz de mezcla ascendente utilizada en estéreo paramétrico con transmisión de ILD e ICC viene dado por
donde
El ángulo de rotación a se utiliza para determinar la cantidad de correlación entre los canales sintetizados, y viene dado por
a = -a rccosQ C C ). (7)
El ángulo de rotación general se obtiene como
La ILD entre los dos canales. x [n] y y [n] viene dada por
ILD = 10 log E *[n ]2
10 £y [n ]2 (9)
donde n = [1, ..., N] es el índice de muestra sobre una trama de N muestras.
La coherencia entre canales puede ser estimada por medio de la correlación cruzada entre canales (ICC). Una estimación convencional de ICC se basa en la función de correlación cruzada (CCF, Cross-Correlation function) rxy, que es una medida de similitud entre dos formas de onda x [n] y y [n], y, en general, está definida en el dominio del tiempo como
donde t es el lapso de tiempo y E [■] el operador de expectativa. Para una trama de señal de longitud N la correlación cruzada se estima habitualmente como
A continuación, la ICC se obtiene como el máximo de la CCF que es normalizada mediante las energías de la señal de la siguiente manera
Se pueden utilizar parámetros adicionales en la descripción de la imagen estéreo. Estos pueden, por ejemplo, reflejar diferencias de fase o tiempo entre los canales.
Un filtro de decorrelación puede estar definido por su respuesta al impulso hd(n) o función de transferencia Hd(k) en el dominio de la DFT, donde n y k son la muestra y el índice de frecuencia, respectivamente. En el dominio de la DFT, una señal decorrelacionada Md se obtiene mediante
M d [k ] = Hd [k ]M [k ] (13)
donde k es un índice de coeficiente de frecuencia. Al funcionar en el dominio del tiempo, se obtiene una señal decorrelacionada mediante el filtrado
m d [n ] = hd [n ] * m [n ] (14)
donde n es un índice de muestra.
En una realización, se obtiene un reverberador basado en un filtro pasa todo conectado en serie como
donde y[a] y d[a] especifica el decaimiento y el retardo de la retroalimentación. Este es solo un ejemplo de un reverberador que puede ser utilizado para la decorrelación, y existen reverberadores alternativos; por ejemplo, se pueden utilizar retardos fraccionados de la muestra. Los factores de descomposición (decay, en inglés) ^[a] se puede elegir en el intervalo [0,1), puesto que un valor mayor de 1 daría como resultado un filtro inestable. Eligiendo un factor de descomposición ^[a] = 0, el filtro será un retardo de d[a] muestras. En ese caso, la longitud del filtro vendrá dada por el mayor retardo d[a] entre el conjunto de filtros en el reverberador.
El audio de múltiples canales, o, en este ejemplo el audio de dos canales, tiene naturalmente una cantidad variable de coherencia entre los canales dependiendo de las características de la señal. Para un solo altavoz grabado en un entorno bien amortiguado, habrá una baja cantidad de reflejos y de reverberación, que dará como resultado una alta coherencia entre los canales. A medida que aumenta la reverberación, la coherencia, en general, disminuirá. Esto significa que, para señales de voz limpias con poca cantidad de ruido y ambiente, la longitud del filtro de decorrelación probablemente debería ser menor que para un solo hablante en un entorno reverberante. La longitud del filtro decorrelacionador es un parámetro importante que controla el carácter de la señal decorrelacionada generada. Las realizaciones de la invención también pueden ser utilizadas para controlar de manera adaptativa otros parámetros con el fin de hacer coincidir el carácter de la señal decorrelacionada con la de la señal de entrada, tales como los parámetros relacionados con el control de nivel de la señal decorrelacionada.
Utilizando un reverberador para componer componentes de señal no coherentes, la cantidad de retardo puede ser controlada para adaptarse a diferentes características espaciales del audio codificado. De manera más general, se puede controlar la longitud de la respuesta al impulso de un filtro de decorrelación. Tal como se mencionó anteriormente, controlar la longitud del filtro puede ser equivalente a controlar el retardo de un reverberador sin retroalimentación.
En una realización, el retardo d de un reverberador sin retroalimentación, que en este caso es equivalente a la longitud del filtro, es una función Zi(-) de un parámetro de control C1
d = / i ( ci)- (16)
Un parámetro de control transmitido puede estar basado, por ejemplo, en un rendimiento estimado de la descripción paramétrica de las propiedades espaciales, es decir, la imagen estéreo en caso de entrada de dos canales. La medida de rendimiento r se puede obtener, por ejemplo, a partir de la longitud de reverberación estimada, de las medidas de correlación, de la estimación del ancho espacial o de la ganancia de predicción. Por lo tanto, la longitud del filtro de decorrelación d puede ser controlada en base a esta medida del rendimiento, es decir, C1 es la medida de rendimiento r. Un ejemplo de una función de control adecuada Zí(-) viene dado por
donde y1 es un parámetro de ajuste habitualmente en el rango [0, Dmax] con un retardo máximo permitido Dmax y 01 es un límite superior de g (r). Si g(r) > 01 se elige un retardo menor, por ejemplo, d = 1.
01 es un parámetro de ajuste que, por ejemplo, puede ser establecido en 01 = 7,0. Existe una relación entre 01 y la dinámica de g (r) y, en otra realización, por ejemplo, puede ser 01 = 0,22. La subfunción g (r) se puede definir como la relación entre el cambio de r y la media r a lo largo del tiempo. Esta relación aumentará para los sonidos que tienen mucha variación en la medida del rendimiento en comparación con su valor medio, que suele ser el caso de los sonidos dispersos con poco ruido de fondo o reverberación. Para sonidos más densos, tales como música o voz con ruido de fondo, esta relación será menor y, por lo tanto, funciona como un clasificador de sonido, clasificando el carácter de las componentes no coherentes de la señal de entrada original. La relación se puede calcular como
donde 0max es un límite superior, por ejemplo, establecido en 200, y 0mn es un límite inferior, por ejemplo, establecido en 0. Los límites pueden estar relacionados, por ejemplo, con el parámetro de ajuste 01, por ejemplo, 0max = 1,501.
Una estimación de la media de una medida del rendimiento transmitida se obtiene, para la trama i, como
Para la primera trama rmedia [i - 1] puede ser inicializada en 0. Los factores de suavizado apos y aneg puede ser elegidos
de tal manera que los cambios hacia arriba y hacia abajo de r son seguidos de manera diferente. En un ejemplo apos = 0,005 y aneg = 0,5, lo que significa que la estimación media sigue en mayor medida los mínimos de la medida de rendimiento medio a lo largo del tiempo. En otra realización, los factores de suavizado positivos y negativos son iguales, por ejemplo, apos = aneg = 0,1.
De manera similar, la estimación suavizada de la variación de la medida de rendimiento se obtiene como
rc [0 — Ppos cî l^ "i-( l — Ppos) c^[ ^ ~ 1] si t"c[í] > rc[i — 1]
( 20 )
*cM = Pnegrc[i] + ( l - Pneg)rc[i - 1] en caso contrario
donde
rc[í] = \ r [ i ] - r med.a[i\\. ( 21 )
Alternativamente, la varianza de r puede ser estimada como
a la media rmedia, es decir
o la varianza puede estar relacionada con la media al cuadrado, es decir
Otra estimación de la desviación estándar podría venir dada por
°r [t] = -~ T ~ rc L~Ppos [í] (l - Ppos)°r U - 1] sí rc[í] > (1 - Pp 'os)(Tr [¡ - 1]
(25)
or [¿] = ~ l~P rne ~g rc U] ( l - Pneg)°r [¿ - 1] en caso contrario
que tiene menor complejidad.
Los factores de suavizado foos y fineg se puede elegir de tal manera que los cambios hacia arriba y hacia abajo de rc sean seguidos de manera diferente. En un ejemplo $pos = 0,5 y fineg = 0,05, lo que significa que la estimación media sigue en mayor medida los máximos del cambio en la medida del rendimiento a lo largo del tiempo. En otra realización, los factores de suavizado positivo y negativo son iguales, por ejemplo,
En general, para todos los ejemplos dados, la transición entre los dos factores de suavizado se puede realizar para cualquier umbral con el que se compare el valor de actualización del marco actual. Es decir, en el ejemplo dado de la ecuación 25 rc[/] > dumbral.
Además, la relación gramo(r) controlar el retardo puede ser suavizado en el tiempo según
g [ i ] = asg [ i ] + (1 - as) g [ i - 1] , (26)
donde el factor de suavizado as es un factor de sintonización, por ejemplo, establecido en 0,01. Esto significa que g (r [/]) en la ecuación 17 es reemplazada por g [/] para la trama /.
En otra realización, la relación g (r) se suaviza condicionalmente según la medida de rendimiento C1 , es decir
^ [0 = f ( c i > g [ i l g [ i ~ ! ] ) • (27)
Un ejemplo de dicha función es
g [ i ] = YPos(c i ) r [ i ] + (l - Y p o s í c ^ g i i - 1] Si g [ L ] > g [ i - l ]
( 28 )
g[ i ] = Y n eg tcM L ] + ( l “ Yneg(Ci))g[Í ~ 1] en caso contrario
donde los parámetros de suavizado son una función de la medida del rendimiento. Por ejemplo
Ypos ^pos_h¿gh> Yneg ^ n e g ji ig h Si f UmbJ C^ > 6sito (29) Ypos K p o s lo w ’ Y n eg ^ n e g jo w en caso contrario
Dependiendo de la medida del rendimiento utilizada, la función fumbrai puede ser elegida de manera diferente. Por ejemplo, puede ser una media, un percentil (por ejemplo, la mediana), el mínimo o el máximo de C1 sobre un conjunto de tramas o muestras o sobre un conjunto de subbandas o coeficientes de frecuencia, es decir, por ejemplo
fu .bJ c i ) = max(Cl[b]), (30) donde b = b0, ... bN-1 es un índice para N subbandas de frecuencia. Los factores de suavizado controlan la cantidad de suavizado cuando el umbral Qaito, por ejemplo, establecido en 0,6, se excede, respectivamente no se excede, y puede ser igual para actualizaciones positivas y negativas o diferente, por ejemplo, KPos_aito = 0,03, Kneg_aito = 0,05, Kposbajo = 0,1, Knegbajo = 0,001.
Se puede observar que es posible suavizar o limitar el cambio adicional en la longitud del filtro de decorrelación obtenido entre muestras o tramas para evitar artefactos. Además, el conjunto de longitudes de filtro utilizadas para la decorrelación puede ser limitado para reducir el número de coloraciones diferentes obtenidas al mezclar señales. Por ejemplo, puede haber dos longitudes diferentes, donde la primera es relativamente corta y la segunda es más larga. En una realización, se utilizan un conjunto de dos filtros disponibles de diferentes longitudes d1 y a2. Una longitud de filtro específica d, por ejemplo, se puede obtener como
donde /1 es un parámetro de ajuste que, por ejemplo, viene dado por
Y i = d 2 - di 8 , (32) donde 5 es un término de compensación que puede ser establecido, por ejemplo, en 2. En este caso se supone que d2 es mayor que d1. Se observa que la longitud del filtro objetivo es un parámetro de control, pero se pueden utilizar diferentes longitudes de filtro o retardos de reverberación para diferentes frecuencias. Esto significa que se pueden utilizar filtros más cortos o más largos que la longitud objetivo para ciertas subbandas o coeficientes de frecuencia. En este caso, la intensidad del filtro de decorrelación s que controla la cantidad de señal decorrelacionada D en los canales sintetizados X e Y puede ser controlada por los mismos parámetros de control, en este caso con un parámetro de control, la medida del rendimiento C1 = r.
En otra realización, la adaptación de la longitud del filtro de decorrelación se realiza en varias, es decir, al menos dos, subbandas, para que cada banda de frecuencia pueda tener la longitud óptima del filtro de decorrelación.
En una realización en la que el reverberador utiliza un conjunto de filtros con retroalimentación, tal como se muestra en la ecuación 15, la cantidad de retroalimentación, ^[a], también puede ser adaptada de manera similar al parámetro de retardo d [a] En dicha realización, la longitud del ambiente generado es una combinación de ambos parámetros y, por lo tanto, es posible que ambos deban ser adaptados para conseguir una longitud de ambiente adecuada.
En otra realización más, la longitud del filtro de decorrelación o el retardo del reverberador d y la intensidad de la señal de decorrelación s se controlan como funciones de dos o más parámetros de control diferentes, es decir
^ = f l (C21< C22> ■■■)' (33)
S = f 3 Í C31>C32> ■■■)■ (34)
En otra realización más, la longitud del filtro de decorrelación y la intensidad de la señal de decorrelación se controlan mediante un análisis de las señales de audio decodificadas.
La longitud de reverberación también puede ser controlada especialmente para transitorios, es decir, aumentos repentinos de energía o para otras señales con características especiales.
A medida que el filtro cambia en el tiempo, debe haber un cierto manejo de los cambios sobre tramas o muestras. Esto puede ser, por ejemplo, interpolación o funciones de ventana con tramas superpuestas. La interpolación puede ser
realizada entre los filtros anteriores de su longitud controlada respectivamente a la longitud del filtro objetivo actual en varias muestras o tramas. La interpolación puede ser obtenida disminuyendo sucesivamente la ganancia de los filtros anteriores, al tiempo que aumenta la ganancia del filtro actual de la longitud objetivo actual sobre muestras o tramas. En otra realización, la longitud del filtro objetivo controla la ganancia del filtro de cada filtro disponible, de manera que haya una mezcla de filtros disponibles de diferentes longitudes cuando la longitud del filtro objetivo no está disponible. En el caso de dos filtros disponibles h y h2 de longitud d y a2 respectivamente, sus ganancias S1 y S2 se pueden obtener como
Sj. = f 3(d1,d 2,c 1), (35)
s 2 = f4(d1,d 2,c 1) . (36)
Las ganancias del filtro también pueden depender unas de otras, por ejemplo, para obtener la misma energía de la señal filtrada, es decir S2 = f (s1) en el caso de que h1 sea el filtro de referencia cuya ganancia es controlada por C1. Por ejemplo, la ganancia del filtro S 1 se puede obtener como
Si = (d2 ~ d ) / (d2 - d4) , (37)
donde d es la longitud del filtro objetivo en el rango [di, efe] y d2 > d1. La segunda ganancia de filtro se puede obtener, por ejemplo, como
s2 = V i ~ s l • (38)
La señal filtrada md [n] se obtiene entonces como
md[n] = (s-l/i i M s2h2[n]) * m [n ] , (39)
si la operación de filtrado se realiza en el dominio del tiempo.
En el caso de que la intensidad de la señal de decorrelación sea controlada por un parámetro de control c puede ser beneficioso controlarlo como una función F4(-) de los parámetros de control de tramas anteriores y la longitud del filtro de decorrelación d. Es decir.
s[i] = /4(d ,c J i] ,c1[ i - l ] l ...l c1[i-./VM]). (40)
Un ejemplo de dicha función es
donde a4 y £4 son parámetros de ajuste, por ejemplo, a4 = 0,8 o a4 = 0,6 y £4 = 1,0. a4 normalmente debería estar en el rango [0,1] mientras que £4 puede ser también mayor de uno.
En el caso de una mezcla de más de un filtro, la intensidad s de la señal filtrada md[n]en la mezcla ascendente con m [n] se puede obtener, por ejemplo, en base a una media ponderada, es decir, en el caso de dos filtros h1 y h2, mediante
s[i ] = min(£4w[i],w[i](l - a 4) a^c ji]), (42)
donde
w[i] = s 1c1[ i - d 1] s2c1[ i - d 2]. (43)
La figura 4 muestra un ejemplo de una señal en la que la primera mitad contiene un discurso limpio y la segunda mitad música clásica. La media de la medida del rendimiento es relativamente alta para la segunda mitad que contiene música. La variación de la medida del rendimiento también es mayor para la segunda mitad, pero la relación entre ellas es considerablemente menor. Una señal en la que la variación de la medida de rendimiento es mucho mayor que la media de la medida del rendimiento se considera una señal con altas cantidades continuas de componentes difusos y, por lo tanto, la longitud del filtro de decorrelación debería ser menor en la primera mitad de este ejemplo que en la segunda. Cabe señalar que todas las señales en los gráficos se han suavizado y parcialmente limitado para un comportamiento más controlado. En este caso, la longitud del filtro de decorrelación objetivo se expresa en un número discreto de tramas, pero, en otras realizaciones, la longitud del filtro puede variar de manera continua.
Las figuras 5 y 6 ilustran un método de ejemplo para ajustar un decorrelacionador. El método comprende obtener un parámetro de control y calcular la media y la variación del parámetro de control. Se calcula la relación de la variación y la media del parámetro de control, y se calcula un parámetro de decorrelación en base a la relación. El parámetro de decorrelación es proporcionado a continuación a un decorrelacionador.
La figura 5 describe las etapas involucradas en la adaptación de la longitud del filtro de decorrelación. El método 500
se inicia con la recepción 501 de un parámetro de medición del rendimiento, es decir, un parámetro de control. La medida del rendimiento se calcula en un codificador de audio y se transmite a un decodificador de audio. Alternativamente, el parámetro de control se obtiene a partir de la información ya disponible en un decodificador, o mediante una combinación de la información disponible y transmitida. En primer lugar, se calcula una media y una variación de la medida del rendimiento, tal como se muestra en los bloques 502 y 504. A continuación, se calcula 506 la razón de la variación y la media de la medida del rendimiento. Se calcula 508 la longitud óptima del filtro de decorrelación en base a la razón. Finalmente, se aplica una nueva longitud de filtro de decorrelación 510 para obtener una señal decorrelacionada de, por ejemplo, la señal mono recibida.
La figura 6 describe otra realización de la adaptación de la longitud del filtro de decorrelación. El método 600 se inicia con la recepción 601 de un parámetro de medición del rendimiento, es decir, un parámetro de control. La medida del rendimiento se calcula en un codificador de audio y se transmite a un decodificador de audio. Alternativamente, el parámetro de control se obtiene a partir de la información ya disponible en un decodificador, o mediante una combinación de la información disponible y transmitida. En primer lugar, se calcula una media y una variación de la medida del rendimiento, tal como se muestra en los bloques 602 y 604. A continuación, se calcula la relación de la variación y la media de la medida del rendimiento 606. La longitud del filtro de decorrelación objetivo se calcula 608 en base a la relación. La etapa final es proporcionar 610 la nueva longitud del filtro de decorrelación objetivo a un decorrelacionador.
Los métodos pueden ser realizados mediante un decodificador estéreo paramétrico o un códec de audio estéreo.
La figura 7 muestra un ejemplo de un aparato que realiza el método ilustrado en las figuras 5 y 6. El aparato 700 comprende un procesador 710, por ejemplo, una unidad central de procesamiento (CPU, Central Processing Unit) y un producto de programa informático 720 en forma de memoria para almacenar las instrucciones, por ejemplo, un programa informático 730 que, cuando es recuperado de la memoria y ejecutado por el procesador 710, hace que el aparato 700 realice procesos relacionados con realizaciones de ajuste adaptativo de un decorrelacionador. El procesador 710 está acoplado comunicativamente a la memoria 720. El aparato puede comprender, además, un nodo de entrada para recibir parámetros de entrada, es decir, la medida del rendimiento, y un nodo de salida, para emitir parámetros procesados tales como una longitud del filtro de decorrelación. El nodo de entrada y el nodo de salida están ambos acoplados comunicativamente al procesador 710.
El aparato 700 está comprendido en un decodificador de audio, tal como el decodificador estéreo paramétrico mostrado en una parte inferior de la figura 2. Puede estar comprendido en un códec de audio estéreo.
La figura 8 muestra un dispositivo 800 que comprende un calculador de la longitud del filtro de decorrelación 802. El dispositivo es un decodificador, por ejemplo, un decodificador de voz o audio. Una señal de entrada 804 es una señal mono codificada con parámetros codificados que describen la imagen espacial. Los parámetros de entrada pueden comprender el parámetro de control, como la medida del rendimiento. La señal de salida 806 es una señal estéreo o de múltiples canales sintetizada, es decir, una señal de audio reconstruida. El dispositivo puede comprender, además, un receptor (no mostrado) para recibir la señal de entrada desde un codificador de audio. El dispositivo puede comprender, además, un decodificador mono y una unidad de síntesis paramétrica, tal como se muestra en la figura 2.
En una realización, el calculador de la longitud de decorrelación 802 comprende una unidad de obtención para recibir u obtener un parámetro de medida del rendimiento, es decir, un parámetro de control. Además, comprende una primera unidad de cálculo, para calcular una media y una variación de la medida del rendimiento, una segunda unidad de cálculo, para calcular la relación de la variación y la media de la medida del rendimiento, y una tercera unidad de cálculo, para calcular la longitud del filtro de decorrelación objetivo. Puede comprender, además, una unidad de suministro, para proporcionar la longitud del filtro de decorrelación objetivo a una unidad de decorrelación.
A modo de ejemplo, el software o programa informático 730 puede estar realizado como un producto de programa informático, que normalmente se transporta o almacena en un medio legible por ordenador, preferentemente un medio de almacenamiento legible por ordenador no volátil. El medio legible por ordenador puede incluir uno o más dispositivos de memoria extraíbles o no extraíbles que incluyen, entre otros, una memoria de solo lectura (ROM, Read Only Memory), una memoria de acceso aleatorio (RAM, Random Access Memory), un disco compacto (CD, Compact Disc), un disco Versátil digital (DVD, Digital Versatile Disc), un disco Blue-ray, una memoria de bus de serie universal (USB, Universal Serial Bus), un dispositivo de almacenamiento de disco duro (HDD . Hard disc Drive), una memoria flash, una cinta magnética o cualquier otro dispositivo de memoria convencional.
Las realizaciones de la presente invención pueden ser implementadas en software, hardware, lógica de aplicación o en una combinación de software, hardware y lógica de aplicación. El software, la lógica de la aplicación y/o el hardware pueden residir en una memoria, un microprocesador o una unidad central de procesamiento. Si se desea, parte del software, la lógica de la aplicación y/o el hardware pueden residir en un dispositivo anfitrión o en una memoria, un microprocesador o una unidad central de procesamiento del anfitrión. En una realización de ejemplo, la lógica de la aplicación, el software o un conjunto de instrucciones se mantiene en cualquiera de los diversos medios convencionales legibles por ordenador.
Abreviaturas
ILD / ICLD Diferencia de nivel entre canales IPD / ICPD Diferencia de fase entre canales ITD / ICTD Diferencia de tiempo entre canales IACC Correlación cruzada inter-aural ICC Correlación entre canales
DFT Transformada discreta de Fourier CCF Función de correlación cruzada
Claims (14)
1. Un método de procesamiento de señal de audio (500, 600) realizado por un decodificador de audio, para ajustar adaptativamente un decodificador, comprendiendo el método:
obtener (501,601) un parámetro de control;
calcular (502, 602) la media del parámetro de control;
calcular (504, 604) la variación del parámetro de control;
calcular (506, 606) relación de la variación y la media del parámetro de control; y
calcular (508, 608) un parámetro de decorrelación basado en dicha relación.
2. El método según la reivindicación 1, que comprende, además, proporcionar el parámetro de decorrelación calculado a un correlacionador de decodificación.
3. El método según la reivindicación 1 o 2, en el que calcular el parámetro de decorrelación comprende calcular una longitud del filtro de decorrelación objetivo.
4. El método según cualquiera de las reivindicaciones 1 a 3, en el que el parámetro de control es recibido desde un codificador u obtenido a partir de la información disponible en un decodificador, o mediante una combinación de la información disponible y la recibida.
5. El método según cualquiera de las reivindicaciones 1 a 4, en el que el parámetro de control es una medida del rendimiento.
6. El método según cualquiera de las reivindicaciones 1 a 5, en el que el parámetro de control se determina en base a un rendimiento estimado de una descripción paramétrica de las propiedades espaciales de una señal de audio de entrada.
7. El método según la reivindicación 5, en el que la medida del rendimiento se obtiene a partir de la longitud de la reverberación estimada, medidas de correlación, estimación del ancho espacial o ganancia de predicción.
8. El método según una cualquiera de las reivindicaciones 1 a 7, en el que la adaptación del parámetro de decorrelación se realiza en al menos dos subbandas, teniendo cada banda de frecuencia el parámetro de decorrelación óptimo.
9. El método según cualquiera de las reivindicaciones 3 a 8, en el que al menos una de la longitud del filtro de decorrelación y la intensidad de la señal de decorrelación se controlan mediante un análisis de señales de audio decodificadas.
10. El método según una cualquiera de las reivindicaciones 3 a 8, en el que al menos una de la longitud del filtro de decorrelación y la intensidad de la señal de decorrelación se controlan como funciones de dos o más parámetros de control diferentes.
11. Un aparato, que comprende medios configurados para realizar el método, según al menos una de las reivindicaciones 1 a 10.
12. Un códec de audio estéreo, que comprende el aparato de la reivindicación 11.
13. Un decodificador estéreo paramétrico, que comprende el aparato de la reivindicación 11.
14. Un programa informático (730), que comprende instrucciones que, cuando son ejecutadas por un procesador (710), hacen que un aparato realice las acciones del método de cualquiera de las reivindicaciones 1 a 10.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US201662425861P | 2016-11-23 | 2016-11-23 | |
| US201662430569P | 2016-12-06 | 2016-12-06 | |
| PCT/EP2017/080219 WO2018096036A1 (en) | 2016-11-23 | 2017-11-23 | Method and apparatus for adaptive control of decorrelation filters |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2808096T3 true ES2808096T3 (es) | 2021-02-25 |
Family
ID=60450667
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES17803944T Active ES2808096T3 (es) | 2016-11-23 | 2017-11-23 | Método y aparato para el control adaptativo de los filtros de decorrelación |
Country Status (9)
| Country | Link |
|---|---|
| US (5) | US10950247B2 (es) |
| EP (3) | EP3545693B1 (es) |
| JP (3) | JP6843992B2 (es) |
| KR (2) | KR102349931B1 (es) |
| CN (2) | CN110024421B (es) |
| ES (1) | ES2808096T3 (es) |
| IL (1) | IL266580B (es) |
| MX (1) | MX2019005805A (es) |
| WO (1) | WO2018096036A1 (es) |
Families Citing this family (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN110024421B (zh) | 2016-11-23 | 2020-12-25 | 瑞典爱立信有限公司 | 用于自适应控制去相关滤波器的方法和装置 |
| US11606663B2 (en) | 2018-08-29 | 2023-03-14 | Audible Reality Inc. | System for and method of controlling a three-dimensional audio engine |
| CN112005210A (zh) * | 2018-08-30 | 2020-11-27 | 惠普发展公司,有限责任合伙企业 | 多通道源音频的空间特性 |
| US12073842B2 (en) * | 2019-06-24 | 2024-08-27 | Qualcomm Incorporated | Psychoacoustic audio coding of ambisonic audio data |
| CN112653985B (zh) | 2019-10-10 | 2022-09-27 | 高迪奥实验室公司 | 使用2声道立体声扬声器处理音频信号的方法和设备 |
| KR102735772B1 (ko) | 2021-10-16 | 2024-11-27 | 김은일 | 외장 태양에너지시스템과 이의 건설방법 |
| GB2623999A (en) * | 2022-11-03 | 2024-05-08 | The Univ Of Derby | Speaker system and calibration method |
Family Cites Families (21)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5956674A (en) * | 1995-12-01 | 1999-09-21 | Digital Theater Systems, Inc. | Multi-channel predictive subband audio coder using psychoacoustic adaptive bit allocation in frequency, time and over the multiple channels |
| EP1356589B1 (en) * | 2001-01-23 | 2010-07-14 | Koninklijke Philips Electronics N.V. | Asymmetric multichannel filter |
| SE0301273D0 (sv) | 2003-04-30 | 2003-04-30 | Coding Technologies Sweden Ab | Advanced processing based on a complex-exponential-modulated filterbank and adaptive time signalling methods |
| ATE390683T1 (de) * | 2004-03-01 | 2008-04-15 | Dolby Lab Licensing Corp | Mehrkanalige audiocodierung |
| TWI393121B (zh) | 2004-08-25 | 2013-04-11 | 杜比實驗室特許公司 | 處理一組n個聲音信號之方法與裝置及與其相關聯之電腦程式 |
| JP2007065497A (ja) | 2005-09-01 | 2007-03-15 | Matsushita Electric Ind Co Ltd | 信号処理装置 |
| EP1879181B1 (en) * | 2006-07-11 | 2014-05-21 | Nuance Communications, Inc. | Method for compensation audio signal components in a vehicle communication system and system therefor |
| JP4928918B2 (ja) * | 2006-11-27 | 2012-05-09 | 株式会社東芝 | 適応フィルタを用いた信号処理装置 |
| JP5554065B2 (ja) * | 2007-02-06 | 2014-07-23 | コーニンクレッカ フィリップス エヌ ヴェ | 複雑さの軽減されたパラメトリックステレオデコーダ |
| CN101521010B (zh) * | 2008-02-29 | 2011-10-05 | 华为技术有限公司 | 一种音频信号的编解码方法和装置 |
| WO2009129008A1 (en) * | 2008-04-17 | 2009-10-22 | University Of Utah Research Foundation | Multi-channel acoustic echo cancellation system and method |
| CN102656627B (zh) * | 2009-12-16 | 2014-04-30 | 诺基亚公司 | 多信道音频处理方法和装置 |
| US8977542B2 (en) * | 2010-07-16 | 2015-03-10 | Telefonaktiebolaget L M Ericsson (Publ) | Audio encoder and decoder and methods for encoding and decoding an audio signal |
| JP5730555B2 (ja) | 2010-12-06 | 2015-06-10 | 富士通テン株式会社 | 音場制御装置 |
| GB201109731D0 (en) * | 2011-06-10 | 2011-07-27 | System Ltd X | Method and system for analysing audio tracks |
| CA2859985C (en) | 2011-12-21 | 2020-11-03 | The Regents Of The University Of Colorado | Anti-cancer compounds targeting ral gtpases and methods of using the same |
| JP2013156109A (ja) * | 2012-01-30 | 2013-08-15 | Hitachi Ltd | 距離計測装置 |
| EP2956935B1 (en) * | 2013-02-14 | 2017-01-04 | Dolby Laboratories Licensing Corporation | Controlling the inter-channel coherence of upmixed audio signals |
| TWI618050B (zh) * | 2013-02-14 | 2018-03-11 | 杜比實驗室特許公司 | 用於音訊處理系統中之訊號去相關的方法及設備 |
| US10839302B2 (en) * | 2015-11-24 | 2020-11-17 | The Research Foundation For The State University Of New York | Approximate value iteration with complex returns by bounding |
| CN110024421B (zh) | 2016-11-23 | 2020-12-25 | 瑞典爱立信有限公司 | 用于自适应控制去相关滤波器的方法和装置 |
-
2017
- 2017-11-23 CN CN201780072339.4A patent/CN110024421B/zh active Active
- 2017-11-23 EP EP17803944.2A patent/EP3545693B1/en active Active
- 2017-11-23 CN CN202011398462.5A patent/CN112397076A/zh active Pending
- 2017-11-23 WO PCT/EP2017/080219 patent/WO2018096036A1/en not_active Ceased
- 2017-11-23 EP EP20180704.7A patent/EP3734998B1/en active Active
- 2017-11-23 JP JP2019527437A patent/JP6843992B2/ja active Active
- 2017-11-23 MX MX2019005805A patent/MX2019005805A/es unknown
- 2017-11-23 KR KR1020217000273A patent/KR102349931B1/ko active Active
- 2017-11-23 KR KR1020197017588A patent/KR102201308B1/ko active Active
- 2017-11-23 US US16/463,619 patent/US10950247B2/en active Active
- 2017-11-23 ES ES17803944T patent/ES2808096T3/es active Active
- 2017-11-23 EP EP22203950.5A patent/EP4149122B1/en active Active
-
2019
- 2019-05-12 IL IL266580A patent/IL266580B/en unknown
-
2021
- 2021-02-24 JP JP2021027961A patent/JP7201721B2/ja active Active
- 2021-03-15 US US17/201,030 patent/US11501785B2/en active Active
-
2022
- 2022-11-14 US US17/986,830 patent/US11942098B2/en active Active
- 2022-12-22 JP JP2022205672A patent/JP7591549B2/ja active Active
-
2024
- 2024-02-21 US US18/582,932 patent/US12462818B2/en active Active
-
2025
- 2025-10-24 US US19/368,101 patent/US20260112376A1/en active Pending
Also Published As
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2808096T3 (es) | Método y aparato para el control adaptativo de los filtros de decorrelación | |
| JP6626581B2 (ja) | 1つの広帯域アライメント・パラメータと複数の狭帯域アライメント・パラメータとを使用して、多チャネル信号を符号化又は復号化する装置及び方法 | |
| US11869518B2 (en) | Method and apparatus for increasing stability of an inter-channel time difference parameter | |
| CN105493182A (zh) | 混合波形编码和参数编码语音增强 | |
| US20230352034A1 (en) | Encoding and decoding methods, and encoding and decoding apparatuses for stereo signal | |
| CN108665902B (zh) | 多声道信号的编解码方法和编解码器 | |
| EP4435777B1 (en) | Stereo signal encoding method and apparatus | |
| US11961526B2 (en) | Method and apparatus for calculating downmixed signal and residual signal |


















