ES2709327T3 - Método de descodificación y descodificador para la mejora del diálogo - Google Patents

Método de descodificación y descodificador para la mejora del diálogo Download PDF

Info

Publication number
ES2709327T3
ES2709327T3 ES15770958T ES15770958T ES2709327T3 ES 2709327 T3 ES2709327 T3 ES 2709327T3 ES 15770958 T ES15770958 T ES 15770958T ES 15770958 T ES15770958 T ES 15770958T ES 2709327 T3 ES2709327 T3 ES 2709327T3
Authority
ES
Spain
Prior art keywords
dialogue
parameters
subset
improvement
channels
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES15770958T
Other languages
English (en)
Inventor
Jeroen Koppens
Per Ekstrand
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Dolby International AB
Original Assignee
Dolby International AB
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Dolby International AB filed Critical Dolby International AB
Application granted granted Critical
Publication of ES2709327T3 publication Critical patent/ES2709327T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • G10L21/0364Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude for improving intelligibility
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S3/00Systems employing more than two channels, e.g. quadraphonic
    • H04S3/008Systems employing more than two channels, e.g. quadraphonic in which the audio signals are in digital form, i.e. employing more than two discrete digital channels
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/01Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/03Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2420/00Techniques used stereophonic systems covered by H04S but not provided for in its groups
    • H04S2420/03Application of parametric coding in stereophonic audio systems

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Computational Linguistics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Health & Medical Sciences (AREA)
  • Quality & Reliability (AREA)
  • Mathematical Physics (AREA)
  • Stereophonic System (AREA)
  • Telephonic Communication Services (AREA)

Abstract

Un método para la mejora del diálogo en un descodificador de un sistema de audio, de tal manera que el método comprende las etapas de: recibir una pluralidad de señales de mezcla descendente (512, 612, 712), que constituyen una mezcla en sentido descendente de una pluralidad más grande de canales; recibir parámetros para mejora de diálogo (516, 616, 716), de tal manera que los parámetros se han definido con respecto a un subconjunto de la pluralidad de canales que incluye canales que comprenden diálogo, de tal modo que el subconjunto de la pluralidad de canales se mezcla en sentido descendente para formar un subconjunto (512a, 612a, 712a) de la pluralidad de señales de mezcla descendente; recibir parámetros de reconstrucción (514, 614, 714) que permiten una reconstrucción paramétrica de los canales que están mezclados en sentido descendente en el subconjunto (512a, 612a, 712a) de la pluralidad de señales de mezcla descendente; mezclar en sentido ascendente únicamente el subconjunto (512a, 612a, 712a) de la pluralidad de señales de mezcla descendente paramétricamente, basándose en los parámetros de reconstrucción (514, 614, 714), a fin de reconstruir únicamente un subconjunto (618a, 618b, 718a) de la pluralidad de canales que incluye el subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parámetros para mejora de diálogo (516, 616, 716); aplicar una mejora del diálogo al subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parámetros para mejora de diálogo (516, 616, 716), utilizando los parámetros para mejora de diálogo (516, 616, 716), a fin de proporcionar al menos una señal mejora en diálogo (619, 719); y proporcionar versiones mejoradas en diálogo (520, 620, 720) del subconjunto (512a, 612a, 712a) de la pluralidad de señales de mezcla descendente, al mezclar la al menos una señal mejorada en diálogo (619, 719) con al menos otra de dicho subconjunto de la pluralidad de señales de mezcla descendente (618b, 712a).

Description

DESCRIPCION
Metodo de descodificacion y descodificador para la mejora del dialogo
Campo tecnico
La invencion divulgada en esta memoria se refiere generalmente a la codificacion de audio. En particular, se refiere a metodos y dispositivos para la mejora del dialogo en sistemas de audio basados en canales.
Antecedentes
La mejora del dialogo se refiere a potenciacion del dialogo en relacion con otros contenidos de audio. Esto puede aplicarse, por ejemplo, con el fin de permitir a personas auditivamente impedidas seguir los dialogos de una pelfcula. Para el contenido de audio basado en canales, el dialogo esta presente, por lo comun, en varios canales y tambien esta mezclado con otros contenidos de audio. Es, por lo tanto, una tarea no baladf mejorar el dialogo.
Existen diversos metodos conocidos para llevar a cabo una mejora del dialogo en un descodificador. De acuerdo con algunos de estos metodos, se descodifica en primer lugar el contenido completo de canales, esto es, la totalidad de la configuracion de los canales, y, a continuacion, se utilizan parametros de mejora del dialogo recibidos para predecir el dialogo basandose en el contenido completo de canales. El dialogo predicho se utiliza entonces para mejorar el dialogo en los canales relevantes. A lo largo de estas lmeas, la Norma de Compresion de Audio Digital (AC-4) (ETSI TS [Especificacion Tecnica - “Technical Specification”- del Instituto Europeo de Normas de Telecomunicaciones -“European Telecommunications Standards Institute”- ] 103 190 v1.1.1) sugiere extraer todo el contenido de canales de las senales de mezcla descendente recibidas y proporcionar un subconjunto del contenido de canales como entrada para una mejora del dialogo. Sin embargo, tales metodos de descodificacion se fundamentan en un descodificador que es capaz de descodificar la configuracion completa de canales.
Sin embargo, los descodificadores de baja complejidad no estan disenados, por lo comun, para descodificar la configuracion completa de canales. En lugar de esto, un descodificador de baja complejidad puede descodificar y suministrar como salida un bajo numero de canales que representan una version mezclada en sentido descendente de la configuracion completa de canales. De acuerdo con esto, la configuracion completa de canales no esta disponible en el descodificador de baja complejidad. Puesto que los parametros de mejora del dialogo se han definido con respecto a los canales de la configuracion de canales completa (o al menos con respecto a algunos de los canales de la configuracion completa de canales), los metodos de mejora de dialogo conocidos no pueden ser aplicados directamente por un descodificador de baja complejidad. En particular, este es el caso, puesto que los canales con respecto a los cuales se aplican los parametros de mejora del dialogo pueden aun seguir estando mezclados con otros canales.
Hay, por tanto, margen para mejoras que permitan a un descodificador de baja complejidad aplicar una mejora del dialogo sin tener que descodificar la configuracion de canales completa.
Breve descripcion de los dibujos
En lo que sigue, se describiran realizaciones proporcionadas a modo de ejemplo con mayor detalle y con referencia a los dibujos que se acompanan, en los cuales:
La Figura 1a es una ilustracion esquematica de una configuracion de canales de 7.1+4 que se ha mezclado en sentido descendente para obtener una mezcla descendente de 5.1, de acuerdo con un primer esquema de mezcla en sentido descendente.
La Figura 1b es una ilustracion esquematica de una configuracion de canales de 7.1+4 que se ha mezclado en sentido descendente para obtener una mezcla descendente de 5.1, de acuerdo con un segundo esquema de mezcla en sentido descendente.
La Figura 2 es una ilustracion esquematica de un descodificador de la tecnica anterior para llevar a cabo una mejora del dialogo en una configuracion completa de canales descodificados.
La Figura 3 es una ilustracion esquematica de la mejora del dialogo de acuerdo con un primer modo.
La Figura 4 es una ilustracion esquematica de la mejora del dialogo de acuerdo con un segundo modo.
La Figura 5 es una ilustracion esquematica de un descodificador de acuerdo con realizaciones proporcionadas a modo de ejemplo.
La Figura 6 es una ilustracion esquematica de un descodificador de acuerdo con realizaciones proporcionadas a modo de ejemplo.
La Figura 7 es una ilustracion esquematica de un descodificador de acuerdo con realizaciones proporcionadas a modo de ejemplo.
La Figura 8 es una ilustracion esquematica de un codificador correspondiente a uno cualquiera de los descodificadores de la Figura 2, la Figura 5, la Figura 6 y la Figura 7.
La Figura 9 ilustra metodos para computar una operacion BA de tratamiento combinada, compuesta por dos suboperaciones, u operaciones subordinadas, A y B, basandose en parametros que controlan cada una de las suboperaciones.
Todas las figuras son esquematicas y, generalmente, tan solo muestran los elementos que son necesarios para ilustrar la invencion, mientras que otros elementos pueden haberse omitido o ser meramente sugeridos.
Descripcion detallada
A la vista de lo anterior, es un proposito proporcionar un descodificador y metodos asociados que permitan la aplicacion de la mejora del dialogo sin tener que descodificar la configuracion completa de canales.
I. Vista general
De acuerdo con un primer aspecto, realizaciones proporcionadas a modo de ejemplo proporcionan un metodo para mejorar el dialogo en un descodificador de un sistema de audio. El metodo comprende las etapas de:
recibir una pluralidad de senales de mezcla descendente que constituyen una mezcla en sentido descendente de una pluralidad mayor de canales;
recibir parametros para la mejora del dialogo, de tal manera que los parametros son definidos con respecto a un subconjunto de la pluralidad de canales que incluye canales que comprenden dialogo, de tal modo que el subconjunto de la pluralidad de canales se mezcla en sentido descendente para obtener un subconjunto de la pluralidad de senales de mezcla descendente;
recibir parametros de reconstruccion que permiten la reconstruccion parametrica de canales que se han mezclado en sentido descendente para obtener el subconjunto de la pluralidad de senales de mezcla descendente;
mezclar en sentido ascendente unicamente el subconjunto de la pluralidad de senales de mezcla descendente parametricamente, basandose en los parametros de reconstruccion, a fin de reconstruir unicamente un subconjunto de la pluralidad de canales que incluye el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo;
aplicar la mejora del dialogo al subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, utilizando los parametros para la mejora del dialogo con el fin de proporcionar al menos una senal mejorada en el dialogo; y
proporcionar versiones mejoradas en dialogo del subconjunto de la pluralidad de senales de mezcla descendente, mezclando la al menos una senal mejorada en dialogo con al menos otra de dicho subconjunto de la pluralidad de senales de mezcla descendente.
Con esta disposicion, el descodificador no tiene que reconstruir la configuracion de canales completa para llevar a cabo la mejora del dialogo, por lo que se reduce la complejidad. En lugar de ello, el descodificador reconstruye los canales que se requieren para la aplicacion de la mejora del dialogo. Esto incluye, en particular, un subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros recibidos para la mejora del dialogo. Una vez que se ha llevado a cabo la mejora del dialogo, esto es, cuando se ha determinado al menos una senal mejorada en dialogo basandose en los parametros para la mejora del dialogo y en el subconjunto de la pluralidad de canales con respecto al cual se han definido estos parametros, se determinan versiones mejoradas en dialogo de las senales de mezcla descendente recibidas, al someter la(s) senal(es) mejorada(s) en dialogo a un procedimiento de mezcla. Como resultado de ello, se producen versiones mejoradas en dialogo de las senales de mezcla descendente para su subsiguiente reproduccion por parte del sistema de audio.
En realizaciones proporcionadas a modo de ejemplo, una operacion de mezcla en sentido ascendente puede ser completa (reconstruccion del conjunto completo de canales codificados) o parcial (reconstruccion de un subconjunto de los canales).
Tal y como se utiliza en esta memoria, una senal de mezcla descendente se refiere a una senal que es una combinacion de una o mas senales / canales.
Tal y como se utiliza en esta memoria, mezclar en sentido ascendente parametricamente se refiere a la reconstruccion de una o mas senales / canales a partir de una senal de mezcla descendente por medio de tecnicas parametricas. Se hace enfasis en que las realizaciones proporcionadas a modo de ejemplo que se divulgan en esta memoria no estan limitadas por el contenido basado en canales (en el sentido de senales de audio asociadas con direcciones, angulos y/o posiciones en el espacio invariables o predefinidos), sino que tambien se extienden a contenido basado en objetos.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, en la etapa de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente parametricamente, se utilizan senales no descorrelacionadas con el fin de reconstruir el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo.
Esto es ventajoso en tanto en cuanto reduce la complejidad computacional, al mismo tiempo que mejora la calidad de las versiones mejoradas en dialogo resultantes de las senales de mezcla descendente (esto es, la calidad de la salida). Con mas detalle, las ventajas obtenidas mediante el uso de senales descorrelacionadas a la hora de mezclar en sentido ascendente, se ven reducidas por la subsiguiente mezcla a la que se somete la senal mejorada en dialogo. Por lo tanto, el uso de senales descorrelacionadas puede, ventajosamente, omitirse, con lo que se ahorra complejidad de computacion. De hecho, el uso de senales descorrelacionadas en la mezcla en sentido ascendente puede, en combinacion con la mejora del dialogo, dar lugar a una peor calidad, puesto que puede tener como resultado una reverberacion descorrelacionadora en el dialogo mejorado.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, la mezcla se realiza con arreglo a parametros de mezcla que describen una contribucion de la al menos una senal mejorada en dialogo a las versiones mejoradas en dialogo del subconjunto de la pluralidad de senales de mezcla descendente. Pueden existir, por tanto, algunos parametros de mezcla que describen el modo como mezclar la al menos una senal mejorada en dialogo al objeto de proporcionar versiones mejoradas en dialogo del subconjunto de la pluralidad de senales de mezcla descendente. Por ejemplo, los parametros de mezcla pueden darse en la forma de factores de ponderacion, o pesos, que describen cuanto de la al menos una senal mejorada en dialogo ha de mezclarse en cada una de las senales de mezcla descendente del subconjunto de la pluralidad de senales de mezcla descendente, para obtener las versiones mejoradas en dialogo del subconjunto de la pluralidad de senales de mezcla descendente. Tales pesos pueden darse, por ejemplo, en la forma de parametros de representacion que son indicativos de las posiciones espaciales asociadas con la al menos una senal mejorada en dialogo, en relacion con posiciones espaciales asociadas con la pluralidad de canales, y, por tanto, el subconjunto correspondiente de senales de mezcla descendente. De acuerdo con otros ejemplos, los parametros de mezcla pueden indicar si la al menos una senal mejorada en dialogo ha de contribuir, o no, tal como estar incluida en, una particular de la version mejorada en dialogo del subconjunto de senales de mezcla descendente. Por ejemplo, un '1' puede indicar que una senal mejorada en dialogo ha de incluirse a la hora de formar una particular de la version mejorada en dialogo de las senales de mezcla descendente, y un '0' puede indicar que esta no debe ser incluida.
En la etapa de someter la al menos una senal mejorada en dialogo a mezcla de tal manera que se proporcionen versiones mejoradas en dialogo del subconjunto de senales de mezcla descendente, las senales mejoradas en dialogo pueden ser mezcladas con otras senales / canales.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, la al menos una senal mejorada en dialogo se mezcla con canales que se han reconstruido en la etapa de mezcla ascendente, pero que no han sido sometidos a mejora del dialogo. Mas detalladamente, la etapa de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente parametricamente, puede comprender reconstruir al menos un canal adicional, ademas de la pluralidad de canales con respecto a los cuales se han definido los parametros para la mejora del dialogo, y de tal manera que la mezcla comprende mezclar el al menos un canal adicional conjuntamente con la al menos una senal mejorada en dialogo. Por ejemplo, todos los canales que se mezclan en sentido descendente para formar el subconjunto de la pluralidad de senales de mezcla descendente pueden ser reconstruidos e incluidos en la mezcla. En tales realizaciones, existe, por lo comun, una correspondencia directa entre cada senal mejorada en dialogo y el canal.
De acuerdo con otras realizaciones proporcionadas a modo de ejemplo, la al menos una senal mejorada en dialogo se mezcla con el subconjunto de la pluralidad de senales de mezcla descendente. Con mayor detalle, la etapa de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente parametricamente, puede comprender reconstruir unicamente el subconjunto de la pluralidad de canales con respecto al cual se definen los parametros para la mejora del dialogo, y la etapa de aplicar la mejora del dialogo puede comprender predecir y mejorar un componente de dialogo a partir del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, utilizando los parametros para la mejora del dialogo, a fin de proporcionar la al menos una senal mejorada en dialogo, y la mezcla puede comprender mezclar la al menos una senal mejorada en dialogo con el subconjunto de la pluralidad de senales de mezcla descendente. Tales realizaciones sirven, por lo tanto, para predecir y mejorar el contenido de dialogo y mezclarlo para formar el subconjunto de la pluralidad de senales de mezcla descendente.
Generalmente, debe apreciarse que un canal puede comprender contenido de dialogo que se mezcla con contenido que no es de dialogo. Por otra parte, el contenido de dialogo correspondiente a un unico dialogo puede ser mezclado en varios canales. Con la prediccion de un componente de dialogo a partir del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, quiere decirse generalmente que el contenido de dialogo es extrafdo, es decir, separado de los canales y combinado con el fin de reconstruir el dialogo.
La calidad de la mejora del dialogo puede, adicionalmente, ser mejorada recibiendo y utilizando una senal de audio que representa dialogo. Por ejemplo, la senal de audio que representa dialogo puede ser codificada a una baja velocidad de transferencia de bits, lo que provoca senales espurias que son bien audibles cuando se escuchan por separado. Sin embargo, cuando se utilizan conjuntamente con la mejora parametrica del dialogo, es decir, en la etapa de aplicar la mejora del dialogo al subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, utilizando los parametros para la mejora del dialogo, es posible perfeccionar la mejora del dialogo, por ejemplo, en terminos de calidad de audio. Mas particularmente, el metodo puede comprender, adicionalmente: recibir una senal de audio que representa dialogo, de tal manera que la etapa de aplicar la mejora del dialogo comprende aplicar la mejora del dialogo al subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, adicionalmente utilizando la senal de audio que representa dialogo.
En algunas realizaciones, los parametros de mezcla pueden estar ya disponibles en el descodificador, es decir, pueden estar codificados en hardware. Este sera el caso, en particular, si la al menos una senal mejorada en dialogo es siempre mezclada de la misma manera, por ejemplo, si esta es siempre mezclada con los mismos canales reconstruidos. En otras realizaciones, el metodo comprende recibir parametros de mezcla para la etapa de someter a mezcla la al menos una senal mejorada en dialogo. Por ejemplo, los parametros de mezcla pueden formar parte de los parametros de mejora del dialogo.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, el metodo comprende recibir parametros de mezcla que describen un esquema de mezcla en sentido descendente que describe en que senal de mezcla descendente es mezclado cada uno de la pluralidad de canales. Por ejemplo, si cada senal mejorada en dialogo corresponde a un canal, que, a su vez, es mezclado con otros canales reconstruidos, la mezcla se lleva a cabo de acuerdo con el esquema de mezcla en sentido descendente, de tal modo que cada canal es mezclado en la senal de mezcla descendente correcta.
El esquema de mezcla en sentido descendente puede variar con el tiempo, es decir, puede ser dinamico, con lo que se incrementa la flexibilidad del sistema.
El metodo puede comprender, de manera adicional, recibir datos que identifican el subconjunto de la pluralidad de canales con respecto al cual se han definido para la mejora del dialogo. Por ejemplo, los datos que identifican el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, pueden ser incluidos en los parametros para la mejora del dialogo. De esta manera, puede senalarse al descodificador con respecto a que canales ha de llevarse a cabo la mejora del dialogo. Alternativamente, tal informacion puede hacerse disponible en el descodificador, por ejemplo, al estar codificado en hardware, lo que significa que los parametros para la mejora del dialogo son siempre definidos con respecto a los mismos canales. En particular, el metodo puede incluir, adicionalmente, recibir informacion que indica que senales de entre las senales mejoradas en dialogo han de ser sometidas a mezcla. Por ejemplo, el metodo de acuerdo con esta variante puede llevarse a cabo por medio de un sistema de descodificacion que funciona en un modo particular, de tal manera que las senales mejoradas en dialogo no se mezclan de vuelta hasta formar un conjunto completamente identico de senales de mezcla descendente, como era el uso para proporcionar las senales mejoradas en dialogo. De esta manera, la operacion de mezcla puede, en la practica, restringirse a una seleccion incompleta (una o mas senales) del subconjunto de la pluralidad de senales de mezcla descendente. Las demas senales mejoradas en dialogo se anaden a senales de mezcla descendente ligeramente diferentes, tales como senales de mezcla descendente que se han sometido a una conversion de formato. Una vez que los datos que identifican el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, y el esquema de mezcla en sentido descendente son conocidos, es posible encontrar el subconjunto de la pluralidad de senales de mezcla descendente en el que es mezclado en sentido descendente el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo. Con mayor detalle, los datos que identifican el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, conjuntamente con el esquema de mezcla en sentido descendente, pueden ser utilizados para encontrar el subconjunto de la pluralidad de senales de mezcla descendente en el que se mezcla en sentido descendente el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo.
Las etapas de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente, aplicar la mejora del dialogo y mezclar pueden llevarse a cabo como operaciones matriciales definidas por los parametros de reconstruccion, los parametros para la mejora del dialogo y los parametros de mezcla, respectivamente. Esto es ventajoso por cuanto el metodo puede ser implementado de una manera eficiente llevando a cabo una multiplicacion matricial.
Es mas, el metodo puede comprender combinar, por multiplicacion matricial, las operaciones matriciales correspondientes a las etapas de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente, aplicar la mejora del dialogo y mezclar, en una unica operacion matricial, antes de su aplicacion al subconjunto de la pluralidad de senales de mezcla descendente. De esta forma, las diferentes operaciones matriciales pueden ser combinadas en una unica operacion matricial, con lo que se mejora adicionalmente la eficiencia y se reduce la complejidad computacional del metodo.
Los parametros de mejora del dialogo y/o los parametros de reconstruccion pueden ser dependientes de la frecuencia, con lo que se permite que los parametros difieran entre bandas de frecuencias diferentes. De este modo, la mejora del dialogo y la reconstruccion pueden ser optimizadas en las diferentes bandas de frecuencias, con lo que se mejora la calidad del audio de salida.
Con mayor detalle, los parametros para la mejora del dialogo pueden ser definidos con respecto a un primer conjunto de bandas de frecuencias, y los parametros de reconstruccion pueden ser definidos con respecto a un segundo conjunto de bandas de frecuencias, de tal manera que el segundo conjunto de bandas de frecuencias es diferente del primer conjunto de bandas de frecuencias. Esto puede ser ventajoso a la hora de reducir la velocidad de transferencia de bits para transmitir los parametros para la mejora del dialogo y los parametros de reconstruccion en una corriente de bits, cuando, por ejemplo, el procedimiento de reconstruccion requiere parametros con una resolucion en frecuencia mas alta que el procedimiento de mejora del dialogo, y/o cuando, por ejemplo, el procedimiento de mejora del dialogo se lleva a cabo en una anchura de banda mas pequena que la del procedimiento de reconstruccion.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, los valores (preferiblemente discretos) de los parametros para la mejora del dialogo pueden ser recibidos repetidamente y asociados con un primer conjunto de instantes de tiempo, en el que los respectivos valores se aplican exactamente. En la presente divulgacion, es la intencion que la afirmacion del efecto de que un valor se aplica, o es conocido, “exactamente” en un cierto instante de tiempo, signifique que el valor ha sido recibido por el descodificador, por lo comun, conjuntamente con una indicacion explfcita o implfcita de un instante de tiempo en el que este se aplica. En contraposicion, un valor que se ha interpolado o predicho para un cierto instante de tiempo no se aplica “exactamente” en ese instante de tiempo en este sentido, sino que es una estimacion por parte del descodificador. “Exactamente” no implica que el valor consiga una reconstruccion exacta de una senal de audio. Entre instantes de tiempo consecutivos del conjunto, puede prescribirse una primera configuracion de interpolacion predefinida. Una configuracion de interpolacion, que define el modo como estimar un valor aproximado de un parametro en un instante de tiempo situado entre dos instantes de tiempo lfmite del conjunto en los cuales se conocen los valores del parametro, puede ser, por ejemplo, una interpolacion lineal o constante por tramos. Si el instante de tiempo de prediccion esta alejado a una cierta distancia de uno de los instantes de tiempo lfmite, una configuracion de interpolacion lineal se basa en la suposicion de que el valor del parametro en el instante de tiempo de prediccion depende linealmente de dicha distancia, en tanto que una configuracion de interpolacion constante por tramos garantiza que el valor del parametro no cambia entre cada valor conocido y el siguiente. Pueden existir tambien otras configuraciones de interpolacion posibles, incluyendo, por ejemplo, configuraciones que se sirven de polinomios de grados mayores que uno, curvas de aproximacion, funciones racionales, procedimientos gaussianos, polinomios trigonometricos, aproximacion de ondas pequenas, o una combinacion de los mismos, a fin de estimar el valor del parametro en un instante de tiempo de prediccion dado. El conjunto de instantes de tiempo puede no ser explfcitamente transmitido o establecido, sino, en lugar de ello, inferido a partir de la configuracion de interpolacion, por ejemplo, el punto de partida o punto final de un intervalo de interpolacion lineal, el cual puede ser implfcitamente fijado en los lfmites de trama de un algoritmo de tratamiento de audio. Los parametros de reconstruccion pueden ser recibidos de una forma similar: los valores (preferiblemente discretos) de los parametros de reconstruccion pueden estar asociados con un segundo conjunto de instantes de tiempo, y puede llevarse a cabo una segunda configuracion de interpolacion entre instantes de tiempo consecutivos.
El metodo puede incluir, de manera adicional, seleccionar un tipo de parametro, consistiendo el tipo bien en parametros para la mejora del dialogo, o bien en parametros de reconstruccion, de tal manera que el conjunto de instantes de tiempo asociado con el tipo seleccionado incluye al menos un instante de prediccion que es un instante de tiempo que esta fuera del conjunto asociado con el tipo no seleccionado. Por ejemplo, si el conjunto de instantes de tiempo con los que estan asociados los parametros de reconstruccion incluye un cierto instante de tiempo que esta fuera del conjunto de instantes de tiempo con los que estan asociados los parametros para la mejora del dialogo, ese cierto instante de tiempo sera un instante de prediccion si el tipo seleccionado de parametro son los parametros de reconstruccion y el tipo no seleccionado de parametro son los parametros para la mejora del dialogo. De una manera similar, en otra situacion, el instante de prediccion puede, en lugar de ello, ser encontrado en el conjunto de instantes de tiempo con los que estan asociados los parametros para la mejora del dialogo, y se conmutaran los tipos seleccionado y no seleccionado. Preferiblemente, el tipo de parametro seleccionado es el tipo que tenga la mas alta densidad de instantes de tiempo con valores de parametro asociados; en un caso de uso dado, esto puede reducir la cantidad total de operaciones de prediccion necesarias.
El valor de los parametros del tipo no seleccionado, en el instante de prediccion, puede ser predicho. La prediccion puede llevarse a cabo utilizando un metodo de prediccion adecuado, tal como la interpolacion o la extrapolacion, y a la vista de la configuracion de interpolacion predefinida para los tipos de parametros.
El metodo puede incluir la etapa de computar, basandose en al menos el valor predicho de los parametros del tipo no seleccionado y en un valor recibido de los parametros del tipo seleccionado, una operacion de tratamiento compuesta que representa al menos la mezcla en sentido ascendente del subconjunto de las senales de mezcla descendente, seguida de la mejora del dialogo en el instante de prediccion. Ademas de en valores de los parametros de reconstruccion y de los parametros para la mejora del dialogo, la computacion puede estar basada en otros valores, tales como valores de parametros para la mezcla, y la operacion de tratamiento compuesta puede representar tambien la etapa de mezclar una senal de mejora de dialogo de vuelta hasta formar una senal de mezcla descendente.
El metodo puede incluir la etapa de computar, basandose en al menos un valor (recibido o predicho) de los parametros del tipo seleccionado y en al menos un valor (recibido o predicho) de los parametros del tipo no seleccionado, de tal manera que al menos alguno de los valores es un valor recibido, la operacion de tratamiento compuesta en un instante de tiempo adyacente del conjunto asociado con el tipo seleccionado o el no seleccionado. El instante de tiempo adyacente puede ser bien mas temprano o bien mas tardfo que el instante de prediccion, y no es esencial exigir que el instante de tiempo adyacente sea el vecino mas proximo en terminos de distancia.
En el metodo, las etapas de mezclar en sentido ascendente el subconjunto de la pluralidad de senales de mezcla descendente y aplicar la mejora del dialogo pueden llevarse a cabo entre el instante de prediccion y el instante de tiempo adyacente, por medio de un valor interpolado de la operacion de tratamiento compuesta computada. Interpolando la operacion de tratamiento compuesta computada, es posible conseguir una complejidad computacional reducida. Al no interpolar los dos tipos de parametros por separado, y al no formar un producto (por ejemplo, una operacion de tratamiento compuesta) en cada punto de interpolacion, pueden requerirse menos operaciones matematicas de adicion y de multiplicacion para conseguir un resultado igualmente util en terminos de la calidad de audicion percibida.
De acuerdo con realizaciones proporcionadas a modo de ejemplo adicionales, la operacion de tratamiento compuesta en el instante de tiempo adyacente puede computarse basandose en un valor recibido de los parametros del tipo seleccionado y en un valor predicho de los parametros del tipo no seleccionado. Es tambien posible la situacion inversa en la que la operacion de tratamiento compuesta en el instante de tiempo adyacente puede computarse basandose en un valor predicho de los parametros del tipo seleccionado y en un valor recibido de los parametros del tipo no seleccionado. Situaciones en las que un valor del mismo tipo de parametro es un valor recibido en el instante de prediccion y un valor predicho en el instante de tiempo adyacente, pueden producirse si, por ejemplo, los mismos instantes del conjunto con el que esta asociado el tipo de parametro seleccionado se encuentran situados estrictamente entre los instantes de tiempo del conjunto con el que esta asociado el tipo de parametro no seleccionado.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, la operacion de tratamiento compuesta en el instante de tiempo adyacente puede ser computada basandose en un valor recibido de los parametros del tipo de parametro seleccionado, y en un valor recibido de los parametros del tipo de parametro no seleccionado. Tales situaciones pueden producirse, por ejemplo, si se reciben valores exactos de parametros de los dos tipos para los lfmites de trama, pero tambien -para el tipo seleccionado- para un instante de tiempo a medio camino entre los lfmites. Entonces el instante de tiempo adyacente es un instante de tiempo asociado con un lfmite de trama, y el instante de tiempo de prediccion esta situado a medio camino entres los lfmites de trama.
De acuerdo con realizaciones proporcionadas a modo de ejemplo adicionales, el metodo puede incluir, de manera adicional, seleccionar, basandose en las primera y segunda configuraciones de interpolacion, una configuracion de interpolacion compuesta de acuerdo con una regla de seleccion predefinida, de tal manera que la interpolacion de las respectivas operaciones de tratamiento compuestas computadas es de conformidad con la configuracion de interpolacion compuesta. La regla de seleccion predefinida puede haberse definido para el caso de que las primera y segunda configuraciones de interpolacion sean iguales, y puede tambien haberse definido para el caso de que las primera y segunda configuraciones de interpolacion sean diferentes. Como ejemplo de ello, si la primera configuracion de interpolacion es lineal (y, preferiblemente, si existe una relacion lineal entre parametros y propiedades cuantitativas de la operacion de mejora de dialogo) y la segunda configuracion de interpolacion es constante por tramos, puede seleccionarse la configuracion de interpolacion compuesta de manera que sea lineal.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, la prediccion del valor de los parametros del tipo no seleccionado en el instante de prediccion se realiza de acuerdo con la configuracion de interpolacion para los parametros del tipo no seleccionado. Esto puede implicar el uso de un valor exacto del parametro del tipo no seleccionado, en un instante de tiempo del conjunto asociado con el tipo no seleccionado, que es adyacente al instante de prediccion.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, la operacion de tratamiento compuesta se computa como una unica operacion matricial y, a continuacion, se aplica al subconjunto de la pluralidad de senales de mezcla descendente. Preferiblemente, las etapas de mezclar en sentido descendente y aplicar la mejora del dialogo se llevan a cabo como operaciones matriciales definidas por los parametros de reconstruccion y los parametros para la mejora del dialogo. Como configuracion de interpolacion compuesta, puede seleccionarse una configuracion de interpolacion lineal, y el valor interpolado de las respectivas operaciones de tratamiento compuestas computadas puede computarse por interpolacion matricial lineal. La interpolacion puede restringirse a los elementos de matriz que cambian entre el instante de prediccion y el instante de tiempo adyacente, a fin de reducir la complejidad computacional.
De acuerdo con realizaciones proporcionadas a modo de ejemplo, las senales de mezcla descendente recibidas pueden ser segmentadas en tramas temporales, y el metodo puede incluir, en una operacion de estado estacionario, una etapa consistente en recibir al menos un valor de los tipos de parametro respectivos que se aplica exactamente en un instante de tiempo de cada trama temporal. Tal y como se utiliza en esta memoria, la expresion 'estado estacionario' se refiere a un funcionamiento que no implica la presencia de porciones inicial y final, por ejemplo, una cancion, y a un funcionamiento que no implica transitorios internos que necesiten subdivision de tramas.
De acuerdo con un segundo aspecto, se proporciona un producto de programa informatico que comprende un medio legible por computadora con instrucciones para llevar a cabo el metodo del primer aspecto. El medio legible por computadora puede ser un medio o dispositivo legible por computadora no transitorio.
De acuerdo con un tercer aspecto, se proporciona un descodificador para mejorar el dialogo en un sistema de audio, de tal manera que el descodificador comprende:
un componente de recepcion, configurado para recibir:
una pluralidad de senales de mezcla descendente, que son una mezcla en sentido descendente d una pluralidad de canales mas grande,
parametros para la mejora del dialogo, de tal manera que los parametros se definen con respecto a un subconjunto de la pluralidad de canales que incluye canales que comprenden dialogo, de modo que el subconjunto de la pluralidad de canales se mezcla en sentido descendente hasta formar un subconjunto de la pluralidad de senales de mezcla descendente, y
parametros de reconstruccion, que permiten la reconstruccion parametrica de canales que son mezclados en sentido descendente hasta formar el subconjunto de la pluralidad de senales de mezcla descendente;
un componente de mezcla en sentido ascendente, configurado para mezclar en sentido ascendente unicamente el subconjunto de la pluralidad de senales de mezcla descendente parametricamente basandose en los parametros de reconstruccion, a fin de reconstruir unicamente un subconjunto de la pluralidad de canales que incluye el subconjunto de la pluralidad de canales con respecto al cual se definen los parametros para la mejora del dialogo; y
un componente de mejora del dialogo, configurado para aplicar una mejora del dialogo al subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, utilizando los parametros para la mejora del dialogo con el fin de proporcionar al menos una senal mejorada en dialogo; y
un componente de mezcla, configurado para proporcionar versiones mejoradas en dialogo del subconjunto de la pluralidad de senales de mezcla descendente, mezclando la al menos una senal mejorada en dialogo con al menos otro de dichos subconjuntos de la pluralidad de senales de mezcla descendente.
Generalmente, el segundo y el tercer aspectos pueden comprender las mismas caractensticas y ventajas del primer aspecto.
II. Ejemplos de realizacion
La Figura 1a y la Figura 1b ilustran esquematicamente una configuracion de canales de 7.1+4 (correspondiente a una configuracion de altavoz de 7.1+4) con tres canales delanteros L, C, R, dos canales de entorno LS, Rs, dos canales traseros LB, RB, cuatro canales elevados TFL, TFR, TBL, TBR, y un canal de efectos de baja frecuencia, LFE. En el procedimiento de codificar la configuracion de canales de 7.1+4, los canales son, por lo comun, mezclados en sentido descendente (esto es, combinados) en un numero mas pequeno de senales, a las que se hace referencia como senales de mezcla descendente. En el procedimiento de mezcla en sentido descendente, los canales pueden ser combinados de diferentes maneras para formar diferentes configuraciones de mezcla descendente. La Figura 1a ilustra una primera configuracion de mezcla descendente de 5.1 100a, con senales de mezcla descendente l, c, r, ls, rs, lfe. Los drculos de la figura indican que canales son mezclados en sentido descendente para formar que senales de mezcla descendente. La Figura 1b ilustra una segunda configuracion de mezcla descendente de 5.1 100b, con senales de mezcla descendente l, c, r, tl, tr, lfe. La segunda configuracion de mezcla descendente de 5.1 100b es diferente de la configuracion de mezcla descendente 5.1 100a en que los canales se combinan de un modo diferente. Por ejemplo, en la primera configuracion de mezcla descendente 100a, los canales L y TFL son mezclados en sentido descendente para formar la senal de mezcla descendente I, en tanto que, en la segunda configuracion de mezcla descendente 100b, los canales L, LS, LB son mezclados en sentido descendente para formar la senal de mezcla descendente I. Se hace referencia, en ocasiones, a la configuracion de mezcla descendente, en esta memoria, como un esquema de mezcla en sentido descendente que describe que canales son mezclados en sentido descendente para formar que senales de mezcla descendente. La configuracion de mezcla descendente, o esquema de mezcla en sentido descendente, puede ser dinamica por cuanto puede variar ente tramas temporales de un sistema de codificacion de audio. Por ejemplo, puede utilizarse el primer esquema de mezcla en sentido descendente 100a en algunas tramas temporales, en tanto que puede utilizarse el segundo esquema de mezcla en sentido descendente 100b en otras tramas temporales. En el caso de que el esquema de mezcla en sentido descendente vane dinamicamente, el codificador puede enviar datos al descodificador que indican que esquema de mezcla en sentido descendente se ha utilizado a la hora de codificar los canales.
La Figura 2 ilustra un descodificador 200 de la tecnica anterior para la mejora del dialogo. El descodificador comprende tres componentes principales, un componente de recepcion 202, un componente de mezcla en sentido ascendente, o reconstruccion, 204, y un componente de mejora de dialogo (DE - “dialog enhancement”- ) 206. El descodificador 200 es del tipo que recibe una pluralidad de senales de mezcla descendente 212, reconstruye la configuracion completa 218 de los canales basandose en las senales de mezcla descendente 212 recibidas, lleva a cabo una mejora del dialogo con respecto a la configuracion de canales completa 218, o al menos un subconjunto de esta, y suministra como salida una configuracion completa de canales mejoradosen dialogo 220.
Con mas detalle, el componente de recepcion 202 se ha configurado para recibir una corriente de datos 210 (a la que se hace referencia, en ocasiones, como corriente de bits) de un codificador. La corriente de datos 210 puede comprender diferentes tipos de datos, y el componente de recepcion 202 puede descodificar la corriente de datos recibida 210 en diferentes tipos de datos. En este caso, la corriente de datos comprende una pluralidad de senales de mezcla descendente 212, parametros de reconstruccion 214 y parametros de mejora de dialogo 216.
El componente de mezcla en sentido ascendente 204 reconstruye, entonces, la configuracion completa de canales basandose en la pluralidad se senales de mezcla descendente 212 y en los parametros de reconstruccion 214. En otras palabras, el componente de mezcla en sentido ascendente 204 reconstruye todos los canales 218 que fueron mezclados en sentido descendente para obtener las senales de mezcla descendente 212. Por ejemplo, el componente de mezcla en sentido ascendente 204 puede reconstruir toda la configuracion de canales parametricamente, basandose en los parametros de reconstruccion 214.
En el ejemplo ilustrado, las senales de mezcla descendente 212 corresponden a las senales de mezcla descendente de una de las configuraciones de mezcla descendente de 5.1 de las Figuras 1a y 1b, y los canales 218 corresponden a los canales de la configuracion de canales de 7.1+4 de las Figuras 1a y 1b. Sin embargo, los principios del descodificador 200 se aplicaran, por supuesto, a otras configuraciones de canales / configuraciones de mezcla descendente.
Los canales 218 reconstruidos, o al menos un subconjunto de los canales 218 reconstruidos, son entonces sometidos a una mejora del dialogo por parte del componente de mejora de dialogo 206. Por ejemplo, el componente de mejora de dialogo 206 puede llevar a cabo una operacion matricial sobre los canales 218 reconstruidos, o al menos sobre un subconjunto de los canales 218 reconstruidos, al objeto de suministrar como salida canales mejorados en dialogo. Tal operacion matricial se define, por lo comun, por los parametros de mejora de dialogo 216.
A modo de ejemplo, el componente de mejora de dialogo 206 puede someter los canales C, L, R a una mejora del dialogo, a fin de proporcionar canales mejorados en dialogo Cde, Lde, Rde, en tanto que los demas canales unicamente se hacen pasar a su traves como se indica por las lmeas discontinuas de la Figura 2. En tal situacion, los parametros de mejora de dialogo se han definido unicamente con respecto a los canales C, L, R, esto es, con respecto a un subconjunto de la pluralidad de canales 218. Por ejemplo, los parametros de mejora de dialogo 216 pueden definir una matriz 3 x 3 que puede ser aplicada a los canales C, L, R.
Figure imgf000009_0002
Alternativamente, los canales no implicados en la mejora del dialogo pueden hacerse pasar a su traves por medio de la matriz de mejora de dialogo con 1 en las posiciones diagonales correspondientes y 0 en todos los demas elementos de las filas y columnas correspondientes.
Figure imgf000009_0001
El componente de mejora de dialogo 206 puede llevar a cabo una mejora del dialogo con arreglo a diferentes modos. Un primer modo, al que se hace referencia en la presente memoria como mejora parametrica independiente de canales, se ilustra en la Figura 3. La mejora del dialogo se lleva a cabo con respecto a al menos un subconjunto de los canales 218 reconstruidos, por lo comun, los canales que comprenden dialogo, aqrn, los canales L, R, C. Los parametros de mejora de dialogo 216 comprenden un conjunto de parametros para cada uno de los canales que se han de mejorar. En el ejemplo ilustrado, los conjuntos de parametros vienen dados por parametros p-i, p2, p3 correspondientes a los canales L, R, C, respectivamente. En principio, los parametros transmitidos en este modo representan la contribucion relativa del dialogo a la energfa de mezcla, para un mosaico o losa de tiempo-frecuencia de un canal. El factor de ganancia g puede ser expresado como:
Figure imgf000010_0002
donde G es una ganancia de mejora de dialogo, expresada en dB. La ganancia de mejora de dialogo G puede, por ejemplo, ser suministrada como entrada por un usuario, y no esta, en consecuencia, incluida, por lo comun, en la corriente de datos 210 de la Figura 2.
Cuando se esta en el modo de mejora parametrica independiente de canales, el componente de mejora de dialogo 206 multiplica cada canal por su parametro pi correspondiente y el factor de ganancia g, y anade entonces el resultado al canal con el fin de producir canales de mejora de dialogo 220, aqrn, Lde, Rde, Cde. Utilizando notacion matricial, esto puede escribirse como:
Xe = (I + diag(p) ■ g) ■ X
donde X es una matriz que tiene por filas los canales 218 (L, R, C), Xe es una matriz que tiene por filas los canales mejorados en dialogo 220, p es un vector fila con entradas correspondientes a los parametros de mejora de dialogo pi, p2, p3 para cada canal, y diag(p) es una matriz diagonal que tiene las entradas de p en la diagonal.
En la Figura 4 se ilustra un segundo modo de realizacion, al que se hace referencia en esta memoria como prediccion de dialogo de multiples canales. En este modo, el componente de mejora de dialogo 206 combina multiples canales 218 en una combinacion lineal con el fin de predecir una senal de dialogo 419. Aparte de la adicion coherente de la presencia del dialogo en multiples canales, esta solucion puede aprovecharse de la sustraccion del ruido de fondo en un canal que comprende dialogo utilizando otro canal sin dialogo. Para este proposito, los parametros de mejora de dialogo 216 comprenden un parametro para cada canal 218, que define el coeficiente del canal correspondiente a la hora de formar la combinacion lineal. En el ejemplo ilustrado, los parametros de mejora de dialogo 216 comprenden parametros p-i, p2, p3 correspondientes a los canales L, R, C, respectivamente. Por lo comun, pueden utilizarse algoritmos de optimizacion de error cuadratico medio mmimo (MMSE - “minimum mean square error”- ) para generar los parametros de prediccion en el lado del codificador.
El componente de mejora de dialogo 206 puede entonces mejorar, es decir, producir ganancia en, la senal de dialogo predicha 419 por aplicacion de un factor de ganancia g, y anadir la senal de dialogo mejorada a los canales 218, a fin de producir los canales mejorados en dialogo 220. Para anadir la senal de dialogo mejorada a los canales correctos en la posicion espacial adecuada (de otro modo, ello no mejorara el dialogo con la ganancia esperada), el reparto entre los tres canales es transmitido por coeficientes de representacion, aqrn, r-i, r2, r3. Con la restriccion de que los coeficientes de representacion son conservativos de la energfa, esto es:
r12 r2 r32 = 1
El tercer coeficiente de representacion r3 puede ser determinado a partir de los dos primeros coeficientes, tal como:
Figure imgf000010_0003
Utilizando notacion matricial, la mejora del dialogo llevada a cabo por el componente de mejora de dialogo 206 cuando se encuentra en el modo de prediccion de dialogo de multiples canales, puede escribirse como:
Xe = (I g • H • P) ■ X
o:
Figure imgf000010_0001
donde I es la matriz identidad, X es una matriz que tiene por filas los canales 218 (L, R, C), Xe es una matriz que tiene por filas los canales mejorados en dialogo 220, P es un vector fila con entradas correspondientes a los parametros de mejora de dialogo pi, p2, p3 para cada canal, H es un vector columna que tiene como entradas los coeficientes de representacion r-i, r2, r3, y g es el factor de ganancia, de manera que:
c_
g = 1020 - 1 .
De acuerdo con un tercer modo, al que se hace referencia en esta memoria como hforido de forma de ondaparametrico, el componente de mejora de dialogo 206 puede combinar cualquiera de entre el primer y el segundo modos con la transmision de una senal de audio adicional (una senal de forma de onda) que representa dialogo. Esta ultima es, por lo comun, codificada a una baja velocidad de transferencia de bits, lo que provoca senales espurias bien audibles cuando se escuchan por separado. Dependiendo de las propiedades de senal de los canales 218 y del dialogo, asf como de la velocidad de transferencia de bits asignada a la codificacion de la senal de forma de onda de dialogo, el codificador tambien determina un parametro de fusion, ac, que indica el modo como han de dividirse las contribuciones de ganancia ente la contribucion parametrica (originaria del primer o del segundo modo) y la senal de audio adicional que representa dialogo.
En combinacion con el segundo modo, la mejora del dialogo del tercer modo puede escribirse como:
Xe = H ■ g i ■ dc + (I + H ■ g2 ■ P) • X
o:
Figure imgf000011_0001
donde dc es la senal de audio adicional que representa dialogo, con:
Figure imgf000011_0002
Para la combinacion con la mejora independiente de canal (el primer modo), se recibe para cada canal 218 una senal
de audio dc,i que representa dialogo. Escribiendo
Figure imgf000011_0003
la mejora del dialogo puede escribirse como:
Xe = gi ■ Dc (I + diag(p) ■ g2) • X .
La Figura 5 ilustra un descodificador 500 de acuerdo con realizaciones proporcionadas a modo de ejemplo. El descodificador 500 es del tipo que descodifica una pluralidad de senales de mezcla descendente, que son una mezcla descendente de una pluralidad mas grande de canales, para su reproduccion subsiguiente. En otras palabras, el descodificador 500 es diferente del descodificador de la Figura 2 en que no esta configurado para reconstruir la configuracion de canales completa.
El descodificador 500 comprende un componente de recepcion 502 y un bloque de mejora de dialogo 503 que comprende un componente de mezcla en sentido ascendente 504, un componente de mejora de dialogo 506 y un componente de mezcla 508.
Como se explica con referencia a la Figura 2, el componente de recepcion 502 recibe una corriente de datos 510 y la descodifica en sus componentes, en este caso, una pluralidad de senales de mezcla descendente 512 que constituyen una mezcla descendente de una pluralidad mas grande de canales (veanse las Figuras 1a y 1b), parametros de reconstruccion 514 y parametros para mejora de dialogo 516. En algunos casos, la corriente de datos 510 comprende, de manera adicional, datos indicativos de parametros de mezcla 522. Por ejemplo, los parametros de mezcla pueden formar parte de los parametros para la mejora del dialogo. En otros casos, los parametros de mezcla 522 se encuentran ya disponibles en el descodificador 500, por ejemplo, pueden estar codificados en hardware en el descodificador 500. En otros casos, se dispone de parametros de mezcla 522 para multiples conjuntos de parametros de mezcla, y los datos de la corriente de datos 510 proporcionan una indicacion de que conjunto de entre estos multiples conjuntos de parametros de mezcla se utiliza.
Los parametros para mejora de dialogo 516 se definen, por lo comun, con respecto a un subconjunto de la pluralidad de canales. Los datos que identifican el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para la mejora del dialogo, pueden estar incluidos en la corriente de datos recibida 510, por ejemplo, como parte de los parametros para mejora de dialogo 516. Alternativamente, el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo puede estar codificado en hardware en el descodificador 500. Por ejemplo, haciendo referencia a la Figura 1a, los parametros para mejora de dialogo 516 pueden haberse definido con respecto a canales L, TFL que se han mezclado en sentido descendente para formar la senal de mezcla descendente I, el canal C que esta comprimido en la senal de mezcla descendente c, y los canales R, TFR que se han mezclado en sentido descendente para formar la senal de mezcla descendente r. Para propositos de ilustracion, se supone que el dialogo esta unicamente presente los canales L, C y R. Ha de apreciarse que los parametros para mejora de dialogo 516 pueden haberse definido con respecto a canales que comprenden dialogo, tales como los canales L, C, R, pero tambien pueden haberse definido con respecto a canales que no comprenden dialogo, tales como los canales TFL, TFR, en este ejemplo. De esta manera, el ruido de fondo de un canal que comprende dialogo puede, por ejemplo, sustraerse utilizando otro canal sin dialogo.
El subconjunto de canales con respecto a los cuales se definen los parametros para mejora de dialogo 516, se mezcla en sentido descendente hasta formar un subconjunto 512a de la pluralidad de senales de mezcla descendente 512. En el ejemplo ilustrado, el subconjunto 512a de senales de mezcla descendente comprende las senales de mezcla descendente c, I y r. Este subconjunto de senales de mezcla descendente 512a se suministra como entrada al bloque de mejora de dialogo 503. El subconjunto relevante 512a de senales de mezcla descendente puede, por ejemplo, encontrarse basandose en el conocimiento del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo y el esquema de mezcla en sentido descendente.
El componente de mezcla en sentido ascendente 514 se sirve de tecnicas parametricas como es sabido en la tecnica, para la reconstruccion de canales que son mezclados en sentido descendente hasta formar el subconjunto de senales de mezcla descendente 512a. La reconstruccion esta basada en los parametros de reconstruccion 514. En particular, el componente de mezcla en sentido ascendente 504 reconstruye el subconjunto de la pluralidad de canales con respecto a los cuales se han definido los parametros para mejora de dialogo 516. En algunas realizaciones, el componente de mezcla en sentido ascendente 504 reconstruye unicamente el subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo 516. Tales realizaciones proporcionadas a modo de ejemplo se describiran con referencia a la Figura 7. En otras realizaciones, el componente de mezcla en sentido ascendente 504 reconstruye al menos un canal, ademas del subconjunto de la pluralidad con respecto al cual se han definido los parametros para mejora de dialogo 516. Tales realizaciones proporcionadas a modo de ejemplo se describiran con referencia a la Figura 6.
Los parametros de reconstruccion no solo pueden ser variables en el tiempo, sino que tambien pueden ser dependientes de la frecuencia. Por ejemplo, los parametros de reconstruccion pueden adoptar diferentes valores para diferentes bandas de frecuencias. Esto generalmente favorecera la calidad de los canales reconstruidos.
Como es sabido en la tecnica, la mezcla parametrica en sentido ascendente puede, generalmente, incluir la formacion de senales descorrelacionadas a partir de las senales de entrada que son sometidas a la mezcla en sentido ascendente, y la reconstruccion de senales parametricamente basandose en las senales de entrada y en las senales descorrelacionadas. Vease, por ejemplo, el libro “Spatial Audio Processing: MPEG Surround and Other Applications” (Tratamiento de audio espacial: entorno de MPEG y otras aplicaciones), por Jeroen Breebaart y Christof Faller, ISBN: 978-9-470-03350-0. Sin embargo, el componente de mezcla en sentido ascendente 504 lleva, preferiblemente, a cabo mezcla parametrica en sentido ascendente sin utilizar ninguna de tales senales descorrelacionadas. Las ventajas obtenidas por el uso de senales descorrelacionadas se ven, en este caso, reducidas por la subsiguiente mezcla en sentido descendente llevada a cabo en el componente de mezcla 508. Por lo tanto, el uso de senales descorrelacionadas puede, ventajosamente, ser omitido por el componente de mezcla en sentido ascendente 504, con lo que se ahorra complejidad de computacion. De hecho, el uso de senales descorrelacionadas en la mezcla en sentido ascendente, en combinacion con la mejora del dialogo, tendra como resultado una peor calidad, puesto que podna dar lugar a una reverberacion descorrelacionadora en el dialogo.
El componente de mejora de dialogo 506 aplica, entonces, la mejora del dialogo al subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo 516, a fin de producir al menos una senal mejorada en dialogo. En algunas realizaciones, la senal mejorada en dialogo corresponde a versiones mejoradas en dialogo del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo 516. Esto se explicara con mayor detalle mas adelante, con referencia a la Figura 6. En otras realizaciones, la senal mejorada en dialogo corresponde a un componente de dialogo predicho y mejorado del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo 516. Esto se explicara con mayor detalle mas adelante, con referencia a la Figura 7.
Similarmente a los parametros de reconstruccion, los parametros para mejora de dialogo pueden variar en el tiempo, asf como con la frecuencia. Con mayor detalle, los parametros para mejora de dialogo pueden adoptar diferentes valores para diferentes bandas de frecuencias. El conjunto de bandas de frecuencias con respecto al cual se han definido los parametros de reconstruccion puede diferir del conjunto de bandas de frecuencias con respecto al cual se han definido los parametros de mejora de dialogo.
El componente de mezcla 508 lleva a cabo, entonces, una mezcla basandose en la al menos una senal de mejora de dialogo, a fin de proporcionar versiones mejoradas en dialogo 520 del subconjunto 512a de senales de mezcla descendente. En el ejemplo ilustrado, las versiones mejoradas en dialogo 520 del subconjunto 512a de senales de mezcla descendente vienen dadas por cde, Ide, rDE, que corresponden a senales de mezcla descendente c, I, r, respectivamente.
La mezcla en sentido descendente puede realizarse de acuerdo con parametros de mezcla 522 que describen una contribucion de la al menos una senal mejorada en dialogo a las versiones mejoradas en dialogo 520 del subconjunto de senales de mezcla descendente 512a. En algunas realizaciones, vease la Figura 6, la al menos una senal mejorada en dialogo se mezcla conjuntamente con canales que han sido reconstruidos por el componente de mezcla en sentido ascendente 504. En tales casos, los parametros de mezcla 522 pueden corresponderse a un esquema de mezcla en sentido descendente, veanse las Figuras 1a y 1b, que describe en cuales de las senales de mezcla descendente mejoradas en dialogo 520 ha de mezclarse cada canal. En otras realizaciones, vease la Figura 7, la al menos una senal mejorada en dialogo se mezcla conjuntamente con el subconjunto 512a de senales de mezcla descendente. En tal caso, los parametros de mezcla 522 pueden corresponder a factores de ponderacion que describen el modo como la al menos una senal mejorada en dialogo debe ser ponderada dentro del subconjunto 512a de senales de mezcla descendente.
La operacion de mezcla en sentido ascendente llevada a cabo por el componente de mezcla en sentido ascendente 504, la operacion de mejora de dialogo llevada a cabo con el componente de mejora de dialogo 506, y la operacion de mezcla llevada a cabo por el componente de mezcla 508 son, por lo comun, operaciones lineales cada una de las cuales puede definirse por una operacion matricial, esto es, por un producto de matriz-vector. Esto es, al menos, verdadero si se omiten las senales descorrelacionadoras en la operacion de mezcla en sentido ascendente. En particular, la matriz asociada con la operacion de mezcla en sentido ascendente (U) se define por / puede ser deducida de los parametros de reconstruccion 514. A este respecto, ha de apreciarse que sigue siendo posible el uso de senales descorrelacionadoras en la operacion de mezcla en sentido ascendente, pero que la creacion de las senales descorrelacionadas no forma entonces parte de la operacion matricial para la mezcla en sentido ascendente. La operacion de mezcla en sentido ascendente con descorrelacionadores puede verse como una aproximacion en dos estadios. En un primer estadio, las senales de mezcla descendente suministradas como entrada son aportadas a una matriz de descorrelacion preliminar, y las senales suministradas como salida tras la aplicacion de la matriz de descorrelacion preliminar son, cada una de ellas, aportadas a un descorrelacionador. En un segundo estadio, las senales de mezcla descendente suministradas como entrada y las senales suministradas como salida desde los descorrelacionadores son aportadas a la matriz de mezcla en sentido ascendente, en la que los coeficientes de la matriz de mezcla en sentido ascendente correspondientes a las senales de mezcla descendente suministradas como entrada forman lo que se denomina la «matriz de mezcla en sentido ascendente seca», y los coeficientes correspondientes a las senales suministradas como salida desde los descorrelacionadores forman lo que se denomina la «matriz de mezcla en sentido ascendente mojada». Cada matriz subordinada, o submatriz, guarda una relacion de correspondencia con la configuracion de canales de mezcla en sentido ascendente. Cuando no se utilizan las senales descorrelacionadoras, la matriz asociada con la operacion de mezcla en sentido ascendente esta configurada para operar unicamente sobre las senales de entrada 512a, y las columnas relacionadas con las senales descorrelacionadas (la matriz de mezcla en sentido ascendente mojada) no estan incluidas en la matriz. En otras palabras, la matriz de mezcla en sentido ascendente corresponde, en este caso, a la matriz de mezcla en sentido ascendente seca. Sin embargo, como se ha destacado anteriormente, el uso de senales descorrelacionadoras tendra, por lo comun, como resultado, en este caso, una peor calidad.
La matriz asociada con la operacion de mejora de dialogo (M) se define por / puede deducirse de los parametros para mejora de dialogo 516, y la matriz asociada con la operacion de mezcla (C) se define por / puede deducirse de, los parametros de mezcla 522.
Puesto que la operacion de mezcla en sentido ascendente, la operacion de mejora del dialogo y la operacion de mezcla son, todas ellas, operaciones lineales, las matrices correspondientes pueden ser combinadas, por multiplicacion de matrices, en una unica matriz E (entonces, X de = E • X, con E = C • M • U). Aqrn, X es un vector columna de las senales de mezcla descendente 512a, y X de es un vector columna de las senales de mezcla descendente mejoradas en dialogo 520. De esta forma, el bloque completo de mejora de dialogo 503 puede corresponder a una unica operacion matricial que se aplica al subconjunto 512a de senales de mezcla descendente con el fin de producir las versiones mejoradas en dialogo 520 del subconjunto 512a de senales de mezcla descendente. De acuerdo con esto, los metodos que se describen en esta memoria pueden implementarse de una manera muy eficiente.
La Figura 6 ilustra un descodificador 600 que corresponde a una realizacion proporcionada a modo de ejemplo del descodificador 500 de la Figura 5. El descodificador 600 comprende un componente de recepcion 602, un componente de mezcla en sentido ascendente 604, un componente de mejora de dialogo 606 y un componente de mezcla 608.
Similarmente al descodificador 500 de la Figura 5, el componente de recepcion 602 recibe una corriente de datos 610 y la descodifica en una pluralidad de senales de mezcla descendente 612, parametros de reconstruccion 614 y parametros para la mejora del dialogo 616.
El componente de mezcla en sentido ascendente 604 recibe un subconjunto 612a (correspondiente al subconjunto 512a) de la pluralidad de senales de mezcla descendente 612. Para cada una de las senales de mezcla descendente del subconjunto 612a, el componente de mezcla en sentido ascendente 604 reconstruye todos los canales que han sido mezclados en sentido descendente en la senal de mezcla descendente (Xu = U • X). Esto incluye canales 618a con respecto a los cuales se han definido los parametros para mejora de dialogo, asf como canales 618b que no han de estar implicados en la mejora del dialogo. Haciendo referencia a la Figura 1b, los canales 618a con respecto a los cuales se han definido los parametros para la mejora del dialogo, pueden, por ejemplo, corresponder a los canales L, LS, C, R, RS, y los canales 618b que no han de implicarse en la mejora del dialogo pueden corresponder a los canales LR, RB.
Los canales 618a con respecto a los cuales se han definido los parametros para la mejora del dialogo (X!a) son entonces sometidos a una mejora del dialogo por el componente de mejora de dialogo 606 (Xe = M X!a), en tanto que los canales 618b que no se han de implicar en la mejora del dialogo (X") se encuentran puenteando el componente de mejora de dialogo 606.
El componente de mejora de dialogo 606 puede aplicar cualquiera del primer, segundo y tercer modos de mejora de dialogo descritos en lo anterior. En caso de que se aplique el tercer modo, la corriente de datos 610 puede comprender, como se ha explicado anteriormente, una senal de audio que representa dialogo (esto es, una forma de onda que representa dialogo), destinada a ser aplicada en la mejora del dialogo conjuntamente con el subconjunto 618a de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo ( x e = M • ( 3 ) -
Como resultado de ello, el componente de mejora de dialogo 606 suministra como salida senales mejoradas en dialogo 619 que, en este caso, corresponden a versiones mejoradas en dialogo del subconjunto 618a de canales con respecto al cual se han definido los parametros para la mejora del dialogo. A modo de ejemplo, las senales de mejora de dialogo 619 pueden corresponder a versiones mejoradas en dialogo de los canales L, LS, C, R, RS de la Figura 1b.
El componente de mezcla 608 mezcla entonces las senales mejoradas en dialogo 619 conjuntamente con los canales
618b que no estan implicados en la mejora del dialogo ( x DE = C H) , con el fin de producir versiones mejoradas en dialogo 620 del subconjunto 612a de senales de mezcla descendente. El componente de mezcla 608 efectua la mezcla de acuerdo con el esquema de mezcla en sentido descendente vigente, tal como el esquema de mezcla en sentido descendente ilustrado en la Figura 1b. En este caso, los parametros de mezcla 622 corresponden, de este modo, a un esquema de mezcla en sentido descendente que describe en que senal de mezcla descendente 620 ha de ser mezclado cada canal 619, 618b. El esquema de mezcla en sentido descendente puede ser estatico y, por tanto, conocido por el descodificador 600, lo que significa que siempre se aplica el mismo esquema de mezcla en sentido descendente, o bien el esquema de mezcla en sentido descendente puede ser dinamico, lo que significa que puede variar de una trama a otra, o puede ser uno de diversos esquemas conocidos en el descodificador. En este ultimo caso, se incluye en la corriente de datos 610 una indicacion referente al esquema de mezcla en sentido descendente.
En la Figura 6, el descodificador esta equipado con un componente de remodelacion opcional 630. El componente de remodelacion 630 puede ser utilizado para la conversion entre diferentes esquemas de mezcla en sentido descendente, por ejemplo, para la conversion del esquema 100b al esquema 100a. Se aprecia que el componente de remodelacion 630 deja, por lo comun, sin cambios las senales c y lfe, es decir, actua como un componente de paso a su traves, o paso libre, con respecto a estas senales. El componente de remodelacion 630 puede recibir y operar (no se muestra) basandose en varios parametros tales como, por ejemplo, los parametros de reconstruccion 614 y los parametros para mejora de dialogo 616.
La Figura 7 ilustra un descodificador 700 que corresponde a una realizacion proporcionada a modo de ejemplo del descodificador 500 de la Figura 5. El descodificador 700 comprende un componente de recepcion 702, un componente de mezcla en sentido ascendente 704, un componente de mejora de dialogo 706, y un componente de mezcla 708.
Similarmente al descodificador 500 de la Figura 5, el componente de recepcion 702 recibe una corriente de datos 710 y la descodifica en una pluralidad de senales de mezcla descendente 712, parametros de reconstruccion 714 y parametros para mejora de dialogo 716.
El componente de mezcla en sentido ascendente 704 recibe un subconjunto 712a (correspondiente al subconjunto 512a) de la pluralidad de senales de mezcla descendente 712. En contraste con la realizacion descrita con respecto a la Figura 6, el componente de mezcla en sentido ascendente 704 unicamente reconstruye el subconjunto 718a de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo 716 (X!a = U' -X). Haciendo referencia a la Figura 1b, los canales 718a con respecto a los cuales se han definido los parametros para la mejora del dialogo pueden corresponder, por ejemplo, a los canales C, L, LS, R, RS.
El componente de mejora de dialogo 706 lleva entonces a cabo una mejora del dialogo en los canales 718a con respecto a los cuales se han definido los parametros para la mejora del dialogo (Xd = Md •X!a). En este caso, el componente de mejora de dialogo 706 prosigue prediciendo un componente de dialogo basandose en los canales 718a, mediante la formacion de una combinacion lineal de los canales 718a, de acuerdo con un segundo modo de mejora de dialogo. Los coeficientes utilizados a la hora de formar la combinacion lineal, denotados por p1 a p5 en la Figura 7, estan incluidos en los parametros para mejora de dialogo 716. El componente de dialogo predicho es entonces mejorado por la multiplicacion de un factor de ganancia g, con el fin de producir una senal mejorada en dialogo 719. El factor de ganancia g puede expresarse como:
c_
g = IO20 - 1
donde G es una ganancia de mejora de dialogo expresada en dB. La ganancia de mejora de dialogo G puede, por ejemplo, ser suministrada como entrada por un usuario y no esta, por tanto, por lo comun, incluida en la corriente de datos 710. Ga de apreciarse que, en caso de que haya varias componentes de dialogo, el procedimiento de prediccion y mejora anterior puede ser aplicado una sola vez por cada componente de dialogo.
La senal mejorada en dialogo predicha 719 (es decir, las componentes de dialogo predichas y mejoradas) es entonces mezclada para formar el subconjunto 712a de senales de mezcla descendente con el fin de producir versiones mejoradas en dialogo 720 del subconjunto 712a de senales de mezcla descendente (x DE = C • [ ^ ] ) . La mezcla se realiza de acuerdo con parametros de mezcla 722 que describen una contribucion de la senal mejorada en dialogo 719 a las versiones mejoradas en dialogo 720 del subconjunto de senales de mezcla descendente. Los parametros de mezcla son, por lo comun, incluidos en la corriente de datos 710. En este caso, los parametros de mezcla 722 corresponden a factores de ponderacion r-i, r2, r3 que describen el modo como la al menos una senal mejorada en dialogo 719 ha de ser ponderada dentro del subconjunto 712a de senales de mezcla descendente:
Figure imgf000015_0001
Con mayor detalle, los factores de ponderacion pueden corresponder a coeficientes de representacion que describen el reparto de la al menos una senal mejorada en dialogo 719 con respecto al subconjunto 712a de senales de mezcla descendente, de tal manera que la senal mejorada en dialogo 719 es anadida a las senales de mezcla descendente 712a en las posiciones espaciales correctas.
Los coeficientes de representacion (los parametros de mezcla 722) de la corriente de datos 710 pueden corresponder a los canales mezclados en sentido ascendente 718a. En el ejemplo ilustrado, existen cinco canales mezclados en sentido ascendente 718a y puede haber, por tanto, pongase por caso, cinco coeficientes de representacion correspondientes rc1, rc2, ..., rc5. Los valores de r1, r2, r3 (que corresponden a las senales de mezcla descendente 712a) pueden ser entonces calculados a partir de rc1, rc2, ..., rc5, en combinacion con el esquema de mezcla en sentido descendente. Cuando una multiplicidad de los canales 718a corresponden a la misma senal de mezcla descendente 712a, los coeficientes de representacion de dialogo pueden ser sumados. Por ejemplo, en el ejemplo ilustrado, setiene que r1 = rc1, r2 = rc2 rc3, y r3 = rc4 rc5. Esta puede ser tambien una suma ponderada en caso de que la mezcla en sentido descendente de los canales se realizase utilizando coeficientes de mezcla en sentido descendente.
Ha de apreciarse que, tambien en este caso, el componente de mejora de dialogo 706 puede hacer uso de una senal de audio adicionalmente recibida que representa dialogo. En tal caso, la senal mejorada en dialogo predicha 719 puede ser ponderada conjuntamente con la senal de audio que representa dialogo, antes de ser suministrada como entrada al componente de mezcla 708 (Xd = (1 -« c) • Md - X!a ac • g • Dc). La ponderacion apropiada viene dada por un parametro de fusion ac incluido en los parametros para mejora de dialogo 716. El parametro de fusion ac indica el modo como deben dividirse las contribuciones a la ganancia entre la componente de dialogo predicha 719 (segun se ha descrito en lo anterior) y la senal de audio adicional que representa dialogo Dc. Esto es analogo a lo que se ha descrito con respecto al tercer modo de mejora del dialogo, cuando se combina con el segundo modo de mejora del dialogo.
En la Figura 7, el descodificador esta equipado con un componente de remodelacion 730. El componente de remodelacion 730 puede ser utilizado para la conversion entre diferentes esquemas de mezcla en sentido descendente, por ejemplo, para la conversion del esquema 100b al esquema 100a. Se destaca que el componente de remodelacion 730 deja, por lo comun, las senales c y lfe sin cambios, es decir, actua como un componente de paso a su traves, o paso libre, con respecto a estas senales. El componente de remodelacion 730 puede recibir y operar (no se muestra) basandose en diversos parametros tales como, por ejemplo, los parametros de reconstruccion 714 y los parametros para mejora de dialogo 716.
Lo anterior se ha explicado principalmente con respecto a una configuracion de canales de 7.1+4 y una mezcla en sentido descendente de 5.1. Debe entenderse, sin embargo, que los principios de los descodificadores y de los metodos de descodificacion que se describen en esta memoria se aplican igualmente bien a otras configuraciones de canales y de mezcla en sentido descendente.
La Figura 8 es una ilustracion de un codificador 800 que puede ser utilizado para codificar una pluralidad de canales 818, algunos de los cuales incluyen dialogo, al objeto de producir una corriente de datos 810 para su transmision al descodificador. El codificador 800 puede ser utilizado con cualquiera de los descodificadores 200, 500, 600, 700. El codificador 800 comprende un componente de mezcla en sentido descendente 805, un componente de codificacion para mejora de dialogo 806, un componente de codificacion parametrica 804 y un componente de transmision 802.
El codificador 800 recibe una pluralidad de canales 818, por ejemplo, los de las configuraciones de canales 100a, 100b representadas en las Figuras 1a y 1b.
El componente de mezcla en sentido descendente 805 mezcla en sentido descendente la pluralidad de canales 818 para obtener una pluralidad de senales de mezcla descendente 812, las cuales son entonces aportadas al componente de transmision 802 para su inclusion en la corriente de datos 810. La pluralidad de canales 818 puede, por ejemplo, ser mezclada en sentido descendente de acuerdo con un esquema de mezcla en sentido descendente, tal como el ilustrado en la Figura 1a o en la Figura 1b.
La pluralidad de canales 818 y las senales de mezcla descendente 812 son suministradas como entrada al componente de codificacion parametrica 804. Basandose en sus senales suministradas como entrada, el componente de codificacion parametrica 804 calcula los parametros de reconstruccion 814 que permiten la reconstruccion de los canales 818 a partir de las senales de mezcla descendente 812. Los parametros de reconstruccion 814 pueden ser calculados, por ejemplo, utilizando algoritmos de optimizacion de error cuadratico medio mmimo (MMSE - “minimum mean square error”-), como es conocido en la tecnica. Los parametros de reconstruccion 814 son entonces aportados al componente de transmision 802 para su inclusion en la corriente de datos 810.
El componente de codificacion para mejora de dialogo 806 calcula parametros para mejora de dialogo 816 basandose en uno o mas de la pluralidad de canales 818 y en una o mas senales de dialogo 813. Las senales de dialogo 813 representan dialogo puro. Es de destacar que el dialogo ya esta mezclado dentro de uno o mas de los canales 818. En los canales 818 puede haber, por tanto, uno o mas componentes de dialogo que se corresponden con las senales de dialogo 813. Por lo comun, el componente de codificacion para mejora de dialogo 806 calcula los parametros para mejora de dialogo 816 utilizando algoritmos de optimizacion de error cuadratico medio mmimo (MMSE). Tales algoritmos pueden proporcionar parametros que hacen posible la prediccion de las senales de dialogo 813 a partir de algunos de la pluralidad de canales 818. Los parametros para mejora de dialogo 816 pueden, de esta forma, haberse definido con respecto a un subconjunto de la pluralidad de canales 818, a saber, aquellos a partir de los cuales pueden predecirse las senales de dialogo 813. Los parametros para prediccion de dialogo 816 son aportados al componente de transmision 802 para su inclusion en la corriente de datos 810.
En conclusion, la corriente de datos 810, en consecuencia, comprende al menos la pluralidad de senales de mezcla descendente 812, los parametros de reconstruccion 814 y los parametros para mejora de dialogo 816.
Durante el funcionamiento normal del descodificador, valores de los parametros de diferentes tipos (tales como los parametros para la mejora del dialogo, o los parametros de reconstruccion) son recibidos repetidamente por el descodificador con ciertas velocidades de transmision. Si las velocidades de transmision con las que se reciben los diferentes valores de parametros son mas bajas que la velocidad de transmision con la que se ha de calcular la salida del descodificador, puede ser necesario interpolar los valores de los parametros. Si el valor de un parametro generico p es conocido en los instantes ti y t2 de tiempo, de manera que son p(ti) y p(t2), respectivamente, el valor p(t) del parametro en un tiempo intermedio ti < t < t2 puede ser calculado utilizando diferentes esquemas de interpolacion. Un ejemplo de tal esquema, al que se hace referencia en esta memoria como configuracion de interpolacion lineal, puede calcular el valor intermedio utilizando interpolacion lineal, por ejemplo, p(t) = p(ti) + [p(t2) - p(ti)] (t - ti) / (t2 - ti). Otra configuracion, a la que se hace aqrn referencia como configuracion de interpolacion constante por tramos, puede, en lugar de ello, incluir la conservacion de un valor de parametro fijo en uno de los valores conocidos durante todo el intervalo temporal, por ejemplo, p(t) = p(ti) o p(t) = p(t2), o una combinacion de los valores conocidos, tal como, por ejemplo, el valor medio p(t) = [p(ti) p(t2)] / 2. Puede haberse incorporado en el descodificador informacion acerca de que esquema de interpolacion debe utilizarse para un cierto tipo de parametro durante un cierto intervalo de tiempo, o bien esta puede proporcionarse al descodificador de diferentes maneras, tal como de manera conjunta con los propios parametros o como informacion adicional contenida en la senal recibida.
En un ejemplo ilustrativo, un descodificador recibe valores de parametro para un primer y un segundo tipos de parametros. Los valores recibidos de cada tipo de parametro son exactamente aplicables en un primer (T1 = {t11, t12, t13, ...}) y en un segundo (T2 = {t21, t22, t23, ...}) conjuntos de instantes de tiempo, respectivamente, y el descodificador tambien tiene acceso a informacion acerca de como se han de interpolar los valores de cada tipo de parametro en el caso de que sea necesario estimar un valor en un instante de tiempo que no esta presente en el correspondiente conjunto. Los valores de parametro controlan propiedades cuantitativas de las operaciones matematicas sobre las senales, operaciones que, por ejemplo, pueden ser representadas como matrices. En el ejemplo que sigue, se supone que la operacion controlada por el primer tipo de parametro viene representada por una primera matriz A, que la operacion controlada por el segundo tipo de parametro viene representada por una segunda matriz B, y que los terminos «operacion» y «matriz» pueden utilizarse de forma intercambiable en el ejemplo. En un instante de tiempo en que es necesario calcular un valor de salida desde el descodificador, ha de computarse una operacion de tratamiento compuesta correspondiente a la composicion de ambas operaciones. Si se supone, adicionalmente, que la matriz A es la operacion de mezcla en sentido ascendente (controlada por los parametros de reconstruccion) y que la matriz B es la operacion de aplicar una mejora del dialogo (controlada por los parametros para la mejora del dialogo), entonces, en consecuencia, la operacion de tratamiento compuesta de mezclar en sentido ascendente seguido de una mejora del dialogo se representa por el producto matricial BA.
Metodos para computar la operacion de tratamiento compuesta se ilustran en las Figuras 9a-9e, en las que el tiempo discurre a lo largo del eje horizontal y unas marcas de verificacion temporal indican los instantes de tiempo en que se ha de computar una operacion de tratamiento compuesta (instantes de tiempo de salida). En las figuras, los triangulos corresponden a la matriz A (representando la operacion de mezcla en sentido ascendente), los drculos, a la matriz B (representando la operacion de aplicar la mejora del dialogo), y los cuadrados, a la matriz de operacion compuesta BA (representando la operacion compuesta de mezclar en sentido ascendente seguido de la mejora del dialogo). Los triangulos y los drculos llenos indican que la matriz respectiva se conoce exactamente (esto es, que los parametros que controlan la operacion que representa la matriz se conocen exactamente) en el instante de tiempo correspondiente, mientras que los triangulos y los drculos vados indican que el valor de la matriz respectiva es predicho o interpolado (utilizando, por ejemplo, cualquiera de las configuraciones de interpolacion esbozadas anteriormente). Un cuadrado lleno indica que la matriz de operacion compuesta BA ha sido computada, en el instante de tiempo correspondiente, por ejemplo, por una matriz producto de las matrices A y B, y un cuadrado vado indica que el valor de BA ha sido interpolado desde un instante de tiempo anterior. Por otra parte, las flechas de trazo de puntos indican entre que instantes de tiempo se ha llevado a cabo una interpolacion. Por ultimo, una lmea continua horizontal que une instantes de tiempo indica que el valor de una matriz se supone constante por tramos en ese intervalo.
En la Figura 9a se ha ilustrado un metodo para computar una operacion de tratamiento compuesta BA que no hace uso de la presente invencion. Los valores recibidos para las operaciones A y B se aplican exactamente en los instantes de tiempo t11, t21 y t12, t22, respectivamente, y, para computar la matriz de operacion de tratamiento compuesta en cada instante de tiempo de salida, el metodo interpola cada matriz individualmente. A fin de completar cada etapa de avance en el tiempo, la matriz que representa la operacion de tratamiento compuesta es computada como el producto de los valores predichos A y B. Aqm, se supone que cada matriz se ha de interpolar utilizando una configuracion de interpolacion lineal. Si la matriz A tiene N’ filas y N columnas, y la matriz B tiene M filas y N’ columnas, cada etapa de avance en el tiempo requerira 0(MN’N) operaciones de multiplicacion por cada banda de parametros (a fin de llevar a cabo la multiplicacion requerida para computar la matriz de tratamiento compuesta BA). Una alta densidad de instantes de tiempo de salida y/o un elevado numero de bandas de parametros conllevara, por tanto, el riesgo (debido a la relativamente elevada complejidad computacional de una operacion de multiplicacion, en comparacion con una operacion de adicion) de requerir una demanda elevada de los recursos computacionales. A fin de reducir la complejidad computacional, puede utilizarse el metodo alternativo ilustrado en la Figura 9b. Al computar la operacion de tratamiento compuesta (por ejemplo, llevando a cabo una multiplicacion de matrices) unicamente en los instantes de tiempo en que los valores de parametro cambian (es decir, cuando son exactamente aplicables valores recibidos, en t11, t21 y tl2 , t22), la matriz de operacion de tratamiento compuesta BA puede ser interpolada directamente, en lugar de interpolar las matrices A y B por separado. Al hacerlo asf, si las operaciones se representan por matrices, cada etapa de avance en el tiempo (entre los instantes de tiempo en que los valores de parametro exactos cambian) requerira, entonces, unicamente 0(NM) operaciones (para la suma de matrices) por cada banda de parametros, y la reducida complejidad computacional requerira una menor demanda de los recursos computacionales. Tambien, si las matrices A y B son tales, que N’ > N x M / (N M), la matriz que representa la operacion de tratamiento compuesta BA tendra un menor numero de elementos que los que se encuentran en las matrices individuales A y B, combinadas. El metodo de interpolar la matriz BA directamente requerira, sin embargo, que tanto A como B sean conocidas en los mismos instantes de tiempo. Cuando los instantes de tiempo para los que A esta definida (al menos parcialmente) son distintos de los instantes de tiempo para los que B esta definida, se requiere un metodo de interpolacion mejorado. Tal metodo mejorado, de acuerdo con realizaciones proporcionadas a modo de ejemplo de la presente invencion, se ilustra en las Figuras 9c-9e. En asociacion con la exposicion de las Figuras 9a-9e, se supone, por simplicidad, que la matriz de operacion de tratamiento compuesta BA es computada como producto de las matrices individuales. A y B, cada una de las cuales se ha generado basandose en valores de parametro (recibidos o predichos / interpolados). En otras situaciones, puede resultar igualmente o mas ventajoso computar la operacion representada por la matriz BA directamente a partir de los valores de parametro, sin pasar por una representacion en forma de dos factores matriciales. En combinacion con cualquiera de las tecnicas ilustradas con referencia a las Figuras 9c-9e, cada una de estas soluciones cae dentro del alcance de la presente invencion.
En la Figura 9c se ilustra una situacion en la que el conjunto T1 de instantes de tiempo para el parametro correspondiente a la matriz A incluye un valor temporal t12 que no esta presente en el conjunto T2 (instantes de tiempo para el parametro correspondiente a la matriz B). Ambas matrices se han de interpolar utilizando una configuracion de interpolacion lineal, y el metodo identifica el instante de prediccion tp = t12 en que se ha de predecir el valor de la matriz B (utilizando, por ejemplo, interpolacion). Una vez que se ha encontrado el valor, el valor de la matriz de operacion de tratamiento compuesta bA en tp puede ser computado multiplicando A y B. Para continuar, el metodo computa el valor de BA en un instante de tiempo adyacente ta = t11 y, seguidamente, interpola BA entre ta y tp. El metodo puede tambien computar, si se desea, el valor de BA en otro instante de tiempo adyacente ta = t13, e interpolar BA de tp a ta. Incluso aunque se requiera una multiplicacion matricial adicional (en tp = t12), el metodo permite interpolar la matriz de operacion de tratamiento compuesta BA directamente, con lo que sigue reduciendo la complejidad computacional en comparacion con el metodo de, por ejemplo, la Figura 9a. Como se ha dicho anteriormente, la operacion de tratamiento compuesta puede, alternativamente, ser computada directamente a partir de los valores de parametro (recibidos o predichos / interpolados), en lugar de como un producto explfcito de dos matrices que, a su vez, dependen de los valores de parametro respectivos.
En el caso previo, unicamente el tipo de parametro correspondiente a tema instantes de tiempo que no estaban incluidos entre los instantes del tipo de parametro correspondiente a B. En la Figura 9d se ilustra una situacion diferente en la que el instante de tiempo t12 falta en el conjunto T2, y en la que el instante de tiempo t22 falta en el conjunto T1. Si se ha de computar un valor de BA en un instante de tiempo intermedio t' entre t12 y t22, el metodo puede predecir tanto el valor de B en tp = t12 como el valor de A en ta = t22. Una vez computada la matriz de operacion de tratamiento compuesta BA en ambos tiempos, BA puede ser interpolada para encontrar su valor en t'. En general, el metodo unicamente lleva a cabo multiplicaciones de matrices en los instantes de tiempo en que cambian valores de parametro (es decir, en los instantes de tiempo de los conjuntos T1 y T2 en los que los valores recibidos son aplicables de forma exacta). Entre medias, la interpolacion de la operacion de tratamiento compuesta tan solo requiere adiciones de matrices que tienen menos complejidad computacional que sus contrapartidas de multiplicacion.
En los ejemplos anteriores, se ha supuesto que todos los parametros de interpolacion son lineales. En la Figura 9e se ilustra un metodo para la interpolacion tambien cuando los parametros han de ser interpolados inicialmente utilizando diferentes esquemas. En la figura, los valores del parametro correspondiente a la matriz A se mantienen de manera que sean constantes por tramos hasta que se llega al instante de tiempo t12, en el que los valores cambian bruscamente. Si los valores de parametro son recibidos segun una pauta por tramas, cada trama puede portar senalizacion que indica un instante de tiempo en el que un valor recibido se aplica exactamente. En el ejemplo, el parametro correspondiente a B ha recibido valores aplicables de forma exacta en t21 y t22, y el metodo puede, primeramente, predecir el valor de B en el instante de tiempo tp inmediatamente precedente t12. Una vez computada la matriz de operacion de tratamiento compuesta BA en tp, y ta = t11, la matriz bA puede ser interpolada entre ta y tp. El metodo puede entonces predecir el valor de B en un nuevo instante de prediccion tp = t12, computar los valores de BA en tp y ta = t22, e interpolar BA directamente entre tp y ta. Una vez mas, la operacion de tratamiento compuesta BA ha sido interpolada a traves del intervalo, y se ha encontrado su valor en todos los instantes de tiempo de salida. En comparacion con la situacion anterior, segun se ilustra en la Figura 9a, en el caso de que A y B hubieran sido interpoladas individualmente, y BA computada por multiplicacion de A y B en cada instante de tiempo de salida, se necesita un numero reducido de multiplicaciones matriciales y la complejidad computacional se rebaja.
Equivalentes, extensiones, alternativas y miscelanea
Realizaciones adicionales de la presente invencion resultaran evidentes para una persona experta en la tecnica tras el estudio de la anterior descripcion. Incluso aunque la presente descripcion y los dibujos divulguen realizaciones y ejemplos, la invencion no esta limitada por estos ejemplos espedficos. Pueden realizarse numerosas modificaciones y variaciones sin apartarse del alcance de la presente invencion, que se define por los dibujos que se acompanan. Cualesquiera signos de referencia que aparecen en las reivindicaciones no deben ser entendidos como limitativos de su alcance.
Adicionalmente, pueden concebirse y llevarse a efecto variaciones en las realizaciones divulgadas por parte de la persona experta a la hora de poner en practica la invencion, a partir del estudio de los dibujos, la descripcion y las reivindicaciones que se acompanan. En las reivindicaciones, la expresion “que comprende” no excluye otros elementos o etapas, y el artfculo indefinido “un” o “uno” no excluye una pluralidad. El mero hecho de que ciertas medidas se refieran en diferentes reivindicaciones dependientes entre si no indica que no pueda usarse de forma ventajosa una combinacion de estas medidas.
Los sistemas y metodos divulgados en lo anterior de esta memoria pueden ser implementados como software, firmware, o software instalado de forma permanente en hardware, hardware, o una combinacion de los mismos. En la implementacion en hardware, la division de tareas entre las unidades funcionales referidas en la anterior descripcion no se corresponde, necesariamente, a la division en unidades ffsicas; al contrario, un unico componente ffsico puede tener multiples capacidades funcionales, y una unica tarea puede llevarse a cabo por varios componentes ffsicos en cooperacion. Ciertos componentes, o todos los componentes, pueden ser implementados como software ejecutado por un procesador de senal digital o microprocesador, o bien ser implementados como hardware o como un circuito integrado espedfico de la aplicacion. Tal software puede ser distribuido en medios legibles por computadora, los cuales pueden comprender medios de almacenamiento informaticos (o medios no transitorios) y medios de comunicacion (o medios transitorios). Como es bien conocido por una persona experta en la tecnica, la expresion “medios de almacenamiento informaticos” incluye medios tanto volatiles como no volatiles, y tanto extrafbles como no extrafbles, implementados en cualquier metodo o tecnologfa para el almacenamiento de informacion, tal como en instrucciones legibles por computadora, estructuras de datos, modulos de programa u otros datos. Los medios de almacenamiento informaticos incluyen RAM, ROM, EEPROM, memoria de tipo flash u otra tecnologfa de memoria, CD-ROM, discos versatiles digitales (DVD) u otros dispositivos de almacenamiento de disco optico, casetes magneticas, cinta magnetica, dispositivos de almacenamiento de disco magnetico u otros dispositivos de almacenamiento magneticos, o cualquier otro medio que pueda ser utilizado para almacenar la informacion deseada y al que pueda accederse por parte de una computadora, si bien no estan limitados por estos. Por otra parte, es bien conocido para la persona experta que los medios de comunicacion incorporan, por lo comun, instrucciones legibles por computadora, estructuras de datos, modulos de programa u otros datos dispuestos en una senal de datos modulada, tal como una onda portadora u otro mecanismo de transporte, e incluyen cualesquiera medios de suministro de informacion.

Claims (15)

REIVINDICACIONES
1. - Un metodo para la mejora del dialogo en un descodificador de un sistema de audio, de tal manera que el metodo comprende las etapas de:
recibir una pluralidad de senales de mezcla descendente (512, 612, 712), que constituyen una mezcla en sentido descendente de una pluralidad mas grande de canales;
recibir parametros para mejora de dialogo (516, 616, 716), de tal manera que los parametros se han definido con respecto a un subconjunto de la pluralidad de canales que incluye canales que comprenden dialogo, de tal modo que el subconjunto de la pluralidad de canales se mezcla en sentido descendente para formar un subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente;
recibir parametros de reconstruccion (514, 614, 714) que permiten una reconstruccion parametrica de los canales que estan mezclados en sentido descendente en el subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente;
mezclar en sentido ascendente unicamente el subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente parametricamente, basandose en los parametros de reconstruccion (514, 614, 714), a fin de reconstruir unicamente un subconjunto (618a, 618b, 718a) de la pluralidad de canales que incluye el subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716);
aplicar una mejora del dialogo al subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716), utilizando los parametros para mejora de dialogo (516, 616, 716), a fin de proporcionar al menos una senal mejora en dialogo (619, 719); y
proporcionar versiones mejoradas en dialogo (520, 620, 720) del subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente, al mezclar la al menos una senal mejorada en dialogo (619, 719) con al menos otra de dicho subconjunto de la pluralidad de senales de mezcla descendente (618b, 712a).
2. - El metodo de acuerdo con la reivindicacion 1, en el cual, en la etapa de mezclar en sentido ascendente unicamente el subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente parametricamente, se utilizan senales no descorrelacionadas para reconstruir tan solo un subconjunto (618a, 618b, 718a) de la pluralidad de canales que incluye el subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716).
3. - El metodo de acuerdo con la reivindicacion 1, en el cual la mezcla se realiza de acuerdo con parametros de mezcla (522, 622, 722) que describen una contribucion de la al menos una senal mejorada en dialogo (619, 719) a las versiones mejoradas en dialogo (620, 720) del subconjunto de la pluralidad de senales de mezcla descendente.
4. - El metodo de acuerdo con una cualquiera de las reivindicaciones precedentes, en el cual la etapa de mezclar en sentido ascendente unicamente el subconjunto (512a, 712a) de la pluralidad de senales de mezcla descendente parametricamente comprende reconstruir tan solo el subconjunto (718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 716),
de tal manera que la etapa de aplicar la mejora del dialogo comprende predecir y mejorar una componente de dialogo a partir del subconjunto de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo, utilizando los parametros para mejora de dialogo (516, 716), a fin de proporcionar la al menos una senal mejorada en dialogo (719), y
en el cual la mezcla comprende mezclar la al menos una senal mejorada en dialogo (719) con el subconjunto (712a) de la pluralidad de senales de mezcla descendente; y/o
que comprende adicionalmente recibir una senal de audio que representa dialogo, de tal modo que la etapa de aplicar la mejora del dialogo comprende aplicar la mejora del dialogo al subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716), utilizando adicionalmente la senal de audio que representa dialogo.
5. - El metodo de acuerdo con una cualquiera de las reivindicaciones precedentes, que comprende adicionalmente recibir parametros de mezcla (522, 622, 722) ara mezclar la al menos una senal mejorada en dialogo (619, 719) con al menos otra de dicho subconjunto de la pluralidad de senales de mezcla descendente (618b, 712a).
6. - El metodo de acuerdo con la reivindicacion 3 o la reivindicacion 5, en el cual las etapas de mezclar en sentido ascendente unicamente el subconjunto de la pluralidad de senales de mezcla descendente, aplicar la mejora del dialogo y mezclar se llevan a cabo como operaciones matriciales definidas por los parametros de reconstruccion, los parametros para la mejora del dialogo y los parametros de mezcla, respectivamente, y que, opcionalmente, comprende, de manera adicional, combinar, por multiplicacion de matrices, las operaciones matriciales correspondientes a las etapas de mezclar en sentido ascendente unicamente el subconjunto de la pluralidad de senales de mezcla descendente, aplicar la mejora del dialogo y mezclar, en una unica operacion matricial, antes de su aplicacion al subconjunto de la pluralidad de senales de mezcla descendente.
7. - El metodo de acuerdo con una cualquiera de las reivindicaciones precedentes, en el que los parametros de mejora de dialogo (516, 616, 716) y los parametros de reconstruccion (514, 614, 714) son dependientes de la frecuencia, y, opcionalmente, en el cual los parametros para mejora de dialogo (516, 616, 716) se definen con respecto a un primer conjunto de bandas de frecuencias, y los parametros de reconstruccion se definen con respecto a un segundo conjunto de bandas de frecuencias, de tal modo que el segundo conjunto de bandas de frecuencias es diferente del primer conjunto de bandas de frecuencias.
8. - El metodo de acuerdo con cualquiera de las reivindicaciones precedentes, en el cual:
se reciben repetidamente valores de los parametros para mejora de dialogo (516, 616, 716) y son asociados con un primer conjunto de instantes de tiempo (T1 = {t11, t12, t13, ...}) en los que los valores respectivos se aplican de forma exacta, de tal manera que se ha de llevar a cabo una primera configuracion de interpolacion predefinida (I1) entre instantes de tiempo consecutivos; y
se reciben repetidamente valores de los parametros de reconstruccion (514, 614, 714) y son asociados con un segundo conjunto de instantes de tiempo (T2 = {t21, t22, t23, ...}) en los que los valores respectivos se aplican de forma exacta, de tal manera que se ha de llevar a cabo una segunda configuracion de interpolacion predefinida (I2) entre instantes de tiempo consecutivos,
de tal modo que el metodo comprende, adicionalmente:
seleccionar un tipo de parametro que consiste, bien en parametros para la mejora del dialogo o bien en parametros de reconstruccion, y de tal manera que el conjunto de instantes de tiempo asociado con el tipo seleccionado comprende al menos un instante de prediccion que es un instante de tiempo (tp) que esta ausente del conjunto asociado con el tipo no seleccionado;
predecir un valor de los parametros del tipo no seleccionado en el instante de prediccion (tp);
computar, basandose en al menos el valor predicho de los parametros del tipo no seleccionado y en un valor recibido de los parametros del tipo seleccionado, una operacion de tratamiento compuesta que representa al menos la mezcla en sentido ascendente de unicamente el subconjunto de senales de mezcla descendente (512a, 612a, 712a), seguida por la mejora del dialogo en el instante de prediccion (tp); y
computar, basandose en al menos un valor de los parametros del tipo seleccionado y en un valor de los parametros del tipo no seleccionado, de los cuales al menos uno es un valor recibido, dicha operacion de tratamiento compuesta en un instante de tiempo adyacente (ta) del conjunto asociado con el tipo seleccionado o con el no seleccionado,
de tal manera que dichas etapas de mezclar en sentido ascendente tan solo el subconjunto de la pluralidad de senales de mezcla descendente (512a, 612a, 712a) y aplicar la mejora del dialogo se llevan a cabo entre el instante de prediccion (tp) y el instante de tiempo adyacente (ta) por medio de un valor interpolado de la operacion de tratamiento compuesta computada, y, opcionalmente, de modo que el tipo seleccionado de parametros son los parametros de reconstruccion (514, 614, 714).
9. - El metodo de acuerdo con la reivindicacion 8, en el cual dicha operacion de tratamiento compuesta, en el instante de tiempo adyacente (ta), es computada basandose en un valor recibido de los parametros del tipo seleccionado y en un valor recibido de los parametros del tipo no seleccionado.
10. - El metodo de acuerdo con la reivindicacion 8 o la reivindicacion 9, que comprende adicionalmente:
seleccionar, basandose en las primera y segunda configuraciones de interpolacion, una configuracion de interpolacion compuesta (I3) de acuerdo con una regla de seleccion predefinida,
en el cual dicha interpolacion de las respectivas operaciones de tratamiento compuestas computadas es de acuerdo con la configuracion de interpolacion compuesta, y, opcionalmente, de manera que la regla de seleccion predefinida se ha definido para el caso de que las primera y segunda configuraciones de interpolacion sean diferentes, y de tal modo que, en respuesta a que la primera configuracion de interpolacion (I1) es lineal y la segunda configuracion de interpolacion (I2) es constante por tramos, se selecciona la interpolacion lineal como configuracion de interpolacion compuesta.
11. - El metodo de acuerdo con cualquiera de las reivindicaciones 8 a 10, en el cual la prediccion del valor de los parametros del tipo no seleccionado en el instante de prediccion (tp) se realiza de acuerdo con la configuracion de interpolacion para los parametros del tipo no seleccionado.
12. - El metodo de acuerdo con cualquiera de las reivindicaciones 8 a 11, en el que la operacion de tratamiento compuesta se computa como una unica operacion matricial antes de ser aplicada al subconjunto de la pluralidad de senales de mezcla descendente (512a, 612a, 712a), y, opcionalmente, en el cual:
se selecciona la interpolacion lineal como configuracion de interpolacion compuesta; y
el valor interpolado de las respectivas operaciones de tratamiento compuestas computadas se computa por interpolacion matricial lineal.
13. - El metodo de acuerdo con cualquiera de las reivindicaciones precedentes, en el cual la mezcla de la al menos una senal mejorada en dialogo (619, 719) con al menos otra senal (618b, 712a) esta restringida a una seleccion incompleta de la pluralidad de senales de mezcla descendente (512, 612, 712).
14. - Un producto de programa informatico que comprende un medio legible por computadora, con instrucciones para llevar a cabo el metodo de acuerdo con una cualquiera de las reivindicaciones 1-13, cuando dicho producto de programa se hace marchar en una computadora.
15. - Un descodificador (500, 600, 700) para mejorar el dialogo en un sistema de audio, de tal manera que el descodificador comprende:
un componente de recepcion (502, 602, 702), configurado para recibir:
una pluralidad de senales de mezcla descendente (512, 612, 712), que son una mezcla en sentido descendente de una pluralidad mas grande de canales,
parametros para mejora de dialogo (516, 616, 716), de tal modo que los parametros se han definido con respecto a un subconjunto de la pluralidad de canales que incluye canales que comprenden dialogo, de manera que el subconjunto de la pluralidad de canales se mezcla en sentido descendente hasta formar un subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente, y
parametros de reconstruccion (514, 614, 714), que permiten la reconstruccion parametrica de canales que estan mezclados en sentido descendente hasta formar el subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente;
un componente de mezcla en sentido ascendente (504, 604, 704), configurado para mezclar en sentido ascendente unicamente el subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente parametricamente, basandose en los parametros de reconstruccion (514, 614, 714), a fin de reconstruir unicamente un subconjunto (618a, 618b, 718a) de la pluralidad de canales que incluye el subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716); y
un componente de mejora de dialogo (506, 606, 706), configurado para aplicar la mejora del dialogo al subconjunto (618a, 718a) de la pluralidad de canales con respecto al cual se han definido los parametros para mejora de dialogo (516, 616, 716), utilizando los parametros para mejora de dialogo (516, 616, 716), a fin de proporcionar al menos una senal mejorada en dialogo (619, 719); y
un componente de mezcla (508, 608, 708), configurado para proporcionar versiones mejoradas en dialogo (520, 620, 720) del subconjunto (512a, 612a, 712a) de la pluralidad de senales de mezcla descendente al mezclar la al menos una senal mejorada en dialogo (619, 719) con al menos otra senal de dicho subconjunto de la pluralidad de senales de mezcla descendente (618b, 712a).
ES15770958T 2014-10-02 2015-09-30 Método de descodificación y descodificador para la mejora del diálogo Active ES2709327T3 (es)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US201462059015P 2014-10-02 2014-10-02
US201562128331P 2015-03-04 2015-03-04
PCT/EP2015/072578 WO2016050854A1 (en) 2014-10-02 2015-09-30 Decoding method and decoder for dialog enhancement

Publications (1)

Publication Number Publication Date
ES2709327T3 true ES2709327T3 (es) 2019-04-16

Family

ID=54199263

Family Applications (1)

Application Number Title Priority Date Filing Date
ES15770958T Active ES2709327T3 (es) 2014-10-02 2015-09-30 Método de descodificación y descodificador para la mejora del diálogo

Country Status (19)

Country Link
US (1) US10170131B2 (es)
EP (1) EP3201918B1 (es)
JP (1) JP6728146B2 (es)
KR (1) KR102426965B1 (es)
CN (1) CN106796804B (es)
AU (1) AU2015326856B2 (es)
BR (1) BR112017006325B1 (es)
CA (1) CA2962806C (es)
DK (1) DK3201918T3 (es)
ES (1) ES2709327T3 (es)
IL (1) IL251263B (es)
MX (1) MX364166B (es)
MY (1) MY179448A (es)
PL (1) PL3201918T3 (es)
RU (1) RU2701055C2 (es)
SG (1) SG11201702301SA (es)
TW (1) TWI575510B (es)
UA (1) UA120372C2 (es)
WO (1) WO2016050854A1 (es)

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2016050854A1 (en) * 2014-10-02 2016-04-07 Dolby International Ab Decoding method and decoder for dialog enhancement
CN106303897A (zh) 2015-06-01 2017-01-04 杜比实验室特许公司 处理基于对象的音频信号
JP7023848B2 (ja) * 2016-01-29 2022-02-22 ドルビー ラボラトリーズ ライセンシング コーポレイション バイノーラル・ダイアログ向上
TWI658458B (zh) * 2018-05-17 2019-05-01 張智星 歌聲分離效能提升之方法、非暫態電腦可讀取媒體及電腦程式產品
WO2020216459A1 (en) * 2019-04-23 2020-10-29 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus, method or computer program for generating an output downmix representation
JP7810612B2 (ja) * 2022-06-16 2026-02-03 シャープ株式会社 放送システム、受信機、受信方法、及びプログラム

Family Cites Families (44)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6463410B1 (en) * 1998-10-13 2002-10-08 Victor Company Of Japan, Ltd. Audio signal processing apparatus
US7158933B2 (en) 2001-05-11 2007-01-02 Siemens Corporate Research, Inc. Multi-channel speech enhancement system and method based on psychoacoustic masking effects
US7787640B2 (en) 2003-04-24 2010-08-31 Massachusetts Institute Of Technology System and method for spectral enhancement employing compression and expansion
US7447317B2 (en) * 2003-10-02 2008-11-04 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V Compatible multi-channel coding/decoding by weighting the downmix channel
KR20050049103A (ko) * 2003-11-21 2005-05-25 삼성전자주식회사 포만트 대역을 이용한 다이얼로그 인핸싱 방법 및 장치
CA2992065C (en) 2004-03-01 2018-11-20 Dolby Laboratories Licensing Corporation Reconstructing audio signals with multiple decorrelation techniques
SE0402652D0 (sv) * 2004-11-02 2004-11-02 Coding Tech Ab Methods for improved performance of prediction based multi- channel reconstruction
EP1866912B1 (en) 2005-03-30 2010-07-07 Koninklijke Philips Electronics N.V. Multi-channel audio coding
ATE378675T1 (de) * 2005-04-19 2007-11-15 Coding Tech Ab Energieabhängige quantisierung für effiziente kodierung räumlicher audioparameter
US7707034B2 (en) * 2005-05-31 2010-04-27 Microsoft Corporation Audio codec post-filter
WO2007004829A2 (en) 2005-06-30 2007-01-11 Lg Electronics Inc. Apparatus for encoding and decoding audio signal and method thereof
JP2009500657A (ja) 2005-06-30 2009-01-08 エルジー エレクトロニクス インコーポレイティド オーディオ信号をエンコーディング及びデコーディングするための装置とその方法
DE602006010712D1 (de) * 2005-07-15 2010-01-07 Panasonic Corp Audiodekoder
EP1999997B1 (en) * 2006-03-28 2011-04-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Enhanced method for signal shaping in multi-channel audio reconstruction
CN101411214B (zh) 2006-03-28 2011-08-10 艾利森电话股份有限公司 用于多信道环绕声音的解码器的方法和装置
EP1853092B1 (en) * 2006-05-04 2011-10-05 LG Electronics, Inc. Enhancing stereo audio with remix capability
TWI308739B (en) 2006-06-23 2009-04-11 Mstar Semiconductor Inc Audio processing circuit and method
US7606716B2 (en) 2006-07-07 2009-10-20 Srs Labs, Inc. Systems and methods for multi-dialog surround audio
EP2070391B1 (en) 2006-09-14 2010-11-03 LG Electronics Inc. Dialogue enhancement techniques
US7463170B2 (en) 2006-11-30 2008-12-09 Broadcom Corporation Method and system for processing multi-rate audio from a plurality of audio processing sources
US8050434B1 (en) 2006-12-21 2011-11-01 Srs Labs, Inc. Multi-channel audio enhancement system
JP5140684B2 (ja) * 2007-02-12 2013-02-06 ドルビー ラボラトリーズ ライセンシング コーポレイション 高齢又は聴覚障害聴取者のための非スピーチオーディオに対するスピーチオーディオの改善された比率
KR101336237B1 (ko) * 2007-03-02 2013-12-03 삼성전자주식회사 멀티 채널 스피커 시스템의 멀티 채널 신호 재생 방법 및장치
EP2137725B1 (en) 2007-04-26 2014-01-08 Dolby International AB Apparatus and method for synthesizing an output signal
RU2452043C2 (ru) * 2007-10-17 2012-05-27 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Аудиокодирование с использованием понижающего микширования
MY179314A (en) 2008-04-18 2020-11-04 Dolby Laboratories Licensing Corp Method and apparatus for maintaining speech audibility in multi-channel audio with minimal impact on surround experience
US8831936B2 (en) * 2008-05-29 2014-09-09 Qualcomm Incorporated Systems, methods, apparatus, and computer program products for speech signal processing using spectral contrast enhancement
US8315396B2 (en) * 2008-07-17 2012-11-20 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus and method for generating audio output signals using object based metadata
US8639502B1 (en) 2009-02-16 2014-01-28 Arrowhead Center, Inc. Speaker model-based speech enhancement system
ES2415155T3 (es) 2009-03-17 2013-07-24 Dolby International Ab Codificación estéreo avanzada basada en una combinación de codificación estéreo izquierda/derecha o central/lateral seleccionable de manera adaptativa y de codificación estéreo paramétrica
EP2422344A1 (en) 2009-04-21 2012-02-29 Koninklijke Philips Electronics N.V. Audio signal synthesizing
US8204742B2 (en) 2009-09-14 2012-06-19 Srs Labs, Inc. System for processing an audio signal to enhance speech intelligibility
EP2486737B1 (en) * 2009-10-05 2016-05-11 Harman International Industries, Incorporated System for spatial extraction of audio signals
WO2011048117A1 (en) * 2009-10-20 2011-04-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio signal encoder, audio signal decoder, method for encoding or decoding an audio signal using an aliasing-cancellation
US9324337B2 (en) * 2009-11-17 2016-04-26 Dolby Laboratories Licensing Corporation Method and system for dialog enhancement
TWI459828B (zh) * 2010-03-08 2014-11-01 Dolby Lab Licensing Corp 在多頻道音訊中決定語音相關頻道的音量降低比例的方法及系統
BR112013033574B1 (pt) 2011-07-01 2021-09-21 Dolby Laboratories Licensing Corporation Sistema para sincronização de sinais de áudio e de vídeo, método para sincronização de sinais de áudio e de vídeo e meio legível por computador
CA3157717A1 (en) * 2011-07-01 2013-01-10 Dolby Laboratories Licensing Corporation System and method for adaptive audio signal generation, coding and rendering
US8615394B1 (en) 2012-01-27 2013-12-24 Audience, Inc. Restoration of noise-reduced speech
EP2690621A1 (en) * 2012-07-26 2014-01-29 Thomson Licensing Method and Apparatus for downmixing MPEG SAOC-like encoded audio signals at receiver side in a manner different from the manner of downmixing at encoder side
US9055362B2 (en) 2012-12-19 2015-06-09 Duo Zhang Methods, apparatus and systems for individualizing audio, music and speech adaptively, intelligently and interactively
MY178342A (en) 2013-05-24 2020-10-08 Dolby Int Ab Coding of audio scenes
EP2830047A1 (en) 2013-07-22 2015-01-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for low delay object metadata coding
WO2016050854A1 (en) * 2014-10-02 2016-04-07 Dolby International Ab Decoding method and decoder for dialog enhancement

Also Published As

Publication number Publication date
BR112017006325A2 (pt) 2018-01-16
TW201627983A (zh) 2016-08-01
JP6728146B2 (ja) 2020-07-22
AU2015326856B2 (en) 2021-04-08
BR112017006325B1 (pt) 2023-12-26
JP2017534904A (ja) 2017-11-24
US10170131B2 (en) 2019-01-01
WO2016050854A1 (en) 2016-04-07
PL3201918T3 (pl) 2019-04-30
CN106796804B (zh) 2020-09-18
KR102426965B1 (ko) 2022-08-01
IL251263A0 (en) 2017-05-29
TWI575510B (zh) 2017-03-21
CN106796804A (zh) 2017-05-31
CA2962806C (en) 2023-03-14
RU2701055C2 (ru) 2019-09-24
DK3201918T3 (en) 2019-02-25
EP3201918A1 (en) 2017-08-09
SG11201702301SA (en) 2017-04-27
US20170309288A1 (en) 2017-10-26
UA120372C2 (uk) 2019-11-25
RU2017110842A (ru) 2018-10-01
MX364166B (es) 2019-04-15
IL251263B (en) 2019-07-31
RU2017110842A3 (es) 2019-05-15
MX2017004194A (es) 2017-05-19
EP3201918B1 (en) 2018-12-12
MY179448A (en) 2020-11-06
CA2962806A1 (en) 2016-04-07
KR20170063667A (ko) 2017-06-08
AU2015326856A1 (en) 2017-04-06

Similar Documents

Publication Publication Date Title
ES2398573T3 (es) Número reducido de decodificación de canales
ES2636808T3 (es) Codificación de escenas de audio
ES2913849T3 (es) Concepto para codificación y decodificación de audio para canales de audio y objetos de audio
ES2798137T3 (es) Decodificador de audio multicanal, codificador de audio multicanal, procedimientos y programa informático que utilizan un ajuste basado en señal residual de una contribución de una señal decorrelacionada
ES2700246T3 (es) Mejora paramétrica de la voz
ES2952871T3 (es) Concepto para puentear el espacio entre codificación parámetrica de audio multicanal y codificación multicanal envolvente matricial
TWI485699B (zh) 音訊信號訊框中事件槽位的編碼與解碼技術
ES2959970T3 (es) Codificador de audio para la codificación de una señal de múltiples canales y un decodificador de audio para la decodificación de una señal de audio codificada
ES2511390T3 (es) Aparato, procedimiento y programa de computación para mezclar en forma ascendente una señal de audio con mezcla descendente utilizando una suavización de valor de fase
ES2399058T3 (es) Aparato y procedimiento para generar una señal de control de sintetizador de múltiples canales y aparato y procedimiento para sintetizar múltipes canales
TWI330826B (en) Decoder, method of generating parametric information, encoding, transmitting, receiving, audio recording and audio playing apparatus and method, transmission system, and digital and computer program storage medium
ES3032871T3 (en) Methods and devices for encoding decoding spatial background noise within a multi-channel input signal
ES2709661T3 (es) Codificación y decodificación paramétrica de señales de audio multicanal
ES2709117T3 (es) Codificador y decodificador de audio
KR102426965B1 (ko) 대화 향상을 위한 디코딩 방법 및 디코더
ES2624668T3 (es) Codificación y descodificación de objetos de audio
HK1235540B (en) Decoding method and decoder for dialog enhancement
HK1235540A1 (en) Decoding method and decoder for dialog enhancement
BR112017006278B1 (pt) Método para aprimorar o diálogo num decodificador em um sistema de áudio e decodificador