ES3058666T3 - Method and system for decoding left and right channels of a stereo sound signal - Google Patents

Method and system for decoding left and right channels of a stereo sound signal

Info

Publication number
ES3058666T3
ES3058666T3 ES21201478T ES21201478T ES3058666T3 ES 3058666 T3 ES3058666 T3 ES 3058666T3 ES 21201478 T ES21201478 T ES 21201478T ES 21201478 T ES21201478 T ES 21201478T ES 3058666 T3 ES3058666 T3 ES 3058666T3
Authority
ES
Spain
Prior art keywords
channel
primary
encoding
stereo sound
factor
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES21201478T
Other languages
English (en)
Inventor
Tommy Vaillancourt
Milan Jelinek
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
VoiceAge Corp
Original Assignee
VoiceAge Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by VoiceAge Corp filed Critical VoiceAge Corp
Application granted granted Critical
Publication of ES3058666T3 publication Critical patent/ES3058666T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/002Dynamic bit allocation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/032Quantisation or dequantisation of spectral components
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/06Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • G10L19/09Long term prediction, i.e. removing periodical redundancies, e.g. by using adaptive codebook or pitch predictor
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • G10L19/12Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a code excitation, e.g. in code excited linear prediction [CELP] vocoders
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • G10L19/24Variable rate codecs, e.g. for generating different qualities using a scalable representation such as hierarchical encoding or layered encoding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/26Pre-filtering or post-filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/06Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being correlation coefficients
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/21Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being power information
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S1/00Two-channel systems
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S1/00Two-channel systems
    • H04S1/007Two-channel systems in which the audio signals are in digital form
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/01Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04SSTEREOPHONIC SYSTEMS 
    • H04S2400/00Details of stereophonic systems covered by H04S but not provided for in its groups
    • H04S2400/03Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Signal Processing (AREA)
  • Multimedia (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • Human Computer Interaction (AREA)
  • Health & Medical Sciences (AREA)
  • Mathematical Physics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Quality & Reliability (AREA)
  • Stereophonic System (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Stereo-Broadcasting Methods (AREA)
  • Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)

Abstract

Un método y un sistema de decodificación de sonido estéreo decodifican los canales izquierdo y derecho de una señal de sonido estéreo mediante parámetros de codificación recibidos, que incluyen los parámetros de codificación de un canal primario, los parámetros de codificación de un canal secundario y un factor β. Los parámetros de codificación del canal primario comprenden los coeficientes del filtro LP del canal primario. El canal primario se decodifica en respuesta a dichos parámetros. El canal secundario se decodifica mediante uno de varios modelos de codificación, donde al menos uno de ellos utiliza los coeficientes del filtro LP del canal primario para decodificar el canal secundario. Los canales primario y secundario decodificados se mezclan en el dominio temporal utilizando el factor β para producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo. Este factor determina las contribuciones respectivas de los canales primario y secundario al producirse dichos canales. (Traducción automática con Google Translate, sin valor legal)

Description

[0001] DESCRIPCIÓN
[0002] Método y sistema para decodificar los canales izquierdo y derecho de una señal de sonido estéreo Campo técnico
[0003] La presente descripción se refiere a la codificación de sonido estéreo, en particular, pero no exclusivamente a la codificación de voz y/o audio estéreo capaz de producir una buena calidad estéreo en una escena de audio compleja a baja tasa de bits y bajo retardo.
[0004] Antecedentes
[0005] Históricamente, la telefonía conversacional se ha implementado con teléfonos que tienen solo un transductor para emitir sonido solo a uno de los oídos del usuario. En la última década, los usuarios han comenzado a usar su teléfono portátil junto con un auricular para recibir el sonido a través de sus dos oídos principalmente para escuchar música, pero también, a veces, para escuchar discursos. Sin embargo, cuando se usa un teléfono portátil para transmitir y recibir el habla conversacional, el contenido sigue siendo monofónico, pero se presenta a los dos oídos del usuario cuando se usa un auricular.
[0006] Con el nuevo estándar de codificación de voz 3GPP como se describió en la referencia [1], la calidad del sonido codificado, por ejemplo, la voz y/o el audio que se transmite y recibe a través de un teléfono portátil ha mejorado significativamente. El siguiente paso natural es transmitir la información estéreo de manera que el receptor se acerque lo más posible a una escena de audio de la vida real que se captura en el otro extremo del enlace de comunicación.
[0007] En los códecs de audio, por ejemplo, como se describió en la referencia [2], se usa normalmente la transmisión de información estéreo.
[0008] Para los códecs de voz conversacional, la señal monofónica es la norma. Cuando se transmite una señal estereofónica, a menudo es necesario duplicar la tasa de bits, ya que tanto los canales izquierdo como derecho se codifican mediante el uso de un códec monofónico. Esto funciona bien en la mayoría de los escenarios, pero presenta el inconveniente de duplicar la tasa de bits y no aprovechar ninguna redundancia potencial entre los dos canales (canales izquierdo y derecho). Además, para mantener la tasa de bits general a un nivel razonable, se usa una tasa de bits muy baja para cada canal, lo que afecta así la calidad de sonido general.
[0009] Una alternativa posible es usar el llamado estéreo paramétrico como se describió en la referencia [6]. Las envíos estéreo paramétricos envían información tal como la diferencia de tiempo interaural (ITD) o las diferencias de intensidad interaural (IID), por ejemplo. Esta última información se envía por banda de frecuencia y, a baja tasa de bits, el presupuesto de bits asociado a la transmisión estéreo no es suficientemente alto para permitir que estos parámetros funcionen de manera eficiente.
[0010] La transmisión de un factor de paneo podría ayudar a crear un efecto estéreo básico a baja tasa de bits, pero tal técnica no hace nada para preservar el ambiente y presenta limitaciones inherentes. Una adaptación demasiado rápida del factor de paneo se vuelve molesta para el oyente, mientras que una adaptación demasiado lenta del factor de paneo no refleja la posición real de los altavoces, lo que dificulta obtener una buena calidad en caso de hablantes que interfieren o cuando la fluctuación del ruido de fondo es importante. Actualmente, la codificación de voz estéreo conversacional con una calidad decente para todas las posibles escenas de audio requiere una tasa de bits mínima de alrededor de 24 kb/s para señales de banda ancha (WB); por debajo de esa tasa de bits, la calidad de la voz comienza a sufrir.
[0011] Con la creciente globalización de la fuerza laboral y la división de equipos de trabajo en todo el mundo, existe la necesidad de mejorar las comunicaciones. Por ejemplo, los participantes a una videoconferencia pueden estar en ubicaciones diferentes y distantes. Algunos participantes podrían estar en sus coches, otros podrían estar en una gran sala anecoica o incluso en su sala de estar. De hecho, todos los participantes desean sentir que tienen una discusión cara a cara. La implementación de voz estéreo, más generalmente sonido estéreo en dispositivos portátiles sería un gran paso en esta dirección.
[0012] Resumen
[0013] De acuerdo con un primer aspecto, la presente descripción se refiere a un método de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende: recibir parámetros de codificación que comprenden parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario; decodificar el canal primario en respuesta a los parámetros de codificación del canal primario; decodificar el canal secundario mediante el uso de uno de una pluralidad de modelos de codificación, en donde al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario; y mezclar de manera ascendente en el dominio del tiempo los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario tras la producción de los canales izquierdo y derecho.
[0014] De acuerdo con un segundo aspecto, se proporciona un sistema de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende: medios para recibir parámetros de codificación que comprenden parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario; un decodificador del canal primario en respuesta a los parámetros de codificación del canal primario; un decodificador del canal secundario mediante el uso de uno de una pluralidad de modelos de codificación, en donde al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario; y un mezclador ascendente en el dominio del tiempo de los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario tras la producción de los canales izquierdo y derecho.
[0015] De acuerdo con un tercer aspecto, se proporciona un sistema de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende: al menos un procesador; y una memoria acoplada al procesador y que comprende instrucciones no transitorias que cuando se ejecutan hacen que el procesador implemente: medios para recibir parámetros de codificación que comprenden parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario; un decodificador del canal primario en respuesta a los parámetros de codificación del canal primario; un decodificador del canal secundario mediante el uso de uno de una pluralidad de modelos de codificación, en donde al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario; y un mezclador ascendente en el dominio del tiempo de los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario tras la producción de los canales izquierdo y derecho. Un aspecto adicional se refiere a un sistema de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende: al menos un procesador; y una memoria acoplada al procesador y que comprende instrucciones no transitorias que, cuando se ejecutan, hacen que el procesador: reciba parámetros de codificación que comprenden parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario; decodificar el canal primario en respuesta a los parámetros de codificación del canal primario; decodificar el canal secundario mediante el uso de uno de una pluralidad de modelos de codificación, en donde al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario; y mezclar en el dominio del tiempo los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario tras la producción de los canales izquierdo y derecho.
[0016] La presente descripción se refiere además a una memoria legible por procesador que comprende instrucciones no transitorias que, cuando se ejecutan, hacen que un procesador implemente las operaciones del método descrito anteriormente.
[0017] Los anteriores y otros objetos, ventajas y características del método y sistema de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo se harán más evidentes tras la lectura de la siguiente descripción no restrictiva de las modalidades ilustrativas de los mismos, dadas a manera de ejemplo solo con referencia a los dibujos adjuntos.
[0018] Breve descripción de los dibujos
[0019] En los dibujos adjuntos:
[0020] La Figura 1 es un diagrama de bloques esquemático de un sistema de procesamiento y comunicación de sonido estéreo que representa un posible contexto de implementación del método y sistema de codificación de sonido estéreo como se describió en la siguiente descripción;
[0021] La Figura 2 es un diagrama de bloques que ilustra simultáneamente un método y sistema de codificación de sonido estéreo de acuerdo con un primer modelo, presentado como un diseño estéreo integrado; La Figura 3 es un diagrama de bloques que ilustra simultáneamente un método y sistema de codificación de sonido estéreo de acuerdo con un segundo modelo, presentado como un modelo integrado;
[0022] La Figura 4 es un diagrama de bloques que muestra simultáneamente suboperaciones de una operación de mezcla descendente en el dominio del tiempo del método de codificación de sonido estéreo de las Figuras 2 y 3, y módulos de un mezclador de canales del sistema de codificación de sonido estéreo de las Figuras 2 y 3;
[0023] La Figura 5 es un gráfico que muestra cómo una diferencia de correlación a largo plazo linealizada se asigna a un factorβy a un factor de normalización de energía ε;
[0024] La Figura 6 es un gráfico de curvas múltiples que muestra una diferencia entre el uso de un esquemapca/kltsobre un marco completo y mediante el uso de una función de asignación de "coseno";
[0025] La Figura 7 es un gráfico de curvas múltiples que muestra un canal primario, un canal secundario y los espectros de estos canales primario y secundario resultantes de aplicar la mezcla descendente en el dominio del tiempo a una muestra estéreo que se ha grabado en una sala con eco pequeño mediante el uso de una configuración de micrófonos binaurales con ruido de oficina de fondo;
[0026] La Figura 8 es un diagrama de bloques que ilustra simultáneamente un método y sistema de codificación de sonido estéreo, con una posible implementación de la optimización de la codificación de los canales Y primario y X secundario de la señal de sonido estéreo;
[0027] La Figura 9 es un diagrama de bloques que ilustra una operación de análisis de coherencia del filtro LP y el analizador de coherencia del filtro LP correspondiente del método y sistema de codificación de sonido estéreo de la Figura 8;
[0028] La Figura 10 es un diagrama de bloques que ilustra simultáneamente un método de decodificación de sonido estéreo y un sistema de decodificación de sonido estéreo;
[0029] La Figura 11 es un diagrama de bloques que ilustra características adicionales del método y sistema de decodificación de sonido estéreo de la Figura 10;
[0030] La Figura 12 es un diagrama de bloques simplificado de una configuración de ejemplo de componentes de hardware que forman el sistema de codificación de sonido estéreo y el decodificador de sonido estéreo de la presente descripción;
[0031] La Figura 13 es un diagrama de bloques que ilustra simultáneamente otras modalidades de suboperaciones de la operación de mezcla descendente en el dominio del tiempo del método de codificación de sonido estéreo de las Figuras 2 y 3, y módulos del mezclador de canales del sistema de codificación de sonido estéreo de las Figuras 2 y 3, mediante el uso de un factor de preadaptación para mejorar la estabilidad de la imagen estéreo;
[0032] La Figura 14 es un diagrama de bloques que ilustra simultáneamente las operaciones de una corrección de retardo temporal y módulos de un corrector de retardo temporal;
[0033] La Figura 15 es un diagrama de bloques que ilustra simultáneamente un método y sistema de codificación de sonido estéreo alternativo;
[0034] La Figura 16 es un diagrama de bloques que ilustra simultáneamente suboperaciones de un análisis de coherencia de tono y módulos de un analizador de coherencia de tono;
[0035] La Figura 17 es un diagrama de bloques que ilustra simultáneamente el método y sistema de codificación estéreo mediante el uso de la mezcla descendente en el dominio del tiempo con una capacidad de operar en el dominio del tiempo y en el dominio de la frecuencia; y
[0036] La Figura 18 es un diagrama de bloques que ilustra simultáneamente otro método y sistema de codificación estéreo mediante el uso de la mezcla descendente en el dominio del tiempo con una capacidad de operar en el dominio del tiempo y en el dominio de la frecuencia.
[0037] Descripción detallada
[0038] El alcance protegido se define en las reivindicaciones independientes adjuntas. Las características opcionales se definen en las reivindicaciones dependientes adjuntas.
[0039] La presente descripción se refiere a la producción y transmisión, con una tasa de bits baja y un retardo bajo, de una representación realista de contenido de sonido estéreo, por ejemplo, contenido de voz y/o audio, desde, en particular, pero no exclusivamente, una escena de audio compleja. Una escena de audio compleja incluye situaciones en las que (a) la correlación entre las señales de sonido que se graban por los micrófonos es baja, (b) hay una fluctuación importante del ruido de fondo y/o (c) está presente un hablante que interfiere. Los ejemplos de escenas de audio complejas comprenden una sala de conferencias anecoica grande con una configuración de micrófonos A/B, una sala acústica pequeña con micrófonos binaurales y una sala acústica pequeña con una configuración de micrófonos mono/lateral. Todas estas configuraciones de habitación podrían incluir ruido de fondo fluctuante y/o hablantes que interfieren.
[0040] Los códecs de sonido estéreo conocidos, tales como 3GPP AMR-WB+ como se describió en la referencia [7], son ineficientes para codificar sonido que no está cerca del modelo monofónico, especialmente a baja tasa de bits. Ciertos casos son particularmente difíciles de codificar mediante el uso de técnicas estéreo existentes. Tales casos incluyen:
[0041]  LAAB (Sala anecoica grande con configuración de micrófonos A/B);
[0042]  SEBI (pequeña sala acústica con micrófonos binaurales configurados); y
[0043]  SEMS (Sala de ecos pequeños con configuración de micrófonos mono/lateral).
[0044] La adición de un ruido de fondo fluctuante y/o hablantes que interfieren hace que estas señales de sonido sean aún más difíciles de codificar a una tasa de bits baja mediante el uso de técnicas estéreo dedicadas, tales como estéreo paramétrico. Una alternativa para codificar tales señales es usar dos canales monofónicos, por lo que se duplica la tasa de bits y el ancho de banda de la red que se usa.
[0045] El último estándar de voz conversacional EVS de 3GPP proporciona un intervalo de tasa de bits de 7,2 kb/s a 96 kb/s para la operación de banda ancha (WB) y de 9,6 kb/s a 96 kb/s para la operación de banda ancha súper (SWB). Esto significa que las tres tasas de bits mono dual más bajas mediante el uso de EVS son 14,4, 16,0 y 19,2 kb/s para la operación WB y 19,2, 26,3 y 32,8 kb/s para la operación SWB. Aunque la calidad de la voz del 3GPP AMR-WB implementado como se describió en la referencia [3] mejora con respecto a su predecesor, la calidad de la voz codificada a 7,2 kb/s en un entorno ruidoso está lejos de ser transparente y, por lo tanto, se puede anticipar que la calidad de la voz dual mono a 14,4 kb/s también se limitaría. A tasas de bits tan bajas, el uso de la tasa de bits se maximiza de manera que se obtiene la mejor calidad de voz posible tan a menudo como sea posible. Con el método y sistema de codificación de sonido estéreo como se describió en la siguiente descripción, la tasa de bits total mínima para el contenido de voz estéreo conversacional, incluso en el caso de escenas de audio complejas, debería ser de alrededor de 13 kb/s para WB y 15,0 kb/s para SWB. A tasas de bits que son más bajas que las tasas de bits usadas en un enfoque mono dual, la calidad y la inteligibilidad del habla estéreo mejoran en gran medida para escenas de audio complejas.
[0046] La Figura 1 es un diagrama de bloques esquemático de un sistema de procesamiento y comunicación de sonido estéreo 100 que representa un posible contexto de implementación del método y sistema de codificación de sonido estéreo como se describió en la siguiente descripción.
[0047] El sistema de procesamiento y comunicación de sonido estéreo 100 de la Figura 1 admite la transmisión de una señal de sonido estéreo a través de un enlace de comunicación 101. El enlace de comunicación 101 puede comprender, por ejemplo, un cable o un enlace de fibra óptica. Alternativamente, el enlace de comunicación 101 puede comprender al menos en parte un enlace de radiofrecuencia. El enlace de radiofrecuencia a menudo admite múltiples comunicaciones simultáneas que requieren recursos de ancho de banda compartidos, como los que pueden encontrarse con la telefonía celular. Aunque no se muestra, el enlace de comunicación 101 puede reemplazarse por un dispositivo de almacenamiento en una implementación de dispositivo único del sistema de procesamiento y comunicación 100 que registra y almacena la señal de sonido estéreo codificada para su posterior reproducción.
[0048] Aún con referencia a la Figura 1, por ejemplo, un par de micrófonos 102 y 122 producen los canales izquierdo 103 y derecho 123 de una señal de sonido estéreo analógica original detectada, por ejemplo, en una escena de audio compleja. Como se indica en la descripción anterior, la señal de sonido puede comprender, en particular, pero no exclusivamente, voz y/o audio. Los micrófonos 102 y 122 pueden disponerse de acuerdo con una configuración A/B, binaural o mono/lateral.
[0049] Los canales izquierdo 103 y derecho 123 de la señal de sonido analógica original se suministran a un convertidor analógico a digital (A/D) 104 para convertirlos en canales izquierdo 105 y derecho 125 de una señal de sonido estéreo digital original. Los canales izquierdo 105 y derecho 125 de la señal de sonido estéreo digital original también pueden grabarse y suministrarse desde un dispositivo de almacenamiento (no mostrado). Un codificador de sonido estéreo 106 codifica los canales izquierdo 105 y derecho 125 de la señal de sonido estéreo digital, de esta manera produce un conjunto de parámetros de codificación que se multiplexan en la forma de un flujo de bits 107 entregado a un codificador de corrección de errores opcional 108. El codificador de corrección de errores opcional 108, cuando está presente, añade redundancia a la representación binaria de los parámetros de codificación en el flujo de bits 107 antes de transmitir el flujo de bits resultante 111 a través del enlace de comunicación 101.
[0050] En el lateral del receptor, un decodificador de corrección de errores opcional 109 utiliza la información redundante mencionada anteriormente en el flujo de bits digital recibido 111 para detectar y corregir errores que pueden haber ocurrido durante la transmisión a través del enlace de comunicación 101, lo que produce un flujo de bits 112 con parámetros de codificación recibidos. Un decodificador de sonido estéreo 110 convierte los parámetros de codificación recibidos en el flujo de bits 112 para crear canales izquierdo 113 y derecho 133 sintetizados de la señal de sonido estéreo digital. Los canales izquierdo 113 y derecho 133 de la señal de sonido estéreo digital reconstruida en el decodificador de sonido estéreo 110 se convierten en canales izquierdo 114 y derecho 134 sintetizados de la señal de sonido estéreo analógica en un convertidor digital a analógico (D/A) 115.
[0051] Los canales izquierdo 114 y derecho 134 sintetizados de la señal de sonido estéreo analógica se reproducen respectivamente en un par de unidades de altavoces 116 y 136. Alternativamente, los canales izquierdo 113 y derecho 133 de la señal de sonido estéreo digital del decodificador de sonido estéreo 110 también pueden suministrarse y grabarse en un dispositivo de almacenamiento (no mostrado).
[0052] Los canales izquierdo 105 y derecho 125 de la señal de sonido estéreo digital original de la Figura 1 corresponden a los canales izquierdo L y derecho R de las Figuras 2, 3, 4, 8, 9, 13, 14, 15, 17 y 18. Además, el codificador de sonido estéreo 106 de la Figura 1 corresponde al sistema de codificación de sonido estéreo de las Figuras 2, 3, 8, 15, 17 y 18.
[0053] El método y sistema de codificación de sonido estéreo de acuerdo con la presente descripción son de dos tipos; se proporcionan el primer y el segundo modelos.
[0054] La Figura 2 es un diagrama de bloques que ilustra simultáneamente el método y sistema de codificación de sonido estéreo de acuerdo con el primer modelo, presentado como un diseño estéreo integrado basado en el núcleo EVS.
[0055] Con referencia a la Figura 2, el método de codificación de sonido estéreo de acuerdo con el primer modelo comprende una operación de mezcla descendente en el dominio del tiempo 201, una operación de codificación del canal primario 202, una operación de codificación del canal secundario 203 y una operación de multiplexación 204.
[0056] Para realizar la operación de mezcla descendente en el dominio del tiempo 201, un mezclador de canales 251 mezcla los dos canales estéreo de entrada (canal derecho R y canal izquierdo L) para producir un canal primario Y y un canal secundario X.
[0057] Para llevar a cabo la operación de codificación del canal secundario 203, un codificador del canal secundario 253 selecciona y usa un número mínimo de bits (tasa de bits mínima) para codificar el canal secundario X mediante el uso de uno de los modos de codificación como se define en la siguiente descripción y producir un flujo de bits codificado del canal secundario correspondiente 206. El presupuesto de bits asociado puede cambiar en cada trama en dependencia del contenido de la trama.
[0058] Para implementar la operación de codificación del canal primario 202, se usa un codificador del canal primario 252. El codificador del canal secundario 253 señala al codificador del canal primario 252 el número de bits 208 usados en la trama actual para codificar el canal secundario X. Puede usarse cualquier tipo adecuado de codificador como el codificador del canal primario 252. Como ejemplo no limitativo, el codificador del canal primario 252 puede ser un codificador de tipo CELP. En esta modalidad ilustrativa, el codificador de tipo CELP de canal primario es una versión modificada del codificador EVS heredado, donde el codificador EVS se modifica para presentar una mayor escalabilidad de la tasa de bits para permitir una asignación flexible de la tasa de bits entre los canales primario y secundario. De esta manera, el codificador EVS modificado será capaz de usar todos los bits que no se usan para codificar el canal secundario X para codificar, con una tasa de bits correspondiente, el canal primario Y y producir un flujo de bits codificado del canal primario correspondiente 205.
[0059] Un multiplexor 254 concatena el flujo de bits del canal primario 205 y el flujo de bits del canal secundario 206 para formar un flujo de bits multiplexado 207, para completar la operación de multiplexación 204.
[0060] En el primer modelo, el número de bits y la tasa de bits correspondiente (en el flujo de bits 206) usados para codificar el canal secundario X es menor que el número de bits y la tasa de bits correspondiente (en el flujo de bits 205) usados para codificar el canal primario Y. Esto puede verse como dos (2) canales de tasa de bits variable en donde la suma de las tasas de bits de los dos canales X y Y representa una tasa de bits total constante. Este enfoque puede tener diferentes variantes con más o menos énfasis en el canal primario Y. De acuerdo con un primer ejemplo, cuando se pone un énfasis máximo en el canal primario Y, el presupuesto de bits del canal secundario X se fuerza agresivamente a un mínimo. De acuerdo con un segundo ejemplo, si se pone menos énfasis en el canal primario Y, entonces el presupuesto de bits para el canal secundario X puede hacerse más constante, lo que significa que la tasa de bits promedio del canal secundario X es ligeramente mayor en comparación con el primer ejemplo.
[0061] Se recuerda que los canales derecho R e izquierdo L de la señal de sonido estéreo digital de entrada se procesan mediante tramas sucesivas de una duración dada que puede corresponder a la duración de las tramas usadas en el procesamiento EVS. Cada trama comprende una serie de muestras de los canales derecho R e izquierdo L en dependencia de la duración dada de la trama y la velocidad de muestreo que se usa.
[0062] La Figura 3 es un diagrama de bloques que ilustra simultáneamente el método y sistema de codificación de sonido estéreo de acuerdo con el segundo modelo, presentado como un modelo integrado.
[0063] Con referencia a la Figura 3, el método de codificación de sonido estéreo de acuerdo con el segundo modelo comprende una operación de mezcla descendente en el dominio del tiempo 301, una operación de codificación del canal primario 302, una operación de codificación del canal secundario 303 y una operación de multiplexación 304.
[0064] Para completar la operación de mezcla descendente en el dominio del tiempo 301, un mezclador de canales 351 mezcla los dos canales de entrada derecho R e izquierdo L para formar un canal primario Y y un canal secundario X.
[0065] En la operación de codificación del canal primario 302, un codificador del canal primario 352 codifica el canal primario Y para producir un flujo de bits codificado del canal primario 305. De nuevo, puede usarse cualquier tipo adecuado de codificador como el codificador del canal primario 352. Como ejemplo no limitativo, el codificador del canal primario 352 puede ser un codificador de tipo CELP. En esta modalidad ilustrativa, el codificador del canal primario 352 usa un estándar de codificación de voz tal como el modo de codificación mono EVS heredado o el modo de codificación AMR-WB-IO, por ejemplo, lo que significa que la porción monofónica del flujo de bits 305 sería interoperable con el EVS heredado, el AMR-WB-IO o el decodificador AMR-WB heredado cuando la tasa de bits es compatible con tal decodificador. En dependencia del modo de codificación que se seleccione, puede ser necesario realizar algunos ajustes del canal primario Y para el procesamiento a través del codificador del canal primario 352.
[0066] En la operación de codificación del canal secundario 303, un codificador del canal secundario 353 codifica el canal secundario X a una tasa de bits más baja mediante el uso de uno de los modos de codificación como se define en la siguiente descripción. El codificador del canal secundario 353 produce un flujo de bits codificado del canal secundario 306.
[0067] Para realizar la operación de multiplexación 304, un multiplexor 354 concatena el flujo de bits codificado del canal primario 305 con el flujo de bits codificado del canal secundario 306 para formar un flujo de bits multiplexado 307. Esto se llama modelo integrado, porque el flujo de bits codificado del canal secundario 306 asociado al estéreo se añade encima de un flujo de bits interoperable 305. El flujo de bits del canal secundario 306 puede separarse del flujo de bits estéreo multiplexado 307 (flujos de bits concatenados 305 y 306) en cualquier momento, lo que da como resultado un flujo de bits decodificable por un códec heredado como se describió anteriormente en la presente descripción, mientras que un usuario de una versión más reciente del códec aún podría disfrutar de la decodificación estéreo completa.
[0068] Los primeros y segundos modelos descritos anteriormente son de hecho cercanos entre sí. La principal diferencia entre los dos modelos es la posibilidad de usar una asignación de bits dinámica entre los dos canales Y y X en el primer modelo, mientras que la asignación de bits es más limitada en el segundo modelo debido a consideraciones de interoperabilidad.
[0069] Ejemplos de implementación y enfoques usados para lograr el primer y segundo modelo descrito anteriormente se dan en la siguiente descripción.
[0070] 1) Mezcla descendente en el dominio del tiempo
[0071] Como se expresa en la descripción anterior, los modelos estéreo conocidos que operan a baja tasa de bits tienen dificultades con la codificación de voz que no está cerca del modelo monofónico. Los enfoques tradicionales realizan la mezcla descendente en el dominio de la frecuencia, por banda de frecuencia, mediante el uso de, por ejemplo, una correlación por banda de frecuencia asociada con un Análisis de Componentes Principales (pca) mediante el uso de, por ejemplo, una Transformada de Karhunen-Loève (klt),para obtener dos vectores, como se describió en las referencias [4] y [5]. Uno de estos dos vectores incorpora todo el contenido altamente correlacionado mientras que el otro vector define todo el contenido que no está muy correlacionado. El método mejor conocido para codificar el habla a tasas de bits bajas usa un códec de dominio del tiempo, tal como un códec CELP (predicción lineal de excitación de código), en el que las soluciones de dominio de la frecuencia no son directamente aplicables. Por esa razón, mientras la idea detrás de lapca/kltpor banda de frecuencia es interesante, cuando el contenido es voz, el canal primario Y necesita convertirse de nuevo al dominio del tiempo y, después de dicha conversión, su contenido ya no se parece a la voz tradicional, especialmente en el caso de las configuraciones descritas anteriormente mediante el uso de un modelo específico de voz tal como CELP. Esto tiene el efecto de reducir el rendimiento del códec de voz. Además, a baja tasa de bits, la entrada de un códec de voz debe estar lo más cerca posible de las expectativas del modelo interno del códec.
[0073] Partiendo de la idea de que una entrada de un códec de voz de baja tasa de bits debe estar lo más cerca posible de la señal de voz esperada, se ha desarrollado una primera técnica. La primera técnica se basa en una evolución del esquemapca/klttradicional. Mientras que el esquema tradicional calcula elpca/kltpor banda de frecuencia, la primera técnica lo calcula en toda la trama, directamente en el dominio del tiempo. Esto funciona adecuadamente durante los segmentos de habla activa, siempre que no haya ruido de fondo o hablante que interfiera. Elesquema pca/kltdetermina qué canal (canal izquierdo L o derecho R) contiene la información más útil, este canal se envía al codificador del canal primario. Desafortunadamente, elesquema pca/kltsobre una base de trama no es confiable en presencia de ruido de fondo o cuando dos o más personas hablan entre sí. El principio del esquemapca/kltimplica la selección de un canal de entrada (R o L) u otro, lo que a menudo conduce a cambios drásticos en el contenido del canal primario a codificar. Al menos por las razones anteriores, la primera técnica no es lo suficientemente confiable y, en consecuencia, se presenta en la presente descripción una segunda técnica para superar las deficiencias de la primera técnica y permitir una transición más fluida entre los canales de entrada. Esta segunda técnica se describirá a continuación con referencia a las Figuras 4-9.
[0075] Con referencia a la Figura 4, la operación de mezcla descendente en el dominio del tiempo 201/301 (Figuras 2 y 3) comprende las siguientes suboperaciones: una suboperación de análisis de energía 401, una suboperación de análisis de tendencia de energía 402, una suboperación de análisis de correlación normalizada de canales L y R 403, una suboperación de cálculo de diferencia de correlación a largo plazo (LT) 404, una suboperación de conversión y cuantificación de diferencia de correlación a largo plazo al factor β 405 y una suboperación de mezcla descendente en el dominio del tiempo 406.
[0077] Teniendo en cuenta la idea de que la entrada de un códec de sonido de baja tasa de bits (tal como voz y/o audio) debe ser lo más homogénea posible, la suboperación de análisis de energía 401 se realiza en el mezclador de canales 252/351 mediante un analizador de energía 451 para determinar primero, por trama, larmsenergía RMS (raíz cuadrada media) de cada canal de entrada R y L mediante el uso de las relaciones (1):
[0080]
[0082] donde los subíndicesLyRrepresentan los canales izquierdo y derecho respectivamente,L(i)representa la muestraidel canalL, R(i)representa la muestraidel canalR, Ncorresponde al número de muestras por trama, ytrepresenta una trama actual.
[0084] El analizador de energía 451 usa entonces los valoresrmsde relaciones (1) para determinar los valores rms a largo plazormspara cada canal mediante el uso de relaciones (2):
[0087]
[0090] dondetrepresenta la trama actual yt-1la trama anterior.
[0092] Para realizar la suboperación de análisis de tendencia de energía 402, un analizador de tendencias de energía 452 del mezclador de canales 251/351 usa los valoresrmsa largo plazormspara determinar la tendencia de la energía en cada canal L y Rrms_dtmediante el uso de las relaciones (3):
[0095]
[0098] La tendencia de los valoresrmsa largo plazo se usa como información que muestra si los eventos temporales capturados por los micrófonos se desvanecen o si cambian de canal. Los valoresrmsa largo plazo y su tendencia también se usan para determinar una velocidad de convergencia α de una diferencia de correlación a largo plazo como se describirá de ahora en adelante.
[0100] Para realizar la suboperación de análisis de correlación normalizada de los canales L y R 403, un analizador de correlación normalizada L y R 453 calcula una correlaciónGL|R
para cada uno de los canales izquierdo L y derecho R normalizados contra una versión de señal monofónicam(i)del sonido, tal como el habla y/o el audio, en la tramatmediante el uso de las relaciones (4):
[0101]
[0104] dondeN, como ya se mencionó, corresponde al número de muestras en una trama, ytrepresenta la trama actual. En la modalidad actual, todas las correlaciones normalizadas y valoresrmsdeterminados por las relaciones 1 a 4 se calculan en el dominio del tiempo, para toda la trama. En otra posible configuración, estos valores pueden calcularse en el dominio de la frecuencia. Por ejemplo, las técnicas descritas en la presente descripción, que se adaptan a señales de sonido que tienen características de voz, pueden ser parte de un marco más grande que puede conmutar entre un método de codificación de audio estéreo genérico en el dominio de la frecuencia y el método descrito en la presente descripción. En este caso, el cálculo de las correlaciones normalizadas y valoresrmsen el dominio de la frecuencia pueden presentar alguna ventaja en términos de complejidad o reutilización del código.
[0106] Para calcular la diferencia de correlación a largo plazo (LT) en la suboperación 404, una calculadora 454 calcula para cada canal L y R en la trama actual las correlaciones normalizadas suavizadas mediante el uso de las relaciones (5):
[0109]
[0112] donde α es la velocidad de convergencia mencionada anteriormente. Finalmente, la calculadora 454 determina la diferencia de correlación a largo plazo (LT)GLRmediante el uso de la relación (6):
[0114] En una modalidad de ejemplo, la velocidad de convergencia α puede tener un valor de 0,8 o 0,5 en dependencia de las energías a largo plazo calculadas en las relaciones (2) y la tendencia de las energías a largo plazo calculadas en las relaciones (3). Por ejemplo, la velocidad de convergencia α puede tener un valor de 0,8 cuando las energías a largo plazo de los canales izquierdo L y derecho R evolucionan en una misma dirección, una diferencia entre la diferencia de correlación a largo plazoGLRen la tramaty la diferencia de correlación a largo plazoGLRen la tramat-1es bajo (por debajo de 0,31 para esta modalidad ilustrativa), y al menos uno de los valores rms a largo plazo de los canales izquierdo L y derecho R está por encima de un cierto umbral (2000 en esta modalidad ilustrativa). Tales casos significan que ambos canales L y R evolucionan sin problemas, no hay un cambio rápido en la energía de un canal a otro, y al menos un canal contiene un nivel significativo de energía. De cualquier otra manera, cuando las energías a largo plazo de los canales derecho R e izquierdo L evolucionan en diferentes direcciones, cuando la diferencia entre las diferencias de correlación a largo plazo es alta, o cuando los dos canales derecho R e izquierdo L tienen energías bajas, entonces α se establecerá en 0,5 para aumentar la velocidad de adaptación de la diferencia de correlación a largo plazoGLR.
[0116] Para llevar a cabo la suboperación de conversión y cuantificación 405, una vez que la diferencia de correlación a largo plazoGLRse ha estimado correctamente en la calculadora 454, el convertidor y el cuantificador 455 convierten esta diferencia en un factorβque se cuantifica, y se suministra a (a) el codificador del canal primario 252 (Figura 2), (b) el codificador del canal secundario 253/353 (Figuras 2 y 3), y (c) el multiplexor 254/354 (Figuras 2 y 3) para su transmisión a un decodificador dentro del flujo de bits multiplexada 207/307 a través de un enlace de comunicación tal como 101 de la Figura 1.
[0118] El factorβrepresenta dos aspectos de la entrada estéreo combinados en un parámetro. Primero, el factorβrepresenta una proporción o contribución de cada uno de los canales derecho R e izquierdo L que se combinan juntos para crear el canal primario Y y, en segundo lugar, también puede representar un factor de escalado de energía para aplicar al canal primario Y para obtener un canal primario que esté cerca en el dominio de energía de lo que sería una versión de sonido monofónico. Por lo tanto, en el caso de una estructura integrada, permite que el canal primario Y se decodifique solo sin la necesidad de recibir el flujo de bits secundario 306 que transporta los parámetros estéreo. Este parámetro de energía también puede usarse para volver a escalar la energía del canal secundario X antes de codificarlo, de manera que la energía global del canal secundario X esté más cerca del intervalo de energía óptimo del codificador del canal secundario. Como se muestra en la Figura 2, la información de energía presente intrínsecamente en el factorβtambién puede usarse para mejorar la asignación de bits entre los canales primario y secundario.
[0120] El factor cuantificadoβpuede transmitirse al decodificador mediante el uso de un índice. Dado que el factorβpuede representar tanto (a) las contribuciones respectivas de los canales izquierdo y derecho al canal primario como (b) un factor de escalado de energía a aplicar al canal primario para obtener una versión de señal monofónica del sonido o una información de correlación/energía que ayuda a asignar de manera más eficiente los bits entre el canal primario Y y el canal secundario X, el índice transmitido al decodificador transmite dos elementos de información distintos con un mismo número de bits.
[0122] Para obtener una asignación entre la diferencia de correlación a largo plazoGLR(t) y el factorβ, en esta modalidad de ejemplo, el convertidor y el cuantificador 455 limitan primero la diferencia de correlación a largo plazoGLR(t) entre -1,5 a 1,5 y después linealiza esta diferencia de correlación a largo plazo entre 0 y 2 para obtener una diferencia de correlación a largo plazo linealizada temporalmente
como se muestra en la relación (7):
[0125]
[0128] En una implementación alternativa, puede decidirse usar solo una parte del espacio rellenado con la diferencia
[0129] de correlación a largo plazo linealizada,limitando además sus valores entre, por ejemplo, 0,4 y 0,6. Esta limitación adicional tendría el efecto de reducir la localización de la imagen estéreo, pero también de ahorrar algunos bits de cuantificación. En dependencia de la elección del diseño, esta opción puede considerarse.
[0131] Después de la linealización, el convertidor y el cuantificador 455 realizan una asignación de la diferencia de
[0132] correlación a largo plazo linealizada en el dominio "coseno" mediante el uso de la relación (8):
[0135]
[0138] Para realizar la suboperación de mezcla descendente en el dominio del tiempo 406, un mezclador descendente en el dominio del tiempo 456 produce el canal primario Y y el canal secundario X como una mezcla de los canales derecho R e izquierdo L mediante el uso de las relaciones (9) y (10):
[0141]
[0144] dondei =0,...,N-1 es el índice de muestra en la trama ytes el índice de trama.
[0146] La Figura 13 es un diagrama de bloques que muestra simultáneamente otras modalidades de suboperaciones de la operación de mezcla descendente en el dominio del tiempo 201/301 del método de codificación de sonido estéreo de las Figuras 2 y 3, y módulos del mezclador de canales 251/351 del sistema de codificación de sonido estéreo de las Figuras 2 y 3, mediante el uso de un factor de preadaptación para mejorar la estabilidad de la imagen estéreo. En una implementación alternativa como se representa en la Figura 13, la operación de mezcla descendente en el dominio del tiempo 201/301 comprende las siguientes suboperaciones: una suboperación de análisis de energía 1301, una suboperación de análisis de tendencia de energía 1302, un suboperación de análisis de correlación normalizada de canales L y R 1303, una suboperación de cálculo del factor de preadaptación 1304, una operación 1305 de aplicación del factor de preadaptación a correlaciones normalizadas, una suboperación de cálculo de diferencia de correlación a largo plazo (LT) 1306, una suboperación de conversión y cuantificación de ganancia al factor β 1307, y una suboperación de mezcla descendente en el dominio del tiempo 1308.
[0148] Las suboperaciones 1301, 1302 y 1303 se realizan respectivamente mediante un analizador de energía 1351, un analizador de tendencias de energía 1352 y un analizador de correlación normalizada L y R 1353, sustancialmente de la misma manera que se explica en la descripción anterior en relación con las suboperaciones 401, 402 y 403, y analizadores 451, 452 y 453 de la Figura 4.
[0150] Para realizar la suboperación 1305, el mezclador de canales 251/351 comprende una calculadora 1355 para aplicar el factor de preadaptaciónardirectamente a las correlacionesGL|R
) (GL(t) yGR(t)) de las relaciones (4) de manera que su evolución se suaviza en dependencia de la energía y las características de ambos canales. Si la energía de la señal es baja o si tiene algunas características sordas, entonces la evolución de la ganancia de correlación puede ser más lenta.
[0152] Para llevar a cabo la suboperación de cálculo 1304 de factor de preadaptación, el mezclador de canales 251/351 comprende una calculadora de factores de preadaptación 1354, suministrada con (a) los valores de energía de canal izquierdo y derecho a largo plazo de las relaciones (2) del analizador de energía 1351, (b) la clasificación de trama de tramas anteriores y (c) la información de actividad de voz de las tramas anteriores. La calculadora de factores de preadaptación 1354 calcula el factor de preadaptaciónar,que pueden linealizarse entre 0,1 y 1 en dependencia de los valores rms a largo plazo mínimosrmsL|R
de los canales izquierdo y derecho del analizador 1351, mediante el uso de la relación (6a):
[0153] En una modalidad, el coeficienteMapuede tener el valor de 0,0009 y coeficienteBael valor de 0,16. En una variante, el factor de preadaptaciónarpuede verse obligado a 0,15, por ejemplo, si una clasificación anterior de los dos canales R y L es indicativa de características sordas y de una señal activa. También puede usarse una bandera de extensión de detección de actividad de voz (VAD) para determinar que una parte anterior del contenido de una trama era un segmento activo.
[0155] La operación 1305 de aplicar el factor de preadaptaciónara las correlaciones normalizadasGL|R
(GL(t) yGR(t) de las relaciones (4)) de los canales izquierdo L y derecho R es distinta de la operación 404 de la Figura 4. En lugar de calcular las correlaciones normalizadas suavizadas a largo plazo (LT) aplicando a las correlaciones normalizadasGL|R(GL(t) yGR(t)) un factor (1-α), α es la velocidad de convergencia definida anteriormente (Relaciones (5)), la calculadora 1355 aplica el factor de preadaptaciónardirectamente a las correlaciones normalizadasGL|R(GL(t) yGR(t)) de los canales izquierdo L y derecho R mediante el uso de la relación (11b):
[0158]
[0161] La calculadora 1355 genera ganancias de correlación adaptadas τL|R
que se proporcionan a una calculadora de diferencias de correlación a largo plazo (LT) 1356. La operación de mezcla descendente en el dominio del tiempo 201/301 (Figuras 2 y 3) comprende, en la implementación de la Figura 13, una suboperación de cálculo de diferencia de correlación a largo plazo (LT) 1306, una suboperación de conversión y cuantificación de diferencia de correlación a largo plazo al factor β 1307 y una suboperación de mezcla descendente en el dominio del tiempo 1358 similar a las suboperaciones 404, 405 y 406, respectivamente, de la Figura 4.
[0163] La operación de mezcla descendente en el dominio del tiempo 201/301 (Figuras 2 y 3) comprende, en la implementación de la Figura 13, una suboperación de cálculo de diferencia de correlación a largo plazo (LT) 1306, una suboperación de conversión y cuantificación de diferencia de correlación a largo plazo al factor β 1307 y una suboperación de mezcla descendente en el dominio del tiempo 1358 similar a las suboperaciones 404, 405 y 406, respectivamente, de la Figura 4.
[0165] Las suboperaciones 1306, 1307 y 1308 se realizan respectivamente mediante una calculadora 1356, un convertidor y cuantificador 1357 y un mezclador descendente en el dominio del tiempo 1358, sustancialmente de la misma manera que se explica en la descripción anterior en relación con las suboperaciones 404, 405 y 406, y la calculadora 454, convertidor y cuantificador 455 y mezclador descendente en el dominio del tiempo 456.
[0167] La Figura 5 muestra cómo la diferencia de correlación a largo plazo linealizada
se asigna al factorβy
[0168] la escala de energía. Puede observarse que para una diferencia de correlación a largo plazo linealizada de 1,0, lo que significa que las energías/correlaciones del canal derecho R y del canal izquierdo L son casi las mismas, el factorβes igual a 0,5 y un factor de normalización de energía (reescala) ε es 1,0. En esta situación, el contenido del canal primario Y es básicamente una mezcla mono y el canal secundario X forma un canal lateral. El cálculo del factor de normalización (reescala) de energía ε se describe en la presente descripción.
[0169] Por otro lateral, si la diferencia de correlación a largo plazo linealizada es igual a 2, lo que significa que la mayor parte de la energía está en el canal izquierdo L, entonces el factorβes 1 y el factor de normalización de energía (reescala) es 0,5, lo que indica que el canal primario Y contiene básicamente el canal izquierdo L en una implementación de diseño integrada o una representación reducida del canal izquierdo L en una implementación de diseño integrada. En este caso, el canal secundario X contiene el canal derecho R. En las modalidades ilustrativas, el convertidor y el cuantificador 455 o 1357 cuantifican el factorβmediante el uso de 31 entradas de cuantificación posibles. La versión cuantificada del factorβse representa mediante el uso de un índice de 5 bits y, como se describió anteriormente en la presente descripción, se suministra al multiplexor para su integración en el flujo de bits multiplexado 207/307, y se transmite al decodificador a través del enlace de comunicación.
[0171] En una modalidad, el factorβtambién puede usarse como indicador tanto para el codificador del canal primario 252/352 como para el codificador del canal secundario 253/353 para determinar la asignación de tasa de bits. Por ejemplo, si el factorβestá cerca de 0,5, lo que significa que las dos (2) energías/correlación de canales de entrada al mono están cerca entre sí, se asignarían más bits al canal secundario X y menos bits al canal primario Y, excepto si el contenido de ambos canales es bastante cercano, entonces el contenido del canal secundario será de energía realmente baja y probablemente se considerará inactivo, lo que permite codificarlo con muy pocos bits. Por otro lateral, si el factorβestá más cerca de 0 o 1, entonces la asignación de tasa de bits favorecerá al canal primario Y.
[0173] La Figura 6 muestra la diferencia entre el uso del esquemapca/kltmencionado anteriormente sobre todo el marco completo (dos curvas superiores de la Figura 6) frente al uso de la función "coseno" como se desarrolla en la relación (8) para calcular el factor β (curva inferior de la Figura 6). Por naturaleza, el esquemapca/klttiende a buscar un mínimo o un máximo. Esto funciona bien en el caso de un discurso activo como se muestra en la curva del medio de la Figura 6, pero esto no funciona realmente bien para el discurso con ruido de fondo ya que tiende a cambiar continuamente de 0 a 1 como se muestra en la curva del medio de la Figura 6. Un cambio demasiado frecuente a las extremidades, 0 y 1, provoca muchos artefactos cuando se codifica a una tasa de bits baja. Una solución potencial habría sido suavizar las decisiones del esquemapca/klt, pero esto habría afectado negativamente la detección de ráfagas de voz y sus ubicaciones correctas mientras que la función "coseno" de la relación (8) es más eficiente en este aspecto.
[0175] La Figura 7 muestra el canal primario Y, el canal secundario X y los espectros de estos canales primarios Y y secundarios X resultantes de aplicar la mezcla descendente en el dominio del tiempo a una muestra estéreo que se ha grabado en una sala con eco pequeña mediante el uso de una configuración de micrófonos binaurales con ruido de oficina de fondo. Después de la operación de mezcla descendente en el dominio del tiempo, se puede ver que ambos canales aún tienen formas espectrales similares y el canal secundario X aún tiene un contenido temporal similar al del habla, lo que permite usar un modelo basado en la voz para codificar el canal secundario X.
[0177] La mezcla descendente en el dominio del tiempo presentada en la descripción anterior puede mostrar algunos problemas en el caso especial de los canales derecho R e izquierdo L que están invertidos en fase. La suma de los canales derecho R e izquierdo L para obtener una señal monofónica resultaría en la cancelación entre los canales derecho R e izquierdo L. Para resolver este posible problema, en una modalidad, el mezclador de canales 251/351 compara la energía de la señal monofónica con la energía de los canales derecho R e izquierdo L. La energía de la señal monofónica debe ser al menos mayor que la energía de uno de los canales derecho R e izquierdo L. De cualquier otra manera, en esta modalidad, el modelo de mezcla descendente en el dominio del tiempo entra en el caso especial de fase invertida. En presencia de este caso especial, el factorβse fuerza a 1 y el canal secundario X se codifica forzosamente mediante el uso del modo genérico o sordo, lo que evita así el modo de codificación inactiva y garantiza la codificación adecuada del canal secundario X. Este caso especial, donde no se aplica el reescalado de energía, se señala al decodificador mediante el uso de la última combinación de bits (valor del índice) disponible para la transmisión del factorβ(Básicamente desdeβse cuantifica mediante el uso de 5 bits y se usan 31 entradas (niveles de cuantificación) para la cuantificación como se describió anteriormente, las 32<enésimas>posibles combinaciones de bits (valor de entrada o índice) se usan para señalar este caso especial).
[0179] En una implementación alternativa, puede ponerse más énfasis en la detección de señales que son subóptimas para las técnicas de mezcla descendente y codificación descritas anteriormente, tales como en los casos de señales fuera de fase o casi fuera de fase. Una vez que se detectan estas señales, las técnicas de codificación subyacentes pueden adaptarse si es necesario.
[0181] Típicamente, para la mezcla descendente en el dominio del tiempo como se describió en la presente descripción, cuando los canales izquierdo L y derecho R de una señal estéreo de entrada están fuera de fase, puede ocurrir cierta cancelación durante el proceso de mezcla descendente, lo que podría conducir a una calidad subóptima. En los ejemplos anteriores, la detección de estas señales es simple y la estrategia de codificación comprende codificar ambos canales por separado. Pero a veces, con señales especiales, tales como señales que están fuera de fase, puede ser más eficiente realizar aún una mezcla descendente similar a mono/lateral (β= 0,5), donde se pone mayor énfasis en el canal lateral. Dado que algún tratamiento especial de estas señales puede ser beneficioso, la detección de tales señales debe realizarse cuidadosamente. Además, la transición del modelo de mezcla descendente en el dominio del tiempo normal como se describió en la descripción anterior y el modelo de mezcla descendente en el dominio del tiempo que trata con estas señales especiales puede activarse en una región de energía muy baja o en regiones donde el tono de ambos canales no es estable, de manera que la conmutación entre los dos modelos tiene un efecto subjetivo mínimo.
[0182] La corrección de retardo temporal (TDC) (ver el corrector de retardo temporal 1750 en las Figuras 17 y 18) entre los canales L y R, o una técnica similar a la descrita en la referencia [8], puede realizarse antes de entrar en el módulo de mezcla descendente 201/301, 251/351. En tal modalidad, el factor β puede terminar teniendo un significado diferente del que se ha descrito en la presente descripción. Para este tipo de implementación, con la condición de que la corrección de retardo temporal funcione como se esperaba, el factor β puede acercarse a 0,5, lo que significa que la configuración de la mezcla descendente en el dominio del tiempo está cerca de una configuración mono/lateral. Con el funcionamiento adecuado de la corrección de retardo temporal (TDC), el lateral puede contener una señal que incluye una menor cantidad de información importante. En ese caso, la tasa de bits del canal secundario X puede ser mínima cuando el factor β está cerca de 0,5. Por otro lateral, si el factor β está cerca de 0 o 1, esto significa que la corrección de retardo temporal (TDC) puede no superar adecuadamente la situación de desalineación del retardo y el contenido del canal secundario X es probable que sea más complejo, por lo que necesita una tasa de bits más alta. Para ambos tipos de implementación, el factor β y por asociación el factor de normalización de energía (reescala) ε, pueden usarse para mejorar la asignación de bits entre el canal primario Y y el canal secundario X.
[0183] La Figura 14 es un diagrama de bloques que muestra simultáneamente las operaciones de una detección de señales fuera de fase y módulos de un detector de señales fuera de fase 1450 que forma parte de la operación de mezcla descendente 201/301 y mezclador de canales 251/351. Las operaciones de detección de señales fuera de fase incluyen, como se muestra en la Figura 14, una operación de detección de señales fuera de fase 1401, una operación de detección de posición de conmutación 1402 y una operación de selección de mezclador de canal 1403, para elegir entre la operación de mezcla descendente en el dominio del tiempo 201/301 y una operación de mezcla descendente en el dominio del tiempo específica fuera de fase 1404. Estas operaciones se realizan respectivamente mediante un detector de señal fuera de fase 1451, un detector de posición de conmutación 1452, un selector de mezclador de canal 1453, el mezclador de canal descendente en el dominio del tiempo 251/351 descrito anteriormente, y un mezclador de canal descendente en el dominio del tiempo específico fuera de fase 1454.
[0184] La detección de señales fuera de fase 1401 se basa en una correlación de bucle abierto entre los canales primario y secundario en tramas anteriores. Para este fin, el detector 1451 calcula en las tramas anteriores una diferencia de energíaSm(t) entre una señal laterals(i)y una señal monom(i) mediante el uso de las relaciones (12a) y (12b):
[0187]
[0189] Después, el detector 1451 calcula la diferencia de energía lateral a mono a largo plazoSm(t) mediante el uso de la relación (12c):
[0192]
[0194] dondetindica la trama actual,t-1
la trama anterior, y donde el contenido inactivo puede derivarse de la bandera de extensión del Detector de Actividad de Voz (VAD) o de un contador de extensión del VAD.
[0195] Además de la diferencia de energía lateral a mono a largo plazoSm(t), la última correlación máxima de tono en bucle abiertoCF|L
de cada canal Y y X, como se define en la cláusula 5.1.10 de la Referencia [1], también se tiene en cuenta para decidir cuándo el modelo actual se considera subóptimo.CP(t-1)
representa la correlación máxima de tono en bucle abierto de tono del canal primario Y en una trama anterior yCS(t-1),
la correlación máxima de tono en bucle abierto del canal secundario X en la trama anterior. Una bandera de suboptimalidadFsubse calcula mediante el detector de posición de conmutación 1452 de acuerdo con los siguientes criterios: Si la diferencia de energía lateral a mono a largo plazoSm(t) está por encima de un cierto umbral, por ejemplo cuandoSm(t) > 2,0, si tanto las correlaciones máximas de tono en bucle abiertoCP(t-1)
yCS(t-1)
están entre 0,85 y 0,92, lo que significa que las señales tienen una buena correlación, pero no están tan correlacionadas como lo estaría una señal de voz, la bandera de suboptimalidadFsubse establece en 1, lo que indica una condición fuera de fase entre los canales izquierdo L y derecho R.
[0196] De cualquier otra manera, la bandera de suboptimalidadFsubse establece en 0, lo que indica que no hay una condición fuera de fase entre los canales izquierdo L y derecho R.
[0197] Para añadir estabilidad en la decisión de la bandera de suboptimalidad, el detector de posición de conmutación 1452 implementa un criterio con respecto al contorno de tono de cada canal Y y X. El detector de posición de conmutación 1452 determina que el mezclador de canales 1454 se usará para codificar las señales subóptimas cuando, en la modalidad ilustrativa, al menos tres (3) instancias consecutivas de la bandera de suboptimalidadFsubse establecen en 1 y la estabilidad de cabeceo de la última trama de uno de los canales primarios,ppc(t-1)
, o del canal secundario,psc(t-1)
, es mayor que 64. La estabilidad del tono consiste en la suma de las diferencias absolutas de los tres tonos de bucle abiertop0|1|2
como se define en 5.1.10 de la referencia [1], calculado por el detector de posición de conmutación 1452 mediante el uso de la relación (12d):
[0200]
[0202] El detector de posición de conmutación 1452 proporciona la decisión al selector de mezclador de canal 1453 que, a su vez, selecciona el mezclador de canal 251/351 o el mezclador de canal 1454 en consecuencia. El selector de mezclador de canal 1453 implementa una histéresis de manera que, cuando se selecciona el mezclador de canal 1454, esta decisión se mantiene hasta que se cumplan las siguientes condiciones: un número de tramas consecutivas, por ejemplo 20 tramas, se consideran óptimas, la estabilidad del tono de la última trama de uno de losppc(t-1)
o el canal secundariopsc(t-1)
es mayor que un número predeterminado, por ejemplo 64, y la diferencia de energía lateral a mono a largo plazoSm(t) es menor o igual a 0.
[0203] 2) Codificación dinámica entre canales primarios y secundarios
[0204] La Figura 8 es un diagrama de bloques que ilustra simultáneamente el método y sistema de codificación de sonido estéreo, con una posible implementación de la optimización de la codificación de los canales Y primario y X secundario de la señal de sonido estéreo, tal como voz o audio.
[0205] Con referencia a la Figura 8, el método de codificación de sonido estéreo comprende una operación de preprocesamiento de baja complejidad 801 implementada por un preprocesador de baja complejidad 851, una operación de clasificación de señales 802 implementada por un clasificador de señales 852, una operación de decisión 803 implementada por un módulo de decisión 853, una operación de codificación solo genérica de modelo de cuatro (4) subtramas 804 implementada por un módulo de codificación solo genérica de modelo de cuatro (4) subtramas 854, una operación de codificación de modelo de dos (2) subtramas 805 implementada por un módulo de codificación de modelo de dos (2) subtramas 855, y una operación de análisis de coherencia del filtro LP 806 implementada por un analizador de coherencia del filtro LP 856.
[0206] Después de que el mezclador descendente en el dominio del tiempo 301 se haya realizado mediante el mezclador de canal 351, en el caso del modelo integrado, el canal primario Y se codifica (operación de codificación del canal primario 302) (a) mediante el uso del codificador del canal primario 352 un codificador heredado tal como el codificador EVS heredado o cualquier otro codificador de sonido heredado adecuado (debe tenerse en cuenta que, como se mencionó en la descripción anterior, cualquier tipo adecuado de codificador puede usarse como el codificador del canal primario 352). En el caso de una estructura integrada, se usa un códec de voz dedicado como codificador del canal primario 252. El codificador de voz dedicado 252 puede ser un codificador basado en tasa de bits variable (VBR), por ejemplo, una versión modificada del codificador EVS heredado, que se ha modificado para tener una mayor escalabilidad de la tasa de bits que permite el manejo de una tasa de bits variable a nivel de trama (de nuevo, debe tenerse en cuenta que, como se mencionó en la descripción anterior, puede usarse cualquier tipo adecuado de codificador como el codificador del canal primario 252). Esto permite que la cantidad mínima de bits usados para codificar el canal secundario X varíe en cada trama y se adapte a las características de la señal de sonido a codificar. Al final, la firma del canal secundario X será lo más homogénea posible.
[0207] La codificación del canal secundario X, es decir, la energía/correlación más baja a la entrada mono, se optimiza para usar una tasa de bits mínima, en particular, pero no exclusivamente para contenido similar al habla. Para ello, la codificación del canal secundario puede aprovechar los parámetros que ya están codificados en el canal primario Y, tales como los coeficientes del filtro LP (LPC) y/o el retardo de tono 807. Específicamente, se decidirá, como se describió en la presente descripción, si los parámetros calculados durante la codificación del canal primario son suficientemente cercanos a los parámetros correspondientes calculados durante la codificación del canal secundario para volver a usarse durante la codificación del canal secundario.
[0208] En primer lugar, la operación de preprocesamiento de baja complejidad 801 se aplica al canal secundario X mediante el uso del preprocesador de baja complejidad 851, en donde un filtro LP, una detección de actividad de voz (VAD) y un tono de bucle abierto se calculan en respuesta al canal secundario X. Estos últimos cálculos pueden implementarse, por ejemplo, mediante los realizados en el codificador heredado EVS y descritos respectivamente en las cláusulas 5.1.9, 5.1.12 y 5.1.10 de la referencia [1]. Dado que, como se mencionó en la descripción anterior, cualquier tipo adecuado de codificador puede usarse como el codificador del canal primario 252/352, los cálculos anteriores pueden implementarse mediante los realizados en tal codificador del canal primario.
[0209] Después, el clasificador de señales 852 analiza las características de la señal del canal secundario X para clasificar el canal secundario X como sordo, genérico o inactivo mediante el uso de técnicas similares a las de la función de clasificación de señales EVS, cláusula 5.1.13 de la misma Referencia [1]. Estas operaciones son conocidas por los expertos en la técnica y pueden extraerse del estándar 3GPP TS 26.445, v.12,0.0 para la simplicidad, pero también pueden usarse implementaciones alternativas.
[0210] a. Reutilización de los coeficientes del filtro LP del canal primario
[0211] Una parte importante del consumo de la tasa de bits reside en la cuantificación de los coeficientes del filtro LP (LPC). A baja tasa de bits, la cuantificación completa de los coeficientes del filtro LP puede ocupar hasta casi el 25 % del presupuesto de bits. Dado que el canal secundario X a menudo está cerca en contenido de frecuencia al canal primario Y, pero con un nivel de energía más bajo, vale la pena verificar si sería posible reutilizar los coeficientes del filtro LP del canal primario Y. Para ello, como se muestra en la Figura 8, se ha desarrollado una operación de análisis de coherencia del filtro LP 806 implementada por un analizador de coherencia del filtro LP 856, en la que se calculan y comparan pocos parámetros para validar la posibilidad de reutilizar o no los coeficientes del filtro LP (LPC) 807 del canal primario Y.
[0212] La Figura 9 es un diagrama de bloques que ilustra la operación de análisis de coherencia del filtro LP 806 y el analizador de coherencia del filtro LP correspondiente 856 del método y sistema de codificación de sonido estéreo de la Figura 8.
[0213] La operación de análisis de coherencia del filtro LP 806 y el analizador de coherencia del filtro LP correspondiente 856 del método y sistema de codificación de sonido estéreo de la Figura 8 comprenden, como se ilustra en la Figura 9, una suboperación de análisis del filtro LP de canal primario 903 implementada por un analizador del filtro LP 953, una suboperación de ponderación 904 implementada por un filtro de ponderación 954, una suboperación de análisis del filtro LP de canal secundario 912 implementada por un analizador del filtro LP 962, una suboperación de ponderación 901 implementada por un filtro de ponderación 951, una suboperación de análisis de distancia euclidiana 902 implementada por un analizador de distancia euclidiana 952, una suboperación de filtrado residual 913 implementada por un filtro residual 963, una suboperación de cálculo de energía residual 914 implementada por una calculadora 964 de energía de residual, una suboperación de resta 915 implementada por un restador 965, una suboperación de cálculo de energía de sonido (tal como voz y/o audio) 910 implementada por una calculadora 960 de energía, una operación de filtrado residual de canal secundario 906 implementada por un filtro residual de canal secundario 956, una suboperación de cálculo de energía residual 907 implementada por una calculadora de energía de residual 957, una suboperación de resta 908 implementada por un restador 958, una suboperación de cálculo de relación de ganancia 911 implementada por una calculadora de relación de ganancia, una suboperación de comparación 916 implementada por un comparador 966, una suboperación de comparación 917 implementada por un comparador 967, una suboperación de decisión de uso del filtro LP de canal primario 918 implementada por un módulo de decisión 968, y una suboperación de decisión de reutilización del filtro LP de canal primario 919 implementada por un módulo de decisión 969.
[0214] Con referencia a la Figura 9, el analizador del filtro LP 953 realiza un análisis del filtro LP en el canal primario Y mientras que el analizador del filtro LP 962 realiza un análisis del filtro LP en el canal secundario X. El análisis del filtro LP realizado en cada uno de los canales primarios Y y secundarios X es similar al análisis descrito en la cláusula 5.1.9 de la referencia [1].
[0215] Después, los coeficientes del filtro LPAydel analizador del filtro LP 953 se suministran al filtro residual 956 para un primer filtrado residual,rY, del canal secundario X. De la misma manera, los coeficientes del filtro LP óptimosAxdel analizador del filtro LP 962 se suministran al filtro residual 963 para un segundo filtrado residual,rX, del canal secundario X. El filtrado residual con coeficientes de filtro,AYoAX,se realiza mediante el uso de la relación (11):
[0218]
[0220] donde, en este ejemplo,sxrepresenta el canal secundario, el orden del filtro LP es 16, yNes el número de muestras en la trama (tamaño de trama) que suele ser 256, correspondiente a una duración de trama de 20 ms a una velocidad de muestreo de 12,8 kHz.
[0221] La calculadora 910 calcula la energíaExde la señal de sonido en el canal secundario X mediante el uso de la relación (14):
[0223]
[0225] y la calculadora 957 calcula la energíaErydel residuo del filtro residual 956 mediante el uso de la relación (15):
[0228]
[0230] El restador 958 resta la energía residual de la calculadora 957 de la energía del sonido de la calculadora 960 para producir una ganancia de predicciónGY.
[0231] De la misma manera, la calculadora 964 calcula la energíaErxresidual del filtro residual 963 mediante el uso de la relación (16):
[0233]
[0235] y el restador 965 resta esta energía residual de la energía del sonido de la calculadora 960 para producir una ganancia de predicciónGX.
[0236] La calculadora 961 calcula la relación de gananciaGY/GX.El comparador 966 compara la relación de gananciaGY/GXa un umbral τ, que es 0,92 en la modalidad ilustrativa. Si la relaciónGY/GXes menor que el umbral τ, el resultado de la comparación se transmite al módulo de decisión 968 que fuerza el uso de los coeficientes del filtro LP del canal secundario para codificar el canal secundario X.
[0237] El analizador de distancia euclidiana 952 realiza una medida de similitud del filtro LP, tal como la distancia euclidiana entre los pares espectrales de líneaIspYcalculado por el analizador del filtro LP 953 en respuesta al canal primario Y y los pares espectrales de líneaIspXcalculados por el analizador del filtro LP 962 en respuesta al canal secundario X. Como es conocido por los expertos en la técnica, los pares espectrales de líneaIspYyIspXrepresentan los coeficientes del filtro LP en un dominio de cuantificación. El analizador 952 usa la relación (17) para determinar la distancia euclidianadist:
[0240]
[0242] dondeMrepresenta el orden del filtro, yIspYyIspXrepresentan respectivamente los pares espectrales de línea calculados para los canales Y primario y X secundario.
[0243] Antes de calcular la distancia euclidiana en el analizador 952, es posible ponderar ambos conjuntos de pares espectrales de líneaIspYyIspXa través de factores de ponderación respectivos de manera que se ponga más o menos énfasis en ciertas porciones del espectro. Otras representaciones del filtro LP también pueden usarse para calcular la medida de similitud del filtro LP.
[0244] Una vez que la distancia euclidianadistes conocido, se compara con un umbral σ en el comparador 967. En la modalidad ilustrativa, el umbral σ tiene un valor de 0,08. Cuando el comparador 966 determina que la relaciónGY/GXes igual o mayor que el umbral τ y el comparador 967 determina que la distancia euclidianadistes igual o mayor que el umbralσ,el resultado de las comparaciones se transmite al módulo de decisión 968 que fuerza el uso de los coeficientes del filtro LP del canal secundario para codificar el canal secundario X. Cuando el comparador 966 determina que la relaciónGY/GXes igual o mayor que el umbral τ y el comparador 967 determina que la distancia euclidianadistes menor que el umbralσ,el resultado de estas comparaciones se transmite al módulo de decisión 969 que fuerza la reutilización de los coeficientes del filtro LP del canal primario para codificar el canal secundario X. En este último caso, los coeficientes del filtro LP del canal primario se reutilizarán como parte de la codificación del canal secundario.
[0245] Pueden realizarse algunas pruebas adicionales para limitar la reutilización de los coeficientes del filtro LP del canal primario para codificar el canal secundario X en casos particulares, por ejemplo, en el caso del modo de codificación sorda, donde la señal es lo suficientemente fácil de codificar que todavía hay tasa de bits disponible para codificar los coeficientes del filtro LP también. También es posible forzar la reutilización de los coeficientes del filtro LP del canal primario cuando ya se obtiene una ganancia residual muy baja con los coeficientes del filtro LP del canal secundario o cuando el canal secundario X tiene un nivel de energía muy bajo. Finalmente, las variables τ,σ,el nivel de ganancia residual o el nivel de energía muy bajo en el que puede forzarse la reutilización de los coeficientes del filtro LP pueden adaptarse todos como una función del presupuesto de bits disponible y/o como una función del tipo de contenido. Por ejemplo, si el contenido del canal secundario se considera inactivo, entonces incluso si la energía es alta, puede decidirse reutilizar los coeficientes del filtro LP del canal primario.
[0246] b. Codificación de baja tasa de bits de canal secundario
[0247] Dado que los canales Y primario y X secundario pueden ser una mezcla de ambos canales de entrada R derecho y L izquierdo, esto implica que, incluso si el contenido de energía del canal secundario X es bajo en comparación con el contenido de energía del canal primario Y, un artefacto de codificación puede percibirse una vez que se realiza la mezcla ascendente de los canales. Para limitar tal posible artefacto, la firma de codificación del canal secundario X se mantiene lo más constante posible para limitar cualquier variación de energía no intencionada. Como se muestra en la Figura 7, el contenido del canal secundario X tiene características similares al contenido del canal primario Y y por esa razón se ha desarrollado un modelo de codificación de voz de muy baja tasa de bits.
[0248] Con referencia de nuevo a la Figura 8, el analizador de coherencia del filtro LP 856 envía al módulo de decisión 853 la decisión de reutilizar los coeficientes del filtro LP del canal primario del módulo de decisión 969 o la decisión de usar los coeficientes del filtro LP del canal secundario del módulo de decisión 968. El módulo de decisión 803 decide entonces no cuantificar los coeficientes del filtro LP del canal secundario cuando los coeficientes del filtro LP del canal primario se reutilizan y a cuantificar los coeficientes del filtro LP del canal secundario cuando la decisión es usar los coeficientes del filtro LP del canal secundario. En este último caso, los coeficientes del filtro LP del canal secundario cuantificado se envían al multiplexor 254/354 para su inclusión en el flujo de bits multiplexado 207/307.
[0249] En la operación de codificación solo genérica de modelo de cuatro (4) subtramas 804 y el módulo de codificación solo genérica de modelo de cuatro (4) subtramas correspondientes 854, para mantener la tasa de bits lo más baja posible, una búsqueda ACELP como se describió en la cláusula 5.2.3.1 de la referencia [1] solo se usa cuando los coeficientes del filtro LP del canal primario Y pueden reutilizarse, cuando el canal secundario X se clasifica como genérico por el clasificador de señales 852, y cuando la energía de los canales de entrada derecho R e izquierdo L está cerca del centro, lo que significa que las energías de los canales derecho R e izquierdo L están cerca entre sí. Los parámetros de codificación encontrados durante la búsqueda ACELP en el módulo de codificación solo genérica de modelo de cuatro (4) subtramas 854 se usan entonces para construir el flujo de bits del canal secundario 206/306 y se envían al multiplexor 254/354 para su inclusión en el flujo de bits multiplexado 207/307.
[0250] De cualquier otra manera, en la operación de codificación de modelo de dos (2) subtramas 805 y el módulo de codificación de modelo de dos (2) subtramas correspondiente 855, se usa un modelo de banda media para codificar el canal secundario X con contenido genérico cuando los coeficientes del filtro LP del canal primario Y no pueden reutilizarse. Para el contenido inactivo y sordo, solo se codifica la forma del espectro.
[0251] En el módulo de codificación 855, la codificación de contenido inactivo comprende (a) codificación de ganancia de banda espectral de dominio de la frecuencia más relleno de ruido y (b) codificación de los coeficientes del filtro LP del canal secundario cuando sea necesario como se describió respectivamente en (a) cláusulas 5.2.3.5.7 y 5.2.3.5.11 y (b) cláusula 5.2.2.1 de la referencia [1]. El contenido inactivo puede codificarse a una tasa de bits tan baja como 1,5 kb/s.
[0252] En el módulo de codificación 855, la codificación X sorda del canal secundario es similar a la codificación X inactiva del canal secundario, con la excepción de que la codificación sorda usa un número adicional de bits para la cuantificación de los coeficientes del filtro LP del canal secundario que se codifican para el canal secundario sordo.
[0253] El modelo de codificación genérica de media banda se construye de manera similar a ACELP como se describió en la cláusula 5.2.3.1 de la Referencia [1], pero se usa con solo dos (2) subtramas por trama. Por lo tanto, para hacerlo, el residual como se describió en la cláusula 5.2.3.1.1 de la referencia [1], la memoria del libro de códigos adaptativo como se describió en la cláusula 5.2.3.1.4 de la referencia [1] y el canal secundario de entrada se muestrean primero mediante un factor 2. Los coeficientes del filtro LP también se modifican para representar el dominio submuestreado en lugar de la frecuencia de muestreo de 12,8 kHz mediante el uso de una técnica como se describió en la cláusula 5.4.4.2 de la referencia [1].
[0254] Después de la búsqueda ACELP, se realiza una extensión del ancho de banda en el dominio de la frecuencia de la excitación. La extensión del ancho de banda primero replica las energías de la banda espectral inferior en la banda superior. Para replicar las energías de las bandas espectrales, la energía de las primeras nueve (9) bandas espectrales,Gbd(i),se encuentran como se describió en la cláusula 5.2.3.5.7 de la Referencia [1] y las últimas bandas se rellenan como se muestra en la relación (18):
[0256]
[0258] Después, el contenido de alta frecuencia del vector de excitación representado en el dominio de la frecuenciafd(k)como se describió en la cláusula 5.2.3.5.9 de la Referencia [1] se puebla mediante el uso del contenido de frecuencia de banda inferior mediante el uso de la relación (19):
[0261]
[0263] donde el desplazamiento de tono, P<b>, se basa en un múltiplo de la información de tono como se describió en la cláusula 5.2.3.1.4.1 de la Referencia [1] y se convierte en un desplazamiento de bandas de frecuencia como se muestra en la rela
[0265] dondeTrepresenta un promedio de la información de tono decodificada por subtrama,Fses la frecuencia de muestreo interno, 12,8 kHz en esta modalidad de ejemplo, yFres la resolución de frecuencia.
[0266] Los parámetros de codificación encontrados durante la codificación inactiva de baja velocidad, la codificación sorda de baja velocidad o la codificación genérica de media banda realizada en el módulo de codificación de modelo de dos (2) subtramas 855 se usan entonces para construir el flujo de bits del canal secundario 206/306 enviado al multiplexor 254/354 para su inclusión en el flujo de bits multiplexado 207/307.
[0267] c. Implementación alternativa de la codificación de baja tasa de bits del canal secundario
[0268] La codificación del canal secundario X puede lograrse de manera diferente, con el mismo objetivo de usar un número mínimo de bits mientras se logra la mejor calidad posible y se mantiene una firma constante. La codificación del canal secundario X puede ser impulsada en parte por el presupuesto de bits disponible, independientemente de la posible reutilización de los coeficientes del filtro LP y la información de tono. Además, la operación de codificación de modelo de dos (2) subtramas (805) puede ser de banda media o banda completa. En esta implementación alternativa del codificación del canal secundario de baja tasa de bits, los coeficientes del filtro LP y/o la información de tono del canal primario pueden reutilizarse y la codificación del modelo de dos (2) subtramas puede elegirse en base al presupuesto de bits disponible para codificar el canal secundario X. Además, la codificación del modelo de 2 subtramas presentada más abajo se ha creado al duplicar la longitud de la subtrama en lugar de submuestrear/sobremuestrear sus parámetros de entrada/salida. La Figura 15 es un diagrama de bloques que ilustra simultáneamente un método de codificación de sonido estéreo alternativo y un sistema de codificación de sonido estéreo alternativo. El método y sistema de codificación de sonido estéreo de la Figura 15 incluyen varias de las operaciones y módulos del método y el sistema de la Figura 8, identificados mediante el uso de los mismos números de referencia y cuya descripción no se repite en la presente descripción por brevedad. Además, el método de codificación de sonido estéreo de la Figura 15 comprende una operación de preprocesamiento 1501 aplicada al canal primario Y antes de su codificación en la operación 202/302, una operación de análisis de coherencia de tono 1502, una operación de decisión de voz sorda/inactiva 1504, una operación de decisión de codificación de voz sorda/inactiva 1505 y una operación de decisión del modelo de subtramas 2/41506.
[0269] Las suboperaciones 1501, 1502, 1503, 1504, 1505 y 1506 se realizan respectivamente mediante un preprocesador 1551 similar al preprocesador de baja complejidad 851, un analizador de coherencia de tono 1552, un estimador de asignación de bits 1553, un módulo de decisión sordo/inactivo 1554, un módulo de decisión de codificación sorda/inactiva 1555 y un módulo de decisión de modelo de 2/4 subtramas 1556. Para realizar la operación de análisis de coherencia de tono 1502, el analizador de coherencia de tono 1552 es suministrado por los preprocesadores 851 y 1551 con tonos de bucle abierto de los canales Y primario y X secundario, respectivamente OLpitch<pri>y OLpitch<sec>. El analizador de coherencia de tono 1552 de la Figura 15 se muestra con mayor detalle en la Figura 16, que es un diagrama de bloques que ilustra simultáneamente las suboperaciones de la operación de análisis de coherencia de tono 1502 y los módulos del analizador de coherencia de tono 1552.
[0270] La operación de análisis de coherencia de tono 1502 realiza una evaluación de la similitud de los tonos de bucle abierto entre el canal primario Y y el canal secundario X para decidir en qué circunstancias el tono de bucle abierto primario puede reutilizarse en la codificación del canal secundario X. Para este fin, la operación de análisis de coherencia de tono 1502 comprende una suboperación de suma de tonos de bucle abierto del canal primario 1601 realizada por un sumador de tonos de bucle abierto del canal primario 1651, y una suboperación de suma de tonos de bucle abierto del canal secundario 1602 realizada por un sumador de tonos de bucle abierto del canal secundario 1652. La suma del sumador 1652 se resta (suboperación 1603) de la suma del sumador 1651 mediante el uso de un restador 1653. El resultado de la resta de la suboperación 1603 proporciona una coherencia de tono estéreo. Como ejemplo no limitativo, las sumas en las suboperaciones 1601 y 1602 se basan en tres (3) tonos de bucle abierto consecutivos anteriores disponibles para cada canal Y y X. Los tonos de bucle abierto pueden calcularse, por ejemplo, como se define en la cláusula 5.1.10 de la referencia [1]. La coherencia de tono estéreoSpcse calcula en suboperaciones 1601, 1602 y 1603 mediante el uso de la relación (21):
[0272]
[0274] dondepp|s(i)
representan los intervalos de bucle abierto de los canales Y primario y X secundario yirepresenta la posición de los intervalos de bucle abierto.
[0275] Cuando la coherencia de tono esté por debajo de un umbral predeterminado Δ, puede permitirse la reutilización de la información de tono del canal primario Y en dependencia de un presupuesto de bits disponible para codificar el canal secundario X. Además, en dependencia del presupuesto de bits disponible, es posible limitar la reutilización de la información de tono para señales que tienen una característica de tono para los canales Y primario y X secundario.
[0276] Para este fin, la operación de análisis de coherencia de tono 1502 comprende una suboperación de decisión 1604 realizada por un módulo de decisión 1654 que considera el presupuesto de bits disponible y las características de la señal de sonido (indicadas, por ejemplo, por los modos de codificación del canal primario y secundario). Cuando el módulo de decisión 1654 detecta que el presupuesto de bits disponible es suficiente o las señales de sonido para los canales Y primario y X secundario no tienen característica de voz, la decisión es codificar la información de tono relacionada con el canal secundario X (1605).
[0277] Cuando el módulo de decisión 1654 detecta que el presupuesto de bits disponible es bajo con el propósito de codificar la información de tono del canal secundario X o las señales de sonido para ambos canales primario Y y secundario X tienen una característica de voz, el módulo de decisión compara la coherencia de tono estéreoSpcal umbral Δ. Cuando el presupuesto de bits es bajo, el umbral Δ se establece en un valor mayor en comparación con el caso donde el presupuesto de bits es más importante (suficiente para codificar la información de tono del canal secundario X). Cuando el valor absoluto de la coherencia de tono estéreoSpces menor o igual al umbral Δ, el módulo 1654 decide reutilizar la información de tono del canal primario Y para codificar el canal secundario X (1607). Cuando el valor de la coherencia de tono estéreoSpces mayor que el umbral Δ, el módulo 1654 decide codificar la información de tono del canal secundario X (1605).
[0279] Asegurar que los canales tengan características sonoras aumenta la probabilidad de una evolución de tono suave, por lo tanto, reduce el riesgo de añadir artefactos al reutilizar el tono del canal primario. Como ejemplo no limitativo, cuando el presupuesto de bits estéreo es inferior a 14 kb/s y la coherencia de tono estéreoSpces inferior o igual a 6 (Δ = 6), la información de tono primaria puede reutilizarse en la codificación del canal secundario X. De acuerdo con otro ejemplo no limitativo, si el presupuesto de bits estéreo está por encima de 14 kb/s y por debajo de 26 kb/s, entonces tanto el canal Y primario como el X secundario se consideran como canales sonoros y la coherencia de tono estéreoSpcse compara con un umbral inferior Δ = 3, lo que conduce a una velocidad de reutilización más pequeña de la información de tono del canal primario Y a una tasa de bits de 22 kb/s.
[0281] Con referencia de nuevo a la Figura 15, el estimador de asignación de bits 1553 se suministra con el factorβdel mezclador de canales 251/351, con la decisión de reutilizar los coeficientes del filtro LP del canal primario o usar y codificar los coeficientes del filtro LP del canal secundario del analizador de coherencia del filtro LP 856, y con la información de tono determinada por el analizador de coherencia de tono 1552. En dependencia de los requisitos de codificación del canal primario y secundario, el estimador de asignación de bits 1553 proporciona un presupuesto de bits para codificar el canal primario Y al codificador del canal primario 252/352 y un presupuesto de bits para codificar el canal secundario X al módulo de decisión 1556. En una posible implementación, para todo el contenido que no está INACTIVO, una fracción de la tasa de bits total se asigna al canal secundario. Después, la tasa de bits del canal secundario se aumentará en una cantidad que está relacionada con un factor de normalización de energía (reescala) ε descrito anteriormente como:
[0284]
[0287] dondeBxrepresenta la tasa de bits asignada al canal secundario X,Btrepresenta la tasa de bits estéreo total disponible,BMrepresenta la tasa de bits mínima asignada al canal secundario y generalmente es de alrededor del 20 % de la tasa de bits estéreo total. Finalmente, ε representa el factor de normalización de energía descrito anteriormente. Por lo tanto, la tasa de bits asignada al canal primario corresponde a la diferencia entre la tasa de bits estéreo total y la tasa de bits estéreo del canal secundario. En una implementación alternativa, la asignación de tasa de bits del canal secundario puede describirse como:
[0290]
[0292] donde nuevamenteBxrepresenta la tasa de bits asignada al canal secundario X,Btrepresenta la tasa de bits estéreo total disponible yBMrepresenta la tasa de bits mínima asignada al canal secundario. Finalmente,εidxrepresenta un índice transmitido del factor de normalización de energía. Por lo tanto, la tasa de bits asignada al canal primario corresponde a la diferencia entre la tasa de bits estéreo total y la tasa de bits del canal secundario. En todos los casos, para el contenido INACTIVO, la tasa de bits del canal secundario se establece en la tasa de bits mínima necesaria para codificar la forma espectral del canal secundario, lo que da una tasa de bits generalmente cercana a 2 kb/s.
[0294] Mientras tanto, el clasificador de señales 852 proporciona una clasificación de señales del canal secundario X al módulo de decisión 1554. Si el módulo de decisión 1554 determina que la señal de sonido es inactiva o sorda, el módulo de codificación sorda/inactiva 1555 proporciona la forma espectral del canal secundario X al multiplexor 254/354. Alternativamente, el módulo de decisión 1554 informa al módulo de decisión 1556 cuando la señal de sonido no está inactiva ni sorda. Para tales señales de sonido, mediante el uso del presupuesto de bits para la codificación del canal secundario X, el módulo de decisión 1556 determina si hay un número suficiente de bits disponibles para la codificación del canal secundario X mediante el uso del módulo de codificación solo genérica de modelo de cuatro (4) subtramas 854; de cualquier otra manera, el módulo de decisión 1556 selecciona codificar el canal secundario X mediante el uso del módulo de codificación de modelo de dos (2) subtramas 855. Para elegir el módulo de codificación genérica de cuatro subtramas, el presupuesto de bits disponible para el canal secundario debe ser lo suficientemente alto como para asignar al menos 40 bits a los libros de códigos algebraicos, una vez que todo lo demás se cuantifica o reutiliza, que incluye el coeficiente LP y la información y ganancias de tono.
[0296] Como se entenderá a partir de la descripción anterior, en la operación de codificación solo genérica de modelo de cuatro (4) subtramas 804 y el módulo de codificación solo genérica de modelo de cuatro (4) subtramas 854 correspondiente, para mantener la tasa de bits lo más baja posible, se usa una búsqueda ACELP como se describió en la cláusula 5.2.3.1 de la referencia [1]. En la codificación solo genérica de modelo de cuatro (4) subtramas, la información de tono puede reutilizarse del canal primario o no. Los parámetros de codificación encontrados durante la búsqueda ACELP en el módulo de codificación solo genérica de modelo de cuatro (4) subtramas 854 se usan entonces para construir el flujo de bits del canal secundario 206/306 y se envían al multiplexor 254/354 para su inclusión en el flujo de bits multiplexado 207/307.
[0297] En la operación de codificación de modelo de dos (2) subtramas alternativa 805 y el módulo de codificación de modelo de dos (2) subtramas alternativa correspondiente 855, el modelo de codificación genérica se construye de manera similar a ACELP como se describió en la cláusula 5.2.3.1 de la referencia [1], pero se usa con solo dos (2) subtramas por trama. Por lo tanto, para hacerlo, la longitud de las subtramas se aumenta de 64 muestras a 128 muestras, manteniendo aún la velocidad de muestreo interna en 12,8 kHz. Si el analizador de coherencia de tono 1552 ha determinado reutilizar la información de tono del canal primario Y para codificar el canal secundario X, entonces se calcula el promedio de los tonos de las dos primeras subtramas del canal primario Y y se usa como la estimación de tono para la primera media trama del canal secundario X. De manera similar, se calcula el promedio de los tonos de las dos últimas subtramas del canal primario Y y se usa para la segunda media trama del canal secundario X. Cuando se reutilizan del canal primario Y, los coeficientes del filtro LP se interpolan y la interpolación de los coeficientes del filtro LP como se describió en la cláusula 5.2.2.1 de la referencia [1] se modifica para adaptarse a un esquema de dos (2) subtramas al reemplazar los factores de interpolación primero y tercero con los factores de interpolación segundo y cuarto.
[0298] En la modalidad de la Figura 15, el proceso para decidir entre las cuatro (4) subtramas y el esquema de codificación de las dos (2) subtramas es impulsado por el presupuesto de bits disponible para codificar el canal secundario X. Como se mencionó anteriormente, el presupuesto de bits del canal secundario X se deriva de diferentes elementos tales como el presupuesto de bits total disponible, el factor β o el factor de normalización de energía ε, la presencia o no de un módulo de corrección de retardo temporal (TDC), la posibilidad o no de reutilizar los coeficientes del filtro LP y/o la información de tono del canal primario Y.
[0299] La tasa de bits mínima absoluta usada por el modelo de codificación de dos (2) subtramas del canal secundario X cuando tanto los coeficientes del filtro LP como la información de tono se reutilizarán del canal primario Y es de alrededor de 2 kb/s para una señal genérica, mientras que es de alrededor de 3,6 kb/s para el esquema de codificación de cuatro (4) subtramas. Para un codificador similar a ACELP, mediante el uso de un modelo de codificación de dos (2) o cuatro (4) subtramas, una gran parte de la calidad proviene del número de bits que pueden asignarse a la búsqueda del libro de códigos algebraico (ACB) como se define en la cláusula 5.2.3.1.5 de la referencia [1].
[0300] Después, para maximizar la calidad, la idea es comparar el presupuesto de bits disponible para la búsqueda del libro de códigos algebraico (ACB) de las cuatro (4) subtramas y la búsqueda del libro de códigos algebraico (ACB) de las dos (2) subtramas después de que se tenga en cuenta todo lo que se codificará. Por ejemplo, si, para una trama específica, hay 4 kb/s (80 bits por trama de 20 ms) disponibles para codificar el canal secundario X y el coeficiente del filtro LP puede reutilizarse mientras se necesita transmitir la información de tono. Después se eliminan de los 80 bits, la cantidad mínima de bits para codificar la señalización del canal secundario, la información de tono del canal secundario, las ganancias y el libro de códigos algebraico para las dos (2) subtramas y las cuatro (4) subtramas, para obtener el presupuesto de bits disponible para codificar el libro de códigos algebraico. Por ejemplo, el modelo de codificación de cuatro (4) subtramas se elige si al menos 40 bits están disponibles para codificar el libro de códigos algebraico de las cuatro (4) subtramas, de cualquier otra manera, se usa el esquema de dos (2) subtramas.
[0301] 3) Aproximación de la señal mono de un flujo de bits parcial
[0302] Como se describió en la descripción anterior, la mezcla descendente en el dominio del tiempo es mono amigable, lo que significa que en caso de una estructura integrada, donde el canal primario Y se codifica con un códec heredado (debe tenerse en cuenta que, como se mencionó en la descripción anterior, cualquier tipo adecuado de codificador puede usarse como el codificador del canal primario 252/352) y los bits estéreo se añaden al flujo de bits del canal primario, los bits estéreo podrían separarse y un decodificador heredado podría crear una síntesis que es subjetivamente cercana a una síntesis mono hipotética. Para hacerlo, se necesita una normalización de energía simple en el lateral del codificador, antes de codificar el canal primario Y. Al reescalar la energía del canal primario Y a un valor suficientemente cercano a una energía de una versión de sonido de señal monofónica, la decodificación del canal primario Y con un decodificador heredado puede ser similar a la decodificación por el decodificador heredado de la versión de sonido de señal monofónica. La función de la normalización de la energía está directamente relacionada con la diferencia de correlación a largo plazo linealizada calculado mediante el uso de la relación (7) y se calcula mediante el uso de la relación (22):
[0304]
[0306] El nivel de normalización se muestra en la Figura 5. En la práctica, en lugar de usar la relación (22), se usa una tabla de consulta que relaciona los valores de normalizaciónεa cada valor posible del factorβ(31 valores en esta modalidad ilustrativa). Incluso si esta etapa adicional no es necesaria al codificar una señal de sonido estéreo, por ejemplo, voz y/o audio, con el modelo integrado, esto puede ser útil al decodificar solo la señal mono sin decodificar los bits estéreo.
[0307] 4) Decodificación estéreo y mezcla ascendente
[0308] La Figura 10 es un diagrama de bloques que ilustra simultáneamente un método de decodificación de sonido estéreo y un sistema de decodificación de sonido estéreo. La Figura 11 es un diagrama de bloques que ilustra características adicionales del método de decodificación de sonido estéreo y el sistema de decodificación de sonido estéreo de la Figura 10.
[0309] El método de decodificación de sonido estéreo de las Figuras 10 y 11 comprende una operación de demultiplexión 1007 implementada por un demultiplexor 1057, una operación de decodificación del canal primario 1004 implementada por un decodificador del canal primario 1054, una operación de decodificación del canal secundario 1005 implementada por un decodificador del canal secundario 1055 y una operación de mezcla ascendente en el dominio del tiempo 1006 implementada por un mezclador ascendente de canal en el dominio del tiempo 1056. La operación de decodificación del canal secundario 1005 comprende, como se muestra en la Figura 11, una operación de decisión 1101 implementada por un módulo de decisión 1151, una operación de decodificación genérica de cuatro (4) subtramas 1102 implementada por un decodificador genérico de cuatro (4) subtramas 1152, y una operación de decodificación genérica/sorda/inactiva de dos (2) subtramas 1103 implementada por un decodificador genérico/sordo/inactivo de dos (2) subtramas 1153. En el sistema de decodificación de sonido estéreo, se recibe un flujo de bits 1001 de un codificador. El demultiplexor 1057 recibe el flujo de bits 1001 y extrae de este los parámetros de codificación del canal primario Y (flujo de bits 1002), los parámetros de codificación del canal secundario X (flujo de bits 1003) y el factorβsuministrado al decodificador del canal primario 1054, al decodificador del canal secundario 1055 y al mezclador ascendente de canal 1056. Como se mencionó anteriormente, el factor β se usa como indicador tanto para el codificador del canal primario 252/352 como para el codificador del canal secundario 253/353 para determinar la asignación de tasa de bits, por lo tanto, tanto el decodificador del canal primario 1054 como el decodificador del canal secundario 1055 están reutilizando el factor β para decodificar el flujo de bits adecuadamente.
[0310] Los parámetros de codificación del canal primario corresponden al modelo de codificación ACELP a la tasa de bits recibida y podrían relacionarse con un codificador EVS heredado o modificado (debe tenerse en cuenta aquí que, como se mencionó en la descripción anterior, puede usarse cualquier tipo adecuado de codificador como el codificador del canal primario 252). El decodificador del canal primario 1054 se suministra con el flujo de bits 1002 para decodificar los parámetros de codificación del canal primario (modo de códec<1>, β, LPC<1>, Tono<1>, índices del libro de códigos fijo<1>y ganancias<1>como se muestra en la Figura 11) mediante el uso de un método similar a la Referencia [1] para producir un canal primario Y' decodificado.
[0311] Los parámetros de codificación del canal secundario usados por el decodificador del canal secundario 1055 corresponden al modelo usado para codificar el segundo canal X y pueden comprender:
[0312] (a) El modelo de codificación genérica con reutilización de los coeficientes del filtro LP (LPC<1>) y/u otros parámetros de codificación (tales como, por ejemplo, el retardo de tono Pitch<1>) del canal primario Y. El decodificador genérico de cuatro (4) subtramas 1152 (Figura 11) del decodificador del canal secundario 1055 se suministra con los coeficientes del filtro LP (LPC<1>) y/u otros parámetros de codificación (tales como, por ejemplo, el retardo de tono Pitch<1>) del canal primario Y del decodificador 1054 y/o con el flujo de bits 1003 (β, LPC<2>, Tono<2>, índices del libro de códigos fijo<2>y ganancias<2>como se muestra en la Figura 11) y usa un método inverso al del módulo de codificación 854 (Figura 8) para producir el canal secundario decodificado X'.
[0313] (b) Otros modelos de codificación pueden o no volver a usar los coeficientes del filtro LP (LPC<1>) y/u otros parámetros de codificación (tales como, por ejemplo, el retardo de tono Pitch<1>) del canal primario Y, que incluye el modelo de codificación genérica de banda media, el modelo de codificación sorda de baja velocidad y el modelo de codificación inactiva de baja velocidad. Como ejemplo, el modelo de codificación inactiva puede reutilizar los coeficientes del filtro LP del canal primario LPC<1>. El decodificador genérico/sordo/inactivo de dos (2) subtramas 1153 (Figura 11) del decodificador del canal secundario 1055 se suministra con los coeficientes del filtro LP (LPC<1>) y/u otros parámetros de codificación (tales como, por ejemplo, el retardo de tono Pitch<1>) del canal primario Y y/o con los parámetros de codificación del canal secundario del flujo de bits 1003 (modo de códec<2>, β, LPC<2>, Tono<2>, índices del libro de códigos fijo<2>y ganancias<2>como se muestra en la Figura 11) y usa métodos inversos a los del módulo de codificación 855 (Figura 8) para producir el canal secundario decodificado X'.
[0314] Los parámetros de codificación recibidos correspondientes al canal secundario X (flujo de bits 1003) contienen información (modo de códec<2>) relacionado con el modelo de codificación que se usa. El módulo de decisión 1151 usa esta información (códec mode<2>) para determinar e indicar al decodificador genérico de cuatro (4) subtramas 1152 y al decodificador genérico/sordo/inactivo de dos (2) subtramas 1153 qué modelo de codificación se usará.
[0315] En caso de una estructura integrada, el factorβse usa para recuperar el índice de escala de energía que se almacena en una tabla de consulta (no mostrada) en el lateral del decodificador y se usa para volver a escalar el canal primario Y' antes de realizar la operación de mezcla ascendente en el dominio del tiempo 1006. Finalmente, el factorβse suministra al mezclador ascendente de canal 1056 y se usa para mezclar de manera ascendente los canales Y' primario decodificado y X' secundario. La operación de mezcla ascendente en el dominio del tiempo 1006 se realiza como el inverso de las relaciones de mezcla descendente (9) y (10) para obtener los canales R' derecho y L' izquierdo decodificados, mediante el uso de las relaciones (23) y (24):
[0318]
[0320] donden=0,...,N-1es el índice de la muestra en la trama y t es el índice de trama.
[0321] 5) Integración de codificación de dominio del tiempo y dominio de la frecuencia
[0322] Para aplicaciones de la presente técnica donde se usa un modo de codificación de dominio de la frecuencia, también se contempla realizar la mezcla descendente en el dominio de la frecuencia para ahorrar algo de complejidad o simplificar el flujo de datos. En tales casos, el mismo factor de mezcla se aplica a todos los coeficientes espectrales para mantener las ventajas de la mezcla descendente en el dominio del tiempo. Puede observarse que esta es una desviación de la aplicación de coeficientes espectrales por banda de frecuencia, como en el caso de la mayoría de las aplicaciones de mezcla descendente en el dominio de la frecuencia. El mezclador descendente 456 puede adaptarse para calcular las relaciones (25.1) y (25.2):
[0325]
[0327] dondeFR(k) representa un coeficiente de frecuenciakdel canal derecho R y, de manera similar,FL(k) representa un coeficiente de frecuencia k del canal izquierdo L. Los canales Y primario y X secundario se calculan después aplicando una transformada de frecuencia inversa para obtener la representación en el tiempo de las señales mixtas hacia abajo.
[0328] Las Figuras 17 y 18 muestran posibles implementaciones del método y sistema de codificación estéreo en el dominio del tiempo mediante el uso de la mezcla descendente en el dominio de la frecuencia capaz de conmutar entre la codificación en el dominio del tiempo y en el dominio de la frecuencia de los canales Y primario y X secundario.
[0329] Una primera variante de tal método y sistema se muestra en la Figura 17, que es un diagrama de bloques que ilustra simultáneamente el método y sistema de codificación estéreo mediante el uso de la conmutación descendente en el dominio del tiempo con una capacidad de operar en el dominio del tiempo y en el dominio de la frecuencia.
[0330] En la Figura 17, el método y sistema de codificación estéreo incluyen muchas operaciones y módulos descritos anteriormente con referencia a figuras anteriores e identificados por los mismos números de referencia. Un módulo de decisión 1751 (operación de decisión 1701) determina si los canales izquierdo L' y derecho R' del corrector de retardo temporal 1750 deben codificarse en el dominio del tiempo o en el dominio de la frecuencia. Si se selecciona la codificación en el dominio del tiempo, el método y sistema de codificación estéreo de la Figura 17 operan sustancialmente de la misma manera que el método y sistema de codificación estéreo de las figuras anteriores, por ejemplo y sin limitación como en la modalidad de la Figura 15.
[0331] Si el módulo de decisión 1751 selecciona la codificación de frecuencia, un convertidor de tiempo a frecuencia 1752 (operación de conversión de tiempo a frecuencia 1702) convierte los canales izquierdo L' y derecho R' al dominio de la frecuencia. Un mezclador descendente de dominio de la frecuencia 1753 (operación de mezcla descendente de dominio de la frecuencia 1703) emite canales de dominio de la frecuencia Y primario y X secundario. El canal primario de dominio de la frecuencia se convierte de nuevo al dominio del tiempo mediante un convertidor de frecuencia a tiempo 1754 (operación de conversión de frecuencia a tiempo 1704) y el canal primario de dominio del tiempo Y resultante se aplica al codificador del canal primario 252/352. El canal secundario de dominio de la frecuencia X del mezclador descendente de dominio de la frecuencia 1753 se procesa a través de un codificador paramétrico y/o residual convencional 1755 (operación de codificación paramétrica y/o residual 1705).
[0332] La Figura 18 es un diagrama de bloques que ilustra simultáneamente otro método y sistema de codificación estéreo mediante el uso de la mezcla descendente en el dominio de la frecuencia con una capacidad de operar en el dominio del tiempo y en el dominio de la frecuencia. En la Figura 18, el método y sistema de codificación estéreo son similares al método y sistema de codificación estéreo de la Figura 17 y solo se describirán las nuevas operaciones y módulos.
[0333] Un analizador de dominio del tiempo 1851 (operación de análisis de dominio del tiempo 1801) reemplaza al mezclador de canal de dominio del tiempo 251/351 descrito anteriormente (operación de mezcla descendente en el dominio del tiempo 201/301). El analizador de dominio del tiempo 1851 incluye la mayoría de los módulos de la Figura 4, pero sin el mezclador descendente en el dominio del tiempo 456. Por lo tanto, su función es en gran parte proporcionar un cálculo del factor β. Este factorβse suministra al preprocesador 851 y a los convertidores de dominio de la frecuencia a tiempo 1852 y 1853 (operaciones de conversión de dominio de la frecuencia a tiempo 1802 y 1803) que convierten respectivamente al dominio del tiempo los canales secundarios X de dominio de la frecuencia y Y primario recibidos del mezclador descendente de dominio de la frecuencia 1753 para la codificación de dominio del tiempo. Por lo tanto, la salida del convertidor 1852 es un canal secundario X en el dominio del tiempo que se proporciona al preprocesador 851 mientras que la salida del convertidor 1852 es un canal primario Y en el dominio del tiempo que se proporciona tanto al preprocesador 1551 como al codificador 252/352.
[0334] 6) Ejemplo de configuración de hardware
[0335] La Figura 12 es un diagrama de bloques simplificado de una configuración de ejemplo de componentes de hardware que forman cada uno del sistema de codificación de sonido estéreo y el sistema de decodificación de sonido estéreo descritos anteriormente.
[0336] Cada uno del sistema de codificación de sonido estéreo y el sistema de decodificación de sonido estéreo puede implementarse como parte de un terminal móvil, como parte de un reproductor de medios portátil, o en cualquier dispositivo similar. Cada uno del sistema de codificación de sonido estéreo y el sistema de decodificación de sonido estéreo (identificado como 1200 en la Figura 12) comprende una entrada 1202, una salida 1204, un procesador 1206 y una memoria 1208.
[0337] La entrada 1202 se configura para recibir los canales izquierdo L y derecho R de la señal de sonido estéreo de entrada en forma digital o analógica en el caso del sistema de codificación de sonido estéreo, o el flujo de bits 1001 en el caso del sistema de decodificación de sonido estéreo. La salida 1204 se configura para suministrar el flujo de bits multiplexado 207/307 en el caso del sistema de codificación de sonido estéreo o el canal izquierdo L' y el canal derecho R' decodificados en el caso del sistema de decodificación de sonido estéreo. La entrada 1202 y la salida 1204 pueden implementarse en un módulo común, por ejemplo, un dispositivo de entrada/salida serie.
[0338] El procesador 1206 se conecta operativamente a la entrada 1202, a la salida 1204 y a la memoria 1208. El procesador 1206 se realiza como uno o más procesadores para ejecutar instrucciones de código en apoyo de las funciones de los diversos módulos de cada uno del sistema de codificación de sonido estéreo como se muestra en las Figuras 2, 3, 4, 8, 9, 13, 14, 15, 16, 17 y 18 y el sistema de decodificación de sonido estéreo como se muestra en las Figuras 10 y 11.
[0339] La memoria 1208 puede comprender una memoria no transitoria para almacenar instrucciones de código ejecutables por el procesador 1206, específicamente, una memoria legible por procesador que comprende instrucciones no transitorias que, cuando se ejecutan, hacen que un procesador implemente las operaciones y módulos del método y sistema de codificación de sonido estéreo y el método y sistema de decodificación de sonido estéreo como se describió en la presente descripción. La memoria 1208 también puede comprender una memoria de acceso aleatorio o búfer(es) para almacenar datos de procesamiento intermedios de las diversas funciones realizadas por el procesador 1206.
[0340] Los expertos en la técnica se darán cuenta de que la descripción del método y sistema de codificación de sonido estéreo y el método y sistema de decodificación de sonido estéreo son solo ilustrativos y no pretenden ser de ninguna manera limitantes. Otras modalidades se les ocurrirán fácilmente a los expertos en la técnica que tengan el beneficio de la presente descripción. Además, el método y sistema de codificación de sonido estéreo descritos y el método y sistema de decodificación de sonido estéreo pueden personalizarse para ofrecer soluciones valiosas a las necesidades y problemas existentes de codificación y decodificación de sonido estéreo.
[0341] En interés de la claridad, no se muestran ni se describen todas las características de rutina de las implementaciones del método y sistema de codificación de sonido estéreo y el método y sistema de decodificación de sonido estéreo. Por supuesto, se apreciará que en el desarrollo de cualquiera de tales implementaciones reales del método y sistema de codificación de sonido estéreo y el método y sistema de decodificación de sonido estéreo, pueden ser necesarias numerosas decisiones específicas de implementación para lograr los objetivos específicos del desarrollador, tales como el cumplimiento de las restricciones relacionadas con la aplicación, el sistema, la red y el negocio, y que estos objetivos específicos variarán de una implementación a otra y de un desarrollador a otro. Además, se apreciará que un esfuerzo de desarrollo podría ser complejo y llevar mucho tiempo, pero, sin embargo, sería una tarea de ingeniería de rutina para los expertos en la técnica del procesamiento de sonido que tienen el beneficio de la presente descripción.
[0342] De acuerdo con la presente descripción, los módulos, operaciones de procesamiento y/o estructuras de datos descritos en la presente descripción pueden implementarse mediante el uso de varios tipos de sistemas operativos, plataformas informáticas, dispositivos de red, programas informáticos y/o máquinas de propósito general. Además, los expertos en la técnica reconocerán que también pueden usarse dispositivos de una naturaleza de propósito menos general, tales como dispositivos cableados, matrices de puertas programables en campo (FPGA), circuitos integrados de aplicación específica (ASIC), o similares. Cuando un método que comprende una serie de operaciones y suboperaciones es implementado por un procesador, ordenador o máquina y esas operaciones y suboperaciones pueden almacenarse como una serie de instrucciones de código no transitorio legibles por el procesador, ordenador o máquina, pueden almacenarse en un medio tangible y/o no transitorio.
[0343] Los módulos del método y sistema de codificación de sonido estéreo y el método de decodificación de sonido estéreo y decodificador como se describieron en la presente descripción pueden comprender software, microprograma, hardware o cualquier combinación de software, microprograma o hardware adecuados para los propósitos descritos en la presente descripción.
[0344] En el método de codificación de sonido estéreo y el método de decodificación de sonido estéreo como se describió en la presente descripción, las diversas operaciones y suboperaciones pueden realizarse en varios órdenes y algunas de las operaciones y suboperaciones pueden ser opcionales.
[0345] Aunque la presente descripción se ha descrito anteriormente por medio de modalidades ilustrativas no restrictivas de las mismas, estas modalidades pueden modificarse a voluntad dentro del alcance de las reivindicaciones anexas.
[0346] Referencias
[0347] Las siguientes referencias se mencionan en la presente descripción.
[0348] [1] 3GPP TS 26.445, v.12.0.0, "Codec for Enhanced Voice Services (EVS); Detailed Algorithmic Description", septiembre de 2014.
[0349] [2] M. Neuendorf, M. Multrus, N. Rettelbach, G. Fuchs, J. Robillard, J. Lecompte, S. Wilde, S. Bayer, S. Disch, C. Helmrich, R. Lefevbre, P. Gournay, y otros, "The ISO/MPEG Unified Speech and Audio Coding Standard - Consistent High Quality for All Content Types and at All Bit Rates", J. Audio Eng. Soc., vol.61, núm.12, pp.956-977, diciembre de 2013.
[0350] [3] B. Bessette, R. Salami, R. Lefebvre, M. Jelinek, J. Rotola-Pukkila, J. Vainio, H. Mikkola, y K. Järvinen, "The Adaptive Multi-Rate Wideband Speech Codec (AMR-WB)," Special Issue of IEEE Trans. Speech and Audio Proc., Vol.10, pp.620-636, noviembre de 2002.
[0351] [4] R.G. van der Waal & R.N.J. Veldhuis, "Subband coding of stereophonic digital audio signals", Proc. IEEE ICASSP, Vol.5, pp.3601-3604, abril de 1991
[0352] [5] Dai Yang, Hongmei Ai, Chris Kyriakakis y C.-C. Jay Kuo, "High-Fidelity Multichannel Audio Coding With Karhunen-Loève Transform", IEEE Trans. Speech and Audio Proc., Vol. 11, núm. 4, pp. 365-379, julio de 2003.
[0353] [6] J. Breebaart, S. van de Par, A. Kohlrausch y E. Schuijers, "Parametric Coding of Stereo Audio", EURASIP Journal on Applied Signal Processing, Volumen 9, páginas 1305-1322, 2005
[0354] [7] 3GPP TS 26.290 V9.0.0, "Extended Adaptive Multi-Rate - Wideband (AMR-WB+) codec; Transcoding functions (Release 9)", septiembre de 2009.
[0355] [8] Jonathan A. Gibbs, "Apparatus and method for encoding a multi-channel audio signal", US 8577045 B2 [9] WO 02/23527 A1 (ERICSSON TELEFON AB L M [SE]; MINDE TOR BJOERN [SE] Y OTROS) 21 de marzo de 2002

Claims (7)

1. REIVINDICACIONES
1. Un método de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende:
recibir un flujo de bits de un codificador de sonido estéreo y extraer del flujo de bits parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde 0 ≤β≤ 1 y en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario;
decodificar el canal primario en respuesta a los parámetros de codificación del canal primario, mediante el uso del factorβcomo indicador de asignación de la tasa de bits al canal primario; decodificar el canal secundario mediante el uso de uno de una pluralidad de modelos de codificación y el factorβcomo indicador de asignación de la tasa de bits al canal secundario, en donde (a) al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario, y (b) al menos uno de los modelos de codificación usa parámetros de codificación del canal primario distintos de los coeficientes del filtro LP para decodificar el canal secundario; y
producir los canales izquierdo y derecho decodificados que comprenden:
(a) siβes diferente de 0 y 1, mezclar de manera ascendente en el dominio del tiempo los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario decodificados tras la producción de los canales izquierdo y derecho;
(b) siβ= 1, mapear el canal primario al canal izquierdo y el canal secundario al canal derecho; o (c) siβ= 0, mapear el canal primario al canal derecho y el canal secundario al canal izquierdo.
2. Un método de decodificación de sonido estéreo como se define en la reivindicación 1, en donde los modelos de codificación comprenden un modelo de codificación genérica, un modelo de codificación sorda y un modelo de codificación inactiva.
3. Un método de decodificación de sonido estéreo como se define en la reivindicación 1, en donde los parámetros de codificación del canal secundario comprenden información que identifica uno de los modelos de codificación que se usará al decodificar el canal secundario.
4. Un sistema de decodificación de sonido estéreo para decodificar los canales izquierdo y derecho de una señal de sonido estéreo, que comprende:
medios para recibir un flujo de bits de un codificador de sonido estéreo y para extraer del flujo de bits parámetros de codificación de un canal primario, parámetros de codificación de un canal secundario y un factorβ, en donde 0 ≤β≤ 1 y en donde los parámetros de codificación del canal primario comprenden coeficientes del filtro LP del canal primario;
un decodificador del canal primario en respuesta a los parámetros de codificación del canal primario, mediante el uso del factorβcomo indicador de asignación de la tasa de bits al canal primario; un decodificador del canal secundario mediante el uso de uno de una pluralidad de modelos de codificación y el factorβcomo indicador de asignación de la tasa de bits al canal secundario, en donde (a) al menos uno de los modelos de codificación usa los coeficientes del filtro LP del canal primario para decodificar el canal secundario, y (b) al menos uno de los modelos de codificación usa parámetros de codificación del canal primario distintos de los coeficientes del filtro LP para decodificar el canal secundario; y
medios para producir los canales izquierdo y derecho decodificados, configurados para:
(a) siβes diferente de 0 y 1, mezclar de manera ascendente en el dominio del tiempo los canales primario y secundario decodificados mediante el uso del factorβpara producir los canales izquierdo y derecho decodificados de la señal de sonido estéreo, en donde el factorβdetermina las contribuciones respectivas de los canales primario y secundario decodificados tras la producción de los canales izquierdo y derecho;
(b) siβ= 1, mapear el canal primario al canal izquierdo y el canal secundario al canal derecho; o (c) siβ= 0, mapear el canal primario al canal derecho y el canal secundario al canal izquierdo.
5. Un sistema de decodificación de sonido estéreo como se define en la reivindicación 4, en donde el decodificador del canal secundario comprende un primer decodificador que usa un modelo de codificación genérica, y un segundo decodificador que usa uno del modelo de codificación genérica, un modelo de codificación sorda y un modelo de codificación inactiva.
6. Un sistema de decodificación de sonido estéreo como se define en la reivindicación 5, en donde los parámetros de codificación del canal secundario comprenden información que identifica uno de los modelos de codificación que se usará al decodificar el canal secundario, y en donde el sistema de decodificación de sonido estéreo comprende un módulo de decisión para indicar al primer y segundo decodificadores el modelo de codificación que se usará al decodificar el canal secundario.
7. Un sistema de decodificación de sonido estéreo como se define en la reivindicación 4, en donde los medios de recepción y extracción comprenden un multiplexor para recibir el flujo de bits y para extraer del flujo de bits los parámetros de codificación del canal primario, los parámetros de codificación del canal secundario y el factorβ.
ES21201478T 2015-09-25 2016-09-22 Method and system for decoding left and right channels of a stereo sound signal Active ES3058666T3 (en)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US201562232589P 2015-09-25 2015-09-25
US201662362360P 2016-07-14 2016-07-14

Publications (1)

Publication Number Publication Date
ES3058666T3 true ES3058666T3 (en) 2026-03-12

Family

ID=58385516

Family Applications (6)

Application Number Title Priority Date Filing Date
ES16847686T Active ES2904275T3 (es) 2015-09-25 2016-09-22 Método y sistema de decodificación de los canales izquierdo y derecho de una señal sonora estéreo
ES16847684T Active ES2955962T3 (es) 2015-09-25 2016-09-22 Método y sistema que utiliza una diferencia de correlación a largo plazo entre los canales izquierdo y derecho para mezcla descendente en el dominio del tiempo de una señal de sonido estéreo en canales primarios y secundarios
ES21201478T Active ES3058666T3 (en) 2015-09-25 2016-09-22 Method and system for decoding left and right channels of a stereo sound signal
ES16847683T Active ES2949991T3 (es) 2015-09-25 2016-09-22 Método y sistema para la mezcla en el dominio del tiempo de una señal de sonido estéreo en canales primario y secundario mediante el uso de la detección de un estado de desfase de los canales izquierdo y derecho
ES16847685T Active ES2809677T3 (es) 2015-09-25 2016-09-22 Método y sistema para codificar una señal de sonido estéreo utilizando parámetros de codificación de un canal primario para codificar un canal secundario
ES20170546T Active ES3058595T3 (en) 2015-09-25 2016-09-22 Method and system for encoding a stereo sound signal using coding parameters of a primary channel to encode a secondary channel

Family Applications Before (2)

Application Number Title Priority Date Filing Date
ES16847686T Active ES2904275T3 (es) 2015-09-25 2016-09-22 Método y sistema de decodificación de los canales izquierdo y derecho de una señal sonora estéreo
ES16847684T Active ES2955962T3 (es) 2015-09-25 2016-09-22 Método y sistema que utiliza una diferencia de correlación a largo plazo entre los canales izquierdo y derecho para mezcla descendente en el dominio del tiempo de una señal de sonido estéreo en canales primarios y secundarios

Family Applications After (3)

Application Number Title Priority Date Filing Date
ES16847683T Active ES2949991T3 (es) 2015-09-25 2016-09-22 Método y sistema para la mezcla en el dominio del tiempo de una señal de sonido estéreo en canales primario y secundario mediante el uso de la detección de un estado de desfase de los canales izquierdo y derecho
ES16847685T Active ES2809677T3 (es) 2015-09-25 2016-09-22 Método y sistema para codificar una señal de sonido estéreo utilizando parámetros de codificación de un canal primario para codificar un canal secundario
ES20170546T Active ES3058595T3 (en) 2015-09-25 2016-09-22 Method and system for encoding a stereo sound signal using coding parameters of a primary channel to encode a secondary channel

Country Status (16)

Country Link
US (8) US10319385B2 (es)
EP (8) EP3353784B1 (es)
JP (6) JP6976934B2 (es)
KR (3) KR102636424B1 (es)
CN (4) CN108352164B (es)
AU (1) AU2016325879B2 (es)
CA (4) CA2997331C (es)
DK (1) DK3353779T3 (es)
ES (6) ES2904275T3 (es)
MX (4) MX2021006677A (es)
MY (2) MY188370A (es)
PL (1) PL3353779T3 (es)
PT (1) PT3353779T (es)
RU (6) RU2763374C2 (es)
WO (5) WO2017049399A1 (es)
ZA (2) ZA201801675B (es)

Families Citing this family (51)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US12125492B2 (en) 2015-09-25 2024-10-22 Voiceage Coproration Method and system for decoding left and right channels of a stereo sound signal
EP3353784B1 (en) 2015-09-25 2025-03-05 VoiceAge Corporation Method and system for encoding left and right channels of a stereo sound signal selecting between two and four sub-frames models depending on the bit budget
CN107742521B (zh) * 2016-08-10 2021-08-13 华为技术有限公司 多声道信号的编码方法和编码器
WO2018058379A1 (zh) * 2016-09-28 2018-04-05 华为技术有限公司 一种处理多声道音频信号的方法、装置和系统
AU2017357452B2 (en) 2016-11-08 2020-12-24 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Downmixer and method for downmixing at least two channels and multichannel encoder and multichannel decoder
CN108269577B (zh) 2016-12-30 2019-10-22 华为技术有限公司 立体声编码方法及立体声编码器
CN110709925B (zh) * 2017-04-10 2023-09-29 诺基亚技术有限公司 用于音频编码或解码的方法及装置
EP3396670B1 (en) * 2017-04-28 2020-11-25 Nxp B.V. Speech signal processing
US10224045B2 (en) 2017-05-11 2019-03-05 Qualcomm Incorporated Stereo parameters for stereo decoding
CN109300480B (zh) 2017-07-25 2020-10-16 华为技术有限公司 立体声信号的编解码方法和编解码装置
CN114005455A (zh) * 2017-08-10 2022-02-01 华为技术有限公司 时域立体声编解码方法和相关产品
CN117133297A (zh) * 2017-08-10 2023-11-28 华为技术有限公司 时域立体声参数的编码方法和相关产品
CN109389985B (zh) * 2017-08-10 2021-09-14 华为技术有限公司 时域立体声编解码方法和相关产品
CN114898761A (zh) 2017-08-10 2022-08-12 华为技术有限公司 立体声信号编解码方法及装置
CN109427338B (zh) 2017-08-23 2021-03-30 华为技术有限公司 立体声信号的编码方法和编码装置
CN109427337B (zh) 2017-08-23 2021-03-30 华为技术有限公司 立体声信号编码时重建信号的方法和装置
US10891960B2 (en) * 2017-09-11 2021-01-12 Qualcomm Incorproated Temporal offset estimation
MX2020002972A (es) 2017-09-20 2020-07-22 Voiceage Corp Metodo y dispositivo para asignar un presupuesto de bits entre subtramas en un codec celp.
CN109859766B (zh) * 2017-11-30 2021-08-20 华为技术有限公司 音频编解码方法和相关产品
CN110556119B (zh) * 2018-05-31 2022-02-18 华为技术有限公司 一种下混信号的计算方法及装置
CN110556118B (zh) 2018-05-31 2022-05-10 华为技术有限公司 立体声信号的编码方法和装置
CN110556117B (zh) 2018-05-31 2022-04-22 华为技术有限公司 立体声信号的编码方法和装置
CN110728986B (zh) * 2018-06-29 2022-10-18 华为技术有限公司 立体声信号的编码方法、解码方法、编码装置和解码装置
CN110660400B (zh) 2018-06-29 2022-07-12 华为技术有限公司 立体声信号的编码、解码方法、编码装置和解码装置
JP7354275B2 (ja) * 2019-03-14 2023-10-02 ブームクラウド 360 インコーポレイテッド 優先度を持つ空間認識マルチバンド圧縮システム
EP3719799A1 (en) * 2019-04-04 2020-10-07 FRAUNHOFER-GESELLSCHAFT zur Förderung der angewandten Forschung e.V. A multi-channel audio encoder, decoder, methods and computer program for switching between a parametric multi-channel operation and an individual channel operation
CN111988726A (zh) * 2019-05-06 2020-11-24 深圳市三诺数字科技有限公司 一种立体声合成单声道的方法和系统
BR112021020507A2 (pt) 2019-05-07 2021-12-07 Voiceage Corp Métodos e dispositivos para detectar um ataque em um sinal de som a ser codificado e para codificar o ataque detectado
CN112233682B (zh) * 2019-06-29 2024-07-16 华为技术有限公司 一种立体声编码方法、立体声解码方法和装置
CN112151045B (zh) * 2019-06-29 2024-06-04 华为技术有限公司 一种立体声编码方法、立体声解码方法和装置
EP4008000B1 (en) * 2019-08-01 2026-03-18 Dolby Laboratories Licensing Corporation Encoding and decoding ivas bitstreams
CN110534120B (zh) * 2019-08-31 2021-10-01 深圳市友恺通信技术有限公司 一种移动网络环境下的环绕声误码修复方法
CN110809225B (zh) * 2019-09-30 2021-11-23 歌尔股份有限公司 一种应用于立体声系统的自动校准喇叭的方法
US10856082B1 (en) * 2019-10-09 2020-12-01 Echowell Electronic Co., Ltd. Audio system with sound-field-type nature sound effect
ES3020557T3 (en) * 2020-02-03 2025-05-23 Voiceage Corp Switching between stereo coding modes in a multichannel sound codec
CN120526780A (zh) * 2020-03-09 2025-08-22 日本电信电话株式会社 声音信号缩混方法、编码方法、缩混装置及程序
WO2021181746A1 (ja) * 2020-03-09 2021-09-16 日本電信電話株式会社 音信号ダウンミックス方法、音信号符号化方法、音信号ダウンミックス装置、音信号符号化装置、プログラム及び記録媒体
US12374343B2 (en) * 2020-03-09 2025-07-29 Nippon Telegraph And Telephone Corporation Sound signal encoding method, sound signal decoding method, sound signal encoding apparatus, sound signal decoding apparatus, program, and recording medium
US12170091B2 (en) * 2020-03-09 2024-12-17 Nippon Telegraph And Telephone Corporation Sound signal encoding method, sound signal decoding method, sound signal encoding apparatus, sound signal decoding apparatus, program, and recording medium
JP7813238B2 (ja) 2020-04-16 2026-02-12 ヴォイスエイジ・コーポレーション サウンドコーデックにおける音声/音楽分類およびコアエンコーダ選択のための方法およびデバイス
CN113571073A (zh) * 2020-04-28 2021-10-29 华为技术有限公司 一种线性预测编码参数的编码方法和编码装置
CN111599381A (zh) * 2020-05-29 2020-08-28 广州繁星互娱信息科技有限公司 音频数据处理方法、装置、设备及计算机存储介质
CN111885414B (zh) * 2020-07-24 2023-03-21 腾讯科技(深圳)有限公司 一种数据处理方法、装置、设备及可读存储介质
EP4211683B1 (en) 2020-09-09 2026-04-01 VoiceAge Corporation Method and device for classification of uncorrelated stereo content, cross-talk detection, and stereo mode selection in a sound codec
EP4243015A4 (en) * 2021-01-27 2024-04-17 Samsung Electronics Co., Ltd. AUDIO PROCESSING APPARATUS AND METHOD
CN112767956B (zh) * 2021-04-09 2021-07-16 腾讯科技(深圳)有限公司 音频编码方法、装置、计算机设备及介质
CN114258568B (zh) * 2021-11-26 2024-12-03 北京小米移动软件有限公司 一种立体声音频信号处理方法、装置、编码设备、解码设备及存储介质
CN115641858B (zh) * 2022-10-27 2026-04-21 深圳市中科蓝讯科技股份有限公司 变声处理方法、存储介质、芯片及电子设备
WO2024142360A1 (ja) * 2022-12-28 2024-07-04 日本電信電話株式会社 音信号処理装置、音信号処理方法、プログラム
JPWO2024142358A1 (es) * 2022-12-28 2024-07-04
JPWO2024142357A1 (es) * 2022-12-28 2024-07-04

Family Cites Families (68)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH01231523A (ja) * 1988-03-11 1989-09-14 Fujitsu Ltd ステレオ信号符号化装置
JPH02124597A (ja) * 1988-11-02 1990-05-11 Yamaha Corp 複数チャンネルの信号圧縮方法
US6330533B2 (en) * 1998-08-24 2001-12-11 Conexant Systems, Inc. Speech encoder adaptively applying pitch preprocessing with warping of target signal
SE519552C2 (sv) * 1998-09-30 2003-03-11 Ericsson Telefon Ab L M Flerkanalig signalkodning och -avkodning
EP1054575A3 (en) * 1999-05-17 2002-09-18 Bose Corporation Directional decoding
US6397175B1 (en) * 1999-07-19 2002-05-28 Qualcomm Incorporated Method and apparatus for subsampling phase spectrum information
SE519981C2 (sv) 2000-09-15 2003-05-06 Ericsson Telefon Ab L M Kodning och avkodning av signaler från flera kanaler
SE519976C2 (sv) * 2000-09-15 2003-05-06 Ericsson Telefon Ab L M Kodning och avkodning av signaler från flera kanaler
KR101016251B1 (ko) * 2002-04-10 2011-02-25 코닌클리케 필립스 일렉트로닉스 엔.브이. 스테레오 신호의 코딩
JP2004325633A (ja) * 2003-04-23 2004-11-18 Matsushita Electric Ind Co Ltd 信号符号化方法、信号符号化プログラム及びその記録媒体
SE527670C2 (sv) * 2003-12-19 2006-05-09 Ericsson Telefon Ab L M Naturtrogenhetsoptimerad kodning med variabel ramlängd
JP2005202248A (ja) * 2004-01-16 2005-07-28 Fujitsu Ltd オーディオ符号化装置およびオーディオ符号化装置のフレーム領域割り当て回路
DE102004009954B4 (de) * 2004-03-01 2005-12-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Verarbeiten eines Multikanalsignals
US7668712B2 (en) * 2004-03-31 2010-02-23 Microsoft Corporation Audio encoding and decoding with intra frames and adaptive forward error correction
SE0400998D0 (sv) 2004-04-16 2004-04-16 Cooding Technologies Sweden Ab Method for representing multi-channel audio signals
US7283634B2 (en) 2004-08-31 2007-10-16 Dts, Inc. Method of mixing audio channels using correlated outputs
US7630902B2 (en) * 2004-09-17 2009-12-08 Digital Rise Technology Co., Ltd. Apparatus and methods for digital audio coding using codebook application ranges
WO2006035705A1 (ja) * 2004-09-28 2006-04-06 Matsushita Electric Industrial Co., Ltd. スケーラブル符号化装置およびスケーラブル符号化方法
JPWO2006059567A1 (ja) 2004-11-30 2008-06-05 松下電器産業株式会社 ステレオ符号化装置、ステレオ復号装置、およびこれらの方法
EP1691348A1 (en) * 2005-02-14 2006-08-16 Ecole Polytechnique Federale De Lausanne Parametric joint-coding of audio sources
US7573912B2 (en) * 2005-02-22 2009-08-11 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschunng E.V. Near-transparent or transparent multi-channel encoder/decoder scheme
ATE521143T1 (de) * 2005-02-23 2011-09-15 Ericsson Telefon Ab L M Adaptive bitzuweisung für die mehrkanal- audiokodierung
US7751572B2 (en) * 2005-04-15 2010-07-06 Dolby International Ab Adaptive residual audio coding
US8227369B2 (en) 2005-05-25 2012-07-24 Celanese International Corp. Layered composition and processes for preparing and using the composition
WO2006126115A2 (en) * 2005-05-25 2006-11-30 Koninklijke Philips Electronics N.V. Predictive encoding of a multi channel signal
CN101233568B (zh) * 2005-07-29 2010-10-27 Lg电子株式会社 生成经编码的音频信号的方法以及处理音频信号的方法
JP5171256B2 (ja) * 2005-08-31 2013-03-27 パナソニック株式会社 ステレオ符号化装置、ステレオ復号装置、及びステレオ符号化方法
US7974713B2 (en) * 2005-10-12 2011-07-05 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Temporal and spatial shaping of multi-channel audio signals
KR100866885B1 (ko) * 2005-10-20 2008-11-04 엘지전자 주식회사 멀티채널 오디오 신호의 부호화 및 복호화 방법과 그 장치
KR100888474B1 (ko) * 2005-11-21 2009-03-12 삼성전자주식회사 멀티채널 오디오 신호의 부호화/복호화 장치 및 방법
JP2007183528A (ja) * 2005-12-06 2007-07-19 Fujitsu Ltd 符号化装置、符号化方法、および符号化プログラム
WO2007096808A1 (en) 2006-02-21 2007-08-30 Koninklijke Philips Electronics N.V. Audio encoding and decoding
CN101411214B (zh) 2006-03-28 2011-08-10 艾利森电话股份有限公司 用于多信道环绕声音的解码器的方法和装置
ES2378734T3 (es) * 2006-10-16 2012-04-17 Dolby International Ab Codificación mejorada y representación de parámetros de codificación de objetos de mezcla descendente multicanal
WO2008132826A1 (ja) * 2007-04-20 2008-11-06 Panasonic Corporation ステレオ音声符号化装置およびステレオ音声符号化方法
US8046214B2 (en) * 2007-06-22 2011-10-25 Microsoft Corporation Low complexity decoder for complex transform coding of multi-channel sound
US8218775B2 (en) * 2007-09-19 2012-07-10 Telefonaktiebolaget L M Ericsson (Publ) Joint enhancement of multi-channel audio
GB2453117B (en) 2007-09-25 2012-05-23 Motorola Mobility Inc Apparatus and method for encoding a multi channel audio signal
RU2452043C2 (ru) * 2007-10-17 2012-05-27 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Аудиокодирование с использованием понижающего микширования
KR101505831B1 (ko) * 2007-10-30 2015-03-26 삼성전자주식회사 멀티 채널 신호의 부호화/복호화 방법 및 장치
US8103005B2 (en) * 2008-02-04 2012-01-24 Creative Technology Ltd Primary-ambient decomposition of stereo audio signals using a complex similarity index
CN101981616A (zh) 2008-04-04 2011-02-23 松下电器产业株式会社 立体声信号变换装置、立体声信号逆变换装置及其方法
EP2144230A1 (en) * 2008-07-11 2010-01-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Low bitrate audio encoding/decoding scheme having cascaded switches
KR20130133917A (ko) * 2008-10-08 2013-12-09 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 다중 분해능 스위치드 오디오 부호화/복호화 방법
WO2010084756A1 (ja) * 2009-01-22 2010-07-29 パナソニック株式会社 ステレオ音響信号符号化装置、ステレオ音響信号復号装置およびそれらの方法
CN102292769B (zh) * 2009-02-13 2012-12-19 华为技术有限公司 一种立体声编码方法和装置
WO2010097748A1 (en) 2009-02-27 2010-09-02 Koninklijke Philips Electronics N.V. Parametric stereo encoding and decoding
CN101826326B (zh) * 2009-03-04 2012-04-04 华为技术有限公司 一种立体声编码方法、装置和编码器
ES2415155T3 (es) * 2009-03-17 2013-07-24 Dolby International Ab Codificación estéreo avanzada basada en una combinación de codificación estéreo izquierda/derecha o central/lateral seleccionable de manera adaptativa y de codificación estéreo paramétrica
US8666752B2 (en) * 2009-03-18 2014-03-04 Samsung Electronics Co., Ltd. Apparatus and method for encoding and decoding multi-channel signal
WO2011048117A1 (en) * 2009-10-20 2011-04-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio signal encoder, audio signal decoder, method for encoding or decoding an audio signal using an aliasing-cancellation
KR101710113B1 (ko) * 2009-10-23 2017-02-27 삼성전자주식회사 위상 정보와 잔여 신호를 이용한 부호화/복호화 장치 및 방법
EP2323130A1 (en) 2009-11-12 2011-05-18 Koninklijke Philips Electronics N.V. Parametric encoding and decoding
WO2011073600A1 (fr) * 2009-12-18 2011-06-23 France Telecom Codage/decodage parametrique stereo avec optimisation du traitement de reduction des canaux
IL286761B (en) * 2010-04-09 2022-09-01 Dolby Int Ab An uplink mixer is active in predictive or non-predictive mode
US8463414B2 (en) * 2010-08-09 2013-06-11 Motorola Mobility Llc Method and apparatus for estimating a parameter for low bit rate stereo transmission
FR2966634A1 (fr) * 2010-10-22 2012-04-27 France Telecom Codage/decodage parametrique stereo ameliore pour les canaux en opposition de phase
KR101998609B1 (ko) 2010-10-25 2019-07-10 보이세지 코포레이션 혼합형 시간-영역/주파수-영역 코딩 장치, 인코더, 디코더, 혼합형 시간-영역/주파수-영역 코딩 방법, 인코딩 방법 및 디코딩 방법
ES2553398T3 (es) * 2010-11-03 2015-12-09 Huawei Technologies Co., Ltd. Codificador paramétrico para codificar una señal de audio multicanal
WO2013149672A1 (en) * 2012-04-05 2013-10-10 Huawei Technologies Co., Ltd. Method for determining an encoding parameter for a multi-channel audio signal and multi-channel audio encoder
KR101606665B1 (ko) 2012-04-05 2016-03-25 후아웨이 테크놀러지 컴퍼니 리미티드 파라미터 공간 오디오 코딩 및 디코딩을 위한 방법, 파라미터 공간 오디오 코더 및 파라미터 공간 오디오 디코더
US9516446B2 (en) * 2012-07-20 2016-12-06 Qualcomm Incorporated Scalable downmix design for object-based surround codec with cluster analysis by synthesis
KR101729930B1 (ko) * 2013-02-14 2017-04-25 돌비 레버러토리즈 라이쎈싱 코오포레이션 업믹스된 오디오 신호들의 채널간 코히어런스를 제어하기 위한 방법
TWI634547B (zh) * 2013-09-12 2018-09-01 瑞典商杜比國際公司 在包含至少四音訊聲道的多聲道音訊系統中之解碼方法、解碼裝置、編碼方法以及編碼裝置以及包含電腦可讀取的媒體之電腦程式產品
TWI557724B (zh) * 2013-09-27 2016-11-11 杜比實驗室特許公司 用於將 n 聲道音頻節目編碼之方法、用於恢復 n 聲道音頻節目的 m 個聲道之方法、被配置成將 n 聲道音頻節目編碼之音頻編碼器及被配置成執行 n 聲道音頻節目的恢復之解碼器
US9832589B2 (en) * 2013-12-23 2017-11-28 Wilus Institute Of Standards And Technology Inc. Method for generating filter for audio signal, and parameterization device for same
CN106463125B (zh) * 2014-04-25 2020-09-15 杜比实验室特许公司 基于空间元数据的音频分割
EP3353784B1 (en) 2015-09-25 2025-03-05 VoiceAge Corporation Method and system for encoding left and right channels of a stereo sound signal selecting between two and four sub-frames models depending on the bit budget

Also Published As

Publication number Publication date
MY188370A (en) 2021-12-06
MX2018003703A (es) 2018-04-30
CA2997332A1 (en) 2017-03-30
AU2016325879A1 (en) 2018-04-05
KR20180056662A (ko) 2018-05-29
RU2729603C2 (ru) 2020-08-11
CN108352162A (zh) 2018-07-31
ES2955962T3 (es) 2023-12-11
US20180277126A1 (en) 2018-09-27
EP3353780A4 (en) 2019-05-22
HK1259477A1 (en) 2019-11-29
ES2949991T3 (es) 2023-10-04
JP6804528B2 (ja) 2020-12-23
EP3353779A4 (en) 2019-08-07
CN108352163B (zh) 2023-02-21
MX383266B (es) 2025-03-13
EP3353778A4 (en) 2019-05-08
AU2016325879B2 (en) 2021-07-08
KR102677745B1 (ko) 2024-06-25
RU2020125468A (ru) 2020-09-24
EP3961623A1 (en) 2022-03-02
EP3699909A1 (en) 2020-08-26
US10522157B2 (en) 2019-12-31
MX2021006677A (es) 2023-03-01
EP3353777B8 (en) 2023-08-23
KR102636396B1 (ko) 2024-02-15
US10573327B2 (en) 2020-02-25
ES2809677T3 (es) 2021-03-05
JP2018533057A (ja) 2018-11-08
JP6887995B2 (ja) 2021-06-16
CN108352164A (zh) 2018-07-31
JP2021047431A (ja) 2021-03-25
EP3353777A4 (en) 2019-05-15
ZA202003500B (en) 2022-06-29
EP4235659A2 (en) 2023-08-30
ES2904275T3 (es) 2022-04-04
DK3353779T3 (da) 2020-08-10
RU2018114899A (ru) 2019-10-25
US10839813B2 (en) 2020-11-17
JP7244609B2 (ja) 2023-03-22
US10319385B2 (en) 2019-06-11
KR102636424B1 (ko) 2024-02-15
RU2018114898A3 (es) 2020-02-11
MY186661A (en) 2021-08-04
US11056121B2 (en) 2021-07-06
ZA201801675B (en) 2020-09-30
RU2020125468A3 (es) 2021-11-26
US20180261231A1 (en) 2018-09-13
CA2997331C (en) 2023-12-05
WO2017049399A1 (en) 2017-03-30
US20190228784A1 (en) 2019-07-25
EP3353778B1 (en) 2023-07-05
PT3353779T (pt) 2020-07-31
KR20180056661A (ko) 2018-05-29
RU2728535C2 (ru) 2020-07-30
RU2020124137A (ru) 2020-09-04
US20180233154A1 (en) 2018-08-16
EP3353784A1 (en) 2018-08-01
EP3353780B1 (en) 2021-12-01
RU2730548C2 (ru) 2020-08-24
CA2997513A1 (en) 2017-03-30
JP7140817B2 (ja) 2022-09-21
US20190228785A1 (en) 2019-07-25
US10984806B2 (en) 2021-04-20
EP3353780A1 (en) 2018-08-01
HK1253570A1 (zh) 2019-06-21
RU2018114899A3 (es) 2020-02-25
MX2018003242A (es) 2018-09-26
HK1257684A1 (en) 2019-10-25
JP2021131569A (ja) 2021-09-09
EP3353777B1 (en) 2023-06-21
EP3961623B1 (en) 2025-11-19
RU2018114901A3 (es) 2020-03-10
EP3353784A4 (en) 2019-05-22
RU2765565C2 (ru) 2022-02-01
ES3058595T3 (en) 2026-03-11
CN108352164B (zh) 2022-12-06
CN116343802A (zh) 2023-06-27
EP4235659A3 (en) 2023-09-06
EP3353779A1 (en) 2018-08-01
JP2022028765A (ja) 2022-02-16
CA2997334A1 (en) 2017-03-30
RU2018114901A (ru) 2019-10-28
RU2018114898A (ru) 2019-10-25
CN108352162B (zh) 2023-05-09
HK1253569A1 (zh) 2019-06-21
EP3353784C0 (en) 2025-03-05
EP3353784B1 (en) 2025-03-05
CA2997331A1 (en) 2017-03-30
CA2997296A1 (en) 2017-03-30
US10339940B2 (en) 2019-07-02
MX2021005090A (es) 2023-01-04
CN108352163A (zh) 2018-07-31
CA2997296C (en) 2023-12-05
US10325606B2 (en) 2019-06-18
EP3699909B1 (en) 2025-11-19
WO2017049397A1 (en) 2017-03-30
EP3353777A1 (en) 2018-08-01
WO2017049400A1 (en) 2017-03-30
EP3353778A1 (en) 2018-08-01
US20190237087A1 (en) 2019-08-01
JP6976934B2 (ja) 2021-12-08
KR20180059781A (ko) 2018-06-05
MX382211B (es) 2025-03-13
JP2018533056A (ja) 2018-11-08
RU2763374C2 (ru) 2021-12-28
JP2018533058A (ja) 2018-11-08
US20180286415A1 (en) 2018-10-04
RU2764287C1 (ru) 2022-01-17
US20180268826A1 (en) 2018-09-20
WO2017049398A1 (en) 2017-03-30
WO2017049396A1 (en) 2017-03-30
EP3353779B1 (en) 2020-06-24
PL3353779T3 (pl) 2020-11-16
RU2020124137A3 (es) 2021-11-12
JP7124170B2 (ja) 2022-08-23

Similar Documents

Publication Publication Date Title
ES3058595T3 (en) Method and system for encoding a stereo sound signal using coding parameters of a primary channel to encode a secondary channel
US12125492B2 (en) Method and system for decoding left and right channels of a stereo sound signal
HK40069408A (en) Method and system for decoding left and right channels of a stereo sound signal
HK1259052A1 (zh) 用於解码立体声声音信号的左和右声道的方法和系统
HK1259052B (en) Method and system for decoding left and right channels of a stereo sound signal
HK1257684B (en) Method and system for time domain down mixing a stereo sound signal into primary and secondary channels using detecting an out-of-phase condition of the left and right channels
HK1253570B (en) Method and system using a long-term correlation difference between left and right channels for time domain down mixing a stereo sound signal into primary and secondary channels
HK1259477B (en) Method and system for encoding left and right channels of a stereo sound signal selecting between two and four sub-frames models depending on the bit budget