ES2340608T3 - Aparato y procedimiento para codificar mediante banda dividida una señal de voz. - Google Patents

Aparato y procedimiento para codificar mediante banda dividida una señal de voz. Download PDF

Info

Publication number
ES2340608T3
ES2340608T3 ES06740354T ES06740354T ES2340608T3 ES 2340608 T3 ES2340608 T3 ES 2340608T3 ES 06740354 T ES06740354 T ES 06740354T ES 06740354 T ES06740354 T ES 06740354T ES 2340608 T3 ES2340608 T3 ES 2340608T3
Authority
ES
Spain
Prior art keywords
signal
band
high band
voice
encoder
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES06740354T
Other languages
English (en)
Inventor
Koen Bernard Vos
Ananthapadmanabhan A. Kandhadai
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Qualcomm Inc
Original Assignee
Qualcomm Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Family has litigation
First worldwide family litigation filed litigation Critical https://patents.darts-ip.com/?family=36588741&utm_source=google_patent&utm_medium=platform_link&utm_campaign=public_patent_search&patent=ES2340608(T3) "Global patent litigation dataset” by Darts-ip is licensed under a Creative Commons Attribution 4.0 International License.
Application filed by Qualcomm Inc filed Critical Qualcomm Inc
Application granted granted Critical
Publication of ES2340608T3 publication Critical patent/ES2340608T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0204Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
    • G10L19/0208Subband vocoders
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/038Speech enhancement, e.g. noise reduction or echo cancellation using band spreading techniques
    • G10L21/0388Details of processing therefor
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/032Quantisation or dequantisation of spectral components
    • G10L19/038Vector quantisation, e.g. TwinVQ audio
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • G10L19/24Variable rate codecs, e.g. for generating different qualities using a scalable representation such as hierarchical encoding or layered encoding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise
    • G10L21/0232Processing in the frequency domain
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/038Speech enhancement, e.g. noise reduction or echo cancellation using band spreading techniques

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Quality & Reliability (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Reduction Or Emphasis Of Bandwidth Of Signals (AREA)
  • Analogue/Digital Conversion (AREA)
  • Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
  • Control Of Amplification And Gain Control (AREA)
  • Control Of Eletrric Generators (AREA)
  • Cable Transmission Systems, Equalization Of Radio And Reduction Of Echo (AREA)
  • Digital Transmission Methods That Use Modulated Carrier Waves (AREA)
  • Magnetic Resonance Imaging Apparatus (AREA)
  • Image Analysis (AREA)
  • Amplitude Modulation (AREA)
  • Finish Polishing, Edge Sharpening, And Grinding By Specific Grinding Devices (AREA)
  • Filters And Equalizers (AREA)
  • Soundproofing, Sound Blocking, And Sound Damping (AREA)
  • Addition Polymer Or Copolymer, Post-Treatments, Or Chemical Modifications (AREA)
  • Telephonic Communication Services (AREA)
  • Organic Low-Molecular-Weight Compounds And Preparation Thereof (AREA)
  • Stereo-Broadcasting Methods (AREA)
  • Separation Using Semi-Permeable Membranes (AREA)
  • Developing Agents For Electrophotography (AREA)
  • Air Conditioning Control Device (AREA)
  • Peptides Or Proteins (AREA)
  • Transmitters (AREA)
  • Crystals, And After-Treatments Of Crystals (AREA)
  • Ticket-Dispensing Machines (AREA)
  • Filtration Of Liquid (AREA)
  • Solid-Sorbent Or Filter-Aiding Compositions (AREA)
  • Filtering Of Dispersed Particles In Gases (AREA)
  • Surface Acoustic Wave Elements And Circuit Networks Thereof (AREA)

Abstract

Un aparato, que comprende: un banco (A110) de filtros, que contiene A) una trayectoria de procesamiento de banda baja configurada para recibir una señal de voz de banda ancha y para generar una señal de voz de banda baja en función de una parte de baja frecuencia de la señal de voz de banda ancha, y B) una trayectoria de procesamiento de banda alta configurada para recibir la señal de voz de banda ancha y para generar una señal de voz de banda alta en función de una parte de alta frecuencia de la señal de voz de banda ancha, donde una banda de paso de la trayectoria de procesamiento de banda baja se solapa con una banda de paso de la trayectoria de procesamiento de banda alta, donde el solapamiento se considera como la distancia del punto en el que la respuesta de frecuencia del filtro de banda alta desciende hasta -20 dB desde el punto en el que la respuesta de frecuencia del filtro de banda baja desciende hasta -20 dB; un primer codificador (A120) de voz configurado para codificar la señal de voz de banda baja en al menos una señal de excitación de banda baja codificada y una pluralidad de parámetros de filtro de banda baja; y un segundo codificador (A200) de voz configurado para generar una señal de excitación de banda alta en función de la señal de excitación de banda baja codificada y para codificar la señal de banda alta, según la señal de excitación de banda alta, en al menos una pluralidad de parámetros de filtro de banda alta, caracterizado porque la banda de paso de la trayectoria de procesamiento de banda baja se solapa con la banda de paso de la trayectoria de procesamiento de banda alta entre 400 y 1000 Hz aproximadamente.

Description

Aparato y procedimiento para codificar mediante banda dividida una señal de voz.
Campo de la invención
Esta invención se refiere al procesamiento de señales.
Antecedentes
Tradicionalmente, las comunicaciones de voz a través de la red telefónica pública conmutada (PSTN) han tenido limitado el ancho de banda al intervalo de frecuencias comprendido entre 300 y 3400 kHz. Las nuevas redes de comunicaciones de voz, tales como telefonía celular y voz sobre IP (protocolo de Internet, VoIP), pueden tener otros límites de ancho de banda diferentes y puede ser deseable transmitir y recibir comunicaciones de voz que incluyan un intervalo de frecuencias de banda ancha en tales redes. Por ejemplo, puede ser deseable soportar un intervalo de frecuencias de audio con un valor inferior de 50 Hz y/o con un valor superior de 7 u 8 kHz. También puede ser deseable soportar otras aplicaciones, tales como conferencias de audio o de audio/vídeo de alta calidad, que puedan tener contenido de voz y audio en intervalos fuera de los límites PSTN tradicionales.
La ampliación del intervalo soportado por un codificador de voz en frecuencias superiores puede mejorar la inteligibilidad. Por ejemplo, la información que diferencia sonidos fricativos tales como "s" y "f" está presente principalmente en las altas frecuencias. La ampliación de banda alta también puede mejorar otras características de la voz, tales como la presencia. Por ejemplo, incluso una vocal sonora puede presentar energía espectral muy por encima del límite PSTN.
Un enfoque a la codificación de voz de banda ancha requiere escalar una técnica de codificación de voz de banda estrecha (por ejemplo, una técnica configurada para codificar el intervalo comprendido entre 0 y 4 kHz) para cubrir el espectro de banda ancha. Por ejemplo, una señal de voz puede muestrearse a una tasa superior para incluir componentes a altas frecuencias, y una técnica de codificación de banda estrecha puede reconfigurarse para utilizar más coeficientes de filtro para representar esta señal de banda ancha. Sin embargo, las técnicas de codificación de banda estrecha tales como CELP (predicción lineal excitada por libro de códigos) requieren un gran esfuerzo computacional y un codificador CELP de banda ancha puede consumir demasiados ciclos de procesamiento para que resulte práctico en muchas aplicaciones móviles y en otras aplicaciones embebidas. La codificación de todo el espectro de una señal de banda ancha en una calidad deseada utilizando una técnica de este tipo también puede dar lugar a un incremento inaceptablemente grande del ancho de banda. Además, la transcodificación de una señal codificada de este tipo sería necesaria incluso antes de que su parte de banda estrecha pudiera transmitirse a y/o descodificarse por un sistema que solo soporte codificación de banda estrecha.
Otro enfoque a la codificación de voz de banda ancha requiere extrapolar la envolvente espectral de banda alta a partir de la envolvente espectral de banda estrecha codificada.
Aunque un enfoque de este tipo puede implementarse sin aumentar el ancho de banda y sin necesidad de transcodificación, la envolvente espectral aproximada o la estructura de formante de la parte de banda alta de una señal de voz no pueden predecirse generalmente de manera precisa a partir de la envolvente espectral de la parte de banda
estrecha.
Puede ser deseable implementar la codificación de voz de banda ancha de manera que al menos la parte de banda estrecha de la señal codificada pueda enviarse a través de un canal de banda estrecha (tal como un canal PSTN) sin transcodificación u otra modificación significativa. La eficacia de la extensión de codificación de banda ancha también puede ser deseable, por ejemplo, para evitar una reducción significativa del número de usuarios que pueden recibir servicio en aplicaciones tales como telefonía celular inalámbrica y radiodifusión a través de canales cableados y canales inalámbricos.
Para compensar las diferencias en la intensidad sonora percibida entre la parte de banda baja y la parte de banda alta en la señal sintetizada, se conoce un procedimiento a partir del documento US 2005/0004793 A1 para ajustar de manera adaptativa la señal de banda alta codificada en función del algoritmo de codificación de banda baja.
El objeto de la invención es proporcionar un procedimiento simplificado y, en particular, mejorado para evitar fenómenos transitorios audibles en la señal.
Resumen
La invención proporciona un aparato que comprende las características de la reivindicación 1 y un procedimiento según la reivindicación 22. Realizaciones preferidas adicionales resultarán evidentes a partir de las reivindicaciones dependientes.
Breve descripción de los dibujos
La Figura 1a muestra un diagrama de bloques de un codificador A100 de voz de banda ancha según una realización.
La Figura 1b muestra un diagrama de bloques de una implementación A102 del codificador A100 de voz de banda ancha.
La Figura 2a muestra un diagrama de bloques de un descodificador B100 de voz de banda ancha según una realización.
La Figura 2b muestra un diagrama de bloques de una implementación B102 del codificador B100 de voz de banda ancha.
La Figura 3a muestra un diagrama de bloques de una implementación A112 de un banco A110 de filtros.
La Figura 3b muestra un diagrama de bloques de una implementación B122 de un banco B120 de filtros.
La Figura 4a muestra una cobertura de ancho de banda de una banda alta y de una banda baja de un ejemplo del banco A110 de filtros.
La Figura 4b muestra una cobertura de ancho de banda de una banda alta y de una banda baja de otro ejemplo del banco A110 de filtros.
La Figura 4c muestra un diagrama de bloques de una implementación A114 de un banco A112 de filtros.
La Figura 4d muestra un diagrama de bloques de una implementación B124 de un banco B122 de filtros.
La Figura 5a muestra un ejemplo de una representación gráfica de la amplitud logarítmica frente a la frecuencia de una señal de voz.
La Figura 5b muestra un diagrama de bloques de un sistema de codificación básico de predicción lineal.
La Figura 6 muestra un diagrama de bloques de una implementación A122 de un codificador A120 de banda estrecha.
La Figura 7 muestra un diagrama de bloques de una implementación B112 de un descodificador B110 de banda estrecha.
La Figura 8a muestra un ejemplo de una representación gráfica de la amplitud logarítmica frente a la frecuencia de una señal residual de voz sonora.
La Figura 8b muestra un ejemplo de una representación gráfica de la amplitud logarítmica frente al tiempo de una señal residual de un voz sonora.
La Figura 9 muestra un diagrama de bloques de un sistema de codificación básico de predicción lineal que también lleva a cabo una predicción a largo plazo.
La Figura 10 muestra un diagrama de bloques de una implementación A202 de un codificador A200 de banda alta.
La Figura 11 muestra un diagrama de bloques de una implementación A302 de un generador A300 de excitación de banda alta.
La Figura 12 muestra un diagrama de bloques de una implementación A402 de un ensanchador A400 de espectro.
La Figura 12a muestra representaciones gráficas de espectros de señales en varios puntos en un ejemplo de una operación de ensanchamiento espectral.
La Figura 12b muestra representaciones gráficas de espectros de señales en varios puntos en otro ejemplo de una operación de ensanchamiento espectral.
La Figura 13 muestra un diagrama de bloques de una implementación A304 de un generador A302 de excitación de banda alta.
La Figura 14 muestra un diagrama de bloques de una implementación A306 del generador A302 de excitación de banda alta.
La Figura 15 muestra un diagrama de flujo de una tarea T100 de cálculo de envolvente.
La Figura 16 muestra un diagrama de bloques de una implementación 492 de un combinador 490.
La Figura 17 muestra un enfoque para calcular una medida de periodicidad de una señal S30 de banda alta.
La Figura 18 muestra un diagrama de bloques de una implementación A312 del generador A302 de excitación de banda alta.
La Figura 19 muestra un diagrama de bloques de una implementación A314 del generador A302 de excitación de banda alta.
La Figura 20 muestra un diagrama de bloques de una implementación A316 del generador A302 de excitación de banda alta.
La Figura 21 muestra un diagrama de flujo de una tarea T200 de cálculo de ganancia.
La Figura 22 muestra un diagrama de flujo de una implementación T210 de la tarea T200 de cálculo de ganancia.
La Figura 23a muestra un diagrama de una función de división en ventanas.
La Figura 23b muestra una aplicación de una función de división en ventanas, como la mostrada en la Figura 23a, en subtramas de una señal de voz.
La Figura 24 muestra un diagrama de bloques de una implementación B202 de un descodificador B200 de banda alta.
La Figura 25 muestra un diagrama de bloques de una implementación AD10 del codificador A100 de voz de banda ancha.
La Figura 26a muestra un diagrama esquemático de una implementación D122 de una línea D120 de retardo.
La Figura 26b muestra un diagrama esquemático de una implementación D124 de la línea D120 de retardo.
La Figura 27 muestra un diagrama esquemático de una implementación D130 de la línea D120 de retardo.
La Figura 28 muestra un diagrama de bloques de una implementación AD12 del codificador AD10 de voz de banda ancha.
La Figura 29 muestra un diagrama de flujo de un procedimiento de procesamiento MD100 de señales según una realización.
La Figura 30 muestra un diagrama de flujo de un procedimiento M100 según una realización.
La Figura 31a muestra un diagrama de flujo de un procedimiento M200 según una realización.
La Figura 31b muestra un diagrama de flujo de una implementación M210 del procedimiento M200.
La Figura 32 muestra un diagrama de flujo de un procedimiento M300 según una realización.
Las Figuras 33 a 36b muestran respuestas de frecuencia y de impulso de las operaciones de filtrado mostradas en la Figura 4c.
Las Figuras 37a a 39b muestran respuestas de frecuencia y de impulso de las operaciones de filtrado mostradas en la Figura 4d.
En las figuras y en la descripción adjunta, las mismas etiquetas de referencia se refieren a elementos o señales idénticos o análogos.
Descripción detallada
Las realizaciones descritas en este documento incluyen sistemas, procedimientos y aparatos que pueden configurarse para ampliar un codificador de voz de banda estrecha para que soporte la transmisión y/o el almacenamiento de señales de voz de banda ancha con un incremento de ancho de banda comprendido solamente entre 800 y 1000 bps (bits por segundo) aproximadamente. Las ventajas potenciales de estas implementaciones incluyen codificación embebida para permitir la compatibilidad con sistemas de banda estrecha, una asignación y reasignación de bits relativamente sencillas entre los canales de codificación de banda estrecha y de banda alta, la eliminación de una operación de síntesis de banda ancha de un alto esfuerzo computacional y el mantenimiento de una baja tasa de muestreo para señales que van a procesarse mediante rutinas de codificación de forma de onda de un alto esfuerzo computacional.
A no ser que esté limitado expresamente por su contexto, el término "calcular" se utiliza en este documento para indicar cualquiera de sus significados habituales, tales como computar, generar y seleccionar a partir de una lista de valores. Cuando se utilice el término "comprender" en la presente descripción y en las reivindicaciones, no excluye otros elementos u operaciones. El término "A se basa en B" se utiliza para indicar cualquiera de sus significados habituales, incluyendo los casos (i) "A es igual a B" y (ii) "A se basa al menos en B". El término "protocolo de Internet" incluye la versión 4, tal y como se describe en la RFC (solicitud de comentarios) 791 del IETF (grupo de trabajo de ingeniería de Internet) y versiones posteriores tales como la versión 6.
La Figura 1a muestra un diagrama de bloques de un codificador A100 de voz de banda ancha según una realización. Un banco A110 de filtros está configurado para filtrar una señal S10 de voz de banda ancha para generar una señal S20 de banda estrecha y una señal S30 de banda alta. Un codificador A120 de banda estrecha está configurado para codificar la señal S20 de banda estrecha para generar parámetros S40 de filtro de banda estrecha (NB) y una señal S50 residual de banda estrecha. Tal y como se describe en mayor detalle en este documento, el codificador A120 de banda estrecha está configurado normalmente para generar parámetros S40 de filtro de banda estrecha y una señal S50 de excitación de banda estrecha codificada como índices de libro de código o en otra forma cuantificada. Un codificador A200 de banda alta está configurado para codificar la señal S30 de banda alta según información de la señal S50 de excitación de banda estrecha codificada para generar parámetros S60 de codificación de banda alta. Tal y como se describe en mayor detalle en este documento, el codificador A200 de banda alta está configurado normalmente para generar parámetros S60 de codificación de banda alta como índices de libro de código o en otra forma cuantificada. Un ejemplo particular del codificador A100 de voz de banda ancha está configurado para codificar la señal S10 de voz de banda ancha a una velocidad de 8,55 kbps aproximadamente (kilobits por segundo), utilizándose 7,55 kbps aproximadamente para los parámetros S40 de filtro de banda estrecha y para la señal S50 de excitación de banda estrecha codificada, y utilizándose 1 kbps aproximadamente para los parámetros S60 de codificación de banda alta.
Puede ser deseable combinar las señales de banda estrecha y de banda alta codificadas en un único flujo de bits. Por ejemplo, puede ser deseable multiplexar juntas las señales codificadas para su transmisión (por ejemplo, a través de un canal de transmisión cableado, óptico o inalámbrico), o para su almacenamiento, como una señal de voz de banda ancha codificada. La Figura 1b muestra un diagrama de bloques de una implementación A102 del codificador A100 de voz de banda ancha que incluye un multiplexor A130 configurado para combinar los parámetros S40 de filtro de banda estrecha, la señal S50 de excitación de banda estrecha codificada y los parámetros S60 de filtro de banda alta en una señal S70 multiplexada.
Un aparato que incluye al codificador A102 también puede incluir un sistema de circuitos configurado para transmitir la señal S70 multiplexada en un canal de transmisión tal como un canal cableado, óptico o inalámbrico. Un aparato de este tipo también puede configurarse para llevar a cabo una o más operaciones de codificación de canal en la señal, tal como codificación de corrección de errores (por ejemplo, codificación convolucional de velocidades compatibles) y/o codificación de detección de errores (por ejemplo, codificación de redundancia cíclica), y/o una o más capas de codificación de protocolo de red (por ejemplo, Ethernet, TCP/IP, cdma2000).
Puede ser deseable que el multiplexor A130 esté configurado para encapsular la señal de banda estrecha codificada (incluyendo los parámetros S40 de filtro de banda estrecha y la señal S50 de excitación de banda estrecha) como un subflujo separable de la señal S70 multiplexada de manera que la señal de banda estrecha codificada pueda recuperarse y descodificarse independientemente de otra parte de la señal S70 multiplexada tal como una señal de banda alta y/o de banda baja. Por ejemplo, la señal S70 multiplexada puede estar dispuesta de manera que la señal de banda estrecha codificada pueda recuperarse extrayendo los parámetros S60 de filtro de banda alta. Una ventaja potencial de esta característica es evitar la necesidad de transcodificar la señal de banda ancha codificada antes de suministrarla a un sistema que soporte la descodificación de la señal de banda estrecha pero que no soporte la descodificación de la parte de banda alta.
La Figura 2a es un diagrama de bloques de un descodificador B100 de voz de banda ancha según una realización. Un descodificador B110 de banda estrecha está configurado para descodificar los parámetros S40 de filtro de banda estrecha y la señal S50 de excitación de banda estrecha para generar una señal S90 de banda estrecha. Un descodificador B200 de banda alta está configurado para descodificar los parámetros S60 de codificación de banda alta según una señal S80 de excitación de banda estrecha, basada en la señal S50 de excitación de banda estrecha codificada, para generar una señal S100 de banda alta. En este ejemplo, el descodificador B110 de banda estrecha está configurado para proporcionar la señal S80 de excitación de banda estrecha al descodificador B200 de banda alta. Un banco B120 de filtros está configurado para combinar la señal S90 de banda estrecha y la señal S100 de banda alta para generar una señal S110 de voz de banda ancha.
La Figura 2b es un diagrama de bloques de una implementación B102 del descodificador B100 de voz de banda ancha que incluye un desmultiplexor B130 configurado para generar las señales S40, S50 y S60 codificadas de la señal S70 multiplexada. Un aparato que incluye al descodificador B102 puede incluir un sistema de circuitos configurado para recibir la señal S70 multiplexada desde un canal de transmisión tal como un canal cableado, óptico o inalámbrico. Un aparato de este tipo también puede configurarse para llevar a cabo una o más operaciones de descodificación de canal en la señal, tal como descodificación de corrección de errores (por ejemplo, descodificación convolucional de velocidades compatibles) y/o descodificación de detección de errores (por ejemplo, descodificación de redundancia cíclica), y/o uno más capas de descodificación de protocolo de red (por ejemplo, Ethernet, TCP/IP, cdma2000).
El banco A110 de filtros está configurado para filtrar una señal de entrada según un esquema de banda divida para generar una subbanda de baja frecuencia y una subbanda de alta frecuencia. Dependiendo de los criterios de diseño de la aplicación particular, las subbandas de salida pueden tener anchos de banda iguales o diferentes y pueden estar solapadas o no solapadas. También es posible una configuración del banco A110 de filtros que genere más de dos subbandas. Por ejemplo, un banco de filtros de este tipo puede configurarse para generar una o más señales de banda baja que incluyan componentes en un intervalo de frecuencias inferior al de la señal S20 de banda estrecha (tal como el intervalo comprendido entre 50 y 300 Hz). También es posible que un banco de filtros de este tipo esté configurado para generar una o más señales de banda alta adicionales que incluyan componentes en un intervalo de frecuencias superior al de la señal S30 de banda alta (tal como un intervalo comprendido entre 14 y 20, 16 y 20 o 16 y 32 KHz). En ese caso, el codificador A100 de voz de banda ancha puede implementarse para codificar esta señal o señales por separado, y el multiplexor A130 puede configurarse para incluir la señal o señales codificada(s) adicional(es) en la señal S70 multiplexada (por ejemplo, como una parte separable).
La Figura 3a muestra un diagrama de bloques de una implementación A112 del banco A110 de filtros que está configurada para generar dos señales de subbanda que presentan tasas de muestreo reducidas. El banco A110 de filtros está dispuesto para recibir una señal S10 de voz de banda ancha que presenta una parte de alta frecuencia (o de banda alta) y una parte de baja frecuencia (o de banda baja). El banco A112 de filtros incluye una trayectoria de procesamiento de banda baja configurada para recibir una señal S10 de voz de banda ancha y para generar una señal S20 de voz de banda estrecha, y una trayectoria de procesamiento de banda alta configurada para recibir la señal S10 de voz de banda ancha y para generar una señal S30 de voz de banda alta. Un filtro 110 paso bajo filtra la señal S10 de voz de banda ancha para hacer pasar una subbanda de baja frecuencia seleccionada, y un filtro 130 paso alto filtra la señal S10 de señal de voz de banda ancha para hacer pasar una subbanda de alta frecuencia seleccionada. Puesto que ambas señales de subbanda presentan anchos de banda más estrechos que la señal S10 de voz de banda ancha, sus tasas de muestreo pueden reducirse hasta cierto punto sin pérdida de información. Un muestreador 120 descendente reduce la tasa de muestreo de la señal de paso bajo según un factor de diezmado deseado (por ejemplo, eliminando muestras de la señal y/o sustituyendo las muestras por valores promedio), y un muestreador 140 descendente reduce igualmente la tasa de muestreo de la señal de paso alto según otro factor de diezmado deseado.
La Figura 3b muestra un diagrama de bloques de una implementación B122 correspondiente del banco B120 de filtros. Un muestreador 150 ascendente aumenta la tasa de muestreo de la señal S90 de banda estrecha (por ejemplo, rellenando con ceros y/o duplicando las muestras), y un filtro 160 paso bajo filtra la señal muestreada de manera ascendente para hacer pasar solamente una parte de banda baja (por ejemplo, para impedir la superposición). Asimismo, un muestreador 170 ascendente aumenta la tasa de muestreo de la señal S100 de banda alta y un filtro 180 paso alto filtra la señal muestreada de manera ascendente para hacer pasar solamente una parte de banda alta. Después, las dos señales de banda de paso se suman para formar una señal S110 de voz de banda ancha. En algunas implementaciones del descodificador B100, el banco B120 de filtros está configurado para generar una suma ponderada de las dos señales de banda de paso según una o más ponderaciones recibidas y/o calculadas por el descodificador B200 de banda alta. También se contempla una configuración del banco B120 de filtros que combine más de dos señales de banda de paso.
Cada uno de los filtros 110, 130, 160 y 180 pueden implementarse como un filtro de respuesta de impulsos finita (FIR) o como un filtro de respuesta de impulsos infinita (IIR). Las respuestas de frecuencia de los filtros 110 y 130 de codificador pueden presentar regiones de transición simétricas o de formas distintas entre la banda de detención y la banda de paso. Asimismo, las respuestas de frecuencia de los filtros 160 y 180 de descodificador pueden presentar regiones de transición simétricas o de formas distintas entre la banda de detención y la banda de paso. Puede ser deseable, pero no es estrictamente necesario, que el filtro 110 paso bajo tenga la misma respuesta que el filtro 160 paso bajo y que el filtro 130 paso alto tenga la misma respuesta que el filtro 180 paso alto. En un ejemplo, los dos pares 110, 130 y 160, 180 de filtros son bancos de filtros de espejo en cuadratura (QMF), presentando el par 110, 130 de filtros los mismos coeficientes que el par 160, 180 de filtros.
En un ejemplo típico, el filtro 110 paso bajo presenta una banda de paso que incluye el intervalo PSTN limitado de 300 a 3400 Hz (por ejemplo, la banda de 0 a 4 kHz). Las Figuras 4a y 4b muestran anchos de banda relativos de la señal S10 de voz de banda ancha, de la señal S20 de banda estrecha y de la señal S30 de banda alta en dos ejemplos de implantación diferentes. En estos dos ejemplos particulares, la señal S10 de voz de banda ancha presenta una tasa de muestreo de 16 kHz (representando componentes de frecuencia dentro del intervalo de 0 a 8 kHz), y la señal S20 de banda estrecha presenta una tasa de muestreo de 8 kHz (representando componentes de frecuencia dentro del intervalo de 0 a 4 kHz).
En el ejemplo de la Figura 4a no se produce un solapamiento significativo entre las dos subbandas. Una señal S30 de banda alta como la mostrada en este ejemplo puede obtenerse utilizando un filtro 130 paso alto con una banda de paso de 4 a 8 kHz. En este caso, puede ser deseable reducir la tasa de muestreo a 8kHz realizando un muestreo descendente de la señal filtrada mediante un factor de dos. Una operación de este tipo, mediante la cual se espera reducir significativamente la complejidad computacional de operaciones de procesamiento adicionales en la señal, reducirá la energía de banda de paso al intervalo de 0 a 4 kHz sin pérdida de información.
En el ejemplo alternativo de la Figura 4b, la subbanda superior y la subbanda inferior presentan un solapamiento apreciable, de manera que la región de 3,5 a 4 kHz se describe mediante ambas señales de señales de subbanda. Una señal S30 de banda alta como en este ejemplo puede obtenerse utilizando un filtro 130 paso alto con una banda de paso de 3,5 a 7 kHz. En este caso, puede ser deseable reducir la tasa de muestreo a 7kHz muestreando de manera descendente la señal filtrada mediante un factor de 16/7. Una operación de este tipo, mediante la cual se espera reducir significativamente la complejidad computacional de operaciones de procesamiento adicionales en la señal, reducirá la energía de banda de paso al intervalo de 0 a 3,5 kHz sin pérdida de información.
En un dispositivo típico de comunicación telefónica, uno o más de los transductores (es decir, el micrófono y el auricular u altavoz) carece(n) de una respuesta apreciable en el intervalo de frecuencias de 7 a 8 kHz. En el ejemplo de la Figura 4b, la parte de la señal S10 de voz de banda ancha entre 7 y 8 kHz no está incluida en la señal codificada. Otros ejemplos particulares del filtro 130 paso alto presentan bandas de paso de 3,5 a 7,5 kHz y de 3,5 a 8 kHz.
En algunas implementaciones, la provisión de un solapamiento entre subbandas como en el ejemplo de la Figura 4b permite la utilización de un filtro paso bajo y/o de un filtro paso alto que presenten una suave caída en la región solapada. Tales filtros son normalmente más fáciles de diseñar, menos complejos computacionalmente y/o introducen menos retardo que los filtros con respuestas más angulosas o de "muro de ladrillos". Los filtros que presentan regiones de transición angulosas tienden a tener mayores lóbulos laterales (lo que puede provocar superposición) que los filtros de orden similar que presentan suaves caídas. Los filtros que presentan regiones de transición angulosas también pueden presentar largas respuestas de impulsos que pueden provocar artefactos oscilantes. En implementaciones de bancos de filtros que presenten uno o más filtros IIR, permitiendo una suave caída en la región solapada puede adoptarse la utilización de un filtro o filtros cuyos polos estén alejados del círculo unitario, lo que puede ser importante para garantizar una implementación de punto fijo estable.
El solapamiento de las subbandas permite una mezcla uniforme de banda baja y de banda alta que puede da lugar a artefactos menos audibles, una menor superposición y/o una transición menos apreciable de una banda a otra. Además, la eficacia de codificación del codificador A120 de banda estrecha (por ejemplo, un codificador de forma de onda) puede disminuir con una frecuencia creciente. Por ejemplo, la calidad de codificación del codificador de banda estrecha puede reducirse a bajas velocidades binarias, especialmente en presencia de ruido de fondo. En tales casos, proporcionar un solapamiento de las subbandas puede aumentar la calidad de las componentes de frecuencia reproducidas en la región solapada.
Además, el solapamiento de las subbandas permite una mezcla uniforme de banda baja y de banda alta que puede dar lugar a artefactos menos audibles, una superposición reducida y/o una transición menos perceptible de una banda a otra. Esta característica puede ser especialmente deseable para una implementación en la que el codificador A120 de banda estrecha y el codificador A200 de banda alta funcionen según diferentes metodologías de codificación. Por ejemplo, diferentes técnicas de codificación pueden generar señales que suenen de manera muy diferente. Un codificador que codifique una envolvente espectral en forma de índices de libro de código puede generar una señal que tenga un sonido diferente al de un codificador que codifique en cambio el espectro de amplitud. Un codificador de dominio de tiempo (por ejemplo, un codificador PCM o de modulación por códigos de impulsos) puede generar una señal que tenga un sonido diferente al de un codificador de dominio de frecuencia. Un codificador que codifique una señal con una representación de la envolvente espectral y la señal residual correspondiente puede generar una señal que tenga un sonido diferente al de un codificador que codifique una señal con solamente una representación de la envolvente espectral. Un codificador que codifique una señal como una representación de su forma de onda puede generar una salida que tenga un sonido diferente al de un codificador sinusoidal. En tales casos, la utilización de filtros que presenten regiones de transición angulosas para definir subbandas no solapadas puede dar lugar a una transición abrupta y perceptualmente apreciable entre las subbandas de la señal de banda ancha sintetizada.
Aunque los bancos de filtros QMF que presentan respuestas de frecuencia solapadas complementarias se utilizan normalmente en técnicas de subbanda, tales filtros no son adecuados para al menos algunas de las implementaciones de codificación de banda ancha descritas en este documento. Un banco de filtros QMF en el codificador está configurado para crear un grado significativo de superposición que se suprime en el banco de filtros QMF correspondiente en el descodificador. Una disposición de este tipo puede no ser apropiada para una aplicación en la que la señal adquiere una cantidad importante de distorsión entre los bancos de filtros, ya que la distorsión puede reducir la eficacia de la propiedad de supresión de superposición. Por ejemplo, las aplicaciones descritas en este documento incluyen implementaciones de codificación configuradas para funcionar a velocidades binarias muy bajas. Como consecuencia de la reducida velocidad binaria, es probable que la señal descodificada aparezca significativamente distorsionada en comparación con la original, de manera que la utilización de bancos de filtros QMF puede dar lugar a una superposición no eliminada. Las aplicaciones que utilizan bancos de filtros QMF presentan normalmente velocidades binarias superiores (por ejemplo, por encima de los 12 kbps para AMR y de los 64 kbps para G.722).
Además, un codificador puede configurarse para generar una señal sintetizada que sea perceptualmente similar a la señal original pero que realmente sea muy diferente de la señal original. Por ejemplo, un codificador que obtenga la excitación de banda alta a partir de la señal residual de banda estrecha tal y como se describe en este documento puede generar una señal de este tipo, ya que la señal residual de banda alta real puede estar totalmente ausente de la señal descodificada. La utilización de bancos de filtros QMF en tales aplicaciones puede dar lugar a un grado de distorsión significativo provocado por una superposición no eliminada.
La cantidad de distorsión provocada por la superposición QMF puede reducirse si la subbanda afectada es estrecha, ya que el efecto de la superposición está limitado a un ancho de banda igual al ancho de la subbanda. Sin embargo, para los ejemplos descritos en este documento en los que cada subbanda incluye casi la mitad del ancho de banda de banda ancha, la distorsión provocada por la superposición no eliminada podría afectar a una parte significativa de la señal. La calidad de la señal también puede verse afectada por la posición de la banda de frecuencia sobre la cual se produce la superposición no eliminada. Por ejemplo, la distorsión creada cerca del centro de una señal de voz de banda ancha (por ejemplo, entre 3 y 4 kHz) puede ser mucho más inaceptable que la distorsión que se produce cerca de un borde de la señal (por ejemplo, por encima de los 6 kHz).
Aunque las respuestas de los filtros de un banco de filtros QMF están estrictamente relacionadas entre sí, la trayectoria de banda baja y la trayectoria de banda alta de los bancos A110 y B120 de filtros pueden configurarse para presentar espectros que no estén en absoluto relacionados aparte del solapamiento de las dos subbandas. El solapamiento de las dos subbandas se define como la distancia desde el punto en el que la respuesta de frecuencia del filtro de banda alta desciende a -20 dB hasta el punto en que la respuesta de frecuencia del filtro de banda baja desciende a -20 dB. En varios ejemplos del banco A110 y/o B120 de filtros, este solapamiento oscila entre 200 Hz aproximadamente y 1 kHz aproximadamente. El intervalo entre 400 Hz aproximadamente y 600 Hz aproximadamente puede representar un equilibrio deseable entre la eficacia de codificación y una uniformidad perceptual. En un ejemplo particular como el mencionado anteriormente, el solapamiento es de 500 Hz aproximadamente.
Puede ser deseable implementar el banco A122 y/o B122 de filtros para llevar a cabo operaciones como las ilustradas en las Figuras 4a y 4b en varias fases. Por ejemplo, la Figura 4c muestra un diagrama de bloques de una implementación A114 del banco A112 de filtros que realiza un equivalente funcional de operaciones de muestreo descendente y de filtrado de paso alto utilizando una serie de operaciones de interpolación, remuestreo, diezmado, etc. Una implementación de este tipo puede ser más fácil de diseñar y/o puede permitir la reutilización de bloques funcionales de lógica y/o código. Por ejemplo, puede utilizarse el mismo bloque funcional para realizar las operaciones de diezmado a 14 kHz y de diezmado a 7 kHz tal y como se muestra en la Figura 4c. La operación de inversión espectral puede implementarse multiplicando la señal con la función o la secuencia (-1)^{n}, cuyos valores alternan entre +1 y -1. La operación de conformación espectral puede implementarse como un filtro paso bajo configurado para conformar la señal para obtener una respuesta de filtro global deseada.
Las Figuras 33, 34a, 34b y 35a muestran respuestas de frecuencia y de impulso de ejemplos de implementación de, respectivamente, el filtro paso bajo, la interpolación a 34 kHz, el remuestreo a 28 kHz y el diezmado a 14 kHz mostrados en la Figura 4c. La Figura 35b muestra respuestas combinadas de frecuencia y de impulso de las implementaciones de la interpolación a 34 kHz, el remuestreo a 28 kHz y el diezmado a 14 kHz. Las Figuras 36a y 36b muestran respuestas de frecuencia y de impulso de ejemplos de implementación de, respectivamente, el diezmado a 7 Hz y la operación de conformación espectral mostrados en la Figura 4c.
Debe observarse que como consecuencia de la operación de inversión espectral, el espectro de la señal S30 de banda alta se invierte. Operaciones posteriores en el codificador y en el descodificador correspondiente pueden configurarse consecuentemente. Por ejemplo, el generador A300 de excitación de banda descrito en este documento puede configurarse para generar una señal S120 de excitación de banda alta que también presente una forma invertida espectralmente.
La Figura 4d muestra un diagrama de bloques de una implementación B124 del banco B122 de filtros que realiza un equivalente funcional de operaciones de muestreo ascendente y de filtrado de paso alto utilizando una serie de operaciones de interpolación, remuestreo, etc. El banco B124 de filtros incluye una operación de inversión espectral en la banda alta que invierte una operación similar a la realizada, por ejemplo, en un banco de filtros del codificador tal como el banco A114 de filtros. En este ejemplo particular, el banco B124 de filtros también incluye filtros de muesca en la banda baja y en la banda alta que atenúan una componente de la señal a 7100 Hz, aunque tales filtros son opcionales y no es necesario que estén incluidos.
Las Figuras 37a y 37b muestran respuestas de frecuencia y de impulso de ejemplos de implementación de, respectivamente, el filtro paso bajo y el filtro de muesca de banda baja mostrados en la Figura 4d. Las Figuras 38a, 38b, 39a y 39b muestran respuestas de frecuencia y de impulso de ejemplos de implementación de, respectivamente, la interpolación a 14 kHz, la interpolación a 28 kHz, el remuestreo a 16 kHz y el filtro de muesca de banda alta mostrados en la Figura 4d.
El codificador A120 de banda estrecha está implementado según un modelo de filtro fuente que codifica la señal de voz de entrada como (A) un conjunto de parámetros que describe un filtro y (B) una señal de excitación que activa al filtro descrito para generar una reproducción sintetizada de la señal de voz de entrada. La Figura 5a muestra un ejemplo de una envolvente espectral de una señal de voz. Los picos que caracterizan esta envolvente espectral representan resonancias del tracto vocal y se denominan formantes. La mayoría de codificadores de voz codifican al menos esta estructura espectral aproximada como un conjunto de parámetros tales como coeficientes de filtro.
La Figura 5b muestra un ejemplo de una disposición básica de filtro fuente aplicada a la codificación de la envolvente espectral de la señal S20 de banda estrecha. Un módulo de análisis calcula un conjunto de parámetros que caracteriza a un filtro correspondiente al sonido de voz durante un periodo de tiempo (normalmente 20 ms). Un filtro blanqueador (también denominado como filtro de análisis o de error de predicción) configurado según esos parámetros de filtro elimina la envolvente espectral para aplanar espectralmente la señal. La señal blanqueada resultante (también denominada como señal residual) tiene menos energía y, por lo tanto, menos varianza y es más fácil de codificar que la señal de voz original. Los errores generados por la codificación de la señal residual también pueden distribuirse de manera más homogénea a través del espectro. Los parámetros de filtro y la señal residual se cuantifican normalmente para su transmisión eficaz a través del canal. En el descodificador, un filtro de síntesis configurado según los parámetros de filtro se excita mediante una señal basada en la señal residual para generar una versión sintetizada del sonido de voz original. El filtro de síntesis está configurado normalmente para presentar una función de transferencia que sea la inversa de la función de transferencia del filtro blanqueador.
La Figura 6 muestra un diagrama de bloques de una implementación A122 básica del codificador A120 de banda estrecha. En este ejemplo, un módulo 210 de análisis de codificación por predicción lineal (LPC) codifica la envolvente espectral de la señal S20 de banda estrecha como un conjunto de coeficientes de predicción lineal (LP) (por ejemplo, coeficientes de un filtro todo polos 1/A(z)). El módulo de análisis procesa normalmente la señal de entrada como una serie de tramas no solapadas, con un nuevo conjunto de coeficientes que se calculan para cada trama. El periodo de trama es generalmente un periodo sobre el que puede esperarse que la señal sea localmente estacionaria; un ejemplo común es 20 milisegundos (equivalente a 160 muestras a una tasa de muestreo de 8 kHz). En un ejemplo, el módulo 210 de análisis LPC está configurado para calcular un conjunto de diez coeficientes de filtro LP para caracterizar la estructura de formante de cada trama de 20 milisegundos. También es posible implementar el módulo de análisis para procesar la señal de entrada como una serie de tramas solapadas.
El módulo de análisis puede configurarse para analizar directamente las muestras de cada trama, o las muestras pueden ponderarse primero según una función de división en ventanas (por ejemplo, una ventana de Hamming). El análisis también puede realizarse sobre una ventana que sea más larga que la trama, tal como una ventana de 30 ms. Esta ventana puede ser simétrica (por ejemplo, 5-20-5, de manera que incluya los 5 milisegundos inmediatamente antes y después de la trama de 20 milisegundos) o asimétrica (por ejemplo, 10-20, de manera que incluya los últimos 10 milisegundos de la trama anterior). Un módulo de análisis LPC está configurado normalmente para calcular los coeficientes de filtro LP utilizando la recursividad de Levinson-Durbin o el algoritmo de Leroux-Gueguen. En otra implementación, el módulo de análisis puede configurarse para calcular un conjunto de coeficientes cepstrales para cada trama en lugar de un conjunto de coeficientes de filtro LP.
La velocidad de salida del codificador A120 puede reducirse significativamente, sin afectar demasiado a la calidad de reproducción, cuantificando los parámetros de filtro. Los coeficientes de filtro de predicción lineal son difíciles de cuantificar eficazmente y normalmente se correlacionan en otra representación, tal como pares espectrales lineales (LSP) o frecuencias espectrales lineales (LSF), para la cuantificación y/o la codificación por entropía. En el ejemplo de la Figura 6, la transformada 220 de coeficientes de filtro LP a LSF transforma el conjunto de coeficientes de filtro LP en un conjunto correspondiente de LSF. Otras representaciones biunívocas de coeficientes de filtro LP incluyen coeficientes parcor, valores del logaritmo de relación de área, pares espectrales de inmitancia (ISP) y frecuencias espectrales de inmitancia (ISF), que se utilizan en el códec AMR-WB (banda ancha adaptable a múltiples velocidades) de GSM (sistema global para comunicaciones móviles). Normalmente, una transformada entre un conjunto de coeficientes de filtro LP y un conjunto correspondiente de LSF es reversible, pero las realizaciones también incluyen implementaciones del codificador A120 en las que la transformada no es reversible sin errores.
El cuantificador 230 está configurado para cuantificar el conjunto de LSF de banda estrecha (u otra representación de coeficientes), y el codificador A122 de banda estrecha está configurado para transmitir el resultado de esta cuantificación como los parámetros S40 de filtro de banda estrecha. Un cuantificador de este tipo incluye normalmente un cuantificador vectorial que codifica el vector de entrada como un índice a una entrada vectorial correspondiente de una tabla o libro de códigos.
Tal y como se observa en la Figura 6, el codificador A122 de banda estrecha también genera una señal residual haciendo pasar la señal S20 de banda estrecha a través de un filtro 260 blanqueador (también denominado como filtro de análisis o de error de predicción) que está configurado según el conjunto de coeficientes de filtro. En este ejemplo particular, el filtro 260 blanqueador está implementado como un filtro FIR, aunque también pueden utilizarse implementaciones IIR. Esta señal residual contendrá normalmente información perceptualmente importante de la trama de voz, tal como una estructura de larga duración relacionada con el tono, que no está representada en los parámetros S40 de filtro de banda estrecha. El cuantificador 270 está configurado para calcular una representación cuantificada de esta señal residual para transmitirse como una señal S50 de excitación de banda estrecha codificada. Un cuantificador de este tipo incluye normalmente un cuantificador vectorial que codifica el vector de entrada como un índice a una entrada de vector correspondiente de una tabla o libro de códigos. Como alternativa, un cuantificador de este tipo puede configurarse para enviar uno o más parámetros a partir de los cuales el vector puede generarse dinámicamente en el descodificador, en lugar de recuperarse de un medio de almacenamiento, como en un procedimiento de libro de códigos disperso. Un procedimiento de este tipo se utiliza en esquemas de codificación tales como CELP (predicción lineal de excitación por libro de códigos) algebraica y códecs tales como EVRC (códec de velocidad variable mejorado) del 3GPP2 (segundo proyecto de colaboración de tercera generación).
Es deseable que el codificador A120 de banda estrecha genere la señal de excitación de banda estrecha codificada según los mismos valores de parámetro que estarán disponibles para el descodificador de banda estrecha correspondiente. De esta manera, la señal de excitación de banda estrecha codificada resultante ya puede soportar, hasta cierto punto, imprecisiones en esos valores de parámetros, tales como errores de cuantificación. Por consiguiente, es deseable configurar el filtro blanqueador utilizando los mismos valores de coeficiente que estarán disponibles en el descodificador. En el ejemplo básico del codificador A122 mostrado en la Figura 6, un cuantificador 240 inverso descuantifica los parámetros S40 de codificación de banda estrecha, una transformada 250 de ISF a coeficientes de filtro LP correlaciona los valores resultantes con un conjunto correspondiente de coeficientes de filtro LP, y este conjunto de coeficientes se utiliza para configurar un filtro 260 blanqueador para generar la señal residual que se cuantifica mediante un cuantificador 270.
Algunas implementaciones del codificador A120 de banda estrecha están configuradas para calcular la señal S50 de excitación de banda estrecha codificada identificando un vector de libro de códigos de un conjunto de vectores de libro de códigos que se ajuste mejor a la señal residual. Sin embargo, debe observarse que el codificador A120 de banda estrecha también puede implementarse para calcular una representación cuantificada de la señal residual sin generar realmente la señal residual. Por ejemplo, el codificador A120 de banda estrecha puede configurarse para utilizar una pluralidad de vectores de libro de códigos para generar señales sintetizadas correspondientes (por ejemplo, según un conjunto actual de parámetros de filtro), y para seleccionar el vector de libro de códigos asociado a la señal generada que se ajuste mejor a las señal S20 de banda estrecha original en un dominio ponderado de manera perceptual.
La Figura 7 muestra un diagrama de bloques de una implementación B112 del descodificador B110 de banda estrecha. Un cuantificador 310 inverso descuantifica los parámetros S40 de filtro de banda estrecha (en este caso, a un conjunto de LSF), y una transformada 320 de LSF a coeficientes de filtro de LP transforma las LSF en un conjunto de coeficientes de filtro (por ejemplo, tal y como se ha descrito anteriormente con referencia al cuantificador 240 inverso y a la transformada 250 del codificador A122 de banda estrecha). El cuantificador 340 inverso descuantifica la señal 550 de excitación de banda estrecha para generar una señal S80 de excitación de banda estrecha. En función de los coeficientes de filtro y de la señal S80 de excitación de banda estrecha, un filtro 330 de síntesis de banda estrecha sintetiza la señal S90 de banda estrecha. Dicho de otro modo, el filtro 330 de síntesis de banda estrecha está configurado para conformar de manera espectral la señal S80 de excitación de banda estrecha según los coeficientes de filtro descuantificados para generar la señal S90 de banda estrecha. El descodificador B112 de banda estrecha también proporciona la señal S80 de excitación de banda estrecha al codificador A200 de banda alta, el cual la utiliza para obtener la señal S120 de excitación de banda alta tal descrita en este documento. En algunas implementaciones descritas posteriormente, el descodificador B110 de banda estrecha puede configurarse para proporcionar al descodificador B200 de banda alta información adicional relacionada con la señal de banda estrecha, tal como la inclinación espectral, retardo y ganancia de tono, y modo de voz.
El sistema del codificador A122 de banda estrecha y del descodificador B112 de banda estrecha es un ejemplo básico de un códec de voz de análisis por síntesis. La codificación de predicción lineal excitada por libro de códigos (CELP) es un tipo conocido de codificación de análisis por síntesis, y las implementaciones de tales codificadores pueden llevar a cabo la codificación de forma de onda de la señal residual, incluyendo operaciones tales como la selección de entradas de libros de códigos fijos y adaptativos, operaciones de minimización de errores y/u operaciones de ponderación perceptuales. Otras implementaciones de codificación de análisis por síntesis incluyen codificación de predicción lineal de excitación mixta (MELP), de CELP algebraica (ACELP), de CELP de relajación (RCELP), de excitación por impulsos regulares (RPE), de CELP de múltiples impulsos (MPE) y de predicción lineal excitada por suma vectorial (VSELP). Procedimientos de codificación relacionados incluyen codificación de excitación por múltiples bandas (MBE) y codificación de interpolación de forma de onda de prototipo (PWI). Ejemplos de códecs de voz normalizados de análisis por síntesis incluyen el códec de velocidad total GSM (GSM 06.10) del ETSI (Instituto Europeo de Normas de Telecomunicaciones), el cual utiliza predicción lineal excitada por señal residual (RELP), el códec de velocidad total mejorado GSM (ETSI-GSM 06.60), el codificador normalizado del anexo E del G.729 de 11,8 kb/s de la ITU (Unión Internacional de Telecomunicaciones), códecs IS-641 (norma provisional) para IS-136 (un esquema de acceso múltiple por división de tiempo); los códecs GSM adaptables a múltiples velocidades (GSM-AMR); y el códec 4GV^{TM} (vocodificador^{TM} de cuarta generación) (QUALCOMM Incorporated, San Diego, CA). El codificador A120 de banda estrecha y el descodificador B110 correspondiente pueden implementarse según cualquiera de estas tecnologías o según cualquier otra tecnología de codificación de voz (ya sea conocida o desarrollada en un futuro) que represente una señal de voz como (A) un conjunto de parámetros que describa un filtro y (B) una señal de excitación utilizada para activar el filtro descrito para generar la señal de voz.
Incluso después de que el filtro blanqueador haya eliminado la envolvente espectral aproximada de la señal S20 de banda estrecha, puede haber una considerable cantidad de una fina estructura de harmónico, especialmente para voz sonora. La Figura 8a muestra una representación gráfica espectral de un ejemplo de una señal residual, como la que puede generarse por un filtro blanqueador, para una señal sonora tal como una vocal. La estructura periódica visible en este ejemplo está relacionada con el tono, y diferentes sonidos sonoros producidos por el mismo hablante pueden tener diferentes estructuras de formante pero estructuras de tono similares. La Figura 8b muestra una representación gráfica en el dominio de tiempo de un ejemplo de una señal residual de este tipo que muestra una secuencia de impulsos de tono en el tiempo.
La eficacia de codificación y/o la calidad de la voz pueden aumentarse utilizando uno o más valores de parámetro para codificar las características de la estructura de tono. Una característica importante de la estructura de tono es la frecuencia del primer harmónico (también denominada como frecuencia fundamental), que está normalmente en el intervalo de 60 a 400 Hz. Esta característica se codifica normalmente como la inversa de la frecuencia fundamental, denominada también desfase de tono. El desfase de tono indica el número de muestras de un periodo de tono y puede codificarse como uno o más índices de libro de código. Las señales de voz de los hombres tienden a tener mayores retardos de tono que las señales de voz de las mujeres.
Otra característica de señal relacionada con la estructura de tono es la periodicidad, la cual indica la intensidad de la estructura de harmónico o, dicho de otro modo, el grado en que la señal es harmónica o no harmónica. Dos indicadores típicos de la periodicidad son los cruces por cero y las funciones de autocorrelación normalizada (NACF). La periodicidad también puede indicarse mediante la ganancia de tono, la cual se codifica normalmente como una ganancia de libro de códigos (por ejemplo, una ganancia cuantificada de libro de códigos adaptativo).
El codificador A120 de banda estrecha puede incluir uno o más módulos configurados para codificar la estructura de harmónico de larga duración de la señal S20 de banda estrecha. Tal y como se muestra en la Figura 9, un paradigma CELP típico que puede utilizarse incluye un módulo de análisis LPC de bucle abierto, el cual codifica las características de corta duración de la envolvente espectral aproximada, seguido por una etapa de análisis de predicción a largo plazo de bucle cerrado que codifica la fina estructura de tono o de harmónico. Las características de corta duración se codifican como coeficientes de filtro, y las características de larga duración se codifican como valores para parámetros tales como el desfase de tono y la ganancia de tono. Por ejemplo, el codificador A120 de banda estrecha puede configurarse para transmitir la señal S50 de excitación estrecha codificada en un forma que incluya uno o más índices de libro de códigos (por ejemplo, un índice de libro de códigos fijo y un índice de libro de códigos adaptativo) y valores de ganancia correspondientes. El cálculo de esta representación cuantificada de la señal residual de banda estrecha (por ejemplo, mediante el cuantificador 270), puede incluir seleccionar tales índices y calcular tales valores. La codificación de la estructura de tono también puede incluir interpolación de una forma de onda de prototipo de tono, operación que puede incluir calcular una diferencia entre impulsos de tono sucesivos. La modelización de la estructura de larga duración puede inhabilitarse para tramas correspondientes a voz sorda, que normalmente es similar al ruido y no está estructurada.
Una implementación del descodificador B110 de banda estrecha según un paradigma como el mostrado en la Figura 9 puede configurarse para transmitir la señal S80 de excitación de banda estrecha al descodificador B200 de banda alta después de que la estructura de larga duración (estructura de tono o de harmónico) se haya restablecido. Por ejemplo, un descodificador de este tipo puede configurarse para transmitir la señal S80 de excitación de banda estrecha como una versión descuantificada de la señal S50 de excitación de banda estrecha codificada. Por supuesto, también es posible implementar el descodificador B110 de banda estrecha de manera que el descodificador B200 de banda alta realice la descuantificación de la señal S50 de excitación de banda estrecha codificada para obtener la señal S80 de excitación de banda estrecha.
En una implementación del codificador A100 de voz de banda ancha según un paradigma como el mostrado en la Figura 9, el codificador A200 de banda alta puede configurarse para recibir la señal de excitación de banda estrecha generada por el análisis a corto plazo o por el filtro blanqueador. Dicho de otro modo, el codificador A120 de banda estrecha puede configurarse para transmitir la señal de excitación de banda estrecha al codificador A200 de banda alta antes de codificar la estructura de larga duración. Sin embargo, es deseable que el codificador A200 de banda alta reciba del canal de banda estrecha la misma información de codificación que se recibirá mediante el descodificador B200 de banda alta, de manera que los parámetros de codificación generados por el codificador A200 de banda alta ya puedan soportar hasta cierto punto imprecisiones en esa información. Por lo tanto, puede ser preferible que el codificador A200 de banda alta reconstruya la señal S80 de excitación de banda estrecha a partir de la misma señal S50 de excitación de banda estrecha codificada cuantificada y/o parametrizada que se transmitirá por el codificador A100 de voz de banda ancha. Una ventaja potencial de este enfoque es un cálculo más preciso de los factores S60b de ganancia de banda alta que se describirán posteriormente.
Además de los parámetros que caracterizan la estructura de corta duración y/o de larga duración de la señal S20 de banda estrecha, el codificador A120 de banda estrecha puede generar valores de parámetro que se refieren a otras características de la señal S20 de banda estrecha. Estos valores, que pueden cuantificarse de manera adecuada para su transmisión mediante el codificador A100 de voz de banda ancha, pueden incluirse entre los parámetros S40 de filtro de banda estrecha o transmitirse por separado. El codificador A200 de banda alta también puede estar configurado para calcular los parámetros S60 de codificación de banda alta según uno o más de estos parámetros adicionales (por ejemplo, después de la descuantificación). En el descodificador B100 de voz de banda ancha, el descodificador B200 de banda alta puede configurarse para recibir los valores de parámetro a través del descodificador B110 de banda estrecha (por ejemplo, después de la descuantificación). Como alternativa, el descodificador B200 de banda alta puede configurarse para recibir (y posiblemente para descuantificar) los valores de parámetro directamente.
En un ejemplo de parámetros de codificación de banda estrecha adicionales, el codificador A120 de banda estrecha genera valores de inclinación espectral y de parámetros de modo de voz para cada trama. La inclinación espectral se refiere a la forma de la envolvente espectral sobre la banda de paso y se representa normalmente por el primer coeficiente de reflexión cuantificado. Para la mayoría de sonidos sonoros, la energía espectral disminuye con frecuencias crecientes, de manera que el primer coeficiente de reflexión es negativo y puede aproximarse a -1. La mayoría de sonidos sordos tienen un espectro que es o bien plano, de manera que el primer coeficiente de reflexión vale casi cero, o bien tiene más energía a altas frecuencias, de manera que el primer coeficiente de reflexión es positivo y puede aproximarse a +1.
El modo de voz (también denominado como modo de sonoridad) indica si la trama actual representa voz sonora o sorda. Este parámetro puede tener un valor binario en función de una o más medidas de periodicidad (por ejemplo, cruces por cero, NACF, ganancia de tono) y/o actividad de voz para la trama, tal como una relación entre una medida de este tipo y un valor de umbral. En otras implementaciones, el parámetro de modo de voz tiene uno o más estados diferentes para indicar modos tales como silencio o ruido de fondo, o una transición entre silencio y voz sonora.
El codificador A200 de banda alta está configurado para codificar la señal S30 de banda alta según un modelo de filtro fuente, basándose la excitación de este filtro en la señal de excitación de banda estrecha codificada. La Figura 10 muestra un diagrama de bloques de una implementación A202 del codificador A200 de banda alta que está configurada para generar un flujo de parámetros S60 de codificación de banda alta que incluye parámetros S60a de filtro de banda alta y factores S60b de ganancia de banda alta. El generador A300 de excitación de banda alta obtiene una señal S120 de excitación de banda alta a partir de la señal S50 de excitación de banda estrecha codificada. Un módulo A210 de análisis genera un conjunto de valores de parámetro que caracteriza a la envolvente espectral de la señal S30 de banda alta. En este ejemplo particular, un módulo A210 de análisis está configurado para realizar un análisis LPC para generar un conjunto de coeficientes de filtro LP para cada trama de la señal S30 de banda alta. Una transformada 410 de coeficientes de filtro de predicción lineal a LSF transforma el conjunto de coeficientes de filtro LP en un conjunto correspondiente de LSF. Tal y como se ha indicado anteriormente con referencia al módulo 210 de análisis y a la transformada 220, el módulo A210 de análisis y/o la transformada 410 pueden configurarse para utilizar otros conjuntos de coeficientes (por ejemplo, coeficientes cepstrales) y/o representaciones de coeficientes (por ejemplo, ISP).
Un cuantificador 420 está configurado para cuantificar el conjunto de LSF de banda alta (u otra representación de coeficientes, tal como ISP), y un codificador A202 de banda alta está configurado para transmitir el resultado de esta cuantificación como los parámetros S60a de filtro de banda alta. Un cuantificador de este tipo incluye normalmente un cuantificador vectorial que codifica el vector de entrada como un índice a una entrada de vector correspondiente de una tabla o libro de códigos.
El codificador A202 de banda alta también incluye un filtro A220 de síntesis configurado para generar una señal S130 de banda alta sintetizada según la señal S120 de excitación de banda alta y la envolvente espectral codificada (por ejemplo, el conjunto de coeficientes de filtro LP) generada por el módulo A210 de análisis. El filtro A220 de síntesis está implementado normalmente como un filtro IIR, aunque también pueden usarse implementaciones FIR. En un ejemplo particular, el filtro A220 de síntesis está implementado como un filtro autorregresivo lineal de sexto orden.
Un calculador A230 de factor de ganancia de banda alta calcula una o más diferencias entre los niveles de la señal S30 de banda alta original y la señal S130 de banda alta sintetizada para especificar una envolvente de ganancia para la trama. El cuantificador 430, que puede implementarse como un cuantificador vectorial que codifica el vector de entrada como un índice a una entrada de vector correspondiente de una tabla o libro de códigos, cuantifica el valor o valores que especifican la envolvente de ganancia, y el codificador A202 de banda alta está configurado para transmitir el resultado de esta cuantificación como factores S60b de ganancia de banda alta.
En una implementación como la mostrada en la Figura 10, el filtro A220 de síntesis está dispuesto para recibir los coeficientes de filtro del módulo A210 de análisis. Una implementación alternativa del codificador A202 de banda alta incluye un cuantificador inverso y una transformada inversa configurados para descodificar los coeficientes de filtro de los parámetros S60a de filtro de banda alta y, en este caso, el filtro A220 de síntesis está dispuesto en cambio para recibir los coeficientes de filtro descodificados. Una disposición alternativa de este tipo puede soportar un cálculo más preciso de la envolvente de ganancia mediante el calculador A230 de ganancia de banda alta.
En un ejemplo particular, el módulo A210 de análisis y el calculador A230 de ganancia de banda alta transmiten un conjunto de seis LSF y un conjunto de cinco valores de ganancia por trama, respectivamente, de manera que puede conseguirse un ensanchamiento de banda ancha de la señal S20 de banda estrecha solamente con once valores adicionales por trama. El oído tiende a ser menos sensible a los errores de frecuencia a altas frecuencias, de manera que la codificación de banda alta en un orden LPC bajo puede generar una señal que presente una calidad perceptual comparable a la codificación de banda estrecha en un orden LPC superior. Una implementación típica del codificador A200 de banda alta puede configurarse para transmitir entre 8 y 12 bits por trama para una reconstrucción de alta calidad de la envolvente espectral y entre 8 y 12 bits adicionales por trama para una reconstrucción de alta calidad de la envolvente temporal. En otro ejemplo particular, el módulo A210 de análisis transmite un conjunto de ocho LSF por trama.
Algunas implementaciones del codificador A200 de banda alta están configuradas para generar la señal S120 de excitación de banda alta generando una señal de ruido aleatorio que presenta componentes de frecuencia de banda alta y modulando en amplitud la señal de ruido según la envolvente de dominio de tiempo de la señal S20 de banda estrecha, de la señal S80 de excitación de banda estrecha o de la señal S30 de banda alta. Aunque un procedimiento de este tipo basado en ruido puede generar resultados adecuados para sonidos sordos, puede no ser deseable para sonidos sonoros, cuyas señales residuales son normalmente harmónicas y, por consiguiente, presentan alguna estructura periódica.
El generador A300 de excitación de banda alta está configurado para generar la señal S120 de excitación de banda alta ensanchado el espectro de la señal S80 de excitación de banda estrecha en el intervalo de frecuencias de banda alta. La Figura 11 muestra un diagrama de bloques de una implementación A302 del generador A300 de excitación de banda alta. Un cuantificador 450 inverso está configurado para descuantificar la señal S50 de excitación de banda estrecha codificada para generar la señal S80 de excitación de banda estrecha. Un ensanchador A400 de espectro está configurado para generar una señal S160 ensanchada de manera armónica en función de la señal S80 de excitación de banda estrecha. Un combinador 470 está configurado para combinar una señal de ruido aleatorio generada por un generador 480 de ruido y una envolvente de dominio de tiempo calculada por un calculador 460 de envolvente para generar una señal S170 de ruido modulada. Un combinador 490 está configurado para mezclar la señal S160 ensanchada de manera harmónica y la señal S170 de ruido modulada para generar la señal S120 de excitación de banda alta.
En un ejemplo, el ensanchador A400 de espectro está configurado para realizar una operación de plegado espectral (también denominada como reflexión) en la señal S80 de excitación de banda estrecha para generar la señal S160 ensanchada de manera armónica. El plegado espectral puede llevarse a cabo rellenando con ceros la señal S80 de excitación y aplicando después un filtro paso alto para mantener la superposición. En otro ejemplo, el ensanchador A400 de espectro está configurado para generar la señal S160 ensanchada de manera armónica trasladando de manera espectral la señal S80 de señal de excitación de banda estrecha hacia la banda alta (por ejemplo, mediante un muestreo ascendente seguido de una multiplicación por una señal de coseno de frecuencia constante).
Los procedimientos de traslación y de plegado espectral pueden generar señales ensanchadas de manera espectral cuya estructura armónica es discontinua con la estructura armónica original de la señal S80 de excitación de banda estrecha en fase y/o frecuencia. Por ejemplo, tales procedimientos pueden generar señales que presenten picos que no estén situados generalmente en múltiplos de la frecuencia fundamental, lo que puede provocar artefactos de sonido metálico en la señal de voz reconstruida. Estos procedimientos también tienden a generar armónicos de alta frecuencia que presentan características tonales extrañamente fuertes. Además, puesto que una señal PSTN puede muestrearse a 8 kHz pero limitarse en banda a no más de 3400 Hz, el espectro superior de la señal S80 de excitación de banda estrecha puede contener poca o ninguna energía, de manera que una señal ensanchada generada según una operación de plegado espectral o de traslación espectral puede presentar un agujero espectral por encima de 3400 Hz.
Otros procedimientos de generación de la señal S160 ensanchada de manera armónica incluyen identificar una o más frecuencias fundamentales de la señal S80 de excitación de banda estrecha y generar tonos de armónico según esa información. Por ejemplo, la estructura armónica de una señal de excitación puede caracterizarse por la frecuencia fundamental junto con información de amplitud y de fase. Otra implementación del generador A300 de excitación de banda alta genera una señal S160 ensanchada de manera armónica en función de la frecuencia fundamental y de la amplitud (según se indica, por ejemplo, por el desfase de tono y la ganancia de tono). A no ser que la señal ensanchada de manera armónica sea coherente en fase con la señal S80 de excitación de banda estrecha, la calidad de la voz descodificada resultante puede no ser aceptable.
Puede utilizarse una función no lineal para crear una señal de excitación de banda alta que sea coherente en fase con la excitación de banda estrecha y que conserve la estructura armónica sin discontinuidad de fase. Una función no lineal también puede proporcionar un mayor nivel de ruido entre los armónicos de alta frecuencia, lo que tiende a sonar más natural que los armónicos de alta frecuencia tonales generados por procedimientos tales como el plegado espectral y la traslación espectral. Funciones típicas no lineales sin memoria que pueden aplicarse mediante varias implementaciones del ensanchador A400 de espectro incluyen la función de valor absoluto (también denominada como rectificación de onda completa), rectificación de media onda, elevación al cuadrado, elevación al cubo y truncamiento. Otras implementaciones del ensanchador A400 de espectro pueden configurarse para aplicar una función no lineal que tenga memoria.
La Figura 12 es un diagrama de bloques de una implementación A402 del ensanchador A400 de espectro que está configurada para aplicar una función no lineal para ensanchar el espectro de la señal S80 de excitación de banda estrecha. Un muestreador 510 ascendente está configurado para muestrear de manera ascendente la señal S80 de excitación de banda estrecha. Puede ser deseable muestrear de manera ascendente la señal lo suficiente como para minimizar la superposición tras la aplicación de la función no lineal. En un ejemplo particular, el muestreador 510 ascendente muestra de manera ascendente la señal por un factor de ocho. El muestreador 510 ascendente puede configurarse para realizar la operación de muestreo ascendente rellenando con ceros la señal de entrada y filtrando mediante paso bajo el resultado. Un calculador 520 de función no lineal está configurado para aplicar una función no lineal a la señal muestreada de manera ascendente. Una ventaja potencial de la función de valor absoluto sobre otras funciones no lineales de ensanchamiento espectral, tales como la elevación al cuadrado, es que la normalización de energía no es necesaria. En algunas implementaciones, la función de valor absoluto puede aplicarse de manera eficaz suprimiendo o eliminando el bit de signo de cada muestra. El calculador 520 de función no lineal también puede configurarse para realizar una distorsión de amplitud de la señal muestreada de manera ascendente o ensanchada de manera espectral.
Un muestreador 530 descendente está configurado para muestrear de manera descendente el resultado, ensanchado de manera espectral, de aplicar la función no lineal. Puede ser deseable que el muestreador 530 descendente realice una operación de filtrado de paso de banda para seleccionar una banda de frecuencia deseada de la señal ensanchada de manera espectral antes de reducir la tasa de muestreo (por ejemplo, para reducir o evitar la superposición o la corrupción mediante una imagen no deseada). También puede ser deseable que el muestreador 530 descendente reduzca la tasa de muestreo en más de una etapa.
La Figura 12a es un diagrama que muestra los espectros de señal en varios puntos en un ejemplo de una operación de ensanchamiento espectral, donde la escala de frecuencia es la misma en todas las representaciones gráficas. La representación gráfica (a) muestra el espectro de un ejemplo de la señal S80 de excitación de banda estrecha. La representación gráfica (b) muestra el espectro después de que la señal S80 se haya muestreado de manera ascendente por un factor de ocho. La representación gráfica (c) muestra un ejemplo del espectro ensanchado después de la aplicación de una función no lineal. La representación gráfica (d) muestra el espectro después de un filtrado de paso bajo. En este ejemplo, la banda de paso se ensancha hasta el límite de frecuencia superior de la señal S30 de banda alta (por ejemplo, 7 kHz u 8 kHz).
La representación gráfica (e) muestra el espectro después de una primera etapa de muestreo descendente, en la que la tasa de muestreo se reduce por un factor de cuatro para obtener una señal de banda ancha. La representación gráfica (f) muestra el espectro después de una operación de filtrado de paso alto para seleccionar la parte de banda alta de la señal ensanchada, y la representación gráfica (g) muestra el espectro después de una segunda etapa de muestreo descendente, en la que la tasa de muestreo se reduce por un factor de dos. En un ejemplo particular, el muestreador 530 descendente realiza el filtrado de paso alto y la segunda etapa de muestreo descendente haciendo pasar la señal de banda ancha a través del filtro 130 paso alto y del muestreador 140 descendente del banco A112 de filtros (o de otras estructuras o rutinas que tengan la misma respuesta) para generar una señal ensanchada de manera espectral que presente el intervalo de frecuencias y la tasa de muestreo de la señal S30 de banda alta.
Como puede observarse en la representación gráfica (g), el muestreo descendente de la señal de paso alto mostrada en la representación gráfica (f) provoca la inversión de su espectro. En este ejemplo, el muestreador 530 descendente también está configurado para realizar una operación de inversión espectral en la señal. La representación gráfica (h) muestra un resultado de la aplicación de la operación de inversión espectral, la cual puede realizarse multiplicando la señal por la función o por la secuencia (-1)^{n}, cuyos valores alternan entre +1 y -1. Una operación de este tipo es equivalente a desplazar el espectro digital de la señal en el dominio de frecuencia en un distancia de. Debe observarse que también puede obtenerse el mismo resultado aplicando las operaciones de muestreo descendente y de inversión espectral. Las operaciones de muestreo ascendente y/o de muestreo descendente también pueden configurase para incluir remuestreo para obtener una señal ensanchada de manera espectral que presente la tasa de muestreo de la señal S30 de banda alta (por ejemplo, 7 kHz).
Tal y como se ha indicado anteriormente, los bancos A110 y B120 de filtros pueden implementarse de manera que una o ambas señales S20, S30 de banda estrecha y de banda alta presente(n) una forma invertida de manera espectral en la salida del banco A110 de filtros, se codifique(n) y se descodifique(n) en la forma invertida de manera espectral y se invierta(n) de nuevo de manera espectral en el banco B120 de filtros antes de transmitirse en la señal S110 de voz de banda ancha. En ese caso, por supuesto, una operación de inversión espectral como la mostrada en la Figura 12a no sería necesaria ya que sería deseable que la señal S120 de excitación de banda alta también presentase una forma invertida de manera espectral.
Las diversas tareas de muestreo ascendente y de muestreo descendente de una operación de ensanchamiento espectral como la realizada por el ensanchador A402 de espectro pueden configurarse y disponerse de muchas maneras diferentes. Por ejemplo, la Figura 12b es un diagrama que muestra los espectros de señal en varios puntos en otro ejemplo de una operación de extensión espectral, donde la escala de frecuencia es la misma en todas las representaciones gráficas. La representación gráfica (a) muestra el espectro de un ejemplo de la señal S80 de excitación de banda estrecha. La representación gráfica (b) muestra el espectro después de que la señal S80 se haya muestreado de manera ascendente por un factor de dos. La representación gráfica (c) muestra un ejemplo del espectro ensanchado después de la aplicación de una función no lineal. En este caso se acepta la superposición que puede producirse en las frecuencias más altas.
La representación gráfica (d) muestra el espectro después de una operación de inversión espectral. La representación gráfica (e) muestra el espectro después de una única etapa de muestreo descendente, en la que la tasa de muestreo se reduce por un factor de dos para obtener la señal ensanchada de manera espectral deseada. En este ejemplo, la señal está en una forma invertida de manera espectral y puede utilizarse en una implementación del codificador A200 de banda alta que procese la señal S30 de banda alta en esta forma.
Es probable que la señal ensanchada de manera espectral generada por el calculador 520 de función no lineal presente una gran disminución de amplitud a medida que aumente la frecuencia. El ensanchador A402 espectral incluye un aplanador 540 espectral configurado para realizar una operación de blanqueo en la señal muestreada de manera descendente. El aplanador 540 espectral puede configurarse para realizar una operación de blanqueo fija o para realizar una operación de blanqueo adaptativa. En un ejemplo particular de blanqueo adaptativo, el aplanador 540 espectral incluye un módulo de análisis LPC configurado para calcular un conjunto de cuatro coeficientes de filtro a partir de la señal muestreada de manera descendente y un filtro de análisis de cuarto orden configurado para blanquear la señal según esos coeficientes. Otras implementaciones del ensanchador A400 de espectro incluyen configuraciones en las que el aplanador 540 espectral actúa en la señal ensanchada de manera espectral antes del muestreador 530 descendente.
El generador A300 de excitación de banda alta puede implementarse para transmitir la señal S160 ensanchada de manera armónica como la señal S120 de excitación de banda alta. Sin embargo, en algunos casos, utilizando solamente una señal ensanchada de manera armónica como la excitación de banda alta puede dar como resultado artefactos audibles. La estructura armónica de la voz es generalmente menos pronunciada en la banda alta que en la banda baja, y la utilización de una estructura demasiado armónica en la señal de excitación de banda alta puede dar como resultado un sonido con zumbidos. Este artefacto puede apreciarse especialmente en señales de voz de mujeres.
Las realizaciones incluyen implementaciones del generador A300 de excitación de banda alta que están configuradas para mezclar la señal S160 ensanchada de manera armónica con una señal de ruido. Tal y como se muestra en la Figura 11, el generador A302 de excitación de banda alta incluye un generador 480 de ruido que está configurado para generar una señal de ruido aleatorio. En un ejemplo, el generador 480 de ruido está configurado para generar una señal de ruido blanco pseudoaletorio de varianza unitaria aunque en otras implementaciones la señal de ruido no necesita ser blanca y puede presentar una densidad de potencia que varíe con la frecuencia. Puede ser deseable que los generadores 480 de ruido estén configurados para transmitir la señal de ruido como una función determinista de manera que su estado pueda duplicarse en el descodificador. Por ejemplo, el generador 480 de ruido puede configurarse para transmitir la señal de ruido como una función determinista de información codificada anteriormente dentro de la misma trama, tal como los parámetros S40 de filtro de banda estrecha y/o la señal S50 de excitación de banda estrecha codificada.
Antes de mezclarse con la señal S160 ensanchada de manera armónica, la señal de ruido aleatorio generada por el generador 480 de ruido puede modularse en amplitud para presentar una envolvente de dominio de tiempo que aproxime la distribución de energía en el tiempo de la señal S20 de banda estrecha, de la señal S30 de banda alta, de la señal S80 de excitación de banda estrecha o de la señal S160 ensanchada de manera armónica. Tal y como se muestra en la Figura 11, el generador A302 de excitación de banda alta incluye un combinador 470 configurado para modular en amplitud la señal de ruido generada por el generador 480 de ruido según una envolvente de dominio de tiempo calculada por el calculador 460 de envolvente. Por ejemplo, el combinador 470 puede implementarse como un multiplicador dispuesto para escalar la salida del generador 480 de ruido según la envolvente de dominio de tiempo calculada por el calculador 460 de envolvente para generar la señal S170 de ruido modulada.
En una implementación A304 del generador A302 de excitación de banda alta, como la mostrada en el diagrama de bloques de la Figura 13, el calculador 460 de envolvente está dispuesto para calcular la envolvente de la señal S160 ensanchada de manera armónica. En una implementación A306 del generador A302 de excitación de banda alta, como la mostrada en el diagrama de bloques de la Figura 14, el calculador 460 de envolvente está dispuesto para calcular la envolvente de la señal S80 de excitación de banda estrecha. Implementaciones adicionales del generador A302 de excitación de banda alta pueden configurarse de otro modo para añadir ruido a la señal S160 ensanchada de manera armónica según las posiciones de los impulsos de tono de banda estrecha en el tiempo.
El calculador 460 de envolvente puede configurarse para realizar un cálculo de envolvente como una tarea que incluya una serie de subtareas. La Figura 15 muestra un diagrama de flujo de un ejemplo T100 de una tarea de este tipo. La subtarea T110 calcula el cuadrado de cada muestra de la trama de la señal cuya envolvente va a modelarse (por ejemplo, la señal S80 de excitación de banda estrecha o la señal S160 ensanchada de manera armónica) para generar una secuencia de valores al cuadrado. La subtarea T120 realiza una operación de suavizado en la secuencia de valores al cuadrado. En un ejemplo, la subtarea T120 aplica un filtro paso bajo IIR de primer orden a la secuencia según la expresión
100
donde x es la entrada del filtro, y es la salida del filtro, n es un índice de dominio de tiempo, y a es un coeficiente de suavizado que presenta un valor entre 0,5 y 1. El valor del coeficiente de suavizado a puede ser fijo o, en una implementación alternativa, puede ser adaptativo según una indicación de ruido en la señal de entrada, de manera que a está más cerca de 1 en ausencia de ruido y más cercano a 0,5 en presencia de ruido. La subtarea T130 aplica una función de raíz cuadrada a cada muestra de la secuencia suavizada para generar la envolvente de dominio de tiempo.
Una implementación de este tipo del calculador 460 de envolvente puede configurarse para realizar las diversas subtareas de la tarea T100 en serie y/o en paralelo. En implementaciones adicionales de la tarea T100, la subtarea T110 puede estar precedida por una operación de paso banda configurada para seleccionar una parte de frecuencia deseada de la señal cuya envolvente va a modelarse, tal como el intervalo de 3 a 4 kHz.
El combinador 490 está configurado para mezclar la señal S160 ensanchada de manera armónica y la señal S170 de ruido modulada para generar la señal S120 de excitación de banda alta. Implementaciones del combinador 490 pueden configurarse, por ejemplo, para calcular la señal S120 de excitación de banda alta como una suma de la señal S160 ensanchada de manera armónica y la señal S170 de ruido modulada. Una implementación de este tipo del combinador 490 puede configurarse para calcular la señal S120 de excitación de banda alta como una suma ponderada aplicando un factor de ponderación a la señal S160 ensanchada de manera armónica y/o a la señal S170 de ruido modulada antes de la suma. Cada factor de ponderación puede calcularse según uno o más criterios y puede ser un valor fijo o, como alternativa, un valor adaptativo que se calcule para cada trama o para cada subtrama.
La Figura 16 muestra un diagrama de bloques de una implementación 492 del combinador 490 que está configurada para calcular la señal S120 de excitación de banda alta como una suma ponderada de la señal S160 ensanchada de manera armónica y la señal S170 de ruido modulada. El combinador 492 está configurado para ponderar la señal S160 ensanchada de manera armónica según un factor S180 de ponderación armónico, para ponderar la señal S170 de ruido modulada según un factor S190 de ponderación de ruido y para transmitir la señal S120 de excitación de banda alta como una suma de las señales ponderadas. En este ejemplo, el combinador 492 incluye un calculador 550 de factor de ponderación que está configurado para calcular el factor S180 de ponderación de armónico y el factor S190 de ponderación de ruido.
El calculador 550 de factor de ponderación puede configurarse para calcular los factores S180 y S190 de ponderación según una relación deseada de contenido de armónico con respecto a contenido de ruido en la señal S120 de excitación de banda alta. Por ejemplo, puede ser deseable que el combinador 492 genere la señal S120 de excitación de banda alta para que presente una relación de energía de armónico con respecto a energía de ruido similar a la de la señal S30 de banda alta. En algunas implementaciones del calculador 550 de factor de ponderación, los factores S180, S190 de ponderación se calculan según uno o más parámetros relacionados con una periodicidad de la señal S20 de banda estrecha o de la señal residual de banda estrecha, tal como la ganancia de tono y/o el modo de voz. Una implementación de este tipo del calculador 550 de factor de ponderación puede configurarse para asignar un valor al factor S180 de ponderación de armónico que sea proporcional a la ganancia de tono, por ejemplo, y/o para asignar un valor más elevado al factor S190 de ponderación de ruido para señales de voz sordas en lugar de para señales de voz sonoras.
En otras implementaciones, el calculador 550 de factor de ponderación está configurado para calcular valores para el factor S180 de ponderación de armónico y/o para el factor S190 de ponderación de ruido según una medida de periodicidad de la señal S30 de banda alta. En un ejemplo de este tipo, el calculador 550 de factor de ponderación calcula el factor S180 de ponderación de armónico como el valor máximo del coeficiente de autocorrelación de la señal S30 de banda alta para la trama o subtramas actuales, donde la autocorrelación se lleva a cabo a través de un intervalo de búsqueda que incluye un retardo de un desfase de tono y que no incluye un retardo de cero muestras. La Figura 17 muestra un ejemplo de tal intervalo de búsqueda de muestras de longitud n que está centrado en torno a un retardo de un desfase de tono y que presenta un ancho no superior a un desfase de tono.
La Figura 17 también muestra un ejemplo de otro enfoque en el que el calculador 550 de factor de ponderación calcula una medida de periodicidad de la señal S30 de banda alta en varias etapas. En una primera etapa, la trama actual se divide en una pluralidad de subtramas, y el retardo para el que el coeficiente de autocorrelación es máximo se identifica por separado para cada subtrama. Tal y como se ha mencionado anteriormente, la autocorrelación se realiza en un intervalo de búsqueda que incluye un retardo de un desfase de tono y que no incluye un retardo de cero muestras.
En una segunda etapa, una trama retardada se construye aplicando el retardo identificado correspondiente a cada subtrama, concatenando las tramas resultantes para construir una trama retardada de manera óptima, y calculando el factor S180 de ponderación de armónico como el coeficiente de correlación entre la trama original y la trama retardada de manera óptima. En una alternativa adicional, el calculador 550 de factor de ponderación calcula el factor S180 de ponderación de armónico como la media de los coeficientes de autocorrelación máximos obtenidos en la primera etapa para cada subtrama. Implementaciones del calculador 550 de factor de ponderación también pueden calcularse para escalar el coeficiente de correlación, y/o para combinarlo con otro valor, para calcular el valor para el factor S180 de ponderación de armónico.
Puede ser deseable que el calculador 550 de factor de ponderación calcule una medida de periodicidad de la señal S30 de banda alta solamente cuando se indique de otro modo una presencia de periodicidad en la trama. Por ejemplo, el calculador 550 de factor de ponderación puede configurarse para calcular una medida de periodicidad de la señal S30 de banda alta según una relación entre otro indicador de periodicidad de la trama actual, tal como la ganancia de tono, y un valor de umbral. En un ejemplo, el calculador 550 de factor de ponderación está configurado para realizar una operación de autocorrelación en la señal S30 de banda alta solamente si la ganancia de tono de la trama (por ejemplo, la ganancia de libro de códigos adaptativo de la señal residual de banda estrecha) tiene un valor superior a 0,5 (como alternativa, de al menos 0,5). En otro ejemplo, el calculador 550 de factor de ponderación está configurado para realizar una operación de autorregulación de la señal S30 de banda alta solamente para tramas que presenten estados particulares de modo de voz (por ejemplo, solamente para señales sonoras). En estos casos, el calculador 550 de factor de ponderación puede configurarse para asignar un factor de ponderación por defecto para tramas que presenten otros estados de modo de voz y/o valores inferiores de ganancia de tono.
Las realizaciones incluyen implementaciones adicionales del calculador 550 de factor de ponderación que están configuradas para calcular factores de ponderación según características distintas de o adicionales a la periodicidad. Por ejemplo, una implementación de este tipo puede configurarse para asignar un valor más elevado al factor S190 de ganancia de ruido para señales de voz que presenten un gran desfase de tono en lugar de para señales de voz que presenten un pequeño desfase de tono. Otra implementación de este tipo del calculador 550 de factor de ponderación está configurada para determinar una medida de armonicidad de la señal S10 de voz de banda ancha, o de la señal S30 de banda alta, según una medida de la energía de la señal en múltiplos de la frecuencia fundamental con respecto a la energía de la señal en otras componentes de frecuencia.
Algunas implementaciones del codificador A100 de voz de banda ancha están configuradas para transmitir una indicación de periodicidad o armonicidad (por ejemplo, una bandera de un bit que indique si la trama es armónica o no armónica) en función de la ganancia de tono y/u otra medida de periodicidad o armonicidad descrita en este documento. En un ejemplo, un descodificador B100 de voz de banda ancha correspondiente utiliza esta indicación para configurar una operación tal como el cálculo de los factores de ponderación. En otro ejemplo, una indicación de este tipo se utiliza en el codificador y/o en el descodificador para calcular un valor para un parámetro de modo de voz.
Puede ser deseable que el generador A302 de excitación de banda alta genere la señal S120 de excitación de banda alta de manera que la energía de la señal de excitación no quede afectada en gran medida por los valores particulares de los factores S180 y S190 de ponderación. En este caso, el calculador 550 de factor de ponderación puede configurarse para calcular un valor para el factor S180 de ponderación de armónico o para el factor S190 de ponderación de ruido (o para recibir un valor de este tipo de un medio de almacenamiento u otro elemento del codificador A200 de banda alta) y para obtener un valor para el otro factor de ponderación según una expresión como la siguiente
101
donde W_{armónico} denota el factor S180 de ponderación de armónico y W_{ruido} denota el factor S190 de ponderación de ruido. Como alternativa, el calculador 550 de factor de ponderación puede configurarse para seleccionar, según un valor de una medida de periodicidad para la trama o subtrama actual, un par correspondiente de entre una pluralidad de pares de factores S180, S190 de ponderación, donde los pares se precalculan para satisfacer una relación de energía constante tal como la expresión (2). Para una implementación del calculador 550 de factor de ponderación en la que se observa la expresión (2), los valores típicos para el factor S180 de ponderación de armónico oscilan entre 0,7 aproximadamente y 1,0 aproximadamente, y los valores típicos para el factor S190 de ponderación de ruido oscilan entre 0,1 aproximadamente y 0,7 aproximadamente. Otras implementaciones del calculador 550 de factor de ponderación pueden configurarse para funcionar según una versión de la expresión (2) que está modificada según una ponderación de línea de base deseada entre la señal S160 ensanchada de manera armónica y la señal S170 de ruido modulada.
Pueden producirse artefactos en una señal de voz sintetizada cuando un libro de códigos disperso (uno cuyas entradas son en gran parte valores de cero) se haya utilizado para calcular la representación cuantificada de la señal residual. La dispersión de libro de códigos se produce especialmente cuando la señal de banda estrecha se codifica a una baja velocidad binaria. Los artefactos producidos por la dispersión de libros de códigos son normalmente cuasiperiódicos en el tiempo y se producen principalmente por encima de 3 kHz. Puesto que el oído humano tiene una mejor resolución de tiempo a frecuencias más altas, estos artefactos pueden apreciarse más en la banda alta.
Las realizaciones incluyen implementaciones del generador A300 de excitación de banda alta que están configuradas para realizar un filtrado de antidispersión. La Figura 18 muestra un diagrama de bloques de una implementación A312 del generador A302 de excitación de banda alta que incluye un filtro 600 de antidispersión dispuesto para filtrar la señal de excitación de banda estrecha descuantificada generada por el cuantificador 450 inverso. La Figura 19 muestra un diagrama de bloques de una implementación A314 del generador A302 de excitación de banda alta que incluye un filtro 600 de antidispersión dispuesto para filtrar la señal ensanchada de manera espectral generada por el ensanchador A400 de espectro. La Figura 20 muestra un diagrama de bloques de una implementación A316 del generador A302 de excitación de banda alta que incluye un filtro 600 de antidispersión dispuesto para filtrar la salida del combinador 490 para generar la señal S120 de excitación de banda alta. Por supuesto, se contemplan implementaciones del generador A300 de excitación de banda alta que combinen las características de cualquiera de las implementaciones A304 y A306 con las características de cualquiera de las implementaciones A312, A314 y A316 y, por lo tanto, se indica de manera expresa. El filtro 600 de antidispersión también puede estar dispuesto dentro del ensanchador A400 de espectro: por ejemplo, después de cualquiera de los elementos 510, 520, 530 y 540 del ensanchador A402 de espectro. Debe observarse expresamente que el filtro 600 de antidispersión también puede usarse con implementaciones del ensanchador A400 de espectro que realicen plegado espectral, traslación espectral o ensanchamiento de armónico.
El filtro 600 de antidispersión puede configurarse para alterar la fase de su señal de entrada. Por ejemplo, puede ser deseable que el filtro 600 de antidispersión esté configurado y dispuesto de manera que la fase de la señal S120 de excitación de banda alta se aleatorice, o se distribuya de otro modo de manera más uniforme, en el tiempo. También puede ser deseable que la respuesta del filtro 600 de antidispersión sea plana de manera espectral, de manera que el espectro de magnitud de la señal filtrada no cambie de manera apreciable. En un ejemplo, el filtro 600 de antidispersión está implementado como un filtro de todo paso que presenta una función de transferencia según la siguiente expresión:
102
Un efecto de un filtro de este tipo puede ser distribuir la energía de la señal de entrada de manera que no se concentre solamente en algunas muestras.
Los artefactos producidos por la dispersión de libro de códigos son normalmente más apreciables para señales similares al ruido, donde la señal residual incluye menos información de tono, y también para voz en ruido de fondo. La dispersión provoca normalmente menos artefactos cuando la excitación presenta una estructura de larga duración y, de hecho, la modificación de fase puede provocar ruido en señales sonoras. Por lo tanto, puede ser deseable configurar el filtro 600 de antidispersión para filtrar señales sordas y para hacer pasar al menos las mismas señales sonoras sin alteración. Las señales sordas están caracterizadas por una baja ganancia de tono (por ejemplo, una ganancia de libro de códigos adaptativo de banda estrecha cuantificada) y por una inclinación espectral (por ejemplo, primer coeficiente de reflexión cuantificado) cercana a cero o positiva, indicando una envolvente espectral que es plana o que está inclinada hacia arriba sin una frecuencia creciente. Las implementaciones típicas del filtro 600 de antidispersión están configuradas para filtrar sonidos sordos (por ejemplo, como los indicados por el valor de la inclinación espectral), para filtrar sonidos sonoros cuando la ganancia de tono está por debajo de un valor de umbral (como alternativa, no superior al valor de umbral) y además para hacer pasar la señal sin alteraciones.
Implementaciones adicionales del filtro 600 de antidispersión incluyen dos o más filtros que están configurados para presentar diferentes ángulos de modificación de fase máxima (por ejemplo, de hasta 180 grados). En ese caso, el filtro 600 de antidispersión puede estar configurado para realizar una selección entre esos filtros de componente según un valor de la ganancia de tono (por ejemplo, el libro de códigos adaptativo cuantificado o la ganancia LTP), de manera que se utiliza un mayor ángulo de modificación de fase máxima para tramas que tengan valores de ganancia de tono más bajos. Una implementación del filtro 600 de antidispersión también puede incluir diferentes filtros de componente que estén configurados para modificar la fase más o menos en el espectro de frecuencia, de manera que un filtro configurado para modificar la fase en un intervalo de frecuencias más amplio de la señal de entrada se utiliza para tramas que tengan valores de ganancia de tono más bajos.
Para una reproducción precisa de la señal de voz codificada puede ser deseable que la relación entre los niveles de la parte de banda alta y la parte de banda estrecha de la señal S100 de voz de banda ancha sintetizada sea similar a la de la señal S10 de voz de banda ancha original. Además de una envolvente espectral como la representada por los parámetros S60a de codificación de banda alta, el codificador A200 de banda alta puede configurarse para caracterizar la señal S30 de banda alta especificando una envolvente temporal o de ganancia. Tal y como se muestra en la Figura 10, el codificador A202 de banda alta incluye un calculador A230 de factor de ganancia de banda alta que está configurado y dispuesto para calcular uno o más factores de ganancia según una relación entre la señal S30 de banda alta y la señal S130 de banda alta sintetizada, tal como una diferencia o relación entre las energías de las dos señales en una trama o en alguna parte de la misma. En otras implementaciones del codificador A202 de banda alta, el calculador A230 de ganancia de banda alta puede estar configurado de la misma manera pero dispuesto en cambio para calcular la envolvente de ganancia según una relación variable en el tiempo de este tipo entre la señal S30 de banda alta y la señal S80 de excitación de banda estrecha o la señal S120 de excitación de banda alta.
Es probable que las envolventes temporales de la señal S80 de excitación de banda estrecha y de la señal S30 de banda alta sean similares. Por lo tanto, codificar una envolvente de ganancia que esté basada en una relación entre la señal S30 de banda alta y la señal S80 de excitación de banda estrecha (o una señal que se obtenga de las mismas, tal como la señal S120 de excitación de banda alta o la señal S130 de banda alta sintetizada) será generalmente más eficaz que codificar una envolvente de ganancia basada solamente en la señal S30 de banda alta. En una implementación típica, el codificador A202 de banda alta está configurado para transmitir un índice cuantificado de ocho a doce bits que especifica cinco factores de ganancia para cada trama.
El calculador A230 de factor de ganancia de banda alta puede configurarse para realizar el cálculo del factor de ganancia como una tarea que incluya una o más series de subtareas. La Figura 21 muestra un diagrama de flujo de un ejemplo T200 de una tarea de este tipo que calcula un valor de ganancia para una subtrama correspondiente según las energías relativas de la señal S30 de banda alta y de la señal S130 de banda alta sintetizada. Las tareas 220a y 220b calculan las energías de las subtramas correspondientes de las señales respectivas. Por ejemplo, las tareas 220a y 220b pueden configurarse para calcular la energía como una suma de los cuadrados de las muestras de la subtrama respectiva. La tarea T230 calcula un factor de ganancia para la subtrama como la raíz cuadrada de la relación de esas energías. En este ejemplo, la tarea T230 calcula el factor de ganancia como la raíz cuadrada de la relación de la energía de la señal S30 de banda alta con respecto a la energía de la señal S130 de banda alta sintetizada en la subtrama.
Puede ser deseable que el calculador A230 de factor de ganancia de banda alta esté configurado para calcular las energías de subtrama según una función de división en ventanas. La Figura 22 muestra un diagrama de flujo de una implementación T210 de este tipo de la tarea T200 de cálculo de factor de ganancia. La tarea T215a aplica una función de división en ventanas a la señal S30 de banda alta, y la tarea T215b aplica la misma función de división en ventanas a la señal S130 de banda alta sintetizada. Las implementaciones 222a y 222b de las tareas 220a y 220b calculan las energías de las ventanas respectivas, y la tarea T230 calcula un factor de ganancia para la subtrama como la raíz cuadrada de la relación de las energías.
Puede ser deseable aplicar una función de división en ventanas que solape subtramas adyacentes. Por ejemplo, una función de división en ventanas que genere factores de ganancia que puedan aplicarse mediante solapamiento y suma puede ayudar a reducir o evitar discontinuidades entre subtramas. En un ejemplo, el calculador A230 de factor de ganancia de banda alta está configurado para aplicar una función trapezoidal de división en ventanas, tal como la mostrada en la Figura 23a, en la que la ventana se solapa con cada una de las dos subtramas adyacentes en un milisegundo. La Figura 23b muestra una aplicación de esta función de división en ventanas a cada una de las cinco subtramas de una trama de 20 milisegundos. Otras implementaciones del calculador A230 de factor de ganancia de banda alta pueden configurarse para aplicar funciones de división en ventanas que presenten diferentes periodos de solapamiento y/o diferentes formas de ventana (por ejemplo, rectangulares, de Hamming) que pueden ser simétricas o asimétricas. También es posible que una implementación del calculador A230 de factor de ganancia de banda alta esté configurada para aplicar diferentes funciones de división en ventanas a diferentes subtramas de una trama y/o que una trama incluya subtramas de diferentes longitudes.
De manera no limitativa, los siguientes valores se presentan como ejemplos de implementaciones particulares. Se considera una trama de 20 ms para estos casos, aunque puede utilizarse cualquier otra duración. Para una señal de banda alta muestreada a 7 kHz, cada trama tiene 140 muestras. Si una trama de este tipo se divide en cinco subtramas de igual longitud, cada subtrama tendrá 28 muestras, y la ventana mostrada en la Figura 23a tendrá un ancho de 42 muestras. Para una señal de banda alta muestreada a 8 kHz, cada trama presenta 160 muestras. Si una trama de este tipo se divide en cinco subtramas de igual longitud, cada subtrama tendrá 32 muestras, y la ventana mostrada en la Figura 23a tendrá un ancho de 48 muestras. En otras implementaciones pueden usarse subtramas de cualquier ancho e incluso es posible que una implementación del calculador A230 de ganancia de banda alta esté configurada para generar un factor de ganancia diferente para cada muestra de una trama.
La Figura 24 muestra un diagrama de bloques de una implementación B202 del descodificador B200 de banda alta. El descodificador B202 de banda alta incluye un generador B300 de excitación de banda alta que está configurado para generar la señal S120 de excitación de banda alta en función de la señal S80 de excitación de banda estrecha. Dependiendo de las elecciones particulares de diseño del sistema, el generador B300 de excitación de banda alta puede implementarse según cualquiera de las implementaciones del generador A300 de excitación de banda alta descrito en este documento. Normalmente es deseable implementar el generador B300 de excitación de banda alta para que tenga la misma respuesta que el generador de excitación de banda alta del codificador de banda alta del sistema de codificación particular. Puesto que el descodificador B110 de banda estrecha realizará normalmente la descuantificación de la señal S50 de excitación de banda estrecha codificada, en la mayoría de los casos el generador B300 de excitación de banda alta puede implementarse para recibir la señal S80 de excitación de banda estrecha del descodificador B110 de banda estrecha y no necesita incluir un cuantificador inverso configurado para descuantificar la señal S50 de excitación de banda estrecha codificada. También es posible implementar el descodificador B110 de banda estrecha para que incluya una instancia del filtro 600 de antidispersión dispuesta para filtrar la señal de excitación de banda estrecha descuantificada antes de que se introduzca en un filtro de síntesis de banda estrecha tal como el filtro 330.
Un cuantificador 560 inverso está configurado para descuantificar los parámetros S60a de filtro de banda alta (en este ejemplo, a un conjunto de LSF), y una transformada 570 de LSF a coeficientes de filtro LP está configurada para transformar las LSF en un conjunto de coeficientes de filtro (por ejemplo, como el descrito anteriormente con referencia al cuantificador 240 inverso y a la transformada 250 del codificador A122 de banda estrecha). En otras implementaciones, como las mencionadas anteriormente, pueden utilizarse conjuntos de coeficientes diferentes (por ejemplo, coeficientes cepstrales y/o representaciones de coeficientes (por ejemplo, ISP)). Un filtro B204 de síntesis de banda alta está configurado para generar una señal de banda alta sintetizada según la señal S120 de excitación de banda alta y el conjunto de coeficientes de filtro. Para un sistema en el que el codificador de banda alta incluye un filtro de síntesis (por ejemplo, como en el ejemplo del codificador A202 descrito anteriormente), puede ser deseable implementar el filtro B204 de síntesis de banda alta para que tenga la misma repuesta (por ejemplo, la misma función de transferencia) que el filtro de síntesis.
El descodificador B202 de banda alta incluye un cuantificador 580 inverso configurado para descuantificar los factores S60b de ganancia de banda alta y un elemento 590 de control de ganancia (por ejemplo, un multiplicador o amplificador) configurado y dispuesto para aplicar los factores de ganancia descuantificados a la señal de banda alta sintetizada para generar la señal S100 de banda alta. Para un caso en el que la envolvente de ganancia de una trama está especificada por más de un factor de ganancia, el elemento 590 de control de ganancia puede incluir lógica configurada para aplicar los factores de ganancia a las subtramas respectivas, posiblemente según una función de división en ventanas que puede ser la misma o una función de división en ventanas diferente como la aplicada por un calculador de ganancia (por ejemplo, el calculador A230 de ganancia de banda alta) del codificador de banda alta correspondiente. En otras implementaciones del descodificador B202 de banda alta, el elemento 590 de control de ganancia está configurado de manera similar pero está dispuesto en cambio para aplicar los factores de ganancia descuantificados a la señal S80 de excitación de banda estrecha o a la señal S120 de excitación de banda alta.
Tal y como se ha mencionado anteriormente, puede ser deseable obtener el mismo estado en el codificador de banda alta y en el descodificador de banda alta (por ejemplo, utilizando valores descuantificados durante la codificación). Por lo tanto, en un sistema de codificación según una implementación de este tipo puede ser deseable garantizar el mismo estado para generadores de ruido correspondientes en los generadores A300 y B300 de excitación de banda alta. Por ejemplo, los generadores A300 y B300 de excitación de banda alta de una implementación de este tipo pueden configurarse de manera que el estado del generador de ruido sea una función determinista de información ya codificada dentro de la misma trama (por ejemplo, los parámetros S40 de filtro de banda estrecha o una parte de los mismos y/o la señal S50 de excitación de banda estrecha codificada o una parte de la misma).
Uno o más de los cuantificadores de los elementos descritos en este documento (por ejemplo, los cuantificadores 230, 420 ó 430) pueden configurarse para realizar una cuantificación vectorial clasificada. Por ejemplo, un cuantificador de este tipo puede configurarse para seleccionar un libro de códigos de un conjunto de libros de códigos en función de información que ya se haya codificado dentro de la misma trama en el canal de banda estrecha y/o en el canal de banda alta. Una técnica de este tipo proporciona normalmente una mayor eficacia de codificación a expensas de un almacenamiento adicional de libros de códigos.
Tal y como se ha mencionado anteriormente con referencia a, por ejemplo, las Figuras 8 y 9, una considerable cantidad de estructura periódica puede permanecer en la señal residual después de la eliminación de la envolvente espectral aproximada de la señal S20 de voz de banda estrecha. Por ejemplo, la señal residual puede contener una secuencia de valores de pico o de impulsos aproximadamente periódicos en el tiempo. Es especialmente probable que tal estructura, que está relacionada normalmente con el tono, se produzca en señales de voz sonoras. El cálculo de una representación cuantificada de la señal residual de banda estrecha puede incluir la codificación de esta estructura de tono según un modelo de periodicidad de larga duración como el representado, por ejemplo, por uno o más libros de códigos.
La estructura de tono de una señal residual real puede no coincidir exactamente con el modelo de periodicidad. Por ejemplo, la señal residual puede incluir pequeñas fluctuaciones de retardo en la regularidad de las posiciones de los impulsos de tono, de manera que las distancias entre impulsos de tono sucesivos en una trama no son exactamente iguales y la estructura es bastante irregular. Estas irregularidades tienden a reducir la eficacia de codificación.
Algunas implementaciones del codificador A120 de banda estrecha están configuradas para realizar una regularización de la estructura de tono aplicando una distorsión de tiempo adaptativa a la señal residual antes o durante la cuantificación o incluyendo de otro modo una distorsión de tiempo adaptativa en la señal de excitación codificada. Por ejemplo, un codificador de este tipo puede configurarse para seleccionar o calcular de otro modo un grado de distorsión en el tiempo (por ejemplo, según uno o más criterios de minimización de errores y/o de ponderación perceptual) de manera que la señal de excitación resultante se ajuste de manera óptima al modelo de periodicidad de larga duración. La regularización de la estructura de tono se realiza por un subconjunto de codificadores CELP denominados codificadores de predicción lineal excitada por código de relajación (RCELP).
Un codificador RCELP está configurado normalmente para realizar la distorsión de tiempo como un desplazamiento de tiempo adaptativo. Este desplazamiento de tiempo puede ser un retardo que oscile entre algunos milisegundos negativos y algunos milisegundos positivos, y normalmente se modifica de manera uniforme para evitar discontinuidades audibles. En algunas implementaciones, un codificador de este tipo está configurado para aplicar la regularización por tramos, donde cada trama o subtrama está distorsionada mediante un desplazamiento de tiempo fijo correspondiente. En otras implementaciones, el codificador está configurado para aplicar la regularización como una función de distorsión continua, de manera que una trama o subtrama se distorsiona según un contorno de tono (denominado también como trayectoria de tono). En algunos casos (por ejemplo, según se describe en la publicación de solicitud de patente estadounidense 2004/0098255), el codificador está configurado para incluir una distorsión de tiempo en la señal de excitación codificada aplicando el desplazamiento a una señal de entrada ponderada de manera perceptual que se utiliza para calcular la señal de excitación codificada.
El codificador calcula una señal de excitación codificada que está regularizada y cuantificada, y el descodificador descuantifica la señal de excitación codificada para obtener una señal de excitación que se utiliza para sintetizar la señal de voz descodificada. Por lo tanto, la señal de salida descodificada presenta el mismo retardo variable que el que estaba incluido en la señal de excitación codificada debido a la regularización. Normalmente, no se transmite al descodificador ninguna información que especifique las cantidades de regularización.
La regularización tiende a hacer la señal residual más fácil de codificar, lo que mejora la ganancia de codificación del elemento de predicción a largo plazo y, por lo tanto, aumenta la eficacia de codificación global, generalmente sin generar artefactos. Puede ser deseable realizar la regularización solamente en tramas que sean sonoras. Por ejemplo, el codificador A124 de banda estrecha puede configurarse para desplazar solamente aquellas tramas o subtramas que tengan una estructura de larga duración, tal como las señales sonoras. También puede ser deseable realizar la regularización solamente en subtramas que incluyan energía de impulso de tono. Varias implementaciones de la codificación RCELP se describen en las patentes estadounidenses números 5.704.003 (Kleijn et al.) y 6.879.955 (Rao) y en la publicación de solicitud de patente estadounidense 2004/0098255 (Kovesi et al.). Implementaciones existentes de codificadores RCELP incluyen el códec de velocidad variable mejorado (EVRC), como el descrito en la especificación IS-127 de la Asociación de la Industria de Telecomunicaciones (TIA), y el vocodificador de modo seleccionable (SMV) del segundo proyecto de colaboración de tercera generación (3GPP2).
Desafortunadamente, la regularización puede provocar problemas en un codificador de voz de banda ancha en el que la excitación de banda alta se obtenga de la señal de excitación de banda estrecha codificada (tal como un sistema que incluye el codificador A100 de voz de banda ancha y el descodificador B100 de voz de banda ancha). Debido a esta obtención a partir de una señal distorsionada en el tiempo, la señal de excitación de banda alta presentará generalmente un perfil de tiempo que será diferente del de la señal de voz de banda alta original. Dicho de otro modo, la señal de excitación de banda alta ya no será síncrona con la señal de voz de banda alta original.
Una desalineación en el tiempo entre la señal de excitación de banda alta distorsionada y la señal de voz de banda alta original puede provocar varios problemas. Por ejemplo, la señal de excitación de banda alta distorsionada ya no puede proporcionar una excitación fuente adecuada para un filtro de síntesis que esté configurado según los parámetros de filtro extraídos de la señal de voz de banda alta original. Como resultado, la señal de banda alta sintetizada puede contener artefactos audibles que reduzcan la calidad percibida de la señal de voz de banda ancha descodificada.
Esta desalineación en el tiempo también puede provocar ineficiencias en la codificación de envolvente de ganancia. Tal y como se ha mencionado anteriormente, es probable que exista una correlación entre las envolventes temporales de la señal S80 de excitación de banda estrecha y de la señal S30 de banda alta. Codificando la envolvente de ganancia de la señal de banda alta según una relación entre estas dos envolventes temporales puede obtenerse un aumento de la eficacia de codificación en comparación con la codificación directa de la envolvente de ganancia. Sin embargo, cuando la señal de excitación de banda estrecha codificada está regularizada, esta correlación puede debilitarse. La desalineación en el tiempo entre la señal S80 de excitación de banda estrecha y la señal S30 de banda alta puede provocar que aparezcan fluctuaciones en los factores S60b de ganancia de banda alta, y la eficacia de codificación puede disminuir.
Las realizaciones pueden incluir procedimientos de codificación de voz de banda ancha que lleven a cabo la distorsión de tiempo de una señal de voz de banda alta según una distorsión de tiempo incluida en una señal de excitación de banda estrecha codificada correspondiente. Las ventajas potenciales de tales procedimientos incluyen mejorar la calidad de una señal de voz de banda ancha descodificada y/o mejorar la eficacia de codificación de una envolvente de ganancia de banda alta.
La Figura 25 muestra un diagrama de bloques de una implementación AD10 del codificador A100 de voz de banda ancha. El codificador AD10 incluye una implementación A124 del codificador A120 de banda estrecha que está configurada para realizar la regularización durante el cálculo de la señal S50 de excitación de banda estrecha codificada. Por ejemplo, el codificador A124 de banda estrecha puede configurarse según una o más de las implementaciones RCELP descritas anteriormente.
El codificador A124 de banda estrecha también está configurado para transmitir una señal SD10 de datos de regularización que especifica el grado de distorsión de tiempo aplicado. Para varios casos en los que el codificador A124 de banda estrecha esté configurado para aplicar un desplazamiento de tiempo fijo a cada trama o subtrama, la señal SD10 de datos de regularización puede incluir una serie de valores que indiquen cada cantidad de desplazamiento de tiempo como un valor entero o no entero en lo que se refiere a muestras, milisegundos o algún otro incremento de tiempo. Para un caso en el que el codificador A124 de banda estrecha esté configurado para modificar de otro modo la escala de tiempo de una trama u otra secuencia de muestras (por ejemplo, comprimiendo una parte y ampliando otra parte), la señal SD10 de información de regularización puede incluir una descripción correspondiente de la modificación, tal como un conjunto de parámetros de función. En un ejemplo particular, el codificador A124 de banda estrecha está configurado para dividir una trama en tres subtramas y para calcular un desplazamiento de tiempo fijo para cada subtrama, de manera que la señal SD10 de datos de regularización indica tres cantidades de desplazamiento de tiempo para cada trama regularizada de la señal de banda estrecha codificada.
El codificador AD10 de voz de banda ancha incluye una línea D120 de retardo configurada para adelantar o retrasar partes de la señal S30 de voz de banda alta, según cantidades de retardo indicadas por una señal de entrada, para generar una señal S30a de voz de banda alta distorsionada en el tiempo. En el ejemplo mostrado en la Figura 25, la línea D120 de retardo está configurada para distorsionar en el tiempo la señal S30 de voz de banda alta según la distorsión indicada por la señal SD10 de datos de regularización. De esta manera, la misma cantidad de distorsión de tiempo que estaba incluida en la señal S50 de excitación de banda estrecha codificada también se aplica a la parte correspondiente de la señal S30 de voz de banda alta antes del análisis. Aunque este ejemplo muestra la línea D120 de retardo como un elemento separado del codificador A200 de banda alta, en otras implementaciones la línea D120 de retardo está dispuesta como parte del codificador de banda alta.
Implementaciones adicionales del codificador A200 de banda alta pueden configurarse para realizar un análisis espectral (por ejemplo, un análisis LPC) de la señal S30 de voz de banda alta no distorsionada y para distorsionar en el tiempo la señal S30 de voz de banda alta antes del cálculo de los parámetros S60b de ganancia de banda alta. Un codificador de este tipo puede incluir, por ejemplo, una implementación de la línea D120 de retardo dispuesta para realizar la distorsión en el tiempo. Sin embargo, en tales casos, los parámetros S60a de filtro de banda alta basados en el análisis de la señal S30 no distorsionada pueden describir una envolvente espectral que esté desalineada en el tiempo con la señal S120 de excitación de banda alta.
La línea D120 de retardo puede configurarse según cualquier combinación de elementos lógicos y de elementos de almacenamiento adecuados para aplicar las operaciones de distorsión de tiempo deseadas a la señal S30 de voz de banda alta. Por ejemplo, la línea D120 de retardo puede configurarse para leer la señal S30 de voz de banda alta de un almacenamiento intermedio según los desplazamientos de tiempo deseados. La Figura 26a muestra un diagrama esquemático de una implementación D122 de este tipo de la línea D120 de retardo que incluye un registro SR1 de desplazamiento. El registro SR1 de desplazamiento es un almacenamiento intermedio de longitud m que está configurado para recibir y almacenar las m muestras más recientes de la señal S30 de voz de banda alta. El valor m es igual a al menos la suma del desplazamiento de tiempo positivo máximo (o "adelanto") y del desplazamiento de tiempo negativo máximo (o "retraso") que van a soportarse. Puede ser conveniente que el valor m sea igual a la longitud de una trama o subtrama de la señal S30 de banda alta.
La línea D122 de retardo está configurada para transmitir la señal S30a de banda alta distorsionada en el tiempo desde una ubicación de desfase OL del registro SR1 de desplazamiento. La posición de la ubicación de desfase OL varía en torno a una posición de referencia (desplazamiento de tiempo cero) según el desplazamiento de tiempo actual indicado, por ejemplo, por la señal SD10 de datos de regularización. La línea D122 de retardo puede configurarse para soportar límites de adelanto o de retraso iguales o, como alternativa, un límite más grande que otro de manera que pueda llevarse a cabo un mayor desplazamiento en una dirección que en la otra. La Figura 26a muestra un ejemplo particular que soporta un mayor desplazamiento de tiempo positivo que negativo. La línea D122 de retardo puede configurarse para transmitir una o más muestras a la vez (dependiendo del ancho de un bus de salida, por ejemplo).
\newpage
Un desplazamiento de tiempo de regularización que presente una magnitud de más de algunos milisegundos puede provocar artefactos audibles en la señal descodificada. Normalmente, la magnitud de un desplazamiento de tiempo de regularización como el generado por un codificador A124 de banda estrecha no será mayor que algunos milisegundos, de manera que los desplazamientos de tiempo indicados por la señal SD10 de datos de regularización serán limitados. Sin embargo, en tales casos puede desearse que la línea D122 de retardo esté configurada para imponer un límite máximo en los desplazamientos de tiempo en la dirección positiva y/o en la dirección negativa (por ejemplo, para observar un límite más preciso que el impuesto por el codificador de banda estrecha).
La Figura 26b muestra un diagrama esquemático de una implementación D124 de la línea D122 de retardo que incluye una venta de desplazamiento SW. En este ejemplo, la posición de la ubicación de desfase OL está limitada por la ventana de desplazamiento SW. Aunque la Figura 26b muestra un caso en que la longitud m del almacenamiento intermedio es mayor que el ancho de la ventana de desplazamiento SW, la línea D124 de retardo también puede implementarse de manera que el ancho de la ventana de desplazamiento SW sea igual a m.
En otras implementaciones, la línea D120 de retardo está configurada para escribir la señal S30 de voz de banda alta en un almacenamiento intermedio según los desplazamientos de tiempo deseados. La Figura 27 muestra un diagrama esquemático de una implementación D130 de este tipo de la línea D120 de retardo que incluye dos registros SR2 y SR3 de desplazamiento configurados para recibir y almacenar la señal S30 de voz de banda alta. La línea D130 de retardo está configurada para escribir una trama o subtrama del registro SR2 de desplazamiento en el registro SR3 de desplazamiento según un desplazamiento de tiempo como el indicado, por ejemplo, por la señal SD10 de datos de regularización. El registro SR3 de desplazamiento está configurado como un almacenamiento intermedio FIFO dispuesto para transmitir la señal S30a de banda alta distorsionada en el tiempo.
En el ejemplo particular mostrado en la Figura 27, el registro SR2 de desplazamiento incluye una parte FB1 de almacenamiento intermedio de trama y una parte DB de almacenamiento intermedio de retardo, y el registro SR3 de desplazamiento incluye una parte FB2 de almacenamiento intermedio de trama, una parte AB de almacenamiento intermedio de adelanto y una parte RB de almacenamiento intermedio de retraso. Las longitudes del almacenamiento AB intermedio de adelanto y del almacenamiento RB intermedio de retraso pueden ser iguales, o una puede ser más larga que la otra, de manera que se soporta un mayor desplazamiento en una dirección que en la otra. El almacenamiento DB intermedio de retardo y la parte RB del almacenamiento intermedio de retraso pueden configurarse para tener la misma longitud. Como alternativa, el almacenamiento DB intermedio de retardo puede ser más corto que el almacenamiento RB intermedio de retraso para soportar un intervalo de tiempo requerido para transferir muestras desde el almacenamiento FB1 intermedio de trama al registro SR3 de desplazamiento, lo que puede incluir otras operaciones de procesamiento tales como la distorsión de las muestras antes de su almacenamiento en el registro SR3 de desplazamiento.
En el ejemplo de la Figura 27, el almacenamiento FB1 intermedio de trama está configurado para tener la misma longitud que una trama de la señal S30 de banda alta. En otro ejemplo, el almacenamiento FB1 intermedio de trama está configurado para tener la misma longitud que una subtrama de la señal S30 de banda alta. En ese caso, la línea D130 de retardo puede configurarse para incluir lógica para aplicar el mismo retardo (por ejemplo, un promedio) a todas las subtramas de una trama que va a desplazarse. La línea D130 de retardo también puede incluir lógica para calcular la media de valores del almacenamiento FB1 intermedio de trama con valores que van a sobrescribirse en el almacenamiento RB intermedio de retraso o en el almacenamiento AB intermedio de adelanto. En un ejemplo adicional, el registro SR3 de desplazamiento puede configurarse para que reciba valores de la señal S30 de banda alta solamente a través del almacenamiento FB1 intermedio de trama y, en ese caso, la línea D130 de retardo puede incluir lógica para realizar una interpolación a través de los espacios entre tramas o subtramas sucesivas escritas en el registro SR3 de desplazamiento. En otras implementaciones, la línea D130 de retardo puede configurarse para realizar una operación de distorsión en muestras del almacenamiento FB1 intermedio de trama antes de que se escriban en el registro SR3 de desplazamiento (por ejemplo, según una función descrita por la señal SD10 de datos de regularización).
Puede ser deseable que la línea D120 de retardo aplique una distorsión de tiempo basada en, pero que no sea idéntica a, la distorsión especificada por la señal SD10 de datos de regularización. La Figura 28 muestra un diagrama de bloques de una implementación AD12 del codificador AD10 de voz de banda ancha que incluye un elemento D110 de correlación de valores de retardo. El elemento D110 de correlación de valores de retardo está configurado para transformar la distorsión indicada por la señal SD10 de datos de regularización en valores SD10a de retardo correlacionados. La línea D120 de retardo está dispuesta para generar la señal S30a de voz de banda alta distorsionada en el tiempo según la distorsión indicada por los valores SD10a de retardo correlacionados.
Puede esperarse que el desplazamiento de tiempo aplicado por el codificador de banda estrecha se desarrolle de manera uniforme en el tiempo. Por lo tanto, normalmente es suficiente calcular el desplazamiento de tiempo medio de banda estrecha aplicado a las subtramas durante una trama de voz y desplazar una trama correspondiente de la señal S30 de voz de banda alta según este promedio. En un ejemplo de este tipo, el elemento D110 de correlación de valores de retardo está configurado para calcular un promedio de los valores de retardo de subtrama para cada trama, y la línea D120 de retardo está configurada para aplicar el promedio calculado a una trama correspondiente de la señal S30 de banda alta. En otros ejemplos, puede calcularse y aplicarse un promedio en un periodo más corto (tal como dos subtramas o media trama) o en un periodo más largo (tal como dos tramas). En un caso en el que el promedio no sea un valor entero de muestras, el elemento D110 de correlación de valores de retardo puede configurarse para redondear el valor a un número entero de muestras antes de transmitirse a la línea D120 de retardo.
El codificador A124 de banda estrecha puede configurarse para incluir un desplazamiento de tiempo de regularización de un número no entero de muestras en la señal de excitación de banda estrecha codificada. En tal caso, puede ser deseable que el elemento D110 de correlación de valores de retardo esté configurado para redondear el desplazamiento de tiempo de banda estrecha a un número entero de muestras y que la línea D120 de retardo aplique el desplazamiento de tiempo redondeado a la señal S30 de voz de banda alta.
En algunas implementaciones del codificador AD10 de voz de banda ancha, las tasas de muestreo de la señal S20 de voz de banda estrecha y de la señal S30 de voz de banda alta pueden ser diferentes. En tales casos, el elemento D110 de correlación de valores de retardo puede configurarse para ajustar cantidades de desplazamiento de tiempo indicadas en la señal SD10 de datos de regularización para soportar una diferencia entre las tasas de muestreo de la señal S20 de voz de banda estrecha (o la señal S80 de excitación de banda estrecha) y de la señal S30 de voz de banda alta. Por ejemplo, el elemento D110 de correlación de valores de retardo puede configurarse para escalar las cantidades de desplazamiento de tiempo según una relación de las tasas de muestreo. En un ejemplo particular como el mencionado anteriormente, la señal S20 de voz de banda estrecha se muestra a 8 kHz y la señal S30 de voz de banda alta se muestra a 7 kHz. En este caso, el elemento D110 de correlación de valores de retardo está configurado para multiplicar cada cantidad de desplazamiento por 7/8. Implementaciones del elemento D110 de correlación de valores de retardo también pueden configurarse para realizar una operación de escalado de este tipo junto con una operación de redondeo a enteros y/o una operación de cálculo de la media de desplazamientos de tiempo como las descritas en este documento.
En implementaciones adicionales, la línea D120 de retardo está configurada para modificar de otro modo la escala de tiempo de una trama u otra secuencia de muestras (por ejemplo, comprimiendo una parte y ampliando otra parte). Por ejemplo, el codificador A124 de banda estrecha puede configurarse para realizar la regularización según una función tal como una trayectoria o contorno de tono. En ese caso, la señal SD10 de datos de regularización puede incluir una descripción correspondiente de la función, tal como un conjunto de parámetros, y la línea D120 de retardo puede incluir lógica configurada para distorsionar tramas o subtramas de la señal S30 de voz de banda alta según la función. En otras implementaciones, el elemento D110 de correlación de valores de retardo está configurado para calcular la media, escalar, y/o redondear la función antes de aplicarse a la señal S30 de voz de banda alta mediante la línea D120 de retardo. Por ejemplo, el elemento D110 de correlación de valores de retardo puede configurarse para calcular uno o más valores de retardo según la función, indicando cada valor de retardo una pluralidad de muestras, que se aplican posteriormente mediante la línea D120 de retardo para distorsionar en el tiempo una o más tramas o subtramas correspondientes de la señal S30 de voz de banda alta.
La Figura 29 muestra un diagrama de flujo de un procedimiento MD100 para distorsionar en el tiempo una señal de voz de banda alta según una distorsión de tiempo incluida en una señal de excitación de banda estrecha codificada correspondiente. La tarea TD100 procesa una señal de voz de banda ancha para obtener una señal de voz de banda estrecha y una señal de voz de banda alta. Por ejemplo, la tarea TD100 puede configurarse para filtrar la señal de voz de banda ancha utilizando un banco de filtros que contenga filtros paso bajo y filtros paso alto, tal como una implementación del banco A110 de filtros. La tarea TD200 codifica la señal de voz de banda estrecha en al menos una señal de excitación de banda estrecha codificada y una pluralidad de parámetros de filtro de banda estrecha. La señal de excitación de banda estrecha codificada y/o los parámetros de filtro pueden cuantificarse, y la señal de voz de banda estrecha codificada también puede incluir otros parámetros tales como un parámetro de modo de voz. La tarea TD200 también incluye una distorsión de tiempo en la señal de excitación de banda estrecha codificada.
La tarea TD300 genera una señal de excitación de banda alta en función de una señal de excitación de banda estrecha. En este caso, la señal de excitación de banda estrecha está basada en la señal de excitación de banda estrecha codificada. Según al menos la señal de excitación de banda alta, la tarea TD400 codifica la señal de voz de banda alta en al menos una pluralidad de parámetros de filtro de banda alta. Por ejemplo, la tarea TD400 puede configurarse para codificar la señal de voz de banda alta en una pluralidad de LSF cuantificadas. La tarea TD500 aplica un desplazamiento de tiempo a la señal de voz de banda alta en función de información relacionada con una distorsión de tiempo incluida en la señal de excitación de banda estrecha codificada.
La tarea TD400 puede configurarse para realizar un análisis espectral (tal como un análisis LPC) en la señal de voz de banda alta y/o para calcular una envolvente de ganancia de la señal de voz de banda alta. En tales casos, la tarea TD500 puede configurarse para aplicar el desplazamiento de tiempo a la señal de voz de banda alta antes del análisis y/o del cálculo de envolvente de ganancia.
Otras implementaciones del codificador A100 de voz de banda ancha están configuradas para invertir una distorsión de tiempo de la señal S120 de excitación de banda alta provocada por una distorsión de tiempo incluida en la señal de excitación de banda estrecha codificada. Por ejemplo, el generador A300 de excitación de banda alta puede implementarse para incluir una implementación de la línea D120 de retardo que esté configurada para recibir la señal SD10 de datos de regularización o los valores SD10a de retardo correlacionados, y para aplicar un desplazamiento de tiempo inverso correspondiente a la señal S80 de excitación de banda estrecha y/o a una señal posterior basada en la misma tal como la señal S160 ensanchada de manera armónica o la señal S120 de excitación de banda alta.
Implementaciones adicionales del codificador de voz de banda ancha pueden configurarse para codificar la señal S20 de voz de banda estrecha y la señal S30 de voz de banda alta de manera independiente entre sí, de modo que la señal S30 de voz de banda alta se codifica como una representación de una envolvente espectral de banda alta y de una señal de excitación de banda alta. Una implementación de este tipo puede configurarse para realizar una distorsión en el tiempo de la señal residual de banda alta o para incluir de otro modo una distorsión de tiempo en una señal de excitación de banda alta codificada, según información relacionada con una distorsión de tiempo incluida en la señal de excitación de banda estrecha codificada. Por ejemplo, el codificador de banda alta puede incluir una implementación de la línea D120 de retardo y/o una implementación del elemento D110 de correlación de valores de retardo como las descritas en este documento que estén configuradas para aplicar una distorsión de tiempo a la señal residual de banda alta. Ventajas potenciales de una operación de este tipo incluyen una codificación más eficaz de la señal residual de banda alta y una mejor correspondencia entre las señales de voz de banda alta y de banda estrecha sintetizadas.
Tal y como se ha mencionado anteriormente, las realizaciones descritas en este documento incluyen implementaciones que pueden utilizarse para realizar codificación embebida, permitiendo la compatibilidad con sistemas de banda estrecha y evitando la necesidad de transcodificación. Los medios que soportan la codificación de banda alta también pueden diferenciarse, en lo que a los costes se refiere, entre chips, conjuntos de chips, dispositivos y/o redes que soportan banda ancha con compatibilidad hacia atrás y aquellos que soportan solamente banda estrecha. Los medios que soportan la codificación de banda alta como la descrita en este documento también pueden utilizarse junto con una técnica para soportar codificación de banda baja, y un sistema, procedimiento o aparato según una realización de este tipo pueden soportar la codificación de componentes de frecuencia desde, por ejemplo, 50 ó 100 Hz aproximadamente hasta 7 u 8 kHz aproximadamente.
Tal y como se ha mencionado anteriormente, añadir medios de soporte de banda alta en un codificador de voz puede mejorar la inteligibilidad, especialmente en lo que respecta a la diferenciación de sonidos fricativos. Aunque tal diferenciación puede obtenerse normalmente escuchando a una persona en un contexto particular, los medios que soportan banda alta pueden servir como una característica de habilitación en el reconocimiento de voz y en otras aplicaciones de interpretación mediante máquinas, tales como sistemas para la navegación por menús mediante voz automatizada y/o el procesamiento automático de llamadas.
Un aparato según una realización puede incorporarse en un dispositivo portátil de comunicaciones inalámbricas tal como un teléfono celular o un asistente personal digital (PDA). Como alternativa, un aparato de este tipo puede incluirse en otro dispositivo de comunicaciones tal como un microteléfono de VoIP, un ordenador personal configurado para soportar comunicaciones de VoIP, o un dispositivo de red configurado para encaminar comunicaciones telefónicas o de VoIP. Por ejemplo, un aparato según una realización puede implementarse en un chip o en un conjunto de chips de un dispositivo de comunicaciones. Dependiendo de la aplicación particular, un dispositivo de este tipo también puede incluir características tales como conversión de analógico a digital y/o de digital a analógico de una señal de voz, un sistema de circuitos para realizar amplificación y/u otras operaciones de procesamiento de señales en una señal de voz, y/o un sistema de circuitos de radiofrecuencia para la transmisión y/o recepción de la señal de voz codificada.
La presentación anterior de las realizaciones descritas se proporciona para que un experto en la técnica fabrique o utilice la presente invención. Son posibles varias modificaciones de estas realizaciones, y los principios genéricos presentados en este documento también pueden aplicarse a otras realizaciones. Por ejemplo, una realización puede implementarse en parte o en su totalidad como un circuito cableado, como una configuración de circuitos fabricada en un circuito integrado de aplicación específica o como un programa de firmware cargado en un medio de almacenamiento no volátil o un programa de software cargado desde o en un medio de almacenamiento de datos como un código legible por máquina, siendo tal código instrucciones que pueden ejecutarse por una disposición de elementos lógicos tal como un microprocesador u otra unidad de procesamiento de señales digitales. El medio de almacenamiento de datos puede ser una disposición de elementos de almacenamiento tal como una memoria de semiconductor (que puede incluir de manera no limitativa una RAM (memoria de acceso aleatorio) dinámica o estática, una ROM (memoria de solo lectura), y/o una RAM flash), o una memoria ferroeléctrica, magnetorresistiva, ovónica, polimérica o de cambio de fase; o un medio de disco tal como un disco magnético u óptico. Debe entenderse que el término "software" incluye código fuente, código de lenguaje ensamblador, código máquina, código binario, firmware, macrocódigo, microcódigo, uno o más conjuntos o secuencias de instrucciones ejecutables por una disposición de elementos lógicos, y cualquier combinación de tales ejemplos.
Los diversos elementos de implementaciones de los generadores A300 y B300 de excitación de banda alta, del codificador A100 de banda alta, del descodificador B200 de banda alta, del codificador A100 de voz de banda ancha y del descodificador B100 de voz de banda ancha pueden implementarse como dispositivos electrónicos y/u ópticos que residen, por ejemplo, en el mismo chip o entre dos o más chips de un conjunto de chips, aunque también se contemplan otras disposiciones sin tal limitación. Uno o más elementos de un aparato de este tipo pueden implementarse en su totalidad o en parte como uno o más conjuntos de instrucciones dispuestos para ejecutarse en una o más disposiciones fijas o programables de elementos lógicos (por ejemplo, transistores, puertas) tales como microprocesadores, procesadores incorporados, núcleos IP, procesadores de señales digitales, FPGA (matrices de puertas programables de campo), ASSP (productos estándar de aplicación específica) y ASIC (circuitos integrados de aplicación específica). También es posible que uno o más de tales elementos tengan una estructura en común (por ejemplo, un procesador utilizado para ejecutar partes de código correspondientes a diferentes elementos en momentos diferentes, un conjunto de instrucciones ejecutadas para llevar a cabo tareas correspondientes a diferentes elementos en momentos diferentes, o una disposición de dispositivos electrónicos y/u ópticos que realizan operaciones para diferentes elementos en momentos diferentes). Además, es posible que uno o más de estos elementos se utilicen para realizar tareas o para ejecutar otros conjuntos de instrucciones que no estén directamente relacionados con una operación del aparato, tal como una tarea relacionada con otra operación de un dispositivo o sistema en el que el aparato esté incorporado.
La Figura 30 muestra un diagrama de flujo de un procedimiento M100, según una realización, para codificar una parte de banda alta de una señal de voz que presenta una parte de banda estrecha y la parte de banda alta. La tarea X100 calcula un conjunto de parámetros de filtro que caracterizan una envolvente espectral de la parte de banda alta. La tarea X200 calcula una señal ensanchada de manera espectral aplicando una función no lineal a una señal obtenida de la parte de banda estrecha. La tarea X300 genera una señal de banda alta sintetizada según (A) el conjunto de parámetros de filtro y (B) una señal de excitación de banda alta basada en la señal ensanchada de manera espectral. La tarea X400 calcula una envolvente de ganancia en función de una relación entre (C) la energía de la parte de banda alta y (D) la energía de una señal obtenida de la parte de banda estrecha.
La Figura 31a muestra un diagrama de flujo de un procedimiento M200 de generación de una señal de excitación de banda alta según una realización. La tarea Y100 calcula una señal ensanchada de manera armónica aplicando una función no lineal a una señal de excitación de banda estrecha obtenida de una parte de banda estrecha de una señal de voz. La tarea Y200 mezcla la señal ensanchada de manera armónica con una señal de ruido modulada para generar una señal de excitación de banda alta. La Figura 31b muestra un diagrama de flujo de un procedimiento M210 de generación de una señal de excitación de banda alta según otra realización que incluye las tareas Y300 e Y400. La tarea Y300 calcula una envolvente de dominio de tiempo según la energía en el tiempo de una señal de entre la señal de excitación de banda estrecha y la señal ensanchada de manera armónica. La tarea Y400 modula una señal de ruido según la envolvente de dominio de tiempo para generar la señal de ruido modulada.
La Figura 32 muestra un diagrama de flujo de un procedimiento M300, según una realización, para descodificar una parte de banda alta de una señal de voz que presenta una parte de banda estrecha y la parte de banda alta. La tarea Z100 recibe un conjunto de parámetros de filtro que caracterizan a una envolvente espectral de la parte de banda alta y un conjunto de factores de ganancia que caracterizan a una envolvente temporal de la parte de banda alta. La tarea Z200 calcula una señal ensanchada de manera espectral aplicando una función no lineal a una señal obtenida de la parte de banda estrecha. La tarea Z300 genera una señal de banda alta sintetizada según (A) el conjunto de parámetros de filtro y (B) una señal de excitación de banda alta basada en la señal ensanchada de manera espectral. La tarea Z400 modula una envolvente de ganancia de la señal de banda alta sintetizada en función del conjunto de factores de ganancia. Por ejemplo, la tarea Z400 puede configurarse para modular la envolvente de ganancia de la señal de banda alta sintetizada aplicando el conjunto de factores de ganancia a una señal de excitación obtenida de la parte de banda estrecha, a la señal ensanchada de manera espectral, a la señal de excitación de banda alta o a la señal de banda alta sintetizada.

Claims (28)

1. Un aparato, que comprende:
un banco (A110) de filtros, que contiene
A)
una trayectoria de procesamiento de banda baja configurada para recibir una señal de voz de banda ancha y para generar una señal de voz de banda baja en función de una parte de baja frecuencia de la señal de voz de banda ancha, y
B)
una trayectoria de procesamiento de banda alta configurada para recibir la señal de voz de banda ancha y para generar una señal de voz de banda alta en función de una parte de alta frecuencia de la señal de voz de banda ancha, donde una banda de paso de la trayectoria de procesamiento de banda baja se solapa con una banda de paso de la trayectoria de procesamiento de banda alta, donde el solapamiento se considera como la distancia del punto en el que la respuesta de frecuencia del filtro de banda alta desciende hasta -20 dB desde el punto en el que la respuesta de frecuencia del filtro de banda baja desciende hasta -20 dB;
un primer codificador (A120) de voz configurado para codificar la señal de voz de banda baja en al menos una señal de excitación de banda baja codificada y una pluralidad de parámetros de filtro de banda baja; y
un segundo codificador (A200) de voz configurado para generar una señal de excitación de banda alta en función de la señal de excitación de banda baja codificada y para codificar la señal de banda alta, según la señal de excitación de banda alta, en al menos una pluralidad de parámetros de filtro de banda alta,
caracterizado porque la banda de paso de la trayectoria de procesamiento de banda baja se solapa con la banda de paso de la trayectoria de procesamiento de banda alta entre 400 y 1000 Hz aproximadamente.
2. El aparato según la reivindicación 1, en el que dicho segundo codificador de voz está configurado para generar la señal de excitación de banda alta aplicando una función no lineal a una señal que está basada en la señal de excitación de banda baja codificada para generar una señal ensanchada en el espectro, y en el que la señal de excitación de banda alta está basada en la señal ensanchada en el espectro.
3. El aparato según la reivindicación 1, en el que el segundo codificador de voz está configurado para codificar una envolvente de ganancia de la señal de banda alta.
4. El aparato según la reivindicación 3, en el que el segundo codificador de voz está configurado para generar una señal de banda alta sintetizada según la señal de excitación de banda alta y la pluralidad de parámetros de filtro de banda alta, y en el que el segundo codificador de voz está configurado para codificar la envolvente de ganancia en función de la señal de banda alta sintetizada.
5. El aparato según la reivindicación 4, en el que el segundo codificador está configurado para codificar la envolvente de ganancia en función de una relación entre la señal de banda alta y la señal de banda alta sintetizada.
6. El aparato según la reivindicación 1, en el que la banda de paso de la trayectoria de procesamiento de banda baja se solapa con la banda de paso de la trayectoria de procesamiento de banda alta en 500 Hz aproximadamente.
7. El aparato según la reivindicación 1, en el que la banda de paso de la trayectoria de procesamiento de banda baja se solapa con la banda de paso de la trayectoria de procesamiento de banda alta entre 400 y 600 Hz aproximadamente.
8. El aparato según la reivindicación 1, en el que el solapamiento incluye al menos una parte del intervalo de frecuencias comprendido entre 2000 Hz aproximadamente y 5000 Hz aproximadamente.
9. El aparato según la reivindicación 1, en el que el solapamiento incluye al menos una parte del intervalo de frecuencias comprendido entre 3000 Hz aproximadamente y 4000 Hz aproximadamente.
10. El aparato según la reivindicación 1, en el que la señal de voz de banda baja y la señal de voz de banda alta tienen diferentes tasas de muestreo.
11. El aparato según la reivindicación 1, en el que una suma de las tasas de muestreo de la señal de voz de banda baja y de la señal de voz de banda alta no es mayor que la tasa de muestreo de la señal de banda ancha.
12. El aparato según la reivindicación 1, comprendiendo dicho aparato un teléfono celular.
13. El aparato según la reivindicación 1, comprendiendo dicho aparato un dispositivo configurado para transmitir una pluralidad de paquetes compatibles con una versión del protocolo de Internet, donde la pluralidad de paquetes describe la señal de excitación de banda baja codificada, la pluralidad de parámetros de filtro de banda baja y la pluralidad de parámetros de filtro de banda alta.
14. El aparato según la reivindicación 1, en el que:
A)
la trayectoria de procesamiento de banda baja está configurada para recibir la señal de voz de banda ancha que presenta un contenido de frecuencia entre al menos 1000 y 6000 Hz y para generar la señal de voz de banda baja que está basada en una primera parte del contenido de frecuencia de la señal de banda ancha, incluyendo la primera parte la parte de la señal de banda ancha entre 1000 y 3000 Hz, y
B)
la trayectoria de procesamiento de banda alta está configurada para recibir la señal de voz de banda ancha y para generar la señal de voz de banda alta, que está basada en una segunda parte del contenido de frecuencia de la señal de banda ancha,
en el que la segunda parte incluye la parte de la señal de banda ancha entre 4000 y 6000 Hz, y
tanto la señal de voz de banda baja como la señal de voz de banda alta están basadas en una tercera parte del contenido de frecuencia de la señal de banda ancha, incluyendo la tercera parte una parte de la señal de banda ancha entre 3000 y 4000 Hz que presenta un ancho de al menos 400 Hz.
15. El aparato según la reivindicación 14, en el que la señal de voz de banda baja incluye contenido de frecuencia de la primera parte y contenido de frecuencia de la tercera parte, y en el que la señal de voz de banda alta incluye contenido de frecuencia de la segunda parte y contenido de frecuencia de la tercera parte.
16. El aparato según la reivindicación 14, en el que la señal de voz de banda baja y la señal de voz de banda alta presentan diferentes tasas de muestreo.
17. El aparato según la reivindicación 14, en el que una suma de las tasas de muestreo de la señal de voz de banda baja y de la señal de voz de banda alta no es mayor que la tasa de muestreo de la señal de banda ancha.
18. El aparato según la reivindicación 14, comprendiendo dicho aparato un teléfono celular.
19. El aparato según la reivindicación 14, en el que el primer codificador de voz está configurado para codificar la señal de voz de banda baja en al menos una señal de excitación de banda baja codificada y una pluralidad de parámetros de filtro de banda baja, y en el que el segundo codificador de voz está configurado para generar una señal de excitación de banda alta en función de la señal de excitación de banda baja codificada y para codificar la señal de banda alta, según la señal de excitación de banda alta, en al menos una pluralidad de parámetros de filtro de banda alta.
20. El aparato según la reivindicación 19, en el que el segundo codificador de voz está configurado para codificar la señal de banda alta en al menos una pluralidad de parámetros de filtro de banda alta y una pluralidad de factores de ganancia.
21. El aparato según la reivindicación 19, comprendiendo dicho aparato un dispositivo configurado para transmitir una pluralidad de paquetes compatibles con una versión del protocolo de Internet, en el que la pluralidad de paquetes describe la señal de excitación de banda baja codificada, la pluralidad de parámetros de filtro de banda baja y la pluralidad de parámetros de filtro de banda alta.
22. Un procedimiento de procesamiento de señales, comprendiendo dicho procedimiento:
generar una señal de voz de banda baja en función de una señal de voz de banda ancha que presenta un contenido de frecuencia entre al menos 1000 y 6000 Hz;
codificar la señal de voz de banda baja;
generar una señal de voz de banda alta en función de la señal de voz de banda ancha; y
codificar la señal de voz de banda alta;
en el que dicha generación de una señal de voz de banda baja incluye generar la señal de voz de banda baja en función de
A)
una primera parte del contenido de frecuencia de la señal de banda ancha, incluyendo la primera parte la parte de la señal de banda ancha entre 1000 y 2000 Hz, y
B)
una tercera parte del contenido de frecuencia de la señal de banda ancha,
caracterizado porque
la tercera parte incluye una parte de la señal de banda ancha entre 2000 y 5000 Hz que presenta un ancho de al menos 400 Hz hasta 1000 Hz aproximadamente a -20 dB, y porque generar una señal de voz de banda alta incluye generar la señal de voz de banda alta en función de
C)
una segunda parte del contenido de frecuencia de la señal de banda ancha, incluyendo la segunda parte la parte de la señal de banda ancha entre 5000 y 6000 Hz, y
D)
la tercera parte del contenido de frecuencia de la señal de banda ancha.
23. El procedimiento según la reivindicación 22, en el que la primera parte de la señal de banda ancha incluye la parte de la señal de banda ancha entre 1000 y 3000 Hz, y
en el que la segunda parte de la señal de banda ancha incluye la parte de la señal de banda ancha entre 4000 y 6000 Hz, y
en el que la tercera parte incluye una parte de la señal de banda ancha entre 3000 y 4000 Hz que presenta un ancho de al menos 250 Hz.
24. El procedimiento según la reivindicación 22, en el que la señal de voz de banda baja incluye contenido de frecuencia de la primera parte y contenido de frecuencia de la tercera parte, y
en el que la señal de voz de banda alta incluye contenido de frecuencia de la segunda parte y contenido de frecuencia de la tercera parte.
25. El procedimiento según la reivindicación 22, en el que la señal de voz de banda baja y la señal de voz de banda alta presentan diferentes tasas de muestreo.
26. El aparato según la reivindicación 22, en el que una suma de las tasas de muestreo de la señal de voz de banda baja y de la señal de voz de banda alta no es mayor que la tasa de muestreo de la señal de banda ancha.
27. El procedimiento según la reivindicación 22, en el que el primer codificador de voz está configurado para codificar la señal de voz de banda baja en al menos una señal de excitación de banda baja codificada y una pluralidad de parámetros de filtro de banda baja, y en el que el segundo codificador de voz está configurado para generar una señal de excitación de banda alta en función de la señal de excitación de banda baja codificada y para codificar la señal de banda alta, según la señal de excitación de banda alta, en al menos una pluralidad de parámetros de filtro de banda alta.
28. El procedimiento según la reivindicación 22, en el que el segundo codificador de voz está configurado para codificar la señal de banda alta en al menos una pluralidad de parámetros de filtro de banda alta y una pluralidad de factores de ganancia.
ES06740354T 2005-04-01 2006-04-03 Aparato y procedimiento para codificar mediante banda dividida una señal de voz. Expired - Lifetime ES2340608T3 (es)

Applications Claiming Priority (4)

Application Number Priority Date Filing Date Title
US66790105P 2005-04-01 2005-04-01
US667901P 2005-04-01
US67396505P 2005-04-22 2005-04-22
US673965P 2005-04-22

Publications (1)

Publication Number Publication Date
ES2340608T3 true ES2340608T3 (es) 2010-06-07

Family

ID=36588741

Family Applications (3)

Application Number Title Priority Date Filing Date
ES06784345T Expired - Lifetime ES2391292T3 (es) 2005-04-01 2006-04-03 Sistemas, procedimientos y aparato para la generación de una señal de excitación de banda alta
ES06740354T Expired - Lifetime ES2340608T3 (es) 2005-04-01 2006-04-03 Aparato y procedimiento para codificar mediante banda dividida una señal de voz.
ES06740358.4T Expired - Lifetime ES2636443T3 (es) 2005-04-01 2006-04-03 Sistemas, procedimientos y aparatos para codificación de voz de banda ancha

Family Applications Before (1)

Application Number Title Priority Date Filing Date
ES06784345T Expired - Lifetime ES2391292T3 (es) 2005-04-01 2006-04-03 Sistemas, procedimientos y aparato para la generación de una señal de excitación de banda alta

Family Applications After (1)

Application Number Title Priority Date Filing Date
ES06740358.4T Expired - Lifetime ES2636443T3 (es) 2005-04-01 2006-04-03 Sistemas, procedimientos y aparatos para codificación de voz de banda ancha

Country Status (23)

Country Link
US (8) US8260611B2 (es)
EP (8) EP1866914B1 (es)
JP (8) JP5129116B2 (es)
KR (8) KR100956624B1 (es)
CN (1) CN102411935B (es)
AT (4) ATE485582T1 (es)
AU (8) AU2006232357C1 (es)
BR (8) BRPI0609530B1 (es)
CA (8) CA2603187C (es)
DE (4) DE602006018884D1 (es)
DK (2) DK1864101T3 (es)
ES (3) ES2391292T3 (es)
IL (8) IL186438A (es)
MX (8) MX2007012182A (es)
NO (7) NO340428B1 (es)
NZ (6) NZ562183A (es)
PL (4) PL1864282T3 (es)
PT (2) PT1864282T (es)
RU (9) RU2491659C2 (es)
SG (4) SG163555A1 (es)
SI (1) SI1864282T1 (es)
TW (8) TWI319565B (es)
WO (8) WO2006107837A1 (es)

Families Citing this family (329)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7987095B2 (en) * 2002-09-27 2011-07-26 Broadcom Corporation Method and system for dual mode subband acoustic echo canceller with integrated noise suppression
US7619995B1 (en) * 2003-07-18 2009-11-17 Nortel Networks Limited Transcoders and mixers for voice-over-IP conferencing
JP4679049B2 (ja) 2003-09-30 2011-04-27 パナソニック株式会社 スケーラブル復号化装置
US7668712B2 (en) * 2004-03-31 2010-02-23 Microsoft Corporation Audio encoding and decoding with intra frames and adaptive forward error correction
EP3336843B1 (en) * 2004-05-14 2021-06-23 Panasonic Intellectual Property Corporation of America Speech coding method and speech coding apparatus
US8725501B2 (en) * 2004-07-20 2014-05-13 Panasonic Corporation Audio decoding device and compensation frame generation method
CN101873266B (zh) * 2004-08-30 2015-11-25 高通股份有限公司 用于语音ip传输的自适应去抖动缓冲器
US8085678B2 (en) * 2004-10-13 2011-12-27 Qualcomm Incorporated Media (voice) playback (de-jitter) buffer adjustments based on air interface
US8355907B2 (en) * 2005-03-11 2013-01-15 Qualcomm Incorporated Method and apparatus for phase matching frames in vocoders
US8155965B2 (en) * 2005-03-11 2012-04-10 Qualcomm Incorporated Time warping frames inside the vocoder by modifying the residual
EP1872364B1 (en) * 2005-03-30 2010-11-24 Nokia Corporation Source coding and/or decoding
US8260611B2 (en) * 2005-04-01 2012-09-04 Qualcomm Incorporated Systems, methods, and apparatus for highband excitation generation
PT1875463T (pt) * 2005-04-22 2019-01-24 Qualcomm Inc Sistemas, métodos e aparelho para nivelamento de fator de ganho
ES2327566T3 (es) * 2005-04-28 2009-10-30 Siemens Aktiengesellschaft Procedimiento y dispositivo para la supresion de ruidos.
US7707034B2 (en) * 2005-05-31 2010-04-27 Microsoft Corporation Audio codec post-filter
US7831421B2 (en) 2005-05-31 2010-11-09 Microsoft Corporation Robust decoder
US7177804B2 (en) * 2005-05-31 2007-02-13 Microsoft Corporation Sub-band voice codec with multi-stage codebooks and redundant coding
DE102005032724B4 (de) * 2005-07-13 2009-10-08 Siemens Ag Verfahren und Vorrichtung zur künstlichen Erweiterung der Bandbreite von Sprachsignalen
EP1905009B1 (en) * 2005-07-14 2009-09-16 Koninklijke Philips Electronics N.V. Audio signal synthesis
US8169890B2 (en) * 2005-07-20 2012-05-01 Qualcomm Incorporated Systems and method for high data rate ultra wideband communication
KR101171098B1 (ko) * 2005-07-22 2012-08-20 삼성전자주식회사 혼합 구조의 스케일러블 음성 부호화 방법 및 장치
US8326614B2 (en) * 2005-09-02 2012-12-04 Qnx Software Systems Limited Speech enhancement system
CA2558595C (en) * 2005-09-02 2015-05-26 Nortel Networks Limited Method and apparatus for extending the bandwidth of a speech signal
EP1926083A4 (en) * 2005-09-30 2011-01-26 Panasonic Corp AUDIOCODING DEVICE AND AUDIOCODING METHOD
US7991611B2 (en) * 2005-10-14 2011-08-02 Panasonic Corporation Speech encoding apparatus and speech encoding method that encode speech signals in a scalable manner, and speech decoding apparatus and speech decoding method that decode scalable encoded signals
RU2008114382A (ru) * 2005-10-14 2009-10-20 Панасоник Корпорэйшн (Jp) Кодер с преобразованием и способ кодирования с преобразованием
JP4876574B2 (ja) * 2005-12-26 2012-02-15 ソニー株式会社 信号符号化装置及び方法、信号復号装置及び方法、並びにプログラム及び記録媒体
EP1852848A1 (en) * 2006-05-05 2007-11-07 Deutsche Thomson-Brandt GmbH Method and apparatus for lossless encoding of a source signal using a lossy encoded data stream and a lossless extension data stream
US8949120B1 (en) 2006-05-25 2015-02-03 Audience, Inc. Adaptive noise cancelation
US8135047B2 (en) 2006-07-31 2012-03-13 Qualcomm Incorporated Systems and methods for including an identifier with a packet associated with a speech signal
US8725499B2 (en) 2006-07-31 2014-05-13 Qualcomm Incorporated Systems, methods, and apparatus for signal change detection
US7987089B2 (en) * 2006-07-31 2011-07-26 Qualcomm Incorporated Systems and methods for modifying a zero pad region of a windowed frame of an audio signal
US8260609B2 (en) 2006-07-31 2012-09-04 Qualcomm Incorporated Systems, methods, and apparatus for wideband encoding and decoding of inactive frames
US8532984B2 (en) 2006-07-31 2013-09-10 Qualcomm Incorporated Systems, methods, and apparatus for wideband encoding and decoding of active frames
US8024192B2 (en) * 2006-08-15 2011-09-20 Broadcom Corporation Time-warping of decoded audio signal after packet loss
WO2008021247A2 (en) 2006-08-15 2008-02-21 Dolby Laboratories Licensing Corporation Arbitrary shaping of temporal noise envelope without side-information
US8239190B2 (en) * 2006-08-22 2012-08-07 Qualcomm Incorporated Time-warping frames of wideband vocoder
US8046218B2 (en) * 2006-09-19 2011-10-25 The Board Of Trustees Of The University Of Illinois Speech and method for identifying perceptual features
JP4972742B2 (ja) * 2006-10-17 2012-07-11 国立大学法人九州工業大学 高域信号補間方法及び高域信号補間装置
PL3848928T3 (pl) 2006-10-25 2023-07-17 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Urządzenie i sposób do generowania wartości podpasm audio o wartościach zespolonych
USRE50158E1 (en) 2006-10-25 2024-10-01 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Apparatus and method for generating audio subband values and apparatus and method for generating time-domain audio samples
KR101565919B1 (ko) 2006-11-17 2015-11-05 삼성전자주식회사 고주파수 신호 부호화 및 복호화 방법 및 장치
KR101375582B1 (ko) 2006-11-17 2014-03-20 삼성전자주식회사 대역폭 확장 부호화 및 복호화 방법 및 장치
US8639500B2 (en) * 2006-11-17 2014-01-28 Samsung Electronics Co., Ltd. Method, medium, and apparatus with bandwidth extension encoding and/or decoding
US8005671B2 (en) * 2006-12-04 2011-08-23 Qualcomm Incorporated Systems and methods for dynamic normalization to reduce loss in precision for low-level signals
GB2444757B (en) * 2006-12-13 2009-04-22 Motorola Inc Code excited linear prediction speech coding
US20080147389A1 (en) * 2006-12-15 2008-06-19 Motorola, Inc. Method and Apparatus for Robust Speech Activity Detection
FR2911020B1 (fr) * 2006-12-28 2009-05-01 Actimagine Soc Par Actions Sim Procede et dispositif de codage audio
FR2911031B1 (fr) * 2006-12-28 2009-04-10 Actimagine Soc Par Actions Sim Procede et dispositif de codage audio
KR101379263B1 (ko) 2007-01-12 2014-03-28 삼성전자주식회사 대역폭 확장 복호화 방법 및 장치
US7873064B1 (en) * 2007-02-12 2011-01-18 Marvell International Ltd. Adaptive jitter buffer-packet loss concealment
US8032359B2 (en) 2007-02-14 2011-10-04 Mindspeed Technologies, Inc. Embedded silence and background noise compression
GB0704622D0 (en) * 2007-03-09 2007-04-18 Skype Ltd Speech coding system and method
KR101411900B1 (ko) * 2007-05-08 2014-06-26 삼성전자주식회사 오디오 신호의 부호화 및 복호화 방법 및 장치
US9653088B2 (en) 2007-06-13 2017-05-16 Qualcomm Incorporated Systems, methods, and apparatus for signal encoding using pitch-regularizing and non-pitch-regularizing coding
DK2186089T3 (en) 2007-08-27 2019-01-07 Ericsson Telefon Ab L M Method and apparatus for perceptual spectral decoding of an audio signal including filling in spectral holes
FR2920545B1 (fr) * 2007-09-03 2011-06-10 Univ Sud Toulon Var Procede de trajectographie de plusieurs cetaces par acoustique passive
JP5547081B2 (ja) * 2007-11-02 2014-07-09 華為技術有限公司 音声復号化方法及び装置
WO2009059633A1 (en) * 2007-11-06 2009-05-14 Nokia Corporation An encoder
EP2227682A1 (en) * 2007-11-06 2010-09-15 Nokia Corporation An encoder
EP2220646A1 (en) * 2007-11-06 2010-08-25 Nokia Corporation Audio coding apparatus and method thereof
KR101444099B1 (ko) * 2007-11-13 2014-09-26 삼성전자주식회사 음성 구간 검출 방법 및 장치
EP2218068A4 (en) * 2007-11-21 2010-11-24 Lg Electronics Inc METHOD AND APPARATUS FOR SIGNAL PROCESSING
US8688441B2 (en) * 2007-11-29 2014-04-01 Motorola Mobility Llc Method and apparatus to facilitate provision and use of an energy value to determine a spectral envelope shape for out-of-signal bandwidth content
US8050934B2 (en) * 2007-11-29 2011-11-01 Texas Instruments Incorporated Local pitch control based on seamless time scale modification and synchronized sampling rate conversion
TWI356399B (en) * 2007-12-14 2012-01-11 Ind Tech Res Inst Speech recognition system and method with cepstral
KR101439205B1 (ko) * 2007-12-21 2014-09-11 삼성전자주식회사 오디오 매트릭스 인코딩 및 디코딩 방법 및 장치
JPWO2009084221A1 (ja) * 2007-12-27 2011-05-12 パナソニック株式会社 符号化装置、復号装置およびこれらの方法
KR101413967B1 (ko) * 2008-01-29 2014-07-01 삼성전자주식회사 오디오 신호의 부호화 방법 및 복호화 방법, 및 그에 대한 기록 매체, 오디오 신호의 부호화 장치 및 복호화 장치
KR101413968B1 (ko) * 2008-01-29 2014-07-01 삼성전자주식회사 오디오 신호의 부호화, 복호화 방법 및 장치
DE102008015702B4 (de) 2008-01-31 2010-03-11 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zur Bandbreitenerweiterung eines Audiosignals
US8433582B2 (en) * 2008-02-01 2013-04-30 Motorola Mobility Llc Method and apparatus for estimating high-band energy in a bandwidth extension system
US20090201983A1 (en) * 2008-02-07 2009-08-13 Motorola, Inc. Method and apparatus for estimating high-band energy in a bandwidth extension system
US8326641B2 (en) * 2008-03-20 2012-12-04 Samsung Electronics Co., Ltd. Apparatus and method for encoding and decoding using bandwidth extension in portable terminal
US8983832B2 (en) * 2008-07-03 2015-03-17 The Board Of Trustees Of The University Of Illinois Systems and methods for identifying speech sound features
NO2313887T3 (es) 2008-07-10 2018-02-10
MY154452A (en) * 2008-07-11 2015-06-15 Fraunhofer Ges Forschung An apparatus and a method for decoding an encoded audio signal
RU2621965C2 (ru) 2008-07-11 2017-06-08 Фраунхофер-Гезелльшафт цур Фёрдерунг дер ангевандтен Форшунг Е.Ф. Передатчик сигнала активации с деформацией по времени, кодер звукового сигнала, способ преобразования сигнала активации с деформацией по времени, способ кодирования звукового сигнала и компьютерные программы
BRPI0904958B1 (pt) 2008-07-11 2020-03-03 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Aparelho e método para calcular dados de extensão de largura de banda usando um quadro controlado por inclinação espectral
KR101614160B1 (ko) 2008-07-16 2016-04-20 한국전자통신연구원 포스트 다운믹스 신호를 지원하는 다객체 오디오 부호화 장치 및 복호화 장치
WO2010011963A1 (en) * 2008-07-25 2010-01-28 The Board Of Trustees Of The University Of Illinois Methods and systems for identifying speech sounds using multi-dimensional analysis
US8463412B2 (en) * 2008-08-21 2013-06-11 Motorola Mobility Llc Method and apparatus to facilitate determining signal bounding frequencies
WO2010028301A1 (en) * 2008-09-06 2010-03-11 GH Innovation, Inc. Spectrum harmonic/noise sharpness control
US8532998B2 (en) 2008-09-06 2013-09-10 Huawei Technologies Co., Ltd. Selective bandwidth extension for encoding/decoding audio/speech signal
US8352279B2 (en) * 2008-09-06 2013-01-08 Huawei Technologies Co., Ltd. Efficient temporal envelope coding approach by prediction between low band signal and high band signal
WO2010028292A1 (en) * 2008-09-06 2010-03-11 Huawei Technologies Co., Ltd. Adaptive frequency prediction
WO2010028299A1 (en) * 2008-09-06 2010-03-11 Huawei Technologies Co., Ltd. Noise-feedback for spectral envelope quantization
US20100070550A1 (en) * 2008-09-12 2010-03-18 Cardinal Health 209 Inc. Method and apparatus of a sensor amplifier configured for use in medical applications
KR101178801B1 (ko) * 2008-12-09 2012-08-31 한국전자통신연구원 음원분리 및 음원식별을 이용한 음성인식 장치 및 방법
US8577673B2 (en) * 2008-09-15 2013-11-05 Huawei Technologies Co., Ltd. CELP post-processing for music signals
WO2010031003A1 (en) 2008-09-15 2010-03-18 Huawei Technologies Co., Ltd. Adding second enhancement layer to celp based core layer
EP2224433B1 (en) * 2008-09-25 2020-05-27 Lg Electronics Inc. An apparatus for processing an audio signal and method thereof
WO2010053287A2 (en) * 2008-11-04 2010-05-14 Lg Electronics Inc. An apparatus for processing an audio signal and method thereof
DE102008058496B4 (de) * 2008-11-21 2010-09-09 Siemens Medical Instruments Pte. Ltd. Filterbanksystem mit spezifischen Sperrdämpfungsanteilen für eine Hörvorrichtung
US9947340B2 (en) 2008-12-10 2018-04-17 Skype Regeneration of wideband speech
GB2466201B (en) * 2008-12-10 2012-07-11 Skype Ltd Regeneration of wideband speech
GB0822537D0 (en) 2008-12-10 2009-01-14 Skype Ltd Regeneration of wideband speech
JP5423684B2 (ja) * 2008-12-19 2014-02-19 富士通株式会社 音声帯域拡張装置及び音声帯域拡張方法
GB2466671B (en) * 2009-01-06 2013-03-27 Skype Speech encoding
GB2466673B (en) * 2009-01-06 2012-11-07 Skype Quantization
GB2466669B (en) * 2009-01-06 2013-03-06 Skype Speech coding
GB2466672B (en) * 2009-01-06 2013-03-13 Skype Speech coding
GB2466670B (en) * 2009-01-06 2012-11-14 Skype Speech encoding
GB2466675B (en) * 2009-01-06 2013-03-06 Skype Speech coding
GB2466674B (en) 2009-01-06 2013-11-13 Skype Speech coding
ES3023486T3 (en) 2009-01-16 2025-06-02 Dolby Int Ab Cross product enhanced harmonic transposition
US8463599B2 (en) * 2009-02-04 2013-06-11 Motorola Mobility Llc Bandwidth extension method and apparatus for a modified discrete cosine transform audio coder
EP2555191A1 (en) * 2009-03-31 2013-02-06 Huawei Technologies Co., Ltd. Method and device for audio signal denoising
JP4921611B2 (ja) * 2009-04-03 2012-04-25 株式会社エヌ・ティ・ティ・ドコモ 音声復号装置、音声復号方法、及び音声復号プログラム
JP4932917B2 (ja) * 2009-04-03 2012-05-16 株式会社エヌ・ティ・ティ・ドコモ 音声復号装置、音声復号方法、及び音声復号プログラム
CN102460574A (zh) * 2009-05-19 2012-05-16 韩国电子通信研究院 用于使用层级正弦脉冲编码对音频信号进行编码和解码的方法和设备
US8000485B2 (en) * 2009-06-01 2011-08-16 Dts, Inc. Virtual audio processing for loudspeaker or headphone playback
CN101609680B (zh) * 2009-06-01 2012-01-04 华为技术有限公司 压缩编码和解码的方法、编码器和解码器以及编码装置
KR20110001130A (ko) * 2009-06-29 2011-01-06 삼성전자주식회사 가중 선형 예측 변환을 이용한 오디오 신호 부호화 및 복호화 장치 및 그 방법
WO2011029484A1 (en) * 2009-09-14 2011-03-17 Nokia Corporation Signal enhancement processing
WO2011037587A1 (en) * 2009-09-28 2011-03-31 Nuance Communications, Inc. Downsampling schemes in a hierarchical neural network structure for phoneme recognition
US8452606B2 (en) * 2009-09-29 2013-05-28 Skype Speech encoding using multiple bit rates
JP5754899B2 (ja) * 2009-10-07 2015-07-29 ソニー株式会社 復号装置および方法、並びにプログラム
ES2531013T3 (es) 2009-10-20 2015-03-10 Fraunhofer Ges Forschung Codificador de audio, decodificador de audio, método para codificar información de audio, método para decodificar información de audio y programa de computación que usa la detección de un grupo de valores espectrales previamente decodificados
CN102257567B (zh) * 2009-10-21 2014-05-07 松下电器产业株式会社 音响信号处理装置、音响编码装置及音响解码装置
ES3051141T3 (en) 2009-10-21 2025-12-26 Dolby Int Ab Oversampling in a combined transposer filter bank
US8484020B2 (en) 2009-10-23 2013-07-09 Qualcomm Incorporated Determining an upperband signal from a narrowband signal
EP2502230B1 (en) * 2009-11-19 2014-05-21 Telefonaktiebolaget L M Ericsson (PUBL) Improved excitation signal bandwidth extension
JP5619177B2 (ja) * 2009-11-19 2014-11-05 テレフオンアクチーボラゲット エル エムエリクソン(パブル) 低域オーディオ信号の帯域拡張
US8489393B2 (en) * 2009-11-23 2013-07-16 Cambridge Silicon Radio Limited Speech intelligibility
US9838784B2 (en) 2009-12-02 2017-12-05 Knowles Electronics, Llc Directional audio capture
RU2464651C2 (ru) * 2009-12-22 2012-10-20 Общество с ограниченной ответственностью "Спирит Корп" Способ и устройство многоуровневого масштабируемого устойчивого к информационным потерям кодирования речи для сетей с коммутацией пакетов
US20110167445A1 (en) * 2010-01-06 2011-07-07 Reams Robert W Audiovisual content channelization system
US8326607B2 (en) * 2010-01-11 2012-12-04 Sony Ericsson Mobile Communications Ab Method and arrangement for enhancing speech quality
BR122021008581B1 (pt) * 2010-01-12 2022-08-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Codificador de áudio, decodificador de áudio, método de codificação e informação de áudio, e método de decodificação de uma informação de áudio que utiliza uma tabela hash que descreve tanto valores de estado significativos como limites de intervalo
US8699727B2 (en) 2010-01-15 2014-04-15 Apple Inc. Visually-assisted mixing of audio using a spectral analyzer
US9525569B2 (en) * 2010-03-03 2016-12-20 Skype Enhanced circuit-switched calls
ES2458354T3 (es) * 2010-03-10 2014-05-05 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Decodificador de señales de audio, codificador de señales de audio, métodos y programa de ordenador que utiliza tasa de muestreo dependiente de la codificación del contorno de distorsión en el tiempo
US8700391B1 (en) * 2010-04-01 2014-04-15 Audience, Inc. Low complexity bandwidth expansion of speech
WO2011128723A1 (en) * 2010-04-12 2011-10-20 Freescale Semiconductor, Inc. Audio communication device, method for outputting an audio signal, and communication system
JP5652658B2 (ja) 2010-04-13 2015-01-14 ソニー株式会社 信号処理装置および方法、符号化装置および方法、復号装置および方法、並びにプログラム
JP5719922B2 (ja) * 2010-04-13 2015-05-20 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン サンプルごとに正確なオーディオ信号表現のための方法、エンコーダ及びデコーダ
JP5609737B2 (ja) 2010-04-13 2014-10-22 ソニー株式会社 信号処理装置および方法、符号化装置および方法、復号装置および方法、並びにプログラム
JP5850216B2 (ja) 2010-04-13 2016-02-03 ソニー株式会社 信号処理装置および方法、符号化装置および方法、復号装置および方法、並びにプログラム
RU2547238C2 (ru) * 2010-04-14 2015-04-10 Войсэйдж Корпорейшн Гибкая и масштабируемая комбинированная обновляющая кодовая книга для использования в кодере и декодере celp
US9443534B2 (en) * 2010-04-14 2016-09-13 Huawei Technologies Co., Ltd. Bandwidth extension system and approach
CN102947882B (zh) * 2010-04-16 2015-06-17 弗劳恩霍夫应用研究促进协会 使用制导带宽扩展和盲带宽扩展生成宽带信号的装置、方法
US8473287B2 (en) 2010-04-19 2013-06-25 Audience, Inc. Method for jointly optimizing noise reduction and voice quality in a mono or multi-microphone system
US8538035B2 (en) 2010-04-29 2013-09-17 Audience, Inc. Multi-microphone robust noise suppression
US8798290B1 (en) 2010-04-21 2014-08-05 Audience, Inc. Systems and methods for adaptive signal equalization
US8781137B1 (en) 2010-04-27 2014-07-15 Audience, Inc. Wind noise detection and suppression
US9378754B1 (en) 2010-04-28 2016-06-28 Knowles Electronics, Llc Adaptive spatial classifier for multi-microphone systems
US9558755B1 (en) 2010-05-20 2017-01-31 Knowles Electronics, Llc Noise suppression assisted automatic speech recognition
KR101660843B1 (ko) 2010-05-27 2016-09-29 삼성전자주식회사 Lpc 계수 양자화를 위한 가중치 함수 결정 장치 및 방법
US8600737B2 (en) * 2010-06-01 2013-12-03 Qualcomm Incorporated Systems, methods, apparatus, and computer program products for wideband speech coding
ES2372202B2 (es) * 2010-06-29 2012-08-08 Universidad De Málaga Sistema de reconocimiento de sonidos de bajo consumo.
KR101696632B1 (ko) 2010-07-02 2017-01-16 돌비 인터네셔널 에이비 선택적인 베이스 포스트 필터
US8447596B2 (en) 2010-07-12 2013-05-21 Audience, Inc. Monaural noise suppression based on computational auditory scene analysis
JP5589631B2 (ja) * 2010-07-15 2014-09-17 富士通株式会社 音声処理装置、音声処理方法および電話装置
US8977542B2 (en) 2010-07-16 2015-03-10 Telefonaktiebolaget L M Ericsson (Publ) Audio encoder and decoder and methods for encoding and decoding an audio signal
JP5777041B2 (ja) * 2010-07-23 2015-09-09 沖電気工業株式会社 帯域拡張装置及びプログラム、並びに、音声通信装置
JP6075743B2 (ja) 2010-08-03 2017-02-08 ソニー株式会社 信号処理装置および方法、並びにプログラム
WO2012031125A2 (en) 2010-09-01 2012-03-08 The General Hospital Corporation Reversal of general anesthesia by administration of methylphenidate, amphetamine, modafinil, amantadine, and/or caffeine
IL317702A (en) 2010-09-16 2025-02-01 Dolby Int Ab Method and system for harmonic, block, subchannel, and enhanced transposition by rhetorical multiplication
US8924200B2 (en) 2010-10-15 2014-12-30 Motorola Mobility Llc Audio signal bandwidth extension in CELP-based speech coder
JP5707842B2 (ja) 2010-10-15 2015-04-30 ソニー株式会社 符号化装置および方法、復号装置および方法、並びにプログラム
WO2012053149A1 (ja) * 2010-10-22 2012-04-26 パナソニック株式会社 音声分析装置、量子化装置、逆量子化装置、及びこれらの方法
JP5743137B2 (ja) * 2011-01-14 2015-07-01 ソニー株式会社 信号処理装置および方法、並びにプログラム
US9767823B2 (en) 2011-02-07 2017-09-19 Qualcomm Incorporated Devices for encoding and detecting a watermarked signal
US8880404B2 (en) 2011-02-07 2014-11-04 Qualcomm Incorporated Devices for adaptively encoding and decoding a watermarked signal
US9767822B2 (en) 2011-02-07 2017-09-19 Qualcomm Incorporated Devices for encoding and decoding a watermarked signal
TWI488176B (zh) 2011-02-14 2015-06-11 Fraunhofer Ges Forschung 音訊信號音軌脈衝位置之編碼與解碼技術
KR101613673B1 (ko) 2011-02-14 2016-04-29 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 불활성 위상 동안에 잡음 합성을 사용하는 오디오 코덱
BR112013020324B8 (pt) 2011-02-14 2022-02-08 Fraunhofer Ges Forschung Aparelho e método para supressão de erro em fala unificada de baixo atraso e codificação de áudio
TWI479478B (zh) 2011-02-14 2015-04-01 弗勞恩霍夫爾協會 用以使用對齊的預看部分將音訊信號解碼的裝置與方法
TWI564882B (zh) 2011-02-14 2017-01-01 弗勞恩霍夫爾協會 利用重疊變換之資訊信號表示技術(一)
AU2012217162B2 (en) * 2011-02-14 2015-11-26 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Noise generation in audio codecs
KR101699898B1 (ko) 2011-02-14 2017-01-25 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 스펙트럼 영역에서 디코딩된 오디오 신호를 처리하기 위한 방법 및 장치
EP2676267B1 (en) 2011-02-14 2017-07-19 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Encoding and decoding of pulse positions of tracks of an audio signal
WO2012110448A1 (en) 2011-02-14 2012-08-23 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for coding a portion of an audio signal using a transient detection and a quality result
WO2012112357A1 (en) * 2011-02-16 2012-08-23 Dolby Laboratories Licensing Corporation Methods and systems for generating filter coefficients and configuring filters
CN104916290B (zh) * 2011-02-18 2018-11-06 株式会社Ntt都科摩 语音解码装置、语音编码装置、语音解码方法以及语音编码方法
US9165558B2 (en) 2011-03-09 2015-10-20 Dts Llc System for dynamically creating and rendering audio objects
US9298287B2 (en) 2011-03-31 2016-03-29 Microsoft Technology Licensing, Llc Combined activation for natural user interface systems
US9244984B2 (en) 2011-03-31 2016-01-26 Microsoft Technology Licensing, Llc Location based conversational understanding
US9842168B2 (en) 2011-03-31 2017-12-12 Microsoft Technology Licensing, Llc Task driven user intents
US10642934B2 (en) 2011-03-31 2020-05-05 Microsoft Technology Licensing, Llc Augmented conversational understanding architecture
US9760566B2 (en) 2011-03-31 2017-09-12 Microsoft Technology Licensing, Llc Augmented conversational understanding agent to identify conversation context between two humans and taking an agent action thereof
JP5704397B2 (ja) * 2011-03-31 2015-04-22 ソニー株式会社 符号化装置および方法、並びにプログラム
US9064006B2 (en) 2012-08-23 2015-06-23 Microsoft Technology Licensing, Llc Translating natural language utterances to keyword search queries
CN102811034A (zh) 2011-05-31 2012-12-05 财团法人工业技术研究院 信号处理装置及信号处理方法
WO2012169133A1 (ja) * 2011-06-09 2012-12-13 パナソニック株式会社 音声符号化装置、音声復号装置、音声符号化方法及び音声復号方法
US9070361B2 (en) * 2011-06-10 2015-06-30 Google Technology Holdings LLC Method and apparatus for encoding a wideband speech signal utilizing downmixing of a highband component
WO2013002623A2 (ko) 2011-06-30 2013-01-03 삼성전자 주식회사 대역폭 확장신호 생성장치 및 방법
US9059786B2 (en) * 2011-07-07 2015-06-16 Vecima Networks Inc. Ingress suppression for communication systems
JP5942358B2 (ja) * 2011-08-24 2016-06-29 ソニー株式会社 符号化装置および方法、復号装置および方法、並びにプログラム
RU2486636C1 (ru) * 2011-11-14 2013-06-27 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации высокочастотных сигналов и устройство его реализации
RU2486637C1 (ru) * 2011-11-15 2013-06-27 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации и частотной модуляции высокочастотных сигналов и устройство его реализации
RU2486638C1 (ru) * 2011-11-15 2013-06-27 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации высокочастотных сигналов и устройство его реализации
RU2496222C2 (ru) * 2011-11-17 2013-10-20 Федеральное государственное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации и частотной модуляции высокочастотных сигналов и устройство его реализации
RU2486639C1 (ru) * 2011-11-21 2013-06-27 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации и частотной модуляции высокочастотных сигналов и устройство его реализации
RU2496192C2 (ru) * 2011-11-21 2013-10-20 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ генерации и частотной модуляции высокочастотных сигналов и устройство его реализации
RU2490727C2 (ru) * 2011-11-28 2013-08-20 Федеральное государственное бюджетное образовательное учреждение высшего профессионального образования "Уральский государственный университет путей сообщения" (УрГУПС) Способ передачи речевых сигналов (варианты)
RU2487443C1 (ru) * 2011-11-29 2013-07-10 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ согласования комплексных сопротивлений и устройство его реализации
JP5817499B2 (ja) * 2011-12-15 2015-11-18 富士通株式会社 復号装置、符号化装置、符号化復号システム、復号方法、符号化方法、復号プログラム、及び符号化プログラム
US9972325B2 (en) 2012-02-17 2018-05-15 Huawei Technologies Co., Ltd. System and method for mixed codebook excitation for speech coding
US9082398B2 (en) * 2012-02-28 2015-07-14 Huawei Technologies Co., Ltd. System and method for post excitation enhancement for low bit rate speech coding
US9437213B2 (en) * 2012-03-05 2016-09-06 Malaspina Labs (Barbados) Inc. Voice signal enhancement
TWI591620B (zh) * 2012-03-21 2017-07-11 三星電子股份有限公司 產生高頻雜訊的方法
ES2960582T3 (es) * 2012-03-29 2024-03-05 Ericsson Telefon Ab L M Cuantificador vectorial
US10448161B2 (en) 2012-04-02 2019-10-15 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for gestural manipulation of a sound field
JP5998603B2 (ja) * 2012-04-18 2016-09-28 ソニー株式会社 音検出装置、音検出方法、音特徴量検出装置、音特徴量検出方法、音区間検出装置、音区間検出方法およびプログラム
KR101343768B1 (ko) * 2012-04-19 2014-01-16 충북대학교 산학협력단 스펙트럼 변화 패턴을 이용한 음성 및 오디오 신호 분류방법
RU2504898C1 (ru) * 2012-05-17 2014-01-20 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ демодуляции фазомодулированных и частотно-модулированных сигналов и устройство его реализации
RU2504894C1 (ru) * 2012-05-17 2014-01-20 Федеральное государственное военное образовательное учреждение высшего профессионального образования "Военный авиационный инженерный университет" (г. Воронеж) Министерства обороны Российской Федерации Способ демодуляции фазомодулированных и частотно-модулированных сигналов и устройство его реализации
US20140006017A1 (en) * 2012-06-29 2014-01-02 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for generating obfuscated speech signal
EP2891151B1 (en) 2012-08-31 2016-08-24 Telefonaktiebolaget LM Ericsson (publ) Method and device for voice activity detection
EP2898506B1 (en) 2012-09-21 2018-01-17 Dolby Laboratories Licensing Corporation Layered approach to spatial audio coding
WO2014062859A1 (en) * 2012-10-16 2014-04-24 Audiologicall, Ltd. Audio signal manipulation for speech enhancement before sound reproduction
KR101413969B1 (ko) 2012-12-20 2014-07-08 삼성전자주식회사 오디오 신호의 복호화 방법 및 장치
CN105551497B (zh) 2013-01-15 2019-03-19 华为技术有限公司 编码方法、解码方法、编码装置和解码装置
JP6082126B2 (ja) 2013-01-29 2017-02-15 フラウンホーファーゲゼルシャフト ツール フォルデルング デル アンゲヴァンテン フォルシユング エー.フアー. 音声信号を合成するための装置及び方法、デコーダ、エンコーダ、システム及びコンピュータプログラム
US9728200B2 (en) 2013-01-29 2017-08-08 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for adaptive formant sharpening in linear prediction coding
CN103971693B (zh) 2013-01-29 2017-02-22 华为技术有限公司 高频带信号的预测方法、编/解码设备
RU2641461C2 (ru) * 2013-01-29 2018-01-17 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Аудиокодер, аудиодекодер, способ обеспечения кодированной аудиоинформации, способ обеспечения декодированной аудиоинформации, компьютерная программа и кодированное представление с использованием сигнально-адаптивного расширения полосы пропускания
US20140213909A1 (en) * 2013-01-31 2014-07-31 Xerox Corporation Control-based inversion for estimating a biological parameter vector for a biophysics model from diffused reflectance data
US9711156B2 (en) 2013-02-08 2017-07-18 Qualcomm Incorporated Systems and methods of performing filtering for gain determination
US9601125B2 (en) * 2013-02-08 2017-03-21 Qualcomm Incorporated Systems and methods of performing noise modulation and gain adjustment
US9741350B2 (en) 2013-02-08 2017-08-22 Qualcomm Incorporated Systems and methods of performing gain control
US9336789B2 (en) * 2013-02-21 2016-05-10 Qualcomm Incorporated Systems and methods for determining an interpolation factor set for synthesizing a speech signal
US9715885B2 (en) 2013-03-05 2017-07-25 Nec Corporation Signal processing apparatus, signal processing method, and signal processing program
EP2784775B1 (en) * 2013-03-27 2016-09-14 Binauric SE Speech signal encoding/decoding method and apparatus
US9558785B2 (en) * 2013-04-05 2017-01-31 Dts, Inc. Layered audio coding and transmission
EP3671738B1 (en) * 2013-04-05 2024-06-05 Dolby International AB Audio encoder and decoder
KR102450178B1 (ko) * 2013-04-05 2022-10-06 돌비 인터네셔널 에이비 인터리브된 파형 코딩을 위한 오디오 인코더 및 디코더
RU2665253C2 (ru) 2013-06-21 2018-08-28 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Устройство и способ для улучшенного маскирования адаптивной таблицы кодирования при acelp-образном маскировании с использованием улучшенной оценки запаздывания основного тона
AU2014283285B2 (en) 2013-06-21 2017-09-21 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio decoder having a bandwidth extension module with an energy adjusting module
FR3007563A1 (fr) * 2013-06-25 2014-12-26 France Telecom Extension amelioree de bande de frequence dans un decodeur de signaux audiofrequences
WO2014210549A1 (en) 2013-06-27 2014-12-31 The General Hospital Corporation Systems and methods for tracking non-stationary spectral structure and dynamics in physiological data
WO2014210527A1 (en) * 2013-06-28 2014-12-31 The General Hospital Corporation System and method to infer brain state during burst suppression
CN104282308B (zh) * 2013-07-04 2017-07-14 华为技术有限公司 频域包络的矢量量化方法和装置
FR3008533A1 (fr) 2013-07-12 2015-01-16 Orange Facteur d'echelle optimise pour l'extension de bande de frequence dans un decodeur de signaux audiofrequences
EP2830054A1 (en) 2013-07-22 2015-01-28 Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder, audio decoder and related methods using two-channel processing within an intelligent gap filling framework
RU2639952C2 (ru) 2013-08-28 2017-12-25 Долби Лабораторис Лайсэнзин Корпорейшн Гибридное усиление речи с кодированием формы сигнала и параметрическим кодированием
TWI557726B (zh) * 2013-08-29 2016-11-11 杜比國際公司 用於決定音頻信號的高頻帶信號的主比例因子頻帶表之系統和方法
JP6586093B2 (ja) 2013-09-13 2019-10-02 ザ ジェネラル ホスピタル コーポレイション 全身麻酔および鎮静中の改良された脳監視のためのシステム
JP6531649B2 (ja) 2013-09-19 2019-06-19 ソニー株式会社 符号化装置および方法、復号化装置および方法、並びにプログラム
CN104517611B (zh) * 2013-09-26 2016-05-25 华为技术有限公司 一种高频激励信号预测方法及装置
CN108172239B (zh) * 2013-09-26 2021-01-12 华为技术有限公司 频带扩展的方法及装置
US9224402B2 (en) 2013-09-30 2015-12-29 International Business Machines Corporation Wideband speech parameterization for high quality synthesis, transformation and quantization
US9620134B2 (en) * 2013-10-10 2017-04-11 Qualcomm Incorporated Gain shape estimation for improved tracking of high-band temporal characteristics
US10083708B2 (en) * 2013-10-11 2018-09-25 Qualcomm Incorporated Estimation of mixing factors to generate high-band excitation signal
US9384746B2 (en) * 2013-10-14 2016-07-05 Qualcomm Incorporated Systems and methods of energy-scaled signal processing
KR102271852B1 (ko) * 2013-11-02 2021-07-01 삼성전자주식회사 광대역 신호 생성방법 및 장치와 이를 채용하는 기기
EP2871641A1 (en) * 2013-11-12 2015-05-13 Dialog Semiconductor B.V. Enhancement of narrowband audio signals using a single sideband AM modulation
CN105765655A (zh) 2013-11-22 2016-07-13 高通股份有限公司 高频带译码中的选择性相位补偿
US10163447B2 (en) * 2013-12-16 2018-12-25 Qualcomm Incorporated High-band signal modeling
KR102356012B1 (ko) 2013-12-27 2022-01-27 소니그룹주식회사 복호화 장치 및 방법, 및 프로그램
CN103714822B (zh) * 2013-12-27 2017-01-11 广州华多网络科技有限公司 基于silk编解码器的子带编解码方法及装置
FR3017484A1 (fr) * 2014-02-07 2015-08-14 Orange Extension amelioree de bande de frequence dans un decodeur de signaux audiofrequences
US9564141B2 (en) 2014-02-13 2017-02-07 Qualcomm Incorporated Harmonic bandwidth extension of audio signals
JP6281336B2 (ja) * 2014-03-12 2018-02-21 沖電気工業株式会社 音声復号化装置及びプログラム
JP6035270B2 (ja) * 2014-03-24 2016-11-30 株式会社Nttドコモ 音声復号装置、音声符号化装置、音声復号方法、音声符号化方法、音声復号プログラム、および音声符号化プログラム
US9542955B2 (en) * 2014-03-31 2017-01-10 Qualcomm Incorporated High-band signal coding using multiple sub-bands
EP3128513B1 (en) * 2014-03-31 2019-05-15 Fraunhofer Gesellschaft zur Förderung der Angewand Encoder, decoder, encoding method, decoding method, and program
US9697843B2 (en) 2014-04-30 2017-07-04 Qualcomm Incorporated High band excitation signal generation
CN105336336B (zh) 2014-06-12 2016-12-28 华为技术有限公司 一种音频信号的时域包络处理方法及装置、编码器
CN105336338B (zh) * 2014-06-24 2017-04-12 华为技术有限公司 音频编码方法和装置
US9984699B2 (en) 2014-06-26 2018-05-29 Qualcomm Incorporated High-band signal coding using mismatched frequency ranges
US9583115B2 (en) * 2014-06-26 2017-02-28 Qualcomm Incorporated Temporal gain adjustment based on high-band signal characteristic
CN106486129B (zh) * 2014-06-27 2019-10-25 华为技术有限公司 一种音频编码方法和装置
US9721584B2 (en) * 2014-07-14 2017-08-01 Intel IP Corporation Wind noise reduction for audio reception
EP2980794A1 (en) 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoder and decoder using a frequency domain processor and a time domain processor
EP2980795A1 (en) 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoding and decoding using a frequency domain processor, a time domain processor and a cross processor for initialization of the time domain processor
EP2980798A1 (en) * 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Harmonicity-dependent controlling of a harmonic filter tool
EP2980792A1 (en) * 2014-07-28 2016-02-03 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for generating an enhanced signal using independent noise-filling
US10304474B2 (en) * 2014-08-15 2019-05-28 Samsung Electronics Co., Ltd. Sound quality improving method and device, sound decoding method and device, and multimedia device employing same
CN104217730B (zh) * 2014-08-18 2017-07-21 大连理工大学 一种基于k‑svd的人工语音带宽扩展方法及装置
WO2016040885A1 (en) 2014-09-12 2016-03-17 Audience, Inc. Systems and methods for restoration of speech components
TWI550945B (zh) * 2014-12-22 2016-09-21 國立彰化師範大學 具有急遽過渡帶的複合濾波器之設計方法及其串聯式複合濾波器
US9595269B2 (en) * 2015-01-19 2017-03-14 Qualcomm Incorporated Scaling for gain shape circuitry
CN107210824A (zh) 2015-01-30 2017-09-26 美商楼氏电子有限公司 麦克风的环境切换
KR102125410B1 (ko) 2015-02-26 2020-06-22 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 타깃 시간 도메인 포락선을 사용하여 처리된 오디오 신호를 얻도록 오디오 신호를 처리하기 위한 장치 및 방법
WO2016142002A1 (en) 2015-03-09 2016-09-15 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio encoder, audio decoder, method for encoding an audio signal and method for decoding an encoded audio signal
US9837089B2 (en) * 2015-06-18 2017-12-05 Qualcomm Incorporated High-band signal generation
US10847170B2 (en) * 2015-06-18 2020-11-24 Qualcomm Incorporated Device and method for generating a high-band signal from non-linearly processed sub-ranges
US9407989B1 (en) 2015-06-30 2016-08-02 Arthur Woodrow Closed audio circuit
US9830921B2 (en) * 2015-08-17 2017-11-28 Qualcomm Incorporated High-band target signal control
NO20151400A1 (en) 2015-10-15 2017-01-23 St Tech As A system for isolating an object
CN107924683B (zh) * 2015-10-15 2021-03-30 华为技术有限公司 正弦编码和解码的方法和装置
ES2771200T3 (es) 2016-02-17 2020-07-06 Fraunhofer Ges Forschung Postprocesador, preprocesador, codificador de audio, decodificador de audio y métodos relacionados para mejorar el procesamiento de transitorios
FR3049084B1 (fr) * 2016-03-15 2022-11-11 Fraunhofer Ges Forschung Dispositif de codage pour le traitement d'un signal d'entree et dispositif de decodage pour le traitement d'un signal code
PL4134953T3 (pl) * 2016-04-12 2025-04-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Koder audio do kodowania sygnału audio, sposób kodowania sygnału audio i program komputerowy, z uwzględnieniem wykrytego szczytowego obszaru widmowego w paśmie wyższej częstotliwości
US10699725B2 (en) * 2016-05-10 2020-06-30 Immersion Networks, Inc. Adaptive audio encoder system, method and article
JP7005036B2 (ja) * 2016-05-10 2022-01-21 イマージョン・ネットワークス・インコーポレイテッド 適応オーディオコーデックシステム、方法および媒体
US20170330575A1 (en) * 2016-05-10 2017-11-16 Immersion Services LLC Adaptive audio codec system, method and article
US10770088B2 (en) * 2016-05-10 2020-09-08 Immersion Networks, Inc. Adaptive audio decoder system, method and article
US10756755B2 (en) * 2016-05-10 2020-08-25 Immersion Networks, Inc. Adaptive audio codec system, method and article
US10264116B2 (en) * 2016-11-02 2019-04-16 Nokia Technologies Oy Virtual duplex operation
KR102507383B1 (ko) * 2016-11-08 2023-03-08 한국전자통신연구원 직사각형 윈도우를 이용한 스테레오 정합 방법 및 스테레오 정합 시스템
US10786168B2 (en) 2016-11-29 2020-09-29 The General Hospital Corporation Systems and methods for analyzing electrophysiological data from patients undergoing medical treatments
EP3555885B1 (en) 2016-12-16 2020-06-24 Telefonaktiebolaget LM Ericsson (PUBL) Method and encoder for handling envelope representation coefficients
FI3965354T3 (fi) 2017-01-06 2023-05-24 Ericsson Telefon Ab L M Menetelmät ja laitteet signalointia ja referenssisignaalien offsetien määrittämistä varten
KR102687184B1 (ko) * 2017-02-10 2024-07-19 삼성전자주식회사 Wfst 디코딩 시스템, 이를 포함하는 음성 인식 시스템 및 wfst 데이터 저장 방법
US10553222B2 (en) * 2017-03-09 2020-02-04 Qualcomm Incorporated Inter-channel bandwidth extension spectral mapping and adjustment
US10304468B2 (en) * 2017-03-20 2019-05-28 Qualcomm Incorporated Target sample generation
TWI873683B (zh) * 2017-03-23 2025-02-21 瑞典商都比國際公司 用於音訊信號之高頻重建的諧波轉置器的回溯相容整合
US10825467B2 (en) * 2017-04-21 2020-11-03 Qualcomm Incorporated Non-harmonic speech detection and bandwidth extension in a multi-source environment
US20190051286A1 (en) * 2017-08-14 2019-02-14 Microsoft Technology Licensing, Llc Normalization of high band signals in network telephony communications
CA3184758A1 (en) * 2017-10-27 2019-05-02 Terawave, Llc Receiver for high spectral efficiency data communications system using encoded sinusoidal waveforms
US11876659B2 (en) 2017-10-27 2024-01-16 Terawave, Llc Communication system using shape-shifted sinusoidal waveforms
CN109729553B (zh) * 2017-10-30 2021-12-28 成都鼎桥通信技术有限公司 Lte集群通信系统的语音业务处理方法及设备
EP3483886A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Selecting pitch lag
EP3483880A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Temporal noise shaping
WO2019091573A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding and decoding an audio signal using downsampling or interpolation of scale parameters
EP3483883A1 (en) * 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio coding and decoding with selective postfiltering
EP3483878A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio decoder supporting a set of different loss concealment tools
EP3483879A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Analysis/synthesis windowing function for modulated lapped transformation
EP3483882A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Controlling bandwidth in encoders and/or decoders
EP3483884A1 (en) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Signal filtering
WO2019091576A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoders, audio decoders, methods and computer programs adapting an encoding and decoding of least significant bits
US10460749B1 (en) * 2018-06-28 2019-10-29 Nuvoton Technology Corporation Voice activity detection using vocal tract area information
US10847172B2 (en) * 2018-12-17 2020-11-24 Microsoft Technology Licensing, Llc Phase quantization in a speech encoder
US10957331B2 (en) 2018-12-17 2021-03-23 Microsoft Technology Licensing, Llc Phase reconstruction in a speech decoder
JP7088403B2 (ja) * 2019-02-20 2022-06-21 ヤマハ株式会社 音信号生成方法、生成モデルの訓練方法、音信号生成システムおよびプログラム
CN110610713B (zh) * 2019-08-28 2021-11-16 南京梧桐微电子科技有限公司 一种声码器余量谱幅度参数重构方法及系统
US11380343B2 (en) 2019-09-12 2022-07-05 Immersion Networks, Inc. Systems and methods for processing high frequency audio signal
TWI723545B (zh) 2019-09-17 2021-04-01 宏碁股份有限公司 語音處理方法及其裝置
US11295751B2 (en) 2019-09-20 2022-04-05 Tencent America LLC Multi-band synchronized neural vocoder
KR102201169B1 (ko) * 2019-10-23 2021-01-11 성균관대학교 산학협력단 메타 표면의 반사 계수를 제어하기 위한 시간 부호 생성 방법, 메타 표면의 반사 계수를 제어하기 위한 시공간 부호 생성 방법, 이를 실행하는 컴퓨터 프로그램이 저장된 컴퓨터 판독 가능한 기록매체, 및 이를 이용한 메타 표면의 신호 변조 방법
CN114548442B (zh) * 2022-02-25 2022-10-21 万表名匠(广州)科技有限公司 一种基于互联网技术的腕表维修管理系统
EP4584781A1 (en) * 2022-09-09 2025-07-16 Telefonaktiebolaget LM Ericsson (publ) Low complex bandwidth extension target generation
EP4553830A1 (en) * 2023-11-10 2025-05-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio processor for extended the audio bandwidth of band-limited audio signal
EP4553832A1 (en) * 2023-11-10 2025-05-14 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio processor with a steered audio bandwidth extension

Family Cites Families (148)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US525147A (en) * 1894-08-28 Steam-cooker
US596689A (en) * 1898-01-04 Hose holder or support
US321993A (en) * 1885-07-14 Lantern
US526468A (en) * 1894-09-25 Charles d
US1126620A (en) * 1911-01-30 1915-01-26 Safety Car Heating & Lighting Electric regulation.
US1089258A (en) * 1914-01-13 1914-03-03 James Arnot Paterson Facing or milling machine.
US1300833A (en) * 1918-12-12 1919-04-15 Moline Mill Mfg Company Idler-pulley structure.
US1498873A (en) * 1924-04-19 1924-06-24 Bethlehem Steel Corp Switch stand
US2073913A (en) * 1934-06-26 1937-03-16 Wigan Edmund Ramsay Means for gauging minute displacements
US2086867A (en) * 1936-06-19 1937-07-13 Hall Lab Inc Laundering composition and process
US3044777A (en) * 1959-10-19 1962-07-17 Fibermold Corp Bowling pin
US3158693A (en) * 1962-08-07 1964-11-24 Bell Telephone Labor Inc Speech interpolation communication system
US3855416A (en) 1972-12-01 1974-12-17 F Fuller Method and apparatus for phonation analysis leading to valid truth/lie decisions by fundamental speech-energy weighted vibratto component assessment
US3855414A (en) * 1973-04-24 1974-12-17 Anaconda Co Cable armor clamp
JPS59139099A (ja) 1983-01-31 1984-08-09 株式会社東芝 音声区間検出装置
US4616659A (en) 1985-05-06 1986-10-14 At&T Bell Laboratories Heart rate detection utilizing autoregressive analysis
US4630305A (en) 1985-07-01 1986-12-16 Motorola, Inc. Automatic gain selector for a noise suppression system
US4747143A (en) 1985-07-12 1988-05-24 Westinghouse Electric Corp. Speech enhancement system having dynamic gain control
NL8503152A (nl) * 1985-11-15 1987-06-01 Optische Ind De Oude Delft Nv Dosismeter voor ioniserende straling.
US4862168A (en) 1987-03-19 1989-08-29 Beard Terry D Audio digital/analog encoding and decoding
US4805193A (en) 1987-06-04 1989-02-14 Motorola, Inc. Protection of energy information in sub-band coding
US4852179A (en) * 1987-10-05 1989-07-25 Motorola, Inc. Variable frame rate, fixed bit rate vocoding method
JP2707564B2 (ja) 1987-12-14 1998-01-28 株式会社日立製作所 音声符号化方式
US5285520A (en) * 1988-03-02 1994-02-08 Kokusai Denshin Denwa Kabushiki Kaisha Predictive coding apparatus
US5077798A (en) * 1988-09-28 1991-12-31 Hitachi, Ltd. Method and system for voice coding based on vector quantization
US5086475A (en) 1988-11-19 1992-02-04 Sony Corporation Apparatus for generating, recording or reproducing sound source data
JPH02244100A (ja) 1989-03-16 1990-09-28 Ricoh Co Ltd 駆動音源信号生成装置
CN1031540C (zh) 1990-09-19 1996-04-10 菲利浦光灯制造公司 记录载体、主数据和控制文件的记录方法和装置及读出装置
JP2779886B2 (ja) * 1992-10-05 1998-07-23 日本電信電話株式会社 広帯域音声信号復元方法
JP3191457B2 (ja) * 1992-10-31 2001-07-23 ソニー株式会社 高能率符号化装置、ノイズスペクトル変更装置及び方法
US5455888A (en) * 1992-12-04 1995-10-03 Northern Telecom Limited Speech bandwidth extension method and apparatus
EP0663739B1 (en) 1993-06-30 2001-08-22 Sony Corporation Digital signal encoding device, its decoding device, and its recording medium
WO1995010760A2 (en) * 1993-10-08 1995-04-20 Comsat Corporation Improved low bit rate vocoders and methods of operation therefor
US5684920A (en) 1994-03-17 1997-11-04 Nippon Telegraph And Telephone Acoustic signal transform coding method and decoding method having a high efficiency envelope flattening method therein
US5487087A (en) 1994-05-17 1996-01-23 Texas Instruments Incorporated Signal quantizer with reduced output fluctuation
US5797118A (en) * 1994-08-09 1998-08-18 Yamaha Corporation Learning vector quantization and a temporary memory such that the codebook contents are renewed when a first speaker returns
JP2770137B2 (ja) * 1994-09-22 1998-06-25 日本プレシジョン・サーキッツ株式会社 波形データ圧縮装置
US5699477A (en) * 1994-11-09 1997-12-16 Texas Instruments Incorporated Mixed excitation linear prediction with fractional pitch
FI97182C (fi) * 1994-12-05 1996-10-25 Nokia Telecommunications Oy Menetelmä vastaanotettujen huonojen puhekehysten korvaamiseksi digitaalisessa vastaanottimessa sekä digitaalisen tietoliikennejärjestelmän vastaanotin
JP3365113B2 (ja) * 1994-12-22 2003-01-08 ソニー株式会社 音声レベル制御装置
JP3189614B2 (ja) 1995-03-13 2001-07-16 松下電器産業株式会社 音声帯域拡大装置
JP2956548B2 (ja) 1995-10-05 1999-10-04 松下電器産業株式会社 音声帯域拡大装置
JP2798003B2 (ja) 1995-05-09 1998-09-17 松下電器産業株式会社 音声帯域拡大装置および音声帯域拡大方法
EP0732687B2 (en) * 1995-03-13 2005-10-12 Matsushita Electric Industrial Co., Ltd. Apparatus for expanding speech bandwidth
US6263307B1 (en) * 1995-04-19 2001-07-17 Texas Instruments Incorporated Adaptive weiner filtering using line spectral frequencies
US5706395A (en) 1995-04-19 1998-01-06 Texas Instruments Incorporated Adaptive weiner filtering using a dynamic suppression factor
JP3334419B2 (ja) * 1995-04-20 2002-10-15 ソニー株式会社 ノイズ低減方法及びノイズ低減装置
US5699485A (en) 1995-06-07 1997-12-16 Lucent Technologies Inc. Pitch delay modification during frame erasures
US5704003A (en) 1995-09-19 1997-12-30 Lucent Technologies Inc. RCELP coder
US6097824A (en) * 1997-06-06 2000-08-01 Audiologic, Incorporated Continuous frequency dynamic range audio compressor
DE69530204T2 (de) * 1995-10-16 2004-03-18 Agfa-Gevaert Neue Klasse von Gelbfarbstoffen für photographische Materialien
JP3707116B2 (ja) 1995-10-26 2005-10-19 ソニー株式会社 音声復号化方法及び装置
US5737716A (en) * 1995-12-26 1998-04-07 Motorola Method and apparatus for encoding speech using neural network technology for speech classification
JP3073919B2 (ja) * 1995-12-30 2000-08-07 松下電器産業株式会社 同期装置
US5689615A (en) 1996-01-22 1997-11-18 Rockwell International Corporation Usage of voice activity detection for efficient coding of speech
TW307960B (en) 1996-02-15 1997-06-11 Philips Electronics Nv Reduced complexity signal transmission system
TW416044B (en) 1996-06-19 2000-12-21 Texas Instruments Inc Adaptive filter and filtering method for low bit rate coding
JP3246715B2 (ja) * 1996-07-01 2002-01-15 松下電器産業株式会社 オーディオ信号圧縮方法,およびオーディオ信号圧縮装置
KR100339168B1 (ko) 1996-11-07 2002-06-03 모리시타 요이찌 음원 벡터 생성 장치, 음성 부호화 장치 및 음성 복호화장치
US6009395A (en) * 1997-01-02 1999-12-28 Texas Instruments Incorporated Synthesizer and method using scaled excitation signal
US6202046B1 (en) 1997-01-23 2001-03-13 Kabushiki Kaisha Toshiba Background noise/speech classification method
US6041297A (en) 1997-03-10 2000-03-21 At&T Corp Vocoder for coding speech by using a correlation between spectral magnitudes and candidate excitations
US5890126A (en) * 1997-03-10 1999-03-30 Euphonics, Incorporated Audio data decompression and interpolation apparatus and method
EP0878790A1 (en) 1997-05-15 1998-11-18 Hewlett-Packard Company Voice coding system and method
SE512719C2 (sv) * 1997-06-10 2000-05-02 Lars Gustaf Liljeryd En metod och anordning för reduktion av dataflöde baserad på harmonisk bandbreddsexpansion
US6889185B1 (en) * 1997-08-28 2005-05-03 Texas Instruments Incorporated Quantization of linear prediction coefficients using perceptual weighting
US6122384A (en) * 1997-09-02 2000-09-19 Qualcomm Inc. Noise suppression system and method
US6029125A (en) 1997-09-02 2000-02-22 Telefonaktiebolaget L M Ericsson, (Publ) Reducing sparseness in coded speech signals
US6231516B1 (en) * 1997-10-14 2001-05-15 Vacusense, Inc. Endoluminal implant with therapeutic and diagnostic capability
JPH11205166A (ja) * 1998-01-19 1999-07-30 Mitsubishi Electric Corp ノイズ検出装置
US6301556B1 (en) * 1998-03-04 2001-10-09 Telefonaktiebolaget L M. Ericsson (Publ) Reducing sparseness in coded speech signals
US6449590B1 (en) 1998-08-24 2002-09-10 Conexant Systems, Inc. Speech encoder using warping in long term preprocessing
US6385573B1 (en) * 1998-08-24 2002-05-07 Conexant Systems, Inc. Adaptive tilt compensation for synthesized speech residual
JP4170458B2 (ja) * 1998-08-27 2008-10-22 ローランド株式会社 波形信号の時間軸圧縮伸長装置
US6353808B1 (en) * 1998-10-22 2002-03-05 Sony Corporation Apparatus and method for encoding a signal as well as apparatus and method for decoding a signal
KR20000047944A (ko) 1998-12-11 2000-07-25 이데이 노부유끼 수신장치 및 방법과 통신장치 및 방법
JP4354561B2 (ja) * 1999-01-08 2009-10-28 パナソニック株式会社 オーディオ信号符号化装置及び復号化装置
US6223151B1 (en) * 1999-02-10 2001-04-24 Telefon Aktie Bolaget Lm Ericsson Method and apparatus for pre-processing speech signals prior to coding by transform-based speech coders
EP1126620B1 (en) 1999-05-14 2005-12-21 Matsushita Electric Industrial Co., Ltd. Method and apparatus for expanding band of audio signal
US6604070B1 (en) * 1999-09-22 2003-08-05 Conexant Systems, Inc. System of encoding and decoding speech signals
JP4792613B2 (ja) 1999-09-29 2011-10-12 ソニー株式会社 情報処理装置および方法、並びに記録媒体
US6556950B1 (en) 1999-09-30 2003-04-29 Rockwell Automation Technologies, Inc. Diagnostic method and apparatus for use with enterprise control
US6715125B1 (en) 1999-10-18 2004-03-30 Agere Systems Inc. Source coding and transmission with time diversity
EP1147514B1 (en) 1999-11-16 2005-04-06 Koninklijke Philips Electronics N.V. Wideband audio transmission system
CA2290037A1 (en) * 1999-11-18 2001-05-18 Voiceage Corporation Gain-smoothing amplifier device and method in codecs for wideband speech and audio signals
US7260523B2 (en) * 1999-12-21 2007-08-21 Texas Instruments Incorporated Sub-band speech coding system
EP1164580B1 (en) * 2000-01-11 2015-10-28 Panasonic Intellectual Property Management Co., Ltd. Multi-mode voice encoding device and decoding device
US6757395B1 (en) 2000-01-12 2004-06-29 Sonic Innovations, Inc. Noise reduction apparatus and method
US6704711B2 (en) * 2000-01-28 2004-03-09 Telefonaktiebolaget Lm Ericsson (Publ) System and method for modifying speech signals
US6732070B1 (en) * 2000-02-16 2004-05-04 Nokia Mobile Phones, Ltd. Wideband speech codec using a higher sampling rate in analysis and synthesis filtering than in excitation searching
JP3681105B2 (ja) 2000-02-24 2005-08-10 アルパイン株式会社 データ処理方式
FI119576B (fi) * 2000-03-07 2008-12-31 Nokia Corp Puheenkäsittelylaite ja menetelmä puheen käsittelemiseksi, sekä digitaalinen radiopuhelin
US6523003B1 (en) * 2000-03-28 2003-02-18 Tellabs Operations, Inc. Spectrally interdependent gain adjustment techniques
US6757654B1 (en) * 2000-05-11 2004-06-29 Telefonaktiebolaget Lm Ericsson Forward error correction in speech coding
US7330814B2 (en) 2000-05-22 2008-02-12 Texas Instruments Incorporated Wideband speech coding with modulated noise highband excitation system and method
US7136810B2 (en) * 2000-05-22 2006-11-14 Texas Instruments Incorporated Wideband speech coding system and method
DE60102975T2 (de) 2000-05-22 2005-05-12 Texas Instruments Inc., Dallas Vorrichtung und Verfahren zur Breitbandcodierung von Sprachsignalen
JP2002055699A (ja) 2000-08-10 2002-02-20 Mitsubishi Electric Corp 音声符号化装置および音声符号化方法
BR0107142A (pt) 2000-08-25 2002-07-02 Koninkl Philips Electronics Nv Métodos para redução do número de bits de um sinal de entrada digital, e para recuperar um sinal de saìda de um sinal de comprimento de palavra reduzido, e, aparelhos de processamento de sinal, e para decodificação de sinal
US6515889B1 (en) * 2000-08-31 2003-02-04 Micron Technology, Inc. Junction-isolated depletion mode ferroelectric memory
US7386444B2 (en) * 2000-09-22 2008-06-10 Texas Instruments Incorporated Hybrid speech coding and system
US6947888B1 (en) * 2000-10-17 2005-09-20 Qualcomm Incorporated Method and apparatus for high performance low bit-rate coding of unvoiced speech
JP2002202799A (ja) 2000-10-30 2002-07-19 Fujitsu Ltd 音声符号変換装置
JP3558031B2 (ja) * 2000-11-06 2004-08-25 日本電気株式会社 音声復号化装置
US7346499B2 (en) 2000-11-09 2008-03-18 Koninklijke Philips Electronics N.V. Wideband extension of telephone speech for higher perceptual quality
SE0004163D0 (sv) 2000-11-14 2000-11-14 Coding Technologies Sweden Ab Enhancing perceptual performance of high frequency reconstruction coding methods by adaptive filtering
SE0004187D0 (sv) 2000-11-15 2000-11-15 Coding Technologies Sweden Ab Enhancing the performance of coding systems that use high frequency reconstruction methods
CA2733453C (en) 2000-11-30 2014-10-14 Panasonic Corporation Lpc vector quantization apparatus
GB0031461D0 (en) 2000-12-22 2001-02-07 Thales Defence Ltd Communication sets
US20040204935A1 (en) 2001-02-21 2004-10-14 Krishnasamy Anandakumar Adaptive voice playout in VOP
JP2002268698A (ja) 2001-03-08 2002-09-20 Nec Corp 音声認識装置と標準パターン作成装置及び方法並びにプログラム
US20030028386A1 (en) 2001-04-02 2003-02-06 Zinser Richard L. Compressed domain universal transcoder
SE522553C2 (sv) * 2001-04-23 2004-02-17 Ericsson Telefon Ab L M Bandbreddsutsträckning av akustiska signaler
DE50104998D1 (de) * 2001-05-11 2005-02-03 Siemens Ag Verfahren zur erweiterung der bandbreite eines schmalbandig gefilterten sprachsignals, insbesondere eines von einem telekommunikationsgerät gesendeten sprachsignals
EP1405303A1 (en) * 2001-06-28 2004-04-07 Koninklijke Philips Electronics N.V. Wideband signal transmission system
US6879955B2 (en) * 2001-06-29 2005-04-12 Microsoft Corporation Signal modification based on continuous time warping for low bit rate CELP coding
JP2003036097A (ja) * 2001-07-25 2003-02-07 Sony Corp 情報検出装置及び方法、並びに情報検索装置及び方法
TW525147B (en) 2001-09-28 2003-03-21 Inventec Besta Co Ltd Method of obtaining and decoding basic cycle of voice
US6988066B2 (en) * 2001-10-04 2006-01-17 At&T Corp. Method of bandwidth extension for narrow-band speech
US6895375B2 (en) * 2001-10-04 2005-05-17 At&T Corp. System for bandwidth extension of Narrow-band speech
TW526468B (en) 2001-10-19 2003-04-01 Chunghwa Telecom Co Ltd System and method for eliminating background noise of voice signal
JP4245288B2 (ja) 2001-11-13 2009-03-25 パナソニック株式会社 音声符号化装置および音声復号化装置
KR20040066835A (ko) * 2001-11-23 2004-07-27 코닌클리즈케 필립스 일렉트로닉스 엔.브이. 대역폭 확장기 및 광대역 오디오 신호 생성 방법
CA2365203A1 (en) 2001-12-14 2003-06-14 Voiceage Corporation A signal modification method for efficient coding of speech signals
US6751587B2 (en) 2002-01-04 2004-06-15 Broadcom Corporation Efficient excitation quantization in noise feedback coding with general noise shaping
JP4290917B2 (ja) * 2002-02-08 2009-07-08 株式会社エヌ・ティ・ティ・ドコモ 復号装置、符号化装置、復号方法、及び、符号化方法
JP3826813B2 (ja) 2002-02-18 2006-09-27 ソニー株式会社 ディジタル信号処理装置及びディジタル信号処理方法
ES2259158T3 (es) * 2002-09-19 2006-09-16 Matsushita Electric Industrial Co., Ltd. Metodo y aparato decodificador audio.
JP3756864B2 (ja) 2002-09-30 2006-03-15 株式会社東芝 音声合成方法と装置及び音声合成プログラム
KR100841096B1 (ko) 2002-10-14 2008-06-25 리얼네트웍스아시아퍼시픽 주식회사 음성 코덱에 대한 디지털 오디오 신호의 전처리 방법
US20040098255A1 (en) * 2002-11-14 2004-05-20 France Telecom Generalized analysis-by-synthesis speech coding method, and coder implementing such method
US7242763B2 (en) 2002-11-26 2007-07-10 Lucent Technologies Inc. Systems and methods for far-end noise reduction and near-end noise compensation in a mixed time-frequency domain compander to improve signal quality in communications systems
CA2415105A1 (en) 2002-12-24 2004-06-24 Voiceage Corporation A method and device for robust predictive vector quantization of linear prediction parameters in variable bit rate speech coding
KR100480341B1 (ko) 2003-03-13 2005-03-31 한국전자통신연구원 광대역 저전송률 음성 신호의 부호화기
CN1820306B (zh) * 2003-05-01 2010-05-05 诺基亚有限公司 可变比特率宽带语音编码中增益量化的方法和装置
WO2005004113A1 (ja) 2003-06-30 2005-01-13 Fujitsu Limited オーディオ符号化装置
US20050004793A1 (en) * 2003-07-03 2005-01-06 Pasi Ojala Signal adaptation for higher band coding in a codec utilizing band split coding
FI118550B (fi) * 2003-07-14 2007-12-14 Nokia Corp Parannettu eksitaatio ylemmän kaistan koodaukselle koodekissa, joka käyttää kaistojen jakoon perustuvia koodausmenetelmiä
US7428490B2 (en) 2003-09-30 2008-09-23 Intel Corporation Method for spectral subtraction in speech enhancement
US7689579B2 (en) * 2003-12-03 2010-03-30 Siemens Aktiengesellschaft Tag modeling within a decision, support, and reporting environment
KR100587953B1 (ko) * 2003-12-26 2006-06-08 한국전자통신연구원 대역-분할 광대역 음성 코덱에서의 고대역 오류 은닉 장치 및 그를 이용한 비트스트림 복호화 시스템
CA2454296A1 (en) 2003-12-29 2005-06-29 Nokia Corporation Method and device for speech enhancement in the presence of background noise
JP4259401B2 (ja) 2004-06-02 2009-04-30 カシオ計算機株式会社 音声処理装置及び音声符号化方法
US8000967B2 (en) * 2005-03-09 2011-08-16 Telefonaktiebolaget Lm Ericsson (Publ) Low-complexity code excited linear prediction encoding
US8155965B2 (en) * 2005-03-11 2012-04-10 Qualcomm Incorporated Time warping frames inside the vocoder by modifying the residual
UA94041C2 (ru) 2005-04-01 2011-04-11 Квелкомм Инкорпорейтед Способ и устройство для фильтрации, устраняющей разреженность
US8260611B2 (en) * 2005-04-01 2012-09-04 Qualcomm Incorporated Systems, methods, and apparatus for highband excitation generation
PT1875463T (pt) * 2005-04-22 2019-01-24 Qualcomm Inc Sistemas, métodos e aparelho para nivelamento de fator de ganho

Also Published As

Publication number Publication date
SG161223A1 (en) 2010-05-27
TWI321314B (en) 2010-03-01
WO2006107838A1 (en) 2006-10-12
CA2603231A1 (en) 2006-10-12
US20060282263A1 (en) 2006-12-14
AU2006232362A1 (en) 2006-10-12
BRPI0608270A2 (pt) 2009-10-06
MX2007012189A (es) 2007-12-11
TWI321315B (en) 2010-03-01
KR100956525B1 (ko) 2010-05-07
AU2006252957A1 (en) 2006-12-07
US20060277038A1 (en) 2006-12-07
WO2006107839A2 (en) 2006-10-12
WO2006107839A3 (en) 2007-04-05
CA2602804A1 (en) 2006-10-12
BRPI0607691B1 (pt) 2019-08-13
AU2006232361B2 (en) 2010-12-23
NO340566B1 (no) 2017-05-15
RU2007140365A (ru) 2009-05-10
NZ562183A (en) 2010-09-30
CA2603219A1 (en) 2006-10-12
MX2007012183A (es) 2007-12-11
MX2007012184A (es) 2007-12-11
US8332228B2 (en) 2012-12-11
AU2006232357B2 (en) 2010-07-01
BRPI0608306A2 (pt) 2009-12-08
ES2391292T3 (es) 2012-11-23
EP1864282A1 (en) 2007-12-12
CA2603219C (en) 2011-10-11
NO340428B1 (no) 2017-04-18
NO20075515L (no) 2007-12-28
WO2006130221A1 (en) 2006-12-07
TWI320923B (en) 2010-02-21
WO2006107834A1 (en) 2006-10-12
JP2008535026A (ja) 2008-08-28
EP1866914A1 (en) 2007-12-19
MX2007012182A (es) 2007-12-10
DE602006018884D1 (de) 2011-01-27
JP5129117B2 (ja) 2013-01-23
TWI321777B (en) 2010-03-11
RU2387025C2 (ru) 2010-04-20
AU2006232358A1 (en) 2006-10-12
BRPI0608269B1 (pt) 2019-07-30
KR100956524B1 (ko) 2010-05-07
BRPI0607690A8 (pt) 2017-07-11
EP1864283A1 (en) 2007-12-12
EP1869673A1 (en) 2007-12-26
AU2006232363A1 (en) 2006-10-12
ATE492016T1 (de) 2011-01-15
EP1869673B1 (en) 2010-09-22
WO2006107836A1 (en) 2006-10-12
AU2006232364A1 (en) 2006-10-12
IL186405A (en) 2013-07-31
US8244526B2 (en) 2012-08-14
CA2602804C (en) 2013-12-24
PT1864282T (pt) 2017-08-10
NO20075511L (no) 2007-12-27
KR100956876B1 (ko) 2010-05-11
NO20075510L (no) 2007-12-28
NO20075512L (no) 2007-12-28
RU2009131435A (ru) 2011-02-27
NO20075503L (no) 2007-12-28
RU2007140383A (ru) 2009-05-10
RU2007140426A (ru) 2009-05-10
PT1864101E (pt) 2012-10-09
JP2008536170A (ja) 2008-09-04
JP2008536169A (ja) 2008-09-04
CA2603229A1 (en) 2006-10-12
WO2006107833A1 (en) 2006-10-12
CA2603229C (en) 2012-07-31
US20070088541A1 (en) 2007-04-19
US8140324B2 (en) 2012-03-20
KR20070118175A (ko) 2007-12-13
ATE485582T1 (de) 2010-11-15
TWI316225B (en) 2009-10-21
TW200705390A (en) 2007-02-01
ATE482449T1 (de) 2010-10-15
JP5161069B2 (ja) 2013-03-13
AU2006232364B2 (en) 2010-11-25
WO2006107837A1 (en) 2006-10-12
JP2008537606A (ja) 2008-09-18
IL186436A0 (en) 2008-01-20
KR20070118174A (ko) 2007-12-13
BRPI0607646B1 (pt) 2021-05-25
IL186405A0 (en) 2008-01-20
CN102411935A (zh) 2012-04-11
EP1864281A1 (en) 2007-12-12
EP1866915B1 (en) 2010-12-15
JP2008535027A (ja) 2008-08-28
AU2006232361A1 (en) 2006-10-12
PL1869673T3 (pl) 2011-03-31
HK1115023A1 (en) 2008-11-14
KR20070118173A (ko) 2007-12-13
RU2007140394A (ru) 2009-05-10
US8069040B2 (en) 2011-11-29
BRPI0609530B1 (pt) 2019-10-29
MX2007012181A (es) 2007-12-11
AU2006252957B2 (en) 2011-01-20
NO20075514L (no) 2007-12-28
BRPI0608269A2 (pt) 2009-12-08
SG163555A1 (en) 2010-08-30
BRPI0607646A2 (pt) 2009-09-22
AU2006232358B2 (en) 2010-11-25
RU2386179C2 (ru) 2010-04-10
HK1169509A1 (en) 2013-01-25
DK1864282T3 (en) 2017-08-21
US8484036B2 (en) 2013-07-09
AU2006232360A1 (en) 2006-10-12
TW200705387A (en) 2007-02-01
DE602006017050D1 (de) 2010-11-04
JP4955649B2 (ja) 2012-06-20
EP1866915A2 (en) 2007-12-19
EP1869670B1 (en) 2010-10-20
TWI330828B (en) 2010-09-21
BRPI0609530A2 (pt) 2010-04-13
AU2006232357C1 (en) 2010-11-25
US20070088558A1 (en) 2007-04-19
NZ562182A (en) 2010-03-26
RU2376657C2 (ru) 2009-12-20
CA2603246C (en) 2012-07-17
RU2402827C2 (ru) 2010-10-27
EP1864282B1 (en) 2017-05-17
CA2603255A1 (en) 2006-10-12
RU2007140429A (ru) 2009-05-20
KR101019940B1 (ko) 2011-03-09
BRPI0608305B1 (pt) 2019-08-06
TWI319565B (en) 2010-01-11
US8260611B2 (en) 2012-09-04
TW200703237A (en) 2007-01-16
CA2603187C (en) 2012-05-08
HK1113848A1 (en) 2008-10-17
ES2636443T3 (es) 2017-10-05
BRPI0607690A2 (pt) 2009-09-22
CA2603187A1 (en) 2006-12-07
PL1866915T3 (pl) 2011-05-31
JP5203930B2 (ja) 2013-06-05
IL186438A0 (en) 2008-01-20
SG163556A1 (en) 2010-08-30
PL1864101T3 (pl) 2012-11-30
US20060277042A1 (en) 2006-12-07
EP1864283B1 (en) 2013-02-13
IL186442A0 (en) 2008-01-20
EP1866914B1 (en) 2010-03-03
EP1864101A1 (en) 2007-12-12
RU2381572C2 (ru) 2010-02-10
IL186439A0 (en) 2008-01-20
JP2008537165A (ja) 2008-09-11
IL186441A0 (en) 2008-01-20
IL186438A (en) 2011-09-27
NZ562186A (en) 2010-03-26
KR100956523B1 (ko) 2010-05-07
EP1864101B1 (en) 2012-08-08
KR20070118170A (ko) 2007-12-13
KR20070118167A (ko) 2007-12-13
RU2007140381A (ru) 2009-05-10
WO2006107840A1 (en) 2006-10-12
SG161224A1 (en) 2010-05-27
CA2602806A1 (en) 2006-10-12
NO340434B1 (no) 2017-04-24
IL186443A0 (en) 2008-01-20
TW200707408A (en) 2007-02-16
TW200707405A (en) 2007-02-16
JP2008535025A (ja) 2008-08-28
RU2491659C2 (ru) 2013-08-27
US8078474B2 (en) 2011-12-13
US20080126086A1 (en) 2008-05-29
BRPI0608269B8 (pt) 2019-09-03
IL186442A (en) 2012-06-28
JP5129116B2 (ja) 2013-01-23
CA2603246A1 (en) 2006-10-12
BRPI0608305A2 (pt) 2009-10-06
HK1114901A1 (en) 2008-11-14
CA2603231C (en) 2012-11-06
KR100956877B1 (ko) 2010-05-11
NZ562188A (en) 2010-05-28
TWI324335B (en) 2010-05-01
MX2007012191A (es) 2007-12-11
PL1864282T3 (pl) 2017-10-31
MX2007012187A (es) 2007-12-11
JP5203929B2 (ja) 2013-06-05
CA2603255C (en) 2015-06-23
RU2402826C2 (ru) 2010-10-27
CN102411935B (zh) 2014-05-07
JP5129118B2 (ja) 2013-01-23
KR20070118172A (ko) 2007-12-13
TW200705389A (en) 2007-02-01
TW200705388A (en) 2007-02-01
ATE459958T1 (de) 2010-03-15
HK1115024A1 (en) 2008-11-14
RU2007140382A (ru) 2009-05-10
JP5129115B2 (ja) 2013-01-23
IL186404A0 (en) 2008-01-20
EP1869670A1 (en) 2007-12-26
NZ562185A (en) 2010-06-25
US20070088542A1 (en) 2007-04-19
NO20075513L (no) 2007-12-28
AU2006232357A1 (en) 2006-10-12
IL186443A (en) 2012-09-24
SI1864282T1 (sl) 2017-09-29
DK1864101T3 (da) 2012-10-08
KR20070119722A (ko) 2007-12-20
AU2006232363B2 (en) 2011-01-27
RU2007140406A (ru) 2009-05-10
AU2006232360B2 (en) 2010-04-29
JP2008535024A (ja) 2008-08-28
MX2007012185A (es) 2007-12-11
RU2413191C2 (ru) 2011-02-27
DE602006012637D1 (de) 2010-04-15
CA2602806C (en) 2011-05-31
DE602006017673D1 (de) 2010-12-02
AU2006232362B2 (en) 2009-10-08
KR100956624B1 (ko) 2010-05-11
BRPI0607691A2 (pt) 2009-09-22
RU2390856C2 (ru) 2010-05-27
IL186404A (en) 2011-04-28
US20060271356A1 (en) 2006-11-30
KR100982638B1 (ko) 2010-09-15
US8364494B2 (en) 2013-01-29
KR20070118168A (ko) 2007-12-13
TW200703240A (en) 2007-01-16
NZ562190A (en) 2010-06-25

Similar Documents

Publication Publication Date Title
ES2340608T3 (es) Aparato y procedimiento para codificar mediante banda dividida una señal de voz.
ES2358125T3 (es) Procedimiento y aparato para un filtrado de antidispersión de una señal ensanchada de excitación de predicción de velocidad de ancho de banda.