ES2219624T3 - Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso. - Google Patents

Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso.

Info

Publication number
ES2219624T3
ES2219624T3 ES02290984T ES02290984T ES2219624T3 ES 2219624 T3 ES2219624 T3 ES 2219624T3 ES 02290984 T ES02290984 T ES 02290984T ES 02290984 T ES02290984 T ES 02290984T ES 2219624 T3 ES2219624 T3 ES 2219624T3
Authority
ES
Spain
Prior art keywords
frame
decision
voice
noise
energy
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES02290984T
Other languages
English (en)
Inventor
Raymond Gass
Richard Atzenhoffer
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Alcatel Lucent SAS
Nokia Inc
Original Assignee
Alcatel SA
Nokia Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Alcatel SA, Nokia Inc filed Critical Alcatel SA
Application granted granted Critical
Publication of ES2219624T3 publication Critical patent/ES2219624T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals
    • G10L2025/783Detection of presence or absence of voice signals based on threshold decision

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
  • Communication Control (AREA)
  • Circuits Of Receivers In General (AREA)

Abstract

Procedimiento para detectar la actividad vocal en una señal, siendo recortada esta señal en tramas, y comprendiendo este procedimiento una etapa de alisado de una decisión inicial « voz » o « ruido », tomada para cada trama; caracterizado porque esta etapa de alisado comprende una etapa que consiste en tomar una decisión definitiva « voz » para la enésima trama, si: - la decisión inicial para la trama n es « voz »; - y la decisión definitiva para la trama n-2 era « ruido »; - y la energía de la trama n-1 era superior a la de la trama n-2; - y la energía de la trama n es superior a la energía.

Description

Proceso de detección de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso.
La invención se refiere a un codificador de señal vocal que comprende un dispositivo mejorado de detección de actividad vocal y, especialmente, un codificador de acuerdo con la norma ITU-T G.729A, anexo B.
Una señal vocal comprende hasta un 60% de silencio o de ruido de fondo. Para reducir la cantidad de informaciones que hay que transmitir, se conoce discriminar las porciones de señal vocal que contienen realmente señales útiles, y las porciones que solamente contienen silencio o ruido; y codificarlas, respectivamente, según dos algoritmos diferentes, siendo codificada cada porción que contiene solamente silencio o ruido con muy pocas informaciones que representan las características del ruido ambiente. Un codificador de este tipo comprende un dispositivo de detección de actividad vocal que realiza esta discriminación de acuerdo con las características espectrales, y de acuerdo con la energía de la señal vocal que hay que codificar (calculada en cada trama de señal).
La señal vocal es recortada en tramas numéricas, que corresponden, por ejemplo, a una duración de 10 ms. En cada trama, se extrae de la señal un juego de parámetros. Los parámetros principales son coeficientes de autocorrelación. De estos coeficientes de autocorrelación se deduce un conjunto de coeficientes de codificación por predicción lineal, y un juego de parámetros frecuenciales. Una de las etapas del procedimiento de discriminación de las porciones de señal vocal que contienen realmente señales útiles y de las porciones que contienen solamente silencio o ruido, consiste en comparar la energía de una trama de la señal con un umbral. Un dispositivo de cálculo del valor del umbral adapta el valor del umbral en función de las variaciones del ruido. El ruido que afecta a la señal vocal está compuesto por ruido de origen eléctrico y ruido ambiente. Este último puede aumentar o disminuir de manera importante en el transcurso de una misma comunicación. Por otra parte, coeficientes de filtrado frecuencial del ruido deben ser adaptados, también, a las variaciones del ruido.
El artículo "ITU-T Recommendation G729 Annex B: A silence Compression Schema for Use With G729 Optimized for V.70 Digital Simultaneous Voice and Data Applications", de Adil Benyassine et al, IEEE Communication Magazine, September 1997, describe un codificador de este tipo.
El descodificador encargado de descodificar la señal vocal codificada debe utilizar alternativamente dos algoritmos de descodificación, correspondientes, respectivamente, a las porciones de señal codificadas como voz y a las porciones de señal codificadas como silencio o ruido de fondo. El paso de un algoritmo al otro es sincronizado por las informaciones que codifican los períodos de silencio o ruido.
Los codificadores conocidos que implementan la norma ITU-T G.729A, anexo B, 11/96, no son capaces de hacer la distinción entre la señal útil y el ruido cuando el nivel de ruido es superior a 8.000 escalones de la escala de cuantificación definida por esta norma. Resultan, así, numerosas transiciones inútiles de la señal de detección de actividad vocal y, por tanto, la pérdida de porciones de la señal útil.
Se conoce una solución descrita en la contribución G.723.1 VAD y que consiste en inhibir completamente la detección de actividad vocal en el codificador, cuando la relación señal/ruido es inferior a un valor predeterminado. Esta solución preserva la integridad de la señal útil pero tiene el inconveniente de aumentar el tráfico.
El objeto de la invención es proponer una solución más eficaz, que preserve la eficacia de la detección de actividad vocal en términos de tráfico, pero que no perjudique la calidad de la señal restituida después de la descodificación.
El objeto de la invención es un procedimiento para detectar la actividad vocal en una señal, siendo esta señal recortada en tramas, y comprendiendo este procedimiento una etapa de alisado de una decisión inicial, "voz" o "ruido", tomada para cada trama, caracterizado porque esta etapa de alisado comprende una etapa que consiste en tomar una decisión definitiva "voz", para la trama n, si:
- la decisión inicial para la trama n es "voz";
- y la decisión definitiva para la trama n-2 era "ruido";
- y la energía de la trama n-1 era superior a la de la trama n-2;
- y la energía de la trama n es superior a la energía de la trama n-2.
El procedimiento así caracterizado evita una transición no deseable de "ruido" a "voz" durante un aumento de energía transitorio en la trama n solamente, porque la función de alisado tiene en cuenta la decisión definitiva tomada para la trama n-1 que precede a la trama corriente n, para decidir una transición de "ruido" a "voz".
De acuerdo con un modo de puesta en práctica preferente, si se ha tomado una decisión definitiva "voz" para la trama n, el procedimiento de acuerdo con la invención consiste, además, en impedir cualquier decisión definitiva "ruido" para las tramas n+1 a n+i donde i es un número entero que define una duración de inercia.
El procedimiento así caracterizado evita el fenómeno de pérdida de segmentos de palabras porque la función de alisado presenta una inercia correspondiente a la duración de i tramas, para el retorno a una decisión "ruido".
La invención tiene, también, por objeto un codificador de señal vocal que comprende medios de alisado para poner en práctica el procedimiento de acuerdo con la invención.
La invención será comprendida mejor y otras características se pondrán de manifiesto con la ayuda de la descripción que sigue y de las figuras que la acompañan:
- La figura 1 representa el esquema funcional de un ejemplo de realización de codificador para la puesta en práctica del procedimiento de acuerdo con la invención.
- La figura 2 representa el organigrama de la toma de decisión "voz"/"ruido" de acuerdo con el procedimiento de codificación conocido por la norma G.729 anexo B, 11/96.
- La figura 3 representa de manera más detallada las operaciones de alisado de la señal de detección de actividad vocal, de acuerdo con el procedimiento de codificación conocido por la norma G.729 anexo B, 11/96.
- La figura 4 representa el organigrama de un ejemplo de puesta en práctica del alisado de la señal de detección de actividad vocal, en el procedimiento de acuerdo con la invención.
- La figura 5 representa, respectivamente, los porcentajes de errores con el procedimiento conocido y con el procedimiento de acuerdo con la invención, para diferentes valores de la relación señal/ruido.
- La figura 6 representa los porcentajes de pérdidas de palabras con el procedimiento conocido y con el procedimiento de acuerdo con la invención, para diferentes valores de la relación señal/ruido.
El ejemplo de realización de un codificador, cuyo esquema funcional está representado en la figura 1, comprende:
- un borne de entrada 1 que recibe, en forma analógica, una señal vocal que hay que codificar;
- un circuito 2 para filtrar, muestrear, cuantificar, y poner en tramas, la señal vocal;
- un conmutador 3 que tiene una entrada unida a la salida del circuito 2, y dos salidas;
- un circuito 4 de codificación de las tramas consideradas como representantes verdaderamente de una señal útil, que tiene una entrada unida a una primera salida del conmutador 3;
- un circuito 5 de codificación de las tramas consideradas como representantes de silencio o de ruido, que tiene una entrada unida a una segunda salida del conmutador 3;
- un segundo conmutador 6 que tiene: una primera y una segunda entradas, unidas, respectivamente, a una salida del circuito 4 y a una salida del circuito 5, y un borne de salida 9 que constituye el borne de salida del codificador;
- y un detector 7 de actividad vocal que tiene una entrada unida a la salida del circuito 2 y una salida unida, especialmente, a una entrada de mando de cada uno de los conmutadores 3 y 6, a fin de seleccionar las tramas codificadas correspondientes al contenido reconocido en la señal vocal: ya sea una señal útil, o silencio (o ruido).
Cuando la señal vocal es una señal útil, el codificador facilita una trama cada 10 ms. Cuando la señal vocal está constituida por silencio (o ruido), el codificador facilita una sola trama, al comienzo del período de silencio (o de ruido).
En la práctica, un codificador de este tipo puede realizarse por medio de un procesador convenientemente programado. En particular, el procedimiento de acuerdo con la invención puede ser puesto en práctica por un software cuya realización está al alcance del experto en la técnica.
La figura 2 representa el organigrama de la toma de decisión "voz" o "ruido", de acuerdo con el procedimiento de codificación conocido por la norma G.729 anexo B, 11/96. El procedimiento se aplica a tramas de señal numerizada que tienen una duración fija de 10 ms.
Una primera etapa 11 consiste en extraer cuatro parámetros para la trama corriente de la señal que hay que codificar: la energía de esta trama en toda la banda de frecuencias, la energía de esta trama en las frecuencias bajas, un juego de coeficientes espectrales, y la tasa de pasos por cero.
La etapa siguiente 12 consiste en actualizar el tamaño mínimo de una memoria intermedia.
La etapa siguiente 13 consiste en comparar el número de la trama corriente con un valor predeterminado Ni:
-
Si éste es inferior a Ni:
- -
La etapa siguiente 14 consiste en inicializar los valores de las medias deslizantes de los parámetros de la señal que hay que codificar: los coeficientes espectrales; la energía media en toda la banda; la energía media en las frecuencias bajas, y la tasa media de pasos por cero.
- -
Y después una etapa 15 consiste en comparar la energía de la trama con un valor de umbral predeterminado, para decidir que la señal es de voz si la energía de la trama es superior a este valor, o decidir que la señal es de ruido si la energía de la trama es inferior a este valor. El tratamiento de la trama corriente llega, entonces, a su final 16.
-
Si el número de trama no es inferior a Ni, una etapa siguiente 17 consiste en determinar si éste es igual o si es superior a Ni;
- -
si éste es igual a Ni, la etapa siguiente 18 consiste en inicializar el valor de la energía media del ruido en toda la banda y el valor de la energía media del ruido en las frecuencias bajas.
- -
Si éste es superior a Ni:
- - -
Una etapa siguiente 19 consiste en calcular un juego de parámetros diferencias, substrayendo el valor corriente de un parámetro de trama del valor medio deslizante de este parámetro de trama, siendo este último representativo del ruido. Estos parámetros diferencias son: la distorsión espectral, la diferencia de energía en toda la banda, la diferencia de energía en las frecuencias bajas, y la diferencia de las tasas de pasos por cero.
- - -
Una etapa siguiente 20 consiste en comparar la energía de la trama con un valor de umbral predeterminado:
- - - -
Si ésta no es inferior a este valor, una etapa 21 consiste en tomar una decisión inicial ("voz" o "ruido") basada en una pluralidad de criterios, y después una etapa 22 consiste en "alisar" esta decisión para evitar cambios de decisión demasiado numerosos.
- - - -
Si ésta es inferior o igual a este valor, una etapa 23 consiste en decidir que la señal es ruido, y después la etapa 22 consiste en "alisar" esta decisión.
- -
Después de la etapa 22 de alisado, una etapa siguiente 24 consiste en comparar la energía de la trama corriente con un umbral adaptativo igual a la media deslizante de la energía en toda la banda, aumentada en una constante:
- - -
Si ésta es superior al valor de umbral, una etapa siguiente 25 consiste en actualizar los valores de las medias deslizantes de los parámetros representativos del ruido, y el tratamiento de la trama corriente llega al final 26.
- - -
Si ésta no es superior al valor de umbral, el tratamiento de la trama corriente llega al final 27.
La figura 3 representa de manera más detallada las operaciones de alisado de la señal de detección de actividad vocal, de acuerdo con el procedimiento de codificación conocido por la norma G.729 anexo B, 11/96. Este alisado comprende cuatro etapas, que siguen a la toma de decisión inicial 21 ("voz" o "ruido") basada en una pluralidad de criterios:
-
Una primera etapa consiste en una prueba 31 para tomar la decisión "voz", si:
- -
la decisión para la trama precedente era "voz",
- -
y la energía media de la trama corriente es superior a la media deslizante de la energía de las tramas precedentes, aumentada en una constante, dicho de otro modo si la energía de la trama corriente es netamente superior a la energía media del ruido.
En el caso contrario, se toma definitivamente la decisión "ruido" 42.
-
Una segunda etapa 32 a 35 consiste en una prueba 32 para confirmar la decisión "voz", si:
- -
la decisión para las dos tramas precedentes era "voz",
- -
y la energía media de la trama corriente es superior a la media deslizante de la energía de la trama precedente, aumentada en una constante, dicho de otro modo si la energía no ha disminuido mucho de la trama precedente a la trama corriente.
Esta segunda etapa consiste, además, en incrementar un contador (operación 33), en comparar después su contenido con el valor 4 (operación 34), y en desactivar después (operación 35) esta prueba 32 para la próxima trama, si la trama corriente es la cuarta trama seguida para la cual la decisión es "voz". Si la decisión "voz" no se confirma, se toma definitivamente la decisión "ruido" 42.
-
Una tercera etapa 36 a 39 consiste en una prueba 36 para tomar definitivamente la decisión "ruido" 42, si:
- -
Se ha tomado una decisión "ruido" para las diez tramas que preceden a la trama corriente (habiendo sido tomada la decisión "voz" para ésta en las etapas 31-35).
- -
La energía de la trama corriente es inferior a la energía de la trama precedente aumentada en una constante, dicho de otro modo la energía no ha aumentado mucho de la trama precedente a la trama corriente.
Esta tercera etapa consiste, además, en reinicializar (operación 37) la prueba 36 reinicializando la cuenta de las tramas (operación 39), si la trama corriente es la décima trama seguida para la cual la decisión es "ruido" (prueba 38).
-
Una cuarta etapa consiste en tomar definitivamente en una prueba 40 la decisión "ruido" 42, si la energía de la trama corriente es inferior a la suma de la media deslizante de la energía de las tramas precedentes, aumentada en una constante igual a 614. Dicho de otro modo, la decisión "voz" solamente se confirma definitivamente (operación 41) si la energía de la trama es netamente superior a la media deslizante de la energía de las tramas precedentes. En caso contrario, se toma definitivamente la decisión "ruido" 42.
Esta cuarta etapa 40 (decisión final) facilita decisiones malas de "ruido" cuando la señal está muy afectada por ruido. En efecto, esta etapa 40 decide que la señal es ruido sin tener en cuenta las decisiones que preceden, sino basándose simplemente en la diferencia de energía entre la trama corriente y el ruido de fondo, representado por el valor de la media deslizante de la energía de las tramas precedentes, aumentado en la constante 614. De hecho, cuando el ruido de fondo es elevado, el umbral constituido por esta constante 614 no es válido.
El procedimiento de acuerdo con la invención se distingue del procedimiento conocido por la norma G.729.1, Anexo B, 11/96, a nivel de las etapas de alisado.
La figura 4 representa el organigrama de un ejemplo de puesta en práctica del alisado de la señal de detección de actividad vocal, en el procedimiento de acuerdo con la invención. Este alisado comprende cuatro etapas, que siguen a la toma de decisión inicial 21 ("voz" o "ruido") basada en una pluralidad de criterios. De estas cuatro etapas, tres etapas (pruebas 131, 132, 136) son análogas a tres etapas descritas anteriormente (pruebas 31, 32, 36); la cuarta etapa 40 descrita anteriormente está suprimida; y antes de la primera etapa 31 descrita anteriormente está añadida una etapa denominada preliminar. Una cuenta denominada de inercia es añadida para obtener una inercia de una duración igual a cinco veces la duración de una trama, por ejemplo, antes de cambiar de la decisión "voz" a la decisión "ruido" cuando la energía de la trama llega a ser pequeña. Esta duración es, por tanto, igual a 50 ms en este ejemplo. Esta cuenta de inercia se activa solamente cuando la energía media del ruido se hace superior a 8.000 escalones de la escala de cuantificación definida por la norma G.729.1, Anexo B, 11/96.
-
La etapa preliminar 101 a 104 añadida consiste en:
- -
Si la decisión inicial de la etapa 21 es "voz", inicializar a 0 el contador de inercia (operación 102) y finalmente pasar a la prueba 131.
- -
Si la decisión inicial de la etapa 21 es "ruido", determinar si la energía de la trama corriente es superior a un valor de umbral fijado, y determinar si el contenido del contador de inercia es inferior a 6 y superior a 1 (operación 103). Después:
- - -
Tomar la decisión "voz" (en contradicción con la decisión inicial) si se cumplen estas dos condiciones, e incrementar después el contador de inercia en una unidad (operación 104) y finalmente pasar a la prueba 131.
- - -
O tomar definitivamente la decisión "ruido" 142 si no se cumple una de estas condiciones.
-
La primera etapa consiste en una prueba 131 (análoga a la prueba 31) que consiste en mantener la decisión "voz" si la decisión precedente era "voz" y la energía media de la trama corriente es superior a la media deslizante de la energía de las tramas precedentes, aumentada en una constante fijada.
-
La segunda etapa 132 a 135 (análoga a la etapa 32 a 35) consiste en tomar la decisión "voz" si:
- -
la decisión para las dos tramas precedentes era "voz",
- -
y la energía media de la trama corriente es superior a la media deslizante de la energía de la trama precedente, aumentada en una constante, dicho de otro modo si la energía no ha disminuido mucho de la trama precedente a la trama corriente.
Esta segunda etapa 132 a 135 consiste, además, en desactivar esta prueba para la próxima trama, si la trama corriente es la cuarta trama seguida para la cual la decisión es "voz" (incremento 133 de un contador, comparación 134 de su contenido con el valor 4, y desactivación 135 si se alcanza el valor 4).
-
La tercera etapa 136 a 139, 143 (poco diferente de la etapa 36 a 39) consiste en tomar definitivamente la decisión "ruido" 142, si:
- -
Se ha tomado una decisión "ruido" para las diez últimas tramas;
- -
Y la energía de la trama corriente es inferior a la energía de la trama precedente aumentada en una constante, dicho de otro modo si la energía no ha aumentado mucho de la trama precedente a la trama corriente.
Esta tercera etapa consiste, además, en reinicializar esta prueba 136 reinicializando la cuenta de las tramas, si la trama corriente es la décima trama seguida para la cual la decisión es "ruido" (incremento 137 de un contador, comparación 138 del contenido de este contador con el valor 10, reinicialización 139 de este contador a 0 si se llega al valor 10). La tercera etapa es modificada con respecto al procedimiento conocido descrito anteriormente, porque ésta consiste, además, en forzar el contador de inercia al valor 6 (operación 143) para evitar cualquier interacción entre esta prueba 136 y el contador de inercia.
-
No hay cuarta etapa análoga a la etapa 40.
En la figura 5 las curvas E1 y E2 representan, respectivamente, los porcentajes de errores con el procedimiento conocido y con el procedimiento de acuerdo con la invención, para diferentes valores de la relación señal/ruido.
En la figura 6 las curvas L1 y L2 representan, respectivamente, los porcentajes de pérdidas de palabra con el procedimiento conocido y con el procedimiento de acuerdo con la invención, para diferentes valores de la relación señal/ruido.
Éstas muestran que el comportamiento de la detección de actividad vocal mejora ampliamente en medio ruidoso. El porcentaje de error global disminuye y, sobre todo, el porcentaje de palabra perdida se reduce considerablemente. La integridad de la palabra está preservada y la conversación se mantiene comprensible.

Claims (6)

1. Procedimiento para detectar la actividad vocal en una señal, siendo recortada esta señal en tramas, y comprendiendo este procedimiento una etapa de alisado de una decisión inicial "voz" o "ruido", tomada para cada trama; caracterizado porque esta etapa de alisado comprende una etapa que consiste en tomar una decisión definitiva "voz" para la enésima trama, si:
- la decisión inicial para la trama n es "voz";
- y la decisión definitiva para la trama n-2 era "ruido";
- y la energía de la trama n-1 era superior a la de la trama n-2;
- y la energía de la trama n es superior a la energía de la trama n-2.
2. Procedimiento de acuerdo con la reivindicación 1, caracterizado porque si se ha tomado una decisión definitiva "voz" para la trama n, consiste, además, en impedir cualquier decisión definitiva "ruido" para las tramas n + 1 a n + i donde i es un número entero que define una duración de inercia.
3. Procedimiento de acuerdo con la reivindicación 1, caracterizado porque esta etapa de alisado comprende una etapa que consiste, para la trama n, en:
- Si la decisión inicial es "voz", inicializar a 0 un contador de inercia (102).
- Si la decisión inicial es "ruido", determinar si la energía de la trama n es superior a un valor de umbral, y determinar si el contenido del contador de inercia es inferior a un umbral fijado, y superior a uno (103). Después:
- Tomar la decisión "voz" si se cumplen estas tres condiciones, e incrementar después el contador de inercia en una unidad (104).
- O tomar la decisión "ruido" si no se cumple una de estas condiciones.
4. Codificador de señal vocal que comprende un dispositivo de detección de actividad vocal, siendo recortada esta señal en tramas, y comprendiendo este dispositivo medios de alisado de una decisión inicial "voz" o "ruido", tomada para cada trama; caracterizado porque estos medios de alisado comprenden medios para tomar una decisión definitiva "voz" para la enésima trama, si:
- la decisión inicial para la trama n es "voz";
- y la decisión definitiva para la trama n-2 era "ruido";
- y la energía de la trama n-1 era superior a la de la trama n-2;
- y la energía de la trama n es superior a la energía de la trama n-2.
5. Codificador de acuerdo con la reivindicación 4, caracterizado porque los medios de alisado comprenden medios para impedir cualquier decisión definitiva "ruido" para las tramas n + 1 a n + i donde i es un número entero que define una duración de inercia, si se ha tomado una decisión definitiva "voz" para la trama n.
6. Codificador de acuerdo con la reivindicación 4, caracterizado porque los medios de alisado comprenden medios para:
- Si la decisión inicial es "voz" para la trama n, inicializar a 0 un contador de inercia (102).
- Si la decisión inicial es "ruido", determinar si la energía de la trama n es superior a un valor de umbral, y determinar si el contenido del contador de inercia es inferior a un umbral fijado, y es superior a uno (103). Después:
- Tomar la decisión "voz" si se cumplen estas tres condiciones, e incrementar después el contador de inercia en una unidad (104).
- O tomar la decisión "ruido" si no se cumple una de estas condiciones.
ES02290984T 2001-06-11 2002-04-18 Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso. Expired - Lifetime ES2219624T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0107585 2001-06-11
FR0107585A FR2825826B1 (fr) 2001-06-11 2001-06-11 Procede pour detecter l'activite vocale dans un signal, et codeur de signal vocal comportant un dispositif pour la mise en oeuvre de ce procede

Publications (1)

Publication Number Publication Date
ES2219624T3 true ES2219624T3 (es) 2004-12-01

Family

ID=8864153

Family Applications (1)

Application Number Title Priority Date Filing Date
ES02290984T Expired - Lifetime ES2219624T3 (es) 2001-06-11 2002-04-18 Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso.

Country Status (8)

Country Link
US (1) US7596487B2 (es)
EP (1) EP1267325B1 (es)
JP (2) JP3992545B2 (es)
CN (1) CN1162835C (es)
AT (1) ATE269573T1 (es)
DE (1) DE60200632T2 (es)
ES (1) ES2219624T3 (es)
FR (1) FR2825826B1 (es)

Families Citing this family (21)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7756709B2 (en) * 2004-02-02 2010-07-13 Applied Voice & Speech Technologies, Inc. Detection of voice inactivity within a sound stream
GB0408856D0 (en) * 2004-04-21 2004-05-26 Nokia Corp Signal encoding
ATE371926T1 (de) * 2004-05-17 2007-09-15 Nokia Corp Audiocodierung mit verschiedenen codierungsmodellen
DE102004049347A1 (de) * 2004-10-08 2006-04-20 Micronas Gmbh Schaltungsanordnung bzw. Verfahren für Sprache enthaltende Audiosignale
KR100657912B1 (ko) * 2004-11-18 2006-12-14 삼성전자주식회사 잡음 제거 방법 및 장치
US20060241937A1 (en) * 2005-04-21 2006-10-26 Ma Changxue C Method and apparatus for automatically discriminating information bearing audio segments and background noise audio segments
KR20080059881A (ko) * 2006-12-26 2008-07-01 삼성전자주식회사 음성 신호의 전처리 장치 및 방법
EP2816560A1 (en) * 2009-10-19 2014-12-24 Telefonaktiebolaget L M Ericsson (PUBL) Method and background estimator for voice activity detection
CN102137194B (zh) * 2010-01-21 2014-01-01 华为终端有限公司 一种通话检测方法及装置
ES2489472T3 (es) * 2010-12-24 2014-09-02 Huawei Technologies Co., Ltd. Método y aparato para una detección adaptativa de la actividad vocal en una señal de audio de entrada
US9659571B2 (en) * 2011-05-11 2017-05-23 Robert Bosch Gmbh System and method for emitting and especially controlling an audio signal in an environment using an objective intelligibility measure
US20130090926A1 (en) * 2011-09-16 2013-04-11 Qualcomm Incorporated Mobile device context information using speech detection
CN103325386B (zh) * 2012-03-23 2016-12-21 杜比实验室特许公司 用于信号传输控制的方法和系统
CN107978325B (zh) * 2012-03-23 2022-01-11 杜比实验室特许公司 语音通信方法和设备、操作抖动缓冲器的方法和设备
CN105681966B (zh) * 2014-11-19 2018-10-19 塞舌尔商元鼎音讯股份有限公司 降低噪音的方法及电子装置
US10928502B2 (en) * 2018-05-30 2021-02-23 Richwave Technology Corp. Methods and apparatus for detecting presence of an object in an environment
CN109360585A (zh) * 2018-12-19 2019-02-19 晶晨半导体(上海)股份有限公司 一种语音激活检测方法
CN113497852A (zh) * 2020-04-07 2021-10-12 北京字节跳动网络技术有限公司 自动音量调整方法、装置、介质和设备
CN113555025B (zh) * 2020-04-26 2024-08-09 华为技术有限公司 一种静音描述帧发送、协商方法及装置
CN115132231B (zh) * 2022-08-31 2022-12-13 安徽讯飞寰语科技有限公司 语音活性检测方法、装置、设备及可读存储介质
US20250037733A1 (en) * 2023-07-28 2025-01-30 Cisco Technology, Inc. Discontinuous noise removal in an audio processing pipeline

Family Cites Families (15)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH0240700A (ja) * 1988-08-01 1990-02-09 Matsushita Electric Ind Co Ltd 音声検出装置
JPH0424692A (ja) * 1990-05-18 1992-01-28 Ricoh Co Ltd 音声区間検出方式
US5410632A (en) * 1991-12-23 1995-04-25 Motorola, Inc. Variable hangover time in a voice activity detector
US5583961A (en) * 1993-03-25 1996-12-10 British Telecommunications Public Limited Company Speaker recognition using spectral coefficients normalized with respect to unequal frequency bands
US5459814A (en) * 1993-03-26 1995-10-17 Hughes Aircraft Company Voice activity detector for speech signals in variable background noise
JP2897628B2 (ja) * 1993-12-24 1999-05-31 三菱電機株式会社 音声検出器
JP3604393B2 (ja) * 1994-07-18 2004-12-22 松下電器産業株式会社 音声検出装置
JP3109978B2 (ja) * 1995-04-28 2000-11-20 松下電器産業株式会社 音声区間検出装置
US5819217A (en) * 1995-12-21 1998-10-06 Nynex Science & Technology, Inc. Method and system for differentiating between speech and noise
JP3297346B2 (ja) * 1997-04-30 2002-07-02 沖電気工業株式会社 音声検出装置
US6188981B1 (en) * 1998-09-18 2001-02-13 Conexant Systems, Inc. Method and apparatus for detecting voice activity in a speech signal
US6691084B2 (en) * 1998-12-21 2004-02-10 Qualcomm Incorporated Multiple mode variable rate speech coding
JP3759685B2 (ja) * 1999-05-18 2006-03-29 三菱電機株式会社 雑音区間判定装置,雑音抑圧装置及び推定雑音情報更新方法
FR2797343B1 (fr) * 1999-08-04 2001-10-05 Matra Nortel Communications Procede et dispositif de detection d'activite vocale
WO2002045078A1 (en) * 2000-11-30 2002-06-06 Matsushita Electric Industrial Co., Ltd. Audio decoder and audio decoding method

Also Published As

Publication number Publication date
JP2006189907A (ja) 2006-07-20
CN1162835C (zh) 2004-08-18
ATE269573T1 (de) 2004-07-15
JP2003005772A (ja) 2003-01-08
EP1267325A1 (fr) 2002-12-18
US20020188442A1 (en) 2002-12-12
JP3992545B2 (ja) 2007-10-17
US7596487B2 (en) 2009-09-29
EP1267325B1 (fr) 2004-06-16
DE60200632D1 (de) 2004-07-22
CN1391212A (zh) 2003-01-15
FR2825826B1 (fr) 2003-09-12
FR2825826A1 (fr) 2002-12-13
DE60200632T2 (de) 2004-12-23

Similar Documents

Publication Publication Date Title
ES2219624T3 (es) Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso.
RU2120668C1 (ru) Устройство и способ маскирования ошибок
JP4146489B2 (ja) 音声パケット再生方法、音声パケット再生装置、音声パケット再生プログラム、記録媒体
US7983906B2 (en) Adaptive voice mode extension for a voice activity detector
US8041563B2 (en) Apparatus for coding a wideband audio signal and a method for coding a wideband audio signal
ES2209383T3 (es) Procedimiento de decodificacion de una señal audio con correccion de los errores de transmision.
US8180632B2 (en) Method for limiting adaptive excitation gain in an audio decoder
JP2006512617A5 (es)
JP4221537B2 (ja) 音声検出方法及び装置とその記録媒体
CN107666325B (zh) 基于列表连续删除算法的极化码译码路径选择方法
ES2274812T3 (es) Codificador predictivo de voz usando pautas de seleccion de esquemas de codificacion para reducir la sensilibidad de errores de trama.
JP2004361731A (ja) オーディオ復号装置及びオーディオ復号方法
WO2001084540A1 (en) Method and apparatus for reducing rate determination errors and their artifacts
CN103117062B (zh) 语音解码器中帧差错隐藏的谱参数代替方法及系统
JP5547282B2 (ja) パルス符号化のための方法および装置、パルス復号のための方法および装置
KR20000062171A (ko) 가변 비율 음성부호화기의 음성 부호화 비율 결정장치 및방법
KR20230129581A (ko) 음성 정보를 갖는 개선된 프레임 손실 보정
KR20000026288A (ko) 약전계에서 코드 분할 다중 접속 시스템의 코덱 잡음 제거 방법
CN101226744A (zh) 语音解码器中实现语音解码的方法及装置
KR100407479B1 (ko) 가변 길이의 코드 워드의 데이터 스트림을 만드는 방법 및장치와 가변 길이의 코드 워드의 데이터 스트림을 읽어내는 방법 및 장치
JP3315708B2 (ja) 比較減衰器付音声符復号器
Ramadas et al. A phonetically switched ADPCM speech coder
CN1366659A (zh) 具有音调变化检测的纠错方法
Yang et al. An inter-frame correlation based error concealment of immittance spectral coefficients for mobile speech and audio codecs
JPH0467200A (ja) 有音区間判定方法