ES2219624T3 - Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso. - Google Patents
Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso.Info
- Publication number
- ES2219624T3 ES2219624T3 ES02290984T ES02290984T ES2219624T3 ES 2219624 T3 ES2219624 T3 ES 2219624T3 ES 02290984 T ES02290984 T ES 02290984T ES 02290984 T ES02290984 T ES 02290984T ES 2219624 T3 ES2219624 T3 ES 2219624T3
- Authority
- ES
- Spain
- Prior art keywords
- frame
- decision
- voice
- noise
- energy
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 title claims description 35
- 230000000694 effects Effects 0.000 title abstract description 6
- 238000001514 detection method Methods 0.000 title description 11
- 230000008569 process Effects 0.000 title description 9
- 230000001755 vocal effect Effects 0.000 claims description 28
- 238000009499 grossing Methods 0.000 claims description 22
- 230000003595 spectral effect Effects 0.000 description 4
- 230000008520 organization Effects 0.000 description 3
- 230000007704 transition Effects 0.000 description 3
- 238000004891 communication Methods 0.000 description 2
- 230000007423 decrease Effects 0.000 description 2
- 230000003247 decreasing effect Effects 0.000 description 2
- 238000011002 quantification Methods 0.000 description 2
- 230000003044 adaptive effect Effects 0.000 description 1
- 238000004364 calculation method Methods 0.000 description 1
- 230000006835 compression Effects 0.000 description 1
- 238000007906 compression Methods 0.000 description 1
- 230000009849 deactivation Effects 0.000 description 1
- 238000001914 filtration Methods 0.000 description 1
- 230000002401 inhibitory effect Effects 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 230000001360 synchronised effect Effects 0.000 description 1
- 230000001052 transient effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
- G10L2025/783—Detection of presence or absence of voice signals based on threshold decision
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Computational Linguistics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
- Communication Control (AREA)
- Circuits Of Receivers In General (AREA)
Abstract
Procedimiento para detectar la actividad vocal en una señal, siendo recortada esta señal en tramas, y comprendiendo este procedimiento una etapa de alisado de una decisión inicial « voz » o « ruido », tomada para cada trama; caracterizado porque esta etapa de alisado comprende una etapa que consiste en tomar una decisión definitiva « voz » para la enésima trama, si: - la decisión inicial para la trama n es « voz »; - y la decisión definitiva para la trama n-2 era « ruido »; - y la energía de la trama n-1 era superior a la de la trama n-2; - y la energía de la trama n es superior a la energía.
Description
Proceso de detección de actividad de voz en una
señal, y codificador de señal de voz que comprende un dispositivo
para realizar el proceso.
La invención se refiere a un codificador de señal
vocal que comprende un dispositivo mejorado de detección de
actividad vocal y, especialmente, un codificador de acuerdo con la
norma ITU-T G.729A, anexo B.
Una señal vocal comprende hasta un 60% de
silencio o de ruido de fondo. Para reducir la cantidad de
informaciones que hay que transmitir, se conoce discriminar las
porciones de señal vocal que contienen realmente señales útiles, y
las porciones que solamente contienen silencio o ruido; y
codificarlas, respectivamente, según dos algoritmos diferentes,
siendo codificada cada porción que contiene solamente silencio o
ruido con muy pocas informaciones que representan las
características del ruido ambiente. Un codificador de este tipo
comprende un dispositivo de detección de actividad vocal que realiza
esta discriminación de acuerdo con las características espectrales,
y de acuerdo con la energía de la señal vocal que hay que codificar
(calculada en cada trama de señal).
La señal vocal es recortada en tramas numéricas,
que corresponden, por ejemplo, a una duración de 10 ms. En cada
trama, se extrae de la señal un juego de parámetros. Los parámetros
principales son coeficientes de autocorrelación. De estos
coeficientes de autocorrelación se deduce un conjunto de
coeficientes de codificación por predicción lineal, y un juego de
parámetros frecuenciales. Una de las etapas del procedimiento de
discriminación de las porciones de señal vocal que contienen
realmente señales útiles y de las porciones que contienen solamente
silencio o ruido, consiste en comparar la energía de una trama de la
señal con un umbral. Un dispositivo de cálculo del valor del umbral
adapta el valor del umbral en función de las variaciones del ruido.
El ruido que afecta a la señal vocal está compuesto por ruido de
origen eléctrico y ruido ambiente. Este último puede aumentar o
disminuir de manera importante en el transcurso de una misma
comunicación. Por otra parte, coeficientes de filtrado frecuencial
del ruido deben ser adaptados, también, a las variaciones del
ruido.
El artículo "ITU-T
Recommendation G729 Annex B: A silence Compression Schema for Use
With G729 Optimized for V.70 Digital Simultaneous Voice and Data
Applications", de Adil Benyassine et al, IEEE
Communication Magazine, September 1997, describe un codificador de
este tipo.
El descodificador encargado de descodificar la
señal vocal codificada debe utilizar alternativamente dos algoritmos
de descodificación, correspondientes, respectivamente, a las
porciones de señal codificadas como voz y a las porciones de señal
codificadas como silencio o ruido de fondo. El paso de un algoritmo
al otro es sincronizado por las informaciones que codifican los
períodos de silencio o ruido.
Los codificadores conocidos que implementan la
norma ITU-T G.729A, anexo B, 11/96, no son capaces
de hacer la distinción entre la señal útil y el ruido cuando el
nivel de ruido es superior a 8.000 escalones de la escala de
cuantificación definida por esta norma. Resultan, así, numerosas
transiciones inútiles de la señal de detección de actividad vocal
y, por tanto, la pérdida de porciones de la señal útil.
Se conoce una solución descrita en la
contribución G.723.1 VAD y que consiste en inhibir completamente la
detección de actividad vocal en el codificador, cuando la relación
señal/ruido es inferior a un valor predeterminado. Esta solución
preserva la integridad de la señal útil pero tiene el inconveniente
de aumentar el tráfico.
El objeto de la invención es proponer una
solución más eficaz, que preserve la eficacia de la detección de
actividad vocal en términos de tráfico, pero que no perjudique la
calidad de la señal restituida después de la descodificación.
El objeto de la invención es un procedimiento
para detectar la actividad vocal en una señal, siendo esta señal
recortada en tramas, y comprendiendo este procedimiento una etapa de
alisado de una decisión inicial, "voz" o "ruido", tomada
para cada trama, caracterizado porque esta etapa de alisado
comprende una etapa que consiste en tomar una decisión definitiva
"voz", para la trama n, si:
- la decisión inicial para la trama n es
"voz";
- y la decisión definitiva para la trama
n-2 era "ruido";
- y la energía de la trama n-1
era superior a la de la trama n-2;
- y la energía de la trama n es superior a la
energía de la trama n-2.
El procedimiento así caracterizado evita una
transición no deseable de "ruido" a "voz" durante un
aumento de energía transitorio en la trama n solamente, porque la
función de alisado tiene en cuenta la decisión definitiva tomada
para la trama n-1 que precede a la trama corriente
n, para decidir una transición de "ruido" a "voz".
De acuerdo con un modo de puesta en práctica
preferente, si se ha tomado una decisión definitiva "voz" para
la trama n, el procedimiento de acuerdo con la invención consiste,
además, en impedir cualquier decisión definitiva "ruido" para
las tramas n+1 a n+i donde i es un número entero que define una
duración de inercia.
El procedimiento así caracterizado evita el
fenómeno de pérdida de segmentos de palabras porque la función de
alisado presenta una inercia correspondiente a la duración de i
tramas, para el retorno a una decisión "ruido".
La invención tiene, también, por objeto un
codificador de señal vocal que comprende medios de alisado para
poner en práctica el procedimiento de acuerdo con la invención.
La invención será comprendida mejor y otras
características se pondrán de manifiesto con la ayuda de la
descripción que sigue y de las figuras que la acompañan:
- La figura 1 representa el esquema funcional de
un ejemplo de realización de codificador para la puesta en práctica
del procedimiento de acuerdo con la invención.
- La figura 2 representa el organigrama de la
toma de decisión "voz"/"ruido" de acuerdo con el
procedimiento de codificación conocido por la norma G.729 anexo B,
11/96.
- La figura 3 representa de manera más detallada
las operaciones de alisado de la señal de detección de actividad
vocal, de acuerdo con el procedimiento de codificación conocido por
la norma G.729 anexo B, 11/96.
- La figura 4 representa el organigrama de un
ejemplo de puesta en práctica del alisado de la señal de detección
de actividad vocal, en el procedimiento de acuerdo con la
invención.
- La figura 5 representa, respectivamente, los
porcentajes de errores con el procedimiento conocido y con el
procedimiento de acuerdo con la invención, para diferentes valores
de la relación señal/ruido.
- La figura 6 representa los porcentajes de
pérdidas de palabras con el procedimiento conocido y con el
procedimiento de acuerdo con la invención, para diferentes valores
de la relación señal/ruido.
El ejemplo de realización de un codificador, cuyo
esquema funcional está representado en la figura 1, comprende:
- un borne de entrada 1 que recibe, en forma
analógica, una señal vocal que hay que codificar;
- un circuito 2 para filtrar, muestrear,
cuantificar, y poner en tramas, la señal vocal;
- un conmutador 3 que tiene una entrada unida a
la salida del circuito 2, y dos salidas;
- un circuito 4 de codificación de las tramas
consideradas como representantes verdaderamente de una señal útil,
que tiene una entrada unida a una primera salida del conmutador
3;
- un circuito 5 de codificación de las tramas
consideradas como representantes de silencio o de ruido, que tiene
una entrada unida a una segunda salida del conmutador 3;
- un segundo conmutador 6 que tiene: una primera
y una segunda entradas, unidas, respectivamente, a una salida del
circuito 4 y a una salida del circuito 5, y un borne de salida 9
que constituye el borne de salida del codificador;
- y un detector 7 de actividad vocal que tiene
una entrada unida a la salida del circuito 2 y una salida unida,
especialmente, a una entrada de mando de cada uno de los
conmutadores 3 y 6, a fin de seleccionar las tramas codificadas
correspondientes al contenido reconocido en la señal vocal: ya sea
una señal útil, o silencio (o ruido).
Cuando la señal vocal es una señal útil, el
codificador facilita una trama cada 10 ms. Cuando la señal vocal
está constituida por silencio (o ruido), el codificador facilita
una sola trama, al comienzo del período de silencio (o de
ruido).
En la práctica, un codificador de este tipo puede
realizarse por medio de un procesador convenientemente programado.
En particular, el procedimiento de acuerdo con la invención puede
ser puesto en práctica por un software cuya realización está al
alcance del experto en la técnica.
La figura 2 representa el organigrama de la toma
de decisión "voz" o "ruido", de acuerdo con el
procedimiento de codificación conocido por la norma G.729 anexo B,
11/96. El procedimiento se aplica a tramas de señal numerizada que
tienen una duración fija de 10 ms.
Una primera etapa 11 consiste en extraer cuatro
parámetros para la trama corriente de la señal que hay que
codificar: la energía de esta trama en toda la banda de
frecuencias, la energía de esta trama en las frecuencias bajas, un
juego de coeficientes espectrales, y la tasa de pasos por cero.
La etapa siguiente 12 consiste en actualizar el
tamaño mínimo de una memoria intermedia.
La etapa siguiente 13 consiste en comparar el
número de la trama corriente con un valor predeterminado Ni:
- -
- Si éste es inferior a Ni:
- - -
- La etapa siguiente 14 consiste en inicializar los valores de las medias deslizantes de los parámetros de la señal que hay que codificar: los coeficientes espectrales; la energía media en toda la banda; la energía media en las frecuencias bajas, y la tasa media de pasos por cero.
- - -
- Y después una etapa 15 consiste en comparar la energía de la trama con un valor de umbral predeterminado, para decidir que la señal es de voz si la energía de la trama es superior a este valor, o decidir que la señal es de ruido si la energía de la trama es inferior a este valor. El tratamiento de la trama corriente llega, entonces, a su final 16.
- -
- Si el número de trama no es inferior a Ni, una etapa siguiente 17 consiste en determinar si éste es igual o si es superior a Ni;
- - -
- si éste es igual a Ni, la etapa siguiente 18 consiste en inicializar el valor de la energía media del ruido en toda la banda y el valor de la energía media del ruido en las frecuencias bajas.
- - -
- Si éste es superior a Ni:
- - - -
- Una etapa siguiente 19 consiste en calcular un juego de parámetros diferencias, substrayendo el valor corriente de un parámetro de trama del valor medio deslizante de este parámetro de trama, siendo este último representativo del ruido. Estos parámetros diferencias son: la distorsión espectral, la diferencia de energía en toda la banda, la diferencia de energía en las frecuencias bajas, y la diferencia de las tasas de pasos por cero.
- - - -
- Una etapa siguiente 20 consiste en comparar la energía de la trama con un valor de umbral predeterminado:
- - - - -
- Si ésta no es inferior a este valor, una etapa 21 consiste en tomar una decisión inicial ("voz" o "ruido") basada en una pluralidad de criterios, y después una etapa 22 consiste en "alisar" esta decisión para evitar cambios de decisión demasiado numerosos.
- - - - -
- Si ésta es inferior o igual a este valor, una etapa 23 consiste en decidir que la señal es ruido, y después la etapa 22 consiste en "alisar" esta decisión.
- - -
- Después de la etapa 22 de alisado, una etapa siguiente 24 consiste en comparar la energía de la trama corriente con un umbral adaptativo igual a la media deslizante de la energía en toda la banda, aumentada en una constante:
- - - -
- Si ésta es superior al valor de umbral, una etapa siguiente 25 consiste en actualizar los valores de las medias deslizantes de los parámetros representativos del ruido, y el tratamiento de la trama corriente llega al final 26.
- - - -
- Si ésta no es superior al valor de umbral, el tratamiento de la trama corriente llega al final 27.
La figura 3 representa de manera más detallada
las operaciones de alisado de la señal de detección de actividad
vocal, de acuerdo con el procedimiento de codificación conocido por
la norma G.729 anexo B, 11/96. Este alisado comprende cuatro etapas,
que siguen a la toma de decisión inicial 21 ("voz" o
"ruido") basada en una pluralidad de criterios:
- -
- Una primera etapa consiste en una prueba 31 para tomar la decisión "voz", si:
- - -
- la decisión para la trama precedente era "voz",
- - -
- y la energía media de la trama corriente es superior a la media deslizante de la energía de las tramas precedentes, aumentada en una constante, dicho de otro modo si la energía de la trama corriente es netamente superior a la energía media del ruido.
En el caso contrario, se toma definitivamente la
decisión "ruido" 42.
- -
- Una segunda etapa 32 a 35 consiste en una prueba 32 para confirmar la decisión "voz", si:
- - -
- la decisión para las dos tramas precedentes era "voz",
- - -
- y la energía media de la trama corriente es superior a la media deslizante de la energía de la trama precedente, aumentada en una constante, dicho de otro modo si la energía no ha disminuido mucho de la trama precedente a la trama corriente.
Esta segunda etapa consiste, además, en
incrementar un contador (operación 33), en comparar después su
contenido con el valor 4 (operación 34), y en desactivar después
(operación 35) esta prueba 32 para la próxima trama, si la trama
corriente es la cuarta trama seguida para la cual la decisión es
"voz". Si la decisión "voz" no se confirma, se toma
definitivamente la decisión "ruido" 42.
- -
- Una tercera etapa 36 a 39 consiste en una prueba 36 para tomar definitivamente la decisión "ruido" 42, si:
- - -
- Se ha tomado una decisión "ruido" para las diez tramas que preceden a la trama corriente (habiendo sido tomada la decisión "voz" para ésta en las etapas 31-35).
- - -
- La energía de la trama corriente es inferior a la energía de la trama precedente aumentada en una constante, dicho de otro modo la energía no ha aumentado mucho de la trama precedente a la trama corriente.
Esta tercera etapa consiste, además, en
reinicializar (operación 37) la prueba 36 reinicializando la cuenta
de las tramas (operación 39), si la trama corriente es la décima
trama seguida para la cual la decisión es "ruido" (prueba
38).
- -
- Una cuarta etapa consiste en tomar definitivamente en una prueba 40 la decisión "ruido" 42, si la energía de la trama corriente es inferior a la suma de la media deslizante de la energía de las tramas precedentes, aumentada en una constante igual a 614. Dicho de otro modo, la decisión "voz" solamente se confirma definitivamente (operación 41) si la energía de la trama es netamente superior a la media deslizante de la energía de las tramas precedentes. En caso contrario, se toma definitivamente la decisión "ruido" 42.
Esta cuarta etapa 40 (decisión final) facilita
decisiones malas de "ruido" cuando la señal está muy afectada
por ruido. En efecto, esta etapa 40 decide que la señal es ruido
sin tener en cuenta las decisiones que preceden, sino basándose
simplemente en la diferencia de energía entre la trama corriente y
el ruido de fondo, representado por el valor de la media deslizante
de la energía de las tramas precedentes, aumentado en la constante
614. De hecho, cuando el ruido de fondo es elevado, el umbral
constituido por esta constante 614 no es válido.
El procedimiento de acuerdo con la invención se
distingue del procedimiento conocido por la norma G.729.1, Anexo B,
11/96, a nivel de las etapas de alisado.
La figura 4 representa el organigrama de un
ejemplo de puesta en práctica del alisado de la señal de detección
de actividad vocal, en el procedimiento de acuerdo con la
invención. Este alisado comprende cuatro etapas, que siguen a la
toma de decisión inicial 21 ("voz" o "ruido") basada en
una pluralidad de criterios. De estas cuatro etapas, tres etapas
(pruebas 131, 132, 136) son análogas a tres etapas descritas
anteriormente (pruebas 31, 32, 36); la cuarta etapa 40 descrita
anteriormente está suprimida; y antes de la primera etapa 31
descrita anteriormente está añadida una etapa denominada preliminar.
Una cuenta denominada de inercia es añadida para obtener una
inercia de una duración igual a cinco veces la duración de una
trama, por ejemplo, antes de cambiar de la decisión "voz" a la
decisión "ruido" cuando la energía de la trama llega a ser
pequeña. Esta duración es, por tanto, igual a 50 ms en este ejemplo.
Esta cuenta de inercia se activa solamente cuando la energía media
del ruido se hace superior a 8.000 escalones de la escala de
cuantificación definida por la norma G.729.1, Anexo B, 11/96.
- -
- La etapa preliminar 101 a 104 añadida consiste en:
- - -
- Si la decisión inicial de la etapa 21 es "voz", inicializar a 0 el contador de inercia (operación 102) y finalmente pasar a la prueba 131.
- - -
- Si la decisión inicial de la etapa 21 es "ruido", determinar si la energía de la trama corriente es superior a un valor de umbral fijado, y determinar si el contenido del contador de inercia es inferior a 6 y superior a 1 (operación 103). Después:
- - - -
- Tomar la decisión "voz" (en contradicción con la decisión inicial) si se cumplen estas dos condiciones, e incrementar después el contador de inercia en una unidad (operación 104) y finalmente pasar a la prueba 131.
- - - -
- O tomar definitivamente la decisión "ruido" 142 si no se cumple una de estas condiciones.
- -
- La primera etapa consiste en una prueba 131 (análoga a la prueba 31) que consiste en mantener la decisión "voz" si la decisión precedente era "voz" y la energía media de la trama corriente es superior a la media deslizante de la energía de las tramas precedentes, aumentada en una constante fijada.
- -
- La segunda etapa 132 a 135 (análoga a la etapa 32 a 35) consiste en tomar la decisión "voz" si:
- - -
- la decisión para las dos tramas precedentes era "voz",
- - -
- y la energía media de la trama corriente es superior a la media deslizante de la energía de la trama precedente, aumentada en una constante, dicho de otro modo si la energía no ha disminuido mucho de la trama precedente a la trama corriente.
Esta segunda etapa 132 a 135 consiste, además, en
desactivar esta prueba para la próxima trama, si la trama corriente
es la cuarta trama seguida para la cual la decisión es "voz"
(incremento 133 de un contador, comparación 134 de su contenido con
el valor 4, y desactivación 135 si se alcanza el valor 4).
- -
- La tercera etapa 136 a 139, 143 (poco diferente de la etapa 36 a 39) consiste en tomar definitivamente la decisión "ruido" 142, si:
- - -
- Se ha tomado una decisión "ruido" para las diez últimas tramas;
- - -
- Y la energía de la trama corriente es inferior a la energía de la trama precedente aumentada en una constante, dicho de otro modo si la energía no ha aumentado mucho de la trama precedente a la trama corriente.
Esta tercera etapa consiste, además, en
reinicializar esta prueba 136 reinicializando la cuenta de las
tramas, si la trama corriente es la décima trama seguida para la
cual la decisión es "ruido" (incremento 137 de un contador,
comparación 138 del contenido de este contador con el valor 10,
reinicialización 139 de este contador a 0 si se llega al valor 10).
La tercera etapa es modificada con respecto al procedimiento
conocido descrito anteriormente, porque ésta consiste, además, en
forzar el contador de inercia al valor 6 (operación 143) para
evitar cualquier interacción entre esta prueba 136 y el contador de
inercia.
- -
- No hay cuarta etapa análoga a la etapa 40.
En la figura 5 las curvas E1 y E2 representan,
respectivamente, los porcentajes de errores con el procedimiento
conocido y con el procedimiento de acuerdo con la invención, para
diferentes valores de la relación señal/ruido.
En la figura 6 las curvas L1 y L2 representan,
respectivamente, los porcentajes de pérdidas de palabra con el
procedimiento conocido y con el procedimiento de acuerdo con la
invención, para diferentes valores de la relación señal/ruido.
Éstas muestran que el comportamiento de la
detección de actividad vocal mejora ampliamente en medio ruidoso.
El porcentaje de error global disminuye y, sobre todo, el
porcentaje de palabra perdida se reduce considerablemente. La
integridad de la palabra está preservada y la conversación se
mantiene comprensible.
Claims (6)
1. Procedimiento para detectar la actividad vocal
en una señal, siendo recortada esta señal en tramas, y
comprendiendo este procedimiento una etapa de alisado de una
decisión inicial "voz" o "ruido", tomada para cada trama;
caracterizado porque esta etapa de alisado comprende una
etapa que consiste en tomar una decisión definitiva "voz" para
la enésima trama, si:
- la decisión inicial para la trama n es
"voz";
- y la decisión definitiva para la trama
n-2 era "ruido";
- y la energía de la trama n-1
era superior a la de la trama n-2;
- y la energía de la trama n es superior a la
energía de la trama n-2.
2. Procedimiento de acuerdo con la reivindicación
1, caracterizado porque si se ha tomado una decisión
definitiva "voz" para la trama n, consiste, además, en impedir
cualquier decisión definitiva "ruido" para las tramas n + 1 a
n + i donde i es un número entero que define una duración de
inercia.
3. Procedimiento de acuerdo con la reivindicación
1, caracterizado porque esta etapa de alisado comprende una
etapa que consiste, para la trama n, en:
- Si la decisión inicial es "voz",
inicializar a 0 un contador de inercia (102).
- Si la decisión inicial es "ruido",
determinar si la energía de la trama n es superior a un valor de
umbral, y determinar si el contenido del contador de inercia es
inferior a un umbral fijado, y superior a uno (103). Después:
- Tomar la decisión "voz" si se cumplen
estas tres condiciones, e incrementar después el contador de inercia
en una unidad (104).
- O tomar la decisión "ruido" si no se
cumple una de estas condiciones.
4. Codificador de señal vocal que comprende un
dispositivo de detección de actividad vocal, siendo recortada esta
señal en tramas, y comprendiendo este dispositivo medios de alisado
de una decisión inicial "voz" o "ruido", tomada para cada
trama; caracterizado porque estos medios de alisado
comprenden medios para tomar una decisión definitiva "voz"
para la enésima trama, si:
- la decisión inicial para la trama n es
"voz";
- y la decisión definitiva para la trama
n-2 era "ruido";
- y la energía de la trama n-1
era superior a la de la trama n-2;
- y la energía de la trama n es superior a la
energía de la trama n-2.
5. Codificador de acuerdo con la reivindicación
4, caracterizado porque los medios de alisado comprenden
medios para impedir cualquier decisión definitiva "ruido" para
las tramas n + 1 a n + i donde i es un número entero que define una
duración de inercia, si se ha tomado una decisión definitiva
"voz" para la trama n.
6. Codificador de acuerdo con la reivindicación
4, caracterizado porque los medios de alisado comprenden
medios para:
- Si la decisión inicial es "voz" para la
trama n, inicializar a 0 un contador de inercia (102).
- Si la decisión inicial es "ruido",
determinar si la energía de la trama n es superior a un valor de
umbral, y determinar si el contenido del contador de inercia es
inferior a un umbral fijado, y es superior a uno (103). Después:
- Tomar la decisión "voz" si se cumplen
estas tres condiciones, e incrementar después el contador de inercia
en una unidad (104).
- O tomar la decisión "ruido" si no se
cumple una de estas condiciones.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0107585 | 2001-06-11 | ||
| FR0107585A FR2825826B1 (fr) | 2001-06-11 | 2001-06-11 | Procede pour detecter l'activite vocale dans un signal, et codeur de signal vocal comportant un dispositif pour la mise en oeuvre de ce procede |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2219624T3 true ES2219624T3 (es) | 2004-12-01 |
Family
ID=8864153
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES02290984T Expired - Lifetime ES2219624T3 (es) | 2001-06-11 | 2002-04-18 | Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso. |
Country Status (8)
| Country | Link |
|---|---|
| US (1) | US7596487B2 (es) |
| EP (1) | EP1267325B1 (es) |
| JP (2) | JP3992545B2 (es) |
| CN (1) | CN1162835C (es) |
| AT (1) | ATE269573T1 (es) |
| DE (1) | DE60200632T2 (es) |
| ES (1) | ES2219624T3 (es) |
| FR (1) | FR2825826B1 (es) |
Families Citing this family (21)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7756709B2 (en) * | 2004-02-02 | 2010-07-13 | Applied Voice & Speech Technologies, Inc. | Detection of voice inactivity within a sound stream |
| GB0408856D0 (en) * | 2004-04-21 | 2004-05-26 | Nokia Corp | Signal encoding |
| ATE371926T1 (de) * | 2004-05-17 | 2007-09-15 | Nokia Corp | Audiocodierung mit verschiedenen codierungsmodellen |
| DE102004049347A1 (de) * | 2004-10-08 | 2006-04-20 | Micronas Gmbh | Schaltungsanordnung bzw. Verfahren für Sprache enthaltende Audiosignale |
| KR100657912B1 (ko) * | 2004-11-18 | 2006-12-14 | 삼성전자주식회사 | 잡음 제거 방법 및 장치 |
| US20060241937A1 (en) * | 2005-04-21 | 2006-10-26 | Ma Changxue C | Method and apparatus for automatically discriminating information bearing audio segments and background noise audio segments |
| KR20080059881A (ko) * | 2006-12-26 | 2008-07-01 | 삼성전자주식회사 | 음성 신호의 전처리 장치 및 방법 |
| EP2816560A1 (en) * | 2009-10-19 | 2014-12-24 | Telefonaktiebolaget L M Ericsson (PUBL) | Method and background estimator for voice activity detection |
| CN102137194B (zh) * | 2010-01-21 | 2014-01-01 | 华为终端有限公司 | 一种通话检测方法及装置 |
| ES2489472T3 (es) * | 2010-12-24 | 2014-09-02 | Huawei Technologies Co., Ltd. | Método y aparato para una detección adaptativa de la actividad vocal en una señal de audio de entrada |
| US9659571B2 (en) * | 2011-05-11 | 2017-05-23 | Robert Bosch Gmbh | System and method for emitting and especially controlling an audio signal in an environment using an objective intelligibility measure |
| US20130090926A1 (en) * | 2011-09-16 | 2013-04-11 | Qualcomm Incorporated | Mobile device context information using speech detection |
| CN103325386B (zh) * | 2012-03-23 | 2016-12-21 | 杜比实验室特许公司 | 用于信号传输控制的方法和系统 |
| CN107978325B (zh) * | 2012-03-23 | 2022-01-11 | 杜比实验室特许公司 | 语音通信方法和设备、操作抖动缓冲器的方法和设备 |
| CN105681966B (zh) * | 2014-11-19 | 2018-10-19 | 塞舌尔商元鼎音讯股份有限公司 | 降低噪音的方法及电子装置 |
| US10928502B2 (en) * | 2018-05-30 | 2021-02-23 | Richwave Technology Corp. | Methods and apparatus for detecting presence of an object in an environment |
| CN109360585A (zh) * | 2018-12-19 | 2019-02-19 | 晶晨半导体(上海)股份有限公司 | 一种语音激活检测方法 |
| CN113497852A (zh) * | 2020-04-07 | 2021-10-12 | 北京字节跳动网络技术有限公司 | 自动音量调整方法、装置、介质和设备 |
| CN113555025B (zh) * | 2020-04-26 | 2024-08-09 | 华为技术有限公司 | 一种静音描述帧发送、协商方法及装置 |
| CN115132231B (zh) * | 2022-08-31 | 2022-12-13 | 安徽讯飞寰语科技有限公司 | 语音活性检测方法、装置、设备及可读存储介质 |
| US20250037733A1 (en) * | 2023-07-28 | 2025-01-30 | Cisco Technology, Inc. | Discontinuous noise removal in an audio processing pipeline |
Family Cites Families (15)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH0240700A (ja) * | 1988-08-01 | 1990-02-09 | Matsushita Electric Ind Co Ltd | 音声検出装置 |
| JPH0424692A (ja) * | 1990-05-18 | 1992-01-28 | Ricoh Co Ltd | 音声区間検出方式 |
| US5410632A (en) * | 1991-12-23 | 1995-04-25 | Motorola, Inc. | Variable hangover time in a voice activity detector |
| US5583961A (en) * | 1993-03-25 | 1996-12-10 | British Telecommunications Public Limited Company | Speaker recognition using spectral coefficients normalized with respect to unequal frequency bands |
| US5459814A (en) * | 1993-03-26 | 1995-10-17 | Hughes Aircraft Company | Voice activity detector for speech signals in variable background noise |
| JP2897628B2 (ja) * | 1993-12-24 | 1999-05-31 | 三菱電機株式会社 | 音声検出器 |
| JP3604393B2 (ja) * | 1994-07-18 | 2004-12-22 | 松下電器産業株式会社 | 音声検出装置 |
| JP3109978B2 (ja) * | 1995-04-28 | 2000-11-20 | 松下電器産業株式会社 | 音声区間検出装置 |
| US5819217A (en) * | 1995-12-21 | 1998-10-06 | Nynex Science & Technology, Inc. | Method and system for differentiating between speech and noise |
| JP3297346B2 (ja) * | 1997-04-30 | 2002-07-02 | 沖電気工業株式会社 | 音声検出装置 |
| US6188981B1 (en) * | 1998-09-18 | 2001-02-13 | Conexant Systems, Inc. | Method and apparatus for detecting voice activity in a speech signal |
| US6691084B2 (en) * | 1998-12-21 | 2004-02-10 | Qualcomm Incorporated | Multiple mode variable rate speech coding |
| JP3759685B2 (ja) * | 1999-05-18 | 2006-03-29 | 三菱電機株式会社 | 雑音区間判定装置,雑音抑圧装置及び推定雑音情報更新方法 |
| FR2797343B1 (fr) * | 1999-08-04 | 2001-10-05 | Matra Nortel Communications | Procede et dispositif de detection d'activite vocale |
| WO2002045078A1 (en) * | 2000-11-30 | 2002-06-06 | Matsushita Electric Industrial Co., Ltd. | Audio decoder and audio decoding method |
-
2001
- 2001-06-11 FR FR0107585A patent/FR2825826B1/fr not_active Expired - Fee Related
-
2002
- 2002-04-18 EP EP02290984A patent/EP1267325B1/fr not_active Expired - Lifetime
- 2002-04-18 DE DE60200632T patent/DE60200632T2/de not_active Expired - Lifetime
- 2002-04-18 AT AT02290984T patent/ATE269573T1/de not_active IP Right Cessation
- 2002-04-18 ES ES02290984T patent/ES2219624T3/es not_active Expired - Lifetime
- 2002-05-10 US US10/142,060 patent/US7596487B2/en not_active Expired - Fee Related
- 2002-05-29 CN CNB021217432A patent/CN1162835C/zh not_active Expired - Fee Related
- 2002-06-10 JP JP2002168375A patent/JP3992545B2/ja not_active Expired - Fee Related
-
2006
- 2006-03-28 JP JP2006087186A patent/JP2006189907A/ja active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| JP2006189907A (ja) | 2006-07-20 |
| CN1162835C (zh) | 2004-08-18 |
| ATE269573T1 (de) | 2004-07-15 |
| JP2003005772A (ja) | 2003-01-08 |
| EP1267325A1 (fr) | 2002-12-18 |
| US20020188442A1 (en) | 2002-12-12 |
| JP3992545B2 (ja) | 2007-10-17 |
| US7596487B2 (en) | 2009-09-29 |
| EP1267325B1 (fr) | 2004-06-16 |
| DE60200632D1 (de) | 2004-07-22 |
| CN1391212A (zh) | 2003-01-15 |
| FR2825826B1 (fr) | 2003-09-12 |
| FR2825826A1 (fr) | 2002-12-13 |
| DE60200632T2 (de) | 2004-12-23 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2219624T3 (es) | Proceso de deteccion de actividad de voz en una señal, y codificador de señal de voz que comprende un dispositivo para realizar el proceso. | |
| RU2120668C1 (ru) | Устройство и способ маскирования ошибок | |
| JP4146489B2 (ja) | 音声パケット再生方法、音声パケット再生装置、音声パケット再生プログラム、記録媒体 | |
| US7983906B2 (en) | Adaptive voice mode extension for a voice activity detector | |
| US8041563B2 (en) | Apparatus for coding a wideband audio signal and a method for coding a wideband audio signal | |
| ES2209383T3 (es) | Procedimiento de decodificacion de una señal audio con correccion de los errores de transmision. | |
| US8180632B2 (en) | Method for limiting adaptive excitation gain in an audio decoder | |
| JP2006512617A5 (es) | ||
| JP4221537B2 (ja) | 音声検出方法及び装置とその記録媒体 | |
| CN107666325B (zh) | 基于列表连续删除算法的极化码译码路径选择方法 | |
| ES2274812T3 (es) | Codificador predictivo de voz usando pautas de seleccion de esquemas de codificacion para reducir la sensilibidad de errores de trama. | |
| JP2004361731A (ja) | オーディオ復号装置及びオーディオ復号方法 | |
| WO2001084540A1 (en) | Method and apparatus for reducing rate determination errors and their artifacts | |
| CN103117062B (zh) | 语音解码器中帧差错隐藏的谱参数代替方法及系统 | |
| JP5547282B2 (ja) | パルス符号化のための方法および装置、パルス復号のための方法および装置 | |
| KR20000062171A (ko) | 가변 비율 음성부호화기의 음성 부호화 비율 결정장치 및방법 | |
| KR20230129581A (ko) | 음성 정보를 갖는 개선된 프레임 손실 보정 | |
| KR20000026288A (ko) | 약전계에서 코드 분할 다중 접속 시스템의 코덱 잡음 제거 방법 | |
| CN101226744A (zh) | 语音解码器中实现语音解码的方法及装置 | |
| KR100407479B1 (ko) | 가변 길이의 코드 워드의 데이터 스트림을 만드는 방법 및장치와 가변 길이의 코드 워드의 데이터 스트림을 읽어내는 방법 및 장치 | |
| JP3315708B2 (ja) | 比較減衰器付音声符復号器 | |
| Ramadas et al. | A phonetically switched ADPCM speech coder | |
| CN1366659A (zh) | 具有音调变化检测的纠错方法 | |
| Yang et al. | An inter-frame correlation based error concealment of immittance spectral coefficients for mobile speech and audio codecs | |
| JPH0467200A (ja) | 有音区間判定方法 |