ES2347760T3 - Procedimiento y dispositivo de reduccion de ruido. - Google Patents
Procedimiento y dispositivo de reduccion de ruido. Download PDFInfo
- Publication number
- ES2347760T3 ES2347760T3 ES01273554T ES01273554T ES2347760T3 ES 2347760 T3 ES2347760 T3 ES 2347760T3 ES 01273554 T ES01273554 T ES 01273554T ES 01273554 T ES01273554 T ES 01273554T ES 2347760 T3 ES2347760 T3 ES 2347760T3
- Authority
- ES
- Spain
- Prior art keywords
- hat
- noise
- filter
- signal
- impulse response
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 230000009467 reduction Effects 0.000 title claims abstract description 57
- 238000000034 method Methods 0.000 title claims abstract description 51
- 238000012546 transfer Methods 0.000 claims abstract description 43
- 238000001914 filtration Methods 0.000 claims abstract description 30
- 238000001228 spectrum Methods 0.000 claims abstract description 20
- 230000009466 transformation Effects 0.000 claims abstract description 20
- 230000004044 response Effects 0.000 claims description 60
- 230000002123 temporal effect Effects 0.000 claims description 24
- 239000003638 chemical reducing agent Substances 0.000 claims description 15
- 238000004364 calculation method Methods 0.000 claims description 12
- 230000005236 sound signal Effects 0.000 claims description 5
- 230000001131 transforming effect Effects 0.000 claims 1
- 230000006870 function Effects 0.000 description 58
- 230000003595 spectral effect Effects 0.000 description 53
- 238000012545 processing Methods 0.000 description 32
- 230000001629 suppression Effects 0.000 description 9
- 230000001755 vocal effect Effects 0.000 description 9
- 238000009499 grossing Methods 0.000 description 8
- 230000000694 effects Effects 0.000 description 6
- 230000014509 gene expression Effects 0.000 description 6
- 230000008901 benefit Effects 0.000 description 4
- 238000001514 detection method Methods 0.000 description 4
- 230000004048 modification Effects 0.000 description 4
- 238000012986 modification Methods 0.000 description 4
- 238000010183 spectrum analysis Methods 0.000 description 4
- 101000822695 Clostridium perfringens (strain 13 / Type A) Small, acid-soluble spore protein C1 Proteins 0.000 description 3
- 101000655262 Clostridium perfringens (strain 13 / Type A) Small, acid-soluble spore protein C2 Proteins 0.000 description 3
- 101000655256 Paraclostridium bifermentans Small, acid-soluble spore protein alpha Proteins 0.000 description 3
- 101000655264 Paraclostridium bifermentans Small, acid-soluble spore protein beta Proteins 0.000 description 3
- 230000015572 biosynthetic process Effects 0.000 description 3
- 238000002156 mixing Methods 0.000 description 3
- 238000003786 synthesis reaction Methods 0.000 description 3
- 230000007704 transition Effects 0.000 description 3
- 206010011878 Deafness Diseases 0.000 description 2
- 230000005534 acoustic noise Effects 0.000 description 2
- 238000004891 communication Methods 0.000 description 2
- 239000012141 concentrate Substances 0.000 description 2
- 235000019800 disodium phosphate Nutrition 0.000 description 2
- 230000007774 longterm Effects 0.000 description 2
- 230000008520 organization Effects 0.000 description 2
- 230000008569 process Effects 0.000 description 2
- 230000002441 reversible effect Effects 0.000 description 2
- 238000005070 sampling Methods 0.000 description 2
- 238000007476 Maximum Likelihood Methods 0.000 description 1
- 230000003044 adaptive effect Effects 0.000 description 1
- 239000000654 additive Substances 0.000 description 1
- 230000000996 additive effect Effects 0.000 description 1
- 230000008033 biological extinction Effects 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 230000001364 causal effect Effects 0.000 description 1
- 230000006835 compression Effects 0.000 description 1
- 238000007906 compression Methods 0.000 description 1
- 125000004122 cyclic group Chemical group 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 238000011161 development Methods 0.000 description 1
- 230000008030 elimination Effects 0.000 description 1
- 238000003379 elimination reaction Methods 0.000 description 1
- 238000002474 experimental method Methods 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 238000010348 incorporation Methods 0.000 description 1
- 239000000203 mixture Substances 0.000 description 1
- 230000010355 oscillation Effects 0.000 description 1
- 238000007781 pre-processing Methods 0.000 description 1
- 230000001932 seasonal effect Effects 0.000 description 1
- 238000000844 transformation Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G01—MEASURING; TESTING
- G01L—MEASURING FORCE, STRESS, TORQUE, WORK, MECHANICAL POWER, MECHANICAL EFFICIENCY, OR FLUID PRESSURE
- G01L21/00—Vacuum gauges
- G01L21/02—Vacuum gauges having a compression chamber in which gas, whose pressure is to be measured, is compressed
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Quality & Reliability (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- General Physics & Mathematics (AREA)
- Noise Elimination (AREA)
- Soundproofing, Sound Blocking, And Sound Damping (AREA)
- Superconductors And Manufacturing Methods Therefor (AREA)
- Pharmaceuticals Containing Other Organic And Inorganic Compounds (AREA)
- Filters That Use Time-Delay Elements (AREA)
- Stereo-Broadcasting Methods (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
Procedimiento de reducción de ruido en sucesivas tramas de una señal de entrada x(n), que incluye las siguientes etapas para por lo menos algunas de las tramas: - calcular un espectro X(k,f) de la señal de entrada mediante transformación en el ámbito frecuencial; - obtener un estimador de nivel de ruido &gamma (k,f) del espectro X(k,f) en función de la frecuencia; - calcular un primer estimador de nivel de señal útil &gamma (k,f) en la trama en función de la frecuencia; - calcular la función de transferencia {H (k,f) de un primer filtro reductor de ruido sobre la base del primer estimador de nivel de señal útil gamma (k,f) y del estimador de nivel de ruido gamma (k,f); - calcular un segundo estimador de nivel de señal útil &gamma (k,f) en la trama en función de la frecuencia, combinando el espectro X(k,f) de la señal de entrada y la función de transferencia H (k,f) del primer filtro reductor de ruido; - calcular la función de transferencia H (k,f) de un segundo filtro reductor de ruido sobre la base del segundo estimador de nivel de señal útil &gamma (k,f) y del estimador de nivel de ruido &gamma (k,f); y - utilizar la función de transferencia H (k,f) del segundo filtro reductor de ruido en una operación de filtrado de la trama para producir una señal con ruido reducido.
Description
Procedimiento y dispositivo de reducción de
ruido.
La presente invención se refiere a las técnicas
de procesamiento de señal que sirve para reducir el nivel de ruido
presente en una señal de entrada.
Un importante ámbito de aplicación es el del
procesamiento de la señal de audio (voz o música), incluyendo de
manera no limitativa:
\bullet teleconferencia y videoconferencia en
medio ruidoso (en sala dedicada o bien a partir de ordenadores
multimedia, etc.);
\bullet telefonía: procesamiento a nivel de
los terminales, fijos o móviles y/o en las redes de transporte;
\bullet terminales manos libres, especialmente
de oficina, de vehículo o móviles;
\bullet toma de sonido en lugares públicos
(estación, aeropuerto, etc.);
\bullet toma de sonido manos libres en
vehículos;
\bullet reconocimiento de voz robusta en el
entorno acústico;
\bullet toma de sonido para cine y en los
medios de comunicación (radio y televisión, por ejemplo para
periodismo deportivo o conciertos, etc.).
\vskip1.000000\baselineskip
La invención se puede aplicar asimismo a
cualquier ámbito en el que se desee extraer una información útil a
partir de una observación con ruido. Se pueden mencionar
especialmente los siguientes ámbitos: imagen submarina,
teledetección submarina, procesamiento de señales biomédicas (EEG,
ECG, imagen biomédica, etc.).
Un problema característico de la toma de sonido
se refiere al entorno acústico en el que se coloca el micrófono de
toma de sonido y, más concretamente, el hecho de que, debido a la
imposibilidad de controlar totalmente dicho entorno, una señal
perturbadora (calificada de ruido) está asimismo presente dentro de
la señal de observación.
Con objeto de mejorar la calidad de la señal, se
desarrollan sistemas de reducción de ruido con objeto de extraer la
información útil efectuando un procesamiento de la señal de
observación con ruido. Cuando la señal de audio es una señal de voz
transmitida a distancia, estos sistemas permiten incrementar su
inteligibilidad y reducir la fatiga del interlocutor. Además de
dichas aplicaciones de comunicación hablada, la mejora de la
calidad de la señal de voz se revela asimismo útil para el
reconocimiento de voz, cuyas prestaciones quedan fuertemente
alteradas cuando el utilizador se encuentra en un entorno
ruidoso.
La elección de una técnica de procesamiento de
la señal para realizar la operación de reducción de ruido depende,
en primer lugar, del número de observaciones disponibles en la
entrada del procesamiento. En la presente descripción, se
considerará el caso en que está disponible una única señal de
observación. Los métodos de reducción de ruido adaptados a esta
problemática monosensor se basan principalmente en técnicas de
procesamiento de la señal tales como el filtrado adaptativo
mediante adelanto/retraso, el filtrado paramétrico de Kalman o
también el filtrado mediante modificación espectral a corto
plazo.
Esta última familia (filtrado mediante
modificación espectral a corto plazo) agrupa prácticamente el
conjunto de soluciones utilizadas en los equipos industriales
debido a la sencillez de los conceptos en juego y a la gran
disponibilidad de herramientas básicas (por ejemplo, la transformada
de Fourier discreta) necesarias para su programación. Sin embargo,
el desarrollo de dichas técnicas de reducción de ruido se basa en
gran medida en la posibilidad de efectuar con facilidad dichos
procesamientos en tiempo real en un dispositivo de procesamiento de
la señal, sin introducir distorsiones relevantes en la señal
disponible a la salida del procesamiento. En los métodos de dicha
familia, el procesamiento consiste la mayoría de las veces en
evaluar una función de transferencia de un filtro reductor de
ruido, y en realizar el filtrado a partir de una multiplicación en
el ámbito espectral, lo que permite operar la reducción de ruido
mediante atenuación espectral a corto plazo, mediante un
procesamiento por bloques.
Se escribe x(n) la señal de observación
con ruido procedente de la mezcla de la señal deseada s(n) y
el ruido de perturbación b(n), designando n el índice
temporal en tiempo discreto. La elección de una representación en
tiempo discreto está unida a una aplicación orientada al
procesamiento digital de la señal, pero se observará que los
métodos descritos más adelante se aplican asimismo a las señales en
tiempo continuo. Se analiza la señal por segmentos sucesivos o
tramas de índice k de longitud constante. Algunas formas de
anotación habitualmente utilizadas para representaciones en los
ámbitos discretos tiempo y frecuencia son:
\bullet X(k,f): transformada de Fourier
(f es el índice de frecuencia de la k-ésima trama (k es el índice
de trama) de la señal analizada x(n);
\bullet S(k,f): transformada de Fourier
de la k-ésima trama de la señal deseada s(n);
\bullet\hat{\nu}: estimación de una
magnitud (temporal o frecuencial) v; por ejemplo,
\hat{S}(k,f) es la estimación de la transformada de
Fourier de la señal deseada;
\bullet\gamma_{uu}(f): densidad
espectral de potencia (DSP) de una señal u(n).
\vskip1.000000\baselineskip
En la mayoría de las técnicas de reducción de
ruido, la señal con ruido x(n) soporta un filtrado en el
ámbito frecuencial para producir una señal útil estimada
\hat{s}(n) lo más próxima posible a la señal original
s(n) desprovista de cualquier perturbación. Como se ha
indicado anteriormente, esta operación de filtrado consiste en
reducir cada componente frecuencial f de la señal con ruido habida
cuenta de la relación señal/ruido (RSB) estimada en dicha
componente. Dicha RSB función de la frecuencia f se escribe en este
caso \eta(k,f) para la trama k.
Para cada una de las tramas, se multiplica
primero la señal por una ventana de ponderación que permite mejorar
la estimación posterior de las magnitudes espectrales necesarias
para el cálculo del filtro reductor de ruido. Cada trama así
ventaneada se analiza a continuación en el ámbito espectral
(generalmente con la ayuda de la transformada de Fourier discreta
en su versión rápida). Esta operación se denomina transformación de
Fourier a corto plazo (TFCT). Esta representación frecuencial
X(k,f) de la señal observada permite al mismo tiempo estimar
la función de transferencia H(k,f) del filtro reductor de
ruido, y aplicar dicho filtro en el ámbito espectral mediante
simple multiplicación entre dicha función de transferencia y el
espectro a corto plazo de la señal con ruido, es decir:
El regreso en el ámbito temporal de la señal así
obtenida se efectúa a continuación mediante simple transformada
espectral inversa. La síntesis de la señal a la que se ha quitado el
ruido se efectúa generalmente mediante una técnica de solapamiento
e incorporación de bloques (OLA, "overlap add") o una técnica
de salvaguarda de bloques (OLS, "overlap save"). Esta
operación de reconstrucción de la señal en el ámbito temporal se
denomina transformación de Fourier a corto plazo inverso
(TFCTI).
Se encontrará una descripción detallada de los
métodos de atenuación espectral a corto plazo en las referencias:
J.S. Lim, A.V. Oppenheim, "Enhancement and bandwidth compression
of noisy speech", Proceedeings of the IEEE, vol. 67, pp.
1586-1604, 1979; y R.E. Crochiere, L.R. Rabiner,
"Multirate digital signal processing", Prentice Hall,
1983.
Las principales tareas realizadas por dicho
sistema de reducción de ruido son:
\bullet la detección de actividad vocal
(DAV);
\bullet la estimación de la densidad espectral
de potencia (DSP) de ruido durante los instantes de actividad
vocal;
\bullet la aplicación de una atenuación
espectral a corto plazo evaluada a partir de una regla de supresión
de las componentes espectrales de ruido;
\bullet la síntesis de la señal procesada a
partir de una técnica del tipo OLS u OLA.
\vskip1.000000\baselineskip
La elección de la regla de supresión de las
componentes de ruido es importante, ya que determina la calidad de
la señal transmitida. Generalmente, dichas reglas de supresión sólo
modifican la amplitud |X(k,f)| de las componentes
espectrales de la señal con ruido, no su fase. Generalmente, se
realizan las siguientes hipótesis:
\bullet estadísticamente, no existe
correlación entre el ruido y la señal útil;
\bullet la señal útil es intermitente
(presencia de períodos de silencio en los que se puede estimar el
ruido);
\bullet el oído humano no es sensible a la
fase de la señal (véase D.L. Wang, J.S. Lim, "The unimportance of
phase in speech enhancement", IEEE Trans. On ASSP, vol. 30, nº 4,
pp. 679-681, 1982).
\vskip1.000000\baselineskip
La atenuación espectral a corto plazo
H(k,f), aplicada a la señal de observación X(k,f) en
la trama de índice k a la componente frecuencial f, se determina
generalmente a partir de la estimación de la relación señal/ruido
local \eta(k,f). Una característica común al conjunto de
reglas de supresión es su comportamiento asintótico, dado por:
Las reglas de supresión habitualmente empleadas
son:
\bullet la sustracción espectral en potencia
(véase el artículo ya citado de J.S. Lim y A.V. Oppenheim), para la
que la función de transferencia H(k,f) del filtro reductor de
ruido se escribe:
\bullet la sustracción espectral en amplitud
(véase S.F. Boll, "Suppression of acoustic noise in speech using
spectral substraction", IEEE Trans. On Audio, Speech and Signal
Processing, vol. 27, nº 2, pp. 113-120, Abril
1979), para la que la función de transferencia se escribe:
\bullet el empleo directo del filtro de Wiener
(véase el artículo ya citado de J.S. Lim y A.V. Oppenheim), para el
que la función de transferencia H(k,f) se escribe:
En dichas expresiones,
\gamma_{ss}(k,f) y \gamma_{bb}(k,f)
representan respectivamente las densidades espectrales de potencia
de la señal útil y del ruido presente dentro de la componente
frecuencial f de la señal de observación X(k,f) en la trama
de índice k.
A partir de las expresiones (3)-(5), es posible
estudiar, en función de la relación señal/ruido local medida en una
componente frecuencial dada f, el comportamiento de la atenuación
espectral aplicada a la señal con ruido. Se comprueba que todas las
reglas dan lugar a una atenuación idéntica cuando la relación
señal/ruido local es importante. La regla de sustracción en
potencia es óptima en el sentido del máximo de verosimilitud para
modelos gaussianos (véase O. Cappé, "Elimination of the musical
noise phenomenon with the Ephraim and Malah noise suppressor",
IEEE Trans. On Speech and Audio Processing, vol. 2, nº 2, pp.
345-349, Abril 1994). Pero es aquella para la que
la potencia del ruido sigue siendo más importante a la salida del
procesamiento. Para el conjunto de las reglas de supresión, se
observa que basta una escasa variación de la relación señal/ruido
local alrededor del valor de corte para pasar del caso de la
atenuación total (H(k,f) = 0) al caso de una modificación
espectral despreciable (H(k,f) = 1).
Esta última propiedad constituye una de las
causas del fenómeno calificado de "ruido musical". En efecto,
el ruido ambiente, caracterizado al mismo tiempo por componentes
deterministas y aleatorias, sólo se puede caracterizar durante los
períodos de no actividad vocal. Debido a la presencia de dichas
componentes aleatorias, existen muy fuertes variaciones entre la
contribución real de una componente frecuencial f del ruido durante
los períodos de actividad vocal y su estimación de media realizada
en varias tramas durante los instantes de no actividad vocal.
Debido a esta diferencia, la estimación de la relación señal/ruido
local puede fluctuar alrededor del nivel de corte y, por lo tanto,
generar a la salida del procesamiento componentes espectrales que
aparecen y desaparecen, y cuya duración de vida media no supera
estadísticamente el orden de magnitud de la ventana de análisis
considerada. La generalización de este comportamiento en el conjunto
del ancho de banda introduce un ruido residual audible y molesto,
calificado de "ruido musical".
Varios estudios están orientados a reducir la
influencia de dicho ruido. Las soluciones preconizadas se desglosan
según varios ejes:
\bullet media de las estimaciones a corto
plazo (véase el artículo ya citado de S.F. Boll);
\bullet sobreestimación del espectro de
potencia del ruido (véase M. Berouti et al, "Enhancement of
speech corrupted by acoustic noise", Int. Conf. On Speech,
Signal Processing, pp. 208-211, 1979; y P. Lockwood,
J. Boudy, "Experiments with a non-linear spectral
substractor, hidden Markov models and the projection for robust
speech recognition in cars", Proc. of EUSIPCO'91, pp.
79-82, 1991);
\bullet seguimiento de los mínimos de la
densidad espectral de ruido (véase R. Martin, "Spectral
substraction based on minimum statistics", in Signal Processing
VII: Therories and Applications, EUSIPCO'94, pp.
1182-1185, Sept. 1994).
\vskip1.000000\baselineskip
Varios estudios han tratado asimismo del
establecimiento de nuevas reglas de supresión basadas en modelos
estadísticos de las señales de voz y de ruido aditivo. Estos
estudios han permitido introducir nuevos algoritmos de
"decisiones flexibles", ya que poseen un grado de libertad
adicional con relación a los métodos clásicos (véase R.J. Mac
Aulay, M.L. Malpass, "Speech enhancement using a
soft-decision noise suppression filter", IEEE
trans. On Audio, Speech and Signal Processing, vol. 28, nº 2, pp.
137-145, Abril 1980; Y. Ephraim, D. Malah,
"Speech enhancement using optimal non-linear
spectral amplitude estimation", Int. Conf. on Speech, Signal
Processing, pp. 1118-1121, 1983; Y. Ephraim, D.
Malah, "Speech enhancement using a minimum mean square error
short-time spectral amplitude estimator", IEEE
Trans. on ASSP, vol. 32, nº 6, pp. 1109-1121,
1984).
Las reglas de modificación espectral a corto
plazo anteriormente mencionadas presentan las siguientes
características:
\bullet El cálculo de la atenuación espectral
a corto plazo se basa en la estimación de la relación señal/ruido en
cada una de las componentes espectrales, haciendo intervenir cada
una de las ecuaciones (3)-(5) la cantidad:
De este modo, las prestaciones de la técnica de
reducción de ruido (distorsiones, reducción efectiva del nivel de
ruido) se rigen por la pertinencia de este estimador de la relación
señal/ruido.
\bullet Estas técnicas se basan en un
procesamiento por bloques (con posibilidad de solapamiento entre los
bloques sucesivos) que consiste en filtrar el conjunto de muestras
de una trama dada, presente en la entrada del dispositivo de
reducción de ruido, mediante una única atenuación espectral. Esta
propiedad reside en el hecho de que la aplicación del filtro se
efectúa mediante una multiplicación en el ámbito espectral. Esto es
especialmente apremiante cuando la señal presente en la trama actual
no verifica las hipótesis de estacionalidad en el segundo orden,
por ejemplo en el caso del inicio o el final de una palabra, o en el
caso de una trama mixta sonora/sorda.
\bullet La multiplicación efectuada en el
ámbito espectral corresponde en realidad a una operación de
convolución cíclica. En la práctica, para evitar las distorsiones,
la operación que se intenta efectuar es una convolución lineal, lo
que requiere al mismo tiempo añadir cierto número de muestras nulas
a cada trama de entrada (técnica denominada del "zero
padding") y efectuar un procesamiento adicional orientado a
limitar el soporte temporal de la respuesta impulsional del filtro
reductor de ruido. Satisfacer el requisito de convolución temporal
incrementa por lo tanto necesariamente el orden de la transformada
espectral y, como consecuencia, la complejidad aritmética del
procesamiento de reducción de ruido. La técnica más utilizada para
limitar el soporte temporal de la respuesta impulsional del filtro
reductor de ruido consiste en introducir una restricción en el
ámbito temporal, lo que requiere (i) una primera transformación
espectral "inversa" que permite obtener la respuesta
impulsional h(k,n) a partir del conocimiento de la función de
transferencia del filtro H(k,f), (ii) una limitación del
número de puntos de dicha respuesta impulsional, que conduce a un
filtro temporal truncado h'(k,n), y (iii) una segunda
transformación espectral "directa" que permite obtener la
función de transferencia modificada H'(k,f) a partir de la
respuesta impulsional truncada h'(k,n).
\bullet En la práctica, cada trama de análisis
se multiplica por una ventana de análisis w(n) antes de
efectuar la operación de transformada espectral. Cuando el filtro
reductor de ruido es del tipo de todo paso (es decir H(k,f)
\approx 1, \forallf), la ventana de análisis debe cumplir la
siguiente condición
si se desea que se verifique la
condición de reconstitución perfecta. En esta ecuación, el parámetro
D representa la diferencia (en número de muestras) entre dos tramas
de análisis sucesivas. Por otra parte, la elección de la ventana de
ponderación w(n) (típicamente del tipo Hanning, Hamming,
Blackman, etc.) condiciona el ancho del lóbulo principal de
W(f) así como la amplitud de los lóbulos secundarios (con
relación a la del lóbulo principal). Si el lóbulo principal es
ancho, la aproximación de las transiciones rápidas de la
transformada de la señal original es muy mala. Si la amplitud
relativa de los lóbulos secundarios es grande, la aproximación
obtenida posee oscilaciones molestas, especialmente alrededor de las
discontinuidades. Por lo tanto, es difícil cumplir al mismo tiempo
el requisito de análisis espectral pertinente (elección del ancho
del lóbulo principal y de la amplitud de los lóbulos laterales) y
el requisito de escasa demora introducida por el proceso de filtrado
de reducción de ruido (desfase temporal entre la señal a la entrada
y a la salida del procesamiento). Respetar el segundo requisito
conduce a utilizar tramas sucesivas sin solapamiento alguno y, por
lo tanto, una ventana de análisis del tipo rectangular, lo que no
conduce a efectuar un análisis espectral pertinente. El único medio
de respetar estos dos requisitos al mismo tiempo consiste en
efectuar un análisis espectral a partir de una primera
transformación espectral realizada en una trama ponderada mediante
una ventana de análisis adecuada (para efectuar una correcta
estimación espectral), y en realizar paralelamente una segunda
transformada espectral sobre los datos no ventaneados (para
efectuar la operación de convolución mediante multiplicación
espectral). Dicha técnica se revela en la práctica demasiado costosa
en términos de complejidad
aritmética.
Los documentos
EP-A-0710947 y EP 0918317 describen
un dispositivo de reducción de ruido acoplado a un anulador de eco.
La reducción de ruido se opera mediante un filtrado por bloques en
el ámbito temporal, por medio de una respuesta impulsional obtenida
mediante transformación de Fourier inversa de la función de
transferencia H(k,f) estimada en función de la relación
señal/ruido en el transcurso del análisis espectral.
Un objetivo principal de la presente invención
es mejorar las prestaciones de los métodos de reducción de
ruido.
La invención propone de este modo un
procedimiento según la reivindicación 1 de reducción de ruido en
sucesivas tramas de una señal de entrada, que incluye las
siguientes etapas para por lo menos algunas de las tramas:
- calcular un espectro de la señal de entrada
mediante transformación en el ámbito frecuencial;
- obtener un estimador de nivel de ruido en
función de la frecuencia;
- calcular un primer estimador de nivel de señal
útil en la trama en función de la frecuencia;
- calcular la función de transferencia de un
primer filtro reductor de ruido sobre la base del primer estimador
de nivel de señal útil y del estimador de nivel de ruido;
- calcular un segundo estimador de nivel de
señal útil en la trama en función de la frecuencia, combinando el
espectro de la señal de entrada y la función de transferencia del
primer filtro reductor de ruido;
- calcular la función de transferencia de un
segundo filtro reductor de ruido sobre la base del segundo estimador
de nivel de señal útil y del estimador de nivel de ruido; y
- utilizar la función de transferencia del
segundo filtro reductor de ruido en una operación de filtrado de la
trama para producir una señal con ruido reducido.
\vskip1.000000\baselineskip
Los niveles de ruido y de señal útil que se
estiman son típicamente DSP, o más generalmente magnitudes en
correlación con dichas DSP.
El cálculo en dos pasos, cuya particularidad
reside en una actualización más rápida de la DSP de la señal útil
\gamma_{ss}(k,f), proporciona al segundo filtro reductor
de ruido dos ventajas apreciables con relación a los métodos
anteriores. Por una parte, se consigue un seguimiento más rápido de
las no estacionalidades de la señal útil, especialmente durante las
variaciones rápidas de su envuelta temporal (por ejemplo de los
ataques o de las extinciones para señal de voz durante una
transición silencio/voz). Por otra parte, se estima mejor el filtro
reductor de ruido, lo que se traduce en un incremento de las
prestaciones del método (mayor reducción de ruido y menor
degradación de la señal útil).
El procedimiento se puede generalizar a los
casos en que se efectúan más de dos pasos. A partir de la p-ésima
función de transferencia obtenida (p \geq 2), se vuelve a calcular
entonces el estimador de nivel de señal útil, y se vuelve a evaluar
una (p+1)-ésima función de transferencia para la reducción de ruido.
La definición anterior del procedimiento vale asimismo para
aquellos casos en que se realizan P > 2 pasos: basta considerar
que el "primer estimador de nivel de señal útil" según dicha
definición es el obtenido en el transcurso del
(P-1)-ésimo paso. En la práctica, se observan buenas
prestaciones del procedimiento con P = 2.
En una realización ventajosa del procedimiento,
el cálculo del espectro incluye una ponderación de la trama de
señal de entrada mediante una función de ventaneo y una
transformación de la trama ponderada hacia el ámbito frecuencial,
siendo asimétrica la función de ventaneo de manera a aplicar una
ponderación más fuerte a la mitad más reciente de la trama que a la
mitad menos reciente de la trama.
La elección de dicha función de ventaneo permite
concentrar el peso de la estimación espectral hacia las muestras
más recientes, permitiendo al mismo tiempo una ventana con buenas
propiedades espectrales (subida controlada de los lóbulos
secundarios). Esto permite seguir con rapidez las variaciones de la
señal. Cabe subrayar que este modo de cálculo del espectro para el
análisis en frecuencia se puede asimismo aplicar cuando la
estimación de la función de transferencia del filtro reductor de
ruido se realiza en un único paso.
El procedimiento se puede utilizar cuando el
filtrado de la señal de entrada se efectúa por bloques en el ámbito
frecuencial, mediante los métodos ya citados de atenuación espectral
a corto plazo. La señal a la que se ha retirado el ruido se produce
entonces en la forma de sus componentes espectrales
\hat{S}(k,f), que pueden ser explotadas directamente (por
ejemplo en una aplicación de codificación o de reconocimiento de
voz) o transformadas hacia el ámbito temporal para obtener
explícitamente la señal \hat{s}(n).
Sin embargo, en un modo de realización preferido
del procedimiento, se determina una respuesta impulsional de filtro
reductor de ruido para la trama actual a partir de una
transformación hacia el ámbito temporal de la función de
transferencia del segundo filtro reductor de ruido, y se realiza la
operación de filtrado de la trama en el ámbito temporal por medio
de la respuesta impulsional determinada para dicha trama.
Ventajosamente, la determinación de la respuesta
impulsional de filtro reductor de ruido para la trama actual
incluye entonces las siguientes etapas:
- transformar hacia el ámbito temporal la
función de transferencia del segundo filtro reductor de ruido para
obtener una primera respuesta impulsional; y
- truncar la primera respuesta impulsional a una
longitud de truncado correspondiente a un número de muestras
sensiblemente menor (típicamente por lo menos cinco veces menor) que
el número de puntos de la transformación hacia el ámbito
temporal.
\vskip1.000000\baselineskip
Esta limitación del soporte temporal del filtro
reductor de ruido presenta una doble ventaja. Por una parte,
permite evitar los problemas de repliegue temporal (respeto de la
convolución lineal). Por otra parte, asegura un alisado que permite
evitar los efectos de un filtro demasiado agresivo, que podrían
degradar la señal útil. Puede acompañarse de una ponderación de la
respuesta impulsional truncada mediante una función de ventaneo en
un número de muestras correspondiente a la longitud de truncado.
Cabe subrayar que esta limitación del soporte temporal del filtro
es asimismo aplicable cuando la estimación de la función de
transferencia se realiza en un único paso.
Cuando se realiza el filtrado en el ámbito
temporal, es ventajoso subdividir la trama actual en varias
subtramas y calcular para cada subtrama una respuesta impulsional
interpolada a partir de la respuesta impulsional de filtro reductor
de ruido determinada para la trama actual y de la respuesta
impulsional de filtro reductor de ruido determinada para por lo
menos una trama anterior. La operación de filtrado de la trama
incluye entonces un filtrado de la señal de cada subtrama en el
ámbito temporal, de conformidad con la respuesta impulsional
interpolada calculada para dicha subtrama.
Este procesamiento en subtramas permite aplicar
un filtro reductor de ruido que varía dentro de una misma trama y,
por lo tanto, bien adaptado a las no estacionalidades de la señal
procesada. En el caso del procesamiento de una señal de voz, esto
se observa especialmente en las tramas mixtas, es decir que
presentan sonidos sonoros y sordos. Cabe subrayar que este
procesamiento en subtramas se puede asimismo aplicar cuando la
estimación de la función de transferencia del filtro se realiza en
un único paso.
Otro aspecto de la presente invención se refiere
a un dispositivo, según la reivindicación 10, de reducción de ruido
adecuado para la aplicación del procedimiento anterior.
Otras particularidades y ventajas de la presente
invención aparecerán en la siguiente descripción de ejemplos de
realización no limitativos, en referencia a los dibujos adjuntos, en
los cuales:
- la figura 1 muestra un esquema sinóptico de un
dispositivo de reducción de ruido apto para la aplicación del
procedimiento de la invención;
- la figura 2 muestra un esquema sinóptico de
una unidad de estimación de la función de transferencia de un
filtro reductor de ruido utilizable en un dispositivo según la
figura 1;
- la figura 3 muestra un esquema sinóptico de
una unidad de filtrado temporal utilizable en un dispositivo según
la figura 1; y
- la figura 4 muestra un gráfico de una función
de ventaneo utilizable en una realización particular del
procedimiento.
\vskip1.000000\baselineskip
Las figuras 1 a 3 muestran una representación de
un dispositivo según la invención en forma de unidades distintas.
En una implementación típica del procedimiento, las operaciones de
procesamiento de señal se efectúan, como es usual, mediante un
procesador de señal digital que ejecuta programas cuyos distintos
módulos funcionales corresponden a dichas unidades.
En referencia a la figura 1, un dispositivo de
reducción de ruido según la invención incluye una unidad 1 que
distribuye la señal de entrada x(n), como una señal de audio
digital, en sucesivas tramas de longitud L muestras (indexadas por
un entero k). Cada trama de índice k es ponderada (multiplicador 2)
multiplicándola por una función de ventaneo w(n), lo que
produce la señal x_{w}(k,n) = w(n).x(k,n)
para 0 \leq n < L.
El paso en el ámbito frecuencial se realiza
aplicando la transformada de Fourier discreta (TFD) a las tramas
ponderadas x_{w}(k,n) por medio de una unidad 3 que
proporciona la transformada de Fourier X(k,f) de la trama
actual.
Para los pasos en los ámbitos
tiempo-frecuencia y viceversa empleados en la
invención, la TFD de la transformada inversa hacia el ámbito
temporal (TFDI) utilizada aguas abajo en su caso (unidad 7), es
ventajosamente una transformada de Fourier rápida (o FFT, "Fast
Fourier Transform") y una transformada de Fourier inversa rápida
(o IFFT, "Inverse Fast Fourier Transform") respectivamente.
También se pueden utilizar otras transformaciones
tiempo-frecuencia, como la transformada de
ondillas.
Una unidad 4 de detección de actividad vocal
(DAV) permite discriminar las tramas sólo de ruido y las tramas de
voz, y proporciona una indicación binaria de actividad de voz
\delta para la trama actual. Se puede utilizar cualquier método
conocido de DAV, tanto si opera en el ámbito temporal sobre la base
de la señal x(k,n) o, como se indica en trazo discontinuo,
en el ámbito frecuencial sobre la base de la señal
X(k,f).
La DAV controla la estimación de la DSP del
ruido por la unidad 5. De este modo, para cada trama k_{b} de
"sólo ruido" detectada por la unidad 4 (\delta = 0), se
estima la densidad espectral de potencia de ruido
\hat{\gamma}_{bb}(k_{b},f) mediante la siguiente
expresión recursiva:
donde k_{b} es bien la trama de
ruido actual si \delta = 0, bien la última trama de ruido si
\delta = 1 (k es detectada como trama de señal útil), y
\alpha(k_{b}) es un parámetro de alisado que puede variar
con el transcurso del
tiempo.
Obsérvese que el modo de cálculo de
\hat{\gamma}_{bb}(k_{b},f) no se limita a este
estimador con alisado exponencial, pudiendo utilizarse por parte de
la unidad 5 cualquier otro estimador de DSP.
A partir del espectro X(k,f) de la trama
actual y de la estimación de nivel de ruido
\hat{\gamma}_{bb}(k_{b},f), otra unidad 6 estima la
función de transferencia (FT) del filtro reductor de ruido
\hat{H}(k,f). La unidad 7 aplica la TFDI a dicha FT para
obtener la respuesta impulsional correspondiente
\hat{h}(k,n).
Una función de ventaneo w_{filt}(n) se
aplica a dicha respuesta impulsional \hat{h}(k,n) mediante
un multiplicador 8 con objeto de obtener la respuesta impulsional
\hat{h}_{w}(k,n) del filtro temporal del dispositivo de
reducción de ruido. La operación efectuada por la unidad de filtrado
9 para producir la señal temporal a la que se ha quitado el ruido
\hat{s}(n) es, en su principio, una convolución de la señal
de entrada por la respuesta impulsional \hat{h}_{w}(k,n)
determinada para la trama actual.
La función de ventaneo w_{filt}(n)
tiene un soporte netamente más corto que la longitud de una trama.
Dicho de otro modo, la respuesta impulsional \hat{h}(k,n)
resultante de la TFDI se trunca antes de aplicarle la ponderación
mediante la función w_{filt}(n). Preferiblemente, la
longitud de truncado L_{filt}, expresada en número de muestras,
es por lo menos cinco veces menor que la longitud de la trama. Es
típicamente del orden de magnitud de la décima parte de dicha
longitud de trama.
Los L_{filt} coeficientes más significativos
de la respuesta impulsional son objeto de la ponderación mediante
la ventana w_{filt}(n), que es por ejemplo una ventana de
Hamming o de Hanning de longitud L_{filt}: para
La limitación del soporte temporal del filtro
reductor de ruido permite evitar los problemas de repliegue
temporal, con objeto de respetar la convolución lineal. Además,
asegura un alisado que permite evitar los efectos de un filtro
demasiado agresivo que podrían degradar la señal útil.
La figura 2 ilustra una organización preferida
de la unidad 6 de estimación de la función de transferencia
\hat{H}(k,f) del filtro reductor de ruido, que depende de
la DSP del ruido b(n) y de la de la señal útil
s(n).
Se ha descrito cómo la unidad 5 puede estimar la
DSP del ruido \hat{\gamma}_{bb}(k,f). Pero la DSP
\hat{\gamma}_{ss}(k,f) de la señal útil no puede
obtenerse directamente debido a la mezcla de la señal y del ruido
durante los períodos de actividad vocal. Para preestimarla, el
módulo 11 de la unidad 6 de la figura 2 utiliza por ejemplo un
estimador de decisión dirigida (véase Y. Ephraim, D. Malah,
"Speech enhancement using a minimum mean square error
short-time spectral amplitude estimator", IEEE
Trans. on ASSP, vol. 32, nº 6, pp. 1109-1121, 1984),
de conformidad con la siguiente expresión:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
donde \beta(k) es un
parámetro baricéntrico que puede variar en el transcurso del tiempo
y \hat{S}(k-1,f) es el espectro de la
señal útil estimada con relación a la trama anterior de índice
k-1 (por ejemplo
\hat{S}(k-1,f) =
\hat{H}(k-1,f).X(k-1,f),
obtenido mediante el multiplicador 12 de la figura 2). La función P
asegura el umbralado de la magnitud
|X(k,f)|^{2} - \hat{\gamma}_{bb}(k,f)
que corre el riesgo de ser negativa en caso de error de estimación.
Se da
mediante:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
Cabe subrayar que el cálculo de
\hat{\gamma}_{ss1}(k,f) no se limita a este estimador de
decisión dirigida. En efecto, se puede utilizar un estimador con
alisado exponencial o cualquier otro estimador de densidad espectral
de potencia.
Mediante el módulo 13, se calcula una
preestimación de la FT del filtro reductor de ruido para la trama
actual, como una función de las DSP estimadas
\hat{\gamma}_{ss1}(k,f) y
\hat{\gamma}_{bb}(k,f):
\vskip1.000000\baselineskip
Este módulo 13 puede emplear especialmente la
regla de sustracción espectral en potencia 13 según
(3)), en amplitud 14 según (4)), o también la del
filtro de Wiener en bucle abierto 15 según (5)).
Habitualmente, la función de transferencia final
del filtro reductor de ruido se obtiene mediante la ecuación (14).
Para mejorar las prestaciones del filtro, se propone estimarlo
mediante un procedimiento iterativo en dos pasos. El primer paso
consiste en las operaciones efectuadas por los módulos 11 a 13.
La función de transferencia
\hat{H}_{1}(k,f) así obtenida se reutiliza para afinar la
estimación de la DSP de la señal útil. La unidad 6 (multiplicador
14 y módulo 15) calcula para ello la magnitud
\hat{\gamma}_{ss}(k,f) dada por:
\vskip1.000000\baselineskip
El segundo paso consiste entonces, para el
módulo 16, en calcular el estimador final \hat{H}(k,f) de
la función de transferencia del filtro reductor de ruido a partir
de la estimación afinada de la DSP de la señal útil:
pudiendo ser la función F la misma
que la empleada por el módulo
13.
Este cálculo en dos pasos permite una
actualización más rápida de la DSP de la señal útil
\hat{\gamma}_{ss}(k,f) y una mejor estimación del
filtro.
La figura 3 ilustra una organización preferida
de la unidad de filtrado temporal 9, basada en una subdivisión de
la trama actual en N subtramas, permitiendo así aplicar una función
de reducción de ruido capaz de evolucionar dentro de una misma
trama de señal.
Un módulo 21 efectúa una interpolación de la
respuesta impulsional truncada y ponderada
\hat{h}_{w}(k,n) con objeto de obtener un juego de N
\geq 2 respuestas impulsionales de filtros de subtramas
\hat{h}_{w}^{(i)}(k,n) para i entre 1 y N.
El filtrado en subtrama se puede implementar por
medio de un filtro transversal 23 de longitud L_{filt} cuyos
coeficientes \hat{h}_{w}^{(i)}(k,n) (0 \leq n <
L_{filt}, 1 \leq i \leq N) son presentados en cascada por el
selector 22 sobre la base del índice i de la subtrama actual. Las
subtramas de la señal a filtrar se obtienen mediante una
subdivisión de la trama de entrada x(k,n). El filtro
transversal 23 calcula así la señal con ruido reducido
\hat{s}(n) mediante convolución de la señal de entrada
x(n) con los coeficientes
\hat{h}_{w}^{(i)}(k,n) relativos a la subtrama
actual.
Las respuestas
\hat{h}_{w}^{(i)}(k,n) de los filtros de subtramas se
pueden calcular mediante el módulo 21 como sumas ponderadas por la
respuesta impulsional \hat{h}_{w}(k,n) determinada para
la trama actual y por la
\hat{h}_{w}(k-1,n) determinada para la
trama anterior. Cuando las subtramas corresponden a un recorte
regular de la trama, la función de mezcla ponderada puede ser
especialmente:
Se observará que el caso al que se aplica
directamente el filtro \hat{h}_{w}(k,n) corresponde a N =
1 (sin subtramas).
\vskip1.000000\baselineskip
Este ejemplo de dispositivo se adapta a una
aplicación para la comunicación vocal, especialmente en
pre-procesamiento de un codificador de voz de baja
velocidad de transferencia.
Se utilizan ventanas no solapables para reducir
al máximo teórico el retraso introducido por el procesamiento,
ofreciendo al mismo tiempo al utilizador la posibilidad de elegir un
ventaneo adaptado a la aplicación. Esto es posible ya que el
ventaneo de la señal de entrada del dispositivo no está sometido a
una limitación de reconstrucción perfecta.
En dicha aplicación, la función de ventaneo
w(n) aplicada por el multiplicador 2 es ventajosamente
asimétrica, con objeto de realizar una ponderación más fuerte en la
mitad más reciente de la trama que en la mitad menos reciente.
Como se muestra en la figura 4, la ventana de
análisis asimétrica w(n) se puede construir por medio de dos
medias ventanas de Hanning de distintos tamaños L_{1} y
L_{2}:
Muchos codificadores de voz para móviles
utilizan tramas de longitud 20 ms y funcionan a la frecuencia de
muestreo F_{e} = 8 kHz (es decir 160 muestras por trama). En el
ejemplo representado en la figura 4, se ha elegido L = 160, L_{1}
= 120 y L_{2} = 40.
La elección de dicha ventana permite concentrar
el peso de la estimación espectral hacia las muestras más
recientes, garantizando al mismo tiempo una buena ventana espectral.
El método propuesto permite dicha elección debido a que no se tiene
limitación alguna de reconstrucción perfecta de la señal en la
síntesis (señal reconstruida a la salida mediante filtrado
temporal).
Para tener una mejor resolución frecuencial, las
unidades 3 y 7 utilizan una FFT de longitud L_{FFT} = 256. Esta
elección está motivada asimismo dado que la FFT es digitalmente
óptima cuando se aplica a tramas de longitud en potencia 2. Por lo
tanto, es necesario prolongar previamente el bloque ventaneado
x_{w}(k,n) por L_{FFT} - L = 96 muestras nulas
("zero-padding"):
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
La detección de actividad vocal utilizada en
este ejemplo es un método clásico basado en comparaciones de
energías a corto plazo y a largo plazo de la señal. La actualización
de la estimación de la densidad espectral de potencia de ruido
\hat{\gamma}_{bb}(k,f) se realiza mediante estimación con
alisado exponencial, de conformidad con la expresión (10) con
\alpha(k_{b}) = 0,8553, correspondiente a una constante
de tiempo de 128 ms, considerada suficiente para asegurar un
compromiso entre una estimación fiable y un seguimiento de las
variaciones temporales de la estadística del ruido.
La FT del filtro de reducción de ruido
\hat{H}_{1}(k,f) se preestima de conformidad con la
fórmula (5) (filtro de Wiener en bucle abierto), tras haber
preestimado la DSP de la señal útil según el estimador con decisión
dirigida definido en (12) con \beta(k) = 0,98. Se reutiliza
la misma función F por parte del módulo 16 para producir la
estimación final \hat{H}(k,f) de la FT.
Debido a que la FT \hat{H}(k,f) es de
valores reales, el filtro temporal se vuelve causal mediante:
\vskip1.000000\baselineskip
\vskip1.000000\baselineskip
A continuación, se seleccionan los L_{filt} =
21 coeficientes de dicho filtro, que se ponderan mediante una
ventana de Hanning w_{filt}(n) de longitud L_{filt},
valor correspondiente a las muestras significativas para esta
aplicación:
\vskip1.000000\baselineskip
con:
\vskip1.000000\baselineskip
El filtrado temporal se realiza mediante N = 4
filtros de subtramas \hat{h}_{w}^{(i)}(k,n) obtenidos
por las funciones de mezcla ponderada dadas por (17). A
continuación, estos cuatro filtros se aplican por medio de un
filtrado transversal de longitud L_{filt} = 21 a las cuatro
subtramas de la señal de entrada x^{(i)}(k,n),
obteniéndose éstas mediante una extracción contigua de cuatro
subtramas de tamaño L/4 = 40 muestras de señal de observación
x(k,n):
\vskip1.000000\baselineskip
Este ejemplo de dispositivo se adapta a una
aplicación para el reconocimiento de voz robusto (en un entorno
ruidoso).
En este ejemplo, se utilizan tramas de análisis
de longitud L que presentan solapados mutuos de L/2 muestras entre
dos tramas sucesivas, y la ventana utilizada es del tipo
Hanning:
Se fija la longitud de las tramas en 20 ms, es
decir L = 160 a la frecuencia de muestreo F_{e} = 8 kHz, y se
completan las tramas mediante 96 muestras nulas
("zero-padding") para la FFT.
En este ejemplo, el cálculo de la FT del filtro
reductor de ruido se basa en una relación de raíces cuadradas de
las densidades espectrales de potencia del ruido
\hat{\gamma}_{bb}(k,f) y de la señal útil
\hat{\gamma}_{ss}(k,f) y, por consiguiente, en los
módulos de la estimada del ruido 26 y de la señal
útil 27
La detección de actividad vocal utilizada en
este ejemplo es un método clásico existente basado en comparaciones
de energías a corto plazo y a largo plazo de la señal. La
actualización de la estimación del módulo de la señal de ruido
28 se realiza mediante estimación con alisado
exponencial:
donde k_{b} es la trama de ruido
actual o la última trama de ruido (si se detecta k como trama de
señal útil). La magnitud de alisado \alpha se elige constante e
igual a 0,99, es decir una constante de tiempo de 1,6
s.
La FT del filtro de reducción de ruido
\hat{H}_{1}(k,f) es preestimada por el módulo 13,
según:
con:
El hecho de calcular la raíz cuadrada permite
efectuar estimaciones sobre los módulos, que están ligados al RSB
\eta(k,f) mediante:
El estimador de la señal útil en el módulo
|\hat{S}(k,f)| se obtiene mediante:
(28)
con \beta(k) =
0,98.
El multiplicador 14 realiza el producto de la FT
preestimada \hat{H}_{1}(k,f) por el espectro
X(k,f), y el módulo del resultado (y no su cuadrado) se
obtiene en 15 para proporcionar la estimación afinada de
|\hat{S}(k,f)|, a partir de la cual el módulo
16 produce la estimación final \hat{H}(k,f) de la FT,
utilizando la misma función F que en (25).
A continuación, se obtiene la respuesta temporal
\hat{h}_{w}(k,n) exactamente de la misma manera que en el
ejemplo 1 (paso a ámbito temporal, restitución de la causalidad,
selección de las muestras significativas y ventaneo). La única
diferencia reside en la elección del número de coeficientes
seleccionado L_{filt}, que se fija en L_{filt} = 17 en este
ejemplo.
El filtrado de la trama de entrada x(k,n)
se realiza aplicándole directamente la respuesta temporal del filtro
de reducción de ruido obtenida \hat{h}_{w}(k,n). El
hecho de no realizar el filtrado en subtramas equivale a tomar N =
1 en la expresión (17).
Claims (18)
1. Procedimiento de reducción de ruido en
sucesivas tramas de una señal de entrada x(n), que incluye
las siguientes etapas para por lo menos algunas de las tramas:
- calcular un espectro X(k,f) de la señal
de entrada mediante transformación en el ámbito frecuencial;
- obtener un estimador de nivel de ruido
\hat{\gamma}_{bb}(k,f) del espectro X(k,f) en
función de la frecuencia;
- calcular un primer estimador de nivel de señal
útil \hat{\gamma}_{ss}(k,f) en la trama en función de la
frecuencia;
- calcular la función de transferencia
\hat{H}_{1}(k,f) de un primer filtro reductor de ruido
sobre la base del primer estimador de nivel de señal útil
\hat{\gamma}_{ss1}(k,f) y del estimador de nivel de ruido
\hat{\gamma}_{bb}(k,f);
- calcular un segundo estimador de nivel de
señal útil \hat{\gamma}_{ss}(k,f) en la trama en función
de la frecuencia, combinando el espectro X(k,f) de la señal
de entrada y la función de transferencia \hat{H}_{1}(k,f)
del primer filtro reductor de ruido;
- calcular la función de transferencia
\hat{H}(k,f) de un segundo filtro reductor de ruido sobre
la base del segundo estimador de nivel de señal útil
\hat{\gamma}_{ss}(k,f) y del estimador de nivel de ruido
\hat{\gamma}_{bb}(k,f); y
- utilizar la función de transferencia
\hat{H}(k,f) del segundo filtro reductor de ruido en una
operación de filtrado de la trama para producir una señal con ruido
reducido.
\vskip1.000000\baselineskip
2. Procedimiento según la reivindicación 1, en
el que el cálculo del espectro X(k,f) incluye una ponderación
de la trama de señal de entrada mediante una función de ventaneo
w(n) y una transformación de la trama ponderada hacia el
ámbito frecuencial, siendo la función de ventaneo asimétrica de
manera a aplicar una ponderación más fuerte a la mitad más reciente
de la trama que a la mitad menos reciente de la trama.
3. Procedimiento según la reivindicación 1 o 2,
en el que se determina una respuesta impulsional de filtro reductor
de ruido \hat{h}_{w}(k,n) para la trama actual a partir
de una transformación hacia el ámbito temporal de la función de
transferencia \hat{H}(k,f) del segundo filtro reductor de
ruido, y se realiza la operación de filtrado de la trama en el
ámbito temporal por medio de la respuesta impulsional determinada
para dicha trama.
4. Procedimiento según la reivindicación 3, en
el que la determinación de la respuesta impulsional de filtro
reductor de ruido \hat{h}_{w}(k,n) para la trama actual
incluye las siguientes etapas:
- transformar hacia el ámbito temporal la
función de transferencia \hat{H}(k,f) del segundo filtro
reductor de ruido para obtener una primera respuesta impulsional;
y
- truncar la primera respuesta impulsional a una
longitud de truncado correspondiente a un número de muestras
sensiblemente menor que el número de puntos de la transformación
hacia el ámbito temporal.
\vskip1.000000\baselineskip
5. Procedimiento según la reivindicación 4, en
el que la determinación de la respuesta impulsional de filtro
reductor de ruido \hat{h}_{w}(k,n) para la trama actual
incluye además la siguiente etapa:
- ponderar la respuesta impulsional truncada
mediante una función de ventaneo w_{filt}(n) en un número
de muestras correspondiente a dicha longitud de truncado.
\vskip1.000000\baselineskip
6. Procedimiento según una cualquiera de las
reivindicaciones 3 a 5, en el que se subdivide la trama actual en
varias subtramas y se calcula para cada subtrama una respuesta
impulsional interpolada \hat{h}_{w}^{(i)}(k,n) a
partir de una respuesta impulsional de filtro reductor de ruido
determinada para la trama actual y de la respuesta impulsional de
filtro reductor de ruido determinada para por lo menos una trama
anterior, y en el que la operación de filtrado de la trama incluye
un filtrado de la señal de cada subtrama en el ámbito temporal, de
conformidad con la respuesta impulsional interpolada calculada para
dicha subtrama.
7. Procedimiento según la reivindicación 6, en
el que las respuestas impulsionales interpoladas
\hat{h}_{w}^{(i)}(k,n) se calculan para las distintas
subtramas de la trama actual como sumas ponderadas de la respuesta
impulsional de filtro reductor de ruido \hat{h}_{w}(k,n)
determinada para la trama actual y de la respuesta impulsional de
filtro reductor de ruido
\hat{h}_{w}(k-1,n) determinada para la
trama anterior.
8. Procedimiento según la reivindicación 7, en
el que la respuesta impulsional interpolada
\hat{h}_{w}^{(i)}(k,n) calculada para la i-ésima
subtrama de la trama actual (1 \leq i < N) es igual a
(N-i)/N veces la respuesta impulsional de filtro
reductor de ruido \hat{h}_{w}(k-1,n)
determinada para la trama anterior más i/N veces la respuesta
impulsional de filtro reductor de ruido \hat{h}_{w}(k,n)
determinada para la trama actual, siendo N el número de subtramas
de la trama actual.
9. Procedimiento según una cualquiera de las
reivindicaciones anteriores, en el que la señal de entrada
x(n) es una señal de audio.
10. Dispositivo de reducción de ruido en una
señal de entrada x(n) que incluye:
- medios (1-3) de cálculo de un
espectro X(k,f) de una trama de la señal de entrada mediante
transformación en el ámbito frecuencial;
- medios (5) de obtención de un estimador de
nivel de ruido \hat{\gamma}_{bb}(k,f) del espectro
X(k,f) en función de la frecuencia;
- medios (11) de cálculo de un primer estimador
de nivel de señal útil \hat{\gamma}_{ss1}(k,f) en la
trama en función de la frecuencia;
- medios (13) de cálculo de la función de
transferencia \hat{H}_{1}(k,f) de un primer filtro
reductor de ruido sobre la base del primer estimador de nivel de
señal útil \hat{\gamma}_{ss1}(k,f) y del estimador de
nivel de ruido \hat{\gamma}_{bb}(k,f);
- medios (14-15) de cálculo de
un segundo estimador de nivel de señal útil
\hat{\gamma}_{ss}(k,f) en la trama en función de la
frecuencia, combinando el espectro X(k,f) de la señal de
entrada y la función de transferencia \hat{H}_{1}(k,f)
del primer filtro reductor de ruido;
- medios (16) de cálculo de la función de
transferencia \hat{H}(k,f) de un segundo filtro reductor de
ruido sobre la base del segundo estimador de nivel de señal útil
\hat{\gamma}_{ss}(k,f) y del estimador de nivel de ruido
_{bb}(k,f); y
- medios (7-9) de filtrado de la
trama por medio de la función de transferencia \hat{H}(k,f)
del segundo filtro reductor de ruido para producir una señal con
ruido reducido.
\vskip1.000000\baselineskip
11. Dispositivo según la reivindicación 10, en
el que los medios de cálculo de espectro incluyen medios (2) de
ponderación de la trama de señal de entrada x(n) mediante una
función de ventaneo w(n), y medios (3) de transformación de
la trama ponderada hacia el ámbito frecuencial, siendo la función de
ventaneo asimétrica de manera a aplicar una ponderación más fuerte
a la mitad más reciente de la trama que a la mitad menos reciente
de la trama.
12. Dispositivo según la reivindicación 10 u 11,
que incluye medios (7-8) de determinación de una
respuesta impulsional de filtro reductor de ruido
\hat{h}_{w}(k,n) para la trama actual a partir de una
transformación hacia el ámbito temporal de la función de
transferencia \hat{H}(k,f) del segundo filtro reductor de
ruido, en el que los medios de filtrado (9) operan en el ámbito
temporal por medio de la respuesta impulsional determinada para la
trama actual.
13. Dispositivo según la reivindicación 12, en
el que los medios de determinación de la respuesta impulsional de
filtro reductor de ruido \hat{h}_{w}(k,n) incluyen medios
(7) de transformación hacia el ámbito temporal de la función de
transferencia \hat{H}(k,f) del segundo filtro reductor de
ruido, para obtener una primera respuesta impulsional, y medios (8)
de truncado de la primera respuesta impulsional a una longitud de
truncado correspondiente a un número de muestras sensiblemente
menor que el número de puntos de la transformación hacia el ámbito
temporal.
14. Dispositivo según la reivindicación 13, en
el que los medios de determinación de la respuesta impulsional de
filtro reductor de ruido incluyen medios (8) de ponderación de la
respuesta impulsional truncada mediante una función de ventaneo
w_{filt}(n) en un número de muestras correspondiente a
dicha longitud de truncado.
15. Dispositivo según una cualquiera de las
reivindicaciones 12 a 14, que incluye medios para subdividir la
trama actual en varias subtramas , y medios (21) de cálculo de una
respuesta impulsional interpolada
\hat{h}_{w}^{(i)}(k,n) para cada subtrama a partir de
la respuesta impulsional de filtro reductor de ruido
\hat{h}_{w}(k,n) determinada para la trama actual y de
la respuesta impulsional de filtro reductor de ruido determinada
para por lo menos una trama anterior, en el que los medios de
filtrado (9) incluyen un filtro (23) para filtrar la señal de cada
subtrama en el ámbito temporal, de conformidad con la respuesta
impulsional interpolada calculada para dicha subtrama.
16. Dispositivo según la reivindicación 15, en
el que los medios de cálculo de respuesta impulsional interpolada
están dispuestos para calcular las respuestas impulsionales
interpoladas \hat{h}_{w}^{(i)}(k,n) para las distintas
subtramas de la trama actual como sumas ponderadas de la respuesta
impulsional de filtro reductor de ruido \hat{h}_{w}(k,n)
determinada para la trama actual y de la respuesta impulsional de
filtro reductor de ruido
\hat{h}_{w}(k-1,n) determinada para la
trama ante-
rior.
rior.
17. Dispositivo según la reivindicación 16, en
el que la respuesta impulsional interpolada
\hat{h}_{w}^{(i)}(k,n) calculada para la i-ésima
subtrama de la trama actual (1 \leq i \leq N) es igual a
(N-i)/N veces la respuesta impulsional de filtro
reductor de ruido \hat{h}_{w}(k-1,n)
determinada para la trama anterior más i/N veces la respuesta
impulsional de filtro reductor de ruido \hat{h}_{w}(k,n)
determinada para la trama actual, siendo N el número de subtramas
de la trama actual.
18. Dispositivo según una cualquiera de las
reivindicaciones 10 a 17, en el que la señal de entrada x(n)
es una señal de audio.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0101220A FR2820227B1 (fr) | 2001-01-30 | 2001-01-30 | Procede et dispositif de reduction de bruit |
| FR0101220 | 2001-01-30 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2347760T3 true ES2347760T3 (es) | 2010-11-04 |
Family
ID=8859390
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES01273554T Expired - Lifetime ES2347760T3 (es) | 2001-01-30 | 2001-11-19 | Procedimiento y dispositivo de reduccion de ruido. |
Country Status (13)
| Country | Link |
|---|---|
| US (1) | US7313518B2 (es) |
| EP (1) | EP1356461B1 (es) |
| JP (1) | JP4210521B2 (es) |
| KR (1) | KR100549133B1 (es) |
| CN (1) | CN1284139C (es) |
| AT (1) | ATE472794T1 (es) |
| BR (1) | BRPI0116844B1 (es) |
| CA (1) | CA2436318C (es) |
| DE (1) | DE60142490D1 (es) |
| ES (1) | ES2347760T3 (es) |
| FR (1) | FR2820227B1 (es) |
| MX (1) | MXPA03006667A (es) |
| WO (1) | WO2002061731A1 (es) |
Families Citing this family (43)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8326621B2 (en) | 2003-02-21 | 2012-12-04 | Qnx Software Systems Limited | Repetitive transient noise removal |
| US8271279B2 (en) | 2003-02-21 | 2012-09-18 | Qnx Software Systems Limited | Signature noise removal |
| US8073689B2 (en) * | 2003-02-21 | 2011-12-06 | Qnx Software Systems Co. | Repetitive transient noise removal |
| US7725315B2 (en) | 2003-02-21 | 2010-05-25 | Qnx Software Systems (Wavemakers), Inc. | Minimization of transient noises in a voice signal |
| US7885420B2 (en) | 2003-02-21 | 2011-02-08 | Qnx Software Systems Co. | Wind noise suppression system |
| US7949522B2 (en) | 2003-02-21 | 2011-05-24 | Qnx Software Systems Co. | System for suppressing rain noise |
| US7895036B2 (en) | 2003-02-21 | 2011-02-22 | Qnx Software Systems Co. | System for suppressing wind noise |
| US7778425B2 (en) * | 2003-12-24 | 2010-08-17 | Nokia Corporation | Method for generating noise references for generalized sidelobe canceling |
| US7516069B2 (en) * | 2004-04-13 | 2009-04-07 | Texas Instruments Incorporated | Middle-end solution to robust speech recognition |
| EP1591995B1 (en) * | 2004-04-29 | 2019-06-19 | Harman Becker Automotive Systems GmbH | Indoor communication system for a vehicular cabin |
| CN101031963B (zh) * | 2004-09-16 | 2010-09-15 | 法国电信 | 处理有噪声的声音信号的方法以及实现该方法的装置 |
| US7383179B2 (en) * | 2004-09-28 | 2008-06-03 | Clarity Technologies, Inc. | Method of cascading noise reduction algorithms to avoid speech distortion |
| KR100565086B1 (ko) * | 2004-10-13 | 2006-03-30 | 삼성전자주식회사 | 뮤지컬 잡음을 감쇄하는 스펙트럼 잡음 제거 방법 및 그장치 |
| EP1846921B1 (en) * | 2005-01-31 | 2017-10-04 | Skype | Method for concatenating frames in communication system |
| FR2888458A1 (fr) * | 2005-07-11 | 2007-01-12 | France Telecom | Procede et dispositif de prise de son, notamment dans des terminaux telephoniques en "mains libres" |
| JP4765461B2 (ja) * | 2005-07-27 | 2011-09-07 | 日本電気株式会社 | 雑音抑圧システムと方法及びプログラム |
| EP1982305B1 (en) * | 2006-01-31 | 2011-06-15 | Canadian Space Agency | Method and system for increasing signal-to-noise ratio |
| JP4827661B2 (ja) * | 2006-08-30 | 2011-11-30 | 富士通株式会社 | 信号処理方法及び装置 |
| JP4653059B2 (ja) * | 2006-11-10 | 2011-03-16 | オリンパス株式会社 | 撮像システム、画像処理プログラム |
| EP2031583B1 (en) * | 2007-08-31 | 2010-01-06 | Harman Becker Automotive Systems GmbH | Fast estimation of spectral noise power density for speech signal enhancement |
| ATE456130T1 (de) * | 2007-10-29 | 2010-02-15 | Harman Becker Automotive Sys | Partielle sprachrekonstruktion |
| US20100151118A1 (en) * | 2008-12-17 | 2010-06-17 | Eastman Chemical Company | Carrier solvent compositions, coatings compositions, and methods to produce thick polymer coatings |
| US9449611B2 (en) * | 2011-09-30 | 2016-09-20 | Audionamix | System and method for extraction of single-channel time domain component from mixture of coherent information |
| US9173025B2 (en) | 2012-02-08 | 2015-10-27 | Dolby Laboratories Licensing Corporation | Combined suppression of noise, echo, and out-of-location signals |
| US8712076B2 (en) | 2012-02-08 | 2014-04-29 | Dolby Laboratories Licensing Corporation | Post-processing including median filtering of noise suppression gains |
| WO2012126415A2 (zh) | 2012-05-04 | 2012-09-27 | 华为技术有限公司 | 一种信号发送方法、通信设备及系统 |
| CN103916733B (zh) * | 2013-01-05 | 2017-09-26 | 中国科学院声学研究所 | 基于均方误差最小准则的声能量对比控制方法及系统 |
| CN103916730B (zh) * | 2013-01-05 | 2017-03-08 | 中国科学院声学研究所 | 一种能够改善音质的声场聚焦方法及系统 |
| US9318125B2 (en) * | 2013-01-15 | 2016-04-19 | Intel Deutschland Gmbh | Noise reduction devices and noise reduction methods |
| ES2635555T3 (es) | 2013-06-21 | 2017-10-04 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Aparato y método para el desvanecimiento de señales mejorado en diferentes dominios durante el ocultamiento de errores |
| US10149047B2 (en) * | 2014-06-18 | 2018-12-04 | Cirrus Logic Inc. | Multi-aural MMSE analysis techniques for clarifying audio signals |
| CN113115197B (zh) * | 2016-05-09 | 2022-09-16 | 哈曼国际工业有限公司 | 噪声检测方法和系统 |
| CN108848435B (zh) * | 2018-09-28 | 2021-03-09 | 广州方硅信息技术有限公司 | 一种音频信号的处理方法和相关装置 |
| CN110010144A (zh) * | 2019-04-24 | 2019-07-12 | 厦门亿联网络技术股份有限公司 | 语音信号增强方法及装置 |
| CN111402917B (zh) | 2020-03-13 | 2023-08-04 | 北京小米松果电子有限公司 | 音频信号处理方法及装置、存储介质 |
| CN111968615A (zh) * | 2020-08-31 | 2020-11-20 | Oppo广东移动通信有限公司 | 降噪处理方法及装置、终端设备和可读存储介质 |
| US12062369B2 (en) * | 2020-09-25 | 2024-08-13 | Intel Corporation | Real-time dynamic noise reduction using convolutional networks |
| CN112489615B (zh) * | 2020-10-29 | 2024-06-18 | 宁波方太厨具有限公司 | 降噪方法、降噪系统、降噪装置及吸油烟机 |
| CN112960012B (zh) * | 2021-02-03 | 2022-05-31 | 中国铁道科学研究院集团有限公司节能环保劳卫研究所 | 基于阈值归一化短时功率谱密度的高速铁路钢轨波磨声学诊断方法 |
| KR102704879B1 (ko) | 2022-10-06 | 2024-09-09 | 주식회사 라우드에이아이 | 센싱신호로부터 노이즈를 제거하기 위한 장치 및 노이즈 제거하기 위한 방법 |
| CN116952355B (zh) * | 2023-07-24 | 2024-05-14 | 中国人民解放军海军工程大学 | 一种浅海环境近场辐射噪声测量系统及终端 |
| CN116952356B (zh) * | 2023-07-24 | 2024-08-06 | 中国人民解放军海军工程大学 | 基于浅海环境水下声全息技术的近场辐射噪声测量方法 |
| CN120431951B (zh) * | 2025-07-09 | 2025-09-23 | 浙江工业大学 | 基于增强谱减与卡尔曼滤波的两阶段语音降噪方法及其装置和存储介质 |
Family Cites Families (9)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0608833B1 (en) * | 1993-01-25 | 2001-10-17 | Matsushita Electric Industrial Co., Ltd. | Method of and apparatus for performing time-scale modification of speech signals |
| FR2726392B1 (fr) * | 1994-10-28 | 1997-01-10 | Alcatel Mobile Comm France | Procede et dispositif de suppression de bruit dans un signal de parole, et systeme avec annulation d'echo correspondant |
| FR2729247A1 (fr) * | 1995-01-06 | 1996-07-12 | Matra Communication | Procede de codage de parole a analyse par synthese |
| JP2760373B2 (ja) * | 1995-03-03 | 1998-05-28 | 日本電気株式会社 | 雑音消去装置 |
| JP2874679B2 (ja) * | 1997-01-29 | 1999-03-24 | 日本電気株式会社 | 雑音消去方法及びその装置 |
| US5999561A (en) * | 1997-05-20 | 1999-12-07 | Sanconix, Inc. | Direct sequence spread spectrum method, computer-based product, apparatus and system tolerant to frequency reference offset |
| FR2771542B1 (fr) * | 1997-11-21 | 2000-02-11 | Sextant Avionique | Procede de filtrage frequentiel applique au debruitage de signaux sonores mettant en oeuvre un filtre de wiener |
| US6549586B2 (en) * | 1999-04-12 | 2003-04-15 | Telefonaktiebolaget L M Ericsson | System and method for dual microphone signal noise reduction using spectral subtraction |
| US6792405B2 (en) * | 1999-12-10 | 2004-09-14 | At&T Corp. | Bitstream-based feature extraction method for a front-end speech recognizer |
-
2001
- 2001-01-30 FR FR0101220A patent/FR2820227B1/fr not_active Expired - Fee Related
- 2001-11-19 ES ES01273554T patent/ES2347760T3/es not_active Expired - Lifetime
- 2001-11-19 WO PCT/FR2001/003624 patent/WO2002061731A1/fr not_active Ceased
- 2001-11-19 MX MXPA03006667A patent/MXPA03006667A/es active IP Right Grant
- 2001-11-19 EP EP01273554A patent/EP1356461B1/fr not_active Expired - Lifetime
- 2001-11-19 CA CA002436318A patent/CA2436318C/fr not_active Expired - Lifetime
- 2001-11-19 JP JP2002561819A patent/JP4210521B2/ja not_active Expired - Fee Related
- 2001-11-19 CN CNB018223583A patent/CN1284139C/zh not_active Expired - Lifetime
- 2001-11-19 AT AT01273554T patent/ATE472794T1/de not_active IP Right Cessation
- 2001-11-19 BR BRPI0116844-4A patent/BRPI0116844B1/pt not_active IP Right Cessation
- 2001-11-19 DE DE60142490T patent/DE60142490D1/de not_active Expired - Lifetime
- 2001-11-19 US US10/466,816 patent/US7313518B2/en not_active Expired - Lifetime
- 2001-11-19 KR KR1020037010104A patent/KR100549133B1/ko not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| US20040064307A1 (en) | 2004-04-01 |
| KR100549133B1 (ko) | 2006-02-03 |
| CN1488136A (zh) | 2004-04-07 |
| HK1057639A1 (en) | 2004-04-08 |
| MXPA03006667A (es) | 2003-10-24 |
| WO2002061731A1 (fr) | 2002-08-08 |
| BRPI0116844B1 (pt) | 2015-07-28 |
| BR0116844A (pt) | 2003-12-16 |
| US7313518B2 (en) | 2007-12-25 |
| FR2820227B1 (fr) | 2003-04-18 |
| CA2436318A1 (fr) | 2002-08-08 |
| JP4210521B2 (ja) | 2009-01-21 |
| ATE472794T1 (de) | 2010-07-15 |
| FR2820227A1 (fr) | 2002-08-02 |
| JP2004520616A (ja) | 2004-07-08 |
| DE60142490D1 (de) | 2010-08-12 |
| EP1356461B1 (fr) | 2010-06-30 |
| CN1284139C (zh) | 2006-11-08 |
| EP1356461A1 (fr) | 2003-10-29 |
| KR20030074762A (ko) | 2003-09-19 |
| CA2436318C (fr) | 2007-09-04 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2347760T3 (es) | Procedimiento y dispositivo de reduccion de ruido. | |
| Qian et al. | Speech Enhancement Using Bayesian Wavenet. | |
| RU2768514C2 (ru) | Процессор сигналов и способ обеспечения обработанного аудиосигнала с подавленным шумом и подавленной реверберацией | |
| Huang et al. | A multi-frame approach to the frequency-domain single-channel noise reduction problem | |
| CN114694670B (zh) | 一种基于多任务网络的麦克风阵列语音增强系统及方法 | |
| Tashev | Reverberation reduction for improved speech recognition | |
| Martín-Doñas et al. | Dual-channel DNN-based speech enhancement for smartphones | |
| Wisdom et al. | Enhancement and recognition of reverberant and noisy speech by extending its coherence | |
| Sasaoka et al. | A new noise reduction system based on ALE and noise reconstruction filter | |
| Taşmaz et al. | Speech enhancement based on undecimated wavelet packet-perceptual filterbanks and MMSE–STSA estimation in various noise environments | |
| Huang et al. | Dereverberation | |
| Buragohain et al. | Single channel speech enhancement system using convolutional neural network based autoencoder for noisy environments | |
| Upadhyay et al. | A perceptually motivated stationary wavelet packet filterbank using improved spectral over-subtraction for enhancement of speech in various noise environments | |
| CN114678036A (zh) | 语音增强方法、电子设备和存储介质 | |
| Erkelens et al. | Single-microphone late-reverberation suppression in noisy speech by exploiting long-term correlation in the DFT domain | |
| Lu et al. | Temporal contrast normalization and edge-preserved smoothing of temporal modulation structures of speech for robust speech recognition | |
| WO2006114100A1 (en) | Estimation of signal from noisy observations | |
| Prasad et al. | Two microphone technique to improve the speech intelligibility under noisy environment | |
| Krishnamoorthy et al. | Processing noisy speech for enhancement | |
| Dionelis | On single-channel speech enhancement and on non-linear modulation-domain Kalman filtering | |
| Rao et al. | Implementation and evaluation of spectral subtraction with minimum statistics using WOLA and FFT modulated filter banks | |
| Chen et al. | Early reflections based speech enhancement | |
| Schwarz | Dereverberation and Robust Speech Recognition Using Spatial Coherence Models | |
| Yousif et al. | A Dual-Stage Perceptual-Harmonic Hybrid Estimator for Speech Enhancement | |
| WO2026049768A1 (en) | Wind noise mitigation and speech enhancement (wmse) for speech communications |