FR2898209A1 - Procede de debruitage d'un signal audio - Google Patents
Procede de debruitage d'un signal audio Download PDFInfo
- Publication number
- FR2898209A1 FR2898209A1 FR0601822A FR0601822A FR2898209A1 FR 2898209 A1 FR2898209 A1 FR 2898209A1 FR 0601822 A FR0601822 A FR 0601822A FR 0601822 A FR0601822 A FR 0601822A FR 2898209 A1 FR2898209 A1 FR 2898209A1
- Authority
- FR
- France
- Prior art keywords
- signal
- speech
- algorithm
- noise
- noisy
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Quality & Reliability (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Soundproofing, Sound Blocking, And Sound Damping (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Noise Elimination (AREA)
- Signal Processing Not Specific To The Method Of Recording And Reproducing (AREA)
Abstract
Ce procédé est un procédé d'analyse de cohérence temporelle du signal bruité comprenant les étapes consistant à : a) déterminer, à partir du signal bruité, un signal de référence en appliquant au signal bruité un traitement (10, 18) propre à atténuer de façon plus importante les composantes de parole que la composante de bruit, notamment au moyen d'un algorithme prédictif récursif adaptatif de type LMS ; b) déterminer (24) une probabilité de présence/absence de parole à partir des niveaux d'énergie respectifs dans le domaine spectral du signal bruité et du signal de référence, et c) dériver (26) du signal bruité une estimée débruitée du signal de parole en fonction de la probabilité de présence/absence de parole ainsi déterminée.
Description
La présente invention concerne le débruitage des signaux audio captés par
un microphone dans un environnement bruité. L'invention s'applique avantageusement, mais de façon non limitative, aux signaux de parole captés par les appareils téléphoniques de type "mains- libres" ou analogues. Ces appareils comportent un microphone sensible captant non seulement la voix de l'utilisateur, mais également le bruit environnant, bruit qui constitue un élément perturbateur pouvant aller, dans certains cas, jusqu'à rendre incompréhensibles les paroles du locuteur.
Il en est de même si l'on veut mettre en oeuvre des techniques de reconnaissance vocale, où il est très difficile d'opérer une reconnaissance de forme sur des mots noyés dans un niveau de bruit élevé. Cette difficulté liée au bruit ambiant est particulièrement contraignante dans le cas des dispositifs "mains-libres" pour véhicules automobiles. En particulier, la distance importante entre le microphone et le locuteur en-traîne un niveau relatif de bruit élevé qui rend difficile l'extraction du signal utile noyé dans le bruit. De plus, le milieu très bruité typique de l'environnement automobile présente des caractéristiques spectrales non stationnaires, c'est-à-dire qui évoluent de manière imprévisible en fonction des conditions de conduite : passage sur des chaussées déformées ou pavées, autoradio en fonctionnement, etc. Diverses techniques ont été proposées pour réduire le niveau de bruit du signal capté par un microphone. Le WO-A-98/45997 (Parrot SA) prévoit ainsi d'évaluer et mémoriser un niveau de bruit courant capté par le microphone en l'absence du signal de parole puis, en présence d'un signal de parole, le niveau de bruit ainsi évalué est soustrait du signal capté. Plus précisément, le bruit est capté en permanence par le microphone et analysé pour donner un spectre énergétique moyen pondéré du bruit, continûment réactualisé. Lorsque l'on souhaite opérer une reconnaissance vocale, le dispositif analyse le signal capté par le microphone dans le domaine fréquentiel et soustrait du spectre de puissance ainsi obtenu le spectre de puissance du bruit antérieurement déterminé et mémorisé. Ce dispositif utilise l'appui sur le bouton-poussoir d'activation du téléphone (par exemple lorsque le conducteur veut répondre à un appel entrant) pour détecter le début du signal de pa- role et considérer que le signal capté antérieurement à cet appui était essentiellement un signal de bruit. On connaît également des mécanismes de filtrage du bruit du type dit beamforming ou double-phoning mettant en oeuvre deux microphones dis- tants, dont l'un est placé et orienté pour capter principalement la voix du locuteur, tandis que l'autre capte une composante de bruit plus importante. La comparaison des signaux captés permet d'extraire de manière efficace la voix du bruit ambiant, par des moyens logiciels relativement simples. Cette technique, fondée sur une analyse de cohérence spatiale de deux signaux, présente cependant l'inconvénient de nécessiter deux microphones distants, ce qui la cantonne généralement à des installations fixes ou semi-fixes et ne permet pas de l'intégrer à un dispositif préexistant par simple adjonction d'un module logiciel. Elle présuppose aussi que la position du locuteur par rapport aux deux microphones soit à peu près constante, ce qui est généralement le cas dans un téléphone de voiture utilisé par son conducteur. Mais cette contrainte, comme la précédente, exclut de généraliser cette technique à toutes les situations où l'on aurait besoin d'assurer un débruitage énergique d'un signal de parole noyé dans un bruit de nature complexe et imprévisible.
Une part importante des méthodes les plus efficaces dans le cas du système comportant un seul microphone enregistrant un signal de voix bruité se fondent sur le modèle statistique établit par D. Malah et Y. Ephraim dans [1] Y. Ephraim et D. Malah, Speech Enhancement using a Minimum Mean-Square Error Short-Time Spectral Amplitude Estimator, IEEE Transactions on Acoustics, Speech, and Signal Processing, Vol. ASSP-32, No 6, pp. 1109-1121, Dec. 1984, et [2] Y. Ephraim et D. Malah, Speech Enhancement using a Minimum Mean-Square Error Log-Spectral Amplitude Estimator, IEEE Transactions on Acoustics, Speech, and Signal Processing, Vol. ASSP-33, No 2, pp. 443-445, April 1985. Faisant l'approximation que la parole et le bruit sont des processus gaussiens non corrélés et présupposant que la puissance spectrale du bruit soit une donnée connue, ces deux articles donnent une solution optimale au problème de réduction de bruit décrit plus haut. Cette solution propose de découper le signal bruité en composantes fréquentielles indépendantes par l'utilisation de la transformée de Fourrier discrète, d'appliquer un gain optimal sur chacune de ces composantes puit de recombiner le signal ainsi traité. Les deux articles divergent sur le choix du critère d'opti- matité. Dans [1], le gain appliqué est nommé gain STSA et permet de minimiser la distance quadratique moyenne entre le signal estimé (à la sortie de l'algorithme) et le signal de parole orignal (non bruité). Dans [2], l'application d'un gain nommé gain LSA permet quant à elle de minimiser la dis-tance quadratique moyenne entre le logarithme de l'amplitude du signal estimé et le logarithme de l'amplitude du signal de parole original. Ce second critère se montre supérieur au premier car la distance choisie est en bien meilleure adéquation avec le comportement de l'oreille humaine et donne donc qualitativement de meilleurs résultats. Dans tous les cas, l'idée essentielle est de diminuer l'énergie des composantes fréquentielles très bruités en leur appliquant un gain faible tout en laissant intactes (par l'application d'un gain égal à 1) celles qui le sont peu ou pas du tout. Bien que séduisant puisque soutenu par une démonstration mathématique rigoureuse, ce procédé ne peut toutefois pas être mis en oeuvre tout seul. En effet, comme indiqué plus haut, la puissance spectrale du bruit est inconnue et imprévisible ex ante. De plus, ce même procédé ne pro-pose pas d'évaluer à quels moments la parole du locuteur est présente dans le signal capté. Il se contente simplement de supposer soit que la parole est toujours présente, soit qu'elle est présente une portion fixe du temps, ce qui peut limiter sérieusement la qualité de la réduction de bruit.
II est donc nécessaire d'utiliser un autre algorithme ayant pour fonction d'évaluer la puissance spectrale du bruit ainsi que les instants où la parole du locuteur est présente sur le signal brut capté. II s'avère même que cette estimation constitue le facteur déterminant de la qualité de la réduction de bruit opérée, l'algorithme d'Ephraim et Malah n'étant que la ma- nière optimale d'utiliser l'information ainsi obtenue. C'est une solution originale à ce double problème d'évaluation du bruit et des instants de présence du signal de parole qu'apporte la présente invention. Ces deux questions sont en réalité intrinsèquement liées. En effet suppo-sons que le signal brut capté est découpé en trames de longueurs égales, dont on calcule pour chacune la transformée de Fourier à court terme. Pour une composante fréquentielle donnée, la connaissance des indices de trames où la parole est absente permet d'évaluer la puissance du bruit ainsi que son évolution au cours du temps sur ce segment du spectre. II suffit en effet de mesurer l'énergie du signal brut lorsque la parole est ab-sente et de faire une moyenne continuellement mise à jour de ses mesures. La question principale est donc de savoir quand exactement la parole du locuteur est absente du signal capté par le microphone. Si le bruit est stationnaire ou pseudo-stationnaire, ce problème peut être aisément résolu en déclarant que la parole est absente dans un segment de spectre d'une trame donnée lorsque l'énergie spectrale des données pour ce segment de spectre n'a pas évolué ou a peu évolué par rapport aux dernières trames. Inversement, on déclare que la parole est présente en cas de comportement non stationnaire.
Toutefois, dans une environnement réel, a fortiori un environnement automobile dont on a indiqué plus haut que le bruit comportait de nombreuses caractéristique spectrales non stationnaires, ce procédé est aisément pris en défaut, dans la mesure où aussi bien la parole que le bruit peuvent présenter des comportement transitoires. Or, si l'on décide de conserver toutes les composantes transitoires, il restera du bruit musical résiduel dans les données débruitées ; inversement, si l'on décide de supprimer les composantes transitoires en deçà d'un seuil énergétique donné, les composantes faibles de la parole seront alors effacées, alors que ces composantes peuvent être importantes, tant pour leur contenu informatif que pour l'intelligibilité générale (faible distorsion) du signal débruité restitué après traitement. À cet égard, diverses méthodes ont été proposées. Parmi les plus efficaces, on peut citer celle décrite par : [3] I. Cohen et B. Berdugo, Speech Enhancement for Non-Stationary Noise Environments, Signal Processing, Elsevier, Vol. 81, pp. 2403-2418, 2001, Comme fréquemment dans le domaine, le procédé décrit dans cet article n'a pas pour objectif d'identifier précisément sur quelles composantes fréquentielles de quelles trames la parole est absente mais plutôt de donner un indice de confiance entre 0 et 1, une valeur 1 indiquant que la parole est absente à coup sûr (selon l'algorithme) tandis qu'une valeur 0 déclare le contraire. De par sa nature, cet indice est assimilé à la probabilité d'absence de la parole a priori, c'est à dire la probabilité que la parole soit absente sur une composante fréquentielle donnée de la trame considé- 5 rée. II s'agit bien sûr d'une assimilation non rigoureuse dans le sens que même si la présence de la parole soit probabiliste ex-ante, le signal capté par le microphone ne peut à chaque instant que passer par deux états distincts. Il peut soit (à l'instant considéré) comporter de la parole soit ne pas en contenir. Toutefois cette assimilation donne de bons résultats en pratique ce qui justifie son utilisation. Afin d'estimer cette probabilité d'absence, Cohen et Berdugo utilisent des moyennes sur des rapports signal à bruit a priori eux mêmes utilisés et calculés dans l'algorithme d'Ephraim et Malah. Ces auteurs décrivent également la technique dite de gain OMLSA (Optimally-Modified Log-Spectral Amplitude), visant à améliorer le gain LSA par l'intégration de cette probabilité d'absence de la parole. Cette estimation de la probabilité a priori d'absence de la parole se révèle efficace, mais dépend directement du modèle statistique élaboré par Ephraim et Malah et non d'une connaissance a priori des données. Pour obtenir une estimée de la probabilité d'absence qui soit indépen- dante de ce modèle statistique, Cohen et Berdugo ont proposé dans : [4] I. Cohen And B. Berdugo, Two Channel Signal Détection and Speech Enhancement Based on the Transient Beam-to-Reference Ratio, Proc. ICASSP 2003, Hong Kong, pp. 233-236, April 2003, de calculer la probabilité d'absence à partir de signaux captés par deux microphones différemment placés, donnant des signaux respectifs sur deux voies différentes, dont la combinaison permet d'obtenir une voie dite de sortie et une voie dite bruit de référence. L'analyse est basée sur la constatation que les composantes de parole sont relativement plus faibles sur la voie de bruit de référence, et que les composantes de bruit transi-toire présentent à peu près la même énergie sur les deux voies. Une probabilité de présence de parole pour chaque segment de spectre de chaque trame est déterminée en calculant un ratio d'énergie entre les composantes non stationnaires des signaux respectifs des deux voies.
6
Mais, comme pour les techniques de beamforming ou double-phoning évoquées plus haut, ce procédé est assez contraignant dans la mesure où il nécessite deux microphones. L'un des buts de l'invention est de remédier aux inconvénients des mé- thodes proposées jusqu'à présent, grâce à un procédé perfectionné de débruitage applicable à un signal de parole considéré isolément, notamment un signal capté par un microphone unique, procédé qui soit basé sur l'analyse de la cohérence temporelle des signaux captés. Le point de départ de l'invention réside dans la constatation que la parole présente généralement une cohérence temporelle supérieure au bruit et que, de ce fait, elle est nettement plus prédictible. Essentiellement, l'invention propose d'utiliser cette propriété pour calculer un signal de référence où la parole aura été plus atténuée que le bruit, en appliquant notamment un algorithme prédictif qui pourra par exemple être de type LMS (Least Mean Squares, moindres carrés moyens). Ce signal de référence dérivé du signal de parole à débruiter pourra être utilisé de façon comparable à celle du signal du second microphone des techniques de beamforming à deux voies, par exemple des techniques semblables à celles de Cohen et Berdugo [4, précité]. Le calcul d'un ratio entre les niveaux d'énergie respectifs du signal originel et du signal de référence ainsi obtenu permettra de discriminer entre les composantes de parole et les bruits parasites non stationnaires, et fournira une estimation de la probabilité de présence de parole de façon indépendante de tout modèle statistique. Plus précisément, pour le débruitage d'un signal audio bruité comportant une composante de parole combinée à une composante de bruit, cette composante de bruit comprenant elle-même une composante de bruit transitoire et une composante de bruit pseudo-stationnaire, la présente invention propose d'opérer une analyse de cohérence temporelle du signal bruité par les étapes consistant à : a) déterminer, à partir du signal bruité, un signal de référence en appli-quant au signal bruité un traitement propre à atténuer de façon plus importante les composantes de parole que les composantes de bruit, b) déterminer une probabilité de présence/absence de parole a priori à partir des niveaux d'énergie respectifs dans le domaine spectral du si-35 gnal bruité et du signal de référence, et
7
c) utiliser cette probabilité d'absence de parole a priori pour estimer un spectre de bruit et dériver (26) du signal bruité une estimée débruitée du signal de parole. L'étape a) comprend avantageusement l'application d'un algorithme pré- dictif, notamment un algorithme adaptatif récursif de type moindres carrés moyens LMS. L'étape b) comprend avantageusement l'application d'un algorithme d'estimation de l'énergie de la composante de bruit pseudo-stationnaire dans le signal de référence et dans le signal bruité, notamment un algorithme de type à moyennage récursif par contrôle des minima MRCA comme décrit dans : [5] I. Cohen et B. Berdugo, Noise Estimation by Minima Controlled Recursive Averaging for Robust Speech Enhancement, IEEE Signal Processing Letters, Vol. 9, No 1, pp. 12-15, Jan. 2002, L'étape c) comprend avantageusement l'application d'un algorithme de gain variable fonction de la probabilité de présence/absence de parole, notamment un algorithme de type gain à amplitude log-spectrale modifié optimisé OM-LSA. 0
On va maintenant décrire un exemple de mise en oeuvre de l'invention, en référence aux dessins annexés où les mêmes références numériques dé-signent d'une figure à l'autre des éléments identiques ou fonctionnelle- ment semblables. La figure 1 est un diagramme schématique illustrant les différentes opérations effectuées par un algorithme de débruitage conformément au procédé de l'invention. La figure 2 est un diagramme schématique illustrant plus particulièrement l'algorithme prédictif LMS adaptatif. 0
8
Le signal que l'on souhaite débruiter est un signal numérique échantillon-né x(n), où n désigne le numéro de l'échantillon (n est donc la variable temporelle). Le signal capté x(n) est une combinaison d'un signal de parole s(n) et d'un bruit surajouté, non corrélé, d(n) : ( ) = s(n) +d(n) Ce bruit d(n) a deux composantes indépendantes, à savoir une compo- saute transitoire dt(n) et une composante pseudo-stationnaire dps(n) :
d(n) d (n)+ dp.(n) Comme illustré sur la figure 1, le signal bruité x(n) est appliqué en entrée d'un algorithme LMS prédictif schématisé par le bloc 10, incluant l'application de retards appropriés 12. Le fonctionnement de cet algorithme LMS sera décrit plus bas, en référence à la figure 2. On calcule ensuite la transformé de Fourier à court terme du signal capté x(n) (bloc 16), ainsi que du signal y(n) délivré par l'algorithme LMS prédic- tif (bloc 14). À partir de ces deux transformées est calculé un signal de référence (bloc 18), qui constitue l'une des variables d'entrée d'un algorithme de calcul de la probabilité d'absence de parole (bloc 24). Parallèlement, la transformée du signal bruité x(n), issue du bloc 16, est égale-ment appliquée à l'algorithme de calcul de probabilité.
Les blocs 20 et 22 estiment le bruit pseudo-stationnaire du signal de référence et de la transformée du signal bruité est estimé, et le résultat est également appliqué à l'algorithme de calcul de probabilité. Le résultat du calcul de probabilité d'absence de parole, ainsi que la transformée du signal bruité, sont appliqués en entrée d'un algorithme de tai- tement de gain OM-LSA (bloc 26), dont le résultat est soumis à une transformation inverse de Fourier (bloc 28) pour donner une estimée de la parole débruitée. On va maintenant décrire plus en détail les différentes phases de ce traitement.
L'algorithme prédictif LMS (bloc 10) est schématisé sur la figure 2.
9
Dans la mesure où les signaux en présence sont globalement non stationnaires mais localement pseudo-stationnaires, on peut avantageuse-ment utiliser un système adaptatif, qui pourra tenir compte des variations d'énergie du signal dans le temps et converger vers les divers optima Io- caux. Essentiellement, si l'on applique des retards successifs A, la prédiction linéaire y(n) du signal x(n) est une combinaison linéaire des échantillons antérieurs {x(n- -i+1)}j<< n ,t1- _j + 1) qui minimise l'erreur quadratique moyenne de l'erreur de prédiction : (n) = x{n) ù La minimisation consiste à trouver : [(n) min E - wx(n_. -z+1) 2 20 Pour résoudre ce problème, il est possible d'utiliser un algorithme LMS, qui est un algorithme en lui-même connu, décrit par exemple dans : [6] B. Widrow, Adaptative Filters, Aspect of Network and System Theory, R. E. Kalman and N. De Claris (Eds). New York: Holt, Rinehart and Winston, pp. 563-587, 1970, et 25 [7] B. Widrow et al., Adaptative Noise Cancelling: Principles and Applications, Proc. IEEE, Vol. 63, No 12 pp. 1692-1716, Dec 1975. On peut définir un procédé récursif d'adaptation des pondérations.
w1(n +1) = r;(n) + 2p (n) (n - c1- : + 1) p étant une constante de gain qui permet d'ajuster la vitesse et la stabilité de l'adaptation. 15 30 On pourra trouver des indications générales sur ces aspects de l'algorithme LMS dans : [8] B. Widrow et S. Stearns, Adaptative Signal Processing, Prentice-Hall Signal Processing Series, Alan V. Oppenheim Series Editor, 1985.
On peut démontrer qu'une telle prédiction linéaire adaptative permet de discriminer efficacement entre bruit et parole car les échantillons contenant de la parole seront bien mieux prédits (plus petites erreurs quadratiques entre la prédiction et le signal brut) que ceux ne contenant que du bruit.
Plus précisément, les signaux respectifs x(n) et y(n) (signal de parole bruitée et prédiction linéaire) sont découpés en trames de longueurs identiques, et leur transformée de Fourier à court terme (notées respectivement X et Y) est calculée pour chaque trame. Pour éviter les effets des erreurs de précision, l'algorithme prévoit un recouvrement de 50% entre trames consécutives, et les échantillons sont multipliés par les coefficients de la fenêtre de Nanning de manière que l'addition des trames paires et impaires corresponde au signal d'origine proprement dit. Pour le segment de spectre k d'une trame 1 paire, on a : R X (k, t) _ E h(n)x(Ri + Et pour le segment de spectre k d'une trame / impaire : X (k, t) _ h(p)( f +#?}-i h étant la fenêtre de Nanning. Une première possibilité consiste à définir le signal de référence en prenant la transformée de Fourier de l'erreur de prédiction :
k, t) = X(k_, t) - I'( k, t)
Cependant, on constate en pratique un certain déphasage entre X et Y dû à une convergence imparfaite de l'algorithme LMS, empêchant une bonne 25 30 discrimination entre parole et bruit. On préfère donc adopter pour le signal de référence une autre définition qui compense ce déphasage, à savoir : =X(k,i) -X(kt IY(k,i)I I (k,i)I On suppose que l'énergie spectrale du signal de référence peut être décrite sous la forme : E[Re f(k,1)12 = E[S(k, i)] tag (k) + E[D (k, 1)12 D, (k) + E[Dpi (k, i)] 2ar,, (k) 10 où as(k) < aD,(k) < a; .(k)
représentent l'atténuation sur le signal de référence des trois signaux dans chaque segment de spectre. 15 L'étape suivante consiste à délivrer une estimation q(k,l) de la probabilité d'absence de parole dans le signal bruité : = Pr{tda(k, i)}
20 Ho(k,l) indiquant l'absence de parole (et H1(k,l) la présence de parole) dans le sème segment de spectre de la lème trame. La discrimination entre bruit transitoire et parole peut être opérée par une technique comparable à celle de Cohen et Berdugo [5, précité]. Plus précisément, l'algorithme de l'invention évalue un ratio des énergies transitoi- 25 res sur les deux voies, donné par : 8X(k, i) ù MX (k, i) n(k,t) SRef(k,i) ùMRef(k;i) S étant une estimation lissée de l'énergie instantanée : 30 (k,r) SX(k- 1.) E b()I `(k, 1
12
b étant une fenêtre dans le domaine temporel et M étant un estimateur de l'énergie pseudo-stationnaire, qui peut être obtenu par exemple par une méthode MCRA (Minima Controlled Recursive Averaging) du même type que celle décrite par Cohen et Berdugo [5, précité] (cependant plusieurs alternatives existent dans la littérature). En présence de parole mais en l'absence de bruit transitoire, ce ratio vaut approximativement : ( Inversement, en l'absence de parole mais en présence de bruits transitoi-res : Si l'on suppose qu'en général :
0....(k) ~ n (k, une procédure d'estimation de q(k,l) est donnée par l'algorithme en méta-20 langage suivant : Pour chaque trame 1 et pour chaque segment de spectre k, (i) Calculer sX(k, t), MX(k, t), SRef (k, t) et MRRÎ(k, t). Aller à (ii) (ii) Si sX(k,t) > Lxm (k,t) (détection de transitoires sur la voie de parole 25 bruitée), alors aller à (iii) sinon q(k,t) =1 (iii) Si sRe,t(k, t) > Ltt,jMRef (k, t) (détection de transitoires sur la voie de référence), alors aller à (iv) sinon q(k, t) 0 30 (iv) Calculer t't(k,t). aller à (v) (v) Calculer q(k,t) = max.(m k) ù k,t) (k) ù ++(k'4'0) Les constantes LX et LRef sont des seuils de détection des transitoires. f2min(k) et .Qmax(k) sont les limites supérieure et inférieure pour chaque segment de spectre. Ces divers paramètres sont choisis de manière à correspondre à des situations typiques, proches de la réalité.
L'étape suivante (correspondant au bloc 26 de la figure 1) consiste à opérer le débruitage proprement dit (renforcement de la composante de parole). L'estimateur que l'on vient de décrire sera appliqué au modèle statistique décrit par Ephraim et Malah [2, précité], qui suppose que le bruit et la parole dans chaque segment de spectre sont des processus gaus-siens indépendants de variances respectives /tX(k,l) et Jd(k,l). Cette étape peut avantageusement mettre en oeuvre l'algorithme de gain OM-LSA (Optimally Modified Log-Spectral Amplitude Gain) décrit par Cohen et Berdugo [3, précité]. Le rapport signal/bruit a priori est défini par : (k}) _ .? Àx(k, 1) (k, t) Le rapport signal/bruit a posteriori est défini par : r( , t) = 1X(k,1)12 A,Î(k z) La probabilité conditionnelle de présence du signal est : F(k,1) = Pr(ffi(k ) IX (k, O) 25 Avec l'hypothèse gaussienne et les paramètres ci-dessus, il vient : n(k,t) q(k'r) {x+e(k,d) avec : t) (k,I)E(k,1) 1. + 41) 20 30 L'estimée optimale de la parole débruitée S(k,l) est donnée par :
14 (k,1) _ G111(k,1)~ ~` tkk x(k,1)
GHI étant le gain dans l'hypothèse où la parole est présente, qui est défini par: k,t) ù 1 + s(k 1) Le gain Gm;n dans l'hypothèse d'absence de parole est une limite inférieure pour la réduction du bruit, afin de limiter la distorsion de la parole. 10 La formule classique d'estimation du rapport signal/bruit a priori est :
(k,l) = a tl,(k,1ù 1) r~(k,l ù 1)+(1 ù m)max(ry(k,t)ù 1,0)
L'estimation de l'énergie du bruit est donnée par :
tk,t+1)= (k, 1) (k,i)+ +0(d(k,l))IX(k,l;tl2
Le paramètre de lissage âd évolue entre une limite inférieure ad et 1, en fonction de la probabilité de présence conditionnelle : 1) = ad + (1 ù ad)F(k,l)
fi étant un facteur de surestimation qui compense le biais en l'absence de signal.
25 Le signal obtenu à l'issue de ce traitement est soumis à une transformée de Fourier inverse (bloc 28) pour donner l'estimée finale de la parole dé-bruitée. L'algorithme de la présente invention se révèle particulièrement efficace dans les environnements bruyants, parasités à la fois par des bruits mé- 30 caniques, des vibrations, etc. ainsi que par des bruits musicaux, situations caractéristiques rencontrées dans l'habitacle d'une voiture. Les spectrogrammes montrent que l'atténuation du bruit est non seulement efficace, mais se fait sans distorsion notable de la parole après débruitage. 15 20
Claims (8)
1. Un procédé de traitement d'un signal audio, pour le débruitage d'un signal bruité comportant une composante de parole combinée à une corn-posante de bruit, cette composante de bruit comprenant elle-même une composante de bruit transitoire et une composante de bruit pseudostationnaire, caractérisé en ce que ce procédé est un procédé d'analyse de cohérence temporelle du signal bruité comprenant les étapes consistant à : a) déterminer, à partir du signal bruité, un signal de référence en appliquant au signal bruité un traitement (10, 18) propre à atténuer de façon plus importante les composantes de parole que les composantes de bruit, b) déterminer (24) une probabilité de présence/absence de parole a prio- ri à partir des niveaux d'énergie respectifs dans le domaine spectral du signal bruité et du signal de référence, et c) utiliser cette probabilité d'absence de parole a priori pour estimer un spectre de bruit et dériver (26) du signal bruité une estimée débruitée du signal de parole.
2. Le procédé de la revendication 1, dans lequel l'étape a) comprend l'application d'un algorithme prédictif (10).
3. Le procédé de la revendication 2, dans lequel l'algorithme prédictif (10) 25 est un algorithme de type moindres carrés moyens LMS.
4. Le procédé de la revendication 2, dans lequel l'algorithme prédictif (10) est un algorithme adaptatif récursif. 30
5. Le procédé de la revendication 1, dans lequel l'étape b) comprend l'application d'un algorithme d'estimation de l'énergie de la composante de bruit pseudo-stationnaire dans le signal de référence et dans le signal bruité. 16
6. Le procédé de la revendication 5, dans lequel l'algorithme d'estimation de l'énergie de la composante de bruit pseudo-stationnaire est un algorithme de type à moyennage récursif par contrôle des minima MRCA.
7. Le procédé de la revendication 1, dans lequel l'étape c) comprend l'application d'un algorithme de gain variable fonction de la probabilité de présence/absence de parole.
8. Le procédé de la revendication 7, dans lequel l'algorithme de gain va-riable est un algorithme de type gain à amplitude log-spectrale modifié optimisé OM-LSA.
Priority Applications (6)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0601822A FR2898209B1 (fr) | 2006-03-01 | 2006-03-01 | Procede de debruitage d'un signal audio |
| EP07290219A EP1830349B1 (fr) | 2006-03-01 | 2007-02-21 | Procédé de débruitage d'un signal audio |
| AT07290219T ATE535905T1 (de) | 2006-03-01 | 2007-02-21 | Verfahren zur geräuschdämpfung eines audiosignals |
| ES07290219T ES2378482T3 (es) | 2006-03-01 | 2007-02-21 | Procedimiento de eliminación de ruido de una señal de audio |
| US11/710,613 US7953596B2 (en) | 2006-03-01 | 2007-02-26 | Method of denoising a noisy signal including speech and noise components |
| PCT/FR2007/000347 WO2007099222A1 (fr) | 2006-03-01 | 2007-02-27 | Procede de debruitage d'un signal audio |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0601822A FR2898209B1 (fr) | 2006-03-01 | 2006-03-01 | Procede de debruitage d'un signal audio |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| FR2898209A1 true FR2898209A1 (fr) | 2007-09-07 |
| FR2898209B1 FR2898209B1 (fr) | 2008-12-12 |
Family
ID=36992693
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| FR0601822A Expired - Fee Related FR2898209B1 (fr) | 2006-03-01 | 2006-03-01 | Procede de debruitage d'un signal audio |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US7953596B2 (fr) |
| EP (1) | EP1830349B1 (fr) |
| AT (1) | ATE535905T1 (fr) |
| ES (1) | ES2378482T3 (fr) |
| FR (1) | FR2898209B1 (fr) |
| WO (1) | WO2007099222A1 (fr) |
Families Citing this family (47)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8949120B1 (en) | 2006-05-25 | 2015-02-03 | Audience, Inc. | Adaptive noise cancelation |
| FR2908005B1 (fr) * | 2006-10-26 | 2009-04-03 | Parrot Sa | Circuit de reduction de l'echo acoustique pour un dispositif "mains libres"utilisable avec un telephone portable |
| FR2908004B1 (fr) * | 2006-10-26 | 2008-12-12 | Parrot Sa | Circuit de reduction de l'echo acoustique pour un dispositif "mains libres"utilisable avec un telephone portable |
| FR2908003B1 (fr) * | 2006-10-26 | 2009-04-03 | Parrot Sa | Procede de reduction de l'echo acoustique residuel apres supression d'echo dans un dispositif"mains libres" |
| FR2932332B1 (fr) * | 2008-06-04 | 2011-03-25 | Parrot | Systeme de controle automatique de gain applique a un signal audio en fonction du bruit ambiant |
| US8521530B1 (en) * | 2008-06-30 | 2013-08-27 | Audience, Inc. | System and method for enhancing a monaural audio signal |
| DK2151820T3 (da) * | 2008-07-21 | 2012-02-06 | Siemens Medical Instr Pte Ltd | Fremgangsmåde til forspændingskompensation med henblik på cepstro-temporal udglatning af spektralfilterforstærkninger |
| EP2555191A1 (fr) * | 2009-03-31 | 2013-02-06 | Huawei Technologies Co., Ltd. | Procédé et dispositif de débruitage de signaux audio |
| FR2945696B1 (fr) * | 2009-05-14 | 2012-02-24 | Parrot | Procede de selection d'un microphone parmi deux microphones ou plus, pour un systeme de traitement de la parole tel qu'un dispositif telephonique "mains libres" operant dans un environnement bruite. |
| WO2010151183A1 (fr) * | 2009-06-23 | 2010-12-29 | Telefonaktiebolaget L M Ericsson (Publ) | Procédé et agencement pour réseau de télécommunications mobiles |
| FR2948484B1 (fr) | 2009-07-23 | 2011-07-29 | Parrot | Procede de filtrage des bruits lateraux non-stationnaires pour un dispositif audio multi-microphone, notamment un dispositif telephonique "mains libres" pour vehicule automobile |
| KR101587844B1 (ko) * | 2009-08-26 | 2016-01-22 | 삼성전자주식회사 | 마이크로폰의 신호 보상 장치 및 그 방법 |
| FR2950461B1 (fr) | 2009-09-22 | 2011-10-21 | Parrot | Procede de filtrage optimise des bruits non stationnaires captes par un dispositif audio multi-microphone, notamment un dispositif telephonique "mains libres" pour vehicule automobile |
| US8219394B2 (en) * | 2010-01-20 | 2012-07-10 | Microsoft Corporation | Adaptive ambient sound suppression and speech tracking |
| US8798290B1 (en) | 2010-04-21 | 2014-08-05 | Audience, Inc. | Systems and methods for adaptive signal equalization |
| DK2395506T3 (da) * | 2010-06-09 | 2012-09-10 | Siemens Medical Instr Pte Ltd | Fremgangsmåde og system til behandling af akustisk signal til undertrykkelse af interferens og støj i binaurale mikrofonkonfigurationer |
| US20120245927A1 (en) * | 2011-03-21 | 2012-09-27 | On Semiconductor Trading Ltd. | System and method for monaural audio processing based preserving speech information |
| CN102740215A (zh) * | 2011-03-31 | 2012-10-17 | Jvc建伍株式会社 | 声音输入装置、通信装置、及声音输入装置的动作方法 |
| FR2974655B1 (fr) | 2011-04-26 | 2013-12-20 | Parrot | Combine audio micro/casque comprenant des moyens de debruitage d'un signal de parole proche, notamment pour un systeme de telephonie "mains libres". |
| FR2976111B1 (fr) | 2011-06-01 | 2013-07-05 | Parrot | Equipement audio comprenant des moyens de debruitage d'un signal de parole par filtrage a delai fractionnaire, notamment pour un systeme de telephonie "mains libres" |
| FR2976710B1 (fr) * | 2011-06-20 | 2013-07-05 | Parrot | Procede de debruitage pour equipement audio multi-microphones, notamment pour un systeme de telephonie "mains libres" |
| US8880393B2 (en) * | 2012-01-27 | 2014-11-04 | Mitsubishi Electric Research Laboratories, Inc. | Indirect model-based speech enhancement |
| US9258653B2 (en) * | 2012-03-21 | 2016-02-09 | Semiconductor Components Industries, Llc | Method and system for parameter based adaptation of clock speeds to listening devices and audio applications |
| US9640194B1 (en) | 2012-10-04 | 2017-05-02 | Knowles Electronics, Llc | Noise suppression for speech processing based on machine-learning mask estimation |
| US20140278393A1 (en) | 2013-03-12 | 2014-09-18 | Motorola Mobility Llc | Apparatus and Method for Power Efficient Signal Conditioning for a Voice Recognition System |
| US20140270249A1 (en) * | 2013-03-12 | 2014-09-18 | Motorola Mobility Llc | Method and Apparatus for Estimating Variability of Background Noise for Noise Suppression |
| US9536540B2 (en) | 2013-07-19 | 2017-01-03 | Knowles Electronics, Llc | Speech signal separation and synthesis based on auditory scene analysis and speech modeling |
| US10141003B2 (en) * | 2014-06-09 | 2018-11-27 | Dolby Laboratories Licensing Corporation | Noise level estimation |
| WO2016033364A1 (fr) | 2014-08-28 | 2016-03-03 | Audience, Inc. | Suppression de bruit à sources multiples |
| US10605941B2 (en) | 2014-12-18 | 2020-03-31 | Conocophillips Company | Methods for simultaneous source separation |
| US20170018273A1 (en) * | 2015-07-16 | 2017-01-19 | GM Global Technology Operations LLC | Real-time adaptation of in-vehicle speech recognition systems |
| CA2999920A1 (fr) | 2015-09-28 | 2017-04-06 | Conocophillips Company | Acquisition sismique en 3d |
| FR3044197A1 (fr) | 2015-11-19 | 2017-05-26 | Parrot | Casque audio a controle actif de bruit, controle anti-occlusion et annulation de l'attenuation passive, en fonction de la presence ou de l'absence d'une activite vocale de l'utilisateur de casque. |
| US10251002B2 (en) | 2016-03-21 | 2019-04-02 | Starkey Laboratories, Inc. | Noise characterization and attenuation using linear predictive coding |
| US10564925B2 (en) | 2017-02-07 | 2020-02-18 | Avnera Corporation | User voice activity detection methods, devices, assemblies, and components |
| US10809402B2 (en) | 2017-05-16 | 2020-10-20 | Conocophillips Company | Non-uniform optimal survey design principles |
| US10079026B1 (en) * | 2017-08-23 | 2018-09-18 | Cirrus Logic, Inc. | Spatially-controlled noise reduction for headsets with variable microphone array orientation |
| WO2019100068A1 (fr) | 2017-11-20 | 2019-05-23 | Conocophillips Company | Application en mer d'une conception d'étude d'échantillonnage optimale non uniforme |
| CN108899043A (zh) * | 2018-06-15 | 2018-11-27 | 深圳市康健助力科技有限公司 | 数字助听器瞬时噪声抑制算法的研究及实现 |
| US11481677B2 (en) | 2018-09-30 | 2022-10-25 | Shearwater Geoservices Software Inc. | Machine learning based signal recovery |
| JP7628388B2 (ja) * | 2019-03-06 | 2025-02-10 | パナソニック インテレクチュアル プロパティ コーポレーション オブ アメリカ | 信号処理装置及び信号処理方法 |
| KR20200132645A (ko) * | 2019-05-16 | 2020-11-25 | 삼성전자주식회사 | 음성 인식 서비스를 제공하는 장치 및 방법 |
| FR3113537B1 (fr) | 2020-08-19 | 2022-09-02 | Faurecia Clarion Electronics Europe | Procédé et dispositif électronique de réduction du bruit multicanale dans un signal audio comprenant une partie vocale, produit programme d’ordinateur associé |
| CN112233688B (zh) * | 2020-09-24 | 2022-03-11 | 北京声智科技有限公司 | 音频降噪方法、装置、设备及介质 |
| CN114387982B (zh) * | 2020-10-19 | 2025-03-14 | 大众问问(北京)信息科技有限公司 | 一种语音信号处理方法、装置及计算机设备 |
| CN114999512A (zh) * | 2022-05-26 | 2022-09-02 | 山东衡昊信息技术有限公司 | 一种基于最值限定的人工耳蜗语音信号净化方法 |
| CN116644281B (zh) * | 2023-07-27 | 2023-10-24 | 东营市艾硕机械设备有限公司 | 一种游艇船体偏移检测方法 |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4658426A (en) * | 1985-10-10 | 1987-04-14 | Harold Antin | Adaptive noise suppressor |
| US5742694A (en) * | 1996-07-12 | 1998-04-21 | Eatwell; Graham P. | Noise reduction filter |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5251263A (en) * | 1992-05-22 | 1993-10-05 | Andrea Electronics Corporation | Adaptive noise cancellation and speech enhancement system and apparatus therefor |
| US5924061A (en) * | 1997-03-10 | 1999-07-13 | Lucent Technologies Inc. | Efficient decomposition in noise and periodic signal waveforms in waveform interpolation |
| US6691092B1 (en) * | 1999-04-05 | 2004-02-10 | Hughes Electronics Corporation | Voicing measure as an estimate of signal periodicity for a frequency domain interpolative speech codec system |
| JP2005249816A (ja) * | 2004-03-01 | 2005-09-15 | Internatl Business Mach Corp <Ibm> | 信号強調装置、方法及びプログラム、並びに音声認識装置、方法及びプログラム |
| EP1580882B1 (fr) * | 2004-03-19 | 2007-01-10 | Harman Becker Automotive Systems GmbH | Système et procédé d'amélioration audio |
| US7813499B2 (en) * | 2005-03-31 | 2010-10-12 | Microsoft Corporation | System and process for regression-based residual acoustic echo suppression |
-
2006
- 2006-03-01 FR FR0601822A patent/FR2898209B1/fr not_active Expired - Fee Related
-
2007
- 2007-02-21 ES ES07290219T patent/ES2378482T3/es active Active
- 2007-02-21 EP EP07290219A patent/EP1830349B1/fr not_active Not-in-force
- 2007-02-21 AT AT07290219T patent/ATE535905T1/de active
- 2007-02-26 US US11/710,613 patent/US7953596B2/en active Active
- 2007-02-27 WO PCT/FR2007/000347 patent/WO2007099222A1/fr not_active Ceased
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4658426A (en) * | 1985-10-10 | 1987-04-14 | Harold Antin | Adaptive noise suppressor |
| US5742694A (en) * | 1996-07-12 | 1998-04-21 | Eatwell; Graham P. | Noise reduction filter |
Non-Patent Citations (2)
| Title |
|---|
| COHEN I ET AL: "Speech enhancement based on a microphone array and log-spectral amplitude estimation", ELECTRICAL AND ELECTRONICS ENGINEERS IN ISRAEL, 2002. THE 22ND CONVENTION OF DEC. 1, 2002, PISCATAWAY, NJ, USA,IEEE, 2002, pages 4 - 6, XP010631024, ISBN: 0-7803-7693-5 * |
| COHEN I ET AL: "Two-channel signal detection and speech enhancement based on the transient beam-to-reference ratio", 2003 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH, AND SIGNAL PROCESSING. PROCEEDINGS. (ICASSP). HONG KONG, APRIL 6 - 10, 2003, IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH, AND SIGNAL PROCESSING (ICASSP), NEW YORK, NY : IEEE, US, vol. VOL. 1 OF 6, 6 April 2003 (2003-04-06), pages V233 - V236, XP010639251, ISBN: 0-7803-7663-3 * |
Also Published As
| Publication number | Publication date |
|---|---|
| FR2898209B1 (fr) | 2008-12-12 |
| US20070276660A1 (en) | 2007-11-29 |
| ATE535905T1 (de) | 2011-12-15 |
| US7953596B2 (en) | 2011-05-31 |
| ES2378482T3 (es) | 2012-04-13 |
| EP1830349B1 (fr) | 2011-11-30 |
| WO2007099222A1 (fr) | 2007-09-07 |
| EP1830349A1 (fr) | 2007-09-05 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP1830349B1 (fr) | Procédé de débruitage d'un signal audio | |
| EP2057835B1 (fr) | Procédé de réduction de l'écho acoustique résiduel après suppression d'écho dans un dispositif "mains libres" | |
| EP1789956B1 (fr) | Procede de traitement d'un signal sonore bruite et dispositif pour la mise en oeuvre du procede | |
| EP2309499B1 (fr) | Procédé de filtrage optimisé des bruits non stationnaires captés par un dispositif audio multi-microphone, notamment un dispositif téléphonique "mains libres" pour véhicule automobile | |
| EP2538409B1 (fr) | Procédé de débruitage pour équipement audio multi-microphones, notamment pour un système de téléphonie "mains libres" | |
| EP2772916B1 (fr) | Procédé de débruitage d'un signal audio par un algorithme à gain spectral variable à dureté modulable dynamiquement | |
| EP0767569B1 (fr) | Procédé et dispositif d'identification adaptative et annuleur d'écho adaptatif s'y rapportant | |
| EP2131357A1 (fr) | Système de contrôle automatique du gain appliqué à un signal audio en fonction du bruit ambiant | |
| FR2948484A1 (fr) | Procede de filtrage des bruits lateraux non-stationnaires pour un dispositif audio multi-microphone, notamment un dispositif telephonique "mains libres" pour vehicule automobile | |
| FR2831717A1 (fr) | Methode et systeme d'elimination d'interference pour antenne multicapteur | |
| EP0666655B1 (fr) | Procédé et dispositif d'analyse d'un signal de retour et annuleur d'écho adaptatif en comportant application | |
| FR3012928A1 (fr) | Modificateurs reposant sur un snr estime exterieurement pour des calculs internes de mmse | |
| CA2779157A1 (fr) | Procede et dispositif d'annulation d'echo acoustique par tatouage audio | |
| FR3012929A1 (fr) | Modificateur de la presence de probabilite de la parole perfectionnant les performances de suppression du bruit reposant sur le log-mmse | |
| EP1940139B1 (fr) | Commande de filtres d'annulation d'écho | |
| WO2016038316A1 (fr) | Discrimination et atténuation de pré-échos dans un signal audionumérique | |
| EP3627510A1 (fr) | Filtrage d'un signal sonore acquis par un systeme de reconnaissance vocale | |
| FR3012927A1 (fr) | Estimation precise du rapport signal a bruit par progression reposant sur une probabilite de la presence de la parole mmse | |
| KR20110024969A (ko) | 음성신호에서 통계적 모델을 이용한 잡음 제거 장치 및 방법 | |
| FR2906070A1 (fr) | Reduction de bruit multi-reference pour des applications vocales en environnement automobile | |
| EP2078301A1 (fr) | Reduction de bruit et de distorsion dans une structure de type forward | |
| FR2767941A1 (fr) | Suppresseur d'echo par transformation de sens et procede associe | |
| FR2906071A1 (fr) | Reduction de bruit multibande avec une reference de bruit non acoustique | |
| WO2010029247A1 (fr) | Annulation de bruit a faible distorsion | |
| Kim et al. | Improved noise reduction with packet loss recovery based on post-filtering over IP networks |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| ST | Notification of lapse |
Effective date: 20131129 |