BRPI0612668A2 - fala multisensorial usando um modelo de estado de fala - Google Patents

fala multisensorial usando um modelo de estado de fala Download PDF

Info

Publication number
BRPI0612668A2
BRPI0612668A2 BRPI0612668-5A BRPI0612668A BRPI0612668A2 BR PI0612668 A2 BRPI0612668 A2 BR PI0612668A2 BR PI0612668 A BRPI0612668 A BR PI0612668A BR PI0612668 A2 BRPI0612668 A2 BR PI0612668A2
Authority
BR
Brazil
Prior art keywords
speech
signal
value
noise
probability
Prior art date
Application number
BRPI0612668-5A
Other languages
English (en)
Inventor
Zhengyou Zhang
Zicheng Liu
Alejandro Acero
Amarnag Subramanya
James G Droppo
Original Assignee
Microsoft Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Microsoft Corp filed Critical Microsoft Corp
Publication of BRPI0612668A2 publication Critical patent/BRPI0612668A2/pt

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/20Speech recognition techniques specially adapted for robustness in adverse environments, e.g. in noise, of stress induced speech
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise
    • G10L2021/02161Number of inputs available containing the signal or the noise to be suppressed
    • G10L2021/02165Two microphones, one receiving mainly the noise signal and the other one mainly the speech signal

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Magnetic Resonance Imaging Apparatus (AREA)
  • Electrophonic Musical Instruments (AREA)
  • Telephone Function (AREA)
  • Machine Translation (AREA)

Abstract

FALA MULTISENSORIAL USANDO UM MODELO DE ESTADO DE FALA Trata-se de um método e aparelho para determinar uma probabilidade de estado de fala baseado num sinal de sensor alternativo e num sinal de microfone de condução por via aérea. A probabilidade de estado de fala é usada, em conjunto com o sinal de sensor alternativo e o sinal de microfone de condução aérea, para estimar um valor de fala exato para um sinal de fala claro.

Description

"FALA MULTISENSORIAL USANDO UM MODELO DE ESTADO DE FALA"
ANTECEDENTES
Um problema comum no reconhecimento da fala e natransmissão da fala é a corrupção do sinal da fala por ruidoagregado. Em especial, a corrupção devido à fala de outroorador o que está provado ser de difícil detecção e/ou cor-reção.
Recentemente, alguns sistemas foram desenvolvidospara tentar remover o ruído através do uso de uma combinaçãode sensores alternativos, tal como microfone de condução ós-sea e microfone de condução aérea. Várias técnicas foram de-senvolvidas que usam sensores de sinal alternativos e o si-nal do microfone de condução aérea para formar um sinal defala aperfeiçoado que tem menos ruído que o sinal do micro-fone de condução por via aérea. No entanto, não se alcançoua fala perfeita e necessita-se de avanços adicionais na for-mação de sinais de fala aperfeiçoados.
SUMÁRIO
Um método e aparelho determinam as probabilidadesde uma expressão de fala baseado num sensor de sinal alter-nativo e um sinal de microfone de condução aérea. A probabi-lidade da expressão de fala é usada para estimar um valor defala exato para um sinal de fala claro.
BREVE DESCRIÇÃO DOS DESENHOS
A Figura 1 é um diagrama em blocos de um ambientede computação, no qual a modalidade da presente invenção po-de ser experimentada.A Figura 2 é um diagrama em blocos de um ambientede computação alternativo, no qual modalidades da presenteinvenção podem ser experimentadas.
A Figura 3 é um diagrama em blocos de um sistemageral de processamento da fala da presente invenção.
A Figura 4 é um diagrama em blocos de um sistemapara aperfeiçoar a fala, de acordo com uma modalidade dapresente invenção.
A Figura 5 é um modelo, no qual o aperfeiçoamentoda fala se baseia em uma modalidade da presente invenção.
A Figura 6 é um fluxograma para aperfeiçoar a fa-la, de acordo com uma modalidade da presente invenção.
DESCRIÇÃO DETALHADA DAS MODALIDADES ILUSTRATIVAS
A Figura 1 ilustra um exemplo de um ambiente decomputação 100 adequado, no qual pode-se implementar as mo-dalidades da invenção. O ambiente de computação 100 é apenasum exemplo do ambiente de computação adequado e não pretendesugerir quaisquer limitações no escopo do uso ou da funcio-nalidade da invenção. Também não se pretende que o ambientede computação 100 seja interpretado como dependente ou quepossua requerimento relativo a qualquer componente ou umacombinação deles ilustrados no ambiente operacional 100 e-xemplificativo.
As modalidades da invenção são operacionais cominúmeros outros ambientes de sistemas de computação de pro-pósitos gerais ou específicos ou configurações. Exemplos desistemas de computação, ambientes e/ou configurações bem co-nhecidos que podem ser adequados para usar com as modalida-des da invenção incluem, mas não se limitam, a computadorespessoais, servidores, dispositivos manuais ou para laptops,sistemas multiprocessadores, sistemas baseados em micropro-cessadores, conversores, produtos eletrônicos programáveispara consumo, redes de computadores, minicomputadores, com-putadores de grande porte, sistemas de telefonia, ambientesde computação distribuídos que podem incluir qualquer um dossistemas ou dispositivos acima descritos e similares.
As modalidades da invenção podem ser descritas nocontexto geral de instruções executáveis por computador, talcomo módulos de programa, que são executados por um computa-dor. Em geral, módulos de programa, incluem rotinas, progra-mas, objetos, componentes, estruturas de dados, etc., quedesempenham tarefas específicas ou implementam tipos de re-sumos de dados específicos. A invenção está projetada paraser experimentada em ambiente de computação distribuída ondeas tarefas são desempenhadas por dispositivos de processa-mento remotos interconectados à uma rede de comunicações. Emum ambiente de computação distribuída, os módulos de progra-ma estão localizados tanto em meios de computador de armaze-namento local como de armazenamento remoto, incluindo dispositivos de memória de armazenamento.
Com referência à Figura 1, o sistema exemplifica-tivo para implementar a invenção inclui um dispositivo decomputação de propósitos gerais na forma de um computador110. Os componentes do computador 110 podem incluir, mas nãose limitam, a uma unidade processadora 120, um sistema dememória 130, e um sistema de barramento 121 que acopla vá-rios componentes do sistema que inclui o sistema de memóriaà unidade processadora 120. O sistema de barramento 121 podeser um dos diversos tipos de estruturas de barramento queinclui o barramento de memória ou um controlador de memória,um barramento periférico, e um barramento local usando umadas várias arquiteturas de barramento. À titulo de exemplo,e não à limitações, tais arquiteturas incluem barramentoISA, barramento MCA, barramento EISA, barramento local VESAe barramento PCI, também conhecido como barramento Mezanino.
0 computador 110 geralmente inclui uma variedadede mídias legíveis por computador. Mídias legíveis por com-putador pode ser qualquer mídia disponível que possa ser a-cessada pelo computador 110 e inclui tanto a mídia volátilcomo a mídia não-volátil, mídia removível como não-removível. A titulo de exemplo, e não limitado a, mídia le-gível por computador pode compreender mídia de armazenamentoe mídia de comunicação. A mídia de armazenamento de computa-dor inclui tanto mídia volátil como não-volátil, mídia remo-vível como não-removível implementada com qualquer método outecnologia para armazenar informação tal como instruções le-gíveis por computador, estrutura de dados, módulos de pro-grama ou outros dados. Mídias de armazenamento por computa-dor incluem, mas não estão limitadas a, RAM, ROM, EEPROM,memória flash ou outra tecnologia de memória, CD-ROM, discosversáteis digitais (DVD) ou outros discos óticos de armaze-namento, cartuchos magnéticos, fitas magnéticas, discos dearmazenamento magnéticos, ou outros dispositivos magnéticosde armazenamento, ou quaisquer outros meios que possam serusados para armazenar a informação desejada e que possa seracessada pelo computador 110. A mídia de comunicação, em ge-ral, contempla instruções legíveis por computador, estrutu-ras de dados, módulos de programa ou outros dados em sinalmodulado tal como onda portadora ou outro mecanismo detransporte e inclui qualquer mídia de entrega de informação.O termo "sinal modulado de dados" significa um sinal que temuma ou mais de suas características dispostas ou alteradasde tal maneira que codifica a informação no sinal. À títulode exemplo, e não limitado a, mídia de comunicação incluimídia via cabo tal como rede via cabo ou conexão direta viacabo, e mídia sem fio tal como acústica, RF, infravermelha,e outras mídias sem fio. Combinações de qualquer uma das mí-dias antes citadas podem ser incluídas dentro do escopo dasmídias legíveis por computador.
O sistema de memória 130 inclui mídia de armazena-mento de computador na forma de memória volátil e/ou não-volátil- tal como memória somente para leitura (ROM) 131 ememória de acesso aleatório (RAM) 132. Um sistema básico deentrada/saída 133 (BIOS), contendo as rotinas básicas queajudam a transferir a informação entre os elementos dentrodo computador 110, tal como durante a inicialização, é ge-ralmente armazenada na memória ROM 131. A memória RAM 132geralmente contém dados e/ou módulos de programa que são a-cessíveis imediatamente e/ou que estão sendo operados pelaunidade processadora 120. À titulo de exemplo, e não limi-tando, a Figura 1 ilustra o sistema operacional 134, progra-mas aplicativos 135, outros módulos de programa 136 e dadosde programa 137.
O computador 110 pode incluir outras mídias de ar-mazenamento por computador removíveis e não-removíveis, vo-láteis e não-voláteis. À titulo de exemplo somente, a FIGURA1 ilustra uma unidade de disco rígido 141 que lê de ou es-creve em mídia magnética não-removível e não-volátil, umaunidade magnética de disco 151 que lê de e escreve em discomagnético removível e não-volátil 152, e uma unidade de dis-co ótico 155 que lê de e escreve em disco ótico removível enão-volátil 156 tal como CD-ROM ou outra mídia ótica. Outrasmídias de armazenamento por computador removíveis/não-removíveis e voláteis/não-voláteis que podem ser usadas noambiente operacional exemplar incluem, mas não limitadas a,cartuchos de fitas magnéticas, cartões de memória flash,discos versáteis digitais, fitas de vídeo digitais, RAM emestado sólido, ROM em estado sólido e similares. A unidadede disco rígido 141 está geralmente conectada ao sistema debarramento 121 através de uma memória removível de interfacetal como a interface 140, e a unidade de disco magnético 151e a unidade de disco ótico 155 estão geralmente conectadasao sistema de barramento 121 por uma memória removível deinterface, tal como a interface 150.
As unidades e as mídias de armazenamento por com-putador associadas, descritas acima e ilustradas na FIGURA1, propiciam o armazenamento das instruções legíveis porcomputador, estruturas de dados, módulos de programa e ou-tros dados para o computador 110. Na FIGURA 1, por exemplo,a unidade de disco rígido 141 é ilustrada armazenando o sis-tema operacional 144, programas aplicativos 145, outros mó-dulos de programa 146, e dados de programa 147. Observe-seque estes componentes podem ser iguais ou diferentes que osistema operacional 134, programas aplicativos 135, outrosmódulos de programa 136 e dados de programa 137. 0 sistemaoperacional 144, programas aplicativos 145, outros módulosde programa 146, e dados de programa 147 estão denominadospor diferentes referências numéricas para ilustrar que, aomenos, são cópias diferentes.
O usuário pode entrar com comandos e informaçõesno computador 110 através de dispositivos de entrada tal co-mo o teclado 162, o microfone 163, e um dispositivo de dire-ção do cursor 161, tal como o mouse, esfera móvel ou almofa-da de toque. Outros dispositivos de entrada (não mostrados)podem incluir um dispositivo de controle manual, controle dejogos, antena parabólica, scanner ou similares. Estes e ou-tros dispositivos de entrada estão freqüentemente conectadosà unidade processamento 120 através da interface de entradade usuário 160 que está acoplada ao sistema de barramento,mas que pode estar conectada por outras interfaces e estru-turas de barramento, tal como porta paralela, porta de jogosou um barramento serial universal (USB) . O monitor 191 ououtro tipo de dispositivo de exibição também está conectadoao sistema de barramento 121 via uma interface, tal como ainterface de vídeo 190. Além do monitor, computadores podemincluir outros dispositivos periféricos de saída tal comoalto-falante 197 e impressora 196, que podem estar conecta-dos através de uma interface periférica de saida.
O computador 110 é operado num ambiente de redeusando conexões lógicas a um ou mais computadores remotos,tal como o computador remoto 180. O computador remoto 18 0pode ser um computador pessoal, um dispositivo manual, umservidor, um roteador, um computador em rede, um dispositivoponto a ponto, ou outro ponto de conexão de rede, e geral-mente incluem vários ou todos os elementos descritos acimarelativos ao computador 110. As conexões lógicas descritasna FIGURA 1 incluem uma rede de área local (LAN) 171 e umarede de área distante (WAN) 173, mas também pode incluir ou-tras redes. Tais ambientes de rede são comuns em escritó-rios, redes corporativas, intranets e internet.
Quando usado numa rede LAN, o computador 110 é co-nectado à rede LAN 171 através de uma interface de rede ouadaptador 170. Quando usado num ambiente WAN, o computador110 geralmente inclui um modem 172 ou outros meios para es-tabelecer comunicação na rede WAN 173, tal como a Internet.O modem 172, que pode ser interno ou externo, pode ser co-nectado ao sistema de barramento 121 via interface de entra-da de usuário 160, ou outro mecanismo apropriado. Num ambi-ente de rede, módulos de programa descritos relativos aocomputador 110, ou partes deles, podem ser armazenados nodispositivo de memória de armazenamento remoto. A titulo deexemplo, e sem limitação, a Figura 1 ilustra os programasaplicativos remotos 185 residentes num computador remoto180. Deverá ser observado que as conexões de rede ilustradassão exemplares e outros meios de estabelecer enlaces de co-municações entre computadores podem ser usados.
A Figura 2 é um diagrama em blocos de um disposi-tivo móvel 200, que é um ambiente de computação exemplar. 0dispositivo móvel 200 inclui microprocessador 202, memória204, componentes de entrada/saida (1/0) 206, e uma interfacede comunicações 208 para comunicar-se com computadores remo-tos ou outros dispositivos móveis. Numa modalidade, os com-ponentes anteriormente mencionados estão interconectados a-través de um barramento 210 adequado.
A memória 204 é implementada como memória eletrô-nica não-volátil . tal como a memória de acesso aleatório(RAM) com módulo de bateria de apoio (não mostrada) de talforma que a informação armazenada na memória 204 não se per-ca quando a energia do dispositivo móvel 200 é desligada.Uma parte da memória 204 disponível é preferencialmente di-recionada à execução de programas, enquanto que outra parteda memória 204 é preferencialmente usada para armazenamento,tal como a simulação do armazenamento numa unidade de discorígido.
A memória 204 inclui um sistema operacional 212,programas aplicativos 214 bem como um local de armazenamento216. Durante a operação o sistema operacional 212 é prefe-rencialmente executado a partir da memória 204 pelo proces-sador 202. 0 sistema operacional 212, numa modalidade prefe-rida, Windows CE, é o sistema operacional disponível da Mi-crosoft Corporation. O sistema operacional 212 é preferenci-almente projetado para dispositivos móveis, e implementa umabase de dados com características que podem ser utilizadaspelos aplicativos 214, através de um conjunto de interfacesde programas aplicativos e métodos. Os objetos no local dearmazenamento 216 são mantidos pelos aplicativos 214 e pelosistema operacional 212, ao menos parcialmente, em respostaàs interfaces de programas aplicativos e métodos.
A interface de comunicações 208 representa numero-sos dispositivos e tecnologias que permitem ao dispositivomóvel 200 enviar e receber as informações. Os dispositivosincluem modems com e sem fio, receptores por satélite e sin-tonizadores de radiodifusão apenas para mencionar alguns. Odispositivo móvel 200 pode estar diretamente conectado a umcomputador para trocar dados com ele. Em tais casos, a in-terface de comunicações 208 pode ser um transceptor infra-vermelho ou uma conexão de comunicações serial ou paralela,todas as quais são capazes de transmitir pacotes de informação.
Os componentes de entrada/saída 206 incluem umavariedade de dispositivos, tal como tela sensível ao toque,botões, roletes, e microfone bem como uma variedade de dis-positivos de saída incluindo um gerador de áudio, um dispo-sitivo de vibração e uma tela. Os dispositivos listados aci-ma são a titulo de exemplo e não necessitam estar presentesno dispositivo móvel 200. Ademais, outros dispositivos deentrada/saída podem ser conectados ou encontrados no dispo-sitivo móvel 200 dentro do escopo da presente invenção.
A Figura 3 apresenta um diagrama em blocos básicodas modalidades da presente invenção. Na FIGURA 3, um Iocu-tor 300 gera um sinal de fala 302 (X) que é detectado por ummicrofone de condução aérea 304 e por um sensor alternativo306. Exemplos de sensores alternativos incluem um microfonede garganta que mede as vibrações da garganta do usuário, umsensor por via óssea que é localizado em ou adjacente à for-mação óssea facial ou osso craniano do usuário (tal como oosso mandibular) ou no ouvido do usuário e que sente as vi-brações da formação óssea facial ou dos ossos cranianos dousuário que correspondem à fala gerada pelo usuário. 0 mi-crofone de condução aérea 304 é o tipo de microfone usadocomumente para converter ondas de áudio em sinais elétricos.
O microfone de condução aérea 304 recebe o ruidoambiente 308 (V) gerado por uma ou mais fontes de ruido 310e gera seu próprio sensor de ruido 305 (U) . Dependendo dotipo de ruido ambiente e do nivel do ruido ambiente, o ruidoambiente 308 pode ser detectado por um sensor alternativo306. No entanto, sob as modalidades da presente invenção, osensor alternativo 306 é menos sensível ao ruído ambienteque o microfone de condução aérea 304. Assim, o sinal dosensor alternativo 316 (B) gerado pelo sensor alternativo306 geralmente inclui menos ruído que o sinal do microfone318 (Y) gerado pelo microfone de condução aérea 304. Apesardo sensor alternativo 306 ser menos sensível ao ruído ambi-ente, gera algum ruído do sensor 320 (W).
A rota desde o alto falante 300 ao sinal do sensoralternativo 316 pode ser modelado como um canal tendo umaresposta de canal Η. A rota desde o ruído ambiente 308 aosinal do sensor alternativo 316 pode ser modelado como umcanal tendo um resposta de canal G.
0 sinal do sensor alternativo 316 (B) e o sinal domicrofone de condução aérea 318 (Y) são obtidos num avalia-dor de sinal limpo 322, que estima o sinal limpo 324. 0 si-nal limpo estimado 324 determina um processo de fala 328. 0sinal limpo estimado 324 tanto pode ser um sinal de domíniode tempo ou um vetor de transformação Fourier. Se o sinallimpo estimado 324 é um sinal de domínio de tempo, o proces-so de fala 328 pode adotar a forma de um ouvinte, um sistemade codificação de fala ou um sistema de reconhecimento defala. Se o sinal limpo estimado 324 é um vetor de transfor-mação Fourier, o processo de fala 328 será geralmente umsistema de reconhecimento de fala, ou conterá uma transfor-mação inversa de Fourier para converter o vetor de transfor-mação de Fourier em forma de onda.
Dentro do avaliador de sinal limpo 322, o sinal desensor alternativo 316 e o sinal de microfone 318 são con-vertidos em domínio de freqüências sendo usadas para estimara fala claro. Como mostrado na FIGURA 4, o sinal de sensoralternativo 316 e o sinal de microfone de condução aérea 318são obtidos em conversores analógico-digitais 404 e 414,respectivamente, para gerar uma seqüência de valores digi-tais, agrupados dentro de amostras de valores pelas amostra-gens 406 e 416 respectivamente. Numa modalidade, os conver-sores 404 e 414 de A a D simulam sinais analógicos de 16 kHze 16 bits por amostra, conseqüentemente criando dados de fa-la de 32 kilobytes por segundo e as amostragens 406 e 416criam uma nova amostra respectiva a cada 10 mili-segundosque incluem um valor de 20 mili-segundos de dados.
Cada amostra respectiva de dados obtida das amos-tragens 406 e 416 é convertida no domínio de freqüência u-sando a transformação rápida de Fourier (FFT) 408 e 418,respectivamente.
Os valores de domínio de freqüências para o sinalde sensor alternativo e sinal de microfone de condução aéreasão obtidos num avaliador de sinal 420, que usa os valoresde domínio de freqüências para estimar o sinal de fala limpo 324.
Em algumas modalidades, o sinal de fala claro 324é convertido de volta para domínio de tempo usando a trans-formação rápida de Fourier inversa (IFFT) 422. Isto cria umaversão tempo de domínio do sinal de fala limpo 324.
A presente invenção utiliza um modelo do sistemada Figura 3 que inclui estados de fala para a fala claro demaneira a produzir um sinal de fala aperfeiçoado. A Figura 5apresenta uma representação gráfica do citado modelo.
No modelo da Figura 5, a fala claro 500 é depen-dente de um estado de fala 502. 0 sinal de microfone de con-dução aérea 504 é dependente do sinal de sensor de ruído506, do ruído ambiente 508 e do sinal de fala claro 500. 0sinal de sensor 510 é dependente do sensor de ruído 512 e dosinal de fala claro 500 quando passa através de um canal deresposta 514 e do ruído ambiente 508 quando passa através deum canal de resposta 516.O modelo da Figura 5 é usado na presente invençãopara estimar um sinal de fala claro Xt de observações de ru-ídos Yt e Bt e identifica a probabilidade de uma variedade deestados de fala St.
Numa modalidade da presente invenção, o sinal defala claro estimado e a probabilidade dos estados para o si-nal de fala claro estimado são formados primeiro assumindouma distribuição Gaussianica para os componentes de ruído nomodelo do sistema. Assim:
<formula>formula see original document page 15</formula>
onde cada componente de ruído é modelado como media zeroGaussianica tendo as variâncias respectivas g2o~2v, o~2w e o~2W, V é o ruído ambiente, U é o ruído do sensor no microfonede condução por via aérea, e W é o ruído do sensor no sensoralternativo. Na EQ. 1, g é um parâmetro de sintonia quepermite variâncias de ruído ambiente a ser sintonizado.
Ademais, esta modalidade da presente invenção mo-dela a probabilidade do sinal limpo de fala dado um estadocomo media zero Gaussianico com uma variância o~2s tal que:
<formula>formula see original document page 15</formula>
Numa modalidade da presente invenção, a probabili-dade prévia de um dado estado é assumida como ser uma proba- bilidade uniforme de tal maneira que todos os estados sãoigualmente prováveis. Especificamente, a probabilidade pré-via é:
<formula>formula see original document page 16</formula>
onde Ns é o numero de estados de fala disponíveis no modelo.
Na descrição das equações abaixo para determinar aestimativa do sinal limpo de fala e a probabilidade dos es-tados de fala, todas as variâncias são modeladas no complexodomínio espectral. Cada componente de freqüência (Bem) étratado independentemente dos outros componentes de freqüên-cia. Para facilitar a observação, o método descrito a seguiré para um único componente de freqüência. Os conhecedores datécnica reconhecerão que as computações são desempenhadaspara cada componente de freqüência na versão espectral dossinais de entrada. Para variâncias que modificam com o tem-po, um t subscrito é adicionado à variância.
Para estimar o sinal de fala limpo Xt das observa-ções de ruído Yt e Bt, a presente invenção maximiza a proba-bilidade p(XtiYt,Bt), que é a probabilidade do sinal de falalimpo dado o sinal de ruído do microfone de condução aéreae o sinal de ruído do sensor alternativo. Uma vez que a es-timativa do sinal de fala limpo depende do estado de fala Stno modelo, esta probabilidade condicional é determinada como:
<formula>formula see original document page 16</formula>onde (S) se estabelece que o conjunto dos estados de fala,^^^^^^^ é a probabilidade de Xt dadas as observações deruido correntes e o estado de fala s, e ^^^^^^^ é a proba-bilidade do estado de fala s dadas as observações de ruido.
Qualquer número de estados de fala possíveis pode ser usadona presente invenção, incluindo estados de fala para sons devoz, fricativos, sons nasais e sons de vogais. Em algumasmodalidades, um estado de fala separado é fornecido para ca-da um das unidades fonéticas, tal como fonemas. Numa modali-dade, no entanto, somente dois estados de fala são forneci-dos, um para fala e outro para não-fala.
Em algumas modalidades, um único estado é usadopara todos os componentes de freqüência. Assim sendo, cadaamostragem tem uma única variância de estado de fala.
Os termos ao lado direito da EQ. 6 podem ser cal-culados como:
<formula>formula see original document page 17</formula>
o que indica que a probabilidade condicional dosinal de fala limpo dadas as observações pode ser estimadopela probabilidade conjunta do sinal de fala limpo, as ob-servações o estado e que as probabilidades condicionais doestado dadas as observações possam ser aproximadas pela in-tegração da probabilidade conjunta do sinal de fala limpo asobservações e o estado sobre todos os valores de fala claropossíveis.Ao usar as hipóteses das distribuições Gaussiani-cas para ruídos, descritas acima nas equações 1-3, a proba-bilidade conjunta do sinal de fala limpo, as observações e oestado podem ser computados como:
<formula>formula see original document page 18</formula>
onde Wa probabilidade préviado estado o qual é dado pela probabilidade uniforme da dis-tribuição na EQ. 5, G é o canal resposta do sensor alterna-tivo ao ruído ambiente, H é o canal resposta do sinal desensor alternativo ao sinal de fala limpo, e termos comple-xos entre barras verticais tal como, I^l , indicam a magnitu-de do valor complexo.
0 canal resposta do sensor alternativo G para falade fundo é estimado dos sinais do microfone via aérea Y e dosensor alternativo B através da amostragem na qual o usuárionão está falando. Especificamente, G é determinada como:
<formula>formula see original document page 18</formula>
onde D é o numero de amostragens em que o usuário não estáfalando, mas onde há fala de fundo. Aqui, assumimos que G éconstante através de todas as amostragens de tempo D. Em ou-tras modalidades, em vez de usar todas as amostragens D i-gualmente, usamos a técnica conhecida como "envelhecimentoexponencial" de forma que as últimas amostragens contribuemmais para a estimativa de G do que as amostragens mais antigas.
0 canal de resposta H do sensor alternativo para osinal de fala limpo é estimado dos sinais de microfone devia aérea Y e do sensor alternativo B através das últimasamostragens T nas quais o usuário está falando. Especifica-mente, H é determinado como:
<formula>formula see original document page 19</formula>
onde T é o numero de amostragens nas quais o usuá-rio está falando. Aqui, assumimos que H é constante atravésde todas as amostragens de tempo T. Em outra modalidades, emvez de usar todas as amostragens T igualmente, usamos a téc-nica conhecida como "envelhecimento exponencial" de tal for-ma que as últimas amostragens contribuem mais para a estima-tiva de H do que as amostragens mais antigas.
A probabilidade condicional do estadocomputada usando a aproximação da EQ. 8 e o conjunto de cal-culo de probabilidades da EQ. 9 como:<formula>formula see original document page 20</formula>
que pode ser simplificada como:
<formula>formula see original document page 20</formula>
Olhando de perto, a EQ. 13 revela que o primeirotermo é de alguma maneira o modelo da correlação entre o ca-nal de sensor alternativo e o canal de microfone via aéreaonde o segundo termo usa o modelo de estado e o modelo deruido para explicar a observação no canal de microfone viaaérea. O terceiro termo é simplesmente o estado prévio, quenuma modalidade é uma distribuição uniforme.
A probabilidade do estado dada a observação compu-tada na EQ. 13 tem duas aplicações possíveis. Primeiro, podeser usada para estruturar um classificador de estado de fa-la, o qual pode ser usado para classificar as observaçõescomo incluir fala ou não, de tal forma que as variações dasfontes de ruído possam ser determinadas a partir das amos-tragens que não incluem fala. Também pode ser usado para a-tribuir um peso mais "suave" quando estimar o sinal de falaclaro, como mostrado a seguir.
Como observado acima, cada uma das variâncias nasequações acima é definida para um componente de freqüênciaespecifico no complexo domínio espectral, Assim, a probabi-lidade da EQ. 13 é para um estado associado com um componen-te de freqüência especifica. No entanto, uma vez que há so-mente uma;única variância para cada amostragem, a probabili-dade de um estado para a amostragem é formada agregando aprobabilidade através dos componentes de freqüências comosegue:
<formula>formula see original document page 21</formula>
onde é a probabilidade para ocomponente de freqüência f como definido na EQ. 13. 0 produ-to é determinado para todos os componentes de freqüência ex-ceto para as freqüências DC e Nyquist. Note-se que se a com-putação da probabilidade é levada adiante no domínio Iog-probabilidade, então o produto na equação acima é substituí-do por uma soma.
A probabilidade acima pode ser usada para estrutu-rar um classificador fala/não-fala, baseado na prova de taxade probabilidade tal que:
<formula>formula see original document page 21</formula>
onde a amostragem é considerada tendo fala se ataxa r é maior que 0, fora isso é considerado que não contémfala.
Usando as probabilidades dos estados de fala, umaestimativa do sinal de fala claro pode ser formado. Numa mo-dalidade, a estimativa é formada usando uma estimativa mediamínima ao quadrado (MMSE) baseada na EQ. 6 acima, tal que:
<formula>formula see original document page 22</formula>
onde e a expectativa do sinal de fala ^^^^limpo dada a observação, e é a expectativa dosinal de fala limpo dadas as observações e o estado de fala.
Usando as equações 7 e 9, a probabilidade condi-cional ^^^^^^^ da qual a expectativa podeser calculada é determinada como:
<formula>formula see original document page 22</formula>
EQ. 17
Isto produz a expectativa de:
<formula>formula see original document page 22</formula>
onde:
<formula>formula see original document page 22</formula>
e M* é a conjugação complexa de M.Assim, a estimativa MMSE do sinal de fala limpo Xté dada por:
<formula>formula see original document page 23</formula>
onde, tts, é no estado posterior e é dado por:
<formula>formula see original document page 23</formula>
onde L(St=s) é dada pela EQ. 14. Assim,, a estima-tiva do sinal de fala limpo em parte é baseado na probabili-dade relativa de um estado de fala especifico e esta proba-bilidade atribui um peso suave para a estimativa do sinal defala limpo.
No cálculo acima, H foi assumido que é conhecidocom bastante precisão. No entanto, na prática, H é conhecidosomente com precisão limitada. Numa modalidade adicional dapresente invenção, H é modelado como variância aleatóriaGaussianica ^wjsw***). Em tal modalidade, todos os cálculosacima são marginalizados para todos os valores possíveis deH. No entanto, isto torna a matemática intratável. Numa mo-dalidade, um processo interativo é usado para superar essaintratabilidade. Durante cada interação, H é substituído nasequações 13 e 20 por H<1 e é substituído por ondeé uma estimativa do sinal de fala limpo determinado poruma interação prévia. 0 sinal de fala claro então é determi-nado usando a EQ. 21. Esta nova estimativa do sinal de falaclaro é estabelecida como o novo valor de x* então a novainteração é executada. As interações terminam quando a esti-mativa do sinal de fala limpo fica estável.
A Figura 6 fornece um método para estimar o sinalde fala limpo usando as equações acima. Na etapa 600, amos-tragens de entrada de expressão são identificadas quando ousuário não está falando. Essas amostragens então são usadaspara determinar a variância para o ruído ambiente *' , a va-riância para o ruído do sensor alternativo σ"' , e a variân-cia para o ruído do microfone de condução aérea σ* * .
Para identificar amostragens onde o usuário nãoestá falando, o sinal do sensor alternativo pode ser exami-nado. Uma vez que o sinal de sensor alternativo produzirávalores de sinal muito menores para fala de fundo do que pa-ra ruído, quando a potência do sinal de sensor alternativoestiver baixa, inicialmente pode-se assumir que o locutornão está falando. Os valores dos sinais de microfone de con-dução aérea e dos sinais de sensor alternativo para amostra-gens que não contém fala são armazenados numa memória tempo-rária e são usados para computar variâncias de ruídos como:
<formula>formula see original document page 24</formula>
onde Nv é o número de amostragens de ruídos na expressão queestão sendo usadas para formar as variâncias, V é o conjuntode amostragens de ruídos onde o usuário não está falando, ese refere ao sinal de sensor alternativo depois de consi-derada a dispersão, que é calculado como:<formula>formula see original document page 25</formula>
que em algumas modalidades é calculado alternati-vamente como:
<formula>formula see original document page 25</formula>
Em algumas modalidades, a técnica para identificaramostragens de não-fala baseadas em niveis de potência bai-xos nos sinais de sensor alternativo somente são executadosdurante as amostragens de treinamento inicial. Após a forma-ção de valores iniciais para as variáveis de ruídos, podemser usadas para determinar quais amostragens contém fala equais amostragens não contêm fala usando a taxa de probabi-lidade da EQ. 15.
O valor de g, que é um parâmetro de sintonia quepode ser usado para aumentar ou diminuir a variância estima-da o2, é ajustado em 1 numa modalidade específica. Isto su-gere completa confiança no procedimento de estimativa de ru-ídos. Valores diferentes de g podem ser usados em diferentesmodalidades da presente invenção.
A variância de ruído para o microfone por via aé-rea, βα, é estimada baseado na observação de que o microfonede condução aérea é menos propenso a ruído do sensor que osensor alternativo. De tal modo, a variância do microfone decondução aérea pode ser calculada como:
<formula>formula see original document page 25</formula><formula>formula see original document page 26</formula>
onde
<formula>formula see original document page 26</formula>
onde é a estimativa de fala claro da amostragem prece-dente, τ é um fator de atenuação que em algumas modalidadesé ajustado em .2, a controla a extensão da redução de ruídode tal forma que se a>l, mais ruído é reduzido à custa deaumento da distorção de fala, e 73 dá o patamar mínimo de ru-ído e fornece meios para agregar ruído de fundo para masca-rar o ruído musical residual percebido. Em algumas modalida-des, β é ajustada igual a 0.01 para 20 dB de redução de ruí-do em amostragens de ruído puro.
Assim, na EQ. 28, a variância é determinada comouma soma sobrecarregada da estimativa do sinal de fala claroda amostragem precedente e a potência do sinal do microfonede condução aérea filtrado pela supressão de ruído no filtro Ks.
Em algumas modalidades, a é escolhida de acordocom uma taxa de sinal de ruído e o princípio de mascaragem oqual demonstra que a mesmo volume de ruído numa banda de al-ta energia de fala tem um impacto menor na percepção que nu-ma banda de baixa potência de fala e a presença de alta po-tência de fala numa freqüência reduzirá a percepção de ruídonuma banda de freqüência adjacente. Nesta modalidade, a éescolhida como:
<formula>formula see original document page 27</formula>
onde SNR é a taxa de sinal-ruído em decibéis (dB), B é a ta-xa de nível de sinal-ruído desejada acima, cuja redução deruído não deverá ser executada, e ao é o volume de ruído quedeverá ser removido no valor da taxa de sinal-ruído de 0. Emalgumas modalidades, B é ajustada igual a 20 dB.
Usando a definição de taxa de sinal-ruído de:
<formula>formula see original document page 27</formula>
o filtro de supressão de ruído da EQ. 29 se transforma em:
<formula>formula see original document page 27</formula>
Este filtro de supressão de ruído consegue baixasupressão de ruído para taxas positivas de sinal-ruído e al-ta supressão de ruído para taxas negativas de sinal-ruído.
De fato, para taxas suficientemente negativas de sinal-ruído, todos os sinais e ruídos observados são removidos e oúnico sinal presente é o patamar de ruído que é agregado devolta pela seção "fora isso" do filtro de supressão de ruí-dos da EQ. 33.Em algumas modalidades, a0 é de tal forma depen-dente de freqüências que diferentes volumes de ruídos sãoremovidos para freqüências diferentes. Numa modalidade, estadependência de freqüências é formada usando uma interpolaçãolinear entre a0 a 30Hz e ao a 8KHz tal que:
<formula>formula see original document page 28</formula>
onde k é a contagem do componente de freqüência,3omin é o valor de a0 desejado a 30Hz, aomax é o ao desejado a8KHZ e assume-se que há 256 componentes de freqüência.
Depois de determinar a variável da fala na etapa602, as variâncias são usadas para determinar as probabili-dades de cada estado de fala na etapa 604 usando as equações13 e 14 acima. A probabilidade dos estados de fala então éusada na etapa 606 para determinar estimativas de fala claropara a amostragem corrente. Como observado acima, nas moda-lidades em que se usa distribuição Gaussianica para repre-sentar H, as etapas 604 e 606 são repetidas usando a últimaestimativa do sinal de fala limpo em cada repetição e usandoas alterações das equações acima descritas para acomodar omodelo Gaussianico para H.
Embora a presente invenção tenha sido descrita comreferência a modalidades específicas, pessoas com conheci-mento da técnica reconhecerão que alterações podem ser fei-tas na forma e nos detalhes sem afastar-se do espírito e doescopo da invenção.

Claims (13)

1. Método para determinar uma estimativa para umvalor de ruido reduzido representando uma parte de um sinalde fala de ruído reduzido, o método sendo CARACTERIZADO pelofato de compreender:gerar um sinal de sensor alternativo usando umsensor alternativo;gerar um sinal de microfone de condução aérea;usar um sinal de sensor alternativo e o sinal demicrofone de condução aérea para estimar uma probabilidade,L(St) de um estado de fala, St, estimando uma probabilidadeseparada do estado de fala para cada de um conjunto de com-ponentes de freqüência e combinar as probabilidades separa-das para formar a probabilidade do estado de fala; eusar a probabilidade do estado de fala para esti-mar o valor de ruído reduzido, Xt, como:<formula>formula see original document page 29</formula>onde π5 é um posterior no estado e é dado por:<formula>formula see original document page 29</formula>e onde:<formula>formula see original document page 29</formula>onde:<formula>formula see original document page 29</formula>onde Μ* é o conjugado complexo, de M, Xt é um valorcom ruído reduzido, Yt é um valor para um quadro t do sinalde microfone de condução aérea, Bt é um valor para um quadrot do sinal de sensor alternativo, ou2 é uma variância de ru-ido de sensor no microfone de condução aérea, ow2 é uma va-riância de ruído de sensor no sensor alternativo, g2ov2 é avariância de ruído ambiente, G é a resposta de canal do sen-sor alternativo para ruído ambiente, H é a resposta de canaldo sensor alternativo para um sinal de fala limpo, S é oconjunto de todos estados de fala, e os2 é uma variância pa-ra uma distribuição que modela uma probabilidade de um valorde ruído reduzido dado um estado de fala.
2. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreender usar a estima-tiva de probabilidade de um estado de fala para determinarse um quadro do sinal de microfone de condução aérea contémfala.
3. Método, de acordo com a reivindicação 2,CARACTERIZADO adicionalmente por compreender usar um quadrodo sinal de microfone de condução aérea que é determinadopara não conter fala para determinar uma variância para umafonte de ruído e usar a variância para a fonte de ruído paraestimar o valor de ruído reduzido.
4. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreender estimar a vari-ação da distribuição como uma combinação linear de uma esti-mativa de um valor de ruído reduzido para um quadro prece-dente e uma versão filtrada do sinal de microfone de condu-ção aérea para um quadro corrente.
5. Método, de acordo com a reivindicação 4,CARACTERIZADO pelo fato de que a versão filtrada do sinal domicrofone de condução aérea é formada usando um filtro que édependente de freqüência.
6. Método, de acordo com a reivindicação 4,CARACTERIZADO pelo fato de que a versão filtrada do sinal demicrofone de condução aérea é formada usando um filtro que édependente de uma razão de sinal para ruido.
7. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreende executar uma re-petição usando a estimativa de valor de ruido reduzido paraformar uma nova estimativa do valor de ruido reduzido.
8. Midia de armazenamento em computador,CARACTERIZADA pelo fato de possuir instruções executáveispor computador que quando executadas por um processador fa-zem com que o processador execute etapas que compreendem:receber um sinal de sensor alternativo gerado u-sando um sensor alternativo;receber um sinal de microfone de condução aéreagerado usando um microfone de condução aérea;determinar uma probabilidade de um estado de falabaseado em um sinal de sensor alternativo e em um sinal demicrofone de condução aérea estimando uma probabilidade se-parada do estado de fala para cada um de um conjunto de com-ponentes de freqüência e formando um produto das probabili-dades separadas para formar a probabilidade do estado de fala; eusar a probabilidade do estado, de fala para esti-mar um valor de fala limpo.
9. Midia legível por computador, de acordo com areivindicação 8, CARACTERIZADA pelo fato de'usar a probabi-lidade do estado de fala para estimar um valor de fala limpocompreende pesar um valor de expectativa.
10. Mídia legível por computador, de acordo com areivindicação 8, CARACTERIZADA pelo fato de usar a probabi-lidade do estado de fala para estimar um valor de fala lim-po, que compreende:usar a probabilidade do estado de fala para iden-tificar um quadro de um sinal como um quadro de não-fala;usar o quadro de não-fala para estimar uma variân-cia para um ruído; eusar a variância para o ruído para estimar o valorde fala limpo.
11. Método para identificar um valor de fala limpopara um sinal de fala limpo, o método sendo CARACTERIZADOpor compreender:receber um sinal de sensor alternativo gerado u-sando um sensor alternativo;receber um sinal de microfone de condução aéreagerado usando um microfone de condução aérea;formar um modelo onde o sinal de fala limpo é de-pendente de um estado de fala, um sinal de sensor alternati-vo é dependente do sinal de fala limpo, e um sinal de micro-fone de condução aérea é dependente do sinal de fala limpo,onde formar o modelo compreende modelar uma probabilidade deum valor do sinal de fala limpo dado um estado de fala comouma distribuição tendo uma variância; edeterminar um valor filtrado do sinal de microfonede condução aérea aplicando um valor para um quadro correntedo sinal de microfone de condução aérea para um filtro desupressão de ruido dependente de freqüência que é uma funçãode uma variância de ruido ambiente;determinar a variância da distribuição como umacombinação linear de uma estimativa de um valor para um si-nal de fala limpo para um quadro precedente e o valor fil-trado do sinal de microfone de condução aérea;determinar uma estimativa de valor de fala limpopara o quadro corrente baseado no modelo, a variância dadistribuição, um valor para o sinal de sensor alternativopara o quadro corrente, e um valor para o sinal de um micro-fone de condução aérea para o quadro corrente.
12. Método, de acordo com a reivindicação 11,- CARACTERIZADO adicionalmente por compreender determinar umaprobabilidade para um estado, e onde determinar uma estima-tiva de valor de fala limpo adicionalmente compreende usar aprobabilidade para o estado.
13. Método, de acordo com a reivindicação 11,CARACTERIZADO pelo fato de que formar o modelo compreendeformar um modelo, no qual o sinal do sensor alternativo e osinal do microfone de condução aérea são dependentes de umafonte de ruido.
BRPI0612668-5A 2005-06-28 2006-06-13 fala multisensorial usando um modelo de estado de fala BRPI0612668A2 (pt)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US11/168.770 2005-06-28
US11/168,770 US7680656B2 (en) 2005-06-28 2005-06-28 Multi-sensory speech enhancement using a speech-state model
PCT/US2006/022863 WO2007001821A2 (en) 2005-06-28 2006-06-13 Multi-sensory speech enhancement using a speech-state model

Publications (1)

Publication Number Publication Date
BRPI0612668A2 true BRPI0612668A2 (pt) 2010-11-30

Family

ID=37568662

Family Applications (1)

Application Number Title Priority Date Filing Date
BRPI0612668-5A BRPI0612668A2 (pt) 2005-06-28 2006-06-13 fala multisensorial usando um modelo de estado de fala

Country Status (11)

Country Link
US (1) US7680656B2 (pt)
EP (1) EP1891624B1 (pt)
JP (2) JP5000647B2 (pt)
KR (1) KR101224755B1 (pt)
CN (1) CN101606191B (pt)
AT (1) ATE508454T1 (pt)
BR (1) BRPI0612668A2 (pt)
DE (1) DE602006021741D1 (pt)
MX (1) MX2007015446A (pt)
RU (1) RU2420813C2 (pt)
WO (1) WO2007001821A2 (pt)

Families Citing this family (20)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CA2621940C (en) * 2005-09-09 2014-07-29 Mcmaster University Method and device for binaural signal enhancement
KR100738332B1 (ko) * 2005-10-28 2007-07-12 한국전자통신연구원 성대신호 인식 장치 및 그 방법
US8364492B2 (en) * 2006-07-13 2013-01-29 Nec Corporation Apparatus, method and program for giving warning in connection with inputting of unvoiced speech
JP4940956B2 (ja) * 2007-01-10 2012-05-30 ヤマハ株式会社 音声伝送システム
JP4950930B2 (ja) * 2008-04-03 2012-06-13 株式会社東芝 音声/非音声を判定する装置、方法およびプログラム
US9159335B2 (en) * 2008-10-10 2015-10-13 Samsung Electronics Co., Ltd. Apparatus and method for noise estimation, and noise reduction apparatus employing the same
CN102411936B (zh) * 2010-11-25 2012-11-14 歌尔声学股份有限公司 语音增强方法、装置及头戴式降噪通信耳机
US9589580B2 (en) 2011-03-14 2017-03-07 Cochlear Limited Sound processing based on a confidence measure
US10418047B2 (en) 2011-03-14 2019-09-17 Cochlear Limited Sound processing with increased noise suppression
US9094749B2 (en) 2012-07-25 2015-07-28 Nokia Technologies Oy Head-mounted sound capture device
TWI502583B (zh) * 2013-04-11 2015-10-01 Wistron Corp 語音處理裝置和語音處理方法
US9928851B2 (en) * 2013-09-12 2018-03-27 Mediatek Inc. Voice verifying system and voice verifying method which can determine if voice signal is valid or not
US20150161999A1 (en) * 2013-12-09 2015-06-11 Ravi Kalluri Media content consumption with individualized acoustic speech recognition
TWM492015U (zh) * 2014-07-30 2014-12-11 Wen-Tsung Sun 電子式助發聲裝置
CN105448303B (zh) * 2015-11-27 2020-02-04 百度在线网络技术(北京)有限公司 语音信号的处理方法和装置
CN107045874B (zh) * 2016-02-05 2021-03-02 深圳市潮流网络技术有限公司 一种基于相关性的非线性语音增强方法
US10535364B1 (en) * 2016-09-08 2020-01-14 Amazon Technologies, Inc. Voice activity detection using air conduction and bone conduction microphones
CN110265056B (zh) * 2019-06-11 2021-09-17 安克创新科技股份有限公司 音源的控制方法以及扬声设备、装置
CN114424581B (zh) 2019-09-12 2025-09-19 深圳市韶音科技有限公司 用于音频信号生成的系统和方法
CN116778944A (zh) * 2023-07-10 2023-09-19 深圳百瑞互联技术有限公司 噪声估计方法、装置、介质和设备

Family Cites Families (108)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3383466A (en) 1964-05-28 1968-05-14 Navy Usa Nonacoustic measures in automatic speech recognition
US3746789A (en) 1971-10-20 1973-07-17 E Alcivar Tissue conduction microphone utilized to activate a voice operated switch
US3787641A (en) 1972-06-05 1974-01-22 Setcom Corp Bone conduction microphone assembly
US3838466A (en) * 1973-01-26 1974-10-01 White S Non-fogging face shield
US4025721A (en) * 1976-05-04 1977-05-24 Biocommunications Research Corporation Method of and means for adaptively filtering near-stationary noise from speech
JPH0755167B2 (ja) 1988-09-21 1995-06-14 松下電器産業株式会社 移動体
JPH03108997A (ja) 1989-09-22 1991-05-09 Temuko Japan:Kk 骨伝導マイク
US5148488A (en) * 1989-11-17 1992-09-15 Nynex Corporation Method and filter for enhancing a noisy speech signal
JPH03160851A (ja) 1989-11-20 1991-07-10 Fujitsu Ltd 携帯電話機
US5054079A (en) 1990-01-25 1991-10-01 Stanton Magnetics, Inc. Bone conduction microphone with mounting means
US5404577A (en) 1990-07-13 1995-04-04 Cairns & Brother Inc. Combination head-protective helmet & communications system
WO1993001664A1 (en) 1991-07-08 1993-01-21 Motorola, Inc. Remote voice control system
US5295193A (en) 1992-01-22 1994-03-15 Hiroshi Ono Device for picking up bone-conducted sound in external auditory meatus and communication device using the same
JPH05276587A (ja) 1992-03-30 1993-10-22 Retsutsu Corp:Kk イヤーマイクロフォン
US5590241A (en) 1993-04-30 1996-12-31 Motorola Inc. Speech processing system and method for enhancing a speech signal in a noisy environment
US5446789A (en) 1993-11-10 1995-08-29 International Business Machines Corporation Electronic device having antenna for receiving soundwaves
ZA948426B (en) 1993-12-22 1995-06-30 Qualcomm Inc Distributed voice recognition system
AU684872B2 (en) 1994-03-10 1998-01-08 Cable And Wireless Plc Communication system
US5828768A (en) 1994-05-11 1998-10-27 Noise Cancellation Technologies, Inc. Multimedia personal computer with active noise reduction and piezo speakers
US6471420B1 (en) * 1994-05-13 2002-10-29 Matsushita Electric Industrial Co., Ltd. Voice selection apparatus voice response apparatus, and game apparatus using word tables from which selected words are output as voice selections
JP3082825B2 (ja) 1994-08-29 2000-08-28 日本電信電話株式会社 通信装置
DE69527731T2 (de) 1994-05-18 2003-04-03 Nippon Telegraph & Telephone Co., Tokio/Tokyo Sender-Empfänger mit einem akustischen Wandler vom Ohrpassstück-Typ
US5727124A (en) * 1994-06-21 1998-03-10 Lucent Technologies, Inc. Method of and apparatus for signal recognition that compensates for mismatching
JP3488749B2 (ja) 1994-08-23 2004-01-19 株式会社ダッド・ジャパン 骨伝導型マイクロホン
JP3306784B2 (ja) 1994-09-05 2002-07-24 日本電信電話株式会社 骨導マイクロホン出力信号再生装置
JPH08186654A (ja) 1994-12-22 1996-07-16 Internatl Business Mach Corp <Ibm> 携帯端末装置
US5692059A (en) 1995-02-24 1997-11-25 Kruger; Frederick M. Two active element in-the-ear microphone system
US5555449A (en) 1995-03-07 1996-09-10 Ericsson Inc. Extendible antenna and microphone for portable communication unit
KR960042590A (ko) 1995-05-23 1996-12-21 김광호 테이프 재생용 음량기기에서의 발음비교방법
US5647834A (en) 1995-06-30 1997-07-15 Ron; Samuel Speech-based biofeedback method and system
RU2163032C2 (ru) * 1995-09-14 2001-02-10 Эрикссон Инк. Система адаптивной фильтрации аудиосигналов для улучшения разборчивости речи при наличии шума
JPH09172479A (ja) 1995-12-20 1997-06-30 Yokoi Kikaku:Kk 送受話器およびそれを用いた通話装置
US6243596B1 (en) 1996-04-10 2001-06-05 Lextron Systems, Inc. Method and apparatus for modifying and integrating a cellular phone with the capability to access and browse the internet
JP3097901B2 (ja) 1996-06-28 2000-10-10 日本電信電話株式会社 通話装置
JP3095214B2 (ja) 1996-06-28 2000-10-03 日本電信電話株式会社 通話装置
US5943627A (en) 1996-09-12 1999-08-24 Kim; Seong-Soo Mobile cellular phone
JPH10261910A (ja) 1997-01-16 1998-09-29 Sony Corp 携帯無線装置およびアンテナ装置
JPH10224253A (ja) 1997-02-10 1998-08-21 Sony Corp 携帯通信機
US6308062B1 (en) 1997-03-06 2001-10-23 Ericsson Business Networks Ab Wireless telephony system enabling access to PC based functionalities
JP3108997B2 (ja) 1997-03-31 2000-11-13 武田薬品工業株式会社 アゾール化合物、その製造法および用途
FR2761800A1 (fr) 1997-04-02 1998-10-09 Scanera Sc Dispositif de transmission de voix et telephone le mettant en oeuvre
US5983073A (en) 1997-04-04 1999-11-09 Ditzik; Richard J. Modular notebook and PDA computer systems for personal computing and wireless communications
US6175633B1 (en) 1997-04-09 2001-01-16 Cavcom, Inc. Radio communications apparatus with attenuating ear pieces for high noise environments
US5924065A (en) * 1997-06-16 1999-07-13 Digital Equipment Corporation Environmently compensated speech processing
JPH1115191A (ja) * 1997-06-20 1999-01-22 Fuji Xerox Co Ltd 静電荷像現像用トナー及びその製造方法
AU8205398A (en) 1997-07-16 1999-02-10 Siemens Aktiengesellschaft Hand-held telephone device
JPH11249692A (ja) 1998-02-27 1999-09-17 Nec Saitama Ltd 音声認識装置
US6912287B1 (en) 1998-03-18 2005-06-28 Nippon Telegraph And Telephone Corporation Wearable communication device
JPH11265199A (ja) 1998-03-18 1999-09-28 Nippon Telegr & Teleph Corp <Ntt> 送話器
JP2000009688A (ja) 1998-04-22 2000-01-14 Tokyo Gas Co Ltd 一酸化炭素センサ
US6052464A (en) 1998-05-29 2000-04-18 Motorola, Inc. Telephone set having a microphone for receiving or an earpiece for generating an acoustic signal via a keypad
US6137883A (en) 1998-05-30 2000-10-24 Motorola, Inc. Telephone set having a microphone for receiving an acoustic signal via keypad
JP3160714B2 (ja) 1998-07-08 2001-04-25 株式会社シコー技研 携帯無線通信機
JP3893763B2 (ja) 1998-08-17 2007-03-14 富士ゼロックス株式会社 音声検出装置
WO2000021194A1 (en) 1998-10-08 2000-04-13 Resound Corporation Dual-sensor voice transmission system
JP2000196723A (ja) 1998-12-25 2000-07-14 Koichi Tamura 筒状アンテナ、マイク
JP2000209688A (ja) 1999-01-19 2000-07-28 Temuko Japan:Kk 骨導マイク
US6760600B2 (en) 1999-01-27 2004-07-06 Gateway, Inc. Portable communication apparatus
US6408269B1 (en) * 1999-03-03 2002-06-18 Industrial Technology Research Institute Frame-based subband Kalman filtering method and apparatus for speech enhancement
JP2000261529A (ja) 1999-03-10 2000-09-22 Nippon Telegr & Teleph Corp <Ntt> 通話装置
JP2000261534A (ja) 1999-03-10 2000-09-22 Nippon Telegr & Teleph Corp <Ntt> 送受話器
JP2000261530A (ja) 1999-03-10 2000-09-22 Nippon Telegr & Teleph Corp <Ntt> 通話装置
DE19917169A1 (de) 1999-04-16 2000-11-02 Kamecke Keller Orla Verfahren zur Speicherung und Wiedergabe von Audio-, Video- und Anwendungsprogrammdaten in Mobilfunkendgeräten
US6542721B2 (en) 1999-10-11 2003-04-01 Peter V. Boesen Cellular telephone, personal digital assistant and pager unit
US6094492A (en) 1999-05-10 2000-07-25 Boesen; Peter V. Bone conduction voice transmission apparatus and system
US6952483B2 (en) 1999-05-10 2005-10-04 Genisus Systems, Inc. Voice transmission apparatus with UWB
US6560468B1 (en) 1999-05-10 2003-05-06 Peter V. Boesen Cellular telephone, personal digital assistant, and pager unit with capability of short range radio frequency transmissions
US20020057810A1 (en) 1999-05-10 2002-05-16 Boesen Peter V. Computer and voice communication unit with handsfree device
JP2000330597A (ja) * 1999-05-20 2000-11-30 Matsushita Electric Ind Co Ltd 雑音抑圧装置
JP2000354284A (ja) 1999-06-10 2000-12-19 Iwatsu Electric Co Ltd 送受一体形電気音響変換器を用いる送受話装置
US6594629B1 (en) 1999-08-06 2003-07-15 International Business Machines Corporation Methods and apparatus for audio-visual speech detection and recognition
KR100304666B1 (ko) 1999-08-28 2001-11-01 윤종용 음성 향상 방법
JP2001119797A (ja) 1999-10-15 2001-04-27 Phone Or Ltd 携帯電話装置
US6339706B1 (en) 1999-11-12 2002-01-15 Telefonaktiebolaget L M Ericsson (Publ) Wireless voice-activated remote control device
US6675027B1 (en) 1999-11-22 2004-01-06 Microsoft Corp Personal mobile computing device having antenna microphone for improved speech recognition
US6411933B1 (en) 1999-11-22 2002-06-25 International Business Machines Corporation Methods and apparatus for correlating biometric attributes and biometric attribute production features
JP3576915B2 (ja) 2000-02-28 2004-10-13 株式会社ケンウッド 携帯電話装置
JP2001292489A (ja) 2000-04-10 2001-10-19 Kubota Corp 骨伝導マイク付きヘッドホン
GB2363557A (en) * 2000-06-16 2001-12-19 At & T Lab Cambridge Ltd Method of extracting a signal from a contaminated signal
JP3339579B2 (ja) 2000-10-04 2002-10-28 株式会社鷹山 電話装置
JP2002125298A (ja) 2000-10-13 2002-04-26 Yamaha Corp マイク装置およびイヤホンマイク装置
US20020075306A1 (en) 2000-12-18 2002-06-20 Christopher Thompson Method and system for initiating communications with dispersed team members from within a virtual team environment using personal identifiers
US7617099B2 (en) 2001-02-12 2009-11-10 FortMedia Inc. Noise suppression by two-channel tandem spectrum modification for speech signal in an automobile
US7082393B2 (en) 2001-03-27 2006-07-25 Rast Associates, Llc Head-worn, trimodal device to increase transcription accuracy in a voice recognition system and to process unvocalized speech
GB2375276B (en) 2001-05-03 2003-05-28 Motorola Inc Method and system of sound processing
WO2002098169A1 (en) 2001-05-30 2002-12-05 Aliphcom Detecting voiced and unvoiced speech using both acoustic and nonacoustic sensors
JP2002358089A (ja) 2001-06-01 2002-12-13 Denso Corp 音声処理装置及び音声処理方法
US6987986B2 (en) 2001-06-21 2006-01-17 Boesen Peter V Cellular telephone, personal digital assistant with dual lines for simultaneous uses
US7054423B2 (en) 2001-09-24 2006-05-30 Nebiker Robert M Multi-media communication downloading
JP3532544B2 (ja) 2001-10-30 2004-05-31 株式会社テムコジャパン 面体又は帽体のストラップ装着用送受話装置
US6664713B2 (en) 2001-12-04 2003-12-16 Peter V. Boesen Single chip device for voice communications
US20050141730A1 (en) 2001-12-21 2005-06-30 Rti Tech Pte Ltd. Vibration-based talk-through method and apparatus
US7219062B2 (en) 2002-01-30 2007-05-15 Koninklijke Philips Electronics N.V. Speech activity detection using acoustic and facial characteristics in an automatic speech recognition system
US9374451B2 (en) 2002-02-04 2016-06-21 Nokia Technologies Oy System and method for multimodal short-cuts to digital services
GB2390264B (en) 2002-06-24 2006-07-12 Samsung Electronics Co Ltd Usage position detection
US7103541B2 (en) * 2002-06-27 2006-09-05 Microsoft Corporation Microphone array signal enhancement using mixture models
US7146315B2 (en) * 2002-08-30 2006-12-05 Siemens Corporate Research, Inc. Multichannel voice detection in adverse environments
US7047047B2 (en) 2002-09-06 2006-05-16 Microsoft Corporation Non-linear observation model for removing noise from corrupted signals
US7225124B2 (en) * 2002-12-10 2007-05-29 International Business Machines Corporation Methods and apparatus for multiple source signal separation
US7269560B2 (en) * 2003-06-27 2007-09-11 Microsoft Corporation Speech detection and enhancement using audio/video fusion
US20060008256A1 (en) 2003-10-01 2006-01-12 Khedouri Robert K Audio visual player apparatus and system and method of content distribution using the same
US7447630B2 (en) 2003-11-26 2008-11-04 Microsoft Corporation Method and apparatus for multi-sensory speech enhancement
US7499686B2 (en) 2004-02-24 2009-03-03 Microsoft Corporation Method and apparatus for multi-sensory speech enhancement on a mobile device
EP1600947A3 (en) * 2004-05-26 2005-12-21 Honda Research Institute Europe GmbH Subtractive cancellation of harmonic noise
US8095073B2 (en) 2004-06-22 2012-01-10 Sony Ericsson Mobile Communications Ab Method and apparatus for improved mobile station and hearing aid compatibility
US7574008B2 (en) 2004-09-17 2009-08-11 Microsoft Corporation Method and apparatus for multi-sensory speech enhancement
US7283850B2 (en) 2004-10-12 2007-10-16 Microsoft Corporation Method and apparatus for multi-sensory speech enhancement on a mobile device
US7590529B2 (en) 2005-02-04 2009-09-15 Microsoft Corporation Method and apparatus for reducing noise corruption from an alternative sensor signal during multi-sensory speech enhancement

Also Published As

Publication number Publication date
MX2007015446A (es) 2008-02-25
US7680656B2 (en) 2010-03-16
US20060293887A1 (en) 2006-12-28
EP1891624A2 (en) 2008-02-27
KR101224755B1 (ko) 2013-01-21
JP2012155339A (ja) 2012-08-16
RU2420813C2 (ru) 2011-06-10
JP5452655B2 (ja) 2014-03-26
ATE508454T1 (de) 2011-05-15
EP1891624B1 (en) 2011-05-04
RU2007149546A (ru) 2009-07-10
DE602006021741D1 (de) 2011-06-16
WO2007001821A3 (en) 2009-04-30
WO2007001821A2 (en) 2007-01-04
CN101606191B (zh) 2012-03-21
JP2009501940A (ja) 2009-01-22
KR20080019222A (ko) 2008-03-03
CN101606191A (zh) 2009-12-16
JP5000647B2 (ja) 2012-08-15
EP1891624A4 (en) 2009-11-04

Similar Documents

Publication Publication Date Title
BRPI0612668A2 (pt) fala multisensorial usando um modelo de estado de fala
KR101099339B1 (ko) 복수-감지기형 음성 향상 방법 및 컴퓨터-판독가능 매체
US20220328041A1 (en) Training neural networks to predict acoustic sequences using observed prosody info
CN108615535B (zh) 语音增强方法、装置、智能语音设备和计算机设备
KR101153093B1 (ko) 다감각 음성 향상을 위한 방법 및 장치
CN113744762B (zh) 一种信噪比确定方法、装置、电子设备和存储介质
WO2023116660A2 (zh) 一种模型训练以及音色转换方法、装置、设备及介质
KR102198598B1 (ko) 합성 음성 신호 생성 방법, 뉴럴 보코더 및 뉴럴 보코더의 훈련 방법
CN116129869A (zh) 语音风格迁移合成方法及装置、电子设备、存储介质
JP2016522421A (ja) 入力雑音混入信号を強調する方法およびシステム
KR20080018163A (ko) 깨끗한 음성 사전 확률을 이용한 멀티센서 음성 향상
CN111326166B (zh) 语音处理方法及装置、计算机可读存储介质、电子设备
CN114596870A (zh) 实时音频处理方法和装置、计算机存储介质、电子设备
KR20200092500A (ko) 뉴럴 보코더 및 화자 적응형 모델을 구현하기 위한 뉴럴 보코더의 훈련 방법
US12340793B1 (en) Augmenting voice samples based on distributions of speaker classes
CN116543778B (zh) 声码器训练方法、音频合成方法、介质、装置和计算设备
CN111583945B (zh) 用于处理音频的方法、装置、电子设备和计算机可读介质
CN112382296A (zh) 一种声纹遥控无线音频设备的方法和装置
CN116975795A (zh) 音频资源的侵权检测方法、装置、存储介质和计算设备
WO2024009746A1 (ja) モデル生成装置、モデル生成方法、信号処理装置、信号処理方法、及び、プログラム

Legal Events

Date Code Title Description
B08F Application dismissed because of non-payment of annual fees [chapter 8.6 patent gazette]

Free format text: REFERENTE A 6A ANUIDADE.

B08K Patent lapsed as no evidence of payment of the annual fee has been furnished to inpi [chapter 8.11 patent gazette]

Free format text: NAO APRESENTADA A GUIA DE CUMPRIMENTO DE EXIGENCIA. REFERENTE A 6A ANUIDADE.