BRPI0612668A2 - fala multisensorial usando um modelo de estado de fala - Google Patents
fala multisensorial usando um modelo de estado de fala Download PDFInfo
- Publication number
- BRPI0612668A2 BRPI0612668A2 BRPI0612668-5A BRPI0612668A BRPI0612668A2 BR PI0612668 A2 BRPI0612668 A2 BR PI0612668A2 BR PI0612668 A BRPI0612668 A BR PI0612668A BR PI0612668 A2 BRPI0612668 A2 BR PI0612668A2
- Authority
- BR
- Brazil
- Prior art keywords
- speech
- signal
- value
- noise
- probability
- Prior art date
Links
- 238000000034 method Methods 0.000 claims abstract description 28
- 230000001419 dependent effect Effects 0.000 claims description 12
- 230000004044 response Effects 0.000 claims description 11
- 238000009826 distribution Methods 0.000 claims description 10
- 230000001629 suppression Effects 0.000 claims description 7
- 238000005303 weighing Methods 0.000 claims 1
- 238000005070 sampling Methods 0.000 description 12
- 238000004891 communication Methods 0.000 description 10
- 238000010586 diagram Methods 0.000 description 6
- 210000000988 bone and bone Anatomy 0.000 description 5
- 230000003287 optical effect Effects 0.000 description 5
- 230000008569 process Effects 0.000 description 4
- 238000005516 engineering process Methods 0.000 description 3
- 230000003993 interaction Effects 0.000 description 3
- 230000002093 peripheral effect Effects 0.000 description 3
- 238000012545 processing Methods 0.000 description 3
- 230000009467 reduction Effects 0.000 description 3
- 230000003595 spectral effect Effects 0.000 description 3
- 230000032683 aging Effects 0.000 description 2
- 230000008859 change Effects 0.000 description 2
- 210000003054 facial bone Anatomy 0.000 description 2
- 230000011164 ossification Effects 0.000 description 2
- 230000008447 perception Effects 0.000 description 2
- 239000007787 solid Substances 0.000 description 2
- CDFKCKUONRRKJD-UHFFFAOYSA-N 1-(3-chlorophenoxy)-3-[2-[[3-(3-chlorophenoxy)-2-hydroxypropyl]amino]ethylamino]propan-2-ol;methanesulfonic acid Chemical compound CS(O)(=O)=O.CS(O)(=O)=O.C=1C=CC(Cl)=CC=1OCC(O)CNCCNCC(O)COC1=CC=CC(Cl)=C1 CDFKCKUONRRKJD-UHFFFAOYSA-N 0.000 description 1
- 230000004931 aggregating effect Effects 0.000 description 1
- 230000005540 biological transmission Effects 0.000 description 1
- 230000015572 biosynthetic process Effects 0.000 description 1
- 230000021615 conjugation Effects 0.000 description 1
- 230000002708 enhancing effect Effects 0.000 description 1
- 238000000802 evaporation-induced self-assembly Methods 0.000 description 1
- 230000010354 integration Effects 0.000 description 1
- 230000002452 interceptive effect Effects 0.000 description 1
- 230000000873 masking effect Effects 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 238000007670 refining Methods 0.000 description 1
- 238000012360 testing method Methods 0.000 description 1
- 238000012549 training Methods 0.000 description 1
- 238000012546 transfer Methods 0.000 description 1
- 230000007723 transport mechanism Effects 0.000 description 1
- 238000009827 uniform distribution Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/20—Speech recognition techniques specially adapted for robustness in adverse environments, e.g. in noise, of stress induced speech
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L2021/02161—Number of inputs available containing the signal or the noise to be suppressed
- G10L2021/02165—Two microphones, one receiving mainly the noise signal and the other one mainly the speech signal
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Quality & Reliability (AREA)
- Signal Processing (AREA)
- Circuit For Audible Band Transducer (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
- Magnetic Resonance Imaging Apparatus (AREA)
- Electrophonic Musical Instruments (AREA)
- Telephone Function (AREA)
- Machine Translation (AREA)
Abstract
FALA MULTISENSORIAL USANDO UM MODELO DE ESTADO DE FALA Trata-se de um método e aparelho para determinar uma probabilidade de estado de fala baseado num sinal de sensor alternativo e num sinal de microfone de condução por via aérea. A probabilidade de estado de fala é usada, em conjunto com o sinal de sensor alternativo e o sinal de microfone de condução aérea, para estimar um valor de fala exato para um sinal de fala claro.
Description
"FALA MULTISENSORIAL USANDO UM MODELO DE ESTADO DE FALA"
ANTECEDENTES
Um problema comum no reconhecimento da fala e natransmissão da fala é a corrupção do sinal da fala por ruidoagregado. Em especial, a corrupção devido à fala de outroorador o que está provado ser de difícil detecção e/ou cor-reção.
Recentemente, alguns sistemas foram desenvolvidospara tentar remover o ruído através do uso de uma combinaçãode sensores alternativos, tal como microfone de condução ós-sea e microfone de condução aérea. Várias técnicas foram de-senvolvidas que usam sensores de sinal alternativos e o si-nal do microfone de condução aérea para formar um sinal defala aperfeiçoado que tem menos ruído que o sinal do micro-fone de condução por via aérea. No entanto, não se alcançoua fala perfeita e necessita-se de avanços adicionais na for-mação de sinais de fala aperfeiçoados.
SUMÁRIO
Um método e aparelho determinam as probabilidadesde uma expressão de fala baseado num sensor de sinal alter-nativo e um sinal de microfone de condução aérea. A probabi-lidade da expressão de fala é usada para estimar um valor defala exato para um sinal de fala claro.
BREVE DESCRIÇÃO DOS DESENHOS
A Figura 1 é um diagrama em blocos de um ambientede computação, no qual a modalidade da presente invenção po-de ser experimentada.A Figura 2 é um diagrama em blocos de um ambientede computação alternativo, no qual modalidades da presenteinvenção podem ser experimentadas.
A Figura 3 é um diagrama em blocos de um sistemageral de processamento da fala da presente invenção.
A Figura 4 é um diagrama em blocos de um sistemapara aperfeiçoar a fala, de acordo com uma modalidade dapresente invenção.
A Figura 5 é um modelo, no qual o aperfeiçoamentoda fala se baseia em uma modalidade da presente invenção.
A Figura 6 é um fluxograma para aperfeiçoar a fa-la, de acordo com uma modalidade da presente invenção.
DESCRIÇÃO DETALHADA DAS MODALIDADES ILUSTRATIVAS
A Figura 1 ilustra um exemplo de um ambiente decomputação 100 adequado, no qual pode-se implementar as mo-dalidades da invenção. O ambiente de computação 100 é apenasum exemplo do ambiente de computação adequado e não pretendesugerir quaisquer limitações no escopo do uso ou da funcio-nalidade da invenção. Também não se pretende que o ambientede computação 100 seja interpretado como dependente ou quepossua requerimento relativo a qualquer componente ou umacombinação deles ilustrados no ambiente operacional 100 e-xemplificativo.
As modalidades da invenção são operacionais cominúmeros outros ambientes de sistemas de computação de pro-pósitos gerais ou específicos ou configurações. Exemplos desistemas de computação, ambientes e/ou configurações bem co-nhecidos que podem ser adequados para usar com as modalida-des da invenção incluem, mas não se limitam, a computadorespessoais, servidores, dispositivos manuais ou para laptops,sistemas multiprocessadores, sistemas baseados em micropro-cessadores, conversores, produtos eletrônicos programáveispara consumo, redes de computadores, minicomputadores, com-putadores de grande porte, sistemas de telefonia, ambientesde computação distribuídos que podem incluir qualquer um dossistemas ou dispositivos acima descritos e similares.
As modalidades da invenção podem ser descritas nocontexto geral de instruções executáveis por computador, talcomo módulos de programa, que são executados por um computa-dor. Em geral, módulos de programa, incluem rotinas, progra-mas, objetos, componentes, estruturas de dados, etc., quedesempenham tarefas específicas ou implementam tipos de re-sumos de dados específicos. A invenção está projetada paraser experimentada em ambiente de computação distribuída ondeas tarefas são desempenhadas por dispositivos de processa-mento remotos interconectados à uma rede de comunicações. Emum ambiente de computação distribuída, os módulos de progra-ma estão localizados tanto em meios de computador de armaze-namento local como de armazenamento remoto, incluindo dispositivos de memória de armazenamento.
Com referência à Figura 1, o sistema exemplifica-tivo para implementar a invenção inclui um dispositivo decomputação de propósitos gerais na forma de um computador110. Os componentes do computador 110 podem incluir, mas nãose limitam, a uma unidade processadora 120, um sistema dememória 130, e um sistema de barramento 121 que acopla vá-rios componentes do sistema que inclui o sistema de memóriaà unidade processadora 120. O sistema de barramento 121 podeser um dos diversos tipos de estruturas de barramento queinclui o barramento de memória ou um controlador de memória,um barramento periférico, e um barramento local usando umadas várias arquiteturas de barramento. À titulo de exemplo,e não à limitações, tais arquiteturas incluem barramentoISA, barramento MCA, barramento EISA, barramento local VESAe barramento PCI, também conhecido como barramento Mezanino.
0 computador 110 geralmente inclui uma variedadede mídias legíveis por computador. Mídias legíveis por com-putador pode ser qualquer mídia disponível que possa ser a-cessada pelo computador 110 e inclui tanto a mídia volátilcomo a mídia não-volátil, mídia removível como não-removível. A titulo de exemplo, e não limitado a, mídia le-gível por computador pode compreender mídia de armazenamentoe mídia de comunicação. A mídia de armazenamento de computa-dor inclui tanto mídia volátil como não-volátil, mídia remo-vível como não-removível implementada com qualquer método outecnologia para armazenar informação tal como instruções le-gíveis por computador, estrutura de dados, módulos de pro-grama ou outros dados. Mídias de armazenamento por computa-dor incluem, mas não estão limitadas a, RAM, ROM, EEPROM,memória flash ou outra tecnologia de memória, CD-ROM, discosversáteis digitais (DVD) ou outros discos óticos de armaze-namento, cartuchos magnéticos, fitas magnéticas, discos dearmazenamento magnéticos, ou outros dispositivos magnéticosde armazenamento, ou quaisquer outros meios que possam serusados para armazenar a informação desejada e que possa seracessada pelo computador 110. A mídia de comunicação, em ge-ral, contempla instruções legíveis por computador, estrutu-ras de dados, módulos de programa ou outros dados em sinalmodulado tal como onda portadora ou outro mecanismo detransporte e inclui qualquer mídia de entrega de informação.O termo "sinal modulado de dados" significa um sinal que temuma ou mais de suas características dispostas ou alteradasde tal maneira que codifica a informação no sinal. À títulode exemplo, e não limitado a, mídia de comunicação incluimídia via cabo tal como rede via cabo ou conexão direta viacabo, e mídia sem fio tal como acústica, RF, infravermelha,e outras mídias sem fio. Combinações de qualquer uma das mí-dias antes citadas podem ser incluídas dentro do escopo dasmídias legíveis por computador.
O sistema de memória 130 inclui mídia de armazena-mento de computador na forma de memória volátil e/ou não-volátil- tal como memória somente para leitura (ROM) 131 ememória de acesso aleatório (RAM) 132. Um sistema básico deentrada/saída 133 (BIOS), contendo as rotinas básicas queajudam a transferir a informação entre os elementos dentrodo computador 110, tal como durante a inicialização, é ge-ralmente armazenada na memória ROM 131. A memória RAM 132geralmente contém dados e/ou módulos de programa que são a-cessíveis imediatamente e/ou que estão sendo operados pelaunidade processadora 120. À titulo de exemplo, e não limi-tando, a Figura 1 ilustra o sistema operacional 134, progra-mas aplicativos 135, outros módulos de programa 136 e dadosde programa 137.
O computador 110 pode incluir outras mídias de ar-mazenamento por computador removíveis e não-removíveis, vo-láteis e não-voláteis. À titulo de exemplo somente, a FIGURA1 ilustra uma unidade de disco rígido 141 que lê de ou es-creve em mídia magnética não-removível e não-volátil, umaunidade magnética de disco 151 que lê de e escreve em discomagnético removível e não-volátil 152, e uma unidade de dis-co ótico 155 que lê de e escreve em disco ótico removível enão-volátil 156 tal como CD-ROM ou outra mídia ótica. Outrasmídias de armazenamento por computador removíveis/não-removíveis e voláteis/não-voláteis que podem ser usadas noambiente operacional exemplar incluem, mas não limitadas a,cartuchos de fitas magnéticas, cartões de memória flash,discos versáteis digitais, fitas de vídeo digitais, RAM emestado sólido, ROM em estado sólido e similares. A unidadede disco rígido 141 está geralmente conectada ao sistema debarramento 121 através de uma memória removível de interfacetal como a interface 140, e a unidade de disco magnético 151e a unidade de disco ótico 155 estão geralmente conectadasao sistema de barramento 121 por uma memória removível deinterface, tal como a interface 150.
As unidades e as mídias de armazenamento por com-putador associadas, descritas acima e ilustradas na FIGURA1, propiciam o armazenamento das instruções legíveis porcomputador, estruturas de dados, módulos de programa e ou-tros dados para o computador 110. Na FIGURA 1, por exemplo,a unidade de disco rígido 141 é ilustrada armazenando o sis-tema operacional 144, programas aplicativos 145, outros mó-dulos de programa 146, e dados de programa 147. Observe-seque estes componentes podem ser iguais ou diferentes que osistema operacional 134, programas aplicativos 135, outrosmódulos de programa 136 e dados de programa 137. 0 sistemaoperacional 144, programas aplicativos 145, outros módulosde programa 146, e dados de programa 147 estão denominadospor diferentes referências numéricas para ilustrar que, aomenos, são cópias diferentes.
O usuário pode entrar com comandos e informaçõesno computador 110 através de dispositivos de entrada tal co-mo o teclado 162, o microfone 163, e um dispositivo de dire-ção do cursor 161, tal como o mouse, esfera móvel ou almofa-da de toque. Outros dispositivos de entrada (não mostrados)podem incluir um dispositivo de controle manual, controle dejogos, antena parabólica, scanner ou similares. Estes e ou-tros dispositivos de entrada estão freqüentemente conectadosà unidade processamento 120 através da interface de entradade usuário 160 que está acoplada ao sistema de barramento,mas que pode estar conectada por outras interfaces e estru-turas de barramento, tal como porta paralela, porta de jogosou um barramento serial universal (USB) . O monitor 191 ououtro tipo de dispositivo de exibição também está conectadoao sistema de barramento 121 via uma interface, tal como ainterface de vídeo 190. Além do monitor, computadores podemincluir outros dispositivos periféricos de saída tal comoalto-falante 197 e impressora 196, que podem estar conecta-dos através de uma interface periférica de saida.
O computador 110 é operado num ambiente de redeusando conexões lógicas a um ou mais computadores remotos,tal como o computador remoto 180. O computador remoto 18 0pode ser um computador pessoal, um dispositivo manual, umservidor, um roteador, um computador em rede, um dispositivoponto a ponto, ou outro ponto de conexão de rede, e geral-mente incluem vários ou todos os elementos descritos acimarelativos ao computador 110. As conexões lógicas descritasna FIGURA 1 incluem uma rede de área local (LAN) 171 e umarede de área distante (WAN) 173, mas também pode incluir ou-tras redes. Tais ambientes de rede são comuns em escritó-rios, redes corporativas, intranets e internet.
Quando usado numa rede LAN, o computador 110 é co-nectado à rede LAN 171 através de uma interface de rede ouadaptador 170. Quando usado num ambiente WAN, o computador110 geralmente inclui um modem 172 ou outros meios para es-tabelecer comunicação na rede WAN 173, tal como a Internet.O modem 172, que pode ser interno ou externo, pode ser co-nectado ao sistema de barramento 121 via interface de entra-da de usuário 160, ou outro mecanismo apropriado. Num ambi-ente de rede, módulos de programa descritos relativos aocomputador 110, ou partes deles, podem ser armazenados nodispositivo de memória de armazenamento remoto. A titulo deexemplo, e sem limitação, a Figura 1 ilustra os programasaplicativos remotos 185 residentes num computador remoto180. Deverá ser observado que as conexões de rede ilustradassão exemplares e outros meios de estabelecer enlaces de co-municações entre computadores podem ser usados.
A Figura 2 é um diagrama em blocos de um disposi-tivo móvel 200, que é um ambiente de computação exemplar. 0dispositivo móvel 200 inclui microprocessador 202, memória204, componentes de entrada/saida (1/0) 206, e uma interfacede comunicações 208 para comunicar-se com computadores remo-tos ou outros dispositivos móveis. Numa modalidade, os com-ponentes anteriormente mencionados estão interconectados a-través de um barramento 210 adequado.
A memória 204 é implementada como memória eletrô-nica não-volátil . tal como a memória de acesso aleatório(RAM) com módulo de bateria de apoio (não mostrada) de talforma que a informação armazenada na memória 204 não se per-ca quando a energia do dispositivo móvel 200 é desligada.Uma parte da memória 204 disponível é preferencialmente di-recionada à execução de programas, enquanto que outra parteda memória 204 é preferencialmente usada para armazenamento,tal como a simulação do armazenamento numa unidade de discorígido.
A memória 204 inclui um sistema operacional 212,programas aplicativos 214 bem como um local de armazenamento216. Durante a operação o sistema operacional 212 é prefe-rencialmente executado a partir da memória 204 pelo proces-sador 202. 0 sistema operacional 212, numa modalidade prefe-rida, Windows CE, é o sistema operacional disponível da Mi-crosoft Corporation. O sistema operacional 212 é preferenci-almente projetado para dispositivos móveis, e implementa umabase de dados com características que podem ser utilizadaspelos aplicativos 214, através de um conjunto de interfacesde programas aplicativos e métodos. Os objetos no local dearmazenamento 216 são mantidos pelos aplicativos 214 e pelosistema operacional 212, ao menos parcialmente, em respostaàs interfaces de programas aplicativos e métodos.
A interface de comunicações 208 representa numero-sos dispositivos e tecnologias que permitem ao dispositivomóvel 200 enviar e receber as informações. Os dispositivosincluem modems com e sem fio, receptores por satélite e sin-tonizadores de radiodifusão apenas para mencionar alguns. Odispositivo móvel 200 pode estar diretamente conectado a umcomputador para trocar dados com ele. Em tais casos, a in-terface de comunicações 208 pode ser um transceptor infra-vermelho ou uma conexão de comunicações serial ou paralela,todas as quais são capazes de transmitir pacotes de informação.
Os componentes de entrada/saída 206 incluem umavariedade de dispositivos, tal como tela sensível ao toque,botões, roletes, e microfone bem como uma variedade de dis-positivos de saída incluindo um gerador de áudio, um dispo-sitivo de vibração e uma tela. Os dispositivos listados aci-ma são a titulo de exemplo e não necessitam estar presentesno dispositivo móvel 200. Ademais, outros dispositivos deentrada/saída podem ser conectados ou encontrados no dispo-sitivo móvel 200 dentro do escopo da presente invenção.
A Figura 3 apresenta um diagrama em blocos básicodas modalidades da presente invenção. Na FIGURA 3, um Iocu-tor 300 gera um sinal de fala 302 (X) que é detectado por ummicrofone de condução aérea 304 e por um sensor alternativo306. Exemplos de sensores alternativos incluem um microfonede garganta que mede as vibrações da garganta do usuário, umsensor por via óssea que é localizado em ou adjacente à for-mação óssea facial ou osso craniano do usuário (tal como oosso mandibular) ou no ouvido do usuário e que sente as vi-brações da formação óssea facial ou dos ossos cranianos dousuário que correspondem à fala gerada pelo usuário. 0 mi-crofone de condução aérea 304 é o tipo de microfone usadocomumente para converter ondas de áudio em sinais elétricos.
O microfone de condução aérea 304 recebe o ruidoambiente 308 (V) gerado por uma ou mais fontes de ruido 310e gera seu próprio sensor de ruido 305 (U) . Dependendo dotipo de ruido ambiente e do nivel do ruido ambiente, o ruidoambiente 308 pode ser detectado por um sensor alternativo306. No entanto, sob as modalidades da presente invenção, osensor alternativo 306 é menos sensível ao ruído ambienteque o microfone de condução aérea 304. Assim, o sinal dosensor alternativo 316 (B) gerado pelo sensor alternativo306 geralmente inclui menos ruído que o sinal do microfone318 (Y) gerado pelo microfone de condução aérea 304. Apesardo sensor alternativo 306 ser menos sensível ao ruído ambi-ente, gera algum ruído do sensor 320 (W).
A rota desde o alto falante 300 ao sinal do sensoralternativo 316 pode ser modelado como um canal tendo umaresposta de canal Η. A rota desde o ruído ambiente 308 aosinal do sensor alternativo 316 pode ser modelado como umcanal tendo um resposta de canal G.
0 sinal do sensor alternativo 316 (B) e o sinal domicrofone de condução aérea 318 (Y) são obtidos num avalia-dor de sinal limpo 322, que estima o sinal limpo 324. 0 si-nal limpo estimado 324 determina um processo de fala 328. 0sinal limpo estimado 324 tanto pode ser um sinal de domíniode tempo ou um vetor de transformação Fourier. Se o sinallimpo estimado 324 é um sinal de domínio de tempo, o proces-so de fala 328 pode adotar a forma de um ouvinte, um sistemade codificação de fala ou um sistema de reconhecimento defala. Se o sinal limpo estimado 324 é um vetor de transfor-mação Fourier, o processo de fala 328 será geralmente umsistema de reconhecimento de fala, ou conterá uma transfor-mação inversa de Fourier para converter o vetor de transfor-mação de Fourier em forma de onda.
Dentro do avaliador de sinal limpo 322, o sinal desensor alternativo 316 e o sinal de microfone 318 são con-vertidos em domínio de freqüências sendo usadas para estimara fala claro. Como mostrado na FIGURA 4, o sinal de sensoralternativo 316 e o sinal de microfone de condução aérea 318são obtidos em conversores analógico-digitais 404 e 414,respectivamente, para gerar uma seqüência de valores digi-tais, agrupados dentro de amostras de valores pelas amostra-gens 406 e 416 respectivamente. Numa modalidade, os conver-sores 404 e 414 de A a D simulam sinais analógicos de 16 kHze 16 bits por amostra, conseqüentemente criando dados de fa-la de 32 kilobytes por segundo e as amostragens 406 e 416criam uma nova amostra respectiva a cada 10 mili-segundosque incluem um valor de 20 mili-segundos de dados.
Cada amostra respectiva de dados obtida das amos-tragens 406 e 416 é convertida no domínio de freqüência u-sando a transformação rápida de Fourier (FFT) 408 e 418,respectivamente.
Os valores de domínio de freqüências para o sinalde sensor alternativo e sinal de microfone de condução aéreasão obtidos num avaliador de sinal 420, que usa os valoresde domínio de freqüências para estimar o sinal de fala limpo 324.
Em algumas modalidades, o sinal de fala claro 324é convertido de volta para domínio de tempo usando a trans-formação rápida de Fourier inversa (IFFT) 422. Isto cria umaversão tempo de domínio do sinal de fala limpo 324.
A presente invenção utiliza um modelo do sistemada Figura 3 que inclui estados de fala para a fala claro demaneira a produzir um sinal de fala aperfeiçoado. A Figura 5apresenta uma representação gráfica do citado modelo.
No modelo da Figura 5, a fala claro 500 é depen-dente de um estado de fala 502. 0 sinal de microfone de con-dução aérea 504 é dependente do sinal de sensor de ruído506, do ruído ambiente 508 e do sinal de fala claro 500. 0sinal de sensor 510 é dependente do sensor de ruído 512 e dosinal de fala claro 500 quando passa através de um canal deresposta 514 e do ruído ambiente 508 quando passa através deum canal de resposta 516.O modelo da Figura 5 é usado na presente invençãopara estimar um sinal de fala claro Xt de observações de ru-ídos Yt e Bt e identifica a probabilidade de uma variedade deestados de fala St.
Numa modalidade da presente invenção, o sinal defala claro estimado e a probabilidade dos estados para o si-nal de fala claro estimado são formados primeiro assumindouma distribuição Gaussianica para os componentes de ruído nomodelo do sistema. Assim:
<formula>formula see original document page 15</formula>
onde cada componente de ruído é modelado como media zeroGaussianica tendo as variâncias respectivas g2o~2v, o~2w e o~2W, V é o ruído ambiente, U é o ruído do sensor no microfonede condução por via aérea, e W é o ruído do sensor no sensoralternativo. Na EQ. 1, g é um parâmetro de sintonia quepermite variâncias de ruído ambiente a ser sintonizado.
Ademais, esta modalidade da presente invenção mo-dela a probabilidade do sinal limpo de fala dado um estadocomo media zero Gaussianico com uma variância o~2s tal que:
<formula>formula see original document page 15</formula>
Numa modalidade da presente invenção, a probabili-dade prévia de um dado estado é assumida como ser uma proba- bilidade uniforme de tal maneira que todos os estados sãoigualmente prováveis. Especificamente, a probabilidade pré-via é:
<formula>formula see original document page 16</formula>
onde Ns é o numero de estados de fala disponíveis no modelo.
Na descrição das equações abaixo para determinar aestimativa do sinal limpo de fala e a probabilidade dos es-tados de fala, todas as variâncias são modeladas no complexodomínio espectral. Cada componente de freqüência (Bem) étratado independentemente dos outros componentes de freqüên-cia. Para facilitar a observação, o método descrito a seguiré para um único componente de freqüência. Os conhecedores datécnica reconhecerão que as computações são desempenhadaspara cada componente de freqüência na versão espectral dossinais de entrada. Para variâncias que modificam com o tem-po, um t subscrito é adicionado à variância.
Para estimar o sinal de fala limpo Xt das observa-ções de ruído Yt e Bt, a presente invenção maximiza a proba-bilidade p(XtiYt,Bt), que é a probabilidade do sinal de falalimpo dado o sinal de ruído do microfone de condução aéreae o sinal de ruído do sensor alternativo. Uma vez que a es-timativa do sinal de fala limpo depende do estado de fala Stno modelo, esta probabilidade condicional é determinada como:
<formula>formula see original document page 16</formula>onde (S) se estabelece que o conjunto dos estados de fala,^^^^^^^ é a probabilidade de Xt dadas as observações deruido correntes e o estado de fala s, e ^^^^^^^ é a proba-bilidade do estado de fala s dadas as observações de ruido.
Qualquer número de estados de fala possíveis pode ser usadona presente invenção, incluindo estados de fala para sons devoz, fricativos, sons nasais e sons de vogais. Em algumasmodalidades, um estado de fala separado é fornecido para ca-da um das unidades fonéticas, tal como fonemas. Numa modali-dade, no entanto, somente dois estados de fala são forneci-dos, um para fala e outro para não-fala.
Em algumas modalidades, um único estado é usadopara todos os componentes de freqüência. Assim sendo, cadaamostragem tem uma única variância de estado de fala.
Os termos ao lado direito da EQ. 6 podem ser cal-culados como:
<formula>formula see original document page 17</formula>
o que indica que a probabilidade condicional dosinal de fala limpo dadas as observações pode ser estimadopela probabilidade conjunta do sinal de fala limpo, as ob-servações o estado e que as probabilidades condicionais doestado dadas as observações possam ser aproximadas pela in-tegração da probabilidade conjunta do sinal de fala limpo asobservações e o estado sobre todos os valores de fala claropossíveis.Ao usar as hipóteses das distribuições Gaussiani-cas para ruídos, descritas acima nas equações 1-3, a proba-bilidade conjunta do sinal de fala limpo, as observações e oestado podem ser computados como:
<formula>formula see original document page 18</formula>
onde Wa probabilidade préviado estado o qual é dado pela probabilidade uniforme da dis-tribuição na EQ. 5, G é o canal resposta do sensor alterna-tivo ao ruído ambiente, H é o canal resposta do sinal desensor alternativo ao sinal de fala limpo, e termos comple-xos entre barras verticais tal como, I^l , indicam a magnitu-de do valor complexo.
0 canal resposta do sensor alternativo G para falade fundo é estimado dos sinais do microfone via aérea Y e dosensor alternativo B através da amostragem na qual o usuárionão está falando. Especificamente, G é determinada como:
<formula>formula see original document page 18</formula>
onde D é o numero de amostragens em que o usuário não estáfalando, mas onde há fala de fundo. Aqui, assumimos que G éconstante através de todas as amostragens de tempo D. Em ou-tras modalidades, em vez de usar todas as amostragens D i-gualmente, usamos a técnica conhecida como "envelhecimentoexponencial" de forma que as últimas amostragens contribuemmais para a estimativa de G do que as amostragens mais antigas.
0 canal de resposta H do sensor alternativo para osinal de fala limpo é estimado dos sinais de microfone devia aérea Y e do sensor alternativo B através das últimasamostragens T nas quais o usuário está falando. Especifica-mente, H é determinado como:
<formula>formula see original document page 19</formula>
onde T é o numero de amostragens nas quais o usuá-rio está falando. Aqui, assumimos que H é constante atravésde todas as amostragens de tempo T. Em outra modalidades, emvez de usar todas as amostragens T igualmente, usamos a téc-nica conhecida como "envelhecimento exponencial" de tal for-ma que as últimas amostragens contribuem mais para a estima-tiva de H do que as amostragens mais antigas.
A probabilidade condicional do estadocomputada usando a aproximação da EQ. 8 e o conjunto de cal-culo de probabilidades da EQ. 9 como:<formula>formula see original document page 20</formula>
que pode ser simplificada como:
<formula>formula see original document page 20</formula>
Olhando de perto, a EQ. 13 revela que o primeirotermo é de alguma maneira o modelo da correlação entre o ca-nal de sensor alternativo e o canal de microfone via aéreaonde o segundo termo usa o modelo de estado e o modelo deruido para explicar a observação no canal de microfone viaaérea. O terceiro termo é simplesmente o estado prévio, quenuma modalidade é uma distribuição uniforme.
A probabilidade do estado dada a observação compu-tada na EQ. 13 tem duas aplicações possíveis. Primeiro, podeser usada para estruturar um classificador de estado de fa-la, o qual pode ser usado para classificar as observaçõescomo incluir fala ou não, de tal forma que as variações dasfontes de ruído possam ser determinadas a partir das amos-tragens que não incluem fala. Também pode ser usado para a-tribuir um peso mais "suave" quando estimar o sinal de falaclaro, como mostrado a seguir.
Como observado acima, cada uma das variâncias nasequações acima é definida para um componente de freqüênciaespecifico no complexo domínio espectral, Assim, a probabi-lidade da EQ. 13 é para um estado associado com um componen-te de freqüência especifica. No entanto, uma vez que há so-mente uma;única variância para cada amostragem, a probabili-dade de um estado para a amostragem é formada agregando aprobabilidade através dos componentes de freqüências comosegue:
<formula>formula see original document page 21</formula>
onde é a probabilidade para ocomponente de freqüência f como definido na EQ. 13. 0 produ-to é determinado para todos os componentes de freqüência ex-ceto para as freqüências DC e Nyquist. Note-se que se a com-putação da probabilidade é levada adiante no domínio Iog-probabilidade, então o produto na equação acima é substituí-do por uma soma.
A probabilidade acima pode ser usada para estrutu-rar um classificador fala/não-fala, baseado na prova de taxade probabilidade tal que:
<formula>formula see original document page 21</formula>
onde a amostragem é considerada tendo fala se ataxa r é maior que 0, fora isso é considerado que não contémfala.
Usando as probabilidades dos estados de fala, umaestimativa do sinal de fala claro pode ser formado. Numa mo-dalidade, a estimativa é formada usando uma estimativa mediamínima ao quadrado (MMSE) baseada na EQ. 6 acima, tal que:
<formula>formula see original document page 22</formula>
onde e a expectativa do sinal de fala ^^^^limpo dada a observação, e é a expectativa dosinal de fala limpo dadas as observações e o estado de fala.
Usando as equações 7 e 9, a probabilidade condi-cional ^^^^^^^ da qual a expectativa podeser calculada é determinada como:
<formula>formula see original document page 22</formula>
EQ. 17
Isto produz a expectativa de:
<formula>formula see original document page 22</formula>
onde:
<formula>formula see original document page 22</formula>
e M* é a conjugação complexa de M.Assim, a estimativa MMSE do sinal de fala limpo Xté dada por:
<formula>formula see original document page 23</formula>
onde, tts, é no estado posterior e é dado por:
<formula>formula see original document page 23</formula>
onde L(St=s) é dada pela EQ. 14. Assim,, a estima-tiva do sinal de fala limpo em parte é baseado na probabili-dade relativa de um estado de fala especifico e esta proba-bilidade atribui um peso suave para a estimativa do sinal defala limpo.
No cálculo acima, H foi assumido que é conhecidocom bastante precisão. No entanto, na prática, H é conhecidosomente com precisão limitada. Numa modalidade adicional dapresente invenção, H é modelado como variância aleatóriaGaussianica ^wjsw***). Em tal modalidade, todos os cálculosacima são marginalizados para todos os valores possíveis deH. No entanto, isto torna a matemática intratável. Numa mo-dalidade, um processo interativo é usado para superar essaintratabilidade. Durante cada interação, H é substituído nasequações 13 e 20 por H<1 e é substituído por ondeé uma estimativa do sinal de fala limpo determinado poruma interação prévia. 0 sinal de fala claro então é determi-nado usando a EQ. 21. Esta nova estimativa do sinal de falaclaro é estabelecida como o novo valor de x* então a novainteração é executada. As interações terminam quando a esti-mativa do sinal de fala limpo fica estável.
A Figura 6 fornece um método para estimar o sinalde fala limpo usando as equações acima. Na etapa 600, amos-tragens de entrada de expressão são identificadas quando ousuário não está falando. Essas amostragens então são usadaspara determinar a variância para o ruído ambiente *' , a va-riância para o ruído do sensor alternativo σ"' , e a variân-cia para o ruído do microfone de condução aérea σ* * .
Para identificar amostragens onde o usuário nãoestá falando, o sinal do sensor alternativo pode ser exami-nado. Uma vez que o sinal de sensor alternativo produzirávalores de sinal muito menores para fala de fundo do que pa-ra ruído, quando a potência do sinal de sensor alternativoestiver baixa, inicialmente pode-se assumir que o locutornão está falando. Os valores dos sinais de microfone de con-dução aérea e dos sinais de sensor alternativo para amostra-gens que não contém fala são armazenados numa memória tempo-rária e são usados para computar variâncias de ruídos como:
<formula>formula see original document page 24</formula>
onde Nv é o número de amostragens de ruídos na expressão queestão sendo usadas para formar as variâncias, V é o conjuntode amostragens de ruídos onde o usuário não está falando, ese refere ao sinal de sensor alternativo depois de consi-derada a dispersão, que é calculado como:<formula>formula see original document page 25</formula>
que em algumas modalidades é calculado alternati-vamente como:
<formula>formula see original document page 25</formula>
Em algumas modalidades, a técnica para identificaramostragens de não-fala baseadas em niveis de potência bai-xos nos sinais de sensor alternativo somente são executadosdurante as amostragens de treinamento inicial. Após a forma-ção de valores iniciais para as variáveis de ruídos, podemser usadas para determinar quais amostragens contém fala equais amostragens não contêm fala usando a taxa de probabi-lidade da EQ. 15.
O valor de g, que é um parâmetro de sintonia quepode ser usado para aumentar ou diminuir a variância estima-da o2, é ajustado em 1 numa modalidade específica. Isto su-gere completa confiança no procedimento de estimativa de ru-ídos. Valores diferentes de g podem ser usados em diferentesmodalidades da presente invenção.
A variância de ruído para o microfone por via aé-rea, βα, é estimada baseado na observação de que o microfonede condução aérea é menos propenso a ruído do sensor que osensor alternativo. De tal modo, a variância do microfone decondução aérea pode ser calculada como:
<formula>formula see original document page 25</formula><formula>formula see original document page 26</formula>
onde
<formula>formula see original document page 26</formula>
onde é a estimativa de fala claro da amostragem prece-dente, τ é um fator de atenuação que em algumas modalidadesé ajustado em .2, a controla a extensão da redução de ruídode tal forma que se a>l, mais ruído é reduzido à custa deaumento da distorção de fala, e 73 dá o patamar mínimo de ru-ído e fornece meios para agregar ruído de fundo para masca-rar o ruído musical residual percebido. Em algumas modalida-des, β é ajustada igual a 0.01 para 20 dB de redução de ruí-do em amostragens de ruído puro.
Assim, na EQ. 28, a variância é determinada comouma soma sobrecarregada da estimativa do sinal de fala claroda amostragem precedente e a potência do sinal do microfonede condução aérea filtrado pela supressão de ruído no filtro Ks.
Em algumas modalidades, a é escolhida de acordocom uma taxa de sinal de ruído e o princípio de mascaragem oqual demonstra que a mesmo volume de ruído numa banda de al-ta energia de fala tem um impacto menor na percepção que nu-ma banda de baixa potência de fala e a presença de alta po-tência de fala numa freqüência reduzirá a percepção de ruídonuma banda de freqüência adjacente. Nesta modalidade, a éescolhida como:
<formula>formula see original document page 27</formula>
onde SNR é a taxa de sinal-ruído em decibéis (dB), B é a ta-xa de nível de sinal-ruído desejada acima, cuja redução deruído não deverá ser executada, e ao é o volume de ruído quedeverá ser removido no valor da taxa de sinal-ruído de 0. Emalgumas modalidades, B é ajustada igual a 20 dB.
Usando a definição de taxa de sinal-ruído de:
<formula>formula see original document page 27</formula>
o filtro de supressão de ruído da EQ. 29 se transforma em:
<formula>formula see original document page 27</formula>
Este filtro de supressão de ruído consegue baixasupressão de ruído para taxas positivas de sinal-ruído e al-ta supressão de ruído para taxas negativas de sinal-ruído.
De fato, para taxas suficientemente negativas de sinal-ruído, todos os sinais e ruídos observados são removidos e oúnico sinal presente é o patamar de ruído que é agregado devolta pela seção "fora isso" do filtro de supressão de ruí-dos da EQ. 33.Em algumas modalidades, a0 é de tal forma depen-dente de freqüências que diferentes volumes de ruídos sãoremovidos para freqüências diferentes. Numa modalidade, estadependência de freqüências é formada usando uma interpolaçãolinear entre a0 a 30Hz e ao a 8KHz tal que:
<formula>formula see original document page 28</formula>
onde k é a contagem do componente de freqüência,3omin é o valor de a0 desejado a 30Hz, aomax é o ao desejado a8KHZ e assume-se que há 256 componentes de freqüência.
Depois de determinar a variável da fala na etapa602, as variâncias são usadas para determinar as probabili-dades de cada estado de fala na etapa 604 usando as equações13 e 14 acima. A probabilidade dos estados de fala então éusada na etapa 606 para determinar estimativas de fala claropara a amostragem corrente. Como observado acima, nas moda-lidades em que se usa distribuição Gaussianica para repre-sentar H, as etapas 604 e 606 são repetidas usando a últimaestimativa do sinal de fala limpo em cada repetição e usandoas alterações das equações acima descritas para acomodar omodelo Gaussianico para H.
Embora a presente invenção tenha sido descrita comreferência a modalidades específicas, pessoas com conheci-mento da técnica reconhecerão que alterações podem ser fei-tas na forma e nos detalhes sem afastar-se do espírito e doescopo da invenção.
Claims (13)
1. Método para determinar uma estimativa para umvalor de ruido reduzido representando uma parte de um sinalde fala de ruído reduzido, o método sendo CARACTERIZADO pelofato de compreender:gerar um sinal de sensor alternativo usando umsensor alternativo;gerar um sinal de microfone de condução aérea;usar um sinal de sensor alternativo e o sinal demicrofone de condução aérea para estimar uma probabilidade,L(St) de um estado de fala, St, estimando uma probabilidadeseparada do estado de fala para cada de um conjunto de com-ponentes de freqüência e combinar as probabilidades separa-das para formar a probabilidade do estado de fala; eusar a probabilidade do estado de fala para esti-mar o valor de ruído reduzido, Xt, como:<formula>formula see original document page 29</formula>onde π5 é um posterior no estado e é dado por:<formula>formula see original document page 29</formula>e onde:<formula>formula see original document page 29</formula>onde:<formula>formula see original document page 29</formula>onde Μ* é o conjugado complexo, de M, Xt é um valorcom ruído reduzido, Yt é um valor para um quadro t do sinalde microfone de condução aérea, Bt é um valor para um quadrot do sinal de sensor alternativo, ou2 é uma variância de ru-ido de sensor no microfone de condução aérea, ow2 é uma va-riância de ruído de sensor no sensor alternativo, g2ov2 é avariância de ruído ambiente, G é a resposta de canal do sen-sor alternativo para ruído ambiente, H é a resposta de canaldo sensor alternativo para um sinal de fala limpo, S é oconjunto de todos estados de fala, e os2 é uma variância pa-ra uma distribuição que modela uma probabilidade de um valorde ruído reduzido dado um estado de fala.
2. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreender usar a estima-tiva de probabilidade de um estado de fala para determinarse um quadro do sinal de microfone de condução aérea contémfala.
3. Método, de acordo com a reivindicação 2,CARACTERIZADO adicionalmente por compreender usar um quadrodo sinal de microfone de condução aérea que é determinadopara não conter fala para determinar uma variância para umafonte de ruído e usar a variância para a fonte de ruído paraestimar o valor de ruído reduzido.
4. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreender estimar a vari-ação da distribuição como uma combinação linear de uma esti-mativa de um valor de ruído reduzido para um quadro prece-dente e uma versão filtrada do sinal de microfone de condu-ção aérea para um quadro corrente.
5. Método, de acordo com a reivindicação 4,CARACTERIZADO pelo fato de que a versão filtrada do sinal domicrofone de condução aérea é formada usando um filtro que édependente de freqüência.
6. Método, de acordo com a reivindicação 4,CARACTERIZADO pelo fato de que a versão filtrada do sinal demicrofone de condução aérea é formada usando um filtro que édependente de uma razão de sinal para ruido.
7. Método, de acordo com a reivindicação 1,CARACTERIZADO adicionalmente por compreende executar uma re-petição usando a estimativa de valor de ruido reduzido paraformar uma nova estimativa do valor de ruido reduzido.
8. Midia de armazenamento em computador,CARACTERIZADA pelo fato de possuir instruções executáveispor computador que quando executadas por um processador fa-zem com que o processador execute etapas que compreendem:receber um sinal de sensor alternativo gerado u-sando um sensor alternativo;receber um sinal de microfone de condução aéreagerado usando um microfone de condução aérea;determinar uma probabilidade de um estado de falabaseado em um sinal de sensor alternativo e em um sinal demicrofone de condução aérea estimando uma probabilidade se-parada do estado de fala para cada um de um conjunto de com-ponentes de freqüência e formando um produto das probabili-dades separadas para formar a probabilidade do estado de fala; eusar a probabilidade do estado, de fala para esti-mar um valor de fala limpo.
9. Midia legível por computador, de acordo com areivindicação 8, CARACTERIZADA pelo fato de'usar a probabi-lidade do estado de fala para estimar um valor de fala limpocompreende pesar um valor de expectativa.
10. Mídia legível por computador, de acordo com areivindicação 8, CARACTERIZADA pelo fato de usar a probabi-lidade do estado de fala para estimar um valor de fala lim-po, que compreende:usar a probabilidade do estado de fala para iden-tificar um quadro de um sinal como um quadro de não-fala;usar o quadro de não-fala para estimar uma variân-cia para um ruído; eusar a variância para o ruído para estimar o valorde fala limpo.
11. Método para identificar um valor de fala limpopara um sinal de fala limpo, o método sendo CARACTERIZADOpor compreender:receber um sinal de sensor alternativo gerado u-sando um sensor alternativo;receber um sinal de microfone de condução aéreagerado usando um microfone de condução aérea;formar um modelo onde o sinal de fala limpo é de-pendente de um estado de fala, um sinal de sensor alternati-vo é dependente do sinal de fala limpo, e um sinal de micro-fone de condução aérea é dependente do sinal de fala limpo,onde formar o modelo compreende modelar uma probabilidade deum valor do sinal de fala limpo dado um estado de fala comouma distribuição tendo uma variância; edeterminar um valor filtrado do sinal de microfonede condução aérea aplicando um valor para um quadro correntedo sinal de microfone de condução aérea para um filtro desupressão de ruido dependente de freqüência que é uma funçãode uma variância de ruido ambiente;determinar a variância da distribuição como umacombinação linear de uma estimativa de um valor para um si-nal de fala limpo para um quadro precedente e o valor fil-trado do sinal de microfone de condução aérea;determinar uma estimativa de valor de fala limpopara o quadro corrente baseado no modelo, a variância dadistribuição, um valor para o sinal de sensor alternativopara o quadro corrente, e um valor para o sinal de um micro-fone de condução aérea para o quadro corrente.
12. Método, de acordo com a reivindicação 11,- CARACTERIZADO adicionalmente por compreender determinar umaprobabilidade para um estado, e onde determinar uma estima-tiva de valor de fala limpo adicionalmente compreende usar aprobabilidade para o estado.
13. Método, de acordo com a reivindicação 11,CARACTERIZADO pelo fato de que formar o modelo compreendeformar um modelo, no qual o sinal do sensor alternativo e osinal do microfone de condução aérea são dependentes de umafonte de ruido.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US11/168.770 | 2005-06-28 | ||
| US11/168,770 US7680656B2 (en) | 2005-06-28 | 2005-06-28 | Multi-sensory speech enhancement using a speech-state model |
| PCT/US2006/022863 WO2007001821A2 (en) | 2005-06-28 | 2006-06-13 | Multi-sensory speech enhancement using a speech-state model |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| BRPI0612668A2 true BRPI0612668A2 (pt) | 2010-11-30 |
Family
ID=37568662
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| BRPI0612668-5A BRPI0612668A2 (pt) | 2005-06-28 | 2006-06-13 | fala multisensorial usando um modelo de estado de fala |
Country Status (11)
| Country | Link |
|---|---|
| US (1) | US7680656B2 (pt) |
| EP (1) | EP1891624B1 (pt) |
| JP (2) | JP5000647B2 (pt) |
| KR (1) | KR101224755B1 (pt) |
| CN (1) | CN101606191B (pt) |
| AT (1) | ATE508454T1 (pt) |
| BR (1) | BRPI0612668A2 (pt) |
| DE (1) | DE602006021741D1 (pt) |
| MX (1) | MX2007015446A (pt) |
| RU (1) | RU2420813C2 (pt) |
| WO (1) | WO2007001821A2 (pt) |
Families Citing this family (20)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CA2621940C (en) * | 2005-09-09 | 2014-07-29 | Mcmaster University | Method and device for binaural signal enhancement |
| KR100738332B1 (ko) * | 2005-10-28 | 2007-07-12 | 한국전자통신연구원 | 성대신호 인식 장치 및 그 방법 |
| US8364492B2 (en) * | 2006-07-13 | 2013-01-29 | Nec Corporation | Apparatus, method and program for giving warning in connection with inputting of unvoiced speech |
| JP4940956B2 (ja) * | 2007-01-10 | 2012-05-30 | ヤマハ株式会社 | 音声伝送システム |
| JP4950930B2 (ja) * | 2008-04-03 | 2012-06-13 | 株式会社東芝 | 音声/非音声を判定する装置、方法およびプログラム |
| US9159335B2 (en) * | 2008-10-10 | 2015-10-13 | Samsung Electronics Co., Ltd. | Apparatus and method for noise estimation, and noise reduction apparatus employing the same |
| CN102411936B (zh) * | 2010-11-25 | 2012-11-14 | 歌尔声学股份有限公司 | 语音增强方法、装置及头戴式降噪通信耳机 |
| US9589580B2 (en) | 2011-03-14 | 2017-03-07 | Cochlear Limited | Sound processing based on a confidence measure |
| US10418047B2 (en) | 2011-03-14 | 2019-09-17 | Cochlear Limited | Sound processing with increased noise suppression |
| US9094749B2 (en) | 2012-07-25 | 2015-07-28 | Nokia Technologies Oy | Head-mounted sound capture device |
| TWI502583B (zh) * | 2013-04-11 | 2015-10-01 | Wistron Corp | 語音處理裝置和語音處理方法 |
| US9928851B2 (en) * | 2013-09-12 | 2018-03-27 | Mediatek Inc. | Voice verifying system and voice verifying method which can determine if voice signal is valid or not |
| US20150161999A1 (en) * | 2013-12-09 | 2015-06-11 | Ravi Kalluri | Media content consumption with individualized acoustic speech recognition |
| TWM492015U (zh) * | 2014-07-30 | 2014-12-11 | Wen-Tsung Sun | 電子式助發聲裝置 |
| CN105448303B (zh) * | 2015-11-27 | 2020-02-04 | 百度在线网络技术(北京)有限公司 | 语音信号的处理方法和装置 |
| CN107045874B (zh) * | 2016-02-05 | 2021-03-02 | 深圳市潮流网络技术有限公司 | 一种基于相关性的非线性语音增强方法 |
| US10535364B1 (en) * | 2016-09-08 | 2020-01-14 | Amazon Technologies, Inc. | Voice activity detection using air conduction and bone conduction microphones |
| CN110265056B (zh) * | 2019-06-11 | 2021-09-17 | 安克创新科技股份有限公司 | 音源的控制方法以及扬声设备、装置 |
| CN114424581B (zh) | 2019-09-12 | 2025-09-19 | 深圳市韶音科技有限公司 | 用于音频信号生成的系统和方法 |
| CN116778944A (zh) * | 2023-07-10 | 2023-09-19 | 深圳百瑞互联技术有限公司 | 噪声估计方法、装置、介质和设备 |
Family Cites Families (108)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US3383466A (en) | 1964-05-28 | 1968-05-14 | Navy Usa | Nonacoustic measures in automatic speech recognition |
| US3746789A (en) | 1971-10-20 | 1973-07-17 | E Alcivar | Tissue conduction microphone utilized to activate a voice operated switch |
| US3787641A (en) | 1972-06-05 | 1974-01-22 | Setcom Corp | Bone conduction microphone assembly |
| US3838466A (en) * | 1973-01-26 | 1974-10-01 | White S | Non-fogging face shield |
| US4025721A (en) * | 1976-05-04 | 1977-05-24 | Biocommunications Research Corporation | Method of and means for adaptively filtering near-stationary noise from speech |
| JPH0755167B2 (ja) | 1988-09-21 | 1995-06-14 | 松下電器産業株式会社 | 移動体 |
| JPH03108997A (ja) | 1989-09-22 | 1991-05-09 | Temuko Japan:Kk | 骨伝導マイク |
| US5148488A (en) * | 1989-11-17 | 1992-09-15 | Nynex Corporation | Method and filter for enhancing a noisy speech signal |
| JPH03160851A (ja) | 1989-11-20 | 1991-07-10 | Fujitsu Ltd | 携帯電話機 |
| US5054079A (en) | 1990-01-25 | 1991-10-01 | Stanton Magnetics, Inc. | Bone conduction microphone with mounting means |
| US5404577A (en) | 1990-07-13 | 1995-04-04 | Cairns & Brother Inc. | Combination head-protective helmet & communications system |
| WO1993001664A1 (en) | 1991-07-08 | 1993-01-21 | Motorola, Inc. | Remote voice control system |
| US5295193A (en) | 1992-01-22 | 1994-03-15 | Hiroshi Ono | Device for picking up bone-conducted sound in external auditory meatus and communication device using the same |
| JPH05276587A (ja) | 1992-03-30 | 1993-10-22 | Retsutsu Corp:Kk | イヤーマイクロフォン |
| US5590241A (en) | 1993-04-30 | 1996-12-31 | Motorola Inc. | Speech processing system and method for enhancing a speech signal in a noisy environment |
| US5446789A (en) | 1993-11-10 | 1995-08-29 | International Business Machines Corporation | Electronic device having antenna for receiving soundwaves |
| ZA948426B (en) | 1993-12-22 | 1995-06-30 | Qualcomm Inc | Distributed voice recognition system |
| AU684872B2 (en) | 1994-03-10 | 1998-01-08 | Cable And Wireless Plc | Communication system |
| US5828768A (en) | 1994-05-11 | 1998-10-27 | Noise Cancellation Technologies, Inc. | Multimedia personal computer with active noise reduction and piezo speakers |
| US6471420B1 (en) * | 1994-05-13 | 2002-10-29 | Matsushita Electric Industrial Co., Ltd. | Voice selection apparatus voice response apparatus, and game apparatus using word tables from which selected words are output as voice selections |
| JP3082825B2 (ja) | 1994-08-29 | 2000-08-28 | 日本電信電話株式会社 | 通信装置 |
| DE69527731T2 (de) | 1994-05-18 | 2003-04-03 | Nippon Telegraph & Telephone Co., Tokio/Tokyo | Sender-Empfänger mit einem akustischen Wandler vom Ohrpassstück-Typ |
| US5727124A (en) * | 1994-06-21 | 1998-03-10 | Lucent Technologies, Inc. | Method of and apparatus for signal recognition that compensates for mismatching |
| JP3488749B2 (ja) | 1994-08-23 | 2004-01-19 | 株式会社ダッド・ジャパン | 骨伝導型マイクロホン |
| JP3306784B2 (ja) | 1994-09-05 | 2002-07-24 | 日本電信電話株式会社 | 骨導マイクロホン出力信号再生装置 |
| JPH08186654A (ja) | 1994-12-22 | 1996-07-16 | Internatl Business Mach Corp <Ibm> | 携帯端末装置 |
| US5692059A (en) | 1995-02-24 | 1997-11-25 | Kruger; Frederick M. | Two active element in-the-ear microphone system |
| US5555449A (en) | 1995-03-07 | 1996-09-10 | Ericsson Inc. | Extendible antenna and microphone for portable communication unit |
| KR960042590A (ko) | 1995-05-23 | 1996-12-21 | 김광호 | 테이프 재생용 음량기기에서의 발음비교방법 |
| US5647834A (en) | 1995-06-30 | 1997-07-15 | Ron; Samuel | Speech-based biofeedback method and system |
| RU2163032C2 (ru) * | 1995-09-14 | 2001-02-10 | Эрикссон Инк. | Система адаптивной фильтрации аудиосигналов для улучшения разборчивости речи при наличии шума |
| JPH09172479A (ja) | 1995-12-20 | 1997-06-30 | Yokoi Kikaku:Kk | 送受話器およびそれを用いた通話装置 |
| US6243596B1 (en) | 1996-04-10 | 2001-06-05 | Lextron Systems, Inc. | Method and apparatus for modifying and integrating a cellular phone with the capability to access and browse the internet |
| JP3097901B2 (ja) | 1996-06-28 | 2000-10-10 | 日本電信電話株式会社 | 通話装置 |
| JP3095214B2 (ja) | 1996-06-28 | 2000-10-03 | 日本電信電話株式会社 | 通話装置 |
| US5943627A (en) | 1996-09-12 | 1999-08-24 | Kim; Seong-Soo | Mobile cellular phone |
| JPH10261910A (ja) | 1997-01-16 | 1998-09-29 | Sony Corp | 携帯無線装置およびアンテナ装置 |
| JPH10224253A (ja) | 1997-02-10 | 1998-08-21 | Sony Corp | 携帯通信機 |
| US6308062B1 (en) | 1997-03-06 | 2001-10-23 | Ericsson Business Networks Ab | Wireless telephony system enabling access to PC based functionalities |
| JP3108997B2 (ja) | 1997-03-31 | 2000-11-13 | 武田薬品工業株式会社 | アゾール化合物、その製造法および用途 |
| FR2761800A1 (fr) | 1997-04-02 | 1998-10-09 | Scanera Sc | Dispositif de transmission de voix et telephone le mettant en oeuvre |
| US5983073A (en) | 1997-04-04 | 1999-11-09 | Ditzik; Richard J. | Modular notebook and PDA computer systems for personal computing and wireless communications |
| US6175633B1 (en) | 1997-04-09 | 2001-01-16 | Cavcom, Inc. | Radio communications apparatus with attenuating ear pieces for high noise environments |
| US5924065A (en) * | 1997-06-16 | 1999-07-13 | Digital Equipment Corporation | Environmently compensated speech processing |
| JPH1115191A (ja) * | 1997-06-20 | 1999-01-22 | Fuji Xerox Co Ltd | 静電荷像現像用トナー及びその製造方法 |
| AU8205398A (en) | 1997-07-16 | 1999-02-10 | Siemens Aktiengesellschaft | Hand-held telephone device |
| JPH11249692A (ja) | 1998-02-27 | 1999-09-17 | Nec Saitama Ltd | 音声認識装置 |
| US6912287B1 (en) | 1998-03-18 | 2005-06-28 | Nippon Telegraph And Telephone Corporation | Wearable communication device |
| JPH11265199A (ja) | 1998-03-18 | 1999-09-28 | Nippon Telegr & Teleph Corp <Ntt> | 送話器 |
| JP2000009688A (ja) | 1998-04-22 | 2000-01-14 | Tokyo Gas Co Ltd | 一酸化炭素センサ |
| US6052464A (en) | 1998-05-29 | 2000-04-18 | Motorola, Inc. | Telephone set having a microphone for receiving or an earpiece for generating an acoustic signal via a keypad |
| US6137883A (en) | 1998-05-30 | 2000-10-24 | Motorola, Inc. | Telephone set having a microphone for receiving an acoustic signal via keypad |
| JP3160714B2 (ja) | 1998-07-08 | 2001-04-25 | 株式会社シコー技研 | 携帯無線通信機 |
| JP3893763B2 (ja) | 1998-08-17 | 2007-03-14 | 富士ゼロックス株式会社 | 音声検出装置 |
| WO2000021194A1 (en) | 1998-10-08 | 2000-04-13 | Resound Corporation | Dual-sensor voice transmission system |
| JP2000196723A (ja) | 1998-12-25 | 2000-07-14 | Koichi Tamura | 筒状アンテナ、マイク |
| JP2000209688A (ja) | 1999-01-19 | 2000-07-28 | Temuko Japan:Kk | 骨導マイク |
| US6760600B2 (en) | 1999-01-27 | 2004-07-06 | Gateway, Inc. | Portable communication apparatus |
| US6408269B1 (en) * | 1999-03-03 | 2002-06-18 | Industrial Technology Research Institute | Frame-based subband Kalman filtering method and apparatus for speech enhancement |
| JP2000261529A (ja) | 1999-03-10 | 2000-09-22 | Nippon Telegr & Teleph Corp <Ntt> | 通話装置 |
| JP2000261534A (ja) | 1999-03-10 | 2000-09-22 | Nippon Telegr & Teleph Corp <Ntt> | 送受話器 |
| JP2000261530A (ja) | 1999-03-10 | 2000-09-22 | Nippon Telegr & Teleph Corp <Ntt> | 通話装置 |
| DE19917169A1 (de) | 1999-04-16 | 2000-11-02 | Kamecke Keller Orla | Verfahren zur Speicherung und Wiedergabe von Audio-, Video- und Anwendungsprogrammdaten in Mobilfunkendgeräten |
| US6542721B2 (en) | 1999-10-11 | 2003-04-01 | Peter V. Boesen | Cellular telephone, personal digital assistant and pager unit |
| US6094492A (en) | 1999-05-10 | 2000-07-25 | Boesen; Peter V. | Bone conduction voice transmission apparatus and system |
| US6952483B2 (en) | 1999-05-10 | 2005-10-04 | Genisus Systems, Inc. | Voice transmission apparatus with UWB |
| US6560468B1 (en) | 1999-05-10 | 2003-05-06 | Peter V. Boesen | Cellular telephone, personal digital assistant, and pager unit with capability of short range radio frequency transmissions |
| US20020057810A1 (en) | 1999-05-10 | 2002-05-16 | Boesen Peter V. | Computer and voice communication unit with handsfree device |
| JP2000330597A (ja) * | 1999-05-20 | 2000-11-30 | Matsushita Electric Ind Co Ltd | 雑音抑圧装置 |
| JP2000354284A (ja) | 1999-06-10 | 2000-12-19 | Iwatsu Electric Co Ltd | 送受一体形電気音響変換器を用いる送受話装置 |
| US6594629B1 (en) | 1999-08-06 | 2003-07-15 | International Business Machines Corporation | Methods and apparatus for audio-visual speech detection and recognition |
| KR100304666B1 (ko) | 1999-08-28 | 2001-11-01 | 윤종용 | 음성 향상 방법 |
| JP2001119797A (ja) | 1999-10-15 | 2001-04-27 | Phone Or Ltd | 携帯電話装置 |
| US6339706B1 (en) | 1999-11-12 | 2002-01-15 | Telefonaktiebolaget L M Ericsson (Publ) | Wireless voice-activated remote control device |
| US6675027B1 (en) | 1999-11-22 | 2004-01-06 | Microsoft Corp | Personal mobile computing device having antenna microphone for improved speech recognition |
| US6411933B1 (en) | 1999-11-22 | 2002-06-25 | International Business Machines Corporation | Methods and apparatus for correlating biometric attributes and biometric attribute production features |
| JP3576915B2 (ja) | 2000-02-28 | 2004-10-13 | 株式会社ケンウッド | 携帯電話装置 |
| JP2001292489A (ja) | 2000-04-10 | 2001-10-19 | Kubota Corp | 骨伝導マイク付きヘッドホン |
| GB2363557A (en) * | 2000-06-16 | 2001-12-19 | At & T Lab Cambridge Ltd | Method of extracting a signal from a contaminated signal |
| JP3339579B2 (ja) | 2000-10-04 | 2002-10-28 | 株式会社鷹山 | 電話装置 |
| JP2002125298A (ja) | 2000-10-13 | 2002-04-26 | Yamaha Corp | マイク装置およびイヤホンマイク装置 |
| US20020075306A1 (en) | 2000-12-18 | 2002-06-20 | Christopher Thompson | Method and system for initiating communications with dispersed team members from within a virtual team environment using personal identifiers |
| US7617099B2 (en) | 2001-02-12 | 2009-11-10 | FortMedia Inc. | Noise suppression by two-channel tandem spectrum modification for speech signal in an automobile |
| US7082393B2 (en) | 2001-03-27 | 2006-07-25 | Rast Associates, Llc | Head-worn, trimodal device to increase transcription accuracy in a voice recognition system and to process unvocalized speech |
| GB2375276B (en) | 2001-05-03 | 2003-05-28 | Motorola Inc | Method and system of sound processing |
| WO2002098169A1 (en) | 2001-05-30 | 2002-12-05 | Aliphcom | Detecting voiced and unvoiced speech using both acoustic and nonacoustic sensors |
| JP2002358089A (ja) | 2001-06-01 | 2002-12-13 | Denso Corp | 音声処理装置及び音声処理方法 |
| US6987986B2 (en) | 2001-06-21 | 2006-01-17 | Boesen Peter V | Cellular telephone, personal digital assistant with dual lines for simultaneous uses |
| US7054423B2 (en) | 2001-09-24 | 2006-05-30 | Nebiker Robert M | Multi-media communication downloading |
| JP3532544B2 (ja) | 2001-10-30 | 2004-05-31 | 株式会社テムコジャパン | 面体又は帽体のストラップ装着用送受話装置 |
| US6664713B2 (en) | 2001-12-04 | 2003-12-16 | Peter V. Boesen | Single chip device for voice communications |
| US20050141730A1 (en) | 2001-12-21 | 2005-06-30 | Rti Tech Pte Ltd. | Vibration-based talk-through method and apparatus |
| US7219062B2 (en) | 2002-01-30 | 2007-05-15 | Koninklijke Philips Electronics N.V. | Speech activity detection using acoustic and facial characteristics in an automatic speech recognition system |
| US9374451B2 (en) | 2002-02-04 | 2016-06-21 | Nokia Technologies Oy | System and method for multimodal short-cuts to digital services |
| GB2390264B (en) | 2002-06-24 | 2006-07-12 | Samsung Electronics Co Ltd | Usage position detection |
| US7103541B2 (en) * | 2002-06-27 | 2006-09-05 | Microsoft Corporation | Microphone array signal enhancement using mixture models |
| US7146315B2 (en) * | 2002-08-30 | 2006-12-05 | Siemens Corporate Research, Inc. | Multichannel voice detection in adverse environments |
| US7047047B2 (en) | 2002-09-06 | 2006-05-16 | Microsoft Corporation | Non-linear observation model for removing noise from corrupted signals |
| US7225124B2 (en) * | 2002-12-10 | 2007-05-29 | International Business Machines Corporation | Methods and apparatus for multiple source signal separation |
| US7269560B2 (en) * | 2003-06-27 | 2007-09-11 | Microsoft Corporation | Speech detection and enhancement using audio/video fusion |
| US20060008256A1 (en) | 2003-10-01 | 2006-01-12 | Khedouri Robert K | Audio visual player apparatus and system and method of content distribution using the same |
| US7447630B2 (en) | 2003-11-26 | 2008-11-04 | Microsoft Corporation | Method and apparatus for multi-sensory speech enhancement |
| US7499686B2 (en) | 2004-02-24 | 2009-03-03 | Microsoft Corporation | Method and apparatus for multi-sensory speech enhancement on a mobile device |
| EP1600947A3 (en) * | 2004-05-26 | 2005-12-21 | Honda Research Institute Europe GmbH | Subtractive cancellation of harmonic noise |
| US8095073B2 (en) | 2004-06-22 | 2012-01-10 | Sony Ericsson Mobile Communications Ab | Method and apparatus for improved mobile station and hearing aid compatibility |
| US7574008B2 (en) | 2004-09-17 | 2009-08-11 | Microsoft Corporation | Method and apparatus for multi-sensory speech enhancement |
| US7283850B2 (en) | 2004-10-12 | 2007-10-16 | Microsoft Corporation | Method and apparatus for multi-sensory speech enhancement on a mobile device |
| US7590529B2 (en) | 2005-02-04 | 2009-09-15 | Microsoft Corporation | Method and apparatus for reducing noise corruption from an alternative sensor signal during multi-sensory speech enhancement |
-
2005
- 2005-06-28 US US11/168,770 patent/US7680656B2/en not_active Expired - Fee Related
-
2006
- 2006-06-13 RU RU2007149546/09A patent/RU2420813C2/ru not_active IP Right Cessation
- 2006-06-13 WO PCT/US2006/022863 patent/WO2007001821A2/en not_active Ceased
- 2006-06-13 EP EP06772956A patent/EP1891624B1/en not_active Not-in-force
- 2006-06-13 AT AT06772956T patent/ATE508454T1/de not_active IP Right Cessation
- 2006-06-13 KR KR1020077029014A patent/KR101224755B1/ko not_active Expired - Fee Related
- 2006-06-13 CN CN2006800226393A patent/CN101606191B/zh not_active Expired - Fee Related
- 2006-06-13 DE DE602006021741T patent/DE602006021741D1/de active Active
- 2006-06-13 JP JP2008519337A patent/JP5000647B2/ja not_active Expired - Fee Related
- 2006-06-13 MX MX2007015446A patent/MX2007015446A/es not_active Application Discontinuation
- 2006-06-13 BR BRPI0612668-5A patent/BRPI0612668A2/pt not_active IP Right Cessation
-
2012
- 2012-04-13 JP JP2012092031A patent/JP5452655B2/ja not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| MX2007015446A (es) | 2008-02-25 |
| US7680656B2 (en) | 2010-03-16 |
| US20060293887A1 (en) | 2006-12-28 |
| EP1891624A2 (en) | 2008-02-27 |
| KR101224755B1 (ko) | 2013-01-21 |
| JP2012155339A (ja) | 2012-08-16 |
| RU2420813C2 (ru) | 2011-06-10 |
| JP5452655B2 (ja) | 2014-03-26 |
| ATE508454T1 (de) | 2011-05-15 |
| EP1891624B1 (en) | 2011-05-04 |
| RU2007149546A (ru) | 2009-07-10 |
| DE602006021741D1 (de) | 2011-06-16 |
| WO2007001821A3 (en) | 2009-04-30 |
| WO2007001821A2 (en) | 2007-01-04 |
| CN101606191B (zh) | 2012-03-21 |
| JP2009501940A (ja) | 2009-01-22 |
| KR20080019222A (ko) | 2008-03-03 |
| CN101606191A (zh) | 2009-12-16 |
| JP5000647B2 (ja) | 2012-08-15 |
| EP1891624A4 (en) | 2009-11-04 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| BRPI0612668A2 (pt) | fala multisensorial usando um modelo de estado de fala | |
| KR101099339B1 (ko) | 복수-감지기형 음성 향상 방법 및 컴퓨터-판독가능 매체 | |
| US20220328041A1 (en) | Training neural networks to predict acoustic sequences using observed prosody info | |
| CN108615535B (zh) | 语音增强方法、装置、智能语音设备和计算机设备 | |
| KR101153093B1 (ko) | 다감각 음성 향상을 위한 방법 및 장치 | |
| CN113744762B (zh) | 一种信噪比确定方法、装置、电子设备和存储介质 | |
| WO2023116660A2 (zh) | 一种模型训练以及音色转换方法、装置、设备及介质 | |
| KR102198598B1 (ko) | 합성 음성 신호 생성 방법, 뉴럴 보코더 및 뉴럴 보코더의 훈련 방법 | |
| CN116129869A (zh) | 语音风格迁移合成方法及装置、电子设备、存储介质 | |
| JP2016522421A (ja) | 入力雑音混入信号を強調する方法およびシステム | |
| KR20080018163A (ko) | 깨끗한 음성 사전 확률을 이용한 멀티센서 음성 향상 | |
| CN111326166B (zh) | 语音处理方法及装置、计算机可读存储介质、电子设备 | |
| CN114596870A (zh) | 实时音频处理方法和装置、计算机存储介质、电子设备 | |
| KR20200092500A (ko) | 뉴럴 보코더 및 화자 적응형 모델을 구현하기 위한 뉴럴 보코더의 훈련 방법 | |
| US12340793B1 (en) | Augmenting voice samples based on distributions of speaker classes | |
| CN116543778B (zh) | 声码器训练方法、音频合成方法、介质、装置和计算设备 | |
| CN111583945B (zh) | 用于处理音频的方法、装置、电子设备和计算机可读介质 | |
| CN112382296A (zh) | 一种声纹遥控无线音频设备的方法和装置 | |
| CN116975795A (zh) | 音频资源的侵权检测方法、装置、存储介质和计算设备 | |
| WO2024009746A1 (ja) | モデル生成装置、モデル生成方法、信号処理装置、信号処理方法、及び、プログラム |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| B08F | Application dismissed because of non-payment of annual fees [chapter 8.6 patent gazette] |
Free format text: REFERENTE A 6A ANUIDADE. |
|
| B08K | Patent lapsed as no evidence of payment of the annual fee has been furnished to inpi [chapter 8.11 patent gazette] |
Free format text: NAO APRESENTADA A GUIA DE CUMPRIMENTO DE EXIGENCIA. REFERENTE A 6A ANUIDADE. |