BRPI0714140A2 - detecÇço de uma secretÁria eletrânica utilizando reconhecimento de fala - Google Patents
detecÇço de uma secretÁria eletrânica utilizando reconhecimento de fala Download PDFInfo
- Publication number
- BRPI0714140A2 BRPI0714140A2 BRPI0714140-8A BRPI0714140A BRPI0714140A2 BR PI0714140 A2 BRPI0714140 A2 BR PI0714140A2 BR PI0714140 A BRPI0714140 A BR PI0714140A BR PI0714140 A2 BRPI0714140 A2 BR PI0714140A2
- Authority
- BR
- Brazil
- Prior art keywords
- processing
- answering machine
- call recipient
- audible response
- output
- Prior art date
Links
- 238000001514 detection method Methods 0.000 title claims abstract description 15
- 230000004044 response Effects 0.000 claims abstract description 36
- 238000000034 method Methods 0.000 claims abstract description 28
- 238000007619 statistical method Methods 0.000 claims description 6
- 230000008569 process Effects 0.000 abstract description 9
- 238000010586 diagram Methods 0.000 description 6
- 230000003287 optical effect Effects 0.000 description 5
- 238000004891 communication Methods 0.000 description 3
- 238000005516 engineering process Methods 0.000 description 2
- 239000000945 filler Substances 0.000 description 2
- 230000005055 memory storage Effects 0.000 description 2
- 230000002093 peripheral effect Effects 0.000 description 2
- 239000007787 solid Substances 0.000 description 2
- 238000013528 artificial neural network Methods 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 238000003066 decision tree Methods 0.000 description 1
- 230000001419 dependent effect Effects 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 238000012706 support-vector machine Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/26—Speech to text systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M3/00—Automatic or semi-automatic exchanges
- H04M3/42—Systems providing special services or facilities to subscribers
- H04M3/50—Centralised arrangements for answering calls; Centralised arrangements for recording messages for absent or busy subscribers ; Centralised arrangements for recording messages
- H04M3/51—Centralised call answering arrangements requiring operator intervention, e.g. call or contact centers for telemarketing
- H04M3/5158—Centralised call answering arrangements requiring operator intervention, e.g. call or contact centers for telemarketing in combination with automated outdialling systems
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2203/00—Aspects of automatic or semi-automatic exchanges
- H04M2203/20—Aspects of automatic or semi-automatic exchanges related to features of supplementary services
- H04M2203/2027—Live party detection
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Business, Economics & Management (AREA)
- Marketing (AREA)
- Telephonic Communication Services (AREA)
- Telephone Function (AREA)
Abstract
DETECÇçO DE UMA SECRETÁRIA ELETRâNICA UTILIZANDO RECONHECIMENTO DE FALA. Um módulo de detecção de secretária eletrônica é utilizado para determinar se um recipiente de uma chamada é uma pessoa ou uma secretária eletrônica. O módulo de detecção de secretária eletrônica inclui um reconhecedor de fala e um módulo de análise de chamada. O reconhecedor de fala recebe uma resposta audível do recipiente da chamada para uma chamada. O reconhecedor de fala processa a resposta audível e fornece uma saída indicativa da fala reconhecida. O módulo de análise de chamada processa a saída do reconhecedor de fala para gerar uma saída indicativa de se o recipiente de chamada é uma pessoa ou uma secretária eletrônica.
Description
"DETECÇÃO DE UMA SECRETÁRIA ELETRÔNICA UTILIZANDO RECONHECIMENTO DE FALA"
Fundamentos
A discussão abaixo é meramente fornecida para informação de suporte geral e não deve ser utilizada como um auxílio na determinação do escopo da matéria reivindicada.
O uso de sistemas de chamada telefônica de saída automatizados é bem comum. Além de serem utilizados para fins de comercialização, tais sistemas também podem ser utilizados por consultórios médicos ou clínicas para contatar pacientes para confirmar ou alterar suas consultas, por escolas para informar aos alunos sobre mudanças de programa- ção, por entidades de caridade para obtenção de contribuições, e agências governamentais para fornecer a notificação ou outras informações, para citar apenas algumas poucas das outras aplicações.
Em muitos casos, pode ser necessário ou útil se determinar automaticamente se o recipiente da chamada telefônica é uma pessoa de verdade ou uma secretária eletrônica. Dependendo de se uma pessoa atendeu ou uma secretária eletrônica está em uso, diferen- tes ações podem ser tomadas pelo sistema de chamada telefônica de saída. No entanto, essa tarefa, análise de chamada, é difícil e atualmente imprecisa.
A análise de chamada é comumente realizada no nível de comutação de hardware. A análise é implementada pela utilização de um intervalo curto quando o recipiente inicial- mente atende à chamada e antes de a chamada ser conectada ao aplicativo de telefonia. Durante esse intervalo, quando o recipiente começa a falar, o sistema processará os sinais audíveis recebidos com relação a, por exemplo, conteúdo de energia, intensidade ou outros parâmetros de sinal de sinais audíveis, a fim de determinar se o recipiente é uma pessoa ou uma secretária eletrônica. É importante se compreender que o aplicativo de telefonia não sabe que a chamada foi atendida nesse momento, e, portanto, não distribuiu qualquer aviso inicial. Dessa forma, na outra extremidade da linha, apesar de o recipiente ter atendido à chamada e ter dito uma saudação tipo "alô", o recipiente só ouve silêncio de volta visto que o sistema está realizando a análise da chamada. Em muitos casos, o recipiente simples- mente desligará. Sumário
O Sumário é fornecido para introduzir uma seleção de conceitos de uma forma sim- plificada que são adicionalmente descritos abaixo na Descrição Detalhada. O Sumário não deve identificar características chave ou características essenciais da matéria reivindicada, nem deve ser utilizado como um auxílio na determinação do escopo da matéria reivindicada. Adicionalmente, a matéria reivindicada não está limitada às implementações que solucionam qualquer ou todas as desvantagens notadas nos fundamentos.
Um módulo de detecção de secretária eletrônica é utilizado para determinar se um recipiente de chamada é uma pessoal ou uma secretária eletrônica. O módulo de detecção de secretária eletrônica inclui um reconhecedor de fala e um módulo de análise de chama- da. O reconhecedor de fala recebe uma resposta audível do recipiente de chamada para uma chamada. O reconhecedor de fala processa a resposta audível e fornece uma saída indicativa da fala reconhecida. O módulo de análise de chamada processa a saída do reco- nhecedor de fala para gerar uma saída indicativa de se o recipiente da chamada é uma pes- soa ou uma secretária eletrônica. Em uma modalidade, o módulo de análise de chamada pode incluir um módulo classificador que fornece análise estatística da saída do reconhece- dor de fala para determinar se um recipiente de chamada é uma pessoa ou secretária ele- trônica.
Também é descrita uma técnica para garantir que toda a mensagem do chamador seja gravada pela secretária eletrônica. Em particular, um reconhecedor de fala é operado para detectar eventos de "invasão" pela secretária eletrônica, e onde a mensagem é repro- duzida para a secretária eletrônica se um evento de "invasão" for detectado. Apesar disso poder fazer com que a mensagem seja reproduzida uma ou mais vezes, isso é particular- mente vantajoso visto que qualquer evento de "invasão" significa que a saudação da secre- tária eletrônica ainda não acabou, e, dessa forma, a secretária eletrônica não está pronta para gravar uma mensagem. Pela reprodução da mensagem após cada evento de "inva- são", depois da reprodução da mensagem após o último evento de "invasão" é garantido que toda a mensagem seja gravada quando a secretária eletrônica está pronta para gravar a mensagem.
Breve Descrição dos Desenhos
A figura 1 é uma representação em diagrama em bloco esquemática de um sistema de discagem;
A figura 2 é uma representação em diagrama em bloco esquemática de componen- tes do sistema de discagem ilustrado na figura 1;
A figura 3 é um diagrama em bloco esquemático para o processamento de uma chamada;
A figura 4 é um fluxograma para o processamento de uma chamada;
A figura 5 é um fluxograma mais detalhado para o processamento da chamada;
A figura 6 é um ambiente de computação ilustrativo.
Descrição Detalhada
As figuras 1 e 2 são diagramas em bloco esquemáticos de um sistema de discagem ou de chamada de saída 100. O sistema 100 é implementado de forma ilustrativa dentro de um dos ambientes de computação discutidos em associação com a figura 6 discutida abai- xo, ou dentro de outros ambientes de computação adequados. Como ilustrado na figura 1, o sistema de chamada de saída 100 realiza as chamadas para qualquer um dentre a plurali- dade de recipientes de chamada 102 (recipientes de chamada 102-1 a 102-M são ilustra- dos). Como utilizado aqui, um "recipiente de chamada" pode ser uma pessoa ou uma secre- tária eletrônica. Depois da realização de uma chamada para um dos recipientes de chamada 102-1 a 102-M, o sistema de chamada de saída 100 determina se o recipiente da chamada é uma pessoa ou se uma secretária eletrônica está em uso.
A figura 2 ilustra em maiores detalhes os componentes ou módulos do sistema de chamada de saída 100 de acordo com uma modalidade ilustrativa. Como ilustrado, o siste- ma de chamada de saída 100 realiza as chamadas para um ou mais recipientes de chama- da 102. Um módulo de detecção de secretária eletrônica 106 é utilizado para determinar se o recipiente da chamada 102 é uma pessoa ou uma secretária eletrônica. Em uma aplicação típica, um módulo de aplicativo 104 inicia a discagem do número de telefone do recipiente da chamada recuperado a partir de, por exemplo, uma base de dados de números telefôni- cos 108. O módulo de detecção de secretária eletrônica 106 é então utilizado para determi- nar se o recipiente da chamada 102 é uma pessoa ou uma secretária eletrônica. Ações dife- rentes serão tomadas pelo sistema de chamada de saída 100 de acordo com a saída do módulo de detecção 106. Por exemplo, se o recipiente da chamada for uma pessoa, o mó- dulo de aplicativo 104 pode então transferir a chamada para um operador 110, ou engatar o recipiente em uma conversação automática. Do contrário, o módulo de aplicação 104 pode ser utilizado para deixar uma mensagem na secretária eletrônica do recipiente da chamada 102. Na figura 2, os recipientes da chamada 102, a base de dados do número telefônico 108 e o operador 110 são ilustrados por linhas tracejadas para ilustrar que os mesmos não fa- zem parte de, ou são necessários no sistema de chamada de saída 100. Adicionalmente, o diagrama em bloco do sistema de chamada de saída 100 é esquemático para fins de com- preensão e a fim de fornecer uma relação ilustrativa entre o módulo de detecção de secretá- ria eletrônica 106 e seus componentes, além de outros componentes do sistema de chama- da de saída 100. Deve-se compreender que essa é apenas uma modalidade ilustrativa visto que um ou mais componentes do sistema de chamada de saída 100 e módulo de detecção de secretária eletrônica 106 podem ser omitidos e/ou combinados em outras configurações em outras modalidades.
Na modalidade ilustrada, o módulo de detecção de secretária eletrônica 106 inclui
um reconhecedor de fala 120 e um módulo de análise de chamada 122. As figuras 3 e 4 são um diagrama esquemático e um fluxograma de um método 200, respectivamente, ilustrando a operação desses módulos. Na etapa 202, o reconhecedor de fala 120 recebe a resposta audível 124 do recipiente de chamada 102 para a chamada realizada pelo sistema de cha- mada de saída 100. O reconhecedor de fala 120 processa a resposta audível 124 e fornece uma saída 126 indicativa da fala reconhecida, e em uma modalidade, frases, comumente na forma de dados de texto. Como utilizado aqui uma frase é uma pluralidade de palavras no contexto como fornecido pelo recipiente da chamada. Na etapa 204, a saída 126 do reconhecedor de fala 120 é fornecida como entrada para o módulo de análise de chamada 122. O módulo de análise de chamada 122 processa a saída 126 do reconhecedor de fala 120 para gerar uma saída 128 indicativa de se o reci- piente da chamada é uma pessoa ou uma secretária eletrônica. O módulo de análise de chamada 122 pode incluir um módulo classificador 123 que fornece análise estatística do conteúdo das frases na saída 126. O reconhecedor de fala 120 e o módulo classificador 123 são módulos bem conhecidos e podem ser implementados utilizando-se uma variedade de técnicas bem conhecidas. No entanto, deve-se notar que um modelo de linguagem 130 (por exemplo, N-gram, gramática livre de contexto, híbrida, etc.) utilizado pelo reconhecedor de fala 120 e um modelo classificador 132 são tipicamente ambos seqüenciados em apenas frases ou saudações utilizadas por pessoas e secretárias eletrônicas quando atendem uma chamada. Por exemplo, uma pessoa pode atender a uma chamada telefônica com a sauda- ção "Alô", "Como posso ajudar?", "Aqui quem fala é o Steve" ou talvez dizendo apenas o nome. Em contraste, uma secretária eletrônica pode ter a saudação "Você ligou para a se- cretária eletrônica. Não estou disponível no momento. Por favor, deixe sua mensagem." ou simplesmente "Favor deixar uma mensagem". No entanto, na detecção de secretária eletrô- nica com base em conteúdo, pode ser necessário se reconhecer frases importantes tal co- mo "não disponível no momento" ou "deixe uma mensagem". Da mesma forma, no caso de passar por um sistema de identificação de telefone no local de recepção, pode ser necessá- rio se reconhecer frases como "pressione 2". Para uma precisão de reconhecimento alta das frases como essa, o modelo de linguagem 130 pode ser seqüenciado com frases importan- tes e onde o modelo pode ser suavizado com um modelo de enchimento n-gram pra captu- rar as palavras não cobertas nas frases importantes. Um exemplo de um modelo de enchi- mento n-gram é descrito por D.Yu, Y. - C, Ju, Y. Wang e A. Acero em "N-gram Based Filler Model for Robust Grammar Authoring," publicado em Proceedings of the International Confe- rence on Acoustics, Speech, and Signal Processing, maio de 2006. Utilizando um número suficiente de exemplos (exemplos genéricos ou exemplos específicos de aplicativo) ambos o modelo de linguagem 130 e o modelo classificador 132 podem ser seqüenciados de forma adequada.
Com relação ao módulo de análise de chamada 122 e etapa 204, as características de não fala 136 também podem ser utilizadas para análise em adição ou na alternativa à saída 126 do reconhecedor de fala 120. Exemplos de características de não fala 136 inclu- em, mas não estão limitados a: se o recipiente de chamada 102 "invadiu" (isso é, interrom- peu um aviso sendo exibido quando o aplicativo 104 está executando um diálogo), a dura- ção da resposta audível feita pelo recipiente da chamada 102 quando atende a chamada, e se ou não o reconhecedor de fala 120 foi capaz de reconhecer a resposta audível 124 como uma frase válida. Na figura 3. as características de não fala 136 são produzidas a partir de um gerador de característica de não palavra 128, que pode receber e processar a resposta audível 124 ou outra informação de entrada 138 pertencente à chamada do sistema de chamada de saída 100. Na figura 4, o recebimento das características de não palavra 136 é indicado na etapa 203.
Nesse ponto, deve-se notar também que não existe qualquer exigência de que o reconhecedor de fala 120 seja capaz de reconhecer a resposta audível completa 124, mas ao invés disso, devido ao ambiente barulhento no recipiente da chamada 102, ao ruído em uma saudação gravada ou ao ruído do sistema de telefonia, e à natureza da resposta, ape- nas uma ou mais partes da resposta audível 124 podem ser reconhecíveis, e, dessa forma, utilizadas para determinar se o recipiente da chamada 102 é uma pessoa ou uma secretária eletrônica.
A figura 5 é um fluxograma ilustrando um método ilustrativo 300 realizado pelo mó- dulo de análise de chamada 122 na etapa de execução 204 na figura 3. A etapa 302 repre- senta o começo do reconhecimento da fala depois de a chamada ter sido realizada. Uma primeira característica de não fala que pode opcionalmente ser utilizada para a determina- ção de se o recipiente é uma pessoa ou uma secretária eletrônica é se o silêncio está inici- almente presente uma vez que a chamada é atendida. Em particular, descobriu-se que uma pessoa pode esperar, por exemplo, por um ou dois segundos, antes de começar a falar. Dessa forma, se na etapa 304 for determinado que o silêncio significativo está presente de- pois de a chamada ter sido atendida, por exemplo, como medido por um temporizador exce- dendo um tempo selecionado a partir da etapa 302, uma determinação pode ser feita de que o recipiente da chamada 102 é uma pessoa.
Se, por outro lado, o silêncio significativo não estiver presente depois de a chamada ter sido atendida na etapa 302, ou a etapa 302 não estiver presente, a duração da resposta audível pode ser utilizada para determinar se ou não o recipiente da chamada é uma pesso- a. As etapas 306 e 308 ilustram o processamento da característica de não palavra compre- endendo a duração da resposta audível. Na etapa 306, se a duração da resposta audível for muito curta (por exemplo, de aproximadamente menos de 1 segundo), é mais do que prová- vel que uma pessoa tenha atendido à chamada. Em contraste, se a duração da resposta audível for muito longa (por exemplo, de aproximadamente quatro ou mais segundos) como ilustrado na etapa 308, o recipiente da chamada é provavelmente uma secretária eletrônica. Deve-se notar que a ordem na qual as etapas 306 e 308 são ilustradas não é necessária visto que essas etapas podem ser invertidas. Da mesma forma, os períodos de tempo espe- cificados podem ser ajustados.
Se uma determinação de se o recipiente da chamada é uma pessoa ou uma secre- tária eletrônica não tiver sido realizada antes da etapa 308, o fluxo de processo continua para a etapa 310 onde a duração da resposta audível pode novamente ser utilizada. Em particular, na etapa 310 a duração da resposta audível é medida para determinar se é relati- vamente curta, por exemplo, dois ou três segundos. O resultado dessa etapa é combinado com a informação relacionada com o contexto da resposta audível como reconhecida pelo reconhecedor de fala 120 tal como obtido a partir do módulo classificador 123. Em outras palavras, o módulo classificador 123 analisa a saída 126 do reconhecedor de fala 120 para determinar se uma ou mais frases estão estatisticamente consistentes com as frases utiliza- das por uma pessoa ou frases utilizadas por uma secretária eletrônica. Na figura 5, a infor- mação do módulo classificador 123 é representada nas etapas 312 e 314. Em particular, se na etapa 312 a informação do módulo classificador 123 indicar que as frases na resposta audível são muito provavelmente (alta confiança) de uma pessoa, a saída 128 do módulo de análise de chamada 122 indicará que o recipiente da chamada 102 é uma pessoa. Em con- traste, se na etapa 312 não houver alta confiança de o recipiente da chamada ser uma pes- soa, a saída do módulo de análise de chamada 122 indicará que o recipiente da chamada 102 é uma secretária eletrônica. De forma similar, na etapa 314, se a informação do módulo classificador 123 indicar que as frases na resposta audível são muito provavelmente de uma secretária eletrônica, a saída do módulo de análise de chamada 122 indicará que o recipien- te da chamada é uma secretária eletrônica, ao passo que se alta confiança de que o recipi- ente da chamada é uma secretária eletrônica não estiver presente, a saída do módulo de análise de chamada 122 indicará que o recipiente da chamada 102 é uma pessoa. Deve-se notar que nesse exemplo existe uma tendência ao erro no lado da classificação errada de um recipiente de chamada como uma pessoa ao invés de uma secretária eletrônica. Se for desejável, a tendência pode ser no sentido da classificação do recipiente de chamada como uma secretária eletrônica, ou nenhuma tendência de acordo com os custos associados com diferentes erros.
Favor notar que o classificador estatístico descrito acima é apenas um exemplo i- lustrativo. O módulo de análise de chamada 122 pode utilizar muitos outros classificadores, tal como classificadores de entropia máxima. Adicionalmente, o módulo de análise de cha- mada 122 também pode utilizar máquinas de vetor de suporte, componentes utilizando árvo- res de decisão, e redes neurais artificiais para alcançar uma precisão comparável.
No exemplo da figura 5, as características de não palavra tal como a presença de silêncio depois de a chamada ter sido atendida pelo recipiente e a duração da resposta au- dível foram utilizadas antes da classificação real do conteúdo da resposta audível a fim de determinar se o recipiente de chamada é uma pessoa ou secretária eletrônica. Novamente, outras características de não palavra tal como se o recipiente invadiu ou se o reconhecedor de fala 120 foi capaz de reconhecer a resposta audível também podem ser utilizadas. Adi- cionalmente, um classificador pode ser seqüenciado com base nas características de não palavra e utilizado com o classificador 123 fornecendo uma saída com base nas frases re- conhecidas da resposta audível para fornecer uma indicação de se o recipiente da chamada e uma pessoa ou uma secretária eletrônica. Da mesma forma, um classificador único seria seqüenciado com base nas características de não palavra e as palavras reconhecidas da resposta audível para fornecer uma indicação de se o recipiente da chamada é uma pessoal ou uma secretária eletrônica.
Em algumas aplicações, pode ser necessário se reproduzir uma mensagem para o recipiente da chamada, por exemplo, se tiver sido determinado que o recipiente da chamada é uma secretária eletrônica. Apesar de as secretárias eletrônicas fornecerem um tom ou silêncio significando que a saudação terminou e que uma mensagem deve agora ser deixa- da, o reconhecimento desse tom é difícil. Em muitos casos, visto que o tom ou silêncio pode não ser reconhecido com precisão, pelo menos parte da mensagem pode ser reproduzida durante a saudação, dessa forma, a parte inicial da mensagem pode não ser gravada.
Uma etapa opcional 206 ilustrada na figura 4, compreendendo também outro as- pecto descrito aqui fornece meios e uma técnica para se garantir que toda a mensagem seja gravada pela secretária eletrônica ou, se for desejável, ouvida pela pessoa. Em particular, a mensagem é reproduzida com esse reconhecedor de fala 120 ligado e ativado para "inva- são" (de forma a detectar a finalização da saudação) até que a mensagem tenha sido com- pletada. Por exemplo, assumindo-se que uma secretária eletrônica forneça uma saudação "Você ligou para....Eric Moe....Favor deixar uma mensagem," onde "..." representa silêncio durante a saudação. Em muitos sistemas atuais, a mensagem pode ser reproduzida depois da detecção de um desses períodos de silêncio, onde a mensagem pode então ser reprodu- zida, mas não gravada visto que a secretária eletrônica não alcançou o final da saudação. Utilizando-se a técnica descrita aqui, o reconhecedor de fala 120 com capacidade de "inva- são" detecta cada parte da saudação e faz com que a mensagem seja iniciada novamente. Uma vez que a saudação alcançou definitivamente seu final, a mensagem é reproduzida, mas agora até o seu final de modo a garantir que a mensagem seja ouvida ou gravada em sua totalidade.
A figura 6 ilustra um exemplo de um ambiente de sistema de computação adequado 400 no qual os conceitos descritos aqui podem ser implementados. Em particular, uma for- ma do ambiente de sistema de computação 400 pode ser utilizada para o sistema de cha- mada de saída 100 ou partes do mesmo. Não obstante, o ambiente de sistema de computa- ção 400 é novamente apenas um exemplo de um ambiente de computação adequado para cada um desses computadores e não deve sugerir qualquer limitação quanto ao escopo de uso ou funcionalidade da descrição abaixo. Nem deve o ambiente de computação 400 ser interpretado como sendo dependente ou possuindo qualquer exigência com relação a qual- quer um ou uma combinação de componentes ilustrados no ambiente operacional ilustrativo 400.
Em adição aos exemplos fornecidos aqui, outros sistemas de computação bem co- nhecidos, ambientes, e/ou configurações podem ser adequados para uso com os conceitos descritos aqui. Tais sistemas incluem, mas não estão limitados a, computadores pessoais, computadores servidores, dispositivos portáteis, sistemas multiprocessadores, sistemas com Bse em micro processador, aparelhos decodificadores, partes eletrônicas de consumidor programáveis, PCs em rede, mini computadores, computadores principais, ambientes de computação distribuídos que incluem qualquer um dos sistemas acima ou dispositivos, e similares.
Os conceitos descritos aqui podem ser consubstanciados no contexto geral das ins-
truções executáveis por computador, tal como módulos de programa, sendo executados por um computador. Geralmente, os módulos de programa incluem rotinas, programas, objetos, componentes, estruturas de dados, etc. que realizam tarefas particulares ou implementam tipos de dados abstratos particulares. Os versados na técnica podem implementar a descri- ção e/ou figuras aqui como instruções executáveis por computador, que podem ser con- substanciadas em qualquer forma de mídia legível por computador discutida abaixo.
Os conceitos descritos aqui também podem ser praticados em ambientes de com- putação distribuídos onde as tarefas são realizadas por dispositivos de processamento re- moto que são conectados através de uma rede de comunicações. Em um ambiente de com- putação distribuída, os módulos de programa podem ser localizados em ambas a mídia de armazenamento em computador local e remota incluindo dispositivos de armazenamento em memória.
Com referência à figura 6, um sistema ilustrativo inclui um dispositivo de computa- ção de finalidade geral na forma de um computador 410. Os componentes de computador 410 podem incluir, mas não estão limitados a, uma unidade de processamento 420, uma memória de sistema 430 e um barramento de sistema 421 que acopla vários componentes de sistema incluindo a memória do sistema à unidade de processamento 420. O barramento do sistema 421 pode ser qualquer um dentre os vários tipos de estruturas de barramento incluindo o barramento de memória ou controlador de memória, um barramento periférico, e um barramento local utilizando qualquer uma dentre uma variedade de arquiteturas de bar- ramento. Por meio de exemplo, e não de limitação, tais arquiteturas incluem o barramento de Arquitetura Padrão (ISA), o barramento de Arquitetura de Micro Canal (MCA), o barra- mento ISA Melhorado (EISA), o barramento local da Associação de Padrões Eletrônicos de Vídeo (VESA), o barramento de Interconexão de Componente Periférico (PCI) também co- nhecido como barramento Mezzanine.
O computador 410 inclui tipicamente uma variedade de mídias legíveis por compu- tador. A mídia legível por computador pode ser qualquer mídia disponível que possa ser acessada pelo computador 410 e inclui ambas as mídias volátil e não volátil, e as mídias removível e não removível. Por meio de exemplo, e não de limitação, a mídia legível por computador pode compreender mídia de armazenamento em computador. Por meio de e- xemplo, e não de limitação, a mídia legível por computador pode compreender mídia de ar- mazenamento em computador. A mídia de armazenamento em computador inclui mídia vo- látil e não volátil, removível e não removível implementada em qualquer método ou tecnolo- gia para armazenamento de informação tal como instruções legíveis por computador, estru- turas de dados, módulos de programa ou outros dados. A mídia de armazenamento em computador inclui, mas não está limitada a, memórias RAM, ROM, EEPROM e FLASH ou outra tecnologia de memória, CD-ROM, discos versáteis digitais (DVD) ou outro armazena- mento em disco ótico, fitas magnéticas, armazenamento em disco magnético ou outros dis- positivos de armazenamento magnético, ou qualquer outro meio que possa ser utilizado pa- ra armazenar a informação desejada e que possa ser acessado pelo computador 400.
A memória de sistema 430 inclui a mídia de armazenamento em computador na forma de memória volátil e/ou não volátil tal como memória de leitura apenas (ROM) 431 e memória de acesso randômico (RAM) 432. Um sistema básico de entrada/saída (BIOS) 433, contendo as rotinas básicas que ajudam a transferir informação entre os elementos dentro do computador 410, tal como durante a inicialização, é tipicamente armazenado em ROM 431. A RAM 432 contém tipicamente dados e/ou módulos de programa imediatamente a- cessíveis a e/ou atualmente sendo operados pela unidade de processamento 420. Por meio de exemplo, e não de limitação,
A figura 6 ilustra o sistema operacional 434, programas de aplicativo 435, outros módulos de programa 436, e dados de programa 437. Aqui, os programas de aplicativo 435, os módulos de programa 436 e os dados de programa 437 implementam um ou mais dos conceitos descritos acima.
O computador 410 também pode incluir outras mídias de armazenamento em com- putador removíveis/não removíveis, voláteis/não voláteis. Por meio de exemplo apenas, a figura 6 ilustra um acionador de disco rígido 441 que lê a partir de ou escreve na mídia mag- nética não removível e não volátil, um acionador de disco magnético 451 que lê a partir de ou escreve em um disco magnético não volátil e removível 452, e um acionador de disco ótico 455 que lê a partir de ou escreve em um disco ótico removível e não volátil 456 tal co- mo um CD ROM ou outra mídia ótica. Outras mídias de armazenamento em computador removíveis/não removíveis e voláteis/não voláteis que podem ser utilizadas no ambiente operacional ilustrativo incluem, mas não estão limitadas a, fitas magnéticas, cartões de me- mória flash, discos versáteis digitais, fita de vídeo digital, RAM em estado sólido, ROM em estado sólido, e similares. O acionador de disco rígido 441 é tipicamente conectado ao bar- ramento do sistema 421 através de uma interface de memória não removível tal como a in- terface 440, e o acionador de disco magnético 451 e o acionador de disco ótico 455 são tipi- camente conectados ao barramento do sistema 421 por uma interface de memória removí- vel, tal como a interface 450.
Os acionadores e sua mídia de armazenamento em computador associada discuti- dos acima e ilustrados na figura 6 fornecem armazenamento de instruções legíveis por computador, estruturas de dados, módulos de programa e outros dados para o computador 410. Na figura 6, por exemplo, o acionador de disco rígido 441 é ilustrado como armazenan- do o sistema operacional 444, os programas de aplicativo 445, outros módulos de programa 446, e dados de programa 447. Note-se que esses componentes podem ser iguais ou dife- rentes do sistema operacional 434, programas de aplicativo 435, outros módulos de progra- ma 436 e dados de programa 437. O sistema operacional 444, os programas de aplicativo 445, outros módulos de programa 446 e os dados de programa 447 recebem números dife- rentes para ilustrar que, no mínimo, são cópias diferentes.
Um usuário pode registra os comandos e informação no computador 410 através dos dispositivos de registro tal como um teclado 462, um microfone 463 e um dispositivo de apontar 461, tal como um mouse, TrackBaII ou teclado de toque. Esses e outros dispositivos de registro são freqüentemente conectados à unidade de processamento 420 através de uma interface de registro de usuário 460 que é acoplada ao barramento do sistema, mas podem ser conectados por outra interface e estruturas de barramento, tal como uma porta serial ou um barramento serial universal (USB). Um monitor 491 ou outro tipo de dispositivo de exibição também é conectado ao barramento do sistema 421 através de uma interface, tal como uma interface de vídeo 490.
O computador 410 pode operar em um ambiente em rede utilizando conexões lógi- cas com um ou mais computadores remotos, tal como um computador remoto 480. O com- putador remoto 480 pode ser um computador pessoal, um dispositivo portátil, um servidor, um roteador, um PC em rede, um dispositivo não hierarquizado ou outro nó de rede comum, e inclui tipicamente muitos ou todos os elementos descritos acima com relação ao computa- dor 410. As conexões lógicas apresentadas na figura 6 incluem uma rede de área local (LAN) 471 e uma rede de área ampla (WAN) 473, mas também podem incluir outras redes. Tais ambientes em rede são lugar comum em escritórios, redes de computador empresari- ais, intranets e na Internet.
Quando utilizado em um ambiente em rede LAN, o computado 410 é conectado à LAN 471 através de uma interface de rede ou adaptador 470. Quando utilizado em um am- biente em rede WAN, o computador 410 tipicamente inclui um modem 472 ou outro meio de estabelecimento de comunicações através da WAN 473, tal como a Internet. O modem 472, que pode ser interno ou externo, pode ser conectado ao barramento do sistema 421 através da interface de registro de usuário 460, ou outro mecanismo adequado. Em um ambiente de rede, os módulos de programa apresentados com relação ao computador 410, ou partes dos mesmos, podem ser armazenados no dispositivo de armazenamento em memória remota. Por meio de exemplo, e não de limitação, a figura 6 ilustra programas de aplicativo remotos 485 residindo no computador remoto 480. Será apreciado que as conexões de rede ilustra- das são ilustrativas e que outros meios de estabelecimento de uma conexão de comunica- ção entre os computadores podem ser utilizados.
Deve-se notar que os conceitos descritos aqui podem ser realizados em um siste- ma de computador tal como o descrito com relação à figura 6. No entanto, outros sistemas adequados incluem um servidor, um computador devotado ao manuseio de mensagens, ou em um sistema distribuído no qual partes diferentes dos conceitos são realizadas em dife- rentes partes do sistema de computação distribuído.
Apesar de a matéria ter sido descrito em linguagem específica de características estruturais e/ou atos metodológicos, deve-se compreender que a matéria definida nas rei- vindicações em anexo não está limitada às características específicas ou atos descritos a- cima como foi determinado nos tribunais. Ao invés disso, as características especificas e atos descritos acima são descritos como formas ilustrativas de implementação das reivindi- cações.
Claims (20)
1. Método implementado por computador (200) de determinação de se um recipien- te de chamada é uma pessoa ou uma secretária eletrônica, o método sendo CARACTERIZADO pelo fato de compreender: o recebimento (202) de uma resposta audível de um recipiente de chamada e o processamento da resposta audível com um reconhecedor de fala para fornecer uma saída indicativa da fala reconhecida; e o processamento (204) da saída indicativa de fala reconhecida com um classifica- dor para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoa ou uma secretária eletrônica, o dito processamento sendo baseado em análise estatística da saída indicativa de fala reconhecida.
2. Método implementado por computador (200), de acordo com a reivindicação 1, CARACTERIZADO pelo fato de o processamento (204) incluir o processamento da resposta audível para determinar as características de não palavra associadas com a resposta audí- vel (304, 306, 308) e utilizar as características de não palavra como base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoa ou uma secretária eletrônica.
3. Método implementado por computador (200), de acordo com a reivindicação 2, CARACTERIZADO pelo fato de o processamento (204) incluir a determinação de uma du- ração de resposta audível (306, 308) e utilização da duração da resposta audível como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoa ou uma secretária eletrônica.
4. Método implementado por computador (200), de açodo com a reivindicação 2, CARACTERIZADO pelo fato de o processamento (204) incluir a determinação de se um silêncio está inicialmente presente na resposta audível (304) e a utilização da presença do silêncio como base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoa ou uma secretária eletrônica.
5. Método implementado por computador (200), de acordo com a reivindicação 4, CARACTERIZADO pelo fato de o processamento (204) incluir a determinação de se o si- lêncio por um período relativo a um comprimento selecionado está inicialmente presente na resposta audível (304) e a utilização da presença do silêncio como base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal ou uma secretária eletrônica.
6. Método implementado por computador (200), de acordo com a reivindicação 2, CARACTERIZADO pelo fato de o processamento (204) incluir a utilização de uma indicação de se o reconhecedor de fala foi capaz de reconhecer qualquer fala na resposta audível co- mo uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pes- soal ou uma secretária eletrônica.
7. Método implementado por computador (200), de acordo com a reivindicação 3, CARACTERIZADO pelo fato de o processamento (204) incluir a utilização de análise esta- tística (312, 314) quando a duração da fala está dentro de uma faixa selecionada.
8. Método implementado por computador (200), de acordo com a reivindicação 1, CARACTERIZADO pelo fato de o processamento (204) incluir a utilização da análise esta- tística (312, 314) quando uma duração de fala está dentro de uma faixa selecionada.
9. Meio legível por computador possuindo instruções que quando implementadas por um computador determinam se um recipiente de chamada é uma pessoal ou uma secre- tária eletrônica, as instruções sendo CARACTERIZADAS pelo fato de compreender: o recebimento (202) de uma resposta audível de um recipiente de chamada e o processamento da resposta audível com um reconhecedor de fala para fornecer uma saída indicativa da fala reconhecida; e o processamento (204) da saída indicativa de fala reconhecida para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal ou uma secretária eletrônica, o dito processamento sendo baseado em analise de frases de palavra na saída indicativa da fala reconhecida.
10. Meio legível por computador, de acordo com a reivindicação 9, CARACTERIZADO pelo fato de o processamento (204) compreender o processamento (312, 314) das frases de palavra com um classificador estatístico e a utilização de uma saí- da do classificador estatístico como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal ou uma secretária eletrônica.
11. Meio legível por computador, de acordo com a reivindicação 9, CARACTERIZADO pelo fato de o processamento (204) incluir o processamento da resposta audível para determinar as características de não palavra associadas com a resposta audí- vel (304, 306, 308) e a utilização das não características como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal ou uma secretária eletrônica.
12. Meio legível por computador, de acordo com a reivindicação 9, CARACTERIZADO pelo fato de o processamento incluir a determinação de uma duração de resposta audível (306, 308) e a utilização da duração da resposta audível como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal o uma secretária eletrônica.
13. Meio legível por computador, de acordo com a reivindicação 9, CARACTERIZADO pelo fato de o processamento incluir a determinação de se o silêncio está inicialmente presente na resposta audível (304) e a utilização da presença do silêncio como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal real ou uma secretária eletrônica.
14. Meio legível por computador, de acordo com a reivindicação 13, CARACTERIZADO pelo fato de o processamento (204) incluir a determinação de se o si- lêncio de um período relativo a um comprimento selecionado está inicialmente presente na resposta audível (304) e a utilização da presença do silêncio como uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoal ou uma secretária ele- trônica.
15. Meio legível por computador, de acordo com a reivindicação 9, CARACTERIZADO pelo fato de o processamento (204) incluir a utilização de uma indicação de se o reconhecedor de fala foi capaz de reconhecer qualquer fala na resposta audível co- mo uma base para fornecer uma saída indicativa de se o recipiente da chamada é uma pes- soal ou uma secretária eletrônica.
16. Meio legível por computador, de acordo com a reivindicação 10, CARACTERIZADO pelo fato de o processamento (204) incluir a utilização de análise esta- tística quando a duração da fala está dentro de uma faixa selecionada.
17. Meio legível por computador, de acordo com a reivindicação 10, CARACTERIZADO pelo fato de compreender adicionalmente a operação (206) do reconhe- cedor de fala para detectar eventos de invasão pelo recipiente da chamada e reproduzir uma mensagem para o recipiente da chamada se um evento de invasão for detectado até que a mensagem seja reproduzida em sua totalidade.
18. Meio legível por computador, de acordo com a reivindicação 17, CARACTERIZADO pelo fato de a reprodução da mensagem para o recipiente da chamada (206) compreender a reprodução da mensagem para o recipiente da chamada se o recipien- te da chamada for uma secretária eletrônica.
19. Método implementado por computador para deixar uma mensagem em uma se- cretária eletrônica, o método sendo CARACTERIZADO pelo fato de compreender: a operação (206) de um reconhecedor de fala para detectar eventos de invasão pe- la secretária eletrônica; e a reiniciação (206) de uma mensagem para a secretária eletrônica se um evento de invasão for detectado até que a mensagem seja reproduzida em sua totalidade.
20. Método implementado por computador, de acordo com a reivindicação 19, CARACTERIZADO pelo fato de compreender adicionalmente, antes da etapa de reprodu- ção de mensagem, a detecção de se um recipiente de chamada é uma pessoal ou uma se- cretária eletrônica onde a detecção compreende: o recebimento (202) de uma resposta audível do recipiente da chamada e o pro- cessamento da resposta audível com o reconhecedor de fala para fornecer uma saída indi- cativa da fala reconhecida; e o processamento (204) da saída indicativa da fala reconhecida para fornecer uma saída indicativa de se o recipiente da chamada é uma pessoa ou uma secretária eletrônica, o dito processamento sendo baseado na análise das frases de palavras na saída indicativa de fala reconhecida
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US11/485,011 US8065146B2 (en) | 2006-07-12 | 2006-07-12 | Detecting an answering machine using speech recognition |
| US11485011 | 2006-07-12 | ||
| PCT/US2007/011567 WO2008008117A1 (en) | 2006-07-12 | 2007-05-15 | Detecting an answering machine using speech recognition |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| BRPI0714140A2 true BRPI0714140A2 (pt) | 2012-12-25 |
Family
ID=38923532
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| BRPI0714140-8A BRPI0714140A2 (pt) | 2006-07-12 | 2007-05-15 | detecÇço de uma secretÁria eletrânica utilizando reconhecimento de fala |
Country Status (12)
| Country | Link |
|---|---|
| US (1) | US8065146B2 (pt) |
| EP (1) | EP2038877A4 (pt) |
| JP (1) | JP5124573B2 (pt) |
| KR (1) | KR20090033437A (pt) |
| CN (1) | CN101490741B (pt) |
| BR (1) | BRPI0714140A2 (pt) |
| CA (1) | CA2653536A1 (pt) |
| MX (1) | MX2008016354A (pt) |
| NO (1) | NO20085203L (pt) |
| RU (1) | RU2439716C2 (pt) |
| TW (1) | TW200810504A (pt) |
| WO (1) | WO2008008117A1 (pt) |
Families Citing this family (31)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8396713B2 (en) * | 2007-04-30 | 2013-03-12 | Nuance Communications, Inc. | Method and system for using a statistical language model and an action classifier in parallel with grammar for better handling of out-of-grammar utterances |
| US8370148B2 (en) * | 2008-04-14 | 2013-02-05 | At&T Intellectual Property I, L.P. | System and method for answering a communication notification |
| CN101662544B (zh) * | 2008-08-26 | 2012-01-25 | 华为技术有限公司 | 一种外呼处理的方法、装置和系统 |
| US8624875B2 (en) * | 2009-08-24 | 2014-01-07 | Semiconductor Energy Laboratory Co., Ltd. | Method for driving touch panel |
| US8990071B2 (en) * | 2010-03-29 | 2015-03-24 | Microsoft Technology Licensing, Llc | Telephony service interaction management |
| US20110313762A1 (en) * | 2010-06-20 | 2011-12-22 | International Business Machines Corporation | Speech output with confidence indication |
| US8417223B1 (en) * | 2010-08-24 | 2013-04-09 | Google Inc. | Advanced voicemail features without carrier voicemail support |
| US20120209590A1 (en) * | 2011-02-16 | 2012-08-16 | International Business Machines Corporation | Translated sentence quality estimation |
| US9100479B2 (en) * | 2011-03-10 | 2015-08-04 | Angel.Com Incorporated | Answering machine detection |
| CN103295585A (zh) * | 2012-02-24 | 2013-09-11 | 北京英立讯科技有限公司 | 识别电话自动外呼是否真人应答的处理系统及方法 |
| KR101909141B1 (ko) * | 2012-07-27 | 2018-10-17 | 엘지전자 주식회사 | 전자기기 및 전자기기의 제어방법 |
| CN103973872B (zh) * | 2013-01-31 | 2016-12-28 | 联想(北京)有限公司 | 一种信息处理的方法及电子设备 |
| GB2513924A (en) * | 2013-05-10 | 2014-11-12 | Noetica Ltd | Live person detection in an automated calling system |
| US9495959B2 (en) * | 2014-02-27 | 2016-11-15 | Ford Global Technologies, Llc | Disambiguation of dynamic commands |
| US10212266B2 (en) * | 2014-03-07 | 2019-02-19 | Dialogtech Inc. | Phone fraud deterrence system for use with toll free and other fee generating numbers |
| US9953646B2 (en) | 2014-09-02 | 2018-04-24 | Belleau Technologies | Method and system for dynamic speech recognition and tracking of prewritten script |
| RU2583150C1 (ru) * | 2014-11-28 | 2016-05-10 | Самсунг Электроникс Ко., Лтд. | Голосовая связь на естественном языке между человеком и устройством |
| GB2533139A (en) * | 2014-12-11 | 2016-06-15 | Ultra Communications Ltd | Telephone call processing |
| CN104601834B (zh) * | 2014-12-19 | 2017-03-22 | 国家电网公司 | 多语种自动语音呼叫应答装置及其使用方法 |
| US10277745B1 (en) | 2017-05-30 | 2019-04-30 | Noble Systems Corporation | Answering machine detection for a contact center |
| US10530928B1 (en) * | 2017-03-15 | 2020-01-07 | Noble Systems Corporation | Answering machine detection (“AMD”) for a contact center by using AMD meta-data |
| US10148818B1 (en) | 2017-03-15 | 2018-12-04 | Noble Systems Corporation | Using enhanced answering machine detection (“AMD”) to detect reassigned numbers |
| US10910105B2 (en) * | 2017-05-31 | 2021-02-02 | International Business Machines Corporation | Monitoring the use of language of a patient for identifying potential speech and related neurological disorders |
| JP7173049B2 (ja) * | 2018-01-10 | 2022-11-16 | ソニーグループ株式会社 | 情報処理装置、情報処理システム、および情報処理方法、並びにプログラム |
| KR102142338B1 (ko) * | 2018-12-26 | 2020-08-07 | 주식회사 어플라이 | 인공지능 통신 장치 및 그 동작 방법 |
| KR102636409B1 (ko) | 2018-12-28 | 2024-02-15 | 삼성전자주식회사 | 전자 장치 및 그 제어 방법 |
| EP3757991B1 (en) | 2019-06-26 | 2025-01-08 | Samsung Electronics Co., Ltd. | Electronic apparatus and control method thereof |
| JP7304627B2 (ja) * | 2019-11-08 | 2023-07-07 | 株式会社ハロー | 留守番電話判定装置、方法及びプログラム |
| US11501067B1 (en) | 2020-04-23 | 2022-11-15 | Wells Fargo Bank, N.A. | Systems and methods for screening data instances based on a target text of a target corpus |
| KR102494422B1 (ko) | 2022-06-24 | 2023-02-06 | 주식회사 액션파워 | Ars 음성이 포함된 오디오 데이터에서 발화 음성을 검출하는 방법 |
| US12598253B2 (en) * | 2023-11-03 | 2026-04-07 | Infobip Ltd. | Systems and methods for media analysis for call state detection |
Family Cites Families (28)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4941168A (en) * | 1988-09-21 | 1990-07-10 | U.S. Telecom International Inc. | System for the recognition of automated telephone answering devices and delivery of prerecorded messages to such devices |
| US5581602A (en) * | 1992-06-19 | 1996-12-03 | Inventions, Inc. | Non-offensive termination of a call detection of an answering machine |
| US5371787A (en) * | 1993-03-01 | 1994-12-06 | Dialogic Corporation | Machine answer detection |
| US5644624A (en) * | 1994-05-23 | 1997-07-01 | Caldwell Communications Development, Inc. | Automatic telephone call origination and retry system and method of operation |
| DE19536212B4 (de) * | 1994-09-28 | 2004-12-23 | Rockwell International Corp., Downers Grove | Anordnung zum Erkennen eines Anrufbeantworters |
| US6233319B1 (en) * | 1997-12-30 | 2001-05-15 | At&T Corp. | Method and system for delivering messages to both live recipients and recording systems |
| US6324262B1 (en) * | 1998-03-26 | 2001-11-27 | Market Ability, Inc. | Method and system for automated delivery of nontruncated messages |
| US6161087A (en) * | 1998-10-05 | 2000-12-12 | Lernout & Hauspie Speech Products N.V. | Speech-recognition-assisted selective suppression of silent and filled speech pauses during playback of an audio recording |
| US6574601B1 (en) * | 1999-01-13 | 2003-06-03 | Lucent Technologies Inc. | Acoustic speech recognizer system and method |
| GB9930731D0 (en) * | 1999-12-22 | 2000-02-16 | Ibm | Voice processing apparatus |
| US6999565B1 (en) * | 2000-02-01 | 2006-02-14 | Envoyworldwide, Inc. | Multi-mode message routing and management |
| US6990179B2 (en) * | 2000-09-01 | 2006-01-24 | Eliza Corporation | Speech recognition method of and system for determining the status of an answered telephone during the course of an outbound telephone call |
| US7054419B2 (en) * | 2001-01-02 | 2006-05-30 | Soundbite Communications, Inc. | Answering machine detection for voice message delivery method and system |
| US20030086541A1 (en) * | 2001-10-23 | 2003-05-08 | Brown Michael Kenneth | Call classifier using automatic speech recognition to separately process speech and tones |
| US7069221B2 (en) * | 2001-10-26 | 2006-06-27 | Speechworks International, Inc. | Non-target barge-in detection |
| KR20030068693A (ko) * | 2002-02-15 | 2003-08-25 | 남기식 | 음성인식을 이용한 자동응답 대응전화기 |
| US6850602B1 (en) * | 2002-03-27 | 2005-02-01 | Avaya Technology Corp. | Method and apparatus for answering machine detection in automatic dialing |
| US7162421B1 (en) * | 2002-05-06 | 2007-01-09 | Nuance Communications | Dynamic barge-in in a speech-responsive system |
| US7389230B1 (en) * | 2003-04-22 | 2008-06-17 | International Business Machines Corporation | System and method for classification of voice signals |
| US20050013418A1 (en) * | 2003-07-15 | 2005-01-20 | Shye-Bin Chang | Emergency notification systems |
| US7392188B2 (en) * | 2003-07-31 | 2008-06-24 | Telefonaktiebolaget Lm Ericsson (Publ) | System and method enabling acoustic barge-in |
| US7852993B2 (en) * | 2003-08-11 | 2010-12-14 | Microsoft Corporation | Speech recognition enhanced caller identification |
| ATE316283T1 (de) * | 2003-11-27 | 2006-02-15 | Cit Alcatel | Vorrichtung zur verbesserung der spracherkennung |
| US9117460B2 (en) * | 2004-05-12 | 2015-08-25 | Core Wireless Licensing S.A.R.L. | Detection of end of utterance in speech recognition system |
| US7184521B2 (en) * | 2004-06-10 | 2007-02-27 | Par3 Communications, Inc. | Method and system for identifying a party answering a telephone call based on simultaneous activity |
| JP3874196B2 (ja) * | 2004-08-16 | 2007-01-31 | 船井電機株式会社 | インターホン装置 |
| KR20060077505A (ko) | 2004-12-30 | 2006-07-05 | 주식회사 한맥소프트웨어 | 이단계 예측 전화 연결 시스템 |
| US20060235694A1 (en) * | 2005-04-14 | 2006-10-19 | International Business Machines Corporation | Integrating conversational speech into Web browsers |
-
2006
- 2006-07-12 US US11/485,011 patent/US8065146B2/en not_active Expired - Fee Related
-
2007
- 2007-05-15 BR BRPI0714140-8A patent/BRPI0714140A2/pt not_active Application Discontinuation
- 2007-05-15 RU RU2009100152/08A patent/RU2439716C2/ru not_active IP Right Cessation
- 2007-05-15 CN CN2007800264794A patent/CN101490741B/zh not_active Expired - Fee Related
- 2007-05-15 KR KR1020097000363A patent/KR20090033437A/ko not_active Abandoned
- 2007-05-15 EP EP07777047A patent/EP2038877A4/en not_active Withdrawn
- 2007-05-15 WO PCT/US2007/011567 patent/WO2008008117A1/en not_active Ceased
- 2007-05-15 MX MX2008016354A patent/MX2008016354A/es not_active Application Discontinuation
- 2007-05-15 JP JP2009519430A patent/JP5124573B2/ja not_active Expired - Fee Related
- 2007-05-15 CA CA002653536A patent/CA2653536A1/en not_active Withdrawn
- 2007-05-21 TW TW096118089A patent/TW200810504A/zh unknown
-
2008
- 2008-12-12 NO NO20085203A patent/NO20085203L/no unknown
Also Published As
| Publication number | Publication date |
|---|---|
| US20080015846A1 (en) | 2008-01-17 |
| JP2009543158A (ja) | 2009-12-03 |
| EP2038877A1 (en) | 2009-03-25 |
| JP5124573B2 (ja) | 2013-01-23 |
| RU2009100152A (ru) | 2010-07-20 |
| CA2653536A1 (en) | 2008-01-17 |
| TW200810504A (en) | 2008-02-16 |
| CN101490741B (zh) | 2012-01-11 |
| MX2008016354A (es) | 2009-01-16 |
| NO20085203L (no) | 2008-12-12 |
| WO2008008117A1 (en) | 2008-01-17 |
| EP2038877A4 (en) | 2010-08-11 |
| US8065146B2 (en) | 2011-11-22 |
| RU2439716C2 (ru) | 2012-01-10 |
| CN101490741A (zh) | 2009-07-22 |
| KR20090033437A (ko) | 2009-04-03 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| BRPI0714140A2 (pt) | detecÇço de uma secretÁria eletrânica utilizando reconhecimento de fala | |
| KR102509464B1 (ko) | 발언 분류기 | |
| ES2420559T3 (es) | Un sistema a gran escala, independiente del usuario e independiente del dispositivo de conversión del mensaje vocal a texto | |
| CN109493850B (zh) | 成长型对话装置 | |
| JP4619623B2 (ja) | ボイスメッセージ処理システムおよび方法 | |
| US20130262106A1 (en) | Method and system for automatic domain adaptation in speech recognition applications | |
| Lickley et al. | When can listeners detect disfluency in spontaneous speech? | |
| US8285539B2 (en) | Extracting tokens in a natural language understanding application | |
| JP2007102787A (ja) | インスタント・メッセージを可聴音信号によって注釈付けする方法、システム及びプログラム | |
| US20140337024A1 (en) | Method and system for speech command detection, and information processing system | |
| CN111798833A (zh) | 一种语音测试方法、装置、设备和存储介质 | |
| US11495245B2 (en) | Urgency level estimation apparatus, urgency level estimation method, and program | |
| Shriberg et al. | Can prosody aid the automatic processing of multi-party meetings? Evidence from predicting punctuation, disfluencies, and overlapping speech | |
| JP7151181B2 (ja) | 音声対話システム、その処理方法及びプログラム | |
| Schönherr et al. | Exploring accidental triggers of smart speakers | |
| CN111415128A (zh) | 控制会议的方法、系统、装置、设备和介质 | |
| KR20230113368A (ko) | 검출들의 시퀀스에 기반한 핫프레이즈 트리거링 | |
| CN103049192A (zh) | 一种应用程序开启方法及装置 | |
| US11582174B1 (en) | Messaging content data storage | |
| CN116129856A (zh) | 语音合成模型的训练方法、语音合成方法及相关设备 | |
| US20070263805A1 (en) | Method to alert participant on a conference call | |
| Wyatt et al. | A Privacy-Sensitive Approach to Modeling Multi-Person Conversations. | |
| Rytting et al. | Segmenting words from natural speech: subsegmental variation in segmental cues | |
| CN111767083A (zh) | 误唤醒音频数据的收集方法、播放设备、电子设备、介质 | |
| US7092884B2 (en) | Method of nonvisual enrollment for speech recognition |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| B11A | Dismissal acc. art.33 of ipl - examination not requested within 36 months of filing | ||
| B11Y | Definitive dismissal - extension of time limit for request of examination expired [chapter 11.1.1 patent gazette] |