BRPI0617624B1 - Método para reconhecer uma fala, dispositivo de processamento de recursos de meios, sistema para implementar função de reconhecimento de fala - Google Patents

Método para reconhecer uma fala, dispositivo de processamento de recursos de meios, sistema para implementar função de reconhecimento de fala Download PDF

Info

Publication number
BRPI0617624B1
BRPI0617624B1 BRPI0617624-0A BRPI0617624A BRPI0617624B1 BR PI0617624 B1 BRPI0617624 B1 BR PI0617624B1 BR PI0617624 A BRPI0617624 A BR PI0617624A BR PI0617624 B1 BRPI0617624 B1 BR PI0617624B1
Authority
BR
Brazil
Prior art keywords
speech recognition
speech
media resource
recognition
parameter
Prior art date
Application number
BRPI0617624-0A
Other languages
English (en)
Inventor
Cheng Chen
Original Assignee
Huawei Technologies Co., Ltd.
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Family has litigation
First worldwide family litigation filed litigation Critical https://patents.darts-ip.com/?family=37962208&utm_source=google_patent&utm_medium=platform_link&utm_campaign=public_patent_search&patent=BRPI0617624(B1) "Global patent litigation dataset” by Darts-ip is licensed under a Creative Commons Attribution 4.0 International License.
Application filed by Huawei Technologies Co., Ltd. filed Critical Huawei Technologies Co., Ltd.
Publication of BRPI0617624A2 publication Critical patent/BRPI0617624A2/pt
Publication of BRPI0617624B1 publication Critical patent/BRPI0617624B1/pt

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/28—Constructional details of speech recognition systems
    • G10L15/30—Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04L—TRANSMISSION OF DIGITAL INFORMATION, e.g. TELEGRAPHIC COMMUNICATION
    • H04L65/00—Network arrangements, protocols or services for supporting real-time applications in data packet communication
    • H04L65/1066—Session management
    • H04L65/1101—Session protocols
    • H04L65/1106—Call signalling protocols; H.323 and related
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04L—TRANSMISSION OF DIGITAL INFORMATION, e.g. TELEGRAPHIC COMMUNICATION
    • H04L65/00—Network arrangements, protocols or services for supporting real-time applications in data packet communication
    • H04L65/60—Network streaming of media packets
    • H04L65/75—Media network packet handling
    • H04L65/762—Media network packet handling at the source 
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/08—Speech classification or search
    • G10L15/18—Speech classification or search using natural language modelling
    • G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
    • G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Business, Economics & Management (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Human Computer Interaction (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • General Business, Economics & Management (AREA)
  • Health & Medical Sciences (AREA)
  • Computational Linguistics (AREA)
  • Telephonic Communication Services (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Selective Calling Equipment (AREA)
  • Communication Control (AREA)
  • Machine Translation (AREA)

Abstract

método para reconhecer uma fala, dispositivo de processamento de recursos de meios, sistema para implementar função de reconhecimento de fala. a presente invenção refere-se um método, a um dispositivo e a um sistema para implementar uma função de recolhecimento de fala, no qual um dispositivo de controle de recursos de meios controla um dispositivo de processamento de recursos de meios para reconhecer uma entrada de fala por um usuário por meio do protocolo h.248. o método inclui: receber, pelo dispositivo de processamento de recursos de meios, uma mensagem h.248 transportando uma instrução de reconhecimento de fala e um parâmetro relacionado enviado pelo dispositivo de controle de meios: realizar reconhecimento de fala de acordo com a instrução de reconhecimento de fala e o parâmetro; e relatar um resultado de reconhecimento para o dispositivo de controle de recursos de meios. além do mais, um dispositivo correspondente e sistema para implementar a função de reconhecimento de fala é fornecido adicionalmente.

Description

MÉTODO PARA RECONHECER UMA FALA, DISPOSITIVO DE PROCESSAMENTO DE RECURSOS DE MEIOS, SISTEMA PARA IMPLEMENTAR FUNÇÃO DE RECONHECIMENTO DE FALA
CAMPO DA INVENÇÃO
A presente invenção refere-se ao campo de tecnologia de informação, e em particular, a um método, dispositivo e sistema para implementar uma função de reconhecimento de fala.
ANTECEDENTES DA INVENÇÃO
O reconhecimento de fala se refere à função de converter uma entrada de fala por um usuário em um texto de acordo com uma gramática especifica. Por exemplo, em um pedido de interação,. um sistema primeiro reproduz um sinal de orientação para um usuário 0 que você quer? Água, coca-cola, ou suco de fruta?. 0 usuário pode responder por meio de uma fala, e a fala pode incluir somente a pronúncia de palavraschaves água, coca-cola, suco de fruta ou nada. 0 sistema pode reconhecer a fala do usuário e então fornecer o objeto selecionado para o usuário.
No aplicativo de rede fixa ou móvel, existem geralmente dois métodos para um usuário inserir.
Método 1: O usuário insere com uma freqüência múltipla de sinal- duplo (DTMF). Por exemplo, no pedido de interação acima, quando o usuário insere 1, é indicado que a água' é 25 selecionada, quando o usuário insere 2 é indicado que coca-cola é selecionada; quando o usuário insere- 3, é indicado que suco de fruta é selecionado. E quando uma outra tecla é pressionada, é indicado que nada é desejado. Tal método foi definido no protocolo H.248.
Método 2: 0 usuário insere diretamente uma fala, e o sistema pode transmitir a entrada de fala pelo usuário para o outro grupo de comunicação, ou gravar a fala, ou realizar o reconhecimento de fala.
Uma função parecida com a entrada DTMF pode ser 35 conseguida por meio do processo de reconhecimento de fala. O sistema pode determinar a seleção do usuário de acordo com a
2/23 λ) fala do usuário. As vantagens do reconhecimento de fala estão no fato de que, o usuário pode interagir com um sistema diretamente por meio de uma fala e nenhum outro dispositivo de entrada auxiliar, tal como dispositivo para inserir DTMF 5 pela pressão de uma tecla, é necessário, de modo que o modo de entrada do usuário possa ser simplificado. Como a tecnologia de reconhecimento de fala se aperfeiçoa, a tecnologia de reconhecimento de fala se tornará o modo de entrada predominante.
0 protocolo H.248 define métodos de controle de recursos de meios abundantes por meio de pacotes.
1. O protocolo H.248.9 define os métodos por meio de Pacotes de Servidor de Meios Avançados, incluindo o seguinte:
1) O método de reprodução de um segmento de fala, no qual a localização do segmento de fala pode ser indicada por um Identificador de Recurso Uniforme (URI), e parâmetros tais como número de iterações da reprodução do segmento de fala, o intervalo de silêncio a ser inserido entre reproduções iterativas, e volume e velocidade de cada reprodução, podem 20 ser indicadqs;
2) 0 método de sinal de reprodução de coleção DTMF, no
qual a reprodução de sinal de orientação e a coleção DTMF são
realizadas interativamente; e
3) 0 método de gravação de áudio, no qual o ID ou a
localização do armazenamento de um arquivo de registro é devolvido.
2. O protocolo H.248.7 define um método para reproduzir um registro de acordo com um ID de comunicação.
3. O protocolo H.248.16 define um método para uma 30 operação de coleção de dígitos DTMF complexa.
Entretanto, o método para um usuário inserir diretamente uma fala não é definido no protocolo H.248, e a função de reconhecimento de fala é necessária no ambiente de aplicativos de recursos de meios.
SUMÁRIO DA INVENÇÃO
As modalidades da invenção fornecem um método, um
3/23 fldispositivo e um sistema para implementar uma função de reconhecimento de fala de modo que o reconhecimento de fala possa ser realizado de acordo com uma instrução e um parâmetro transportado em uma mensagem relacionada, e um 5 usuário pode interagir diretamente com um sistema por meio de uma fala. Uma modalidade da invenção fornece um método para implementar uma função de reconhecimento de fala, na qual um dispositivo de controle de recursos de meios controla um dispositivo de processamento de recursos de meios para 10 reconhecer uma entrada de fala por . um usuário por meio do protocolo H.248. O método inclui:
-receber, pelo dispositivo de processamento de recursos de meios, uma mensagem H.248 transportando uma instrução de reconhecimento de fala e um parâmetro relacionado enviado 15 pelo dispositivo de controle de recursos de meios;
-realizar, pelo dispositivo de processamento de recursos de meios,' um reconhecimento de fala de acordo com a instrução de reconhecimento de fala e com o parâmetro; e
-relatar um resultado de reconhecimento para o 20 dispositivo de controle de recursos de meios.
O parâmetro relacionado inclui um parâmetro de gramática de reconhecimento para uma fala.
Quando o parâmetro de «gramática de reconhecimento é uma gramática de reconhecimento para uma fala comum, , o 25 dispositivo de processamento de recursos de meios realiza o reconhecimento de fala de acordo com o parâmetro de gramática de reconhecimento.
Preferivelmente, a gramática de reconhecimento que é uma série de caracteres específica é embutida no parâmetro de 30 gramática de reconhecimento, e o dispositivo de processamento de recursos extrai uma série de textos e realiza o reconhecimento de fala após receber o parâmetro de gramática de reconhecimento.
Preferivelmente, quando a gramática de reconhecimento 35 para.· a fala é pré-armazenada no dispositivo de. processamento de recursos de meios ou em um servidor externo, o parâmetro
4Ρ
4/23
de gramática de reconhecimento é um ID de arquivo e informação de localização de armazenamento de um arquivo de gramática de reconhecimento, e o dispositivo de processamento de recursos de meios lê e faz cache do arquivo de gramática 5 de reconhecimento de acordo com a informação de localização de armazenamento e realiza o reconhecimento de fala de acordo com o arquivo de gramática de reconhecimento que é lido.
Preferivelmente, o parâmetro relacionado inclui:
-um parâmetro usado durante o reconhecimento de fala, que inclui um parâmetro adaptado para informar se reconhece uma fala comum somente, e o dispositivo de processamento de recursos de meios realiza o reconhecimento de fala de acordo com o parâmetro relacionado; e/ou . -um parâmetro adaptado para indicar uma duração de tempo do reconhecimento de fala, e o dispositivo de processamento de recursos de meios determina a duração do tempo do reconhecimento de fala de acordo com o parâmetro, e/ou
-um parâmetro adaptado para indicar um tempo de espera, e o dispositivo de processamento de recursos de meios 20 determina o tempo de espera para um usuário inserir de acordo com o parâmetro, e/ou
-um parâmetro adaptado para indicar um tipo de uma linguagem a ser reconhecida, e o dispositivo de.processamento de recursos de meios determina o tipo de linguagem empregada 25 durante o reconhecimento de fala comum de acordo com o parâmetro; e/ou
-um parâmetro adaptado para indicar uma precisão de reconhecimento, e o dispositivo de processamento de recursos de meios determina a precisão de reconhecimento necessária 30 durante o reconhecimento de fala comum de acordo com o parâmetro; e/ou
-um parâmetro adaptado para indicar uma sensibilidade de reconhecimento, e o dispositivo de processamento de recursos de meios determina a sensibilidade de reconhecimento 35 necessária durante o reconhecimento de fala comum de acordo com o parâmetro; e/ou
5/23
-um parâmetro adaptado para indicar uma localização de armazenamento de um registro, e o dispositivo de processamento de recursos de meios lê a entrada de registros pelo usuário de uma localização designada de acordo com o 5 parâmetro; e/ou
-um parâmetro para indicar o arquivo de gramática a ser lido, e informa para ler o arquivo de gramática de um servidor externo e faz cache do arquivo de gramática localmente quando a gramática de reconhecimento é armazenada 10 em um arquivo; e/ou
-um parâmetro adaptado para indicar um tempo de cache para o arquivo de gramática e definir o tempo de cache para o arquivo de gramática do servidor, e se a duração de um cache excede o tempo de cache que foi definido, o cache é inválido.
Preferivelmente, durante o reconhecimento de fala realizado pelo dispositivo de processamento de recursos de meios, o método inclui:
-detectar, pelo dispositivo de processamento de recursos de meios, um evento anormal incluindo o tempo de espera para 20 um usuário inserir intervalo de tempo, um intervalo de tempo de reconhecimento, um agrupamento errôneo entre uma entrada e gramática do usuário, o arquivo de gramática que não existe, o erro que é lido do arquivo de gramática, uma entrada do usuário que é incapaz de ser reconhecida, um erro de 25 reconhecimento, e um erro de software/hardware do dispositivo de processamento de recursos de meios; e/ou
-detectar, pelo dispositivo de processamento de recursos de meios, um evento de entrada de uma fala por um usuário e relatar um tipo de fala de uma entrada de fala detectado pelo 30 usuário para o dispositivo de controle de recursos de meios, a fala incluindo: uma fala DTMF e uma comum,
O método inclui adicionalmente detectar, pelo dispositivo de processamento de recursos de meios, o processamento de reconhecimento de fala de acordo com uma 35 instrução do dispositivo de controle de recursos de meios, e realimentando um resultado de detecção para o dispositivo de
Λτ
6/23 controle de recursos de meios.
Preferivelmente, o método inclui adicionalmente realimentar, pelo dispositivo de processamento de recursos de meios, um código de erro correspondente para o dispositivo de 5 controle de recursos de meios ao detectar o evento anormal durante o reconhecimento de fala.
Uma modalidade da invenção fornece adicionalmente um dispositivo de processamento de recursos de meios, incluindo:
-uma unidade de obtenção de instrução, adaptada para 10 obter um parâmetro de controle relacionado e uma gramática de reconhecimento.
-uma unidade de obtenção de fala, adaptada para obter um sinal de fala para ser reconhecido que é introduzido por um usuário e enviar o sinal de fala para uma unidade de 15 reconhecimento de fala;
-a unidade de reconhecimento de fala, adaptada para converter um sinal de fala de entrada em uma série de caracteres reconhecidos pela máquina de acordo com a gramática de reconhecimento e o parâmetro de controle; e
-uma unidade de expedição, adaptada para enviar um resultado de processamento da unidade de reconhecimento de fala para um dispositivo de controle de recursos de meios.
dispositivo inclui adicionalmente: uma unidade de obtenção de arquivo, adaptada para obter um arquivo de 25 gramática pré-armazenado externamente e enviar o arquivo de gramática para a unidade de reconhecimento de fala, e a unidade de reconhecimento de fala extrai a gramática de reconhecimento do arquivo de gramática recebido e processa um sinal de fala.
Uma modalidade da invenção fornece um sistema para implementar uma função de reconhecimento de fala, incluindo:
-um dispositivo de controle de recursos de meios, adaptado para ampliar o protocolo H.248, enviar uma mensagem H.248 transferindo uma instrução de reconhecimento de fala e 35 um parâmetro relacionado com um dispositivo de processamento de reçursos de meios, e controlar o dispositivo de
Μ <
7/23 processamento de recursos de meios para realizar um reconhecimento de fala; e
-um dispositivo de processamento de recursos de meios, adaptado para receber a mensagem H.248 transferindo a 5 instrução de reconhecimento de fala e parâmetro relacionado do dispositivo de controle de recursos de meios, realizar o reconhecimento de fala de acordo com o parâmetro, e .realimentar um resultado do reconhecimento de fala para o dispositivo de controle de recursos de meios.
O parâmetro relacionado inclui um parâmetro de gramática de reconhecimento de fala e o dispositivo de processamento de recursos de meios extrai uma série de texto e realiza o reconhecimento de fala após receber o parâmetro de gramática de reconhecimento.
Quando uma gramática de reconhecimento para uma fala é pré-armazenado no dispositivo de processamento de recursos de meios ou em um servidor externo, o parâmetro de gramática de um ID e informação de localização de um arquivo de gramática de reconhecimento, e processamento de recursos de meios lê e faz de gramática de reconhecimento localização de armazenamento fala de acordo com conhecimento é armazenamento de o dispositivo de cache do arquivo a informação de reconhecimento de o arquivo que é lido.
O dispositivo de processamento inclui:
de acordo com realiza o de gramática de reconhecimento de recursos de meios uma unidade de reconhecimento de reconhecer uma fala e converter um sinal fala, adaptada para de fala em uma série de caracteres reconhecíveis por máquina;
de. fala é
-a unidade de reconhecimento dispositivo de processamento de configurada independentemente.
Em comparação com a técnica modalidades da invenção, fala e um parâmetro relacionado mensagem H.248 pela definição <
recursos configurada no de meios ou anterior, uma instrução de reconhecimento de ► são transportados em uma de um pacote ampliado de de acordo com
8/23
4Ί
protocolo H. 2.4 8, de modo a informar um dispositivo de
processamento de recursos de meios a realizar um
reconhecimento de fala correspondente ao parâmetro. 0
dispositivo de processamento de recursos de meios recebe a
transferindo a de recursos mensagem H.248 pelo dispositivo de controle instrução e o parâmetro enviado de meios, e realiza o reconhecimento de fala de acordo com o parâmetro. Portanto, o reconhecimento para uma entrada de fala comum por um usuário pode ser implementado por meio do protocolo H.248.
Deste modo, o usuário pode interagir com um sistema diretamente por meio de uma fala, o modo de entrada do usuário pode ser simplificado, e a operação de entrada pode ser mais fácil ou mais simples.
BREVE DESCRIÇÃO DOS DESENHOS
A figura 1 é um diagrama esquemático mostrando a arquitetura de rede para processamento de um serviço de recursos de meios em uma rede WCDMA IMS da técnica anterior;
A figura 2 é um diagrama esquemático mostrando a arquitetura de rede para processamento de um serviço de 20 recursos de meios em uma rede comutada soft fixa da técnica anterior;
A figura 3 é um gráfico de fluxo do método para implementar a função de reconhecimento de fala de acordo com uma modalidade da invenção; e a figura 4 é um diagrama 25 esquemático mostrando a estrutura do dispositivo para implementar a função de reconhecimento de fala de acordo com uma modalidade da invenção.
DESCRIÇÃO DETALHADA DAS MODALIDADES
Como é mostrado na figura 1, em uma rede WCDMA IMS, o 30 servidor de aplicativos 1 é adaptado para processar vários serviços, tais como reproduzir um anúncio para um usuário, coleção de dígitos DTMF, conferência e gravação. O dispositivo de controle de sessão de chamada de serviço 2 é adaptado para processar uma rota e avançar uma mensagem 35 enviada pelo servidor de aplicativos 1 para o dispositivo de controle de recursos de meios 3 corretamente, ou encaminhar
9/23
Λ5 uma mensagem enviada pelo dispositivo de controle de recursos de meios 3 para o servidor de aplicativos 1 corretamente. 0 dispositivo de controle de recursos de meios 3 é adaptado para controlar recursos de meios, selecionar um dispositivo de processamento de recursos de meios correspondente 4 e controlar o processamento para recursos de meios de acordo com o requerimento do servidor de aplicativos 1. O dispositivo de processamento de recursos de meios 4 é adaptado para processar recursos de meios, e completar o .
processamento para os recursos de meios expedidos pelo servidor de aplicativos 1 sob o controle do dispositivo de controle de recursos de meios 3.
A interface empregada entre o servidor de aplicativos 1, dispositivo de controle de·, sessão de chamada de serviço 2 e 15 dispositivo de controle de recursos de meios 3 usa protocolo SIP e protocolo XML, ou protocolo SIP e um protocolo similar ao XML (por exemplo, VXML). A interface empregada entre o dispositivo de controle de recursos de meios 3 e o dispositivo de processamento de recursos de meios 4 é uma interface Mp e usa o protocolo H.248. A interface externa do dispositivo de processamento de recursos de meios 4 é uma interface Mb usando protocolo RTP para transportar um fluxo de meios do usuário.
A figura 2 é um diagrama esquemático mostrando a arquitetura de rede para processar um serviço de recursos de meios em uma rede comutada soft fixa. O servidor de recursos de meios (MRS) corresponde ao dispositivo de controle de recursos de meios 3 e ao dispositivo de processamento de recursos de meios 4 na rede WCDMA IMS , e o servidor de aplicativos corresponde ao servidor de aplicativos 1 e o dispositivo de controle de sessão de chamada de serviço 2 na rede WÇDMA IMS, e a função do dispositivo de comutação soft é substancialmente a mesma que a do servidor de aplicativos 1.
método para implementar a função de reconhecimento de 35 fala por meio do protocolo H. 248 de acordo com a invenção é adaptado para processar os recursos de meios na rede WCDMA
10/23 /1^
IMS mostrada na figura 1 e a rede comutada soft fixa mostrada na figura 2. Similarmente, o método pode também ser aplicado a outras redes, por exemplo, a rede CDMA e a rede IMS fixa, e rede comutada soft de circuito WCDMA e CDMA. Na rede CDMA e 5 rede IMS. fixa, a arquitetura e fluxo de processo de serviço do cenário de aplicativos de recursos de meios são basicamente os mesmos que aqueles da rede WCDMA IMS. Na rede comutada soft de circuito CDMA e WCDMA, a arquitetura de aplicativos de recursos de meios e fluxo de processo de 10 serviço são basicamente os mesmos que aqueles da rede comutada soft fixa. Em outras palavras, a invenção pode ser aplicada ao caso no qual um dispositivo relacionado com recursos de meios é controlado por meio do protocolo H.248 para implementar a função de reconhecimento de fala.
O método para implementar a função do - reconhecimento de fala por meio do protocolo H.248 de acordo com a invenção será ilustrado agora pelo caso no qual o método é aplicado a rede WCDMA IMS como um exemplo, em conjunto com os desenhos.
Geralmente, o reconhecimento de fala inclui o 20 reconhecimento de fala comum e reconhecimento DTMF, e o reconhecimento de fala comum e o reconhecimento DTMF podem ocorrer geralmente ao mesmo tempo. Para o reconhecimento DTMF e o reconhecimento de fala comum, tecnologias diferentes são usadas e o processo de controle e parâmetros necessários 25 também são diferentes. Por que a detecção de um DTMF já foi definida no protocolo H.248, a invenção dará ênfase ao reconhecimento de fala comum e ao reconhecimento simultâneo da fala comum e ao DTMF.
Na ' presente invenção, porque a. invenção somente se 30 relaciona ao processo entre o dispositivo de controle de recursos de meios 3 e o dispositivo de processamento de recursos de meios 4 mostrado na figura 1 enquanto outros processos são os mesmos que aqueles na rede WCDMA IMS existente, para simplificação, somente o processo entre o 35 dispositivo de controle de recursos de meios 3 e · dispositivo de processamento de recursos de meios 4 será descrito.
11/23
A figura 3 é uma gráfico de fluxo do processo no qual o dispositivo de controle de recursos de meios 3 e o dispositivo de processamento de recursos de meios 4 controlam e processam recursos de meios.
Etapa 1: o dispositivo de controle de recursos de meios envia uma instrução para realizar um reconhecimento de fala para o dispositivo de processamento de recursos de meios 4.
Especificamente, o dispositivo de controle de .recursos de meios 3 transporta uma instrução de reconhecimento de fala 10 e parâmetros relacionados em uma mensagem pela definição de um pacote ampliado de protocolo H.248 de modo a controlar um dispositivo de processamento de recursos de meios para realizar o reconhecimento de fala. O pacote ampliado de protocolo H.248 é definido como se segue:
Nome do pacote Pacote ASR
ID do pacote asrp(0x??)
Descrição Refere-se a descrição da solução
Versão 1
Estende . Nula
1. Propriedades
Nula
2. Eventos
Referem-se à definição de um evento abaixo.
3. Sinais.
Referem-se à definição de um sinal abaixo.
4. Estatística
Nula
5. Procedimento
0 procedimento correspondente à solução completa descrita abaixo.
Aqui, õ reconhecimento de fala inclui reconhecimento de fala comum e um reconhecimento DTMF. A gramática de reconhecimento de DTMF foi definida no protocolo H.248. O 30 reconhecimento de fala cpmum precisa transportar uma gramática de reconhecimento, e existem dois métodos para
12/23 /1¾ transportar o parâmetro de gramática de reconhecimento.
1) A gramática de reconhecimento é transportada no parâmetro de uma mensagem H.248.
A gramática de reconhecimento é uma série de caracteres de um formato especifico, por exemplo:
#JSGF vl. 0;
Bebida de gramática;
Público<returncommands>= água| coca-cola| suco de frutas | nada..
O formato da série de texto não é reconhecido por uma entidade funcional para processar o protocolo H.248. A série de texto somente é encaixada em uma mensagem H.248 como uma série. Após receber o parâmetro, o dispositivo de processamento de recursos de meios 4 pode.extrair diretamente 15 a série de texto e submeter a série de texto extraída a um identificador de fala para processamento. O identificador de fala pode ser configurado no dispositivo de processamento de recursos de meios 4 e pode também ser configurado independentemente.
2) O ID e a informação de localização de armazenamento da gramática de reconhecimento de fala são transportados no parâmetro de uma mensagem H.248.
A gramática de reconhecimento de fala pode ser préarmazenada no dispositivo de processamento de recursos de 25 meios 4 ou outros servidores externos, e o ID e a informação de localização de armazenamento do. arquivo de gramática são transportados na mensagem H.248.
O ID do arquivo pode ser qualquer série de texto que se adapte a especificação de nome do arquivo.
A informação de localização de armazenamento do arquivo inclui as três formas seguintes.
A) um arquivo que pode ser localmente acessado diretamente, tal como drink.gra.
B) um arquivo que pode ser acessado no arquivo:// mode, tal como o arquivo://huawei/drink.gra.
C) um arquivo que pode ser acessado no http://mode, tal
13/23 como http;//huawei/drink.gra.
Após receber o parâmetro, o dispositivo de processamento de recursos de meios 4 primeiro lê o arquivo de gramática de um servidor remoto ou um armazenamento local de acordo com a 5 localização de armazenamento do arquivo, coloca o arquivo de gramática em um cache, e então processa o arquivo de gramática por meio de um identificador de fala.
Em acréscimo a gramática de reconhecimento ou informação relacionada, parâmetros para realizar o reconhecimento de 10 fala também precisam ser transportados na mensagem H.248. Os parâmetros para realizar o reconhecimento de fala são adaptados para informar o dispositivo de processamento de recursos de meios 4 para realizar a função de reconhecimento de fala. Os parâmetros incluem os seguintes parâmetros:
1)Se reconhecem ou não um DTMF e uma fala comum simultaneamente
Em certos aplicativos, o usuário precisa somente inserir uma fala comum. Se este parâmetro é definido como Sim, o dispositivo de processamento de recursos de meios 4 realizará 20 o reconhecimento de fala comum e o reconhecimento DTMF não importando que o usuário insira uma fala comum ou um DTMF.
2) Duração do reconhecimento
Este parâmetro é adaptado ara indicar a extensão do tempo de reconhecimento. Em outras palavras, quando um 25 usuário começa a introduzir, se o reconhecimento de fala não é completado em uma duração especificada, o processo realimenta por tempo esgotado.
3) Tempo de espera para um usuário inserir
Este parâmetro é adaptado parta indicar o tempo de 30 espera, do reconhecimento. Em outras palavras, quando o reconhecimento é iniciado, se nenhuma entrada de usuário é detectada em uma duração dada, o processo realimenta por tempo esgotado.
4) Tipo de linguagem a ser reconhecida
Este parâmetro é adaptado para indicar o tipo de linguagem empregada pelo dispositivo de processamento de
14/23
Ί° recursos de meios durante o reconhecimento de fala comum, e este parâmetro se adapta, por exemplo, a definição do protocolo RFC3066.
5) Precisão de Reconhecimento
Este parâmetro representa a precisão de reconhecimento, como é indicado por um valor entre 0 e 100. Quanto mais alta for a precisão, maior será a quantidade de processamento, e mais longo será o tempo de reconhecimento.
6) Sensibilidade
Este parâmetro é adaptado para representar a sensibilidade necessária pelo reconhecimento de fala, como é indicado por um valor entre 0 e 100. Quanto mais alta for a sensibilidade, maior será a influência do barulho de fundo, e quanto mais baixa for a sensibilidade, menor será a 15 influência do barulho de fundo.
7) Localização de Armazenamento de Registro
Durante o reconhecimento de fala, a entrada do usuário pode ser gravada e armazenada em uma localização designada. Este parâmetro é adaptado para indicar a localização de 20 armazenamento do registro do usuário.
8) Sé realiza a pré-busca de um arquivo de gramática
Quando a gramática de reconhecimento é armazenada no modo de arquivo, se este parâmetro é definido como Sim, o dispositivo de processamento de recursos de meios 4 lê o 25 arquivo de gramática de um servidor externo e cache o arquivo de gramática localmente após receber um pedido; se este parâmetro é definido como Não. O arquivo ,de gramática é lido durante o reconhecimento.
9) Tempo de cache do Arquivo de Gramática
Este parâmetro representa a .duração de tempo que o dispositivo de processamento de recursos de meios 4 faz cache de um arquivo de gramática lido de um servidor. Se o tempo termina, o cache é considerado como inválido.
O pacote de protocolo H.248 mencionado na etapa 1 usa as 35 seguintes definições:
1. Sinal: O sinal inclui sinal de Arquivo de Gramática
Ί.1
15/23 de Reconhecimento de fala Automático (ASR) ou sinal de Série de Gramática ASR, correspondendo aos dois métodos para transportar um parâmetro de gramática de reconhecimento respectivamente..
1) 0 Arquivo de Gramática ASR é adaptado para informar para realizar a função de reconhecimento de fala.
Nome do sinal Arquivo de Gramática ASR
ID do sinal asrgf(0x??)
Descrição Realizar a função ASR
Tipo de sinal br
Duração Não aplicável
Parâmetro Adicional inclui:
I.
Nome do Parâmetro Arquivo.de Gramática
ID do Parâmetro gf(0x??)
Descrição Nome do arquivo de gramática de reconhecimento ASR e localização de armazenamento
Tipo Série de caracteres (série)
Opcional Não
Valor Possível ID de arquivo válido e formato de armazenamento
Default Nulo
' 10 II.
Nome do Parâmetro Reconhecer DTMF
ID do Parâmetro rd(0x'??)
Descrição Reconhece-se DTMF simultaneamente
Tipo Enum
Opcional Sim
Valor Possível Sim, Não
Default sim
III.
16/23
Nome do Parâmetro Tempo de Reconhecimento de Espera
ID do Parâmetro wrt(0x??)
Descrição Tempo de espera para reconhecimento
Tipo Número Inteiro
Opcional Sim
Valor Possível Maior do que 0 segundo
Default Nulo
IV.
Nome Parâmetro do Tempo de Entrada de Espera
ID do wit(Ox??)
Parâmetro
Descrição Tempo de espera para um usuário inserir
Tipo Número Inteiro
Opcional Sim
Valor. Possível Maior do que 0 segundo
Default Nulo
V.
Nome do Parâmetro Tipo de Linguagem
ID do Parâmetro lt (Ox??)
Descrição Tipo de linguagem a ser reconhecida
Tipo Série de Caracteres
Opcional Sim
Valor Possível Adaptar ao protocolo RFC3066
Default - Nulo
VI.
Nome do Parâmetro Reconhecer Precisão
ID do Parâmetro ra(0x??)
Descrição Precisão de reconhecimento
Tipo' Número Inteiro
Opcional Sim
Valor Possível 0 - 100
Default Nulo
VII.
Nome do Parâmetro Reconhecer Sensibilidade
ID . do Parâmetro ra(0x??.)
Descrição • i · l í Requerimento ' para reconhecer sensibilidade
Tipo Número Inteiro
Opcional Sim
Valor Possível 0-100
Default Nulo
VIII.
17/23
Nome do Parâmetro Gravar Arquivo
ID do Parâmetro rf(0x??)
Descrição Gravar localização de armazenamento do fala a ser reconhecido
Tipo Série de Caracteres
Opcional Sim
Valor Possível Série URI válida ou nome de arquivo local
Default Nulo
IX.
Nome do Parâmetro Pré-buscar Gramática
ID do Parâmetro pg(0x??)
Descrição Se pré-busca um arquivo de gramática
Tipo Enum
Opcional Sim
.Valor Possível Sim, Não
.Default Nulo
X.
Nome do Parâmetro Tempo de Cache
ID do Parâmetro ct (Ox??)
Descrição Tempo de cache do arquivo de gramática
Tipo Número Inteiro
Opcional Sim
Valor.Possível Maior do que 0 segundo
Default Nulo
2j A Série de Gramática ASR é adaptada para informar para realizar a função de reconhecimento de fa1a.
Nome do Sinal Série de Gramática ASR
ID . do Sinal: ags(Ox??)
Descrição Realizar, a função ASR de acordo com a série de gramática ···
Tipo de Sinal br
Duração Não aplicável
O Parâmetro Adicional inclui:
I.
Nome do Parâmetro Série de Gramática
ID do Parâmetro gf(0x??)
Descrição Gramática de reconhecimento ASR
Tipo Série de Caracteres
Opcional Não
18/23
Valor Possivel Gramática de reconhecimento válida
Default Nulo
II. Outros parâmetros são os mesmos que II, III, IV, V, VI, VII e VIII de sinal dè Arquivo de Gramática ASR.
Etapa 2: Quando o dispositivo de processamento de recursos de meios 4 recebe a instrução de reconhecimento de fala do .dispositivo de controle de recursos de meios 3, o dispositivo de processamento de recursos de meios 4 realiza a confirmação da mensagem e realimenta o resultado da confirmação para o dispositivo de controle de recursos de meios 3. Além disso, o dispositivo de processamento de recursos de meios 4 realiza o processo correspondente de acordo com os parâmetros acima na mensagem, tal como, se reconhece um DTMF e uma fala comum simultaneamente,, duração de reconhecimento, tempo de espera para um usuário inserir, localização de armazenamento de registro, se pré-busca um arquivo de gramática, tempo de cache do arquivo de gramática. Especificamente, um identificador de fala reconhece uma entrada ,de fala por um usuário, incluindo o tipo de linguagem, precisão e sensibilidade do reconhecimento.
Etapa 3: O dispositivo de controle de recursos de meios informa o dispositivo de processamento de recursos de meios para detectar um evento que ocorre durante o reconhecimento de fala.
Etapa 4: O dispositivo de processamento de recursos de meios 4 realiza uma confirmação de mensagem e realimenta o resultado da confirmação para o dispositivo de controle de recursos de meios 3. Além disso, o dispositivo de processamento de recursos de meios 4 detecta o evento que ocorre durante o'reconhecimento de fala.
O evento possivel inclui o seguinte:
a) Um código de erro para realizar a função de reconhecimento de fala é devolvido em uma situação anormal.
Quando o dispositivo de processamento de recursos de meios 4 realiza o reconhecimento de fala, se uma anormalidade ocorre, um código de erro especifico precisa ser. devolvido ao
19/23 dispositivo de controle de recursos de meios. 0 valor especifico do código de erro é definido e localizado uniformemente de acordo como padrão relacionado, e o conteúdo do código de erro inclui:
l)o tempo de espera para um usuário inserir a fala excede um tempo predeterminado;
2) o tempo de reconhecimento de fala excede um tempo predeterminado;
3) a entrada de fala pelo usuário agrupa erroneamente a 10 gramática de reconhecimento;
4) o arquivo de gramática não existe;
5) erro de leitura do arquivo de gramática;
6) erro de gramática, de reconhecimento de fala;
7) incapaz de ser reconhecido ou erro de reconhecimento;
8). um erro de hardware do dispositivo de processamento de recursos de meios 4;
9) um erro de software do dispositivo de processamento de recursos de meios 4; e
10) outros erros.
b) É detectado que um usuário começa a inserir uma fala.
Quando um usuário começa a inserir uma fala, o dispositivo de processamento de recursos de meios 4 pode relatar o tipo de entrada de fala detectada pelo usuário para o dispositivo de controle de recursos de meios 3. A fala 25 inserida inclui o DTMF e a fala comum.
Na etapa 4, os eventos definidos por meio do pacote de protocolo H.248 inclui o seguinte:
Eventos:
1) Falha ASR
Nome do Evento Falha ASR
ID do Evento asrfail(Ox??)
Descrição. 0 reconhecimento. de... fala falha, e um código de erro é devolvido
Parâmetros do descritor :do Evento Nulo
Parâmetros do Descritor do Evento Observados:
I.
20/23
Nome do Parâmetro Devolver Código de Falha
ID do Parâmetro rfc(0x??)
Descrição Parâmetro do código de erro
Tipo de Parâmetro Número Inteiro
Opcional Não
Valor Possível Código de erro definido na solução acima
Default Nulo
2) Sucesso ASR
Nome do Evento Sucesso ASR
ID do Evento asrsucc(0x??)
Descrição 0 reconhecimento de fala é bem sucedido, e o resultado do reconhecimento é devolvido
Parâmetros do Descritor do Evento Nulo
Parâmetros do Descritor do Evento Observados:
I.
Nome do Parâmetro Resultado ASR
ID do Parâmetro ar(0x??)
Descrição Resultado do reconhecimento
Tipo, de Parâmetro Série de caracteres
Opcional Não
Valor Possível Série DTMF ou série de texto
Default Nulo
II.
Nome do Parâmetro Confiabilidade do resultado
ID do Parâmetro rr(0x??)
Descrição ..\ Confiabilidade do resultado do reconhecimento
Tipo de Parâmetro Número Inteiro
Opcional Sim
Valor Possível 0-100
Default 100
3) Início ASR
Nome do Evento Início ASR
ID;-do Evento asrbeg(0x??)
Descrição 0 reconhecimento de fala é bem sucedido, e o resultado do reconhecimento é devolvido
Parâmetros do Descritor do Evento Nulo
Parâmetros do Descritor do Evento Observados:
I.
21/23
Nome do Parâmetro Tipo de Entrada
ID do Parâmetro it(0x??)
Descrição Tipo de entrada do Usuário: DTMF e fala comum
Tipo de Parâmetro Série de caracteres
Opcional Não
Valor Possível DTMF e fala comum
Default Nulo
Etapa 5: Após o dispositivo de processamento de recursos de meios completar o reconhecimento de fala de acordo com os parâmetros transportados pelo dispositivo de controle
3, o dispositivo recursos de meios recursos de meios reconhecimento de de relata o evento de processamento detectado durante de fala, e relata a confiabilidade do resultado do reconhecimento controle de recursos de reconhecimento é uma série devolvido para o dispositivo de meios
3.
resultado do de caracteres, de caracteres pode ser o resultado do reconhecimento . de uma série DTMF ou o resultado do reconhecimento de fala comum. A entidade funcional para processar o protocolo H.248 não pode reconhecer a série e então devolve a série para o dispositivo 15 de controle de recursos de meios 3 para processamento.
Etapa 6: O dispositivo de controle de recursos 3 confirma o resultado do reconhecimento relatado pelo dispositivo de processamento de recursos de meios 4.
Com referência a figura 4, uma modalidade da invenção 20 fornece um çiispositivo de processamento de recursos de meios, incluindo:
-unidade de obtenção de instrução 10, adaptada para obter um parâmetro de controle relacionado e uma gramática de reconhecimento;
-unidade de obtenção de fala 20, adaptada para obter um sinal de fala para ser reconhecido que é inserido por um usuário e enviar o sinal de fala para uma unidade de reconhecimento de fala;
-unidade de reconhecimento de fala 30, adaptada para 30 converter um sinal de fala de entrada em uma série .de
2¾
3'
22/23 caracteres reconhecíveis por máquina de acordo com a gramática de reconhecimento e o parâmetro de controle; e
-unidade de transmissão 40, adaptada para enviar um resultado de processamento da unidade de reconhecimento de.
fala para um dispositivo de controle de recursos de meios.
dispositivo inclui adicionalmente unidade de obtenção de arquivo 50 adaptada para obter um arquivo de gramática pré-armazenado externamente e enviar o arquivo de gramática para a unidade de reconhecimento de fala quando a gramática 10 de reconhecimento é fornecida por meio de um arquivo externo, e a unidade de reconhecimento de fala extrai a gramática de reconhecimento do arquivo de gramática recebido e processa um sinal de fala,
Uma modalidade da invenção fornece um sistema para 15 implementar uma função de reconhecimento de fala, incluindo:
-um dispositivo de controle de recursos de meios, adaptado para ampliar o protocolo H.248, enviar uma mensagem H.248 transportando uma instrução de reconhecimento de fala e um parâmetro relacionado para um dispositivo de processamento 20 de recursos de meios, e controlar o dispositivo de processamento de recursos de meios para realizar . o reconhecimento de fala; e
-um. dispositivo de processamento de recursos de meios, adaptado para receber a mensagem H.248 transportando a 25 instrução de reconhecimento de fala e parâmetro relacionado do dispositivo de controle de recursos de meios, realizar o reconhecimento de fala de acordo com o parâmetro, e realimentar um resultado de reconhecimento de fala para o dispositivo de controle de recursos de meios.
0 parâmetro relacionado inclui um parâmetro de gramática de reconhecimento de fala, e o dispositivo de processamento de recursos de meios extrai uma série de texto e realiza o reconhecimento de fala após receber o parâmetro de gramática de reconhecimento.
Quando uma gramática de reconhecimento para uma fala é pré-armazenada no dispositivo de processamento de recursos de τ°)
23/23 meios ou em um servidor externo, o parâmetro de gramática de reconhecimento é um ID e informação de localização de armazenamento de um arquivo de gramática de reconhecimento, e o dispositivo de processamento de recursos de meios lê e faz 5 cache do arquivo de gramática de acordo com a informação de localização de armazenamento e realiza o reconhecimento de fala de acordo com o arquivo de gramática que é lido.
dispositivo de processamento de recursos de meios inclui:
-uma unidade de reconhecimento de fala, adaptada para reconhecer uma fala e converter um sinal de fala em uma série de caracteres reconhecíveis por máquina.
A unidade de reconhecimento de fala é configurada no dispositivo de processamento de recursos de meios ou 15 configurada independentemente.
Pelas soluções da invenção, um aplicativo de serviço relacionado- ao reconhecimento de fala pode ser fornecido para um|usuário em um aplicativo de recursos de meios de rede fixa ou móvel. Por exemplo, pela substituição da tecla inserida 20 com a entrada de fala, um usuário pode efetuar funções básicas, tais como chamar e questionar por meio de uma fala.
Vantagens adicionais e modificações ocorrerão prontamente àqueles versados na técnica. Portanto, a invenção em seus aspectos mais amplos não é limitada aos detalhes 25 específicos e modalidades representativas mostradas e descritas na presente invenção. Consequentemente, várias modificações e variações podem ser feitas sem se afastar do escopo da invenção como é definido pelas reivindicações anexadas e seus equivalentes.

Claims (6)

  1. REIVINDICAÇÕES
    1. Método para reconhecer uma fala, compreendendo:
    - receber, por um dispositivo de processamento de recursos de meios, uma mensagem H.248 transportando, pela definição de um pacote ampliado de protocolo H.248, uma instrução de reconhecimento de fala e parâmetros relacionados enviados por um dispositivo de controle de recursos de meios (1 na Fig 3);
    - realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e o parâmetro relacionado (2 na Fig 3); e
    - relatar um resultado de reconhecimento para o dispositivo de controle de recursos de meios (5 na Fig 3) caracterizado pelo fato de que os parâmetros relacionados compreendendo um parâmetro adaptado para instruir se deve-se reconhecer uma frequência múltipla de sinal duplo, DTMF, e uma fala comum simultaneamente, e realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e com os parâmetros relacionados, compreendendo, adicionalmente:
    - realizar, pelo dispositivo de processamento de recursos de meios, simultaneamente, reconhecimento de DTMF e reconhecimento de fala se o parâmetro adaptado instruir se deve-se reconhecer um DTMF e uma fala comum simultaneamente é definido como Sim;
    - realizar, pelo dispositivo de processamento de recursos de meios, apenas o reconhecimento de fala se o parâmetro adaptado instruir se deve-se reconhecer um DTMF e uma fala comum simultaneamente é definido como Não.
  2. 2. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem, adicionalmente, um parâmetro adaptado para indicar uma duração de tempo do reconhecimento de fala e realizar, pelo dispositivo de processamento de recursos de
    Petição 870190027723, de 22/03/2019, pág. 28/42
    2/7 meios, o reconhecimento de fala de acordo com a instrução de reconhecimento de fala de acordo com a instrução de reconhecimento de fala e os parâmetros relacionados compreendem adicionalmente:
    determinar uma duração de tempo do reconhecimento de fala de acordo com o parâmetro adaptado para indicar a duração de tempo do reconhecimento de fala.
  3. 3. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem, adicionalmente, um parâmetro adaptado para indicar um tempo de espera e realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e os parâmetros relacionados compreendem adicionalmente:
    - determinar um tempo de espera do reconhecimento para um usuário inserir de acordo com o parâmetro usado adaptado para indicar o tempo de espera.
  4. 4. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem, adicionalmente, um parâmetro adaptado para indicar um tipo da linguagem a ser reconhecida e realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e os parâmetros relacionados compreendem adicionalmente:
    determinar um tipo da linguagem empregada durante o
    reconhecimento de fala comum de acordo com o parâmetro adaptado para indicar o tipo de uma linguagem a ser reconhecida. 5. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados
    compreendem, adicionalmente, um parâmetro adaptado para indicar uma precisão de reconhecimento e realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e os parâmetros relacionados
    Petição 870190027723, de 22/03/2019, pág. 29/42
    3/7 compreendem adicionalmente:
    - determinar uma precisão de reconhecimento necessária durante o reconhecimento de fala comum de acordo com o parâmetro adaptado para indicar a precisão de reconhecimento.
    6. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem, adicionalmente, um parâmetro adaptado para indicar uma sensibilidade de reconhecimento e realizar, pelo dispositivo de processamento de recursos de meios, reconhecimento de fala de acordo com a instrução de reconhecimento de fala e os parâmetros relacionados compreendem adicionalmente:
    determinar uma sensibilidade de reconhecimento necessária durante o reconhecimento de fala comum de acordo com o parâmetro adaptado para indicar a sensibilidade de reconhecimento.
    7. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem, adicionalmente, um parâmetro adaptado para indicar a localização de armazenamento de um registro; o método compreendendo adicionalmente:
    gravar e armazenar a entrada do usuário durante o reconhecimento de fala em uma localização designada de acordo com o parâmetro adaptado para indicar a localização do armazenamento do registro.
    8. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que os parâmetros relacionados compreendem adicionalmente um parâmetro adaptado para indicar
    - se faz pré-busca de um arquivo de gramática, e se o parâmetro que é adaptado para indicar se faz a pré-busca de um arquivo de gramática definido como Sim, o dispositivo de processamento de recursos de meios lê o arquivo de gramática de um servidor externo e faz cache do arquivo de gramática localmente quando a gramática de reconhecimento é armazenada em um modo de um arquivo; e/ou
    - um parâmetro adaptado para indicar um tempo de cache
    Petição 870190027723, de 22/03/2019, pág. 30/42
    4/7 para o arquivo de gramática e definir o tempo de cache para o arquivo de gramática lido de um servidor externo, e se a duração de um cache excede o tempo de cache que foi definido, o cache é inválido.
    9. Método, de acordo com qualquer uma das reivindicações de 1 a 8, durante o reconhecimento de fala realizado pelo dispositivo de processamento de recursos de meios, caracterizado por compreender:
    - detectar, pelo dispositivo de processamento de recursos de meios, um evento anormal compreendendo o tempo de espera para um usuário inserir tempo esgotado, um tempo esgotado de reconhecimento, um agrupamento errôneo entre uma entrada do usuário e gramática, o arquivo de gramática não existindo, o arquivo de gramática sendo lido como erro, uma entrada do usuário sendo incapaz de ser reconhecida, um erro de reconhecimento, e um erro de hardware/software do dispositivo de processamento de recursos de meios; e/ou
    - detectar, pelo dispositivo de processamento de recursos de meios, um evento de inserção de uma fala por um usuário e relatar um tipo de fala de uma entrada de fala detectado pelo usuário para o dispositivo de controle de recursos de meios, a fala compreendendo: uma frequência
    múltipla de sinal duplo, DTMF, e uma fala comum. 10. Método, de acordo com a reivindicação 9, caracterizado por compreender: - detectar, pelo dispositivo de processamento de
    recursos de meios, um processo de reconhecimento de fala de acordo com uma instrução do dispositivo de controle de recursos de meios, e realimentar um resultado de detecção para o dispositivo de controle de recursos de meios.
    11. Método, de acordo com a reivindicação 10, caracterizado por compreender: realimentar, pelo dispositivo de processamento de recursos de meios, um código de erro correspondente para o dispositivo de controle de recursos de meios quando detectar o evento anormal durante o reconhecimento de fala.
    Petição 870190027723, de 22/03/2019, pág. 31/42
  5. 5/7
    12. Dispositivo de processamento de recursos de meios, caracterizado por compreender:
    - uma unidade de obtenção de instrução (10), adaptada para obter uma mensagem H.248 realizando, pela definição de um pacote ampliado de protocolo H.248, parâmetros de controle relacionados e uma gramática de reconhecimento, em que os parâmetros relacionados compreendem um parâmetro adaptado para instruir se deve-se reconhecer uma frequência múltipla de sinal duplo, DTMF, e uma fala comum simultaneamente;
    - uma unidade de obtenção de fala (20), adaptada para obter um sinal de fala para ser reconhecido que é inserido por um usuário e enviar o sinal de fala para uma unidade de reconhecimento de fala, em que o dispositivo de processamento de recursos de meios é adaptado para realizar reconhecimento de DTMF e reconhecimento de fala simultaneamente se o parâmetro adaptado instruir se deve-se reconhecer simultaneamente um DTMF e uma fala comum é definido como Sim, e realizar apenas o reconhecimento de fala se o parâmetro adaptado instruir se deve-se reconhecer um DTMF e uma fala comum simultaneamente é definido como Não;
    - uma unidade de reconhecimento de fala (30), adaptada para converter o sinal de fala de entrada em uma série de caracteres reconhecíveis por máquina de acordo com a gramática de reconhecimento e os parâmetros de controle relacionados; e
    - uma unidade de transmissão (40), adaptada para enviar um resultado de processamento da unidade de reconhecimento de fala para um dispositivo de controle de meios.
    13. Dispositivo, de acordo com a reivindicação 12, caracterizado por compreender adicionalmente:
    - uma unidade de obtenção de arquivo (50), adaptada para obter um arquivo de gramática pré-armazenado externamente e enviar o arquivo de gramática para a unidade de reconhecimento de fala, na qual a unidade de reconhecimento de fala é adaptada para extrair a gramática de reconhecimento do arquivo de gramática recebido para processar o sinal de
    Petição 870190027723, de 22/03/2019, pág. 32/42
  6. 6/7 fala.
    14. Sistema para implementar função de reconhecimento de fala, caracterizado por compreender:
    - um dispositivo de controle de recursos de meios e um dispositivo de processamento de recursos de meios;
    no qual o dispositivo de controle de recursos de meios é adaptado para se comunicar com o dispositivo de processamento de recursos de meios;
    no qual o dispositivo de controle de recursos de meios é adaptado para enviar uma mensagem H.248 transportando, pela definição de um pacote ampliado de protocolo H.248, uma instrução de reconhecimento de fala e parâmetros relacionados ao dispositivo de processamento de recursos de meios, e controlar o dispositivo de processamento de recursos de meios para realizar um reconhecimento de fala, no qual os parâmetros relacionados compreendem um parâmetro adaptado para instruir se deve-se reconhecer uma frequência múltipla de sinal duplo, DTMF, e uma fala comum simultaneamente;
    no qual o dispositivo de processamento de recursos de meios é adaptado para receber a mensagem H.248 transportando a instrução de reconhecimento de fala e os parâmetros relacionados do dispositivo de controle de recursos de meios, realizar o reconhecimento de fala de acordo com os parâmetros relacionados, e realimentar um resultado de reconhecimento de fala para o dispositivo de controle de recursos de meios; e no qual o dispositivo de processamento de recursos de meios é adicionalmente adaptado para realizar, simultaneamente, reconhecimento de DTMF e reconhecimento de fala se o parâmetro adaptado para instruir se deve-se reconhecer um DTMF e uma fala comum simultaneamente é definido como Sim, e realizar apenas o reconhecimento de fala se o parâmetro adaptado para instruir se deve-se reconhecer um DTMF e uma fala comum simultaneamente é definido como Não.
    15. Sistema, de acordo com a reivindicação 14, caracterizado pelo fato de que os parâmetros relacionados compreendem adicionalmente um parâmetro adaptado para indicar
    Petição 870190027723, de 22/03/2019, pág. 33/42
    Ί/Ί a localização de armazenamento de um registro e o dispositivo de processamento de recursos de meios é adicionalmente adaptado para gravar e armazenar a entrada do usuário durante o reconhecimento de fala em uma localização designada de 5 acordo com o parâmetro adaptado para indicar a localização do armazenamento do registro.
BRPI0617624-0A 2005-10-21 2006-10-20 Método para reconhecer uma fala, dispositivo de processamento de recursos de meios, sistema para implementar função de reconhecimento de fala BRPI0617624B1 (pt)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
CN200510114276.3 2005-10-21
CNB2005101142763A CN100426377C (zh) 2005-10-21 2005-10-21 一种实现语音识别功能的方法
PCT/CN2006/002807 WO2007045188A1 (en) 2005-10-21 2006-10-20 A method, apparatus and system for accomplishing the function of speech recognition

Publications (2)

Publication Number Publication Date
BRPI0617624A2 BRPI0617624A2 (pt) 2013-01-01
BRPI0617624B1 true BRPI0617624B1 (pt) 2019-06-18

Family

ID=37962208

Family Applications (1)

Application Number Title Priority Date Filing Date
BRPI0617624-0A BRPI0617624B1 (pt) 2005-10-21 2006-10-20 Método para reconhecer uma fala, dispositivo de processamento de recursos de meios, sistema para implementar função de reconhecimento de fala

Country Status (7)

Country Link
US (1) US8417521B2 (pt)
EP (1) EP1950738B1 (pt)
CN (1) CN100426377C (pt)
AT (1) ATE470928T1 (pt)
BR (1) BRPI0617624B1 (pt)
DE (1) DE602006014857D1 (pt)
WO (1) WO2007045188A1 (pt)

Families Citing this family (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20100054445A1 (en) * 2008-08-28 2010-03-04 Peter Leis Method, apparatus and computer program product for providing routing of message signaling
US9190057B2 (en) * 2012-12-12 2015-11-17 Amazon Technologies, Inc. Speech model retrieval in distributed speech recognition systems
CN104517606A (zh) * 2013-09-30 2015-04-15 腾讯科技(深圳)有限公司 语音识别测试方法及装置
KR20150145024A (ko) * 2014-06-18 2015-12-29 한국전자통신연구원 화자적응 음성인식 시스템의 단말 및 서버와 그 운용 방법
CN106548772A (zh) * 2017-01-16 2017-03-29 上海智臻智能网络科技股份有限公司 语音识别测试系统及方法
CN107221329A (zh) * 2017-07-06 2017-09-29 上海思依暄机器人科技股份有限公司 一种对话控制方法、装置及机器人
CN111415684B (zh) * 2020-03-18 2023-12-22 歌尔微电子股份有限公司 语音模组的测试方法、装置及计算机可读存储介质
CN113838457B (zh) * 2020-06-24 2024-11-26 中兴通讯股份有限公司 语音交互的方法、电子设备及存储介质

Family Cites Families (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6532446B1 (en) * 1999-11-24 2003-03-11 Openwave Systems Inc. Server based speech recognition user interface for wireless devices
US6542867B1 (en) * 2000-03-28 2003-04-01 Matsushita Electric Industrial Co., Ltd. Speech duration processing method and apparatus for Chinese text-to-speech system
US7194071B2 (en) * 2000-12-28 2007-03-20 Intel Corporation Enhanced media gateway control protocol
US7068598B1 (en) * 2001-02-15 2006-06-27 Lucent Technologies Inc. IP packet access gateway
US7185094B2 (en) * 2001-03-30 2007-02-27 Sandcherry, Inc. Media session framework using a control module to direct and manage application and service servers
US20020184346A1 (en) * 2001-05-31 2002-12-05 Mani Babu V. Emergency notification and override service in a multimedia-capable network
EP1337097A1 (de) * 2002-02-19 2003-08-20 Siemens Aktiengesellschaft Effiziente Ausnutzung von für Vermittlungssysteme bereitgestellten IVR-Ressourcen
US7451207B2 (en) 2002-06-28 2008-11-11 Intel Corporation Predictive provisioning of media resources
US7318030B2 (en) * 2003-09-17 2008-01-08 Intel Corporation Method and apparatus to perform voice activity detection
US20050114118A1 (en) * 2003-11-24 2005-05-26 Jeff Peck Method and apparatus to reduce latency in an automated speech recognition system
CN1547190A (zh) * 2003-11-30 2004-11-17 中兴通讯股份有限公司 承载控制分离网络中语音通知包的构造和解析方法
US8027276B2 (en) * 2004-04-14 2011-09-27 Siemens Enterprise Communications, Inc. Mixed mode conferencing

Also Published As

Publication number Publication date
US20080228483A1 (en) 2008-09-18
US8417521B2 (en) 2013-04-09
EP1950738A4 (en) 2009-01-14
EP1950738B1 (en) 2010-06-09
EP1950738A1 (en) 2008-07-30
CN100426377C (zh) 2008-10-15
CN1953054A (zh) 2007-04-25
ATE470928T1 (de) 2010-06-15
BRPI0617624A2 (pt) 2013-01-01
DE602006014857D1 (de) 2010-07-22
WO2007045188A1 (en) 2007-04-26

Similar Documents

Publication Publication Date Title
US7995711B2 (en) Method and apparatus for voice mail notes
AU2020201997B2 (en) System and method for real-time transcription of an audio signal into texts
US8417521B2 (en) Method, device and system for implementing speech recognition function
CN111798833B (zh) 一种语音测试方法、装置、设备和存储介质
JP4256590B2 (ja) データ蓄積装置で使用する命令コードで駆動されるバッファ管理装置
JP6470306B2 (ja) 音声検証のための方法、装置、及びシステム
JPH09190396A (ja) コンピュータネットワーク上の位置決め方法及び装置
JP2017529711A5 (pt)
WO2011072552A1 (zh) 一种访问文件资源的方法及装置
RU2010101635A (ru) Способ и устройство для воспроизведения динамически изменяющихся аудио- и видеоменю
CN106803997A (zh) 一种音视频直播中检测客户端播放状态的系统及方法
CN104348905B (zh) 一种离线推送消息的方法及装置
CN107484010A (zh) 一种视频资源解码方法及装置
CN111308978B (zh) 一种通信方法及工业控制背板总线系统
CN100487788C (zh) 一种实现文语转换功能的方法
CN1953447A (zh) 媒体资源处理方法
CN100562925C (zh) 对限定范围的语音进行自动识别的方法
CN101146304B (zh) 基于业务处理流程的日志记录方法和装置
CN102137092A (zh) 支持多媒体子系统中的会议系统媒体抓包的方法及系统
CN116996632A (zh) 一种视频字幕生成方法、电子设备、存储介质
CN112422323B (zh) 一种日志处理的方法和装置
CN101222541A (zh) 一种实现语音识别功能的方法
CN103474073B (zh) 音频解码方法及音频解码装置
US11244697B2 (en) Artificial intelligence voice interaction method, computer program product, and near-end electronic device thereof
US20020188686A1 (en) System and method for accessing voice messaging system data

Legal Events

Date Code Title Description
B06G Technical and formal requirements: other requirements [chapter 6.7 patent gazette]

Free format text: SOLICITA-SE A REGULARIZACAO DA PROCURACAO, UMA VEZ QUE BASEADO NO ARTIGO 216 1O DA LPI, O DOCUMENTO DE PROCURACAO DEVE SER APRESENTADO NO ORIGINAL, TRASLADO OU FOTOCOPIA AUTENTICADA.

B15K Others concerning applications: alteration of classification

Ipc: H04L 29/06 (2006.01), G10L 15/30 (2013.01), G10L 1

B06T Formal requirements before examination [chapter 6.20 patent gazette]
B06F Objections, documents and/or translations needed after an examination request according [chapter 6.6 patent gazette]
B09A Decision: intention to grant [chapter 9.1 patent gazette]
B16A Patent or certificate of addition of invention granted [chapter 16.1 patent gazette]

Free format text: PRAZO DE VALIDADE: 10 (DEZ) ANOS CONTADOS A PARTIR DE 18/06/2019, OBSERVADAS AS CONDICOES LEGAIS. (CO) 10 (DEZ) ANOS CONTADOS A PARTIR DE 18/06/2019, OBSERVADAS AS CONDICOES LEGAIS