BRPI0922035A2 - SYSTEM AND METHOD FOR AUTOMATIC VOICE TO TEXT CONVERSION - Google Patents

SYSTEM AND METHOD FOR AUTOMATIC VOICE TO TEXT CONVERSION Download PDF

Info

Publication number
BRPI0922035A2
BRPI0922035A2 BRPI0922035-6A BRPI0922035A BRPI0922035A2 BR PI0922035 A2 BRPI0922035 A2 BR PI0922035A2 BR PI0922035 A BRPI0922035 A BR PI0922035A BR PI0922035 A2 BRPI0922035 A2 BR PI0922035A2
Authority
BR
Brazil
Prior art keywords
events
event
speech
voice
speech recognition
Prior art date
Application number
BRPI0922035-6A
Other languages
Portuguese (pt)
Inventor
Mark Pinson
David Pinson, Sr.
Mary FLANAGAN
Shahrokh Makanvand
Original Assignee
Scti Holdings, Inc.
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Scti Holdings, Inc. filed Critical Scti Holdings, Inc.
Publication of BRPI0922035A2 publication Critical patent/BRPI0922035A2/en
Publication of BRPI0922035B1 publication Critical patent/BRPI0922035B1/en

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/02Feature extraction for speech recognition; Selection of recognition unit
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/26Speech to text systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/16Speech classification or search using artificial neural networks
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • G10L15/32Multiple recognisers used in sequence or in parallel; Score combination systems therefor, e.g. voting systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Machine Translation (AREA)
  • Electrically Operated Instructional Devices (AREA)
  • Document Processing Apparatus (AREA)

Abstract

sistema e método para conversão auto mática de voz para texto. reconhecimento de voz é executado próximo a tempo real e aprimorando pela exploração de eventos e sequência de eventos, empregando técnicas de aprendizado de máquina que incluem classificadores, conjuntos, detectores e cascatas e usando grupos perceptivos. reconhecimento de voz também é aprimorado usando processamento em série.um pontuador automático injeta pontuação em sequências de texto reconhecidas.system and method for automatic speech-to-text conversion. Speech recognition is performed in near real-time and enhanced by event exploration and event sequencing, employing machine learning techniques that include classifiers, sets, detectors, and cascades, and using perceptual groups. Speech recognition is also enhanced using batch processing. An auto punctuation injects punctuation into recognized text strings.

Description

Relatório Descritivo da Patente de Invenção para "SISTEMA E MÉTODO PARA CONVERSÃO AUTOMÁTICA DE VOZ PARA TEXTO". Referência Cruzada Para Pedidos Relacionados ' Este pedido de patente reivindica o benefício do pedido de pa- - 5 tente Norte Americano de número serial 12/616.723, System and Method for Automatic Speech to Text Conversion, depositado em 11 de novembro de 2009, e do pedido de patente Norte Americano de número serial 61/113.910, Automated Speech Processors and Automated Punctuator, depositado em 12 de novembro de 2008, cujos conteúdos são integralmente incorporados neste documento através desta referência aos mesmos.Descriptive Report of the Patent of Invention for "SYSTEM AND METHOD FOR AUTOMATIC VOICE TO TEXT CONVERSION". Cross Reference to Related Applications This patent application claims the benefit of US patent application serial number 12/616,723, System and Method for Automatic Speech to Text Conversion, filed November 11, 2009, and the US patent application serial number 61/113,910, Automated Speech Processors and Automated Punctuator, filed November 12, 2008, the contents of which are fully incorporated herein by this reference thereto.

Antecedentes da Técnica Campo da Técnica A presente invenção refere-se em geral a reconhecimento de Lt voz automático.Background Art Field of the Art The present invention relates generally to automatic Lt speech recognition.

Mais especificamente, a invenção refere-se a técnicas para “% 15 melhorar o reconhecimento automático de voz através do uso de aspectos 7 mais robustos e relevantes do sinal de voz, que incluem informação temporal e padrões derivados de agrupamentos perceptivos e processamento desta informação com o uso de técnicas de aprendizado de máquina.More specifically, the invention relates to techniques for "%15 improving automatic speech recognition through the use of more robust and relevant aspects of the speech signal, which include temporal information and patterns derived from perceptual clusters and processing this information with the use of machine learning techniques.

Descrição da Técnica Relacionada Informação de percepção de voz é distribuída de maneira não uniforme na frequência, amplitude e tempo.Description of the Related Art Speech perception information is non-uniformly distributed in frequency, amplitude, and time.

Em todos os aspectos, a voz é altamente variável.In all respects, the voice is highly variable.

A maior parte dos sistemas de reconhecimento de voz automáticos extrai informação em intervalos espaçados unifor- memente em uma única escala.Most automated speech recognition systems extract information at evenly spaced intervals on a single scale.

Na percepção de voz humana, algumas classes de voz são conhecidas ser distinguidas pela recorrência a caracte- rísticas temporais, mas nos sistemas de reconhecimento de voz típicos do estado da técnica os aspectos temporais da voz não são completamente explorados.In human voice perception, some voice classes are known to be distinguished by the recurrence to temporal features, but in typical state-of-the-art speech recognition systems the temporal aspects of voice are not fully explored.

A maior parte dos sistemas de reconhecimento de voz automáti- cos do estado da técnica inclui um processo que extrai informação do sinal de voz em escalas de tempo uniformes (tipicamente 10 a 15 milissegundos) usando quadros de análise de duração curta uniforme (tipicamente 20 a 30 milissegundos). A classificação da voz baseada em um único vetor de observação de curto prazo não é confiável porque o sinal de voz é altamente : dinâmico e constantemente em transição uma vez que vários sons de voz são produzidos. Na verdade, padrões de maior prazo têm que ser emprega- - 5 dosparacriar sistemas utilizáveis.Most prior art automatic speech recognition systems include a process that extracts information from the speech signal at uniform time scales (typically 10 to 15 milliseconds) using analysis frames of uniform short duration (typically 20 to 15 milliseconds). 30 milliseconds). Voice classification based on a single short-term observation vector is unreliable because the voice signal is highly dynamic and constantly in transition as multiple voice sounds are produced. In fact, longer-term standards have to be used to create usable systems.

' Um método conhecido na técnica, que torna padrões de maior prazo disponíveis é reter uma memória de uma quantidade de vetores de ob- servação de curto prazo que em seguida são apresentados simultaneamente para um classificador de voz. Os classificadores usados com esta abordagem são frequentemente redes neurais artificiais ou padrões de correlação. Embo- ra reter uma memória de vetores de observação de curto prazo traga resulta- dos melhorados, existem diversos problemas remanescentes.' A method known in the art that makes longer-term patterns available is to retain a memory of a number of short-term observation vectors which are then presented simultaneously to a voice classifier. The classifiers used with this approach are often artificial neural networks or correlation patterns. While retaining a memory of short-term observation vectors brings improved results, there are several remaining problems.

Primeiro, a amostragem de escala de tempo uniforme, comum a s todos os métodos baseados em quadro, não é síncrona com o sinal de voz.First, uniform timescale sampling, common to all frame-based methods, is not synchronous with the speech signal.

x 15 Portanto o relacionamento de eventos da voz e quadros de observação é ; randômico. Isto resulta em variabilidade aumentada das características ex- traídas e uma quantização de detalhes temporais.x 15 So the relationship of voice events and observation frames is ; random. This results in increased variability of the extracted features and a quantization of temporal details.

A seguir, a extração baseada em quadros de análise uniformes não é ótima. A informação usada para percepção humana dos sons da voz ocorreem muitas escalas de tempo diferentes. Por exemplo, o irromper ex- plosivo de um som de "t" falado pode ser tão pequeno quanto uns poucos milissegundos de duração enquanto que uma vogal pode ser sustentada por mais do que um segundo. Uma sequência de muitas observações de curto prazo não apresenta a mesma informação que uma informação de longo prazoe vice-versa.Next, extraction based on uniform analysis frames is not optimal. The information used for human perception of voice sounds occurs on many different time scales. For example, the burst of a spoken "t" sound can be as short as a few milliseconds in duration whereas a vowel can be sustained for more than a second. A sequence of many short-term observations does not present the same information as long-term information, and vice versa.

Alguns aspectos da voz são altamente variáveis na dimensão temporal. Por exemplo, a extensão que uma vogal é sustentada depende do orador, da taxa de voz, de se a vogal está em uma sílaba acentuada ou não, de onde na sentença se encontra a palavra que contém a sílaba. Esta varia- bilidade temporal faz com que a informação de voz se mova para diferentes quadros de observação relativa, aumentando significativamente a variabili- dade dos valores extraídos para diferentes exemplos da mesma classe de voz e tornando difícil a detecção de padrões com significado na memória.Some aspects of the voice are highly variable in the temporal dimension. For example, the extent to which a vowel is sustained depends on the speaker, the rate of voice, whether the vowel is in an accented syllable or not, where in the sentence the word containing the syllable is found. This temporal variability causes voice information to move to different frames of relative observation, significantly increasing the variability of values extracted for different examples of the same voice class and making it difficult to detect meaningful patterns in memory.

Adicionalmente, sistemas baseados em quadro tratam tipica- : mente todos os quadros com importância igual.Additionally, frame-based systems typically treat all frames with equal importance.

Ao contrário, a percepção humana usa as partes do sinal que têm a melhora relação sinal para ruído e - 5 que contém as características mais relevantes e confiáveis para fazer as distinções exigidas.On the contrary, human perception uses the parts of the signal that have the best signal-to-noise ratio and -5 that contain the most relevant and reliable features to make the required distinctions.

A maior parte dos sistemas de reconhecimento de voz automáti- cos do estado da técnica incorpora Modelos Markov Ocultos.Most state-of-the-art automatic speech recognition systems incorporate Hidden Markov Models.

Os Modelos Markov Ocultos são máquinas de estado estocásticas.Hidden Markov Models are stochastic state machines.

Os Modelos Markov Ocultos mapeiam probabilidades estimadas de classe dos vetores de obser- vação em sequências prováveis de produções de classe ocultas (não obser- vadas). Usando os Modelos Markov Ocultos, o problema de variabilidade temporal mencionado acima é tratado permitindo que cada estado de não e- missão mude para ele próprio.Hidden Markov Models map estimated class probabilities of observation vectors into likely sequences of hidden (unobserved) class productions. Using the Hidden Markov Models, the temporal variability problem mentioned above is addressed by allowing each non-emission state to change to itself.

Usando estados de autotransição a variabilida- + 15 detemporalé "absorvida". Infelizmente, a menos que a abordagem seja modi- ]; ficada para extrair explicitamente a informação de duração, a abordagem re- move informação temporal tanto não desejada como desejada.Using autotransition states the + 15 time-variability is "absorbed". Unfortunately, unless the approach is modified ]; set to explicitly extract duration information, the approach removes both unwanted and desired temporal information.

Os relaciona- mentos temporais dos eventos de voz trazem informação significativa para percepção dos sons de voz particularmente na discriminação de oclusivas, fricativas e africadas.The temporal relationships of voice events bring significant information to the perception of voice sounds, particularly in the discrimination of stops, fricatives and affricates.

Além disso, a estimativa robusta de probabilidades de classe requer grandes quantidades de dados de treinamento.Furthermore, robust estimation of class probabilities requires large amounts of training data.

Quando as con- dições de uso diferem das condições de treinamento, as estimativas de pro- babilidade se tornam muito imprecisas levando a reconhecimento inferior.When usage conditions differ from training conditions, probability estimates become very inaccurate leading to inferior recognition.

As características usadas pela maior parte dos sistemas de re- conhecimento de voz automáticos do estado da técnica são primariamente derivadas a partir de perfis espectrais de curto prazo.The characteristics used by most state-of-the-art automatic speech recognition systems are primarily derived from short-term spectral profiles.

Esta abordagem é u- sada frequentemente porque muitos sons de voz têm alguns picos de fre- quência característicos chamados formantes.This approach is often used because many voice sounds have some characteristic frequency spikes called formants.

Uma abordagem muito diferen- te empregada por outros sistemas atuais é focar em trajetórias de longo pra- zodas bandas de frequência.A very different approach employed by other current systems is to focus on long-term trajectories of frequency bands.

Em um método chamado TRAPs (Padrões Temporais) sons de voz são modelados como as trajetórias médias de longo prazo (-1 s) de exemplos de sons.In a method called TRAPs (Temporal Patterns) voice sounds are modeled as the long-term average trajectories (-1 s) of sample sounds.

A classificação é executada baseada na correlação dos pacotes de sinal de voz com cada um dos modelos TRAP.Classification is performed based on the correlation of the voice signal packets with each of the TRAP models.

Algumas versões desta abordagem têm resultados reportados comparáveis : aos métodos espectrais de curto prazo. Estes resultados mostram que in- formação útil para identificar os sons de voz está espalhada pelo tempo além - 5 dos limites dos segmentos do fonema. Devido à média e janela usadas no método, informação próxima ao centro do TRAP é enfatizada sobre informa- ção mais distante. OSTRAPs capturam tendências brutas mas não capturam detalhes temporais.Some versions of this approach have reported results comparable to short-term spectral methods. These results show that information useful for identifying voice sounds is spread over time beyond -5 the boundaries of the phoneme segments. Due to the average and window used in the method, information near the center of the TRAP is emphasized over information further away. OSTRAPs capture raw trends but do not capture temporal details.

Ainda outra abordagem alternativa a extração de característica baseada em quadro é segmentar a voz na localização de certas condições de sinal detectáveis chamadas "eventos". É considerado que cada parte de segmento tem uma única identidade de classe. Usualmente o alinhamento temporal com um modelo é executado pela deflexão dinâmica do tempo, que “% permite que sejam projetadas as trajetórias das características dentro de uma escala de tempo comum. Então, na escala de tempo defletida a trajetó- F ria da característica é reamostrada e correlacionada com um padrão ou usa- da como observação para um Modelo Markov Oculto. O processo de defle- xão dinâmica do tempo remove muito da variabilidade do tempo dos seg- mentos de voz. Entretanto, descobrir eventos de segmentação confiáveis apresenta um desafio para métodos baseados em eventos. Inserções e de- leções de eventos resultam em desalinhamentos catastróficos.Yet another alternative approach to frame-based feature extraction is to segment the voice at the location of certain detectable signal conditions called "events". It is assumed that each segment part has a unique class identity. Usually time alignment with a model is performed by dynamic time deflection, which “% allows the trajectories of features to be projected within a common time scale. Then, on the deflected time scale the trajectory of the feature is resampled and correlated with a pattern or used as an observation for a Hidden Markov Model. The dynamic time deflection process removes much of the time variability from the voice segments. However, discovering reliable threading events presents a challenge for event-based methods. Insertions and deletions of events result in catastrophic misalignments.

Claramente existe uma necessidade na área por técnicas melho- radas para aumentar a eficiência e efetividade de reconhecimento de voz automático.Clearly there is a need in the field for improved techniques to increase the efficiency and effectiveness of automatic speech recognition.

A percepção humana da voz se baseia, em parte significativa, na temporização relativa dos eventos no sinal de voz. Os indicadores para a percepção da voz ocorrem sobre várias escalas de tempo e podem ser des- locadas no tempo a partir da própria percepção. Mudar os relacionamentos temporais de eventos de voz pode mudar a percepção da voz. Isto é de- —monstrado em B. Repp, e outros, Perceptual Integration of Acoustic Cues for Stop, Fricative, and Affricative Manner, Journal of Experimental Psychology: Human Perception and performance 1978, Vol. 4, Num. 4, 621-637, através de experimentos perceptivos onde as durações do silêncio e fricção foram manipuladas. Um destes experimentos introduziu um pequeno intervalo de : silêncio entre as palavras "Say" "Shop", que faz com que os ouvintes ouçam "Say Chop". Outro exemplo de como a temporização relativa de eventos influ- 7 5 enciaapercepção é referenciada como tempo de começo de voz, comumente abreviado VOT. VOT é a extensão de tempo que passa de quando uma para- da é liberada até quando a vibração das cordas vocais começa. VOT é um importante indicador na distinção de várias consoantes de parada. A impor- tância da temporização também deriva da variabilidade da duração de fenô- menos de voz. Alguns fenômenos de voz perceptíveis são muito breves en- quanto que outros são bastante longos. Por exemplo, o corpus de escritos TIMIT de vozes em Inglês transcritas fonemicamente tem segmentos de inter- rupção de rajada com durações de menos do que 5 milissegundos, enquanto " alguns segmentos de vogais duram mais do que 500 milissegundos. Embora temporizações relativas de eventos sejam indicadores É importantes para a percepção, os métodos mais comuns de extração de ca- racterísticas não são sensíveis à temporização de eventos de voz. Quase todas as aplicações de reconhecimento de voz e orador atuais extraem ca- racterísticas através da utilização de uma abordagem de segmentação de sinal baseada em quadros de análise de extensão fixa escalonado à frente em tempo por uma dimensão de escala fixa. Devido a estes quadros de aná- lise terem tamanho fixo, os mesmos são quase sempre significativamente menores ou significativamente mais longos do que as extensões dos fenô- menos perceptivos que eles tentam capturar.The human perception of voice is based, in significant part, on the relative timing of events in the voice signal. The indicators for voice perception occur over several time scales and can be shifted in time from the perception itself. Changing the temporal relationships of voice events can change the perception of voice. This is demonstrated in B. Repp, et al., Perceptual Integration of Acoustic Cues for Stop, Fricative, and Affricative Manner, Journal of Experimental Psychology: Human Perception and performance 1978, Vol. 4, Num. 4, 621-637 , through perceptual experiments where the durations of silence and friction were manipulated. One such experiment introduced a small gap of silence between the words "Say" "Shop", which causes listeners to hear "Say Chop". Another example of how the relative timing of events influences perception is referred to as voice onset time, commonly abbreviated VOT. VOT is the length of time that passes from when a stop is released to when vocal cord vibration begins. VOT is an important indicator in distinguishing various stop consonants. The importance of timing also derives from the variability in the duration of voice phenomena. Some perceptible voice phenomena are very brief while others are quite long. For example, the TIMIT writing corpus of phonemically transcribed English voices has burst interrupt segments lasting less than 5 milliseconds, while "some vowel segments last longer than 500 milliseconds. Although relative timings of events are indicators It is important for perception, the most common feature extraction methods are not sensitive to the timing of speech events Almost all speech recognition and speaker applications today extract features using a segmentation approach signal based on fixed-length analysis frames scaled ahead in time by a fixed-scale dimension. Because these analysis frames are fixed in size, they are almost always significantly smaller or significantly longer than the extents of the perceptual phenomena that they try to capture.

Embora fácil de implementar, a abordagem comum torna a ex- tração de características sujeita ao relacionamento entre o sinal e o ponto de início do primeiro quadro e ao relacionamento arbitrário entre a dimensão do quadro de análise e a escala de tempo de vários fenômenos de voz. Um sis- tema de reconhecimento de voz baseado em quadro descrito em S. Basu, e outros, Time shift invariant speech recognition, ICSLP98, é baseado em quadros de vinte e cinco milissegundos escalonados por dez milissegundos, deslocamentos no relacionamento inicial do sinal e do primeiro quadro de menos do que dez milissegundos provocaram "modificações significativas F das estimativas espectrais e [coeficientes cepstrais de frequência-mel] pro- : duzidos pelo adiantamento que por sua vez resulta em variações de até [dez porcento] de taxa de erro de palavras no mesmo banco de dados”.Although easy to implement, the common approach makes feature extraction subject to the relationship between the signal and the start point of the first frame and to the arbitrary relationship between the analysis frame size and the time scale of various voice phenomena. . A frame-based speech recognition system described in S. Basu, et al., Time shift invariant speech recognition, ICSLP98, is based on twenty-five millisecond frames staggered by ten milliseconds, shifts in the initial signal and signal relationship. first frame of less than ten milliseconds caused "significant modifications F of the spectral estimates and [cepstral frequency-honey coefficients] produced by the advance which in turn results in variations of up to [ten percent] in the word error rate in the same database”.

“5 Existem muitas fontes de variação nos sinais de voz: tais como a extensão do trato vocal do orador, acentuação, velocidade da voz, saúde e estado emocional, bem como ruído de fundo, etc. Entretanto, a variação re- portada por Basu e outros é inteiramente devida ao uso de um método de extração de característica no qual a dimensão do quadro e o alinhamento do quadro têm relacionamentos arbitrários com o sinal. A Patente Norte Ameri- . cana de Número U.S. 5.956.671 (depositada em 4 de junho de 1997) para Ittycheriah e outros, descreveu técnicas voltadas para reduzir variabilidade de características provocadas pelo relacionamento arbitrário entre quadros - de análise e sinal de voz. Um aspecto de sua invenção expande a variabili- dade do conjunto de treinamento sujeitando múltiplas versões do sinal des- É locadas no tempo a processo de análise de quadro fixo como exemplos de treinamento separados. Eles também descrevem uma técnica usada no tempo de reconhecimento onde os valores de características são computa- dos pela ponderação dos resultados de análise de quadro fixo a múltiplas versões atrasadas do sinal.“5 There are many sources of variation in voice signals: such as the length of the speaker's vocal tract, accentuation, voice speed, health and emotional state, as well as background noise, etc. However, the variation reported by Basu and others is entirely due to the use of a feature extraction method in which frame size and frame alignment have arbitrary relationships with the signal. The North American Patent. cane of U.S. Number 5,956,671 (deposited June 4, 1997) to Ittycheriah et al., described techniques aimed at reducing variability of characteristics brought about by the arbitrary relationship between analysis frames and speech signal. One aspect of his invention expands the variability of the training set by subjecting multiple time-shifted versions of the signal to a fixed-frame analysis process as separate training examples. They also describe a technique used in recognition time where feature values are computed by weighting the results of fixed frame analysis to multiple delayed versions of the signal.

Estas técnicas não mitigam completamente os problemas provo- cados pela extração de características usando quadros fixos e escalas de tempo fixas. Além disso, expandir a quantidade de exemplos aumenta o tempo de treinamento e incorpora variabilidade adicional no modelo que não está presente no sinal de voz original. Ponderações deslocadas no tempo aumentam a complexidade e podem "ponderar para fora" algumas caracte- rísticas de voz relevantes perceptivamente.These techniques do not completely mitigate the problems caused by extracting features using fixed frames and fixed time scales. Furthermore, expanding the number of examples increases training time and incorporates additional variability in the model that is not present in the original speech signal. Time-shifted weightings add to the complexity and may "weight out" some perceptually relevant voice features.

Na Patente Norte Americana de Número U.S. 6.470.311 (deposi- tada em 15 de outubro de 1999), para Moncur, um método de segmentação síncrona de afastamento de voz sonora baseado nos cruzamentos zero posi- tivos da saída de um filtro passa banda com uma frequência central aproxi- madamente igual ao afastamento endereça parcialmente a sincronização. Voz não sonora é segmentada com o uso do período médio do afastamento com- putado sobre algum quadro de tempo não especificado.In U.S. Patent Number US 6,470,311 (filed October 15, 1999), for Moncur, a method of synchronous segmentation of voice pitch based on the positive zero crossings of the output of a bandpass filter with a center frequency approximately equal to the offset partially addresses the synchronization. Non-voice voice is segmented using the average distance period computed over some unspecified time frame.

Deve ser observado : que condições de baixo sinal para ruído e sinais com pequenos deslocamen- tos de sinal DC são conhecidos por causarem problemas para segmentação 7 5 baseada em cruzamento de zero.It should be noted that low signal-to-noise conditions and signals with small DC signal shifts are known to cause problems for zero-crossing based segmentation.

Para sinais de voz de alta qualidade, a a- bordagem de Moncur representa uma melhoria sobre os métodos de análise de quadros fixos comuns durante a voz sonora.For high-quality speech signals, the Moncur approach represents an improvement over common still-frame analysis methods during voiced speech.

Infelizmente para voz não so- nora a abordagem reverte para intervalos de tempo e quadros fixos arbitrários.Unfortunately for voiceless voice the approach reverts to arbitrary time intervals and fixed frames.

O uso de quadros e intervalos de tempo fixos ainda mantém a localização precisa de eventos tais como fechamento e interrupção de rajadas não resol- vidas.The use of fixed frames and time intervals still maintains the precise location of events such as closing and stopping unresolved bursts.

Além disso, nenhuma solução é fornecida para voz sussurrada.Also, no solution is provided for whispered voice.

Claramente é necessária uma solução que extraia característi- cas sincronamente com os eventos do próprio sinal de voz em vez de atra- - vés de quadros uniformes fixos que têm relacionamentos arbitrários e mutá- veiscom os fenômenos de voz.Clearly, a solution is needed that extracts features synchronously with the events of the speech signal itself rather than through fixed uniform frames that have arbitrary and changing relationships with speech phenomena.

A técnica de segmentação deve ser aplicada 3 ao sinal inteiro tanto para voz sonora quanto não sonora.The segmentation technique must be applied 3 to the entire signal for both voiced and non-voiced voices.

Adicionalmente, a análise de voz deve ser executada sobre escalas de tempo apropriadas para cada um dos tipos de eventos particulares que são detectados.Additionally, voice analysis must be performed over appropriate timescales for each of the particular event types that are detected.

O mecanismo de reconhecimento de voz automático típico atual espera por um silêncio detectado para analisar e produzir saída porque isto permite uma segmentação natural e, portanto resulta em maior precisão de- vido ao contexto aumentado.Current typical automatic speech recognition engine waits for a detected silence to analyze and produce output because this allows for natural segmentation and therefore results in higher accuracy due to increased context.

Esperar até o fim de uma voz pode fazer com que a saída seja atrasada em algo entre cinco a vinte e cinco segundos.Waiting until the end of a voice can cause the output to be delayed by anywhere from five to twenty-five seconds.

Quando uma aplicação tem que produzir uma saída em tempo próximo a real, como é exigido por aplicações tais como produção automática de le- gendas (closed caption) em difusão de televisão, a segmentação menor de- ve reduzir o contexto disponível para análise, e é esperada e produzida me- nor precisão.When an application has to produce near-real-time output, as is required by applications such as closed captioning in broadcast television, smaller segmentation must reduce the context available for analysis, and less accuracy is expected and produced.

Para estes tipos de aplicações, o que é necessário é alta pre- cisão com baixa latência.For these types of applications, what is needed is high accuracy with low latency.

Sumáriodalnvenção Algumas modalidades da invenção referem-se à aprendizagem automática de detectores e classificadores para reconhecimento de voz.Summary of the invention Some embodiments of the invention relate to automatic learning of detectors and classifiers for speech recognition.

Mais particularmente, esta invenção é dirigida para a aprendizagem automá- tica de detectores e classificadores que se concentram nos aspectos mais : relevantes e robustos do sinal de voz para as tarefas particulares de detec- ção ou classificação em questão.More particularly, this invention is directed to the machine learning of detectors and classifiers that focus on the most relevant and robust aspects of the speech signal for the particular detection or classification tasks in question.

a) Algumas modalidades da invenção envolvem extração de picos ou eventos de sinal de voz que indiquem aspectos notáveis do sinal. Estas modalidades também envolvem capturar os relacionamentos temporais entre os eventos. Nas modalidades preferenciais, um esquema de classificadores ponderados é usado para extrair eventos. Algumas modalidades da invenção envolvem construir o esquema de classificadores ponderados para uso em mecanismo de reconhecimento de voz automático. Algumas modalidades da invenção envolvem detectar sequências de eventos em vez de, ou adicional- mente a, detectar eventos individuais. Em algumas modalidades da invenção, - detectores baseados em indicadores alternativos são desenvolvidos. Em algumas modalidades da invenção, algoritmos de reforço É adaptativo são usados para aumentar o desempenho do reconhecimento. Algumas modalidades da invenção incluem um processo para reduzir a complexidade de conjuntos criados por algoritmos de reforço adaptativos. Em algumas modalidades da invenção, um método para criar automaticamente cascatas de detectores baseados em evento supera os problemas de aprendizado de conjuntos de treinamento altamente desbalan- ceados ou aprendizagem para detectar objetos raros. A cascata de detecto- res resultante proporciona detecção eficiente de objetos raros pela elimina- ção da maior parte de exemplos negativos nos estágios iniciais.a) Some embodiments of the invention involve extracting peaks or events from the voice signal that indicate notable aspects of the signal. These modalities also involve capturing the temporal relationships between events. In preferred embodiments, a weighted classifier scheme is used to extract events. Some embodiments of the invention involve building the weighted classifier scheme for use in an automatic speech recognition engine. Some embodiments of the invention involve detecting sequences of events instead of, or in addition to, detecting individual events. In some embodiments of the invention, detectors based on alternative indicators are developed. In some embodiments of the invention, IS adaptive reinforcement algorithms are used to increase recognition performance. Some embodiments of the invention include a process for reducing the complexity of sets created by adaptive reinforcement algorithms. In some embodiments of the invention, a method for automatically creating event-based detector cascades overcomes the problems of learning highly unbalanced training sets or learning to detect rare objects. The resulting cascade of detectors provides efficient detection of rare objects by eliminating most negative examples in the early stages.

Em algumas modalidades da invenção, um processo de classifi- car voz em grupos perceptivos é executado. O processo então remove am- biguidades entre percepções alternativas.In some embodiments of the invention, a process of classifying voice into perceptual groups is performed. The process then removes ambiguities between alternative perceptions.

Algumas modalidades da invenção envolvem segmentar um si- nal de voz em localizações importantes perceptivamente. Isto fornece um meio para não apenas extrair temporizações importantes perceptivamente, mas também sincronizar a análise do sinal com eventos de voz, deste modo evitando todos os problemas de análise de quadro fixo assíncrono. O méto-Some embodiments of the invention involve segmenting a speech signal at perceptually important locations. This provides a means to not only extract perceptually important timings, but also to synchronize the signal analysis with speech events, thus avoiding all the problems of asynchronous fixed frame analysis. The method-

do primeiro executa uma pré-segmentação com o uso de filtros de baixa complexidade baseados em certos aspectos da percepção humana e nos : fenômenos de voz que os mesmos são projetados para detectar.The first one performs a pre-segmentation using low-complexity filters based on certain aspects of human perception and on the voice phenomena that they are designed to detect.

Estes filtros detectam as localizações de padrões perceptíveis que indicam começo, tér- 7 5 mino,rajadas, pulsos glotais, e outros eventos de sinal de voz significativos.These filters detect the locations of perceptible patterns that indicate start, end, bursts, glottal pulses, and other significant speech signal events.

Os eventos de pré-segmentação definem intervalos que são usados para sincronizar certas computações de características.Pre-segmentation events define intervals that are used to synchronize certain feature computations.

Os padrões de caracte- rísticas que têm sido extraídos sincronamente são processados adicional- mente para criar características sobre escalas de tempo mais longas e para detectar eventos perceptivos de nível ainda mais alto tais como fronteiras de fonema, núcleos de sílabas, etc.The feature patterns that have been extracted synchronously are further processed to create features over longer time scales and to detect even higher level perceptual events such as phoneme boundaries, syllable heads, etc.

Preferencialmente, um sistema de reconhecimento de voz de al- to nível usa todas estas técnicas.Preferably, a high-level speech recognition system uses all of these techniques.

Em algumas modalidades da invenção, é - usada uma pluralidade de métodos em um sistema para reconhecimento de voz automático.In some embodiments of the invention, a plurality of methods are used in a system for automatic speech recognition.

O sistema recebe uma entrada de voz, aplica um ou mais dos ]; meios de processamento a entrada de voz, decide qual meio de processa- mento é mais correto, e fornece uma sequência de texto resultante.The system receives a voice input, applies one or more of the ]; processing means the voice input, decides which processing means is most correct, and provides a resulting text string.

Nas mo- dalidades atualmente preferenciais da invenção, o sistema de reconhecimento de voz automático é usado em criação de legendas (closed captioning) de televisão em tempo real e ambientes de detecção de palavra.In the presently preferred embodiments of the invention, the automatic voice recognition system is used in real-time television closed captioning and word detection environments.

Outras modali- dades podem incluir virtualmente qualquer forma de transcrição de voz, que incluem legendagem ou transcrição de encontros ou conferência telefônica, ditado em tempo real ou conversão oral de mensagens telefônicas para a forma escrita.Other modalities may include virtually any form of voice transcription, which include subtitling or transcription of meetings or conference calls, real-time dictation, or oral conversion of telephone messages to written form.

Algumas modalidades da invenção envolvem processar sinais devozcomo uso de n-séries paralelas de mecanismos de reconhecimento de voz automáticos em modo de rajada sobreposta temporariamente para reduzir a latência.Some embodiments of the invention involve processing speech signals using parallel n-series of automatic speech recognition engines in burst burst mode temporarily to reduce latency.

Algumas modalidades da invenção envolvem inserção automática de sinais de pontuação em um texto não pontuado.Some embodiments of the invention involve automatic insertion of punctuation marks in unpunctuated text.

Breve Descrição das Figuras A figura 1 ilustra um exemplo de um fluxo de trabalho para cons- trução de um esquema de classificadores ponderados para uso em um mó- dulo de processamento de um mecanismo de reconhecimento de voz auto-Brief Description of the Figures Figure 1 illustrates an example of a workflow for building a weighted classifier scheme for use in a processing module of an automatic speech recognition engine.

mático de acordo com algumas modalidades da invenção; a figura 2 ilustra um fluxo de trabalho para identificar automati- BR camente regiões em uma pluralidade de sinais de voz que contém eventos de acordo com algumas modalidades da invenção; Ns) a figura 3A ilustra os relacionamentos de tempo de eventos de acordo com algumas modalidades da invenção;matic according to some embodiments of the invention; Figure 2 illustrates a workflow for automatically identifying regions in a plurality of speech signals that contain events in accordance with some embodiments of the invention; ns) figure 3A illustrates the time relationships of events according to some embodiments of the invention;

a figura 3B ilustra a contagem de eventos que ocorrem dentro das unidades da grade de tempo de acordo com algumas modalidades da invenção;Figure 3B illustrates counting events that occur within time grid units in accordance with some embodiments of the invention;

a figura 3C ilustra a estrutura de um mapa de soma baseado em eventos de acordo com algumas modalidades da invenção;Figure 3C illustrates the structure of an event-based sum map according to some embodiments of the invention;

a figura 4 ilustra um fluxo de trabalho 400 para criar uma cascata de detectores de acordo com algumas modalidades da invenção;Figure 4 illustrates a workflow 400 for creating a cascade of detectors in accordance with some embodiments of the invention;

- " a figura 5 ilustra um exemplo de uma região que contém eventos de todos os exemplos positivos de acordo com algumas modalidades da in--" Figure 5 illustrates an example of a region that contains events from all positive examples according to some modalities of the in-

: venção;: vention;

a figura 6A ilustra outro exemplo de uma região no espaço de característica de tempo que contém eventos de todos os exemplos positivos de acordo com algumas modalidades da invenção;Figure 6A illustrates another example of a region in time feature space that contains events from all positive examples in accordance with some embodiments of the invention;

a figura 6B ilustra uma região não alinhada que contém eventos de todos os exemplos positivos de acordo com algumas modalidades da invenção;Figure 6B illustrates a non-aligned region containing events from all positive examples in accordance with some embodiments of the invention;

a figura 6C ilustra um exemplo de uma região não retangular que contém eventos de todos os exemplos positivos de acordo com algumas modalidades da invenção;Figure 6C illustrates an example of a non-rectangular region that contains events from all positive examples according to some embodiments of the invention;

a figura 7 ilustra o relacionamento da fronteira geométrica má- xima para as fronteiras mais apertadas e mais folgadas em uma projeção de uma região de acordo com algumas modalidades da invenção;Figure 7 illustrates the relationship of the maximum geometric boundary to the tightest and loosest boundaries in a projection of a region according to some embodiments of the invention;

a figura 8A ilustra uma representação de um sistema automático devoz para texto de acordo com algumas modalidades da invenção;Figure 8A illustrates a representation of an automatic speech-to-text system according to some embodiments of the invention;

a figura 8B ilustra uma representação de um sistema automático de voz para texto de acordo com algumas modalidades da invenção;Figure 8B illustrates a representation of an automatic speech-to-text system according to some embodiments of the invention;

a figura 8C ilustra uma representação de um sistema para reco- nhecimento de evento e detecção de palavras de acordo com algumas mo- ' dalidades da invenção; a figura 9 ilustra um exemplo de segmentações de um sinal de 7 5 vozde acordo com algumas modalidades da invenção;Figure 8C illustrates a representation of a system for event recognition and word detection according to some embodiments of the invention; Figure 9 illustrates an example of segmentations of a voice signal according to some embodiments of the invention;

a figura 10 ilustra uma fórmula de contraste perceptivo usada pa- ra computar mudança perceptiva de acordo com algumas modalidades da invenção;Figure 10 illustrates a perceptual contrast formula used to compute perceptual change in accordance with some embodiments of the invention;

a figura 11A ilustra uma memória de fila circular de acordo com algumas modalidades da invenção;Figure 11A illustrates a circular row memory in accordance with some embodiments of the invention;

a figura 11B ilustra uma memória de fila circular atualizada de acordo com algumas modalidades da invenção;Figure 11B illustrates an updated circular row memory in accordance with some embodiments of the invention;

a figura 11C ilustra uma memória de fila circular atualizada deFigure 11C illustrates an updated circular queue memory of

- acordo com algumas modalidades da invenção; a figura 12 ilustra uma fila circular segmentada para manter so- mas correntes de acordo com algumas modalidades da invenção;- according to some embodiments of the invention; Figure 12 illustrates a segmented circular row for holding running sums in accordance with some embodiments of the invention;

a figura 13 ilustra uma fila circular segmentada de acordo com algumas modalidades da invenção;Figure 13 illustrates a segmented circular row according to some embodiments of the invention;

a figura 14 ilustra uma representação de uma saída do detector de pulso glotal em um pequeno segmento de voz sonora de acordo com al- gumas modalidades da invenção;Figure 14 illustrates a representation of a glottal pulse detector output in a small segment of voiced voice in accordance with some embodiments of the invention;

a figura 15 ilustra uma representação de um detector de núcleos silábicos de acordo com algumas modalidades da invenção;figure 15 illustrates a representation of a syllabic nucleus detector according to some embodiments of the invention;

a figura 16 ilustra um fluxo de trabalho para executar extração deFigure 16 illustrates a workflow to perform extraction of

—formante de acordo com algumas modalidades da invenção;—formant according to some embodiments of the invention;

a figura 17 ilustra um fluxo de trabalho para executar extração harmônica de acordo com algumas modalidades da invenção; :Figure 17 illustrates a workflow for performing harmonic extraction in accordance with some embodiments of the invention; :

a figura 18 ilustra uma representação de dois mecanismos de processamento consecutivos, se sobrepondo no tempo, operando em uma sequência de dicções de acordo com algumas modalidades da inven- ção; e a figura 19 ilustra um sistema de voz para texto que inclui um pontuador automático para algumas modalidades da invenção.figure 18 illustrates a representation of two consecutive processing mechanisms, overlapping in time, operating in a sequence of dictions according to some embodiments of the invention; and Figure 19 illustrates a speech-to-text system that includes an automatic scorer for some embodiments of the invention.

Descrição Detalhada da Invenção ; A invenção refere-se à aprendizagem automática de detectores e classificadores para reconhecimento de voz.Detailed Description of the Invention ; The invention relates to the automatic learning of detectors and classifiers for speech recognition.

Mais particularmente, esta 7“ 5 invenção é direcionada para a aprendizagem automática de detectores e classificadores que se concentram nos aspectos mais relevantes e robustos do sinal de voz, incluindo informação temporal para as tarefas particulares de detecção ou classificação em questão.More particularly, this invention is directed towards machine learning detectors and classifiers that focus on the most relevant and robust aspects of the speech signal, including temporal information for the particular detection or classification tasks in question.

Nas modalidades atualmente preferenciais da invenção, o siste- ma de reconhecimento de voz automático é usado em criação de legendas (closed captioning) de televisão em tempo real e ambientes de detecção de palavra.In the currently preferred embodiments of the invention, the automatic speech recognition system is used in real-time television closed captioning and word detection environments.

Embora o reconhecimento de voz automático tenha melhorado - ao longo dos anos o mesmo ainda não se aproxima do desempenho huma- no.Although automatic speech recognition has improved - over the years it still doesn't come close to human performance.

Níveis de ruído que não provocam nenhuma dificuldade para ouvintes ã humanos podem frequentemente tornar inutilizáveis sistemas de reconheci- mento de voz automáticos no estado da técnica.Noise levels that do not cause any difficulties for human listeners can often render automatic speech recognition systems unusable in the prior art.

Melhorias na precisão são provenientes, acima de tudo, ao custo de acréscimo de tempo de processa- mento e complexidade computacional.Improvements in accuracy come, above all, at the cost of increased processing time and computational complexity.

Em parte significativa estas dificulda- des provém do fato de que a informação usada pelos humanos para percep- ção de voz é distribuída de maneira não uniforme na frequência, amplitude e tempo.In significant part, these difficulties stem from the fact that the information used by humans for voice perception is unevenly distributed in frequency, amplitude and time.

A maior parte dos sistemas de reconhecimento de voz trata todos os pontos no tempo como igualmente relevantes para a percepção da voz e faz todas as classes de determinações baseadas no mesmo conjunto de carac- terísticas.Most speech recognition systems treat all points in time as equally relevant to speech perception and make all classes of determinations based on the same set of characteristics.

Os seres humanos, por outro lado, parecem ser capazes de sele- cionar aqueles aspectos do sinal de voz que são mais relevantes e robustos para fazer as distinções necessárias para percepção.Human beings, on the other hand, seem to be able to select those aspects of the voice signal that are most relevant and robust to make the distinctions necessary for perception.

Os receptores neurais no ouvido convertem o sinal acústico em padrões temporais de picos relacionados às suas características de amplitu- de dinâmica e distribuição de frequência.Neural receptors in the ear convert the acoustic signal into temporal patterns of peaks related to their dynamic range and frequency distribution characteristics.

Os padrões de picos. temporais codificam a informação e a comunicam para os neurônios do cérebro para processamento adicional.The peak patterns. Temporals encode information and communicate it to neurons in the brain for further processing.

Os neurônios e sinapses que formam as unidades computacionais do cérebro usam padrões de picos para codificar e comuni- car informação um para o outro.The neurons and synapses that make up the brain's computational units use spike patterns to encode and communicate information to one another.

A eficiência e efetividade do reconhecimen- ' to de padrão do maquinário neural humano são excepcionais.The efficiency and effectiveness of pattern recognition in human neural machinery is exceptional.

A codificação de picos cria uma representação muito esparsa do sinal.Peak encoding creates a very sparse representation of the signal.

Inspirada por certos “ 5 aspectos da percepção humana, a presente invenção codifica informação extraída do sinal de voz como picos, referenciados neste documento como "eventos". Nas modalidades atualmente preferenciais da invenção, a extra- ção baseada em eventos se concentra nos aspectos notáveis do sinal e cap- tura os relacionamentos temporais destes aspectos.Inspired by certain aspects of human perception, the present invention encodes information extracted from the speech signal as spikes, referred to in this document as "events". In the currently preferred embodiments of the invention, event-based extraction focuses on the salient aspects of the signal and captures the temporal relationships of these aspects.

Um exemplo de um tipo de evento seriam picos em pacotes de energia de bandas de frequência passantes.An example of an event type would be spikes in power packets from passing frequency bands.

Os picos são as localizações no sinal de voz onde a energia da voz em cada banda é mais forte contra o ruído de fundo.Peaks are the locations in the voice signal where the voice energy in each band is strongest against background noise.

A distância tempo- - ral entre picos e a sequência temporal de eventos são fortemente relaciona- das ao que está sendo falado.The temporal distance between peaks and the temporal sequence of events are strongly related to what is being said.

A extração de evento não é limitada a achar ] os picos de pacotes de filtros passa banda.Event extraction is not limited to finding the peaks of bandpass filter packets.

Outros eventos incluem eventos de começo e deslocamento gerados através de análise mais complexa do sinal que inclui a saída de detectores de subpadrão.Other events include start and shift events generated through more complex signal analysis that includes the output of subpattern detectors.

Classificadores e detec- tores baseados em qualquer método conhecido podem ser incorporados dentrode padrões de evento fazendo com que os mesmos disparem quando as condições para as quais os mesmos foram designados são detectadas.Classifiers and detectors based on any known method can be incorporated into event patterns causing them to fire when the conditions for which they are designed are detected.

Construindo Detectores e Classificadores Automáticos Relevantes Como usado aqui, o termo "classificadores" refere-se a um mé- todo e aparelho que designa rótulos de classe a vetores de características, eventos, e/ou sequências de eventos.Building Relevant Automatic Detectors and Classifiers As used herein, the term "classifiers" refers to a method and apparatus that assigns class labels to vectors of features, events, and/or sequences of events.

Detectores são classificadores, os quais designam rótulos de classe de "presente" ou "ausente" a cada vetor de característica, evento, e/ou sequência de eventos.Detectors are classifiers, which assign "present" or "absent" class labels to each feature vector, event, and/or sequence of events.

Classificadores de átona são funções de decisão que executam melhor do que o acaso.Unstressed classifiers are decision functions that perform better than chance.

Conjuntos classificadores são formados através da combinação de resultados de múltiplos classificadores de átona.Classifier sets are formed by combining the results of multiple unstressed classifiers.

Reforço é um método conhecido na técnica para construir automaticamente conjuntos qualificadores através da seleção e ponderação de classificadores de átona de modo que a decisão do conjunto seja melhor do que as decisões de qualquer um dos classificadores de átona. A seleção é feita avaliando iterati- BR vamente cada classificador de átona de um conjunto relativamente grande de classificadores de átona e escolhendo aquele que tem o melhor desem- “ 5 penhoem uma distribuição ponderada dos exemplos de treinamento rotula- dos. O classificador de átona selecionado é adicionado ao conjunto e é de- signado um peso à sua decisão baseado em sua taxa de erro. Os pesos de distribuição são então ajustados para enfatizar os erros feitos pelo conjunto e a próxima iteração é iniciada. Devido aos exemplos que não foram classifi- cados corretamente serem enfatizados na distribuição, os classificadores de átona que tendem a corrigir os erros do conjunto são adicionados em etapas subsequentes e as decisões globais do conjunto são melhoradas. Reforço tem mostrado que gera classificadores com boas carac- 7 terísticas de generalização. Os classificadores de átona podem tomar qual- querforma desde que seu desempenho seja melhor do que ao acaso.Reinforcement is a method known in the art to automatically construct qualifying sets by selecting and weighting unstressed classifiers so that the decision of the set is better than the decisions of any of the unstressed classifiers. Selection is made by iteratively evaluating each unstressed classifier from a relatively large set of unstressed classifiers and choosing the one that performs best in a weighted distribution of the labeled training examples. The selected unstressed classifier is added to the set and weighted to its decision based on its error rate. The distribution weights are then adjusted to emphasize the errors made by the ensemble and the next iteration is started. Because examples that were not classified correctly are emphasized in the distribution, unstressed classifiers that tend to correct ensemble errors are added in subsequent steps and overall ensemble decisions are improved. Reinforcement has shown that it generates classifiers with good generalization characteristics. Unstressed classifiers can take any form as long as they perform better than random.

Í Um método para executar classificação de padrão temporal é amostrar as trajetórias da característica em múltiplos intervalos fixos e apre- sentar todos os pontos de característica-tempo como características indivi- duais. Tipicamente, uma quantidade fixa de pontos característica-tempo é usada para classificação. Com uma quantidade fixa de pontos característica- tempo, a correspondência entre informação em um exemplo e aquela de outro exemplo é estabelecida pela definição do vetor de característica. i De acordo com as modalidades preferenciais da invenção atu- almente, é usada uma abordagem diferente. Devido à amostragem uniforme de trajetórias de característica poderem perder detalhes que ocorrem entre amostras e a amostragem uniforme criar muitas amostras que contêm pouca informação discriminada, a invenção em vez disso amostra trajetórias de característica relativa a eventos. Eventos são os pontos nas trajetórias onde é localizada informação significativa. Extração baseada em eventos cria uma representação esparsa do sinal. Esta abordagem requer modificação do mé- todo para definir classificadores de átona usados tipicamente em outros con- textos, tais como processamento de imagem, porque exemplos de uma dada classe podem ter zero, um, ou mais do que um evento de um dado tipo, por- tanto é necessário um método para estabelecer correspondência entre in- ' formação em um exemplo e informação em outro exemplo. Valores de características, eventos e padrões de eventos podem “ 5 fornecer evidência que seja consistente com a classe-alvo do detector ou podem fornecer evidência contrária. Os tipos de eventos, e os relacionamen- tos temporais entre eventos, representam uma parte significativa da evidên- cia a favor ou contra uma detecção de classe-alvo. Infelizmente, a corres- pondência exata entre padrões de eventos em exemplos diferentes da mes- ma voz não ocorrem. Além disso, o ruído pode provocar eventos espúrios ou faltantes, e a velocidade da voz pode provocar variação temporal nas se- quências de eventos. Usualmente as técnicas de aprendizagem de máquina são projetadas para utilizar vetores de característica de extensão fixa. Com - vetores de característica de extensão fixa, cada exemplo de treinamento po- sitivo e negativo sempre tem um valor para toda característica e a corres- : pondência entre valores de característica para cada exemplo é achada na mesma localização indexada no vetor de característica. Diferente dos valo- res em vetores de característica de extensão fixa, eventos e padrões de eventos podem existir ou não e podem ter relacionamentos temporais de alguma forma diferentes um com o outro fazendo com que seja difícil deter- minar quais eventos de um exemplo correspondem, a um evento em outro exemplo.Í One method for performing time pattern classification is to sample feature trajectories at multiple fixed intervals and present all feature-time points as individual features. Typically, a fixed amount of characteristic-time points is used for classification. With a fixed number of feature-time points, the correspondence between information in one instance and that of another instance is established by defining the feature vector. i In accordance with currently preferred embodiments of the invention, a different approach is used. Because uniform sampling of feature trajectories can miss details that occur between samples and uniform sampling creates many samples that contain little discriminated information, the invention instead samples feature trajectories relative to events. Events are the points on trajectories where significant information is located. Event-based extraction creates a sparse representation of the signal. This approach requires modifying the method to define unstressed classifiers typically used in other contexts, such as image processing, because examples of a given class may have zero, one, or more than one event of a given type, therefore a method is needed to establish correspondence between information in one instance and information in another instance. Characteristic values, events, and event patterns may provide evidence that is consistent with the detector's target class, or may provide evidence to the contrary. Event types, and the temporal relationships between events, represent a significant part of the evidence for or against a target class detection. Unfortunately, exact correspondence between patterns of events in different instances of the same voice does not occur. In addition, noise can cause spurious or missing events, and voice speed can cause temporal variation in event sequences. Usually machine learning techniques are designed to use feature vectors of fixed length. With - feature vectors of fixed extent, each positive and negative training example always has a value for every feature and the correspondence between feature values for each instance is found at the same location indexed in the feature vector. Unlike values in feature vectors of fixed length, events and event patterns may or may not exist and may have somewhat different temporal relationships with each other making it difficult to determine which events in an instance correspond, to an event in another example.

A invenção define métodos através dos quais a correspondência de eventos e padrões de eventos entre exemplos pode ser determinada, de — modo que informação temporal possa ser explorada para criar detectores de áfona para conjunto de aprendizes reforçados.The invention defines methods by which the correspondence of events and patterns of events between examples can be determined, so that temporal information can be exploited to create voiceless detectors for sets of reinforced learners.

Nas modalidades da invenção preferenciais atualmente uma ori- gem temporal é associada com um evento de um certo tipo, e as origens temporais de todos os exemplos são alinhadas. As variações temporais de eventos que representam um certo aspecto de voz são limitadas por um in- tervalo definido relativo à origem temporal. Para um dado intervalo, se existe uma diferença na consistência com a qual os eventos (de certo tipo) caem dentro do intervalo para a classe positiva e a classe negativa, a diferença pode ser explorada para criar um detector de átona. Em algumas modalida- . des desta invenção, exemplos são alinhados baseados na localização de seus eventos de núcleo silábico. Em algumas modalidades desta invenção, 7 5 conjuntos de dois ou mais eventos são alinhados com respeito a um dos e- ventos dentro de cada conjunto.In currently preferred embodiments of the invention a time source is associated with an event of a certain type, and the time sources of all examples are aligned. Temporal variations of events that represent a certain aspect of voice are limited by a defined interval relative to the temporal origin. For a given interval, if there is a difference in the consistency with which events (of a certain type) fall within the interval for the positive class and the negative class, the difference can be exploited to create an unstressed detector. In some modality. From this invention, examples are aligned based on the location of their syllabic head events. In some embodiments of this invention, 75 sets of two or more events are aligned with respect to one of the events within each set.

Para fazer um detector de átona utilizável baseado em informa- ção afirmativa associada com eventos, os intervalos que definem o detector de átona têm que conter eventos em sua maioria exemplos positivos e têm que não conter eventos em uma maioria de exemplos negativos. Estes inter- valos podem ser sistematicamente determinados através da avaliação de todos os intervalos que contém eventos de uma maioria de exemplos positi- vos. Primeiro, os exemplos são trazidos para correspondência temporal ge- - ral através de alinhamento baseado em um evento comum particular. Opcio- nalmente, exemplos de diferentes durações gerais podem ser colocados em ] escala para ter uma extensão comum. Os intervalos consistentes podem ser descobertos eficientemente através de primeiro, para todos os exemplos, arrumar os eventos de sensores diferentes (por exemplo, sensores de banda de frequência) em dois espaços dimensionais e gravar a soma acumulada da quantidade ponderada de eventos acima e a esquerda de cada evento. Em seguida a quantidade de eventos dentro de qualquer intervalo retangular pode ser determinada através de diferenças simples nas contas ponderadas acumuladas. Detectores de átona baseados em cada intervalo que contém eventos para a maioria dos exemplos são avaliados e o melhor detector para a distribuição ponderada corrente é retido. O detector composto é avaliado no conjunto de treinamento inteiro e os pesos de distribuição são ajustados para os erros feitos.To make an unstressed detector usable based on the affirmative information associated with events, the intervals defining the unstressed detector must contain events in mostly positive instances and must contain no events in mostly negative instances. These intervals can be systematically determined by evaluating all intervals that contain events from a majority of positive examples. First, the examples are brought into general temporal correspondence through alignment based on a particular common event. Optionally, examples of different general durations can be scaled to a common extent. Consistent ranges can be efficiently discovered by first, for all examples, arranging the events from different sensors (e.g. frequency band sensors) into two dimensional spaces and recording the cumulative sum of the weighted amount of events above and to the left. of each event. Then the number of events within any rectangular range can be determined through simple differences in the accumulated weighted accounts. Unstressed detectors based on each interval that contains events for most examples are evaluated and the best detector for the current weighted distribution is retained. The composite detector is evaluated on the entire training set and the distribution weights are adjusted for the errors made.

Classificadores de átona são adicionados de acordo com o pro- cesso acima até que o detector de desempenho esteja perfeito nas amostras detreinamento ou que seja alcançada a quantidade máxima de iterações.Unstressed classifiers are added according to the above process until the detector performance is perfect in the training samples or the maximum number of iterations is reached.

A figura 1 ilustra um exemplo de um fluxo de trabalho 100 para construir um esquema de classificadores ponderados para uso em um mó-Figure 1 illustrates an example of a workflow 100 to build a weighted classifier scheme for use in a

dulo de processamento de um mecanismo de reconhecimento de voz auto- mático. Nas modalidades da invenção preferenciais atualmente, o esquema : de classificação ponderada é usado no módulo de classificação de um me- canismo de reconhecimento de voz automático, como explicado abaixo em “ 5 conexão coma figura 9. O fluxo de trabalho 100 da figura 1 começa arma- zenando uma pluralidade de sinais de voz como um conjunto de treinamento 101 e em seguida extrai padrões de eventos do conjunto de treinamento 102, em que os ditos padrões de evento compreendem aspectos caracterís- ticos dos sinais de voz. A seguir, uma amostra de sinais de voz com padrões de evento correspondentes é acessada 103 e alinhada com base na locali- zação temporal de onde o evento ocorreu dentro do sinal de voz 104. Cada sinal é em seguida colocado em escala opcionalmente para uma duração temporal comum 105. - Uma vez que os sinais extraídos sejam colocados em escala pa- rauma duração comum com localizações de evento comuns, uma pluralida- ] de de detectores de átona é aplicada aos sinais e a efetividade de cada classificador de átona é testada em sua habilidade de detectar os eventosprocessing dual of an automatic speech recognition engine. In currently preferred embodiments of the invention, the weighted classification scheme is used in the classification module of an automatic speech recognition engine, as explained below in “5 in connection with Figure 9. Workflow 100 of Figure 1 begins storing a plurality of speech signals as a training set 101 and then extracting event patterns from the training set 102, said event patterns comprising characteristic aspects of the speech signals. Next, a sample of speech signals with corresponding event patterns is accessed 103 and aligned based on the temporal location of where the event occurred within the speech signal 104. Each signal is then optionally scaled to a duration common temporal 105. - Once the extracted signals are scaled to a common duration with common event locations, a plurality of unstressed detectors are applied to the signals and the effectiveness of each unstressed classifier is tested in your ability to detect events

106. Baseado na efetividade medida, os classificadores de átona são ponde- rados, com aqueles que executam bem recebendo um coeficiente alto e a- queles que executaram de forma deficiente recebendo um coeficiente baixo106. Based on measured effectiveness, unstressed classifiers are weighted, with those that perform well receiving a high coefficient and those that perform poorly receiving a low coefficient.

107.107.

A seguir a efetividade do esquema de ponderação é testada pa- ra determinar se a ponderação reconhece adequadamente eventos no con- junto de treinamento baseado em um limite de efetividade predeterminadoNext, the effectiveness of the weighting scheme is tested to determine if the weighting properly recognizes events in the training set based on a predetermined effectiveness threshold.

108.O fluxo de trabalho faz uma consulta se a ponderação reconhece ade- quadamente os eventos 109. Se o esquema de ponderação executa ade- quadamente, o fluxo de trabalho 100 armazena o esquema de ponderação e termina 110. Por outro lado, se o esquema de ponderação não executa ade- quadamente, são adicionados classificadores de átona ao grupo de classifi- —cadores de átona aplicado previamente 111, e o fluxo de trabalho reitera até que o nível limite de efetividade seja alcançado.108. The workflow queries whether the weight properly recognizes events 109. If the weighting scheme performs properly, the workflow 100 stores the weighting scheme and terminates 110. weighting scheme does not perform properly, unstressed classifiers are added to the previously applied unstressed classifiers group 111, and the workflow iterates until the threshold level of effectiveness is reached.

Os padrões de evento de diferentes exemplos de uma dada voz têm alguma similaridade, entretanto, não ocorre correspondência exata de eventos entre quaisquer dois exemplos de voz. Se é dado um tempo de refe- ' rência comum a eventos de exemplos diferentes, tal como sendo feitos rela- tivos aos centros de sílabas, os eventos correspondentes de diferentes e- “ 5 xemplosde uma dada voz ocorrerão dentro de uma região no plano tempo- sensor. Voz é altamente variável e a informação mais útil para percepção é distribuída não uniformemente em frequência, amplitude, tempo e escala de tempo. Portanto, especificar regiões no plano tempo-sensor que contêm e- ventos que contribuem com certa informação perceptiva não pode ser feito efetivamente usando uma única escala ou forma constante. Entretanto, ava- liar completamente todas as possíveis posições, formas e escalas de regiões que possam conter coleções ou eventos correspondentes relevantes pode ser computacionalmente inviável. Portanto, é definido um processo que iden- - tifica automaticamente regiões de eventos correspondentes úteis para per- cepção de voz.The event patterns of different instances of a given voice have some similarity, however, there is no exact correspondence of events between any two voice instances. If events from different examples are given a common time of reference, such as being made relative to syllable centers, the corresponding events of different examples of a given voice will occur within a region in the time plane. - sensor. Voice is highly variable and the information most useful for perception is distributed non-uniformly in frequency, amplitude, time and time scale. Therefore, specifying regions in the time-sensor plane that contain events that contribute certain perceptual information cannot be done effectively using a single scale or constant form. However, fully evaluating all possible positions, shapes and scales of regions that may contain relevant collections or corresponding events may be computationally infeasible. Therefore, a process is defined that automatically identifies corresponding event regions useful for speech perception.

? Primeiros eventos de uma pluralidade de exemplos de treina- mento positivos são feitos relativos a uma referência de tempo comum, tal! como centros de sílabas e os eventos são projetados no plano tempo- trajetória. Opcionalmente, antes da projeção os padrões podem ser coloca- dos em escalade modo que sua duração seja igual a 1. Regiões no plano tempo-trajetória que contém eventos de uma maioria de exemplos positivos são retidas como grupos potenciais de eventos correspondentes. Uma lista destas regiões é formada e usada para todas as etapas subsequentes de criação de detectores de átona.? First events of a plurality of positive training examples are made relative to a common-time reference, such! how syllable centers and events are projected onto the time-path plane. Optionally, before projection, patterns can be scaled so that their duration is equal to 1. Regions in the time-trajectory plane that contain events from a majority of positive examples are retained as potential groups of corresponding events. A list of these regions is formed and used for all subsequent steps of creating unstressed detectors.

A figura 2 ilustra um exemplo de um fluxo de trabalho 200 para identificar regiões automaticamente em uma pluralidade de sinais de voz que contêm padrões de evento de acordo com algumas modalidades da inven- ção. O fluxo de trabalho 200 começa alinhando um grupo de sinais de voz de um conjunto de treinamento de sinais de voz relativos a um eixo de tem- po comum 7201. A seguir, o fluxo de trabalho 200 opcionalmente coloca em escala a duração de cada sinal de voz individual no grupo para uma unidade de duração de tempo comum 202 e que projeta centros de sílaba dos sinais de voz e os centros de eventos dos sinais de voz no eixo do tempo comumFigure 2 illustrates an example of a workflow 200 for automatically identifying regions in a plurality of speech signals that contain event patterns in accordance with some embodiments of the invention. Workflow 200 begins by aligning a group of speech signals from a training set of speech signals relative to a common time axis 7201. Next, workflow 200 optionally scales the duration of each signal individual voice in the group to a common time duration unit 202 and which projects syllable centers of the voice signals and the event centers of the voice signals onto the common time axis

203. Finalmente, as regiões do eixo do tempo que têm uma concentração : alta de centros de silaba e centros de evento são identificadas como regiões que contém padrões de evento 204.203. Finally, regions of the time axis that have a high concentration of syllable centers and event centers are identified as regions that contain 204 event patterns.

“5 Adicionalmente às técnicas reveladas para identificar regiões que têm uma alta concentração de eventos, a invenção também envolve di- versas técnicas que são empregadas para rejeitar regiões que são pouco prováveis de resultar em detectores de átonas robustos que incluem, mas não são limitadas a mapeamento de integração de evento, aplicação de res- trições de densidade de exemplo, rejeição de regiões redundantes e combi- nações dos mesmos. Mapeamento de Integração de Eventos Em algumas modalidades da invenção, um processo de mape- - amento de integração de eventos é empregado para rejeitar regiões que não são prováveis de resultar em detectores de átona úteis.“5 In addition to the disclosed techniques for identifying regions that have a high concentration of events, the invention also involves several techniques that are employed to reject regions that are unlikely to result in robust stress detectors that include, but are not limited to, event integration mapping, application of example density constraints, rejection of redundant regions and combinations thereof. Event Integration Mapping In some embodiments of the invention, an event integration mapping process is employed to reject regions that are not likely to result in useful unstress detectors.

? Uma técnica conhecida no campo de processamento de imagem que permite a computação rápida da soma de valores de pixel sobre regiões retangulares é modificada para permitir rejeição rápida de regiões inviáveis com base em contadores de eventos na região. Na técnica de processamen- tode imagem original a primeira etapa é computar um "mapa de soma" no qual cada célula do mapa corresponde à soma dos valores de pixel na regi- ão retangular definida pelo canto naquela célula e o canto diagonalmente oposto na origem. Após este mapa de soma ter sido computado a soma dos pixels de qualquer sub-região retangular da imagem pode ser determinada com duas operações de subtração e uma de adição. A técnica de "mapa de soma" é adaptada para a eliminação rápida de regiões que não podem con- ter evidência de mais do que uma quantidade especificada de eventos em cada célula da grade de uma grade sobreposta no plano tempo-trajetória. Quando um mapa de soma de contas de eventos de célula de grade é com- —putado então pode ser feita uma determinação da quantidade de eventos em qualquer região retangular usando apenas duas operações de subtração e uma de adição. Conhecer a quantidade de eventos na região não é equiva-? A known technique in the image processing field that allows fast computation of the sum of pixel values over rectangular regions is modified to allow fast rejection of infeasible regions based on event counters in the region. In the original image processing technique the first step is to compute a "sum map" in which each cell of the map corresponds to the sum of the pixel values in the rectangular region defined by the corner in that cell and the diagonally opposite corner at the origin. After this sum map has been computed, the sum of pixels of any rectangular sub-region of the image can be determined with two operations of subtraction and one of addition. The "sum map" technique is adapted for the rapid elimination of regions that cannot contain evidence of more than a specified number of events in each grid cell of a grid superimposed on the time-trajectory plane. When a grid cell event count sum map is computed then a determination of the number of events in any rectangular region can be made using only two subtraction and one addition operations. Knowing the number of events in the region is not equivalent to

lente a conhecer a quantidade de exemplos na região, mas isto estabelece o limite superior. Portanto qualquer região que não tenha um contador de ' eventos maior ou igual à quantidade requerida de exemplos possivelmente não pode conter a quantidade requerida de exemplos.lens to know the number of examples in the region, but this sets the upper limit. Therefore any region that does not have an event counter greater than or equal to the required number of examples cannot possibly contain the required number of examples.

“5 As figuras 3A a 3C ilustram a estrutura de um mapa de soma baseado em eventos de acordo com algumas modalidades da invenção. Na figura 3A é representado um padrão de eventos no plano tempo-trajetória. Na figura 3B são determinados os contadores de eventos que ocorrem dentro dos limites de uma grade sobreposta. Na figura 3C é conhecido um mapa de so- ma onde cada célula contém a soma dos contadores na região retangular que tem a origem como um canto e a célula como o canto diagonalmente oposto. Para determinar a quantidade de eventos nas quatro células centrais da figura 3C, a partir do valor na célula superior direita da região em questão, neste - caso "7", o valor da região não incluída à esquerda é subtraído, neste caso "3", como na região não incluída abaixo, neste caso "4", e a região subtraída ? acima na interseção das duas regiões subtraídas é adicionada de volta, neste caso "2". Isto resulta na quantidade de eventos na região, neste caso "2" (7-3-4+2 = 2). O custo computacional de determinar os contadores de evento de uma região de qualquer dimensão ou forma é o mesmo. Restriçãode Densidade de Eventos Em algumas outras modalidades da invenção, a aplicação de restrições de densidade de eventos é empregada para rejeitar regiões que não são prováveis de resultar em detectores de átona úteis. Por exemplo, restrições de densidade mínima podem ser aplicadas opcionalmente para rejeitar regiões com uma densidade de eventos abaixo de uma quantidade especificada. Rejeição de Região Redundante Em algumas modalidades da invenção, regiões redundantes que são improváveis de resultar em detectores de átona úteis são rejeitadas. Regiões que contém outras regiões, mas não adicionam eventos positivos adicionais além daqueles incluídos dentro da região contida não são adicio- nadas a lista de regiões.“5 Figures 3A to 3C illustrate the structure of an event-based sum map according to some embodiments of the invention. In figure 3A a pattern of events in the time-trajectory plane is represented. In figure 3B the event counters that occur within the limits of an overlapping grid are determined. In figure 3C a sum map is known where each cell contains the sum of the counters in the rectangular region that has the origin as a corner and the cell as the diagonally opposite corner. To determine the number of events in the four central cells of figure 3C, from the value in the upper right cell of the region in question, in this case "7", the value of the region not included on the left is subtracted, in this case "3" , as in the region not included below, in this case "4", and the subtracted region ? above at the intersection of the two subtracted regions is added back, in this case "2". This results in the number of events in the region, in this case "2" (7-3-4+2 = 2). The computational cost of determining event counters for a region of any size or shape is the same. Event Density Constraint In some other embodiments of the invention, the application of event density constraints is employed to exclude regions that are not likely to result in useful unstressed detectors. For example, minimum density constraints can optionally be applied to reject regions with an event density below a specified amount. Redundant Region Rejection In some embodiments of the invention, redundant regions that are unlikely to result in useful unstressed detectors are rejected. Regions that contain other regions but do not add additional positive events beyond those included within the contained region are not added to the region list.

Com referência novamente a figura 2, uma vez que as regiões são identificadas, as mesmas formam restrições que são usadas para gerar . detectores de átona.Referring again to Figure 2, once the regions are identified, they form constraints that are used to generate . tone detectors.

Os detectores de átona podem consistir em um simples teste para determinar se um dado exemplo tem quaisquer eventos dentro da “ 5 região ou não, ou podem ser estendidos para incluir restrições adicionais baseadas na extensão de valores de característica dos exemplos positivos que tem eventos dentro da região.Unstress detectors may consist of a simple test to determine whether a given instance has any events within the “5 region or not, or they may be extended to include additional restrictions based on the extent of characteristic values of positive instances that have events within the region. region.

Reconhecimento de Voz Baseado em Sequência de Eventos As sequências de eventos, em geral, são discriminadores mais poderosos no reconhecimento automático de voz do que eventos individuais dos quais eles são compostos.Sequence-of-Event-Based Speech Recognition Sequences of events, in general, are more powerful discriminators in automatic speech recognition than the individual events of which they are composed.

Algumas modalidades da Invenção envolvem detectar sequências de eventos em vez de, ou adicionalmente a, detectar eventos individuais. - Em algumas modalidades da invenção, uma sequência de even- tos é localizada como um ponto no hiperespaço pelo uso dos intervalos : (possivelmente colocados em escala) em espaço temporal-sensor como co- ordenadas.Some embodiments of the Invention involve detecting sequences of events instead of, or in addition to, detecting individual events. - In some embodiments of the invention, a sequence of events is located as a point in hyperspace by using the intervals : (possibly scaled) in sensor-temporal space as coordinates.

Para entender o conceito, considera-se a sequência de três e- ventos produzidos por um único sensor, no qual o segundo evento segue o primeiro por duas unidades de tempo e o terceiro segue o segundo por qua- tro unidades de tempo.To understand the concept, we consider the sequence of three events produced by a single sensor, in which the second event follows the first for two time units and the third follows the second for four time units.

A sequência de tempo destes três eventos com res- peito a cada um dos outros é representada pelas coordenadas (2, 4). A simi- laridade das sequências temporais pode ser julgada através da computação de uma função de distância entre os pontos projetados.The time sequence of these three events with respect to each other is represented by the coordinates (2, 4). The similarity of the temporal sequences can be judged by computing a distance function between the projected points.

Por exemplo, a dis- tância Euclideana pode ser usada para este propósito.For example, Euclidean distance can be used for this purpose.

Para acessar quais sequências podem aparecer consistentemente (ou não) nos exemplos, as sequências de eventos de um exemplo positivo são projetadas como já des- critas para formar um conjunto de pontos-padrão que representam as se- quências possíveis que podem ser associadas com os exemplos positivos.In order to assess which sequences may (or may not) appear consistently in the examples, the sequences of events of a positive example are designed as already described to form a set of pattern points that represent the possible sequences that can be associated with the positive examples.

Um ponto-padrão é definido baseado nas coordenadas de cada um dos pon- tosdo primeiro exemplo e cada contador associado de ponto-padrão é ajus- tado para 1. As sequências de eventos do restante de eventos positivos são projetadas dento dos pontos de hiperespaço com o uso de seus intervalos como coordenadas de maneira semelhante ao primeiro exemplo. Conforme cada ponto da sequência é gerado o mesmo é associado com o ponto- ' padrão mais próximo. O ponto de sequência é adicionado a uma lista asso- ciada com aquele ponto-padrão e o contador de pontos-padrão é incremen- “ 5 tadode1 As coordenadas de ponto-padrão são então ajustadas para se tornarem os valores médios das coordenadas de seus pontos de exemplo associados. Após todos os exemplos terem sido processados, os pontos- padrão com contadores altos representam sequências de eventos que são altamente associadas com a classe. As coordenadas dos pontos-padrão re- presentam os centros relativos das regiões com respeito ao primeiro evento na sequência. O tamanho e formas das regiões podem ser determinados pela variação das sequências de exemplos associados. Em algumas moda- lidades da invenção, pode ser desejável mesclar sequências similares. Can- fr didatos para o consolidador são determinados facilmente por sua distância no hiperespaço projetado.A pattern point is defined based on the coordinates of each of the points in the first example and each associated pattern point counter is set to 1. The event sequences of the rest of positive events are projected into the hyperspace points with using their ranges as coordinates in a similar way to the first example. As each point in the sequence is generated it is associated with the closest standard '-point. The sequence point is added to a list associated with that pattern point and the pattern point counter is incremented “ 5 pattern point coordinates are then adjusted to become the average values of the coordinates of its points associated examples. After all examples have been processed, pattern points with high counters represent sequences of events that are highly associated with the class. The coordinates of the standard points represent the relative centers of the regions with respect to the first event in the sequence. The size and shapes of the regions can be determined by varying the sequences of associated examples. In some embodiments of the invention, it may be desirable to merge similar sequences. Candidates for the consolidator are easily determined by its distance in the projected hyperspace.

É Em algumas modalidades da invenção o processo descobre combinações de regiões que detectam sequências de eventos que frequen- temente ocorrem juntamente com a classe-alvo. A utilidade destes detecto- res de átona depende da co-ocorrência ser menos frequente quando a clas- se-alvonão está presente.In some embodiments of the invention the process discovers combinations of regions that detect sequences of events that frequently occur together with the target class. The usefulness of these unstressed detectors depends on their co-occurrence being less frequent when the target class is not present.

O processo descrito neste documento envolve um processo para descobrir sequências de eventos que fornecem evidência afirmativa da classe positiva. Evidência em contrário também tem valor. Para descobrir evidência contrária, o processo descrito acima é repetido, mas desta vez com os exemplos negativos. Detectores inibidores de átona são formados baseados nas sequências que recorrem nos exemplos negativos com alguma frequência, mas nunca ou raramente ocorrem nos exemplos positi- vos.The process described in this document involves a process to discover sequences of events that provide affirmative evidence of the positive class. Evidence to the contrary also has value. To discover contrary evidence, the process described above is repeated, but this time with the negative examples. Atonic inhibitor detectors are formed based on sequences that recur in negative examples with some frequency, but never or rarely occur in positive examples.

Em algumas modalidades da invenção, conjuntos de detectores de átona podem ser formados através do uso de um algoritmo de reforço adaptativo para manusear conjuntos de treinamento não balanceados ou para resultar em detectores de menor complexidade.In some embodiments of the invention, sets of unstressed detectors can be formed using an adaptive reinforcement algorithm to handle unbalanced training sets or to result in less complex detectors.

Melhoria de Desempenho Através de Simplificação de Conjuntos Reforçados Em algumas modalidades da invenção, algoritmos de reforço . adaptativos são usados para aumentar o desempenho do reconhecimento. Algoritmos de reforço adaptativos envolvem um processo reiterativo de cha- “ 5 mar sequencialmente classificadores de átona, testar estes classificadores e ajustar os coeficientes de ponderação adequadamente. Algoritmos de refor- ço adaptativos criam conjuntos pela adição de um detector de átona por ite- ração sem inspecionar a frente e sem correção de pesos anteriores. Como resultado, o conjunto final pode ser mais complexo do que o necessário.Performance Improvement Through Simplification of Boosted Sets In some embodiments of the invention, boost algorithms . Adaptive tools are used to increase recognition performance. Adaptive reinforcement algorithms involve a reiterative process of calling unstressed classifiers sequentially, testing these classifiers, and adjusting the weighting coefficients accordingly. Adaptive reinforcement algorithms create sets by adding an unstressed detector per iteration without inspecting the front and without correction of previous weights. As a result, the final assembly may be more complex than necessary.

Algumas modalidades da invenção incluem um processo para reduzir a complexidade dos conjuntos criados por algoritmos de reforço a- daptativos. De acordo com estas modalidades após o detector alcançar per- feição no conjunto de treinamento ou alcançar uma quantidade máxima de - iterações, então um processo de simplificação é executado. O desempenho do detector composto é comparado iterativamente com versões dele próprio É em que cada um tem uma diferença de seus detectores de átona removidos. Se remover qualquer um dos detectores de átona melhora a taxa de erro, a remoção que tem o maior ganho é executada, caso contrário, se remover qualquer um dos detectores de átona não provoca aumento na taxa de erro, um destes detectores é removido. O processo continua até que não sejam mais removidos detectores de átona.Some embodiments of the invention include a process for reducing the complexity of sets created by adaptive reinforcement algorithms. According to these modalities after the detector reaches perfection in the training set or reaches a maximum number of iterations, then a simplification process is performed. The performance of the composite detector is iteratively compared with versions of itself. Each has a difference from its removed unstressed detectors. If removing any of the unstressed detectors improves the error rate, the removal that has the highest gain is performed, otherwise, if removing any of the unstressed detectors causes no increase in the error rate, one of these detectors is removed. The process continues until no more unstressed detectors are removed.

Em outras modalidades da invenção, é usado um algoritmo de reforço de programação linear que atualiza todos os pesos do conjunto con- forme são adicionados novos detectores para a construção de conjuntos.In other embodiments of the invention, a linear programming boost algorithm is used that updates all weights in the set as new detectors are added for building sets.

Detecção de Indicador Alternativo A percepção humana de voz pode se basear em indicadores al- ternativos quando alguns aspectos do sinal de voz são corrompidos. Igual- mente, indicadores alternativos podem ser achados em uma amostra de voz e detectados em um sistema de reconhecimento de voz automático.Alternative Indicator Detection Human perception of voice can rely on alternative indicators when some aspects of the voice signal are corrupted. Likewise, alternative indicators can be found in a voice sample and detected in an automatic voice recognition system.

Em algumas modalidades da invenção, detectores baseados em indicadores alternativos são desenvolvidos seguindo as etapas mencionadas acima para criar um conjunto detector e então repetindo o processo para fazer os detectores subsequentes com a restrição de que detectores de áto- na usados pelos detectores criados previamente não podem ser usados para . construir os detectores subsequentes. Isto maximizará a independência dos detectores. Detectores de múltiplos indicadores alternativos podem então ser “ 5 combinados como um conjunto para fazer um detector que seja tolerante a tal variação.In some embodiments of the invention, detectors based on alternative indicators are developed by following the steps mentioned above to create a detector assembly and then repeating the process to make subsequent detectors with the restriction that unstressed detectors used by previously created detectors cannot be used for . build the subsequent detectors. This will maximize detector independence. Alternative multi-indicator detectors can then be combined as a set to make a detector that is tolerant of such variation.

Conversão Automática de Conjuntos Para Detectores em Cascata A decisão global do conjunto é a soma ponderada dos detecto- res individuais. Na forma-padrão do conjunto, todos os classificadores de átonatêm que ser avaliados para fazer uma determinação de voz. Em algu- mas modalidades da invenção o conjunto de detectores é convertido em um detector em cascata que reduz a quantidade de detectores de átona que tem que ser avaliados na média. Ordenar os detectores de átona do mais forte - para o mais fraco e analisar o relacionamento entre as somas em cada está- gioeo resultado final, podem estabelecer limites "precoces" que convertem : o conjunto para uma cascata de detectores.Automatic Set Conversion to Cascade Detectors The overall set decision is the weighted sum of the individual detectors. In the standard form of the set, all unstressed classifiers have to be evaluated to make a voice determination. In some embodiments of the invention the detector array is converted into a cascade detector which reduces the amount of unstressed detectors that have to be averaged. Ranking the unstressed detectors from strongest to weakest and analyzing the relationship between the sums at each stage and the final result can establish "early" limits that convert the set to a cascade of detectors.

O sincronismo relativo de vários eventos contém informação im- portante para percepção de voz. Este tipo de informação pode ser explorado pelo exame de padrões persistentes de eventos correspondentes a partir de múltiplos eventos de uma dada palavra, sílaba, fonema, etc. Esta análise é desafiadora devido à variabilidade em todos os aspectos da voz e pelo fato de que ocorrem diferentes indicadores perceptivos sobre escalas de tempo diferentes.The relative timing of various events contains important information for speech perception. This type of information can be explored by examining persistent patterns of corresponding events from multiple events of a given word, syllable, phoneme, etc. This analysis is challenging due to the variability in all aspects of voice and the fact that different perceptual indicators occur over different time scales.

Entretanto, como explicado neste documento, a maior parte das técnicas de classificação de aprendizagem de máquina é designada para aprender decisões baseadas em vetores de dimensão fixa de informação homogênea. Com extração baseada em evento, os eventos ocorrem ou não de acordo com condições de sinal. Isto significa que um dado exemplo pode ter mais ou menos eventos do que outro exemplo da mesma sílaba, palavra, fonema, etc. A fim de treinar detectores de treinamento com eficácia usando extração baseada em evento, é necessário descobrir quais eventos de um exemplo de uma sílaba, palavra, fonema, etc., correspondem ao mesmo su-However, as explained in this document, most machine learning classification techniques are designed to learn decisions based on fixed-dimensional vectors of homogeneous information. With event-based extraction, events do or do not occur according to signal conditions. This means that a given instance may have more or fewer events than another instance of the same syllable, word, phoneme, etc. In order to train training detectors effectively using event-based extraction, it is necessary to find out which events of an example of a syllable, word, phoneme, etc.

porte perceptivo em outros exemplos. Posteriormente neste documento, são descritos métodos que localizam automaticamente os limites destes eventos : correspondentes. Métodos e Técnicas Para Usar Exemplos de Treinamento Automaticamente “ 5 para Descobrir Suporte Relevante e Informação Contrária e Determinar Pe- sos Para Fazer uma Decisão de Detecção Cascatas Baseadas em Eventos para Conjuntos de Treinamento Altamente Desbalanceados Em algumas modalidades da invenção, um método para criar automaticamente cascatas de detectores baseadas em eventos supera os problemas de aprendizagem a partir de conjuntos de treinamento altamente desbalanceados ou de aprendizagem para detectar objetos raros. As casca- tas de detectores resultantes fornecem detecção eficiente de objetos raros - por eliminação da maioria dos exemplos negativos nos estágios iniciais. Em algumas modalidades da invenção, criar cascatas de detec- : tores baseadas em eventos envolve criar detectores para palavras específi- cas que ocorrem raramente. Detectar palavras raras é usado simplesmente para ilustrar a invenção e outras aplicações de detecção ficarão prontamente aparentes para os indivíduos com conhecimentos comuns na técnica tendo o benefício desta descrição. Por exemplo, algumas outras técnicas incluem detecção de classes de voz de subpalavras, tais como sílabas específicas, fonemas específicos, classes amplas de sílabas e classes amplas de fonéti- ca. Adicionalmente, a invenção pode ser aplicada a muitas aplicações que não são relacionadas a reconhecimento de voz tais como monitoração de processo industrial, detecção de falha em sistema automotivo e monitoração de equipamento médico.perceptual bearing in other examples. Later in this document, methods that automatically find the boundaries of these corresponding events are described. Methods and Techniques for Using Training Examples Automatically “ 5 to Discover Relevant Support and Contradictory Information and Determining Weights to Make a Detection Decision Event-Based Cascades for Highly Unbalanced Training Sets In some embodiments of the invention, a method for automatically creating event-based detector cascades overcomes the problems of learning from highly unbalanced training sets or learning to detect rare objects. The resulting cascades of detectors provide efficient detection of rare objects - by eliminating most negative examples in the early stages. In some embodiments of the invention, creating event-based detector cascades involves creating detectors for specific words that occur rarely. Detecting rare words is used simply to illustrate the invention and other detection applications will be readily apparent to those of ordinary skill in the art having the benefit of this disclosure. For example, some other techniques include detection of voice classes of subwords, such as specific syllables, specific phonemes, broad classes of syllables, and broad classes of phonetics. Additionally, the invention can be applied to many applications that are not related to speech recognition such as industrial process monitoring, automotive system failure detection and medical equipment monitoring.

Conjuntos de treinamento altamente desbalanceados com pou- cos exemplos positivos e muitos exemplos negativos não são bem manipu- lados através de técnicas de aprendizagem de máquina com tentativa de minimizar a quantidade de erros. Quando exemplos positivos ocorrem rara- mente, por exemplo, com uma taxa de 1 em 100.000.000 então um detector que falha em detectar esta ocorrência deve ter uma taxa de erro muito baixaHighly unbalanced training sets with few positive examples and many negative examples are not well handled through machine learning techniques in an attempt to minimize the amount of errors. When positive examples rarely occur, for example with a rate of 1 in 100,000,000 then a detector that fails to detect this occurrence must have a very low error rate.

(taxa de erro = 0,00000001). Entretanto, mesmo embora o mesmo tenha uma taxa de erro baixa devido à nunca fazer uma detecção falsa, ele é es- ' sencialmente inútil.(error rate = 0.00000001). However, even though it has a low error rate due to never making a false detection, it is essentially useless.

Objetos que são membros de uma classe compartilham caracte- “5 rísticas cujos valores ficam dentro de certas amplitudes. Deste modo, obje- tos com características cujos valores fiquem fora destas amplitudes podem ser totalmente rejeitados por não pertencerem a classe. Entretanto, objetos que têm característica cujos valores não estão completamente dentro da amplitude podem ter algumas características cujos valores ficam dentro da amplitude associada com a classe. Portanto, pode ser possível excluir asso- ciação a classe para um objeto se o mesmo tem um único valor de caracte- rística fora da amplitude. Consequentemente, em algumas modalidades da invenção, confirmar associação a classe geralmente exige que todos os va- - lores de característica relevantes estejam dentro de amplitudes consistentes coma classe.Objects that are members of a class share characteristics whose values fall within certain ranges. In this way, objects with characteristics whose values are outside these ranges can be totally rejected because they do not belong to the class. However, objects that have characteristics whose values are not completely within the range may have some characteristics whose values fall within the range associated with the class. Therefore, it may be possible to delete class membership for an object if it has a single out-of-range characteristic value. Consequently, in some embodiments of the invention, confirming class membership generally requires that all relevant feature values fall within ranges consistent with the class.

? Aplicada ao reconhecimento de voz, extração de característica baseada em eventos cria uma representação esparsa que preserva a infor- mação mais relevante para reconhecimento de classes de voz incluindo in- formação temporal. Um exemplo de um tipo de evento que pode ser extraído é a ocorrênciade um pico no pacote de uma certa trajetória de característi- ca. Um pacote de trajetória de característica pode, por exemplo, ser compu- tado na saída produzida quando o sinal de voz é passado através de certo filtro passa banda. Quando muitas destas trajetórias são computadas, os eventos são distribuídos no espaço tempo-trajetória. Toda evidência útil para identidade de classe de palavra é associada com eventos no espaço tempo- trajetória. Quando tempos de eventos são tornados relativos a uma referên- cia de tempo comum, tal como os centros de sílaba, e os eventos de múlti- plos exemplos da mesma classe são plotados no espaço tempo-trajetória, são formadas regiões que contêm agrupamentos de eventos relacionados.? Applied to speech recognition, event-based feature extraction creates a sparse representation that preserves the information most relevant to speech class recognition including temporal information. An example of a type of event that can be extracted is the occurrence of a peak in the packet of a certain characteristic trajectory. A characteristic path packet can, for example, be computed on the output produced when the speech signal is passed through a certain bandpass filter. When many of these trajectories are computed, the events are distributed in the time-trajectory space. All useful evidence for word-class identity is associated with events in the time-path space. When event times are made relative to a common time reference, such as syllable centers, and events from multiple instances of the same class are plotted in time-trajectory space, regions are formed that contain clusters of events. related.

As localizações, forma e escala destas regiões que contêm a- grupamentos são específicas à classe. Algumas destas regiões ficarão tão fortemente associadas com a classe que todos os eventos positivos da clas-The locations, shape, and scale of these regions that contain clusters are class-specific. Some of these regions will be so strongly associated with the class that all positive events in the class

se terão eventos que ficam dentro da região. Como explicado acima, um ob- jeto que não tenha um evento dentro desta região pode ser rejeitado como ' sendo membro de outra classe. Vários valores de característica podem ser associados com cada evento. As amplitudes de valores para cada uma das “ 5 características associadas com eventos de exemplos de classe positiva den- tro de uma região formam intervalos em dimensões adicionais do espaço. Um objeto tem que ter um evento com valores associados dentro da ampli- tude de toda dimensão de característica relevante para ser aceito como um membro da classe. As características que distinguem um objeto que não é daclassede todos os objetos da classe podem ser diferentes das caracterís- ticas que distinguem outro objeto que não é da classe de todos os objetos da classe.whether there will be events that are within the region. As explained above, an object that does not have an event within this region can be rejected as being a member of another class. Multiple characteristic values can be associated with each event. The ranges of values for each of the “5 features associated with class positive instance events within a region form intervals in additional dimensions of space. An object must have an event with associated values within the range of every relevant feature dimension to be accepted as a member of the class. The characteristics that distinguish an object that is not of the class from all objects of the class may be different from the characteristics that distinguish another object that is not of the class from all objects of the class.

De acordo com algumas modalidades da invenção, estas consi- 7 derações relevantes podem ser descobertas automaticamente para criar um detector. A figura 4 ilustra um fluxo de trabalho 400 para criar uma cascata : de detectores de acordo com algumas modalidades da invenção.In accordance with some embodiments of the invention, these relevant considerations can be discovered automatically to create a detector. Figure 4 illustrates a workflow 400 for creating a cascade of detectors in accordance with some embodiments of the invention.

O fluxo de trabalho 400 começa pela inicialização da cascata de detectores para conter zero estágios de detector 401. A seguir, todas as re- giões no espaço tempo-trajetória que contém eventos de todos os exemplos de treinamento positivos são identificadas e a quantidade de exemplos nega- tivos que tem eventos dentro de cada região identificada é computada 402.Workflow 400 starts by initializing the detector cascade to contain zero detector stages 401. Next, all regions in the time-trajectory space that contain events from all positive training examples are identified and the number of examples negative events that have events within each identified region are computed 402.

Em seguida, para cada região que contém eventos de todos os exemplos de treinamento positivo, a definição de regiões pode opcionalmen- te ser expandida para incluir dimensões de característica adicionais 403. Os limites da região para quaisquer dimensões adicionais são selecionados de modo que os mesmos incluam a amplitude total de valores dos exemplos positivos. Em seguida, exemplos negativos que não incluem valores de ca- racterística dentro de todas as amplitudes, assim estabelecidas, são rejeita- dos e o contador de exemplos negativos incluídos na região é reduzido de acordo 404. As dimensões adicionais, se houver alguma, são escolhidas para minimizar o contador de exemplos negativos incluídos dada a quanti- dade de dimensões. Isto significa que as dimensões de característica usa-Then, for each region that contains events from all positive training examples, the definition of regions can optionally be expanded to include additional feature dimensions 403. The region boundaries for any additional dimensions are selected so that they include the full range of values from the positive examples. Then negative examples that do not include feature values within all the ranges, thus established, are rejected and the counter of negative examples included in the region is reduced accordingly 404. Additional dimensions, if any, are chosen to minimize the count of negative examples included given the number of dimensions. This means that the feature dimensions used

das para diferentes regiões são aquelas que discriminam melhor e podem variar de região para região. ' Em seguida a região na lista que contém eventos da menor quantidade de exemplos de treinamento negativos é selecionada como um “ 5 estágio de cascata de detectores 405. Em algumas modalidades da inven- ção, uma quantidade máxima de estágios de detectores é predeterminada.data for different regions are the ones that best discriminate and may vary from region to region. ' Next, the region in the list that contains events from the least amount of negative training examples is selected as a '5 stage detector cascade 405. In some embodiments of the invention, a maximum number of detector stages is predetermined.

Adicionalmente, exemplos negativos sem eventos na região selecionada são eliminados de consideração adicional 406. Em seguida, o fluxo de trabalho faz pesquisa sobre quantos e- xemplos negativos restam 407. Se não existem mais exemplos negativos restantes, foi criada uma cascata de detectores que executa perfeitamente nos exemplos de treinamento, o fluxo de trabalho 400 fornece o detector 408 e para. - Se não existem menos exemplos negativos do que na iteração .: 15 anterior não pode ser feita melhoria adicional.Additionally, negative examples with no events in the selected region are eliminated from further consideration 406. Next, the workflow polls how many negative examples remain 407. If there are no more negative examples remaining, a detector cascade is created that runs perfectly in the training examples, workflow 400 provides detector 408 and para. - If there are no fewer negative examples than in the previous .:15 iteration, no further improvement can be made.

Neste caso, o fluxo de traba- : lho 400 remove o estágio recém-adicionado, transcreve o detector imperfeito 409, e para.In this case, workflow 400 removes the newly added stage, transcribes imperfect detector 409, and stops.

Ao contrário, se existem menos exemplos negativos do que na iteração anterior, então o fluxo de trabalho pesquisa se a quantidade máxima de estágios de detector foi adicionada 410. Se a quantidade máxima de es- tágios de detector foi adicionada à cascata, então o fluxo de trabalho 400 fornece um detector imperfeito 411 e para.Conversely, if there are fewer negative examples than in the previous iteration, then the workflow queries whether the maximum number of detector stages has been added 410. If the maximum number of detector stages has been added to the cascade, then the flow 400 provides an imperfect detector 411 and stops.

Se existem exemplos negativos remanescentes e se a quantida- de máxima de estágios de detector não foi alcançada, então o fluxo de traba- lho400 reitera e continua a construir a cascata de detectores através da in- clusão de estágios adicionais voltando à etapa 402. Após as cascatas de detectores serem criadas as mesmas são usadas de acordo com o método a seguir.If there are negative examples remaining and if the maximum number of detector stages has not been reached, then workflow400 reiterates and continues to build the detector cascade by adding additional stages back to step 402. After detector cascades are created they are used according to the following method.

Primeiro, são detectados eventos e dada uma referência comum como feito durante o processo de treinamen- to Em seguida, começando do primeiro estágio da cascata, os eventos na lista são avaliados para determinar se qualquer um está dentro da região.First, events are detected and given a common reference as done during the training process. Then, starting from the first stage of the cascade, the events in the list are evaluated to determine if any are within the region.

Se quaisquer eventos são considerados dentro da região, os eventos na lista são avaliados por estágios subsequentes desde que pelo menos um evento seja considerado dentro da região considerada por aquele estágio.If any events are considered within the region, the events in the list are evaluated by subsequent stages provided that at least one event is considered within the region considered by that stage.

A Em seguida, se o objeto tem eventos dentro das regiões de to- dos os estágios da cascata, o objeto é detectado como um membro da clas- “5 se Finalmente, se o objeto não tem eventos em qualquer um dos estágios, o mesmo é rejeitado como um membro da classe por aquele estágio e ne- nhum processamento adicional é executado.A Next, if the object has events within the regions of all stages of the cascade, the object is detected as a member of class “5 if Finally, if the object has no events in any of the stages, the same is rejected as a member of the class by that stage and no further processing is performed.

Nestes exemplos, regiões (hiper-) retangulares alinhadas ao eixo foram utilizadas.In these examples, axis-aligned (hyper-) rectangular regions were used.

Em algumas outras modalidades da invenção, outras confi- gurações de limites são usadas, tais como (hiper-) esferas, ou (hiper-) elip- ses ou misturas das formas de limites em diferentes regiões ou em diferen- tes dimensões.In some other embodiments of the invention, other boundary configurations are used, such as (hyper-) spheres, or (hyper-) ellipses or mixtures of boundary shapes in different regions or in different dimensions.

Além disso, podem ser usadas regiões (hiper-) retangulares que não são alinhadas ao eixo.In addition, rectangular (hyper-)rectangular regions that are not axis-aligned can be used.

Esta observação se aplica a todas as refe- . rências a detectores de átona. 2 A1s As figuras 5 a 6C ilustram vários exemplos de projeções de e- Ô ventos de exemplo de treinamento em um plano de valor de tempo- característica de acordo com algumas modalidades da invenção.This note applies to all references. ences to atonic detectors. 2 A1s Figures 5 through 6C illustrate various examples of training example e-Events projections onto a time-characteristic value plane in accordance with some embodiments of the invention.

A figura 5 ilustra um exemplo de uma região que contém eventos de todos os exem- plos positivos.Figure 5 illustrates an example of a region that contains events from all positive examples.

A figura 6A ilustra outro exemplo de uma região que contém eventos de todos os exemplos positivos.Figure 6A illustrates another example of a region that contains events from all positive examples.

A figura 6B ilustra uma região não alinhada que contém eventos de todos os exemplos positivos.Figure 6B illustrates a non-aligned region that contains events from all positive examples.

A figura 6C ilustra um exemplo de uma região não retangular que contém eventos de todos os exemplos positivos.Figure 6C illustrates an example of a non-rectangular region that contains events from all positive examples.

Melhorando a Generalização Através da Maximização da Margem Geométrica O método usado para identificar regiões no plano tempo- trajetória resulta em limites que são ajustados em volta dos eventos de e- xemplo de treinamento positivos contidos na região.Improving Generalization by Maximizing the Geometric Margin The method used to identify regions in the time-path plane results in limits that are adjusted around the positive training example events contained in the region.

Quando usado como um detector estes limites ajustados devem rejeitar casos em que os valores que são apenas ligeiramente diferentes dos eventos de exemplo de treina- mento nos limites externos da região.When used as a detector these fitted limits should reject cases where values that are only slightly different from the training example events at the outer limits of the region.

Se os limites são expandidos tanto quanto possível sem abranger eventos de exemplos negativos adicionais, o detector será capaz de detectar casos com valores similares, mas além da amplitude de valores de qualquer dos exemplos de treinamento positivos na região.If the limits are expanded as much as possible without covering events from additional negative examples, the detector will be able to detect cases with similar values, but beyond the range of values of any of the positive training examples in the region.

Entretanto, estes limites folgados ao máximo podem provocar detec- BR ções falsas de casos com valores que são apenas ligeiramente diferentes dos valores de eventos de exemplo negativo próximos aos limites.However, these slack limits to the maximum can cause false detections of cases with values that are only slightly different from the values of negative example events near the limits.

E: A generalização pode ser melhorada ajustando cada um dos |li- mites na região para maximizar a margem geométrica entre eventos de e- xemplo positivo detectado e eventos de exemplo negativo rejeitados.E: Generalization can be improved by adjusting each of the boundaries in the region to maximize the geometric margin between detected positive instance events and rejected negative instance events.

Os limi- tes de margem geométrica máximos ficam no meio do caminho entre os limi- tes mínimos ajustados e os limites máximos folgados.The maximum geometric margin limits are midway between the adjusted minimum limits and the loose maximum limits.

Maximizar as margens geométricas proporciona a melhor oportunidade para generalização para casos ocultos em exemplos de treinamento.Maximizing the geometric margins provides the best opportunity for generalization to hidden cases in training examples.

A figura 7 ilustra o relaciona- mento do limite geométrico máximo para os limites maximamente ajustado e maximamente folgado em uma projeção de uma região. é O Uso de Sequências de Categorias Gerais Confiáveis para Restringir Per- ' 15 cepções : Sistemas típicos de reconhecimento de voz trabalham através de reconhecimento de detalhes, tais como classes de fonemas ou subfone- ma, e com o uso destes detalhes para determinar padrões de nível mais alto, tais como palavras.Figure 7 illustrates the relationship of the maximum geometric limit to the maximally fitted and maximally loose limits in a projection of a region. is The Use of Reliable General Category Sequences to Constrain Perceptions: Typical speech recognition systems work by recognizing details, such as phoneme or subphoneme classes, and using these details to determine speech patterns. highest level, such as words.

Estes detalhes de baixo nível não são distinguidos com certeza, em vez disso são feitas estimativas de probabilidade para cada uma das classes dado um vetor de observação de valores de característica.These low-level details are not distinguished with certainty, instead probability estimates are made for each of the classes given an observation vector of characteristic values.

Mo- delos Markov Ocultos (HMM) usam as estimativas de probabilidade de clas- se juntamente com probabilidades de transição para computar a sequência mais provável de sons de voz pretendidos.Hidden Markov Models (HMM) use class probability estimates together with transition probabilities to compute the most likely sequence of intended speech sounds.

Embora a abordagem de "cons- truira partir dos detalhes" seja popular e razoavelmente eficaz, a mesma não resulta em sistemas de reconhecimento de voz automáticos que rivali- zem com o desempenho humano.While the "build from the detail" approach is popular and reasonably effective, it does not result in automated speech recognition systems that rival human performance.

Um dos inconvenientes desta abordagem é o fato de que classificações detalhadas não são muito confiáveis e preci- sam ser corrigidas aplicando níveis de contexto mais altos.One of the drawbacks of this approach is the fact that detailed classifications are not very reliable and need to be corrected by applying higher context levels.

Além disso, clas- sificações detalhadas são altamente dependentes de contexto, mas o con- texto não é conhecido quando se determina a identidade das classes de voz.Furthermore, detailed classifications are highly context-dependent, but the context is not known when determining the identity of voice classes.

Adicionalmente, o contexto pode ser representado de forma imprecisa ou com baixa confiabilidade. Além disso, estatísticas precisas são difíceis de estimar para detalhes em contextos que ocorrem raramente. Variações de ' condições acústicas ou na maneira de falar que não são representadas nas distribuições estatísticas do modelo fazem com que as estimativas estatísti- “5 cassetomnem imprecisas. Finalmente, o grande espaço de pesquisa de so- luções alternativas pode ser intratável computacionalmente. Tipicamente a pesquisa é reduzida por meios arbitrários tal como reter apenas os "n" mais prováveis. Os objetivos da presente invenção são superar os problemas e limitações inerentes na abordagem comum.Additionally, the context can be represented inaccurately or with low reliability. Furthermore, accurate statistics are difficult to estimate for details in contexts that rarely occur. Variations in acoustic conditions or speech that are not represented in the model's statistical distributions cause statistical estimates to be inaccurate. Finally, the large search space for alternative solutions can be computationally intractable. Typically the search is reduced by arbitrary means such as retaining only the most likely "n". The objects of the present invention are to overcome the problems and limitations inherent in the common approach.

Em geral, a classificação em categorias amplas pode ser execu- tada com mais segurança do que a classificação em categorias detalhadas. Por exemplo, distinguir entre um peixe e um pássaro pode ser feito com mais segurança do que determinar os tipos específicos de pássaros ou pei- r xes. Igualmente, no caso de reconhecimento de voz a categorização ampla p 15 —podeser executada com mais segurança do que categorização detalhada.In general, sorting into broad categories can be performed more safely than sorting into detailed categories. For example, distinguishing between a fish and a bird can be done more reliably than determining the specific types of birds or fish. Likewise, in the case of speech recognition, broad categorization p 15 —can be performed more safely than detailed categorization.

Í Adicionalmente, a percepção humana parece operar principal- mente em categorizações amplas e considerar detalhes apenas quando e- xiste uma razão para focalizar nos mesmos. Em voz contínua fluente, as pa- lavras apenas raramente são produzidas como o dicionário fala que as mesmas deveriam ser, mas isto causa poucos problemas para os ouvintes humanos desde que estejam presentes evidências suficientes para suportar uma percepção. Consequentemente, os ouvintes humanos podem tolerar substituições e omissões desde que aspectos da voz fiquem dentro de cate- gorias amplas confiáveis esperadas geralmente seguindo o sincronismo es- perado da voz.Í Additionally, human perception seems to operate mainly on broad categorizations and consider details only when there is a reason to focus on them. In a continuous fluent voice, words are only rarely produced as the dictionary says they should be, but this causes little problem for human listeners as long as sufficient evidence is present to support a perception. Consequently, human hearers can tolerate substitutions and omissions as long as aspects of the voice fall within the broad expected reliable categories generally following the expected timing of the voice.

Por exemplo, considerar a pergunta e resposta: "Why you cr- yin?", "See hit mel". A pergunta omitiu a palavra "are" e substituiu a sílaba "in" por "ing". Nenhuma destas mudanças tem muito efeito na percepção humana. Igualmente, a resposta deve ser mais provavelmente percebida como'"Shehitmel!" mesmo considerando que o som "sh" requerido tenha se tornado similar ao som de "s". A substituição e omissão de detalhes nestes exemplos têm pequeno efeito na percepção e provavelmente devem passar despercebidas por um ser humano. Parece que os padrões de sequências : de categorias amplas de sílabas são suficientes para indexar unidades per- . ceptivas que em muitos casos levam a uma percepção ambígua sem exigir identificação específica de classes detalhadas. “5 A invenção é baseada nas seguintes observações: * Em grande parte, o padrão de sequência de categorias am- plas de voz pode limitar as alternativas perceptivas possíveis. As alternativas perceptivas formam um agrupamento perceptivo.For example, consider the question and answer: "Why you cr-yin?", "See hit honey." The question omitted the word "are" and replaced the syllable "in" with "ing". None of these changes have much effect on human perception. Likewise, the answer is more likely to be perceived as '"Shehitmel!" even though the required "sh" sound has become similar to the "s" sound. The substitution and omission of details in these examples has little effect on perception and should probably go unnoticed by a human being. It seems that the sequence patterns : of broad categories of syllables are sufficient to index per- units. perceptions that in many cases lead to an ambiguous perception without requiring specific identification of detailed classes. “5 The invention is based on the following observations: * To a large extent, the sequence pattern of broad categories of speech can limit the possible perceptual alternatives. The perceptual alternatives form a perceptual grouping.

e A própria sequência de categorias de voz amplas pode ser usada para acessar diretamente a lista de alternativas perceptivas.e The broad voice categories string itself can be used to directly access the list of perceptual alternatives.

* Esforço computacional adicional é aplicado apenas quando necessário para diferenciar entre as alternativas remanescentes dentro de um agrupamento perceptivo.* Additional computational effort is applied only when necessary to differentiate between the remaining alternatives within a perceptual cluster.

- * Devido às alternativas no agrupamento serem conhecidas . 15 em tempo de treinamento, para cada agrupamento perceptivo o processo de i diferenciação pode ser otimizado para segurança máxima ou esforço compu- tacional mínimo. Consequentemente, as distinções mais seguras em qual- quer circunstância podem ser aplicadas. Isto significa que informação de várias fontes pode ser aplicada, incluindo estatísticas de palavra, prosódicos, gramática, etc.- * Because the alternatives in the cluster are known. 15 in training time, for each perceptual cluster the differentiation process can be optimized for maximum security or minimum computational effort. Consequently, the safest distinctions under any circumstances can be applied. This means that information from various sources can be applied, including word statistics, prosodics, grammar, etc.

e “Quando diferenciando entre percepções alternadas, a fonéti- ca e contextos da palavra das alternativas são conhecidos, deste modo limi- tando as computações para distinguir características para aquelas que são relevantes e mais seguras. Além disso, detectores e classificadores específi- cosde contexto podem ser usados para maior segurança.and “When differentiating between alternate perceptions, the phonetics and word contexts of the alternatives are known, thus limiting the computations to distinguish features to those that are relevant and safer. In addition, context-specific detectors and classifiers can be used for added security.

De acordo com estas modalidades, é apenas quando os padrões de sequência de categorias amplas não diferenciam completamente a per- cepção, que é exigido recorrer a detalhe. Mesmo neste caso é possível usar preferencialmente discriminações detalhadas que sejam conhecidas como maisseguras do que outras discriminações detalhadas. Por exemplo, consi- derar um padrão de sequência de categorias amplas de sílaba indexadas a duas percepções que foram distinguíveis uma da outra por diferentes fone-According to these modalities, it is only when the sequence patterns of broad categories do not completely differentiate perception, that recourse to detail is required. Even in this case it is possible to preferentially use detailed breakdowns that are known to be more secure than other detailed breakdowns. For example, consider a sequence pattern of broad syllable categories indexed to two perceptions that were distinguishable from each other by different phonemics.

33/57 . mas em duas localizações.33/57 . but in two locations.

Se um dos pares de fonemas era reconhecido como sendo mais seguramente distinguido do que o outro, a distinção deveIf one of the phoneme pairs was recognized as being more reliably distinguished than the other, the distinction must

' ser feita na classificação mais segura.' be made in the safest classification.

Igualmente, o contexto é muito importante para a percepção.Likewise, context is very important for perception.

Se Boa resposta no exemplo dado anteriormente tivesse sido "cuz see hit me!", poderia ser percebida como "cause, he hit me!". Os detalhes do segmento "see" não mudaram, mas a percepção não depende dos detalhes daquele segmento.If the Good response in the example given earlier had been "cuz see hit me!", it could be perceived as "cause, he hit me!". The details of the "see" segment have not changed, but perception does not depend on the details of that segment.

Em algumas modalidades da invenção, um algoritmo único é usado para classificar voz em agrupamentos perceptivos e diferenciar entre percepções alternativas através de acessar otimamente informação disponí- vel.In some embodiments of the invention, a unique algorithm is used to classify voice into perceptual clusters and differentiate between alternative perceptions through optimally accessing available information.

De acordo com estas modalidades, em cada etapa de tempo (ou seja, chegada de outro padrão de sílaba ou sílaba nula se não ocorre nenhuma voz dentro de um certo tempo), o algoritmo classifica a voz dentro de uma — 15 sequência de padrões amplos porém confiáveis, tais como categorias am- Í plas de sílabas.According to these modalities, at each time step (i.e. arrival of another syllable pattern or null syllable if no voice occurs within a certain time), the algorithm classifies the voice within a — 15 sequence of broad patterns but reliable, such as broad syllable categories.

Em seguida, cada categoria ampla é associada com um número de categoria.Then, each broad category is associated with a category number.

Preferencialmente, categorias similares têm designa- dos números similares.Preferably, similar categories are assigned similar numbers.

Em seguida, o algoritmo mapeia sequências de categorias am- plasem padrões de percepção usando os números de categoria como coor- denadas no espaço de estado.The algorithm then maps broad category sequences into perceptual patterns using the category numbers as state space coordinates.

Cada ponto no espaço de estado é associa- do com um agrupamento perceptivo e uma estratégia de diferenciação.Each point in state space is associated with a perceptual grouping and differentiation strategy.

A estratégia de diferenciação, estabelecida durante o treinamento, é uma sequência de etapas a ser executada quando o agrupamento perceptivo é acessado.The differentiation strategy, established during training, is a sequence of steps to be performed when the perceptual cluster is accessed.

O propósito da estratégia de diferenciação é diferenciar entre per- cepções alternativas para acessar informação disponível otimamente.The purpose of the differentiation strategy is to differentiate between alternative perceptions to optimally access available information.

A es- tratégia de diferenciação é determinada através de avaliação de exigências computacionais e sucesso de várias técnicas de diferenciação aplicadas em diferentes ordens e em diferentes combinações.The differentiation strategy is determined by evaluating computational requirements and the success of various differentiating techniques applied in different orders and in different combinations.

O resultado final de aplicar a estratégia é uma redução de percepções alternativas para uma pequena quantidade, preferencialmente uma.The end result of applying the strategy is a reduction of alternative perceptions to a small amount, preferably one.

Se as alternativas são reduzidas a uma única percepção, a per-If the alternatives are reduced to a single perception, the

cepção é ativada. Em um sistema de voz para texto isto envolve fornecer as palavras que correspondem à percepção. Em um sistema controlado por , VOZ, as ações associadas com a percepção devem ser executadas. Se as alternativas não são reduzidas a uma única percepção e “5 um limite máximo de latências foi atingido, a percepção mais provável é aceita como a percepção e ações são geradas de acordo. Se o limite máxi- mo de latência não foi alcançado as percepções alternativas restantes são retidas e interagem com etapas subsequentes no tempo tanto para ajudar na diferenciação de percepções nestas etapas como para serem diferenciadas através da informação disponível nestas etapas no tempo. Mecanismo de Reconhecimento de Voz Automático Nas modalidades atualmente preferenciais da invenção, é forne- cido um aparelho para executar todos os aspectos originais da invenção. Ss Nas modalidades atualmente preferenciais da invenção, o sistema de reco- — 15 nhecimento de voz automático é usado em criação de legendas (closed cap- Ú tioning) de televisão em tempo real e ambientes de detecção de palavra.ception is activated. In a speech-to-text system this involves providing the words that correspond to the perception. In a system controlled by VOICE, actions associated with perception must be performed. If the alternatives are not reduced to a single perception and “5 a maximum latency threshold has been reached, the most likely perception is accepted as the perception and actions are generated accordingly. If the maximum latency threshold has not been reached, the remaining alternative insights are retained and interact with subsequent steps in time both to help differentiate perceptions at these steps and to be differentiated through the information available at these steps in time. Automatic Speech Recognition Mechanism In the presently preferred embodiments of the invention, an apparatus is provided for carrying out all original aspects of the invention. In the presently preferred embodiments of the invention, the automatic speech recognition system is used in closed captioning of real-time television and word detection environments.

A figura 8A ilustra uma representação de um sistema automático de voz para texto 800 que compreende extração baseada em evento e reco- nhecimento em uma escala de sílaba de classificações amplas de sílaba.Figure 8A illustrates a representation of an automated speech-to-text system 800 that comprises event-based extraction and recognition on a syllable scale of broad syllable classifications.

Osistema automático de texto para voz 800 usa padrões de sequências de classificações amplas de sílaba para indexar em listas de unidades percepti- vas com referencia ao nível de detalhe de fonema apenas quando necessá- rio para diferenciação. Nas modalidades atualmente preferenciais da inven- ção, o sistema automático de texto para voz 800 escolhe quais classífica- ções de fonema fazer ou escolhe outros métodos de diferenciação para em- pregar baseado na segurança destas classificações ou métodos.The 800 automatic text-to-speech system uses syllable-wide classification sequence patterns to index into lists of perceptual units with reference to phoneme level of detail only when necessary for differentiation. In currently preferred embodiments of the invention, the automatic text-to-speech system 800 chooses which phoneme classifications to make or chooses other differentiation methods to employ based on the security of those classifications or methods.

O sistema automático de texto para voz 800 inclui um analisador acústico 802. O analisador acústico recebe um sinal de voz de entrada 801 e digitaliza o dito sinal de entrada 801. O analisador acústico 802 é acoplado — opcionalmente com um analisador prosódico 803 e com um extrator de e- vento 804. Em algumas modalidades da invenção, o sinal digitalizado é pro- cessado pelo analisador prosódico 803, deste modo extraindo várias carac-The automatic text-to-speech system 800 includes an acoustic analyzer 802. The acoustic analyzer receives an input speech signal 801 and digitizes said input signal 801. The acoustic analyzer 802 is coupled — optionally with a prosodic analyzer 803 and with a event extractor 804. In some embodiments of the invention, the digitized signal is processed by the prosodic analyzer 803, thereby extracting various characters.

terísticas linguísticas do orador que incluem, mas não estão limitadas a rit- mo, tensão, entonação, ou outra informação prosódica que reflete: o estado ' emocional do orador; se a expressão é uma afirmativa, pergunta ou coman- do; ironia; sarcasmo; ênfase; foco; etc. De acordo com estas modalidades, a “5 informação prosódica e o sinal digitalizado são enviados para o extrator de evento 804.the speaker's linguistic characteristics that include, but are not limited to, rhythm, tension, intonation, or other prosodic information that reflects: the speaker's emotional state; whether the expression is a statement, question or command; irony; sarcasm; emphasis; focus; etc. According to these modalities, the “5 prosodic information and the digitized signal are sent to the event extractor 804.

O extrator de evento 804 compreende um mecanismo de pro- cessamento para identificar automaticamente regiões em uma pluralidade de sinais de voz que contém padrões de evento e extrair os ditos eventos para reconhecimento de voz. Nas modalidades atualmente preferenciais da in- venção, os processos e métodos descritos acima para reconhecimento e extração de evento são empregados pelo extrator de evento 804. O extrator de evento 804 é acoplado a uma memória de evento de curto prazo 805 pa- Ff ra armazenar os eventos de voz extraídos. A memória de evento de curto — 15 prazo 805 é acoplada com uma pluralidade de módulos de processamento : de fluxo de evento para texto para usar os eventos extraídos para fornecer um fluxo de texto resultante. Nas modalidades atualmente preferenciais da invenção, os módulos de processamento de fluxo de evento para texto com- preendem um detector de núcleo de sílaba 806, um categorizador de sílaba 807,um módulo de indexação perceptiva de sequência de sílaba 808, e um módulo de categorização de detalhe de subsílaba 809. Os módulos de pro- cessamento de fluxo de evento para texto fornecem um fluxo de texto com informação prosódica adicionada 811 embutida no mesmo.Event extractor 804 comprises a processing mechanism for automatically identifying regions in a plurality of speech signals that contain event patterns and extracting said events for speech recognition. In the currently preferred embodiments of the invention, the processes and methods described above for event recognition and extraction are employed by the event extractor 804. The event extractor 804 is coupled to a short-term event memory 805 to store the extracted voice events. The short-term event memory 805 is coupled with a plurality of event-to-text processing modules to use the extracted events to provide a resulting text stream. In currently preferred embodiments of the invention, the event stream processing modules for text comprise a syllable head detector 806, a syllable categorizer 807, a syllable sequence perceptual indexing module 808, and a categorization module. subsyllable detail 809. Event stream processing modules for text provide a text stream with added prosodic information 811 embedded in it.

O sistema automático de texto para voz 800 mostrado na figura 8A compreende um exemplo de um aparelho para reconhecimento de voz automático e para melhorar o mesmo. Ficará prontamente aparente para os versados na técnica tendo o benefício desta descrição que qualquer quanti- dade de sistemas, configurações, componentes de hardware, etc. pode ser usada para executar estes métodos e processos para reconhecimento de voz automático e para melhorar o mesmo.The automatic text-to-speech system 800 shown in Figure 8A comprises an example of an apparatus for automatic speech recognition and for improving the same. It will be readily apparent to those skilled in the art having the benefit of this disclosure that any number of systems, configurations, hardware components, etc. can be used to perform these methods and processes for automatic speech recognition and to improve the same.

A figura 8B ilustra uma representação de um sistema de voz pa- ra texto automático 820 que compreende um mecanismo de reconhecimento de voz 824 para processar um sinal de voz de entrada 821 de acordo com algumas modalidades da invenção. Nas modalidades atualmente preferenci- . ais da invenção, um analisador acústico 822 recebe o sinal de voz de entra- da 821 e digitaliza o dito sinal de voz de entrada 821. O analisador acústico “ 5 822 é acoplado com o analisador prosódico 823 e com um mecanismo de reconhecimento de voz 824. Em algumas modalidades da invenção, o sinal digitalizado é processado através do analisador prosódico 823, deste modo extraindo a informação prosódica, como explicado acima. Nas modalidades atualmente preferenciais da invenção, o me- canismo de reconhecimento de voz 824 compreende uma pluralidade de módulos de processamento para executar várias etapas do processamento de reconhecimento de voz. Como mostrado, o mecanismo de reconhecimen- to de voz 824 compreende: um extrator de evento 825; um identificador de . padrão 826; um filtro de região átona 827; um simplificador de conjunto re- 2 15 forçado 828; um identificador de sequência de evento 829; um detector de i indicador alternativo 830; um criador de conjunto de detectores de cascata 831; um generalizador de voz 832; e um módulo de diferenciação de agru- pamento perceptivo 833. Embora módulos de processamento específicos sejam listados neste documento, ficará prontamente aparente para os ver- sados na técnica tendo o benefício desta descrição que quaisquer ferramen- tas de reconhecimento de voz, conhecidas atualmente ou desenvolvidas posteriormente, podem ser incorporadas como um módulo de processamen- to no mecanismo de reconhecimento de voz 824.Figure 8B illustrates a representation of a speech-to-text system 820 comprising a speech recognition engine 824 for processing an input speech signal 821 in accordance with some embodiments of the invention. In the currently preferred modalities. Further to the invention, an acoustic analyzer 822 receives the input speech signal 821 and digitizes said input speech signal 821. The acoustic analyzer 822 is coupled with the prosodic analyzer 823 and with a speech recognition mechanism. 824. In some embodiments of the invention, the digitized signal is processed through prosodic analyzer 823, thereby extracting prosodic information, as explained above. In presently preferred embodiments of the invention, speech recognition engine 824 comprises a plurality of processing modules for performing various steps of speech recognition processing. As shown, the speech recognition mechanism 824 comprises: an event extractor 825; an identifier of . default 826; an unstressed region filter 827; a forced set simplifier 828; an 829 event sequence identifier; an alternative indicator detector 830; a cascade detector array creator 831; an 832 speech generalizer; and a perceptual cluster differentiation module 833. Although specific processing modules are listed in this document, it will be readily apparent to those skilled in the art having the benefit of this disclosure that any speech recognition tools, currently known or developed later, can be incorporated as a processing module into the 824 speech recognition engine.

Em algumas modalidades da invenção, o extrator de evento 825 compreende um módulo de reconhecimento de voz baseado em evento para construir um esquema de classificadores ponderado para uso em mecanis- mo de reconhecimento de voz 824. Em algumas modalidades da invenção, o identificador de padrão 826 identifica automaticamente regiões em uma plu- ralidade de sinais de voz que contém padrões de evento. Em algumas mo- dalidades da invenção, o filtro de região átona 827 empregou diversas técni- cas para filtrar regiões que são improváveis de resultar em detectores de átona robustos. Em algumas modalidades da invenção, o simplificador de conjunto reforçado 828 reduz a complexidade dos conjuntos de detector cri- ados através de algoritmos de reforço adaptativos. Em algumas modalidades . da invenção, o identificador de evento 829 detecta sequências de eventos em vez de, ou adicionalmente a, detecção de eventos individuais. Em algumas “5 modalidades da invenção, o detector de indicador alternativo 830 reconhece indicadores de voz alternativos quando aspectos de sinal de voz são corrom- pidos. Em algumas modalidades da invenção, o criador de conjunto de detec- tor de cascata 831 cria automaticamente conjuntos de detectores. Em algu- mas modalidades da invenção, o generalizador de voz 832 melhora a genera- lização através da maximização da margem geométrica, como explicado aci- ma. Em algumas modalidades da invenção, o módulo de diferenciação de a- grupamento perceptivo 833 diferencia voz usando agrupamento perceptivo, como explicado acima. De acordo com estas modalidades da invenção, o já mecanismo de reconhecimento de voz 824 fornece dados de voz. 215 Em algumas modalidades da invenção, os dados de voz reco- Í nhecidos são armazenados em um ou mais bancos de dados 834, em que o um ou mais bancos de dados 834 é preferencialmente acoplado com uma rede 835. Em algumas outras modalidades da invenção, os dados de voz reconhecidos são automaticamente enviados para uma memória de evento decurto prazo 836 para processamento de voz para texto.In some embodiments of the invention, event extractor 825 comprises an event-based speech recognition module for building a weighted classifier scheme for use in speech recognition engine 824. In some embodiments of the invention, the pattern identifier 826 automatically identifies regions in a plurality of voice signals that contain event patterns. In some embodiments of the invention, the 827 unstressed region filter employed various techniques to filter out regions that are unlikely to result in robust unstressed detectors. In some embodiments of the invention, the boosted set simplifier 828 reduces the complexity of detector sets created through adaptive boosting algorithms. In some modalities. of the invention, event identifier 829 detects sequences of events instead of, or in addition to, detecting individual events. In some embodiments of the invention, alternate indicator detector 830 recognizes alternate voice indicators when aspects of the speech signal are corrupted. In some embodiments of the invention, the cascade detector array 831 automatically creates detector arrays. In some embodiments of the invention, the 832 speech generalizer improves generalization by maximizing the geometric margin, as explained above. In some embodiments of the invention, the perceptual cluster differentiation module 833 differentiates voice using perceptual clustering, as explained above. In accordance with these embodiments of the invention, the voice recognition engine 824 already provides voice data. In some embodiments of the invention, the recognized voice data is stored in one or more databases 834, wherein the one or more databases 834 is preferably coupled with a network 835. In some other embodiments of the invention , the recognized speech data is automatically sent to a short-term event memory 836 for speech-to-text processing.

Em algumas modalidades da invenção, a memória de evento de curto prazo 836 é acoplada com a pluralidade de módulos de processamento de evento para texto para usar os eventos extraídos para fornecer um fluxo de texto resultante. Nas modalidades atualmente preferenciais da invenção, os módulos de processamento de evento para texto compreendem um de- tector de núcleo de sílaba 837, um categorizador de sílabas 838, um módulo de indexação perceptiva de sequência de sílabas 839, e um módulo de ca- tegorização de detalhe de subsílaba 840. Os módulos de processamento de fluxo de evento para texto fornecem um fluxo de texto com informação pro- sódica adicionada 841 embutida no mesmo.In some embodiments of the invention, short-term event memory 836 is coupled with the plurality of text event processing modules to use the extracted events to provide a resulting text stream. In currently preferred embodiments of the invention, the event processing modules for text comprise a syllable head detector 837, a syllable categorizer 838, a syllable sequence perceptual indexing module 839, and a categorization module. subsyllable detail 840. Event stream processing modules for text provide a text stream with added prosodic information 841 embedded in it.

Em algumas outras modalidades da invenção, é fornecido um aparelho para extrair dados de eventos a partir de um sinal de voz e detec-In some other embodiments of the invention, an apparatus is provided for extracting event data from a speech signal and detecting it.

ção de palavra no mesmo. A figura 8C ilustra uma representação de um sis- tema 850 para reconhecimento de evento e detecção de palavra que com- - preende extração baseada em evento e reconhecimento de palavras especí- ficas. O sistema de voz para texto automático 850 inclui um analisador acús- “5 tico852parareceber um sinal de voz de entrada 851. O analisador acústico 852 é opcionalmente acoplado com um analisador prosódico 853 e com um extrator de evento 854. O extrator de evento 854 compreende um mecanis- mo de processamento para identificar automaticamente regiões em uma plu- ralidade de sinais de voz que contém padrões de evento e extrair os ditos eventos para detecção de palavra. O extrator de evento 854 é acoplado com uma memória de evento de curto prazo 855 para armazenar os eventos de voz extraídos. A memória de evento de curto prazo 855 é acoplada com uma pluralidade de módulos de processamento de detecção de palavra. Em al- s gumas modalidades da invenção, os módulos de processamento de detec- 2 15 çãode palavra compreendem um detector de núcleo de sílaba 856 e um de- : tector de palavra 857. Os módulos de processamento de detecção de pala- vra iniciam uma ou mais ações quando uma palavra é detectada. O segundo módulo de processamento 862 compreende um classificador de rede neural pulsada. A informação usada para percepção de voz não é uniformemente distribuída em frequência, amplitude e tempo. Pa- drões temporais são muito importantes para reconhecimento de voz. As re- des neurais pulsadas permitem codificação da informação da voz em pa- drões temporais de pulsos e as estruturas de memória indistintas permitem tolerância de variabilidade temporal. O terceiro módulo de processamento 863 compreende um ou mais mecanismos de reconhecimento de voz con- secutivos, como explicado abaixo. O sistema de voz para texto alternativo 860 também inclui um analisador acústico 866 para analisar e digitalizar sinais de voz de entradaword tion in it. Figure 8C illustrates a representation of a system 850 for event recognition and word detection that comprises event-based extraction and recognition of specific words. The 850 speech-to-text system includes an 852 acoustic analyzer 5 to receive an 851 input speech signal. The 852 acoustic analyzer is optionally coupled with a prosodic analyzer 853 and an event extractor 854. The event extractor 854 comprises a processing mechanism for automatically identifying regions in a plurality of speech signals that contain event patterns and extracting said events for word detection. Event extractor 854 is coupled with short-term event memory 855 to store the extracted voice events. Short-term event memory 855 is coupled with a plurality of word detection processing modules. In some embodiments of the invention, the word detection processing modules 215 comprise a syllable core detector 856 and a word detector 857. The word detection processing modules initiate a or more actions when a word is detected. The second processing module 862 comprises a pulsed neural network classifier. The information used for speech perception is not evenly distributed in frequency, amplitude and time. Temporal patterns are very important for speech recognition. Pulsed neural networks allow coding of voice information in temporal patterns of pulses and indistinct memory structures allow tolerance of temporal variability. The third processing module 863 comprises one or more consecutive speech recognition engines, as explained below. The 860 Voice to Alternative Text System also includes an 866 Acoustic Analyzer to analyze and digitize incoming voice signals.

867. Os sinais de voz digitalizados são processados por um ou mais dos três módulos de processamento 861, 862 ou 863 e os resultados são alimenta- dos para um módulo de decisão 868, que escolhe os resultados melhor re- conhecidos e entrega uma saída de texto 869.867. The digitized voice signals are processed by one or more of the three processing modules 861, 862, or 863 and the results are fed to a decision module 868, which chooses the best recognized results and delivers an output of text 869.

Algumas modalidades da invenção envolvem segmentação de um sinal de voz em localizações importantes perceptivamente. Isto propor- : ciona um meio para extrair não apenas sincronizações relevantes percepti- vamente, mas também sincronizar a análise do sinal com eventos de voz, “5 deste modo evitando todos os problemas de análise de quadro fixo assín- crono, como discutido acima.Some embodiments of the invention involve segmenting a speech signal at perceptually important locations. This provides a means to extract not only perceptually relevant synchronizations, but also to synchronize the signal analysis with speech events, “5 thus avoiding all the problems of asynchronous fixed-frame analysis, as discussed above.

O método primeiro executa um filtro de pré-segmentação usando filtros de baixa complexidade que são baseados em certos aspectos da per- cepção humana e no nos fenômenos de voz que os mesmos são projetados para detectar. Estes filtros detectam as localizações dos padrões percepti- veis indicativos de começo, término, rajadas, pulsos glotais, e outros eventos de sinal de voz significativos.The method first performs a pre-segmentation filter using low-complexity filters that are based on certain aspects of human perception and the voice phenomena they are designed to detect. These filters detect the locations of perceptible patterns indicative of start, end, bursts, glottal pulses, and other significant speech signal events.

A filtragem de evento pré-segmentação define intervalos que são s usados para sincronizar certas computações de categorias. Os padrões de 2 15 características que tiverem sido extraídos sincronamente são adicionalmente i processados para criar características sobre escalas de tempo mais longas e detectar níveis ainda mais altos de eventos perceptivos tais como limites de fonema, núcleo de sílaba, etc.Pre-segmentation event filtering defines ranges that are used to synchronize certain category computations. The patterns of 2 15 features that have been extracted synchronously are further processed to create features over longer time scales and detect even higher levels of perceptual events such as phoneme boundaries, syllable head, etc.

A figura 9 ilustra um exemplo de segmentações de um sinal de voz de acordo com algumas modalidades da invenção. O sinal de voz da figura 9 contém a expressão "Once". O sinal muda de feitio diversas vezes ao longo do curso da expressão de formas que são visualmente aparentes quando visualizando a forma da onda. As segmentações indicadas pelas marcas verticais curtas no fundo do gráfico correspondem a eventos de pul- soglotal durante a parte "sonora" da palavra.Figure 9 illustrates an example of segmentations of a speech signal according to some embodiments of the invention. The voice signal in figure 9 contains the expression "Once". The signal changes shape several times over the course of the expression in ways that are visually apparent when viewing the waveform. The segmentations indicated by the short vertical marks at the bottom of the graph correspond to glottal pulse events during the "sound" part of the word.

As linhas verticais longas correspondem a vários tipos de even- tos de limite de som de voz. Para referência, os rótulos dos segmentos fo- ram colocados no gráfico que indica a identidade fonética do segmento. As condições do sinal nas transições entre fonemas variam pelo tipo de transi- ção Em alguns limites a energia total muda abruptamente, enquanto para outros mudanças espectrais são associadas com o evento. Tomados em conjunto, estes vários eventos permitem que extração de característica seja executada sincronamente com os eventos de voz e fornecem segmentação relevante perceptivamente. : Em algumas modalidades da invenção, a segmentação de sinal é baseada em diferenças perceptivas presentes no sinal de voz.The long vertical lines correspond to various types of voice sound threshold events. For reference, segment labels have been placed on the graph that indicates the phonetic identity of the segment. Signal conditions at transitions between phonemes vary by type of transition. At some thresholds the total energy changes abruptly, while at others spectral changes are associated with the event. Taken together, these various events allow feature extraction to be performed synchronously with speech events and provide perceptually relevant segmentation. : In some embodiments of the invention, signal segmentation is based on perceptual differences present in the speech signal.

Frequente- “5 mente, ainformação usada para percepção de voz não é distribuída unifor- memente no tempo.Often, the information used for voice perception is not evenly distributed in time.

A percepção humana é sensível a mudanças em estí- mulos.Human perception is sensitive to changes in stimuli.

Em sinais temporais tais como voz, as localizações de tempo de mu- danças significativas (ou seja, eventos), proporcionam a organização per- ceptiva do sinal.In temporal signals such as voice, the time locations of significant changes (ie, events) provide the perceptual organization of the signal.

O sincronismo relativo dos eventos e as características dos estímulos em sua vizinhança codificam muito da informação perceptiva.The relative timing of events and the characteristics of stimuli in their vicinity encode much of the perceptual information.

Em geral, as percepções de magnitude não são lineares.In general, perceptions of magnitude are not linear.

Por exemplo, é sabido que a percepção da intensidade de som é logarítmica e medida comumente em decibéis.For example, it is known that the perception of sound intensity is logarithmic and commonly measured in decibels.

Pode ser demonstrado que, para uma ampla gama de percep- F ções, a diferença apenas perceptível no estímulo é relacionada ao nível ori- 2 15 ginaldo estímulo.It can be shown that, for a wide range of perceptions, the barely perceptible difference in the stimulus is related to the original level of the stimulus.

Entretanto, isto não se sustenta nos extremos e não existe percepção na extremidade inferior até que o nível de estímulo alcance um nível mínimo para ativação neural.However, this does not hold at the extremes and there is no perception at the low end until the stimulus level reaches a minimum level for neural activation.

Na extremidade superior, uma vez que os neurônios comecem a saturar, aumentos adicionais no estímulo não são percebidos.At the upper end, once neurons begin to saturate, further increases in stimulus are not perceived.

Na amplitude operacional, para muitos tipos de estímulo, a mu- dança necessária para uma resposta perceptiva pode ser aproximada pela lei de Weber: K = Al / lo; em que lo é o nível de estímulo original, Al é a mu- dança no nível de estímulo, e K é constante determinada empiricamente que define o limite da diferença apenas perceptível.In the operational range, for many types of stimuli, the change required for a perceptual response can be approximated by Weber's law: K = Al / lo; where lo is the original stimulus level, Al is the change in stimulus level, and K is an empirically determined constant that defines the threshold of the barely perceptible difference.

O lado direito da formulação da lei de Weber pode ser reconhe- —cidocomo contraste.The right side of Weber's law formulation can be recognized as a contrast.

Na presente invenção, eventos são declarados (ou se- ja, o detector dispara) quando a mudança em uma característica relevante excede um limite perceptível.In the present invention, events are declared (ie, the detector trips) when the change in a relevant characteristic exceeds a perceptible threshold.

Na presente invenção, a mudança perceptiva é computada com o uso de um cálculo de contraste perceptivo relacionado à lei de Weber.In the present invention, perceptual change is computed using a Weber's law-related perceptual contrast calculation.

A figura 10 ilustra uma fórmula de contraste perceptivo usada para computar mudança perceptiva de acordo com algumas modalidades da invenção.Figure 10 illustrates a perceptual contrast formula used to compute perceptual change in accordance with some embodiments of the invention.

Nesta fórmula, o denominador da relação do lado direito difere da formulação padrão da lei de Weber de duas formas: a mesma inclui a soma dos valores que são contrastados e a mesma inclui um fator adicional e.In this formula, the denominator of the right-hand relationship differs from the standard formulation of Weber's law in two ways: it includes the sum of the values that are contrasted, and it includes an additional factor e.

O . fator e inibe a ativação em níveis muito baixos para simular melhor a respos- ta perceptiva para estímulos de muito baixo nível.THE . factor and inhibits activation at very low levels to better simulate the perceptual response to very low-level stimuli.

O mesmo também torna a “5 fórmula numericamente estável evitando uma divisão por zero quando ne- nhum estímulo está presente.It also makes the “5 formula numerically stable by avoiding division by zero when no stimulus is present.

A inclusão da soma dos valores contrastantes nivela adicional- mente a resposta de contraste perceptivo em níveis muito baixo e muito alto.Including the sum of the contrast values additionally flattens the perceptual contrast response at very low and very high levels.

Para cada característica perceptiva medida (por exemplo, energia ou fre- quência), valores apropriados de € e limites perceptivos são estabelecidos empiricamente.For each perceptual characteristic measured (eg energy or frequency), appropriate values of € and perceptual thresholds are empirically established.

Em algumas modalidades da invenção, é criada uma plurali- dade de detectores de eventos perceptivos heterogêneos, em que cada um é baseado em alguma característica de sinal particular, medida em alguma Li escala de tempo particular, e com seu € e limites perceptivos particulares. 215 Os detectores de eventos da invenção operam em vários aspec- tos do sinal em várias escalas.In some embodiments of the invention, a plurality of heterogeneous perceptual event detectors are created, each one based on some particular signal characteristic, measured on some particular time scale, and with its particular perceptual thresholds and thresholds. 215 The event detectors of the invention operate on various aspects of the signal at various scales.

Primeiro, a pré-segmentação é executada através do processamento de valores de energia através de filtros de baixa complexidade que detectam as localizações temporais das rajadas, fecha- mentos e pulsos glotais.First, pre-segmentation is performed by processing energy values through low-complexity filters that detect the temporal locations of bursts, closes and glottal pulses.

A extração de características então é executada relativa aos eventos de pré-segmentação.Feature extraction is then performed relative to pre-segmentation events.

Filtros e detectores adicionais são aplicados às características extraídas sincronamente para extrair caracterís- ticas e eventos de alto nível.Additional filters and detectors are applied to the synchronously extracted features to extract high-level features and events.

Técnicas de Processamento e Extração de Característica Adicional Memória de Fila Circular Segmentada Diversos componentes de detectores de evento envolvem com- parações de somas de valores de características computadas com o uso de janela de análise de várias extensões, alinhadas em relacionamentos tempo- rais específicos uma com respeito à outra.Additional Feature Processing and Extraction Techniques Segmented Circular Queue Memory Several event detector components involve comparisons of sums of feature values computed using multi-extent analysis windows, aligned in specific temporal relationships with one another. respect to the other.

Para minimizar a carga computa- cional dos detectores de evento estas somas são mantidas com o uso de uma memória de fila circular segmentada.To minimize the computational load of event detectors these sums are maintained using a segmented circular queue memory.

Uma fila circular é uma estrutura de memória do tipo, primeiro a entrar primeiro a sair (FIFO) onde nova in- formação é gravada na memória em |, o índice da informação mais antiga na memória. Após gravar a nova informação na memória o Índice lo é avan- çado um módulo do tamanho da memória (ou seja, o Índice ly volta para zero ; quando chega ao fim da memória). As somas correntes dos valores na me- mória podem ser mantidas de acordo com o processo descrito abaixo.A circular queue is a first-in-first-out (FIFO) memory structure where new information is written to memory at |, the index of the oldest information in memory. After writing the new information into memory, the Index lo is advanced one module the size of memory (ie, the Index ly goes back to zero; when it reaches the end of memory). Running sums of values in memory can be maintained according to the process described below.

a: Primeiro, inicializam-se as localizações de memória de fila circu- lar, a soma corrente, e o Índice ly para zero. Em seguida, em cada etapa: subtrai-se o valor indexado a partir da soma corrente; adiciona-se o novo valor a soma corrente; grava-se o novo valor dentro da fila circular e avança- se o Índice ly um módulo da dimensão da memória.a: First, we initialize the circular queue memory locations, the running sum, and the index ly to zero. Then, in each step: the indexed value is subtracted from the running sum; the new value is added to the running sum; the new value is written into the circular queue and the Index ly is advanced by one module of the memory size.

A operação de uma fila circular e sua utilidade para a comutação eficiente de somas correntes é ilustrada nas figuras 11A a 11C. A figura 11A ilustra uma memória de fila circular de acordo com algumas modalidades da invenção. Na figura 11A, uma memória de fila circular de 5 elementos é re- presentada no momento "t" quando um novo valor, "7", está para ser grava- — 15 do. O novo valorirá sobrescrever o mais velho na memória que, no exemplo ilustrado, tem um valor de "9". Antes de gravar o novo valor, a soma dos va- lores na memória de exemplo é 25. Devido ao novo valor sobrescrever o valor mais antigo, a soma corrente pode ser mantida através da subtração do valor antigo e soma do valor novo. Como pode ser visto prontamente, a complexidade computacional de manter somas correntes desta maneira é independente da dimensão da memória. Apenas uma subtração e uma adi- ção são requeridas independente do tamanho da memória.The operation of a circular queue and its utility for efficiently switching running sums is illustrated in Figures 11A through 11C. Figure 11A illustrates a circular row memory in accordance with some embodiments of the invention. In Figure 11A, a 5-element circular row memory is represented at time "t" when a new value, "7", is about to be written. The new value will overwrite the oldest in memory which, in the illustrated example, has a value of "9". Before writing the new value, the sum of the values in the example memory is 25. Because the new value overwrites the oldest value, the current sum can be maintained by subtracting the old value and adding the new value. As can readily be seen, the computational complexity of maintaining running sums in this way is independent of the memory size. Only one subtraction and one addition are required regardless of memory size.

A figura 11B e a figura 11C ilustram uma memória de fila circular atualizada de acordo com algumas modalidades da invenção. Mais especifi- camente, a figura 11B e a figura 11C mostram o processo de atualização continuando através das duas próximas etapas. Para manter somas corren- tes de valores sobre várias subseções de memória, a fila circular é segmen- tada através do uso de índices adicionais, cada um dos quais tem um deslo- camento fixo a partir do índice l. Cada uma das subseções de soma corren- teé mantida simplesmente pela subtração do valor que está próximo a ser retirado da subseção e adição do valor que está próximo a se tornar parte da subseção.Figure 11B and Figure 11C illustrate an updated circular queue memory in accordance with some embodiments of the invention. More specifically, Figure 11B and Figure 11C show the update process continuing through the next two steps. To maintain running sums of values over various subsections of memory, the circular queue is segmented using additional indices, each of which has a fixed offset from index l. Each of the running sum subsections is maintained by simply subtracting the value that is about to be taken out of the subsection and adding the value that is about to become part of the subsection.

A figura 12 ilustra uma fila circular segmentada para manter duas somas correntes de acordo com algumas modalidades da invenção. À . fila circular segmentada é disposta para facilitar a manutenção de duas so- mas correntes, uma computada para a metade mais antiga dos valores na “5 filacircula (ou seja, subseção A) e a outra computada para a metade mais recente dos valores na fila circular (ou seja, subseção B). Estas somas são referenciadas como Z, e £g respectivamente. Agora existe um segundo índi- ce |; mantido em um deslocamento igual a uma metade da dimensão da memória a partir do índice lo. Em cada etapa no tempo o valor indexado por lp (ou seja, o valor mais antigo em toda a memória) é subtraído de 3, e o valor indexado por |; é somado a Za, enquanto o valor indexado por |, é subtraído de Xg e o novo valor a ser escrito na memória é somado a ?g. O novo valor é gravado na localização no índice lo, e os índices | e |; são em seguida incrementados um módulo do tamanho da memória. No exemplo . 15 agora apresentado, as subseções da memória são de dimensão igual, for- mam conjuntos desmembrados, e juntas cobrem a memória inteira. Nenhu- ma destas condições é exigida pelo método.Figure 12 illustrates a segmented circular row for holding two running sums in accordance with some embodiments of the invention. THE . segmented circular queue is arranged to facilitate the maintenance of two running sums, one computed for the older half of the values in the “5 circular queue (i.e. subsection A) and the other computed for the newer half of the values in the circular queue. (ie subsection B). These sums are referred to as Z, and £g respectively. There is now a second index |; held at an offset equal to one-half the memory dimension from the lo index. At each step in time the value indexed by lp (that is, the oldest value in all memory) is subtracted from 3, and the value indexed by |; is added to Za, while the value indexed by |, is subtracted from Xg and the new value to be written to memory is added to ?g. The new value is written to the location in the lo index, and the | and |; they are then incremented by one module by the size of the memory. In the example . 15 now shown, the subsections of the memory are of equal size, form dismembered sets, and together cover the entire memory. None of these conditions are required by the method.

A figura 13 ilustra uma fila circular segmentada de acordo com algumas modalidades da invenção. Na figura 13, a subseção "A" é disposta de modo que a mesma fica completamente dentro da subseção "B". A di- mensão total da memória bem como as dimensões de cada subseção e a disposição temporal de subseções são determinadas de acordo com o pro- pósito para o qual as somas estão sendo mantidas. Em algumas modalidades da invenção, as filas circulares são usadas para detectar localizações de mudanças abruptas. Diversos eventos de voz importantes, tais como começo, término, paradas de rajadas, etc., são associados com mudanças semi-monotônicas abruptas nos níveis de algumas características do sinal. Uma fila circular segmentada disposta em geral como na figura 13 pode ser empregada para detectar mudanças semi- —monotônicas abruptas. Com as dimensões de subseções "A" e "B" determi- nadas adequadamente, a diferença perceptiva entre somas correntes das subseções "A" e "B" é computada a cada etapa de tempo. Os tempos onde a diferença perceptiva alcança um máximo e sua magnitude excede seu limite perceptivo se tornam candidatos a pontos de segmentação.Figure 13 illustrates a segmented circular row according to some embodiments of the invention. In figure 13, subsection "A" is arranged so that it is completely within subsection "B". The total memory size as well as the dimensions of each subsection and the temporal arrangement of subsections are determined according to the purpose for which the sums are being kept. In some embodiments of the invention, circular rows are used to detect locations of abrupt changes. Several important voice events, such as beginning, ending, bursting stops, etc., are associated with abrupt semi-monotonic changes in the levels of some signal characteristics. A segmented circular row arranged generally as in Figure 13 can be employed to detect abrupt semi-monotonic changes. With the dimensions of subsections "A" and "B" properly determined, the perceptual difference between running sums of subsections "A" and "B" is computed at each time step. Times where the perceptual difference reaches a maximum and its magnitude exceeds its perceptual limit become candidates for segmentation points.

Qualificações 1 adicionais são aplicadas às características que imitam mais proximamente a percepção humana forçando uma separação de tempo mínima entre eventos “5 detectados.Additional 1 qualifications are applied to features that most closely mimic human perception by forcing a minimal time separation between detected “5” events.

Já neste estágio, os eventos podem começar a ser classificados grosseiramente, baseados na direção da mudança no evento.Already at this stage, events can begin to be roughly classified, based on the direction of change in the event.

Por exemplo, eventos devido a fechamentos são diferenciados de começos e rajadas pela direção da mudança de energia através da transição.For example, events due to closures are distinguished from starts and bursts by the direction of energy change through transition.

Em algumas outras modalidades da invénção, as filas circulares são usadas na detecção de impulsos e lacunas nos sinais de voz.In some other embodiments of the invention, circular queues are used to detect pulses and gaps in speech signals.

Alguns eventos de voz importantes são associados com localizações no tempo onde algumas características do sinal mudam abruptamente por um período muito breve de tempo e em seguida retornam a um nível similar àquele que esta- rs vam antes da mudança.Some important voice events are associated with locations in time where some signal characteristics change abruptly for a very brief period of time and then return to a level similar to what they were at before the change.

Se a mudança breve é para um valor maior a mu- 2 15 dançaé chamada um "impulso". Se a mudança breve é para um valor menor a mudança é chamada uma "lacuna". Uma fila circular segmentada disposta em geral como na figura 5 pode ser empregada para detectar impulsos e/ou lacunas.If the brief change is to a greater value the change is called a "pulse". If the brief change is to a smaller value the change is called a "gap". A segmented circular row arranged generally as in Figure 5 may be employed to detect pulses and/or gaps.

Com as dimensões das subseções "A" e "B" determinadas adequa- damente, impulsos (lacunas) são localizados quando o valor médio na sub- seção"A" está acima (abaixo) do valor médio na subseção "B" por um valor limite adaptativo perceptível.With the dimensions of subsections "A" and "B" determined properly, impulses (gaps) are located when the average value in subsection "A" is above (below) the average value in subsection "B" by an amount perceptible adaptive limit.

Como explicado previamente, a função de limi- te é determinada empiricamente.As explained previously, the limit function is empirically determined.

Os tamanhos das subseções "A" e "B" são determinados de acordo com a natureza da percepção humana e caracterís- ticas temporais dos aspectos dos sinais a serem detectados.The sizes of subsections "A" and "B" are determined according to the nature of human perception and temporal characteristics of the aspects of the signals to be detected.

Detecção de Pulso Glotal Um caso especial importante que ilustra o uso desta abordagem é a detecção de eventos de pulso glotal.Glottal Pulse Detection An important special case that illustrates the use of this approach is the detection of glottal pulse events.

Eventos de pulso glotal são locali- zados através do seguinte procedimento.Glottal pulse events are located using the following procedure.

Primeiro, o sinal é filtrado em pas- sa banda na amplitude do primeiro formante.First, the signal is bandpass filtered at the amplitude of the first formant.

Em seguida, a energia Teager é computada como Teager (t) = x(t) * x(t) — x(t-1) * x(t+1); em que x(t) é o valor de entrada no tempo t.Then Teager energy is computed as Teager (t) = x(t) * x(t) — x(t-1) * x(t+1); where x(t) is the input value at time t.

Sendo uma função da amplitude e frequência, a energia Teager enfatiza as localizações de pulso dos pulsos glotais, as quais são associa- das com máximos locais dos componentes de energia e alta frequência. ' Finalmente, o sinal é segmentado com o uso de um detector de impulso dis- posto em geral como na figura 13. O detector é baseado em somas corren- “5 tesde valores absolutos da energia Teager. Na modalidade preferencial, as dimensões de subseções "A" e "B" são ajustadas para 2 ms e 10 ms respec- tivamente. O detector está em um estado alto sempre que a energia Teager média na subseção "A" é maior do que o limite perceptivo K multiplicado pe- la energia Teager média na subseção "B". O valor de K foi escolhido para ser1,3. As dimensões das subseções "A" e "B", e o valor do multiplicador K têm sido considerados úteis para detectar localizações de pulso glotal. Valo- res diferentes destes descritos aqui podem ser usados dentro do escopo desta invenção.Being a function of amplitude and frequency, Teager energy emphasizes the pulse locations of glottal pulses, which are associated with local maxima of the energy and high frequency components. ' Finally, the signal is segmented using an impulse detector arranged generally as in figure 13. The detector is based on running sums of absolute values of Teager energy. In the preferred mode, the dimensions of subsections "A" and "B" are set to 2 ms and 10 ms respectively. The detector is in a high state whenever the average Teager energy in subsection "A" is greater than the perceptual threshold K multiplied by the average Teager energy in subsection "B". The value of K was chosen to be 1.3. The dimensions of subsections "A" and "B", and the value of the K multiplier have been found to be useful for detecting glottal pulse locations. Values other than those described herein may be used within the scope of this invention.

O detector de pulso glotal há pouco descrito cria dois eventos de — 15 localizações para cada pulso glotal, um no limite ascendente do pulso e um no limite descendente do pulso. O período de afastamento é definido como o período entre dois eventos de limites ascendentes sequenciais. A duração do pulso é estimada pelo tempo entre o limite ascendente e o limite descen- dente subsequente. A relação da duração do pulso para o período de afas- tamento total é relacionada ao "quociente aberto", uma característica da voz sonora que pode ser útil em algumas aplicações de processamento de voz. Além disso, durante a parte aberta do período do afastamento as cavidades subglotais são acusticamente acopladas com as cavidades orais criando padrões de formante um pouco diferentes durante esta parte comparada aos padrões da parte fechada. Este fato pode ser explorado vantajosamente dis- pondo a extração de característica em relação a estes eventos.The glottal pulse detector just described creates two events of — 15 locations for each glottal pulse, one at the rising edge of the pulse and one at the falling edge of the pulse. The drift period is defined as the period between two sequential rising threshold events. The pulse duration is estimated by the time between the rising threshold and the subsequent falling threshold. The relationship of pulse duration to total delay period is related to the "open quotient", a characteristic of voiced voice that can be useful in some speech processing applications. Furthermore, during the open part of the retraction period the subglottal cavities are acoustically coupled with the oral cavities creating slightly different formant patterns during this part compared to the closed part patterns. This fact can be exploited advantageously by arranging feature extraction in relation to these events.

A figura 14 ilustra uma representação de uma saída do detector de pulso glotal em um segmento de voz sonora de acordo com algumas mo- dalidades da invenção. Na figura 14, a saída do detector de pulso glotal divi- deosinalem "segmentos "alto" e "baixo". Os segmentos representam tem- pos em que uma característica relevante (neste caso energia Teager) está perceptivamente acima da norma. Esta disposição cria um segmento para a duração do pulso ou lacuna.Figure 14 illustrates a representation of a glottal pulse detector output in a voiced voice segment according to some embodiments of the invention. In figure 14, the output of the glottal pulse detector divides the signal into "high" and "low" segments. The segments represent times when a relevant characteristic (in this case Teager energy) is perceptually above the norm. This arrangement creates a segment for the duration of the pulse or gap.

Para algumas aplicações pode ser preferível marcar um pulso ou lacuna em vez de um segmento.For some applications it may be preferable to mark a pulse or gap rather than a segment.

Nestes casos a sele- N ção de tempos de evento específicos pode ser determinada por um dos di- versos métodos alternativos que incluem, mas não limitados a: e —selecionaro ponto médio entre os limites ascendente (des- cendente) e descendente (ascendente); e —selecionarolimite ascendente do segmento; e —selecionarolimite descendente do segmento; * —selecionaro valor de característica máximo (mínimo) dentro dosegmento;e e — selecionar o ponto do contraste perceptivo máximo dentro do segmento.In these cases the selection of specific event times can be determined by one of several alternative methods which include, but are not limited to: e —selecting the midpoint between the ascending (descending) and descending (rising) limits ; and —select ascending segment limit; and —select descending boundary of the segment; * —select the maximum (minimum) characteristic value within the segment; and — select the point of maximum perceptual contrast within the segment.

Detecção de pulso glotal como delineado acima é baseada na e detecção quando o valor médio de uma certa característica do sinal (por e- 2 15 xemplo, energia Teager) dentro de uma janela disposta centralmente desvia significativamente da média da mesma característica calculada por um perí- odo de tempo mais longo.Glottal pulse detection as outlined above is based on detection when the average value of a certain signal characteristic (e.g. Teager energy) within a centrally arranged window deviates significantly from the average of the same characteristic calculated over a period of time. - longer time odo.

Filas circulares segmentadas dispostas em geral como na figura 13 podem ser usadas para segmentar qualquer sinal de mo- dulação identificando as regiões onde uma característica de voz selecionada (por exemplo, energia ou frequência formante) desvia perceptivamente de sua norma de longo prazo.Segmented circular rows arranged in general as in Figure 13 can be used to segment any modulation signal by identifying regions where a selected voice characteristic (eg energy or formant frequency) perceptually deviates from its long-term norm.

Devido a o custo computacional para manter as somas correntes usadas pelos detectores ser independente da dimensão das subseções, as mesmas podem ser usadas para segmentar modulações de grande escala tão bem quanto impulsos breves.Because the computational cost of maintaining the running sums used by the detectors is independent of the size of the subsections, they can be used to segment large scale modulations as well as short pulses.

Detecção de Núcleo de Sílaba Para ilustrar este ponto, um detector de núcleo de sílaba foi construído usando uma fila circular segmentada disposta em geral como na figura 13, para manter somas correntes da energia de Teager, computadas exatamente como para o detector de pulso glotal exceto a dimensão da sub- seção"A" que foi ajustada para 60 ms e a dimensão da subseção "B" que foi ajustada para 100 ms.Syllable Nucleus Detection To illustrate this point, a syllable nucleus detector was constructed using a segmented circular row arranged in general as in figure 13, to maintain running sums of Teager energy, computed exactly as for the glottal pulse detector except the dimension of subsection "A" which was set to 60 ms and the dimension of subsection "B" which was set to 100 ms.

A figura 15 ilustra uma representação de uma forma de onda de saída de acordo com algumas modalidades da invenção. A figura 15 mostra as saídas de forma de onda e detector para a palavra "Once" falada duas : vezes, a primeira normalmente e a segunda vez em um sussurro. Como po- de ser visto este detector geralmente agrupa as partes centrais das sílabas.Figure 15 illustrates a representation of an output waveform according to some embodiments of the invention. Figure 15 shows the waveform and detector outputs for the word "Once" spoken twice: the first time normally and the second time in a whisper. As can be seen, this detector usually groups the central parts of syllables.

' 5 Algumas modalidades da invenção envolvem métodos para re- conhecer padrões de voz usando extração de formante. Conforme a voz é produzida, as configurações dos órgãos de articulação (por exemplo, língua, mandíbula, lábios) criam padrões dinâmicos de ressonâncias e antirresso- nâncias nos espectros de frequência chamados formantes. Durante a voz sonora, o som é gerado tanto pelos "ruídos de ar" difusos como por estrutura harmônica fortemente organizada. Ambos os componentes difuso e harmô- nico contribuem para o entendimento da voz e ambos são variavelmente invocados sob diferentes condições de ruído. Os "ruídos de ar" difusos inte- Li ragem com os formantes e são formatados pelos mesmos, revelando-os pa- R 15 raser relativamente atenuados. Os harmônicos resolvidos fortes criam picos relativamente agudos no espectro e, se não processados apropriadamente, fazem com que seja difícil localizar precisamente formantes próximos. As séries de harmônicos fornecem um excelente meio para determinar o afas- tamento, mesmo quando a própria frequência do período de afastamento está faltando no sinal. Experimentos têm mostrado que os harmônicos de amplitude modulada podem ser usados para recriar voz inteligível que "igno- ra" ruído. Durante voz não sonora mudanças perceptíveis temporalmente dividem o sinal em segmentos semi-homogêneos.'5 Some embodiments of the invention involve methods for recognizing speech patterns using formant extraction. As the voice is produced, the configurations of the organs of articulation (eg, tongue, jaw, lips) create dynamic patterns of resonances and anti-resonances in frequency spectra called formants. During the sonorous voice, the sound is generated both by diffuse "air noises" and by a strongly organized harmonic structure. Both the diffuse and harmonic components contribute to voice understanding and both are variably invoked under different noise conditions. Diffuse "air noises" interact with and are shaped by formants, revealing them to be relatively attenuated. Strong resolved harmonics create relatively sharp peaks in the spectrum and, if not processed properly, make it difficult to precisely locate nearby formants. Harmonic series provide an excellent means of determining offset, even when the offset period frequency itself is missing from the signal. Experiments have shown that amplitude modulated harmonics can be used to recreate intelligible speech that "ignores" noise. During voiceless speech, temporally perceptible changes divide the signal into semi-homogeneous segments.

Extração de Formante Em algumas modalidades da invenção, um processo de extra- ção de formante é executado como descrito na figura 16. A figura 16 ilustra um fluxo de trabalho 1600 para executar extração de formante de acordo com algumas modalidades da invenção.Formant Extraction In some embodiments of the invention, a formant extraction process is performed as described in Figure 16. Figure 16 illustrates a workflow 1600 for performing formant extraction in accordance with some embodiments of the invention.

O fluxo de trabalho 1600 começa quando as amostras do seg- mento são ajustadas à janela Hamming 1601 com uma extensão de janela igual à extensão do segmento, em que o segmento corresponde a um perío- do de afastamento durante a voz sonora. As amostras ajustadas a janela são em seguida processadas através de um banco de filtros passa banda larga 1602. Em algumas modalidades, os filtros passa banda têm larguras , de banda de 400 Hz e são espaçados em centros de 50 Hz cobrindo a am- plitude de 450 Hz até 4.000 Hz. Em seguida, o fluxo de trabalho computa a amplitude instantânea e a frequência de cada filtro é computada com o uso da técnica DESA-1 16 03. Baseadoa em suas qualidades numéricas, os va- lores computados são julgados como "válidos" ou "não válidos" na etapaWorkflow 1600 begins when the segment samples are fitted to the Hamming window 1601 with a window span equal to the span of the segment, where the segment corresponds to a period of offset during the voiced voice. The windowed samples are then processed through a bank of 1602 broadband filters. In some embodiments, the bandpass filters have bandwidths of 400 Hz and are spaced at 50 Hz centers covering the width of 400 Hz. 450 Hz up to 4000 Hz. Next, the workflow computes the instantaneous amplitude and frequency of each filter is computed using the DESA-1 16 03 technique. Based on their numerical qualities, the computed values are judged as "valid" or "not valid" in step

1604. Em seguida, conta e armazena estimativas "válidas" em uma memória temporária. Em seguida, um histograma cujas caixas representam amplitu- des de frequência é inicializado 1606, em que para cada estimativa válida, a caixa de histograma que representa a frequência instantânea estimada é incrementada pelo logaritmo da amplitude instantânea estimada comprimida F correspondente. Em seguida, os picos do histograma atenuado são selecio- — 15 nadoscomo candidatos a formante 1607, as frequências, larguras de banda (sigmas) e amplitudes de formante são retidas como características 1608, e as características delta são computadas nas trilhas de formante por ajusta- mento linear 1609. Finalmente, em localizações de mudança perceptível nos padrões de formante, são gerados eventos 1610. Processamento de Banco de Filtros de 12º Oitava Em algumas outras modalidades da invenção, é executado um processo de processamento de banco de filtros de 12º oitava no sinal seg- mentado usando passa bandas estreitos nas frequências mais baixas e pas- sa bandas mais largos nas frequências mais altas imitando as tendências de resolução de frequência encontrados na audição humana. A figura 17 lustra um fluxo de trabalho 1700 para executar extração de formante de acordo com algumas modalidades da invenção. O fluxo de trabalho 1700 começa quando as amostras do seg- mento estão síncronas com o sinal, ajustado à janela Hamming 1701 com uma extensão de janela igual à extensão do segmento, em que o segmento corresponde a um período de um afastamento. Em seguida, as amostras ajustadas à janela são processadas através da um banco de filtros espaça-1604. It then counts and stores "valid" estimates in a temporary memory. Next, a histogram whose boxes represent frequency amplitudes is initialized 1606, where for each valid estimate, the histogram box representing the estimated instantaneous frequency is incremented by the logarithm of the corresponding compressed estimated instantaneous amplitude F. Then the peaks of the attenuated histogram are selected as 1607 formant candidates, the formant frequencies, bandwidths (sigmas), and amplitudes are retained as 1608 features, and the delta features are computed on the formant tracks by adjusting - linear ment 1609. Finally, at locations of noticeable change in formant patterns, 1610 events are generated. 12th Octave Filterbank Processing In some other embodiments of the invention, a 12th octave filterbank processing process is performed in the segmented signal using narrow pass bands at lower frequencies and wider pass bands at higher frequencies mimicking the frequency resolution trends found in human hearing. Fig. 17 illustrates a workflow 1700 for performing formant extraction in accordance with some embodiments of the invention. Workflow 1700 starts when the segment samples are synchronous with the signal, fitted to the Hamming window 1701 with a window span equal to the span of the segment, where the segment corresponds to a period of one offset. Then, the window-fitted samples are processed through a bank of spaced filters.

dos de 12º oitava 1702 e a amplitude e frequência instantâneas de cada filtro são computadas com o uso da técnica DESA-1 1703. Baseados em suas qualidades numéricas, os valores conjugados são julgados 1704 "válido" ou À "não válido", em que estimativas "válidas" são contadas e armazenadas em umamemória temporária para o intervalo 1705.12th octave 1702 and the instantaneous amplitude and frequency of each filter are computed using the DESA-1 technique 1703. Based on their numerical qualities, the conjugate values are judged 1704 "valid" or À "not valid", where "valid" estimates are counted and stored in a temporary memory for the range 1705.

Em seguida, é construído um histograma, cujas caixas corres- pondem às frequências centrais de cada filtro no banco de filtros de 12º oita- va 1706, em que para cada valor estimado, a caixa do histograma cuja am- plitude inclui frequência instantânea estimada é incrementada pelo logaritmo da amplitude instantânea estimada comprimida. Em seguida, os pesos do histograma são multiplicados por uma função de ponderação baseada na sensitividade do ouvido em diferentes frequências 1707. Após computar os histogramas, os padrões de energia de caixa do histograma são somados SÁ em combinações harmônicas para detectar a sequência harmônica mais for- — 15 tecoma energia mais forte 1708, em que o fundamental da sequência har- i mônica é usado como uma estimativa de afastamento. Se a aplicação requer estimativas ainda mais precisas, filtros passa banda estreitos são centrados nas frequências harmônicas estimadas e recomputados 1709. Este processo converge rapidamente em estimativas altamente precisas. Finalmente, a re- lação de energia harmônica para a energia total é computado como uma medida de sonoridade 1710, em que os padrões de relação de amplitude dos harmônicos são mantidos como características, em que a relação é u- sada em reconhecimento de voz automático.Next, a histogram is constructed, whose boxes correspond to the central frequencies of each filter in the 12th octave filter bank 1706, in which for each estimated value, the histogram box whose amplitude includes the estimated instantaneous frequency is incremented by the logarithm of the compressed estimated instantaneous amplitude. Then, the histogram weights are multiplied by a weighting function based on the sensitivity of the ear at different 1707 frequencies. After computing the histograms, the histogram box energy patterns are summed SÁ in harmonic combinations to detect the strongest harmonic sequence. - — 15 tecoma strongest energy 1708, where the fundamental of the harmonic sequence is used as a distance estimate. If the application requires even more accurate estimates, narrow bandpass filters are centered on the estimated harmonic frequencies and recomputed 1709. This process quickly converges to highly accurate estimates. Finally, the ratio of harmonic energy to total energy is computed as a 1710 loudness measure, where harmonics amplitude ratio patterns are maintained as characteristics, where the ratio is used in automatic speech recognition. .

Uso dos Períodos de Afastamento Em algumas modalidades da invenção, os começos e afasta- mentos das trilhas de harmônicos podem ser determinados por amplitudes relativas de período de afastamento para período de afastamento. Mudanças abruptas na amplitude das trilhas de harmônicos são associadas com a inte- ração dos harmônicos com os formantes, e as mudanças abruptas indicam uma mudança na interação, que pode ser devida a uma mudança no afas- tamento ou uma mudança no formante. Estas mudanças são indicativas de uma localização de transição. Eventos podem ser gerados em resposta a estas mudanças com o uso dos métodos de filtro expostos previamente.Use of Offset Periods In some embodiments of the invention, the beginnings and offsets of harmonic trails can be determined by relative amplitudes of offset period to offset period. Abrupt changes in the amplitude of harmonic tracks are associated with the interaction of harmonics with the formants, and abrupt changes indicate a change in interaction, which may be due to a change in distance or a change in formant. These changes are indicative of a transition location. Events can be generated in response to these changes using the previously exposed filter methods.

De- ve ser observado que estes eventos, quando ocorrem, serão síncronos com o sincronismo dos pulsos glotais.It should be noted that these events, when they occur, will be synchronous with the synchronism of the glottal pulses.

Normalização do Trato Vocal e Reconhecimento de Segmento de Fonema — Atenuado Em algumas modalidades da invenção um processo de normali- * zação do trato vocal e reconhecimento de segmento de fonema atenuado é empregado para solucionar complicações inerentes ao uso de padrões de formantes como características.Vocal Tract Normalization and Attenuated Phoneme Segment Recognition In some embodiments of the invention a process of vocal tract normalization and attenuated phoneme segment recognition is employed to resolve complications inherent in using formant patterns as features.

Os padrões de formantes gerados por um orador codificam simultaneamente informação sobre os sons da voz que são produzidos e a extensão do trato vocal do orador.The formant patterns generated by a speaker simultaneously encode information about the voice sounds that are produced and the length of the speaker's vocal tract.

Isto complica o uso dos padrões de formato como características.This complicates the use of format standards as characteristics.

Foi observado em Watanabe, e outros, Reliable methods for es- Í timating relative vocal tract lengths formant trajectories of common words, : 15 IEEE transactions on audio, speech, and language processing, 2006, vol. 14 Pp. 1193 a 1204, que os formantes para dois oradores produzindo o mesmo som de voz têm um relacionamento inversamente proporcional à relação de suas extensões de tratos vocais:La/Lg = Fna/FnB Conforme sons de voz diferentes são produzidos, a extensão do trato vocal do orador é modificada continuamente através da reconfiguração dinâmica dos órgãos de articulação.It was noted in Watanabe, et al., Reliable methods for estimating relative vocal tract lengths formant trajectories of common words, : 15 IEEE transactions on audio, speech, and language processing, 2006, vol. 14 pp. 1193 to 1204, that the formants for two speakers producing the same voice sound have a relationship inversely proportional to the relationship of their vocal tract extensions: La/Lg = Fna/FnB As different voice sounds are produced, the vocal tract extension of the speaker is continually modified through the dynamic reconfiguration of the organs of articulation.

Para um dado orador, conforme cada som é produzido os formantes se moverão para cima ou para baixo porque os mesmos estão modificando a extensão do trato vocal.For a given speaker, as each sound is produced the formants will move up or down because they are changing the length of the vocal tract.

Aplicar a fórmula de Watanabe ao padrão de formante do orador "A" pronunciando um certo som de voze o padrão de formante do orador "B" pronunciando o mesmo som, fornece uma estimativa de suas extensões de trato vocal relativas para cada formante medido.Applying Watanabe's formula to the formant pattern of speaker "A" pronouncing a certain voice sound, and the formant pattern of speaker "B" pronouncing the same sound, gives an estimate of their relative vocal tract spans for each measured formant.

Alguns aspectos da invenção são baseados nas in- formações a seguir.Some aspects of the invention are based on the following information.

Primeiro se um orador "A" e orador "B" estão produzindo o mesmo som, as estimativas de trato vocal relativas baseadas em cada um dos váriosformantes medidos irão aproximar o valor real e, portanto um será similar ao outro.First, if a speaker "A" and speaker "B" are producing the same sound, the relative vocal tract estimates based on each of the various measured formants will approximate the true value and therefore one will be similar to the other.

Em seguida, se o orador "A" e orador "B" estão produzindo sons diferentes, as estimativas de extensão de trato vocal baseadas em ca-Next, if speaker "A" and speaker "B" are producing different sounds, vocal tract extension estimates based on

da um dos vários formantes medidos será divergente. Adicionalmente, se a transição de um certo som de voz envolve alongamento (encurtamento) da extensão do trato vocal quando falado pelo orador "A", o mesmo também envolverá o alongamento (encurtamento) da extensão do trato vocal do ora- dor"B"mas por quantidades diferentes baseado em sua fisiologia.from one of several measured formants will be divergent. Additionally, if the transition of a certain voice sound involves lengthening (shortening) the length of the vocal tract when spoken by speaker "A", it will also involve lengthening (shortening) the length of the vocal tract of speaker "B" but by different amounts based on your physiology.

Em algumas modalidades, os valores de formantes para cada som de voz, como falada por um orador de referência, são gravados. As medições de formante do orador de referência podem ser baseadas em um único orador ou mais, preferencialmente ser tomadas como a média de me- diçõesde muitos oradores. No momento do reconhecimento, cada segmento é processado para produzir valores de formante como descrito previamente. Cada som de voz (ou seja, fonema ou fonema parcial) é por sua vez assu- mido como sendo o que está sendo falado, e os valores de formante do í segmento atual são usados para computar estimativas de extensão de trato 215 vocal relativo do orador corrente para aquele do orador de referência. Base- ado na lista de consistências, a probabilidade relativa de cada som de voz pode ser estabelecida. Conforme a trajetória da voz se aproxima da configu- ração-alvo de cada padrão de formante aprovado, a consistência das esti- mativas irá aumentar e nestes tempos alvo tenderão a ser maiores para o som de voz percebido. A confiança que pode ser aplicada a tais percepções é dependente das condições do som de voz e ruído. Quando sons de voz são determinados com alta confiança, os mesmos se tornam pontos de refe- rência no sinal úteis para restringir os possíveis padrões nas regiões com menor confiança. Mecanismos de Reconhecimento de Voz Automáticos Paralelos Consecutivos Algumas modalidades da invenção envolvem usar uma plurali- dade de mecanismos de reconhecimento de voz automáticos (ASR) parale- los consecutivos em modo de rajada se sobrepondo temporariamente para reduzir a latência e melhorar a precisão. Cada mecanismo ASR pode ser de — concepção e origem similar ou diferente, mas todos têm que ser capazes de produzir resultados aceitáveis na linguagem-alvo na parte central do seg- mento dentro do quadro de tempo de segmentação mínimo. Os resultados dos processadores consecutivos são analisados pela ponderação das pala- vras produzidas durante a parte central de cada segmento maior do que as palavras produzidas no início e no fim, sincronização dos segmentos pela melhor adaptação, e as palavras com maior peso são selecionadas para saída Estas modalidades envolvem o uso de múltiplos mecanismos ASR nos segmentos de voz de áudio sobrepostos para reduzir a latência e melhorar a precisão. A abordagem paralela consecutiva aumenta a precisão ao mesmo tempo em que reduz a latência.In some embodiments, formant values for each voice sound, as spoken by a reference speaker, are recorded. Reference speaker formant measurements can be based on a single speaker or more, preferably taken as the average of measurements from many speakers. At recognition time, each segment is processed to produce formant values as described previously. Each voice sound (i.e., phoneme or partial phoneme) is in turn assumed to be what is being spoken, and the formant values of the current i segment are used to compute estimates of the relative vocal tract length of the voice. current speaker to that of the reference speaker. Based on the consistency list, the relative probability of each voice sound can be established. As the voice trajectory approaches the target configuration of each approved formant pattern, the consistency of the estimates will increase and these target times will tend to be higher for the perceived voice sound. The confidence that can be applied to such perceptions is dependent on the sound conditions of voice and noise. When voice sounds are determined with high confidence, they become useful signal reference points for constraining possible patterns in regions with less confidence. Consecutive Parallel Automatic Speech Recognition Engines Some embodiments of the invention involve using a plurality of consecutive parallel automatic speech recognition (ASR) engines in burst mode temporarily overlapping each other to reduce latency and improve accuracy. Each ASR engine can be of similar or different design and origin, but all must be able to produce acceptable results in the target language in the core part of the segment within the minimum segmentation time frame. The results of consecutive processors are analyzed by weighting the words produced during the middle part of each segment larger than the words produced at the beginning and end, synchronizing the segments for the best fit, and the words with the highest weight are selected for output. These modalities involve the use of multiple ASR mechanisms on overlapping audio voice segments to reduce latency and improve accuracy. Consecutive parallel approach increases accuracy while reducing latency.

Por exemplo, se um ASR segmenta arbitrariamente um sinal de voz de entrada em x segundos, a saída tende a ser mais precisa na localiza- ção x/2, e menos precisa no início e fim do segmento, uma vez que o con- texto mais alto em ambas as direções para frente e para trás é encontrado E na localização central. Dado este comportamento observado, alguém pode y 15 ser capaz de usar esta informação como alavanca simplesmente pela exe- cução de n instâncias de um mecanismo ASR em modo em lote, segmen- tando o sinal de entrada em rajadas de x segundos que se sobrepõem por x/n segundos, e alternando o encaminhamento destes segmentos entre cada mecanismo. Se n = 2, ao mesmo tempo em que o mecanismo B está traba- lhando no reconhecimento do seu segmento, a saída do mecanismo A é a- nalisada juntamente com o fluxo de palavras saído previamente para refor- çar estatisticamente, corrigir e fornecer as palavras a partir do mecanismo A. Em seguida, no limite n da segunda entrada, as tarefas de analisador de sa- ida e processamento comutam as obrigações entre os mecanismos.For example, if an ASR arbitrarily segments an input speech signal at x seconds, the output tends to be more accurate at location x/2, and less accurate at the beginning and end of the segment, since the context highest in both forward and backward directions is found AND in the central location. Given this observed behavior, one might be able to leverage this information simply by executing n instances of an ASR mechanism in batch mode, segmenting the input signal into bursts of x seconds that overlap by x/n seconds, and alternating the forwarding of these segments between each mechanism. If n = 2, at the same time that engine B is working on recognizing its segment, the output of engine A is analyzed together with the previously output word stream to statistically reinforce, correct and provide the words from engine A. Then, at the boundary n of the second input, the output parser and processing tasks switch obligations between the engines.

Observando um típico mecanismo ASR útil em uma configura- ção consecutiva, vê-se que x parece trabalhar melhor quando estabelecido por volta de três segundos quando usando um modelo de linguagem Inglês WSJ de três mil palavras. Isto permite a possibilidade de usar o mecanismo, que é projetado e otimizado para trabalhar em expressões longas, para ser adaptado para uso em ambientes onde a baixa latência é necessária.Looking at a typical ASR engine useful in a consecutive setup, it can be seen that x seems to work best when set to around three seconds when using a three thousand word WSJ English language model. This allows the possibility to use the engine, which is designed and optimized to work on long expressions, to be adapted for use in environments where low latency is required.

Em outras palavras, se x = 3, o primeiro segmento de voz em 0,0 a 3,0 segundos será apresentado para transformação para o mecanismo A.In other words, if x = 3, the first voice segment in 0.0 to 3.0 seconds will be presented for transformation to engine A.

O segmento de 1,5 a 4,5 então será apresentado para mecanismo B, etc.Segment 1.5 to 4.5 will then be presented for engine B, etc.

A figura 18 ilustra uma representação de dois mecanismos de processamento consecutivos, se sobrepondo no tempo, operando em uma sequência de expressões de acordo com algumas modalidades da invenção.Figure 18 illustrates a representation of two consecutive processing mechanisms, overlapping in time, operating in a sequence of expressions according to some embodiments of the invention.

Como mostrado na figura 18, as palavras, "is falling from the sky" são forne- cidas pelo mecanismo A, e "done the sky today at" vem do mecanismo B. Empregando métodos estatísticos descontando o peso para cada palavra nas extremidades de cada segmento que leva em conta o fator de confiabili- dade para aquelas palavras, pode-se terminar com uma sequência de pala- vras contínua aparente tal como "is falling from the sky today at” com uma latência fixa de 3 segundos.As shown in Figure 18, the words, "is falling from the sky" are provided by mechanism A, and "done the sky today at" comes from mechanism B. Employing statistical methods discounting the weight for each word at the ends of each segment that takes into account the reliability factor for those words, one can end up with an apparent continuous string of words such as "is falling from the sky today at" with a fixed latency of 3 seconds.

A análise de ponderação e o mecanismo de saída podem incluir um ou mais algoritmos nas seguintes categorias bem como outras para de- t terminar quais palavras serão adicionadas à sequência de saída final. Por p 15 exemplo, um algoritmo pode envolver ponderação simples das palavras cen- trais em um segmento com valores maiores do que as palavras nos limites do segmento, indicadores acústicos e prosódicos ganhos do sinal de voz original, análise estatística das palavras para serem fornecidas para reforçar os pesos da saída mais provável, regras gramaticais para selecionar a saída mais provável, ou outros métodos de aprendizagem de máquina e estatísti- cos. Pontuador Automático Algumas modalidades da invenção envolvem inserção automáti- ca de sinais de pontuação em um texto não pontuado. Um pontuador auto- -mático é um sistema que insere sinais de pontuação (pontos, vírgulas, pon- tos de interrogação, pontos de exclamação, apóstrofos, aspas, parêntesis, elipses, ponto e vírgula e dois pontos) em um texto não pontuado.The weighting analysis and output mechanism may include one or more algorithms in the following categories as well as others to determine which words will be added to the final output string. For example, an algorithm may involve simple weighting of the central words in a segment with values greater than the words at the limits of the segment, acoustic and prosodic indicators gained from the original speech signal, statistical analysis of the words to be provided for reinforcing most likely output weights, grammar rules for selecting the most likely output, or other statistical and machine learning methods. Automatic Punctuation Some embodiments of the invention involve automatic insertion of punctuation marks in unpunctuated text. An automatic punctuation system is a system that inserts punctuation marks (periods, commas, question marks, exclamation marks, apostrophes, quotation marks, parentheses, ellipses, semicolons, and colons) into unpunctuated text.

A figura 19 ilustra um sistema de voz para texto 1900 que inclui um pontuador automático de acordo com algumas modalidades da invenção.Figure 19 illustrates a speech-to-text system 1900 that includes an automatic scorer in accordance with some embodiments of the invention.

Em algumas modalidades da invenção, texto não pontuado pode originar um texto 1901, ou linguagem vozda 1902 que é em seguida transcrita para texto por um sistema de reconhecimento de voz automático 1903.In some embodiments of the invention, unpunctuated text may give rise to text 1901, or voiced language 1902 which is then transcribed to text by an automatic speech recognition system 1903.

O texto transcrito ou o texto nativo de 1901 é enviado para o pontuador automático 1905. O pontuador automático 1905 cria um texto que é mais facilmente legível e menos ambíguo devido à colocação correta de sinais de pontuação.The transcribed text or native 1901 text is sent to the 1905 auto punctuation. The 1905 auto punctuation creates text that is more easily readable and less ambiguous due to the correct placement of punctuation marks.

Em algumas modalidades da invenção, o pontuador automático 1905 é acoplado com um banco de dados 1904 que contém dados de trei- namento. O pontuador automático usa um ou mais algoritmos Baysianos que é treinado em uma grande quantidade de textos de treinamento que é pon- tuado corretamente. Os padrões de pontuação nos dados de treinamento são analisados para criar um conjunto de regras que descrevem os padrões de pontuação no texto.In some embodiments of the invention, the autoscorer 1905 is coupled with a database 1904 that contains training data. The auto scorer uses one or more Baysian algorithms that are trained on a large amount of training texts that are scored correctly. The scoring patterns in the training data are analyzed to create a set of rules that describe the scoring patterns in the text.

Uma vez que o pontuador tenha sido treinado em uma quantida- de suficiente de texto, suas regras podem então ser aplicadas a um novo í texto para predizer onde devem ser inseridos sinais de pontuação.Once the punctuation has been trained on a sufficient amount of text, its rules can then be applied to new text to predict where punctuation marks should be inserted.

Em algumas modalidades da invenção o pontuador automático 1905 compreende uma pluralidade de módulos de processamento. Como mostrado, o pontuador automático inclui um primeiro processador estatístico 1906, um segundo processador estatístico 1907 e um terceiro processador estatístico 1908.In some embodiments of the invention the autoscorer 1905 comprises a plurality of processing modules. As shown, the autoscorer includes a first statistical processor 1906, a second statistical processor 1907, and a third statistical processor 1908.

Em algumas modalidades, o primeiro processador estatístico 1906 identifica lugares onde a pontuação deve ser inserida baseada em re- gras estatísticas. Um processo de treinamento é conduzido para desenvolver as regras. O processo de treinamento envolve análise das correlações entre palavras específicas e sinais de pontuação em uma grande quantidade de textos pontuados corretamente. O conjunto de regras é derivado desta análi- se. O conjunto de regras pode então ser aplicado a um novo texto não pon- tuado para predizer localizações prováveis para sinais de pontuação. A saí- da deste processo é uma série de opiniões sobre onde os sinais de pontua- ção devem ser inseridos. | Em algumas modalidades, o segundo processador estatístico 1907 treina nas correlações de classes de palavra com sinais de pontuação. Este processo é baseado em um marcador de classe de palavra que analisa a estrutura das sentenças nos dados de treinamento e atribui um rótulo de classe de palavra para cada palavra.In some embodiments, the first 1906 statistical processor identifies places where scores should be entered based on statistical rules. A training process is conducted to develop the rules. The training process involves analyzing the correlations between specific words and punctuation marks in a large amount of correctly punctuated texts. The rule set is derived from this analysis. The ruleset can then be applied to new unpunctuated text to predict likely locations for punctuation marks. The output of this process is a series of opinions about where the punctuation marks should be inserted. | In some embodiments, the second 1907 statistical processor trains on the correlations of word classes with punctuation marks. This process is based on a word class marker that analyzes the sentence structure in the training data and assigns a word class label to each word.

Exemplos de rótulos de classe de pala- vra são substantivo, verbo, adjetivo, preposição, etc.Examples of word class labels are noun, verb, adjective, preposition, etc.

O processo em seguida constrói um conjunto de regras baseado emsuas observações de como certas classes de palavra se correlacionam com sinais de pontuação.The process then builds a set of rules based on its observations of how certain word classes correlate with punctuation marks.

Em seguida o conjunto de regras pode ser aplica- do a um novo texto.Then the rule set can be applied to new text.

A saída deste processo é uma série de opiniões sobre onde devem ser inseridos sinais de pontuação dentro do texto.The output of this process is a series of opinions on where to place punctuation marks within the text.

Em algumas modalidades, o terceiro processador estatístico 1908 utiliza ponderação baseada em extensões médias de sentença.In some embodiments, the 1908 third statistical processor uses weighting based on average sentence lengths.

O ter- ceiro componente do pontuador estatístico é baseado na quantidade de pa- lavras que tipicamente formam sentenças em um texto particular.The third component of the statistical scorer is based on the number of words that typically form sentences in a particular text.

Como nos outros processos, ele treina em uma grande quantidade de texto pontuado Í corretamente.As with the other processes, it trains on a large amount of punctuated text Í correctly.

As regras são desenvolvidas baseadas na quantidade de n- , 15 gramas que ocorrem nas unidades de texto que são limitadas pela pontua- ção.Rules are developed based on the amount of n- , 15 grams that occur in text units that are limited by punctuation.

Em algumas modalidades da invenção, os resultados do primei- ro processador estatístico 1906 e do segundo processador estatístico 1907 são dois conjuntos de opiniões de onde a pontuação deve ser inserida em um texto.In some embodiments of the invention, the results of the first statistical processor 1906 and the second statistical processor 1907 are two sets of opinions as to where punctuation should be inserted in a text.

Os resultados do terceiro processador estatístico 1908 são então usados como um tipo de desempate para resolver situações quando as de- cisões estão em conflito.The results of the third 1908 statistical processor are then used as a kind of tiebreaker to resolve situations when decisions are in conflict.

Por exemplo, se o primeiro processador estatístico 1906 prediz que um ponto é necessário após a quinta palavra em uma se- quência de palavras, e o segundo processador estatístico 1907 prediz que um ponto é necessário após a terceira palavra, os resultados do terceiro processador estatístico 1908 devem ser chamados para tomar a decisão, uma vez que é improvável que ambos estejam corretos, porque seria forma- da uma sentença de duas palavras.For example, if the first stat processor 1906 predicts that a dot is needed after the fifth word in a string of words, and the second stat processor 1907 predicts that a dot is needed after the third word, the results of the third stat processor 1908 must be called upon to make the decision, as both are unlikely to be correct, as a two-word sentence would be formed.

Em algumas modalidades, o terceiro processador estatístico 1908 atribui um peso maior para os resultados ou do primeiro processador estatístico 1906 ou do segundo processador estatístico 1907 baseado em seu conhecimento da extensão típica de sentença neste tipo de documento.In some embodiments, the third statistical processor 1908 assigns greater weight to the results of either the first statistical processor 1906 or the second statistical processor 1907 based on its knowledge of the typical sentence length in this type of document.

Se as sentenças no tipo de documento são tipicamente muito curtas, o ter- ceiro processador estatístico 1908 deveria atribuir maior peso para a saída do segundo processador estatístico 1907. Se, por outro lado, as sentenças no tipo de documento são usualmente de cinco palavras ou mais longas, ele dever atribuir maior peso à opinião gerada pelo primeiro processador estatís- tico 1906.If sentences in the document type are typically very short, the third statistical processor 1908 should assign greater weight to the output of the second statistical processor 1907. If, on the other hand, sentences in the document type are usually five words or longer, he should give more weight to the opinion generated by the first 1906 statistical processor.

Uma vez que a etapa de tomada de decisão está completa, o re- sultado é passado para um módulo de decisão 1909 que fará a decisão final sobre onde inserir pontuação, em conjunto com informação de um módulo de pontuação baseado em regras 1910 e um módulo de afastamento/pausaOnce the decision-making step is complete, the result is passed to a 1909 decision module that will make the final decision on where to enter scores, together with information from a 1910 rules-based scoring module and a 1910 rule-based scoring module. of leave/pause

1911. Em algumas modalidades, um módulo de pontuação baseado em regras 1910 usa um conjunto de regras sobre estrutura linguística para í determinar onde sinais de pontuação devem ser inseridos no texto. O módu- 2, 15 lode pontuação baseado em regras 1910 é acoplado com um banco de da- dos léxico 1916.1911. In some embodiments, a 1910 rule-based punctuation module uses a set of rules on linguistic structure to determine where punctuation marks should be inserted in the text. The 1910 rule-based scoring module 2, 15 is coupled with a 1916 lexical database.

O módulo de pontuação baseado em regras 1910 pode identifi- car diversas classes funcionais de palavras, incluindo pronomes sujeitos, pronomes objetos, pronomes relativos, modais, conjunções, artigos defini- dos, datase certas categorias de verbos. Em algumas modalidades, o banco de dados léxico 1916 inclui informação de classe de palavra.The 1910 rule-based punctuation module can identify several functional classes of words, including subject pronouns, object pronouns, relative pronouns, modals, conjunctions, definite articles, dates, and certain categories of verbs. In some embodiments, the 1916 lexical database includes word class information.

Uma vez que o programa tenha identificado um membro de uma das categorias funcionais, ele prossegue para a pesquisa do contexto próxi- mo, examinando em uma janela de texto que consiste no item identificado e duas palavras precedentes e seguintes. Categorias específicas de palavras ou classe de palavra que ocorrem na janela de contexto indicarão a necessi- dade de uma vírgula em algum ponto na sequência de palavras. As regras de linguística servem como uma lista de instrução para onde as vírgulas de- vem ser inseridas. Como um exemplo, quando o programa identifica um pro- nome sujeito (eu, ele, ela, nós, eles) ele verifica a janela de contexto para a ocorrência de outras categorias. Se, por exemplo, o pronome sujeito é pre- cedido por um advérbio ou um particípio (com certos particípios de verbo esperados) o programa irá predizer que ali deve haver uma vírgula após a palavra que precede a palavra identificada.Once the program has identified a member of one of the functional categories, it proceeds to search for the next context, looking in a text window consisting of the identified item and two preceding and following words. Specific word categories or word classes that occur in the context window will indicate the need for a comma at some point in the word sequence. Linguistic rules serve as an instruction list for where commas should be inserted. As an example, when the program identifies a subject pronoun (I, he, she, we, they) it checks the context window for the occurrence of other categories. If, for example, the subject pronoun is preceded by an adverb or a participle (with certain verb participles expected) the program will predict that there must be a comma after the word that precedes the identified word.

O pontuador baseado em regras pode processar uma sequência de palavras do texto ou um arquivo de texto preexistente.The rule-based scorer can process a string of text words or a pre-existing text file.

A saída do pontuador baseado em regras é uma série de opi- —niões sobre onde devem ser inseridas vírgulas.The output of the rule-based scorer is a series of opinions about where to insert commas.

Em algumas modalidades o módulo de afastamento/pausa 1911 é diferente dos outros componentes pelo fato de que sua entrada é um ar- quivo de áudio que contém voz humana.In some embodiments, the 1911 Away/Pause module is different from other components in that its input is an audio file that contains human voice.

Os outros componentes operam com texto, embora o texto possa ter sido originado como dados de áudio que foram então transcritos.The other components operate on text, although the text may have originated as audio data which was then transcribed.

O módulo de afastamento/pausa 1911 opera na ob- servação de que na voz humana, mudanças de afastamento significativas que acontecem sobre um curto período de tempo e são correlacionadas com um período de silêncio são usualmente indicativos de uma necessidade de í pontuação.The 1911 withdrawal/pause module operates on the observation that in the human voice, significant withdrawal changes that occur over a short period of time and are correlated with a period of silence are usually indicative of a need for punctuation.

Por exemplo, se um dado ponto de arquivo de áudio mostra uma 25 queda abrupta no afastamento (30% ou mais) ocorrendo em um curto perío- do de tempo (275 ms), que é um indicador provável de que o orador encon- trou o fim de uma sentença.For example, if a given point in an audio file shows an abrupt drop in distance (30% or more) occurring in a short period of time (275 ms), that is a likely indicator that the speaker has encountered the end of a sentence.

A presença de uma pausa seguindo este padrão tende a confir- mar que uma localização para um sinal de pontuação foi identificada.The presence of a pause following this pattern tends to confirm that a location for a punctuation mark has been identified.

O pon- tuadorde afastamento/pausa rastreia afastamento de um arquivo de áudio e sinaliza quando as condições corretas foram alcançadas para indicar pontu- ação.The away/pause scorer tracks the distance of an audio file and signals when the correct conditions have been met to indicate scoring.

O pontuador de afastamento/pausa fornece opiniões sobre onde sinais de pontuação devem ser inseridos.The leave/pause scorer provides opinions on where punctuation marks should be inserted.

Em algumas modalidades, o módulo de decisão 1909 recebe as entradas do pontuador automático 1905, pontuador baseado em regras 1910, e módulo de afastamento/pausa 1911. Baseado em características conhecidas do tipo de texto, o módulo de decisão 1909 atribui pesos maiores ou menores para cada um destes resultados para fazer uma determinação final sobre se uma pontuação deve ser inserida ou não em um dado ponto dotexto.In some embodiments, decision module 1909 receives input from auto scorer 1905, rule-based scorer 1910, and skip/pause module 1911. Based on known characteristics of the text type, decision module 1909 assigns higher or lower weights for each of these results to make a final determination as to whether or not a punctuation should be inserted at a given point in the text.

Claims (20)

U7 REIVINDICAÇÕESU7 CLAIMS 1. Mecanismo de reconhecimento de voz, que compreende: um analisador acústico para receber e digitalizar um sinal de co- dificação de voz; um extrator de eventos para extrair eventos do dito sinal de voz, em que os ditos eventos ou padrões de eventos que são altamente relevan- tes no reconhecimento de voz; e um módulo de reconhecimento de voz acoplado ao dito extrator de eventos, em que o dito módulo de reconhecimento de voz usa eventos parainiciar pelo menos uma ação em resposta ao conteúdo detectado.1. Speech recognition mechanism, comprising: an acoustic analyzer for receiving and digitizing a speech encoding signal; an event extractor for extracting events from said speech signal, wherein said events or patterns of events are highly relevant in speech recognition; and a speech recognition module coupled to said event extractor, wherein said speech recognition module uses events to initiate at least one action in response to detected content. 2. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que a dita ação iniciada é a conversão de conteúdo de voz do dito sinal em pelo menos uma sequência de texto.2. Speech recognition engine according to claim 1, wherein said initiated action is the conversion of speech content of said signal into at least one text string. [ 3. Mecanismo de reconhecimento de voz, de acordo com a rei- — 15 vindicação1,em que a dita ação iniciada é suprimir saída de áudio de um sistema quando certas palavras são detectadas.[ 3. Speech recognition engine, according to claim1, wherein said action initiated is to suppress audio output from a system when certain words are detected. 4. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que a dita ação iniciada é responder a comandos detecta- dos.4. Voice recognition mechanism, according to claim 1, wherein said initiated action is to respond to detected commands. 5. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que o dito extrator de eventos compreende adicionalmente: um corpus de treinamento de dicções de voz digitalizada de classes conhecidas; uma pluralidade de detectores de átona, em que cada detector deátonacompreende um método para determinar a presença de um evento; e um meio para montar um detector de conjunto, em que o dito de- tector de conjunto compreende um grupo de detectores de átona que agindo em conjunto são melhores na determinação da presença de um evento do — que qualquer dos detectores de átona constituintes.5. Speech recognition engine, according to claim 1, wherein said event extractor additionally comprises: a training corpus of digitized voice dictions of known classes; a plurality of stress detectors, each stress detector comprising a method for determining the presence of an event; and a means for mounting an array detector, wherein said array detector comprises a group of unstressed detectors which acting together are better at determining the presence of an event than any of the constituent unstressed detectors. 6. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 5, em que o dito detector de conjunto é criado iterativamente u-6. Speech recognition engine according to claim 5, wherein said array detector is iteratively created using sando um algoritmo de reforço, deste modo formando um detector de con- junto reforçado.being a reinforcement algorithm, thereby forming a reinforced array detector. 7. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 6, em que o dito extrator de eventos inclui um meio para simplifi- carodito detector de conjunto reforçado, deste modo formando um detector de conjunto simplificado.7. Speech recognition mechanism according to claim 6, wherein said event extractor includes means for simplifying said enhanced array detector, thereby forming a simplified array detector. 8. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 7, em que o dito extrator de eventos inclui um meio para conver- ter automaticamente o dito detector de conjunto simplificado em um detector em cascata.8. Speech recognition engine according to claim 7, wherein said event extractor includes means for automatically converting said simplified array detector into a cascade detector. 9. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que o dito extrator de eventos compreende adicionalmente um meio para classificar voz em grupos perceptivos e retirar a ambiguidade í entre percepções alternativas.9. Speech recognition mechanism according to claim 1, wherein said event extractor additionally comprises a means for classifying voice into perceptual groups and disambiguating i between alternative perceptions. 215 10. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que o dito extrator de eventos compreende adicionalmente um filtro para rejeitar regiões de um sinal de voz digitalizado que não conte- nha eventos e que provavelmente não resulte em detectores robustos.215 10. Speech recognition mechanism according to claim 1, wherein said event extractor additionally comprises a filter for rejecting regions of a digitized speech signal that do not contain events and that are not likely to result in an event. robust detectors. 11. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação1,em que o dito extrator de eventos compreende adicionalmente um reconhecedor de sequência de eventos, em que o dito reconhecedor de sequência de eventos detecta sequências de eventos.11. Speech recognition engine according to claim 1, wherein said event extractor further comprises a sequence of events recognizer, wherein said sequence of events recognizer detects sequences of events. 12. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, em que o dito extrator de eventos compreende adicionalmente um detector de interpretação alternativa configurado para reconhecer inter- pretações alternativas de voz para fortalecer o reconhecimento, por exem- plo, quando aspectos do sinal de voz estão corrompidos.12. Speech recognition engine according to claim 1, wherein said event extractor additionally comprises an alternative interpretation detector configured to recognize alternative speech interpretations to strengthen recognition, for example, when aspects of the voice signal are corrupted. 13. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, que compreende adicionalmente um mecanismo de sincroni- zação de sinal, que compreende: um filtro de pré-segmentação para definir intervalos que são u- sados para sincronizar computações de características;13. A speech recognition engine according to claim 1, further comprising a signal synchronization mechanism, comprising: a pre-segmentation filter for defining intervals that are used to synchronize computations of characteristics; um meio para segmentaro dito sinal digitalizado baseado nas di- ferenças perceptíveis dos intervalos, em que deste modo formam um sinal segmentado; e um extrator de característica para extrair características relativas aeventosdo dito sinal segmentado.a means for segmenting said digitized signal based on perceptible gap differences, thereby forming a segmented signal; and a feature extractor for extracting event-related features from said segmented signal. 14. Mecanismo de reconhecimento de voz, de acordo com a rei- vindicação 1, que compreende adicionalmente um pontuador automático para inserir pontuação automaticamente em pelo menos uma sequência de texto.14. Speech recognition engine according to claim 1, further comprising an automatic punctuation for automatically inserting punctuation into at least one text string. 15. Método de reconhecimento de voz, que compreende: estabelecer um treinamento de classificadores de átona baseado nos exemplos de treinamento; construir um conjunto de detectores; : receber um sinal de voz; , 15 digitalizar o dito sinal de voz; processar o dito sinal de voz com o uso do dito conjunto de de- tectores de átona, em que deste modo reconhece a presença de pelo menos um evento, em que o dito evento compreende um padrão no dito sinal de voz que é altamente relevante no reconhecimento de voz; e processar os ditos eventos para reconhecer voz.15. Voice recognition method, which comprises: establishing a training of unstressed classifiers based on training examples; build a set of detectors; : receive a voice signal; 15 digitizing said voice signal; processing said speech signal using said set of unstressed detectors, wherein thereby recognizing the presence of at least one event, wherein said event comprises a pattern in said speech signal that is highly relevant in the voice recognition; and processing said events to recognize voice. 16. Método de reconhecimento de voz, de acordo com a reivin- dicação 15, em que a etapa de construir um conjunto de detectores compre- ende as etapas de: armazenar uma pluralidade de sinais de voz, em que os ditos si- nais de voz compreendem exemplos de treinamento armazenados em um sistema de reconhecimento de voz automático; extrair padrões de evento a partir da dita pluralidade de sinais de voz, em que os ditos padrões compreendem localizações características dis- tintas nos ditos sinais de voz; acessar uma amostra da dita pluralidade de sinais de voz que tenha padrões de evento correspondentes; alinhar eventos de sinais de voz individuais dentre as amostras,16. The voice recognition method according to claim 15, wherein the step of building a set of detectors comprises the steps of: storing a plurality of voice signals, wherein said voice signals voice comprise training examples stored in an automatic voice recognition system; extracting event patterns from said plurality of speech signals, wherein said patterns comprise distinct characteristic locations in said speech signals; accessing a sample of said plurality of speech signals having corresponding event patterns; align individual voice signal events across samples, em que o dito alinhamento compreende alinhar os ditos eventos dos ditos sinais de voz individuais baseado temporariamente nos ditos padrões de evento correspondentes; opcionalmente ajustar os ditos sinais individuais para uma dura- çãotemporal comum; avaliar a efetividade de uma pluralidade de detectores de átona na detecção dos ditos padrões de evento; aplicar um esquema de ponderação a dita pluralidade de detec- tores de átona, em que os detectores de átona mais efetivos recebem os maiores pesos; adicionar pelo menos um detector de átona à dita pluralidade de detectores de átona; e iterar as ditas etapas de: [ acessar uma amostra da dita pluralidade de sinais de voz que ; 15 tem padrões de evento correspondentes; alinhar eventos de sinais de voz individuais dentre as amostras; opcionalmente ajustar os ditos sinais individuais para uma dura- ção temporal comum; avaliar a efetividade de uma pluralidade de detectores de átona nadetecção dos ditos padrões de evento; aplicar um esquema de ponderação à dita pluralidade de detec- tores de átona baseada na efetividade relativa dos ditos detectores de átona; e adicionar pelo menos um detector de átona adicional à dita plu- —ralidade de detectores de átona; em que a dita etapa de iteração é executada até que a dita efeti- vidade do dito esquema de ponderação execute um conjunto padrão de efi- ciência para detectar os ditos padrões de evento.wherein said alignment comprises aligning said events of said individual speech signals based temporarily on said corresponding event patterns; optionally adjusting said individual signals to a common time duration; evaluating the effectiveness of a plurality of unstressed detectors in detecting said event patterns; applying a weighting scheme to said plurality of unstressed detectors, in which the most effective unstressed detectors receive the highest weights; adding at least one stress detector to said plurality of stress detectors; and iterating said steps of: [accessing a sample of said plurality of voice signals that; 15 has matching event patterns; align individual speech signal events across samples; optionally adjusting said individual signals to a common time duration; evaluating the effectiveness of a plurality of unstressed detectors in detecting said event patterns; applying a weighting scheme to said plurality of unstressed detectors based on the relative effectiveness of said unstressed detectors; and adding at least one additional stress detector to said plurality of stress detectors; wherein said iteration step is executed until said effectiveness of said weighting scheme executes an efficiency pattern set to detect said event patterns. 17. Método, de acordo com a reivindicação 16, em que a etapa de acessar uma amostra da dita pluralidade de sinais de voz que tem pa- drões de eventos correspondentes compreende adicionalmente identificar regiões automaticamente na dita pluralidade de sinais de voz que conte-The method of claim 16, wherein the step of accessing a sample of said plurality of speech signals that have corresponding event patterns further comprises automatically identifying regions in said plurality of speech signals that contain nham os ditos padrões de eventos, que compreende as etapas de: alinhar a dita pluralidade de sinais de voz relativos a um eixo de tempo comum; opcionalmente ajustar as durações de cada sinal de voz indivi- dualda pluralidade de sinais de voz para um; projetar centros de sílaba e/ou outras localizações de eventos dos ditos sinais de voz individuais dentro do mesmo eixo de tempo na forma de centros de sílaba projetados e localizações de evento projetadas; e identificar regiões no dito eixo do tempo que tenham uma con- centração de centros de sílaba ou outras localizações de evento na forma de regiões na dita pluralidade de sinais de voz que contém os ditos padrões de evento.include said event patterns, comprising the steps of: aligning said plurality of speech signals relative to a common time axis; optionally adjusting the durations of each individual speech signal from the plurality of speech signals to one; projecting syllable centers and/or other event locations of said individual voice signals within the same time axis in the form of projected syllable centers and projected event locations; and identifying regions on said time axis that have a concentration of syllable centers or other event locations in the form of regions in said plurality of speech signals that contain said event patterns. 18. Método, de acordo com a reivindicação 15, em que a etapa í de acessar uma amostra da dita pluralidade de sinais de voz que tem pa- , 15 drões de eventos correspondentes compreende adicionalmente identificar regiões automaticamente na dita pluralidade de sinais de voz que conte- nham os ditos padrões de eventos, que compreende as etapas de: acessar um conjunto de treinamento; converter o dito sinal de voz dentro de regiões do espaço tempo- trajetória que contém todos os eventos dos exemplos de treinamento positi- vo; computar os contadores de exemplos negativos para todas as regiões; selecionar uma região do espaço tempo-trajetória com menos eventos dos exemplos de treinamento negativos; eliminar exemplos negativos sem eventos na região selecionada de consideração adicional; e repetir as etapas de: computar os contadores de exemplos negativos a partir de e- xemplos negativos remanescentes em cada região; selecionar uma região do espaço tempo-trajetória com menos eventos dos exemplos de treinamento negativos; e eliminar exemplos negativos sem eventos na consideração adi- cional de forma de região selecionada; até que seja criada uma cascata que opere perfeitamente no dito conjunto de treinamento.The method of claim 15, wherein the step of accessing a sample of said plurality of speech signals having corresponding event patterns further comprises automatically identifying regions in said plurality of speech signals that contain said event patterns, which comprises the steps of: accessing a training set; convert said voice signal into regions of time-path space that contain all the events of the positive training examples; compute negative example counters for all regions; select a region of time-trajectory space with fewer events from the negative training examples; eliminate negative examples with no events in the selected region from further consideration; and repeat the steps of: computing the negative examples counters from the remaining negative examples in each region; select a region of time-trajectory space with fewer events from the negative training examples; and eliminate negative examples without events in the additional consideration of selected region shape; until a cascade is created that operates perfectly on said training set. 19. Método para operar dois ou mais sistemas de reconhecimen- to em série, em que os ditos dois ou mais sistemas de reconhecimento de voz executam detecção e análise de um sinal de voz nos intervalos de tem- po sobrepostos, o dito método que compreende: configurar os intervalos de tempo para serem usados em cada mecanismo de reconhecimento de voz, em que os ditos intervalos são re- configuráveis; configurar a sobreposição dos intervalos, em que a sobreposição é reconfigurável, e em que a sobreposição é ajustada para refletir as partes 1 mais ricas em informação do dito sinal de voz; 215 encaminhar a dita detecção e análise entre os ditos mecanismos de reconhecimento de voz; ponderar os resultados dos ditos mecanismos de reconhecimen- to de voz, em que um peso mais alto é dado aos resultados tomados do meio do intervalo, e gerar pelo menos duas opiniões como a identidade das palavras dentro de um único intervalo de tempo; e determinar qual opinião das pelo menos duas opiniões estima melhor uma representação do dito sinal de voz.19. A method of operating two or more recognition systems in series, wherein said two or more voice recognition systems perform detection and analysis of a voice signal at overlapping time intervals, said method comprising : configure the time intervals to be used in each speech recognition engine, where said intervals are reconfigurable; configuring the overlap of intervals, wherein the overlap is reconfigurable, and wherein the overlap is adjusted to reflect the most information-rich parts 1 of said speech signal; 215 routing said detection and analysis between said speech recognition mechanisms; weighting the results of said speech recognition mechanisms, in which a higher weight is given to the results taken from the middle of the range, and generating at least two opinions as to the identity of the words within a single time interval; and determining which opinion of the at least two opinions best estimates a representation of said speech signal. 20. Mecanismo de reconhecimento de voz, que compreende: um analisador acústico para receber e digitalizar um sinal de voz —naforma de uma dicção digital; um módulo de reconhecimento de voz acoplado ao dito analisa- dor acústico, em que o dito módulo de reconhecimento de voz converte a dita dicção digital em pelo menos uma sequência de texto; um mecanismo de pontuação automática acoplado com um ban- code dados que contém dados de treinamento, em que o dito mecanismo de pontuação automática inclui pelo menos um processador estatístico para adicionar a pontuação à dita sequência de texto com o uso dos ditos dados20. Speech recognition mechanism, comprising: an acoustic analyzer for receiving and digitizing a speech signal —in the form of a digital diction; a speech recognition module coupled to said acoustic analyzer, wherein said speech recognition module converts said digital diction into at least one text string; an automatic scoring mechanism coupled with a database containing training data, wherein said automatic scoring mechanism includes at least one statistical processor for adding the score to said text string using said data ' TM de treinamento na forma de texto pontuados baseados em estatística; um pontuador baseado em regras acoplado com um banco de dados de regras lexicais, em que o dito pontuador baseado em regras adi- ciona pontuação à dita sequência de texto usando regras do dito banco de dados de regras lexicais na forma de texto pontuado baseado em regras; e um módulo de decisão para determinar se o dito texto pontuado ou dito texto pontuado baseado em estatística produz um resultado pontua- do melhor.' statistic-based punctuated text training TM; a rule-based scorer coupled with a lexical rules database, wherein said rule-based scorer adds punctuation to said text string using rules from said lexical rules database in the form of rule-based punctuated text ; and a decision module for determining whether said scored text or said statistically based scored text produces a better scored result.
BRPI0922035-6A 2008-11-12 2009-11-12 VOICE RECOGNITION METHOD AND VOICE RECOGNITION SYSTEM BRPI0922035B1 (en)

Applications Claiming Priority (5)

Application Number Priority Date Filing Date Title
US11391008P 2008-11-12 2008-11-12
US61/113,910 2008-11-12
US12/616,723 US8566088B2 (en) 2008-11-12 2009-11-11 System and method for automatic speech to text conversion
US12/616,723 2009-11-11
PCT/US2009/064214 WO2010056868A1 (en) 2008-11-12 2009-11-12 System and method for automatic speach to text conversion

Publications (2)

Publication Number Publication Date
BRPI0922035A2 true BRPI0922035A2 (en) 2021-08-31
BRPI0922035B1 BRPI0922035B1 (en) 2023-01-24

Family

ID=42166012

Family Applications (1)

Application Number Title Priority Date Filing Date
BRPI0922035-6A BRPI0922035B1 (en) 2008-11-12 2009-11-12 VOICE RECOGNITION METHOD AND VOICE RECOGNITION SYSTEM

Country Status (7)

Country Link
US (1) US8566088B2 (en)
EP (1) EP2347408A4 (en)
JP (1) JP5850747B2 (en)
KR (1) KR101688240B1 (en)
CN (1) CN102227767B (en)
BR (1) BRPI0922035B1 (en)
WO (1) WO2010056868A1 (en)

Families Citing this family (106)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8719004B2 (en) * 2009-03-19 2014-05-06 Ditech Networks, Inc. Systems and methods for punctuating voicemail transcriptions
US8712774B2 (en) * 2009-03-30 2014-04-29 Nuance Communications, Inc. Systems and methods for generating a hybrid text string from two or more text strings generated by multiple automated speech recognition systems
US8412525B2 (en) * 2009-04-30 2013-04-02 Microsoft Corporation Noise robust speech classifier ensemble
US8281231B2 (en) * 2009-09-11 2012-10-02 Digitalsmiths, Inc. Timeline alignment for closed-caption text using speech recognition transcripts
US10224036B2 (en) * 2010-10-05 2019-03-05 Infraware, Inc. Automated identification of verbal records using boosted classifiers to improve a textual transcript
US8676574B2 (en) 2010-11-10 2014-03-18 Sony Computer Entertainment Inc. Method for tone/intonation recognition using auditory attention cues
US9031839B2 (en) * 2010-12-01 2015-05-12 Cisco Technology, Inc. Conference transcription based on conference data
US9558738B2 (en) * 2011-03-08 2017-01-31 At&T Intellectual Property I, L.P. System and method for speech recognition modeling for mobile voice search
US9087519B2 (en) * 2011-03-25 2015-07-21 Educational Testing Service Computer-implemented systems and methods for evaluating prosodic features of speech
US8756061B2 (en) * 2011-04-01 2014-06-17 Sony Computer Entertainment Inc. Speech syllable/vowel/phone boundary detection using auditory attention cues
US20120259638A1 (en) * 2011-04-08 2012-10-11 Sony Computer Entertainment Inc. Apparatus and method for determining relevance of input speech
US9087048B2 (en) 2011-06-10 2015-07-21 Linkedin Corporation Method of and system for validating a fact checking system
US9015037B2 (en) 2011-06-10 2015-04-21 Linkedin Corporation Interactive fact checking system
US9176957B2 (en) 2011-06-10 2015-11-03 Linkedin Corporation Selective fact checking method and system
US8185448B1 (en) 2011-06-10 2012-05-22 Myslinski Lucas J Fact checking method and system
US9053750B2 (en) 2011-06-17 2015-06-09 At&T Intellectual Property I, L.P. Speaker association with a visual representation of spoken content
US8719031B2 (en) 2011-06-17 2014-05-06 At&T Intellectual Property I, L.P. Dynamic access to external media content based on speaker content
US20130094567A1 (en) * 2011-10-18 2013-04-18 Lsi Corporation Apparatus and methods for performing block matching on a video stream
US20130132079A1 (en) * 2011-11-17 2013-05-23 Microsoft Corporation Interactive speech recognition
US8849666B2 (en) * 2012-02-23 2014-09-30 International Business Machines Corporation Conference call service with speech processing for heavily accented speakers
CN102682766A (en) * 2012-05-12 2012-09-19 黄莹 Self-learning lover voice swapper
US9529793B1 (en) 2012-06-01 2016-12-27 Google Inc. Resolving pronoun ambiguity in voice queries
US9336302B1 (en) 2012-07-20 2016-05-10 Zuci Realty Llc Insight and algorithmic clustering for automated synthesis
US8484022B1 (en) 2012-07-27 2013-07-09 Google Inc. Adaptive auto-encoders
US8484025B1 (en) * 2012-10-04 2013-07-09 Google Inc. Mapping an audio utterance to an action using a classifier
CN102903361A (en) * 2012-10-15 2013-01-30 Itp创新科技有限公司 An instant translation system and method for a call
US9557818B2 (en) * 2012-10-16 2017-01-31 Google Inc. Contextually-specific automatic separators
US9031293B2 (en) 2012-10-19 2015-05-12 Sony Computer Entertainment Inc. Multi-modal sensor based emotion recognition and emotional interface
US9020822B2 (en) 2012-10-19 2015-04-28 Sony Computer Entertainment Inc. Emotion recognition using auditory attention cues extracted from users voice
US9570076B2 (en) * 2012-10-30 2017-02-14 Google Technology Holdings LLC Method and system for voice recognition employing multiple voice-recognition techniques
US9240184B1 (en) 2012-11-15 2016-01-19 Google Inc. Frame-level combination of deep neural network and gaussian mixture models
US12148426B2 (en) 2012-11-28 2024-11-19 Google Llc Dialog system with automatic reactivation of speech acquiring mode
RU2530268C2 (en) 2012-11-28 2014-10-10 Общество с ограниченной ответственностью "Спиктуит" Method for user training of information dialogue system
US9672811B2 (en) 2012-11-29 2017-06-06 Sony Interactive Entertainment Inc. Combining auditory attention cues with phoneme posterior scores for phone/vowel/syllable boundary detection
US9483159B2 (en) 2012-12-12 2016-11-01 Linkedin Corporation Fact checking graphical user interface including fact checking icons
US8977555B2 (en) * 2012-12-20 2015-03-10 Amazon Technologies, Inc. Identification of utterance subjects
US9390380B2 (en) * 2013-03-15 2016-07-12 Intel Corporation Continuous interaction learning and detection in real-time
CN104142915B (en) * 2013-05-24 2016-02-24 腾讯科技(深圳)有限公司 A kind of method and system adding punctuate
CN104143331B (en) * 2013-05-24 2015-12-09 腾讯科技(深圳)有限公司 A kind of method and system adding punctuate
US9601130B2 (en) * 2013-07-18 2017-03-21 Mitsubishi Electric Research Laboratories, Inc. Method for processing speech signals using an ensemble of speech enhancement procedures
US9728202B2 (en) 2013-08-07 2017-08-08 Vonage America Inc. Method and apparatus for voice modification during a call
US9299358B2 (en) * 2013-08-07 2016-03-29 Vonage America Inc. Method and apparatus for voice modification during a call
US20150095320A1 (en) 2013-09-27 2015-04-02 Trooclick France Apparatus, systems and methods for scoring the reliability of online information
US10169424B2 (en) 2013-09-27 2019-01-01 Lucas J. Myslinski Apparatus, systems and methods for scoring and distributing the reliability of online information
WO2015057661A1 (en) * 2013-10-14 2015-04-23 The Penn State Research Foundation System and method for automated speech recognition
US8943405B1 (en) * 2013-11-27 2015-01-27 Google Inc. Assisted punctuation of character strings
GB2523984B (en) * 2013-12-18 2017-07-26 Cirrus Logic Int Semiconductor Ltd Processing received speech data
CN103761064A (en) * 2013-12-27 2014-04-30 圆展科技股份有限公司 Automatic voice input system and method thereof
US9269045B2 (en) * 2014-02-14 2016-02-23 Qualcomm Incorporated Auditory source separation in a spiking neural network
US8990234B1 (en) 2014-02-28 2015-03-24 Lucas J. Myslinski Efficient fact checking method and system
US9972055B2 (en) 2014-02-28 2018-05-15 Lucas J. Myslinski Fact checking method and system utilizing social networking information
US9643722B1 (en) 2014-02-28 2017-05-09 Lucas J. Myslinski Drone device security system
US12271955B2 (en) 2014-02-28 2025-04-08 Lucas J. Myslinski Drone device
US9189514B1 (en) 2014-09-04 2015-11-17 Lucas J. Myslinski Optimized fact checking method and system
US9520128B2 (en) * 2014-09-23 2016-12-13 Intel Corporation Frame skipping with extrapolation and outputs on demand neural network for automatic speech recognition
KR20160058470A (en) * 2014-11-17 2016-05-25 삼성전자주식회사 Speech synthesis apparatus and control method thereof
US10775996B2 (en) * 2014-11-26 2020-09-15 Snap Inc. Hybridization of voice notes and calling
US9659259B2 (en) * 2014-12-20 2017-05-23 Microsoft Corporation Latency-efficient multi-stage tagging mechanism
US10395555B2 (en) * 2015-03-30 2019-08-27 Toyota Motor Engineering & Manufacturing North America, Inc. System and method for providing optimal braille output based on spoken and sign language
US9640177B2 (en) 2015-06-01 2017-05-02 Quest Software Inc. Method and apparatus to extrapolate sarcasm and irony using multi-dimensional machine learning based linguistic analysis
WO2016209888A1 (en) * 2015-06-22 2016-12-29 Rita Singh Processing speech signals in voice-based profiling
US9978370B2 (en) * 2015-07-31 2018-05-22 Lenovo (Singapore) Pte. Ltd. Insertion of characters in speech recognition
CN105741838B (en) * 2016-01-20 2019-10-15 百度在线网络技术(北京)有限公司 Voice awakening method and device
CN105704538A (en) * 2016-03-17 2016-06-22 广东小天才科技有限公司 Audio and video subtitle generation method and system
KR101862337B1 (en) 2016-03-24 2018-05-31 주식회사 닷 Apparatus, method and computer readable recoding medium for offering information
CN107886951B (en) * 2016-09-29 2021-07-23 百度在线网络技术(北京)有限公司 Voice detection method, device and equipment
KR102476897B1 (en) 2016-10-05 2022-12-12 삼성전자주식회사 Method and apparatus for tracking object, and 3d display device thereof
CN107943405A (en) * 2016-10-13 2018-04-20 广州市动景计算机科技有限公司 Sound broadcasting device, method, browser and user terminal
US11205103B2 (en) 2016-12-09 2021-12-21 The Research Foundation for the State University Semisupervised autoencoder for sentiment analysis
KR101818980B1 (en) 2016-12-12 2018-01-16 주식회사 소리자바 Multi-speaker speech recognition correction system
KR102747895B1 (en) * 2016-12-20 2024-12-27 주식회사 넥슨코리아 Apparatus and method for providing game
CN107424612B (en) * 2017-07-28 2021-07-06 北京搜狗科技发展有限公司 Processing method, apparatus and machine-readable medium
JP6891073B2 (en) * 2017-08-22 2021-06-18 キヤノン株式会社 A device for setting a file name, etc. on a scanned image, its control method, and a program.
US10423727B1 (en) 2018-01-11 2019-09-24 Wells Fargo Bank, N.A. Systems and methods for processing nuances in natural language
CN108108357B (en) * 2018-01-12 2022-08-09 京东方科技集团股份有限公司 Accent conversion method and device and electronic equipment
CN108600773B (en) * 2018-04-25 2021-08-10 腾讯科技(深圳)有限公司 Subtitle data pushing method, subtitle display method, device, equipment and medium
RU2711153C2 (en) 2018-05-23 2020-01-15 Общество С Ограниченной Ответственностью "Яндекс" Methods and electronic devices for determination of intent associated with uttered utterance of user
CN108831458A (en) * 2018-05-29 2018-11-16 广东声将军科技有限公司 A kind of offline voice is to order transform method and system
CN108831481A (en) * 2018-08-01 2018-11-16 平安科技(深圳)有限公司 Symbol adding method, device, computer equipment and storage medium in speech recognition
US11094326B2 (en) * 2018-08-06 2021-08-17 Cisco Technology, Inc. Ensemble modeling of automatic speech recognition output
CN109192217B (en) * 2018-08-06 2023-03-31 中国科学院声学研究所 Multi-class low-rate compressed voice steganography-oriented general information hiding detection method
TWI698857B (en) * 2018-11-21 2020-07-11 財團法人工業技術研究院 Speech recognition system and method thereof, and computer program product
RU2761940C1 (en) 2018-12-18 2021-12-14 Общество С Ограниченной Ответственностью "Яндекс" Methods and electronic apparatuses for identifying a statement of the user by a digital audio signal
CN111858861B (en) * 2019-04-28 2022-07-19 华为技术有限公司 Question-answer interaction method based on picture book and electronic equipment
CN112036174B (en) * 2019-05-15 2023-11-07 南京大学 A punctuation marking method and device
CN110287156B (en) * 2019-06-28 2021-12-21 维沃移动通信有限公司 File processing method and mobile terminal
US11961511B2 (en) 2019-11-08 2024-04-16 Vail Systems, Inc. System and method for disambiguation and error resolution in call transcripts
CN111369981B (en) * 2020-03-02 2024-02-23 北京远鉴信息技术有限公司 Dialect region identification method and device, electronic equipment and storage medium
CN111931508B (en) * 2020-08-24 2023-05-12 上海携旅信息技术有限公司 Digital conversion method and system, text processing method and system, equipment and medium
KR102562692B1 (en) * 2020-10-08 2023-08-02 (주)에어사운드 System and method for providing sentence punctuation
WO2022085296A1 (en) * 2020-10-19 2022-04-28 ソニーグループ株式会社 Information processing device and information processing method, computer program, format conversion device, audio content automatic posting system, trained model, and display device
CN112331178A (en) * 2020-10-26 2021-02-05 昆明理工大学 A Feature Fusion Method for Language Recognition in Low Signal-to-Noise Ratio Environment
CN116018639B (en) 2020-10-27 2024-11-29 谷歌有限责任公司 Method and system for text-to-speech synthesis of streaming text
EP4181120A4 (en) * 2020-11-25 2024-01-10 Samsung Electronics Co., Ltd. ELECTRONIC DEVICE FOR GENERATING A RESPONSE TO A USER INPUTION AND OPERATING METHOD THEREFOR
CN112735383A (en) * 2020-12-23 2021-04-30 深圳壹账通智能科技有限公司 Voice signal processing method, device, equipment and storage medium
CN112966561B (en) * 2021-02-03 2024-01-30 成都职业技术学院 Portable university student innovation and entrepreneur multifunctional recording method and device
US11545143B2 (en) 2021-05-18 2023-01-03 Boris Fridman-Mintz Recognition or synthesis of human-uttered harmonic sounds
CN113744368A (en) * 2021-08-12 2021-12-03 北京百度网讯科技有限公司 Animation synthesis method and device, electronic equipment and storage medium
US12524402B2 (en) * 2021-10-21 2026-01-13 Servicenow, Inc. Systems and methods for using constraints to generate database queries
KR20230102506A (en) * 2021-12-30 2023-07-07 삼성전자주식회사 Electronic apparatus and control method thereof
TWI812070B (en) * 2022-03-15 2023-08-11 宏碁股份有限公司 Method and system for converting audio file to text
CN114724588B (en) * 2022-03-29 2025-06-17 北京声智科技有限公司 Voice detection method, device, electronic device, storage medium and product
CN114758645B (en) * 2022-04-29 2024-08-06 建信金融科技有限责任公司 Training method, device, equipment and storage medium for speech synthesis model
GB202211620D0 (en) * 2022-08-09 2022-09-21 Oakspire Ltd Automated speech recognition to support context-aware intent recognition
US20240087572A1 (en) * 2022-09-14 2024-03-14 Microsoft Technology Licensing, Llc Systems and methods for semantic segmentation for speech
FI20236348A1 (en) * 2023-12-07 2025-06-08 Elisa Oyj Computer-implemented method for transcribing audio input

Family Cites Families (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5749066A (en) * 1995-04-24 1998-05-05 Ericsson Messaging Systems Inc. Method and apparatus for developing a neural network for phoneme recognition
US5799276A (en) 1995-11-07 1998-08-25 Accent Incorporated Knowledge-based speech recognition system and methods having frame length computed based upon estimated pitch period of vocalic intervals
US6611802B2 (en) 1999-06-11 2003-08-26 International Business Machines Corporation Method and system for proofreading and correcting dictated text
JP2002156997A (en) 2000-11-21 2002-05-31 Sharp Corp Voice detection control device
US7668718B2 (en) 2001-07-17 2010-02-23 Custom Speech Usa, Inc. Synchronized pattern recognition source data processed by manual or automatic means for creation of shared speaker-dependent speech user profile
JP2003177776A (en) 2001-12-12 2003-06-27 Seiko Instruments Inc Minutes recording system
JP4675840B2 (en) 2006-06-29 2011-04-27 三菱電機株式会社 Remote controller and home appliance

Also Published As

Publication number Publication date
EP2347408A4 (en) 2012-05-02
WO2010056868A1 (en) 2010-05-20
JP5850747B2 (en) 2016-02-03
US8566088B2 (en) 2013-10-22
CN102227767B (en) 2014-10-15
US20100121638A1 (en) 2010-05-13
EP2347408A1 (en) 2011-07-27
KR101688240B1 (en) 2016-12-20
JP2012508903A (en) 2012-04-12
KR20110095314A (en) 2011-08-24
CN102227767A (en) 2011-10-26
BRPI0922035B1 (en) 2023-01-24

Similar Documents

Publication Publication Date Title
BRPI0922035A2 (en) SYSTEM AND METHOD FOR AUTOMATIC VOICE TO TEXT CONVERSION
US5623609A (en) Computer system and computer-implemented process for phonology-based automatic speech recognition
US5799276A (en) Knowledge-based speech recognition system and methods having frame length computed based upon estimated pitch period of vocalic intervals
Wang et al. Robust speech rate estimation for spontaneous speech
Etman et al. Language and dialect identification: A survey
US5621857A (en) Method and system for identifying and recognizing speech
Niyogi et al. Detecting stop consonants in continuous speech
US7177810B2 (en) Method and apparatus for performing prosody-based endpointing of a speech signal
Patra Silence removal and endpoint detection of speech signal for text independent speaker identification
King et al. Speech recognition via phonetically-featured syllables
Kempton et al. Discovering the phoneme inventory of an unwritten language: A machine-assisted approach
CN102222498B (en) Voice judging system, voice judging method and program for voice judgment
US20210225366A1 (en) Speech recognition system with fine-grained decoding
Hasija et al. Recognition of children Punjabi speech using tonal non-tonal classifier
Wagner et al. Crisperwhisper: Accurate timestamps on verbatim speech transcriptions
Stouten et al. A feature-based filled pause detection system for Dutch
Park Consonant landmark detection for speech recognition
Hamzah et al. Investigation of speech disfluencies classification on different threshold selection techniques using energy feature extraction
EP0760150B1 (en) Computer system and computer-implemented process for phonology-based automatic speech recognition
Muthusamy et al. A review of research in automatic language identification
Maddela et al. Phonetic–Acoustic Characteristics of Telugu Lateral Approximants
Dharmani et al. Performance evaluation of ASR for isolated words in Sindhi Language
Markov et al. Language identification with dynamic hidden Markov network
Reddy et al. Automatic pitch accent contour transcription for Indian languages
Seman et al. Hybrid methods of Brandt’s generalised likelihood ratio and short-term energy for Malay word speech segmentation

Legal Events

Date Code Title Description
B15I Others concerning applications: loss of priority

Free format text: PERDA DA PRIORIDADE US 61/113,910 REIVINDICADA NO PCT/US2009/064214, CONFORME AS DISPOSICOES PREVISTAS NA LEI 9.279 DE 14/05/1996 (LPI) ART. 16 7O, ITEM 28 DO ATO NORMATIVO 128/97 E NO ART. 29 DA RESOLUCAO INPI-PR 77/2013. ESTA PERDA SE DEU PELO FATO DE O DEPOSITANTE CONSTANTE DA PETICAO DE REQUERIMENTO DO PEDIDO PCT SER DISTINTO DAQUELES QUE DEPOSITARAM A PRIORIDADE REIVINDICADA E NAO APRESENTOU DOCUMENTO DE CESSAO REGULARIZADO DENTRO DO PRAZO DE 60 DIAS A CONTAR DA DATA DA PUBLICACAO DA EXIGENCIA, CONFORME AS DISPOSICOES PREVISTAS NA LEI 9.279 DE 14/05/1996 (LPI) ART. 16 6O, ITEM 27 DO ATO NORMATIVO 128/97 E NO ART. 28 DA RESOLUCAO INPI-PR 77/2013.

B06U Preliminary requirement: requests with searches performed by other patent offices: procedure suspended [chapter 6.21 patent gazette]
B09A Decision: intention to grant [chapter 9.1 patent gazette]
B25G Requested change of headquarter approved

Owner name: SCTI HOLDINGS, INC. (US)

B16A Patent or certificate of addition of invention granted [chapter 16.1 patent gazette]

Free format text: PRAZO DE VALIDADE: 20 (VINTE) ANOS CONTADOS A PARTIR DE 12/11/2009, OBSERVADAS AS CONDICOES LEGAIS. PATENTE CONCEDIDA CONFORME ADI 5.529/DF, QUE DETERMINA A ALTERACAO DO PRAZO DE CONCESSAO.

B21F Lapse acc. art. 78, item iv - on non-payment of the annual fees in time

Free format text: REFERENTE A 14A ANUIDADE.

B24J Lapse because of non-payment of annual fees (definitively: art 78 iv lpi, resolution 113/2013 art. 12)

Free format text: EM VIRTUDE DA EXTINCAO PUBLICADA NA RPI 2748 DE 05-09-2023 E CONSIDERANDO AUSENCIA DE MANIFESTACAO DENTRO DOS PRAZOS LEGAIS, INFORMO QUE CABE SER MANTIDA A EXTINCAO DA PATENTE E SEUS CERTIFICADOS, CONFORME O DISPOSTO NO ARTIGO 12, DA RESOLUCAO 113/2013.