METODO E APARELHO DE AVALIAÇÃO DE QUALIDADE DESINAL NÃO INTRUSIVO"
CAMPO TÉCNICO
A presente invenção se refere a avaliação de qualidade de sinalnão intrusiva e, de forma especial à avaliação de qualidade de fala nãointrusiva.
CONHECIMENTO
Avaliação de qualidade de fala é um problema importante emcomunicações móveis. A qualidade de um sinal de fala é uma medidasubjetiva, esta pode ser expressa em termos de como natural os sons do sinalou quanto esforço é exigido para entender a mensagem. Em um testesubjetivo, fala é executada para um grupo de ouvintes, os quais são solicitadosa avaliar a qualidade deste sinal de fala, ver [1], [2].
A medida mais comum para opinião do usuário é o graduaçãode opinião média (MOS), obtido através da ponderação de classificações decategoria absolutas (ACR). Em ACR, ouvintes comparam o sinal distorcidocom seu modelo interno de fala de alta qualidade. Em testes de degradação deMOS (DMOS), os sujeitos primeiro ouvem a fala original, e então sãosolicitados a selecionar a classificação de categoria de degradação (DCR)correspondente para a distorção do sinal processado. Testes de DMOS sãomais comum em avaliação de qualidade de áudio qualidade, ver [3], [4].
Avaliação da qualidade ouvida como descrita em [l]-[4] não éa somente forma de monitoração de qualidade of serviço (QoS). Em muitoscasos, testes subjetivos conversacionais, ver [2], são os métodos preferidos deavaliação subjetiva, onde participantes mantêm conversação sobre um númerode redes diferente e votam na sua percepção de qualidade conversacional. Ummodelo objetivo de qualidade conversacional pode ser encontrado em [5].Ainda uma outra classe de monitoração de QoS consiste de testes deinteligibilidade. Os testes de inteligibilidade mais populares são os Teste deRhyme Diagnóstico (DRT) e Teste de Rhyme Modificado (MRT), ver [6].
Testes subjetivos são acreditados de dar a qualidade de fala"verdadeira". Contudo, o envolvimento de ouvintes humanos os torna caro econsumidores de tempo. Tais testes podem ser usados somente nos estágiosfinais do desenvolvimento de sistemas de comunicação por fala e não sãoadequados para medidas de QoS em uma base diária.
Testes objetivos usam expressões matemáticas paraprognosticar qualidade de fala. Seu baixo custo, significa que eles podem serusados para, de forma contínua, monitorar a qualidade através da rede. Duassituações de teste diferentes pode ser distinguidas:
• Intrusiva, onde ambos, o sinal original e o distorcido estãodisponíveis. Isto é ilustrado na Fig. 1, onde um sinal de sinal de referência épassado adiante para um sistema sob teste, que distorce o sinal de referência.O sinal distorcido e o sinal de referência são ambos passados adiante parauma unidade de medição de intrusiva 12, que estima a medida de qualidademedida para o sinal distorcido.
• Não intrusiva (algumas vezes também denotada "términoúnico" ou "sem referência"), onde somente o sinal distorcido está disponível.Isto é ilustrado na Fig. 2. Neste caso uma unidade de medição de não intrusiva14 estima a medida de qualidade diretamente do sinal distorcido sem acessoao sinal de referência.
A classe mais simples de medidas de qualidade de objetivointrusiva são algoritmos de comparação de forma de onda, tal como relaçãosinal-para-ruído (SNR) e relação sinal-para-ruído em segmento (SSNR). Osalgoritmos de comparação de forma de onda são simples de implementar erequerem complexidade computacional baixa, mas eles não se correlacionambem com medidas subjetiva se tipos diferentes de distorções são comparados.
Técnicas do domínio da freqüência, tal como a medida deItakura-Saito (IS), e a medida de distorção espectral (SD) são amplamenteusadas. Técnicas do domino da freqüência, não são sensitivas a deslocamentode tempo e são, de forma geral, mais consistentes com a percepção humana,ver [7].
Um número significativo de medidas no domínio da percepçãointrusivas têm sido desenvolvido. Essas medidas incorporam o conhecimentodo sistema de percepção humana. Imitação da percepção humana é usada pararedução de dimensão e um estágio "cognitivo" é usado para efetuar omapeamento para a escala de qualidade. O estágio cognitivo é treinado pormeio de um ou mais bancos de dados. Essas medidas incluem a DistorçãoEspectral de Bark (BSD), ver [8], Qualidade de fala Perceptual (PSQM), ver[9], e Blocos de Normalização de Medidas (MNB), ver [10], [11]. AvaliaçãoPerceptual de Qualidade de fala (PESQ), ver [12], e Avaliação Perceptual deQualidade de Audio (PEAQ), ver [13], são algoritmos do estado da técnicapadronizados para avaliação de qualidade intrusiva de fala e áudio,respectivamente.
Medidas de qualidade de fala de objetivo intrusiva existentespodem automaticamente avaliar o desempenho do sistema de comunicaçãosem a necessidade de ouvintes humanos ouvintes. Contudo, medidasintrusivas requerem acesso ao sinal original, que tipicamente não estádisponível na monitoração de QoS. Para tais aplicações, avaliação dequalidade não intrusiva precisa ser usada. Esses métodos freqüentementeincluem ambos, imitação de ambos, imitação de percepção humana e/ou ummapeamento para a medida de qualidade que é treinado usando os bancos dedados.
Uma tentativa anterior em direção a medida de qualidade defala não intrusiva com base em um espectrograma do sinal percebido éapresentado em [14]. O espectrograma é dividido, e o intervalo de dinâmica evariância é calculado de uma maneira de bloco a bloco. O nível médio dointervalo de dinâmica e variância é usado para prognosticar qualidade de fala.A avaliação de qualidade de fala não intrusiva reportada em[15] tenta prognosticar a probabilidade que a seqüência de áudio de passagemé gerada através do sistema de produção vocal humano. A seqüência de falasob avaliação é reduzida a um conjunto de características. Os dadosparametrizados são usados para estimar a qualidade percebida de formafisiológica, por meio de regras básicas.
A medida proposta em [16] é baseada na comparação da falaemitida com um sinal artificial de referência que é, de forma apropriada,selecionado, de forma ótima, de um livro de código agregado. No PerceptualLinear Prognóstico (PLP), ver [17], coeficientes são usados como umarepresentação paramétrica do sinal de fala. Um modelo polinomial de quintaordem é efetuado para suprimir detalhes dependentes de alto-falante doespectro auditivo. A distância média entre o vetor de teste desconhecido e omais próximo centróide de referência fornece uma indicação da degradaçãoda fala.
Algoritmos recentes com base em Modelos de probabilidadede mistura Gaussianos (GMM) de características derivadas das representaçõesde envelope espectral motivadas pela forma de percepção podem serencontradas em [18] e [19]. Um algoritmo novo de avaliação de qualidademotivado pela forma de percepção com base na representação de envelopetemporal da fala é apresentado em [20] e [21].
O padrão de União de Telecomunicação Internacional (ITU)para avaliação de qualidade não intrusiva, ITU-T P.563, pode ser encontradoem [22]. Um total de 51 características de fala é extraído do sinal.Características principais são usadas para determinar uma classe de distorçãodominante, e em cada classe de distorção, uma combinação linear dascaracterísticas é usada para prognosticar uma assim chamada qualidade defala intermediária. A qualidade de fala final é estimada da qualidadeintermediária e 11 características adicionais.As medidas listadas acima para avaliação de qualidade sãodesignadas para prognosticar os efeitos de muitos tipos de distorções, etipicamente tem complexidade computacional alta. Tais algoritmos serãoreferidos como fazedores de prognósticos de qualidade de fala geral. Temsido mostrado que prognóstico de qualidade não intrusiva é possível emcomplexidade muito mais baixa se é assumido que o tipo de distorção éconhecida, ver [23]. Contudo, a última classe de medidas é provável sofrer dedesempenho de prognóstico pobre se as condições de trabalho esperadas nãosão encontradas.
SUMÁRIO
Um objeto da presente invenção é um método de avaliação dequalidade de fala não intrusiva e aparelho tendo complexidade computacionalbaixa.
Este objeto é alcançado de acordo com as reivindicaçõesanexas.
A presente invenção faz prognóstico da qualidade de fala apartir das características genéricas comumente usadas em codificação de fala(referida como características por quadro), sem uma presunção do tipo dedistorção. No proposto método de avaliação de qualidade de fala não intrusivae de complexidade baixa, a estimativa de qualidade é em vez disso baseadaem propriedades estatísticas globais das características por quadro.
De forma breve, a presente invenção determina parâmetrosrepresentando quadros do sinal monitorado. A coleção de vetores decaracterística por quadro representando informação estrutural dos quadrosselecionados é extraída desses parâmetros. Um conjunto de característicasglobal é obtido da coleção de vetores de característica usando momentosestatísticos predeterminados de componentes de vetores de característicasselecionadas. Finalmente, uma medida de qualidade de sinal é prognosticada apartir do conjunto de características globais.DESCRIÇÃO BREVE DOS DESENHOS
A invenção, junto com objetos e vantagens adicionais dela,pode melhor ser entendida fazendo referência a seguinte descrição tomada emconjunto com os desenhos anexos, nos quais:
Fig. 1 é um diagrama em bloco ilustrando medição dequalidade de fala intrusiva;
Fig. 2 é um diagrama em bloco ilustrando medição dequalidade de fala não intrusiva;
Fig. 3 é um diagrama em bloco ilustrando percepção humanade qualidade de fala;
Fig. 4 é um fluxograma ilustrando o método de avaliação dequalidade de sinal de acordo com a presente invenção;
Fig. 5 é um fluxograma ilustrando a modalidade preferida dométodo de avaliação de qualidade de sinal de acordo com a presenteinvenção; e
Fig. 6 é um diagrama em bloco de uma modalidade preferidado aparelho de avaliação de qualidade de sinal de acordo com a presenteinvenção.
DESCRIÇÃO DETALHADANa seguinte descrição a invenção será descrita com referênciaa fala. Contudo, os mesmos princípios podem ser aplicados para outros tiposde sinal, tal como sinais de áudio e sinais de vídeo.
O processo de avaliação de qualidade de fala humano pode serdividido em duas partes: 1) conversão do sinal de fala recebido em excitaçãodos nervos auditivos para o cérebro, e 2) processamento cognitivo no cérebro.Isto é ilustrado na Fig. 3, onde um sinal distorcido é recebido por um bloco deprocessamento auditivo 16, que transforma o sinal em excitações de nervoque são passados adiante para um bloco de mapeamento cognitivo 18, queemite um sinal com uma certa qualidade percebida. O princípios principais detransformadas de percepção são encobrimento de sinal, resolução de espectrode banda crítica, curvas de sonoridade iguais, e lei de sonoridade deintensidade, e.g., [24]. Esses princípios são bem estudados e na maioria dosalgoritmos de avaliação de qualidade existentes em uma transformada depercepção é um estágio de pré-processamento. O propósito implícito principalda transformada de percepção é para efetuar uma redução de dimensãoconsistente da forma de percepção no sinal de fala. De forma ideal, umatransformação de percepção retém todas a informação relevante da forma depercepção, e descarta toda a informação irrelevante da forma de percepção.
Na prática, aproximações e simplificações precisam ser feitas e este objetivopode não ser encontrado. Em alguns casos, transformações de percepçãopodem terminal custos computacionais altos. Para evitar essas limitações empotencial, o método de avaliação da presente invenção não efetua tal umatransformada de percepção. Em vez disso a dimensionalidade épreferencialmente reduzida, de forma simultânea, com a otimização doscoeficientes da função de mapeamento. Esta meta é minimizar a perda deinformação relevante. Esta abordagem é consistente com o aparecimentorecente de algoritmos efetuando avaliação de qualidade sem a transformadade percepção na avaliação de qualidade de imagem [25].
Muitos dos algoritmos existentes de avaliação de qualidadeexistentes são baseados nos modelos específicos de distorção, i.e., nível deruído de fundo, ruído multiplicativo, presença de tons de campainha [22], ousimulam uma distorção conhecida como características de receptor de fontede energia de ouvido [12]. A presente invenção não incorpora um modeloexplícito da distorção. A estimativa de qualidade de fala é baseada totalmentenas estatísticas de um sinal de fala processado, e a distorção é, de formaimplícita, avaliada por segunda unidade de entrada impacto nessasestatísticas. Como um resultado, a presente invenção é facilmente adaptadapara os sistemas de comunicação de próxima geração que provavelmenteproduzir novos tipos de distorções.
Em alguns métodos, a informação dependente do alto-falante éremovida [18], [16]. Contudo, é conhecido que sistemas de telefoniafornecem graduações de qualidade mais alta para algumas vozes do que paraoutras [26]. Por conseguinte, se o algoritmo é para ser usado emmonitoramento da rede contínuo, e o material de fala balanceado paraponderação não pode ser garantido,a informação dependente de alto-falante érelevante. O método de acordo com a presente invenção incorpora ainformação dependente de alto-falante, por exemplo na forma do período deocorrência dos coeficientes de um modelo auto regressivo (AR) de décimaordem, estimado por meio de prognóstico linear.
Uma elocução usada para medições de qualidade é tipicamenteum conjunto de curtas sentenças separadas por uma pausa de, por exemplo,0,5 segundos. O comprimento total de uma elocução é tipicamente deaproximadamente 8 segundos. Contudo, em geral, uma elocução podesimplesmente ser vista como um intervalo ou bloco de sinal. O método deavaliação da presente invenção faz prognóstico de qualidade de fala de umaelocução usando um conjunto simples de características que pode ser derivadoda forma de onda do sinal de fala ou, em uma modalidade preferida, estãofacilmente disponíveis a partir dos codecs de fala na rede. A qualidade de falaé prognosticada em complexidade computacional baixa, que torna o métodoútil para aplicações práticas.
O núcleo do método de avaliação de qualidade de sinal deacordo com a presente invenção é um vetor de características Φ(η) por quadrode múltiplas dimensões (preferencialmente de Expressão 11 dimensões parafala; outros números também são possíveis e o número de dimensões tambémdepende do tipo de sinal, fala, áudio, vídeo, etc), os componentes dos quaisestão definidas no APENDICE I. A qualidade de fala não é prognosticadadiretamente a partir do vetor por quadro, mas de suas propriedades estatísticasglobais, descrita como média, variância, inclinação, e kurtosis dascaracterísticas por quadro sobre muitos quadros, por exemplo sobre umaelocução. As propriedades estatísticas das características por quadro (referidascomo conjunto de características global Ψ) formam a entrada para omapeamento de GMM (Modelo de Probabilidade de Mistura Gaussiano), queestima o nível de qualidade de fala sobre uma escala de MOS, como descritaem detalhe no APÊNDICE III.
Fig. 4 é um fluxograma ilustrando o método de avaliação dequalidade de sinal de acordo com a presente invenção. No estágio S1 um sinalde fala é codificado em uma seqüência de bit de quadros incluindo parâmetrosde fala. Estágio S2 extrai uma vetor de característica Φ(η) (por quadro) dosparâmetros de fala para cada quadro de interesse. No estágio S3 aspropriedades estatísticas desses vetores de característica são usadas paraformar um conjunto de característica Ψ global (por elocução). Finalmente, noestágio S4 a qualidade de fala é prognosticada a partir do conjunto decaracterísticas global usando mapeamento de GMM.
A base do aparelho e método de avaliação de qualidade desinal de acordo com a presente invenção é a extração de um vetor decaracterística. O conjunto de características usado auxilia a capturar ainformação estrutural a partir de um sinal de fala. Isto é motivado pelo fatoque o sinal de fala natura é altamente estruturado, e é provável que ojulgamento de qualidade humano se baseie em padrões extraídos dainformação descrevendo essa estrutura. APÊNDICE I define um conjunto of11 características adequadas, que são coletadas em um vetor de característicapor quadro:
<table>table see original document page 10</column></row><table>
onde η denota ο número do quadro.
De acordo com a presente invenção é assumido que aqualidade de fala pode ser estimada a partir das propriedades estatísticasdessas características por quadro. Suas distribuições de probabilidade sãodescritas com a média, variância, inclinação, e kurtosis. Esses momentosestatísticos são calculados, de forma independente para cada característica porquadro, e isto fornece um conjunto de características que, de forma globaldescrevem uma elocução de fala (características globais):
<formula>formula see original document page 11</formula>
Aqui Ω denota o conjunto de quadros, de cardinalidade(tamanho) r^, usado para calcular estatísticas para cada uma dascaracterísticas por quadro Oi (n). As características globais são agrupadas emum conjunto de características globais:
<formula>formula see original document page 11</formula>
Preferencialmente a complexidade desses cálculos é reduzida.
APENDICE II descreve um procedimento de redução de dimensionalidadeem dois estágios que:
• Extrai o "melhor" sub-conjunto " de quadros fora doconjunto de todos os quadros na elocução.
• Transforma conjunto de características globais Ψ em umconjunto de características globais Ψ de dimensionalidade mais baixa.Em uma modalidade preferida da presente invenção acaracterísticas por quadro do enésimo quadro são calculados diretamenteda variância Ee da excitação do modelo de AR, o período de ocorrência Te o vetor de dez dimensões dos coeficientes f de freqüência espectral emlinha (LSF), determinada sobre 20 ms de quadros de fala. Já que Ee, T e fsão prontamente acessíveis na rede no caso de codificadores dePrognóstico Linear Excitado por Código (CELP) [27], esta modalidade deuma invenção tem a vantagem adicional de extrair o vetor por quadrodiretamente dos parâmetros de rede na seqüência de bit, que é maisimplementações do que extraí-lo da forma de onda do sinal. Serádemonstrado que as características por quadro Φ(η) podem ser calculadasde {Een, Tn, fn} e (Een Tn.l5 fn}. Então será mostrado como aspropriedades estatísticas globais são calculadas, de forma recursiva, semarmazenar as características por quadro para a elocução inteira em umaárea de armazenamento temporário. O período de ocorrência Tn écalculado de acordo com [40], e os coeficientes de AR são extraídos dosinal de fala a cada 20 ms sem sobrepor.
Para manter a complexidade do método baixa, ascaracterísticas por quadro: planicidade espectral, dinâmica espectral, ecentróide espectral são aproximadas. As aproximações são baseadasinteiramente na seqüência de bit codificada de fala, e por meio disso areconstrução do sinal é evitada.
Em uma modalidade preferida da presente invenção aplanicidade espectral é aproximada conforme a proporção da variância de errode prognóstico de décima ordem e a variância do sinal:
<formula>formula see original document page 12</formula>
Dada a variância da excitação do modelo de AR, sua definição
<formula>formula see original document page 12</formula>e coeficientes de AR aÍ5 o sinal de variância é calculado semreconstruir a forma de onda Sjc usando a recursão reversa de Levinson-Durbin(algoritmo de estágio abaixo).
As dinâmicas espectrais são preferencialmente aproximadaspor uma descrição paramétrica do envelope do espectro, por exemplo comouma distância ponderada Euclideana no espaço de LSF:
<formula>formula see original document page 13</formula>
onde a ponderação média de harmônico inversa [41] é definidapelos componentes do vetor de LSF:
Em uma modalidade preferida da presente invenção as médiassão também usadas para obter um centróide espectral aproximado:
<formula>formula see original document page 13</formula>
As características globais selecionadas são calculadas, deforma recursiva, i.e., as características por quadros não são armazenada emuma área de armazenamento temporário. Até o fim da elocução, a média é, deforma recursiva atualizada de acordo com:
<formula>formula see original document page 13</formula>
para obter a μφ. aqui η é o índice sobre o conjunto dequadro aceito como discutido no APÊNDICE II. Em um modo similar,são propagados para obter os momentos centrais μφ , μφ eμφ4. Essas quantidades são usadas para obter as características globaisremanescentes, a saber variância, inclinação, e kurtosis como:<formula>formula see original document page 14</formula>
A modalidade preferida do método de acordo com a presenteinvenção é ilustrada na Fig. 5. Ela inclui os seguintes estágios:
S5. Para o enésimo quadro de fala determina {Een, Tn, fn} e{Een.i, Tn, fn-1} da forma de onda ou extraí da seqüência de bit.
S6. Determinar vetor de característica por quadro Φ(η), combase em (Een, Tn, fn} e os correspondentes parâmetros (Een _i, Tn, fn_i} doquadro anterior, que são armazenadas em uma área de armazenamentotemporário.
Estágios S5 e S6 são efetuados para todos os quadros daelocução.
S7. A partir de um sub-conjunto selecionado & de quadros, deforma recursiva, determinar os momentos centrais ( μφ; μ®2, μφ3 e |ΐφ4}.Quadro Seleção de quadro (APENDICE II) é controlada pelo limite ou janelade várias dimensões Θ.
S8. Ao final da elocução calcular o conjunto de característicasglobal Ψ = ( μφϊ, σφ}, s φ,, k®, } selecionado (equação (23) of APENDICE II)como média, variância, inclinação, e kurtosis das características por quadro.
S9. Prognosticar a qualidade de fala da elocução como afunção do conjunto de características global Q = Q(1F) através de mapeamentode GMM, conforme descrito no APÊNDICE III.
Fig. 6 é um diagrama em bloco de uma modalidade preferidado aparelho de avaliação de qualidade do sinal de acordo com a presenteinvenção. Um sinal codificado de fala (seqüência de bit) é recebido através deum calculador de vetor de características 60, que determina o vetor decaracterísticas Φ(η) do quadro corrente η dos parâmetros de fala (Een, Tn, fn}.O vetor de características é passado adiante para um seletor de quadro 62, quedetermina se ele está dentro da janela de várias dimensões definida pelo limiteΘ, que é armazenada no depósito 64 e tem sido determinada por tentativacomo descrito no APÊNDICE II e IV. Os componentes do vetor decaracterísticas Φι (η), O2 (n),...On (η) dos quadros selecionados são passadosadiante para os respectivos calculadores 66, 68, 70, 72, que, de formarecursiva, calculam momentos centrais de cada componente. Na Fig. 6somente os calculadores para O1 tem sido ilustrados de forma explícita, oscorrespondentes calculadores para os componentes remanescentes tem sidoindicados por pontos. Os momentos centrais são passados adiante para oscalculadores de características globais 74, que determinam as característicasglobais de cada componente de vetor de características de acordo com aequação (13). O conjunto de características globais resultante é passadoadiante para um previsor de qualidade, que determina uma estimativa dequalidade Q como descrito no APÊNDICE III.
Efetivamente, em uma implementação prática, todos oscalculadores de momentos centrais 66, 68, 79, 72 pode não ser exigidos paracada componente de vetor de características Oj, já que a redução dadimensionalidade do conjunto de características globais Ψ pode reduzir onúmero de características globais requeridas, como ilustrado pela equação
(23) no APENDICE II. Neste caso, calculador 72 para componente de vetorde características Oi pode ser omitido, já que k®,, tem sido descartado naredução de dimensionalidade do conjunto de características global Ψ. Osmomentos centrais requeridos efetivamente dependem dos resultados daredução de dimensionalidade do conjunto de características global Ψ, que porsua vez também depende do tipo de sinal tipo (fala, áudio, vídeo, etc).
A funcionalidade do aparelho de avaliação da presenteinvenção é tipicamente implementada por um micro processador ou por umacombinação micro/processador de sinal e software correspondente.Embora o prognóstico de qualidade efetuado pela presenteinvenção seja baseado no mapeamento de modelo de probabilidade deMistura Gaussiana, outras alternativas factíveis são os modelos de redesneural e de Markov escondido.
O desempenho do método de avaliação de qualidade de acordocom a presente invenção tem sido avaliado, de forma experimental. Osresultados são dados no APENDICE V.
Um aspecto não coberto, de forma explícita, na descriçãoacima são os parâmetros afetando a qualidade de fala, embora nãodiretamente acoplados ao sinal de fala original. Tais parâmetros são, e.g.ruído de fundo para a entrada de fala ou tipo de alto-falante (e.g. gênero) ouentrada sinais não de fala como música, ou o estilo de música (e.g. pop, jazz,clássico,...), ou parâmetros relacionados ao sistema de transmissão, tais como:
• O uso de um sistema de VAD /DTX para transmissãoeficiente de fala inativa
• O uso (existência) de um supressor de ruído antes ou nodecorres da codificação de fala
• O método de codificação de fala e sua configuração (codecselecionado e seu modo ou taxa de bit)
Indicadores de quadro ruim indicando que um quadro docodec é, não usável, de forma parcial, ou completamente, devido a erros detransmissão
• Um parâmetro de probabilidade para a ocorrência de erros detransmissão na seqüência de bit de fala recebida, que pode ser derivado devários estágios de processamento no receptor.
• Um possível codec em tandem envolvendo uma multidão dedecodificações e re-codificações do sinal de fala
• Modificação da escala de tempo possível da fala em conjuntocom o uso de uma área de armazenamento temporário de variação adaptativa.Esses parâmetros têm uma imediata influência na qualidade defala resultante após a decodificação. A aplicação direta da presente invençãovai ignorar esses parâmetros, que conduzem para a vantagem de um métodode avaliação de qualidade universal com complexidade baixa.
Contudo, pelo menos, algum desses parâmetros sãoconhecidos ou podem ser conhecidos a priori ou podem ser deduzidos usandodetectores correspondentes ou podem ser obtidos por meio de sinalizaçãoatravés do sistema de transmissão de fala. Como um exemplo, condições demúsica ou de ruído de fundo ou a existência da supressão de ruído podem serdetectadas usando métodos de detecção do estado da técnica. Meios desinalização são adequados para identificar os outros mencionados parâmetros.Uma modalidade específica da invenção fazendo uso dos parâmetros aprioridade é para usar vários exemplos do método de avaliação de qualidadede acordo com a presente invenção, que são treinados para diferentesconjuntos desses parâmetros. De acordo com esta modalidade o exemplo dométodo de avaliação que é mais adequado presentemente para um dadoconjunto de parâmetros a priori é primeiro identificado e selecionado. Em umsegundo estágio o exemplo selecionado é executado rendendo a estimativa dequalidade de fala desejada.
Uma modalidade adicional é executar um exemplo único deum método de avaliação de qualidade de acordo com a presente invenção,seguido de um estágio de processamento adicional levando em conta osparâmetros a priori. De forma específica, o segundo estágio pode efetuar ummapeamento do valor de saída do método de avaliação do primeiro estágio edos vários parâmetros a priori para a saída final da estimativa da qualidade defala. O mapeamento deste segundo estágio pode ser feito de acordo comtécnicas conhecidas tal um método de adequação de dados de quadradosmínimos linear ou não linear ou mapeamentos de GMM. Mesmo umapossibilidade adicional seja combinar o estágio de mapeamento final deGMM de um método de avaliação de qualidade com o mapeamento desegundo estágio descrito, que essencialmente estende o vetor decaracterísticas globais (por elocução) através do conjunto dos parâmetros apriori.
Ainda uma modalidade adicional para tornar o método maisaplicável para não fala, e música em particular, é permitir adaptações dascaracterísticas ' por quadro" locais usadas. Música em geral não é bemcodificada com codecs de fala, já que música não vai de encontro ao modelode produção de fala existentes dos codecs de fala. Mais propriamente, músicaé preferencialmente codificada com base nos modelos de percepção (daaudição), não assumindo qualquer modelo particular da produção de sinalfonte. Considerando este fato, uma adaptação das características "por quadro"locais significa, preferencialmente, usar parâmetros derivados de tal ummodelo de percepção, pelo menos, em adição aos parâmetros apresentados.Particularmente, este é o caso se o codec usado é um codec de áudio maispropriamente do que codec de fala.
Um outro aspecto é que a descrição acima descreve a invençãoem uma forma de regressão, que efetua um mapeamento contínuo. Contudo, ométodo é também aplicável para um mapeamento discreto para pré-definir aescala de qualidade discreta (intervalos pré-definidos) por meio do uso de umclassificador. Então, o termo "mapeamento" deves em resposta interpretadoem um sentido geral que também cobre o caso discreto de usar umclassificador. Um exemplo simples com um classificar é um sistema com baseno método de avaliação de qualidade descrito que não faz prognóstico dequalidade em uma escala contínua, mas tem um resultado binário, porexemplo: 0) qualidade está abaixo de um limite e 1) qualidade está acima deum limite. Este exemplo corresponde a um sistema que tem a habilidade dedetectar se uma particular distorção ou nível de qualidade está ou nãopresente.As várias modalidades da presente invenção conduzem a umaou várias das seguintes vantagens:
• Qualidade de fala pode ser prognosticada a partir dosparâmetros da seqüência de bit (em um caso de codecs CELP), semreconstrução da forma de onda. Isto, junto com o fato que transformada para odomínio da percepção não usado, conduz a requisitos baixos de computação ede memória (a complexidade de umas poucas centenas de vezes mais baixa doque o padrão ITU existente).
• A qualidade de fala é prognosticada a partir das propriedadesestatísticas das características: planicidade espectral, centróide espectral,dinâmica espectral, período de ocorrência, sinal variância de sinal, variânciado sinal de excitação sinal, e outras derivadas no tempo. As propriedadesestatísticas dessas características são descritas por meio sua média, variância,inclinação, e kurtosis. Este tipo de característica e sua descrição não requeremque o sinal de fala seja armazenado. Em uma área de armazenamentotemporário são armazenados somente uns poucos (por exemplo 12)parâmetros escalares do quadro anterior.
• Um novo método pode ser usado para derivar ascaracterísticas por quadro (planicidade espectral, dinâmica espectral, etc.)diretamente da seqüência de bit, sem reconstruir a forma de onda(reconstrução do sinal não é não complexa por si só, a complexidade ocorrequando as características são extraídas do sinal reconstruído).
• A qualidade de fala pode ser prognosticada a partir desomente um sub-conjunto de quadros. Um novo método é usado para extrairos quadros que contem informação útil (nos método existente de avaliação dequalidade, rejeição de quadro é baseado em um simples limite de energia oudetector de atividade de fala). O método proposto generaliza esta abordagem.Diferentes sub conjuntos de quadros podem ser usados para estimar aspropriedades estatísticas de características diferentes. Rejeição de quadro nãoé somente uma função de energia, mas de todas as características por quadro.O método de seleção de quadro pode ser otimizado em conjunto com a funçãode regressão (classificador).
• O método proposto, de forma significativa, executa a ITU-TP.563 nas simulações formadas, com relação ao coeficiente de correlação e aoerro de raiz quadra média.
Será entendido por aqueles com qualificação na arte que váriasmodificações e mudanças podem ser feitas para a presente invenção sem fugirdo escopo da dela, que é definido pelas reivindicações anexas.
APÊNDICE ISELEÇÃO DE CARACTERÍSTICA
Este apêndice vai definir um conjunto adequado decaracterísticas a ser incluído em um vetor de características por quadro Φ(η).este conjunto é especificamente adequado para sinal de fala.
Uma primeira característica por quadro de interesse é a medidarepresentando o conteúdo de informação no sinal, tal como a medida deplanicidade espectral descrita em [28]. Esta é relacionada com a força daestrutura ressonante no espectro de potência e é definida como:
<formula>formula see original document page 20</formula>
onde o envelope de AR (Auto-Regressivo) P ^ é definidocomo a resposta de freqüência do modelo de AR modelo com coeficientes ak,i.e.
<formula>formula see original document page 20</formula>
O índice de quadro é denotado por n, e ρ é a ordem da análisede prognóstico linear, tipicamente configurado to 10 para sinais amostradosem 8 kHz.
Uma segunda característica por quadro é a medidarepresentando a estabilidade do sinal, tal como a dinâmica espectral, definidacomo:
<formula>formula see original document page 21</formula>
A característica da dinâmica espectral tem sido estudadas ecom sucesso usada em codificação de fala [29], [30] e aprimoramento de fala[31].
Uma terceira característica de interesse é a medidarepresentando a distribuição de energia do sinal sobre freqüências, tal como ocentróide espectral [32], que determina a área de freqüência em torno da quala maioria da energia do sinal se concentra. Isto é definido como:
<formula>formula see original document page 21</formula>
e isto é também freqüentemente usado como uma aproximaçãode uma medida de "luminosidade" de percepção.
Três características por quadro adicionais são a variância daexcitação do modelo de AR modelo Een,, a variância do sinal de fala variânciaEsn, e o período de ocorrência Tn,. Elas serão denotadas como Φ4 (η), Φ5 (η), eO6 (η), respectivamente.
04 (η) = Een, a variância da excitação do modelo de AR
05 (n) = Een, a variância do sinal de fala (18)
06 (n) = Tn, o período de ocorrência
As características por quadro apresentadas acima, e suasprimeiras derivadas no tempo (excetos as derivadas das dinâmicas espectrais)são agrupadas em um vetor de características por quadro de 11 dimensõesΦ(η), os componentes dos quais são resumidos na Tabela I abaixo.Tabela 1
Elementos do vetor de características por quadro
<formula>formula see original document page 22</formula>
APÊNDICE II
REDUÇÃO DE DIMENSÃOALIDADE
Redução de dimensionalidade pode ser obtida através daseleção de quadro, global seleção de características globais ou umacombinação de ambos os procedimentos de seleção. Um propósito daredução de dimensionalidade é melhorar a precisão de prognóstico dosistema de avaliação de qualidade removendo dados irrelevantes eredundantes. Um outro propósito é reduzir a complexidadecomputacional. A redução de dimensionalidade apresentada nesteapêndice é baseada em um procedimento de treinamento que será descritoem detalhes no APÊNDICE IV.
Uma comumente abordagem usada na literatura de avaliaçãode qualidade, é remover regiões de não fala com base em um detector deatividade de fala ou um limite de energia [33]. A presente invenção sugereuma generalização deste conceito considerando limites de atividade em todasas dimensões de característica por quadro.
O esquema, apresentado no método de seleção de quadroabaixo permite quadros ativos de fala a serem excluídos se eles nãotransportam informação que melhora a precisão do prognóstico de qualidadede fala. O conceito do algoritmo de seleção de quadro é aceitar somentequadros onde o vetor de características por quadro Φ(η) se encontra dentre ouna superfície do "hyperbox" de 11 dimensões ou janela de várias dimensõesdefinida por um vetor limite vetor Θ. Em pseudo código o método pode serdescrito por:
MÉTODO DE SELEÇÃO DE QUADRO
Ω = {0} Configurar subconjunto " para conjunto vaziopara η € Ω para cada quadro no conjunto de quadro original Ωse Φι (η) € [ 0]L' O1uJ & se vetor de características está dentroda "janela'
Φ2 (n) e [ 02L, 02U]&
Φ11(n)e[0uL' 011u]
Então Ω = Ω + |n} Adiciona quadro η ao subconjunto
O conjunto ótimo de quadros é determinado pelo limite oujanela de várias dimensões 0 = { 0^' O111} i=11n i.e. ^ depende de 0, ou ^= & (0). Nos procuramos pelo limite 0 que minimiza o critério ε:
<formula>formula see original document page 23</formula>
O critério ε é calculado como o desempenho de erro da médiada raiz quadrada (RMSE) do método de avaliação de qualidade de acordocom a presente invenção, i.e.:
<formula>formula see original document page 23</formula>
onde Q é a qualidade prognosticada, e é Q a qualidadesubjetiva. Aqui N é o número de elocuções rotuladas de MOS usado naavaliação, ver APENDICE IV. A otimização do limite 0 é baseado noconjunto inteiro de características globais Ψ. A otimização de ε em (19), como algoritmo de seleção de quadro descrito acima, resultas no seguinte critériopara a aceitação do enésimo quadro:<formula>formula see original document page 24</formula>
com os valores limite ©5L= 3,10, Θχυ = 0.67, e Θ2υ = 4,21.
De (21) é visto que somente três características por quadro têmimpacto significativo na seleção de quadro, a saber variância de fala Φ5,planicidade espectral O1, e dinâmica espectral Φ2. A primeira e segundadesigualdade em (21) somente aceitam quadros com alta energia e umaestrutura de formação clara. Isto sugere que um algoritmo de avaliação dequalidade da presente invenção extrai informação sobre a qualidade de falapredominantemente de regiões de fala manifestadas. A terceira desigualdadesomente seleciona regiões de fala estacionárias. O último resultado éprovavelmente devido a distorção sendo mais facilmente percebida nasregiões de repouso do sinal de fala.
Como pode ser visto do critério (21), o limite ou janela devárias dimensões pode ter restrições efetivas somente em poucasdimensões. Nas outras dimensões a janela pode ser considerada como umajanela infinita. Ainda mais, mesmo em dimensões restritas, a janela podeter uma fronteira ou limite somente em uma direção. Em geral a janela devárias dimensões é mais restritiva na seleção de quadro do que o detectorde atividade de fala pura, que conduz a rejeição de mais quadros seminformação relevante para a avaliação da qualidade. Este por sua vezconduz a médias de qualidade mais confiáveis.
Uma alternativa viável para a janela retangular para cadadimensão é uma janela suave, por exemplo uma janela Gaussiana, comcada função Gaussiana tendo sua média e variância individual. Cadacomponente de vetor vai então corresponder a um valor de funçãoGaussiana. Um quadro seria aceito se o produto desses valores de funçãoexcede um certo limite.
O critério (21) reduz, de forma significativa, o número dequadros processados através de um algoritmo de avaliação de qualidade. Onúmero de quadros selecionados varia com alto-falantes e sentenças, etipicamente & contém entre 20% e 50% do conjunto de quadro total Ω.
Uma vez que o subconjunto ótimo de quadros & foiencontrado, uma procura pelo subconjunto ótimo de características globais Ψpode ser efetuada, este estágio de otimização é definido como a seguir: dado oconjunto original de características globais Ψ de cardinalidade | Ψ |, e oconjunto ótimo de quadros Ω, selecionar um subconjunto de característicasglobais ¥ C Ψ de cardinalidade < |Ψ| que é otimizada para o desempenhode um algoritmo de avaliação de qualidade:
<formula>formula see original document page 25</formula>
Um procura total é somente um procedimento de reduçãode dimensionalidade que garante que uma ótima global seja encontrada.Contudo, é raramente aplicado devido a seus requisitos computacionais. Abem conhecida Seleção para frente Seqüencial e Seleção para trásSeqüencial, e.g., [34] são estágios [ótimo somente, já que a melhor (pior)característica global é adicionada (descartada), mas a decisão não podeser corrigida em um estágio mais tarde. O algoritmo mais avançado (L,R)[35] consiste em aplicar Seleção para frente Seqüencial L times, seguidode R estágios de Seleção para trás Seqüencial. Os métodos de BuscaFlutuante [36] são extensões dos (L,R) métodos de procura, onde onúmero estágios para à frente e para trás não são pré-definidos, masobtidos de forma dinâmica. Em nossas experiência nos temos usado oprocedimento de Seleção para trás Flutuante Seqüencial, que consiste emaplicar após cada estágio para trás um número de estágios para à frenteenquanto os subconjuntos resultantes forem melhores do que aquelesanteriormente avaliados, como ilustrado pelo seguinte método:PROCEDIMENTO DE SELEÇÃO PARA TRÁS FLUTUANTESEQÜENCIAL
<formula>formula see original document page 26</formula>
Após a otimização de ε. em (22), a dimensionalidade doconjunto de características globais é reduzida de 44 to 14, i.e. | ^ | = 14, eesses elementos são:
<formula>formula see original document page 26</formula>
É notado todas as características por quadro estão presentes(através de suas representações estatística das características globais) noconjunto mas a variância de sinal de fala Φ5, e as derivadas da variânciado sinal de excitação, Φ9, são mais freqüentes. Uma outra observação é que ascaracterísticas globais de fala com base somente nos primeiros três momentosestão presentes, e que as características globais com base na kurtosis parecemser menos importante.
APÊNDICE III
E S TIMAITVA DE QUALIDADE
Deixe Q denotar a qualidade subjetiva de uma elocução comoobtida do banco de dados de treinamento rotulado de MOS. Construir umelaborador de estimativa de objetivo ^ da qualidade subjetiva como umafunção de um conjunto de características globais, i.e. 0 = Q (Φ), e procurapara a função mais perto da qualidade subjetiva com relação ao critério:
<formula>formula see original document page 26</formula>onde E{ } é o operador de expectativa. O critério definidoacima é a medida probabilística correspondendo a (22) no APÊNDICE II. Ébem conhecido, e.g., [37], que equação (24) é minimizada pela expectativacondicional:
ρ(ψ) = Ε{θ|ψ} (25)
e o problema reduz para a estimativa da probabilidadecondicional. Para facilitar esta estimativa, a densidade conjunta das variáveisde características globais com as graduações de MOS subjetivas podem sermodeladas como um GMM (Modelo de Probabilidade de Mistura Gaussiano):
<formula>formula see original document page 27</formula>
onde φ = [ Q, ^ ], m é o índice de componente de mistura,G0(m) são os pesos da mistura, e N (φ|μ(ΐΏ), £(m)) são densidades variadasGaussianas, com μ(ιη), £(m) sendo as matrizes de média e a de covariância dasdensidades Gaussianas, respectivamente. O GMM é completamenteespecificado por um conjunto de vetores de média, matrizes de covariância epesos de mistura:
<formula>formula see original document page 27</formula>
e esses coeficientes são estimados fora de linha a partir de umconjunto de treinamento grande usando um algoritmo de maximização deexpectativa (EM) [38]. Detalhes sobre os dados usados para exercício sãoapresentados no APENDICE IV. Experimentos tem mostrado que é suficienteusar 12 matrizes de covariância completa (14 χ 14), i.e., paradimensionalidade K = 14eM = 12 Gaussianas, isto corresponde a M(1 + K +K(K + 1) / 2) = 1440 parâmetros de treinamento.
Usando o modelo de mistura Gaussiano de junção, aexpectativa condicional (25) pode ser expressa como uma soma ponderada deexpectativas condicionais de componente inteligente, que é uma bemconhecida propriedade do caso Gaussiano [39]. Então, o elaborador deestimativa de qualidade ótima (25) pode ser expressa como:
<formula>formula see original document page 28</formula>onde
<formula>formula see original document page 28</formula>
e
<formula>formula see original document page 28</formula>
com μφ(m), μ<5(Γη), Ψ (m)' £ *fq(m) sendo as matrizes de média,covariância e covariância cruzada de Ψ e Q no m-ésimo componente demistura.
APÊNDICE IV
TREINAMENTO
Para o procedimento de avaliação e treinamento nos usamos11 banco de dados rotulados de MOS fornecidos por Ericsson AB e 7 bancosde dados rotulados de forma similar do ITU-T P.Supp 23 [43]. Dados comgraduações de DMOS foram excluídas a partir dos nossos experimentos, e.g.,do ITU-T P.Supp 23 nós excluímos o Experimento 2. O material de falanesses bancos de dados contém elocuções nos seguintes idiomas: Inglês,Francês, Japonês, Italiano e Sueco. Os bancos de dados contém uma grandevariedade de distorções, tal como: codificação diferentes, em tandem, econdições de unidade de referência de ruído modulada (MNRU) [44], assimcomo perda de pacote, ruído de fundo, efeitos de supressão de ruído, efeitosde comutação, níveis de entrada diferentes, etc. O tamanho total da união debancos de dados é 7646 elocuções com comprimento médio de 8s.
Divide-se os bancos de dados disponíveis em duas partes,conjunto de teste e conjunto de conjunto de treinamento. O conjunto de teste ébaseado em 7 bancos de dados do ITUT P.Supp 23 (1328 elocuções), e oconjunto de treinamento é baseado em 11 bancos de dados (6318 elocuções)da Ericsson. O conjunto de teste não está disponível durante o treinamento,mas usado somente para avaliação. O treinamento usada para a redução deesquema de dimensionalidade e experimentos de avaliação de desempenho étotalmente baseada no conjunto de treinamento. Para melhorar desempenhode generalização nos usamos um treinamento com procedimento de ruído[45]. Nos criamos padrões de treinamento virtuais ("ruidoso"), adicionandoruído médio de branco Gaussiano zero, na SNR de 20 dB para o conjunto decaracterísticas globais Ψ. Desta maneira para cada conjunto de característicasglobais nos criamos quatro conjuntos virtuais, e o treinamento é baseada naunião das características "originais" e "ruidosas".
APÊNDICE V
AVALIAÇÃO DE DESEMPENHO
Este apêndice apresenta resultados dos experimentos, comrelação a ambos, precisão de prognóstico e complexidade computacional dométodo proposto. O desempenho do método proposto é comparado ao métodopadronizado da ITU-T P.563. O desempenho da estimativa é avaliado usandoum coeficiente R de correlação por condição entre a qualidade prognosticadaQ ea qualidade subjetiva Q de acordo com a equação:
<formula>formula see original document page 29</formula>
onde Mq e Mq , sã0 os valores médios das variáveis introduzidas, esomatório é sobre as condições. Tabela Π contém os resultados de desempenhoem termos da métrica de desempenho selecionada sobre um conjunto de teste de 7bancos de dados da ITU-T P.Supp 23. A ITU-T P.Supp 23 Exp 1 contémdistorções de codificação de fala, produzidas por sete codecs de fala padrões(predominantemente usando codec de fala usando G.729 [46]) sozinhos, ou emconfiguração em tandem. Na ITU-T P.Supp 23 Exp 3 o codec de fala G.729 éavaliado sob várias condições de erros de canal como apagamento de quadro, errode bit aleatório, e ruído de fundo. O resultado dos testes, apresentado na tabela Πabaixo claramente indica que o método de avaliação de qualidade propostoexecuta o método padronizado da ITUT P.563.
Tempo de processamento e requisitos de memória são figurasimportantes de mérito para método de avaliação de qualidades. O método deacordo com a presente invenção tem requisitos de memória insignificante: aárea de armazenamento temporário de 12+12 valores escalar, calculado apartir do quadro anterior e corrente é necessário (futuros quadros não sãorequeridos), assim como a memória para a mistura de 12 Gaussianos.
Tabela II
COEFICIENTE DE CORRELAÇÃO POR CONDIÇÃO
<table>table see original document page 30</column></row><table>
Tabela III demonstra a diferença em complexidadecomputacional entre o método de avaliação de qualidade proposto e o métododa ITU-T P.563. A comparação é entre a implementação de ANSI-Cotimizada do método da ITU-T P.563 e a implementação de MATLAB® 7 dainvenção, ambos executados em uma máquina de Pentium 4 em 2,8 GHz com1 GB de RAM. O caso onde as características de entrada {Een, Tn, fn} estãoprontamente disponíveis a partir dos codecs usados na rede, é denotado NET.
TABELA III
<table>table see original document page 30</column></row><table>REFERÊNCIAS
[1] ITU-T Rec. Ρ.830, "Subjetiva desempenho assessment oftelephone-band e wideband digital codecs", 1996.
[2] ITU-T Rec. P.800, "Methods for Subjetiva Determinationof Transmission Quality", 1996.
[3] ITU-R Rec. BS. 1534-1, "Methods for the subjectiveassessment of intermediate qualidade levei of coding sistemas", 2005.
[4] ITU-R Rec. BS. 1284-1, "General Methods for thesubjective assessment of sound qualidade ", 2003.
[5] ITU-T Rec. G.107, "The e-modelo, a computationalmodelo para use in transmissão planning", 2005.
[6] M. Goldstein, "Classification of methods used forassessment of text-to- speech sistemas according to the demands placed onthe listener", Speech Comunicação, vol. 16, pp. 225-244, 1995.
[7] S. Quackenbush, T. Barnwell, e M. Clements, ObjectiveMeasures of Speech Qualidade. Prentice Hall, 1988.
[8] S. Wang, A. Sechave, e A. Gersho, "An objetive measurefor predicting subjective quality of speech coders",IEEE J. Selected Areas inCommun., vol. 10, no. 5, pp. 819-829, 1992.
[9] J. Beerends e J. Stemerdink, "A perceptual speech-qualitymeasure based on a psychoacoustic sound representation",J. áudio Eng. Soe,vol. 42, no. 3, pp. 115-123, 1994.
[10] S. Voran, "Objetivo estimation of perceived speechquality - Part I: Development of the measuring normalizing blocktechnique",IEEE Trans. Speech, áudio Processing, vol. 7, no. 4, pp. 371-382,1999.
[11] S. Voran, "Objective estimation of perceived speechuality - Part II: Evaluation of the measuring normalizing blocktechnique",IEEE Trans. Speech, áudio Processing, vol. 7, no. 4, pp. 383-390,1999.
[12] ITU-T Rec. Ρ. 862, "Perceptual evaluation of speechquality (PESQ)",2001.
[13] ITU-R. BS. 1387-1, "Method for Objective Measurementsof Perceived Audio Quality (PEAQ)", 2001.
[14] O. Au e K. Lam, "A novel output-based objective speechquality measure para fro qireless communication",Signal ProcessingProceedings, 4th Int. Conf., vol. 1, pp. 666-669, 1998.
[15] P. Gray, M. Hollier, e R. Massara, "Non-intrusive speech-quality assessment using vocal-tract modelos",em Proc. IEE Vision, Image eSignal Processing, vol. 147, pp. 493-501, 2000.
[16] J. Liang e R. Kubichek, "Output-based objective speechquality",IEEE 44th Vehicular tecnologia Conf., vol. 3, no. 8-10, pp. 1719-1723, 1994.
[17] H. Hermansky, "Perceptual linear predictiono (PLP)analysis of speech",J. Acous. Soe. Amer., vol. 87, pp. 1738-1752, 1990.
[18] T. FaIk, Q. Xu, e W.-Y. Chan, "Non-intrusive GMM-based speech quality measurement",in Proc. IEEE Int. Conf. Acous., Speech,Signal Processing, vol. 1, pp. 125-128, 2005.
[19] G. Chen e V. Parsa, "Bayesian model based non-intrusivespeech quality evaluation",in Proc. IEEE Int. Conf. Acous., Speech, SignalProcessing, vol. 1, pp. 385-388, 2005.
[20] D. Kim, "ANIQUE: An auditory model for single-endedspeech quality estimation",IEEE Trans. Speech, Audio Processing, vol. 13,pp. 821-831,2005.
[21] D. Kim e A. Tarraf, "Enhanced perceptual model for non-intrusive speech quality assessment", em Proc. IEEE Int. Conf. Acous.,Speech, Signal Processing, vol. 1, pp. 829-832, 2006.
[22] ITU-T P. 563, "Single ended method for objective speechquality assesment in narrow-band telephony appliations",2004.
[23] M. Werner, T. Junge, e P. Vary5 "Quality control forAMR speech channels in GSM networks",in Proc. IEEE Int. Conf. Acous.,Speech, Signal Processing, vol. 3, pp. 1076-1079, 2004.
[24] B. C. J. Moore, An Introduction to the Psychology ofHearing. London:
Academic Press, 1989.
[25] Z. Wang, A. Bovik, H. Sheikh, e E. Simoncelli, "Imagequality assessment: From error visibility to estrutural similarity",IEEE Trans.Image Process, vol. 13, pp. 600-612, 2004.
[26] R. Reynolds e A. Rix, "Quality VoIP -an engineeringchallenge",BT tecnologia Journal, vol. 19, pp. 23-32, 2001.
[27] M. Schroeder e B. Atai, "Code-excited linear prediction(CELP): high-quality speech at very Iow bit rates", em Proc. IEEE Int. Conf.Acous., Speech, Signal Processing, vol. 10, pp. 937-940, 1985.
[28] S. Jayant e P. Noll, Digital Coding of Waveforms.Englewood Cliffs NJ: Prentice-Hall, 1984.
[29] H. Knagenhjelm e W. B. Kleijn, "Spectral dynamics ismore important than spectral distortion", em Proc. IEEE Int. Conf. Acous.,Speech, SignalProcessing, vol. l,pp. 732-735, 1995.
[30] F. Norden e T. Eriksson, "Time evolution in LPCspectrum coding",IEEE
Trans. Speech, áudio Processing, vol. 12, pp. 290-301, 2004.
[31] T. Quatieri e R. Dunn, "Speech enhancement based onauditory spectral change", em Proc. IEEE Int. Conf. Acous., Speech, SignalProcessing, vol. 1, pp. 257-260, 2002.
[32] J. Beauchamp, "Synthesis by spectral amplitude ebrightness matching of analyzed musical instrument tones",J. áudio Eng. Soe,vol. 30, pp. 396- 406, 1982.
[33] S. Voran, "A simplified versão of the ITU algoritmo forobjective measurement of speech codec quality", em Proc. IEEE Int. Conf.Acous., Speech, Signal Processing, vol. 1, pp. 537-540, 1998.
[34] P. Devijver e J. Kittler, Pattern Recognition: A StatisticalApproach. London, UK: Prentice Hall, 1982.
[35] S. Stearns, "On selecting features for pattern classifiers",em Proc. 3rd Int.Conf. on Pattern Recognition, pp. 71-75, 1976.
[36] P. Pudil, F. Ferri, J. Novovicova, e J. Kittler, "FloatingSearch methods for featue selection with nonmonotonic criterion functions",em Proc. IEEE Intl.Conf. Pattern Recognition, pp. 279-283, 1994.
[37] T. Soderstrom, Discrete-time Stochastic Sistemas.London: Springer-Verlag, segunda ed., 2002.
[38] A. Dempster, N. Lair, e D. Rubin, "Maximum likelihoodfiram incomplete data via the EM algorithm",Journal Royal StatisticalSociety., vol. 39, pp. 1- 38, 1977.
[39] S. M. Kay, Fundamentais of Statistical Signal Processing,estimation Theory.Prentice Hall, 1993.
[40] W. B. Kleijη, P. Kroon, L. Célulaario, e D. Sereno, "A5.85 kbps CELP algorithm for cellular applications", em Proc. IEEE Int.Conf. Acous., Speech,Signal Processing, vol. 2, pp. 596-599, 1993.
[41] R. Laroia, N. Phamdo, e N. Farvardin, "Robust e efficientquantization of speech LSP parameters using structured vetor quantizers", emProc. IEEE Int. Conf. Acous., Speech, Signal Processing, vol. 1, pp. 641- 644,1991.
[42] DARPA-TIMIT, "Acoustic-telefonetic continuous speechcorpus, NIST Speech Disc 1-1.1 ",1990.
[43] ITU-T Rec. P. Supplement 23, "ITU-T coded-speechdatabase",1998.
[44] ITU-T. Rec. P.810, "Modulated Noise Reference
Unit",1996.
[45] R. Duda, P. Hart, e D. Stork, Pattern Classification.Wiley-Interscience, segunda ed., 2001.
[46] ITU-T. Rec. G.729, "Coding of speech at 8 kbit/s usingconjugate-structure algebraic-code-excited linear predicition (CS-ACELP)", 1996.