BRPI0707343A2 - método e aparelho de avaliação de qualidade de sinal não intrusivo - Google Patents

método e aparelho de avaliação de qualidade de sinal não intrusivo Download PDF

Info

Publication number
BRPI0707343A2
BRPI0707343A2 BRPI0707343-7A BRPI0707343A BRPI0707343A2 BR PI0707343 A2 BRPI0707343 A2 BR PI0707343A2 BR PI0707343 A BRPI0707343 A BR PI0707343A BR PI0707343 A2 BRPI0707343 A2 BR PI0707343A2
Authority
BR
Brazil
Prior art keywords
signal
speech
quality
frame
global
Prior art date
Application number
BRPI0707343-7A
Other languages
English (en)
Inventor
Stefan Bruhn
Bastian Kleijn
Volodya Grancharov
Original Assignee
Tlefonaktiebolaget Lm Ericson Publ
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Tlefonaktiebolaget Lm Ericson Publ filed Critical Tlefonaktiebolaget Lm Ericson Publ
Publication of BRPI0707343A2 publication Critical patent/BRPI0707343A2/pt
Publication of BRPI0707343B1 publication Critical patent/BRPI0707343B1/pt

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/69Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for evaluating synthetic or decoded voice signals
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M3/00Automatic or semi-automatic exchanges
    • H04M3/22Arrangements for supervision, monitoring or testing
    • H04M3/2227Quality of service monitoring
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M2203/00Aspects of automatic or semi-automatic exchanges
    • H04M2203/05Aspects of automatic or semi-automatic exchanges related to OAM&P
    • H04M2203/056Aspects of automatic or semi-automatic exchanges related to OAM&P non-invasive testing, i.e. in operation testing without service interruption
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M2207/00Type of exchange or network, i.e. telephonic medium, in which the telephonic communication takes place
    • H04M2207/18Type of exchange or network, i.e. telephonic medium, in which the telephonic communication takes place wireless networks

Landscapes

  • Engineering & Computer Science (AREA)
  • Signal Processing (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Quality & Reliability (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Telephonic Communication Services (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Complex Calculations (AREA)

Abstract

MéTODO E APARELHO DE AVALIAçãO DE QUALIDADE DE SINAL NãO INTRUSIVO. Um aparelho de avaliação de qualidade de sinal não intrusivo nclui um calculador de vetor de característica (60) que determina parâmetros epresentando quadros de um sinal e extrai uma coleção de vetores de característica por quadro (<sym>(n)) representando informação estrutural do sinal a partir dos parâmetros. Um seletor de quadro (62) preferencialmente eleciona somente quadros (<87>) com um vetor de característica (<sym>(n)) ficando entro de uma janela de múltiplas dimensões predeterminada (<sym>) . Meios (66, 68, 70, 72, 74) determinam um conjunto de características global (<sym>) sobre a oleção de vetores de características (<sym>(n)) de momentos estatísticos dos omponentes de vetor de característica selecionados ((1^,02,...O11) . Um previsor de qualidade (76) faz prognóstico de uma medida de qualidade de sinal (QJ do conjunto de características global (<sym>).

Description

METODO E APARELHO DE AVALIAÇÃO DE QUALIDADE DESINAL NÃO INTRUSIVO"
CAMPO TÉCNICO
A presente invenção se refere a avaliação de qualidade de sinalnão intrusiva e, de forma especial à avaliação de qualidade de fala nãointrusiva.
CONHECIMENTO
Avaliação de qualidade de fala é um problema importante emcomunicações móveis. A qualidade de um sinal de fala é uma medidasubjetiva, esta pode ser expressa em termos de como natural os sons do sinalou quanto esforço é exigido para entender a mensagem. Em um testesubjetivo, fala é executada para um grupo de ouvintes, os quais são solicitadosa avaliar a qualidade deste sinal de fala, ver [1], [2].
A medida mais comum para opinião do usuário é o graduaçãode opinião média (MOS), obtido através da ponderação de classificações decategoria absolutas (ACR). Em ACR, ouvintes comparam o sinal distorcidocom seu modelo interno de fala de alta qualidade. Em testes de degradação deMOS (DMOS), os sujeitos primeiro ouvem a fala original, e então sãosolicitados a selecionar a classificação de categoria de degradação (DCR)correspondente para a distorção do sinal processado. Testes de DMOS sãomais comum em avaliação de qualidade de áudio qualidade, ver [3], [4].
Avaliação da qualidade ouvida como descrita em [l]-[4] não éa somente forma de monitoração de qualidade of serviço (QoS). Em muitoscasos, testes subjetivos conversacionais, ver [2], são os métodos preferidos deavaliação subjetiva, onde participantes mantêm conversação sobre um númerode redes diferente e votam na sua percepção de qualidade conversacional. Ummodelo objetivo de qualidade conversacional pode ser encontrado em [5].Ainda uma outra classe de monitoração de QoS consiste de testes deinteligibilidade. Os testes de inteligibilidade mais populares são os Teste deRhyme Diagnóstico (DRT) e Teste de Rhyme Modificado (MRT), ver [6].
Testes subjetivos são acreditados de dar a qualidade de fala"verdadeira". Contudo, o envolvimento de ouvintes humanos os torna caro econsumidores de tempo. Tais testes podem ser usados somente nos estágiosfinais do desenvolvimento de sistemas de comunicação por fala e não sãoadequados para medidas de QoS em uma base diária.
Testes objetivos usam expressões matemáticas paraprognosticar qualidade de fala. Seu baixo custo, significa que eles podem serusados para, de forma contínua, monitorar a qualidade através da rede. Duassituações de teste diferentes pode ser distinguidas:
• Intrusiva, onde ambos, o sinal original e o distorcido estãodisponíveis. Isto é ilustrado na Fig. 1, onde um sinal de sinal de referência épassado adiante para um sistema sob teste, que distorce o sinal de referência.O sinal distorcido e o sinal de referência são ambos passados adiante parauma unidade de medição de intrusiva 12, que estima a medida de qualidademedida para o sinal distorcido.
• Não intrusiva (algumas vezes também denotada "términoúnico" ou "sem referência"), onde somente o sinal distorcido está disponível.Isto é ilustrado na Fig. 2. Neste caso uma unidade de medição de não intrusiva14 estima a medida de qualidade diretamente do sinal distorcido sem acessoao sinal de referência.
A classe mais simples de medidas de qualidade de objetivointrusiva são algoritmos de comparação de forma de onda, tal como relaçãosinal-para-ruído (SNR) e relação sinal-para-ruído em segmento (SSNR). Osalgoritmos de comparação de forma de onda são simples de implementar erequerem complexidade computacional baixa, mas eles não se correlacionambem com medidas subjetiva se tipos diferentes de distorções são comparados.
Técnicas do domínio da freqüência, tal como a medida deItakura-Saito (IS), e a medida de distorção espectral (SD) são amplamenteusadas. Técnicas do domino da freqüência, não são sensitivas a deslocamentode tempo e são, de forma geral, mais consistentes com a percepção humana,ver [7].
Um número significativo de medidas no domínio da percepçãointrusivas têm sido desenvolvido. Essas medidas incorporam o conhecimentodo sistema de percepção humana. Imitação da percepção humana é usada pararedução de dimensão e um estágio "cognitivo" é usado para efetuar omapeamento para a escala de qualidade. O estágio cognitivo é treinado pormeio de um ou mais bancos de dados. Essas medidas incluem a DistorçãoEspectral de Bark (BSD), ver [8], Qualidade de fala Perceptual (PSQM), ver[9], e Blocos de Normalização de Medidas (MNB), ver [10], [11]. AvaliaçãoPerceptual de Qualidade de fala (PESQ), ver [12], e Avaliação Perceptual deQualidade de Audio (PEAQ), ver [13], são algoritmos do estado da técnicapadronizados para avaliação de qualidade intrusiva de fala e áudio,respectivamente.
Medidas de qualidade de fala de objetivo intrusiva existentespodem automaticamente avaliar o desempenho do sistema de comunicaçãosem a necessidade de ouvintes humanos ouvintes. Contudo, medidasintrusivas requerem acesso ao sinal original, que tipicamente não estádisponível na monitoração de QoS. Para tais aplicações, avaliação dequalidade não intrusiva precisa ser usada. Esses métodos freqüentementeincluem ambos, imitação de ambos, imitação de percepção humana e/ou ummapeamento para a medida de qualidade que é treinado usando os bancos dedados.
Uma tentativa anterior em direção a medida de qualidade defala não intrusiva com base em um espectrograma do sinal percebido éapresentado em [14]. O espectrograma é dividido, e o intervalo de dinâmica evariância é calculado de uma maneira de bloco a bloco. O nível médio dointervalo de dinâmica e variância é usado para prognosticar qualidade de fala.A avaliação de qualidade de fala não intrusiva reportada em[15] tenta prognosticar a probabilidade que a seqüência de áudio de passagemé gerada através do sistema de produção vocal humano. A seqüência de falasob avaliação é reduzida a um conjunto de características. Os dadosparametrizados são usados para estimar a qualidade percebida de formafisiológica, por meio de regras básicas.
A medida proposta em [16] é baseada na comparação da falaemitida com um sinal artificial de referência que é, de forma apropriada,selecionado, de forma ótima, de um livro de código agregado. No PerceptualLinear Prognóstico (PLP), ver [17], coeficientes são usados como umarepresentação paramétrica do sinal de fala. Um modelo polinomial de quintaordem é efetuado para suprimir detalhes dependentes de alto-falante doespectro auditivo. A distância média entre o vetor de teste desconhecido e omais próximo centróide de referência fornece uma indicação da degradaçãoda fala.
Algoritmos recentes com base em Modelos de probabilidadede mistura Gaussianos (GMM) de características derivadas das representaçõesde envelope espectral motivadas pela forma de percepção podem serencontradas em [18] e [19]. Um algoritmo novo de avaliação de qualidademotivado pela forma de percepção com base na representação de envelopetemporal da fala é apresentado em [20] e [21].
O padrão de União de Telecomunicação Internacional (ITU)para avaliação de qualidade não intrusiva, ITU-T P.563, pode ser encontradoem [22]. Um total de 51 características de fala é extraído do sinal.Características principais são usadas para determinar uma classe de distorçãodominante, e em cada classe de distorção, uma combinação linear dascaracterísticas é usada para prognosticar uma assim chamada qualidade defala intermediária. A qualidade de fala final é estimada da qualidadeintermediária e 11 características adicionais.As medidas listadas acima para avaliação de qualidade sãodesignadas para prognosticar os efeitos de muitos tipos de distorções, etipicamente tem complexidade computacional alta. Tais algoritmos serãoreferidos como fazedores de prognósticos de qualidade de fala geral. Temsido mostrado que prognóstico de qualidade não intrusiva é possível emcomplexidade muito mais baixa se é assumido que o tipo de distorção éconhecida, ver [23]. Contudo, a última classe de medidas é provável sofrer dedesempenho de prognóstico pobre se as condições de trabalho esperadas nãosão encontradas.
SUMÁRIO
Um objeto da presente invenção é um método de avaliação dequalidade de fala não intrusiva e aparelho tendo complexidade computacionalbaixa.
Este objeto é alcançado de acordo com as reivindicaçõesanexas.
A presente invenção faz prognóstico da qualidade de fala apartir das características genéricas comumente usadas em codificação de fala(referida como características por quadro), sem uma presunção do tipo dedistorção. No proposto método de avaliação de qualidade de fala não intrusivae de complexidade baixa, a estimativa de qualidade é em vez disso baseadaem propriedades estatísticas globais das características por quadro.
De forma breve, a presente invenção determina parâmetrosrepresentando quadros do sinal monitorado. A coleção de vetores decaracterística por quadro representando informação estrutural dos quadrosselecionados é extraída desses parâmetros. Um conjunto de característicasglobal é obtido da coleção de vetores de característica usando momentosestatísticos predeterminados de componentes de vetores de característicasselecionadas. Finalmente, uma medida de qualidade de sinal é prognosticada apartir do conjunto de características globais.DESCRIÇÃO BREVE DOS DESENHOS
A invenção, junto com objetos e vantagens adicionais dela,pode melhor ser entendida fazendo referência a seguinte descrição tomada emconjunto com os desenhos anexos, nos quais:
Fig. 1 é um diagrama em bloco ilustrando medição dequalidade de fala intrusiva;
Fig. 2 é um diagrama em bloco ilustrando medição dequalidade de fala não intrusiva;
Fig. 3 é um diagrama em bloco ilustrando percepção humanade qualidade de fala;
Fig. 4 é um fluxograma ilustrando o método de avaliação dequalidade de sinal de acordo com a presente invenção;
Fig. 5 é um fluxograma ilustrando a modalidade preferida dométodo de avaliação de qualidade de sinal de acordo com a presenteinvenção; e
Fig. 6 é um diagrama em bloco de uma modalidade preferidado aparelho de avaliação de qualidade de sinal de acordo com a presenteinvenção.
DESCRIÇÃO DETALHADANa seguinte descrição a invenção será descrita com referênciaa fala. Contudo, os mesmos princípios podem ser aplicados para outros tiposde sinal, tal como sinais de áudio e sinais de vídeo.
O processo de avaliação de qualidade de fala humano pode serdividido em duas partes: 1) conversão do sinal de fala recebido em excitaçãodos nervos auditivos para o cérebro, e 2) processamento cognitivo no cérebro.Isto é ilustrado na Fig. 3, onde um sinal distorcido é recebido por um bloco deprocessamento auditivo 16, que transforma o sinal em excitações de nervoque são passados adiante para um bloco de mapeamento cognitivo 18, queemite um sinal com uma certa qualidade percebida. O princípios principais detransformadas de percepção são encobrimento de sinal, resolução de espectrode banda crítica, curvas de sonoridade iguais, e lei de sonoridade deintensidade, e.g., [24]. Esses princípios são bem estudados e na maioria dosalgoritmos de avaliação de qualidade existentes em uma transformada depercepção é um estágio de pré-processamento. O propósito implícito principalda transformada de percepção é para efetuar uma redução de dimensãoconsistente da forma de percepção no sinal de fala. De forma ideal, umatransformação de percepção retém todas a informação relevante da forma depercepção, e descarta toda a informação irrelevante da forma de percepção.
Na prática, aproximações e simplificações precisam ser feitas e este objetivopode não ser encontrado. Em alguns casos, transformações de percepçãopodem terminal custos computacionais altos. Para evitar essas limitações empotencial, o método de avaliação da presente invenção não efetua tal umatransformada de percepção. Em vez disso a dimensionalidade épreferencialmente reduzida, de forma simultânea, com a otimização doscoeficientes da função de mapeamento. Esta meta é minimizar a perda deinformação relevante. Esta abordagem é consistente com o aparecimentorecente de algoritmos efetuando avaliação de qualidade sem a transformadade percepção na avaliação de qualidade de imagem [25].
Muitos dos algoritmos existentes de avaliação de qualidadeexistentes são baseados nos modelos específicos de distorção, i.e., nível deruído de fundo, ruído multiplicativo, presença de tons de campainha [22], ousimulam uma distorção conhecida como características de receptor de fontede energia de ouvido [12]. A presente invenção não incorpora um modeloexplícito da distorção. A estimativa de qualidade de fala é baseada totalmentenas estatísticas de um sinal de fala processado, e a distorção é, de formaimplícita, avaliada por segunda unidade de entrada impacto nessasestatísticas. Como um resultado, a presente invenção é facilmente adaptadapara os sistemas de comunicação de próxima geração que provavelmenteproduzir novos tipos de distorções.
Em alguns métodos, a informação dependente do alto-falante éremovida [18], [16]. Contudo, é conhecido que sistemas de telefoniafornecem graduações de qualidade mais alta para algumas vozes do que paraoutras [26]. Por conseguinte, se o algoritmo é para ser usado emmonitoramento da rede contínuo, e o material de fala balanceado paraponderação não pode ser garantido,a informação dependente de alto-falante érelevante. O método de acordo com a presente invenção incorpora ainformação dependente de alto-falante, por exemplo na forma do período deocorrência dos coeficientes de um modelo auto regressivo (AR) de décimaordem, estimado por meio de prognóstico linear.
Uma elocução usada para medições de qualidade é tipicamenteum conjunto de curtas sentenças separadas por uma pausa de, por exemplo,0,5 segundos. O comprimento total de uma elocução é tipicamente deaproximadamente 8 segundos. Contudo, em geral, uma elocução podesimplesmente ser vista como um intervalo ou bloco de sinal. O método deavaliação da presente invenção faz prognóstico de qualidade de fala de umaelocução usando um conjunto simples de características que pode ser derivadoda forma de onda do sinal de fala ou, em uma modalidade preferida, estãofacilmente disponíveis a partir dos codecs de fala na rede. A qualidade de falaé prognosticada em complexidade computacional baixa, que torna o métodoútil para aplicações práticas.
O núcleo do método de avaliação de qualidade de sinal deacordo com a presente invenção é um vetor de características Φ(η) por quadrode múltiplas dimensões (preferencialmente de Expressão 11 dimensões parafala; outros números também são possíveis e o número de dimensões tambémdepende do tipo de sinal, fala, áudio, vídeo, etc), os componentes dos quaisestão definidas no APENDICE I. A qualidade de fala não é prognosticadadiretamente a partir do vetor por quadro, mas de suas propriedades estatísticasglobais, descrita como média, variância, inclinação, e kurtosis dascaracterísticas por quadro sobre muitos quadros, por exemplo sobre umaelocução. As propriedades estatísticas das características por quadro (referidascomo conjunto de características global Ψ) formam a entrada para omapeamento de GMM (Modelo de Probabilidade de Mistura Gaussiano), queestima o nível de qualidade de fala sobre uma escala de MOS, como descritaem detalhe no APÊNDICE III.
Fig. 4 é um fluxograma ilustrando o método de avaliação dequalidade de sinal de acordo com a presente invenção. No estágio S1 um sinalde fala é codificado em uma seqüência de bit de quadros incluindo parâmetrosde fala. Estágio S2 extrai uma vetor de característica Φ(η) (por quadro) dosparâmetros de fala para cada quadro de interesse. No estágio S3 aspropriedades estatísticas desses vetores de característica são usadas paraformar um conjunto de característica Ψ global (por elocução). Finalmente, noestágio S4 a qualidade de fala é prognosticada a partir do conjunto decaracterísticas global usando mapeamento de GMM.
A base do aparelho e método de avaliação de qualidade desinal de acordo com a presente invenção é a extração de um vetor decaracterística. O conjunto de características usado auxilia a capturar ainformação estrutural a partir de um sinal de fala. Isto é motivado pelo fatoque o sinal de fala natura é altamente estruturado, e é provável que ojulgamento de qualidade humano se baseie em padrões extraídos dainformação descrevendo essa estrutura. APÊNDICE I define um conjunto of11 características adequadas, que são coletadas em um vetor de característicapor quadro:
<table>table see original document page 10</column></row><table>
onde η denota ο número do quadro.
De acordo com a presente invenção é assumido que aqualidade de fala pode ser estimada a partir das propriedades estatísticasdessas características por quadro. Suas distribuições de probabilidade sãodescritas com a média, variância, inclinação, e kurtosis. Esses momentosestatísticos são calculados, de forma independente para cada característica porquadro, e isto fornece um conjunto de características que, de forma globaldescrevem uma elocução de fala (características globais):
<formula>formula see original document page 11</formula>
Aqui Ω denota o conjunto de quadros, de cardinalidade(tamanho) r^, usado para calcular estatísticas para cada uma dascaracterísticas por quadro Oi (n). As características globais são agrupadas emum conjunto de características globais:
<formula>formula see original document page 11</formula>
Preferencialmente a complexidade desses cálculos é reduzida.
APENDICE II descreve um procedimento de redução de dimensionalidadeem dois estágios que:
• Extrai o "melhor" sub-conjunto " de quadros fora doconjunto de todos os quadros na elocução.
• Transforma conjunto de características globais Ψ em umconjunto de características globais Ψ de dimensionalidade mais baixa.Em uma modalidade preferida da presente invenção acaracterísticas por quadro do enésimo quadro são calculados diretamenteda variância Ee da excitação do modelo de AR, o período de ocorrência Te o vetor de dez dimensões dos coeficientes f de freqüência espectral emlinha (LSF), determinada sobre 20 ms de quadros de fala. Já que Ee, T e fsão prontamente acessíveis na rede no caso de codificadores dePrognóstico Linear Excitado por Código (CELP) [27], esta modalidade deuma invenção tem a vantagem adicional de extrair o vetor por quadrodiretamente dos parâmetros de rede na seqüência de bit, que é maisimplementações do que extraí-lo da forma de onda do sinal. Serádemonstrado que as características por quadro Φ(η) podem ser calculadasde {Een, Tn, fn} e (Een Tn.l5 fn}. Então será mostrado como aspropriedades estatísticas globais são calculadas, de forma recursiva, semarmazenar as características por quadro para a elocução inteira em umaárea de armazenamento temporário. O período de ocorrência Tn écalculado de acordo com [40], e os coeficientes de AR são extraídos dosinal de fala a cada 20 ms sem sobrepor.
Para manter a complexidade do método baixa, ascaracterísticas por quadro: planicidade espectral, dinâmica espectral, ecentróide espectral são aproximadas. As aproximações são baseadasinteiramente na seqüência de bit codificada de fala, e por meio disso areconstrução do sinal é evitada.
Em uma modalidade preferida da presente invenção aplanicidade espectral é aproximada conforme a proporção da variância de errode prognóstico de décima ordem e a variância do sinal:
<formula>formula see original document page 12</formula>
Dada a variância da excitação do modelo de AR, sua definição
<formula>formula see original document page 12</formula>e coeficientes de AR aÍ5 o sinal de variância é calculado semreconstruir a forma de onda Sjc usando a recursão reversa de Levinson-Durbin(algoritmo de estágio abaixo).
As dinâmicas espectrais são preferencialmente aproximadaspor uma descrição paramétrica do envelope do espectro, por exemplo comouma distância ponderada Euclideana no espaço de LSF:
<formula>formula see original document page 13</formula>
onde a ponderação média de harmônico inversa [41] é definidapelos componentes do vetor de LSF:
Em uma modalidade preferida da presente invenção as médiassão também usadas para obter um centróide espectral aproximado:
<formula>formula see original document page 13</formula>
As características globais selecionadas são calculadas, deforma recursiva, i.e., as características por quadros não são armazenada emuma área de armazenamento temporário. Até o fim da elocução, a média é, deforma recursiva atualizada de acordo com:
<formula>formula see original document page 13</formula>
para obter a μφ. aqui η é o índice sobre o conjunto dequadro aceito como discutido no APÊNDICE II. Em um modo similar,são propagados para obter os momentos centrais μφ , μφ eμφ4. Essas quantidades são usadas para obter as características globaisremanescentes, a saber variância, inclinação, e kurtosis como:<formula>formula see original document page 14</formula>
A modalidade preferida do método de acordo com a presenteinvenção é ilustrada na Fig. 5. Ela inclui os seguintes estágios:
S5. Para o enésimo quadro de fala determina {Een, Tn, fn} e{Een.i, Tn, fn-1} da forma de onda ou extraí da seqüência de bit.
S6. Determinar vetor de característica por quadro Φ(η), combase em (Een, Tn, fn} e os correspondentes parâmetros (Een _i, Tn, fn_i} doquadro anterior, que são armazenadas em uma área de armazenamentotemporário.
Estágios S5 e S6 são efetuados para todos os quadros daelocução.
S7. A partir de um sub-conjunto selecionado & de quadros, deforma recursiva, determinar os momentos centrais ( μφ; μ®2, μφ3 e |ΐφ4}.Quadro Seleção de quadro (APENDICE II) é controlada pelo limite ou janelade várias dimensões Θ.
S8. Ao final da elocução calcular o conjunto de característicasglobal Ψ = ( μφϊ, σφ}, s φ,, k®, } selecionado (equação (23) of APENDICE II)como média, variância, inclinação, e kurtosis das características por quadro.
S9. Prognosticar a qualidade de fala da elocução como afunção do conjunto de características global Q = Q(1F) através de mapeamentode GMM, conforme descrito no APÊNDICE III.
Fig. 6 é um diagrama em bloco de uma modalidade preferidado aparelho de avaliação de qualidade do sinal de acordo com a presenteinvenção. Um sinal codificado de fala (seqüência de bit) é recebido através deum calculador de vetor de características 60, que determina o vetor decaracterísticas Φ(η) do quadro corrente η dos parâmetros de fala (Een, Tn, fn}.O vetor de características é passado adiante para um seletor de quadro 62, quedetermina se ele está dentro da janela de várias dimensões definida pelo limiteΘ, que é armazenada no depósito 64 e tem sido determinada por tentativacomo descrito no APÊNDICE II e IV. Os componentes do vetor decaracterísticas Φι (η), O2 (n),...On (η) dos quadros selecionados são passadosadiante para os respectivos calculadores 66, 68, 70, 72, que, de formarecursiva, calculam momentos centrais de cada componente. Na Fig. 6somente os calculadores para O1 tem sido ilustrados de forma explícita, oscorrespondentes calculadores para os componentes remanescentes tem sidoindicados por pontos. Os momentos centrais são passados adiante para oscalculadores de características globais 74, que determinam as característicasglobais de cada componente de vetor de características de acordo com aequação (13). O conjunto de características globais resultante é passadoadiante para um previsor de qualidade, que determina uma estimativa dequalidade Q como descrito no APÊNDICE III.
Efetivamente, em uma implementação prática, todos oscalculadores de momentos centrais 66, 68, 79, 72 pode não ser exigidos paracada componente de vetor de características Oj, já que a redução dadimensionalidade do conjunto de características globais Ψ pode reduzir onúmero de características globais requeridas, como ilustrado pela equação
(23) no APENDICE II. Neste caso, calculador 72 para componente de vetorde características Oi pode ser omitido, já que k®,, tem sido descartado naredução de dimensionalidade do conjunto de características global Ψ. Osmomentos centrais requeridos efetivamente dependem dos resultados daredução de dimensionalidade do conjunto de características global Ψ, que porsua vez também depende do tipo de sinal tipo (fala, áudio, vídeo, etc).
A funcionalidade do aparelho de avaliação da presenteinvenção é tipicamente implementada por um micro processador ou por umacombinação micro/processador de sinal e software correspondente.Embora o prognóstico de qualidade efetuado pela presenteinvenção seja baseado no mapeamento de modelo de probabilidade deMistura Gaussiana, outras alternativas factíveis são os modelos de redesneural e de Markov escondido.
O desempenho do método de avaliação de qualidade de acordocom a presente invenção tem sido avaliado, de forma experimental. Osresultados são dados no APENDICE V.
Um aspecto não coberto, de forma explícita, na descriçãoacima são os parâmetros afetando a qualidade de fala, embora nãodiretamente acoplados ao sinal de fala original. Tais parâmetros são, e.g.ruído de fundo para a entrada de fala ou tipo de alto-falante (e.g. gênero) ouentrada sinais não de fala como música, ou o estilo de música (e.g. pop, jazz,clássico,...), ou parâmetros relacionados ao sistema de transmissão, tais como:
• O uso de um sistema de VAD /DTX para transmissãoeficiente de fala inativa
• O uso (existência) de um supressor de ruído antes ou nodecorres da codificação de fala
• O método de codificação de fala e sua configuração (codecselecionado e seu modo ou taxa de bit)
Indicadores de quadro ruim indicando que um quadro docodec é, não usável, de forma parcial, ou completamente, devido a erros detransmissão
• Um parâmetro de probabilidade para a ocorrência de erros detransmissão na seqüência de bit de fala recebida, que pode ser derivado devários estágios de processamento no receptor.
• Um possível codec em tandem envolvendo uma multidão dedecodificações e re-codificações do sinal de fala
• Modificação da escala de tempo possível da fala em conjuntocom o uso de uma área de armazenamento temporário de variação adaptativa.Esses parâmetros têm uma imediata influência na qualidade defala resultante após a decodificação. A aplicação direta da presente invençãovai ignorar esses parâmetros, que conduzem para a vantagem de um métodode avaliação de qualidade universal com complexidade baixa.
Contudo, pelo menos, algum desses parâmetros sãoconhecidos ou podem ser conhecidos a priori ou podem ser deduzidos usandodetectores correspondentes ou podem ser obtidos por meio de sinalizaçãoatravés do sistema de transmissão de fala. Como um exemplo, condições demúsica ou de ruído de fundo ou a existência da supressão de ruído podem serdetectadas usando métodos de detecção do estado da técnica. Meios desinalização são adequados para identificar os outros mencionados parâmetros.Uma modalidade específica da invenção fazendo uso dos parâmetros aprioridade é para usar vários exemplos do método de avaliação de qualidadede acordo com a presente invenção, que são treinados para diferentesconjuntos desses parâmetros. De acordo com esta modalidade o exemplo dométodo de avaliação que é mais adequado presentemente para um dadoconjunto de parâmetros a priori é primeiro identificado e selecionado. Em umsegundo estágio o exemplo selecionado é executado rendendo a estimativa dequalidade de fala desejada.
Uma modalidade adicional é executar um exemplo único deum método de avaliação de qualidade de acordo com a presente invenção,seguido de um estágio de processamento adicional levando em conta osparâmetros a priori. De forma específica, o segundo estágio pode efetuar ummapeamento do valor de saída do método de avaliação do primeiro estágio edos vários parâmetros a priori para a saída final da estimativa da qualidade defala. O mapeamento deste segundo estágio pode ser feito de acordo comtécnicas conhecidas tal um método de adequação de dados de quadradosmínimos linear ou não linear ou mapeamentos de GMM. Mesmo umapossibilidade adicional seja combinar o estágio de mapeamento final deGMM de um método de avaliação de qualidade com o mapeamento desegundo estágio descrito, que essencialmente estende o vetor decaracterísticas globais (por elocução) através do conjunto dos parâmetros apriori.
Ainda uma modalidade adicional para tornar o método maisaplicável para não fala, e música em particular, é permitir adaptações dascaracterísticas ' por quadro" locais usadas. Música em geral não é bemcodificada com codecs de fala, já que música não vai de encontro ao modelode produção de fala existentes dos codecs de fala. Mais propriamente, músicaé preferencialmente codificada com base nos modelos de percepção (daaudição), não assumindo qualquer modelo particular da produção de sinalfonte. Considerando este fato, uma adaptação das características "por quadro"locais significa, preferencialmente, usar parâmetros derivados de tal ummodelo de percepção, pelo menos, em adição aos parâmetros apresentados.Particularmente, este é o caso se o codec usado é um codec de áudio maispropriamente do que codec de fala.
Um outro aspecto é que a descrição acima descreve a invençãoem uma forma de regressão, que efetua um mapeamento contínuo. Contudo, ométodo é também aplicável para um mapeamento discreto para pré-definir aescala de qualidade discreta (intervalos pré-definidos) por meio do uso de umclassificador. Então, o termo "mapeamento" deves em resposta interpretadoem um sentido geral que também cobre o caso discreto de usar umclassificador. Um exemplo simples com um classificar é um sistema com baseno método de avaliação de qualidade descrito que não faz prognóstico dequalidade em uma escala contínua, mas tem um resultado binário, porexemplo: 0) qualidade está abaixo de um limite e 1) qualidade está acima deum limite. Este exemplo corresponde a um sistema que tem a habilidade dedetectar se uma particular distorção ou nível de qualidade está ou nãopresente.As várias modalidades da presente invenção conduzem a umaou várias das seguintes vantagens:
• Qualidade de fala pode ser prognosticada a partir dosparâmetros da seqüência de bit (em um caso de codecs CELP), semreconstrução da forma de onda. Isto, junto com o fato que transformada para odomínio da percepção não usado, conduz a requisitos baixos de computação ede memória (a complexidade de umas poucas centenas de vezes mais baixa doque o padrão ITU existente).
• A qualidade de fala é prognosticada a partir das propriedadesestatísticas das características: planicidade espectral, centróide espectral,dinâmica espectral, período de ocorrência, sinal variância de sinal, variânciado sinal de excitação sinal, e outras derivadas no tempo. As propriedadesestatísticas dessas características são descritas por meio sua média, variância,inclinação, e kurtosis. Este tipo de característica e sua descrição não requeremque o sinal de fala seja armazenado. Em uma área de armazenamentotemporário são armazenados somente uns poucos (por exemplo 12)parâmetros escalares do quadro anterior.
• Um novo método pode ser usado para derivar ascaracterísticas por quadro (planicidade espectral, dinâmica espectral, etc.)diretamente da seqüência de bit, sem reconstruir a forma de onda(reconstrução do sinal não é não complexa por si só, a complexidade ocorrequando as características são extraídas do sinal reconstruído).
• A qualidade de fala pode ser prognosticada a partir desomente um sub-conjunto de quadros. Um novo método é usado para extrairos quadros que contem informação útil (nos método existente de avaliação dequalidade, rejeição de quadro é baseado em um simples limite de energia oudetector de atividade de fala). O método proposto generaliza esta abordagem.Diferentes sub conjuntos de quadros podem ser usados para estimar aspropriedades estatísticas de características diferentes. Rejeição de quadro nãoé somente uma função de energia, mas de todas as características por quadro.O método de seleção de quadro pode ser otimizado em conjunto com a funçãode regressão (classificador).
• O método proposto, de forma significativa, executa a ITU-TP.563 nas simulações formadas, com relação ao coeficiente de correlação e aoerro de raiz quadra média.
Será entendido por aqueles com qualificação na arte que váriasmodificações e mudanças podem ser feitas para a presente invenção sem fugirdo escopo da dela, que é definido pelas reivindicações anexas.
APÊNDICE ISELEÇÃO DE CARACTERÍSTICA
Este apêndice vai definir um conjunto adequado decaracterísticas a ser incluído em um vetor de características por quadro Φ(η).este conjunto é especificamente adequado para sinal de fala.
Uma primeira característica por quadro de interesse é a medidarepresentando o conteúdo de informação no sinal, tal como a medida deplanicidade espectral descrita em [28]. Esta é relacionada com a força daestrutura ressonante no espectro de potência e é definida como:
<formula>formula see original document page 20</formula>
onde o envelope de AR (Auto-Regressivo) P ^ é definidocomo a resposta de freqüência do modelo de AR modelo com coeficientes ak,i.e.
<formula>formula see original document page 20</formula>
O índice de quadro é denotado por n, e ρ é a ordem da análisede prognóstico linear, tipicamente configurado to 10 para sinais amostradosem 8 kHz.
Uma segunda característica por quadro é a medidarepresentando a estabilidade do sinal, tal como a dinâmica espectral, definidacomo:
<formula>formula see original document page 21</formula>
A característica da dinâmica espectral tem sido estudadas ecom sucesso usada em codificação de fala [29], [30] e aprimoramento de fala[31].
Uma terceira característica de interesse é a medidarepresentando a distribuição de energia do sinal sobre freqüências, tal como ocentróide espectral [32], que determina a área de freqüência em torno da quala maioria da energia do sinal se concentra. Isto é definido como:
<formula>formula see original document page 21</formula>
e isto é também freqüentemente usado como uma aproximaçãode uma medida de "luminosidade" de percepção.
Três características por quadro adicionais são a variância daexcitação do modelo de AR modelo Een,, a variância do sinal de fala variânciaEsn, e o período de ocorrência Tn,. Elas serão denotadas como Φ4 (η), Φ5 (η), eO6 (η), respectivamente.
04 (η) = Een, a variância da excitação do modelo de AR
05 (n) = Een, a variância do sinal de fala (18)
06 (n) = Tn, o período de ocorrência
As características por quadro apresentadas acima, e suasprimeiras derivadas no tempo (excetos as derivadas das dinâmicas espectrais)são agrupadas em um vetor de características por quadro de 11 dimensõesΦ(η), os componentes dos quais são resumidos na Tabela I abaixo.Tabela 1
Elementos do vetor de características por quadro
<formula>formula see original document page 22</formula>
APÊNDICE II
REDUÇÃO DE DIMENSÃOALIDADE
Redução de dimensionalidade pode ser obtida através daseleção de quadro, global seleção de características globais ou umacombinação de ambos os procedimentos de seleção. Um propósito daredução de dimensionalidade é melhorar a precisão de prognóstico dosistema de avaliação de qualidade removendo dados irrelevantes eredundantes. Um outro propósito é reduzir a complexidadecomputacional. A redução de dimensionalidade apresentada nesteapêndice é baseada em um procedimento de treinamento que será descritoem detalhes no APÊNDICE IV.
Uma comumente abordagem usada na literatura de avaliaçãode qualidade, é remover regiões de não fala com base em um detector deatividade de fala ou um limite de energia [33]. A presente invenção sugereuma generalização deste conceito considerando limites de atividade em todasas dimensões de característica por quadro.
O esquema, apresentado no método de seleção de quadroabaixo permite quadros ativos de fala a serem excluídos se eles nãotransportam informação que melhora a precisão do prognóstico de qualidadede fala. O conceito do algoritmo de seleção de quadro é aceitar somentequadros onde o vetor de características por quadro Φ(η) se encontra dentre ouna superfície do "hyperbox" de 11 dimensões ou janela de várias dimensõesdefinida por um vetor limite vetor Θ. Em pseudo código o método pode serdescrito por:
MÉTODO DE SELEÇÃO DE QUADRO
Ω = {0} Configurar subconjunto " para conjunto vaziopara η € Ω para cada quadro no conjunto de quadro original Ωse Φι (η) € [ 0]L' O1uJ & se vetor de características está dentroda "janela'
Φ2 (n) e [ 02L, 02U]&
Φ11(n)e[0uL' 011u]
Então Ω = Ω + |n} Adiciona quadro η ao subconjunto
O conjunto ótimo de quadros é determinado pelo limite oujanela de várias dimensões 0 = { 0^' O111} i=11n i.e. ^ depende de 0, ou ^= & (0). Nos procuramos pelo limite 0 que minimiza o critério ε:
<formula>formula see original document page 23</formula>
O critério ε é calculado como o desempenho de erro da médiada raiz quadrada (RMSE) do método de avaliação de qualidade de acordocom a presente invenção, i.e.:
<formula>formula see original document page 23</formula>
onde Q é a qualidade prognosticada, e é Q a qualidadesubjetiva. Aqui N é o número de elocuções rotuladas de MOS usado naavaliação, ver APENDICE IV. A otimização do limite 0 é baseado noconjunto inteiro de características globais Ψ. A otimização de ε em (19), como algoritmo de seleção de quadro descrito acima, resultas no seguinte critériopara a aceitação do enésimo quadro:<formula>formula see original document page 24</formula>
com os valores limite ©5L= 3,10, Θχυ = 0.67, e Θ2υ = 4,21.
De (21) é visto que somente três características por quadro têmimpacto significativo na seleção de quadro, a saber variância de fala Φ5,planicidade espectral O1, e dinâmica espectral Φ2. A primeira e segundadesigualdade em (21) somente aceitam quadros com alta energia e umaestrutura de formação clara. Isto sugere que um algoritmo de avaliação dequalidade da presente invenção extrai informação sobre a qualidade de falapredominantemente de regiões de fala manifestadas. A terceira desigualdadesomente seleciona regiões de fala estacionárias. O último resultado éprovavelmente devido a distorção sendo mais facilmente percebida nasregiões de repouso do sinal de fala.
Como pode ser visto do critério (21), o limite ou janela devárias dimensões pode ter restrições efetivas somente em poucasdimensões. Nas outras dimensões a janela pode ser considerada como umajanela infinita. Ainda mais, mesmo em dimensões restritas, a janela podeter uma fronteira ou limite somente em uma direção. Em geral a janela devárias dimensões é mais restritiva na seleção de quadro do que o detectorde atividade de fala pura, que conduz a rejeição de mais quadros seminformação relevante para a avaliação da qualidade. Este por sua vezconduz a médias de qualidade mais confiáveis.
Uma alternativa viável para a janela retangular para cadadimensão é uma janela suave, por exemplo uma janela Gaussiana, comcada função Gaussiana tendo sua média e variância individual. Cadacomponente de vetor vai então corresponder a um valor de funçãoGaussiana. Um quadro seria aceito se o produto desses valores de funçãoexcede um certo limite.
O critério (21) reduz, de forma significativa, o número dequadros processados através de um algoritmo de avaliação de qualidade. Onúmero de quadros selecionados varia com alto-falantes e sentenças, etipicamente & contém entre 20% e 50% do conjunto de quadro total Ω.
Uma vez que o subconjunto ótimo de quadros & foiencontrado, uma procura pelo subconjunto ótimo de características globais Ψpode ser efetuada, este estágio de otimização é definido como a seguir: dado oconjunto original de características globais Ψ de cardinalidade | Ψ |, e oconjunto ótimo de quadros Ω, selecionar um subconjunto de característicasglobais ¥ C Ψ de cardinalidade < |Ψ| que é otimizada para o desempenhode um algoritmo de avaliação de qualidade:
<formula>formula see original document page 25</formula>
Um procura total é somente um procedimento de reduçãode dimensionalidade que garante que uma ótima global seja encontrada.Contudo, é raramente aplicado devido a seus requisitos computacionais. Abem conhecida Seleção para frente Seqüencial e Seleção para trásSeqüencial, e.g., [34] são estágios [ótimo somente, já que a melhor (pior)característica global é adicionada (descartada), mas a decisão não podeser corrigida em um estágio mais tarde. O algoritmo mais avançado (L,R)[35] consiste em aplicar Seleção para frente Seqüencial L times, seguidode R estágios de Seleção para trás Seqüencial. Os métodos de BuscaFlutuante [36] são extensões dos (L,R) métodos de procura, onde onúmero estágios para à frente e para trás não são pré-definidos, masobtidos de forma dinâmica. Em nossas experiência nos temos usado oprocedimento de Seleção para trás Flutuante Seqüencial, que consiste emaplicar após cada estágio para trás um número de estágios para à frenteenquanto os subconjuntos resultantes forem melhores do que aquelesanteriormente avaliados, como ilustrado pelo seguinte método:PROCEDIMENTO DE SELEÇÃO PARA TRÁS FLUTUANTESEQÜENCIAL
<formula>formula see original document page 26</formula>
Após a otimização de ε. em (22), a dimensionalidade doconjunto de características globais é reduzida de 44 to 14, i.e. | ^ | = 14, eesses elementos são:
<formula>formula see original document page 26</formula>
É notado todas as características por quadro estão presentes(através de suas representações estatística das características globais) noconjunto mas a variância de sinal de fala Φ5, e as derivadas da variânciado sinal de excitação, Φ9, são mais freqüentes. Uma outra observação é que ascaracterísticas globais de fala com base somente nos primeiros três momentosestão presentes, e que as características globais com base na kurtosis parecemser menos importante.
APÊNDICE III
E S TIMAITVA DE QUALIDADE
Deixe Q denotar a qualidade subjetiva de uma elocução comoobtida do banco de dados de treinamento rotulado de MOS. Construir umelaborador de estimativa de objetivo ^ da qualidade subjetiva como umafunção de um conjunto de características globais, i.e. 0 = Q (Φ), e procurapara a função mais perto da qualidade subjetiva com relação ao critério:
<formula>formula see original document page 26</formula>onde E{ } é o operador de expectativa. O critério definidoacima é a medida probabilística correspondendo a (22) no APÊNDICE II. Ébem conhecido, e.g., [37], que equação (24) é minimizada pela expectativacondicional:
ρ(ψ) = Ε{θ|ψ} (25)
e o problema reduz para a estimativa da probabilidadecondicional. Para facilitar esta estimativa, a densidade conjunta das variáveisde características globais com as graduações de MOS subjetivas podem sermodeladas como um GMM (Modelo de Probabilidade de Mistura Gaussiano):
<formula>formula see original document page 27</formula>
onde φ = [ Q, ^ ], m é o índice de componente de mistura,G0(m) são os pesos da mistura, e N (φ|μ(ΐΏ), £(m)) são densidades variadasGaussianas, com μ(ιη), £(m) sendo as matrizes de média e a de covariância dasdensidades Gaussianas, respectivamente. O GMM é completamenteespecificado por um conjunto de vetores de média, matrizes de covariância epesos de mistura:
<formula>formula see original document page 27</formula>
e esses coeficientes são estimados fora de linha a partir de umconjunto de treinamento grande usando um algoritmo de maximização deexpectativa (EM) [38]. Detalhes sobre os dados usados para exercício sãoapresentados no APENDICE IV. Experimentos tem mostrado que é suficienteusar 12 matrizes de covariância completa (14 χ 14), i.e., paradimensionalidade K = 14eM = 12 Gaussianas, isto corresponde a M(1 + K +K(K + 1) / 2) = 1440 parâmetros de treinamento.
Usando o modelo de mistura Gaussiano de junção, aexpectativa condicional (25) pode ser expressa como uma soma ponderada deexpectativas condicionais de componente inteligente, que é uma bemconhecida propriedade do caso Gaussiano [39]. Então, o elaborador deestimativa de qualidade ótima (25) pode ser expressa como:
<formula>formula see original document page 28</formula>onde
<formula>formula see original document page 28</formula>
e
<formula>formula see original document page 28</formula>
com μφ(m), μ<5(Γη), Ψ (m)' £ *fq(m) sendo as matrizes de média,covariância e covariância cruzada de Ψ e Q no m-ésimo componente demistura.
APÊNDICE IV
TREINAMENTO
Para o procedimento de avaliação e treinamento nos usamos11 banco de dados rotulados de MOS fornecidos por Ericsson AB e 7 bancosde dados rotulados de forma similar do ITU-T P.Supp 23 [43]. Dados comgraduações de DMOS foram excluídas a partir dos nossos experimentos, e.g.,do ITU-T P.Supp 23 nós excluímos o Experimento 2. O material de falanesses bancos de dados contém elocuções nos seguintes idiomas: Inglês,Francês, Japonês, Italiano e Sueco. Os bancos de dados contém uma grandevariedade de distorções, tal como: codificação diferentes, em tandem, econdições de unidade de referência de ruído modulada (MNRU) [44], assimcomo perda de pacote, ruído de fundo, efeitos de supressão de ruído, efeitosde comutação, níveis de entrada diferentes, etc. O tamanho total da união debancos de dados é 7646 elocuções com comprimento médio de 8s.
Divide-se os bancos de dados disponíveis em duas partes,conjunto de teste e conjunto de conjunto de treinamento. O conjunto de teste ébaseado em 7 bancos de dados do ITUT P.Supp 23 (1328 elocuções), e oconjunto de treinamento é baseado em 11 bancos de dados (6318 elocuções)da Ericsson. O conjunto de teste não está disponível durante o treinamento,mas usado somente para avaliação. O treinamento usada para a redução deesquema de dimensionalidade e experimentos de avaliação de desempenho étotalmente baseada no conjunto de treinamento. Para melhorar desempenhode generalização nos usamos um treinamento com procedimento de ruído[45]. Nos criamos padrões de treinamento virtuais ("ruidoso"), adicionandoruído médio de branco Gaussiano zero, na SNR de 20 dB para o conjunto decaracterísticas globais Ψ. Desta maneira para cada conjunto de característicasglobais nos criamos quatro conjuntos virtuais, e o treinamento é baseada naunião das características "originais" e "ruidosas".
APÊNDICE V
AVALIAÇÃO DE DESEMPENHO
Este apêndice apresenta resultados dos experimentos, comrelação a ambos, precisão de prognóstico e complexidade computacional dométodo proposto. O desempenho do método proposto é comparado ao métodopadronizado da ITU-T P.563. O desempenho da estimativa é avaliado usandoum coeficiente R de correlação por condição entre a qualidade prognosticadaQ ea qualidade subjetiva Q de acordo com a equação:
<formula>formula see original document page 29</formula>
onde Mq e Mq , sã0 os valores médios das variáveis introduzidas, esomatório é sobre as condições. Tabela Π contém os resultados de desempenhoem termos da métrica de desempenho selecionada sobre um conjunto de teste de 7bancos de dados da ITU-T P.Supp 23. A ITU-T P.Supp 23 Exp 1 contémdistorções de codificação de fala, produzidas por sete codecs de fala padrões(predominantemente usando codec de fala usando G.729 [46]) sozinhos, ou emconfiguração em tandem. Na ITU-T P.Supp 23 Exp 3 o codec de fala G.729 éavaliado sob várias condições de erros de canal como apagamento de quadro, errode bit aleatório, e ruído de fundo. O resultado dos testes, apresentado na tabela Πabaixo claramente indica que o método de avaliação de qualidade propostoexecuta o método padronizado da ITUT P.563.
Tempo de processamento e requisitos de memória são figurasimportantes de mérito para método de avaliação de qualidades. O método deacordo com a presente invenção tem requisitos de memória insignificante: aárea de armazenamento temporário de 12+12 valores escalar, calculado apartir do quadro anterior e corrente é necessário (futuros quadros não sãorequeridos), assim como a memória para a mistura de 12 Gaussianos.
Tabela II
COEFICIENTE DE CORRELAÇÃO POR CONDIÇÃO
<table>table see original document page 30</column></row><table>
Tabela III demonstra a diferença em complexidadecomputacional entre o método de avaliação de qualidade proposto e o métododa ITU-T P.563. A comparação é entre a implementação de ANSI-Cotimizada do método da ITU-T P.563 e a implementação de MATLAB® 7 dainvenção, ambos executados em uma máquina de Pentium 4 em 2,8 GHz com1 GB de RAM. O caso onde as características de entrada {Een, Tn, fn} estãoprontamente disponíveis a partir dos codecs usados na rede, é denotado NET.
TABELA III
<table>table see original document page 30</column></row><table>REFERÊNCIAS
[1] ITU-T Rec. Ρ.830, "Subjetiva desempenho assessment oftelephone-band e wideband digital codecs", 1996.
[2] ITU-T Rec. P.800, "Methods for Subjetiva Determinationof Transmission Quality", 1996.
[3] ITU-R Rec. BS. 1534-1, "Methods for the subjectiveassessment of intermediate qualidade levei of coding sistemas", 2005.
[4] ITU-R Rec. BS. 1284-1, "General Methods for thesubjective assessment of sound qualidade ", 2003.
[5] ITU-T Rec. G.107, "The e-modelo, a computationalmodelo para use in transmissão planning", 2005.
[6] M. Goldstein, "Classification of methods used forassessment of text-to- speech sistemas according to the demands placed onthe listener", Speech Comunicação, vol. 16, pp. 225-244, 1995.
[7] S. Quackenbush, T. Barnwell, e M. Clements, ObjectiveMeasures of Speech Qualidade. Prentice Hall, 1988.
[8] S. Wang, A. Sechave, e A. Gersho, "An objetive measurefor predicting subjective quality of speech coders",IEEE J. Selected Areas inCommun., vol. 10, no. 5, pp. 819-829, 1992.
[9] J. Beerends e J. Stemerdink, "A perceptual speech-qualitymeasure based on a psychoacoustic sound representation",J. áudio Eng. Soe,vol. 42, no. 3, pp. 115-123, 1994.
[10] S. Voran, "Objetivo estimation of perceived speechquality - Part I: Development of the measuring normalizing blocktechnique",IEEE Trans. Speech, áudio Processing, vol. 7, no. 4, pp. 371-382,1999.
[11] S. Voran, "Objective estimation of perceived speechuality - Part II: Evaluation of the measuring normalizing blocktechnique",IEEE Trans. Speech, áudio Processing, vol. 7, no. 4, pp. 383-390,1999.
[12] ITU-T Rec. Ρ. 862, "Perceptual evaluation of speechquality (PESQ)",2001.
[13] ITU-R. BS. 1387-1, "Method for Objective Measurementsof Perceived Audio Quality (PEAQ)", 2001.
[14] O. Au e K. Lam, "A novel output-based objective speechquality measure para fro qireless communication",Signal ProcessingProceedings, 4th Int. Conf., vol. 1, pp. 666-669, 1998.
[15] P. Gray, M. Hollier, e R. Massara, "Non-intrusive speech-quality assessment using vocal-tract modelos",em Proc. IEE Vision, Image eSignal Processing, vol. 147, pp. 493-501, 2000.
[16] J. Liang e R. Kubichek, "Output-based objective speechquality",IEEE 44th Vehicular tecnologia Conf., vol. 3, no. 8-10, pp. 1719-1723, 1994.
[17] H. Hermansky, "Perceptual linear predictiono (PLP)analysis of speech",J. Acous. Soe. Amer., vol. 87, pp. 1738-1752, 1990.
[18] T. FaIk, Q. Xu, e W.-Y. Chan, "Non-intrusive GMM-based speech quality measurement",in Proc. IEEE Int. Conf. Acous., Speech,Signal Processing, vol. 1, pp. 125-128, 2005.
[19] G. Chen e V. Parsa, "Bayesian model based non-intrusivespeech quality evaluation",in Proc. IEEE Int. Conf. Acous., Speech, SignalProcessing, vol. 1, pp. 385-388, 2005.
[20] D. Kim, "ANIQUE: An auditory model for single-endedspeech quality estimation",IEEE Trans. Speech, Audio Processing, vol. 13,pp. 821-831,2005.
[21] D. Kim e A. Tarraf, "Enhanced perceptual model for non-intrusive speech quality assessment", em Proc. IEEE Int. Conf. Acous.,Speech, Signal Processing, vol. 1, pp. 829-832, 2006.
[22] ITU-T P. 563, "Single ended method for objective speechquality assesment in narrow-band telephony appliations",2004.
[23] M. Werner, T. Junge, e P. Vary5 "Quality control forAMR speech channels in GSM networks",in Proc. IEEE Int. Conf. Acous.,Speech, Signal Processing, vol. 3, pp. 1076-1079, 2004.
[24] B. C. J. Moore, An Introduction to the Psychology ofHearing. London:
Academic Press, 1989.
[25] Z. Wang, A. Bovik, H. Sheikh, e E. Simoncelli, "Imagequality assessment: From error visibility to estrutural similarity",IEEE Trans.Image Process, vol. 13, pp. 600-612, 2004.
[26] R. Reynolds e A. Rix, "Quality VoIP -an engineeringchallenge",BT tecnologia Journal, vol. 19, pp. 23-32, 2001.
[27] M. Schroeder e B. Atai, "Code-excited linear prediction(CELP): high-quality speech at very Iow bit rates", em Proc. IEEE Int. Conf.Acous., Speech, Signal Processing, vol. 10, pp. 937-940, 1985.
[28] S. Jayant e P. Noll, Digital Coding of Waveforms.Englewood Cliffs NJ: Prentice-Hall, 1984.
[29] H. Knagenhjelm e W. B. Kleijn, "Spectral dynamics ismore important than spectral distortion", em Proc. IEEE Int. Conf. Acous.,Speech, SignalProcessing, vol. l,pp. 732-735, 1995.
[30] F. Norden e T. Eriksson, "Time evolution in LPCspectrum coding",IEEE
Trans. Speech, áudio Processing, vol. 12, pp. 290-301, 2004.
[31] T. Quatieri e R. Dunn, "Speech enhancement based onauditory spectral change", em Proc. IEEE Int. Conf. Acous., Speech, SignalProcessing, vol. 1, pp. 257-260, 2002.
[32] J. Beauchamp, "Synthesis by spectral amplitude ebrightness matching of analyzed musical instrument tones",J. áudio Eng. Soe,vol. 30, pp. 396- 406, 1982.
[33] S. Voran, "A simplified versão of the ITU algoritmo forobjective measurement of speech codec quality", em Proc. IEEE Int. Conf.Acous., Speech, Signal Processing, vol. 1, pp. 537-540, 1998.
[34] P. Devijver e J. Kittler, Pattern Recognition: A StatisticalApproach. London, UK: Prentice Hall, 1982.
[35] S. Stearns, "On selecting features for pattern classifiers",em Proc. 3rd Int.Conf. on Pattern Recognition, pp. 71-75, 1976.
[36] P. Pudil, F. Ferri, J. Novovicova, e J. Kittler, "FloatingSearch methods for featue selection with nonmonotonic criterion functions",em Proc. IEEE Intl.Conf. Pattern Recognition, pp. 279-283, 1994.
[37] T. Soderstrom, Discrete-time Stochastic Sistemas.London: Springer-Verlag, segunda ed., 2002.
[38] A. Dempster, N. Lair, e D. Rubin, "Maximum likelihoodfiram incomplete data via the EM algorithm",Journal Royal StatisticalSociety., vol. 39, pp. 1- 38, 1977.
[39] S. M. Kay, Fundamentais of Statistical Signal Processing,estimation Theory.Prentice Hall, 1993.
[40] W. B. Kleijη, P. Kroon, L. Célulaario, e D. Sereno, "A5.85 kbps CELP algorithm for cellular applications", em Proc. IEEE Int.Conf. Acous., Speech,Signal Processing, vol. 2, pp. 596-599, 1993.
[41] R. Laroia, N. Phamdo, e N. Farvardin, "Robust e efficientquantization of speech LSP parameters using structured vetor quantizers", emProc. IEEE Int. Conf. Acous., Speech, Signal Processing, vol. 1, pp. 641- 644,1991.
[42] DARPA-TIMIT, "Acoustic-telefonetic continuous speechcorpus, NIST Speech Disc 1-1.1 ",1990.
[43] ITU-T Rec. P. Supplement 23, "ITU-T coded-speechdatabase",1998.
[44] ITU-T. Rec. P.810, "Modulated Noise Reference
Unit",1996.
[45] R. Duda, P. Hart, e D. Stork, Pattern Classification.Wiley-Interscience, segunda ed., 2001.
[46] ITU-T. Rec. G.729, "Coding of speech at 8 kbit/s usingconjugate-structure algebraic-code-excited linear predicition (CS-ACELP)", 1996.

Claims (16)

1. Método de avaliação de qualidade de sinal não intrusivo,caracterizado pelo fato de incluir os estágios de:- determinar os parâmetros {Een, Tn, fn} representando quadrosde um sinal;- extrair uma coleção de vetores de característica porquadro(0(n)) representando a informação estrutural dos quadrosselecionados(") do mencionado sinal a partir dos mencionados parâmetros;- determinar um conjunto de características global (Ψ) sobremencionada coleção de vetores de características (Φ (n)) a partir dosmomentos estatísticos predeterminados dos componentes do vetor decaracterísticas selecionado (Φι, Φ2,...Φιι);- fazer prognóstico de uma medida de qualidade de sinal (apartir do mencionado conjunto de características globais (Ψ).
2. Método de acordo com a reivindicação 1, caracterizado pelofato de incluir o estágio de selecionar somente quadros (") com um vetor decaracterísticas (Φ (n)) ficando dentro de uma janela multidimensionalpredeterminada (Θ).
3. Método de acordo com a reivindicação 1 ou 2, caracterizadopelo fato de incluir o estágio de fazer prognóstico da mencionada medida dequalidade de sinal através de mapeamento do modelo de probabilidade demistura Gaussiano.
4. Método de acordo com qualquer das reivindicaçõesanteriores, caracterizado pelo fato de incluir o estágio de determinarmencionado conjunto de características global (Ψ) a partir de, pelo menos,algumas das propriedades estatísticas média, variância, inclinação e kurtosisdos componentes do mencionado vetor de características selecionado.
5. Método de acordo com a reivindicação 4, caracterizado pelofato de incluir o estágio de determinar as propriedades estatísticas dosmomentos centrais predeterminados (μφ; μ®2, μ®3 e μφ4) dos componentes domencionado vetor de características selecionado.
6. Método de acordo com a reivindicação 5, caracterizado pelofato de incluir o estágio de, de forma recursiva, determinar mencionadosmomentos centrais predeterminados (μφ, μφ2, μφ3 e μφ4).
7. Método de acordo com qualquer das reivindicaçõesanteriores, caracterizado pelo fato de incluir o estágio de obter mencionadosparâmetros a partir de uma seqüência de bit representando mencionado sinal.
8. Método de acordo com qualquer das reivindicaçõesanteriores 1 a 6, caracterizado pelo fato de incluir o estágio de obtermencionados parâmetros a partir da forma de onda do mencionado sinal.
9. Método de acordo com qualquer das reivindicaçõesanteriores, caracterizado pelo fato de que mencionado sinal é um sinal de fala.
10. Método de acordo com qualquer das reivindicaçõesanteriores, caracterizado pelo fato de que mencionado vetor de característicasinclui, pelo menos, algumas das características: planicidade espectral (Φι),dinâmica espectral (Φ2), centróide espectral (Φ3), variância de excitação (Φ4),variância de sinal (Φ5), período de ocorrência (Φ6), e suas derivadas no tempo(Φ7-Φ11).
11. Aparelho de avaliação de qualidade de sinal não intrusivo,caracterizado pelo fato de incluir:- um calculador de vetor de características (60) paradeterminar parâmetros {Een, Tn, fn} representando quadros (Ω) de um sinal eextraindo vetores de características por quadro (Φ(η)) representandoinformação estrutural do mencionado sinal a partir dos mencionadosparâmetros;- um seletor de quadro (62) para selecionar uma coleção devetores de características por quadro (Φ (n));- meios (66, 68, 70, 72, 74) para determinar um conjunto decaracterísticas globais (Ψ) sobre mencionada coleção de vetores decaracterísticas por quadro (Φ(η)) a partir dos momentos estatísticospredeterminados dos componentes do vetor de características selecionado (Φι,Φ2,-Φ11);- um previsor de qualidade para fazer prognóstico de umamedida de qualidade de sinal (O) a partir do mencionado conjunto decaracterísticas globais (1F).
12. Aparelho de acordo com a reivindicação 11, caracterizadopelo fato de que mencionado seletor de quadro (62) é arranjado para incluirsomente quadros ( ^ ) com um vetor de características (Φ (n)) ficando dentrode uma janela multidimensional predeterminada (Θ) na mencionada coleção.
13. Aparelho de acordo com a reivindicação 11 ou 12,caracterizado pelo fato de que mencionado previsor de qualidade é arranjadofazer prognóstico da mencionada medida de qualidade do sinal através demapeamento do modelo de probabilidade de mistura Gaussiano.
14. Aparelho de acordo com a reivindicação 11, 12 ou 13,caracterizado pelo fato de que mencionados meios (66, 68, 70, 72, 74) paradeterminar mencionado conjunto de características globais (Ψ) é arranjadopara determinar, pelo menos, algumas das propriedades estatísticas médias,variância, inclinação e kurtosis dos componentes do mencionado vetor decaracterísticas selecionado.
15. Aparelho de acordo com a reivindicação 14, caracterizadopelo fato de que mencionados meios (66, 68, 70, 72, 74) para determinarmencionado conjunto de características globais (Ψ) é arranjado paradeterminar as propriedades estatísticas dos momentos centraispredeterminados (μφ; μφ2, μ<ι>3 e μφ4) dos componentes do mencionado vetor decaracterísticas selecionado.
16. Aparelho de acordo com a reivindicação 15, caracterizadopelo fato de que os mencionados meios (66, 68, 70, 72, 74) para determinarmencionado conjunto de características globais (Ψ) são arranjados para, deforma recursiva, determinar mencionados momentos centrais predeterminados(μ®, μφ2, μΦ3 e μφ4).
BRPI0707343-7A 2006-01-31 2007-01-30 Método e aparelho de avaliação de qualidade de sinal não intrusivo BRPI0707343B1 (pt)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US76338306P 2006-01-31 2006-01-31
US60/763383 2006-01-31
PCT/SE2007/000080 WO2007089189A1 (en) 2006-01-31 2007-01-30 Non-intrusive signal quality assessment

Publications (2)

Publication Number Publication Date
BRPI0707343A2 true BRPI0707343A2 (pt) 2011-05-03
BRPI0707343B1 BRPI0707343B1 (pt) 2020-09-08

Family

ID=38327679

Family Applications (1)

Application Number Title Priority Date Filing Date
BRPI0707343-7A BRPI0707343B1 (pt) 2006-01-31 2007-01-30 Método e aparelho de avaliação de qualidade de sinal não intrusivo

Country Status (8)

Country Link
US (1) US8195449B2 (pt)
EP (1) EP1980089A4 (pt)
JP (1) JP5006343B2 (pt)
CN (1) CN101411171B (pt)
AU (1) AU2007210334B2 (pt)
BR (1) BRPI0707343B1 (pt)
CA (1) CA2633685A1 (pt)
WO (1) WO2007089189A1 (pt)

Families Citing this family (31)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20070203694A1 (en) * 2006-02-28 2007-08-30 Nortel Networks Limited Single-sided speech quality measurement
US7818168B1 (en) * 2006-12-01 2010-10-19 The United States Of America As Represented By The Director, National Security Agency Method of measuring degree of enhancement to voice signal
US8767566B2 (en) * 2006-12-15 2014-07-01 Tellabs Vienna, Inc. Method and apparatus for verifying signaling and bearer channels in a packet switched network
EP2410516B1 (en) * 2007-09-11 2013-02-13 Deutsche Telekom AG Method and system for the integral and diagnostic assessment of listening speech quality
CN101222744B (zh) * 2008-01-25 2012-09-26 中兴通讯股份有限公司 一种手机人体感应的测试方法及其系统
JP2009260941A (ja) * 2008-03-21 2009-11-05 Nippon Telegr & Teleph Corp <Ntt> 映像品質客観評価方法、映像品質客観評価装置、及びプログラム
US8949114B2 (en) 2009-06-04 2015-02-03 Optis Wireless Technology, Llc Method and arrangement for estimating the quality degradation of a processed signal
EP2457233A4 (en) * 2009-07-24 2016-11-16 Ericsson Telefon Ab L M PROCESS, COMPUTER PROGRAM AND COMPUTER PROGRAM PRODUCT FOR LANGUAGE QUALITY ASSESSMENT
TWI407431B (zh) * 2009-10-22 2013-09-01 Chunghwa Telecom Co Ltd A perceptual parameter based objective voice quality estimation method
JP5609157B2 (ja) * 2010-02-26 2014-10-22 ヤマハ株式会社 係数設定装置および雑音抑圧装置
EP2572356B1 (en) * 2010-05-17 2015-01-14 Telefonaktiebolaget L M Ericsson (PUBL) Method and arrangement for processing of speech quality estimate
US9015046B2 (en) * 2010-06-10 2015-04-21 Nice-Systems Ltd. Methods and apparatus for real-time interaction analysis in call centers
EP2595146A1 (en) * 2011-11-17 2013-05-22 Nederlandse Organisatie voor toegepast -natuurwetenschappelijk onderzoek TNO Method of and apparatus for evaluating intelligibility of a degraded speech signal
CN102496369B (zh) * 2011-12-23 2016-02-24 中国传媒大学 一种基于失真校正的压缩域音频质量客观评价方法
US9386386B2 (en) * 2012-01-09 2016-07-05 Actiwave Ab System and method for audio enhancement of a consumer electronics device
US9972306B2 (en) * 2012-08-07 2018-05-15 Interactive Intelligence Group, Inc. Method and system for acoustic data selection for training the parameters of an acoustic model
DE102013005844B3 (de) * 2013-03-28 2014-08-28 Technische Universität Braunschweig Verfahren und Vorrichtung zum Messen der Qualität eines Sprachsignals
US9396738B2 (en) 2013-05-31 2016-07-19 Sonus Networks, Inc. Methods and apparatus for signal quality analysis
US9679555B2 (en) * 2013-06-26 2017-06-13 Qualcomm Incorporated Systems and methods for measuring speech signal quality
US9870784B2 (en) 2013-09-06 2018-01-16 Nuance Communications, Inc. Method for voicemail quality detection
US9685173B2 (en) * 2013-09-06 2017-06-20 Nuance Communications, Inc. Method for non-intrusive acoustic parameter estimation
US10148526B2 (en) * 2013-11-20 2018-12-04 International Business Machines Corporation Determining quality of experience for communication sessions
US11888919B2 (en) 2013-11-20 2024-01-30 International Business Machines Corporation Determining quality of experience for communication sessions
WO2018028767A1 (en) * 2016-08-09 2018-02-15 Huawei Technologies Co., Ltd. Devices and methods for evaluating speech quality
EP3625791B1 (en) * 2017-05-18 2025-09-03 Telepathy Labs, Inc. Artificial intelligence-based text-to-speech system and method
CN108010539A (zh) * 2017-12-05 2018-05-08 广州势必可赢网络科技有限公司 一种基于语音激活检测的语音质量评估方法及装置
US11955138B2 (en) * 2019-03-15 2024-04-09 Advanced Micro Devices, Inc. Detecting voice regions in a non-stationary noisy environment
CN110033784B (zh) * 2019-04-10 2020-12-25 北京达佳互联信息技术有限公司 一种音频质量的检测方法、装置、电子设备及存储介质
KR102845224B1 (ko) * 2019-12-09 2025-08-12 삼성전자주식회사 전자 장치 및 이의 제어 방법
US10965806B1 (en) 2020-01-31 2021-03-30 Noble Systems Corporation Auto-correcting voice quality in real-time
CN112165342B (zh) * 2020-11-09 2021-09-21 华北电力大学 一种利用模式特征矢量的噪声检测方法和系统

Family Cites Families (17)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6446038B1 (en) * 1996-04-01 2002-09-03 Qwest Communications International, Inc. Method and system for objectively evaluating speech
JPH09331391A (ja) * 1996-06-12 1997-12-22 Nippon Telegr & Teleph Corp <Ntt> 通話品質客観推定装置
DE19647399C1 (de) * 1996-11-15 1998-07-02 Fraunhofer Ges Forschung Gehörangepaßte Qualitätsbeurteilung von Audiotestsignalen
CA2230188A1 (en) * 1998-03-27 1999-09-27 William C. Treurniet Objective audio quality measurement
ATE293333T1 (de) * 1998-10-08 2005-04-15 British Telecomm Messung der qualität von sprachsignalen
US6577996B1 (en) * 1998-12-08 2003-06-10 Cisco Technology, Inc. Method and apparatus for objective sound quality measurement using statistical and temporal distribution parameters
US6266638B1 (en) * 1999-03-30 2001-07-24 At&T Corp Voice quality compensation system for speech synthesis based on unit-selection speech database
ATE255762T1 (de) * 1999-11-08 2003-12-15 British Telecomm Nicht-beeinflussende bestimmung der sprachqualität
US7035790B2 (en) * 2000-06-02 2006-04-25 Canon Kabushiki Kaisha Speech processing system
DE60116559D1 (de) * 2001-10-01 2006-04-06 Koninkl Kpn Nv Verbessertes Verfahren zur Ermittlung der Qualität eines Sprachsignals
US7038710B2 (en) * 2002-07-17 2006-05-02 Koninklijke Philips Electronics, N.V. Method and apparatus for measuring the quality of video data
JP3809164B2 (ja) * 2002-12-25 2006-08-16 日本電信電話株式会社 総合通話品質推定方法及び装置、その方法を実行するプログラム、及びその記録媒体
ATE333694T1 (de) * 2003-01-18 2006-08-15 Psytechnics Ltd Werkzeug zur nicht invasiven bestimmung der qualität eines sprachsignals
DE60329160D1 (de) * 2003-01-21 2009-10-22 Psytechnics Ltd Verfahren und Vorrichtung zur Qualitätsbestimmung eines Audiosignals
GB2407952B (en) * 2003-11-07 2006-11-29 Psytechnics Ltd Quality assessment tool
US20050228655A1 (en) * 2004-04-05 2005-10-13 Lucent Technologies, Inc. Real-time objective voice analyzer
DE102004029421A1 (de) * 2004-06-18 2006-01-05 Rohde & Schwarz Gmbh & Co. Kg Verfahren und Vorrichtung zur Bewertung der Güte eines Signals

Also Published As

Publication number Publication date
EP1980089A1 (en) 2008-10-15
CA2633685A1 (en) 2008-08-09
US20090018825A1 (en) 2009-01-15
US8195449B2 (en) 2012-06-05
WO2007089189A1 (en) 2007-08-09
BRPI0707343B1 (pt) 2020-09-08
CN101411171B (zh) 2013-05-08
CN101411171A (zh) 2009-04-15
JP2009525633A (ja) 2009-07-09
JP5006343B2 (ja) 2012-08-22
EP1980089A4 (en) 2013-11-27
AU2007210334A1 (en) 2007-08-09
AU2007210334B2 (en) 2010-08-05

Similar Documents

Publication Publication Date Title
US8195449B2 (en) Low-complexity, non-intrusive speech quality assessment
Grancharov et al. Low-complexity, nonintrusive speech quality assessment
Yang et al. Performance of the modified bark spectral distortion as an objective speech quality measure
Rix et al. Objective assessment of speech and audio quality—technology and applications
Falk et al. Single-ended speech quality measurement using machine learning methods
Beerends et al. Perceptual evaluation of speech quality (PESQ): The new ITU standard for end-to-end speech quality assessment part II-psychoacoustic model
Grancharov et al. Speech quality assessment
Davis et al. Statistical voice activity detection using low-variance spectrum estimation and an adaptive threshold
US6609092B1 (en) Method and apparatus for estimating subjective audio signal quality from objective distortion measures
Rix Perceptual speech quality assessment-a review
Dubey et al. Non-intrusive speech quality assessment using several combinations of auditory features
Dubey et al. Non‐intrusive speech quality assessment using multi‐resolution auditory model features for degraded narrowband speech
Mahdi et al. Advances in voice quality measurement in modern telecommunications
Dubey et al. Non-intrusive objective speech quality assessment using a combination of MFCC, PLP and LSF features
Lam et al. Objective speech quality measure for cellular phone
Kim A cue for objective speech quality estimation in temporal envelope representations
Falk et al. Hybrid signal-and-link-parametric speech quality measurement for VoIP communications
Mahdi Perceptual non‐intrusive speech quality assessment using a self‐organizing map
Paajanen et al. New objective measures for characterisation of noise suppression algorithms
Mahdi et al. New single-ended objective measure for non-intrusive speech quality evaluation
Grancharov et al. Non-intrusive speech quality assessment with low computational complexity.
Dubey Non-intrusive objective speech quality assessment using features at single and multiple time-scales
Souček et al. Evaluation of itu-t p. 863 polqa in chinese environment
Falk Blind estimation of perceptual quality for modern speech communications
Aburas et al. Symbian Based Perceptual Evaluation of Speech Quality for Telecommunication Networks

Legal Events

Date Code Title Description
B06F Objections, documents and/or translations needed after an examination request according [chapter 6.6 patent gazette]
B06T Formal requirements before examination [chapter 6.20 patent gazette]
B15K Others concerning applications: alteration of classification

Free format text: AS CLASSIFICACOES ANTERIORES ERAM: H04M 3/22 , H04B 3/46 , G10L 19/00

Ipc: G10L 25/69 (2013.01), H04M 3/22 (1968.09)

B07A Application suspended after technical examination (opinion) [chapter 7.1 patent gazette]
B09A Decision: intention to grant [chapter 9.1 patent gazette]
B16A Patent or certificate of addition of invention granted [chapter 16.1 patent gazette]

Free format text: PRAZO DE VALIDADE: 10 (DEZ) ANOS CONTADOS A PARTIR DE 08/09/2020, OBSERVADAS AS CONDICOES LEGAIS.

B21F Lapse acc. art. 78, item iv - on non-payment of the annual fees in time

Free format text: REFERENTE A 18A ANUIDADE.

B24J Lapse because of non-payment of annual fees (definitively: art 78 iv lpi, resolution 113/2013 art. 12)

Free format text: EM VIRTUDE DA EXTINCAO PUBLICADA NA RPI 2812 DE 26-11-2024 E CONSIDERANDO AUSENCIA DE MANIFESTACAO DENTRO DOS PRAZOS LEGAIS, INFORMO QUE CABE SER MANTIDA A EXTINCAO DA PATENTE E SEUS CERTIFICADOS, CONFORME O DISPOSTO NO ARTIGO 12, DA RESOLUCAO 113/2013.