BRPI0114827B1 - método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada - Google Patents
método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada Download PDFInfo
- Publication number
- BRPI0114827B1 BRPI0114827B1 BRPI0114827A BRPI0114827A BRPI0114827B1 BR PI0114827 B1 BRPI0114827 B1 BR PI0114827B1 BR PI0114827 A BRPI0114827 A BR PI0114827A BR PI0114827 A BRPI0114827 A BR PI0114827A BR PI0114827 B1 BRPI0114827 B1 BR PI0114827B1
- Authority
- BR
- Brazil
- Prior art keywords
- lsf
- frame
- bad
- parameters
- last
- Prior art date
Links
- 238000000034 method Methods 0.000 title claims abstract description 49
- 230000000694 effects Effects 0.000 title claims abstract description 12
- 230000000873 masking effect Effects 0.000 title description 11
- 230000003595 spectral effect Effects 0.000 claims abstract description 88
- 230000003044 adaptive effect Effects 0.000 claims abstract description 23
- 238000004891 communication Methods 0.000 claims abstract description 15
- 239000013598 vector Substances 0.000 claims description 61
- NSMXQKNUPPXBRG-UHFFFAOYSA-N 1-(5-hydroxyhexyl)-3,7-dimethyl-3,7-dihydro-1H-purine-2,6-dione Chemical compound O=C1N(CCCCC(O)C)C(=O)N(C)C2=C1N(C)C=N2 NSMXQKNUPPXBRG-UHFFFAOYSA-N 0.000 claims description 25
- 238000004422 calculation algorithm Methods 0.000 claims description 11
- 230000007774 longterm Effects 0.000 claims description 8
- 230000015572 biosynthetic process Effects 0.000 claims description 6
- 238000006467 substitution reaction Methods 0.000 claims description 6
- 238000003786 synthesis reaction Methods 0.000 claims description 6
- 230000006978 adaptation Effects 0.000 claims description 3
- 238000001228 spectrum Methods 0.000 description 13
- 230000005284 excitation Effects 0.000 description 12
- 230000005540 biological transmission Effects 0.000 description 6
- 238000004458 analytical method Methods 0.000 description 4
- 238000004364 calculation method Methods 0.000 description 3
- 238000001514 detection method Methods 0.000 description 3
- 230000006870 function Effects 0.000 description 2
- 238000010348 incorporation Methods 0.000 description 2
- 230000007246 mechanism Effects 0.000 description 2
- 238000012986 modification Methods 0.000 description 2
- 230000004048 modification Effects 0.000 description 2
- 230000008569 process Effects 0.000 description 2
- 238000012545 processing Methods 0.000 description 2
- 238000013139 quantization Methods 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 238000005070 sampling Methods 0.000 description 2
- 238000012546 transfer Methods 0.000 description 2
- 230000002411 adverse Effects 0.000 description 1
- 230000002238 attenuated effect Effects 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 230000001413 cellular effect Effects 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 238000006243 chemical reaction Methods 0.000 description 1
- 125000004122 cyclic group Chemical group 0.000 description 1
- 230000007423 decrease Effects 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 238000012938 design process Methods 0.000 description 1
- 238000010586 diagram Methods 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 230000001939 inductive effect Effects 0.000 description 1
- 238000010295 mobile communication Methods 0.000 description 1
- 230000002829 reductive effect Effects 0.000 description 1
- 230000002441 reversible effect Effects 0.000 description 1
- 238000004088 simulation Methods 0.000 description 1
- 230000005236 sound signal Effects 0.000 description 1
- 238000012795 verification Methods 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/005—Correction of errors induced by the transmission channel, if related to the coding algorithm
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/06—Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/93—Discriminating between voiced and unvoiced parts of speech signals
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Transmission Systems Not Characterized By The Medium Used For Transmission (AREA)
- Detection And Prevention Of Errors In Transmission (AREA)
Abstract
"método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada". os efeitos dos quadros ruins recebidos sobre o canal de comunicação pelo decodificador de voz são encobertos para substituir os valores dos parâmetros dos quadros ruins (um quadro ruim sendo um quadro corrompido ou um quadro perdido) com valores baseados em pelo menos um meio parcialmente adaptativo dos quadros bons recentemente recebidos, mas no caso do quadro corrompido (quando oposto ao quadro perdido), usando o próprio quadro ruim se o quadro ruim encontrar um critério pré-determinado. o objetivo do encobrimento é encontrar os parâmetros mais adequados para o quadro ruim, de modo que a qualidade subjetiva de voz sintetizada seja a mais alta possível.
Description
(54) Título: MÉTODO E APARELHO PARA ENCOBRIR OS EFEITOS DOS ERROS DE QUADRO NOS QUADROS A SEREM DECODIFICADOS PELO DECODIFICADOR PARA PROPORCIONAR VOZ SINTETIZADA (51) Int.CI.: G10L 13/00; G10L 19/005; G10L 19/04 (30) Prioridade Unionista: 23/10/2000 US 60/242,498 (73) Titular(es): NOKIA TECHNOLOGIES OY (72) Inventor(es): JARI MÀKINEN; JANI ROTOLA-PUKKILA; HANNU J. MIKKOLA; JANNE VAINIO (85) Data do Início da Fase Nacional: 22/04/2003
1/18
OY .1 %
“MÉTODO E APARELHO PARA ENCOBRIR OS EFEITOS DOS ERROS DE QUADRO NOS QUADROS A SEREM DECODIFICADOS PELO DECODIFICADOR PARA PROPORCIONAR VOZ SINTETIZADA”.
CAMPO DA INVENÇÃO
A presente invenção refere-se a decodificadores de voz, e mais particularmente a métodos usados para controlar os quadros ruins recebidos pelos decodificadores de voz.
DESCRIÇÃO DA TÉCNICA ANTERIOR
Nos sistemas celulares digitais, um fluxo de bits é dito para ser transmitido através de um canal de comunicação conectando uma estação móvel a uma estação base sobre a interface aérea. O fluxo de bits é organizado em quadros, incluindo os quadros de voz. Se ou não um erro ocorre durante a transmissão depende das condições do canal prevalecentes. O quadro de voz que é detectado contendo erros é simplesmente chamado de um quadro ruim. De acordo com a técnica anterior, no caso de um quadro ruim, os parâmetros de voz derivados dos últimos parâmetros corretos (quadros corretos de voz sem erro) são substituídos para os parâmetros de voz do quadro ruim. O objetivo do controle do quadro ruim ao realizar tal substituição é encobrir os parâmetros corrompidos de voz do quadro de voz errôneo sem causar uma degradação observável na qualidade da voz.
Os codecs de voz modernos operam através do processamento do sinal de voz em pequenos segmentos, isto é, os quadros acima mencionados. O comprimento de quadro típico de um codec de voz é de 20 ms, o qual corresponde a 160 amostras de voz, assumindo uma freqüência de amostragem de 8 KHz. Nos chamados codecs de banda larga, o comprimento do quadro pode novamente ser de 20 ms, mas pode corresponder a 320 amostras de voz, assumindo uma freqüência de amostragem de 16 KHz. O quadro também pode ser dividido em um número de sub-quadros.
Para cada quadro, o codificador determina uma representação paramétrica do sinal de entrada. Os parâmetros são quantizados e então transmitidos através do canal de comunicação na forma digital. O codificador produz um sinal de voz sintetizado baseado nos parâmetros recebidos (ver Fig. 1).
2/18
Um conjunto típico de parâmetros de codificação extraído inclui os parâmetros espectrais (denominados de parâmetros de codificação preditiva linear, ou parâmetros LPC (linear predictive coding)) usados na predição a curto prazo, os parâmetros usados na predição a longo prazo do sinal (os chamados de parâmetros de predição a longo prazo ou parâmetros LTP (long-term prediction parameters)), os vários parâmetros de ganho, e finalmente, os parâmetros de excitação.
O que é chamado codificação preditiva linear é um método amplamente usado e bem sucedido para codificar a voz para transmissão sobre o canal de comunicação; este representa os atributos do modelo de freqüência do trato vocal. A parametrização LPC caracteriza o modelo do espectro de um segmento curto de voz. Os parâmetros LPC podem ser representados como LSF (Line Spectral Frequencies Freqüências de Linha Espectral) ou, equivalentemente, como ISPs (Immittance Spectral Pairs - Pares de Imitância Espectral). Os ISPs são obtidos através da decomposição da função A(z) de transferência de filtro inverso para estabelecer duas funções de transferência, uma possuindo simetria par e a outra possuindo simetria ímpar. Os ISPs, também chamados de Freqüências de Imitância Espectral (ISFs) são as raízes destes polinomiais no círculo de unidade z. Os Pares de Linha Espectral (também chamado de Freqüências de Linha Espectral) podem ser definidos da mesma forma que os Pares de Imitância Espectral; a diferença entre estas representações é o algoritmo de conversão, o qual transforma os coeficientes de filtro LP em outra representação de parâmetro LPC (LSP ou ISP).
Algumas vezes, a condição do canal de comunicação, através do qual são transmitidos os parâmetros de voz codificados é pobre, causando erros no fluxo de bit, isto é, ocasionando erros no quadro (e então ocasionando quadros ruins). Existem dois tipos de erros de quadro: os quadros perdidos e os quadros corrompidos. Em um quadro corrompido, apenas alguns dos parâmetros que descrevem um segmento de voz em particular (tipicamente de 20 ms de duração) são corrompidos. No tipo de quadro perdido do erro de quadro, um quadro é totalmente corrompido ou não recebido de forma alguma.
No sistema de transmissão baseado em pacote para comunicar voz (um sistema no qual um quadro é usualmente carregado como um pacote único), que em
3/18
C&
algumas das vezes é proporcionado por uma conexão Internet ordinária, é possível que um pacote de dados (ou quadro) nunca alcance o receptor pretendido ou que o pacote de dados (ou quadro) chegue tão atrasado que não possa ser usado, devido à natureza em tempo real da voz falada. Tal quadro é chamado de quadro perdido. O quadro corrompido em tal situação é um quadro entrante (usualmente dentro de um pacote único) no receptor, mas que contém alguns parâmetros que estão com erro, como indicado, por exemplo, pela verificação de redundância cíclica (CRC - cyclic redudancy check). Está é usualmente uma situação em uma conexão comutada por circuito, tal como uma conexão ao sistema global para comunicação móvel (GSM), onde a taxa de erro de bit (BER) em um quadro corrompido é tipicamente abaixo de 5 %.
Desse modo, pode ser visto que a resposta corretiva ótima para uma incidência de um quadro ruim é diferente para os dois casos de quadros ruins (o quadro corrompido e o quadro perdido). Existem diferentes respostas, no caso dos quadros corrompidos, e existe informação não confiável sobre os parâmetros, e no caso de quadros perdidos, nenhuma informação está disponível.
De acordo com a técnica anterior, quando um erro é detectado em um quadro de voz recebido, uma substituição e um procedimento de silêncio são iniciados; os parâmetros de voz do quadro ruim são substituídos por valores modificados ou atenuados do quadro bom anterior, embora alguns dos parâmetros menos importantes do quadro errôneo sejam usados, por exemplo, os parâmetros de predição linear excitados por código (CELPs - code excited linear prediction parameters), ou mais simplesmente os parâmetros de excitação.
Em alguns métodos de acordo com a técnica anterior, uma memória é usada (no receptor) denominada de histórico do parâmetro, onde os últimos parâmetros de voz recebidos sem erro são armazenados. Quando um quadro é recebido sem erro, o histórico do parâmetro é atualizado e os parâmetros de voz carregados pelo quadro são usados para decodificação. Quando um quadro ruim é detectado, através da verificação CRC ou de algum outro método de detecção de erro, um indicador de quadro ruim (BFI - bad frame indicator) é estabelecido para verdadeiro e o encobrimento do parâmetro (substituição e silêncio dos quadros ruins correspondentes) é então iniciado; os métodos da técnica
4/18
anterior para encobrimento do parâmetro usam o histórico do parâmetro para encobrir os quadros corrompidos. Como mencionado acima, quando um quadro recebido é classificado como um quadro ruim (BFI estabelecido como verdadeiro), alguns dos parâmetros de voz podem ser usados do quadro ruim; por exemplo, no exemplo de solução para a substituição do quadro corrompido de um codec de voz GSM AMR (múltiplas-taxas adaptativas - adaptive multi-rate) fornecido pelo ETSI (Instituto Europeu de Normas de Telecomunicações) na especificação 06.91, onde o vetor de excitação do canal é sempre usado. Quando um quadro de voz está perdido (incluindo a situação aonde um quadro chega tarde demais para ser usado, tal como, por exemplo, em alguns sistemas de transmissão baseados em IP), obviamente nenhum dos parâmetros do quadro perdido estão disponíveis para ser usado.
Em alguns dos sistemas da técnica anterior, os últimos parâmetros bons espectrais recebidos são substituídos pelos parâmetros espectrais do quadro ruim, após ser ligeiramente desviado em direção a um meio constante pré-determinado. De acordo com a especificação ETSI 06.91 GSM, o encobrimento é realizado no formato LSF (Freqüências de Linha Espectral), e é fornecido pelo seguinte algoritmo:
Para i = 0 a N-l:
LSF _ ql(i) = a*última_LSF_q(i) + (1- a) *meio_LSF(i);
1.0) (eq.
LSF_q2(i) = LSF_ql(i);
Onde a = 0,95eNéa ordem do filtro linear preditivo ( LP- predictive linear) sendo usado. A quantidade LSF_ql é o vetor LSF quantizado do segundo sub-quadro e a quantidade LSF_q2 é o vetor LSF quantizado do quarto sub-quadro. Os vetores LSF do primeiro e do terceiro sub-quadros são interpolados destes dois vetores. (O vetor LSF para o primeiro sub-quadro no quadro n é interpolado do vetor LSF do quarto sub-quadro no quadro n-l, isto é, do quadro anterior). A quantidade de últimaLSFq é a quantidade LSF_q2 do quadro anterior. A quantidade do meio_LSF é um vetor, cujo os componentes são constantes pré-determinadas; os componentes não dependem da seqüência de voz decodificada. A quantidade meioJLSF com componentes constantes gera um espectro de
5/18 voz constante.
Tais sistemas da técnica anterior sempre desviam os coeficientes do espectro em direção às quantidades constantes, aqui indicadas como meio_LSF(i). As quantidades da constante são construídas para calcular a média sobre um período de tempo longo e sobre vários emissores de voz sucessivos. Tais sistemas, portanto oferecem apenas uma solução de compromisso, não uma solução que é ótima para qualquer alto falante ou situação particular; a transação do compromisso é entre deixar os artefatos perturbadores na voz sintetizada, e tornar a voz mais natural ao soar (por exemplo, a qualidade de voz sintetizada).
O que é necessário é uma substituição do parâmetro espectral melhorado no caso do quadro de voz corrompido, possivelmente uma substituição baseada tanto em uma análise do histórico do parâmetro de voz quanto do quadro errôneo. Uma substituição adequada aos quadros errôneos de voz possui um efeito significante na qualidade de voz sintetizada produzida do fluxo de bits.
RESUMO DA INVENÇÃO
Conseqüentemente, a presente invenção proporciona um método e um aparelho correspondente para encobrir os efeitos de erros do quadro nos quadros a serem decodificados pelo decodificador para proporcionar uma voz sintetizada, os quadros sendo proporcionados sobre o canal de comunicação pelo codificador, onde cada quadro proporciona os parâmetros usados pelo decodificador na sintetização da voz, o método inclui as etapas de: determinar se um quadro é um quadro ruim; e proporcionar a substituição dos parâmetros do quadro ruim baseada em um meio pelo menos parcialmente adaptativo dos parâmetros espectrais de um número pré-determinado dos quadros bons recentemente recebidos.
Em um aspecto adicional da invenção, o método também inclui a etapa de determinar se o quadro ruim carrega voz não-estacionária ou estacionária, e, em adição, a etapa de proporcionar a substituição do quadro ruim é realizada de uma maneira que depende se o quadro ruim carrega voz não-estacionária ou estacionária. Ainda em um aspecto adicional da invenção, no caso de um quadro ruim carregando voz estacionária, a etapa de proporcionar a substituição do quadro ruim é realizada usando um meio de
6/18 • ·* · * • ♦ « • ··♦ t
parâmetros de um número pré-determinado dos quadros bons recentemente recebidos. Ainda em outro aspecto adicional da invenção, no caso de um quadro ruim carregando uma voz não-estacionária, a etapa de proporcionar a substituição do quadro ruim é realizada usando, quando muito, uma parte pré-determinada dos parâmetros de um número pré-determinado dos quadros bons recebidos recentemente.
Em outro aspecto da invenção, o método também inclui a etapa de determinar se o quadro ruim encontra um critério pré-determinado, e neste caso, usando o quadro ruim ao invés de substituir o quadro ruim. Ainda em um aspecto adicional da invenção com semelhante etapa, o critério pré-determinado envolve preparar um ou mais quadros de comparação: uma comparação interquadro, uma comparação intraquadro, uma comparação de dois pontos, e uma comparação de ponto único.
De outra perspectiva, da invenção um método para encobrir os efeitos de erros de quadros nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada, onde os quadros são proporcionados sobre o canal de comunicação pelo decodificador, cada quadro proporcionando os parâmetros usados pelo decodificador na sintetização de voz, o método inclui as etapas de: determinar se um quadro é um quadro ruim; e proporcionar a substituição dos parâmetros do quadro ruim, a substituição na qual as últimas frequências de imitância espectral (ISF) são desviadas em direção a um meio parcialmente adaptativo fornecido por:
ISFq (i) = a* últimaISFq (i) + (1- a) * ISFmeio (i), para i = 0,16, onde α = 0,9,
ISFq (i) é o componente iésimo do vetor ISF para um quadro atual, última_ISFq (i) é o componente iés,!T1° do vetor ISF para um quadro anterior, ISFmeio (i) é o componente iésimo do vetor que é uma combinação do meio adaptativo e os vetores ISF constantes do meio pré-determinado, e é calculado usando a 25 fórmula:
ISFmeio (Í) — β * ISFmeio_const (í) + (1“β) * ISFmeio adaptativo (l), para 1 — 0,16, 2 , onde β= 0,75, onde ISF meiojidaptativo (i) = — última _ ISFqÇi) e é adaptado sempre 3Í=O
7/18 * · · ··· ··· · · ··· · que BFI=O, onde BFI é um indicador de quadro ruim, e onde ISFmeio_const (i) é o componente iésimo de um vetor formado de uma média a longo prazo de vetores ISF.
BREVE DESCRIÇÃO DOS DESENHOS
Os objetos acima e outros, os aspectos e as vantagens da invenção tornarse-ão aparentes ao considerar a descrição detalhada subseqüente apresentada em conexão com os desenhos apensos, nos quais:
A Fig. 1 é um diagrama em blocos dos componentes do sistema de acordo com a técnica anterior para transmitir ou armazenar sinal de voz ou de áudio;
A Fig.2 é um gráfico ilustrando os coeficientes LSF [0 ... 4 kHz] dos quadros adjacentes no caso de voz estacionária, o eixo Y sendo a freqüência e o eixo X sendo os quadros;
A Fig.3 é um gráfico ilustrando os coeficientes LSF [O...4kHz] dos quadros adjacentes no caso da voz não-estacionária, o eixo Y sendo a freqüência e o eixo X sendo os quadros;
A Fig.4 é um gráfico ilustrando o erro de desvio espectral absoluto no método da técnica anterior;
A Fig.5 é um gráfico ilustrando o erro de desvio espectral absoluto na presente invenção (mostrando que a presente invenção fornece uma substituição melhor dos parâmetros espectrais do que o método da técnica anterior), onde a barra mais elevada no gráfico (indica o resíduo mais provável) é de aproximadamente zero;
A Fig. 6 é um fluxograma esquemático ilustrando como os bits são classificados de acordo com a técnica anterior quando um quadro ruim é detectado;
A Fig. 7 é o fluxograma do método completo da invenção; e
A Fig. 8 é um conjunto de dois gráficos ilustrando os aspectos do critério usado para determinar se ou não é aceitável a LSF do quadro indicado que possui erros.
DESCRIÇÃO DETALHADA DA INVENÇÃO
De acordo com a invenção, quando um quadro ruim é selecionado pelo decodificador após a transmissão do sinal de voz através do canal de comunicação (Fig. 1), os parâmetros espectrais corrompidos do sinal de voz são encobertos (ao substituir outros parâmetros por estes) baseados na análise dos parâmetros espectrais recentemente
8/18
comunicados através do canal de comunicação. É importante encobrir os parâmetros espectrais corrompidos do quadro ruim não apenas porque os parâmetros espectrais corrompidos podem causar artefatos (sons audíveis que não são obviamente voz), mas também porque a qualidade subjetiva dos quadros subseqüentes de voz livre de erro diminui (pelo menos quando a quantização preditiva linear for usada).
A análise de acordo com a invenção também faz uso da natureza localizada do impacto espectral dos parâmetros espectrais, tais como as freqüências de linha de espectral (LSFs). O impacto espectral LSFs é dito para estar localizado nesta se um parâmetro LSF é adversamente alterado por uma quantização e pelo processo de codificação, o espectro LP irá mudar apenas próximo da frequência representada pelo parâmetro LSF, deixando o resto do espectro inalterado.
A invenção em geral, para o quadro perdido ou o quadro corrompido.
De acordo com a invenção, um analisador determina o encobrimento do parâmetro espectral no caso do quadro ruim baseado no histórico de parâmetros de voz anteriormente recebido. O analisador determina o tipo do sinal de voz decodificada (isto é, se é estacionária ou não-estacionária). O histórico dos parâmetros de voz é usado para classificar o sinal de voz decodificado (como estacionário ou não, e mais especificamente, como vocodificado ou não); o histórico que é usado pode ser derivado principalmente dos valores mais recentes LTP e dos parâmetros espectrais.
Os termos sinal de voz estacionário e sinal de voz vocodificado são praticamente sinônimos; uma seqüência de voz vocodificada é usualmente um sinal relativamente estacionário, enquanto que uma seqüência de voz não-vocodificada não o é. Nós usamos a termologia sinal de voz estacionário e não-estacionário aqui, pois essa terminologia é mais precisa.
Um quadro pode ser classificado como vocodificado ou não-vocodificado (e também estacionário e não-estacionário) de acordo com a razão da potência de excitação adaptativa sob o total de excitação, como indicado no quadro para a voz correspondente ao quadro. (Um quadro contém os parâmetros de acordo com os quais ambas a excitação adaptável e total são construídas; depois disto, a potência total pode ser calculada).
Se a seqüência de voz for estacionária, os métodos da técnica anterior dos
9/18
Ιό quais os parâmetros espectrais corrompidos são encobertos, como indicado acima, não são particularmente eficazes. Isto é devido aos parâmetros espectrais adjacentes estacionários estarem mudando vagarosamente, então os valores anteriores espectrais bons (os valores não corrompido ou espectral perdido) são usualmente bem estimados para os próximos coeficientes espectrais, e mais especificamente, são melhores do que os parâmetros espectrais do quadro anterior conduzidos em direção ao meio constante, o qual a técnica anterior poderia usar no lugar dos parâmetros espectrais ruins (para encobrí-los). A Fig. 2 ilustra, um sinal de voz estacionário (e mais particularmente um sinal de voz vocodificado), as características de LSFs, como um exemplo dos parâmetros espectrais; esta ilustra os coeficientes LSF [0 ... 4 kHz] dos quadros adjacentes de voz estacionária, o eixo Y sendo a freqüência e o eixo X sendo os quadros, mostrando que as LSFs realizam a troca relativamente lenta, de quadro para quadro, para a voz estacionária.
Durante os segmentos da voz estacionária, o encobrimento é executado de acordo com a invenção (para os quadros perdidos ou corrompidos) usando os seguintes algoritmos:
Para i = 0 a N-l (elementos dentro de um quadro): meio_adaptativo_LSF_vetor (i) =última_LSF_boa (i) (0) + última_LSF_boa (i) (1) + ...+última_LSF_boa (i) (k-l))/k;
LSF_ql(i) = a*última_LSF_boa (i) (0) + (1-ct)* meio_adaptativo_LSF (i); (2.1)
LSF_q2 (i) = LSF_ql (i).
onde α pode ser aproximadamente 0,95, N é a ordem do filtro LP, e k é o comprimento de adaptação. LSF_ql (i) é o vetor LSF quantizado do segundo sub-quadro e LSF_q2 (i) é o vetor LSF quantizado do quarto sub-quadro. Os vetores LSF do primeiro e terceiro sub-quadros estão interpolados a partir destes dois vetores. A quantidade última_LSF_boa (i) (0) é igual ao valor da quantidade LSF_q2 (i-1) do quadro bom anterior. A quantidade últimaLSFboa (i) (n) é um componente do vetor dos parâmetros LSF do quadro anteriormente bom n+lésimo (isto é, o quadro bom que precede o quadro
10/18 < · ·
ruim atual por η + 1 quadros). Finalmente, a quantidade meio_adaptativo_LSF (i) é o meio (média aritmética) dos vetores bons LSF anteriores (isto é, é um componente da quantidade do vetor, cada componente sendo um meio dos componentes correspondentes dos vetores bons LSF anteriores).
Tem sido demonstrado que o método do meio adaptativo da invenção melhora a qualidade subjetiva da voz sintetizada comparado ao método da técnica anterior. A demonstração usou simulações onde a voz é transmitida através do canal de comunicação de indução de erro. Toda vez que um quadro ruim foi detectado, o erro espectral foi calculado. O erro espectral foi obtido ao subtrair, do espectro original, o espectro que foi usado para encobrir durante o quadro ruim. O erro absoluto é calculado através do valor absoluto do erro espectral. As Fig. 4 e 5 mostram os histogramas do erro de desvio absoluto de LSFs da técnica anterior e do método inventado, respectivamente. O encobrimento do erro ótimo possui um erro próximo de zero, isto é, quando o erro é próximo de zero, os parâmetros espectrais usados para encobrir estão bem próximos dos parâmetros espectrais originais (corrompidos ou perdidos). Como pode ser visto dos histogramas das Figs. 4 e 5, o método do meio adaptativo da invenção (Fig. 5) encobre os erros melhor do que o método da técnica anterior (Fig .4) durante as seqüências de voz estacionária.
Como mencionado acima, os coeficientes espectrais dos sinais nãoestacionários (ou, menos precisamente, sinais não-vocodificados) flutuam entre os quadros adjacentes, como indicado na Fig. 3, a qual é um gráfico ilustrando as LSFs dos quadros adjacentes no caso da voz não-estacionária, o eixo Y sendo a freqüência e o eixo X sendo os quadros. Neste caso, o método de encobrimento ótimo não é o mesmo do caso do sinal de voz estacionária. Para a voz não-estacionária, a invenção proporciona o encobrimento para os segmentos ruins de voz não-estacionária (corrompidos ou perdidos) de acordo com o algoritmo seguinte (o algoritmo não-estacionário):
Para i = 0 a N-l:
meio_parcialmente_adaptativo_LSF (i) = β* meio_LSF(i) + (l-β)* meio_adaptativo_LSF (i);
(2.3)
11/18
LSF_q1 (i) = a*última_LSF_boa (i) (0) + (1-a)*meio_parcialmente_adaptativo_LSF (i); (2.2)
LSF_q1 (i) = LSF_q2 (i);
onde N é a ordem do filtro LP, e α é, tipicamente, aproximadamente 0,90, onde
LSF_q1 (i) e LSFq2 (i) são dois conjuntos de vetores LSF para o quadro atual como na equação (2.1), onde o último LSF_q(i) é LSF_q2 (i) do quadro bom anterior, onde meio_parcialmente_adaptativo_LSF (i) é uma combinação do vetor LSF no meio adaptativo e o vetor LSF médio, e onde meio_adaptativo_LSF (i) é o meio dos últimos vetores LSF bons K (o qual é atualizado quando o BFI não for estabelecido), e onde meio_LSF(i) é uma LSF média constante e é gerada durante o processo de projeto do codec sendo usado para a voz sintetizada; este é um LSF médio de alguma base de dado. O parâmetro β é tipicamente de aproximadamente 0,75, um valor usado para expressar a extensão pela qual a voz é estacionária como oposta a não-estacionária. (O valor é algumas vezes calculado baseado na relação da energia de excitação da predição a longo prazo pela energia de excitação fixa do livro-código, ou mais precisamente, usando a fórmula:
β = 1 + Fator de voz 2 em que:
Fator de voz = energia^ - energia^ova :o energia!.om + energiainovação em que a energiatom é a energia de excitação do tom e a energiainovação é a energia da inovação da excitação do código. Quando a maior parte da energia for uma excitação de predição a longo prazo, a voz sendo decodificada é principalmente estacionária. Quando a maior parte da energia for uma excitação fixa do livro-código, a voz é principalmente não-estacionária).
Para β = 1,0, a equação (2.3) reduz a equação (1.0), a qual é usada pela técnica anterior. Para β = 0,0, a equação (2.3) reduz para a equação (2.1), a qual é usada pela presente invenção para os segmentos estacionários. Para as implementações sensíveis
Petição 870170026268, de 20/04/2017, pág. 15/81
12/18
á complexidade (nas aplicações onde é importante manter a complexidade a um nível razoável), β pode ser estabelecido para algum valor de compromisso, por exemplo, de 0,75, para ambos os segmentos estacionários e não-estacionários. O encobrimento do parâmetro espectral especificamente para quadros perdidos.
No caso do quadro perdido, apenas a informação dos últimos parâmetros espectrais está disponível. Os parâmetros espectrais substituídos são calculados de acordo com um critério baseado nos históricos do parâmetro de, por exemplo, os valores espectrais e LTP (predição a longo prazo - long-term prediction); os parâmetros LTP incluem o valor de ganho LTP e o valor de retardo. LTP representa a correlação do quadro atual para o quadro anterior. Por exemplo, o critério usado para calcular os parâmetros espectrais substituídos podem distinguir situações onde as últimas LSFs boas deveriam ser modificadas por um meio LSF adaptativo ou, como na técnica anterior, por um meio constante.
Encobrimento do parâmetro espectral alternativo para quadros corrompidos:
Quando o quadro de voz é corrompido (quando oposto ao perdido), o procedimento de encobrimento da invenção pode ser também otimizado. Neste caso, os parâmetros podem estar completamente ou parcialmente corretos quando recebidos no decodificador de voz. Por exemplo, a conexão baseada em pacote (como em uma conexão Internet ordinária TCP/IP), o método de encobrimento dos quadros corrompidos não é usualmente possível, pois com as conexões do tipo TCP/IP usualmente todos os quadros ruins são quadros perdidos, porém para outros tipos de conexões, tal como as conexões comutadas por circuito GSM ou EDGE, o método de encobrimento dos quadros corrompidos da invenção pode ser usado. Desse modo, para as conexões comutadas por pacote, o seguinte método alternativo não pode ser usado, porém para as conexões comutadas por circuito, esta pode ser usada, desde que em tais quadros ruins de conexões sejam pelo menos (e de fato usualmente) quadros corrompidos.
De acordo com as especificações GSM, um quadro ruim é detectado quando o indicador BFI é estabelecido seguindo uma verificação CRC ou outro mecanismo de detecção de erro usado no processo de decodificação do canal. Os mecanismos de
13/18
1£>
detecção de erro são usados para detectar os erros nos bits subjetivamente mais significativos, isto é, nos bits que possuem um efeito mais elevado na qualidade de voz sintetizada. Em alguns dos métodos da técnica anterior, estes bits mais significativos não são usados quando o quadro é indicado para ser um quadro ruim. Entretanto, um quadro pode possuir apenas uns poucos erros de bit (mesmo que seja suficiente para estabelecer o indicador BFI), então todo o quadro poderia ser descartado, embora a maioria dos bits estivesse correto. Uma verificação CRC detecta simplesmente se ou não um quadro possui quadros enormes, mas não faz nenhuma estimativa do BER (taxa de erro em bit). A Fig.6 ilustra como os bits são classificados de acordo com a técnica anterior quando um quadro ruim é detectado. Na Fig. 6, um único quadro é mostrado sendo comunicado, um bit de cada vez (da esquerda para direita), para um decodificador sobre o canal de comunicações com condições tais que alguns bits do quadro incluídos na verificação CRC sejam corrompidos, e então o BFI é estabelecido para um.
Como pode ser visto da Fig. 6, mesmo quando o quadro recebido as vezes contém alguns bits corretos (o BER em um quadro usualmente sendo pequeno quando as condições de canal são relativamente boas), a técnica anterior não os usa. Em contraste, a presente invenção tenta estimar se os parâmetros recebidos são corrompidos e se não são, o método inventado os usa.
A Tabela 1 demonstra a idéia anterior do encobrimento do quadro 20 corrompido de acordo com a invenção no exemplo de um decodificador de banda larga (WB - wideband) de múltiplas-taxas adaptativas (AMR).
| C/l [dB] | |||||
| Modo 12.65 (AMW WB) | 10 | 9 | 8 | 7 | 6 |
| BER | 3,72% | 4,58% | 5,56% | 6,70% | 7,98% |
| FER | 0,30% | 0,74% | 1,62% | 3,45% | 7,16% |
| índices de parâmetro espectral correto | 84% | 77% | 68% | 64% | 60% |
| Espectro totalmente correto | 47% | 38% | 32% | 27% | 24% |
Tabela 1. Porcentagem de parâmetros espectrais corretos em um quadro de voz corrompido.
No caso do decodificador AMR WB, o modo 12,65 kbits/s é uma boa 25 escolha par usar quando a relação portadora do canal para interferência (C/I) está na faixa de aproximadamente 9 dB a 10 dB. A partir da Tabela 1, pode ser visto que no caso das
14/18
condições de canal GSM com uma C/I na faixa de 9 a 10 dB ao usar o esquema de modulação GSMK (Modulação por Desvio Mínimo Gaussiano), aproximadamente de 3050% dos quadros ruins recebidos possuem um espectro totalmente correto. Também, aproximadamente 75-85 % de todos os coeficientes do parâmetro espectral de quadro ruim estão corretos. Devido à natureza localizada do impacto espectral, como mencionado anteriormente, a informação do parâmetro do espectro pode ser usada nos quadros ruins. As condições do canal com uma C/I na faixa de 6-8 dB ou menos são tão pobres que o modo de 12,65 kbit/s não poderia ser usado.
A idéia básica da presente invenção no caso dos quadros corrompidos é que de acordo com o critério (descrito abaixo), os bits de canal do quadro corrompido são usados para decodificar o quadro corrompido. O critério para os coeficientes espectrais é baseado nos últimos valores dos parâmetros de voz do sinal sendo decodificado. Quando um quadro ruim é detectado, as LSFs recebidas ou outros parâmetros espectrais comunicados através do canal são usados se o critério for encontrado; em outras palavras, se as LSFs recebidas encontram o critério, elas são usadas na decodificação da mesma maneira que elas seriam se o quadro não fosse um quadro ruim. Por outro lado, isto é, se as LSFs do canal não encontram o critério, o espectro para o quadro ruim é calculado de acordo com o método de encobrimento descrito acima, usando equações (2.1) ou (2.2). O critério para aceitar os parâmetros espectrais pode ser implementado para usar, por exemplo, o cálculo da distância espectral, tal como o cálculo da chamada distância espectral de Itakura-Saito. (Ver, por exemplo, a página 329 do artigo Processamento de Tempo-Discreto dos Sinais de Voz de John R Deller Jr, John H. L. Hansen, e John G. Proakis, publicado pela editora IEEE, 2000).
O critério para aceitação dos parâmetros espectrais a partir do canal deve ser muito rigoroso no caso do sinal de voz estacionária. Como mostrado na Fig.3, os coeficientes espectrais são muitos estáveis durante a seqüência estacionária (por definição) de modo que as LSFs corrompidas (ou outros parâmetros de voz) do sinal de voz estacionário pode ser usualmente detectado (desde que eles sejam distinguíveis das LSFs não corrompidas com base em que elas diferem dramaticamente das LSFs dos quadros adjacentes não-corrompidos). Por outro lado, para um sinal de voz não-estacionária, o
15/18
critério não necessita ser tão rígido, o espectro para o sinal de voz não-estacionária é permitido possuir uma variação maior. Para um sinal de voz não-estacionária, a exatidão dos parâmetros espectrais corretos não é rígida em relação aos artefatos audíveis, desde que para voz não-estacionária (isto é, mais ou menos voz não-vocodificada), os artefatos não audíveis são provavelmente indiferentes se os parâmetros de voz são ou não corretos. Em outras palavras, mesmo se os bits dos parâmetros espectrais forem corrompidos, eles podem ainda ser aceitos de acordo com o critério, uma vez que os parâmetros espectrais para voz não-estacionária com alguns bits corrompidos não irão usualmente gerar quaisquer artefatos audíveis. De acordo com a invenção, a qualidade subjetiva da voz sintetizada é para ser diminuída o menos possível no caso dos quadros corrompidos ao usar toda a informação disponível sobre as LSFs recebidas, e ao selecionando qual LSFs a usar de acordo com as características da voz sendo carregada.
Desse modo, embora a invenção inclua um método para encobrir os quadros corrompidos, também compreende como uma alternativa usar um critério no caso do quadro corrompido carregando voz não-estacionária, a qual, se encontrada, irá fazer com que o decodificador use o quadro corrompido como está; em outras palavras, embora o BFI seja estabelecido, o quadro será usado. O critério é na essência um limiar usado para distinguir entre um quadro corrompido que é útil e um que não é; o limiar é baseado em quantos parâmetros espectrais do quadro corrompido diferem dos parâmetros espectrais dos quadros bons recentemente recebidos.
O uso de possíveis parâmetros espectrais corrompidos é provavelmente mais sensível aos artefatos audíveis do que o uso de outros parâmetros corrompidos, tais como os valores de retardo de LTP corrompidos. Por esta razão, o critério usado para determinar se ou não usar possivelmente um parâmetro espectral corrompido deveria ser especialmente confiável. Em algumas configurações, é vantajoso usar como critério, uma distância espectral máxima (do parâmetro espectral correspondente ao quadro anterior, além do qual o parâmetro espectral suspeito não é para ser usado); em tal incorporação, o cálculo da distância Itakura-Saito bem conhecido poderia ser usado para quantificar a distância espectral para ser comparada com o limiar. Alternativamente, as estatísticas adaptativas ou fixas dos parâmetros espectrais poderíam ser usadas para determinar se ou
16/18
não usar os parâmetros espectrais possivelmente corrompidos. Outros parâmetros de voz também, tais como os parâmetros de ganho, podem ser usados para gerar o critério. (Se outros parâmetros de voz não são drasticamente diferentes do quadro atual, quando comparados com os valores no quadro bom mais recente, então os parâmetros são provavelmente bons para uso, ao fornecer os parâmetros espectrais recebidos que também encontram o critério. Em outras palavras, outros parâmetros, tais como os ganhos de LTP, podem ser usados como um componente adicional para estabelecer o critério próprio para determinar se ou não usar os parâmetros espectrais recebidos. O histórico dos outros parâmetros de voz pode ser usado para reconhecimento melhorado das características de voz. Por exemplo, o histórico pode ser usado para decidir se a seqüência de voz decodificada possui uma característica estacionária ou não-estacionária. Quando as propriedades da seqüência de voz decodificada são conhecidas, é mais fácil detectar os parâmetros espectrais possivelmente corretos do quadro corrompido e é mais fácil estimar que tipo de valores de parâmetro espectrais são esperados para serem carregados no quadro corrompido recebido).
De acordo com a invenção em uma incorporação preferida, e agora referindo-se a Fig. 8, o critério para determinar se ou não usar um parâmetro espectral para um quadro corrompido é baseado na noção da distância espectral, como mencionado acima. Mais especificamente, para determinar se o critério para aceitação dos coeficientes de LSF de um quadro corrompido for encontrado, o processador do receptor executa o algoritmo que verifica quantos coeficientes LSF têm movido ao longo do eixo da freqüência comparado aos coeficientes LSF do último quadro bom, o qual é armazenado na memória LSF, junto com os coeficientes LSF de um número pré-determinado de quadros anteriores mais recentes.
O critério de acordo com a incorporação preferida envolve realizar uma ou mais de quadro comparações: uma comparação interquadro, uma comparação intraquadro, uma comparação de dois pontos, e uma comparação de ponto único.
Na primeira comparação, a comparação interquadro, as diferenças entre os elementos do vetor LSF nos quadros adjacentes do quadro corrompido são comparados às diferenças correspondentes dos quadros anteriores. As diferenças são determinadas como
17/18 : .· · :
...... ··· . . ... :
se segue:
í/n(z) — - l(z)— Ln(f) | , 1 < ΐ < P-l, onde P é o número de coeficientes espectrais para o quadro, Ln (i) é o elemento LSF iésimo do quadro corrompido, e Ln-i (i) é o elemento LSF iésun0 do quadro antes do quadro corrompido. O elemento LSF, Ln (i) do quadro corrompido é descartado se a diferença, dn (i), for tão alta comparada a dn-i (i), dn-2 (i),..., dn-k (i), onde k é o comprimento da memória LSF.
A segunda comparação, a comparação intraquadro, é uma comparação da diferença entre os elementos do vetor LSF adjacentes no mesmo quadro. A distância entre o elemento candidato LSF iésim0, o Ln (i), e o elemento LSF (i-1)ésimo, Ln-i (i), do quadro nésimo é determinado como se segue:
en(i) = Ln(i -1) - Ln(i) , 2<i<P-l, onde P é o número de coeficientes espectrais e en (i) é a distância entre os elementos LSF. As distâncias são calculadas entre todos os elementos do vetor LSF do quadro. Um ou outro ou ambos os elementos LSF Ln (i) e Ln (i-1) será ou serão descartado(s) se a diferença en (i), for tão grande ou tão pequena comparada a en-i (i), en-2 (i),..., en-k (i).
A terceira comparação, a comparação de dois pontos, determina se uma intercessão tem ocorrido envolvendo o elemento candidato Ln (i) de LSF, isto é, se um elemento Ln (i-1) que é inferior para ao elemento candidato que possui um valor maior do que o elemento candidato Ln(i) de LSF. A intercessão indica um ou mais valores LSF altamente corrompidos. Todos os elementos de intercessão são usualmente descartados.
A quarta comparação, a comparação de ponto único, compara o valor do elemento candidato do vetor LSF, Ln(i) a um elemento LSF mínimo, Lnm(i), e o elemento LSF máximo, Lmáx (i), ambos calculados a partir da memória, e descarta o elemento LSF candidato se este estiver fora da área delimitada pelos elementos LSF mínimo e máximo.
Se um elemento LSF de um quadro corrompido é descartado (baseado no critério acima ou de outra maneira), então um novo valor para o elemento LSF é calculado de acordo com o algoritmo usando a equação (2.2).
18/18
Referindo agora a Fig. 7, um fluxograma do método completo da invenção é mostrado, indicando as diferentes provisões para os quadros de voz estacionários e nãoestacionários, e para os corrompidos quando oposto aos quadros de voz perdidos nãoestacionários.
Discussão:
A invenção pode ser aplicada em um decodificador de voz ou em uma estação móvel ou em um elemento de rede móvel. Pode também ser aplicada a qualquer decodificador de voz usado em um sistema que possui um canal de transmissão errôneo.
Escopo da Invenção:
É para ser entendido que as incorporações descritas acima são apenas ilustrativas dos princípios do pedido da presente invenção. Em particular, deve ser entendido que embora a invenção tenha sido mostrada e descrita usando os pares de linha de espectro para uma ilustração concreta, a invenção também pode usar outros parâmetros equivalentes, tais como os pares de imitância espectral. Numerosas modificações e incorporações alternativas podem ser visualizadas pelo técnico no assunto sem se afastar do conceito inventivo e escopo da presente invenção, e as reivindicações apensas são pretendidas para cobrir tais modificações e incorporações.
1/7
Claims (19)
- REIVINDICAÇÕES1. Método para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar uma voz sintetizada, os quadros sendo fornecidos pelo canal de comunicação para o decodificador, cada quadro5 fornecendo os parâmetros usados pelo decodificador na sintetização de voz, caracterizado pelo fato de que compreende as seguintes etapas:a) determinar se o quadro é um quadro ruim; eb) proporcionar uma substituição dos parâmetros espectrais do quadro ruim baseada somente nos parâmetros espectrais para os quadros bons recentemente e10 anteriormente recebidos e incluindo pelo menos uma média parcialmente adaptativa dos parâmetros espectrais de um número pré-determinado da maioria dos quadros bons recentemente e anteriormente recebidos.
- 2. Método de acordo com a reivindicação 1, caracterizado pelo fato de que compreende ainda a etapa de determinar se o quadro ruim carrega voz não-estacionária15 ou estacionária, e sendo que a etapa de proporcionar a substituição do quadro ruim é realizada de uma maneira que depende se o quadro ruim carrega voz não-estacionária ou estacionária.
- 3. Método de acordo com a reivindicação 2, caracterizado pelo fato de que, no caso de um quadro ruim carregando voz estacionária, a etapa de proporcionar a20 substituição do quadro ruim é realizada usando a média dos parâmetros de um número pré-determinado dos quadros bons recentemente recebidos.
- 4. Método de acordo com a reivindicação 3, caracterizado pelo fato de que, no caso de um quadro ruim carregando uma voz não-estacionária e no caso de um filtro de predição linear (LP) estar sendo usado, a etapa de proporcionar a substituição do25 quadro ruim é realizada de acordo com o algoritmo:Para i = 0 a N-1:meio_adaptativo_LSF_vetor (i) = (última_LSF_boa (i) (0) + última_LSF_boa (i) (1) + .... + última_LSF_boa (i) (k-1))/k;30 LSF_q1(i) = a*última_LSF_boa (i) (0) + (1-a)*meio_adaptativo_LSF (i);(2.1)Petição 870170026268, de 20/04/2017, pág. 16/812/7LSF_q2 (i) = LSF_q1 (i).onde α é um parâmetro pré-determinado, em que N é a ordem do filtro LP, sendo que k é o comprimento de adaptação, em que LSF_q1 (i) é o vetor LSF quantizado do segundo sub-quadro e LSF_q2 (i) é o vetor LSF quantizado do quarto sub-quadro,
- 5 sendo que última_LSF_boa (i) (0) é igual ao valor da quantidade LSF_q2 (i-1) do quadro bom anterior, onde última_LSF_boa (i) (n) é um componente do vetor dos parâmetros LSF do quadro bom anterior n + 1ésimo, e em que meio_adaptativo_LSF (i) é a média dos vetores bons LSF anteriores.5. Método de acordo com a reivindicação 2, caracterizado pelo fato de que, 10 no caso de um quadro ruim carregando uma voz não estacionária, a etapa de proporcionar a substituição do quadro ruim é realizada usando, quando muito, uma parte pré-determinada da média dos parâmetros de um número pré-determinado dos quadros bons recebidos recentemente.
- 6. Método de acordo com a reivindicação 2, caracterizado pelo fato de que, 15 no caso de um quadro ruim carregando uma voz não-estacionária e no caso de um filtro de predição linear (LP) estar sendo usado, a etapa de proporcionar a substituição do quadro ruim é realizada de acordo com o algoritmo:Para i = 0 a N-1:meio_parcialmente_adaptativo_LSF (i)20 = β* meio_LSF(i) + (1-3)*meio_adaptativo_LSF (i);(2.3)LSF_q1 (i) = α*última_LSF_boa (i) (0) + (1-α)*meio_parcialmente_adaptativo_LSF (i);25 (2.2)LSF_q1 (i) = LSF_q2 (i);onde N é a ordem do filtro LP, em que α e β são, particularmente parâmetros predeterminados, em que LSF_q1 (i) é o vetor LSF quantizado do segundo sub-quadro e LSF_q2 (i) é o vetor LSF quantizado do quarto sub-quadro, em que o último_LSF_q (i)30 é o valor de LSF_q2 (i) do quadro bom anterior, em que meio_parcialmente_adaptativo_LSF (i) é uma combinação do vetor LSF no meioPetição 870170026268, de 20/04/2017, pág. 17/813Π adaptativo e o vetor LSF médio, em que o meio_adaptativo_LSF (i) é a média dos últimos vetores LSF bons K, e em que meio_LSF (i) é uma LSF média constante.
- 7. Método de acordo com a reivindicação 1, caracterizado pelo fato de que compreende ainda a etapa de determinar se o quadro ruim encontra um critério prédeterminado, e se sim, usar o quadro ruim ao invés de substituir o quadro ruim.
- 8. Método de acordo com a reivindicação 7, caracterizado pelo fato de que o critério pré-determinado envolve preparar uma ou mais de quatro comparações: uma comparação interquadro, uma comparação intraquadro, uma comparação de dois pontos, e uma comparação de ponto único.
- 9. Método para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada, os quadros sendo fornecidos pelo canal de comunicação para o decodificador, cada quadro fornecendo os parâmetros usados pelo decodificador na sintetização de voz, caracterizado pelo fato de que compreende as etapas de:a) determinar se o quadro é um quadro ruim; eb) proporcionar a substituição dos parâmetros do quadro ruim, a substituição na qual as últimas frequências de imitância espectral (ISF) são desviadas em direção a um meio parcialmente adaptativo fornecido por:ISFq (i) = a*última_ISFq (i) + (1 - a)*ISFmeio (i), para i = 0,16, em que:α = 0,9ISFq (i) é o componente iésimo do vetor ISF para o quadro atual, última_ISFq (i) é o componente iésimo do vetor ISF para o quadro anterior, ISFmeio (i) é o componente iésimo do vetor que é uma combinação do meio adaptativo e dos vetores ISF constantes do meio pré-determinado, e é calculado usando a fórmula:ISFmeio (i) = 3*ISFmeio_const (i) + (1-3)*ISFmeio_adaptativo (i), para i = 0,16 em que:em que:β = 0,75, ISFmeio_adaptativo (i) =Σ última_ISFq(i) e é adaptado sempre que i = 0Petição 870170026268, de 20/04/2017, pág. 18/814/7BFI = 0, em que BFI é um indicador de quadro ruim, e sendo que ISFmeio_const (i) é o componente iésimo do vetor formado da média a longo prazo dos vetores ISF.
- 10. Aparelho para encobrir os efeitos dos erros de quadro nos quadros a 5 serem decodificados pelo decodificador para proporcionar a voz sintetizada, os quadros sendo fornecidos por um canal de comunicação para o codificador, cada quadro fornecendo parâmetros usados pelo decodificador na sintetização da voz, caracterizado pelo fato de que compreende:a) um dispositivo para determinar se o quadro é um quadro ruim; e 10 b) um dispositivo para proporcionar uma substituição dos parâmetros espectrais do quadro ruim baseado somente nos parâmetros espectrais para os quadros bons recentemente e anteriormente recebidos e incluindo pelo menos uma média parcialmente adaptativa dos parâmetros espectrais de um número pré-determinado da maioria dos quadros bons recentemente e anteriormente recebidos.15
- 11. Aparelho de acordo com a reivindicação 10, caracterizado pelo fato de que compreende ainda um dispositivo para determinar se o quadro ruim carrega voz não-estacionária ou estacionária, e sendo que o dispositivo para proporcionar a substituição do quadro ruim realiza a substituição de uma maneira que depende se o quadro ruim carrega voz não-estacionária ou estacionária.20
- 12. Aparelho de acordo com a reivindicação 11, caracterizado pelo fato de que, no caso do quadro ruim carregando voz estacionária, o dispositivo para proporcionar a substituição do quadro ruim usa a média dos parâmetros de um número pré-determinado dos quadros bons recentemente recebidos.
- 13. Aparelho de acordo com a reivindicação 12, caracterizado pelo fato de25 que, no caso do quadro ruim carregando uma voz não-estacionária e no caso de um filtro de predição linear (LP) estar sendo usado, o dispositivo para proporcionar a substituição do quadro ruim é operativo de acordo com o algoritmo:Para i = 0 a N-1:meio_adaptativo_LSF_vetor (i)30 = (última_LSF_boa (i) (0) + última_LSF_boa (i) (1) + ... + última_LSF_boa (i) (k - 1))/k;LSF_q1(i)Petição 870170026268, de 20/04/2017, pág. 19/815>η = a*última_LSF_boa (i) (0) + (1-α)* meio_adaptativo_LSF (i);(2.1)LSF_q2 (i) = LSF_q1 (i), em que α é um parâmetro pré-determinado, em que N é a ordem do filtro LP, em que k é o comprimento de adaptação, sendo que LSF_q1 (i) é o vetor LSF quantizado do segundo sub-quadro e LSF_q2 (i) é o vetor LSF quantizado do quarto sub-quadro, em que última_LSF_boa (i) (0) é igual ao valor da quantidade LSF_q2 (i-1) do quadro bom anterior, em que última_LSF_boa (i) (n) é um componente do vetor dos parâmetros LSF do quadro n + 1ésimo bom anterior, e em que meio_adaptativo_LSF (i) é a média dos vetores bons LSF anteriores.
- 14. Aparelho de acordo com a reivindicação 11, caracterizado pelo fato de que, no caso do quadro ruim carregando uma voz não-estacionária, o dispositivo para proporcionar a substituição do quadro ruim usa, quando muito, uma parte prédeterminada da média dos parâmetros de um número pré-determinado dos quadros bons recebidos recentemente.
- 15. Aparelho de acordo com a reivindicação 11, caracterizado pelo fato de que, no caso do quadro ruim carregando uma voz não-estacionária e no caso de um filtro de predição linear (LP) estar sendo usado, o dispositivo para proporcionar a substituição do quadro ruim é operativo de acordo com o algoritmo:Para i = 0 a N-1:meio_parcialmente_adaptativo_LSF (i) = 3*meio_LSF(i) + (1-3)*meio_adaptativo_LSF (i);(2.3)LSF_q1 (i) = α*última_LSF_boa (i) (0) + (1-α)*meio_parcialmente_adaptativo_LSF (i);(2.2)LSF_q1 (i) = LSF_q2 (i);em que N é a ordem do filtro LP, em que α e β são, particularmente, parâmetros prédeterminados, em que LSF_q1 (i) é o vetor LSF quantizado do segundo sub-quadro e LSF_q2 (i) é o vetor LSF quantizado do quadro sub-quadro, em que o último_LSF_q (i) é o valor de LSF_q2 (i) do quadro bom anterior, em quePetição 870170026268, de 20/04/2017, pág. 20/816/7 meio_parcialmente_adaptativo_LSF (i) é uma combinação do vetor LSF no meio adaptativo e o vetor LSF meio, em que o meio_adaptativo_LSF (i) é a média dos últimos vetores LSF bons K, e em que meio_LSF (i) é uma LSF média constante.
- 16. Aparelho de acordo com a reivindicação 11, caracterizado pelo fato de 5 que compreende ainda um dispositivo para determinar se o quadro ruim encontra um critério pré-determinado, e se sim, usar o quadro ruim ao invés de substituir o quadro ruim.
- 17. Aparelho de acordo com a reivindicação 16, caracterizado pelo fato de que o critério pré-determinado envolve preparar uma ou mais de quatro comparações:10 uma comparação interquadro, uma comparação intraquadro, uma comparação de dois pontos, e uma comparação de ponto único.
- 18. Aparelho para encobrir os efeitos dos erros dos quadros nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada, os quadros sendo fornecidos pelo canal de comunicação para o decodificador, cada quadro15 fornecendo os parâmetros usados pelo decodificador na sintetização de voz, caracterizado pelo fato de que compreende:a) dispositivo para determinar se o quadro é um quadro ruim; eb) dispositivo para proporcionar a substituição dos parâmetros do quadro ruim, a substituição na qual as últimas frequências de imitância espectral (ISF) são
- 20 desviadas em direção a um meio parcialmente adaptativo fornecido por:ISFq (i) = a*última_ISFq (i) + (1 - a)*ISFmeio (i), para i = 0,16, em que:α = 0,9ISFq (i) é o componente iésimo do vetor ISF para o quadro atual, última_ISFq (i) é o componente iésimo do vetor ISF para o quadro anterior, ISFmeio (i) é o componente iésimo do vetor que é uma combinação do meio adaptativo e dos vetores ISF constantes do meio pré-determinado, e é calculado usando a fórmula:ISFmeio (i) = 3*ISFmeio_const (i) + (1-3)*ISFmeio_adaptativo (i), para i = 0,16, em que β = 0,75, em que ISFmeio_adaptativo (i) =Σ última_ISFq(i) e é adaptado i = 0Petição 870170026268, de 20/04/2017, pág. 21/817/7 sempre que BFI = 0, onde BFI é um indicador de quadro ruim, e sendo que ISFmeio_const (i) é o componente 1ésimo de um vetor formado da média a longo prazo dos vetores ISF.Petição 870170026268, de 20/04/2017, pág. 22/812»1/6
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US24249800P | 2000-10-23 | 2000-10-23 | |
| PCT/IB2001/001950 WO2002035520A2 (en) | 2000-10-23 | 2001-10-17 | Improved spectral parameter substitution for the frame error concealment in a speech decoder |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| BRPI0114827B1 true BRPI0114827B1 (pt) | 2018-09-11 |
Family
ID=22915004
Family Applications (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| BR0114827-3A BR0114827A (pt) | 2000-10-23 | 2001-10-17 | Método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada |
| BRPI0114827A BRPI0114827B1 (pt) | 2000-10-23 | 2001-10-17 | método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada |
Family Applications Before (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| BR0114827-3A BR0114827A (pt) | 2000-10-23 | 2001-10-17 | Método e aparelho para encobrir os efeitos dos erros de quadro nos quadros a serem decodificados pelo decodificador para proporcionar voz sintetizada |
Country Status (14)
| Country | Link |
|---|---|
| US (2) | US7031926B2 (pt) |
| EP (1) | EP1332493B1 (pt) |
| JP (2) | JP2004522178A (pt) |
| KR (1) | KR100581413B1 (pt) |
| CN (1) | CN1291374C (pt) |
| AT (1) | ATE348385T1 (pt) |
| AU (1) | AU1079902A (pt) |
| BR (2) | BR0114827A (pt) |
| CA (1) | CA2425034A1 (pt) |
| DE (1) | DE60125219T2 (pt) |
| ES (1) | ES2276839T3 (pt) |
| PT (1) | PT1332493E (pt) |
| WO (1) | WO2002035520A2 (pt) |
| ZA (1) | ZA200302778B (pt) |
Families Citing this family (76)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6810377B1 (en) * | 1998-06-19 | 2004-10-26 | Comsat Corporation | Lost frame recovery techniques for parametric, LPC-based speech coding systems |
| US6609118B1 (en) * | 1999-06-21 | 2003-08-19 | General Electric Company | Methods and systems for automated property valuation |
| US6968309B1 (en) * | 2000-10-31 | 2005-11-22 | Nokia Mobile Phones Ltd. | Method and system for speech frame error concealment in speech decoding |
| CA2388439A1 (en) * | 2002-05-31 | 2003-11-30 | Voiceage Corporation | A method and device for efficient frame erasure concealment in linear predictive based speech codecs |
| JP2004151123A (ja) * | 2002-10-23 | 2004-05-27 | Nec Corp | 符号変換方法、符号変換装置、プログラム及びその記憶媒体 |
| US20040143675A1 (en) * | 2003-01-16 | 2004-07-22 | Aust Andreas Matthias | Resynchronizing drifted data streams with a minimum of noticeable artifacts |
| US7835916B2 (en) * | 2003-12-19 | 2010-11-16 | Telefonaktiebolaget Lm Ericsson (Publ) | Channel signal concealment in multi-channel audio systems |
| FI119533B (fi) * | 2004-04-15 | 2008-12-15 | Nokia Corp | Audiosignaalien koodaus |
| CN1950883A (zh) * | 2004-04-30 | 2007-04-18 | 松下电器产业株式会社 | 可伸缩性解码装置及增强层丢失的隐藏方法 |
| ATE352138T1 (de) * | 2004-05-28 | 2007-02-15 | Cit Alcatel | Anpassungsverfahren für ein mehrraten-sprach- codec |
| US7971121B1 (en) * | 2004-06-18 | 2011-06-28 | Verizon Laboratories Inc. | Systems and methods for providing distributed packet loss concealment in packet switching communications networks |
| US7895035B2 (en) | 2004-09-06 | 2011-02-22 | Panasonic Corporation | Scalable decoding apparatus and method for concealing lost spectral parameters |
| US7409338B1 (en) * | 2004-11-10 | 2008-08-05 | Mediatek Incorporation | Softbit speech decoder and related method for performing speech loss concealment |
| US7596143B2 (en) * | 2004-12-16 | 2009-09-29 | Alcatel-Lucent Usa Inc. | Method and apparatus for handling potentially corrupt frames |
| EP1846920B1 (en) * | 2005-01-31 | 2017-04-19 | Skype | Method for generating concealment frames in communication system |
| KR100612889B1 (ko) * | 2005-02-05 | 2006-08-14 | 삼성전자주식회사 | 선스펙트럼 쌍 파라미터 복원 방법 및 장치와 그 음성복호화 장치 |
| GB0512397D0 (en) * | 2005-06-17 | 2005-07-27 | Univ Cambridge Tech | Restoring corrupted audio signals |
| KR100723409B1 (ko) * | 2005-07-27 | 2007-05-30 | 삼성전자주식회사 | 프레임 소거 은닉장치 및 방법, 및 이를 이용한 음성복호화 방법 및 장치 |
| EP1933304A4 (en) * | 2005-10-14 | 2011-03-16 | Panasonic Corp | SCALABLE CODING ARRANGEMENT, SCALABLE DECODING ARRANGEMENT AND METHOD THEREFOR |
| US8438018B2 (en) * | 2006-02-06 | 2013-05-07 | Telefonaktiebolaget Lm Ericsson (Publ) | Method and arrangement for speech coding in wireless communication systems |
| US7457746B2 (en) | 2006-03-20 | 2008-11-25 | Mindspeed Technologies, Inc. | Pitch prediction for packet loss concealment |
| US8280728B2 (en) * | 2006-08-11 | 2012-10-02 | Broadcom Corporation | Packet loss concealment for a sub-band predictive coder based on extrapolation of excitation waveform |
| KR101040160B1 (ko) * | 2006-08-15 | 2011-06-09 | 브로드콤 코포레이션 | 패킷 손실 후의 제한되고 제어된 디코딩 |
| RU2431892C2 (ru) * | 2006-11-10 | 2011-10-20 | Панасоник Корпорэйшн | Устройство декодирования параметров, устройство кодирования параметров и способ декодирования параметров |
| CN101583995B (zh) | 2006-11-10 | 2012-06-27 | 松下电器产业株式会社 | 参数解码装置、参数编码装置以及参数解码方法 |
| KR101292771B1 (ko) * | 2006-11-24 | 2013-08-16 | 삼성전자주식회사 | 오디오 신호의 오류은폐방법 및 장치 |
| KR100862662B1 (ko) * | 2006-11-28 | 2008-10-10 | 삼성전자주식회사 | 프레임 오류 은닉 방법 및 장치, 이를 이용한 오디오 신호복호화 방법 및 장치 |
| KR101291193B1 (ko) | 2006-11-30 | 2013-07-31 | 삼성전자주식회사 | 프레임 오류은닉방법 |
| CN100578618C (zh) * | 2006-12-04 | 2010-01-06 | 华为技术有限公司 | 一种解码方法及装置 |
| CN101226744B (zh) | 2007-01-19 | 2011-04-13 | 华为技术有限公司 | 语音解码器中实现语音解码的方法及装置 |
| KR20080075050A (ko) * | 2007-02-10 | 2008-08-14 | 삼성전자주식회사 | 오류 프레임의 파라미터 갱신 방법 및 장치 |
| BRPI0808200A8 (pt) * | 2007-03-02 | 2017-09-12 | Panasonic Corp | Dispositivo de codificação de áudio e dispositivo de decodificação de áudio |
| US8165224B2 (en) * | 2007-03-22 | 2012-04-24 | Research In Motion Limited | Device and method for improved lost frame concealment |
| DE602007001576D1 (de) * | 2007-03-22 | 2009-08-27 | Research In Motion Ltd | Vorrichtung und Verfahren zur verbesserten Maskierung von Rahmenverlusten |
| US8428953B2 (en) * | 2007-05-24 | 2013-04-23 | Panasonic Corporation | Audio decoding device, audio decoding method, program, and integrated circuit |
| EP2189976B1 (en) * | 2008-11-21 | 2012-10-24 | Nuance Communications, Inc. | Method for adapting a codebook for speech recognition |
| US8751229B2 (en) * | 2008-11-21 | 2014-06-10 | At&T Intellectual Property I, L.P. | System and method for handling missing speech data |
| CA2989886C (en) | 2008-12-15 | 2020-05-05 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio encoder and bandwidth extension decoder |
| CN101615395B (zh) * | 2008-12-31 | 2011-01-12 | 华为技术有限公司 | 信号编码、解码方法及装置、系统 |
| JP2010164859A (ja) * | 2009-01-16 | 2010-07-29 | Sony Corp | オーディオ再生装置、情報再生システム、オーディオ再生方法、およびプログラム |
| US20100185441A1 (en) * | 2009-01-21 | 2010-07-22 | Cambridge Silicon Radio Limited | Error Concealment |
| US8676573B2 (en) * | 2009-03-30 | 2014-03-18 | Cambridge Silicon Radio Limited | Error concealment |
| US8316267B2 (en) * | 2009-05-01 | 2012-11-20 | Cambridge Silicon Radio Limited | Error concealment |
| CN101894565B (zh) * | 2009-05-19 | 2013-03-20 | 华为技术有限公司 | 语音信号修复方法和装置 |
| US8908882B2 (en) * | 2009-06-29 | 2014-12-09 | Audience, Inc. | Reparation of corrupted audio signals |
| CN102648493B (zh) | 2009-11-24 | 2016-01-20 | Lg电子株式会社 | 音频信号处理方法和设备 |
| JP5724338B2 (ja) * | 2010-12-03 | 2015-05-27 | ソニー株式会社 | 符号化装置および符号化方法、復号装置および復号方法、並びにプログラム |
| JP6178305B2 (ja) | 2011-04-21 | 2017-08-09 | サムスン エレクトロニクス カンパニー リミテッド | 量子化方法 |
| RU2669139C1 (ru) * | 2011-04-21 | 2018-10-08 | Самсунг Электроникс Ко., Лтд. | Устройство для квантования коэффициентов кодирования с линейным предсказанием, устройство кодирования звука, устройство для деквантования коэффициентов кодирования с линейным предсказанием, устройство декодирования звука, и электронное устройство для этого |
| JP6024191B2 (ja) * | 2011-05-30 | 2016-11-09 | ヤマハ株式会社 | 音声合成装置および音声合成方法 |
| JP5973582B2 (ja) | 2011-10-21 | 2016-08-23 | サムスン エレクトロニクス カンパニー リミテッド | フレームエラー隠匿方法及びその装置、並びにオーディオ復号化方法及びその装置 |
| KR20130113742A (ko) * | 2012-04-06 | 2013-10-16 | 현대모비스 주식회사 | 오디오 데이터 디코딩 방법 및 장치 |
| CN103714821A (zh) | 2012-09-28 | 2014-04-09 | 杜比实验室特许公司 | 基于位置的混合域数据包丢失隐藏 |
| CN103117062B (zh) * | 2013-01-22 | 2014-09-17 | 武汉大学 | 语音解码器中帧差错隐藏的谱参数代替方法及系统 |
| ES2816014T3 (es) | 2013-02-13 | 2021-03-31 | Ericsson Telefon Ab L M | Ocultación de error de trama |
| CN105074819B (zh) | 2013-02-20 | 2019-06-04 | 弗劳恩霍夫应用研究促进协会 | 使用多重叠部分来生成经编码的信号或对经编码的音频信号进行解码的设备及方法 |
| US9842598B2 (en) * | 2013-02-21 | 2017-12-12 | Qualcomm Incorporated | Systems and methods for mitigating potential frame instability |
| CA2915805C (en) | 2013-06-21 | 2021-10-19 | Jeremie Lecomte | Apparatus and method for improved concealment of the adaptive codebook in acelp-like concealment employing improved pitch lag estimation |
| EP3011561B1 (en) | 2013-06-21 | 2017-05-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for improved signal fade out in different domains during error concealment |
| KR102132326B1 (ko) * | 2013-07-30 | 2020-07-09 | 삼성전자 주식회사 | 통신 시스템에서 오류 은닉 방법 및 장치 |
| CN103456307B (zh) * | 2013-09-18 | 2015-10-21 | 武汉大学 | 音频解码器中帧差错隐藏的谱代替方法及系统 |
| JP5981408B2 (ja) | 2013-10-29 | 2016-08-31 | 株式会社Nttドコモ | 音声信号処理装置、音声信号処理方法、及び音声信号処理プログラム |
| CN104751849B (zh) | 2013-12-31 | 2017-04-19 | 华为技术有限公司 | 语音频码流的解码方法及装置 |
| EP2980797A1 (en) | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio decoder, method and computer program using a zero-input-response to obtain a smooth transition |
| EP2922056A1 (en) | 2014-03-19 | 2015-09-23 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method and corresponding computer program for generating an error concealment signal using power compensation |
| EP2922054A1 (en) | 2014-03-19 | 2015-09-23 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method and corresponding computer program for generating an error concealment signal using an adaptive noise estimation |
| EP2922055A1 (en) | 2014-03-19 | 2015-09-23 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method and corresponding computer program for generating an error concealment signal using individual replacement LPC representations for individual codebook information |
| CN107369453B (zh) | 2014-03-21 | 2021-04-20 | 华为技术有限公司 | 语音频码流的解码方法及装置 |
| CN105874534B (zh) | 2014-03-31 | 2020-06-19 | 弗朗霍弗应用研究促进协会 | 编码装置、解码装置、编码方法、解码方法及程序 |
| EP2980793A1 (en) | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Encoder, decoder, system and methods for encoding and decoding |
| TWI602172B (zh) | 2014-08-27 | 2017-10-11 | 弗勞恩霍夫爾協會 | 使用參數以加強隱蔽之用於編碼及解碼音訊內容的編碼器、解碼器及方法 |
| CN108011686B (zh) * | 2016-10-31 | 2020-07-14 | 腾讯科技(深圳)有限公司 | 信息编码帧丢失恢复方法和装置 |
| US10784988B2 (en) | 2018-12-21 | 2020-09-22 | Microsoft Technology Licensing, Llc | Conditional forward error correction for network data |
| US10803876B2 (en) * | 2018-12-21 | 2020-10-13 | Microsoft Technology Licensing, Llc | Combined forward and backward extrapolation of lost network data |
| CN111554308B (zh) * | 2020-05-15 | 2024-10-15 | 腾讯科技(深圳)有限公司 | 一种语音处理方法、装置、设备及存储介质 |
| US12394405B2 (en) * | 2023-03-24 | 2025-08-19 | Verizon Patent And Licensing Inc. | Systems and methods for reconstructing video data using contextually-aware multi-modal generation during signal loss |
Family Cites Families (18)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5406532A (en) * | 1988-03-04 | 1995-04-11 | Asahi Kogaku Kogyo Kabushiki Kaisha | Optical system for a magneto-optical recording/reproducing apparatus |
| JP3104400B2 (ja) * | 1992-04-27 | 2000-10-30 | ソニー株式会社 | オーディオ信号符号化装置及び方法 |
| JP3085606B2 (ja) * | 1992-07-16 | 2000-09-11 | ヤマハ株式会社 | ディジタルデータの誤り補正方法 |
| JP2746033B2 (ja) * | 1992-12-24 | 1998-04-28 | 日本電気株式会社 | 音声復号化装置 |
| JP3123286B2 (ja) * | 1993-02-18 | 2001-01-09 | ソニー株式会社 | ディジタル信号処理装置又は方法、及び記録媒体 |
| SE501340C2 (sv) * | 1993-06-11 | 1995-01-23 | Ericsson Telefon Ab L M | Döljande av transmissionsfel i en talavkodare |
| JP3404837B2 (ja) * | 1993-12-07 | 2003-05-12 | ソニー株式会社 | 多層符号化装置 |
| US5502713A (en) | 1993-12-07 | 1996-03-26 | Telefonaktiebolaget Lm Ericsson | Soft error concealment in a TDMA radio system |
| CA2142391C (en) | 1994-03-14 | 2001-05-29 | Juin-Hwey Chen | Computational complexity reduction during frame erasure or packet loss |
| JP3713288B2 (ja) | 1994-04-01 | 2005-11-09 | 株式会社東芝 | 音声復号装置 |
| JP3416331B2 (ja) | 1995-04-28 | 2003-06-16 | 松下電器産業株式会社 | 音声復号化装置 |
| SE506341C2 (sv) | 1996-04-10 | 1997-12-08 | Ericsson Telefon Ab L M | Metod och anordning för rekonstruktion av en mottagen talsignal |
| JP3583550B2 (ja) | 1996-07-01 | 2004-11-04 | 松下電器産業株式会社 | 補間装置 |
| JP4346689B2 (ja) * | 1997-04-07 | 2009-10-21 | コーニンクレッカ、フィリップス、エレクトロニクス、エヌ、ヴィ | 音声送信システム |
| US6810377B1 (en) | 1998-06-19 | 2004-10-26 | Comsat Corporation | Lost frame recovery techniques for parametric, LPC-based speech coding systems |
| US6373842B1 (en) * | 1998-11-19 | 2002-04-16 | Nortel Networks Limited | Unidirectional streaming services in wireless systems |
| US6377915B1 (en) * | 1999-03-17 | 2002-04-23 | Yrp Advanced Mobile Communication Systems Research Laboratories Co., Ltd. | Speech decoding using mix ratio table |
| WO2000060576A1 (en) | 1999-04-05 | 2000-10-12 | Hughes Electronics Corporation | Spectral phase modeling of the prototype waveform components for a frequency domain interpolative speech codec system |
-
2001
- 2001-07-30 US US09/918,300 patent/US7031926B2/en not_active Expired - Lifetime
- 2001-10-17 JP JP2002538420A patent/JP2004522178A/ja active Pending
- 2001-10-17 EP EP01978706A patent/EP1332493B1/en not_active Revoked
- 2001-10-17 CA CA002425034A patent/CA2425034A1/en not_active Abandoned
- 2001-10-17 CN CNB018209378A patent/CN1291374C/zh not_active Expired - Lifetime
- 2001-10-17 WO PCT/IB2001/001950 patent/WO2002035520A2/en not_active Ceased
- 2001-10-17 BR BR0114827-3A patent/BR0114827A/pt active IP Right Grant
- 2001-10-17 AU AU1079902A patent/AU1079902A/xx active Pending
- 2001-10-17 PT PT01978706T patent/PT1332493E/pt unknown
- 2001-10-17 AT AT01978706T patent/ATE348385T1/de not_active IP Right Cessation
- 2001-10-17 DE DE60125219T patent/DE60125219T2/de not_active Revoked
- 2001-10-17 BR BRPI0114827A patent/BRPI0114827B1/pt unknown
- 2001-10-17 KR KR1020037005602A patent/KR100581413B1/ko not_active Expired - Lifetime
- 2001-10-17 ES ES01978706T patent/ES2276839T3/es not_active Expired - Lifetime
-
2003
- 2003-04-09 ZA ZA200302778A patent/ZA200302778B/en unknown
-
2006
- 2006-04-10 US US11/402,220 patent/US7529673B2/en not_active Expired - Lifetime
- 2006-10-04 JP JP2006273448A patent/JP2007065679A/ja active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| BR0114827A (pt) | 2004-06-15 |
| CA2425034A1 (en) | 2002-05-02 |
| US7529673B2 (en) | 2009-05-05 |
| WO2002035520A2 (en) | 2002-05-02 |
| EP1332493B1 (en) | 2006-12-13 |
| EP1332493A2 (en) | 2003-08-06 |
| CN1535461A (zh) | 2004-10-06 |
| DE60125219D1 (de) | 2007-01-25 |
| JP2007065679A (ja) | 2007-03-15 |
| DE60125219T2 (de) | 2007-03-29 |
| WO2002035520A3 (en) | 2002-07-04 |
| PT1332493E (pt) | 2007-02-28 |
| AU1079902A (en) | 2002-05-06 |
| KR100581413B1 (ko) | 2006-05-23 |
| US20020091523A1 (en) | 2002-07-11 |
| JP2004522178A (ja) | 2004-07-22 |
| US20070239462A1 (en) | 2007-10-11 |
| AU2002210799B2 (en) | 2005-06-23 |
| ATE348385T1 (de) | 2007-01-15 |
| CN1291374C (zh) | 2006-12-20 |
| ZA200302778B (en) | 2004-02-27 |
| KR20030048067A (ko) | 2003-06-18 |
| ES2276839T3 (es) | 2007-07-01 |
| US7031926B2 (en) | 2006-04-18 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR100581413B1 (ko) | 음성 복호기에서 프레임 오류 은폐를 위한 개선된스펙트럼 매개변수 대체 | |
| US8825477B2 (en) | Systems, methods, and apparatus for frame erasure recovery | |
| US9053702B2 (en) | Systems, methods, apparatus, and computer-readable media for bit allocation for redundant transmission | |
| TWI436349B (zh) | 用於重建一被抹除語音訊框之系統與方法 | |
| US7711563B2 (en) | Method and system for frame erasure concealment for predictive speech coding based on extrapolation of speech waveform | |
| PT1330818E (pt) | Metodo e sistema para dissimulação de erro de trama de voz na descodificação de voz | |
| EP1291851A2 (en) | Method and System for a waveform attenuation technique of error corrupted speech frames | |
| EP1288915B1 (en) | Method and system for waveform attenuation of error corrupted speech frames | |
| AU2002210799B8 (en) | Improved spectral parameter substitution for the frame error concealment in a speech decoder | |
| US20040138878A1 (en) | Method for estimating a codec parameter | |
| Mertz et al. | Voicing controlled frame loss concealment for adaptive multi-rate (AMR) speech frames in voice-over-IP. | |
| AU2002210799A1 (en) | Improved spectral parameter substitution for the frame error concealment in a speech decoder |






















