BRPI0919880B1 - Método e aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital e transcodificador - Google Patents

Método e aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital e transcodificador Download PDF

Info

Publication number
BRPI0919880B1
BRPI0919880B1 BRPI0919880-6A BRPI0919880A BRPI0919880B1 BR PI0919880 B1 BRPI0919880 B1 BR PI0919880B1 BR PI0919880 A BRPI0919880 A BR PI0919880A BR PI0919880 B1 BRPI0919880 B1 BR PI0919880B1
Authority
BR
Brazil
Prior art keywords
audio
signal
gain
gain values
values
Prior art date
Application number
BRPI0919880-6A
Other languages
English (en)
Inventor
Wolfgang A. Schildbach
Alexander Groeschel
Original Assignee
Dolby International Ab
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Dolby International Ab filed Critical Dolby International Ab
Publication of BRPI0919880A2 publication Critical patent/BRPI0919880A2/pt
Publication of BRPI0919880B1 publication Critical patent/BRPI0919880B1/pt

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16—Vocoder architecture
    • G10L19/173—Transcoding, i.e. converting between two coded representations avoiding cascaded coding-decoding
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/008—Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Signal Processing (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Mathematical Physics (AREA)
  • Stereophonic System (AREA)
  • Signal Processing For Digital Recording And Reproducing (AREA)
  • Control Of Amplification And Gain Control (AREA)
  • Tone Control, Compression And Expansion, Limiting Amplitude (AREA)

Abstract

método e aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital e transcodificador a presente invenção refere-se a um método e a um aparelho para impedir o ceifamento de um sinal de áudio quando a proteção contra o ceifamento de sinal por metadados de áudio recebidos não é garantida. o método pode ser utilizado para impedir o ceifamento para o caso de realizar downmix de um sinal de múltiplos canais para um sinal de áudio estéreo. de acordo com o método, é determinado se os primeiros valores de ganho (4) com base em metadados de áudio recebidos são suficientes para a proteção contra o ceifamento do sinal de áudio. os metadados de áudio estão embutidos em um primeiro fluxo de áudio (1). no caso de um primeiro valor de ganho (4) não ser suficiente para a proteção, o respectivo primeiro valor de ganho (4) é substituído por um valor de ganho suficiente para a proteção contra o ceifamento do sinal de áudio. de preferência, no caso em que nenhum metadado relativo ao controle de faixa dinâmica estiver presente no primeiro fluxo de áudio (1), o método pode adicionar valores de ganho suficientes para a proteção contra o ceifamento de sinal.

Description

Relatório Descritivo da Patente de Invenção para MÉTODO E APARELHO PARA PROVER PROTEÇÃO CONTRA O CEIFAMENTO DE SINAL DE UM SINAL DE ÁUDIO DERIVADO DE DADOS DE ÁUDIO DIGITAL E TRANSCODIFICADOR. REFERÊNCIA CRUZADA A PEDIDOS RELATIVOS [0001] Este pedido reivindica prioridade do Pedido de Patente
Provisório dos Estados Unidos Número 61/109.433, depositado em 29 de Outubro de 2008, por meio disto incorporado por referência em sua totalidade.
CAMPO DA INVENÇÃO [0002] O pedido de patente refere-se à proteção de ceifamento de um sinal de áudio que utiliza metadados de áudio preexistentes embutidos em um fluxo de áudio digital. Especificamente, o pedido refere-se à proteção de ceifamento (clipping) quando executar downmix em um sinal de áudio de múltiplos canais para menos canais.
ANTECEDENTES DA INVENÇÃO [0003] É um conceito comum embutir os metadados de áudio em um fluxo de áudio digital, por exemplo, em ambientes de transmissão digital. Tais metadados são dados sobre dados, isto é, dados sobre o áudio digital no fluxo. Os metadados podem prover as informações para um decodificador de áudio sobre como reproduzir o áudio. Um tipo de metadados são as informações de controle de faixa dinâmica as quais representam um envelope de ganho variável no tempo. Tais metadados de controle de faixa dinâmica podem servir a múltiplos propósitos:
(1) Controlar a faixa dinâmica de áudio reproduzido: a transmissão digital permite uma alta faixa dinâmica, mas as condições de audição nem sempre permitem aproveitar-se disto. Apesar de uma alta faixa dinâmica ser desejável em condições de sala de estar silenciosa, esta pode não ser apropriada para outras condições, por exem
Petição 870190114541, de 08/11/2019, pág. 14/50
2/37 plo, para um rádio de carro devido ao alto nível de ruído de fundo. Para acomodar uma ampla variedade de condições de audição, metadados que instruem um receptor como reduzir a faixa dinâmica do áudio reproduzido podem ser inseridos no fluxo de áudio digital ao invés de reduzir a faixa dinâmica do áudio antes da transmissão. A última proposta não é preferível já que esta torna impossível um receptor reproduzir o áudio com uma faixa dinâmica total. Ao contrário, a primeira proposta é preferida já que esta permite o ouvinte decidir se o controle de faixa dinâmica deverá ser aplicado ou não dependendo do ambiente de audição. Tais metadados de controle de faixa dinâmica tornam uma compressão de faixa dinâmica artística de alta qualidade de um sinal decodificado disponível para os ouvintes à sua vontade.
(2) Impedir o ceifamento em caso de uma operação de downmix: Quando um sinal de múltiplos canais (por exemplo, um sinal de áudio de canal 5.1) sofre downmix, o número de canais é reduzido, tipicamente para dois canais. No caso de reproduzir um sinal de áudio de múltiplos canais que compreende mais de dois canais (por exemplo, um sinal de áudio de canal 5.1 que tem 5 canais principais e 1 canal de efeito de baixa frequência) através de alto-falantes estéreos, tipicamente uma operação de downmix de lado de receptor é executada, onde o sinal de múltiplos canais é misturado em dois canais. A operação de mistura pode ser descrita por uma matriz de downmix, por exemplo, uma matriz 2.5 que tem duas linhas e 5 colunas no caso de executar o downmixing em um sinal de 5 canais para um sinal de 2 canais (estéreo) (o canal de efeito de baixa frequência é tipicamente não considerado durante o downmixing).
[0004] Diferentes esquemas de downmix para misturar os 5 canais principais de um sinal de canal 5.1 em dois canais são conhecidos, por exemplo, Lo/Ro (esquerdo somente, direito somente) ou Lt/Rt (esquerdo total, direito total).
Petição 870190114541, de 08/11/2019, pág. 15/50
3/37
A etapa de downmix suporta o risco de sobrecarga ocasional do sinal estéreo digital, por meio disto gerando artefatos de ceifamento indesejados. Tal ceifamento pode ocorrer quando a amplitude de um sinal digital que sofreu downmix que excederia o valor máximo (ou mínimo) representável está limitada ao valor máximo (ou mínimo) representável. Por exemplo, no caso de uma simples representação binária de ponto fixo não sinalizado, o ceifamento ocorre quando a amplitude que sofreu dowminx computada está limitada à palavra de valor máximo onde todos os bits correspondem a 1. No caso de uma representação sinalizada em 16 bits, o valor máximo pode, por exemplo, corresponder à palavra 01111111 11111111.
[0005] Como todas as matrizes de downmix para os vários esquemas de downmixing são conhecidas na cabeça de rede, o lado de remetente ou de geração de conteúdo, para os sinais que podem resultar em ceifamento quando sofrem downmix, os metadados de controle de faixa dinâmica que instruem um receptor para atenuar os sinais a que deverão sofrer downmix antes da mistura podem ser adicionados ao fluxo de áudio para impedir dinamicamente o ceifamento.
(3) Impedir o ceifamento em caso de saída intensificada: para uma retransmissão sobre canais dinamicamente muito limitados (por exemplo, de um codificador de frequência através de uma conexão de RF analógica para a entrada de RF de uma TV), o sinal é intensificado, tipicamente por 11 dB, para conseguir uma melhor razão de sinal para ruído neste percurso. Em tais aplicações, para os sinais que podem resultar em ceifamento quando amplificados por 11 dB, os metadados de controle de faixa dinâmica que instruem um receptor para atenuar os sinais antes de aplicar a amplificação de 11 dB podem ser adicionados ao fluxo de áudio para impedir dinamicamente o ceifamento.
[0006] Da perspectiva do dispositivo que recebe o fluxo de áudio,
Petição 870190114541, de 08/11/2019, pág. 16/50
4/37 não está claro se os metadados de controle de faixa dinâmica que entram servem ao propósito sob o ponto (1), isto é, o controle da faixa dinâmica, ao propósito sob o ponto (2), isto é, a proteção de ceifamento de downmix, ou ao propósito sob ambos os pontos (1) e (2). Frequentemente, os metadados executam ambas as tarefas, mais este não é sempre o caso, de modo que em alguns casos os metadados podem não incluir a proteção de ceifamento de downmix. Além disso, no caso dos metadados (tipicamente, um parâmetro de ganho diferente é utilizado para o modo de RF) serem associados ao modo de RF sob o ponto (3), os metadados podem ser utilizados para impedir o ceifamento no caso de uma amplificação extra (tanto no caso de downmixing quanto no caso de não downmixing).
[0007] Mais ainda, o fluxo de áudio que entra pode não incluir nenhum metadado de controle de faixa dinâmica, devido ao fato de que, para alguns formatos de codificação de áudio, os metadados são opcionais.
[0008] Se os metadados de controle de faixa dinâmica não estiverem incluídos com o fluxo de áudio comprimido ou estiverem incluídos, mas não incluírem uma proteção de ceifamento de downmix, os artefatos de ceifamento indesejáveis podem estar presentes no sinal decodificado se um sinal de múltiplos canais sofrer downmix para menos canais.
[0009] O WO 2008/1000098 descreve um método e aparelho de codificação / decodificação de áudio para processar os sinais de áudio baseados em objeto.
SUMÁRIO DA INVENÇÃO [00010] A presente invenção refere-se a um método e a um aparelho para impedir o ceifamento de um sinal de áudio quando a proteção de ceifamento por metadados de áudio não é garantida.
[00011] Um primeiro aspecto do pedido refere-se a um método para
Petição 870190114541, de 08/11/2019, pág. 17/50
5/37 prover proteção contra o ceifamento de sinal de um sinal de áudio, por exemplo, um sinal de áudio digital que sofreu downmix, o qual é derivado de dados de áudio digital. De acordo com o método, é determinado se os primeiros valores de ganho com base em metadados de áudio recebidos são suficientes para proteção contra o ceifamento do sinal de áudio. Os metadados de áudio estão embutidos em um primeiro fluxo de áudio. Por exemplo, é determinado se os metadados de envelope de ganho variável no tempo incluídos com um fluxo de áudio comprimido são ou não suficientes para impedir o ceifamento de downmix. No caso de um primeiro valor de ganho não ser suficiente para a proteção, o respectivo primeiro valor de ganho é substituído por um valor de ganho suficiente para a proteção contra o ceifamento do sinal de áudio. De preferência, no caso em que nenhum metadado relativo ao controle de faixa dinâmica está presente no primeiro fluxo de áudio, o método pode adicionar valores de ganho suficientes para a proteção contra o ceifamento de sinal. Por exemplo, no caso onde os metadados de envelope de ganho variável no tempo não proveem uma proteção de ceifamento de downmix suficiente, ou não estão presentes de nenhum modo os metadados de envelope de ganho variável no tempo são modificados ou adicionados, de modo que estes provenham uma proteção de ceifamento de downmix suficiente.
[00012] O método permite a proteção de ceifamento, especificamente a proteção de ceifamento no caso de downmix, independentemente se valores de ganho suficientes para a proteção de ceifamento são recebidos ou não.
[00013] De acordo com o método, as palavras de ganho de áudio recebidas (se providas) podem ser aplicadas tão verdadeiramente quanto possível, mas podem ser ignoradas quando as palavras de ganho que entram não proveem uma atenuação suficiente para impedir o ceifamento, por exemplo, em um downmixing.
Petição 870190114541, de 08/11/2019, pág. 18/50
6/37 [00014] Como os dados de controle de faixa dinâmica que servem ao propósito sob o ponto (1) suportam aspectos artísticos, tipicamente não é o dever do dispositivo de recepção (por exemplo, um conversor de frequência) introduzir estes no caso em que os metadados que entram não os provenham. As propriedades quanto de (2), no entanto, podem e, portanto, devem ser providas pela instância de recepção. Isto significa que o dispositivo de recepção deverá tentar preservar os dados de controle de faixa dinâmica destinados para o controle de faixa dinâmica sob o ponto (1) tanto quanto possível, enquanto ao mesmo tempo adicionando uma proteção de ceifamento.
[00015] Existem vários modos para determinar se os primeiros valores de ganho baseados em metadados de áudio recebidos são suficientes para proteção contra o ceifamento de sinal.
[00016] De acordo com uma proposta preferida, os segundos valores de ganho são computados com base nos dados de áudio digital, onde os segundos valores de ganho são suficientes para a proteção de ceifamento do sinal de áudio. Os segundos valores de ganho podem ser os valores de ganho permissíveis máximos os quais não resultam em corte.
[00017] De preferência, o método determina se os primeiros valores de ganho são suficientes de tal modo que este compara os primeiros valores de ganho com base nos metadados de áudio recebidos e os segundos valores de ganho computados. O método pode comparar um primeiro valor associado a um segmento dos dados de áudio com o respectivo segundo valor de ganho associado ao mesmo segmento de dados de áudio.
[00018] Em dependência disto, um fluxo compatível de proteção de ceifamento de valores de ganho pode ser gerado dos primeiros e dos segundos valores de ganho. De preferência, tais valores de ganho são selecionados dos primeiros valores de ganho e dos segundos valores
Petição 870190114541, de 08/11/2019, pág. 19/50
7/37 de ganho computados em dependência das operações de comparação. Pela seleção de um segundo valor de ganho computado ao invés do primeiro valor de ganho, o primeiro valor de ganho é substituído pelo segundo valor de ganho computado.
[00019] De preferência, o mínimo de um par de primeiro e segundo valores de ganho é selecionado. Se o primeiro valor de ganho for maior do que o segundo valor de ganho computado suficiente para a proteção, isto indica que existe um risco que o primeiro valor de ganho não é suficiente para a proteção de ceifamento e assim deve ser substituído pelo respectivo segundo valor de ganho. De outro modo, se o primeiro valor de ganho for menor do que o segundo valor de ganho computado suficiente para a proteção, isto indica que não existe um risco de ceifamento de sinal e o primeiro valor de ganho deve ser preservado.
[00020] A seleção de valores de ganho dos primeiros e segundos valores de ganho pode ser executada como abaixo explicada:
[00021] No caso em que tanto o primeiro valor de ganho quanto o segundo valor de ganho proveem um ganho menor ou igual a 1, o mínimo de ambos é empregado. Isto significa que ou o primeiro valor de ganho já garante a proteção de ceifamento, ou se não, será substituído pelo segundo valor de ganho.
[00022] No caso em que o ganho do segundo valor de ganho é maior do que 1 e o primeiro valor de ganho provê um ganho menor ou igual a 1, o sinal poderia ser amplificado e ainda não limitaria. Apesar de tudo, o fluxo de áudio que entra solicita atenuação, por exemplo, para atender os propósitos de limitação de faixa dinâmica, e assim é preservado.
[00023] No caso em que o primeiro valor de ganho provê um ganho maior do que 1 e o segundo valor de ganho provê um ganho menor ou igual a 1, o primeiro valor de ganho que entra violaria a proteção de
Petição 870190114541, de 08/11/2019, pág. 20/50
8/37 ceifamento, e assim o segundo valor de ganho é empregado.
[00024] No caso em que tanto o primeiro valor de ganho quanto o segundo valor de ganho proveem um ganho maior do que 1, a entrada deverá ser amplificada. Esta amplificação é permitida desde que nenhumo ceifamento aconteça, e assim o menor do primeiro valor de ganho e do segundo valor de ganho é utilizado.
[00025] Uma proposta alternativa para determinar se os primeiros valores de ganho são suficientes para a proteção é aplicar os primeiros valores de ganho aos dados de áudio e determinar se o sinal de áudio digital resultante (por exemplo, o sinal que sofreu downmix) é ceifado.
[00026] No caso em que os primeiros valores de ganho não são suficientes para a proteção, pode-se interativamente determinar os valores de ganho os quais são suficientes para a proteção de ceifamento iniciando dos primeiros valores de ganho como os valores de ganho iniciais. Por exemplo, pode-se determinar se o sinal de áudio é ceifado com um valor de ganho o qual é o valor de ganho mais próximo menor do que o primeiro valor de ganho de acordo com a resolução dos valores de ganho (por exemplo, no caso em que o primeiro valor de ganho é 0,8 e a resolução de valor de ganho é 0,1, o menor valor de ganho mais próximo seria 0,7). Se o sinal ainda é ceifado, pode-se determinar se o sinal de áudio é ceifado com o próximo valor de ganho menor (por exemplo, um valor de ganho de 0,6). Isto é repetido até que um valor de ganho seja encontrado, o qual não resulte em ceifamento de sinal.
[00027] De preferência, o método é executado como parte de um processo de transcodificação, onde o primeiro fluxo de áudio em um primeiro formato de codificação de áudio (por exemplo, o formato AAC ou o formato AAC de Alta Eficiência (HE-AAC), também conhecido como aacPlus) é transcodificado em um segundo fluxo de áudio codifi
Petição 870190114541, de 08/11/2019, pág. 21/50
9/37 cado em um segundo formato de codificação de áudio (por exemplo, o formato Dolby Digital ou o formato Dolby Digital Plus). O segundo fluxo de áudio compreende os valores de ganho substituídos suficientes para o ceifamento ou tem valores de ganho derivados destes.
[00028] Frequentemente uma transcodificação de áudio é necessária, já que o formato de compressão digital para executar os dados de áudio não pode ser mantido através de toda a cadeia de transmissão até o decodificador de áudio final na cadeia de transmissão (por exemplo, até o decodificador do AVR - receptor de áudio / vídeo). No caso de transmissão, isto é porque, por exemplo, diferentes esquemas de codificação podem ser utilizados para a transmissão pelo ar (ou a transmissão para o consumidor através de cabo) e a transmissão do áudio entre o dispositivo de recepção (por exemplo, um conversor de frequência -STB) e o decodificador final na cadeia de transmissão (por exemplo, o decodificador no AVR ou o decodificador de áudio no aparelho de TV). Por exemplo, os dados de áudio podem ser transmitidos pelo ar através do formato AAC ou o formato HE-AAC, e então os dados de áudio podem ser transcodificados para o formato Dolby Digital ou o formato Dolby Digital Plus para transmissão do STB para o AVR. Em consequência, uma etapa de transcodificação pode ser executada, por exemplo, no STB, para passar de um formato para o outro. Tal etapa de transcodificação compreende a transcodificação dos próprios dados de áudio, mas idealmente também a transcodificação dos metadados acompanhantes, especificamente os dados de controle de faixa dinâmica. De acordo com uma modalidade preferida, o método provê os metadados de ganho de áudio transcodificados no segundo fluxo de áudio, com os metadados de ganho suficientes para a proteção contra o ceifamento de sinal.
[00029] O método pode ser muito útil em qualquer dispositivo que transcodifique um sinal de um formato de fluxo de áudio comprimido
Petição 870190114541, de 08/11/2019, pág. 22/50
10/37 para outro, onde não é conhecido com antecedência se os metadados de controle de ganho variáveis no tempo, se existirem, carregados pelo primeiro formato incluem a proteção de ceifamento de downmix (por exemplo, em um transcodificador de AAC/HE-AAC para Dolby Digital, um transcodificador de Dolby E para AAC/HE-AAC, ou um transcodificador de Dolby Digital para AAC/HE-AAC).
[00030] De preferência, para determinar se os primeiros valores de ganho são suficientes para a proteção, os dados de áudio digital sofrem downmix de acordo com pelo menos um esquema de downmixing, por exemplo, de acordo com um esquema de downmixing Lt/Rt. O downmixing resulta em um ou mais sinais, por exemplo, em um sinal associado com o canal direito e um sinal associado com um canal esquerdo. Além disso, uma pluralidade de esquemas de downmixing pode ser considerada e os dados de áudio digital sofrem downmix de acordo com mais do que um esquema de downmixing.
[00031] De preferência, um valor de pico real de vários sinais derivados do sinal de áudio é continuamente determinado, isto é, em um dado tempo é determinado qual dos vários sinais tem o valor de sinal mais alto. Para computar um valor de pico, o método pode determinar o máximo dos valores absolutos de dois ou mais sinais em um dado tempo. Os dois ou mais sinais podem incluir um ou mais sinais após o downmixing de acordo com um primeiro esquema de downmixing, por exemplo, o valor absoluto de uma amostra do sinal de canal direito que sofreu downmix e o valor absoluto de uma amostra simultânea do sinal de canal esquerdo direito que sofreu downmix. Além disso, para computar o valor de pico, o método pode também considerar o valor absoluto de um ou mais sinais após o downmixing de acordo com um segundo (e até um terceiro) esquema de downmixing. Mais ainda, a determinação de valor de pico pode considerar o valor absoluto de um ou mais sinais de áudio antes do downmixing, por exemplo, o valor
Petição 870190114541, de 08/11/2019, pág. 23/50
11/37 absoluto de cada um dos 5 canais principais de um sinal de canal 5.1 ao mesmo tempo. Deve ser notado que no caso de transcodificação tipicamente não é conhecido se o sinal de múltiplos canais é posteriormente reproduzido sobre canais discretos ou se um downmixing de acordo com um esquema de downmixing é executada.
[00032] Um valor de pico corresponde ao máximo destes valores de amostra de sinal simultâneos, por meio disto indicando a amplitude máxima que o sinal pode ter para todos os casos possíveis em uma instância de tempo específica, e este é o pior caso que o algoritmo de proteção de ceifamento deve levar em conta.
[00033] Os dados de controle de faixa dinâmica são tipicamente variáveis em tempo em uma certa granularidade que geralmente refere-se ao comprimento do segmento de dados (por exemplo, bloco) do respectivo formato de codificação de áudio ou partes inteiras deste. Assim, também um segundo valor de ganho é de preferência computado por segmento de dados.
[00034] Portanto, a taxa de amostragem dos valores de pico ou valores de pico consecutivos é de preferência reduzida (redução de resolução). Isto pode ser feito determinando o máximo de uma pluralidade de valores de pico consecutivos ou valores de pico filtrados consecutivos. Especificamente, o método pode determinar o máximo de uma pluralidade de valores de pico (filtrados) consecutivos associados com um segmento de dados, por exemplo, um bloco ou um quadro. No caso de transcodificação, o método pode determinar o valor de pico mais alto de uma pluralidade de valores de pico (filtrados) consecutivos com um segmento de dados do segundo fluxo de dados (que sai). Deve ser notado que de preferência não somente os valores de pico consecutivos com base em amostras de sinal em um segmento que sai são considerados para determinar o máximo, mas também os valores de pico adicionais (anteriores e posteriores) os quais influenciariam a de
Petição 870190114541, de 08/11/2019, pág. 24/50
12/37 codificação do segmento de dados, isto é, os valores de pico os quais relacionam as amostras de sinal no início e no fim de uma janela de decodificação. Estes valores de pico estão também associados ao segmento de dados.
[00035] Ao invés de escolher o valor de pico mais alto, pode-se computar um valor diferente por segmento de dados para reduzir a taxa de amostragem.
[00036] Deve ser notado que as amostras derivadas dos dados de áudio outros que os valores de pico podem ser reduzidos em resolução. Por exemplo, os dados de áudio podem sofrem downmix para um único canal (mono) e somente o máximo das amostras consecutivas que sofreram downmix por segmento de dados que sai é determinado. De acordo com um exemplo diferente, primeiro cada máximo para cada sinal de canal direito que sofreu downmix é computado por segmento de dados que sai (redução de resolução) e então o valor de pico destes máximos é determinado.
[00037] Com base no máximo determinado, um valor de ganho pode ser computado invertendo o máximo determinado. Se 1 for o valor de sinal máximo o qual pode ser representado, inverter o máximo determinado diretamente gera um fator de ganho. Quando o fator de ganho é aplicado no máximo dos valores de pico (filtrados), o valor resultante é igual a 1, isto é, o valor de sinal máximo. Isto significa que cada amostra de áudio na qual o ganho é aplicado é mantida abaixo de 1 ou é igual a 1, assim evitando o ceifamento para este segmento de dados. No caso em que 1 é nível de sinal máximo, 1 corresponde a 0 dBFS - decibéis relativos à escala total; geralmente 0 dBFS é atribuído ao nível possível máximo.
[00038] Ao invés de simplesmente inverter o máximo determinado, um valor de ganho pode ser computado dividindo um valor de sinal máximo (o qual corresponde a 0 dBFS) pelo máximo determinado as
Petição 870190114541, de 08/11/2019, pág. 25/50
13/37 sociado a um segmento de dados. No entanto, os custos computacionais são mais altos comparados com uma inversão simples.
[00039] No caso de transcodificação, os comprimentos de segmento de dados (por exemplo, bloco ou quadro) são frequentemente diferentes para o primeiro formato de codificação de áudio (formato de fluxo de entrada) e o segundo formato de codificação de áudio (formato de fluxo de saída). Por exemplo, em AAC um bloco tipicamente contém 128 amostras (em HE-AAC: 256 amostras por bloco), enquanto que em Dolby Digital um bloco tipicamente contém 256 amostras. Assim, o número de amostras por bloco aumenta quando transcodificando de AAC para Dolby Digital. Em AAC, um quadro compreende tipicamente 1024 amostras (em HE-AAC: 2048 amostras por quadro), enquanto que em Dolby Digital um quadro tipicamente compreende 1536 amostras (6 blocos). Assim, o número de amostras por quadro também aumenta quando transcodificando de AAC para Dolby Digital. A granularidade dos dados de controle de faixa dinâmica é principalmente ou o tamanho de bloco ou o tamanho de quadro. Por exemplo, a granularidade dos metadados de controle de faixa dinâmica DRC em MPEG para o fluxo de HE-AAC e os metadados de ganho dynrng em Dolby Digital é o tamanho de bloco. Em contraste, a granularidade dos metadados de ganho compr em Dolby Digital e dos metadados de ganho compressão pesada em DVB (transmissão de vídeo digital) para o fluxo de HE-AAC é o tamanho de quadro.
[00040] Além disso, as taxas de amostragem podem ser diferentes para o fluxo de entrada (por exemplo, 32 KHz, ou 44,1 KHz) e o fluxo de saída (por exemplo, 48 KHz), isto é, o áudio é reamostrado. Isto também altera as relações de comprimento entre os segmentos de dados que entram e os segmentos de dados que saem. Mais ainda, os segmentos de dados que entram e que saem podem não estar alinhados. Além disso, deve ser notado que os metadados transmitidos em
Petição 870190114541, de 08/11/2019, pág. 26/50
14/37 um segmento de dados de entrada (por exemplo, bloco ou quadro) têm uma área de impacto de controle de faixa dinâmica (isto é, uma faixa no fluxo onde a aplicação do valor de ganho tem efeito) que é frequentemente não exatamente tão grande quanto o segmento de dados, mas maior. Isto é devido às características de adição de sobreposição da transformada utilizada e ao fato de que o controle de faixa dinâmica é frequentemente aplicado no domínio espectral. O mesmo frequentemente é verdadeiro para os dados de controle de faixa dinâmica do fluxo de áudio que sai. Portanto, para determinar quais valores de ganho de entrada influenciam um dado segmento de dados de saída pode-se observar a sobreposição de comprimentos de impacto de entrada e de saída (ao invés de considerar a sobreposição dos segmentos de dados de entrada e de saída) como será posteriormente explicado em detalhes.
[00041] Devido às razões acima discutidas, a transcodificação dos dados de controle de faixa dinâmica deve levar em conta que um valor de controle de faixa dinâmica que sai pode ser influenciado por mais de um valor de controle de faixa dinâmica que entra. Neste caso, uma reamostragem (re-enquadramento) dos dados de controle de faixa dinâmica pode ser executada quando transcodificando o fluxo de dados. [00042] Portanto, o método pode compreender a etapa de reamostrar os valores de ganho derivados dos metadados de áudio recebidos do primeiro fluxo de áudio. Quando um segmento de dados do primeiro fluxo de áudio cobre um comprimento de tempo mais curto do que um segmento de dados do segundo fluxo de áudio, os valores de ganho são reduzidos em resolução.
[00043] Um valor de ganho reamostrado pode ser determinado computando o mínimo de uma pluralidade de valores de ganho consecutivos. Em outras palavras: de um número de ganhos de controle de faixa dinâmica de entrada (os quais são relevantes para um segmento
Petição 870190114541, de 08/11/2019, pág. 27/50
15/37 de dados que sai), o menor é escolhido. A motivação para isto é preservar os valores que entram tanto quanto possível (no caso em que os valores não resultem em ceifamento de sinal). No entanto, isto frequentemente não é possível já que os valores de ganho precisam ser reamostrados. Portanto, o menor valor de ganho é escolhido, o que tende a reduzir a amplitude de sinal. Esta redução da amplitude de sinal é considerada como menos notável ou irritante. De preferência, tal mínimo é determinado por segmento de dados de saída.
[00044] No caso em que nenhum metadado de ganho relativo ao controle de faixa dinâmica está presente no primeiro fluxo de áudio, o método de preferência adiciona valores de ganho suficientes para a proteção contro ceifamento no segundo fluxo de áudio (fluxo que sai). Estes valores de ganho devem de preferência ser limitados de modo que estes não excedam um ganho de 1. A razão para impedir que os valores de ganho excedam 1 é que o sinal não deve ser desnecessariamente amplificado para se aproximar do limite de ceifamento.
[00045] Assim, no caso em que um respectivo segundo valor de ganho computado tem um ganho abaixo de 1, o respectivo valor de ganho adicionado corresponde ao segundo valor de ganho computado. No caso em que um respectivo segundo valor de ganho computado for acima de 1, o respectivo valor de ganho adicionado é ajustado para um ganho de 1.
[00046] Um segundo aspecto do pedido refere-se a um aparelho para prover a proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital. O aparelho está configurado para executar o método como acima discutido. As características do aparelho correspondem às características do método como acima discutido. Consequentemente, o aparelho compreende um meio para determinar se os primeiros valores de ganho com base em metadados de áudio recebidos são suficientes para a proteção contra o ceifamento
Petição 870190114541, de 08/11/2019, pág. 28/50
16/37 do sinal de áudio. Ainda, o aparelho compreende um meio para substituir um primeiro valor de ganho por um valor de ganho suficiente para a proteção contra o ceifamento do sinal de áudio no caso do primeiro valor de ganho não ser suficiente.
[00047] De preferência, o meio de determinação compreende um meio para computar os segundos valores de ganho com base nos dados de áudio digital, onde os segundos valores de ganho são suficientes para a proteção de ceifamento do sinal de áudio. Mais de preferência, o meio de determinação também compreende um meio de comparação para comparar os primeiros valores de ganho com base nos metadados de áudio recebidos e os segundos valores de ganho computados. Em sua dependência, os valores de ganho são selecionados dos primeiros valores de ganho e dos segundos valores de ganho computados.
[00048] As observações acima relativas ao primeiro aspecto do pedido são também aplicáveis ao segundo aspecto do pedido.
[00049] Um terceiro aspecto do pedido refere-se a um transcodificador, onde o transcodificador está configurado para transcodificar um fluxo de áudio de um primeiro formato de codificação de áudio para um segundo formato de codificação de áudio. O transcodificador compreende o aparelho de acordo com o segundo aspecto do pedido. De preferência, o transcodificador faz parte de um dispositivo de recepção que recebe o primeiro fluxo de áudio, onde o primeiro fluxo de áudio é um sinal de transmissão digital, por exemplo, um fluxo de áudio de um sinal de televisão digital (por exemplo, DVB-T, DVB-S, DVB-C) ou um sinal de rádio digital (por exemplo, um sinal de DAB). Por exemplo, o dispositivo de recepção é um conversor de frequência. O fluxo de áudio pode também ser transmitido através da Internet (por exemplo, Internet TV ou Internet rádio). Alternativamente, o primeiro fluxo de áudio pode ser lido de um meio de armazenamento de dados digitais, por
Petição 870190114541, de 08/11/2019, pág. 29/50
17/37 exemplo, um DVD (Disco Versátil Digital) ou um disco Blu-ray.
[00050] As observações acima relativas ao primeiro e ao segundo aspectos do pedido são também aplicáveis ao terceiro aspecto do pedido.
BREVE DESCRIÇÃO DOS DESENHOS [00051] A invenção está abaixo explicada em um modo exemplar com referência aos desenhos acompanhantes, em que a figura 1 ilustra uma modalidade de um transcodificador que provê uma proteção de ceifamento;
a figura 2 ilustra uma proposta preferida para um reenquadramento de metadados;
a figura 3 ilustra uma modalidade para determinar os valores de pico com base em dados de áudio recebidos:
a figura 4 ilustra uma modalidade para mesclar os dados de controle de faixa dinâmica que entram com valores de ganho computados suficientes para a proteção de ceifamento;
a figura 5 ilustra a seleção dos valores de ganho que saem;
a figura 6 ilustra uma modalidade alternativa para mesclar os dados de controle de faixa dinâmica que entram com valores de ganho computados suficientes para a proteção de ceifamento;
a figura 7 ilustra uma modalidade de um estágio de filtro de uniformização;
a figura 8 ilustra outra modalidade para prover a proteção de ceifamento;
a figura 9 ilustra ainda outra modalidade para prover a proteção de ceifamento; e a figura 10 ilustra um dispositivo de recepção que recebe o fluxo de áudio transcodificado.
DESCRIÇÃO DETALHADA [00052] AAC/HE-AAC e Dolby Digital / Dolby Digital Plus suportam
Petição 870190114541, de 08/11/2019, pág. 30/50
18/37 o conceito de metadados, mais especificamente as palavras de ganho que carregam um ganho variável no tempo para ser opcionalmente aplicado aos dados de áudio quando da decodificação. Para o propósito de reduzir os dados, estas palavras de ganho são tipicamente somente enviadas uma vez por segmento de dados, por exemplo, por bloco ou quadro. Nos ditos formatos de áudio, estas palavras de ganho são opcionais, isto é, é tecnicamente possível não enviar os dados. Os codificadores de Dolby Digital e Dolby Digital Plus tipicamente enviam as palavras de ganho, enquanto que os codificadores de AAC e HE-AAC frequentemente não enviam as palavras de ganho. No entanto, os números de codificadores de AAC e HE-AAC os quais enviam as palavras de ganho estão crescendo. O pedido permite que os decodificadores ou os transcodificadores que recebem um fluxo de áudio façam a coisa certa em ambas as situações. Se as palavras de ganho de áudio forem providas, a coisa certa seria processar as palavras de ganho de áudio recebidas tão verdadeiramente quanto possível, mas ignorá-las quando as palavras de ganho que entram não proveem uma atenuação suficiente para impedir o ceifamento de sinal, por exemplo, no caso de um downmix. Se nenhum valor de ganho for provido, a coisa certa seria calcular e prover os valores de ganho os quais impedem o ceifamento de sinal.
[00053] A figura 1 mostra uma modalidade de um transcodificador, com o transcodificador provendo proteção contra o ceifamento de sinal, especificamente contra o ceifamento no caso de downmixing (por exemplo, executando o downmix de um sinal de canal 5.1 para um sinal de 2 canais). O transcodificador recebe um fluxo de áudio digital 1 que compreende os metadados de áudio. Por exemplo, o fluxo de áudio digital é um fluxo de áudio digital de AAC ou HE-AAC (HE-AAC versão 1 ou HE-AAC versão 2). O fluxo de áudio digital pode fazer parte de um fluxo de vídeo / áudio DVB, por exemplo, um fluxo DVB-T,
Petição 870190114541, de 08/11/2019, pág. 31/50
19/37
DVB-S ou DVB-C. O transcodificador transcodifica o fluxo de áudio 1 recebido em um fluxo de áudio de saída 14 o qual está codificado em um formato diferente, por exemplo, Dolby Digital ou Dolby Digital Plus. Tipicamente, os decodificadores de Dolby Digital suportam o downmixing de sinais de múltiplos canais e assumem que os envelopes de ganho variáveis no tempo incluídos nos metadados de Dolby Digital recebidos incluem a proteção de ceifamento de downmix. Infelizmente, o fluxo de bits 1 (por exemplo, um fluxo de bits AAC/HE-AAC) não necessariamente contém os metadados de envelope de ganho variável no tempo, e mesmo no caso de carregar tais dados não está claro se os dados incluem a proteção de ceifamento. O transcodificador impede que um decodificador (por exemplo, um decodificador Dolby Digital) em um dispositivo de recepção (a jusante do transcodificador) produza sinais de saída que contenham artefatos de ceifamento quando realizando downmix do sinal. O transcodificador assegura que o fluxo de áudio de saída 14 contenha os metadados de envelope de ganho variável no tempo que incluem a proteção de ceifamento de downmix.
[00054] Na figura 1, a unidade 2 lê os valores de ganho de controle de faixa dinâmica 3 contidos nos metadados de áudio do fluxo de áudio 1. Opcionalmente, os valores de ganho 3 são adicionalmente processados na unidade 5, por exemplo, os valores de ganho 3 são reamostrados e transcodificados de acordo com o tempo de segmento de dados do fluxo de áudio de saída transcodificado 14. A reamostragem e a transcodificação de valores de ganho de metadados estão discutidas no documento Transcoding of dynamic range control coefficients and other metadata into MPEG-4 HE AAC, Wolfgang Schildbach et al., Audio Engineering Society Convention Paper, apresentado na 123a Convenção Outubro 5-8, 2007, Nova York. A descrição deste documento, especificamente os conceitos de reamostragem e transcodificação de valores de ganho de metadados, está por meio disto incorpo
Petição 870190114541, de 08/11/2019, pág. 32/50
20/37 rada por referência. Além disso, em 30 de Setembro de 2008, a Requerente depositou o Pedido Provisório US 61/101497 que tem o título Transcodificação de Metadados de Áudio, com o pedido provisório US referindo à reamostragem e à transcodificação de valores de ganho de metadados. A descrição deste pedido, especificamente os conceitos para os conceitos de reamostragem e transcodificação de valores de ganho de metadados, está por meio disto incorporada por referência.
[00055] Em paralelo à reamostragem, os dados de áudio no fluxo de áudio 1 são decodificados por um decodificador 6, tipicamente para dados de áudio de PCM (modulação de código de pulso). Os dados de áudio decodificados 7 compreendem uma pluralidade de canais de sinal paralelos, por exemplo, 6 canais de sinal no caso de um sinal de canal 5.1, ou 8 canais de sinal no caso de um sinal de canal 7.1.
[00056] Uma unidade de computação 8 determina os valores de ganho computados 9 com base em dados de áudio 7. Os valores de ganho computados 9 são suficientes para a proteção contra o ceifamento de sinal em um dispositivo de recepção a jusante do transcodificador o qual recebe o fluxo de áudio transcodificado, especificamente quando realizando downmix do sinal no dispositivo de recepção. Tal dispositivo pode ser um AVR ou um aparelho de TV. Os valores de ganho computados devem garantir que o sinal direito que sofreu downmix atinja no máximo 0 dBFS ou menos. Os valores de ganho 4 derivados dos metadados no fluxo de áudio 1 e os valores de ganho computados 9 são comparados uns com os outros na unidade 10. A unidade 10 emite os valores de ganho 11, onde um valor de ganho do fluxo de valores de ganho 4 é substituído por um valor de ganho derivado do fluxo de valores de ganho 9 no caso do respectivo valor de ganho do fluxo de valores de ganho 4 não ser suficiente para impedir o ceifamento de sinal no dispositivo de recepção. Em paralelo, os dados
Petição 870190114541, de 08/11/2019, pág. 33/50
21/37 de áudio 7 são codificados pelo codificador 12 para um formato de codificação de áudio de saída, por exemplo, para Dolby Digital ou Dolby Digital Plus. Os dados de áudio codificados e os valores de ganho 11 são combinados na unidade 13. O fluxo de áudio resultante provê os metadados de ganho de áudio os quais impedem o ceifamento de sinal, especificamente para o caso de downmixing de sinal.
[00057] Geralmente, os dados de ganho de áudio que entram devem ser preservados tanto quanto possível desde que os metadados de ganho provenham a proteção contra o ceifamento de sinal. Na maioria dos casos, o comprimento de um segmento de dados (por exemplo, bloco ou quadro) do fluxo de áudio de entrada (ver 1 na figura 1) e o comprimento de um segmento de dados (por exemplo, bloco ou quadro) do fluxo de áudio de saída (ver 14 na figura 1) são diferentes. Mais ainda, tipicamente o início de um segmento de dados do fluxo de áudio de entrada e o início de um segmento de dados do fluxo de áudio de saída não estão alinhados (mesmo se os comprimentos de segmento de dados forem idênticos). Assim, um mapeamento de metadados que entram para os metadados que saem é tipicamente necessário.
[00058] A figura 2 ilustra uma proposta preferida para mapear os metadados que entram para os metadados que saem. Como anteriormente discutido, tipicamente cada segmento de dados (por exemplo, bloco ou quadro) tem um valor de ganho de dados de controle de faixa dinâmica (ou uma pluralidade de valores de ganho, por exemplo, 8 valores de ganho). No entanto, os metadados transmitidos ao longo de um segmento de dados de entrada (por exemplo, bloco ou quadro) tem uma área de impacto de controle de faixa dinâmica (isto é, uma faixa no fluxo onde a aplicação do valor de ganho tem efeito) que frequentemente não é exatamente tão grande quanto o segmento de dados, mas maior. Isto é devido às características de adição de sobrepo
Petição 870190114541, de 08/11/2019, pág. 34/50
22/37 sição da transformada utilizada (isto é, janelas são utilizadas as quais são maiores do que o segmento de dados e as janelas sobrepõem) e ao fato de que o controle de faixa dinâmica é frequentemente aplicado no domínio espectral. O mesmo frequentemente é verdadeiro para os dados de controle de faixa dinâmica do fluxo de bits de áudio que sai. Na figura 2, as linhas cheias marcam o início e o fim de um segmento de dados 20-23 no fluxo de entrada, e o início e o fim de um segmento de dados 24-26 no fluxo de saída. Na figura 2 cada área de impacto de controle de faixa dinâmica 30-33 e 34-36 de um valor de ganho estende além do fim e do início do respectivo segmento de dados. Cada área de impacto 30-33 e 34-36 está indicada pelas linhas de traço e ponto.
[00059] Por exemplo, em HE-AAC, o tamanho de bloco é de 256 amostras, enquanto que uma janela para decodificação tem 512 amostras. Toda a janela de 512 amostras pode ser considerada como uma área de impacto; no entanto, o impacto do valor de ganho nas bordas externas das janelas é menor comparado com o impacto no meio da janela. Assim, a área de impacto pode ser também considerada como uma porção da janela. A área de impacto pode ser um número de amostras selecionadas do tamanho de bloco / quadro (aqui: 256 amostras) até o tamanho de janela (aqui: 512 amostras). De preferência, a área de impacto utilizada é maior do que o tamanho do segmento de dados (bloco ou quadro).
[00060] Para determinar quais valores de controle de faixa dinâmica de entrada influenciam um dado segmento de dados de saída, é preferido observar a sobreposição de áreas de impacto de entrada e de saída (ao invés de observar a sobreposição dos segmentos de dados de entrada e de saída). Na figura 2, é determinado quais áreas de impacto 30-33 no fluxo de entrada sobrepõem com uma área de impacto 3436 de um dado segmento de dados de saída 24-26. Por exemplo, a
Petição 870190114541, de 08/11/2019, pág. 35/50
23/37 área de impacto 34 do segmento de dados 24 no fluxo de entrada sobrepõe com as áreas 30, 31, 32 e 33. Portanto, de preferência, os valores de ganho associados aos quatro segmentos de dados 20, 21, 22 e 23 são considerados quando determinando o valor de ganho do primeiro segmento de dados 24 no fluxo de saída ilustrado. O primeiro segmento de dados 24 é influenciado pelos 4 segmentos de dados de entrada 20-23. Alternativamente, o método pode observar a sobreposição das áreas de impacto de entrada e o segmento de sinal de saída, ou a sobreposição dos segmentos de dados de entrada e do segmento de dados de saída.
[00061] Tal mapeamento ou processo de reamostragem pode ser executado na unidade 5 na figura 1, a qual recebe os valores de ganho 3 do fluxo de entrada 1 e mapeia um ou mais dos valores de ganho para um valor de ganho 4.
[00062] A figura 3 ilustra uma modalidade do bloco 50 para determinar os valores de pico com base nos dados de áudio recebidos. Tal bloco de determinação de pico 50 pode fazer parte do bloco 8 na figura 1. Com base nos dados de áudio de múltiplos canais decodificados 7 que compreendem uma pluralidade de canais (aqui 5 canais de um sinal de canal 5.1, o canal de efeito de baixa frequência não é considerado), o downmixing é executada de acordo com um ou mais esquemas de downmix (isto é, de acordo com uma ou mais matrizes de downmix). Deve ser notado que o transcodificador não sabe de nenhum modo se o downmixing é executada no dispositivo de recepção e qual esquema de downmixing é então utilizado no dispositivo de recepção. Assim, é desconhecido se um sinal de múltiplos canais é reproduzido sobre canais discretos ou se o downmixing de acordo com um de diversos esquemas é executada. O transcodificador simula todos os casos e determina o pior caso.
[00063] No exemplo na figura 3, o downmixing de acordo com o es
Petição 870190114541, de 08/11/2019, pág. 36/50
24/37 quema de downmixing Lo/Ro é executado no bloco 41, o downmixing de acordo com o esquema de downmixing Pro Logic (PL) é executada no bloco 42, e o downmixing de acordo com o esquema de downmixing Pro Logic II (PL II) é executado no bloco 43. O esquema de downmixing PL e o esquema de downmixing PL II são duas variantes do esquema de downmixing Lt/Rt como anteriormente discutido. Cada esquema de downmixing emite um sinal de canal direito e um sinal de canal esquerdo. Então, os valores absolutos dos sinais após o downmixing são computados (ver blocos 44 na figura 3). De preferência, também os valores de amostra absolutos dos vários canais do sinal de áudio de múltiplos canais 7 são computados (ver blocos 40 para determinar os valores absolutos). Considerando também os valores absolutos dos canais (sem downmixing) é útil impedir o ceifamento de sinal em outros casos do que o downmixing, por exemplo, no caso do sinal ser posteriormente amplificado por um ganho extra (por exemplo, um ganho de 11 dB no caso do modo de RF posteriormente discutido). [00064] O máximo (= valor de pico) dos valores absolutos em um tempo é computado no bloco 45. A computação do máximo é continuamente executada, por meio disto gerando um fluxo de valores de pico 46. Pode ser possível que as várias amostras tenham um diferente retardo de sinal devido a um diferente processamento de sinal. Tais diferentes retardos de sinal podem ser alinhados (não mostrado). O máximo dos valores de amostra indica a amplitude máxima que um sinal pode ter para todos os casos, e assim este é o pior caso que o algoritmo de proteção de ceifamento leva em conta. O transcodificador assim simula a amplitude de pior caso do sinal no dispositivo de recepção de cada vez. Um valor de controle de faixa dinâmica que consegue a proteção contra o ceifamento deve atenuar (ou amplificar) o sinal em um modo que este atinja 0 dBFS no máximo.
[00065] Deve ser notado que o bloco 50 pode determinar um valor
Petição 870190114541, de 08/11/2019, pág. 37/50
25/37 de pico com base em menos valores absolutos do que ilustrado na figura 3 (por exemplo, sem considerar os valores absolutos dos canais não sofreram downmix) ou com base em valores absolutos adicionais não mostrados na figura 3 (por exemplo, os valores absolutos de outros esquemas de downmixing). Alternativamente, é possível realizar downmix dos canais 7 sem determinar um valor de pico: por exemplo, os dois canais resultantes podem ser combinados e o sinal combinado pode ser adicionalmente processado (ao invés de utilizar os valores de pico 46 como computados pelo bloco 45).
[00066] O processamento adicional de valores de pico 46 está indicado na figura 4. Os elementos figurativos nas figuras 1 e 4 denotados pelos mesmos símbolos de referência são basicamente os mesmos. Os valores de pico 46 sofrem uma etapa de bloqueio e de construção máxima na unidade 60. Aqui, o valor de pico mais alto é determinado para um dado segmento de dados de saída (por exemplo, um bloco). Em outras palavras: os valores de pico são reduzidos em resolução selecionando o valor de pico mais alto (o qual é o mais crítico) para um segmento de dados de saída de uma pluralidade de valores de pico. Deve ser notado que de preferência não somente os valores de pico consecutivos que correspondem às amostras de sinal em um segmento de saída são considerados para determinar o máximo. Ao contrário, também os valores de pico adicionais (anteriores e posteriores) os quais influenciariam um dado segmento de dados são considerados, isto é, os valores de pico os quais referem a amostras de sinal no início e no fim de uma janela de decodificação. De preferência, todas as amostras da janela são consideradas.
[00067] O resultado desta amostragem é invertido no bloco 61 de acordo com a fórmula C = 1/X, onde C refere-se a um valor de ganho computado 9 e X refere-se ao respectivo pico mais alto para o bloco do fluxo de saída 14. O resultado C é um fator (ganho) que garante
Petição 870190114541, de 08/11/2019, pág. 38/50
26/37 que cada amostra de áudio do segmento de dados (por exemplo, bloco) está abaixo ou igual ao nível de sinal máximo 1 (que corresponde a 0 dBFS) quando o ganho é aplicado à respectiva amostra de áudio. Isto evita o ceifamento para este segmento de dados. Deve ser notado que o nível de sinal máximo significa o nível de sinal máximo de um sinal no receptor do fluxo de áudio transcodificado; assim, na saída do bloco 60, a amplitude pode ser mais alta do que 1 (quando C < 1).
[00068] O ganho computado C é o ganho permissivo máximo que impede o ceifamento; um valor de ganho menor do que o ganho computado C pode também ser utilizado (neste caso o sinal resultante é ainda menor). Deve ser notado que no caso em que o ganho C está abaixo de 1, o ganho C (ou um ganho menor) precisa ser aplicado, de outro modo o sinal seria ceifado pelo menos no cenário de pior caso.
[00069] No bloco 5, os valores de ganho que entram 3 dos metadados sofrem uma reamostragem também. De um número de ganhos que entram relevantes para um segmento de dados de saída, o menor ganho é escolhido e utilizado para um processamento adicional. De preferência, a reamostragem é executada conforme discutido em conexão com a figura 2: para determinar quais valores de ganho que entram são relevantes para um segmento de dados de saída, a sobreposição das áreas de impacto de entrada e de saída é considerada. Se a área de impacto de um segmento de dados que entra sobrepõe com a área de impacto de um dado segmento de dados de saída, o segmento de dados que entra é considerado (e assim o seu valor de ganho) quando determinando o menor valor de ganho. Ao contrário, também as duas propostas alternativas como discutido em conexão com a figura 2 podem ser utilizadas.
[00070] A motivação para isto é preservar os valores que entram. No entanto, isto não é possível já que os valores de ganho precisam ser reamostrados de acordo com o tempo do fluxo de saída. A utiliza
Petição 870190114541, de 08/11/2019, pág. 39/50
27/37 ção do menor valor de ganho de uma pluralidade de valores de ganho consecutivos tende a reduzir a amplitude de sinal a qual é considerada em tendência como menos notável ou irritante.
[00071] No caso em que os dados de controle de faixa dinâmica relevantes estão presentes no fluxo de dados que entra 1, uma comparação entre este ganho (de preferência após a reamostragem no bloco 5) e os valores de ganho computados 9 suficientes para a proteção de ceifamento é feita no bloco 10. O bloco 62 determina o mínimo entre um valor de ganho reamostrado 4 e um valor de ganho computado 9, com o menor valor de ganho sendo utilizado como o valor de ganho que sai (o bloco 62 forma um seletor mínimo).
[00072] No caso em que nenhum valor de ganho está presente, o comutador 63 na figura 4 comutará para a posição superior, com o bloco 62 então determinando o mínimo entre um ganho de 1 e o valor de ganho computado, com o menor valor de ganho sendo utilizado como o valor de ganho que sai. Assim, no caso em que nenhum valor de ganho que entra está presente, o valor de ganho que sai é limitado a um ganho máximo de 1.
[00073] A tabela seguinte ilustra a operação do bloco de comparação 10. Aqui, o termo I denota o ganho de controle de faixa dinâmica que entra 4 (após a reamostragem), e o termo C denota o ganho computado 9.
I < 1 I > 1 I não presente
C < 1 min(I, C) min(I, C) = C C
C > 1 min(I, C) = I min(I, C) 1
[00074] No caso em que tanto I quanto C são menores ou iguais a 1, o mínimo é empregado. Isto significa que ou I já garante a proteção de ceifamento, ou se não, este será substituído por C.
[00075] No caso de C > 1 e I < 1, o sinal poderia ser amplificado e ainda não seria ceifado. O fluxo que entra, no entanto, solicita atenua
Petição 870190114541, de 08/11/2019, pág. 40/50
28/37 ção, por exemplo, para atender os propósitos de ceifamento de faixa dinâmica, e assim I é preservado (I é o mínimo de I e C neste caso).
[00076] No caso de I > 1 e C < 1, o valor que entra violaria a proteção de ceifamento, e assim C é empregado (C é o mínimo de I e C neste caso).
[00077] No caso em que tanto I quanto C são maiores do que 1, a entrada deverá ser amplificada. Esta amplificação é permitida desde que ainda nenhumo ceifamento aconteça, e assim o menor de I e C é utilizado.
[00078] No caso em que nenhum valor de faixa dinâmica que entra está presente, a proteção de ceifamento é assegurada pela utilização de C desde que C < 1. No caso de C > 1, o sinal não deverá ser modificado (isto é, o sinal não deveria ser desnecessariamente amplificado para se aproximar da borda de ceifamento). Assim a unidade é empregada como o ganho que sai. Em ambos os casos quando nenhum valor de ganho que entra está presente, o mínimo de 1 e C é utilizado (ao invés do mínimo entre I e C).
[00079] A figura 5 ilustra a seleção dos valores de ganho que saem 11 na forma de um fluxograma. É determinado se um valor de ganho I está presente (ver referência 130 na figura 5). Se um valor de ganho I estiver correntemente presente, o valor de ganho que sai depende dos valores do valor de ganho que entra I e do valor de ganho computado C. Se I < 1 e C < 1, o valor de ganho selecionado corresponde ao mínimo de I e C (ver referência 131). Se I < 1 e C > 1, o valor de ganho selecionado corresponde a I (ver referência 132). Se I > 1 e C < 1, o valor de ganho selecionado corresponde a C (ver referência 133). Se I > 1 e C > 1, o valor de ganho selecionado corresponde ao mínimo de I e C (ver referência 134). Deve ser notado que em todos estes quatro casos, o valor que sai ainda corresponde ao mínimo de I e C. Assim, não é necessário determinar se I e C são < 1 ou não.
Petição 870190114541, de 08/11/2019, pág. 41/50
29/37 [00080] Se nenhum valor de ganho I estiver correntemente presente, o valor de ganho que sai depende do valor do valor de ganho computado C. Se C < 1, o valor de ganho que sai corresponde a C (ver referência 135). Se C > 1, o valor de ganho que sai corresponde a 1 (ver referência 136). Deve ser notado que em ambos os casos, o valor que sai ainda corresponde ao mínimo de 1 e C. Assim, não é necessário determinar se C é < 1 ou não.
[00081] A modalidade como acima discutido obtém que a dinâmica que entra é preservada e somente no caso de um ceifamento ocorrer, a dinâmica é modificada para impedir o ceifamento. No caso em que nenhum valor de controle de faixa dinâmica está presente, valores de controle de faixa dinâmica suficientes são adicionados ao fluxo para impedir o ceifamento. A comutação entre os modos funciona instantaneamente e uniformemente, por meio disto mitigando quaisquer artefatos.
[00082] A figura 6 ilustra uma alternativa à modalidade na figura 4. Os elementos figurativos nas figuras 4 e 6 denotados pelos mesmos símbolos de referência são basicamente os mesmos. Na figura 6, metadados de ganho separados para dois diferentes modos, o modo de linha e o modo de RF, são recebidos e transcodificados. Na modalidade na figura 6 diferentes palavras de ganho para o modo de RF e o modo de linha são computadas porque estas utilizam dois tipos diferentes de metadados. Os metadados de modo de linha cobrem uma pequena faixa de valores e são enviados mais frequentemente (tipicamente uma vez por bloco), enquanto que os metadados de modo de RF cobrem uma faixa de valores maior e são enviados menos frequentemente (tipicamente um por quadro). No modo de RF, o sinal é intensificado por um ganho extra de 11 dB, o que permite uma razão de sinal para ruído mais alta quando transmitindo o sinal sobre um canal dinamicamente muito limitado (por exemplo, de um conversor de fre
Petição 870190114541, de 08/11/2019, pág. 42/50
30/37 quência para a entrada de RF de uma TV através de uma conexão de antena de RF analógica). Mais ainda, como os metadados de ganho de modo de RF cobrem uma faixa de valores mais larga do que os metadados de ganho do modo de linha, o modo de RF permite uma compressão de faixa dinâmica mais alta. Os metadados de ganho para o modo de linha são denotados como DRC (ver símbolo de referência
3), enquanto que os metadados de ganho para o modo de RF são denotados como compr (ver símbolo de referência 3'). Favor notar que em DVB os metadados de ganho para o modo de RF são denotados como compressão ou compressão pesada. Mais ainda, a modalidade na figura 6 também considera um nível de referência de programa (PRL), o qual pode ser transmitido como parte dos metadados. O PRL indica uma intensidade de referência do conteúdo de áudio (por exemplo, em HE-AAC, o PRL pode variar entre 0 dB e -31,75 dB). A aplicação do PRL reduz a intensidade do áudio para um nível de referência alvo definido. Na dependência do formato de codificação de áudio outros termos para a referência são comuns, por exemplo, nível de diálogo, normalização de diálogo ou dialnorm.
[00083] Na figura 6, o valor de pico mais alto para um bloco de dados (como gerado pela unidade 60) é ajustado em nível na unidade 70 na dependência do PRL recebido (normalmente, o nível é reduzido pelo PRL). Para computar os valores de ganho associados ao modo de linha, as amostras ajustadas em nível são invertidas no bloco 61, por meio disto gerando os valores de ganho computados os quais garantem que cada amostra de áudio do bloco está abaixo ou é igual ao nível de sinal máximo 1 no caso do sinal de áudio ser ajustado no receptor pelo PRL. A reamostragem dos dados de DRC que entram 3 no bloco 5, e a comparação dos valores de ganho reamostrados 4 e os valores de ganho computados são idênticas à figura 4.
[00084] Para computar os valores de ganho associados ao modo de
Petição 870190114541, de 08/11/2019, pág. 43/50
31/37
RF, as amostras ajustadas em nível são amplificadas por 11 dB no bloco 71 já que no receptor o sinal é também amplificado por 11 dB no caso de utilizar o modo de RF. O transcodificador assim simula a amplitude de pior caso do sinal no dispositivo de recepção. As amostras intensificadas são invertidas no bloco 61', por meio disto gerando os valores de ganho computados para o modo de RF o que garante que cada amostra de áudio do bloco esteja abaixo ou igual a 1 (= amplitude de sinal máxima) no caso de o sinal de áudio ser ajustado no receptor pelo PRL e intensificado por 11 dB.
[00085] A modalidade na figura 6 é de preferência utilizada para um transcodificador que emite um fluxo de áudio Dolby Digital (por exemplo, um transcodificador de HE-AAC para Dolby Digital ou um transcodificador de AAC para Dolby Digital). De acordo com Dolby Digital, no modo de linha, cada bloco de codificação tem um valor de ganho de DRC (controle de faixa dinâmica), enquanto que no modo de RF cada quadro (o qual compreende 6 blocos) tem um valor de ganho de compr. Apesar de tudo, ambos os tipos de valores de ganho referem ao controle de faixa dinâmica. O valor de ganho computado para o modo de RF é reduzido em resolução da taxa de bloco para a taxa de quadro no bloco 73. O bloco 73 determina o mínimo dos valores de ganho computados para um número total de 6 blocos consecutivos, com cada mínimo atribuído ao valor de ganho computado 72 para todo o quadro. A reamostragem dos valores de ganho de compr que entram 3' no bloco 5' difere da reamostragem no bloco 5 de tal modo que o mínimo para um quadro de saída seja determinado. A comparação dos valores de ganho reamostrados 4' e dos valores de ganho baseados em quadro computados 72 é a mesma que anteriormente discutida.
[00086] A modalidade na figura 6 provê proteção não somente quanto à ceifamento no caso de downmixing, mas também contra o ceifamento de sinal quando aplicando um ganho extra de 11 dB no
Petição 870190114541, de 08/11/2019, pág. 44/50
32/37 modo de RF (de outro modo, o sinal intensificado em 11 dB pode ser ceifado mesmo quando não utilizando o dowmixing de sinal). Portanto, é vantajoso considerar no bloco 50 também os valores absolutos dos canais sem downmix.
[00087] Deve ser notado que no caso nenhum PRL é recebido, de preferência o PRL é ajustado para um valor padrão.
[00088] Para computar os valores de ganho, um estágio de uniformização pode ser utilizado. A figura 7 mostra uma modalidade de um estágio de uniformização 80 o qual pode ser colocado em qualquer lugar no percurso entre a saída do bloco 50 e a entrada dos blocos 61 e 61'. De preferência, o estágio de uniformização 80 é colocado na saída do bloco 50, por meio disto gerando os valores de pico uniformizados 46' com base nos valores de pico 46. O estágio de uniformização 80 implementa um filtro de passa- baixo para o sinal de entrada do estágio de uniformização, por exemplo, o sinal de valor de pico. O seu propósito é aperfeiçoar a impressão audível após a proteção de ceifamento entrar: uma liberação imediata de um ganho de controle secundário após um período de proteção de ceifamento parecerá irritante. Assim, como é amplamente feito em implementações de limitador, o sinal de valor de pico (e por este o sinal de ganho derivado; ver abaixo) é filtrado com um filtro passa-baixa de 1a ordem, o qual de preferência opera a uma constante de tempo τ de 200 ms. No caso em que um valor de entrada novo demande uma proteção de ceifamento a um grau mais alto do que o sinal uniformizado atingiria (como o valor de entrada novo é mais alto do que o sinal uniformizado), este desvia do estágio de uniformização e entra em efeito imediatamente. Neste caso, a entrada superior é mais alta do que a entrada inferior do bloco de computação máxima 81 na figura 7.
[00089] De preferência, a modalidade nas figuras 3-7 faz parte de um transcodificador de áudio, por exemplo, de AAC e/ou HE-AAC para
Petição 870190114541, de 08/11/2019, pág. 45/50
33/37
Dolby Digital, ou de Dolby E ou Dolby Digital para AAC e/ou HE-AAC. No entanto, deve ser notado que as modalidades nas figuras 3-7 não são necessariamente parte de um transcodificador de áudio. Estas modalidades podem fazer parte do dispositivo que recebe o fluxo de áudio que entra 1 e aplica os valores de ganho modificados (sem transcodificação). Os valores de ganho modificados podem ser diretamente utilizados para ajustar o ganho do fluxo de áudio recebido. Por exemplo, as modalidades nas figuras 3-7 podem fazer parte de um AVR ou um aparelho de TV.
[00090] A figura 8 ilustra uma modalidade alternativa para prover proteção de downmix. O aparelho recebe as palavras de ganho que entram 90 contidas nos ou derivadas dos metadados de áudio. As palavras de ganho 90 podem corresponder aos valores de ganho 3 ou 4 nas figuras 1 e 4. Ainda, o aparelho recebe amostras de áudio 91 (por exemplo, amostras de áudio PCM). Por exemplo, as amostras de áudio 91 podem ser valores de pico como gerados pelo bloco 50 na figura 3. Se as amostras de áudio 91 não forem valores absolutos, o valor absoluto das amostras de áudio 91 pode ser determinado anteriormente. No bloco 92, os valores de ganho permitidos máximos gainmax(t) são computados por uma divisão de acordo com a equação seguinte:
gainst) S^gna^mia,allowed signal (/) [00091] Aqui, o termo signalmax,allowed denota a amplitude de sinal permitida máxima, por exemplo, signalmax,allowed = 1. O termo signal(t) denota a amostra de áudio 91 corrente.
[00092] No bloco 93, os valores de ganho permitidos máximos gainmax(t) são limitados para um ganho máximo de 1: Se um valor de gainmax(t) estiver acima de 1, então gainmax(t) será ajustado para 1. No entanto, se um valor de gainmax(t) for abaixo de 1 ou igual a 1, o valor não será modificado.
Petição 870190114541, de 08/11/2019, pág. 46/50
34/37 [00093] A saída do bloco 93 é alimentada para um estágio de filtro de uniformização 94. O estágio de filtro de uniformização 94 contém um filtro passa-baixa e um seletor de mínimo 95 o qual seleciona o mínimo de suas duas entradas. A operação é similar ao estágio de filtro de uniformização 80 na figura 7. No entanto, aqui um seletor de mínimo 95 ao invés de um seletor de máximo 81 é utilizado já que o estágio de filtro 94 uniformiza os valores de ganho ao invés de amostras de áudio (os valores de ganho são derivados pela inversão das amostras de áudio). Um estágio de filtro de uniformização 80 pode ser utilizado ao invés quando sendo colocado a montante do bloco 92 (o qual determina os valores de ganho por inversão). Analogamente, o estágio de filtro de uniformização 94 pode ser utilizado nas figuras 4 e 5 quando sendo colocado a jusante dos blocos 61 e/ou 61' (já que a jusante dos blocos 61 e/ou 61', os sinais de ganho são processados). O estágio de filtro de uniformização 94 uniformiza a rampa de sinal no caso de um aumento abrupto do valor de ganho no bloco 93 (de outro modo, o áudio pode soar irritante). Em contraste, o estágio de filtro de uniformização 94 deixa o sinal de ganho passar sem uniformização no caso de uma redução abrupta do valor de ganho (de outro modo, o sinal seria ceifado). O sinal de ganho computado 96 na saída do estágio de filtro de uniformização 95 comparado com as palavras de ganho que entram 90 no seletor de mínimo 97. O mínimo do valor de ganho computado 96 real e da palavra de ganho que entra 90 real é passado para a saída do seletor de mínimo 97. Os valores de ganho 98 na saída do seletor de mínimo 97 proveem a proteção de downmix e podem ser embutidos em um fluxo de áudio transcodificado como anteriormente discutido.
[00094] Deve ser notado que a modalidade na figura 8 não faz parte necessariamente de um transcodificador de áudio. Os valores de ganho de saída podem ser diretamente utilizados para ajustar o nível do
Petição 870190114541, de 08/11/2019, pág. 47/50
35/37 fluxo de áudio recebido. Neste caso, o aparelho da figura 8 pode fazer parte de um AVR ou um aparelho de TV.
[00095] Mais ainda, a modalidade na figura 8 pode ser utilizada para impedir o ceifamento de sinal sem considerar o downmixing. Por exemplo, a modalidade na figura 8 pode receber as amostras de áudio de PCM 91 convencionais sem um pré-processamento adicional no bloco 50. Neste caso, a modalidade na figura 8 impede o ceifamento quando as amostras de PCM 91 são amplificadas pelos valores de ganho de saída.
[00096] A figura 9 ilustra outra modalidade alternativa. Os elementos figurativos nas figuras 8 e 9 denotados pelos mesmos símbolos de referência são basicamente os mesmos. Em contraste com a modalidade na figura 8, a modalidade na figura 9 é uma versão de operação no sentido de bloco como as modalidades nas figuras 4 e 6, onde somente uma divisão é executada por bloco de sinal (ou qualquer outro segmento de dados como quadro). Isto reduz o número de divisões por tempo. Como já discutido em conexão com a figura 8, as amostras de áudio 91 podem ser geradas pelo bloco 50 na figura 3. Se as amostras de áudio 91 não forem valores absolutos, os valores absolutos das amostras de áudio 91 podem ser determinados anteriormente (não mostrado na figura 9). As amostras de áudio 91 são então alimentadas para um estágio de filtro de uniformização 80 o qual corresponde ao estágio de filtro de uniformização 80 na figura 7. Em contraste com a figura 8, o estágio de filtro de uniformização 80 processa as amostras de áudio ao invés de amostras de ganho. Assim, o estágio de filtro de uniformização 80 utiliza um seletor de máximo 81 ao invés de um seletor de mínimo 95. Após a uniformização, o máximo das amostras por bloco de áudio é determinado na unidade 100. Então, o valor máximo é invertido no bloco 101, por meio disto computando o ganho permissível máximo por bloco. Este valor de ganho é comparado com o valor
Petição 870190114541, de 08/11/2019, pág. 48/50
36/37 de ganho corrente 90 no seletor de mínimo 97, com o mínimo de ambos os valores sendo passado para a saída do seletor de mínimo 97. Os valores de ganho 98 na saída do seletor de mínimo 97 proveem a proteção de ceifamento de downmix e podem ser embutidos em um fluxo de áudio transcodificado como anteriormente discutido. A modalidade na figura 9 pode ser modificada para gerar um valor de ganho 98 em um modo similar quando nenhum valor de ganho que entra 90 está presente: se nenhum valor de ganho que entra 90 estiver presente e o ganho computado for menor ou igual a 1, o valor de ganho computado é emitido. No caso do valor de ganho computado ser maior do que 1 (e nenhum valor de ganho que entra 90 está presente), um valor de ganho que tem um ganho de 1 é emitido. Isto pode ser realizado pelo comutador 63 adicional da figura 6, com o comutador comutando entre o valor de ganho que entra 90 e um ganho de 1 na dependência da presença do valor de ganho que entra 90.
[00097] Deve ser notado que as modalidades como anteriormente discutidas correspondem a um limitador que respeita os valores de ganho que vêm de uma instância de compressor diferente.
[00098] A figura 10 ilustra um dispositivo de recepção que recebe o fluxo de áudio transcodificado 14 como gerado pelo transcodificador da figura 1. O bloco 121 separa os valores de ganho 11 do fluxo de áudio 14. O dispositivo de recepção ainda compreende um decodificador 110 o qual gera um sinal de áudio decodificado 120. A amplitude do sinal de áudio decodificado 120 é ajustada no bloco 112 pelos valores de ganho 11 como derivado na figura 1. No caso em que um downmix opcional é executada no bloco 113, o sinal de saída 114 não é ceifado já que os valores de ganho 11 são suficientes para impedir o ceifamento de sinal no caso de um downmix. A amplitude do sinal de áudio decodificado 120 pode ser adicionalmente ajustada pelo PRL (não mostrado). No caso que os valores de ganho 11 também conside
Petição 870190114541, de 08/11/2019, pág. 49/50
37/37 rem uma intensificação de 11 dB no modo de RF como discutido em conexão com a figura 6, o sinal de áudio 120 pode ser também intensificado por 11 dB sem ser ceifado (tanto no caso de um downmix de sinal quanto no caso de nenhum downmix de sinal).

Claims (14)

  1. REIVINDICAÇÕES
    1. Método para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital, o método caracterizado pelo fato de que compreende:
    - determinar se os primeiros valores de ganho (4) com base em metadados de áudio recebidos são suficientes para proteção contra o ceifamento do sinal de áudio, os metadados de áudio recebidos embutidos em um primeiro fluxo de áudio digital (1);
    - computar segundos valores de ganho (9) com base nos dados de áudio digital, os segundos valores de ganho (9) suficientes para a proteção de ceifamento do sinal de áudio; e
    - comparar os primeiros valores de ganho (4) com base nos metadados de áudio recebidos e os segundos valores de ganho computados (9); e
    - em dependência da etapa de comparação, selecionar valores de ganho (11) dos primeiros valores de ganho (4) e dos segundos valores de ganho computados (9), de modo que os valores de ganho (11) sejam suficientes para a proteção contra o ceifamento do sinal de áudio; em que os valores de ganho (4, 9, 11) são suficientes para a proteção contra o ceifamento se a aplicação dos valores de ganho (4, 9, 11) impedem que uma amplitude do sinal de áudio exceda um valor máximo ou mínimo representável.
  2. 2. Método, de acordo com a reivindicação 1, caracterizado pelo fato de que a etapa de computar segundos valores de ganho (9) compreende:
    - determinar valores de ganho máximo permitidos.
  3. 3. Método, de acordo com a reivindicação 1 ou 2, caracterizado pelo fato de que o mínimo de um par de primeiros (4) e segundos (9) valores de ganho é selecionado.
  4. 4. Método, de acordo com qualquer uma das reivindicações
    Petição 870190114541, de 08/11/2019, pág. 4/50
    2/5
    1 a 3, caracterizado pelo fato de que o método é executado no curso de transcodificar
    - o primeiro fluxo de áudio (1) codificado em um primeiro formato de codificação de áudio em
    - um segundo fluxo de áudio (14) codificado em um segundo formato de codificação de áudio diferente do primeiro formato de codificação de áudio, o segundo fluxo de áudio (14) compreendendo metadados de áudio que têm os valores de ganho (11) selecionados suficientes para a proteção contra o ceifamento do sinal de áudio ou que têm valores de ganho (11) derivados destes.
  5. 5. Método, de acordo com qualquer uma das reivindicações 1 a 4, caracterizado pelo fato de que o sinal de áudio é um sinal de áudio que sofreu downmix e o método provê proteção contra o ceifamento de sinal do sinal que sofreu downmix.
  6. 6. Método, de acordo com qualquer uma das reivindicações
    1 a 5, caracterizado pelo fato de que a etapa de determinar se os primeiros valores de ganho (4) são suficientes para a proteção compreende a etapa de:
    - realizar downmix dos dados de áudio digital de acordo com pelo menos um primeiro esquema de downmixing.
  7. 7. Método, de acordo com a reivindicação 6, caracterizado pelo fato de que a etapa de determinar se os primeiros valores de ganho (4) são suficientes para a proteção compreende a etapa de:
    - computar os valores de pico, em que um valor de pico é computado determinando o máximo dos valores absolutos de pelo menos dois sinais de áudio de cada vez, os pelo menos dois sinais de áudio selecionados do grupo seguinte de:
    - um ou mais sinais de áudio após o downmixing de acordo com o primeiro esquema de downmixing,
    - um ou mais sinais de áudio antes do downmixing, e
    Petição 870190114541, de 08/11/2019, pág. 5/50
    3/5
    - um ou mais sinais de áudio após o downmixing de acordo com um segundo esquema de downmixing.
  8. 8. Método, de acordo com qualquer uma das reivindicações 1 a 7, caracterizado pelo fato de que a etapa de determinar se os primeiros valores de ganho (4) são suficientes para a proteção compreende a etapa de:
    - determinar o máximo de uma pluralidade de valores de sinal consecutivos derivados dos dados de áudio digital.
  9. 9. Método, de acordo com a reivindicação 8, caracterizado pelo fato de que a etapa de determinar se os primeiros valores de ganho (4) são suficientes para a proteção compreende a etapa de:
    - computar os valores de pico, em que um valor de pico é computado determinando o máximo dos valores absolutos de pelo menos dois sinais de áudio de cada vez, os pelo menos dois sinais de áudio selecionados do grupo seguinte de:
    - um ou mais sinais de áudio após o downmixing de acordo com o primeiro esquema de downmixing,
    - um ou mais sinais de áudio antes do downmixing, e
    - um ou mais sinais de áudio após o downmixing de acordo com um segundo esquema de downmixing, e em que a pluralidade de valores de sinal consecutivos corresponde a valores de pico consecutivos ou valores de pico filtrados consecutivos.
  10. 10. Aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital, caracterizado pelo fato de que compreende:
    - um meio de determinação (8, 10) para determinar se os primeiros valores de ganho (4) com base em metadados de áudio recebidos são suficientes para proteção contra o ceifamento do sinal de
    Petição 870190114541, de 08/11/2019, pág. 6/50
    4/5 áudio, os metadados de áudio recebidos embutidos em um primeiro fluxo de áudio digital (1); e
    - um meio de computação (8) para computar segundos valores de ganho (9) com base nos metadados de áudio recebidos e os segundos valores de ganho (9) computados; e
    - um meio de comparação (10) para comparar os primeiros valores de ganho (4) com base nos metadados de áudio recebidos e os segundos valores de ganho computados (9);
    - um meio de seleção (10) para selecionar valores de ganho (11) dos primeiros valores de ganho (4) e dos segundos valores de ganho computados (9) em dependência do meio de comparação (10), de modo que os valores de ganho (11) sejam suficientes para a proteção contra o ceifamento do sinal de áudio; em que os valores de ganho (4, 9, 11) são suficientes para a proteção contra o ceifamento se a aplicação dos valores de ganho (4, 9, 11) impedem que uma amplitude do sinal de áudio exceda um valor máximo ou mínimo representável.
  11. 11. Aparelho, de acordo com a reivindicação 10, caracterizado pelo fato de que o aparelho faz parte de um transcodificador, o transcodificador configurado para transcodificar o primeiro fluxo de áudio (1) codificado em um primeiro formato de codificação de áudio em um segundo fluxo de áudio (14) codificado em um segundo formato de codificação de áudio diferente do primeiro formato de codificação de áudio, o segundo fluxo de áudio (14) compreendendo os metadados de áudio que têm os valores de ganho substituídos (11) suficientes para a proteção contra o ceifamento do sinal de áudio ou que têm valores de ganho (11) derivados destes.
  12. 12. Aparelho, de acordo com a reivindicação 10 ou 11, caracterizado pelo fato de que o sinal de áudio é um sinal de áudio que sofreu downmix e o aparelho provê proteção contra o ceifamento de sinal do sinal que sofreu downmix.
    Petição 870190114541, de 08/11/2019, pág. 7/50
    5/5
  13. 13. Transcodificador, caracterizado pelo fato de que é configurado para transcodificar um primeiro fluxo de áudio (1) codificado em um primeiro formato de codificação de áudio em um segundo fluxo de áudio (14) codificado em um segundo formato de codificação de áudio, o transcodificador compreendendo o aparelho conforme definido em qualquer uma das reivindicações 10 a 12.
  14. 14. Método para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital, caracterizado pelo fato de que o método é executado no curso de transcodificar
    - um primeiro fluxo de áudio (1) codificado em um primeiro formato de codificação de áudio em
    - um segundo fluxo de áudio (14) codificado em um segundo formato de codificação de áudio diferente do primeiro formato de codificação de áudio, e em que no caso de nenhum metadado relativo ao controle de faixa dinâmica estar presente no primeiro fluxo de áudio, valores de ganho (11) suficientes para a proteção contra o ceifamento do sinal de áudio são adicionados no segundo fluxo de áudio, pela computação dos valores de ganho (11) com base nos dados de áudio digital compreendidos no primeiro fluxo de áudio (1); em que os valores de ganho (11) são suficientes para a proteção contra o ceifamento se a aplicação dos valores de ganho (11) impedem que uma amplitude do sinal de áudio exceda um valor máximo ou mínimo representável.
BRPI0919880-6A 2008-10-29 2009-10-26 Método e aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital e transcodificador BRPI0919880B1 (pt)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US10943308P 2008-10-29 2008-10-29
US61/109,433 2008-10-29
PCT/US2009/062004 WO2010053728A1 (en) 2008-10-29 2009-10-26 Signal clipping protection using pre-existing audio gain metadata

Publications (2)

Publication Number Publication Date
BRPI0919880A2 BRPI0919880A2 (pt) 2015-12-15
BRPI0919880B1 true BRPI0919880B1 (pt) 2020-03-03

Family

ID=41508867

Family Applications (1)

Application Number Title Priority Date Filing Date
BRPI0919880-6A BRPI0919880B1 (pt) 2008-10-29 2009-10-26 Método e aparelho para prover proteção contra o ceifamento de sinal de um sinal de áudio derivado de dados de áudio digital e transcodificador

Country Status (9)

Country Link
US (1) US8892450B2 (pt)
EP (5) EP4528726B1 (pt)
JP (1) JP5603339B2 (pt)
CN (1) CN102203854B (pt)
BR (1) BRPI0919880B1 (pt)
ES (2) ES3016645T3 (pt)
RU (1) RU2468451C1 (pt)
TW (1) TWI416505B (pt)
WO (1) WO2010053728A1 (pt)

Families Citing this family (42)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2009086174A1 (en) 2007-12-21 2009-07-09 Srs Labs, Inc. System for adjusting perceived loudness of audio signals
TWI501580B (zh) 2009-08-07 2015-09-21 Dolby Int Ab 資料串流的鑑別
US8538042B2 (en) 2009-08-11 2013-09-17 Dts Llc System for increasing perceived loudness of speakers
TWI413110B (zh) 2009-10-06 2013-10-21 Dolby Int Ab 以選擇性通道解碼的有效多通道信號處理
WO2011048010A1 (en) 2009-10-19 2011-04-28 Dolby International Ab Metadata time marking information for indicating a section of an audio object
US9508356B2 (en) * 2010-04-19 2016-11-29 Panasonic Intellectual Property Corporation Of America Encoding device, decoding device, encoding method and decoding method
CN101951504B (zh) * 2010-09-07 2012-07-25 中国科学院深圳先进技术研究院 基于重叠边界的多媒体切片转码方法和系统
CN102005206B (zh) * 2010-11-16 2012-07-25 华平信息技术股份有限公司 多路音频帧的混音方法
TWI581250B (zh) * 2010-12-03 2017-05-01 杜比實驗室特許公司 利用多媒體處理節點之適應性處理技術
JP5719966B2 (ja) 2011-04-08 2015-05-20 ドルビー ラボラトリーズ ライセンシング コーポレイション 2つのエンコードされたビットストリームからのオーディオストリームの混合において使用するためのメタデータの自動設定
IN2014KN01222A (pt) * 2011-12-15 2015-10-16 Fraunhofer Ges Forschung
US9312829B2 (en) 2012-04-12 2016-04-12 Dts Llc System for adjusting loudness of audio signals in real time
US10844689B1 (en) 2019-12-19 2020-11-24 Saudi Arabian Oil Company Downhole ultrasonic actuator system for mitigating lost circulation
ES3064789T3 (en) 2012-05-18 2026-04-29 Dolby Laboratories Licensing Corp System and method for dynamic range control of an audio signal
CN102968995B (zh) * 2012-11-16 2018-10-02 新奥特(北京)视频技术有限公司 一种音频信号的混音方法及装置
EP2757558A1 (en) * 2013-01-18 2014-07-23 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Time domain level adjustment for audio signal decoding or encoding
BR112015017064B1 (pt) * 2013-01-21 2022-03-22 Dolby Laboratories Licensing Corporation Método, meio legível em computador e aparelho para otimizar o nível de intensidade do som e a faixa dinâmica através de dispositivos de reprodução diferentes
CA2898567C (en) * 2013-01-28 2018-09-18 Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. Method and apparatus for normalized audio playback of media with and without embedded loudness metadata on new media devices
US9715880B2 (en) 2013-02-21 2017-07-25 Dolby International Ab Methods for parametric multi-channel encoding
US9559651B2 (en) * 2013-03-29 2017-01-31 Apple Inc. Metadata for loudness and dynamic range control
WO2014165543A1 (en) 2013-04-05 2014-10-09 Dolby Laboratories Licensing Corporation Companding apparatus and method to reduce quantization noise using advanced spectral extension
TWM487509U (zh) 2013-06-19 2014-10-01 杜比實驗室特許公司 音訊處理設備及電子裝置
EP4683219A3 (en) 2013-09-12 2026-03-25 Dolby Laboratories Licensing Corporation Dynamic range control for a wide variety of playback environments
WO2015038522A1 (en) 2013-09-12 2015-03-19 Dolby Laboratories Licensing Corporation Loudness adjustment for downmixed audio content
AU2014339086B2 (en) * 2013-10-22 2017-12-21 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Concept for combined dynamic range compression and guided clipping prevention for audio devices
US9769550B2 (en) 2013-11-06 2017-09-19 Nvidia Corporation Efficient digital microphone receiver process and system
US9454975B2 (en) * 2013-11-07 2016-09-27 Nvidia Corporation Voice trigger
RU2658888C2 (ru) 2014-03-24 2018-06-25 Долби Интернэшнл Аб Способ и устройство для применения сжатия динамического диапазона к сигналу амбиофонии высшего порядка
BR112016021382B1 (pt) 2014-03-25 2021-02-09 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V dispositivo codificador de áudio e um dispositivo decodificador de áudio com codificação de ganho eficiente no controle de gama dinâmica
US9654076B2 (en) 2014-03-25 2017-05-16 Apple Inc. Metadata for ducking control
CN113035214B (zh) * 2014-09-12 2024-07-09 索尼公司 接收装置
CN119132317A (zh) * 2014-10-01 2024-12-13 杜比国际公司 高效drc配置文件传输
FR3031852B1 (fr) * 2015-01-19 2018-05-11 Devialet Amplificateur a reglage de niveau sonore automatique
US10553228B2 (en) * 2015-04-07 2020-02-04 Dolby International Ab Audio coding with range extension
KR20160132574A (ko) * 2015-05-11 2016-11-21 현대자동차주식회사 자동이득제어모듈, 그 제어방법, 이를 포함하는 차량, 및 그 제어방법
US10109288B2 (en) * 2015-05-27 2018-10-23 Apple Inc. Dynamic range and peak control in audio using nonlinear filters
US10015612B2 (en) 2016-05-25 2018-07-03 Dolby Laboratories Licensing Corporation Measurement, verification and correction of time alignment of multiple audio channels and associated metadata
CN109005452A (zh) * 2018-10-09 2018-12-14 深圳市亿联智能有限公司 一种应用于智能机顶盒的串行混音方法
KR102837743B1 (ko) 2018-11-13 2025-07-23 돌비 레버러토리즈 라이쎈싱 코오포레이션 오디오 신호 및 연관된 메타데이터에 의해 공간 오디오를 표현하는 것
ES2974219T3 (es) 2018-11-13 2024-06-26 Dolby Laboratories Licensing Corp Procesamiento de audio en servicios de audio inversivos
US12177646B2 (en) * 2020-05-26 2024-12-24 Dolby International Ab Main-associated audio experience with efficient ducking gain application
CN112153533B (zh) * 2020-09-25 2021-09-07 展讯通信(上海)有限公司 音频信号的破音消除方法及装置、存储介质、终端

Family Cites Families (34)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5821889A (en) * 1996-11-06 1998-10-13 Sabine, Inc. Automatic clip level adjustment for digital processing
US6131084A (en) * 1997-03-14 2000-10-10 Digital Voice Systems, Inc. Dual subframe quantization of spectral magnitudes
US20050120870A1 (en) * 1998-05-15 2005-06-09 Ludwig Lester F. Envelope-controlled dynamic layering of audio signal processing and synthesis for music applications
JP2000181477A (ja) * 1998-12-14 2000-06-30 Olympus Optical Co Ltd 音声処理装置
US6675125B2 (en) * 1999-11-29 2004-01-06 Syfx Statistics generator system and method
JP4251769B2 (ja) 2000-11-15 2009-04-08 ヤマハ株式会社 ディジタルオーディオアンプ
US6704704B1 (en) * 2001-03-06 2004-03-09 Microsoft Corporation System and method for tracking and automatically adjusting gain
WO2003063346A2 (en) * 2002-01-24 2003-07-31 Koninklijke Philips Electronics N.V. A method for decreasing the dynamic range of a signal and electronic circuit
JP2003280691A (ja) * 2002-03-19 2003-10-02 Sanyo Electric Co Ltd 音声処理方法および音声処理装置
US20050228648A1 (en) * 2002-04-22 2005-10-13 Ari Heikkinen Method and device for obtaining parameters for parametric speech coding of frames
RU2325046C2 (ru) * 2002-07-16 2008-05-20 Конинклейке Филипс Электроникс Н.В. Аудиокодирование
JP2004214843A (ja) * 2002-12-27 2004-07-29 Alpine Electronics Inc デジタルアンプ及びそのゲイン調整方法
DE10344638A1 (de) * 2003-08-04 2005-03-10 Fraunhofer Ges Forschung Vorrichtung und Verfahren zum Erzeugen, Speichern oder Bearbeiten einer Audiodarstellung einer Audioszene
US7394903B2 (en) * 2004-01-20 2008-07-01 Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. Apparatus and method for constructing a multi-channel output signal or for generating a downmix signal
JP2007524124A (ja) * 2004-02-16 2007-08-23 コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ トランスコーダ及びそのための符号変換方法
CN1930914B (zh) * 2004-03-04 2012-06-27 艾格瑞系统有限公司 对多声道音频信号进行编码和合成的方法和装置
US7617109B2 (en) * 2004-07-01 2009-11-10 Dolby Laboratories Licensing Corporation Method for correcting metadata affecting the playback loudness and dynamic range of audio information
EP1691348A1 (en) * 2005-02-14 2006-08-16 Ecole Polytechnique Federale De Lausanne Parametric joint-coding of audio sources
US8290181B2 (en) * 2005-03-19 2012-10-16 Microsoft Corporation Automatic audio gain control for concurrent capture applications
TW200638335A (en) * 2005-04-13 2006-11-01 Dolby Lab Licensing Corp Audio metadata verification
US8116485B2 (en) * 2005-05-16 2012-02-14 Qnx Software Systems Co Adaptive gain control system
CN101199015A (zh) * 2005-06-15 2008-06-11 Lg电子株式会社 记录介质、用于混合音频数据的装置及其方法
ATE523877T1 (de) * 2005-07-14 2011-09-15 Koninkl Philips Electronics Nv Audiodecodierung
US7464029B2 (en) * 2005-07-22 2008-12-09 Qualcomm Incorporated Robust separation of speech signals in a noisy environment
US7760886B2 (en) * 2005-12-20 2010-07-20 Fraunhofer-Gesellschaft zur Foerderung der Angewandten Forscheng e.V. Apparatus and method for synthesizing three output channels using two input channels
WO2007091849A1 (en) * 2006-02-07 2007-08-16 Lg Electronics Inc. Apparatus and method for encoding/decoding signal
US8488811B2 (en) * 2006-08-09 2013-07-16 Dolby Laboratories Licensing Corporation Audio-peak limiting in slow and fast stages
JP2008197199A (ja) * 2007-02-09 2008-08-28 Matsushita Electric Ind Co Ltd オーディオ符号化装置及びオーディオ復号化装置
MX2008012986A (es) * 2007-02-14 2008-11-28 Lg Electronics Inc Metodos y aparatos para codificar y decodificar señales de audio basadas en objetos.
JPWO2009116150A1 (ja) * 2008-03-19 2011-07-21 パイオニア株式会社 倍音生成装置、音響装置及び倍音生成方法
US8208659B2 (en) * 2008-03-27 2012-06-26 Analog Devices Bv Method and apparatus for scaling signals to prevent amplitude clipping
US8094809B2 (en) * 2008-05-12 2012-01-10 Visteon Global Technologies, Inc. Frame-based level feedback calibration system for sample-based predictive clipping
US8798776B2 (en) 2008-09-30 2014-08-05 Dolby International Ab Transcoding of audio metadata
KR101722747B1 (ko) 2015-02-25 2017-04-03 주식회사 제일메디칼코퍼레이션 본 플레이트 시스템

Also Published As

Publication number Publication date
JP5603339B2 (ja) 2014-10-08
EP4528726B1 (en) 2026-03-18
JP2012507059A (ja) 2012-03-22
EP4293665A3 (en) 2024-01-10
CN102203854A (zh) 2011-09-28
EP4293665A2 (en) 2023-12-20
EP4293665B1 (en) 2025-01-22
EP3217395A1 (en) 2017-09-13
TWI416505B (zh) 2013-11-21
EP2353161A1 (en) 2011-08-10
EP3217395B1 (en) 2023-10-11
ES3016645T3 (en) 2025-05-09
US20110208528A1 (en) 2011-08-25
RU2468451C1 (ru) 2012-11-27
ES2963744T3 (es) 2024-04-01
EP4528726A1 (en) 2025-03-26
EP4730328A2 (en) 2026-04-22
TW201042637A (en) 2010-12-01
EP2353161B1 (en) 2017-05-24
EP4730328A3 (en) 2026-04-29
WO2010053728A1 (en) 2010-05-14
CN102203854B (zh) 2013-01-02
US8892450B2 (en) 2014-11-18
BRPI0919880A2 (pt) 2015-12-15

Similar Documents

Publication Publication Date Title
US8892450B2 (en) Signal clipping protection using pre-existing audio gain metadata
US12183355B2 (en) System and method for non-destructively normalizing loudness of audio signals within portable devices
JP7717925B2 (ja) 多様な再生環境のためのダイナミックレンジ制御
US11379178B2 (en) Loudness control for user interactivity in audio coding systems
JP5129888B2 (ja) トランスコード方法、トランスコーディングシステム及びセットトップボックス
US11545166B2 (en) Using metadata to aggregate signal processing operations
KR20110058801A (ko) 멀티채널 사운드 시스템에서의 멀티채널 프로세싱 방법
HK40096159A (en) Signal clipping protection using pre-existing audio gain metadata
HK40096159B (en) Signal clipping protection using pre-existing audio gain metadata
HK40117482A (en) Signal clipping protection using pre-existing audio gain metadata
HK1237985B (en) Signal clipping protection using pre-existing audio gain metadata
HK1237985A1 (en) Signal clipping protection using pre-existing audio gain metadata

Legal Events

Date Code Title Description
B15K Others concerning applications: alteration of classification

Ipc: G10L 19/16 (2013.01), G10L 19/008 (2013.01)

B06F Objections, documents and/or translations needed after an examination request according [chapter 6.6 patent gazette]
B06U Preliminary requirement: requests with searches performed by other patent offices: procedure suspended [chapter 6.21 patent gazette]
B09A Decision: intention to grant [chapter 9.1 patent gazette]
B16A Patent or certificate of addition of invention granted [chapter 16.1 patent gazette]

Free format text: PRAZO DE VALIDADE: 10 (DEZ) ANOS CONTADOS A PARTIR DE 03/03/2020, OBSERVADAS AS CONDICOES LEGAIS.

B25G Requested change of headquarter approved

Owner name: DOLBY INTERNATIONAL AB (IE)