JP7735537B2 - ユーザ生成コンテンツにおける環境ノイズの検出 - Google Patents

ユーザ生成コンテンツにおける環境ノイズの検出

Info

Publication number
JP7735537B2
JP7735537B2 JP2024508330A JP2024508330A JP7735537B2 JP 7735537 B2 JP7735537 B2 JP 7735537B2 JP 2024508330 A JP2024508330 A JP 2024508330A JP 2024508330 A JP2024508330 A JP 2024508330A JP 7735537 B2 JP7735537 B2 JP 7735537B2
Authority
JP
Japan
Prior art keywords
noise
audio signal
confidence score
clip
features
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
JP2024508330A
Other languages
English (en)
Other versions
JP2024532759A (ja
Inventor
ヤーン,ズーユイ
シュワーン,ジーウエイ
ルゥ,リエ
Original Assignee
ドルビー ラボラトリーズ ライセンシング コーポレイション
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by ドルビー ラボラトリーズ ライセンシング コーポレイション filed Critical ドルビー ラボラトリーズ ライセンシング コーポレイション
Publication of JP2024532759A publication Critical patent/JP2024532759A/ja
Application granted granted Critical
Publication of JP7735537B2 publication Critical patent/JP7735537B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208—Noise filtering
    • G10L21/0216—Noise filtering characterised by the method used for estimating noise
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208—Noise filtering
    • G10L21/0264—Noise filtering characterised by the type of parameter measurement, e.g. correlation techniques, zero crossing techniques or predictive techniques

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Circuit For Audible Band Transducer (AREA)

Description

本出願は、2021年8月26日に出願されたPCT国際出願第PCT/CN2021/114746号、2021年9月15日に出願された米国仮出願第63/244,495号、および2021年11月3日に出願された欧州特許出願第21206205.3号からの優先権の利益を主張するものであり、それら各々は、その全体が参照により本明細書に組み込まれる。
[技術分野]
本開示は、オーディオ処理に関し、特に、ノイズリダクションに関する。
本明細書で別段に示されない限り、このセクションで説明される手法は、本出願の特許請求の範囲に対する先行技術ではなく、このセクションに含めることによって先行技術であると認められるものではない。
オーディオ、ビデオ、および組み合わされたオーディオ/ビデオを含むマルチメディアコンテンツは、エンターテインメントの分野において常に重要であった。コンテンツの中でも、映画およびテレビ番組に代表される専門家生成コンテンツ(PGC)は、以前はマルチメディアコンテンツの主要な形態であった。しかしながら、近年、ユーザ生成コンテンツ(UGC)が急激に増加している。これは、キャプチャデバイス、ネットワークプラットフォーム、および再生側技法の急速な発展の恩恵を受けている。キャプチャデバイスの面では、スマートフォンおよびタブレットに代表されるポータブルデバイスが一般的になってきている。ユーザは、搭載されているカメラおよびマイクロフォンを用いて、個別にUGCをキャプチャし、作成することができる。加えて、一般的なビデオウェブサイトおよび新たな(arising)モバイルアプリケーションなどの様々なプラットフォームが、UGCの普及を大いに加速させている。
視覚的および聴覚的経験を向上させる目的で、コンテンツ再生のための多数の技法が開発されてきた。音質を高めるために再生中にDolby(商標)Audio Processingなどのオーディオ処理技法が適用され得る。オーディオ処理システムは、主にPGCに焦点を当ててきたが、UGCの人気の高まりにより、UGCにもオーディオ処理を適用する機会が提供される。
米国特許第9,064,497号 米国特許第9,107,010号 米国特許第9,984,701号 米国特許第8,682,250号 米国特許第8,238,497号 米国特許第6,859,773号 米国特許第7,171,246号 米国特許第7,684,982号 米国特許第9,633,671号 米国特許第9,769,564号 米国特許第7,464,029号 米国特許第9,711,130号 米国特許第8,325,939号 米国特許第9,609,416号 米国特許第9,934,791号 米国特許出願公開第2016/0155434号 米国特許出願公開第2020/0125316号 米国特許出願公開第2020/0020312号
Fatemeh Saki, Abhishek Sehgal, Issa Panahi and Nasser Kehtarnavaz, "Smartphone-Based Real-Time Classification of Noise Signals using Subband Features and Random Forest Classifier", in 2016 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), DOI 10.1109/ICASSP.2016.7472068. Vanishree Gopalakrishna, Nasser Kehtarnavaz, Taher S. Mirzahasanloo and Philipos C. Loizou, "Real-Time Automatic Tuning of Noise Suppression Algorithms for Cochlear Implant Applications", in IEEE Transactions on Biomedical Engineering (Volume: 59, Issue: 6, June 2012), DOI 10.1109/TBME.2012.2191968. Fatemeh Saki and Nasser Kehtarnavaz, "Background noise classification using random forest tree classifier for cochlear implant applications", in 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), DOI 10.1109/ICASSP.2014.6854270. Fatemeh Saki, Taher Mirzahasanloo and Nasser Kehtarnavaz, "A multi-band environment-adaptive approach to noise suppression for cochlear implants", in Annu Int Conf IEEE Eng Med Biol Soc 2014, DOI 10.1109/EMBC.2014.6943934. Peipei Shen, Zhou Changjun and Xiong Chen, "Automatic Speech Emotion Recognition using Support Vector Machine", in Proceedings of 2011 International Conference on Electronic & Mechanical Engineering and Information Technology, DOI 10.1109/EMEIT.2011.6023178. Humaid Alshamsi, Veton Kepuska, Hazza Alshamsi and Hongying Meng, "Automated Speech Emotion Recognition on Smart Phones", in 2018 9th IEEE Annual Ubiquitous Computing, Electronics & Mobile Communication Conference (UEMCON), DOI 10.1109/UEMCON.2018.8796594.
既存のオーディオ処理システムに関する1つの問題は、PGCに使用される技法がUGCに使用される技法とは異なり得ることである。高音質のPGCとは対照的に、多くのUGCは低音質である。これは、非専門的な録音デバイス、複雑な環境、およびより少ない編集手順にものであり得る。品質の問題は、低い音声明瞭度、強い残響などを含むが、これらに限定されない。最も一般的な問題の1つは、UGCに含まれる環境ノイズ(以下、UGCノイズと呼ぶ)である。UGCノイズは、実際のシーンで携帯電話を使用することによって容易にキャプチャすることができる。一般に、UGCノイズは背景ノイズであり、したがって、無意味または不要である。したがって、UGCノイズは、特にほぼ定常的なノイズに対して、いかなる音量調整技法によってもブーストされないようにすべきである。というのも、この種のノイズをブーストすると、リスナーに明らかに知覚され、ユーザエクスペリエンスに悪影響を及ぼすからである。一方、コンテンツにUGCノイズが存在することをオーディオ処理システムが知っている場合、適切なノイズリダクション方法をUGCノイズに適用して、音質を高めることができる。
しかしながら、PGCも、ほぼ定常的なノイズ状コンテンツ(以下、PGCノイズと呼ぶ)を含む。PGCノイズは、一般に、映画における隣接する台詞区間間の背景音区間などのノイズ区間を含む場合がある。このPGCノイズは、通常、専門的な記録デバイスを用いて台詞から独立してキャプチャされ、コンテンツ作成段階においてオーディオミキサによって慎重に処理される。UGCノイズとは対照的に、PGCノイズは、コンテンツの一部であり、通常、アーチストおよびコンテンツ作成者の観点から望まれる。そのような場合、ノイズリダクション方法は適用されるべきではなく、音量調整(volume leveling)のような技法は、PGCノイズを安全にブーストすることができる。
その結果、UGCノイズおよびPGCノイズは、異なる方法で処理されるべきである。PGCノイズと区別しながらUGC定常ノイズを検出する方法が強く望まれている。そのような方法はさらに、オーディオコンテンツ再生のための後処理技法を操作するために使用することができる。実施形態は、2段階ノイズ分類システムを対象とする。
一実施形態によれば、オーディオ処理のコンピュータ実装方法は、オーディオ信号を受信するステップと、第1の機械学習モデルを使用してオーディオ信号の第1の信頼度スコアを計算するステップとを含む。本方法は、第1の信頼度スコアが非ノイズの存在を示すとき、第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップをさらに含む。本方法は、第1の信頼度スコアがノイズの存在を示すとき、第2の機械学習モデルを使用してオーディオ信号の第2の信頼度スコアを計算するステップをさらに含む。本方法は、第2の信頼度スコアがユーザ生成コンテンツ(UGC)ノイズの存在を示すとき、第2のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップをさらに含む。本方法は、第2の信頼度スコアが専門家生成コンテンツ(PGC)ノイズの存在を示すとき、第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップをさらに含む。
第1の信頼度スコアを計算するステップは、オーディオ信号から第1の複数の特徴を抽出するステップと、第1の機械学習モデルを使用して第1の複数の特徴を分類するステップと、第1の複数の特徴を分類した結果に基づいてノイズ信頼度スコアを計算するステップと、ノイズ信頼度スコアに基づいて重みを計算するステップとを含み得る。
第2の信頼度スコアを計算するステップは、オーディオ信号から第2の複数の特徴を抽出するステップであって、第2の複数の特徴は、第1の複数の特徴が抽出されるよりも長い時間期間にわたって抽出される、ステップと、第2の複数の特徴に基づいて第2の複数の統計を計算するステップであって、第2の複数の統計は、重みにしたがって重み付けされる、ステップと、第2の機械学習モデルを使用して第2の複数の特徴と第2の複数の統計とを分類するステップと、第2の複数の特徴と第2の複数の統計とを分類した結果に基づいて第2の信頼度スコアを計算するステップとを含み得る。
別の実施形態によれば、装置は、ラウドスピーカとプロセッサとを含む。プロセッサは、本明細書で説明される方法のうちの1つまたは複数を実装するように装置を制御するように構成される。本装置は、本明細書で説明される方法のうちの1つまたは複数の方法の詳細と同様の詳細を追加的に含み得る。
別の実施形態によれば、非一時的コンピュータ可読媒体は、プロセッサによって実行されると、本明細書で説明される方法のうちの1つまたは複数を含む処理を実行するように装置を制御するコンピュータプログラムを記憶する。
以下の詳細な説明および添付の図面は、様々な実装形態の性質および利点のさらなる理解を提供する。
ノイズ分類システム100のブロック図である。 ノイズ検出器102(図1参照)の詳細を示すブロック図である。 ノイズ弁別器(noise discriminator)104(図1参照)の詳細を示すブロック図である。 一実施形態による、本明細書で説明される特徴およびプロセスを実装するためのモバイルデバイスアーキテクチャ400である。 オーディオ処理の方法500のフローチャートである。
本明細書では、オーディオ処理に関する技法について説明する。以下の説明では、説明を目的として、本開示の完全な理解を提供するために、多数の例および具体的な詳細が記載されている。しかしながら、特許請求の範囲によって定義される本開示が、これらの例における特徴の一部または全部を単独で、または以下で説明する他の特徴と組み合わせて含んでもよく、本明細書で説明される特徴および概念の変更形態および均等物をさらに含んでもよいことは、当業者には明らかであろう。
以下の説明では、様々な方法、プロセスおよび手順が詳述される。特定のステップが特定の順序で説明され得るが、そのような順序は、主に便宜および明確性のためである。特定のステップは、2回以上繰り返されてもよく、別の順序で説明されている場合であっても、他のステップの前または後に行われてもよく、他のステップと並行して行われてもよい。第2のステップは、第1のステップを完了してから第2のステップを開始しなければならない場合にのみ、第1のステップに続くことが必要とされる。このような状況は、文脈から明らかでない場合に特に指摘される。
本明細書では、「および」、「または」および「および/または」という用語が使用される。そのような用語は、包括的な意味を有するものとして読まれるべきである。例えば、「AおよびB」は、少なくとも、「AおよびBの両方」、「少なくともAおよびBの両方」を意味し得る。別の例として、「AまたはB」は、少なくとも、「少なくともA」、「少なくともB」、「AおよびBの両方」、「少なくともAおよびBの両方」を意味し得る。別の例として、「Aおよび/またはB」は、少なくとも、「AおよびB」、「AまたはB」を意味し得る。排他的論理和が意図されるとき、例えば、「AまたはBのいずれか」、「AおよびBのうち多くとも1つ」といったように具体的に記される。
本明細書は、ブロック、要素、構成要素、回路などの構造に関連付けられた様々な処理機能を説明する。一般に、これらの構造は、1つまたは複数のコンピュータプログラムによって制御されるプロセッサによって実装され得る。
図1は、ノイズ分類システム100のブロック図である。一般に、ノイズ分類システム100は、オーディオ信号を受信し、ノイズ分類を実行し、ノイズ分類にしたがって、処理されたオーディオ信号を生成する。ノイズ分類システム100の構成要素は、プロセッサによって実行される1つまたは複数のコンピュータプログラムとして実装されてもよい。ノイズ分類システム100は、ノイズ検出器102と、ノイズ弁別器104と、PGCオーディオプロセッサ106と、UGCプロセッサ108とを含む。
ノイズ検出器102は、オーディオ信号120を受信し、ノイズ検出を実行する。ノイズ検出が、オーディオ信号120に、例えば、UGCノイズ、PGCノイズなどのノイズが含まれることを示すとき、ノイズ検出器102は、さらなる処理のために、オーディオ信号120をノイズ弁別器104に提供する。ノイズ検出が、オーディオ信号120に、例えば、音楽、スピーチなどの非ノイズが含まれることを示すとき、ノイズ検出器102は、さらなる処理のために、オーディオ信号120をPGCオーディオプロセッサ106に提供する。ノイズ検出器102のさらなる詳細は、図2を参照して提供される。
ノイズ弁別器104は、例えば、ノイズ検出器102からオーディオ信号120を受信し、ノイズ弁別を実行する。ノイズ弁別器104に提供されるオーディオ信号120は、ノイズ検出器102によって事前に「ノイズ」に分類されていることを想起されたい。ノイズ弁別104が、オーディオ信号120にPGCノイズが含まれていることを示すとき、ノイズ弁別器104は、さらなる処理のために、オーディオ信号120をPGCオーディオプロセッサ106に提供する。ノイズ弁別が、オーディオ信号120にUGCノイズが含まれていることを示すとき、ノイズ弁別器104は、さらなる処理のために、オーディオ信号120をUGCオーディオプロセッサ108に提供する。ノイズ弁別器104のさらなる詳細は、図3に提供される。
PGCオーディオプロセッサ106は、非ノイズを示すオーディオ信号120をノイズ検出器102から、またはPGCノイズを示すオーディオ信号120をノイズ弁別器104から受信し、第1のオーディオ処理プロセスにしたがってオーディオ処理を実行し、処理されたオーディオ信号130aを生成する。第1のオーディオ処理プロセスは、一般に、台詞強調、音量調整など、非ノイズオーディオに対して使用するのに適切であるオーディオ処理設定に対応する。例えば、リスナーが、例えばノイズ分類システム100を実装した自身の携帯電話で、処理されたオーディオ信号を出力するときに音量調整を実行することを望むとき、第1のオーディオ処理設定を使用することで、音量調整が適用された出力オーディオが得られる。第1のオーディオ処理設定はまた、リスナーの経験をコンテンツ作成者が意図したオーディオ経験に適合させる可能性が高いので、PGCノイズが検出されたときに使用するのに適切である。例えば、音量調整がリスナーによって所望される場合、音量調整をPGCに適用することが適切であろう。
UGCオーディオプロセッサ108は、UGCノイズを示すオーディオ信号120をノイズ弁別器104から受信し、第2のオーディオ処理プロセスにしたがってオーディオ処理を実行し、処理されたオーディオ信号130bを生成する。第2のオーディオ処理プロセスは、一般に、UGCノイズ、例えば、定常ノイズに使用するのに適切であるオーディオ処理設定に対応する。例えば、リスナーが、例えば、ノイズ分類システム100を実装した自身の携帯電話で、処理されたオーディオ信号を出力するときにノイズリダクションを実行することを望むとき、第2のオーディオ処理設定を使用することで、ノイズリダクションが適用された出力オーディオが得られる。UGCは多くの場合定常ノイズを有するので、このコンテンツに対してノイズリダクションを実行することで、リスナーエクスペリエンスの向上につながる。
以下の例を考える。音量調整およびノイズリダクションの両方がオーディオ出力に適用されることをユーザが望み、コンテンツが交通ノイズ、例えば、あるタイプの定常ノイズを含むと仮定する。リスナーが自身の携帯電話でハリウッド映画を見ている場合、コンテンツ作成者の芸術的意図を保つためには交通ノイズを過度に低減しないことが適切であるので、音量調整を実行することは適切であり、ノイズリダクションを実行することは適切ではない。この状況では、ノイズ分類システム100は、PGCノイズを検出し、第1のオーディオ処理設定を適用し、オーディオ出力を適切に出力する。リスナーが屋外で歩道を歩きながら撮影したビデオを見ている場合、音量調整を実行するときに交通ノイズをブーストするのではなく交通ノイズを低減することでリスナーエクスペリエンスが向上するので、音量調整とノイズリダクションの両方を実行することが適切である。この状況では、ノイズ分類システム100は、UGCノイズを検出し、第2のオーディオ処理設定を適用し、オーディオ出力を適切に出力する。
一般に、ノイズ分類システム100は、オーディオ信号120の部分を処理することによってリアルタイムで動作する。各部分は、クリップまたはオーディオクリップと呼ばれ、ノイズ分類システム100は、クリップごとにプロセスを実行し得る。各オーディオクリップは、定義された数の連続するオーディオフレームを含む。48kHzのサンプリングレートを有するオーディオを例にとると、オーディオフレームの典型的な持続時間は、1024サンプル、約21.34ミリ秒とすることができ、オーディオクリップは、重複していない48フレーム、約1.024秒を含むことができる。隣接するオーディオフレームは、重複したサンプルを含み得る。隣接するオーディオクリップも同様に、重複したフレームを含み得る。所与の入力オーディオクリップについて、ノイズ検出器102は、それがノイズ弁別器104に送られるべきノイズクリップであるかどうか、またはそれがノイズ弁別器104に送られるべきではない他のタイプ、例えば、スピーチ、音楽などに属するかどうかを決定する。
ノイズ分類システム100は、2段階ノイズ分類システムと呼ばれることがある。ノイズ検出器102は、第1段階とも呼ばれ、定義された数の定常ノイズ状フレームにしたがって所与のオーディオクリップを分類するように動作する。定常ノイズ状コンテンツは、UGCノイズとも呼ばれる、UGC内のキャプチャされた環境ノイズ、またはPGCノイズとも呼ばれる、PGCの一部であるノイズ状コンテンツのいずれかとすることができることに留意されたい。ノイズ弁別器104は、第2段階とも呼ばれ、ノイズ検出器102によって決定されたほぼ定常的なノイズクリップに対してトリガされる。ノイズ弁別器104は、UGCノイズ対PGCノイズの観点からノイズタイプを区別するように動作する。クリップがUGCノイズであると決定された場合、UGC処理経路をトリガすることとなり、UGCオーディオプロセッサ108を経由する。それ以外の場合、PGCコンテンツ処理のために調整された元の処理経路に残ることとなり、PGCオーディオプロセッサ106を経由する。
実際のコンテンツの場合、所与のオーディオクリップは、いくつかのノイズフレームおよび他のタイプのフレーム、例えば、スピーチ、音楽、一時的なサウンドイベントなどを含む可能性がある。言い換えると、純粋な定常ノイズクリップは一般的ではない。この問題に対処するために、ノイズ分類システム100は、所与のオーディオクリップのノイズ部分に焦点を当てるための注意のような機構を実装する。具体的には、各フレームについて、ノイズ検出器102は、図2にさらに詳述されるように、定常ノイズの可能性を示すためにフレーム重みを計算する。ノイズ検出器102は、分類と呼ばれるデータ駆動方法に基づいてフレーム重みを計算する。ノイズ検出器102は、フレーム重みを使用して、ほぼ定常的なノイズの可能性を示すクリップ信頼度を計算する。追加的に、オーディオクリップが、ノイズ検出器102によって決定されるようなほぼ定常的なノイズクリップである場合、フレーム重みはさらに、図3にさらに詳述されるように、ノイズ弁別器104において特徴計算を操作(steering)するために使用される。
図2は、ノイズ検出器102(図1参照)の詳細を示すブロック図である。一般に、ノイズ検出器102は、オーディオ信号を受信し、ノイズ分類を実行し、ノイズ分類にしたがって信頼度スコアを生成する。ノイズ検出器102の構成要素は、プロセッサによって実行される1つまたは複数のコンピュータプログラムとして実装され得る。ノイズ検出器102は、特徴抽出器202と、分類器204と、モデル206と、決定器208と、オプションで二乗平均平方根(RMS)計算器210とを含む。
特徴抽出器202は、オーディオ信号120を受信し、オーディオ信号120から特徴220を抽出し、特徴220を分類器204に提供する。上述したように、オーディオ信号120は、入力オーディオ信号のオーディオクリップ、例えば、48フレーム(重複していなくてもよい)に対応し、特徴抽出器202は、「ショートクリップ」と呼ばれるオーディオクリップの部分、例えば、48フレーム未満に対して動作する。現在のフレームだけを使用するのではなくショートクリップを使用することで、ノイズ信頼度スコアを計算する際の一般化能力が向上し得る。ここで、「一般化(generalization)」とは、ノイズ検出器102が、以前には見られなかった新しいデータに適応する能力を指す。ショートクリップは、クリップの現在のフレームと、いくつかの履歴フレームとを含み得る。例えば、ショートクリップは、5つの連続するフレーム、例えば、現在のフレームと4つの前のフレームとを含み得る。現在のショートクリップは、前のショートクリップと重複することがある。例えば、重複は、1フレームのホップサイズを有し得る。言い換えると、ショートクリップは、ステップごとに1フレーム移動する。一例として、48フレームを有する所与のクリップの場合、あるショートクリップはフレーム1~5、別のショートクリップはフレーム2~6、別のショートクリップはフレーム3~7、以下同様であり、別のショートクリップはフレーム44~48である。各フレームは、一般にショートクリップに対応するそのコンテキスト、例えば、そのフレーム自体と4つの前のフレームとによって表され、特徴は、このコンテキストから抽出され、分類はまた、このコンテキストに基づいて実行される。このように、ノイズ検出器102は、ショートクリップごとに動作する。
特徴220は、ショートクリップのオーディオ特徴に対応する。これらのオーディオ特徴は、時間的特徴、スペクトル特徴、時間周波数特徴などのうちの1つまたは複数を含む。時間的特徴は、自動補正係数(ACC)、線形予測コーディング係数(LPCC)、ゼロ交差率(ZCR)などのうちの1つまたは複数を含み得る。スペクトル特徴は、スペクトル重心、スペクトルロールオフ、スペクトルエネルギー分布、スペクトル平坦性、スペクトルエントロピー、メル周波数ケプストラム係数(MFCC)などのうちの1つまたは複数を含み得る。時間周波数特徴は、スペクトルフラックス、クロマなどのうちの1つまたは複数を含み得る。特徴220はまた、上記で説明した他の特徴の統計を含み得る。これらの統計は、平均、標準偏差、および高次統計、例えば、歪度、尖度などを含んでいてもよい。例えば、特徴220は、スペクトルエネルギー分布の平均および標準偏差を含み得る。
分類器204は、特徴220を受信し、モデル206を使用して特徴220の分類を実行し、ノイズ信頼度スコア222を生成する。所与のクリップ中の各フレームについて、分類器204は、ショートクリップに対応する、そのフレーム(例えば、現在のフレーム)および4つの前のフレームのコンテキストに基づいて、各フレームに対するノイズ信頼度スコア222を計算し得る。ノイズ信頼度スコア222は、0から1までの範囲であり得、スコアが高いほど、ノイズフレームの可能性が高いことを意味し、その逆も同様である。
分類器204は、機械学習システムに対応し得、モデル206は、機械学習モデルに対応し得る。モデル206は、データ駆動方法によって取得されていてもよく、モデル206は、ポジティブトレーニングデータ、例えば、UGCノイズおよびPGCノイズの両方を含む「ノイズ」データと、ネガティブトレーニングデータ、例えば、音楽、スピーチなどの「非ノイズ」データとを含むトレーニングデータのセットを使用してオフラインでトレーニングされていてもよい。言い換えると、トレーニングデータは、様々なカテゴリ、例えば、UGCノイズ、PGCノイズ、非ノイズにタグ付けされており、モデル206は、モデル206がトレーニングプロセス中にトレーニングデータにさらされた結果として得られる。その結果、「PGC」の1つの定義は、「専門家生成コンテンツであるとしてトレーニングプロセスにおいてタグ付けされたデータ」であり、「PGCノイズ」の1つの定義は、「専門家生成コンテンツであるとしてトレーニングプロセスにおいてタグ付けされ、ノイズを有するデータ」であり、「UGC」の1つの定義は、「専門家生成コンテンツ以外であるとしてトレーニングプロセスにおいてタグ付けされたデータ」であり、「UGCノイズ」の1つの定義は、「専門家生成コンテンツ以外であるとしてトレーニングプロセスにおいてタグ付けされ、ノイズを有するデータ」である。許容可能な結果を提供するトレーニングデータの量は、50時間のトレーニングデータである。この量は必要に応じて変えることができ、量を減らすとモデルの精度が低下する可能性があり、量を増やすとモデルの精度が向上する可能性がある。一般に、特徴抽出器202によって抽出された特徴220は、モデル206をトレーニングするときに使用される特徴、例えば、各ショートクリップから抽出された特徴に対応する。
分類器204は、適応ブースティング(AdaBoost)システム、ディープニューラルネットワーク(DNN)システムなどを含む様々な機械学習システムを実装し得る。一般に、AdaBoostシステムは、「弱学習器(weak learner)」とも呼ばれる他の学習アルゴリズムの出力を加重和へと組み合わせものであり、後続の弱学習器が前の分類器によって誤分類されたインスタンスに有利になるように微調整されるという意味で「適応型」である。一般に、DNNシステムは、入力層と出力層との間に複数の層を有するニューラルネットワークである。AdaBoost分類器の場合、分類器204は、シグモイド関数を適用することによって、出力ノイズ信頼度を区間[0,1]に変換し得る。シグモイド関数σ(z)は、式(1)にしたがって定義され得る:
式(1)において、出力ノイズ信頼度σ(z)は、弱学習器の出力の組合せである、入力zに対する逆指数関数の演算により、区間[0,1]に変換される。出力ノイズ信頼度は、入力が減少するにつれて0に近づき、入力が0のときは0.5であり、入力が増加するにつれて1に近づく。その結果、出力ノイズ信頼度は、zが増加するについて増加する。
DNNが使用される場合、分類器204は、出力層の活性化関数としてシグモイド関数を使用し得る。いずれにせよ、分類器204は、取得したノイズ信頼度スコアをノイズ信頼度スコア222として決定器208に送る。
決定器208は、ノイズ信頼度スコア222を受信し、ノイズ信頼度スコア222に基づいて重み224を生成する。決定器208はまた、ノイズ信頼度スコア222に基づいて、クリップ信頼度wcを計算する。クリップ信頼度が定義されたしきい値よりも大きい場合、クリップはノイズに分類され、ノイズ弁別器104に送られる。言い換えると、所与のクリップ中の各フレームに対するノイズ信頼度スコア222は、所与のクリップを分類するために使用されるクリップ信頼度wcを計算するために使用される。クリップ信頼度wcに関するさらなる詳細は、式(4)および式(8)を参照して以下に提供される。
決定器208は、ノイズ信頼度スコア222を使用して、式(2)にしたがって、フレーム重みとも呼ばれる重み224を計算する:
式(2)において、iは、現在のフレーム番号であり、wf(i)は、現在のフレームの重み224であり、n(i)は、現在のフレームのノイズ信頼度スコア222であり、σ’(・)は、式(3)にしたがって定義される修正シグモイド関数である:
式(3)において、Cはスケールファクタであり、θはしきい値である。一般に、Cは正の値である。Cの典型的な値は、16、例えば、例えば、10~20の範囲であり、θの典型的な値は、0.5、例えば、0.45~0.55の範囲である。したがって、重み224は、ノイズ信頼度スコア222がしきい値を超えると増加し、重み224は、ノイズ信頼度スコア222がしきい値を下回ると減少する。スケールファクタCは、重み224とノイズ信頼度スコア222との間のバランスを調整するために調整され得、スケールファクタを減らすと重み224の寄与が減少し、スケールファクタを増やすと重み224の寄与が増加する。しきい値θは、ノイズ検出の感度を調整するために調整され得、しきい値を上げると重み224が減少し、しきい値を下げると重み224が増加する。
決定器208は、以下でより詳細に説明するように、クリップ信頼度を計算するためだけでなく、図3を参照してより詳細に説明されるように、クリップがノイズ弁別器104に送られるか否かを決定するためにも、重み224を使用する。クリップ信頼度計算は、クリップ中のノイズフレームの数を使用する。クリップ中のノイズフレームの数を測定するために、決定器208は、式(4)を使用してノイズネス重み(noiseness weight)wnoiを計算する:
式(4)において、c(i)は、第iのフレームに適用される一定係数である。係数c(i)は、すべてのフレームに対して同じであってもよいし、フレームによって異なっていてもよいことに留意されたい。係数が同じである場合、重みwnoiは、クリップ全体の中のノイズ状フレームの割合を近似する。代替的に、低レイテンシが望まれる他のシナリオでは、係数を経時的に増加させていくこともできる。要するに、現在のフレームに最大の係数が割り当てられ、前のフレームにより小さい係数が割り当てられる。この方法は、フレームワークが現在のフレームに迅速に対応するのを助ける。
言い換えると、ノイズネス重みwnoiは、(1)クリップ中のすべてのフレームにわたって合計された各フレームの一定係数およびフレーム重みならびに(2)クリップ中のすべてのフレームにわたって合計された各フレームの一定係数という2つの構成要素間の比である。実際には、ノイズネス重みは、フレーム重みの重み付けされた組合せである。
したがって、クリップ信頼度wcは、ノイズネス重みwnoiに対応する。クリップ信頼度は、0以上1以下の範囲である。
クリップ信頼度wcが定義されたしきい値を超えた場合、クリップおよび重み224が、さらなる処理のためにノイズ弁別器104に送られる。しきい値の典型的な値は0.5である。クリップ信頼度wcが定義されたしきい値を超えない場合、クリップは、PGCオーディオプロセッサ106によって処理される。
RMS計算器210はオプションである。存在する場合、RMS計算器210は、オーディオRMSを特定の範囲に制限するように動作する。その動機は、特定のRMS/ラウドネス範囲内のノイズが、後処理技法、例えばラウドネス調整方法によって引き起こされるアーチファクトを悪化させるが、他の範囲では、アーチファクトが知覚的に顕著ではないということである。単純な手法は、事前定義されたしきい値で硬判定(hard decisions)を使用することである。すなわち、RMSがしきい値を超えるノイズクリップは処理されない。しかしながら、特にRMSが頻繁にしきい値付近で変動するクリップの場合、これでは不安定性を引き起こす可能性がある。
不安定性の問題を克服するために、RMS計算器210は、各フレームに対する平均RMS利得226を計算する。RMS利得は、ノイズ信頼度スコアを重み付けするために使用される(以下で説明するクリップ信頼度wcの修正された計算を参照されたい)ので、特徴抽出器202によって実行される特徴抽出との一貫性を保つために、ショートクリップレベルで動作することが有益である。具体的には、第iのフレームのRMSをp(n)とすると、第iのフレームについてのショートクリップレベルRMSは、式(5)によって計算される:
式(5)において、Lは、フレーム単位でのショートクリップ長であり、例えば、5フレームである。
RMS計算器210が存在する場合、決定器208は、平均RMS利得226も受信する。決定器208は、式(6)を使用してRMSベースの重みwrmsを計算する:
式(6)において、
は、第iのフレームについてのショートクリップRMS利得であり、gは、式(7)にしたがって区間[0,1]へのマッピングを定義する関数である:
式(7)において、PLは、RMS区間の下限であり、PUは、RMS区間の上限であり、aLは、ゼロより大きい数であり、aUは、ゼロ未満の数である。
言い換えると、式(6)は、RMSベースの重みwrmsが、(1)クリップ中のすべてのフレームにわたって合計された各フレームの平均RMS利得およびフレーム重みならびに(2)クリップ中のすべてのフレームにわたって合計された各フレームの重みという2つの構成要素間の比に適用される関数gに対応することを記述する。式(7)は、式(6)の比がRMS区間の下限以下であるとき、RMS区間の下限を比に適用してRMSベースの重みを生成し、式(6)の比がRMS区間の上限よりも大きいとき、RMS区間の上限を比に適用してRMSベースの重みを生成し、それ以外の場合、RMSベースの重みは1に設定されるように、関数gが適用されることを記述する。
決定器208は、式(8)にしたがってクリップ信頼度wcを算出する:
式(8)において、wnoiは、式(4)によるノイズネス重みであり、wrmsは、式(6)によるRMSベースの重みである。言い換えると、クリップ信頼度は、ノイズネス重みとRMSベースの重みとの組合せである。
図3は、ノイズ弁別器104(図1参照)の詳細を示すブロック図である。一般に、ノイズ弁別器104は、例えば、ノイズ検出器102によってノイズに分類されたオーディオ信号を受信し、ノイズ弁別を実行し、ノイズ弁別にしたがって信頼度スコアを生成する。ノイズ弁別器104の構成要素は、プロセッサによって実行される1つまたは複数のコンピュータプログラムとして実装され得る。ノイズ弁別器104は、特徴抽出器302と、分類器304と、モデル306と、決定器308とを含む。
特徴抽出器302は、オーディオ信号120と重み224(図2参照)とを受信し、重み224に基づいてオーディオ信号120から特徴320を抽出する。上述したように、オーディオ信号120は、入力オーディオ信号のオーディオクリップ、例えば、48フレーム(重複していなくてもよい)に対応し、特徴抽出器302は、オーディオクリップに対して動作する。ノイズ検出器102がショートクリップに対して動作するのであることを想起されたく、ノイズ弁別器104は、ノイズ検出器102よりも長い期間に対して動作する。より具体的には、所与のクリップについて、特徴抽出器302は、フレーム特徴とも呼ばれる、クリップ中の各フレームについての様々な特徴を抽出し、特徴抽出器302は、フレーム特徴の統計を計算する。特徴抽出器302は、統計を計算するときに重み付け係数として重み224を使用する。したがって、特徴320は、各フレームに基づいて抽出されるフレーム特徴と、クリップに基づいて計算される統計との両方に対応する。このように、ノイズ弁別器104は、クリップごとに動作する。
特徴抽出器302によって抽出されたフレーム特徴は、時間的特徴、スペクトル特徴、時間周波数特徴などのうちの1つまたは複数を含み得る。時間的特徴は、自動補正係数(ACC)、線形予測コーディング係数(LPCC)、ゼロ交差率(ZCR)などのうちの1つまたは複数を含み得る。スペクトル特徴は、スペクトル重心、スペクトルロールオフ、スペクトルエネルギー分布、スペクトル平坦性、スペクトルエントロピー、メル周波数ケプストラム係数(MFCC)などのうちの1つまたは複数を含み得る。時間周波数特徴は、スペクトルフラックス、クロマなどのうちの1つまたは複数を含み得る。特徴抽出器302によって抽出されたフレーム特徴は、特徴抽出器202によって抽出された特徴220(図2参照)と同じタイプの特徴であってもよい。
特徴抽出器302は、加重平均、加重標準偏差などを含む、様々な加重統計を計算し得る。特徴抽出器302は、式(9)を使用して、加重平均μを計算し得る:
式(9)において、v(i)は、フレームインデックスiとも呼ばれる、フレームi中で抽出されたフレーム特徴vに対応し、wfは、フレーム重みに対応し(式(2)および重み224参照)、Mは、クリップ中のフレームの総数、例えば、48フレームに対応する。言い換えると、加重平均は、所与のクリップについて、(1)重み付きフレーム特徴の合計と(2)重みの合計との間の比に対応する。
特徴抽出器302は、式(10)を使用して、加重標準偏差σを計算し得る:
式(10)の変数は、式(9)に関して上述した通りである。言い換えると、加重標準偏差は、所与のクリップについて、(1)フレーム特徴の二乗の加重和と(2)重みの和との間の比の平方根に対応する。
分類器304は、特徴320を受信し、モデル306を使用して特徴320の分類を実行し、ノイズ信頼度スコア322を生成する。ノイズ信頼度スコア322は、PGCノイズの可能性対UGCノイズの可能性を示す。例えば、分類器304は、シグモイド関数を実装して、ノイズ信頼度スコア322を区間[0,1]に変換し得、0に近いスコアは、一方のタイプ、例えば、UGCノイズの可能性が高いことを示し、1に近いスコアは、他方のタイプ、例えば、PGCノイズの可能性が高いことを示す。
分類器304は、機械学習システムに対応し得、モデル306は、機械学習モデルに対応し得る。モデル306は、データ駆動方法によって取得されていてもよく、PGCノイズトレーニングデータおよびUGCノイズトレーニングデータを含むトレーニングデータのセットを使用してオフラインでトレーニングされていてもよい。言い換えると、トレーニングデータは、様々なカテゴリ、例えば、UGCノイズ、PGCノイズなどにタグ付けされており、モデル306は、モデル306がトレーニングプロセス中にトレーニングデータにさらされた結果として得られる。PGCノイズトレーニングデータを「ポジティブ」トレーニングデータとして、およびUGCノイズトレーニングデータを「ネガティブ」トレーニングデータとして見ると、ノイズ信頼度スコア322は、特徴320がPGCに対応するとき、より大きく、例えば、0.5より大きく、特徴320がUGCに対応するとき、より小さく、例えば、0.5より小さい。許容可能な結果を提供するトレーニングデータの量は、50時間のトレーニングデータである。この量は必要に応じて変えることができ、量を減らすとモデルの精度が低下する可能性があり、量を増やすとモデルの精度が向上する可能性がある。一般に、特徴抽出器302によって抽出された特徴320は、モデル306をトレーニングするときに使用される特徴、例えば、所与のクリップ中の各フレームから抽出された特徴と、それから計算された統計とに対応する。
分類器304は、適応ブースティング(AdaBoost)システム、ディープニューラルネットワーク(DNN)システムなどを含む様々な機械学習システムを実装し得る。AdaBoost分類器の場合、分類器304は、シグモイド関数(式(1)参照)を適用することによって、ノイズ信頼度スコアを区間[0,1]に変換し得る。DNNが使用される場合、分類器304は、出力層の活性化関数としてシグモイド関数を使用し得る。
決定器308は、ノイズ信頼度スコア322を受信し、ノイズ信頼度スコア322としきい値とに基づいて分類結果324を生成する。ノイズ信頼度スコア322がしきい値よりも大きいとき、例えば「ポジティブ」トレーニングデータがPGCトレーニングデータに対応するとき、クリップはPGCに分類され、ノイズ弁別器104は、音量調整などの所望のPGCオーディオ処理技法にしたがってクリップを処理するようにPGCオーディオプロセッサ106を制御する。ノイズ信頼度スコア322がしきい値未満であるとき、例えば、「ネガティブ」トレーニングデータがUGCトレーニングデータに対応するとき、クリップはUGCに分類され、ノイズ弁別器104は、定常ノイズリダクションなどの所望のUGCオーディオ処理技法にしたがってクリップを処理するようにUGCオーディオプロセッサ108を制御する。
図4は、一実施形態による、本明細書で説明される特徴およびプロセスを実装するためのモバイルデバイスアーキテクチャ400である。アーキテクチャ400は、限定はしないが、デスクトップコンピュータ、家庭用オーディオ/ビジュアル(AV)機器、ラジオ放送機器、スマートフォン、タブレットコンピュータ、ラップトップコンピュータ、ウェアラブルデバイスなどのモバイルデバイスを含む、任意の電子デバイスにおいて実装され得る。図示の例示的な実施形態では、アーキテクチャ400は、ラップトップコンピュータ用であり、プロセッサ(複数可)401と、周辺機器インターフェース402と、オーディオサブシステム403と、ラウドスピーカ404と、マイクロフォン405と、加速度計、ジャイロ、気圧計、磁力計、カメラなどのセンサ406と、GNSS受信機などのロケーションプロセッサ407と、Wi-Fi、Bluetooth(登録商標)、セルラーなどのワイヤレス通信サブシステム408と、タッチコントローラ410および他の入力コントローラ411、タッチ面412および他の入力/制御デバイス413を含むI/Oサブシステム(複数可)409とを含む。開示された実施形態を実装するために、より多いまたはより少ない構成要素を有する他のアーキテクチャも使用することができる。
メモリインターフェース414は、プロセッサ401、周辺機器インターフェース402、およびフラッシュ、RAM、ROMなどのメモリ415に結合される。メモリ415は、限定はしないが、オペレーティングシステム命令416、通信命令417、GUI命令418、センサ処理命令419、電話命令420、電子メッセージング命令421、ウェブブラウジング命令422、オーディオ処理命令423、GNSS/ナビゲーション命令424、およびアプリケーション/データ425を含む、コンピュータプログラム命令およびデータを記憶する。オーディオ処理命令423は、本明細書で説明されるオーディオ処理を実行するための命令を含む。
一実施形態によれば、アーキテクチャ400は、携帯電話に対応し得る。ユーザは、携帯電話を使用してPGCを出力し得、その場合、ノイズ分類システム100(図1参照)は、PGCに適したオーディオ処理、例えば、PGCオーディオプロセッサ106を使用してオーディオ出力を生成するように携帯電話を制御する。ユーザは、携帯電話を使用してUGCをキャプチャおよび出力し得、その場合、ノイズ分類システムは、UGCに適したオーディオ処理、例えば、UGCオーディオプロセッサ108を使用して音声出力を生成するように携帯電話を制御する。
図5は、オーディオ処理の方法500のフローチャートである。方法500は、例えば、1つまたは複数のコンピュータプログラムを実行することによって、ノイズ分類システム100(図1参照)などの機能を実装するために、図4のアーキテクチャ400の構成要素を有するラップトップコンピュータ、携帯電話などのデバイスによって実行され得る。
502において、オーディオ信号が受信される。例えば、ノイズ分類システム100(図1参照)がオーディオ信号120を受信し得る。オーディオ信号120はオーディオサンプルを含み得、オーディオサンプルはオーディオフレームとして配置され得、オーディオフレームはオーディオクリップへと配置され得、オーディオ信号120はクリップごとにリアルタイムで処理され得る。
504において、オーディオ信号の第1の信頼度スコアが、第1の機械学習モデルを使用して計算される。例えば、ノイズ検出器102(図2参照)は、モデル206を使用して所与のクリップのクリップ信頼度を計算し得る。ノイズ検出器102は、ショートクリップと呼ばれる、クリップの一部分に対して動作する特徴抽出器202を含み得る。
506において、第1の信頼度スコアが非ノイズの存在を示すとき、第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号が生成される。例えば、ノイズ検出器102(図1参照)がノイズの不在を示すとき、PGCオーディオプロセッサ106は、クリップに対してPGCオーディオ処理を実行して、処理されたオーディオ信号を生成し得る。
508において、第1の信頼度スコアがノイズの存在を示すとき、オーディオ信号の第2の信頼度スコアが、第2の機械学習モデルを使用して計算される。例えば、ノイズ弁別器104(図3参照)は、特徴320に適用されるモデル306を使用してノイズ信頼度スコア322を計算し得る。第2の信頼度スコアは、クリップに基づいて、例えば、クリップ中の各フレームから特徴を抽出することによって計算され得る。第1の信頼度スコアはショートクリップに基づいて計算されることを想起されたい(504参照)。
510において、第2の信頼度スコアがUGCノイズの存在を示すとき、第2のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成する。例えば、ノイズ弁別器104(図1参照)がUGCノイズの存在を示すとき、UGCオーディオプロセッサ108は、クリップに対してUGCオーディオ処理を実行して、処理されたオーディオ信号を生成し得る。
512において、第2の信頼度スコアがPGCノイズの存在を示すとき、第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成する。例えば、ノイズ弁別器104(図1参照)がPGCノイズの存在を示すとき、PGCオーディオプロセッサ106は、クリップに対してPGCオーディオ処理を実行して、処理されたオーディオ信号を生成し得る。
次いで、処理されたオーディオ信号は、デバイスのメモリ、例えば、固体メモリに記憶され、例えば、クラウドストレージのために別のデバイスに送信され、例えば、ラウドスピーカを使用して、音として出力され得る。
方法500は、本明細書で説明されるノイズ分類システム100などの他の機能に対応する追加のステップを含んでもよい。例えば、第1の信頼度スコアを計算することは、重みを計算することを含み得、重みは、第2の信頼度スコアを計算する際に使用される。別の例として、第1の信頼度スコアを計算することは、オーディオ信号の平均RMSを計算することと、第1の信頼度スコアを計算するときに計算された平均RMSを使用することとを含み得る。別の例として、第2の信頼度スコアを計算するステップは、第2の複数の統計を計算するときに重みを使用することを含み得る。
実施の詳細
一実施形態は、ハードウェア、コンピュータ可読媒体上に記憶された実行可能モジュール、または両方の組合せ、例えば、プログラマブル論理アレイにおいて実装され得る。別段の指定がない限り、実施形態によって実行されるステップは、任意の特定のコンピュータまたは他の装置に本質的に関連する必要はないが、特定の実施形態では関連する場合がある。特に、本明細書の教示にしたがって書かれたプログラムとともに様々な汎用機が使用されることもあれば、必要な方法ステップを実行するために、より特化された装置、例えば、集積回路を構築する方が便利なこともある。したがって、実施形態は、少なくとも1つのプロセッサと、揮発性および不揮発性メモリおよび/または記憶要素を含む少なくとも1つのデータ記憶システムと、少なくとも1つの入力デバイスまたはポートと、少なくとも1つの出力デバイスまたはポートとをそれぞれ備える、1つまたは複数のプログラマブルコンピュータシステム上で実行する1つまたは複数のコンピュータプログラムにおいて実装され得る。入力データにプログラムコードを適用して、本明細書で説明された機能を実行し、出力情報を生成する。出力情報は、既知の方法で、1つまたは複数の出力デバイスに適用される。
そのような各コンピュータプログラムは、好ましくは、記憶媒体またはデバイスがコンピュータシステムによって読み取られて、本明細書に説明されるプロシージャを行うとき、コンピュータを構成して動作させるために、汎用または専用プログラマブルコンピュータによって読み取り可能な記憶媒体またはデバイス、例えば、固体メモリもしくは媒体、または磁気もしくは光学媒体上に記憶されるか、またはそれにダウンロードされる。本発明のシステムはまた、コンピュータプログラムを用いて構成されたコンピュータ可読記憶媒体として実装されると考えられてもよく、そのように構成された記憶媒体は、本明細書に記載された機能を実行するために、コンピュータシステムを特定の予め定義された方法で動作させる。ソフトウェア自体および無形のまたは一時的な信号は、それらが特許性のない主題である限り、除外される。
本明細書で説明されるシステムの態様は、デジタルまたはデジタル化オーディオファイルを処理するための適切なコンピュータベースのサウンド処理ネットワーク環境において実装され得る。適応オーディオシステムの部分は、コンピュータ間で伝送されるデータをバッファおよびルーティングする役割を果たす1つまたは複数のルータ(図示せず)を含む、任意の所望の数の個々の機械を含む1つまたは複数のネットワークを含み得る。そのようなネットワークは、様々な異なるネットワークプロトコル上に構築され得、インターネット、広域ネットワーク(WAN)、ローカルエリアネットワーク(LAN)、またはそれらの任意の組合せであってもよい。
構成要素、ブロック、プロセス、または他の機能構成要素のうちの1つまたは複数は、システムのプロセッサベースのコンピューティングデバイスの実行を制御するコンピュータプログラムを通して実装され得る。また、本明細書で開示される様々な機能は、ハードウェア、ファームウェア、ならびに/あるいは様々な機械可読媒体またはコンピュータ可読媒体において具現化されるデータおよび/または命令として、それらの挙動、レジスタ転送、論理構成要素、および/または他の特性の観点から、任意の数の組合せを使用して説明され得ることに留意されたい。そのようなフォーマットされたデータおよび/または命令が具現化され得るコンピュータ可読媒体には、限定はしないが、光記憶媒体、磁気記憶媒体、または半導記憶媒体など、様々な形態の物理媒体、非一時的媒体、不揮発性媒体が含まれる。
上記の説明は、本開示の態様がどのように実装され得るかの例とともに、本開示の様々な実施形態を示す。上記の例および実施形態がすべての(only)実施形態であるとみなされるべきではなく、以下の特許請求の範囲によって定義される本開示の柔軟性および利点を例示するために提示される。上記の開示および以下の特許請求の範囲に基づいて、他の配置、実施形態、実装形態および均等物が当業者には明らかになり、特許請求の範囲によって定義される本開示の趣旨および範囲から逸脱することなく採用され得る。
本発明の様々な態様は、以下の列挙する例示的な実施形態(EEE)から認識され得る。
[EEE1]
オーディオ処理のコンピュータ実装方法であって、
オーディオ信号を受信するステップと、
第1の機械学習モデルを使用してオーディオ信号の第1の信頼度スコアを計算するステップと、
第1の信頼度スコアが非ノイズの存在を示すとき、
第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップと、
第1の信頼度スコアがノイズの存在を示すとき、
第2の機械学習モデルを使用してオーディオ信号の第2の信頼度スコアを計算するステップと、
第2の信頼度スコアが第1のタイプのノイズの存在を示すとき、
第2のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップと、
第2の信頼度スコアが第2のタイプのノイズの存在を示すとき、
第1のオーディオ処理プロセスにしたがってオーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップと
を含む方法。
[EEE2]
ラウドスピーカによって、処理されたオーディオ信号を音として出力するステップ
をさらに含む、EEE1に記載のコンピュータ実装方法。
[EEE3]
オーディオ信号は複数のサンプルを含み、複数のサンプルは複数のフレームに配置され、
第1の信頼度スコアは、ショートクリップごとにリアルタイムで計算され、
第2の信頼度スコアは、クリップごとにリアルタイムで計算され、
所与のショートクリップおよび所与のクリップはそれぞれ、オーディオ信号のいくつかのフレームを含み、所与のショートクリップは、所与のクリップよりも少ないフレームを含む、
EEE1または2に記載のコンピュータ実装方法。
[EEE4]
第1のオーディオ処理プロセスは、ノイズリダクション以外のオーディオ処理を含み、
第2のオーディオ処理プロセスは、ノイズリダクションを含む、
EEE1から3のいずれか1つに記載のコンピュータ実装方法。
[EEE5]
第1のタイプのノイズは、ユーザ生成コンテンツ(UGC)ノイズに対応し、第2のタイプのノイズは、専門家生成コンテンツ(PGC)ノイズに対応し、PGCは、専門家によって作成されたオーディオコンテンツであり、UGCは、専門家以外によって作成されたオーディオコンテンツである、EEE1から4のいずれか1つに記載のコンピュータ実装方法。
[EEE6]
第1の機械学習モデルは、ポジティブトレーニングデータおよびネガティブトレーニングデータを使用してオフラインでトレーニングされており、
ポジティブトレーニングデータは、第1のタイプのノイズに対応するトレーニングデータおよび第2のタイプのノイズに対応するトレーニングデータを含み、
ネガティブトレーニングデータは、非ノイズトレーニングデータを含む、
EEE1から5のいずれか1つに記載のコンピュータ実装方法。
[EEE7]
第1の信頼度スコアを計算するステップは、
オーディオ信号から第1の複数の特徴を抽出するステップと、
第1の複数の特徴を第1の機械学習モデルに入力することによってオーディオ信号を分類するステップと、
オーディオ信号を分類した結果に基づいてノイズ信頼度スコアを計算するステップと
を含む、EEE1から6のいずれか1つに記載のコンピュータ実装方法。
[EEE8]
第1の複数の特徴は、現在のフレームと複数の履歴フレームとを含むショートクリップから抽出され、現在のフレームのノイズ信頼度スコアは、ショートクリップの第1の複数の特徴を第1の機械学習モデルに入力することで得られる、EEE7に記載のコンピュータ実装方法。
[EEE9]
クリップ中の複数のフレームに対するノイズ信頼度スコアを計算するステップと、
クリップに対するノイズ信頼度スコアを、複数のフレームに対するノイズ信頼度スコアの重み付けされた組合せとして計算するステップと
をさらに含む、EEE7から8のいずれか1つに記載のコンピュータ実装方法。
[EEE10]
ノイズ信頼度スコアを計算するステップは、
複数の弱学習器の複数の出力を加重和へと組み合わせるステップと、
逆指数関数を使用して、加重和をノイズ信頼度スコアに変換するステップと
を含む、EEE7から9のいずれか1つに記載のコンピュータ実装方法。
[EEE11]
第1の信頼度スコアを計算するステップは、
オーディオ信号の平均二乗平均平方根利得(average root mean square gain)を計算するステップ
をさらに含み、
ノイズ信頼度スコアを計算するステップは、オーディオ信号を分類した結果とオーディオ信号の平均二乗平均平方根利得とに基づいてノイズ信頼度スコアを計算するステップを含む、
EEE7から10のいずれか1つに記載のコンピュータ実装方法。
[EEE12]
ノイズ信頼度スコアおよび平均二乗平均平方根利得は、オーディオ信号の現在のフレームに関連付けられ、平均二乗平均平方根利得を計算するステップは、
平均二乗平均平方根利得を、現在のフレームを含むショートクリップの複数のフレームの二乗平均平方根レベルの平均として計算するステップと、
第1の係数と第2の係数との比に基づいて二乗平均平方根ベースの重みを計算するステップであって、第1の係数は、平均二乗平均平方根利得と現在のフレームのフレーム重みとの積であり、第2の係数は、現在のフレームのフレーム重みである、ステップと
を含み、
方法は、
クリップ中の複数のフレームに対する複数のノイズ信頼度スコアを計算するステップと、
クリップに対するノイズネス重みを、複数のノイズ信頼度スコアの重み付けされた組合せとして計算するステップと、
二乗平均平方根ベースの重みとノイズネス重みとを乗算することによってクリップ信頼度スコアを計算するステップと
をさらに含む、EEE11に記載のコンピュータ実装方法。
[EEE13]
第1の複数の特徴は、複数の時間的特徴、複数のスペクトル特徴、複数の時間周波数特徴、および第1の複数の統計のうちの1つまたは複数を含み、および/または、
第1の複数の統計は、平均および標準偏差のうちの1つまたは複数を含み、平均は、第1の複数の特徴のうちの1つまたは複数に基づいて計算され、標準偏差は、第1の複数の特徴のうちの1つまたは複数に基づいて計算される、
EEE7から12のいずれか1つに記載のコンピュータ実装方法。
[EEE14]
ノイズ信頼度スコアに基づいて重みを計算するステップをさらに含み、第2の信頼度スコアを計算するステップは、
オーディオ信号から第2の複数の特徴を抽出するステップであって、第2の複数の特徴は、第1の複数の特徴が抽出されるよりも長い時間期間にわたって抽出される、ステップと、
第2の複数の特徴に基づいて第2の複数の統計を計算するステップであって、第2の複数の統計は、重みにしたがって重み付けされる、ステップと、
第2の複数の特徴および第2の複数の統計を第2の機械学習モデルに入力することによってオーディオ信号を分類するステップと、
オーディオ信号を分類した結果に基づいて第2の信頼度スコアを計算するステップと
を含む、EEE7から13のいずれか1つに記載のコンピュータ実装方法。
[EEE15]
第1の複数の特徴は、オーディオ信号のショートクリップの第1の複数のフレームから抽出され、第2の複数の特徴は、オーディオ信号のクリップの第2の複数のフレームから抽出される、EEE14に記載のコンピュータ実装方法。
[EEE16]
重みは現在のフレームのフレーム重みであり、フレーム重みを計算するステップは、
現在のフレームのノイズ信頼度スコアに修正シグモイド関数を適用することによってフレーム重みを計算するステップであって、フレーム重みは、ノイズ信頼度スコアがしきい値を超えると増加し、フレーム重みは、ノイズ信頼度スコアがしきい値を下回ると減少する、ステップ
を含む、EEE14または15に記載のコンピュータ実装方法。
[EEE17]
オーディオ信号はクリップを含み、クリップは複数のフレームを含み、第2の複数の特徴は複数のフレーム特徴と複数の統計とを含み、複数のフレーム特徴はフレームごとに抽出され、複数の統計は複数のフレーム特徴に基づいてクリップごとに計算される、EEE14から16のいずれか1つに記載のコンピュータ実装方法。
[EEE18]
第2の機械学習モデルは、ポジティブトレーニングデータおよびネガティブトレーニングデータを使用してオフラインでトレーニングされており、
ポジティブトレーニングデータは、第2のタイプのノイズに対応するトレーニングデータを含み、
ネガティブトレーニングデータは、第1のタイプのノイズに対応するトレーニングデータを含む、
EEE1から17のいずれか1つに記載のコンピュータ実装方法。
[EEE19]
プロセッサによって実行されると、EEE1から18のいずれか1つに記載の方法を含む処理を実行するように装置を制御するコンピュータプログラムを記憶した非一時的コンピュータ可読媒体。
[EEE20]
オーディオ処理のための装置であって、
装置はプロセッサを含み、プロセッサは、EEE1から18のいずれか1つに記載の方法を含む処理を実行するように装置を制御するように構成される、
装置。

Claims (19)

  1. オーディオ処理のコンピュータ実装方法であって、
    オーディオ信号を受信するステップと、
    オーディオ信号を非ノイズまたはノイズに分類するようにトレーニングされた第1の機械学習モデルを使用して前記オーディオ信号の第1の信頼度スコアを計算するステップと、
    前記第1の信頼度スコアが非ノイズの存在を示すとき、
    第1のオーディオ処理プロセスにしたがって前記オーディオ信号を処理することによって、処理されたオーディオ信号を生成するステップと、
    前記第1の信頼度スコアがノイズの存在を示すとき、
    第1のタイプのノイズと第2のタイプのノイズとを区別するようにトレーニングされた第2の機械学習モデルを使用して前記オーディオ信号の第2の信頼度スコアを計算するステップと、
    前記第2の信頼度スコアが前記第1のタイプのノイズの存在を示すとき、
    第2のオーディオ処理プロセスにしたがって前記オーディオ信号を処理することによって、前記処理されたオーディオ信号を生成するステップと、
    前記第2の信頼度スコアが前記第2のタイプのノイズの存在を示すとき、
    前記第1のオーディオ処理プロセスにしたがって前記オーディオ信号を処理することによって、前記処理されたオーディオ信号を生成するステップと
    を含み、
    前記第1のタイプの前記ノイズは、ユーザ生成コンテンツ(UGC)ノイズに対応し、前記第2のタイプの前記ノイズは、専門家生成コンテンツ(PGC)ノイズに対応し、PGCは、専門家によって作成されたオーディオコンテンツであり、UGCは、専門家以外によって作成されたオーディオコンテンツである、
    コンピュータ実装方法。
  2. ラウドスピーカによって、前記処理されたオーディオ信号を音として出力するステップ
    をさらに含む、請求項1に記載のコンピュータ実装方法。
  3. 前記オーディオ信号は複数のサンプルを含み、前記複数のサンプルは複数のフレームに配置され、
    前記第1の信頼度スコアは、ショートクリップごとにリアルタイムで計算され、
    前記第2の信頼度スコアは、クリップごとにリアルタイムで計算され、
    所与のショートクリップおよび所与のクリップはそれぞれ、前記オーディオ信号のいくつかのフレームを含み、前記所与のショートクリップは、前記所与のクリップよりも少ないフレームを含む、
    請求項1に記載のコンピュータ実装方法。
  4. 前記第1のオーディオ処理プロセスは、ノイズリダクション以外のオーディオ処理を含み、
    前記第2のオーディオ処理プロセスは、ノイズリダクションを含む、
    請求項1に記載のコンピュータ実装方法。
  5. 前記第1の機械学習モデルは、ポジティブトレーニングデータおよびネガティブトレーニングデータを使用してオフラインでトレーニングされており、
    前記ポジティブトレーニングデータは、前記第1のタイプの前記ノイズに対応するトレーニングデータおよび前記第2のタイプの前記ノイズに対応するトレーニングデータを含み、
    前記ネガティブトレーニングデータは、非ノイズトレーニングデータを含む、
    請求項1に記載のコンピュータ実装方法。
  6. 前記第1の信頼度スコアを計算するステップは、
    前記オーディオ信号から第1の複数の特徴を抽出するステップと、
    前記第1の複数の特徴を前記第1の機械学習モデルに入力することによって前記オーディオ信号を分類するステップと、
    前記オーディオ信号を分類した結果に基づいてノイズ信頼度スコアを計算するステップと
    を含む、請求項1に記載のコンピュータ実装方法。
  7. 第1の複数の特徴は、現在のフレームと複数の履歴フレームとを含むショートクリップから抽出され、前記現在のフレームの前記ノイズ信頼度スコアは、前記ショートクリップの前記第1の複数の特徴を前記第1の機械学習モデルに入力することで得られる、請求項6に記載のコンピュータ実装方法。
  8. クリップ中の複数のフレームに対するノイズ信頼度スコアを計算するステップと、
    前記クリップに対するノイズ信頼度スコアを、前記複数のフレームに対する前記ノイズ信頼度スコアの重み付けされた組合せとして計算するステップと
    をさらに含む、請求項6に記載のコンピュータ実装方法。
  9. 前記ノイズ信頼度スコアを計算するステップは、
    複数の弱学習器の複数の出力を加重和へと組み合わせるステップと、
    逆指数関数を使用して、前記加重和を前記ノイズ信頼度スコアに変換するステップと
    を含む、請求項6に記載のコンピュータ実装方法。
  10. 前記第1の信頼度スコアを計算するステップは、
    前記オーディオ信号の平均二乗平均平方根利得を計算するステップ
    をさらに含み、
    前記ノイズ信頼度スコアを計算するステップは、前記オーディオ信号を分類した前記結果と前記オーディオ信号の前記平均二乗平均平方根利得とに基づいて前記ノイズ信頼度スコアを計算するステップを含む、
    請求項6に記載のコンピュータ実装方法。
  11. 前記ノイズ信頼度スコアおよび前記平均二乗平均平方根利得は、前記オーディオ信号の現在のフレームに関連付けられ、前記平均二乗平均平方根利得を計算するステップは、
    前記平均二乗平均平方根利得を、前記現在のフレームを含むショートクリップの複数のフレームの二乗平均平方根レベルの平均として計算するステップと、
    第1の係数と第2の係数との比に基づいて二乗平均平方根ベースの重みを計算するステップであって、前記第1の係数は、前記平均二乗平均平方根利得と前記現在のフレームのフレーム重みとの積であり、前記第2の係数は、前記現在のフレームの前記フレーム重みである、ステップと
    を含み、
    前記方法は、
    クリップ中の複数のフレームに対する複数のノイズ信頼度スコアを計算するステップと、
    前記クリップに対するノイズネス重みを、前記複数のノイズ信頼度スコアの重み付けされた組合せとして計算するステップと、
    前記二乗平均平方根ベースの重みと前記ノイズネス重みとを乗算することによってクリップ信頼度スコアを計算するステップと
    をさらに含む、請求項10に記載のコンピュータ実装方法。
  12. 前記第1の複数の特徴は、複数の時間的特徴、複数のスペクトル特徴、複数の時間周波数特徴、および第1の複数の統計のうちの1つまたは複数を含み、および/または、
    前記第1の複数の統計は、平均および標準偏差のうちの1つまたは複数を含み、前記平均は、前記第1の複数の特徴のうちの1つまたは複数に基づいて計算され、前記標準偏差は、前記第1の複数の特徴のうちの1つまたは複数に基づいて計算される、
    請求項6に記載のコンピュータ実装方法。
  13. 前記ノイズ信頼度スコアに基づいて重みを計算するステップをさらに含み、前記第2の信頼度スコアを計算するステップは、
    前記オーディオ信号から第2の複数の特徴を抽出するステップであって、前記第2の複数の特徴は、前記第1の複数の特徴が抽出されるよりも長い時間期間にわたって抽出される、ステップと、
    前記第2の複数の特徴に基づいて第2の複数の統計を計算するステップであって、前記第2の複数の統計は、前記重みにしたがって重み付けされる、ステップと、
    前記第2の複数の特徴および前記第2の複数の統計を前記第2の機械学習モデルに入力することによって前記オーディオ信号を分類するステップと、
    前記オーディオ信号を分類した結果に基づいて前記第2の信頼度スコアを計算するステップと
    を含む、請求項6に記載のコンピュータ実装方法。
  14. 前記第1の複数の特徴は、前記オーディオ信号のショートクリップの第1の複数のフレームから抽出され、前記第2の複数の特徴は、前記オーディオ信号のクリップの第2の複数のフレームから抽出される、請求項13に記載のコンピュータ実装方法。
  15. 前記重みは現在のフレームのフレーム重みであり、前記フレーム重みを計算するステップは、
    前記現在のフレームの前記ノイズ信頼度スコアに修正シグモイド関数を適用することによって前記フレーム重みを計算するステップであって、前記フレーム重みは、前記ノイズ信頼度スコアがしきい値を超えると増加し、前記フレーム重みは、前記ノイズ信頼度スコアが前記しきい値を下回ると減少する、ステップ
    を含む、請求項13に記載のコンピュータ実装方法。
  16. 前記オーディオ信号はクリップを含み、前記クリップは複数のフレームを含み、前記第2の複数の特徴は複数のフレーム特徴と複数の統計とを含み、前記複数のフレーム特徴はフレームごとに抽出され、前記複数の統計は前記複数のフレーム特徴に基づいてクリップごとに計算される、請求項13に記載のコンピュータ実装方法。
  17. 前記第2の機械学習モデルは、ポジティブトレーニングデータおよびネガティブトレーニングデータを使用してオフラインでトレーニングされており、
    前記ポジティブトレーニングデータは、前記第2のタイプの前記ノイズに対応するトレーニングデータを含み、
    前記ネガティブトレーニングデータは、前記第1のタイプの前記ノイズに対応するトレーニングデータを含む、
    請求項1に記載のコンピュータ実装方法。
  18. プロセッサによって実行されると、請求項1から17のいずれか一項に記載の方法を含む処理を実行するように装置を制御するコンピュータプログラムを記憶した非一時的コンピュータ可読媒体。
  19. オーディオ処理のための装置であって、
    前記装置はプロセッサを含み、前記プロセッサは、請求項1から17のいずれか一項に記載の方法を含む処理を実行するように前記装置を制御するように構成される、
    装置。
JP2024508330A 2021-08-26 2022-08-23 ユーザ生成コンテンツにおける環境ノイズの検出 Active JP7735537B2 (ja)

Applications Claiming Priority (7)

Application Number Priority Date Filing Date Title
CN2021114746 2021-08-26
CNPCT/CN2021/114746 2021-08-26
US202163244495P 2021-09-15 2021-09-15
US63/244,495 2021-09-15
EP21206205.3 2021-11-03
EP21206205 2021-11-03
PCT/US2022/041130 WO2023028018A1 (en) 2021-08-26 2022-08-23 Detecting environmental noise in user-generated content

Publications (2)

Publication Number Publication Date
JP2024532759A JP2024532759A (ja) 2024-09-10
JP7735537B2 true JP7735537B2 (ja) 2025-09-08

Family

ID=83280552

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2024508330A Active JP7735537B2 (ja) 2021-08-26 2022-08-23 ユーザ生成コンテンツにおける環境ノイズの検出

Country Status (4)

Country Link
US (1) US20240355348A1 (ja)
EP (1) EP4392971A1 (ja)
JP (1) JP7735537B2 (ja)
WO (1) WO2023028018A1 (ja)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN120279941B (zh) * 2025-03-12 2026-01-02 珠海高凌信息科技股份有限公司 基于主声源检测的噪声事件识别方法、系统、装置、介质

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2016519784A (ja) 2013-03-26 2016-07-07 ドルビー ラボラトリーズ ライセンシング コーポレイション オーディオ分類および処理のための装置および方法

Family Cites Families (19)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FI116643B (fi) 1999-11-15 2006-01-13 Nokia Corp Kohinan vaimennus
FR2808917B1 (fr) 2000-05-09 2003-12-12 Thomson Csf Procede et dispositif de reconnaissance vocale dans des environnements a niveau de bruit fluctuant
US8019091B2 (en) 2000-07-19 2011-09-13 Aliphcom, Inc. Voice activity detector (VAD) -based multiple-microphone acoustic noise suppression
EP1443498B1 (en) 2003-01-24 2008-03-19 Sony Ericsson Mobile Communications AB Noise reduction and audio-visual speech activity detection
US7464029B2 (en) 2005-07-22 2008-12-09 Qualcomm Incorporated Robust separation of speech signals in a noisy environment
GB2434708B (en) 2006-01-26 2008-02-27 Sonaptic Ltd Ambient noise reduction arrangements
GB2461315B (en) 2008-06-27 2011-09-14 Wolfson Microelectronics Plc Noise cancellation system
US8325939B1 (en) 2008-09-19 2012-12-04 Adobe Systems Incorporated GSM noise removal
FR2943200B1 (fr) 2009-03-11 2015-03-20 Imra Europ Sas Filtre adaptatif avec classificateur de bruit
US9318094B2 (en) 2011-06-03 2016-04-19 Cirrus Logic, Inc. Adaptive noise canceling architecture for a personal audio device
US9064497B2 (en) 2012-02-22 2015-06-23 Htc Corporation Method and apparatus for audio intelligibility enhancement and computing apparatus
US9107010B2 (en) 2013-02-08 2015-08-11 Cirrus Logic, Inc. Ambient noise root mean square (RMS) detector
US9633671B2 (en) 2013-10-18 2017-04-25 Apple Inc. Voice quality enhancement techniques, speech recognition techniques, and related systems
US9484043B1 (en) 2014-03-05 2016-11-01 QoSound, Inc. Noise suppressor
US9609416B2 (en) 2014-06-09 2017-03-28 Cirrus Logic, Inc. Headphone responsive to optical signaling
WO2016090342A2 (en) * 2014-12-05 2016-06-09 Stages Pcs, Llc Active noise control and customized audio system
US9769564B2 (en) 2015-02-11 2017-09-19 Google Inc. Methods, systems, and media for ambient background noise modification based on mood and/or behavior information
US10141005B2 (en) 2016-06-10 2018-11-27 Apple Inc. Noise detection and removal systems, and related methods
US10489103B1 (en) 2016-11-15 2019-11-26 Philip A Gruebele Wearable audio recorder and retrieval software applications

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2016519784A (ja) 2013-03-26 2016-07-07 ドルビー ラボラトリーズ ライセンシング コーポレイション オーディオ分類および処理のための装置および方法

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
三宅 信之,音声GMMと雑音重み推定を用いた雑音除去,電子情報通信学会技術研究報告,2007年12月13日,Vol.107 No.405,PP25-30

Also Published As

Publication number Publication date
US20240355348A1 (en) 2024-10-24
WO2023028018A1 (en) 2023-03-02
JP2024532759A (ja) 2024-09-10
EP4392971A1 (en) 2024-07-03

Similar Documents

Publication Publication Date Title
JP7566835B2 (ja) ボリューム平準化器コントローラおよび制御方法
JP6921907B2 (ja) オーディオ分類および処理のための装置および方法
JP6053984B2 (ja) 等化器コントローラおよび制御方法
US12597434B2 (en) Control of speech preservation in speech enhancement
US20230402050A1 (en) Speech Enhancement
US9349384B2 (en) Method and system for object-dependent adjustment of levels of audio objects
WO2023001128A1 (zh) 音频数据的处理方法、装置及设备
CN114503197B (zh) 使用自适应平滑的对话增强
JP2024532759A (ja) ユーザ生成コンテンツにおける環境ノイズの検出
CN117859176A (zh) 检测用户生成内容中的环境噪声
RU2848299C1 (ru) Контроллер выравнивателя громкости и способ управления
JP7862500B2 (ja) ボリューム平準化器コントローラおよび制御方法
RU2826268C2 (ru) Контроллер выравнивателя громкости и способ управления
US12118970B2 (en) Compensating noise removal artifacts
RU2836703C1 (ru) Контроллер выравнивателя громкости и способ управления
EP4732276A1 (en) Enhancing audio content
CN118215961A (zh) 对语音增强中的语音保留的控制

Legal Events

Date Code Title Description
A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20240209

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20250319

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20250401

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20250630

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20250729

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20250827

R150 Certificate of patent or registration of utility model

Ref document number: 7735537

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150