JP2018514976A - フラグメント整列されたオーディオ・コーディング - Google Patents

フラグメント整列されたオーディオ・コーディング Download PDF

Info

Publication number
JP2018514976A
JP2018514976A JP2017548010A JP2017548010A JP2018514976A JP 2018514976 A JP2018514976 A JP 2018514976A JP 2017548010 A JP2017548010 A JP 2017548010A JP 2017548010 A JP2017548010 A JP 2017548010A JP 2018514976 A JP2018514976 A JP 2018514976A
Authority
JP
Japan
Prior art keywords
fragment
temporal
audio
temporal fragment
audio frame
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP2017548010A
Other languages
English (en)
Other versions
JP6707556B2 (ja
JP2018514976A5 (ja
Inventor
ベルント チェルハン
ベルント チェルハン
ハラルド フックス
ハラルド フックス
インゴ ホーフマン
インゴ ホーフマン
ヘルベルト トーマ
ヘルベルト トーマ
シュテファン シュライナー
シュテファン シュライナー
Original Assignee
フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ
フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ, フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ filed Critical フラウンホッファー−ゲゼルシャフト ツァ フェルダールング デァ アンゲヴァンテン フォアシュンク エー.ファオ
Publication of JP2018514976A publication Critical patent/JP2018514976A/ja
Publication of JP2018514976A5 publication Critical patent/JP2018514976A5/ja
Application granted granted Critical
Publication of JP6707556B2 publication Critical patent/JP6707556B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/242—Synchronisation processes, e.g. processing of PCR [Programme Clock References]
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16—Vocoder architecture
    • G10L19/167—Audio streaming, i.e. formatting and decoding of an encoded audio signal representation into a data stream for transmission or storage purposes
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/57—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for processing of video signals
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
    • H04N19/40—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using video transcoding, i.e. partial or full decoding of a coded input stream followed by re-encoding of the decoded output stream
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/233—Processing of audio elementary streams
    • H04N21/2335—Processing of audio elementary streams involving reformatting operations of audio signals, e.g. by converting from one coding standard to another
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/234—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs
    • H04N21/23424—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving splicing one content stream with another content stream, e.g. for inserting or substituting an advertisement
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/234—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs
    • H04N21/2343—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving reformatting operations of video signals for distribution or compliance with end-user requests or end-user device requirements
    • H04N21/23439—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving reformatting operations of video signals for distribution or compliance with end-user requests or end-user device requirements for generating different versions
    • H—ELECTRICITY
    • H04—ELECTRIC COMMUNICATION TECHNIQUE
    • H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/80—Generation or processing of content or additional data by content creator independently of the distribution process; Content per se
    • H04N21/83—Generation or processing of protective or descriptive data associated with content; Content structuring
    • H04N21/845—Structuring of content, e.g. decomposing content into time segments
    • H04N21/8456—Structuring of content, e.g. decomposing content into time segments by decomposing the content in the time domain, e.g. in time segments
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/04—Time compression or expansion
    • G10L21/055—Time compression or expansion for synchronising with other signals, e.g. video signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Signal Processing (AREA)
  • Multimedia (AREA)
  • Acoustics & Sound (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Marketing (AREA)
  • Business, Economics & Management (AREA)
  • Quality & Reliability (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Compression Or Coding Systems Of Tv Signals (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • Synchronisation In Digital Transmission Systems (AREA)
  • Reverberation, Karaoke And Other Acoustics (AREA)

Abstract

フラグメント・グリッドとフレーム・グリッドとを独立の値として取り扱うことによって、オーディオとビデオとの同期および整列または他の外的なクロックへのオーディオの整列は、より効率的または簡易な状態にされるが、それにもかかわらず、各フラグメントに対してフレーム・グリッドは、それぞれのフラグメントの始点に整列される。失われた圧縮の効率性は、適切にフラグメント・サイズを選択すれば、低い状態を保つことができる。他方、フラグメントの始点に関するフレーム・グリッドの整列は、例えば、並列オーディオ・ビデオ・ストリーミング、ビットレート適応型ストリーミング又はそのようなものと関連してフラグメントを処理する簡単なかつフラグメント同期された方法を考慮に入れる。【選択図】図2

Description

本出願は、例えば、コードされたビデオと並列して使用するのに適したオーディオ・コーデックに関する。
1つの目的は、固定または可変ビット・レートのいずれかで伝送チャンネル上でオーディオ・コンテンツおよびビデオ・コンテンツを配信するときに、オーディオとビデオとの同期と、スプライシングのような高度な使用例の有効と、を確保することである。
オーディオ・ビデオ・システムを構築するとき、オーディオとビデオとの同期と、整列と、は常に必須の要素である。通常、オーディオ・コーデックとビデオ・コーデックとは、同じフレーム期間を使用していない。この理由のため、今日のオーディオ・コーデックは、フレーム整列されていない。一例として、このことは、幅広く用いられるAACファミリーにも当てはまる。その例は、1024フレーム・サイズと48kHzのサンプリング周波数とが用いられるDVB規格に基づいている。このことは、1024サンプル/48000Hz≒0.0213秒の期間を有するオーディオ・フレームにつながる。対照的に、ビデオの一般的なDVBリフレッシュ・レートは、25Hzまたは50Hzのいずれかであり、このことは、それぞれ0.02秒または0.04秒のビデオ・フレーム期間につながる。
特に、オーディオ・ストリームの構成を変えるとき又はプログラムを変えるとき、再びビデオとオーディオとが整列されることが必要である。今日のシステムは、オーディオ構成を、対応するビデオの前または後にわずかに異ならせている。なぜなら、人間は、オーディオとビデオとの同期において小さな違いを認識することができないからである。
残念なことに、置換されたビデオ・ストリームがまた、この小さなオフセットで開始しなければならないので、このことは、全体的な広告がローカルな広告によって置き換えられるスプライシングの複雑さを増大する。加えて、新しい規格は、全体的なユーザ体験を改善するために、より正確なビデオとオーディオとの同期を求めている。
それゆえ、最近のオーディオ・コーデックは、ビデオ・フレーム・サイズと合わせるために、可能なフレーム・サイズの広い範囲を取り扱うことができる。ここで問題は、このことが、整列の問題を解決することとは別に、コーディングの効率および性能に大きなインパクトを有することである。
ブロードキャスト環境でのストリーミングは、特別な問題を引き起こす。
最近の開発は、「適応型」ストリーミングが、直線的なブロードキャストに対してさえ、輸送層としてみなされることを示している。トップ・アプリケーションとエア・アプリケーションとで若干異なるすべての要求を満たすために、適応型ストリーミングが最適化されている。ここでは、一つの具体的な適応型ストリーミング技術に焦点をあてることとする。しかし、全ての与えられた例は、MMTのような他のファイル・ベースの技術でも機能する。
図7は、現在開発中のATSC3.0規格に対する提案を示す。この提案において、MPEG−DASHの最適化されたバージョンは、固定レート・ブロードキャスト・チャンネル上で使用されると考えられる。DASHは、可変レート、LTE、3Gのようなユニキャスト・チャンネルまたはブロードバンド・インターネットのために設計されたので、この提案によってカバーされるいくつかの調節は、必要であった。正規のDASHの使用例に対する主要な違いは、ブロードキャスト・チャンネルのレシーバがバックチャンネルを有していないことと、ユニキャストを受信することと、である。通常、クライアントは、MPDの受信及び解析の後に、初期化セグメントの位置を抽出することができる。その後、クライアントは、一つのセグメントを他のセグメントの後にデコードすることができ、または、所定のタイムスタンプを求めることができる。上図に示されるように、ブロードキャスト環境において、このアプローチは全く可能でない。代わりに、MPDおよび初期化セグメントは、定期的に繰り返される。レシーバは、MPDと必要なすべての初期化セグメントとを受信するとすぐに同調することができる。
これは、短い同調時間と小さなオーバーヘッドとの間のトレードオフを含む。正規のブロードキャスタにとって、約1秒のセグメント長さは、実現可能であるように思われる。これは、2つのMPDの間に、共に約1秒の長さである1つのオーディオと1つのビデオ・セグメント(プログラムがオーディオとビデオとのみを含む場合)があることを意味する。
オーディオとビデオとの整列に対して、DASHを使用する場合に、前述のアスペクトもまた当てはまります。加えて、オーディオとビデオとの整列を保つために、オーディオ・セグメントは、わずかに長くまたは短くある必要がある。このことは、図8に示されている。
オーディオ又はビデオの構成変更が引き起こされた場合。アップデートされた初期化セグメントを伝送する他の方法がないので、これは、セグメント境界で起こる必要がある。そのために、フル・セグメントを満たすために、ビデオとオーディオとは、(ブラック・フレーム又は無音のいずれかで)引き伸ばされる。しかし、これは、ビデオとオーディオとの不整列の問題を解決しない。スプライシングとプログラム変更とのために、現在のセグメント期間偏流に依存する小さなオーディオとビデオとのミスマッチが存在し得る。
[1] "Delivery/Sync/FEC-Evaluation Criteria Report", ROUTE/DASH
[2] ISO/IEC 23008-3, "Information technology -- High efficiency coding and media delivery in heterogeneous environments -- Part 3: 3D audio"
[3] ISO/IEC 23009-1, "Information technology Dynamic adaptive streaming over HTTP (DASH) Part 1: Media presentation description and segment formats"
[4] ISO/IEC 23008-1, "Information technology -- High efficiency coding and media delivery in heterogeneous environments -- Part 1: MPEG media transport (MMT)"
本発明の目的は、例えば、既存のオーディオ圧縮技術を基礎として実装することがより簡単になるなどの、オーディオとビデオとの同期および整列というタスクをより効率的にするオーディオ・コーデックを提供することである。
この目的は、係属中の独立請求項の主題によって達成される。
本出願の根底にある基本的な考え方は、フラグメント・グリッドとフレーム・グリッドとが独立の値として取り扱われるときであるが、それにもかかわらず、各フラグメントに対してフレーム・グリッドがそれぞれのフラグメントの始点に整列されるとき、オーディオとビデオとの同期および整列または他の外的なクロックへのオーディオの整列は、より効率的または簡易な状態にされることができるということである。失われた圧縮の効率性は、適切にフラグメント・サイズを選択すれば、低い状態を保つことができる。他方、フラグメントの始点に関するフレーム・グリッドの整列は、例えば、並列オーディオ・ビデオ・ストリーミング、ビットレート適応型ストリーミング又はそのようなものと関連してフラグメントを処理する簡単なかつフラグメント同期された方法を考慮に入れる。
有利な実施形態は、従属請求項の主題である。本出願の好ましい実施形態は、図面に関して以下に説明されている。
図1は、本出願の一実施の形態による、ビデオとオーディオ・フラグメントとが時間整列されたビデオとオーディオとを含む時間的フラグメントの概略図を示す。 図2は、一実施形態による、エンコーダと、それによりエンコードされたオーディオ・コンテンツと、それによって生成されたエンコードされたデータ・ストリームと、の準概略図およびブロック図を示す。 図3は、一実施形態による、図2のエンコーダに適合するデコーダの準概略図およびブロック図を示す。 図4は、フレームをコーディング/デコーディングするために、すなわち、ラップ変換を適用することによる、変換ベースのコーディング/デコーディングが使用されるという一実施形態による、エンコーディング/デコーディング・プロセスに含まれる時間領域部分のウィンドウの概略図を示す。 図5は、一実施形態による、即時プレイアウト情報の生成を図示する概略図を示す。 図6は、例えば、即時プレイアウト情報が、それぞれの時間的フラグメントの始点で構成変更の場合に失われる可能性があることを示し、または、そのような時間的フラグメントの即時プレイアウト情報が代わりにゼロ・サンプルをエンコードすることを示す、一実施形態による、オーディオ・コンテンツにおける構成変更の場合を図示する概略図を示す。 図7は、比較のために[1]によるROUTEを介して配信されるパケット化されたDASHセグメントを示す。 図8は、オーディオ・フラグメンテーションが異なるフラグメント化された期間を含むという現在のフラグメンテーションの概念による、オーディオおよびビデオを搬送する2つの連続したフラグメントを示す。
本出願の様々な実施の形態を説明する前に、それによって提供される利点、と根底にある考えと、をまず説明する。特に、ビデオ・フレームの連続から構成されるビデオ・フレームに付随するために、オーディオ・コンテンツは、コードされることとなることを想像してください。この問題は、本出願の前置き部分で概説されたとおりである:今日、オーディオ・コーデックは、ビデオ・フレームレートの整数分数または整数倍数ではないサンプルおよびフレーム基礎で動作する。したがって、以下に説明される実施の形態は、それらが最適化される「通常の」フレームの単位で動作するエンコーディング/デコーディングのステージを使用する。他方、オーディオ・コンテンツは、1つ又はそれ以上、好ましくは1つから5つ、又は、より好ましくは1つ又は2つのビデオ・フレーム長さである時間的フラグメントの単位においてこれらのエンコーディング/デコーディングのステージの根底にあるオーディオ・コーデックに従属する。そのような各時間的フラグメントに対して、フレーム・グリッドは、それぞれの時間的フラグメントの始点に整列されるように選択される。言い換えれば、後述の実施の形態の根底にある考え方は、対応するビデオ・フレームと正確に同じ長さであるオーディオ・フラグメントを生み出すことである。このアプローチは、2つの利点がある。
1)オーディオ・エンコーダは、最適化された/ネイティブのフレーム期間で作動することができ、フラグメント境界上にフレーム・グリッドを残す必要はない。
2)いかなるオーディオ遅延も、時間的フラグメントのエンコードされた表現に対して即時プレイアウト情報の使用により補償されることができる。スプライシングは、各フラグメント境界で生じることができる。これは、ブロードキャスト機器の全体的な複雑さを著しく減少する。
図1は、以下に示す例による方法で生成されるオーディオ・フラグメントに対する一例を示す。そして、オーディオ・フラグメントは、対応するビデオ・フラグメントに付随する。オーディオ・フラグメントとビデオ・フラグメントとの両方は、図Bに対応する方法で図示されている。それは、2すなわち図1の上段であり、図1は、ビデオ・フラグメントをフレーム4すなわちビデオ・フレームの数Nから構成されるように図示する。ここで、フレームは、時間軸tで図示される時間的プレイアウト順序に沿って左から右まで列方向に連続的に配置される方形として示されている。フレーム0の左端とフレーム59の右端とは、フラグメントの始点と端として登録されることを示しており、このことは、フラグメントの時間的長さTfragmentが、ビデオ・フレーム長さの整数倍数であることを意味し、ここで、整数倍数Nは、模範的に60である。時間的にビデオ・フラグメント2に整列されて、図2は、その下に、フレームの単位又はアクセス・ユニット12におけるビデオ・フラグメント2に付随するオーディオ・コンテンツをそこでエンコードするオーディオ・フラグメント10を図示し、ここで長方形が水平にすなわち時間的に延びるように図示され、その時間的ピッチはその時間的フレーム長さを図示し、このオーディオ・フレーム長さは、残念なことに、オーディオ・フラグメント10の時間的長さTfragmentがフレーム長さTframeの整数倍数ではないほどのものである。フレーム長さTframeと対応するビデオ・フレームのフレーム長さTvideoframeとの間の関係は、それらの間の比が無理数であるか完全に減縮されて適切な分数で表現されることができる比であるほどのものであり、ここで、分母に対する分子が例えば1000よりも高く、その結果、ビデオ・フレーム長さTvideo frameとオーディオ・フレーム長さTframeとの両方の倍数であるフラグメント長さは、不利なほど高い。
図1は、したがって、最後または後行のフレームすなわちアクセス・ユニット46が、オーディオ・フラグメント10の後行端14を上回るオーディオ・コンテンツの時間的部分を時間的にカバーすることを図示する。後ほど、後行端14を上回るか後続する部分16がプレイアウト中にデコーダ・サイドで端を切られるか無視されること、または、時間的フラグメント10と重複するまで後行フレームの部分の「時間的ホール」を満たすように全体の後行フレームが実際はその内部的な状態を単に洗い流すデコーダでエンコードされないこと、は示される。
図示の目的のために、図1は、その下半分で、すなわち16で、ビデオとオーディオとから構成される時間的フラグメントに利用可能なビット・バジェットが、中でフラグメント2のビデオ・フレーム4がコードされるビデオ・データ18と、中でオーディオ・フラグメント10のオーディオ・コンテンツがコードされるオーディオ・データ20と、ヘッダ・データ22および24の両方のそれぞれと、例えば空間分解能、時間分解能、等々を示唆しビデオ・フレーム4がデータ18にコードされる構成データ26と、例えば、ビデオとオーディオとが利用可能なバージョン、ビットレートが異なるバージョン、を示唆するためにフラグメント2のオーディオ・フレーム12が共に整列されたフラグメント2および10に対してデータにここに例示的に含まれるマニフェストまたはメディア・プレゼンテーション・ディスクリプションだけでなくデータ20にコードされるチャンネルの数のような構成と、を運搬するために用いられることができることを図示する。図1の例が単に例示であり、後述する実施の形態が、ビットレート適応型ストリーミングとの関係で用いられることとマニフェストをクライアント等々に送付することとに制限されないことは、理解されるべきである。図1は、オーディオ・フレーム12を、順番に例えばビデオ・フレーム4に完全に整列されるように選択されるフラグメント10の始点30に整列してオーディオ・フラグメンテーションがビデオ・フラグメンテーションに対して完全に整列された状態にされるという以下に説明される実施の形態の一般的な概念を単に図示するものである。
このようにして、図1は、オーディオおよびビデオ・フラグメントを示しており、両方とも先に説明された方法で整列されている。図1の例において、ビデオおよびオーディオ・フラグメントは、59.94HzのNTSCフレーム・レートで60ビデオ・フレームに等しい1001 / 1000sec = 1.001秒の一定の時間的長さTfragmentを有するように選択された。
各オーディオ・フラグメントの最後のオーディオ・フラグメント、ここではAU 46、は、例えばフラグメント期間に適合するように端を切られる。与えられた例において、最後のオーディオ・フレームは、サンプル47104から48127まで到達し、0ベースのナンバリングが選択される、すなわち、フラグメントの中の第1のオーディオ・サンプルが0と番号付けされる。これは、必要とされるよりも若干長いサンプルの番号、すなわち48048の代わりに48128、のフラグメント・サイズにつながる。それゆえ、最後のフレームは、944番目のサンプルの後に切り取られる。これは、例えば、ヘッダ・データ24又は構成データ26において含まれる編集リストを用いることにより付随されることができる。切り取られた部分16は、例えば、より低い品質でエンコードされることができる。あるいは、全てのオーディオ・フレーム12を伝送するのではなく、例えば、最後のフレーム、ここでは例示的にAU 46、のコーディングを除く可能性がある。なぜなら、デコーダが通常、オーディオ構成に依存して洗い流されることができるからである。
さらに以下に説明する実施の形態において、例えば、重なり合うウインドウ関数上で動作するデコーダが、その履歴を喪失し、そして、次のフラグメントの第1のフレームに対する完全なシグナルを生成することができないという問題を和らげるための対策が講じられることは、示される。そのため、第1のフレーム、図1において例示的にAU0、は、即時プレイアウトを許容するIPFフレームとしてコードされる(IPF=Immediate Playout Frame)。同様に、第1のビデオフレーム4は、IDRフレームであってもよい(IDR = Instantaneous Decoding Refresh)。
Figure 2018514976
上の表は、最適化が全く適用されない場合に、期待されるビットレート・オーバーヘッドのための例を示す。オーバーヘッドが、使用されるフラグメント期間Tfragmentに強く依存するということは、見られる。ブロードキャスタの要求に依存して、毎第2又は第3のフラグメントのみをそれぞれ整列する、すなわち、オーディオ・フラグメントをより長くなるように選択することは、実行できる。
図2は、エンコードされたデータ・ストリーム34にフラグメント・グリッド32の時間的フラグメント10の単位におけるオーディオ・コンテンツをエンコードするためのエンコーダを示す。エンコーダは、一般的に、符号20を用いて示され、そして、エンコーディング・ステージ36とフラグメント・プロバイダ38とを備える。エンコーディング・ステージ36は、フレーム・グリッドのフレーム12の単位においてオーディオ・コンテンツをエンコードするように構成され、フラグメント・プロバイダ38は、時間的フラグメント10の単位においてエンコーディング・ステージ36にオーディオ・コンテンツ31を提供するように構成され、その結果、各時間的フラグメントは、エンコーディング・ステージ36によってそれぞれの時間的フラグメント10のエンコードされた表現38にエンコードされ、ここで、フラグメント・プロバイダ38は、フレーム12のそれぞれのフレーム・グリッドの各時間的フラグメントがそれぞれの時間的フラグメント10の始点30に時間的に整列されるように時間的フラグメント10の単位においてエンコーディング・ステージ36にオーディオ・コンテンツ31を提供するように構成され、その結果、始点30は、フレーム12のそれぞれのフレーム・グリッドのフレーム境界42と一致する。つまり、後述するように、フラグメント・プロバイダ38は、エンコーディング・ステージ36と、現在提供される時間的フラグメント10を含むオーディオ・コンテンツ31の部分44と任意に現在の時間的フラグメント10に時間的に先行するオーディオ・コンテンツ31の部分46とを伴う時間的フラグメント10と、現在の時間的フラグメント10に時間的に後続する部分48と、を提供してもよい。現在の部分44でエンコーディング・ステージ36を提供するとき、フレーム境界42が現在の時間的フラグメント10の始点30に一致する1つのフレーム境界を含むほどに、現在の時間的フラグメント10は、フラグメント・プロバイダ38によって時間的に整列される50。図1に関して上述したように、時間的フラグメント10の時間的長さがフレーム12の時間的長さの非整数倍数であるという事実のために、後行フレーム12aは、オーディオ・コンテンツの後続部分48をカバーするその部分16で時間的フラグメント10を単に部分的にカバーするか時間的に重複する。
図2のエンコーダの機能を詳細に説明する前に、図3を参照することとし、図3は、一実施形態による対応するデコーダを示す。図3のデコーダは、一般的に参照符号60を用いて示され、エンコードされたデータ・ストリームから時間的フラグメント10の単位におけるオーディオ・コンテンツ31をデコードするように構成される。デコーダ60は、時間的フラグメントのエンコードされた表現に到達するインプット・インターフェイス62を備える。図3に図示されるように、ハッチングを用いて図2に関して既に説明されたように、各時間的フラグメント10に対して、そのエンコードされた表現40は、データ・ストリーム34の中に存在する。各エンコードされた表現40は、それぞれの時間的フラグメント10の始点30に時間的に整列された前述のフレーム12の単位において関連した時間的フラグメント10をそこでエンコードしており、その結果、始点30は、フレーム・グリッドのフレーム境界42に一致する。
デコーダ60は、エンコードされた表現40から時間的フラグメント10の再構築されたバージョン66をデコードするように構成されたデコーディング・ステージ64を更に含む。つまり、デコーディング・ステージ64は、各時間的フラグメント40に対して、それぞれのエンコードされた表現40が所属する時間的フラグメント10によってカバーされるオーディオ・コンテンツの再構築されたバージョン66を出力する。
フラグメント10の個別のフレーム・グリッドがそこで登録されるので、フラグメント・グリッドのフラグメント境界すなわちフラグメント・グリッドの始点30に一致するように、デコーダ60は、時間的フラグメントの再構築されたバージョン66の始点を整列することに加えて、生得的に、時間的フラグメント10の再構築されたバージョン66を、プレイアウトに対して、結合する(join)ように構成されるジョイナ68を更に備える。
このようにして、図2および図3のエンコーダ20およびデコーダ60は、以下のように動作する。第1の又は先導するフレーム12bが即時に始点30で開始するように、すなわち、時間的フラグメント10の始点と第1のフレーム12bとが一致するように、フレーム12のフレーム・グリッドが対応する時間的フラグメント10の始点30に整列されるように、エンコーダ20は、各時間的フラグメント10を対応するエンコードされた表現40にエンコードする。エンコーディング・ステージ36が単に部分的に時間的フラグメント10に重複する後行フレーム12aをどのように取り扱うかという問題は、以下に述べるように、異なって解決されることができる。さらに、エンコーディング・ステージ36が各時間的フラグメント10に対してそのフレーム・グリッドを再整列するので、エンコーディング・ステージ36は、完全に自己完結した方法ですなわち他の時間的フラグメントから独立して、時間的フラグメント10をそれらに対応するエンコードされた表現40にエンコードする。にもかかわらず、即時プレイアウトが各時間的フラグメントに対してデコーディング・サイドで許容されるように、エンコーディング・ステージ36は、時間的フラグメント10をそれらの対応するエンコードされた表現40にエンコードする。可能な実施の形態の詳細は、以下に説明される。同様に、デコーダ60は、各エンコードされた表現40から対応する時間的フラグメント10の再構築されたバージョン66を再構築する。再構築されたバージョン66は、対応する時間的フラグメント10と同程度に長くてもよい。この目的のために、更に以下に述べるように、デコーディング・ステージ64は、再構築されたバージョン66の時間的長さを時間的フラグメント10の時間的長さにまで拡張するために、洗い流しを実行してもよいし、又は、デコーディング・ステージ64およびジョイナ66は、以下に述べるように、時間的フラグメントの時間的長さをさもなければ上回る再構築されたバージョン66の時間的部分をその端を切る又は無視するために、協働してもよい。デコーディング・ステージ64は、エンコードされた表現40のデコーディングを実行するとき、再びフレーム・グリッドを使用する、すなわち、フレーム12の単位でデコーディングを実行し十分にエンコーディング・プロセスの逆を実行する。
以下では、エンコーディング・ステージ36がまた後行フレーム12aを対応するエンコードされた表現40にエンコードすることに関与する可能性と、デコーダが再構築されたバージョン66の対応する突出する部分の端を切ることに関与する可能性と、を議論する。特に、この例によると、エンコーディング・ステージ36とフラグメント・プロバイダ38とは、現在の時間的フラグメント10に対して、エンコードされた表現40へのこの時間的フラグメント10のエンコーディングが後行フレーム12aが関与するまで現在の時間的フラグメント10の後行端70を超えて継続するように、協働してもよい。すなわち、エンコーディング・ステージ36はまた、オーディオ・コンテンツの突出する部分16をエンコードされた表現40へエンコードする。しかし、そのようにするとき、エンコーディング・ステージ36は、エンコードされた表現40へ後行フレーム12aをエンコードするために使われるビットレートを、突出する部分16から後行フレーム12aの残りの部分すなわち現在の時間的フラグメント10に時間的に重複する部分へ移してもよい。例えば、エンコーディング・ステージ36は、後行フレーム12aの他の部分がエンコードされた表現40にコードされる品質、すなわち現在の時間的フラグメント10に属する品質と比較して、突出する部分16がエンコードされた表現40にコードされる品質を低下してもよい。その場合において、デコーディング・ステージ64は、それゆえに、このエンコードされた表現40から、時間的フラグメント10の時間的長さを時間的に上回る、すなわち後行フレーム12aの突出する部分16が関与するまで、対応する時間的フラグメント10の再構築されたバージョン66をデコードする。ジョイナ68は、フラグメント・グリッドで、すなわちフラグメントの始点30で、再構築されたバージョン66を整列するとき、突出する部分16で再構築されたバージョン66のその端を切る。すなわち、ジョイナ68は、プレイアウトにおける再構築されたバージョン66の部分16を無視する。この部分16が上述するようにより低い品質でコードされているという事実は、それゆえに再構築されたオーディオ・コンテンツ31´の聴取者に対して明白であり、これは、この部分がプレイアウトにおいて次の時間的フラグメント10の再構築されたバージョンの始点によって取って代わられるので、アウトプット・ジョイナ68で再構築されたバージョン66の結合の結果である。
あるいは、エンコーダ20は、現在の時間的フラグメント10をエンコードするとき後行フレーム12aを除くように動作してもよい。代わりに、更に下に例示的に説明されるように内部的な状態を洗い流すことによって、デコーダは、時間的フラグメント10のエンコードされていない部分、すなわち後行フレーム12aが部分的に重複する部分、を充填することに関与してもよい。すなわち、エンコーディング・ステージ36とフラグメント・プロバイダ38とは、現在の時間的フラグメント10に対して、エンコードされた表現40へのこの時間的フラグメントのエンコーディングが後行フレーム12aに即時に先行するフレーム12で捕らえるように、協働してもよい。エンコーディング・ステージは、エンコードされた表現40の範囲内で、後行フレーム12aに即時に先行するフレーム12までエンコーダの内部的な状態自体を明らかにするようにエンコーダの内部的な状態を洗い流す手段によって、時間的フラグメント10の残りのこのようにエンコードされていない部分、すなわち後行フレーム12aに重複する部分を充填するようにデコーダに指示するフラッシュ信号を知らせてもよい。デコーダ・サイドで、コーディング・ステージ64は、対応するエンコードされた表現40をデコードするときに、後行フレーム12aの即時に先行するフレーム12までデコーディング・ステージ64の内部的な状態自体を明らかにするようにデコーディング・ステージ64の内部的な状態を洗い流すことによって時間的フラグメント10と後行フレーム12aとが重複する部分の範囲内でこのエンコードされた表現40に対応する時間的フラグメント10の再構築されたバージョン66を生成するために、このフラッシュ信号に敏感であってもよい。
より詳細にフラッシングの手順を説明するために、図4を参照して、変換コーデックに基づいて動作するエンコーディングおよびデコーディング・ステージの例示的な場合に対して再構築されたバージョン66のエンコードされていない残り部分を生成するという場合を図示する。例えば、ラップ変換は、フレームをエンコードするために用いられてもよい。すなわち、エンコーディング・ステージ36は、MDCT又はそのようなものである周波数分解変換の使用によって結果的にウインドウ化された部分のスペクトル的な分解を伴ってオーディオ・コンテンツの対応するインターバル74に重みを加えるために複数のウインドウのうちの1つのウインドウ72を使用する。ウインドウ化された部分74は、現在のフレーム12´の境界をカバーし、越えて時間的に展開する。図4は、例えば、ウインドウ72又はウインドウ化された部分74が現在のフレーム12´に後続する二つのフレームで現在のフレーム12´に先行する二つのフレーム12に時間的に重複することを図示する。このようにして、現在の時間的フラグメント10に対するエンコードされた表現40は、ウインドウ化された部分74の変換のコーディングを含み、このコーディング76がフレーム12´のコードされた表現である。デコーディング・ステージ64は、時間的フラグメント10のフレーム12を再構築するために逆を実行する:それは、例えば、エントロピー・デコーディングを用いて変換76をデコードし、変換76が属する現在のフレーム12´をカバーするウインドウ化された部分74に帰着するために逆変換を実行し、しかしデコーディング・ステージ64は、オーディオ・コンテンツ31´の最後の再構築を得るために連続したウインドウ化された部分74間でオーバーラップ加算処理を付加的に実行する。オーバーラップ加算処理は、ジョイナ68によって実行されてもよい。このことは、次のことを意味する:図4は、例えば、現在のフレーム12´が現在の時間的フラグメント10の後行フレーム12aに即時に先行する最後から2番目のフレームであるということを想定している。デコーディング・ステージ64は、ウインドウ化された部分74の範囲内で時間領域部分76を得るために変換76へ逆変換を、概要で述べたように、実行することによって最後から2番目のフレーム12´によってカバーされるオーディオ・コンテンツを再構築する。上で述べたように、この時間領域部分76は、現在のフレーム12´に時間的に重複する。現在のフレーム12´の時間的に隣接するフレームのコードされた変換を逆に変換することによって得られた他の時間領域部分は、しかし、現在のフレーム12´にも時間的に重複する。
図4において、これは、現在のフレーム12´の二つの先行するフレームに属し、符号78および80で示唆されるウインドウ化された部分について図示される。フレーム12´の完全な再構築は、しかし、現在のフレーム12´を時間的にオーバーラップしているので、フレーム12´のコードされた変換76に適用される逆変換に起因しそのフレームに隣接する全ての時間領域部分76、78および80の部分を加算するオーバーラップ加算処理によって得られる。たとえエンコーディング・ステージ36がエンコードされた表現40へこの後行フレーム12aに対するウインドウ化された部分の変換をコードしないとしても、1つ又はそれ以上の前のフレームの、すなわち図4と比較して変化してもよいウインドウ・サイズに依存する最後から2番目のフレーム12´に先行する任意に1つ又はそれ以上のフレーム12のコードされた変換76を逆変換することによって得られるので、デコーダは、後行フレーム12aに時間的にオーバーラップしている全ての時間領域部分を加算することによってこの後行フレーム12aの範囲内でオーディオ・コンテンツの見積もりを得ることができる。例えば、ウインドウ・サイズは、時間的に先行するフレームとの時間的な重複が後続フレームとの時間的な重複よりも大きいようになっていてもよい。さらにその上、時間的な重複は、現在のコードされたフレームの即時に先行する及び/又は直後に続くフレームを単に含んでもよい。
異なった可能性は、デコーダ60が突出する部分16のサイズを通知される方法に関して存在する。例えば、デコーダ60は、フレーム長さ値とフラグメント長さ値とを含む端切断情報を介してデータ・ストリーム34の範囲内でこのサイズに関連して端切断情報を伝えるように構成されてもよい。フレーム長さ値は、Tframeとフラグメント長さ値Tfragmentとを示唆することができる。もう一つの可能性は、端切断長さ値が突出する部分16それ自身の時間的長さ、又は、時間的フラグメント10と後行フレーム12aとが時間的に重複する場所である部分の時間的長さを示唆するということである。各時間的フラグメント10の再構築されたバージョン66の即時プレイアウトを許容するために、エンコーディング・ステージ36とフラグメント・プロバイダ38とは協働することができ、その結果、各時間的フラグメント10に対して、エンコードされた表現40はまた、それぞれの時間的フラグメント10に時間的に先行する部分46に関連する即時プレイアウト情報を供給される。例えば、図4に関連するラップ変換がMDCTのようなエイリアシングを導入するラップ変換であることを想像してください。その場合において、先行する部分46の変換コードされたバージョンなしに、デコーダは、現在の時間的フラグメント10をその始点で、例えばエイリアシングなしにその第1の1つ又はそれ以上のフレーム12の範囲内で、再構築することはできない。したがって、オーバーラップ加算処理の手段で時間領域エイリアシング消去を実行するために、エンコードされた表現40の範囲内で伝えられる即時プレイアウト情報は、図4に関して既に図示されたようにラップ変換コーディング処理を用いてエンコーディングおよびデコーディング・ステージで先行する部分46の変換コードされたバージョンに適用される。
上記ではより詳細には議論されていなかったにも関らず、エンコーディング・ステージ36および/又はデコーディング・ステージ64が2つ又はそれ以上のコアから構成されることは、特筆される。例えば、図2は、エンコーディング・ステージが第1のエンコーディング・コア90と第2のエンコーディング・コア92と等々とを含むことを図示し、さらに又はあるいは、図3は、デコーディング・ステージ64が第1のデコーディング・コア94と第2のデコーディング・コア96とを含むことを示す。それぞれの時間的フラグメント10と対応するエンコードされた表現40とを連続的にエンコーディング/デコーディングする代わりに、時間的フラグメント10およびエンコードされた表現40のこれらの対のそれぞれに関して実行されるエンコーディング/デコーディング手順は、それぞれ、時間的フラグメント10およびエンコードされた表現40の連続のデコーディング/エンコーディングで交互に係合するコア94および96(および90および92)でパイプライン方式で実行される。
このようにして、図2の実施の形態によると、オーディオ・エンコーダは、それぞれの時間的フラグメント10の始点30で第1のオーディオ・フレーム12bを整列する。デコーディング・サイドで可聴人工物なしにその時間的フラグメント10のそれぞれの構築されたバージョン66のギャップレス又は即時プレイアウトを可能にするために、上述のエンコーダは、フラグメント境界で2つの異なったフレーム・グリッド上で動作し又は言葉で表す。フラグメントの始点30で個別の再構築されたバージョン66の即時プレイアウトを考慮に入れるために、エンコーディング/デコーディング・ステージの基礎をなすオーディオ・コーデックに依存して、即時プレイアウト情報は、エンコードされた表現の範囲内で伝えられることができるが、また言及された。例えば、各時間的フラグメントの第1のフレーム12bは、即時プレイアウト・フレームIPFとしてコードされてもよい。各新時間的フラグメントの始点に配置されるそのようなIPFは、例えば、全体のデコーダ遅延をカバーする。このことを再び図示するために、図5を参照されたい。図5は、2つの時間的フラグメント10aおよび10bの間のフラグメント境界周辺にオーディオ・コンテンツの外側部分を示す。時間的フラグメント10aおよび10bがコード/デコードされる単位におけるフレーム12は、図5に同様に示されている。特に、図5は、時間的フラグメント10aの後行フレーム12aが、時間的フラグメント10bがコード/デコードされるフレーム・グリッド・ユージングのフレームの第1のフレーム12bに時間的に重複することを明らかにする。特に、時間的フラグメント10bの第1のフレーム12bと時間的に重複するのは、時間的フラグメント10aの後行端と後行フレーム12aの時間的フラグメント10bの始点30とを越えて延びる部分16である。第1のフレーム12bをエンコードするとき、エンコーディング状態は、時間的フラグメント10bに対してエンコードされた表現40に即時プレイアウト情報98を、すなわちここでは例示的に第1のフレーム12bに先行する時間的フラグメント10bをコード/デコードするためのフレーム・グリッドの5つのプレロール・フレーム12のコーディング100をさらにエンコードする。プレロール・フレームは、図1において“AU‐5”から“AU‐1”によって示されている。これらのプレロール・フレームは、このようにして上述の先行する部分46に及ぶ。エンコーディング100は、図4に関して上で概説したように、逆変換を用い、そして、オーバーラップ加算処理において時間領域エイリアシング消去を実行するために時間的フラグメント10bに延びるそれらの部分を用いるこれらのロール・フレームを取り囲む時間領域部分を用いる時間領域エイリアシング消去を実行することをデコーダ・サイドに許すために、プレロール・フレームの範囲内でオーディオ・コンテンツの変換コーディング・バージョンに関連する。
エンコーダは、正確なフラグメント期間を認識している。上述のとおり、実施の形態によると、重複するオーディオ・パート16は、異なるフレーム・グリッドで2度エンコードされてもよい。
簡単な声名は、個別の時間的フラグメント10がそれらのエンコードされた表現40にコードされる「自己完結した方法」に関して実行される。この自己完結した方法は、エンコードされたオーディオ・チャンネル又はそのようなものの数のようなめったに変化しないデータに適用されるコーディング・パラメータのような構成データにもまた適用されることができるにも関らず、その結果、各エンコードされた表現40はこの構成データを含み、そのようなめったに変化しないデータすなわち構成データが各エンコードされた表現40に含まれるのではなく各エンコードされた表現40の範囲外でバンドの外側にあるデコーディング・サイドに伝えられることは、交互に可能である。仮にエンコードされた表現に含まれるのであれば、構成データは、もう一つの輸送層に伝送されてもよい。例えば、当該構成は、初期化セグメントに伝送されてもよく、そして、各時間的フラグメントのIPFフレーム12bは、構成データ情報を伝送することから解放されることができる。
デコーディング・サイドに関する限り、図3に関する上記説明は、デコーダがプレロール・フレームすなわち各時間的フラグメントに対する第1のフレーム12bに先行するフレームをデコードするように構成されることを明らかにする。デコーダは、構成が先行する時間的フラグメントから現在の時間的フラグメントまで変化するかどうかに関係なく、このデコーディングに関与することができる。これはもちろん、デコーダの全体的な性能に影響を与えるが、好都合なことに、デコーダは、デコーダが各時間的フラグメント境界上で、例えば最悪の適応型ストリーミングの使用例によると、IPFをデコードすることができるという要件を既に満たしていなければならず、その結果、そのような場合には追加の要件は課せられない。上述の端切断情報に関する限り、そのシグナリングは、ビットストリーム・レベル上で、またはシステム・レベル・ツールを伴うような他の輸送層で、なされてもよいことに注意されるべきである。
最後に、図6は、エンコードされるべきオーディオ・コンテンツ31が、時間110における点で、すなわち2つの時間的フラグメント10の間のフラグメント境界で、多数のオーディオ・チャンネルにおける変化のような構成変化を示す場合を示す。例えば、タイム・インスタント110の直前、ステレオのような第1の構成は適用され、一方、タイム・インスタント110の後、オーディオ・コンテンツ31は、例えば、5チャンネル・オーディオ・シーンである。オーディオ・データ・ストリーム34は、構成データ情報を含む。このようにして、タイム・インスタント110に先行する時間的フラグメントのデータ・ストリームのエンコードされる表現が第1の構成によりコードされることと、第2の構成がタイム・インスタント110に後続する時間的フラグメント10をエンコードするために用いられることと、は、データ・ストリーム34から明らかである。図6はまた、エンコードされた表現40の即時プレイアウト情報98を示す。タイム・インスタント110に先行する時間的フラグメント10の場合において、即時プレイアウト情報98は、例えば、図5に関して、上述のように引き出されてもよい。しかし、その状況は、タイム・インスタント110で即時に開始する時間的フラグメント10に対して異なっている。ここでは、第2の構成におけるオーディオ・コンテンツ39がタイム・インスタント110の前の時刻で昇降可能ではないので、オーディオ・コンテンツ39は、タイム・インスタント110で即時に開始する時間的フラグメントのエンコードされた表現40に対して即時プレイアウト情報98を形成することを考慮に入れない。代わりに、ゼロ信号は、タイム・インスタント110で開始するこの時間的フラグメント10に関して即時プレイアウト情報98としてコードされてもよい。すなわち、構成変化の場合において、エンコーダは、例えば、モノから5.1又はそのようなものに切り替えるときのような過去に対して実際に利用可能なオーディオ・シグナルは存在しないので、ゼロ・サンプルをエンコードしてもよい。可能な最適化は、デコーダ・サイド上でこのゼロ・フレームすなわちゼロ・プレロール・フレームを生成することになっており、そして第1の時間的フラグメントの第1のフレーム12bのエンコーディングのみを伝送することになっている。すなわち、そのような場合において即時プレイアウト情報は、完全に放置されることができる。
このようにして、上述の実施の形態は、調整された又は可変のビットレートのどちらかで伝送チャンネルを越えてオーディオおよびビデオ・コンテンツの送付を許容し、特に、オーディオ・ビデオ同期とスプライシングのような高度な使用例とを許容する。上述のとおり、上記でエンコードされたようなエンコードされたデータ・ストリームはまた、他のメディア・シグナルによって指示されるクロックのような他のクロックで同期をより簡単な状態にしてもよい。上記で説明されたエンコーダは、既存のオーディオ・フレーム長さの適応を考慮に入れる。時間的フラグメントの長さは、アプリケーションの要求に応じて定められてもよい。エンコーダの実施の形態は、例えば、排他的ではなく、メディア表現のフラグメントとしてこれらのフラグメントを用いることによって適応型ストリーミングの主題にされることができる時間的フラグメントのエンコードされた表現の一部分においてエンコードされたデータ・ストリームを形成する。すなわち、結果的として生じるフラグメントから構成されるコードされたデータ・ストリームは、適応型ストリーミング・プロトコルを介してサーバによってクライアントに提供されてもよく、クライアントは、プロトコルを介して、おそらく、そこで挿入された加算を用いてデータ・ストリーム・フラグメントを回収してもよく、そしてデコーディングのためにデコーダにデータ・ストリーム・フラグメントを送ってもよい。しかし、これは、必須ではない。むしろ、スプライシングは、他のアプリケーション・シナリオにおいてさえ本発明のエンコードされたデータ・ストリームの形成によって有利に影響され得る。上記で説明された実施の形態は、オーディオ・フレームがMPEG−Hオーディオ・フレームであるMPEG−Hオーディオ・コーデックとの関係で実施または使用されてもよいが、しかし上記の実施の形態は、このコーデックの使用に制限されるのではなく全ての(現代の)オーディオ・コーデックに適応されてもよい。
いくつかの側面は、機械の文脈で説明されてきたが、これらの側面が対応する方法の説明も表現することは明らかであり、ここでブロックまたはデバイスは、方法ステップまたは方法ステップの特徴に対応する。同様に、方法ステップの文脈で説明された側面はまた、対応するブロックもしくはアイテムまたは対応する機械の特徴の説明を表現する。方法ステップのいくつか又は全部は、ハードウェア機械、例えば、マイクロプロセッサ、プログラマブル・コンピュータまたは電子回路(を用いること)によって実行されてもよい。いくつかの実施の形態において、最も重要な方法ステップの一つ又はそれ以上は、そのような機械によって実行されてもよい。
本発明のスプライスされた又はスプライス可能なオーディオ・データ・ストリームは、デジタル・ストレージ媒体に格納されることができ、または、伝送媒体例えば無線伝送媒体もしくはインターネットのような有線伝送媒体で伝送されることができる。
特定の実施の形態の要求に応じて、本発明の実施の形態は、ハードウェアまたはソフトウェア内で実施されることができる。実施の形態は、その上に格納され電子的に読み込み可能なコントロール・シグナルを有し、それぞれの方法が実行されるようにプログラマブル・コンピュータ・システムと協働する(または協働することが可能である)デジタル・ストレージ媒体、例えばフロッピーディスク、DVD、Blu‐Ray、CD、ROM、PROM、EPROM、EEPROMまたはフラッシュ・メモリを用いて実行されることができる。それゆえ、デジタル・ストレージ媒体は、コンピュータ読み込み可能である。
本発明によるいくつかの実施の形態は、電子的に読み込み可能なコントロール・シグナルを有しているデータ・キャリアを含み、電子的に読み込み可能なコントロール・シグナルは、本願明細書で説明された方法の一つが実行されるように、プログラマブル・コンピュータ・システムと協働することが可能である。
一般的に、本発明の実施の形態は、プログラム・コードを伴うコンピュータ・プログラム製品として実施されることができ、プログラム・コードは、コンピュータ・プログラム製品がコンピュータ上で稼働するときに方法の一つを実行することに対して動作的である。プログラム・コードは、例えば、マシン読み込み可能なキャリア上に格納されてもよい。
他の実施の形態は、マシン読み込み可能なキャリア上に格納される、本願明細書で説明される方法の一つを実行するためのコンピュータ・プログラムを含む。
言い換えれば、本発明の方法の実施の形態は、それゆえ、コンピュータ・プログラムがコンピュータ上で稼働するとき、本願明細書で説明される方法の一つを実行するためのプログラム・コードを有しているコンピュータ・プログラムである。
本発明の方法の更なる実施の形態は、それゆえ、そこで記録され、本願明細書で説明される方法の一つを実行するためのコンピュータ・プログラムを含むデータ・キャリア(またはデジタル・ストレージ媒体、またはコンピュータ読み込み可能な媒体)である。データ・キャリア、デジタル・ストレージ媒体または記録された媒体は、典型的に有形的および/または非移行的である。
本発明の方法の更なる実施の形態は、それゆえ、データ・ストリームまたは本願明細書で説明される方法の一つを実行するためのコンピュータ・プログラムを表現する信号の連続である。データ・ストリームまたは信号の連続は、例えば、データ・コミュニケーション接続を介して、例えばインターネットを介して、転送されるように構成されてもよい。
更なる実施の形態は、本願明細書で説明される方法の一つを実行するように構成され又は適用された処理手段、例えばコンピュータまたはプログラマブル・ロジック・デバイスを含む。
更なる実施の形態は、そこでインストールされ、本願明細書で説明される方法の一つを実行するためのコンピュータ・プログラムを有するコンピュータを含む。
本発明による更なる実施の形態は、本願明細書で説明される方法の一つを実行するためのコンピュータ・プログラムをレシーバに転送(例えば、電子的に又は光学的に)するように構成された機械又はシステムを含む。レシーバは、例えば、コンピュータ、モバイル・デバイス、メモリ・デバイスまたはそのようなものであってもよい。機械又はシステムは、例えば、コンピュータ・プログラムをレシーバに転送するためのファイル・サーバを含んでもよい。
いくつかの実施の形態において、プログラマブル・ロジック・デバイス(例えば、フィールド・プログラマブル・ゲート・アレイ)は、本願明細書で説明される方法の機能のいくつか又は全部を実行するために使用されてもよい。いくつかの実施の形態において、フィールド・プログラマブル・ゲート・アレイは、本願明細書で説明される方法の一つを実行するためにマイクロプロセッサと協働してもよい。一般的に、方法は、ハードウェア機械によって実行されることが好ましい。
本願明細書で説明される機械は、ハードウェア機械を用いて、またはコンピュータを用いて、またはハードウェア機械とコンピュータとの組み合わせを用いて実施されてもよい。
本願明細書で説明される方法は、ハードウェア機械を用いて、またはコンピュータを用いて、またはハードウェア機械とコンピュータとの組み合わせを用いて実行されてもよい。
上記で説明した実施の形態は、本発明の原理のために、単に例示されているだけである。配置の修正および変更ならびに本願明細書において説明される詳細は他の当業者にとって明らかであるものと理解される。したがって、間近に迫った特許請求の範囲だけによってのみ制限され、本願明細書において実施の形態の説明および説明の方法によって示される具体的な詳細によっては制限されないことが意図される。
<定義と略語>
AAC アドバンスド・オーディオ・コーディング
ATSC 高度テレビジョン・システムズ委員会
AU オーディオ・アクセス・ユニット
DASH HTTPを越える動的適合型ストリーミング
DVB デジタル・ビデオ・ブロードキャスティング
IPF 瞬間プレイアウト・フレーム
MPD メディア・プレゼンテーション・ディスクリプション
MPEG ムービング・ピクチャ・エキスパーツ・グループ
MMT MPEGメディア伝送
NTSC 全米テレビジョンシステム委員会
PAL 位相反転線方式

Claims (21)

  1. エンコードされたデータ・ストリーム(34)へオーディオ・コンテンツをエンコードするためのエンコーダ(20)であって、
    オーディオ・フレーム(12)の単位で前記オーディオ・コンテンツをエンコードするように構成されるエンコーディング・ステージ(36)と、
    時間的フラグメント(10)の単位で前記エンコーディング・ステージ(36)に前記オーディオ・コンテンツ(31)を提供するように構成されるフラグメント・プロバイダ(38)と、を備え、
    前記エンコーダは、各時間的フラグメント(10)について、第1のオーディオ・フレームの始点と前記それぞれの時間的フラグメントの始点(30)とが一致するように前記それぞれの時間的フラグメント(10)へ前記オーディオ・フレーム(12)を整列しながらオーディオ・フレーム(12)の単位で前記それぞれの時間的フラグメントのエンコードされる表現(40)へ各時間的フラグメント(10)をエンコードするように構成され、
    前記時間的フラグメント(10)の前記エンコードされた表現は、前記エンコードされたデータ・ストリームに含まれ、前記時間的フラグメント(10)の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
    前記エンコーダは、前記エンコードされたデータ・ストリーム内で、前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分を特定するための端切断情報を信号で伝えるように構成され、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複し、前記端切断情報は、
    前記オーディオ・フレームの前記時間的長さを示すフレーム長さ値および前記時間的フラグメントの前記時間的長さを示すフラグメント長さ値および/又は
    前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの差を示す端切断長さ値を含み、前記後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて直後に続く時間的フラグメントに時間的に重複する、
    エンコーダ(20)。
  2. 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされた表現(40)への前記所定の時間的フラグメント(10)の前記エンコーディングが前記所定の時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの前記後行オーディオ・フレームに即時に先行するオーディオ・フレームで中止されるように協働し、当該後行オーディオ・フレームは、前記所定の時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、
    請求項1に記載のエンコーダ(20)。
  3. 前記エンコーディング・ステージは、前記所定の時間的フラグメントの前記エンコードされた表現(40)内で、表されている前記デコーダの内部的な状態を前記後行オーディオ・フレームに即時に先行する前記オーディオ・フレームまで洗い流すことに基づいて、前記後行オーディオ・フレームによってカバーされる前記所定の時間的フラグメントの部分を充填するようにデコーダに指示しているフラッシュ信号を知らせるように構成される、
    請求項2に記載のエンコーダ(20)。
  4. 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされる表現への前記所定の時間的フラグメントの前記エンコーディングが前記所定の時間的フラグメントがエンコードされる単位で前記オーディオ・フレーム(12)の前記後行オーディオ・フレーム内の前記所定の時間的フラグメントの後行端を越えて継続するように協働し、当該後行オーディオ・フレームは、前記所定の時間的フラグメントの後行端を上回り前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、
    請求項1に記載のエンコーダ(20)。
  5. 前記エンコーディング・ステージ(36)は、前記所定の時間的フラグメントの前記後行端を越えて前記直後に続く時間的フラグメントに時間的に重複している前記後行オーディオ・フレームの部分内で、前記所定の時間的フラグメン内よりも低い品質で、前記オーディオ・コンテンツをエンコードするように構成される、
    請求項4に記載のエンコーダ(20)。
  6. 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされた表現への前記所定の時間的フラグメントの前記エンコーディングが前記所定の時間的フラグメント(10)が前記それぞれの時間的フラグメントの前記エンコードされた表現(40)へエンコードされ前記即時プレイアウト情報を前記所定の時間的フラグメントの前記エンコードされる表現へコードする単位で前記オーディオ・フレームのうちの前記第1のオーディオ・フレームに即時に先行する前記オーディオ・コンテンツの1つ又はそれ以上のプレロール・オーディオ・フレームから即時プレイアウト情報(98)の導出を含むように協働する、
    請求項1ないし請求項5のいずれかに記載のエンコーダ(20)。
  7. 前記エンコーディング・ステージ(36)は、ラップ変換を導入するエイリアシングに基づいて変換コーディングを用いて前記エンコーディングを実行するように、そして、ラップ変換を導入する前記エイリアシングに基づく前記変換コーディングを前記1つ又はそれ以上のプレロール・オーディオ・フレームにおける前記オーディオ・コンテンツに適用することによって前記即時プレイアウト情報を引き出すように構成される、
    請求項6に記載のエンコーダ(20)。
  8. 前記エンコーディング・ステージ(36)は、
    第1のエンコーディング・コア(90)と第2のエンコーディング・コア(92)とを含み、
    前記フラグメント・プロバイダ(38)は、前記オーディオ・コンテンツの第1の時間的フラグメントをエンコードしながら前記第1のエンコーディング・コア(90)を係合するように構成され、前記第1のエンコーディング・コア(90)は、前記第1の時間的フラグメントの始点に前記オーディオ・フレームを時間的に整列しながらオーディオ・フレームの単位で前記オーディオ・コンテンツの前記第1の時間的フラグメントを係合するように構成され、その結果、前記オーディオ・コンテンツの前記第1の時間的フラグメントがエンコードされる単位における前記オーディオ・フレームのうちの前記第1のオーディオ・フレームが前記第1の時間的フラグメントのエンコードされる表現を出力するために前記第1の時間的フラグメントの始点で即時に開始し、そして前記フラグメント・プロバイダ(38)は、即時に前記第1の時間的フラグメントに後続して、前記オーディオ・コンテンツの第2の時間的フラグメントをエンコードしながら前記第2のエンコーディング・コアを係合するように構成され、前記第2のエンコーディング・コア(90)は、前記第2の時間的フラグメントの始点に前記オーディオ・フレームを時間的に整列しながらオーディオ・フレームの単位で前記オーディオ・コンテンツの前記第2の時間的フラグメントをエンコードするように構成され、その結果、前記オーディオ・コンテンツの前記第2の時間的フラグメントがエンコードされる単位における前記オーディオ・フレームのうちの前記第1のオーディオ・フレームが前記第2の時間的フラグメントのエンコードされる表現を出力するために前記第2の時間的フラグメントの始点で即時に開始し、
    前記プロバイダは、前記オーディオ・コンテンツの第3の時間的フラグメントをエンコードしながらまた前記第1のエンコーディング・コア(90)を係合するように構成される、
    請求項1ないし請求項7のいずれかに記載のエンコーダ。
  9. 前記フラグメント・プロバイダ(38)は、前記オーディオ・コンテンツの前記時間的フラグメントをエンコードするのと交互で前記第1および第2のエンコーディング・コア(90、92)を係合するように構成される、
    請求項8に記載のエンコーダ(20)。
  10. エンコードされたデータ・ストリームからオーディオ・コンテンツをデコードするためのデコーダ(60)であって、
    前記オーディオ・コンテンツの時間的フラグメントのエンコードされた表現を受信するように構成されるインプット・インターフェイス(62)であって、エンコードされた表現のそれぞれが前記それぞれの時間的フラグメントの始点に時間的に整列されるオーディオ・フレームの単位でそこにそれぞれの時間的フラグメントをエンコードし、その結果、前記それぞれの時間的フラグメントの前記始点が前記オーディオ・フレームのうちの第1のオーディオ・フレームの始点と一致するインプット・インターフェイス(62)と、
    前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの再構築されたバージョン(66)をデコードするように構成されるデコーディング・ステージ(64)と、
    プレイアウトのために、前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをともに結合する(join)ように構成されるジョイナ(68)と、を備え、
    前記フラグメント・グリッドのフラグメント境界の間の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
    前記ジョイナ(68)は、所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされる表現にコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分で所定の時間的フラグメントの前記再構築されたバージョン(66)をその端を切るように構成され、当該後行オーディオ・フレームの部分は、前記所定の時間的フラグメントの後行端を時間的に越えて直後に続く時間的フラグメントの再構築されたバージョンに時間的に重複し、
    前記デコーダは、前記エンコードされたデータ・ストリームにおける端切断情報に基づいて前記後行オーディオ・フレームの前記部分を決定するように構成され、前記端切断情報は、
    前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの時間的長さを示すフレーム長さ値、および前記所定のフラグメントの前記再構築されたバージョンの始点から、前記後続する時間的フラグメントの前記再構築されたバージョンの前記始点が一致する前記フラグメント境界までの、前記所定の時間的フラグメントの時間的長さを示すフラグメント長さ値、および/または
    前記後行オーディオ・フレームの前記部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの違いを示す端切断長さ値、を含む、
    デコーダ(60)。
  11. 前記デコーディング・ステージ(64)は、前記所定の時間的フラグメントの前記エンコードされた表現から所定の時間的フラグメントをデコードするとき、前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームのうちの後行オーディオ・フレームの部分の範囲内で前記所定の時間的フラグメントの前記再構築されるバージョンを生成し、当該後行オーディオ・フレームの部分は、前記後行オーディオ・フレームの先端から前記後行オーディオ・フレームに即時に先行するオーディオ・フレームまで表されている前記デコーディング・ステージの内部的な状態を洗い流すことによって後続する時間的フラグメントの再構築されるバージョンの前記フラグメント境界まで延伸する、
    請求項10に記載のデコーダ(60)。
  12. 前記デコーディング・ステージ(64)は、所定の時間的フラグメントの前記エンコードされた表現から即時プレイアウト情報を引き出すように構成され、前記即時プレイアウト情報は、前記時間的フラグメントの前記始点に直後に続く前記所定の時間的フラグメントの1つ又はそれ以上のオーディオ・フレームで前記オーディオ・コンテンツを再構築するために前記所定の時間的フラグメントの始点に時間的に先行し前記即時プレイアウト情報を用いる前記オーディオ・コンテンツの1つ又はそれ以上のプレロール・オーディオ・フレームで前記オーディオ・コンテンツに関連する、
    請求項10または請求項11に記載のデコーダ(60)。
  13. 前記デコーディング・ステージ(64)は、前記即時プレイアウト情報が前記1つ又はそれ以上のプレロール・オーディオ・フレームにおける前記オーディオ・コンテンツの再構築であるように構成される、
    請求項12に記載のデコーダ(60)。
  14. 前記デコーディング・ステージ(64)は、時間領域エイリアシング消去のために前記時間的フラグメントの前記始点に直後に続く前記所定の時間的フラグメントの1つ又はそれ以上のオーディオ・フレームで前記オーディオ・コンテンツを再構築するときに前記即時プレイアウト情報を用いるように構成される、
    請求項12又は請求項13に記載のデコーダ(60)。
  15. 前記デコーディング・ステージ(64)は、エイリアシングを引き起こすラップ変換の逆を個別的に用いて、そして前記フレーム境界を越えて展開する変換ウインドウを負っている前記オーディオ・フレームをデコードするように構成される、
    請求項10ないし請求項14のいずれかに記載のデコーダ。
  16. 前記デコーディング・ステージ(64)は、
    前記第1の時間的フラグメントの前記再構築されたバージョンが前記第1の時間的フラグメントの前記オーディオ・フレームのうちの第1のオーディオ・フレームの先端で開始するように、前記第1の時間的フラグメントのエンコードされた表現から前記オーディオ・コンテンツの第1の時間的フラグメントの再構築されるバージョンをオーディオ・フレーム単位でデコードするように構成される第1のデコーディング・コア(94)と、
    前記第2の時間的フラグメントの前記再構築されたバージョンが前記第2の時間的フラグメントの前記オーディオ・フレームのうちの第1のオーディオ・フレームの先端で登録されて始まるように、前記第2の時間的フラグメントのエンコードされた表現から前記第1の時間的フラグメントに直後に続く前記オーディオ・コンテンツの第2の時間的フラグメントの再構築されたバージョンをオーディオ・フレーム単位でデコードするように構成される第2のデコーディング・コア(96)と、を含み、
    前記ジョイナ(68)は、前記第1の時間的フラグメントの前記再構築されたバージョン(66)と前記第2の時間的フラグメントの前記再構築されたバージョンとをともに結合する(join)ように構成される、
    請求項10ないし請求項15のいずれかに記載のデコーダ。
  17. 前記第1のデコーディング・コアは、前記エンコードされたデータ・ストリームから、前記オーディオ・コンテンツの第3の時間的フラグメントの再構築されたバージョンもデコードするように構成される、
    請求項16に記載のデコーダ。
  18. 前記第1および第2のデコーディング・コアは、前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをデコードすることに交互に関与するように構成される、
    請求項16又は請求項17に記載のデコーダ。
  19. エンコードされたデータ・ストリーム(34)へオーディオ・コンテンツをエンコードするための方法(20)であって、フレーム(12)の単位で前記オーディオ・コンテンツをエンコードするように構成されるエンコーディング・ステージ(36)を用い、前記方法は、
    前記エンコーディング・ステージ(36)に時間的フラグメント(10)の単位で前記オーディオ・コンテンツ(31)を提供するステップと、
    前記エンコーディング・ステージによって実行されて、各時間的フラグメント(10)について、前記それぞれの時間的フラグメント(10)が前記それぞれの時間的フラグメントの前記エンコードされる表現(40)へエンコードされる単位で前記オーディオ・フレームの第1のオーディオ・フレームの始点と前記それぞれの時間的フラグメントの始点(30)とが一致するように前記それぞれの時間的フラグメント(10)に前記オーディオ・フレーム(12)を整列しながらオーディオ・フレーム(12)の単位で前記それぞれの時間的フラグメントのエンコードされる表現(40)へ各時間的フラグメント(10)をエンコードするステップと、を含み、
    前記時間的フラグメント(10)の前記エンコードされた表現は、前記エンコードされたデータ・ストリームに含まれ、前記時間的フラグメント(10)の時間的長さは、前記フレームの時間的長さの非整数倍数であり、
    前記方法は、前記エンコードされたデータ・ストリーム内で、前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分を特定するための端切断情報を信号で伝えるステップを含み、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複し、前記端切断情報は、
    前記オーディオ・フレームの前記時間的長さを示すフレーム長さ値および前記時間的フラグメントの前記時間的長さを示すフラグメント長さ値および/又は
    前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの差を示す端切断長さ値であって、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、端切断長さ値を含む、
    方法(20)。
  20. エンコードされたデータ・ストリームからオーディオ・コンテンツをフラグメント・グリッドの時間的フラグメントの単位でデコードするための方法(60)であって、
    前記オーディオ・コンテンツの時間的フラグメントのエンコードされた表現を受信するステップであって、エンコードされた表現のそれぞれが、前記それぞれの時間的フラグメントの始点に時間的に整列されるオーディオ・フレームの単位でそこにそれぞれの時間的フラグメントをエンコードして、前記それぞれの時間的フラグメントの前記始点が前記オーディオ・フレームのうちの第1のオーディオ・フレームの始点と一致するようになっている、受信するステップと、
    前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの再構築されたバージョン(66)をデコードするステップと、
    プレイアウトのために、前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをともに結合するステップと、を含み、
    前記フラグメント・グリッドのフラグメント境界の間の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
    前記結合するステップ(68)は、前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分で、所定の時間的フラグメントの前記再構築されたバージョン(66)をその端を切るステップを含み、当該後行オーディオ・フレームの部分は、前記所定の時間的フラグメントの後行端を時間的に越えて直後に続く時間的フラグメントの再構築されたバージョンに時間的に重複し、
    前記方法は、前記エンコードされたデータ・ストリームの端切断情報に基づいて前記後行オーディオ・フレームの前記部分を決定するステップを更に含み、
    前記端切断情報は、
    前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの時間的長さを示すフレーム長さ値、および前記所定のフラグメントの前記再構築されたバージョンの始点から、前記後続する時間的フラグメントの前記再構築されたバージョンの前記始点が一致する前記フラグメント境界までの前記所定の時間的フラグメントの時間的長さを示すフラグメント長さ値、および/または
    前記後行オーディオ・フレームの前記部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの間の差を示す端切断長さ値、を含む、
    方法(60)。
  21. コンピュータ上で動作するとき請求項19又は請求項20に記載の方法を実行するためのプログラム・コードを有する、コンピュータ・プログラム。
JP2017548010A 2015-03-09 2016-03-08 フラグメント整列されたオーディオ・コーディング Active JP6707556B2 (ja)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
EP15158317 2015-03-09
EP15158317.6 2015-03-09
PCT/EP2016/054916 WO2016142380A1 (en) 2015-03-09 2016-03-08 Fragment-aligned audio coding

Publications (3)

Publication Number Publication Date
JP2018514976A true JP2018514976A (ja) 2018-06-07
JP2018514976A5 JP2018514976A5 (ja) 2019-05-30
JP6707556B2 JP6707556B2 (ja) 2020-06-10

Family

ID=52692426

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2017548010A Active JP6707556B2 (ja) 2015-03-09 2016-03-08 フラグメント整列されたオーディオ・コーディング

Country Status (11)

Country Link
US (4) US10595066B2 (ja)
EP (1) EP3269147B1 (ja)
JP (1) JP6707556B2 (ja)
KR (1) KR102041140B1 (ja)
CN (1) CN107667400B (ja)
CA (1) CA2978835C (ja)
ES (1) ES2733858T3 (ja)
MX (1) MX363719B (ja)
RU (1) RU2681958C1 (ja)
TR (1) TR201909403T4 (ja)
WO (1) WO2016142380A1 (ja)

Families Citing this family (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11606528B2 (en) * 2018-01-03 2023-03-14 Saturn Licensing Llc Advanced television systems committee (ATSC) 3.0 latency-free display of content attribute
WO2019189988A1 (ko) * 2018-03-30 2019-10-03 (주)디디오넷 Html5 실시간 재생기 및 그것을 이용한 실시간 재생 방법
CN108682436B (zh) * 2018-05-11 2020-06-23 北京海天瑞声科技股份有限公司 语音对齐方法及装置
KR102852659B1 (ko) 2018-08-21 2025-08-29 돌비 인터네셔널 에이비 즉시 재생 프레임(ipf)의 생성, 전송 및 처리를 위한 방법, 장치 및 시스템
US11336947B2 (en) * 2019-09-13 2022-05-17 Netflix, Inc. Audio transitions when streaming audiovisual media titles
US11416208B2 (en) * 2019-09-23 2022-08-16 Netflix, Inc. Audio metadata smoothing
US11317172B1 (en) * 2020-06-29 2022-04-26 Amazon Technologies, Inc. Video fragment aware audio packaging service
CN111968664B (zh) * 2020-08-21 2024-04-05 武汉大晟极科技有限公司 一种语音降噪方法及均衡滤波器
CN112000308B (zh) * 2020-09-10 2023-04-18 成都拟合未来科技有限公司 一种双音轨音频播放控制方法、系统、终端及介质
CN114822559B (zh) * 2022-04-29 2025-05-27 上海大学 一种基于深度学习的短时语音说话人识别系统和方法
KR20240028174A (ko) * 2022-08-24 2024-03-05 삼성전자주식회사 전자 장치 및 그 제어 방법
GB2636866A (en) * 2023-12-28 2025-07-02 Nokia Technologies Oy An apparatus and method for immersive audio rendering

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2013515401A (ja) * 2009-12-21 2013-05-02 エコスター アドバンスト テクノロジーズ エル.エル.シー. コーデック適用フレーム・サイズでの音声スプリッティング
JP2013528825A (ja) * 2010-04-13 2013-07-11 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン サンプルごとに正確なオーディオ信号表記のための方法、エンコーダ及びデコーダ

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6124895A (en) * 1997-10-17 2000-09-26 Dolby Laboratories Licensing Corporation Frame-based audio coding with video/audio data synchronization by dynamic audio frame alignment
RU2515704C2 (ru) * 2008-07-11 2014-05-20 Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. Аудиокодер и аудиодекодер для кодирования и декодирования отсчетов аудиосигнала
CN103177725B (zh) * 2008-10-06 2017-01-18 爱立信电话股份有限公司 用于输送对齐的多通道音频的方法和设备
US8457975B2 (en) * 2009-01-28 2013-06-04 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio decoder, audio encoder, methods for decoding and encoding an audio signal and computer program
KR101748756B1 (ko) * 2011-03-18 2017-06-19 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에.베. 오디오 콘텐츠를 표현하는 비트스트림의 프레임들 내의 프레임 요소 배치
US8880395B2 (en) * 2012-05-04 2014-11-04 Sony Computer Entertainment Inc. Source separation by independent component analysis in conjunction with source direction information
CN103686202B (zh) * 2012-09-18 2018-06-19 中兴通讯股份有限公司 一种dlna下基于http的转码实时传输方法及系统
EP3133817A4 (en) * 2014-04-18 2017-11-15 LG Electronics Inc. Broadcast signal transmitting apparatus, broadcast signal receiving apparatus, broadcast signal transmitting method and broadcast signal receiving method

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2013515401A (ja) * 2009-12-21 2013-05-02 エコスター アドバンスト テクノロジーズ エル.エル.シー. コーデック適用フレーム・サイズでの音声スプリッティング
JP2013528825A (ja) * 2010-04-13 2013-07-11 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン サンプルごとに正確なオーディオ信号表記のための方法、エンコーダ及びデコーダ

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
"Adaptive Transport Stream Specification", OC-SP-ATS-I01-140214, JPN6018040388, 14 February 2014 (2014-02-14), ISSN: 0004123384 *

Also Published As

Publication number Publication date
MX2017011492A (es) 2018-01-25
US20200177936A1 (en) 2020-06-04
EP3269147B1 (en) 2019-04-24
MX363719B (es) 2019-03-29
JP6707556B2 (ja) 2020-06-10
WO2016142380A1 (en) 2016-09-15
US11218754B2 (en) 2022-01-04
US20230388565A1 (en) 2023-11-30
US11765415B2 (en) 2023-09-19
RU2681958C1 (ru) 2019-03-14
CA2978835A1 (en) 2016-09-15
CA2978835C (en) 2021-01-19
CN107667400B (zh) 2020-12-18
US10595066B2 (en) 2020-03-17
KR102041140B1 (ko) 2019-12-05
US20170366830A1 (en) 2017-12-21
ES2733858T3 (es) 2019-12-03
US20220167031A1 (en) 2022-05-26
US12149762B2 (en) 2024-11-19
KR20170134474A (ko) 2017-12-06
TR201909403T4 (tr) 2019-07-22
BR112017019053A2 (pt) 2018-04-17
CN107667400A (zh) 2018-02-06
EP3269147A1 (en) 2018-01-17

Similar Documents

Publication Publication Date Title
US12149762B2 (en) Fragment-aligned audio coding
US12165664B2 (en) Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder
HK40020053A (en) Method and apparatus for encoding and decoding audio data
HK1226549B (en) Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder
HK1226549A1 (en) Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder

Legal Events

Date Code Title Description
A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20171114

A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20171113

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20180906

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20181016

A601 Written request for extension of time

Free format text: JAPANESE INTERMEDIATE CODE: A601

Effective date: 20181221

A524 Written submission of copy of amendment under article 19 pct

Free format text: JAPANESE INTERMEDIATE CODE: A524

Effective date: 20190416

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20191001

A601 Written request for extension of time

Free format text: JAPANESE INTERMEDIATE CODE: A601

Effective date: 20191210

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20200330

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20200421

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20200520

R150 Certificate of patent or registration of utility model

Ref document number: 6707556

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250