JP2018514976A - フラグメント整列されたオーディオ・コーディング - Google Patents
フラグメント整列されたオーディオ・コーディング Download PDFInfo
- Publication number
- JP2018514976A JP2018514976A JP2017548010A JP2017548010A JP2018514976A JP 2018514976 A JP2018514976 A JP 2018514976A JP 2017548010 A JP2017548010 A JP 2017548010A JP 2017548010 A JP2017548010 A JP 2017548010A JP 2018514976 A JP2018514976 A JP 2018514976A
- Authority
- JP
- Japan
- Prior art keywords
- fragment
- temporal
- audio
- temporal fragment
- audio frame
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Images
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
- H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
- H04N21/242—Synchronisation processes, e.g. processing of PCR [Programme Clock References]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/167—Audio streaming, i.e. formatting and decoding of an encoded audio signal representation into a data stream for transmission or storage purposes
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
- G10L25/57—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for processing of video signals
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/40—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using video transcoding, i.e. partial or full decoding of a coded input stream followed by re-encoding of the decoded output stream
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
- H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
- H04N21/233—Processing of audio elementary streams
- H04N21/2335—Processing of audio elementary streams involving reformatting operations of audio signals, e.g. by converting from one coding standard to another
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
- H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
- H04N21/234—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs
- H04N21/23424—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving splicing one content stream with another content stream, e.g. for inserting or substituting an advertisement
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
- H04N21/23—Processing of content or additional data; Elementary server operations; Server middleware
- H04N21/234—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs
- H04N21/2343—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving reformatting operations of video signals for distribution or compliance with end-user requests or end-user device requirements
- H04N21/23439—Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving reformatting operations of video signals for distribution or compliance with end-user requests or end-user device requirements for generating different versions
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/80—Generation or processing of content or additional data by content creator independently of the distribution process; Content per se
- H04N21/83—Generation or processing of protective or descriptive data associated with content; Content structuring
- H04N21/845—Structuring of content, e.g. decomposing content into time segments
- H04N21/8456—Structuring of content, e.g. decomposing content into time segments by decomposing the content in the time domain, e.g. in time segments
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/04—Time compression or expansion
- G10L21/055—Time compression or expansion for synchronising with other signals, e.g. video signals
Landscapes
- Engineering & Computer Science (AREA)
- Signal Processing (AREA)
- Multimedia (AREA)
- Acoustics & Sound (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Marketing (AREA)
- Business, Economics & Management (AREA)
- Quality & Reliability (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Compression Or Coding Systems Of Tv Signals (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
- Synchronisation In Digital Transmission Systems (AREA)
- Reverberation, Karaoke And Other Acoustics (AREA)
Abstract
Description
[2] ISO/IEC 23008-3, "Information technology -- High efficiency coding and media delivery in heterogeneous environments -- Part 3: 3D audio"
[3] ISO/IEC 23009-1, "Information technology Dynamic adaptive streaming over HTTP (DASH) Part 1: Media presentation description and segment formats"
[4] ISO/IEC 23008-1, "Information technology -- High efficiency coding and media delivery in heterogeneous environments -- Part 1: MPEG media transport (MMT)"
2)いかなるオーディオ遅延も、時間的フラグメントのエンコードされた表現に対して即時プレイアウト情報の使用により補償されることができる。スプライシングは、各フラグメント境界で生じることができる。これは、ブロードキャスト機器の全体的な複雑さを著しく減少する。
AAC アドバンスド・オーディオ・コーディング
ATSC 高度テレビジョン・システムズ委員会
AU オーディオ・アクセス・ユニット
DASH HTTPを越える動的適合型ストリーミング
DVB デジタル・ビデオ・ブロードキャスティング
IPF 瞬間プレイアウト・フレーム
MPD メディア・プレゼンテーション・ディスクリプション
MPEG ムービング・ピクチャ・エキスパーツ・グループ
MMT MPEGメディア伝送
NTSC 全米テレビジョンシステム委員会
PAL 位相反転線方式
Claims (21)
- エンコードされたデータ・ストリーム(34)へオーディオ・コンテンツをエンコードするためのエンコーダ(20)であって、
オーディオ・フレーム(12)の単位で前記オーディオ・コンテンツをエンコードするように構成されるエンコーディング・ステージ(36)と、
時間的フラグメント(10)の単位で前記エンコーディング・ステージ(36)に前記オーディオ・コンテンツ(31)を提供するように構成されるフラグメント・プロバイダ(38)と、を備え、
前記エンコーダは、各時間的フラグメント(10)について、第1のオーディオ・フレームの始点と前記それぞれの時間的フラグメントの始点(30)とが一致するように前記それぞれの時間的フラグメント(10)へ前記オーディオ・フレーム(12)を整列しながらオーディオ・フレーム(12)の単位で前記それぞれの時間的フラグメントのエンコードされる表現(40)へ各時間的フラグメント(10)をエンコードするように構成され、
前記時間的フラグメント(10)の前記エンコードされた表現は、前記エンコードされたデータ・ストリームに含まれ、前記時間的フラグメント(10)の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
前記エンコーダは、前記エンコードされたデータ・ストリーム内で、前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分を特定するための端切断情報を信号で伝えるように構成され、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複し、前記端切断情報は、
前記オーディオ・フレームの前記時間的長さを示すフレーム長さ値および前記時間的フラグメントの前記時間的長さを示すフラグメント長さ値および/又は
前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの差を示す端切断長さ値を含み、前記後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて直後に続く時間的フラグメントに時間的に重複する、
エンコーダ(20)。 - 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされた表現(40)への前記所定の時間的フラグメント(10)の前記エンコーディングが前記所定の時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの前記後行オーディオ・フレームに即時に先行するオーディオ・フレームで中止されるように協働し、当該後行オーディオ・フレームは、前記所定の時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、
請求項1に記載のエンコーダ(20)。 - 前記エンコーディング・ステージは、前記所定の時間的フラグメントの前記エンコードされた表現(40)内で、表されている前記デコーダの内部的な状態を前記後行オーディオ・フレームに即時に先行する前記オーディオ・フレームまで洗い流すことに基づいて、前記後行オーディオ・フレームによってカバーされる前記所定の時間的フラグメントの部分を充填するようにデコーダに指示しているフラッシュ信号を知らせるように構成される、
請求項2に記載のエンコーダ(20)。 - 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされる表現への前記所定の時間的フラグメントの前記エンコーディングが前記所定の時間的フラグメントがエンコードされる単位で前記オーディオ・フレーム(12)の前記後行オーディオ・フレーム内の前記所定の時間的フラグメントの後行端を越えて継続するように協働し、当該後行オーディオ・フレームは、前記所定の時間的フラグメントの後行端を上回り前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、
請求項1に記載のエンコーダ(20)。 - 前記エンコーディング・ステージ(36)は、前記所定の時間的フラグメントの前記後行端を越えて前記直後に続く時間的フラグメントに時間的に重複している前記後行オーディオ・フレームの部分内で、前記所定の時間的フラグメン内よりも低い品質で、前記オーディオ・コンテンツをエンコードするように構成される、
請求項4に記載のエンコーダ(20)。 - 前記エンコーディング・ステージ(36)とフラグメント・プロバイダ(38)とは、所定の時間的フラグメント(10)について、前記それぞれの時間的フラグメントの前記エンコードされた表現への前記所定の時間的フラグメントの前記エンコーディングが前記所定の時間的フラグメント(10)が前記それぞれの時間的フラグメントの前記エンコードされた表現(40)へエンコードされ前記即時プレイアウト情報を前記所定の時間的フラグメントの前記エンコードされる表現へコードする単位で前記オーディオ・フレームのうちの前記第1のオーディオ・フレームに即時に先行する前記オーディオ・コンテンツの1つ又はそれ以上のプレロール・オーディオ・フレームから即時プレイアウト情報(98)の導出を含むように協働する、
請求項1ないし請求項5のいずれかに記載のエンコーダ(20)。 - 前記エンコーディング・ステージ(36)は、ラップ変換を導入するエイリアシングに基づいて変換コーディングを用いて前記エンコーディングを実行するように、そして、ラップ変換を導入する前記エイリアシングに基づく前記変換コーディングを前記1つ又はそれ以上のプレロール・オーディオ・フレームにおける前記オーディオ・コンテンツに適用することによって前記即時プレイアウト情報を引き出すように構成される、
請求項6に記載のエンコーダ(20)。 - 前記エンコーディング・ステージ(36)は、
第1のエンコーディング・コア(90)と第2のエンコーディング・コア(92)とを含み、
前記フラグメント・プロバイダ(38)は、前記オーディオ・コンテンツの第1の時間的フラグメントをエンコードしながら前記第1のエンコーディング・コア(90)を係合するように構成され、前記第1のエンコーディング・コア(90)は、前記第1の時間的フラグメントの始点に前記オーディオ・フレームを時間的に整列しながらオーディオ・フレームの単位で前記オーディオ・コンテンツの前記第1の時間的フラグメントを係合するように構成され、その結果、前記オーディオ・コンテンツの前記第1の時間的フラグメントがエンコードされる単位における前記オーディオ・フレームのうちの前記第1のオーディオ・フレームが前記第1の時間的フラグメントのエンコードされる表現を出力するために前記第1の時間的フラグメントの始点で即時に開始し、そして前記フラグメント・プロバイダ(38)は、即時に前記第1の時間的フラグメントに後続して、前記オーディオ・コンテンツの第2の時間的フラグメントをエンコードしながら前記第2のエンコーディング・コアを係合するように構成され、前記第2のエンコーディング・コア(90)は、前記第2の時間的フラグメントの始点に前記オーディオ・フレームを時間的に整列しながらオーディオ・フレームの単位で前記オーディオ・コンテンツの前記第2の時間的フラグメントをエンコードするように構成され、その結果、前記オーディオ・コンテンツの前記第2の時間的フラグメントがエンコードされる単位における前記オーディオ・フレームのうちの前記第1のオーディオ・フレームが前記第2の時間的フラグメントのエンコードされる表現を出力するために前記第2の時間的フラグメントの始点で即時に開始し、
前記プロバイダは、前記オーディオ・コンテンツの第3の時間的フラグメントをエンコードしながらまた前記第1のエンコーディング・コア(90)を係合するように構成される、
請求項1ないし請求項7のいずれかに記載のエンコーダ。 - 前記フラグメント・プロバイダ(38)は、前記オーディオ・コンテンツの前記時間的フラグメントをエンコードするのと交互で前記第1および第2のエンコーディング・コア(90、92)を係合するように構成される、
請求項8に記載のエンコーダ(20)。 - エンコードされたデータ・ストリームからオーディオ・コンテンツをデコードするためのデコーダ(60)であって、
前記オーディオ・コンテンツの時間的フラグメントのエンコードされた表現を受信するように構成されるインプット・インターフェイス(62)であって、エンコードされた表現のそれぞれが前記それぞれの時間的フラグメントの始点に時間的に整列されるオーディオ・フレームの単位でそこにそれぞれの時間的フラグメントをエンコードし、その結果、前記それぞれの時間的フラグメントの前記始点が前記オーディオ・フレームのうちの第1のオーディオ・フレームの始点と一致するインプット・インターフェイス(62)と、
前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの再構築されたバージョン(66)をデコードするように構成されるデコーディング・ステージ(64)と、
プレイアウトのために、前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをともに結合する(join)ように構成されるジョイナ(68)と、を備え、
前記フラグメント・グリッドのフラグメント境界の間の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
前記ジョイナ(68)は、所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされる表現にコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分で所定の時間的フラグメントの前記再構築されたバージョン(66)をその端を切るように構成され、当該後行オーディオ・フレームの部分は、前記所定の時間的フラグメントの後行端を時間的に越えて直後に続く時間的フラグメントの再構築されたバージョンに時間的に重複し、
前記デコーダは、前記エンコードされたデータ・ストリームにおける端切断情報に基づいて前記後行オーディオ・フレームの前記部分を決定するように構成され、前記端切断情報は、
前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの時間的長さを示すフレーム長さ値、および前記所定のフラグメントの前記再構築されたバージョンの始点から、前記後続する時間的フラグメントの前記再構築されたバージョンの前記始点が一致する前記フラグメント境界までの、前記所定の時間的フラグメントの時間的長さを示すフラグメント長さ値、および/または
前記後行オーディオ・フレームの前記部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの違いを示す端切断長さ値、を含む、
デコーダ(60)。 - 前記デコーディング・ステージ(64)は、前記所定の時間的フラグメントの前記エンコードされた表現から所定の時間的フラグメントをデコードするとき、前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームのうちの後行オーディオ・フレームの部分の範囲内で前記所定の時間的フラグメントの前記再構築されるバージョンを生成し、当該後行オーディオ・フレームの部分は、前記後行オーディオ・フレームの先端から前記後行オーディオ・フレームに即時に先行するオーディオ・フレームまで表されている前記デコーディング・ステージの内部的な状態を洗い流すことによって後続する時間的フラグメントの再構築されるバージョンの前記フラグメント境界まで延伸する、
請求項10に記載のデコーダ(60)。 - 前記デコーディング・ステージ(64)は、所定の時間的フラグメントの前記エンコードされた表現から即時プレイアウト情報を引き出すように構成され、前記即時プレイアウト情報は、前記時間的フラグメントの前記始点に直後に続く前記所定の時間的フラグメントの1つ又はそれ以上のオーディオ・フレームで前記オーディオ・コンテンツを再構築するために前記所定の時間的フラグメントの始点に時間的に先行し前記即時プレイアウト情報を用いる前記オーディオ・コンテンツの1つ又はそれ以上のプレロール・オーディオ・フレームで前記オーディオ・コンテンツに関連する、
請求項10または請求項11に記載のデコーダ(60)。 - 前記デコーディング・ステージ(64)は、前記即時プレイアウト情報が前記1つ又はそれ以上のプレロール・オーディオ・フレームにおける前記オーディオ・コンテンツの再構築であるように構成される、
請求項12に記載のデコーダ(60)。 - 前記デコーディング・ステージ(64)は、時間領域エイリアシング消去のために前記時間的フラグメントの前記始点に直後に続く前記所定の時間的フラグメントの1つ又はそれ以上のオーディオ・フレームで前記オーディオ・コンテンツを再構築するときに前記即時プレイアウト情報を用いるように構成される、
請求項12又は請求項13に記載のデコーダ(60)。 - 前記デコーディング・ステージ(64)は、エイリアシングを引き起こすラップ変換の逆を個別的に用いて、そして前記フレーム境界を越えて展開する変換ウインドウを負っている前記オーディオ・フレームをデコードするように構成される、
請求項10ないし請求項14のいずれかに記載のデコーダ。 - 前記デコーディング・ステージ(64)は、
前記第1の時間的フラグメントの前記再構築されたバージョンが前記第1の時間的フラグメントの前記オーディオ・フレームのうちの第1のオーディオ・フレームの先端で開始するように、前記第1の時間的フラグメントのエンコードされた表現から前記オーディオ・コンテンツの第1の時間的フラグメントの再構築されるバージョンをオーディオ・フレーム単位でデコードするように構成される第1のデコーディング・コア(94)と、
前記第2の時間的フラグメントの前記再構築されたバージョンが前記第2の時間的フラグメントの前記オーディオ・フレームのうちの第1のオーディオ・フレームの先端で登録されて始まるように、前記第2の時間的フラグメントのエンコードされた表現から前記第1の時間的フラグメントに直後に続く前記オーディオ・コンテンツの第2の時間的フラグメントの再構築されたバージョンをオーディオ・フレーム単位でデコードするように構成される第2のデコーディング・コア(96)と、を含み、
前記ジョイナ(68)は、前記第1の時間的フラグメントの前記再構築されたバージョン(66)と前記第2の時間的フラグメントの前記再構築されたバージョンとをともに結合する(join)ように構成される、
請求項10ないし請求項15のいずれかに記載のデコーダ。 - 前記第1のデコーディング・コアは、前記エンコードされたデータ・ストリームから、前記オーディオ・コンテンツの第3の時間的フラグメントの再構築されたバージョンもデコードするように構成される、
請求項16に記載のデコーダ。 - 前記第1および第2のデコーディング・コアは、前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをデコードすることに交互に関与するように構成される、
請求項16又は請求項17に記載のデコーダ。 - エンコードされたデータ・ストリーム(34)へオーディオ・コンテンツをエンコードするための方法(20)であって、フレーム(12)の単位で前記オーディオ・コンテンツをエンコードするように構成されるエンコーディング・ステージ(36)を用い、前記方法は、
前記エンコーディング・ステージ(36)に時間的フラグメント(10)の単位で前記オーディオ・コンテンツ(31)を提供するステップと、
前記エンコーディング・ステージによって実行されて、各時間的フラグメント(10)について、前記それぞれの時間的フラグメント(10)が前記それぞれの時間的フラグメントの前記エンコードされる表現(40)へエンコードされる単位で前記オーディオ・フレームの第1のオーディオ・フレームの始点と前記それぞれの時間的フラグメントの始点(30)とが一致するように前記それぞれの時間的フラグメント(10)に前記オーディオ・フレーム(12)を整列しながらオーディオ・フレーム(12)の単位で前記それぞれの時間的フラグメントのエンコードされる表現(40)へ各時間的フラグメント(10)をエンコードするステップと、を含み、
前記時間的フラグメント(10)の前記エンコードされた表現は、前記エンコードされたデータ・ストリームに含まれ、前記時間的フラグメント(10)の時間的長さは、前記フレームの時間的長さの非整数倍数であり、
前記方法は、前記エンコードされたデータ・ストリーム内で、前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分を特定するための端切断情報を信号で伝えるステップを含み、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複し、前記端切断情報は、
前記オーディオ・フレームの前記時間的長さを示すフレーム長さ値および前記時間的フラグメントの前記時間的長さを示すフラグメント長さ値および/又は
前記時間的フラグメントがエンコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの差を示す端切断長さ値であって、当該後行オーディオ・フレームの部分は、前記時間的フラグメントの後行端を越えて前記フラグメント・グリッドの直後に続く時間的フラグメントに時間的に重複する、端切断長さ値を含む、
方法(20)。 - エンコードされたデータ・ストリームからオーディオ・コンテンツをフラグメント・グリッドの時間的フラグメントの単位でデコードするための方法(60)であって、
前記オーディオ・コンテンツの時間的フラグメントのエンコードされた表現を受信するステップであって、エンコードされた表現のそれぞれが、前記それぞれの時間的フラグメントの始点に時間的に整列されるオーディオ・フレームの単位でそこにそれぞれの時間的フラグメントをエンコードして、前記それぞれの時間的フラグメントの前記始点が前記オーディオ・フレームのうちの第1のオーディオ・フレームの始点と一致するようになっている、受信するステップと、
前記時間的フラグメントの前記エンコードされた表現から前記オーディオ・コンテンツの前記時間的フラグメントの再構築されたバージョン(66)をデコードするステップと、
プレイアウトのために、前記オーディオ・コンテンツの前記時間的フラグメントの前記再構築されたバージョンをともに結合するステップと、を含み、
前記フラグメント・グリッドのフラグメント境界の間の時間的長さは、前記オーディオ・フレームの時間的長さの非整数倍数であり、
前記結合するステップ(68)は、前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの後行オーディオ・フレームの部分で、所定の時間的フラグメントの前記再構築されたバージョン(66)をその端を切るステップを含み、当該後行オーディオ・フレームの部分は、前記所定の時間的フラグメントの後行端を時間的に越えて直後に続く時間的フラグメントの再構築されたバージョンに時間的に重複し、
前記方法は、前記エンコードされたデータ・ストリームの端切断情報に基づいて前記後行オーディオ・フレームの前記部分を決定するステップを更に含み、
前記端切断情報は、
前記所定の時間的フラグメントが前記所定の時間的フラグメントの前記エンコードされた表現にコードされる単位で前記オーディオ・フレームの時間的長さを示すフレーム長さ値、および前記所定のフラグメントの前記再構築されたバージョンの始点から、前記後続する時間的フラグメントの前記再構築されたバージョンの前記始点が一致する前記フラグメント境界までの前記所定の時間的フラグメントの時間的長さを示すフラグメント長さ値、および/または
前記後行オーディオ・フレームの前記部分の時間的長さ、または前記後行オーディオ・フレームの前記部分の前記時間的長さと前記後行オーディオ・フレームの前記時間的長さとの間の差を示す端切断長さ値、を含む、
方法(60)。 - コンピュータ上で動作するとき請求項19又は請求項20に記載の方法を実行するためのプログラム・コードを有する、コンピュータ・プログラム。
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP15158317 | 2015-03-09 | ||
| EP15158317.6 | 2015-03-09 | ||
| PCT/EP2016/054916 WO2016142380A1 (en) | 2015-03-09 | 2016-03-08 | Fragment-aligned audio coding |
Publications (3)
| Publication Number | Publication Date |
|---|---|
| JP2018514976A true JP2018514976A (ja) | 2018-06-07 |
| JP2018514976A5 JP2018514976A5 (ja) | 2019-05-30 |
| JP6707556B2 JP6707556B2 (ja) | 2020-06-10 |
Family
ID=52692426
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2017548010A Active JP6707556B2 (ja) | 2015-03-09 | 2016-03-08 | フラグメント整列されたオーディオ・コーディング |
Country Status (11)
| Country | Link |
|---|---|
| US (4) | US10595066B2 (ja) |
| EP (1) | EP3269147B1 (ja) |
| JP (1) | JP6707556B2 (ja) |
| KR (1) | KR102041140B1 (ja) |
| CN (1) | CN107667400B (ja) |
| CA (1) | CA2978835C (ja) |
| ES (1) | ES2733858T3 (ja) |
| MX (1) | MX363719B (ja) |
| RU (1) | RU2681958C1 (ja) |
| TR (1) | TR201909403T4 (ja) |
| WO (1) | WO2016142380A1 (ja) |
Families Citing this family (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11606528B2 (en) * | 2018-01-03 | 2023-03-14 | Saturn Licensing Llc | Advanced television systems committee (ATSC) 3.0 latency-free display of content attribute |
| WO2019189988A1 (ko) * | 2018-03-30 | 2019-10-03 | (주)디디오넷 | Html5 실시간 재생기 및 그것을 이용한 실시간 재생 방법 |
| CN108682436B (zh) * | 2018-05-11 | 2020-06-23 | 北京海天瑞声科技股份有限公司 | 语音对齐方法及装置 |
| KR102852659B1 (ko) | 2018-08-21 | 2025-08-29 | 돌비 인터네셔널 에이비 | 즉시 재생 프레임(ipf)의 생성, 전송 및 처리를 위한 방법, 장치 및 시스템 |
| US11336947B2 (en) * | 2019-09-13 | 2022-05-17 | Netflix, Inc. | Audio transitions when streaming audiovisual media titles |
| US11416208B2 (en) * | 2019-09-23 | 2022-08-16 | Netflix, Inc. | Audio metadata smoothing |
| US11317172B1 (en) * | 2020-06-29 | 2022-04-26 | Amazon Technologies, Inc. | Video fragment aware audio packaging service |
| CN111968664B (zh) * | 2020-08-21 | 2024-04-05 | 武汉大晟极科技有限公司 | 一种语音降噪方法及均衡滤波器 |
| CN112000308B (zh) * | 2020-09-10 | 2023-04-18 | 成都拟合未来科技有限公司 | 一种双音轨音频播放控制方法、系统、终端及介质 |
| CN114822559B (zh) * | 2022-04-29 | 2025-05-27 | 上海大学 | 一种基于深度学习的短时语音说话人识别系统和方法 |
| KR20240028174A (ko) * | 2022-08-24 | 2024-03-05 | 삼성전자주식회사 | 전자 장치 및 그 제어 방법 |
| GB2636866A (en) * | 2023-12-28 | 2025-07-02 | Nokia Technologies Oy | An apparatus and method for immersive audio rendering |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2013515401A (ja) * | 2009-12-21 | 2013-05-02 | エコスター アドバンスト テクノロジーズ エル.エル.シー. | コーデック適用フレーム・サイズでの音声スプリッティング |
| JP2013528825A (ja) * | 2010-04-13 | 2013-07-11 | フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン | サンプルごとに正確なオーディオ信号表記のための方法、エンコーダ及びデコーダ |
Family Cites Families (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6124895A (en) * | 1997-10-17 | 2000-09-26 | Dolby Laboratories Licensing Corporation | Frame-based audio coding with video/audio data synchronization by dynamic audio frame alignment |
| RU2515704C2 (ru) * | 2008-07-11 | 2014-05-20 | Фраунхофер-Гезелльшафт Цур Фердерунг Дер Ангевандтен Форшунг Е.Ф. | Аудиокодер и аудиодекодер для кодирования и декодирования отсчетов аудиосигнала |
| CN103177725B (zh) * | 2008-10-06 | 2017-01-18 | 爱立信电话股份有限公司 | 用于输送对齐的多通道音频的方法和设备 |
| US8457975B2 (en) * | 2009-01-28 | 2013-06-04 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio decoder, audio encoder, methods for decoding and encoding an audio signal and computer program |
| KR101748756B1 (ko) * | 2011-03-18 | 2017-06-19 | 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에.베. | 오디오 콘텐츠를 표현하는 비트스트림의 프레임들 내의 프레임 요소 배치 |
| US8880395B2 (en) * | 2012-05-04 | 2014-11-04 | Sony Computer Entertainment Inc. | Source separation by independent component analysis in conjunction with source direction information |
| CN103686202B (zh) * | 2012-09-18 | 2018-06-19 | 中兴通讯股份有限公司 | 一种dlna下基于http的转码实时传输方法及系统 |
| EP3133817A4 (en) * | 2014-04-18 | 2017-11-15 | LG Electronics Inc. | Broadcast signal transmitting apparatus, broadcast signal receiving apparatus, broadcast signal transmitting method and broadcast signal receiving method |
-
2016
- 2016-03-08 CN CN201680028019.4A patent/CN107667400B/zh active Active
- 2016-03-08 ES ES16709348T patent/ES2733858T3/es active Active
- 2016-03-08 MX MX2017011492A patent/MX363719B/es unknown
- 2016-03-08 CA CA2978835A patent/CA2978835C/en active Active
- 2016-03-08 WO PCT/EP2016/054916 patent/WO2016142380A1/en not_active Ceased
- 2016-03-08 EP EP16709348.3A patent/EP3269147B1/en active Active
- 2016-03-08 TR TR2019/09403T patent/TR201909403T4/tr unknown
- 2016-03-08 RU RU2017134294A patent/RU2681958C1/ru active
- 2016-03-08 JP JP2017548010A patent/JP6707556B2/ja active Active
- 2016-03-08 KR KR1020177028550A patent/KR102041140B1/ko active Active
-
2017
- 2017-09-06 US US15/697,215 patent/US10595066B2/en active Active
-
2020
- 2020-02-07 US US16/784,763 patent/US11218754B2/en active Active
-
2021
- 2021-12-02 US US17/541,188 patent/US11765415B2/en active Active
-
2023
- 2023-08-09 US US18/447,279 patent/US12149762B2/en active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2013515401A (ja) * | 2009-12-21 | 2013-05-02 | エコスター アドバンスト テクノロジーズ エル.エル.シー. | コーデック適用フレーム・サイズでの音声スプリッティング |
| JP2013528825A (ja) * | 2010-04-13 | 2013-07-11 | フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン | サンプルごとに正確なオーディオ信号表記のための方法、エンコーダ及びデコーダ |
Non-Patent Citations (1)
| Title |
|---|
| "Adaptive Transport Stream Specification", OC-SP-ATS-I01-140214, JPN6018040388, 14 February 2014 (2014-02-14), ISSN: 0004123384 * |
Also Published As
| Publication number | Publication date |
|---|---|
| MX2017011492A (es) | 2018-01-25 |
| US20200177936A1 (en) | 2020-06-04 |
| EP3269147B1 (en) | 2019-04-24 |
| MX363719B (es) | 2019-03-29 |
| JP6707556B2 (ja) | 2020-06-10 |
| WO2016142380A1 (en) | 2016-09-15 |
| US11218754B2 (en) | 2022-01-04 |
| US20230388565A1 (en) | 2023-11-30 |
| US11765415B2 (en) | 2023-09-19 |
| RU2681958C1 (ru) | 2019-03-14 |
| CA2978835A1 (en) | 2016-09-15 |
| CA2978835C (en) | 2021-01-19 |
| CN107667400B (zh) | 2020-12-18 |
| US10595066B2 (en) | 2020-03-17 |
| KR102041140B1 (ko) | 2019-12-05 |
| US20170366830A1 (en) | 2017-12-21 |
| ES2733858T3 (es) | 2019-12-03 |
| US20220167031A1 (en) | 2022-05-26 |
| US12149762B2 (en) | 2024-11-19 |
| KR20170134474A (ko) | 2017-12-06 |
| TR201909403T4 (tr) | 2019-07-22 |
| BR112017019053A2 (pt) | 2018-04-17 |
| CN107667400A (zh) | 2018-02-06 |
| EP3269147A1 (en) | 2018-01-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US12149762B2 (en) | Fragment-aligned audio coding | |
| US12165664B2 (en) | Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder | |
| HK40020053A (en) | Method and apparatus for encoding and decoding audio data | |
| HK1226549B (en) | Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder | |
| HK1226549A1 (en) | Audio decoder, apparatus for generating encoded audio output data and methods permitting initializing a decoder |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20171114 |
|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20171113 |
|
| A977 | Report on retrieval |
Free format text: JAPANESE INTERMEDIATE CODE: A971007 Effective date: 20180906 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20181016 |
|
| A601 | Written request for extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A601 Effective date: 20181221 |
|
| A524 | Written submission of copy of amendment under article 19 pct |
Free format text: JAPANESE INTERMEDIATE CODE: A524 Effective date: 20190416 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20191001 |
|
| A601 | Written request for extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A601 Effective date: 20191210 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20200330 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20200421 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20200520 |
|
| R150 | Certificate of patent or registration of utility model |
Ref document number: 6707556 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
|
| R250 | Receipt of annual fees |
Free format text: JAPANESE INTERMEDIATE CODE: R250 |
