JPH09325794A - 時間尺度変更方法および装置 - Google Patents
時間尺度変更方法および装置Info
- Publication number
- JPH09325794A JPH09325794A JP9047595A JP4759597A JPH09325794A JP H09325794 A JPH09325794 A JP H09325794A JP 9047595 A JP9047595 A JP 9047595A JP 4759597 A JP4759597 A JP 4759597A JP H09325794 A JPH09325794 A JP H09325794A
- Authority
- JP
- Japan
- Prior art keywords
- module
- signal
- zero crossing
- zero
- distance metric
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000000034 method Methods 0.000 title claims abstract description 47
- 239000013598 vector Substances 0.000 claims abstract description 37
- 230000007704 transition Effects 0.000 abstract description 11
- 230000008859 change Effects 0.000 abstract description 6
- 230000006870 function Effects 0.000 description 26
- 238000004458 analytical method Methods 0.000 description 13
- 239000000872 buffer Substances 0.000 description 9
- 238000004364 calculation method Methods 0.000 description 9
- 238000012952 Resampling Methods 0.000 description 7
- 230000008569 process Effects 0.000 description 7
- 238000010586 diagram Methods 0.000 description 5
- 238000012545 processing Methods 0.000 description 5
- 238000012360 testing method Methods 0.000 description 5
- 230000003139 buffering effect Effects 0.000 description 4
- 238000009499 grossing Methods 0.000 description 4
- 238000005259 measurement Methods 0.000 description 4
- 230000007246 mechanism Effects 0.000 description 4
- 230000004048 modification Effects 0.000 description 4
- 238000012986 modification Methods 0.000 description 4
- 238000005070 sampling Methods 0.000 description 4
- 239000002131 composite material Substances 0.000 description 3
- 230000000694 effects Effects 0.000 description 3
- 238000011156 evaluation Methods 0.000 description 3
- 230000005284 excitation Effects 0.000 description 3
- 230000008901 benefit Effects 0.000 description 2
- 230000015572 biosynthetic process Effects 0.000 description 2
- 230000015556 catabolic process Effects 0.000 description 2
- 230000006835 compression Effects 0.000 description 2
- 238000007906 compression Methods 0.000 description 2
- 238000006731 degradation reaction Methods 0.000 description 2
- 230000003595 spectral effect Effects 0.000 description 2
- 230000001360 synchronised effect Effects 0.000 description 2
- 238000003786 synthesis reaction Methods 0.000 description 2
- 238000012935 Averaging Methods 0.000 description 1
- 206010024769 Local reaction Diseases 0.000 description 1
- 230000014509 gene expression Effects 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 238000012886 linear function Methods 0.000 description 1
- 238000002715 modification method Methods 0.000 description 1
- 230000009467 reduction Effects 0.000 description 1
- 230000033764 rhythmic process Effects 0.000 description 1
- 230000005236 sound signal Effects 0.000 description 1
- 238000001228 spectrum Methods 0.000 description 1
- 238000000528 statistical test Methods 0.000 description 1
- 238000006467 substitution reaction Methods 0.000 description 1
- 230000002123 temporal effect Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 238000000844 transformation Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10H—ELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
- G10H1/00—Details of electrophonic musical instruments
- G10H1/36—Accompaniment arrangements
- G10H1/361—Recording/reproducing of accompaniment for use with an external source, e.g. karaoke systems
- G10H1/366—Recording/reproducing of accompaniment for use with an external source, e.g. karaoke systems with means for modifying or correcting the external signal, e.g. pitch correction, reverberation, changing a singer's voice
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/04—Time compression or expansion
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10H—ELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
- G10H2250/00—Aspects of algorithms or signal processing methods without intrinsic musical character, yet specifically adapted for or used in electrophonic musical processing
- G10H2250/025—Envelope processing of music signals in, e.g. time domain, transform domain or cepstrum domain
- G10H2250/035—Crossfade, i.e. time domain amplitude envelope control of the transition between musical sounds or melodies, obtained for musical purposes, e.g. for ADSR tone generation, articulations, medley, remix
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Computational Linguistics (AREA)
- Quality & Reliability (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Reverberation, Karaoke And Other Acoustics (AREA)
Abstract
手段を用いて信号の時間尺度変更を実行する方法および
装置を提供することを目的とする。 【解決手段】 本発明は時間尺度変更を実施する方法お
よび装置を提供する。この方法は、信号内のゼロクロッ
シング点を決定するためのゼロクロッシング・モジュー
ル(22)と、ゼロクロッシング点を描写する特徴ベク
トルを生成するための特徴ベクトル・モジュール(2
4)と、ゼロクロッシング点で局所的特徴を描写する距
離メトリックを生成するための距離メトリック・モジュ
ール(26)と、特徴ベクトルおよび距離メトリックを
用いて、局所類似性および選定した時間区間にわたる類
似性に従って信号を整合、同期化させて時間尺度変更し
た信号を生成する整合モジュール(28)とを包含す
る。本発明は、また、こうして得た時間尺度変更済みの
信号の連続したフレーム間の遷移を滑らかにするための
クロスフェイド・モジュール(20)も包含する。
Description
は、時間尺度変更方法および装置に関する。
音声コード化や音楽のアプリケーションにおける重要な
成分である。たとえば、カラオケ装置では、ユーザが自
分のキーに合わせて背景音楽のキーを変えることができ
る。TSMはこのキー変更アルゴリズムの成分である。
カラオケ装置は、再サンプリング後にオリジナルのテン
ポを維持するのにTSMを使用するピッチシフト機能部
も包含する。TSMを実行する1つの方法は、非常に多
くの相互相関計算を含むSynchronized Overlap and Add
(SOLA) アルゴリズムを用いている。このSOLAアルゴリ
ズムは良好なオーディオ品質を与えるが、相互相関計算
に固有の多数回の演算が単チップでの実行を妨げてい
る。それ故、TSMを実行する別の方法を研究する必要
がある。
法は多数ある[たとえば、S. Roucos and A.M. Wilgus,
"High Quality Time Scale Modification for Searc
h", IEEE Int. Conf. Acoust., Speech, Signal Proces
sing, March 1985, pp. 493-496(以下、「Roucos等」と
呼ぶ)ならびにJ. Makhoul and A.E. Jaroudi, "Time-S
cale Modification in Medium to Low Rate Speech Cod
ing", IEEE Int. Conf.Acoust., Speech, Signal Proce
ssing, 1986, pp. 1705-1708(以下、「Makhoul等」と呼
ぶ)を参照されたい]。1つの方法はモディファイド・
ショートタイム・フーリエ変換マグニチュードからの最
小自乗誤差評価(LSEE-MSTFTM)である[D.W. Griffin a
nd J.S. Lim, "Signal Estimation from Modified Shor
t-Time Fourier Transform", IEEE Trans. Acoust., Sp
eech, Signal Processing, Vol. ASSP-32, pp. 236-24
3, April1984(以下、「Griffin 等」と呼ぶ)を参照さ
れたい]。ショートタイム・フーリエ変換マグニチュー
ド(SFTM)アルゴリズムはピッチとエンベロープ両方の
情報を含んでいる。このアルゴリズムは所望の時間尺度
変更済みのSFTMを繰り返し評価する。別の方法は信号を
励起成分およびシステム機能として表す正弦波モードに
基づく[Quatieri and R.S. McAulay, "Speech Transfo
rmation Based on aSinusoidal Representation", IEEE
Int. Conf. Acoust., Speech, Signal Processing, Ma
rch 1985, pp. 489-492(以下、「Quatieri等」と呼
ぶ)を参照されたい]。励起信号はさらにシヌソイドに
分解される。TSMは、システムの振幅および位相を時
間尺度化し、励起振幅、周波数を時間尺度化することに
よって行われる。
するが、SOLA法に比べて演算回数が多い。必要なTSM
を達成する単純でしかもエレガントな方法は、Overlap
and Add(OLA)アルゴリズムを使用している。このOLA
アルゴリズムは連続したフレームをオーバーラップさ
せ、加算する時間領域べースの方法である(それ故に、
Overlap and Add と呼ぶ)。この技術は、OLA アルゴリ
ズムの派生技術としてのSOLAの説明に関連して以下に簡
単に説明する。簡単なシフト用、加算用のフレームで、
時間尺度を変更する目的を達成できる。しかしながら、
これは信号のピッチ周期あるいはスペクトル特徴を保存
しない。したがって、低品質信号特性、たとえば、クリ
ック、ノイズのバースとあるいはリバーブが生じる可能
性がある。これらの望ましくない効果を防ぐには、連続
したフレームがひとつながりになった部位で滑らかな遷
移を得ると共に、オーバラップ区間の持続中に2つのフ
レーム間に類似信号パターンを得る必要がある。換言す
れば、2つのフレームを最高類似度の部位で同期化しな
ければならない。
域で演算を実施し、ピッチ評価を必要としない。SOLA法
は、信号のフレームをシフトし、加算するより単純なOL
A 法に基づいているが、SOLA法では、信号のフレームを
同期化しながらシフトし、加算する。これはオリジナル
の信号のピッチ周期とスペクトル特徴を維持する。SOLA
法は1フレームずつ出力信号を再構築する。SOLAアルゴ
リズムでは、2つのフレーム区間、すなわち、分析フレ
ーム区間Sαと合成フレーム区間SSは、以下の数式
(1)に示すように、時間尺度ファクタαと関係する。
αが1未満の場合には圧縮が行われ、αが1より大きい
場合には拡大が行われる。 Ss = SαXα (1) TSMは、区間Sαで入力信号x[n]からN個のサンプル
を抽出し、すべてのS s 例で信号y[n]を構築することに
よって達成される。合成のプロセスでは、新しい合成フ
レーム(入力信号のm番目のフレーム:x[mSα+j], 0≦
j<N)を、最高類似度を持つ領域が位置決めされるまで、
先に構築した信号(y[mSs +k], kmin ≦k≦ kmax ) と
一緒に加算する。次に、この分析フレームを先に演算
し、再構築した信号y[n]にオーバラップさせ、加算す
る。区間[kmin ,kmax ] は、信号の最低周波数成分の少
なくとも1周期にまたがっていなければならない。
理することが必須である。さもなければ、連接点での不
連続性により、再構築した信号の信号レベルの変動すな
わちノイズとリバーブをリスナーが感知することにな
る。一例が図1に示してある。2つの信号が最高類似度
点で整合していない場合、2つの信号がオーバラップさ
れ、加算された後に異質なパルスが現れる。SOLAは2つ
の信号の間の相関の測定値として正規化された相互相関
を使用する。大きな値は2つの信号間の信号パターンの
高い類似度を示すことになる。それ故、新しい分析フレ
ームを先に構築されている信号に沿ってスライドするに
つれて、その瞬間の正規化された相互相関が計算され
る。最終的に、最大値を持つインデックスが選ばれる。
この方法は良好な結果を与えるが、分析フレームが移動
するにつれてインデックス毎に新しい相関値を計算しな
ければならないので、大量の演算を伴う。したがって、
SOLAアルゴリズムは、単一のDigital Signal Processin
g(DSP)チップでリアルタイムに実行するのは難しい。
に存在するピッチ情報を破壊することなく入力信号の必
要なTSM(圧縮または拡大)を達成する方法および装
置である。出力信号はクリックのようななんらかの人為
結果のないきれいなものでなければならない。さらに必
要なものは、単一のDSP 、たとえば、TMS320C25LP また
はDASP3 で実現できるように最小量の演算を行いながら
必要なTSMを実施する方法および装置である。
を含む時間領域手段を用いて信号の時間尺度変更を実行
する方法および装置である。本発明は、また、信号の類
似セグメントの検索および連結を可能とする特徴ベクト
ル、距離メトリックの定義と使用を含む。有意の演算部
分を信号の類似セグメントの検索に費やしている間、特
徴ベクトルおよび距離メトリックのディメンションが演
算時間に大きく影響する。さらに、本発明を実施する装
置は、オリジナルの信号のピッチ周期を維持しながら所
望の時間尺度を持つ信号を生成することができる。本発
明のこれらおよび他の特徴は添付図面と一緒に本発明に
ついての以下の詳細な説明から当業者にとって明らかと
なろう。
Overlap and Add(OLA)法およびピッチ情報を保存するた
めの新規な時間整合または時間同期化アルゴリズムを用
いて信号の時間尺度変更を行う演算上有効なアルゴリズ
ムを提供する。本発明は、局所的類似性および時間区間
またはウィンドウにわたる類似性に基づいて信号の2つ
のフレームを同期化する、すなわち時間整合させる。本
発明で用いられるような局所的類似性は、サンプル点ま
わりの類似性と定義する。本発明で用いられるような時
間区間類似性は、時間の或る区間にわたる類似性と定義
する。後により詳しく説明するように、本発明の方法お
よび装置は2段階で整合を達成する。まず、時間区間類
似性の検索を行う。次に、本発明は最良時間区間類似性
領域の付近での局所的類似性の検索を行う。
に示すブロック図に示されている。図2に示すように、
このTSM装置はディジタル信号プロセッサであるプロ
セッサ20上で動作するが、他のプロセッサタイプも使
用し得る。図1の装置は、また、信号内のゼロクロッシ
ング点を決定するためのゼロクロッシング・モジュール
22も包含する。ゼロクロッシング・モジュール22に
は、特徴ベクトルを決定するための特徴ベクトル・モジ
ュール24が接続してある。各特徴ベクトルは、各ゼロ
クロッシング点の性質すなわち局所的特徴を記述してい
る。特徴ベクトル・モジュール24は、2つのゼロクロ
ッシング点間の局所的特徴の近接性を測定する距離メト
リックを定めるための距離メトリック・モジュール26
に接続している。
ール26に接続してあり、ゼロクロッシング点を用いて
2つの信号の最良整合点を決定し、したがって、図3に
示すように信号を整合させる整合モジュール28を包含
する。この整合モジュール28は、時間区間類似性検索
モジュール32と局所類似性検索モジュール34とを包
含する。最後に、整合モジュール28には、クロスフェ
イド・モジュール30が接続してあり、このクロスフェ
イド・モジュールは整合後に得られた信号における連続
したフレーム間の遷移を滑らかにするために特徴ベクト
ルを使用する。これらの特徴の各々は以下により詳しく
説明する。ゼロクロッシング・モジュール22を用いて
ゼロクロッシング点を見出すために、信号のゼロクロッ
シング・レートがその周波数内容の生の測定値であるこ
とに注意しながらゼロクロッシング点で信号の性質を測
定する。整合モジュール28を用いて2つのフレームを
整合させる際に、時間区間類似性検索モジュール32が
用い、信号測定値としてゼロクロッシング・レートを用
いて時間区間類似性を検索する。局所類似性検索モジュ
ール34を用いて局所類似性位置を検索する際に、信号
の局所的特性をゼロクロッシング点で測定する。これら
の局所的特性は、たとえば、ゼロクロッシング点での信
号の勾配および絶対値を含む。ゼロクロッシング・レー
トは時間区間にわたる信号特性を表すパラメータとして
は良好である。勾配や絶対値のようなパラメータは局所
反応を表す良好な手段である。
て、2つの連続するサンプル間で算術符号の変化がある
場合にはゼロクロッシングが存在する。それ故、[l、L]
の周期内のゼロクロッシング点の数は次のように定義さ
れる。
(x[m])=0。特徴ベクトル・モジュール24において、1
1次元特徴ベクトルが生成されてゼロクロッシング・モ
ジュール22を用いて決定された各ゼロクロッシング点
の局所情報を表す。これらの成分は、ゼロクロッシング
点およびその近辺での勾配および絶対値からなる。たと
えば、ゼロクロッシングがx[i]とx[i+1]の間に生じた場
合、11次元特徴ベクトルの11個のディメンジョン、
f1, f2, ..., f11は、
モジュール26では、上述した特徴ベクトル・モジュー
ル24によって定義されたような、2つのゼロクロッシ
ング点の各々と関連した特徴モジュールが類似している
場合には、2つのゼロクロッシング点間の良好な整合が
ある。それ故、特徴ベクトルの差が2つのゼロクロッシ
ング点間の局所的特徴の近接性の測定値として用いるこ
とができる。距離メトリック・モジュール26を用いて
決定される距離メトリック dk,i は次のように定義され
る。
クスであり、 fx [j] はx[n]において1つのゼロクロッ
シング点と関連した特徴ベクトルのj番目の成分であ
り、 fy,i [j] はy[n]においてi番目のゼロクロッシン
グ点と関連した特徴ベクトルのj番目の成分である。こ
れらの成分は2つの信号が結合されたときの滑らかさを
ほぼ示すので選ばれている。たとえば、勾配方向と絶対
値の重要性が図4に示す信号に示されている。それぞれ
ゼロクロッシング・モジュール22、特徴ベクトル・モ
ジュール24、距離メトリック・モジュール26を用い
てひとたびゼロクロッシング点、特徴ベクトルおよび距
離メトリックが決定されたならば、整合モジュール28
が用いられて最良の整合点を決定する。
良整合点の決定は、ゼロクロッシング点に基づいて2つ
の別個の段階で実施される。これら2つの段階とは、分
析フレームの検索と同期化である。分析フレームm(x
[n]のm番目の分析フレーム、ここで、mSα≦n<m
Sα+Nである)の検索中、新しい分析フレームが範囲
kmin ≦ k≦ kmax にわたってy[mSs +k] に沿ってシフ
トされる。値 kmin およびkmaxは上述した通りのもので
ある。ここでは、フレームサイズNが良好な性能を達成
するには kmax の4倍より大きくなければならないこと
に注目されたい。クロスフェイド・モジュール30に関
連して以下に説明する最終クロスフェイド機能を用いて
隣接したフレーム間の遷移をより滑らかにかつより自然
にする。整合モジュール28の実施する次の段階は同期
化である。各フレームに対する同期化は2つの別個の段
階で行われる。まず、初期評価値としてゼロクロッシン
グ・レートを用い、次いで、x[n]のゼロクロッシング点
とy[n]のゼロクロッシング点の間の最小距離メトリック
dk,i を選ぶことによって最終整合を洗練する。
期化段階の第1ステージにおいて、ゼロクロッシング点
の数を用いて持続時間を得る。インデックス kzminは、
オーバラップ区間Lにおける信号x[n]と信号y[n]のゼロ
クロッシング点の数の差 Ckk が以下の数式で示すよう
に最小となるように決定される。このことは、x[n]、y
[n]は区間Lではほぼ同じ波形を持つ。したがって、
てシフトするインデックスである。k 毎にオーバラップ
区間Lが変化するので、新しい値を計算しなければなら
ない。しかしながら、この計算が計算の負担を劇的に増
大させることはない。なぜならば、インデックスk が k
min から kmax まで変わるので、ゼロクロッシング点の
数が蓄積されるからである。整合モジュール28によっ
て実施される同期化段階の第2ステージにおいて、距離
メトリック dc,i を用いて2つのゼロクロッシング点間
の局所的類似性を示す。ここでは、大きな勾配を持つゼ
ロクロッシング点での不整合が小さい勾配を持つゼロク
ロッシング点でよりも著しい影響を与えることが観察さ
れている。したがって、最大の勾配x[ kmax ] を持つゼ
ロクロッシング点が選ばれる。次いで、選ばれたゼロク
ロッシング点を、距離メトリック dk,i によって或る範
囲にわたってy[n]における各ゼロクロッシング点と比較
する。
点を持つ場合、m 、 kmin 、 ksmax、 kminfoundで現在
のフレーム番号、初期評価位置、インデックスをそれぞ
れ表示させる。したがって、整合モジュール28の実施
する作業は次の通りである。 1.mSα≦n<mSα+2kmax の場合、x[n]のゼロ
クロッシング点から ksmaxを見出し、その結果、|x[mS
α+ksmax]-x[mSα+ksmax+1]|が最大勾配を与える。 2.K-T≦j≦K+T(K= Kzmin+ ksmax) の場合、y[mSs +
j] からすべてのゼロクロッシング点を位置決めし、そ
の結果、Tが約10msの時間区間をまたぐ。しかしな
がら、この区間は、 kmin ≦K-T ≦ kmax の場合、下方
境界kminと上方境界 kmax を持ち、決定された最良整合
点 kminfoundが kmin ≦ kminfou nd≦ kmax の範囲内に
なお位置するようにしなければならない。
とその周辺と比べたときに最も類似しているy[n]におけ
るゼロクロッシング点を検索する。x[mSα+ kmax ]と
ステップ2で検出したy[n]における各ゼロクロッシング
点の間の距離メトリック dk を計算する。しかしなが
ら、2つのゼロクロッシング点間の特徴ベクトルの勾配
が反対方向のものである場合、そのゼロクロッシング点
を直ちに廃棄して図4に示すような間違った状況が生じ
るのを避ける。 4.最小距離測定値を与えるインデックス kminfoundを
選ぶ。整合モジュール28を用いて最良整合点がひとた
び決定されたならば、2つのフレームx[mSα+i] とy[mS
α+j] (ここで、0 ≦i <L 、 kminfound≦j < kmi
nfound+L)を平均化し、次いで、x[n]におけるN−L個
のサンプルの残りを以下の数式に示すように出力に添付
することによって出力信号を構築する。
だけでは、非常に滑らかな遷移を得られない。それ故、
かさ上げ余弦関数c[j]を選ぶが、これは適度に滑らかな
フェイドインとフェイドアウトを可能とする。本発明を
用いて実行されるTSMのためのゼロクロッシング・ア
ルゴリズムの性能を評価するためにいくつかのテスト信
号を選んだ。図5Aに、オリジナルの信号、すなわち、
単一シヌソイドが示してある.図5B−Cは図5Aに示
す単一シヌソイド信号の時間尺度バージョンを示してい
る。図5Bでは、単一シヌソイド信号は約20%だけ拡
大してある。図5Cでは、単一シヌソイド信号は約20
%だけ縮小してある。同様に、図6Aは電子キーボード
から抽出した波形を示している。図6B−Cは図6Aに
示す電子キーボードから抽出した波形の時間尺度バージ
ョンを示している。図6Bに示す波形は約20%だけ拡
大してある。図6Cの波形は約20%縮小してある。こ
うして、ここでは、本発明で実施されるゼロクロッシン
グ・アルゴリズムが信号のピッチ周期を保存することが
わかる。
ロクロッシング・レートを用いることの重要さが図7に
示してある。オリジナルの信号は図7Aに示してある。
区間整合の欠如による不連続性が図7Bの信号に示して
あり、この信号はゼロクロッシング・レートを用いて予
備検索なしに約20%だけ拡大してある。それ故、図7
Cでは、区間類似性を決定し、信号を20%拡大するこ
とから得た改良が明らかである。こうして、本発明は、
必要な時間尺度変更を行うためにOverlap and Add(OLA)
の原理を用いて時間尺度変更のための計算上有効なアル
ゴリズムを実施する。ピッチ周期を保存する同期化の結
果、信号のゼロクロッシング点から誘導される情報に基
づいて、局所類似性および時間区間にわたる類似性を確
保できる。その結果、本発明による実行でオリジナルの
信号のピッチ周期性を維持しながら所望の時間尺度を持
つ信号を再生することができる。
ディジタル信号プロセッサ、たとえば、譲渡人、Texas
Instruments Incorporatedの製品であるTMS320C52DSPで
ある場合に本発明を実施する際に伴ういくつかの問題を
検討する。また、オーバラップ・加算法に関して得られ
た洞察およびさらなる理解、たとえば、クロスフェイド
・ゲインの重要性およびオーバラップ期間を変える効果
を論議する。入力信号を44.1kHzでサンプル採取し
たときの本発明の性能も、種々の入力音楽信号、たとえ
ば、電子キーボード、弦楽器、管楽器および歌声と背景
音楽の組み合わせを用いることによって広範囲にわたる
テストを行なった。上記のテスト信号のすべてにおい
て、本発明は44.1kHzのサンプリング率で良質なオ
ーディオ信号を生成し、相互相関法に比べて計算上の負
担をかなり減らすことができる。
ば、TMS320C52DSPを備えたPCMCIAカードを用いるシステ
ム)で本発明を実施するときには2つの局面を考えなけ
ればならない。まず、ハードウェア上ではほんの限られ
たメモリ・スペースしか利用できないが、バッファリン
グ機構を用いれば、演算に影響を与えることなくコーデ
ックから連続した入力、出力サンプルを得ることができ
る。次に、TMS320C52DSPが16ビット固定点ディジタル
信号プロセッサである場合、すべての演算を固定点で行
い、すべての変数を16ビットを用いて表す。本発明の
TSM アルゴリズムでは、入力、出力ストリームは異なっ
たサンプリング率にある。しかしながら、現実のシステ
ムにおける入力、出力の両方について同じサンプリング
周波数が必要である。したがって、図8は、再サンプリ
ング機能部80と接続してあってキー・シフティング機
能部84を与える本発明によるTSM機能部32を示し
ており、この場合、再サンプリング機能部80はピッチ
を変更し、TSM機能部82がオリジナルの時間尺度を
維持することになる。図8はフレーム毎に実施される演
算である。キー・シフティング機能部84は1フレーム
あたりssサンプルを読み出し、再サンプリング機能部
80はssサンプルを再サンプリングしてsαサンプル
を与え、次いで、TSM機能部82がsαサンプルをs
sサンプルに時間尺度化する。
のN個の入力サンプル、先のフレームからの kmin 個の
出力サンプル、現在のフレームからの kmax +N ( kmax
=Kmi n )個の出力サンプルについて演算する。TSM機
能部82において、Nは時間尺度ファクタに依存してs
sまたはsαのサイズを二倍にするようにセットされ、
ここで拡大あるいは縮小が行われる。バッファリング機
構は図9に詳しく示してある。図9に示すバッファリン
グ機構では、入力バッファ90と出力バッファ96はサ
イズssのものである。分析および合成には2つの中間
フレーム・バッファ92、94も必要である。中間分析
フレーム・バッファ92は入力バッファ90からの少な
くともsαの三倍(分析フレーム長)のサンプルを格納
し、中間合成フレーム・バッファ94は少なくともss
の4倍(合成フレーム・サイズ)を格納して時間尺度変
更信号を再構築する。
信号プロセッサである。これは、32ビット・アキュム
レータを備えた32ビット演算論理ユニット(ALU)と、
32ビット積容量を備えた16ビット乗算器と、ワード
(16ビット)モードでアクセスされるデータ・メモリ
とを包含する。したがって、16ビットですべての変数
を表す必要がある。Qn記号を採用し、ここで、nは分
数部に割り当てられたビットの数を表す。たとえば、−
2から1.9999の間で変化する符号付き浮動小数点変
数はQ14で表すことができ、ここで、14個の最下位
ビット(LSB)(ビットb0 、・・・・b13)が用いられ
て分数部を表し、1ビット(b14)が用いられて整数部
を表し、最上位ビット(MSB)(ビットb15)が用いられ
て符号を表す。リアルタイムでキー・シフティング機能
部84を実施する際に伴う問題のいくつかを以下に論議
する。
によって行われる。しかしながら、濾波済みの出力が時
に215を超える場合には2、3の問題、たとえば、オー
バフローが生じ、ダウンサンプリングあるいはアップサ
ンプリングの前または後に信号バンド幅を制限するのに
用いられるローパスフィルタが不適切である場合にはア
ライニングが生じる。本発明においては、いくつかの考
慮すべき点がある。まず、入力、出力サンプルである。
次に、大域、小域の類似性の一致である。考慮すべき付
加的な点はオーバラップ、加算操作である。コーデック
が16ビット・リニア・フォーマット(すなわち、−3
2768から32767まで)でサンプルを提供するの
で、入力、出力サンプルは単純にQ15フォーマットで
表される。
2つの段階を含む。第1段階(予備的な大域検索を行な
ってゼロクロッシング点の数および入力、出力フレーム
間の差を決定する)は整数計算のみを行なう。しかしな
がら、第2段階(入力、出力間の特徴距離を最小限にす
る精密な局所検索を行なう)でのオーバフローを避ける
のに若干のスケーリングが必要である。上述した距離メ
トリック di はi番目のゼロクロッシング点における距
離測定値である。これらの特徴成分は入力、出力の勾配
および大きさの差と比較される。これらの変数のための
Qフォーマットは、種々の入力信号についての動的範囲
をプロットすることによって統計的テストに基づいて選
ばれる。これは以下の表1に要約されている。
関数を用いてオーバラップ、加算中の2つのフレーム間
の遷移を滑らかにした(すなわち、クロスフェイドし
た)。しかしながら、固定点形態では、かさ上げ余弦関
数の代わりに一次関数を用いてこれまでに用いられてき
たテスト・ベクトルに対して顕著な劣化なしにより有効
な計算を行なう。線形クロスフェイド関数は次のように
定義される。 フェイドイン・ゲイン:l[j]=j/L、ここでLはオー
バラップ区間、0<j<L フェイドアウト・ゲイン:1-l[j]。
1.0まで変わるゲインでフェイドインしており、出力合
成フレームがオーバラップ期間において1.0から0.0ま
での範囲にあるゲインでフェイドアウトしているクロス
フェイド・プロセスを示している。割り算はDSPにつ
いては計算上コストがかかるので、フレーム毎に一度Δ
=1/Lを計算し、いつもj/Lを計算する代わりに引
き続く時間インデックスについてjxΔ(ここで、jは
時間インデックスである)を計算する。しかしながら、
Δは15ビット精度の最大値でしか表せない。したがっ
て、(L−1)xΔが(L−1)/Lに近くなるという
保証はない。この不一致は、Lが大きいとき(44.1k
HzではLは1500を超えることが多い)にかなりの
頻度で生じる。(L−1)xΔが真の値(L−1)/L
から0.002より大きく偏倚しているとき、フェイドイ
ン・ゲインはオーバラップ区間の終わりで1.0に充分に
近い値に達することはなく(図10B参照)、オーバラ
ップ区間後の第1サンプルについてのゲインは突然1.0
になる。これは時間尺度化信号における連接点まわりに
可聴クリック音を生じさせる。連接が起きる区間で全周
波数バンドを横切って広がる低振幅のホワイトノイズ・
スペクトルも、出力信号のスペクトル写真において観察
された。この問題を解決するには2つの方法がある。
定することである。Q15フォーマットで無限精度にお
ける(L−1)xΔ対Lについてのプロットが図11A
に示してある。Q15フォーマット曲線のピークはQ1
5値が無限精度に非常に近いことを示しており、谷間は
その反対を示している。図11Aからわかるように、L
=762(または381、585または1024)のと
き、Q15における(L−1)xΔは無限精度値に非常
に近い。それ故、もし上限がL′≦762となるように
オーバラップ区間に設定されたならば、Lが44.1kH
zサンプリング率で762より非常に大きくなりそうな
ので、L′は大部分のフレームについて762に設定さ
れる。したがって、滑らかなフェイドイン・ゲインが確
保される。オーバラップ区間L′についてのこの制限に
より、クリック音がなく、品質劣化が非常に少ない信号
の再構築が可能となる。L′=381(8.6ms)か5
85(13.2ms)のとき、背景音楽を伴う歌声は非常
に良好なオーディオ品質で再生することはできない。さ
らに、L=1024(23.2ms)の場合、品質はL′
=762(17.2ms)に類似している。この方法によ
れば、オーバラップ・加算作業がオリジナルのLx2
(ここで、Lが1500より大きいことが多い)乗算・
加算命令の代わりにせいぜい762x2乗算・加算命令
のみを必要とするだけなので、計算回数が低減できると
いう別の利点も得ることができる。
に近いオーバラップ区間の適当な値、すなわちオーバラ
ップ区間L′を選び、また、無限精度値に近いQ15の
Δ値を選ぶことである。換言すれば、図11AのQ15
曲線における最も近いピークであるL′を選ぶのであ
る。Q15フォーマットで無限精度のΔ対Lのプロット
が図11Bに示してある。Q15曲線は階段形状を有
し、これはQ15のΔが次のより小さい全数(整数(1
/L)x215)に対して常に切り捨てられることを示し
ている。したがって、最も近いピークを得る簡単な方法
は、割り算を2回行なうことである。すなわち、Q15
におけるΔを計算し、このΔについて対応するL′を見
出すのである。
はQ15のものであり、L′はQ15曲線(図11A)
における次に最も近いピークである。オリジナルのLお
よびQ15フォーマットの変更L′から計算したフェイ
ドイン・ゲインが図12に示してある。この方法は、い
かなる可聴人工音のない歌声および背景音楽両方につい
て良好なオーディオ品質を生成することができる。図8
に示す本発明の第2実施例では、再サンプリング機能部
80とTSM機能部82をキー・シフティング用の1つ
のモジュール84にまとめてある。固定点再サンプリン
グ機能に伴う問題が知られており、GLS−TSMのリ
アルタイム、固定点実行に伴う問題点のいくつかは解決
されている。このプロセス中、多数の洞察が行われた。
まず、オーバラップ・加算プロセスの性能が正確なオー
バラップ区間の長さに依存しないということである。そ
れは、1つのフレームから他のフレームまでの遷移にと
って充分な長さの区間を必要とするだけである。歌声を
音楽とミックスするためには、最短18ミリ秒の遷移区
間が必要とされる。次に、平滑化(すなわち、クロスフ
ェイド)ゲインは、1つのフレームから次のフレームま
での遷移を滑らかにするのに重要な役割を果たす。でき
るだけ無限精度表記法に近い固定点表記法でフェイドイ
ン・ゲインを表すのが重要である。そうしないと、フェ
イドイン・ゲインがオーバラップ期間の終わりで1.0に
充分に近い値に達しないときに可聴クリック音が生じ
る。
きたが、添付の請求の範囲に定義されているような発明
の精神、範囲から逸脱することなく種々の変更、代替、
交換をなし得ることは了解されたい。上記の記載に関連
して以下の事項を開示する。 1. 信号の時間尺度変更を行う方法であって、ゼロクロ
ッシング・モジュールを用いて信号内のゼロクロッシン
グ点を決定する段階と、特徴ベクトル・モジュールを用
いて前記ゼロクロッシング点を描写する特徴ベクトルを
決定する段階と、前記特徴ベクトルを用いて前記ゼロク
ロッシング点と関連する距離メトリックであって、各々
が距離メトリック・モジュールを用いて前記ゼロクロッ
シング点のうちの2つのゼロクロッシング点間の局所的
特徴の近接性を測定する距離メトリックを決定する段階
と、前記特徴ベクトルと前記距離メトリックを用いて類
似セグメントに沿って信号を整合させ、前記整合モジュ
ールを用いて信号の時間尺度変更を行う段階とを包含す
ることを特徴とする方法。 2. 上記項1記載の方法において、さらに、クロスフェ
イディング・モジュールを用いて信号の時間尺度変更に
おける連続したフレーム間の遷移を滑らかにする段階を
包含することを特徴とする方法。 3. 上記項1記載の方法において、前記整合段階が局所
的類似性および時間区間にわたる類似性に基づいて前記
類似セグメントについて検索する段階を包含することを
特徴とする方法。 4. 上記項1記載の方法において、前記整合段階が前記
ゼロクロッシング点のカウント数および前記ゼロクロッ
シング点のうちの2つのゼロクロッシング点間の最小距
離メトリックに従って信号を同期化する段階を包含する
ことを特徴とする方法。 5. 上記求項1記載の方法において、前記局所的特徴が
絶対的な大きさおよび勾配を含むことを特徴とする方
法。 6. 上記項1記載の方法において、前記ゼロクロッシン
グ点Zの各々が、以下の数式
n(x[m])=0)を用いて決定されることを特徴とする方
法。 7. 信号の時間尺度変更を行う装置であって、信号内の
ゼロクロッシング点を決定するゼロクロッシング・モジ
ュールと、このゼロクロッシング・モジュールに接続し
てあって前記ゼロクロッシング点を描写する特徴ベクト
ルを決定する特徴ベクトル・モジュールと、この特徴ベ
クトル・モジュールに接続してあって、前記ゼロクロッ
シング点のうちの2つのゼロクロッシング点間の局所的
特徴の近接性を示す距離メトリックを決定する距離メト
リック・モジュールと、この距離メトリック・モジュー
ルに接続してあって、前記ゼロクロッシング点および前
記距離メトリックを用いて前記信号を整合させ、信号の
時間尺度変更を行う整合モジュールとを包含することを
特徴とする装置。 8. 上記項5記載の装置において、さらに、前記整合モ
ジュールに接続してあって、信号の時間尺度変更の際の
連続したフレーム間の遷移を滑らかにするクロスフェイ
ド・モジュールを包含することを特徴とする装置。
ーバラップと加算を行なうことを示す。
る。
図である。
明する3つの信号を示す図である。
シング・プロセスの性能を説明するテスト信号を示す。
シング・プロセスの性能を説明する他のテスト信号を示
す。
する信号を示す。
グ機能部のブロック図である。
部の実行の際に使用されるバッファリング機構を示す。
フェイド・プロセスを示す。
精度での値のプロットを示す。
て計算されるフェイドイン・ゲインを示す。
Claims (2)
- 【請求項1】 信号の時間尺度変更を行う方法であっ
て、ゼロクロッシング・モジュールを用いて信号内のゼ
ロクロッシング点を決定する段階と、特徴ベクトル・モ
ジュールを用いて前記ゼロクロッシング点を描写する特
徴ベクトルを決定する段階と、前記特徴ベクトルを用い
て前記ゼロクロッシング点と関連する距離メトリックで
あって、各々が距離メトリック・モジュールを用いて前
記ゼロクロッシング点のうちの2つのゼロクロッシング
点間の局所的特徴の近接性を測定する距離メトリックを
決定する段階と、前記特徴ベクトルと前記距離メトリッ
クを用いて類似セグメントに沿って信号を整合させ、前
記整合モジュールを用いて信号の時間尺度変更を行う段
階とを包含することを特徴とする方法。 - 【請求項2】 信号の時間尺度変更を行う装置であっ
て、信号内のゼロクロッシング点を決定するゼロクロッ
シング・モジュールと、このゼロクロッシング・モジュ
ールに接続してあって前記ゼロクロッシング点を描写す
る特徴ベクトルを決定する特徴ベクトル・モジュール
と、この特徴ベクトル・モジュールに接続してあって、
前記ゼロクロッシング点のうちの2つのゼロクロッシン
グ点間の局所的特徴の近接性を示す距離メトリックを決
定する距離メトリック・モジュールと、この距離メトリ
ック・モジュールに接続してあって、前記ゼロクロッシ
ング点および前記距離メトリックを用いて前記信号を整
合させ、信号の時間尺度変更を行う整合モジュールとを
包含することを特徴とする装置。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US08/609335 | 1996-03-01 | ||
| US08/609,335 US5749064A (en) | 1996-03-01 | 1996-03-01 | Method and system for time scale modification utilizing feature vectors about zero crossing points |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH09325794A true JPH09325794A (ja) | 1997-12-16 |
Family
ID=24440360
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP9047595A Pending JPH09325794A (ja) | 1996-03-01 | 1997-03-03 | 時間尺度変更方法および装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US5749064A (ja) |
| JP (1) | JPH09325794A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7474994B2 (en) | 2001-12-14 | 2009-01-06 | Qualcomm Incorporated | System and method for wireless signal time of arrival |
Families Citing this family (50)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2000030069A2 (en) | 1998-11-13 | 2000-05-25 | Lernout & Hauspie Speech Products N.V. | Speech synthesis using concatenation of speech waveforms |
| DE69933929T2 (de) | 1999-04-09 | 2007-06-06 | Texas Instruments Inc., Dallas | Bereitstellen von digitalen Audio- und Videoprodukten |
| US6625656B2 (en) * | 1999-05-04 | 2003-09-23 | Enounce, Incorporated | Method and apparatus for continuous playback or distribution of information including audio-visual streamed multimedia |
| JP3430968B2 (ja) * | 1999-05-06 | 2003-07-28 | ヤマハ株式会社 | ディジタル信号の時間軸圧伸方法及び装置 |
| JP4300641B2 (ja) | 1999-08-10 | 2009-07-22 | ヤマハ株式会社 | マルチトラック音源信号の時間軸圧伸方法及び装置 |
| JP3601371B2 (ja) | 1999-09-27 | 2004-12-15 | ヤマハ株式会社 | 波形生成方法及び装置 |
| US6594715B1 (en) * | 1999-11-03 | 2003-07-15 | Lucent Technologies Inc. | Method and apparatus for interfacing asymmetric digital subscriber lines to a codec |
| US20030158734A1 (en) * | 1999-12-16 | 2003-08-21 | Brian Cruickshank | Text to speech conversion using word concatenation |
| US6931292B1 (en) * | 2000-06-19 | 2005-08-16 | Jabra Corporation | Noise reduction method and apparatus |
| US7363232B2 (en) * | 2000-08-09 | 2008-04-22 | Thomson Licensing | Method and system for enabling audio speed conversion |
| US20040090555A1 (en) * | 2000-08-10 | 2004-05-13 | Magdy Megeid | System and method for enabling audio speed conversion |
| US6832194B1 (en) * | 2000-10-26 | 2004-12-14 | Sensory, Incorporated | Audio recognition peripheral system |
| US6961397B2 (en) * | 2001-07-12 | 2005-11-01 | Lucent Technologies Inc. | Symbol synchronizer for impulse noise channels |
| EP1527441B1 (en) * | 2002-07-16 | 2017-09-06 | Koninklijke Philips N.V. | Audio coding |
| US7427815B1 (en) * | 2003-11-14 | 2008-09-23 | General Electric Company | Method, memory media and apparatus for detection of grid disconnect |
| US7567896B2 (en) * | 2004-01-16 | 2009-07-28 | Nuance Communications, Inc. | Corpus-based speech synthesis based on segment recombination |
| US7253600B2 (en) * | 2005-07-19 | 2007-08-07 | Cambridge Analog Technology, Llc | Constant slope ramp circuits for sample-data circuits |
| US8345890B2 (en) * | 2006-01-05 | 2013-01-01 | Audience, Inc. | System and method for utilizing inter-microphone level differences for speech enhancement |
| US8204252B1 (en) | 2006-10-10 | 2012-06-19 | Audience, Inc. | System and method for providing close microphone adaptive array processing |
| US9185487B2 (en) * | 2006-01-30 | 2015-11-10 | Audience, Inc. | System and method for providing noise suppression utilizing null processing noise subtraction |
| US8194880B2 (en) | 2006-01-30 | 2012-06-05 | Audience, Inc. | System and method for utilizing omni-directional microphones for speech enhancement |
| US8744844B2 (en) * | 2007-07-06 | 2014-06-03 | Audience, Inc. | System and method for adaptive intelligent noise suppression |
| US8949120B1 (en) | 2006-05-25 | 2015-02-03 | Audience, Inc. | Adaptive noise cancelation |
| US8204253B1 (en) | 2008-06-30 | 2012-06-19 | Audience, Inc. | Self calibration of audio device |
| US8849231B1 (en) | 2007-08-08 | 2014-09-30 | Audience, Inc. | System and method for adaptive power control |
| US8934641B2 (en) * | 2006-05-25 | 2015-01-13 | Audience, Inc. | Systems and methods for reconstructing decomposed audio signals |
| US8150065B2 (en) * | 2006-05-25 | 2012-04-03 | Audience, Inc. | System and method for processing an audio signal |
| US8027377B2 (en) * | 2006-08-14 | 2011-09-27 | Intersil Americas Inc. | Differential driver with common-mode voltage tracking and method |
| TWI312500B (en) * | 2006-12-08 | 2009-07-21 | Micro Star Int Co Ltd | Method of varying speech speed |
| US7899678B2 (en) * | 2007-01-11 | 2011-03-01 | Edward Theil | Fast time-scale modification of digital signals using a directed search technique |
| US8259926B1 (en) | 2007-02-23 | 2012-09-04 | Audience, Inc. | System and method for 2-channel and 3-channel acoustic echo cancellation |
| US8189766B1 (en) | 2007-07-26 | 2012-05-29 | Audience, Inc. | System and method for blind subband acoustic echo cancellation postfiltering |
| US8321222B2 (en) * | 2007-08-14 | 2012-11-27 | Nuance Communications, Inc. | Synthesis by generation and concatenation of multi-form segments |
| US8180064B1 (en) | 2007-12-21 | 2012-05-15 | Audience, Inc. | System and method for providing voice equalization |
| US8143620B1 (en) | 2007-12-21 | 2012-03-27 | Audience, Inc. | System and method for adaptive classification of audio sources |
| US8194882B2 (en) | 2008-02-29 | 2012-06-05 | Audience, Inc. | System and method for providing single microphone noise suppression fallback |
| US8355511B2 (en) | 2008-03-18 | 2013-01-15 | Audience, Inc. | System and method for envelope-based acoustic echo cancellation |
| US8521530B1 (en) | 2008-06-30 | 2013-08-27 | Audience, Inc. | System and method for enhancing a monaural audio signal |
| US8774423B1 (en) | 2008-06-30 | 2014-07-08 | Audience, Inc. | System and method for controlling adaptivity of signal modification using a phantom coefficient |
| US20100063816A1 (en) * | 2008-09-07 | 2010-03-11 | Ronen Faifkov | Method and System for Parsing of a Speech Signal |
| US20100169105A1 (en) * | 2008-12-29 | 2010-07-01 | Youngtack Shim | Discrete time expansion systems and methods |
| US8655466B2 (en) * | 2009-02-27 | 2014-02-18 | Apple Inc. | Correlating changes in audio |
| US8670990B2 (en) * | 2009-08-03 | 2014-03-11 | Broadcom Corporation | Dynamic time scale modification for reduced bit rate audio coding |
| US9008329B1 (en) | 2010-01-26 | 2015-04-14 | Audience, Inc. | Noise reduction using multi-feature cluster tracker |
| WO2013149188A1 (en) | 2012-03-29 | 2013-10-03 | Smule, Inc. | Automatic conversion of speech into song, rap or other audible expression having target meter or rhythm |
| US9640194B1 (en) | 2012-10-04 | 2017-05-02 | Knowles Electronics, Llc | Noise suppression for speech processing based on machine-learning mask estimation |
| US9459768B2 (en) | 2012-12-12 | 2016-10-04 | Smule, Inc. | Audiovisual capture and sharing framework with coordinated user-selectable audio and video effects filters |
| US9536540B2 (en) | 2013-07-19 | 2017-01-03 | Knowles Electronics, Llc | Speech signal separation and synthesis based on auditory scene analysis and speech modeling |
| KR102356012B1 (ko) | 2013-12-27 | 2022-01-27 | 소니그룹주식회사 | 복호화 장치 및 방법, 및 프로그램 |
| US9799330B2 (en) | 2014-08-28 | 2017-10-24 | Knowles Electronics, Llc | Multi-sourced noise suppression |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4780906A (en) * | 1984-02-17 | 1988-10-25 | Texas Instruments Incorporated | Speaker-independent word recognition method and system based upon zero-crossing rate and energy measurement of analog speech signal |
| US4856068A (en) * | 1985-03-18 | 1989-08-08 | Massachusetts Institute Of Technology | Audio pre-processing methods and apparatus |
| US5216744A (en) * | 1991-03-21 | 1993-06-01 | Dictaphone Corporation | Time scale modification of speech signals |
| US5175769A (en) * | 1991-07-23 | 1992-12-29 | Rolm Systems | Method for time-scale modification of signals |
| US5504833A (en) * | 1991-08-22 | 1996-04-02 | George; E. Bryan | Speech approximation using successive sinusoidal overlap-add models and pitch-scale modifications |
| WO1993018505A1 (en) * | 1992-03-02 | 1993-09-16 | The Walt Disney Company | Voice transformation system |
| US5473759A (en) * | 1993-02-22 | 1995-12-05 | Apple Computer, Inc. | Sound analysis and resynthesis using correlograms |
-
1996
- 1996-03-01 US US08/609,335 patent/US5749064A/en not_active Expired - Lifetime
-
1997
- 1997-03-03 JP JP9047595A patent/JPH09325794A/ja active Pending
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7474994B2 (en) | 2001-12-14 | 2009-01-06 | Qualcomm Incorporated | System and method for wireless signal time of arrival |
Also Published As
| Publication number | Publication date |
|---|---|
| US5749064A (en) | 1998-05-05 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JPH09325794A (ja) | 時間尺度変更方法および装置 | |
| US20220262404A1 (en) | Audiovisual capture and sharing framework with coordinated, user-selectable audio and video effects filters | |
| US11127407B2 (en) | Automatic conversion of speech into song, rap or other audible expression having target meter or rhythm | |
| JP2906970B2 (ja) | サウンドの分析及び合成方法並びに装置 | |
| JP4641620B2 (ja) | ピッチ検出の精密化 | |
| Zhu et al. | Real-time signal estimation from modified short-time Fourier transform magnitude spectra | |
| US11410637B2 (en) | Voice synthesis method, voice synthesis device, and storage medium | |
| JP5283757B2 (ja) | オーディオ信号のスペクトルの複数の局部重心周波数を決定するための装置及び方法 | |
| JP2002515610A (ja) | 位相変化からの雑音寄与度の決定に基づく音声符号化 | |
| JP2016509384A (ja) | コーディネートされた、ユーザ選択可能な音響及びビデオ効果フィルタを有する音響視覚取得及び共有フレームワーク | |
| Fitz et al. | Sinusoidal modeling and manipulation using lemur | |
| Bonada et al. | Sample-based singing voice synthesizer by spectral concatenation | |
| JP4194656B2 (ja) | 波形の合成 | |
| Yim et al. | Computationally efficient algorithm for time scale modification (GLS-TSM) | |
| JP2018077283A (ja) | 音声合成方法 | |
| Wright et al. | Analysis/synthesis comparison | |
| Wong et al. | Fast time scale modification using envelope-matching technique (EM-TSM) | |
| Klassen et al. | Melodic Contour Generation with Spline Models of Cycles | |
| Lin et al. | High quality and low complexity pitch modification of acoustic signals | |
| JP6683103B2 (ja) | 音声合成方法 | |
| JP6834370B2 (ja) | 音声合成方法 | |
| Rodet | Sound analysis, processing and synthesis tools for music research and production | |
| JP6822075B2 (ja) | 音声合成方法 | |
| 唐博文 | Energy-Efficient Real-Time Pitch Correction System via FPGA | |
| JP3447220B2 (ja) | 音声変換装置及び音声変換方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20040227 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20070319 |
|
| A601 | Written request for extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A601 Effective date: 20070619 |
|
| A602 | Written permission of extension of time |
Free format text: JAPANESE INTERMEDIATE CODE: A602 Effective date: 20070622 |
|
| A02 | Decision of refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A02 Effective date: 20080407 |