JP7601224B2 - 生成方法、生成プログラム及び生成装置 - Google Patents

生成方法、生成プログラム及び生成装置 Download PDF

Info

Publication number
JP7601224B2
JP7601224B2 JP2023532858A JP2023532858A JP7601224B2 JP 7601224 B2 JP7601224 B2 JP 7601224B2 JP 2023532858 A JP2023532858 A JP 2023532858A JP 2023532858 A JP2023532858 A JP 2023532858A JP 7601224 B2 JP7601224 B2 JP 7601224B2
Authority
JP
Japan
Prior art keywords
intermediate representation
probability distribution
generation
model
unit
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
JP2023532858A
Other languages
English (en)
Other versions
JPWO2023281555A1 (ja
Inventor
裕紀 金川
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NTT Inc
NTT Inc USA
Original Assignee
Nippon Telegraph and Telephone Corp
NTT Inc USA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nippon Telegraph and Telephone Corp, NTT Inc USA filed Critical Nippon Telegraph and Telephone Corp
Publication of JPWO2023281555A1 publication Critical patent/JPWO2023281555A1/ja
Application granted granted Critical
Publication of JP7601224B2 publication Critical patent/JP7601224B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/06Elementary speech units used in speech synthesisers; Concatenation rules
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/27Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique
    • G10L25/30Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique using neural networks

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Signal Processing (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Description

本発明は、生成方法、生成プログラム及び生成装置に関する。
音声合成において、スペクトルや声の高さを表すピッチ等の音響特徴量から音声波形に変換するモジュールはボコーダーと呼ばれる。ボコーダーの実装方法は大きく二種類がある。一つは信号処理による方法であり、STRAIGHTやWORLDといった手法が有名である(たとえば、非特許文献1,2参照)。これらの方法は数理モデルにより音響特徴量から音声波形への変換を表現するため、学習が不要かつ処理速度が高速であるが、分析再合成された音声を自然音声と比較すると品質が劣る。
もう一つは、WaveNetに代表されるニューラルネットによる手法(ニューラルボコーダー)が提案されている(たとえば、特許文献1参照)。こちらは自然音声と比較しても遜色ない品質の音声を合成可能な一方、計算量が多いため信号処理のボコーダーよりも動作が低速である。通常、1つの音声サンプルの予測のためにニューラルネットを1回順伝搬しなくてはならないため、そのまま実装したのではリアルタイム動作は困難である。
ニューラルボコーダーの計算量を減らし、特にCPUにおいてリアルタイム動作させるためには主に二つのアプローチが採られる。一つはニューラルネットの順伝搬1回あたりの計算コストを削減するもので、WaveNetで用いられる巨大な畳み込みニューラルネット(CNN: Convolutional Neural Network)を小規模な再帰型ニューラルネット(RNN:Recurrent Neural Network)で置き換えたWaveRNN(たとえば、特許文献2)や、音声波形の生成過程に信号処理の知見である線形予測分析(LPC)を活用したLPCNet等(たとえば、非特許文献3)がある。
もう一つは順伝搬の回数そのものを減らす方法であり、予測対象を音声波形でなく、サブバンド信号と呼ばれる疑似直交ミラーフィルター(Pseudo-QMF)を用いて帯域分割した短い系列に変更することで順伝搬の回数を減らせることが開示されている(たとえば、非特許文献4)。
国際公開第2018/048934号 国際公開第2019/155054号
Hideki Kawahara, Ikuyo Masuda-Katsuse and Alain de Cheveigne, "Restructuring speech representations using a pitch-adaptive time-frequency smoothing and an instantaneous-frequency-based F0 extraction: Possible role of a repetitive structure in sounds," Speech Communication, vol. 27, no. 3-4, pp. 187-207, 1999. Masanori Morise, Fumiya Yokomori, Kenji Ozawa, "WORLD: a Vocoder-Based High-Quality Speech Synthesis System for Real-Time Applications," IEICE transactions on information and systems, vol. E99-D, no. 7, pp. 1877-1884, 2016. Jean-Marc Valin and Jan Skoglund, "LPCNET: IMPROVING NEURAL SPEECH SYNTHESIS THROUGH LINEAR PREDICTION," Proc. ICASSP, 2019, pp. 5891-5895 Chengzhu Yu, Heng Lu, Na Hu, Meng Yu, Chao Weng, Kun Xu, Peng Liu, Deyi Tuo, Shiyin Kang, Guangzhi Lei, Dan Su, Dong Yu, "DurIAN: Duration Informed Attention Network for Speech Synthesis", Proc. INTERSPEECH 2020, pp. 2027-2031, 2020
非特許文献4では引用文献2を改良し、1サンプル分の音声波形の代わりに1サンプル分のサブバンド信号を使い、次の時刻のサブバンド信号を予測する。この場合にB個のチャネルでサブバンド表現すると系列長を1/Bに短縮でき、純伝搬回数を1/Bに削減可能である。しかしRNN等の自己回帰構造に基づき、過去のサンプルに基づき1サンプルずつ生成しているため、最大B倍速以上の高速化ができない。
本発明は、上記に鑑みてなされたものであって、音響特徴量から高速に音声波形を生成することができる生成方法、生成プログラム及び生成装置を提供することを目的とする。
上述した課題を解決し、目的を達成するために、コンピュータは、音声波形の音響特徴量を基にして、サブバンド信号の中間表現情報を生成する中間表現生成工程と、サブバンド信号のチャンネル数と、同時生成するサンプル数との数に応じた複数の確率分布生成モデルであって、それぞれに割り当てられた時刻および帯域に対応するサブバンド信号の情報を出力する複数の確率分布生成モデルに、中間表現情報を入力することで、異なる複数の時刻および異なる複数の帯域に応じた複数のサブバンド信号を同時に生成するサブバンド信号生成工程と、複数のサブバンド信号を基にして、音声波形を生成する音声波形生成工程とを含む。
本発明によれば、音響特徴量から高速に音声波形を生成することができる。
図1は、本実施例1に係る生成装置の構成を示す機能ブロック図である。 図2は、サブバンド信号の一例を示す図である。 図3は、本実施例1に係る学習部を説明するための図である。 図4は、本実施例1に係る生成部を説明するための図である。 図5は、本実施例1に係る生成装置の学習時の処理手順を示すフローチャートである。 図6は、本実施例1に係る生成装置の生成時の処理手順を示すフローチャートである。 図7は、本実施例2に係る生成装置の構成を示す機能ブロック図である。 図8は、本実施例2に係る学習部を説明するための図である。 図9は、本実施例2に係る生成部を説明するための図である。 図10は、本実施例2に係る生成装置の学習時の処理手順を示すフローチャートである。 図11は、本実施例2に係る生成装置の生成時の処理手順を示すフローチャートである。 図12は、本実施例3に係る生成装置の構成を示す機能ブロック図である。 図13は、本実施例3に係る学習部を説明するための図である。 図14は、本実施例3に係る生成部を説明するための図である。 図15は、本実施例3に係る生成装置の学習時の処理手順を示すフローチャートである。 図16は、本実施例3に係る生成装置の生成時の処理手順を示すフローチャートである。 図17は、生成プログラムを実行するコンピュータの一例を示す図である。
以下に、本願の開示する生成方法、生成プログラム及び生成装置の実施例を図面に基づいて詳細に説明する。なお、この実施例によりこの発明が限定されるものではない。
まず、本実施例1に係る生成装置の構成例について説明する。図1は、本実施例1に係る生成装置の構成を示す機能ブロック図である。図1に示すように、この生成装置100は、通信制御部110と、入力部120と、出力部130と、記憶部140と、制御部150とを有する。
通信制御部110は、NIC(Network Interface Card)等で実現され、LAN(Local Area Network)やインターネットなどの電気通信回線を介した外部の装置と制御部150との通信を制御する。
入力部120は、キーボードやマウス等の入力デバイスを用いて実現され、操作者による入力操作に対応して、制御部150に対して処理開始などの各種指示情報を入力する。
出力部130は、制御部150から取得した情報を出力する出力デバイスであり、液晶ディスプレイなどの表示装置、プリンター等の印刷装置等によって実現される。
記憶部140は、学習用音声波形データ141と、第1中間表現モデル10と、第2中間表現モデル11と、確率分布生成モデル12とを有する。記憶部140は、RAM(Random Access Memory)、フラッシュメモリ(Flash Memory)等の半導体メモリ素子、または、ハードディスク、光ディスク等の記憶装置によって実現される。
学習用音声波形データ141には、学習用の複数の音声波形のデータが含まれる。学習用音声波形データ141は、第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12を学習する場合に利用される。
第1中間表現モデル10は、音声波形から計算される音響特徴量が入力された場合に、音響特徴量の中間表現mを出力するモデルである。第1中間表現モデル10は、たとえば、NN(Neural Network)、CNN、RNN、WaveRNN等に対応する。以下の説明では、音響特徴量の中間表現mを、適宜、「中間表現m」と表記する。
音響特徴量は、音声波形のスペクトログラム、メルケプストラム等のスペクトル情報、基本周波数、ピッチ周波数等の韻律情報に対応する。
音響特徴量の中間表現は、音響特徴量の系列長を音声サンプル数と同じになるように伸長した情報である。係る中間表現mを生成する第1中間表現モデル10の実現方法として、1フレームに対応する音響特徴量のベクトルをサンプル数だけ並べて伸長する方法がある。また、第1中間表現モデル10をWaveRNNで実現する場合、前後フレームの連続性を考慮するため、一次元CNNや二次元CNNを用いて特徴量変換しながら伸長する方法を採用する。
第2中間表現モデル11は、中間表現mが入力された場合に、サブバンド信号の中間表現xを出力するモデルである。後述するように、第2中間表現モデル11は、複数存在する。以下の説明では、サブバンド信号の中間表現xを、適宜、「中間表現x」と表記する。中間表現xのtは時刻インデックスである。たとえば、xt=-1、0は、時刻t=-1、t=0の情報を含んだベクトルであることを意味する。ここで、中間表現xt=-1,0は、中間表現xの初期値に相当する情報である。
図2は、サブバンド信号の一例を示す図である。図2の縦軸はAmplitude Responseに対応し、横軸はNormalized Frequencyに対応する。図2では、音声信号(フルバンド信号)にフィルターをかけることで、4つのサブバンド信号sub1、sub2、sub3、sub4を生成した場合を示している。サブバンド信号sub1は、低域のサブバンド信号である。サブバンド信号sub2は、低域~中域のサブバンド信号である。サブバンド信号sub3は、中域~高域のサブバンド信号である。サブバンド信号sub4は、高域のサブバンド信号である。
確率分布生成モデル12は、中間表現xが入力された場合に、サブバンド信号の確率分布yを出力するモデルである。後述するように、確率分布生成モデル12は、複数存在する。確率分布yのtは時刻インデックスであり、bはサブバンド信号のチャンネルのインデックスである。確率分布yは、音声波形サンプル値の生成確率である。音声波形がμ-law信号等の離散値で表現されている場合には、確率分布yとして、カテゴリカル分布を用いることができる。音声波形が連続値で表現されている場合には、確率分布yとして、ガウス分布、ベータ分布、混合ロジスティック分布を用いることができる。
図1において、制御部150は、学習部151と、生成部152とを有する。制御部150は、CPU(Central Processing Unit)等に対応する。
学習部151は、学習用音声波形データ141を用いて、第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12の学習を実行する。
生成部152は、学習済みの第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12を用いて、音響特徴量から音声波形を生成する。生成部152は、音響特徴量の情報を、入力部120から取得してもよいし、通信制御部110を介して、外部装置から取得してもよい。
次に、図1に示した学習部151について具体的に説明する。図3は、本実施例1に係る学習部を説明するための図である。図3に示すように、学習部151は、音響特徴量計算部20、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の確率分布生成モデル12-t-b(t=1、・・・、T/B、b=1、・・・、B)、サンプリング部21-t-b、サブバンド信号計算部30、損失計算部31、モデル学習部32を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
学習部151は、学習用音声波形データ141に格納された音声波形D1を音響特徴量計算部20に入力する。音響特徴量計算部20は、音声波形D1を基にして、音響特徴量D2を算出する。音響特徴量計算部20は、音響特徴量D2を、第1中間表現モデル10に入力する。
第1中間表現モデル10は、音響特徴量D2が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。第1中間表現モデル10は、勾配情報を、モデル学習部32に出力する。
各第2中間表現モデル11-1~11-nは、中間表現mが入力された場合に、サブバンド信号の中間表現xを出力する。たとえば、第2中間表現モデル11-1は、中間表現xt=-1,0を算出し、確率分布生成モデル12-1-1~12-2-Bに出力する。なお、第2中間表現モデル11-2~11-nは、サブバンド信号の中間表現xを計算する場合に、前の時刻のサブバンド信号st、bを更に用いる。サブバンド信号st、bのtは時刻インデックスであり、bはサブバンド信号のチャンネルのインデックスである。
第2中間表現モデル11-2は、中間表現xt=1,2を算出し、確率分布生成モデル12-3-1~12-4-Bに出力する。第2中間表現モデル11-3は、中間表現xt=3,4を算出し、確率分布生成モデル12-5-1~12-6-B(図示略)に出力する。
以下の説明では、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。第2中間表現モデル11は、勾配情報を、モデル学習部32に出力する。
各確率分布生成モデル12-t-bは、中間表現xが入力された場合に、確率分布yを出力する。たとえば、確率分布生成モデル12-1-1は、確率分布yt=1b=1を、サンプリング部21-1-1に出力する。図示を省略するが、確率分布生成モデル12-1-2~12-1-(B-1)は、確率分布yを配下のサンプリング部21-1-2~21-1-(B-1)に出力する。確率分布生成モデル12-1-Bは、確率分布yt=1b=Bを、サンプリング部21-1-Bに出力する。
確率分布生成モデル12-2-1は、確率分布yt=2b=1を、サンプリング部21-2-1に出力する。図示を省略するが、確率分布生成モデル12-2-2~12-2-(B-1)は、確率分布yを配下のサンプリング部21-2-2~21-2-(B-1)に出力する。確率分布生成モデル12-2-Bは、確率分布yt=2b=Bを、サンプリング部21-2-Bに出力する。
確率分布生成モデル12-3-1は、確率分布yt=3b=1を、サンプリング部21-3-1に出力する。図示を省略するが、確率分布生成モデル12-3-2~12-3-(B-1)は、確率分布yを配下のサンプリング部21-3-2~21-3-(B-1)に出力する。確率分布生成モデル12-3-Bは、確率分布yt=3b=Bを、サンプリング部21-3-Bに出力する。
確率分布生成モデル12-4-1は、確率分布yt=4b=1を、サンプリング部21-4-1に出力する。図示を省略するが、確率分布生成モデル12-4-2~12-4-(B-1)は、確率分布yを配下のサンプリング部21-4-2~21-4-(B-1)に出力する。確率分布生成モデル12-4-Bは、確率分布yt=3b=Bを、サンプリング部21-4-Bに出力する。
その他の確率分布生成モデルの説明を省略するが、それぞれ、中間表現xが入力された場合に、確率分布yを、配下のサンプリング部に出力する。以下の説明では、各確率分布生成モデル12-t-bを区別しない場合、まとめて、確率分布生成モデル12と表記する。確率分布生成モデル12は、勾配情報を、モデル学習部32に出力する。確率分布生成モデル12は、確率分布yt=1~T/B、b=1~Bを、損失計算部31に出力する。
各サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。なお、学習部151は、各確率分布生成モデル12-t-bが、直接サブバンド信号を予測する場合には、各サンプリング部21-t-bを用いなくてもよい。
サンプリング部21-1-1は、サブバンド信号st=1、b=1を算出する。図示を省略するが、サンプリング部21-1-2~21-1-(B-1)は、該当するサブバンド信号st、bを算出する。サンプリング部21-1-Bは、サブバンド信号st=1、b=Bを算出する。
サンプリング部21-2-1は、サブバンド信号st=2、b=1を算出する。図示を省略するが、サンプリング部21-2-2~21-2-(B-1)は、該当するサブバンド信号st、bを算出する。サンプリング部21-2-Bは、サブバンド信号st=2、b=Bを算出する。
上記のように、サンプリング部21-1-1~21-1-Bによって、サブバンド信号st=1、b=1~Bが算出される。サンプリング部21-2-1~21-2-Bによって、サブバンド信号st=2、b=1~Bが算出される。サブバンド信号st=1、b=1~B、サブバンド信号st=2、b=1~Bは、第2中間表現モデル11-2に入力される。
すなわち、確率分布生成モデル12-1-1~12-1-Bとサンプリング部21-1-1~21-1-Bとの組、及び、確率分布生成モデル12-2-1~12-2-Bとサンプリング部21-2-1~21-2-Bとの組によって、1つの中間表現xt=-1,0から、B×N(N=2)個に相当するサブバンド信号(st=1、b=1~B、st=2、b=1~B)が生成される。
サンプリング部21-3-1は、サブバンド信号st=3、b=1を算出する。図示を省略するが、サンプリング部21-3-2~21-3-(B-1)は、該当するサブバンド信号st、bを算出する。サンプリング部21-3-Bは、サブバンド信号st=3、b=Bを算出する。
サンプリング部21-4-1は、サブバンド信号st=4、b=1を算出する。図示を省略するが、サンプリング部21-4-2~21-4-(B-1)は、該当するサブバンド信号st、bを算出する。サンプリング部21-4-Bは、サブバンド信号st=4、b=Bを算出する。
上記のように、サンプリング部21-3-1~21-3-Bによって、サブバンド信号st=3、b=1~Bが算出される。サンプリング部21-4-1~21-4-Bによって、サブバンド信号st=4、b=1~Bが算出される。サブバンド信号st=3、b=1~B、サブバンド信号st=4、b=1~Bは、第2中間表現モデル11-3に入力される。
すなわち、確率分布生成モデル12-3-1~12-3-Bとサンプリング部21-3-1~21-3-Bとの組、及び、確率分布生成モデル12-4-1~12-4-Bとサンプリング部21-4-1~21-4-Bとの組によって、1つの中間表現xt=1,2から、B×N(N=2)個に相当するサブバンド信号(st=3、b=1~B、st=4、b=1~B)が生成される。
その他のサンプリング部の説明を省略するが、それぞれ、確率分布yが入力された場合に、サブバンド信号st、bを算出する。各サンプリング部21-t-bから、サブバンド信号st=1~T/B、b=1~Bが出力される。
続いて、サブバンド信号計算部30の説明に移行する。サブバンド信号計算部30は、音声波形D1から、サブバンド信号st=1~T/B、b=1~Bを計算する。サブバンド信号計算部30として、直交ミラーフィルタ(QMF:Quadrature Mirror Filter)や、疑似直交ミラーフィルタ(PQMF:Pseudo-Quadrature Mirror Filters)を用いることができる。直交ミラーフィルタまたは疑似直交ミラーフィルタを用いることで、入力された音声波形D1の系列長を1/Bに短縮したサブバンド信号に変換する。
サブバンド信号計算部30は、サブバンド信号st=1~T/B、b=1~Bを、損失計算部31に出力する。
損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値D3を算出する。たとえば、損失値D3は、確率分布yt=1~T/B、b=1~Bから予測されるサブバンド信号と、サブバンド信号st=1~T/B、b=1~Bとの誤差を示す値となる。
損失計算部31は、確率分布にカテゴリカル分布を使う場合はクロスエントロピーを利用して損失値D3を算出する。損失計算部31は、確率分布にガウス分布、ベータ分布、混合ロジスティック分布を使う場合には、負の対数尤度を利用して、損失値D3を算出する。
損失計算部31は、損失値D3を、モデル学習部32に出力する。
モデル学習部32は、損失値D3、第1中間表現モデル10の勾配情報、第2中間表現モデル11の勾配情報、確率分布生成モデル12の勾配情報を取得し、損失値D3が小さくなるように、第1中間表現モデル10のパラメータ、第2中間表現モデル11のパラメータ、確率分布生成モデル12のパラメータを機械学習する。たとえば、モデル学習部32は、誤差逆伝播アルゴリズムを利用して、機械学習を実行する。
学習部151に含まれる各処理部は、学習用音声波形データ141に含まれる複数の音声波形D1について、上記処理を繰り返し実行することで、学習済みの第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12を得る。
次に、図1に示した生成部152について具体的に説明する。図4は、本実施例1に係る生成部を説明するための図である。図4に示すように、生成部152は、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の確率分布生成モデル12-t-b(t=1、・・・、T/B、b=1、・・・、B)、サンプリング部21-t-b、音声波形変換部40を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
図3の場合と同様にして、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。確率分布生成モデル12-t-bを区別しない場合、まとめて、確率分布生成モデル12と表記する。
第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12は、学習部151によって学習済みとする。
生成部152は、音響特徴量D10を、第1中間表現モデル10に入力する。第1中間表現モデル10は、音響特徴量D10が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。
第2中間表現モデル11は、中間表現mが入力された場合に、サブバンド信号の中間表現xを、確率分布生成モデル12に出力する。第2中間表現モデル11に関する説明は、図3で行った、各第2中間表現モデル11-1~11-nに関する説明と同様である。
確率分布生成モデル12は、中間表現xが入力された場合に、確率分布yを、各サンプリング部21-t-bに出力する。確率分布生成モデル12に関する説明は、図3で行った、各確率分布生成モデル12-t-bに関する説明と同様である。
サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。各サンプリング部21-t-bは、サブバンド信号st=1~T/B、b=1~Bを、音声波形変換部40に出力する。
音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する。音声波形変換部40は、直交ミラーフィルタや、疑似直交ミラーフィルタの逆変換によって、サブバンド信号を音声波形に変換する。
次に、本実施例1に係る生成装置100の処理手順の一例について説明する。図5は、本実施例1に係る生成装置の学習時の処理手順を示すフローチャートである。図5に示すように、生成装置100の学習部151は、学習用音声波形データ141から、音声波形を取得する(ステップS101)。
学習部151の音響特徴量計算部20は、音声波形から音響特徴量を計算する(ステップS102)。学習部151は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS103)。
学習部151は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS104)。学習部151は、確率分布生成モデル12を用いて確率分布yt、bを算出し、確率分布yt、bを基にサブバンド信号st、bを算出する(ステップS105)。
一方、学習部151のサブバンド信号計算部30は、音声波形を基にして、サブバンド信号を計算する(ステップS106)。
学習部151の損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値を計算する(ステップS107)。
学習部151のモデル学習部32は、誤差逆伝播に基づいて、第1中間表現モデル10、第2中間表現モデル11、確率分布生成モデル12のパラメータを学習する(ステップS108)。
学習部151は、学習を継続する場合には(ステップS109,Yes)、ステップS101に移行する。一方、学習部151は、学習を継続しない場合には(ステップS109,No)、処理を終了する。
図6は、本実施例1に係る生成装置の生成時の処理手順を示すフローチャートである。図6に示すように、生成装置100の生成部152は、音響特徴量を取得する(ステップS201)。生成部152は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS202)。
生成部152は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS203)。生成部152は、確率分布生成モデル12を用いて確率分布yt、bを算出し、確率分布yt、bを基にサブバンド信号st、bを算出する(ステップS204)。
生成部152の音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する(ステップS205)。生成部152は、音声波形zt=1~Tを出力する(ステップS206)。
生成部152は、処理を継続する場合には(ステップS207,Yes)、ステップS201に移行する。生成部152は、処理を継続しない場合には(ステップS207,No)、処理を終了する。
次に、本実施例1に係る生成装置100の効果について説明する。生成装置100は、B個のサブバンド信号を1度の順伝搬で同時にNサンプル分生成することで、音響特徴量から音声波形を生成する処理を最大B×N倍に高速化することができる。
たとえば、確率分布生成モデル12-1-1~12-1-Bとサンプリング部21-1-1~21-1-Bとの組、及び、確率分布生成モデル12-2-1~12-2-Bとサンプリング部21-2-1~21-2-Bとの組によって、1つの中間表現xt=-1,0から、B×N(N=2)個に相当するサブバンド信号(st=1、b=1~B、st=2、b=1~B)が生成される。
また、音響特徴量から音声波形を生成する処理を高速化することで、ニューラルボコーダーの順伝播の回数を削減でき、学習および推論速度が向上する。また、ニューラルボコーダーを搭載可能なデバイスの範囲を広げることや、高サンプリング周波数でのリアルタイム動作に有効である。
まず、本実施例2に係る生成装置の構成例について説明する。図7は、本実施例2に係る生成装置の構成を示す機能ブロック図である。図7に示すように、この生成装置200は、通信制御部210と、入力部220と、出力部230と、記憶部240と、制御部250とを有する。
通信制御部210、入力部220、出力部230に関する説明は、実施例1で説明した通信制御部110、入力部120、出力部130に関する説明と同様である。
記憶部240は、学習用音声波形データ141と、第1中間表現モデル10と、第2中間表現モデル11と、同時確率分布生成モデル13とを有する。記憶部240は、RAM、フラッシュメモリ等の半導体メモリ素子、または、ハードディスク、光ディスク等の記憶装置によって実現される。
学習用音声波形データ141、第1中間表現モデル10、第2中間表現モデル11は、実施例1で説明した学習用音声波形データ141、第1中間表現モデル10、第2中間表現モデル11に関する説明と同様である。
同時確率分布生成モデル13は、チャンネルb=1~Bのサブバンド信号を同時に推定するモデルである。同時確率分布生成モデル13より得た同時確率から各サブバンド信号に該当する次元を確率分布とする。
ここで、実施例1で説明したNサンプルを同時生成する確率分布生成モデル12から出力される確率分布yt=τ、bは、式(1)のように示される。
Figure 0007601224000001
本実施例2の同時確率分布生成モデル13は、チャンネルb=1~Bのサブバンド信号を同時に推定するため、同時確率分布生成モデル13から出力される確率分布yt=τ、b=1~Bは、式(2)のように示される。これにより、サブバンド間の関係性を考慮した確率分布を推定することができる。
Figure 0007601224000002
図7において、制御部250は、学習部251と、生成部252とを有する。制御部250は、CPU等に対応する。
学習部251は、学習用音声波形データ141を用いて、第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル13の学習を実行する。
生成部252は、学習済みの第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル13を用いて、音響特徴量から音声波形を生成する。生成部252は、音響特徴量の情報を、入力部220から取得してもよいし、通信制御部210を介して、外部装置から取得してもよい。
次に、図7に示した学習部251について具体的に説明する。図8は、本実施例2に係る学習部を説明するための図である。図8に示すように、学習部251は、音響特徴量計算部20、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の同時確率分布生成モデル13-t(t=1、・・・、T/B)、サンプリング部21-t-b、サブバンド信号計算部30、損失計算部31、モデル学習部32を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
学習部251は、学習用音声波形データ141に格納された音声波形D1を音響特徴量計算部20に入力する。音響特徴量計算部20は、音声波形D1を基にして、音響特徴量D2を算出する。音響特徴量計算部20は、音響特徴量D2を、第1中間表現モデル10に入力する。
第1中間表現モデル10は、音響特徴量D2が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。第1中間表現モデル10は、勾配情報を、モデル学習部32に出力する。
各第2中間表現モデル11-1~11-nは、中間表現mが入力された場合に、サブバンド信号の中間表現xを出力する。たとえば、第2中間表現モデル11-1は、中間表現xt=-1,0を算出し、同時確率分布生成モデル13-1,13-2に出力する。なお、第2中間表現モデル11-2~11-nは、サブバンド信号の中間表現xを計算する場合に、前の時刻のサブバンド信号st、bを更に用いる。
第2中間表現モデル11-2は、中間表現xt=1,2を算出し、同時確率分布生成モデル12-3,12-4に出力する。第2中間表現モデル11-3は、中間表現xt=3,4を算出し、同時確率分布生成モデル12-5,12-6(図示略)に出力する。
以下の説明では、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。
各同時確率分布生成モデル13-tは、中間表現xが入力された場合に、確率分布yb=1~Bを出力する。たとえば、同時確率分布生成モデル13-1は、確率分布yt=1b=1~Bを、サンプリング部21-1-1~21-1-Bに出力する。
同時確率分布生成モデル13-1が、チャンネル毎の確率分布を、それぞれ、サンプリング部21-1-1~21-1-Bに出力してもよいし、サンプリング部21-1-1~21-1-B側が、同時確率分布から、該当する確率分布をサンプリングして取得してもよい。たとえば、多変量分布を使えば、同時確率分布から該当する確率分布をサンプリングすることが可能である。以下に説明する他の同時確率分布生成モデルについても同様である。
同時確率分布生成モデル13-2は、確率分布yt=2b=1~Bを、サンプリング部21-2-1~21-2-Bに出力する。
同時確率分布生成モデル13-3は、確率分布yt=3b=1~Bを、サンプリング部21-3-1~21-3-Bに出力する。
同時確率分布生成モデル13-4は、確率分布yt=4b=1~Bを、サンプリング部21-4-1~21-4-Bに出力する。
その他の同時確率分布生成モデルの説明を省略するが、それぞれ、中間表現xが入力された場合に、確率分布yb=1~Bを、配下のサンプリング部に出力する。以下の説明では、各同時確率分布生成モデル13-tを区別しない場合、まとめて、同時確率分布生成モデル13と表記する。同時確率分布生成モデル13は、勾配情報を、モデル学習部32に出力する。同時確率分布生成モデル13は、確率分布yt=1~T/B、b=1~Bを、損失計算部31に出力する。
各サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。なお、学習部251は、各同時確率分布生成モデル13が、直接サブバンド信号を予測する場合には、各サンプリング部21-t-bを用いなくてもよい。
各サンプリング部21-t-bの関するその他の説明は、実施例1で説明した各サンプリング部21-t-bに関する説明と同様である。
サブバンド信号計算部30は、音声波形D1から、サブバンド信号st=1~T/B、b=1~Bを計算する。サブバンド信号計算部30は、サブバンド信号st=1~T/B、b=1~Bを、損失計算部31に出力する。サブバンド信号計算部30に関するその他の説明は、実施例1と同様である。
損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値D3を算出する。損失計算部31は、損失値D3を、モデル学習部32に出力する。損失計算部31に関するその他の説明は、実施例1と同様である。
モデル学習部32は、損失値D3、第1中間表現モデル10の勾配情報、第2中間表現モデル11の勾配情報、同時確率分布生成モデル13の勾配情報を取得し、損失値D3が小さくなるように、第1中間表現モデル10のパラメータ、第2中間表現モデル11のパラメータ、同時確率分布生成モデル13のパラメータを機械学習する。たとえば、モデル学習部32は、誤差逆伝播アルゴリズムを利用して、機械学習を実行する。
学習部251に含まれる各処理部は、学習用音声波形データ141に含まれる複数の音声波形D1について、上記処理を繰り返し実行することで、学習済みの第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル13を得る。
次に、図7に示した生成部252について具体的に説明する。図9は、本実施例2に係る生成部を説明するための図である。図9に示すように、生成部252は、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の同時確率分布生成モデル13-t(t=1、・・・、T/B)、サンプリング部21-t-b、音声波形変換部40を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
図8の場合と同様にして、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。同時確率分布生成モデル13-tを区別しない場合、まとめて、同時確率分布生成モデル13と表記する。
第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル13は、学習部251によって学習済みとする。
生成部252は、音響特徴量D10を、第1中間表現モデル10に入力する。第1中間表現モデル10は、音響特徴量D10が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。
第2中間表現モデル11は、中間表現mが入力された場合に、サブバンド信号の中間表現xを、同時確率分布生成モデル13に出力する。第2中間表現モデル11に関する説明は、図8で行った、各第2中間表現モデル11-1~11-nに関する説明と同様である。
同時確率分布生成モデル13は、中間表現xが入力された場合に、確率分布yb=1~Bを、各サンプリング部21-t-bに出力する。同時確率分布生成モデル13に関する説明は、図8で行った、各同時確率分布生成モデル12-tに関する説明と同様である。
サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。各サンプリング部21-t-bは、サブバンド信号st=1~T/B、b=1~Bを、音声波形変換部40に出力する。
音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する。音声波形変換部40は、直交ミラーフィルタや、疑似直交ミラーフィルタの逆変換によって、サブバンド信号を音声波形に変換する。
次に、本実施例2に係る生成装置200の処理手順の一例について説明する。図10は、本実施例2に係る生成装置の学習時の処理手順を示すフローチャートである。図10に示すように、生成装置200の学習部251は、学習用音声波形データ141から、音声波形を取得する(ステップS301)。
学習部251の音響特徴量計算部20は、音声波形から音響特徴量を計算する(ステップS302)。学習部251は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS303)。
学習部251は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS304)。学習部251は、同時確率分布生成モデル13を用いて確率分布yt、bを算出し、確率分布yt、bを基にサブバンド信号st、bを算出する(ステップS305)。
一方、学習部251のサブバンド信号計算部30は、音声波形を基にして、サブバンド信号を計算する(ステップS306)。
学習部251の損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値を計算する(ステップS307)。
学習部251のモデル学習部32は、誤差逆伝播に基づいて、第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル13のパラメータを学習する(ステップS308)。
学習部251は、学習を継続する場合には(ステップS309,Yes)、ステップS301に移行する。一方、学習部251は、学習を継続しない場合には(ステップS309,No)、処理を終了する。
図11は、本実施例2に係る生成装置の生成時の処理手順を示すフローチャートである。図11に示すように、生成装置200の生成部252は、音響特徴量を取得する(ステップS401)。生成部252は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS402)。
生成部252は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS403)。生成部252は、同時確率分布生成モデル13を用いて確率分布yt、bを算出し、確率分布yt、bを基にサブバンド信号st、bを算出する(ステップS404)。
生成部252の音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する(ステップS405)。生成部252は、音声波形zt=1~Tを出力する(ステップS406)。
生成部252は、処理を継続する場合には(ステップS407,Yes)、ステップS401に移行する。生成部252は、処理を継続しない場合には(ステップS407,No)、処理を終了する。
次に、本実施例2に係る生成装置200の効果について説明する。生成装置200は、B個のサブバンド信号を1度の順伝搬で同時にNサンプル分生成することで、音響特徴量から音声波形を生成する処理を最大B×N倍に高速化することができる。また、生成装置200は、同時確率分布生成モデル13を利用することで、サブバンド間の関係性を考慮した確率分布を推定することができる。確率分布計算を複数バンド分同時に実行するため、行列演算命令をコールする回数を実施例1と比較して、1/Bにすることができ、処理面でも効率化を図ることができる。
まず、本実施例3に係る生成装置の構成例について説明する。図12は、本実施例3に係る生成装置の構成を示す機能ブロック図である。図12に示すように、この生成装置300は、通信制御部310と、入力部320と、出力部330と、記憶部340と、制御部350とを有する。
通信制御部310、入力部320、出力部330に関する説明は、実施例1で説明した通信制御部110、入力部120、出力部130に関する説明と同様である。
記憶部340は、学習用音声波形データ141と、第1中間表現モデル10と、第2中間表現モデル11と、同時確率分布生成モデル14とを有する。記憶部340は、RAM、フラッシュメモリ等の半導体メモリ素子、または、ハードディスク、光ディスク等の記憶装置によって実現される。
学習用音声波形データ141、第1中間表現モデル10、第2中間表現モデル11は、実施例1で説明した学習用音声波形データ141、第1中間表現モデル10、第2中間表現モデル11に関する説明と同様である。
同時確率分布生成モデル14は、各時刻t=τ,τ+1のチャンネルb=1~Bのサブバンド信号を同時に推定するモデルである。同時確率分布生成モデル14より得た同時確率から各サブバンド信号および各時刻に該当する次元を確率分布とする。
ここで、実施例2で説明したNサンプルを同時生成する同時確率分布13モデルから出力される確率分布は、ぞれぞれ、式(3)のように示される。たとえば、N=2の場合には、同時確率分布生成モデル13-1,13-2を用いて、各時刻t=τ,τ+1のチャンネルb=1~Bのサブバンド信号を推定している。
Figure 0007601224000003
一方、本実施例3の同時確率分布生成モデル14は、各時刻、及び、チャンネルb=1~Bのサブバンド信号を同時に推定するため、同時確率分布生成モデル14から出力される確率分布は、式(4)のように示される。これにより、複数のサブバンド間の関係性を考慮した確率分布を推定することができる。
Figure 0007601224000004
図12において、制御部350は、学習部351と、生成部352とを有する。制御部350は、CPU等に対応する。
学習部351は、学習用音声波形データ141を用いて、第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル14の学習を実行する。
生成部352は、学習済みの第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル14を用いて、音響特徴量から音声波形を生成する。生成部352は、音響特徴量の情報を、入力部320から取得してもよいし、通信制御部310を介して、外部装置から取得してもよい。
次に、図12に示した学習部351について具体的に説明する。図13は、本実施例3に係る学習部を説明するための図である。図13に示すように、学習部351は、音響特徴量計算部20、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の同時確率分布生成モデル14-t(t=1、・・・、T/2B)、サンプリング部21-t-b、サブバンド信号計算部30、損失計算部31、モデル学習部32を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
学習部351は、学習用音声波形データ141に格納された音声波形D1を音響特徴量計算部20に入力する。音響特徴量計算部20は、音声波形D1を基にして、音響特徴量D2を算出する。音響特徴量計算部20は、音響特徴量D2を、第1中間表現モデル10に入力する。
第1中間表現モデル10は、音響特徴量D2が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。第1中間表現モデル10は、勾配情報を、モデル学習部32に出力する。
各第2中間表現モデル11-1~11-nは、中間表現mが入力された場合に、サブバンド信号の中間表現xを出力する。たとえば、第2中間表現モデル11-1は、中間表現xt=-1,0を算出し、同時確率分布生成モデル14-1に出力する。なお、第2中間表現モデル11-2~11-nは、サブバンド信号の中間表現xを計算する場合に、前の時刻のサブバンド信号st、bを更に用いる。
第2中間表現モデル11-2は、中間表現xt=1,2を算出し、同時確率分布生成モデル14-2に出力する。第2中間表現モデル11-3は、中間表現xt=3,4を算出し、同時確率分布生成モデル14-3(図示略)に出力する。
以下の説明では、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。
各同時確率分布生成モデル14-tは、中間表現xが入力された場合に、確率分布yt=t、t+1b=1~Bを出力する。たとえば、同時確率分布生成モデル14-1は、確率分布yt=1b=1~Bを、サンプリング部21-1-1~21-1-Bに出力し、確率分布yt=2b=1~Bを、サンプリング部21-2-1~21-2-Bに出力する。
同時確率分布生成モデル14-1が、時刻毎、チャンネル毎の確率分布を、それぞれ、サンプリング部21-1-1~21-1-B,21-2-1~21-2-Bに出力してもよいし、サンプリング部21-1-1~21-1-B,21-2-1~21-2-B側が、同時確率分布から、該当する確率分布をサンプリングして取得してもよい。たとえば、多変量分布を使えば、同時確率分布から該当する確率分布をサンプリングすることが可能である。以下に説明する他の同時確率分布生成モデルについても同様である。
同時確率分布生成モデル14-2は、確率分布yt=3b=1~Bを、サンプリング部21-3-1~21-3-Bに出力し、確率分布yt=4b=1~Bを、サンプリング部21-4-1~21-4-Bに出力する。
その他の同時確率分布生成モデルの説明を省略するが、それぞれ、中間表現xが入力された場合に、確率分布yt、t+1b=1~Bを、配下のサンプリング部に出力する。以下の説明では、各同時確率分布生成モデル14を区別しない場合、まとめて、同時確率分布生成モデル14と表記する。同時確率分布生成モデル14は、勾配情報を、モデル学習部32に出力する。同時確率分布生成モデル14は、確率分布yt=1~T/B、b=1~Bを、損失計算部31に出力する。
各サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。なお、学習部351は、各同時確率分布生成モデル14が、直接サブバンド信号を予測する場合には、各サンプリング部21-t-bを用いなくてもよい。
各サンプリング部21-t-bの関するその他の説明は、実施例1で説明した各サンプリング部21-t-bに関する説明と同様である。
サブバンド信号計算部30は、音声波形D1から、サブバンド信号st=1~T/B、b=1~Bを計算する。サブバンド信号計算部30は、サブバンド信号st=1~T/B、b=1~Bを、損失計算部31に出力する。サブバンド信号計算部30に関するその他の説明は、実施例1と同様である。
損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値D3を算出する。損失計算部31は、損失値D3を、モデル学習部32に出力する。損失計算部31に関するその他の説明は、実施例1と同様である。
モデル学習部32は、損失値D3、第1中間表現モデル10の勾配情報、第2中間表現モデル11の勾配情報、同時確率分布生成モデル14の勾配情報を取得し、損失値D3が小さくなるように、第1中間表現モデル10のパラメータ、第2中間表現モデル11のパラメータ、同時確率分布生成モデル14のパラメータを機械学習する。たとえば、モデル学習部32は、誤差逆伝播アルゴリズムを利用して、機械学習を実行する。
学習部351に含まれる各処理部は、学習用音声波形データ141に含まれる複数の音声波形D1について、上記処理を繰り返し実行することで、学習済みの第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル14を得る。
次に、図12に示した生成部352について具体的に説明する。図14は、本実施例3に係る生成部を説明するための図である。図14に示すように、生成部352は、第1中間表現モデル10、複数の第2中間表現モデル11-n(n=1~T/B-1)、複数の同時確率分布生成モデル14-t(t=1、・・・、T/2B)、サンプリング部21-t-b、音声波形変換部40を有する。ここでは、音声の系列長をT、サブバンド信号のチャンネル数をB、サブバンド信号のサンプル数をN(=2)とする。
図13の場合と同様にして、第2中間表現モデル11-1~11-nを区別しない場合、まとめて、第2中間表現モデル11と表記する。同時確率分布生成モデル14-tを区別しない場合、まとめて、同時確率分布生成モデル14と表記する。
第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル14は、学習部351によって学習済みとする。
生成部352は、音響特徴量D10を、第1中間表現モデル10に入力する。第1中間表現モデル10は、音響特徴量D10が入力された場合に、音響特徴量の中間表現mを出力する。第1中間表現モデル10は、中間表現mを、第2中間表現モデル11-1~11-nに出力する。
第2中間表現モデル11は、中間表現mが入力された場合に、サブバンド信号の中間表現xを、同時確率分布生成モデル14に出力する。第2中間表現モデル11に関する説明は、図13で行った、各第2中間表現モデル11-1~11-nに関する説明と同様である。
同時確率分布生成モデル14は、中間表現xが入力された場合に、確率分布yt、t+1b=1~Bを、各サンプリング部21-t-bに出力する。同時確率分布生成モデル14に関する説明は、図13で行った、各同時確率分布生成モデル12-tに関する説明と同様である。
サンプリング部21-t-bは、確率分布yが入力された場合に、サブバンド信号st、bを算出する。各サンプリング部21-t-bは、サブバンド信号st=1~T/B、b=1~Bを、音声波形変換部40に出力する。
音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する。音声波形変換部40は、直交ミラーフィルタや、疑似直交ミラーフィルタの逆変換によって、サブバンド信号を音声波形に変換する。
次に、本実施例3に係る生成装置300の処理手順の一例について説明する。図15は、本実施例3に係る生成装置の学習時の処理手順を示すフローチャートである。図15に示すように、生成装置300の学習部351は、学習用音声波形データ141から、音声波形を取得する(ステップS501)。
学習部351の音響特徴量計算部20は、音声波形から音響特徴量を計算する(ステップS502)。学習部351は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS503)。
学習部351は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS504)。学習部351は、同時確率分布生成モデル14を用いて確率分布yt、t+1、bを算出し、確率分布yt、t+1、bを基にサブバンド信号st、bを算出する(ステップS505)。
一方、学習部351のサブバンド信号計算部30は、音声波形を基にして、サブバンド信号を計算する(ステップS506)。
学習部351の損失計算部31は、サブバンド信号st=1~T/B、b=1~Bと、確率分布yt=1~T/B、b=1~Bとを基にして、損失値を計算する(ステップS507)。
学習部351のモデル学習部32は、誤差逆伝播に基づいて、第1中間表現モデル10、第2中間表現モデル11、同時確率分布生成モデル14のパラメータを学習する(ステップS508)。
学習部351は、学習を継続する場合には(ステップS509,Yes)、ステップS501に移行する。一方、学習部351は、学習を継続しない場合には(ステップS509,No)、処理を終了する。
図16は、本実施例3に係る生成装置の生成時の処理手順を示すフローチャートである。図16に示すように、生成装置300の生成部352は、音響特徴量を取得する(ステップS601)。生成部352は、音響特徴量を第1中間表現モデル10に入力し、音響特徴量の中間表現mを算出する(ステップS602)。
生成部352は、音響特徴量の中間表現mを第2中間表現モデル11に入力し、サブバンド信号の中間表現xを算出する(ステップS603)。生成部352は、同時確率分布生成モデル15を用いて確率分布yt、t+1、bを算出し、確率分布yt、t+1、bを基にサブバンド信号st、bを算出する(ステップS604)。
生成部352の音声波形変換部40は、サブバンド信号st=1~T/B、b=1~Bを基にして、音声波形zt=1~Tを算出する(ステップS605)。生成部352は、音声波形zt=1~Tを出力する(ステップS606)。
生成部352は、処理を継続する場合には(ステップS607,Yes)、ステップS601に移行する。生成部352は、処理を継続しない場合には(ステップS607,No)、処理を終了する。
次に、本実施例3に係る生成装置300の効果について説明する。生成装置300は、各時刻に関するB個のサブバンド信号を1度の順伝搬で同時にNサンプル分生成する。これによって、音声特徴量から音声波形を生成する処理を高速化できるとともに、行列演算命令をコールする回数を実施例1と比較して、最小で1/(B×N)回にすることができ、処理面でも有効である。
続いて、生成プログラムを実行するコンピュータの一例について説明する。図17は、生成プログラムを実行するコンピュータの一例を示す図である。コンピュータ1000は、たとえば、メモリ1010と、CPU1020と、ハードディスクドライブインタフェース1030と、ディスクドライブインタフェース1040と、シリアルポートインタフェース1050と、ビデオアダプタ1060と、ネットワークインタフェース1070とを有する。これらの各部は、バス1080によって接続される。
メモリ1010は、ROM(Read Only Memory)1011およびRAM1012を含む。ROM1011は、たとえば、BIOS(Basic Input Output System)等のブートプログラムを記憶する。ハードディスクドライブインタフェース1030は、ハードディスクドライブ1031に接続される。ディスクドライブインタフェース1040は、ディスクドライブ1041に接続される。ディスクドライブ1041には、たとえば、磁気ディスクや光ディスク等の着脱可能な記憶媒体が挿入される。シリアルポートインタフェース1050には、たとえば、マウス1051およびキーボード1052が接続される。ビデオアダプタ1060には、たとえば、ディスプレイ1061が接続される。
ここで、ハードディスクドライブ1031は、たとえば、OS1091、アプリケーションプログラム1092、プログラムモジュール1093およびプログラムデータ1094を記憶する。上記実施形態で説明した各情報は、たとえばハードディスクドライブ1031やメモリ1010に記憶される。
また、生成プログラムは、たとえば、コンピュータ1000によって実行される指令が記述されたプログラムモジュール1093として、ハードディスクドライブ1031に記憶される。具体的には、上記実施形態で説明した生成装置100(200,300)が実行する各処理が記述されたプログラムモジュール1093が、ハードディスクドライブ1031に記憶される。
また、生成プログラムによる情報処理に用いられるデータは、プログラムデータ1094として、たとえば、ハードディスクドライブ1031に記憶される。そして、CPU1020が、ハードディスクドライブ1031に記憶されたプログラムモジュール1093やプログラムデータ1094を必要に応じてRAM1012に読み出して、上述した各手順を実行する。
なお、生成プログラムに係るプログラムモジュール1093やプログラムデータ1094は、ハードディスクドライブ1031に記憶される場合に限られず、たとえば、着脱可能な記憶媒体に記憶されて、ディスクドライブ1041等を介してCPU1020によって読み出されてもよい。あるいは、生成プログラムに係るプログラムモジュール1093やプログラムデータ1094は、LANやWAN(Wide Area Network)等のネットワークを介して接続された他のコンピュータに記憶され、ネットワークインタフェース1070を介してCPU1020によって読み出されてもよい。
以上、本発明者によってなされた発明を適用した実施形態について説明したが、本実施形態による本発明の開示の一部をなす記述および図面により本発明は限定されることはない。すなわち、本実施形態に基づいて当業者等によりなされる他の実施形態、実施例および運用技術等は全て本発明の範疇に含まれる。
100,200,300 生成装置
110,210,310 通信制御部
120,220,320 入力部
130,230,330 出力部
140,240,340 記憶部
150,250,350 制御部
151,251,351 学習部
152,252,352 生成部

Claims (7)

  1. 音声波形の音響特徴量を基にして、サブバンド信号の中間表現情報を生成する中間表現生成工程と、
    前記サブバンド信号のチャンネル数と、同時生成するサンプル数との数に応じた複数の確率分布生成モデルであって、それぞれに割り当てられた時刻および帯域に対応するサブバンド信号の情報を出力する前記複数の確率分布生成モデルに、前記中間表現情報を入力することで、異なる複数の時刻および異なる複数の帯域に応じた複数のサブバンド信号を同時に生成するサブバンド信号生成工程と、
    前記複数のサブバンド信号を基にして、音声波形を生成する音声波形生成工程と
    を含んだことを特徴とする生成方法。
  2. 前記音響特徴量を入力した場合に、前記音響特徴量の中間表現情報を出力する第1中間表現モデルを用いて、前記音声波形の音響特徴量を、前記音響特徴量の中間表現情報に変換する変換工程を更に含んだことを特徴とする請求項1に記載の生成方法。
  3. 前記中間表現生成工程は、前記音響特徴量の中間表現情報を入力した場合に、前記サブバンド信号の中間表現情報を出力する第2中間表現モデルを用いて、前記サブバンド信号の中間表現情報を生成することを特徴とする請求項2に記載の生成方法。
  4. 音声波形から算出される複数のサブバンド信号と、前記サブバンド信号生成工程によって生成される複数のサブバンド信号とを基にして、損失値を計算し、前記損失値を基にして、前記第1中間表現モデル、前記第2中間表現モデル、前記複数の確率分布生成モデルのうち少なくとも1つのモデルの学習を実行する学習工程を更に有することを特徴とする請求項3に記載の生成方法。
  5. 前記サブバンド信号生成工程は、1つのモデルから複数の時間帯、および、複数の帯域に対応するサブバンド信号の情報を同時に出力する同時確率分布生成モデルを用いて、前記複数のサブバンド信号を同時に生成することを特徴とする請求項1に記載の生成方法。
  6. 音声波形の音響特徴量を基にして、サブバンド信号の中間表現情報を生成する中間表現生成ステップと、
    前記サブバンド信号のチャンネル数と、同時生成するサンプル数との数に応じた複数の確率分布生成モデルであって、それぞれに割り当てられた時刻および帯域に対応するサブバンド信号の情報を出力する前記複数の確率分布生成モデルに、前記中間表現情報を入力することで、異なる複数の時刻および異なる複数の帯域に応じた複数のサブバンド信号を同時に生成するサブバンド信号生成ステップと、
    前記複数のサブバンド信号を基にして、音声波形を生成する音声波形生成ステップと
    をコンピュータに実行させるための生成プログラム。
  7. 音声波形の音響特徴量を基にして、サブバンド信号の中間表現情報を生成する中間表現生成し、前記サブバンド信号のチャンネル数と、同時生成するサンプル数との数に応じた複数の確率分布生成モデルであって、それぞれに割り当てられた時刻および帯域に対応するサブバンド信号の情報を出力する前記複数の確率分布生成モデルに、前記中間表現情報を入力することで、異なる複数の時刻および異なる複数の帯域に応じた複数のサブバンド信号を同時に生成する生成部と、
    前記複数のサブバンド信号を基にして、音声波形を生成する音声波形生成部と
    を備えることを特徴とする生成装置。
JP2023532858A 2021-07-05 2021-07-05 生成方法、生成プログラム及び生成装置 Active JP7601224B2 (ja)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
PCT/JP2021/025237 WO2023281555A1 (ja) 2021-07-05 2021-07-05 生成方法、生成プログラム及び生成装置

Publications (2)

Publication Number Publication Date
JPWO2023281555A1 JPWO2023281555A1 (ja) 2023-01-12
JP7601224B2 true JP7601224B2 (ja) 2024-12-17

Family

ID=84800403

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2023532858A Active JP7601224B2 (ja) 2021-07-05 2021-07-05 生成方法、生成プログラム及び生成装置

Country Status (3)

Country Link
US (1) US12548550B2 (ja)
JP (1) JP7601224B2 (ja)
WO (1) WO2023281555A1 (ja)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US12417762B2 (en) * 2022-04-13 2025-09-16 International Business Machines Corporation Speech-to-text voice visualization

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2018141915A (ja) 2017-02-28 2018-09-13 国立研究開発法人情報通信研究機構 音声合成システム、音声合成プログラムおよび音声合成方法
JP2018141917A (ja) 2017-02-28 2018-09-13 国立研究開発法人情報通信研究機構 学習装置、音声合成システムおよび音声合成方法
WO2020145472A1 (ko) 2019-01-11 2020-07-16 네이버 주식회사 화자 적응형 모델을 구현하고 합성 음성 신호를 생성하는 뉴럴 보코더 및 뉴럴 보코더의 훈련 방법

Family Cites Families (18)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7039588B2 (en) * 2000-03-31 2006-05-02 Canon Kabushiki Kaisha Synthesis unit selection apparatus and method, and storage medium
US20030055640A1 (en) * 2001-05-01 2003-03-20 Ramot University Authority For Applied Research & Industrial Development Ltd. System and method for parameter estimation for pattern recognition
JP5194197B2 (ja) * 2011-07-14 2013-05-08 パナソニック株式会社 声質変換システム、声質変換装置及びその方法、声道情報生成装置及びその方法
EP2845191B1 (en) * 2012-05-04 2019-03-13 Xmos Inc. Systems and methods for source signal separation
WO2017046887A1 (ja) * 2015-09-16 2017-03-23 株式会社東芝 音声合成装置、音声合成方法、音声合成プログラム、音声合成モデル学習装置、音声合成モデル学習方法及び音声合成モデル学習プログラム
US11080591B2 (en) * 2016-09-06 2021-08-03 Deepmind Technologies Limited Processing sequences using convolutional neural networks
EP3497629B1 (en) 2016-09-06 2020-11-04 Deepmind Technologies Limited Generating audio using neural networks
JP7209275B2 (ja) * 2017-08-31 2023-01-20 国立研究開発法人情報通信研究機構 オーディオデータ学習装置、オーディオデータ推論装置、およびプログラム
US10672388B2 (en) * 2017-12-15 2020-06-02 Mitsubishi Electric Research Laboratories, Inc. Method and apparatus for open-vocabulary end-to-end speech recognition
CN111587441B (zh) * 2018-02-09 2024-07-02 渊慧科技有限公司 使用以比特值为条件的回归神经网络生成输出示例
US11128435B2 (en) * 2019-07-08 2021-09-21 Tencent America LLC Distributed and collaborative analytics of encrypted data using deep polynomial networks
WO2021021714A1 (en) * 2019-07-29 2021-02-04 The Regents Of The University Of California Method of contextual speech decoding from the brain
JP7336135B2 (ja) * 2019-08-19 2023-08-31 大学共同利用機関法人情報・システム研究機構 音声合成装置
JP2021067885A (ja) * 2019-10-25 2021-04-30 株式会社エーアイ 音響特徴量変換モデル学習装置、方法およびプログラム、ニューラルボコーダ学習装置、方法およびプログラム、並びに、音声合成装置、方法およびプログラム
CN111681641B (zh) * 2020-05-26 2024-02-06 微软技术许可有限责任公司 基于短语的端对端文本到语音(tts)合成
US11790884B1 (en) * 2020-10-28 2023-10-17 Electronic Arts Inc. Generating speech in the voice of a player of a video game
WO2023235152A1 (en) * 2022-06-03 2023-12-07 Google Llc Streaming speech-to-speech model with automatic speaker turn detection
US12288566B1 (en) * 2022-06-27 2025-04-29 Amazon Technologies, Inc. Beamforming using multiple sensor data

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2018141915A (ja) 2017-02-28 2018-09-13 国立研究開発法人情報通信研究機構 音声合成システム、音声合成プログラムおよび音声合成方法
JP2018141917A (ja) 2017-02-28 2018-09-13 国立研究開発法人情報通信研究機構 学習装置、音声合成システムおよび音声合成方法
WO2020145472A1 (ko) 2019-01-11 2020-07-16 네이버 주식회사 화자 적응형 모델을 구현하고 합성 음성 신호를 생성하는 뉴럴 보코더 및 뉴럴 보코더의 훈련 방법

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
岡本拓磨他,サブバンドWaveNetボコーダによる全可聴帯域音声合成の検討,日本音響学会2018年春季研究発表会講演論文集[CD-ROM],2018年03月,pp.251-254

Also Published As

Publication number Publication date
US12548550B2 (en) 2026-02-10
WO2023281555A1 (ja) 2023-01-12
US20240339105A1 (en) 2024-10-10
JPWO2023281555A1 (ja) 2023-01-12

Similar Documents

Publication Publication Date Title
KR102837410B1 (ko) 오디오 신호 생성 및 오디오 생성기 훈련을 위한 방법 및 오디오 생성기
CN112151003B (zh) 并行语音合成方法、装置、设备以及计算机可读存储介质
CN110047478B (zh) 基于空间特征补偿的多通道语音识别声学建模方法及装置
WO2013011397A1 (en) Statistical enhancement of speech output from statistical text-to-speech synthesis system
JP7103390B2 (ja) 音響信号生成方法、音響信号生成装置およびプログラム
Deng et al. Adaptive Kalman filtering and smoothing for tracking vocal tract resonances using a continuous-valued hidden dynamic model
JP7601224B2 (ja) 生成方法、生成プログラム及び生成装置
CN112562655A (zh) 残差网络的训练和语音合成方法、装置、设备及介质
Dang et al. U-Mamba-Net: A highly efficient Mamba-based U-net style network for noisy and reverberant speech separation
JP2015041081A (ja) 定量的f0パターン生成装置及び方法、f0パターン生成のためのモデル学習装置、並びにコンピュータプログラム
JP7830693B2 (ja) キーフレームネットワーク
EP4020464A1 (en) Acoustic model learning device, voice synthesis device, method, and program
JP7509233B2 (ja) 生成方法、生成装置および生成プログラム
Liu et al. LPCSE: Neural Speech Enhancement through Linear Predictive Coding
CN112396153A (zh) 一种用于深度学习的加速装置及计算装置
JP7754306B2 (ja) 音声波形生成方法、音声波形生成装置及びプログラム
Wu et al. Statistical voice conversion with quasi-periodic wavenet vocoder
US20240161736A1 (en) Electronic device and method of low latency speech enhancement using autoregressive conditioning-based neural network model
Kumar et al. Speech recognition using machine learning
JP6137708B2 (ja) 定量的f0パターン生成装置、f0パターン生成のためのモデル学習装置、並びにコンピュータプログラム
JP2020030373A (ja) 音源強調装置、音源強調学習装置、音源強調方法、プログラム
Juvela et al. HiFi-Glot: Neural Formant Synthesis with Differentiable Resonant Filters
Hwang et al. A Unified Framework for the Generation of Glottal Signals in Deep Learning-based Parametric Speech Synthesis Systems.
WO2026047984A1 (ja) 学習装置、変換装置、学習方法及びプログラム
JP2025108262A (ja) 音声波形生成システム、音声波形生成方法、および、音声波形生成プログラム

Legal Events

Date Code Title Description
A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20231101

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20241105

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20241118

R150 Certificate of patent or registration of utility model

Ref document number: 7601224

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150

S533 Written request for registration of change of name

Free format text: JAPANESE INTERMEDIATE CODE: R313533

R350 Written notification of registration of transfer

Free format text: JAPANESE INTERMEDIATE CODE: R350