JPH0962644A - ニューラルネットワーク - Google Patents
ニューラルネットワークInfo
- Publication number
- JPH0962644A JPH0962644A JP7236062A JP23606295A JPH0962644A JP H0962644 A JPH0962644 A JP H0962644A JP 7236062 A JP7236062 A JP 7236062A JP 23606295 A JP23606295 A JP 23606295A JP H0962644 A JPH0962644 A JP H0962644A
- Authority
- JP
- Japan
- Prior art keywords
- learning
- layer
- input
- intermediate layer
- neuron element
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Abstract
るニューラルネットワークを提供する。 【解決手段】 ニューロン素子網22の中間層Hiは、
学習の各段階において適宜追加される。異なるカテゴリ
(△、□、○)の学習を開始する毎に新たな第N中間層
が確保され、既存中間層の結合重みW、h、wを固定す
る(●で示す)。同一カテゴリ内の学習で学習不能とな
った場合に、新たに中間層ニューロン素子を追加し、そ
の中間層内の既存ニューロン素子の結合重みW、hを固
定する。追加したニューロン素子の結合重みW、h、h
と既存ニューロン素子の結合重みwを調整する(○で示
す)ことで学習を継続する。学習済のカテゴリに属する
結合重みと、学習中のカテゴリの既存ニューロン素子の
結合重みを固定することで、学習内容が記憶され、結果
として高速に学習が行われる。
Description
ワークの学習方法、ニューラルネットワークおよびニュ
ーラルネットワークを利用した音声認識装置に関する。
力層、中間層、出力層といった階層構造に構成され、学
習により各ニューロン素子相互間の結合重みを変化させ
るようになっている。学習は、一般にバックプロバゲー
ション法(誤差逆伝播法;…文献…)によっている。従
来のニューラルネットワークでは、入力層、中間層、出
力層の各層を構成するニューロン素子の数は、ニューラ
ルネットワークで検出や判定等の処理を行おうとする内
容により、予め決められている。例えば○、□、△の三
種類の各カテゴリに属する手書きの図形を認識する場
合、出力層のニューロン素子は3個となる。また、図形
を8×8に分割して入力データとする場合、入力層のニ
ューロン素子は64個となる。一方、中間層のニューロ
ン素子は、経験から決める必要があるが、この数が少な
いと誤認識率が高くなり、一方、多いとバックプロバゲ
ーションによる学習時間が非常に長くなったり、学習過
程において最適解に至らず局所最小点(local minimum)
から抜け出せず、学習不可状態となる場合がある。な
お、本明細書において、学習不可状態とは、学習時間が
所定時間を越えて長くなった場合、および学習過程にお
いて最適解に至らない場合をいうものとする。また、従
来のニューラルネットワークでは、例えば、○の学習が
終了した後に□の学習をし、その後に△の学習を行うと
いうように、順次学習を行うため、ある段階での学習を
開始する場合、それ以前に行った学習による結合重みが
変化してしまうという欠点がある。
ロン素子を学習の段階で最適な数まで適宜追加してい
く、カスケードコーリレーションによるニューラルネッ
トワーク(以下、CCNNという)が、カーネギーメロ
ン大学1990年2月14日発行、Scott E.Fahlman 著
の技術レポート♯CMU-CS-90-100 の“The Cascade-Corr
elation Learning Architecture ”で提案されている。
CCNNは、初期の状態では入力層と出力層のみが存在
し、学習により局所最小点に入り込んだり収束しなかっ
た場合に、新たなニューロン素子を中間層に追加し、再
度学習を繰り返すようになっている。また、CCNN
は、入力層と中間層間の結合重み(Wで表す)を固定
し、入力層と出力層間の結合重み(kで表す)と、中間
層と出力層間の結合重み(wで表す)を調整すること
で、それ以前に学習した内容についてある程度記憶する
ようにしている。
全入力データについての学習が終了するまで中間層のニ
ューロン素子を追加していくため、学習データの量が増
大するにしたがって学習時間も大幅に増加することにな
っていた。また、CCNNは、入力層と中間層間の結合
重Wみのみ固定し、中間層と出力層間の結合重みwは固
定されずに調整可能である。このため、例えば、図形認
識において図形○についての認識が終了したとしても、
次の図形□の学習により結合重みwが変化してしまうた
め、○についての学習内容を充分に記憶しているとはい
えなかった。
ができると共に、学習内容を充分に記憶することが可能
なニューラルネットワークを提供することを目的とす
る。
は、入力層ニューロン素子を複数有する入力層と、出力
層ニューロン素子を複数有する出力層と、所定のカテゴ
リのうちのいずれか1のカテゴリに分類され、前記入力
層の入力層ニューロン素子と結合重みWで結合すると共
に、前記出力層の出力層ニューロン素子と結合重みwで
結合する中間層ニューロン素子を、複数有する中間層
と、あるカテゴリについての学習を行う場合に、他のカ
テゴリに属する中間層ニューロン素子と、入力層ニュー
ロン素子との結合重みW、および出力層ニューロン素子
との結合重みwを固定し、学習対象となるカテゴリの中
間層ニューロン素子との結合重みW、wを調整すること
で学習を行う学習手段と、この学習手段による学習の際
に、あるカテゴリに属する学習用入力データに対して学
習不可状態になった場合に、その学習用入力データが属
するカテゴリの中間層ニューロン素子を追加する中間層
ニューロン素子追加手段と、をニューラルネットワーク
に具備させて前記目的を達成する。請求項2に記載の発
明では、請求項1に記載のニューラルネットワークにお
いて、前記学習手段は、さらに学習対象となっているカ
テゴリの既存の中間層と入力層との結合重みWを固定
し、前記中間層ニューロン素子追加手段による追加され
た新たな中間層ニューロン素子の結合重みWとw、およ
び学習対象となっているカテゴリの既存の中間層ニュー
ロン素子の結合重みwを調整することで学習を行う。請
求項3に記載の発明では、それぞれ異なるカテゴリ毎に
別個独立して学習が行われた複数の中間層と、この複数
の中間層の各中間層ニューロン素子と結合重みWで結合
した、入力層ニューロン素子を複数有する入力層と、前
記複数の中間層の各中間層ニューロン素子と結合重みw
で結合した、出力層ニューロン素子を複数有する出力層
と、前記入力層の入力層ニューロン素子と結合重みW′
で結合し、前記出力層の出力層ニューロン素子と結合荷
重w′で結合した調整用中間層と、前記複数の中間層に
おける前記結合重みWと結合重みwを固定し、前記調整
用中間層の結合重みW′とw′を調整することで、前記
複数の中間層の学習に使用した学習用入力データによ
り、ネットワーク全体の学習を再度行う学習手段と、こ
の学習手段による学習の際に学習不可状態になった場合
に、前記調整用中間層の中間層ニューロン素子を追加す
る中間層ニューロン素子追加手段と、をニューラルネッ
トワークに具備させて前記目的を達成する。請求項4に
記載の発明では、請求項1、請求項2、または請求項3
に記載のニューラルネットワークにおいて、前記中間層
の中間層ニューロン素子と結合重みvで結合した仮説出
力層ニューロン素子を複数有する仮説出力層を備え、前
記学習手段は、複数のベクトル列Fn(n=1、2、
3、…)の集合が特定のカテゴリに属する意味Aを表す
データについて、ベクトル列Fnを入力層に入力し、ベ
クトル列Fn+1を第1教師信号として前記出力層に入
力し、特定の意味Aを第2教師信号として前記仮説出力
層に入力することで、学習を行う。請求項5に記載の発
明では、請求項4に記載のニューラルネットワークにお
いて、前記中間層の中間層ニューロン素子と結合し、そ
の出力ベクトル列が前記中間層に供給される環帰層ニュ
ーロン素子を複数有する環帰層を備え、前記学習手段
は、複数のベクトル列Fnの集合が特定のカテゴリに属
する意味Aを表すデータについて、ベクトル列Fn−1
に対する前記中間層または前記出力層の出力ベクトル値
を前記環帰入力層に入力し、ベクトル列Fnを前記入力
層に入力し、ベクトル列Fn+1を第1教師信号として
前記出力層に入力し、特定の意味Aを第2教師信号とし
て前記仮説出力層に入力することで、学習を行う。請求
項6に記載の発明では、請求項1から請求項5のうちの
いずれか1の請求項に記載されたニューラルネットワー
クにおいて、前記学習手段は、バックプロパゲーション
則により学習する。請求項7に記載の発明では、請求項
4または請求項5に記載のニューラルネットワークにお
いて、前記特定の意味Aが音声を構成する音素であり、
複数のベクトル列Fnが、時系列的に解析された特定の
意味Aについての特徴量を表すベクトル列を使用する。
請求項8に記載の発明では、請求項7に記載のニューラ
ルネットワークにおいて、前記特定の意味Aについての
特徴量を表すベクトルとして、音声のスペクトルデー
タ、ケプストラムデータ、または自己連想型ニューラル
ネットワークの中間層の出力値データを使用する。
ークにおける好適な実施形態について、図1から図26
を参照して詳細に説明する。図1は第1実施形態におけ
るニューラルネットワークのシステム構成を表したもの
である。このニューラルネットワークは、ニューロン素
子網に対する学習のためのベクトル列(入力データD)
の入力と出力層への教師信号(ベクトル列)の入力、学
習による各ニューロン素子間の結合重みの変更、および
ニューロン素子網からの出力信号に基づく図形認識、文
字認識、音声認識等の各種処理および制御を行うCPU
11を備えている。このCPU11は、データバス等の
バスライン12を介して、ROM13、RAM14、通
信制御装置15、プリンタ16、表示装置17、キーボ
ード18、ニューロン素子網22、および図形読取装置
24が接続されている。
字認識、ニューロン素子網の学習等の処理や制御を行う
ための各種プログラムやデータが格納されているリード
・オンリー・メモリである。このROM13には、例え
ば、ニューロン素子網の学習としてバックプロパゲーシ
ョン則による学習を行うためのプログラムが格納されて
いる。RAM14は、ROM13に格納された所定のプ
ログラムがダウンロードされ格納されると共に、CPU
11のワーキングメモリとして使用されるランダム・ア
クセス・メモリである。RAM14には、図形読取装置
24で読み取られた画像データが格納される画像データ
格納エリアが確保されている。
ークで認識された文字のコード情報等の各種データにつ
いて、電話回線網、LAN、パーソナルコンピュータ通
信網等の各種の通信網2を介して他の通信制御装置との
間でデータ送受信を行う。プリンタ16は、レーザプリ
ンタやドットプリンタ等を備えており、入力データや認
識した文字や図形等を印刷するようになっている。表示
装置17は、CRTディスプレイや液晶ディスプレイ等
の画像表示部と表示制御部とを備えており、入力データ
や認識した文字や図形、および、必要な各種操作の指示
を画面表示するようになっている。
定条件等を入力したり、文章の入力処理等を行うための
入力装置であり、数字を入力するテンキー、文字を入力
する文字キー、各種の機能を実現するための機能キー等
が配置されている。このキーボード18には、ポインテ
ィングデバイスとしてのマウス19が接続されている。
図形読取装置24は、CCD(Charge Coupled Device
)等の素子を備えており、用紙等に記録された画像を
読み取るための装置であり、この画像読取装置24で読
み取られた画像データは、RAM14に格納されるよう
になっている。
構成を表したものである。この図2に示すように、ニュ
ーロン素子網22は、入力層Inと出力層Ouを備えて
おり、初期状態においては中間層(Hidden層)を備えて
いない。中間層を構成するニューロン素子Hiは、学習
の各段階において適宜追加されるようになっている。ニ
ューロン素子網22は、初期状態および中間層のニュー
ロン素子が追加された各状態において、順伝播活性およ
び逆伝播学習が可能なように構成される。入力層In
は、N個のニューロン素子In1〜InN、およびバイ
アスbで構成されている。入力層Inの各ニューロン素
子In1〜InNには、入力データの値が入力され、バ
イアスbには、常時“+1”が入力されるようになって
いる。出力層OuはM個のニューロン素子Ou1〜Ou
Mで構成されている。各出力層Ouのニューロン素子O
u1〜OuM、および、追加された中間層Hiのニュー
ロン素子Hi11〜Himpは、シグモイド関数および
閾値が設定されており、−1.0から+1.0の範囲で
出力されるようになっている。
nNおよびバイアスbと、出力層Ouの各ニューロン素
子Ou1〜OuMとは、それぞれ結合重みk、q、rで
結合されている。入力層Inと出力層Ou間の各結合重
みについては、学習段階において、調整可能である。図
2において、調整可能な結合重みについては、○で表す
ことにする。一方、図2では表されていないが、固定さ
れた結合重みについては●で表すこととする。
うに定義する。入力層Inと出力層Ouにおける結合重
みをkで表し、入力層Inと中間層Hiにおける結合重
みをWで表し、中間層Hiと出力層Ouにおける結合重
みをwで表し、中間層Hi間における結合重みをhで表
す。そして、各結合重みの後に付したq,rを次のよう
に定義する。すなわち、q、rに各ニューロン素子の番
号を使用し、信号が流れる順に並べる。例えば、ニュー
ロン素子In30とニューロン素子Ou25との結合重
みは、In30からOu25に信号が流れるので、k3
0,25となる。また、ニューロン素子In11とニュ
ーロン素子Hi22との結合重みは、In11からHi
に信号が流れるので、W11,22となる。また中間層
Hi間の結合重みhは、hm,(p−1),pで表し、
第m中間層Himにおけるニューロン素子Him(p−
1)とニューロン素子Himpとの結合重みを表す。中
間層のニューロン素子は、学習の各段階で順次追加され
るが、mの値が同一である限り(この場合には、同一の
教師信号が供給されている)、追加される前後のニュー
ロン素子間でのみ結合している。
重みを格納する図示しないメモリを備えている。図3
は、このようなニューロン素子網22の各ニューロン素
子間の結合重みを格納する結合重みテーブルを表したも
のである。この結合重みテーブルは、図2に対応した初
期状態における結合重みを表したものである。入力層I
nと中間層Hi間の結合重みW、中間層と出力層Ou間
の結合重みw、および中間層Hi間の結合重みhについ
ては、学習の過程において、中間層Hiのニューロン素
子が新たに追加される毎に、CPU11によって確保さ
れる。そして、各結合重みを調整することで学習が行わ
れる。各結合重みについては、結合重みkを除き、結合
重みW、w、およびhについては、各学習の過程におい
所定の学習を行う間調整され、他の学習を行う際には固
定されるようになっている。
いて、○、□、△の三種類の図形についての学習動作に
ついて説明する。認識対象となる三種類の図形の各々を
特定するための符号として、それぞれ3ビットの符号で
表し、これを学習時の教師信号とする。すなわち、出力
層Ouに供給される教師信号として、入力データが○の
場合Ou1〜Ou3の順に“100”、□の場合“01
0”、△の場合“001”をそれぞれ供給する。学習に
使用する入力データとしては、各図形についてg個の図
形○1〜○g、□1〜□g、△1〜△gを使用する。g
個の各図形については、手書きによるそれぞれ異なった
形状が使用される。
したものである。この図4に示すように、図形○1につ
いて縦10×横10=100個の領域に分割し、各領域
に図形○の線分が含まれている場合には“1”、含まれ
ていない場合には“0”を、それぞれ入力データD1〜
D100の値とする。例えば、D1〜D13等の領域に
は線分が含まれていないので“0”となり、D14、D
15等の領域には線分が含まれているので“1”とな
る。これらの各入力データD1〜D100の値が、学習
時に、それぞれ入力層In1〜In100に供給され
る。
1〜gのそれぞれについての入力データD1〜D100
について、予めROM13に格納されたものを使用す
る。また、通信制御装置12を介して他の装置から受信
し、これをてRAM14に格納した後に使用するように
してもよい。更に、手書きした各図形について、読取装
置24で読み取り、各図形毎に入力データD1〜D10
0を作成してRAM14に格納するようにしてもよい。
を行うためのニューロン素子網22の構成表したもので
ある。この図5(a)に示すように、学習前の段階にお
いて中間層は未だ追加されていない。一方、入力層In
は、入力データD1〜D100に対応して、100個の
ニューロン素子In1〜In100を有している。ま
た、入力層Inのバイアスbには、常時“+1”のバイ
アスが加えられている。そして、出力層Ouは、認識対
象となる3種類の図形を3ビットの符号で表すことに対
応して、3個のニューロン素子Ou1〜Ou3を有して
いる。また、図5(b)に示すように、結合重みテーブ
ルがニューロン素子網22内に確保される。なお、図2
で説明したように、○印で表した入力層Inと出力層O
u間の結合重みk1,1〜kb,3については、学習段
階において調整可能であり、●印で表される結合重みは
固定されており調整できない。
ャートである。なお、図形○1〜○gをZ=1〜gで表
し、図形□1〜□gをZ=g+1〜2gで表し、図形△
1〜△gをZ=2g+1〜3gで表すものとする。まず
ニューラルネットワークについての学習を行う場合、ユ
ーザは、最初にキーボード18を操作することにより、
または表示装置17に表示された所定キーをマウスによ
り操作することにより、学習モードを指定する。
は、Z、m、pについて、Z=m=1、p=0に初期設
定を行う(ステップ11)。次にCPU11は、図形Z
に対応する入力データD1〜D100及び、図形Zに対
応する教師信号(Z=1の場合、図形○に対する教師信
号“100”)を読み込む(ステップ12)。
ータ、バイアスb(+1)、教師信号および、ニューロ
ン素子網22の結合重みテーブルに格納されている結合
重みから、学習処理を行う(ステップ13)。すなわ
ち、CPU11は、図形Zについての学習用入力データ
D1〜D100及びバイアスbを入力層Inの各ニュー
ロン素子In1〜In100に入力した場合の出力層O
uの各ニューロン素子Ouの出力値を求める。この出力
値と図形Zに対する教師信号との誤差δが最小値にな
る、調整可能な結合重み(p=0の場合にはkのみ、p
=1の場合にはW、wおよびk、p≧2の場合にはW、
h、wおよびk)を、CPU11は求める。例えば、図
5(b)に示すように、中間層Hiがまだ追加されてい
ない場合(p=0)、調整可能な結合重みとして、結合
重k1,1〜kb,3のみが求められる。
習はバックプロパゲーション則による学習が行われる。
学習式は、δw(t)=〔S(t)/〔S(t−1)−
S(t)〕〕×δw(t−1)であり、式の詳細および
学習アルゴリズム(TheQuickprop Alg
orithm)は、カーネギーメロン大学1988年9
月発行、Scott E.Fahlman著の技術レポ
ート♯CMU−CS−88−162の“An Empi
rical Study of Learning S
peed in Back−Propagation
Networks”に記載されている。また、エルマン
(J.L.Elman)による、Finding st
ructure in time,Cognitive
science,14,pp.179−211(19
90)に記載されている、離散時間のリカレントネット
ワークに、フィードフォワードネットワークのバックプ
ロパゲーション則を準用した学習則でもよい。また、学
習については以上の方法に限定されず、他の学習則によ
ってもよい。
めた結合重みを用いた場合の誤差δの値が所定値以下に
なっているか否かについて判断する(ステップ14)。
誤差δが所定値以下になっていない場合(ステップ1
4;N)、CPU11は、結合重みテーブルの値をステ
ップ13で求めた結合重みW、h、w、kに更新するこ
となく、pに1を加えた後(ステップ15)、中間層H
iの新しいニューロン素子Himpを追加する(ステッ
プ16)。この新しいニューロン素子Himpは、第m
中間層を構成する。新たなニューロン素子Himpの追
加により、ニューロン素子網と結合重みテーブルには、
調整可能な結合重みW,h,およびwが新しく確保され
る。なお、p=1の場合には、中間層Hiにおけるニュ
ーロン素子間の結合重みhは確保されない。新しく追加
されたニューロン素子Himpには、出力層Ouのニュ
ーロン素子と同様に、シグモイド関数および閾値が設定
されており、−1.0から+1.0の範囲で出力される
ようになっている。
Hi11を追加したニューロン素子網(a)、および、
結合重みテーブル(b)を表したものである。この図7
(a)に示すように、新たなニューロン素子Hi11
は、図形○1についての第1中間層を構成する。そし
て、新しいニューロン素子Hi11と、入力層Inのニ
ューロン素子In1〜In100およびバイアスbとの
結合重みW1,11〜W100,11、Wb,11がニ
ューロン素子網と結合重みテーブルに確保される。ま
た、ニューロン素子Hi11と出力層Ouのニューロン
素子Ou1〜Ou3との結合重みw11,1〜w11,
3も確保される。図7(a)でも○印で示されるよう
に、これら新たな結合重みWとwは、共に調整可能な結
合重みである。
素子Hmpが追加された後、CPU11は、既設のニュ
ーロン素子Him(p−1)についての結合重みW,h
を固定(それ以後は更新できない状態)する(ステップ
17)と共に、Zの値を1に戻した後(ステップ1
8)、ステップ12に移行する。これにより、調整可能
な中間層のニューロン素子Himpよって新たな構成と
なったニューロン素子網により、図形Z=1(最初の図
形○1)から再度の学習処理を行う。ただし、再度の学
習処理であっても、ニューロン素子網は、それまでに学
習した内容の一部について、固定された結合重みWの値
として記憶している。従って、例えば、図形Z=8の学
習で誤差δが所定値以下にならなくなった場合でも、図
形Z=7までの学習内容の一部を、ニューロン素子Hi
m(p−1)についての結合重みWとして記憶している
ので、再度の学習における図形Z=7までの学習処理
(ステップ13)を容易に終了させることができる。
値以下である場合(ステップ14;Y)、CPU11
は、結合重みテーブルの調整可能な結合重みをステップ
13で求めた値に更新する(ステップ19)。そして、
次の図形についての学習を行うためにZに1を加える
(ステップ20)。そして、次の図形が他の形状か否か
についてZの値を確認する(ステップ21)。すなわ
ち、Z=g+1(次の図形が□)、または、Z=2g+
1(次の図形が△)でない場合(ステップ21;N)、
CPU11は、Z=3g+1であるか否かを判断する
(ステップ22)。Z≠3g+1であれば(ステップ2
2;N)、全図形についての学習がまだ終了していない
ので、ステップ12に戻り、次の図形Zについての学習
処理を行う。
子が更に追加された状態を表したものである。図7に示
すように第1中間層のニューロン素子Hi11が追加さ
れた後、ステップ12、13、14、19、20、2
1、22により、各図形Zについて順次学習が繰替えさ
れ、結合重みテーブルの内容について更新される。そし
て、ある図形Z(図形○)についての学習において、誤
差δが所定値以下にならなくなると、図8に示すよう
に、次のニューロン素子Hi12が新たに追加される。
すなわち、結合重みテーブルに、ニューロン素子Hi1
2についての調整可能な結合重みW1,12〜W10
0,12、Wb,12、h1,1,2、および、w1
2,1、〜w12,3が確保される。ここで、hm,p
−1,pは、第m中間層のニューロン素子Hm(p−
1)とHmpとの結合重みである。中間層間の結合重み
は、Hm(p−1)とHmp間でのみ確保され、Hm
(p−2)とHmp間や、HmpとH(m+1)1との
間では確保されない。新たなニューロン素子Hi12の
追加によって、図8(a)の●で表されるように、既設
ニューロン素子Hi11と入力層との結合重みW1,1
1〜W100,11、Wb,11が固定される。なお、
既設ニューロン素子Hi11と出力層との結合重みw1
1,1〜w11,3は○で表されるように固定されず、
調整可能な状態である。
第1中間層Him、および出力層Ouの各ニューロン素
子間の固定された結合重みと調整可能な結合重みを用
い、調整可能な結合重みの値を調整することで、以降の
図形Z(≦g)についての学習(ステップ12、13、
14、19、20、21、22)を順次繰り返す。そし
て、ある図形Zの学習において再び誤差δが所定値以下
にならなくなると、第1中間層Hi1には、図9に示す
ように再びニューロン素子Hi13が確保される。この
図9に示すように、ニューロン素子Hi13の追加によ
り、ニューロン素子Hi11とHi12間の結合重み
h,1,2も固定される。すなわち、一般に、新たなニ
ューロン素子Himpが追加された場合、p≧3であれ
ば、ニューロン素子Him(p−2)とHim(p−
1)との間で確保された結合重みhm,p−2,p−1
の値も固定される。
つめのニューロン素子Hi13が追加されると、同様に
して、以降の図形Z(≦g)についての学習を順次繰替
えする。そして、図6のフローチャートにおけるステッ
プ21においてZ=g+1(次の図形が□)、またはZ
=2g+1(次の図形が△)であると判断した場合(;
Y)、CPU11は、ニューロン素子Himpの結合重
みW,hを固定すると共に、第m中間層Himのニュー
ロン素子Him1〜Himpと出力層Ouとの全結合重
みwを固定する(ステップ23)。さらにCPU11
は、mに1を加えると共に、pの値を再び1に設定した
後(ステップ24)、新たな中間層Himについて新ニ
ューロン素子Himpを追加し(ステップ25)、ステ
ップ12に移行する。
に変わる場合、現時点での中間層Hmpでの学習が可能
であっても、第m中間層Himについての結合重みW、
h、wを固定し、第m+1中間層Hi(m+1)のニュ
ーロン素子Hi(m+1)1を追加する。図10は、第
2中間層のニューロン素子Hi21を新たに追加した状
態を表したものである。この図10に示すように、第1
中間層Hi1のニューロン素子Hi11、Hi12、H
i13によるZ=g(図形○g)までの学習が完了する
と、更に、次のZ=g+1の図形(図形□1)について
の学習が可能であっても、第1中間層Hi1についての
全結合重みW、hおよび、出力層Ouとの結合重みwを
固定する。そして、第2中間層Hi2についてのニュー
ロン素子Hi21を新たに追加し、次の図形□1〜□g
までの学習を行う。
した段階で、図形○に対応する第1中間層Hi1につい
ての全ての結合重みW1,11〜W100,13、W
b,11〜Wb,W13、h1,1,2、h1,2,
3、w11,1〜w13,3、を固定する(図10にお
いて●で表す)ことで、図形○1〜○gについて学習し
た内容を完全に記憶させることができる。すなわち、図
形□についての学習により、図形○について学習した内
容が変化することがない。従って、図形○についての認
識率を高くすることができる。
のニューロン素子Hi21を追加することで、Z=g+
1以降の図形、すなわち図形□1以降の図形についての
学習を開始する。そして、図7〜図9で説明したと同様
に、ある図形Z(g+1≦Z≦g)についての学習処理
により誤差δが所定値以下となったら、新たなニューロ
ン素子Hi22、Hi23、…、を追加してゆく。
+1)の学習で入力データD1〜D100を入力層In
に入力した場合、出力層Ouへは、第2中間層Hi2か
ら出力値(結合重みwを掛けた値)だけでなく、第1中
間層Hi1からの出力値(結合重みwを掛けた値で、例
えばPとする)も供給されることになる。従って、図形
□の学習では、図形□の認識と共に、各入力値に対する
第1中間層Hi1からの出力値Pを打ち消して“0”に
するための学習も行われる。すなわち、最初に図形□を
学習した場合、その中間層から出力される出力値に比べ
て、“−P”だけ小さい値が出力されるようになる。
いて、第1中間層Hi1についての固定した結合重み
W、h、wと共に、第2中間層Hi2の各ニューロン素
子Hi2pについての固定した、および調整可能な結合
重みW、h、wによって学習を行う。この図形□の学習
についても、図形○についての学習と同様に、ある図形
Zの学習で誤差δが所定値以下とならない場合に(ステ
ップ14)新たなニューロン素子Hi2pを追加し(ス
テップ15〜ステップ18)、次の図形についての学習
を行う。そして、ステップ21でZ=2g+1の場合、
既に固定されている第1中間層Hi1の全結合重みW、
h、wと共に、第2中間層Hi2についての全結合重み
W、h、wを固定する(ステップ23)。そして、次の
図形△についての学習を行うための第3中間層Hi3の
ニューロン素子Hi31を追加し(ステップ25)、図
形△1〜△g(Z=2g+1〜3g)についての学習を
行う。この場合においても、図形△の入力データD1〜
D100の入力により、第1中間層Hi1と第2中間層
Hi2からの出力値P′が出力されるため、これを打ち
消して“0”にするための学習も行われる。すなわち、
最初に△を学習した場合に比べて、“−P′”だけ小さ
い値が出力されるように、第三中間層Hi3の学習が行
われる。
1である場合(;Y)、全ての図形○1〜○g、□1〜
□g、△1〜△gについての学習が完了したので、CP
U11は、最後に追加したニューロン素子Himpの結
合重みW,hを固定すると共に、第m中間層Himのニ
ューロン素子Him1〜Himpと出力層Ouとの全結
合重みwを固定する(ステップ26)。その後、入力層
Inと出力層Ou間の結合重みkを固定して(ステップ
27)、学習処理を終了する。図11は、全図形につい
ての学習が終了後におけるニューロン素子網と結合重み
テーブルの状態を表したものである。この図11におい
て●で示すように、全入力データについての学習が終了
すると、結合重みテーブルに格納されている各ニューロ
ン素子間の結合重みは全て固定された状態となる。
ついて各g個のデータによる学習が終了すると、以後手
書き等による三種類の図形を認識することができる。ま
ず、図形が記載された用紙を図形読取装置24で読み取
り、入力データD1〜D100を作成しRAM14に格
納する。CPU11は、入力データD1〜100をニュ
ーロン素子網22の入力層In1〜In100に入力
し、結合重みテーブルに格納された結合重みを用いた順
伝播活性により出力層Ouのニューロン素子Ou1〜O
u3の出力値を求める。CPU11は、出力された3ビ
ットの値から、読み込んだ図形の認識を行う。すなわ
ち、CPU11は、3ビットの出力値の各々について、
所定の閾値を適用することで、各出力値を“0”または
“1”の2ビットで表し、これが教師信号と一致するか
否かを判断する。“100”であれば図形○、“01
0”であれば図形□、“001”であれば図形△である
と認識し、認識した形状を表示装置17の画面に、形状
名と図形形状で表示する。なお、出力がこれら教師信号
以外である場合には、表示装置17に認識不能であるこ
とを表示する。
システムに適用した第2実施形態について説明する。図
12は、ニューラルネットワークを利用した音声認識装
置のシステム構成を表したものである。なお、第1実施
形態と同一または機能的に略同一である部分について
は、同一の符号を付して適宜その説明を省略し、または
異なる部分についてのみ説明することとする。
おり、データバス等のバスライン12を介して、ROM
13、RAM14、通信制御装置15、プリンタ16、
表示装置17、キーボード18、FFT(高速フーリエ
変換)装置21、およびニューロン素子網22が接続さ
れている。
らに、CPU11が音声認識やニューロン素子網の学習
等の処理や制御を行うための各種プログラムやデータが
格納されている。また、ニューロン素子網の学習として
バックプロパゲーション則等による各種学習を行うため
のプログラムや、音声認識を行うための80種類の音素
についての符号列が格納されている。この音素について
の符号列が第2教師信号として使用されると共に、ニュ
ーロン素子網の出力信号から音素を認識する場合に使用
される。またROM13には、認識した音素から音声を
認識すると共に、認識した音声を文字による文章に変換
する日本語変換システムのプログラムも格納されてい
る。
らに、FFT装置21で解析された音声信号について、
各時間と各周波数におけるパワーを一時格納するための
ベクトル列格納エリアが確保されている。なお、この各
周波数におけるパワーの値が、ニューロン素子網の音声
入力層Inに入力されるベクトル列になる。また、表示
装置17は、入力データや認識した音声の内容、およ
び、音声認識に必要な操作の指示を画面表示するように
なっている。キーボード18は、FFT装置21のパラ
メータの変更や設定条件等を入力したり、文章の入力処
理等も行うようになっている。
装置23が接続されている。このFFT装置21は、音
声入力装置23から入力されたアナログの音声データ
を、ディジタルデータに変換すると共に、離散的フーリ
エ変換によりスペクトル解析を行う。このFFT装置2
1におけるスペクトル解析により、各周波数毎のパワー
によるベクトル列が、各時間毎に出力され、この各時間
毎のベクトル列はRAM14のベクトル列格納エリアに
格納されるようになっている。
の構成を表したものである。また、図14は、音素
「a」の学習が終了し、音素「i」の学習途中における
ニューロン素子網22の状態を表したものである。図1
3に示すように、初期状態においてニューロン素子網2
2は、音声入力層Inと音声出力層Ouおよび仮説出力
層(Hypothesis層)Hyを備えている。また図14に示
すように、第m中間層Himを構成するニューロン素子
Himp、および、第m環帰入力層Comを構成するニ
ューロン素子Compの1対が追加される。新たなニュ
ーロン素子HimpとCompは、学習の各段階におい
て誤差δが所定値以下にならない場合に追加されるよう
になっている。なお、第m中間層Himと第m環帰入力
層Comは、各音素毎に新たに確保され、その添字
“m”の値は各音素毎に1が加えれらた値となる。
び、中間層Hiと環帰入力層Coのニューロン素子が追
加された各状態において、順伝播活性および逆伝播学習
が可能なように構成される。
出力層Hyの各ニューロン素子は、シグモイド関数およ
び閾値が設定されており、−1.0から+1.0の範囲
で出力されるようになっている。一方、環帰入力層Co
のニューロン素子Compは、対応する中間層Hiのニ
ューロン素子Himpの時刻t−1に対する出力値を記
憶するようになっており、記憶した値を時刻tに対して
出力するようになっている。
声入力層Inは、In1〜In30の30個のニューロ
ン素子およびバイアスbを備えている。バイアスbに
は、常時“+1”が入力されるようになっている。音声
出力層Ouは音声入力層Inと同数でOu1〜Ou30
の30個のニューロン素子を備えている。仮説出力層H
yは、認識対象となる80個の音素に対応する符号化が
可能な数として8個のニューロン素子Hy1〜Hy8を
有している。
は、認識対象となる音声が日本語以外の外国語の場合
に、その言語に応じた音素数と、その音素数の符号化に
必要な数のニューロン素子が使用される。また、日本語
の音素として必ずしも80に限定する必要はなく、他の
分類による音素数およびニューロン素子数を使用しても
よい。また、音素数と同一のニューロン素子を仮説出力
層58に具備させてもよい。すなわち、音素数が80個
の場合、ニューロン素子も各音素に対応してHy1〜H
y80の80個を仮説出力層Hyに具備させる。そし
て、第2教師信号として、音素「a」の場合「1000
0…0」、音素「i」の場合「01000…0」という
ように、各音素に対応するビット(ニューロン素子)の
みを“1”とし他のビットを“0”とする。こうするこ
とで、学習処理の負担は増加するが、学習後の音声認識
において、他の音素との区別を容易に行うことができる
ようになる。
声出力層Ouは結合重みkで結合され、音声入力層In
と仮説出力層Hyは結合重みuで結合されている。ま
た、音声入力層Inと中間層Hiは結合重みWで結合さ
れ、中間層Hiと中間層Hiは結合重みhで結合され、
中間層Hiと環帰入力層Coは結合重みsで結合され、
中間層Hiと音声出力層Ouは結合重みwで結合され、
中間層Hiと仮説出力層Hyは結合重みvで結合されて
いる。環帰入力層Coと中間層Hiとは、第m環帰入力
層Comと第m中間層Himとのニューロン素子間での
み結合している。中間層Hiは、第1実施形態と同様
に、第m中間層Himにおけるニューロン素子Him
(p−1)とニューロン素子Himpとの間でのみ結合
している。
第1実施形態と同様に、信号が流れる順とする。環帰入
力層Coと中間層Hi間では前者から後者に信号が流れ
るので、例えば、ニューロン素子Co14とHi12間
の結合重みは、s14,12となる。また、h4,2,
3は、第4中間層Hi4のニューロン素子Hi42とH
i43との結合重みである。
整可能である。結合重みW、h、sについては、中間層
Hiおよび環帰入力層Coのニューロン素子の新たな追
加に伴い確保された結合重みが調整可能であり、既設の
ニューロン素子についての結合重みが固定される。ま
た、異なる音素についての学習が開始される場合、すな
わち、第m中間層Him、第m環帰入力層Comにおい
てm=m+1となる場合、および、全学習が終了する場
合に、第m中間層Himとの全結合重みw、vが固定さ
れる。mの値が変らず、pの値のみが変化している間
は、第m中間層Himとの結合重みw、vは調整可能で
ある。図14でも示されるように、第2実施形態のニュ
ーロン素子網22を図示する場合、第1実施形態と同様
に、調整可能な結合重みについては○で表し、固定され
た結合重みについては●で表す。
重みを格納する図示しないメモリを備えている。図15
は、図14に示す状態のニューロン素子網22における
結合重みテーブルを表したものである。図14および図
15に示すように、ニューロン素子網22は、中間層H
iとして、第1中間層Hi1のニューロン素子Hi11
〜Hi14と、第2中間層Hi2のニューロン素子Hi
21〜Hi23までが追加された状態である。また、環
帰入力層Coとして、第1環帰入力層のニューロン素子
Co11〜Co14と第2環帰入力層Hi2のニューロ
ン素子Hi21〜Hi23までが追加された状態であ
る。ニューロン素子網22は、ニューロン素子網22
は、最初の音素、例えば「a」についての学習が4つの
ニューロン素子からなる第1中間層Hi1および第1環
帰入力層Co1の追加によって完了し、更に、次の音
素、例えば「i」についての学習を行っている途中であ
ることがわかる。
FFT装置21でスペクトル解析された時間tにおける
音声のベクトル列が順次音声入力層Inに入力される。
第m環帰入力層Comの各ニューロン素子Com1〜C
ompは、第m中間層の1つ前の出力値を記憶するよう
になっている。すなわち、1つ前の時間t−1に対する
学習が終了して調整可能な結合重みが更新された後に、
時間t−1のデータを音声入力層Inに入力することで
第m中間層Himの各ニューロン素子Him1〜Him
pから出力される値が、それぞれ第m環帰入力層Com
の各ニューロン素子Com1〜Compに記憶される。
この時間t−1における第m中間層Himの出力値が、
時刻tに対する学習において、第m環帰入力層Comか
ら出力され、対応する結合重みsを掛けた値が第m中間
層に入力されるようになっている。
層Inに与えられることになる時間t+1のベクトル列
が第1教師信号として入力される。仮説出力層Hyに
は、時間tにおける前後の時間間隔で音声入力層Inに
入力されるベクトル列が表す特定の意味A(本実施形態
では、認識されるべき音素)を仮説する符号列が第2教
師信号として入力される。
層Inに現在(時間t)のベクトル列を入力し、中間層
Hiにおける過去(時間t−1)のベクトル値を環帰入
力層Coに入力すると共に、音声出力層Ouに未来(時
間t+1)のベクトル列を入力している。このため、各
音素についてスペクトル解析された各パワーP(tn)
によるベクトル列についての時系列的な関係が学習され
ることになる。すなわち、音声入力層In、中間層H
i、および音声出力層Ouの各結合重みは、過去、現
在、未来にわたる時系列的な関係を含めた値に学習され
る。また、同一の音素についての各パワーP(tn)が
音声入力層Inに入力されて学習を行う際、仮説出力層
Hyには常時同一の第2教師信号を入力して学習を行っ
ている。これによって、入力されるベクトル列の時系列
的な関係と共に、そ関係を有する音素(符号列)が仮説
的に学習される。このため、音声認識を行う場合に、ス
ペクトル解析された音声についてのベクトル列が音声入
力層Inに入力されると、そのベクトル列の時系列的な
関係をも考慮されたベクトル列が仮説出力層Hyから出
力されることになる。
形態と同様に、学習の各段階において誤差δが所定値以
下にないない場合に、中間層のニューロン素子Himp
と環帰入力層のニューロン素子Compを追加すること
で学習を進めるので、音声認識のように学習すべき入力
データの量が非常に多い場合であっても、学習処理時間
を短くすることができる。また、各音素に対する学習が
終了する毎に、第m中間層Himと第m環帰入力層Co
mに対する結合重みW、h、v、wが固定されるので、
次の音素に対する学習を行っても、それ以前の学習内容
を忘却することなく記憶させることができる。従って、
各音素に対する認識率を向上させることができる。
表したものである。この図16に示すように、第2教師
信号は、80個の各音素に対応して、音素「a」が「1
000000」、音素「i」が「01000000」、
音素「u」が「00100000」、…、というよう
に、各8ビットの符号列で規定されている。この第2教
師信号が表す符号の各ビットは、仮説出力層Hyの各ニ
ューロン素子Hy1〜Hy8に供給される。この各音素
に対する第2教師信号は、ROM13に格納されてい
る。なお、図16に示した第2教師信号の各符号列は、
本実施形態における例示であり、他の符号列を使用して
もよい。また、音素数に応じて仮説出力層Hyのニュー
ロン素子数が決定されるが、そのニューロン素子数に応
じたビット数で表現するようにしてもよい。
における動作について説明する。 ニューラルネットワークの学習 まずニューラルネットワークについての学習を行う場
合、ユーザは、最初にキーボード18を操作することに
より、または表示装置17に表示された所定キーをマウ
スにより操作することにより、学習モードを指定する。
学習モードを指定した後、ユーザは、予め決められた8
0の音素に対応する文字を順次キーボード18から入力
した後に、その音素についての音声を音声入力装置23
に入力する。なお、入力すべき音素を表示装置17に表
示することで、発声すべき音素を順次知らせるようにし
てもよい。音声入力装置23では、例えば音素「a」に
ついて、図17(a)に示すようなアナログ信号が入力
されると、これをFFT装置21に供給する。FFT装
置21では、供給されたアナログ音声データを、例えば
22KHzでサンプリングし、16ビットのPCMデー
タにA/D変換し、図示しない記憶部に格納する。
ング(Hamming)窓、ハニング(Hannig)
窓等の時間窓の形や、ポイント数(例えば512ポイン
ト)等のパラメータに従って、各時間tn(n=1、
2、…)毎に、高速フーリエ変換(FFT)処理により
ディジタル音声データ「a」についてのスペクトル解析
を行う。すなわち、FFT装置21は、図17(b)に
示すように、各時間tn毎における音声データの、各周
波数(F1〜F30)に対するパワーP(tn)を算出
する。この各周波数のパワーP(tn)によるベクトル
列は、図18に示すように、各時間毎に、RAM14の
ベクトル列格納エリアに格納される。
によるスペクトル解析が終了すると、CPU11は、R
AM14に格納したベクトル列に従ってニューロン素子
網22の学習を行う。いま、最初の音素「a」の時間t
nにおける学習について説明する。CPU11は、ま
ず、時間tnの学習開始する前の第1中間層Hi1のニ
ューロン素子Hi11〜Hi1pの状態、すなわち、時
間tn−1についての学習が終了した時点での第1中間
層Hi1におけるベクトル列を、第1環帰入力層Co1
の対応するニューロン素子Co11〜Co1pに入力す
る。そしてCPU11は、音素「a」についての時間t
nにおけるベクトル列P(tn)をRAM14から読み
出し、音声入力層Inの各ニューロン素子In1〜In
30に入力する。また、時間tnの次の時間tn+1に
つてのベクトル列P(tn+1)を第1教師信号として
音声出力層Ouのニューロン素子Ou1〜Ou30に入
力すると共に、入力された音素「a」について、図15
に示す符号列「10000000」を第2教師信号とし
て仮説出力層Hyの各ニューロン素子Hy1〜Hy8に
入力する。
よび音声出力層Ouと仮説出力層Hyへの教師信号の入
力が済むと、CPU11は、結合重みテーブルに格納さ
れている音声入力層In、中間層Hi、環帰入力層C
o、音声出力層Ou、および仮説出力層Hyの各ニュー
ロン素子間の結合重みW、h、s、w、v、k、uを用
いて学習を行い、調整可能な結合重みを学習後の値に更
新する。なお、本実施形態において行われる学習は、第
1実施形態と同様に各種の学習則が使用可能である。
すると、次に時間t+1についての学習を行う。この場
合、時間tnのときと同様にして、tnについての学習
が終了した時点での第1中間層Hi1のベクトル列を第
1環帰入力層Co1に記憶させ、時間tn+1のベクト
ル列P(tn+1)をRAM14から読み出して音声入
力層Inに入力する。また、時刻tn+2のベクトル列
P(tn+2)を第1教師信号として音声出力層Ouに
入力する。一方、仮説出力層Hyには、入力された音素
「a」についての学習が行われている間、「a」につい
ての同一の符号「10000000」が継続的に第2教
師信号として入力される。
差δが所定値以下にならない場合、第1実施形態と同様
に、第1中間層Hi1と第1環帰入力層Co1には、新
たなニューロン素子Hi1pとニューロン素子Co1p
が追加される。そして、既設のニューロン素子Hi1
(p−1)とCo1(p−1)の結合重みW、h、sを
固定し、ニューロン素子の追加により確保された調整可
能な結合重みW、h、s、および結合重みw、v、k、
uを調整することで、音素「a」についての学習を繰り
返す。
ると、音素「a」の学習で確保された第1中間層Hi1
と第1環帰入力層Co1についての全結合重み、W、
h、s、およびw、vを固定する。そして、次の音素
「i」の学習を行うために、第2中間層Hi2と第2環
帰入力層Co2についてニューロン素子Hi21とCo
2p1を追加し、以後、誤差δが所定値以下にならない
毎に新たなニューロン素子Hi2p、Co2p(p≦
2)を追加する。
におけるp=3の状態が図14で表したニューロン素子
網22の状態である。図14に示すように、新たなニュ
ーロン素子Hi23、Co23の追加によって、既設の
ニューロン素子Hi22とCo22に対する結合重みW
1,22〜W30,22、Wb,22、結合重みh2,
1,2、結合重みs21,22、s22,22、s2
2,21が新たに固定される。そして、結合重みテーブ
ルには、新たに追加されたHi23とCo23に対する
結合重みW1,23〜W30,23、Wb,23、結合
重みh2,2,3、結合重みs21,23,s22,2
3、s23,23、s23,22、s23,21が、調
整可能な結合重みとして確保される。また、結合重みw
23,1〜w23,30と、結合重みv23,1〜v2
3,8も調整可能な結合重みとして確保する。
実施形態と同様に、結合重みを固定した第1中間層Hi
1からの出力は、次の音素「i」の学習において雑音と
して入力されるが、次の音素「i」の学習において、こ
の雑音をマイナスすることも含めた結合重み(固定され
ていないもの)に調整され、更新される。同様に、次の
音素として「u」を学習する場合には、結合重みを固定
した音素「a」の第1中間層Hi1と音素「i」の第2
中間層Hi2からの雑音をマイナスすることも含めて学
習が行われる。このように第2実施形態におけるニュー
ロン素子網では、1対の第m中間層Himと第m環帰入
力層Comが各音素毎に設けられ、他の中間層や環帰入
力層と完全に切り離されると共に、学習が完了した音素
に対する全結合重みを固定しているので、各音素に対応
する学習を高速に行うことができる。
ューロン素子Himp、および第m環帰入力層Comの
各ニューロン素子Compを順次追加しながら、
「i」、「u」、「e」、「o」等の全ての音素につい
ての学習を行う。80個の全音素についての学習が完了
すると、ニューロン素子網22は、中間層と環帰入力層
は、第1中間層Hi1〜第80中間層Co80と、第1
環帰入力層Co1〜第80環帰入力層Co80が存在す
ることになる。各第m中間層Himと各第m環帰入力層
Comのニューロン素子の数は、各音素に対する学習段
階において、それぞれ必要個だけ追加される。
ば音声「まえ」が入力されたものとする。すると、FF
T装置21で入力音声についてのスペクトル解析が行わ
れる。そして、CPU11は、時間tn−1にける中間
層Hiのベクトル列を環帰入力層Coに入力した後、現
在の時間tnにおける各周波数のパワーから成るベクト
ル列P(tn)を音声入力層Inに入力する。CPU1
1は、音声入力層Inと中間層Hiとの各結合重み(図
4)をニューロン素子網22のメモリから読み出し、各
結合重みと音声入力層Inの各入力値とから、中間層H
iの各ニューロン素子Hi〜Hi200の出力値を算出
し、ニューロン素子網22の図示しないメモリに格納さ
れる。この中間層Hiのベクトル値は、次の時間tnに
おけるベクトル列P(tn+1)が入力される前に環帰
入力層Coに入力される。
2の図示しないメモリから、格納した中間層Hiの出力
値と、中間層と仮説出力層Hyとの結合重みとを読み出
し、両者の値から、仮説出力層Hyの各ニューロン素子
Hy1〜Hy8の出力値を求める。そして、各ニューロ
ン素子Hy1〜Hy8の出力値と、ROM13に格納さ
れている第2教師信号テーブルの各符号列と照合するこ
とで、該当する音素を特定し、特定した音素をRAM1
4に格納する。
ル列P(tn)に解析され、時系列的に音声入力層In
に入力されて特定されるため、複数の音素列となる。例
えば、音声「いろ」が入力された場合には、「iiii
irrrooooo」となる。そこで、CPU11は、
このRAM14に格納された音素列から、入力された音
声を「iro」と認識する。そしてCPU11は、キー
ボード18からの入力指示がある場合には、認識した音
声を日本語変換システムに従って、文字による文章に変
換する。変換した文章は、表示装置17に表示されると
共にRAM14に格納される。また、キーボード18か
らの指示に応じて、通信制御装置5および通信網2を介
して、パーソナルコンピュータやワードプロセッサ等の
各種通信制御装置にデータ伝送を行う。
の特定結果を表したものである。なお、学習段階におい
て、第2教師信号として仮説出力層Hyに入力する各音
素の符号として図16のベクトル列を採用したものとす
る。また、各ニューロン素子Hy1〜Hy8の出力は、
所定の閾値を越えた場合に出力され、閾値以下の場合に
は出力されず図19では、記号「−」で示されている。
この図19の最右欄に示すように、各時間tnにおける
ベクトル列の入力に対応して音素「m」、「a」、
「e」を特定することができる。この音素から入力され
た音声が「まえ」であると認識することができる。
おけるニューロン素子Hy1〜H8の出力によって特定
された各音素列から、音声を特定する場合、同一の音素
が複数個以上、例えば4個以上連続的に特定されている
場合に、その音素を有効と見なして、音声認識を行う。
例えば、図19において、時間t1で特定された音素
「m」と時間t35で特定された音素「e」は、4個以
上連続していないため、音声認識を行う対象から除外さ
れる。なお、4子以上連続的に特定された場合だけでな
く、他に、2個、3個、5個、10個等の他の数だけ連
続的に特定された場合にその音素が有効であると判断す
るようにしてよもい。更に、音素が有効であると判断す
るための個数を、利用者の選択により、キーボードから
指定することができるようにしてもよい。
に、音声を認識する場合、スペクトル分析されたベクト
ル列が入力された当初と、各音素から音素に変化する場
合において、音素を特定できない場合があるが、その後
継続的に特定される音素によって容易に音声を認識する
ことができる。スペクトル分析されたベクトル列が入力
された当初に音素を特定できない場合があるのは、学習
段階において、過去、現在、未来による時系列的な関係
を含めて学習しているのに対して、入力当初は過去の時
系列的関係を含む情報が充分でない為であると考えられ
る。また、各音素の変化時において音素を特定できない
のは、学習段階において、個々の音素単位での学習を行
っており、各音素同士の時系列的関係については学習の
対象になっていないためであると考えられる。
ルの時系列的な関係について学習されているため、学習
のための音素を発声する者と異なる者の音声も正確に認
識することができた。従って、不特定話者認識を行うこ
とができる。
従来から認識すべき音素の開始点をどのようにして正確
に決定するかが問題であったが、第2実施形態によれ
ば、音素の開始点を特定する必要がない。また、音素単
位による連続音声認識を行う場合に、各個人差が大きい
各音素の発声時間に関係なく、音声を認識することがで
きる。例えば、音声として「はーる」というように、音
声「は」をのばして発声した場合であっても、「hhh
hh…aaaaaaaaaaaaaa…rrrr…uu
uuu…」というように、音素「a」が多く特定される
だけで、容易に音声「はる」と認識することができる。
数の時間tnにおける複数のベクトル列P(tn)が入
力され、各時間毎に音素を特定している。このため、連
続音声認識において、各音素状態が前に現れる音素の状
態により影響を受けていても、各音素から音素に変化す
る場合に音素の特定ができない状態、すなわち、図19
の最右欄の「?」が多少増えるだけである。そして、そ
の後に同一の音素が継続的に特定されるため、連続音声
認識であっても容易に音声を認識することができる。
子網22では、図14で示したように環帰入力層Coと
中間層Hiとを結合重みsで結合するようにしたが、図
20示されるように、各環帰入力層Coのニューロン素
子の値を、対応する中間Hiのニューロン素子に供給す
るようにしてもよい。すなわち、各中間層Hi1〜Hi
80を構成する各ニューロン素子は、自己の値をフィー
ドバックして入力するように構成する。従って、時間t
における入力を処理する場合、各中間層Hiのニューロ
ン素子には、音声入力層Inからの時間tに対する入力
の他に、時間t−1における自己の出力値も、環帰入力
層Coのニューロン素子からフィードバックして入力さ
れる。一方、環帰入力層Coには、時間tにおける各中
間層Hiのニューロン素子からの出力値が入力される。
ニューロン素子網22をこのように構成することで、時
間t−1における過去の情報も考慮しつつ、環帰入力層
Coと中間層Hi間の結合重みsの計算が不要となるの
で、処理を早くすることができる。
間層Hiのデータをフィードバックさせるリカレント型
のニューラルネットワークとしたが、本発明では、環帰
入力層Coのないニューロン素子網としてもよい。この
場合、時間tのベクトル列を音声入力層Inに入力し、
次の時間t+1のベクトル列を第1教師信号として音声
出力層Ouに入力し、時間tnの集合が表す特定の意味
Aを第2教師信号として仮説出力層Hyに入力する。環
帰入力層がない場合、過去(時間t−1)の情報に基づ
く時系列的な関係までは学習されない。しかし、局所的
ではあるが、現在(時間t)と未来(t+1)による時
系列的関係を学習しているため充分に音声を認識するこ
とができる。環帰入力層がない場合には、学習および音
声認識の処理が軽減され、処理速度を早くすることが可
能になる。
の時系列的な関係と共に、その関係を有する音素(符号
列)を仮説的に学習することで、音声を認識するように
したが、本発明では、時系列的関係を有する音声に限定
されるものではなく、互いに所定の関係を有する複数の
ベクトル列Fn(n=1、2、3、…)の集合が表す特
定の意味についての学習とその認識や予測について利用
することができる。例えば、音声認識以外に、運動の時
系列パターン発生の学習とその予測を行うようにしても
よい。また、時系列的な場合だけでなく、空間的関係
や、周波数的関係を有する複数のベクトル列の集合が特
定の意味を有する場合の、学習と認識を行うようにして
もよい。例えば、文字が有する空間的関係について学習
することで、文字認識を行うようにしてもよい。
声認識について説明したが、単語単位で音声認識するよ
うにしてもよい。この場合、ベクトル列が表す特定の意
味としてその単語を表す符号列が第2教師信号として使
用される。
した学習プログラムに従ってCPU11でニューロン素
子網22の学習を行い、学習後のニューロン素子網22
による音声認識を行うようにしたが、不特定話者の連続
音声認識を高い認識率で行うことが可能であるので、再
学習の必要が少ない。従って、音声認識装置としては、
必ずしも学習機能を有する必要がなく、他の装置の学習
で求めた結合重みを有する、音声入力層In、環帰入力
層Co、中間層Hi、仮説出力層Hyからなるニューロ
ン素子網を使用するようにしてもよい。この場合、ニュ
ーロン素子網を、学習済みの結合重みを有するハードウ
ェアで構成してもよい。
T装置における高速フーリエ変換によって、学習時の各
音素と音声認識時の音声についてのスペクトル解析を行
ったが、他のアルゴリズムによりスペクトル解析を行う
ようにしてもよい。例えば、DCT(離散コサイン変
換)等によるスペクトル解析を行ってもよい。
音素を学習する場合に、例えば母音である音素「a」に
ついて1種類の学習を行う場合について説明したが、本
発明では、複数種類について学習するようにしてもよ。
例えば、音素「a」について、母音の「a」の他に、
「ma」、「na」、「ka」等の各音声から音素
「a」の部分を切り出して音素「a」の学習を行うよう
にしてもよい。また、子音の場合も同様に、音素「m」
であれば、「ma」、「mi」、「mu」等の各音声か
ら音素「m」を切り出し、それぞれについて学習を行
う。これにより、他の色々な音素と接続された場合につ
いて学習が行われ、認識率が向上する。
は、音声/入力層Inにバイアスbを設け、音声/入力
層Inと音声/出力層Ouとを結合重みkで結合させ、
第2実施形態では、更に音声入力層Inと仮説出力層H
yとを結合重みuで結合させる構成としたが、本発明で
は他の構成としてもよい。すなわち、バイアスbが無い
構成としてもよい。また、音声/入力層Inと音声/出
力層Ouとを結合させず、第2実施形態では、更に音声
入力層Inと仮説出力層Hyとを結合させないようにし
てもよい。なお、バイアスbと結合重みk、第2実施形
態の場合更に結合重みuが無い場合、ニューロン素子網
22は、初期状態において、第1中間層Hiのニューロ
ン素子Hi11、第2実施形態の場合更に第1環帰入力
層Coのニューロン素子Co11を学習可能な状態で具
備させておく。
て、結合重み結合重みkを他の結合重みとを同等に扱っ
たが、本発明では、結合重みkの比重を他の結合重みよ
りも小さくするようにしてもよい。例えば、結合重みk
の範囲を他の結合重みの1/2、1/3、1/4、1/
5等にしてもよい。
第m中間層Himと、音声/出力層Ouとの結合重み
w、第2実施形態の場合更に仮説出力層Hyとの結合重
みvについては、異なる図形、音素についての学習を開
始する場合、すなわち、mの値がm+1になる場合に、
一括して固定する構成としている。本発明では他に、第
m中間層Himと音声/入力層Inとの結合重みWの場
合と同様に、mの値が同一でも、新たなニューロン素子
Himpが追加されるときに、既設のニューロン素子H
im(p−1)に対する結合重みwm(p−1),1〜
wm(p−1),30と、結合重みvm(p−1),1
〜vm(p−1),8を固定するようにしてもよい。そ
して、追加した第m中間層Himのニューロン素子Hi
mpに対する結合重みwmp,1〜wmp,30と、結
合重みvmp,1〜vmp,8を調整可能な結合重みと
する。
に格納した学習プログラムに従ってCPU11でニュー
ロン素子網22の学習を行い、学習後のニューロン素子
網22は、高い認識率で図形認識や音声認識等を行うこ
とが可能であるので、再学習の必要が少ない。特に、音
声認識の場合、不特定話者の連続音声認識を高い認識率
で行うことが可能であるり再学習の必要が少ない。従っ
て、図形認識装置や音声認識装置としては、必ずしも学
習機能を有する必要がなく、他の装置の学習で求めた結
合重みを有する、環帰入力層Co、中間層Hi、仮説出
力層Hyからなるニューロン素子網を使用するようにし
てもよい。この場合、ニューロン素子網を、学習済みの
結合重みを有するハードウェアで構成してもよい。
各音素に対応する1対の中間層と環帰入力層毎の学習を
別々のコンピュータシステム等を使用して別個独立に行
い、各学習終了後に、各中間層と環帰入力層の対を組み
合わせて、ニューロン素子網22を構成するようにして
もよい。この場合、例えば第2実施形態であれば、各中
間層は対応する音素についてだけ独立して学習している
ため、他の音素に対する中間層による雑音をマイナスす
ることも含めた学習が行われていない。そこで、各音素
の雑音をマイナスする信号が音声出力層Ouと仮説出力
層Hyに入力されるような、調整用中間層Hi81(8
1個目の中間層)と調整用環帰入力層Co81(81個
目の環帰入力層)を別個付加する必要がある。そして、
既に学習した各第1中間層Hi1〜第80中間層Hi8
0(80音素の場合)の結合重みを固定した状態で、全
ての音声について再度学習を行う。
からの出力は、雑音をマイナスする値となる。例えば、
音素「a」を再学習する場合、音素「a」に対応する第
1中間層Hi1を除いた他の中間層Hi2〜Hi80
(各結合重みは固定されている。)からの出力の合計が
プラスマイナスゼロとなるような値が、調整用中間層H
i81から出力されるように、調整用中間層Hi81と
調整用環帰入力層Co81の結合重みが学習される。こ
の学習においても、調整ができなくなった段階で、調整
用中間層Hi81と調整用環帰入力層Co81のニュー
ロン素子Hi81p、Co81pを順次追加し、ニュー
ロン素子Hi81(p−1)の結合重みW、hを固定す
る。なお、各音素や図形等の学習を個別に行い、中間層
と環帰入力層の対を組み合わせてニューロン素子網22
を構成する場合、調整用の環帰入力層Co81を設け
ず、調整用中間層Hi81のみを設けるようにしてもよ
い。
実施形態では音声認識においてFFT21で解析された
スペクトルデータを入力層に入力するデータとしたのに
対して、この第3実施形態では、ケプストラムデータを
入力することで音声認識を行うようにしたものである。
図21は、第3実施形態におけるニューラルネットワー
クのシステム構成を表したものである。この図に示すよ
うに、ニューラルネットワークでは、第2実施形態のシ
ステムに更にケプストラム装置26を備えている。な
お、その他の部分については第2実施形態と同様なの
で、同一の番号を付してその説明を省略する。また、ニ
ューロン素子網22については、第1実施形態および第
2実施形態で説明したニューロン素子網22だけでな
く、さらに第1および第2実施形態の変形例として説明
したニューロン素子網22の、いずれのニューロン素子
網22を適用することも可能である。ケプストラム装置
26は、FFT装置21におけるスペクトル解析された
波形の短時間振幅スペクトルの対数を逆フーリエ変換す
ることで、ケプストラムデータを得るものである。この
ケプストラム装置26により、スペクトル包絡と微細構
造とを近似的に分離して抽出することができる。
する。いま、音源と音道のインパルス応答のフーリエ変
換をそれぞれ、G(ω)H(ω)で表すと、線型分離透
過回路モデルにより、 X(ω)=G(ω)H(ω) の関係が得られる。この式の両辺の対数をとると、次の
数式(1)となる。 log|X(ω)|=log|G(ω)+log|H(ω)|…(1) さらに、この数式(1)の両辺の逆フーリエ変換をとる
と次の数式(2)になり、これがケプストラムである。 c(τ)=F-1log|X(ω)| =F-1log|G(ω)+F-1log|H(ω)|…(2) ここでτの次元は、周波数領域からの逆変換であるから
時間になり、ケフレンシーとよばれる。
する。数式(1)の右辺第1項はスペクトル上の微細構
造であり、第2項はスペクトル包絡線である。両者の逆
フーリエ変換には大きな違いがあり、第1項は高ケフレ
ンシーのピークとなり、第2項は0から2〜4ms程度
の低ケフレンシー部に集中する。高ケフレンシー部を用
いてフーリエ変換することによって対数スペクトル包絡
線が求まり、更に、それを指数変換すればスペクトル包
絡線が求まる。求まるスペクトル包絡線の平滑さの度合
いは、低ケフレンシー部のどれだけの成分を用いるかに
よって変化する。ケフレンシー成分を分離する操作をリ
フタリングと呼ぶ。
表したものである。このケプストラム装置26は、対数
変換部261と、逆FFT部262と、ケプストラム窓
263と、ピーク抽出部264と、FFT部265とを
備えている。なお、ケプストラム窓263、ピーク抽出
部264と、FFT部265は、ニューロン素子網22
の入力層に供給するデータとして、逆FFT部262で
求めたケプストラムデータを使用する場合には不要であ
り、スペクトル包絡をニューロン素子網22の入力デー
タとして使用する場合に必要となる。また、FFT部2
65については、必ずしも必要ではなく、FFT装置2
1を使用するようにしてもよい。
されるスペクトルデータX(ω)から、数式(1)に従
って対数変換を行い、log|X(ω)|を求め、逆F
FT部262に供給する。逆FFT部262では、供給
された値について、更に逆FFTをとり、c(τ)を算
出することで、ケプストラムデータを求める。逆FFT
部262では、求めたケプストラムデータを、音声デー
タについての学習または音声認識を行う入力データIn
として、第1実施形態または第2実施形態で説明したニ
ューロン素子網22の入力層に供給するようになってい
る。ニューロン素子網22に入力する入力データInの
数については、音声認識に併せて任意に選択された入力
層のニューロン素子数と同数が選択される。すなわち、
図13に示したニューロン素子網22の場合、入力層I
nのニューロン素子が30あるので、ケフレンシー
(τ)軸を30分割し、各ケフレンシー毎のパワーの値
を入力データIn1〜In30として、入力層に供給す
る。この逆FFT部262で求めたケプストラムデータ
を入力層に供給するのが、第3実施形態における第1例
である。
て説明する。この第2例では、ケプストラム窓263に
おいて求めたケプストラムデータに対してリフタリング
を行うことで、ケフレンシー成分を高ケフレンシー部と
低ケフレンシー部に分離する。分離された低ケフレンシ
ー部は、FFT部265において、フーリエ変換するこ
とによって対数スペクトル包絡線が求められ、更に、指
数変換することでスペクトル包絡線が求められる。この
スペクトル包絡データから、周波数軸軸をニューロン素
子の数に対応して分割し、各周波数毎のパワーの値を入
力層Inに供給する。
た、低ケフレンシー部のケプストラムデータを入力デー
タとして入力層Inに供給するようにしてよもい。ま
た、分離された高ケフレンシー部のケプストラムデータ
から、ピーク抽出部264で基本周期を抽出し、これ
を、FFT部265で求めたスペクトル包絡のデータと
共に入力データの1つとして使用してもよい。こ場合、
入力層Inのニューロン素子数がN個とすると、スペク
トル包絡のデータから(N−1)の入力データIn1〜
In(N−1)を入力層Inに入力し、基本周期のデー
タから入力データInNを入力層Inに入力する。
ば、音声データにいてのケプストラムデータを使用する
ことで、パワースペクトルよりも一層音声の特徴を捕ら
えたデータを認識対象とするので、認識率が向上する。
なお、第3実施形態では音声認識について説明したが、
画像データのケプストラムデータを使用して画像認識を
行うようにしてもよい。この場合の画像データは、画像
読取装置24で読み取られた画像データ、および通信制
御装置15で受信した画像データのいずれを用いてもよ
い。
実施形態では、ニューロン素子網22の入力層Inへの
入力データとしてケプストラムデータ用いたが、この第
4実施形態では、入力データとして、自己連想(オート
アソシエーション)型ニューラルネットワークにおける
中間層のデータを用いるものである。
型NN(ニューラルネットワーク)を用いたニューラル
ネットワークのシステム構成を表したものである。この
図に示すように、ニューラルネットワークでは、第2実
施形態のシステムに更に、自己連想型NN27を備えて
いる。第4実施形態におけるRAM14は、ニューロン
素子網22用の入力データを格納するベクトル列格納エ
リアの外に、さらに自己連想NN用ベクトル列格納エリ
アが確保されている。なお、その他の部分については第
2実施形態と同様なので、同一の番号を付してその説明
を省略する。また、ニューロン素子網22については、
第1実施形態および第2実施形態で説明したニューロン
素子網22だけでなく、さらに第1および第2実施形態
の変形例として説明したニューロン素子網22の、いず
れのニューロン素子網22を適用することも可能であ
る。
ものである。この図24に示すように、自己連想型NN
は、入力層AIと中間層AHおよび出力層AOの3層を
備えている。入力層AIは、音声認識や、図形認識等の
各種処理に対応して任意に選択される入力データ数pに
応じた数p個のニューロン素子AI1〜AIpを備えて
いる。中間層AHは、入力層AHのニューロン素子の数
p個よりも少ない数p個のニューロン素子AH1〜AH
q(q<p)を備えている。出力層AOは、入力層AH
と同数p個のニューロン素子AO1〜AOpを備えてい
る。
Hqは、入力層AIの全ニューロン素子との間で、学習
時に変更可能な結合重みAW11〜AWpqで完全結合
している。また中間層AHの各ニューロン素子AH1〜
AHqは、それぞれ学習段階で変更可能な閾値を備えて
いる。中間層AHの各ニューロン素子AH1〜AHq
は、入力層AIに入力された入力データと、結合重みA
Wと、閾値に基づいて、順伝播活性による出力値を出力
するようになっている。このAH1〜AHqの出力値
は、ニューロン素子網22の入力層Inに入力する入力
データStとして出力されるようになっている。また、
出力層AOの各ニューロン素子AO1〜AOpは、中間
層AHの全ニューロン素子AH1〜AHqとの間で、学
習時に可変な結合重みAw11〜Awqpで完全結合し
ている。そして、各ニューロン素子AO1〜AOpは、
中間層AHの出力値Stと結合重みAwとから、自己連
想型NNの出力値を出力するようになっている。
を備えており、このメモリに入力層AIと中間層AHと
の結合重みAW、閾値、および中間層AHと出力層AO
との結合重みを格納するようになっている。
ロン素子網22に入力する入力データStの生成につい
て、音声認識の場合を例に説明する。いま音声認識の対
象となる各音素のうち、音素“あ”についての学習を行
う場合につてい説明する。学習対象となる音素「a」に
ついては、言葉の最初に発声場合の音素を“あ”で表
し、言葉の最後に発声される場合の音素を“ア”で表
し、言葉の途中に発声される場合の音素を“A”で表す
ものとする。例えば、“あ”は、aki(秋)からと
り、“ア”はdenwa(電話)からとり、“A”はt
omari(泊まり)からとる。なお、以下の説明にお
いては、音素「あ」について、“あ”、“ア”、“A”
の3パターンによる音素「a」の学習を例に説明する
が、各音素について3〜30パターン、好ましくは10
0パターン程度による学習が行われる。
“ア”、“A”について、FFT装置21で各時間t
(t=1、2、…)毎に、FFT処理によりスペクトル
解析したデータを表したものである。FFT装置21
は、各音素“あ”、“ア”、“A”について、それぞれ
図25(a)、(b)、(c)に示すように、各時間t
毎に音声データの、各周波数(周波数の分割数は、入力
層AIのニューロン素子の数pに対応して、F1〜Fp
のp個である)に対するパワー(P)の値を算出する。
そして、各周波数のパワーP(t)によるベクトル列
は、第2実施形態について図18で説明したと同様に、
各時間毎に、RAM14の自己連想NN用ベクトル列格
納エリアに格納される。
素“あ”についてスペクトル解析された、時刻t=1に
おけるパワーP(1)のベクトル列をあ1とし、時刻t
=2におけるパワーP(2)のベクトル列をあ2とし、
同様に、図示しないが、時刻t=nのベクトル列をあn
とする。また、図25(b)に示されるように、音素
“ア”についてスペクトル解析された、時刻t=1にお
けるパワーP(1)のベクトル列をア1とし、時刻t=
2におけるパワーP(2)のベクトル列をア2とし、同
様に、図示しないが、時刻t=nのベクトル列をあnと
する。また、図25(c)に示されるように、音素
“A”についてスペクトル解析された、時刻t=1にお
けるパワーP(1)のベクトル列をA1とし、時刻t=
2におけるパワーP(2)のベクトル列をA2とし、同
様に、図示しないが、時刻t=nのベクトル列をAnと
する。
れたパワーP(t)の各時刻毎に、自己連想型NN27
の学習と、ニューロン素子網22にの入力層INに供給
する入力データの生成が行われる。すなわち、同一時
刻、例えばt=1における各音素のベクトル列あ1、ア
1、A、を自己連想型NN27の入力層AIの入力デー
タとする共に、出力層AOの教師信号として使用するこ
とで、各時刻tのベクトル列毎に学習を行なう。そし
て、時刻tについての学習が終了した時点での中間層A
Hからの一方の出力値Stを入力層INの入力データと
する。なお、自己連想型NN27における学習は、例え
ばバックプロパゲーション則等による各種学習が適用さ
れる。
る入力データと教師信号、学習終了後の出力値Stにつ
いて表したものである。この図26では、図25に示し
た各音素に対するパワーのベクトル列に基づいて学習す
る場合を例に示している。この図26に示されるよう
に、各時刻t(t=1、2、…n)を単位として学習が
行われ、入力データStが生成される。例えば、時刻t
1の場合であれば、教師信号をあ1として入力データあ
1とア1とA1について学習を行い、次に、教師信号を
ア1として、入力データあ1とア1とA1について学習
を行い、更に、教師信号をA1として、入力データあ1
とア1とA1について学習を行う。これら、全組み合わ
せについての学習が終了した後に、あ1、ア1、A1の
いずれかのデータを入力層AIに入力し、このときの中
間層AHの出力値から、時刻t=1におけるニューロン
素子網22の入力層Inへの入力データS1が生成され
る。同様にして、あ2、ア2、A2による入力データと
教師信号の全組み合わせによる学習から、時刻t=2に
おける入力層Inへの入力データS2が生成され、さら
に、S3、S4、…、Snも同様にして生成される。
力データSt(t=1、2、…、n)に従って、ニュー
ロン素子網22による学習が行われる。第2実施形態の
ニューロン素子網22の場合、この入力データStが、
音声入力層Inと音声出力層Ouに入力される。すなわ
ち、時刻t=iのスペクトルデータについて学習を行う
場合、入力データSiのベクトル列が音声入力層Inに
入力され、入力データS(i+1)のベクトル列が教師
信号として音声出力層Ouに入力される。なお、仮説出
力層Hyへの教師信号(入力データSt生成のための音
素を示す符号列)の入力、および、各中間層Hiと各環
帰入力層Coの追加につては、第2実施形態で説明した
と同様に行われる。一方、第1実施形態のニューロン素
子網22の場合、入力データStが順次入力層Inに入
力される。出力層Ouに入力される教師信号としては、
入力データSt生成のための音素を示す符号列が入力さ
れる。
びニューロン素子網22の学習が終了すると、次のよう
にして、実際の音声認識が行われる。まず、認識対象と
なる音声が音声入力装置23から入力されると、FFT
装置21でスペクトル解析が行われ、各時間t毎の、各
周波数に対するパワーP(t)のベクトル列が順次求ま
る。このベクトル列は、各時間毎に、RAM14の自己
連想NN用ベクトル列格納エリアに格納される。
のスペクトル解析が終了した後のベクトル列P(t)
を、順次自己連想型NN27の入力層AIに入力する。
自己連想型NN27では、入力されたベクトル列P
(t)に対する中間層AHの出力ベクトルを、その時刻
tにおける入力データStとしてニューロン素子網22
に出力する。この各時刻t(t=1、2、…n)毎の入
力データS(t)が、第1実施形態のニューロン素子網
22の場合には入力層Inに、第2実施形態のニューロ
ン素子網22の場合には音声入力層Inに、それぞれ順
次入力される。そして、入力データに対応する出力値
が、第1実施形態のニューロン素子網22では出力層O
uのニューロン素子から、第2実施形態のニューロン素
子網22では仮説出力層Hyのニューロン素子から、そ
れぞれ出力される。そして、各ニューロン素子からの出
力値と、ROM13に格納されている第2教師信号の各
符号列とを照合することで、CPU11は該当音素を特
定し、RAM14に格納する。
うに、各音素について複数のベクトル列P(tn)に解
析され、時系列的に音声入力層Inに入力されて特定さ
れるため、複数の音素列となる。すなわち、音声「い
ろ」が入力された場合には、例えば「iiiiirrr
ooooo」となる。そこで、CPU11は、このRA
M14に格納された音素列から、入力された音声を「i
ro」と認識する。そしてCPU11は、キーボード1
8からの入力指示に応じて、認識した音声を日本語変換
システムに従って文字による文章に変換し、また通信制
御装置5および通信網2を介して、パーソナルコンピュ
ータやワードプロセッサ等の各種通信制御装置にデータ
伝送を行う。
自己連想型NN27を使用することによって、ニューロ
ン素子網22に入力するベクトル列が小さくなり、第1
実施形態の入力層Inや第2実施形態の音声入力層In
のニューロン素子数を少なくすることができる。従っ
て、ニューロン素子網22の構成を小さくすることがで
きる。
型NN27の学習において、音素の各パターンについて
の入力データと教師信号の全組み合わせを学習対象とし
ているため、中間層AHは、その音素についての一般化
されたベクトル列St(t=1〜n)を生成することが
できる。なお、全音素の各パターンについての組み合わ
せでなくても、入力層AIの入力データおよび出力層A
Oの教師信号として、同一のパターンを使用するように
してもよい。
習および認識の際に自己連想型NN27の入力層AIに
入力するデータとして、FFT装置21でスペクトル解
析されたデータを用いた。これに対して、第3実施形態
で説明した、ケプストラムデータを自己連想型NN27
の入力層AIに入力することで、ニューロン素子網22
の入力データStを生成するようにしてよもい。
を行う際に、FFT装置21でスペクトル解析されたベ
クトル列P(t)を順次自己連想型NN27の入力層A
Iに入力し、中間層AHの出力ベクトルを時刻tにおけ
る入力データStとして直ちにニューロン素子網22に
出力するようにした。これに対して、自己連想型NN2
7を、不特定話者用に学習したニューロン素子網22に
よって、ある特定話者による音声の認識が可能か否かを
判定するフィルタとして使用することができる。すなわ
ち、ニューロン素子網22の学習で使用された不特定話
者用のデータを使用した特定のキーワードについて、予
め自己連想型NN27の不特定話者認識用の学習を行っ
ておく。そして、特定話者は、音声認識を行う際に、キ
ーワードを発声し音声入力装置23に入力する。入力さ
れたキーワードは、FFT装置21でスペクトル解析さ
れて自己連想型NN27の入力層AIに入力され、中間
層AHの出力値から、入力データStが生成される。こ
の特定話者の入力データStを、不特定話者用に学習し
た際のStとを比較し、両者が大きく異なっている場合
には、その特定話者の音声を不特定話者用の入力ニュー
ロン素子網22で認識することが困難であると判断する
ことができる。なお、不特定話者音声について学習済の
自己連想型NN27に、特定話者による任意音声のスペ
クトルデータを入力し、出力層AOからの出力データ
と、入力データとを比較し、自己連想が略できているか
否かを判断することで、その特定話者の音声についての
認識が可能か否かを判断するようにしてもよい。
が可能なニューラルネットワークを提供することができ
る。
トワークのシステム構成図である。
状態を示す説明図である。
ューロン素子間の結合重みを格納する結合重みテーブル
を示す説明図である。
により学習する図形○1を表した説明図である。
いての学習を行うためのニューロン素子網の構成図であ
る。
フローチャートである。
Himp=Hi11を追加したニューロン素子網と結合
重みテーブルを表した説明図である。
ン素子が更に追加された状態を表した説明図である。
ン素子が更に追加された状態を表した説明図である。
ロン素子Hi21を新たに追加した状態を表した説明図
である。
習が終了後におけるニューロン素子網と結合重みテーブ
ルの状態を表した説明図である。
ネットワークを利用した音声認識装置のシステム構成図
である。
ロン素子網の初期状態を説明する説明図である。
ロン素子網による学習途中を説明するための説明図であ
る。
ニューロン素子間の結合重みを格納する結合重みテーブ
ルを示す説明図である。
する第2教師信号テーブルの内容を示す説明図である。
声のスペクトル解析の状態を説明する説明図である。
装置によりスペクトル解析された音声についてのベクト
ル列を表す説明図である。
定した音声「まえ」についての各音素の分布を示す説明
図である。
ロン素子網の変形例を示すシステム構成である。
ットワークのシステム構成図である。
成図である。
NNを用いたニューラルネットワークのシステム構成図
である。
図である。
“ア”、“A”のスペクトル解析したデータを示す説明
図である。
習時の入力データと教師信号、入力データStの関係を
表す説明図である。
Claims (8)
- 【請求項1】 入力層ニューロン素子を複数有する入力
層と、 出力層ニューロン素子を複数有する出力層と、 所定のカテゴリのうちのいずれか1のカテゴリに分類さ
れ、前記入力層の入力層ニューロン素子と結合重みWで
結合すると共に、前記出力層の出力層ニューロン素子と
結合重みwで結合する中間層ニューロン素子を、複数有
する中間層と、 あるカテゴリについての学習を行う場合に、他のカテゴ
リに属する中間層ニューロン素子と、入力層ニューロン
素子との結合重みW、および出力層ニューロン素子との
結合重みwを固定し、学習対象となるカテゴリの中間層
ニューロン素子との結合重みW、wを調整することで学
習を行う学習手段と、 この学習手段による学習の際に、あるカテゴリに属する
学習用入力データに対して学習不可状態になった場合
に、その学習用入力データが属するカテゴリの中間層ニ
ューロン素子を追加する中間層ニューロン素子追加手段
と、 を具備することを特徴とするニューラルネットワーク。 - 【請求項2】 前記学習手段は、さらに学習対象となっ
ているカテゴリの既存の中間層と入力層との結合重みW
を固定し、 前記中間層ニューロン素子追加手段による追加された新
たな中間層ニューロン素子の結合重みWとw、および学
習対象となっているカテゴリの既存の中間層ニューロン
素子の結合重みwを調整することで学習を行うことを特
徴とする請求項1に記載のニューラルネットワーク。 - 【請求項3】 それぞれ異なるカテゴリ毎に別個独立し
て学習が行われた複数の中間層と、 この複数の中間層の各中間層ニューロン素子と結合重み
Wで結合した、入力層ニューロン素子を複数有する入力
層と、 前記複数の中間層の各中間層ニューロン素子と結合重み
wで結合した、出力層ニューロン素子を複数有する出力
層と、 前記入力層の入力層ニューロン素子と結合重みW′で結
合し、前記出力層の出力層ニューロン素子と結合荷重
w′で結合した調整用中間層と、 前記複数の中間層における前記結合重みWと結合重みw
を固定し、前記調整用中間層の結合重みW′とw′を調
整することで、前記複数の中間層の学習に使用した学習
用入力データにより、ネットワーク全体の学習を再度行
う学習手段と、 この学習手段による学習の際に学習不可状態になった場
合に、前記調整用中間層の中間層ニューロン素子を追加
する中間層ニューロン素子追加手段と、を具備すること
を特徴とするニューラルネットワーク。 - 【請求項4】 前記中間層の中間層ニューロン素子と結
合重みvで結合した仮説出力層ニューロン素子を複数有
する仮説出力層を備え、 前記学習手段は、複数のベクトル列Fn(n=1、2、
3、…)の集合が特定のカテゴリに属する意味Aを表す
データについて、ベクトル列Fnを入力層に入力し、ベ
クトル列Fn+1を第1教師信号として前記出力層に入
力し、特定の意味Aを第2教師信号として前記仮説出力
層に入力することで、学習を行うことを特徴とする請求
項1、請求項2、または請求項3に記載のニューラルネ
ットワーク。 - 【請求項5】 前記中間層の中間層ニューロン素子と結
合し、その出力ベクトル列が前記中間層に供給される環
帰層ニューロン素子を複数有する環帰層を備え、 前記学習手段は、複数のベクトル列Fnの集合が特定の
カテゴリに属する意味Aを表すデータについて、ベクト
ル列Fn−1に対する前記中間層または前記出力層の出
力ベクトル値を前記環帰入力層に入力し、ベクトル列F
nを前記入力層に入力し、ベクトル列Fn+1を第1教
師信号として前記出力層に入力し、特定の意味Aを第2
教師信号として前記仮説出力層に入力することで、学習
を行うことを特徴とする請求項4に記載のニューラルネ
ットワーク。 - 【請求項6】 前記学習手段は、バックプロパゲーショ
ン則により学習することを特徴とする請求項1から請求
項5のうちのいずれか1の請求項に記載されたニューラ
ルネットワーク。 - 【請求項7】 前記特定の意味Aが音声を構成する音素
であり、複数のベクトル列Fnが、時系列的に解析され
た特定の意味Aについての特徴量を表すベクトル列であ
ることを特徴とする請求項4または請求項5に記載のニ
ューラルネットワーク。 - 【請求項8】 前記特定の意味Aについての特徴量を表
すベクトルとして、音声のスペクトルデータ、ケプスト
ラムデータ、または自己連想型ニューラルネットワーク
の中間層の出力値データを使用することを特徴とする請
求項7に記載のニューラルネットワーク。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP23606295A JP3737841B2 (ja) | 1995-08-22 | 1995-08-22 | ニューラルネットワーク |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP23606295A JP3737841B2 (ja) | 1995-08-22 | 1995-08-22 | ニューラルネットワーク |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH0962644A true JPH0962644A (ja) | 1997-03-07 |
| JP3737841B2 JP3737841B2 (ja) | 2006-01-25 |
Family
ID=16995169
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP23606295A Expired - Fee Related JP3737841B2 (ja) | 1995-08-22 | 1995-08-22 | ニューラルネットワーク |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP3737841B2 (ja) |
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2009516246A (ja) * | 2005-11-15 | 2009-04-16 | ベルナデット ガーナー | ニューラルネットワークのトレーニング方法 |
| JP2012014617A (ja) * | 2010-07-05 | 2012-01-19 | Honda Motor Co Ltd | ニューラルネットワーク学習装置 |
| JP2016004547A (ja) * | 2014-06-19 | 2016-01-12 | ヤフー株式会社 | 算出装置、算出方法及び算出プログラム |
| JP2019033234A (ja) * | 2017-08-10 | 2019-02-28 | 株式会社半導体エネルギー研究所 | 半導体装置、および電子機器 |
| WO2019167884A1 (ja) * | 2018-02-28 | 2019-09-06 | 富士フイルム株式会社 | 機械学習方法及び装置、プログラム、学習済みモデル、並びに判別装置 |
| CN111611892A (zh) * | 2020-05-14 | 2020-09-01 | 青岛翰林汇力科技有限公司 | 应用神经网络的综合性智能深度学习方法 |
| US12068767B2 (en) | 2020-09-17 | 2024-08-20 | Nec Corporation | Parameter determination apparatus, signal transmission apparatus, parameter determination method, signal transmission method and program recording medium |
-
1995
- 1995-08-22 JP JP23606295A patent/JP3737841B2/ja not_active Expired - Fee Related
Cited By (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11263528B2 (en) | 2005-11-15 | 2022-03-01 | Bernadette Garner | Neural network, computer readable medium, and methods including a method for training a neural network |
| JP2013020638A (ja) * | 2005-11-15 | 2013-01-31 | Garner Bernadette | 入力ベクトルがニューロンによって既知であるか未知であるかを決定する方法 |
| JP2009516246A (ja) * | 2005-11-15 | 2009-04-16 | ベルナデット ガーナー | ニューラルネットワークのトレーニング方法 |
| JP2012014617A (ja) * | 2010-07-05 | 2012-01-19 | Honda Motor Co Ltd | ニューラルネットワーク学習装置 |
| JP2016004547A (ja) * | 2014-06-19 | 2016-01-12 | ヤフー株式会社 | 算出装置、算出方法及び算出プログラム |
| US10346742B2 (en) | 2014-06-19 | 2019-07-09 | Yahoo Japan Corporation | Calculation device, calculation method, and recording medium |
| JP2019033234A (ja) * | 2017-08-10 | 2019-02-28 | 株式会社半導体エネルギー研究所 | 半導体装置、および電子機器 |
| WO2019167884A1 (ja) * | 2018-02-28 | 2019-09-06 | 富士フイルム株式会社 | 機械学習方法及び装置、プログラム、学習済みモデル、並びに判別装置 |
| JPWO2019167884A1 (ja) * | 2018-02-28 | 2021-02-12 | 富士フイルム株式会社 | 機械学習方法及び装置、プログラム、学習済みモデル、並びに判別装置 |
| US11929174B2 (en) | 2018-02-28 | 2024-03-12 | Fujifilm Corporation | Machine learning method and apparatus, program, learned model, and discrimination apparatus using multilayer neural network |
| CN111611892A (zh) * | 2020-05-14 | 2020-09-01 | 青岛翰林汇力科技有限公司 | 应用神经网络的综合性智能深度学习方法 |
| CN111611892B (zh) * | 2020-05-14 | 2024-03-19 | 龙立强人工智能科技(苏州)有限公司 | 应用神经网络的综合性智能深度学习方法 |
| US12068767B2 (en) | 2020-09-17 | 2024-08-20 | Nec Corporation | Parameter determination apparatus, signal transmission apparatus, parameter determination method, signal transmission method and program recording medium |
Also Published As
| Publication number | Publication date |
|---|---|
| JP3737841B2 (ja) | 2006-01-25 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JPH08227410A (ja) | ニューラルネットワークの学習方法、ニューラルネットワークおよびニューラルネットワークを利用した音声認識装置 | |
| CN111916111B (zh) | 带情感的智能语音外呼方法及装置、服务器、存储介质 | |
| US5638486A (en) | Method and system for continuous speech recognition using voting techniques | |
| US5596679A (en) | Method and system for identifying spoken sounds in continuous speech by comparing classifier outputs | |
| EP4177882B1 (en) | Methods and systems for synthesising speech from text | |
| US5566270A (en) | Speaker independent isolated word recognition system using neural networks | |
| AU684214B2 (en) | System for recognizing spoken sounds from continuous speech and method of using same | |
| US5594834A (en) | Method and system for recognizing a boundary between sounds in continuous speech | |
| El Choubassi et al. | Arabic speech recognition using recurrent neural networks | |
| Al Anazi et al. | A machine learning model for the identification of the holy quran reciter utilizing k-nearest neighbor and artificial neural networks | |
| Sunny et al. | Recognition of speech signals: an experimental comparison of linear predictive coding and discrete wavelet transforms | |
| Sarma et al. | An ANN based approach to recognize initial phonemes of spoken words of Assamese language | |
| Boulanger-Lewandowski et al. | Exploiting long-term temporal dependencies in NMF using recurrent neural networks with application to source separation | |
| JP3014177B2 (ja) | 話者適応音声認識装置 | |
| JP3737841B2 (ja) | ニューラルネットワーク | |
| JPH09212197A (ja) | ニューラルネットワーク | |
| Selouani | Speech processing and soft computing | |
| Venkateswarlu et al. | Speech recognition by using recurrent neural networks | |
| Venkateswarlu et al. | Developing efficient speech recognition system for Telugu letter recognition | |
| Agrawal et al. | Robust raw waveform speech recognition using relevance weighted representations | |
| JP3571821B2 (ja) | 音声認識装置および単語構成要素の辞書並びに隠れマルコフモデルの学習方法 | |
| Gebreegziabher et al. | A Light-weight Convolutional Neural Network based Speech Recognition for Spoken Content Retrieval Task | |
| Wu et al. | Statistical voice conversion with quasi-periodic wavenet vocoder | |
| Binh et al. | A high-performance speech-recognition method based on a nonlinear neural network | |
| Kaewprateep et al. | Evaluation of small-scale deep learning architectures in Thai speech recognition |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20050621 |
|
| A521 | Written amendment |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20050818 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20051018 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20051028 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20091104 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20101104 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20101104 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20111104 Year of fee payment: 6 |
|
| LAPS | Cancellation because of no payment of annual fees |