JPH08335091A - 音声認識装置、および音声合成装置、並びに音声認識合成装置 - Google Patents
音声認識装置、および音声合成装置、並びに音声認識合成装置Info
- Publication number
- JPH08335091A JPH08335091A JP7142870A JP14287095A JPH08335091A JP H08335091 A JPH08335091 A JP H08335091A JP 7142870 A JP7142870 A JP 7142870A JP 14287095 A JP14287095 A JP 14287095A JP H08335091 A JPH08335091 A JP H08335091A
- Authority
- JP
- Japan
- Prior art keywords
- analysis
- sound
- speech
- recognition
- time
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Abandoned
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/02—Methods for producing synthetic speech; Speech synthesisers
- G10L13/04—Details of speech synthesis systems, e.g. synthesiser structure or memory management
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
- G10L2015/025—Phonemes, fenemes or fenones being the recognition units
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
- G10L25/15—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being formant information
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Manipulator (AREA)
- Electrophonic Musical Instruments (AREA)
Abstract
い音素を用いて、言語を構築することができるようにす
る。 【構成】 音響信号分析部101に供給された、雑音や
妨害音のある環境において分離しやすい音素からなる音
響信号は、そこで分析され、音名認識部102におい
て、その分析結果から音名が認識され、さらに所定のセ
ンテンスとして認識された後、発話生成部103に供給
される。それに対応して、発話生成部103は、雑音や
妨害音のある環境において分離しやすい音素からなる音
名で構成された所定の時系列を生成し、音響信号生成部
104に供給する。音響信号生成部104においては、
それに対応する音響信号が合成され、出力される。
Description
音声合成装置、並びに音声認識合成装置に関し、可聴帯
域の音響信号を認識または合成する場合に用いて好適な
音声認識装置、および音声合成装置、並びに音声認識合
成装置に関する。
をする場合、従来は、音声認識と音声合成を組み合わせ
て、機械が自然言語(日本語、英語など)を認識し、単
語あるいは文章を音声信号に変換して自然言語で答える
というシステムを構築する。しかしながら、従来の音声
認識では、雑音や妨害音の影響により認識率が悪化する
ため、その対策として次のような手法が提案されてい
る。
が混入しないようにするものがある。例えば、指向性の
あるマイクを用い、それを音源の方向に向け、雑音を低
減したりする方法がある。特開昭59−012500は
この例である。
定し、それらを引き去るものがある。例えば、周波数変
換などの前処理において、背景雑音のスペクトル成分を
引き算し、その影響を取り除くようなスペクトルサブト
ラクションとよばれる手法がある。特開昭57−212
496はこの例である。また、適応信号処理を用いて、
雑音のみを採取できる条件であれば、雑音にフィルタを
かけて、音声と雑音が混入したものからそれを引き去る
ものも存在する。
適当な写像を用いて比較的両者の距離が大きくなるよう
な空間にマッピングし、認識対象の音声を認識する方法
がある。例えば、特開平2−15718「神経回路網モ
デルを用いた雑音除去装置」では、多層構造の神経回路
網に、入力を雑音が混入した音声、出力を雑音無しの音
声として写像を学習させ、雑音を除去する装置が示され
ている。また、特開昭60−75898には、音声ピッ
チの調波成分のみを検出し、騒音下における単語認識性
能の劣化を防止する方法が示されている。
由度という観点から考えると、使用環境において、適切
な集音の方法を与えることにより妨害音を除去する方
法、適切な信号処理により妨害音を除去する方法、また
は適切な写像を選ぶことにより音声と妨害音を分離する
方法であるということがいえる。
方として、自然言語を前提とするものは従来から開示さ
れている。自然言語を用いないと考えられるものとし
て、特開昭54−153070では、時計の時刻を自然
言語ではなく、「ドレミファ...、」などの音と数字
を1対で対応させることで時刻を知らせるという装置を
開示している。これは、自然言語を用いない機械から人
間への情報の伝え方であるが、人間から機械への情報伝
達は音声にはよらず、会話システムではない。
て、特開昭61−110837では手叩きや笛で遠隔操
作ができるようにした装置を開示している。この請求項
1では、「離れた所から電源のON、OFFやその他の
制御が可能な、遠隔制御式空気調和機の制御方式に於い
て、一定時間内に任意の数の音波を断続入力することに
より、空気調和機の運転、停止を行なうことを特徴とす
る空気調和機の制御方式」となっている。背景としてワ
イヤレスリモコン(ワイヤレスリモートコントローラ)
では落としたり紛失したりするという欠点を挙げている
が、対雑音特性、対妨害音に関しての音素の設計に関し
ては述べられていない。また、この例も人間から機械へ
の一方向の情報伝達であり、会話システムではない。
の自由度という観点から考えると、 (1) 集音の方法を与え、妨害音を除去する。 (2) 適切な信号処理により、妨害音を除去する。 (3) 適切な写像を選ぶことにより、音声と妨害音を
分離する。 という観点で設計の最適化が計られている。
語を用いた音声認識、音声合成では会話システムは開示
されているが、現状において、自然言語による自然な会
話は技術的にはまだ困難である。特に認識に関しては対
妨害音、対雑音特性もあわせると通常のオフィスや家庭
の環境の中では、非常に困難である課題があった。
は認識装置はそれぞれ単独で開示されているが、それら
は対妨害、対雑音特性の向上のために導入されたもので
はなく、従って、会話システムをそこから推測すること
はできない課題があった。
ものであり、対妨害音、対雑音特性を考慮に入れ、かつ
1つ以上の機械と1人以上の人間が互いに伝達情報を確
認可能な会話システムを実現することができるようにす
るものである。
識装置は、雑音や妨害音が存在する環境で音声認識を行
う音声認識装置において、雑音や妨害音と分離が容易な
音響特性を有する音素あるいは音素の時系列より構成さ
れた音を分析する分析手段を備えることを特徴とする。
分析空間に所定の順序でそれぞれ並べたとき、分析結果
の特徴点の位置は、分析空間と時間軸で構成された時系
列分析空間において、所定の規則に従った動きをするよ
うにすることができる。
大値あるいは極小値より選ばれた点であるようにするこ
とができる。
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
囲以上に変化しないようにすることができる。
る。
うにすることができる。
を含む認識手段をさらに設け、認識手段により、分析手
段による分析結果に対応する音が認識されるようにする
ことができる。
や妨害音が存在する環境で音声合成を行う音声合成装置
において、雑音や妨害音と分離が容易な音響特性を有す
る音素あるいは音素の時系列より構成された音を合成す
る合成手段を備えることを特徴とする。
を、所定の次元の分析空間に所定の順序でそれぞれ並べ
たとき、分析結果の特徴点の位置は、分析空間と時間軸
で構成された時系列分析空間において、所定の規則に従
った動きをするようにすることができる。
大値あるいは極小値より選ばれた点であるようにするこ
とができる。
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
囲以上に変化しないようにすることができる。
る。
雑音や妨害音が存在する環境で音声認識と音声合成を行
う音声認識合成装置において、雑音や妨害音と分離が容
易な音響特性を有する音素あるいは音素の時系列より構
成された音を分析する分析手段と、雑音や妨害音と分離
が容易な音響特性を有する音素あるいは音素の時系列よ
り構成された音を合成する合成手段を備えることを特徴
とする。
元の分析空間に所定の順序でそれぞれ並べたとき、分析
結果の特徴点の位置は、分析空間と時間軸で構成された
時系列分析空間において、所定の規則に従った動きをす
るようにすることができる。
は極小値より選ばれた点であるようにすることができ
る。
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
囲以上に変化しないようにすることができる。
る。
うにすることができる。
を含む認識手段をさらに設け、認識手段により、分析手
段による分析結果に対応する音が認識されるようにする
ことができる。
析手段により、雑音や妨害音と分離が容易な音響特性を
有する音素あるいは音素の時系列より構成された音の分
析が行われる。従って、妨害音あるいは雑音の影響を受
けずに目的の音を検出あるいは認識することができる。
は、合成手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音が合成される。従って、妨害音あるいは雑音の影響を
受け難い目的の音を合成することができる。
いては、分析手段により、雑音や妨害音と分離が容易な
音響特性を有する音素あるいは音素の時系列より構成さ
れた音の分析が行われ、合成手段により、雑音や妨害音
と分離が容易な音響特性を有する音素あるいは音素の時
系列より構成された音が合成される。従って、妨害音あ
るいは雑音の影響を受けずに目的の音を検出あるいは認
識することができ、妨害音あるいは雑音の影響を受け難
い目的の音を合成することができる。
実施例の全体の構成を示すブロック図である。この実施
例において、音響信号分析部101(分析手段)は、時
間tの関数とみなせる入力の音響信号g(t)を分析す
る。音名認識部102(認識手段)は、音響信号分析部
101からの出力をさらに解析して、音名を認識する。
発話生成部103(合成手段)は、音名認識部102の
認識結果により、同様に音名を用いて所定のメッセージ
を作りだす。音響信号合成部104は発話生成部103
により作成されたメッセージを音響信号に変換するよう
になされている。
マイクロフォンなどにより検出された音響信号g(t)
は、音響信号分析部101に入力され、そこで周波数分
析が行われ、音名認識部102にその周波数構造に対応
するデータが供給される。音名認識部102において
は、音響信号g(t)の周波数構造に基づいて、例えば
音楽でいうところのドレミ...、などの音名が検出さ
れ、その時系列より音楽の和音のアルペジオ表現として
コードが認識され、対応する単語あるいはセンテンスと
して認識される。
102の認識結果および発話生成部103内部の内部状
態により、同じく音名で構成された時系列が生成され、
音響信号合成部104に供給される。音響信号合成部1
04においては、発話生成部103からの結果が音響信
号に変換され、スピーカなどを駆動する信号として出力
される。
のことで、C,D,E,...という表現も用いられ
る。コードとは和音のことであるが、この実施例では分
散和音あるいはアルペジオと呼ばれる、タイミングをず
らして和音の構成音を順次出力してできる音の時系列の
ことである。
加える。図2は音響信号分析部101の詳細な構成を示
すブロック図である。A/D変換部201は、アナログ
の入力信号g(t)をデジタル信号g(k)に変換して
出力するようになされている。入力信号バッファ202
は、入力されたデジタル信号g(k)を記憶する。周波
数分析部203は、入力された信号に対してフーリエ変
換処理を施し、変換結果を出力するようになされてい
る。
/D変換部201に入力されると、A/D変換部201
において、それがデジタル信号g(k)に変換され、出
力される。ここでk=0,1,2,..,は標本化列の
indexである。
雑音防止のためのLow PassFilter(LP
F)と16bitで8kHzの標本化周波数をもつA/
D変換器より構成されている。このデジタル信号g
(k)は、入力信号バッファ202において512標本
(g(0),g(1),..,g(N−1),N=51
2として表す)がひとつのブロックとして蓄えられ、周
波数分析部203においてそのブロックがフーリエ変換
され、周波数分析が行なわれる。入力信号バッファ20
2より出力される信号(flg)は、入力信号バッファ
202に512個のデータが蓄えられたことを示す信号
であり、この信号(flg)が供給されたタイミング
で、周波数分析部203は512個のデータからなる1
つのブロックの信号(vect_g)を入力信号バッフ
ァ202より入力する。これは次の式1で表される。
表す。すなわち、vect_gは512行1列のマトリ
クス、あるいは列ベクトルである。周波数分析部203
でのフーリエ変換とは次の式2で表される処理である。
を時系列として扱うためのindexである。また、式
2においてvect_kernel(w)は次の式3で
表されるベクトルである。
率を表す。変数w=0,1,2,..,511は周波数
のindexである。実際の周波数は標本化周波数fs
に対応してfs×w/N(Nはブロックの長さ、この例
ではN=512)で表される。また、通常は信号のベク
トルvect_gに窓関数なるものを掛け算したのちに
式3の変換を行なうが、今回は簡単のため方形型の窓関
数を想定し、掛け算を省略している。
数、あるいは同じindexのフーリエ変換の出力があ
る程度の時間だけ継続することを、検出するべき音の特
徴として利用するため、式2のG(w,m)を変数w毎
に変数mに関してLow Pass Filterを施
すことにする。実際には、移動平均によりLow Pa
ss Filterの代用をする。すなわち、[G
(w,m)+G(w,m+1)+,..+G(w,m+
MM−1)]/MMを出力とする。この実施例では、変
数MM=3とする。以下、簡単のためこの値[G(w,
m)+G(w,m+1)+,..+G(w,m+MM−
1)]/MMをG(w,m)として表すものとする。
3に示す。音名認識部102はさらに3つの処理を行う
部分から構成されている。1番目は入力信号G(w,
m)より音名および音の大きさを検出する音名検出部3
01、次に検出された音名tone(m)よりそれを時
系列として音楽のコード(chord(l))を認識す
るコード認識部302、ただし、ここでl=0,
2,..,はコードを時系列データとしたときのind
exである。最後にchord(l)を時系列として捕
らえてコマンド解釈し、システムに対する入力センテン
ス(com(p))を出力するコマンド解釈部303で
ある。
る。音名検出部301は、音楽の音名に相当するものを
検出する。実際には、フーリエ変換のindexで代理
表現する。G(w,m)は、標本化周波数8000Hz
とフーリエ変換に用いた点が512点であることから、
式4で与えられる周波数分解能Δfをもつ。
2,...,は周波数の値としては、Δf×wに対応す
る。
るいはそれらの半音異なる音の周波数は、周波数440
Hzを基準のオクターブのラの周波数として、オクター
ブをlogスケールで12等分した周波数が割り当てら
れる。簡便のため、ドの音としてf_do_ref=1
30.81Hzを基準周波数としたときの場合を式5に
示す。
2,...,11はド、ド#、レ、レ#、...,シと
1オクターブ中の音名を周波数順にならべたinde
x、変数oct=..,−1,0,1,2,..は、f
_do_refと同じオクターブを0としたオクターブ
のindexである。ただし、この実施例では有効なオ
クターブは標本化周波数より4000Hz以上は識別で
きないものとし、また、周波数分解能Δf=15.62
5Hzから隣合う音の周波数が簡単に識別できるoct
=0(f_do_ref=f(0,0)を最低の周波数
として想定する)とする。すなわち、変数oct=0,
1,2,3,4とする。
ーチャートで示す。ステップS1において、音名検出部
301は、フーリエ変換の結果G(w,m)の最大値検
出を行なう。最大となるときの周波数のindexであ
るw=w_maxとする。次に、ステップS2に進み、
変換結果G(w,m)の絶対値の平均値mean=(|
G(0,m)|+|G(1,m)|+...+|G(5
11,m)|)/512を演算する。
換の結果の最大値の絶対値|G(w_max,m)|
が、変換結果|G(w,m)|の平均値meanより適
当な倍数A以上の大きさであるか否かを判定する。この
実施例では、例えば倍数A=3とする。フーリエ変換の
結果の最大値の絶対値|G(w_max,m)|が、変
換結果|G(w,m)|の平均値meanより倍数A以
上の大きさであると判定された場合、ステップS4に進
み、tone(m)=w_maxとする。また、音の大
きさlevel(m)=|G(w_max,m)|と定
義する。
値|G(w_max,m)|が、変換結果|G(w,
m)|の平均値meanより倍数A以上の大きさではな
いと判定された場合、ステップS5に進み、tone
(m)=−1として無効であることを示す。また、音の
大きさlevel(m)=|G(w_max,m)|と
定義する。
e(m)はフーリエ変換のindexそのものであるこ
とに注意する。すなわち、Δf×tone(m)が実際
の周波数を表し、これを音楽の音名に変換する必要があ
る。この変換は、次のコード認識部302において行な
われる。また、上述したように、音の大きさlevel
(m)=|G(w_max,m)|と定義し、後述のコ
ード認識部302において無音検出などを行なう。
コード認識部302の処理手順について説明する。ステ
ップS11において、後述する多数決フィルタにより、
tone(m)に対して揺らぎや雑音による誤検出の影
響を軽減する処理を施したf_tone(m)を求め
る。ここでは、音名検出部301の出力tone(m)
を時系列データとして扱う。m=0,1,2,..は標
本列512点を1ブロックとするため、標本化周波数を
8000Hzとすると、64msec(=1/8000
×512)の時系列データとなる。まず、時間方向にフ
ィルタリングをして揺らぎや雑音による誤検出の影響を
軽減する。この実施例では、10データの多数決フィル
タをかける。これは、次の式6で定義される処理であ
る。
ば無効とする。また、同時に無音部をlevel(m)
を用いて検出する。無音とは、1sec以上の時間、l
evel(m)<Thとなるような状態が続くこととす
る。ここで、1secは64msecの時系列が16回
続くこととし、Thは適当なスレショルド値とする。こ
の実施例では、この値Thは予めターゲットの音を入れ
ずに環境音だけでデータをとり、そのレベルの平均値の
定数倍(例えば2倍)としている。無音部が検出された
場合、chord(l)=NULLとしてコマンド解釈
部303にその情報を伝えるものとする。
ne(m)をフーリエ変換のindexから音名のin
dexに変換する。すなわち、周波数に変換したΔf×
f_tone(m)の値と、式5のf(i,oct)と
を、i=0,1,2,..,11,oct=0,1,
2,3,4で比較し、最も近い周波数f(i_max,
oct_max)のindexである、i_max,o
ct_maxを求める。次に、ステップS13におい
て、簡便のため、p_tone(m)=i_max+o
ct_max×12とする。
level(m)が所定のスレショルド値Thより小さ
いか否かが判定される。level(m)がスレショル
ド値Thより大きいかまたは等しいと判定された場合、
処理を終了する。一方、level(m)がスレショル
ド値Thより小さいと判定された場合、ステップS15
に進み、無音が続く回数をカウントするための変数(m
uon_count)の値を1だけカウントアップす
る。
on_countの値が値16より大きいかまたは等し
いか否かが判定される。変数muon_countの値
が値16より小さいと判定された場合、無音状態ではな
いとされ、処理を終了する。一方、変数muon_co
untの値が値16より大きいかまたは等しいと判定さ
れた場合、無音状態であるとされ、ステップS17に進
み、変数(muon_count)の値を0に初期化す
る。
以前の最大4つの連続する異なるp_tone(m)を
検出する。次に、その検出方法について説明する。
tone(m)が無音部に対応する部分より以前の連続
する3つ、あるいは4つの音名を求める。いま、ind
exであるmが所定の値Mのとき無音が検出されたとす
る。このとき、m=M−15,..,Mまでは無音であ
るので、m=M−16から順次時間を遡って、p_to
ne(m)を調べていく。p_tone(m),m=M
−16,M−17,..,と調べて、最大4つの異なる
音名が検出されるまで、あるいはメモリを全て調べ尽く
すまで検査をする。このようにして、連続する3つの異
なる音名、あるいは4つの異なる音名を検出する。
18において、連続する3つの異なる音名、あるいは4
つの異なる音名が検出されたときのみ、それらの音名を
用いてコード(chord(l))を検出あるいは認識
し、処理を終了する。
述べるコードの検出あるいは認識を簡便に行なうためで
ある。コードにはMajor,minor,7th,m
inor7th,diminishなどさまざまなコー
ドが定義されているが、この実施例では簡便のためMa
jor,minor,7thのみを検出し、そのほかの
コードは無効とする。また、音名の並びかたは低い音か
ら順番に時間軸上に並んでいるものとし、それ以外の順
番で入力されたものも無効とする。ただし、後述するよ
うに、センテンスの終了を示すものとして高い音から順
に並べたものを用いる。ここで再び、p_tone
(m)を音名とオクターブにわけた表現に直した後に行
なう。これは、式5におけるiとoctによる表現であ
り、次の式7、および式8で定義される。
を意味する。ここで、音楽における標記法との対応は次
のようになる。i=0,1,2,..,11の順番に、
C,C#(Db),D,D#(Eb),E,F,F#
(Gb),G,G#(Ab),A,A#(Bb),Bで
ある。()内はたとえばC#とDbは同じ音の異なる標
記であることを示す。
音が時間軸上で並んでいればC−Major、C,D
#,GであればC−minor、C,E,G,A#であ
ればC−7thであるとする。その他の対応を図6に示
す。実際のchord(l)は文字列情報として”C0
−Major”,”C0−minor”などのコード名
称が入っているものとする。ここで、C0の0はオクタ
ーブを示しており、”C0−Major”は式5におけ
るoct=0,i=0に対応する音名を基音とするMa
jor chordである。また、前述のように無音は
chord(l)=NULL、すなわちNULL st
ringであり、無効なコードはchord(l)=”
NG”を送るものとする。
が並んでいるコードはセンテンス終了を表すものとし
て、chord(l)=”end−D1−Major”
などのように文字列の先頭に”end−”という文字を
付加して送る。このようにして得られたコードchor
d(l)は、次にコマンド解釈部303へ入力される。
ここで、l=0,1,2,..はchord(l)を時
系列データとして扱うためのindexであり、コード
を検出するごとに増えていく。また、適当な数あるいは
コマンド解釈が成立したときにクリアされる。
コマンド解釈部303の処理手順について説明する。コ
ード解釈を通常の音声認識の単語認識とすれば、コマン
ド解釈はセンテンスの認識となる。従って、最初に、ス
テップS21において、センテンスの句点に相当するc
hord(l)として前述のように文字列”end−”
が付加されているものを検出する。すなわち、chor
d(l)の最初の4文字が”end_”であるか否かが
判定される。chord(l)の最初の4文字が”en
d_”ではないと判定された場合、ステップS23に進
み、bufferにchord(l)を記憶させ、次
に、lを1だけカウントアップし、処理を終了する。
が”end_”であると判定された場合、すなわち、セ
ンテンスの終了が検出された場合、ステップS22に進
み、”end−”が付加されたchord(l)のin
dexであるl=Lとし、chord(L)に付加され
た文字列”end−”を除いておく。また、後述するH
パターンを指示するindexであるhに0を代入して
初期化しておく。
(L)以前にbufferに溜められているchord
(l)(ここで、l=0,1,2,...,L−1,
L)をセンテンスとして認識する。この実施例では簡便
のため、予め記憶されている所定数H種類のパターン
(temp(h)(ただし、h=0,1,..,H−
1))のどれかと完全に一致しているかどうかを検査し
てコマンド解釈をする。
ord(0),chord(1),...,chord
(L)が、Hパターンtemp(h)のいずれかと等し
いか否かが判定される。chord(0),chord
(1),...,chord(L)が、Hパターンte
mp(h)のいずれとも等しくないと判定された場合、
ステップS25に進み、indexであるhを1だけカ
ウントアップする。
xであるhが所定数Hと等しいか否か、すなわち、ch
ord(0),chord(1),...,chord
(L)が、Hパターンtemp(h)のどれとも等しく
ないか否かが判定される。indexであるhが所定数
Hと等しくないと判定された場合、ステップS24に戻
り、ステップS24以降の処理が繰り返し実行される。
一方、indexであるhが所定数Hと等しいと判定さ
れた場合、ステップS27に進む。
d(0),chord(1),...,chord
(L)が、パターンtemp(h)と等しいと判定され
た場合、ステップS27に進む。
の結果としてのcomp(p)としてhを出力し、次
に、comp(p)のindexであるlを0に初期化
し、処理を終了する。
om(p)=0、または1、または2,..,またはH
−1として出力する。なお、H種類のパターンのどれと
も一致しなかった場合、com(p)=Hとして出力す
る。
説明を終える。
る。図8は、発話生成部103の詳細な構成例を示すブ
ロック図である。図8に示すように、発話生成部103
は内部状態決定部401と発話内容決定部402より構
成される。発話生成部103には、音名認識部102の
コマンド解釈部303(図3)の出力である認識結果
(comp(p))が入力されるようになされている。
内部状態決定部401には図示せぬバッテリからの電源
電圧が供給され、内蔵するタイマやバッテリ電圧を監視
するバッテリセンサなどからの情報も入力されるように
なされている。
視するバッテリセンサなどの情報が内部状態決定部40
1に入力されると、それに従って状態遷移がおきる。こ
の実施例では、この状態は、簡便のため3状態であり、
バッテリセンサの値が所定のスレショルド値THR_1
以下であれば状態1(OUT_S=1)であり、バッテ
リセンサの値がスレショルド値THR_1以上であり、
かつ所定のスレショルド値THR_2以下であれば状態
2(OUT_S=2)であり、バッテリセンサの値がス
レショルド値THR_2以上であれば状態3(OUT_
S=3)であるとする。また、別の信号Nowを設け、
内部タイマにより20秒ごとにNow=1となるように
する。この信号Nowを、発話内容決定部402に出力
する。
解釈部303から受けた認識結果と、前述の内部状態決
定部401の出力OUT_Sを受け取り、適当な規則に
より発話すべき内容を決定する。規則として、この実施
例はコードによる会話をするものとしてあるので、例え
ば音階の時系列として予め登録してあるK個のコードに
よるセンテンスが入力されたときの出力をテーブルとし
て持つこととする。センテンス数を6としてテーブルの
例を図9に示す。これは、前述のコマンド解釈部303
において無音をいれたコマンド数H=7としたものにな
る。センテンスT0,..,T6には適当なコードの時
系列chord(l’)と、楽器の種類、1つの音の長
さ、大きさを表すパラメータparam(l’)が記憶
されている。ここではparam(l’)をプログラミ
ング言語Cの記法にならって、それぞれparam
(l’).kind,param(l’).lengt
h,param(l’).levelと表す。
例がロボット装置に組み込まれているものとして、テー
ブルのセンテンスに意味を付けてみる。センテンスT1
は「前進」を意味する。センテンスT2は「止まれ」を
意味する。センテンスT3は「バッテリを交換してくだ
さい」を意味する。センテンスT4は「頑張れ」を意味
する。センテンスT5は「はい」を意味する。センテン
スT6は「いいえ」を意味する。なお、センテンスT0
は発話しないという意味である。また、出力信号S1,
S2,S3はそれぞれ内部状態決定部401の出力であ
り、上述した状態1、状態2、状態3に対応する。ま
た、センテンス入力がT0での出力は、上述した内部状
態決定部401の出力Now=1であるか、Now=0
であるかによって異なる。
「前進」、「止まれ」などの指示に対して、「はい」、
「いいえ」で答え、また、音声入力がなく、バッテリが
なくなってきたときには、「バッテリを交換してくださ
い」とお願いし、他のロボットが、「バッテリを交換し
てください」と言っているときには、「頑張れ」と答え
るようなシステムが構成できる。
が入力され)、かつバッテリがなく状態S1である場
合、ロボットは、20秒毎に信号Now=1が入力され
る度に、センテンスT3「バッテリを交換してくださ
い」を発話する。状態S2およびS3のときは、何も発
話しない。また、「前進」(センテンスT1)を指示す
ると、状態S1のとき、「いいえ」(センテンスT6)
と答え、状態S2およびS3のとき、「はい」(センテ
ンスT5)と答える。
と、「はい」(センテンスT5)と答え、他のロボット
が「バッテリを交換してください」(センテンスT3)
と発話すると、「頑張れ」(センテンスT4)と答え
る。また、他のロボットから「頑張れ」(センテンスT
4)と発話されるか、または「頑張れ」と指示される
と、「はい」(センテンスT5)と答える。また、セン
テンスT5(「はい」)およびセンテンスT6(「いい
え」)に対しては何も答えない。
る。図10は、音響信号合成部104の内部の詳細な構
成例を示すブロック図である。音響信号合成部104で
はコードの時系列chord(l’)とパラメータpa
ram(l’)を用いて、音名生成部501にてコード
情報を音名の時系列o_tone(m’),m’=0,
1,2,...に変換し、さらに、シンセサイザ部50
2でo_tone(m’)とparam(l’)によっ
て決定される1次元波形h(k),k=0,1,
2,...を生成し、D/A変換部503でアナログ信
号h(t)(tは時間)として出力する。
において行われる変換の逆の変換を行なう。すなわち、
コード名に対して通常は低い音から順に音名o_ton
e(m’)を生成していく。例えば、chord
(l’)=”C0−Major”であれば、oct=0
のCの音を基音として、C,E,Gという音名時系列を
生成する。ただし、chord(l’)=”end−C
0−Major”であればG,E,Cという高い音から
順に音名時系列を生成するものとする。実際のo_to
ne(m’)のデータは、式5のiとoctに対してi
+oct×12の0以上の整数値を取るものとする。す
なわち、chord(l’)=”C0−Major”で
あれば、o_tone(0)=0,o_tone(1)
=4,o_tone(2)=7,o_tone(3)=
−1という出力になる。なお、o_tone(3)=−
1は無音を意味するデータとする。
tone(m’)とparam(l’)を用いて実際の
音響信号のデジタル波形h(k)を生成する。簡便のた
め、chord(l’)=”C0−Major”とし、
これにより、o_tone(m’)として、前述の出力
(0,4,7,−1)が入力されたものとする。一方、
param(l’)で設定された長さ、大きさ、種類を
ここで設定する。シンセサイザとしては現在市販の電子
楽器、パーソナルコンピュータあるいはビデオゲーム機
などに、安価なFM音源あるいはサンプリング音源のL
SIが搭載されている。
電子楽器の音を8000Hzサンプリングした波形を記
憶しておき、その大きさと長さを変化させることによっ
てh(k)を生成するものとする。通常のシンセサイザ
LSIは基本周期の音を記憶し、それにサンプリングレ
ートを変換するフィルタを施すことにより様々な音名を
作り出すが、この実施例では簡便のためすべての種類の
すべての音名の音を約1sec分記憶し、param
(l’).lengthで指定された長さで振幅を0に
することで長さのコントロールを行なう。したがって、
1secより長い音は設定しないものとする。大きさに
関しては、前述のとおり記憶波形をparam(l’)
/256倍するものとする。最後のD/A変換部では、
8000HzのサンプリングレートでD/A変換を行な
い、アナログ信号h(t)を得る。
る。
波に対して分離性能の高い音響信号を組み合わせること
により、頑強な認識システムおよび合成システムを組み
合わせて対話するようなシステムを構築することにあ
る。この実施例のシステムは、口笛で使用する場合、通
常のオフィス空間ではもちろん、入力信号g(t)に人
の会話が混入している場合でも、正常に動作する。その
理由として、まず、自然発話における周波数構造におい
ては、スペクトルが広がって分布するため口笛や楽器音
のような特定の周波数に集中した音よりはスペクトルピ
ークが低くなってしまうこと、また、例えば日本語の発
話においては安定なピッチを保って発声することは非常
に不自然であり、通常の会話では20msecの分析長
ピッチを検出して、同一のピッチが連続することはほと
んどないことが上げられる。
異なるが、典型的なパターンとして、500msecで
ピッチ周波数が100Hz乃至200Hzの間を上がっ
て、下がってという変化をすることから、この実施例の
ように、式3の結果に各周波数毎にLow Pass
Filterを施し、式6のような多数決フィルタと4
ブロック(256msec)の連続を認識条件としてい
る場合、人間の会話がこの条件を満たすことはほとんど
ない。
zであったが、周波数分析部203において、フーリエ
変換ではなく、例えば並列に分解能が数Hzのバンドパ
スフィルタを用いて分析することにより、周波数の揺ら
ぎをもっと細かく分析することによって、自然発話の音
声とこの実施例で認識するために発話された音声を区別
することも可能である。したがって、この実施例のよう
に音名の進行を組み合わせて情報を伝達することによ
り、オフィスや家庭内の空間などにおいて通常の人間の
自然な会話が妨害音として存在しているときでも、機械
と人間の間、機械と機械の間、あるいは人間と人間の間
でさえも疑似的な会話をすることが可能となる。
妨害音とターゲットの音声に対して、その2つを適切に
分離するような写像を作ろうとしているのに対し、この
実施例では、存在する妨害音に対して分離しやすい音響
信号を組み合わせて対妨害特性を上げようとするもので
あり、それが新しい方法論となっている。すなわち、従
来では例えば写像のみが対雑音特性の向上のための認識
器の設計の自由度であるのに対し、この実施例では、写
像はもちろん、ターゲットの音響信号そのものの構成の
仕方にも自由度が与えられている。
の他の実施例の構成を示すブロック図である。この実施
例は、音名ではなく雑音に強い母音だけで形成された音
素列を認識、合成することにより、対雑音、対妨害音特
性を向上させるものである。図11にこの実施例の全体
の構成を示す。この実施例においては、構成は大きく2
つに別れる。A/D変換部601、音声認識部602、
音声区間検出部603、および制御部604は音声認識
システム607(認識手段)を構成し、発話生成部60
5および音声生成部606は音声合成システム608
(合成手段)を構成し、両方で対話システムを構成して
いる。
施例で用いているHMM(Hidden Markov
Model)という音声認識手法について、様々な文
献や特許に説明されているが、ここでも、簡単に説明す
る。
リwsに対応するものである確率を、P(ws,y)と
表現した場合、次の式9で示す値を最大にする音声ws
に特徴ベクトルyが属するということができる。
sが発生される事前確率であり、P(y|ws)は音声
wsが発生されたときに、特徴ベクトルyが得られる確
率である。HMM法は、式9のP(ws,y)を最大に
する音声wsを推定する方法である。HMMのモデルは
図12(a)に示すように、状態S1,S2,...,
SN,(Nは状態数)と、状態間の遷移をあらわすパス
から構成され、状態の遷移に伴い、シンボルを出力す
る。
ように、自分自身と次の状態に遷移するパスのみを有す
るモデルが一般的に使用される。HMM法のうち離散的
HMM法では、音声の特徴ベクトルを例えばベクトル量
子化処理することなどにより得られるシンボルの系列Y
=(y1,y2,..,yT)が各モデルで生起される
確率が計算され、その確率が最も大きいモデルが認識結
果となる。
移する遷移確率 b_i_j(k): 状態iから状態jへ遷移するとき
にシンボルkが生起される出力確率。 K: シンボル数(シンボルの種類) π=(π1,π2,..,πN): 初期状態が状態i
である確率を示す初期状態確率 のようにパラメータを表すとすると、モデルθからシン
ボル系列Yが観測される確率P(Y|θ)は次のように
して求めることができる。
状態iを決定し、時刻t=1とする。 (ST2)遷移確率a_i_jに基づいて状態iから状
態jへの遷移を決定する。 (ST3)出力確率b_i_j(k)に基づいて状態i
から状態jへ遷移するときに出力するシンボルy_tを
決定する。 (ST4)t=t+1,i=j,t<=Tであれば、S
T2へ戻る。
は最終状態はそれぞれ1つとするのが一般的であり、以
下、t=1における状態をS1、t=Tにおける状態を
SNとする。したがって、初期状態確率はπ1のみでそ
の他はすべて0となる。
2,..,ytを出力して状態iにいる前方予測確率を
αi(t)とすると、上述したモデルの出力の定義
((ST1,ST2,ST3,ST4))から、モデル
θがシンボル系列Y=(y_1,y_2,...,y_
T)を出力する確率P(Y|θ)は次のようにして計算
できる。
ンであり、状態jから状態iへの遷移が許されている場
合のみとられる。したがって、音声から求められたシン
ボル系列Y=(y_1,..,y_T)に対してP(Y
|θ)を最大とするモデルθが認識結果となる。
ルの学習では、学習用のシンボル系列Yから、上述した
前方予測確率αi(t)が求められ、さらに、時刻tに
おいて状態iにいて、以後、シンボル系列y_(t+
1),y_(t+2),...,y_Tを出力する後方
予測確率βi(t)が次の式11により求められる。
おいて、状態iから状態jへの遷移が許されている場合
にのみとられる。
b_i_j(k)が更新される。
(k)はそれぞれ更新された遷移確率および出力確率を
表す。また、上式のh=1,..,Nのサメーションは
状態iから状態hへの遷移が許されている場合にのみと
られる。さらに、t:y_t=kに関するサメーション
は、時刻tにおいてkなるシンボルが生起される場合に
のみとられる。
の再推定法と呼ばれる。
_j、およびb_i_j(k)は、ある学習シンボル系
列1つに対してだけであり、これにより学習が行なわれ
たモデルは、あるシンボル系列だけを高い確率で出力す
るようになる。しかしながら、これでは話者や発話のば
らつきなどに対処することができない。
率で出力するようにモデルθの学習を行なう必要があ
る。これは、例えばQ種類のシンボル系列の、q番目の
シンボル系列をY^q=(y_1^q,...,y_T
^q)としたとき、各シンボル系列Y^q,q=1,
2,..,Qが観測される確率P(Y^q|θ)の積が
最大になるようにモデルθの学習を行なえばよい。
を多重系列に拡張した次式によって求めることができ
る。
別に行なう場合であるが、実際にはモデルを連結した連
結学習が必要になる。モデルの連結学習では予め用意し
た単語辞書に登録されている単語に基づき、音韻または
音素モデル同士が連結され、これを単語モデルと見なし
て、単語の学習用のシンボル系列として用意されたシン
ボル系列Y^qに対する学習が行なわれる。
学習を個別に行なった場合において、そのうちのm番目
のモデル(モデルm)のパラメータ(遷移確率、出力確
率)をそれぞれ、a_i_j^mおよびb_i_j^m
(k)と表し、そのモデルmに音韻あるいは音素モデル
を連結したモデル(連結モデル)の状態をuまたはvで
表す。さらに、連結モデルの状態がuからvへ遷移する
場合において、状態uがモデルmに属する状態であるこ
とを(u−>v)mと表すと、次式にしたがって、a_
i_j^mとb_i_j^m(k)が更新(再推定、学
習)される。
数回使用している場合、例えば、3つの状態S1,S
2,S3からなるモデルmを2回使用して構成されてい
る場合、連結モデルはS1,S2,S3,S1,S2,
S3の6状態を有することになる。したがって、モデル
mの状態S1,S2,S3のうちの例えば先頭の状態S
1は、連結モデルの先頭の状態と4番目の状態と同一と
なる。このように、連結モデルの複数の状態uまたはv
がモデルmの1つの状態iまたはjと同一になる場合が
ある。
はこのような連結モデルの状態u,vがモデルmの状態
iまたはjと同一である場合、サメーションがとられ
る。さらに、Σ_(u=i)は連結モデルの状態uがモ
デルmの状態iと同一である場合、サメーションがとら
れる。
連結モデルの状態uから状態hへの遷移が許されている
場合で、連結モデルの状態uがモデルmに属するときに
のみとられる。
にモデルmが連結されており、連結モデルのある状態u
がモデルmの最終状態(u=N)となった場合、状態u
から遷移先の状態vはモデルmの直後に連結したモデル
の初期状態になるものとする。
て音声認識が行なわれる場合について説明する。まず、
学習用に用意された学習系列Yを用いて、上述した式1
2または式13(以下、式13におけるa_i_j^
m,b_i_j^m(k)を式12における場合と同様
にa_i_j,b_i_j(k)と記載する)にしたが
ってモデルの学習(連結学習)がおこなわれ、モデルθ
の遷移確率a_i_jおよび出力確率b_i_j(k)
が求められる。
系列Yが観測された場合には、モデルθがそのシンボル
系列を出力する確率P(Y|θ)が、式10にしたがっ
て、すなわち、フォワード法によって計算される。な
お、P(Y|θ)の計算はそのほか例えばビタビ法など
によって行なうこともできる。
ても行なわれ、前述したように確率Pが最も大きいモデ
ルが認識結果とされる。
1、音声認識部602、音声区間検出部603、および
制御部604からなる音声認識システム607について
説明する。
された信号を、所定の標本化周波数によってデジタル信
号に変換し、音声認識部602と音声区間検出部603
に出力する。音声認識部602は、例えば図13に示す
ように分析部701(分析手段)、ベクトル量子化部7
02、およびHMM部703から構成される。分析部7
01はA/D変換部601からのデジタル信号を所定の
フレーム単位で音響分析し、その分析の結果得られる音
声の特徴ベクトルをベクトル量子化部702に出力す
る。ベクトル量子化部702は、予め作成されたコード
ブックを用いて、分析部701からの特徴ベクトルをベ
クトル量子化し、その結果得られるシンボルをHMM部
703に出力する。HMM部703は、学習用の音声を
用いて上述したような連結学習が行なわれた音素モデル
(遷移確率a_i_jおよび出力確率b_i_j
(k))を記憶しているモデル記憶部704を有してい
る。
(図11)から供給される音声認識処理に必要な必要情
報にしたがい、モデル記憶部704に記憶されているモ
デルを用いて、ベクトル量子化部702から供給される
シンボル系列から、上述した離散型HMM法による音声
認識を行うようになっている。音声認識の結果得られた
認識結果候補は、制御部604に出力される。
変換部601の出力の短時間パワーまたはゼロクロス数
を算出し、その短時間パワーまたはゼロクロス数が所定
のスレショルド値を超えた区間を音声区間として検出
し、制御部604に出力する。制御部604は、図示せ
ぬ単語辞書を内蔵しており、その単語辞書を参照して、
音声認識の対象とする単語を設定し、その単語を、必要
情報として、音声認識部602を構成するHMM部70
3に出力する。なお、制御部604は音声区間検出部6
03からの音声区間も必要情報としてHMM部703に
出力する。
の認識結果候補を受信し、所定のアルゴリズムにしたが
って、そのうちの少なくとも1つを選択し、これを認識
結果として出力する。
607では次のようにして音声認識が行なわれる。
1において、A/D変換部601の出力が所定のフレー
ム単位で例えば、線形予測分析などの音響分析処理がな
され、これにより、所定の次数の線形予測係数が算出さ
れる。さらに、分析部701では、線形予測係数から所
定の再帰式によって、ケプストラム係数(LPC(Li
near Predictive Coding)ケプ
ストラム係数)が算出され、これが特徴ベクトルとし
て、ベクトル量子化部702に出力される。
からの特徴ベクトルが、ベクトル量子化され、その結
果、フレーム単位で得られるシンボルが、HMM部70
3に出力される。
変換部601の出力から上述したような方法で音声区間
が検出され、制御部604に出力され、制御部604で
は内蔵する単語辞書を参照して、音声認識対象の単語
(認識対象単語)が少なくとも1つ以上決定される。ま
た、制御部604は音声区間検出部603からの音声区
間を受信すると、その区間と共に認識対象単語を必要情
報として音声認識部602のHMM部703に出力す
る。
と、そのうち認識対象単語に対応するモデルが、モデル
記憶部704に記憶されている音素モデルを連結するこ
とにより生成される。以上のようにして制御部604か
らの認識対象単語すべてに対応する単語モデルが生成さ
れた後、HMM703では制御部604からの音声区間
において、ベクトル量子化部702から供給されるシン
ボル系列が単語モデルから観測される確率が上述したよ
うにして計算される。そして、その確率が所定値より大
きくなる単語モデルに対応する単語を認識結果候補とし
て制御部604に出力する。制御部604はHMM部か
らの認識結果候補を受信し、所定のアルゴリズムにした
がって、そのうちの少なくとも1つを選択し、これを認
識結果として出力する。
よび音声生成部606からなる音声合成システム608
について説明する。
例を示すブロック図である。発話生成部605は、内部
状態決定部801と発話内容決定部802より構成され
る。発話生成部605には、前述の制御部604の出力
である認識結果が入力されるようになされている。
なタイマあるいはバッテリ電圧を監視するバッテリセン
サなどの情報が入力され、それに従って状態遷移が起き
るようになされている。この実施例では、この状態は、
簡便のため3状態であり、バッテリセンサの値が所定の
スレショルド値THR_1以下であれば状態1(OUT
_S=1)であり、スレショルド値THR_1以上であ
り、かつ別の所定のスレショルド値THR_2以下であ
れば状態2(OUT_S=2)であり、スレショルド値
THR_2以上であれば状態3(OUT_S=3)であ
るとする。また、別の信号Nowを設け、内部タイマに
より20秒ごとにNow=1となるようにする。この信
号Nowを、発話内容決定部802に出力する。
04からの認識結果と、前述の内部状態決定部801か
らの出力OUT_Sを受け取り、適当な規則により発話
するべき内容を決定する。規則として、この実施例は単
語による会話をするものとしてあるので、母音の時系列
として予め登録してあるK個の単語が入力されたときの
出力をテーブルとして持つこととする。単語数を6とし
てテーブルの例を図15に示す。
例がロボット装置に組み込まれているものとして、テー
ブルの単語に意味を付けてみる。単語T1は「前進」を
意味する。単語T2は「止まれ」を意味する。単語T3
は「バッテリを交換してください」を意味する。単語T
4は「頑張れ」を意味する。単語T5は「はい」を意味
する。単語T6は「いいえ」を意味する。なお、単語T
0は発話しないという意味である。また、出力信号S
1,S2,S3はそれぞれ内部状態決定部801の出力
であり、状態1、状態2、状態3に対応する。また、単
語入力がT0での出力は、前述の内部状態決定部801
の出力Now=1であるか、Now=0であるかによっ
て異なる。
どの指示に、「はい」、「いいえ」で答え、また、音声
入力がなく、バッテリがなくなってきたときには、「バ
ッテリを交換してください」とお願いし、他のロボット
が、「バッテリを交換してください」といっているとき
には、「頑張れ」と答えるようなシステムが構成でき
る。
音声に変換する音声生成部606について説明する。音
声生成部606は、いわゆる音声合成のシンセサイザ部
であり、この実施例では予め単語レベルで録音してある
ものを選んで出力するものとする。これは、前述の単語
T1から単語T6までを母音のみで構成される単語と対
応付けることと同じであり、前述の音声認識部602で
HMM部703が持っているモデル、あるいは単語辞書
と同様の母音列から構成される。
T2を”a−i−e”,単語T3を”i−u−e”,単
語T4を”i−u−o”,単語T5を”u−e−o”、
単語T6を”o−e−u”とする。これを、適当に発音
したものをデジタルデータとして記録したものを、音声
生成部606の図示せぬ内部のメモリで持つものとし、
発話生成部605からの単語にしたがって、対応するデ
ジタルデータをメモリから読みだし、D/A変換をして
音声信号に変換する。
は、音声認識部602にHMMを利用することと、音素
構成として母音のみで形成される音素系列を単語として
登録してあることである。このような音素による設計を
行なうことにおいて、ホワイト雑音が非常に大きな環境
では簡単に妨害音との区別を行なうことができる。ま
た、人間は母音を子音と比較して大きなパワーで発声す
るため、通常の自然言語に比べてシステムの入力信号の
S/N比を良くすることができる。
声認識において、対妨害音、対雑音の問題に対応し、か
つ、機械と人間との間で会話を実現できる方法として、
音声認識の設計の自由度に注目する。すなわち、従来見
落としている認識システムの構成自由度に注目し、対雑
音、対妨害音特性を向上させるものである。
り、対妨害特性、対雑音特性に優れた音響特性をもつ音
素を選択あるいは設計することである。それを用いて発
話することにより通常の認識技術だけでも十分な対雑
音、対妨害音特性をもつ認識システムを実現することが
できる。すなわち、日本語あるいは英語の音声認識装置
ではないが、可帯域の信号で特殊な音響特性をもつ音素
をもちいて単語やセンテンスを構築し、それを認識する
システム、そして合成するシステムを構築することによ
り対雑音、対妨害音特性のすぐれた認識あるいは対話シ
ステムがより実現しやすくなる。
た3つの手法のどれにもあてはまるものではない。例え
ば日本語音声認識装置において、日本語として固有名詞
を含む任意の音素の組合せに対して、上述の3つの手法
で対雑音、対妨害特性の向上を施しているどの手法にも
あてはまらない。音素の組合せを雑音や妨害音に合わせ
て選び、または設計する自由度が与えられ、それゆえに
対雑音、対妨害音特性を容易に改善することができる。
手法にフーリエ変換を用いたが、本発明はそれに限定さ
れるものではない。通常の音声認識の前処理として用い
る分析手法を利用することもできる。例えば、LPC分
析などは通常の音声認識で良く使われる手法である。ま
た、音名を認識するのであれば通常のピッチ検出技術を
利用することができる。例えば、ゼロクロス検出による
ピッチ検出や自己相関を用いたピッチ検出などはその代
表例である。
部において1つの音名の区切りを無音部の検出に利用し
ているが、それに限定されるものではない。また、無音
部を想定せずにp_toneの変化した音を3つあるい
は4つに注目し、それがC−MajorやC−mino
rなどのコードを構成する音と一致した時のみchor
d(l)を出力し、そうでない場合は無効であるとし、
有効なchord(l)の時系列だけをコマンド解釈に
あてることによっても実現できる。ただし、7thコー
ドなどのように4つで構成されるコードの場合、4つ目
の音を検出する前にMajorコードとして有効なch
ord(l)を出力するため、その対策が必要である。
これは、l=Lで7thコードが認識されたときにそれ
以前の3音で構成されたMajorコードchord
(L−1)を無効データに書き換えることで可能であ
る。
ら順に入力されることが条件になっているが、本発明は
これに限定されるものではない。これは3つあるいは4
つの音の構成が、あるコードの構成音と同一であるか否
か、あるいは別の定められた順番であるか否かによって
認識することにより実現することができる。
スの終了は高い音から順に入力されることを前提として
いるが、本発明はこれに限定されるものではない。適当
な長さの無音検出でもセンテンスの終了を決めることも
できるし、適当な無効パターンを決めることにより終了
を決めることもできる。また、特定のコードを終了コー
ドとしてもよい。あるいは、特定のコード進行により終
了とみなしてもよい。また、第1の実施例では3音から
構成されるコードは3音、4音から構成されるコードは
4音であることを前提としているが、本発明はそれに限
定されるものではない。例えば、”C−Major”と
してC,E,F,E,Cというようなギターの奏法で用
いられるようなアルペジオでもよい。
ードの時系列を認識しているが、本発明はこれに限定さ
れるものではない。例えば、コードそのものが1つでコ
マンドであることも可能である。また、コードに限定せ
ずに、音名の時系列でその長さ、高さで情報を表すこと
も第1の実施例の変形と考えられる。
音名およびコードを認識しているが、相対的な周波数変
化、相対的な音名の変化、あるいは相対的なコード変化
を認識することにより、いわゆるチューンのずれに対応
することは容易である。
械、あるいは人間が楽器を用いて機械と対話している例
で記述されているが、本発明はそれに限定されるもので
はない。この実施例より、2つ以上の装置がこの実施例
の構成を独立に持っておれば、機械同士の会話が可能な
構成であり、かつ、その内容を人間が聴覚を用いて認識
可能であることも容易に推測できる。また、人間同士が
この音素を用いた会話が可能であり、その内容を機械が
理解することも可能である。
認識しているがHMMを用いて第1の実施例のような音
名やコードを認識することは容易な変更で可能である。
たとえば、「あー」というような声でドレミ、、を発声
し、それを認識することは可能である。
識としてHMMを用いているが本発明はこれに限定され
るものではない。
の手法は予め記憶してある母音からなる波形を出力した
が、本発明はそれに限定されるものではない。規則合成
による音声合成や声道モデルによる音声合成方法を利用
することは容易に推定できる。また、それを用いて、音
声に自然なゆらぎを導入し、より人間に近い母音発話を
することは容易である。
は単語認識となっているが、本発明はそれに限定される
ものではない。センテンスへの拡張は容易である。
a,i,u,e,oを仮定しているが本発明はそれに限
定されるものではない。たとえば、子音を発声するが子
音部を無視して母音部のみの時系列認識とすれば、対雑
音特性を損なわずに発声の容易さを増すことができる。
また、そのほかの雑音と区別しやすい音素を利用するこ
とは本発明の変形である。
あっても雑音と区別しづらい音素を予め除くことも可能
である。例えば、iの音素は人間の発声において、その
他の母音に比べて出力パワーが小さいことが知られてい
るが、このような音素を除いた音素の組みで単語を設計
することも可能である。
ば、分析手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音の分析が行われるようにしたので、妨害音または雑音
の影響を抑制することができる。従って、目的の音を確
実に検出あるいは認識することが可能となる。
ば、合成手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音が合成されるようにしたので、妨害音あるいは雑音の
影響を受け難い目的の音を合成することができる。従っ
て、相手に、目的の音を確実に認識させることが可能と
なる。
れば、分析手段により、雑音や妨害音と分離が容易な音
響特性を有する音素あるいは音素の時系列より構成され
た音の分析が行われ、合成手段により、雑音や妨害音と
分離が容易な音響特性を有する音素あるいは音素の時系
列より構成された音が合成されるようにしたので、妨害
音あるいは雑音の影響を受けずに目的の音を検出あるい
は認識することができ、妨害音あるいは雑音の影響を受
け難い目的の音を合成することができる。従って、妨害
音や雑音の影響を受けずに、1つ以上の機械と1人以上
の人間との間、あるいは機械同士において対話をするシ
ステムを容易に構築することができる。また、自然言語
による対話ではないため、このシステムによる対話によ
り娯楽性を生み出すことができる。さらに、エンターテ
イメント用途の対話システムに応用した場合において
は、自然言語による対話よりも効果的な対話システムを
構築することが可能となる。
成を示すブロック図である。
ロック図である。
ク図である。
トである。
ートである。
ャートである。
ある。
ク図である。
の構成を示すブロック図である。
である。
である。
Claims (25)
- 【請求項1】 雑音や妨害音が存在する環境で音声認識
を行う音声認識装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
あるいは前記音素の時系列より構成された音を分析する
分析手段を備えることを特徴とする音声認識装置。 - 【請求項2】 前記分析手段による分析結果を、所定の
次元の分析空間に所定の順序でそれぞれ並べたとき、前
記分析結果の特徴点の位置は、前記分析空間と時間軸で
構成された時系列分析空間において、所定の規則に従っ
た動きをすることを特徴とする請求項1に記載の音声認
識装置。 - 【請求項3】 前記特徴点は、前記分析空間における前
記分析結果の極大値あるいは極小値より選ばれた点であ
ることを特徴とする請求項2に記載の音声認識装置。 - 【請求項4】 前記時系列分析空間上における前記特徴
点の位置の前記動きは、所定の時間以上、前記時間軸に
対して所定の傾きを持った動きであることを特徴とする
請求項2に記載の音声認識装置。 - 【請求項5】 前記時系列分析空間上における前記特徴
点の位置の前記動きは、所定の時間以上、前記時間軸に
対して平行な動きであることを特徴とする請求項2に記
載の音声認識装置。 - 【請求項6】 前記音のピッチは、所定の時間以上、所
定の範囲以上に変化しないことを特徴とする請求項1に
記載の音声認識装置。 - 【請求項7】 前記音素は、母音であることを特徴とす
る請求項1に記載の音声認識装置。 - 【請求項8】 前記分析手段は、線形の畳み込み演算を
行うことを特徴とする請求項1に記載の音声認識装置。 - 【請求項9】 Hidden Markov Mode
lを含む認識手段をさらに備え、 前記認識手段により、前記分析手段による前記分析結果
に対応する音が認識されることを特徴とする請求項1に
記載の音声認識装置。 - 【請求項10】 雑音や妨害音が存在する環境で音声合
成を行う音声合成装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
あるいは前記音素の時系列より構成された音を合成する
合成手段を備えることを特徴とする音声合成装置。 - 【請求項11】 前記音を所定の分析方法で分析した分
析結果を、所定の次元の分析空間に所定の順序でそれぞ
れ並べたとき、前記分析結果の特徴点の位置は、前記分
析空間と時間軸で構成された時系列分析空間において、
所定の規則に従った動きをすることを特徴とする請求項
10に記載の音声合成装置。 - 【請求項12】 前記特徴点は、前記分析空間における
前記分析結果の極大値あるいは極小値より選ばれた点で
あることを特徴とする請求項11に記載の音声合成装
置。 - 【請求項13】 前記時系列分析空間上における前記特
徴点の位置の前記動きは、所定の時間以上、前記時間軸
に対して所定の傾きを持った動きであることを特徴とす
る請求項11に記載の音声合成装置。 - 【請求項14】 前記時系列分析空間上における前記特
徴点の位置の前記動きは、所定の時間以上、前記時間軸
に対して平行な動きであることを特徴とする請求項11
に記載の音声合成装置。 - 【請求項15】 前記音のピッチは、所定の時間以上、
所定の範囲以上に変化しないことを特徴とする請求項1
0に記載の音声合成装置。 - 【請求項16】 前記音素は、母音であることを特徴と
する請求項10に記載の音声合成装置。 - 【請求項17】 雑音や妨害音が存在する環境で音声認
識と音声合成を行う音声認識合成装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
あるいは前記音素の時系列より構成された音を分析する
分析手段と、 前記雑音や妨害音と分離が容易な音響特性を有する前記
音素あるいは前記音素の時系列より構成された前記音を
合成する合成手段とを備えることを特徴とする音声認識
合成装置。 - 【請求項18】 前記音の前記分析手段による分析結果
を、所定の次元の分析空間に所定の順序でそれぞれ並べ
たとき、前記分析結果の特徴点の位置は、前記分析空間
と時間軸で構成された時系列分析空間において、所定の
規則に従った動きをすることを特徴とする請求項17に
記載の音声認識合成装置。 - 【請求項19】 前記特徴点は、前記分析空間における
極大値あるいは極小値より選ばれた点であることを特徴
とする請求項18に記載の音声認識合成装置。 - 【請求項20】 前記時系列分析空間上における前記特
徴点の位置の前記動きは、所定の時間以上、前記時間軸
に対して所定の傾きを持った動きであることを特徴とす
る請求項18に記載の音声認識合成装置。 - 【請求項21】 前記時系列分析空間上における前記特
徴点の位置の前記動きは、所定の時間以上、前記時間軸
に対して平行な動きであることを特徴とする請求項18
に記載の音声認識合成装置。 - 【請求項22】 前記音のピッチは、所定の時間以上、
所定の範囲以上に変化しないことを特徴とする請求項1
7に記載の音声認識合成装置。 - 【請求項23】 前記音素は、母音であることを特徴と
する請求項17に記載の音声認識合成装置。 - 【請求項24】 前記分析手段は、線形の畳み込み演算
を行うことを特徴とする請求項17に記載の音声認識合
成装置。 - 【請求項25】 Hidden Markov Mod
elを含む認識手段をさらに備え、 前記認識手段により、前記分析手段による前記分析結果
に対応する音が認識されることを特徴とする請求項17
に記載の音声認識合成装置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP7142870A JPH08335091A (ja) | 1995-06-09 | 1995-06-09 | 音声認識装置、および音声合成装置、並びに音声認識合成装置 |
| US08/661,396 US5966690A (en) | 1995-06-09 | 1996-06-07 | Speech recognition and synthesis systems which distinguish speech phonemes from noise |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP7142870A JPH08335091A (ja) | 1995-06-09 | 1995-06-09 | 音声認識装置、および音声合成装置、並びに音声認識合成装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH08335091A true JPH08335091A (ja) | 1996-12-17 |
Family
ID=15325522
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP7142870A Abandoned JPH08335091A (ja) | 1995-06-09 | 1995-06-09 | 音声認識装置、および音声合成装置、並びに音声認識合成装置 |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US5966690A (ja) |
| JP (1) | JPH08335091A (ja) |
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2000099099A (ja) * | 1998-09-22 | 2000-04-07 | Sharp Corp | データ再生装置 |
| WO2000066239A1 (en) * | 1999-04-30 | 2000-11-09 | Sony Corporation | Electronic pet system, network system, robot, and storage medium |
| JP2002321177A (ja) * | 2001-04-23 | 2002-11-05 | Sony Corp | 脚式移動ロボット及びその制御方法 |
| US8195451B2 (en) | 2003-03-06 | 2012-06-05 | Sony Corporation | Apparatus and method for detecting speech and music portions of an audio signal |
Families Citing this family (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6049770A (en) * | 1996-05-21 | 2000-04-11 | Matsushita Electric Industrial Co., Ltd. | Video and voice signal processing apparatus and sound signal processing apparatus |
| US6490562B1 (en) | 1997-04-09 | 2002-12-03 | Matsushita Electric Industrial Co., Ltd. | Method and system for analyzing voices |
| US6587822B2 (en) * | 1998-10-06 | 2003-07-01 | Lucent Technologies Inc. | Web-based platform for interactive voice response (IVR) |
| US6980956B1 (en) * | 1999-01-07 | 2005-12-27 | Sony Corporation | Machine apparatus and its driving method, and recorded medium |
| JP2003186500A (ja) * | 2001-12-17 | 2003-07-04 | Sony Corp | 情報伝達システム、情報符号化装置および情報復号装置 |
| JP4447857B2 (ja) * | 2003-06-20 | 2010-04-07 | 株式会社エヌ・ティ・ティ・ドコモ | 音声検出装置 |
| WO2006026812A2 (en) * | 2004-09-07 | 2006-03-16 | Sensear Pty Ltd | Apparatus and method for sound enhancement |
| JP4456537B2 (ja) * | 2004-09-14 | 2010-04-28 | 本田技研工業株式会社 | 情報伝達装置 |
| US11238409B2 (en) | 2017-09-29 | 2022-02-01 | Oracle International Corporation | Techniques for extraction and valuation of proficiencies for gap detection and remediation |
| US20200097879A1 (en) * | 2018-09-25 | 2020-03-26 | Oracle International Corporation | Techniques for automatic opportunity evaluation and action recommendation engine |
| US11467803B2 (en) | 2019-09-13 | 2022-10-11 | Oracle International Corporation | Identifying regulator and driver signals in data systems |
| JP7714459B2 (ja) | 2018-09-27 | 2025-07-29 | オラクル・インターナショナル・コーポレイション | メトリックのデータ駆動型相関のための技術 |
Family Cites Families (14)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US3836717A (en) * | 1971-03-01 | 1974-09-17 | Scitronix Corp | Speech synthesizer responsive to a digital command input |
| US3943295A (en) * | 1974-07-17 | 1976-03-09 | Threshold Technology, Inc. | Apparatus and method for recognizing words from among continuous speech |
| JPS54153070A (en) * | 1978-05-23 | 1979-12-01 | Seiko Epson Corp | Wristwatch for the blind |
| US4661915A (en) * | 1981-08-03 | 1987-04-28 | Texas Instruments Incorporated | Allophone vocoder |
| US4707858A (en) * | 1983-05-02 | 1987-11-17 | Motorola, Inc. | Utilizing word-to-digital conversion |
| US4833714A (en) * | 1983-09-30 | 1989-05-23 | Mitsubishi Denki Kabushiki Kaisha | Speech recognition apparatus |
| JPS61110837A (ja) * | 1984-11-02 | 1986-05-29 | Hitachi Ltd | 空気調和機の制御方式 |
| US4852181A (en) * | 1985-09-26 | 1989-07-25 | Oki Electric Industry Co., Ltd. | Speech recognition for recognizing the catagory of an input speech pattern |
| US4803729A (en) * | 1987-04-03 | 1989-02-07 | Dragon Systems, Inc. | Speech recognition method |
| US5136653A (en) * | 1988-01-11 | 1992-08-04 | Ezel, Inc. | Acoustic recognition system using accumulate power series |
| US5293448A (en) * | 1989-10-02 | 1994-03-08 | Nippon Telegraph And Telephone Corporation | Speech analysis-synthesis method and apparatus therefor |
| US5390278A (en) * | 1991-10-08 | 1995-02-14 | Bell Canada | Phoneme based speech recognition |
| US5377302A (en) * | 1992-09-01 | 1994-12-27 | Monowave Corporation L.P. | System for recognizing speech |
| JP3114468B2 (ja) * | 1993-11-25 | 2000-12-04 | 松下電器産業株式会社 | 音声認識方法 |
-
1995
- 1995-06-09 JP JP7142870A patent/JPH08335091A/ja not_active Abandoned
-
1996
- 1996-06-07 US US08/661,396 patent/US5966690A/en not_active Expired - Fee Related
Cited By (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2000099099A (ja) * | 1998-09-22 | 2000-04-07 | Sharp Corp | データ再生装置 |
| WO2000066239A1 (en) * | 1999-04-30 | 2000-11-09 | Sony Corporation | Electronic pet system, network system, robot, and storage medium |
| US6560511B1 (en) | 1999-04-30 | 2003-05-06 | Sony Corporation | Electronic pet system, network system, robot, and storage medium |
| US7089083B2 (en) | 1999-04-30 | 2006-08-08 | Sony Corporation | Electronic pet system, network system, robot, and storage medium |
| JP2002321177A (ja) * | 2001-04-23 | 2002-11-05 | Sony Corp | 脚式移動ロボット及びその制御方法 |
| US8195451B2 (en) | 2003-03-06 | 2012-06-05 | Sony Corporation | Apparatus and method for detecting speech and music portions of an audio signal |
Also Published As
| Publication number | Publication date |
|---|---|
| US5966690A (en) | 1999-10-12 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP3180655B2 (ja) | パターンマッチングによる単語音声認識方法及びその方法を実施する装置 | |
| US6009391A (en) | Line spectral frequencies and energy features in a robust signal recognition system | |
| JP4274962B2 (ja) | 音声認識システム | |
| US6553342B1 (en) | Tone based speech recognition | |
| JP3114468B2 (ja) | 音声認識方法 | |
| WO2007117814A2 (en) | Voice signal perturbation for speech recognition | |
| JP2002304190A (ja) | 発音変化形生成方法及び音声認識方法 | |
| JPH09500223A (ja) | 多言語音声認識システム | |
| US5966690A (en) | Speech recognition and synthesis systems which distinguish speech phonemes from noise | |
| JP4911034B2 (ja) | 音声判別システム、音声判別方法及び音声判別用プログラム | |
| JP2000194392A (ja) | 騒音適応型音声認識装置及び騒音適応型音声認識プログラムを記録した記録媒体 | |
| Kurcan | Isolated word recognition from in-ear microphone data using hidden markov models (HMM) | |
| JP4461557B2 (ja) | 音声認識方法および音声認識装置 | |
| JPH08211897A (ja) | 音声認識装置 | |
| US11043212B2 (en) | Speech signal processing and evaluation | |
| JP2011180308A (ja) | 音声認識装置及び記録媒体 | |
| JP2001013988A (ja) | 音声認識方法及び装置 | |
| JP2002091480A (ja) | 音響モデル生成装置及び音声認識装置 | |
| KR100488121B1 (ko) | 화자간 변별력 향상을 위하여 개인별 켑스트럼 가중치를 적용한 화자 인증 장치 및 그 방법 | |
| JP4749990B2 (ja) | 音声認識装置 | |
| JP2658426B2 (ja) | 音声認識方法 | |
| WO2025211030A1 (ja) | 収音装置、収音方法、およびプログラム | |
| JP3357752B2 (ja) | パターンマッチング装置 | |
| JPH09160585A (ja) | 音声認識装置および音声認識方法 | |
| JPH04125597A (ja) | 音声認識装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A977 | Report on retrieval |
Free format text: JAPANESE INTERMEDIATE CODE: A971007 Effective date: 20040811 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20040914 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20041115 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20041217 |
|
| A762 | Written abandonment of application |
Free format text: JAPANESE INTERMEDIATE CODE: A762 Effective date: 20050127 |