JPH08335091A - 音声認識装置、および音声合成装置、並びに音声認識合成装置 - Google Patents

音声認識装置、および音声合成装置、並びに音声認識合成装置

Info

Publication number
JPH08335091A
JPH08335091A JP7142870A JP14287095A JPH08335091A JP H08335091 A JPH08335091 A JP H08335091A JP 7142870 A JP7142870 A JP 7142870A JP 14287095 A JP14287095 A JP 14287095A JP H08335091 A JPH08335091 A JP H08335091A
Authority
JP
Japan
Prior art keywords
analysis
sound
speech
recognition
time
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Abandoned
Application number
JP7142870A
Other languages
English (en)
Inventor
Masahiro Fujita
雅博 藤田
Makoto Inoue
真 井上
Koji Kageyama
浩二 景山
Makoto Akaha
誠 赤羽
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sony Corp
Original Assignee
Sony Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sony Corp filed Critical Sony Corp
Priority to JP7142870A priority Critical patent/JPH08335091A/ja
Priority to US08/661,396 priority patent/US5966690A/en
Publication of JPH08335091A publication Critical patent/JPH08335091A/ja
Abandoned legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00—Speech synthesis; Text to speech systems
    • G10L13/02—Methods for producing synthetic speech; Speech synthesisers
    • G10L13/04—Details of speech synthesis systems, e.g. synthesiser structure or memory management
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
    • G10L2015/025—Phonemes, fenemes or fenones being the recognition units
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/15—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being formant information

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Manipulator (AREA)
  • Electrophonic Musical Instruments (AREA)

Abstract

(57)【要約】 【目的】 雑音や妨害音のある環境において分離しやす
い音素を用いて、言語を構築することができるようにす
る。 【構成】 音響信号分析部101に供給された、雑音や
妨害音のある環境において分離しやすい音素からなる音
響信号は、そこで分析され、音名認識部102におい
て、その分析結果から音名が認識され、さらに所定のセ
ンテンスとして認識された後、発話生成部103に供給
される。それに対応して、発話生成部103は、雑音や
妨害音のある環境において分離しやすい音素からなる音
名で構成された所定の時系列を生成し、音響信号生成部
104に供給する。音響信号生成部104においては、
それに対応する音響信号が合成され、出力される。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】本発明は、音声認識装置、および
音声合成装置、並びに音声認識合成装置に関し、可聴帯
域の音響信号を認識または合成する場合に用いて好適な
音声認識装置、および音声合成装置、並びに音声認識合
成装置に関する。
【0002】
【従来の技術】1つ以上の機械と1人以上の人間が会話
をする場合、従来は、音声認識と音声合成を組み合わせ
て、機械が自然言語(日本語、英語など)を認識し、単
語あるいは文章を音声信号に変換して自然言語で答える
というシステムを構築する。しかしながら、従来の音声
認識では、雑音や妨害音の影響により認識率が悪化する
ため、その対策として次のような手法が提案されてい
る。
【0003】まず、マイクなどを工夫して雑音、妨害音
が混入しないようにするものがある。例えば、指向性の
あるマイクを用い、それを音源の方向に向け、雑音を低
減したりする方法がある。特開昭59−012500は
この例である。
【0004】あるいは、信号処理的に雑音、妨害音を推
定し、それらを引き去るものがある。例えば、周波数変
換などの前処理において、背景雑音のスペクトル成分を
引き算し、その影響を取り除くようなスペクトルサブト
ラクションとよばれる手法がある。特開昭57−212
496はこの例である。また、適応信号処理を用いて、
雑音のみを採取できる条件であれば、雑音にフィルタを
かけて、音声と雑音が混入したものからそれを引き去る
ものも存在する。
【0005】あるいは、妨害音と認識対象の音声とを、
適当な写像を用いて比較的両者の距離が大きくなるよう
な空間にマッピングし、認識対象の音声を認識する方法
がある。例えば、特開平2−15718「神経回路網モ
デルを用いた雑音除去装置」では、多層構造の神経回路
網に、入力を雑音が混入した音声、出力を雑音無しの音
声として写像を学習させ、雑音を除去する装置が示され
ている。また、特開昭60−75898には、音声ピッ
チの調波成分のみを検出し、騒音下における単語認識性
能の劣化を防止する方法が示されている。
【0006】これらの方法は、音声認識装置の設計の自
由度という観点から考えると、使用環境において、適切
な集音の方法を与えることにより妨害音を除去する方
法、適切な信号処理により妨害音を除去する方法、また
は適切な写像を選ぶことにより音声と妨害音を分離する
方法であるということがいえる。
【0007】一方、機械から人間へのメッセージの伝え
方として、自然言語を前提とするものは従来から開示さ
れている。自然言語を用いないと考えられるものとし
て、特開昭54−153070では、時計の時刻を自然
言語ではなく、「ドレミファ...、」などの音と数字
を1対で対応させることで時刻を知らせるという装置を
開示している。これは、自然言語を用いない機械から人
間への情報の伝え方であるが、人間から機械への情報伝
達は音声にはよらず、会話システムではない。
【0008】また、人間から機械への情報伝達手段とし
て、特開昭61−110837では手叩きや笛で遠隔操
作ができるようにした装置を開示している。この請求項
1では、「離れた所から電源のON、OFFやその他の
制御が可能な、遠隔制御式空気調和機の制御方式に於い
て、一定時間内に任意の数の音波を断続入力することに
より、空気調和機の運転、停止を行なうことを特徴とす
る空気調和機の制御方式」となっている。背景としてワ
イヤレスリモコン(ワイヤレスリモートコントローラ)
では落としたり紛失したりするという欠点を挙げている
が、対雑音特性、対妨害音に関しての音素の設計に関し
ては述べられていない。また、この例も人間から機械へ
の一方向の情報伝達であり、会話システムではない。
【0009】このように、従来の音声認識装置は、設計
の自由度という観点から考えると、 (1) 集音の方法を与え、妨害音を除去する。 (2) 適切な信号処理により、妨害音を除去する。 (3) 適切な写像を選ぶことにより、音声と妨害音を
分離する。 という観点で設計の最適化が計られている。
【0010】
【発明が解決しようとする課題】上述のように、自然言
語を用いた音声認識、音声合成では会話システムは開示
されているが、現状において、自然言語による自然な会
話は技術的にはまだ困難である。特に認識に関しては対
妨害音、対雑音特性もあわせると通常のオフィスや家庭
の環境の中では、非常に困難である課題があった。
【0011】また、自然言語を用いない合成装置あるい
は認識装置はそれぞれ単独で開示されているが、それら
は対妨害、対雑音特性の向上のために導入されたもので
はなく、従って、会話システムをそこから推測すること
はできない課題があった。
【0012】本発明はこのような状況に鑑みてなされた
ものであり、対妨害音、対雑音特性を考慮に入れ、かつ
1つ以上の機械と1人以上の人間が互いに伝達情報を確
認可能な会話システムを実現することができるようにす
るものである。
【0013】
【課題を解決するための手段】請求項1に記載の音声認
識装置は、雑音や妨害音が存在する環境で音声認識を行
う音声認識装置において、雑音や妨害音と分離が容易な
音響特性を有する音素あるいは音素の時系列より構成さ
れた音を分析する分析手段を備えることを特徴とする。
【0014】分析手段による分析結果を、所定の次元の
分析空間に所定の順序でそれぞれ並べたとき、分析結果
の特徴点の位置は、分析空間と時間軸で構成された時系
列分析空間において、所定の規則に従った動きをするよ
うにすることができる。
【0015】特徴点は、分析空間における分析結果の極
大値あるいは極小値より選ばれた点であるようにするこ
とができる。
【0016】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
【0017】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
【0018】音のピッチは、所定の時間以上、所定の範
囲以上に変化しないようにすることができる。
【0019】音素は、母音であるようにすることができ
る。
【0020】分析手段は、線形の畳み込み演算を行うよ
うにすることができる。
【0021】Hidden Markov Model
を含む認識手段をさらに設け、認識手段により、分析手
段による分析結果に対応する音が認識されるようにする
ことができる。
【0022】請求項10に記載の音声合成装置は、雑音
や妨害音が存在する環境で音声合成を行う音声合成装置
において、雑音や妨害音と分離が容易な音響特性を有す
る音素あるいは音素の時系列より構成された音を合成す
る合成手段を備えることを特徴とする。
【0023】音を所定の分析方法で分析した分析結果
を、所定の次元の分析空間に所定の順序でそれぞれ並べ
たとき、分析結果の特徴点の位置は、分析空間と時間軸
で構成された時系列分析空間において、所定の規則に従
った動きをするようにすることができる。
【0024】特徴点は、分析空間における分析結果の極
大値あるいは極小値より選ばれた点であるようにするこ
とができる。
【0025】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
【0026】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
【0027】音のピッチは、所定の時間以上、所定の範
囲以上に変化しないようにすることができる。
【0028】音素は、母音であるようにすることができ
る。
【0029】請求項17に記載の音声認識合成装置は、
雑音や妨害音が存在する環境で音声認識と音声合成を行
う音声認識合成装置において、雑音や妨害音と分離が容
易な音響特性を有する音素あるいは音素の時系列より構
成された音を分析する分析手段と、雑音や妨害音と分離
が容易な音響特性を有する音素あるいは音素の時系列よ
り構成された音を合成する合成手段を備えることを特徴
とする。
【0030】音の分析手段による分析結果を、所定の次
元の分析空間に所定の順序でそれぞれ並べたとき、分析
結果の特徴点の位置は、分析空間と時間軸で構成された
時系列分析空間において、所定の規則に従った動きをす
るようにすることができる。
【0031】特徴点は、分析空間における極大値あるい
は極小値より選ばれた点であるようにすることができ
る。
【0032】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して所定の傾きを
持った動きであるようにすることができる。
【0033】時系列分析空間上における特徴点の位置の
動きは、所定の時間以上、時間軸に対して平行な動きで
あるようにすることができる。
【0034】音のピッチは、所定の時間以上、所定の範
囲以上に変化しないようにすることができる。
【0035】音素は、母音であるようにすることができ
る。
【0036】分析手段は、線形の畳み込み演算を行うよ
うにすることができる。
【0037】Hidden Markov Model
を含む認識手段をさらに設け、認識手段により、分析手
段による分析結果に対応する音が認識されるようにする
ことができる。
【0038】
【作用】請求項1に記載の音声認識装置においては、分
析手段により、雑音や妨害音と分離が容易な音響特性を
有する音素あるいは音素の時系列より構成された音の分
析が行われる。従って、妨害音あるいは雑音の影響を受
けずに目的の音を検出あるいは認識することができる。
【0039】請求項10に記載の音声合成装置において
は、合成手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音が合成される。従って、妨害音あるいは雑音の影響を
受け難い目的の音を合成することができる。
【0040】請求項17に記載の音声認識合成装置にお
いては、分析手段により、雑音や妨害音と分離が容易な
音響特性を有する音素あるいは音素の時系列より構成さ
れた音の分析が行われ、合成手段により、雑音や妨害音
と分離が容易な音響特性を有する音素あるいは音素の時
系列より構成された音が合成される。従って、妨害音あ
るいは雑音の影響を受けずに目的の音を検出あるいは認
識することができ、妨害音あるいは雑音の影響を受け難
い目的の音を合成することができる。
【0041】
【実施例】図1は、本発明を応用した対話システムの一
実施例の全体の構成を示すブロック図である。この実施
例において、音響信号分析部101(分析手段)は、時
間tの関数とみなせる入力の音響信号g(t)を分析す
る。音名認識部102(認識手段)は、音響信号分析部
101からの出力をさらに解析して、音名を認識する。
発話生成部103(合成手段)は、音名認識部102の
認識結果により、同様に音名を用いて所定のメッセージ
を作りだす。音響信号合成部104は発話生成部103
により作成されたメッセージを音響信号に変換するよう
になされている。
【0042】次に、その動作について説明する。例えば
マイクロフォンなどにより検出された音響信号g(t)
は、音響信号分析部101に入力され、そこで周波数分
析が行われ、音名認識部102にその周波数構造に対応
するデータが供給される。音名認識部102において
は、音響信号g(t)の周波数構造に基づいて、例えば
音楽でいうところのドレミ...、などの音名が検出さ
れ、その時系列より音楽の和音のアルペジオ表現として
コードが認識され、対応する単語あるいはセンテンスと
して認識される。
【0043】発話生成部103においては、音名認識部
102の認識結果および発話生成部103内部の内部状
態により、同じく音名で構成された時系列が生成され、
音響信号合成部104に供給される。音響信号合成部1
04においては、発話生成部103からの結果が音響信
号に変換され、スピーカなどを駆動する信号として出力
される。
【0044】ここで、音名とは音楽のドレミ...など
のことで、C,D,E,...という表現も用いられ
る。コードとは和音のことであるが、この実施例では分
散和音あるいはアルペジオと呼ばれる、タイミングをず
らして和音の構成音を順次出力してできる音の時系列の
ことである。
【0045】以下、それぞれのブロックに分けて説明を
加える。図2は音響信号分析部101の詳細な構成を示
すブロック図である。A/D変換部201は、アナログ
の入力信号g(t)をデジタル信号g(k)に変換して
出力するようになされている。入力信号バッファ202
は、入力されたデジタル信号g(k)を記憶する。周波
数分析部203は、入力された信号に対してフーリエ変
換処理を施し、変換結果を出力するようになされてい
る。
【0046】例えば、アナログの入力信号g(t)がA
/D変換部201に入力されると、A/D変換部201
において、それがデジタル信号g(k)に変換され、出
力される。ここでk=0,1,2,..,は標本化列の
indexである。
【0047】A/D変換部201は、例えば、折り返し
雑音防止のためのLow PassFilter(LP
F)と16bitで8kHzの標本化周波数をもつA/
D変換器より構成されている。このデジタル信号g
(k)は、入力信号バッファ202において512標本
(g(0),g(1),..,g(N−1),N=51
2として表す)がひとつのブロックとして蓄えられ、周
波数分析部203においてそのブロックがフーリエ変換
され、周波数分析が行なわれる。入力信号バッファ20
2より出力される信号(flg)は、入力信号バッファ
202に512個のデータが蓄えられたことを示す信号
であり、この信号(flg)が供給されたタイミング
で、周波数分析部203は512個のデータからなる1
つのブロックの信号(vect_g)を入力信号バッフ
ァ202より入力する。これは次の式1で表される。
【0048】 (式1) vect_g=[g(0),g(1),..,g(511)]^t
【0049】式1において、^tはマトリクスの転置を
表す。すなわち、vect_gは512行1列のマトリ
クス、あるいは列ベクトルである。周波数分析部203
でのフーリエ変換とは次の式2で表される処理である。
【0050】 (式2) G(w,m)=vect_g^t・vect_kernel(w)
【0051】式2において、変数mは周波数分析の結果
を時系列として扱うためのindexである。また、式
2においてvect_kernel(w)は次の式3で
表されるベクトルである。
【0052】 (式3) vect_kernel(w) =[exp(−j2πw×0/512), exp(−j2πw×1/512),..,exp(−j2πw511 /512)]
【0053】式3において、jは虚数を表し、πは円周
率を表す。変数w=0,1,2,..,511は周波数
のindexである。実際の周波数は標本化周波数fs
に対応してfs×w/N(Nはブロックの長さ、この例
ではN=512)で表される。また、通常は信号のベク
トルvect_gに窓関数なるものを掛け算したのちに
式3の変換を行なうが、今回は簡単のため方形型の窓関
数を想定し、掛け算を省略している。
【0054】さらに、この実施例では同じピッチ周波
数、あるいは同じindexのフーリエ変換の出力があ
る程度の時間だけ継続することを、検出するべき音の特
徴として利用するため、式2のG(w,m)を変数w毎
に変数mに関してLow Pass Filterを施
すことにする。実際には、移動平均によりLow Pa
ss Filterの代用をする。すなわち、[G
(w,m)+G(w,m+1)+,..+G(w,m+
MM−1)]/MMを出力とする。この実施例では、変
数MM=3とする。以下、簡単のためこの値[G(w,
m)+G(w,m+1)+,..+G(w,m+MM−
1)]/MMをG(w,m)として表すものとする。
【0055】次に、図1の音名認識部102の詳細を図
3に示す。音名認識部102はさらに3つの処理を行う
部分から構成されている。1番目は入力信号G(w,
m)より音名および音の大きさを検出する音名検出部3
01、次に検出された音名tone(m)よりそれを時
系列として音楽のコード(chord(l))を認識す
るコード認識部302、ただし、ここでl=0,
2,..,はコードを時系列データとしたときのind
exである。最後にchord(l)を時系列として捕
らえてコマンド解釈し、システムに対する入力センテン
ス(com(p))を出力するコマンド解釈部303で
ある。
【0056】次に、各部の動作を説明する。
【0057】まず、音名検出部301の動作を説明す
る。音名検出部301は、音楽の音名に相当するものを
検出する。実際には、フーリエ変換のindexで代理
表現する。G(w,m)は、標本化周波数8000Hz
とフーリエ変換に用いた点が512点であることから、
式4で与えられる周波数分解能Δfをもつ。
【0058】 (式4) Δf=8000/512=15.625(Hz)
【0059】すなわち、G(w,m)のw=0,1,
2,...,は周波数の値としては、Δf×wに対応す
る。
【0060】一方、音楽の音名(ドレミファソラシ)あ
るいはそれらの半音異なる音の周波数は、周波数440
Hzを基準のオクターブのラの周波数として、オクター
ブをlogスケールで12等分した周波数が割り当てら
れる。簡便のため、ドの音としてf_do_ref=1
30.81Hzを基準周波数としたときの場合を式5に
示す。
【0061】 (式5) f(i,oct)=f_do_ref×2(i/12)×2(oct)
【0062】式5において、変数i=0,1,
2,...,11はド、ド#、レ、レ#、...,シと
1オクターブ中の音名を周波数順にならべたinde
x、変数oct=..,−1,0,1,2,..は、f
_do_refと同じオクターブを0としたオクターブ
のindexである。ただし、この実施例では有効なオ
クターブは標本化周波数より4000Hz以上は識別で
きないものとし、また、周波数分解能Δf=15.62
5Hzから隣合う音の周波数が簡単に識別できるoct
=0(f_do_ref=f(0,0)を最低の周波数
として想定する)とする。すなわち、変数oct=0,
1,2,3,4とする。
【0063】音名検出部301の処理手順を図4のフロ
ーチャートで示す。ステップS1において、音名検出部
301は、フーリエ変換の結果G(w,m)の最大値検
出を行なう。最大となるときの周波数のindexであ
るw=w_maxとする。次に、ステップS2に進み、
変換結果G(w,m)の絶対値の平均値mean=(|
G(0,m)|+|G(1,m)|+...+|G(5
11,m)|)/512を演算する。
【0064】次に、ステップS3において、フーリエ変
換の結果の最大値の絶対値|G(w_max,m)|
が、変換結果|G(w,m)|の平均値meanより適
当な倍数A以上の大きさであるか否かを判定する。この
実施例では、例えば倍数A=3とする。フーリエ変換の
結果の最大値の絶対値|G(w_max,m)|が、変
換結果|G(w,m)|の平均値meanより倍数A以
上の大きさであると判定された場合、ステップS4に進
み、tone(m)=w_maxとする。また、音の大
きさlevel(m)=|G(w_max,m)|と定
義する。
【0065】一方、フーリエ変換の結果の最大値の絶対
値|G(w_max,m)|が、変換結果|G(w,
m)|の平均値meanより倍数A以上の大きさではな
いと判定された場合、ステップS5に進み、tone
(m)=−1として無効であることを示す。また、音の
大きさlevel(m)=|G(w_max,m)|と
定義する。
【0066】ステップS4およびS5において、ton
e(m)はフーリエ変換のindexそのものであるこ
とに注意する。すなわち、Δf×tone(m)が実際
の周波数を表し、これを音楽の音名に変換する必要があ
る。この変換は、次のコード認識部302において行な
われる。また、上述したように、音の大きさlevel
(m)=|G(w_max,m)|と定義し、後述のコ
ード認識部302において無音検出などを行なう。
【0067】次に、図5のフローチャートを参照して、
コード認識部302の処理手順について説明する。ステ
ップS11において、後述する多数決フィルタにより、
tone(m)に対して揺らぎや雑音による誤検出の影
響を軽減する処理を施したf_tone(m)を求め
る。ここでは、音名検出部301の出力tone(m)
を時系列データとして扱う。m=0,1,2,..は標
本列512点を1ブロックとするため、標本化周波数を
8000Hzとすると、64msec(=1/8000
×512)の時系列データとなる。まず、時間方向にフ
ィルタリングをして揺らぎや雑音による誤検出の影響を
軽減する。この実施例では、10データの多数決フィル
タをかける。これは、次の式6で定義される処理であ
る。
【0068】 (式6) f_tone(m)=tone(m),tone(m+1), ..,tone(m+9) で最も標本数の多いもの
【0069】ただし、少なくとも4つ連続していなけれ
ば無効とする。また、同時に無音部をlevel(m)
を用いて検出する。無音とは、1sec以上の時間、l
evel(m)<Thとなるような状態が続くこととす
る。ここで、1secは64msecの時系列が16回
続くこととし、Thは適当なスレショルド値とする。こ
の実施例では、この値Thは予めターゲットの音を入れ
ずに環境音だけでデータをとり、そのレベルの平均値の
定数倍(例えば2倍)としている。無音部が検出された
場合、chord(l)=NULLとしてコマンド解釈
部303にその情報を伝えるものとする。
【0070】ステップS12において、まず、f_to
ne(m)をフーリエ変換のindexから音名のin
dexに変換する。すなわち、周波数に変換したΔf×
f_tone(m)の値と、式5のf(i,oct)と
を、i=0,1,2,..,11,oct=0,1,
2,3,4で比較し、最も近い周波数f(i_max,
oct_max)のindexである、i_max,o
ct_maxを求める。次に、ステップS13におい
て、簡便のため、p_tone(m)=i_max+o
ct_max×12とする。
【0071】次に、ステップS14に進み、音の大きさ
level(m)が所定のスレショルド値Thより小さ
いか否かが判定される。level(m)がスレショル
ド値Thより大きいかまたは等しいと判定された場合、
処理を終了する。一方、level(m)がスレショル
ド値Thより小さいと判定された場合、ステップS15
に進み、無音が続く回数をカウントするための変数(m
uon_count)の値を1だけカウントアップす
る。
【0072】次に、ステップS16において、変数mu
on_countの値が値16より大きいかまたは等し
いか否かが判定される。変数muon_countの値
が値16より小さいと判定された場合、無音状態ではな
いとされ、処理を終了する。一方、変数muon_co
untの値が値16より大きいかまたは等しいと判定さ
れた場合、無音状態であるとされ、ステップS17に進
み、変数(muon_count)の値を0に初期化す
る。
【0073】次に、ステップS18に進み、無音部より
以前の最大4つの連続する異なるp_tone(m)を
検出する。次に、その検出方法について説明する。
【0074】まず、p_tone(m)を分析してp_
tone(m)が無音部に対応する部分より以前の連続
する3つ、あるいは4つの音名を求める。いま、ind
exであるmが所定の値Mのとき無音が検出されたとす
る。このとき、m=M−15,..,Mまでは無音であ
るので、m=M−16から順次時間を遡って、p_to
ne(m)を調べていく。p_tone(m),m=M
−16,M−17,..,と調べて、最大4つの異なる
音名が検出されるまで、あるいはメモリを全て調べ尽く
すまで検査をする。このようにして、連続する3つの異
なる音名、あるいは4つの異なる音名を検出する。
【0075】次に、ステップS19に進み、ステップS
18において、連続する3つの異なる音名、あるいは4
つの異なる音名が検出されたときのみ、それらの音名を
用いてコード(chord(l))を検出あるいは認識
し、処理を終了する。
【0076】最大4つの異なる音名とした理由は以下に
述べるコードの検出あるいは認識を簡便に行なうためで
ある。コードにはMajor,minor,7th,m
inor7th,diminishなどさまざまなコー
ドが定義されているが、この実施例では簡便のためMa
jor,minor,7thのみを検出し、そのほかの
コードは無効とする。また、音名の並びかたは低い音か
ら順番に時間軸上に並んでいるものとし、それ以外の順
番で入力されたものも無効とする。ただし、後述するよ
うに、センテンスの終了を示すものとして高い音から順
に並べたものを用いる。ここで再び、p_tone
(m)を音名とオクターブにわけた表現に直した後に行
なう。これは、式5におけるiとoctによる表現であ
り、次の式7、および式8で定義される。
【0077】 (式7) i_max=p_tone%12
【0078】 (式8) oct_max=(p_tone−i_max)/12
【0079】式7において%は割り算の余りを取ること
を意味する。ここで、音楽における標記法との対応は次
のようになる。i=0,1,2,..,11の順番に、
C,C#(Db),D,D#(Eb),E,F,F#
(Gb),G,G#(Ab),A,A#(Bb),Bで
ある。()内はたとえばC#とDbは同じ音の異なる標
記であることを示す。
【0080】コードの検出は例えばC,E,Gという3
音が時間軸上で並んでいればC−Major、C,D
#,GであればC−minor、C,E,G,A#であ
ればC−7thであるとする。その他の対応を図6に示
す。実際のchord(l)は文字列情報として”C0
−Major”,”C0−minor”などのコード名
称が入っているものとする。ここで、C0の0はオクタ
ーブを示しており、”C0−Major”は式5におけ
るoct=0,i=0に対応する音名を基音とするMa
jor chordである。また、前述のように無音は
chord(l)=NULL、すなわちNULL st
ringであり、無効なコードはchord(l)=”
NG”を送るものとする。
【0081】また、前述のように高い音から順に時系列
が並んでいるコードはセンテンス終了を表すものとし
て、chord(l)=”end−D1−Major”
などのように文字列の先頭に”end−”という文字を
付加して送る。このようにして得られたコードchor
d(l)は、次にコマンド解釈部303へ入力される。
ここで、l=0,1,2,..はchord(l)を時
系列データとして扱うためのindexであり、コード
を検出するごとに増えていく。また、適当な数あるいは
コマンド解釈が成立したときにクリアされる。
【0082】次に、図7のフローチャートを参照して、
コマンド解釈部303の処理手順について説明する。コ
ード解釈を通常の音声認識の単語認識とすれば、コマン
ド解釈はセンテンスの認識となる。従って、最初に、ス
テップS21において、センテンスの句点に相当するc
hord(l)として前述のように文字列”end−”
が付加されているものを検出する。すなわち、chor
d(l)の最初の4文字が”end_”であるか否かが
判定される。chord(l)の最初の4文字が”en
d_”ではないと判定された場合、ステップS23に進
み、bufferにchord(l)を記憶させ、次
に、lを1だけカウントアップし、処理を終了する。
【0083】一方、chord(l)の最初の4文字
が”end_”であると判定された場合、すなわち、セ
ンテンスの終了が検出された場合、ステップS22に進
み、”end−”が付加されたchord(l)のin
dexであるl=Lとし、chord(L)に付加され
た文字列”end−”を除いておく。また、後述するH
パターンを指示するindexであるhに0を代入して
初期化しておく。
【0084】次に、ステップS24以降で、chord
(L)以前にbufferに溜められているchord
(l)(ここで、l=0,1,2,...,L−1,
L)をセンテンスとして認識する。この実施例では簡便
のため、予め記憶されている所定数H種類のパターン
(temp(h)(ただし、h=0,1,..,H−
1))のどれかと完全に一致しているかどうかを検査し
てコマンド解釈をする。
【0085】すなわち、ステップS24において、ch
ord(0),chord(1),...,chord
(L)が、Hパターンtemp(h)のいずれかと等し
いか否かが判定される。chord(0),chord
(1),...,chord(L)が、Hパターンte
mp(h)のいずれとも等しくないと判定された場合、
ステップS25に進み、indexであるhを1だけカ
ウントアップする。
【0086】次に、ステップS26において、inde
xであるhが所定数Hと等しいか否か、すなわち、ch
ord(0),chord(1),...,chord
(L)が、Hパターンtemp(h)のどれとも等しく
ないか否かが判定される。indexであるhが所定数
Hと等しくないと判定された場合、ステップS24に戻
り、ステップS24以降の処理が繰り返し実行される。
一方、indexであるhが所定数Hと等しいと判定さ
れた場合、ステップS27に進む。
【0087】一方、ステップS24において、chor
d(0),chord(1),...,chord
(L)が、パターンtemp(h)と等しいと判定され
た場合、ステップS27に進む。
【0088】ステップS27においては、コマンド解釈
の結果としてのcomp(p)としてhを出力し、次
に、comp(p)のindexであるlを0に初期化
し、処理を終了する。
【0089】このようにして、解釈されたコマンドをc
om(p)=0、または1、または2,..,またはH
−1として出力する。なお、H種類のパターンのどれと
も一致しなかった場合、com(p)=Hとして出力す
る。
【0090】以上で、音名認識部102の構成と処理の
説明を終える。
【0091】次に、図1の発話生成部103の説明に移
る。図8は、発話生成部103の詳細な構成例を示すブ
ロック図である。図8に示すように、発話生成部103
は内部状態決定部401と発話内容決定部402より構
成される。発話生成部103には、音名認識部102の
コマンド解釈部303(図3)の出力である認識結果
(comp(p))が入力されるようになされている。
内部状態決定部401には図示せぬバッテリからの電源
電圧が供給され、内蔵するタイマやバッテリ電圧を監視
するバッテリセンサなどからの情報も入力されるように
なされている。
【0092】内部的なタイマあるいはバッテリ電圧を監
視するバッテリセンサなどの情報が内部状態決定部40
1に入力されると、それに従って状態遷移がおきる。こ
の実施例では、この状態は、簡便のため3状態であり、
バッテリセンサの値が所定のスレショルド値THR_1
以下であれば状態1(OUT_S=1)であり、バッテ
リセンサの値がスレショルド値THR_1以上であり、
かつ所定のスレショルド値THR_2以下であれば状態
2(OUT_S=2)であり、バッテリセンサの値がス
レショルド値THR_2以上であれば状態3(OUT_
S=3)であるとする。また、別の信号Nowを設け、
内部タイマにより20秒ごとにNow=1となるように
する。この信号Nowを、発話内容決定部402に出力
する。
【0093】一方、発話内容決定部402は、コマンド
解釈部303から受けた認識結果と、前述の内部状態決
定部401の出力OUT_Sを受け取り、適当な規則に
より発話すべき内容を決定する。規則として、この実施
例はコードによる会話をするものとしてあるので、例え
ば音階の時系列として予め登録してあるK個のコードに
よるセンテンスが入力されたときの出力をテーブルとし
て持つこととする。センテンス数を6としてテーブルの
例を図9に示す。これは、前述のコマンド解釈部303
において無音をいれたコマンド数H=7としたものにな
る。センテンスT0,..,T6には適当なコードの時
系列chord(l’)と、楽器の種類、1つの音の長
さ、大きさを表すパラメータparam(l’)が記憶
されている。ここではparam(l’)をプログラミ
ング言語Cの記法にならって、それぞれparam
(l’).kind,param(l’).lengt
h,param(l’).levelと表す。
【0094】説明を分かりやすくするために、この実施
例がロボット装置に組み込まれているものとして、テー
ブルのセンテンスに意味を付けてみる。センテンスT1
は「前進」を意味する。センテンスT2は「止まれ」を
意味する。センテンスT3は「バッテリを交換してくだ
さい」を意味する。センテンスT4は「頑張れ」を意味
する。センテンスT5は「はい」を意味する。センテン
スT6は「いいえ」を意味する。なお、センテンスT0
は発話しないという意味である。また、出力信号S1,
S2,S3はそれぞれ内部状態決定部401の出力であ
り、上述した状態1、状態2、状態3に対応する。ま
た、センテンス入力がT0での出力は、上述した内部状
態決定部401の出力Now=1であるか、Now=0
であるかによって異なる。
【0095】例えば、図9に示したような規則により、
「前進」、「止まれ」などの指示に対して、「はい」、
「いいえ」で答え、また、音声入力がなく、バッテリが
なくなってきたときには、「バッテリを交換してくださ
い」とお願いし、他のロボットが、「バッテリを交換し
てください」と言っているときには、「頑張れ」と答え
るようなシステムが構成できる。
【0096】例えば、何も指示されず(センテンスT0
が入力され)、かつバッテリがなく状態S1である場
合、ロボットは、20秒毎に信号Now=1が入力され
る度に、センテンスT3「バッテリを交換してくださ
い」を発話する。状態S2およびS3のときは、何も発
話しない。また、「前進」(センテンスT1)を指示す
ると、状態S1のとき、「いいえ」(センテンスT6)
と答え、状態S2およびS3のとき、「はい」(センテ
ンスT5)と答える。
【0097】「止まれ」(センテンスT2)と指示する
と、「はい」(センテンスT5)と答え、他のロボット
が「バッテリを交換してください」(センテンスT3)
と発話すると、「頑張れ」(センテンスT4)と答え
る。また、他のロボットから「頑張れ」(センテンスT
4)と発話されるか、または「頑張れ」と指示される
と、「はい」(センテンスT5)と答える。また、セン
テンスT5(「はい」)およびセンテンスT6(「いい
え」)に対しては何も答えない。
【0098】次に、音響信号合成部104の説明に移
る。図10は、音響信号合成部104の内部の詳細な構
成例を示すブロック図である。音響信号合成部104で
はコードの時系列chord(l’)とパラメータpa
ram(l’)を用いて、音名生成部501にてコード
情報を音名の時系列o_tone(m’),m’=0,
1,2,...に変換し、さらに、シンセサイザ部50
2でo_tone(m’)とparam(l’)によっ
て決定される1次元波形h(k),k=0,1,
2,...を生成し、D/A変換部503でアナログ信
号h(t)(tは時間)として出力する。
【0099】音名生成部501ではコード認識部302
において行われる変換の逆の変換を行なう。すなわち、
コード名に対して通常は低い音から順に音名o_ton
e(m’)を生成していく。例えば、chord
(l’)=”C0−Major”であれば、oct=0
のCの音を基音として、C,E,Gという音名時系列を
生成する。ただし、chord(l’)=”end−C
0−Major”であればG,E,Cという高い音から
順に音名時系列を生成するものとする。実際のo_to
ne(m’)のデータは、式5のiとoctに対してi
+oct×12の0以上の整数値を取るものとする。す
なわち、chord(l’)=”C0−Major”で
あれば、o_tone(0)=0,o_tone(1)
=4,o_tone(2)=7,o_tone(3)=
−1という出力になる。なお、o_tone(3)=−
1は無音を意味するデータとする。
【0100】次のシンセサイザ部502では、このo_
tone(m’)とparam(l’)を用いて実際の
音響信号のデジタル波形h(k)を生成する。簡便のた
め、chord(l’)=”C0−Major”とし、
これにより、o_tone(m’)として、前述の出力
(0,4,7,−1)が入力されたものとする。一方、
param(l’)で設定された長さ、大きさ、種類を
ここで設定する。シンセサイザとしては現在市販の電子
楽器、パーソナルコンピュータあるいはビデオゲーム機
などに、安価なFM音源あるいはサンプリング音源のL
SIが搭載されている。
【0101】この実施例では簡便のため、予め5種類の
電子楽器の音を8000Hzサンプリングした波形を記
憶しておき、その大きさと長さを変化させることによっ
てh(k)を生成するものとする。通常のシンセサイザ
LSIは基本周期の音を記憶し、それにサンプリングレ
ートを変換するフィルタを施すことにより様々な音名を
作り出すが、この実施例では簡便のためすべての種類の
すべての音名の音を約1sec分記憶し、param
(l’).lengthで指定された長さで振幅を0に
することで長さのコントロールを行なう。したがって、
1secより長い音は設定しないものとする。大きさに
関しては、前述のとおり記憶波形をparam(l’)
/256倍するものとする。最後のD/A変換部では、
8000HzのサンプリングレートでD/A変換を行な
い、アナログ信号h(t)を得る。
【0102】以上で音響信号生成部104の説明を終え
る。
【0103】この実施例のポイントは、環境雑音や妨害
波に対して分離性能の高い音響信号を組み合わせること
により、頑強な認識システムおよび合成システムを組み
合わせて対話するようなシステムを構築することにあ
る。この実施例のシステムは、口笛で使用する場合、通
常のオフィス空間ではもちろん、入力信号g(t)に人
の会話が混入している場合でも、正常に動作する。その
理由として、まず、自然発話における周波数構造におい
ては、スペクトルが広がって分布するため口笛や楽器音
のような特定の周波数に集中した音よりはスペクトルピ
ークが低くなってしまうこと、また、例えば日本語の発
話においては安定なピッチを保って発声することは非常
に不自然であり、通常の会話では20msecの分析長
ピッチを検出して、同一のピッチが連続することはほと
んどないことが上げられる。
【0104】ピッチ周波数の変化は文章や状況によって
異なるが、典型的なパターンとして、500msecで
ピッチ周波数が100Hz乃至200Hzの間を上がっ
て、下がってという変化をすることから、この実施例の
ように、式3の結果に各周波数毎にLow Pass
Filterを施し、式6のような多数決フィルタと4
ブロック(256msec)の連続を認識条件としてい
る場合、人間の会話がこの条件を満たすことはほとんど
ない。
【0105】この実施例では、周波数分解能が約16H
zであったが、周波数分析部203において、フーリエ
変換ではなく、例えば並列に分解能が数Hzのバンドパ
スフィルタを用いて分析することにより、周波数の揺ら
ぎをもっと細かく分析することによって、自然発話の音
声とこの実施例で認識するために発話された音声を区別
することも可能である。したがって、この実施例のよう
に音名の進行を組み合わせて情報を伝達することによ
り、オフィスや家庭内の空間などにおいて通常の人間の
自然な会話が妨害音として存在しているときでも、機械
と人間の間、機械と機械の間、あるいは人間と人間の間
でさえも疑似的な会話をすることが可能となる。
【0106】これは、従来の音声認識が妨害音の除去や
妨害音とターゲットの音声に対して、その2つを適切に
分離するような写像を作ろうとしているのに対し、この
実施例では、存在する妨害音に対して分離しやすい音響
信号を組み合わせて対妨害特性を上げようとするもので
あり、それが新しい方法論となっている。すなわち、従
来では例えば写像のみが対雑音特性の向上のための認識
器の設計の自由度であるのに対し、この実施例では、写
像はもちろん、ターゲットの音響信号そのものの構成の
仕方にも自由度が与えられている。
【0107】図11は、本発明を応用した対話システム
の他の実施例の構成を示すブロック図である。この実施
例は、音名ではなく雑音に強い母音だけで形成された音
素列を認識、合成することにより、対雑音、対妨害音特
性を向上させるものである。図11にこの実施例の全体
の構成を示す。この実施例においては、構成は大きく2
つに別れる。A/D変換部601、音声認識部602、
音声区間検出部603、および制御部604は音声認識
システム607(認識手段)を構成し、発話生成部60
5および音声生成部606は音声合成システム608
(合成手段)を構成し、両方で対話システムを構成して
いる。
【0108】この実施例の構成を説明する前に、この実
施例で用いているHMM(Hidden Markov
Model)という音声認識手法について、様々な文
献や特許に説明されているが、ここでも、簡単に説明す
る。
【0109】いま、特徴ベクトルが、所定の音声カテゴ
リwsに対応するものである確率を、P(ws,y)と
表現した場合、次の式9で示す値を最大にする音声ws
に特徴ベクトルyが属するということができる。
【0110】 (式9) P(ws,y)=P(ws)P(y|ws)
【0111】ただし、式9においてP(ws)は音声w
sが発生される事前確率であり、P(y|ws)は音声
wsが発生されたときに、特徴ベクトルyが得られる確
率である。HMM法は、式9のP(ws,y)を最大に
する音声wsを推定する方法である。HMMのモデルは
図12(a)に示すように、状態S1,S2,...,
SN,(Nは状態数)と、状態間の遷移をあらわすパス
から構成され、状態の遷移に伴い、シンボルを出力す
る。
【0112】音声認識においては、図12(b)に示す
ように、自分自身と次の状態に遷移するパスのみを有す
るモデルが一般的に使用される。HMM法のうち離散的
HMM法では、音声の特徴ベクトルを例えばベクトル量
子化処理することなどにより得られるシンボルの系列Y
=(y1,y2,..,yT)が各モデルで生起される
確率が計算され、その確率が最も大きいモデルが認識結
果となる。
【0113】ここで、 N: モデルの有する状態数 Y=(y1,..,YT):シンボル系列 T: シンボル系列長 a_i_j: 状態i(Si)から状態j(Sj)へ遷
移する遷移確率 b_i_j(k): 状態iから状態jへ遷移するとき
にシンボルkが生起される出力確率。 K: シンボル数(シンボルの種類) π=(π1,π2,..,πN): 初期状態が状態i
である確率を示す初期状態確率 のようにパラメータを表すとすると、モデルθからシン
ボル系列Yが観測される確率P(Y|θ)は次のように
して求めることができる。
【0114】(ST1)初期状態確率πに基づいて初期
状態iを決定し、時刻t=1とする。 (ST2)遷移確率a_i_jに基づいて状態iから状
態jへの遷移を決定する。 (ST3)出力確率b_i_j(k)に基づいて状態i
から状態jへ遷移するときに出力するシンボルy_tを
決定する。 (ST4)t=t+1,i=j,t<=Tであれば、S
T2へ戻る。
【0115】なお、音声認識においては、初期状態また
は最終状態はそれぞれ1つとするのが一般的であり、以
下、t=1における状態をS1、t=Tにおける状態を
SNとする。したがって、初期状態確率はπ1のみでそ
の他はすべて0となる。
【0116】モデルθがシンボル系列y1,y
2,..,ytを出力して状態iにいる前方予測確率を
αi(t)とすると、上述したモデルの出力の定義
((ST1,ST2,ST3,ST4))から、モデル
θがシンボル系列Y=(y_1,y_2,...,y_
T)を出力する確率P(Y|θ)は次のようにして計算
できる。
【0117】 (式10) t=1のとき、 i=1,α1(t)=1 t=2,3,..,Tのとき、 αi(t)=Σ_j(αi(t−1)×a_i_j ×b_i_j(y_t)) P(Y|θ)=αN(T)
【0118】なお、式10においてΣ_jはサメーショ
ンであり、状態jから状態iへの遷移が許されている場
合のみとられる。したがって、音声から求められたシン
ボル系列Y=(y_1,..,y_T)に対してP(Y
|θ)を最大とするモデルθが認識結果となる。
【0119】次にモデルの学習について説明する。モデ
ルの学習では、学習用のシンボル系列Yから、上述した
前方予測確率αi(t)が求められ、さらに、時刻tに
おいて状態iにいて、以後、シンボル系列y_(t+
1),y_(t+2),...,y_Tを出力する後方
予測確率βi(t)が次の式11により求められる。
【0120】 (式11) t=Tのとき、 i=N,βi(t)=1 t=T−1,T−2,...,1のとき βi(t)=Σ_j(a_i_j×b_i_j(y_(t+1)) ×βj(t+1))
【0121】なお、上式のΣ_jは与えられたモデルに
おいて、状態iから状態jへの遷移が許されている場合
にのみとられる。
【0122】そして、次式にしたがって、a_i_jと
b_i_j(k)が更新される。
【0123】 (式12) γ_i_j(t)=[αi(t−1)×a_i_j ×b_i_j(y_t)×βj(t)]/αN(T) ^a_i_j=[Σ_t(γ_i_j(t))] /[Σ_t(Σ_h(γ_i_h(t)))] ^b_i_j(k)=[Σ_t:y_t=k(γ_i_j(t))] /[Σ_t(γ_i_j(t))]
【0124】なお、^a_i_j、および^b_i_j
(k)はそれぞれ更新された遷移確率および出力確率を
表す。また、上式のh=1,..,Nのサメーションは
状態iから状態hへの遷移が許されている場合にのみと
られる。さらに、t:y_t=kに関するサメーション
は、時刻tにおいてkなるシンボルが生起される場合に
のみとられる。
【0125】式12による学習はBaum−Welch
の再推定法と呼ばれる。
【0126】ここで、式12に従って更新されるa_i
_j、およびb_i_j(k)は、ある学習シンボル系
列1つに対してだけであり、これにより学習が行なわれ
たモデルは、あるシンボル系列だけを高い確率で出力す
るようになる。しかしながら、これでは話者や発話のば
らつきなどに対処することができない。
【0127】そこで、いくつかのシンボル系列を高い確
率で出力するようにモデルθの学習を行なう必要があ
る。これは、例えばQ種類のシンボル系列の、q番目の
シンボル系列をY^q=(y_1^q,...,y_T
^q)としたとき、各シンボル系列Y^q,q=1,
2,..,Qが観測される確率P(Y^q|θ)の積が
最大になるようにモデルθの学習を行なえばよい。
【0128】これは、Baum−Welchの再推定法
を多重系列に拡張した次式によって求めることができ
る。
【0129】 (式13) γ_i_j^q(t)=[αi(t−1)×a_i_j ×b_i_j(y_t^q)×βj(t)]/αN(T) ^a_i_j=[Σ_q(Σ_t(γ_i_j^q(t)))] /[Σ_q(Σ_t(Σ_h(γ_i_h^q(t))))] ^b_i_j(k)= [[Σ_q(Σ_t:y_t^q=k(γ_i_j^q(t)))] /[Σ_q(Σ_t(γ_i_j^q(t)))]]
【0130】以上は、単語に対応するモデルの学習を個
別に行なう場合であるが、実際にはモデルを連結した連
結学習が必要になる。モデルの連結学習では予め用意し
た単語辞書に登録されている単語に基づき、音韻または
音素モデル同士が連結され、これを単語モデルと見なし
て、単語の学習用のシンボル系列として用意されたシン
ボル系列Y^qに対する学習が行なわれる。
【0131】すなわち、M個の音韻または音素モデルの
学習を個別に行なった場合において、そのうちのm番目
のモデル(モデルm)のパラメータ(遷移確率、出力確
率)をそれぞれ、a_i_j^mおよびb_i_j^m
(k)と表し、そのモデルmに音韻あるいは音素モデル
を連結したモデル(連結モデル)の状態をuまたはvで
表す。さらに、連結モデルの状態がuからvへ遷移する
場合において、状態uがモデルmに属する状態であるこ
とを(u−>v)mと表すと、次式にしたがって、a_
i_j^mとb_i_j^m(k)が更新(再推定、学
習)される。
【0132】 (式14) ^a_i_j^m=[Σ_(u=i,v=j)(Σ_q(Σ_t (γ_u_v^q(t))))] /[Σ_(u=i)(Σ_q(Σ_t (Σ_(h:(u−>h)inm)(γ_u_h^q(t)))))] ^b_i_j^m(k)=[Σ_(u=i,v=j)(Σ_q (Σ_t:y_t^q=k(γ_u_v^q(t))))] /[Σ_(u=i)(Σ_q(Σ_t(γ_u_v^q(t))))]
【0133】ここで、連結モデルが同一のモデルmを複
数回使用している場合、例えば、3つの状態S1,S
2,S3からなるモデルmを2回使用して構成されてい
る場合、連結モデルはS1,S2,S3,S1,S2,
S3の6状態を有することになる。したがって、モデル
mの状態S1,S2,S3のうちの例えば先頭の状態S
1は、連結モデルの先頭の状態と4番目の状態と同一と
なる。このように、連結モデルの複数の状態uまたはv
がモデルmの1つの状態iまたはjと同一になる場合が
ある。
【0134】式14において、Σ_(u=i,v=j)
はこのような連結モデルの状態u,vがモデルmの状態
iまたはjと同一である場合、サメーションがとられ
る。さらに、Σ_(u=i)は連結モデルの状態uがモ
デルmの状態iと同一である場合、サメーションがとら
れる。
【0135】また、Σ_(h:(u−>h)inm)は
連結モデルの状態uから状態hへの遷移が許されている
場合で、連結モデルの状態uがモデルmに属するときに
のみとられる。
【0136】さらに、式14において、モデルmの後続
にモデルmが連結されており、連結モデルのある状態u
がモデルmの最終状態(u=N)となった場合、状態u
から遷移先の状態vはモデルmの直後に連結したモデル
の初期状態になるものとする。
【0137】次に、以上説明した離散型HMM法を用い
て音声認識が行なわれる場合について説明する。まず、
学習用に用意された学習系列Yを用いて、上述した式1
2または式13(以下、式13におけるa_i_j^
m,b_i_j^m(k)を式12における場合と同様
にa_i_j,b_i_j(k)と記載する)にしたが
ってモデルの学習(連結学習)がおこなわれ、モデルθ
の遷移確率a_i_jおよび出力確率b_i_j(k)
が求められる。
【0138】そして、認識時において音声からシンボル
系列Yが観測された場合には、モデルθがそのシンボル
系列を出力する確率P(Y|θ)が、式10にしたがっ
て、すなわち、フォワード法によって計算される。な
お、P(Y|θ)の計算はそのほか例えばビタビ法など
によって行なうこともできる。
【0139】以上の処理がモデルθ以外のモデルに対し
ても行なわれ、前述したように確率Pが最も大きいモデ
ルが認識結果とされる。
【0140】次に、図11におけるA/D変換部60
1、音声認識部602、音声区間検出部603、および
制御部604からなる音声認識システム607について
説明する。
【0141】A/D変換部601でマイクなどより入力
された信号を、所定の標本化周波数によってデジタル信
号に変換し、音声認識部602と音声区間検出部603
に出力する。音声認識部602は、例えば図13に示す
ように分析部701(分析手段)、ベクトル量子化部7
02、およびHMM部703から構成される。分析部7
01はA/D変換部601からのデジタル信号を所定の
フレーム単位で音響分析し、その分析の結果得られる音
声の特徴ベクトルをベクトル量子化部702に出力す
る。ベクトル量子化部702は、予め作成されたコード
ブックを用いて、分析部701からの特徴ベクトルをベ
クトル量子化し、その結果得られるシンボルをHMM部
703に出力する。HMM部703は、学習用の音声を
用いて上述したような連結学習が行なわれた音素モデル
(遷移確率a_i_jおよび出力確率b_i_j
(k))を記憶しているモデル記憶部704を有してい
る。
【0142】HMM部703は後述する制御部604
(図11)から供給される音声認識処理に必要な必要情
報にしたがい、モデル記憶部704に記憶されているモ
デルを用いて、ベクトル量子化部702から供給される
シンボル系列から、上述した離散型HMM法による音声
認識を行うようになっている。音声認識の結果得られた
認識結果候補は、制御部604に出力される。
【0143】図11の音声区間検出部603は、A/D
変換部601の出力の短時間パワーまたはゼロクロス数
を算出し、その短時間パワーまたはゼロクロス数が所定
のスレショルド値を超えた区間を音声区間として検出
し、制御部604に出力する。制御部604は、図示せ
ぬ単語辞書を内蔵しており、その単語辞書を参照して、
音声認識の対象とする単語を設定し、その単語を、必要
情報として、音声認識部602を構成するHMM部70
3に出力する。なお、制御部604は音声区間検出部6
03からの音声区間も必要情報としてHMM部703に
出力する。
【0144】また、制御部604はHMM部703から
の認識結果候補を受信し、所定のアルゴリズムにしたが
って、そのうちの少なくとも1つを選択し、これを認識
結果として出力する。
【0145】以上のように構成される音声認識システム
607では次のようにして音声認識が行なわれる。
【0146】音声認識部602では、まず、分析部70
1において、A/D変換部601の出力が所定のフレー
ム単位で例えば、線形予測分析などの音響分析処理がな
され、これにより、所定の次数の線形予測係数が算出さ
れる。さらに、分析部701では、線形予測係数から所
定の再帰式によって、ケプストラム係数(LPC(Li
near Predictive Coding)ケプ
ストラム係数)が算出され、これが特徴ベクトルとし
て、ベクトル量子化部702に出力される。
【0147】ベクトル量子化部702では分析部701
からの特徴ベクトルが、ベクトル量子化され、その結
果、フレーム単位で得られるシンボルが、HMM部70
3に出力される。
【0148】一方、音声区間検出部603では、A/D
変換部601の出力から上述したような方法で音声区間
が検出され、制御部604に出力され、制御部604で
は内蔵する単語辞書を参照して、音声認識対象の単語
(認識対象単語)が少なくとも1つ以上決定される。ま
た、制御部604は音声区間検出部603からの音声区
間を受信すると、その区間と共に認識対象単語を必要情
報として音声認識部602のHMM部703に出力す
る。
【0149】HMM部703では必要情報を受信する
と、そのうち認識対象単語に対応するモデルが、モデル
記憶部704に記憶されている音素モデルを連結するこ
とにより生成される。以上のようにして制御部604か
らの認識対象単語すべてに対応する単語モデルが生成さ
れた後、HMM703では制御部604からの音声区間
において、ベクトル量子化部702から供給されるシン
ボル系列が単語モデルから観測される確率が上述したよ
うにして計算される。そして、その確率が所定値より大
きくなる単語モデルに対応する単語を認識結果候補とし
て制御部604に出力する。制御部604はHMM部か
らの認識結果候補を受信し、所定のアルゴリズムにした
がって、そのうちの少なくとも1つを選択し、これを認
識結果として出力する。
【0150】次に、図11に示した発話生成部605お
よび音声生成部606からなる音声合成システム608
について説明する。
【0151】図14は、発話生成部605の内部の構成
例を示すブロック図である。発話生成部605は、内部
状態決定部801と発話内容決定部802より構成され
る。発話生成部605には、前述の制御部604の出力
である認識結果が入力されるようになされている。
【0152】また、内部状態決定部801には、内部的
なタイマあるいはバッテリ電圧を監視するバッテリセン
サなどの情報が入力され、それに従って状態遷移が起き
るようになされている。この実施例では、この状態は、
簡便のため3状態であり、バッテリセンサの値が所定の
スレショルド値THR_1以下であれば状態1(OUT
_S=1)であり、スレショルド値THR_1以上であ
り、かつ別の所定のスレショルド値THR_2以下であ
れば状態2(OUT_S=2)であり、スレショルド値
THR_2以上であれば状態3(OUT_S=3)であ
るとする。また、別の信号Nowを設け、内部タイマに
より20秒ごとにNow=1となるようにする。この信
号Nowを、発話内容決定部802に出力する。
【0153】一方、発話内容決定部802は、制御部6
04からの認識結果と、前述の内部状態決定部801か
らの出力OUT_Sを受け取り、適当な規則により発話
するべき内容を決定する。規則として、この実施例は単
語による会話をするものとしてあるので、母音の時系列
として予め登録してあるK個の単語が入力されたときの
出力をテーブルとして持つこととする。単語数を6とし
てテーブルの例を図15に示す。
【0154】説明を分かりやすくするために、この実施
例がロボット装置に組み込まれているものとして、テー
ブルの単語に意味を付けてみる。単語T1は「前進」を
意味する。単語T2は「止まれ」を意味する。単語T3
は「バッテリを交換してください」を意味する。単語T
4は「頑張れ」を意味する。単語T5は「はい」を意味
する。単語T6は「いいえ」を意味する。なお、単語T
0は発話しないという意味である。また、出力信号S
1,S2,S3はそれぞれ内部状態決定部801の出力
であり、状態1、状態2、状態3に対応する。また、単
語入力がT0での出力は、前述の内部状態決定部801
の出力Now=1であるか、Now=0であるかによっ
て異なる。
【0155】図15のような規則により前進、止まれな
どの指示に、「はい」、「いいえ」で答え、また、音声
入力がなく、バッテリがなくなってきたときには、「バ
ッテリを交換してください」とお願いし、他のロボット
が、「バッテリを交換してください」といっているとき
には、「頑張れ」と答えるようなシステムが構成でき
る。
【0156】次に、この結果を、母音のみで構成される
音声に変換する音声生成部606について説明する。音
声生成部606は、いわゆる音声合成のシンセサイザ部
であり、この実施例では予め単語レベルで録音してある
ものを選んで出力するものとする。これは、前述の単語
T1から単語T6までを母音のみで構成される単語と対
応付けることと同じであり、前述の音声認識部602で
HMM部703が持っているモデル、あるいは単語辞書
と同様の母音列から構成される。
【0157】例えば、単語T1を”a−i−u”,単語
T2を”a−i−e”,単語T3を”i−u−e”,単
語T4を”i−u−o”,単語T5を”u−e−o”、
単語T6を”o−e−u”とする。これを、適当に発音
したものをデジタルデータとして記録したものを、音声
生成部606の図示せぬ内部のメモリで持つものとし、
発話生成部605からの単語にしたがって、対応するデ
ジタルデータをメモリから読みだし、D/A変換をして
音声信号に変換する。
【0158】第1の実施例(図1)と大きく異なるの
は、音声認識部602にHMMを利用することと、音素
構成として母音のみで形成される音素系列を単語として
登録してあることである。このような音素による設計を
行なうことにおいて、ホワイト雑音が非常に大きな環境
では簡単に妨害音との区別を行なうことができる。ま
た、人間は母音を子音と比較して大きなパワーで発声す
るため、通常の自然言語に比べてシステムの入力信号の
S/N比を良くすることができる。
【0159】このように、上記各実施例においては、音
声認識において、対妨害音、対雑音の問題に対応し、か
つ、機械と人間との間で会話を実現できる方法として、
音声認識の設計の自由度に注目する。すなわち、従来見
落としている認識システムの構成自由度に注目し、対雑
音、対妨害音特性を向上させるものである。
【0160】その自由度とは使用する音そのものであ
り、対妨害特性、対雑音特性に優れた音響特性をもつ音
素を選択あるいは設計することである。それを用いて発
話することにより通常の認識技術だけでも十分な対雑
音、対妨害音特性をもつ認識システムを実現することが
できる。すなわち、日本語あるいは英語の音声認識装置
ではないが、可帯域の信号で特殊な音響特性をもつ音素
をもちいて単語やセンテンスを構築し、それを認識する
システム、そして合成するシステムを構築することによ
り対雑音、対妨害音特性のすぐれた認識あるいは対話シ
ステムがより実現しやすくなる。
【0161】この方法は、従来の技術のところで上述し
た3つの手法のどれにもあてはまるものではない。例え
ば日本語音声認識装置において、日本語として固有名詞
を含む任意の音素の組合せに対して、上述の3つの手法
で対雑音、対妨害特性の向上を施しているどの手法にも
あてはまらない。音素の組合せを雑音や妨害音に合わせ
て選び、または設計する自由度が与えられ、それゆえに
対雑音、対妨害音特性を容易に改善することができる。
【0162】なお、第1の実施例においては、音響分析
手法にフーリエ変換を用いたが、本発明はそれに限定さ
れるものではない。通常の音声認識の前処理として用い
る分析手法を利用することもできる。例えば、LPC分
析などは通常の音声認識で良く使われる手法である。ま
た、音名を認識するのであれば通常のピッチ検出技術を
利用することができる。例えば、ゼロクロス検出による
ピッチ検出や自己相関を用いたピッチ検出などはその代
表例である。
【0163】また、第1の実施例においては、音名認識
部において1つの音名の区切りを無音部の検出に利用し
ているが、それに限定されるものではない。また、無音
部を想定せずにp_toneの変化した音を3つあるい
は4つに注目し、それがC−MajorやC−mino
rなどのコードを構成する音と一致した時のみchor
d(l)を出力し、そうでない場合は無効であるとし、
有効なchord(l)の時系列だけをコマンド解釈に
あてることによっても実現できる。ただし、7thコー
ドなどのように4つで構成されるコードの場合、4つ目
の音を検出する前にMajorコードとして有効なch
ord(l)を出力するため、その対策が必要である。
これは、l=Lで7thコードが認識されたときにそれ
以前の3音で構成されたMajorコードchord
(L−1)を無効データに書き換えることで可能であ
る。
【0164】また、第1の実施例においては、低い音か
ら順に入力されることが条件になっているが、本発明は
これに限定されるものではない。これは3つあるいは4
つの音の構成が、あるコードの構成音と同一であるか否
か、あるいは別の定められた順番であるか否かによって
認識することにより実現することができる。
【0165】また、第1の実施例においては、センテン
スの終了は高い音から順に入力されることを前提として
いるが、本発明はこれに限定されるものではない。適当
な長さの無音検出でもセンテンスの終了を決めることも
できるし、適当な無効パターンを決めることにより終了
を決めることもできる。また、特定のコードを終了コー
ドとしてもよい。あるいは、特定のコード進行により終
了とみなしてもよい。また、第1の実施例では3音から
構成されるコードは3音、4音から構成されるコードは
4音であることを前提としているが、本発明はそれに限
定されるものではない。例えば、”C−Major”と
してC,E,F,E,Cというようなギターの奏法で用
いられるようなアルペジオでもよい。
【0166】また、第1の実施例においては、音楽のコ
ードの時系列を認識しているが、本発明はこれに限定さ
れるものではない。例えば、コードそのものが1つでコ
マンドであることも可能である。また、コードに限定せ
ずに、音名の時系列でその長さ、高さで情報を表すこと
も第1の実施例の変形と考えられる。
【0167】また、第1の実施例においては、絶対的な
音名およびコードを認識しているが、相対的な周波数変
化、相対的な音名の変化、あるいは相対的なコード変化
を認識することにより、いわゆるチューンのずれに対応
することは容易である。
【0168】また、第1の実施例においては、人間と機
械、あるいは人間が楽器を用いて機械と対話している例
で記述されているが、本発明はそれに限定されるもので
はない。この実施例より、2つ以上の装置がこの実施例
の構成を独立に持っておれば、機械同士の会話が可能な
構成であり、かつ、その内容を人間が聴覚を用いて認識
可能であることも容易に推測できる。また、人間同士が
この音素を用いた会話が可能であり、その内容を機械が
理解することも可能である。
【0169】さらに、第2の実施例においては、母音を
認識しているがHMMを用いて第1の実施例のような音
名やコードを認識することは容易な変更で可能である。
たとえば、「あー」というような声でドレミ、、を発声
し、それを認識することは可能である。
【0170】また、第2の実施例においては、母音の認
識としてHMMを用いているが本発明はこれに限定され
るものではない。
【0171】また、第2の実施例においては、音声合成
の手法は予め記憶してある母音からなる波形を出力した
が、本発明はそれに限定されるものではない。規則合成
による音声合成や声道モデルによる音声合成方法を利用
することは容易に推定できる。また、それを用いて、音
声に自然なゆらぎを導入し、より人間に近い母音発話を
することは容易である。
【0172】また、第2の実施例においては、音声認識
は単語認識となっているが、本発明はそれに限定される
ものではない。センテンスへの拡張は容易である。
【0173】また、第2の実施例においては、音素は
a,i,u,e,oを仮定しているが本発明はそれに限
定されるものではない。たとえば、子音を発声するが子
音部を無視して母音部のみの時系列認識とすれば、対雑
音特性を損なわずに発声の容易さを増すことができる。
また、そのほかの雑音と区別しやすい音素を利用するこ
とは本発明の変形である。
【0174】さらに、第2の実施例においては、母音で
あっても雑音と区別しづらい音素を予め除くことも可能
である。例えば、iの音素は人間の発声において、その
他の母音に比べて出力パワーが小さいことが知られてい
るが、このような音素を除いた音素の組みで単語を設計
することも可能である。
【0175】
【発明の効果】請求項1に記載の音声認識装置によれ
ば、分析手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音の分析が行われるようにしたので、妨害音または雑音
の影響を抑制することができる。従って、目的の音を確
実に検出あるいは認識することが可能となる。
【0176】請求項10に記載の音声合成装置によれ
ば、合成手段により、雑音や妨害音と分離が容易な音響
特性を有する音素あるいは音素の時系列より構成された
音が合成されるようにしたので、妨害音あるいは雑音の
影響を受け難い目的の音を合成することができる。従っ
て、相手に、目的の音を確実に認識させることが可能と
なる。
【0177】請求項17に記載の音声認識合成装置によ
れば、分析手段により、雑音や妨害音と分離が容易な音
響特性を有する音素あるいは音素の時系列より構成され
た音の分析が行われ、合成手段により、雑音や妨害音と
分離が容易な音響特性を有する音素あるいは音素の時系
列より構成された音が合成されるようにしたので、妨害
音あるいは雑音の影響を受けずに目的の音を検出あるい
は認識することができ、妨害音あるいは雑音の影響を受
け難い目的の音を合成することができる。従って、妨害
音や雑音の影響を受けずに、1つ以上の機械と1人以上
の人間との間、あるいは機械同士において対話をするシ
ステムを容易に構築することができる。また、自然言語
による対話ではないため、このシステムによる対話によ
り娯楽性を生み出すことができる。さらに、エンターテ
イメント用途の対話システムに応用した場合において
は、自然言語による対話よりも効果的な対話システムを
構築することが可能となる。
【図面の簡単な説明】
【図1】本発明を応用した対話システムの一実施例の構
成を示すブロック図である。
【図2】図1の音響信号分析部101の構成例を示すブ
ロック図である。
【図3】図1の音名認識部102の構成例を示すブロッ
ク図である。
【図4】音名認識部102の処理例を示すフローチャー
トである。
【図5】コード認識部302の処理例を示すフローチャ
ートである。
【図6】コードと音階の定義を示す図である。
【図7】コマンド解釈部303の処理例を示すフローチ
ャートである。
【図8】発話生成部103の構成例を示すブロック図で
ある。
【図9】発話のためのテーブルを示す図である。
【図10】音響信号合成部104の構成例を示すブロッ
ク図である。
【図11】本発明を応用した対話システムの他の実施例
の構成を示すブロック図である。
【図12】HMMのモデルを示す図である。
【図13】音声認識部602の構成例を示すブロック図
である。
【図14】発話生成部605の構成例を示すブロック図
である。
【図15】発話のためのテーブルを示す図である。
【符号の説明】
101 音響信号分析部(分析手段) 102 音名認識部(認識手段) 103 発話生成部(合成手段) 104 音響信号合成部 201 A/D変換部 202 入力信号バッファ 203 周波数分析部 301 音名検出部 302 コード認識部 303 コマンド解釈部 401 内部状態決定部 402 発話内容決定部 501 音名生成部 502 シンセサイザ部 503 D/A変換部 601 A/D変換部 602 音声認識部 603 音声区間検出部 604 制御部 605 発話生成部 606 音声生成部 607 音声認識システム(認識手段) 608 音声合成システム(合成手段) 701 分析部(分析手段) 702 ベクトル量子化部 703 HMM部 704 モデル記憶部 801 内部状態決定部 802 発話内容決定部
───────────────────────────────────────────────────── フロントページの続き (72)発明者 赤羽 誠 東京都品川区北品川6丁目7番35号 ソニ ー株式会社内

Claims (25)

    【特許請求の範囲】
  1. 【請求項1】 雑音や妨害音が存在する環境で音声認識
    を行う音声認識装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
    あるいは前記音素の時系列より構成された音を分析する
    分析手段を備えることを特徴とする音声認識装置。
  2. 【請求項2】 前記分析手段による分析結果を、所定の
    次元の分析空間に所定の順序でそれぞれ並べたとき、前
    記分析結果の特徴点の位置は、前記分析空間と時間軸で
    構成された時系列分析空間において、所定の規則に従っ
    た動きをすることを特徴とする請求項1に記載の音声認
    識装置。
  3. 【請求項3】 前記特徴点は、前記分析空間における前
    記分析結果の極大値あるいは極小値より選ばれた点であ
    ることを特徴とする請求項2に記載の音声認識装置。
  4. 【請求項4】 前記時系列分析空間上における前記特徴
    点の位置の前記動きは、所定の時間以上、前記時間軸に
    対して所定の傾きを持った動きであることを特徴とする
    請求項2に記載の音声認識装置。
  5. 【請求項5】 前記時系列分析空間上における前記特徴
    点の位置の前記動きは、所定の時間以上、前記時間軸に
    対して平行な動きであることを特徴とする請求項2に記
    載の音声認識装置。
  6. 【請求項6】 前記音のピッチは、所定の時間以上、所
    定の範囲以上に変化しないことを特徴とする請求項1に
    記載の音声認識装置。
  7. 【請求項7】 前記音素は、母音であることを特徴とす
    る請求項1に記載の音声認識装置。
  8. 【請求項8】 前記分析手段は、線形の畳み込み演算を
    行うことを特徴とする請求項1に記載の音声認識装置。
  9. 【請求項9】 Hidden Markov Mode
    lを含む認識手段をさらに備え、 前記認識手段により、前記分析手段による前記分析結果
    に対応する音が認識されることを特徴とする請求項1に
    記載の音声認識装置。
  10. 【請求項10】 雑音や妨害音が存在する環境で音声合
    成を行う音声合成装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
    あるいは前記音素の時系列より構成された音を合成する
    合成手段を備えることを特徴とする音声合成装置。
  11. 【請求項11】 前記音を所定の分析方法で分析した分
    析結果を、所定の次元の分析空間に所定の順序でそれぞ
    れ並べたとき、前記分析結果の特徴点の位置は、前記分
    析空間と時間軸で構成された時系列分析空間において、
    所定の規則に従った動きをすることを特徴とする請求項
    10に記載の音声合成装置。
  12. 【請求項12】 前記特徴点は、前記分析空間における
    前記分析結果の極大値あるいは極小値より選ばれた点で
    あることを特徴とする請求項11に記載の音声合成装
    置。
  13. 【請求項13】 前記時系列分析空間上における前記特
    徴点の位置の前記動きは、所定の時間以上、前記時間軸
    に対して所定の傾きを持った動きであることを特徴とす
    る請求項11に記載の音声合成装置。
  14. 【請求項14】 前記時系列分析空間上における前記特
    徴点の位置の前記動きは、所定の時間以上、前記時間軸
    に対して平行な動きであることを特徴とする請求項11
    に記載の音声合成装置。
  15. 【請求項15】 前記音のピッチは、所定の時間以上、
    所定の範囲以上に変化しないことを特徴とする請求項1
    0に記載の音声合成装置。
  16. 【請求項16】 前記音素は、母音であることを特徴と
    する請求項10に記載の音声合成装置。
  17. 【請求項17】 雑音や妨害音が存在する環境で音声認
    識と音声合成を行う音声認識合成装置において、 前記雑音や妨害音と分離が容易な音響特性を有する音素
    あるいは前記音素の時系列より構成された音を分析する
    分析手段と、 前記雑音や妨害音と分離が容易な音響特性を有する前記
    音素あるいは前記音素の時系列より構成された前記音を
    合成する合成手段とを備えることを特徴とする音声認識
    合成装置。
  18. 【請求項18】 前記音の前記分析手段による分析結果
    を、所定の次元の分析空間に所定の順序でそれぞれ並べ
    たとき、前記分析結果の特徴点の位置は、前記分析空間
    と時間軸で構成された時系列分析空間において、所定の
    規則に従った動きをすることを特徴とする請求項17に
    記載の音声認識合成装置。
  19. 【請求項19】 前記特徴点は、前記分析空間における
    極大値あるいは極小値より選ばれた点であることを特徴
    とする請求項18に記載の音声認識合成装置。
  20. 【請求項20】 前記時系列分析空間上における前記特
    徴点の位置の前記動きは、所定の時間以上、前記時間軸
    に対して所定の傾きを持った動きであることを特徴とす
    る請求項18に記載の音声認識合成装置。
  21. 【請求項21】 前記時系列分析空間上における前記特
    徴点の位置の前記動きは、所定の時間以上、前記時間軸
    に対して平行な動きであることを特徴とする請求項18
    に記載の音声認識合成装置。
  22. 【請求項22】 前記音のピッチは、所定の時間以上、
    所定の範囲以上に変化しないことを特徴とする請求項1
    7に記載の音声認識合成装置。
  23. 【請求項23】 前記音素は、母音であることを特徴と
    する請求項17に記載の音声認識合成装置。
  24. 【請求項24】 前記分析手段は、線形の畳み込み演算
    を行うことを特徴とする請求項17に記載の音声認識合
    成装置。
  25. 【請求項25】 Hidden Markov Mod
    elを含む認識手段をさらに備え、 前記認識手段により、前記分析手段による前記分析結果
    に対応する音が認識されることを特徴とする請求項17
    に記載の音声認識合成装置。
JP7142870A 1995-06-09 1995-06-09 音声認識装置、および音声合成装置、並びに音声認識合成装置 Abandoned JPH08335091A (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP7142870A JPH08335091A (ja) 1995-06-09 1995-06-09 音声認識装置、および音声合成装置、並びに音声認識合成装置
US08/661,396 US5966690A (en) 1995-06-09 1996-06-07 Speech recognition and synthesis systems which distinguish speech phonemes from noise

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP7142870A JPH08335091A (ja) 1995-06-09 1995-06-09 音声認識装置、および音声合成装置、並びに音声認識合成装置

Publications (1)

Publication Number Publication Date
JPH08335091A true JPH08335091A (ja) 1996-12-17

Family

ID=15325522

Family Applications (1)

Application Number Title Priority Date Filing Date
JP7142870A Abandoned JPH08335091A (ja) 1995-06-09 1995-06-09 音声認識装置、および音声合成装置、並びに音声認識合成装置

Country Status (2)

Country Link
US (1) US5966690A (ja)
JP (1) JPH08335091A (ja)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2000099099A (ja) * 1998-09-22 2000-04-07 Sharp Corp データ再生装置
WO2000066239A1 (en) * 1999-04-30 2000-11-09 Sony Corporation Electronic pet system, network system, robot, and storage medium
JP2002321177A (ja) * 2001-04-23 2002-11-05 Sony Corp 脚式移動ロボット及びその制御方法
US8195451B2 (en) 2003-03-06 2012-06-05 Sony Corporation Apparatus and method for detecting speech and music portions of an audio signal

Families Citing this family (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6049770A (en) * 1996-05-21 2000-04-11 Matsushita Electric Industrial Co., Ltd. Video and voice signal processing apparatus and sound signal processing apparatus
US6490562B1 (en) 1997-04-09 2002-12-03 Matsushita Electric Industrial Co., Ltd. Method and system for analyzing voices
US6587822B2 (en) * 1998-10-06 2003-07-01 Lucent Technologies Inc. Web-based platform for interactive voice response (IVR)
US6980956B1 (en) * 1999-01-07 2005-12-27 Sony Corporation Machine apparatus and its driving method, and recorded medium
JP2003186500A (ja) * 2001-12-17 2003-07-04 Sony Corp 情報伝達システム、情報符号化装置および情報復号装置
JP4447857B2 (ja) * 2003-06-20 2010-04-07 株式会社エヌ・ティ・ティ・ドコモ 音声検出装置
WO2006026812A2 (en) * 2004-09-07 2006-03-16 Sensear Pty Ltd Apparatus and method for sound enhancement
JP4456537B2 (ja) * 2004-09-14 2010-04-28 本田技研工業株式会社 情報伝達装置
US11238409B2 (en) 2017-09-29 2022-02-01 Oracle International Corporation Techniques for extraction and valuation of proficiencies for gap detection and remediation
US20200097879A1 (en) * 2018-09-25 2020-03-26 Oracle International Corporation Techniques for automatic opportunity evaluation and action recommendation engine
US11467803B2 (en) 2019-09-13 2022-10-11 Oracle International Corporation Identifying regulator and driver signals in data systems
JP7714459B2 (ja) 2018-09-27 2025-07-29 オラクル・インターナショナル・コーポレイション メトリックのデータ駆動型相関のための技術

Family Cites Families (14)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3836717A (en) * 1971-03-01 1974-09-17 Scitronix Corp Speech synthesizer responsive to a digital command input
US3943295A (en) * 1974-07-17 1976-03-09 Threshold Technology, Inc. Apparatus and method for recognizing words from among continuous speech
JPS54153070A (en) * 1978-05-23 1979-12-01 Seiko Epson Corp Wristwatch for the blind
US4661915A (en) * 1981-08-03 1987-04-28 Texas Instruments Incorporated Allophone vocoder
US4707858A (en) * 1983-05-02 1987-11-17 Motorola, Inc. Utilizing word-to-digital conversion
US4833714A (en) * 1983-09-30 1989-05-23 Mitsubishi Denki Kabushiki Kaisha Speech recognition apparatus
JPS61110837A (ja) * 1984-11-02 1986-05-29 Hitachi Ltd 空気調和機の制御方式
US4852181A (en) * 1985-09-26 1989-07-25 Oki Electric Industry Co., Ltd. Speech recognition for recognizing the catagory of an input speech pattern
US4803729A (en) * 1987-04-03 1989-02-07 Dragon Systems, Inc. Speech recognition method
US5136653A (en) * 1988-01-11 1992-08-04 Ezel, Inc. Acoustic recognition system using accumulate power series
US5293448A (en) * 1989-10-02 1994-03-08 Nippon Telegraph And Telephone Corporation Speech analysis-synthesis method and apparatus therefor
US5390278A (en) * 1991-10-08 1995-02-14 Bell Canada Phoneme based speech recognition
US5377302A (en) * 1992-09-01 1994-12-27 Monowave Corporation L.P. System for recognizing speech
JP3114468B2 (ja) * 1993-11-25 2000-12-04 松下電器産業株式会社 音声認識方法

Cited By (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2000099099A (ja) * 1998-09-22 2000-04-07 Sharp Corp データ再生装置
WO2000066239A1 (en) * 1999-04-30 2000-11-09 Sony Corporation Electronic pet system, network system, robot, and storage medium
US6560511B1 (en) 1999-04-30 2003-05-06 Sony Corporation Electronic pet system, network system, robot, and storage medium
US7089083B2 (en) 1999-04-30 2006-08-08 Sony Corporation Electronic pet system, network system, robot, and storage medium
JP2002321177A (ja) * 2001-04-23 2002-11-05 Sony Corp 脚式移動ロボット及びその制御方法
US8195451B2 (en) 2003-03-06 2012-06-05 Sony Corporation Apparatus and method for detecting speech and music portions of an audio signal

Also Published As

Publication number Publication date
US5966690A (en) 1999-10-12

Similar Documents

Publication Publication Date Title
JP3180655B2 (ja) パターンマッチングによる単語音声認識方法及びその方法を実施する装置
US6009391A (en) Line spectral frequencies and energy features in a robust signal recognition system
JP4274962B2 (ja) 音声認識システム
US6553342B1 (en) Tone based speech recognition
JP3114468B2 (ja) 音声認識方法
WO2007117814A2 (en) Voice signal perturbation for speech recognition
JP2002304190A (ja) 発音変化形生成方法及び音声認識方法
JPH09500223A (ja) 多言語音声認識システム
US5966690A (en) Speech recognition and synthesis systems which distinguish speech phonemes from noise
JP4911034B2 (ja) 音声判別システム、音声判別方法及び音声判別用プログラム
JP2000194392A (ja) 騒音適応型音声認識装置及び騒音適応型音声認識プログラムを記録した記録媒体
Kurcan Isolated word recognition from in-ear microphone data using hidden markov models (HMM)
JP4461557B2 (ja) 音声認識方法および音声認識装置
JPH08211897A (ja) 音声認識装置
US11043212B2 (en) Speech signal processing and evaluation
JP2011180308A (ja) 音声認識装置及び記録媒体
JP2001013988A (ja) 音声認識方法及び装置
JP2002091480A (ja) 音響モデル生成装置及び音声認識装置
KR100488121B1 (ko) 화자간 변별력 향상을 위하여 개인별 켑스트럼 가중치를 적용한 화자 인증 장치 및 그 방법
JP4749990B2 (ja) 音声認識装置
JP2658426B2 (ja) 音声認識方法
WO2025211030A1 (ja) 収音装置、収音方法、およびプログラム
JP3357752B2 (ja) パターンマッチング装置
JPH09160585A (ja) 音声認識装置および音声認識方法
JPH04125597A (ja) 音声認識装置

Legal Events

Date Code Title Description
A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20040811

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20040914

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20041115

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20041217

A762 Written abandonment of application

Free format text: JAPANESE INTERMEDIATE CODE: A762

Effective date: 20050127