JPS5953900A - 音声認識方法 - Google Patents

音声認識方法

Info

Publication number
JPS5953900A
JPS5953900A JP57165879A JP16587982A JPS5953900A JP S5953900 A JPS5953900 A JP S5953900A JP 57165879 A JP57165879 A JP 57165879A JP 16587982 A JP16587982 A JP 16587982A JP S5953900 A JPS5953900 A JP S5953900A
Authority
JP
Japan
Prior art keywords
speaker
recognition
vowel
unit
voice
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP57165879A
Other languages
English (en)
Other versions
JPH0381160B2 (ja
Inventor
伸 神谷
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sharp Corp
Original Assignee
Sharp Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sharp Corp filed Critical Sharp Corp
Priority to JP57165879A priority Critical patent/JPS5953900A/ja
Publication of JPS5953900A publication Critical patent/JPS5953900A/ja
Publication of JPH0381160B2 publication Critical patent/JPH0381160B2/ja
Granted legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 く技術分野〉 本発明は入力される音声により話者の認識及び照合を行
う話者認識方式に関する。
〈従来例) 話者認識は、話者識別と話者照合との二つの形態に分け
ることができる。ここで話者識別とは、未知の話者によ
る音声において、きめられた特定の話者のうち、いずれ
の話者によるものであるかを判別することであり、話者
照合とは同じく未知の話者による音声に関して特定され
た話者によるものであるか否かを判別することである。
上記話者の識別及び照合による話者認識においては、登
録時と認識時での発話内容が同一である場合にテキスト
(発話内容)を固定した話者認識と称し、また登録時と
認識時での発話内容が同一でない場合にテキストに依存
しない話者認識と称している。
テキスト全発話した話者認識によれば、認識時に登録時
と同一内容の発話を行うため、認識は比較的に容易であ
る。しかし、登録時に発話内容を他人に聞かれたり、ま
た隠しマイクで盗み取りされる危険性かあり好ましくな
い。
これに対しテキストに依存しない話者認識は一般に認識
が非常に困難となる。しかも、登録時や認識時に数十秒
〜数分間発話する必要があるのでユーザへの負担かかな
り大きくなっていた。
〈発明の目的〉 本発明はテキストに依存しない話者認識の方式全提供す
るものであり、且つ話者認識装置とユーザとか対話する
ことにより1、登録及び認識を行う話者認識方式を提供
するも分千千ミ〇 〈実施例〉 第1図は本発明による話者認識装置の回路構成を示すブ
ロック図である。図において符号lは例えば話者の登録
を行うためのモードに装置(システム)を設定するスイ
ッチ、2は認識モードに設定するためのスイッチである
。このスイッチ1又は2からの信号n又はpff:入力
し制御部3は、話者認識装置(以下システムと記す)を
登録モード又は認識モードに設定する。この制御部3は
、システムを構成する各部を制御するものである。ここ
で、この認識装置をドアの開閉に適用させる場合、スイ
ッチ1はドアの内側Vこ且つスイッチ2はドアの外側に
取りイ」けられる。
1社fc C中相話者0音“6カを行う′・。
は音声入力された信号aを音声分析する音声分析部、6
は音節等を切シ出すセグメンテーション部、7は母音認
識部、8は話者認識部、9は単語認識部、及びIOは登
録話者の母音データを記憶する記憶部、更に11は音声
合成部、12はスピーカである。
本実施例では説明の、都合で母音のみによる認識につい
て記載するが、これに限定されるものでないことは勿論
である。
上述の構成においてまず話者の登録について説明する。
ユーザか登録を行う場合、まずスイッチ1を操作すれば
制御部3は7ステム自体を登録モードに設定し各部を登
録モードで制御する。そこでユーザはユーザ番号全マイ
ク4全通して音声入力する。この音声入力されたユーザ
番号(a)は、音声分析部5を介して箪語認酸部9に送
られ、該単語認識部9にて番号認識される。該認識され
た番号(c)は、次の記憶部1oへのデータの登録領域
を決めるために用いられる。つまり、上記入力され懲殻
号(・)にて記憶部10′)アトは指定を行う・この様
に音声入力により記憶部10のユーザに対する登録領域
を決めているが登録時のみキー人力にて行ってもよい。
上記ユーザ番号による番舟認識か終了ずれば制御部3は
、音声合成部11へ母音連鎖、例えば「いえあおう」、
「あいうえお」、「うおあえい」・・・等のテキスト(
j)を作製し、このテキストをユーザに音声入力するよ
う音声合成部11へ送る。そこで音声合成部11は制御
部3よシ指示された母音連鎖のき放音(k)を作成し、
スピーカ12を通してユーザに促す。ユーザは、スピー
カ12′ft通して聞いた母音連4ilIをユーザ番号
同様音声入力する。
この母音連鎖(テキスト)の音声信号は、音声分析部5
を介して信号dとしてセグメンテーション部6へ送られ
る。該セグメンテーション部6は、音声区間を音節に切
り出すべく定常部とわたり部とに分割し、これを(e)
母音認識部7で認識させる。
母音認識部7は予め発話内容かシステム側でわかってお
り、制御部3より音声入力さitた内容zl取り込み認
識を行う。この場合、認識率は100係に近い。この母
音認識後、先はど入力されたユーザ番号に対応した記憶
部IOの登録領域へ、1、母音毎に定常部のスペクトル
と、母音連鎖毎にわたり部のスペクトルと’1i=(f
)ストアする。以上で登録が終了したことになる。
次に認識する場合について説明する。この場合、ユーザ
がスイッチ2を操作することで制御部3はシステム自体
を認識モードに設定する。この設定後にユーザはユーザ
番号を登録時と同様に音声入力する。この音声入力に従
って、ユーザ番号が認識され、この番号に対応した記憶
部10の登録領域より母音のデータが読み出され(0)
制御部3に送られる。制御部3はそのユーザの母音のう
ちで最も安定して発話される母音(母音のスペクトルの
話者内分散が小)または他の話者とは異なっている母音
(話者間分散が犬)を選択し、これら全多く用いた母音
連鎖、例えば「い」であれば「ういあいお」の様に「い
」の多いテキストを作製して音声合成部11に送り(j
)、ユーザに上記テキストを発−声するように指示する
(k)。
/ステムからの指示に従ってユーザは音声入力全行う。
入力した音声は(a 、d )、セグメンテーション部
6て、登録時と同様に定常部とわたり部(e)とに分割
される。そして、母音認識γ<1(7で認識した後(こ
の揚台も発話内容か既知なので(l−)、認識率は10
0%に近い)、母音毎に定常部のスペクトルとIす音連
鎖毎にわたり部のスペクトルとを話者認識部8へ出力す
る(g)。話者認識部8はユーザ番号に対応した記l意
部10の登録領域から読み出された母音のデータ11と
、話者認識部8からの入力gの母音データとの母音毎に
定常部のスペクトル間の距離と母音連鎖毎にわたり部の
スペクトル 、間の距離を求め、データhとgとの比較
を行い、これらの重み付き和か閾値θ1 (0くθ1〈
θ2)未満ならば1本人である」と同定する。また閾値
02以上ならば「他人である」として認識結果を出力し
2、その処理か実行される。更に01以上で且つ62未
満ならば制御部3ヘデ一タ不足であることを示す信号1
を出力する。この信号1を入力すれば開戸1部3は、ま
た別のテキスト(母音連鎖)を作製して、該テキストヲ
音声入力することをユーザに要求する。該テキストの音
声入力を行っても信号iか話者認識部8より出力されれ
ば、再度別のテキストか作製され、上述動作か繰り返さ
れる。
この繰り返しかN回行れでも信号jが出力されるようで
あれば、「他人である」との処理が実行される。
以上説明した認識動作は第2図のフローチャートに示す
通りであり、話者は/ステム側より発せられるテキスト
に従って、音声入力を行っており、/ステムとの対話形
式で話者認識が実行される。
〈発明の効果〉 本発明によれば、話者認識装置より要求されるテキスト
でもって認識する、テキストに依存しない話者認識の方
式であり、かつ話者認識装置゛とユーザとが対話するこ
とにより、登録及び認識を行うため登録時や認識時に数
秒間発話するだけで高い認識率を達成することを可能に
する。
成の一具体例を示すブロック図、第2図は本発明の話者
認識の動作説明に供するフローチャートである。
1.2:登録、認識モート設定用のスイッチ3:制御部
 石:セグメンテーション部′ 8:話者認識部 10
:記憶部 11;音声合成部 12:スピーカ 代理人 弁理士 福 士 愛 彦(他2名)第7図

Claims (1)

    【特許請求の範囲】
  1. 1 予め登録されている話者の登録用データ中の音節と
    、該話者が入力された音声より切り出した音節とを比較
    し話者の認識を行うものにおいて、予め登録されている
    話者の登録用データ中より該話者の最も安定して発話さ
    れる音節又は他の話者とは異なる音節を選択し、こC音
    節を基に登録時とは異なるテキスト全発話するように話
    者へ要求し、該テキストにより入力された音声より音節
    を切り出して登録されているデータとの比較を行うこと
    により話者の認識を行うことを特徴とする話者認識方式
JP57165879A 1982-09-21 1982-09-21 音声認識方法 Granted JPS5953900A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP57165879A JPS5953900A (ja) 1982-09-21 1982-09-21 音声認識方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP57165879A JPS5953900A (ja) 1982-09-21 1982-09-21 音声認識方法

Publications (2)

Publication Number Publication Date
JPS5953900A true JPS5953900A (ja) 1984-03-28
JPH0381160B2 JPH0381160B2 (ja) 1991-12-27

Family

ID=15820710

Family Applications (1)

Application Number Title Priority Date Filing Date
JP57165879A Granted JPS5953900A (ja) 1982-09-21 1982-09-21 音声認識方法

Country Status (1)

Country Link
JP (1) JPS5953900A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6135257A (ja) * 1984-07-27 1986-02-19 Matsushita Electric Ind Co Ltd インクジエツト記録装置
JP2014182270A (ja) * 2013-03-19 2014-09-29 Yahoo Japan Corp 情報処理装置及び方法

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6135257A (ja) * 1984-07-27 1986-02-19 Matsushita Electric Ind Co Ltd インクジエツト記録装置
JP2014182270A (ja) * 2013-03-19 2014-09-29 Yahoo Japan Corp 情報処理装置及び方法

Also Published As

Publication number Publication date
JPH0381160B2 (ja) 1991-12-27

Similar Documents

Publication Publication Date Title
CN116018638B (zh) 使用话音转换和语音识别模型的合成数据增强
US11295748B2 (en) Speaker identification with ultra-short speech segments for far and near field voice assistance applications
Ambikairajah et al. Language identification: A tutorial
US7062440B2 (en) Monitoring text to speech output to effect control of barge-in
US7191132B2 (en) Speech synthesis apparatus and method
US20040049375A1 (en) Speech synthesis apparatus and method
JP2002304190A (ja) 発音変化形生成方法及び音声認識方法
US20070088547A1 (en) Phonetic speech-to-text-to-speech system and method
Boite et al. A new approach towards keyword spotting.
Furui 40 years of progress in automatic speaker recognition
JPS6138479B2 (ja)
JPS5953900A (ja) 音声認識方法
JPH07230293A (ja) 音声認識装置
Heo et al. Classification based on speech rhythm via a temporal alignment of spoken sentences
Bapineedu Analysis of Lombard effect speech and its application in speaker verification for imposter detection
Fakotakis et al. A continuous HMM text-independent speaker recognition system based on vowel spotting.
Gorai et al. A GAUSSIAN MIXTURE MODEL-BASED SPEAKER RECOGNITION SYSTEM
JPS6126678B2 (ja)
Holmes Towards a unified model for low bit-rate speech coding using a recognition-synthesis approach.
JP3357752B2 (ja) パターンマッチング装置
JP2001175275A (ja) サブワード音響モデル生成方法および音声認識装置
JPH06337700A (ja) 音声合成装置
Gupta et al. Development of Robust Speech Systems
JPS607492A (ja) 単音節音声認識方式
Svendsen Speech Technology: Past, Present And Future