JP3036509B2 - 話者照合における閾値決定方法及び装置 - Google Patents

話者照合における閾値決定方法及び装置

Info

Publication number
JP3036509B2
JP3036509B2 JP10069514A JP6951498A JP3036509B2 JP 3036509 B2 JP3036509 B2 JP 3036509B2 JP 10069514 A JP10069514 A JP 10069514A JP 6951498 A JP6951498 A JP 6951498A JP 3036509 B2 JP3036509 B2 JP 3036509B2
Authority
JP
Japan
Prior art keywords
similarity
standard pattern
node
speaker
threshold value
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP10069514A
Other languages
English (en)
Other versions
JPH11249684A (ja
Inventor
栄子 山田
浩明 服部
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NEC Corp
Original Assignee
NEC Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by NEC Corp filed Critical NEC Corp
Priority to JP10069514A priority Critical patent/JP3036509B2/ja
Publication of JPH11249684A publication Critical patent/JPH11249684A/ja
Application granted granted Critical
Publication of JP3036509B2 publication Critical patent/JP3036509B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】本発明は、話者照合装置内で
用いられる照合時の本人判定の閾値を決定する話者照合
における閾値決定方法及び装置に関する。
【0002】
【従来の技術】話者照合では照合時に入力音声と登録さ
れた本人パターンとの類似度が求められ、類似度が予め
定められた閾値よりも高い場合に本人と判定され低い場
合に他人と判定される。判定の基準となる閾値について
は、従来より複数話者の複数単語を用いた評価実験結果
から事後的に設定されることが多く、閾値設定に要する
手間が大きいことが問題となっている。
【0003】この問題を解決する手法として、事前に閾
値を設定する手法が古井より提案されている。(S.Furu
i, "Cepstral analysis technique for automatic spea
kerverification, "IEEE Trans. Acoust., Speech, Sig
nal processing,ASSP-29,2,pp.254-271,1981、以下これ
を文献1とする。)この手法は、登録された本人の標準
パターンと本人とは異なる複数話者の音声(発声内容は
本人と同一)との間の類似度(距離)の分布を調べ、次
のような(1)式に従って閾値を設定する手法である。 閾値(k)=0.6*(μ(k)−σ(k)+7.0 (1)
【0004】ここで、μは本人標準パターンと本人とは
異なる複数話者の音声との間の類似度の平均値であり、
σはその分散であり、kは登録話者番号である。
【0005】図5はこの手法を実行するための装置構成
を示す図である。最初に、本人標準パターン作成部31
0において、登録音声を用い本人の標準パターン(単語
標準パターン)が作成され、単語単位の木構造話者標準
パターン記憶部320にされる。次に、作成された本人
標準パターンと、複数話者の音声記憶部340に記憶さ
れている複数話者の音声との間の類似度計算が類似度計
算部330にて行われる。続いて、平均値、分散計算部
350において、計算された類似度の分布から類似度の
平均値と分散が計算される。最後に、閾値計算部360
において、計算された平均値、分散を用いて(1)式に
従い閾値が求められる。この方法を用いた場合、登録時
の発声から事前に閾値を決定できるため、閾値設定の手
間が少なくて済む。
【0006】
【発明が解決しようとする課題】従来方法は、単語単位
の登録であるため、本人の登録用発声と同一内容の多数
話者の発声を予め用意する必要があり、複数の登録話者
が異なる単語を登録する場合に対応し全ての発声を予め
用意することは困難である。そのため従来方法は、全登
録話者に共通な発声内容を登録する場合には効果的な方
法であるが、登録話者ごとに異なる登録用単語を発声し
た場合には適切な閾値を求めることができない。
【0007】本発明の目的は、事前に閾値を決定するこ
とができ、しかも登録話者ごとに異なる登録用単語を発
声した場合においても適切な閾値を求めることができる
閾値決定方法及び装置を提供することにある。
【0008】
【課題を解決するための手段】前述の課題を解決するた
め、本発明による閾値決定方法及び装置は、次のような
特徴的構成を採用している。
【0009】(1)入力パターンと標準パターンの照合
時の本人判定の基準となる話者照合における閾値決定方
法において、登録話者以外の複数話者のサブワード単位
の標準パターンを蓄えておき、登録時に当該発声内容を
表すサブワード標準パターンを連結し単語標準パターン
を作成し、本人の登録音声との類似度の分布を求め、前
記閾値は、本人の登録音声と前記複数話者の標準パター
ンとの間の類似度の分布のKパーセンタイルの類似度と
して決定する話者照合における閾値決定方法。
【0010】(2)入力パターンと標準パターンの照合
時の本人判定の基準となる話者照合における閾値決定方
法において、登録話者以外の複数話者のサブワード単位
の標準パターンを蓄えておき、登録時に当該発声内容を
表すサブワード標準パターンを連結し単語標準パターン
を作成し、本人の登録音声との類似度の分布を求め、前
記閾値は、本人の登録音声と複数話者の標準パターンと
の間の類似度の分布のKパーセンタイル近傍のN個の類
似度の平均値として決定する話者照合における閾値決定
方法。
【0011】(3)入力パターンと標準パターンの照合
時の本人判定の基準となる話者照合における閾値決定方
法において、登録話者以外の複数話者のサブワード単位
の標準パターンを蓄えておき、登録時に当該発声内容を
表すサブワード標準パターンを連結し単語標準パターン
を作成し、本人の登録音声との類似度の分布を求め、前
記閾値は、本人の登録音声と複数話者の標準パターンと
の間の類似度の分布からランダムに選択されたN個の類
似度に基づいて決定する話者照合における閾値決定方
法。
【0012】(4)入力パターンと標準パターンの照合
時の本人判定の基準となる話者照合における閾値決定方
法において、登録話者以外の複数話者のサブワード単位
の標準パターンを蓄えておき、登録時に当該発声内容を
表すサブワード標準パターンを連結し単語標準パターン
を作成し、本人の登録音声との類似度の分布を求め、前
記閾値は、本人の登録音声と複数話者の標準パターンと
の間の類似度の分布の中央値近傍のN個の類似度に基づ
いて決定する話者照合における閾値決定方法。
【0013】(5)複数話者の標準パターンを、話者ク
ラスタに相当する各ノードによって構成され、第一段目
のノードが全話者のクラスタに相当し、第一段目の各ノ
ードから子ノードが第二段目のノードに相当し、上位ノ
ードはそれにつながる下位ノードの音響的特徴を代表す
る標準パターンを有し末端のリーフノードが各話者の標
準パターンで構成される木構造話者標準パターンとして
記憶されており、登録音声と第二段目の各ノードの標準
パターンとの類似度を計算し、計算された類似度の上位
M位の類似度を持つノードの下位ノードの標準パターン
と登録音声との類似度計算を計算し、このような計算を
上位ノードから下位ノードへ向かって、各段で類似度の
高い上位M位のノードの下位ノードの標準パターンと登
録音声との類似度を計算し、計算されないノードの類似
度は、その上位ノードの値を代用し、最終的にリーフノ
ードで計算された類似度類似度の分布に基づいて閾値を
決定することを特徴とする話者照合における閾値決定方
法。
【0014】(6)前記類似度の分布のKパーセンタイ
ルの類似度を閾値として決定する上記(5)の話者照合
における閾値決定方法。
【0015】(7)前記類似度の分布のKパーセンタイ
ル近傍のN個の類似度の平均値の類似度を閾値として決
定する上記(5)の話者照合における閾値決定方法。
【0016】(8)入力された本人の登録用音声を分析
し、特徴ベクトルに変換し、複数の話者の標準パターン
をサブワード単位の標準パターンを入力された発声内容
に従って連鎖させ、各話者の単語標準パターンを作成
し、前記本人の特徴ベクトルと、複数話者の単語標準パ
ターンとの類似度を計算し、計算された類似度を高い順
にソートし、類似度の分布のKパーセンタイル近傍のN
個の類似度の平均値を照合時の閾値とすることを特徴と
する話者照合における閾値決定方法。
【0017】(9)入力された本人の登録用音声を分析
し、特徴ベクトルに変換し、1つのノードがそれにつな
がる下位ノードの音響的特徴を代表するような木構造
で、各話者の標準パターンを末端のリーフノードに持つ
木構造をした複数話者の標準パターンをサブワード単位
の標準パターンを入力された発声内容に従って連鎖さ
せ、各ノードの単語標準パターンを作成し、前記本人の
特徴ベクトルと作成された木構造話者標準パターンとの
類似度を、上位ノードから下位ノードに向かって計算す
る際、各階層において類似度の高い上位M個のノードに
ついてのみその下位ノードの類似度計算を行い、計算さ
れないノードの類似度をその上位ノードの類似度で代用
し、前記計算された類似度の分布から照合時の閾値を求
めることを特徴とする話者照合における閾値決定方法。
【0018】(10)入力された本人の登録用音声を分
析し特徴ベクトルに変換する分析部と、複数の話者の標
準パターンをサブワード単位で記憶するサブワード単位
の話者標準パターン記憶部と、前記サブワード単位の話
者標準パターン記憶部に記憶されているサブワード単位
の標準パターンを入力された発声内容に従って連鎖さ
せ、各話者の単語標準パターンを作成し、前記分析部で
変換された本人の特徴ベクトルと、複数話者の単語標準
パターンとの類似度を計算する類似度計算部と、前記類
似度計算部で計算された類似度を高い順にソートし、類
似度の分布のKパーセンタイル近傍のN個の類似度の平
均値を照合時の閾値とする閾値選計算部と、を備えて成
る話者照合における閾値決定装置。
【0019】(11)入力された本人の登録用音声を分
析し、特徴ベクトルに変換する分析部と、1つのノード
がそれにつながる下位ノードの音響的特徴を代表するよ
うな木構造で、各話者の標準パターンを末端のリーフノ
ードに持つ木構造をした複数話者の標準パターンをサブ
ワード単位で記憶するサブワード単位の木構造話者標準
パターン記憶部と、前記サブワード単位の木構造話者標
準パターン記憶部に記憶されているサブワード単位の標
準パターンを入力された発声内容に従って連鎖させ、各
ノードの単語標準パターンを作成し、前記分析部で変換
された本人の特徴ベクトルと作成された木構造話者標準
パターンとの類似度を、上位ノードから下位ノードに向
かって計算する場合に、各階層において類似度の高い上
位M個のノードについてのみその下位ノードの類似度計
算を行い、計算されないノードの類似度をその上位ノー
ドの類似度で代用する類似度計算部と、前記類似度計算
部で計算された類似度の分布から照合時の閾値を求める
閾値決定部と、を備えて成ることを特徴とする話者照合
における閾値決定装置。
【0020】
【0021】
【0022】
【0023】
【0024】
【0025】
【発明の実施の形態】以下、本発明による閾値決定方法
及び装置の実施形態を説明する。本発明は、照合時の本
人判定の際に用いられる閾値の決定に関するもので、登
録話者以外の複数話者のサブワード単位の標準パターン
を蓄えておき、登録時には当該発声内容を表すサブワー
ド標準パターンを連結し単語標準パターンを作成し、本
人の登録音声との類似度の分布を求める。
【0026】こうして作成された分布を本人標準パター
ンと詐称者音声との類似度の分布と見なすことで閾値を
決定するものである。同一話者の音声とそれによって学
習された標準パターンの持つ情報量は等価であると考え
られているため、蓄えられる複数話者の標準パターンを
音響空間をちゅう密に覆うような多数話者の標準パター
ンとすることで、本人標準パターンとあらゆる詐称者音
声との類似度の分布を本人の登録音声と複数話者の標準
パターンとの類似度の分布と見なすことができる。
【0027】作成された本人の登録音声と複数話者の標
準パターンとの類似度の分布から閾値を求めることによ
って、あらゆる詐称者に対して適切な閾値を設定するこ
とができる。
【0028】また、本手法は、サブワード単位の標準パ
ターンを用いているためあらゆる単語標準パターンを作
成することができ、登録話者ごとに異なる単語を発声す
る場合においても適切な閾値を求めることができる方法
である。
【0029】標準パターンの単位であるサブワードにつ
いては、音素、音節、半音節(渡辺他.,"半音節を単位
とするHMMを用いた不特定話者音声認識,"電子情報通信
学会論文誌D-II Vol.J75-D-II No.8,pp.1281-1289,1992
-8、以下文献2と称する)等を用いることができる。
【0030】閾値の計算方法は、種々の決定方法を用い
ることができ、例えば、本人の登録音声と複数話者の標
準パターンとの間の類似度の分布のKパーセンタイルの
類似度を閾値として選択する方法を用いることができ
る。
【0031】この閾値決定方法を用いた場合、全体のK
パーセントにあたる類似度の値が閾値より高い値とな
る。これは受理誤り率をKパーセントに設定することと
同等であると言える。この閾値決定方法を用いること
で、所望する受理誤り率を与える閾値を事前に設定する
ことが可能となる。受理誤り率を10パーセントにする
場合類似度の分布の10パーセンタイルの類似度を閾値
とし、受理誤り率を0パーセントにする場合最大の類似
度を閾値とする。
【数1】
【0032】また、本人の登録音声と複数話者の標準パ
ターンとの間の類似度の分布のKパーセンタイル近傍の
N個の類似度の平均値を閾値とする方法も用いることが
できる。この方法によると、蓄えられている話者数が少
なく標準パターンによる音響空間の被覆が粗である場
合、N個の類似度の平均値を求めることで閾値計算精度
の低下を軽減することができる。閾値の計算は(2)式
に従って行われる。
【0033】Nは類似度計算を行う話者標準パターン数
である。この他の方法として、類似度の分布からランダ
ムに選択されたN個の類似度から求める方法や、類似度
の分布の中央値近傍のN個の類似度から求める方法等も
用いることができる。
【0034】他の発明による閾値決定方法は、記憶され
ている複数話者の標準パターンを木構造話者標準パター
ンとした場合の方法である。木構造話者標準パターンの
簡単な構造を図5に示す。
【0035】木構造話者標準パターンは、話者クラスタ
に相当する各ノードによって構成されている。第一段目
のノードは全話者のクラスタに相当する。第一段目の各
ノードから子ノードが出ており、それが第二段目のノー
ドに相当する。上位ノードはそれにつながる下位ノード
の音響的特徴を代表する標準パターンを有している。末
端のリーフノードは各話者の標準パターンで構成され
る。
【0036】話者クラスタリングに関しては、以下の論
文に詳しい。例えば、Kai-Fu Lee,"Large-Vocabulary S
peaker-Independent Continuous Speech Recognition :
TheSPHINX System, "CMU-CS-88-148,pp.103-107,1988.4
(文献3と称する)。また、話者標準パターンの木構
造化については、小坂他,"話者適応のための木構造話
者クラスタリング,"信学技報,SP93-110,pp.49-54,119
3-12 (文献4と称する)に詳しい。
【0037】木構造化話者標準パターンを用いた場合の
閾値計算方法について図4を参照して説明する。
【0038】先ず、始めに、登録音声と第二段目の各ノ
ードの標準パターンとの類似度計算が計算され、続い
て、計算された類似度の上位M位の類似度を持つノード
の下位ノード(第三段目、最下位ノード)の標準パター
ンと登録音声との類似度計算が計算される。このように
上位ノードから下位ノードへ向かって、各段で類似度の
高い上位M位のノードの下位ノードの標準パターンと登
録音声との類似度が計算される。
【0039】計算されないノードの類似度は、その上位
ノードの値が代用される。最終的にリーフノードで計算
された類似度がソートされ、類似度の分布のKパーセン
タイルの類似度が閾値となる。
【0040】または、類似度の分布のKパーセンタイル
近傍のN個の類似度の平均値が閾値となる。ここで、リ
ーフノードで計算される類似度が全体のKパーセント以
上の個数となることに注意する必要がある。例えば、木
構造を各層が4、各ノードにつながる子ノードが4の構
造(リーフノードの話者標準パターン数は64)とし、
10パーセンタイルの類似度を閾値とする場合、リーフ
ノードで計算される類似度は7個以上であればよいた
め、M>=2となる。木構造化された話者標準パターン
を用いた場合、各段で類似度の高いノードの下位ノード
分だけ類似度を計算すれば良いため、非常に高速に登録
時の閾値計算を行うことが可能である。
【0041】図1は本発明による閾値決定方法及び装置
の第1の実施形態を示す構成図である。
【0042】入力された登録時の音声は、分析部10に
送出られ、発声内容は類似度計算部30に送出される。
分析部10に送出された入力音声は、特徴ベクトルに変
換され、類似度計算部30に送られる。特徴ベクトルと
しては、ケプストラム、△ケプストラム、(古井,"デ
ィジタル音声処理,"東海大学出版会,pp.44-47,1985、
これを以後文献5とする。)等が用いられる。
【0043】類似度計算部30では、送られた発声内容
に従いサブワード単位の話者標準パターン記憶部20に
記憶されているサブワード単位の標準パターンが連鎖さ
れ、各話者の単語標準パターンが作成される。続いて、
作成された各話者の単語標準パターンと分析部10から
送出された特徴ベクトルとの間の類似度計算が行われ
る。
【0044】類似度計算方法については、Viterbiアル
ゴリズム(中川,"確率モデルによる音声認識,"電子情
報通信学会,1988、これを以後文献6とする。)、DP
マッチング(迫江他,"動的計画法による音声パタンの
類似度評価,"電子通信学会総合全国大会講演論文集,
p.136, 1970.8、以後これを文献7と称する)等が用いら
れる。計算された類似度は、閾値決定部40に送出され
る。
【0045】閾値決定部40は、類似度計算部30から
送出された類似度の分布から閾値を求め、出力する。
【0046】図2は本発明による閾値決定方法及び装置
の第2の実施形態を示す構成図である。
【0047】入力された登録時の音声は、分析部110
に送出され、発声内容は類似度計算部130に送出され
る。
【0048】分析部110に送出された入力音声は、特
徴ベクトルに変換され、類似度計算部130に送出され
る。特徴ベクトルについては上述第1の発明の場合と同
様である。
【0049】類似度計算部130では、送られた発声内
容に従いサブワード単位の話者標準パターン記憶部12
0に記憶されているサブワード単位の標準パターンが連
鎖され、各話者の単語標準パターンが作成される。次
に、作成された各話者の単語標準パターンと分析部11
0から送られた特徴ベクトルとの間の類似度計算が行わ
れる。類似度計算方法については上述第一の発明と同様
である。計算された類似度は閾値計算部140に送出さ
れる。
【0050】閾値計算部140では、類似度計算部13
0から送られた類似度が高い順にソートされ、類似度分
布のKパーセンタイル近傍のN個の類似度の平均値が計
算される。計算された平均値が閾値として出力される。
【0051】図3は本発明による閾値決定方法及び装置
の第3の実施形態を示す構成図である。
【0052】入力された登録時の音声は、分析部210
に送出され、発声内容は類似度計算部230に送出され
る。分析部210に送出された入力音声は、特徴ベクト
ルに変換され、類似度計算部230に送出される。特徴
ベクトルについては第1の発明の場合と同様である。
【0053】類似度計算部230では、送られた発声内
容に従いサブワード単位の木構造話者標準パターン記憶
部220に記憶されているサブワード単位の標準パター
ンが連鎖され、各ノードの単語標準パターンが作成され
る。次に、作成された各ノードの単語標準パターンと分
析部210から送られた特徴ベクトルとの間の類似度計
算が行われる。
【0054】木構造話者標準パターンと特徴ベクトルと
の間の類似度計算方法について、図4の木構造を例とし
た場合について説明する。
【0055】先ず始めに、特徴ベクトルと第二段目の各
ノードの標準パターンとの類似度計算が行われる。次
に、計算された類似度の上位M位の類似度を持つノード
の下位ノード(第三段目、最下位ノード)の標準パター
ンと特徴ベクトルとの類似度計算が行われる。計算され
ないノードの類似度はその上位ノードの類似度が代用さ
れる。このように、上位ノードからリーフノードに向か
って類似度計算が行われ、最終的に計算された類似度が
閾値決定部240に送られる。
【0056】閾値決定部240では、類似度計算部23
0から送られた類似度が高い順にソートされ、類似度の
分布のKパーセンタイルに相当する類似度が閾値として
出力される。又は、類似度の分布のKパーセンタイル近
傍のN個の類似度の平均値が閾値として出力される。
【0057】
【発明の効果】以上説明したように、本発明によれば、
所望する受理誤り率を得られる閾値を事前に設定するこ
とが可能であり、登録話者ごとに異なる単語を発声する
場合についても適切な閾値を求めることができる。
【図面の簡単な説明】
【図1】本発明による閾値決定装置の第1の実施形態を
示す構成図である。
【図2】本発明による閾値決定装置の第2の実施形態を
示す構成図である。
【図3】本発明による閾値決定装置の第3の実施形態を
示す構成図である。
【図4】従来の閾値決定方法を説明するための図であ
る。
【図5】従来の閾値決定装置の構成図である。
【符号の説明】
10、110、210 分析部 20、120 サブワード単位の話者標準パタ
ーン記憶部 30、130、230、330 類似度計算部 40、240 閾値決定部 140、360 閾値計算部 220 サブワード単位の木構造話者標準パターン
記憶部 310 本人標準パターン作成部 320 単語単位の本人標準パターン記憶部 340 複数話者の音声記憶部 350 平均値、分散計算部 360 閾値計算部
フロントページの続き (56)参考文献 特開 平9−198086(JP,A) 特開 昭63−37484(JP,A) 特開 平3−58098(JP,A) 特開 平8−123475(JP,A) 特開 平10−207484(JP,A) 特開 平10−214096(JP,A) Proceedings of 1990 IEEE Internationa l Conference on Ac oustics,Speech and Signal Processin g,Vol.1”Sub−word u nit talker verfica tion using hidden markov models”p.269 −272 Proceedings of 1996 IEEE Internationa l Conference on Ac oustics,Speech and Signal Processin g,Vol.1”Robust met hods of updating m odel and a priori threshold in speke r verification”p.97 −100 IEEE Transactions on Acoustics,Spee ch and Signal Proc essing,Vol.ASSP−29, No.2,April 1981,”Cep stral Analysis Tec hnique for Automat ic Speaker Verific ation”,p.254−272 日本音響学会平成10年春季研究発表会 講演論文集▲I▼ 2−6−7「話者照 合における連続音節認識による登録パタ ーン作成方法」p.67−68(平成10年3 月17日発行) (58)調査した分野(Int.Cl.7,DB名) G10L 17/00 G10L 15/28 JICSTファイル(JOIS)

Claims (11)

    (57)【特許請求の範囲】
  1. 【請求項1】入力パターンと標準パターンの照合時の本
    人判定の基準となる話者照合における閾値決定方法にお
    いて、 登録話者以外の複数話者のサブワード単位の標準パター
    ンを蓄えておき、登録時に当該発声内容を表すサブワー
    ド標準パターンを連結し単語標準パターンを作成し、本
    人の登録音声との類似度の分布を求め、前記閾値は、本
    人の登録音声と前記複数話者の標準パターンとの間の類
    似度の分布のKパーセンタイルの類似度として決定する
    ことを特徴とする話者照合における閾値決定方法。
  2. 【請求項2】入力パターンと標準パターンの照合時の本
    人判定の基準となる話者照合における閾値決定方法にお
    いて、 登録話者以外の複数話者のサブワード単位の標準パター
    ンを蓄えておき、登録時に当該発声内容を表すサブワー
    ド標準パターンを連結し単語標準パターンを作成し、本
    人の登録音声との類似度の分布を求め、前記閾値は、本
    人の登録音声と複数話者の標準パターンとの間の類似度
    の分布のKパーセンタイル近傍のN個の類似度の平均値
    として決定することを特徴とする話者照合における閾値
    決定方法。
  3. 【請求項3】入力パターンと標準パターンの照合時の本
    人判定の基準となる話者照合における閾値決定方法にお
    いて、 登録話者以外の複数話者のサブワード単位の標準パター
    ンを蓄えておき、登録時に当該発声内容を表すサブワー
    ド標準パターンを連結し単語標準パターンを作成し、本
    人の登録音声との類似度の分布を求め、前記閾値は、本
    人の登録音声と複数話者の標準パターンとの間の類似度
    の分布からランダムに選択されたN個の類似度に基づい
    て決定することを特徴とする話者照合における閾値決定
    方法。
  4. 【請求項4】入力パターンと標準パターンの照合時の本
    人判定の基準となる話者照合における閾値決定方法にお
    いて、 登録話者以外の複数話者のサブワード単位の標準パター
    ンを蓄えておき、登録時に当該発声内容を表すサブワー
    ド標準パターンを連結し単語標準パターンを作成し、本
    人の登録音声との類似度の分布を求め、前記閾値は、本
    人の登録音声と複数話者の標準パターンとの間の類似度
    の分布の中央値近傍のN個の類似度に基づいて決定する
    ことを特徴とする話者照合における閾値決定方法。
  5. 【請求項5】複数話者の標準パターンを、話者クラスタ
    に相当する各ノードによって構成され、第一段目のノー
    ドが全話者のクラスタに相当し、第一段目の各ノードか
    ら子ノードが第二段目のノードに相当し、上位ノードは
    それにつながる下位ノードの音響的特徴を代表する標準
    パターンを有し末端のリーフノードが各話者の標準パタ
    ーンで構成される木構造話者標準パターンとして記憶さ
    れており、登録音声と第二段目の各ノードの標準パター
    ンとの類似度を計算し、計算された類似度の上位M位の
    類似度を持つノードの下位ノードの標準パターンと登録
    音声との類似度計算を計算し、このような計算を上位ノ
    ードから下位ノードへ向かって、各段で類似度の高い上
    位M位のノードの下位ノードの標準パターンと登録音声
    との類似度を計算し、計算されないノードの類似度は、
    その上位ノードの値を代用し、最終的にリーフノードで
    計算された類似度類似度の分布に基づいて閾値を決定す
    ることを特徴とする話者照合における閾値決定方法。
  6. 【請求項6】前記類似度の分布のKパーセンタイルの類
    似度を閾値として決定する請求項5に記載の話者照合に
    おける閾値決定方法。
  7. 【請求項7】前記類似度の分布のKパーセンタイル近傍
    のN個の類似度の平均値の類似度を閾値として決定する
    請求項5に記載の話者照合における閾値決定方法。
  8. 【請求項8】入力された本人の登録用音声を分析し、特
    徴ベクトルに変換し、複数の話者の標準パターンをサブ
    ワード単位の標準パターンを入力された発声内容に従っ
    て連鎖させ、各話者の単語標準パターンを作成し、前記
    本人の特徴ベクトルと、複数話者の単語標準パターンと
    の類似度を計算し、計算された類似度を高い順にソート
    し、類似度の分布のKパーセンタイル近傍のN個の類似
    度の平均値を照合時の閾値とすることを特徴とする話者
    照合における閾値決定方法。
  9. 【請求項9】入力された本人の登録用音声を分析し、特
    徴ベクトルに変換し、1つのノードがそれにつながる下
    位ノードの音響的特徴を代表するような木構造で、各話
    者の標準パターンを末端のリーフノードに持つ木構造を
    した複数話者の標準パターンをサブワード単位の標準パ
    ターンを入力された発声内容に従って連鎖させ、各ノー
    ドの単語標準パターンを作成し、前記本人の特徴ベクト
    ルと作成された木構造話者標準パターンとの類似度を、
    上位ノードから下位ノードに向かって計算する際、各階
    層において類似度の高い上位M個のノードについてのみ
    その下位ノードの類似度計算を行い、計算されないノー
    ドの類似度をその上位ノードの類似度で代用し、前記計
    算された類似度の分布から照合時の閾値を求めることを
    特徴とする話者照合における閾値決定方法。
  10. 【請求項10】入力された本人の登録用音声を分析し特
    徴ベクトルに変換する分析部と、 複数の話者の標準パターンをサブワード単位で記憶する
    サブワード単位の話者標準パターン記憶部と、 前記サブワード単位の話者標準パターン記憶部に記憶さ
    れているサブワード単位の標準パターンを入力された発
    声内容に従って連鎖させ、各話者の単語標準パターンを
    作成し、前記分析部で変換された本人の特徴ベクトル
    と、複数話者の単語標準パターンとの類似度を計算する
    類似度計算部と、 前記類似度計算部で計算された類似度を高い順にソート
    し、類似度の分布のKパーセンタイル近傍のN個の類似
    度の平均値を照合時の閾値とする閾値選計算部と、 を備えて成ることを特徴とする話者照合における閾値決
    定装置。
  11. 【請求項11】入力された本人の登録用音声を分析し、
    特徴ベクトルに変換する分析部と、 1つのノードがそれにつながる下位ノードの音響的特徴
    を代表するような木構造で、各話者の標準パターンを末
    端のリーフノードに持つ木構造をした複数話者の標準パ
    ターンをサブワード単位で記憶するサブワード単位の木
    構造話者標準パターン記憶部と、 前記サブワード単位の木構造話者標準パターン記憶部に
    記憶されているサブワード単位の標準パターンを入力さ
    れた発声内容に従って連鎖させ、各ノードの単語標準パ
    ターンを作成し、前記分析部で変換された本人の特徴ベ
    クトルと作成された木構造話者標準パターンとの類似度
    を、上位ノードから下位ノードに向かって計算する場合
    に、各階層において類似度の高い上位M個のノードにつ
    いてのみその下位ノードの類似度計算を行い、計算され
    ないノードの類似度をその上位ノードの類似度で代用す
    る類似度計算部と、 前記類似度計算部で計算された類似度の分布から照合時
    の閾値を求める閾値決定部と、 を備えて成ることを特徴とする話者照合における閾値決
    定装置。
JP10069514A 1998-03-04 1998-03-04 話者照合における閾値決定方法及び装置 Expired - Lifetime JP3036509B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP10069514A JP3036509B2 (ja) 1998-03-04 1998-03-04 話者照合における閾値決定方法及び装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP10069514A JP3036509B2 (ja) 1998-03-04 1998-03-04 話者照合における閾値決定方法及び装置

Publications (2)

Publication Number Publication Date
JPH11249684A JPH11249684A (ja) 1999-09-17
JP3036509B2 true JP3036509B2 (ja) 2000-04-24

Family

ID=13404928

Family Applications (1)

Application Number Title Priority Date Filing Date
JP10069514A Expired - Lifetime JP3036509B2 (ja) 1998-03-04 1998-03-04 話者照合における閾値決定方法及び装置

Country Status (1)

Country Link
JP (1) JP3036509B2 (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20220238097A1 (en) * 2019-06-07 2022-07-28 Nec Corporation Speech processing device, speech processing method, and non-transitory computer readable medium storing program

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR101229108B1 (ko) 2009-12-21 2013-02-01 한국전자통신연구원 단어별 신뢰도 문턱값에 기반한 발화 검증 장치 및 그 방법
JP6473189B2 (ja) * 2017-04-12 2019-02-20 サンコーインダストリー株式会社 最終注文時刻特定装置
JP7729118B2 (ja) * 2021-08-30 2025-08-26 カシオ計算機株式会社 電子機器、認証方法及び認証プログラム

Non-Patent Citations (4)

* Cited by examiner, † Cited by third party
Title
IEEE Transactions on Acoustics,Speech and Signal Processing,Vol.ASSP−29,No.2,April 1981,"Cepstral Analysis Technique for Automatic Speaker Verification",p.254−272
Proceedings of 1990 IEEE International Conference on Acoustics,Speech and Signal Processing,Vol.1"Sub−word unit talker verfication using hidden markov models"p.269−272
Proceedings of 1996 IEEE International Conference on Acoustics,Speech and Signal Processing,Vol.1"Robust methods of updating model and a priori threshold in speker verification"p.97−100
日本音響学会平成10年春季研究発表会講演論文集▲I▼ 2−6−7「話者照合における連続音節認識による登録パターン作成方法」p.67−68(平成10年3月17日発行)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20220238097A1 (en) * 2019-06-07 2022-07-28 Nec Corporation Speech processing device, speech processing method, and non-transitory computer readable medium storing program
US12094450B2 (en) * 2019-06-07 2024-09-17 Nec Corporation Speech processing device, speech processing method, and non-transitory computer readable medium storing program

Also Published As

Publication number Publication date
JPH11249684A (ja) 1999-09-17

Similar Documents

Publication Publication Date Title
CA2609247C (en) Automatic text-independent, language-independent speaker voice-print creation and speaker recognition
Sukkar et al. Vocabulary independent discriminative utterance verification for nonkeyword rejection in subword based speech recognition
US5167004A (en) Temporal decorrelation method for robust speaker verification
US5675706A (en) Vocabulary independent discriminative utterance verification for non-keyword rejection in subword based speech recognition
JP3337233B2 (ja) 音声符号化方法及び装置
JP6908045B2 (ja) 音声処理装置、音声処理方法、およびプログラム
JPH11507443A (ja) 話者確認システム
US4910782A (en) Speaker verification system
KR20010102549A (ko) 화자 인식 방법 및 장치
US20100063817A1 (en) Acoustic model registration apparatus, talker recognition apparatus, acoustic model registration method and acoustic model registration processing program
JP2991287B2 (ja) 抑制標準パターン選択式話者認識装置
JP2004199077A (ja) 音声処理のための、ガウスモデルを基にした動的時間伸縮のシステムと方法
Ozaydin Design of a text independent speaker recognition system
Ilyas et al. Speaker verification using vector quantization and hidden Markov model
JP3092788B2 (ja) 話者認識用しきい値設定方法及びこの方法を用いた話者認識装置
Rahim et al. String-based minimum verification error (SB-MVE) training for speech recognition
JP4391179B2 (ja) 話者認識システム及び方法
JP4440414B2 (ja) 話者照合装置及び方法
JPH11249684A (ja) 話者照合における閾値決定方法及び装置
Gunawardana et al. Word-based acoustic confidence measures for large-vocabulary speech recognition.
JP2001312293A (ja) 音声認識方法およびその装置、並びにコンピュータ読み取り可能な記憶媒体
JP3090119B2 (ja) 話者照合装置、方法及び記憶媒体
JP3104900B2 (ja) 音声認識方法
Dey et al. Content normalization for text-dependent speaker verification
JP2991288B2 (ja) 話者認識装置