JPH02242298A - 声門波形に基づく話者識別装置 - Google Patents

声門波形に基づく話者識別装置

Info

Publication number
JPH02242298A
JPH02242298A JP1062265A JP6226589A JPH02242298A JP H02242298 A JPH02242298 A JP H02242298A JP 1062265 A JP1062265 A JP 1062265A JP 6226589 A JP6226589 A JP 6226589A JP H02242298 A JPH02242298 A JP H02242298A
Authority
JP
Japan
Prior art keywords
speaker
section
glottis
waveform
glottal
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP1062265A
Other languages
English (en)
Other versions
JP2504171B2 (ja
Inventor
Jun Kametani
亀谷 潤
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NEC Corp
Original Assignee
NEC Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by NEC Corp filed Critical NEC Corp
Priority to JP1062265A priority Critical patent/JP2504171B2/ja
Priority to US07/493,118 priority patent/US5091948A/en
Publication of JPH02242298A publication Critical patent/JPH02242298A/ja
Application granted granted Critical
Publication of JP2504171B2 publication Critical patent/JP2504171B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/02Preprocessing operations, e.g. segment selection; Pattern representation or modelling, e.g. based on linear discriminant analysis [LDA] or principal components; Feature selection or extraction

Landscapes

  • Engineering & Computer Science (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Complex Calculations (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [産業上の利用分野] 本発明は不特定多数の話者識別装置に関し、特に、話者
の同定に際してキーワードの登録を必要とせず、声門波
形の形状における個人的特徴に基づいた話者識別装置に
関するものである。
〔従来の技術〕
従来、この種の話者識別装置は、第2図に示すような構
成となっている。第2図において、9は入力される音声
信号を無音部分から分離する始終端検出部、10は抽出
された音声信号の特徴パラメータを算出する音響分析部
、11は話者識別の補助的情報となるキーワードを登録
しておくキーワード記憶部、及び12は特徴パラメータ
およびキーワードを使って入力音声の話者と登録されて
いる話者が同一人物であるか否かを判別する話者識別部
である。
[発明が解決しようとする課題] 上述した従来の話者識別装置では、音声の個人性を表わ
す特徴パラメータを、主に音声信号波形そのものから求
めている。例えば、割合個人性の情報を含むパラメータ
として、ケプストラム係数、線形予測係数、音声信号の
自己相関係数等が使用される。また、話者の個人的特徴
を良く表わすパラメータとして、音声信号の基本周波数
も一般によく使われる。音声信号波形から算出される特
徴パラメータには、声道の形状によって決定される調音
に関する情報が含まれている。一般に、調音情報は、受
話器官の大きさ等個人的な情報も含んでいるが、主に音
韻情報という話者に依存しない情報を含んでいる。した
がって、従来使われているパラメータのみでは、個人性
に基づく特徴パラメータの差が明確に表われず、話者の
識別率はそれほど高くないという欠点がある。
この欠点を補うため、従来の話者識別装置では、話者ご
とにキーワードを設定し、このキーワードにてDPマツ
チング等の特定話者音声認識を行ない、この認識結果と
話者識別の結果の両方に基づいて最終判定を下すことに
より、識別率を高め安全性の確保を図っている。しかし
、この話者識別装置においては、利用者は各自のキーワ
ードを決定してそれを登録する必要があるため、常にキ
ーワードを記憶していなければならないという欠点があ
る。
[課題を解決するための手段] 本発明による声門波形に基づく話者識別装置は、入力さ
れた音声信号から有声区間を検出し、検出した有声音信
号を出力する手段と、該検出した有声音信号の高域補償
を行ない、補償された音声信号と高域補償パラメータを
出力する手段と、該補償された音、声信号から入力信号
を推定し、推定人力信号を出力する手段と、該推定入力
信号と前記高域補償パラメータから声門波形を再現し、
再現した声門波形を出力する手段と、話者ごとの声門波
形の各特徴をあらかじめ登録して記憶しておき、登録済
みパターンを出力する手段と、前記再現した声門波形を
分析して特徴パラメータを抽出し、前記登録済みパラメ
ータと比較して話者を識別する手段とを有している。
[実施例] 次に、本発明について図面を参照して説明する。
第1図は本発明の一実施例による声門波形に基づく話者
識別装置の構成を示すブロック図である。
人力媒体1は、マイクロフォン、電話回線等を通じて入
力される音声信号をディジタル化するユニットである。
音声区間検出部2は、人力された音声信号の中から音声
音の部分を取り出すユニットである。プレフィルタリン
グ部3は、有声音区間のスペクトルの高域補償を行なう
ユニットである。入力信号推定部4は、補償後の有声音
信号より声道への入力信号を推定するユニットである。
声門波形推定部5は、推定入力信号と高域補償に用いた
パラメータを使って、声門波形を再現するユニットであ
る。話者別パターン記憶部6は、声門ニラの個人的な特
徴のパターンを登録、蓄櫃しておくユニットである。話
者識別部7は、再現された声門波形を分析し、あらかじ
め登録しである各話者の特徴パターンと比較照合するこ
とにより、話者を識別するユニットである。ホスト8は
、このシステム全体の制御を行ない、識別結果に基づき
サービスを指示するコンピュータである。
以下にこの実施例の動作について説明する。
まず、話者の発声した音は人力媒体1に入力され、ここ
でディジタル信号化される。入力手段としては、利用サ
ービスの形態により、マイクロフォンもしくは電話回線
の選択ができる。ディジタル信号化された音声信号は、
有声区間検出部2に送られる。
この音声信号中には、無音区間や無声子音等の情報も含
まれている。音声に反映される個人性の情報は、調音器
官の生理学的違いに基づくフォルマント周波数差よりも
、声門波形の違いによるピッチ周波数の大小、音声信号
のスペクトル特性の傾き、曲がりおよびピッチハーモニ
ー以外の雑音的成分の大小等に顕著に表われるものと考
えられる。したがってこの話者識別装置では、声門波に
よって励起される音声、すなわち有声音のみが話者識別
に必要な情報となる。
このため、有声区間検出部2では、入力された信号の類
サンプル区間のパワー情報および零交差回数等の情報を
用いて、信号中から有声音の区間を一定サンプル数だけ
抽出する。
有声音のスペクトル特性は、一般に、声門波形のスペク
トル特性と口唇からの放射特性を反映して、大体−10
dB10ct程度の高域減衰特性を侍っている。この特
性は、音声信号の人力信号を推定するのに際し、あまり
好ましい事ではないため、適応的に逆フィルタリング等
を行なう事により、スペクトル概形を平坦化する必要が
ある。
プレフィルタリング部3は、以上の様に有声区間のスペ
クトル原形を平坦化するためにフィルタリングを行なう
が、この時のフィルタリングの係数は声門波を再現する
際に必要となるので、後述する声門波形推定部5にこの
時の係数も送っておく 。
プレフィルタリング部3によってスペクトル特性を補償
された音声音区間は、入力推定部4において線形予測分
析が行なわれ、声道伝達関数と声道への人力信号に分離
される。声道の伝達関数を全極形、この系の人力を周期
的パルス列と仮定すると、声道への入力信号すなわち声
門波は音声信号と線形予測係数の多項式から求めること
ができる。
この有声音区間の推定入力信号は、声門波形推定部5に
送られ、ここでプレフィルタリング部3から先に送られ
ている逆フィルタの係数を用いて、声門波形の再現が行
なわれる。有声音の声門波を時間で2回微分すると、周
期的パルス列で近似できることより、入力信号推定部4
で求めた入力信号に2回積分操作を行なえば声門波形を
再現できル、フレフィルタリ〉・グ部3で求めたフィル
タの係数を用いて逆の伝達特性を持つ正フィルタを構成
し、推定入力信号をフィルタリングすれば、1回積分を
したのと等価になる。あと−回の積分操作は、正フィル
タリングした推定入力信号の和分を行なえば等価となり
、これによって声門波形は再現される。また同時に、声
門波形推定部5では、フィルタリング前の入力信号の自
己相関関数を求め、これよりピッチ周期を算出すること
も行なう。
再現された声門波形は、次の話者識別部7に送られ、以
下の各項目について分析される。
第3図は、ここで分析される声門波形の個人的特徴を示
している。第3図(a)において、Tはピッチ周期もし
くは音声の基本周期と呼ばれる周期で、話者の声の高低
に対応しており、個人性がよく反映される特徴量である
。τは声門閉鎖期間であり、声門が閉じて呼気流が声道
に流入しない期間の長さである。toは声門が閉鎖状態
から声門開口面積最大の時点に達するまでの期間長、t
2は声門開口面積最大の時点から声門が閉鎖状態に達す
るまでの期間長である。
話者識別装置においては、個人性を表わす特徴パラメー
タとして上記の4つの特徴量より、ピッチ周期T1声門
閉鎖期間τとピッチ周期Tの比R1−τ/T、および声
門波形立上り時間t0と声門波形立下り時間t、の比R
2−t。/1.の3つを用いる。
比R1およびR2は、声門波形の形状に関して正規化し
た情報であり、主に声の質に関連している。例えば、R
1が太きくR2も大きい第3図(b)に示されるような
音声は、高域の減衰が少なく、ピッチハーモニー以外の
周波数成分が多く、聴感的によ(通る声の話者と考えら
れる。またR1が小さくR2も小さい第3図(c)に示
されるような音声は、高域の減衰が大きく、ピッチハー
モニー以外の周波数成分が少なく、聴覚的に柔かい声の
話者と考えられる。
話者識別部7では、あらかじめ話者別パターン記憶部6
に登録しであるT、R,R2の値と、入力された音声信
号より分析されたT、R。
R2の値を比較し、3つの値共に許容範囲内に収まって
いる場合には、入力された音声信号の話者と登録済の話
者が同一であると判断し、ホスト8に結果を送信する。
ここで、判定の基準に選ばれるT、R,R2の値は、あ
る一定の長さだけ抽出された有声音より求められた声門
波形における、個々のT、R。
R2の平均値を用いるが、T 、 Rl 、R2(7)
 各分散値も識別の基準に用いる。これは、各パラメー
タの安定度にも個人差が存在するためであり、このため
有声音を抽出する区間長は、10ピッチ分の長さが最低
でも必要である。
話者別パターン記憶部6は、このシステムの利用者があ
らかじめ自分自身の音声の声門波形を分析し、その特徴
パターンT、R+ 、R2の平均値もよγドその分散を
登録しておくメモリであり、ホスト8からの指示電文に
より話者別パターンの登録や登録済パターンの読出しを
話者識別部7との間で行なう。
[発明の効果] 以上説明したように本発明は、個人性を表わす特徴パラ
メータとして、有声音の声門波形の形状に基づくパラメ
ータを用いることにより、従来の音声信号波形そのもの
から求めたパラメータを用いる方式と比べ、音声の個人
性に関するより本質的な情報を使用するため、音声によ
る話者識別率が向上するという効果がある。
また、有声音の声門波形は音声の音韻性情報をほとんど
含んでいないため、任意の単語発声から抽出した声門波
形より話者識別が可能であり、キーワードの登録による
特定話者単語認識の併用によって、音声に基づく話者識
別の結果を補わなくても高い識別率が得られるため、利
用者は個人のキーワードを覚えておく必要がないという
効果がある。
【図面の簡単な説明】
第1図は本発明の一実施例による声門波形に基づく話者
識別装置の構成を示すブロック図、第2図は従来の話者
識別装置の構成を示すブロック図、第3図(a)は有声
音の声門波形の特徴パラメータについての説明図、第3
図(b)、(c)は対照的な声の質を持つ話者の南門波
形の特徴パラメータの違いについての説明図である。 1・・・人力媒体、2・・・有声区間検出部、3・・・
プレフィルタリング部、4・・・入力信号推定部、5・
・・声門波形推定部、6・・・話者別パターン記憶部、
7・・・話者識別部、8・・・ホスト。

Claims (1)

    【特許請求の範囲】
  1. 1、入力された音声信号から有声区間を検出し、検出し
    た有声音信号を出力する手段と、該検出した有声音信号
    の高域補償を行ない、補償された音声信号と高域補償パ
    ラメータを出力する手段と、該補償された音声信号の入
    力信号を推定し、推定入力信号を出力する手段と、該推
    定入力信号と前記高域補償パラメータから声門波形を再
    現し、再現した声門波形を出力する手段と、声門波形の
    個人的特徴をパターンとして記憶しておき、登録済パタ
    ーンを出力する手段と、前記再現した声門波形い特徴を
    分析し、前記登録済パターンと比較することにより話者
    を識別する手段とを有することを特徴とする声門波形に
    基づく話者識別装置。
JP1062265A 1989-03-16 1989-03-16 声門波形に基づく話者識別装置 Expired - Lifetime JP2504171B2 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP1062265A JP2504171B2 (ja) 1989-03-16 1989-03-16 声門波形に基づく話者識別装置
US07/493,118 US5091948A (en) 1989-03-16 1990-03-15 Speaker recognition with glottal pulse-shapes

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1062265A JP2504171B2 (ja) 1989-03-16 1989-03-16 声門波形に基づく話者識別装置

Publications (2)

Publication Number Publication Date
JPH02242298A true JPH02242298A (ja) 1990-09-26
JP2504171B2 JP2504171B2 (ja) 1996-06-05

Family

ID=13195146

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1062265A Expired - Lifetime JP2504171B2 (ja) 1989-03-16 1989-03-16 声門波形に基づく話者識別装置

Country Status (2)

Country Link
US (1) US5091948A (ja)
JP (1) JP2504171B2 (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2010276697A (ja) * 2009-05-26 2010-12-09 Waseda Univ 音声処理装置およびプログラム

Families Citing this family (38)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE69203186T2 (de) * 1991-09-20 1996-02-01 Philips Electronics Nv Verarbeitungsgerät für die menschliche Sprache zum Detektieren des Schliessens der Stimmritze.
US5402520A (en) * 1992-03-06 1995-03-28 Schnitta; Bonnie S. Neural network method and apparatus for retrieving signals embedded in noise and analyzing the retrieved signals
US5596680A (en) * 1992-12-31 1997-01-21 Apple Computer, Inc. Method and apparatus for detecting speech activity using cepstrum vectors
US5692104A (en) * 1992-12-31 1997-11-25 Apple Computer, Inc. Method and apparatus for detecting end points of speech activity
DK46493D0 (da) * 1993-04-22 1993-04-22 Frank Uldall Leonhard Metode for signalbehandling til bestemmelse af transientforhold i auditive signaler
US5625747A (en) * 1994-09-21 1997-04-29 Lucent Technologies Inc. Speaker verification, speech recognition and channel normalization through dynamic time/frequency warping
US5640490A (en) * 1994-11-14 1997-06-17 Fonix Corporation User independent, real-time speech recognition system and method
US5666466A (en) * 1994-12-27 1997-09-09 Rutgers, The State University Of New Jersey Method and apparatus for speaker recognition using selected spectral information
NZ303239A (en) * 1995-03-07 1999-01-28 British Telecomm Speech synthesis from recorded phonemes with amplitude adjustments
US6504905B1 (en) * 1999-04-09 2003-01-07 Qwest Communications International Inc. System and method of testing voice signals in a telecommunication system
US7253919B2 (en) * 2000-11-30 2007-08-07 Ricoh Co., Ltd. Printer with embedded retrieval and publishing interface
FR2823361A1 (fr) * 2001-04-05 2002-10-11 Thomson Licensing Sa Procede et dispositif d'extraction acoustique d'un signal vocal
US7424129B2 (en) * 2001-11-19 2008-09-09 Ricoh Company, Ltd Printing system with embedded audio/video content recognition and processing
US7861169B2 (en) * 2001-11-19 2010-12-28 Ricoh Co. Ltd. Multimedia print driver dialog interfaces
US20040181815A1 (en) * 2001-11-19 2004-09-16 Hull Jonathan J. Printer with radio or television program extraction and formating
US7747655B2 (en) 2001-11-19 2010-06-29 Ricoh Co. Ltd. Printable representations for time-based media
US7415670B2 (en) 2001-11-19 2008-08-19 Ricoh Co., Ltd. Printer with audio/video localization
US7314994B2 (en) * 2001-11-19 2008-01-01 Ricoh Company, Ltd. Music processing printer
US8323190B2 (en) * 2003-07-09 2012-12-04 Med-Tek Llc Comprehensive neuromuscular profiler
US7275159B2 (en) * 2003-08-11 2007-09-25 Ricoh Company, Ltd. Multimedia output device having embedded encryption functionality
US8077341B2 (en) * 2003-09-25 2011-12-13 Ricoh Co., Ltd. Printer with audio or video receiver, recorder, and real-time content-based processing logic
US7864352B2 (en) 2003-09-25 2011-01-04 Ricoh Co. Ltd. Printer with multimedia server
JP2005108230A (ja) * 2003-09-25 2005-04-21 Ricoh Co Ltd オーディオ/ビデオコンテンツ認識・処理機能内蔵印刷システム
US7528976B2 (en) * 2003-09-25 2009-05-05 Ricoh Co., Ltd. Stand alone printer with hardware/software interfaces for sharing multimedia processing
US7440126B2 (en) * 2003-09-25 2008-10-21 Ricoh Co., Ltd Printer with document-triggered processing
US20050068573A1 (en) * 2003-09-25 2005-03-31 Hart Peter E. Networked printing system having embedded functionality for printing time-based media
US7511846B2 (en) * 2003-09-25 2009-03-31 Ricoh Co., Ltd. Printer having embedded functionality for printing time-based media
US7570380B2 (en) * 2003-09-25 2009-08-04 Ricoh Company, Ltd. Printer user interface
US7505163B2 (en) * 2003-09-25 2009-03-17 Ricoh Co., Ltd. User interface for networked printer
US7573593B2 (en) * 2003-09-25 2009-08-11 Ricoh Company, Ltd. Printer with hardware and software interfaces for media devices
US20050071763A1 (en) * 2003-09-25 2005-03-31 Hart Peter E. Stand alone multimedia printer capable of sharing media processing tasks
US7528977B2 (en) * 2003-09-25 2009-05-05 Ricoh Co., Ltd. Printer with hardware and software interfaces for peripheral devices
US7508535B2 (en) * 2003-09-25 2009-03-24 Ricoh Co., Ltd. Stand alone multimedia printer with user interface for allocating processing
US20050096900A1 (en) * 2003-10-31 2005-05-05 Bossemeyer Robert W. Locating and confirming glottal events within human speech signals
US7603615B2 (en) 2004-03-30 2009-10-13 Ricoh Co., Ltd. Multimedia projector-printer
US8274666B2 (en) * 2004-03-30 2012-09-25 Ricoh Co., Ltd. Projector/printer for displaying or printing of documents
US7551312B1 (en) 2005-03-17 2009-06-23 Ricoh Co., Ltd. Annotable document printer
EP3469580B1 (en) * 2016-06-02 2025-02-19 Genesys Cloud Services, Inc. Technologies for authenticating a speaker using voice biometrics

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3456080A (en) * 1966-03-28 1969-07-15 American Standard Inc Human voice recognition device
US3466394A (en) * 1966-05-02 1969-09-09 Ibm Voice verification system
US3700815A (en) * 1971-04-20 1972-10-24 Bell Telephone Labor Inc Automatic speaker verification by non-linear time alignment of acoustic parameters
US3989896A (en) * 1973-05-08 1976-11-02 Westinghouse Electric Corporation Method and apparatus for speech identification
JPS5722295A (en) * 1980-07-15 1982-02-05 Nippon Electric Co Speaker recognizing system
JPS5876893A (ja) * 1981-10-30 1983-05-10 日本電気株式会社 音声認識装置

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2010276697A (ja) * 2009-05-26 2010-12-09 Waseda Univ 音声処理装置およびプログラム

Also Published As

Publication number Publication date
US5091948A (en) 1992-02-25
JP2504171B2 (ja) 1996-06-05

Similar Documents

Publication Publication Date Title
JP2504171B2 (ja) 声門波形に基づく話者識別装置
Talkin et al. A robust algorithm for pitch tracking (RAPT)
Kinnunen Spectral features for automatic text-independent speaker recognition
Yegnanarayana et al. Epoch-based analysis of speech signals
JP2000511651A (ja) 記録されたオーディオ信号の非均一的時間スケール変更
CN104123934A (zh) 一种构音识别方法及其系统
JP3673507B2 (ja) 音声波形の特徴を高い信頼性で示す部分を決定するための装置およびプログラム、音声信号の特徴を高い信頼性で示す部分を決定するための装置およびプログラム、ならびに擬似音節核抽出装置およびプログラム
CN120766655B (zh) 跨语言ai声纹克隆方法、系统及其存储介质
Xu et al. Speaker recognition based on long short-term memory networks
Brookes et al. Speaker characteristics from a glottal airflow model using robust inverse filtering
Singh et al. Features and techniques for speaker recognition
Dubey et al. Hypernasality detection using zero time windowing
Deshpande et al. Speaker identification based on robust am-fm features
Thirumuru et al. Application of non-negative frequency-weighted energy operator for vowel region detection
Jelinek et al. Frequency-domain spectral envelope estimation for low rate coding of speech
Bapineedu Analysis of Lombard effect speech and its application in speaker verification for imposter detection
JP3035939B2 (ja) 音声分析合成装置
JP2000099099A (ja) データ再生装置
Feng et al. The Research of Forensic Voiceprint Identification Based on WMFCC
Alku et al. Analysis of voice production in breathy, normal and pressed phonation by comparing inverse filtering and videokymography.
Patil et al. Identifying Perceptually Similar Languages Using Teager Energy Based Cepstrum.
Gable Speaker verification using acoustic and glottal electromagnetic micropower sensor (GEMS) data
Aljinu Khadar et al. Extraction of Vocal Tract Length from Formant Frequencies for Forensic Speech Applications in Noisy Environment
Pandiaraj et al. A confidence measure based—Score fusion technique to integrate MFCC and pitch for speaker verification
Kura Novel pitch detection algorithm with application to speech coding