JPH06318099A - 話者認識装置 - Google Patents
話者認識装置Info
- Publication number
- JPH06318099A JPH06318099A JP5108044A JP10804493A JPH06318099A JP H06318099 A JPH06318099 A JP H06318099A JP 5108044 A JP5108044 A JP 5108044A JP 10804493 A JP10804493 A JP 10804493A JP H06318099 A JPH06318099 A JP H06318099A
- Authority
- JP
- Japan
- Prior art keywords
- voice
- information
- registered
- input
- voice information
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000005070 sampling Methods 0.000 description 15
- 238000000034 method Methods 0.000 description 13
- 238000012795 verification Methods 0.000 description 5
- 238000010586 diagram Methods 0.000 description 3
- 238000005516 engineering process Methods 0.000 description 3
- 230000005236 sound signal Effects 0.000 description 3
- 238000001914 filtration Methods 0.000 description 2
- 230000002123 temporal effect Effects 0.000 description 2
- YBIDYTOJOXKBLO-USLOAXSXSA-N (4-nitrophenyl)methyl (5r,6s)-6-[(1r)-1-hydroxyethyl]-3,7-dioxo-1-azabicyclo[3.2.0]heptane-2-carboxylate Chemical compound C([C@@H]1[C@H](C(N11)=O)[C@H](O)C)C(=O)C1C(=O)OCC1=CC=C([N+]([O-])=O)C=C1 YBIDYTOJOXKBLO-USLOAXSXSA-N 0.000 description 1
- 101710096655 Probable acetoacetate decarboxylase 1 Proteins 0.000 description 1
- 108091022873 acetoacetate decarboxylase Proteins 0.000 description 1
- 238000001514 detection method Methods 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 238000009740 moulding (composite fabrication) Methods 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Abstract
(57)【要約】
【目的】 話者認識装置において、特定話者に関する発
声上の同一性の認識率を向上させる。 【構成】 登録モード時に音声入出力部10から出力さ
れた音声信号を登録音声情報として登録し、認識モード
時に音声入出力部10から出力された音声信号を未知音
声情報として登録音声情報と比較し両者が個人性情報と
して一致しているかどうかを判定するに際し、音声波形
中で時間が変化しても振幅があまり変化しない区間が吸
収された登録音声情報と未知音声情報とを比較すること
で、同一人の発声速度の変動を単音の単位で吸収し、認
識率の向上を図る。
声上の同一性の認識率を向上させる。 【構成】 登録モード時に音声入出力部10から出力さ
れた音声信号を登録音声情報として登録し、認識モード
時に音声入出力部10から出力された音声信号を未知音
声情報として登録音声情報と比較し両者が個人性情報と
して一致しているかどうかを判定するに際し、音声波形
中で時間が変化しても振幅があまり変化しない区間が吸
収された登録音声情報と未知音声情報とを比較すること
で、同一人の発声速度の変動を単音の単位で吸収し、認
識率の向上を図る。
Description
【0001】
【産業上の利用分野】本発明は、特定話者の発声上の同
一性を識別する話者認識装置に関する。
一性を識別する話者認識装置に関する。
【0002】
【従来の技術】人間が発声する言葉には、音韻性情報と
個人性情報とが含まれている。音韻性情報というのは、
言葉の意味内容に関する情報であり、この音韻性情報を
認識する技術は音声認識といわれている。一方、個人性
情報というのは、誰が話しているかに関する情報であ
り、この個人性情報を認識する技術は話者認識といわれ
ている。また、この話者認識という概念には、話者識別
と話者照合とが含まれている。話者識別というのは、未
知の音声が予め限定された複数の話者のうちの誰の音声
なのかを判定する技術であり、話者照合というのは、未
知の音声が予め定められた話者の音声であるかどうかを
判定する技術である。
個人性情報とが含まれている。音韻性情報というのは、
言葉の意味内容に関する情報であり、この音韻性情報を
認識する技術は音声認識といわれている。一方、個人性
情報というのは、誰が話しているかに関する情報であ
り、この個人性情報を認識する技術は話者認識といわれ
ている。また、この話者認識という概念には、話者識別
と話者照合とが含まれている。話者識別というのは、未
知の音声が予め限定された複数の話者のうちの誰の音声
なのかを判定する技術であり、話者照合というのは、未
知の音声が予め定められた話者の音声であるかどうかを
判定する技術である。
【0003】近年、話者認識中の話者照合の技術は、電
話によるバンキングサービス、機密保管場所などへの入
室者のチェック、個人情報へのアクセス等に広く利用さ
れている。この場合に用いられている話者照合では、い
わば本人であるかどうかの鍵として音声が用いられてい
る。
話によるバンキングサービス、機密保管場所などへの入
室者のチェック、個人情報へのアクセス等に広く利用さ
れている。この場合に用いられている話者照合では、い
わば本人であるかどうかの鍵として音声が用いられてい
る。
【0004】ここで、話者照合の技術を利用した話者認
識装置の一例として、その基本的構成を図8に概念的に
示す。まず、入力された音声の取り扱いを登録モードと
認識モードとに切り替えるモード選択スイッチ1が設け
られ、このモード選択スイッチ1によって登録モードが
選択されている場合には、入力されて特徴部分が抽出さ
れた音声が登録話者の標準パターンとして登録される。
そして、モード選択スイッチ1によって認識モードが選
択されている場合には、入力されて特徴部分が抽出され
た未知の音声と標準パターンとの類似度が判定され、そ
の判定結果が出力される。
識装置の一例として、その基本的構成を図8に概念的に
示す。まず、入力された音声の取り扱いを登録モードと
認識モードとに切り替えるモード選択スイッチ1が設け
られ、このモード選択スイッチ1によって登録モードが
選択されている場合には、入力されて特徴部分が抽出さ
れた音声が登録話者の標準パターンとして登録される。
そして、モード選択スイッチ1によって認識モードが選
択されている場合には、入力されて特徴部分が抽出され
た未知の音声と標準パターンとの類似度が判定され、そ
の判定結果が出力される。
【0005】より詳細には、入力音声の特徴部分を抽出
する手段として、あるサンプリング周期を1フレームと
し、このフレーム毎に複数の周波数についての音声パワ
ー及び各周波数の音声パワーの総和を算出し、こうして
算出した各フレーム毎の音声パワーのパターンを特徴部
分と認識する等の手段が従来から用いられている。これ
は、音声パワーの時間的変化に個人性情報が含まれてい
ることに着目した手段である。したがって、このような
手段が用いられる場合、算出された各フレーム毎の音声
パワーのパターンが登録話者の標準パターンとなる。そ
して、入力された未知の音声と標準パターンとの類似度
の判定は、各フレーム毎の音声パワーのパターンがどれ
だけ近似しているかを判定することによりなされる。
する手段として、あるサンプリング周期を1フレームと
し、このフレーム毎に複数の周波数についての音声パワ
ー及び各周波数の音声パワーの総和を算出し、こうして
算出した各フレーム毎の音声パワーのパターンを特徴部
分と認識する等の手段が従来から用いられている。これ
は、音声パワーの時間的変化に個人性情報が含まれてい
ることに着目した手段である。したがって、このような
手段が用いられる場合、算出された各フレーム毎の音声
パワーのパターンが登録話者の標準パターンとなる。そ
して、入力された未知の音声と標準パターンとの類似度
の判定は、各フレーム毎の音声パワーのパターンがどれ
だけ近似しているかを判定することによりなされる。
【0006】
【発明が解決しようとする課題】同じ単語を同じ人が発
声したとしても、時間や季節の違い、その日の体調や咽
喉の調子、温度や湿度の相違等の種々の要因が絡み合
い、その発声速度が変動することがある。そこで、従
来、このような同一人の発声速度の変動を吸収するた
め、ある瞬間における二つの情報が一定幅を有する整合
窓の範囲内にある場合には同一の情報とみなして一方の
情報を吸収するDPマッチング(DPはdynamicprogram
ming の略称である)という手法が一般に用いられてい
る。ところが、このDPマッチングでは、発声された単
語全体としてしか発声速度の変動を吸収することができ
ず、その単語中のある単音についての発声速度の変動を
吸収することができない。このため、同一人が時間を置
いてある単語を発声した際、その単語中のある単音だけ
に発声速度の変動が生ずると、DPマッチングではその
ような発声速度の変動を吸収することができず、認識率
が低くなってしまうという欠点を有する。
声したとしても、時間や季節の違い、その日の体調や咽
喉の調子、温度や湿度の相違等の種々の要因が絡み合
い、その発声速度が変動することがある。そこで、従
来、このような同一人の発声速度の変動を吸収するた
め、ある瞬間における二つの情報が一定幅を有する整合
窓の範囲内にある場合には同一の情報とみなして一方の
情報を吸収するDPマッチング(DPはdynamicprogram
ming の略称である)という手法が一般に用いられてい
る。ところが、このDPマッチングでは、発声された単
語全体としてしか発声速度の変動を吸収することができ
ず、その単語中のある単音についての発声速度の変動を
吸収することができない。このため、同一人が時間を置
いてある単語を発声した際、その単語中のある単音だけ
に発声速度の変動が生ずると、DPマッチングではその
ような発声速度の変動を吸収することができず、認識率
が低くなってしまうという欠点を有する。
【0007】なお、整合窓の幅を広げればDPマッチン
グにより吸収することができる発声速度の変動幅も大き
くなるが、この場合には他人の発声を同一人の発声であ
ると誤認する可能性が高くなってしまい不都合である。
グにより吸収することができる発声速度の変動幅も大き
くなるが、この場合には他人の発声を同一人の発声であ
ると誤認する可能性が高くなってしまい不都合である。
【0008】
【課題を解決するための手段】本発明は、入力された音
声を音声信号として出力する音声入出力部と、この音声
入出力部から出力された音声信号の取り扱いを登録モー
ドと認識モードとに切り替えるモード選択手段と、登録
モード時に音声入出力部から出力された音声信号を登録
音声情報として登録する音声登録手段と、認識モード時
に音声入出力部から出力された音声信号を未知音声情報
として登録音声情報と比較し個人性情報として一致して
いるかどうかを判定する真偽判定手段とを設けた話者認
識装置において、音声波形中で経時的に平坦な区間が吸
収された登録音声情報及び未知音声情報を生成して真偽
判定手段による比較対象とする平坦区間吸収手段を設け
た。ここで、「音声波形中で経時的に平坦な区間」とい
うのは、音声波形中、時間が変化しても振幅があまり変
化しない区間を意味する。
声を音声信号として出力する音声入出力部と、この音声
入出力部から出力された音声信号の取り扱いを登録モー
ドと認識モードとに切り替えるモード選択手段と、登録
モード時に音声入出力部から出力された音声信号を登録
音声情報として登録する音声登録手段と、認識モード時
に音声入出力部から出力された音声信号を未知音声情報
として登録音声情報と比較し個人性情報として一致して
いるかどうかを判定する真偽判定手段とを設けた話者認
識装置において、音声波形中で経時的に平坦な区間が吸
収された登録音声情報及び未知音声情報を生成して真偽
判定手段による比較対象とする平坦区間吸収手段を設け
た。ここで、「音声波形中で経時的に平坦な区間」とい
うのは、音声波形中、時間が変化しても振幅があまり変
化しない区間を意味する。
【0009】
【作用】モード選択手段によって登録モードが選択され
ている場合、音声入出力部に音声が入力されて音声信号
として出力されると、この音声信号は音声登録手段によ
って登録音声情報として登録される。一方、モード選択
手段によって認識モードが選択されている場合、音声入
出力部に音声が入力されて音声信号として出力される
と、真偽判定手段によってその音声信号が未知音声情報
として登録音声情報と比較され、両者が個人性情報とし
て一致しているかどうかが判定される。この際、平坦区
間吸収手段によって時間が変化しても振幅があまり変化
しない音声波形の区間が吸収された登録音声情報及び未
知音声情報が真偽判定手段による比較対象となる。した
がって、単音の単位で同一人による発声速度の変動が吸
収され、認識率の向上等が図られる。
ている場合、音声入出力部に音声が入力されて音声信号
として出力されると、この音声信号は音声登録手段によ
って登録音声情報として登録される。一方、モード選択
手段によって認識モードが選択されている場合、音声入
出力部に音声が入力されて音声信号として出力される
と、真偽判定手段によってその音声信号が未知音声情報
として登録音声情報と比較され、両者が個人性情報とし
て一致しているかどうかが判定される。この際、平坦区
間吸収手段によって時間が変化しても振幅があまり変化
しない音声波形の区間が吸収された登録音声情報及び未
知音声情報が真偽判定手段による比較対象となる。した
がって、単音の単位で同一人による発声速度の変動が吸
収され、認識率の向上等が図られる。
【0010】
【実施例】本発明の一実施例を図1ないし図7に基づい
て説明する。まず、図1のブロック図に示すように、音
声入出力部としてのマイクロフォン10が設けられてい
る。このマイクロフォン10は、増幅器11、低域通過
フィルタ12(以下、LPFと略称する)及びアナログ
デジタル変換器13(以下、ADCと略称する)を介し
て各種処理を集中的に行うCPU14(Central Proces
sing Unit )に接続されている。このCPU14には、
動作プログラム等の固定情報を格納するROM15(Re
ad Only Memory)と各種の可変情報を書き替え自在に格
納するRAM16(Randam Access Memory)とが接続さ
れている。このRAM16内には、登録音声情報格納領
域16aが含まれている。また、前記CPU14には、
処理モードを登録モードと認識モードとのいずれかに切
り替えるためのモード選択スイッチ17が接続されてい
る。さらに、話者に関する真偽の判定結果を出力するC
PU16の出力には、LED18(Light Emitting Dio
de)が接続されている。
て説明する。まず、図1のブロック図に示すように、音
声入出力部としてのマイクロフォン10が設けられてい
る。このマイクロフォン10は、増幅器11、低域通過
フィルタ12(以下、LPFと略称する)及びアナログ
デジタル変換器13(以下、ADCと略称する)を介し
て各種処理を集中的に行うCPU14(Central Proces
sing Unit )に接続されている。このCPU14には、
動作プログラム等の固定情報を格納するROM15(Re
ad Only Memory)と各種の可変情報を書き替え自在に格
納するRAM16(Randam Access Memory)とが接続さ
れている。このRAM16内には、登録音声情報格納領
域16aが含まれている。また、前記CPU14には、
処理モードを登録モードと認識モードとのいずれかに切
り替えるためのモード選択スイッチ17が接続されてい
る。さらに、話者に関する真偽の判定結果を出力するC
PU16の出力には、LED18(Light Emitting Dio
de)が接続されている。
【0011】このような構成において、CPU14によ
る処理の流れを図2及び図3のフローチャート、図4な
いし図7のグラフに基づいて説明する。概略的には、モ
ード選択手段によって登録モードが選択されていると、
マイクロフォン10から出力された音声信号が音声登録
手段によって登録音声情報として登録され、認識モード
が選択されていると、真偽判定手段によってマイクロフ
ォン10から出力された音声信号が未知音声情報として
登録音声情報と比較され、両者が個人性情報として一致
しているかどうかが判定される。この際、平坦区間吸収
手段によって音声パワーがあまり変化しない区間が吸収
された登録音声情報及び未知音声情報が真偽判定手段に
よる比較対象となる。以下、より詳細に説明する。
る処理の流れを図2及び図3のフローチャート、図4な
いし図7のグラフに基づいて説明する。概略的には、モ
ード選択手段によって登録モードが選択されていると、
マイクロフォン10から出力された音声信号が音声登録
手段によって登録音声情報として登録され、認識モード
が選択されていると、真偽判定手段によってマイクロフ
ォン10から出力された音声信号が未知音声情報として
登録音声情報と比較され、両者が個人性情報として一致
しているかどうかが判定される。この際、平坦区間吸収
手段によって音声パワーがあまり変化しない区間が吸収
された登録音声情報及び未知音声情報が真偽判定手段に
よる比較対象となる。以下、より詳細に説明する。
【0012】[モード選択手段]まず、モード選択スイ
ッチ17の切り替えによって、CPU14の処理モード
が登録モードか認識モードかに選択される。ここに、モ
ード選択手段が構成されている。
ッチ17の切り替えによって、CPU14の処理モード
が登録モードか認識モードかに選択される。ここに、モ
ード選択手段が構成されている。
【0013】[音声登録手段]次いで、マイクロフォン
10に音声が入力されて音声信号として出力されると、
この音声信号が増幅器11で増幅され、LPF12で高
域成分がカットされ、ADC13でデジタル信号に変換
される。LPF12で帯域制限を行うのは、後述する音
声信号のサンプリングに際し、サンプリング定理に従っ
たサンプリングを行って折り返し歪の発生を防止するた
めである。
10に音声が入力されて音声信号として出力されると、
この音声信号が増幅器11で増幅され、LPF12で高
域成分がカットされ、ADC13でデジタル信号に変換
される。LPF12で帯域制限を行うのは、後述する音
声信号のサンプリングに際し、サンプリング定理に従っ
たサンプリングを行って折り返し歪の発生を防止するた
めである。
【0014】デジタル信号に変換された音声信号は一定
の様式にしたがってフィルタリングされ、音声情報とし
て生成される。つまり、デジタル変換された音声信号の
音声パワーが特定の周波数毎に求められ、その値がRA
M16内の所定領域に一時記憶されるという処理が予め
定められたサンプリング周期(フレーム)毎に行われ
る。「特定の周波数」としては、例えば200Hz、40
0Hz、800Hz、1600Hz、3200Hz及び6400
Hzである。図4のグラフには、各周波数における1フレ
ームでの音声パワーを例示し、図5のグラフには、各フ
レームにおけるある周波数での音声パワーを例示する。
そして、各フレーム毎に各周波数毎の音声パワーがフィ
ルタリングされると、各フレーム毎に各周波数の音声パ
ワーの総和が求められる。図5のグラフには、各フレー
ム毎の各周波数の音声パワーの総和を例示する。音声情
報は、こうして各フレーム毎に求められた各周波数毎の
音声パワー及び各周波数の音声パワーの総和である。
の様式にしたがってフィルタリングされ、音声情報とし
て生成される。つまり、デジタル変換された音声信号の
音声パワーが特定の周波数毎に求められ、その値がRA
M16内の所定領域に一時記憶されるという処理が予め
定められたサンプリング周期(フレーム)毎に行われ
る。「特定の周波数」としては、例えば200Hz、40
0Hz、800Hz、1600Hz、3200Hz及び6400
Hzである。図4のグラフには、各周波数における1フレ
ームでの音声パワーを例示し、図5のグラフには、各フ
レームにおけるある周波数での音声パワーを例示する。
そして、各フレーム毎に各周波数毎の音声パワーがフィ
ルタリングされると、各フレーム毎に各周波数の音声パ
ワーの総和が求められる。図5のグラフには、各フレー
ム毎の各周波数の音声パワーの総和を例示する。音声情
報は、こうして各フレーム毎に求められた各周波数毎の
音声パワー及び各周波数の音声パワーの総和である。
【0015】この時、モード選択スイッチ17の切り替
えによって登録モードが選択されていると、生成された
音声情報は登録音声情報格納領域16aに格納され、登
録音声情報として登録される。この際、音声の始終端の
検出がなされ、始端と終端との間の区間の音声情報のみ
が登録音声情報格納領域16aに格納される。ここに、
音声登録手段が構成されている。
えによって登録モードが選択されていると、生成された
音声情報は登録音声情報格納領域16aに格納され、登
録音声情報として登録される。この際、音声の始終端の
検出がなされ、始端と終端との間の区間の音声情報のみ
が登録音声情報格納領域16aに格納される。ここに、
音声登録手段が構成されている。
【0016】[平坦区間吸収手段]ここで、マイクロフ
ォン10に入力された音声に平坦区間、すなわち時間が
経過しても振幅があまり変わらない区間が含まれている
と、フィルタリングデータ中でその平坦区間の音声パワ
ーが吸収される。この処理を図3のフローチャートに示
す。まず、フィルタリング後、入力された音声について
のサンプリング番号iの最初の値を1としてカウントを
開始する。そして、サンプリング番号iが全体のサンプ
リング数を越えたかどうかが判断され、越えた場合には
音声始終端の検出に移行し、越えない場合にはその音声
パワーと次にフィルタリングされる音声パワーとの値が
同じとみなすことができるかどうかが見られる。つま
り、音声パワーの時間的変化の一例を示す図7(a)の
グラフに例示するように、サンプリング番号iの音声パ
ワーAiと次のサンプリング番号i+1の音声パワーA
i+1とが比較され、音声パワーAiに対する音声パワ
ーA(i+1)の差が許容範囲δ内であるかどうかが判
断される。なお、図7(a)中、aの区間が音声波形の
平坦部分である。
ォン10に入力された音声に平坦区間、すなわち時間が
経過しても振幅があまり変わらない区間が含まれている
と、フィルタリングデータ中でその平坦区間の音声パワ
ーが吸収される。この処理を図3のフローチャートに示
す。まず、フィルタリング後、入力された音声について
のサンプリング番号iの最初の値を1としてカウントを
開始する。そして、サンプリング番号iが全体のサンプ
リング数を越えたかどうかが判断され、越えた場合には
音声始終端の検出に移行し、越えない場合にはその音声
パワーと次にフィルタリングされる音声パワーとの値が
同じとみなすことができるかどうかが見られる。つま
り、音声パワーの時間的変化の一例を示す図7(a)の
グラフに例示するように、サンプリング番号iの音声パ
ワーAiと次のサンプリング番号i+1の音声パワーA
i+1とが比較され、音声パワーAiに対する音声パワ
ーA(i+1)の差が許容範囲δ内であるかどうかが判
断される。なお、図7(a)中、aの区間が音声波形の
平坦部分である。
【0017】そして、音声パワーAiに対する音声パワ
ーA(i+1)の差が許容範囲δ内である場合にはサン
プリング番号i+1のデータをサンプリング番号iのデ
ータに吸収してデータ番号を編集し、その差が許容範囲
δ内でない場合にはそのまま次の処理に移行する。次の
処理では、サンプリング番号iを1つインクリメントし
てこれをiとし、再びサンプリング番号iが全体のサン
プリング数を越えたかどうかが判断される。したがっ
て、図7(b)のグラフに示すように、図7(a)に例
示した音声波形中の平坦区間aが吸収され、平坦区間を
有しない音声情報が生成される。ここに、平坦区間吸収
手段が構成されている。
ーA(i+1)の差が許容範囲δ内である場合にはサン
プリング番号i+1のデータをサンプリング番号iのデ
ータに吸収してデータ番号を編集し、その差が許容範囲
δ内でない場合にはそのまま次の処理に移行する。次の
処理では、サンプリング番号iを1つインクリメントし
てこれをiとし、再びサンプリング番号iが全体のサン
プリング数を越えたかどうかが判断される。したがっ
て、図7(b)のグラフに示すように、図7(a)に例
示した音声波形中の平坦区間aが吸収され、平坦区間を
有しない音声情報が生成される。ここに、平坦区間吸収
手段が構成されている。
【0018】[真偽判定手段]一方、モード選択スイッ
チ17の切り替えによって認識モードが選択されている
場合には、マイクロフォン10から入力されてADC1
3でデジタル信号に変換された音声信号は、登録モード
時と同一の処理でフィルタリングされ、未知音声情報と
して生成される。この未知音声情報というのは、登録音
声情報と同様に、各フレーム毎の音声パワーであり、平
坦区間吸収手段によって時間が変化しても振幅があまり
変化しない平坦区間が吸収されている。
チ17の切り替えによって認識モードが選択されている
場合には、マイクロフォン10から入力されてADC1
3でデジタル信号に変換された音声信号は、登録モード
時と同一の処理でフィルタリングされ、未知音声情報と
して生成される。この未知音声情報というのは、登録音
声情報と同様に、各フレーム毎の音声パワーであり、平
坦区間吸収手段によって時間が変化しても振幅があまり
変化しない平坦区間が吸収されている。
【0019】こうして未知音声情報が生成されると、こ
の未知音声情報と登録音声情報格納領域16aに格納さ
れている登録音声情報とが比較され、二つの情報が個人
性情報として一致しているかどうかが判定される。具体
的には、登録音声情報と未知音声情報とについて、図5
及び図6に例示するような各フレーム毎の音声パワーの
パターンがある許容範囲内で重なり合うかどうかが見ら
れる。つまり、登録音声情報と未知音声情報とが同じ人
の発声によるものであるかどうかが判定される。この
際、DPマッチングによって、発声された言葉全体とし
ての発声の揺らぎの吸収がなされる。ここに、真偽判定
手段が構成されている。
の未知音声情報と登録音声情報格納領域16aに格納さ
れている登録音声情報とが比較され、二つの情報が個人
性情報として一致しているかどうかが判定される。具体
的には、登録音声情報と未知音声情報とについて、図5
及び図6に例示するような各フレーム毎の音声パワーの
パターンがある許容範囲内で重なり合うかどうかが見ら
れる。つまり、登録音声情報と未知音声情報とが同じ人
の発声によるものであるかどうかが判定される。この
際、DPマッチングによって、発声された言葉全体とし
ての発声の揺らぎの吸収がなされる。ここに、真偽判定
手段が構成されている。
【0020】こうして、登録音声情報と未知音声情報と
が個人性情報として一致しているかどうかが判定される
と、その判定結果がCPU18より出力される。具体的
には、一致している場合にはLED18の発光、不一致
の場合にはLED18の不発光という形で判定結果が表
現される。そこで、例えば、本話者認識装置を自動車の
オートドアロック装置に適用する場合には、LED18
の発光をスイッチとしてドアの施錠又は解鍵を行わせる
ように構成する。
が個人性情報として一致しているかどうかが判定される
と、その判定結果がCPU18より出力される。具体的
には、一致している場合にはLED18の発光、不一致
の場合にはLED18の不発光という形で判定結果が表
現される。そこで、例えば、本話者認識装置を自動車の
オートドアロック装置に適用する場合には、LED18
の発光をスイッチとしてドアの施錠又は解鍵を行わせる
ように構成する。
【0021】このように、登録音声情報と未知音声情報
との真偽判定手段による比較に際しては、平坦区間吸収
手段によって時間が変化しても振幅があまり変化しない
平坦区間が吸収された登録音声情報と未知音声情報とが
比較される。したがって、同一人による発声速度の変動
が単音単位で吸収され、認識率の向上が図られる。
との真偽判定手段による比較に際しては、平坦区間吸収
手段によって時間が変化しても振幅があまり変化しない
平坦区間が吸収された登録音声情報と未知音声情報とが
比較される。したがって、同一人による発声速度の変動
が単音単位で吸収され、認識率の向上が図られる。
【0022】
【発明の効果】本発明は、入力された音声を音声信号と
して出力する音声入出力部と、この音声入出力部から出
力された音声信号の取り扱いを登録モードと認識モード
とに切り替えるモード選択手段と、登録モード時に音声
入出力部から出力された音声信号を登録音声情報として
登録する音声登録手段と、認識モード時に音声入出力部
から出力された音声信号を未知音声情報として登録音声
情報と比較し個人性情報として一致しているかどうかを
判定する真偽判定手段とを設けた話者認識装置におい
て、音声波形中で経時的に平坦な区間が吸収された登録
音声情報及び未知音声情報を生成して真偽判定手段によ
る比較対象とする平坦区間吸収手段を設けたので、時間
が変化しても振幅があまり変化しない音声波形の区間が
吸収された登録音声情報及び未知音声情報を真偽判定手
段による比較対象とすることができ、したがって、同一
人による発声速度の変動を単音の単位で吸収することが
でき、これにより認識率を向上させることができる等の
効果を有する。
して出力する音声入出力部と、この音声入出力部から出
力された音声信号の取り扱いを登録モードと認識モード
とに切り替えるモード選択手段と、登録モード時に音声
入出力部から出力された音声信号を登録音声情報として
登録する音声登録手段と、認識モード時に音声入出力部
から出力された音声信号を未知音声情報として登録音声
情報と比較し個人性情報として一致しているかどうかを
判定する真偽判定手段とを設けた話者認識装置におい
て、音声波形中で経時的に平坦な区間が吸収された登録
音声情報及び未知音声情報を生成して真偽判定手段によ
る比較対象とする平坦区間吸収手段を設けたので、時間
が変化しても振幅があまり変化しない音声波形の区間が
吸収された登録音声情報及び未知音声情報を真偽判定手
段による比較対象とすることができ、したがって、同一
人による発声速度の変動を単音の単位で吸収することが
でき、これにより認識率を向上させることができる等の
効果を有する。
【図1】本発明の一実施例を示す各部の電気的接続のブ
ロック図である。
ロック図である。
【図2】全体の処理の流れを示すフローチャートであ
る。
る。
【図3】平坦区間吸収手段の処理の流れを示すフローチ
ャートである。
ャートである。
【図4】各周波数における1フレームでの音声パワーを
例示するグラフである。
例示するグラフである。
【図5】各フレームにおけるある周波数での音声パワー
を例示するグラフである。
を例示するグラフである。
【図6】各フレーム毎の各周波数の音声パワーの総和を
例示するグラフである。
例示するグラフである。
【図7】音声パワーを時間との関係で例示するグラフで
あり、(a)は平坦部分を含む音声波形のグラフ、
(b)はその平坦部分が吸収された音声波形のグラフで
ある。
あり、(a)は平坦部分を含む音声波形のグラフ、
(b)はその平坦部分が吸収された音声波形のグラフで
ある。
【図8】従来の話者認識装置の一例として、その基本的
構成を示す概念図である。
構成を示す概念図である。
10 音声入出力部
Claims (1)
- 【請求項1】 入力された音声を音声信号として出力す
る音声入出力部と、この音声入出力部から出力された音
声信号の取り扱いを登録モードと認識モードとに切り替
えるモード選択手段と、登録モード時に前記音声入出力
部から出力された音声信号を登録音声情報として登録す
る音声登録手段と、認識モード時に前記音声入出力部か
ら出力された音声信号を未知音声情報として登録音声情
報と比較し個人性情報として一致しているかどうかを判
定する真偽判定手段とを設けた話者認識装置において、
音声波形中で経時的に平坦な区間が吸収された登録音声
情報及び未知音声情報を生成して前記真偽判定手段によ
る比較対象とする平坦区間吸収手段を設けたことを特徴
とする話者認識装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5108044A JPH06318099A (ja) | 1993-05-10 | 1993-05-10 | 話者認識装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5108044A JPH06318099A (ja) | 1993-05-10 | 1993-05-10 | 話者認識装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH06318099A true JPH06318099A (ja) | 1994-11-15 |
Family
ID=14474521
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP5108044A Pending JPH06318099A (ja) | 1993-05-10 | 1993-05-10 | 話者認識装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH06318099A (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2006077743A1 (ja) * | 2004-12-28 | 2006-07-27 | Moritex Corporation | 装飾用素材とその製造方法 |
| CN114550717A (zh) * | 2022-02-16 | 2022-05-27 | 北京梧桐车联科技有限责任公司 | 语音音区切换方法、装置、设备及存储介质 |
-
1993
- 1993-05-10 JP JP5108044A patent/JPH06318099A/ja active Pending
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2006077743A1 (ja) * | 2004-12-28 | 2006-07-27 | Moritex Corporation | 装飾用素材とその製造方法 |
| CN114550717A (zh) * | 2022-02-16 | 2022-05-27 | 北京梧桐车联科技有限责任公司 | 语音音区切换方法、装置、设备及存储介质 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US12026241B2 (en) | Detection of replay attack | |
| Shiota et al. | Voice liveness detection algorithms based on pop noise caused by human breath for automatic speaker verification | |
| US20130332165A1 (en) | Method and systems having improved speech recognition | |
| CA2366892C (en) | Method and apparatus for speaker recognition using a speaker dependent transform | |
| JP6220304B2 (ja) | 音声識別装置 | |
| JPH04318900A (ja) | 多方向同時収音式音声認識方法 | |
| JP3649032B2 (ja) | 音声認識方法 | |
| JPH06318098A (ja) | 話者認識装置 | |
| JP3284968B2 (ja) | 話速変換機能を有する補聴器 | |
| JPH04369698A (ja) | 音声認識方式 | |
| JP3588929B2 (ja) | 音声認識装置 | |
| JPH04324499A (ja) | 音声認識装置 | |
| JP3114757B2 (ja) | 音声認識装置 | |
| JPH03160499A (ja) | 音声認識装置 | |
| KR20000032269A (ko) | 음향 기기의 음성인식장치 | |
| JP2968976B2 (ja) | 音声認識装置 | |
| JP2870421B2 (ja) | 話速変換機能を有する補聴器 | |
| JP2000155600A (ja) | 音声認識システムおよび入力音声レベル警告方法 | |
| JP2975808B2 (ja) | 音声認識装置 | |
| JP2006053459A (ja) | 話者認識装置 | |
| JP2004062076A (ja) | 本人認証装置および本人認証方法、コンピュータプログラム | |
| JP3020999B2 (ja) | パターン登録方法 | |
| JPS6193499A (ja) | 音声パタ−ン照合方式 | |
| JPH0316038B2 (ja) | ||
| JPS63213897A (ja) | 話者認識装置における辞書更新方式 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A02 | Decision of refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A02 Effective date: 20000307 |