JPS63257797A - 音声始端検出装置 - Google Patents

音声始端検出装置

Info

Publication number
JPS63257797A
JPS63257797A JP62092184A JP9218487A JPS63257797A JP S63257797 A JPS63257797 A JP S63257797A JP 62092184 A JP62092184 A JP 62092184A JP 9218487 A JP9218487 A JP 9218487A JP S63257797 A JPS63257797 A JP S63257797A
Authority
JP
Japan
Prior art keywords
value
energy
detection device
voice
speech
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP62092184A
Other languages
English (en)
Inventor
丹羽 美幸
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Brother Industries Ltd
Original Assignee
Brother Industries Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Brother Industries Ltd filed Critical Brother Industries Ltd
Priority to JP62092184A priority Critical patent/JPS63257797A/ja
Publication of JPS63257797A publication Critical patent/JPS63257797A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [産業上の利用分野] 本発明は特定の話者の音声を含む信号の振幅に対しサン
プリングやその他の処理を行うことにより音声領域の始
端に対応する時点を検出する音声始端検出装置に関する
。
[従来技術] 音声の始端検出に関する従来例としては、信号の区間毎
ののエネルギー値を用いたものがよく利用される。この
例として特開fli361−46999号公報に記載の
技術がある。これは、固定された二個の閾値によって連
続する一定の個数の区間の列を始端検出区間として抽出
して、その始端検出区間におけるエネルギーの平均値を
第3の閾値とし、始端検出区間において前記2個の閾値
の低い方の閾値を再び越えることなく、前記第3の閾値
を下回る時点の検出を時間的に遡る方向に向って行うも
のである。
゛ また区間毎のエネルギー値と零交差数とを利用した
ものとして、新美康永;音声認識、共立出版(1979
)がある。これは予め非音声部の分析によって得られた
区間毎のエネルギー値及び零交差数に対する3個の閾値
を用いるものである。
更に特開昭60−200300号公報に記載されるよう
に区間毎のエネルギーの変化及びスペクトルの変化とい
った動的要因を用いたものもある。
[発明が解決しようとする問題点] 一般に音声の特に破裂音の発生の直前にはバズ音とよば
れる基本周波数が低くかつエネルギーの比較的低い鼻音
性の信号が発生することがある。
このバズ音は同一人物の発声においても、発生する場合
と発生しない場合とがある。そのため、特に音声認識等
を行う場合、それに用いる標準パラメータはバズ音のな
い音声信号より抽出する必要があり、また認識される音
声信号においてもバズ音の発生時には予めその部分を除
去する必要がある。そのため音声認識等に用いる音声信
号の抽出において、バズ音は自動的に非音声とみなし予
め除去してしまうことが望ましい。
前述した特開昭61−46999号公報に記載の技術で
は、バズ音の発生時にはバズ音の始端を音声の始端とし
て検出してしまい、その除去は不可能である。
また新美東永;音声認識、共立出版(1979)記載の
技術においては、閾値を非音声部の分析によって得てい
るため、非音声部としてバズ音の部分を抽出することに
より、バズ音の除去が可能であるが、バズ音部の抽出が
困難であり非実用的である。
また特開昭60−200300号公報に記載の技術では
、スペクトル等の分析が必要となり、処理が難しく、ま
た装置も複雑になるといった欠点があった。
[発明の目的] 本発明は上記の欠点に鑑みてなされたもので、その主な
る目的は、バズ音に影響されることのない、音声認識等
の処理に適した音声信号を抽出するための音声始端検出
装置を提出することである。
[問題点を解決するための手段] そこで本発明では、特定の話者の音声を含んだ入力信号
の振幅を一定時間毎にサンプリングして、複数の振幅値
の列に変換するサンプリング手段と、前記複数の振幅値
の列を複数の区間に分割し、その区間毎における前記入
力信号のエネルギー値に関連するエネルギー関連値を計
算する計算手段と、少なくとも前記入力信号のエネルギ
ー関連値とその関連値に対する閾値とを比較する比較手
段を含み、その比較結果を参酌して前記音声の始端を決
定する音声始端決定手段を有する音声始端検出装置にお
いて、前記話者の予め発声した特定の音素におけるエネ
ルギーに関連して前記閾値を決定する閾値決定手段を有
することを特徴とするものである。
[作用コ 従って、本発明において、閾値を決定するために、特定
の話者が発声した特定の音素についてサンプリング手段
及び計算手段、あるいは別の手段によりエネルギーに関
連する関連値が計算され、その値に基いて閾値が決定さ
れる。
始端を決定すべき音声を含む信号はサンプリング手段に
よって複数の振幅値の列に変換され、それらの複数の振
幅値の列は、計算手段によって複数の区間に分割され、
それぞれの区間のエネルギー関連値が計算される。
その後、始端決定手段は、前記区間毎のエネルギー関連
値と前記閾値とを比較し、その比較結果を参酌して前記
音声の始端を検出する。
[実施例] 以下、第1図乃至第4図を参照して本発明の一実施例を
詳細に説明する。
第2図は、汎用の中央演算装置(以下CPUと称す)1
5を利用した本実施例の音声始端検出装置の構成を示し
たブロック図である。話者の発声した音声を含む音響情
報を集音して電気信号に変換するマイクロホン11は、
増幅器12の入力端子に接続されている。増幅器42は
マイクロホン11により送られた電気信号を以後の処理
に適したレベルに増幅するように構成されている。増幅
器12の出力には、アナログローパスフィルタ13が接
続されている。このフィルタ13はカットオフ周波数を
4KHzに設定され、そのカットオフ周波数以上の周波
数の信号を遮断するように構成されている。このフィル
タ13の出力には、サンプリング手段に対応するA/D
変換器14が接続されている。このA/D変換器14の
出力端子は、CPU15に接続されている。このCPU
 15には、後述する各処理の手順を記述したプログラ
ム及び各種定数等を記憶している続出専用メモリ(以下
ROMと称す)16と、書込み可能メモリ(以下RAM
と称す)17と、不揮発性書込み可能メモリで構成され
た閾値レジスタ18とが接続されている。このRAM1
7はA/D変換器14でサンプリングされた音声波形の
振幅値が順次書込まれていく振幅バッファ i 7 a
、エネルギー関連値が順次書込まれていくエネルギー関
連値バッフ117b、任意の整数値を記憶可能なポイン
タレジスタ17Cと始端レジスタ17e!、iから4ま
での整数を計数可能なカウンタレジスタ17d及び後述
の各処理を行うためのワーキングエリアを含んでいる。
上記のように構成された本実施例の音声始端検出装置の
動作を以下第1図及び第3図に示すフローチャートを参
照して詳細に説明する。
まず、閾値を設定するための話者登録を行う。
この処理の手順を第1@に示すフローチャートを参照し
て説明する。まずステップ20aにおいて話者に、音素
“N ttを発声してもらう。この音素の音声信号は、
バズ音と比較的類似した特徴を持ち、かつ安定している
。この音声はマイクロフォン11により集音され電気信
号に変えられる。
この電気信号は増幅器12によって後述の処理に適した
レベルに増幅される。増幅された電気信号は、アナログ
ローパスフィルタ13によって、4KH2以上の信号弁
が遮断される。以上の動作はステップ21°に対応して
いる。
前記アナログロウパスフィルタ13の出力は、サンプリ
ング手段に対応するA/D変換器」4に入力される。A
/D変換器14では入力信号を8KH2のサンプリング
周波数でサンプリングし、125マイクロ秒毎の振幅値
を出力する。この振幅値は、標本化定理より前記入力信
号の4KHzまでの情報をすべて含んでいる。この振幅
値の1番目の値、すなわちサンプリングの開始より12
5x(i−1>マイクロ秒後の振幅値を以後Amと表す
ことにする。このiは1からnまでの値であり、このn
はサンプリングされた振幅値の総数である。これらのA
(1)からA (n>までの値は前記振幅バッファ17
aに順次書込まれてい(。この処理はステップ22にて
実行される。
次にステップ23に進み、CPU15は前記n個の振幅
値を64個毎の区間、即ち8ミリ秒毎の振幅情報に分割
し、その区間毎のエネルギー関連値を計算する。エネル
ギー関連値は厳密な意味でのエネルギー値である必要は
なく、比較的エネルギー値に似た性質のものであればよ
い。本実施例ではエネルギー関連値として64個毎の振
幅値の絶対値の和を利用している。即ち、第j番目のエ
ネルギー関連値をE(j)とすると、その関連値は下記
の式にて求められる。
4j E(j>  =  ΣIA(Q)1 q=64j−63 ここでjは整数であり、その最大値はnを64で割りそ
の剰余を切上げた商の値となる。このjの値を以下その
区間の区間番号と呼ぶことにする。
この処理は計算手段の動作に対応する。
このステップ23において得られたE(j>を縦軸、区
間番号jを横軸としてE(j)の推移の概略を示したグ
ラフを第4図に示す。
次にステップ24に進み、前ステップ23で求められた
エネルギー関連値が最大となる区間を探索し、その区間
の時間的後方の近傍区間のエネルギー関連値の平均値を
計算する。更にこの平均値に対し定数を乗じ、その積を
エネルギー関連値に対する閾値とする。この閾値を1−
e、前)ホのエネルギー関連値が最大となる区間の区間
番号を踊aX、前記定数をαとすると、Teは次式で表
わされる。
L Te= [ΣE  (rmax+ i )  コX α
/ (L+1 )i=O 上式においてLの値は2程度でよい。L=2とした場合
、αの値は0.3程度が最適となる。即ち、閾値Teは
第4図における領域AにおけるE(j>の平均値にαを
乗じた値となる。このステップ24で(qた閾値Teの
値は前記閾値レジスター8に記憶される。以上で話者登
録は終了する。
次に音声の始端検出の処理について、第3図に示される
フローチャートを参照して説明する。
前記登録された話者の発声した音声を含む信号は、ステ
ップ20bにおいて、前記ステップ21乃至ステップ2
3により処理され、そのの振幅値及びエネルギー関連値
が前述のようにそれぞれ振幅バッファ17a及びエネル
ギー関連値バッフ117bに記憶される。このエネルギ
ー関連値を前述と同様にE(j)で表すことにする。
次にステップ30へ進み、ポインタレジスター7Cに零
を記憶させる。以下このポインタレジスタ17cに記憶
される値をkで表すことにする。
次にステップ31へ進み、カウンタレジスタ17d1.
:@を記憶させる。以下このカウンタレジスタ17dに
記憶される値をCで表すことにする。
次にステップ32に進み、この時点におけるkの値に1
を加えた値を始端レジスタ17eに記憶さゼる。このス
テップ20a及びステップ21乃至ステップ24は閾値
決定手段に対応する。
次にステップ33へ進み、k+lの値を新たなkとして
、ポインタレジスタ17cに記憶させる。
このkの値は後述のステップ34乃至ステップ36の対
象となる区間の区間番号を表している。
次にステップ34に進み、ステップ24で得られた閾値
Teとポインタレジスタ17Gで示される区間のエネル
ギー関連値E(k)とを比較し、その結果がE (k、
) >Teであるならばステップ37に進み、E(k)
≦Teであるならばステップ35に進む。このステップ
34は、比較手段の動作に対応している。
ステップ35では、ポインタレジスタ170の示す区間
の零交差数を計算する。計算方法については、特開昭6
0−117299M公報等に記載されているので、詳細
については省く。尚、このステップ35で得られた零交
差数をZ(k)と表すことにする。
次にステップ36に進み、前ステップ35において得ら
れた零交差数Z (k)と予め設定されている零交差数
に対する閾値とを比較する。この閾値は本実施例では4
としている。この閾値をTZとして表したとき、この比
較結果がZ (k)≦T2であるならばステップ31に
戻り、Z (k) >Tzでおるならばステップ37へ
進む。
ステップ37では、c+1の値を計算してその値を新た
なCとしてカウンタレジスタ17dに記憶させる。
次のステップ38においてそのCの値を評価し、Cの値
が3以下なら、ステップ33へ戻り、4ならば終了とな
る。
即ち、ステップ30乃至ステップ38では、先頭の区間
より調査し、4以上連続してE (k> >Te、ある
いはZ (k)>Tzとなる最初の領域の先頭の区間を
探索し、その区間を始端レジスタ17eに記憶させて終
了する。
このとき始端レジスタ17eに記憶されている区間番号
で表される区間が、その信号における音声の始端である
。このステップ30乃至ステップ38は、音声始端抽出
手段の動作に対応している。
このように本実施例において、バズ音と音声とで比較的
大きな差異の表れる零交差数をも参酌しているため、よ
り正確な始端の検出が可能となる。
尚、本発明は上記実施例に限るものではなく、例えば本
実施例でエネルギー関連値として使用した絶対値の和は
、一般的に使われる下記の式にて求められる短時間エネ
ルギーであってもよい。
4j Eij>   =  Σ[A(Q) コ2q =eaj
−63 また、前記エネルギー関連値に対する閾値は、前記話者
登録の処理において入力された音声のエネルギー関連値
の平均値あるいは最高値、あるいはモード値等に関連し
て決定することも可能である。
ただしこの場合、前記定数αの値は本実施例の値とは異
なる。更に、本実施例では零交差数の変動を始端の決定
に利用しているが、短時間スペクトルの変化等も利用で
きる。
また、本発明を話者認識装置と併用することにより、特
定多数の話者の任意の一人の音声を含んだ信号に対し使
用可能となる。
[発明の効果] 本発明は、話者の予め発声した特定の音素のエネルギー
に関連して閾値を決定し、その閾値に基いて音声の始端
を検出するので、バズ音等の不要な信号を正確に除去し
得る。この結果、本発明の音声始端検出装置を既存の音
声終端検出装置と併用することにより、音声認識等の処
理に適した音声の情報を確実に抽出することが可能とな
る。
【図面の簡単な説明】
第1図は本発明の実施例における閾値決定の処理を示す
フローチャート、第2図は実施例の構成を示すブロック
図、第3図は実施例の始端検出動作を示すフローチャー
1−1第4図は、音素(I N Ifのエネルギー関連
値の推移の概略を示すグラフである。 図中、14はA/D変換器、15はCPtJ、16はR
OM、17及び”+8はRAM、21Ltサンプリング
手段に対応するステップ、22は計算手段に対応するス
テップ、30乃至38は音声始端検出手段に対応するス
テップである。

Claims (1)

  1. 【特許請求の範囲】 1、特定の話者の音声を含んだ入力信号の振幅を一定時
    間毎にサンプリングして、複数の振幅値の列に変換する
    サンプリング手段(14)と、前記複数の振幅値の列を
    複数の区間に分割し、その区間毎における前記入力信号
    のエネルギー値に関連するエネルギー関連値を計算する
    計算手段(23)と、 少なくとも前記入力信号のエネルギー関連値とその関連
    値に対する閾値とを比較する比較手段(34)を含み、
    その比較結果を参酌して前記音声の始端を決定する音声
    始端決定手段(30乃至38)とを有する音声始端検出
    装置において、前記話者の予め発声した特定の音素にお
    けるエネルギーに関連して前記閾値を決定する決定手段
    を有することを特徴とする音声始端検出装置。 2、前記決定手段は、前記話者の発声した特定の音素に
    おけるエネルギーの最高値をとる区間の時間的後方の近
    傍区間のエネルギーの平均値に関連して前記閾値を決定
    することを特徴とする特許請求の範囲第1項記載の音声
    始端検出装置。
JP62092184A 1987-04-15 1987-04-15 音声始端検出装置 Pending JPS63257797A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP62092184A JPS63257797A (ja) 1987-04-15 1987-04-15 音声始端検出装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP62092184A JPS63257797A (ja) 1987-04-15 1987-04-15 音声始端検出装置

Publications (1)

Publication Number Publication Date
JPS63257797A true JPS63257797A (ja) 1988-10-25

Family

ID=14047352

Family Applications (1)

Application Number Title Priority Date Filing Date
JP62092184A Pending JPS63257797A (ja) 1987-04-15 1987-04-15 音声始端検出装置

Country Status (1)

Country Link
JP (1) JPS63257797A (ja)

Similar Documents

Publication Publication Date Title
EP0077194B1 (en) Speech recognition system
JP2502880B2 (ja) 音声認識方法
JP2666296B2 (ja) 音声認識装置
JPS63235999A (ja) 音声始端検出装置
JPH03114100A (ja) 音声区間検出装置
JPS63213899A (ja) 話者照合方式
JP2557497B2 (ja) 男女声の識別方法
JPH0424717B2 (ja)
JP2891259B2 (ja) 音声区間検出装置
JP2643202B2 (ja) 入力音声の定常部、過渡部、不確定部の検出装置
JP3008404B2 (ja) 音声認識装置
JPH0114599B2 (ja)
JP2658104B2 (ja) 音声認識装置
JPH0412478B2 (ja)
JPH0451840B2 (ja)
JPH04211299A (ja) 単音節音声認識装置
JPS6227798A (ja) 音声認識装置
JPS5885495A (ja) 音声認識装置
JPH05313695A (ja) 音声分析装置
JPS63220199A (ja) 音声認識装置
JPS59124392A (ja) 音声認識方式
JPH0731506B2 (ja) 音声認識方法
JPH09127971A (ja) 音声区間検出装置及び音声認識装置
JPS6136798A (ja) 音声セグメンテ−シヨン法
JPS6310437B2 (ja)