JPS63257797A - 音声始端検出装置 - Google Patents
音声始端検出装置Info
- Publication number
- JPS63257797A JPS63257797A JP62092184A JP9218487A JPS63257797A JP S63257797 A JPS63257797 A JP S63257797A JP 62092184 A JP62092184 A JP 62092184A JP 9218487 A JP9218487 A JP 9218487A JP S63257797 A JPS63257797 A JP S63257797A
- Authority
- JP
- Japan
- Prior art keywords
- value
- energy
- detection device
- voice
- speech
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000001514 detection method Methods 0.000 title claims description 13
- 238000005070 sampling Methods 0.000 claims description 12
- 238000004364 calculation method Methods 0.000 claims description 7
- 238000003708 edge detection Methods 0.000 claims description 5
- 238000000034 method Methods 0.000 description 27
- 230000005236 sound signal Effects 0.000 description 5
- 238000001228 spectrum Methods 0.000 description 3
- 238000010586 diagram Methods 0.000 description 2
- 230000007704 transition Effects 0.000 description 2
- 101100325756 Arabidopsis thaliana BAM5 gene Proteins 0.000 description 1
- 101150046378 RAM1 gene Proteins 0.000 description 1
- 101100476489 Rattus norvegicus Slc20a2 gene Proteins 0.000 description 1
- 238000004458 analytical method Methods 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
[産業上の利用分野]
本発明は特定の話者の音声を含む信号の振幅に対しサン
プリングやその他の処理を行うことにより音声領域の始
端に対応する時点を検出する音声始端検出装置に関する
。
プリングやその他の処理を行うことにより音声領域の始
端に対応する時点を検出する音声始端検出装置に関する
。
[従来技術]
音声の始端検出に関する従来例としては、信号の区間毎
ののエネルギー値を用いたものがよく利用される。この
例として特開fli361−46999号公報に記載の
技術がある。これは、固定された二個の閾値によって連
続する一定の個数の区間の列を始端検出区間として抽出
して、その始端検出区間におけるエネルギーの平均値を
第3の閾値とし、始端検出区間において前記2個の閾値
の低い方の閾値を再び越えることなく、前記第3の閾値
を下回る時点の検出を時間的に遡る方向に向って行うも
のである。
ののエネルギー値を用いたものがよく利用される。この
例として特開fli361−46999号公報に記載の
技術がある。これは、固定された二個の閾値によって連
続する一定の個数の区間の列を始端検出区間として抽出
して、その始端検出区間におけるエネルギーの平均値を
第3の閾値とし、始端検出区間において前記2個の閾値
の低い方の閾値を再び越えることなく、前記第3の閾値
を下回る時点の検出を時間的に遡る方向に向って行うも
のである。
゛ また区間毎のエネルギー値と零交差数とを利用した
ものとして、新美康永;音声認識、共立出版(1979
)がある。これは予め非音声部の分析によって得られた
区間毎のエネルギー値及び零交差数に対する3個の閾値
を用いるものである。
ものとして、新美康永;音声認識、共立出版(1979
)がある。これは予め非音声部の分析によって得られた
区間毎のエネルギー値及び零交差数に対する3個の閾値
を用いるものである。
更に特開昭60−200300号公報に記載されるよう
に区間毎のエネルギーの変化及びスペクトルの変化とい
った動的要因を用いたものもある。
に区間毎のエネルギーの変化及びスペクトルの変化とい
った動的要因を用いたものもある。
[発明が解決しようとする問題点]
一般に音声の特に破裂音の発生の直前にはバズ音とよば
れる基本周波数が低くかつエネルギーの比較的低い鼻音
性の信号が発生することがある。
れる基本周波数が低くかつエネルギーの比較的低い鼻音
性の信号が発生することがある。
このバズ音は同一人物の発声においても、発生する場合
と発生しない場合とがある。そのため、特に音声認識等
を行う場合、それに用いる標準パラメータはバズ音のな
い音声信号より抽出する必要があり、また認識される音
声信号においてもバズ音の発生時には予めその部分を除
去する必要がある。そのため音声認識等に用いる音声信
号の抽出において、バズ音は自動的に非音声とみなし予
め除去してしまうことが望ましい。
と発生しない場合とがある。そのため、特に音声認識等
を行う場合、それに用いる標準パラメータはバズ音のな
い音声信号より抽出する必要があり、また認識される音
声信号においてもバズ音の発生時には予めその部分を除
去する必要がある。そのため音声認識等に用いる音声信
号の抽出において、バズ音は自動的に非音声とみなし予
め除去してしまうことが望ましい。
前述した特開昭61−46999号公報に記載の技術で
は、バズ音の発生時にはバズ音の始端を音声の始端とし
て検出してしまい、その除去は不可能である。
は、バズ音の発生時にはバズ音の始端を音声の始端とし
て検出してしまい、その除去は不可能である。
また新美東永;音声認識、共立出版(1979)記載の
技術においては、閾値を非音声部の分析によって得てい
るため、非音声部としてバズ音の部分を抽出することに
より、バズ音の除去が可能であるが、バズ音部の抽出が
困難であり非実用的である。
技術においては、閾値を非音声部の分析によって得てい
るため、非音声部としてバズ音の部分を抽出することに
より、バズ音の除去が可能であるが、バズ音部の抽出が
困難であり非実用的である。
また特開昭60−200300号公報に記載の技術では
、スペクトル等の分析が必要となり、処理が難しく、ま
た装置も複雑になるといった欠点があった。
、スペクトル等の分析が必要となり、処理が難しく、ま
た装置も複雑になるといった欠点があった。
[発明の目的]
本発明は上記の欠点に鑑みてなされたもので、その主な
る目的は、バズ音に影響されることのない、音声認識等
の処理に適した音声信号を抽出するための音声始端検出
装置を提出することである。
る目的は、バズ音に影響されることのない、音声認識等
の処理に適した音声信号を抽出するための音声始端検出
装置を提出することである。
[問題点を解決するための手段]
そこで本発明では、特定の話者の音声を含んだ入力信号
の振幅を一定時間毎にサンプリングして、複数の振幅値
の列に変換するサンプリング手段と、前記複数の振幅値
の列を複数の区間に分割し、その区間毎における前記入
力信号のエネルギー値に関連するエネルギー関連値を計
算する計算手段と、少なくとも前記入力信号のエネルギ
ー関連値とその関連値に対する閾値とを比較する比較手
段を含み、その比較結果を参酌して前記音声の始端を決
定する音声始端決定手段を有する音声始端検出装置にお
いて、前記話者の予め発声した特定の音素におけるエネ
ルギーに関連して前記閾値を決定する閾値決定手段を有
することを特徴とするものである。
の振幅を一定時間毎にサンプリングして、複数の振幅値
の列に変換するサンプリング手段と、前記複数の振幅値
の列を複数の区間に分割し、その区間毎における前記入
力信号のエネルギー値に関連するエネルギー関連値を計
算する計算手段と、少なくとも前記入力信号のエネルギ
ー関連値とその関連値に対する閾値とを比較する比較手
段を含み、その比較結果を参酌して前記音声の始端を決
定する音声始端決定手段を有する音声始端検出装置にお
いて、前記話者の予め発声した特定の音素におけるエネ
ルギーに関連して前記閾値を決定する閾値決定手段を有
することを特徴とするものである。
[作用コ
従って、本発明において、閾値を決定するために、特定
の話者が発声した特定の音素についてサンプリング手段
及び計算手段、あるいは別の手段によりエネルギーに関
連する関連値が計算され、その値に基いて閾値が決定さ
れる。
の話者が発声した特定の音素についてサンプリング手段
及び計算手段、あるいは別の手段によりエネルギーに関
連する関連値が計算され、その値に基いて閾値が決定さ
れる。
始端を決定すべき音声を含む信号はサンプリング手段に
よって複数の振幅値の列に変換され、それらの複数の振
幅値の列は、計算手段によって複数の区間に分割され、
それぞれの区間のエネルギー関連値が計算される。
よって複数の振幅値の列に変換され、それらの複数の振
幅値の列は、計算手段によって複数の区間に分割され、
それぞれの区間のエネルギー関連値が計算される。
その後、始端決定手段は、前記区間毎のエネルギー関連
値と前記閾値とを比較し、その比較結果を参酌して前記
音声の始端を検出する。
値と前記閾値とを比較し、その比較結果を参酌して前記
音声の始端を検出する。
[実施例]
以下、第1図乃至第4図を参照して本発明の一実施例を
詳細に説明する。
詳細に説明する。
第2図は、汎用の中央演算装置(以下CPUと称す)1
5を利用した本実施例の音声始端検出装置の構成を示し
たブロック図である。話者の発声した音声を含む音響情
報を集音して電気信号に変換するマイクロホン11は、
増幅器12の入力端子に接続されている。増幅器42は
マイクロホン11により送られた電気信号を以後の処理
に適したレベルに増幅するように構成されている。増幅
器12の出力には、アナログローパスフィルタ13が接
続されている。このフィルタ13はカットオフ周波数を
4KHzに設定され、そのカットオフ周波数以上の周波
数の信号を遮断するように構成されている。このフィル
タ13の出力には、サンプリング手段に対応するA/D
変換器14が接続されている。このA/D変換器14の
出力端子は、CPU15に接続されている。このCPU
15には、後述する各処理の手順を記述したプログラ
ム及び各種定数等を記憶している続出専用メモリ(以下
ROMと称す)16と、書込み可能メモリ(以下RAM
と称す)17と、不揮発性書込み可能メモリで構成され
た閾値レジスタ18とが接続されている。このRAM1
7はA/D変換器14でサンプリングされた音声波形の
振幅値が順次書込まれていく振幅バッファ i 7 a
、エネルギー関連値が順次書込まれていくエネルギー関
連値バッフ117b、任意の整数値を記憶可能なポイン
タレジスタ17Cと始端レジスタ17e!、iから4ま
での整数を計数可能なカウンタレジスタ17d及び後述
の各処理を行うためのワーキングエリアを含んでいる。
5を利用した本実施例の音声始端検出装置の構成を示し
たブロック図である。話者の発声した音声を含む音響情
報を集音して電気信号に変換するマイクロホン11は、
増幅器12の入力端子に接続されている。増幅器42は
マイクロホン11により送られた電気信号を以後の処理
に適したレベルに増幅するように構成されている。増幅
器12の出力には、アナログローパスフィルタ13が接
続されている。このフィルタ13はカットオフ周波数を
4KHzに設定され、そのカットオフ周波数以上の周波
数の信号を遮断するように構成されている。このフィル
タ13の出力には、サンプリング手段に対応するA/D
変換器14が接続されている。このA/D変換器14の
出力端子は、CPU15に接続されている。このCPU
15には、後述する各処理の手順を記述したプログラ
ム及び各種定数等を記憶している続出専用メモリ(以下
ROMと称す)16と、書込み可能メモリ(以下RAM
と称す)17と、不揮発性書込み可能メモリで構成され
た閾値レジスタ18とが接続されている。このRAM1
7はA/D変換器14でサンプリングされた音声波形の
振幅値が順次書込まれていく振幅バッファ i 7 a
、エネルギー関連値が順次書込まれていくエネルギー関
連値バッフ117b、任意の整数値を記憶可能なポイン
タレジスタ17Cと始端レジスタ17e!、iから4ま
での整数を計数可能なカウンタレジスタ17d及び後述
の各処理を行うためのワーキングエリアを含んでいる。
上記のように構成された本実施例の音声始端検出装置の
動作を以下第1図及び第3図に示すフローチャートを参
照して詳細に説明する。
動作を以下第1図及び第3図に示すフローチャートを参
照して詳細に説明する。
まず、閾値を設定するための話者登録を行う。
この処理の手順を第1@に示すフローチャートを参照し
て説明する。まずステップ20aにおいて話者に、音素
“N ttを発声してもらう。この音素の音声信号は、
バズ音と比較的類似した特徴を持ち、かつ安定している
。この音声はマイクロフォン11により集音され電気信
号に変えられる。
て説明する。まずステップ20aにおいて話者に、音素
“N ttを発声してもらう。この音素の音声信号は、
バズ音と比較的類似した特徴を持ち、かつ安定している
。この音声はマイクロフォン11により集音され電気信
号に変えられる。
この電気信号は増幅器12によって後述の処理に適した
レベルに増幅される。増幅された電気信号は、アナログ
ローパスフィルタ13によって、4KH2以上の信号弁
が遮断される。以上の動作はステップ21°に対応して
いる。
レベルに増幅される。増幅された電気信号は、アナログ
ローパスフィルタ13によって、4KH2以上の信号弁
が遮断される。以上の動作はステップ21°に対応して
いる。
前記アナログロウパスフィルタ13の出力は、サンプリ
ング手段に対応するA/D変換器」4に入力される。A
/D変換器14では入力信号を8KH2のサンプリング
周波数でサンプリングし、125マイクロ秒毎の振幅値
を出力する。この振幅値は、標本化定理より前記入力信
号の4KHzまでの情報をすべて含んでいる。この振幅
値の1番目の値、すなわちサンプリングの開始より12
5x(i−1>マイクロ秒後の振幅値を以後Amと表す
ことにする。このiは1からnまでの値であり、このn
はサンプリングされた振幅値の総数である。これらのA
(1)からA (n>までの値は前記振幅バッファ17
aに順次書込まれてい(。この処理はステップ22にて
実行される。
ング手段に対応するA/D変換器」4に入力される。A
/D変換器14では入力信号を8KH2のサンプリング
周波数でサンプリングし、125マイクロ秒毎の振幅値
を出力する。この振幅値は、標本化定理より前記入力信
号の4KHzまでの情報をすべて含んでいる。この振幅
値の1番目の値、すなわちサンプリングの開始より12
5x(i−1>マイクロ秒後の振幅値を以後Amと表す
ことにする。このiは1からnまでの値であり、このn
はサンプリングされた振幅値の総数である。これらのA
(1)からA (n>までの値は前記振幅バッファ17
aに順次書込まれてい(。この処理はステップ22にて
実行される。
次にステップ23に進み、CPU15は前記n個の振幅
値を64個毎の区間、即ち8ミリ秒毎の振幅情報に分割
し、その区間毎のエネルギー関連値を計算する。エネル
ギー関連値は厳密な意味でのエネルギー値である必要は
なく、比較的エネルギー値に似た性質のものであればよ
い。本実施例ではエネルギー関連値として64個毎の振
幅値の絶対値の和を利用している。即ち、第j番目のエ
ネルギー関連値をE(j)とすると、その関連値は下記
の式にて求められる。
値を64個毎の区間、即ち8ミリ秒毎の振幅情報に分割
し、その区間毎のエネルギー関連値を計算する。エネル
ギー関連値は厳密な意味でのエネルギー値である必要は
なく、比較的エネルギー値に似た性質のものであればよ
い。本実施例ではエネルギー関連値として64個毎の振
幅値の絶対値の和を利用している。即ち、第j番目のエ
ネルギー関連値をE(j)とすると、その関連値は下記
の式にて求められる。
4j
E(j> = ΣIA(Q)1
q=64j−63
ここでjは整数であり、その最大値はnを64で割りそ
の剰余を切上げた商の値となる。このjの値を以下その
区間の区間番号と呼ぶことにする。
の剰余を切上げた商の値となる。このjの値を以下その
区間の区間番号と呼ぶことにする。
この処理は計算手段の動作に対応する。
このステップ23において得られたE(j>を縦軸、区
間番号jを横軸としてE(j)の推移の概略を示したグ
ラフを第4図に示す。
間番号jを横軸としてE(j)の推移の概略を示したグ
ラフを第4図に示す。
次にステップ24に進み、前ステップ23で求められた
エネルギー関連値が最大となる区間を探索し、その区間
の時間的後方の近傍区間のエネルギー関連値の平均値を
計算する。更にこの平均値に対し定数を乗じ、その積を
エネルギー関連値に対する閾値とする。この閾値を1−
e、前)ホのエネルギー関連値が最大となる区間の区間
番号を踊aX、前記定数をαとすると、Teは次式で表
わされる。
エネルギー関連値が最大となる区間を探索し、その区間
の時間的後方の近傍区間のエネルギー関連値の平均値を
計算する。更にこの平均値に対し定数を乗じ、その積を
エネルギー関連値に対する閾値とする。この閾値を1−
e、前)ホのエネルギー関連値が最大となる区間の区間
番号を踊aX、前記定数をαとすると、Teは次式で表
わされる。
L
Te= [ΣE (rmax+ i ) コX α
/ (L+1 )i=O 上式においてLの値は2程度でよい。L=2とした場合
、αの値は0.3程度が最適となる。即ち、閾値Teは
第4図における領域AにおけるE(j>の平均値にαを
乗じた値となる。このステップ24で(qた閾値Teの
値は前記閾値レジスター8に記憶される。以上で話者登
録は終了する。
/ (L+1 )i=O 上式においてLの値は2程度でよい。L=2とした場合
、αの値は0.3程度が最適となる。即ち、閾値Teは
第4図における領域AにおけるE(j>の平均値にαを
乗じた値となる。このステップ24で(qた閾値Teの
値は前記閾値レジスター8に記憶される。以上で話者登
録は終了する。
次に音声の始端検出の処理について、第3図に示される
フローチャートを参照して説明する。
フローチャートを参照して説明する。
前記登録された話者の発声した音声を含む信号は、ステ
ップ20bにおいて、前記ステップ21乃至ステップ2
3により処理され、そのの振幅値及びエネルギー関連値
が前述のようにそれぞれ振幅バッファ17a及びエネル
ギー関連値バッフ117bに記憶される。このエネルギ
ー関連値を前述と同様にE(j)で表すことにする。
ップ20bにおいて、前記ステップ21乃至ステップ2
3により処理され、そのの振幅値及びエネルギー関連値
が前述のようにそれぞれ振幅バッファ17a及びエネル
ギー関連値バッフ117bに記憶される。このエネルギ
ー関連値を前述と同様にE(j)で表すことにする。
次にステップ30へ進み、ポインタレジスター7Cに零
を記憶させる。以下このポインタレジスタ17cに記憶
される値をkで表すことにする。
を記憶させる。以下このポインタレジスタ17cに記憶
される値をkで表すことにする。
次にステップ31へ進み、カウンタレジスタ17d1.
:@を記憶させる。以下このカウンタレジスタ17dに
記憶される値をCで表すことにする。
:@を記憶させる。以下このカウンタレジスタ17dに
記憶される値をCで表すことにする。
次にステップ32に進み、この時点におけるkの値に1
を加えた値を始端レジスタ17eに記憶さゼる。このス
テップ20a及びステップ21乃至ステップ24は閾値
決定手段に対応する。
を加えた値を始端レジスタ17eに記憶さゼる。このス
テップ20a及びステップ21乃至ステップ24は閾値
決定手段に対応する。
次にステップ33へ進み、k+lの値を新たなkとして
、ポインタレジスタ17cに記憶させる。
、ポインタレジスタ17cに記憶させる。
このkの値は後述のステップ34乃至ステップ36の対
象となる区間の区間番号を表している。
象となる区間の区間番号を表している。
次にステップ34に進み、ステップ24で得られた閾値
Teとポインタレジスタ17Gで示される区間のエネル
ギー関連値E(k)とを比較し、その結果がE (k、
) >Teであるならばステップ37に進み、E(k)
≦Teであるならばステップ35に進む。このステップ
34は、比較手段の動作に対応している。
Teとポインタレジスタ17Gで示される区間のエネル
ギー関連値E(k)とを比較し、その結果がE (k、
) >Teであるならばステップ37に進み、E(k)
≦Teであるならばステップ35に進む。このステップ
34は、比較手段の動作に対応している。
ステップ35では、ポインタレジスタ170の示す区間
の零交差数を計算する。計算方法については、特開昭6
0−117299M公報等に記載されているので、詳細
については省く。尚、このステップ35で得られた零交
差数をZ(k)と表すことにする。
の零交差数を計算する。計算方法については、特開昭6
0−117299M公報等に記載されているので、詳細
については省く。尚、このステップ35で得られた零交
差数をZ(k)と表すことにする。
次にステップ36に進み、前ステップ35において得ら
れた零交差数Z (k)と予め設定されている零交差数
に対する閾値とを比較する。この閾値は本実施例では4
としている。この閾値をTZとして表したとき、この比
較結果がZ (k)≦T2であるならばステップ31に
戻り、Z (k) >Tzでおるならばステップ37へ
進む。
れた零交差数Z (k)と予め設定されている零交差数
に対する閾値とを比較する。この閾値は本実施例では4
としている。この閾値をTZとして表したとき、この比
較結果がZ (k)≦T2であるならばステップ31に
戻り、Z (k) >Tzでおるならばステップ37へ
進む。
ステップ37では、c+1の値を計算してその値を新た
なCとしてカウンタレジスタ17dに記憶させる。
なCとしてカウンタレジスタ17dに記憶させる。
次のステップ38においてそのCの値を評価し、Cの値
が3以下なら、ステップ33へ戻り、4ならば終了とな
る。
が3以下なら、ステップ33へ戻り、4ならば終了とな
る。
即ち、ステップ30乃至ステップ38では、先頭の区間
より調査し、4以上連続してE (k> >Te、ある
いはZ (k)>Tzとなる最初の領域の先頭の区間を
探索し、その区間を始端レジスタ17eに記憶させて終
了する。
より調査し、4以上連続してE (k> >Te、ある
いはZ (k)>Tzとなる最初の領域の先頭の区間を
探索し、その区間を始端レジスタ17eに記憶させて終
了する。
このとき始端レジスタ17eに記憶されている区間番号
で表される区間が、その信号における音声の始端である
。このステップ30乃至ステップ38は、音声始端抽出
手段の動作に対応している。
で表される区間が、その信号における音声の始端である
。このステップ30乃至ステップ38は、音声始端抽出
手段の動作に対応している。
このように本実施例において、バズ音と音声とで比較的
大きな差異の表れる零交差数をも参酌しているため、よ
り正確な始端の検出が可能となる。
大きな差異の表れる零交差数をも参酌しているため、よ
り正確な始端の検出が可能となる。
尚、本発明は上記実施例に限るものではなく、例えば本
実施例でエネルギー関連値として使用した絶対値の和は
、一般的に使われる下記の式にて求められる短時間エネ
ルギーであってもよい。
実施例でエネルギー関連値として使用した絶対値の和は
、一般的に使われる下記の式にて求められる短時間エネ
ルギーであってもよい。
4j
Eij> = Σ[A(Q) コ2q =eaj
−63 また、前記エネルギー関連値に対する閾値は、前記話者
登録の処理において入力された音声のエネルギー関連値
の平均値あるいは最高値、あるいはモード値等に関連し
て決定することも可能である。
−63 また、前記エネルギー関連値に対する閾値は、前記話者
登録の処理において入力された音声のエネルギー関連値
の平均値あるいは最高値、あるいはモード値等に関連し
て決定することも可能である。
ただしこの場合、前記定数αの値は本実施例の値とは異
なる。更に、本実施例では零交差数の変動を始端の決定
に利用しているが、短時間スペクトルの変化等も利用で
きる。
なる。更に、本実施例では零交差数の変動を始端の決定
に利用しているが、短時間スペクトルの変化等も利用で
きる。
また、本発明を話者認識装置と併用することにより、特
定多数の話者の任意の一人の音声を含んだ信号に対し使
用可能となる。
定多数の話者の任意の一人の音声を含んだ信号に対し使
用可能となる。
[発明の効果]
本発明は、話者の予め発声した特定の音素のエネルギー
に関連して閾値を決定し、その閾値に基いて音声の始端
を検出するので、バズ音等の不要な信号を正確に除去し
得る。この結果、本発明の音声始端検出装置を既存の音
声終端検出装置と併用することにより、音声認識等の処
理に適した音声の情報を確実に抽出することが可能とな
る。
に関連して閾値を決定し、その閾値に基いて音声の始端
を検出するので、バズ音等の不要な信号を正確に除去し
得る。この結果、本発明の音声始端検出装置を既存の音
声終端検出装置と併用することにより、音声認識等の処
理に適した音声の情報を確実に抽出することが可能とな
る。
第1図は本発明の実施例における閾値決定の処理を示す
フローチャート、第2図は実施例の構成を示すブロック
図、第3図は実施例の始端検出動作を示すフローチャー
1−1第4図は、音素(I N Ifのエネルギー関連
値の推移の概略を示すグラフである。 図中、14はA/D変換器、15はCPtJ、16はR
OM、17及び”+8はRAM、21Ltサンプリング
手段に対応するステップ、22は計算手段に対応するス
テップ、30乃至38は音声始端検出手段に対応するス
テップである。
フローチャート、第2図は実施例の構成を示すブロック
図、第3図は実施例の始端検出動作を示すフローチャー
1−1第4図は、音素(I N Ifのエネルギー関連
値の推移の概略を示すグラフである。 図中、14はA/D変換器、15はCPtJ、16はR
OM、17及び”+8はRAM、21Ltサンプリング
手段に対応するステップ、22は計算手段に対応するス
テップ、30乃至38は音声始端検出手段に対応するス
テップである。
Claims (1)
- 【特許請求の範囲】 1、特定の話者の音声を含んだ入力信号の振幅を一定時
間毎にサンプリングして、複数の振幅値の列に変換する
サンプリング手段(14)と、前記複数の振幅値の列を
複数の区間に分割し、その区間毎における前記入力信号
のエネルギー値に関連するエネルギー関連値を計算する
計算手段(23)と、 少なくとも前記入力信号のエネルギー関連値とその関連
値に対する閾値とを比較する比較手段(34)を含み、
その比較結果を参酌して前記音声の始端を決定する音声
始端決定手段(30乃至38)とを有する音声始端検出
装置において、前記話者の予め発声した特定の音素にお
けるエネルギーに関連して前記閾値を決定する決定手段
を有することを特徴とする音声始端検出装置。 2、前記決定手段は、前記話者の発声した特定の音素に
おけるエネルギーの最高値をとる区間の時間的後方の近
傍区間のエネルギーの平均値に関連して前記閾値を決定
することを特徴とする特許請求の範囲第1項記載の音声
始端検出装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62092184A JPS63257797A (ja) | 1987-04-15 | 1987-04-15 | 音声始端検出装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62092184A JPS63257797A (ja) | 1987-04-15 | 1987-04-15 | 音声始端検出装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPS63257797A true JPS63257797A (ja) | 1988-10-25 |
Family
ID=14047352
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP62092184A Pending JPS63257797A (ja) | 1987-04-15 | 1987-04-15 | 音声始端検出装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS63257797A (ja) |
-
1987
- 1987-04-15 JP JP62092184A patent/JPS63257797A/ja active Pending
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP0077194B1 (en) | Speech recognition system | |
| JP2502880B2 (ja) | 音声認識方法 | |
| JP2666296B2 (ja) | 音声認識装置 | |
| JPS63235999A (ja) | 音声始端検出装置 | |
| JPH03114100A (ja) | 音声区間検出装置 | |
| JPS63213899A (ja) | 話者照合方式 | |
| JP2557497B2 (ja) | 男女声の識別方法 | |
| JPH0424717B2 (ja) | ||
| JP2891259B2 (ja) | 音声区間検出装置 | |
| JP2643202B2 (ja) | 入力音声の定常部、過渡部、不確定部の検出装置 | |
| JP3008404B2 (ja) | 音声認識装置 | |
| JPH0114599B2 (ja) | ||
| JP2658104B2 (ja) | 音声認識装置 | |
| JPH0412478B2 (ja) | ||
| JPH0451840B2 (ja) | ||
| JPH04211299A (ja) | 単音節音声認識装置 | |
| JPS6227798A (ja) | 音声認識装置 | |
| JPS5885495A (ja) | 音声認識装置 | |
| JPH05313695A (ja) | 音声分析装置 | |
| JPS63220199A (ja) | 音声認識装置 | |
| JPS59124392A (ja) | 音声認識方式 | |
| JPH0731506B2 (ja) | 音声認識方法 | |
| JPH09127971A (ja) | 音声区間検出装置及び音声認識装置 | |
| JPS6136798A (ja) | 音声セグメンテ−シヨン法 | |
| JPS6310437B2 (ja) |