JPH0462399B2 - - Google Patents

Info

Publication number
JPH0462399B2
JPH0462399B2 JP58072340A JP7234083A JPH0462399B2 JP H0462399 B2 JPH0462399 B2 JP H0462399B2 JP 58072340 A JP58072340 A JP 58072340A JP 7234083 A JP7234083 A JP 7234083A JP H0462399 B2 JPH0462399 B2 JP H0462399B2
Authority
JP
Japan
Prior art keywords
segment
peak value
indicator
value
threshold
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP58072340A
Other languages
English (en)
Other versions
JPS58194099A (ja
Inventor
Yohanesu Suryuuteru Roberuto
Yan Kotomansu Hendoritsuku
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Koninklijke Philips NV
Original Assignee
Koninklijke Philips Electronics NV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Koninklijke Philips Electronics NV filed Critical Koninklijke Philips Electronics NV
Publication of JPS58194099A publication Critical patent/JPS58194099A/ja
Publication of JPH0462399B2 publication Critical patent/JPH0462399B2/ja
Granted legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/93—Discriminating between voiced and unvoiced parts of speech signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)

Description

【発明の詳細な説明】 A 発明の背景 A (1) 発明の分野 本発明は入力アナログ音声信号をデイジタル音
声信号に変換する変換手段と;前記デイジタル音
声信号のセグメントを蓄積する蓄積手段と;各セ
グメントを順次のスペクトル成分に変換する変換
手段にあつて、離散的フーリエ変換を行う手段を
具え、これにより各々が順次のスペクトル成分か
ら成る一連の振幅スペクトルを発生させる交換手
段;とを具えている音声分析システムに関するも
のである。
A (2) 従来技術の説明 斯種の音声分析システムは従来のボコーダから
一般的に既知である。例えば“IEEE
Transaction on Acoustics,Speech and
Signal Processing”(Vol.ASSP,No.7、1978年
8月、第358〜365頁)を参照することができ、こ
こに記載されている従来のシステムでは振幅スペ
クトルを高調波ピツチ検出器に供給して、各振幅
スペクトルの包絡(線)のピーク値間における周
波数離間距離からピツチ周期を検出するようにし
ている。
さらに上記文献には、元来ピツチ検出器は、有
声音−無声音(V/U)の判定をする共に、有声
音の期間中はピツチ周期を測定する装置であると
記載されている。しかし、ピツチ検出アルゴリズ
ムには、音声の有声音セグメントの期間中におけ
るピツチ周期だけを求めて、有声−無声音の判定
は別の方法で行うようにしたものもある。このこ
とについては、“IEEE Transaction on
Acoustics,Speech and Signal Processing”
(Vol.ASSP−24,No.5、1976年10月第399〜418
頁)を参照することができる。
上記最後に述べた文献には、自己相関関数や、
零交さ計数や、トレーニングセツトを用いてのパ
ターン認識技法に基づいたり、または幾つかのピ
ツチ検出器間での一致の度合に基づく数種の有声
−無声音検出アルゴリズムが記載されている。こ
れらの検出アルゴリズムは実際には全音声帯域に
おける音声信号の時間範囲まては周波数範囲のデ
ータを入力として用いているのに対して、ピツチ
周期の検出には低域通過フイルタにてろ波した音
声信号のデータを一般に用いている。
B 発明の概要 本発明の目的は前述した音声分析システムに
て、ピツチ周期を検出するために入力として一般
に用いられるのと同じスペクトルデータ、即ち低
域通過フイルタにてろ波した音声信号、特に約
200〜800Hzの周波数範囲内の音声信号のデータを
入力として用いる有声−無声音検出方法を提供す
ることにある。
本発明は、入力アナログ音声信号をデイジタル
音声信号に変換する変換手段と;前記デイジタル
音声信号のセグメントを蓄積する蓄積手段と;各
セグメントを順次のスペクトル成分に変換する変
換手段であつて、離散的フーリエ変換を行う手段
を具え、これにより各々が順次のスペクトル成分
から成る一連の振幅スペクトルを発生させる変換
手段;とを具えている音声分析システムにおい
て、当該システムがさらに、有声音の期間を指示
すべくセツトできると共に、無声音または音声の
ない期間を指示すべくリセツトできる双安定イン
ジケータと、下記の工程を含むプロセスを実効す
べくプログラム化したプログラマブル計算手段と
を具え、前記工程を: (1) 各セグメント(1番目)に対し、約200〜800
Hzの低周波帯域における該セグメントに関する
振幅スペクトルのスペクトル成分のピーク値M
(I)を求める工程; (2) kを所定の数とする場合に、n=I,I−
1,……I+1−kのセグメントのピーク値M
(n)が、nの値の増加により所定フアクタよ
りも大きいフアクタで単調に増加し、かつ前記
ピーク値M(I)が適応しきい値AT(I−1)
以上となる場合に双安定インジケータをセツト
する工程; (3) ピーク値M(I)が最大ピーク値VM(I−
1)の所定数分の1よりも小さいVM(I)で
あるか、ピーク値M(I)が所定しきい値より
も小さい場合に双安定インジケータをリセツト
する工程; (4) 前記インジケータがセツトされる場合に、各
セグメントおよび多数の先行セグメントに対し
て、n−I,I−1,……,I+1−mで、m
をセグメントIとセグメントI=1−mとの間
ではインジケータの状態が変化しないような値
とするピーク値M(n)の最大値(VM(I))
を求める工程; (5) 前記インジケータがセツトされる場合に、適
応しきい値AT(I)を最大値VM(I)の何分
の1かに等しく設定し、かつ前記インジケータ
がリセツトされる場合には、適応しきい値AT
(I)を前記AT(I−1)の何分の1かに等し
く設定することにより各セグメントに対する適
応しきい値(AT(I))を決定する工程; としたことを特徴とする音声分析システム。
上記本発明による音声分析システムにおける計
算プロセスの各工程(2)〜(5)に対応する部分を、後
に説明する第2図に一点鎖線で囲んで同一番号を
付して示してある。
斯かる方法によれば、最新のものを含む順次の
ピーク値(これはスペクトル強度とも称する)が
所定のフアクター(実際にはこのフアクターを3
とすることができる)以上のフアクターで単調に
増加する場合で、しかも最新のスペクトル強度が
所定の適応(アダプテイブ)しきい値以上となる
場合に、有声−無声音の判定をする。音声では、
ほぼ常に有声音の冒頭に前述したスペクトル強度
の増加が見られる。しかし、無声破裂音でも帯域
幅に制限があるにも拘わらず、同様にスペクトル
強度が強力に増加することが時々ある。
実際上、無声破裂音の内のいくつかのものは、
それらの殆どすべてのエネルギーが800Hz以上の
帯域に位置するため有効に除外されるが、200〜
800Hzの帯域内にある他の無声破裂音のスペクト
ル強度は著しく高くなる。適応しきい値は無声破
裂音によるスペクトル強度の増加と有声音の冒頭
部によるスペクトル強度の増加とを区別する。そ
のしきい値は最初は以前の有声音の最大スペクト
ル強度に比例させるため、粗い音声レベルに追従
することになる。無声音では適応しきい値は大き
な時定数で減衰する。この時定数は適当に選定し
て、よどみのない話し方の2つの有声音間では適
応しきい値が殆ど一定となり、中間の無声破裂音
が有声音として検出されないようにする必要があ
る。しかし、音声がはつきり途切れた後には、適
応しきい値が十分に減衰して、つぎの低レベルの
有声音を検出し得るようにする必要がある。この
場合、時定数が大き過ぎるとしきい値によつて有
声音の冒頭部が誤つて除去されてしまうことにな
る。この時定数は例えば数秒程度とするのが好適
である。
有声−無声音の転換部は或るしきい値によつて
規定され、その大きさは現時点の有声音における
最大スペクトル強度の何分の1かの大きさとす
る。スペクトル強度がこのしきい値よりも小さく
なると直ちに有声−無声音の転換部が判定され
る。
安全策として大きな一定のしきい値を用いる。
スペクトル強度がこのしきい値以上となる場合、
そのセグメントは有声音として直接類別される。
このしきい値の値はスペクトル強度がとり得る最
大強度に関するものであり、実際には最大スペク
トル強度の10%程度とすることができる。
さらに、低レベルの予定したしきい値も用い
る。スペクトル強度がこのしきい値を越さないセ
グメントは無声音として直接類別される。この低
レベルしきい値の値はスペクトル強度がとり得る
最大強度に関連し、実際にはその値を最大スペク
トル強度の0.4%程度とすることができる。
そこで、本発明の好適例では前記計算プロセス
が: (A) ピーク値M(I)が相対的に高い固定のしき
い値以上となる場合には、双安定インジケータ
をセツトする工程と; (B) ピーク値M(I)が相対的に低い固定のしき
い値を超えない場合には、双安定インジケータ
をリセツトする工程; とを含むようにする。これらの各工程(A)及び(B)に
対応する部分を第2図にそれぞれA及びBにて示
してある。
タイプの異なる種々のボコーダにおける順次の
セグメント間の時間遅れは通常10msと30msとの
範囲内の値である。確実な判定をするための有声
−無声音検出器で観測すべき最小時間間隔は40〜
50msとすべきである。最小時間遅れは10msと推
測されることからして、あらゆる実際のケースを
網羅するには6個(k=6)の順次のセグメント
を観測すれば充分である。
C 実施例の説明 以下図面につき本発明を説明する。
第1図に流れ図をもつて示す本発明による音声
分析システムでは、サンプリング速度が8kHzで、
精度が12ビツト/サンプルのブロツク11にて示
すアナログ−デイジタル変換操作(演算処理)部
に対する入力として10にて示す個所にアナログ
形態の音声信号を供給する。ライン12に現われ
るデイジタルサンプルをブロツク13にて表わす
セグメントバツフア操作部に供給して、256個の
サンプルに相当する32msのデイジタル化した音
声のセグメントを蓄積する。
本例ではデイジタル化した全ての音声セグメン
トが10msのインターバルでライン14に現われ
る。10msの各期間中に80個の新規のサンプルが
ブロツク13の操作部によつて蓄積され、80個の
最古サンプルは放棄される。上記インターバルは
10ms以外の値とすることができ、例えばボコー
ダにこのシステムを用いるように約10ms〜30ms
の範囲内の値とすることができる。
ついで、或るセグメントの256個のサンプルを
ブロツク15にて表わす操作部によるハミング窓
によつて逓倍する。ライン16に現われる窓掛け
したサンプルをつぎにブロツク17にて表わす個
所にて離散的にフーリエ変換し、ここで各離散的
スペクトル成分の絶対値をその実部および虚数部
から求める。
ライン18には10ms毎に128個のスペクトル成
分(絶対値で)が順次現われ、これらのスペクト
ル成分をブロツク19に供給し、ここでは約200
〜800Hzの周波数範囲内におけるスペクトル成分
のピーク値を測定する。第1番目のセグメントに
対するピーク値をM(I)にて示し、このピーク
値のことを上記周波数範囲における音声セグメン
トのスペクトル強度とも称する。
つぎに10msのインターバルでライン20に現
われるピーク値M(I)をブロツク21および2
2にて示す個所にて処理する。
ブロツク21では最終セグメントを含む一連の
セグメントのスペクトル強度が所定フアクター以
上のフアクターで単調に増加するするかどうかを
測定する。本例では6個のセグメントを考慮し、
上記フアクターを3とする。また、ブロツク21
ではスペクトル強度が適応(アダプテイブ)しき
い値を越すかどうかも測定する。この適応しきい
値は、先行する有声音の期間における最大スペク
トル強度の所定数分の1の値とするか、または無
声音の期間中には時間と共に減少する値とする。
有声音を確実に識別する安全策として大きなしき
い値を用いる。スペクトル強度がこの値以上とな
る場合にはセグメントが有声音として直接類別さ
れる。
ブロツク21の条件が満たされる場合に、双安
定インジケータ23がセツトされて、真の出力端
子Qに有声音の期間であることが指示される。
ブロツク22ではスペクトル強度が現時点の有
声音の期間における最大スペクトル強度の所定数
分の1のしきい値以下に低下するのか、または小
さな一定しきい値以下に低下するかどうかを決定
する。これらの条件が満たされる場合に双安定イ
ンジケータ23はリセツトされて偽の出力端子
に無声音の期間であることが指示される。
第1図に基づくプロセスでの所定の操作は汎用
デイジタルコンピユータを適当にプログラミング
することによつて満足させることができる。
ブロツク21および22の操作を実行するため
のコンピユータプログラムの流れ図を第2図に示
す。このプログラムの入力は連続する音声セグメ
ントのスペクトル強度を表わすピーク値M(I)
によつて形成する。
この流れ図におけるIはセグメントの番号を表
わし、ATは適応しきい値を、VMは連続する有
声音のセグメントの最大強度を、VUVは出力パ
ラメータをそれぞれ表し、有声音に対しては
VUV=1であり、無声音に対してはVUV=0で
ある。斯かる出力パラメータは第1図につき前述
した双安定インジケータ23の状態に対応する。
なお、第2図の流れ図は敢えて説明しなくても
容易に理解し得るものであるが、念のため、つぎ
のようなコメントを下記に呈示する。
コメントC1:ピーク値M(I)が、最後の5つ
のセグメントI,I−1,……,I−5に
わたつて3倍よりも大きく単調に増加する
かどうかを検出する。
コメントC2:M(I)が以前に設定した最大強
度VM(I−1)の所定数分の1(1/8)よ
りも小さい場合に双安定インジケータをリ
セツト(VUV=0)する。
コメントC3:前述した双安定インジケータ2
3の状態に対応するVUV(I)を出力させ
る。
コメントC4:適応しきい値ATを決定する。
コメントC5:大レベルの固定しきい値の値を
3072に固定し、低レベルの固定しきい値の
値を128に固定する。
本発明による音声分析システムは第3図に示す
構成によるハードウエアで実施することができ
る。このハードウエアは、 A/D変換器30(第1図のブロツク11に対
応)と、 セグメントバツフア31(第1図のブロツク1
3)と、 窓逓倍(窓掛け)機能を同時に行うDFTプロ
セツサ32(第1図のブロツク15および17)
と、 マイクロコンピユータ33(第1図のブロツク
19,21および22と、 双安定インジケータ34(第1図のブロツク2
3)とを具えている。
ブロツク19の機能、即ち一連のピーク値を決
定する機能はコンピユータを適当にプログラミン
グすることにより実行することができる。なおこ
の場合における適当なプログラムの流れ図は容易
にくふうすることができる。
【図面の簡単な説明】
第1図は本発明による音声分析システムの順次
の操作過程を示す流れ図、第2図は第1図に基づ
くプロセスで所定の操作を実施するのに用いられ
るコンピユータプログラムの流れ図、第3図は本
発明による音声分析システムを実施する電子装置
の一例を示すブロツク線図である。 10……音声信号入力部、11……A/D変換
操作部、13……セグメントバツフア操作部、1
5……ハミング窓掛け操作部、17……離散的フ
ーリエ変換操作部、19……スペクトル成分のピ
ーク値測定操作部、21……スペクトル強度の単
調増加検出兼適応しきい値との比較操作部、22
……スペクトル強度の最低しきい値との比較操作
部、23……双安定インジケータ、30……A/
D変換器、31……セグメントバツフア、32…
…DFTプロセツサ、33……マイクロコンピユ
ータ、34……双安定インジケータ。

Claims (1)

  1. 【特許請求の範囲】 1 入力アナログ音声信号をデイジタル音声信号
    に変換する変換手段と;前記デイジタル音声信号
    のセグメントを蓄積する蓄積手段と;各セグメン
    トを順次のスペクトル成分に変換する変換手段で
    あつて、離散的フーリエ変換を行う手段を具え、
    これにより各々が順次のスペクトル成分から成る
    一連の振幅スペクトルを発生させる変換手段;と
    を具えている音声分析システムにおいて、当該シ
    ステムがさらに、有声音の期間を指示すべくセツ
    トできると共に、無声音または音声のない期間を
    指示すべくリセツトできる双安定インジケータ
    と、下記の工程を含むプロセスを実効すべくプロ
    グラム化したプログラマブル計算手段とを具え、
    前記工程を: (1) 各セグメント(1番目)に対し、約200〜800
    Hzの低周波帯域における該セグメントに関連す
    る振幅スペクトルのスペクトル成分のピーク値
    M(I)を求める工程; (2) kを所定の数とする場合に、n=I,I−
    1,……I+1−kのセグメントのピーク値M
    (n)が、nの値の増加により所定フアクタよ
    りも大きいフアクタで単調に増加し、かつ前記
    ピーク値M(I)が適応しきい値AT(I−1)
    以上となる場合に双安定インジケータをセツト
    する工程; (3) ピーク値M(I)が最大ピーク値VM(I−
    1)の所定数分の1よりも小さいVM(I)で
    あるか、ピーク値M(I)が所定しきい値より
    も小さい場合に双安定インジケータをリセツト
    する工程; (4) 前記インジケータがセツトされる場合に、各
    セグメントおよび多数の先行セグメントに対し
    て、n−I,I−1,……,I+1−mで、m
    をセグメントIとセグメントI=1−mとの間
    ではインジケータの状態が変化しないような値
    とするピーク値M(n)の最大値(VM(I))
    を求める工程; (5) 前記インジケータがセツトされる場合に、適
    応しきい値AT(I)を最大値VM(I)の何分
    の1かに等しく設定し、かつ前記インジケータ
    がリセツトされる場合には、適応しきい値AT
    (I)を前記AT(I−1)の何分の1かに等し
    く設定することにより各セグメントに対する適
    応しきい値(AT(I))を決定する工程; としたことを特徴とする音声分析システム。 特許請求の範囲1記載のシステムにおいて、前
    記プロセスが: (A) ピーク値M(I)が相対的に高い固定のしき
    い値以上となる場合には、双安定インジケータ
    をセツトする工程と; (B) ピーク値M(I)が相対的に低い固定のしき
    い値を超えない場合には、双安定インジケータ
    をリセツトする工程; とを含むようにしたことを特徴とする音声分析シ
    ステム。
JP58072340A 1982-04-27 1983-04-26 音声分析システム Granted JPS58194099A (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP82200501A EP0092612B1 (en) 1982-04-27 1982-04-27 Speech analysis system
NL82200501.3 1982-04-27

Publications (2)

Publication Number Publication Date
JPS58194099A JPS58194099A (ja) 1983-11-11
JPH0462399B2 true JPH0462399B2 (ja) 1992-10-06

Family

ID=8189485

Family Applications (1)

Application Number Title Priority Date Filing Date
JP58072340A Granted JPS58194099A (ja) 1982-04-27 1983-04-26 音声分析システム

Country Status (5)

Country Link
US (1) US4637046A (ja)
EP (1) EP0092612B1 (ja)
JP (1) JPS58194099A (ja)
CA (1) CA1193730A (ja)
DE (1) DE3276732D1 (ja)

Families Citing this family (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS59174382A (ja) * 1983-03-24 1984-10-02 Canon Inc 被記録材
AU582962B2 (en) * 1986-03-18 1989-04-13 Siemens Aktiengesellschaft Process for differentiating speech signals from signals of noise-free or noise-affected speech pauses
IT1229725B (it) * 1989-05-15 1991-09-07 Face Standard Ind Metodo e disposizione strutturale per la differenziazione tra elementi sonori e sordi del parlato
JP3277398B2 (ja) 1992-04-15 2002-04-22 ソニー株式会社 有声音判別方法
US5715365A (en) * 1994-04-04 1998-02-03 Digital Voice Systems, Inc. Estimation of excitation parameters
US5819217A (en) * 1995-12-21 1998-10-06 Nynex Science & Technology, Inc. Method and system for differentiating between speech and noise
US5758277A (en) * 1996-09-19 1998-05-26 Corsair Communications, Inc. Transient analysis system for characterizing RF transmitters by analyzing transmitted RF signals
DE19854341A1 (de) * 1998-11-25 2000-06-08 Alcatel Sa Verfahren und Schaltungsanordnung zur Sprachpegelmessung in einem Sprachsignalverarbeitungssystem
RU2482679C1 (ru) * 2011-10-10 2013-05-27 Биогард Инвестментс Лтд., Инсектицидная композиция
US9454976B2 (en) 2013-10-14 2016-09-27 Zanavox Efficient discrimination of voiced and unvoiced sounds
JP6891736B2 (ja) * 2017-08-29 2021-06-18 富士通株式会社 音声処理プログラム、音声処理方法および音声処理装置

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3549806A (en) * 1967-05-05 1970-12-22 Gen Electric Fundamental pitch frequency signal extraction system for complex signals
US4015088A (en) * 1975-10-31 1977-03-29 Bell Telephone Laboratories, Incorporated Real-time speech analyzer
US4351983A (en) * 1979-03-05 1982-09-28 International Business Machines Corp. Speech detector with variable threshold
FR2451680A1 (fr) * 1979-03-12 1980-10-10 Soumagne Joel Discriminateur parole/silence pour interpolation de la parole
FR2466825A1 (fr) * 1979-09-28 1981-04-10 Thomson Csf Dispositif de detection de signaux vocaux et systeme d'alternat comportant un tel dispositif
US4441200A (en) * 1981-10-08 1984-04-03 Motorola Inc. Digital voice processing system

Also Published As

Publication number Publication date
EP0092612B1 (en) 1987-07-08
JPS58194099A (ja) 1983-11-11
CA1193730A (en) 1985-09-17
DE3276732D1 (en) 1987-08-13
US4637046A (en) 1987-01-13
EP0092612A1 (en) 1983-11-02

Similar Documents

Publication Publication Date Title
EP0398180B1 (en) Method of and arrangement for distinguishing between voiced and unvoiced speech elements
Markel The SIFT algorithm for fundamental frequency estimation
KR950013551B1 (ko) 잡음신호예측장치
JPH0713584A (ja) 音声検出装置
US20050102133A1 (en) Voice activated device
JPH0121519B2 (ja)
WO1986003047A1 (en) Endpoint detector
US4625327A (en) Speech analysis system
US4637046A (en) Speech analysis system
JP3849116B2 (ja) 音声検出装置及び音声検出プログラム
WO2007026436A1 (ja) ボーカル・フライ検出装置
EP0348888B1 (en) Overflow speech detecting apparatus
JPH04100099A (ja) 音声検出装置
SU1781701A1 (en) Method of separation of speech and nonstationary noise signals
KR100345402B1 (ko) 피치 정보를 이용한 실시간 음성 검출 장치 및 그 방법
Dasgupta et al. Detection of Glottal Excitation Epochs in Speech Signal Using Hilbert Envelope.
JPH04230798A (ja) 雑音予測装置
JPH03288199A (ja) 音声認識装置
Brossier Fast melody extraction using aubio (brossier), mirex-2005
JP2643202B2 (ja) 入力音声の定常部、過渡部、不確定部の検出装置
JPS6068000A (ja) ピッチ抽出装置
AU662616B2 (en) Speech detection circuit
JPH0117599B2 (ja)
JPH01315798A (ja) ピッチ抽出装置
JPS63155197A (ja) 無声音検出方法