JPH02100099A - 音声認識装置 - Google Patents
音声認識装置Info
- Publication number
- JPH02100099A JPH02100099A JP25448988A JP25448988A JPH02100099A JP H02100099 A JPH02100099 A JP H02100099A JP 25448988 A JP25448988 A JP 25448988A JP 25448988 A JP25448988 A JP 25448988A JP H02100099 A JPH02100099 A JP H02100099A
- Authority
- JP
- Japan
- Prior art keywords
- channel
- power
- recognition device
- sound
- band
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
投眺氷乱
本発明は、音声認識装置、より詳細には、音声認識装置
における有声音、無声音の検出に関する。
における有声音、無声音の検出に関する。
従】U1術−
音声認識装置の特徴量の一つとして、有声音か無声音か
という情報を使うことが一般に知られている。有声音と
は母音に代表される音声で声帯振動を伴うものであり、
無声音は子音の/ s /や/1/などに代表される音
声であり声帯振動を伴わないものである。この有声音と
無声音の検出の方法の一つとして1周波数方向のパワー
の分布によって検出する方法がある。多くの音声認識装
置の場合1周波数方向のパワーの分布を検出するために
、バンドパスフィルター(BPF)と整流回路(DET
)を使用することが多い。なぜならばFFTを行なうに
は計算量が多過ぎて、リアルタイムでデータが処理でき
ないからである。また、デジタルフィルターに関しても
チャンネル数が多くなるとハードフェアの規模が大きく
なり過ぎるため現実的ではない。このBPFのチャンネ
ル数は主にそれらがカバーする帯域によって異なる。
という情報を使うことが一般に知られている。有声音と
は母音に代表される音声で声帯振動を伴うものであり、
無声音は子音の/ s /や/1/などに代表される音
声であり声帯振動を伴わないものである。この有声音と
無声音の検出の方法の一つとして1周波数方向のパワー
の分布によって検出する方法がある。多くの音声認識装
置の場合1周波数方向のパワーの分布を検出するために
、バンドパスフィルター(BPF)と整流回路(DET
)を使用することが多い。なぜならばFFTを行なうに
は計算量が多過ぎて、リアルタイムでデータが処理でき
ないからである。また、デジタルフィルターに関しても
チャンネル数が多くなるとハードフェアの規模が大きく
なり過ぎるため現実的ではない。このBPFのチャンネ
ル数は主にそれらがカバーする帯域によって異なる。
音声認識が対象としている音声に関しては色々の考え方
があるが、多くは200tlz −7kHz程度をカバ
ーできるようにBPFを設定する。この帯域をnチャン
ネルのBPFでカバーするのである。
があるが、多くは200tlz −7kHz程度をカバ
ーできるようにBPFを設定する。この帯域をnチャン
ネルのBPFでカバーするのである。
このような構成において有声音と無声音の検出をする場
合、低周波数のパワーが高周波数のパワーより大きい場
合には有声音、小さい場合には無声音とすることにより
検出ができる。具体的には、最も周波数が低いチャンネ
ルのBPFのパワーと最も周波数が高いチャンネルのB
PFのパワーとを比較したり、周波数が低い複数のチャ
ンネルのパワーの加算値と周波数が高い複数のチャンネ
ルのパワーの加算値で比較することが一般に行なわれて
いる。
合、低周波数のパワーが高周波数のパワーより大きい場
合には有声音、小さい場合には無声音とすることにより
検出ができる。具体的には、最も周波数が低いチャンネ
ルのBPFのパワーと最も周波数が高いチャンネルのB
PFのパワーとを比較したり、周波数が低い複数のチャ
ンネルのパワーの加算値と周波数が高い複数のチャンネ
ルのパワーの加算値で比較することが一般に行なわれて
いる。
しかしながら、音声認識装置が使用されている状態にお
いては、入力される帯域が狭い場合がある。例えば、電
話音声に関しては最高周波数は3.4kHzまでであり
、それ以上の帯域にはパワーがない。また、無線音声の
場合でも、同様に周波数が狭くなる場合も多い。このよ
うな場合、従来では、その使用環境にあわせて有声音と
無声音を検出するために比較を行なうBPFのチャンネ
ルを合わせた音声認識装置を使用していた。しかし、使
用者がどのような環境で使用するのか分からない場合に
は、何らの対策もできなかった。例えば、電話用に通常
の音声vi、識装置を使用した場合には、3.4kHz
以上の情報がまったく無くなるため、最高周波数のBP
Fのパワーがなくなり、全ての音声が有声音となる欠点
があった。
いては、入力される帯域が狭い場合がある。例えば、電
話音声に関しては最高周波数は3.4kHzまでであり
、それ以上の帯域にはパワーがない。また、無線音声の
場合でも、同様に周波数が狭くなる場合も多い。このよ
うな場合、従来では、その使用環境にあわせて有声音と
無声音を検出するために比較を行なうBPFのチャンネ
ルを合わせた音声認識装置を使用していた。しかし、使
用者がどのような環境で使用するのか分からない場合に
は、何らの対策もできなかった。例えば、電話用に通常
の音声vi、識装置を使用した場合には、3.4kHz
以上の情報がまったく無くなるため、最高周波数のBP
Fのパワーがなくなり、全ての音声が有声音となる欠点
があった。
■−−府
本発明は、上述のごとき実情に鑑みてなされたもので、
音声認識装置において、使用状況下ではパワーが出力さ
れない帯域を自動的に調べることにより最も適した帯域
を使用して有声音と無声音の検出を行なうことを目的と
してなされたものである。
音声認識装置において、使用状況下ではパワーが出力さ
れない帯域を自動的に調べることにより最も適した帯域
を使用して有声音と無声音の検出を行なうことを目的と
してなされたものである。
碧−−フに
本発明は、上記目的を達成するために、入力された音声
を適したレベルまで増幅する手段と、n(n=正の整数
)チャンネルのバンドパスフィルター(BPF)と、n
チャンネルの整流回路(DET)と、A/D変換回路と
、特徴を抽出する手段と、音声区間を切り出す手段と、
辞書を記憶する手段と、認識をする手段と、ある指定さ
れた音声区間のサンプリングされたフレーム毎に1チャ
ンネルからnチャンネルまでのパワーデータを記憶する
手段と、その値をある閾値と比較する手段と、その結果
によりそれぞれのチャンネルが有効か無効かを示す手段
と、有効なチャンネルの低い周波数のパワーと高い周波
数のパワーとを比較する手段を有する音声認識装置にお
いて、該音声認識装置が使用される状態において、予め
使用者に決められた発声を行なわせ、各バンドパスフィ
ルターのパワーを検出し使用状態においてパワーが無い
帯域のバンドパスフィルターを検出し。
を適したレベルまで増幅する手段と、n(n=正の整数
)チャンネルのバンドパスフィルター(BPF)と、n
チャンネルの整流回路(DET)と、A/D変換回路と
、特徴を抽出する手段と、音声区間を切り出す手段と、
辞書を記憶する手段と、認識をする手段と、ある指定さ
れた音声区間のサンプリングされたフレーム毎に1チャ
ンネルからnチャンネルまでのパワーデータを記憶する
手段と、その値をある閾値と比較する手段と、その結果
によりそれぞれのチャンネルが有効か無効かを示す手段
と、有効なチャンネルの低い周波数のパワーと高い周波
数のパワーとを比較する手段を有する音声認識装置にお
いて、該音声認識装置が使用される状態において、予め
使用者に決められた発声を行なわせ、各バンドパスフィ
ルターのパワーを検出し使用状態においてパワーが無い
帯域のバンドパスフィルターを検出し。
その帯域に関してはバンドパスフィルターの出力を無効
とし、有効な帯域のパワーデータから音声区間内の有声
音部分と無声音部分を検出することを特徴としたもので
ある。以下、本発明の実施例に基づいて説明する。
とし、有効な帯域のパワーデータから音声区間内の有声
音部分と無声音部分を検出することを特徴としたもので
ある。以下、本発明の実施例に基づいて説明する。
第1図は、本発明の一実施例を説明するための構成図で
、図中、1はアンプ、2はバンドパスフィルター(BP
F)群、3はA/D変換回路、4は音声区間検出部、5
は特徴抽出部、6はテストモードスイッチ、7はパワー
記憶部、8はチャンネルパワー計算部、9はチャンネル
パワー記憶部。
、図中、1はアンプ、2はバンドパスフィルター(BP
F)群、3はA/D変換回路、4は音声区間検出部、5
は特徴抽出部、6はテストモードスイッチ、7はパワー
記憶部、8はチャンネルパワー計算部、9はチャンネル
パワー記憶部。
10はコンパレータ、11はチャンネルイネーブルフラ
グ、12aは低周波パワー検出部、12bは高周波パワ
ー検出部、13はコンパレータ、14は認識部、15は
辞書記憶部で、まず、使用者は音声認識装置を用いて、
辞書の登録や認識を行なう前に、入力される音声の状態
を認識装置に知らせるためテストモードスイッチ6を使
用して、装置をテストモードの状態にする。スイッチ6
は使用者が直接押せる物であったり、例えば、電話等で
あれば、ブツシュホンの番号によってテストモードにな
るものであったり、無線等でモード切り替えができるも
のであったりする。装置はテストモードになると、入力
された音声から音声区間を検出して、検出された音声区
間のデータをパワー記憶部7に記憶する。記憶されるデ
ータは1ch(チャンネル)からnch(チャンネル)
までの整流回路(DET)の出力、つまり各BPFのパ
ワー値をA/D変換した値であり、サンプル時間は辞i
t録もしくは認識時と等しくする。ここでテストに使用
する音声であるが、低い周波数から高い周波数まで成分
を持った音声でなくてはならない。例えば、高い周波数
ならば、子音IsT含んだものにすれば良いし、低い周
波数ならばn、m’を含めば良い。テスト用の発声単語
はあらかじめ使用者に指定すれば良く、上記の音を含ん
だ単語であればよい。このテスト単語のパワーデータは
各チャンネル毎に、音声区間内の全フレームについて加
算される。この加算されたパワー値はチャンネルパワー
記憶部9に記憶される。このパワー値によって使用する
BPFの範囲を決定する。
グ、12aは低周波パワー検出部、12bは高周波パワ
ー検出部、13はコンパレータ、14は認識部、15は
辞書記憶部で、まず、使用者は音声認識装置を用いて、
辞書の登録や認識を行なう前に、入力される音声の状態
を認識装置に知らせるためテストモードスイッチ6を使
用して、装置をテストモードの状態にする。スイッチ6
は使用者が直接押せる物であったり、例えば、電話等で
あれば、ブツシュホンの番号によってテストモードにな
るものであったり、無線等でモード切り替えができるも
のであったりする。装置はテストモードになると、入力
された音声から音声区間を検出して、検出された音声区
間のデータをパワー記憶部7に記憶する。記憶されるデ
ータは1ch(チャンネル)からnch(チャンネル)
までの整流回路(DET)の出力、つまり各BPFのパ
ワー値をA/D変換した値であり、サンプル時間は辞i
t録もしくは認識時と等しくする。ここでテストに使用
する音声であるが、低い周波数から高い周波数まで成分
を持った音声でなくてはならない。例えば、高い周波数
ならば、子音IsT含んだものにすれば良いし、低い周
波数ならばn、m’を含めば良い。テスト用の発声単語
はあらかじめ使用者に指定すれば良く、上記の音を含ん
だ単語であればよい。このテスト単語のパワーデータは
各チャンネル毎に、音声区間内の全フレームについて加
算される。この加算されたパワー値はチャンネルパワー
記憶部9に記憶される。このパワー値によって使用する
BPFの範囲を決定する。
次に、第2図を参照しながら、BPFの範囲を決定する
手段について詳細に説明する。チャンネルパワー記憶部
9には各チャンネル毎に単語内のパワーが記憶されてい
る。なお、ここでは、入力音声が電話からのものである
として説明する。電話の音声は一般に高い周波数の部分
にパワーが無い。そのためテスト単語のパワーを調べる
と、高い周波数にはほとんどパワーが無く高い周波数の
BPFの出力データは0に近くなっている。つまり、こ
のパワーが出ていないBPFについては全く音声の情報
が無いといえる。そこで、ある閾値mとチャンネルパワ
ー記憶部の値をコンパレータ1oで比較して、mより大
きければそのチャンネルは有効であるとし、逆に小さけ
れば無効であるとする。なお、閾値の値は雑音による影
響を除くためであり実験的に求めても良く、それほど値
を変化させても影響が無い。このようにして求められた
チャンネルの有効と無効の情報はチャンネルイネーブル
フラグ11によって示される。本実施例では各チャンネ
ルについて、有効ならば1無効ならば0にしているがそ
の他の方法でもかまわない。このようにして得られたチ
ャンネルの情報を基に装置は認識対象となる入力音声の
有声音と無声音の検出を行なう。
手段について詳細に説明する。チャンネルパワー記憶部
9には各チャンネル毎に単語内のパワーが記憶されてい
る。なお、ここでは、入力音声が電話からのものである
として説明する。電話の音声は一般に高い周波数の部分
にパワーが無い。そのためテスト単語のパワーを調べる
と、高い周波数にはほとんどパワーが無く高い周波数の
BPFの出力データは0に近くなっている。つまり、こ
のパワーが出ていないBPFについては全く音声の情報
が無いといえる。そこで、ある閾値mとチャンネルパワ
ー記憶部の値をコンパレータ1oで比較して、mより大
きければそのチャンネルは有効であるとし、逆に小さけ
れば無効であるとする。なお、閾値の値は雑音による影
響を除くためであり実験的に求めても良く、それほど値
を変化させても影響が無い。このようにして求められた
チャンネルの有効と無効の情報はチャンネルイネーブル
フラグ11によって示される。本実施例では各チャンネ
ルについて、有効ならば1無効ならば0にしているがそ
の他の方法でもかまわない。このようにして得られたチ
ャンネルの情報を基に装置は認識対象となる入力音声の
有声音と無声音の検出を行なう。
次に、第3図を参照しながら、例えば、最高周波数と最
低周波数のチャンネルを使用して検出を行なう場合につ
いて説明する。前記したチャンネルイネーブルフラグ1
1を入力として、それぞれのチャンネルを選択し、その
データをイネーブルとする。これは論理回路で行なって
もよいし。
低周波数のチャンネルを使用して検出を行なう場合につ
いて説明する。前記したチャンネルイネーブルフラグ1
1を入力として、それぞれのチャンネルを選択し、その
データをイネーブルとする。これは論理回路で行なって
もよいし。
ROMを使用して、イネーブルフラグをアドレスにして
もよい。このようにして選ばれたチャンネルのパワーは
コンパレータ13により比較される。
もよい。このようにして選ばれたチャンネルのパワーは
コンパレータ13により比較される。
ここでもし最高周波数のパワーが最低周波数のパワーよ
り大きい場合には無声音、小さい場合には有声音とする
。複数のチャンネルを使用して有声音と無声音を検出す
る場合も同様である。
り大きい場合には無声音、小さい場合には有声音とする
。複数のチャンネルを使用して有声音と無声音を検出す
る場合も同様である。
上記のチャンネルイネーブルフラグの情報は辞書をフロ
ッピーなどに格納するときにそのデータの一部として同
時に格納することにより、−度テストするだけで済むよ
うになる。
ッピーなどに格納するときにそのデータの一部として同
時に格納することにより、−度テストするだけで済むよ
うになる。
夏−一部
以上の説明から明らかなように、本発明の音声認識装置
によると、使用状況が変化しても最適に有声音と無声音
の検出を行なうことができ、認識率が向上する。
によると、使用状況が変化しても最適に有声音と無声音
の検出を行なうことができ、認識率が向上する。
第1図は、本発明の一実施例を説明するための構成図、
第2図は、BPFの範囲を決定する手段の一例を説明す
るための図、第3図は、入力音声の有声音と無声音を検
出する手段の一例を説明するための図である。 1・・・アンプ、2・・・バンドパスフィルター群、3
・・・A/D変換回路、4・・・音声区間検出部、5・
・・特徴抽出部、6・・・テストモードスイッチ、7・
・・パワー記憶部、8・・・チャンネルパワー計算部、
9・・・チャンネルパワー記憶部、10・・・コンパレ
ータ。 ・・・チャンネルイネーブルフラグ、12a・・・低パ
ワー検出部、12b・・・高周波パワー検出13・・・
コンパレータ、14・・・認識部、15・・・記憶部。
第2図は、BPFの範囲を決定する手段の一例を説明す
るための図、第3図は、入力音声の有声音と無声音を検
出する手段の一例を説明するための図である。 1・・・アンプ、2・・・バンドパスフィルター群、3
・・・A/D変換回路、4・・・音声区間検出部、5・
・・特徴抽出部、6・・・テストモードスイッチ、7・
・・パワー記憶部、8・・・チャンネルパワー計算部、
9・・・チャンネルパワー記憶部、10・・・コンパレ
ータ。 ・・・チャンネルイネーブルフラグ、12a・・・低パ
ワー検出部、12b・・・高周波パワー検出13・・・
コンパレータ、14・・・認識部、15・・・記憶部。
Claims (1)
- 1、入力された音声を適したレベルまで増幅する手段と
、n(n=正の整数)チャンネルのバンドパスフィルタ
ーと、nチャンネルの整流回路と、A/D変換回路と、
特徴を抽出する手段と、音声区間を切り出す手段と、辞
書を記憶する手段と、認識をする手段と、ある指定され
た音声区間のサンプリングされたフレーム毎に1チャン
ネルからnチャンネルまでのパワーデータを記憶する手
段と、その値をある閾値と比較する手段と、その結果に
よりそれぞれのチャンネルが有効か無効かを示す手段と
、有効なチャンネルの低い周波数のパワーと高い周波数
のパワーとを比較する手段を有する音声認識装置におい
て、該音声認識装置が使用される状態において、予め使
用者に決められた発声を行なわせ、各バンドパスフィル
ターのパワーを検出して使用状態においてパワーが無い
帯域のバンドパスフィルターを検出し、その帯域に関し
てはバンドパスフィルターの出力を無効とし、有効な帯
域のパワーデータから音声区間内の有声音部分と無声音
部分を検出することを特徴とする音声認識装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP25448988A JPH02100099A (ja) | 1988-10-07 | 1988-10-07 | 音声認識装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP25448988A JPH02100099A (ja) | 1988-10-07 | 1988-10-07 | 音声認識装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH02100099A true JPH02100099A (ja) | 1990-04-12 |
Family
ID=17265763
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP25448988A Pending JPH02100099A (ja) | 1988-10-07 | 1988-10-07 | 音声認識装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH02100099A (ja) |
-
1988
- 1988-10-07 JP JP25448988A patent/JPH02100099A/ja active Pending
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Shiota et al. | Voice liveness detection algorithms based on pop noise caused by human breath for automatic speaker verification | |
| CN102214464B (zh) | 音频信号的瞬态检测方法以及基于该方法的时长调整方法 | |
| JPH0431898A (ja) | 音声雑音分離装置 | |
| JP2701431B2 (ja) | 音声認識装置 | |
| US5897614A (en) | Method and apparatus for sibilant classification in a speech recognition system | |
| JP3106543B2 (ja) | 音声信号処理装置 | |
| Dai et al. | An improved model of masking effects for robust speech recognition system | |
| JP3284968B2 (ja) | 話速変換機能を有する補聴器 | |
| JPS6367197B2 (ja) | ||
| JP3588929B2 (ja) | 音声認識装置 | |
| WO2009055701A1 (en) | Processing of a signal representing speech | |
| JP2968976B2 (ja) | 音声認識装置 | |
| JP2006010739A (ja) | 音声認識装置 | |
| JP2666296B2 (ja) | 音声認識装置 | |
| KR20040082756A (ko) | 비음성 제거에 의한 음성 추출 방법 | |
| JP2870421B2 (ja) | 話速変換機能を有する補聴器 | |
| JPH0567039B2 (ja) | ||
| JP3020999B2 (ja) | パターン登録方法 | |
| Mahmoodzade | The recognition of nasal-stop distinction in adverse listening conditions | |
| JP2901976B2 (ja) | パターン照合予備選択方式 | |
| JPH02165199A (ja) | 音声認識装置 | |
| JPH0316038B2 (ja) | ||
| JPH06318099A (ja) | 話者認識装置 | |
| JPS61246800A (ja) | 音声応答スイツチ | |
| JPH06318098A (ja) | 話者認識装置 |