JPS63136097A - 音声認識方式 - Google Patents

音声認識方式

Info

Publication number
JPS63136097A
JPS63136097A JP61283426A JP28342686A JPS63136097A JP S63136097 A JPS63136097 A JP S63136097A JP 61283426 A JP61283426 A JP 61283426A JP 28342686 A JP28342686 A JP 28342686A JP S63136097 A JPS63136097 A JP S63136097A
Authority
JP
Japan
Prior art keywords
data
speech
words
similarity
dictionary data
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP61283426A
Other languages
English (en)
Inventor
杉 伸夫
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Toshiba Corp
Original Assignee
Toshiba Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Toshiba Corp filed Critical Toshiba Corp
Priority to JP61283426A priority Critical patent/JPS63136097A/ja
Publication of JPS63136097A publication Critical patent/JPS63136097A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [発明の1−1的] (産業上の利用分野) 本発明は不特定話者が発声する音声を、特に類似した単
語音声を高精戊に認識することのでき  □る音声認識
11式に関する。
(従来の技術) 近時、マン・マシン・インターフェースとして重要な役
割を担う技術として、音声+’hl!1識処理が注目さ
れている。そして特定話合を対象として音声認識処理か
ら、不特定爪音を対象とした音声認識処理へと、その認
識処理技術が1−1覚ましく発展してきている。
ところでこの種の音声:ココ識処理において、認識 1
しようとする音声情報、例えば単語の中に類似した単語
が存在すると、人力音用に対する分析結果が似ている為
、これを誤認識する例が多くある。
例えば「ギリキズ」と「スリキズ」とを誤認識しtこり
、まt二rづ−カヤマjと「ナガヤマjとを認識するこ
とがある。このような類似111語の音j:1は、ぞの
音響分析結果で示される音声スペクトル自体が類似して
おり、音白認識で用いられる。Iiy書データに対する
類似度値が必然的に近似することに起因する。
そこで従来では専ら良く似ている111語については別
の111語に置換えてζ4声人力するようにしたり、そ
の単語を用いることを諦める等している。それにも拘ら
ず類似した単語が音声人力された場合には、その認識候
補を)(敢呈示し、オペレータにその選択を委ねるよ・
)にしている。
5゛6゛かにこのような]−夫によれば、その認識率の
向」二を図り?’−?るが、この結果として音声認識シ
ステムの使い勝手が悪くなることが否めなかった。
(発明が解決しようとする問題点) このように従来の音j!′i認識方式にあっては、例え
ば類似した単語間での誤認識を防いでその認識率の向」
−を図るには種々の問題があり、その改;(が強く要9
!されている。
本発明はこのようなJl情を考慮してなされたもので、
その目的とするところは、類似単語の音声人力を中止し
たり、別の単語に置換して音声人力する等のように音声
認、2(システムの使い勝f、を1;(牲にすることな
く、類似したllt語間の違いを効果的に見出してその
認識率の向」二を図ることのできる。狛IJ認識方式を
提供することにある。
[発明のH’i I戊] (間p+6点を解決するための手段) 本発明は認識しようとする、例えばllt語中6°Lで
与えられる音声情報の1次辞11)データを格納した1
次辞書データメモリと、類似した音声悄(K(単語)の
↓1【毎にそれらの異なりを示す2次辞書データを(;
1納した2次、ζt、 、IFデークメモリとをCイ、
lX備し、入力音声データと1次、−?書デークとの類
似度計算結果から、その認識候補の1位および2位とし
゛C判定された音1!1情報(111語)が、前記2次
辞書データメモリに格納された2次辞書データの類似し
たご再精報(単語)の組に属するか否かを調べ、類似し
た音声情報の組に属する場合には、前記人力i′?声デ
ータの一部と前記2次X? q’fデータとの類11:
1度を改めC計や、し、その類似++X計算結果に従っ
て前記入力高声データを認識してなることを特徴とする
ものである。
(作用) 本発明によれば、入力音声データと1次辞書データとの
類似度計算結果としC求められる1位および2位の認識
候補が類似した音7ji情報(IF語)の組に属する場
合、その類似した音、j、i情報(単語)の組に応じて
求められた2次、−7書デーク、つまり類似したi音声
情報(単語)間の違いを示ず2次1す7書デークと前記
入力音jjiデークとの類似度計算が++1度行われる
。そしてこの2次辞+’Fデータとの類似度計19結果
に従って前記入力音声データに対する認識結果が求めら
れる。
従って入力音声データが示す(lj語が他の14語と類
似しているような場合であってし、これを高精Izに3
;識することができる。またこのようなff1ri l
以単語間の誤認識を避けるべく、従来のようにその単、
?!iを他の同義の単語に置換して音声人力したり、ま
たその114語の使用をやめる等の煩わしさがない。
従ってg′声認識システムの使い勝手の良さを十分にE
l[持することができる。
(実施例) 以下、図面を参照して本発明の一実施例につ認識処理に
1」(される1°?パ1は、例えばマイクロッ4・ン(
図示せず)を介して人力される。
しかして人力古川は前処理部1にてf?響性分417れ
、ディジクル変換されて取込まれる。音J!H区間検出
部2は、このようにして音響分+Rされた人力j:r 
J’fデータの音J!1区間をその始端と終端として制
御部3の制御を受けて検出するものである。この11°
、jH区間の始端と終端との検出結果に従って前記人力
i’r j”’データ中の?η声区間のデータ、つまり
息継ぎ等によって生じる111(音区間を除< 、11
1語1“r声が存t1:する区間のiη声データが切出
されろ。そしてこのようにして切出された1゛?声区間
の人力Fl、、 7jiデータが人力jη声データメモ
リ(RAM)4に格納されて後述するi′丁声認識処理
に供される。
一方、1次辞書データメモリ(ROM)5には、1認識
しようとするi工灼情f′!が、例えば11語を認識処
理Iド位とする単語情報の1次辞書データとして格納さ
れている。この1次1(?書データは、従来より種々提
唱されている音声計1識の為の一般的な、lir書デー
タ、例えば単語の標県パターンデータからなるものであ
る。
また2次辞書データメモリ(ROM)Gは、前述した「
スリギズ」と「キリキズ」の如き類似した単語の違いを
示す情報を2次辞書データとして、その単語の組に対応
してそれぞれ記憶したものである。
この2次辞書データは、例えば前記1次辞書データの中
から、その辞、1「パターンの似ているl1語を抽出し
、これらのII 、h−に似ている111語を組(セラ
!・)としてその違いを示す情報と共にそれぞれブイレ
フ!・りとしてまとめ、これを第2図(a)に示すよう
に前記2次舌?νFデータメモリ6にそれぞれ登録した
ものである。
この2次辞書における各セットのディレクトりは、その
セットに含まれる単語の登録番号(カテゴリ)、そのセ
ットに含まれる単語数、そのセットに含まれるllj語
を相lj、に識別する為の情報等からなる。
この識別情報は、例えば前述した如く検出されたf7声
区間のどの部分の古川パターンに着1−1すれば、それ
らの違いを識別しi′するかの情報からなる。
具体的には音?・区間の始端と終端との間を(・・1文
・l (Iilの比率で分け、その+jii ’1チの
音、Hパターンで入力音声データを認工処理すれば良い
か、或いはその後゛1<、のき、!iパターンで人力1
°’I’ j!:データを認識処理すれば良いかを指示
する情報からなる。
第21’2j(b)はこのような情報のデータフ4−−
マツ!・の例を示すものである。ここでは8ビットのデ
ータのMSBの値によって前゛1tを用いるか後゛1′
を用いるかの指示をり、え、残る7ビツトのデータ中の
ド位3ビットと中位:うビットにて前゛11と後半とを
区切る位置(比率)を分数値として表現するものとなっ
ている。
従ってこの例では、分数liαが1/2で示され、MS
Bの値が(0)であることから、その類似11語を識別
する為にはその音1:5区間を2等分してなる前半のざ
声パターンに;’j IIすれば良いことが指示される
。
このような情報からなる2次辞書データが、類似中詰の
Sl【(セット)毎に2次辞書データメモリ6にそれぞ
れ格納されている。
しかして類似度計算部7は、先ず前記入力行声データメ
モリ4に格納された入力音声データと、上記′1次1(
゛を書データメモリ5に格納された各単語の1次辞書デ
ータとの間でそれぞれ類似度計算を実行し、その類似度
計311結果を111語カテゴリと共に前記制ρ11部
3にLpえている。この類似度計算処理は、例えばt(
合類似度法を用いる等して行われる。
制御部3はこのようにして求められた各111語の1次
辞書データに対する類似度泪311結果(類似度値)を
相互に比較し、その類似度値に従って上記各11語をソ
ーティング(並へ変え)している。そして基本的には最
も高い類似度値を11.1だ1次、−゛?書データの単
語カテゴリをその認識結果として求めるものとなってい
る。しかし本装置では、類似J立結果から」−述した如
く認識結果を直接求めるに先立ち、類似度値の高い1位
と2位のll’1語を抽出している。そしてそれらの単
語が前述した2次1ζ7書データメモリ6に、同じセッ
トに含:4:れるli語として登録されているか否かを
調べている。つまり1位および2位として求められた単
語が相tOに類似した単語であるか否かを調べている。
そしてその1位と2位のIlj語カテゴリが+111r
、に類似したものである場合には、それらのr)(語が
属するセットのブイレフ!・りに格納された情報を2次
辞書データメモリ (ROM ) [iから読出し、そ
の情報に従って前記類似度計算部7による類似)文;I
’)’>を+1度実行させ°Cいる。
この2次辞書データに従う類似度計算は、人力1°l、
+ 、j=データ中から、2次辞書データで(I示され
る比率の前゛11または後゛1−のFS°jjiパター
ンを前記音声区間検出部2にてそれぞれ切出し、この音
j!(パターンと2次辞書データで示される該当部分の
ざ声パターンとの間で類似度計算を実行することによっ
て行われる。
このようにして2次、ζ7古データに従う類似度計算が
行われると、その類似度1:1算結果が前記制御81S
3にりえられる。そして1.制御部では、この類似度計
t9結宋に従っ゛C前記1位および2tit、とじて求
められた認識松浦のllj語の内、どぢらの1111語
が正しいかを判定することになる。
尚、1次辞i’Fデータとの類似実計1)によって求め
られた1位と2位の認識松浦の単語が類似qt語でない
場合には、上述した2次辞−Fデータに従う類似度計算
を行なうことなく、その認識結果が決定される。
第3図は以」二のようにして人力111語音声を認識す
る本装置の全体的な処理の流れを示す図である。
この流れ図を参照して前述した処理を更に詳しく説明す
ると、音声データが人力されると、先ずその入力音声デ
ータを前処理部1に導き(ステップa)、この入力音声
を認識処理するに必要な特徴データをi−するべく該入
力音声データを音響分117する(ステップb)。
しかる後、金白区間検出部2にてこの入力音声データの
音声区間を検出し、そのF?声声量間人力1°?声デー
タのみを抽出する(ステップC)。
次にこのi′り声区間検出された人力i′7声データと
、前記1次辞書データメモリ5に格納された各単語の1
次辞マFデータとの間の類似度をそれぞれ計算し、その
類似度値を求める(ステップd)。そして制御部3にて
これらの計算された類似度値を、その値に従ってソーテ
ィングし、汀1似度値の最も高い単語(1位)と、次に
類似度値の高い111語(2位)とをそれぞれ求める(
ステップe)。
しかる後、木刀式の特徴的な処理ステップとして、先ず
」−記の々■く求められた1位の単語が2次+Ii’l
 i’Fデータのいずれかのセラ!・、つまり類似単語
の組(セット・)に含まれているか否かを判定する(ス
テップ【)。この判定の結果、1位の単語がいずれのセ
ットにも含まれていないことが確認された場合には、こ
の1位の単語を前記入力音声データの+認ullc 結
果として出力する(ステップIc )。
一方、−1−記判定処理によって1位の単語が2次^ン
書デークのいずれかのセット1こ含まれていることが見
出された場合には、前記2位の単語が2次辞書データの
同一のセラ!・に含まれているか否かを判定する(ステ
ップg)。この2つの判定処理ステップによって、1位
および2位の単語が類似した単語であるか、イiか、つ
まり相互に類似した111語として組(セット)をなし
、2次^7書デークとして登録されているか否かが判定
されることになる。この判定処理によって2位のlit
語が1位のIlt語と組をなしていないことが&ζ認さ
れた場合には、t1°1似11を語間のX;認識がない
ことが明らかとなり、前記11)“lのll1語が前記
人力i′丁声データの認識結果としてIN力される(ス
テップ10゜ さて、」二連した判定処理によって1位の単語と2位の
単語とが類似したilt語であることが示されると、そ
れらの単語の組に対して定められた2次A7書デークに
従って類似度計算処理が+1i度行われる。
先ず、入力音声データの?゛丁声区間が、そのセットの
2次辞書データで示される検出法に従って改めて1刀出
される(ステップ11)。つまりそれらの111語間の
違いが明確に生じる音声区間の音声パターンが切出され
る。
そしてこの新たに切出された入力音声データと、2次辞
書データとの間で類似度が計算され、前述した1 (:
1.および2位の111語に対する類似度がそれぞれ求
められる(ステップi)。この類似度計39゜は、1次
辞書データとの類似度計算とは異なる片、ji区間につ
いて行われていること、また2次+474fデータは類
似単語間の違いが明確になるようなデータを2次辞書デ
ータとしていることから、その、類似戊計算結果は上述
した1位および2位の単語間で大幅に異なったものとな
る。
このような類似疫値をソーティング処理する(ステップ
j)。そしてこのソーティングによって、1: (j/
、となった前記1位あるいは2位の11語を前記人力j
′?声データの認識結果であるとして出力する(ステッ
プ10゜ かくしてこのようなi′丁産声認識装置よれば、人力i
′7声データと1次辞占(通常の音声認、電用の辞書)
との類似実計39結果からだけでは誤認識を生じどうか
った類似tド語を、その単語間の違いを示す2次辞書デ
ータとの類似rF計算によって容易に、しかも適確に識
別することができる。これ故、他に類似した711語が
存白二するようなli語メ9ノ!+を人力した場合であ
っても、その人力111語t′1°J!+を高1.“1
度(こl’&i’を識することかできる。
i:1って従来のように、同義の他の単語に置換えてr
9 +’・人力する等の煩わしさがなく、Ll的とする
情報の音jニー人力を簡易に、効果的に行い1′、する
等の効果が奏せられる。
尚、本発明は、1−述した実施例に限定されるものでは
ない。ここではiη声人力の’11 (+’/、をll
’1語とじて説明したが、文節をrlt位として名、 
jji人力する場合であっても同様に適用することがで
きる。また3位までの候補について2次1(?書データ
を用いた類似実計3′>を行なうようにすることも一1
■能である。
要するに本発明はその要旨を逸脱しない範囲で杯)l変
形して実施することができる。
[発明の効果] 以1.説明したよ・)に本発明ににれば、類似した1゛
?声情報、例えば単語間の識別をLllI’、実化して
その認識精度の向」−を図ることができ、マン・マシン
・インターフェースに適用する等【7て実用」、多大な
る効用を奏し得る。
【図面の簡単な説明】
図は本発明方式の一実施例を示すもので、第1図は実施
例方式を適用したl”l’ IF: +認識装置の1j
既略(1−成用、第2図は2次辞書のデータ構造例を/
1<ず図、第3図はとの実施例における音l:・認識処
理の;ルされを示す図である。 ■・・・前処理部、2・・・F5jji区間険出部、3
・・・制御部、4・・・人カンη)!;デークメモリ、
 5・・・1次、(7書データメモリ、 6・・・2次
1ζ7書データメモリ、7・・・類似度計算部。

Claims (2)

    【特許請求の範囲】
  1. (1)入力音声を分析する前処理部と、この分析された
    入力音声データ中から音声区間を検出する音声区間検出
    部と、音声区間検出された音声データを格納する入力音
    声データメモリと、認識しようとする音声情報の1次辞
    書データを格納した1次辞書データメモリと、類似した
    音声情報の組毎にそれらの異なりを示す2次辞書データ
    を格納した2次辞書データメモリと、前記入力音声デー
    タメモリに格納された入力音声データと前記辞書データ
    との類似度を計算する類似度計算部と、この類似度計算
    結果を判定する手段とを具備し、 前記1次辞書データとの類似度計算結果から1位および
    2位として判定された音声情報が、前記2次辞書データ
    メモリに格納された2次辞書データの類似した音声情報
    の組に属する場合、前記入力音声データメモリに格納さ
    れた入力音声データの一部と前記2次辞書データとの類
    似度を計算して前記入力音声データを認識してなること
    を特徴とする音声認識方式。
  2. (2)認識しようとする音声情報は、単語を単位として
    与えられるものである特許請求の範囲第1項記載の音声
    認識方式。
JP61283426A 1986-11-28 1986-11-28 音声認識方式 Pending JPS63136097A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP61283426A JPS63136097A (ja) 1986-11-28 1986-11-28 音声認識方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP61283426A JPS63136097A (ja) 1986-11-28 1986-11-28 音声認識方式

Publications (1)

Publication Number Publication Date
JPS63136097A true JPS63136097A (ja) 1988-06-08

Family

ID=17665375

Family Applications (1)

Application Number Title Priority Date Filing Date
JP61283426A Pending JPS63136097A (ja) 1986-11-28 1986-11-28 音声認識方式

Country Status (1)

Country Link
JP (1) JPS63136097A (ja)

Similar Documents

Publication Publication Date Title
WO2020211354A1 (zh) 基于说话内容的说话者身份识别方法、装置及存储介质
CN113920986B (zh) 会议记录生成方法、装置、设备及存储介质
JPS62217295A (ja) 音声認識方式
CN114121023A (zh) 说话人分离方法、装置、电子设备及计算机可读存储介质
WO2009136440A1 (ja) 音声認識辞書作成支援装置,処理プログラム,および処理方法
CN115240655A (zh) 一种基于深度学习的中文语音识别系统及方法
JP3514481B2 (ja) 音声認識装置
JP2757356B2 (ja) 単語音声認識方法および装置
JP2664136B2 (ja) 音声認識装置
JPH0451840B2 (ja)
JP2827590B2 (ja) 音声認識装置
JPS6365499A (ja) 構文認識方式
JPS5977500A (ja) 単語音声認識方式
JPS60147797A (ja) 音声認識装置
JP2655637B2 (ja) 音声パターン照合方式
JPH10214096A (ja) 話者認識装置
CN119252256A (zh) 一种基于深度学习的语音转录方法
Berkling et al. Language identification with inaccurate string matching
JPH0887292A (ja) 単語音声認識装置
JPS62159200A (ja) 特定話者用単語音声認識装置
JPS63173100A (ja) キ−ワ−ド抽出装置
JPS6346499A (ja) 大語▲い▼単語音声認識方式
JPS63798B2 (ja)
CN112668664A (zh) 一种基于智能语音的话术训练方法
JPS6328315B2 (ja)