JPS6148063A - カナ漢字変換方式 - Google Patents

カナ漢字変換方式

Info

Publication number
JPS6148063A
JPS6148063A JP59168830A JP16883084A JPS6148063A JP S6148063 A JPS6148063 A JP S6148063A JP 59168830 A JP59168830 A JP 59168830A JP 16883084 A JP16883084 A JP 16883084A JP S6148063 A JPS6148063 A JP S6148063A
Authority
JP
Japan
Prior art keywords
kana
word
reliability
kanji
evaluation value
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP59168830A
Other languages
English (en)
Inventor
Katsuhiko Fujita
克彦 藤田
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Ricoh Co Ltd
Original Assignee
Ricoh Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Ricoh Co Ltd filed Critical Ricoh Co Ltd
Priority to JP59168830A priority Critical patent/JPS6148063A/ja
Publication of JPS6148063A publication Critical patent/JPS6148063A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Document Processing Apparatus (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 技術分野 本発明は日本語処理方式、特に詳細には、たとえば日本
語ワードプロセッサ等の日本語処理装置において、入力
されたカナ文字列をカナ漢字変換する日本語処理方式に
関する。
従来技術 従来、ワードプロセッサ等の日本語処理装置においては
、たとえばカナ等からなるカナ列を入力し、所定のアル
ゴリズムに従って文法解析処理して漢字とカナの混ざっ
たカナ漢字変換が行なわれていた。このカナ漢字変換方
式として最長一致法や最尤評価法が一般的によく知られ
用いられている。
一般的には縦型探索による単語の切シ出しを行ない、最
尤評価法による評価値のみによってカナ列をカナ漢字変
換する方式は最長一致法の方式よシはすぐれた高品質の
カナ漢字変換を行なうことができる。
しかし、その方式の場合、最尤評価値により抽出および
選択された単語同士の接続が可能である限シ、入力カナ
列の解析は縦型に続行され、見直し再検討のためのバッ
クトラックがかからず、その解析が正しいものとしてそ
のままカナ漢字変換して誤変換して出力してしまう欠点
があったO たとえば、「けんシをこうしします」の入力カナ列に対
して縦型探索の最尤評価方式によりカナ漢字変換する。
この場合、まず、入力カナ列の文頭からの部分カナ文字
列「けんりを」に対して辞書検索を行ない、候補単語と
して「券」、「剣」、「権利」等をうる。それらの単語
の内、どの単語が文頭に利用される単語かどうかを接続
行列表で検定し、文頭に利用される単語についてのみ評
価演算が行なわれる。ここで「権利」が評価値最大だっ
たとすると、次の単語抽出は「権利」の後続文字列「を
こうし」に対してカナ漢字変換が行なわれる。
以下、同様に単語抽出を繰シ返し、文末迄単語抽出が行
なわれれば、1文章のカナ漢字変換が終了したことにな
る。ところが、「を」の後に「行使」ではなく「講師」
が評価値最大になったとすると、それに続くカナ漢字変
換は、「します。」を「島酢。」のように誤変換になる
可能性がある。これは、「行使」と「講師」では品詞が
他動詞と名詞とで異なっているため、「講師」を選択し
た場合、す変動側の「シ」が「講師」には続かないこと
により、他の候補単語である「島」を抽出して接続した
結果である。
目的 本発明はこのような従来技術の欠点を解消しカナ文字列
をカナと漢字の混在したカナ漢字変換する方式において
、候補語の信頼性の一定条件のもとて強制的にバックト
ラックをかけることにより、より信頼性の高いカナ漢字
変換する方式を提供することを目的とする。
構成 本発明の構成について以下、一実施例に基づいて説明す
る。第1図を参照すると、本発明を日本語ワードプロセ
ッサに適用した実施例が概念的機能ブロック図にて示さ
れている。本図に示すように、本実施例はキーボード1
、入力バッファ部2、解析対象文字列作成部3、辞書検
索部4、単語辞書5、接続重み行列表6、最大評価部7
、バックトラック起動判定部8、バックトラック制御部
9、出力制御バッファ部と表−一。
キーボード1はカナ等のカナ文字を入力するカナ文ネキ
ー、カナ漢字変換を指示する変換キー等を有する。入力
バッファ部2はキーボード1により入力された入力カナ
文字列の内、カナ漢字変換されていないカナ文字列を一
時的にバッファしておく機能を有する。解析対象文字列
作成部3はキーボード1により入力されたカナ文字列を
解析し、カナ漢字変換された文の後に続く部分カナ文字
列の組を次のカナ漢字変換のために出力する。辞書検索
部4は解析対象文字列作成部3により出力された部分カ
ナ文字列に対応する候補語の表記コード情報、品詞分類
情報等を単語辞書5からすべて抽出し、また、その候補
語の前後に接続する言葉の重みを接続重み行列表6から
抽出して、その候補語を抽出する役割を果す。評価部7
ではその辞書検索部4により抽出、選別された候補語を
たとえば最尤評価法のような評価法により評価し、その
評価値を出力する。
パックトラック起動判定部8は評価部7で評価された第
1番目に評価値の高い第1候補語や直前の解析による第
2番目に評価値の高い第2候補語の評価値について後述
のフローチャートに従って閾値以上かどうかを判定し、
また、場合によって直前の解析による第2位候補語の読
みの長さや品詞は直前の解析による第1位候補語と同じ
かどうかを判定する。その判定結果から、カナ漢字変換
の信頼性が高い場合は出力部10に第1位候補語を出力
し、その信頼性が低い場合、その判定結果を伝達された
パックトラック制御部9は解析対象文字列作成部3に制
御信号を送ってバックトラックを起動させ、カナ文字列
の解析を再度検討して、再びカナ漢字変換させる。
第2図は単語辞書5の内容の一部を模式的に示した図で
、読みと、表記文字と、品詞と、頻度ランク、その他の
情報が蓄積されている。
第3図は、接続重み行列表6の内容の一部を模式的に示
した図で、列には扱、っている言語の品詞を、行にその
言葉の直前の品詞を示し、その行列の交差部の数字が接
続の重みを示す数値である。゛その数値は最大値、たと
えば1.5に近い程、当該打部と当該列部の、品詞+扱
っている言葉の接続関係が強くなる。
第4図はパックトラック起動判定部8の判定を示すフロ
ーチャートである。
キー&−ド1により読み文字であるカナ文字列、「けん
シをこうしします。」が入力されたとする。このカナ文
字列は入カバ、ファ部2によりパツファされる。入力バ
ッファ部2がらそのカナ文字列を入力した解析対象文字
列作成部3は、まず、「けんりを」を解析し、その文頭
の解析については問題なく、「権利を」とカナ漢字変換
され、出力部1oのメモリに蓄積されたとする。
次に、解析対象文字列作成部3にょシ解析された「こう
し」について辞書検索部3は、単語辞書5を検索し、表
記文字の「講師J1その品詞である名詞和語、頻度ラン
ク1.0と、表記文字の「行使」、その品詞でちるす変
名側漢語、頻度ランク0.7を得、接続重み行列表6を
検索し、それらの表記文字の品詞を列に、その言葉の前
にある格助詞「を」を行として、その交差部の数値0.
7を検定し、それらのそれぞれの接続重みである0、7
を抽出する。
評価部7は、評価式、評価値V=(単語の読みの長さ)
+(頻度ランク)+(接続重み)、に従って評価値を演
算する。上記のように既に辞書検索部4により評価値を
演算する係数を抽出しておシ、゛その単語の読みの長さ
は3であるので、評価部7は「講師」についてはv=3
+1.0 +0.7 = 4.7で評価値4.7を演算
し、「行使」についてはV= 3 +0.7 + 0.
7 = 4.4で評価値4.4を演算する。評価値が最
大の第1位候補語と評価値が2番目に大きい第2位候補
語を、それぞれ、カナ文字列をカナ漢字変換した言語の
何番目の単語かを示す情報や評価値と共に辞書検索部4
の第1候補語メモリ領域と第2候補語メモリ領域とにそ
れぞれ格納しておく。
図に示しであるフローチャートの閾値Tl 。
T2にツイテは、それぞれTl = 3.2 、 T2
 = 4.0と経験的に予め決めである。第1候補語の
「講師」の評価値については評価値4.7は閾値T□以
上なのでステ、プ1(sl)、表記文字の「講師」はカ
ナ漢字変換の信頼性が高いものと判断され、第1位候補
語メモリ領域から取出されて、出力部lOのメモリに格
納される。次に、解析対象文j字列作成部3から出方さ
れる、後続文字列「します」の解析にうっシ、その先頭
から辞書検索部4は、上記と同様に、「シ」と「しま」
について単語辞書5を用いた辞書検定と、接続重み行列
表6を用いた接続検定を行ない、その後、評価部7にて
評価演算を行なう。
なお、ここで、す変動詞である「シ」は「講師」に接続
しえないことが、辞書検索部4により接続重み行列表6
を検定してわかったのです変動詞である「シ」について
は除外されている。
「市」についてもまた同様である。
表記文字  単語tDM、+Q度十接続重み=評価値み
の長さ  フラグ 「±J     1   1.2   0.7   2
.9「四J     1    1.5   0.2 
  2.7[死j     1   0.9   0.
7   2.6[島J     2    0.5  
 0.5   3.0「縞J    、2   0.3
   0.5   2.8よって、第1位候補語は評価
値3.0の「島」で、第2位候補語は評価値2.9の「
±」である。
次に、バックドラック起動判定部8で判定を行なりた結
果、「島」の評価値3,0は閾値T1以下なので(Sl
)、次に、直前の解析の第2位候補語の「行使」の判定
が行なわれる(S2)。第2位候補語の「行使」の評価
値は4.4であ)閾値12以上なので、直前の解析によ
る第2位候補語の「行使」の読みの長さと品詞は直前の
解析による第1位候補語の「講師」と同じであるかどう
か判定される(S3)。その第1位候補語の「講師」の
品詞は名詞漢語でその第2位候補語の「行使」の品詞は
す変名側漢語でそれらの品詞は異なるのでバックトラッ
ク処理が開始される。
なおいステラf 2 (S2)やステップ3 (S3)
で直前の解析の第2位候補語の評価値がT2未満だった
)、第1位候補語と第2位候補語の品詞や読みの長さが
同じ場合、バックトラックはかからず通常の解析が進行
する。
バックトラック処理は次の理由から開始される。第1の
理由は第1位候補語のたとえば「島」の評価値が閾値T
1未満で低いということは、第1位候補語は誤解析であ
る確率が高いこと。
第2の理由は直前の解析の第2位候補語のたとえば「行
使」の評価値が閾値12以上と高いということは、それ
が正しい解析である確率が高いことでちる。
バックトラック処理は第1に、バックトラック起動判定
部8よυバックトラック処理しなければならない結果を
得たバックトラック制御部9は通常は0である再解析フ
ラグを1にたてる。
第2に、再解析によって消える可能性のある単語情報を
辞書検索部4は再解析用一時メモリに保存する。第3に
、直前の解析による第2位候補語を辞書検索部4の第2
位候補語メモリ領域から読み出す。第4に、辞書検索部
4はその読み情報により、再解析すべき文字列に関する
情報を割夛出す。第5に、読み出した第2位候補語を出
力部10のメモリに書き込み、先の第1位候補語以降の
情報を出力部10のメモリから消去する。第6に、第4
にて割り出した情報を解析対象文字列作成部3に送る。
第7に辞書検索部4や評f品部7等により再解析が行な
われる。
上記例文に戻って、解析は第2位候補語である「行使」
の妥当性が認識され、「行使」の後のカナ文字列「しま
す。」の先頭から解析対象文字作成部3は順次「シ」と
「しま」を出力し、辞書検索部4は、単語辞書5により
単語検索を行ない、接続重み行列表6により接続重みの
検定を行ない、「シ」、「±」、「四」、「死」、「島
」、「縞」の単語及び接続重み情報等を上記と同様にし
て順次検索する。。
評価部7では前述の評価式にしたがった評価値を演算す
る。
し        1      2.5    .1
.5     5.0士      1     1.
2    0.9    3.1四       1 
    1.5     0.2     2.7死 
     1     0.9    0.5    
2.4島       2     0.5     
0.5     3.0縞      2’     
0.3    0.5    2.8よって、す変動側
である「シ」の評価値が5.0と最大で第1位候補語に
、評価値が3.1と2番目に大きい「±」が第2位候補
語となる。
表記文字「シ」の評価値は5.0と閾値T1 よシ高い
のでバックトラック起動判定部8でカナ漢字変換の信頼
性が高いと評価され、辞書検索部4の第2位候補語メモ
リ領域内の「行使」が取出され出力部10のメモリに格
納されている後に続く言葉として「シ」が出力部1oの
メモリに格納される。よって、バックトラック起動判宇
部8がその判定をした際には、再解析は成功したものと
みなせるので、神ヤ廿再解析フラグを再びOとした後、
通常の解析に戻る。
本実施例の場合、再解析の第1位候補語の「シ」の評価
値が5.0と閾値T1以上なので問題ないが、もし仮に
、第1位候補語の評価値が閾値Tlよυ小さい場合でし
かも再解析フラグ1が立っていた場合、直前の解析語で
ある「行使」の評価値とその第1位候補語の評価値との
和をとシ、バックトラック前の直前の解析の第1位候補
語である「講師」の評価値とバックトラック前の解析の
第1位候補語である「島」の評価値との和とをパックト
ラック起動判定部8で比較判定し、評価値の和の大きい
方を正しい解析とみなして出力部10のメモリを書きか
え、バックトラック制御部9は、再解析フラグをOに戻
して、通常の解析を続行する。
後は「ます。」についての通常の解析が行なわれ、「け
んシをこうしします。」の入力カナ列に対して「権利を
行使します。」の正しいカナ漢字変換が縦型の探索によ
る最尤評価法でも確実に行なうことができた。
効果 本発明によるカナ漢字変換処理方式はこのように解析結
果の信頼性が低い場合、バックトラックを起動させるこ
とができ、縦型探索法の欠点だった1誤解析の連続を軽
減し、信頼性の高いカナ漢字変換を達成することができ
る。
上記実施例ではバックトラック起動判定部での判別条件
として評価値をパラメータとしたものを用いているが、
これに限ることはなく、たとえば、単語の読みの長さと
品詞によって、読みが1字の名詞が選択された時にはバ
ックトラックを起動するように判別条件を設定すること
も可能である。
このとき、再解析が成功したがどうかの判別も読み1字
の名詞以外の単語が新たに選択されたかどうかにより行
なわれることは言うまでもない。要するに、バックトラ
ックを強制的にかけるための判別条件が設けられればよ
いことは勿論である。
【図面の簡単な説明】
第1図は、本発明を日本語ワードプロセッサに適用した
一実施例を概念的に示す機能ブロック図、 第2図は第1図に示した単語辞書の内容の一部を示す模
式図、 第3図は第1図に示した接続重み行列表の内容の一部を
示す模式図、 第4図は第1図に示したパックトラック起動判定部のフ
ローを示す図である。 主要部分の符号の説明 1・・・キーボード 4・・・辞書検索部 5・・・単語辞書 6・・・接続重み行列表 7・・・評価部 8・・・パックトラック起動判定部 9・・・バックトラック制御部 第1図 第2図 第3図

Claims (1)

    【特許請求の範囲】
  1. 入力されたカナ文字列のある位置から始まる部分カナ文
    字列に対して辞書検索を行ない、該辞書検索により得ら
    れた少なくとも1つの単語に対し所定の評価を行ない、
    該評価にもとづいて最適な単語を選択し、該単語に対応
    する上記部分カナ文字列の後に続く部分カナ文字列に対
    して上記の解析処理をサイクル的に行なってカナ漢字変
    換を行なうカナ漢字変換方式において、選択された単語
    の信頼性を判別する信頼性判別手段を有し、該信頼性判
    別手段により、選択された単語の信頼性が低く、上記単
    語の選択の直前の解析で選択された最適な単語の次に最
    適な単語の信頼性が比較的高いと判別された場合、該判
    別結果によって再解析を起動させることを特徴とするカ
    ナ漢字変換方式。
JP59168830A 1984-08-14 1984-08-14 カナ漢字変換方式 Pending JPS6148063A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP59168830A JPS6148063A (ja) 1984-08-14 1984-08-14 カナ漢字変換方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP59168830A JPS6148063A (ja) 1984-08-14 1984-08-14 カナ漢字変換方式

Publications (1)

Publication Number Publication Date
JPS6148063A true JPS6148063A (ja) 1986-03-08

Family

ID=15875308

Family Applications (1)

Application Number Title Priority Date Filing Date
JP59168830A Pending JPS6148063A (ja) 1984-08-14 1984-08-14 カナ漢字変換方式

Country Status (1)

Country Link
JP (1) JPS6148063A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6345676A (ja) * 1986-08-13 1988-02-26 Hitachi Ltd 仮名漢字変換装置

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6345676A (ja) * 1986-08-13 1988-02-26 Hitachi Ltd 仮名漢字変換装置

Similar Documents

Publication Publication Date Title
EP0971294A2 (en) Method and apparatus for automated search and retrieval processing
JPH10326275A (ja) 形態素解析方法および装置、並びに日本語形態素解析方法および装置
KR20040101678A (ko) 복합 형태소 분석 장치 및 방법
JP2002149643A (ja) 日本語の表意文字の読み方を予測する方法
JP3952964B2 (ja) 読み情報決定方法及び装置及びプログラム
JPH11338498A (ja) 音声合成装置
EP0553745A2 (en) Character recognition apparatus
JPS62251986A (ja) 誤読文字訂正処理装置
JP3084864B2 (ja) 文章入力装置
JP4318223B2 (ja) 文書校正装置およびプログラム記憶媒体
JPH049320B2 (ja)
JPH0630100B2 (ja) 仮名漢字変換方式
JP2995717B2 (ja) 形態素解析方法およびその装置
JPS62284480A (ja) 文字認識後処理方式
JPS61184677A (ja) カナ漢字変換方式
JPS62285189A (ja) 文字認識後処理方式
CN118675530A (zh) 跨语言文本中实体语义识别处理方法、系统及存储介质
JPS61184682A (ja) 仮名漢字変換装置
JPH06149872A (ja) 文章入力装置
JPH09134353A (ja) 文書処理装置の仮名漢字変換方法
JPH06301718A (ja) 文書解析方法および装置
JPS62284481A (ja) 文字認識後処理方式
JPH0757059A (ja) 文字認識装置
JPH0546612A (ja) 文章誤り検出装置
JPH06289890A (ja) 自然言語処理装置