JPS589968B2 - カナ漢字変換装置 - Google Patents
カナ漢字変換装置Info
- Publication number
- JPS589968B2 JPS589968B2 JP54092271A JP9227179A JPS589968B2 JP S589968 B2 JPS589968 B2 JP S589968B2 JP 54092271 A JP54092271 A JP 54092271A JP 9227179 A JP9227179 A JP 9227179A JP S589968 B2 JPS589968 B2 JP S589968B2
- Authority
- JP
- Japan
- Prior art keywords
- word
- kana
- words
- stack
- dictionary
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired
Links
Landscapes
- Machine Translation (AREA)
- Document Processing Apparatus (AREA)
Description
【発明の詳細な説明】
本発明はカナ漢字変換装置に関し、特に、入力としてロ
ーマ字あるいはカナによる分ち書きあるいはベタ書きの
文を受けつけ、最尤評価法により単語(自立語、付属語
などの辞書的形態素)を抽出し、その単語に対応した漢
字コードに変換し、漢字カナ混り文を出力するカナ漢字
変換装置に関する。
ーマ字あるいはカナによる分ち書きあるいはベタ書きの
文を受けつけ、最尤評価法により単語(自立語、付属語
などの辞書的形態素)を抽出し、その単語に対応した漢
字コードに変換し、漢字カナ混り文を出力するカナ漢字
変換装置に関する。
最近、カナ文字もしくはローマ字で入力された文章を漢
字まじりの文章に変換することが盛んに研究されている
。
字まじりの文章に変換することが盛んに研究されている
。
そして変換方式として、従来一般に最長一致法が用いら
れてきた。
れてきた。
第1図は従来の最長一致法を説明する図である。
まず、入力カナ文字列a1 、a2.a3.…a、が与
えられると、単語辞書を検索する。
えられると、単語辞書を検索する。
単語辞書にはカタカナ表記の単語を見出しとして、これ
に対応する漢字もしくは平カナ、および単語の文法的性
質が記入されている。
に対応する漢字もしくは平カナ、および単語の文法的性
質が記入されている。
例えば、「セイフ」という見出しがついた欄には「政府
」という漢字と、「政府」という単語が名詞であること
が記入されている。
」という漢字と、「政府」という単語が名詞であること
が記入されている。
また、「ヨツ」という見出しのついた欄には「寄つ」と
いう漢字まじゆの単語と、これがう行五段活用の動詞の
連用形であることが記入されている。
いう漢字まじゆの単語と、これがう行五段活用の動詞の
連用形であることが記入されている。
まず、入力カナ文字列a0.a2.a3.…aoと単語
辞書の内容を比較し、カナ文字列の始端から任意の長さ
の入力カナ列と整合(マツチング)する読みを有する単
語W1(al、a2.a3)、w2(al。
辞書の内容を比較し、カナ文字列の始端から任意の長さ
の入力カナ列と整合(マツチング)する読みを有する単
語W1(al、a2.a3)、w2(al。
a2)、W3(al、a2)、……、Wm(al)を選
択すべき単語の候補とし、その中で最もカナ文字列の長
いもの、第1図の例ではwlを選択する。
択すべき単語の候補とし、その中で最もカナ文字列の長
いもの、第1図の例ではwlを選択する。
次に、残されたカナ文字列a4 、 a5 +…、an
について同様に単語辞書の内容との比較を行ない、最も
カナ文字列の長いものに対応する単語を選択する。
について同様に単語辞書の内容との比較を行ない、最も
カナ文字列の長いものに対応する単語を選択する。
以下同様である。第2図は最長一致法を使用した従来の
カナ漢字変換探索方法の一例を説明するものである。
カナ漢字変換探索方法の一例を説明するものである。
この例は、「セイフノモウシデニョツテ」というカタカ
ナ文字列を漢字まじりの平カナに変換する場合を説明す
るものである。
ナ文字列を漢字まじりの平カナに変換する場合を説明す
るものである。
第2図において、■は名詞、Oは付属語、[相]は動詞
を示している。
を示している。
先ず、「セイフノモウシデニョツテ」という文章と単語
辞書メモリとが最長一致法で比較される。
辞書メモリとが最長一致法で比較される。
最初は一致しないので、次に一字減した「セイフノモウ
シデニョッ」と単語辞書メモリの内容との一致を取る。
シデニョッ」と単語辞書メモリの内容との一致を取る。
このようにして「セイフ」まで来ると、一致するので「
政府」という漢字が得られる。
政府」という漢字が得られる。
「政府」という漢字が得られた後、残りのカタカナ文字
列と単語辞書メモリとを最長一致法で比較する。
列と単語辞書メモリとを最長一致法で比較する。
このような変換探索を繰返して行った結果「政府のも牛
で荷寄って」という文章が得られたと仮定する。
で荷寄って」という文章が得られたと仮定する。
日本語文法では、「荷」という名詞の次に「寄って」と
いう動詞が来ることは無いので、「荷寄って」という接
続は誤りであることが判る。
いう動詞が来ることは無いので、「荷寄って」という接
続は誤りであることが判る。
そこで、「荷」の代りに数詞「二」を選択し直したとす
ると、この場合も誤りである。
ると、この場合も誤りである。
複数回の試行を行った結果、「によって」が得られたと
仮定する。
仮定する。
ところが「で」は助詞と解しているので「で」という助
詞の次に、「に」という助詞が来ることは有り得ない。
詞の次に、「に」という助詞が来ることは有り得ない。
このような文法チェックおよび変換探索を複数回行うこ
とによって、「政府の申し出によって」という正しい漢
字まじりの平カナ文を得ることが出来る。
とによって、「政府の申し出によって」という正しい漢
字まじりの平カナ文を得ることが出来る。
ここで第2図の変換過程についてみると、「政府」とい
う漢字を得た後、付属語の「のも」を選択したために、
相当回数の試行を無駄に繰返していることがわかる。
う漢字を得た後、付属語の「のも」を選択したために、
相当回数の試行を無駄に繰返していることがわかる。
これは最長一致法のために、付属語の「の」よりも「の
も」の方が優先順位が高くなっているためである。
も」の方が優先順位が高くなっているためである。
ところが一般的に、付属語の「の」の方が「のも」より
はるかに使用頻度が犬であり、「政府のも」という使用
方法よりも「政府の」という使用方法の方が出現確率が
高いと考えられる。
はるかに使用頻度が犬であり、「政府のも」という使用
方法よりも「政府の」という使用方法の方が出現確率が
高いと考えられる。
そのため、「政府」という名詞を選択した後付属語の「
のも」の代りに、先に、付属語の「の」を選択できれば
カナ漢字変換速度を向上することが可能となる。
のも」の代りに、先に、付属語の「の」を選択できれば
カナ漢字変換速度を向上することが可能となる。
本発記は上記考察にもとづくものであり、単語の読みの
長さはかりでなく、その使用頻度をも考慮に入れて単語
を決定することによりカナ漢字変換を効率的に行なうこ
とを目的とし、そのため本発明によるカナ漢字変換装置
は、カナに対応した単語および該単語の使用頻度が記入
された単語辞書メモリと、入力されたカナ列の始端から
任意の長さの入力カナ列と整合する読みを有する単語を
上記辞書から検索する辞書検索手段と、上記検索された
単語とそれ以前に検索され決定された単語との接続性を
検定する接続性検定手段と、該接続性検定手段により接
続性が確認された箪語を保持するスタックと、該スタッ
ク中の各々の単語について読みの長さと使用頻度にもと
づき最尤評価を行ない最尤評価の最も高い鵬語を決定す
る最尤評価手段とをそなえることを特徴とする。
長さはかりでなく、その使用頻度をも考慮に入れて単語
を決定することによりカナ漢字変換を効率的に行なうこ
とを目的とし、そのため本発明によるカナ漢字変換装置
は、カナに対応した単語および該単語の使用頻度が記入
された単語辞書メモリと、入力されたカナ列の始端から
任意の長さの入力カナ列と整合する読みを有する単語を
上記辞書から検索する辞書検索手段と、上記検索された
単語とそれ以前に検索され決定された単語との接続性を
検定する接続性検定手段と、該接続性検定手段により接
続性が確認された箪語を保持するスタックと、該スタッ
ク中の各々の単語について読みの長さと使用頻度にもと
づき最尤評価を行ない最尤評価の最も高い鵬語を決定す
る最尤評価手段とをそなえることを特徴とする。
以下、図面により本発明を説明する。
第3図は本発明において使用される最尤評価法を説明す
る図である。
る図である。
第3図に示す単語辞書には、第1図図示の従来例の単語
辞書の内容に加えて各単語毎に使用頻度情報が記入され
ている。
辞書の内容に加えて各単語毎に使用頻度情報が記入され
ている。
まず、入力カナ文字列のal 、 C2) C3、・・
・先と単語辞書の内容を比較し、カナ文字列の始端から
任意の長さの入力カナ列と整合(マツチング)する読み
を有する単語W’(al 、C2g C3)、w2(a
l、C2)、w3(at+a2)s・・・1wm(al
)を選択すべき単語の候補とする。
・先と単語辞書の内容を比較し、カナ文字列の始端から
任意の長さの入力カナ列と整合(マツチング)する読み
を有する単語W’(al 、C2g C3)、w2(a
l、C2)、w3(at+a2)s・・・1wm(al
)を選択すべき単語の候補とする。
次に、各候補単語について、読みの長さと使用頻度情報
にもとづき評価値C1、C2、C3,・・・。
にもとづき評価値C1、C2、C3,・・・。
cmを求める。
そして、最も大きい評価値を有する単語を選択する。
第3図の例では、C2が最大値を有するので単語w2が
選択され、残りのカナ文字列a3 、 C4、・・・t
a、が次の単語解析のために使用される。
選択され、残りのカナ文字列a3 、 C4、・・・t
a、が次の単語解析のために使用される。
ここで、単語の読みの長さをli、使用頻度(例えば過
去の使用回数)をhiとすると、評価値ciは、一例と
して、 C1−hi×32ti の形で求められる。
去の使用回数)をhiとすると、評価値ciは、一例と
して、 C1−hi×32ti の形で求められる。
この例では、使用頻度の32倍の違いは、カナ1字の読
みの長さの違いに相当している。
みの長さの違いに相当している。
すなわち、読みの長さがカナ1字分だけ短かくても、使
用頻度が32倍以上犬であれば使用頻度の大きい方の単
語が選択されることを示している。
用頻度が32倍以上犬であれば使用頻度の大きい方の単
語が選択されることを示している。
ここで評価値とは当該単語が使用される可能性を比較
評価し得る値であれば他の値であってもよい。
評価し得る値であれば他の値であってもよい。
第4図は本発明による実施例のカナ漢字変換装置のブロ
ック図である。
ック図である。
第4図において、1は入力カナバッファ、2は単語辞書
メモリ、3は辞書検索装置、4は接続性検定装置、5は
整合単語スタック、6は単語バッファ、6−1は読みと
漢字情報を保持する部分、6−2は単語の読みの長さを
示す情報を保持する部分、6−3は単語の頻度情報を保
持する部分、7は評価値算出回路、8は単語・評価値ス
タック、8−1は読みと漢字情報を保持する部分、8−
2は評価筺ヲ保持する部分、9はソーティング回路、1
0は優先順スタックである。
メモリ、3は辞書検索装置、4は接続性検定装置、5は
整合単語スタック、6は単語バッファ、6−1は読みと
漢字情報を保持する部分、6−2は単語の読みの長さを
示す情報を保持する部分、6−3は単語の頻度情報を保
持する部分、7は評価値算出回路、8は単語・評価値ス
タック、8−1は読みと漢字情報を保持する部分、8−
2は評価筺ヲ保持する部分、9はソーティング回路、1
0は優先順スタックである。
第4図の動作は次の通りである。
まず、入力カナ列al 、 a2 、 a3.・・・、
anが入力カナバッファ1に入れられる。
anが入力カナバッファ1に入れられる。
次に、辞書検索装置3は単語辞書メモリ2の内容を検索
し、入力カナバッファ1中のカナ文字列の始端から任意
の長さのカナ文字列と整合する読みを有する単語をすべ
て選択する。
し、入力カナバッファ1中のカナ文字列の始端から任意
の長さのカナ文字列と整合する読みを有する単語をすべ
て選択する。
辞書検索装置3で選択された単語は接続性検定装置4へ
送られる。
送られる。
接続性検定装置4(詳細動作は特願昭54−92270
号明細書参照)は、辞書検索装置3から送られてきた単
語が入力カナ文字列の先頭部分の読みに対応するもので
あれば該単語をそのまま整合単語スタック5に入れる。
号明細書参照)は、辞書検索装置3から送られてきた単
語が入力カナ文字列の先頭部分の読みに対応するもので
あれば該単語をそのまま整合単語スタック5に入れる。
また、辞書検索装置3から送られてきた単語が入力カナ
文字列の先頭部分の読みに対応するものではなく、既に
検索されカナ漢字変換の確定された単語に引続く単語で
ある場合には、接続性検定装置4は辞書検索装置3から
送られてきた単語について直前の確定単語との文法的な
接続性の可否についてチェックを行ない、可のもののみ
を整合単語スタック5に入れる。
文字列の先頭部分の読みに対応するものではなく、既に
検索されカナ漢字変換の確定された単語に引続く単語で
ある場合には、接続性検定装置4は辞書検索装置3から
送られてきた単語について直前の確定単語との文法的な
接続性の可否についてチェックを行ない、可のもののみ
を整合単語スタック5に入れる。
なお、第4図においてはカナ漢字変換の確定した単語を
保持するバッファの図示を省略している。
保持するバッファの図示を省略している。
次に、整合単語スタック5内の単語は1語づつ単語バッ
ファ6に移送される。
ファ6に移送される。
単語バッファの6−2の部分には単語の長さ情報が、6
−3部分には単語の頻度情報がそれぞれ保持されており
、これらを評価値算出回路7に入力し、前述したような
算式を使用して評価値を求め、単語・評価値スタック8
の8−2の部分に入れる。
−3部分には単語の頻度情報がそれぞれ保持されており
、これらを評価値算出回路7に入力し、前述したような
算式を使用して評価値を求め、単語・評価値スタック8
の8−2の部分に入れる。
単語バッファ6の6−1の部分には、単語の読みと漢字
情報が保持されており、これらはそのまま単語・評価値
スタック8の8−1の部分に入力される。
情報が保持されており、これらはそのまま単語・評価値
スタック8の8−1の部分に入力される。
このようにして、整合単語スタック5内のすべての単語
について評価値を求め、単語・評価値スタック8に単語
および評価値を保持した後、ソーティング回路9により
単語・評価値スタック8内の単語を評価値順に取出し、
優先順スタック10に転送する。
について評価値を求め、単語・評価値スタック8に単語
および評価値を保持した後、ソーティング回路9により
単語・評価値スタック8内の単語を評価値順に取出し、
優先順スタック10に転送する。
そして、優先順スタック10内の最も優先順位の高い、
すなわち最も評価値の高い単語を取出して図示しない確
定単語格納用バッファに入れる。
すなわち最も評価値の高い単語を取出して図示しない確
定単語格納用バッファに入れる。
このようにして、1つの単語を確定した後、入力カナバ
ッファ1内の入力カナ文字列について、その確定した単
語に和尚するカナ文字だけシフトして入力カナバッファ
1から追い出す。
ッファ1内の入力カナ文字列について、その確定した単
語に和尚するカナ文字だけシフトして入力カナバッファ
1から追い出す。
そして、入力カナバッファ1に保持されている残りの未
確定カナ文字列について上記と同様な処理を繰返して行
なっていき、漢字まじり文を作成する。
確定カナ文字列について上記と同様な処理を繰返して行
なっていき、漢字まじり文を作成する。
なお、上記実施例では、最尤評価値を有する単語を求め
るために、整合単語スタック5内のすべての単語の評価
値を求めいったん単語・評価値スタック8に入れるよう
にしているが、これに限らず、例えば、単語バッファ6
を2つもうけ、整合単語スタック5内の単語を1つづつ
取出して2つの単語間で順次、比較を行ない評価値の大
きい方の単語を決められた一方のバッファに保持するよ
うにして、最尤単語を求めるようにしてもよい。
るために、整合単語スタック5内のすべての単語の評価
値を求めいったん単語・評価値スタック8に入れるよう
にしているが、これに限らず、例えば、単語バッファ6
を2つもうけ、整合単語スタック5内の単語を1つづつ
取出して2つの単語間で順次、比較を行ない評価値の大
きい方の単語を決められた一方のバッファに保持するよ
うにして、最尤単語を求めるようにしてもよい。
また、実施例11における辞書検索装置、接続性検定装
置、評価値算出回路等は汎用の処理装置および記憶装置
を使用することによっても実現できることはいうまでも
ない。
置、評価値算出回路等は汎用の処理装置および記憶装置
を使用することによっても実現できることはいうまでも
ない。
上記したように本発明によれば、カナを漢字に変換する
に際して単語の読みの長さとともに使用頻度をも考慮に
入れて単語を決定するようにしたので、従来の単純な最
長一致法よりも効率的にカナ漢字変換を行なうことがで
きる。
に際して単語の読みの長さとともに使用頻度をも考慮に
入れて単語を決定するようにしたので、従来の単純な最
長一致法よりも効率的にカナ漢字変換を行なうことがで
きる。
第1図は従来の最長一致法を説明する図、第2図は最長
一致法を使用したカナ漢字変換探索方法の一例、第3図
は本発明において使用される最尤評価法を説明する図、
第4図は本発明による実施例のカナ漢字変換装置のブロ
ック図である。 第4図において、1は入力バッファ、2は単語辞書メモ
リ、3は辞書検索装置、4は接続性検定装置、5は整合
単語スタック、6は単語バッファ、7は評価値算出回路
、8は単語・評価値スタック、9はソーティング回路、
10は優先順スタックである。
一致法を使用したカナ漢字変換探索方法の一例、第3図
は本発明において使用される最尤評価法を説明する図、
第4図は本発明による実施例のカナ漢字変換装置のブロ
ック図である。 第4図において、1は入力バッファ、2は単語辞書メモ
リ、3は辞書検索装置、4は接続性検定装置、5は整合
単語スタック、6は単語バッファ、7は評価値算出回路
、8は単語・評価値スタック、9はソーティング回路、
10は優先順スタックである。
Claims (1)
- 1 カナに対応した単語および該単語の使用頻度が記入
された単語辞書メモリと、入力されたカナ列の始端から
任意の長さの入力カナ列と整合する読みを有する単語を
上記辞書から検索する辞書検索手段と、上記検索された
単語とそれ以前に検索され決定された単語との接続性全
検定する接続性検定手段と、該接続性検定手段により接
続性が確認された単語を保持するスタックと、該スタッ
ク中の各々の単語について読みの長さと使用頻度にもと
すき最尤評価を行い最尤評価の最も高い単語を決定する
最尤評価手段とを備えることを特徴とするカナ漢字変換
装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP54092271A JPS589968B2 (ja) | 1979-07-20 | 1979-07-20 | カナ漢字変換装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP54092271A JPS589968B2 (ja) | 1979-07-20 | 1979-07-20 | カナ漢字変換装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS5617468A JPS5617468A (en) | 1981-02-19 |
| JPS589968B2 true JPS589968B2 (ja) | 1983-02-23 |
Family
ID=14049724
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP54092271A Expired JPS589968B2 (ja) | 1979-07-20 | 1979-07-20 | カナ漢字変換装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS589968B2 (ja) |
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6392073U (ja) * | 1986-12-05 | 1988-06-14 | ||
| JPH02163460A (ja) * | 1988-12-16 | 1990-06-22 | Nippondenso Co Ltd | 電磁式燃料噴射弁 |
| JPH0444473U (ja) * | 1990-08-13 | 1992-04-15 |
Families Citing this family (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS5790781A (en) * | 1980-11-27 | 1982-06-05 | Canon Inc | Character processor |
| JPS57141775A (en) * | 1981-02-25 | 1982-09-02 | Nec Corp | Kana(japanese syllables) kanji(japanese characters) converter |
| JPS5855995A (ja) * | 1981-09-29 | 1983-04-02 | 富士通株式会社 | 音声認識システム |
| JPS5990167A (ja) * | 1982-11-12 | 1984-05-24 | Fujitsu Ltd | 文章解析装置 |
| JPS59116469A (ja) * | 1982-12-21 | 1984-07-05 | 旭化成株式会社 | 炭素繊維の表面処理法 |
| JPS6140672A (ja) * | 1984-07-31 | 1986-02-26 | Hitachi Ltd | 多品詞解消処理方式 |
| JPH0850589A (ja) * | 1995-06-26 | 1996-02-20 | Hitachi Ltd | 仮名漢字変換方法及び装置 |
-
1979
- 1979-07-20 JP JP54092271A patent/JPS589968B2/ja not_active Expired
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS6392073U (ja) * | 1986-12-05 | 1988-06-14 | ||
| JPH02163460A (ja) * | 1988-12-16 | 1990-06-22 | Nippondenso Co Ltd | 電磁式燃料噴射弁 |
| JPH0444473U (ja) * | 1990-08-13 | 1992-04-15 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPS5617468A (en) | 1981-02-19 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5541836A (en) | Word disambiguation apparatus and methods | |
| JPH0351020B2 (ja) | ||
| JP2595934B2 (ja) | 仮名漢字変換処理装置 | |
| JPS58127231A (ja) | 漢字仮名変換装置 | |
| JPH10198676A (ja) | 日本語形態素解析装置及び日本語形態素解析方法 | |
| JPS6282466A (ja) | 辞書検索装置 | |
| Cowie | CRL’s Approach to MET | |
| JP3091540B2 (ja) | 日本語文の形態素解析方式 | |
| JP2537991B2 (ja) | 文字入力装置および方法 | |
| JPS603017A (ja) | カナ漢字変換処理装置 | |
| JP2895137B2 (ja) | 日本文誤り自動検出および訂正装置 | |
| JPH0695330B2 (ja) | 文書作成装置 | |
| JPS61282966A (ja) | 仮名漢字変換方式 | |
| JPH08329081A (ja) | 機械翻訳方法及び機械翻訳装置 | |
| JP2001125907A (ja) | 辞書検索方法、装置、および辞書検索プログラムを記録した記録媒体 | |
| JPS6175467A (ja) | 仮名漢字変換方式 | |
| JPH05324714A (ja) | 翻訳処理機における定型文処理装置 | |
| JPH04365166A (ja) | 文章検査装置 | |
| JPS6039228A (ja) | カナ漢字変換処理装置 | |
| JPH02105968A (ja) | 日本文誤り自動検定・訂正方式 | |
| JPS59197929A (ja) | カナ漢字変換処理装置 | |
| JPS5835306B2 (ja) | 単語情報検索出力装置 | |
| JPH0581314A (ja) | 係り受け関係判定方式 | |
| Park et al. | Eliminating Implausible Korean Morphological Interpretations by Using History of Previous Analysis and Lexical Association | |
| JPS5972495A (ja) | 文字音韻変換装置 |