JPH08180050A - 難読漢字検索装置 - Google Patents

難読漢字検索装置

Info

Publication number
JPH08180050A
JPH08180050A JP6320119A JP32011994A JPH08180050A JP H08180050 A JPH08180050 A JP H08180050A JP 6320119 A JP6320119 A JP 6320119A JP 32011994 A JP32011994 A JP 32011994A JP H08180050 A JPH08180050 A JP H08180050A
Authority
JP
Japan
Prior art keywords
kanji
pattern
radical
strokes
patterns
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP6320119A
Other languages
English (en)
Other versions
JP3233803B2 (ja
Inventor
Kayoko Kawada
かよ子 川田
Toshiharu Okeya
俊治 尾毛谷
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Mitsubishi Heavy Industries Ltd
Original Assignee
Mitsubishi Heavy Industries Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Mitsubishi Heavy Industries Ltd filed Critical Mitsubishi Heavy Industries Ltd
Priority to JP32011994A priority Critical patent/JP3233803B2/ja
Publication of JPH08180050A publication Critical patent/JPH08180050A/ja
Application granted granted Critical
Publication of JP3233803B2 publication Critical patent/JP3233803B2/ja
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Landscapes

  • Document Processing Apparatus (AREA)

Abstract

(57)【要約】 【目的】 短時間で難読漢字の検索が可能な難読漢字検
索装置を提供する。 【構成】 総画数型辞書15には、部首を含む漢字が
「\」,「―」,「|」,「/」の4種類のパターンに
分類されて予め記憶され、部首別型辞書16には、漢字
が部首別に分類されて部首以外の部分が上記4種類のパ
ターンにより予め記憶される。検索モード選択装置11
は、総画数モード又は部首モードの二つの検索モードを
選択する。パターン入力装置12は、検索する各漢字の
部首及び部首以外の部分の最初のN画の各画の最初の書
き出し線を上記4種類に分類したパターンで入力する。
パターン検索装置14は、総画数型辞書15及び部首別
型辞書16を参照してパターンによる漢字検索を行な
い、その検索結果を候補漢字出力装置17へ出力する。
候補漢字出力装置17は、パターン検索装置14で検索
された漢字の中から正解確率の高い漢字を選択して画面
上に表示する。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】ワードプロセッサ等での漢字入力
において、読みが不明な漢字(難読漢字)を検索する難
読漢字検索装置に関する。
【0002】
【従来の技術】従来、ワードプロセッサ等による文書作
成処理において、読みの不明な漢字、つまり、難読漢字
を検索する場合、 (1)総画数 (2)部首と部首以外の画数 の何れかの方式により漢字コード表から漢字検索を行な
っている。即ち、従来では、画数による方式を用いて難
読漢字の検索を行なっている。
【0003】
【発明が解決しようとする課題】しかし、上記画数方式
による難読漢字の検索には、次のような問題がある。 (1)難読漢字の大半は画数が多く、正確な画数の把握
には時間がかかる。一般に10画以上の正答率は特に低
い。
【0004】(2)難読漢字は、一般的に当用漢字以外
であるので、旧字体が多く正確に画数を把握し難い場合
がある。 (3)漢字の画数は大部分が5画〜20画であり、十数
通りの区分けしかできない。このため同一画数に存在す
る漢字の個数は多く、画数を間違えた場合、検索に時間
を要する。
【0005】(4)漢字文化圏(中国、朝鮮、日本、N
IES等)において、細部にわたり字体が異なるため、
画数を間違える場合が多い。近年、漢字文化圏の経済力
の急成長により、交流が急速に深まりつつある。このよ
うな環境において、相互の固有名詞(地名、人名など)
は翻訳不能のため、原字のまま表現することになるが、
この種の漢字には難読なものが多い。本発明は上記実情
に鑑みてなされたもので、短時間で難読漢字の検索が可
能な難読漢字検索装置を提供することを目的とする。
【0006】
【課題を解決するための手段】本発明に係る難読漢字検
索装置は、各漢字部首及び部首以外の部分の最初のN画
(Nは所望の自然数)の各画の最初の書き出し線を
「\」,「―」,「|」,「/」の4種類にパターン分
けして記憶する記憶手段と、検索対象漢字の部首及び部
首以外の部分のN画分の各画の最初の書き出し線を
「\」,「―」,「|」,「/」の4種類にパターン分
けしたときの、同部首及び部首以外の部分のN画分のパ
ターンを取り込む手段と、同手段により取り込んだ部首
及び部首以外の部分のN画分のパターンと上記記憶手段
のデータとをパターン検索し、検索対象漢字のデータを
抽出する手段とを有することを特徴とする。
【0007】
【作用】上記記憶手段には、各漢字部首及び部首以外の
部分の最初のN画(Nは所望の自然数)の各画の最初の
書き出し線を「\」,「―」,「|」,「/」の4種類
にパターン分けして記憶する。そして、難読漢字を検索
する際、検索する各漢字の部首及び部首以外の部分の最
初のN画の各画の最初の書き出し線を上記4種類に分類
したパターンで入力する。そして、この入力されたパタ
ーンに基づいて上記記憶手段を参照して漢字検索を行な
い、その検索結果を候補漢字として画面上に表示する。
【0008】上記のように各漢字部首及び部首以外の部
分の最初のN画の各画の最初の書き出し線を4種類にパ
ターン分けして記憶手段に記憶し、入力されたN画分の
パターンに基づいて検索することにより、漢字の読みを
知らなくても4種類のパターンの組み合わせ入力によっ
て短時間で所望の漢字を検索することができる。
【0009】
【実施例】以下、図面を参照して本発明の一実施例を説
明する。図1はワードプロセッサ等の漢字入力装置にお
ける難読漢字検索装置部分の機能的な構成を示したもの
である。
【0010】図1において、11は検索モード選択装置
で、総画数モードあるいは部首モードの二つの検索モー
ドを選択するようになっている。12はパターン入力装
置で、検索する各漢字の部首及び部首以外の部分の最初
のN画(Nは所望の自然数)の各画の最初の書き出し線
を「\」,「―」,「|」,「/」の4種類に分類した
パターンを入力する。この場合、総画数モードの場合
は、部首を含むN画のパターンを入力し、部首モードの
場合は部首指定を行なった後、部首以外の部分の最初の
N画のパターンを入力する。上記4種類のパターンは、
JISキーボードが一般的に備えている「\」,
「―」,「|」,「/」のキーを利用するが、パターン
入力用キーとして別個に設けても良い。
【0011】13は概略画数入力装置で、検索文字の概
略画数を例えば小画数(10画以下)、中画数(8〜1
6画)、大画数(14画以上)に分けて入力する。この
画数の分類に際しては、数画程度オーバーラップさせた
方が良い。なお、この概略画数入力装置13は、補助的
に用いられるものであるので、省略することが可能であ
る。
【0012】14はパターン検索装置で、総画数型辞書
15及び部首別型辞書16を参照してパターンによる漢
字検索を行なう。上記総画数型辞書15には、部首を含
む漢字が「\」,「―」,「|」,「/」の4種類のパ
ターンに分類されて予め記憶されている。また、部首別
型辞書16には、漢字が部首別に分類され、部首以外の
部分が「\」,「―」,「|」,「/」の4種類のパタ
ーンに分類されて予め記憶されている。この総画数型辞
書15及び部首別型辞書16を作成するパターン辞書作
成装置については、詳細を後述する。
【0013】17は候補漢字出力装置で、上記パターン
検索装置14で検索された漢字の中から正解確率の高い
漢字を選択する。この候補漢字出力装置17で選択され
た候補漢字は、抽出結果判定入力装置18へ送られて画
面上に表示される。この画面表示された候補漢字に対し
て操作者は、その成否を入力する。この入力に基づいて
判断部19が候補漢字が正しいか誤っているかを判断
し、候補漢字が誤っている場合には、パターン再入力装
置20でパターンを再入力するか、パターン追加入力装
置21でパターンを追加入力し、パターン検索装置14
へ送る。パターン検索装置14は、そのパターンに基づ
いてパターン検索を再度実行する。そして、正しい候補
漢字が抽出されることにより、漢字検索を終了する。
【0014】図2は、上記総画数型辞書15及び部首別
型辞書16を作成するパターン辞書作成装置30の概略
構成を示すブロック図である。パターン辞書作成装置3
0は、漢字の方向コード化装置31、総画数型パターン
抽出装置32、部首別型パターン抽出装置33、パター
ン分類装置34からなっている。上記漢字の方向コード
化装置31は、各対象漢字について、その筆順に従って
その書き方(一画相当)を、(1)「\」,(2)
「―」,(3)「|」,(4)「/」の4種類にパター
ン化する。即ち、各対象漢字を筆順に従って一画毎に上
記の4種類、つまり、(1)「右下斜めの線」、(2)
「横線」、(3)「縦線」、(4)「左下斜めの線」に
パターン化する。
【0015】例えば「幅」という漢字の場合、部首の
「巾」は筆順で「縦」、「横」、「縦」、つまり、
「|」,「―」,「|」のパターンとなる。また、部首
以外の部分では、同様にして、筆順に従って「―」,
「|」,「―」,「―」,「|」,…のパターンとな
る。その他の漢字についても同様にして4種類のパター
ンを用いてコード化する。
【0016】そして、総画数型パターン抽出装置32で
は、漢字の方向コード化装置31でコード化された漢字
について、部首を含んで最初のN画、例えば5画分のパ
ターンを抽出する。例えば上記「幅」という漢字の場合
は、「|」,「―」,「|」,「―」,「|」というパ
ターンの組み合わせになる。
【0017】また、部首別型パターン抽出装置33で
は、漢字の方向コード化装置31でコード化された漢字
について、部首以外の部分で最初のN画、例えば5画分
のパターンを抽出する。例えば上記「幅」という漢字の
場合は、「―」,「|」,「―」,「―」,「|」とい
うパターンの組み合わせになる。
【0018】そして、パターン分類装置34は、上記総
画数型パターン抽出装置32で抽出されたパターンを分
類して総画数型辞書15を作成すると共に、部首別型パ
ターン抽出装置33で抽出されたパターンを部首別に分
類して部首別型辞書16を作成する。
【0019】図1に示した難読漢字検索装置は、上記の
ようにして作成された総画数型辞書15及び部首別型辞
書16を用いて難読漢字の検索処理を行なう。以下、こ
の難読漢字検索装置の検索動作について図3に示すフロ
ーチャートを参照して説明する。
【0020】まず、文書作成の画面上において、検索モ
ード選択装置11の機能を用いて難読漢字検索モードを
指定する(ステップA1)。検索モード選択装置11
は、難読漢字検索モードが指定されると、次に「総画数
モード」又は「部首別モード」を選択するための画面を
表示する(ステップA2)。今、ここで「総画数モー
ド」を指定したとすると、パターン入力装置12により
難読漢字に対するパターン入力画面を表示する(ステッ
プA3)。この表示画面において、検索したい難読漢字
の総画数によるパターンを「\」,「―」,「|」,
「/」のキーにより例えば最初の5画まで入力する。例
えば、「幅」、「矣」、「徽」という漢字の場合、 「幅」:「|」,「―」,「|」,「―」,「|」 「矣」:「/」,「\」,「/」,「―」,「―」 「徽」:「/」,「/」,「|」,「|」,「|」 のように入力する。
【0021】上記のようにパターンを入力した後は、概
略画数入力装置13の機能を用いて検索漢字の概略の画
数を入力する。例えば 小画数(10画以下) 中画数(8〜16画) 大画数(14画以上) に分けて入力する。
【0022】パターン検索装置14は、上記のように
「総画数モード」が指定されている場合には、総画数型
辞書15を用いて指定画数の範囲で難読漢字を検索する
(ステップA5)。この場合、特に画数の指定がなくて
も難読漢字を検索することができるが、画数を指定した
方が効率的である。
【0023】パターン検索装置14は、入力パターンに
基づいて総画数型辞書15を検索し、検索結果を候補漢
字出力装置17に出力する。候補漢字出力装置17は、
検索された漢字の中から最も正解確率の高い漢字を選択
して画面上の所定の位置に表示する(ステップA6)。
この表示された候補漢字が所望の漢字であった場合に
は、確定操作等を行なうことにより検索処理を終了する
が、所望の漢字でない場合には、次候補の漢字を次候補
キーの操作によって表示させる。候補漢字として所望の
漢字が得られない場合には、パターン入力が誤っている
場合あるいはパターンの入力画数が少なくて所望の漢字
を抽出できない場合がある。この場合には、パターン再
入力装置20の機能を用いて新たにパターンを再入力さ
せるか、あるいはパターン追加入力装置21の機能を用
いて6画目以降のパターンを追加入力させる。そして、
再度、パターン検索装置14により検索処理を実行す
る。このパターン検索の再実行により、所望の漢字が得
られると検索処理を終了する。
【0024】また、上記ステップA2で「部首別モー
ド」を指定した場合、検索モード選択装置11は部首入
力の画面を表示して検索漢字の部首を入力させる(ステ
ップA7)。例えば「幅」、「矣」、「徽」という漢字
の場合、 「幅」→「巾」 「矣」→「ム」 「徽」→「彳」 の部首を入力する。部首が入力されると、パターン入力
装置12により難読漢字に対するパターン入力画面を表
示する(ステップA8)。この表示画面において、検索
したい難読漢字の部首以外の部分のパターンを「\」,
「―」,「|」,「/」のキーによりステップAの場合
と同様にして最初の5画まで入力する。例えば、
「幅」、「矣」、「徽」という漢字の場合、 「幅」:「―」,「|」,「―」,「―」,「|」 「矣」:「/」,「―」,「―」,「/」,「\」 「徽」:「|」,「|」,「|」,「/」,「/」 のように入力する。なお、この「部首別モード」の場
合、総画数の入力は不要である。
【0025】パターン検索装置14は、上記のように
「部首別モード」が指定されている場合には、入力パタ
ーンに基づいて部首別型辞書16を検索し、検索結果を
候補漢字出力装置17に出力する(ステップA9)。候
補漢字出力装置17は、検索された漢字の中から最も正
解確率の高い漢字を選択して画面上の所定の位置に表示
する(ステップA10)。この表示された候補漢字が所
望の漢字であった場合には、確定操作等を行なうことに
より検索処理を終了するが、所望の漢字でない場合に
は、次候補の漢字を次候補キーの操作によって表示させ
る。所望の漢字を抽出できない場合には、上記「総画数
モード」の場合と同様にパターンを再入力するか、ある
いは6画目以降のパターンを追加入力して検索処理を再
実行する。
【0026】上記のようにして4種類のパターンを筆順
に従ってN画分入力することにより、短時間で難読漢字
を検索することができる。一般的に漢字の読みは知らな
くても、基本となる書き順を間違える人は少ない。ま
た、間違えたとしても2〜3ケースしかなく、容易に正
答を得ることができる。
【0027】上記実施例で示したように4種のパターン
を難読漢字の5画まで入力するようにした場合、その組
み合わせは、4の5乗、つまり「45 =1024」通り
あり、かなり細分化された検索が可能となる。また、例
えば康煕辞典で字数約5万字、これに字体の異なる文字
(簡体字、頻体字)を加えても10万字程度であり、全
文字をデータベース化してもデータ量はそれ程大規模と
はならない。
【0028】なお、上記実施例では、難読漢字を検索し
た場合、抽出した漢字のみを表示するようにしたが、総
画数型辞書15及び部首別型辞書16に漢字と共に読み
を記憶しておき、検索を行なった場合に該当する漢字と
共に読みを表示するようにしても良い。
【0029】また、本発明はワードプロセッサに限定さ
れるものではなく、その他、例えば漢字処理機能を備え
た計算機等においても上記実施例と同様にして実施し得
るものである。
【0030】
【発明の効果】以上詳記したように本発明によれば、各
漢字部首及び部首以外の部分の最初のN画の各画の最初
の書き出し線を4種類にパターン分けして辞書に記憶
し、入力されたN画分のパターンに基づいて上記辞書を
検索するようにしたので、漢字の読みを知らなくても短
時間で所望の漢字を検索することができる。
【図面の簡単な説明】
【図1】本発明の一実施例に係る難読漢字検索装置の構
成を示すブロック図。
【図2】同実施例における辞書を作成するパターン辞書
作成装置の概略構成を示すブロック図。
【図3】同実施例の処理動作を示すフローチャート。
【符号の説明】
11 検索モード選択装置 12 パターン入力装置 13 概略画数入力装置 14 パターン検索装置 15 総画数型辞書 16 部首別型辞書 17 候補漢字出力装置 18 抽出結果判定入力装置 19 判断部 20 パターン再入力装置 21 パターン追加入力装置 30 パターン辞書作成装置 31 漢字の方向コード化装置 32 総画数型パターン抽出装置 33 部首別型パターン抽出装置 34 パターン分類装置

Claims (1)

    【特許請求の範囲】
  1. 【請求項1】 各漢字部首及び部首以外の部分の最初の
    N画(Nは所望の自然数)の各画の最初の書き出し線を
    「\」,「―」,「|」,「/」の4種類にパターン分
    けして記憶する記憶手段と、 検索対象漢字の部首及び部首以外の部分のN画分の各画
    の最初の書き出し線を「\」,「―」,「|」,「/」
    の4種類にパターン分けしたときの、同部首及び部首以
    外の部分のN画分のパターンを取り込む手段と、 同手段により取り込んだ部首及び部首以外の部分のN画
    分のパターンと上記記憶手段のデータとをパターン検索
    し、検索対象漢字のデータを抽出する手段とを有するこ
    とを特徴とする難読漢字検索装置。
JP32011994A 1994-12-22 1994-12-22 難読漢字検索装置 Expired - Fee Related JP3233803B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP32011994A JP3233803B2 (ja) 1994-12-22 1994-12-22 難読漢字検索装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP32011994A JP3233803B2 (ja) 1994-12-22 1994-12-22 難読漢字検索装置

Publications (2)

Publication Number Publication Date
JPH08180050A true JPH08180050A (ja) 1996-07-12
JP3233803B2 JP3233803B2 (ja) 2001-12-04

Family

ID=18117911

Family Applications (1)

Application Number Title Priority Date Filing Date
JP32011994A Expired - Fee Related JP3233803B2 (ja) 1994-12-22 1994-12-22 難読漢字検索装置

Country Status (1)

Country Link
JP (1) JP3233803B2 (ja)

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2008106475A1 (en) * 2007-03-01 2008-09-04 Microsoft Corporation Stroke number input
WO2008106472A1 (en) * 2007-03-01 2008-09-04 Microsoft Corporation Integrated pinyin and stroke input
US8316295B2 (en) 2007-03-01 2012-11-20 Microsoft Corporation Shared language model

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2008106475A1 (en) * 2007-03-01 2008-09-04 Microsoft Corporation Stroke number input
WO2008106472A1 (en) * 2007-03-01 2008-09-04 Microsoft Corporation Integrated pinyin and stroke input
US8316295B2 (en) 2007-03-01 2012-11-20 Microsoft Corporation Shared language model
US8677237B2 (en) 2007-03-01 2014-03-18 Microsoft Corporation Integrated pinyin and stroke input

Also Published As

Publication number Publication date
JP3233803B2 (ja) 2001-12-04

Similar Documents

Publication Publication Date Title
JP2726568B2 (ja) 文字認識方法及び装置
US6950533B2 (en) Sorting images for improved data entry productivity
JP2713622B2 (ja) 表形式文書読取装置
JPH1055371A (ja) 文書探索および検索システム
JP3233803B2 (ja) 難読漢字検索装置
JPH0423185A (ja) 自動セル属性判定機能を有する表読取装置
JP2003331214A (ja) 文字認識誤り訂正方法、装置及びプログラム
JPH0896081A (ja) 文字認識装置及び文字認識方法
KR20030018519A (ko) 이미지검색 기반 편리한 한자 입력교정 방법
JPH0744656A (ja) 手書文字認識装置
JP3763262B2 (ja) 手書文字認識装置
JP3157530B2 (ja) 文字切り出し方法
JPH0589190A (ja) 図面情報のチエツク方式
JPH053631B2 (ja)
JPH0388086A (ja) 文書読取装置
JP3481850B2 (ja) 文字認識装置
JPH06333083A (ja) 光学式文字読取装置
JPH1097528A (ja) 難読漢字の入力方法
JPS6059487A (ja) 手書文字認識装置
JPH09134357A (ja) 文字処理装置
JPH11282965A (ja) 文字認識装置及び文字認識プログラムを記録したコンピュータ読み取り可能な記録媒体
JP2000057315A (ja) 文書ファイリング装置及び文書ファイリング方法
JPH07325887A (ja) データ入力装置及び文字認識辞書の作成方法
JPH10105645A (ja) 文字認識装置
JPH056456A (ja) 文字認識装置

Legal Events

Date Code Title Description
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20010821

LAPS Cancellation because of no payment of annual fees