JPH04215183A - キーワード検索方法 - Google Patents

キーワード検索方法

Info

Publication number
JPH04215183A
JPH04215183A JP2401761A JP40176190A JPH04215183A JP H04215183 A JPH04215183 A JP H04215183A JP 2401761 A JP2401761 A JP 2401761A JP 40176190 A JP40176190 A JP 40176190A JP H04215183 A JPH04215183 A JP H04215183A
Authority
JP
Japan
Prior art keywords
character
characters
keyword
manuscript
candidate
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP2401761A
Other languages
English (en)
Inventor
Yukio Kudo
久藤 幸生
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fuji Electric Co Ltd
Fuji Facom Corp
Original Assignee
Fuji Electric Co Ltd
Fuji Facom Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fuji Electric Co Ltd, Fuji Facom Corp filed Critical Fuji Electric Co Ltd
Priority to JP2401761A priority Critical patent/JPH04215183A/ja
Publication of JPH04215183A publication Critical patent/JPH04215183A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Character Discrimination (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】この発明は、登録キーワードと同
じ単一文字または文字列をキーワードとして文書中から
検索する方法であって、とくに文書中の各文字の読取り
に多少の誤読があっても検索効率の良好なキーワード検
索方法に関する。
【0002】
【従来の技術】一般に、文書の内容を迅速,的確に把握
するには、キーワードを活用するのが有効である。たと
えば、地球環境保護の問題に関する文書では、たとえば
「放射能」や「オゾン層」,「地球汚染」などのキーワ
ードが用いられる。さて、文書のデータベース化をおこ
なうとき、文書の文字つまり原稿文字を順に文字読取装
置によって、標準文字に対する類似度のもっとも高い文
字を読取文字として選出し、文字コードで表されるテキ
ストを作成する。このテキストに対して、登録されたキ
ーワードと同じ単一文字または文字列をキーワードとし
て検索する。
【0003】
【発明が解決しようとする課題】従来の方法では、文字
読取装置によって読み取られた結果に誤り、つまり誤読
が1字でもあると、キーワードが存在するにもかかわら
ず、検索対象から除外される。すなわち、文書中のキー
ワード総数に対する検索キーワード数の比率を検索効率
と定義したとき、検索効率は著しく低下する。
【0004】この発明の課題は、従来の技術がもつ以上
の問題点を解消し、文書中の各文字の読取りに多少の誤
読があっても検索効率の良好なキーワード検索方法を提
供することにある。
【0005】
【課題を解決するための手段】この課題を解決するため
に、請求項1に係るキーワード検索方法は、登録キーワ
ードと同じ単一文字または文字列をキーワードとして文
書中から検索する方法において、この文書の各文字を原
稿文字として順に文字読取装置によって読み取り、前記
各原稿文字について標準文字に対する類似度に基づき所
定個数までの候補文字を選出し;前記各原稿文字でもっ
とも先行するものの各候補文字のうち少なくとも一つが
前記登録キーワードの先頭文字と一致するときの、前記
原稿文字を前記検索すべきキーワードの先頭文字とし;
この先頭文字に対応する原稿文字に後続の各文字につい
て前記と同じ所定個数までの候補文字を選出し;この後
続順の各原稿文字に対応する前記所定個数までの各候補
文字のうち少なくとも一つが前記登録キーワードの対応
する後続順位の文字と一致するとき、前記後続順の各原
稿文字を前記検索すべきキーワードの対応する後続順位
の各文字とする。請求項2に係るキーワード検索方法は
、請求項1に記載の方法において、所定個数が3である
【0006】
【作用】請求項1または2に係るキーワード検索方法で
は共通に、文書の各原稿文字の読取りに多少の誤読があ
っても、読取文字として所定個数、たとえば請求項2の
ように、3個までの候補文字を上げ、そのうち少なくと
も一つが登録キーワードの先頭文字と一致する最先行の
読取文字を探せば、その一致したものは正しい文字であ
る確率が高い。以下、後続する各原稿文字を順に読み取
り、それぞれに対し同じ所定個数、たとえば3個までの
候補文字を選出し、そのうち少なくとも一つが登録キー
ワードの対応する各後続文字と一致するものを探せば、
その一致したものは、高い確率でキーワードの対応する
各後続文字である。
【0007】
【実施例】本発明に係るキーワード検索方法が適用され
る検索装置について、以下に図を参照しながら説明する
。図3は検索装置に係る登録キーワード,原稿文字,各
候補文字の対応図である。図3において、第1行は登録
キーワード、第2行は検索すべき原稿文字、第3行は各
原稿文字の読取結果の第1候補文字、第4行は同じくそ
の第2候補文字、第5行は同じくその第3候補文字であ
る。登録キーワードは「共同開発」、原稿文字「共」に
係る読取結果の第1候補文字は「共」、第2候補文字は
「井」、第3候補文字は「丼」である。以下、原稿文字
「同」に対し伺,同,向が、原稿文字「開」に対し開,
閉,関が、原稿文字「発」に対し発,溌,廃がそれぞれ
候補文字として選出される。なお、第1,第2,第3の
各候補文字は、各原稿文字の標準文字に対する類似度の
高い順に、または類似度に係るしきい値を順に緩和して
、3個までの文字が選定される。類似度が極端に低くな
るときには、候補文字とは言えないから、3個を揃えて
選定する必要はない。
【0008】図4は、図3の各文字を符号化したときの
対応図であり、登録キーワードKの各構成文字:Ki、
原稿文字Wの各構成文字:Wi、第1,第2,第3の各
候補文字:Ai,Bi,Ciにそれぞれ対応する。ここ
で、i=1,2,3,4で、登録キーワード、原稿文字
の共通な文字順位符号である。
【0009】図2は検索装置の構成を示すブロック図で
ある。図2において、1は文書の原稿文字に係る画像を
求めるイメージスキャナ、2は読取部で、原稿文字に係
る画像に基づいて3個までの候補文字を選出する。なお
、第1,第2,第3の各候補文字については、既に説明
したとおりである。3は読取文字に係る候補文字用のメ
モリで、読取りの第1,第2,第3の各候補文字が文字
コードで格納される。4は登録キーワード用の入力部、
5は登録キーワード用のメモリである。6は照合部で、
各メモリ3,5からの対応する文字コードを照合し、一
致,不一致の判定をする。7はCRTで、照合結果を画
面に表示する。なお、このCRT7に照合結果を印刷し
て出力するプリンタを併設することもできる。
【0010】図1は検索装置の動作を示すフローチャー
トである。図1において、ステップS1で、4個の文字
からなる登録キーワードの各構成文字Ki、原稿文字W
iの共通な文字順位符号iの初期化、i=1をおこなう
。ステップS2で、原稿文字Wiを読み取った結果の3
個の第1,第2,第3の各候補文字Ai,Bi,Ciを
選出する。ステップS3で、第1候補文字Aiがキーワ
ード構成文字Kiと一致するかどうかが判断され、YE
SならステップS6へ、NOならステップS4へ移行す
る。ステップS6で、Wi,Kiは一致すると判定され
た後、以上のプロセスがステップS7とステップS8を
経て、4個の文字すべてについて繰り返される。戻って
ステップS4で、第2候補文字BiがKiと一致するか
どうかが判断され、YESならステップS6へ、NOな
らステップS5へ移行する。ステップS5で、第3候補
文字CiがKiと一致するかどうかが判断され、YES
ならステップS6へ、NOならステップS9へ移行する
。ステップS9で、Wiは読取不能とされ、したがって
次のステップS10で検索不能とされる。
【0011】ここで、若干補足すると、キーワードとな
るべき先頭の原稿文字W1の読取りに多少の誤読があっ
ても、読取文字として3個までの候補文字A1,B1,
C1を上げ、そのうち少なくとも一つが登録キーワード
の先頭文字K1と一致するものを探せば、その一致した
ものは正しい文字である確率が高い、と考えることがで
きる。以下、後続する各原稿文字Wiを順に読み取り、
それぞれに対し3個までの候補文字Ai,Bi,Ciを
選出し、そのうち少なくとも一つが登録キーワードの対
応する各後続文字Kiと一致するものを探せば、その一
致したものは、高い確率でキーワードの対応する各後続
文字であると言える。なお、候補文字の個数は多いほど
、読取り確度は上がるが、処理時間もかかるから、調和
点を求める必要がある。候補文字を3個までとしたのは
、経験的なもので、処理時間もほどほどの線で、ほぼ9
9%の確率で正確な文字読取りができることが実証され
たことに基づく。
【0012】
【発明の効果】請求項1または2に係るキーワード検索
方法では共通に、文書の各原稿文字の読取りに多少の誤
読があっても、読取文字として所定個数、たとえば請求
項2のように、3個までの候補文字を上げ、そのうち少
なくとも一つが登録キーワードの先頭文字と一致する最
先行の読取文字を探せば、その一致したものは正しい文
字である確率が高いから、以下、後続する各原稿文字を
順に読み取り、それぞれに対し同じ所定個数、たとえば
3個までの候補文字を上げ、そのうち少なくとも一つが
登録キーワードの対応する各後続文字と一致するものを
探せば、その一致したものは、高い確率でキーワードの
対応する各後続文字である。したがって、文書中の各文
字の読取りに多少の誤読があっても、結果として検索効
率の良好なキーワード検索ができるという効果が得られ
る。とくに、候補文字を3個までにすることによって、
処理時間もほどほどの線で、ほぼ99%の確率で正確な
文字読取りができ、処理時間と検索確度との調和が図れ
ることが実証された。
【図面の簡単な説明】
【図1】本発明に係る方法を適用した検索装置の動作を
示すフローチャート
【図2】この検索装置の構成を示すブロック図
【図3】
この検索装置に係る登録キーワード,原稿文字,各候補
文字の対応図
【図4】図3の各文字を符号化したときの対応図
【符号の説明】
1    イメージセンサ 2    読取部 3    メモリ 4    入力部 5    メモリ 6    照合部 7    CRT

Claims (2)

    【特許請求の範囲】
  1. 【請求項1】登録キーワードと同じ単一文字または文字
    列をキーワードとして文書中から検索する方法において
    、この文書の各文字を原稿文字として順に文字読取装置
    によって読み取り、前記各原稿文字について標準文字に
    対する類似度に基づき所定個数までの候補文字を選出し
    ;前記各原稿文字でもっとも先行するものの各候補文字
    のうち少なくとも一つが前記登録キーワードの先頭文字
    と一致するときの、前記原稿文字を前記検索すべきキー
    ワードの先頭文字とし;この先頭文字に対応する原稿文
    字に後続の各文字について前記と同じ所定個数までの候
    補文字を選出し;この後続順の各原稿文字に対応する前
    記所定個数までの各候補文字のうち少なくとも一つが前
    記登録キーワードの対応する後続順位の文字と一致する
    とき、前記後続順の各原稿文字を前記検索すべきキーワ
    ードの対応する後続順位の各文字とする;ことを特徴と
    するキーワード検索方法。
  2. 【請求項2】請求項1に記載の方法において、所定個数
    は、3であることを特徴とするキーワード検索方法。
JP2401761A 1990-12-13 1990-12-13 キーワード検索方法 Pending JPH04215183A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP2401761A JPH04215183A (ja) 1990-12-13 1990-12-13 キーワード検索方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP2401761A JPH04215183A (ja) 1990-12-13 1990-12-13 キーワード検索方法

Publications (1)

Publication Number Publication Date
JPH04215183A true JPH04215183A (ja) 1992-08-05

Family

ID=18511590

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2401761A Pending JPH04215183A (ja) 1990-12-13 1990-12-13 キーワード検索方法

Country Status (1)

Country Link
JP (1) JPH04215183A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2011034230A (ja) * 2009-07-30 2011-02-17 Rakuten Inc 画像検索エンジン

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2011034230A (ja) * 2009-07-30 2011-02-17 Rakuten Inc 画像検索エンジン

Similar Documents

Publication Publication Date Title
CN110349568B (zh) 语音检索方法、装置、计算机设备及存储介质
CN117076653A (zh) 基于思维链及可视化提升上下文学习知识库问答方法
CN109902303B (zh) 一种实体识别方法及相关设备
CN114328861A (zh) 一种智能知识库扩充方法、装置、电子设备及存储介质
CN115455948A (zh) 一种拼写纠错模型训练方法、拼写纠错方法及存储介质
JP3589007B2 (ja) 文書ファイリングシステムおよび文書ファイリング方法
JPH10171806A (ja) 語義曖昧性解消装置及び方法
JPH04215183A (ja) キーワード検索方法
JP2815707B2 (ja) キーワード検索方法
JP7754095B2 (ja) 文書検索装置、文書検索システム、文書検索プログラム、および文書検索方法
JPH04225471A (ja) キーワード検索方法
CN117744655A (zh) 一种基于多特征融合的嵌套命名实体识别方法
JP2586372B2 (ja) 情報検索装置及び情報検索方法
JP2827066B2 (ja) 数字列混在文書の文字認識の後処理方法
JPH08272813A (ja) ファイリング装置
JP3241854B2 (ja) 単語スペル自動補正装置
JPH07302347A (ja) グラフ生成装置
JP3924899B2 (ja) テキスト検索装置およびテキスト検索方法
JPH07296005A (ja) 日本語テキスト登録・検索装置
JP2839515B2 (ja) 文字読取システム
JPH08180064A (ja) 文書検索方法及び文書ファイリング装置
CN120218082A (zh) 一种商品交易平台数据交换方法
JP2570784B2 (ja) 文書リーダ後処理装置
JPH0757059A (ja) 文字認識装置
JPH05342415A (ja) 類似文字判定方式