JPH01106263A - 文書の格納検索装置 - Google Patents
文書の格納検索装置Info
- Publication number
- JPH01106263A JPH01106263A JP62264888A JP26488887A JPH01106263A JP H01106263 A JPH01106263 A JP H01106263A JP 62264888 A JP62264888 A JP 62264888A JP 26488887 A JP26488887 A JP 26488887A JP H01106263 A JPH01106263 A JP H01106263A
- Authority
- JP
- Japan
- Prior art keywords
- character
- document
- characters
- image
- document image
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Landscapes
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。
め要約のデータは記録されません。
Description
【発明の詳細な説明】
〔産業上の利用分野〕
本発明は文書をイメージデータに変換し、格納検索する
装置に関する。
装置に関する。
データやファイルの増大にともない、大量の文書を電子
ファイル化に、高密度の記憶媒体2例えば光ディスク等
に電子的データとして格納することが行われている。
ファイル化に、高密度の記憶媒体2例えば光ディスク等
に電子的データとして格納することが行われている。
従来、この種装置は、第5図に示すように構成されてい
る。文書の格納時は入力文書1をイメージリーダー2に
て文書イメージに光電変換し、キーボード5から入力さ
れたオペレータの任意な分類によるキーワード群を付し
て、記憶媒体となる光ディスク等のデータベース3に格
納する。一方、文書の検索時は、キーボード5がら入力
された検索条件(格納時に使用した分類に従った条件)
を満足するキーワード群の付けられた文書イメージを検
索し、検索結果を表示装置6上に表示するようになって
いる。
る。文書の格納時は入力文書1をイメージリーダー2に
て文書イメージに光電変換し、キーボード5から入力さ
れたオペレータの任意な分類によるキーワード群を付し
て、記憶媒体となる光ディスク等のデータベース3に格
納する。一方、文書の検索時は、キーボード5がら入力
された検索条件(格納時に使用した分類に従った条件)
を満足するキーワード群の付けられた文書イメージを検
索し、検索結果を表示装置6上に表示するようになって
いる。
このような装置では、前もって格納する文書1に対し、
検索時の状況を想定して適切なキーワード群を付さなけ
ればならなかった。もしキーワード群がないと、せっか
く格納された文書も、どこに何を格納したのか知るすべ
がなく検索できなくなる。又、文書格納時に−々オペレ
ータはキーワード群を入力作成し入力するわずられしい
作業を必要としていた。個人的に使うような文書管理装
置としては入力したキーワード群を覚えたらいいとして
も、別の人が検索するとき、それを見出すことが大変で
あるという問題である。
検索時の状況を想定して適切なキーワード群を付さなけ
ればならなかった。もしキーワード群がないと、せっか
く格納された文書も、どこに何を格納したのか知るすべ
がなく検索できなくなる。又、文書格納時に−々オペレ
ータはキーワード群を入力作成し入力するわずられしい
作業を必要としていた。個人的に使うような文書管理装
置としては入力したキーワード群を覚えたらいいとして
も、別の人が検索するとき、それを見出すことが大変で
あるという問題である。
本発明は係る欠点を除去するためになされたもので、キ
ーワード群の作成をオペレータが行う労をなくして、自
動化し、かつ格納者と検索者とが別人であっても容易に
検索ができる。即ちオペレータが交代しても格納検索が
正確にできる文書の格納検索装置を提供することを目的
としている。
ーワード群の作成をオペレータが行う労をなくして、自
動化し、かつ格納者と検索者とが別人であっても容易に
検索ができる。即ちオペレータが交代しても格納検索が
正確にできる文書の格納検索装置を提供することを目的
としている。
〔問題点を解決するための手段〕
この発明においては、文書1を読取り文書イメージに光
電変換するイメージ読取装置2と、文書イメージに検索
用キーワード群のデータが付されて格納されるデータベ
ース3と、検索用キーワード群を入力することにより該
データベース3から文書イメージを検索して読み出す検
索装置4とからなる文書の格納検索装置において、文書
イメージ中の文字を切り出して認識し文字コード列に変
換する文字認識装置7と、分類項目用の単語や熟語が予
め登録されている単語辞書9と、文字コード列と単語や
熟語とを照合して文書1に関するキーワードデ°−夕を
抽出するとともに文書イメージ〔作用〕 オペレータはイメージ読取装置2を使って文書1を入力
すれば、文書イメージは自動的にキーワード群抽出装置
10により、キーワード群が付され、データベース3に
格納される。検索時には検 −索者が別人であっ
ても、文書の属する分野の一般的なキーワード群を入力
するだけで、目的の文書を取り出すことができる。
電変換するイメージ読取装置2と、文書イメージに検索
用キーワード群のデータが付されて格納されるデータベ
ース3と、検索用キーワード群を入力することにより該
データベース3から文書イメージを検索して読み出す検
索装置4とからなる文書の格納検索装置において、文書
イメージ中の文字を切り出して認識し文字コード列に変
換する文字認識装置7と、分類項目用の単語や熟語が予
め登録されている単語辞書9と、文字コード列と単語や
熟語とを照合して文書1に関するキーワードデ°−夕を
抽出するとともに文書イメージ〔作用〕 オペレータはイメージ読取装置2を使って文書1を入力
すれば、文書イメージは自動的にキーワード群抽出装置
10により、キーワード群が付され、データベース3に
格納される。検索時には検 −索者が別人であっ
ても、文書の属する分野の一般的なキーワード群を入力
するだけで、目的の文書を取り出すことができる。
以下、この発明を図面に基づいて説明する。第1図にお
いて、1は格納予定の文書、2は文書1上の文字像を光
学的に入力し電子信号の文書イメ。
いて、1は格納予定の文書、2は文書1上の文字像を光
学的に入力し電子信号の文書イメ。
−ジを生成するイメージ読取装置としてのイメージリー
ダー〈3は電子信号を記憶する磁気ディスクや光ディス
ク等のデータベース、4はデータベース3の記憶データ
を検索する検索装置、5は文字等を入力するキーボード
、6は・CRT等からなる表示装置である。
ダー〈3は電子信号を記憶する磁気ディスクや光ディス
ク等のデータベース、4はデータベース3の記憶データ
を検索する検索装置、5は文字等を入力するキーボード
、6は・CRT等からなる表示装置である。
而して、7はイメージリーダー2によって読み取られた
文書イメージ中の各文字データを切り出し、認識して文
字コードに変換する文字認識装置、8は文字認識装置7
の出力である文字コード列を記憶するレジスタ:、9は
キーワード群の抽出に用いるROMとしての単語辞書、
lOはレジスタ8中の文字コード列から単語辞書9を用
いてキーワード群を抽出するキーワード群抽出装置であ
る。
文書イメージ中の各文字データを切り出し、認識して文
字コードに変換する文字認識装置、8は文字認識装置7
の出力である文字コード列を記憶するレジスタ:、9は
キーワード群の抽出に用いるROMとしての単語辞書、
lOはレジスタ8中の文字コード列から単語辞書9を用
いてキーワード群を抽出するキーワード群抽出装置であ
る。
単語辞書9は分野別に、例えば料理分野に関する用語の
系統だった分類用熟語や文字等が予め料理専門家により
体系的に登録された読み出し専用のメモリである。文字
認識装置7は基準文字辞書を内蔵しており、文字を一文
字づつ認識するものである。
系統だった分類用熟語や文字等が予め料理専門家により
体系的に登録された読み出し専用のメモリである。文字
認識装置7は基準文字辞書を内蔵しており、文字を一文
字づつ認識するものである。
以下、−例として、第2図に示すような文書を本装置に
入力する場合について動作を説明する。
入力する場合について動作を説明する。
まず、文字認識装置7はイメージリーダー2によって読
み取られた文書のイメージから、第3図に示すように文
字列領域71〜75を切り出し、この領域71〜75内
に存在する文字イメージを区切りの曖昧さを残したまま
順次認識し、各候補文字のコードを出力する。第4図に
このようにして得られる一つの文字列領域72の一例を
示す。同図では一行目が第1候補文字で二行目が第2候
補文字である。文字認識装置7はひらがなや漢字等の基
準文字の辞書を内蔵し、各文字を一字づつ認識して候補
文字を添えてレジスタ8に与える。
み取られた文書のイメージから、第3図に示すように文
字列領域71〜75を切り出し、この領域71〜75内
に存在する文字イメージを区切りの曖昧さを残したまま
順次認識し、各候補文字のコードを出力する。第4図に
このようにして得られる一つの文字列領域72の一例を
示す。同図では一行目が第1候補文字で二行目が第2候
補文字である。文字認識装置7はひらがなや漢字等の基
準文字の辞書を内蔵し、各文字を一字づつ認識して候補
文字を添えてレジスタ8に与える。
そこで、次にキーワード群抽出装置10は、レジスタ8
から出力される文字コード列72に含まれる長さnのす
べての部分文字コード列に対し、これが単語辞書9に登
録されている用語や熟語と一致するか否かを調べ、登録
されていれば、これをキーワードとして抽出する。この
操作を文字コード列72〜75について最小長から最大
長の範囲の長さnについて行い、文字コード列72〜7
5のなかから登録分類用語と一致するキーワード群を抽
出する。このようにして抽出されたキーワード群は、キ
ーワード群抽出装置10により文書1の分類項目と決定
され、入力文書イメージに 。
から出力される文字コード列72に含まれる長さnのす
べての部分文字コード列に対し、これが単語辞書9に登
録されている用語や熟語と一致するか否かを調べ、登録
されていれば、これをキーワードとして抽出する。この
操作を文字コード列72〜75について最小長から最大
長の範囲の長さnについて行い、文字コード列72〜7
5のなかから登録分類用語と一致するキーワード群を抽
出する。このようにして抽出されたキーワード群は、キ
ーワード群抽出装置10により文書1の分類項目と決定
され、入力文書イメージに 。
付されてデータベース3に格納される。
一方、格納された文書1の検索はキーボード5から入力
される所望分野についての検索条件を満たすキーワード
群を付された文書イメージをデータベース3中で検索す
ることによって行われる。
される所望分野についての検索条件を満たすキーワード
群を付された文書イメージをデータベース3中で検索す
ることによって行われる。
即ち、オペレータは料理分野に関する一般的な分類用語
や文節をキーボード5からキーワードとして入力する。
や文節をキーボード5からキーワードとして入力する。
すると検索装置4はこのキーワード群と一致する分類項
目をデータベース3から検出し、一致した分類項目に属
する文書データ1を読み出し、表示装置6に表示する。
目をデータベース3から検出し、一致した分類項目に属
する文書データ1を読み出し、表示装置6に表示する。
この表示文書をオペレータは視認して、もし要求する文
書であれば、プリントアウト等を行い取り入れ、もし異
なるものなら他のキーワード群を入力して目的の文書を
得るまで検索を行う。
書であれば、プリントアウト等を行い取り入れ、もし異
なるものなら他のキーワード群を入力して目的の文書を
得るまで検索を行う。
以上説明してきたように、発明によれば、検索用キーワ
ード群を入力することにより文書イメージが格納された
データベースから当該文書イメージを検索して読み出す
検索装置を備えた文書の格納検索装置において、文書イ
メージ中の文字を切り出して認識し文字コード列に変換
する文字認識装置と、分類項目用の単語や熟語が予め登
録されている単語辞書と、文字コードと単語や熟語とを
照合して文書に関するキーワードデータを抽出するとと
もに文書イメージに付してデータベースに格納するキー
ワード群抽出装置とを設け、格納すべき文書イメージに
付けられるキーワード群がこの文書イメージから自動的
に抽出されるものであって、しかも、自動抽出されたキ
ーワード群の中には必ず入力文書イメージに含まれる文
字列の中でキーワードとなり得る単語はすべて網羅され
ているから、利用者は文書の格納時にキーワード群を作
成入力する必要がなく、しかも、文書の検索時は誰が検
索しても指定された検索条件を満たすキーワード群を含
む文書は必ずそれに付されたキーワード群の分野別の性
質から検索されるという効果がある。
ード群を入力することにより文書イメージが格納された
データベースから当該文書イメージを検索して読み出す
検索装置を備えた文書の格納検索装置において、文書イ
メージ中の文字を切り出して認識し文字コード列に変換
する文字認識装置と、分類項目用の単語や熟語が予め登
録されている単語辞書と、文字コードと単語や熟語とを
照合して文書に関するキーワードデータを抽出するとと
もに文書イメージに付してデータベースに格納するキー
ワード群抽出装置とを設け、格納すべき文書イメージに
付けられるキーワード群がこの文書イメージから自動的
に抽出されるものであって、しかも、自動抽出されたキ
ーワード群の中には必ず入力文書イメージに含まれる文
字列の中でキーワードとなり得る単語はすべて網羅され
ているから、利用者は文書の格納時にキーワード群を作
成入力する必要がなく、しかも、文書の検索時は誰が検
索しても指定された検索条件を満たすキーワード群を含
む文書は必ずそれに付されたキーワード群の分野別の性
質から検索されるという効果がある。
第1図は本発明の文書の格納検索装置の全体構成図、第
2図は入力文書の一例を示す図、第3図は文字領域の切
り出しの様子を例示する図、第4図は文字コード列を例
示する図、第5図は従来の装置の構成図である。 図において、1は入力文書、2はイメージリーダー、3
はデータベース、4は検索装置、5はキーボード、6は
表示装置、7は文字認識装置、8はレジスタ、9は単語
辞書、10はキーワード群抽出装置、70は文書イメー
ジ、71〜75は文字領域である。 代理人 大 岩 増 a(ほか2名)第1図 第2図 第3図 手続補正書(自発) 1、事件の表示 特願昭62−264888号3、
補正をする者 代表者志岐守哉 4、代理人 5補正の対象 発明の詳細な説明の欄。 6補正の内容 (1)明細書第2頁第6行目「電子ファイル化に、」と
あるのを「電子ファイル化し、」と補正する。 (2)同書第3頁第11行目「間層である。」とあるの
を「問題がある。」と補正する。 以上
2図は入力文書の一例を示す図、第3図は文字領域の切
り出しの様子を例示する図、第4図は文字コード列を例
示する図、第5図は従来の装置の構成図である。 図において、1は入力文書、2はイメージリーダー、3
はデータベース、4は検索装置、5はキーボード、6は
表示装置、7は文字認識装置、8はレジスタ、9は単語
辞書、10はキーワード群抽出装置、70は文書イメー
ジ、71〜75は文字領域である。 代理人 大 岩 増 a(ほか2名)第1図 第2図 第3図 手続補正書(自発) 1、事件の表示 特願昭62−264888号3、
補正をする者 代表者志岐守哉 4、代理人 5補正の対象 発明の詳細な説明の欄。 6補正の内容 (1)明細書第2頁第6行目「電子ファイル化に、」と
あるのを「電子ファイル化し、」と補正する。 (2)同書第3頁第11行目「間層である。」とあるの
を「問題がある。」と補正する。 以上
Claims (1)
- 【特許請求の範囲】 文書を読取り文書イメージに光電変換するイメージ読取
装置と、前記文書イメージに検索用キーワード群のデー
タが付されて格納されるデータベースと、前記検索用キ
ーワード群を入力することにより該データベースから前
記文書イメージを検索して読み出す検索装置とからなる
文書の格納検索装置において、 前記文書イメージ中の文字を切り出して認識し文字コー
ド列に変換する文字認識装置と、分類項目用の単語や熟
語が予め登録されている単語辞書と、前記文字コード列
と前記単語や熟語とを照合して前記文書に関するキーワ
ードデータを抽出するとともに前記文書イメージに付し
て前記データベースに格納するキーワード群抽出装置と
を備えたことを特徴とする文書の格納検索装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62264888A JPH01106263A (ja) | 1987-10-20 | 1987-10-20 | 文書の格納検索装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP62264888A JPH01106263A (ja) | 1987-10-20 | 1987-10-20 | 文書の格納検索装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH01106263A true JPH01106263A (ja) | 1989-04-24 |
Family
ID=17409621
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP62264888A Pending JPH01106263A (ja) | 1987-10-20 | 1987-10-20 | 文書の格納検索装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH01106263A (ja) |
Cited By (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH0736941A (ja) * | 1993-07-23 | 1995-02-07 | Nec Corp | イメージファイル管理装置 |
| JP2000057315A (ja) * | 1998-08-06 | 2000-02-25 | Mitsubishi Electric Corp | 文書ファイリング装置及び文書ファイリング方法 |
| JP2000137728A (ja) * | 1998-11-02 | 2000-05-16 | Fujitsu Ltd | 文書解析装置及びプログラム記録媒体 |
| JP2009059050A (ja) * | 2007-08-30 | 2009-03-19 | Canon Inc | 画像処理装置および統合ドキュメント生成方法 |
-
1987
- 1987-10-20 JP JP62264888A patent/JPH01106263A/ja active Pending
Cited By (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH0736941A (ja) * | 1993-07-23 | 1995-02-07 | Nec Corp | イメージファイル管理装置 |
| JP2000057315A (ja) * | 1998-08-06 | 2000-02-25 | Mitsubishi Electric Corp | 文書ファイリング装置及び文書ファイリング方法 |
| JP2000137728A (ja) * | 1998-11-02 | 2000-05-16 | Fujitsu Ltd | 文書解析装置及びプログラム記録媒体 |
| JP2009059050A (ja) * | 2007-08-30 | 2009-03-19 | Canon Inc | 画像処理装置および統合ドキュメント生成方法 |
| US8339622B2 (en) | 2007-08-30 | 2012-12-25 | Canon Kabushiki Kaisha | Image processing apparatus and integrated document generating method |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5794177A (en) | Method and apparatus for morphological analysis and generation of natural language text | |
| EP0802492A1 (en) | Document search system | |
| JPH0797373B2 (ja) | 文書フアイリングシステム | |
| JPH09259140A (ja) | 情報検索方法、情報検索装置及び情報検索プログラムを格納する媒体 | |
| JPH03172966A (ja) | 類似文書検索装置 | |
| US5890182A (en) | Sentence processing method and apparatus | |
| JPH09198395A (ja) | 文書検索装置 | |
| JPH01106263A (ja) | 文書の格納検索装置 | |
| JP3727995B2 (ja) | 文書処理方法及び装置 | |
| JP3945075B2 (ja) | 辞書機能を備えた電子装置及び情報検索処理プログラムを記憶した記憶媒体 | |
| JP2000231560A (ja) | 文書自動分類方式 | |
| JPH0944521A (ja) | インデックス作成装置および文書検索装置 | |
| JPS61248160A (ja) | 文書情報登録方式 | |
| JPH1011431A (ja) | 漢字検索装置および方法 | |
| JP2560656B2 (ja) | 文書ファイリングシステム | |
| JPS6175952A (ja) | 文書入力処理方式 | |
| JPH07296005A (ja) | 日本語テキスト登録・検索装置 | |
| JPH08249341A (ja) | 文書データベースの文書格納・検索装置 | |
| JPH09259132A (ja) | 情報登録検索装置及びその方法 | |
| JPH022458A (ja) | 類似文書検索装置 | |
| JPH06223107A (ja) | 辞書検索装置 | |
| JPH0512257A (ja) | 文書作成装置 | |
| JP2005189955A (ja) | 文書処理方法、文書処理装置、制御プログラム及び記録媒体 | |
| JPH02128270A (ja) | ワードプロセッサ | |
| JPH03161865A (ja) | 文章の検索方法 |