JPH0797373B2 - 文書フアイリングシステム - Google Patents

文書フアイリングシステム

Info

Publication number
JPH0797373B2
JPH0797373B2 JP60184181A JP18418185A JPH0797373B2 JP H0797373 B2 JPH0797373 B2 JP H0797373B2 JP 60184181 A JP60184181 A JP 60184181A JP 18418185 A JP18418185 A JP 18418185A JP H0797373 B2 JPH0797373 B2 JP H0797373B2
Authority
JP
Japan
Prior art keywords
character
document
search
character code
text
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP60184181A
Other languages
English (en)
Other versions
JPS6244878A (ja
Inventor
浩道 藤澤
敦 畠山
康明 中野
純一 東野
歳弘 花野井
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Ltd
Original Assignee
Hitachi Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Ltd filed Critical Hitachi Ltd
Priority to JP60184181A priority Critical patent/JPH0797373B2/ja
Publication of JPS6244878A publication Critical patent/JPS6244878A/ja
Priority to US07/139,781 priority patent/US5265242A/en
Priority to US07/559,994 priority patent/US4985863A/en
Priority to US08/111,511 priority patent/US5628003A/en
Publication of JPH0797373B2 publication Critical patent/JPH0797373B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/58Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/903Querying
    • G06F16/90335Query processing
    • G06F16/90344Query processing by using string matching techniques
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y10TECHNICAL SUBJECTS COVERED BY FORMER USPC
    • Y10STECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y10S707/00Data processing: database and file management or data structures
    • Y10S707/99931Database or file accessing
    • Y10S707/99933Query processing, i.e. searching
    • Y10S707/99935Query augmenting and refining, e.g. inexact access

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Library & Information Science (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Character Discrimination (AREA)

Description

【発明の詳細な説明】 〔発明の対象〕 本発明は文書を画像としてファイリングする文書ファイ
リングシステムに係り、特にフルテキストサーチ(本文
検索)が行えることを特徴とした文書ファイリングシス
テムに関する。
〔発明の背景〕
従来の情報検索方式では主にキーワードと分類コードに
従った検索手段を提供してきた。文献情報や特許情報は
上記の方式を用いてこれまでにデータベース化されてい
る。ここでは主に抄録までを含めた書誌情報がデータベ
ース化されており、真の情報検索のニーズに対してはそ
の一部分の機能しか提供できていない。すなわち、関連
すると思われる文献や特許が見い出されても、本文を得
るためには大量な書棚の中を探しまわる必要があった。
これに対して、大容量データを記憶できる光ディスクが
登場して、本文をもデータベースに格納して、いわゆる
原文書情報サービスを行うことが社会ニーズとしてクロ
ーズアップされて来た。特許庁におけるペーパレス化計
画もその流れに沿ったものである。これらのシステムで
は、大量な文書を画像データの形で光ディスクに記憶さ
せ、従来のキーワードを主体とした情報検索技術が適用
されている。
しかしながら、上記従来の情報検索技術では、数10件か
ら数100件のオーダまでしか絞り込むことが出来ず、更
に1/10程度まで関連文書を絞り込む手法が求められてい
る。一つの方法は、画像データとして貯えられている原
文書(本文)を端末上に呼び出して、検索者が目で読む
方法である。この方法は原理的には確実であるが、最大
数100件の文書を画像データの形式で読み出すのは、デ
ータ量が多く、また一件一件目視により読み取るのでは
効率が悪く、実用的には問題である。
一方、従来のキーワードや分類コードによる方法は、分
類体系自体が時間とともに変化するため常に更新する必
要があり、本質的な問題点を抱えている。例えば、既に
分類してしまった大量な文書を、後になって分類体系を
変更する必要が発生したとして、変更することは実際上
不可能である。科学技術の進歩を記録するところの文献
や特許は本来は従来の分類体系に乗らない概念が提示さ
れていてこそ新規なものであり、かつ価値があるもので
ある。この意味において、本来概念を表わすところのキ
ーワードや分類体系は、前もって定義しておくことは不
可能であり、情報検索方式として本質的な課題である。
上記のような理由から、文書の本文を直接参照して内容
検索する方法が要望されている。本文を参照する方法に
よれば、文書をデータベースに登録する際には重要とは
思われなかった概念で、かつ検索する時点において新し
い概念と認知されている語彙を用いて検索することが可
能となる。あるいは、登録する際のインデクサ(索引を
付与する専任者)という「フィルタ」を介さずに重要な
文書を直接探し出すことが可能となる。
このような要求を満すためには、画像データとしての文
書から、文字パターンを抽出して本文を文字コードに置
き換える必要があり、このためには文字認識の技術を適
用すればよい。しかしながら、文書ファイリングの対象
となる文書は、たとえ印刷文書であったとしても、印字
品質や活字(フォント)の種類の多様性などから、従来
の文字認識技術では完全な文字認識を期待することは難
しい。従来の文字読取装置では、誤認識や認識不能(拒
絶)などの不完全な認識はオペレータによりチェックと
修正を行う方法を取っていた。(例えば、橋本著「文字
認識概論」オーム社,1982年,pp.153-154参照)従って、
仮に認識精度が極めて高くても、文書の量が膨大である
場合には、本文を認識させた結果を人間がチェックする
方法は現実的ではなく、本文検索が可能な画像主体の文
書ファイリングシステムは現在までに実現されていな
い。
〔発明の目的〕
本発明の目的は、上記のような問題点を解決することに
より、文書の本文を直接参照して検索するところのフル
テキストサーチ機能を有する文書ファイリングシステム
を提供することにある。
〔発明の概要〕
本発明は、上記の目的を達成するために、文書を画像デ
ータとして記憶するとともに、該文書の本文またはその
一部を文字コード列として記憶すること、更に、該文字
コード列は曖昧性を残した文字認識結果を許容し、該文
字列のストリングマッチングを行うことにより本文検索
を可能とすることを特徴とする。
すなわち、本発明による文書ファイリングシステムは、
文書などを画像として扱うことの利点を損うことなく、
同時に画像として扱うことの不利な点を改善するもので
ある。すなわち、画像として扱うファイリングシステム
では従来、主に別途付与したキーワードや書誌的事項に
もとづいて検索することが主であったが、本発明によれ
ば、更に中に書かれている文章を参照して検索すること
が出来る。
例えば、「ホンブンケンサク」と検索用端末から入力す
ることにより、検索対象の文書群の中のある文書の本文
中に例えば「…文字認識による本文検索…」と書いてあ
る文書があれば、同文書を同定・抽出して、端末上に同
文書を画像のまま表示することが出来る。
画像として表示することにより、文字認識により情報が
失われることを避けることが出来る。一般に、文字認識
では、各文字の位置、大きさ、フォントなどの2次的情
報は正規化の過程で捨ててしまう。したがって、ゴシッ
ク体であったか明朝体であったか、どの大きさかは認識
後では分らなくなり、重要性を表わすためにゴシック体
にしたり、大きなフォントにしたりして印刷したことの
意味がなくなってしまう。音声でいえば、音声認識して
しまうと、誰が話したのか、とか、その時の感情とか
は、分らなくなってしまうことに対応する。文書の場合
においても、読取る人間にとっては、これら2次的な情
報も重要であり、単に文字認識してしまうのは得策では
ない。
本発明システムの第一の原理は、以上述べたように、文
書を画像として記憶する一方、文字の部分は文字コード
として重ねて記憶させている点である。
さて、文字の部分を画像から抽出して文字コードに置換
えるには文字切り出しと文字認識を行うことが必要であ
る。これには従来技術を用いることが可能であるが、10
0%の認識率を期待することはできない。
本発明システムの第二の原理は、文字認識の結果、判定
不能になった文字については、上位に残った文字カテゴ
リーを集合として扱って、認識結果文字列の中にそのま
ま残す点にある。
たとえば、「…文字認識による本文検索…」を認識した
場合、本システムでは「…文〔字学〕認〔識織〕による
〔本木〕文検索…」と認識結果を表わす。ここで〔 〕
で囲んだ文字はある一つの文字パターンに対する認識結
果であり、「〔識織〕」は「識」は「織」かのどちらか
であることを意味する。従来は、必ずオペレータの介入
により判定不能の文字は正しい文字コードに置き換え
て、文字認識結果(OCRの出力)としていた。ここで記
号「〔 」,「 〕」は特殊記号であり、一般にテキス
トに表われないコードを割り当てるものとする。単に表
示のときに、分りやすいように記号〔 ,〕を用いるも
のとする。
本発明を用いたシステムでは、結局第1図に示すよう
に、文書10は20で示すような記号式に変換される。同記
号列はLISP言語などで用いているS式と呼ばれる記法に
従う。文書(画像)10を記号式20に変換する過程を、文
書理解ないしは文書認識という。同記号式は、およそ次
のような意味を表わす。すなわち、ドキュメント♯99で
あり、そのクラスは「論文」,VOL=5,NO=7,タイトルは
“文〔字学〕認〔識織〕…",著者名は“日立〔太大〕
郎",本文は“…自動文字読み取〔りリ〕によるフルテキ
スト〔ト卜〕サ〔ー一−〕チ…”などを意味する。ここ
で〔りリ〕は平仮名と片仮名,〔ト卜〕は片仮名と漢
字,〔ー一−〕は片仮名の長音,漢数字の1,およびマイ
ナス記号〕を意味する。文字認識において曖昧なものの
中には、上記の例のように、殆んど通常では対処しよう
のない文字パターンも多い。
さて、検索に当っては、ユーザはローマ字又は片仮名で
「ホンブンケンサク」と入力する。システムではこれを
仮名漢字変換する。一般に同音異義語があり、この場
合、「ホンブン」は「本文」が「本分」かのどちらかで
あり、「ケンサク」は「検索」か「献策」のどちらかで
ある。本方式ではこのような曖昧性を自動的に扱うこと
ができる。
同様に、「モジヨミトリ」を入力した場合には、送り仮
名に曖昧性(2つ以上の可能性)がある。「文字読
取」,「文字読取り」,「文字読み取り」があり、未知
の本文にどのような送り仮名が振られているか分らない
ため、原理的にはすべての可能性を扱う必要がある。
更にまた、「モジニンシキ」と入力した場合は、仮名漢
字変換では一意に「文字認識」が得られるが、「文字認
識」は場合によっては「文字読み取り」と言われること
があるので、同義語として「文字読み取り」も検索キー
として自動的に選択することも望まれる。この場合、上
記の例と同様に複数の送り仮名の可能性も列挙する。こ
こで、「文字認識」の同義語に「文字読み取り」が上っ
ても、「文字読み取り」の同義語には「文字認識」が上
らないという非対称性が一般に求められるが、本方式で
も満されている。
結局、被検索対象文章の中で見い出すべき複数の部分文
字列は、第2図で示す如く有限状態オートマトンとして
表現される。一方、第1図の例で示した被検索文章の文
字列も同様に、第3図のオートマトンで表現される。本
発明では、検索キー(部分文字列)および被検索文章双
方ともに曖昧性(複数の可能性;一意に決定できない要
素が存在する状況)が存在する場合のテキストサーチ機
能を提供しており、これが第三の原理である。
複数の部分文字列を、それらの有限状態オートマトンを
用いて、曖昧性のないテキストから探し出す方法として
は文献〔A.V.Aho,et al.“Efficient String Matching:
An Aid to Bibliographic Search,"Communications of
the ACM,Vol.18,No.6,1975〕による方法が知られてい
る。
以下、本発明を実施例にもとづいて説明する。
第4図は本発明の一実施例である文書ファイリングシス
テムの構成図である。同システムは、系全体の制御とデ
ータベース機能を提供する制御サブシステム100,文書な
どの入力とファイルへの登録を行うための入力サブシス
テム200,文書を認識するための文書認識装置300,高速な
テキストサーチを行うところのテキストサーチサブシス
テム400,検索を行うための端末サブシステム800とから
成っている。
各サブシステムの構成と動作の流れを以下に詳細に説明
する。
入力サブシステム200は、同サブシステムを制御するCPU
(中央処理装置)201,主メモリ202,システムファイル25
1,端末203を基本部として持つ。端末203からの操作によ
りサブシステムを制御し、文書220の各ページの画像を
スキャナ221により光学的に読み取り、ディジタル化し
た画像データをバス210を介してビデオメモリ224にまず
蓄える。同画像データは次に画像処理装置(IP)223に
より冗長性圧縮を行って、MH(Modified Huffmann)符
号あるいはMR(Modified Read)符号に変換され、再度
ビデオメモリ224の別なエリアに戻される。
入力された文書画像は端末203上に確認のため表示され
ると同時に、オペレータは表示された画像を見ながら書
誌的事項などを入力することが出来る。後述するよう
に、定形文書の書誌的事項は自動的に文書理解により読
み取ることが出来るが、不定形文書の書誌的事項や、紙
面上に記入されていない情報は人間が入力する必要があ
る。例えばユーザが定義した文書内容の分類コードや、
紙面上にないキーワードの入力はオペレータに依存せざ
るを得ないのは当然である。また、各文書の価値や位置
付けは、同文書の利用者が独自に付す必要があり、これ
らも端末203より入力することができる。入力された該
書誌的事項などのデータは、ビデオメモリ224内の画像
データ(圧縮されたデータ)と関連付けられて、主メモ
リ202に格納される。
ここで、各文書には固有番号(ドキュメントID)が付さ
れ、同文書固有番号をキーとして画像データと書誌的事
項等が引出せるようにメモリには記憶される。文書固有
番号は、例えば、サブシステムID(“INSYS 01"など)
と日付・時間を表わす文字列の連結で表わすことができ
る。例えばINSYS01.850501.132437は1985年5月1日,13
時24分37秒に入力サブシステムINSYS01より入力された
文書であることを表わす。システムの応用によっては入
力時刻が重要な場合があり、タイムスタンプとしても機
能する。
さて、所定の量の文書がサブシステム200に一定量溜る
か、あるいは端末203からの所定の指令があると、割込
信号がバスアダプタ171へ送られる。
制御サブシステム100は該割込信号をセンスして、入力
サブシステム200のメモリ202内の所定のアドレスを読み
取る。これにより、入力サブシステムの要求の内容を判
断することが出来る。
入力した文書のデータベースへの登録の要求の場合には
次のように動作する。
中央処理装置(CPU)101は主メモリ102内の所定のプロ
グラムに従って、入力サブシステムに一時的に貯えられ
た文書(複数)の固有番号を知り、更にそれらに関する
書誌データ(書誌的事項)と画像データの記憶アドレス
を知る。
制御サブシステム100は書誌データなどの記号データを
記憶・管理するデータベースファイル151と、画像デー
タを記憶・管理するイメージファイル152を有する。
入力サブシステム200から読み出された書誌データは、
第5図に示す表形式のデータベース(ファイル151内に
格納してある)に新規レコードとして書込まれる。上記
表は、MAIN-DIR(メインディレクトリ)なる名称をも
ち、以下のようなカラム(データ欄)を有する。
・DC♯:本システム内の登録文書に対する通番 ・ID♯:入力サブシステムで付した文書固有番号 ・NP:該文書を構成しているページ数 ・TITLE:表題(文字列) ・AUTHOR:著者名(繰返し、すなわち複数データを許
す。) ・CLASS:文書の分類,種類などを表わす符号 ・PUBL♯:出版物のシステム内登録番号(詳細は第7図
に示す表で管理する。) ・VOL,NO,PP:巻,号,頁 ・KWD:複数のキーワード ・ABS:文字コード列(テキストデータ)として表わされ
ている抄録のテキスト固有番号 ・TXT:文字コード列としての本文の固有番号 ・IMG:画像データの固有番号。各画像データは頁毎に管
理されるので、複数のイメージ固有番号が記録される。
書誌データの登録では、上記カラムの内、書誌データに
関係する一部データのみが新規に書き込まれる。
次に、各文書を構成する頁の画像が入力サブシステムの
所定の記憶領域から制御サブシステム100へ読み出さ
れ、イメージファイル152の空領域へ順次記憶される。
同時に、各画像(頁単位)には画像固有番号(IMGID)
が振られる。また、画像データを格納したファイルのボ
リューム番号(VOLSER)、ファイル装置番号(UNIT)、
同ファイルにおける格納物理アドレス(PHYSA)、同フ
ァイルに占めた記憶領域の長さ(SLENG)などを、第6
図(b)および第8図に示すような表に書き込む。新規
に振られた該画像固有番号IMGIDは表MAIN-DIR(第5
図)のIMGカラムにも記録される。
ここで、第6図(b)に示す表IMG-LOCは、イメージフ
ァイル152が、複数の駆動装置、あるいは複数のボリュ
ームから構成されているときに特に有効であり、各画像
の所在を管理する。当然、オペレータによるボリューム
のアンマウントやマウントの動作毎に更新される。
また、第8図は、イメージファイル152の各ボリューム
毎に設けられたディレクトリであり、以下のカラムを有
す。
・IMGID:画像固有番号 ・PN:文書内の頁通番(1〜n) ・PHYSA:ボリューム内の物理アドレス ・SLENG:記録長(例えばセクタ数) ・CODE:画像圧縮符号名 ・SIZE:画像サイズ(画素数) ・DOC♯:文書通番 などである。また、同図において、レコード157のカラ
ムPHYSAのデータはイメージファイル内のイメージデー
タ領域156内での該画像データ158の先頭アドレスを示し
ている。
さて、以上の動作が終了すると、本システムは書誌的事
項とキーワードからの検索が端末群800から行えるよう
になる。
検索用端末から入力された検索条件はゲートウェイ175
を経由して制御サブシステム100のCPU101へ転送され
る。メモリ102の所定の検索処理プログラムに従って、
データベースファイル151内の表MAIN-DIR153(第5図)
の検索が行われる。表153の主要なカラムに対してはイ
ンデキシング(ハッシングや逆ファイルなどの検索高速
化のための手段)が施されていることは言うまでもな
い。
検索処理の結果として、表153(第5図)からDOC♯のリ
ストと、画像固有番号IMGIDのリストが作られメモリ102
の所定の領域に記憶させる。検索用端末から表示要求を
出すと、表IMG-LOC154(第6図(b))と表IMG-DIR155
(第8図)を用いて、イメージファイルの中の位置を同
定して、画像データを逐次メモリ102上へ読み出す。同
時に、読み出された画像データから順に検索用端末へ転
送され、端末上での指示に従って画面上に表示される。
次に本文内容検索に用いるテキストの管理方法について
説明する。
メインディレクトリMAIN-DIR(第5図)で説明したよう
に、各文書は画像データのみならず、文字コード列で表
現されるテキストも記憶・管理される。本実施例の場
合、抄録と本文とが各々テキストとしてテキストファイ
ル451,452,453で記憶・管理される。各テキスト(文字
列)には固有テキスト番号を振り、表153(第5図)のA
BS欄,TXT欄,第6図(a)に示すTXT-LOC表のTXTID欄、
および第9図に示すTEXT-DIR表のTXTID欄に記録され
る。
第9図はテキストファイル451,452,453でのテキスト記
憶と管理の方法を示す。同図において、ファイル記憶領
域466には、テキスト本体が一次元的に記憶される。各
テキスト(一本の文字列)には固有番号TXTIDが振ら
れ、ディレクトリ表、TEXT-DIR465で管理される。表465
は以下のカラムを有す。
・TXTID:テキスト固有番号 ・NCH:該テキストを構成する文字の総数 ・PHYSA:該テキストが記録されている物理的アドレス ・SLENG:該テキストの記憶媒体上での記録の長さ。
・CCLASS:該テキストを表現する文字のクラス(漢字混
り日本文,英字,ローマ字,仮名文字など) 表465のレコード467は、同ファイル内で、該レコードが
表わすテキストが、記憶領域内の468の部分であること
などを表わしている。
一方、第4図に示す如く、複数のボリュームにテキスト
を記録することが可能であり、上記テキストディレクト
リは各ボリューム内のテキストを管理するものである。
複数ボリュームをマウントしている場合、あるテキスト
がどのボリュームに在るのかを知る必要があるが、第6
図(a)に示すTXT-LOC表が各テキストの所在を管理す
る。テキスト固有番号TXTIDを有すテキストが記録され
ているボリューム通番VOLSERと、同ボリュームがマウン
トされているファイル装置番号UNITが管理される。当
然、オペレータにより物理的なボリュームがアンマウン
トされたり、新しくマウントされたりすると、TXT-LOC
は自動的に更新される。
さて、大きな動作の流れとして、文書画像入力,書誌的
事項の入力、および文書登録が終了すると、登録が終了
した文書の本文認識(文書理解)が文書認識装置300に
よって行われる。該認識装置の入力は、イメージファイ
ル152内の第1図に示したような文書画像10であり、認
識結果出力は同図に同じく示したような記号式20であ
る。記号式20内の抄録および本文のテキスト部分は上記
の説明のようにテキストファイル451〜453に新規に記憶
され、管理される。
文書認識を第10図に示す文書認識装置の詳細ブロック図
を用いて説明する。
該認識装置300は制御サブシステム100のバス110とバス
アダプタ371を介して接続され、CPU301により制御され
る。メモリ302は該装置の動作を制御するためのプログ
ラムとパラメータなどのデータを記憶する。
認識すべき画像データはイメージファイル152からメモ
リ321へ転送される。該画像データは圧縮符号化されて
おり、画像処理回路IP322によりビット表現画像に復号
化され、再度メモリ321に記憶される。続いて、ビット
表現に直された画像からパターンの輪郭抽出をIP322が
行い、抽出結果を再びメモリ321に格納する。
抽出された輪郭データは次のように表わされる。
(i Ci xmax,i xmin,i ymax,i ymin,i xsi ysi (θ1i L1i)……(θni Lni)) (1) ここでiは輪郭の固有番号(1,2,3,……)であり、Ciは
該輪郭のクラスを表わす。Ci=0は外輪郭(第11図の実
線1001)を表わし、Ci=1は内輪郭(第11図の破線100
2)を表わす。xmax,xmin,ymax,yminは第11図に示す
ように、輪郭の外郭四角形の頂点の座標を表わす。
(xs,ys)は輪郭長のある一点Ps(例えば輪郭探索で最
初に見い出された点)の座標である。輪郭データ自体
は、点Psを基点として、第12図に示す如く、量子化され
た方向コードθと、同方向が連続する画素数Lとの組の
列で表わされる。
次に、(1)式で表わされる輪郭データから、傾き補正
回路323は文書入力時に発生した傾き角度を検出し、輪
郭データを補正して再びメモリ321へ書き戻す。同傾き
補正アルゴリズムとしては例えば特願昭60-152210号に
て開示した方式を用いることができる。
傾き補正を施した輪郭データの内、特に外郭四角形を表
わすデータ部分(xmax,xmin,ymax,ymin)から、次に
行切り出しと、列切り出しとをボトムアップセグメンタ
(BSG)324により行う。
ボトムアップセグメンタBSGは(1)式の形式で表わさ
れるデータを入力し、(2)式で表わされるパターンリ
ストを生成し、メモリ321に格納する。
(j xmax,j xmin,j ymax,j ymin,j) (2) ここでjはパターン固有番号であり、パターンは互いに
重ならない矩形領域として定義され、(2)式は更に該
矩形領域の頂点座標を定義する。たとえば、第13図で、
破線で示す矩形領域1008,1009はBSGの入力であるが、BS
Gの結果として矩形1010が得られる。矩形1008,1009は各
々一つの輪郭から作られ、成分(エレメント)であり、
矩形1010は一つの文字を形成するパターンである。パタ
ーンjを構成する成分は(2)式で定義される矩形領域
に含まれる矩形を(1)式の輪郭データから探索するこ
とにより求めることができる。もしくは別途求めておい
て、データとして格納しておいてもよい。第14図に行切
り出し処理の結果を、第15図に列切り出し処理の結果を
図式的に示す。
文字切り出し部(CSG)325は、文書の書式などの規則を
まとめた文書知識を参照しながら、上記パターンリスト
から文字を構成するパターンを抽出する。文書知識は第
10図に示す如く、文書知識ファイル(DKF)327に格納さ
れている。
文書知識ファイルには、文書の種類毎に、その表題,著
者名,著者の所属,抄録,本文などのレイアウト(配
置)の構造的な規則などが、フォントの大きさなどのパ
ラメトリックな知識とともに記憶されている。これらの
知識は書式記述言語により記述する。書式記述言語とし
ては、特願昭60-122424に開示した言語を用いることが
できる。
文字切り出し部CSGでは、一文字を本来構成するもので
ありながら、2つ以上のパターンに分れてしまったもの
の統合や、逆に2つ以上の文字が1つのパターンに接触
により融合してしまったものの強制的な分離という処理
も行う。
文字切り出し部CSGは、処理結果として、表題とか抄
録、あるいは本文といった項目ごとに、各文字を構成す
るパターンの番号をリストとして出力する。たとえば、 (ABSTRACT (j1 j2 j3…(jn jn+1 jn+2)…jN)) (3) は抄録がパターン番号jkで表わされる文字の列で構成さ
れることを表わす。ここで、(jn jn+1 jn+2)は該文
字がjn,jn+1,jn+2番目の3つのパターンで構成されてい
ることを表わす。
文字認識部(CRG)331は、上記パターンリスト(例えば
(3)式)とメモリ321上にある輪郭データ((1)式
で表現)とから、各文字パターンを構成する輪郭データ
を前述のごとく抽出し、特徴抽出が可能なデータ構造に
変換する。
文字認識手法としては公知の技術を用いることができる
ので詳細な説明は省略するが、輪郭データから特徴抽出
を行った後、標準パターンファイル333内の標準パター
ンとのパターン整合を行って、各文字を認識することが
できる。第10図において、メモリSTPM334は、参照頻度
が高い標準パターンを記憶するためのものであり、高速
処理を目的とする。
文字認識の結果は、前述したごとく、第1図に示すよう
な記号式20で出力する。文字認識における最終判定過程
において、パターン整合の結果得られる類似度が(4)
式を満すときは、該類似度を与える文字カテゴリ(文字
コード)ωを出力する。
ここで、ρは文字カテゴリkに対する類似度、Kは全
カテゴリ数、εは相対閾値である。
もし、(4)式が満されない場合には、(5)式を満す
文字カテゴリの集合{ω|k=k1,k2,…}を、特殊な
2つの文字コードに挟んで出力する。例えば、ωωk1
ωk2…ωなる文字(コード)列を出力する。ここでω
は“[",ωは“]”を表わす。
以上のような処理により、類似文字が存在して(4)式
が満足されない場合には、例えば、「フルテキストサー
チ」という入力パターンに対して、「フルテキスト〔ト
卜〕サ〔ー一−〕チ」という認識結果が得られる。認識
結果はメモリ321上にバッファリングされた後、一括し
てメモリ102(第4図)に転送される。
制御サブシステム100では、表TXT-LOC(第6図)を参照
して最大のテキスト固有番号を検出し、値1を加算した
値を新規のテキスト固有番号として、認識結果の文字コ
ード列(テキスト)を登録する。登録処理は、メインデ
ィレクトリ153,表TXT-LOCおよび表465(第9図)に対し
て行われ、テキストデータ自体はテキストファイル451
〜453のいずれかに格納する。
さて、以上のようにして、テキストデータが与えられた
文書に対しては、テキストサーチサブシステム400を用
いた検索を行うことが可能である。
次に、本文内容検索のためのテキストサーチサブシステ
ム400とその動作について詳しく説明する。
端末800で発せられる本文内容検索の要求、たとえば「A
BS=*モジニンシキ*」は制御サブシステム100へまず
転送される。サブシステム100では、被検索文書が既に
キーワード検索などによって絞られている場合には、該
文書に付随しているテキストの固有番号をメインディレ
クトリ153から選択し、更に表TXT-LOCを参照することに
より、テキストファイル毎に、被検索テキスト固有番号
のリスト(6)式を作成する。
(ui vi(ti1 ti2…tin)) (6) i=1,2,…,M ここで、uiはi番目のファイル装置番号、viが該ボリュ
ーム通番、tikは該ボリューム上で検索すべきk番目の
テキストのテキスト固有番号である。また、Mはテキス
トファイル装置の最大数である。
一方、被検索文書が全体である場合には、特殊な記号
(例えば(7)式)が全テキストファイルに対して送ら
れる。
(ui vi*)i=1,2,…,M (7) リスト(6)式、或いは(7)式と、部分文字列(たと
えば「モジニンシキ」)が制御サブシステム100から、
バスアダプタ172を経由して、テキストサーチサブシス
テム400内のメモリ402へ転送される。
サブシステム400(第4図)では、メモリ402内の所定の
プログラムに従って、転送された該部分文字列の仮名漢
字変換,異表記発生処理,同義語処理などを行う。仮名
漢字変換辞書,異表記発生規則,同義語辞書はファイル
403に記憶されている。
仮名漢字変換により「モジニンシキ」から「文字認識」
が得られる。同義語辞書を参照することにより更に「文
字読み取り」が得られる。これらの結果に対して異表記
発生規則を適用すると、「文字読み取り」から、送り仮
名の異る異表記「文字読取り」と「文字読取」が得られ
る。仮名漢字変換や同義語発生には公知技術を用いるこ
とができる。
異表記発生規則とは送り仮名,人名などの旧字体などの
多様性を扱うためのものであり、以下の(8)式のよう
な書換規則で表わされる。
ここで、X,Yは任意の漢字であり、「|」は併置を意味
する。更に、異表記発生に関しては例えば、特開昭60-1
50176で開示の方法もとることができる。
異表記発生処理は、入力文字列に(8)式の規則の左辺
が当てはまるものが存在するか否かを判定し、存在する
場合には、当該規則の右辺を生成する。但し、変数X,Y
には当てはめられた漢字を挿入する。
上記の処理により、結局、「モジニンシキ」に対して、
文字列の集合(文字認識,文字読み取り,文字読取り,
文字読取)が得られる。これを(9)式で表わすことに
する。
ここで、nは文字列の数、miはi番目の文字列の長さ、
aijはi番目の文字列Aiの先頭からj番目の文字コード
である。
サブシステム400は更に文字列集合(9)式を所定のプ
ログラムにより、第2図で説明した有限オートマトンを
表わす状態遷移リスト(10)式に変換する。
ここで、リストa list(10)式の各要素は、状態Sji
おいて文字Ckiが入力された(に一致した)場合、状態
はSliに遷移することができることを意味する。また、
同式において、{Sj1,…,Sji,…,Sjm}の中には互
いに等しいものが含まれている。
更に、出力リスト(11)式を生成する。
ここで、(Sjp Aip)は、状態Sjpに到達した時点で、
文字列Aipが見つかったことを意味する。一般にオート
マトンで出力関数と呼ばれるものに相当する。
第16図に、文字列集合(9)式から状態遷移リスト(1
0)式と、出力リスト(11)式を導出するアルゴリズム
のPAD図式(Program Analysis Diagram)を示す。
次に、失敗遷移リスト(12)式を状態遷移リスト(10)
式より作る。
f list=((So Sjo)…(Sm Sjm)) (12) f listの要素(Sm Sjm)は、状態Smに於いて入力され
た文字Ckに対して、遷移すべき状態がa list(10)式の
中に指定されていなかった場合には、f listを参照して
状態Sjmに遷移することを指定する。一般に失敗関数と
呼ばれることがある。
f listを設ける目的は、部分文字列マッチングにおい
て、ある文字列の途中までマッチングが成功したが次の
文字が一致しない場合、すなわち所定の状態遷移先が見
つからない場合に、初期状態Soに状態を戻すことは一般
に正しくない場合があることに対処するためである。例
えば、2つの部分文字列{文字認識,光学的文字読取装
置}を探索することを想定する。いま、「…光学的文字
認識……」という文章を入力したとすると、「光学的文
字」までの部分が2番目の部分文字列に一致するが、次
の文字「認」がマッチングしない。ここでもし、状態を
Soにまで戻して、リセットしてしまうと、オートマトン
は「認識…」以降の文章を入力文字としてしまうため、
結局、「文字認識」という部分文字列を見落してしまう
ことになる。従って、マッチングが失敗した場合の遷移
すべき状態はSoではなく、「文字認識」の遷移パスの
「字」までをマッチングした状態にする必要がある。
さて次に、サブシステム400は、上記説明の如く作成し
た状態遷移リストa list,出力リストσ list,および失
敗遷移リストf listを下位のフレキシブルストリングマ
ッチング回路FSM501〜503に転送する。
フレキシブルストリングマッチング回路501のより詳細
なブロック図を第17図に示す。(FMS502,503についても
同様である。) 上記3種類のリストa list,σ list,f listはバスアダ
プタ571を経由してメモリ513の所定のエリアに格納され
る。マイクロプロセッサ511は所定のマイクロプログラ
ムによって、上記情報をもとに第18図(b)に示す拡張
有限オートマトンを状態遷移行列の形で生成する。
該リストa listおよびf listが直接的に意味するところ
の有限オートマトンは第18図(a)に示す単純な形をし
ている。同図はa listの中の なる2つの遷移を図示したものである。
マイクロプロセッサ511は第18図(a)で示す有限オー
トマトンを同図(b)の如く拡張変換する。同変換は一
意的に定まる変換である。この変換により、曖昧性を有
する被検索テキストからも、所定の部分文字列を探し出
すことが可能となる。ここで、同図において、f(Sj
は失敗遷移リストf listから作られる失敗関数であり、
状態Sjでマッチングに失敗したときの遷移先の状態を表
わす。また、状態Wjは状態Sjに一対一に対応するもので
あり、曖昧な文字列(記号〔 〕で囲まれた文字列)を
スキャンしている状態である。更にまた、状態Tj1,Tj2
は状態Sjからの遷移に対応して、状態Wjから派生する状
態であり、曖昧な文字列の中に探索中の文字(同図の場
合、Ck1またはCk2)を見い出した状態である。
実際には、マイクロプロセッサ511は2つのリストa lis
tとf listから第19図(a)に示す状態遷移表を直接生
成することが出来る。該状態遷移表の列(縦)は現在の
状態を表わし、行(横)は同状態で入力される文字(コ
ード)に対応する。表の中には、次に遷移すべき状態が
記される。同状態遷移表を生成するアルゴリズムは第18
図による説明から容易に類推できるので、説明を省略す
る。
マイクロプロセッサ511は更に出力リストσ listを第19
図(b)に示す出力表の形に変換して上記状態遷移表と
ともにメモリ513の所定のエリアに記録する。
以下に、上記有限状態オートマトンを用いたストリング
サーチアルゴリズムを記す。
〔ストリングサーチアルゴリズム〕
begin γ:‘false'; S:So; While not eof do begin read(c); S:next(c,S); if out(S)<>nil then γ:=‘true'; end; end; ここで、関数(c,S)は第19図(a)に示す状態遷移表
から、文字cと現在の状態Sをもとに次の状態を求める
関数である。また、関数out(S)は第19図(b)に示
す出力表を参照して状態Sに出力があるか否かを判断す
る関数である。
なお、上記説明では1文字のコードの単位に状態を割当
てているが、日本語のように1文字のコードが2バイト
になる場合は、1バイトづつに分割して、上記方法を適
用することができる。
次に、テキストサーチサブシステム400は、上位から送
られて来る被検索テキスト固有番号リスト(6)式,
(7)式を受理し、各FSMで検索処理すべきテキスト固
有番号リストとして、対応するFSMへ転送する。従って
各FSMは、対応するテキストファイルに検索対象が存在
すれば、その固有番号リスト(ti1 ti2 ti3……tin
を得る。テキスト固有番号リストはメモリ513(第17
図)に格納される。マイクロプロセッサMPU511はマイク
ロプログラムメモリ512内の所定のプログラム(第20図
参照)に従って、まず各テキストの所在物理アドレスを
検知する。テキスト固有番号と物理アドレスは第9図で
説明したTEXT-DIRで管理されており、該表をファイル45
1から読み出して検知することができる。
マイクロプロセッサ511は次に各テキストデータをファ
イル451から読み出す。ファイル制御部531は読み出した
テキストデータ(文字列)を逐次FIFO(First-in-first
-out)回路532へ入力する。マイクロプロセッサMPU511
はFIFO532から一文字づつ読み出し、メモリ513内に定義
されている有限オートマトン(第18図(b))に従って
所定の部分文字列が存在するか否かを検定する。ストリ
ングマッチング結果b list(第20図参照)を上位プロセ
ッサのメモリ402へ返送する。
CPU1は所定のプログラムに従って、下位の複数のFSMか
ら返送される検索条件が合致したテキスト固有番号リス
トを1つにまとめ、更に上位の制御サブシステム内のメ
モリ102に転送する。テキスト固有番号から、メインデ
ィレクトリ153(第5図)を参照することにより、部分
文字列がマッチングした文書の固有番号DOC♯や文書画
像の固有番号IMGIDあるいは表題TITLEなどを同定するこ
とが出来る。
これらの検索結果は端末800へ返送される。ユーザは表
題などをCRT上で見ながら、所望の文書の画像を同CRTに
呼び出して表示することができる。
次に第二の実施例について説明する。該実施例ではフレ
キシブルストリングマッチング回路501のみの構成方法
が異っている。第21図は第二の実施例におけるフレキシ
ブルストリングマッチング回路FSMの構成図である。
同図において、2次記憶装置(テキストファイル)461
は同時に信号の読み出しができる複数のヘッドを有して
おり、本実施例では、同時に4個のヘッドからデータを
読み出すことが可能である。該データはファイル制御装
置FCU541を経由して、各々4個のFIFO回路551〜554へ転
送される。
一方、上位サブシステム400から送られる検索条件はマ
イクロプロセッサ511で翻訳された後、データメモリを
内包するマイクロプロセッサユニットMPU1〜MPU4561〜5
64へ転送される。
テキストファイル461から読み出されるテキストデータ
はFIFO回路551〜554を経由して、各々マイクロプロセッ
サユニット561〜564へ読み出される。該マイクロプロセ
ッサユニットは並行して、4本の文字列(テキストデー
タ)の中から所定の部分文字列を探索し、結果をデータ
バス521を介してマイクロプロセッサ511へ返送する。
他の部分は第一の実施例と等しいので説明を省略する。
次に第三の実施例について説明する。同実施例では、ハ
ードウエア構成は第一の実施例または第二の実施例を等
しいが、テキストサーチ処理が異る。
階層的な検索法を用いて、まずキーワードや分類コード
を用いて被検索文書を絞り込む場合を考えると、同過程
でスクリーンされた被検索文書はあるテキストファイル
のボリュームに偏在していることが一般的にある。
本実施例システムでは、複数のテキストファイルボリュ
ームに、多重性を有効にするために重複してテキストデ
ータを記憶する。CPU401(第4図参照)は所定のプログ
ラムに従って、複数のボリュームに多重に記憶されてい
るテキストについては、複数のボリュームへのアクセス
回数が均等になるようにアクセスすべきボリュームを選
択する。本方式を用いれば、すべてのフレキシブルスト
リングマッチング回路が効率よく動作し、全体として高
速な探索が可能となる。
以上の実施例では、フレキシブルストリングサーチ回路
の多重度は3〜4となっているが、本発明方式では多重
度は限定されない。
また、テキストサーチは文書全体に対して一様に行うと
して説明したが、ページの境界に関する情報をテキスト
中に特殊記号で記録しておき、ストリングマッチングが
成功したページ番号をも、マッチング結果として出力す
るように拡張することが可能であり、同方式も本発明に
含まれる。
更にまた、説明は日本語テキストについて行ったが、全
く同様に英語などの他の言語にも適用することが可能で
ある。
また、上記実施例ではテキストデータは文字認識により
抽出するとしたが、明らかに人手などによって入力され
たテキストデータに対しても本文内容検索の方式は適用
可能であり、本発明に含まれる。
更にまた、システム形態は第4図に示す形態で説明した
が、小形システム,スタンドアロン形システムにおいて
も、その本質とするところは変わらず、本発明が含む所
である。特に、別システムで用意したテキストファイル
とイメージファイルをロードして小規模な検索ステーシ
ョンとすることが考えられるが、本発明に含まれる。
また、検索条件は論理的演算子によって組合せることが
可能なことや、ある相対的位置関係を満す部分文字列の
探索が可能となるように拡張できることは、言うまでも
ない。特に、複数の部分文字列のそれぞれがどこに存在
したかも出力することにより、後処理により組合せ的な
高度な検索が高速に実現される。
〔発明の効果〕
以上、本発明システムによれば、文書の本文などの中身
を参照して所望の文書を高速に検索することが可能とな
り、文書を登録した時点では考えられなかった概念から
も効率よく検索することが可能となる。特に、登録時
に、分類コードやキーワードとして何が適切かを付すの
に過度に悩む必要がなくなる。結果として、検索精度を
高めることが可能となると同時に、ノイズ発生率を低く
おさえることが可能となる。
更に、テキストサーチサブシステムの中を並列化するこ
とにより、高速な本文検索が可能となる。特に、読み出
しヘッド毎にストリングマッチング回路を付加すること
により高速化が達成される。
大規模な文書ファイルを対象にする検索の場合には、キ
ーワードや書誌的事項により被検索文書を減らしてか
ら、本文内容検索を行うことができ、全体として効率の
よい検索が行える。
また、文書画像からテキストデータを得るには従来技術
では文書認識結果を人間が逐次検査し、誤りを修正する
必要があったが、本発明によれば人間の介在を無くすこ
とが可能である。従来は上記理由から実質的には本文内
容検索が実現されておらず、本発明によって効果的な本
文内容検索が可能となる。
【図面の簡単な説明】
第1図は文書画像と文書理解の結果を示す図、第2図は
部分文字列から生成される同音異義語と同義語の文字列
の状態遷移図、第3図は曖昧性を含む文字認識結果の文
字列の状態遷移図である。第4図は第一の実施例のシス
テム構成図、第5図〜第9図は文書,画像,テキストを
蓄積・管理する方法を説明する図、第10図は文書認識装
置のブロック図、第11図は文字パターンを囲む矩形領域
の説明図、第12図はパターンを記述する輪郭形状の表現
方法を説明する図、第13図はパターン成分と文字パター
ンの関係を説明する図である。第14図,第15図は各々ボ
トムアップセグメンタによる行切り出しと列切り出しの
結果を示す図である。第16図は文字列集合から状態遷移
リストを得るアルゴリズムの説明図、第17図はフレキシ
ブルストリングマッチング回路のブロック図、第18図は
曖昧文字列を許容する拡張有限状態オートマトン、第19
図は拡張有限状態オートマトンの状態遷移表、第20図は
FSM回路のプログラムを説明する図である。第21図は、
第二の実施例におけるフレキシブルストリングマッチン
グ回路の構成図である。 符号の説明 100……制御サブシステム,200……入力サブシステム,30
0……文書認識装置,400……テキストサーチサブシステ
ム,800……検索用端末サブシステム,501……フレキシブ
ルストリングマッチング回路,151……データベースファ
イル,152……イメージファイル,451……テキストファイ
ル。
───────────────────────────────────────────────────── フロントページの続き (72)発明者 東野 純一 東京都国分寺市東恋ヶ窪1丁目280番地 株式会社日立製作所中央研究所内 (72)発明者 花野井 歳弘 神奈川県小田原市国府津2880番地 株式会 社日立製作所小田原工場内 (56)参考文献 特開 昭60−105039(JP,A) 特開 昭60−114967(JP,A) 特開 昭58−144980(JP,A)

Claims (6)

    【特許請求の範囲】
  1. 【請求項1】文書を蓄積して検索する文書ファイリング
    システムにおいて、 文書画像を蓄積するイメージファイルと、 上記文書画像に存在する文字パターンを切り出し、各文
    字パターンについて予め記憶されている標準文字パター
    ンとパターン整合を行い、文字カテゴリが一意に判定可
    能な場合には該当する文字コードを、文字カテゴリが一
    意に判定不能な場合には複数の認識候補に該当する複数
    の文字コードを曖昧認識結果を示す特殊文字コードに挾
    み、認識結果文字コード列として出力する文書認識手段
    と、 上記文書認識手段から出力される認識結果文字コード列
    を、上記イメージファイル内の該当する文書画像と関連
    付けて蓄積するテキストファイルと、 検索条件である検索文字コード列を入力する検索条件入
    力手段と、 上記テキストファイルから読み出される認識結果文字コ
    ード列を走査して、上記検索条件入力手段から入力され
    た検索文字コード列が、曖昧認識結果を包含する認識結
    果文字コード列に含まれているか否かを判定する文字列
    照合手段と、 上記文字列照合手段により上記検索文字コード列が含ま
    れると判定された認識結果文字コード列に関連付けられ
    た文書画像を、上記イメージファイルから読み出して出
    力する検索出力手段とを、 有することを特徴とする文書ファイリングシステム。
  2. 【請求項2】特許請求の範囲第1項の文書ファイリング
    システムにおいて、 上記文字列照合手段は、上記検索条件入力手段から複数
    の検索文字コード列を入力し、予め定めた規則に従っ
    て、上記複数の検索文字コード列から拡張有限オートマ
    トンを状態遷移行列の形で生成し、上記拡張有限オート
    マトンに上記テキストファイルから読み出される認識結
    果文字コード列を入力することによって、上記複数の検
    索文字コード列が含まれているか否かを一括して判定す
    ることを特徴とする文書ファイリングシステム。
  3. 【請求項3】特許請求の範囲第1項の文書ファイリング
    システムにおいて、 上記テキストファイルとそれに接続される上記文字列照
    合手段の組みを複数有し、 上記検索条件入力手段から入力される検索文字コード列
    を上記複数の文字列照合手段に転送し、上記複数のテキ
    ストファイル内の認識結果文字コード列の検索処理を並
    行して行うことを特徴とする文書ファイリングシステ
    ム。
  4. 【請求項4】特許請求の範囲第2項の文書ファイリング
    システムにおいて、 仮名漢字変換辞書を有し、 上記文字列照合手段は、上記検索文字コード列に対して
    上記仮名漢字変換辞書を参照して複数の文字コード列を
    生成し、それらの文字コード列に対して上記拡張有限オ
    ートマトンを生成することを特徴とする文書ファイリン
    グシステム。
  5. 【請求項5】特許請求の範囲第2項の文書ファイリング
    システムにおいて、 異表記発生規則ファイルを有し、 上記文字列照合手段は、上記検索文字コード列に対して
    上記異表記発生規則ファイルを参照して複数の異表記を
    生成し、それらの異表記に対応する複数の文字コード列
    に対して上記拡張有限オートマトンを生成することを特
    徴とする文書ファイリングシステム。
  6. 【請求項6】特許請求の範囲第2項の文書ファイリング
    システムにおいて、 同義語辞書ファイルを有し、 上記文字列照合手段は、上記検索文字コード列に対して
    上記同義語辞書を参照して複数の同義語を生成し、それ
    らの同義語に対応する複数の文字コード列に対して上記
    拡張有限オートマトンを生成することを特徴とする文書
    ファイリングシステム。
JP60184181A 1985-08-23 1985-08-23 文書フアイリングシステム Expired - Lifetime JPH0797373B2 (ja)

Priority Applications (4)

Application Number Priority Date Filing Date Title
JP60184181A JPH0797373B2 (ja) 1985-08-23 1985-08-23 文書フアイリングシステム
US07/139,781 US5265242A (en) 1985-08-23 1987-12-30 Document retrieval system for displaying document image data with inputted bibliographic items and character string selected from multiple character candidates
US07/559,994 US4985863A (en) 1985-08-23 1990-07-30 Document storage and retrieval system
US08/111,511 US5628003A (en) 1985-08-23 1993-08-24 Document storage and retrieval system for storing and retrieving document image and full text data

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP60184181A JPH0797373B2 (ja) 1985-08-23 1985-08-23 文書フアイリングシステム

Related Child Applications (1)

Application Number Title Priority Date Filing Date
JP6071820A Division JPH06342483A (ja) 1994-04-11 1994-04-11 文書ファイリングシステム

Publications (2)

Publication Number Publication Date
JPS6244878A JPS6244878A (ja) 1987-02-26
JPH0797373B2 true JPH0797373B2 (ja) 1995-10-18

Family

ID=16148777

Family Applications (1)

Application Number Title Priority Date Filing Date
JP60184181A Expired - Lifetime JPH0797373B2 (ja) 1985-08-23 1985-08-23 文書フアイリングシステム

Country Status (2)

Country Link
US (1) US4985863A (ja)
JP (1) JPH0797373B2 (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7623259B2 (en) 2004-09-14 2009-11-24 Canon Kabushiki Kaisha Image processing apparatus and image processing method to store image data for subsequent retrieval

Families Citing this family (143)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5245166A (en) * 1987-04-20 1993-09-14 Cognitronics Imaging Systems, Inc. Method of processing a document carrying two kinds of indicia
JP2702927B2 (ja) * 1987-06-15 1998-01-26 株式会社日立製作所 文字列検索装置
JPH01147750A (ja) * 1987-12-04 1989-06-09 Ricoh Co Ltd 画像処理装置
JPH0217573A (ja) * 1988-07-06 1990-01-22 Mitsubishi Electric Corp フアイル装置
JP2790466B2 (ja) * 1988-10-18 1998-08-27 株式会社日立製作所 文字列検索方法及び装置
US5291592A (en) * 1989-05-15 1994-03-01 Sharp Kabushiki Kaisha System having document scanner for optically scanning information whereby a first information contains control information indicating a number of sheets to be scanned
US5369716A (en) * 1989-08-31 1994-11-29 Kabushiki Kaisha Toshiba Document reader and reading processing method therefor
JP2978519B2 (ja) * 1989-12-15 1999-11-15 株式会社日立製作所 文書データ表示方法およびシステム
JPH03294963A (ja) * 1990-04-12 1991-12-26 Ricoh Co Ltd 文書検索装置
JPH0418673A (ja) * 1990-05-11 1992-01-22 Hitachi Ltd テキスト情報抽出方法および装置
US5396588A (en) * 1990-07-03 1995-03-07 Froessl; Horst Data processing using digitized images
US5444840A (en) * 1990-06-12 1995-08-22 Froessl; Horst Multiple image font processing
JP2829937B2 (ja) * 1990-08-06 1998-12-02 キヤノン株式会社 画像検索方法及び装置
JP2835178B2 (ja) * 1990-11-28 1998-12-14 株式会社東芝 文書読取装置
FR2681454B1 (fr) * 1991-09-16 1995-08-18 Aerospatiale Procede et dispositif de traitement d'informations alphanumeriques et graphiques pour la constitution d'une banque de donnees.
US5926565A (en) * 1991-10-28 1999-07-20 Froessl; Horst Computer method for processing records with images and multiple fonts
US5350303A (en) * 1991-10-24 1994-09-27 At&T Bell Laboratories Method for accessing information in a computer
US5875263A (en) * 1991-10-28 1999-02-23 Froessl; Horst Non-edit multiple image font processing of records
CA2078423C (en) * 1991-11-19 1997-01-14 Per-Kristian Halvorsen Method and apparatus for supplementing significant portions of a document selected without document image decoding with retrieved information
US5390259A (en) * 1991-11-19 1995-02-14 Xerox Corporation Methods and apparatus for selecting semantically significant images in a document image without decoding image content
US8352400B2 (en) 1991-12-23 2013-01-08 Hoffberg Steven M Adaptive pattern recognition based controller apparatus and method and human-factored interface therefore
US5488719A (en) * 1991-12-30 1996-01-30 Xerox Corporation System for categorizing character strings using acceptability and category information contained in ending substrings
WO1993018484A1 (en) * 1992-03-10 1993-09-16 Oracle Corporation Method and apparatus for comparison of data strings
US5579407A (en) * 1992-04-21 1996-11-26 Murez; James D. Optical character classification
JP2534600B2 (ja) * 1992-06-19 1996-09-18 松下電器産業株式会社 文字列照合装置
JP2994926B2 (ja) * 1993-10-29 1999-12-27 松下電器産業株式会社 有限状態機械作成方法とパターン照合機械作成方法とこれらを変形する方法および駆動方法
JPH07506207A (ja) * 1993-02-23 1995-07-06 ゼロックス コーポレイション 文字認識におけるストリングのカテゴライズ
EP0625757B1 (en) * 1993-05-07 2000-08-23 Canon Kabushiki Kaisha Selective document retrieval method and system
US5455945A (en) * 1993-05-19 1995-10-03 Vanderdrift; Richard System and method for dynamically displaying entering, and updating data from a database
US5408630A (en) * 1993-08-20 1995-04-18 Iii G.I. Ltd. Three-state virtual volume system for managing document storage to permanent media
US5623681A (en) * 1993-11-19 1997-04-22 Waverley Holdings, Inc. Method and apparatus for synchronizing, displaying and manipulating text and image documents
US6877137B1 (en) 1998-04-09 2005-04-05 Rose Blush Software Llc System, method and computer program product for mediating notes and note sub-notes linked or otherwise associated with stored or networked web pages
US5696963A (en) * 1993-11-19 1997-12-09 Waverley Holdings, Inc. System, method and computer program product for searching through an individual document and a group of documents
US5799325A (en) * 1993-11-19 1998-08-25 Smartpatents, Inc. System, method, and computer program product for generating equivalent text files
US5806079A (en) * 1993-11-19 1998-09-08 Smartpatents, Inc. System, method, and computer program product for using intelligent notes to organize, link, and manipulate disparate data objects
US5991751A (en) * 1997-06-02 1999-11-23 Smartpatents, Inc. System, method, and computer program product for patent-centric and group-oriented data processing
US5623679A (en) * 1993-11-19 1997-04-22 Waverley Holdings, Inc. System and method for creating and manipulating notes each containing multiple sub-notes, and linking the sub-notes to portions of data objects
US6963920B1 (en) 1993-11-19 2005-11-08 Rose Blush Software Llc Intellectual asset protocol for defining data exchange rules and formats for universal intellectual asset documents, and systems, methods, and computer program products related to same
US6339767B1 (en) 1997-06-02 2002-01-15 Aurigin Systems, Inc. Using hyperbolic trees to visualize data generated by patent-centric and group-oriented data processing
JP3986098B2 (ja) * 1994-08-16 2007-10-03 富士通株式会社 文字列検索方法及び文字列検索装置
US5625711A (en) 1994-08-31 1997-04-29 Adobe Systems Incorporated Method and apparatus for producing a hybrid data structure for displaying a raster image
US5946678A (en) * 1995-01-11 1999-08-31 Philips Electronics North America Corporation User interface for document retrieval
JPH08255155A (ja) * 1995-03-16 1996-10-01 Fuji Xerox Co Ltd 全文登録語検索装置および方法
US5729741A (en) * 1995-04-10 1998-03-17 Golden Enterprises, Inc. System for storage and retrieval of diverse types of information obtained from different media sources which includes video, audio, and text transcriptions
US5754782A (en) * 1995-12-04 1998-05-19 International Business Machines Corporation System and method for backing up and restoring groupware documents
US5960448A (en) * 1995-12-15 1999-09-28 Legal Video Services Inc. System and method for displaying a graphically enhanced view of a region of a document image in which the enhanced view is correlated with text derived from the document image
JP2833580B2 (ja) 1996-04-19 1998-12-09 日本電気株式会社 全文インデックス作成装置および全文データベース検索装置
JP2973944B2 (ja) * 1996-06-26 1999-11-08 富士ゼロックス株式会社 文書処理装置および文書処理方法
US5761436A (en) * 1996-07-01 1998-06-02 Sun Microsystems, Inc. Method and apparatus for combining truncated hyperlinks to form a hyperlink aggregate
JP3427692B2 (ja) * 1996-11-20 2003-07-22 松下電器産業株式会社 文字認識方法および文字認識装置
JPH10307846A (ja) * 1997-03-03 1998-11-17 Toshiba Corp ドキュメント情報管理システム、ドキュメント情報管理方法、及びドキュメント検索方法
US6744936B2 (en) 1997-12-30 2004-06-01 Imagetag, Inc. Apparatus and method for simultaneously managing paper-based documents and digital images of the same
US6674924B2 (en) 1997-12-30 2004-01-06 Steven F. Wright Apparatus and method for dynamically routing documents using dynamic control documents and data streams
US6192165B1 (en) 1997-12-30 2001-02-20 Imagetag, Inc. Apparatus and method for digital filing
US6427032B1 (en) 1997-12-30 2002-07-30 Imagetag, Inc. Apparatus and method for digital filing
EA003619B1 (ru) * 1998-04-01 2003-08-28 Уильям Петерман Система и способ поиска электронных документов, созданных с помощью оптического распознавания знаков
JP2000137728A (ja) * 1998-11-02 2000-05-16 Fujitsu Ltd 文書解析装置及びプログラム記録媒体
US6363381B1 (en) * 1998-11-03 2002-03-26 Ricoh Co., Ltd. Compressed document matching
US6397205B1 (en) 1998-11-24 2002-05-28 Duquesne University Of The Holy Ghost Document categorization and evaluation via cross-entrophy
US7966078B2 (en) 1999-02-01 2011-06-21 Steven Hoffberg Network media appliance system and method
US7966328B2 (en) 1999-03-02 2011-06-21 Rose Blush Software Llc Patent-related tools and methodology for use in research and development projects
US7716060B2 (en) 1999-03-02 2010-05-11 Germeraad Paul B Patent-related tools and methodology for use in the merger and acquisition process
US6470336B1 (en) * 1999-08-25 2002-10-22 Matsushita Electric Industrial Co., Ltd. Document image search device and recording medium having document search program stored thereon
JP2001202466A (ja) * 2000-01-18 2001-07-27 Hitachi Ltd 帳票種別判別装置
US6980313B2 (en) * 2000-07-11 2005-12-27 Imran Sharif Fax-compatible internet appliance
US20020078445A1 (en) * 2000-07-11 2002-06-20 Imran Sharif Internet appliance for interactive audio/video display using a remote control unit for user input
US7245291B2 (en) 2000-07-11 2007-07-17 Imran Sharif System and method for internet appliance data entry and navigation
US20030115167A1 (en) * 2000-07-11 2003-06-19 Imran Sharif Web browser implemented in an Internet appliance
DE10054583C2 (de) * 2000-11-03 2003-06-18 Digital Design Gmbh Verfahren und Vorrichtung zum Aufzeichnen, Suchen und Wiedergeben von Notizen
JP2002189747A (ja) 2000-12-19 2002-07-05 Hitachi Ltd 文書情報の検索方法
US6999204B2 (en) * 2001-04-05 2006-02-14 Global 360, Inc. Document processing using color marking
US20030037302A1 (en) * 2001-06-24 2003-02-20 Aliaksei Dzienis Systems and methods for automatically converting document file formats
US7194513B2 (en) * 2001-07-08 2007-03-20 Imran Sharif System and method for using an internet appliance to send/receive digital content files as E-mail attachments
US7737134B2 (en) * 2002-03-13 2010-06-15 The Texas A & M University System Anticancer agents and use
AU2003293135A1 (en) * 2002-12-03 2004-06-23 Future Quote Incorporated System and method for managing investment information
US7310769B1 (en) 2003-03-12 2007-12-18 Adobe Systems Incorporated Text encoding using dummy font
US7949732B1 (en) 2003-05-12 2011-05-24 Sourcefire, Inc. Systems and methods for determining characteristics of a network and enforcing policy
WO2004104860A1 (ja) * 2003-05-20 2004-12-02 Victor Company Of Japan, Limited 電子化サービスマニュアル表示制御装置
JP2005135169A (ja) * 2003-10-30 2005-05-26 Nec Corp 携帯端末およびデータ処理方法
US8442331B2 (en) 2004-02-15 2013-05-14 Google Inc. Capturing text from rendered documents using supplemental information
US7707039B2 (en) * 2004-02-15 2010-04-27 Exbiblio B.V. Automatic modification of web pages
US20060136629A1 (en) * 2004-08-18 2006-06-22 King Martin T Scanner having connected and unconnected operational behaviors
US20060053097A1 (en) * 2004-04-01 2006-03-09 King Martin T Searching and accessing documents on private networks for use with captures from rendered documents
US10635723B2 (en) 2004-02-15 2020-04-28 Google Llc Search engines and systems with handheld document data capture devices
US20060041484A1 (en) * 2004-04-01 2006-02-23 King Martin T Methods and systems for initiating application processes by data capture from rendered documents
US7812860B2 (en) * 2004-04-01 2010-10-12 Exbiblio B.V. Handheld device for capturing text from both a document printed on paper and a document displayed on a dynamic display device
US9008447B2 (en) * 2004-04-01 2015-04-14 Google Inc. Method and system for character recognition
US20060081714A1 (en) 2004-08-23 2006-04-20 King Martin T Portable scanning device
US20080313172A1 (en) * 2004-12-03 2008-12-18 King Martin T Determining actions involving captured information and electronic content associated with rendered documents
US7894670B2 (en) 2004-04-01 2011-02-22 Exbiblio B.V. Triggering actions in response to optically or acoustically capturing keywords from a rendered document
US9116890B2 (en) 2004-04-01 2015-08-25 Google Inc. Triggering actions in response to optically or acoustically capturing keywords from a rendered document
US9143638B2 (en) 2004-04-01 2015-09-22 Google Inc. Data capture from rendered documents using handheld device
US8081849B2 (en) * 2004-12-03 2011-12-20 Google Inc. Portable scanning and memory device
US20070300142A1 (en) * 2005-04-01 2007-12-27 King Martin T Contextual dynamic advertising based upon captured rendered text
US8146156B2 (en) 2004-04-01 2012-03-27 Google Inc. Archive of text captures from rendered documents
US20060098900A1 (en) * 2004-09-27 2006-05-11 King Martin T Secure data gathering from rendered documents
US7990556B2 (en) 2004-12-03 2011-08-02 Google Inc. Association of a portable scanner with input/output and storage devices
US8713418B2 (en) * 2004-04-12 2014-04-29 Google Inc. Adding value to a rendered document
US8874504B2 (en) * 2004-12-03 2014-10-28 Google Inc. Processing techniques for visual capture data from a rendered document
US8620083B2 (en) 2004-12-03 2013-12-31 Google Inc. Method and system for character recognition
US8489624B2 (en) 2004-05-17 2013-07-16 Google, Inc. Processing techniques for text capture from a rendered document
US20050289107A1 (en) * 2004-06-25 2005-12-29 Yan Arrouye Methods and systems for managing data
US7962449B2 (en) * 2004-06-25 2011-06-14 Apple Inc. Trusted index structure in a network environment
US8521720B2 (en) * 2004-06-25 2013-08-27 Apple Inc. Methods and systems for managing data
US7730012B2 (en) 2004-06-25 2010-06-01 Apple Inc. Methods and systems for managing data
US7437358B2 (en) * 2004-06-25 2008-10-14 Apple Inc. Methods and systems for managing data
US8156123B2 (en) * 2004-06-25 2012-04-10 Apple Inc. Method and apparatus for processing metadata
US8538997B2 (en) 2004-06-25 2013-09-17 Apple Inc. Methods and systems for managing data
US8131674B2 (en) 2004-06-25 2012-03-06 Apple Inc. Methods and systems for managing data
US7693856B2 (en) 2004-06-25 2010-04-06 Apple Inc. Methods and systems for managing data
US7774326B2 (en) * 2004-06-25 2010-08-10 Apple Inc. Methods and systems for managing data
US8150837B2 (en) * 2004-06-25 2012-04-03 Apple Inc. Methods and systems for managing data
US20050289127A1 (en) * 2004-06-25 2005-12-29 Dominic Giampaolo Methods and systems for managing data
US9081872B2 (en) 2004-06-25 2015-07-14 Apple Inc. Methods and systems for managing permissions data and/or indexes
US8346620B2 (en) 2004-07-19 2013-01-01 Google Inc. Automatic modification of web pages
US7539681B2 (en) * 2004-07-26 2009-05-26 Sourcefire, Inc. Methods and systems for multi-pattern searching
US8046833B2 (en) * 2005-11-14 2011-10-25 Sourcefire, Inc. Intrusion event correlation with network discovery information
US7733803B2 (en) * 2005-11-14 2010-06-08 Sourcefire, Inc. Systems and methods for modifying network map attributes
US7948988B2 (en) * 2006-07-27 2011-05-24 Sourcefire, Inc. Device, system and method for analysis of fragments in a fragment train
US7701945B2 (en) * 2006-08-10 2010-04-20 Sourcefire, Inc. Device, system and method for analysis of segments in a transmission control protocol (TCP) session
EP2067119A2 (en) * 2006-09-08 2009-06-10 Exbiblio B.V. Optical scanners, such as hand-held optical scanners
US20100278453A1 (en) * 2006-09-15 2010-11-04 King Martin T Capture and display of annotations in paper and electronic documents
US20080196102A1 (en) * 2006-10-06 2008-08-14 Sourcefire, Inc. Device, system and method for use of micro-policies in intrusion detection/prevention
US8069352B2 (en) * 2007-02-28 2011-11-29 Sourcefire, Inc. Device, system and method for timestamp analysis of segments in a transmission control protocol (TCP) session
US8055104B2 (en) * 2007-03-02 2011-11-08 Adi, Llc Process performance evaluation for Enterprise data systems
EP2156290B1 (en) * 2007-04-30 2020-03-25 Cisco Technology, Inc. Real-time awareness for a computer network
CN101354703B (zh) * 2007-07-23 2010-11-17 夏普株式会社 文档图像处理装置和文档图像处理方法
CN101354704B (zh) * 2007-07-23 2011-01-12 夏普株式会社 字形特征字典制作装置及具备该装置的文档图像处理装置
US20110145068A1 (en) * 2007-09-17 2011-06-16 King Martin T Associating rendered advertisements with digital content
US8474043B2 (en) * 2008-04-17 2013-06-25 Sourcefire, Inc. Speed and memory optimization of intrusion detection system (IDS) and intrusion prevention system (IPS) rule processing
WO2010045089A1 (en) 2008-10-08 2010-04-22 Sourcefire, Inc. Target-based smb and dce/rpc processing for an intrusion detection system or intrusion prevention system
WO2010096191A2 (en) * 2009-02-18 2010-08-26 Exbiblio B.V. Automatically capturing information, such as capturing information using a document-aware device
EP2406767A4 (en) * 2009-03-12 2016-03-16 Google Inc AUTOMATIC CONTENT SUPPLY ASSOCIATED WITH CAPTURED INFORMATION, TYPE INFORMATION CAPTURED IN REAL TIME
US8447066B2 (en) 2009-03-12 2013-05-21 Google Inc. Performing actions based on capturing information from rendered documents, such as documents under copyright
US9081799B2 (en) * 2009-12-04 2015-07-14 Google Inc. Using gestalt information to identify locations in printed information
US9323784B2 (en) * 2009-12-09 2016-04-26 Google Inc. Image search using text-based elements within the contents of images
CA2789824C (en) 2010-04-16 2018-11-06 Sourcefire, Inc. System and method for near-real time network attack detection, and system and method for unified detection via detection routing
JP5591578B2 (ja) * 2010-04-19 2014-09-17 日本電産サンキョー株式会社 文字列認識装置および文字列認識方法
US8433790B2 (en) 2010-06-11 2013-04-30 Sourcefire, Inc. System and method for assigning network blocks to sensors
US8671182B2 (en) 2010-06-22 2014-03-11 Sourcefire, Inc. System and method for resolving operating system or service identity conflicts
US8601034B2 (en) 2011-03-11 2013-12-03 Sourcefire, Inc. System and method for real time data awareness
US9171203B2 (en) * 2013-09-10 2015-10-27 Dropbox, Inc. Scanbox
JP7574167B2 (ja) * 2021-10-29 2024-10-28 キヤノン株式会社 画像処理装置、画像処理方法、プログラム

Family Cites Families (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR2293741A1 (fr) * 1974-12-04 1976-07-02 Anvar Procede et systeme de rapprochement iteratif et simultane de donnees avec un ensemble de donnees de reference
US4270182A (en) * 1974-12-30 1981-05-26 Asija Satya P Automated information input, storage, and retrieval system
US4241402A (en) * 1978-10-12 1980-12-23 Operating Systems, Inc. Finite state automaton with multiple state types
US4490811A (en) * 1979-03-14 1984-12-25 Yianilos Peter N String comparator device system circuit and method
US4623985A (en) * 1980-04-15 1986-11-18 Sharp Kabushiki Kaisha Language translator with circuitry for detecting and holding words not stored in dictionary ROM
JPS589982B2 (ja) * 1980-05-30 1983-02-23 工業技術院長 情報検索装置
US4384329A (en) * 1980-12-19 1983-05-17 International Business Machines Corporation Retrieval of related linked linguistic expressions including synonyms and antonyms
JPS58144980A (ja) * 1982-02-24 1983-08-29 Fujitsu Ltd 文字認識処理用後処理システム
US4456973A (en) * 1982-04-30 1984-06-26 International Business Machines Corporation Automatic text grade level analyzer for a text processing system
US4507750A (en) * 1982-05-13 1985-03-26 Texas Instruments Incorporated Electronic apparatus from a host language
US4468756A (en) * 1982-05-20 1984-08-28 Chan Computer Corporation Method and apparatus for processing languages
JPS60105039A (ja) * 1983-11-12 1985-06-10 Nippon Telegr & Teleph Corp <Ntt> 文字列照合方式
JPS60114967A (ja) * 1983-11-28 1985-06-21 Hitachi Ltd 画像フアイル装置

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7623259B2 (en) 2004-09-14 2009-11-24 Canon Kabushiki Kaisha Image processing apparatus and image processing method to store image data for subsequent retrieval

Also Published As

Publication number Publication date
US4985863A (en) 1991-01-15
JPS6244878A (ja) 1987-02-26

Similar Documents

Publication Publication Date Title
JPH0797373B2 (ja) 文書フアイリングシステム
US5628003A (en) Document storage and retrieval system for storing and retrieving document image and full text data
JP3289968B2 (ja) 電子的文書処理のための装置および方法
JP3427692B2 (ja) 文字認識方法および文字認識装置
JPH11110416A (ja) データベースからドキュメントを検索するための方法および装置
JP2004348591A (ja) 文書検索方法及び装置
EP1745396B1 (en) Document information mining tool
JP2007122403A (ja) 文書タイトルおよび関連情報の自動抽出装置、抽出方法および抽出プログラム
Yurtsever et al. Figure search by text in large scale digital document collections
JP2560656B2 (ja) 文書ファイリングシステム
JP3727995B2 (ja) 文書処理方法及び装置
JPH08129554A (ja) 関係表現抽出装置および関係表現検索装置
Setlur et al. Creation of data resources and design of an evaluation test bed for Devanagari script recognition
Tarride et al. SIMARA: a database for key-value information extraction from full pages
JPH06342483A (ja) 文書ファイリングシステム
CN116798055A (zh) 表单录入方法及装置、电子设备和计算机可读介质
JPS61248160A (ja) 文書情報登録方式
JP2007025939A (ja) 多言語文書検索装置および多言語文書検索方法、並びに、多言語文書を検索するプログラム
Krishnan et al. Content level access to Digital Library of India pages
Alzuru et al. Quality-Aware Human-Machine Text Extraction for Biocollections using Ensembles of OCRs
JPH08272813A (ja) ファイリング装置
Puri et al. Sentence detection and extraction in machine printed imaged document using matching technique
JP2005189955A (ja) 文書処理方法、文書処理装置、制御プログラム及び記録媒体
JPH07296005A (ja) 日本語テキスト登録・検索装置
JPH01106263A (ja) 文書の格納検索装置