JPH0256086A - 文字認識の後処理方法 - Google Patents

文字認識の後処理方法

Info

Publication number
JPH0256086A
JPH0256086A JP63207842A JP20784288A JPH0256086A JP H0256086 A JPH0256086 A JP H0256086A JP 63207842 A JP63207842 A JP 63207842A JP 20784288 A JP20784288 A JP 20784288A JP H0256086 A JPH0256086 A JP H0256086A
Authority
JP
Japan
Prior art keywords
processing
knowledge
character
character string
semantic
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP63207842A
Other languages
English (en)
Inventor
Takakuni Minewaki
隆邦 嶺脇
Michiyoshi Tachikawa
道義 立川
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Ricoh Co Ltd
Original Assignee
Ricoh Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Ricoh Co Ltd filed Critical Ricoh Co Ltd
Priority to JP63207842A priority Critical patent/JPH0256086A/ja
Publication of JPH0256086A publication Critical patent/JPH0256086A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Character Discrimination (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 〔産業上の利用分野〕 本発明は、文字認識の後処理方法に関する。
〔従来の技術〕
一般に文字認識装置においては、入力画像上の文字イメ
ージから抽出した特徴パターンと、予め辞書に登録され
ている標準特徴パターンとの比較照合により、文字を認
識して諭る。
しかし、このような1文字単位の文字認識では。
漢字のように類似文字の多い場合に、一つの文字に対し
複数の候補が見つかることが多いので、最終的に妥当な
候補文字を決定するための後処理が必要である。
従来、このような後処理として、住所のみ9氏名のみ、
あるいは書籍のみ、というような単一の意味カテゴリー
の文字列を対象とし、単語知識を用いた知識処理により
1文字単位の文字認識の結果を修正する方法が検討され
ていた。これは、予め設定された枠内に文字を記入する
場合など1文書内の文字列の位置とその属する意味カテ
ゴリーが分かっている場合には有効である。
〔発明が解決しようとする課題〕
しかし、複数の意味カテゴリーが異なる文字列ブロック
が存在する名刺などを対象とした場合、上記の意味カテ
ゴリー別の知識処理だけによる後処理方法では1文字列
ブロックの意味カテゴリーの誤りなどによるエラーが起
こりやすい。
本発明の目的は、このような複数の意味力テゴリーの文
字列が存在する名刺1文書などに対し。
より信頼度の高い処理結果を得るための文字認識の後処
理方法を提供することにある。
〔課題を解決するための手段〕
例えば名刺の場合、郵便番号と住所、電話番号と住所、
というように意味カテゴリーは異なるが相互に密接な関
係がある文字列が存在する。このような文字列は、一方
が分かれば他方の推定あるいは決定が可能であるため、
意味カテゴリー相互の関係より意味カテゴリー別の知識
処理の妥当性をチェック可能である。
このような点に着目し、本発明は、意味カテゴリー別の
単語の知識のほかに意味カテゴリー相互の関係の知識を
用意し、入力画像より切り出された各文字列ブロックの
1文字単位の文字認識結果について、意味カテゴリー別
の単語知識による知識処理を行い、その処理結果の妥当
性を意味カテゴリー相互関係の知識によってチェックし
、矛盾を検出した場合に関連した文字列に対する知識処
理の結果を修正するというものである。
〔作 用〕
このように、郵便番号と住所のような異なった意味カテ
ゴリー相互の関係の知識を利用し、意味カテゴリー別の
知識処理の結果の妥当性をチェックし、必要に応じて意
味カテゴリー別の知識処理の結果を修正するため、意味
カテゴリー別の知識処理のみによる後処理で生じるよう
な誤りを大部分排除することができ、より正確な処理結
果を得られる。
〔実施例〕
以下、図面を用い本発明の詳細な説明する。
まず、第2図に示す名刺画像21を例に、本発明の一実
施例における処理の内容について説明する。
この名刺画像21から文字列ブロックの切り出しを行う
と、例えば第3図に示す矩形領域31〜37が文字列ブ
ロック■〜■として切り出される。
この文字列ブロックの切り出しは、例えば名刺画像内の
黒画素の外接矩形を統合する手法によって行われるが、
他の方法によってもよい。
このようにして得られた各文字列ブロックの内容は不明
であるが、対象画像が横書きの名刺画像であることが予
め指定されていれば、画像内における意味カテゴリーの
文字列の相対的位置関係や配列順序などはある程度特定
されるので、切り出された各文字列ブロックの画像内の
相対的位置や文字サイズ(文字列ブロックの高さなど)
により、その意味カテゴリーの候補は推定可能である。
すなわち、文字列ブロック■は企業名らしい、文字列ブ
ロック■は肩書らしい、というように意味カテゴリーを
推定できる。
次に、各文字列ブロック内の文字を切り出し、その特徴
パターンと文字辞書に登録されている標準特徴パターン
との比較照合により1文字単位の認識を行い、候補文字
を決定する。各文字の候補文字数は予め設定しておくこ
とも可能であるが、例えば第1位候補からの距離差と、
予め設定された閾値との比較などによって候補文字数を
決定してもよい。
以上の1文字単位の認識によって得られた各文字列ブロ
ックの候補文字列について、意味カテゴリー別の単語の
知識辞書との比較照合による知識処理で修正を行う。こ
のときに、上記のように文字列ブロックの相対的位置な
どによって推定した意味カテゴリーを優先し、各意味カ
テゴリー別の知識辞書を用いて処理する。そして処理結
果に、意味カテゴリーのラベルを付加して出力するが、
この時の意味カテゴリーの決定は、ブロックの位置など
から推定された候補意味カテゴリーのみならず、知識辞
書との一致の具合、処理結果中に発見されたキーワード
なども考慮して行う。
次に、各文字列に対する意味カテゴリー別の知識処理の
結果にいて、意味カテゴリー相互関係の知識辞書を用い
妥当性のチェックを行う。
住所と郵便番号を例にすると、これらの文字列は相互に
「一方が決定されれば、他の一方も決定される」という
関係にある。つまり、名刺画像21の場合、住所の文字
列ブロック■が正しく処理されれば、[横浜市港北区新
栄町という住所の郵便番号は223である」という知識
により、郵便番号は分かる。そこで、郵便番号の文字列
ブロック■の処理結果が「〒223」であれば、これと
知識から得られた郵便番号との比較によって、処理結果
が妥当であるか否かを判定できる。
このような比較が一致すれば、比較した各文字列ブロッ
クの意味カテゴリー別知識処理結果は信頼できるが、一
致しなければ、どちらかの文字列の処理結果が間違って
いるか、意味ラベルが間違っている可能が高い。
比較が不一致の場合、比較した二つの文字列のどちらの
処理結果が信用度(確度)が高いかを判定し、信用度の
高いほうの文字列の情報を用いて他方の文字列について
意味別カテゴリーの知識処理の結果を修正する。どの信
用度としては、文字列の長さ、知識データと一致したと
きの候補番号の累積値、文字の大きさなどを基にして計
算される。
具体的には信用度の高いほうの情報から推定される水力
の内容を、その文字列ブロックの文字認識候補中から検
索し、候補中にそのデータがあれば、それを「意味カテ
ゴリー相互関係かダ充分信用度の高い」処理結果として
出力する(結果メモリに書き込)、これにより、文*列
間の相互関係に矛盾のない処理結果が得られる。
なお、意味カテゴリー間の相互関係は、「住所と郵便番
号」、「住所と電話番号(市外局番)」。
r文献名と著者」など、様々なものが考えられるが、こ
うした−膜内な知識に限らず、さらに企業に関するより
専門的な知識、例えば1口社の社長はOoである」、「
0社のΔΔ事業所は◇◇市☆☆区にある」といったよう
に、2項目間の関係にとどまらず、より複合的・詳細な
相互関係知識を利用することも可能である。
以上説明して処理を行う文字認識装置の一例を第1図に
より説明する。
第1図において、処理対象の原稿(名刺、文著)はスキ
ャナー1により光学的に読み取られ、2値画像としてイ
メージメモリ2に格納される。この入力画像より文字列
ブロック切り出し部3により文字列ブロックが切出され
、そのイメージがブロックイメージメモリ4に格納され
る。この時、各文字列ブロックの相対位置などの意味カ
テゴリー推定のための情報も抽出される。なお、横書き
名刺であるというような原稿についての情報は予め指定
される。
この各文字列ブロックのイメージに対し、文字切り出し
・認識部5によって文字切り出し、特徴パターン抽出、
文字辞書6との比較照合による1文字単位の認識が行わ
れる。この認識結果である候補文字列は、ブロック毎に
認識結果候補メモリ7に書き込まれるが、この時にブロ
ック位置などから推定された意味カテゴリー候補も書き
込まれる。
このような各文字列ブロック毎の1文字単位の文字認識
結果について、上述のような後処理が行われる。
まず、後処理・知識辞書照合部8において、各文字列ブ
ロック毎にその候補文字列と、意味カテゴリー別の単語
の知識辞書9との比較照合による知識処理を行う、ある
意味カテゴリーの知識辞書9との照合が成功したら、意
味カテゴリーのラベルとともに処理結果を相互関係検定
部10へ渡す。
この相互関係検定部10は、後処理・知識辞書照合部8
から送られた処理結果と、既に結果メモリ11に書き込
まれている別の文字列ブロックの知識処理結果について
、意味カテゴリーの相互関係の知識辞書12の内容を用
い相互関係の有無を調べ、相互関係があれば妥当性のチ
ェックを行う。
このチェックで矛盾を検出しなければ、その処理結果を
意味カテゴリーのラベルとともに結果メモリ11に出力
する。
もし、このチェックで矛盾を検出した場合、それらの文
字列ブロックの処理結果を信用度比較部13に送り、ど
ちらの文字列の信用度が高いかを調べる。そして、゛信
用度が高いほうの文字列ブロックの処理結果に基づき、
他方の文字列ブロックの処理結果の修正(知識処理のや
り直し)を後処理・知識辞書照合部8で行い、その結果
を意味カテゴリーのラベルとともに結果メモリ11へ出
力する。
l4は以上の処理の流れを制御する制御部である。
なお、本発明は音声認識の修正処理、その他のデータ処
理にも応用可能である。
〔発明の効果〕
以上の説明から明らかなように、本発明によれば、意味
カテゴリー別の単語知識だけでなく、意味カテゴリーの
相互関係の知識をも利用することにより、意味カテゴリ
ー別知識による文字列ブロック単体の後処理に比べ、よ
り信頼度の高い処理結果を得られる。
【図面の簡単な説明】
第1図は本発明を実施する文字認識装置の一例を示す概
略ブロック図、第2図は名刺画像の一例を示す図、第3
図は第2図の名刺画像の文字列ブロック切り出し結果を
示す図である。 1・・・スキャナー、  2・・・イメージメモリ、3
・・・文字列ブロック切り出し部、 4・・・ブロックイメージメモリ、 5・・・文字切り出し・認識部、 6・・・文字辞書、
7・・・認識結果候補メモリ。 8・・・後処理・知識辞書照合部、 9・・・意味カテゴリー別知識辞書、 10・・・相互関係検索部、  11・・・結果メモリ
、12・・・意味カテゴリー相互関係知識辞書、13・
・・信用度比較部。

Claims (1)

    【特許請求の範囲】
  1. (1)入力画像から切り出された文字列ブロックに対す
    る1文字単位の文字認識の結果に、意味カテゴリー別の
    単語知識を用いた知識処理を施し、この知識処理の結果
    について意味カテゴリー相互の関係の知識を用いて妥当
    性のチェックを行い、このチェックにより矛盾を検出し
    たときに関係した文字列ブロックの知識処理の結果を修
    正することを特徴とする文字認識の後処理方法。
JP63207842A 1988-08-22 1988-08-22 文字認識の後処理方法 Pending JPH0256086A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP63207842A JPH0256086A (ja) 1988-08-22 1988-08-22 文字認識の後処理方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP63207842A JPH0256086A (ja) 1988-08-22 1988-08-22 文字認識の後処理方法

Publications (1)

Publication Number Publication Date
JPH0256086A true JPH0256086A (ja) 1990-02-26

Family

ID=16546430

Family Applications (1)

Application Number Title Priority Date Filing Date
JP63207842A Pending JPH0256086A (ja) 1988-08-22 1988-08-22 文字認識の後処理方法

Country Status (1)

Country Link
JP (1) JPH0256086A (ja)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH07114616A (ja) * 1993-10-20 1995-05-02 Hitachi Ltd 伝票文書情報システム
JPH0997312A (ja) * 1995-09-29 1997-04-08 Fujitsu Ltd 認識文字補正装置およびデータベース検索装置
JP2005128865A (ja) * 2003-10-24 2005-05-19 Casio Comput Co Ltd データ認識装置及びプログラム
JP2007179395A (ja) * 2005-12-28 2007-07-12 Fujitsu Ltd 媒体処理装置,媒体処理方法,媒体処理システム,及び媒体処理プログラムを記録したコンピュータ読取可能な記録媒体

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS63138478A (ja) * 1986-11-29 1988-06-10 Toshiba Corp 文字認識方式
JPS6331471B2 (ja) * 1979-08-23 1988-06-23 Nippon Kanko Shikiso Kenkyusho Kk

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6331471B2 (ja) * 1979-08-23 1988-06-23 Nippon Kanko Shikiso Kenkyusho Kk
JPS63138478A (ja) * 1986-11-29 1988-06-10 Toshiba Corp 文字認識方式

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH07114616A (ja) * 1993-10-20 1995-05-02 Hitachi Ltd 伝票文書情報システム
JPH0997312A (ja) * 1995-09-29 1997-04-08 Fujitsu Ltd 認識文字補正装置およびデータベース検索装置
JP2005128865A (ja) * 2003-10-24 2005-05-19 Casio Comput Co Ltd データ認識装置及びプログラム
JP2007179395A (ja) * 2005-12-28 2007-07-12 Fujitsu Ltd 媒体処理装置,媒体処理方法,媒体処理システム,及び媒体処理プログラムを記録したコンピュータ読取可能な記録媒体

Similar Documents

Publication Publication Date Title
US5787197A (en) Post-processing error correction scheme using a dictionary for on-line handwriting recognition
KR100412317B1 (ko) 문자인식/수정방법및장치
US6360010B1 (en) E-mail signature block segmentation
US5909509A (en) Statistical-based recognition of similar characters
Saiga et al. An OCR system for business cards
JP2751865B2 (ja) 文字列認識装置
JPH06215184A (ja) 抽出領域のラベリング装置
JP2000090193A (ja) 文字認識装置および項目分類方法
JP2746345B2 (ja) 文字認識の後処理方法
JP2908460B2 (ja) 誤認識修正方法及び装置
JP2985813B2 (ja) 文字列認識装置および知識データベース学習方法
CN100562885C (zh) 搜索、识别和定位墨水中的术语的方法、装置
JPS60138689A (ja) 文字認識方法
JP2839515B2 (ja) 文字読取システム
JPS63282586A (ja) 文字認識装置
JP2991594B2 (ja) 郵便物の宛名読取装置
JP2939945B2 (ja) ローマ字住所認識装置
JP2827066B2 (ja) 数字列混在文書の文字認識の後処理方法
JP2560959B2 (ja) 文字認識後処理方式
JPH11120294A (ja) 文字認識装置および媒体
JPS6095689A (ja) 光学的文字読取装置
JP3929560B2 (ja) 誤記自動修正方法、読取装置、および誤記自動修正プログラムを記録したコンピュータ読み取り可能な記憶媒体
JP3007697B2 (ja) 単語照合装置及び単語照合方法
JPH076213A (ja) 文字列認識装置
JPH0728956A (ja) 誤読修正支援方法