JPH02219190A - 文字認識方法 - Google Patents

文字認識方法

Info

Publication number
JPH02219190A
JPH02219190A JP1039308A JP3930889A JPH02219190A JP H02219190 A JPH02219190 A JP H02219190A JP 1039308 A JP1039308 A JP 1039308A JP 3930889 A JP3930889 A JP 3930889A JP H02219190 A JPH02219190 A JP H02219190A
Authority
JP
Japan
Prior art keywords
character
characters
recognition
shape feature
long
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP1039308A
Other languages
English (en)
Other versions
JPH07101441B2 (ja
Inventor
Kazuyuki Yoshida
吉田 収志
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fuji Electric Co Ltd
Fuji Facom Corp
Original Assignee
Fuji Electric Co Ltd
Fuji Facom Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fuji Electric Co Ltd, Fuji Facom Corp filed Critical Fuji Electric Co Ltd
Priority to JP1039308A priority Critical patent/JPH07101441B2/ja
Publication of JPH02219190A publication Critical patent/JPH02219190A/ja
Publication of JPH07101441B2 publication Critical patent/JPH07101441B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Landscapes

  • Character Discrimination (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 〔産業上の利用分野〕 この発明は、文字、マーク(文字等とも云う)を認識す
るための文字認識方法、特にその改良に関する。
〔従来の技術〕
従来、この種の方法として、例えば文書画像から文字行
または文字列(以下、文字行と云う。)を切り出した後
、文字らしきものを仮文字として抽出し、この仮文字か
ら所定の文字サイズを基準として全角文字(漢字等)を
切り出し、文字サイズから全角文字と確定できないもの
は、半角文字として有効に成立し得る文字か否かを調べ
、成立すれば半角文字として認識する方法がある。
しかしながら、このような方法では文字によって全角文
字が2つ以上の半角文字として誤認識されるおそれがあ
る。そこで、出願人は次のような方法を提案している(
特願昭63−292445号;提案漬方法とも云う)。
第4図は提案漬方法を説明するためのフローチャートで
ある。
これは、図示されない画像処理装置の処理手順を示すも
ので、まず文書画像データを入力しく■参照)、その水
平方向の投影値をとることにより、各文字行を切り出す
(■参照)、これにより、行の幅寸法を求め、全角文字
の大きさに相当する量(文字サイズ)を得る。なお、こ
こでは横書きの場合を想定しているが、縦書きの場合も
同様である。
次に、各行に垂直な方向の投影値を調べ、文字サイズを
考慮することにより、各文字行から文字らしきもの、す
なわち仮文字群を切り出しく■参照)、シかる後この仮
文字群の中から上記文字サイズを利用して全角文字を選
出する(■参照)。
全角文字として選出する条件は次のとおりである。
イ)それ単独で文字サイズが全角サイズのもの、つまり
他の仮文字と結合する余地の全くないもの。
口)句読点 ハ)それ単独では半角サイズであるが、隣り合う他の半
角サイズの仮文字と結合させてみると全角サイズとなる
もの。
二)それ単独ではサイズが全角サイズよりも小さいが、
隣り合う他の半角サイズの仮文字との間に距離があり過
ぎ、これらを無理に結合させると全角文字サイズをこえ
るもの。
以上の如き条件に従って全角文字を全て選出した後、あ
とに残った仮文字について、これを統合または分離して
統合文字2分離文字を作成しく■参照)、シかる後これ
らの統合文字9分離文字をOCR(文字読取装置)によ
り、辞書パターンとの類似度を利用して認識する(■参
照)。
次に、その認識結果に対して次のような矛盾処理を実行
する(■参照)。
a)例えば認識すべき対象が分離文字であるにもかかわ
らず、OCRによる認識結果が全角サイズの漢字を示す
ものとすれば互いに矛盾するので、かかる認識結果は採
用しない。
b)上記とは逆に、認識すべき対象が統合文字であるに
もかかわらず、OCRによる認識結果が英字、数字等の
半角サイズ文字を示す場合。
そして、最後に残された文字につき、これを統合文字と
すべきか分離文字とすべきかを、OCRにより相対類似
度を用いて判別する(■参照)。
なお、相対類似度X、は類似度Xと類似度の平均値mと
の比に成る定数(例えば、1024)を掛けたものとし
て定義する。すなわち、 x、=x/mx定数(1024) である。
〔発明が解決しようとする課題〕
提案済方法では類似度から認識結果を決定するようにし
ているので、例えば「う」と「ろ」、「テ」と「チ」の
如く非常に似ているものは、文字画像の僅かな違い、例
えば文字等の太さや字体の相違1文字等のつぶれやかす
れ等により誤認識するおそれがある。
また、同様の理由から、「は」の相対類似度よりも「(
」と「よ」の部分の相対類似度の方が高くなり、誤認識
してしまうことがある。この点について、もう少し具体
的に説明する。
第5図は入力文字「は」について、これを統合文字1と
して処理した場合と、分離文字2,3として処理した場
合のI!(11度X、相対類僚度X、を示すものである
。すなわち、類似度x、 [似度の平均値mとが図示の
如く得られるものとすると、類似度とその平均値との比
に一定数(1024)を乗じて得られる相対類似度は、
統合文字lの場合はr954J 、分離文字2.3の場
合はそれぞれr1028J、r898Jでその平均値は
「963」となり、 954<963 であることから、入力文字「は」は「(」(前括弧)と
「は」からなるものとして誤認識されることになる。な
お、定数はr1024Jに限らないことは勿論である。
〔課題を解決するための手段〕
少なくとも辞書パターンとの類似度を調べて文字を認識
するにあたり、認識すべき文字の縦横比と縦方向および
横方向にそれぞれいくつに分離できるかを示す形状特徴
量も辞書として予め記憶しておき、入力文字の形状特徴
量をその認識結果と対応する候補文字の予め記憶されて
いる形状特徴量と比較して類似度にもとづく認識結果を
採用するか否かを決定する。
【作用〕
類似度だけでなく、形状特徴量をも抽出するようにし、
「う」と「ろ」、「チ」と「テ」等のように、形状特徴
に差のある類似文字の認識率を向上させる。また、「は
」を「(」と「は」の如く誤認識しないようにし、文字
の切り出し性能の向上を図る。
〔実施例〕
第1図はこの発明の実施例を示すフローチャートである
。同図からも明らかなように、この実施例は形状特徴照
合ステップ■を付加した点が特徴である。
ステップ■は同図の如く[相]〜[相]に細分化される
すなわち、ステップ[相]では入力文字が縦長か横長か
がチエツクされる。なお、縦長か横長かはそれが正体文
字の場合は縦横比(高さ7幅)が例えば2以上ならば縦
長とし、1/2以下ならば横長とする。また、長体文字
や平棒文字の場合は正体文字に直して判定することとす
る。
ステップ■、@ではそれぞれ縦、横をいくつに分離する
かを調べ、分離の態様が入力文字とその認識結果の候補
文字との間で一致するか否かを調ぺる。この操作を候補
文字(第1〜第10位)で適合するものが見つかる迄行
い、いずれの候補文字も適合しない場合はステップ[相
]でリジェクト出力を出す。
なお、以上の他は第3図と同様なので説明は省略する。
次に、具体的な例について説明する。
第2図は入力画像(または入力文字)が「う」で、入力
画像から得られる形状特徴は“縦長で、縦方向に2つに
分離する”であり、これに対して認識結果の候補文字の
第1〜第10位のうちの第1位が「ろ」となった例であ
る。この場合、辞書に予め記憶されている「ろ」の形状
特徴は“縦長でも横長でもなく、縦横に分離しない”で
ある。
したがって、縦長・横長チエツクのステップ(第1図[
相]参照)で“NO”となるため、第2位の候補文字の
チエツクが行われる。第2位の候補文字は「う」であり
、形状特徴量が一致するので、これを認識結果として採
用する。
第3図は入力文字「は」を統合文字として処理する場合
と、分離文字r(J、rよ」として処理する場合の例で
ある。すなわち、同図(イ)の如く統合文字として処理
する場合は、認識結果の第1候補「は」が形状特徴量の
点からも適合するので「は」が採用される。同様に、分
離文字「(」は同図(ロ)の如く第1候補文字「(」と
適合するが、分離文字「よ」は同図(ハ)の如く、その
形状特徴量から第1候補文字「は」とは適合せず、結局
第2位の候補文字「ま」と適合する。そして、同図(ニ
)に示す如く、「は」として認識したときの相対類似度
はr954J、「(」と「ま」に分離されるものとした
ときの相対類似度は「946」となり、 946<954 から、「は」が採用されることになる。つまり、入力文
字は「は」と認識され、「(」と「ま」に誤i!識され
るおそれをなくすことができる。
〔発明の効果〕
この発明によれば、類似度による認識の他に、形状時f
!kit (縦長か横長か、縦方向にいくつに分離する
か、横方向にいくつに分離するか)も考慮するようにし
たので、類似度のみによる認識結果の誤りを修正するこ
とができ、文字等の認識率。
切出し性能を向上させることができる。
【図面の簡単な説明】
第1図はこの発明の実施例を示すフローチャート、第2
図および第3図はいずれもこの発明を具体的に説明する
ための説明図、第4図は提案済方法を説明するためのフ
ローチャート、第5図は誤認識例を説明するための説明
図である。 1・・・統合文字、2,3・・・分離文字。 代理人弁理士  並 木 昭 夫

Claims (1)

  1. 【特許請求の範囲】 1)文書を画像処理して個々の文字を切り出し、各文字
    毎に辞書パターンとの類似度を求めて文字を認識するに
    あたり、 認識すべき文字の縦横比と縦方向および横方向にそれぞ
    れいくつに分離できるかを示す形状特徴量も辞書データ
    として予め記憶しておき、入力文字の形状特徴量をその
    認識結果と対応する候補文字の予め記憶されている形状
    特徴量と比較して類似度にもとづく認識結果を採用する
    か否かを決定することを特徴とする文字認識方法。
JP1039308A 1989-02-21 1989-02-21 文字認識方法 Expired - Lifetime JPH07101441B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP1039308A JPH07101441B2 (ja) 1989-02-21 1989-02-21 文字認識方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1039308A JPH07101441B2 (ja) 1989-02-21 1989-02-21 文字認識方法

Publications (2)

Publication Number Publication Date
JPH02219190A true JPH02219190A (ja) 1990-08-31
JPH07101441B2 JPH07101441B2 (ja) 1995-11-01

Family

ID=12549486

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1039308A Expired - Lifetime JPH07101441B2 (ja) 1989-02-21 1989-02-21 文字認識方法

Country Status (1)

Country Link
JP (1) JPH07101441B2 (ja)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6274181A (ja) * 1985-09-27 1987-04-04 Sony Corp 文字認識装置

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS6274181A (ja) * 1985-09-27 1987-04-04 Sony Corp 文字認識装置

Also Published As

Publication number Publication date
JPH07101441B2 (ja) 1995-11-01

Similar Documents

Publication Publication Date Title
JP3452774B2 (ja) 文字認識方法
JP2001283152A (ja) 帳票類判別装置、帳票類判別方法、およびこれらの方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体
JPS60217477A (ja) 手書き文字認識装置
US5561720A (en) Method for extracting individual characters from raster images of a read-in handwritten or typed character sequence having a free pitch
JP2000315247A (ja) 文字認識装置
Baird Global-to-local layout analysis
JP2002063548A (ja) 手書き文字認識方法
JP4194020B2 (ja) 文字認識方法、該方法の実行に用いるプログラム及び文字認識装置
JPH02219190A (ja) 文字認識方法
JP3374762B2 (ja) 文字認識方法及びその装置
JP2963474B2 (ja) 類似文字識別方法
JPH028348B2 (ja)
JP3151866B2 (ja) 英文字認識方法
JPH02230484A (ja) 文字認識装置
JP2977244B2 (ja) 文字認識方法及び文字認識装置
JP2752499B2 (ja) 文字読取り装置
Hwang et al. Segmentation of a text printed in Korean and English using structure information and character recognizers
JPH01231187A (ja) 文字認識装置
JP2000207491A (ja) 文字列読取方法及び装置
JPH11120294A (ja) 文字認識装置および媒体
JP2570311B2 (ja) 文字列認識装置
JP3725944B2 (ja) 文字認識装置
JPH07160831A (ja) 手書き文字認識結果のリジェクト方法
JP3033904B2 (ja) 文字認識後処理方法
JPH08171608A (ja) 帳票様式識別方法および装置