JPH02278393A - 単語認識装置 - Google Patents

単語認識装置

Info

Publication number
JPH02278393A
JPH02278393A JP1098843A JP9884389A JPH02278393A JP H02278393 A JPH02278393 A JP H02278393A JP 1098843 A JP1098843 A JP 1098843A JP 9884389 A JP9884389 A JP 9884389A JP H02278393 A JPH02278393 A JP H02278393A
Authority
JP
Japan
Prior art keywords
word
character
character code
code string
recognition
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP1098843A
Other languages
English (en)
Inventor
Masami Hisagai
正己 久貝
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Canon Inc
Original Assignee
Canon Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Canon Inc filed Critical Canon Inc
Priority to JP1098843A priority Critical patent/JPH02278393A/ja
Publication of JPH02278393A publication Critical patent/JPH02278393A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Character Discrimination (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [産業上の利用分野] 本発明は、文書原稿から文字画像を読取って単語単位で
の文字コード列に変換する単語認識装置に関する。
[従来の技術] 従来、文書読取装置で用いられる単語認識装置では文字
認識結果の認識ミスを補填するために単語辞書と文字認
識結果とを照合することにより1文字程度の認識ミスを
訂正する。
従来のこの種の単語認識装置は単語の照合時間を速くす
るために単語の一部分、例えば、先頭文字から始まる数
文字と、その単語部分が格納されているアドレス範囲と
を記憶したインデックス部を単語辞書に設け、このイン
デックスを参照することにより、単語辞書の検索範囲を
限定している。
[発明が解決しようとする課題] しかしながら、従来の文書読取装置では認識結果の中の
インデックス参照部分に認識ミスが含まれた場合には、
単語辞書と文字認識結果との照合が正しく行われず、認
識ミスの訂正が不可能になるという不具合があった。
そこで、本発明の目的は、このような不具合を解消し、
正しい単語認識結果のみを出力することができる認識確
率の高い単語認識装置を提供することにある。
[課題を解決するための手段] このような目的を達成するために、本発明の第1形態は
、単語の先頭部を第1インデックスとする第1車語辞書
と、単語の末尾部を第2インデックスとする第2単語辞
書と、原稿の文字画像を読取る画像読取部と、画像読取
部により読取られた文字画像を単語単位の文字コード列
に変換する文字認識部と、文字認識部により変換された
文字コード列に最も近似する文字コード列を、第1単語
辞書の中から第1インデックスを用いて検索抽出する第
1車語認識部と、文字認識部により変換された文字コー
ド列に最も近似する文字コード列を第2単語辞書の中か
ら第2インデックスを用いて検索抽出する第2.41語
U識部と、第1.IL語認識部により検索抽出された文
字コード列と第2単語認識部により検索抽出された文字
コード列とを比較し、当該両文字コード列が一致したと
きにのみ、当該文字コード列を単語の認識結果として出
力する単語照合部とを具えたことを特徴とする。
本発明の第2形態は、第14語認識部および第2単語認
識部は、それぞれ最も近似する文字コード列を、複数個
、検索抽出し、単語照合部は第1単語認識部により検索
抽出された各文字コード列と第2XL語認識部により検
索抽出された各文字コード列とを比較することを特徴と
する。
[作 用] 本発明の第1形態では、単語の末尾の文字コード列をイ
ンデックスとする第2単語辞書と従来から用いられてい
る単語の先頭の文字コード列をインデックスとする第1
単語辞書の二つからそれぞれ単語候補の文字コード列を
抽出し、両車語候補が一致したときにのみこの単語候補
の文字コード列をlL語認識結果としたので、例えば文
字認識部が誤認識を起こした場合は、両文字コード列が
一致せず、誤った文字認識結果が出力されることはない
また、本発明の第2形態では、第1および第2の単語認
識部が複数の単語候補を検索抽出するようにしたので、
文字認識部が数文字程度の誤認識を起こした場合でも、
複数の単語候補の中に正しい単語認識結果が含まれてお
り、単語照合部の一致比較により正しい単語認識結果を
見つけることができる。
[実施例J 以下、図面を参照して本発明の実施例を詳細に説明する
第1図は本発明実施例の具体的な回路構成を示す。
第1図において、読み取り部1は撮像素子により主に構
成され、文書を読み取って二値画像に変換して読取り画
像を画像メモリ2へ書き込む。単語切出し回路3は、画
像のX軸(横方向)とY軸(縦方向)に沿った射影ヒス
トグラムの谷間の検索によって、文書画像の行間位置、
単語間の位置を決定して単語データを切り出す回路であ
り、切り出した単語データ画像メモリ2の余白へ書き込
む。なお、単語間は英文のように文字間よりも広い適当
なスペースで区切られているものと前提している。
文字切り出し回路4は切り出された単語データについて
X軸への射影ヒストグラムを作成し、射影ヒストグラム
の谷間の検索を行うことにより、1個ずつの文字データ
に切り分け、画像メモリ2の余白へ切り出した文字デー
タを書き込む。
また、文字切り出し回路4は切り出した文字を計数する
ことにより、単語から切り出した文字が単語の最初の2
文字および最後尾2文字のときはセレクト信号50をア
クティブにして、第1の識別回路6を動作可能情報に設
定する。
次に特徴抽出回路5は画像メモリ2内の切り出された文
字データから特徴ベクトルQIl  q2・・・qnを
抽出する。本実施例においては、例えば、文字画像デー
タを5×5の升目状に区切り、各升目内の黒画素の個数
q++Q2・・・Qnを文字認識の際の特徴ベクトルと
する。文字認識部を構成する第1の識別回路6および第
2の識別回路7はそれぞれ、認識辞書8.9に記憶され
た標準特徴ベクトルを参照して、切り出された文字画像
データを、標準特徴ベクトルに最も近い文字コードに変
換する。
第1の識別回路6および第2の識別回路7は文字切り出
し回路4からのセレクト信号51および52により選択
される。第1認識辞書8にはあらかじめ、多数の文字画
像データから学習されてつくられ、標準特徴ベクトルと
して各文字についての平均ベクトル(m + + m 
2”” m n )と標!$!(j!差ヘクトル(σ3
.a2・・・Qn)が記憶されている。第1の識別回路
6では、人力の特徴ベクトル(ql。
q2・・・qn)と認識辞書8の標準特徴ベクトル(m
、、m2 ”’m、)との間の距1!lidが次の式で
計算される。
距離計算の後、第1識別回路6から距1iidの最も小
さくなる標準特徴ベクトルの文字のコードバッファへ送
られる。なお、第1識別回路6には、いわゆるマハラノ
ビス距離と呼ばれる距離計算を行う回路を用いることに
より認識精度を上げることもできる。
第2認識辞書9には、各文字について上記平均ベクトル
(ml、m2・・・mn)のみが標準特徴ベクトルとし
て記憶され、選択信号52により動作可能状態になると
、識別回路2では、入力の特徴ベクトル(Q+ 、  
q2・・・qn)と認識辞書との間で次の式の距離計算
がなされる。
d=Σ (q  i −m i )  2−(2)この
距離計算の後、距!1dの最小となる文字のコードが第
2識別回路7からコードバッファlOに送られる。この
結果、コードバッファ10の先頭の2文字および最後尾
の2文字は第1の識別回路6により認識された文字コー
ド、中間の文字列は第2の識別回路7により識別された
文字コードとなる。なお、上記(1)式は上記(2)式
よりも文字認識精度が良いが、計算時間は少し長くなる
コードバッファlOは第1識別回路6および第2の識別
回路7により識別された文字コードを順次に蓄積する。
単語辞書12は第2図に示すように2つのインデックス
部12−1 、12−3と2つの単語部12−2 、1
2−4を含み、各単語部には文字コード値の昇順に単語
(文字コード列)が配列されている。第1のインデック
ス部12−1には第3図に示すように、語頭から2文字
をキーとした単語群の先頭のメモリアドレスがキー文字
と共に格納されている。
第1図に戻り、コードバッファ10に単語データのすべ
ての文字コードが格納されると、第1Q語認識部と第2
単語認識部としての単語照合回路11は、以下の処理を
行フてコードバッファ10に格納された文字コード列に
最も類似する単語辞書内の単語(文字コード列)を抽出
する。
すなわち、コードバッファ10内の最初の2文字をキー
として単語辞書12の第1のインデックス部12−1を
参照して上記最初の2文字を同一とする第1の単語部1
2−2の先頭アドレス位置から単語情報(文字コード列
)を順に読出し、コードバッファ10内の文字コード列
と第1の単語部12−2の文字コード列を比較し、コー
ドバッフアlO内の文字コード列に最も近い文字コード
列を単語辞書12の中から抽出する。本実施例では、コ
ードバッファ10内の文字コード列と、抽出した文字コ
ード列は1個の文字の違いまでを許容する。次に、コー
ドバッファ10内の文字コード列を認識結果に入れ換え
る。
続いて、単語照合回路11は、まず、フードバッファ1
0内単語の最後尾の2文字を後述の単語検索処理のため
のキーとして保持し、第2のインデックス部12−3を
照合して同一のキーを有する単語アドレスを検出する。
次に検出した単語アドレスを検索して第2の単語部12
−4内の単語とコードバッファ10内の単語を比較して
一致もしくは類似する単語を抽出する。本実施例では、
抽出された単語とコードバッファlOに記憶された単語
の1文字の違いまでを許容する。
次に、最後尾の2文字をキーとして抽出された単語とコ
ードバッファlOの先頭の2文字をキーとして抽出され
た単語とを比較し、上記2つの単語が1文字の違いを許
容して、はぼ一致したときは、コードバッファlOに保
持された単語、すなわち文字コード列を認識結果として
外部出力する。
上記比較において、1文字違いではないときは一致比較
を行った2つの文字コード列をそのまま出力してもよい
ことは言うまでもない。
以上、説明したように、本実施例では、単語を構成する
文字の認識結果の先頭および最後尾の2文字をそれぞれ
キーとして単語辞書から単語認識候補を抽出し、抽出さ
れた2つの単語候補がほぼ一致したときにのみ2つの単
語候補のいずれか一方を出力するようにしたので、本実
施例においてる。このため、従来のように出力された認
識単語が認識画像の文字列画像と大幅に異なるという不
具合を解消することができる。
さらに、本実施例では、検索のキーとなる文字の認識に
は認識精度の高い文字認識回路を用いて、キーの文字列
を除く文字を認識精度の低い文字認識回路を用いるよう
にしたので、単語の認識対象の文字列全てを認識精度の
高い文字認識回路を用いて文字認識を行うよりも処理時
間を短縮でき、低い精度の文字認識回路を用いたことに
より単語の中間部に文字の認識ミスが生じても単語認識
処理により文字の認識ミスが補正される。
また、本実施例では第1識別回路6および第2識別回路
7は単語候補を1つだけ検索抽出するようにしているが
、例えば1文字または2文字の違いを許した複数個の単
語候補を抽出し、これら抽出された複数個の文字候補の
中で、文字コード列が一致する単語候補を単語候補とす
ることもできる。この場合は各単語候補を組み合わせて
一致比較を行う。なお、複数の単語候補を単語辞書から
検索する技術、また、複数の数値の中から一致する数値
の組み合わせを検索する技術は従来からよく知られてい
るので、本例についての具体的な回路構成の説明を省略
する。
[発明の効果] 以上、説明したように、本発明によれば、本発明の第1
形態では、単語の末尾の文字コード列をインデックスと
する第2車語辞書と従来から用いられている単語の先頭
の文字コード列をインデックスとする第1.iIL語辞
書の二つからそれぞれ単語候補の文字コード列を抽出し
、両単語候補が一致したときにのみこの単語候補の文字
コード列を単語認識結果としたので、例えば文字認識部
が誤認識を起こした場合は、両文字コード列が一致せず
、誤った文字認識結果が出力されることばない。
また、本発明の第2形態では第1および第2の単語認識
部が複数の単語候補を検索抽出するようにしたので、文
字認識部が数文字程度の誤認識を起こした場合でも、複
数の単語候補の中に正しい単語認識結果が含まれており
、単語照合部の一致比較により正しい単語認識結果を見
つけることができる。
4・・・文字切り出し回路、 5・・・特徴抽出回路、 6.7・・・識別回路、 8.9・・・認識辞書、 10・・・コードバッファ、 11・・・単語照合回路、 12・・・単語辞書、 50.51.52・・・セレクト信号線。
【図面の簡単な説明】
第1図は本発明実施例の回路構成を示すブロック図、 第2図は本発明実施例の単語辞書12の構成を示す説明
図、 第3図は本発明実施例のインデックスの構成例を示す説
明図である。 1・・・読取り部、 2・・・画像メモリ、 3・・・単語切り出し回路、 第4d日月幻芭イi1の具体−ヲ、な回蓼各利(へ乞d
・i)゛ロック図茅11 不j9月尖凭介忙単語辞)12の 茅五a乏jテ・1盲兇ヨ月口 第2図 キー アドレス 1のインサックス部 本妃日月炙施イ列の単語gF杏のイン″fレク又の溝へ
例2才・1説明図 第3図

Claims (1)

  1. 【特許請求の範囲】 1)単語の先頭部を第1インデックスとする第1単語辞
    書と、 単語の末尾部を第2インデックスとする第2単語辞書と
    、 原稿の文字画像を読取る画像読取部と、 該画像読取部により読取られた文字画像を単語単位の文
    字コード列に変換する文字認識部と、該文字認識部によ
    り変換された文字コード列に最も近似する文字コード列
    を、前記第1単語辞書の中から前記第1インデックスを
    用いて検索抽出する第1単語認識部と、 前記文字認識部により変換された文字コード列に最も近
    似する文字コード列を前記第2単語辞書の中から前記第
    2インデックスを用いて検索抽出する第2単語認識部と
    、 前記第1単語認識部により検索抽出された文字コード列
    と前記第2単語認識部により検索抽出された文字コード
    列とを比較し、当該両文字コード列が一致したときにの
    み、当該文字コード列を単語の認識結果として出力する
    単語照合部と を具えたことを特徴とする単語認識装置。 2)前記第1単語認識部および前記第2単語認識部は、
    それぞれ前記最も近似する文字コード列を、複数個、検
    索抽出し、 前記単語照合部は前記第1単語認識部により検索抽出さ
    れた各文字コード列と前記第2単語認識部により検索抽
    出された各文字コード列とを比較することを特徴とする
    請求項1に記載の単語認識装置。
JP1098843A 1989-04-20 1989-04-20 単語認識装置 Pending JPH02278393A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP1098843A JPH02278393A (ja) 1989-04-20 1989-04-20 単語認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1098843A JPH02278393A (ja) 1989-04-20 1989-04-20 単語認識装置

Publications (1)

Publication Number Publication Date
JPH02278393A true JPH02278393A (ja) 1990-11-14

Family

ID=14230535

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1098843A Pending JPH02278393A (ja) 1989-04-20 1989-04-20 単語認識装置

Country Status (1)

Country Link
JP (1) JPH02278393A (ja)

Similar Documents

Publication Publication Date Title
US10846523B2 (en) System and method of character recognition using fully convolutional neural networks with attention
CN110046350B (zh) 文法错误识别方法、装置、计算机设备及存储介质
US5161245A (en) Pattern recognition system having inter-pattern spacing correction
US5787197A (en) Post-processing error correction scheme using a dictionary for on-line handwriting recognition
EP0844583A2 (en) Method and apparatus for character recognition
KR100412317B1 (ko) 문자인식/수정방법및장치
Naz et al. Segmentation techniques for recognition of Arabic-like scripts: A comprehensive survey
Romero-Gómez et al. Automatic alignment of handwritten images and transcripts for training handwritten text recognition systems
JP3975825B2 (ja) 文字認識誤り訂正方法、装置及びプログラム
Pal On the developement of an optical character recognition (ocr) system for printed bangla script
JPH02278393A (ja) 単語認識装置
JP2903779B2 (ja) 文字列認識方法及びその装置
JPH0634253B2 (ja) 誤読文字訂正処理装置
JP2939945B2 (ja) ローマ字住所認識装置
JPH0256086A (ja) 文字認識の後処理方法
JPS6095689A (ja) 光学的文字読取装置
Saluja Robust multilingual OCR: from Ancient Indic texts to modern Indian Street signs
JPH11120294A (ja) 文字認識装置および媒体
JPH0340434B2 (ja)
JPH0614375B2 (ja) 文字入力装置
JPS62180462A (ja) 音声入力かな漢字変換装置
Lebourgeois et al. A contextual processing for an ocr system, based on pattern learning
JPS59188783A (ja) 文字判定処理方式
JPS60138689A (ja) 文字認識方法
JPH0922441A (ja) 光学文字読取装置