JPH0567237A - 空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置 - Google Patents

空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置

Info

Publication number
JPH0567237A
JPH0567237A JP3137275A JP13727591A JPH0567237A JP H0567237 A JPH0567237 A JP H0567237A JP 3137275 A JP3137275 A JP 3137275A JP 13727591 A JP13727591 A JP 13727591A JP H0567237 A JPH0567237 A JP H0567237A
Authority
JP
Japan
Prior art keywords
character
blank
word length
english
distribution
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP3137275A
Other languages
English (en)
Inventor
Shigeru Owada
茂 大和田
Masateru Sakata
正輝 坂田
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Industry and Control Solutions Co Ltd
Original Assignee
Hitachi Engineering Co Ltd Ibaraki
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Engineering Co Ltd Ibaraki filed Critical Hitachi Engineering Co Ltd Ibaraki
Priority to JP3137275A priority Critical patent/JPH0567237A/ja
Publication of JPH0567237A publication Critical patent/JPH0567237A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Document Processing Apparatus (AREA)
  • Character Input (AREA)
  • Machine Translation (AREA)

Abstract

(57)【要約】 【目的】 手書きあるいは活字印字された英文の空白を
正確に認識する。 【構成】 入力英文の各行について、文字間隔の分布か
ら空白サイズ候補を取り出し(処理25)、各候補につ
いてそのサイズ以上の文字間隔を空白としたときの単語
長の分布が英文について調べた単語長分布に最も近くな
るような候補を空白サイズとし(処理26、28)、そ
の空白サイズ以上の間隔を空白とする(処理29)。 【効果】 各行毎に文字間隔が変化していても常に正確
に空白の検出が行える。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】本発明は空白認識方法及びそれを
用いた文字認識装置に関わり、特に活字印刷や手書きな
どにより作成された不定ピッチの英文の空白(スペー
ス)の認識方法及び装置及びそれを用いた文字認識装
置、更に英日翻訳装置に関する。
【0002】
【従来の技術】英日翻訳装置などに於て、活字印刷や手
書きにより作成された英文の文字認識を行うためには、
その英文中のワード間の空白を正確に認識することが、
文字列から正確にワードを取り出す上で欠かせない。こ
のための従来の一般的な空白の認識方法では、特開昭6
2ー26587号に示されているように、ユーザが予め
設定した設定サイズと入力文字列から求めた文字間隔と
の比較を行い、文字間隔の方が大きい場合にその文字間
隔に空白が存在しているとしている。図7はこの従来方
法の処理を示すもので、ステップ201に於て入力され
た文字画像データから文字行が文字行データとして切り
出される。ステップ202ではこの切り出された各文字
行データが1個づつ以下で処理されるのを管理する。ス
テップ203では1つの文字行データ内の各文字の外接
枠を切り出して文字外接枠データを求める。ステップ2
04では各文字外接枠について以下の処理が行われるの
を管理する。ステップ205では隣接する文字外接枠デ
ータの間隔とその設定サイズとの比較を行い、外接枠間
隔の方が設定サイズより大きい場合に空白があると認識
し、ステップ206にて空白を出力する。
【0003】
【発明が解決しようとする課題】上記従来技術は、ワー
ドプロセッサなどにより出力された定ピッチ文書には有
効であるが、一般の雑誌や手書きなどの英文の読物文書
では、1つの単語が行間にまたがらないように空白の長
さが制御されるから、不定ピッチとなり、空白のサイズ
が微妙に変動する。図8はそのような例を示しており、
空白の基準となるサイズを常に正しく設定するのは難し
い。これは空白の認識ミスの原因となっていた。
【0004】本発明の目的は、このような不定ピッチの
英文の読物文書においても、常に空白の認識を高い確率
で正確に行えるようにした空白認識方法及び装置と、及
びそれを用いた文字認識装置、英日翻訳装置を提供する
にある。
【0005】
【課題を解決するための手段】上記の目的は、入力され
た英文の画像データから切り出された文字行の各々につ
いて、当該文字行の画像データに対する垂直方向のヒス
トグラムと水平方向のヒストグラムを求めて個々の文字
外接枠を検出し、該検出した文字外接枠より当該文字行
の全ての文字間隔を算出し、該算出した文字間隔の分布
から複数個の空白サイズ候補を選出し、該選出した空白
サイズ候補の各々について当該空白サイズ候補より上記
求めた文字間隔が大きいところに空白があるとした場合
の各単語長を検出し、該検出した単語長の分布が実際の
英文の単語長分布に最も近くなるような空白サイズ候補
を定め、該空白サイズ候補をこえる文字間隔には空白が
存在するものとすることにより達成される。
【0006】
【作用】英文の同一単語内の文字間隔と2つの単語間の
空白に相当する文字間隔との間にははっきりした差があ
るが、前記のように1つの単語が2行にまたがらないよ
うに調整された英文では、空白の長さは各行毎に異なっ
ている。そこで各行ごとに文字間隔の分布を調べれば、
単語内の文字間隔と単語間の文字間隔との間には必ず差
が現れるので、それぞれに対応した文字間隔のグループ
を見いだすことができ、これらのグループとグループの
間のサイズを当該行の空白サイズ候補とすることができ
る。そしてこの空白サイズ候補より大きい文字間隔に空
白が挿入されるものとした場合に作成される各単語の長
さを、その文字行の一行分検出し、その単語長の分布を
一般の英文について予め調べておいた単語長の分布と比
べれば、どの空白サイズ候補がもっともらしいかを決定
でき、この決定した空白サイズより大きい文字間隔に空
白があると認識できる。
【0007】
【実施例】以下本発明を実施例によって詳細に説明す
る。図1は本発明の空白認識方法の一実施例をフローチ
ャートで示したもので、この処理は画像入力装置1より
の文書画像データを入力とし、電子計算機2により実行
される。即ちまず入力画像データは画像データ記憶手段
21に白黒2値の画素データとして記憶される。ついで
行切り出し処理22は、記憶手段21に記憶されたデー
タの解析による行と並行方向へのヒストグラム作成を行
い、それから行データの切り出しを行う。処理23は切
り出した各行について以下の処理が繰り返されるのを管
理する。文字外接枠検出処理24は、上記切り出された
1つの行について、画像データ記憶手段21より対応す
る画像データを取り出し、行と垂直方向及び並行方向の
ヒストグラム作成などを行い、これを用いて各文字の外
接枠の検出を行い、画像データ記憶手段21内の文字デ
ータ格納領域を表す文字外接枠の左上及び右下の画素ア
ドレスを求め、空白サイズ選出処理25へ出力する。こ
こまでの処理は従来と同じである。
【0008】次に図2を用いて空白サイズ候補選出処理
25を説明する。まずステップ101において、前記文
字外接枠データより文字間隔(隣合う文字との間の画素
数)を算出し、いま処理中の行の各文字間隔毎の出現回
数を求める。次にステップ102において、前記出現回
数が1以上の文字間隔を調べ、その差が予め定めたサイ
ズ(本実施例では3画素としている)以上あるものは別
のグループとなるように文字間隔のグループ分けを行
い、いくつかの文字間隔グループを作成する。このグル
ープ化処理102を図3(a)に示した文字列を例とし
て具体的に説明する。図3(a)は不定ピッチの英文読
物文書の文字行の画像データの例であって、その各文字
間隔のサイズ(画素数)が矢印で示されている。図3
(b)はその文字間隔毎の出現回数をヒストグラムで示
したもので、出現回数が1以上の文字間隔は2、3、
4、5、8、9、12、14、15である。これらの各
差が3以上の所でグループ分けを行うと、グループの分
割位置は5と8、9と12の間の所となり、2〜5、8
〜9、12〜15の3つのグループに分割される。この
結果は各グループの文字間隔の最小値、最大値と共に図
3(c)に示されており、不定ピッチ文書の文字間隔が
非常に微妙であることが分かる。次のステップ103で
は、前記各グループの(最小値ー1)の文字間隔サイズ
を空白サイズ候補として選出し、単語長検出処理26に
出力する。本例の場合の空白文字サイズ候補は、図3
(c)から1、7、11の3つとなる。なお、空白サイ
ズ候補は各グループの(最大値+1)としてもよい。要
はグループ間の中間位置のどこかに空白サイズ候補を定
めればよい。
【0009】単語長検出処理26は、空白サイズ選出処
理25により求められた各空白サイズ候補と図2のステ
ップ101で求められた文字間隔データを比較し、空白
サイズ候補より文字間隔が大きいところに空白を挿入し
たとしたときの単語長分布を、各空白サイズ毎に作成
し、空白サイズ決定処理28に出力する。図4(a)〜
(c)は図3(a)の画像データに対し、図3(c)で
求めた各空白サイズ毎の単語長分布を示したもので、図
中の△印が各空白サイズ候補を基準としたときの空白位
置を示し、その間の数字は空白で区切られた単語長(文
字数)を示している。
【0010】単語長重みデータベース27は、予め英文
読物文書の各単語長の出現頻度を調査し、その結果から
出現頻度が高い単語長ほど小さい重みをもたせたデータ
べースであり、空白サイズ決定処理28にて用いられ
る。図5(a)は適当に選出した英文読物文書10ペー
ジ分のデータを調査して得た単語長出現頻度調査結果を
示すヒストグラムで、図5(b)はこの結果を基に作成
した単語長重み係数データベース27の例を示すもので
ある。空白サイズ決定処理28は、前記単語長検出処理
26により求められた単語長データを、各空白文字サイ
ズごとに単語長重み係数データベース27と照合し、各
単語長の出現頻度とその重み係数との積を算出し、この
各積を全単語長分加算してその空白サイズ候補の累積値
とし、この累積値が一番小さくなる空白サイズ候補を空
白サイズと決定し、空白認識処理29へ出力する。図6
は図4の単語長の分布データを、図5(b)の単語長重
み係数データベースと照合した場合の各空白サイズ候補
ごとの累積値を示す。例えば空白サイズ候補が7の場合
は、単語長分布が図4(b)より5、2、3、6、2、
2、10、6、3、7、14であり、この各々の単語長
を図5(b)の単語長重み係数データベースと照合して
得られる重み係数はそれぞれ1、0、0、2、0、0、
6、2、0、2、11となり、この重み係数の全てを合
計した値24が、空白サイズ候補7の時の重み係数累積
値となる。こうして求めた重み係数累積値は、図5
(b)の重みの決め方から分かるように、出現頻度の高
い単語長ほど小さい重みを与えているから、上記累積値
が一番小さくなる空白サイズ候補7が正しい空白サイズ
と決定される。
【0011】なおここでは、出現頻度の高い単語長ほど
小さい重み係数を与えたが、これを逆にして出現頻度の
高い単語長ほど大きい重み係数を与え、重み係数累積値
の最大となる空白サイズ候補を空白サイズとしてもよ
い。
【0012】以上のように、本発明の特徴とする方法で
空白サイズが決定されると、空白認識処理29は、上記
求められた空白サイズより文字間隔が大きいところに空
白が存在すると認識し、その結果を文字認識処理30へ
送る。文字認識処理30は、文字外接枠検出処理24で
得られた文字外接枠にしたがい、画像データ記憶手段2
1より各文字の画像データを取り出し、正規化、塵処理
などの前処理を行ったのち、文字認識辞書31とのパタ
ーンマッチングなどの認識手法により文字認識処理を行
い、取り出した文字の画像データに似ていると判断され
た文字認識辞書31内の文字候補を認識結果出力処理3
2へ出力する。認識結果出力処理32は、空白認識処理
29と文字認識処理30で得られた結果を、電子計算機
用の文字コードとして出力する。これら空白認識処理2
9以降の処理は従来から既知のものでよい。
【0013】本実施例の方法によって英文の文字列から
単語を切り出し、各単語の文字認識を行うようにすれ
ば、正確に文字認識や英日翻訳を行う装置を実現でき
る。
【0014】
【発明の効果】本発明によれば、一般雑誌や手書きなど
の不定ピッチの英文読物文書における非常に微妙な空白
を正確に効率よく見つけることが出来ると言う効果があ
り、従って英文文書中の単語を正確に抽出できるから、
文字認識における認識率向上策の1つである単語照合処
理や英日翻訳用の文字認識に用いることにより、文字認
識や翻訳の精度向上が図れる。
【図面の簡単な説明】
【図1】本発明の空白認識方法の一実施例を示すフロー
チャートである。
【図2】空白サイズ候補選出処理のフローチャートであ
る。
【図3】空白サイズ候補選出処理の例を示す図である。
【図4】単語長検出処理の例を示す図である。
【図5】単語長重み係数データベースの例を示す図であ
る。
【図6】空白サイズ候補ごとの単語長重み係数累積値を
示す図である。
【図7】従来の空白認識方法の処理を示すフローチャー
トである。
【図8】不定ピッチの英文文書の例を示す図である。
【符号の説明】
1 画像入力装置 2 電子計算機 25 空白サイズ候補選出処理 26 単語長検出処理 27 単語長重み係数データベース 28 空白サイズ決定処理 29 空白認識処理 30 文字認識処理 31 文字認識辞書

Claims (8)

    【特許請求の範囲】
  1. 【請求項1】 入力された英文の画像データから切り出
    された文字行の各々について、当該文字行の画像データ
    に対する垂直方向のヒストグラムと水平方向のヒストグ
    ラムを求めて個々の文字外接枠を検出し、該検出した文
    字外接枠より当該文字行の全ての文字間隔を算出し、該
    算出した文字間隔の分布から複数個の空白サイズ候補を
    選出し、該選出した空白サイズ候補の各々について当該
    空白サイズ候補より上記求めた文字間隔が大きいところ
    に空白があるとした場合の各単語長を検出し、該検出し
    た単語長の分布が実際の英文の単語長分布に最も近くな
    るような空白サイズ候補を空白サイズと定め、該空白サ
    イズをこえる文字間隔には空白が存在するものとするこ
    とを特徴とする空白認識方法。
  2. 【請求項2】 前記文字間隔の分布から空白サイズ候補
    を選出する方法は、当該行の全文字間隔を、その差が予
    め定めた域値未満のものが同一グループ、その差が上記
    域値以上のものが別のグループとなるようにグループ分
    けし、該グループを大きさの順に並べたときのグループ
    とグループの間の文字間隔あるいはどのグループよりも
    小さい文字間隔を空白サイズ候補とすることを特徴とす
    る空白認識方法。
  3. 【請求項3】 前記域値を3画素とし、前記各グループ
    の間の最小文字間隔よりも1画素小さい値あるいは各グ
    ループ内の最大文字間隔より1画素大きい値を空白サイ
    ズ候補とすることを特徴とする請求項2記載の空白認識
    方法。
  4. 【請求項4】 英文における単語長の分布を調べ、出現
    頻度の高い単語長ほど重み係数が小さくなるように各単
    語長に対する重み係数を定めたテーブルを備えるととも
    に、前記検出した単語長の出現頻度と当該単語長対応の
    上記テーブルで定められた重み係数を乗じた積を各単語
    長について加算して得た累積値が小さいほど実際の英文
    の単語長分布に近いと判定することを特徴とする請求項
    1記載の空白認識方法。
  5. 【請求項5】 英文における単語長の分布を調べ、出現
    頻度の高い単語長ほど重み係数が大きくなるように各単
    語長に対する重み係数を定めたテーブルを備えるととも
    に、前記検出した単語長の出現頻度と当該単語長対応の
    上記テーブルで定められた重み係数を乗じた積を各単語
    長について加算して得た累積値が大きいほど実際の英文
    の単語長分布に近いと判定することを特徴とする請求項
    1記載の空白認識方法。
  6. 【請求項6】 入力された英文の画像データから切り出
    された文字行の各々について、当該文字行の画像データ
    に対する垂直方向のヒストグラムと水平方向のヒストグ
    ラムを求めて個々の文字外接枠を検出する手段と、該検
    出した文字外接枠より当該文字行の全ての文字間隔を算
    出し、該算出した文字間隔の分布から複数個の空白サイ
    ズ候補を選出する手段と、該選出した空白サイズ候補の
    各々について当該空白サイズ候補より上記求めた文字間
    隔が大きいところに空白があるとした場合の各単語長を
    検出する手段と、該検出した単語長の分布が実際の英文
    の単語長分布に最も近くなるような空白サイズ候補を空
    白サイズと定め、該空白サイズをこえる文字間隔には空
    白が存在するものと判断する手段より成ることを特徴と
    する空白認識装置。
  7. 【請求項7】 請求項1記載の空白認識方法を用いて認
    識した空白により文字列を区切って単語を取り出し、該
    単語の各々の文字を認識する文字認識装置。
  8. 【請求項8】 請求項7記載の文字認識装置により認識
    した各単語のスペルを基に入力された英文の文書を日本
    文に翻訳する英日翻訳装置。
JP3137275A 1991-05-13 1991-05-13 空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置 Pending JPH0567237A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP3137275A JPH0567237A (ja) 1991-05-13 1991-05-13 空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP3137275A JPH0567237A (ja) 1991-05-13 1991-05-13 空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置

Publications (1)

Publication Number Publication Date
JPH0567237A true JPH0567237A (ja) 1993-03-19

Family

ID=15194870

Family Applications (1)

Application Number Title Priority Date Filing Date
JP3137275A Pending JPH0567237A (ja) 1991-05-13 1991-05-13 空白認識方法、空白認識装置、文字認識装置、英日翻 訳装置

Country Status (1)

Country Link
JP (1) JPH0567237A (ja)

Cited By (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR19990025455A (ko) * 1997-09-12 1999-04-06 구자홍 히스토그램 기울기를 이용한 문자영역 내의 줄 분리 방법
KR100458941B1 (ko) * 1997-08-27 2005-01-17 엘지전자 주식회사 히스토그램 기울기를 이용한 문자영역 내의 줄 분리 방법
US7062089B2 (en) 2002-02-22 2006-06-13 Fujitsu Limited Handwritten character input assistant apparatus and method
US8225200B2 (en) 2006-12-13 2012-07-17 Canon Kabushiki Kaisha Extracting a character string from a document and partitioning the character string into words by inserting space characters where appropriate
JP2014021533A (ja) * 2012-07-12 2014-02-03 Fuji Xerox Co Ltd 情報処理装置及び情報処理プログラム
US8861862B2 (en) 2011-08-03 2014-10-14 Sharp Kabushiki Kaisha Character recognition apparatus, character recognition method and program
JP2016143413A (ja) * 2015-01-29 2016-08-08 コニカ ミノルタ ラボラトリー ユー.エス.エー.,インコーポレイテッド 再帰的な区分化を用いた文書画像についての単語区分化
JP2019125353A (ja) * 2017-12-29 2019-07-25 コニカ ミノルタ ラボラトリー ユー.エス.エー.,インコーポレイテッド 電子文書中の文字列塊を推測する方法
CN113780265A (zh) * 2021-09-16 2021-12-10 平安科技(深圳)有限公司 英文单词的空格识别方法、装置、存储介质及计算机设备

Cited By (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100458941B1 (ko) * 1997-08-27 2005-01-17 엘지전자 주식회사 히스토그램 기울기를 이용한 문자영역 내의 줄 분리 방법
KR19990025455A (ko) * 1997-09-12 1999-04-06 구자홍 히스토그램 기울기를 이용한 문자영역 내의 줄 분리 방법
US7062089B2 (en) 2002-02-22 2006-06-13 Fujitsu Limited Handwritten character input assistant apparatus and method
US8225200B2 (en) 2006-12-13 2012-07-17 Canon Kabushiki Kaisha Extracting a character string from a document and partitioning the character string into words by inserting space characters where appropriate
US8861862B2 (en) 2011-08-03 2014-10-14 Sharp Kabushiki Kaisha Character recognition apparatus, character recognition method and program
JP2014021533A (ja) * 2012-07-12 2014-02-03 Fuji Xerox Co Ltd 情報処理装置及び情報処理プログラム
JP2016143413A (ja) * 2015-01-29 2016-08-08 コニカ ミノルタ ラボラトリー ユー.エス.エー.,インコーポレイテッド 再帰的な区分化を用いた文書画像についての単語区分化
JP2019125353A (ja) * 2017-12-29 2019-07-25 コニカ ミノルタ ラボラトリー ユー.エス.エー.,インコーポレイテッド 電子文書中の文字列塊を推測する方法
CN113780265A (zh) * 2021-09-16 2021-12-10 平安科技(深圳)有限公司 英文单词的空格识别方法、装置、存储介质及计算机设备
CN113780265B (zh) * 2021-09-16 2023-12-15 平安科技(深圳)有限公司 英文单词的空格识别方法、装置、存储介质及计算机设备

Similar Documents

Publication Publication Date Title
US7181068B2 (en) Mathematical expression recognizing device, mathematical expression recognizing method, character recognizing device and character recognizing method
JP3576570B2 (ja) 比較方法
US6272242B1 (en) Character recognition method and apparatus which groups similar character patterns
Spitz Determination of the script and language content of document images
JP4504702B2 (ja) 文書処理装置、文書処理方法、および文書処理プログラム
KR100297482B1 (ko) 수기입력의문자인식방법및장치
US7020338B1 (en) Method of identifying script of line of text
CN112560849B (zh) 基于神经网络算法的文理分割方法及系统
US9047655B2 (en) Computer vision-based methods for enhanced JBIG2 and generic bitonal compression
JPH0684006A (ja) オンライン手書き文字認識方法
US11551461B2 (en) Text classification
CN1123844C (zh) 识别手写字符的装置和方法
JP2000315247A (ja) 文字認識装置
Kim et al. Word segmentation of printed text lines based on gap clustering and special symbol detection
US11335108B2 (en) System and method to recognise characters from an image
Singh et al. Document layout analysis for Indian newspapers using contour based symbiotic approach
JP4194020B2 (ja) 文字認識方法、該方法の実行に用いるプログラム及び文字認識装置
JP2751865B2 (ja) 文字列認識装置
WO2007070010A1 (en) Improvements in electronic document analysis
Singh et al. Development of a page segmentation technique for Bangla documents printed in italic style
JP3128357B2 (ja) 文字認識処理装置
JP3157530B2 (ja) 文字切り出し方法
TWI869931B (zh) 車牌辨識系統及其方法
Zhou et al. Character recognition under severe perspective distortion
Liu et al. An improved algorithm for Identifying Mathematical formulas in the images of PDF documents