JPH0793467A - 住所読取システム - Google Patents
住所読取システムInfo
- Publication number
- JPH0793467A JPH0793467A JP5236154A JP23615493A JPH0793467A JP H0793467 A JPH0793467 A JP H0793467A JP 5236154 A JP5236154 A JP 5236154A JP 23615493 A JP23615493 A JP 23615493A JP H0793467 A JPH0793467 A JP H0793467A
- Authority
- JP
- Japan
- Prior art keywords
- address
- character
- characters
- name
- notation
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Landscapes
- Sorting Of Articles (AREA)
- Character Discrimination (AREA)
Abstract
(57)【要約】
【目的】住所表記の自動読取処理における高精度化と高
速化。 【構成】住所表記文字全てについて、とりあえず文字認
識をしておく。認識された住所表記文字の初めの数文字
の組合せに対して、対象を都道府県(第1階層)に絞っ
て該当する都道府県名を検索する。この検索の結果、実
在する都道府県名、例えば東京都が見つかれば、対象を
都内(第2階層)に絞り、認識された住所表記文字の次
の数文字の組合せに対して、該当する地域名(区/市な
ど)を検索する。この検索の結果、実在する地域名、例
えば足立区が見つかれば、対象を足立区内(第3階層)
に絞り、認識された住所表記文字のさらに次の数文字の
組合せに対して、場所(町名など)を検索する。このよ
うに上位階層から順に住所を検索し検索結果が出る毎に
検索対象を絞って行くことで、読取正解率の向上と処理
時間の短縮を図る。
速化。 【構成】住所表記文字全てについて、とりあえず文字認
識をしておく。認識された住所表記文字の初めの数文字
の組合せに対して、対象を都道府県(第1階層)に絞っ
て該当する都道府県名を検索する。この検索の結果、実
在する都道府県名、例えば東京都が見つかれば、対象を
都内(第2階層)に絞り、認識された住所表記文字の次
の数文字の組合せに対して、該当する地域名(区/市な
ど)を検索する。この検索の結果、実在する地域名、例
えば足立区が見つかれば、対象を足立区内(第3階層)
に絞り、認識された住所表記文字のさらに次の数文字の
組合せに対して、場所(町名など)を検索する。このよ
うに上位階層から順に住所を検索し検索結果が出る毎に
検索対象を絞って行くことで、読取正解率の向上と処理
時間の短縮を図る。
Description
【0001】
【産業上の利用分野】この発明は、郵便物に印刷されあ
るいは手書き記載された住所表記を電子的に読み取り認
識する住所読取システムに関する。
るいは手書き記載された住所表記を電子的に読み取り認
識する住所読取システムに関する。
【0002】
【従来の技術】通常、住所読取処理では、まず文字を認
識し、次にこれを並べて単語を認識し、同時に(あるい
は続いて)単語を並べて住所を認識する。すなわち、住
所読取システムにおける認識処理は、「文字認識」と
「住所認識」という2つの処理に分けることができる。
識し、次にこれを並べて単語を認識し、同時に(あるい
は続いて)単語を並べて住所を認識する。すなわち、住
所読取システムにおける認識処理は、「文字認識」と
「住所認識」という2つの処理に分けることができる。
【0003】ここで、文字認識処理部では読み取った文
字画像(文字パターン)を可能性のある全文字種の辞書
と照合するが、単語認識(住所表記語認識)ではその処
理量を軽減するため類似度の高い数文字種(例えば10
種)のみを限定選択して住所認識処理部に送るようにし
ている。しかしこの場合、正解がこの中(選択された1
0種)に入らないと住所の読み取りが不能になる。
字画像(文字パターン)を可能性のある全文字種の辞書
と照合するが、単語認識(住所表記語認識)ではその処
理量を軽減するため類似度の高い数文字種(例えば10
種)のみを限定選択して住所認識処理部に送るようにし
ている。しかしこの場合、正解がこの中(選択された1
0種)に入らないと住所の読み取りが不能になる。
【0004】この発明に拠らない場合、住所読取システ
ムを構築するための方法としては、次のいずれかが考え
られる。 (1)文字認識では各文字毎に住所認識処理で使用する
全文字種と照合/評価処理し、評価値の高い方から一定
数の文字種候補を選択して住所認識処理に渡す。 (2)住所表記を上位階層から順に(例えば県→市→区
→町)処理し、各階層毎に文字認識、住所認識を繰り返
す。
ムを構築するための方法としては、次のいずれかが考え
られる。 (1)文字認識では各文字毎に住所認識処理で使用する
全文字種と照合/評価処理し、評価値の高い方から一定
数の文字種候補を選択して住所認識処理に渡す。 (2)住所表記を上位階層から順に(例えば県→市→区
→町)処理し、各階層毎に文字認識、住所認識を繰り返
す。
【0005】
【発明が解決しようとする課題】上記(1)の場合、住
所認識で都道府県の認識を行なっている場合に、都道府
県名の文字認識結果の上位候補に市、区、あるいは町の
みに使用される文字が多く含まれると、正解文字が10
種の候補から落ちてしまう場合がある。この場合は、当
然、正しい単語や住所を認識することができず、読取不
能となる。
所認識で都道府県の認識を行なっている場合に、都道府
県名の文字認識結果の上位候補に市、区、あるいは町の
みに使用される文字が多く含まれると、正解文字が10
種の候補から落ちてしまう場合がある。この場合は、当
然、正しい単語や住所を認識することができず、読取不
能となる。
【0006】たとえば図6(a)の例では、「東」
「京」「都」の3文字画像から文字認識を行なった場合
に、「東」と「都」の2文字については10種の候補中
に正解文字(下線付き)が入っているが、「京」につい
ては10種の候補中に正解文字が入っていない(「京」
は第11候補に入っている)。また「足」「立」「区」
の3文字画像から文字認識を行なった場合に、「足」と
「区」の2文字については10種の候補中に正解文字
(下線付き)が入っているが、「立」については10種
の候補中に正解文字が入っていない(「立」は第11候
補に入っている)。この例では、「東京都足立区」の読
み取りは不能となる。
「京」「都」の3文字画像から文字認識を行なった場合
に、「東」と「都」の2文字については10種の候補中
に正解文字(下線付き)が入っているが、「京」につい
ては10種の候補中に正解文字が入っていない(「京」
は第11候補に入っている)。また「足」「立」「区」
の3文字画像から文字認識を行なった場合に、「足」と
「区」の2文字については10種の候補中に正解文字
(下線付き)が入っているが、「立」については10種
の候補中に正解文字が入っていない(「立」は第11候
補に入っている)。この例では、「東京都足立区」の読
み取りは不能となる。
【0007】一方、上記(2)の場合では、読み取る住
所階層に限定して文字認識を行なえるため(1)の場合
の欠点(読取不能)は解消できる。たとえば、「東京
都」が見つかればその後の数文字には「区」、「市」な
どの名称を表す数文字しか現われない。この場合、日本
全国の地域名称をカバーする全文字種から上位10文字
を選ぶより、「東京都」に続いて現われる限られた文字
種の中から選ぶほうが、「区」や「市」の名称の正解が
10候補文字種中に入る確率が高くなり、最終的に住所
読取率が向上する。
所階層に限定して文字認識を行なえるため(1)の場合
の欠点(読取不能)は解消できる。たとえば、「東京
都」が見つかればその後の数文字には「区」、「市」な
どの名称を表す数文字しか現われない。この場合、日本
全国の地域名称をカバーする全文字種から上位10文字
を選ぶより、「東京都」に続いて現われる限られた文字
種の中から選ぶほうが、「区」や「市」の名称の正解が
10候補文字種中に入る確率が高くなり、最終的に住所
読取率が向上する。
【0008】しかし、上記(2)の場合では時間のかか
る文字認識処理を住所表記階層毎に繰り返すため処理効
率が悪く、処理時間が長くなる。たとえば、「神奈川
県」「川崎市」「幸区」「柳町」のように住所階層が深
くなると、住所判定結果を得るまでに何度も(この場合
4度)同じ文字の文字認識をすることになり、効率が悪
い。また上位階層(例えば川崎市)の住所認識が終わる
まで次の階層(例えば幸区)の文字認識ができないこと
から、文字認識で使用するハードウエアの遊び時間が生
じてしまい、さらに非効率的となる。この発明の目的
は、住所表記の自動読取処理において高精度化と高速化
を図った住所読取システムを提供することである。
る文字認識処理を住所表記階層毎に繰り返すため処理効
率が悪く、処理時間が長くなる。たとえば、「神奈川
県」「川崎市」「幸区」「柳町」のように住所階層が深
くなると、住所判定結果を得るまでに何度も(この場合
4度)同じ文字の文字認識をすることになり、効率が悪
い。また上位階層(例えば川崎市)の住所認識が終わる
まで次の階層(例えば幸区)の文字認識ができないこと
から、文字認識で使用するハードウエアの遊び時間が生
じてしまい、さらに非効率的となる。この発明の目的
は、住所表記の自動読取処理において高精度化と高速化
を図った住所読取システムを提供することである。
【0009】
【課題を解決するための手段】この発明の住所読取シス
テムは、正しい住所表記のデータ(都道府県名、各市区
町村名、その他の実在地名)を格納している住所辞書
(50)と;1以上の住所表記階層(第1階層/都道府
県名「東京都」;第2階層「足立区」;第3階層「西新
井栄町」;第4階層・・・・・・)からなる住所表示に
用いられる1以上の住所表記語(「東京都」「足立区」
「西新井栄町」・・・・・・)を構成する文字各々を認
識して、文字認識結果(「東」「京」「都」「足」
「立」「区」「西」「新」「井」「栄」「町」・・・・
・・)を出力する文字認識手段(10、30;ST1
0、ST12)と;前記1以上の住所表記語(「東京
都」「足立区」「西新井栄町」)各々の認識に必要な最
小限の文字種を含んで構成される1以上の文字種テーブ
ル(40;ST16、ST20、ST24)と;前記文
字認識手段(10、30)で認識された文字認識結果
(「東」「京」「都」・・・・・・)のうち、これから
認識しようとする住所階層(「東京都」)の判定に必要
な所定数の文字種(「東」「京」「都」それぞれ1字に
つき10種)を前記文字種テーブル(40;ST16)
から抽出し、抽出された文字各々の組合せで前記住所辞
書(50)を引いて、該当する住所表記語(「東京
都」)を検出する住所認識手段(20)とを備えてい
る。
テムは、正しい住所表記のデータ(都道府県名、各市区
町村名、その他の実在地名)を格納している住所辞書
(50)と;1以上の住所表記階層(第1階層/都道府
県名「東京都」;第2階層「足立区」;第3階層「西新
井栄町」;第4階層・・・・・・)からなる住所表示に
用いられる1以上の住所表記語(「東京都」「足立区」
「西新井栄町」・・・・・・)を構成する文字各々を認
識して、文字認識結果(「東」「京」「都」「足」
「立」「区」「西」「新」「井」「栄」「町」・・・・
・・)を出力する文字認識手段(10、30;ST1
0、ST12)と;前記1以上の住所表記語(「東京
都」「足立区」「西新井栄町」)各々の認識に必要な最
小限の文字種を含んで構成される1以上の文字種テーブ
ル(40;ST16、ST20、ST24)と;前記文
字認識手段(10、30)で認識された文字認識結果
(「東」「京」「都」・・・・・・)のうち、これから
認識しようとする住所階層(「東京都」)の判定に必要
な所定数の文字種(「東」「京」「都」それぞれ1字に
つき10種)を前記文字種テーブル(40;ST16)
から抽出し、抽出された文字各々の組合せで前記住所辞
書(50)を引いて、該当する住所表記語(「東京
都」)を検出する住所認識手段(20)とを備えてい
る。
【0010】
【作用】住所を構成する各文字について、各住所階層の
住所表記に用いられる全文字種との類似度(あるいは評
価値)が予め求められ、各住所階層の文字テーブルにま
とめられている。住所構成文字の階層を上位(都道府県
名)から順に読み進めていく際に、上位階層文字の読取
結果に基づき次の階層(市/区名など)の読取に必要な
類似文字種のみで構成される文字テーブルを選択して参
照することにより、住所文字の読取正解率の向上と処理
時間の短縮を図る。
住所表記に用いられる全文字種との類似度(あるいは評
価値)が予め求められ、各住所階層の文字テーブルにま
とめられている。住所構成文字の階層を上位(都道府県
名)から順に読み進めていく際に、上位階層文字の読取
結果に基づき次の階層(市/区名など)の読取に必要な
類似文字種のみで構成される文字テーブルを選択して参
照することにより、住所文字の読取正解率の向上と処理
時間の短縮を図る。
【0011】
【実施例】以下、図面を参照してこの発明の一実施例に
係る住所読取システムを説明する。図5は、この住所読
取システムに適用されるハードウエアの構成の概要を示
す。この実施例システムは、光電変換ユニット102、
領域検出ユニット104、行検出ユニット106、文字
検出ユニット108および文字認識ユニット110から
なる文字認識部10と、文字認識ユニット110で文字
認識の際に参照される基本文字を全て含む文字辞書30
と、文字種テーブル40および住所辞書50を参照して
文字認識部10で認識された読取文字の組合せから住所
を認識する住所認識ユニット20とで構成されている。
文字認識ユニット110および住所認識ユニット20は
マイクロコンピュータ(CPU)を含んでおり、これら
のユニットの機能はそのCPU上で走るソフトウエアで
実現される。なお、文字認識部10そのものは従来の光
学文字読取装置(OCR)等で採用されている文字認識
技術により構成できる。
係る住所読取システムを説明する。図5は、この住所読
取システムに適用されるハードウエアの構成の概要を示
す。この実施例システムは、光電変換ユニット102、
領域検出ユニット104、行検出ユニット106、文字
検出ユニット108および文字認識ユニット110から
なる文字認識部10と、文字認識ユニット110で文字
認識の際に参照される基本文字を全て含む文字辞書30
と、文字種テーブル40および住所辞書50を参照して
文字認識部10で認識された読取文字の組合せから住所
を認識する住所認識ユニット20とで構成されている。
文字認識ユニット110および住所認識ユニット20は
マイクロコンピュータ(CPU)を含んでおり、これら
のユニットの機能はそのCPU上で走るソフトウエアで
実現される。なお、文字認識部10そのものは従来の光
学文字読取装置(OCR)等で採用されている文字認識
技術により構成できる。
【0012】初めに、この実施例システムの内容を簡単
に説明する。光電変換ユニット102は、読取対象文字
を含む郵便物の表面画像を取り込み、これを2値化し
て、文字画像を含む原画像データを出力する。
に説明する。光電変換ユニット102は、読取対象文字
を含む郵便物の表面画像を取り込み、これを2値化し
て、文字画像を含む原画像データを出力する。
【0013】領域検出ユニット104は、郵便物の表面
を走査して得た窓信号および精走査信号から、宛名の記
載された領域を抽出する。すなわち、まず郵便物全体の
画像情報(原画像データ)を2次元的に圧縮処理し、そ
の処理画像により大局的な画像のブロック化を図り、細
部に捕われない大局的な領域検出を行なう。次に、ブロ
ック単位の投影データを生成し、線分の複雑さ/方向性
を判定し、その判定結果を予め与えられた宛名領域編集
知識によって編集して、宛名領域を決定する。
を走査して得た窓信号および精走査信号から、宛名の記
載された領域を抽出する。すなわち、まず郵便物全体の
画像情報(原画像データ)を2次元的に圧縮処理し、そ
の処理画像により大局的な画像のブロック化を図り、細
部に捕われない大局的な領域検出を行なう。次に、ブロ
ック単位の投影データを生成し、線分の複雑さ/方向性
を判定し、その判定結果を予め与えられた宛名領域編集
知識によって編集して、宛名領域を決定する。
【0014】宛名領域からは、領域内における画像濃度
ヒストグラムから求められる2値化しきい値候補、検出
された宛名領域位置から求められる記載方向候補、およ
び手書き/印刷活字などの字体候補が出力される。宛名
領域編集知識には、多量の郵便物から抽出した宛名記載
位置/領域について、統計的調査に基づくデータが宛名
領域画像知識として取り込まれている。
ヒストグラムから求められる2値化しきい値候補、検出
された宛名領域位置から求められる記載方向候補、およ
び手書き/印刷活字などの字体候補が出力される。宛名
領域編集知識には、多量の郵便物から抽出した宛名記載
位置/領域について、統計的調査に基づくデータが宛名
領域画像知識として取り込まれている。
【0015】郵便物表面には宛名と同様に記載されてい
る差出人名、差出人住所、通信文、切手などの料額印
面、そして多種多様な広告などがあり、これらの位置、
領域、複雑さ、印字方向などが宛名領域画像知識の構築
に利用される。
る差出人名、差出人住所、通信文、切手などの料額印
面、そして多種多様な広告などがあり、これらの位置、
領域、複雑さ、印字方向などが宛名領域画像知識の構築
に利用される。
【0016】行検出ユニット106は、領域検出ユニッ
ト104からの出力を受け、宛名文字の行を囲う枠線ま
たは宛名記載上の罫線などのノイズ成分を取り除き、文
字行単位の分離抽出を行なう。また検出された文字行単
位に印字濃度ヒストグラムを求め、検出文字行単位での
最適2値化しきい値を決定する。
ト104からの出力を受け、宛名文字の行を囲う枠線ま
たは宛名記載上の罫線などのノイズ成分を取り除き、文
字行単位の分離抽出を行なう。また検出された文字行単
位に印字濃度ヒストグラムを求め、検出文字行単位での
最適2値化しきい値を決定する。
【0017】ここでの文字行単位検出のアルゴリズムは
宛名領域検出のアルゴリズムと基本的には同様である。
しかし文字行単位検出では大局的な捕え方はせず、宛名
領域検出の場合よりも詳細な画像分析によって下線領
域、空白領域などを除外し読取対象画像(行画像)を限
定抽出する。
宛名領域検出のアルゴリズムと基本的には同様である。
しかし文字行単位検出では大局的な捕え方はせず、宛名
領域検出の場合よりも詳細な画像分析によって下線領
域、空白領域などを除外し読取対象画像(行画像)を限
定抽出する。
【0018】文字検出ユニット108は、行検出ユニッ
ト106で抽出/決定された行画像/2値化しきい値に
よって、文字単位に画像を分離する。すなわち、文字行
幅データによって予め定めたしきい値以下を印刷活字宛
名と仮定し、それ以外を手書き宛名と仮定する。そし
て、行方向の文字分離を射影情報から検出する。その検
出論理は文字間の余白によって生ずるスペース検知であ
るが、文字間の接触、文字内の分離については検出され
た文字外接枠を正方形を基準として変動予測評価し決定
する。評価の決定があいまいな場合は複数の検出候補を
認める。
ト106で抽出/決定された行画像/2値化しきい値に
よって、文字単位に画像を分離する。すなわち、文字行
幅データによって予め定めたしきい値以下を印刷活字宛
名と仮定し、それ以外を手書き宛名と仮定する。そし
て、行方向の文字分離を射影情報から検出する。その検
出論理は文字間の余白によって生ずるスペース検知であ
るが、文字間の接触、文字内の分離については検出され
た文字外接枠を正方形を基準として変動予測評価し決定
する。評価の決定があいまいな場合は複数の検出候補を
認める。
【0019】文字認識ユニット110は、公知の光学文
字読取装置(OCR)と同様な文字認識処理を行なう。
この文字認識処理にあたり予め用意される識別対象文字
種は、アラビア数字/漢数字および片仮名/平仮名の全
文字と宛名表記に用いられる漢字約200文字である。
これらの文字(合計400文字以下)は、印刷活字用と
手書き文字用にそれぞれ用意される(用意される文字数
は最大800文字程度)。
字読取装置(OCR)と同様な文字認識処理を行なう。
この文字認識処理にあたり予め用意される識別対象文字
種は、アラビア数字/漢数字および片仮名/平仮名の全
文字と宛名表記に用いられる漢字約200文字である。
これらの文字(合計400文字以下)は、印刷活字用と
手書き文字用にそれぞれ用意される(用意される文字数
は最大800文字程度)。
【0020】上述のユニット102〜110各々につい
ては従来技術で構成できるので、これ以上詳細に立ち入
った説明は避けることにする。あいまいさを含んだ入力
文字画像に対し、文字識別を100%正解するよう図る
ことは現実的でない。そこで、本願実施例では、後に住
所知識(住所辞書50)を利用した後処理があることを
前提にして、入力画像単位に識別候補という形で類似度
の高いものから順に10候補を出力するようにしてい
る。こうすることによって、識別候補を単一にしたので
は得られない高い識別率を獲得できる。
ては従来技術で構成できるので、これ以上詳細に立ち入
った説明は避けることにする。あいまいさを含んだ入力
文字画像に対し、文字識別を100%正解するよう図る
ことは現実的でない。そこで、本願実施例では、後に住
所知識(住所辞書50)を利用した後処理があることを
前提にして、入力画像単位に識別候補という形で類似度
の高いものから順に10候補を出力するようにしてい
る。こうすることによって、識別候補を単一にしたので
は得られない高い識別率を獲得できる。
【0021】また、記載上のあいまいさとして残された
記載方向(縦書き/横書き)の区分については、入力文
字画像を90°および180°回転させて識別処理を行
ない、それぞれの回転単位について一連の文字候補行列
を出力する。
記載方向(縦書き/横書き)の区分については、入力文
字画像を90°および180°回転させて識別処理を行
ない、それぞれの回転単位について一連の文字候補行列
を出力する。
【0022】住所認識ユニット20では、配達局管内に
与えられた区名、町名、大口受取人名などの知識データ
ベース(辞書50の一部)を用い、文字識別候補行列か
ら宛名を決定する。たとえば東京都足立区の足立郵便局
を例に取ると、住所として用意した標準表記町名は31
種あり、また大口受取人名としては足立区役所など10
種ある。しかしそれらの名称の表記は様々な変形を含む
ので、他の町名/大口受取人名と競合しない限りにおい
て、変形の頻度に応じて学習を進め、宛名知識データを
増やすようにする。
与えられた区名、町名、大口受取人名などの知識データ
ベース(辞書50の一部)を用い、文字識別候補行列か
ら宛名を決定する。たとえば東京都足立区の足立郵便局
を例に取ると、住所として用意した標準表記町名は31
種あり、また大口受取人名としては足立区役所など10
種ある。しかしそれらの名称の表記は様々な変形を含む
ので、他の町名/大口受取人名と競合しない限りにおい
て、変形の頻度に応じて学習を進め、宛名知識データを
増やすようにする。
【0023】たとえば、足立区の「小台」という町名を
例に取ると、標準の知識では「オダイ」となるがこの町
名には「コダイ」、[オタイ]、「コタイマチ」、「オ
ダイチョウ」などの変形がある。これらの変形呼称がい
ずれも足立区の「小台」を指すものとして、宛名知識デ
ータベース(住所辞書50)に蓄積される。
例に取ると、標準の知識では「オダイ」となるがこの町
名には「コダイ」、[オタイ]、「コタイマチ」、「オ
ダイチョウ」などの変形がある。これらの変形呼称がい
ずれも足立区の「小台」を指すものとして、宛名知識デ
ータベース(住所辞書50)に蓄積される。
【0024】上述したような変形を含む住所/大口受取
人名による知識から、2文字以上連接した文字群によっ
て作られる単語を作成し、この単語によって前記文字識
別候補行列を評価する。たとえば作成された単語が「東
京都」であり対応する文字識別候補行列が図6(b)に
示すようなものであれば、「東東群」、「東東都」、
「東京群」、「東京都」、「京東群」、「京東都」、
「京東群」、「京京都」といった語群から、「東京都」
という住所辞書50に(宛名知識として)登録された地
名が最終的に選択される。
人名による知識から、2文字以上連接した文字群によっ
て作られる単語を作成し、この単語によって前記文字識
別候補行列を評価する。たとえば作成された単語が「東
京都」であり対応する文字識別候補行列が図6(b)に
示すようなものであれば、「東東群」、「東東都」、
「東京群」、「東京都」、「京東群」、「京東都」、
「京東群」、「京京都」といった語群から、「東京都」
という住所辞書50に(宛名知識として)登録された地
名が最終的に選択される。
【0025】その後、全ての単語照合が終了した段階
で、いくつかの単語候補について再度知識処理が行なわ
れる。それは単語照合と同様に単語間の隣接関係を保っ
たうえで、住所または大口受取人名としての単語並びが
得られるかどうかを評価する処理である。たとえば、東
京都という単語の次に足立区という単語が並びその次に
町名が並んでいるか、あるいは足立区の次に区役所など
の大口受取人名称単語が並んでいるか、といった点が評
価される。この評価では、単語毎に所定の得点を与え
(現実の住所地名表記に近いものほど高得点)、得点の
積算により最も高い得点を得た宛名を出力するようにで
きる。
で、いくつかの単語候補について再度知識処理が行なわ
れる。それは単語照合と同様に単語間の隣接関係を保っ
たうえで、住所または大口受取人名としての単語並びが
得られるかどうかを評価する処理である。たとえば、東
京都という単語の次に足立区という単語が並びその次に
町名が並んでいるか、あるいは足立区の次に区役所など
の大口受取人名称単語が並んでいるか、といった点が評
価される。この評価では、単語毎に所定の得点を与え
(現実の住所地名表記に近いものほど高得点)、得点の
積算により最も高い得点を得た宛名を出力するようにで
きる。
【0026】大口受取人宛ての郵便物を除いて、町名以
降の丁目、街区(番/号など)を識別するため、検出さ
れた町名の文字画像上の位置および宛名記載書式コード
(縦書き/横書き/回転などの情報)を従属情報として
次の処理に渡す。
降の丁目、街区(番/号など)を識別するため、検出さ
れた町名の文字画像上の位置および宛名記載書式コード
(縦書き/横書き/回転などの情報)を従属情報として
次の処理に渡す。
【0027】町名までの認識後では、町名に連なる文字
画像が丁目/街区を表すことが明かとなる。住所認識ユ
ニット20は、この丁目/街区の部分を識別して最終的
な宛名を決定し、これを宛名区分コードに変換して出力
する。
画像が丁目/街区を表すことが明かとなる。住所認識ユ
ニット20は、この丁目/街区の部分を識別して最終的
な宛名を決定し、これを宛名区分コードに変換して出力
する。
【0028】以上まとめると、図5の実施例は以下のよ
うに機能する。すなわち、文字認識部10では文字辞書
30が参照され、手書き文字あるいは印刷活字の文字読
取/認識が行なわれる。住所認識ユニット20では文字
テーブル40が参照され、文字認識部10で認識された
1以上の読取文字の組合せが1以上作成される。次に作
成された読取文字の組合せによって住所辞書50が引か
れ、この辞書50から読取文字組合せに該当する正しい
住所表示語が読み出される。辞書50から読み出された
1以上の住所表示語の文字コードと、これらの住所表示
語に続く住所表示数値(丁目、番、号など)のコードが
まとめられて、住所読取結果(宛名区分コード)として
出力される。
うに機能する。すなわち、文字認識部10では文字辞書
30が参照され、手書き文字あるいは印刷活字の文字読
取/認識が行なわれる。住所認識ユニット20では文字
テーブル40が参照され、文字認識部10で認識された
1以上の読取文字の組合せが1以上作成される。次に作
成された読取文字の組合せによって住所辞書50が引か
れ、この辞書50から読取文字組合せに該当する正しい
住所表示語が読み出される。辞書50から読み出された
1以上の住所表示語の文字コードと、これらの住所表示
語に続く住所表示数値(丁目、番、号など)のコードが
まとめられて、住所読取結果(宛名区分コード)として
出力される。
【0029】次に、図1を参照して、文字認識後の住所
表記文字から住所が読み取られるまでの過程をいくつか
の段階に分けて説明する。 (1)まず、郵便物の紙面に記載された住所文字は、図
5の光電変換ユニット102、領域検出ユニット10
4、行検出ユニット106、および文字検出ユニット1
08を経て、図6(a)の文字画像のように1文字づつ
に切り分けられる。
表記文字から住所が読み取られるまでの過程をいくつか
の段階に分けて説明する。 (1)まず、郵便物の紙面に記載された住所文字は、図
5の光電変換ユニット102、領域検出ユニット10
4、行検出ユニット106、および文字検出ユニット1
08を経て、図6(a)の文字画像のように1文字づつ
に切り分けられる。
【0030】次に各文字画像は、図5の文字認識ユニッ
ト110において文字辞書30に登録されている全ての
文字種と照合/評価され(図1のステップST10、ス
テップST12)、図6(a)の最上段の「文字画像」
の行に示すような文字認識結果が得られる。(ここで文
字画像は正しい文字「東京都足立区…」で例示してある
が、これらはたとえば「東東群足土区…」のように誤っ
た文字を含んでいてもよい。)その後の住所認識処理の
処理量を大幅に軽減するため、住所認識処理で扱う文字
は、図6(a)のように評価値の高い方から一定数の候
補、例えば10候補に限定される。この場合、各文字の
正解の評価値が11位以下の場合は住所読取は不能とな
り、正解の読取率は低下する。
ト110において文字辞書30に登録されている全ての
文字種と照合/評価され(図1のステップST10、ス
テップST12)、図6(a)の最上段の「文字画像」
の行に示すような文字認識結果が得られる。(ここで文
字画像は正しい文字「東京都足立区…」で例示してある
が、これらはたとえば「東東群足土区…」のように誤っ
た文字を含んでいてもよい。)その後の住所認識処理の
処理量を大幅に軽減するため、住所認識処理で扱う文字
は、図6(a)のように評価値の高い方から一定数の候
補、例えば10候補に限定される。この場合、各文字の
正解の評価値が11位以下の場合は住所読取は不能とな
り、正解の読取率は低下する。
【0031】すなわち、文字認識ユニット110から文
字認識結を出力する前にこの候補選択処理を行なうと、
図6(a)の「京」の様に都道府県名に用いられる文字
を読み取る場合でも、都道府県名には現われない市、
区、町名の文字などが上位に上がり、正解の「京」が1
0の候補に残らない場合が多発する。
字認識結を出力する前にこの候補選択処理を行なうと、
図6(a)の「京」の様に都道府県名に用いられる文字
を読み取る場合でも、都道府県名には現われない市、
区、町名の文字などが上位に上がり、正解の「京」が1
0の候補に残らない場合が多発する。
【0032】(2)そこで本願実施例では、正解文字が
候補に残らないということをなくすために、文字認識ユ
ニット110での認識結果(たとえば東京都足立区西新
井栄町1丁目2番3号)を全て住所認識ユニット20に
送るようにしている。そして、住所認識ユニット20で
は、住所を住所表記の上位階層(都道府県名称)から段
階的に読み進める。
候補に残らないということをなくすために、文字認識ユ
ニット110での認識結果(たとえば東京都足立区西新
井栄町1丁目2番3号)を全て住所認識ユニット20に
送るようにしている。そして、住所認識ユニット20で
は、住所を住所表記の上位階層(都道府県名称)から段
階的に読み進める。
【0033】まず、読取対象として都道府県が指定され
る(ステップST14)。次に文字種テーブル40か
ら、都道府県名称(1都2府1道43県)だけの読み取
りに必要な文字種リスト(都道府県専用文字テーブル)
が文字辞書/基本文字候補30から読み出される(ステ
ップST16)。
る(ステップST14)。次に文字種テーブル40か
ら、都道府県名称(1都2府1道43県)だけの読み取
りに必要な文字種リスト(都道府県専用文字テーブル)
が文字辞書/基本文字候補30から読み出される(ステ
ップST16)。
【0034】そして、文字認識結果の住所表記文字
(「東」「京」「都」)各々に対して、この文字種リス
トに含まれる中で上位10候補が選択される。この結
果、図6(b)に示すように、都道府県指定による該当
文字候補が得られる。
(「東」「京」「都」)各々に対して、この文字種リス
トに含まれる中で上位10候補が選択される。この結
果、図6(b)に示すように、都道府県指定による該当
文字候補が得られる。
【0035】すなわち、図6(a)の例のように、単に
文字認識結果の上位10候補を選択した時には10候補
中に入らなかった「京」の正解文字が、都道府県指定下
の選択では10候補中に入るようになる。これらの文字
候補(東、京、郡、都など)の組合せ単語と住所辞書5
0の登録内容とが照合されて、正しい住所表記(東京
都)が読み取られる。
文字認識結果の上位10候補を選択した時には10候補
中に入らなかった「京」の正解文字が、都道府県指定下
の選択では10候補中に入るようになる。これらの文字
候補(東、京、郡、都など)の組合せ単語と住所辞書5
0の登録内容とが照合されて、正しい住所表記(東京
都)が読み取られる。
【0036】(3)図6(b)の例では、「東京都」が
読み取れたので、次の読取対象は都下の市/区/郡/島
名となる。次に、読取対象として東京都(他の都道府県
名、例えば神奈川県でもやり方は同様)が指定される
(ステップST18)。
読み取れたので、次の読取対象は都下の市/区/郡/島
名となる。次に、読取対象として東京都(他の都道府県
名、例えば神奈川県でもやり方は同様)が指定される
(ステップST18)。
【0037】次に文字種テーブル40から、都下の地域
名称(23区27市ほか)の読み取りに必要な文字種リ
スト(区/市/郡/島専用文字テーブル;すなわち地域
名文字テーブル)が基本文字候補30から読み出される
(ステップST20)。
名称(23区27市ほか)の読み取りに必要な文字種リ
スト(区/市/郡/島専用文字テーブル;すなわち地域
名文字テーブル)が基本文字候補30から読み出される
(ステップST20)。
【0038】そして、文字認識結果の住所表記文字
(「足」「立」「区」)各々に対して、この文字種リス
トに含まれる中で上位10候補が選択される。この結
果、図6(c)に示すように、東京都指定下における該
当文字候補が得られる。
(「足」「立」「区」)各々に対して、この文字種リス
トに含まれる中で上位10候補が選択される。この結
果、図6(c)に示すように、東京都指定下における該
当文字候補が得られる。
【0039】すなわち、単に文字認識結果の上位10候
補を選択した時(図6(a)の例)には10候補中に入
らなかった「立」の正解文字が、東京都指定下の選択で
は10候補中に入るようになる。これらの文字候補
(足、北、区、荒、立、国など)の組合せ単語と住所辞
書50の登録内容とが照合されて、正しい住所表記(足
立区)が読み取られる。
補を選択した時(図6(a)の例)には10候補中に入
らなかった「立」の正解文字が、東京都指定下の選択で
は10候補中に入るようになる。これらの文字候補
(足、北、区、荒、立、国など)の組合せ単語と住所辞
書50の登録内容とが照合されて、正しい住所表記(足
立区)が読み取られる。
【0040】(4)次に、読取対象として足立区(他の
都下地域名、例えば府中市でも同様)が指定される(ス
テップST22)。続いて文字種テーブル40から、足
立区内の地域名称(町名など)の読み取りに必要な文字
種リスト(町名/地名専用文字テーブル)が基本文字候
補30から読み出される(ステップST24)。
都下地域名、例えば府中市でも同様)が指定される(ス
テップST22)。続いて文字種テーブル40から、足
立区内の地域名称(町名など)の読み取りに必要な文字
種リスト(町名/地名専用文字テーブル)が基本文字候
補30から読み出される(ステップST24)。
【0041】そして、文字認識結果の住所表記文字
(「西」「新」「井」「栄」「町」)各々に対して、こ
の文字種リストに含まれる中で上位10候補が選択され
る。この結果、足立区指定による該当文字候補が得られ
る。
(「西」「新」「井」「栄」「町」)各々に対して、こ
の文字種リストに含まれる中で上位10候補が選択され
る。この結果、足立区指定による該当文字候補が得られ
る。
【0042】すなわち、住所表記文字(「西」「新」
「井」「栄」「町」の5文字)各々に対する上位10候
補中に正解文字が入るようになる。これらの各10文字
候補(合計50文字)の組合せ単語と住所辞書50の登
録内容とが照合されて、正しい住所表記(西新井栄町)
が読み取られる。
「井」「栄」「町」の5文字)各々に対する上位10候
補中に正解文字が入るようになる。これらの各10文字
候補(合計50文字)の組合せ単語と住所辞書50の登
録内容とが照合されて、正しい住所表記(西新井栄町)
が読み取られる。
【0043】ここで、読み取った住所が最終段階であれ
ば処理を終え、更に下位階層があれば読取対象を更新し
て別の文字種リスト(専用文字テーブル)を基本文字候
補30から読み出して、該当住所表記の読み取りが行な
われる。
ば処理を終え、更に下位階層があれば読取対象を更新し
て別の文字種リスト(専用文字テーブル)を基本文字候
補30から読み出して、該当住所表記の読み取りが行な
われる。
【0044】(5)その後、読み取った都道府県名と区
市町村名(東京都足立区西新井栄町)の文字コードが出
力され(ステップST26)、これに街区識別コード
(丁目/番地/号の数値コード)が付加される(ステッ
プST28)。そして、これらの文字/数値コードから
最終的な住所区分コードが求められ、住所認識ユニット
20から住所区分コードが出力される(ステップST3
0)。
市町村名(東京都足立区西新井栄町)の文字コードが出
力され(ステップST26)、これに街区識別コード
(丁目/番地/号の数値コード)が付加される(ステッ
プST28)。そして、これらの文字/数値コードから
最終的な住所区分コードが求められ、住所認識ユニット
20から住所区分コードが出力される(ステップST3
0)。
【0045】図2は、この発明の一実施例に係る住所読
取システムにおいて、文字認識後の住所表記文字のう
ち、第1階層の住所表示(都道府県)を読み取る手順を
示す。まず、都道府県名から始まる文字列が図5の文字
認識部10に入力される(ステップST100)。する
と文字認識ユニット110のCPUは文字辞書30を参
照して入力された文字列の認識処理を行なう(ステップ
ST102)。文字辞書30の記憶容量は通常は800
文字程度でよいが、状況によりもっと大容量(たとえば
3000文字分)にしてもよい。
取システムにおいて、文字認識後の住所表記文字のう
ち、第1階層の住所表示(都道府県)を読み取る手順を
示す。まず、都道府県名から始まる文字列が図5の文字
認識部10に入力される(ステップST100)。する
と文字認識ユニット110のCPUは文字辞書30を参
照して入力された文字列の認識処理を行なう(ステップ
ST102)。文字辞書30の記憶容量は通常は800
文字程度でよいが、状況によりもっと大容量(たとえば
3000文字分)にしてもよい。
【0046】文字認識処理が済むと、ユニット110は
都道府県名から始まる文字列を出力する(ステップST
104)。ここで、文字認識が正しく行なわれたと仮定
すれば、ユニット110からは、たとえば「東」「京」
「都」「足」「立」「区」「西」「新」「井」「栄」
「町」・・・・・・を示す文字コードの集合が出力され
る。この文字認識が誤りを含んでいるときは、たとえば
「東」「東」「群」「足」「北」「区」・・・・・・と
いった文字コードの集合が出力される。
都道府県名から始まる文字列を出力する(ステップST
104)。ここで、文字認識が正しく行なわれたと仮定
すれば、ユニット110からは、たとえば「東」「京」
「都」「足」「立」「区」「西」「新」「井」「栄」
「町」・・・・・・を示す文字コードの集合が出力され
る。この文字認識が誤りを含んでいるときは、たとえば
「東」「東」「群」「足」「北」「区」・・・・・・と
いった文字コードの集合が出力される。
【0047】文字認識ユニット110から出力された文
字コードの集合は、住所表記の上位階層(都道府県名)
から順に下位階層(市/区/町名)に向かって並んでい
る。このような文字コードの集合(文字列)が、住所認
識ユニット20に渡される。
字コードの集合は、住所表記の上位階層(都道府県名)
から順に下位階層(市/区/町名)に向かって並んでい
る。このような文字コードの集合(文字列)が、住所認
識ユニット20に渡される。
【0048】住所認識ユニット20では、まず都道府県
名の読み取りから初めるために、読取対象を「都道府
県」にセットする(ステップST106)。すると住所
認識ユニット20のCPUは、都道府県名にだけ用いら
れる文字で構成される都道府県文字テーブルを基本文字
候補30から抽出する(ステップST108)。都道府
県文字テーブルの記憶容量は、100文字分あれば足り
る。
名の読み取りから初めるために、読取対象を「都道府
県」にセットする(ステップST106)。すると住所
認識ユニット20のCPUは、都道府県名にだけ用いら
れる文字で構成される都道府県文字テーブルを基本文字
候補30から抽出する(ステップST108)。都道府
県文字テーブルの記憶容量は、100文字分あれば足り
る。
【0049】ユニット20のCPUは、文字認識後の文
字列の頭から3文字(たとえば「東」「東」「群」)を
取り出し、各文字について、都道府県文字テーブルか
ら、類似度の高い順に10文字を抽出する(ステップS
T110)。すなわち、合計30文字が都道府県名の読
み取りのための候補として挙げられる。
字列の頭から3文字(たとえば「東」「東」「群」)を
取り出し、各文字について、都道府県文字テーブルか
ら、類似度の高い順に10文字を抽出する(ステップS
T110)。すなわち、合計30文字が都道府県名の読
み取りのための候補として挙げられる。
【0050】なお、都道府県名のうち神奈川県、和歌山
県、鹿児島県は4文字であるが、これらの県名はその最
初の3文字(神奈川、和歌山、鹿児島)で識別できる。
一方、文字認識後の文字列の頭から2文字しか読まない
と、仮に都道府県名が平仮名で記載されていた場合(た
とえば「やまがた県」「やまなし県」「やまぐち
県」)、都道府県名の識別が不能になる。3文字読め
ば、平仮名記載が含まれていても、都道府県名の識別は
可能になる。
県、鹿児島県は4文字であるが、これらの県名はその最
初の3文字(神奈川、和歌山、鹿児島)で識別できる。
一方、文字認識後の文字列の頭から2文字しか読まない
と、仮に都道府県名が平仮名で記載されていた場合(た
とえば「やまがた県」「やまなし県」「やまぐち
県」)、都道府県名の識別が不能になる。3文字読め
ば、平仮名記載が含まれていても、都道府県名の識別は
可能になる。
【0051】次にユニット20のCPUは、抽出された
3組10種の各文字組グループそれぞれから1文字づつ
取り出して3文字の組合せ単語を順次作りこれらの3文
字単語と住所辞書50(知識データベース含む)に登録
された住所表記名とを逐次一対比較する(ステップST
112)。
3組10種の各文字組グループそれぞれから1文字づつ
取り出して3文字の組合せ単語を順次作りこれらの3文
字単語と住所辞書50(知識データベース含む)に登録
された住所表記名とを逐次一対比較する(ステップST
112)。
【0052】この一対比較の結果、一致単語(文字列
「東京都」に対する登録語「東京都」)が見つかれば、
あるいは知識データベースを利用して対応単語(文字列
「東東群」に対する登録語「東京都」)が見つかれば、
次の処理に移る(ステップST114、イエス)。一致
単語あるいは対応単語が見つからなければ、読取不能と
してその処理を終了し(ステップST114、ノー)別
の郵便物の住所読取処理に移る。
「東京都」に対する登録語「東京都」)が見つかれば、
あるいは知識データベースを利用して対応単語(文字列
「東東群」に対する登録語「東京都」)が見つかれば、
次の処理に移る(ステップST114、イエス)。一致
単語あるいは対応単語が見つからなければ、読取不能と
してその処理を終了し(ステップST114、ノー)別
の郵便物の住所読取処理に移る。
【0053】上記一対比較で一致単語(文字列「東京
都」に対する登録語「東京都」)が見つかると、現在の
住所階層が最終階層であるかどうかチェックされる(ス
テップST116)。もし最終階層であれば(ステップ
ST116、イエス)、ユニット20のCPUは、読み
取られた住所表記の文字コードに街区表示(丁目/番/
号など)の数字コードを付け、そこから対応する住所区
分コードを求めて、住所読取判別結果を出力する(ステ
ップST118)。
都」に対する登録語「東京都」)が見つかると、現在の
住所階層が最終階層であるかどうかチェックされる(ス
テップST116)。もし最終階層であれば(ステップ
ST116、イエス)、ユニット20のCPUは、読み
取られた住所表記の文字コードに街区表示(丁目/番/
号など)の数字コードを付け、そこから対応する住所区
分コードを求めて、住所読取判別結果を出力する(ステ
ップST118)。
【0054】しかし、この時点(ステップST106〜
ステップST114)では都道府県を読み取っていたの
であるから最終階層ではない(ステップST116、ノ
ー)。
ステップST114)では都道府県を読み取っていたの
であるから最終階層ではない(ステップST116、ノ
ー)。
【0055】図3は、図2の手順の続きであって、文字
認識後の住所表記文字のうち、第2階層の住所表示(区
/市など)を読み取る手順を示す。住所認識ユニット2
0は、ステップST112での比較結果に基づいて、次
に都下の区/市/郡/島の読み取りから初めるために、
読取対象を「東京都」にセットする(ステップST12
0)。すると住所認識ユニット20のCPUは、東京都
下の地名にだけ用いられる文字で構成される東京都文字
テーブルを基本文字候補30から抽出する(ステップS
T122)。東京都文字テーブルの記憶容量は、100
文字分で足りる。
認識後の住所表記文字のうち、第2階層の住所表示(区
/市など)を読み取る手順を示す。住所認識ユニット2
0は、ステップST112での比較結果に基づいて、次
に都下の区/市/郡/島の読み取りから初めるために、
読取対象を「東京都」にセットする(ステップST12
0)。すると住所認識ユニット20のCPUは、東京都
下の地名にだけ用いられる文字で構成される東京都文字
テーブルを基本文字候補30から抽出する(ステップS
T122)。東京都文字テーブルの記憶容量は、100
文字分で足りる。
【0056】ユニット20のCPUは、文字認識後の文
字列の4字目以降の5文字(たとえば「足」「北」
「区」「西」「新」)を取り出し、各文字について、東
京都文字テーブルから、類似度の高い順に10文字を抽
出する(ステップST124)。すなわち、合計50文
字が都下の区/市/郡/島の地名の読取候補として挙げ
られる。
字列の4字目以降の5文字(たとえば「足」「北」
「区」「西」「新」)を取り出し、各文字について、東
京都文字テーブルから、類似度の高い順に10文字を抽
出する(ステップST124)。すなわち、合計50文
字が都下の区/市/郡/島の地名の読取候補として挙げ
られる。
【0057】なお、都下の地名のうち最長文字は東久留
米市、武蔵村山市の5文字であり、最短文字は北区、港
区等の2文字であるが、これらの地名の大部分は3文字
(足立区、府中市など)で構成されている。平仮名表記
をふくめて5文字あれば都下の長い地名(「ひがしくる
め市」「ひがしむらやま市」「ひがしやまと市」など)
の区別を付けることができる。
米市、武蔵村山市の5文字であり、最短文字は北区、港
区等の2文字であるが、これらの地名の大部分は3文字
(足立区、府中市など)で構成されている。平仮名表記
をふくめて5文字あれば都下の長い地名(「ひがしくる
め市」「ひがしむらやま市」「ひがしやまと市」など)
の区別を付けることができる。
【0058】次にユニット20のCPUは、抽出された
5組10種の各文字組グループそれぞれから1文字づつ
取り出して2文字ないし5文字の組合せ単語を順次作り
これらの2〜5文字単語と住所辞書50(知識データベ
ース含む)に登録された住所表記名とを逐次一対比較す
る(ステップST126)。
5組10種の各文字組グループそれぞれから1文字づつ
取り出して2文字ないし5文字の組合せ単語を順次作り
これらの2〜5文字単語と住所辞書50(知識データベ
ース含む)に登録された住所表記名とを逐次一対比較す
る(ステップST126)。
【0059】この一対比較の結果、一致単語(文字列
「足立区」に対する登録語「足立区」)が見つかれば、
あるいは知識データベースを利用して対応単語(文字列
「足北区」に対する登録語「足立区」)が見つかれば、
次の処理に移る(ステップST128、イエス)。一致
単語あるいは対応単語が見つからなければ、読取不能と
してその処理を終了し(ステップST128、ノー)別
の郵便物の住所読取処理に移る。
「足立区」に対する登録語「足立区」)が見つかれば、
あるいは知識データベースを利用して対応単語(文字列
「足北区」に対する登録語「足立区」)が見つかれば、
次の処理に移る(ステップST128、イエス)。一致
単語あるいは対応単語が見つからなければ、読取不能と
してその処理を終了し(ステップST128、ノー)別
の郵便物の住所読取処理に移る。
【0060】上記一対比較で一致単語(文字列「足立
区」に対する登録語「足立区」)が見つかると、現在の
住所階層が最終階層であるかどうかチェックされる(ス
テップST130)。もし最終階層であれば(ステップ
ST130、イエス)、ユニット20のCPUは、読み
取られた住所表記の文字コードに街区表示(丁目/番/
号など)の数字コードを付け、そこから対応する住所区
分コードを求めて、住所読取判別結果を出力する(ステ
ップST132)。
区」に対する登録語「足立区」)が見つかると、現在の
住所階層が最終階層であるかどうかチェックされる(ス
テップST130)。もし最終階層であれば(ステップ
ST130、イエス)、ユニット20のCPUは、読み
取られた住所表記の文字コードに街区表示(丁目/番/
号など)の数字コードを付け、そこから対応する住所区
分コードを求めて、住所読取判別結果を出力する(ステ
ップST132)。
【0061】しかし、この時点(ステップST120〜
ステップST128)では都下の区/市などの地名(住
所表記の上位〜中位階層)を読み取っており、最終階層
ではない(ステップST130、ノー)。
ステップST128)では都下の区/市などの地名(住
所表記の上位〜中位階層)を読み取っており、最終階層
ではない(ステップST130、ノー)。
【0062】図4は、図3の手順の続きであって、文字
認識後の住所表記文字のうち、第3階層の住所表示(町
/村その他の地名)を読み取る手順を示す。住所認識ユ
ニット20は、ステップST126での比較結果に基づ
いて、次に足立区内の地名の読み取りから初めるため
に、読取対象を「足立区」にセットする(ステップST
134)。すると住所認識ユニット20のCPUは、足
立区内の地名にだけ用いられる文字で構成される足立区
文字テーブルを基本文字候補30から抽出する(ステッ
プST136)。足立区文字テーブルの記憶容量も10
0文字分でよい。
認識後の住所表記文字のうち、第3階層の住所表示(町
/村その他の地名)を読み取る手順を示す。住所認識ユ
ニット20は、ステップST126での比較結果に基づ
いて、次に足立区内の地名の読み取りから初めるため
に、読取対象を「足立区」にセットする(ステップST
134)。すると住所認識ユニット20のCPUは、足
立区内の地名にだけ用いられる文字で構成される足立区
文字テーブルを基本文字候補30から抽出する(ステッ
プST136)。足立区文字テーブルの記憶容量も10
0文字分でよい。
【0063】ユニット20のCPUは、文字認識後の文
字列の7字目以降の7文字(たとえば「西」「新」
「井」「栄」「町」「1」「丁」)を取り出し、各文字
について、東京都文字テーブルから、類似度の高い順に
10文字を抽出する(ステップST138)。すなわ
ち、合計70文字が足立区内の地名の読取候補として挙
げられる。
字列の7字目以降の7文字(たとえば「西」「新」
「井」「栄」「町」「1」「丁」)を取り出し、各文字
について、東京都文字テーブルから、類似度の高い順に
10文字を抽出する(ステップST138)。すなわ
ち、合計70文字が足立区内の地名の読取候補として挙
げられる。
【0064】なお、都下の地名のうち最長文字は西新井
栄町等の5文字であり、最短文字は青井等の2文字であ
る。平仮名表記をふくめて7文字あれば足立区内の長い
地名(「にしあらいさかえ町」「にしあらいほん町」な
ど)の区別を付けることができる。
栄町等の5文字であり、最短文字は青井等の2文字であ
る。平仮名表記をふくめて7文字あれば足立区内の長い
地名(「にしあらいさかえ町」「にしあらいほん町」な
ど)の区別を付けることができる。
【0065】次にユニット20のCPUは、抽出された
7組10種の各文字組グループそれぞれから1文字づつ
取り出して2文字ないし7文字の組合せ単語を順次作り
これらの2〜7文字単語と住所辞書50(知識データベ
ース含む)に登録された住所表記名とを逐次一対比較す
る(ステップST140)。
7組10種の各文字組グループそれぞれから1文字づつ
取り出して2文字ないし7文字の組合せ単語を順次作り
これらの2〜7文字単語と住所辞書50(知識データベ
ース含む)に登録された住所表記名とを逐次一対比較す
る(ステップST140)。
【0066】この一対比較の結果、一致単語(文字列
「西新井栄町」に対する登録語「西新井栄町」)が見つ
かれば、あるいは知識データベースを利用して対応単語
(たとえば文字列「酉新丼栄田」に対する登録語「西新
井栄町」)が見つかれば、次の処理に移る(ステップS
T142、イエス)。一致単語あるいは対応単語が見つ
からなければ、読取不能としてその処理を終了し(ステ
ップST142、ノー)別の郵便物の住所読取処理に移
る。
「西新井栄町」に対する登録語「西新井栄町」)が見つ
かれば、あるいは知識データベースを利用して対応単語
(たとえば文字列「酉新丼栄田」に対する登録語「西新
井栄町」)が見つかれば、次の処理に移る(ステップS
T142、イエス)。一致単語あるいは対応単語が見つ
からなければ、読取不能としてその処理を終了し(ステ
ップST142、ノー)別の郵便物の住所読取処理に移
る。
【0067】上記一対比較で一致単語(文字列「西新井
栄町」に対する登録語「西新井栄町」)が見つかると、
入力された文字列のうちまだ一対比較していない(つま
り読み取り判定していない)文字列があるかどうかチェ
ックされる(ステップST144)。もし未比較文字列
があれば(ステップST144、イエス)、ユニット2
0のCPUは、街区(丁目/番/号など数字を伴うも
の)以外の文字各々について足立区文字テーブルを参照
し、足立区内の地名として用いられている文字10候補
を、未比較文字列それぞれの文字に対して選択する(ス
テップST146)。そして各文字候補の全ての組合せ
単語と住所辞書50内の足立区地名とが一対比較される
(ステップST148)。
栄町」に対する登録語「西新井栄町」)が見つかると、
入力された文字列のうちまだ一対比較していない(つま
り読み取り判定していない)文字列があるかどうかチェ
ックされる(ステップST144)。もし未比較文字列
があれば(ステップST144、イエス)、ユニット2
0のCPUは、街区(丁目/番/号など数字を伴うも
の)以外の文字各々について足立区文字テーブルを参照
し、足立区内の地名として用いられている文字10候補
を、未比較文字列それぞれの文字に対して選択する(ス
テップST146)。そして各文字候補の全ての組合せ
単語と住所辞書50内の足立区地名とが一対比較される
(ステップST148)。
【0068】この一対比較の結果、一致単語あるいは対
応単語が見つからなければ、読取不能としてその処理を
終了し(ステップST142、ノー)、別の郵便物の住
所読取処理に移る。一致単語あるいは対応単語が見つか
り(ステップST142、イエス)、その後に未比較文
字列がないならば(ステップST144、ノー)、ユニ
ット20のCPUはその時点が住所表記の最終階層と判
断し、読み取られた住所表記(東京都足立区西新井栄
町)の文字コードに街区表示(丁目/番/号など)の数
字コードを付け、そこから対応する住所区分コードを求
めて、住所読取判別結果を出力する(ステップST15
0)。
応単語が見つからなければ、読取不能としてその処理を
終了し(ステップST142、ノー)、別の郵便物の住
所読取処理に移る。一致単語あるいは対応単語が見つか
り(ステップST142、イエス)、その後に未比較文
字列がないならば(ステップST144、ノー)、ユニ
ット20のCPUはその時点が住所表記の最終階層と判
断し、読み取られた住所表記(東京都足立区西新井栄
町)の文字コードに街区表示(丁目/番/号など)の数
字コードを付け、そこから対応する住所区分コードを求
めて、住所読取判別結果を出力する(ステップST15
0)。
【0069】
【発明の効果】この発明によれば、住所を上位階層から
順に認識して行く場合に、各階層に必要な文字種のみを
参照するため、不用な文字候補が出てくることはなく、
正解文字を含む最適な文字候補を選択することができる
から、住所読取正解率を向上させることができる。
順に認識して行く場合に、各階層に必要な文字種のみを
参照するため、不用な文字候補が出てくることはなく、
正解文字を含む最適な文字候補を選択することができる
から、住所読取正解率を向上させることができる。
【0070】また、全ての文字認識を終わらせてから住
所認識に移るので、連続して多数の住所読取を行なう場
合には、住所認識処理中(図1のステップST14〜ス
テップST30)に文字認識のハードウエア(10)は
次の住所表記の文字認識(図1のステップST10〜ス
テップST12)を開始することができる。すると、文
字認識と住所認識の並列処理が可能となるから、処理効
率が向上する。
所認識に移るので、連続して多数の住所読取を行なう場
合には、住所認識処理中(図1のステップST14〜ス
テップST30)に文字認識のハードウエア(10)は
次の住所表記の文字認識(図1のステップST10〜ス
テップST12)を開始することができる。すると、文
字認識と住所認識の並列処理が可能となるから、処理効
率が向上する。
【図1】図1は、この発明の一実施例に係る住所読取シ
ステムにおいて、文字認識後の住所表記文字からどのよ
うにして正しい住所が読み取られるのかの概要を説明す
る図。
ステムにおいて、文字認識後の住所表記文字からどのよ
うにして正しい住所が読み取られるのかの概要を説明す
る図。
【図2】図2は、この発明の一実施例に係る住所読取シ
ステムにおいて、文字認識後の住所表記文字のうち、第
1階層の住所表示(都道府県)を読み取る手順を説明す
るフローチャート。
ステムにおいて、文字認識後の住所表記文字のうち、第
1階層の住所表示(都道府県)を読み取る手順を説明す
るフローチャート。
【図3】図3は、図2の手順の続きであって、文字認識
後の住所表記文字のうち、第2階層の住所表示(区/市
など)を読み取る手順を説明するフローチャート。
後の住所表記文字のうち、第2階層の住所表示(区/市
など)を読み取る手順を説明するフローチャート。
【図4】図4は、図3の手順の続きであって、文字認識
後の住所表記文字のうち、第3階層の住所表示(町/村
その他の地名)を読み取る手順を説明するフローチャー
ト。
後の住所表記文字のうち、第3階層の住所表示(町/村
その他の地名)を読み取る手順を説明するフローチャー
ト。
【図5】図5は、この発明の一実施例に係る住所読取シ
ステムに適用されるハードウエア構成の概要を説明する
図。
ステムに適用されるハードウエア構成の概要を説明する
図。
【図6】図6は、住所表記文字がどのようにして認識さ
れるのかの具体例を説明する図。
れるのかの具体例を説明する図。
10…文字認識部、102…光電変換ユニット、104
…領域検出ユニット、106…行検出ユニット、108
…文字検出ユニット、110…文字認識ユニット(CP
U)、20…住所認識ユニット(CPU)、30…文字
辞書(基本文字候補)、40…文字種テーブル(都道府
県名文字テーブル/地域名文字テーブル)、50…住所
辞書。
…領域検出ユニット、106…行検出ユニット、108
…文字検出ユニット、110…文字認識ユニット(CP
U)、20…住所認識ユニット(CPU)、30…文字
辞書(基本文字候補)、40…文字種テーブル(都道府
県名文字テーブル/地域名文字テーブル)、50…住所
辞書。
Claims (5)
- 【請求項1】 正しい住所表記のデータを格納している
住所辞書と、 1以上の住所表記階層からなる住所表示に用いられる1
以上の住所表記語を構成する文字各々を認識して、文字
認識結果を出力する文字認識手段と、 前記1以上の住所表記語各々の認識に必要な最小限の文
字種を含んで構成される1以上の文字種テーブルと、 前記文字認識手段で認識された文字認識結果のうち、こ
れから認識しようとする住所階層の判定に必要な所定数
の文字種を前記文字種テーブルから抽出し、抽出された
文字各々の組合せで前記住所辞書を引いて、該当する住
所表記語を検出する住所認識手段とを備えたことを特徴
とする住所読取システム。 - 【請求項2】 前記文字種テーブルが、前記住所認識手
段で検出された住所表記語で特定される地域の認識に必
要な文字種だけで構成される第2の文字種テーブルを含
み、 前記住所認識手段が、前記第2の文字種テーブルから抽
出される文字各々の組合せで前記住所辞書を引いて、該
当する住所表記語を検出するように構成されることを特
徴とする請求項1に記載の住所読取システム。 - 【請求項3】 正しい住所表記のデータを格納している
住所辞書と、 少なくとも第1および第2の住所表記階層を含む住所表
示に用いられる複数の住所表記語を構成する文字各々を
認識して、文字認識結果を出力する文字認識手段と、 前記第1の住所表記階層の住所表記語の認識に必要な最
小限の文字種を含んで構成される第1の文字種テーブル
と、 前記文字認識手段で認識された文字認識結果のうち、前
記第1の住所表記階層の判定に必要な所定数の文字種を
前記第1の文字種テーブルから抽出し、抽出された文字
各々の組合せで前記住所辞書を引いて、該当する第1の
住所表記語を検出する第1の住所認識手段と、 前記第1の住所認識手段により検出された前記第1の住
所表記語で特定される地域の認識に必要な最小限の文字
種を含んで構成される第2の文字種テーブルと、 前記文字認識手段で認識された文字認識結果のうち、前
記第2の住所表記階層の判定に必要な所定数の文字種を
前記第2の文字種テーブルから抽出し、抽出された文字
各々の組合せで前記住所辞書を引いて、該当する第2の
住所表記語を検出する第2の住所認識手段と、 前記第1および第2の住所認識手段により検出された前
記第1および第2の住所表記語から、対応する住所コー
ドを出力する手段とを備えたことを特徴とする住所読取
システム。 - 【請求項4】 複数の文字パターンからそれらに対応す
る文字を認識して住所表記文字列を出力する文字認識手
段と、 正しい住所表記のデータを格納している住所辞書と、 都道府県の名称に用いられる文字で構成される都道府県
文字テーブルと、 前記都道府県文字テーブルおよび前記住所辞書を参照し
て、前記文字認識手段で認識された前記住所表記文字列
の最初の数文字の組合せに対応する都道府県名を検出す
る都道府県名検出手段と、 前記都道府県名検出手段で検出された都道府県名の地域
内の場所を表す地域名に用いられる文字で構成される地
域名文字テーブルと、 前記地域名文字テーブルおよび前記住所辞書を参照し
て、前記文字認識手段で認識された前記住所表記文字列
のうち都道府県名の次に現われる数文字の組合せに対応
する地域名を検出する地域名検出手段と、 前記都道府県名検出手段で検出された都道府県名および
前記地域名検出手段で検出された地域名から、対応する
住所コードを出力する手段とを備えたことを特徴とする
住所読取装置。 - 【請求項5】 複数の文字パターンからそれらに対応す
る文字を認識して住所表記文字列を出力し、 都道府県の名称に用いられる文字で構成される都道府県
文字テーブルおよび正しい住所表記データを格納してい
る住所辞書を参照して、前記出力された住所表記文字列
の最初の数文字の組合せに対応する都道府県名を検出
し、 前記検出された都道府県名の地域内の場所を表す地域名
に用いられる文字で構成される地域名文字テーブルおよ
び前記住所辞書を参照して、前記出力された住所表記文
字列のうち都道府県名の次に現われる数文字の組合せに
対応する地域名を検出し、 前記検出された都道府県名および前記検出された地域名
から、対応する住所コードを出力することを特徴とする
住所読取方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5236154A JPH0793467A (ja) | 1993-09-22 | 1993-09-22 | 住所読取システム |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP5236154A JPH0793467A (ja) | 1993-09-22 | 1993-09-22 | 住所読取システム |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH0793467A true JPH0793467A (ja) | 1995-04-07 |
Family
ID=16996569
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP5236154A Pending JPH0793467A (ja) | 1993-09-22 | 1993-09-22 | 住所読取システム |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH0793467A (ja) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0841630A3 (en) * | 1996-05-21 | 1999-09-01 | Hitachi, Ltd. | Apparatus for recognizing input character strings by inference |
| JP2020187622A (ja) * | 2019-05-16 | 2020-11-19 | 株式会社Pfu | 情報処理装置、制御方法及び制御プログラム |
-
1993
- 1993-09-22 JP JP5236154A patent/JPH0793467A/ja active Pending
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0841630A3 (en) * | 1996-05-21 | 1999-09-01 | Hitachi, Ltd. | Apparatus for recognizing input character strings by inference |
| US6751605B2 (en) | 1996-05-21 | 2004-06-15 | Hitachi, Ltd. | Apparatus for recognizing input character strings by inference |
| JP2020187622A (ja) * | 2019-05-16 | 2020-11-19 | 株式会社Pfu | 情報処理装置、制御方法及び制御プログラム |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR100401685B1 (ko) | 소재정보의 인식장치, 소재정보의 인식방법 및 기록매체 | |
| US6327373B1 (en) | Mail address reading apparatus and mail sorting apparatus | |
| KR100324847B1 (ko) | 수신인명 리드장치와 우편물등 구분기 및 문자열 인식방법 | |
| US4524453A (en) | Postal code distinguishing apparatus | |
| JP3485020B2 (ja) | 文字認識方法及び装置ならびに記憶媒体 | |
| JPH07509576A (ja) | 文字の認識方法 | |
| JP3232991B2 (ja) | 文字読取り方法及び住所読取り方法 | |
| JPH06124366A (ja) | 住所読取装置 | |
| Mao et al. | A system for cursive handwritten address recognition | |
| JPH08243505A (ja) | 住所読取装置及び方法 | |
| JP3162552B2 (ja) | 郵便物あて名認識装置及びあて名認識方法 | |
| JPH07271899A (ja) | 文字認識装置 | |
| JP2780654B2 (ja) | 住所読み取り装置 | |
| JP2910630B2 (ja) | 住所認識方法,住所認識装置および紙葉類自動処理システム | |
| JPH07271920A (ja) | 文字認識装置 | |
| JP3088036B2 (ja) | 宛名読取区分機 | |
| JP2991594B2 (ja) | 郵便物の宛名読取装置 | |
| JPH11138108A (ja) | 郵便物読取区分装置 | |
| JP3151866B2 (ja) | 英文字認識方法 | |
| JPH10174935A (ja) | 宛名読取装置および文字情報読取装置 | |
| JPH10432A (ja) | 郵便物の住所読取方法及び郵便物の住所読取装置 | |
| JPH05324899A (ja) | 郵便物記載住所認識装置 | |
| JPS63303481A (ja) | 住所読取装置 | |
| JPH05217015A (ja) | 郵便物の宛名読取装置 | |
| JPH08249427A (ja) | 文字認識方法および装置 |