JPH0514952B2 - - Google Patents
Info
- Publication number
- JPH0514952B2 JPH0514952B2 JP58070911A JP7091183A JPH0514952B2 JP H0514952 B2 JPH0514952 B2 JP H0514952B2 JP 58070911 A JP58070911 A JP 58070911A JP 7091183 A JP7091183 A JP 7091183A JP H0514952 B2 JPH0514952 B2 JP H0514952B2
- Authority
- JP
- Japan
- Prior art keywords
- character
- characters
- character string
- image data
- cutting device
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Landscapes
- Character Discrimination (AREA)
- Character Input (AREA)
Description
【発明の詳細な説明】
(発明の属する分野)
本発明は文書上の文字を直接機械で読み取る
OCR(Optical Dharacter Recognition)装置に
おいて、ほぼ一定のピツチで並んだ文字の他に、
通常の文字の粉程度のピツチしか持たない英数
字、記号等が連続して含まれている文字列からも
個々の文字、記号等を効率良く切出すことの出来
る文字切出し装置に関するものである。
OCR(Optical Dharacter Recognition)装置に
おいて、ほぼ一定のピツチで並んだ文字の他に、
通常の文字の粉程度のピツチしか持たない英数
字、記号等が連続して含まれている文字列からも
個々の文字、記号等を効率良く切出すことの出来
る文字切出し装置に関するものである。
(従来の技術)
従来の方法では、文字列中に通常文字ピツチの
半分程度のピツチを持つ英数字、記号等が連続し
て出現した場合、これらの英数字、記号を幾つか
まとめて一つの文字として切出してしまうため、
切出し処理が正常に行なわれないという欠点があ
つた。また、文字認識装置からの情報を用い、リ
ジエクトとなつた文字の切出し処理を改めて行う
手法も考えらえているが、その手法では全ての文
字に対して認識処理を行なうため、認識用辞書の
容量が大きくなつたり、或いは、文字切出し装置
としてシステム全体が大きなものとなるという欠
点があつた。
半分程度のピツチを持つ英数字、記号等が連続し
て出現した場合、これらの英数字、記号を幾つか
まとめて一つの文字として切出してしまうため、
切出し処理が正常に行なわれないという欠点があ
つた。また、文字認識装置からの情報を用い、リ
ジエクトとなつた文字の切出し処理を改めて行う
手法も考えらえているが、その手法では全ての文
字に対して認識処理を行なうため、認識用辞書の
容量が大きくなつたり、或いは、文字切出し装置
としてシステム全体が大きなものとなるという欠
点があつた。
(発明の目的)
本発明はこれらの欠点を解決するために英数
字、記号等、通常の文字とは異なるピツチを持つ
もの又は異なるピツチを持つものと分離文字との
みの認識用辞書を用意し、一度文字として切出さ
れた図形の中で、その図形が複数個の部分図形に
分離出来るもののみを抽出して個々の部分図形に
認識処理を加え、リジエクトされるか否かを判定
し、その結果によつて文字として切出した図形が
複数個の英数字、記号等に分離出来るか否かを判
定するようにしたものである。
字、記号等、通常の文字とは異なるピツチを持つ
もの又は異なるピツチを持つものと分離文字との
みの認識用辞書を用意し、一度文字として切出さ
れた図形の中で、その図形が複数個の部分図形に
分離出来るもののみを抽出して個々の部分図形に
認識処理を加え、リジエクトされるか否かを判定
し、その結果によつて文字として切出した図形が
複数個の英数字、記号等に分離出来るか否かを判
定するようにしたものである。
(発明の構成および作用)
第1図は本発明の一実施例の構成を示すブロツ
ク図であり、1は文書画像から抽出された文字列
の画像データを信号線aを用いて読み込み記憶し
ておく文字列画像データ記憶装置、2は信号線b
を用いて入力された推定ピツチをもとに文字列画
像データ記憶装置1に記憶された文字列の画像デ
ータを信号線cを用いて読み込み、文字の1次切
出しを行なう文字1次切出し装置、3は文字1次
切出し装置2から信号線dを用いて入力された文
字1次切出し結果をもとに、文字列画像データ記
憶装置1に記憶された文字列の画像データを信号
線cを用いて読み込み、識別処理用辞書4から信
号線fを通じて読込んだ標準文字パターンを用い
て必要な文字認識処理を行ない、文字の1次切出
し結果に修正を加える文字2次切出し装置であ
り、その文字2次切出し結果は信号線gを用いて
出力する。以下、それぞれの装置について説明す
る。
ク図であり、1は文書画像から抽出された文字列
の画像データを信号線aを用いて読み込み記憶し
ておく文字列画像データ記憶装置、2は信号線b
を用いて入力された推定ピツチをもとに文字列画
像データ記憶装置1に記憶された文字列の画像デ
ータを信号線cを用いて読み込み、文字の1次切
出しを行なう文字1次切出し装置、3は文字1次
切出し装置2から信号線dを用いて入力された文
字1次切出し結果をもとに、文字列画像データ記
憶装置1に記憶された文字列の画像データを信号
線cを用いて読み込み、識別処理用辞書4から信
号線fを通じて読込んだ標準文字パターンを用い
て必要な文字認識処理を行ない、文字の1次切出
し結果に修正を加える文字2次切出し装置であ
り、その文字2次切出し結果は信号線gを用いて
出力する。以下、それぞれの装置について説明す
る。
文字列画像データ記憶装置1は通常のOCR、
或いは、別途出願中の特願昭55−126845「2次元
文字領域抽出装置」等によつて抽出された1文字
列分の画像データを記憶する画像メモリである。
文字1次切出し装置2は外部から入力された推定
文字ピツチをもとに個々の文字を切出す装置で、
例えば別途出願中の特願昭56−74015「文字切出し
装置」によつて実現可能である。ここで、推定文
字ピツチは数値を直接入力してもよいし、また、
例えば漢字は縦と横の比がほぼ1であるという性
質を利用して文字列を列方向に投影し、文字列の
幅を求めることによつても容易に推定出来る。
或いは、別途出願中の特願昭55−126845「2次元
文字領域抽出装置」等によつて抽出された1文字
列分の画像データを記憶する画像メモリである。
文字1次切出し装置2は外部から入力された推定
文字ピツチをもとに個々の文字を切出す装置で、
例えば別途出願中の特願昭56−74015「文字切出し
装置」によつて実現可能である。ここで、推定文
字ピツチは数値を直接入力してもよいし、また、
例えば漢字は縦と横の比がほぼ1であるという性
質を利用して文字列を列方向に投影し、文字列の
幅を求めることによつても容易に推定出来る。
第2図は文字列画像配列と文字1次及び2次切
出し装置により抽出された結果の説明図であり、
1は文字列画像配列、2及び3は文字1次切出し
装置2及び文字2次切出し装置3の抽出結果の一
例を示す。
出し装置により抽出された結果の説明図であり、
1は文字列画像配列、2及び3は文字1次切出し
装置2及び文字2次切出し装置3の抽出結果の一
例を示す。
第2図2では第2図1の数字“34”と“)。”が
一文字として抽出されている。本来これらの文字
は2つに分離して切出されるべきものであるが、
個々の数字、記号が通常文字の半分程度しかな
く、しかも連続して存在しているために2つの数
字、記号を纒めて切出してしまつたものであり、
従来のOCRでは対応が困難なものである。逆に
“門”という文字は予め求めてある文字推定ピツ
チを用いて切出しを行うことによつて正確に切出
されている。
一文字として抽出されている。本来これらの文字
は2つに分離して切出されるべきものであるが、
個々の数字、記号が通常文字の半分程度しかな
く、しかも連続して存在しているために2つの数
字、記号を纒めて切出してしまつたものであり、
従来のOCRでは対応が困難なものである。逆に
“門”という文字は予め求めてある文字推定ピツ
チを用いて切出しを行うことによつて正確に切出
されている。
文字2次切出し装置3は文字1次切出し装置2
の内容を読み込んで文字として切出した図形が複
数個の部分図形に分離出来るものを抽出し、文字
として切出した個々の部分図形、又は全体図形及
び個々の部分図形について認識処理を行ない、文
字として切出した図形がそのまま単一の文字なの
か、或いは複数個の図形に分解出来るかを判断す
る装置である。文字が分離しているか否かの判断
は、例えば、文字列の上下方向(横書きの場合)、
又は左右方向(縦書きの場合)の投影を行ない、
文字1次切出し装置2で文字として抽出された図
形の中央部に黒画素が存在しない部分が有るか否
かを調べればよい。
の内容を読み込んで文字として切出した図形が複
数個の部分図形に分離出来るものを抽出し、文字
として切出した個々の部分図形、又は全体図形及
び個々の部分図形について認識処理を行ない、文
字として切出した図形がそのまま単一の文字なの
か、或いは複数個の図形に分解出来るかを判断す
る装置である。文字が分離しているか否かの判断
は、例えば、文字列の上下方向(横書きの場合)、
又は左右方向(縦書きの場合)の投影を行ない、
文字1次切出し装置2で文字として抽出された図
形の中央部に黒画素が存在しない部分が有るか否
かを調べればよい。
第2図3は文字2次切出し装置2によつて切出
された結果を示したもので、“〓”“〓”は識別の
結果リジエクトとなり、文字1次切出し装置2の
切出し結果の“門”がそのまま採用されている。
また“3”,“4”,“)”,“。”は数字、記号とし
て
認識され、文字1字切出し装置2の結果が修正さ
れて別々のものとして切出される。
された結果を示したもので、“〓”“〓”は識別の
結果リジエクトとなり、文字1次切出し装置2の
切出し結果の“門”がそのまま採用されている。
また“3”,“4”,“)”,“。”は数字、記号とし
て
認識され、文字1字切出し装置2の結果が修正さ
れて別々のものとして切出される。
認識処理用辞書4は文字2次切出し装置3の認
識処理時に用いられる文字の標準パターンを登録
しておくもので、英数字、記号等通常の文字とは
ピツチが異なるもののみの標準パターンが登録さ
れており、このため辞書容量を極めて小さくする
ことが出来る。また、“門”等の分離文字の標準
パターンを登録しておくことにより、個々の部分
図形だけでなく、分離文字全体の図形についても
認識処理を行なうことにより精度を向上すること
も可能である。この場合、“門”、“兆”等、文字
を構成している図形が完全に分離している文字は
少なく、この場合でも文字全体の標準パターンを
持つよりは、はるかに少ない辞書容量ですむ。ま
た認識処理用辞書4に登録されている標準パター
ンは予めROM等に書き込んでおいてもよいし、
また切出しの過程で人間との会話処理により標準
パターンを学習させていつても良い。
識処理時に用いられる文字の標準パターンを登録
しておくもので、英数字、記号等通常の文字とは
ピツチが異なるもののみの標準パターンが登録さ
れており、このため辞書容量を極めて小さくする
ことが出来る。また、“門”等の分離文字の標準
パターンを登録しておくことにより、個々の部分
図形だけでなく、分離文字全体の図形についても
認識処理を行なうことにより精度を向上すること
も可能である。この場合、“門”、“兆”等、文字
を構成している図形が完全に分離している文字は
少なく、この場合でも文字全体の標準パターンを
持つよりは、はるかに少ない辞書容量ですむ。ま
た認識処理用辞書4に登録されている標準パター
ンは予めROM等に書き込んでおいてもよいし、
また切出しの過程で人間との会話処理により標準
パターンを学習させていつても良い。
(効果)
以上説明したように本装置では文字列中から文
字として切出したものの中で図形が分離している
もののみを抽出し、分離した個々の部分図形又は
個々の部分図形及び図形全体の認識処理を行なう
ことにより、ほぼ定ピツチで並んでいる通常文字
の他に通常文字の半分程度のピツチしかない英数
字等が連続して存在している文字列からも個々の
文字を効率的に切出すことが出来、また認識処理
上必要な辞書も極めて小さなものですむという利
点がある。また本装置で用いた手法は一度切出し
た結果を修正する場合だけでなく、文字列の端か
ら文字を切出して行く途中の過程においても充分
応用可能であることは明らかである。
字として切出したものの中で図形が分離している
もののみを抽出し、分離した個々の部分図形又は
個々の部分図形及び図形全体の認識処理を行なう
ことにより、ほぼ定ピツチで並んでいる通常文字
の他に通常文字の半分程度のピツチしかない英数
字等が連続して存在している文字列からも個々の
文字を効率的に切出すことが出来、また認識処理
上必要な辞書も極めて小さなものですむという利
点がある。また本装置で用いた手法は一度切出し
た結果を修正する場合だけでなく、文字列の端か
ら文字を切出して行く途中の過程においても充分
応用可能であることは明らかである。
第1図は本発明の一実施例の構成を示すブロツ
ク図、第2図は文字列画像配列と、文字1次及び
2次切出し装置により抽出された結果の説明図で
ある。 1……文字列画像データ記憶装置、2……文字
1次切出し装置、3……文字2次切出し装置、4
……認識処理用辞書、a……文字列画像データを
転送するための信号線、b……文字1次切出しに
必要な文字推定ピツチを入力する信号線、c……
文字1次切出し装置が文字列画像データを読み込
むための信号線、d……文字1次切出し結果を出
力するための信号線、e……文字2次切出し装置
が文字列画像データを読み込むための信号線、f
……文字2次切出し装置が認識処理用辞書を読み
込むための信号線、g……出力信号線。
ク図、第2図は文字列画像配列と、文字1次及び
2次切出し装置により抽出された結果の説明図で
ある。 1……文字列画像データ記憶装置、2……文字
1次切出し装置、3……文字2次切出し装置、4
……認識処理用辞書、a……文字列画像データを
転送するための信号線、b……文字1次切出しに
必要な文字推定ピツチを入力する信号線、c……
文字1次切出し装置が文字列画像データを読み込
むための信号線、d……文字1次切出し結果を出
力するための信号線、e……文字2次切出し装置
が文字列画像データを読み込むための信号線、f
……文字2次切出し装置が認識処理用辞書を読み
込むための信号線、g……出力信号線。
Claims (1)
- 1 文書画像中の文字列部分の画像データを入力
し、その文字列の画像を記憶しておく文字列画像
データ記憶装置と、その文字列画像データ記憶装
置に格納された文字列画像データを用いて外部か
ら入力された推定文字ピツチによつて文字切出し
を行なう文字1次切出し装置と、その文字1次切
出し装置によつて文字として切出された図形の中
で図形が分離していて2個またはそれ以上の部分
図形に分解出来るもののみを抽出し、各部分図形
又は各部分図形と図形全体の認識処理を行ない、
前記文字1次切出し装置により切出された図形を
単一の文字として切出すか或いは複数個の文字と
して切出すかを判別する文字2次切出し装置と、
文字2次切出し装置の認識処理時に用いられる文
字の標準パターンを登録しておく認識処理用辞書
とを備え、ほぼ定ピツチで並んでいる通常文字の
他に通常文字の半分程度のピツチを有する英数
字、記号等が連続して存在している文字列から
個々の文字を切出すようにしたことを特徴とする
文字切出し装置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP58070911A JPS59197971A (ja) | 1983-04-23 | 1983-04-23 | 文字切出し装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP58070911A JPS59197971A (ja) | 1983-04-23 | 1983-04-23 | 文字切出し装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS59197971A JPS59197971A (ja) | 1984-11-09 |
| JPH0514952B2 true JPH0514952B2 (ja) | 1993-02-26 |
Family
ID=13445165
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP58070911A Granted JPS59197971A (ja) | 1983-04-23 | 1983-04-23 | 文字切出し装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPS59197971A (ja) |
Families Citing this family (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPS61220081A (ja) * | 1985-03-27 | 1986-09-30 | Hitachi Ltd | パタ−ン切り出し及び認識方式 |
| JPH07107700B2 (ja) * | 1987-04-28 | 1995-11-15 | 松下電器産業株式会社 | 文字認識装置 |
| JPH02220188A (ja) * | 1989-02-22 | 1990-09-03 | Nec Corp | 文字認識装置 |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4003023A (en) * | 1975-07-09 | 1977-01-11 | International Business Machines Corporation | Post-recognition segmentation for pattern-recognition machines |
-
1983
- 1983-04-23 JP JP58070911A patent/JPS59197971A/ja active Granted
Also Published As
| Publication number | Publication date |
|---|---|
| JPS59197971A (ja) | 1984-11-09 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US5359673A (en) | Method and apparatus for converting bitmap image documents to editable coded data using a standard notation to record document recognition ambiguities | |
| EP0063454B1 (en) | Method for recognizing machine encoded characters | |
| JPH04195692A (ja) | 文書読取装置 | |
| JPS63182793A (ja) | 文字切り出し方式 | |
| JPS59197971A (ja) | 文字切出し装置 | |
| JP2993533B2 (ja) | 情報処理装置及び文字認識装置 | |
| JP2578767B2 (ja) | 画像処理方法 | |
| JPS6095689A (ja) | 光学的文字読取装置 | |
| JP3151866B2 (ja) | 英文字認識方法 | |
| JPH02230484A (ja) | 文字認識装置 | |
| JP2851102B2 (ja) | 文字切出し方法 | |
| Hwang et al. | Segmentation of a text printed in Korean and English using structure information and character recognizers | |
| JPH01201789A (ja) | 文字読取装置 | |
| JPH03268181A (ja) | 文書読み取り装置 | |
| JPH04130979A (ja) | 文字画像切出し方法 | |
| JP2578768B2 (ja) | 画像処理方法 | |
| EP0490374A2 (en) | Character recognition system | |
| JPH08129608A (ja) | 文字認識装置 | |
| JPS63204486A (ja) | 文字入力装置 | |
| JPH0353392A (ja) | 文字認識装置 | |
| JPH0368091A (ja) | 文字認識装置 | |
| JPH04346189A (ja) | 文字列種類識別装置 | |
| JPS60201480A (ja) | 文字読み取り方式 | |
| JPS5914078A (ja) | 帳票読取装置 | |
| JPS5851390A (ja) | 活字文字認識装置 |