JP3548372B2 - 文字認識装置 - Google Patents

文字認識装置 Download PDF

Info

Publication number
JP3548372B2
JP3548372B2 JP6413997A JP6413997A JP3548372B2 JP 3548372 B2 JP3548372 B2 JP 3548372B2 JP 6413997 A JP6413997 A JP 6413997A JP 6413997 A JP6413997 A JP 6413997A JP 3548372 B2 JP3548372 B2 JP 3548372B2
Authority
JP
Japan
Prior art keywords
character
characters
voiced
semi
point
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Fee Related
Application number
JP6413997A
Other languages
English (en)
Other versions
JPH10261049A (ja
Inventor
東善 ▲裴▼
康裕 浦
清治 高橋
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fujitsu Ltd
Original Assignee
Fujitsu Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fujitsu Ltd filed Critical Fujitsu Ltd
Priority to JP6413997A priority Critical patent/JP3548372B2/ja
Publication of JPH10261049A publication Critical patent/JPH10261049A/ja
Application granted granted Critical
Publication of JP3548372B2 publication Critical patent/JP3548372B2/ja
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Images

Landscapes

  • Character Discrimination (AREA)
  • User Interface Of Digital Computer (AREA)

Description

【0001】
【発明の属する技術分野】
本発明は,帳票に記入された文字を認識する文字認識装置に関する。
特に,帳票に記入する文字領域が指定され,濁点,半濁点を一文字として記入する帳票の文字認識装置に関するものである。
【0002】
【従来の技術】
従来使用されている文字認識装置は,半角文字の読み取りと全角文字の読み取りは,別であり,また文字を記入するルールも半角文字のカナでは,濁点や半濁点をそのかかる文字とは別の文字枠に記入するのが普通である。これはEBCDICコード(半角コード)に濁点,半濁点のついたカナコードがないことによる。
【0003】
図12により従来の技術を説明する。
図12において,
111は帳票に記入された手書き文字等の文字を表し,ヤマダを帳票に記入した例を示す。第1の枠にヤ,第2の枠にマが記入され,第3の枠のダはタと濁点を同一枠に誤記入したものである。111’は正しく記入された例であり,第3の枠にタ,第4の枠に濁点を記入したものである。
【0004】
112は,記入文字を1文字ずつ文字認識した結果である。1文字毎の文字認識は,帳票に記入された文字を画像データとして読み取り,1文字を切出し,切り出された1文字毎の特徴を抽出し,文字毎に特徴をもつ文字認識辞書120と比較し,一文字毎に文字認識をする。112はそのようにして得られた結果であり,第1の枠の文字をヤ,第2の枠の文字をマ,第3の枠の文字を1文字のダと文字認識したことを示す(文字認識辞書は濁点,半濁点付きの文字の特徴を持ち,それらを1文字として文字認識することができる,例えば,タと濁点「゛」が同じ枠に記入されている場合には1文字のダに文字認識する)。
【0005】
113は知識処理であって,1文字ずつの文字認識結果112について知識辞書114を参照して,文字認識された文字列の意味を表す単語を検索するものである。図12の例の場合,記入文字111の入力領域が姓名の記入領域であることから,文字認識結果112の意味は姓名についてのものであると判断し,姓名についての知識辞書114を参照して,文字認識された文字列の姓名を認識する。
【0006】
114は知識辞書であって,文字列の表す意味の抽象概念毎に,意味を表す単語を保持するものであり,図12は姓名を文字数毎に保持するものを示す(3文字の姓名としてヤマノ等,4文字の姓名としてヤマタ゛等をもつことを示す)。知識辞書は,半角文字に対しては,例えば,タと濁点「゛」はそれぞれ1文字とみなし,タ゛のように2文字にみる。1文字の濁点付きのダはもたない。
【0007】
117は出力処理であって,知識処理の認識結果を出力するものである。
120は文字認識辞書であり,一文字毎に特徴をもつものである。
121は文字毎に特徴をもつことを表す。
【0008】
図12の場合,タと濁点が同一の枠に記入されていることから,文字認識装置は,記入された文字を1文字の濁点付きのダと判定し,文字認識結果はヤ,マ,ダの三文字であると判断する。そこで,文字認識装置は,記入された領域が姓名についての領域であることから3文字のヤマダについて姓名の知識辞書114を参照する。そして,その知識辞書のヤマノ,ヤマタ等の3文字の単語を文字認識結果112と比較するが,3文字の姓名辞書にはヤマダは存在しないので,正しい結果(ヤマダ)を出力することができない。
【0009】
【発明が解決しようとする課題】
一文字の記入領域が枠等で定められた帳票に対して,一般の利用者が記入する場合,濁点や半濁点とそれにかかる文字は同じ枠に書くのが自然である。従って,文字認識装置で指定される記入文字のルールは守られないことが多い。そして,このように誤記入された文字は知識辞書の単語にないので知識処理が全く効かなくなり,正しい文字認識結果を出力することができない。
【0010】
さらに,図12の111’のように,正しく記入された場合にも,半角表示ではヤ,マ,タ, ゛のようにタと濁点「゛」を別の文字として扱い4文字として表示する。そのため,表示された認識結果の修正等でカーソル操作をする場合に操作が煩わしいという問題があった。
【0011】
本発明は,濁点や半濁点と文字が同じ枠に書かれた場合にも,正しく知識処理できる文字認識装置を提供することを目的とする。また,認識結果を修正する等の場合にも操作を能率良く行うことのできる文字認識装置を提供することを目的とする。
【0012】
【課題を解決するための手段】
本発明は,帳票の文字を読み取る文字読み取り部と,文字読み取り部の読み取った文字列の文字数を判断する文字数判断部と,濁点および半濁点をそれぞれ1文字として扱う知識辞書と,前記知識辞書を参照して,前記文字数判断部が判断した,読み取った文字列の文字数の単語を第1のテーブルに格納し,読み取った文字列の文字数に1を加算した文字数から読み取った文字列の文字数を2倍にした文字数までの文字数となる単語を第2のテーブルに格納する知識辞書参照部と,前記第2のテーブルを参照して,濁点あるいは半濁点を統合すると前記文字数判断部が判断した,読み取った文字列の文字数となる単語を抽出し,濁点あるいは半濁点を統合した単語を前記第1のテーブルに格納する統合部と,前記第1のテーブルに格納された単語について文字認識結果と比較し,もっとも距離の近いもの,もしくは距離の近い順に候補順位をつけて表示出力する表示部とを備えるようにした。
【0013】
図1は本発明の基本構成を示す。
図1において,
1は文字認識部であって,文字の記入領域が定められた帳票等に記入された文字,例えば1文字毎の文字認識結果である(文字認識結果の文字数をnとする)。
【0014】
2は知識処理部であって,文字認識部1の文字認識結果について知識辞書10を参照してその意味を判断する知識処理を行い,1文字毎の文字認識結果の文字列の意味を認識するものである。
【0015】
3は文字認識部1の認識した文字認識結果の表す意味の表わす概念(姓名,住所等)を判定する処理である。
4は文字認識部1の文字認識結果の文字列の文字数を判定する処理である。
5は文字列の意味を表す単語をもつ知識辞書10からn文字の単語を検索して獲得する処理である。
【0016】
6は文字列の意味を表す単語をもつ知識辞書10から(n+1)文字の文字列の単語,(n+2)文字の文字列の単語,・・・,2n文字のn文字の単語を検索して獲得する処理である。
【0017】
7は濁点,半濁点を統合する処理であって,濁点および半濁点とそれがかかる文字を一文字に統合する処理である。例えば,知識辞書から得られた4文字のヤマタ゛のタと濁点「゛」を一文字に統合してダとみなして3文字にする処理である。
【0018】
8は文字認識された認識文字列,と知識辞書から獲得したn文字,および(n+1)文字〜2n文字のうちで統合した結果がn文字となった文字列を比較する処理である。
【0019】
10は知識辞書である。
11は出力部であって,知識処理の結果得られた意味をもつ認識結果を出力するものである。
【0020】
図2は本発明の基本構成の動作説明図である。
図2において,
20は帳票にタと濁点「゛」を同じ枠に誤記入された文字列ヤマダを1文字ずつ文字認識して得られた結果のヤマダである(タと濁点「゛」を1文字として認識したことを示す)。
【0021】
知識処理部2において,
27は統合部であって,姓名についての知識辞書10の4文字のヤマタ゛22を統合して3文字のヤマダ28にしたことを示す。
【0022】
知識辞書10において,
22は4文字の姓名のヤマタ゛を表す。
23は3文字の姓名ヤマキを表す。
【0023】
出力部8において,
31は知識処理して得られた認識結果のヤマダである。
入力文字(文字認識結果)がヤマダである場合を例として,図1の本発明の基本構成の動作を説明する(図2を参照する)。
【0024】
1文字毎の文字認識結果としてヤマダ20が得られ,その記入領域の文字列の表す意味の抽象概念は姓名を表すものであるとする。知識処理部2は,文字認識結果が姓名についてのものであり,文字列の文字数が3文字であることから,姓名の知識辞書10により,3文字の姓名ヤマキ等の単語を検索して獲得する。
【0025】
さらに,文字認識結果が3文字であることから,4文字からその2倍の6文字までの文字列の単語を知識辞書10から獲得する。例えば,4文字のヤマタ゛22等である。
【0026】
4文字から6文字の文字列の単語に対して,統合部27は濁点,半濁点を統合し,例えば,濁点を1文字に数えた4文字のヤマタ゛はタと濁点「゛」を1文字に統合して3文字のヤマダとする。知識処理部2において,1文字毎の文字認識結果ヤマダ20と知識辞書10から獲得された3文字(ヤマキ等)および統合して3文字とされた単語(ヤマダ等)を比較する。そして,例えば,距離計算等でその類似関係を調べ,もっとも類似する単語(もっとも距離の近いもの等),図2の場合,ヤマダ31を知識処理に基づく認識結果として出力部11に出力する。
【0027】
本発明によれば,濁点や半濁点とそれにかかる文字は同じ枠に書かれた場合にも,知識処理において正しい認識結果を得ることができる。さらに,認識結果を表示する場合にも,表示する文字に対して濁点および半濁点を統合して1文字として取り扱えるように処理をする(この点の詳細については後述する)。
【0028】
【発明の実施の形態】
図3は本発明の文字認識装置のブロック図である。
図3において,
40は帳票であって,文字の記入領域および記入領域にその内容を表す意味が決められているものである(例えば,姓名,名前,住所等の記入領域が定められている)。
【0029】
41は文字読み取り部であって,帳票に書いた手書き文字等の文字をスキャナーで読み取り光電変換するものである。
42は特徴抽出部であって,文字読み取り部41で得られた帳票の画像データをもとに,1文字を切出し,1文字毎の文字認識に必要な特徴を抽出するものである。
【0030】
43は照合部であって,特徴抽出部42で得られた特徴と文字認識辞書44の辞書に記憶されている特徴を比較し,1文字毎に文字認識するものである。
44は文字認識辞書であって,文字毎にその特徴を記憶するものである。
【0031】
45は知識処理部であって,1文字ずつの文字認識結果について,その文字の表す意味の抽象概念(姓名,住所等)を判定し,その文字列の意味を表す単語をもつ知識辞書46を参照して,文字認識結果の文字列のもつ意味を認識するものである。
【0032】
46は知識辞書であって,単語の表す意味の抽象的概念,例えば住所,姓名,名前,企業名,一般名称(学校,図書館等)毎にその抽象概念に含まれる単語を保持するものである。
【0033】
47は表示部であって,知識処理部45の認識結果を出力するディスプレイ等である。
48は修正部であって,知識処理の認識結果の確認,修正等をするものである。
【0034】
49は入力部であって,ユーザによる確認,修正データ等を入力するものである。
図3の構成の動作を説明する。
【0035】
文字読み取り部41は帳票を画像として読み取る。特徴抽出部42はその画像データをもとに,1文字毎に文字を切取り,特徴を抽出する。そして照合部43は文字認識辞書44を参照し,1文字毎に特徴を比較し,類似する文字を求める。そして,その類似文字に類似度に応じて順位を付け,知識処理部45に与える。
【0036】
知識処理部45は,照合部43で得られた文字認識結果に従い,その文字列の意味(住所,氏名,企業名等の属性)を判定する。そして,その意味を表す単語をもつ知識辞書46を参照する。その際,知識辞書46に含まれる単語のうち濁点,半濁点等をもつ単語は統合して単語数を縮約し,文字認識結果の候補順位等を考慮して文字認識結果の文字列の単語の意味を表す単語を認識する(本発明の知識処理について図6で詳しく説明する)。そして,得られた認識結果を表示部47に転送する(出力する認識結果は,知識処理で得られた認識結果が第1順位のもののみ,あるいは複数を順位を付けて出力する等必要に応じて選択される)。
【0037】
表示部47は,知識処理部45で得られた認識結果を候補順位をつけて画面に表示する。
ユーザは,表示部47に表示された認識結果に従って,入力部49により,認識結果の確認,あるいは修正データを入力する。修正部48は確認もしくは修正等のデータをもとに,認識結果の確認,修正等の処理をする。
【0038】
図4は本発明の知識辞書の実施例であり,カタカナで姓名を表す単語を保持する辞書を示す。
51は辞書に登録されている単語の文字数nおよび単語の記憶領域へのポインタをもつ領域である。
【0039】
52は文字数毎に姓名を保持する領域である。
n=1の登録単語(姓名)はなし,n=2の登録単語はウラ,n=3の登録単語はササキ,イマイ等,n=4はヤマタ゛,アオシマ,タカハシ等である。
【0040】
図5は本発明の知識処理部の実施例のブロック構成図である。
図5において,
知識処理部2において,
61は文字数判定部であって,1文字毎の文字認識結果を受入れ,その文字列の文字数nを判定するものである。
【0041】
61’は文字列の表す意味の抽象概念判定部であって,入力された文字列の表す意味の抽象概念(住所,姓名,名前,企業名,一般名称等)を判定するものである。
【0042】
62は知識辞書参照部であって,文字認識結果の文字列の文字数,その意味の抽象概念に従って,その抽象概念の単語をもつ知識辞書10のn文字および(n+1)文字〜2n文字の単語を検索して求めるものである。
【0043】
63はテーブル1であって,知識辞書10を検索して求めたn文字の単語および統合部65によりn文字に統合された濁点,半濁点をもつ単語を保持するものである。
【0044】
64はテーブル2であって,知識辞書10を検索して求めた(n+1)文字〜2n文字の単語を保持するものである。
65は統合部であって,テーブル2(64)に保持された(n+1)文字〜2n文字の単語のうち,濁点,半濁点をもつ単語についてその濁点,半濁点とそれがかかる文字を1文字に統合する処理を行うものである。
【0045】
66は類似性判断部であって,一文字毎の文字認識結果とテーブル1(63)に保持されたn文字の単語および濁点,半濁点を統合してn文字とされた単語との類似判断をするものである。類似性の判断は,例えば,一文字毎の文字認識結果の文字とテーブル1(63)に記憶された文字との距離計算をする等で求める(この点については図6で具体的に説明する)。
【0046】
知識辞書10において,
71は姓名辞書であって,氏名の姓を表す単語を文字数毎に保持するものである。
【0047】
72は名前辞書であって,氏名の名前を表す単語を文字数毎に保持するものである。
73は住所辞書であって,住所を表す地名等の単語を文字数毎に保持するものである。
【0048】
74は企業名辞書である。
75は一般名称辞書である。
図6は本発明の知識処理による文字認識の説明図である。1文字毎の文字認識結果の第1候補がヤマダ,第2候補がイヌグ,第3候補がアスタである場合を例として示す。図6 (a)はテーブル1(63)から取り出された姓名ヤマダと文字認識結果を比較して距離計算をする場合を示し,図6 (b)はテーブル1(63)から取り出された姓名がヤマダの場合の距離計算方法を示す。
【0049】
図6 (a)において,
63はテーブル1である。
64はテーブル2である。
【0050】
65は統合部である。
66は類似性判断部である。
71は知識辞書のn文字の姓名を表す辞書である。
【0051】
71’は知識辞書の(n+1)文字〜2n文字の姓名を表す辞書である。
82はテーブル1(63)から取り出された文字列と文字認識結果91の文字列を比較して求められた距離である(距離の計算方法は後述する)。
【0052】
91は一文字毎の文字認識結果を表し,第1候補がヤマダ,第2候補がイヌグ,第3候補がアスタであることを例として示す。
図6 (a)の場合について説明する。
【0053】
知識辞書71,71’からテーブル1(63)に取り出す単語の獲得方法について説明する。
文字認識結果91が3文字であるので,文字認識結果91の第1候補の第1文字ヤを第1文字とする3文字の単語を全て取り出し,テーブル1(63)に格納する。次に文字認識結果91の第2候補の第1文字イを第1文字とする3文字の単語を全て取り出し,テーブル1(63)に格納する。さらに,文字認識結果91の第3候補の第1文字アを第1文字とする3文字の単語を全て取り出し,テーブル1(63)に格納する。
【0054】
次に,文字認識結果91が3文字であるので,文字列の数が4文字,5文字,6文字の単語について同様に全て取り出し,テーブル2(64)に格納する。例えば,4文字の場合,第1文字がヤである4文字の単語,第1文字がイである4文字の単語,第1文字がアである4文字の単語を全て取り出し,テーブル2(64)に格納する。この操作を5文字,6文字の単語についても繰り返し,テーブル2(64)に格納する。
【0055】
次に統合部65はテーブル2(64)に格納された単語について,濁点,半濁点を統合処理する。そして統合処理で3文字となった単語(ヤマダ等)をテーブル1(63)に移動する。
【0056】
類似性判断部66は,このようにしてテーブル1(63)に格納された3文字の単語および統合して3文字となった単語について文字認識結果と比較し距離を求める。
【0057】
テーブル1(63)から3文字の姓名ヤマダが取り出されたとする。類似性判断部66はテーブル1(63)に格納された第1文字マと一致する文字認識結果の第1文字を探す。その結果第1候補マと一致しているので,第1文字の距離をゼロとする。次にアマダ81の第2文字マと一致する文字認識結果の第2文字を求める。その結果第1候補のマと一致するので,第2文字の距離をゼロとする。次にヤマダ81の第3文字ダと一致する文字認識結果の第3文字を求める。その結果第1候補のダと一致するので距離を0とする。そして,ヤマダ81の各文字の距離の和0を総合距離として求める。
【0058】
図6 (b)に示すように,テーブル1(63)にアマダが取り出された場合の距離は次のように求める。
まず,テーブル1(63)から獲得した単語と文字認識結果の第1文字どうしを比較する。アマダの第1文字のアは第3候補の第1文字アと一致するのでその距離を2とする。次に第2文字どうしを比較する。アマダの第2文字のマは第1候補と一致するのでその距離をゼロとする。次に第3文字どうしを比較する。その結果,アマダの第3文字ダは第1候補と一致するので距離を2とする。従って,アマダの総合距離は2である。
【0059】
このように,テーブル1(63)に格納された単語について全て距離を計算し,総合距離の最小のものを知識処理の認識結果の第1候補として出力し,以下距離の小さい順に候補順位をつけて出力する。第1候補のみ結果として出力しても良い。
【0060】
ユーザは出力部のディスプレイに表示された知識処理の認識結果を見て,確認し,修正する必要があれば必要な修正データを入力して,認識結果を修正する。
図7は本発明の知識処理部の実施例のフローチャートである。
【0061】
図示のステップ番号に従って図5の構成の動作を説明する(図5を参照する)。
S1 文字数判定部61は,候補数kohoを設定する(図6の場合koho=3)。
【0062】
S2 文字数判定部61は,入力文字数nを設定する(図6の場合n=3)。S3,S4 i=1からkohoまでループする。ループにおいて,入力文字の第1番目の第i候補の文字をSとした時,Sで始まる長さnの単語を全て辞書から取り出し,テーブル1(table1)に入れる。図6の場合,文字認識結果の第1候補のヤマダの第1文字がヤであるので,ヤから始まる3文字の単語(姓名)を全て取り出す。次に,その第2候補イマダの第1文字がイであるので,イで始まる3文字の単語を全て取り出す。同様に,その第3候補アスタの第1文字がアであるので,アで始まる3文字の全ての単語を検索して求める。
【0063】
S5,S6 k=n+1からk=2nまでループする。また,そのループにおいてi=1からi=kohoまでループする。
S7 ループの過程において,入力(文字認識結果)の第1文字の第i候補の文字をSとしたとき,Sで始まる長さkの単語を全て辞書中から取り出しテーブル2に保持する。例えば,n=3であるので,4文字の単語について,文字認識結果の第1候補の第1文字ヤを第1文字とする4文字の単語をテーブル2に格納する。次に文字認識結果の第2候補の第1文字マを第1文字とする4文字の単語をテーブル2に格納する。さらに,第3候補の第1文字アを第1文字とする4文字の単語をテーブル2に格納する。同様に,5文字,6文字の単語についてもそれぞれ,ヤ,イ,アを第1文字とする単語を全て求め,テーブル2(64)に格納する。
【0064】
S8 統合部はテーブル2を検索し,濁点,半濁点を統合した結果が長さn文字になる単語をテーブル1に追加する(例えば,4文字のヤマタ゛のタと濁点「゛」を統合して3文字とし,テーブル1(63)に追加する)。
【0065】
S9 テーブル1に保持された全ての単語について入力文字候補と照合し,距離計算をし,最も距離の小さい単語を知識処理の認識結果として出力する。
図8は本発明の文字認識装置の表示方法の実施例である。
【0066】
図8 (a)は本発明の知識処理の認識結果の表示方法の例を示す。
図8 (a)は,知識処理の認識結果がノザキの場合の表示である。
半角フォントには,濁点付きの文字フォントはないので,本発明により濁点を統合して3文字で認識しても,表示はタと濁点゛をそれぞれ半角1文字で表示する。例えば,ノザキを表示する時は,図示のように濁点を1文字として4文字で表示する。従来,このような表示を第1文字のノから第4文字のキまでカーソルを移動する場合には,濁点も1文字とみて,4回のカーソル移動操作をする必要があった。本発明は,半角文字の表示の場合に濁点,半濁点を統合して1文字とし,統合した部分を1回のカーソル操作で行うようにした。
【0067】
92は第1文字ノにカーソルがある状態である。93は第2文字サと濁点「゛」を統合してサと濁点「゛」の下にカーソルがある状態である。94は第4文字キにカーソルがある状態である。第1文字のノから第4文字のキまでカーソル移動するのに3回のカーソル処理で行うことが可能である。また,サと濁点「゛」を消去もしくは変更するような場合にも,一回の操作で行うことができる。
【0068】
図8は (b)は本発明の半角文字の表示制御のブロック図である。
図8 (b)において,
95は知識処理の認識結果であって,タと濁点「゛」を統合してヤマダ(3文字)を認識したものである。
【0069】
96は表示制御部であって,表示制御を行うものである。
97は表示統合処理部であって,半角文字の濁点,半濁点を統合する処理をするものである。
【0070】
98は表示用半角文字のフォント保持部である。
99はディスプレイである。
ヤマダ95のような濁点を含む半角文字の認識結果が入力された時,表示制御部96は,表示用半角文字のフォント保持部98から半角文字のヤ,マ,タ,濁点「゛」を取り出す。そして,表示統合処理部97はタと゛を1文字で扱うように統合処理し,カーソル操作,文字の削除,変更等を一回の操作で行う。
【0071】
図9は本発明の認識結果の表示制御部のフローチャートの実施例1である。
S1 認識結果を入力する。
S2 認識結果の文字は半角文字か,あるいはそうでないかを判定する。全角文字であれば,S5で全角文字の表示処理をする。半角文字であれば,S3に進む。
【0072】
S3 濁点,半濁点があるか判定する。濁点,半濁点がなければS5で半角文字の表示処理をする。濁点,半濁点があれば,濁点,半濁点を1文字として扱うように統合処理をし,S5で統合した濁点,半濁点をその前の半角文字に統合して1文字として扱って表示処理をする。
【0073】
図10は本発明の認識結果の表示制御部のフローチャートの実施例2である。濁点,半濁点をともなう半角文字は,濁点,半濁点付きの全角文字で扱うようにしたものである。
【0074】
S1 認識結果を入力する。
S2 半角文字かあるいはそうでないかを判定する。半角文字でなければS5で全角文字の表示処理をする。半角文字であればS3の処理をする。
【0075】
S3 濁点,半濁点はあるか判定する。濁点,半濁点がなければS5で半角文字の表示処理をする。濁点,半濁点があればS4の処理をする。
S4 濁点,半濁点のある文字を全角文字で扱うようにし,S5で濁点,半濁点付きの全角文字の表示処理をする。
【0076】
図10のフローチャートの方法で表示する,濁点,半濁点のない前後の半角文字に比べて濁点,半濁点付きの全角文字は大きく不自然になるので,目立たなくするためにその濁点,半濁点付きの全角文字は,大きさの小さいフォントを使用するようにしたものである。
【0077】
S1 認識結果を入力する。
S2 半角文字か,あるいはそうでないかを判定する。半角文字でなければS4で全角文字の表示処理をする。半角文字であればS3の処理をする。
【0078】
S3 濁点,半濁点はあるか判定する。濁点,半濁点がなければS4で半角文字の表示処理をする。濁点,半濁点があればS4の処理をする。
S4 濁点,半濁点付きの文字を1文字に統合する。
【0079】
S5 統合した文字を濁点,半濁点のある小さい全角文字で表示をする。
【0080】
【発明の効果】
本発明によれば,濁点や半濁点と文字が同じ枠に書かれた場合にも,知識処理により正しい認識結果を得ることが可能になる。また,濁点,半濁点をともなう半角文字の表示も1文字として扱うことができるので,認識結果の修正,変更等を能率的に行うことができる。
【図面の簡単な説明】
【図1】本発明の基本構成を示す図である。
【図2】本発明の基本構成の動作説明図である。
【図3】本発明の文字認識装置のブロック図である。
【図4】知識辞書の実施例を示す図である。
【図5】知識処理部の実施例のブロック構成図である。
【図6】本発明の知識処理の動作説明図である。
【図7】本発明の知識処理部の実施例のフローチャートを示す図である。
【図8】本発明の知識処理の認識結果の表示方法の実施例を示す図である。
【図9】本発明の表示制御部のフローチャートの実施例1を示す図である。
【図10】本発明の表示制御部のフローチャートの実施例2を示す図である。
【図11】本発明の表示制御部のフローチャートの実施例3を示す図である。
【図12】従来技術の説明図である。
【符号の説明】
1:文字認識部
2:知識処理部
10:知識辞書
11:出力部

Claims (6)

  1. 帳票の文字を読み取る文字読み取り部と,
    文字読み取り部の読み取った文字列の文字数を判断する文字数判断部と,
    濁点および半濁点をそれぞれ1文字として扱う知識辞書と,
    前記知識辞書を参照して,前記文字数判断部が判断した,読み取った文字列の文字数の単語を第1のテーブルに格納し,読み取った文字列の文字数に1を加算した文字数から読み取った文字列の文字数を2倍にした文字数までの文字数となる単語を第2のテーブルに格納する知識辞書参照部と,
    前記第2のテーブルを参照して,濁点あるいは半濁点を統合すると前記文字数判断部が判断した,読み取った文字列の文字数となる単語を抽出し,濁点あるいは半濁点を統合した単語を前記第1のテーブルに格納する統合部と,
    前記第1のテーブルに格納された単語について文字認識結果と比較し,もっとも距離の近いもの,もしくは距離の近い順に候補順位をつけて表示出力する表示部と,
    を備えたことを特徴とする文字認識装置。
  2. 帳票に記入された文字の1文字毎の特徴を抽出する特徴抽出部と,1文字毎に文字の特徴をもつ文字認識辞書と,抽出された1文字毎の特徴を文字認識辞書と比較して文字認識する照合部とを備え,文字認識辞書は1文字に切り出された濁点もしくは半濁点付きの文字を1文字に見る特徴を持つものであり,
    1文字毎の文字認識においては,濁点もしくは半濁点とそのかかる文字が同一記入枠に書かれた文字も濁点もしくは半濁点付きの1文字として文字認識するものであることを特徴とする請求項1に記載の文字認識装置。
  3. 濁点,半濁点およびそのかかる文字が半角文字であることを特徴とする請求項1もしくは2に記載の文字認識装置。
  4. 濁点もしくは半濁点をともなう半角文字の認識結果の文字表示において,濁点もしくは半濁点をともなう文字に対して濁点もしくは半濁点とそのかかる文字を統合して1文字とみなして表示処理することを特徴とする請求項1に記載の文字認識装置。
  5. 濁点もしくは半濁点をともなう半角文字の認識結果の文字表示において,濁点もしくは半濁点をともなう文字に対して濁点もしくは半濁点とそのかかる文字を統合して1文字とみなし,その文字を濁点もしくは半濁点付き全角文字で表示することを特徴とする請求項1に記載の文字認識装置。
  6. 濁点もしくは半濁点付き全角文字を他の文字より小さい文字で表示することを特徴とする請求項5に記載の文字認識装置。
JP6413997A 1997-03-18 1997-03-18 文字認識装置 Expired - Fee Related JP3548372B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP6413997A JP3548372B2 (ja) 1997-03-18 1997-03-18 文字認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP6413997A JP3548372B2 (ja) 1997-03-18 1997-03-18 文字認識装置

Publications (2)

Publication Number Publication Date
JPH10261049A JPH10261049A (ja) 1998-09-29
JP3548372B2 true JP3548372B2 (ja) 2004-07-28

Family

ID=13249455

Family Applications (1)

Application Number Title Priority Date Filing Date
JP6413997A Expired - Fee Related JP3548372B2 (ja) 1997-03-18 1997-03-18 文字認識装置

Country Status (1)

Country Link
JP (1) JP3548372B2 (ja)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP5422934B2 (ja) * 2007-09-21 2014-02-19 凸版印刷株式会社 ゲノム配列における回文構造検出システム
CN111081102B (zh) * 2019-07-29 2022-03-25 广东小天才科技有限公司 一种听写结果的检测方法及学习设备

Also Published As

Publication number Publication date
JPH10261049A (ja) 1998-09-29

Similar Documents

Publication Publication Date Title
EP0844583B1 (en) Method and apparatus for character recognition
US8069033B2 (en) Document based character ambiguity resolution
JP4570509B2 (ja) 読み生成装置、読み生成方法及びコンピュータプログラム
JP2002117027A (ja) 感情情報抽出方法および感情情報抽出プログラムの記録媒体
US12499328B2 (en) Tonal language dictionary search device, tonal language dictionary search method, and non-transitory computer-readable storage medium storing a computer program readable by a computer of a tonal language dictionary search device
JP2003331214A (ja) 文字認識誤り訂正方法、装置及びプログラム
JPH10261049A (ja) 文字認識装置
JP3958722B2 (ja) イメージデータ文書検索システム
JPH10232871A (ja) 検索装置
JP3470927B2 (ja) 自然語解析方法及び装置
JP3187671B2 (ja) 電子辞書表示装置
JP2922365B2 (ja) Ocr処理システムにおける漢字住所データ処理方法
JP2001325292A (ja) 複合語の類似度判定システム、類似度判定方法及び記録媒体
JP2000090193A (ja) 文字認識装置および項目分類方法
JPH0546607A (ja) 文書読み上げ装置
JP2002014981A (ja) 文書ファイリング装置
JP2827066B2 (ja) 数字列混在文書の文字認識の後処理方法
JP4361655B2 (ja) 文章入力装置及び記録媒体
JPH09259132A (ja) 情報登録検索装置及びその方法
JPH10293811A (ja) 文書認識装置及び方法並びにプログラム記憶媒体
JP2947832B2 (ja) 単語照合方法
JP2574741B2 (ja) 言語処理方法
JPH05120331A (ja) 同音異義語認識装置
JPH10154141A (ja) かな漢字変換装置
JPH09245030A (ja) 文書解析装置及び形態素解析方法

Legal Events

Date Code Title Description
TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20040413

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20040416

R150 Certificate of patent or registration of utility model

Free format text: JAPANESE INTERMEDIATE CODE: R150

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20080423

Year of fee payment: 4

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090423

Year of fee payment: 5

S111 Request for change of ownership or part of ownership

Free format text: JAPANESE INTERMEDIATE CODE: R313113

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090423

Year of fee payment: 5

R350 Written notification of registration of transfer

Free format text: JAPANESE INTERMEDIATE CODE: R350

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100423

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100423

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20130423

Year of fee payment: 9

LAPS Cancellation because of no payment of annual fees