JPS5856189A - 文字認識装置 - Google Patents

文字認識装置

Info

Publication number
JPS5856189A
JPS5856189A JP56155629A JP15562981A JPS5856189A JP S5856189 A JPS5856189 A JP S5856189A JP 56155629 A JP56155629 A JP 56155629A JP 15562981 A JP15562981 A JP 15562981A JP S5856189 A JPS5856189 A JP S5856189A
Authority
JP
Japan
Prior art keywords
character
matching
word
prefecture
register
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP56155629A
Other languages
English (en)
Other versions
JPH0226268B2 (ja
Inventor
Hideaki Sugawara
菅原 秀明
Eiichiro Yamamoto
山本 栄一郎
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Computer Basic Technology Research Association Corp
Original Assignee
Computer Basic Technology Research Association Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Computer Basic Technology Research Association Corp filed Critical Computer Basic Technology Research Association Corp
Priority to JP56155629A priority Critical patent/JPS5856189A/ja
Publication of JPS5856189A publication Critical patent/JPS5856189A/ja
Publication of JPH0226268B2 publication Critical patent/JPH0226268B2/ja
Granted legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V30/00—Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
    • G06V30/10—Character recognition
    • G06V30/26—Techniques for post-processing, e.g. correcting the recognition result
    • G06V30/262—Techniques for post-processing, e.g. correcting the recognition result using context analysis, e.g. lexical, syntactic or semantic context
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V30/00—Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
    • G06V30/10—Character recognition

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Theoretical Computer Science (AREA)
  • Character Discrimination (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 本発明は文字認識後処理方式に関するものであって、%
に文字読取手段によ多入力された入力文字を文字辞書(
例えd漢字辞書)と文字認識後処理のII&順位の認−
結果にもとづきさらに単語辞書とのマツチングを行なう
ことKよ〕入力単語を正確に認識できるようkした文字
111IIl後処理方式%式% 従来の文字MM4方式では、例えば第1riAK示す如
<、ii*sxにおいて入力文字の%微抽出を行ないこ
れをファイルと比較してもつともwIwA順位の高りも
のを出力レジスタ2に出力し、その後、文字認識後処理
としてこの出力レジスタ2に出力された3ケの文字が都
道府県名を示すものであるとあらかじめわかってiる場
合には、これらの文字を都道府県辞書3と順次マツチン
グ回路番にて比較を行なり入力文字を正確に認識するよ
うにしている。
すなわち第1図において都道府県名の記入領域に3個の
文字の記入されたデータ入力用紙(図示省略)を例えば
0CR(図示省略)で読取シ、これによル得られたデー
タにもとづきWii識部lではそれぞれMaill順位
のもつとも高い「宮」1「埼」「県」を出力レジスタ2
に出力し、これらをマツチング回路4において都道府県
辞書8にセットされている都道府県名と順次比較してそ
の一致度のもつとも高い都道府県名を読堆出力として出
力するものである。しかるにこのような後処理方式のも
のでは、tg1図に示す如く、認譜部lから「宮」「埼
」、「県」と出力されたことにもとづき都道府県辞書3
にセットされている都道府県名とマツチングを行なう九
場合、「宮崎系」と「宮城系」の2つが同−優先順位で
存在することKなり、自動的にこのいずれか一方を選択
することはできなかった。その丸め場合によってはオは
レータによるilt#操作制御を行なう必要が存在する
ため、その後処理Kかなりの時間を必要とする問題が存
在する。
したがって本発明はこのような問題を改善するためにJ
1身部からの出力を最高順位のもの1つのみに限定せず
に、例えば3#r目までの4のとかあるいFifた5番
目までのものというように、優先順位の高いものから複
数個出力させ、これらの複数個のgA識出力により単語
辞書とのマツチングを行なうようにした文字認識後処理
方式を提供することを目的とするものである。そしてこ
のために本発明における文字認識後処理方式では、読取
文字を認識する文字認識手段と該認識した文字が単語辞
書に記入された文字と一致することを検出するマツチン
グ手段を具備する文字認識後処理方式において、文字認
識手段より複数順位のgW1文字候補を出力させかつマ
ツチング手段において単語辞書に保持された単語と前記
複数順位の1朦文字候補と比較してそのマツチング度合
のもつとも大きい単語を選択するようにしたことを特徴
とする。
本発明を詳述するに先立ち、第2図にもとづきその動作
原理について簡単に説明する。
いtg繊部で3文字の都道府県名を読取ったとき第1#
r目の文字については第2図に示す如く、第1順位が「
科」、第2順位が「秩」、第3順位が「秋」、第4順位
が「材」、第5順位が「林Jであり、第2番目の文字に
ついては第1順位が「田」、第2順位が「内」、第3順
位が「口」、第4順位が「円」、第5順位が「由」であ
り、第3番目の文字については第1順位が「具」、第2
1−位が「県」、第311j位が「目」、第4NA位が
「且」、第5順位が「旦」とそれぞれ認i11順位にし
たがって複数の候補文字が得られ九とき、これらの各候
補文字を都道府県名の格納された都道府県辞書の各部道
府県名と順次比較する・すなわち都道府県辞書3から第
1番目に「北海道」を読出し、その第1番目の文字「北
」を前記「科、秩。
秋、材、林」と比較してマツチングをとる。この場合に
は「北」と「科、秩、秋、材、林」は不一致である。そ
して第2番目の文字「海」を前記「田、内9ロ9円、由
」と比較し、第3番目の文字「道Jtllfr記「具1
県、目、且、旦」と比較しそれぞれ一致をとる。そして
この場合には第4番目の文字が存在しないということで
i1繊部の出力と都道府県辞書3の第1番の単#I「北
海道」とは一致するのみである。
ところが都道府県辞書3の第2番目の単語「青森県」は
、その第3番目の文字「県」が前記[具。
県、目、且、旦」のうちの1つと一致し、またお互に第
4番目の文字が存在しないということでも一致するので
、第2番目の単誤「青森県」は第1番目の単語「北海道
」よりもマツチング度合が大きい。
そして都道府県辞書3の第31に目の単語「秋田系」は
、各文字とも前記候補文字と一致する。すなわち「秋」
は「科、秩、秋、材、林」の1つに一致し、「田」は「
田、内2ロ1円、由」の1つに一致し、「県」は[具1
県、目、且、flJの1つに一致し、しかも第4番目の
文字が存在しないことでも一致する。それ故、この場合
、この第3番目の単語とのマツチング度合がもっとも大
きいので、この第3番の単語である「秋田系」を読取文
字として認識出力するものである。
以下本発明の一実施例を第3図にもとづき説明する。
図Φ、他国と同符号部は同一部分を示し、5は文字マト
リクス・レジスタ、6は順位レジスタ、7は単語辞書、
8はマツチング結果出力レジスタ、9は結果判定回路、
lOは出力レジスタ、11はマツチング回路であってマ
ツチング回路4にズ・1応するものである。
文字マトリクス・レジスタ5はs1m部1から出力され
た複数の候補文字がセットされるレジスタであって、例
えば第1番目の文字に対しては第1順位〜第5@位まで
の「科」、「秩」、「秋」。
「材」、「林」がそのam順位■〜■にしたがってセッ
トされ、第2番目の文字および第3番目の文字に対して
も、同様に第1願位〜第5順位までの「田」、「内」、
「口」、「円」、「由」及び「風」、「県」、「目」、
「且」、「旦」がセットされる。
順位レジスタ6は文字マトリクス・レジスタ5にセット
されている文字が出力されるレジスタであって、マツチ
ング回路11からの順序制御信号C1によりそのセット
される文字が順次変更されるものである。
単語辞書7は後処理に必要な、例えば都道府県名用の単
語集とか、各部道府県毎の例えば秋田県内の都市町村名
のような分類された複数の単語集がファイルされている
ものであり、マツチング回路11からの単語毎の制御信
号c2  により分類別に、しかも一定の順序にしたが
って所望の分類の単語が順次出力されるものである。
マツチング結果出力レジスタ8は文字マトリクス・レジ
スタ5にセットされた文字と単語辞書7から出力された
単語との一致度を単語対応に保持するレジスタである。
結果判定回路9はマツチング回路11にて行なわれたマ
ツチングの結果、そのもつとも!ツチング度合の大きな
単語を選択出力するものである。
次に第3図の動作について説明する。
(1)  g繊部1から出力されたaR候補文字はその
1繊順位にし九がって文字マトリクスφレジスタ5に出
力される。例えば、第2図に示す如く、第1番目の文字
に対しては第1順位〜第5順位までの「科、秩、秋、材
、林」が出力され、第2i1目の文字に対しては「田、
内2ロ1円、由」が出力され、第3!#目の文字に対し
ては[具1県、目。
且、旦」が出力される。そして前記g綴部1の出力が都
道府県名であることがあらかじめわかっているので、単
語辞書7から都道府県名用の単語集ファイル部が読出さ
れる。この場合、マツチング回路11から出力される単
語毎の制御信号C3により先ず「北海道」が読出される
。そしてマツチング回路11からの順序制御信号C1に
よシ順位レジスタ6に先ず「科田具」がセットされ、「
北海道Jと比較されるが、このとき4番目に文字がない
ということのみで一致するが他は一致しない。
次にマツチング回路11から再び順序制御信号C1が出
力され、順位レジスタ6に「秩内県」がセットされ同様
に「北海道」と比較される。このようにしてマツチング
回路11からの順序制御信号C1により順位レジスタ6
に第3順位の「秋口目」、第4順位の「材円且」、第5
順位の「林由旦」が順次セットされ「北海道」とのマツ
チングが行なわれるが、これらはいずれも文字同志不一
致であり、その結果第4番目の文字が存在しないという
ことで一致するので、マツチング結果出力レジスタ8の
区分1の(4)に「1」が記入され区分1の(1)〜(
3)には「O」が記入される。
(2)  このようにして第1番目の単#!「北海道」
との照合が終るとマツチング回路11は制御信号C2を
出力し、第2vk目の単語「青森県」を出力させる。そ
れから順序制御信号Cz  を出力し順位レジスタ6に
第1順位「科田具」〜第5願位「林由旦」を順次セット
して前記「青森県」と照合する。このとき第2順位の「
秩内県」における「県」と第4番目の文字がないという
2つの点で一致するので、マツチング回路11はマツチ
ング結果出力レジスタ8の区分2の(3) (4)にそ
れぞれ「1」が記入され区分2の(1) (2)にそれ
ぞれrOJが記入される。
(3)  次いでマツチング回路11は制御信号Ctに
よシ第3番の単語「秋田県」を出力させ、それから前記
(1) 、 (2)と同様にして順位レジスタ6に「科
田具」〜「林由旦」を順次セットしてこの「秋田県」と
の照合を行なう。この場合には第1順位の「科田具」に
おける「田」、第2順位の「秩内県」の「県」、第3順
位の「秋口目」における「秋」と第4番目の文字がない
ということでそれぞれ一致が得られるので、マツチング
結果出力レジスタ8の区分3の(1)〜(4)にはそれ
ぞれ「1」が記入されることになる。
(4)  このようにしてすべての都道府県名との照合
が終了したとき、結果判定回路9はこのマツチング結果
出力レジスタ8の各区分の内容にもとづきそのもつとも
マツチング度合の大きな区分3の照合結果により第3番
目の都道府県名の「秋田系」を最終的な読取出力として
出力レジスタ10に出力する。このようにして後処理に
より「秋田系」を正確に取出すことができる。
なお第4図に示す如く、結果判定回路9′に第1人力レ
ジスタ12、第2人力レジスタ13および比較制御部1
4を設け、第1人力レジスタ12にマツチング回路11
からの個々のマツチング状態を人力してこれを先に入力
している第2人力レジスタ13に保持されているものと
のマツチング状態と比較して、新らしく伝達された第1
人力レジスタ12のマツチング度が大きいときにこれを
第2人力レジスタ13に記入し、小さいときにはその1
1第1人力レジスタ12に次の単語に対するマツチング
度を入力するように構成すれば、第3図におけるマツチ
ング結果出力レジスタ8は不必要となり、単語辞書から
読出される被照合単語数が大きい場合でも簡単な構成で
対処することができる。
なお上記説明では候補文字を第5順位まで選択した例に
ついて説明したが、これに限定されるもので社ない。例
えば第5図に示す如く、これを変更することもできる。
第5図の例では、第1順位が「宮崎系」であっても、そ
の第2順位の「官崎具」、第3順位の「富峠旦」を都道
府県辞書3と比較してマツチングをとることにより、入
力文字が「宮崎系」であるものと正しく識別できるので
。
第3順位までで本第1図に示した従来のような問題を正
しく解決することができる。
【図面の簡単な説明】
第1図は従来の文字認識後処理方式説明図、第2図は本
発明の詳細な説明図、第3図は本発明の一実施例構成図
、第4図はその結果判定回路の他の実施例、第5図は候
補文字を第3111位までにした場合の説明図である。 図中、lは謂綴部、2は出力レジスタ、3は都道府県辞
書、番はマツチング回路、5,5′は文字マトリクスΦ
レジスタ、6は順位レジスタ、7は単語辞書、8はマツ
チング結果出力レジスタ、9゜9′は結果判定回路、1
0は出力レジスタ、11はマツチング回路、12は第1
人力レジスタ、13は第2人力レジスタ、14は比較制
御部をそれぞれ示す。 特許出願人   電子計算機基本技術研究組合代理人弁
理士    山 谷 晧 榮

Claims (1)

    【特許請求の範囲】
  1. (11読取文字をi!識する文字認識手段と該wll1
    mした文字が単語辞書に記入された文字と一致すること
    を検出するマツチング手段を具備する文字認識後処理方
    式において、文字MwA手段よル複数順位の認識文字候
    補を出力させかつマツチング手段におhて単語辞書に保
    持された単語と前記複数順位の認識文字候補と比較して
    そのマツチング度合のもつとも大きい単語を遍択するよ
    うにしたことを特徴とする文字認識後処理方式。
JP56155629A 1981-09-30 1981-09-30 文字認識装置 Granted JPS5856189A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP56155629A JPS5856189A (ja) 1981-09-30 1981-09-30 文字認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP56155629A JPS5856189A (ja) 1981-09-30 1981-09-30 文字認識装置

Publications (2)

Publication Number Publication Date
JPS5856189A true JPS5856189A (ja) 1983-04-02
JPH0226268B2 JPH0226268B2 (ja) 1990-06-08

Family

ID=15610166

Family Applications (1)

Application Number Title Priority Date Filing Date
JP56155629A Granted JPS5856189A (ja) 1981-09-30 1981-09-30 文字認識装置

Country Status (1)

Country Link
JP (1) JPS5856189A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH03189891A (ja) * 1989-12-20 1991-08-19 Pfu Ltd 辞書参照による知識処理を行う文字列読み取り装置
JPH06215198A (ja) * 1993-01-12 1994-08-05 Nec Corp 文字認識後処理方式

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5839377A (ja) * 1981-09-02 1983-03-08 Toshiba Corp 文字認識装置

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS5839377A (ja) * 1981-09-02 1983-03-08 Toshiba Corp 文字認識装置

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH03189891A (ja) * 1989-12-20 1991-08-19 Pfu Ltd 辞書参照による知識処理を行う文字列読み取り装置
JPH06215198A (ja) * 1993-01-12 1994-08-05 Nec Corp 文字認識後処理方式

Also Published As

Publication number Publication date
JPH0226268B2 (ja) 1990-06-08

Similar Documents

Publication Publication Date Title
US4775956A (en) Method and system for information storing and retrieval using word stems and derivative pattern codes representing familes of affixes
US5706496A (en) Full-text search apparatus utilizing two-stage index file to achieve high speed and reliability of searching a text which is a continuous sequence of characters
US4514826A (en) Relational algebra engine
JPS61267885A (ja) 単語辞書照合装置
JP2693914B2 (ja) 検索システム
CN110347804B (zh) 一种线性时间复杂度的敏感信息检测方法
CN106776746A (zh) 一种全文索引数据的创建方法及装置
JP2000040085A (ja) 日本語形態素解析処理の後処理方法および装置
JPH0226268B2 (ja)
JPS59736A (ja) 構文解析方式
JPS60583A (ja) 単語認識方式
Neufeld et al. Machine-aided title word indexing for a weekly current awareness publication
Hill The dynamic semantics of kernel ELLA
JP2773657B2 (ja) 文字列検索装置
JPS59117673A (ja) 文字認識装置における後処理方式
De Smet Chasing Commentaries: Kaspar Schoppe, Jacques Bongars, and Pierre Daniel, or the Backstory to the Servius Danielis Revisited
Davies et al. A technique for consistent splitting of Russian words
JPH05128163A (ja) 連結データベース仮想論理演算処理装置および方法
JPS6049481A (ja) 単語認識装置
CN106372089A (zh) 确定词语位置的方法及装置
Arikawa On the length functions of languages recognizable by linear bounded automata
JPS58175054A (ja) デ−タ検索方式
JPS63103393A (ja) 単語認識装置
JPS60124773A (ja) 文書作成装置
JPS603017A (ja) カナ漢字変換処理装置