JPH04153880A - 文字列の部分列抽出処理方式 - Google Patents

文字列の部分列抽出処理方式

Info

Publication number
JPH04153880A
JPH04153880A JP2280322A JP28032290A JPH04153880A JP H04153880 A JPH04153880 A JP H04153880A JP 2280322 A JP2280322 A JP 2280322A JP 28032290 A JP28032290 A JP 28032290A JP H04153880 A JPH04153880 A JP H04153880A
Authority
JP
Japan
Prior art keywords
character
extraction
string
primitive
storage area
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP2280322A
Other languages
English (en)
Inventor
Tadahiro Murotani
室谷 忠宏
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
PFU Ltd
Original Assignee
PFU Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by PFU Ltd filed Critical PFU Ltd
Priority to JP2280322A priority Critical patent/JPH04153880A/ja
Publication of JPH04153880A publication Critical patent/JPH04153880A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [概要〕 文字プリミティブ列から所定の条件に適合した部分列を
抽出する文字列の部分列抽出処理方式に関し。
入力文字列を所定の部分列に分割して所定の条件に適合
したものを抽出することを目的とし入力文字列を文字プ
リミティブ列に分割する分割部と、前記文字プリミティ
ブ列の属性を判別する属性判別部と5抽出条件から抽出
条件判別列を生成する抽出条件生成部と、前記抽出条件
に適合した前記文字プリミティブ列を抽出する抽出部と
前記属性を所定の順に格納する配列型格納領域とを備え
、前記属性判別部が、前記属性を前記配列型格納領域に
前記所定の順に格納し、前記抽出部が、前記配列型格納
領域に格納された内容と前記抽出条件判別列とを比較す
ることにより、前記抽出を行なうように構成する。
〔産業上の利用分野〕
本発明は文字列の部分列抽出処理方式に関し。
更に詳しくは1文字プリミティブ列から所定の条件に適
合した部分列を抽出する文字列の部分列抽出処理方式に
関する。
ある規則に従って作成された文字列の中から。
所定の条件に適合した部分列を自動的に抽出することが
できれば、当該部分列の内容が正しいか否か等のチエツ
クを行うのに有効である。
〔従来の技術〕
例えば、複数の部分を組立てである1つの製品を製造す
る場合5通常1組立て図面が作成される。
組立て図面には、m立での仕様の他ムこ、どの部品を何
個使用するかという情報〔部品情報〕も記載される。部
品情報は1例えば、数量(何個用いるか)1品名(部品
の一般的な名称)2図番(部品の詳細を特定する番号)
等からなる。
一方、m立てに用いる部品の購入、管理等を目的として
3通常2部品リスト(SK)も作成される。部品リスト
は5部品情報からなる。
ここで1組立て図と部品リストとの関係を考える9本来
1部品リストは1Mi立て図の完成後、これに基づいて
作成されるものである。しかし、これでは製造工程完了
の短縮が図れないので、ある程度まで組立て図が作成進
行した段階で部品リストが作成され1発注等がなされる
。そして1組立て図の完成後に部品リストを修正する。
この修正のために1Mi立て図と部品7ノストを対比し
て1部品情報をチエツクする必要がある。
〔発明が解決しようとする課題〕
前述の従来技術において1部品情報の対比によるチエツ
クは、設計者等が人手によって行っている。
このため、以下の問題があった。即ち1組立て図におけ
る部品情報は、当該部品の近傍(の所定位置)に記入さ
れるため2図面全域に散在しており、その位置が判りに
くい。また1図と文字とが混在するため、この点からも
判りにくい。更に組立て図中には1部品情報の他にも種
々の情報が存在し、これらは共に「文字列」という形態
をとるため、どの文字列が部品情報か判りにくい。また
5部品情報の文字列のフォーマットには、幾つかの種類
があり、一方、フォーマントが変更されることがある。
このような場合1人手に依るチエツクでは正確に変更等
に対応できず、エラーを生しる可能性もある。
本発明は2人力文字列を所定の部分列に分割して所定の
条件に適合したものを抽出することを可能とした文字列
の部分列抽出処理方式を提供することを目的とする。
〔課題を解決するための手段〕
第1図は本発明の原理構成図であり6本発明によるデー
タ処理装置を示す。
第1図において、1は処理装置、2は分割部3は属性判
別部、4は抽出条件生成部、5は抽出部、6は配列型格
納領域、7は読取り装置、8は出力装置である。
処理装置lは、中央処理装置(cpu)及びメモリから
なる。
分割部2は、入力文字列を文字プリミティブ列(即ち部
分列)に分割する。
属性判別部3は2分割された文字プリミティブ列毎にそ
の属性を判別する。
抽出条件生成部4は、抽出条件から抽出条件判別列を生
成する。
抽出部5は7分割された文字プリミティブ列のうちから
、抽出条件に適合したものを抽出する。
配列型格納領域6は、処理装置lのメモリ上に設けられ
2文字プリミティブ列の属性を所定の順に格納する。即
ち、このために、予め定められた大きさの配列型とされ
る。
読取り装置7は1図面上の入力文字列、抽出条件を読取
る。
出力装置8は、抽出された文字プリミティブ列を出力す
る。
〔作用〕
第2図は本発明の作用説明図であり1本発明の処理フロ
ーを示す。
■ 分割部2が、読取り装置7の読取った入力文字列を
、予め定められた条件に従って1文字プリミティブ列(
部分列)に分割する。
■ 属性判別部3が1分割部2の分割した文字プリミテ
ィブ列の各々について予め定められた条件を用いてその
属性を判別し、その結果を、配列型格納領域6に所定の
順に格納(配列)する。
これにより、属性を記述した属性列が得られる。
■ 抽出条件生成部4が、読取り装置7の読取った抽出
条件から、抽出条件判別列を生成する。
■ 抽出部5が、配列型格納領域6に格納された内容即
ち属性列の各々と、抽出条件判別列とを比較し、一致し
た属性列に対応する文字プリミティブ列を、抽出条件に
適合したものとして抽出する。そして、出力装置FBが
、当該文字プリミティブ列を例えば、印刷等により出力
する。
以上によれば1図面上の文字列を区別なく入力し、この
中から所定の抽出条件に適合した文字列(部分列)1例
えば1部品情報のみを自動的に抽出することができる。
また、抽出条件を入力して判別列を生成することにより
1例えば部品情報のフォーマットの変更等に容易に対応
することができる。
〔実施例〕
第3図は実施例構成図であり、第1図図示のデータ処理
装置の詳細を示す。
入力文字列読取り装置10及び抽出条件読取り装置14
は、読取り装置7を構成する。
文字プリミティブ分解部11は2分割部2に相当し1分
割した文字プリミティブを文字プリミティブ格納領域1
2に格納する。文字プリミティブ格納領域12は、処理
装置1のメモリの所定の位置に設けられる。
判別値決定部13は2属性判別部3に相当し文字プリミ
ティブ格納領域12から文字プリミティブを取出し、そ
の属性、即ち2判別値を決定しこれを配列型格納IJI
域6に格納する。
抽出条件判別列生成部15は、抽出条件生成部4に相当
し、生成した抽出条件判別列を抽出条件判別列格納領域
16に格納する。この領域16は。
処理装置1のメモリの所定の位置に設けられる。
配列型記憶領域抽出条件判別列比較部17は。
文字プリミティブ抜出し部18と共に抽出部5を構成し
、配列型記憶領域6の内容の各々と抽出条件判別列の各
々とを比較する。この比較の結果に基づいて2文字プリ
ミティブ抜出し部18は1文字プリミティブ格納領域1
2から適合する文字プリミティブを抜出す。
文字プリミティブ出力装置19は、出力装置8に相当し
、抜出された文字プリミティブを出力すなお、各部11
.13,15.17及び18は。
処理袋N1のcpuとそのメモリ上に存在する処理プロ
グラムとによって実現される。
第4図は文字プリミティブ説明図である。
第4図(a)において、■乃至[相]の各々が文字プリ
ミティブであり、「!」が文字プリミティブ列である。
文字プリミティブ列!は、入力文字列に等しく所定の記
号(区切り文字)1例えば、「口(ブランクを表すもの
とする)」、  r、  (ピリオド)」。
「、(カンマ)」等によって区切られる。この区切られ
た文字列の各々■乃至[相]が文字プリミティブである
。従って1文字プリミティブ■乃至0は。
複数の文字を含むことがあり、かつ、これ以上分割して
は意味をなさなくなるものである。例えば。
■の「コネジ」を「コJ、r$ジ」に分解しては意味を
失う。
なお、この文字プリミティブ列lは、主に部品情報(数
量2品名1図番)からなる。
また、このような分割処理は1分割部2が、第8図図示
の分割処理フローに従って、実行するものである。
即ち、読取り装置7で読取られた入力文字列は一旦所定
の配憶領域(図示せず)に格納される。
分割部2は、入力文字列から一文字づつ取出した文字に
ついて1区切り文字か否かを判定し、これを利用して文
字プリミティブに分解する。
なお、第8図において、Neは入力文字数。
Npは文字プリミティブの数である。
第4図(b)は2文字プリミティブ■乃至[相]の各々
について その属性を判別値「1」又は「0」を用いて
示している。この場合1文字プリミティブ列!から部品
情報を抽出しようとしているので属性が部品情報の数量
2品名2図番のうちのいずれを表しているのかを示す。
例えば、■の「ネジ」は、「品名」であるから2品名に
ついての判別値を「1」とじ5数量及び図番についての
判別値は「OJとされる。他の文字プリミティブ■乃至
[相]についても同様に判別値が決定される。例えば2
文字プリミティブが片仮名からなれば「品名」、数字か
らなれば「数量」、アルファニューメリ、りからなれば
「図番」であると判別される。
なお 判別の方法は、これに限定されるものではない。
また、一般に1文字プリミティブの属性(判別値)の数
をNaとすると、当該属性は (al+a!+  ・・・a N11−1+  a m
alなる集合で表される。ある文字プリミティブがn番
目の属性である(n番目の判別値が「1」)であるとき
5 ak =1 (k=n) =O(kin) となる。
第5図は抽出条件判別列説明図である。
今2部品情報を抽出しようとしているものとし。
かつ2部品情報は、数量1品名1図番の3つのみをこの
順序に記載することにより構成されているとする。
この場合1部品情報は2本来的に、前記3つの項目の全
てが記入されたものからなるから、抽出条件としては「
数量1品名1図番」と指定され。
入力される。これにより5抽出条件判別列は。
rll、l」となる。即ち、数量1品名5図番の3つに
ついての文字列が存在しく記入があり)。
この結果各々の判別値が「l」であるものが抽出され、
抽出条件に適合する文字列2即ち2部品情報とされる。
また3部品情報は、その数量が「1」である場合にこれ
を省略して記入されることがある。そこで このような
ものまで部品情報として抽出する場合、抽出条件として
「〔省略〕十品名十図番」と指定される。これにより、
抽出条件判別列はrol、l」となる。
更に2部品情報は1図番のみで品名を必要としないこと
があるので、これを省略して記入されることがある。そ
こで、この場合には抽出条件は「数量+(省略〕十図番
jとされ、抽出条件判別列はro、0.IJ又はrl、
0.0」となる。
本発明によれば、このように種々の抽出条件を所望によ
り設定できる。即ち、抽出条件読取り装置14を設ける
ことにより、抽出対象に応して。
柔軟な抽出条件が設定できる。そして、このように種々
の抽出条件を設定することにより、抽出対象の抽出率を
極めて高いものにできる。
なお、抽出条件は4つ以上の項目で構成されていてもよ
い0例えば、8つの項目からなり、その3番目、5番目
及び6番目の項目が省略されているものを抽出するとす
る。この場合、抽出条件判別列は。
*+に+kOO011 $$00001* *0O100**。
11000***。
の4つとなる。
また、このような生成処理は、抽出条件生成部4が、第
9図図示の生成処理フローに従って実行するものである
。
第9図において、要素d ijに「0」又は「1」。
省略の場合には「*」が格納されることによって。
抽出条件判別列が求まる。ここで、jは「1」乃至rN
a」の値をとり、第5図中のX方向に相当し、iは「1
」乃至rNdJ(抽出条件判別列の番号)の値をとり、
第5図中のX方向に相当する。
X方向のi列目の全要素をDiで表すと2 このDiが
1つの抽出条件判別列を示す。
第6図は格納状態説明図である。
今2文字プリミティブ■に着目すると、これが部品情報
の一部である可能性は1例えば。
(数量十品名十図番)−(省略+■+■)(数量十品名
十図番)−(■+■+■)(数量十品名十図番)=(■
十■+■)の3つの組合せがある。従って、この各々に
ついて、抽出条件判別列r1.1.IJ又はrO,1゜
1」等と一致するか否かを調べる必要がある。
そこで、まず、配列型格納領域6が用意される。
この配列の横の要素数は部品情報の項目の数Naとされ
、縦の要素数は(文字プリミティブ数Np+(前記項目
の数−1))とされる。そして、この配列に、所定の順
で1文字プリミティブ■乃至[株]の各々の属性の判別
値が格納される。文字プリミティブ■(n)について見
ると、その図番1品名及び数量は、各々1組合せ順“2
(n)”“’3 (n+1)”及び“4 (n+2)”
の該当する項目の領域に格納される。他についても同様
である0以上により1文字プリミティブ■乃至[相]の
各々について1部品情報を構成する可能性のある組合せ
の全ての属性列を作成できる。
このような判別及び格納処理は、属性判別部3が、第1
0図図示の判別格納処理フローに従って実行するもので
ある。
第10図において、要素txyに属性aVが格納される
ことによって、属性列が生成される。ここで、Xはrl
、乃至「Na」の値をとり、第6図中のX方向に相当し
、yは「1」乃至rNp 十Na−1」の値をとり5第
6図中のX方向に相当する。X方向のi列目の全要素を
Tiで表すと。
このTiが1つの属性列を示す。
第7図は抽出処理説明図であり5第3図乃至第6図まで
をまとめて示したものである。
前述の如く、入力文字列を文字プリミティブ■乃至[株
]に分解し、その属性の判別を行い1判別値を配列型格
納領域6に所定の順で格納する。一方抽出条件から抽出
条件判別列rl、1.IJ及びro、1.IJを得る。
そして、配列型記憶領域6の各組合せ順と抽出条件判別
列とを比較する。この結果1組合せ順“6″及び13″
が一致する。前者は、その数量2品名及び図番が、各々
2文字プリミティブ■■及び■により構成される部品情
報である。後者は、その数量1品名及び図番が、各々、
省略1文字プリミティブ@及び■により構成される部品
情報である。
このように1文字プリミティブ列中から2部品情報が2
つ抽出される。即ち7「3.ネジ四M3×30」は2図
番rM3X3.で特定される「ネジ」が「3」個である
ことを意味し、「ネジ四M7×70」は1図番「M7×
7」で特定される「ネジ」が「1」個であることを意味
する。この場合の部品情報の抽出率は100% である
。従って、この後の作業を橿めて効率よく行いうる。
以上の抽出処理は、抽出部5が、第11図図示の抽出処
理フローに従って実行するものである。
第11図において、抽出条件判別列Dj と属性列T+
 とを比較し1両者が一致し、がっ、その属性が指定さ
れている場合に、当該属性列Tiのその属性に対応する
文字プリミティブを、当該属性として出力する。ここで
、qh=0なら、に番目の属性が指定されており、Qk
=1なら、当該属性が省略されていることを意味する。
〔発明の効果〕
以上説明したように1本発明によれば、所定の条件に適
合した部分列を抽出する文字列の部分列抽出処理におい
て1文字列を分割した文字プリミティブの属性を所定の
順に配列したものと抽出条件判別列とを比較することに
より、所望の抽出条件に適合した文字プリミティブを抽
出することができるので2部分列を用いた作業を行うた
めの当該部分列の抽出処理を自動化でき1作業の効率を
大幅に向上できる。
【図面の簡単な説明】
第1図は本発明の原理構成図。 第2図は本発明の作用説明図 第3図は実施例構成図。 第4図は文字プリミティブ説明図 第5図は抽出条件判別列説明図。 第6図は格納状態説明図9 第7図は抽出処理説明図。 第8図は分割処理フロー 第9図は生成処理フロー 第10図は判別格納処理フロー 第11図は抽出処理フロー 1は処理装置、2は分剖部53は属性判別部4は抽出条
件生成部、5は抽出部、6は配列型格納領域、7は読取
り装置、8は出力装置である。 特許出願人  株式会社ビーエフニー 代理人 弁理士 長谷用 交情(外2名)本 発 明 の 作 用 説 明 図 第 図 実 施例橋成 第3図 図 生成処理フロ 第 9 図(その1) 住 成 処 理 フ ロ 第 図(その2) 生成処理フロ 第 9 区(その3) 生成処理フロ 第 9 図(その4) 1別格納処理フロー 第10図 抽  出  処 第11 理  フ  ロ 図(その1) 抽出処 第11 1!  フ  ロ 図(その2)

Claims (2)

    【特許請求の範囲】
  1. (1)入力文字列を文字プリミティブ列に分割する分割
    部(2)と、 前記文字プリミティブ列の属性を判別する属性判別部(
    3)と、 抽出条件から抽出条件判別列を生成する抽出条件生成部
    (4)と、 前記抽出条件に適合した前記文字プリミティブ列を抽出
    する抽出部(5)と、 前記属性を所定の順に格納する配列型格納領域(6)と
    を備え、 前記属性判別部(3)が、前記属性を前記配列型格納領
    域(6)に前記所定の順に格納し、前記抽出部(5)が
    、前記配列型格納領域(6)に格納された内容と前記抽
    出条件判別列とを比較することにより、前記抽出を行な
    う ことを特徴とする文字列の部分列抽出処理方式。
  2. (2)前記入力文字列及び抽出条件を、読取り装置(7
    )で読取る ことを特徴とする請求項(1)記載の文字列の部分列抽
    出処理方式。
JP2280322A 1990-10-18 1990-10-18 文字列の部分列抽出処理方式 Pending JPH04153880A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP2280322A JPH04153880A (ja) 1990-10-18 1990-10-18 文字列の部分列抽出処理方式

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP2280322A JPH04153880A (ja) 1990-10-18 1990-10-18 文字列の部分列抽出処理方式

Publications (1)

Publication Number Publication Date
JPH04153880A true JPH04153880A (ja) 1992-05-27

Family

ID=17623386

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2280322A Pending JPH04153880A (ja) 1990-10-18 1990-10-18 文字列の部分列抽出処理方式

Country Status (1)

Country Link
JP (1) JPH04153880A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH06103329A (ja) * 1992-09-22 1994-04-15 Fujitsu Ltd データ入力方式

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH06103329A (ja) * 1992-09-22 1994-04-15 Fujitsu Ltd データ入力方式

Similar Documents

Publication Publication Date Title
JP2726568B2 (ja) 文字認識方法及び装置
US6470347B1 (en) Method, system, program, and data structure for a dense array storing character strings
US4775956A (en) Method and system for information storing and retrieval using word stems and derivative pattern codes representing familes of affixes
JP2783558B2 (ja) 要約生成方法および要約生成装置
US7046847B2 (en) Document processing method, system and medium
JPH02299068A (ja) 入力文字列からワードを分離する方法
CN113779218A (zh) 问答对构建方法、装置、计算机设备和存储介质
EP0241717A2 (en) Linguistic analysis method and apparatus
US20070179932A1 (en) Method for finding data, research engine and microprocessor therefor
JP2693914B2 (ja) 検索システム
US11361565B2 (en) Natural language processing (NLP) pipeline for automated attribute extraction
JP3531222B2 (ja) 類似文字列検索装置
JP3470930B2 (ja) 自然語解析方法及び装置
JPH05250416A (ja) データベースの登録・検索装置
JPS59736A (ja) 構文解析方式
JP3016040B2 (ja) 自然言語処理システム
JPH08115330A (ja) 類似文書検索方法および装置
EP0539965A2 (en) An electronic dictionary including a pointer file and a word information correction file
JP3022079B2 (ja) 全文データベースシステム
JP3548372B2 (ja) 文字認識装置
JP3093759B2 (ja) 日本語解析装置
JPH02148174A (ja) Ocrによる住所データベース検索装置
JPS62175863A (ja) 帳票処理装置
JP2575947B2 (ja) 文節切出し装置
JPH0554148B2 (ja)