JPH01194065A - 文書処理装置 - Google Patents

文書処理装置

Info

Publication number
JPH01194065A
JPH01194065A JP63017412A JP1741288A JPH01194065A JP H01194065 A JPH01194065 A JP H01194065A JP 63017412 A JP63017412 A JP 63017412A JP 1741288 A JP1741288 A JP 1741288A JP H01194065 A JPH01194065 A JP H01194065A
Authority
JP
Japan
Prior art keywords
code
character
string
character code
kana
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP63017412A
Other languages
English (en)
Inventor
Masami Hisagai
正己 久貝
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Canon Inc
Original Assignee
Canon Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Canon Inc filed Critical Canon Inc
Priority to JP63017412A priority Critical patent/JPH01194065A/ja
Publication of JPH01194065A publication Critical patent/JPH01194065A/ja
Pending legal-status Critical Current

Links

Classifications

    • Y02T10/52

Landscapes

  • Document Processing Apparatus (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [産業上の利用分野] 本発明は文書処理装置に関し、特に文字情報を扱うワー
ドプロセッサ、文書データベース、電子メールシステム
、テレックス等の文書処理装置に関する。
[従来の技術] この種の装置では、キー人力した文字コード列又はこれ
をかな混じり漢字に変換した文字コード列を文書メモリ
に記憶し、又は他の装置に伝送している。しかし、従来
は1文字につき欧文語では1バイト、日本語では2バイ
トのデータ量を必要としたので、文書データが増大する
につれてこれらの保存、伝送に支障を来たした。特に特
許情報、文献情報等を扱うデータベース等においては莫
大な記憶容量が必要になり、深刻な問題である。また回
線を使う電子メールシステム等においても回線コストの
大幅な増大を招いている。
[発明が解決しようとする問題点コ 本発明は上述した従来技術の欠点を除去するものであり
、その目的とする所は、文書情報を効率良く圧縮して記
憶し又は伝送する文書処理装置を提供することにある。
[問題点を解決するための手段] 本発明の文書処理装置は上記の目的を達成するために、
所定の文字コード列に一定ビット数のコードデータを対
応させたテーブルを格納している辞書回路と、入力され
た文字コード列を前記辞書回路に参照して対応するコー
ドデータを読み出すコード変換回路と、入力された文字
コード列のうち前記コード変換回路から読み出されたコ
ードデータで対応する文字コード列を置き替える編集回
路を備えることをその概要とする。
[作用コ かかる構成において、辞書回路は所定の文字コード列に
一定ビット数のコードデータを対応させたテ列プルを格
納しており、例えばキーボードからかな(カナ)文字コ
ード列が人力されると、該かな文字コード列は公知のか
な漢字変換によりかな混じり漢字の文字コード列に変換
される。
そして、コード変換回路はこの入力された文字コード列
、かな混じり漢字の文字コード列)を前記辞書回路に参
照して対応する一定ビット数のコードデータ(単語コー
ド)を読み出し、編集回路は入力された文字コード列の
うち前記コード変換回路から読み出されたコードデータ
で対応する文字コード列を置き替える。これにより、人
力の文書データは大幅に圧縮された形で記憶され、又は
伝送される。
[実施例の説明] 以下、添付図面に従って本発明による実施例を詳細に説
明する。
第1図は実施例の文書処理装置の機能ブロック図である
。尚、以下に説明する各機能ブロックはキーボード、C
PU、RAM及びROM等のハードウェア構成により実
現できるものである。
第1図において、1はキー人力部であり、例えば文書デ
ータを形成するためのかな(カナ)文字コード列を人力
し、該かな文字コード列を不図示のかな漢字変換回路に
よりかな混じり漢字の文字コード列に変換して出力する
。2は人力バッファであり、キー人力部1からのかな混
じり漢字の文字コード列を一時的に蓄える。3は人力ポ
インタであり、入力バッファ2中の注目文字(コード変
換しようとする先頭文字)のコードアドレスをポイント
する。4は文字列辞書部であり、例えば意味のある単語
を形成すような所定のかな、漢字及びかな混じり漢字の
文字コード列(単語)の夫々に一定ビット数のコードデ
ータ(単語コード)を対応させたテーブルを格納してい
る。
5はインデックステーブルであり、文字列辞書部4中の
所定のかな、漢字又はかな混じり漢字等の単語のアドレ
スをインデックスするためのテーブル情報を記憶してい
る。6は比較回路部であり、人力バッファ2中の注目文
字で始まる不定長の文字コード列に対して文字列辞書部
4中の前記注目文字で始まる複数単語の文字コード列(
単語グループ)を参照することにより、一致するものの
中で最長の単語を検出し、対応する単語コードを出力す
る。7はカウンタであり、文字列辞書部4の単語グルー
プを参照する際の相対アドレス情報を保持する。8は出
力バッファであり、比較回路部6出力の文書データを一
時的に蓄える。9は出力ポインタであり、出力バッファ
8へのデータ書込アドレスを保持、更新する。10は文
書格納部であり、出力バッファ8からの変換後の文書デ
ータを文書ファイルにして格納する。
第3図はインデックステーブル5と文字列辞書部4の関
係を説明する図である。図において、41は文字列辞書
部4の所定の文字コード列(単語)を格納しているエリ
アであり、この文字コード列は意味のある単語を登録の
単位として配列されている。例えば先頭文字が”文”の
単語グループには「文字」 「文字列」 「文字コード
」 「文字認識」等の単語が登録されている。これらの
単語は複数文字から成っており、例えば文字数が多くな
る順序で登録されており、かつ一般の文書に表われる頻
度の大のものである。本発明によればこれらを圧縮コー
ド化することで文書データの大幅な圧縮が期待できる。
42は文字コード列(単語)に対応する単語コードを格
納しているエリアであり、この単語コードは各単語に対
応して一意に定められている。単語コードは例えば2バ
イトから成るコードデータである。ところで、本実施例
のようにかな混じり漢字を入力とする場合は、一般にか
な混じり漢字のコード体系が2バイトより成ることから
このコード体系と上記単語コードのコード体系を区別し
なくてはならない。
そこで、本実施例では文字列のコード体系としてJIS
コードを採用するとすればそのMSBビットが常に“0
”となるので、単語コードのMSBビットを1”に選ぶ
ことにより識別可能となる。51はインデックステーブ
ル5の索引文字を格納しているエリアであり、例えばエ
リア41の単語群に対応してその先頭文字のみを記憶し
ている。52は文字列辞書部4の卑語の格納番地をポイ
ントする情報が格納されているエリアである。
第2図は実施例の文書データ作成処理手順のフローチャ
ートである。図において、ステップS1ではキー人力部
1からのかな混じり漢字コードデータを入力バッファ2
に取り込む。ステップS2では入力バッファ2の全コー
ドデータについて後述する変換処理を終了しているか否
かを判断し、終了していればステップS7に進み、出力
バッファ8の文書データを文書格納部10にはき出す。
また終了していなければステップS3に進み、比較回路
部6が、大力バッファ2の注目文字をキー文字としてイ
ンデックステーブル5を検索し、文字列辞書部4の対応
する先頭文字の単語グループの先頭アドレスを取り出し
、該単語グループの各単語により人力バッファ2の当該
文字コード列と比較をする。具体的に言うと以下の通り
である。
■インデックステーブル51中の注目文字と同一文字の
文字数nをカウントしてn−1をカランタフに格納する
■対応する単語グループ中のカウンタ7で修飾するアド
レスから単語を良み出し、この先頭文字と入力バッファ
2中の注目文字を合わせるようにして両者の一致有無を
調べる。
■一致すれば対応する単語コードを良み出して処理を出
る。
■一致しなければカウンタ7の内容がOか否かを調べ、
′0′ならミッシングフラグを立てて処理を出る。また
“O“でないならカランタフの内容から−1して上記■
に戻る。
ステップS4ではミッシングフラグがOFFか否かを調
べ、OFFならステップS5に進み、入力ポインタ3を
当該単語の文字数に相当する分(文字数×2バイト)だ
け更新し、出力ポインタ8で指す位置に当該単語の単語
コードを書きこむ。またOFFでない時は人力ポインタ
3の内容を1文字分(2バイト分)更新し、当該注目文
字の文字コード(2バイト)をそのまま出力ポインタ9
の指す番地に格納する。
第4図は実施例の入力バッファ2と出力バッファ8の各
内容を対比して示す図である。図において、入力バッフ
ァ2中の“文字コード”は単語コード「A3」に変換さ
れる。即ち、最初の注目文字は“文”であるから、対応
する単語グループの文字数の大きい「文字認識」と比較
されるが、一致しない。次に「文字コード」と比較され
て−致し、単語コード「A3」に置き替えられる。
次の注目文字は“を“であるが、これはインデックステ
ーブル5に無い。又は文字列辞書部4に無い。従って、
そのまま出力バッファ8に書き込まれる。以下同様にし
て”順次”は「B2」に、“人力”は「C1」に変換さ
れる。ここで、“入力する”が「入力装置」に変換され
ないことは明らかである。従って“する”は「B2」に
、“手段“は「El」に変換される。この例では入力の
かな混じり漢字の文書データ(56バイト分)が出力の
文書データ(22バイト分)に圧縮(1/2以下)され
ている。
尚、こうして変換した文書データをもとの文字コード列
に復元するには、逆に単語コードで索引して対応する文
字コード列を生成するようなテーブルを用意すれば良い
[他の実施例] 第5図は他の実施例を示す機能ブロック図である。この
実施例は通常のカナ漢字変換に本発明による単語コード
変換機能を追加して、カナ漢字変換と単語コード変換を
同時に行うものである。
図において、101はキー人力部であり、キー打鍵によ
り日本語の読みをローマ字又はカナ文字で入力してカナ
コードを出力する。102は入力バッファであり、キー
人力部101から出力されるカナ文字コードの列を一時
的に蓄える。103はカナ卑語変換辞書であり、所定の
漢字の読みカナに単語コードを対応づけたテーブルを格
納している0例えばこのカナ卑語変換辞書103は漢字
の読みカナの人力に対して、変換結果が1文字の漢字に
相当するような場合には通常の漢字の文字コードが対応
しており、2文字以上の所定の漢字(単語)に相当する
場合は通常の漢字コードの代りに直接単語コードが対応
づけられているものである。104はカナ卑語変換部で
あり、カナ卑語変換辞書103を使用してカタカナはひ
らがな又は漢字に、かつ所定の単語漢字は対応する単語
コードに差し替えられる。105は出力バッファであり
変換後の文書データを一時的に蓄える。この実施例によ
れば、更に高速、かつ高能率の変換が行える。
[発明の効果] 以上述べた如く本発明によれば、連続した文字コード列
からなるデータを効率的に圧縮符号化することが可能で
あり、これによりデータの保存効率が向上し、あるいは
データの転送時間の短縮と回線利用コストの削減ができ
る。
【図面の簡単な説明】 第1図は実施例の文書処理装置の機能ブロック図、 第2図は実施例の文書データ作成処理手順のフローチャ
ート、 第3図はインデックステーブル5と文字列辞書部4の関
係を説明する図、 第4図は実施例の入力バッファ2と出力バッファ8の各
内容を対比して示す図、 第5図は他の実施例を示す機能ブロック図である。 図中、1・・・キー人力部、2・・・入力バッファ、3
・・・入力ポインタ、4・・・文字列辞書部、5・・・
インデックステーブル、6・・・比較回路部、7・・・
カウンタ、8・・・出力バッファ、9・・・出力ポイン
タ、10・・・文書格納部、101・・・キー人力部、
102・・・人力バッファ、103・・・カナ漢字変換
辞書、104・・・カナ漢字変換部、105・・・出力
バッファである。

Claims (1)

  1. 【特許請求の範囲】  所定の文字コード列に一定ビット数のコードデータを
    対応させたテーブルを格納している辞書回路と、 入力された文字コード列を前記辞書回路を参照して対応
    するコードデータを読み出すコード変換回路と、 入力された文字コード列のうち前記コード変換回路から
    読み出されたコードデータで対応する文字コード列を置
    き替える編集回路を備えることを特徴とする文書処理装
    置。
JP63017412A 1988-01-29 1988-01-29 文書処理装置 Pending JPH01194065A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP63017412A JPH01194065A (ja) 1988-01-29 1988-01-29 文書処理装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP63017412A JPH01194065A (ja) 1988-01-29 1988-01-29 文書処理装置

Publications (1)

Publication Number Publication Date
JPH01194065A true JPH01194065A (ja) 1989-08-04

Family

ID=11943293

Family Applications (1)

Application Number Title Priority Date Filing Date
JP63017412A Pending JPH01194065A (ja) 1988-01-29 1988-01-29 文書処理装置

Country Status (1)

Country Link
JP (1) JPH01194065A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH07191972A (ja) * 1991-11-20 1995-07-28 Sharp Corp 文章圧縮方法

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH07191972A (ja) * 1991-11-20 1995-07-28 Sharp Corp 文章圧縮方法

Similar Documents

Publication Publication Date Title
EP0083393B1 (en) Method of compressing information and an apparatus for compressing english text
EP0294950B1 (en) A method of facilitating computer sorting
JP3234104B2 (ja) 圧縮データをサーチする方法及びシステム
US5325091A (en) Text-compression technique using frequency-ordered array of word-number mappers
US5721899A (en) Retrieval apparatus using compressed trie node and retrieval method thereof
EP0293161B1 (en) Character processing system with spelling check function
GB2057821A (en) Communication method and system
WO1985001814A1 (en) Method and apparatus for data compression
US5560037A (en) Compact hyphenation point data
JP2018018174A (ja) 符号化プログラム、符号化装置、符号化方法、及び検索方法
US5225833A (en) Character encoding
US5815096A (en) Method for compressing sequential data into compression symbols using double-indirect indexing into a dictionary data structure
Witten et al. Models for compression in full-text retrieval systems
JPH01194065A (ja) 文書処理装置
JP2729416B2 (ja) テキストデータの復元方法
US6731229B2 (en) Method to reduce storage requirements when storing semi-redundant information in a database
JPH07287716A (ja) 辞書検索装置
JPH0546358A (ja) テキストデータの圧縮方法
JPH0554077A (ja) 単語辞書検索装置
WO1996011442A1 (en) Character information processing method and apparatus for the same
JPS6268325A (ja) 文章圧縮・伸展方式
JPH0140372B2 (ja)
JPH07182354A (ja) 電子文書の作成方法
JPS6246029B2 (ja)
JPH0140370B2 (ja)

Legal Events

Date Code Title Description
A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20050422

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Effective date: 20050517

Free format text: JAPANESE INTERMEDIATE CODE: A01

A61 First payment of annual fees (during grant procedure)

Effective date: 20050525

Free format text: JAPANESE INTERMEDIATE CODE: A61

R150 Certificate of patent (=grant) or registration of utility model

Free format text: JAPANESE INTERMEDIATE CODE: R150

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20080603

Year of fee payment: 3

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090603

Year of fee payment: 4

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090603

Year of fee payment: 4

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100603

Year of fee payment: 5

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20110603

Year of fee payment: 6

FPAY Renewal fee payment (prs date is renewal date of database)

Year of fee payment: 6

Free format text: PAYMENT UNTIL: 20110603

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20130603

Year of fee payment: 8

FPAY Renewal fee payment (prs date is renewal date of database)

Free format text: PAYMENT UNTIL: 20130603

Year of fee payment: 8

FPAY Renewal fee payment (prs date is renewal date of database)

Year of fee payment: 9

Free format text: PAYMENT UNTIL: 20140603