JPH01194065A - 文書処理装置 - Google Patents
文書処理装置Info
- Publication number
- JPH01194065A JPH01194065A JP63017412A JP1741288A JPH01194065A JP H01194065 A JPH01194065 A JP H01194065A JP 63017412 A JP63017412 A JP 63017412A JP 1741288 A JP1741288 A JP 1741288A JP H01194065 A JPH01194065 A JP H01194065A
- Authority
- JP
- Japan
- Prior art keywords
- code
- character
- string
- character code
- kana
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- Y02T10/52—
Landscapes
- Document Processing Apparatus (AREA)
Abstract
め要約のデータは記録されません。
Description
ドプロセッサ、文書データベース、電子メールシステム
、テレックス等の文書処理装置に関する。
をかな混じり漢字に変換した文字コード列を文書メモリ
に記憶し、又は他の装置に伝送している。しかし、従来
は1文字につき欧文語では1バイト、日本語では2バイ
トのデータ量を必要としたので、文書データが増大する
につれてこれらの保存、伝送に支障を来たした。特に特
許情報、文献情報等を扱うデータベース等においては莫
大な記憶容量が必要になり、深刻な問題である。また回
線を使う電子メールシステム等においても回線コストの
大幅な増大を招いている。
、その目的とする所は、文書情報を効率良く圧縮して記
憶し又は伝送する文書処理装置を提供することにある。
所定の文字コード列に一定ビット数のコードデータを対
応させたテーブルを格納している辞書回路と、入力され
た文字コード列を前記辞書回路に参照して対応するコー
ドデータを読み出すコード変換回路と、入力された文字
コード列のうち前記コード変換回路から読み出されたコ
ードデータで対応する文字コード列を置き替える編集回
路を備えることをその概要とする。
一定ビット数のコードデータを対応させたテ列プルを格
納しており、例えばキーボードからかな(カナ)文字コ
ード列が人力されると、該かな文字コード列は公知のか
な漢字変換によりかな混じり漢字の文字コード列に変換
される。
、かな混じり漢字の文字コード列)を前記辞書回路に参
照して対応する一定ビット数のコードデータ(単語コー
ド)を読み出し、編集回路は入力された文字コード列の
うち前記コード変換回路から読み出されたコードデータ
で対応する文字コード列を置き替える。これにより、人
力の文書データは大幅に圧縮された形で記憶され、又は
伝送される。
明する。
。尚、以下に説明する各機能ブロックはキーボード、C
PU、RAM及びROM等のハードウェア構成により実
現できるものである。
ータを形成するためのかな(カナ)文字コード列を人力
し、該かな文字コード列を不図示のかな漢字変換回路に
よりかな混じり漢字の文字コード列に変換して出力する
。2は人力バッファであり、キー人力部1からのかな混
じり漢字の文字コード列を一時的に蓄える。3は人力ポ
インタであり、入力バッファ2中の注目文字(コード変
換しようとする先頭文字)のコードアドレスをポイント
する。4は文字列辞書部であり、例えば意味のある単語
を形成すような所定のかな、漢字及びかな混じり漢字の
文字コード列(単語)の夫々に一定ビット数のコードデ
ータ(単語コード)を対応させたテーブルを格納してい
る。
所定のかな、漢字又はかな混じり漢字等の単語のアドレ
スをインデックスするためのテーブル情報を記憶してい
る。6は比較回路部であり、人力バッファ2中の注目文
字で始まる不定長の文字コード列に対して文字列辞書部
4中の前記注目文字で始まる複数単語の文字コード列(
単語グループ)を参照することにより、一致するものの
中で最長の単語を検出し、対応する単語コードを出力す
る。7はカウンタであり、文字列辞書部4の単語グルー
プを参照する際の相対アドレス情報を保持する。8は出
力バッファであり、比較回路部6出力の文書データを一
時的に蓄える。9は出力ポインタであり、出力バッファ
8へのデータ書込アドレスを保持、更新する。10は文
書格納部であり、出力バッファ8からの変換後の文書デ
ータを文書ファイルにして格納する。
係を説明する図である。図において、41は文字列辞書
部4の所定の文字コード列(単語)を格納しているエリ
アであり、この文字コード列は意味のある単語を登録の
単位として配列されている。例えば先頭文字が”文”の
単語グループには「文字」 「文字列」 「文字コード
」 「文字認識」等の単語が登録されている。これらの
単語は複数文字から成っており、例えば文字数が多くな
る順序で登録されており、かつ一般の文書に表われる頻
度の大のものである。本発明によればこれらを圧縮コー
ド化することで文書データの大幅な圧縮が期待できる。
納しているエリアであり、この単語コードは各単語に対
応して一意に定められている。単語コードは例えば2バ
イトから成るコードデータである。ところで、本実施例
のようにかな混じり漢字を入力とする場合は、一般にか
な混じり漢字のコード体系が2バイトより成ることから
このコード体系と上記単語コードのコード体系を区別し
なくてはならない。
コードを採用するとすればそのMSBビットが常に“0
”となるので、単語コードのMSBビットを1”に選ぶ
ことにより識別可能となる。51はインデックステーブ
ル5の索引文字を格納しているエリアであり、例えばエ
リア41の単語群に対応してその先頭文字のみを記憶し
ている。52は文字列辞書部4の卑語の格納番地をポイ
ントする情報が格納されているエリアである。
ートである。図において、ステップS1ではキー人力部
1からのかな混じり漢字コードデータを入力バッファ2
に取り込む。ステップS2では入力バッファ2の全コー
ドデータについて後述する変換処理を終了しているか否
かを判断し、終了していればステップS7に進み、出力
バッファ8の文書データを文書格納部10にはき出す。
部6が、大力バッファ2の注目文字をキー文字としてイ
ンデックステーブル5を検索し、文字列辞書部4の対応
する先頭文字の単語グループの先頭アドレスを取り出し
、該単語グループの各単語により人力バッファ2の当該
文字コード列と比較をする。具体的に言うと以下の通り
である。
文字数nをカウントしてn−1をカランタフに格納する
。
レスから単語を良み出し、この先頭文字と入力バッファ
2中の注目文字を合わせるようにして両者の一致有無を
調べる。
る。
′0′ならミッシングフラグを立てて処理を出る。また
“O“でないならカランタフの内容から−1して上記■
に戻る。
べ、OFFならステップS5に進み、入力ポインタ3を
当該単語の文字数に相当する分(文字数×2バイト)だ
け更新し、出力ポインタ8で指す位置に当該単語の単語
コードを書きこむ。またOFFでない時は人力ポインタ
3の内容を1文字分(2バイト分)更新し、当該注目文
字の文字コード(2バイト)をそのまま出力ポインタ9
の指す番地に格納する。
内容を対比して示す図である。図において、入力バッフ
ァ2中の“文字コード”は単語コード「A3」に変換さ
れる。即ち、最初の注目文字は“文”であるから、対応
する単語グループの文字数の大きい「文字認識」と比較
されるが、一致しない。次に「文字コード」と比較され
て−致し、単語コード「A3」に置き替えられる。
ーブル5に無い。又は文字列辞書部4に無い。従って、
そのまま出力バッファ8に書き込まれる。以下同様にし
て”順次”は「B2」に、“人力”は「C1」に変換さ
れる。ここで、“入力する”が「入力装置」に変換され
ないことは明らかである。従って“する”は「B2」に
、“手段“は「El」に変換される。この例では入力の
かな混じり漢字の文書データ(56バイト分)が出力の
文書データ(22バイト分)に圧縮(1/2以下)され
ている。
に復元するには、逆に単語コードで索引して対応する文
字コード列を生成するようなテーブルを用意すれば良い
。
実施例は通常のカナ漢字変換に本発明による単語コード
変換機能を追加して、カナ漢字変換と単語コード変換を
同時に行うものである。
り日本語の読みをローマ字又はカナ文字で入力してカナ
コードを出力する。102は入力バッファであり、キー
人力部101から出力されるカナ文字コードの列を一時
的に蓄える。103はカナ卑語変換辞書であり、所定の
漢字の読みカナに単語コードを対応づけたテーブルを格
納している0例えばこのカナ卑語変換辞書103は漢字
の読みカナの人力に対して、変換結果が1文字の漢字に
相当するような場合には通常の漢字の文字コードが対応
しており、2文字以上の所定の漢字(単語)に相当する
場合は通常の漢字コードの代りに直接単語コードが対応
づけられているものである。104はカナ卑語変換部で
あり、カナ卑語変換辞書103を使用してカタカナはひ
らがな又は漢字に、かつ所定の単語漢字は対応する単語
コードに差し替えられる。105は出力バッファであり
変換後の文書データを一時的に蓄える。この実施例によ
れば、更に高速、かつ高能率の変換が行える。
からなるデータを効率的に圧縮符号化することが可能で
あり、これによりデータの保存効率が向上し、あるいは
データの転送時間の短縮と回線利用コストの削減ができ
る。
ート、 第3図はインデックステーブル5と文字列辞書部4の関
係を説明する図、 第4図は実施例の入力バッファ2と出力バッファ8の各
内容を対比して示す図、 第5図は他の実施例を示す機能ブロック図である。 図中、1・・・キー人力部、2・・・入力バッファ、3
・・・入力ポインタ、4・・・文字列辞書部、5・・・
インデックステーブル、6・・・比較回路部、7・・・
カウンタ、8・・・出力バッファ、9・・・出力ポイン
タ、10・・・文書格納部、101・・・キー人力部、
102・・・人力バッファ、103・・・カナ漢字変換
辞書、104・・・カナ漢字変換部、105・・・出力
バッファである。
Claims (1)
- 【特許請求の範囲】 所定の文字コード列に一定ビット数のコードデータを
対応させたテーブルを格納している辞書回路と、 入力された文字コード列を前記辞書回路を参照して対応
するコードデータを読み出すコード変換回路と、 入力された文字コード列のうち前記コード変換回路から
読み出されたコードデータで対応する文字コード列を置
き替える編集回路を備えることを特徴とする文書処理装
置。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP63017412A JPH01194065A (ja) | 1988-01-29 | 1988-01-29 | 文書処理装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP63017412A JPH01194065A (ja) | 1988-01-29 | 1988-01-29 | 文書処理装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH01194065A true JPH01194065A (ja) | 1989-08-04 |
Family
ID=11943293
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP63017412A Pending JPH01194065A (ja) | 1988-01-29 | 1988-01-29 | 文書処理装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH01194065A (ja) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH07191972A (ja) * | 1991-11-20 | 1995-07-28 | Sharp Corp | 文章圧縮方法 |
-
1988
- 1988-01-29 JP JP63017412A patent/JPH01194065A/ja active Pending
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH07191972A (ja) * | 1991-11-20 | 1995-07-28 | Sharp Corp | 文章圧縮方法 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP0083393B1 (en) | Method of compressing information and an apparatus for compressing english text | |
| EP0294950B1 (en) | A method of facilitating computer sorting | |
| JP3234104B2 (ja) | 圧縮データをサーチする方法及びシステム | |
| US5325091A (en) | Text-compression technique using frequency-ordered array of word-number mappers | |
| US5721899A (en) | Retrieval apparatus using compressed trie node and retrieval method thereof | |
| EP0293161B1 (en) | Character processing system with spelling check function | |
| GB2057821A (en) | Communication method and system | |
| WO1985001814A1 (en) | Method and apparatus for data compression | |
| US5560037A (en) | Compact hyphenation point data | |
| JP2018018174A (ja) | 符号化プログラム、符号化装置、符号化方法、及び検索方法 | |
| US5225833A (en) | Character encoding | |
| US5815096A (en) | Method for compressing sequential data into compression symbols using double-indirect indexing into a dictionary data structure | |
| Witten et al. | Models for compression in full-text retrieval systems | |
| JPH01194065A (ja) | 文書処理装置 | |
| JP2729416B2 (ja) | テキストデータの復元方法 | |
| US6731229B2 (en) | Method to reduce storage requirements when storing semi-redundant information in a database | |
| JPH07287716A (ja) | 辞書検索装置 | |
| JPH0546358A (ja) | テキストデータの圧縮方法 | |
| JPH0554077A (ja) | 単語辞書検索装置 | |
| WO1996011442A1 (en) | Character information processing method and apparatus for the same | |
| JPS6268325A (ja) | 文章圧縮・伸展方式 | |
| JPH0140372B2 (ja) | ||
| JPH07182354A (ja) | 電子文書の作成方法 | |
| JPS6246029B2 (ja) | ||
| JPH0140370B2 (ja) |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A977 | Report on retrieval |
Free format text: JAPANESE INTERMEDIATE CODE: A971007 Effective date: 20050422 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Effective date: 20050517 Free format text: JAPANESE INTERMEDIATE CODE: A01 |
|
| A61 | First payment of annual fees (during grant procedure) |
Effective date: 20050525 Free format text: JAPANESE INTERMEDIATE CODE: A61 |
|
| R150 | Certificate of patent (=grant) or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20080603 Year of fee payment: 3 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20090603 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20090603 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20100603 Year of fee payment: 5 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20110603 Year of fee payment: 6 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Year of fee payment: 6 Free format text: PAYMENT UNTIL: 20110603 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20130603 Year of fee payment: 8 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20130603 Year of fee payment: 8 |
|
| FPAY | Renewal fee payment (prs date is renewal date of database) |
Year of fee payment: 9 Free format text: PAYMENT UNTIL: 20140603 |