JPS5965344A - 単語検索装置 - Google Patents

単語検索装置

Info

Publication number
JPS5965344A
JPS5965344A JP57175114A JP17511482A JPS5965344A JP S5965344 A JPS5965344 A JP S5965344A JP 57175114 A JP57175114 A JP 57175114A JP 17511482 A JP17511482 A JP 17511482A JP S5965344 A JPS5965344 A JP S5965344A
Authority
JP
Japan
Prior art keywords
word
information
character string
character
unit
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP57175114A
Other languages
English (en)
Inventor
Makoto Tatebayashi
誠 館林
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Priority to JP57175114A priority Critical patent/JPS5965344A/ja
Publication of JPS5965344A publication Critical patent/JPS5965344A/ja
Pending legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/01—Input arrangements or combined input and output arrangements for interaction between user and computer
    • G06F3/018—Input/output arrangements for oriental characters

Landscapes

  • Engineering & Computer Science (AREA)
  • General Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Document Processing Apparatus (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 産業上の利用分野 本発明はカナによシ入力された日本語文章を漢字仮名混
じ9表記に変換する仮名漢字変換装置や、同じくカナに
より入力された日本語文章を外国語文章に翻訳する機械
翻訳装置などに組み込んで用いる単語検索装置に関する
ものである。
従来例の構成とその問題点 近年1日本語情報処理技術の一環としてカナ漢字変換装
置や機械翻訳装置などが盛んに開発されている。入力さ
れた日本語文章を他の形、態へ変換するこれらの変換装
置が実用に耐えうる能力全発揮するためには、極めて多
数の日本語の単語について、その漢字表記や外国語表記
や文法情報を記載した単語記憶装置中有することが必安
である。
さらに、上記のような変換装置が実用に酬えうる処理速
度で動作しうるためには、上記単語記憶装置内の単語を
極めて高速に検索しうる単π11検索装置を有すること
が必要となる。
現在、半導体技術の進歩により、従来は経済面で非現実
的であ−)た半導体メモリによる単語記憶装置の実現が
可能となりつつある。しかし、依然として半導体メモリ
が高価であることに変わりはなく、制限された容量の記
憶媒体の内に可能な限り大量の単語情報を格納し、これ
を高速に検索する単語検索装置を実現するために数多く
の考案がなされている。
以下、たとえばカナ漢字変換用単語検索装置を例にとり
、これまでに成されたいくつかの考案について述べる。
まずその1つとして、従来の装置は日本語の単語の単語
読み情報と、漢字表記その他の情報とを対応して記憶さ
せているに対し、たとえば同一の単語読み情報をもつ単
語(いわゆる同音語)については代表のレコードのみに
単語読み情報を記憶し、他のものは代表のレコードから
容易に指示されるような単語格納の様態にすることによ
り、同音語の単語読み情報を格納不要にする装置が考案
されている。
さらに他のものとしては、単語読み情報を示すコードと
して日本工業規格C6220に定めるコードではなく、
日本語の文字の発生頻度全考慮し、単語読み情報をでき
るたけ少ないコード数で表現しようというものがある。
例えば、「ガ」「バ」等の濁音、半濁音や、「キヤ」「
ジー」等の拘置を1バイトのコードに対応させたコード
体系によって単語読み情報を表現すれば、前記日本工業
規格06220に定める仮名コードを用いた場合に比べ
て幾分かの容量圧縮が実現される。
しかしながら、実用化レベルの単語数(約3万語り、」
二と言われる)を有する単語記憶装置全半導体メモリ等
の高速記憶媒体上に実装するためには、容量および経済
性の面で従来のものではまたまた不十分なものであった
。
発明の目的 本発明は従来の単語検索装置が有していた上記問題点全
改善するためになされたものであり、単語読み情報の格
納・探索方法に改良を加え、従来より高い格納効率を有
する単語検索装置全提供するものである。
発明の構成 本発明は、多数の日本語の単語の読み情ylQと漢字情
報等の属性情報とを記憶している単語記憶装置と、入力
された仮名読みを有する前記単1:lii記憶装置中の
単語全検索する単語読み検索部とを設け、前記単語記憶
装置中の単語の読み情報として、単語の仮名読みに対応
したコード化を行なった後に前記コードの先頭の2文字
をコードの順に置換したコードに変換すると共に、置換
したかjfか企示す正逆情報を各単語に付随して記憶さ
せ、入力仮名列に一致する単語全検索する際にも同様の
コード変換を行なって検索するようにしたことにより、
通常と同様の検索手順で単語検索ができる一方で前記単
語記憶装置中に従来より多量の単語を格納することを可
能にするものである。
実施例の説明 以下本発明の一実施例について図面を参照しながら説明
する。
第1図は本発明の一実施例における単語検索装置のブロ
ック図である。同図において1は第1の文字列入力装置
である。ここで第1の文字とは日本語の仮名文字に対応
して定められたコードで、例えば1」本工業規格062
20に定めるものである。2は第1の文字列一時記憶部
で、上記第1の文字列入力装置1より入力された第1の
文字列C151を一時記憶する。3は第1の文字変換部
で、第1の文字列一時記憶部2に一時記憶されている第
1の文字列C81を、これに対応する第2の文字列C3
2に変換する。ここで第2の文字とけ前記憶1の文字か
らなる長さn(n〉1)の系列に一対一対応して定めら
れたコードである。4は第2の文字変換部で、第1の文
字変換部3の出力である第2の文字列C82のうち先頭
の2文字のコードの大小を判別し、その判別結果(正逆
情報)Di1/Q信号として出力すると共に、前記第2
の文字列C82のうち先頭の2文字たけ全コードの小さ
い順に並べ直した系列(第3の文字列)C33を出力す
る。5は単語読み情報検索)7I3で、第3の文字列C
83に一致する単語読み情報を有している後述の単語記
憶部内の単語を検索しそのアドレスAD(z出力する。
6は単語記憶部で、日本語の単語Mの単語読み情報や漢
字表記や品詞等を次に述べる所定の規則で記憶している
ものである。
第2図は上述した単語記憶部6に格納されている単語読
み情報TYの単語W1、および単語W1と同一の単語読
み情報TYを有する単語W2の記憶状態を示す図である
。同図において、7は単語W1の単語読み情報で、単語
W1の単語読みが第30文字列によってコード化されて
格納されている。8は単語w1の単語読みの正逆情報で
、単語W1の単語読みを第2の文字列で表わしたとき、
先頭の文字コードが21目の文字コードより小さいか又
はそれ以外かをそれぞれ0.1で表わしている。9は前
記単語W1の漢字情報や品詞情報などの単語属性情報で
ある。10は前記単語W1の火車語情牧で、前記単語W
1と同一の単語読み情報を持つ単語W2のアドレスを示
している。
なお11,12.13はそれぞれ単語W2の単語読み正
逆情報、単語属性情報および火車語情報である。
第1図の14は正逆情報判定部で、第2の文字変換部4
より通知さ扛る第2の文字列O32の正逆情報りと、単
語記憶部6の単語のうち読み情報検索部4が検索したア
ドレスADの単語の正逆情報DMとを比較する。そして
、前記正逆情報りとDMとが一致する場合には単語Mの
単語属性情報を後述する出力部へ転送する。一方、正逆
情報りとDMとが異なる場合には、正逆情報判定部14
はこの旨の信号をアドレスADと共に火車語検索F4[
!15に対して通知する。この信号を受けた火車語検索
:1115は、単語W1と同じ単語読み情報を持ち、単
語W1の火車語情報10で示されるアドレスに格納され
ている単語〜f2のアドレスAD2を求め、これ全正逆
情報DM1と共に正逆情報判定部14に対して送出する
。16は出力部で、読み情報検索部5と正逆情報判定部
14とによって確定された単語の単語属性情報を一時記
憶する。
この単語属性情報は、本実施例において単語検索装置の
出力として利用されるものである。
以上のように構成された単語検索装置(以下本装置と呼
ぶ)の一実施例の動作について、第3図のフローチャー
トに従って説明する。
(イ)第1の文字列入力装置1から日本語のJll詔の
読みを示す第1の文字列G S 1 f、1人力し、C
れを第1の文字列一時記憶部2に格納した陵(ロ)に行
く。
(ロ)第1の文字変換部3は第1の文字列一時記憶14
182に格納さしている第1の文字列G S 11.1
取り出して、第4図に示すよう2!i:変換規則を用い
ることにより第2の文字列cs2に変換する。
但し、変換は第1の文字列の先頭より順に、最も長い部
分列に対しで行なうものとする。この後0号に行く。
ヒJ 第2の文字変換部4は第2の文字変換部3の出力
である第2の文字列082のうち先頭の文字C82〔1
〕と2番目の文字C82〔2〕の大小を比較する。1番
目の文字C82〔1〕が2番目の文字よりも大きい時は
に)へ、そうでない時は(ホ)へ進む。
(Z+  第2の文字変換84は第2の文字列O32と
は先頭の2文字の順序が逆で、残りは第2の文字列C3
2と同一の第3の文字列cs36作成する一方、正逆情
報りに「1」を設定する。この後(へ)へ進む。
U→ 第2の文字変換部4は第2の文字列cs22その
まま第3の文字列aSSとして作成する一方、正逆情報
に「0」を設定する。この後(刑へ進む。
(1単語読み情報検索部5は第2の文字変換■114の
出力である第3の文字列C83に一致する単vLi読み
情報全有する単語記憶部6内の単語を検索する。検索は
二分検索法又は順次検索lh等の公知の技術を用いて行
なう。
(ト)検索が成功した場合は、単語読み情報検索部5は
検索した単語WのアドレスA D f、1出力した後(
flへ進む。検索が失敗した場合には(〕→へ進む。
(チ 正逆情報判定部14は単語記憶部6中のアドレス
ADの単語の単語正逆情報DM8と、第2の文字変換部
4の出力である正逆情報りとを比較する。両者が一致す
るとき(ヲ)へ進む。両名が異なるとき凹へ進む。
(1力  正逆情報判定部14は現単記のアドレスAD
と共に起動信号を火車語検索部13に苅して送出する。
この信号を受けた火車語検索都15は単語記憶部6のア
ドレスADに格納さ扛ている単語の火車語情報10を検
査することにより、現単語と同一の単語読み情報を持つ
単語W1のイ(無f;C=べる。この結果、上記単語W
1が存在する場合には乞)へ進む。存在しない場合には
(ノリへ進む。
(ヌ)火車語検索部15は単語W1の単語記憶部6中の
アドレスAD(i−正逆情報判定部14に対して送出す
る。この後(チに進む。
(ノリ 本装置は検索が失敗した旨の信号を出力して動
作全終了する。
(ヲ) 出力部16は前記アドレスADの単語の単語属
性情報を取り出し、出力部16内に一時記憶する。この
後本装置は検索が成功した旨の信号全出力して動作を終
了する。(第3図(ワ))以上、第3図のフローチャー
トを用いて本装置の動作全説明したが、次には本装置の
さらに具体的な動作例について説明する。
(イ)第1の文字列入力装置1より「シカ/」という単
語読みに対応する第1の文字列「3C6d3b3e」が
取り込まれ、これが第1の文字列一時記憶部2に記憶さ
れているものとする。
(曵33図(イ)) ここで各数字は16進数である。以下、第2の文字、第
3の文字共に16進数2桁で表現するものとする。
(ロ)第1の文字変換部3は第4図に示すような変換規
則に従って第1の文字列031を第2の文字列032に
変換する。変換は入力された第1の文字列の先頭部より
順次に行なう。この結果筒2の文字列OS2として「3
118」が得られる。ここで先頭の文字C82〔1〕は
「ジ」、2番目の文字cs2c2〕は「カン」に対応す
るものである。(第3図(ロ)) (/埼  第2の文字変換部4は前記第2の文字列C8
2の先頭の文字C82[11]と2番目の文字CS2〔
2〕の大小を比較する。今の場合、c S 2COは3
1であジ、O32〔2:lは18であって、C82〔1
〕〉C82〔2〕であることを判定する。(第3図e→
) に))第2の文字変換部4は第2の文字列032のうち
先頭の2文字の順序だけが逆で、残りは前記第2の文字
列と同じである、第3の文字列「1831 ]を作成す
る。さらに正逆情、i14 Dに「1」を設定する。(
第3図に)) 田)単語読み情報検索部5は前記第3の文字列「183
1」 (これは「カンタ」という単語読み情報に対応す
る)とゝ一致する単語読み情報を肩する単語記憶部5内
の単語を検索する。(第3図(へ)) (へ)第6図に単語記憶部6内の単語の記憶状態の一例
を示す。この例においては前記第3の文字列「カンタ」
(以下便宜上、このように単語読み情報で示すものとす
る)はアドレス#0OOGの「アイ」、次いでアドレス
#0010の「アカ」のように順番に一致するか否か7
5玉判定される。そしてアドレス#1000の「カンタ
」と比較されfc時点で一致していることが判定される
。(第3図(ト)) (ト)正逆情報判定部14は単語記憶部5のアドレス#
1000の単語読み情報「カンタ」の第1番口車語「幹
事」の正逆情報1)Ml ’i読み出す。
そしてこの値「φjと第2の文字変換部3に且己憶され
ている正逆情@Dの値「1」を比較し、この両者が異な
っていることを認める。(第3図チ)) チ)次−1+i詔検索部15は前記第1番口の’l” 
lli’、i r幹事」の火車語情報NX−1読み取り
、これが本単語の次の格納位置#1007に本単語と同
一の単語読み情報「カンジ」を有する単語が格納されて
いることを示していることを知る。(第3図(男) (男 仄単語検索部15は火車語格納アドレス1110
07をアドレスADとして正逆情報判定部14に対して
送出する。(第3区内)(ヨ)正逆情報判定部14は単
語記憶部6中の前記アドレスA D 441007の単
語の単語正逆情報DMlIJを読み取ジ、これと第2の
文字変換部4の出力である正逆情報D「1」とを比較し
、この両者が一致していることを認める。(第3図(−
F−1) (ワ)出力部16は前記アドレスAD#1007の単語
の単語属性情報(「時間」という漢字コードおよび名詞
という文法情報)を一時記憶する。
この後本装置は検索が成功した旨の信号を出力して動作
を終了する。(第3図(ワ))以上のように、「ジカン
」なる単語を検索するにあたって、予め「シカゝン」を
第3の文字列、すなわち「カンジ」に相当する文字列に
変換するという過程を経るために、「カンジ」なる単語
と同一の単語読み情報を持つ単語として登録されている
1時間」という単語を容易に検索することができる。
すなわち本実施例によれば、「ジカン」なる単語と「カ
ンジ」なる単語を一種の「同音語」の扱いができるよう
に文字変換を行ない、片方の単語読み情報と正逆情報(
1ビツト)のみで他方の単語読み情報を表現することに
より、通常と同様のIf1語検索法を用いながら単語記
憶容量を削減することができる。
なお単語記憶容量の削減の効果をより顕著にするために
は第2の文字の選択が重要な問題となる。
第2の文字としては可能な限9日本語の単語の読みを短
かく表わすことが必要であると同時に、第2の文字列と
して表現されたとき、その第1番目の文字と第2@目の
文字の順番を入れ換えた文字列も又、別の日本語の単語
となっていることが望まれる。このためには第4図に示
したような、日本語中の漢字の音読みに対応した第2の
文字を用いることにより効果が得られることが明らかで
ある。
発明の効果 以上のように本発明は、多数の日本語の単語全記憶する
に際し、日本語の統計的特徴に合致した文字コードによ
って単語の読みを表現し、さらにその文字列のうち先頭
の2文字の順序が異なる文字列に対応する単語読みを有
する単語と前記単語の読み情報を共通化することにより
、単語検索処理に大巾な変更を加えることなく、単語記
憶容量を大巾に削減することができ、その価値は大なる
ものがある。
【図面の簡単な説明】 第1図は本発明の一実施例における単語検索装置のブロ
ック図、第2図は単語記憶部の単語の格納状態を示す説
明図、第3図は本発明の一実施例における単語検索装置
の勲作全示す70−テヤ−1−、g4図は単語の読みを
表わすための第1の文字と第2の文字の変換規則の一例
を示す図、第5Nは本発明の一実施例における単語記憶
部内の単語の格納状態を示す図である。 1・・・・・・第1の文字列入力装置、2・・・・・・
第1の文字列一時記憶部、3・・・・・・第1の文字変
換部、4・°・・・・第2の文字変換部、6・・・・・
・読み情報検索部、6・・・・・・単語記憶部、14・
・・・・・正逆情報判定部、15・・・・・・火車語検
索部。 代理人の氏名 弁理士 中 尾 敏 男 ほか1名第3
図 第4図 ス #σθσρ

Claims (1)

    【特許請求の範囲】
  1. 日本語の仮名に対応する第1の文字列の入力手段と、前
    記入力手段から入力された前記第1の文字列を一時記憶
    する一時記憶手段と、前記第1の文字列を前記第1の文
    字列と一対一対応する第2の文字列に変換する第1の文
    字変換部と、l1il記第2の文字、烈惚うち先頭の2
    文字のコードの大小を判別し、前記第2の文字列のうち
    先頭の2文字のみをコードの順に置換した第3の文字列
    、および置換したか否かを示す正逆情報を一時記憶手段
    −る第2の文字変換部と、日本語の単語の単語読みを前
    記第3の文字列と前記正逆情報とによって表現して記憶
    するとともに、前記単語に付随する漢字表記や品詞情報
    などの属性情報を記憶している単語記憶部と、前記一時
    記憶されている第3の文字列に一致する単語記憶部中の
    単語読み情報を検索する単語読み情報検索部と、前記検
    索された単語の正逆情報と前記一時記憶されている正逆
    情報との一致を判定する正逆情報判定部と、前記単語記
    憶部中で前記単語読み情報と同一の単語読み情報を有す
    る他の単語を検索すも次単語検索部とを具備し、入力さ
    れた前記第1の文字列に対応する単語読みを有する単語
    が、前記単語読み情報検索部又は前記次単語検索部が示
    す前記単語記憶部中の単語で、かつ、前記正逆情報が前
    記一時記憶された正逆情報と一致するか否かを検索する
    ことを特徴とする単語検索装置。
JP57175114A 1982-10-05 1982-10-05 単語検索装置 Pending JPS5965344A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP57175114A JPS5965344A (ja) 1982-10-05 1982-10-05 単語検索装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP57175114A JPS5965344A (ja) 1982-10-05 1982-10-05 単語検索装置

Publications (1)

Publication Number Publication Date
JPS5965344A true JPS5965344A (ja) 1984-04-13

Family

ID=15990513

Family Applications (1)

Application Number Title Priority Date Filing Date
JP57175114A Pending JPS5965344A (ja) 1982-10-05 1982-10-05 単語検索装置

Country Status (1)

Country Link
JP (1) JPS5965344A (ja)

Similar Documents

Publication Publication Date Title
KR100288144B1 (ko) 한글로 표기된 외래어 코드화 방법 및 그를 이용한 검색 방법
JPH0140372B2 (ja)
JPS6057421A (ja) 文書作成装置
JPH0227423A (ja) 日本語文字データの並び換え方法
JPS58123126A (ja) 辞書検索装置
JPS62214468A (ja) かな漢字変換装置
JPH0554145B2 (ja)
JPS61177575A (ja) 日本語文章作成装置
JP2976682B2 (ja) 言語再生装置
JPS62212877A (ja) 漢字かな変換装置
JP2580566B2 (ja) 音声合成装置
JPH01114976A (ja) 文書処理装置の辞書構造
JPH03282961A (ja) 相互変換辞書方式
JPH07152756A (ja) 文書処理装置
JPH0350669A (ja) 情報処理装置
JPS6349799A (ja) 音声出力装置
JPS5978400A (ja) 候補列作成方式
JPS63157266A (ja) 単語辞書構成方式
JPS5913040B2 (ja) 音声合成装置
JPH01166186A (ja) 文字認識方法
JPS6024630A (ja) 制御情報付きカナ文字列形成方式
JPS61177574A (ja) 日本語文章作成装置
JPS6293746A (ja) カナ漢字変換用辞書
CN1010620B (zh) 中文文书作成装置
JPH04335464A (ja) 辞書記憶装置