JPH0724056B2 - コンピュータによる形態論的テキスト解析方法 - Google Patents
コンピュータによる形態論的テキスト解析方法Info
- Publication number
- JPH0724056B2 JPH0724056B2 JP63008602A JP860288A JPH0724056B2 JP H0724056 B2 JPH0724056 B2 JP H0724056B2 JP 63008602 A JP63008602 A JP 63008602A JP 860288 A JP860288 A JP 860288A JP H0724056 B2 JPH0724056 B2 JP H0724056B2
- Authority
- JP
- Japan
- Prior art keywords
- word
- inflection
- dictionary
- inflection table
- generated
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/253—Grammatical analysis; Style critique
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/237—Lexical tools
- G06F40/247—Thesauruses; Synonyms
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y10—TECHNICAL SUBJECTS COVERED BY FORMER USPC
- Y10S—TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y10S707/00—Data processing: database and file management or data structures
- Y10S707/99941—Database schema or data structure
- Y10S707/99943—Generating database or data structure, e.g. via user interface
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Health & Medical Sciences (AREA)
- Computational Linguistics (AREA)
- General Health & Medical Sciences (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Artificial Intelligence (AREA)
- Machine Translation (AREA)
- Document Processing Apparatus (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Description
【発明の詳細な説明】 A.産業上の利用分野 本発明はテキスト解析方法に係り、特にコンピュータに
よる形態論的テキスト解析方法に係る。
よる形態論的テキスト解析方法に係る。
B.従来技術 テキスト・プロセッシング・システムおよびワード・プ
ロセッシング・システムは、スタンド・アロン用および
分散システム用の両方のものが開発されてきた。この明
細書において、テキスト・プロセッシングおよびワード
・プロセッシングという用語は、互いに入れ換えて使っ
てもよく、文書となったテキストを構成する英数字スト
リングの作成、編集、通信または印刷、あるいはそれら
のいくつかまたはすべてを行なうために、主として使用
されるデータ処理システムを指すものである。ワード・
プロセッシング用のある分散処理システムが、K.W.ボー
ゲンダール(K.W.Borgendale)他の「全コマンド、メッ
セージおよびヘルプのサポートによる、ワード・プロセ
ッサにおける画面イメージの構築およびコマンドのデコ
ードのための多言語処理(Multilingual Processing fo
r Screen Image Build and Command Decode in a Word
Processor,with Full Command,Message,and Help Suppo
rt)」と題する米国特許第4731735号に開示されてい
る。
ロセッシング・システムは、スタンド・アロン用および
分散システム用の両方のものが開発されてきた。この明
細書において、テキスト・プロセッシングおよびワード
・プロセッシングという用語は、互いに入れ換えて使っ
てもよく、文書となったテキストを構成する英数字スト
リングの作成、編集、通信または印刷、あるいはそれら
のいくつかまたはすべてを行なうために、主として使用
されるデータ処理システムを指すものである。ワード・
プロセッシング用のある分散処理システムが、K.W.ボー
ゲンダール(K.W.Borgendale)他の「全コマンド、メッ
セージおよびヘルプのサポートによる、ワード・プロセ
ッサにおける画面イメージの構築およびコマンドのデコ
ードのための多言語処理(Multilingual Processing fo
r Screen Image Build and Command Decode in a Word
Processor,with Full Command,Message,and Help Suppo
rt)」と題する米国特許第4731735号に開示されてい
る。
本発明の形態論的テキスト解析は、米国特許第4887212
号に記載されている、自然言語テキスト用文法解析プロ
グラム(parser)に使用できる。
号に記載されている、自然言語テキスト用文法解析プロ
グラム(parser)に使用できる。
用語集 本明細書では言語学の専門用語を使用する。そのうち最
もよく出てくるものをここで定義しておく。
もよく出てくるものをここで定義しておく。
屈折語尾−単語に付加されて、時制、法、数、性、その
他の言語学的属性を指定する語尾または接尾辞。
他の言語学的属性を指定する語尾または接尾辞。
見出し語形−辞書で使われる単語の標準の形(一般に動
詞の不定詞形または名詞の単数形)。
詞の不定詞形または名詞の単数形)。
形態論−屈折、派生、複合語の形成を含めて、ある言語
の語形成の研究。
の語形成の研究。
語形変化表−ある単語のすべての屈折形を示すモデル
(活用または曲用)。
(活用または曲用)。
語幹−自らは変化せず、それに接尾辞を付加すると単語
になる、単語の部分。語幹自体は必ずしも単語でなくと
もよい。
になる、単語の部分。語幹自体は必ずしも単語でなくと
もよい。
形態論は、データ・プロセッシングで多くの実用的用途
をもつ、言語研究の重要な一側面である。本発明にとっ
て特に重要なのは、規則変化の適用による単語の変化の
研究である。何世紀もの間、ロマンス語(スペイン語、
フランス語、イタリア語など)およびその他の印欧諸語
の研究は、動詞の「語幹」と「屈折語尾」を重視してき
た。「語幹」とは活用中変化しない動詞の部分であり、
「屈折語尾」とはある種の語形変化表またはパターンに
従って変化する部分である。英語では動詞の屈折語尾の
種類は比較的少ない(過去時制を表わす“−ed"、三人
称を表わす“−s"、現在分詞を表わす“−ing")が、ヨ
ーロッパの言語には50以上の動詞変化形をもつものもあ
る。自然言語の分類体系がいろいろ考察されているが、
大部分のものは不完全で、コンピュータをベースとする
システムで様々な言語に適用できるほど系統的ではな
い。
をもつ、言語研究の重要な一側面である。本発明にとっ
て特に重要なのは、規則変化の適用による単語の変化の
研究である。何世紀もの間、ロマンス語(スペイン語、
フランス語、イタリア語など)およびその他の印欧諸語
の研究は、動詞の「語幹」と「屈折語尾」を重視してき
た。「語幹」とは活用中変化しない動詞の部分であり、
「屈折語尾」とはある種の語形変化表またはパターンに
従って変化する部分である。英語では動詞の屈折語尾の
種類は比較的少ない(過去時制を表わす“−ed"、三人
称を表わす“−s"、現在分詞を表わす“−ing")が、ヨ
ーロッパの言語には50以上の動詞変化形をもつものもあ
る。自然言語の分類体系がいろいろ考察されているが、
大部分のものは不完全で、コンピュータをベースとする
システムで様々な言語に適用できるほど系統的ではな
い。
一つの従来技術は、既存の辞書の項目に語尾変化表参照
番号をつけて関連づけたもので、入力したテキストの単
語の文法形とその変化しない語根の形を識別することが
できる。しかし、この技術は、語尾変化表を辞書構造の
一部として使う機構を備えておらず、その結果、データ
が不必要なほど冗長で、非常にコンパクトな表現になら
ない。このデータ編成のもう一つの結果として、辞書の
各単語と関連する語尾変化表を見つけるのに余分のアク
セスが必要である。
番号をつけて関連づけたもので、入力したテキストの単
語の文法形とその変化しない語根の形を識別することが
できる。しかし、この技術は、語尾変化表を辞書構造の
一部として使う機構を備えておらず、その結果、データ
が不必要なほど冗長で、非常にコンパクトな表現になら
ない。このデータ編成のもう一つの結果として、辞書の
各単語と関連する語尾変化表を見つけるのに余分のアク
セスが必要である。
第二の従来技術である、「辞書記憶ファイル中のデータ
を減らすための語幹処理(Stem Processing for Data R
eduction in a Dictionary Storage File)」と題する
米国特許第4342085号は、一般的な接頭辞と接尾辞を符
号化して辞書の表現をコンパクトにするものであるが、
その符号化機構は圧縮体系にすぎず、言語学的情報を提
供するものではない。
を減らすための語幹処理(Stem Processing for Data R
eduction in a Dictionary Storage File)」と題する
米国特許第4342085号は、一般的な接頭辞と接尾辞を符
号化して辞書の表現をコンパクトにするものであるが、
その符号化機構は圧縮体系にすぎず、言語学的情報を提
供するものではない。
C.発明が解決しようとする問題点 本発明の一つの目的は、自然言語によるテキストを分類
し、様々なテキスト処理適用業務に使用できる語形を生
成する、多くの自然言語に適用できる機構を提供するこ
とにある。
し、様々なテキスト処理適用業務に使用できる語形を生
成する、多くの自然言語に適用できる機構を提供するこ
とにある。
本発明の第二の目的は、従来技術の手法よりもコンパク
トであり、単語の「見出し語形」(すなわちその基本
形)および見出し語形から派生できるすべての活用形ま
たは言語学的形態を生成することができる、改良された
形態論的解析システムを提供することにある。
トであり、単語の「見出し語形」(すなわちその基本
形)および見出し語形から派生できるすべての活用形ま
たは言語学的形態を生成することができる、改良された
形態論的解析システムを提供することにある。
本発明の第三の目的は、入力または生成された語形を分
類するために文法上の情報を関連づける、コンピュータ
利用の改良された方法を提供することにある。
類するために文法上の情報を関連づける、コンピュータ
利用の改良された方法を提供することにある。
本発明の第四の目的は、語尾変化表をそれが辞書の表現
の一体的部分となるように符号化し、従来技術に比べて
著しいコンパクト化と高速化を実現することにある。
の一体的部分となるように符号化し、従来技術に比べて
著しいコンパクト化と高速化を実現することにある。
D.問題点を解決するための手段 ある単語のすべての屈折形を示す語形変化表と呼ばれる
モデルを使って、テキストを解析する、コンピュータ利
用の方法を開示する。単語リスト(辞書)と語形変化表
ファイルという2つの構成要素からなるファイル構造を
作成する。単語リストの各単語は、1組の語形変化表参
照番号と関連づけられ、語形変化表ファイルは、文法上
の諸範疇およびそれに配された時制、法、数、性その他
の言語学的属性を指定する対応する語尾または接尾辞部
分(屈折語尾と呼ぶ)からなる。単語の標準の形(見出
し語形と呼ぶ)、すなわち通常は動詞の不定詞形または
名詞の単数形のリストから単語のすべての変化形を生成
することにより、辞書のファイル構造を作成する、コン
ピュータ利用の方法を開示する。見出し語形は、対応す
る語形変化表を用いて生成される。この方法では、得ら
れた単語リストを分類して辞書の形に編成する。次に、
入力された各単語の見出し語形を生成することにより、
自然言語の単語の入力データ・ストリームを処理するこ
とができる。そのために、入力された単語を辞書と突き
合わせ、得られた語形変化表参照番号を使って1組の語
形変化表にアクセスする。次に語形変化表の語尾または
接尾辞(屈折語尾)を入力された単語と突き合わせ、一
致した各屈折語尾の対応する文法範疇を記録し、入力さ
れた単語の一致した屈折語尾を見出し語形の屈折語尾で
置き換えることにより単語の標準形(見出し語形)を生
成する。入力された単語の特定の文法上の形態は、単語
の標準形(見出し語形)と文法範疇から、見出し語形を
辞書と突き合わせその語形変化表参照番号を用いて1組
の語形変化表にアクセスすることにより生成できる。次
に、語形変化表の屈折語尾を見出し語形と突き合わせ、
指定された文法範疇に対応する屈折語尾を選択する。特
定の文法形態を生成するには、見出し語形の屈折語尾
を、希望する文法形態の屈折語尾で置き換える。このコ
ンピュータ利用の方法は、辞書表現のコンパクト化、文
法解析、自動索引作成、同義語検索その他計算言語学の
応用分野に適用することができる。語形変化表を辞書に
一体的表現として組み込んだ結果、語形変化表の検索は
辞書の走査と等価となるので、屈折語尾と関係する文法
情報に効率的にアクセスできることを示す。
モデルを使って、テキストを解析する、コンピュータ利
用の方法を開示する。単語リスト(辞書)と語形変化表
ファイルという2つの構成要素からなるファイル構造を
作成する。単語リストの各単語は、1組の語形変化表参
照番号と関連づけられ、語形変化表ファイルは、文法上
の諸範疇およびそれに配された時制、法、数、性その他
の言語学的属性を指定する対応する語尾または接尾辞部
分(屈折語尾と呼ぶ)からなる。単語の標準の形(見出
し語形と呼ぶ)、すなわち通常は動詞の不定詞形または
名詞の単数形のリストから単語のすべての変化形を生成
することにより、辞書のファイル構造を作成する、コン
ピュータ利用の方法を開示する。見出し語形は、対応す
る語形変化表を用いて生成される。この方法では、得ら
れた単語リストを分類して辞書の形に編成する。次に、
入力された各単語の見出し語形を生成することにより、
自然言語の単語の入力データ・ストリームを処理するこ
とができる。そのために、入力された単語を辞書と突き
合わせ、得られた語形変化表参照番号を使って1組の語
形変化表にアクセスする。次に語形変化表の語尾または
接尾辞(屈折語尾)を入力された単語と突き合わせ、一
致した各屈折語尾の対応する文法範疇を記録し、入力さ
れた単語の一致した屈折語尾を見出し語形の屈折語尾で
置き換えることにより単語の標準形(見出し語形)を生
成する。入力された単語の特定の文法上の形態は、単語
の標準形(見出し語形)と文法範疇から、見出し語形を
辞書と突き合わせその語形変化表参照番号を用いて1組
の語形変化表にアクセスすることにより生成できる。次
に、語形変化表の屈折語尾を見出し語形と突き合わせ、
指定された文法範疇に対応する屈折語尾を選択する。特
定の文法形態を生成するには、見出し語形の屈折語尾
を、希望する文法形態の屈折語尾で置き換える。このコ
ンピュータ利用の方法は、辞書表現のコンパクト化、文
法解析、自動索引作成、同義語検索その他計算言語学の
応用分野に適用することができる。語形変化表を辞書に
一体的表現として組み込んだ結果、語形変化表の検索は
辞書の走査と等価となるので、屈折語尾と関係する文法
情報に効率的にアクセスできることを示す。
E.実施例 語形変化表とは、ある単語の可能なすべての変化形を示
すモデルである。語形変化表は、接尾辞の付加によって
生成できる語形ならびに接頭辞の付加によって生成でき
る語形をすべて含むことが可能である。本明細書では、
「基本的語形変化表処理」と「生成的語形変化表処理」
とを区別する。基本的語形変化表処理は、ある単語の任
意の語形からその標準形(見出し語形)を生成するのに
使い、生成的語形変化表処理は、見出し語形と語形変化
表からすべての語形を生成するのに使用する。基本的語
形変化表処理を第1図に示す。入力された単語を語形変
化表参照番号に対して処理して、標準語形(見出し語
形)と文法範疇リストを生成する。
すモデルである。語形変化表は、接尾辞の付加によって
生成できる語形ならびに接頭辞の付加によって生成でき
る語形をすべて含むことが可能である。本明細書では、
「基本的語形変化表処理」と「生成的語形変化表処理」
とを区別する。基本的語形変化表処理は、ある単語の任
意の語形からその標準形(見出し語形)を生成するのに
使い、生成的語形変化表処理は、見出し語形と語形変化
表からすべての語形を生成するのに使用する。基本的語
形変化表処理を第1図に示す。入力された単語を語形変
化表参照番号に対して処理して、標準語形(見出し語
形)と文法範疇リストを生成する。
下記の第1表は、英語の多数の規則変化動詞用の語形変
化表であり、第2表は英語の規則変化名詞用の語形変化
表である。左側の欄に文法上のクラスを示し、右側の欄
に形態論的特徴(屈折語尾)を示す。さらに、語形変化
表の見出しに、識別番号と例を示す。基本的語形変化表
処理は、語形変化表の屈折語尾を(特定の語形変化表が
適用されるはずの)入力された単語と突き合わせること
からなる。
化表であり、第2表は英語の規則変化名詞用の語形変化
表である。左側の欄に文法上のクラスを示し、右側の欄
に形態論的特徴(屈折語尾)を示す。さらに、語形変化
表の見出しに、識別番号と例を示す。基本的語形変化表
処理は、語形変化表の屈折語尾を(特定の語形変化表が
適用されるはずの)入力された単語と突き合わせること
からなる。
基本的語形変化表処理は下記のように適用する。“book
s"などの入力された単語と語形変化表参照番号“N27"
(第2表)が与えられているものとして、語形変化表の
屈折語尾をその単語と突き合わせる。この例では、最後
の“s"が一致し、入力された単語が複数名詞であること
を示す。この情報を文法クラスのリストに入れる。“s"
をブランク(語形変化表では下線で表わす)で置き換え
て、見出し語形を生成する。得られた見出し語形は“bo
ok"であり、名詞の単数形である。
s"などの入力された単語と語形変化表参照番号“N27"
(第2表)が与えられているものとして、語形変化表の
屈折語尾をその単語と突き合わせる。この例では、最後
の“s"が一致し、入力された単語が複数名詞であること
を示す。この情報を文法クラスのリストに入れる。“s"
をブランク(語形変化表では下線で表わす)で置き換え
て、見出し語形を生成する。得られた見出し語形は“bo
ok"であり、名詞の単数形である。
語形変化表参照番号“V45"(第1表)を同じ入力された
単語に適用すると、基本的語形変化表処理でその単語が
動詞の現在時制三人称であることが示される。文章“He
books a flight to Boston"がその例である。前の例と
同様にして見出し語形を生成するが、これは動詞の不定
詞形に対応するものである。
単語に適用すると、基本的語形変化表処理でその単語が
動詞の現在時制三人称であることが示される。文章“He
books a flight to Boston"がその例である。前の例と
同様にして見出し語形を生成するが、これは動詞の不定
詞形に対応するものである。
下記の第3表は、英語の不規則変化動詞用の語形変化表
である。第4表および第5表は、スペイン語の規則変化
動詞および規則変化名詞の例の語形変化表である。スペ
イン語の形態論はより複雑ではあるが、上記と同じ基本
的手順を使用する。
である。第4表および第5表は、スペイン語の規則変化
動詞および規則変化名詞の例の語形変化表である。スペ
イン語の形態論はより複雑ではあるが、上記と同じ基本
的手順を使用する。
見出し語形を生成するのに使う置換機構は、非常に一般
的なものである。この機構は、(動詞“be:"の変化形b
e、am、isなどのように)形態論的特徴が全く共通しな
いため、単語全体の置換が必要な場合にさえも適用でき
る。
的なものである。この機構は、(動詞“be:"の変化形b
e、am、isなどのように)形態論的特徴が全く共通しな
いため、単語全体の置換が必要な場合にさえも適用でき
る。
語形変化表参照番号と単語の関連づけ 前節では、見出し語形を生成するための基本的語形変化
表処理について例示した。本節では、ある見出し語形と
語形変化表からすべての語形を生成するのに使われる生
成的語形変化表処理の方法を提示する。
表処理について例示した。本節では、ある見出し語形と
語形変化表からすべての語形を生成するのに使われる生
成的語形変化表処理の方法を提示する。
第2図は、見出し語形のファイルとそれに対応する語形
変化表参照番号とを語形変化表を含むファイルに対して
どのように処理すれば単語と語形変化表番号のファイル
が生成できるかについて例示する。分類し重複するもの
を除去した後、このファイルを参照辞書として使って、
任意のテキストから取った語彙をそれと突き合わせ、語
形変化表番号を検索することができる。次に、テキスト
の各単語について基本的語形変化表処理を適用してその
見出し語形を得ることができる。
変化表参照番号とを語形変化表を含むファイルに対して
どのように処理すれば単語と語形変化表番号のファイル
が生成できるかについて例示する。分類し重複するもの
を除去した後、このファイルを参照辞書として使って、
任意のテキストから取った語彙をそれと突き合わせ、語
形変化表番号を検索することができる。次に、テキスト
の各単語について基本的語形変化表処理を適用してその
見出し語形を得ることができる。
生成的処理手順の詳細は基本的処理手順とほぼ同じであ
るが、語形変化表の形態論的項目をすべて走査して一致
を探す代わりに、見出し語形の形態論だけを検査して、
言語学的語幹を決定し、それに残りの形態論的特徴を適
用して様々な語形を生成する点が異なる。一例として、
“grind"という見出し語形と語形変化表“V4c"(第3
表)から“gr"という言語学的語幹が得られ、それから
“grind"、“grinding"、“ground"、“grinds"といっ
た独特の項目が生成できる。見出し語形“ground"と語
形変化表“N27"(第2表)を処理すると、項目“groun
d"と“grounds"が得られる。
るが、語形変化表の形態論的項目をすべて走査して一致
を探す代わりに、見出し語形の形態論だけを検査して、
言語学的語幹を決定し、それに残りの形態論的特徴を適
用して様々な語形を生成する点が異なる。一例として、
“grind"という見出し語形と語形変化表“V4c"(第3
表)から“gr"という言語学的語幹が得られ、それから
“grind"、“grinding"、“ground"、“grinds"といっ
た独特の項目が生成できる。見出し語形“ground"と語
形変化表“N27"(第2表)を処理すると、項目“groun
d"と“grounds"が得られる。
こうして得られる語形変化表を含む辞書は、下記のよう
な項目を含むはずである。なおアステリスク(*)は見
出し語形を示す。この辞書は、余分な情報を含んでいる
ものの、スペル・ミスの検出と訂正など他のワード・プ
ロセッシング機能にも使用できる。
な項目を含むはずである。なおアステリスク(*)は見
出し語形を示す。この辞書は、余分な情報を含んでいる
ものの、スペル・ミスの検出と訂正など他のワード・プ
ロセッシング機能にも使用できる。
grind V4c* grinding V4c grinds V4c ground V4c、N27* grounds N27 復号のあいまいさを避けるための語形変化表定義 見出し語形と語形変化表からすべての語形が正しく生成
されるからといって、どの語形からでも見出し語形が生
成できる訳ではない。特定の見出し語形に適用される語
形変化表をうまく定義して、この機能対称性を得ること
が重要である。
されるからといって、どの語形からでも見出し語形が生
成できる訳ではない。特定の見出し語形に適用される語
形変化表をうまく定義して、この機能対称性を得ること
が重要である。
下記の第6表は、“talk"、“paint"、“remind"など子
音で終わる英語の多数の規則変化動詞に適用される語形
変化表を例示したものである。左側の欄は語尾の定義
(下線はブランクを示す)であり、右側の欄にはそれに
対応する文法範疇を列挙してある(ただし、数字1〜3
は現在時制の単数人称を表わし、4〜6は対応する複数
人称を表わす)。
音で終わる英語の多数の規則変化動詞に適用される語形
変化表を例示したものである。左側の欄は語尾の定義
(下線はブランクを示す)であり、右側の欄にはそれに
対応する文法範疇を列挙してある(ただし、数字1〜3
は現在時制の単数人称を表わし、4〜6は対応する複数
人称を表わす)。
この語形変化表を、その見出し語形と同じサブストリン
グで終わる見出し語形に適用すると、復号段階で問題が
生じることがある。“speed"のような単語にこの語形変
化表を適用するものと仮定する。見出し語形から各語形
を生成している間は問題はないが、復号の際には、“sp
eeded"および“speed"という語形が“ed"と一致し、前
者の場合は“speed"という見出し語形が得られ、後者の
場合は“spe"という間違った語幹が得られる。
グで終わる見出し語形に適用すると、復号段階で問題が
生じることがある。“speed"のような単語にこの語形変
化表を適用するものと仮定する。見出し語形から各語形
を生成している間は問題はないが、復号の際には、“sp
eeded"および“speed"という語形が“ed"と一致し、前
者の場合は“speed"という見出し語形が得られ、後者の
場合は“spe"という間違った語幹が得られる。
この問題を矯正するには、1)状況を認識する、2)語
形変化表内にもっと長いサブストリングを含む新しい語
形変化表を定義する措置を講じる。もっと長いサブスト
リングを作成するには、問題が生じた見出し語形の最後
から屈折語尾に文字を追加する。この問題を解決できる
語形変化表を第7表に例示する。この語形変化表は、
“speed"、“seed"、“need"などその見出し語形が“e
d"で終わる動詞に適用される。
形変化表内にもっと長いサブストリングを含む新しい語
形変化表を定義する措置を講じる。もっと長いサブスト
リングを作成するには、問題が生じた見出し語形の最後
から屈折語尾に文字を追加する。この問題を解決できる
語形変化表を第7表に例示する。この語形変化表は、
“speed"、“seed"、“need"などその見出し語形が“e
d"で終わる動詞に適用される。
語形変化表にもとづくテキスト解析の応用例 辞書表現のコンパクト化 見出し語形のリストとそれに対応する語形変化表を使う
と、辞書の表現をコンパクトにすることができる。動詞
が多数の活用形をもつ言語では、こうすると特に好都合
である。本発明は、辞書を1組の見出し語形およびそれ
に対応する語形変化表として表現する。
と、辞書の表現をコンパクトにすることができる。動詞
が多数の活用形をもつ言語では、こうすると特に好都合
である。本発明は、辞書を1組の見出し語形およびそれ
に対応する語形変化表として表現する。
文法解析 基本的語形変化表処理の一部として得られる情報の一つ
に、品詞を決定するだけでなく単語の文法上の役割も示
す文法上の情報がある。このため、語形変化表手順を使
って、主語と動詞の一致、冠詞と名詞の一致、その他
性、数、動詞形の一致などの文法チェックを行なうこと
ができる。
に、品詞を決定するだけでなく単語の文法上の役割も示
す文法上の情報がある。このため、語形変化表手順を使
って、主語と動詞の一致、冠詞と名詞の一致、その他
性、数、動詞形の一致などの文法チェックを行なうこと
ができる。
自動索引作成 基本的語形変化表処理で得られた見出し語形を、テキス
ト中に現われる語形とは独立な、自然言語によるテキス
トのインデックス・ポイントとして使うことができる。
同様に、自然言語による無制限のテキスト中の語彙の不
確実性に対抗する必要がなく、見出し語形だけを探索す
ればよい場合、検索が容易になる。
ト中に現われる語形とは独立な、自然言語によるテキス
トのインデックス・ポイントとして使うことができる。
同様に、自然言語による無制限のテキスト中の語彙の不
確実性に対抗する必要がなく、見出し語形だけを探索す
ればよい場合、検索が容易になる。
追加オプションとして、(語形変化表処理により)照会
語の複数形を作成すると、データ・ベースの照会が拡張
される。こうすると、データ・ベースを探索する際の再
現性が向上する。
語の複数形を作成すると、データ・ベースの照会が拡張
される。こうすると、データ・ベースを探索する際の再
現性が向上する。
類語検索 第3図に、基本的語形変化表処理および生成的語形変化
表処理を用いて可能な3つのレベルの類語サポートを例
示する。第1レベルは最も基本的なレベルであり、見出
し語形にもとづく通常の検索である。人手によるまたは
援助なしの類語サポート・プロセスのやり方がこれであ
る。人間が見出し語形を提供しなければならない。
表処理を用いて可能な3つのレベルの類語サポートを例
示する。第1レベルは最も基本的なレベルであり、見出
し語形にもとづく通常の検索である。人手によるまたは
援助なしの類語サポート・プロセスのやり方がこれであ
る。人間が見出し語形を提供しなければならない。
第2レベルは、基本的語形変化表処理を用いてテキスト
の単語を自動的に見出し語形に変換するものである。こ
うすると、ある単語にカーソルを合わせてファンクショ
ン・キーを押すだけで、テキスト・プロセッシングの間
に自動的に類語辞書を基準づけることができる。検索さ
れる類語は、類語辞書中に見出し語形で見つかるもので
ある。
の単語を自動的に見出し語形に変換するものである。こ
うすると、ある単語にカーソルを合わせてファンクショ
ン・キーを押すだけで、テキスト・プロセッシングの間
に自動的に類語辞書を基準づけることができる。検索さ
れる類語は、類語辞書中に見出し語形で見つかるもので
ある。
第3レベルは、入力した単語に対応する語形の類語を生
成することにより、類語辞書の出力を改善するものであ
る。この段階では、テキスト・プロセッシング・システ
ムのユーザは、ある語形を選択して、それをテキスト中
で置き換えるだけでよい。
成することにより、類語辞書の出力を改善するものであ
る。この段階では、テキスト・プロセッシング・システ
ムのユーザは、ある語形を選択して、それをテキスト中
で置き換えるだけでよい。
コンパクトな辞書としての語形変化表 第2図に、語形変化表参照番号を辞書の項目とアルファ
ベット順で関連づける方法を提示した。しかし、厳密な
アルファベット順に並べる必要のない応用分野も多数あ
る。たとえばスペル・チェックでは、単語の最初の3文
字(または任意の文字数)がアルファベット順になるよ
うに、辞書を大雑把にアルファベット順に並べれば十分
である。入力された単語を辞書と比較するプログラム
は、辞書の最初の3文字が同じ部分だけ走査する。アル
ファベット順にする最初の文字の数を増やして、走査時
間が希望の要件を満たすように辞書の走査しなければな
らない部分を減らすことができる。
ベット順で関連づける方法を提示した。しかし、厳密な
アルファベット順に並べる必要のない応用分野も多数あ
る。たとえばスペル・チェックでは、単語の最初の3文
字(または任意の文字数)がアルファベット順になるよ
うに、辞書を大雑把にアルファベット順に並べれば十分
である。入力された単語を辞書と比較するプログラム
は、辞書の最初の3文字が同じ部分だけ走査する。アル
ファベット順にする最初の文字の数を増やして、走査時
間が希望の要件を満たすように辞書の走査しなければな
らない部分を減らすことができる。
辞書のすべての単語を、見出し語形のリストとそれらに
関連する語形変化表によって表わせることは明白であ
る。語形変化表のない単語(たとえば、前置詞“at"、
“for"やその他の機能語)を加えて、単語リストを完璧
にすることができる。見出し語形をアルファベット順に
並べる場合、多くの場合、「大雑把にアルファベット」
順という判定基準が満たされなくなる。たとえば、単語
“go"は、“goes"、“going"、“gone"、“went"と関連
している。明らかに“went"は“go"とアルファベット順
で非常に離れており、希望する配列度をもつアルファベ
ット順を維持するには、相互参照項目を作成する必要が
ある。しががってこの中に出ているすべての単語の最初
の2文字がアルファベット順になっているコンパクトな
辞書は、次のような形になるはずである。
関連する語形変化表によって表わせることは明白であ
る。語形変化表のない単語(たとえば、前置詞“at"、
“for"やその他の機能語)を加えて、単語リストを完璧
にすることができる。見出し語形をアルファベット順に
並べる場合、多くの場合、「大雑把にアルファベット」
順という判定基準が満たされなくなる。たとえば、単語
“go"は、“goes"、“going"、“gone"、“went"と関連
している。明らかに“went"は“go"とアルファベット順
で非常に離れており、希望する配列度をもつアルファベ
ット順を維持するには、相互参照項目を作成する必要が
ある。しががってこの中に出ているすべての単語の最初
の2文字がアルファベット順になっているコンパクトな
辞書は、次のような形になるはずである。
この例では、見出し語形がその対応する語形変化表と関
連づけられ、語形変化表がない場合は“0"で表される。
“went"の項目は、関連する語形変化表番号を添えてア
ルファベット順に置かれるが、“@”はそれが見出し語
形ではなくて相互参照であることを示している。ここで
は、語形変化表をその記号表示で示してある。実際の辞
書では、語形変化表を識別する2進数として符号化され
ることになる。一項目につき複数の語形変化表があるこ
ともあり、場合によっては、関係するすべての一致を見
つけるために、一致が見つかった後も走査を続行する必
要がある。たとえば、単語“types"は動詞の三人称の形
としても、名詞の複数形としても見つかるので、異なる
2つの語形変化表を走査しなければならない。
連づけられ、語形変化表がない場合は“0"で表される。
“went"の項目は、関連する語形変化表番号を添えてア
ルファベット順に置かれるが、“@”はそれが見出し語
形ではなくて相互参照であることを示している。ここで
は、語形変化表をその記号表示で示してある。実際の辞
書では、語形変化表を識別する2進数として符号化され
ることになる。一項目につき複数の語形変化表があるこ
ともあり、場合によっては、関係するすべての一致を見
つけるために、一致が見つかった後も走査を続行する必
要がある。たとえば、単語“types"は動詞の三人称の形
としても、名詞の複数形としても見つかるので、異なる
2つの語形変化表を走査しなければならない。
フロント・コーディングにより、辞書をさらにコンパク
ト化することができる。これは、前の項目と同じ先行文
字がいくつあるかを示すカウントを指定する方法であ
る。すなわち、“goad"は最初の2文字が前の項目であ
る“go"と同じなので、“2ad"と符号化されることにな
る。“goat"は最初の3文字が前の単語と同じなので、
“3t"と符号化される。前の単語と共通する文字がない
場合、このカウントは省略される。フロント・コーデイ
ングされた辞書は次のような形になる。
ト化することができる。これは、前の項目と同じ先行文
字がいくつあるかを示すカウントを指定する方法であ
る。すなわち、“goad"は最初の2文字が前の項目であ
る“go"と同じなので、“2ad"と符号化されることにな
る。“goat"は最初の3文字が前の単語と同じなので、
“3t"と符号化される。前の単語と共通する文字がない
場合、このカウントは省略される。フロント・コーデイ
ングされた辞書は次のような形になる。
at 0 go V4 2ad V56 3t N27 2bble V71 went @V4 突合わせをスピードアップするための機能 これまで、語形変化表が文法範疇と関連する1組の屈折
語尾(語尾)からなるものとして説明してきた。語形変
化表参照番号自体が、動詞モデル、名詞モデルなどを識
別するので、品詞に関する情報をもたらす。語形変化表
にもとづくコンパクトな辞書にアクセスする速度を上げ
るために、語形変化表に追加情報を加えることもでき
る。なかでも長さスクリーンと内容スクリーンが特に有
用である。長さスクリーンは、語形変化表によって生成
される単語の最小長さと最大長さを示し、これを使う
と、何もあり得ないときに一致を探して語形変化表を走
査するのを回避することができる。一例として、“gobb
le"という単語を辞書で探しているものと仮定する。“g
obbles"はサブストリング“go"で始まるので、“go"に
関連する語形変化表V4を検査して、それが単語“gobble
s"を生成するかどうか調べるのももっともなはずであ
る。長さスクリーンを使うと、この無駄な努力を避ける
ことができる。必要なことは、語形変化表によって生成
される単語の最小長さと最大長さおよび最長屈折語尾の
長さを語形変化表に示すことだけである。語形変化表V4
によって生成される最長の単語は5文字であり、“gobb
les"はそれよりも長いので、この単語が一致することは
あり得ず、この語形変化表をさらに検索する必要はない
と推論することができる。
語尾(語尾)からなるものとして説明してきた。語形変
化表参照番号自体が、動詞モデル、名詞モデルなどを識
別するので、品詞に関する情報をもたらす。語形変化表
にもとづくコンパクトな辞書にアクセスする速度を上げ
るために、語形変化表に追加情報を加えることもでき
る。なかでも長さスクリーンと内容スクリーンが特に有
用である。長さスクリーンは、語形変化表によって生成
される単語の最小長さと最大長さを示し、これを使う
と、何もあり得ないときに一致を探して語形変化表を走
査するのを回避することができる。一例として、“gobb
le"という単語を辞書で探しているものと仮定する。“g
obbles"はサブストリング“go"で始まるので、“go"に
関連する語形変化表V4を検査して、それが単語“gobble
s"を生成するかどうか調べるのももっともなはずであ
る。長さスクリーンを使うと、この無駄な努力を避ける
ことができる。必要なことは、語形変化表によって生成
される単語の最小長さと最大長さおよび最長屈折語尾の
長さを語形変化表に示すことだけである。語形変化表V4
によって生成される最長の単語は5文字であり、“gobb
les"はそれよりも長いので、この単語が一致することは
あり得ず、この語形変化表をさらに検索する必要はない
と推論することができる。
同様に、内容スクリーンは、屈折語尾に含まれる文字を
示す。突き合わせようとする単語が、内容スクリーンに
ない文字を含む場合、突合わせは失敗であり、それ以上
続ける必要なない。語形変化表をコンパクトな辞書表現
として効率的に使用するために、長さスクリーンと内容
スクリーンを併用することができる。
示す。突き合わせようとする単語が、内容スクリーンに
ない文字を含む場合、突合わせは失敗であり、それ以上
続ける必要なない。語形変化表をコンパクトな辞書表現
として効率的に使用するために、長さスクリーンと内容
スクリーンを併用することができる。
F.発明の効果 本発明によれば、語尾変化表を辞書構造の一部として使
う機構を備えているので、従来よりコンパクトで効率的
な辞書メモリを有するワード・プロセッシング・システ
ムが提供される。
う機構を備えているので、従来よりコンパクトで効率的
な辞書メモリを有するワード・プロセッシング・システ
ムが提供される。
第1図は、基本的語形変化表処理の機能構成図である。 第2図は、語形変化表番号と語形の関連づけを示す機能
構成図である。 第3図は、類語サポートの様々なレベルを示す説明図で
ある。
構成図である。 第3図は、類語サポートの様々なレベルを示す説明図で
ある。
Claims (1)
- 【請求項1】自然言語用の語形変化表に基づいた形態論
的テキスト解析をコンピュータで行う方法であって、 (a) 見出し語形とそれらに関連づけられた対応する
語形変化表参照番号との初期リストから各見出し語形に
より生成されるすべての語形およびその語形変化表のリ
ストを、各語形をその語形変化表参照番号と関連づけた
形でコンピュータ・メモリ内で生成し、 前記生成されたリストの語形および語形変化表参照番号
を所望の照合順序に並べ、 見出し語および語形変化表の組合せから生成された重複
単語エントリを合体し、 語形変化表参照番号にそれぞれ関連づけられた非重複の
語形および該参照番号によりアクセス可能な語形変化表
のリストのファイル構造を生成する、 ことにより自然言語テキストの入力単語ストリーム内の
単語に対して語形変化表に基づいた形態論的テキスト解
析を可能ならしめるファイル構造の辞書をコンピュータ
・メモリ内に生成するステップと、 (b) 1組の辞書項目を選択して入力単語の照合順序
に基づいて走査し、 辞書項目がそれに関連する語形変化表を有する場合には
辞書項目に語形変化表を適用することにより生成された
単語に対して、入力単語を比較し、 一致したときは関連する文法情報を検索する、 ステップと、 よりなるコンピュータによる形態論的テキスト解析方
法。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US07/028,437 US4862408A (en) | 1987-03-20 | 1987-03-20 | Paradigm-based morphological text analysis for natural languages |
| US28437 | 1987-03-20 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPS63231674A JPS63231674A (ja) | 1988-09-27 |
| JPH0724056B2 true JPH0724056B2 (ja) | 1995-03-15 |
Family
ID=21843442
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP63008602A Expired - Lifetime JPH0724056B2 (ja) | 1987-03-20 | 1988-01-20 | コンピュータによる形態論的テキスト解析方法 |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US4862408A (ja) |
| EP (1) | EP0282721B1 (ja) |
| JP (1) | JPH0724056B2 (ja) |
| DE (1) | DE3853894T2 (ja) |
Families Citing this family (54)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4864503A (en) * | 1987-02-05 | 1989-09-05 | Toltran, Ltd. | Method of using a created international language as an intermediate pathway in translation between two national languages |
| US5551049A (en) * | 1987-05-26 | 1996-08-27 | Xerox Corporation | Thesaurus with compactly stored word groups |
| US5551026A (en) * | 1987-05-26 | 1996-08-27 | Xerox Corporation | Stored mapping data with information for skipping branches while keeping count of suffix endings |
| US5754847A (en) * | 1987-05-26 | 1998-05-19 | Xerox Corporation | Word/number and number/word mapping |
| EP0361570B1 (en) * | 1988-09-15 | 1997-08-06 | Océ-Nederland B.V. | A system for grammatically processing a sentence composed in natural language |
| US5099426A (en) * | 1989-01-19 | 1992-03-24 | International Business Machines Corporation | Method for use of morphological information to cross reference keywords used for information retrieval |
| JPH077419B2 (ja) * | 1989-06-30 | 1995-01-30 | シャープ株式会社 | 機械翻訳装置における略称付き固有名詞処理方法 |
| US5146406A (en) * | 1989-08-16 | 1992-09-08 | International Business Machines Corporation | Computer method for identifying predicate-argument structures in natural language text |
| JPH03188566A (ja) * | 1989-12-18 | 1991-08-16 | Fujitsu Ltd | 辞書連動テキストベース装置 |
| FR2660085A1 (fr) * | 1990-03-20 | 1991-09-27 | Philips Electronique Lab | Dispositif de traitement de donnees et procede pour selectionner des mots de donnees contenus dans un dictionnaire. |
| JP2862626B2 (ja) * | 1990-03-22 | 1999-03-03 | 株式会社東芝 | 電子辞書及び情報検索方法 |
| US5229936A (en) * | 1991-01-04 | 1993-07-20 | Franklin Electronic Publishers, Incorporated | Device and method for the storage and retrieval of inflection information for electronic reference products |
| US5708829A (en) * | 1991-02-01 | 1998-01-13 | Wang Laboratories, Inc. | Text indexing system |
| US5369577A (en) * | 1991-02-01 | 1994-11-29 | Wang Laboratories, Inc. | Text searching system |
| US5475587A (en) * | 1991-06-28 | 1995-12-12 | Digital Equipment Corporation | Method and apparatus for efficient morphological text analysis using a high-level language for compact specification of inflectional paradigms |
| US5559693A (en) * | 1991-06-28 | 1996-09-24 | Digital Equipment Corporation | Method and apparatus for efficient morphological text analysis using a high-level language for compact specification of inflectional paradigms |
| NL9101286A (nl) * | 1991-07-23 | 1993-02-16 | Oce Nederland Bv | Werkwijze voor het verbuigen van woorden, alsmede een data-verwerkings-eenheid voor het uitvoeren van een dergelijke werkwijze. |
| US5265065A (en) * | 1991-10-08 | 1993-11-23 | West Publishing Company | Method and apparatus for information retrieval from a database by replacing domain specific stemmed phases in a natural language to create a search query |
| US5488719A (en) * | 1991-12-30 | 1996-01-30 | Xerox Corporation | System for categorizing character strings using acceptability and category information contained in ending substrings |
| US5523946A (en) * | 1992-02-11 | 1996-06-04 | Xerox Corporation | Compact encoding of multi-lingual translation dictionaries |
| DE4209280C2 (de) * | 1992-03-21 | 1995-12-07 | Ibm | Verfahren und Computersystem zur automatisierten Analyse von Texten |
| US5412567A (en) * | 1992-12-31 | 1995-05-02 | Xerox Corporation | Augmenting a lexical transducer by analogy |
| JPH07506207A (ja) * | 1993-02-23 | 1995-07-06 | ゼロックス コーポレイション | 文字認識におけるストリングのカテゴライズ |
| DE69425564D1 (de) * | 1993-03-12 | 2000-09-21 | Stanford Res Inst Int | Verfahren und vorrichtung für sprachunterricht mittels interaktiver sprachsteuerung |
| US5546573A (en) * | 1993-10-27 | 1996-08-13 | International Business Machines Corporation | Specification of cultural bias in database manager |
| US5692176A (en) * | 1993-11-22 | 1997-11-25 | Reed Elsevier Inc. | Associative text search and retrieval system |
| US5615320A (en) * | 1994-04-25 | 1997-03-25 | Canon Information Systems, Inc. | Computer-aided color selection and colorizing system using objective-based coloring criteria |
| US5508718A (en) * | 1994-04-25 | 1996-04-16 | Canon Information Systems, Inc. | Objective-based color selection system |
| US5521816A (en) * | 1994-06-01 | 1996-05-28 | Mitsubishi Electric Research Laboratories, Inc. | Word inflection correction system |
| US5794177A (en) * | 1995-07-19 | 1998-08-11 | Inso Corporation | Method and apparatus for morphological analysis and generation of natural language text |
| US5680628A (en) * | 1995-07-19 | 1997-10-21 | Inso Corporation | Method and apparatus for automated search and retrieval process |
| US5752025A (en) * | 1996-07-12 | 1998-05-12 | Microsoft Corporation | Method, computer program product, and system for creating and displaying a categorization table |
| US5832500A (en) * | 1996-08-09 | 1998-11-03 | Digital Equipment Corporation | Method for searching an index |
| WO1998012616A2 (en) | 1996-09-23 | 1998-03-26 | Lowrie Mcintosh | Defining a uniform subject classification system incorporating document management/records retention functions |
| WO1998014934A1 (en) * | 1996-10-02 | 1998-04-09 | Sri International | Method and system for automatic text-independent grading of pronunciation for language instruction |
| EP0856851B1 (en) * | 1997-01-30 | 2004-03-24 | Motorola, Inc. | Circuit and method of latching a bit line in a non-volatile memory |
| US6421675B1 (en) * | 1998-03-16 | 2002-07-16 | S. L. I. Systems, Inc. | Search engine |
| US6192333B1 (en) * | 1998-05-12 | 2001-02-20 | Microsoft Corporation | System for creating a dictionary |
| GB0006721D0 (en) * | 2000-03-20 | 2000-05-10 | Mitchell Thomas A | Assessment methods and systems |
| AUPQ811500A0 (en) * | 2000-06-09 | 2000-07-06 | Educational And Computing Software Pty Ltd | System for program source code conversion |
| US7072827B1 (en) * | 2000-06-29 | 2006-07-04 | International Business Machines Corporation | Morphological disambiguation |
| CN1512406A (zh) * | 2002-12-30 | 2004-07-14 | 国际商业机器公司 | 面向用户的电子词典、电子词典系统及其生成方法 |
| US8051096B1 (en) * | 2004-09-30 | 2011-11-01 | Google Inc. | Methods and systems for augmenting a token lexicon |
| US8438010B2 (en) * | 2007-12-06 | 2013-05-07 | International Business Machines Corporation | Efficient stemming of semitic languages |
| US8311808B2 (en) * | 2009-12-15 | 2012-11-13 | Thinkmap, Inc. | System and method for advancement of vocabulary skills and for identifying subject matter of a document |
| US9384678B2 (en) | 2010-04-14 | 2016-07-05 | Thinkmap, Inc. | System and method for generating questions and multiple choice answers to adaptively aid in word comprehension |
| US9235566B2 (en) | 2011-03-30 | 2016-01-12 | Thinkmap, Inc. | System and method for enhanced lookup in an online dictionary |
| US20130149681A1 (en) * | 2011-12-12 | 2013-06-13 | Marc Tinkler | System and method for automatically generating document specific vocabulary questions |
| US9460082B2 (en) | 2012-05-14 | 2016-10-04 | International Business Machines Corporation | Management of language usage to facilitate effective communication |
| US9372924B2 (en) * | 2012-06-12 | 2016-06-21 | International Business Machines Corporation | Ontology driven dictionary generation and ambiguity resolution for natural language processing |
| US9336195B2 (en) * | 2013-08-27 | 2016-05-10 | Nuance Communications, Inc. | Method and system for dictionary noise removal |
| CN106782516B (zh) * | 2016-11-17 | 2020-02-07 | 北京云知声信息技术有限公司 | 语料分类方法及装置 |
| CN109684627A (zh) * | 2018-11-16 | 2019-04-26 | 北京奇虎科技有限公司 | 一种文本分类方法及装置 |
| DE202018107421U1 (de) | 2018-12-21 | 2019-06-18 | Elbmind Gmbh | System zur automatisierten Kommunikation mit zulässiger Unschärfe für menschliche und maschinelle Quell- und Zielsysteme |
Family Cites Families (15)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4706212A (en) * | 1971-08-31 | 1987-11-10 | Toma Peter P | Method using a programmed digital computer system for translation between natural languages |
| JPS5937887Y2 (ja) * | 1978-10-31 | 1984-10-20 | シャープ株式会社 | 単語記憶装置 |
| JPS6239467Y2 (ja) * | 1978-11-20 | 1987-10-08 | ||
| JPS5598797A (en) * | 1979-01-20 | 1980-07-28 | Sharp Kk | Electronic translator |
| US4420817A (en) * | 1979-05-25 | 1983-12-13 | Sharp Kabushiki Kaisha | Word endings inflection means for use with electronic translation device |
| JPS5853787B2 (ja) * | 1979-08-30 | 1983-12-01 | シャープ株式会社 | 電子辞典 |
| JPS59865B2 (ja) * | 1979-09-13 | 1984-01-09 | シャープ株式会社 | 電子式翻訳装置 |
| JPS59868B2 (ja) * | 1979-10-24 | 1984-01-09 | シャープ株式会社 | 単語の基本形認識装置およびこれを用いた翻訳装置 |
| JPS5840684A (ja) * | 1981-09-04 | 1983-03-09 | Hitachi Ltd | 自然言語間の自動翻訳方式 |
| US4499553A (en) * | 1981-09-30 | 1985-02-12 | Dickinson Robert V | Locating digital coded words which are both acceptable misspellings and acceptable inflections of digital coded query words |
| US4495566A (en) * | 1981-09-30 | 1985-01-22 | System Development Corporation | Method and means using digital data processing means for locating representations in a stored textual data base |
| FR2569883B1 (fr) * | 1984-09-05 | 1989-11-17 | Sharp Kk | Dictionnaire electronique destine a etre utilise dans un systeme de traitement de texte en francais |
| JPS6165361A (ja) * | 1984-09-05 | 1986-04-03 | Sharp Corp | 電子式仏単語辞書 |
| JPS62251876A (ja) * | 1986-04-18 | 1987-11-02 | インタ−ナショナル ビジネス マシ−ンズ コ−ポレ−ション | 言語処理システム |
| US4887212A (en) * | 1986-10-29 | 1989-12-12 | International Business Machines Corporation | Parser for natural language text |
-
1987
- 1987-03-20 US US07/028,437 patent/US4862408A/en not_active Expired - Fee Related
-
1988
- 1988-01-20 JP JP63008602A patent/JPH0724056B2/ja not_active Expired - Lifetime
- 1988-02-05 EP EP88101694A patent/EP0282721B1/en not_active Expired - Lifetime
- 1988-02-05 DE DE3853894T patent/DE3853894T2/de not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| US4862408A (en) | 1989-08-29 |
| JPS63231674A (ja) | 1988-09-27 |
| EP0282721A2 (en) | 1988-09-21 |
| EP0282721A3 (en) | 1990-06-27 |
| DE3853894T2 (de) | 1995-12-14 |
| DE3853894D1 (de) | 1995-07-06 |
| EP0282721B1 (en) | 1995-05-31 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US4862408A (en) | Paradigm-based morphological text analysis for natural languages | |
| Christopher et al. | Introduction to information retrieval | |
| Manning et al. | Introduction to information retrieval | |
| US6269189B1 (en) | Finding selected character strings in text and providing information relating to the selected character strings | |
| US5303150A (en) | Wild-card word replacement system using a word dictionary | |
| JP2012248210A (ja) | 日本語などの複雑言語のコンテンツを検索するシステム及び方法 | |
| US20070011132A1 (en) | Named entity translation | |
| US20050203900A1 (en) | Associative retrieval system and associative retrieval method | |
| EP0971294A2 (en) | Method and apparatus for automated search and retrieval processing | |
| EP0266001B1 (en) | A parser for natural language text | |
| WO1997004405A9 (en) | Method and apparatus for automated search and retrieval processing | |
| JP2010519655A (ja) | 名前照合システムの名前インデックス付け | |
| JPH05314166A (ja) | 電子化辞書および辞書検索装置 | |
| EP0316743B1 (en) | Method for removing enclitic endings from verbs in romance languages | |
| Roy et al. | An unsupervised normalization algorithm for noisy text: a case study for information retrieval and stance detection | |
| Tambouratzis | Automatic corpora-based stemming in Greek | |
| JPH08129554A (ja) | 関係表現抽出装置および関係表現検索装置 | |
| Yasukawa et al. | Phonetic Matching in Japanese. | |
| Yeshambel et al. | Evaluation of corpora, resources and tools for Amharic information retrieval | |
| Pantelia | ‘Noûs, INTO CHAOS’: THE CREATION OF THE THESAURUS OF THE GREEK LANGUAGE | |
| JPH04160473A (ja) | 事例再利用型翻訳方法および装置 | |
| JPH04130578A (ja) | 未登録語検索方法および装置 | |
| Graliński et al. | Mining historical texts for diachronic spelling variants | |
| JP4262529B2 (ja) | 全文検索装置、方法、プログラム及び記録媒体 | |
| JPH0561902A (ja) | 機械翻訳システム |