JPH11184890A - 個人関心事辞書作成装置 - Google Patents

個人関心事辞書作成装置

Info

Publication number
JPH11184890A
JPH11184890A JP9364535A JP36453597A JPH11184890A JP H11184890 A JPH11184890 A JP H11184890A JP 9364535 A JP9364535 A JP 9364535A JP 36453597 A JP36453597 A JP 36453597A JP H11184890 A JPH11184890 A JP H11184890A
Authority
JP
Japan
Prior art keywords
proper
word
abstract
proper word
specific
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP9364535A
Other languages
English (en)
Inventor
Mamiko Oka
満美子 岡
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fujifilm Business Innovation Corp
Original Assignee
Fuji Xerox Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fuji Xerox Co Ltd filed Critical Fuji Xerox Co Ltd
Priority to JP9364535A priority Critical patent/JPH11184890A/ja
Publication of JPH11184890A publication Critical patent/JPH11184890A/ja
Pending legal-status Critical Current

Links

Landscapes

  • Machine Translation (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

(57)【要約】 【課題】 個人が関心をもつ知識領域を表す語句(固有
語)を当該個人が書いたテキストデータから抽出して、
当該個人の関心事を把握するための辞書を作成する。 【解決手段】 情報記憶手段1に記憶されている特定個
人によって作成されたテキストデータを含む文書を、テ
キスト解析手段2で形態素解析等して語句の単位に切り
分け、共起解析手段3によって、テキストデータ中の予
め定めたテキスト単位中で固有名詞と共起する語を当該
テキストデータを作成した特定個人の知識領域を表す抽
象固有語候補として抽出し、更に、当該固有名詞を抽出
して各抽象固有語との共起頻度をカウントする。そし
て、この固有名詞の共起頻度を基準として、抽象固有語
抽出手段4で抽象固有語候補から抽象固有語を抽出し、
更に、具体固有語抽出手段5により、抽出された抽象固
有語と共起する固有名詞を、当該抽象固有語が表す領域
での前記特定個人の具体的な関心を表す具体固有語とし
て抽出し、これら抽出された抽象固有語と具体固有語と
を対応付けて固有語辞書手段7に保持する。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術の分野】本発明は、個人が関心(興
味や知見等も含む)をもつ知識領域を表す語句(以下、
固有語と呼ぶ)を当該個人が書いたテキストデータから
抽出して、当該個人の関心事を把握するための辞書を作
成する装置に関する。
【0002】
【従来の技術】最近、例えば、会議への出席者の選定や
メールの宛先の選定等に供するために、個性や特徴とい
った個人の固有性データの必要性が増している。近年、
日本においても、以前に比べて個人主義的な傾向が強ま
りつつある。これにより、各個人の個性が求められるよ
うになりつつあり、また、他人と異なる個性が積極的に
活用される場が増えつつある。
【0003】一方、従来は様々なコミュニケーションが
物理的な距離に大きく制約されていたが、ネットワーク
等の発達により、必ずしも物理的に近くない人とのコミ
ュニケーションや協業の可能性が大きくなってきた。こ
れらにより、例えば、ある問題を解決するのに最もふさ
わしい人を広範囲に探したり、自分と興味が合う人を探
して知り合いになるといった広範囲での人選の必要性が
感じられるようになってきた。
【0004】これに対して、従来では、例えば、何か解
決したい問題が生じた場合には、ネットニュースやメイ
リング・リストを通じて不特定多数に呼びかけるという
方法や、ネットニュース上に投稿されている記事やホー
ムぺージの内容から判断して、問題を解決してくれそう
だと思われる人に対して電子メイルなどを送り、解決を
依頼するというような、ユーザ主導の方法がとられてい
る。
【0005】しかしながら、前者の場合には、不特定多
数の相手に対して呼びかけるため、呼びかけられる相手
側には自分に依頼されているという意識が少なく、呼び
かけに答えるかどうかは相手の善意等に大きく依存する
上に、本当にふさわしい人が誰かは呼びかける側からは
わからない。また、後者の場合には、特定の個人に対し
て依頼されるため、前者に比べれば依頼に答えてもらえ
る可能性は高いが、現状では、偶然見たその人の投稿や
ホームページといった偶然性の強い情報に頼っているた
め、本当にふさわしい人を見つけるのは困難である。な
お、この場合に、検索エンジン等を利用してホームペー
ジを検索して探すこともできるが、実際に内容を全部読
んだりしない限り、ふさわしい人を見つけるのは困難で
あり、また、ふさわしい人を見つけるのにはユーザの負
担が非常に大きい。
【0006】このため、近年、ある領域に関心や知見を
もつ人を探したり、興味が一致する人同士を紹介したり
するようなシステムが考えられ始めている。このような
システムにおいて、人選がうまく行われるためには、各
個人がどういう分野に知識や興味を持っているかといっ
た、知識領域の固有性のデータが必要になってくる。な
お、ここでの知識領域という語は、必ずしも学問の領域
のような純粋に知的なものだけを指すのではなく、趣味
などに関するものや、日常生活上の関心領域など、さま
ざまなものを指して用いている。
【0007】スペシャリストや興味を同じくするグルー
プの紹介といった、一種の人選を前提とした興味領域の
表現手法の従来技術としては、特開平9−44470号
公報に開示されているものがある。この発明は、興味領
域とその領域での情報処理能力を同時に表現しようとす
るものである。この中で興味領域の表現に着目すると、
特定の人の興味領域はキーワードで表されており、その
キーワードは、その人が送受信した電子メイルのコンテ
ンツから抽出されている。抽出方法は、やり取りされて
いる電子メイル全体(その人が関係しないものも含む)
における単語の出現頻度に対する特定の人が送受信した
電子メイルにおける単語の出現頻度の比に基づくもの
で、従来の情報検索のためのキーワード抽出の手法を用
いたものである。また、「分散型人脈活用支援システム
における人脈データベースの構築」(重点領域研究「高
度データベース」松江ワークショップ講演論文集Vol.1,
pp109-114 (1996))では、二人の間でやりとりされた
電子メイルのサブジェクトに含まれる語を、二人に共通
の興味領域として抽出する技術が開示されている。この
ように、従来においては、個人の関心領域は、単独のキ
ーワード群で表されているだけであった。
【0008】
【発明が解決しようとする課題】ところが、個人に対し
て、自分の関心領域を表す語(以下、固有語と呼ぶ)を
自由に好きなだけ列挙してもらう実験を行ったところ、
その結果から次のような特徴があることがわかった。 (1)例えば固有語が50個列挙されている場合、その
人は50個の独立した領域に対して関心を持っているわ
けではなく、関心を持っている領域は幾つかの領域に分
けられる。 (2)ひとつひとつの関心領域は、かなり抽象的なもの
から、非常に具体的なものまで、異なる抽象レベルの語
で構成される。 (3)具体的な語としては、人名、地名、小説や映画の
名前、商品名など、固有名詞が多く挙げられている。 (4)ひとつの領域を構成する語は互いに関連を持つ
が、その関係はシソーラスに表されるような厳密な上下
関係というわけではなく、様々な意味、コンテキストに
基づく関係をもつ。また、それはしばしば、その個人の
経験や価値観に基づく、その人独自のものである。
【0009】例えば、ある個人が挙げた固有語のうち、
「文学」の領域に関連するものを、互いの関係を元に図
式化したものを図8に示す。すなわち、単に「文学」と
いう領域でも「小説」と「国文学」という異なる関心領
域があり、その「小説」の中でも「推理小説」と「少女
小説」との領域に分けられる。更に、「谷崎潤一郎」や
「横溝正史」等といった具体的な関心対象は各領域に対
して別個或いは重複した関連を有している。
【0010】ディスカッションや問題解決において誰が
ふさわしいかを選ぶ場合、「どういう領域に関心がある
か」という抽象的な領域と、その中で実際にどういうと
ころに詳しかったり関心が強かったりするのかといった
具体的な対象が共に必要である。抽象的な領域で興味が
一致している場合でも、具体的な関心対象はまったく異
なっていて、ぜんぜん話が合わないという場合もある。
また、例えば、具体的な興味の対象として例えば同じ小
説を挙げていたとしても、一方は文学に興味がありその
中で特にその小説が好きであり、もう一方は文学には関
心がないが、アフリカに興味があり、その小説がアフリ
カを描いているために関心を持っている、というような
場合もある。このように、自分の関心を抽象度の違う語
で表すことにより、お互いの意味を補強し合うことにな
るため、個人の関心領域をより正確に表すには、固有語
は、単独のキーワードではなく、抽象度の異なるキーワ
ードの組で表す必要がある。
【0011】しかしながら、このような固有語を、ユー
ザ自身に列挙してもらうことは、ユーザにとって大きな
負担となり、その場ですべてを思いつくことはかなり困
難であり、また、抜けが多くなる。また、列挙してもら
ったとしても、列挙してもらった時の関心などに大きく
左右される結果になり、かなり恣意的なものとなってし
まう。さらに、関連する語句をまとめることも、ユーザ
にとって大きな負担となる。上述の例では単純化して
「文学」に関するものだけを示したが、具体的な関心事
は、複数の領域にまたがっていたりするため、非常に煩
雑である。
【0012】ここで、このような語句の関連を表したも
のとしてシソーラスがあり、シソーラスを利用した自動
的な関連付けや階層化が考えられる。しかしながら、シ
ソーラスは基本的に語の上位−下位関係を表したもので
あるが、固有語間の関係は上下関係ではないものが多い
ため適用するに適していない。さらに、現在、入手でき
る既存のシソーラスでは、固有名詞は一部の地名など以
外記載されておらず、例え記載されているとしても、商
品名や番組名のような日々増えていく語句に対してサポ
ートされることは難しい。
【0013】上記のような事情から、固有語の組をユー
ザに負担をかけることなく、自動的に抽出する方法が必
要である。そこで、実際には、図8に示したように、数
段階の階層関係を持つものもあるが、まず、特に重要で
ある最も下位にある具体的な固有語と、それより上の階
層にあるより抽象的な固有語という2段階の組の抽出を
考える。抽出する対象として、一般的にある人の関心が
表われているものとして、そのユーザが作成したテキス
ト情報が考えられる。ここでは、洩れを減らすため、論
文のようなオフィシャルなものから電子メイルのような
日常的、プライヴェートなものまで含む種々のテキスト
で、かつある程度長い期間の間に書かれた、大量のテキ
ストを想定する。
【0014】従来、互いに関連を持つ語(以下、関連語
と呼ぶ)をテキストから自動的に抽出する方法として
は、語句の共出現頻度に基づくものがある。特開平6−
168272号公報には、あるキーワードに対する関連
語を作成するために、もとのキーワードを含む文書内に
現れる他の語のうち、文書データベース全体における出
現頻度に対して、もとのキーワードを含む文書内に現れ
る頻度の高いものをもとのキーワードの関連語とする発
明が開示されている。このような方法によれば、シソー
ラスにはない上下関係以外の関連語も抽出することがで
きる。しかしながら、このような関連語抽出方法は、情
報検索において、指定したキーワードを含む大量の文書
において、どのような関連語が使われているかを提示し
て、ユーザが結果を絞り込めるようにするためのもので
あり、結果の絞り込みにとっては有効な関連語でも、抽
象度の異なる語の組といった点を考慮したものではなか
った。
【0015】本発明は、上記の事情に鑑みてなされたも
のであり、個人の知識領域の固有性を表す語句の組を正
確に抽出し、これを辞書に作成する個人関心事辞書作成
装置を提供することを目的としている。
【0016】
【課題を解決するための手段】本発明に係る個人関心事
辞書作成装置は、文書中から当該文書を作成した特定個
人の具体的な関心を表す語を抽出して、辞書にまとめる
個人関心事辞書作成装置であって、情報記憶手段に記憶
されている特定個人によって作成されたテキストデータ
を含む文書を、テキスト解析手段で形態素解析等して語
句の単位に切り分け、共起解析手段によって、テキスト
データ中の予め定めたテキスト単位(例えば、文書毎や
段落等)中で固有名詞と共起する語を当該テキストデー
タを作成した特定個人の知識領域を表す抽象固有語候補
として抽出し、更に、当該固有名詞を抽出して各抽象固
有語候補との共起頻度をカウントする。そして、この共
起する固有名詞の共起頻度を基準として、抽象固有語抽
出手段で抽象固有語候補から抽象固有語を抽出し、更
に、具体固有語抽出手段により、抽出された抽象固有語
と共起する固有名詞を、当該抽象固有語が表す領域での
前記特定個人の具体的な関心を表す具体固有語として抽
出し、これら抽出された抽象固有語と具体固有語とを対
応付けて固有語辞書手段に保持する。
【0017】また、本発明に係る個人関心事辞書作成装
置では、共起解析手段が、テキストデータ中の予め定め
たテキスト単位中で固有名詞と共起する語を当該テキス
トデータを作成した特定個人の知識領域を表す抽象固有
語候補として抽出し、更に、当該固有名詞を抽出して個
数をカウントし、この抽出された固有名詞数を基準とし
て、抽象固有語抽出手段で抽象固有語候補から抽象固有
語を抽出し、更に、具体固有語抽出手段により、抽出さ
れた抽象固有語と共起する固有名詞を、当該抽象固有語
が表す領域での前記特定個人の具体的な関心を表す具体
固有語として抽出し、これら抽出された抽象固有語と具
体固有語とを対応付けて固有語辞書手段に保持する。
【0018】このようにして作成された固有語辞書中の
固有語の組は、その個人にとっての関連語として捉える
ことができ、したがって、人選等における利用のみなら
ず、例えば、情報検索等においても、関連語情報として
その個人に合わせた検索の支援に用いることができる。
例えば、情報検索における関連語の利用には、クエリー
の拡張に用いられる場合と、結果の絞り込みに用いられ
る場合とがある。クエリー拡張の場合は、関連語によっ
てクエリーを拡張して検索することにより、より多くの
結果を得る。一方、結果の絞り込みの場合は、クエリー
の関連語としてどのような語が使われているかによっ
て、ユーザの検索意図に合ったものだけに絞り込む。
【0019】本発明で抽出される固有語は、この両方の
用途に用いることができる。前者の場合には、固有名詞
のような具体的な語は、意味の特定性が高いため、クエ
リーの関連語である固有名詞が含まれている文書を検索
することにより、クエリーの語が含まれていなくても必
要な文書を検索することができる。また、後者の場合に
は、クエリーを満たす文書のうち、どのような固有名詞
が共起しているかによって、ユーザの意図する文書だけ
を検索することができる。更に、本発明で抽出される固
有語は、この他にも、個人の関心領域の情報を必要とす
る、個人の知的な活動を支援するようなあらゆるシステ
ムにおいて利用しうる。
【0020】
【発明の実施の形態】本発明の一実施形態を図面を参照
して説明する。図1には、本実施形態に係る個人関心事
辞書作成装置の構成を示してあり、この個人関心事辞書
作成装置は、情報記憶部1、テキスト解析部2、共起解
析部3、抽象固有語抽出部4、具体固有語抽出部5、固
有語登録部6、および固有語辞書7を備えている。な
お、本実施形態における各機能手段2〜6および後述す
る各機能手段21、22、31、32は、予めインスト
ールしたプログラムをコンピュータハードウエア資源を
用いて実行することにより構成される。
【0021】情報記憶部1は、例えば、磁気ディスク装
置等といった情報を読み書き自在に記憶する装置を有
し、特定個人によって書かれたテキストデータを含む文
書を複数記憶する。なお、情報記憶部1は、テキスト解
析部2等からネットワーク上の離れた場所に設置しても
よく、また、複数の装置によって構成してもよい。ま
た、上記した文書にはテキストデータの他に絵や図形な
どのデータを含んでいてもよい。
【0022】テキスト解析部2は、情報記憶部1に記憶
されている文書中のテキストデータを解析し、テキスト
データ中の自立語(名詞、形容詞、動詞等)を切り出す
処理を行う。なお、本実施形態では、テキスト解析部2
は形態素解析部21と語処理部22とを備えており、テ
キストデータ中から名詞を切り出す処理を行う。形態素
解析部21は、情報記憶部1に記憶されている文書中の
テキストデータに対して形態素解析を行うことによって
単語に分割し、各単語に品詞情報を付与する処理を行
う。なお、形態素解析は、自然言語処理の基礎技術とし
て広く知られており、例えば「自然言語処理の基礎技
術」(野村浩郷著、社団法人電子情報通信学会、1988)
や「情報処理」(Vol.30, No.10, 1989)の「3.1形
態論」等に記載されている方法により、容易に実現する
ことができる。
【0023】語処理部22は、形態素解析部21の解析
結果に基づき、未知語と複合語の処理を行う。例えば、
固有名詞には外来語や新語が多いため、未知語を固有名
詞とみなし、固有名詞の品詞情報を与える。また、漢字
の名詞の連続、カタカナの名詞の連続は複合語と考えら
れるので、まとめてひとつの名詞として品詞情報を与え
る。なお、本実施形態では、既存の形態素解析システム
を用いることを前提として上述のような構成としたが、
本発明はこれに限らず、形態素解析部21と語処理部2
2の処理を同時に行うようにしてもよい。この際、予め
定めたルールに基づいて、例えば、「 」や“ ”など
で囲まれた短い語句を固有名詞とするようにしてもよ
い。
【0024】また、テキスト解析部2に、形態素解析用
の辞書とは別に固有名詞辞書を設け、未知語や複合語を
この辞書中の固有名詞とマッチングして、マッチするも
のは固有名詞とするようにしてもよい。また、本実施形
態では、テキスト解析部2の解析内容として形態素解析
を用いたが、本発明はこれに限らず、共起解析部3で必
要とされる情報にしたがって、構文解析など、さらに深
い解析を行うようにしてもよい。
【0025】共起解析部3は、あるテキスト単位毎に、
固有名詞と共起する語を文書データの作成者の知識領域
を表す抽象固有語候補として抽出し、それぞれの抽象固
有語候補に対して、共起する固有名詞の共起頻度をカウ
ントする。ここで、本実施形態において、「共起する」
とは、「同一テキスト単位中に共存する」ことを指すも
のとするが、本発明はこれに限らず、例えば、文法的な
係り受け関係をもつ場合を指すようにしてもよい。な
お、この場合には、テキスト解析部2において、構文解
析等のさらに深い解析を行うようにすればよい。
【0026】また、テキスト単位とは、本実施形態では
一文書としており、同じ文書内に共に存在していれば
「共起する」とみなす。なお、本発明はこれに限らず、
予め定めたテキスト単位であればどのような単位でもよ
く、例えば、一文、一段落などをテキスト単位としても
よい。また、情報記憶部1に記憶された文書が構造化文
書である場合には、特定のタグによって囲まれた範囲と
してもよい。また、構造的な特徴以外に、一定の行数、
文字数などとしてもよい。文法的な係り受け関係をもつ
場合に「共起する」とする場合には、テキスト単位とし
ては一文を用いるのが好ましい。
【0027】また、固有名詞と共起する語として、本実
施形態では名詞を考えており、ここでは、サ変動詞語幹
もサ変名詞とみなして、名詞の中に含め、一方、形式名
詞と固有名詞は除く。以後、本実施形態中の抽象固有語
候補について、断りなく名詞と書いた場合には、上述の
範囲の名詞を指すものとする。なお、本発明はこれに限
らず、要は、個人の固有語となり得る語であれば何でも
よく、例えば、広く自立語全般、名詞と動詞全部などと
してもよく、また、サ変動詞語幹などを含まない名詞の
みとしてもよく、また、目的に応じて形容詞や形容動詞
などとしてもよい。
【0028】本実施形態では、共起解析部3は、単語抽
出部31と共起カウント部32とを備えている。単語抽
出部31は、一文書毎に、文書中の固有名詞と名詞を、
それぞれ重複を除いて抽出し、文書毎の固有名詞リスト
および抽象固有語候補リストを作成する。ここで、重複
を除くとは、例えば固有名詞リストの作成において、同
じ固有名詞が同一文書中に2回以上出てきた場合、2回
目以降は無視するということである。共起カウント部3
2は、全文書の固有名詞リストおよび抽象固有語候補リ
ストから、各抽象固有語候補毎に、共起する固有名詞の
共起頻度(本実施形態の場合、共出現文書数)をカウン
トし、共起リストを作成する。
【0029】抽象固有語抽出部4は、共起する各固有名
詞の共起頻度に基づいて、共起リストの抽象固有語候補
の中から、文書の作成者固有の知識領域を表す語を選択
する。この選択の基準は、単純には、共起する固有名詞
が何個以上で、トータルの出現文書数がいくつ以上であ
るといったものである。また、これらの数値を含む評価
式を作り、その評価値が予め決めた値以上になるもの、
あるいは、評価値が大きい方から何%までといった基準
でもよい。また、後述するように共起する固有名詞の個
数や、各固有名詞の出現文書数以外の要素をさらに加味
してもよく、要は、共起する固有名詞の個数および各固
有名詞の出現文書数に基づくものならどのような方法で
もよい。
【0030】具体固有語抽出部5は、抽象固有語抽出部
4で抽出された各抽象固有語に関連する具体固有語を選
択する。ここでは、選択の基準は、例えば、共起リスト
にある固有名詞のうち、共起頻度が予め決めた数より多
いものを選択する。この選択の基準は、この他に、共起
文書数が多いものからn個選ぶ、全体のn%選ぶなどで
もよく、また、共起頻度以外の基準を組み合わせて選択
するようにしてもよい。
【0031】固有語登録部6は、抽出された抽象固有語
と具体固有語をセットにして、文書作成者の固有語辞書
7に登録する処理を行う。ここで、各固有名詞の頻度
や、抽象固有語抽出部4、具体固有語抽出部5で算出し
た評価値などを共に登録するようにしてもよい。固有語
辞書7は、例えば、磁気ディスク装置等といった情報を
読み書き自在に記憶する装置で構成されており、上記の
抽象固有語と具体固有語とのセットを個人毎の辞書とし
て記憶する。
【0032】次に、上記の個人関心事辞書作成装置によ
って行う、特定個人に対する固有語辞書を作成する処理
を図2〜図7を参照して説明する。なお、情報記憶部1
には、A氏によって作成されたN個の文書が記憶されて
いるものとする。まず、テキスト解析部2の形態素解析
部21において、情報記憶部1に記憶されている全文書
中のテキストデータを形態素解析する(ステップS
1)。すなわち、形態素解析部21は、まず、ある1つ
の文書D1からテキストデータを一文ずつ読み込んで単
語に分割し、各単語に品詞情報を付与する。例えば、テ
キスト中に「ペナンのチャイナタウンは、伝統的な景観
がかなり残されている。」という一文があった場合に
は、形態素解析によって図3に示すように、当該一文を
単語に切り分けてその品詞情報を付与する。このように
文書D1のすべての文の解析が終了すると、形態素解析
部21は次の文書D2に移って同様の解析を行う。
【0033】そして、全文書Nについて形態素解析が終
了すると、語処理部22において、未知語と複合語の処
理を行う(ステップS2)。例えば、図3に示した解析
結果が得られた場合、語処理部22の処理が行われる
と、図4に示すように、未知語である「ペナン」が固有
名詞に、名詞の連続である「チャイナ」「タウン」がひ
とつにまとめられて「チャイナタウン」という名詞にな
る。なお、未知語、複合語の処理は、文書D1の先頭か
ら順番に文書DNまで行われる。
【0034】次いで、共起解析部3の単語抽出部31に
おいて、固有名詞リストおよび抽象固有語候補リストが
作成される(ステップS3)。単語抽出部31は、まず
最初の文書D1からすべての固有名詞と名詞を重複なく
抽出し、固有名詞リストPNL1および抽象固有語候補
リストAIL1を作成する。例えば、「ペナンのチャイ
ナタウンは、伝統的な景観がかなり残されている。ジョ
ージタウンの商店建築は、ショップハウスと呼ばれる、
住居と商店を兼ねた形式である。」というテキスト文章
のみからなる文書があった場合、固有名詞リストには
「ペナン」「ジョージタウン」という固有名詞が載せら
れ、抽象固有語候補リストには「「チャイナタウン」
「伝統」「景観」「商店建築」「ショップハウス」「住
居」「商店」「形式」という語が載せられる。このよう
に文書D1についてリストを作成すると、単語抽出部3
1は次の文書D2に移って同様にリストを作成し、すべ
ての文書Nについて、各リストを作成する。
【0035】次いで、共起カウント部32において、抽
象固有語候補毎に、共起する固有名詞をカウントし、共
起リストCOLを作成する(ステップS4)。この共起
カウント部32による動作を図5を参照して詳しく説明
すると、共起カウント部32は、まず、最初の文書D1
を取り出し(ステップS11、S12)、当該文書D1
の中小固有語候補リストに単語があるか否かを確認し
(ステップS13)、単語がない場合には次の文書D2
への処理へ移行する一方、単語がある場合には文書D1
の抽象固有語候補リストAIL1の先頭から一語(W)
取り出す(ステップS14)。
【0036】次いで、取り出した語Wが共起リストCO
Lにあるかを調べ(ステップS15)、ない場合には当
該語をリストに追加する一方(ステップS16)、ある
場合には文書D1の固有名詞リストPNL1に単語があ
るかを確認し(ステップS17)、単語がない場合には
次の抽象固有語への処理へ移行する一方、単語がある場
合には文書D1の固有名詞リストPNL1の先頭から一
語(PN)取り出す(ステップS18)。そして、この
語(PN)が共起リスト中のWの項の共起固有名詞中に
あるかどうかを調べ(ステップS19)、ない場合には
PNをリストに追加してその頻度を1とする一方(ステ
ップS20)、ある場合には、その頻度を+1加算する
(ステップS21)。
【0037】上記のような処理によって、固有名詞リス
トの全固有名詞についてリストの変更を終わると、抽象
固有語候補リストの次の語に移り、同様に固有名詞リス
トの先頭の語から順に、共起リストへの追加または頻度
の加算を行う。更に、文書D1の抽象固有語候補リスト
のすべての名詞についてこの処理が終了すると、次の文
書D2に移り、文書D2の抽象固有語候補リストAIL
2と固有名詞リストPNL2について同様の処理を行
う。以後同様に、文書Nまでの抽象固有語候補リストお
よび固有名詞リストを処理し、共起リストCOLを更新
する。例えば、文書D1と文書D2の抽象固有語候補リ
ストと固有名詞リストが図6(a)に示すものであった
場合、文書D1と文書D2についての処理を終わった時
点での共起リストCOLの一部を示すと図6(b)のよ
うになる。なお、図6(b)中に示す数字は頻度であ
る。
【0038】上記のようにして全文書Nに対する共起リ
ストCOLが作成されると(ステップS4)、抽象固有
語抽出部4において、各固有名詞の出現文書数に基づい
て、共起リスト中の抽象固有語候補の中から文書の作成
者固有の知識領域を表す語を選択する(ステップS
5)。そして、抽象固有語の抽出が終了すると、具体固
有語抽出部5において、選択された各抽象固有語に関連
する具体固有語を抽出する(ステップS6)。ここで
は、共起リストにある固有名詞のうち、共起頻度が予め
決めた数より多いものを選択する。例えば、図7(a)
に一部を示すような共起リストCOLが作成された場
合、例えば、しきい値を40として、図7(b)に示す
ような抽象固有語と具体固有語の組が、抽象固有語抽出
部4、具体固有語抽出部5の動作により抽出される。
【0039】このようにして具体固有語の選択が終了す
ると、固有語登録部6において、抽出された抽象固有語
と具体固有語をセットにして、文書の作成者の固有語辞
書7に登録し(ステップS7)、一連の辞書作成動作が
終了する。このようにして作成された固有語辞書7は、
例えば、個人の関心や知見に基づいて問題を解決してく
れる人を選んだり、興味の一致する人を紹介したりする
一種の人選システムにおいて、個人の関心領域を表す有
効な情報として利用することができる。なお、本実施形
態では本発明の個人関心事辞書作成装置を、情報を永続
的に記憶保持する辞書を作成するものとして説明した
が、この辞書は情報を一時的に保持するバッファ的なも
のとしてもよく、例えば、固有語を抽出した結果を永続
的な情報としては登録せずに、アプリケーション中で直
接的に利用するようにしてもよい。
【0040】上記した実施形態では、共起カウント部3
2は、固有名詞リストおよび抽象固有語候補リストから
共起する固有名詞の共起頻度をカウントして共起リスト
を作成し、抽象固有語抽出部4は、各固有名詞の共起頻
度に基づいて、共起リストの抽象固有語候補の中から文
書の作成者固有の知識領域を表す語を選択するようにし
たが、本発明の他の実施態様として、共起カウント部3
2は、全文書の固有名詞リストおよび抽象固有語候補リ
ストから、各抽象固有語候補毎に、共起する固有名詞の
個数をカウントして共起リストを作成し、抽象固有語抽
出部4は、共起する固有名詞の個数に基づいて、共起リ
ストの抽象固有語候補の中から、文書の作成者固有の知
識領域を表す語を選択するようにしてもよい。すなわ
ち、抽象固有語に関連する固有名詞の数によって、登録
のために選択する抽象固有語を選択するようにしてもよ
い。
【0041】
【発明の効果】以上説明したように、本発明によると、
固有名詞と共起する抽象固有語候補の中から、その固有
名詞の個数や共起頻度に基づいて、特定個人の具体的な
関心事を表す具体固有語として選定するようにしたた
め、個人の知識領域の固有性を表す語句の組を正確に抽
出し、これを辞書に作成することができる。このため、
この辞書を用いて、例えば、人選やメールの宛先選定を
適切に行うことができ、個人の知的活動に係わる業務を
円滑に実行することができる。
【図面の簡単な説明】
【図1】 本発明の一実施形態に係る個人関心事辞書作
成装置の構成図である。
【図2】 本発明の一実施形態に係る処理動作を説明す
るフローチャートである。
【図3】 本発明の一実施形態に係るテキスト解析部の
動作を説明する図である。
【図4】 本発明の一実施形態に係るテキスト解析部の
動作を説明する図である。
【図5】 本発明の一実施形態に係る共起カウント部の
動作を説明するフローチャートである。
【図6】 本発明の一実施形態に係る共起カウント部の
動作を説明する図である。
【図7】 本発明の一実施形態に係る抽象固有語抽出部
および具体固有語抽出部の動作を説明する図である。
【図8】 従来の課題を説明する図である。 1・・・情報記憶部、 2・・・テキスト解析部、 3
・・・共起解析部、4・・・抽象固有語抽出部、 5・
・・具体固有語抽出部、5・・・固有語登録部、 7・
・・固有語辞書、 21・・・形態素解析部、22・・
・語処理部、 31・・・単語抽出部、 32・・・共
起カウント部、

Claims (3)

    【特許請求の範囲】
  1. 【請求項1】 文書中から当該文書を作成した特定個人
    の具体的な関心を表す語を抽出して、辞書にまとめる個
    人関心事辞書作成装置であって、 特定個人によって作成されたテキストデータを含む文書
    を記憶する情報記憶手段と、 前記文書中のテキストデータを解析するテキスト解析手
    段と、 前記テキストデータ中の予め定めたテキスト単位中で固
    有名詞と共起する語を当該テキストデータを作成した特
    定個人の知識領域を表す抽象固有語候補として抽出し、
    更に、当該固有名詞を抽出して各抽象固有語との共起頻
    度をカウントする共起解析手段と、 前記共起する固有名詞の共起頻度を基準として前記抽象
    固有語候補から抽象固有語を抽出する抽象固有語抽出手
    段と、 前記抽出された抽象固有語と共起する固有名詞を、当該
    抽象固有語が表す領域での前記特定個人の具体的な関心
    を表す具体固有語として抽出する具体固有語抽出手段
    と、 前記抽出された抽象固有語と具体固有語とを対応付けて
    保持する固有語辞書手段と、 を備えたことを特徴とする個人関心事辞書作成装置。
  2. 【請求項2】 文書中から当該文書を作成した特定個人
    の具体的な関心を表す語を抽出して、辞書にまとめる個
    人関心事辞書作成装置であって、 特定個人によって作成されたテキストデータを含む文書
    を記憶する情報記憶手段と、 前記文書中のテキストデータを解析するテキスト解析手
    段と、 前記テキストデータ中の予め定めたテキスト単位中で固
    有名詞と共起する語を当該テキストデータを作成した特
    定個人の知識領域を表す抽象固有語候補として抽出し、
    更に、当該固有名詞を抽出して個数をカウントする共起
    解析手段と、 前記抽出された固有名詞数を基準として前記抽象固有語
    候補から抽象固有語を抽出する抽象固有語抽出手段と、 前記抽出された抽象固有語と共起する固有名詞を、当該
    抽象固有語が表す領域での前記特定個人の具体的な関心
    を表す具体固有語として抽出する具体固有語抽出手段
    と、 前記抽出された抽象固有語と具体固有語とを対応付けて
    保持する固有語辞書手段と、 を備えたことを特徴とする個人関心事辞書作成装置。
  3. 【請求項3】 請求項1又は請求項2に記載の個人関心
    事辞書作成装置において、 前記情報記憶手段は同一の個人によって作成された複数
    の文書を記憶しており、 前記テキスト解析手段、前記共起解析手段、前記抽象固
    有語抽出手段、及び、前記具体固有語抽出手段は、同一
    の個人に係る複数の文書に対して前記処理を施し、 前記固有語辞書手段には前記複数の文書中から抽出した
    同一の個人に係る抽象固有語と具体固有語とが対応付け
    て保持されることを特徴とする個人関心事辞書作成装
    置。
JP9364535A 1997-12-18 1997-12-18 個人関心事辞書作成装置 Pending JPH11184890A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP9364535A JPH11184890A (ja) 1997-12-18 1997-12-18 個人関心事辞書作成装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP9364535A JPH11184890A (ja) 1997-12-18 1997-12-18 個人関心事辞書作成装置

Publications (1)

Publication Number Publication Date
JPH11184890A true JPH11184890A (ja) 1999-07-09

Family

ID=18482050

Family Applications (1)

Application Number Title Priority Date Filing Date
JP9364535A Pending JPH11184890A (ja) 1997-12-18 1997-12-18 個人関心事辞書作成装置

Country Status (1)

Country Link
JP (1) JPH11184890A (ja)

Cited By (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6321221B1 (en) 1998-07-17 2001-11-20 Net Perceptions, Inc. System, method and article of manufacture for increasing the user value of recommendations
US6334127B1 (en) * 1998-07-17 2001-12-25 Net Perceptions, Inc. System, method and article of manufacture for making serendipity-weighted recommendations to a user
US6412012B1 (en) 1998-12-23 2002-06-25 Net Perceptions, Inc. System, method, and article of manufacture for making a compatibility-aware recommendations to a user
JP2005242416A (ja) * 2004-02-24 2005-09-08 Shogakukan Inc 自然言語文の検索方法および検索装置
JP2006073012A (ja) * 2004-09-02 2006-03-16 Microsoft Corp 予め定められた個数の予め定義された質問に応答することによって情報を管理するシステムおよび方法
US7461058B1 (en) 1999-09-24 2008-12-02 Thalveg Data Flow Llc Optimized rule based constraints for collaborative filtering systems
JP2010529714A (ja) * 2007-05-15 2010-08-26 ソニー エリクソン モバイル コミュニケーションズ, エービー 共通の関心を持つ通信装置間のリンクを共有のための方法と装置
US7788123B1 (en) 2000-06-23 2010-08-31 Ekhaus Michael A Method and system for high performance model-based personalization

Cited By (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6321221B1 (en) 1998-07-17 2001-11-20 Net Perceptions, Inc. System, method and article of manufacture for increasing the user value of recommendations
US6334127B1 (en) * 1998-07-17 2001-12-25 Net Perceptions, Inc. System, method and article of manufacture for making serendipity-weighted recommendations to a user
US6412012B1 (en) 1998-12-23 2002-06-25 Net Perceptions, Inc. System, method, and article of manufacture for making a compatibility-aware recommendations to a user
US7461058B1 (en) 1999-09-24 2008-12-02 Thalveg Data Flow Llc Optimized rule based constraints for collaborative filtering systems
US8548987B2 (en) 1999-09-24 2013-10-01 Thalveg Data Flow Llc System and method for efficiently providing a recommendation
US7788123B1 (en) 2000-06-23 2010-08-31 Ekhaus Michael A Method and system for high performance model-based personalization
JP2005242416A (ja) * 2004-02-24 2005-09-08 Shogakukan Inc 自然言語文の検索方法および検索装置
JP2006073012A (ja) * 2004-09-02 2006-03-16 Microsoft Corp 予め定められた個数の予め定義された質問に応答することによって情報を管理するシステムおよび方法
JP2010529714A (ja) * 2007-05-15 2010-08-26 ソニー エリクソン モバイル コミュニケーションズ, エービー 共通の関心を持つ通信装置間のリンクを共有のための方法と装置
US8199734B2 (en) 2007-05-15 2012-06-12 Sony Mobil Communications AB Method and apparatus for sharing common interest links between communication devices

Similar Documents

Publication Publication Date Title
Fillmore et al. Building a large lexical databank which provides deep semantics
US10296584B2 (en) Semantic textual analysis
US6571240B1 (en) Information processing for searching categorizing information in a document based on a categorization hierarchy and extracted phrases
Witten Text Mining.
US7707023B2 (en) Method of finding answers to questions
AU2004218705B2 (en) System for identifying paraphrases using machine translation techniques
US20020188586A1 (en) Multi-layered semiotic mechanism for answering natural language questions using document retrieval combined with information extraction
US20030101182A1 (en) Method and system for smart search engine and other applications
US20070027854A1 (en) Processor for fast contextual searching
JP2009259252A (ja) 名前をハイパーリンクするためのシステム、方法、及びソフトウェア
Al-Taani et al. An extractive graph-based Arabic text summarization approach
Archer What's in a word-list?: investigating word frequency and keyword extraction
US20020046019A1 (en) Method and system for acquiring and maintaining natural language information
JP3594701B2 (ja) キーセンテンス抽出装置
JP2006004399A (ja) 情報抽出プログラムおよびその記録媒体、情報抽出装置ならびに情報抽出規則作成方法
JPH10207910A (ja) 関連語辞書作成装置
KR100669534B1 (ko) 문장추상화와 개연규칙을 활용하는 문서요약 방법과 시스템, 그리고 문장 의미 분석 및 표현방법
Kim et al. Design of question answering system with automated question generation
Wu et al. Domain Event Extraction and Representation with Domain Ontology.
Abuleil et al. Extracting an Arabic lexicon from Arabic newspaper text
Fujisaki et al. Principles and design of an intelligent system for information retrieval over the internet with a multimodal dialogue interface.
Sunitha et al. Automatic summarization of Malayalam documents using clause identification method
KR100225855B1 (ko) 자연어 메모 문장으로부터의 일정관리 방법
KR20020054254A (ko) 사전구조를 이용한 한국어 형태소 분석방법
JPH1185766A (ja) キーワード抽出方法及び装置及びキーワード抽出プログラムを格納した記憶媒体