JPH09101990A - 情報フィルタリング装置 - Google Patents

情報フィルタリング装置

Info

Publication number
JPH09101990A
JPH09101990A JP33579095A JP33579095A JPH09101990A JP H09101990 A JPH09101990 A JP H09101990A JP 33579095 A JP33579095 A JP 33579095A JP 33579095 A JP33579095 A JP 33579095A JP H09101990 A JPH09101990 A JP H09101990A
Authority
JP
Japan
Prior art keywords
article
articles
user
information
similarity
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP33579095A
Other languages
English (en)
Other versions
JP3810463B2 (ja
Inventor
Tetsuya Sakai
哲也 酒井
Seiji Miike
誠司 三池
Kazuo Sumita
一男 住田
Masahiro Kajiura
正浩 梶浦
Kenji Ono
顕司 小野
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Toshiba Corp
Original Assignee
Toshiba Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Toshiba Corp filed Critical Toshiba Corp
Priority to JP33579095A priority Critical patent/JP3810463B2/ja
Priority to US08/695,214 priority patent/US5907836A/en
Publication of JPH09101990A publication Critical patent/JPH09101990A/ja
Application granted granted Critical
Publication of JP3810463B2 publication Critical patent/JP3810463B2/ja
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Landscapes

  • Information Transfer Between Computers (AREA)
  • Machine Translation (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

(57)【要約】 【課題】情報フィルタリングによって選択された記事に
関連記事の情報を付加してユーザに送信し、送信記事の
有効利用を図る。 【解決手段】情報フィルタリングセンタ1内には記事間
の類似度を算出する記事間類似度計算部16が設けられ
ており、この記事間類似度計算部16によって重複記事
の存在が調べられる。重複記事を構成する記事群の1つ
がユーザに提示する記事として選択され、他の記事は排
除される。この場合、排除された記事に関する情報は、
関連記事情報として選択記事に付加されてユーザに送ら
れる。よって、ユーザに提供される記事同士の関連性を
ユーザに提示できるようになり、ユーザによる送信記事
の有効利用を図る事が可能になる。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】この発明は、膨大なテキスト
記事からユーザの要求・興味にあったものを選出して定
期的にユーザに提供する情報フィルタリング装置に関す
る。
【0002】
【従来の技術】近年、ワードプロセッサーや電子計算機
の普及、および計算機ネットワークを介した電子メール
や電子ニュースの普及などに伴い、文書の電子化は加速
的に進みつつある。
【0003】電子出版という言葉が示すように、今後は
新聞、雑誌、本の情報も電子的に提供されることが一般
的になると考えられる。これにより、個人にとってリア
ルタイムで入手可能となるテキスト情報の量は膨大にな
っていくと予測される。
【0004】これに伴い、新聞や雑誌などの膨大なテキ
スト記事からユーザの要求・興味にあったものを選出し
て定期的にユーザに提供する情報フィルタリングシステ
ムあるいは情報フィルタリングサービスの需要が高まり
つつある。
【0005】従来より実現されている情報フィルタリン
グシステムは、ユーザの要求や興味を表現したユーザプ
ロファイルに合致する記事を検索し、これらの見出しの
リストあるいは記事全体をならべてユーザに提示するも
のである。
【0006】通常、ユーザプロファイルは、ユーザが興
味をもっているトピックをいくつか指定することにより
作成される。
【0007】また、提示された記事の有用性の判定をユ
ーザが行い、この情報をユーザプロファイルに反映させ
ることにより、次回以降の情報フィルタリングの適合率
を高めるというレレバンス・フィードバックという機能
が実現されている。
【0008】
【発明が解決しようとする課題】しかし、従来のシステ
ムでは、選定された記事が羅列されてユーザに提示され
るだけであるので、今回提示された記事同士の関係や、
今回提示された記事と前回までに提示された記事との関
係を把握することがユーザにとっては難しいという問題
点があった。
【0009】また、従来のような記事の単純な提示で
は、いかなるトピックのいかなる検索条件にマッチした
ためにその記事がユーザに提示されるに至ったか、ま
た、提示された記事を他のユーザはどのように読んでい
るかなどの情報が欠落していたため、有用性の判定には
多大な労力を必要とし、その一貫性を保つことが難しい
という問題点があった。
【0010】また、情報フィルタリングシステムにおい
ては、重要記事を選出した後にさらに、その記事内の重
要なテキストを部分的に選出するという二重のフィルタ
リングを行うことは、長い記事からの情報収集を効率的
にするという点で有効である。しかし、従来では、機械
的に適当な長さのテキストを抜粋表示しているにすぎな
かったため、余分な情報が混在していたり、必要な情報
が欠けていたりするという問題点があった。
【0011】また、従来では、ニュースソースから配信
されるテキストと検索条件との類似度にしたがってユー
ザに提供するテキストを選択するだけであったため、同
じ内容のテキストであってもばらばらに出力される等の
問題があった。
【0012】この発明は上述の事情に鑑みてなされたも
のであり、情報フィルタリングによってユーザに提供さ
れる記事同士の関連性をユーザに提示できるようにし、
ユーザに記事同士の関連性を把握させることが可能な情
報フィルタリング装置を提供することを第1の目的とす
る。
【0013】また、この発明は、提示されている記事が
いかなる検索条件を満足したのかがユーザにわかるよう
にすることにより、情報フィルタリングに対するユーザ
の理解と信頼を深めることが可能な情報フィルタリング
装置を提供することを第2の目的とする。
【0014】さらに、この発明は、記事の種類に応じて
ユーザに提示する要約あるいは抄録の長さを調節できる
ようにし、2重フィルタリングを効率的に行うことがで
きる情報フィルタリング装置を提供することを第3の目
的とする。
【0015】また、この発明は、互いに内容が重複する
記事同士をグループ化あるいは関連づけしてユーザに提
供できるようにし、ユーザがテキスト記事を読むための
手間を大幅に軽減することが可能な情報フィルタリング
装置を提供することを第4の目的とする。
【0016】
【課題を解決するための手段】この発明は、複数の情報
源からテキストやイメージなどの記事の配信を受け、そ
れら配信された記事の中から所定の記事を選出してユー
ザに提示する情報フィルタリング装置において、ユーザ
毎に予め指定された検索条件を保持する手段と、配信さ
れた記事を検索し、ユーザ毎に検索条件に合致する記事
を選定する記事検索手段と、この記事検索手段によって
選定された記事同志または選定された記事と他の記事と
の間の類似度を算出し、その類似度に従って記事毎に関
連記事を決定する手段と、決定された関連記事の情報を
前記選定された記事に付加してユーザに提示する手段と
を具備することを特徴とする。
【0017】この情報フィルタリング装置においては、
例えば記事表現を記事間で比較することによって記事同
志の類似度が算出され、その類似度に従って、ユーザに
提示される記事とそれに関連する関連記事が決定され
る。この関連記事の情報は、ユーザに提示される記事の
本文情報などに付加されてユーザに送られる。類似度計
算を行う対象としては、今回到着した記事同士、または
今回到着した記事と前回までに到着した記事との間で行
うことが好ましい。これにより、記事検索手段によって
選定されている記事同士の関係や、今回選定された記事
と過去のフィルタリングで選定された記事との関係など
が明確になり、記事同士の関連性などをユーザに知らせ
ることができる。
【0018】また、記事検索手段によって選定された記
事同志の類似度を算出することによって重複記事の存在
を調べれば、重複記事の本文情報についてはユーザに提
示せずに、その重複記事の見出しなどの情報だけを関連
記事情報として付加してユーザに提示することもでき
る。これにより、例えば異なる複数の情報源から得られ
た同一内容に関する記事が、重複してユーザに提示され
ることを自動的に回避することができる。
【0019】また、この発明は、複数の情報源からテキ
ストやイメージなどの記事の配信を受け、それら配信さ
れた記事の中から所定の記事を選出してユーザに提示す
る情報フィルタリング装置において、ユーザ毎に予め指
定された検索条件を保持する手段と、配信された記事を
検索し、ユーザ毎に検索条件に合致する記事を選定して
ユーザに提示する記事検索手段と、この記事検索手段に
よって選定された記事が満足した検索条件を示す情報を
各記事に付加してユーザに提示する手段を具備し、その
記事が選択された根拠をユーザに知らせることができる
ようにしたことを特徴とする。
【0020】この構成によれば、提示されている記事が
ユーザの選択したトピックのうちいずれに適合したもの
であるかなど、提示されている記事がいかなる検索条件
を満足したのかがユーザに明示されるため、何故その記
事が提示されているかがユーザに分かりやすくなり、記
事の有用性の判定が容易になる。
【0021】したがって、既にユーザに送信された各記
事がユーザにとって有用であったか否かなどの情報につ
いてユーザからフィードバックを受け、その情報を反映
して検索条件を修正するレレバンス・フィードバック機
能をさらに設けることにより、記事が選択された根拠の
提示を、そのレレバンス・フィードバック機能に有効利
用できるようになる。
【0022】また、記事が選択された根拠の代わりに、
提示されている記事が他のユーザによってどのように読
まれているかをユーザに提示することによっても、他の
ユーザの判断を参考にしたレレバンス・フィードバック
が可能になり、レレバンス・フィードバックの有効利用
を図ることができる。
【0023】また、この発明は、複数の情報源からテキ
ストやイメージなどの記事の配信を受け、それら配信さ
れた記事の中から所定の記事を選出してユーザに提示す
る情報フィルタリング装置において、ユーザ毎に予め指
定された検索条件を保持する手段と、配信された記事を
検索し、ユーザ毎に検索条件に合致する記事を選定して
ユーザに提示する記事検索手段と、この記事検索手段に
よって選定された記事の種類に応じた長さの要約または
抄録を生成し、その要約または抄録をユーザに提示する
手段を具備することを特徴とする。
【0024】この構成によれば、記事の種類に応じた長
さの要約あるいは抄録が作成されてそれがユーザに提示
されるため、ユーザに提示されるテキストのうち、ユー
ザにとって有用であるテキスト情報の占める割合が高く
なる。これにより、効率的な情報収集が可能になる。
【0025】記事の種類の区分としては、その記事が満
足したトピックなどの検索条件の違いや、その記事の発
行日時などの記事そのものの属性の違いなどを利用する
ことが好ましい。例えば、ユーザが検索条件として複数
のトピックを指定し、且つそれらトピックに優先度を設
定した場合には、優先度の高いトピックに該当する記事
が検索される程、要約・抄録のサイズを長くでき、ユー
ザにとって有用であるテキスト情報の占める割合が高く
なる。
【0026】また、この発明は、少なくとも1つ以上の
情報源からテキストやイメージなどの記事の配信を受け
る手段と、あらかじめユーザが指定した検索条件と配信
された記事との類似度を算出する手段と、算出した類似
度の順に記事をソートして、一定の数の記事、あるいは
あらかじめ定めた閾値以上の類似度を有する記事のみを
類似度の順で出力する出力手段を有する情報フィルタリ
ング装置において、記事間の類似度を算出する手段を具
備し、その算出した記事間類似度にしたがって記事のグ
ループ化、関連づけ、あるいは出力記事の選択制御を行
うことを特徴とする。
【0027】この情報フィルタリング装置においては、
関連する記事同士がグループ化あるいは関連づけて利用
者に提供することが可能となる。従来のように関連のあ
るテキストが、順不同で出力された場合には、利用者は
テキストごとに内容を理解するために頭を切り替える必
要が生じ、フィルタリング結果全体を理解するための手
間がかかることになるが、この発明の情報フィルタリン
グ装置では、関連する記事同士がグループ化あるいは関
連づけて利用者に提供されるため、利用者の手間を大幅
に軽減することができる。
【0028】記事間類似度は当日配信された記事間のみ
でなく、前日以前にユーザに出力した記事との間の類似
度も求め、出力記事には、当日の記事だけからなる記事
グループか、それ以前の日の記事も含まれているのかを
区別するための情報を付加することが好ましい。これに
より、利用者は、関連記事をさらに効率よく整理して読
むことが可能となる。
【0029】
【発明の実施の形態】以下、図面を参照してこの発明の
実施の形態について説明する。
【0030】まず、図1を参照して、この発明の情報フ
ィルタリングシステム全体の構成について説明する。
【0031】情報フィルタリングシステムは、新聞社、
通信社、または出版社などの複数の情報源2からテキス
トやイメージを含むテキスト記事の配信を受け、それを
定期的に加入ユーザ端末3それぞれに送信する情報提供
システムであり、このシステムの情報提供サービスは情
報フィルタリングセンタ1によって実現されている。情
報フィルタリングセンタ1は、通信網を介して複数の情
報源2および複数の加入ユーザ端末3に接続された1つ
の計算機システムによって実現されており、ここには、
情報フィルタリングのための制御や処理を行う中央処理
装置4、プログラム並びにデータを格納する半導体メモ
リ、磁気ディスク、光ディスクなどの記憶装置5、回線
や電波などの通信網介して情報源2からテキスト記事を
受信する受信部6、回線や電波などの通信網介してユー
ザ端末3にテキスト記事を送信する送信部7などから構
成されている。
【0032】各ユーザ端末3は、例えばパーソナルコン
ピュータやワークステーションなどの情報処理端末であ
り、情報フィルタリングセンタ1から送信されたテキス
ト記事を受信するテキスト情報受信部8と、受信したテ
キスト記事を画面表示する表示部9などを備えている。
【0033】情報フィルタリングセンタ1は、図2に示
されているように、ユーザプロファイル10と称する一
種の検索条件をユーザ毎に保持しており、そのユーザプ
ロファイル10に従って該当するユーザに提供すベき記
事を検索する。ユーザプロファイル10は、ユーザによ
って指定された複数のトピックなどから構成されてお
り、それらトピックに合致する記事が検索および選出さ
れてユーザに送られる。次に、この情報フィルタリング
センタ1の具体的な構成について説明する。
【0034】(実施形態1)図3には、この発明の第1
実施形態に係わる情報フィルタリングセンタ1の構成が
示されている。図中、実線の矢印はデータの流れを示し
ている。
【0035】情報フィルタリングセンタ1は、図示のよ
うに、ユーザプロファイル生成部11、ユーザプロファ
イル記憶部12、記事情報抽出部13、記事検索部1
4、記事選出部15、記事間類似度計算部16、提示情
報生成部17、および記事情報記憶部18から構成され
ている。これら構成要素のうち、破線で囲まれているユ
ーザプロファイル生成部11、記事情報抽出部13、記
事検索部14、記事選出部15、記事間類似度計算部1
6、および提示情報生成部17は、例えば図1の中央処
理装置14によって実行されるソフトウェアによって実
現でき、またユーザプロファイル記憶部12および記事
情報記憶部18は記憶装置5によって実現できる。
【0036】ユーザプロファイル生成部11は、予め各
ユーザによって指定される要求・興味などを解析して検
索のために必要なユーザプロファイルをユーザ毎に生成
する。これらユーザプロファイルはユーザプロファイル
記憶部12に記憶される。記事情報抽出部13は、各情
報源2から到着したテキスト記事から、検索や記事同士
の類似度計算に必要な情報を抽出し、それを生のテキス
ト記事と共に記事情報記憶部18に格納する。
【0037】記事検索部14は、各情報源2から到着し
た記事の中からユーザプロファイルに合致するものを検
索する。この検索処理では、ユーザプロファイルと到着
記事との間の類似度が調べられ、類似度の高い順に記事
がソートされる。記事選出部15は、検索結果からユー
ザに提示する記事を選出するためのものであり、例えば
類似度の値があるしきい値を越えた記事すべて、または
類似度の高い上位のいくつかの記事が選択される。
【0038】記事間類似度計算部16は、記事間の類似
度を調べるためのものであり、選択された記事同志の類
似度を算出する。提示情報生成部17は、記事選出結果
と記事間類似度計算結果をもとにユーザに提示する記事
情報を生成する。記事情報記憶部18には、検索のため
の記事情報や記事間類似度計算結果などが記憶される。
以下、これらユーザプロファイル生成部11、記事情報
抽出部13、記事検索部14、記事選出部15、記事間
類似度計算部16、および提示情報生成部17それぞれ
の具体的な処理内容について説明する。
【0039】図5には、ユーザプロファイル生成部11
の処理の流れが示されている。
【0040】ユーザプロファイル生成部11は、入力と
して個々のユーザの要求・興味を受けつける(ステップ
S1)。ユーザの要求・興味は、「○○と××に関する
記事が読みたい」といった自然言語や、興味のあるトピ
ック(話題)に頻出するキーワードの集合や、それらに
優先順位や重みをつけたもの、または通常の文書検索に
おける検索式のようなもので表される。
【0041】ユーザプロファイル生成部11は、これに
対して単語辞書、同義語辞書などを利用して単語抽出、
同義語展開などの言語処理を行い(ステップS2)、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する(ステップS3、S4)。作成されたユー
ザプロファイルはユーザ毎にユーザプロファイル記憶部
12に記憶され、記事検索のための検索条件として利用
される。
【0042】図5には、記事情報抽出部13の処理の流
れの一例が示されている。
【0043】記事情報抽出部13は、入力として情報源
から到着した記事を受けつけ(ステップS11)、これ
に対して文書解析用の辞書や情報抽出用の辞書を用い
て、形態素解析、構文解析、書式解析などを行い、記事
の情報源や日付、文字や単語その他の文書構成要素の頻
度情報や出現位置、5W1H的な情報などの抽出を行う
(ステップS12)。次いで、記事情報抽出部13は、
これらの抽出された情報の集合体として記事を表現する
(ステップS13)。例えば、出現した単語の頻度を要
素とするベクトルにより記事を表現したり、5W1Hの
テンプレートに実現値を代入したものにより表現したり
する。このような記事の表現例をそれぞれ図6、図7に
示す。図6は、その記事に出現した単語(半導体、メモ
リー、摩擦、不況、生産、…)の出現頻度(14、9、
5、2、3)を要素とした頻度ベクトルであり、また図
7は、情報源、文字数、記事見出し、トピック、日時、
場所、主語、主動詞……などを項目とするテンプレート
である。
【0044】記事情報抽出部13は、このようにして記
事を表現した後、記事検索を高速に実現するための索引
付け、つまりインデクシング処理も行い(ステップS1
4)、そしてベクトルやテンプレートで表現して記事お
よびインデクシング情報を記事情報記憶部18に記憶す
る(ステップS15)。
【0045】図8には、記事検索部14の処理の流れが
示されている。
【0046】記事検索部14は、記事情報抽出部13に
よって抽出された記事情報を参照し、到着した記事の中
からユーザプロファイルに適合するものを検索する。
【0047】これは、ユーザプロファイルと到着した記
事の各々との類似度を算出することに相当する。この類
似度は、検索の方式によって「ユーザプロファイルに適
合する」「ユーザプロファイルに適合しない」などの離
散値をとる場合もあるし、よく適合している記事ほど類
似度の値が高くなるように連続値をとる場合もある。こ
こでは、より一般的である、類似度が連続値をとる場合
について説明する。
【0048】記事検索部14は、各ユーザのユーザプロ
ファイルについて、以下の処理を行う。
【0049】まず、ユーザプロファイル記憶部12から
プロファイルを読み込む(ステップS21)。次に、記
事検索部14は、変数iに1を代入した後(ステップS
22)、i番目の記事(1番目の記事)とユーザプロフ
ァイルとの類似度を計算する(ステップS23)。この
類似度計算は、通常の検索処理に相当するもので、記事
情報記憶部18に格納されている記事の表現や検索イン
デックスが参照される。
【0050】次いで、記事検索部14は、変数iの値を
+1更新した後、そのときのiの値が到着記事数よりも
大きいか否かを調べ(ステップS24,S25)、大き
くない場合には類似度計算されてない記事が残っている
と認識し、iの値が到着記事数よりも大きくなるまで、
ステップS23〜S25を繰り返す。到着した全ての記
事に対してユーザプロファイルとの類似度の計算が終わ
ると、すなわち、到着した全ての記事を検索対象とした
検索処理が終わると、記事検索部14は、到着した記事
をユーザプロファイルとの類似度が高い順にソートし、
記事のランキングを行う(ステップS26)。このラン
キングの結果は、記事情報記憶部18に記憶される。ラ
ンキング結果の一例を図9に示す。
【0051】図10に、記事選出部15の処理の流れを
示す。
【0052】記事選出部15は、記事検索部14により
検索されランキングされた到着記事を記事情報記憶部1
8から読み込み(ステップS31)、その中から、実際
にユーザに提示するものを選出する(ステップS3
2)。ユーザに提示することが決まった記事の情報は、
再び記事情報記憶部18に格納される。
【0053】記事の選出の方法としては、例えば、ユー
ザに提示する記事の件数Nをユーザ側があるいはセンタ
側が予め定めておき、ランキング上位N件を提示するこ
とにしたり、あるいは、ユーザプロファイルとの類似度
がある閾値以上の記事を提示することにするなどが考え
られる。図11は、図9のようなランキング結果が得ら
れている場合にその上位10件を選出した例を示してい
る。
【0054】また図12は、図9のようなランキング結
果が得られている場合にユーザプロファイルとの類似度
が0.86以上の記事を選出した例を示している。
【0055】さらに、図13は、一人のユーザに対して
複数の検索及びランキングが行われた場合において、こ
れら複数のランキング結果の上位部分をマージしてユー
ザに提示する記事を選出する例を示している。
【0056】この例では、「半導体技術」、「低価格パ
ソコン」、「人工知能」の3つのトピックに関する検索
が別個に行われており、3つのランキング結果の上位か
ら、記事A1、B1、C1、A2、B2が選出されてい
る。
【0057】記事A1及びA2はトピック「半導体技
術」に適合したもの、記事B1及びB2はトピック「低
価格パソコン」に適合したもの、そして記事C1はトピ
ック「人工知能」に適合したものである。
【0058】ここでの記事の選出の方法としても、図1
1のように一定件数を選出する、図12のように類似度
が一定値以上の記事を選出するなどが考えられる。
【0059】図14には、記事間類似度計算部16の処
理の流れが示されている。
【0060】記事検索部14が、ユーザプロファイルと
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
【0061】類似度計算は、例えば図6や図7のような
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
【0062】ここでは、新聞社などの記事の情報源2は
複数存在するものとし、記事間類似度計算の対象となる
のは、異なる情報源から到着した記事同士、例えば、新
聞社Mから到着した記事と新聞社Nから到着した記事と
する。
【0063】異なる情報源から到着した記事同士の全て
の組合せについて記事間類似度を計算してもよいが、こ
こでは、記事選出部15により選出された記事に対して
のみ記事間類似度を計算するという計算コストの低い方
法について説明する。
【0064】すなわち、記事間類似度計算部16は、ま
ず、記事選出部15により選出された記事を記事情報記
憶部18から読み込む(ステップS41)。次いで、記
事間類似度計算部16は、読み込んだ記事のうち、異な
る情報源から到着したもの同志の類似度を計算し、その
結果を記事情報記憶部18に格納する(ステップS4
2)。
【0065】以下、記事間類似度計算の具体例を説明す
る。
【0066】図15には、記事選出部15により選出さ
れた、異なる情報源から到着した記事の例が示されてい
る。この例では、記事A〜Dの4つの記事がユーザに提
示されることになっている。
【0067】記事A及びDは新聞社Mから到着した記
事、記事Bは新聞社Nから到着した記事、そして記事C
は出版社Oから到着した記事である。
【0068】この場合、記事Aと記事B、記事Aと記事
C、記事Bと記事C、記事Cと記事Dの組合せについて
記事間類似度が計算される。記事Aと記事Dは同一の情
報源から到着した記事であるため、類似度計算を行わな
い。
【0069】図16には、提示情報生成部17の処理の
流れが示されている。
【0070】提示情報生成部17は、記事情報記憶部1
8から、記事選出部15により選出された記事の情報及
び記事間類似度計算部16により計算された記事間類似
度を読み込む(ステップS51、S52)。
【0071】そして、提示情報生成部17は、互いに類
似度が高く、かつ情報源が異なる記事の集合を、重複記
事の集合として分類する(ステップS53)。ここで、
重複記事とは、同じ出来事に対して複数の情報源が独自
に作成した記事のことであり、内容的には同一あるいは
ほぼ同じと考えてよい記事をいう。
【0072】この後、提示情報生成部17は、重複記事
の提示を回避するために、重複記事集合から、代表とし
てユーザに提示する記事をひとつ、一般にはN個選択す
る(ステップS54)。そして、提示情報生成部17
は、選択した記事の本文に対して、選択しなかった記事
の情報を関連記事情報として付加することなどにより、
ユーザに提示する情報を生成し、それを出力する(ステ
ップS55,S56)。
【0073】ここで、重複記事と関連記事情報の具体例
を説明する。
【0074】図17は、一件のプレスリリースから重複
記事が派生する例を示している。ある出来事について情
報を記したプレスリリース記事Pが、新聞社M,N,O
に送られると、各新聞社はこれを編集し、コメントを加
えるなどして、独自の記事M,N,Oを作成する。記事
M,N,O,Pが各情報源から情報フィルタリングセン
ターに送られるとすると、記事M,N,O,Pは重複記
事となる。
【0075】また、図18は、一件の出来事から重複記
事が作成される例を示している。
【0076】この例では、新聞社M,N,Oが同一の出
来事に対して独自に取材を行い、記事M,N,Oが作成
されている。これらが情報フィルタリングセンタ1に送
られるとすると、記事M,N,Oは重複記事となる。
【0077】情報フィルタリングの本来の主旨は、膨大
な情報の中にある所望の情報をできるだけ効率よくユー
ザにアクセスさせることであるから、一般には、ユーザ
に提示する記事に重複記事が多く含まれていることは好
ましくないと考えられる。例えば、図18の例におい
て、ユーザに記事M,N,Oを全て提示してしまうと、
ユーザはひとつの出来事についての情報を得るのに3つ
の記事を読まなければならなくなってしまう。
【0078】提示情報生成部17は、以上のような重複
記事の提示を回避するために、重複記事集合から、代表
としてユーザに提示する記事をひとつ、一般にはN個選
択する。以後、ひとつだけ選択する場合についてのみ説
明する。
【0079】図19に、図15の4つの記事に対して記
事間類似度計算を行った結果得られる重複記事集合の例
を示す。
【0080】この例では、記事AとC、記事BとDの類
似度が高かったため、ふたつの重複記事集合が得られて
いる。
【0081】提示情報生成部17は、一定の戦略に従っ
て、各重複記事集合から記事をひとつずつ選択する。
【0082】例えばユーザ側あるいはサービスセンタ側
が新聞社Mを最優先するように予め決めておいたとする
と、最終的にユーザに提示される記事は新聞社Mから到
着した記事A,Dとなる。
【0083】同様に、一般には情報量の一番多いプレス
リリースを最優先して選択することも考えられる。
【0084】また、検索結果のランキングで最も上位に
あったものを選択することも考えられる。
【0085】例えば図19において、ユーザプロファイ
ルと記事との類似度は重複記事集合1では記事Cが高
く、重複記事集合2では記事Dが高いので、最終的にユ
ーザに提示される記事は記事C,Dとなる。
【0086】さらに、記事の長さが最も長い、あるいは
最も少ないものを選択するなどの戦略も考えられる。
【0087】これまで述べてきた処理により、ユーザに
提示する記事の候補の中から重複記事が排除される。最
終的に排除された重複記事に関する情報は、各記事の本
文情報に付加してユーザに提示される。
【0088】図20に、排除された重複記事に関する情
報を記事の本文情報に付加して提示する例を示す。
【0089】この例では、ユーザに提示されている記事
の本文情報に加えて、この記事と内容が同一と判断され
た他の情報源の記事に関する情報が付加情報として与え
られている。具体的には、記事の見出しや情報源、文字
数、そして現在本文が提示されている記事との類似度な
どがリストアップされている。
【0090】この例では、「○×社が情報サービス事業
から撤退した」という内容の記事が○○新聞社、△△新
聞社、□□新聞社の3つの情報源から得られたが、ユー
ザに提示する記事としては○○新聞社の記事が選ばれた
ということになる。
【0091】このように排除された重複記事に関する情
報を記事の本文情報に付加して提示すると、内容的には
同じだが情報源が異なる記事を何度も読むことを回避で
き、かつ各情報源が同一の出来事に対してどのように報
道しているかの概観を得ることができると考えられる。
【0092】図21には、図20の関連情報提示形態の
変形例が示されている。
【0093】すなわち、図20はべたテキストとして関
連情報をユーザ端末に表示したが、図21では、付加情
報のテキスト部分がハイパーテキストなどで構造化され
ており、これを利用して排除された重複記事の本文にア
クセスすることを可能にしている。
【0094】この例では、付加情報のエリアにおける記
事見出しがマウスなどの装置により選択できるボタンに
なっており、ユーザは関連記事1を選択することによっ
て、その関連記事1の本文を参照することができる。
【0095】図22及び図22に、図21において関連
記事1が選択された場合に関連記事1の本文を表示する
例を示す。
【0096】図21において本文が表示されていた「半
導体協議の…」という記事は、図22においては付加情
報のエリアに見出しなどの情報のみが表示されており、
その代わりに本文情報のエリアには関連記事1の本文が
表示されている。
【0097】図22から図21の状態に戻すためには、
ユーザは図22の付加情報のエリアにおける「半導体協
議の…(元の記事)」というボタンを選択すればよい。
【0098】また図23においては、図21で表示され
ている情報を保持しながら、関連記事1の本文情報を新
たに開いたウィンドウ上に表示している。このような表
示方法をとれば、複数の重複記事を比較することが可能
となる。
【0099】図21の画面から図22の画面への移行
は、図24の処理の流れに従って次のように実行され
る。
【0100】提示情報生成部17は、図21に示されて
いるように提示記事の本文情報に関連記事の情報を付加
してユーザ端末3に画面表示させる(ステップS6
1)。次いで、関連記事のボタンが選択されるというイ
ベントが発生すると、提示情報生成部17は、選択され
た関連記事の本文情報を記事情報記憶部18から取り出
し(ステップS62,S63)、図22に示されている
ように、元の記事の情報を付加情報のエリアに、選択さ
れた関連記事の本文を本文情報エリアに表示する(ステ
ップS64)。
【0101】なお、このような画面切り替えは、センタ
1からユーザ端末3に予め関連記事の本文情報を送信し
ておけば、ユーザ端末3側の制御で行うこともできる。
【0102】図21の画面から図23の画面への移行
は、図25の処理の流れに従って次のように実行され
る。
【0103】提示情報生成部17は、図21に示されて
いるように提示記事の本文情報に関連記事の情報を付加
してユーザ端末3に画面表示させる(ステップS7
1)。次いで、関連記事のボタンが選択されるというイ
ベントが発生すると、提示情報生成部17は、選択され
た関連記事の本文情報を記事情報記憶部18から取り出
し(ステップS72,S73)、図23に示されている
ように、選択された関連記事の本文をウインドウ表示す
る(ステップS74)。
【0104】この画面切り替えについても、センタ1か
らユーザ端末3に予め関連記事の本文情報を送信してお
けば、ユーザ端末3側の制御で行うことができる。
【0105】また、図20や図21のように付加情報の
エリアに付加する関連記事は、前述の重複記事集合から
記事を選択するのと同様な戦略により絞り込みを行って
もよい。
【0106】図21〜23のように、重複記事集合を代
表して本文が表示されている記事から、それ以外の重複
記事の本文にアクセスできるようにすると、情報フィル
タリングシステムによって選択された代表記事が不適切
なものであった場合にも、ユーザが他の重複記事を選択
して読むことが可能となる。
【0107】例えば、情報フィルタリングシステムがユ
ーザの希望によりN新聞の記事を優先して選択する戦略
をとっていたとしても、ユーザがある出来事に関してだ
けはN新聞の記事ではなくプレスリリースを読みたいと
いった場合に有効である。
【0108】また、同一の出来事に対する複数の新聞社
の見解などを比較することも可能となる。
【0109】図26には、記事の重複が起こっている場
合に、ユーザに提示する記事の一覧表を重複記事情報と
ともに表示した例が示されている。
【0110】この例では、ユーザに提示する記事は4件
あるが、そのうちの3件目である「○×社 情報サービ
スビジネスから撤退」という記事には重複記事が2件存
在する。
【0111】各記事の見出しの後にはユーザプロファイ
ルと記事との類似度の値が表示されているが、重複記事
に関してはそれとは別に、元の記事と重複記事との類似
度の値も表示されている。これは重複記事である確から
しさを示していると言える。ここで、元の記事とは「○
×社 情報サービスビジネスから撤退」の記事などを指
す。
【0112】以上の説明では、ひとつのユーザプロファ
イルに対する処理を中心に述べてきた。
【0113】一般には、情報フィルタリングサービスを
受けるユーザは複数いるので、情報フィルタリングセン
タは、ユーザ毎にユーザプロファイルを保持し、フィル
タリングの各処理を行うことになる。
【0114】(実施形態1の変形例1)次に、記事間類
似度計算部16及び提示情報生成部17の他の構成例に
ついて説明する。
【0115】図27に、記事間類似度計算部16の処理
の流れを示す。
【0116】記事検索部14が、ユーザプロファイルと
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
【0117】類似度計算は、例えば図6や図7のような
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
【0118】ここでは、N回前までの情報フィルタリン
グで得られた記事情報が記事情報記憶部18に保存され
ているものとする。
【0119】例えば、情報フィルタリングサービスが一
日一回行われ、かつNを1とした場合、昨日の情報フィ
ルタリングで得られた記事情報は保存されているという
ことを意味する。以後、主にN=1として説明する。
【0120】このシステムでは、記事間類似度計算の対
象となるのは、今回到着した記事と、前回までに到着し
た記事との組である。
【0121】今回到着した記事と、前回までに到着した
記事との全ての組合せについて類似度計算を行ってもよ
いが、以後は、より計算コストの低い方式、つまり記事
選出部により今回選出された記事と、前回までにユーザ
に提示された記事との組合せについてのみ類似度計算を
行う場合について説明する。
【0122】すなわち、記事間類似度計算部16は、ま
ず、記事選出部15により選出された記事の情報を記事
情報記憶部18から読み込み、次いで、前回までのフィ
ルタリングでユーザに提示した記事の情報を記事情報記
憶部18から読み取る(ステップS81、S82)。そ
して、記事間類似度計算部16は、記事選出部15によ
り今回選出された記事と、前回までにユーザに提示され
た記事との組合せについて類似度計算を行い、その結果
を記事情報記憶部18に格納する(ステップS83)。
【0123】図28には、今回記事選出部15により選
出された記事の集合と、前回ユーザに提示された記事の
集合の例を示す。
【0124】この例では、前回はユーザには記事A,
B,C,Dが提示されており、今回は記事E,F,G,
Hが提示されようとしている。
【0125】この場合、類似度計算は、記事Aと記事
E、記事Aと記事Fといったように4×4=16の組合
せについて計算されることになる。
【0126】また、この変形例として、一定の条件を満
たす記事のみ類似度計算の対象としてもよい。
【0127】例えば、図28において、情報源が同じ記
事同士の類似度のみを計算することにすると、今回新聞
社Mから到着した記事Eに関する類似度計算は、前回新
聞社Mから到着した記事A,Bのみについて行えばよい
ことになる。
【0128】また、例えば、図28において、ユーザプ
ロファイルとの類似度が一定値以上の記事のみを類似度
計算の対象とすることも考えられる。
【0129】ユーザプロファイルとの類似度が0.8以
上の記事のみを対象とすると、記事Eと記事A、記事G
と記事Aの組合せのみ計算すればよいことになる。
【0130】図29には、提示情報生成部17の処理の
流れが示されている。
【0131】提示情報生成部17は、記事情報記憶部1
8から、今回記事情報選出部15により選出された記事
の情報及び前回までにユーザに提示された記事の情報及
び記事間類似度計算部16により計算された記事間類似
度を読み込む(ステップS91〜S93)。そして、今
回の記事の本文情報を前回までの関連記事の情報ととも
にユーザに提示する(ステップS94,S95)。
【0132】図30及び図31には、今回の記事の本文
情報に前回までの関連記事の情報を付加して提示する例
が示されている。
【0133】図30では、ユーザに今回初めて提示され
た「半導体協議の…」という記事の本文情報に加えて、
半導体に関する昨日までの記事の情報が付加情報として
与えられている。具体的には、前回までの記事の見出し
や情報源、文字数、そして今回提示された記事との類似
度などがリストアップされている。
【0134】この例では、今回提示されたのは○○新聞
の15日付の記事であり、前回までの関連記事としては
○△新聞及び○○新聞の14日付の記事が表示されてい
る。
【0135】また図31では、ユーザに今回提示された
「シリーズ:半導体摩擦(その3)」という記事の本文
情報に加えて、同じ○○新聞社から昨日までに到着した
「シリーズ:半導体摩擦(その1)」及び「シリーズ:
半導体摩擦(その2)」という記事に関する情報が表示
されている。
【0136】また、実施形態1で示した図21〜23
は、この例における図30及び図31の変形例にもなっ
ている。
【0137】すなわち、このシステムでも、実施形態1
と同様に、ユーザが前回までの関連記事の本文にアクセ
スできるようにすることが考えられる。
【0138】図21〜23では、本文情報と付加情報が
完全に分離されているが、本文情報中に前回までの記事
情報を埋め込んで提示することも考えれる。
【0139】図32に、今回の記事の本文情報中に前回
までの関連記事の情報を埋め込んで提示する例を示す。
【0140】この例では、「○○沖の××地震 再び活
発化」という19日付けの記事の本文が表示されている
が、その第一文の「○○県○○沖で先月14日から始ま
った××地震は…」の一部がマウスなどで選択できるボ
タンになっている。
【0141】ユーザがこれを選択すると、前回までの記
事のうちこの文と類似した情報を含む記事に関する情報
が表示される。
【0142】図33は、図31においてユーザが第一文
を選択した場合に、その文と関係の深い前回までの記事
のリストを表示した例である。
【0143】この例では、「○○沖で地震 マグニチュ
ード4」などの、14日付の記事の見出しや情報源、文
字数、今回の記事との類似度などがリストアップされて
いる。
【0144】図34は、図33においてユーザが「○○
沖で地震 マグニチュード4」という関連記事を選択し
た場合に、その記事の本文を表示した例である。
【0145】また、図32においてユーザが第一文を選
択した直後に、図34のように関連記事の本文をひとつ
以上表示してもよい。
【0146】図32のように、今回の記事の本文情報中
に前回までの関連記事の情報を埋め込んで提示するとい
う形態を実施するためには、今回の記事と前回までの記
事との類似度を計算するかわりに、今回の記事の本文の
各構成要素と前回までの記事との類似度を計算すること
になる。
【0147】本文の構成要素としては、段落、文、節、
句、単語、などが考えられる。
【0148】また、これをさらに変形して、前回までの
関連記事情報も記事単位ではなく本文の構成要素単位で
提示してもよい。
【0149】例えば、図34のように関連記事の全文を
表示するかわりに、第一段落のみを表示することが考え
られる。
【0150】以上のように、今回提示された記事からそ
れと関係のある前回までの記事にアクセスできるように
すれば、時間の経過とともに状況が変わっていくような
出来事についてその経緯を把握することや、連載記事な
ど複数の記事にわたる情報を把握することが容易にな
る。
【0151】さらに、今回の記事を読んだときに、過去
に提示された記事を思い出して、その内容を再確認した
くなった場合などにも有効である。
【0152】(実施形態1の変形例2)次に、記事間類
似度計算部16及び提示情報生成部17のさらに他の構
成例について説明する。
【0153】図35には、記事間類似度計算部16の処
理の流れが示されている。
【0154】記事検索部14が、ユーザプロファイルと
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
【0155】類似度計算は、例えば図6や図7のような
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
【0156】この例において記事間類似度計算の対象と
なるのは、今回到着した記事同士の組合せである。
【0157】到着した記事全てについて類似度計算を行
ってもよいが、以後、より計算コストの低い、今回記事
選出部15により選出された記事同士についてのみ類似
度計算を行う場合について説明する。
【0158】今回の記事同士について類似度計算を行う
点では、実施形態1と同じであるが、実施形態1が情報
源の異なる記事間に対して計算を行っていたのに対し、
ここではそのような限定はしていない。
【0159】図15のように記事選出部15により4つ
の記事が選出された場合、記事間類似度計算部16は、
それら記事を記事情報記憶部18から読取り(ステップ
S101)、記事Aと記事B、記事Aと記事C、記事A
と記事D、記事Bと記事Dといったように全ての組合せ
について類似度計算を行う(ステップS102)。
【0160】また、一定の条件を満たす記事のみ類似度
計算の対象としてもよい。
【0161】図36には、提示情報生成部17の処理の
流れが示されている。
【0162】提示情報生成部17は、記事情報記憶部1
8から、記事情報選出部15により選出された記事の情
報及び記事間類似度計算部16により計算された記事間
類似度を読み込む(ステップS111,S112)。そ
して、提示情報生成部17は、今回の記事の本文情報を
今回の他の関連記事の情報とともにユーザに提示する
(ステップS113,S114)。
【0163】図37に、今回の記事の本文情報を今回の
他の関連記事の情報とともに提示する例を示す。
【0164】この例では、15日付の「半導体協議の
…」という記事の本文情報に加えて、同じ15日付けの
半導体に関する記事の情報が付加情報として与えられて
いる。これにより、実施形態1における重複記事が表示
されてしまう可能性があるが、このような場合には実施
形態1の重複記事削除処理を行ってもよい。
【0165】また、図37の付加情報のエリアに表示さ
れている「××社 半導体シェア独占…」という記事の
本文情報を見るときには、図38のように「半導体協議
の…」という記事が付加情報のエリアに表示されること
になる。
【0166】また、実施形態1で示した図21〜23
は、この例の図37及び図38の変形例にもなってい
る。
【0167】すなわち、実施形態1と同様に、ユーザが
当日の関連記事の本文に直接アクセスできるようにする
ことが考えられる。
【0168】(記事間類似度の記事提示順序への反映)
これまでは、主に個々の記事をユーザに提示する際の関
連記事情報の付加について述べてきたが、今回の記事同
士の記事間類似度を利用して、ユーザに提示する記事の
順序を決定することも可能である。
【0169】図39に、記事間類似度を記事の提示順序
に反映させる例を示す。
【0170】この例では、ユーザプロファイルは半導体
技術、低価格パソコン、人工知能という3つの異なる分
野に関する語の集合であるとする。
【0171】これにより検索を行うと、図39(a)の
ように、3つの異なる分野の記事が混在した検索結果が
得られる。
【0172】ここで、例えば上位8件、あるいはユーザ
プロファイルとの類似度が0.80以上の記事を選択
し、そのままの順序でユーザに提示すると、ユーザは半
導体、低価格パソコン、人工知能、半導体、低価格パソ
コン、のような順序で記事を読むことになってしまう場
合がある。
【0173】ユーザプロファイルとの類似度が近い順に
記事を読むことが有効な場合もあると考えられるが、こ
のように複数分野の記事が混在している場合には、図3
9(b)のように、内容の類似した記事を集め、それを
ひとかたまりにして表示した方がユーザにとって分りや
すいと考えられる。
【0174】この例では、半導体に関する記事が初めの
3件、低価格パソコンに関する記事が次の3件、そして
残りの2件が人工知能に関するものとなっている。
【0175】以上のように、この実施形態1のシステム
では、頻度ベクトルなどを使用して記事間でその表現を
比較することによって記事同志の類似度が算出され、そ
の類似度に従って、ユーザに提示される記事に関連する
関連記事が決定される。この関連記事の情報は、ユーザ
に提示される記事の本文情報に付加されてユーザに送ら
れる。類似度計算を行う対象としては、今回提示されて
いる記事同士、または今回到着した記事と前回までに到
着した記事との間で行うことが好ましい。これにより、
今回提示されている記事同士の関係や、今回提示されて
いる記事と過去のフィルタリングで提示された記事との
関係が明確になり、記事同士の関連性などをユーザに知
らせることができる。
【0176】また、記事同志の類似度を算出することに
よって重複記事の存在を調べれば、重複記事の本文情報
についてはユーザに提示せずに、その重複記事の見出し
などの情報だけを関連記事情報として付加してユーザに
提示することもできる。これにより、例えば異なる複数
の情報源から得られた同一内容に関する記事が、重複し
てユーザに提示されることを自動的に回避することがで
きる。
【0177】よって、一回の情報フィルタリングでユー
ザに複数の記事を提示する際、記事間の関係を明確にし
て提示できるようになり、ユーザにとって記事内容の理
解が容易になると考えられる。
【0178】(実施形態2)次に、この発明の情報フィ
ルタリングシステムの第2の実施形態について説明す
る。このシステム全体の構成は、図1と同様であり、ユ
ーザ毎にユーザプロファイルが保持しており、そのユー
ザプロファイルを利用して記事の検索が行われる。ここ
で、ユーザプロファイルとは、前述したように、ユーザ
の関心が高いトピックに適合する記事を検索するための
検索条件のことをいう。
【0179】図40に、実施形態2で使用されるユーザ
プロファイルの概念図を示す。
【0180】この例では、あるユーザAは「半導体技
術」、「半導体貿易」という2つのトピックを選択して
いる。また別のユーザBは、「半導体貿易」、「低価格
パソコン」、「人工知能」という3つのトピックを選択
している。
【0181】このとき、ユーザAのユーザプロファイル
は、「半導体技術」に関する記事を検索するための検索
条件及び「半導体貿易」に関する記事を検索するための
検索条件から構成される。同様に、ユーザBのユーザプ
ロファイルは、「半導体貿易」に関する記事の検索条
件、「低価格パソコン」に関する記事の検索条件、及び
「人工知能」に関する記事の検索条件から構成される。
【0182】図41には、実施形態2に係わる情報フィ
ルタリングセンタ1の構成が示されている。情報フィル
タリングセンタ1は、図示のように、ユーザプロファイ
ル生成部21、トピック記憶部22、記事情報抽出部2
3、記事検索部24、記事選出部25、付加情報生成部
26、および記事情報記憶部27から構成されている。
これら構成要素のうち、破線で囲まれているユーザプロ
ファイル生成部21、記事情報抽出部23、記事検索部
24、記事選出部25、付加情報生成部26は、例えば
図1の中央処理装置14によって実行されるソフトウェ
アによって実現でき、またトピック記憶部22および記
事情報記憶部27は記憶装置5によって実現できる。
【0183】ユーザプロファイル生成部21は、入力と
して個々のユーザの要求・興味を受けつける。ユーザの
要求・興味は、「○○と××に関する記事が読みたい」
といった自然言語や、興味のあるトピックに頻出するキ
ーワードの集合や、それらに優先順位や重みをつけたも
の、または通常の文書検索における検索式のようなもの
で表される。
【0184】ユーザプロファイル生成部21は、これに
対して単語抽出、同義語展開などの言語処理を行い、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する。ユーザプロファイルはユーザ毎にトピッ
ク記憶部22に記憶される。また、ユーザプロファイル
生成部21は、既にユーザに送信された各記事がユーザ
にとって有用であったか否かなどの情報についてユーザ
からフィードバックを受け、その情報を反映してトピッ
ク記憶部22の検索条件を修正するというレレバンスフ
ィードバック機能も有している。
【0185】記事情報抽出部23は、入力として情報源
から到着した記事を受けつけ、これに対して形態素解
析、構文解析、書式解析などを行い、記事の情報源や日
付、文字や単語その他の文書構成要素の頻度情報や出現
位置、5W1H的な情報などの抽出を行う。そして、記
事をこれらの抽出された情報の集合体として表現する。
例えば、出現した単語の頻度を要素とするベクトルによ
り記事を表現したり、5W1Hのテンプレートに実現値
を代入したものにより表現したりする。このような記事
の表現例は、それぞれ図6および図7で説明した実施形
態1のものと同じである。
【0186】記事情報抽出部23は、記事検索を高速に
実現するためのインデクシング処理も行う。記事情報抽
出部23により抽出された記事情報は、記事情報記憶部
27に記憶される。
【0187】次に、図42を参照して、記事検索部24
の処理の流れを説明する。
【0188】記事検索部24は、トピック記憶部22に
記憶されている各トピックの検索条件と、記事情報抽出
部23によって抽出された記事情報とを参照し、各トピ
ックに適合する到着記事を検索する。これは、トピック
と到着記事との類似度を算出することに相当する。この
類似度は、検索の方式によって「トピックに適合する」
「トピックに適合しない」などの離散値をとる場合もあ
るし、よく適合している記事ほど類似度の値が高くなる
ように連続値をとる場合もあるが、ここでは、より一般
的である類似度が連続値をとる場合について説明する。
【0189】記事検索部24は、各トピックについて、
以下の処理を行う。
【0190】まず、記事検索部24は、変数iに1を代
入した後(ステップS121)、i番目のトピック(ト
ピック1)の検索条件をトピック記憶部22から取り出
す(ステップS122)。この後、記事検索部24は、
変数jに1を代入した後(ステップS123)、トピッ
クi(トピック1)と到着記事j(到着記事1)との類
似度を計算し、満足された検索条件の情報と共に類似度
を記事情報記憶部27に格納する(ステップS12
4)。この類似度計算は、通常の検索処理に相当するも
ので、記事情報記憶部18に格納されている記事の表現
や検索インデックスが参照される。
【0191】次いで、記事検索部24は、変数jの値を
+1更新した後、そのときのjの値が到着記事数よりも
大きいか否かを調べ(ステップS125,S126)、
大きくない場合には類似度計算されてない記事が残って
いると認識し、jの値が到着記事数よりも大きくなるま
で、ステップS124〜S126を繰り返す。到着した
全ての記事に対してトピックiとの類似度の計算が終わ
ると、記事検索部24は、到着した記事をユーザプロフ
ァイルとの類似度が高い順にソートし、記事のランキン
グを行う(ステップS127)。このランキングの結果
は、記事情報記憶部27に記憶される。
【0192】この後、記事検索部24は、変数iの値を
+1更新した後、そのときのiの値が全トピック数より
も大きいか否かを調べ(ステップS128,S12
9)、大きくない場合には類似度計算されてないトピッ
クが残っていると認識し、iの値が全トピック数よりも
大きくなるまで、ステップS122〜S129を繰り返
す。
【0193】図43は、記事検索部24によりランキン
グされたトピックiに対する到着記事の概念図を示す。
このように、到着記事はトピック毎にランキングされ
る。
【0194】図44には、記事選出部25の処理の流れ
が示されている。
【0195】記事選出部25は、記事検索部24により
記事情報記憶部27に格納された各トピックの検索結果
の中から、各ユーザに提示する記事を選出する。
【0196】すなわち、まず、記事選出部25は、変数
iに1を代入した後(ステップS131)、ユーザi
(ユーザ1)のユーザプロファイルをトピック記憶部2
2から取り出す(ステップS132)。この後、記事選
出部25は、変数jに1を代入した後(ステップS13
3)、ユーザiのトピックj(トピック1)の検索結果
を記事情報記憶部27から取り出し、その中からユーザ
に提示する記事を選出する(ステップS135)。記事
の選出の方法としては、例えば、ユーザに提示する記事
の件数Nをユーザ側があるいはセンタ側が予め定めてお
き、ランキング上位N件を提示することにしたり、ある
いは、ユーザプロファイルとの類似度がある閾値以上の
記事を提示することにするなどが考えられる。選出され
た記事の情報は、記事情報記憶部27に格納される。
【0197】次いで、記事選出部25は、変数jの値を
+1更新した後、そのときのjの値がユーザiの指定し
たトピック数よりも大きいか否かを調べ(ステップS1
36,S137)、大きくない場合には選出されてない
他のトピックの検索結果が残っていると認識し、jの値
がユーザiのトピック数よりも大きくなるまで、ステッ
プS134〜S137を繰り返す。ユーザiのすべての
トピックに対しての記事選出が終わると、記事選出部2
5は、変数iの値を+1更新した後、そのときのiの値
が全ユーザ数よりも大きいか否かを調べ(ステップS1
38,S139)、大きくない場合には記事選出されて
ないユーザが残っていると認識し、iの値が全ユーザ数
よりも大きくなるまで、ステップS132〜S139を
繰り返す。
【0198】このような処理により、例えば、図45の
ように、「半導体貿易」、「低価格パソコン」、「人工
知能」という3つのトピックを選択しているユーザに対
しては、「半導体貿易」の検索結果、「低価格パソコ
ン」の検索結果、「人工知能」の検索結果の3つが取り
出され、これらのうち上位の記事の中からユーザに提示
するものが選出される。
【0199】図46には、付加情報生成部26の処理の
流れが示されている。
【0200】付加情報生成部26は、全てのユーザに対
して以下を行う。
【0201】まず、付加情報生成部26は、変数iに1
を代入した後(ステップS141)、ユーザi(ユーザ
1)のユーザプロファイルをトピック記憶部22から取
り出す(ステップS142)。次に、付加情報生成部2
6は、記事選出部25によって選出されたユーザ1に提
示する記事と、これらの記事が満足した検索条件に関す
る情報とを記事情報記憶部27から取り出す(ステップ
S143)。
【0202】ここで、記事が満足した検索条件に関する
情報とは、その記事がユーザの選択したトピックのうち
いずれに適合したか、トピックの検索条件の中のどのよ
うな条件に適合したか、などの情報をいう。検索条件と
は、どのような言語表現が記事中のどのような位置に、
どのような頻度で含まれていたか、記事の主題・行為や
その動作主は何かなどの記事が満たすべき条件を、通常
の文書検索で用いるブール式や自然言語、その他の記事
検索部により処理が可能な形式で記述したものをいう。
【0203】この後、付加情報生成部26は、記事選出
部25によって選出された記事に、これらの記事が満足
した検索条件に関する情報を付加してユーザiに提示す
る(ステップS144)。そして、付加情報生成部26
は、変数iの値を+1更新した後、そのときのiの値が
全ユーザ数よりも大きいか否かを調べ(ステップS14
5,S146)、大きくない場合には付加情報が生成さ
れてないユーザが残っていると認識し、iの値が全ユー
ザ数よりも大きくなるまで、ステップS142〜S14
6を繰り返す。
【0204】図47には、あるユーザのために選出され
た記事の記事見出しのリストに、各記事が適合したトピ
ックの情報を付加してそのユーザに提示した表示例が示
されている。
【0205】ここでは、ユーザは「半導体貿易」、「低
価格パソコン」、「人工知能」という3つのトピックを
選択しているものとする。
【0206】この例では、ユーザに6つの記事の記事見
出しが提示されており、これらの記事のうち3つが「半
導体貿易」に適合した記事、2つが「低価格パソコン」
に適合した記事、そして残りの1つが「半導体貿易」と
「低価格パソコン」の両方に適合した記事になってい
る。
【0207】このように、ひとつの記事が複数のトピッ
クに適合する場合があっても、その記事が提示された根
拠が表示される。
【0208】また、この例では、各行の最後の欄に、記
事検索部24により検索時に計算された、適合したトピ
ックと記事との類似度の値が表示されている。
【0209】記事番号6の記事は、2つのトピックに適
合したため、「半導体貿易」との類似度は1.05、
「低価格パソコン」との類似度は0.80、というよう
に2つの類似度が表示されている。
【0210】図48に、図47と同じユーザに対して各
トピックに適合した記事の件数情報を提示した表示例を
示す。
【0211】図48(a)では、ユーザの選択している
各トピックに適合した記事の件数情報を表形式で表示し
ている。
【0212】「半導体貿易」に適合した記事は、図47
における記事番号1、2、3、及び6の記事であるの
で、記事数は4と表示されている。同様に、「低価格パ
ソコン」に適合した記事は、図47における記事番号
4、5、及び6の記事であるので、記事数は3と表示さ
れている。また、この例では「人工知能」に適合する記
事はないので、記事数は0となっている。
【0213】ユーザに提示された記事数は、「半導体貿
易」の4件と「低価格パソコン」の3件のうち1件重複
があるので6件となっている。
【0214】また、この変形例として、図47の記事番
号6のように複数のトピックに適合した記事の件数は別
個にカウントするようにしてもよい。
【0215】この場合、例えば図48(a)の「半導体
貿易」の件数は、このトピックのみに適合した記事の件
数という意味で3件となる。
【0216】図48(b)では、ユーザの選択している
各トピックに適合した記事の件数情報をベン図形式で表
示している。
【0217】この例では、図47における記事番号1、
2、3の3つの記事が「半導体貿易」のみに適合した記
事であり、記事番号4、5の2つの記事が「低価格パソ
コン」のみに適合した記事であり、記事番号6の記事が
両方に適合した記事であることが明示されている。
【0218】この例では、図48(a)に比べ、各トピ
ックの適合件数と全記事数との関係がより明確になって
いる。
【0219】図49に、あるユーザのために選出された
記事の要約文・抜粋文あるいは本文をトピック別にまと
めてそのユーザに提示した表示例を示す。
【0220】ここで、要約文とは、もとの記事の本文を
加工して要点がつかめるようにしたテキストをいい、抜
粋文とは、もとの記事の本文の一部を加工せずに抜き出
したテキストをいう。
【0221】この例では、「半導体貿易」に関する3つ
の記事が並べて最初に表示されており、その後に「低価
格パソコン」に関する記事が続いている。
【0222】以上の説明のように、ユーザに提示する各
記事がどのトピックに適合したのかを明示することによ
り、ユーザは記事の内容理解や、どの記事を読み、どの
記事を読まないかなどの判断が容易になり、より効率的
な情報収集ができると考えられる。
【0223】図50に、記事が満足した検索条件に関す
る情報を記事本文のヘッダ情報として付加してユーザに
提示した表示例を示す。
【0224】この例では、表示中の記事が、ユーザの選
択しているトピックのうち「半導体貿易」に適合したも
のであることが「該当トピック」の行に明示されてい
る。
【0225】その下には、「半導体貿易」と記事との類
似度が1.32であったことが表示されている。
【0226】さらに、「半導体貿易」に関する記事を検
索するために用いられた検索条件と、これらの条件のう
ち表示中の記事が満足したものが並べて表示されてい
る。
【0227】また、図50の本文中では、テキストの一
部が強調表示されている。
【0228】ここで、強調表示とは、アンダーラインな
どの付加記号を伴った表示、異なる字体や大きさの文字
による表示、異なる色による表示など、一般にテキスト
の一部を他の部分よりも目立たせる手段を用いた表示を
いう。
【0229】この例では、「半導体貿易」というトピッ
クに適合する記事を検索するための検索条件として、
「半導体、IC、調達などの単語を本文中に含む」とい
う条件が設定されていたものとする。
【0230】記事は上記の条件を実際に満たしているの
で、このことを明示するために本文一文目の「半導
体」、「IC」、「調達」という単語が強調表示されて
いる。
【0231】また、この変形例として、例えば「記事見
出し」の行の「IC」という単語を強調表示してもよ
い。
【0232】このような強調表示により、ユーザは、表
示中の記事がどのような根拠に基づいて検索され、提示
されたのか理解することができる。
【0233】また、強調表示されている部分のテキスト
は、内容的に重要であることが多いので、ユーザは拾い
読みにより効率的に記事内容を把握することが可能にな
ると考えられる。
【0234】これは、例えば、レレバンス・フィードバ
ックのために提示された記事の有用性を判定する作業の
効率化にもつながる。
【0235】図51、52、53に、適合した検索条件
を記事中に強調表示することにより記事の有用性の判定
が効率的になる例を示す。
【0236】図51(a)は、「自然言語処理」という
トピックに適合する記事を検索するための検索条件の例
である。
【0237】この例では、記事の本文中に「自然言語処
理」、「NL」、「機械翻訳」、「かな漢字変換」とい
う言語表現が出現するとその記事の得点が高くなる。
【0238】また、「自然言語」と「解析」という表現
が同一の文中に出現すると、その記事の得点が高くな
る。
【0239】この他、記事を検索するための様々な条件
が記されているものとする。
【0240】図51(b)は、図51(a)の検索条件
を用いて検索され、ユーザに提示された記事の例であ
る。この記事は「本文中に自然言語処理という言語表現
を含む」という検索条件を満たしているので、記事中の
「自然言語処理」という表現が強調表示されている。こ
こで、強調表示されている「自然言語処理」という表現
を含む文の辺りを読んでみると、「このソフトウェア
は、自然言語処理は用いずに、簡単な文字列マッチング
により検索を行う。」と書いてあるので、実際には自然
言語処理に関する記事ではないことがすぐにわかる。
【0241】ユーザはこの時点でこの記事を読む必要が
ないと判断できるので、有用そうな記事のみを読んで情
報収集を行ったり、効率的にレレバンス・フィードバッ
クを行ったりできる。
【0242】図52も、図51と同様に、記事が有用で
ないことを迅速に判断する例である。
【0243】この例での検索対象は英文テキストであ
り、「artificial intelligenc
e(人工知能)」というトピックの検索条件が図52
(a)である。
【0244】ここでは、「artificial」、
「intelligence」などの単語を含む記事の
得点が高くなるようにしている。
【0245】図52(b)は、図52(a)の検索条件
を用いて検索されユーザに提示された記事の例であり、
「artificial」という語が強調表示されてい
る。図51と同様に、強調表示された語の周辺のみを拾
い読みすることにより、この記事は「artifici
al hand(義手)」に関するものであって「ar
tificial intelligence」とは無
関係であるということが瞬時にしてわかる。
【0246】図51、52が有用でない記事の表示例で
あるのに対し、図53はユーザにとって有用である記事
の表示例である。
【0247】図53(a)は、「パソコン新製品」とい
うトピックに適合する記事を検索するための検索条件で
あり、記事に出現する単語として「ノートパソコン」、
「ラップトップ」、「デスクトップ」などのパソコンの
種類を表す表現や、「○○社」、「△△社」など、パソ
コンメーカーの名前などが指定されている。
【0248】図53(b)は、図53(a)のような検
索条件により検索を行った結果得られ、ユーザに提示さ
れた記事の表示例である。
【0249】「△△社」が強調表示されているので、こ
の記事で紹介されているパソコンのメーカーは○○社な
どのものではなく△△社のものであることがひと目でわ
かる。
【0250】同様に、「ノートパソコン」が強調表示さ
れているので、発売したパソコンの種類はラップトップ
やデスクトップなどではなくノートパソコンであること
がひと目でわかる。このように、提示されている記事が
ユーザにとって有用である場合にも、記事の内容を把握
することが容易になると考えられる。
【0251】図50において、トピック検索条件と、そ
のうち記事が満足した検索条件をユーザに提示する例を
示したが、これらの表示方法の例を説明する。
【0252】図54は、「半導体貿易」というトピック
に適合する文書を検索するための検索条件の具体例であ
る。
【0253】一行目の条件は、通常の文書検索で用いら
れるブール式の例であり、「半導体」「貿易」などの言
語表現がANDやORなどの演算子で結合されている。
【0254】2行目の条件は、「半導体」と「貿易」と
いう言語表現が同一文中に出現するという条件を表して
いる。
【0255】また、例えば4行目の条件は、記事の記事
見出し文字列の中に「半導体」、「メモリー」、「I
C」などの言語表現が出現するという条件を表してい
る。
【0256】図54のような検索条件により検索されユ
ーザに提示された図50のような記事には、例えば図5
5のような情報を付加して表示する。
【0257】この例では、現在表示中の記事は「半導体
貿易」というトピックに適合したものであることが明示
されており、図54に示した「半導体貿易」のトピック
検索条件がそのままユーザに提示されている。
【0258】そして、その下には、実際に記事が満足し
た条件が列挙されている。例えば、図50の第1文には
「半導体」と「調達」という言語表現が出現しているの
で、図55の「記事1が満足した検索条件」のところに
は、満足された条件である「第1文:半導体(1回)、
調達(1回)」が表示されている。
【0259】ここで、「(1回)」は出現回数を表す。
【0260】また、トピック検索条件の「単語:」とい
う行に記された言語表現のうち、記事中に実際に出現し
たものは「半導体」、「IC」、「調達」の3つであっ
たことが「記事1が満足した検索条件」の「単語:」と
いう行に表示されている。
【0261】同時に、これらの出現した位置や、出現回
数などの情報が表示されている。
【0262】さらに、トピック検索条件の1行目の
「(半導体ORメモリー)AND(貿易OR調達)」と
いうブール式は、図50の記事中に「半導体」と「調
達」という表現が出現しているために満足されているの
で、「記事1が満足した検索条件」ではこのブール式が
表示され、さらにその中の「半導体」と「調達」という
表現が強調表示されている。
【0263】図56に、図55の変形例を示す。
【0264】図55がトピック検索条件と記事が実際に
満足した検索条件とを別々に表示しているのに対し、図
56ではトピック検索条件の中に記事が満足した検索条
件を埋め込む形で表示している。
【0265】この例では、「半導体」や「調達」などの
実際に満足された条件の語が強調表示されている。
【0266】これにより、トピック検索条件のうち何パ
ーセントくらいの条件が記事によって満たされているか
がおおまかに把握できる。
【0267】以上のように、表示中のトピックの検索条
件と、そのうち記事が実際に満足している検索条件の情
報を提示することにより、その記事の有用性を判断しな
がら拾い読みをしたり、内容の把握を容易にすることが
可能であると考えられる。
【0268】また、記事がどのような根拠から検索され
提示されたのかがユーザにわかるようになるので、ユー
ザはよりきめ細かで効果的なレレバンス・フィードバッ
ク用情報を情報フィルタリングサービス側に返すことが
可能になると考えられる。
【0269】(実施形態2の変形例1)次に、記事検索
部24及び付加情報生成部26の他の構成例について説
明する。
【0270】まず、記事検索部24は、変数iに1を代
入した後(ステップS151)、i番目のトピック(ト
ピック1)の検索条件をトピック記憶部22から取り出
す(ステップS152)。この後、記事検索部24は、
変数jに1を代入した後(ステップS153)、トピッ
クi(トピック1)と到着記事j(到着記事1)との類
似度を計算し、記事情報記憶部27に格納する(ステッ
プS154)。この類似度計算は、通常の検索処理に相
当するもので、記事情報記憶部18に格納されている記
事の表現や検索インデックスが参照される。
【0271】ここで、実施形態2の図42との違いは、
各記事が満足した検索条件に関する情報を必ずしも記事
情報部27に記憶する必要がないという点だけである。
【0272】これは、実施形態2が、ユーザに提示する
記事にその記事が何故検索されたかという情報を付加し
て提示するものであるのに対し、この変形例では、ユー
ザに提示する記事に、他のユーザがその記事をどのよう
に読んでいるかという情報を付加して提示するものであ
るためである。
【0273】次いで、記事検索部24は、変数jの値を
+1更新した後、そのときのjの値が到着記事数よりも
大きいか否かを調べ(ステップS155,S156)、
大きくない場合には類似度計算されてない記事が残って
いると認識し、jの値が到着記事数よりも大きくなるま
で、ステップS154〜S156を繰り返す。到着した
全ての記事に対してトピックiとの類似度の計算が終わ
ると、記事検索部24は、到着した記事をユーザプロフ
ァイルとの類似度が高い順にソートし、記事のランキン
グを行う(ステップS157)。このランキングの結果
は、記事情報記憶部27に記憶される。
【0274】この後、記事検索部24は、変数iの値を
+1更新した後、そのときのiの値が全トピック数より
も大きいか否かを調べ(ステップS158,S15
9)、大きくない場合には類似度計算されてないトピッ
クが残っていると認識し、iの値が全トピック数よりも
大きくなるまで、ステップS152〜S159を繰り返
す。
【0275】図58に、付加情報生成部26の処理の流
れを示す。
【0276】付加情報生成部26は、全てのユーザに対
して以下の処理を行う。
【0277】まず、付加情報生成部26は、変数iに1
を代入した後(ステップS161)、ユーザi(ユーザ
1)のユーザプロファイルをトピック記憶部22から取
り出す(ステップS162)。次に、付加情報生成部2
6は、記事選出部25によって選出されたユーザ1に提
示する記事と、これらの記事を受信する他のユーザに関
する情報とを記事情報記憶部27から取り出す(ステッ
プS163)。
【0278】この後、付加情報生成部26は、記事選出
部25によって選出された記事に、これらの記事を受信
する他のユーザに関する情報を付加してユーザiに提示
する(ステップS164)。そして、付加情報生成部2
6は、変数iの値を+1更新した後、そのときのiの値
が全ユーザ数よりも大きいか否かを調べ(ステップS1
65,S166)、大きくない場合には付加情報が生成
されてないユーザが残っていると認識し、iの値が全ユ
ーザ数よりも大きくなるまで、ステップS162〜S1
66を繰り返す。
【0279】例えば、図59のように、どのユーザにど
の記事を送信するかという情報が記事選出部25により
格納されていたとする。
【0280】この例では、例えばユーザ1には記事1、
2を提示することが、ユーザ2には記事2、3、4を提
示することが記されている。
【0281】付加情報生成部26は、ユーザ1に記事1
を提示する際に、記事1を受信する他のユーザであるユ
ーザ3、4に関する情報を付加して提示する。例えば記
事1の受信人数を提示する場合、ユーザ1、3、4の3
人という情報を付加したり、ユーザ1を除いた2人とい
う情報を付加したりする。
【0282】同様に、ユーザ1に記事2を提示する際に
は、ユーザ2、ユーザ4に関する情報を付加して提示す
る。
【0283】図60に、あるユーザのために選出された
記事の記事見出しのリストに、記事を受信した他のユー
ザに関する情報を付加してそのユーザに提示した表示例
を示す。
【0284】この例では、情報フィルタリングサービス
の全ユーザ数は4,000人となっている。
【0285】そして、例えば記事番号1の記事を受信し
たユーザ数は250人だということがわかる。
【0286】図61に、あるユーザのために選出された
記事の要約文または抜粋文に記事を受信した他のユーザ
に関する情報を付加して提示した表示例を示す。
【0287】図60と同様に受信ユーザ数の情報が示さ
れている。
【0288】図62に、記事を受信した他のユーザに関
する情報を記事本文のヘッダ情報として付加しユーザに
提示した例を示す。
【0289】全4,000人のユーザ中、250人が表
示中の記事を受信していることが明示されている。
【0290】図63に図62の変形例を示す。
【0291】この例では、記事の受信ユーザ数の内訳が
表示されている。
【0292】表示中の記事を受信した250人のうち1
50人が男性、100人が女性であり、200人が日本
人、30人が米国人、20人がその他の国のユーザであ
ることがわかる。
【0293】さらに、250人のうち、180人は「半
導体貿易」というトピックを選択しているユーザ、50
人は「IC」というトピックを選択しているユーザ、2
0人は「半導体貿易」と「IC」の両方を選択している
ユーザであることがわかる。この他、受信者の所属や年
齢層など、プライバシー侵害にならない程度の統計情報
を表示するようにしてもよい。
【0294】以上の説明のように、現在表示中の記事
を、他のどのようなユーザが何人受信しているかという
情報がわかれば、その記事がどのくらい一般的な記事で
あるか、または特殊なユーザ層にだけ読まれる記事であ
るかがわかり、ユーザにとってどれくらい有用な記事で
あるかの判断材料となると考えられる。
【0295】例えば、図60のような記事情報を受信し
たユーザが、6つの記事全てを読んでいる時間がない場
合、とりあえず一般常識的な情報だけを収集しようとし
て、記事番号4の記事のように多くのユーザが読んでい
る記事だけを読むといった使い方が考えられる。
【0296】図64に、あるユーザや他のユーザが前回
に行ったレレバンス・フィードバック情報を今回提示す
る記事情報に付加して提示する表示例を示す。
【0297】この例では、今回到着した記事はb1〜b
4の4件であり、ユーザはこれらの全てあるいは一部に
対して有用性の判定を行い、レレバンス・フィードバッ
クを行おうとしているものとする。
【0298】例えば、ユーザが記事b1に対して「有用
ではない」という判定を行い、この情報を情報フィルタ
リングセンタ1側に送信すれば、情報フィルタリングセ
ンタ1側は記事b1のようなトピックの記事の優先度を
下げるなどしてユーザプロファイルを修正し、次回から
はユーザの要求に合致した記事がより多く提示されるよ
うにすることが可能である。
【0299】図64では、この有用性の判定の参考情報
として、ユーザが前回あるいはそれ以前に行った有用性
判定に関する情報と、他のユーザの有用性判定に関する
情報が提示されている。
【0300】この例では、ユーザが前回受信し、有用性
判定を行った記事はa1〜a6の6件あり、例えばユー
ザは記事a1に対しては「有用である」、記事a3に対
しては「不要である」という判定をしたことがわかる。
【0301】一般に、人間による有用性の判定には一貫
性がなく、同じような記事に対してもあるときは「有用
である」とし、またあるときは「やや有用である」、と
いうように違った判断をしてしまうことがあると考えら
れる。
【0302】このように一貫性に欠ける判定情報をフィ
ードバックしてユーザプロファイルを修正しても、より
よいフィルタリングが行われるようになる保証はない。
【0303】この例のように、本人がこれまでに行って
きた有用性判定情報にアクセスを許すことにより、今回
の有用性の判定の信頼性や効率を高めることができると
考えられる。また、ユーザの要求が時とともに変化した
場合でも、自分の過去のフィードバック結果を参照しな
がら意識的に有用性判定の方針を変えるといった使いか
たも考えられる。
【0304】また、図64では、本人の過去の判定情報
に加えて、他のユーザの判定情報が表示されている。
【0305】例えば、記事a1は、他の250人のユー
ザによっても受信され、有用性の判定が行われており、
このうち100人が「有用である」と判定し、100人
が「やや有用である」と判定し、50人が「不要であ
る」と判定したことがわかる。このように、他のユーザ
が過去に行った有用性判定の情報を参照して、自分のこ
れからの有用性判定の参考にしたり、また、自分が過去
に行った有用性判定を直接訂正し、レレバンス・フィー
ドバックを再度実行してもらうなどが可能となる。
【0306】これによりより信頼性が高く効率のよいレ
レバンス・フィードバックが行えると考えられる。
【0307】図64の変形例を図65に示す。
【0308】図64ではユーザが「有用」「やや有用」
「不要」という離散的な評価値により有用性を判定して
いるのに対し、図65では連続的な得点により判定して
いる。
【0309】「前回のrelevance feedb
ack情報」の、他のユーザの判定情報のところには、
他のユーザがつけた得点の平均値が表示されている。
【0310】例えば、今回の記事b1の内容が、前回の
記事a1の内容に似たものである場合、ユーザは、前回
のa1に対する自分の判定が10点であったことから、
今回のb1に対しても高得点を与えるといった使い方が
考えられる。
【0311】また、前回の記事a5の行を見ると、自分
は1点という低い評価を行ったのに対して、他のユーザ
の平均値は7.4点と比較的高い値になっている。
【0312】そこで、ユーザは、自分のa5に対する有
用性の評価を撤回して、新たに評価値を付与しなおすと
いった使い方が考えられる。
【0313】このように、実施形態2のシステムでは、
提示されている記事がユーザの選択したトピックのうち
いずれに適合したものであるかなど、提示されている記
事がいかなる検索条件を満足したのかがユーザに明示さ
れるため、何故その記事が提示されているかがユーザに
分かりやすくなり、記事の有用性の判定が容易になる。
したがって、既にユーザに送信された各記事がユーザに
とって有用であったか否かなどの情報についてユーザか
らフィードバックを受け、その情報を反映して検索条件
を修正するレレバンスフィードバック機能をより有効利
用できるようになる。
【0314】また、記事が選択された根拠の代わりに、
提示されている記事が他のユーザによってどのように読
まれているかをユーザに提示することによっても、他の
ユーザの判断を参考にしたレレバンス・フィードバック
が可能になり、レレバンスフィードバックの有効利用を
図ることができる。
【0315】(実施形態3)次に、この発明の情報フィ
ルタリングシステムの第3の実施形態について説明す
る。このシステム全体の構成は、図1と同様であり、ユ
ーザ毎にユーザプロファイルを保持しており、そのユー
ザプロファイルを利用して記事の検索が行われる。ここ
で、ユーザプロファイルとは、前述したように、ユーザ
の関心が高いトピックに適合する記事を検索するための
検索条件のことをいう。
【0316】図66には、実施形態3に係わる情報フィ
ルタリングセンタ1の構成が示されている。情報フィル
タリングセンタ1は、図示のように、ユーザプロファイ
ル生成部31、トピック記憶部32、記事情報抽出部3
3、記事検索部34、記事選出部35、要約・抄録生成
部36、および記事情報記憶部37から構成されてい
る。これら構成要素のうち、破線で囲まれているユーザ
プロファイル生成部31、記事情報抽出部33、記事検
索部34、記事選出部35、要約・抄録生成部36は、
例えば図1の中央処理装置14によって実行されるソフ
トウェアによって実現でき、またトピック記憶部32お
よび記事情報記憶部37は記憶装置5によって実現でき
る。
【0317】ユーザプロファイル生成部31は、入力と
して個々のユーザの要求・興味を受けつける。ユーザの
要求・興味は、「○○と××に関する記事が読みたい」
といった自然言語や、興味のあるトピックに頻出するキ
ーワードの集合や、それらに優先順位や重みをつけたも
の、または通常の文書検索における検索式のようなもの
で表される。
【0318】ユーザプロファイル生成部31は、これに
対して単語抽出、同義語展開などの言語処理を行い、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する。ユーザプロファイルはユーザ毎にトピッ
ク記憶部32に記憶される。また、ユーザプロファイル
生成部31は、既にユーザに送信された各記事がユーザ
にとって有用であったか否かなどの情報についてユーザ
からフィードバックを受け、その情報を反映してトピッ
ク記憶部32の検索条件を修正するというレレバンスフ
ィードバック機能も有している。
【0319】図67に、キーワードとその重みで表現さ
れたユーザプロファイルの例を示す。
【0320】この例では、ユーザが半導体に関する記事
に興味をもっているために「メモリー」などの関連用語
が羅列されており、それぞれの用語に類似度計算に利用
する重みが定義されている。。
【0321】記事情報抽出部33は、入力として情報源
から到着した記事を受けつけ、これに対して形態素解
析、構文解析、書式解析などを行い、記事の情報源や日
付、文字や単語その他の文書構成要素の頻度情報や出現
位置、5W1H的な情報などの抽出を行う。そして、記
事をこれらの抽出された情報の集合体として表現する。
例えば、出現した単語の頻度を要素とするベクトルによ
り記事を表現したり、5W1Hのテンプレートに実現値
を代入したものにより表現したりする。記事情報抽出部
33はまた、記事検索を高速に実現するためのインデク
シング処理も行う。記事情報抽出部33により抽出され
た記事情報は、記事情報記憶部37に記憶される。
【0322】記事検索部34は、トピック記憶部32に
記憶されている各トピックの検索条件と、記事情報抽出
部33によって抽出された記事情報とを参照し、各トピ
ックに適合する到着記事を検索する。これは、トピック
と到着記事との類似度を算出することに相当する。この
類似度は、検索の方式によって「トピックに適合する」
「トピックに適合しない」などの離散値をとる場合もあ
るし、よく適合している記事ほど類似度の値が高くなる
ように連続値をとる場合もあるが、ここでは、より一般
的である類似度が連続値をとる場合について説明する。
この場合には、記事検索部34が各トピックについて行
う処理は実施形態1、2と同様であり、まず、トピック
記憶部32からトピックに適合する記事を検索するため
の検索条件を読み込む。次に、到着した記事の各々に対
して、そのトピックとの類似度を計算する。この類似度
計算は、通常の検索処理に相当するもので、記事情報記
憶部に格納されている記事の表現や検索インデックスが
参照される。記事の類似度、及びその記事が満足した検
索条件の情報は記事情報記憶部37に記憶される。到着
した全ての記事に対して類似度の計算が終わると、すな
わち、到着した全ての記事を検索対象とした検索処理が
終わると、到着した記事はトピックとの類似度が高い順
にソートされる。すなわち、記事のランキングが行われ
る。ランキングの結果も記事情報記憶部37に記憶され
る。
【0323】記事選出部35は、記事検索部34により
記事情報記憶部37に格納された各トピックの検索結果
の中から、各ユーザに提示する記事を選出する。例え
ば、「半導体貿易」、「低価格パソコン」、「人工知
能」という3つのトピックを選択しているユーザに対し
ては、「半導体貿易」の検索結果、「低価格パソコン」
の検索結果、「人工知能」の検索結果の3つを取り出
し、これらのうち上位の記事の中からユーザに提示する
ものを選出する。
【0324】図68に、本実施形態3における要約・抄
録生成部36の処理の流れを示す。要約・抄録生成部3
6は、各ユーザに対して以下の処理を行う。
【0325】まず、要約・抄録生成部36は、変数iに
1を代入し(ステップS171)、ユーザiのユーザプ
ロファイルをトピック記憶部32から取り出す(ステッ
プS172)。次に、要約・抄録生成部36は、ユーザ
iに提示する記事の集合と、各記事がユーザの選んだト
ピックのうちいずれに適合したかを示す情報とを記事情
報記憶部37から取り出す。そして、要約・抄録生成部
36は、変数jに1を代入し、ユーザに提示する記事j
に対して、適合したトピックの情報を参照しながら、そ
のトピックに応じた長さの要約あるいは抄録を生成する
(ステップS175)。
【0326】ここで、要約とは、記事の主題を端的に表
すために原文をもとに生成したテキストをいい、抄録と
は、重要文など、記事の原文テキストの一部をそのまま
抜きだしたものをいう。
【0327】また、要約・抄録の「長さ」とは、原文に
対する圧縮率、文数、段落数、文字数、あるいは提示す
るテキスト全体に占める割合などをいう。
【0328】本実施形態3で用いる要約・抄録生成の方
法は、長さを2段階以上に調節できるものであれば、ど
のような方法であってもよい。
【0329】例えば、自然言語解析を用いた自動要約生
成技術でもよいし、初めの一段落目のみ表示するかもし
くは全文を表示するかという単純な方法でもよい。
【0330】次に、要約・抄録生成部36は、現在のj
の値がユーザiに提示する記事数よりも大きいか否かを
調べ(ステップS176)、大きくないならば、要約・
抄録生成処理を行っていない記事が残っていると判断
し、jの値がユーザiに提示する記事数よりも大きくな
るまでステップS175、S176を繰り返す。
【0331】この後、要約・抄録生成部36は、ユーザ
iに該当記事の要約または抄録を提示し(ステップS1
77)、その後、現在のiの値が全ユーザ数よりも大き
いか否かを調べる(ステップS178)。現在のiの値
が全ユーザ数よりも大きくないならば、大きくなるまで
ステップS172〜S178の処理が繰り返される。次
に、記事の適合したトピックに応じた長さの要約・抄録
を生成する手順を図を用いて説明する。
【0332】図69は、あるユーザが選択したトピック
と、それらの間の優先度の例を示す。
【0333】この例では、ユーザはトピックA,B,
C,Dの4トピックを選択しており、これらに関する記
事を求めている。また、トピックA,B,C,Dの順で
優先度が高くなっている。
【0334】この優先度は、情報フィルタリングサービ
スセンタ1側が設定してもよいし、ユーザが指定しても
よい。ここでは、ユーザが指定したものであるとする
と、このユーザは、例えばトピックBに適合する記事よ
りもトピックAに適合する記事により興味があるという
ことになる。
【0335】図70に、図69のトピックを選択してい
るユーザに提示する記事のリストとそれらに適合したト
ピックの例を示す。
【0336】この例では、ユーザのために記事1〜4の
4つの記事が選出されている。記事1、2はトピックA
に、記事3はトピックBに、記事4はトピックCおよび
Dに適合したものである。
【0337】図71に、図70のような場合にユーザに
提示する記事情報の概念図を示す。記事1、2は、ユー
ザの選んだトピックのうちもっとも優先度が高いトピッ
クAに適合したものであるため、比較的長い要約あるい
は抄録が提示されている。これに対して、記事4は、ユ
ーザの選んだトピックのうちもっとも優先度が低いトピ
ックC,Dに適合したものであるため、非常に短い要約
あるいは抄録が提示されている。
【0338】このように、トピックの優先度に応じて段
階的に抄録の長さを変化させる。
【0339】なお、図71では、要約あるいは抄録の長
さを図中の面積であらわしているが、優先度の最も高い
トピックに適合した記事の要約・抄録が必ずしも最も長
くなるとは限らない。
【0340】例えば、抄録の長さとして、原文の文数を
もとにした圧縮率を採用するとし、記事1の原文が5
文、記事4の原文が20文であったとする。
【0341】このとき、記事1は優先度の高いトピック
Aの記事なので圧縮率100%とし、記事4は優先度の
低いトピックC,Dの記事なので圧縮率50%として表
示したとすると、記事1の抄録は原文のままなので5文
となり、一方、記事4の抄録は10文となる。
【0342】以上のような機能により、ユーザはトピッ
ク毎に異なる詳細度の記事を読むことができる。
【0343】ユーザが選択したトピック間に明確な優先
度がある場合には有効であると考えられる。
【0344】(レレバンス・フィードバック)文書検索
における技術に、検索結果の文書に対してユーザに有用
性の判定を行ってもらい、その結果を利用して検索式中
の単語の重み値を変更することにより、ユーザの求める
ものにより近い文書を検索するレレバンス・フィードバ
ックがある。
【0345】情報フィルタリングの分野でもこの機能は
実現されつつある。
【0346】本実施例においては、レレバンス・フィー
ドバックの際に得られる有用性判定情報を、要約・抄録
の長さに反映させることが可能である。
【0347】例えば、既に説明した図71のような情報
提示に対して、ユーザが「記事3が非常に有用であっ
た」という情報を返したとする。
【0348】同時に、図70で示したトピック間の優先
度が具体的には図72のように重要度の値の大小で定義
されていたとする。
【0349】このとき、ユーザによって特に有用である
とされた記事3は、トピックBに適合した記事であるの
で、何らかの計算によりトピックBの重要度の値をより
大きくし、今度はトピックBに適合する記事の長さをよ
り長くして提示することが有用である。
【0350】図73に、このようなフィードバックを行
った場合に、次回のフィルタリングでユーザに提示され
る記事情報の例を示す。
【0351】図71ではトピックAの優先度が最も高か
ったが、この図ではフィードバックによりトピックBの
優先度がもっとも高くなっており、トピックBに適合し
た記事1′の要約あるいは抄録が最も長くなっている。
【0352】(実施形態3の変形例1)次に、要約・抄
録生成部36の他の構成例について説明する。
【0353】図74に、本変形例における要約・抄録生
成部36の処理の流れを示す。
【0354】要約・抄録生成部36は、各ユーザに対し
て以下の処理を行う。
【0355】まず、ユーザiのユーザプロファイルをト
ピック記憶部32から取り出す(ステップS181,S
182)。次に、ユーザiに提示する記事の集合と、各
記事に予め付加されている日付、新聞社、朝刊/夕刊、
見出しの大きさや行数、何面に掲載されたか、などの属
性情報とを記事情報記憶部37から取り出す(ステップ
S183)。そして、ユーザiに提示する各記事に対し
て、属性情報を参照しながら、それに応じた長さの要約
あるいは抄録を生成する(ステップS185)。ここ
で、「要約」、「抄録」、および「長さ」の意味は、実
施形態3と同様である。また、以下の処理も実施形態3
と同様である。
【0356】以下に、記事の属性に応じた長さの要約・
抄録を生成する手順を図を用いて説明する。
【0357】図75に、あるユーザに提示するために記
事選出部35により選出された記事の例を示す。この例
では、記事に予め付加されている属性として、発行日な
どの日付の情報を採用している。
【0358】記事1〜4の日付は、それぞれ5月26
日、23日、23日、20日となっている。
【0359】例えば一週間毎に情報をまとめて配信する
ような形態のサービスでは、このように、記事には新し
いものと古いものが混在している可能性がある。
【0360】図76に、図75のような場合にユーザに
提示する記事情報の概念図を示す。この例では、新しい
記事ほど要約あるいは抄録の長さを長くして表示してい
る。
【0361】例えば、5月26日付けの記事1は詳しく
表示されているが、5月20日付けの記事4は簡単に表
示されている。
【0362】同様に、記事が情報フィルタリングセンタ
ーに到着した時間や朝刊/夕刊の情報などに応じて要約
あるいは抄録の長さを変えてもよい。
【0363】また、時間的属性として曜日を採用し、例
えば「月曜日の記事は他の曜日の記事よりも詳しく表示
する」などといった処理も可能である。
【0364】図77に、属性として新聞社が採用されて
いる場合の、あるユーザに提示するために選出された記
事の例を示す。
【0365】この例では、記事1は○○新聞から到着し
たもの、記事2、3は△△新聞から到着したもの、記事
4は××新聞から到着したものである。
【0366】ここで、ユーザあるいは情報フィルタリン
グサービス側が、○○新聞、△△新聞、××新聞の順で
優先度を定めていたとすると、ユーザには例えば図78
のような情報が提示される。
【0367】記事1はもっとも優先度の高い○○新聞の
記事なので、長い要約あるいは抄録が提示されており、
一方記事4はもっとも優先度の低い××新聞の記事なの
で、短い要約あるいは抄録が提示されている。
【0368】ここでは新聞社で説明したが、何面の記事
か、位置、社会面などの分類など、各記事の発信者によ
って予め付与されている様々な属性に応じて要約あるい
は抄録の長さを変化させることが可能である。
【0369】(レレバンス・フィードバック)本変形例
においても実施形態3と同様に、レレバンス・フィード
バックの際に得られる有用性判定情報を、要約・抄録の
長さに反映させることが可能である。例えば、既に説明
した図78のような情報提示に対して、ユーザが「記事
2、3が非常に有用であった」という情報を返したとす
る。
【0370】記事2、3は共に「△△新聞」という属性
をもつ記事であるので、何らかの計算により△△新聞の
重要度の値をより大きくし、今度は△△新聞に適合する
記事の長さをより長くして提示することが有用であるか
も知れない。
【0371】図79に、このようなフィードバックを行
った場合に、次回のフィルタリングでユーザに提示され
る記事情報の例を示す。
【0372】図78では○○新聞の優先度が最も高かっ
たが、この図ではフィードバックにより△△新聞の優先
度がもっとも高くなっており、△△新聞という属性をも
つ記事1′の要約あるいは抄録が最も長くなっている。
【0373】以上のように、実施形態3のシステムで
は、記事の種類(その記事が満足したトピックなどの検
索条件、またはその記事の発行日時などの記事そのもの
の属性)に応じた長さの要約あるいは抄録が作成されて
それがユーザに提示されるため、ユーザに提示されるテ
キストのうち、ユーザにとって有用であるテキスト情報
の占める割合が高くなる。これにより、効率的な情報収
集が可能になる。
【0374】(実施形態4)次に、この発明の第4の実
施形態に係る情報フィルタリングシステムを説明する。
全体的なシステム構成は実施形態1と同じであるので、
ここでは、実施形態1との差異について説明する。
【0375】図3の記事間類似度計算部16は図14で
示したような記事間類似度計算処理を行うが、ある記事
iと記事jとの記事間類似度計算には、次の計算式が使
用される。
【0376】
【数1】 類似度計算式の変形例として、例えば以下の式があげら
れる。
【0377】
【数2】 上記の類似度計算式の変形例の中で、xi とxj はそれ
ぞれ記事iと記事jに含まれる単語の頻度ベクトルであ
る。
【0378】上記の類似度計算では、記事中の全単語を
対象にしているが、これを数種の品詞の単語に限定する
ことも可能である。例えば、品詞を名詞と動詞だけに限
定して類似度を計算することにしても構わない。
【0379】また、記事間の類似度計算においては、見
出しや一文目など書式上のフィールドごとに類似度を求
め、その類似度の荷重平均を全体の記事間類似度として
定義することもできる。この場合、式1に対応する類似
度としては、以下の通りになる。
【0380】
【数3】 ここで、Cfiは記事iのフィールドfに含まれる単語の
集合、Cfjは記事jのフィールドfに含まれる単語の集
合である。
【0381】フィールドとしては、見出しや一文目、一
段落目など、文書の先頭文字の空白やインデントの情
報、句点などの存在によって検出することができる。式
2から8についても同様の変形が可能である。
【0382】また、上記のような数値的な類似度計算を
情報をした後、構文情報などのチェックの過程を設け、
ある閾値以上の類似度を持つ記事間であっても、類似記
事としないとするように変形が可能である。例えば、新
聞記事においては、一文目の主語(具体的には助詞
「は」に前接している固有名詞)が重要な役割を果た
す。この主語が記事同士異なる場合、類似記事としない
ようにする。
【0383】次に、図80を参照して、図3の提示情報
生成部17による提示情報生成処理について説明する。
【0384】実施形態1では、重複記事の提示を回避す
るために、重複記事集合から、代表としてユーザに提示
する記事を選択する場合について説明したが、ここで
は、関連記事同士がグループ化あるいは関連づけされて
ユーザに提示される。
【0385】すなわち、まず、記事情報記憶部18から
記事選出部15により選択された記事の情報が読み込ま
れる(ステップS201)。次いで、上述の式を用いる
ことにより記事間類似度計算部16によって、選択され
た記事間の類似度計算が行われ、互いに類似度の高い記
事の集合が求められる(ステップS202)。そして、
関連記事同士のグループ化、関連づけ、あるいは特定の
記事の選択といった出力制御が行われ、それがユーザに
提示される(ステップS203)。
【0386】ここで、グループ化とは、関連記事同士が
並んでユーザに提示されるように記事の出力リストを揃
えることを意味する。また、関連づけとしては、例え
ば、ある記事とそれに関連する記事とを連結するリンク
情報を用いてハイパーテキストを生成し、それをユーザ
に提示することなどがあげられる。また、特定記事選択
では、関連記事の中から1つまたは幾つか記事が選択
し、選択された記事だけがユーザに提示される。
【0387】この様なグループ化、関連づけなどを行う
ことにより、関連のあるテキスト記事が順不同でバラバ
ラにユーザに出力されるといった事態を防止できる。よ
って、利用者は、関連記事を効率よく整理して読むこと
が可能となる。
【0388】(実施形態5)次に、この発明の第5の実
施形態に係る情報フィルタリングシステムについて、実
施形態1との差異を中心に説明する。実施形態5の構成
を図81に示す。実施形態との相違は、利用者に出力し
た記事を格納する送付記事記憶部19を有することにあ
る。
【0389】送付記事記憶部19には、記事を提供した
日付情報と共に利用者に提供された記事が、利用者と対
応づけて記憶される。これは、利用者への記事の提供時
に行われるものである。
【0390】図82に提示情報生成部の処理の流れを図
示する。まず始めに、記事選択部15により選出された
記事の情報を読み込む(ステップS211)。そして、
記事情報記憶部18に格納されている選出された当日記
事と送付記事記憶部19に格納されている前日以前の記
事とを参照し、記事間類似度計算部16により前日以前
の記事をも対象とした記事間類似度計算が行われて、重
複記事集合が求められる(ステップS212)。
【0391】この場合、重複記事集合φk は、ある記事
jを核にして、以下のように定義することができる。
【0392】
【数4】 すなわち、具体的には、記事選出部15により選出され
た記事を上位からスキャンし、その記事jに対して類似
度が一定の閾値以上に入る記事を求め、その記事を重複
記事とし重複記事集合を求めるものである。
【0393】この後、前述したような関連する記事同士
のグループ化、関連づけ、あるいは特定の記事の選択と
いった出力制御が行われ、それがユーザにフィルタリン
グ結果として提示される(ステップS213)。
【0394】図83には、ユーザに出力するフィルタリ
ング結果の出力処理の流れが示されている。選出されて
いる上位の記事から順に、重複記事集合を持つか否かを
判定し(ステップS221,S222)、重複記事を持
たない場合は、その記事(例えばタイトルと新聞社の情
報など)を出力する(ステップS223)。一方、重複
記事を持つ場合、その重複記事集合が当日記事のみから
なるか否かを調べ(ステップS224)、当日記事のみ
からなる場合はマーク2を、それ以前の記事も含む場合
はマーク1を出力するとともに重複記事集合を出力する
(ステップS225,S226,S227)。選出され
ている残りの記事についても、ステップS222〜S2
27の処理が同様に行われる(ステップS228,S2
29)。重複記事集合を出力する際には、タイトルをフ
ラットなテキストとして出力する場合は、重複記事を並
べて出力することになる(グループ化)。図84はその
出力例である。直線で囲まれている記事同士が、重複記
事であることを意味している。また、□は当日の記事の
みからなる重複記事集合であり、△はそれ以前の記事を
含むことを意味するマークである。「8/4」などは記
事の日付である。一方、ハイパーテキストとして出力で
きる場合、代表記事だけを一番上の階層に表示し、その
代表記事に他の重複記事を関連づけしておくことができ
る。このハイパーテキストの表示例を図85〜図87に
示す。
【0395】図85において、□は当日の重複記事集合
を、△はそれ以前の重複記事集合を持ったことを意味し
ており、それぞれその代表記事のタイトルが表示されて
いる。図85に示した最上位階層の記事リストを出力す
る際に、それぞれのマークには、図86や図87に示す
重複記事集合の情報へのリンク情報を付与しておくこと
になる。これは、HTML(Hyper Text M
arkup Language)の記法を用いること
等、公知の技術によって実現可能である。この場合、図
85のマーク□を利用者が画面上で選択すると、図86
の重複記事情報が表示され、また図85のマーク△を利
用者が画面上で選択すると、図87の重複記事情報が表
示されることになる。
【0396】このように、当日の記事だけからなる記事
グループか、それ以前の日の記事も含まれているのかを
区別するための情報を付加して送ることにより、利用者
は、関連記事をさらに効率よく整理して読むことが可能
となる。
【0397】なお、以上の実施形態1〜5およびそれら
の変形例は必要に応じて種々組み合わせて利用すること
ができる。また、以上の説明は、通信網を介してフィル
タリング結果をセンタからユーザに送るネットワークシ
ステムとして実現した例について述べたが、この発明の
情報フィルタリングシステムの中枢をなすセンタの機能
は個人の計算機上で構築することもできる。この場合、
ユーザ端末とフィルタリングシステムが一体となった形
態となり、ユーザ端末とフィルタリングシステム間には
通信網は存在しないことになる。
【0398】
【発明の効果】以上説明したように、本発明によれば、
情報フィルタリングによってユーザに提示される記事同
士の関連性がユーザにとって明確になり、記事内容の理
解が容易になる。特に時間の経過と共に状況が変わって
いくような出来事についてその経緯を把握することや、
連載記事など複数の記事にわたる情報を把握することが
容易になり、フィルタリングシステムの性能向上を図る
ことができる。また、複数の情報源から得られた同一内
容に関する記事が、重複してユーザに提示されることが
自動的に回避できる。
【0399】また、提示されている記事がユーザの選択
したトピックのうちいずれに適合したものであるかがユ
ーザに明示されるため、ユーザが記事内容を理解するこ
とが容易になる。また、提示されている記事が他のユー
ザによってどのように読まれているかが明示されるた
め、ユーザは一般的に読まれている記事や一部のユーザ
に読まれている記事などを識別することができる。さら
に、過去に提示された記事に対してユーザが行った有用
性の判定、及び他のユーザが行った有用性の判定情報へ
のユーザのアクセスを許すことにより、一貫性を保った
レレバンス・フィードバックや他のユーザの判断を参考
にしたレレバンス・フィードバック、さらには過去に行
った有用性判定を修正してレレバンス・フィードバック
をかけ直すことが可能となる。
【0400】また、さらに、記事に適合したトピックに
応じた長さの要約あるいは抄録や、記事の持つ属性に応
じた長さの要約あるいは抄録がユーザに提示されるた
め、ユーザに提示されるテキストのうち、ユーザにとっ
て有用であるテキスト情報の占める割合を高くでき、効
率的な情報収集が可能になる。
【0401】また、関連する記事同士がグループ化ある
いは関連づけされて利用者に提供されるため、利用者の
手間を大幅に軽減することができる。さらに、当日配信
された記事間のみでなく、前日以前にユーザに出力した
記事との間の類似度も求め、出力記事には、当日の記事
だけからなる記事グループか、それ以前の日の記事も含
まれているのかを区別するための情報を付加することに
より、利用者は、関連記事をさらに効率よく整理して読
むことが可能となる。
【図面の簡単な説明】
【図1】この発明の各実施形態が適用される情報フィル
タリングシステム全体のシステム構成を示すブロック
図。
【図2】図1の情報フィルタリングシステムの運用形態
を概念的に示す図。
【図3】この発明の第1の実施形態に係わる情報フィル
タリングシステムに設けられる情報フィルタリングセン
タの構成を示すブロック図。
【図4】同第1実施形態のシステムにおけるユーザプロ
ファイル生成処理の流れを示すフローチャート。
【図5】同第1実施形態のシステムにおける記事情報抽
出処理の流れを示すフローチャート。
【図6】同第1実施形態のシステムにおける記事の表現
例を示す図。
【図7】同第1実施形態のシステムにおける記事の他の
表現例を示す図。
【図8】同第1実施形態のシステムにおける記事検索処
理の流れを示すフローチャート。
【図9】同第1実施形態のシステムにおいて記事検索処
理によってランキングされた到着記事の様子を示す図。
【図10】同第1実施形態のシステムにおける記事選出
処理の流れを示すフローチャート。
【図11】同第1実施形態のシステムにおいて図9のよ
うなランキング結果が得られている場合にその上位10
件を選出した例を示す図。
【図12】同第1実施形態のシステムにおいて図8のよ
うなランキング結果が得られている場合にユーザプロフ
ァイルとの類似度が0.86以上の記事を選出した例を
示す図。
【図13】同第1実施形態のシステムにおいて一人のユ
ーザに対して複数の検索及びランキングが行われる場合
にこれら複数のランキング結果の上位部分をマージして
ユーザに提示する記事を選出する様子を示す図。
【図14】同第1実施形態のシステムにおける記事間類
似度計算処理の流れを示すフローチャート。
【図15】同第1実施形態のシステムにおいて異なる情
報源から到着した記事の例を示す図。
【図16】同第1実施形態のシステムにおける提示情報
生成処理の流れを示すフローチャート。
【図17】同第1実施形態のシステムにおいて一件のプ
レスリリースから重複記事が派生する様子を示す図。
【図18】同第1実施形態のシステムにおいて一件の出
来事から重複記事が作成される様子を示す図。
【図19】同第1実施形態のシステムにおいて図15の
4つの記事に対して記事間類似度計算を行った結果得ら
れる重複記事集合の例を示す図。
【図20】同第1実施形態のシステムにおいて排除され
た重複記事に関する情報を記事の本文情報に付加して提
示する例を示す図。
【図21】同第1実施形態のシステムにおける関連記事
情報の表示形態を示す図。
【図22】同第1実施形態のシステムにおける関連記事
情報の他の表示形態を示す図。
【図23】同第1実施形態のシステムにおける関連記事
情報のさらに他の表示形態を示す図。
【図24】同第1実施形態のシステムにおける関連記事
情報の表示画面切り替え処理の流れを示すフローチャー
ト。
【図25】同第1実施形態のシステムにおける関連記事
情報の他の表示画面切り替え処理の流れを示すフローチ
ャート。
【図26】同第1実施形態のシステムにおいて図20の
ような記事の重複が起こっている場合にユーザに提示す
る記事の一覧表を重複記事情報とともに表示した例を示
す図。
【図27】同第1実施形態のシステムにおける記事間類
似度計算処理の流れを示すフローチャート。
【図28】同第1実施形態のシステムにおいて今回記事
選出部により選出された記事の集合と前回ユーザに提示
された記事の集合の例を示す図。
【図29】同第1実施形態のシステムにおける提示情報
生成処理の流れを示すフローチャート。
【図30】同第1実施形態のシステムにおいて今回の記
事の本文情報に前回までの関連記事の情報を付加して提
示する例を示す図。
【図31】同第1実施形態のシステムにおいて今回の記
事の本文情報に前回までの関連記事の情報を付加して提
示する他の例を示す図。
【図32】同第1実施形態のシステムにおいて今回の記
事の本文情報中に前回までの関連記事の情報を埋め込ん
で提示する例を示す図。
【図33】同第1実施形態のシステムにおいて図32の
第一文が選択された場合にその文と関係の深い前回まで
の記事のリストが表示される様子を示す図。
【図34】同第1実施形態のシステムにおいて図33の
「○○沖で地震 マグニチュード4」という関連記事を
選択した場合にその記事の本文を表示した例を示す図。
【図35】同第1実施形態のシステムにおける記事間類
似度計算処理の流れの他の例を示すフローチャート。
【図36】同第1実施形態のシステムにおける提示情報
生成処理の流れの他の例を示す図。
【図37】同第1実施形態のシステムにおいて今回の記
事の本文情報を今回の他の関連記事の情報とともに提示
する他の例を示す図。
【図38】同第1実施形態のシステムにおいて今回の記
事の本文情報を今回の他の関連記事の情報とともに提示
する他の例を示す図。
【図39】同第1実施形態のシステムにおいて記事間類
似度を記事の提示順序に反映させる例を示す図。
【図40】この発明の第2の実施形態に係わる情報フィ
ルタリングシステムで使用されるユーザプロファイルを
概念的を示す図。
【図41】同第2実施形態のシステムに設けられる情報
フィルタリングセンタの構成を示すブロック図。
【図42】同第2実施形態のシステムにおける記事検索
処理の流れを示すフローチャート。
【図43】同第2実施形態のシステムにおいてランキン
グされた到着記事を概念的に示す図。
【図44】同第2実施形態のシステムにおける記事選出
処理の流れを示すフローチャート。
【図45】同第2実施形態のシステムにおけるトピック
とその検索結果の例を示す図。
【図46】同第2実施形態のシステムにおける付加情報
生成処理の流れを示すフローチャート。
【図47】同第2実施形態のシステムにおいてユーザの
ために選出された記事の記事見出しのリストに各記事が
適合したトピックの情報を付加してそのユーザに提示す
る様子を示す図。
【図48】同第2実施形態のシステムにおいてユーザに
対して各トピックに適合した記事の件数情報を提示する
様子を示す図。
【図49】同第2実施形態のシステムにおいてユーザの
ために選出された記事の要約文・抜粋文あるいは本文を
トピック別にまとめてそのユーザに提示する様子を示す
図。
【図50】同第2実施形態のシステムにおいて記事が満
足した検索条件に関する情報を記事本文のヘッダ情報と
して付加してユーザに提示する様子を示す図。
【図51】同第2実施形態のシステムにおいて適合した
検索条件を記事中に強調表示する様子を示す図。
【図52】同第2実施形態のシステムにおいて適合した
検索条件を記事中に強調表示する他の列を示す図。
【図53】同第2実施形態のシステムにおいて適合した
検索条件を記事中に強調表示するさらに他の列を示す
図。
【図54】同第2実施形態のシステムにおいてあるトピ
ックに適合する文書を検索するための検索条件の具体例
を示す図。
【図55】同第2実施形態のシステムにおいて図54の
検索条件により検索されユーザに提示された記事に対し
て付加する検索条件の表示例を示す図。
【図56】同第2実施形態のシステムにおいて図54の
検索条件により検索されユーザに提示された記事に対し
て付加する検索条件の他の表示例を示す図。
【図57】同第2実施形態のシステムおける記事検索処
理の他の例を示すフローチャート。
【図58】同第2実施形態のシステムおける付加情報生
成処理の他の例を示すフローチャート。
【図59】同第2実施形態のシステムにおいて複数のユ
ーザそれぞれとそれらユーザに送信する記事との関係を
示す図。
【図60】同第2実施形態のシステムにおいてあるユー
ザに対して選出された記事の記事見出しのリストに、記
事を受信した他のユーザに関する情報を付加して提示す
る様子を示す図。
【図61】同第2実施形態のシステムにおいてあるユー
ザに対して選出された記事の要約文または抜粋文に記事
を受信した他のユーザに関する情報を付加して提示する
様子を示す図。
【図62】同第2実施形態のシステムにおいて記事を受
信した他のユーザに関する情報を記事本文のヘッダ情報
として付加しユーザに提示する様子を示す図。
【図63】同第2実施形態のシステムにおいて記事を受
信した他のユーザに関する情報を記事本文のヘッダ情報
として付加しユーザに提示する他の例を示す図。
【図64】同第2実施形態のシステムにおいてあるユー
ザや他のユーザが前回に行ったレレバンス・フィードバ
ック情報を今回提示する記事情報に付加して提示する表
示例を示す図。
【図65】同第2実施形態のシステムにおいてあるユー
ザや他のユーザが前回に行ったレレバンス・フィードバ
ック情報を今回提示する記事情報に付加して提示する他
の表示例を示す図。
【図66】この発明の第3の実施形態に係わる情報フィ
ルタリングシステムに設けられる情報フィルタリングセ
ンタの構成を示すブロック図。
【図67】同第3実施形態のシステムにおけるキーワー
ドとその重みで表現されたユーザプロファイルの例を示
す図。
【図68】同第3実施形態のシステムにおける要約・抄
録生成処理の流れを示すフローチャート。
【図69】同第3実施形態のシステムにおいてユーザが
選択したトピックとそれらの間の優先度の例を示す図。
【図70】同第3実施形態のシステムにおいて図69の
トピックを選択しているユーザに提示する記事のリスト
とそれらに適合したトピックの例を示す図。
【図71】同第3実施形態のシステムにおいてユーザに
提示される記事情報を概念的に示す図。
【図72】同第3実施形態のシステムにおいてユーザが
選択したトピックとそれらの間の優先度の例を示す図。
【図73】同第3実施形態のシステムにおいてフィード
バックを行った場合に次回のフィルタリングでユーザに
提示される記事情報の例を示す図。
【図74】同第3実施形態のシステムにおける要約・抄
録生成処理の流れの他の例を示すフローチャート。
【図75】同第3実施形態のシステムにおいて記事選出
部により選出された記事の例を示す図。
【図76】同第3実施形態のシステムにおいてユーザに
提示される記事情報の他の例を概念的に示す図。
【図77】同第3実施形態のシステムにおいて属性とし
て新聞社が採用されている場合にあるユーザに提示する
ために選出された記事の例を示す図。
【図78】同第3実施形態のシステムにおいて図77の
場合にユーザに提示される記事情報を概念的に示す図。
【図79】同第3実施形態のシステムにおいてフィード
バックを行った場合に次回のフィルタリングでユーザに
提示される記事情報の他の例を示す図。
【図80】この発明の第4の実施形態に係わる情報フィ
ルタリングシステムにおける提示情報生成処理の流れを
示すフローチャート。
【図81】この発明の第5の実施形態に係わる情報フィ
ルタリングシステムに設けられた情報フィルタリングセ
ンタの構成を示すブロック図。
【図82】同第5実施形態のシステムにおける提示情報
生成処理の流れを示すフローチャート。
【図83】同第5実施形態のシステムにおける重複記事
集合の出力処理の流れを示すフローチャート。
【図84】同第5実施形態のシステムにおける利用者へ
の記事提示例を示す図。
【図85】同第5実施形態のシステムにおけるハイパー
テキストによる利用者への記事提示例を示す図。
【図86】同第5実施形態のシステムにおけるハイパー
テキストによる利用者への記事提示例を示す図。
【図87】同第5実施形態のシステムにおけるハイパー
テキストによる利用者への記事提示例を示す図。
【符号の説明】
1…情報フィルタリングセンタ、2…情報源、3…ユー
ザ端末、10…ユーザプロファイル、11,21,31
…ユーザプロファイル生成部、12…ユーザプロファイ
ル記憶部、13,23,33…記事情報抽出部、14,
24,34…記事検索部、15,25,35…記事選出
部、16…記事間類似度計算部、17…提示情報生成
部、19…送付記事記憶部、22,32…トピック記憶
部、26…付加情報生成部、36…要約・抄録生成部。
───────────────────────────────────────────────────── フロントページの続き (72)発明者 梶浦 正浩 神奈川県川崎市幸区小向東芝町1番地 株 式会社東芝研究開発センター内 (72)発明者 小野 顕司 神奈川県川崎市幸区小向東芝町1番地 株 式会社東芝研究開発センター内

Claims (6)

    【特許請求の範囲】
  1. 【請求項1】 複数の情報源からテキストやイメージな
    どの記事の配信を受け、それら配信された記事の中から
    所定の記事を選出してユーザに提示する情報フィルタリ
    ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
    る記事を選定する記事検索手段と、 この記事検索手段によって選定された記事同志または選
    定された記事と他の記事との間の類似度を算出し、その
    類似度に従って記事毎に関連記事を決定する手段と、 決定された関連記事の情報を前記選定された記事に付加
    してユーザに提示する手段とを具備することを特徴とす
    る情報フィルタリング装置。
  2. 【請求項2】 複数の情報源からテキストやイメージな
    どの記事の配信を受け、それら配信された記事の中から
    所定の記事を選出してユーザに提示する情報フィルタリ
    ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
    る記事を選定してユーザに提示する記事検索手段と、 この記事検索手段によって選定された記事が満足した検
    索条件を示す情報を各記事に付加してユーザに提示する
    手段を具備することを特徴とする情報フィルタリング装
    置。
  3. 【請求項3】 複数の情報源からテキストやイメージな
    どの記事の配信を受け、それら配信された記事の中から
    所定の記事を選出してユーザに提示する情報フィルタリ
    ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
    る記事を選定してユーザに提示する記事検索手段と、 この記事検索手段によって選定された記事の種類に応じ
    た長さの要約または抄録を生成し、その要約または抄録
    をユーザに提示する手段を具備することを特徴とする情
    報フィルタリング装置。
  4. 【請求項4】 少なくとも1つ以上の情報源からテキス
    トやイメージなどの記事の配信を受ける手段と、あらか
    じめユーザが指定した検索条件と配信された記事との類
    似度を算出する手段と、算出した類似度の順に記事をソ
    ートして、一定の数の記事、あるいはあらかじめ定めた
    閾値以上の類似度を有する記事のみを類似度の順で出力
    する出力手段を有する情報フィルタリング装置におい
    て、 記事間の類似度を算出する手段を具備し、その算出した
    記事間類似度にしたがって記事のグループ化、関連づ
    け、あるいは出力記事の選択制御を行うことを特徴とす
    る情報フィルタリング装置。
  5. 【請求項5】 前記記事間の類似度を算出する手段は、 一文目、一段落目、見出しといった書式上のフィールド
    ごとに記事間で類似度を求め、それらの荷重平均を記事
    間の類似度とすることを特徴とする請求項4記載の情報
    フィルタリング装置。
  6. 【請求項6】 少なくとも1つ以上の情報源からテキス
    トやイメージなどの記事の配信を毎日定期的に受ける手
    段と、あらかじめユーザが指定した検索条件と配信され
    た記事との類似度を算出する手段と、算出した類似度の
    順に記事をソートして、一定の数の記事、あるいはあら
    かじめ定めた閾値以上の類似度を有する記事のみを選択
    する情報フィルタリング装置において、 フィルタリング結果としてユーザに出力した記事を記憶
    する出力記事記憶手段と、 この出力記事記憶手段に記憶されている記事と当日配信
    された記事とを合わせてそれら記事間で類似度を算出
    し、その類似度にしたがって記事のグループ化あるいは
    関連づけを行ってユーザに出力する手段とを具備し、 当日の記事だけからなる記事グループか、それ以前の日
    の記事も含まれているのかを区別するための情報を出力
    記事に付加することを特徴とする情報フィルタリング装
    置。
JP33579095A 1995-07-31 1995-11-30 情報フィルタリング装置 Expired - Fee Related JP3810463B2 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP33579095A JP3810463B2 (ja) 1995-07-31 1995-11-30 情報フィルタリング装置
US08/695,214 US5907836A (en) 1995-07-31 1996-07-31 Information filtering apparatus for selecting predetermined article from plural articles to present selected article to user, and method therefore

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
JP7-212939 1995-07-31
JP21293995 1995-07-31
JP33579095A JP3810463B2 (ja) 1995-07-31 1995-11-30 情報フィルタリング装置

Publications (2)

Publication Number Publication Date
JPH09101990A true JPH09101990A (ja) 1997-04-15
JP3810463B2 JP3810463B2 (ja) 2006-08-16

Family

ID=26519516

Family Applications (1)

Application Number Title Priority Date Filing Date
JP33579095A Expired - Fee Related JP3810463B2 (ja) 1995-07-31 1995-11-30 情報フィルタリング装置

Country Status (1)

Country Link
JP (1) JP3810463B2 (ja)

Cited By (45)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH09212505A (ja) * 1996-01-30 1997-08-15 Canon Inc 文書処理装置および方法
JPH10260991A (ja) * 1997-01-14 1998-09-29 Seiko Epson Corp 情報検索方法および情報検索装置
JPH10275160A (ja) * 1997-03-31 1998-10-13 Matsushita Giken Kk 情報フィルタ装置及び情報フィルタリング方法並びに情報フィルタリングプログラムを記録した記録媒体
JPH1117569A (ja) * 1997-06-25 1999-01-22 Kokusai Electric Co Ltd 情報表示システム
JPH1153392A (ja) * 1997-08-08 1999-02-26 Toshiba Corp 情報フィルタリング装置および同装置に適用される関連情報提供方法
JPH11265398A (ja) * 1998-03-18 1999-09-28 Fujitsu Ltd 情報提供システム及びその制御プログラムを記録した記録媒体
JP2000011003A (ja) * 1998-06-26 2000-01-14 Nippon Telegr & Teleph Corp <Ntt> 公開文書要約装置およびそのためのプログラムを記録した記録媒体
JP2000067067A (ja) * 1998-08-20 2000-03-03 Sky Com:Kk 配信サーバ及び配信システム
JP2000105764A (ja) * 1998-09-28 2000-04-11 Hitachi Ltd 情報フィルタリングシステム
JP2000123105A (ja) * 1999-12-07 2000-04-28 Adc Technology Kk サイト案内システム
JP2000200339A (ja) * 1998-12-28 2000-07-18 Casio Comput Co Ltd 集合図表示制御装置及び記憶媒体
JP2000209255A (ja) * 1999-01-12 2000-07-28 San Denshi Kk 情報提供装置
JP2000216810A (ja) * 2000-01-01 2000-08-04 San Denshi Kk 情報提供方法
US6119117A (en) * 1997-07-15 2000-09-12 Kabushiki Kaisha Toshiba Document management method, document retrieval method, and document retrieval apparatus
JP2001117941A (ja) * 1999-10-20 2001-04-27 Just Syst Corp 文書検索装置、文書検索方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体
JP2001222631A (ja) * 2000-02-10 2001-08-17 Canon Inc 著作物配信システム及び情報処理装置及び方法
JP2001273302A (ja) * 2000-03-23 2001-10-05 Toshiba Corp 画像検索システムおよび画像検索方法
JP2001312509A (ja) * 2000-04-28 2001-11-09 Fujitsu Ltd 電子情報配信システムおよび記録媒体
JP2002116894A (ja) * 2000-10-11 2002-04-19 Fuji Xerox Co Ltd カスタマイズ印刷データ配信方法及びシステム
JP2002150147A (ja) * 2000-08-29 2002-05-24 Yutaka Nishimura 情報提供システム及び方法並びに情報提供用プログラムを記録した記録媒体
JP2002342246A (ja) * 2001-05-15 2002-11-29 Pia Corp メールマガジン配信システム及びそれを実現するためのコンピュータプログラム
JP2003514271A (ja) * 1999-10-22 2003-04-15 ヨードリー・コム・インコーポレイテツド 単一のユーザインターフェースを介してユーザに計算済みの解決指向の個人化された要約リポートを提供するための方法および装置
JP2003196421A (ja) * 2001-12-25 2003-07-11 Pia Corp ランキング情報返送システム及びそれを実現するためのコンピュータプログラムとその方法
JP2004506961A (ja) * 2000-03-16 2004-03-04 マイクロソフト コーポレイション 優先順位の生成および管理
JP2005056359A (ja) * 2003-08-07 2005-03-03 Sony Corp 情報処理装置および方法、プログラム、並びに記録媒体
JP2007034961A (ja) * 2005-07-29 2007-02-08 Ricoh Co Ltd コンテンツ処理装置、コンテンツ処理プログラムおよびコンテンツ処理方法
JP2007287154A (ja) * 2006-04-18 2007-11-01 Nhn Corp オンライン上で提供されるニュース記事に加重値を付与する方法及びそのシステム
JP2008511081A (ja) * 2004-08-23 2008-04-10 トムソン グローバル リソーシーズ 重複する文書の検出および表示機能
US7555195B2 (en) 2002-04-16 2009-06-30 Nippon Telegraph And Telephone Corporation Content combination reproducer, content combination reproduction method, program executing the method, and recording medium recording therein the program
JP2010020678A (ja) * 2008-07-14 2010-01-28 Nippon Telegr & Teleph Corp <Ntt> 文書要約装置、文書要約方法、プログラムおよび記録媒体
JP2010055619A (ja) * 2008-08-28 2010-03-11 Palo Alto Research Center Inc ウェブブラウザ・ウィジェットをソーシャルインデクシングとインターフェースさせるためのシステム及び方法
JP2011002982A (ja) * 2009-06-18 2011-01-06 Yahoo Japan Corp コンテンツ提供装置、コンテンツ提供方法およびコンテンツ提供プログラム
JP2011517822A (ja) * 2008-04-14 2011-06-16 アルカテル−ルーセント 重複を最低限に抑えるWebフィードを集約するための方法
JP2011134355A (ja) * 2007-07-12 2011-07-07 Oki Data Corp 文書検索装置
JP2013513140A (ja) * 2009-12-07 2013-04-18 インターナショナル・ビジネス・マシーンズ・コーポレーション パブリッシュ−サブスクライブ・システムのための文脈的サポート
KR101356035B1 (ko) * 2012-05-14 2014-01-29 한국과학기술원 욕설 제거 방법 및 시스템
JP2016043537A (ja) * 2014-08-21 2016-04-04 株式会社アシストシステム研究所 新聞紙面印刷装置および新聞紙面印刷方法
WO2016147621A1 (ja) * 2015-03-13 2016-09-22 日本電気株式会社 記事管理システム、記事管理方法および記事管理プログラム
JP2018045498A (ja) * 2016-09-15 2018-03-22 株式会社東芝 検索装置、検索方法、プログラムおよび検索システム
JP2018185716A (ja) * 2017-04-27 2018-11-22 株式会社日立製作所 データ処理システム、データ処理方法、およびデータ構造
JPWO2017175432A1 (ja) * 2016-04-05 2019-03-22 ソニー株式会社 情報処理装置、情報処理方法、およびプログラム
KR102114223B1 (ko) * 2019-12-10 2020-05-22 셀렉트스타 주식회사 딥러닝 기반 유사 이미지를 필터링하는 방법 및 그를 이용한 장치
CN112529091A (zh) * 2020-12-18 2021-03-19 广州视源电子科技股份有限公司 课件相似度检测方法、装置及存储介质
KR102349624B1 (ko) * 2020-09-24 2022-01-10 주식회사 포스코아이씨티 뉴스 크롤링 시스템 및 뉴스 크롤링 방법
JP2022174380A (ja) * 2021-05-11 2022-11-24 日本放送協会 コンテンツ提示制御装置及びそのプログラム、コンテンツ提示装置、並びに、コンテンツ提示システム

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20130073545A1 (en) * 2011-09-15 2013-03-21 Yahoo! Inc. Method and system for providing recommended content for user generated content on an article
WO2021181680A1 (ja) * 2020-03-13 2021-09-16 日本電信電話株式会社 支援装置、支援方法及びプログラム

Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH03244080A (ja) * 1990-02-22 1991-10-30 Teremateiiku Kokusai Kenkyusho:Kk 記事統合化処理装置
JPH0749875A (ja) * 1993-08-06 1995-02-21 Hitachi Ltd 文書情報分類方法およびそれを用いた文書情報収集方法、文書情報収集システム
JPH07114572A (ja) * 1993-10-18 1995-05-02 Sharp Corp 文書分類装置
JPH07129605A (ja) * 1993-09-13 1995-05-19 Toshiba Corp 文書検索装置
JPH07182373A (ja) * 1993-03-17 1995-07-21 Toshiba Corp 文書情報検索装置及び文書検索結果表示方法
JPH07295994A (ja) * 1994-04-22 1995-11-10 Sharp Corp 情報検索装置

Patent Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH03244080A (ja) * 1990-02-22 1991-10-30 Teremateiiku Kokusai Kenkyusho:Kk 記事統合化処理装置
JPH07182373A (ja) * 1993-03-17 1995-07-21 Toshiba Corp 文書情報検索装置及び文書検索結果表示方法
JPH0749875A (ja) * 1993-08-06 1995-02-21 Hitachi Ltd 文書情報分類方法およびそれを用いた文書情報収集方法、文書情報収集システム
JPH07129605A (ja) * 1993-09-13 1995-05-19 Toshiba Corp 文書検索装置
JPH07114572A (ja) * 1993-10-18 1995-05-02 Sharp Corp 文書分類装置
JPH07295994A (ja) * 1994-04-22 1995-11-10 Sharp Corp 情報検索装置

Cited By (49)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH09212505A (ja) * 1996-01-30 1997-08-15 Canon Inc 文書処理装置および方法
JPH10260991A (ja) * 1997-01-14 1998-09-29 Seiko Epson Corp 情報検索方法および情報検索装置
JPH10275160A (ja) * 1997-03-31 1998-10-13 Matsushita Giken Kk 情報フィルタ装置及び情報フィルタリング方法並びに情報フィルタリングプログラムを記録した記録媒体
JPH1117569A (ja) * 1997-06-25 1999-01-22 Kokusai Electric Co Ltd 情報表示システム
US6119117A (en) * 1997-07-15 2000-09-12 Kabushiki Kaisha Toshiba Document management method, document retrieval method, and document retrieval apparatus
JPH1153392A (ja) * 1997-08-08 1999-02-26 Toshiba Corp 情報フィルタリング装置および同装置に適用される関連情報提供方法
JPH11265398A (ja) * 1998-03-18 1999-09-28 Fujitsu Ltd 情報提供システム及びその制御プログラムを記録した記録媒体
JP2000011003A (ja) * 1998-06-26 2000-01-14 Nippon Telegr & Teleph Corp <Ntt> 公開文書要約装置およびそのためのプログラムを記録した記録媒体
JP2000067067A (ja) * 1998-08-20 2000-03-03 Sky Com:Kk 配信サーバ及び配信システム
JP2000105764A (ja) * 1998-09-28 2000-04-11 Hitachi Ltd 情報フィルタリングシステム
JP2000200339A (ja) * 1998-12-28 2000-07-18 Casio Comput Co Ltd 集合図表示制御装置及び記憶媒体
JP2000209255A (ja) * 1999-01-12 2000-07-28 San Denshi Kk 情報提供装置
JP2001117941A (ja) * 1999-10-20 2001-04-27 Just Syst Corp 文書検索装置、文書検索方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体
JP2003514271A (ja) * 1999-10-22 2003-04-15 ヨードリー・コム・インコーポレイテツド 単一のユーザインターフェースを介してユーザに計算済みの解決指向の個人化された要約リポートを提供するための方法および装置
JP2000123105A (ja) * 1999-12-07 2000-04-28 Adc Technology Kk サイト案内システム
JP2000216810A (ja) * 2000-01-01 2000-08-04 San Denshi Kk 情報提供方法
JP2001222631A (ja) * 2000-02-10 2001-08-17 Canon Inc 著作物配信システム及び情報処理装置及び方法
JP2004506961A (ja) * 2000-03-16 2004-03-04 マイクロソフト コーポレイション 優先順位の生成および管理
JP2001273302A (ja) * 2000-03-23 2001-10-05 Toshiba Corp 画像検索システムおよび画像検索方法
JP2001312509A (ja) * 2000-04-28 2001-11-09 Fujitsu Ltd 電子情報配信システムおよび記録媒体
JP2002150147A (ja) * 2000-08-29 2002-05-24 Yutaka Nishimura 情報提供システム及び方法並びに情報提供用プログラムを記録した記録媒体
JP2002116894A (ja) * 2000-10-11 2002-04-19 Fuji Xerox Co Ltd カスタマイズ印刷データ配信方法及びシステム
JP2002342246A (ja) * 2001-05-15 2002-11-29 Pia Corp メールマガジン配信システム及びそれを実現するためのコンピュータプログラム
JP2003196421A (ja) * 2001-12-25 2003-07-11 Pia Corp ランキング情報返送システム及びそれを実現するためのコンピュータプログラムとその方法
US7555195B2 (en) 2002-04-16 2009-06-30 Nippon Telegraph And Telephone Corporation Content combination reproducer, content combination reproduction method, program executing the method, and recording medium recording therein the program
JP2005056359A (ja) * 2003-08-07 2005-03-03 Sony Corp 情報処理装置および方法、プログラム、並びに記録媒体
JP2008511081A (ja) * 2004-08-23 2008-04-10 トムソン グローバル リソーシーズ 重複する文書の検出および表示機能
JP2007034961A (ja) * 2005-07-29 2007-02-08 Ricoh Co Ltd コンテンツ処理装置、コンテンツ処理プログラムおよびコンテンツ処理方法
JP2007287154A (ja) * 2006-04-18 2007-11-01 Nhn Corp オンライン上で提供されるニュース記事に加重値を付与する方法及びそのシステム
JP2011134355A (ja) * 2007-07-12 2011-07-07 Oki Data Corp 文書検索装置
JP2011517822A (ja) * 2008-04-14 2011-06-16 アルカテル−ルーセント 重複を最低限に抑えるWebフィードを集約するための方法
JP2010020678A (ja) * 2008-07-14 2010-01-28 Nippon Telegr & Teleph Corp <Ntt> 文書要約装置、文書要約方法、プログラムおよび記録媒体
JP2010055619A (ja) * 2008-08-28 2010-03-11 Palo Alto Research Center Inc ウェブブラウザ・ウィジェットをソーシャルインデクシングとインターフェースさせるためのシステム及び方法
JP2011002982A (ja) * 2009-06-18 2011-01-06 Yahoo Japan Corp コンテンツ提供装置、コンテンツ提供方法およびコンテンツ提供プログラム
US9020959B2 (en) 2009-12-07 2015-04-28 International Business Machines Corporation Contextual support for publish-subscribe systems
JP2013513140A (ja) * 2009-12-07 2013-04-18 インターナショナル・ビジネス・マシーンズ・コーポレーション パブリッシュ−サブスクライブ・システムのための文脈的サポート
KR101356035B1 (ko) * 2012-05-14 2014-01-29 한국과학기술원 욕설 제거 방법 및 시스템
JP2016043537A (ja) * 2014-08-21 2016-04-04 株式会社アシストシステム研究所 新聞紙面印刷装置および新聞紙面印刷方法
WO2016147621A1 (ja) * 2015-03-13 2016-09-22 日本電気株式会社 記事管理システム、記事管理方法および記事管理プログラム
WO2016147624A1 (ja) * 2015-03-13 2016-09-22 日本電気株式会社 検索システム、検索方法および検索プログラム
JPWO2016147624A1 (ja) * 2015-03-13 2017-12-21 日本電気株式会社 検索システム、検索方法および検索プログラム
US10909154B2 (en) 2015-03-13 2021-02-02 Nec Corporation Search system, search method and search program
JPWO2017175432A1 (ja) * 2016-04-05 2019-03-22 ソニー株式会社 情報処理装置、情報処理方法、およびプログラム
JP2018045498A (ja) * 2016-09-15 2018-03-22 株式会社東芝 検索装置、検索方法、プログラムおよび検索システム
JP2018185716A (ja) * 2017-04-27 2018-11-22 株式会社日立製作所 データ処理システム、データ処理方法、およびデータ構造
KR102114223B1 (ko) * 2019-12-10 2020-05-22 셀렉트스타 주식회사 딥러닝 기반 유사 이미지를 필터링하는 방법 및 그를 이용한 장치
KR102349624B1 (ko) * 2020-09-24 2022-01-10 주식회사 포스코아이씨티 뉴스 크롤링 시스템 및 뉴스 크롤링 방법
CN112529091A (zh) * 2020-12-18 2021-03-19 广州视源电子科技股份有限公司 课件相似度检测方法、装置及存储介质
JP2022174380A (ja) * 2021-05-11 2022-11-24 日本放送協会 コンテンツ提示制御装置及びそのプログラム、コンテンツ提示装置、並びに、コンテンツ提示システム

Also Published As

Publication number Publication date
JP3810463B2 (ja) 2006-08-16

Similar Documents

Publication Publication Date Title
JP3810463B2 (ja) 情報フィルタリング装置
US7958128B2 (en) Query-independent entity importance in books
US5907836A (en) Information filtering apparatus for selecting predetermined article from plural articles to present selected article to user, and method therefore
US6836768B1 (en) Method and apparatus for improved information representation
US6665681B1 (en) System and method for generating a taxonomy from a plurality of documents
US6826576B2 (en) Very-large-scale automatic categorizer for web content
US7882115B2 (en) Method and apparatus for improved information representation
US9659084B1 (en) System, methods, and user interface for presenting information from unstructured data
US5598557A (en) Apparatus and method for retrieving and grouping images representing text files based on the relevance of key words extracted from a selected file to the text files
US9323827B2 (en) Identifying key terms related to similar passages
USRE44794E1 (en) Method and apparatus for representing and navigating search results
US20070185860A1 (en) System for searching
JP3717808B2 (ja) 情報検索システム
US20020099685A1 (en) Document retrieval system; method of document retrieval; and search server
US20070250501A1 (en) Search result delivery engine
US20060117002A1 (en) Method for search result clustering
EP2307951A1 (en) Method and apparatus for relating datasets by using semantic vectors and keyword analyses
US20040098385A1 (en) Method for indentifying term importance to sample text using reference text
JPH09101991A (ja) 情報フィルタリング装置
TWI290687B (en) System and method for search information based on classifications of synonymous words
Croft et al. Search engines
Gupta A survey of text summarizers for Indian Languages and comparison of their performance
Ntoulas et al. The infocious web search engine: Improving web searching through linguistic analysis
JP2002183175A (ja) テキストマイニング方法
EA002016B1 (ru) Способ поиска хранимых на устройствах хранения данных электронных документов и их фрагментов

Legal Events

Date Code Title Description
A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20040119

A911 Transfer to examiner for re-examination before appeal (zenchi)

Free format text: JAPANESE INTERMEDIATE CODE: A911

Effective date: 20040202

A912 Re-examination (zenchi) completed and case transferred to appeal board

Free format text: JAPANESE INTERMEDIATE CODE: A912

Effective date: 20040319

A711 Notification of change in applicant

Free format text: JAPANESE INTERMEDIATE CODE: A711

Effective date: 20041203

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A821

Effective date: 20041203

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20060421

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20060524

R150 Certificate of patent or registration of utility model

Free format text: JAPANESE INTERMEDIATE CODE: R150

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100602

Year of fee payment: 4

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20110602

Year of fee payment: 5

LAPS Cancellation because of no payment of annual fees