JPH09101990A - 情報フィルタリング装置 - Google Patents
情報フィルタリング装置Info
- Publication number
- JPH09101990A JPH09101990A JP33579095A JP33579095A JPH09101990A JP H09101990 A JPH09101990 A JP H09101990A JP 33579095 A JP33579095 A JP 33579095A JP 33579095 A JP33579095 A JP 33579095A JP H09101990 A JPH09101990 A JP H09101990A
- Authority
- JP
- Japan
- Prior art keywords
- article
- articles
- user
- information
- similarity
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Landscapes
- Information Transfer Between Computers (AREA)
- Machine Translation (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
Abstract
関連記事の情報を付加してユーザに送信し、送信記事の
有効利用を図る。 【解決手段】情報フィルタリングセンタ1内には記事間
の類似度を算出する記事間類似度計算部16が設けられ
ており、この記事間類似度計算部16によって重複記事
の存在が調べられる。重複記事を構成する記事群の1つ
がユーザに提示する記事として選択され、他の記事は排
除される。この場合、排除された記事に関する情報は、
関連記事情報として選択記事に付加されてユーザに送ら
れる。よって、ユーザに提供される記事同士の関連性を
ユーザに提示できるようになり、ユーザによる送信記事
の有効利用を図る事が可能になる。
Description
記事からユーザの要求・興味にあったものを選出して定
期的にユーザに提供する情報フィルタリング装置に関す
る。
の普及、および計算機ネットワークを介した電子メール
や電子ニュースの普及などに伴い、文書の電子化は加速
的に進みつつある。
新聞、雑誌、本の情報も電子的に提供されることが一般
的になると考えられる。これにより、個人にとってリア
ルタイムで入手可能となるテキスト情報の量は膨大にな
っていくと予測される。
スト記事からユーザの要求・興味にあったものを選出し
て定期的にユーザに提供する情報フィルタリングシステ
ムあるいは情報フィルタリングサービスの需要が高まり
つつある。
グシステムは、ユーザの要求や興味を表現したユーザプ
ロファイルに合致する記事を検索し、これらの見出しの
リストあるいは記事全体をならべてユーザに提示するも
のである。
味をもっているトピックをいくつか指定することにより
作成される。
ーザが行い、この情報をユーザプロファイルに反映させ
ることにより、次回以降の情報フィルタリングの適合率
を高めるというレレバンス・フィードバックという機能
が実現されている。
ムでは、選定された記事が羅列されてユーザに提示され
るだけであるので、今回提示された記事同士の関係や、
今回提示された記事と前回までに提示された記事との関
係を把握することがユーザにとっては難しいという問題
点があった。
は、いかなるトピックのいかなる検索条件にマッチした
ためにその記事がユーザに提示されるに至ったか、ま
た、提示された記事を他のユーザはどのように読んでい
るかなどの情報が欠落していたため、有用性の判定には
多大な労力を必要とし、その一貫性を保つことが難しい
という問題点があった。
ては、重要記事を選出した後にさらに、その記事内の重
要なテキストを部分的に選出するという二重のフィルタ
リングを行うことは、長い記事からの情報収集を効率的
にするという点で有効である。しかし、従来では、機械
的に適当な長さのテキストを抜粋表示しているにすぎな
かったため、余分な情報が混在していたり、必要な情報
が欠けていたりするという問題点があった。
されるテキストと検索条件との類似度にしたがってユー
ザに提供するテキストを選択するだけであったため、同
じ内容のテキストであってもばらばらに出力される等の
問題があった。
のであり、情報フィルタリングによってユーザに提供さ
れる記事同士の関連性をユーザに提示できるようにし、
ユーザに記事同士の関連性を把握させることが可能な情
報フィルタリング装置を提供することを第1の目的とす
る。
いかなる検索条件を満足したのかがユーザにわかるよう
にすることにより、情報フィルタリングに対するユーザ
の理解と信頼を深めることが可能な情報フィルタリング
装置を提供することを第2の目的とする。
ユーザに提示する要約あるいは抄録の長さを調節できる
ようにし、2重フィルタリングを効率的に行うことがで
きる情報フィルタリング装置を提供することを第3の目
的とする。
記事同士をグループ化あるいは関連づけしてユーザに提
供できるようにし、ユーザがテキスト記事を読むための
手間を大幅に軽減することが可能な情報フィルタリング
装置を提供することを第4の目的とする。
源からテキストやイメージなどの記事の配信を受け、そ
れら配信された記事の中から所定の記事を選出してユー
ザに提示する情報フィルタリング装置において、ユーザ
毎に予め指定された検索条件を保持する手段と、配信さ
れた記事を検索し、ユーザ毎に検索条件に合致する記事
を選定する記事検索手段と、この記事検索手段によって
選定された記事同志または選定された記事と他の記事と
の間の類似度を算出し、その類似度に従って記事毎に関
連記事を決定する手段と、決定された関連記事の情報を
前記選定された記事に付加してユーザに提示する手段と
を具備することを特徴とする。
例えば記事表現を記事間で比較することによって記事同
志の類似度が算出され、その類似度に従って、ユーザに
提示される記事とそれに関連する関連記事が決定され
る。この関連記事の情報は、ユーザに提示される記事の
本文情報などに付加されてユーザに送られる。類似度計
算を行う対象としては、今回到着した記事同士、または
今回到着した記事と前回までに到着した記事との間で行
うことが好ましい。これにより、記事検索手段によって
選定されている記事同士の関係や、今回選定された記事
と過去のフィルタリングで選定された記事との関係など
が明確になり、記事同士の関連性などをユーザに知らせ
ることができる。
事同志の類似度を算出することによって重複記事の存在
を調べれば、重複記事の本文情報についてはユーザに提
示せずに、その重複記事の見出しなどの情報だけを関連
記事情報として付加してユーザに提示することもでき
る。これにより、例えば異なる複数の情報源から得られ
た同一内容に関する記事が、重複してユーザに提示され
ることを自動的に回避することができる。
ストやイメージなどの記事の配信を受け、それら配信さ
れた記事の中から所定の記事を選出してユーザに提示す
る情報フィルタリング装置において、ユーザ毎に予め指
定された検索条件を保持する手段と、配信された記事を
検索し、ユーザ毎に検索条件に合致する記事を選定して
ユーザに提示する記事検索手段と、この記事検索手段に
よって選定された記事が満足した検索条件を示す情報を
各記事に付加してユーザに提示する手段を具備し、その
記事が選択された根拠をユーザに知らせることができる
ようにしたことを特徴とする。
ユーザの選択したトピックのうちいずれに適合したもの
であるかなど、提示されている記事がいかなる検索条件
を満足したのかがユーザに明示されるため、何故その記
事が提示されているかがユーザに分かりやすくなり、記
事の有用性の判定が容易になる。
事がユーザにとって有用であったか否かなどの情報につ
いてユーザからフィードバックを受け、その情報を反映
して検索条件を修正するレレバンス・フィードバック機
能をさらに設けることにより、記事が選択された根拠の
提示を、そのレレバンス・フィードバック機能に有効利
用できるようになる。
提示されている記事が他のユーザによってどのように読
まれているかをユーザに提示することによっても、他の
ユーザの判断を参考にしたレレバンス・フィードバック
が可能になり、レレバンス・フィードバックの有効利用
を図ることができる。
ストやイメージなどの記事の配信を受け、それら配信さ
れた記事の中から所定の記事を選出してユーザに提示す
る情報フィルタリング装置において、ユーザ毎に予め指
定された検索条件を保持する手段と、配信された記事を
検索し、ユーザ毎に検索条件に合致する記事を選定して
ユーザに提示する記事検索手段と、この記事検索手段に
よって選定された記事の種類に応じた長さの要約または
抄録を生成し、その要約または抄録をユーザに提示する
手段を具備することを特徴とする。
さの要約あるいは抄録が作成されてそれがユーザに提示
されるため、ユーザに提示されるテキストのうち、ユー
ザにとって有用であるテキスト情報の占める割合が高く
なる。これにより、効率的な情報収集が可能になる。
足したトピックなどの検索条件の違いや、その記事の発
行日時などの記事そのものの属性の違いなどを利用する
ことが好ましい。例えば、ユーザが検索条件として複数
のトピックを指定し、且つそれらトピックに優先度を設
定した場合には、優先度の高いトピックに該当する記事
が検索される程、要約・抄録のサイズを長くでき、ユー
ザにとって有用であるテキスト情報の占める割合が高く
なる。
情報源からテキストやイメージなどの記事の配信を受け
る手段と、あらかじめユーザが指定した検索条件と配信
された記事との類似度を算出する手段と、算出した類似
度の順に記事をソートして、一定の数の記事、あるいは
あらかじめ定めた閾値以上の類似度を有する記事のみを
類似度の順で出力する出力手段を有する情報フィルタリ
ング装置において、記事間の類似度を算出する手段を具
備し、その算出した記事間類似度にしたがって記事のグ
ループ化、関連づけ、あるいは出力記事の選択制御を行
うことを特徴とする。
関連する記事同士がグループ化あるいは関連づけて利用
者に提供することが可能となる。従来のように関連のあ
るテキストが、順不同で出力された場合には、利用者は
テキストごとに内容を理解するために頭を切り替える必
要が生じ、フィルタリング結果全体を理解するための手
間がかかることになるが、この発明の情報フィルタリン
グ装置では、関連する記事同士がグループ化あるいは関
連づけて利用者に提供されるため、利用者の手間を大幅
に軽減することができる。
でなく、前日以前にユーザに出力した記事との間の類似
度も求め、出力記事には、当日の記事だけからなる記事
グループか、それ以前の日の記事も含まれているのかを
区別するための情報を付加することが好ましい。これに
より、利用者は、関連記事をさらに効率よく整理して読
むことが可能となる。
実施の形態について説明する。
ィルタリングシステム全体の構成について説明する。
通信社、または出版社などの複数の情報源2からテキス
トやイメージを含むテキスト記事の配信を受け、それを
定期的に加入ユーザ端末3それぞれに送信する情報提供
システムであり、このシステムの情報提供サービスは情
報フィルタリングセンタ1によって実現されている。情
報フィルタリングセンタ1は、通信網を介して複数の情
報源2および複数の加入ユーザ端末3に接続された1つ
の計算機システムによって実現されており、ここには、
情報フィルタリングのための制御や処理を行う中央処理
装置4、プログラム並びにデータを格納する半導体メモ
リ、磁気ディスク、光ディスクなどの記憶装置5、回線
や電波などの通信網介して情報源2からテキスト記事を
受信する受信部6、回線や電波などの通信網介してユー
ザ端末3にテキスト記事を送信する送信部7などから構
成されている。
ピュータやワークステーションなどの情報処理端末であ
り、情報フィルタリングセンタ1から送信されたテキス
ト記事を受信するテキスト情報受信部8と、受信したテ
キスト記事を画面表示する表示部9などを備えている。
されているように、ユーザプロファイル10と称する一
種の検索条件をユーザ毎に保持しており、そのユーザプ
ロファイル10に従って該当するユーザに提供すベき記
事を検索する。ユーザプロファイル10は、ユーザによ
って指定された複数のトピックなどから構成されてお
り、それらトピックに合致する記事が検索および選出さ
れてユーザに送られる。次に、この情報フィルタリング
センタ1の具体的な構成について説明する。
実施形態に係わる情報フィルタリングセンタ1の構成が
示されている。図中、実線の矢印はデータの流れを示し
ている。
うに、ユーザプロファイル生成部11、ユーザプロファ
イル記憶部12、記事情報抽出部13、記事検索部1
4、記事選出部15、記事間類似度計算部16、提示情
報生成部17、および記事情報記憶部18から構成され
ている。これら構成要素のうち、破線で囲まれているユ
ーザプロファイル生成部11、記事情報抽出部13、記
事検索部14、記事選出部15、記事間類似度計算部1
6、および提示情報生成部17は、例えば図1の中央処
理装置14によって実行されるソフトウェアによって実
現でき、またユーザプロファイル記憶部12および記事
情報記憶部18は記憶装置5によって実現できる。
ユーザによって指定される要求・興味などを解析して検
索のために必要なユーザプロファイルをユーザ毎に生成
する。これらユーザプロファイルはユーザプロファイル
記憶部12に記憶される。記事情報抽出部13は、各情
報源2から到着したテキスト記事から、検索や記事同士
の類似度計算に必要な情報を抽出し、それを生のテキス
ト記事と共に記事情報記憶部18に格納する。
た記事の中からユーザプロファイルに合致するものを検
索する。この検索処理では、ユーザプロファイルと到着
記事との間の類似度が調べられ、類似度の高い順に記事
がソートされる。記事選出部15は、検索結果からユー
ザに提示する記事を選出するためのものであり、例えば
類似度の値があるしきい値を越えた記事すべて、または
類似度の高い上位のいくつかの記事が選択される。
度を調べるためのものであり、選択された記事同志の類
似度を算出する。提示情報生成部17は、記事選出結果
と記事間類似度計算結果をもとにユーザに提示する記事
情報を生成する。記事情報記憶部18には、検索のため
の記事情報や記事間類似度計算結果などが記憶される。
以下、これらユーザプロファイル生成部11、記事情報
抽出部13、記事検索部14、記事選出部15、記事間
類似度計算部16、および提示情報生成部17それぞれ
の具体的な処理内容について説明する。
の処理の流れが示されている。
して個々のユーザの要求・興味を受けつける(ステップ
S1)。ユーザの要求・興味は、「○○と××に関する
記事が読みたい」といった自然言語や、興味のあるトピ
ック(話題)に頻出するキーワードの集合や、それらに
優先順位や重みをつけたもの、または通常の文書検索に
おける検索式のようなもので表される。
対して単語辞書、同義語辞書などを利用して単語抽出、
同義語展開などの言語処理を行い(ステップS2)、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する(ステップS3、S4)。作成されたユー
ザプロファイルはユーザ毎にユーザプロファイル記憶部
12に記憶され、記事検索のための検索条件として利用
される。
れの一例が示されている。
から到着した記事を受けつけ(ステップS11)、これ
に対して文書解析用の辞書や情報抽出用の辞書を用い
て、形態素解析、構文解析、書式解析などを行い、記事
の情報源や日付、文字や単語その他の文書構成要素の頻
度情報や出現位置、5W1H的な情報などの抽出を行う
(ステップS12)。次いで、記事情報抽出部13は、
これらの抽出された情報の集合体として記事を表現する
(ステップS13)。例えば、出現した単語の頻度を要
素とするベクトルにより記事を表現したり、5W1Hの
テンプレートに実現値を代入したものにより表現したり
する。このような記事の表現例をそれぞれ図6、図7に
示す。図6は、その記事に出現した単語(半導体、メモ
リー、摩擦、不況、生産、…)の出現頻度(14、9、
5、2、3)を要素とした頻度ベクトルであり、また図
7は、情報源、文字数、記事見出し、トピック、日時、
場所、主語、主動詞……などを項目とするテンプレート
である。
事を表現した後、記事検索を高速に実現するための索引
付け、つまりインデクシング処理も行い(ステップS1
4)、そしてベクトルやテンプレートで表現して記事お
よびインデクシング情報を記事情報記憶部18に記憶す
る(ステップS15)。
示されている。
よって抽出された記事情報を参照し、到着した記事の中
からユーザプロファイルに適合するものを検索する。
事の各々との類似度を算出することに相当する。この類
似度は、検索の方式によって「ユーザプロファイルに適
合する」「ユーザプロファイルに適合しない」などの離
散値をとる場合もあるし、よく適合している記事ほど類
似度の値が高くなるように連続値をとる場合もある。こ
こでは、より一般的である、類似度が連続値をとる場合
について説明する。
ファイルについて、以下の処理を行う。
プロファイルを読み込む(ステップS21)。次に、記
事検索部14は、変数iに1を代入した後(ステップS
22)、i番目の記事(1番目の記事)とユーザプロフ
ァイルとの類似度を計算する(ステップS23)。この
類似度計算は、通常の検索処理に相当するもので、記事
情報記憶部18に格納されている記事の表現や検索イン
デックスが参照される。
+1更新した後、そのときのiの値が到着記事数よりも
大きいか否かを調べ(ステップS24,S25)、大き
くない場合には類似度計算されてない記事が残っている
と認識し、iの値が到着記事数よりも大きくなるまで、
ステップS23〜S25を繰り返す。到着した全ての記
事に対してユーザプロファイルとの類似度の計算が終わ
ると、すなわち、到着した全ての記事を検索対象とした
検索処理が終わると、記事検索部14は、到着した記事
をユーザプロファイルとの類似度が高い順にソートし、
記事のランキングを行う(ステップS26)。このラン
キングの結果は、記事情報記憶部18に記憶される。ラ
ンキング結果の一例を図9に示す。
示す。
検索されランキングされた到着記事を記事情報記憶部1
8から読み込み(ステップS31)、その中から、実際
にユーザに提示するものを選出する(ステップS3
2)。ユーザに提示することが決まった記事の情報は、
再び記事情報記憶部18に格納される。
ザに提示する記事の件数Nをユーザ側があるいはセンタ
側が予め定めておき、ランキング上位N件を提示するこ
とにしたり、あるいは、ユーザプロファイルとの類似度
がある閾値以上の記事を提示することにするなどが考え
られる。図11は、図9のようなランキング結果が得ら
れている場合にその上位10件を選出した例を示してい
る。
果が得られている場合にユーザプロファイルとの類似度
が0.86以上の記事を選出した例を示している。
複数の検索及びランキングが行われた場合において、こ
れら複数のランキング結果の上位部分をマージしてユー
ザに提示する記事を選出する例を示している。
ソコン」、「人工知能」の3つのトピックに関する検索
が別個に行われており、3つのランキング結果の上位か
ら、記事A1、B1、C1、A2、B2が選出されてい
る。
術」に適合したもの、記事B1及びB2はトピック「低
価格パソコン」に適合したもの、そして記事C1はトピ
ック「人工知能」に適合したものである。
1のように一定件数を選出する、図12のように類似度
が一定値以上の記事を選出するなどが考えられる。
理の流れが示されている。
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
複数存在するものとし、記事間類似度計算の対象となる
のは、異なる情報源から到着した記事同士、例えば、新
聞社Mから到着した記事と新聞社Nから到着した記事と
する。
の組合せについて記事間類似度を計算してもよいが、こ
こでは、記事選出部15により選出された記事に対して
のみ記事間類似度を計算するという計算コストの低い方
法について説明する。
ず、記事選出部15により選出された記事を記事情報記
憶部18から読み込む(ステップS41)。次いで、記
事間類似度計算部16は、読み込んだ記事のうち、異な
る情報源から到着したもの同志の類似度を計算し、その
結果を記事情報記憶部18に格納する(ステップS4
2)。
る。
れた、異なる情報源から到着した記事の例が示されてい
る。この例では、記事A〜Dの4つの記事がユーザに提
示されることになっている。
事、記事Bは新聞社Nから到着した記事、そして記事C
は出版社Oから到着した記事である。
C、記事Bと記事C、記事Cと記事Dの組合せについて
記事間類似度が計算される。記事Aと記事Dは同一の情
報源から到着した記事であるため、類似度計算を行わな
い。
流れが示されている。
8から、記事選出部15により選出された記事の情報及
び記事間類似度計算部16により計算された記事間類似
度を読み込む(ステップS51、S52)。
似度が高く、かつ情報源が異なる記事の集合を、重複記
事の集合として分類する(ステップS53)。ここで、
重複記事とは、同じ出来事に対して複数の情報源が独自
に作成した記事のことであり、内容的には同一あるいは
ほぼ同じと考えてよい記事をいう。
の提示を回避するために、重複記事集合から、代表とし
てユーザに提示する記事をひとつ、一般にはN個選択す
る(ステップS54)。そして、提示情報生成部17
は、選択した記事の本文に対して、選択しなかった記事
の情報を関連記事情報として付加することなどにより、
ユーザに提示する情報を生成し、それを出力する(ステ
ップS55,S56)。
を説明する。
記事が派生する例を示している。ある出来事について情
報を記したプレスリリース記事Pが、新聞社M,N,O
に送られると、各新聞社はこれを編集し、コメントを加
えるなどして、独自の記事M,N,Oを作成する。記事
M,N,O,Pが各情報源から情報フィルタリングセン
ターに送られるとすると、記事M,N,O,Pは重複記
事となる。
事が作成される例を示している。
来事に対して独自に取材を行い、記事M,N,Oが作成
されている。これらが情報フィルタリングセンタ1に送
られるとすると、記事M,N,Oは重複記事となる。
な情報の中にある所望の情報をできるだけ効率よくユー
ザにアクセスさせることであるから、一般には、ユーザ
に提示する記事に重複記事が多く含まれていることは好
ましくないと考えられる。例えば、図18の例におい
て、ユーザに記事M,N,Oを全て提示してしまうと、
ユーザはひとつの出来事についての情報を得るのに3つ
の記事を読まなければならなくなってしまう。
記事の提示を回避するために、重複記事集合から、代表
としてユーザに提示する記事をひとつ、一般にはN個選
択する。以後、ひとつだけ選択する場合についてのみ説
明する。
事間類似度計算を行った結果得られる重複記事集合の例
を示す。
似度が高かったため、ふたつの重複記事集合が得られて
いる。
て、各重複記事集合から記事をひとつずつ選択する。
が新聞社Mを最優先するように予め決めておいたとする
と、最終的にユーザに提示される記事は新聞社Mから到
着した記事A,Dとなる。
リリースを最優先して選択することも考えられる。
あったものを選択することも考えられる。
ルと記事との類似度は重複記事集合1では記事Cが高
く、重複記事集合2では記事Dが高いので、最終的にユ
ーザに提示される記事は記事C,Dとなる。
最も少ないものを選択するなどの戦略も考えられる。
提示する記事の候補の中から重複記事が排除される。最
終的に排除された重複記事に関する情報は、各記事の本
文情報に付加してユーザに提示される。
報を記事の本文情報に付加して提示する例を示す。
の本文情報に加えて、この記事と内容が同一と判断され
た他の情報源の記事に関する情報が付加情報として与え
られている。具体的には、記事の見出しや情報源、文字
数、そして現在本文が提示されている記事との類似度な
どがリストアップされている。
から撤退した」という内容の記事が○○新聞社、△△新
聞社、□□新聞社の3つの情報源から得られたが、ユー
ザに提示する記事としては○○新聞社の記事が選ばれた
ということになる。
報を記事の本文情報に付加して提示すると、内容的には
同じだが情報源が異なる記事を何度も読むことを回避で
き、かつ各情報源が同一の出来事に対してどのように報
道しているかの概観を得ることができると考えられる。
変形例が示されている。
連情報をユーザ端末に表示したが、図21では、付加情
報のテキスト部分がハイパーテキストなどで構造化され
ており、これを利用して排除された重複記事の本文にア
クセスすることを可能にしている。
事見出しがマウスなどの装置により選択できるボタンに
なっており、ユーザは関連記事1を選択することによっ
て、その関連記事1の本文を参照することができる。
記事1が選択された場合に関連記事1の本文を表示する
例を示す。
導体協議の…」という記事は、図22においては付加情
報のエリアに見出しなどの情報のみが表示されており、
その代わりに本文情報のエリアには関連記事1の本文が
表示されている。
ユーザは図22の付加情報のエリアにおける「半導体協
議の…(元の記事)」というボタンを選択すればよい。
ている情報を保持しながら、関連記事1の本文情報を新
たに開いたウィンドウ上に表示している。このような表
示方法をとれば、複数の重複記事を比較することが可能
となる。
は、図24の処理の流れに従って次のように実行され
る。
いるように提示記事の本文情報に関連記事の情報を付加
してユーザ端末3に画面表示させる(ステップS6
1)。次いで、関連記事のボタンが選択されるというイ
ベントが発生すると、提示情報生成部17は、選択され
た関連記事の本文情報を記事情報記憶部18から取り出
し(ステップS62,S63)、図22に示されている
ように、元の記事の情報を付加情報のエリアに、選択さ
れた関連記事の本文を本文情報エリアに表示する(ステ
ップS64)。
1からユーザ端末3に予め関連記事の本文情報を送信し
ておけば、ユーザ端末3側の制御で行うこともできる。
は、図25の処理の流れに従って次のように実行され
る。
いるように提示記事の本文情報に関連記事の情報を付加
してユーザ端末3に画面表示させる(ステップS7
1)。次いで、関連記事のボタンが選択されるというイ
ベントが発生すると、提示情報生成部17は、選択され
た関連記事の本文情報を記事情報記憶部18から取り出
し(ステップS72,S73)、図23に示されている
ように、選択された関連記事の本文をウインドウ表示す
る(ステップS74)。
らユーザ端末3に予め関連記事の本文情報を送信してお
けば、ユーザ端末3側の制御で行うことができる。
エリアに付加する関連記事は、前述の重複記事集合から
記事を選択するのと同様な戦略により絞り込みを行って
もよい。
表して本文が表示されている記事から、それ以外の重複
記事の本文にアクセスできるようにすると、情報フィル
タリングシステムによって選択された代表記事が不適切
なものであった場合にも、ユーザが他の重複記事を選択
して読むことが可能となる。
ーザの希望によりN新聞の記事を優先して選択する戦略
をとっていたとしても、ユーザがある出来事に関してだ
けはN新聞の記事ではなくプレスリリースを読みたいと
いった場合に有効である。
の見解などを比較することも可能となる。
合に、ユーザに提示する記事の一覧表を重複記事情報と
ともに表示した例が示されている。
あるが、そのうちの3件目である「○×社 情報サービ
スビジネスから撤退」という記事には重複記事が2件存
在する。
ルと記事との類似度の値が表示されているが、重複記事
に関してはそれとは別に、元の記事と重複記事との類似
度の値も表示されている。これは重複記事である確から
しさを示していると言える。ここで、元の記事とは「○
×社 情報サービスビジネスから撤退」の記事などを指
す。
イルに対する処理を中心に述べてきた。
受けるユーザは複数いるので、情報フィルタリングセン
タは、ユーザ毎にユーザプロファイルを保持し、フィル
タリングの各処理を行うことになる。
似度計算部16及び提示情報生成部17の他の構成例に
ついて説明する。
の流れを示す。
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
グで得られた記事情報が記事情報記憶部18に保存され
ているものとする。
日一回行われ、かつNを1とした場合、昨日の情報フィ
ルタリングで得られた記事情報は保存されているという
ことを意味する。以後、主にN=1として説明する。
象となるのは、今回到着した記事と、前回までに到着し
た記事との組である。
記事との全ての組合せについて類似度計算を行ってもよ
いが、以後は、より計算コストの低い方式、つまり記事
選出部により今回選出された記事と、前回までにユーザ
に提示された記事との組合せについてのみ類似度計算を
行う場合について説明する。
ず、記事選出部15により選出された記事の情報を記事
情報記憶部18から読み込み、次いで、前回までのフィ
ルタリングでユーザに提示した記事の情報を記事情報記
憶部18から読み取る(ステップS81、S82)。そ
して、記事間類似度計算部16は、記事選出部15によ
り今回選出された記事と、前回までにユーザに提示され
た記事との組合せについて類似度計算を行い、その結果
を記事情報記憶部18に格納する(ステップS83)。
出された記事の集合と、前回ユーザに提示された記事の
集合の例を示す。
B,C,Dが提示されており、今回は記事E,F,G,
Hが提示されようとしている。
E、記事Aと記事Fといったように4×4=16の組合
せについて計算されることになる。
たす記事のみ類似度計算の対象としてもよい。
事同士の類似度のみを計算することにすると、今回新聞
社Mから到着した記事Eに関する類似度計算は、前回新
聞社Mから到着した記事A,Bのみについて行えばよい
ことになる。
ロファイルとの類似度が一定値以上の記事のみを類似度
計算の対象とすることも考えられる。
上の記事のみを対象とすると、記事Eと記事A、記事G
と記事Aの組合せのみ計算すればよいことになる。
流れが示されている。
8から、今回記事情報選出部15により選出された記事
の情報及び前回までにユーザに提示された記事の情報及
び記事間類似度計算部16により計算された記事間類似
度を読み込む(ステップS91〜S93)。そして、今
回の記事の本文情報を前回までの関連記事の情報ととも
にユーザに提示する(ステップS94,S95)。
情報に前回までの関連記事の情報を付加して提示する例
が示されている。
た「半導体協議の…」という記事の本文情報に加えて、
半導体に関する昨日までの記事の情報が付加情報として
与えられている。具体的には、前回までの記事の見出し
や情報源、文字数、そして今回提示された記事との類似
度などがリストアップされている。
の15日付の記事であり、前回までの関連記事としては
○△新聞及び○○新聞の14日付の記事が表示されてい
る。
「シリーズ:半導体摩擦(その3)」という記事の本文
情報に加えて、同じ○○新聞社から昨日までに到着した
「シリーズ:半導体摩擦(その1)」及び「シリーズ:
半導体摩擦(その2)」という記事に関する情報が表示
されている。
は、この例における図30及び図31の変形例にもなっ
ている。
と同様に、ユーザが前回までの関連記事の本文にアクセ
スできるようにすることが考えられる。
完全に分離されているが、本文情報中に前回までの記事
情報を埋め込んで提示することも考えれる。
までの関連記事の情報を埋め込んで提示する例を示す。
発化」という19日付けの記事の本文が表示されている
が、その第一文の「○○県○○沖で先月14日から始ま
った××地震は…」の一部がマウスなどで選択できるボ
タンになっている。
事のうちこの文と類似した情報を含む記事に関する情報
が表示される。
を選択した場合に、その文と関係の深い前回までの記事
のリストを表示した例である。
ード4」などの、14日付の記事の見出しや情報源、文
字数、今回の記事との類似度などがリストアップされて
いる。
沖で地震 マグニチュード4」という関連記事を選択し
た場合に、その記事の本文を表示した例である。
択した直後に、図34のように関連記事の本文をひとつ
以上表示してもよい。
に前回までの関連記事の情報を埋め込んで提示するとい
う形態を実施するためには、今回の記事と前回までの記
事との類似度を計算するかわりに、今回の記事の本文の
各構成要素と前回までの記事との類似度を計算すること
になる。
句、単語、などが考えられる。
関連記事情報も記事単位ではなく本文の構成要素単位で
提示してもよい。
表示するかわりに、第一段落のみを表示することが考え
られる。
れと関係のある前回までの記事にアクセスできるように
すれば、時間の経過とともに状況が変わっていくような
出来事についてその経緯を把握することや、連載記事な
ど複数の記事にわたる情報を把握することが容易にな
る。
に提示された記事を思い出して、その内容を再確認した
くなった場合などにも有効である。
似度計算部16及び提示情報生成部17のさらに他の構
成例について説明する。
理の流れが示されている。
記事との類似度を計算する、換言すれば、ユーザプロフ
ァイルを検索式とし、記事を検索対象とした通常の検索
を行うのに対し、記事間類似度計算部16は、記事同士
の類似度を計算する。
記事の表現同士を比較することにより行われ、計算結果
は記事情報記憶部18に記憶される。
なるのは、今回到着した記事同士の組合せである。
ってもよいが、以後、より計算コストの低い、今回記事
選出部15により選出された記事同士についてのみ類似
度計算を行う場合について説明する。
点では、実施形態1と同じであるが、実施形態1が情報
源の異なる記事間に対して計算を行っていたのに対し、
ここではそのような限定はしていない。
の記事が選出された場合、記事間類似度計算部16は、
それら記事を記事情報記憶部18から読取り(ステップ
S101)、記事Aと記事B、記事Aと記事C、記事A
と記事D、記事Bと記事Dといったように全ての組合せ
について類似度計算を行う(ステップS102)。
計算の対象としてもよい。
流れが示されている。
8から、記事情報選出部15により選出された記事の情
報及び記事間類似度計算部16により計算された記事間
類似度を読み込む(ステップS111,S112)。そ
して、提示情報生成部17は、今回の記事の本文情報を
今回の他の関連記事の情報とともにユーザに提示する
(ステップS113,S114)。
他の関連記事の情報とともに提示する例を示す。
…」という記事の本文情報に加えて、同じ15日付けの
半導体に関する記事の情報が付加情報として与えられて
いる。これにより、実施形態1における重複記事が表示
されてしまう可能性があるが、このような場合には実施
形態1の重複記事削除処理を行ってもよい。
れている「××社 半導体シェア独占…」という記事の
本文情報を見るときには、図38のように「半導体協議
の…」という記事が付加情報のエリアに表示されること
になる。
は、この例の図37及び図38の変形例にもなってい
る。
当日の関連記事の本文に直接アクセスできるようにする
ことが考えられる。
これまでは、主に個々の記事をユーザに提示する際の関
連記事情報の付加について述べてきたが、今回の記事同
士の記事間類似度を利用して、ユーザに提示する記事の
順序を決定することも可能である。
に反映させる例を示す。
技術、低価格パソコン、人工知能という3つの異なる分
野に関する語の集合であるとする。
ように、3つの異なる分野の記事が混在した検索結果が
得られる。
プロファイルとの類似度が0.80以上の記事を選択
し、そのままの順序でユーザに提示すると、ユーザは半
導体、低価格パソコン、人工知能、半導体、低価格パソ
コン、のような順序で記事を読むことになってしまう場
合がある。
記事を読むことが有効な場合もあると考えられるが、こ
のように複数分野の記事が混在している場合には、図3
9(b)のように、内容の類似した記事を集め、それを
ひとかたまりにして表示した方がユーザにとって分りや
すいと考えられる。
3件、低価格パソコンに関する記事が次の3件、そして
残りの2件が人工知能に関するものとなっている。
では、頻度ベクトルなどを使用して記事間でその表現を
比較することによって記事同志の類似度が算出され、そ
の類似度に従って、ユーザに提示される記事に関連する
関連記事が決定される。この関連記事の情報は、ユーザ
に提示される記事の本文情報に付加されてユーザに送ら
れる。類似度計算を行う対象としては、今回提示されて
いる記事同士、または今回到着した記事と前回までに到
着した記事との間で行うことが好ましい。これにより、
今回提示されている記事同士の関係や、今回提示されて
いる記事と過去のフィルタリングで提示された記事との
関係が明確になり、記事同士の関連性などをユーザに知
らせることができる。
よって重複記事の存在を調べれば、重複記事の本文情報
についてはユーザに提示せずに、その重複記事の見出し
などの情報だけを関連記事情報として付加してユーザに
提示することもできる。これにより、例えば異なる複数
の情報源から得られた同一内容に関する記事が、重複し
てユーザに提示されることを自動的に回避することがで
きる。
ザに複数の記事を提示する際、記事間の関係を明確にし
て提示できるようになり、ユーザにとって記事内容の理
解が容易になると考えられる。
ルタリングシステムの第2の実施形態について説明す
る。このシステム全体の構成は、図1と同様であり、ユ
ーザ毎にユーザプロファイルが保持しており、そのユー
ザプロファイルを利用して記事の検索が行われる。ここ
で、ユーザプロファイルとは、前述したように、ユーザ
の関心が高いトピックに適合する記事を検索するための
検索条件のことをいう。
プロファイルの概念図を示す。
術」、「半導体貿易」という2つのトピックを選択して
いる。また別のユーザBは、「半導体貿易」、「低価格
パソコン」、「人工知能」という3つのトピックを選択
している。
は、「半導体技術」に関する記事を検索するための検索
条件及び「半導体貿易」に関する記事を検索するための
検索条件から構成される。同様に、ユーザBのユーザプ
ロファイルは、「半導体貿易」に関する記事の検索条
件、「低価格パソコン」に関する記事の検索条件、及び
「人工知能」に関する記事の検索条件から構成される。
ルタリングセンタ1の構成が示されている。情報フィル
タリングセンタ1は、図示のように、ユーザプロファイ
ル生成部21、トピック記憶部22、記事情報抽出部2
3、記事検索部24、記事選出部25、付加情報生成部
26、および記事情報記憶部27から構成されている。
これら構成要素のうち、破線で囲まれているユーザプロ
ファイル生成部21、記事情報抽出部23、記事検索部
24、記事選出部25、付加情報生成部26は、例えば
図1の中央処理装置14によって実行されるソフトウェ
アによって実現でき、またトピック記憶部22および記
事情報記憶部27は記憶装置5によって実現できる。
して個々のユーザの要求・興味を受けつける。ユーザの
要求・興味は、「○○と××に関する記事が読みたい」
といった自然言語や、興味のあるトピックに頻出するキ
ーワードの集合や、それらに優先順位や重みをつけたも
の、または通常の文書検索における検索式のようなもの
で表される。
対して単語抽出、同義語展開などの言語処理を行い、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する。ユーザプロファイルはユーザ毎にトピッ
ク記憶部22に記憶される。また、ユーザプロファイル
生成部21は、既にユーザに送信された各記事がユーザ
にとって有用であったか否かなどの情報についてユーザ
からフィードバックを受け、その情報を反映してトピッ
ク記憶部22の検索条件を修正するというレレバンスフ
ィードバック機能も有している。
から到着した記事を受けつけ、これに対して形態素解
析、構文解析、書式解析などを行い、記事の情報源や日
付、文字や単語その他の文書構成要素の頻度情報や出現
位置、5W1H的な情報などの抽出を行う。そして、記
事をこれらの抽出された情報の集合体として表現する。
例えば、出現した単語の頻度を要素とするベクトルによ
り記事を表現したり、5W1Hのテンプレートに実現値
を代入したものにより表現したりする。このような記事
の表現例は、それぞれ図6および図7で説明した実施形
態1のものと同じである。
実現するためのインデクシング処理も行う。記事情報抽
出部23により抽出された記事情報は、記事情報記憶部
27に記憶される。
の処理の流れを説明する。
記憶されている各トピックの検索条件と、記事情報抽出
部23によって抽出された記事情報とを参照し、各トピ
ックに適合する到着記事を検索する。これは、トピック
と到着記事との類似度を算出することに相当する。この
類似度は、検索の方式によって「トピックに適合する」
「トピックに適合しない」などの離散値をとる場合もあ
るし、よく適合している記事ほど類似度の値が高くなる
ように連続値をとる場合もあるが、ここでは、より一般
的である類似度が連続値をとる場合について説明する。
以下の処理を行う。
入した後(ステップS121)、i番目のトピック(ト
ピック1)の検索条件をトピック記憶部22から取り出
す(ステップS122)。この後、記事検索部24は、
変数jに1を代入した後(ステップS123)、トピッ
クi(トピック1)と到着記事j(到着記事1)との類
似度を計算し、満足された検索条件の情報と共に類似度
を記事情報記憶部27に格納する(ステップS12
4)。この類似度計算は、通常の検索処理に相当するも
ので、記事情報記憶部18に格納されている記事の表現
や検索インデックスが参照される。
+1更新した後、そのときのjの値が到着記事数よりも
大きいか否かを調べ(ステップS125,S126)、
大きくない場合には類似度計算されてない記事が残って
いると認識し、jの値が到着記事数よりも大きくなるま
で、ステップS124〜S126を繰り返す。到着した
全ての記事に対してトピックiとの類似度の計算が終わ
ると、記事検索部24は、到着した記事をユーザプロフ
ァイルとの類似度が高い順にソートし、記事のランキン
グを行う(ステップS127)。このランキングの結果
は、記事情報記憶部27に記憶される。
+1更新した後、そのときのiの値が全トピック数より
も大きいか否かを調べ(ステップS128,S12
9)、大きくない場合には類似度計算されてないトピッ
クが残っていると認識し、iの値が全トピック数よりも
大きくなるまで、ステップS122〜S129を繰り返
す。
グされたトピックiに対する到着記事の概念図を示す。
このように、到着記事はトピック毎にランキングされ
る。
が示されている。
記事情報記憶部27に格納された各トピックの検索結果
の中から、各ユーザに提示する記事を選出する。
iに1を代入した後(ステップS131)、ユーザi
(ユーザ1)のユーザプロファイルをトピック記憶部2
2から取り出す(ステップS132)。この後、記事選
出部25は、変数jに1を代入した後(ステップS13
3)、ユーザiのトピックj(トピック1)の検索結果
を記事情報記憶部27から取り出し、その中からユーザ
に提示する記事を選出する(ステップS135)。記事
の選出の方法としては、例えば、ユーザに提示する記事
の件数Nをユーザ側があるいはセンタ側が予め定めてお
き、ランキング上位N件を提示することにしたり、ある
いは、ユーザプロファイルとの類似度がある閾値以上の
記事を提示することにするなどが考えられる。選出され
た記事の情報は、記事情報記憶部27に格納される。
+1更新した後、そのときのjの値がユーザiの指定し
たトピック数よりも大きいか否かを調べ(ステップS1
36,S137)、大きくない場合には選出されてない
他のトピックの検索結果が残っていると認識し、jの値
がユーザiのトピック数よりも大きくなるまで、ステッ
プS134〜S137を繰り返す。ユーザiのすべての
トピックに対しての記事選出が終わると、記事選出部2
5は、変数iの値を+1更新した後、そのときのiの値
が全ユーザ数よりも大きいか否かを調べ(ステップS1
38,S139)、大きくない場合には記事選出されて
ないユーザが残っていると認識し、iの値が全ユーザ数
よりも大きくなるまで、ステップS132〜S139を
繰り返す。
ように、「半導体貿易」、「低価格パソコン」、「人工
知能」という3つのトピックを選択しているユーザに対
しては、「半導体貿易」の検索結果、「低価格パソコ
ン」の検索結果、「人工知能」の検索結果の3つが取り
出され、これらのうち上位の記事の中からユーザに提示
するものが選出される。
流れが示されている。
して以下を行う。
を代入した後(ステップS141)、ユーザi(ユーザ
1)のユーザプロファイルをトピック記憶部22から取
り出す(ステップS142)。次に、付加情報生成部2
6は、記事選出部25によって選出されたユーザ1に提
示する記事と、これらの記事が満足した検索条件に関す
る情報とを記事情報記憶部27から取り出す(ステップ
S143)。
情報とは、その記事がユーザの選択したトピックのうち
いずれに適合したか、トピックの検索条件の中のどのよ
うな条件に適合したか、などの情報をいう。検索条件と
は、どのような言語表現が記事中のどのような位置に、
どのような頻度で含まれていたか、記事の主題・行為や
その動作主は何かなどの記事が満たすべき条件を、通常
の文書検索で用いるブール式や自然言語、その他の記事
検索部により処理が可能な形式で記述したものをいう。
部25によって選出された記事に、これらの記事が満足
した検索条件に関する情報を付加してユーザiに提示す
る(ステップS144)。そして、付加情報生成部26
は、変数iの値を+1更新した後、そのときのiの値が
全ユーザ数よりも大きいか否かを調べ(ステップS14
5,S146)、大きくない場合には付加情報が生成さ
れてないユーザが残っていると認識し、iの値が全ユー
ザ数よりも大きくなるまで、ステップS142〜S14
6を繰り返す。
た記事の記事見出しのリストに、各記事が適合したトピ
ックの情報を付加してそのユーザに提示した表示例が示
されている。
価格パソコン」、「人工知能」という3つのトピックを
選択しているものとする。
出しが提示されており、これらの記事のうち3つが「半
導体貿易」に適合した記事、2つが「低価格パソコン」
に適合した記事、そして残りの1つが「半導体貿易」と
「低価格パソコン」の両方に適合した記事になってい
る。
クに適合する場合があっても、その記事が提示された根
拠が表示される。
事検索部24により検索時に計算された、適合したトピ
ックと記事との類似度の値が表示されている。
合したため、「半導体貿易」との類似度は1.05、
「低価格パソコン」との類似度は0.80、というよう
に2つの類似度が表示されている。
トピックに適合した記事の件数情報を提示した表示例を
示す。
各トピックに適合した記事の件数情報を表形式で表示し
ている。
における記事番号1、2、3、及び6の記事であるの
で、記事数は4と表示されている。同様に、「低価格パ
ソコン」に適合した記事は、図47における記事番号
4、5、及び6の記事であるので、記事数は3と表示さ
れている。また、この例では「人工知能」に適合する記
事はないので、記事数は0となっている。
易」の4件と「低価格パソコン」の3件のうち1件重複
があるので6件となっている。
号6のように複数のトピックに適合した記事の件数は別
個にカウントするようにしてもよい。
貿易」の件数は、このトピックのみに適合した記事の件
数という意味で3件となる。
各トピックに適合した記事の件数情報をベン図形式で表
示している。
2、3の3つの記事が「半導体貿易」のみに適合した記
事であり、記事番号4、5の2つの記事が「低価格パソ
コン」のみに適合した記事であり、記事番号6の記事が
両方に適合した記事であることが明示されている。
ックの適合件数と全記事数との関係がより明確になって
いる。
記事の要約文・抜粋文あるいは本文をトピック別にまと
めてそのユーザに提示した表示例を示す。
加工して要点がつかめるようにしたテキストをいい、抜
粋文とは、もとの記事の本文の一部を加工せずに抜き出
したテキストをいう。
の記事が並べて最初に表示されており、その後に「低価
格パソコン」に関する記事が続いている。
記事がどのトピックに適合したのかを明示することによ
り、ユーザは記事の内容理解や、どの記事を読み、どの
記事を読まないかなどの判断が容易になり、より効率的
な情報収集ができると考えられる。
る情報を記事本文のヘッダ情報として付加してユーザに
提示した表示例を示す。
択しているトピックのうち「半導体貿易」に適合したも
のであることが「該当トピック」の行に明示されてい
る。
似度が1.32であったことが表示されている。
索するために用いられた検索条件と、これらの条件のう
ち表示中の記事が満足したものが並べて表示されてい
る。
部が強調表示されている。
どの付加記号を伴った表示、異なる字体や大きさの文字
による表示、異なる色による表示など、一般にテキスト
の一部を他の部分よりも目立たせる手段を用いた表示を
いう。
クに適合する記事を検索するための検索条件として、
「半導体、IC、調達などの単語を本文中に含む」とい
う条件が設定されていたものとする。
で、このことを明示するために本文一文目の「半導
体」、「IC」、「調達」という単語が強調表示されて
いる。
出し」の行の「IC」という単語を強調表示してもよ
い。
示中の記事がどのような根拠に基づいて検索され、提示
されたのか理解することができる。
は、内容的に重要であることが多いので、ユーザは拾い
読みにより効率的に記事内容を把握することが可能にな
ると考えられる。
ックのために提示された記事の有用性を判定する作業の
効率化にもつながる。
を記事中に強調表示することにより記事の有用性の判定
が効率的になる例を示す。
トピックに適合する記事を検索するための検索条件の例
である。
理」、「NL」、「機械翻訳」、「かな漢字変換」とい
う言語表現が出現するとその記事の得点が高くなる。
が同一の文中に出現すると、その記事の得点が高くな
る。
が記されているものとする。
を用いて検索され、ユーザに提示された記事の例であ
る。この記事は「本文中に自然言語処理という言語表現
を含む」という検索条件を満たしているので、記事中の
「自然言語処理」という表現が強調表示されている。こ
こで、強調表示されている「自然言語処理」という表現
を含む文の辺りを読んでみると、「このソフトウェア
は、自然言語処理は用いずに、簡単な文字列マッチング
により検索を行う。」と書いてあるので、実際には自然
言語処理に関する記事ではないことがすぐにわかる。
ないと判断できるので、有用そうな記事のみを読んで情
報収集を行ったり、効率的にレレバンス・フィードバッ
クを行ったりできる。
ないことを迅速に判断する例である。
り、「artificial intelligenc
e(人工知能)」というトピックの検索条件が図52
(a)である。
「intelligence」などの単語を含む記事の
得点が高くなるようにしている。
を用いて検索されユーザに提示された記事の例であり、
「artificial」という語が強調表示されてい
る。図51と同様に、強調表示された語の周辺のみを拾
い読みすることにより、この記事は「artifici
al hand(義手)」に関するものであって「ar
tificial intelligence」とは無
関係であるということが瞬時にしてわかる。
あるのに対し、図53はユーザにとって有用である記事
の表示例である。
うトピックに適合する記事を検索するための検索条件で
あり、記事に出現する単語として「ノートパソコン」、
「ラップトップ」、「デスクトップ」などのパソコンの
種類を表す表現や、「○○社」、「△△社」など、パソ
コンメーカーの名前などが指定されている。
索条件により検索を行った結果得られ、ユーザに提示さ
れた記事の表示例である。
の記事で紹介されているパソコンのメーカーは○○社な
どのものではなく△△社のものであることがひと目でわ
かる。
れているので、発売したパソコンの種類はラップトップ
やデスクトップなどではなくノートパソコンであること
がひと目でわかる。このように、提示されている記事が
ユーザにとって有用である場合にも、記事の内容を把握
することが容易になると考えられる。
のうち記事が満足した検索条件をユーザに提示する例を
示したが、これらの表示方法の例を説明する。
に適合する文書を検索するための検索条件の具体例であ
る。
れるブール式の例であり、「半導体」「貿易」などの言
語表現がANDやORなどの演算子で結合されている。
いう言語表現が同一文中に出現するという条件を表して
いる。
見出し文字列の中に「半導体」、「メモリー」、「I
C」などの言語表現が出現するという条件を表してい
る。
ーザに提示された図50のような記事には、例えば図5
5のような情報を付加して表示する。
貿易」というトピックに適合したものであることが明示
されており、図54に示した「半導体貿易」のトピック
検索条件がそのままユーザに提示されている。
た条件が列挙されている。例えば、図50の第1文には
「半導体」と「調達」という言語表現が出現しているの
で、図55の「記事1が満足した検索条件」のところに
は、満足された条件である「第1文:半導体(1回)、
調達(1回)」が表示されている。
う行に記された言語表現のうち、記事中に実際に出現し
たものは「半導体」、「IC」、「調達」の3つであっ
たことが「記事1が満足した検索条件」の「単語:」と
いう行に表示されている。
数などの情報が表示されている。
「(半導体ORメモリー)AND(貿易OR調達)」と
いうブール式は、図50の記事中に「半導体」と「調
達」という表現が出現しているために満足されているの
で、「記事1が満足した検索条件」ではこのブール式が
表示され、さらにその中の「半導体」と「調達」という
表現が強調表示されている。
満足した検索条件とを別々に表示しているのに対し、図
56ではトピック検索条件の中に記事が満足した検索条
件を埋め込む形で表示している。
実際に満足された条件の語が強調表示されている。
ーセントくらいの条件が記事によって満たされているか
がおおまかに把握できる。
件と、そのうち記事が実際に満足している検索条件の情
報を提示することにより、その記事の有用性を判断しな
がら拾い読みをしたり、内容の把握を容易にすることが
可能であると考えられる。
提示されたのかがユーザにわかるようになるので、ユー
ザはよりきめ細かで効果的なレレバンス・フィードバッ
ク用情報を情報フィルタリングサービス側に返すことが
可能になると考えられる。
部24及び付加情報生成部26の他の構成例について説
明する。
入した後(ステップS151)、i番目のトピック(ト
ピック1)の検索条件をトピック記憶部22から取り出
す(ステップS152)。この後、記事検索部24は、
変数jに1を代入した後(ステップS153)、トピッ
クi(トピック1)と到着記事j(到着記事1)との類
似度を計算し、記事情報記憶部27に格納する(ステッ
プS154)。この類似度計算は、通常の検索処理に相
当するもので、記事情報記憶部18に格納されている記
事の表現や検索インデックスが参照される。
各記事が満足した検索条件に関する情報を必ずしも記事
情報部27に記憶する必要がないという点だけである。
記事にその記事が何故検索されたかという情報を付加し
て提示するものであるのに対し、この変形例では、ユー
ザに提示する記事に、他のユーザがその記事をどのよう
に読んでいるかという情報を付加して提示するものであ
るためである。
+1更新した後、そのときのjの値が到着記事数よりも
大きいか否かを調べ(ステップS155,S156)、
大きくない場合には類似度計算されてない記事が残って
いると認識し、jの値が到着記事数よりも大きくなるま
で、ステップS154〜S156を繰り返す。到着した
全ての記事に対してトピックiとの類似度の計算が終わ
ると、記事検索部24は、到着した記事をユーザプロフ
ァイルとの類似度が高い順にソートし、記事のランキン
グを行う(ステップS157)。このランキングの結果
は、記事情報記憶部27に記憶される。
+1更新した後、そのときのiの値が全トピック数より
も大きいか否かを調べ(ステップS158,S15
9)、大きくない場合には類似度計算されてないトピッ
クが残っていると認識し、iの値が全トピック数よりも
大きくなるまで、ステップS152〜S159を繰り返
す。
れを示す。
して以下の処理を行う。
を代入した後(ステップS161)、ユーザi(ユーザ
1)のユーザプロファイルをトピック記憶部22から取
り出す(ステップS162)。次に、付加情報生成部2
6は、記事選出部25によって選出されたユーザ1に提
示する記事と、これらの記事を受信する他のユーザに関
する情報とを記事情報記憶部27から取り出す(ステッ
プS163)。
部25によって選出された記事に、これらの記事を受信
する他のユーザに関する情報を付加してユーザiに提示
する(ステップS164)。そして、付加情報生成部2
6は、変数iの値を+1更新した後、そのときのiの値
が全ユーザ数よりも大きいか否かを調べ(ステップS1
65,S166)、大きくない場合には付加情報が生成
されてないユーザが残っていると認識し、iの値が全ユ
ーザ数よりも大きくなるまで、ステップS162〜S1
66を繰り返す。
の記事を送信するかという情報が記事選出部25により
格納されていたとする。
2を提示することが、ユーザ2には記事2、3、4を提
示することが記されている。
を提示する際に、記事1を受信する他のユーザであるユ
ーザ3、4に関する情報を付加して提示する。例えば記
事1の受信人数を提示する場合、ユーザ1、3、4の3
人という情報を付加したり、ユーザ1を除いた2人とい
う情報を付加したりする。
は、ユーザ2、ユーザ4に関する情報を付加して提示す
る。
記事の記事見出しのリストに、記事を受信した他のユー
ザに関する情報を付加してそのユーザに提示した表示例
を示す。
の全ユーザ数は4,000人となっている。
たユーザ数は250人だということがわかる。
記事の要約文または抜粋文に記事を受信した他のユーザ
に関する情報を付加して提示した表示例を示す。
れている。
する情報を記事本文のヘッダ情報として付加しユーザに
提示した例を示す。
示中の記事を受信していることが明示されている。
表示されている。
50人が男性、100人が女性であり、200人が日本
人、30人が米国人、20人がその他の国のユーザであ
ることがわかる。
導体貿易」というトピックを選択しているユーザ、50
人は「IC」というトピックを選択しているユーザ、2
0人は「半導体貿易」と「IC」の両方を選択している
ユーザであることがわかる。この他、受信者の所属や年
齢層など、プライバシー侵害にならない程度の統計情報
を表示するようにしてもよい。
を、他のどのようなユーザが何人受信しているかという
情報がわかれば、その記事がどのくらい一般的な記事で
あるか、または特殊なユーザ層にだけ読まれる記事であ
るかがわかり、ユーザにとってどれくらい有用な記事で
あるかの判断材料となると考えられる。
たユーザが、6つの記事全てを読んでいる時間がない場
合、とりあえず一般常識的な情報だけを収集しようとし
て、記事番号4の記事のように多くのユーザが読んでい
る記事だけを読むといった使い方が考えられる。
に行ったレレバンス・フィードバック情報を今回提示す
る記事情報に付加して提示する表示例を示す。
4の4件であり、ユーザはこれらの全てあるいは一部に
対して有用性の判定を行い、レレバンス・フィードバッ
クを行おうとしているものとする。
ではない」という判定を行い、この情報を情報フィルタ
リングセンタ1側に送信すれば、情報フィルタリングセ
ンタ1側は記事b1のようなトピックの記事の優先度を
下げるなどしてユーザプロファイルを修正し、次回から
はユーザの要求に合致した記事がより多く提示されるよ
うにすることが可能である。
として、ユーザが前回あるいはそれ以前に行った有用性
判定に関する情報と、他のユーザの有用性判定に関する
情報が提示されている。
判定を行った記事はa1〜a6の6件あり、例えばユー
ザは記事a1に対しては「有用である」、記事a3に対
しては「不要である」という判定をしたことがわかる。
性がなく、同じような記事に対してもあるときは「有用
である」とし、またあるときは「やや有用である」、と
いうように違った判断をしてしまうことがあると考えら
れる。
ードバックしてユーザプロファイルを修正しても、より
よいフィルタリングが行われるようになる保証はない。
きた有用性判定情報にアクセスを許すことにより、今回
の有用性の判定の信頼性や効率を高めることができると
考えられる。また、ユーザの要求が時とともに変化した
場合でも、自分の過去のフィードバック結果を参照しな
がら意識的に有用性判定の方針を変えるといった使いか
たも考えられる。
に加えて、他のユーザの判定情報が表示されている。
ザによっても受信され、有用性の判定が行われており、
このうち100人が「有用である」と判定し、100人
が「やや有用である」と判定し、50人が「不要であ
る」と判定したことがわかる。このように、他のユーザ
が過去に行った有用性判定の情報を参照して、自分のこ
れからの有用性判定の参考にしたり、また、自分が過去
に行った有用性判定を直接訂正し、レレバンス・フィー
ドバックを再度実行してもらうなどが可能となる。
レバンス・フィードバックが行えると考えられる。
「不要」という離散的な評価値により有用性を判定して
いるのに対し、図65では連続的な得点により判定して
いる。
ack情報」の、他のユーザの判定情報のところには、
他のユーザがつけた得点の平均値が表示されている。
記事a1の内容に似たものである場合、ユーザは、前回
のa1に対する自分の判定が10点であったことから、
今回のb1に対しても高得点を与えるといった使い方が
考えられる。
は1点という低い評価を行ったのに対して、他のユーザ
の平均値は7.4点と比較的高い値になっている。
用性の評価を撤回して、新たに評価値を付与しなおすと
いった使い方が考えられる。
提示されている記事がユーザの選択したトピックのうち
いずれに適合したものであるかなど、提示されている記
事がいかなる検索条件を満足したのかがユーザに明示さ
れるため、何故その記事が提示されているかがユーザに
分かりやすくなり、記事の有用性の判定が容易になる。
したがって、既にユーザに送信された各記事がユーザに
とって有用であったか否かなどの情報についてユーザか
らフィードバックを受け、その情報を反映して検索条件
を修正するレレバンスフィードバック機能をより有効利
用できるようになる。
提示されている記事が他のユーザによってどのように読
まれているかをユーザに提示することによっても、他の
ユーザの判断を参考にしたレレバンス・フィードバック
が可能になり、レレバンスフィードバックの有効利用を
図ることができる。
ルタリングシステムの第3の実施形態について説明す
る。このシステム全体の構成は、図1と同様であり、ユ
ーザ毎にユーザプロファイルを保持しており、そのユー
ザプロファイルを利用して記事の検索が行われる。ここ
で、ユーザプロファイルとは、前述したように、ユーザ
の関心が高いトピックに適合する記事を検索するための
検索条件のことをいう。
ルタリングセンタ1の構成が示されている。情報フィル
タリングセンタ1は、図示のように、ユーザプロファイ
ル生成部31、トピック記憶部32、記事情報抽出部3
3、記事検索部34、記事選出部35、要約・抄録生成
部36、および記事情報記憶部37から構成されてい
る。これら構成要素のうち、破線で囲まれているユーザ
プロファイル生成部31、記事情報抽出部33、記事検
索部34、記事選出部35、要約・抄録生成部36は、
例えば図1の中央処理装置14によって実行されるソフ
トウェアによって実現でき、またトピック記憶部32お
よび記事情報記憶部37は記憶装置5によって実現でき
る。
して個々のユーザの要求・興味を受けつける。ユーザの
要求・興味は、「○○と××に関する記事が読みたい」
といった自然言語や、興味のあるトピックに頻出するキ
ーワードの集合や、それらに優先順位や重みをつけたも
の、または通常の文書検索における検索式のようなもの
で表される。
対して単語抽出、同義語展開などの言語処理を行い、検
索が可能となるような形式に変換してユーザプロファイ
ルを作成する。ユーザプロファイルはユーザ毎にトピッ
ク記憶部32に記憶される。また、ユーザプロファイル
生成部31は、既にユーザに送信された各記事がユーザ
にとって有用であったか否かなどの情報についてユーザ
からフィードバックを受け、その情報を反映してトピッ
ク記憶部32の検索条件を修正するというレレバンスフ
ィードバック機能も有している。
れたユーザプロファイルの例を示す。
に興味をもっているために「メモリー」などの関連用語
が羅列されており、それぞれの用語に類似度計算に利用
する重みが定義されている。。
から到着した記事を受けつけ、これに対して形態素解
析、構文解析、書式解析などを行い、記事の情報源や日
付、文字や単語その他の文書構成要素の頻度情報や出現
位置、5W1H的な情報などの抽出を行う。そして、記
事をこれらの抽出された情報の集合体として表現する。
例えば、出現した単語の頻度を要素とするベクトルによ
り記事を表現したり、5W1Hのテンプレートに実現値
を代入したものにより表現したりする。記事情報抽出部
33はまた、記事検索を高速に実現するためのインデク
シング処理も行う。記事情報抽出部33により抽出され
た記事情報は、記事情報記憶部37に記憶される。
記憶されている各トピックの検索条件と、記事情報抽出
部33によって抽出された記事情報とを参照し、各トピ
ックに適合する到着記事を検索する。これは、トピック
と到着記事との類似度を算出することに相当する。この
類似度は、検索の方式によって「トピックに適合する」
「トピックに適合しない」などの離散値をとる場合もあ
るし、よく適合している記事ほど類似度の値が高くなる
ように連続値をとる場合もあるが、ここでは、より一般
的である類似度が連続値をとる場合について説明する。
この場合には、記事検索部34が各トピックについて行
う処理は実施形態1、2と同様であり、まず、トピック
記憶部32からトピックに適合する記事を検索するため
の検索条件を読み込む。次に、到着した記事の各々に対
して、そのトピックとの類似度を計算する。この類似度
計算は、通常の検索処理に相当するもので、記事情報記
憶部に格納されている記事の表現や検索インデックスが
参照される。記事の類似度、及びその記事が満足した検
索条件の情報は記事情報記憶部37に記憶される。到着
した全ての記事に対して類似度の計算が終わると、すな
わち、到着した全ての記事を検索対象とした検索処理が
終わると、到着した記事はトピックとの類似度が高い順
にソートされる。すなわち、記事のランキングが行われ
る。ランキングの結果も記事情報記憶部37に記憶され
る。
記事情報記憶部37に格納された各トピックの検索結果
の中から、各ユーザに提示する記事を選出する。例え
ば、「半導体貿易」、「低価格パソコン」、「人工知
能」という3つのトピックを選択しているユーザに対し
ては、「半導体貿易」の検索結果、「低価格パソコン」
の検索結果、「人工知能」の検索結果の3つを取り出
し、これらのうち上位の記事の中からユーザに提示する
ものを選出する。
録生成部36の処理の流れを示す。要約・抄録生成部3
6は、各ユーザに対して以下の処理を行う。
1を代入し(ステップS171)、ユーザiのユーザプ
ロファイルをトピック記憶部32から取り出す(ステッ
プS172)。次に、要約・抄録生成部36は、ユーザ
iに提示する記事の集合と、各記事がユーザの選んだト
ピックのうちいずれに適合したかを示す情報とを記事情
報記憶部37から取り出す。そして、要約・抄録生成部
36は、変数jに1を代入し、ユーザに提示する記事j
に対して、適合したトピックの情報を参照しながら、そ
のトピックに応じた長さの要約あるいは抄録を生成する
(ステップS175)。
すために原文をもとに生成したテキストをいい、抄録と
は、重要文など、記事の原文テキストの一部をそのまま
抜きだしたものをいう。
対する圧縮率、文数、段落数、文字数、あるいは提示す
るテキスト全体に占める割合などをいう。
法は、長さを2段階以上に調節できるものであれば、ど
のような方法であってもよい。
成技術でもよいし、初めの一段落目のみ表示するかもし
くは全文を表示するかという単純な方法でもよい。
の値がユーザiに提示する記事数よりも大きいか否かを
調べ(ステップS176)、大きくないならば、要約・
抄録生成処理を行っていない記事が残っていると判断
し、jの値がユーザiに提示する記事数よりも大きくな
るまでステップS175、S176を繰り返す。
iに該当記事の要約または抄録を提示し(ステップS1
77)、その後、現在のiの値が全ユーザ数よりも大き
いか否かを調べる(ステップS178)。現在のiの値
が全ユーザ数よりも大きくないならば、大きくなるまで
ステップS172〜S178の処理が繰り返される。次
に、記事の適合したトピックに応じた長さの要約・抄録
を生成する手順を図を用いて説明する。
と、それらの間の優先度の例を示す。
C,Dの4トピックを選択しており、これらに関する記
事を求めている。また、トピックA,B,C,Dの順で
優先度が高くなっている。
スセンタ1側が設定してもよいし、ユーザが指定しても
よい。ここでは、ユーザが指定したものであるとする
と、このユーザは、例えばトピックBに適合する記事よ
りもトピックAに適合する記事により興味があるという
ことになる。
るユーザに提示する記事のリストとそれらに適合したト
ピックの例を示す。
4つの記事が選出されている。記事1、2はトピックA
に、記事3はトピックBに、記事4はトピックCおよび
Dに適合したものである。
提示する記事情報の概念図を示す。記事1、2は、ユー
ザの選んだトピックのうちもっとも優先度が高いトピッ
クAに適合したものであるため、比較的長い要約あるい
は抄録が提示されている。これに対して、記事4は、ユ
ーザの選んだトピックのうちもっとも優先度が低いトピ
ックC,Dに適合したものであるため、非常に短い要約
あるいは抄録が提示されている。
階的に抄録の長さを変化させる。
さを図中の面積であらわしているが、優先度の最も高い
トピックに適合した記事の要約・抄録が必ずしも最も長
くなるとは限らない。
もとにした圧縮率を採用するとし、記事1の原文が5
文、記事4の原文が20文であったとする。
Aの記事なので圧縮率100%とし、記事4は優先度の
低いトピックC,Dの記事なので圧縮率50%として表
示したとすると、記事1の抄録は原文のままなので5文
となり、一方、記事4の抄録は10文となる。
ク毎に異なる詳細度の記事を読むことができる。
度がある場合には有効であると考えられる。
における技術に、検索結果の文書に対してユーザに有用
性の判定を行ってもらい、その結果を利用して検索式中
の単語の重み値を変更することにより、ユーザの求める
ものにより近い文書を検索するレレバンス・フィードバ
ックがある。
実現されつつある。
ドバックの際に得られる有用性判定情報を、要約・抄録
の長さに反映させることが可能である。
提示に対して、ユーザが「記事3が非常に有用であっ
た」という情報を返したとする。
度が具体的には図72のように重要度の値の大小で定義
されていたとする。
とされた記事3は、トピックBに適合した記事であるの
で、何らかの計算によりトピックBの重要度の値をより
大きくし、今度はトピックBに適合する記事の長さをよ
り長くして提示することが有用である。
った場合に、次回のフィルタリングでユーザに提示され
る記事情報の例を示す。
ったが、この図ではフィードバックによりトピックBの
優先度がもっとも高くなっており、トピックBに適合し
た記事1′の要約あるいは抄録が最も長くなっている。
録生成部36の他の構成例について説明する。
成部36の処理の流れを示す。
て以下の処理を行う。
ピック記憶部32から取り出す(ステップS181,S
182)。次に、ユーザiに提示する記事の集合と、各
記事に予め付加されている日付、新聞社、朝刊/夕刊、
見出しの大きさや行数、何面に掲載されたか、などの属
性情報とを記事情報記憶部37から取り出す(ステップ
S183)。そして、ユーザiに提示する各記事に対し
て、属性情報を参照しながら、それに応じた長さの要約
あるいは抄録を生成する(ステップS185)。ここ
で、「要約」、「抄録」、および「長さ」の意味は、実
施形態3と同様である。また、以下の処理も実施形態3
と同様である。
抄録を生成する手順を図を用いて説明する。
事選出部35により選出された記事の例を示す。この例
では、記事に予め付加されている属性として、発行日な
どの日付の情報を採用している。
日、23日、23日、20日となっている。
ような形態のサービスでは、このように、記事には新し
いものと古いものが混在している可能性がある。
提示する記事情報の概念図を示す。この例では、新しい
記事ほど要約あるいは抄録の長さを長くして表示してい
る。
表示されているが、5月20日付けの記事4は簡単に表
示されている。
ーに到着した時間や朝刊/夕刊の情報などに応じて要約
あるいは抄録の長さを変えてもよい。
えば「月曜日の記事は他の曜日の記事よりも詳しく表示
する」などといった処理も可能である。
いる場合の、あるユーザに提示するために選出された記
事の例を示す。
たもの、記事2、3は△△新聞から到着したもの、記事
4は××新聞から到着したものである。
グサービス側が、○○新聞、△△新聞、××新聞の順で
優先度を定めていたとすると、ユーザには例えば図78
のような情報が提示される。
記事なので、長い要約あるいは抄録が提示されており、
一方記事4はもっとも優先度の低い××新聞の記事なの
で、短い要約あるいは抄録が提示されている。
か、位置、社会面などの分類など、各記事の発信者によ
って予め付与されている様々な属性に応じて要約あるい
は抄録の長さを変化させることが可能である。
においても実施形態3と同様に、レレバンス・フィード
バックの際に得られる有用性判定情報を、要約・抄録の
長さに反映させることが可能である。例えば、既に説明
した図78のような情報提示に対して、ユーザが「記事
2、3が非常に有用であった」という情報を返したとす
る。
をもつ記事であるので、何らかの計算により△△新聞の
重要度の値をより大きくし、今度は△△新聞に適合する
記事の長さをより長くして提示することが有用であるか
も知れない。
った場合に、次回のフィルタリングでユーザに提示され
る記事情報の例を示す。
たが、この図ではフィードバックにより△△新聞の優先
度がもっとも高くなっており、△△新聞という属性をも
つ記事1′の要約あるいは抄録が最も長くなっている。
は、記事の種類(その記事が満足したトピックなどの検
索条件、またはその記事の発行日時などの記事そのもの
の属性)に応じた長さの要約あるいは抄録が作成されて
それがユーザに提示されるため、ユーザに提示されるテ
キストのうち、ユーザにとって有用であるテキスト情報
の占める割合が高くなる。これにより、効率的な情報収
集が可能になる。
施形態に係る情報フィルタリングシステムを説明する。
全体的なシステム構成は実施形態1と同じであるので、
ここでは、実施形態1との差異について説明する。
示したような記事間類似度計算処理を行うが、ある記事
iと記事jとの記事間類似度計算には、次の計算式が使
用される。
れる。
ぞれ記事iと記事jに含まれる単語の頻度ベクトルであ
る。
対象にしているが、これを数種の品詞の単語に限定する
ことも可能である。例えば、品詞を名詞と動詞だけに限
定して類似度を計算することにしても構わない。
出しや一文目など書式上のフィールドごとに類似度を求
め、その類似度の荷重平均を全体の記事間類似度として
定義することもできる。この場合、式1に対応する類似
度としては、以下の通りになる。
集合、Cfjは記事jのフィールドfに含まれる単語の集
合である。
段落目など、文書の先頭文字の空白やインデントの情
報、句点などの存在によって検出することができる。式
2から8についても同様の変形が可能である。
情報をした後、構文情報などのチェックの過程を設け、
ある閾値以上の類似度を持つ記事間であっても、類似記
事としないとするように変形が可能である。例えば、新
聞記事においては、一文目の主語(具体的には助詞
「は」に前接している固有名詞)が重要な役割を果た
す。この主語が記事同士異なる場合、類似記事としない
ようにする。
生成部17による提示情報生成処理について説明する。
るために、重複記事集合から、代表としてユーザに提示
する記事を選択する場合について説明したが、ここで
は、関連記事同士がグループ化あるいは関連づけされて
ユーザに提示される。
記事選出部15により選択された記事の情報が読み込ま
れる(ステップS201)。次いで、上述の式を用いる
ことにより記事間類似度計算部16によって、選択され
た記事間の類似度計算が行われ、互いに類似度の高い記
事の集合が求められる(ステップS202)。そして、
関連記事同士のグループ化、関連づけ、あるいは特定の
記事の選択といった出力制御が行われ、それがユーザに
提示される(ステップS203)。
並んでユーザに提示されるように記事の出力リストを揃
えることを意味する。また、関連づけとしては、例え
ば、ある記事とそれに関連する記事とを連結するリンク
情報を用いてハイパーテキストを生成し、それをユーザ
に提示することなどがあげられる。また、特定記事選択
では、関連記事の中から1つまたは幾つか記事が選択
し、選択された記事だけがユーザに提示される。
ことにより、関連のあるテキスト記事が順不同でバラバ
ラにユーザに出力されるといった事態を防止できる。よ
って、利用者は、関連記事を効率よく整理して読むこと
が可能となる。
施形態に係る情報フィルタリングシステムについて、実
施形態1との差異を中心に説明する。実施形態5の構成
を図81に示す。実施形態との相違は、利用者に出力し
た記事を格納する送付記事記憶部19を有することにあ
る。
日付情報と共に利用者に提供された記事が、利用者と対
応づけて記憶される。これは、利用者への記事の提供時
に行われるものである。
示する。まず始めに、記事選択部15により選出された
記事の情報を読み込む(ステップS211)。そして、
記事情報記憶部18に格納されている選出された当日記
事と送付記事記憶部19に格納されている前日以前の記
事とを参照し、記事間類似度計算部16により前日以前
の記事をも対象とした記事間類似度計算が行われて、重
複記事集合が求められる(ステップS212)。
jを核にして、以下のように定義することができる。
た記事を上位からスキャンし、その記事jに対して類似
度が一定の閾値以上に入る記事を求め、その記事を重複
記事とし重複記事集合を求めるものである。
のグループ化、関連づけ、あるいは特定の記事の選択と
いった出力制御が行われ、それがユーザにフィルタリン
グ結果として提示される(ステップS213)。
ング結果の出力処理の流れが示されている。選出されて
いる上位の記事から順に、重複記事集合を持つか否かを
判定し(ステップS221,S222)、重複記事を持
たない場合は、その記事(例えばタイトルと新聞社の情
報など)を出力する(ステップS223)。一方、重複
記事を持つ場合、その重複記事集合が当日記事のみから
なるか否かを調べ(ステップS224)、当日記事のみ
からなる場合はマーク2を、それ以前の記事も含む場合
はマーク1を出力するとともに重複記事集合を出力する
(ステップS225,S226,S227)。選出され
ている残りの記事についても、ステップS222〜S2
27の処理が同様に行われる(ステップS228,S2
29)。重複記事集合を出力する際には、タイトルをフ
ラットなテキストとして出力する場合は、重複記事を並
べて出力することになる(グループ化)。図84はその
出力例である。直線で囲まれている記事同士が、重複記
事であることを意味している。また、□は当日の記事の
みからなる重複記事集合であり、△はそれ以前の記事を
含むことを意味するマークである。「8/4」などは記
事の日付である。一方、ハイパーテキストとして出力で
きる場合、代表記事だけを一番上の階層に表示し、その
代表記事に他の重複記事を関連づけしておくことができ
る。このハイパーテキストの表示例を図85〜図87に
示す。
を、△はそれ以前の重複記事集合を持ったことを意味し
ており、それぞれその代表記事のタイトルが表示されて
いる。図85に示した最上位階層の記事リストを出力す
る際に、それぞれのマークには、図86や図87に示す
重複記事集合の情報へのリンク情報を付与しておくこと
になる。これは、HTML(Hyper Text M
arkup Language)の記法を用いること
等、公知の技術によって実現可能である。この場合、図
85のマーク□を利用者が画面上で選択すると、図86
の重複記事情報が表示され、また図85のマーク△を利
用者が画面上で選択すると、図87の重複記事情報が表
示されることになる。
グループか、それ以前の日の記事も含まれているのかを
区別するための情報を付加して送ることにより、利用者
は、関連記事をさらに効率よく整理して読むことが可能
となる。
の変形例は必要に応じて種々組み合わせて利用すること
ができる。また、以上の説明は、通信網を介してフィル
タリング結果をセンタからユーザに送るネットワークシ
ステムとして実現した例について述べたが、この発明の
情報フィルタリングシステムの中枢をなすセンタの機能
は個人の計算機上で構築することもできる。この場合、
ユーザ端末とフィルタリングシステムが一体となった形
態となり、ユーザ端末とフィルタリングシステム間には
通信網は存在しないことになる。
情報フィルタリングによってユーザに提示される記事同
士の関連性がユーザにとって明確になり、記事内容の理
解が容易になる。特に時間の経過と共に状況が変わって
いくような出来事についてその経緯を把握することや、
連載記事など複数の記事にわたる情報を把握することが
容易になり、フィルタリングシステムの性能向上を図る
ことができる。また、複数の情報源から得られた同一内
容に関する記事が、重複してユーザに提示されることが
自動的に回避できる。
したトピックのうちいずれに適合したものであるかがユ
ーザに明示されるため、ユーザが記事内容を理解するこ
とが容易になる。また、提示されている記事が他のユー
ザによってどのように読まれているかが明示されるた
め、ユーザは一般的に読まれている記事や一部のユーザ
に読まれている記事などを識別することができる。さら
に、過去に提示された記事に対してユーザが行った有用
性の判定、及び他のユーザが行った有用性の判定情報へ
のユーザのアクセスを許すことにより、一貫性を保った
レレバンス・フィードバックや他のユーザの判断を参考
にしたレレバンス・フィードバック、さらには過去に行
った有用性判定を修正してレレバンス・フィードバック
をかけ直すことが可能となる。
応じた長さの要約あるいは抄録や、記事の持つ属性に応
じた長さの要約あるいは抄録がユーザに提示されるた
め、ユーザに提示されるテキストのうち、ユーザにとっ
て有用であるテキスト情報の占める割合を高くでき、効
率的な情報収集が可能になる。
いは関連づけされて利用者に提供されるため、利用者の
手間を大幅に軽減することができる。さらに、当日配信
された記事間のみでなく、前日以前にユーザに出力した
記事との間の類似度も求め、出力記事には、当日の記事
だけからなる記事グループか、それ以前の日の記事も含
まれているのかを区別するための情報を付加することに
より、利用者は、関連記事をさらに効率よく整理して読
むことが可能となる。
タリングシステム全体のシステム構成を示すブロック
図。
を概念的に示す図。
タリングシステムに設けられる情報フィルタリングセン
タの構成を示すブロック図。
ファイル生成処理の流れを示すフローチャート。
出処理の流れを示すフローチャート。
例を示す図。
表現例を示す図。
理の流れを示すフローチャート。
理によってランキングされた到着記事の様子を示す図。
処理の流れを示すフローチャート。
うなランキング結果が得られている場合にその上位10
件を選出した例を示す図。
うなランキング結果が得られている場合にユーザプロフ
ァイルとの類似度が0.86以上の記事を選出した例を
示す図。
ーザに対して複数の検索及びランキングが行われる場合
にこれら複数のランキング結果の上位部分をマージして
ユーザに提示する記事を選出する様子を示す図。
似度計算処理の流れを示すフローチャート。
報源から到着した記事の例を示す図。
生成処理の流れを示すフローチャート。
レスリリースから重複記事が派生する様子を示す図。
来事から重複記事が作成される様子を示す図。
4つの記事に対して記事間類似度計算を行った結果得ら
れる重複記事集合の例を示す図。
た重複記事に関する情報を記事の本文情報に付加して提
示する例を示す図。
情報の表示形態を示す図。
情報の他の表示形態を示す図。
情報のさらに他の表示形態を示す図。
情報の表示画面切り替え処理の流れを示すフローチャー
ト。
情報の他の表示画面切り替え処理の流れを示すフローチ
ャート。
ような記事の重複が起こっている場合にユーザに提示す
る記事の一覧表を重複記事情報とともに表示した例を示
す図。
似度計算処理の流れを示すフローチャート。
選出部により選出された記事の集合と前回ユーザに提示
された記事の集合の例を示す図。
生成処理の流れを示すフローチャート。
事の本文情報に前回までの関連記事の情報を付加して提
示する例を示す図。
事の本文情報に前回までの関連記事の情報を付加して提
示する他の例を示す図。
事の本文情報中に前回までの関連記事の情報を埋め込ん
で提示する例を示す図。
第一文が選択された場合にその文と関係の深い前回まで
の記事のリストが表示される様子を示す図。
「○○沖で地震 マグニチュード4」という関連記事を
選択した場合にその記事の本文を表示した例を示す図。
似度計算処理の流れの他の例を示すフローチャート。
生成処理の流れの他の例を示す図。
事の本文情報を今回の他の関連記事の情報とともに提示
する他の例を示す図。
事の本文情報を今回の他の関連記事の情報とともに提示
する他の例を示す図。
似度を記事の提示順序に反映させる例を示す図。
ルタリングシステムで使用されるユーザプロファイルを
概念的を示す図。
フィルタリングセンタの構成を示すブロック図。
処理の流れを示すフローチャート。
グされた到着記事を概念的に示す図。
処理の流れを示すフローチャート。
とその検索結果の例を示す図。
生成処理の流れを示すフローチャート。
ために選出された記事の記事見出しのリストに各記事が
適合したトピックの情報を付加してそのユーザに提示す
る様子を示す図。
対して各トピックに適合した記事の件数情報を提示する
様子を示す図。
ために選出された記事の要約文・抜粋文あるいは本文を
トピック別にまとめてそのユーザに提示する様子を示す
図。
足した検索条件に関する情報を記事本文のヘッダ情報と
して付加してユーザに提示する様子を示す図。
検索条件を記事中に強調表示する様子を示す図。
検索条件を記事中に強調表示する他の列を示す図。
検索条件を記事中に強調表示するさらに他の列を示す
図。
ックに適合する文書を検索するための検索条件の具体例
を示す図。
検索条件により検索されユーザに提示された記事に対し
て付加する検索条件の表示例を示す図。
検索条件により検索されユーザに提示された記事に対し
て付加する検索条件の他の表示例を示す図。
理の他の例を示すフローチャート。
成処理の他の例を示すフローチャート。
ーザそれぞれとそれらユーザに送信する記事との関係を
示す図。
ザに対して選出された記事の記事見出しのリストに、記
事を受信した他のユーザに関する情報を付加して提示す
る様子を示す図。
ザに対して選出された記事の要約文または抜粋文に記事
を受信した他のユーザに関する情報を付加して提示する
様子を示す図。
信した他のユーザに関する情報を記事本文のヘッダ情報
として付加しユーザに提示する様子を示す図。
信した他のユーザに関する情報を記事本文のヘッダ情報
として付加しユーザに提示する他の例を示す図。
ザや他のユーザが前回に行ったレレバンス・フィードバ
ック情報を今回提示する記事情報に付加して提示する表
示例を示す図。
ザや他のユーザが前回に行ったレレバンス・フィードバ
ック情報を今回提示する記事情報に付加して提示する他
の表示例を示す図。
ルタリングシステムに設けられる情報フィルタリングセ
ンタの構成を示すブロック図。
ドとその重みで表現されたユーザプロファイルの例を示
す図。
録生成処理の流れを示すフローチャート。
選択したトピックとそれらの間の優先度の例を示す図。
トピックを選択しているユーザに提示する記事のリスト
とそれらに適合したトピックの例を示す図。
提示される記事情報を概念的に示す図。
選択したトピックとそれらの間の優先度の例を示す図。
バックを行った場合に次回のフィルタリングでユーザに
提示される記事情報の例を示す図。
録生成処理の流れの他の例を示すフローチャート。
部により選出された記事の例を示す図。
提示される記事情報の他の例を概念的に示す図。
て新聞社が採用されている場合にあるユーザに提示する
ために選出された記事の例を示す図。
場合にユーザに提示される記事情報を概念的に示す図。
バックを行った場合に次回のフィルタリングでユーザに
提示される記事情報の他の例を示す図。
ルタリングシステムにおける提示情報生成処理の流れを
示すフローチャート。
ルタリングシステムに設けられた情報フィルタリングセ
ンタの構成を示すブロック図。
生成処理の流れを示すフローチャート。
集合の出力処理の流れを示すフローチャート。
の記事提示例を示す図。
テキストによる利用者への記事提示例を示す図。
テキストによる利用者への記事提示例を示す図。
テキストによる利用者への記事提示例を示す図。
ザ端末、10…ユーザプロファイル、11,21,31
…ユーザプロファイル生成部、12…ユーザプロファイ
ル記憶部、13,23,33…記事情報抽出部、14,
24,34…記事検索部、15,25,35…記事選出
部、16…記事間類似度計算部、17…提示情報生成
部、19…送付記事記憶部、22,32…トピック記憶
部、26…付加情報生成部、36…要約・抄録生成部。
Claims (6)
- 【請求項1】 複数の情報源からテキストやイメージな
どの記事の配信を受け、それら配信された記事の中から
所定の記事を選出してユーザに提示する情報フィルタリ
ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
る記事を選定する記事検索手段と、 この記事検索手段によって選定された記事同志または選
定された記事と他の記事との間の類似度を算出し、その
類似度に従って記事毎に関連記事を決定する手段と、 決定された関連記事の情報を前記選定された記事に付加
してユーザに提示する手段とを具備することを特徴とす
る情報フィルタリング装置。 - 【請求項2】 複数の情報源からテキストやイメージな
どの記事の配信を受け、それら配信された記事の中から
所定の記事を選出してユーザに提示する情報フィルタリ
ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
る記事を選定してユーザに提示する記事検索手段と、 この記事検索手段によって選定された記事が満足した検
索条件を示す情報を各記事に付加してユーザに提示する
手段を具備することを特徴とする情報フィルタリング装
置。 - 【請求項3】 複数の情報源からテキストやイメージな
どの記事の配信を受け、それら配信された記事の中から
所定の記事を選出してユーザに提示する情報フィルタリ
ング装置において、 ユーザ毎に予め指定された検索条件を保持する手段と、 配信された記事を検索し、ユーザ毎に検索条件に合致す
る記事を選定してユーザに提示する記事検索手段と、 この記事検索手段によって選定された記事の種類に応じ
た長さの要約または抄録を生成し、その要約または抄録
をユーザに提示する手段を具備することを特徴とする情
報フィルタリング装置。 - 【請求項4】 少なくとも1つ以上の情報源からテキス
トやイメージなどの記事の配信を受ける手段と、あらか
じめユーザが指定した検索条件と配信された記事との類
似度を算出する手段と、算出した類似度の順に記事をソ
ートして、一定の数の記事、あるいはあらかじめ定めた
閾値以上の類似度を有する記事のみを類似度の順で出力
する出力手段を有する情報フィルタリング装置におい
て、 記事間の類似度を算出する手段を具備し、その算出した
記事間類似度にしたがって記事のグループ化、関連づ
け、あるいは出力記事の選択制御を行うことを特徴とす
る情報フィルタリング装置。 - 【請求項5】 前記記事間の類似度を算出する手段は、 一文目、一段落目、見出しといった書式上のフィールド
ごとに記事間で類似度を求め、それらの荷重平均を記事
間の類似度とすることを特徴とする請求項4記載の情報
フィルタリング装置。 - 【請求項6】 少なくとも1つ以上の情報源からテキス
トやイメージなどの記事の配信を毎日定期的に受ける手
段と、あらかじめユーザが指定した検索条件と配信され
た記事との類似度を算出する手段と、算出した類似度の
順に記事をソートして、一定の数の記事、あるいはあら
かじめ定めた閾値以上の類似度を有する記事のみを選択
する情報フィルタリング装置において、 フィルタリング結果としてユーザに出力した記事を記憶
する出力記事記憶手段と、 この出力記事記憶手段に記憶されている記事と当日配信
された記事とを合わせてそれら記事間で類似度を算出
し、その類似度にしたがって記事のグループ化あるいは
関連づけを行ってユーザに出力する手段とを具備し、 当日の記事だけからなる記事グループか、それ以前の日
の記事も含まれているのかを区別するための情報を出力
記事に付加することを特徴とする情報フィルタリング装
置。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP33579095A JP3810463B2 (ja) | 1995-07-31 | 1995-11-30 | 情報フィルタリング装置 |
| US08/695,214 US5907836A (en) | 1995-07-31 | 1996-07-31 | Information filtering apparatus for selecting predetermined article from plural articles to present selected article to user, and method therefore |
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP7-212939 | 1995-07-31 | ||
| JP21293995 | 1995-07-31 | ||
| JP33579095A JP3810463B2 (ja) | 1995-07-31 | 1995-11-30 | 情報フィルタリング装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPH09101990A true JPH09101990A (ja) | 1997-04-15 |
| JP3810463B2 JP3810463B2 (ja) | 2006-08-16 |
Family
ID=26519516
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP33579095A Expired - Fee Related JP3810463B2 (ja) | 1995-07-31 | 1995-11-30 | 情報フィルタリング装置 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JP3810463B2 (ja) |
Cited By (45)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH09212505A (ja) * | 1996-01-30 | 1997-08-15 | Canon Inc | 文書処理装置および方法 |
| JPH10260991A (ja) * | 1997-01-14 | 1998-09-29 | Seiko Epson Corp | 情報検索方法および情報検索装置 |
| JPH10275160A (ja) * | 1997-03-31 | 1998-10-13 | Matsushita Giken Kk | 情報フィルタ装置及び情報フィルタリング方法並びに情報フィルタリングプログラムを記録した記録媒体 |
| JPH1117569A (ja) * | 1997-06-25 | 1999-01-22 | Kokusai Electric Co Ltd | 情報表示システム |
| JPH1153392A (ja) * | 1997-08-08 | 1999-02-26 | Toshiba Corp | 情報フィルタリング装置および同装置に適用される関連情報提供方法 |
| JPH11265398A (ja) * | 1998-03-18 | 1999-09-28 | Fujitsu Ltd | 情報提供システム及びその制御プログラムを記録した記録媒体 |
| JP2000011003A (ja) * | 1998-06-26 | 2000-01-14 | Nippon Telegr & Teleph Corp <Ntt> | 公開文書要約装置およびそのためのプログラムを記録した記録媒体 |
| JP2000067067A (ja) * | 1998-08-20 | 2000-03-03 | Sky Com:Kk | 配信サーバ及び配信システム |
| JP2000105764A (ja) * | 1998-09-28 | 2000-04-11 | Hitachi Ltd | 情報フィルタリングシステム |
| JP2000123105A (ja) * | 1999-12-07 | 2000-04-28 | Adc Technology Kk | サイト案内システム |
| JP2000200339A (ja) * | 1998-12-28 | 2000-07-18 | Casio Comput Co Ltd | 集合図表示制御装置及び記憶媒体 |
| JP2000209255A (ja) * | 1999-01-12 | 2000-07-28 | San Denshi Kk | 情報提供装置 |
| JP2000216810A (ja) * | 2000-01-01 | 2000-08-04 | San Denshi Kk | 情報提供方法 |
| US6119117A (en) * | 1997-07-15 | 2000-09-12 | Kabushiki Kaisha Toshiba | Document management method, document retrieval method, and document retrieval apparatus |
| JP2001117941A (ja) * | 1999-10-20 | 2001-04-27 | Just Syst Corp | 文書検索装置、文書検索方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体 |
| JP2001222631A (ja) * | 2000-02-10 | 2001-08-17 | Canon Inc | 著作物配信システム及び情報処理装置及び方法 |
| JP2001273302A (ja) * | 2000-03-23 | 2001-10-05 | Toshiba Corp | 画像検索システムおよび画像検索方法 |
| JP2001312509A (ja) * | 2000-04-28 | 2001-11-09 | Fujitsu Ltd | 電子情報配信システムおよび記録媒体 |
| JP2002116894A (ja) * | 2000-10-11 | 2002-04-19 | Fuji Xerox Co Ltd | カスタマイズ印刷データ配信方法及びシステム |
| JP2002150147A (ja) * | 2000-08-29 | 2002-05-24 | Yutaka Nishimura | 情報提供システム及び方法並びに情報提供用プログラムを記録した記録媒体 |
| JP2002342246A (ja) * | 2001-05-15 | 2002-11-29 | Pia Corp | メールマガジン配信システム及びそれを実現するためのコンピュータプログラム |
| JP2003514271A (ja) * | 1999-10-22 | 2003-04-15 | ヨードリー・コム・インコーポレイテツド | 単一のユーザインターフェースを介してユーザに計算済みの解決指向の個人化された要約リポートを提供するための方法および装置 |
| JP2003196421A (ja) * | 2001-12-25 | 2003-07-11 | Pia Corp | ランキング情報返送システム及びそれを実現するためのコンピュータプログラムとその方法 |
| JP2004506961A (ja) * | 2000-03-16 | 2004-03-04 | マイクロソフト コーポレイション | 優先順位の生成および管理 |
| JP2005056359A (ja) * | 2003-08-07 | 2005-03-03 | Sony Corp | 情報処理装置および方法、プログラム、並びに記録媒体 |
| JP2007034961A (ja) * | 2005-07-29 | 2007-02-08 | Ricoh Co Ltd | コンテンツ処理装置、コンテンツ処理プログラムおよびコンテンツ処理方法 |
| JP2007287154A (ja) * | 2006-04-18 | 2007-11-01 | Nhn Corp | オンライン上で提供されるニュース記事に加重値を付与する方法及びそのシステム |
| JP2008511081A (ja) * | 2004-08-23 | 2008-04-10 | トムソン グローバル リソーシーズ | 重複する文書の検出および表示機能 |
| US7555195B2 (en) | 2002-04-16 | 2009-06-30 | Nippon Telegraph And Telephone Corporation | Content combination reproducer, content combination reproduction method, program executing the method, and recording medium recording therein the program |
| JP2010020678A (ja) * | 2008-07-14 | 2010-01-28 | Nippon Telegr & Teleph Corp <Ntt> | 文書要約装置、文書要約方法、プログラムおよび記録媒体 |
| JP2010055619A (ja) * | 2008-08-28 | 2010-03-11 | Palo Alto Research Center Inc | ウェブブラウザ・ウィジェットをソーシャルインデクシングとインターフェースさせるためのシステム及び方法 |
| JP2011002982A (ja) * | 2009-06-18 | 2011-01-06 | Yahoo Japan Corp | コンテンツ提供装置、コンテンツ提供方法およびコンテンツ提供プログラム |
| JP2011517822A (ja) * | 2008-04-14 | 2011-06-16 | アルカテル−ルーセント | 重複を最低限に抑えるWebフィードを集約するための方法 |
| JP2011134355A (ja) * | 2007-07-12 | 2011-07-07 | Oki Data Corp | 文書検索装置 |
| JP2013513140A (ja) * | 2009-12-07 | 2013-04-18 | インターナショナル・ビジネス・マシーンズ・コーポレーション | パブリッシュ−サブスクライブ・システムのための文脈的サポート |
| KR101356035B1 (ko) * | 2012-05-14 | 2014-01-29 | 한국과학기술원 | 욕설 제거 방법 및 시스템 |
| JP2016043537A (ja) * | 2014-08-21 | 2016-04-04 | 株式会社アシストシステム研究所 | 新聞紙面印刷装置および新聞紙面印刷方法 |
| WO2016147621A1 (ja) * | 2015-03-13 | 2016-09-22 | 日本電気株式会社 | 記事管理システム、記事管理方法および記事管理プログラム |
| JP2018045498A (ja) * | 2016-09-15 | 2018-03-22 | 株式会社東芝 | 検索装置、検索方法、プログラムおよび検索システム |
| JP2018185716A (ja) * | 2017-04-27 | 2018-11-22 | 株式会社日立製作所 | データ処理システム、データ処理方法、およびデータ構造 |
| JPWO2017175432A1 (ja) * | 2016-04-05 | 2019-03-22 | ソニー株式会社 | 情報処理装置、情報処理方法、およびプログラム |
| KR102114223B1 (ko) * | 2019-12-10 | 2020-05-22 | 셀렉트스타 주식회사 | 딥러닝 기반 유사 이미지를 필터링하는 방법 및 그를 이용한 장치 |
| CN112529091A (zh) * | 2020-12-18 | 2021-03-19 | 广州视源电子科技股份有限公司 | 课件相似度检测方法、装置及存储介质 |
| KR102349624B1 (ko) * | 2020-09-24 | 2022-01-10 | 주식회사 포스코아이씨티 | 뉴스 크롤링 시스템 및 뉴스 크롤링 방법 |
| JP2022174380A (ja) * | 2021-05-11 | 2022-11-24 | 日本放送協会 | コンテンツ提示制御装置及びそのプログラム、コンテンツ提示装置、並びに、コンテンツ提示システム |
Families Citing this family (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20130073545A1 (en) * | 2011-09-15 | 2013-03-21 | Yahoo! Inc. | Method and system for providing recommended content for user generated content on an article |
| WO2021181680A1 (ja) * | 2020-03-13 | 2021-09-16 | 日本電信電話株式会社 | 支援装置、支援方法及びプログラム |
Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH03244080A (ja) * | 1990-02-22 | 1991-10-30 | Teremateiiku Kokusai Kenkyusho:Kk | 記事統合化処理装置 |
| JPH0749875A (ja) * | 1993-08-06 | 1995-02-21 | Hitachi Ltd | 文書情報分類方法およびそれを用いた文書情報収集方法、文書情報収集システム |
| JPH07114572A (ja) * | 1993-10-18 | 1995-05-02 | Sharp Corp | 文書分類装置 |
| JPH07129605A (ja) * | 1993-09-13 | 1995-05-19 | Toshiba Corp | 文書検索装置 |
| JPH07182373A (ja) * | 1993-03-17 | 1995-07-21 | Toshiba Corp | 文書情報検索装置及び文書検索結果表示方法 |
| JPH07295994A (ja) * | 1994-04-22 | 1995-11-10 | Sharp Corp | 情報検索装置 |
-
1995
- 1995-11-30 JP JP33579095A patent/JP3810463B2/ja not_active Expired - Fee Related
Patent Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH03244080A (ja) * | 1990-02-22 | 1991-10-30 | Teremateiiku Kokusai Kenkyusho:Kk | 記事統合化処理装置 |
| JPH07182373A (ja) * | 1993-03-17 | 1995-07-21 | Toshiba Corp | 文書情報検索装置及び文書検索結果表示方法 |
| JPH0749875A (ja) * | 1993-08-06 | 1995-02-21 | Hitachi Ltd | 文書情報分類方法およびそれを用いた文書情報収集方法、文書情報収集システム |
| JPH07129605A (ja) * | 1993-09-13 | 1995-05-19 | Toshiba Corp | 文書検索装置 |
| JPH07114572A (ja) * | 1993-10-18 | 1995-05-02 | Sharp Corp | 文書分類装置 |
| JPH07295994A (ja) * | 1994-04-22 | 1995-11-10 | Sharp Corp | 情報検索装置 |
Cited By (49)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JPH09212505A (ja) * | 1996-01-30 | 1997-08-15 | Canon Inc | 文書処理装置および方法 |
| JPH10260991A (ja) * | 1997-01-14 | 1998-09-29 | Seiko Epson Corp | 情報検索方法および情報検索装置 |
| JPH10275160A (ja) * | 1997-03-31 | 1998-10-13 | Matsushita Giken Kk | 情報フィルタ装置及び情報フィルタリング方法並びに情報フィルタリングプログラムを記録した記録媒体 |
| JPH1117569A (ja) * | 1997-06-25 | 1999-01-22 | Kokusai Electric Co Ltd | 情報表示システム |
| US6119117A (en) * | 1997-07-15 | 2000-09-12 | Kabushiki Kaisha Toshiba | Document management method, document retrieval method, and document retrieval apparatus |
| JPH1153392A (ja) * | 1997-08-08 | 1999-02-26 | Toshiba Corp | 情報フィルタリング装置および同装置に適用される関連情報提供方法 |
| JPH11265398A (ja) * | 1998-03-18 | 1999-09-28 | Fujitsu Ltd | 情報提供システム及びその制御プログラムを記録した記録媒体 |
| JP2000011003A (ja) * | 1998-06-26 | 2000-01-14 | Nippon Telegr & Teleph Corp <Ntt> | 公開文書要約装置およびそのためのプログラムを記録した記録媒体 |
| JP2000067067A (ja) * | 1998-08-20 | 2000-03-03 | Sky Com:Kk | 配信サーバ及び配信システム |
| JP2000105764A (ja) * | 1998-09-28 | 2000-04-11 | Hitachi Ltd | 情報フィルタリングシステム |
| JP2000200339A (ja) * | 1998-12-28 | 2000-07-18 | Casio Comput Co Ltd | 集合図表示制御装置及び記憶媒体 |
| JP2000209255A (ja) * | 1999-01-12 | 2000-07-28 | San Denshi Kk | 情報提供装置 |
| JP2001117941A (ja) * | 1999-10-20 | 2001-04-27 | Just Syst Corp | 文書検索装置、文書検索方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体 |
| JP2003514271A (ja) * | 1999-10-22 | 2003-04-15 | ヨードリー・コム・インコーポレイテツド | 単一のユーザインターフェースを介してユーザに計算済みの解決指向の個人化された要約リポートを提供するための方法および装置 |
| JP2000123105A (ja) * | 1999-12-07 | 2000-04-28 | Adc Technology Kk | サイト案内システム |
| JP2000216810A (ja) * | 2000-01-01 | 2000-08-04 | San Denshi Kk | 情報提供方法 |
| JP2001222631A (ja) * | 2000-02-10 | 2001-08-17 | Canon Inc | 著作物配信システム及び情報処理装置及び方法 |
| JP2004506961A (ja) * | 2000-03-16 | 2004-03-04 | マイクロソフト コーポレイション | 優先順位の生成および管理 |
| JP2001273302A (ja) * | 2000-03-23 | 2001-10-05 | Toshiba Corp | 画像検索システムおよび画像検索方法 |
| JP2001312509A (ja) * | 2000-04-28 | 2001-11-09 | Fujitsu Ltd | 電子情報配信システムおよび記録媒体 |
| JP2002150147A (ja) * | 2000-08-29 | 2002-05-24 | Yutaka Nishimura | 情報提供システム及び方法並びに情報提供用プログラムを記録した記録媒体 |
| JP2002116894A (ja) * | 2000-10-11 | 2002-04-19 | Fuji Xerox Co Ltd | カスタマイズ印刷データ配信方法及びシステム |
| JP2002342246A (ja) * | 2001-05-15 | 2002-11-29 | Pia Corp | メールマガジン配信システム及びそれを実現するためのコンピュータプログラム |
| JP2003196421A (ja) * | 2001-12-25 | 2003-07-11 | Pia Corp | ランキング情報返送システム及びそれを実現するためのコンピュータプログラムとその方法 |
| US7555195B2 (en) | 2002-04-16 | 2009-06-30 | Nippon Telegraph And Telephone Corporation | Content combination reproducer, content combination reproduction method, program executing the method, and recording medium recording therein the program |
| JP2005056359A (ja) * | 2003-08-07 | 2005-03-03 | Sony Corp | 情報処理装置および方法、プログラム、並びに記録媒体 |
| JP2008511081A (ja) * | 2004-08-23 | 2008-04-10 | トムソン グローバル リソーシーズ | 重複する文書の検出および表示機能 |
| JP2007034961A (ja) * | 2005-07-29 | 2007-02-08 | Ricoh Co Ltd | コンテンツ処理装置、コンテンツ処理プログラムおよびコンテンツ処理方法 |
| JP2007287154A (ja) * | 2006-04-18 | 2007-11-01 | Nhn Corp | オンライン上で提供されるニュース記事に加重値を付与する方法及びそのシステム |
| JP2011134355A (ja) * | 2007-07-12 | 2011-07-07 | Oki Data Corp | 文書検索装置 |
| JP2011517822A (ja) * | 2008-04-14 | 2011-06-16 | アルカテル−ルーセント | 重複を最低限に抑えるWebフィードを集約するための方法 |
| JP2010020678A (ja) * | 2008-07-14 | 2010-01-28 | Nippon Telegr & Teleph Corp <Ntt> | 文書要約装置、文書要約方法、プログラムおよび記録媒体 |
| JP2010055619A (ja) * | 2008-08-28 | 2010-03-11 | Palo Alto Research Center Inc | ウェブブラウザ・ウィジェットをソーシャルインデクシングとインターフェースさせるためのシステム及び方法 |
| JP2011002982A (ja) * | 2009-06-18 | 2011-01-06 | Yahoo Japan Corp | コンテンツ提供装置、コンテンツ提供方法およびコンテンツ提供プログラム |
| US9020959B2 (en) | 2009-12-07 | 2015-04-28 | International Business Machines Corporation | Contextual support for publish-subscribe systems |
| JP2013513140A (ja) * | 2009-12-07 | 2013-04-18 | インターナショナル・ビジネス・マシーンズ・コーポレーション | パブリッシュ−サブスクライブ・システムのための文脈的サポート |
| KR101356035B1 (ko) * | 2012-05-14 | 2014-01-29 | 한국과학기술원 | 욕설 제거 방법 및 시스템 |
| JP2016043537A (ja) * | 2014-08-21 | 2016-04-04 | 株式会社アシストシステム研究所 | 新聞紙面印刷装置および新聞紙面印刷方法 |
| WO2016147621A1 (ja) * | 2015-03-13 | 2016-09-22 | 日本電気株式会社 | 記事管理システム、記事管理方法および記事管理プログラム |
| WO2016147624A1 (ja) * | 2015-03-13 | 2016-09-22 | 日本電気株式会社 | 検索システム、検索方法および検索プログラム |
| JPWO2016147624A1 (ja) * | 2015-03-13 | 2017-12-21 | 日本電気株式会社 | 検索システム、検索方法および検索プログラム |
| US10909154B2 (en) | 2015-03-13 | 2021-02-02 | Nec Corporation | Search system, search method and search program |
| JPWO2017175432A1 (ja) * | 2016-04-05 | 2019-03-22 | ソニー株式会社 | 情報処理装置、情報処理方法、およびプログラム |
| JP2018045498A (ja) * | 2016-09-15 | 2018-03-22 | 株式会社東芝 | 検索装置、検索方法、プログラムおよび検索システム |
| JP2018185716A (ja) * | 2017-04-27 | 2018-11-22 | 株式会社日立製作所 | データ処理システム、データ処理方法、およびデータ構造 |
| KR102114223B1 (ko) * | 2019-12-10 | 2020-05-22 | 셀렉트스타 주식회사 | 딥러닝 기반 유사 이미지를 필터링하는 방법 및 그를 이용한 장치 |
| KR102349624B1 (ko) * | 2020-09-24 | 2022-01-10 | 주식회사 포스코아이씨티 | 뉴스 크롤링 시스템 및 뉴스 크롤링 방법 |
| CN112529091A (zh) * | 2020-12-18 | 2021-03-19 | 广州视源电子科技股份有限公司 | 课件相似度检测方法、装置及存储介质 |
| JP2022174380A (ja) * | 2021-05-11 | 2022-11-24 | 日本放送協会 | コンテンツ提示制御装置及びそのプログラム、コンテンツ提示装置、並びに、コンテンツ提示システム |
Also Published As
| Publication number | Publication date |
|---|---|
| JP3810463B2 (ja) | 2006-08-16 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP3810463B2 (ja) | 情報フィルタリング装置 | |
| US7958128B2 (en) | Query-independent entity importance in books | |
| US5907836A (en) | Information filtering apparatus for selecting predetermined article from plural articles to present selected article to user, and method therefore | |
| US6836768B1 (en) | Method and apparatus for improved information representation | |
| US6665681B1 (en) | System and method for generating a taxonomy from a plurality of documents | |
| US6826576B2 (en) | Very-large-scale automatic categorizer for web content | |
| US7882115B2 (en) | Method and apparatus for improved information representation | |
| US9659084B1 (en) | System, methods, and user interface for presenting information from unstructured data | |
| US5598557A (en) | Apparatus and method for retrieving and grouping images representing text files based on the relevance of key words extracted from a selected file to the text files | |
| US9323827B2 (en) | Identifying key terms related to similar passages | |
| USRE44794E1 (en) | Method and apparatus for representing and navigating search results | |
| US20070185860A1 (en) | System for searching | |
| JP3717808B2 (ja) | 情報検索システム | |
| US20020099685A1 (en) | Document retrieval system; method of document retrieval; and search server | |
| US20070250501A1 (en) | Search result delivery engine | |
| US20060117002A1 (en) | Method for search result clustering | |
| EP2307951A1 (en) | Method and apparatus for relating datasets by using semantic vectors and keyword analyses | |
| US20040098385A1 (en) | Method for indentifying term importance to sample text using reference text | |
| JPH09101991A (ja) | 情報フィルタリング装置 | |
| TWI290687B (en) | System and method for search information based on classifications of synonymous words | |
| Croft et al. | Search engines | |
| Gupta | A survey of text summarizers for Indian Languages and comparison of their performance | |
| Ntoulas et al. | The infocious web search engine: Improving web searching through linguistic analysis | |
| JP2002183175A (ja) | テキストマイニング方法 | |
| EA002016B1 (ru) | Способ поиска хранимых на устройствах хранения данных электронных документов и их фрагментов |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20040119 |
|
| A911 | Transfer to examiner for re-examination before appeal (zenchi) |
Free format text: JAPANESE INTERMEDIATE CODE: A911 Effective date: 20040202 |
|
| A912 | Re-examination (zenchi) completed and case transferred to appeal board |
Free format text: JAPANESE INTERMEDIATE CODE: A912 Effective date: 20040319 |
|
| A711 | Notification of change in applicant |
Free format text: JAPANESE INTERMEDIATE CODE: A711 Effective date: 20041203 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A821 Effective date: 20041203 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20060421 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20060524 |
|
| R150 | Certificate of patent or registration of utility model |
Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20100602 Year of fee payment: 4 |
|
| FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20110602 Year of fee payment: 5 |
|
| LAPS | Cancellation because of no payment of annual fees |