JPH08278973A - 並列句解析装置および学習データ作成装置 - Google Patents

並列句解析装置および学習データ作成装置

Info

Publication number
JPH08278973A
JPH08278973A JP7082510A JP8251095A JPH08278973A JP H08278973 A JPH08278973 A JP H08278973A JP 7082510 A JP7082510 A JP 7082510A JP 8251095 A JP8251095 A JP 8251095A JP H08278973 A JPH08278973 A JP H08278973A
Authority
JP
Japan
Prior art keywords
parallel
learning
dependency
sentence
unit
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP7082510A
Other languages
English (en)
Other versions
JP3698454B2 (ja
Inventor
Hide Fuji
秀 富士
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fujitsu Ltd
Original Assignee
Fujitsu Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fujitsu Ltd filed Critical Fujitsu Ltd
Priority to JP08251095A priority Critical patent/JP3698454B2/ja
Publication of JPH08278973A publication Critical patent/JPH08278973A/ja
Application granted granted Critical
Publication of JP3698454B2 publication Critical patent/JP3698454B2/ja
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Landscapes

  • Machine Translation (AREA)

Abstract

(57)【要約】 【目的】 分野や文脈依存の並列構造の知識を自動的に
作成する学習データ作成装置を提供すること。 【構成】 入力された学習文は、形態素解析部によって
形態素列に変換される。形態素列は、文節合成部によっ
て文節列に変換される。並列キー判定部は、文節列の中
に並列キーがあるか否かを判定する。並列キーがある場
合には、並列型分類部が学習文の並列型を調べる。並列
要素抽出部は、並列型が学習に適していることを示して
いる場合には、学習文から並列要素を抽出する。係り受
け分類部は、学習文の係り受け型を調べる。係り受け関
係抽出部は、係り受け型が学習に適していることを示し
ている場合には、学習文から係り受け要素を抽出する。

Description

【発明の詳細な説明】
【0001】
【産業上の利用分野】本発明は、学習辞書を参照して入
力文中の並列構造を認識する並列句解析装置および学習
データを作成する学習データ作成装置に関するものであ
る。並列句解析装置や学習データ作成装置は、自然言語
解析システムの中に存在する。
【0002】一般に出回っている文書にはかなりの数の
並列構造が含まれている。機械翻訳システムや文書推敲
支援システムなどの自然言語解析システムでは、これら
の並列構造を正しく認識しなければ正しい解析を行うこ
とが出来ない。並列構造の認識を誤ると、殆どの場合、
文意が正しく解釈できなくなり、解析全体として見ると
致命的である。
【0003】
【従来の技術】自然言語解析システムでは、並列構造を
認識するための仕組みとして、次のようなものが考案さ
れ、実現されている。 1.システム操作者が並列構造を対話的に指定するも
の。システム解析できるところまで自動的に解析を行
い、並列構造の曖昧性が生じた時点で、システム操作者
に並列の範囲を指定させる。並列範囲の周囲に括弧付け
させるもの等がある。また、可能な並列候補を提示して
操作者に正しいものを選ばせるものもある。 2.構文情報を使うもの。並列候補の中で、構文的に妥
当なもののみを使う。ただし、構文的に妥当な並列候補
が複数ある場合があるので、この方法のみでは正しいも
のを見つけることが出来ない。 3.並列構造のバランスを使うもの。並列候補の中で、
並列キー両側の並列要素のバランスの良いものを優先的
に正解として扱う。 4.用言の格情報を使うもの。並列要素が、係り受け関
係を持つとき、この係り受けの妥当性を加味して計算を
行う。 5.意味属性を使うもの。並列要素候補の意味属性か
ら、その並列要素の妥当性を計算する。 6.上記の複数の情報を統合して使うもの。
【0004】
【発明が解決しようとする課題】上述したような従来の
並列構造認定では、使っている情報が固定的なものが多
いので、或る分野に特徴的な並列構造を精度よく認識す
ることが難しかった。分野に特徴的な並列構造とは、例
えば文書処理の分野では、「書き込み」と「読み出
し」、「作成」と「更新」と「保存」などがある。この
ような分野依存の構造は一般的な情報から或る程度は認
識することが出来るが、分野に合わせて調整でき、確実
な認識が出来るような装置が必要となる。
【0005】また、上述したように並列構造は分野毎に
特徴があるが、文書毎に特徴があることも多い。すなわ
ち、或る特定の文書で一度使われた並列表現は、同一文
書内で同じような形で再度使われることが多い。このよ
うな文脈依存の情報も合わせた調節が出来ることが望ま
しい。
【0006】本発明は、この点に鑑みて創作されたもの
であって、分野や文脈依存の並列構造の知識を自動的に
作成する学習データ作成装置を提供することを目的とし
ている。また、本発明は、学習データ作成装置によって
作成された学習データを参照して、並列構造認識を行う
並列句解析装置を提供することを目的としている。
【0007】
【課題を解決するための手段】請求項1の並列句解析装
置は、入力文を形態素列に分解する形態素解析部と、形
態素列から文節列を合成する文節合成部と、並列要素お
よび係り受け要素を記憶する学習辞書と、文節列および
学習辞書の内容に基づいて、入力文中に存在する並列句
の認識を行う並列構造認識部とを具備することを特徴と
するものである。
【0008】請求項2の並列句解析装置は、請求項1の
並列句解析装置において、並列構造認識部が、文節列か
ら作ることが出来る全ての並列の組合せについて学習辞
書を検索し、検索のヒット数の多い組合せを優先的に出
力することを特徴とするものである。
【0009】請求項3の学習データ自動作成装置は、学
習文を形態素に分解する形態素解析部と、形態素列を文
節列に合成する文節合成部と、文節列の中から並列キー
を見つけ出す並列キー判定部と、文節列および並列キー
から、学習文の並列型を判定する並列型分類部と、文節
列から、学習文の係り受け型を判定する係り受け型分類
部と、学習文の並列型に基づいて学習文が学習に有用な
ものか否かを判断し、有用であれば並列要素を学習文か
ら抽出する並列要素抽出部と、学習文の係り受け型に基
づいて学習文が学習に有用なものか否かを判断し、有用
であれば係り受け要素を学習文から抽出する係り受け要
素抽出部とを具備することを特徴とするものでる。
【0010】請求項4の学習データ自動作成装置は、請
求項3の学習データ自動作成装置において、並列要素抽
出部が、並列型分類部の出力結果の内、学習文の並列構
造に並列の曖昧性がないのもだけを並列要素抽出の対象
とすることを特徴とするものである。
【0011】請求項5の学習データ自動作成装置は、請
求項3の学習データ自動作成装置において、係り受け要
素抽出部が、係り受け型分類部の出力結果の内、学習文
の並列構造に係り受けの曖昧性がないものだけを係り受
け要素抽出の対象とすることを特徴とするものである。
【0012】請求項6の学習データ自動作成装置は、請
求項3の学習データ自動作成装置において、並列要素抽
出部が、並列型分類部の出力結果の内、学習文の並列構
造に並列の曖昧性がある場合でも、全ての可能な並列の
組合せに対して並列要素抽出を行い、頻度の高い並列要
素のみを学習データとして登録することを特徴とするも
のである。
【0013】請求項7の学習データ自動作成装置は、請
求項3の学習データ自動作成装置において、係り受け要
素抽出部が、係り受け型分類部の出力結果の内、学習文
の並列構造に係り受けの曖昧性がある場合でも、全ての
可能な並列の組合せに対して係り受け要素抽出を行い、
頻度の高い係り受け要素のみを学習データとして登録す
ることを特徴とするものである。
【0014】請求項8の文脈追従型並列句解析装置は、
入力文を形態素列に分解する形態素解析部と、形態素列
から文節列を合成する文節合成部と、並列要素および係
り受け要素を記憶する学習辞書と、文節列の中から並列
キーを見つけ出す並列キー判定部と、文節列および並列
キーから、入力文の並列型を判定する並列型分類部と、
文節列から、入力文の係り受け型を判定する係り受け型
分類部と、入力文の並列型を参照して入力文から並列要
素を抽出し、学習辞書に登録する並列要素抽出登録部
と、入力文の係り受け型を参照して入力文から係り受け
要素を抽出し、学習辞書に登録する係り受け要素抽出登
録部と文節列および学習辞書の内容に基づいて、入力文
中に存在する並列句の認識を行う並列構造認識部とを具
備することを特徴とするものである。
【0015】請求項9の文脈追従型並列句解析装置は、
請求項8の文脈追従型並列句解析装置において、並列構
造認識部が、文脈の学習データを事前の学習によって得
られた学習データに優先させることを特徴とするもので
ある。
【0016】
【作用】本発明の並列句解析装置の作用について説明す
る。学習辞書には、例えば「編集,印刷」「作成,更
新,削除」「解析,生成」「分割,合成」などの並列要
素と、「文書の作成」「文書の編集」「文書の更新」
「文書の印刷」と言う係り受け要素が格納されている。
例えば「編集と印刷を行なう」と言う文が入力される
と、この入力文は「編集」「と」「印刷」「を」「行
な」「う」「。」と言う形態素列に変換される。各形態
素には文法上の属性が付加されている。文法上の属性と
は、例えば「編集」がサ変名詞と言うものである。
【0017】この形態素列から文節列が作成される。上
述の入力文に対応する文節列は、 「編集と」 文節型=体(並) 係り受け型=体 「印刷を」 文節型=体 係り受け型=用 「行なう。」 文節型=用 係り受け型=× と言うものである。上述の文節列から、「編集と」が体
言属性を持ち、且つ並列キーであり、「編集と」の係り
先が体言であることが判る。
【0018】「編集と」が並列キーであり、並列の相手
が体言であり、学習辞書に「編集,印刷」と言う並列要
素が登録されているので、「編集の」の並列相手が「印
刷」であることが判る。
【0019】本発明の学習データ作成装置の作用につい
て説明する。例えば、「編集と印刷を行なう」と言う学
習文が入力されると、この学習文は「編集」「と」「印
刷」「を」「行な」「う」「。」と言う形態素列に変換
される。
【0020】この形態素列から文節列が作成される。上
述の学習文に対応する文節列は、 「編集と」 文節型=体(並) 係り受け型=体 「印刷を」 文節型=体 係り受け型=用 「行なう。」 文節型=用 係り受け型=× と言うものである。上述の文節列の中に存在する並列キ
ーは「編集と」と言う文節である。「編集と」の係り先
は体言であり、この例では「編集と」に係る体言は「印
刷を」しか存在しないので、学習文から「編集と印刷」
と言う並列要素が抽出される。
【0021】「文書の編集を行なう。」と言う学習文が
学習データ作成装置に入力されると、この学習文は「文
書」「の」「編集」「を」「行な」「う」「。」と言う
形態素列に変換される。
【0022】この形態素列から文節列が作成される。上
述の学習文に対応する文節列は、 「文書の」 文節型=体 係り受け型=体 「印刷を」 文節型=体 係り受け型=用 「行なう。」 文節型=用 係り受け型=× と言うものである。この文節列において、「文書の」の
係り先になるものは「印刷を」と言う文節しか存在しな
いので、学習文から「文書の印刷」と言う係り受け要素
が抽出される。
【0023】本発明の文脈追従型並列句解析装置は、本
発明の並列句解析装置と学習データ作成装置をあわせた
ものである。本発明の文脈追従型並列句解析装置は、入
力文から学習データを抽出し、抽出された学習データを
使用しながら、それ以後の入力文の並列句解析を行う。
【0024】
【実施例】図1は本発明の学習データ作成装置の例を示
す図である。同図において、1は形態素解析部、2は文
節合成部、3は並列キー判定部、4は並列型分類部、5
は並列要素抽出部、6は係り受け型分類部、7は係受け
関係抽出部をそれぞれ示している。
【0025】形態素解析部1は、学習文を受け取り、学
習文を形態素列に分解する。文節合成部2は、上述の形
態素解析結果で得られた形態素列を文節に組み上げる。
ここで言う文節とは、標準的な学校文法に基づく文節で
ある。名詞や動詞などの自立語に、付属語が付いた形が
多い。並列キー判定部3は、文節合成部2によって合成
された文節列から文節のキーとなるものを判定する。並
列キーとは、例えば「編集(名詞)と(並立助詞)」と
言う形を持つ文節を意味している。
【0026】並列型分類部4は、これまでに求めた文節
および並列キーの情報から、入力文の並列型を分類す
る。並列型とは、例えば並列キーとされた文節と並立し
得る文節が1個か複数個かを表すものである。並列要素
抽出部5は、並列型分類部4で判定された学習文の並列
型から、その学習文が学習に有用なものであるかどうか
を判断し、有用であれば、その学習文からから並列要素
を取り出す。取り出された並列要素は、後述の並列要素
学習辞書に書き込まれる。
【0027】係り受け型分類部6は、文節合成部2によ
って得られた文節列から、学習文の係り受け型を判定す
る。係り受け型とは、例えば係り元の文節の係り先とな
り得る文節が1個か複数個かを表すものである。係り受
け関係抽出部7は、係り受け型分類部6によって判定さ
れた係り受け型から、学習文が係り受け情報を抽出する
のに適当であるかどうかを判断し、適当であれば係り受
け要素を取り出す。取り出された係り受け要素は、後述
の係り受け要素学習辞書に格納される。
【0028】図2は学習データ作成のための処理の流れ
を示す図である。ステップS1では、入力文が入力され
る。ステップS2では、入力文が形態素に分解される。
ステップS3では、形態素列が文節列に組み上げられ
る。ステップS4では、文節列から並列型が判定され
る。ステップS5では、この判定結果から入力文が学習
に適しているかどうかが判定される。学習に適している
場合は、ステップS6で並列要素が並列要素学習辞書に
登録される。
【0029】ステップS7では、ステップS3で得られ
た文節列から係り受け型が判定される。ステップS8で
は、判定された係り受け型が学習に適しているか否が判
断される。学習に適している場合は、ステップS9で係
り受け要素を係り受け要素学習辞書に登録する。ステッ
プS10では、入力文が最後の文かどうかを判定し、最
後であれば終了する。最後でなければ、ステップS1に
戻って次の入力文を受け付ける。
【0030】図3は学習データ作成を説明する図であ
る。図3(a) は、学習データである。図3(b) は、学習
データに形態素解析をかけ、形態素列に分解したもので
ある。図3(c) は、形態素列を文節に組み上げたもので
ある。各文節には、文節の型および係り得る先の文節型
を示してある。図3(c) は次のことを示す。「編集と」
と言う文節が、体言であること、並列キーであること、
係り先は体言であることを示す。また、「印刷を」と言
う文節が、体言であること、係り先が用言であることを
示す。更に、「行なう。」と言う文節が、用言であるこ
と、係り先がないことを示す。
【0031】図3(c) によって、「編集と」と言う文節
が並列キーであることが認識される。この文では、「編
集と」と並列になり得る文節は「印刷を」しかないの
で、並列の曖昧性はなく、よって確実に並列要素を特定
することが出来る文である。このことから、この文は、
並列要素抽出に適した文であることが判断される。この
ような並列要素データを抽出して蓄積したものが、図3
(e) の並列要素学習辞書である。
【0032】図3(d) は「文書の編集を行う」と言う学
習文から、文節を取り出したものである。この文は、
「編集を」の対象として「文書の」しかあり得ず、係り
受けの曖昧性がない。したがって、この文は係り受け要
素抽出に適していると判断され、係り受け要素が抽出さ
れる。このようにして抽出された係り受け要素を蓄積し
たものが図3(e) の係り受け要素学習辞書である。
【0033】図4は並列構造の曖昧性を説明する図であ
る。本発明では、並列構造の型で文を分類し、入力文が
学習に向いているかどうかを判定する。以下の例では、
仮に“並列構造を含む文で、且つ、並列の曖昧性のない
文”が学習に向いた文だとする。図4(a) および(b) の
文は、ともに「読みだしと」と言う並列キーを持ってい
るので、並列構造を持った文と言える。
【0034】更に、図4(a) によると、「読みだしと」
の係り先(この場合は並列の相手)は体言であるが、
「読みだしと」の後には「ファイルへの」と言う体言と
「書き込み」と言う体言があり、どちらに係るかは曖昧
である。このようにして、この文は「並列構造に曖昧性
がある」と判定される。一方、図4(b) においては、
「読み出しと」の係り先(並列の相手)としては「書き
込み」しか存在しないので、並列の曖昧性がない。この
ようにして、この文は「並列の曖昧性がない」と判定さ
れる。
【0035】図5は係り受けの曖昧性を説明する図であ
る。本発明においては、係り受け型で文を分類し、入力
文が学習に向いているかどうかを判定する。以下の例で
は、仮に「係り受けの曖昧性のない文」が学習に向いた
文だとする。図5(a) においては、「ファイルへ」と言
う体言文節は用言に係るが、「ファイルへ」の後には
「書き込まれた」と「読み出す」の2つの用言文節があ
り、どちらに係るかは本格的な解析をしないと判定でき
ない。よって、この文を「係り受けの曖昧性のある文」
と判定する。図5(b) では、「ファイルへの」の係り先
は「読み出す」しかないので、この文は「係り受けの曖
昧性のない文」だと判定される。
【0036】学習文の並列構造における係り受けの曖昧
性について例をあげて説明する。 例1(曖昧性なし):「東京および大阪に行った」 例2(曖昧性あり):「東京および大阪の町に行った」 例1では、「東京」と「大阪」が並列になっており、よ
って「行った」は「東京」と「大阪」の両方にかかると
言うことが、一意に認識できる。例2では、「東京」と
「大阪」が並列であると言う解釈と、「東京」と「大阪
の町」が並列になっていると言う解釈ができる。よっ
て、「行った」が「東京」と「大阪」にかかると言う解
釈と、「行った」が「東京」と「町」にかかると言う解
釈の両方ができる。このことから、この例文の係り受け
は曖昧であると言える。
【0037】以上のような操作を全ての学習文に対して
行い、学習データの蓄積を行う。上述の例では、曖昧性
のない文のみを学習の対象にするようになっているが、
曖昧性がある場合には、全ての可能な組合せに展開して
から学習辞書に蓄積し、頻度の低いものは捨てるような
方法を取ることも出来る。例えば、上述の例1の場合
は、全ての可能な組合せは、「東京に行った。」「大阪
に行った。」になり、上述の例2の場合は、全ての可能
な組合せは、「東京に行った。」「東京の町に行っ
た。」「大阪の町に行った。」になる。
【0038】図6は本発明の並列句解析装置の例を示す
図である。同図において、1は形態素解析部、2は文節
合成部、8は並列構造認識部、9は並列要素学習辞書、
10は係り受け要素学習辞書をそれぞれ示す。
【0039】形態素解析部1は、解析対象の入力文を形
態素に分解する。文節合成部2は、上述の形態素列を文
節列にまとめあげる。並列構造認識部8は、上述の文節
列から並列構造を認識する。並列構造認識部8は、認識
のために、並列要素学習辞書9および係り受け要素学習
辞書10を参照する。これら並列要素学習辞書9および
係り受け要素学習辞書10は、学習データ作成装置(図
1を参照)によって、解析に先立って作成しておくもの
である。
【0040】図7は学習データを使用して並列句解析を
行うための処理の流れを示す図である。ステップS1で
は、文が入力される。ステップS2では、入力文が形態
素に分解される。ステップS3では、形態素列が文節に
組み上げられる。ステップS4では、学習段階で作成さ
れた学習辞書を参照しながら、並列句認識を行う。
【0041】図8は並列構造の認識を説明する図であ
る。図8(a) は解析対象の入力文である。図8(b) は入
力文を文節に分解したものである。図8(c) は文節列か
ら作ることが出来る並列の組合せの例である。図中、組
合せは括弧で表してある。ここで、それぞれの組合せか
ら得られる,全ての並列要素の組と係り受け要素の組に
ついて、学習辞書を検索する。検索した結果、要素が辞
書に存在したものを,右側に並べてある。この中で、上
から3番目の組合せが,学習辞書の内容にもっとも沿っ
たものであるので、並列句認識結果として出力する。図
8(d) は、この出力結果である。なお、それぞれの組合
せについて従来手法による点数付けを行っておき、この
点数に学習辞書の検索結果の点数を加味して候補を選ぶ
ようにしても良い。
【0042】図9は本発明の文脈追従型並列句解析装置
の例を示す図である。同図において、1は形態素解析
部、2は文節合成部、3は並列キー判定部、4は並列型
分類部、6は係り受け型分類部、8は並列構造認識部、
9は並列要素学習辞書、10は係り受け要素学習辞書を
それぞれ示している。
【0043】図9の文脈追従型並列句解析装置は、学習
辞書を用いて並列句解析を行う装置において、学習辞書
の学習も同時に行うようにしたものである。基本的に
は、学習のための構成と認識のための構成を組み合わせ
たような構成になっている。
【0044】図中、並列キー判定部3までは普通の並列
句解析装置と同じである。並列型分類部4および係り受
け型分類部6は、並列構造認識処理中に、並列キー判定
部3からの文節列を監視しており、学習に適当な文の場
合には、並列要素学習辞書9又は係り受け要素学習辞書
10に学習データを追加する。並列構造認識部8は、こ
の動的に変化する学習辞書9,10を参照しながら、認
識処理を行う。よって、学習が起こった次の文の認識か
ら、この学習結果が並列構造認識部8に反映されるよう
になる。
【0045】図9の文脈追従型並列句解析装置において
は、学習辞書の中には、現文書の認識前から存在する学
習データと、現文書の認識中に抽出された学習データと
が存在することになるが、現文書の認識中で抽出された
学習データの重みを、現文書の認識前から存在する学習
データの重みよりも大きくすることが出来る。
【0046】
【発明の効果】以上の説明から明らかなように、本発明
によれば、並列句認識を行う際に、解析対象の分野に多
用されるような並列表現を確実に認識することが出来
る。また、この際に用られる学習データを,人手作業な
しに自動的に作成することが出来る。
【図面の簡単な説明】
【図1】本発明の学習データ作成装置の例を示す図であ
る。
【図2】学習データ作成のための処理の流れを示す図で
ある。
【図3】学習データの作成を説明する図である。
【図4】並列構造の曖昧性を説明する図である。
【図5】係り受けの曖昧性を説明する図である。
【図6】本発明の並列句解析装置の例を示す図である。
【図7】学習データを用いて並列句解析を行うための処
理の流れを示す図である。
【図8】並列構造の認識を説明する図である。
【図9】本発明の文脈追従型並列句解析装置の例を示す
図である。
【符号の説明】
1 形態素解析部 2 文節合成部 3 並列キー判定部 4 並列型分類部 5 並列要素抽出部 6 係り受け分類部 7 係り受け関係抽出部 8 並列構造認識部 9 並列要素学習辞書 10 係り受け要素学習辞書

Claims (9)

    【特許請求の範囲】
  1. 【請求項1】 入力文を形態素列に分解する形態素解析
    部と、 形態素列から文節列を合成する文節合成部と、 並列要素および係り受け要素を記憶する学習辞書と、 文節列および学習辞書の内容に基づいて、入力文中に存
    在する並列句の認識を行う並列構造認識部とを具備する
    ことを特徴とする並列句解析装置。
  2. 【請求項2】 並列構造認識部が、文節列から作ること
    が出来る全ての並列の組合せについて学習辞書を検索
    し、検索のヒット数の多い組合せを優先的に出力するこ
    とを特徴とする請求項1の並列句解析装置。
  3. 【請求項3】 学習文を形態素に分解する形態素解析部
    と、 形態素列を文節列に合成する文節合成部と、 文節列の中から並列キーを見つけ出す並列キー判定部
    と、 文節列および並列キーから、学習文の並列型を判定する
    並列型分類部と、 文節列から、学習文の係り受け型を判定する係り受け型
    分類部と、 学習文の並列型に基づいて学習文が学習に有用なものか
    否かを判断し、有用であれば並列要素を学習文から抽出
    する並列要素抽出部と、 学習文の係り受け型に基づいて学習文が学習に有用なも
    のか否かを判断し、有用であれば係り受け要素を学習文
    から抽出する係り受け要素抽出部とを具備することを特
    徴とする学習データ自動作成装置。
  4. 【請求項4】並列要素抽出部が、並列型分類部の出力結
    果の内、学習文の並列構造に並列の曖昧性がないのもだ
    けを並列要素抽出の対象とすることを特徴とする請求項
    3の学習データ自動作成装置。
  5. 【請求項5】 係り受け要素抽出部が、係り受け型分類
    部の出力結果の内、学習文の並列構造に係り受けの曖昧
    性がないものだけを係り受け要素抽出の対象とすること
    を特徴とする請求項3の学習データ自動作成装置。
  6. 【請求項6】 並列要素抽出部が、並列型分類部の出力
    結果の内、学習文の並列構造に並列の曖昧性がある場合
    でも、全ての可能な並列の組合せに対して並列要素抽出
    を行い、頻度の高い並列要素のみを学習データとして登
    録することを特徴とする請求項3の学習データ自動作成
    装置。
  7. 【請求項7】 係り受け要素抽出部が、係り受け型分類
    部の出力結果の内、学習文の並列構造に係り受けの曖昧
    性がある場合でも、全ての可能な並列の組合せに対して
    係り受け要素抽出を行い、頻度の高い係り受け要素のみ
    を学習データとして登録することを特徴とする請求項3
    の学習データ自動作成装置。
  8. 【請求項8】入力文を形態素列に分解する形態素解析部
    と、 形態素列から文節列を合成する文節合成部と、 並列要素および係り受け要素を記憶する学習辞書と、 文節列の中から並列キーを見つけ出す並列キー判定部
    と、 文節列および並列キーから、入力文の並列型を判定する
    並列型分類部と、 文節列から、入力文の係り受け型を判定する係り受け型
    分類部と、 入力文の並列型を参照して入力文から並列要素を抽出
    し、学習辞書に登録する並列要素抽出登録部と、 入力文の係り受け型を参照して入力文から係り受け要素
    を抽出し、学習辞書に登録する係り受け要素抽出登録部
    と文節列および学習辞書の内容に基づいて、入力文中に
    存在する並列句の認識を行う並列構造認識部とを具備す
    ることを特徴とする文脈追従型並列句解析装置。
  9. 【請求項9】 並列構造認識部が、文脈の学習データを
    事前の学習によって得られた学習データに優先させるこ
    とを特徴とする請求項8の文脈追従型並列句解析装置。
JP08251095A 1995-04-07 1995-04-07 並列句解析装置および学習データ自動作成装置 Expired - Fee Related JP3698454B2 (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP08251095A JP3698454B2 (ja) 1995-04-07 1995-04-07 並列句解析装置および学習データ自動作成装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP08251095A JP3698454B2 (ja) 1995-04-07 1995-04-07 並列句解析装置および学習データ自動作成装置

Publications (2)

Publication Number Publication Date
JPH08278973A true JPH08278973A (ja) 1996-10-22
JP3698454B2 JP3698454B2 (ja) 2005-09-21

Family

ID=13776525

Family Applications (1)

Application Number Title Priority Date Filing Date
JP08251095A Expired - Fee Related JP3698454B2 (ja) 1995-04-07 1995-04-07 並列句解析装置および学習データ自動作成装置

Country Status (1)

Country Link
JP (1) JP3698454B2 (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2017027536A (ja) * 2015-07-28 2017-02-02 Kddi株式会社 特性語によってグループ状態を推定可能なプログラム、装置及び方法
JP2018180935A (ja) * 2017-04-13 2018-11-15 日本電信電話株式会社 並列句解析装置、並列句解析モデル学習装置、方法、及びプログラム

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2017027536A (ja) * 2015-07-28 2017-02-02 Kddi株式会社 特性語によってグループ状態を推定可能なプログラム、装置及び方法
JP2018180935A (ja) * 2017-04-13 2018-11-15 日本電信電話株式会社 並列句解析装置、並列句解析モデル学習装置、方法、及びプログラム

Also Published As

Publication number Publication date
JP3698454B2 (ja) 2005-09-21

Similar Documents

Publication Publication Date Title
US6278968B1 (en) Method and apparatus for adaptive speech recognition hypothesis construction and selection in a spoken language translation system
US6442524B1 (en) Analyzing inflectional morphology in a spoken language translation system
US6266642B1 (en) Method and portable apparatus for performing spoken language translation
US6282507B1 (en) Method and apparatus for interactive source language expression recognition and alternative hypothesis presentation and selection
US6243669B1 (en) Method and apparatus for providing syntactic analysis and data structure for translation knowledge in example-based language translation
JP3906356B2 (ja) 構文解析方法及び装置
US6356865B1 (en) Method and apparatus for performing spoken language translation
US20100088085A1 (en) Statistical machine translation apparatus and method
EP0971294A2 (en) Method and apparatus for automated search and retrieval processing
US20040260533A1 (en) Method and apparatus for converting an expression using key words
WO1997004405A9 (en) Method and apparatus for automated search and retrieval processing
KR100481598B1 (ko) 복합 형태소 분석 장치 및 방법
Alsina et al. CATCG: a general purpose parsing tool applied.
JP3698454B2 (ja) 並列句解析装置および学習データ自動作成装置
KR20050064574A (ko) 영한 자동번역에서 의미 벡터와 한국어 국소 문맥 정보를사용한 대역어 선택시스템 및 방법
KR20040018008A (ko) 품사 태깅 장치 및 태깅 방법
JP3326646B2 (ja) 機械翻訳システム用辞書・ルール学習装置
KR940022311A (ko) 기계번역장치 및 방법
Raza et al. Saraiki language word prediction and spell correction framework
Gebremeskel Geez POS Tagger Using Hybrid Approach
Ney et al. The RWTH system for statistical translation of spoken dialogues
JPH11338863A (ja) 未知名詞および表記ゆれカタカナ語自動収集・認定装置、ならびにそのための処理手順を記録した記録媒体
JP2004280316A (ja) 分野判定装置及び言語処理装置
Samir et al. Training and evaluation of TreeTagger on Amazigh corpus
JP2994539B2 (ja) 機械翻訳装置

Legal Events

Date Code Title Description
A02 Decision of refusal

Free format text: JAPANESE INTERMEDIATE CODE: A02

Effective date: 20020416

A521 Written amendment

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20050613

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20050705

R150 Certificate of patent or registration of utility model

Free format text: JAPANESE INTERMEDIATE CODE: R150

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20080715

Year of fee payment: 3

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090715

Year of fee payment: 4

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100715

Year of fee payment: 5

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20100715

Year of fee payment: 5

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20110715

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20110715

Year of fee payment: 6

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20120715

Year of fee payment: 7

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20120715

Year of fee payment: 7

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20130715

Year of fee payment: 8

LAPS Cancellation because of no payment of annual fees