JPH08500691A - バイリンガルデータベース処理方法とその装置 - Google Patents

バイリンガルデータベース処理方法とその装置

Info

Publication number
JPH08500691A
JPH08500691A JP7502560A JP50256095A JPH08500691A JP H08500691 A JPH08500691 A JP H08500691A JP 7502560 A JP7502560 A JP 7502560A JP 50256095 A JP50256095 A JP 50256095A JP H08500691 A JPH08500691 A JP H08500691A
Authority
JP
Japan
Prior art keywords
word
pair
linguistic
aligned
database
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP7502560A
Other languages
English (en)
Inventor
フランシス オダナヒュー,ティモシー
Original Assignee
キャノン リサーチ センター ヨーロッパ リミテッド
キャノン ヨーロッパ ナムローゼ フエンノートシャップ
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by キャノン リサーチ センター ヨーロッパ リミテッド, キャノン ヨーロッパ ナムローゼ フエンノートシャップ filed Critical キャノン リサーチ センター ヨーロッパ リミテッド
Publication of JPH08500691A publication Critical patent/JPH08500691A/ja
Pending legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00—Handling natural language data
    • G06F40/40—Processing or translation of natural language
    • G06F40/42—Data-driven translation
    • G06F40/45—Example-based machine translation; Alignment
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00—Handling natural language data
    • G06F40/40—Processing or translation of natural language
    • G06F40/42—Data-driven translation
    • G06F40/49—Data-driven translation using very large corpora, e.g. the web
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00—Handling natural language data
    • G06F40/40—Processing or translation of natural language
    • G06F40/51—Translation evaluation

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Machine Translation (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

(57)【要約】 整列された言語資料(206、CORPE,CORPF)は、生成されるかまたは、外部ソースから受け取られる。例えば、各言語資料は他の言語資料の対応部分と連合した1セットの整列された部分を備え、整列された部分は2つの自然言語では互いに名目上の翻訳である。統計データベース(210)はコンパイルされる。評価モジュール(212)は各函語資料から1つ選択されたワードペアに対する相関スコアを計算する。テキスト部分ペア(各言語で1つ)が与えられると、評価モジュール(212)は、ワードペア相関スコアを結合し、テキスト部分に対する整列スコアを獲得する。これらの整列スコアは、翻訳(230)を検証し、また、整列された言語資料(206)を修正して可能性のない整列を取り除く。

Description

【発明の詳細な説明】 [発明の名称] バイリンガルデータベース処理方法とその装置 [発明の分野] 本発明は、整理された言語資料を備えるバイリンガルデータベースまたはマル チリンガルデータベースの処理方法とその装置に関し、特に、そのようなデータ ベースを用いた自動翻訳方法とその装置に関する。 、整理された言語資料は、整理された部分に分割された2つ(あるいは、それ 以上の)のテキスト体を有する。第1の言語資料の各部分は、第2の言語資料の 対応部分にマップされる。各部分は、通常、1つの文あるいは句を備えることが できるが、1つの単語やおそらく全パラグラフをも備えることができる。 その整理された言語資料は、自動翻訳システムでのデータベースとして利用可 能であり、そのシステムでは単語、句、文が第1の言語で与えられており、もし 、既にデータベースに存在する部分に一致するかある程度に似ているならば、第 2の言語での対応翻訳が自動的に得られる。この原理は、2つ以上の言語資料が 整理されて、複数言語への翻訳が可能になるような拡張が可能である。 1950、1960年代では、万能(all-purpose)な翻訳システムの開発が近 い将来可能になるだろうと共通に信じられていた。しかしながら、膨大なバック グラウンド情報と″知識″を必要とするために、そのようなシステムは、はるか 将来のものであり、おそらく決してインプリメントされないであろうと後にわか ってきた。しかし、小さな専門分野の翻訳を自動化するために、整理された言語 資料を使うことができたことも評価された。このことは、例えば、多くの異なる 意味を有する″問題ワード(problem words)″が専門家の活動分野の制限内では 非常に限られた範囲の意味を持つ傾向があるという道理を支持する。 しかしながら、そのように特殊化された翻訳システムを作る時に、一つの活動 分野に対して生成されたデータベースが、理想的に大容量の前もって翻訳された ドキュメントに基づくべきであり、おそらく別分野でのアプリケーションには適 さないであろうということがわかっていたとしても、高品質に整理された言語資 料をまず生成する問題が存在する。第1に、各分野で働くユーザにとって、自分 自身のデータベースを生成することが必要となり、このことがそのような自動化 されたシステムの利用を取りやめる方向に向かわせることになり、人間の翻訳者 への依存が続く。例えば、米国特許5140522では、機械翻訳システムにつ いて記述している。このシステムでは、前もって翻訳された文のデータベースが 使用中に構築されるが、人間の翻訳者の初期の努力なしでそのようなデータベー スを獲得する方法についてはなんら公開していない。 上述の問題について述べると、GB-A-2272091として公開されている 対応英国特許出願は、整理された言語資料を生成する自動化システムについて記 述している。GB-A-2272091の内容は、参照番号によって本明細書に一 体化される。自動化システムは、ワード処理装置によってほとんどのドキュメン ト中に挿入されるフォーマッテイングコードに応答する。そのフォーマッテイン グコードは例えば、新しい章のヘッデイングやテーブル中での新しいエントリを 知らせる。例えば、電子機器のインストラクションマニュアルを含む多くの種類 のテキストにとって、そのようなフォーマッテイングコード間のテキスト部分は 、整理された言語資料中での整理された部分として利用されるには十分に小さい 。このように、従来技術で記述されたシステムは相対的にシンプルで、そこでは 、ワードの意味を判定することは要求されず、テキストを文またはより小さい単 位に分解しない。他方、様々な理由で、結果としての整列は完全ではないため、 データベースは不正な整列形態での″ノイズ″を含む。 整理された言語資料の生成を自動化する他の方法が、例えば、W A GaleとK WC hurchによる″A program for Aligning Sentences in Bilingual Corpora (バ イリンガル言語資料の文を整理するプログラム)″と、P F Brown他による″Ali gning Sentences in Parallel Corpora(パラレル言語資料の文の整理)″の中 に記述されている。これらは共に、第29回計算的言語学会のアニュアルミーテ イング(バークレイ、カルフォルニア)のプロシーデイングの中で記述されてい る。ブラウン他(Brown et al)によって提案されたシステムは、より詳細に欧 州特許EP A-0525470に記載されている。これらのシステムでは、文に対応して使 わ れる部分と整列は、ワード数(ブラウン他(Brown et al))か文字数(ゲールと チャーチ(Gale and Church))のいずれかで文長を比較することによって達成さ れる。勿論、それらの文献によると、これらの方法を用いた結果の整理された言 語資料もまた、少なくとも数パーセントのレベルまでのエラー構成を含む。 ブラウン他の文献は、自動的に生成された整理された言語資料(100000 0ペアの文から1000)の小さなサンプルを人間の努力によってランダムチェ ックすることについて記述している。この努力は、ある観察された可能性でエラ ーが起こることを示したが、人間の努力によって全データベースをチェックする ことは非実践的であるうが、その文献には、エラーの重要な部分を検出し訂正す る実践的方法をなんら示唆してはいない。さらに、大きな節(言語資料の約10 %)は既に捨てられている。何故なら、″アンカーポイント (anchor points) ″の比較で、節間のミスマッチが示されたからである。ゲール(Gale)とチャーチ (church)によって提案された自動整列方法は、文長の可能性のある訂正に基づい ているので、それらアンカーは、最も小さい可能性の整列を単純に無視すること によって、多くの謝った整列を削除できることを示唆する。このオプションは価 値があるかもしれないが、文長の訂正が整列に対する唯一のキーであるという仮 定があるため、データベースの品質は制限される。 ブラウン他(EP-A-0525470)の翻訳システムは、相対的に複雑なソース言語とタ ーゲット言語の統計モデルとそれら言語間翻訳の統計モデルとを用いているので 、データベース中の低レベルの″ノイズ″を許容することができる。しかしなが ら、簡単に言えば、US5140522とGB−A−2272091で記述され ているタイプのメモリベースのシステムでの各不正な整列は、結果として与えら れた文に対して全体として不正な翻訳出力となるかもしれない。 本発明は、統計技術を使用して、整列されたテキスト部分中で可能性のあるエ ラーを検出する。誤った整列をデータベースから使用前に取り除くために、また 、ある他の方法で″ノイズのある(noisy)″データベースを使って得られた誤翻 訳を取り除くために本発明を使うことができる。特定の実施例において、本発明 によって、バイリンガルワードペアの相関を測定するためのあるスコアを得るこ とができる。そして、提案された整列された部分のペアに対するスコアを得るた めに、 ワードペアスコアを結合することができる。その部分は外部から受信されるかま たは、データベース自身からの整列された部分であるかもしれない。全体として のデータベースの統計量との比較してエラーであることがわかった整列をそのデ ータベースから取り除くことができる。 従って、本発明は、整列された言語資料を備えるデータベースを、最小の人間 の介入と処理条件で改良する。特に、使用されたプロセスが統計的な基盤を維持 し、また、プロセッサが言語資料の文脈とシンタックスに対する明瞭さを維持す るときは、実際上、相対的に安価な処理装置によって、高品質に整列された言語 資料の生成をすばやく実行できることが見いだされている。 どんな技術が使われて整列された言語資料を以前に翻訳されたドキュメントか ら生成するかということに無関係にその技術を使うことができるから、本発明を 存在するデータベースの改良に使うことができ、また、オリジナルの整列を作っ た装置によって示唆されていないエラーを検出できる。 EP-A-0499366(The British and Foreign Bible Society)に、翻訳によって生成 されたバイリンガル言語資料をチェックするプロセスが記述されていることに注 目されたい。このプロセスは、ワードペアに対するスコアを計算し、繰り返しプ ロセスによって、翻訳の″辞書(dictionary)″を構築する。これは、あるワード の翻訳において、可能性のある不整合をハイライトするのに使われる。 さらに、本発明は、従属クレイムで示すように、データベースのようなものを 有する翻訳方法とその装置を提供する。 本発明に係る一実施例について、以下、図面を参照しながら説明する。 図1は、本発明を実施する翻訳システムのハードウエア要素を示す図である。 図2は、図1のシステムの実行構造を示す図である。 図3は、整列された言語資料のペアを有するデータベース構造を示す図である 。 図4は、図3のデータベースに対するワード頻度テーブルを示す図である。 図5は、図3のデータベースに対するペア頻度テーブルを示す図である。 図6は、システムの統計的アナライザの処理を描いたフローチャートである。 図7は、システムの評価モジュールの処理の一部を描いたフローチャートであ る。 図8は、評価モジュールの処理の他の一部を描いたフローチャートである。 図9は、評価モジュールを使ったデータベースの修正を描いたフローチャート である。 図10は、修正されたデータベースを用いたテキスト翻訳を描いたフローチャ ートである。 図11は、一例のデータベースでの整列されたスコアのヒストグラムを示す図 である。 英語とドイツ語のパートAからGを有する付録は、整列された言語資料の一例 と、その一例に対するアナライザと評価モジュールでの処理結果を示す。 図1のシステムでは、ユーザとの対話は、キーボード10とデイスプレイ画面 12の手段によってなされる。プロセッサユニット14は、中央処理装置(CP U)と半導体メモリ(RAMとROM)とインターフェイス回路を備える。磁気 デイスクメモリや光学的デイスクメモリ16は、マルチリンガルのデータベース と翻訳されたテキストとシステム全体の処理を制御するためのプログラムを格納 するための大容量記憶を提供する。可動デイスクメモリ18は、そのシステムに 対する新しいデータとプログラムのコミュニケーションのために用意されている 。 本発明の有利な点は、システムの上述したハードウエア要素が、パーソナルコ ンピュータやワークステーションタイプのコンピュータの形態で、商業的にすで に入手可能であることである。図2は、図1のシステムの実行構成を示す。その システムは、2つかそれ以上の言語で既に存在する1つかそれ以上の参照テキス トを含むソースデータを格納する。例えば、図2の200で示されているテキス トREFTEXTIEは、202に格納されたフランス語ドキュメントREFTEXTIFの英語翻 訳である。そのようなテキストのペアを読み込むことができ、また、図2の20 6に示された対応する整列された言語資料のペアを生成できる整列モジュール2 04が用意されている。整列された言語資料206はバイリンガルデータベース の大部分を構成し、新しいドキュメントの翻訳のために使われる。 整列された言語資料206に対して統計データベース210を生成するために 、 アナライザモジュール208が用意されている。整列された言語資料や他のテキ ストでの整列の品質を測定するために、統計データベース210の情報を使う評 価モジュール212が用意されている。出力テキストファイル218を生成する ために、入カテキストを(例えば、磁気デイスクドライブ18経由で)読み込む ための翻訳モジュール214が用意されている。人間オペレータとの対話はそれ らモジュールのいずれとも可能であり、例えば、翻訳モジュール214は当業の 翻訳者と相談できる。 多様な構成が実際上可能であることが理解されるであろう。例えば、1つの装 置で生成されて、翻訳での使用のために第2の装置と通信されるデータベース情 報206、210を有する翻訳モジュールと分析と評価モジュール204、20 8、212を独立な装置として用意できる。このことは実際に役に立ち、整列さ れた言語資料を生成し、評価し、中心に維持し、翻訳のためのドキュメントを当 業の翻訳者や編集者に分配することができる。ここで、前記翻訳者や編集者はパ ーソナルコンピュータ等を備える自宅や小さな事務所で、例えば翻訳モジュール 214と遠隔で作業する傾向がある。 上述したように、整列された言語資料生成器204は、公知の設計のものであ ってよい。例えば、従来技術GB-A-2272091で述べた例やゲール(Gale)とチャーチ (Church)やブラウン(Brown)他による論文に記述されている例を用いてもよい。 さらに、オリジナルの整列された言語資料が生成される方法は、本発明の理解の ために関連するものではないため、詳細には記述しない。図3は、整列された言 語資料ペアを含む範囲でのバイリンガルデータベース206の構造を示す図であ る。図3の例は小さく、また、図のみが示されているが、付録を参照して小さい が完全な例を後述する。 図3では、英語の呂語資料CORPEが、テキストの複数部分を備える。これらの 部分は、番号によってアドレス可能で、″chunks(チャンク:大きな塊)″CORP E[I]として参照される。ここで、Iは1、2、3...である。整列された言語資 料が生成される方法に依存して、各チャンクはオリジナルソースドキュメントの 文におおよそ対応するか、テキストのより長いかより短い部分に対応する。どち らにしても、各チャンクCORPE[I]は、CORPE[I][J]で参照される可変番号のより 小さい 要素を有する。この例では、これらより小さい要素は英語テキストの個別ワード である。このように、例えば、チャンクCORPE[1]は、2つのワードを有する。即 ち、CORPE[1][1]は″Good″であり、CORPE[1][2]は″day″である。CORPE[3][1] は″No″であり、CORPE[6][1]は″Yes″である。ワードCORPE[5][2]とCORPF[4][ 3]は、さらに付け加えた描画として図中でラベル付けされている。 図3の他の側面において、第2のフランス語の言語資料CORPFは、識別可能な 番号のチャンクCORPF[I]を含む。ここで、そのチャンクの各々は、英語の言語資 料の同様に番号付けされたチャンクCORPE[I]に対応する。特に、関係RELは、少 なくともある名目的意味で、各英語のチャンクCORPE[I]が対応するフランス語チ ャンクCORPF[I]の翻訳であることを具体化する。各チャンクが反対の言語資料の 正確に1つのチャンクと結びつくとき、整列されたチャンク内のワード数は同じ である必要はない。例えば、示されているように、フランス語の言語資料の第1 のチャンクは、1つの単語″Bonjour″を備え、他方、英語の言語資料の第1の チャンクは2つのワード″Good″、″Day″を有する。その文献はまた、1つの 文を備える部分が2つの文を含む部分と結びつくところの例を記述する。 整列された言語資料のCORPEとCORPFでのチャンクの整列がそれ以上のものでは ないことを理解すべきである。それらの整列が個別に正しいことが、当業の人間 翻訳者によって立証されていないため、それらの整列は、その文献に記述された タイプの自動化された比較での単に″当てずっぽうの判断(guesswork)″に基づ くものである。2つのチャンクが互いに翻訳であって、整列されたチャンクの個 別のワード間の特別な関係を全く示してはいないということを、その整列が証明 しないことは明白である。このように、例えば、ワード″Yes″と″Oui″が互い に翻訳であり、それらの両方が、整列された言語資料の対応するチャンクの第1 ワードとしてたまたま現れるということにすぎないということは、データベース 中には何の示唆もない。 図4と図5は、統計的アナライザモジュール208の出力を描いており、本実 施例では、このモジュールは以下に説明する頻度テーブルを生成する。テーブル FREQE(図4)は、英語の言語資料CORPEに対するワード頻度テーブルである。テ ーブルFREQEのエントリに対するインデックスは、英語の言語資料からの1ワー ドである。そして、そのワード下に格納されたそのエントリは、言語資料中でそ のワードの発生数である。幾つかの従来のプログラミング言語は、いわゆる″連 想アドレッシング(associative addressing)″を提供することが知られている。 これら言語は、Lisp、POP-11、PERL、AWKを含む。勿論、連想アドレッシングが 提供されていない環境では、システム設計者がそれを明示的にインプリメントす ることができる。 第2のワード頻度テーブルFREQFは、フランス語の言語資料CORPFに対するワー ド頻度を含む。そのテーブルは、本実施例ではケースセンシテイブ(case-sensit ive)ではないので、″Yes″と″yes″は同じワードとして取り扱われる。連想ア ドレッシングは、ここでは、″中括弧(braces)″や″カーリーブラケット (cury brackets)″の使用によって示される。 第3のテーブルPAIRFREQ(図5)は、整列された言語資料に対するワードペア 頻度を格納する。これは、概念的に2次元テーブルであり、ワードペアによって 各エントリは連想的にアドレスづけが可能である。ここで、このワードペアは、 英語の言語資料CORPEからの1つのワードとフランス語の言語資料CORPFからの別 のワードである。所定のワードペア、例えば、″good″、″bonjour″のために 、テーブルエントリPAIRFREQ{good,bonjour}は、それら2つのワードが整列され た言語資料の対応するチャンクに現れる回数を格納する。 図5の影付きの箱は、図3の1例の言語資料に示された2、3ワードに対応す るエントリを示す。このように、エントリPAIRFREQ{good,bonjour}は、少なくと も値1を含む。何故なら、これら2つのワードは、第1の整列されたチャンクペ アCORPE[1]とCORPF[1]内に存在するからである。同様に、PAIRFREQ{good,bonjou r}は、少なくとも1の値を含む。何故なら、このワードペアはまた、整列された チャンクの第1のペアに存在するからである。 各言語資料に対して、ワードの総数が格納される。そしてその数は、このケー スでは、テーブルFREQEやFREQF内の全エントリ合計に等しい。同様に、全ワード ペアの総数が記録されるが、これは、2次元ペアの頻度テーブルPAIRFREQ内の全 エントリの自然な合計である。 当業者は、2次元テーブルとしてのテーブルPAIRFREQを実際に使うことが、結 果として非常にまばらな配列となることを理解するであろう。テーブルPAIRFREQ が1次元連想配列であり、配列FREQEとFREQFと同様であるようなより効果的なイ ンプリメンテーションを採用できる。このことは、ペアのワードを1つのストリ ングに結びつけて、そのテーブルに対してインデックス付けすることによって非 常に単純に達成される。従って、例えば、2次元アドレス{good,bonjour}の独立 要素である″good″と″bonjour″の代わりに、全ストリング″good_bonjour″ は、テーブルPAIRFREQ内で対応するエントリの連想アドレッシングのための単独 の1次元アイテムとして扱われる。 図6は、整列された言語資料CORPEとCORPFから統計データベース210を生成 する統計アナライザ208の処理フローチャートである。初期化ステップ600 では、ペア頻度テーブルPAIRFREQのための空き領域が予約され、そこでの全エン トリはゼロに初期化される。同様に、ワード頻度テーブルFREQEとFREQFのための 空き領域が予約され、また、これらのエントリもゼロに初期化される。ペアカウ ント変数PAIRTOTALが確立されて、0にセットされる。同様に、ワードカウント 変数ETOTALとFTOTALが確立されて、0にセットされる。 そのプロセスの残りは、一連のネストされたループを備える。メインループ6 02は、各整列されたチャンクペアCORPE[I]とCORPF[I]に対して一度実行される 。。ここで、Iはループによる各時間で1から上方に、全ての整列されたチャン クペアが検討されるまでインクリメントされる。 メインループ602の範囲内で、さらなるループ604が、英語の言語資料の 現チャンク内の各ワードCORPE[I][J]に対して一度実行される。メインループ6 04の範囲内で、さらにさらなるループ606が、フランス語の言語資料CORPF で対応するチャンクの各ワードCORPF[I][K]に対して一度実行される。この内部 ループ606の範囲内で、ペア頻度テーブルPAIRFREQ内の現ワードペアに対応す るエントリが1づつインクリメントされる。上述したように、英語-フランス語 ワードペアを参照することによって、配列PAIRFREQは連想的にアドレス可能であ る。また、ループ606の範囲内で、カウンタ変数PAIRTOTALは、インクリメン トされる。 ループ604と606の外側でメインループ602の範囲内では、さらなるル ープ608が英語の言語資料の現チャンク内で各ワードCORPE[I][J]に対して一 度実行される。ワード頻度テーブルFREQEのエントリは、1づつインクリメント される。また、英語の言語資料のための合計ワードカウントETOTALもまた、1づ つインクリメントされる。ループ608の終了後、メインループ602の範囲内 で、さらなるループ610がフランス語の言語資料内の各ワードCORPF[I]{K]に 対して一度実行される。このループの範囲内では、ワード頻度テーブルFREQFの エントリはインクリメントされ、ワードCORPF[I][K]の発生を記録する。そして 、フランス語の言語資料の総ワードカウントFTOTALもインクリメントされる。 従って、一度、メインループ602が整列された言語資料CORPEとCORPFの全て の整列されたチャンクペアに対して実行されると、テーブルPAIRFREQは、整列さ れたチャンクでの全ユニークなワードペアの発生数の記録を含み、また、テーブ ルFREQEは、英語の言語資料での各ユニークワードの発生数を記録し、さらに、 テーブルFREQFは、フランス語の言語資料での各ユニークワードの発生数を記録 する。ワードペアの総数が可変のPAIRTOTALで記録される同時に、英語の言語資 料でのワードの総数が可変のETOTALで記録され、また、フランス語の言語資料CO RPFでの総ワード数が可変のFTOTALで記録される。 図7と図8は、図1に示される評価モジュール212での処理を描いている。特 に、図7では、相互関連測定、即ち各ワードペアに対する″スコア(score)″の 計算を描いている。また、図8では、各整列されたチャンクペアに対するスコア を、そこでのワードペアのペアスコアを用いた計算を描いている。 図7を参照して、処理はステップ700から始まる。この処理では、ワードペ アWORDEとWORDFが受け取られる。ステップ702では、統計データベース210 のテーブルを用いて3つの確率値が計算される。そのワードペアのために確率値 ペアPAIRPROBが、ペア頻度テーブル(図5)に記録されたワードペアの合計数PA IRTOTALによって、そのテーブルに記録されたワードペア頻度PAIRFREQ{WORDE,WO RDF}を分割することによって計算される。このように、PAIRPROBはデータベース の整列された言語資料内の2つの整列されたチャンクに存在する受け取ったワー ドペアの観測確率を見積もる。 英語の言語資料内でのワードの合計数により英語の言語資料内での英語ワード WORDE単独での発生頻度を分割することによって、値EPROBが計算される。即ち、 テーブルエントリFREQE{WORDE}は、値ETOTALによって分割される。このように、 値EPROBは、英語の言語資料内での受け取ったペアの英語ワードの確率を見積も る。受け取ったワードペアのフランス語WORDFにたいしても同様に、フランス語 の言語資料内での合計数FTOTALによりテーブルエントリFREQF{WORDF}を分割する ことによって、確率値FPROBが計算される。フランス語の言語資料CORPFの内容に 基づき、値FPROBが存在するワードWORDFの確率を見積もる。 最後にステップ704では、個々のワード確率値EPROBとFPROBにより、受け取 ったワードペアWORDE,WORDFに対するスコア値(scoring value)PAIRSCOREが計算 される。単位元(unity)に等しい値PAIRSCOREは、整列されたチャンク内でのこの ワードペアの発生頻度が個々の言語資料に存在する個々のワードの観測確率に基 づくランダム確率によって期待される以上のものではないということを示す。他 方、単位元以上の値PAIRSCOREは、このワードペアの発生頻度が個々のワード頻 度から期待されるより大きいということを示す。このように、そのペアスコアは 、そのペアの2つのワード間相関の見積もりとなる。 図8を参照して、個々の言語、例えば、英語とフランス語内での1つかそれ以 上のワードをそれぞれ備えるテキストの2つのチャンクの整列の品質を見積もる ために、統計データベースと図7のペアスコアリング方法を使うことができる。 図8の処理は、ステップ800から始まり、テキストの2つのチャンクCHUNKE とCHUNKFがモジュール212がそれらの整列スコアを評価するために受け取られ る。初期化ステップ802では、スコア変数Sは1にセットされ、カウント変数 N (counting variable N)は0にセットされる。 初期値がSとNに与えられると、これらの変数はネストしたループペア 80 4と806によって修正される。外側のループ804は、ステップ800で受け 取ったフランス語チャンクでの各ワードCHUNKE[J]に対して一度実行される。そ れ故、ネストしたループ806と804の範囲内で、英語チャンクの全ての各ワ ードが、フランス語チャンクの全ワードと共に検討される。S値は、検討される 各ワードペアペアスコアに対するPAIRSCORE(CHUNKE[J],CHUNKF[K])と乗算される 。このペアスコアは、図7のステップを用いて計算される。同時に、変数Sに結 合 されたスコア数のカウントを維持するために、カウント変数Nは1づつインクリ メントされる。 2つの受け取られたチャンクの各ワードペアが検討され、そのペアスコアが結 合して積Sになった後、積SのN乗根をとることによって、整列スコアALSCORE が、ステップ808で計算される。数学的言語では、整列スコアALSCOREは、受 け取られたチャンクでの全ワードペアのペアスコアALSCOREの″幾何学的意味″ を有する。テキストのチャンクペアに対する整列スコアALSCOREは、2つのチャ ンク間の全ての可能なワードペアのペアスコアを結合する″可能性″見積もりで ある。幾何学的手段がステップ808でとられるので、値ALSCOREはペアスコア と同様な方法で正規化される。そのため、ワード頻度と統計データベース210 に記録されたワードペア頻度に基づいて、ステップ800で受け取った2つのチ ャンクが唯一対応しそうであることが個々のワード確率から期待できることを、 単位元の値ALSCOREは示す。他方、単位元よりおおきな整列スコアは、ランダム 確率と観測されたワード頻度だけによって示唆されるよりもっと2つのチャック のワード間には、平均してある程度の相関があるということを示唆する。 積Sは、大きな値になるかもしれず、多くの乗算と除算の計算は一般に自動処 理装置ではやっかいである。ステップ808での幾何学的平均計算が、ペアスコ アの対数(logarithms)の算術平均を計算することによって実行されることは、実 際上有利な点となる。対数は、結果として乗算と除算を行うために加算と減算で できる。SのN乗根の対数を得るために、Sの対数はNで除算されることができ る。 頻度テーブルと統計データベース210のカウント値がソースの言語資料20 0、202とそれらの間で示された整列から得られる一方、ステップ700で受 け取ったワードペアとステップ800で受け取ったチャンクペアが整列された言 語資料自身から得られるか、整列が評価されているテキストペアから得られるこ とに注目してほしい。従って、例えば、受け取ったチャンクCHUNKEは、受け取っ たCHUNKFを翻訳する人間翻訳者による結果であるかもしれないし、また、整列ス コアALSCOREの手段によって、存在する整列された言語資料CORPE CORPFの統計デ ータベースと比較された結果であるかもしれない。1より大きな値は、人間翻 訳者が存在する整列した言語資料と大まかに一致することを示す。他方、単位元 より非常に小さいスコアは、例えば、言語資料の整列でのエラーや、人間翻訳の エラーや、存在するデータベース内と翻訳者の頭の中で検討されている主題の2 つの分野での単純な違いのために不一致を示す。評価モジュール212と後述の 例が示す図6、図7、図8の技術に対する多くのアプリケーションがある。 図9は、存在するデータベース、即ち、整列された言語資料206と統計デー タベース210を改良する、即ち、″フィルターをかける″ために、評価モジュ ール212を用いる方法を示す。そのようなプロセスは、フィードバックの形態 を有し、ブロークアロー(Broken arrows)230と図2の232によって示され る。ステップ900では、閾値が整列スコア値との比較のためにセットされる。 閾値を選択する多くの可能な方法あり、以下に示される。本説明では、単位元に 対する閾値を単純にセットすることで十分であるが、一般に、最適な閾値は実際 のデータに依存する。英語の言語資料での各チャンクCORPE[I]に対して、フラン ス語の言語資料に整列されたチャンクCORPF[I]があると、プロセスはループ90 2を次に実行する。ループ902の範囲内では、ステップ904では整列された チャンクCORPF[I]をリードする。そして、ステップ906では、整列スコアALSC ORE(CORPE[I],CORPF[I])は、現在のチャンクペアに対する図8のプロシージャを 用いて評価される。 ステップ908では、この整列スコアはステップ900でセットされた閾値と 比較される。もし、整列スコアが閾値を越えるなら、制御は912に進み、ルー プ902はIの次の値で、即ち、整列された言語資料206での整列された次の チャンクペアに対して実行される。もし、ステップ908で、整列スコアが閾値 より低いならば、制御はステップ910へ進み、配列された現在のチャンクペア は、整列された言語資料から削除されるか、あるいは、少なくとも後に削除され る候補としてマークが付けられる。この後者のオプションは、特定のインプリメ ンテーションでは便利であり、また、最終的に決定がなされる前に人間翻訳者と の対話を許容する。 ステップ910が処理された後、制御は再び点912へ進む。ここでは、Iは インクリメントされ、次の整列されたチャンクペアのために、ループ902が実 行される。整列された言語資料206での全ての整列されたチャンクが、ループ 902で検討されると、制御はステップ914へ進み、ステップ910で実行さ れた(なら)削除を考慮にいれて統計データベース210が更新される。 図9の方法を、データベース上で何回でも繰り返し、徐々に、不正確に整列さ れたあるチャンクに存在する″ノイズ″をフィルタして消し去ることができるこ とに注目されたい。ノイズソースはたくさんあるが、これらは一般的に、整列さ れた言語資料206を生成するモジュール204にインプリメントされた自動化 プロセスが処理する言語知識を有せず、また、整列するテキストのチャンクを選 択するときに、シンタックスとセマンテックスに無関心であることの結果である 。また、適切に整列されたチャンクに対して、オリジナルの翻訳はいつも文字ど うりの翻訳とは限らず、短文でさえ特定言語への幾つかの翻訳方法が存在するこ とがある。 例えば、写真式複写機やファクシミリのような電子装置の動作マニュアルから 得られた言語資料の場合、例えば、しばしば、全く対応しないテキスト部がある 。何故なら、異なる国々での法的要件は、異なる安全メッセージが用意されるこ とを要求するからである。他のノイズのコモンソースは、各言語資料の一部がア ルファベット順に並べられたリスト項目を有するところにある。項目数とそれら の一般的な外観が、整列モジュール204にとって区別可能でないとしても、こ れらの項目順は2つの異なる言語で同じではない。 しかしながら、もし、これらの問題が相対的にソースドキュメントの小部分に 制限されるなら、統計データベースは役に立ち、評価モジュール212によって 生成された整列スコアは、首尾良く問題領域を突き止めると考えられる。 整列された言語資料をフィルター処理するのとは別に、図10に示されるよう な整列された言語資料を用いて、新しいテキストの翻訳中にチャンクペアに対す る整列スコアをつかうことができる。 図10では、翻訳モジュール214によって英語からフランス語に翻訳される 新しいテキストETEXT(216,図2)が、ステップ1000で受け取られる。英語 テキストの第1のチャンクECHUNKは、ステップ1002で識別される。そして、 ステップ1004で、存在する整列された英語の言語資料CORPEが、このチャン クの存在を見いだすために探索される。もし、ある値Iに対して、英語の整列さ れた言語資料のチャンクが受け取ったチャンクECHUNKに等しいなら、制御はステ ップ1006に進み、フランス語の言語資料の対応するチャンクCORPF[I]がリー ドされる。ステップ1010では、このチャンクは所望のフランス語翻訳(テキ スト218を出力する)の対応するチャンクFCHUNKとしてセーブされる。 もし、ステップ1004でのサーチで、現在のチャンクECHUNKと等しいものが 発見されなかったら、制御はユーザ対話ステップ1008へ進む。ここでは、人 間翻訳者は、英語のチャンクECHUNKの翻訳をおこなうことが要求される。その翻 訳は、ステップ1010で翻訳FCHUNKとしてセーブされる。ステップ1012で は、次の英語の言語チャンクが受け取ったテキストETEXTで識別され、制御はサ ーチステップ1004へ戻る。全入力テキストETEXTが翻訳されると、ステップ 1010でセーブされた全チャンクFCHUNKの連接が、ステップ1014で翻訳さ れたフランス語の言語テキストFTEXTとして出力される。 なじみの薄い英語の言語チャンクCHUNKEとユーザに提供されたフランス語翻訳 を整列された言語資料206に加えることによって、ステップ1008でユーザ によって提供された翻訳をまた、存在するデータベースを拡張するために使うこ とができることに注目されたい。そのような処理は、例えば、米国特許5140 522に記述されている。統計データベース210をまた、このステージで更新 することができる。図10の方法の実行中にユーザ対話″live″を実行する別の 方法として、出力ファイルFTEXTが単純に人間翻訳者にたいして最新の日に検討 するように要求することを含むことにまた注目されたい。さらに、翻訳されたチ ャンクFCHUNKをセーブするステップ1010では、これが本当に確からしい翻訳 であるかをベリファイするために、例えば、チャンクECHUNKとFCHUNKに対する整 列スコアを評価するステップを含む。整列スコアが所定の閾値以下になると、ユ ーザ対話を″ライブにする(live)″かまたは、適切な質問を出力ファイルFTEXT に入力することによって、入力することができる。これは、図9のフィルター処 理で取り除かれなかったエラーの整列を訂正する役目をはたす。 当業の読者は、上述の実施例の多くの変形と多くの他の分析アプリケーション と本開示で示唆された評価装置を同一視できるであろう。 大きなデータベース(特に、チャンクが相対的に多くのワードを含む)の場合 に適当な1つの変形は、全ての可能性のあるワードペアより少なく検討すること によって、処理努力を制限する。これは、多くの方法で行うことができるが、単 純なステップでは、図6のフローチャートの最内ループ606でのKの範囲を制 限することになるため、例えば、ある整数dに対しKはJ-dからJ+dに変化す る。 そして、現在の英語のワードCORPE[I][K]とのペアとして、フランス語のチャ ンクの全てのワードをカウントする代わりに、ワードCORPF[I][K]の制限された ″window″だけが検討されてカウントされる。現在の英語のワードインデックス Jが、外部ループ604の各繰り返しによって進むと、フランス語のワードの″ window″は、その繰り返しと共に進む。勿論、このインプリメンテーションは、 通常文でのワード順が同様な規則に従う言語ペアに対して最適である。整列され た部分でのワード数が非常に異なる言語にとって、そのwindow(K値の範囲で) を、適当な割合で進むようにアレンジすることができるため、Kの最大値に関す るその位置が、Jの最大値に関するJ値におおよそ一致する。 考えられるペア数を減らす別の技術では、″the″や″and″等のような非常に ありふれたワードを無視する。頻度の少ないワードは、より大きな情報負荷を持 つと見なされる。一例として、英語文:″The man killed a big dog″を、″ma n killed big dog″に意味をほとんど損なうことなく削減することができる。 図6のフローチャートでこの変形をインプリメントするために、ワードペア頻 度テーブル(PAIRFREQ、ステップ602、604、606)の前に、2つの言語 資料(ステップ602、608、610)に対するワード頻度テーブル(FREQE,F REQF)を生成することは便利である。そして、これらのテーブルを、ペア頻度テ ーブルの生成で無視されるべき最もありふれたワードをみつけるために使うこと ができる。別の方法では、同じ言語資料かまたは、一般的に関連する言語にたい して先在するワード頻度テーブルが利用可能である。 必要ならば、これら(と他の)変形の両方を結合することもできる。対応する 技術を図8の内部ループ806にインプリメントすることができ、テキストチャ ンクペアに対する整列スコアを獲得するためのワードペアスコアを結合する努力 を減らすことができる。 この記述は、2つの相対的に小さく整列された言語資料と上述のシステムで実 行されたような評価の実例である付録AからGの部分を検討することによって結 論づけられる。付録の言語資料は、ファクシミリ装置の動作マニュアルの内容リ スト、即ち、英語での第1の内容とドイツ語での第2の内容を備える。これらの 言語資料は、それぞれ付録AとBで提供されている。ここで、行番号1から30 は、その2つの言語資料での整列されたチャンクペア1から30を示す。不正な 整列が行30に与えられており、その行の″sending documents″はドイツ語句 ″problemen oplossen″の英語翻訳ではない。一般的にこのケースでは、整列さ れた言語資料は、どこか他のところに、ワード″problemen″と″oplossen″、 即ち″troubleshooting″(チャンクペア23と27)を有するチャンクの正し い整列を含む。 付録Cでは、英語の言語資料に対するワード頻度が与えられる。例えば、7回 のワード″sending″の出現と、1回のワード″confidential″の出現があるこ とがわかる。英語の言語資料のワード総数は118である。このように、例えば 、英語の言語資料のワード″sending″の発生確率は、7を118で割ったもの であり、0.059322となる。 付録Dでは、ドイツ語の言語資料に対するワード頻度テーブルが与えられる。 ドイツ語の言語資料では、合計が106ワードである。従って、例えば、106 ワード中での頻度が4のワード″problemen″は、観測確率0.037736を 有する。一例のシステムにおいては、統計データベースはケースセンシテイブ(c ase-sensitive)ではないことにも注目してほしい。即ち、言語資料のチャンク2 3の″problemen″とチャンク6の″problemen″の間には差異がない。 付録E−1からE−4では、整列された言語資料に対するワードペア頻度テー ブルが与えられ、ここでは合計427のユニークなワードペアがある。全ワード ペア頻度の合計は510である。言語資料がより大きな語集を使うケース、その ケースは普通であろうが、現在のワードペア数は劇的にエスカレートすることに 注目してほしい。 付録Dのワードペア頻度テーブルは、例えば4つのチャンクペアを有し、ここ では、英語のチャンクがワード″part″を備え、他方、対応するドイツ語のチャ ンクがワード″en″を備えることを示す。2つの言語資料(付録AとB)の素早 い検 査は、このワードペアが整列したチャンク2、3、5、6に存在することを示す 。しかしながら、データベースがワード″part″と″en″が互いに翻訳であるこ とを表現していないことに注目してほしい。たまたま、両方のワードがそれぞれ の言語資料で共通であるため、両方のワードの道理にかなった確率が、チャンク ペアで純粋にランダムに発生する。 付録F−1からF−4では、2つのワード間での相関を見積もるワードペアス コアが言語資料の例での427個の異なったワードペアに対して計算され、示さ れる。付録Dでは、それらのペアがペア頻度順に並べられるが、付録Eではペア スコアの降順に並べられる。頻度テーブルと比較して、互いに実際的な翻訳であ るワードに対して高スコアを達成する傾向が非常に大きいことに注目できる。そ のスコアは、24.525490から0.383211に至る範囲がある。しか しながら、ワード毎の翻訳精度をベリファイするために、付録Aからの個々のワ ードペアスコアを使う可能性はない。 対照的に、付録G−1とG−2では整列されたチャンクが別々に各チャンクに 対する整列スコアと共に与えられる。これらのチャンク整列スコアは、図8の方 法で、各チャンクペアでの全ワードペアに対するペアスコアを蓄積することによ って獲得される。チャンク1は、10.071629のスコアを有する。このス コアは、全データベースの統計と比較して、2つの整列されたチャンクペアが互 いの翻訳として本当に役に立ちそうであることを示す。最後の1つを除く整列さ れたチャンクペアの全てが1を越える良いスコアを有することに注目してほしい 。他方、読者にエラーとして知られているチャンクペア番号30は、たった0. 819339のスコアである。このように、少なくとも1つの不正に整列された チャンクペアを備えるこの非常に小さいデータベースからでさえ、ここで提供さ れる評価技術とその装置は、不正翻訳を明確に示す。 図11は、言語資料の一例の30個のチャンクに対する整列スコアの分布を示 すグラフ状のヒストグラムである。垂直軸は頻度をプロットし、便宜上、水平軸 は整列スコアの対数(ベースが2)をプロットする。例えば、整列スコア(水平 軸)の対数の3から4の範囲は、整列スコア自身の8から16の範囲に対応する 。垂直波線1100は、整列スコアの対数の閾値0を示し、上述の整列スコア自 身 の単一元値の閾値に対応する(logl=0)。閾値線1100の右に向かって、頻度分 布の主部が小さいピーク1102から閾値の左まで明瞭に分離されており、チャ ンクペア番号30の低整列スコアを区画する。 当業者は、統計データベースの内容に依存して、他の閾値が望まれるか必要で あるかもしれないことを理解するであろう。多くのケースでは、本例のように、 整列された言語資料での整列スコアの分布の主部と不正な整列による2次的な分 布間を差別化することが可能である。本例のように、これらの2つの母集団が明 確に分離される場合には、閾値をそれら2つの間に設定することは簡単なことで ある。 他のケースでは、例えば、最も可能性のない5%の整列はリジェクトされるべ きであるということに決めることによって、閾値を設定するためのより微妙なア プローチが必要になるかもしれない。そして、整列スコア閾値をそれに対応して 設定できる。あるいは、最も悪い5%の整列を削除する処理によって整列スコア 閾値を暗黙に設定するかもしれない。 あるケースでは、厳密な閾値を全く設定せず、どの整列が正しいかを決めるた めに人間翻訳者との対話を利用することが望まれるかもしれない。そして、その システムは、整列されたチャンクペアを、最低の整列スコアを有するチャンクか ら開始する人間翻訳者に与えることによって、動作するかもしれない。通常、与 えられた第1のペアは、エラーとして容易にリジェクトされる。そして、与えら れたチャンクに対する整列スコアがより高い値になると、人間翻訳者は、正しい が相対的に低い整列スコア(例えば、付録Gの例のペア番号2)を有するペアを 受け取り始める。 その処理ではさらに、ユーザに与えられる大多数のペアが正しく、そして、シ ステム設計者や操作者にとって、カットオフ(cut-off)がなされて残っている整 列が正しいと考えられるのがどの点であるかを選択するのが問題となる。どんな 場合でも、人間翻訳者によってベリファイされる必要のあるデータベース部分は 、本発明を利用することによって、小さく管理しやすい小部分に削減される。他 方、全デ−タベースをベリファイすることは、非実践的で高価となったり多大な 時間を消費することになる。 残っているエラーを削除するために、操作者に2、3のエラーに対するサーチ でもっと多くのペアをベリファイするよう強制するよりは、修正された言語資料 と更新された統計データベースを用いる他の繰り返しによる方法は、より効果的 であるかもしれない。また、2、3のエラーが取り除かれて、統計データベース が更新された後、正しいがはじめは低くスコアされたペアに対する整列スコアは 、連続した繰り返しで改善されるかもしれない。何故なら、ここで、統計データ ベース自身は、ノイズのほとんどないデータベースの産物であるからである。従 って、第2の繰り返しで、人間翻訳者が実際正しく整列されたペアを与えられる ことはほとんどなさそうである。 また、上述のインプリメンテーションでの多くの変形は、本技術に精通してい る人の能力と想像力と一致するものである。例えば、ワードペアスコアを得るた めの図6と図7で具体化した方法とは別の方法として、EP-A-0499366で使われた ような方法が同様な効果を得るために使われるかもしれない。ワードペアスコア を得るために使われた的確な方法に依存して、整列された文に対するスコアを得 るためにワードペアスコアを結合する方法、例えば、対数に関して上述したよう な方法を採用する必要があるかもしれない。同様に、様々な文献で記述されてい るように、統計や形態論的知識に基づいて、共通の″幹(stem)″を有するワード を同一視する前処理技術も使うことができる。上記例はイラストレーションの方 法だけで提供されたものである。
───────────────────────────────────────────────────── フロントページの続き (72)発明者 オダナヒュー,ティモシー フランシス イギリス国 スレイ ジーユー2 5エム ディー ギルフォード チェストナッツ アベニュー ザ ゲイトウェイ(番地な し)

Claims (1)

  1. 【特許請求の範囲】 1. 第1と第2の整列された言語資料(テキスト情報の本体)を有するデータ べースを前記装置に格納する工程と、 ここで、前記言語資料の各々は、少なくとも前記第1の言語資料のサブセット 部分が、前記第2の言語資料の各部分に対応する関係によって一致させるように 部分に分割され、前記各部分はさらに1つかそれ以上の要素部分(″ワード″) に分割されており、 統計データベースを得るために整列された言語資料を分析する工程を備え、 さらに、 前記統計データベースを用いて、整列された言語資料から選択された整列され た部分に対する相関度を評価する工程と、 可能性のない整列おいて整列された部分の相関度から識別する工程と、 少なくとも最も可能性のない整列を取り除くために前記整列された言語資料を 修正することによって、前記識別された不正整列を訂正する工程とを備えること を特徴とするバイリンガルデータベースを処理する処理装置の動作方法。 2. 前記統計データベースを前記整列された言語資料の修正に対応して更新す る工程をさらに備えることを特徴とする請求項1に記載のバイリンガルデータベ ースを処理する処理装置の動作方法。 3.請求項2による方法によって前記整列された言語資料を修正し、 前記更新された統計データベースを用いて修正された言語資料を再び修正する ために前記方法を少なくとも1度繰り返す工程を備えることを特徴とするバイリ ンガルデータベースの処理方法。 4. 前記修正工程は、前記一致した可能正のない整列が不正であることを検証 するための人間翻訳者との対話を含むことを特徴とする請求項1、2、3のいず れか1つに記載の方法。 5. 追加の整列されたテキスト部分ペアを受け取り、 前記受け取った部分を含むために前記整列された言語資料と統計データベース を増やす工程をさらに備えることを特徴とする先行する請求項のいずれか一つに 記載の方法。 6. 前記相関度は、各追加の部分ペアに対して評価され、前記評価結果によっ て条件付きで、前記整列された言語資料が増やされることを特徴とする請求項5 に記載の方法。 7. 前記評価工程は、前記統計データベースを用いて、各言語資料から1つが 選択されたワードペアに対する観測された相関度を獲得し、 前記部分ペアに含まれる前記獲得されたワードペアの相関度の結合によって、 前記部分相関度を評価する工程をさらに備えることを特徴とする先行する請求項 のいずれか一つに記載の方法。 8. 前記ワードペア相関度は、前記ペアのどちらかのワードが実際に他方の翻 訳である確率を得ないで獲得されることを特徴とする請求項7に記載の方法。 9. 前記ワードペアの相関度の結合は、前記ワードペアの位置にかかわらず、 前記ワードペアのそれぞれの部分内で実行されることを特徴とする請求項7、8 のいずれか一方に記載の方法。 10. 前記ワードペアの相関度の結合は、それらのそれぞれのテキスト部分で おおよそ対応する位置に存在するワードペアに限られることを特徴とする請求項 7、8のいずれか一方に記載の方法。 11. 前記ワードペアの相関度の結合のために、ある共通ワードが識別されて 無視されることを特徴とする請求項7、8、9、10のいずれかに記載の方法。 12. 前記ワードペア相関度を獲得する工程は、 ペアの各ワードに対して、そのそれぞれの言語資料からワードを見つける観測 確率の大きさを獲得し、 各選択されたワードペアに対して、前記言語資料の整列された部分の中からワ ードペアを見つける観測確率の大きさを獲得し、 前記ワードペア間の前記相関度を獲得するために前記ペア確率と前記個々のワ ード確率とを結合する工程を備えることを特徴とする請求項7から11のいずれ かに記載の方法。 13. 前記統計データベースは、各言語資料に対するワード頻度テーブルと、 前記言語資料の整列された部分内で所定のワードペアが存在する回数をカウント するための前記整列された言語資料全体に対するワードペア頻度テーブルとを備 えることを特徴とする先行する請求項のいずれか一つに記載の方法。 14. 前記ワードペア頻度は、各テキスト部分ペアの全ワードペアに対して、 各部分内のワード位置に無関係にカウントされることを特徴とする請求項13に 記載の方法。 15. 前記ワードペアのカウントは、前記言語資料の前記ワードペアの整列さ れた部分の各々の中で、おおよそ対応する位置に存在するワードペアに制限され ることを特徴とする請求項13に記載の方法。 16. ワードペアをカウントするために、ある共通ワードが識別されて無視さ れることを特徴とする請求項13、14、15のいずれか1つに記載の方法。 17. ソース言語からターゲット言語へのソーステキスト自動翻訳処理装置の 実行方法であって、 前記ソースとターゲット言語での整列された言語資料を有するバイリンガルデ ータベースを前記装置に格納する工程と、 請求項1から16までのいずれか1つに記載された方法で、前記整列された言 語資料を修正する工程と、 前記ソーステキストを部分に分割する工程と、 前記ソース言語での前記整列された言語資料を探索して、前記ソーステキスト 部分に一致する部分をみつける工程と、 (i)一致が検出されるソーステキスト部分に対する前記ターゲット言語の言語 資料の対応部分を出力する工程と、 (ii)一致が検出されない部分に対して、翻訳がなされなかったことを示す問い 合わせメッセージを出力する工程とを備えることを特徴とする自動翻訳処理装置 の実行方法。 18. バイリンガルデータベースを処理する処理装置の実行方法であって、 第1と第2の整列された言語資料(テキスト情報本体)を有するデータベース を前記装置に格納する工程と、 ここで、前記言語資料の各々は、前記第1の言語資料の部分の少なくともサブ セットが、前記第2の言語資料での各部分との対応関係によって識別されるよう な部分に分割され、 前記部分の各々は、1つかそれ以上の要素部分(″ワード″)にさらに分割さ れ、 統計データベースを獲得するために前記整列された言語資料を分析する工程と 、 前記統計データベースを利用して、各言語資料から1つ選択されたワードペア に対する観測相関度を獲得する工程とを備え、 さらに、前記部分ペアに含まれる前記獲得されたワードペアの相関度の結合に よって、所定のテキスト部分ペア(2つの自然言語の各々での1つ)に対する前 記部分の相関度を評価する工程を備えることを特徴とする処理装置の実行方法。 19. 前記ワードペアの相関度は、ペアのどちらかのワードが実際に他方の翻 訳である確率を得ることなしに獲得されることを特徴とする請求項18に記載の 処理装置の実行方法。 20. 前記獲得されたワードペアの相関度の結合は、それらの各部分でペアの ワード位置とは無関係に実行されることを特徴とする請求項18か19のどちら か1つに記載の処理装置の実行方法。 21. 前記ワードペアの相関度の結合は、それらの各テキスト部でおおよそ対 応する位置に存在するワードペアに制限されることを特徴とする請求項18か1 9のどちらか1つに記載の処理装置の実行方法。 22. 前記ワードペアの相関度の結合のために、ある共通ワードが識別され無 視されることを特徴とする請求項18から21のいずれか1つに記載の処理装置 の実行方法。 23. 前記ワードペアの相関度を獲得する工程は、 ペアの各ワードに対して、その言語資料の各々内でそのワードを見つける観測 確率の大きさを獲得する工程と、 ワードの選択されたペアの各々に対して、その言語資料の各々内でそのワード を見つける観測確率の大きさを獲得する工程と、 前記ペア確率と前記各々のワード確率を結合して、前記ペアのワード間の相関 度を獲得する工程とを備えることを特徴とする請求項18から22のいずれか1 つに記載の処理装置の実行方法。 24. 前記統計データベースは、 各言語資料に対するワード頻度テーブルと、所定のワードペア(各言語資料から 1つ)が前記言語資料の整列された部分で発生する回数をカウントするための前 記整列された言語資料全体に対するワードペア頻度テーブルとを備えることを特 徴とする請求項18から23のいずれか1つに記載の処理装置の実行方法。 25. 前記ワードペア頻度は、各部分内の前記ワード位置に無関係に、各テキ スト部ペアの全ワードペアに対してカウントされることを特徴とする請求項24 に記載の処理装置の実行方法。 26. 前記ワードペアのカウントは、前記言語資料のそれらの整列された部分 の各々におおよそ対応する位置に存在するワードペアに制限されることを特徴と する請求項24に記載の処理装置の実行方法。 27. 前記ワードペアのカウントに対して、ある共通ワードが識別され無視さ れることを特徴とする請求項24、25、26に記載の処理装置の実行方法。 28. ソース言語からターゲット言語へソーステキストの自動翻訳を行う処理 装置の実行方法であって、 前記ソース言語とターゲット言語での整列された言語資料を有するバイリンガ ルデータベースを前記装置に格納する工程と、 前記ソーステキストを部分に分割する工程と、 候補となるターゲット言語部分の構成の中から各ソーステキスト部分の翻訳候 補を獲得する工程と、 請求項18から27に記載のいずれか1つの方法によって、前記ソース言語の 部分と前記ターゲット言語の部分とに対する相関度を評価することによって、前 記翻訳を検証する工程と、 ターゲットテキストの内容として前記検証された候補部分を出力する工程と を備えることを特徴とする処理装置の実行方法。 29. 前記検証する工程は、閾値を候補部分の前記相関度に適用することを特 徴とする請求項28に記載の処理装置の実行方法。 30. 前記検証する工程は、検証された翻訳が前記ソース言語部分に対して作 られてはいないことを示す問い合わせメッセージを出力する工程をさらに備える ことを特徴とする請求項28か29のいずれか1つに記載の処理装置の実行方法 。 31. 前記翻訳された部分と前記問い合わせメッセージ(もし、あれば)は、 他手段による処理完結のために、1つの単独の出力テキストとして共に連接され 出力されることを特徴とする請求項17、28、29、30のいずれか1つに記 載の処理装置の実行方法。 32. 先行する全ての請求項のいずれか1つに記載の方法の各工程をインプリ メントする手段を備えることを特徴とする処理装置。 33. 請求項1から16のいづれか1つに記載の動作を行う処理装置によって 修正されるバイリンガルデータベースを格納することを特徴とする記憶装置。 34. 請求項32に記載の装置を備えることを特徴とする自動翻訳システム。 35. 請求項1から16のいづれか1つに記載の動作を行う処理装置によって 修正されるデータベースを格納することを特徴とする自動翻訳システム。
JP7502560A 1993-06-18 1994-06-17 バイリンガルデータベース処理方法とその装置 Pending JPH08500691A (ja)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
GB9312598.7 1993-06-18
GB9312598A GB2279164A (en) 1993-06-18 1993-06-18 Processing a bilingual database.
PCT/GB1994/001321 WO1995000912A1 (en) 1993-06-18 1994-06-17 Methods and apparatuses for processing a bilingual database

Publications (1)

Publication Number Publication Date
JPH08500691A true JPH08500691A (ja) 1996-01-23

Family

ID=10737376

Family Applications (1)

Application Number Title Priority Date Filing Date
JP7502560A Pending JPH08500691A (ja) 1993-06-18 1994-06-17 バイリンガルデータベース処理方法とその装置

Country Status (7)

Country Link
US (1) US5867811A (ja)
EP (1) EP0804767B1 (ja)
JP (1) JPH08500691A (ja)
CN (1) CN1110757C (ja)
DE (1) DE69429881T2 (ja)
GB (1) GB2279164A (ja)
WO (1) WO1995000912A1 (ja)

Families Citing this family (139)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE19636739C1 (de) * 1996-09-10 1997-07-03 Siemens Ag Verfahren zur Mehrsprachenverwendung eines hidden Markov Lautmodelles in einem Spracherkennungssystem
US6085162A (en) * 1996-10-18 2000-07-04 Gedanken Corporation Translation system and method in which words are translated by a specialized dictionary and then a general dictionary
EP0932897B1 (en) * 1997-06-26 2003-10-08 Koninklijke Philips Electronics N.V. A machine-organized method and a device for translating a word-organized source text into a word-organized target text
DE69837979T2 (de) * 1997-06-27 2008-03-06 International Business Machines Corp. System zum Extrahieren einer mehrsprachigen Terminologie
US7574649B1 (en) * 1997-08-14 2009-08-11 Keeboo Sarl Book metaphor for modifying and enforcing sequential navigation of documents
US6782510B1 (en) * 1998-01-27 2004-08-24 John N. Gross Word checking tool for controlling the language content in documents using dictionaries with modifyable status fields
US6195631B1 (en) * 1998-04-15 2001-02-27 At&T Corporation Method and apparatus for automatic construction of hierarchical transduction models for language translation
US6345243B1 (en) * 1998-05-27 2002-02-05 Lionbridge Technologies, Inc. System, method, and product for dynamically propagating translations in a translation-memory system
US6345244B1 (en) * 1998-05-27 2002-02-05 Lionbridge Technologies, Inc. System, method, and product for dynamically aligning translations in a translation-memory system
US7447626B2 (en) * 1998-09-28 2008-11-04 Udico Holdings Method and apparatus for generating a language independent document abstract
US6535842B1 (en) * 1998-12-10 2003-03-18 Global Information Research And Technologies, Llc Automatic bilingual translation memory system
JP3055545B1 (ja) * 1999-01-19 2000-06-26 富士ゼロックス株式会社 関連文検索装置
US6278969B1 (en) * 1999-08-18 2001-08-21 International Business Machines Corp. Method and system for improving machine translation accuracy using translation memory
US6393389B1 (en) * 1999-09-23 2002-05-21 Xerox Corporation Using ranked translation choices to obtain sequences indicating meaning of multi-token expressions
US6473729B1 (en) * 1999-12-20 2002-10-29 Xerox Corporation Word phrase translation using a phrase index
US6604101B1 (en) * 2000-06-28 2003-08-05 Qnaturally Systems, Inc. Method and system for translingual translation of query and search and retrieval of multilingual information on a computer network
US20020046018A1 (en) * 2000-05-11 2002-04-18 Daniel Marcu Discourse parsing and summarization
US6519557B1 (en) * 2000-06-06 2003-02-11 International Business Machines Corporation Software and method for recognizing similarity of documents written in different languages based on a quantitative measure of similarity
US7155517B1 (en) 2000-09-28 2006-12-26 Nokia Corporation System and method for communicating reference information via a wireless terminal
US6782356B1 (en) * 2000-10-03 2004-08-24 Hewlett-Packard Development Company, L.P. Hierarchical language chunking translation table
US20020069049A1 (en) * 2000-12-06 2002-06-06 Turner Geoffrey L. Dynamic determination of language-specific data output
US6996518B2 (en) * 2001-01-03 2006-02-07 International Business Machines Corporation Method and apparatus for automated measurement of quality for machine translation
US7860706B2 (en) 2001-03-16 2010-12-28 Eli Abir Knowledge system method and appparatus
US7483828B2 (en) * 2001-03-16 2009-01-27 Meaningful Machines, L.L.C. Multilingual database creation system and method
US7711547B2 (en) * 2001-03-16 2010-05-04 Meaningful Machines, L.L.C. Word association method and apparatus
US20030135357A1 (en) * 2001-03-16 2003-07-17 Eli Abir Multilingual database creation system and method
US20030093261A1 (en) * 2001-03-16 2003-05-15 Eli Abir Multilingual database creation system and method
US8744835B2 (en) * 2001-03-16 2014-06-03 Meaningful Machines Llc Content conversion method and apparatus
US20030083860A1 (en) * 2001-03-16 2003-05-01 Eli Abir Content conversion method and apparatus
US8874431B2 (en) * 2001-03-16 2014-10-28 Meaningful Machines Llc Knowledge system method and apparatus
JP4574047B2 (ja) * 2001-03-30 2010-11-04 富士通株式会社 訳例辞書を用いて翻訳を行う機械翻訳装置およびプログラム
US7177792B2 (en) * 2001-05-31 2007-02-13 University Of Southern California Integer programming decoder for machine translation
US7191115B2 (en) * 2001-06-20 2007-03-13 Microsoft Corporation Statistical method and apparatus for learning translation relationships among words
EP1271341A3 (en) * 2001-06-30 2005-11-30 Unilever N.V. System for analysing textual data
WO2003005166A2 (en) 2001-07-03 2003-01-16 University Of Southern California A syntax-based statistical translation model
US7361881B2 (en) * 2002-03-13 2008-04-22 Oy Ajat Ltd Ganged detector pixel, photon/pulse counting radiation imaging device
AU2003269808A1 (en) * 2002-03-26 2004-01-06 University Of Southern California Constructing a translation lexicon from comparable, non-parallel corpora
ES2343786T3 (es) * 2002-03-27 2010-08-10 University Of Southern California Modelo de probabilidad de union basado en frases para traduccion automatica estadistica.
US7031911B2 (en) * 2002-06-28 2006-04-18 Microsoft Corporation System and method for automatic detection of collocation mistakes in documents
US7181451B2 (en) * 2002-07-03 2007-02-20 Word Data Corp. Processing input text to generate the selectivity value of a word or word group in a library of texts in a field is related to the frequency of occurrence of that word or word group in library
US20040006547A1 (en) * 2002-07-03 2004-01-08 Dehlinger Peter J. Text-processing database
WO2004006134A1 (en) * 2002-07-03 2004-01-15 Iotapi.Com, Inc. Text-processing code, system and method
US7016895B2 (en) 2002-07-05 2006-03-21 Word Data Corp. Text-classification system and method
US7003516B2 (en) * 2002-07-03 2006-02-21 Word Data Corp. Text representation and method
US7386442B2 (en) * 2002-07-03 2008-06-10 Word Data Corp. Code, system and method for representing a natural-language text in a form suitable for text manipulation
US7024408B2 (en) 2002-07-03 2006-04-04 Word Data Corp. Text-classification code, system and method
US20040006459A1 (en) * 2002-07-05 2004-01-08 Dehlinger Peter J. Text-searching system and method
US20040054520A1 (en) * 2002-07-05 2004-03-18 Dehlinger Peter J. Text-searching code, system and method
US7194455B2 (en) * 2002-09-19 2007-03-20 Microsoft Corporation Method and system for retrieving confirming sentences
US7293015B2 (en) * 2002-09-19 2007-11-06 Microsoft Corporation Method and system for detecting user intentions in retrieval of hint sentences
CN100380373C (zh) * 2002-10-29 2008-04-09 埃里·阿博 知识系统方法和装置
US7249012B2 (en) * 2002-11-20 2007-07-24 Microsoft Corporation Statistical method and apparatus for learning translation relationships among phrases
KR100652007B1 (ko) * 2002-12-18 2006-12-01 가부시키가이샤 리코 번역 지원 시스템 및 그 프로그램
US7356457B2 (en) * 2003-02-28 2008-04-08 Microsoft Corporation Machine translation using learned word associations without referring to a multi-lingual human authored dictionary of content words
US7283949B2 (en) * 2003-04-04 2007-10-16 International Business Machines Corporation System, method and program product for bidirectional text translation
US20040243391A1 (en) * 2003-05-28 2004-12-02 Nelson David D. Apparatus, system, and method for multilingual regulation management
US20100070265A1 (en) * 2003-05-28 2010-03-18 Nelson David D Apparatus, system, and method for multilingual regulation management
WO2004107203A1 (ja) * 2003-05-30 2004-12-09 Fujitsu Limited 対訳文対応付け装置
JP2004362249A (ja) * 2003-06-04 2004-12-24 Advanced Telecommunication Research Institute International 翻訳知識最適化装置、翻訳知識最適化のためのコンピュータプログラム、コンピュータ及び記憶媒体
US7734627B1 (en) 2003-06-17 2010-06-08 Google Inc. Document similarity detection
US7383542B2 (en) * 2003-06-20 2008-06-03 Microsoft Corporation Adaptive machine translation service
AU2004202391A1 (en) * 2003-06-20 2005-01-13 Microsoft Corporation Adaptive machine translation
US7711545B2 (en) * 2003-07-02 2010-05-04 Language Weaver, Inc. Empirical methods for splitting compound words with application to machine translation
US8548794B2 (en) * 2003-07-02 2013-10-01 University Of Southern California Statistical noun phrase translation
JP3790825B2 (ja) * 2004-01-30 2006-06-28 独立行政法人情報通信研究機構 他言語のテキスト生成装置
US7287027B2 (en) * 2004-03-01 2007-10-23 Sap Ag System and method for entering a default field value through statistical defaulting
WO2005089340A2 (en) * 2004-03-15 2005-09-29 University Of Southern California Training tree transducers
US8296127B2 (en) * 2004-03-23 2012-10-23 University Of Southern California Discovery of parallel text portions in comparable collections of corpora and training using comparable texts
US20050216253A1 (en) * 2004-03-25 2005-09-29 Microsoft Corporation System and method for reverse transliteration using statistical alignment
US8666725B2 (en) * 2004-04-16 2014-03-04 University Of Southern California Selection and use of nonstatistical translation components in a statistical machine translation framework
US20060047656A1 (en) * 2004-09-01 2006-03-02 Dehlinger Peter J Code, system, and method for retrieving text material from a library of documents
DE112005002534T5 (de) * 2004-10-12 2007-11-08 University Of Southern California, Los Angeles Training für eine Text-Text-Anwendung, die eine Zeichenketten-Baum-Umwandlung zum Training und Decodieren verwendet
US7774192B2 (en) * 2005-01-03 2010-08-10 Industrial Technology Research Institute Method for extracting translations from translated texts using punctuation-based sub-sentential alignment
US8886517B2 (en) 2005-06-17 2014-11-11 Language Weaver, Inc. Trust scoring for language translation systems
WO2006133571A1 (en) * 2005-06-17 2006-12-21 National Research Council Of Canada Means and method for adapted language translation
US8676563B2 (en) 2009-10-01 2014-03-18 Language Weaver, Inc. Providing human-generated and machine-generated trusted translations
US7974833B2 (en) 2005-06-21 2011-07-05 Language Weaver, Inc. Weighted system of expressing language information using a compact notation
US20070010989A1 (en) * 2005-07-07 2007-01-11 International Business Machines Corporation Decoding procedure for statistical machine translation
US7389222B1 (en) 2005-08-02 2008-06-17 Language Weaver, Inc. Task parallelization in a text-to-text system
US7813918B2 (en) * 2005-08-03 2010-10-12 Language Weaver, Inc. Identifying documents which form translated pairs, within a document collection
CN1916889B (zh) * 2005-08-19 2011-02-02 株式会社日立制作所 语料库制作装置及其方法
US8700383B2 (en) * 2005-08-25 2014-04-15 Multiling Corporation Translation quality quantifying apparatus and method
US7653531B2 (en) * 2005-08-25 2010-01-26 Multiling Corporation Translation quality quantifying apparatus and method
KR100739726B1 (ko) * 2005-08-30 2007-07-13 삼성전자주식회사 문자열 매칭 방법 및 시스템과 그 방법을 기록한 컴퓨터판독 가능한 기록매체
US7624020B2 (en) * 2005-09-09 2009-11-24 Language Weaver, Inc. Adapter for allowing both online and offline training of a text to text system
US10319252B2 (en) * 2005-11-09 2019-06-11 Sdl Inc. Language capability assessment and training apparatus and techniques
US7536295B2 (en) * 2005-12-22 2009-05-19 Xerox Corporation Machine translation using non-contiguous fragments of text
JP2007233486A (ja) * 2006-02-27 2007-09-13 Fujitsu Ltd 翻訳者支援プログラム,翻訳者支援装置及び翻訳者支援方法
US8943080B2 (en) * 2006-04-07 2015-01-27 University Of Southern California Systems and methods for identifying parallel documents and sentence fragments in multilingual document collections
CN101443759B (zh) * 2006-05-12 2010-08-11 北京乐图在线科技有限公司 多语言信息检索的方法和系统
US8886518B1 (en) 2006-08-07 2014-11-11 Language Weaver, Inc. System and method for capitalizing machine translated text
JP2008090555A (ja) * 2006-09-29 2008-04-17 Oki Electric Ind Co Ltd 訳文評価装置、訳文評価方法およびコンピュータプログラム
US9235573B2 (en) 2006-10-10 2016-01-12 Abbyy Infopoisk Llc Universal difference measure
US8195447B2 (en) 2006-10-10 2012-06-05 Abbyy Software Ltd. Translating sentences between languages using language-independent semantic structures and ratings of syntactic constructions
US8145473B2 (en) 2006-10-10 2012-03-27 Abbyy Software Ltd. Deep model statistics method for machine translation
US9633005B2 (en) 2006-10-10 2017-04-25 Abbyy Infopoisk Llc Exhaustive automatic processing of textual information
US9495358B2 (en) 2006-10-10 2016-11-15 Abbyy Infopoisk Llc Cross-language text clustering
US8433556B2 (en) 2006-11-02 2013-04-30 University Of Southern California Semi-supervised training for statistical word alignment
GB2444084A (en) 2006-11-23 2008-05-28 Sharp Kk Selecting examples in an example based machine translation system
US9122674B1 (en) 2006-12-15 2015-09-01 Language Weaver, Inc. Use of annotations in statistical machine translation
US8468149B1 (en) 2007-01-26 2013-06-18 Language Weaver, Inc. Multi-lingual online community
US8615389B1 (en) 2007-03-16 2013-12-24 Language Weaver, Inc. Generation and exploitation of an approximate language model
US8959011B2 (en) 2007-03-22 2015-02-17 Abbyy Infopoisk Llc Indicating and correcting errors in machine translation systems
US8175864B1 (en) * 2007-03-30 2012-05-08 Google Inc. Identifying nearest neighbors for machine translation
US8831928B2 (en) * 2007-04-04 2014-09-09 Language Weaver, Inc. Customizable machine translation service
US8825466B1 (en) 2007-06-08 2014-09-02 Language Weaver, Inc. Modification of annotated bilingual segment pairs in syntax-based machine translation
JP5105513B2 (ja) * 2007-07-20 2012-12-26 インターナショナル・ビジネス・マシーンズ・コーポレーション 処理対象として適切なテキストを選択する技術
US9311390B2 (en) * 2008-01-29 2016-04-12 Educational Testing Service System and method for handling the confounding effect of document length on vector-based similarity scores
JP5100445B2 (ja) * 2008-02-28 2012-12-19 株式会社東芝 機械翻訳する装置および方法
US8594992B2 (en) * 2008-06-09 2013-11-26 National Research Council Of Canada Method and system for using alignment means in matching translation
US20100070482A1 (en) * 2008-09-12 2010-03-18 Murali-Krishna Punaganti Venkata Method, system, and apparatus for content search on a device
US8818992B2 (en) * 2008-09-12 2014-08-26 Nokia Corporation Method, system, and apparatus for arranging content search results
US8676791B2 (en) 2008-11-27 2014-03-18 International Business Machines Corporation Apparatus and methods for providing assistance in detecting mistranslation
US8185373B1 (en) * 2009-05-05 2012-05-22 The United States Of America As Represented By The Director, National Security Agency, The Method of assessing language translation and interpretation
US8990064B2 (en) 2009-07-28 2015-03-24 Language Weaver, Inc. Translating documents based on content
CN101996166B (zh) * 2009-08-14 2015-08-05 张龙哺 双语句对模式化记录方法以及翻译方法和翻译系统
US8380486B2 (en) 2009-10-01 2013-02-19 Language Weaver, Inc. Providing machine-generated translations and corresponding trust levels
US10417646B2 (en) * 2010-03-09 2019-09-17 Sdl Inc. Predicting the cost associated with translating textual content
US9767095B2 (en) 2010-05-21 2017-09-19 Western Standard Publishing Company, Inc. Apparatus, system, and method for computer aided translation
US8954447B1 (en) * 2011-02-07 2015-02-10 Amazon Technologies, Inc. Annotation-based content rankings
US11003838B2 (en) 2011-04-18 2021-05-11 Sdl Inc. Systems and methods for monitoring post translation editing
US8694303B2 (en) 2011-06-15 2014-04-08 Language Weaver, Inc. Systems and methods for tuning parameters in statistical machine translation
US8886515B2 (en) 2011-10-19 2014-11-11 Language Weaver, Inc. Systems and methods for enhancing machine translation post edit review processes
CN103164390B (zh) * 2011-12-15 2016-05-18 富士通株式会社 文档处理方法和文档处理装置
US9256597B2 (en) * 2012-01-24 2016-02-09 Ming Li System, method and computer program for correcting machine translation information
US8942973B2 (en) 2012-03-09 2015-01-27 Language Weaver, Inc. Content page URL translation
US10261994B2 (en) 2012-05-25 2019-04-16 Sdl Inc. Method and system for automatic management of reputation of translators
US9081762B2 (en) * 2012-07-13 2015-07-14 Enyuan Wu Phrase-based dictionary extraction and translation quality evaluation
US9152622B2 (en) 2012-11-26 2015-10-06 Language Weaver, Inc. Personalized machine translation via online adaptation
US9213694B2 (en) 2013-10-10 2015-12-15 Language Weaver, Inc. Efficient online domain adaptation
JP6328409B2 (ja) * 2013-11-28 2018-05-23 シャープ株式会社 翻訳装置
JP5843117B2 (ja) * 2013-12-04 2016-01-13 国立研究開発法人情報通信研究機構 学習装置、翻訳装置、学習方法、翻訳方法、およびプログラム
RU2592395C2 (ru) 2013-12-19 2016-07-20 Общество с ограниченной ответственностью "Аби ИнфоПоиск" Разрешение семантической неоднозначности при помощи статистического анализа
RU2586577C2 (ru) 2014-01-15 2016-06-10 Общество с ограниченной ответственностью "Аби ИнфоПоиск" Фильтрация дуг в синтаксическом графе
JP2015138414A (ja) * 2014-01-22 2015-07-30 富士通株式会社 機械翻訳装置、翻訳方法、及び、そのプログラム
CN106462579B (zh) * 2014-10-15 2019-09-27 微软技术许可有限责任公司 为选定上下文构造词典
US9626358B2 (en) 2014-11-26 2017-04-18 Abbyy Infopoisk Llc Creating ontologies by analyzing natural language texts
JP6607482B2 (ja) * 2015-02-02 2019-11-20 国立研究開発法人情報通信研究機構 構文解析装置、学習装置、機械翻訳装置、およびプログラム
US9836457B2 (en) * 2015-05-25 2017-12-05 Panasonic Intellectual Property Corporation Of America Machine translation method for performing translation between languages

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE68928231T2 (de) * 1988-10-28 1998-01-08 Toshiba Kawasaki Kk Verfahren und Vorrichtung zur Maschinenübersetzung
GB9103080D0 (en) * 1991-02-14 1991-04-03 British And Foreign Bible The Analysing textual documents
JPH04264971A (ja) * 1991-02-20 1992-09-21 Nippon Computer Kenkyusho:Kk 学習型共起辞書作成装置
US5477451A (en) * 1991-07-25 1995-12-19 International Business Machines Corp. Method and system for natural language translation
US5541836A (en) * 1991-12-30 1996-07-30 At&T Corp. Word disambiguation apparatus and methods
US5510981A (en) * 1993-10-28 1996-04-23 International Business Machines Corporation Language translation apparatus and method using context-based translation models

Also Published As

Publication number Publication date
EP0804767A1 (en) 1997-11-05
CN1110882A (zh) 1995-10-25
CN1110757C (zh) 2003-06-04
US5867811A (en) 1999-02-02
EP0804767B1 (en) 2002-02-13
WO1995000912A1 (en) 1995-01-05
GB2279164A (en) 1994-12-21
DE69429881D1 (de) 2002-03-21
DE69429881T2 (de) 2002-07-04
GB9312598D0 (en) 1993-08-04

Similar Documents

Publication Publication Date Title
EP0804767B1 (en) Methods and apparatuses for processing a bilingual database
US6236958B1 (en) Method and system for extracting pairs of multilingual terminology from an aligned multilingual text
Pomikálek Removing boilerplate and duplicate content from web corpora
JP4694111B2 (ja) 用例ベースの機械翻訳システム
US8943080B2 (en) Systems and methods for identifying parallel documents and sentence fragments in multilingual document collections
KR101507521B1 (ko) IPC 자동 분류 방법 및 F-Term 추천 방법과 그 장치
WO2005059771A1 (ja) 対訳判断装置、方法及びプログラム
JP5370159B2 (ja) 情報抽出装置及び情報抽出システム
CN104077275A (zh) 一种基于语境进行分词的方法和装置
JPH083815B2 (ja) 自然言語の共起関係辞書保守方法
JP2015060243A (ja) 検索装置、検索方法、およびプログラム
CN110348020A (zh) 一种英文单词拼写纠错方法、装置、设备及可读存储介质
JP2016164707A (ja) 自動翻訳装置及び翻訳用モデル学習装置
EP0887748A2 (en) Multilingual terminology extraction system
CN121233615A (zh) 基于自然语言的数据库查询方法、系统、设备和介质
JP4401269B2 (ja) 対訳判断装置及びプログラム
Nghiem et al. Using MathML parallel markup corpora for semantic enrichment of mathematical expressions
RU2643438C2 (ru) Обнаружение языковой неоднозначности в тексте
Pal et al. Word Alignment-Based Reordering of Source Chunks in PB-SMT.
EP1365331A2 (en) Determination of a semantic snapshot
JP2001101184A (ja) 構造化文書生成方法及び装置及び構造化文書生成プログラムを格納した記憶媒体
JP3744136B2 (ja) 訳語選択装置と記憶媒体
Barrón-Cedeño et al. Identifying useful human correction feedback from an on-line machine translation service
CN121119449B (zh) 金融机构制度信息的冲突检测方法、装置、设备及介质
Kobayashi et al. Dataset construction for scientific-document writing support by extracting related work section and citations from pdf papers

Legal Events

Date Code Title Description
A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20031209

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20040209

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20040209

A02 Decision of refusal

Free format text: JAPANESE INTERMEDIATE CODE: A02

Effective date: 20040330

Free format text: JAPANESE INTERMEDIATE CODE: A02

Effective date: 20040330

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20040531

A911 Transfer to examiner for re-examination before appeal (zenchi)

Free format text: JAPANESE INTERMEDIATE CODE: A911

Effective date: 20040617

A912 Re-examination (zenchi) completed and case transferred to appeal board

Free format text: JAPANESE INTERMEDIATE CODE: A912

Effective date: 20040701