JPH1078964A - 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム - Google Patents

一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム

Info

Publication number
JPH1078964A
JPH1078964A JP9162383A JP16238397A JPH1078964A JP H1078964 A JPH1078964 A JP H1078964A JP 9162383 A JP9162383 A JP 9162383A JP 16238397 A JP16238397 A JP 16238397A JP H1078964 A JPH1078964 A JP H1078964A
Authority
JP
Japan
Prior art keywords
word
speech
words
record
input text
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP9162383A
Other languages
English (en)
Inventor
Darou Richardson Stephen
ダロウ リチャードソン スティーヴン
E Heidoon George
イー ヘイドーン ジョージ
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Microsoft Corp
Original Assignee
Microsoft Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Microsoft Corp filed Critical Microsoft Corp
Publication of JPH1078964A publication Critical patent/JPH1078964A/ja
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/253Grammatical analysis; Style critique

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Machine Translation (AREA)
  • Document Processing Apparatus (AREA)

Abstract

(57)【要約】 【課題】 自然言語パーザにおいて一般に混同するワー
ドを識別しそして分析する方法及びシステムを提供す
る。 【解決手段】 コンピュータシステムは、2つ以上のワ
ードより成る入力テキストを、入力テキストのワードの
中の1つのワードを含む潜在的に混同するワードからそ
の意図されたワードへとマップする関係を使用してパー
ズする。コンピュータシステムは、先ず、潜在的に混同
するワードを含む入力テキストの各ワードに対して考え
られるスピーチ部分を識別し、次いで、上記関係が潜在
的に混同するワードをマップするところの意図されたワ
ードに対して考えられるスピーチ部分を識別し、そして
それらの識別されたスピーチ部分に構文的文法ルールを
適用し、意図されたワードに対するスピーチ部分を含む
完全な構文ツリーは発生されるが、潜在的の混同するワ
ードに対するスピーチ部分を含む完全な構文ツリーは発
生されないようにする。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】本発明は、一般に、自然言語
パージングの分野に係り、より詳細には、自然言語テキ
ストに生じるエラーを修正する技術に係る。
【0002】
【従来の技術】文章を書くときに、筆者は、時々、ある
ワードが正しいところに誤って別のワードを使用するこ
とがある。例えば、筆者は、「ad」が正しいところに
ワード「add」を用いて次のような文章を書くことが
ある。The add convinced peop
le.互いに一貫して間違いを侵す「add」及び「a
d」のようなワード対は、一般に混同すると言える。一
般に混同するワードは、同様の発音を有する(例えば、
「advise」対「advice」)か、又は若干の
文字の位置が異なる(例えば、「from」対「for
m」)ことが多い。上記例において、ワード「ad」
は、「意図されたワード」即ち筆者により意図されたワ
ードと称し、一方、ワード「add」は、「混同するワ
ード」即ち筆者が意図されたワードと誤って置き換えた
ワードと称する。
【0003】混同するワードがセンテンスに含まれたと
きは、自然言語パーザは、センテンスをパージングする
ことが困難である。自然言語パーザは、自然言語のセン
テンスを分析して、センテンスの語彙及び構文内容を見
分ける。例えば、チャートに基づく自然言語パーザは、
入力センテンスの各ワードに対し辞書から辞書エントリ
ーを検索する。辞書エントリーは、ワードに関する一般
的情報を含む語彙記録と、ワードが表すスピーチの特定
部分に特有の情報を各々含む参照用のスピーチ部分記録
とを備えている。パーザは、1つ以上のスピーチ部分記
録を、チャートと称する作用領域に入れ、それらはパー
ジングルールを受け、スピーチ部分記録が、より大きな
構文単位、最終的にはセンテンスに合成される。
【0004】
【発明が解決しようとする課題】自然言語パーザを使用
し、意図されたワードとして筆者により意図されたスピ
ーチの部分を有していない混同するワードを含むセンテ
ンスをパージングするときには、自然言語パーザは、セ
ンテンスの完全なパーズを発生することができない。自
然言語パーザの目的は、入力センテンスの意図された語
彙及び構文内容を正確に表す完全なパーズを発生するこ
とであるから、混同するワードを含むセンテンスの完全
なパーズを発生することのできる自然言語パーザが望ま
れる。
【0005】
【課題を解決するための手段】本発明は、センテンスの
ような入力テキストセグメントのパージング中に一般に
混同するワードを識別しそして分析する自然言語パーザ
を提供する。一般に混同するワードを識別しそして分析
する能力は、筆者により作成された文書に含まれたセン
テンスの文法上の的確さを評価するためにワードプロセ
ッサに関連して使用される文法チェッカーについて特に
価値がある。しかしながら、当業者であれば、本発明
は、自然言語パーザのいかなる用途にも有利に使用でき
ることが明らかであろう。
【0006】本発明は、一般に混同するワードのセット
のリストを使用する。各セットは、一般に混同する2つ
以上のワードを含んでいる。本発明によるパーザは、入
力センテンスにおいて遭遇しこれらセットの1つに現れ
るワードであって、あたかもそのセットの他のワードで
表されるスピーチの部分を表し得るようなワードを処理
する。例えば、ワード「add」及び「ad」が混同し
得るワードのセットを構成しそしてワード「add」が
入力センテンスに現れる場合に、パーザは、ワード「a
dd」をあたかもそれが動詞又は名詞を表し得るかのよ
うに処理する。というのは、ワード「add」は動詞を
表し、そしてワード「ad」は名詞を表すからである。
これは、遭遇するワードの辞書エントリーにスピーチの
対応部分がないか、又はスピーチの同じ部分が異なる数
又は時制を有するようなセットの他のワードの辞書エン
トリーからスピーチ部分記録をチャートに追加すること
を含む。これら付加的なスピーチ部分記録は、一般に、
パーザが元のスピーチ部分記録にルールを適用する機会
を有した後に、パージングプロセスに後で追加される。
【0007】本発明の実施形態は、更に、一般に混同す
るワードを識別及び分析した結果を表示するために文法
チェッカーのユーザインターフェイスを提供する。又、
ある実施形態において、本発明は、これらの追加された
スピーチ部分記録へのレファレンスを、遭遇したワード
の語彙記録に追加し、ワードの語彙記録を用いてワード
がスピーチのどの部分を表すかを決定するためのルール
が、遭遇したワードがスピーチのこれら追加部分を表す
確率を考慮するようにする。
【0008】
【発明の実施の形態】自然言語パーザにおいて一般に混
同するワードを識別しそして分析する方法及びシステム
が提供される。好ましい実施形態において、本発明は、
一般に混同するワードのセットのリストを使用し、これ
は、ユーザにより修正することができる。本発明によれ
ば、パーザは、入力センテンスにおいて遭遇しこれらセ
ットの1つに現れるワードであって、あたかもそのセッ
トの他のワードで表されるスピーチの部分を表し得るよ
うなワードを処理する。例えば、ワード「add」及び
「ad」が混同し得るワードのセットを構成しそしてワ
ード「add」が入力センテンスに現れる場合に、パー
ザは、ワード「add」をあたかもそれが動詞又は名詞
を表し得るかのように処理する。というのは、ワード
「add」は動詞を表し、そしてワード「ad」は名詞
を表すからである。これは、遭遇するワードにスピーチ
の対応部分がないセットの他のワードの辞書エントリー
からスピーチ部分記録をチャートに追加することを含
む。これらの付加的なスピーチ部分記録は、一般に、パ
ーザが元のスピーチ部分記録にルールを適用する機会を
有した後に、パージングプロセスに後で追加される。
又、ある実施形態では、本発明は、これらの追加された
スピーチ部分記録へのレファレンスを、遭遇したワード
の語彙記録に追加し、従って、ワードの語彙記録を用い
てワードがスピーチの他のどの部分を表すかを決定する
ためのルールが、遭遇したワードがスピーチのこれら追
加部分を表す確率を考慮するようにする。
【0009】図1は、パーザが好ましく動作する汎用コ
ンピュータシステムの高レベルブロック図である。コン
ピュータシステム100は、中央処理ユニット(CP
U)110と、入力/出力装置120と、コンピュータ
メモリ(メモリ)130とを備えている。入力/出力装
置の中には、ハードディスクドライブのような記憶装置
121がある。又、入力/出力装置は、取り外し可能な
メディアドライブ122を含み、このドライブは、適用
パーザを含むソフトウェア製品をインストールするのに
使用でき、これらソフトウェア製品は、CD−ROMの
ようなコンピュータ読み取り可能な媒体に設けられる。
更に、入力/出力装置は、ユーザが自然言語テキストを
直接的に入力するのに使用するキーボード123も含
む。又、入力/出力装置は、ユーザが自然言語テキスト
を間接的に入力するのに使用する音声入力装置124及
び手書き入力装置125も任意に含む。音声入力装置を
用いてユーザにより入力される自然言語テキストは、好
ましくは、音声認識装置(図示せず)により音声データ
から変換される。同様に、手書き入力装置を用いてユー
ザにより入力される自然言語テキストは、好ましくは、
手書き認識装置(図示せず)を用いて手書きデータから
変換される。メモリ130は、一般的に混同するワード
を識別及び分析するためのパーザ131を含む。パーザ
は、入力テキストセグメント及び中間パーズ結果を表す
パーズツリーを含むためのチャート132を備えてい
る。又、パーザは、一般に混同するワードを、それらと
一般に混同するワード(即ち、意図されたワード)へと
マップする混同し得るワードのテーブル133も備えて
いる。例えば、ワード「add」は、ワード「ad」へ
とマップされ、筆者が「ad」ではなくワード「ad
d」を間違って使用するかもしれないことを指示する。
混同し得るワードのテーブルは、記憶装置に記憶されて
もよいし、又は取り外し可能なメディアドライブを用い
て取り外し可能な媒体に記憶されてもよい。パーザは、
上記のように構成されたコンピュータシステムにおいて
実施されるのが好ましいが、異なる構成のコンピュータ
システムでも実施できることが当業者に明らかであろ
う。
【0010】適用パーザを用いて入力テキストをパーズ
しながら、一般に混同するワードを識別及び分析する一
例を、図2ないし7に関連して説明する。図2は、入力
テキストに生じる潜在的に混同するワードを含む入力テ
キストのワードに対しパーザがスピーチ部分記録(part-
of-speech record) をチャートに追加するところを示す
チャート図である。図2は、例示的入力ストリング20
1「The addconvinced peopl
e.」を示している。図2は、更に、パーザが入力テキ
ストに現れるワードに対するスピーチ部分記録をチャー
トに追加した後のパーザのチャート200の内容も示し
ている。このチャートは、スピーチ部分記録211−2
15を含み、その1つ以上は、入力テキストに生じる各
ワードを示す。スピーチ部分記録211は、ワード「t
he」を表し、スピーチ部分記録212は、ワード「a
dd」を表し、スピーチ部分記録213は、ワード「c
onvinced」を表し、そしてスピーチ部分記録2
14及び215は、ワード「people.」を表す。
各スピーチ部分記録は、そのワードが表し得るスピーチ
の1つの考えられる部分の指示と、動詞のスピーチ部分
記録に対する動詞の時制のような付加的な関連語彙情報
とを含む。スピーチ及び他の語彙情報の考えられる部分
は、入力ストリングに生じるワードに対し辞書入力から
検索されるのが好ましい。
【0011】図3は、チャートの内容により暗示される
ルールをパーザが適用するところを示す。即ち、パーザ
は、チャートに既に存在する形式の記録を結合すること
のできるルールを適用する。図3は、動詞及び名詞を動
詞句即ち「VP」に変換するルールの適用を示す。この
ルールの適用は、ワード「convinced」に対す
る動詞のスピーチ部分記録313を「people」に
対する名詞のスピーチ部分記録314と結合する動詞句
記録321を形成する。スピーチ部分記録及びルーツに
より成形された記録の両方は、付加的なルールを包含す
る。これら付加的なルールは、繰り返し適用される。こ
こに示す例の場合には、チャートの記録を結合するのに
他のルールは首尾良く適用されない。
【0012】これらルールの適用により完全なパーズが
発生された場合には(即ち、入力ストリングの全てのワ
ードをカバーするセンテンス記録が形成された場合に
は)、パージングが終了しそして完全なパーズが返送さ
れるが、さもなくば、パーザの動作が続けられる。入力
テキストが潜在的に混同するワードを含む場合には、パ
ーザの動作が続けられるが、さもなくば、パーザは完全
なパーズを発生することができず、欠陥を返送する。図
4は、入力テキストにおいて潜在的に混同するワードを
識別するのに使用される例示的な混同し得るワードのテ
ーブルを示す図である。この混同し得るワードのテーブ
ル400は、潜在的に混同するワードの欄と、考えられ
る意図されたワードの欄とを含む。各行において、潜在
的に混同するワードの欄は、1つ以上の他のワードに対
して混同することのあるワードを含む。その行におい
て、考えられる意図されたワードの欄は、潜在的に混同
するワードと混同し得る1つ以上の考えられる意図され
たワードのリストを含む。例えば、行402は、ワード
「add」がワード「ad」と混同し得ることを示す。
行401は、その逆もあることを示し、即ちワード「a
d」がワード「add」と混同することを示している。
ワード間の幾つかの潜在的な混同は、一方向性であり、
即ちある対の一方のワードは、その対の他方のワードと
潜在的に混同し得る(例えば、行403は、「can
t」が「can’t」と混同し得ることを示す)が、そ
の逆はない(例えば、「can’t」は、潜在的に混同
するワードの欄に現れない)。行409ないし411
は、潜在的に混同するワードが2つ以上の考えられる意
図されたワードと混同し得ることを示す。パーザは、入
力テキストのワードを、混同し得るワードのテーブルの
潜在的に混同するワード欄のワードと比較する。入力ス
トリングのいずれかのワードが、潜在的に混同するワー
ド欄のワードと一致する場合には、その入力テキストが
潜在的に混同するワードを含む。
【0013】図5は、入力テキストにおいて識別された
潜在的に混同するワードに対応する考えられる意図され
たワードに対しパーザがスピーチ部分記録をチャートに
追加するところを示すチャート図である。パーザは、潜
在的に混同するワード以外のスピーチ部分を有する考え
られる意図されたワードに対するスピーチ部分記録をチ
ャートに追加するのが好ましい。例えば、パーザは、好
ましくは、考えられる意図されたワード「ad」に対し
名詞のスピーチ部分記録を追加する。というのは、その
スピーチ部分が、その潜在的に混同するワード「ad
d」に対して考えられるスピーチ部分とは異なるからで
ある。又、パーザは、好ましくは、潜在的に混同するワ
ードとは異なる時制を有する考えられる意図されたワー
ドに対しスピーチ部分記録をチャートに追加する。例え
ば、パーザは、好ましくは、考えられる意図されたワー
ド「mind」に対し現在時制の動詞のスピーチ部分記
録を追加する。というのは、その時制が、潜在的に混同
するワード「mined」の過去時制の動詞形態と異な
るからである。又、パーザは、好ましくは、潜在的に混
同するワードとは異なる数を有する考えられる意図され
たワードに対しスピーチ部分記録をチャートに追加す
る。例えば、パーザは、好ましくは、考えられる意図さ
れたワード「laps」に対し複数名詞のスピーチ部分
記録を追加する。というのは、その数が、潜在的に混同
するワード「lapse」の単数名詞形と異なるからで
ある。更に、混同するワードの特定セットに対し、ユー
ザは、たとえスピーチ部分、時制及び数が同じであって
も、セット内のワードに対しスピーチ部分記録をチャー
トに追加することを指定するのが好ましい。図5は、パ
ーザがワード「ad」に対する名詞の市ピーチ部分記録
516をチャートに追加したところを示す。というの
は、行402に示すように、入力ストリングに現れるワ
ード「add」が、辞書が考えられるスピーチ部分とし
て名詞を指定するところのワード「ad」と混同し得る
からである。
【0014】図6は、考えられる意図されたワードに対
してスピーチ部分記録をチャートに追加した後にチャー
トの内容により暗示されるルールをパーザが適用すると
ころを示すチャート図である。図6は、チャートに記録
622及び623を形成するルールをパーザが適用する
ところを示す。記録622は、「the」に対する冠詞
のスピーチ部分記録611を、考えられる意図されたワ
ード「ad」に対する名詞のスピーチ部分記録616と
結合して、名詞句(NP)を形成する。記録623は、
名詞句の記録622と動詞句の記録621を結合してセ
ンテンスを形成する。又、記録623は、入力テキスト
の各ワードを表すリーフを有するツリーのヘッドノード
を構成するという点で、入力ストリングの各ワードを
「カバー」する。
【0015】別のワードに対するスピーチ部分記録を追
加した後のチャートの内容によって暗示されたルールの
適用が完全なパーズを形成した場合には、パーザは、的
確な成功を返送するが、さもなくば、パーザは失敗を返
送する。図6から明らかなように、この例では、パーザ
は、センテンス記録623が入力テキストの全てのワー
ドをカバーし、それ故、的確な成功を返送するという点
で、完全なパーズを形成している。
【0016】図7は、パーザを用いた文法チェッカーの
視覚的ユーザインターフェイスを示すスクリーン図であ
る。この文法チェッカーのユーザインターフェイスは、
好ましくは、ウインドウ700を表示する。ウインドウ
700は、好ましくは、現在チェックされているセンテ
ンス710を含む。更に、ウインドウは、現在センテン
スの特定のワードがおそらく別のワードと混同している
という指示720を含む。又、ウインドウは、好ましく
は、潜在的に混同するワードを置き換えるという提案7
10も含む。更に、ウインドウは、好ましくは、提案を
受け入れて潜在的に混同するワードを置き換えることを
ユーザが選択できるボタン740と、提案を拒否しそし
て潜在的に混同するワードの置き換えを排除することを
ユーザが選択できるボタン750とを含む。
【0017】図8は、一般に混同するワードを識別しそ
して分析しながら入力テキストをパーズするために適用
パーザにより好ましく実行される高レベルステップを示
すフローチャートである。ステップ801において、パ
ーザは、入力テキストに生じる潜在的に混同するワード
を含む入力テキストのワードに対しスピーチ部分記録を
チャートに追加する。ステップ802において、パーザ
は、チャートの内容により暗示されたルールの1つを適
用する。ステップ803において、ステップ802のル
ールの適用により完全なパーズが形成された場合には
(即ち、入力ストリングの全てのワードをカバーするセ
ンテンス記録が形成された場合には)、これらのステッ
プは終了し、完全なパーズが返送されるが、さもなく
ば、パーザはステップ804に続く。ステップ804に
おいて、パージングが終了した場合、即ち暗示された全
てのルールが適用されるか又は適用されたルールの全数
が上限を越えた場合には、パーザは、ステップ805に
続き、さもなくば、パーザは、ステップ802に続い
て、暗示された別のルールを適用する。ステップ805
において、入力テキストが潜在的に混同するワードを含
む場合には、パーザは、ステップ806に続き、さもな
くば、パーザは、完全なパーズを形成することができ
ず、失敗を返送する。入力テキストが潜在的に混同する
ワードを含むかどうか決定するために、パーザは、入力
テキストのワードを、混同し得るワードのテーブルの潜
在的に混同するワード欄のワードと比較する。入力スト
リングのいずれかのワードが、潜在的に混同するワード
欄のワードと一致する場合には、入力テキストが潜在的
に混同するワードを含む。ステップ806において、パ
ーザは、入力テキストにおいて識別された潜在的に混同
するワードに対応する考えられる意図されたワードに対
し、スピーチ部分記録をチャートに追加する。ステップ
807において、パーザは、別のワードに対しスピーチ
部分記録をステップ806で追加した後にチャートの内
容により暗示されたルールの1つを適用する。ステップ
808において、完全なパーズが発生された場合には、
パーザは、的確な成功を返送し、さもなくば、パーザ
は、ステップ809に続く。ステップ809において、
パージングが完了した場合、即ち暗示された全てのルー
ルが適用されるか又は適用されたルールの全数が上限を
越えたな場合に、パーザは、失敗を返送し、さもなく
ば、パーザはステップ807に続き、別の暗示されたル
ールを適用する。
【0018】幾つかの文法ルールは、各ワードに対して
スピーチの特定部分に適用される間に、各ワードが表す
スピーチの全ての考えられる部分を考慮する。このよう
な文法ルールは、ルールを適用するのに必要であるが完
全なパーズの発生に貢献しそうもない処理リソースの量
を減少することができる。このようなリソースをサポー
トするために、スピーチ部分記録を一緒にリンクし、ワ
ードに対して考えられる全てのスピーチ部分を容易に決
定することができる。本発明の好ましい実施形態によれ
ば、考えられる意図されたワードに対するスピーチ部分
記録は、パージングプロセスの始めに、潜在的に混同す
るワードに対するスピーチ部分記録にリンクされるのが
好ましい。図8ないし11は本発明のこの特徴を示す。
図9は、図2の別の図であって、ステップ801の実行
の後であって且つルールを適用する前のチャートの内容
を示す。入力テキストのワードにより表されたスピーチ
の潜在的な部分に関するデータを含むのではなく、スピ
ーチ部分記録911ないし915は、この情報を含むデ
ータ構造体へのポインタを含む。例えば、スピーチ部分
記録914は、潜在的なスピーチ部分の名詞及び他の関
連する語彙情報を含むスピーチ部分データ構造体971
へのポインタを含む。別の好ましい実施形態(図示せ
ず)によれば、スピーチ部分データ構造体へのポインタ
をデレファレンスする時間的コストを排除するために、
スピーチ部分データ構造体からスピーチ部分記録へデー
タがコピーされる。スピーチ部分データ構造体971
は、ワード「people」を表す語彙記録970への
両方向性リンクを含む。別のデータ構造体972は、ワ
ード「people」に対して考えられるスピーチ部分
の動詞を含むと共に、語彙記録970への両方向性リン
クも含む。スピーチ部分データ構造体971及び972
と語彙記録データ構造体970との間のリンクは、ルー
ルがそれらの処理を、特定のワードに対して考えられる
全てのスピーチ部分のセットに基づいて行えるようにす
る。ワード「people」に対する名詞のスピーチ部
分記録914の場合に、この記録に適用されるルール
は、ワード「people」が動詞も表し得ることを考
慮する。
【0019】図10は、本発明のこの特徴によるチャー
トの更に別の変形を示している。図10は、考えられる
意図されたワードに対するスピーチ部分データ構造体
と、その潜在的に混同するワードに対する語彙記録デー
タ構造体とのリンクを示す。図10は、名詞形態のワー
ド「ad」に対するスピーチ部分データ構造体1052
を「add」に対する語彙記録1050に加えるところ
を示している。両スピーチ部分データ構造体1051及
び1052は、ワード「add」の語彙データ構造体1
050に両方向性リンクされるので、「add」に対す
る動詞のスピーチ部分記録1012に適用されるルール
は、このワードに対して考えられる名詞のスピーチ部分
とみなすことができる。上記のように、本発明によれ
ば、考えられる意図されたワードの考えられるスピーチ
部分に対するスピーチ部分データ構造体は、ルールによ
り結合されるべきワードに対して考えられる他のスピー
チ部分に基づいて作用するルールの適用を容易にするた
めに、各々の考えられる混同するワードに対する語彙デ
ータ構造体にリンクされるのが好ましい。図11は、本
発明のこの特徴により、名詞のスピーチ部分記録111
6がステップ806においてチャートに追加されたとき
に、考えられる意図されたワード「ad」に対する潜在
的なスピーチ部分の名詞を含むスピーチ部分データ構造
体1152へのポインタを含むことを示している。
【0020】完全なパーズの発生に貢献しそうにないル
ールの適用を防止することによってパージングの効率を
高めるのに加えて、考えられる意図されたワードに対し
てリンクされるスピーチ部分記録を参照するルールを使
用することは、潜在的に混同するワードが考えられる意
図されるワードと実際に混合する場合にパーザが潜在的
に混同するワードを用いて入力テキストの見掛け上正し
い完全なパーズを発生するのを防止することができる。
これは、混同するワード「form」が意図されたワー
ド「from」に代わって使用される次の例示的なセン
テンスについて言えることである。Angela de
parted form Seattle.考えられる
意図されたワードの考えられるスピーチ部分を考慮しな
いルールを用いると、あるパーザは、動詞句が動詞句
「departed」と名詞句「form Seatt
le」から形成されるこのセンテンスの完了パーズを発
生する。この完了パーズは、「form Seattl
e」が動詞「departed」の有効な目的語でない
から、実際には正しくない。しかしながら、考えられる
意図されたワードの考えられるスピーチ部分を考慮する
ルールを用いると、パーザは、この誤った完了パーズを
回避することができる。この場合に、動詞句と動詞句の
目的語である名詞句を結合して別の動詞句にするルール
を適用することは、名詞句の「前修飾語」(即ち、名詞
句のメインワード「Seattle」の前に生じるワー
ド「form」)又はその考えられる意図されたワード
がスピーチの前置詞部分を表し得るときに、スピーチの
前置詞部分が動詞の目的語の前に意図される可能性が大
きい場合は、阻止される。考えられる意図されたワード
「from」は、スピーチの前置詞部分をもつことがで
き、そして前置詞のスピーチ部分記録は、潜在的に混同
するワード「form」のスピーチ部分記録にリンクさ
れるので、このルールの適用は阻止され、パーザが上記
の誤った完了パーズを形成しないよう防止し、これによ
り、パーザの出力の精度を改善する。
【0021】図12及び13は、潜在的に混同するワー
ドのスピーチ部分記録がチャートに追加されそして暗示
されたルールがステップ805によりそれらに適用され
た後に、別のワードに対するスピーチ部分記録をチャー
トに追加させる2つの好ましい実施形態を示している。
図12は、2つの異なるリスト即ち「待ち行列」である
一次リスト1280及び二次リスト1290からスピー
チ部分記録がチャート120に追加される実施形態を示
す。入力テキストに含まれたワードに対するスピーチ部
分記録は、一次リスト1280に記憶される。この一次
リストは、入力テキストに現れるワード「the」、
「add」、「convinced」及び「peopl
e」に対するスピーチ部分記録を含む。二次リスト12
90は、考えられる意図されたワードに対するスピーチ
部分記録を含む。二次リスト1290は、別のワード
「ad」に対する名詞のスピーチ部分記録を含むことが
明らかである。この実施形態では、ワードは、先ず、一
次リストからチャートに追加される。暗示されたルール
が適用された後に、パーザは、二次リストからスピーチ
部分記録をチャートに追加する。好ましい実施形態にお
いて、スピーチ部分記録を二次リストからチャートに追
加することは、先ず、二次リストから一次リストへそれ
らを移動し、次いで、それらを一次リストからチャート
へ追加する一方、一次リストに現れる新たに暗示される
ルールを適用することを含む。この解決策は、入力テキ
ストのワードと一般に混同するところの考えられる意図
されたワードがチャートに追加される前に、入力テキス
トに含まれたワードに対するスピーチ部分記録からパー
ズツリーを構成できるようにする。
【0022】図13は、スピーチ部分記録が単一のリス
ト1370からチャート1300に追加される別の実施
形態を示す。リスト1370は確率リストであり、完了
パーズツリーのリーフを最終的に構成する各スピーチ部
分記録の確率に基づいて分類される。確率指向パーザの
詳細な説明については、参考としてここに取り上げる
「統計学的な処理をルールに基づく自然言語パーザへと
ブートストラップするための方法及びシステム(METHOD
AND SYSTEM FOR BOOTSTRAPPING STATISTICAL PROCESSIN
G INTO A RULE-BASED NATURAL LANGUAGE PARSER)」と題
する米国特許出願第08/265,845号を参照され
たい。スピーチ部分記録は、成功裡なパーズツリーのリ
ーフを構成する確率の下降順に確率リストからチャート
に追加される。これらの確率は、「適用優先値」とも称
されるが、入力テキストセグメントの代表的集成に対し
て完成したパーズツリーにおける各スピーチ部分記録の
出現を統計学的に分析することによって発生されるのが
好ましい。例えば、スピーチ部分記録1374及び13
75に関連して示された統計データは、ワード「peo
ple」を含む入力テキストセグメントにおいて、ワー
ド「people」が入力セグメントの完全なパーズに
おいて名詞を表すときが78%であり、一方、動詞を表
すケースが13%であることを示している。この実施形
態において、考えられる意図されたワードに対するスピ
ーチ部分記録には、比較的小さな確率が指定され、それ
らを処理の終わり付近でチャートに追加させるのが好ま
しい。これは、多数の方法で行われる。ワード「ad」
は入力テキストに実際に生じないので、入力テキストに
「ad」が現れるときにワード「ad」の名詞形態が完
全なパーズツリーのリーフを形成する確率は、低くする
ことができる。或いは又、ワード「ad」ではなくワー
ド「add」が入力テキストに現れるときにワード「a
d」の名詞形態が完成パーズツリーのリーフを形成する
確率を計算するように個別の統計データを維持すること
もできる。いずれにせよ、代替えワード「ad」に対す
るスピーチ部分記録は、潜在的に混同するワード「ad
d」に対するスピーチ部分記録の後にチャートに追加さ
れる。最後に、考えられる意図されたワードに対するス
ピーチ部分記録の確率は、確率リストの最少確率以下に
セットすることができる。
【0023】更に別の好ましい実施形態では、潜在的に
混同するワードに対するスピーチ部分記録がチャートに
追加された後に代替えワードに対するスピーチ部分記録
をチャートに追加させる2つの解決策を組み合わせて、
潜在的に意図されたワードに対するスピーチ部分記録を
二次リストに記憶し、そして全てのルールと、一次リス
トで終わりとなるスピーチ部分記録とをそれらの確率に
より順序付けする。
【0024】ユーザは、潜在的に混同するワード、又は
その潜在的に混同するワードに置き換わる考えられる意
図されたワードのリストを変更するようにパーザを構成
できるのが好ましい。ユーザは、図4に示された混同し
得るワードのテーブルを変更することによりこれを行
う。しかしながら、あるユーザは、混同し得るワードの
リストの簡単な表示を変更できることを望む。図14
は、簡単化された混同し得るワードのファイル1400
を示す。行1401ないし1406は、潜在的に混同す
るワードの1つのセットに各々対応する。特に指示のな
い限り、1つの行に一緒に現れるワードは、全て、互い
に混同する。例えば、行1401は、ワード「ad」が
ワード「add」と混同しそしてその逆もあり得ること
を示す。又、この混同し得るワードのファイルは、潜在
的に混同するとみなしてはならないワードの前にハイフ
ォン(−)記号を置くことによりユーザが一方向の混同
関係を指定できるのが好ましい。例えば、行1401に
おけるワード「can’t」の前のハイフォン記号は、
ワード「cant」がワード「can’t」と混同する
ことはあるが、ワード「can’t」がワード「can
t」と潜在的に混同されないことを示す。又、この混同
し得るワードのファイルは、潜在的に混同するセットの
ワードは、それらが同じスピーチ部分、数及び時制を有
していても、互いに置き換えられることをユーザがアス
タリスク(*)記号で指定できるのが好ましい。例え
ば、混同し得るセット1402の前のアスタリスク記号
は、「can’t」及び「cant」の両方のワードが
スピーチの動詞部分を有していても、ワード「can’
t」をワード「cant」に置き換えられることを示
す。パーザは、ユーザがパーザの動作を構成するように
混同し得るワードのファイル1400を変更できると共
に、混同し得るワードのファイルを、図4に示す混同し
得るワードのテーブルのようなパーザにより容易に適用
される形態へと変換できるのが好ましい。
【0025】好ましい実施形態を参照して本発明を説明
したが、当業者であれば、本発明の範囲から逸脱せず
に、種々の変更や修正がなされ得ることが明らかであろ
う。例えば、上記以外の機構を使用して、一般に混同す
るワードに対するスピーチ部分記録をチャートに導入す
ることができる。更に、上記した本発明の実施形態は、
コンピュータプログラミング言語やテキスト形成言語の
ような人為的言語のテキストをパーズするのにも容易に
適用できる。
【図面の簡単な説明】
【図1】本発明が好ましく動作する汎用コンピュータシ
ステムの高レベルブロック図である。
【図2】入力テキストに生じるワードに対してパーザが
スピーチ部分記録をチャートに追加するところを示すチ
ャート図である。
【図3】チャートの内容により暗示されるルールをパー
ザが適用するところ示すチャート図である。
【図4】入力テキストにおける潜在的に混同するワード
を識別するのに使用される例示的な混同ワードテーブル
を示すテーブル図である。
【図5】入力テキストにおいて識別された潜在的に混同
するワードに対応する考えられる意図されたワードに対
し、パーザがスピーチ部分記録をチャートに追加すると
ころを示すチャート図である。
【図6】考えられる意図されたワードに対するスピーチ
記録の部分がチャートに追加された後に、チャートの内
容により暗示されたルールをパーザが適用するところを
示すチャート図である。
【図7】パーザを用いた文法チェッカーの視覚的ユーザ
インターフェイスを示すスクリーン図である。
【図8】一般に混同するワードを識別しそして分析しな
がら入力テキストをパーズするために適用パーザにより
好ましく実行される高レベルステップを示すフローチャ
ートである。
【図9】辞書からの語彙記録を含む図2の別の図であっ
て、ステップ801の実行後で且つルールを適用する前
のチャートの内容を示す図である。
【図10】代替えワードに対するスピーチ部分データ構
造体を、その潜在的に混同するワードに対する語彙記録
データ構造体にリンクするところを示す図である。
【図11】考えられる意図されたワードに対するスピー
チ部分記録を追加した後のチャートの内容を示す図であ
る。
【図12】スピーチ部分記録が2つの異なるリストから
チャートに追加される実施形態を示す図である。
【図13】スピーチ部分記録が、確率でランク付けされ
た単一リストからチャートに追加される別の実施形態を
示す図である。
【図14】混同し得るワードの簡単化されたファイルを
示す図である。
【符号の説明】
100 コンピュータシステム 110 中央処理ユニット 120 入力/出力装置 121 記憶装置 122 取り外し可能なメディアドライブ 123 キーボード 124 音声入力装置 125 手書き入力装置 130 コンピュータメモリ 131 パーザ 132 チャート 133 混同し得るワードのテーブル 200 パーザのチャート 201 入力ストリング 211−215 スピーチ部分記録
───────────────────────────────────────────────────── フロントページの続き (72)発明者 ジョージ イー ヘイドーン アメリカ合衆国 ワシントン州 98008 ベルビュー ワンハンドレッドアンドシッ クスティフィフス プレイス ノースイー スト 3211

Claims (10)

    【特許請求の範囲】
  1. 【請求項1】 コンピュータシステムにおいて1つ以上
    のワードを含む自然言語入力テキストのセグメントを文
    法ルールと複数のエントリーを含む辞書とを用いてパー
    ズする方法であって、各辞書エントリーは自然言語のワ
    ードに対応しそしてそのワードに対する1つ以上の考え
    られるスピーチ部分を指定し、上記方法は、 (a)入力テキストセグメントを表すパーズツリーと、
    それに対する中間のパーズ結果とを含むチャートを形成
    し、 (b)入力テキストセグメントに生じる各ワードごと
    に、そのワードの辞書エントリーで指定されたスピーチ
    の部分を指定するスピーチ部分記録をそのワードに対し
    て上記チャートに形成し、 (c)入力テキストセグメントに生じるワードであっ
    て、別のワードと一般に混同するワードを識別し、 (d)その識別されたワードと一般に混同するワードに
    対する辞書エントリーで指定されたスピーチの部分を指
    定するスピーチ部分記録を上記識別されたワードに対し
    て上記チャートに形成し、そして (e)上記段階(b)及び(d)で形成された両方にス
    ピーチ部分記録に文法ルールを適用する、という段階を
    備えたことを特徴とする方法。
  2. 【請求項2】 更に、一般に混同するワードのリストを
    使用し、このリストは、一般に混同するワードの各々に
    対し、そのワードと一般に混同するワードを含み、そし
    て上記段階(c)は、入力テキストセグメントに生じる
    ワードの1つを上記リストのワードの1つとマッチング
    させる段階を含む請求項1に記載の方法。
  3. 【請求項3】 上記段階(b)は、入力テキストセグメ
    ントに生じる各ワードごとに、そのワードの辞書エント
    リーで指定された考えられるスピーチ部分の各々を指定
    するスピーチ部分記録を上記チャートに形成し、そして
    上記方法は、更に、入力テキストセグメントの各ワード
    ごとに、そのワードに対してチャートに形成されたスピ
    ーチ部分記録を一緒にリンクする段階を備え、1つ以上
    の文法ルールをスピーチ部分記録に適用することは、そ
    のスピーチ部分記録がリンクされる他のスピーチ部分記
    録を検査することによりそのワードに対して他の考えら
    れるスピーチ部分を決定することを含み、そして更に、
    上記方法は、段階(d)で形成されたスピーチ部分記録
    を段階(b)で識別されたワードに対して形成されたス
    ピーチ部分記録にリンクさせる段階を含む請求項1に記
    載の方法。
  4. 【請求項4】 上記段階(d)は、上記段階(e)の実
    行を開始した後に行う請求項1に記載の方法。
  5. 【請求項5】 上記段階(d)は、上記段階(b)で形
    成されたスピーチ部分記録への文法ルールの適用が終了
    した後に行う請求項1に記載の方法。
  6. 【請求項6】 各文法ルール及びスピーチ部分記録は、
    適用優先値が関連され、上記段階(e)は、適用優先値
    が減少する順に文法ルール及びリストのスピーチ部分記
    録を適用し、そして上記識別されたワードと一般に混同
    するワードに対するスピーチ部分記録に関連した適用優
    先値は、上記識別されたワードに対するスピーチ部分記
    録に関連した適用優先値より小さい請求項1に記載の方
    法。
  7. 【請求項7】 上記段階(e)の文法ルールの適用が、
    上記識別されたワードを含む入力テキストの完全なパー
    ズを形成しないが、一般に混同するワードを含む入力テ
    キストの完全なパーズを形成するときには、上記識別さ
    れたワードが上記一般に混同するワードと混同すること
    を指示する段階を更に備えた請求項1に記載の方法。
  8. 【請求項8】 上記段階(e)の文法ルールの適用が、
    上記識別されたワードを含む入力テキストの完全なパー
    ズを形成しないか、又は一般に混同するワードを含む入
    力テキストの完全なパーズを形成する場合には、 自然言語センテンスが構文的に正しくないという指示を
    出力し、そして自然言語センテンスの識別されたワード
    が、その識別されたワードと一般に混同するワードと置
    き換えられた場合には、自然言語センテンスが構文的に
    正しいという指示を出力する、という段階を備えた請求
    項1に記載の方法。
  9. 【請求項9】 1つ以上のワードを含む自然言語入力テ
    キストのセグメントを文法ルールと複数のエントリーを
    含む辞書とを使用してパーズするための装置であって、
    各辞書エントリーは自然言語のワードに対応しそしてそ
    のワードに対する1つ以上の考えられるスピーチ部分を
    指定し、上記装置は、 入力テキストセグメントを表すパーズツリーと、それに
    対する中間のパーズ結果とを含むデータ構造体と、 入力テキストセグメントに生じる各ワードごとに、その
    ワードの辞書エントリーで指定されたスピーチの部分を
    各々指定するスピーチ部分記録を上記データ構造体に形
    成する一次スピーチ部分記録発生器と、 入力テキストセグメントに生じるワードであって、別の
    ワードと一般に混同するワードを識別する識別子と、 その識別されたワードと一般に混同するワードに対する
    辞書エントリーで指定されたスピーチの部分を指定する
    スピーチ部分記録を、上記識別子で識別されたワードに
    対してチャートメモリに形成する二次スピーチ部分記録
    発生器と、 上記一次及び二次のスピーチ部分記録発生器で形成され
    た両方のスピーチ部分記録に文法ルールを適用する文法
    ルール適用サブシステムと、を備えたことを特徴とする
    装置。
  10. 【請求項10】 ディスプレイ装置と、 入力テキストセグメントが構文的に正しくないという指
    示を上記ディスプレイ装置に表示させると共に、入力テ
    キストセグメントの識別されたワードが、その識別され
    たワードと一般に混同するワードに置き換えられた場合
    には、入力テキストセグメントが構文的に正しいという
    指示を上記ディスプレイ装置に表示させるためのフィー
    ドバックサブシステムとを更に備えた請求項9に記載の
    装置。
JP9162383A 1996-06-25 1997-06-19 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム Pending JPH1078964A (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/671,203 US5999896A (en) 1996-06-25 1996-06-25 Method and system for identifying and resolving commonly confused words in a natural language parser
US08/671203 1996-06-25

Related Child Applications (1)

Application Number Title Priority Date Filing Date
JP2007069577A Division JP2007172657A (ja) 1996-06-25 2007-03-16 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム

Publications (1)

Publication Number Publication Date
JPH1078964A true JPH1078964A (ja) 1998-03-24

Family

ID=24693543

Family Applications (2)

Application Number Title Priority Date Filing Date
JP9162383A Pending JPH1078964A (ja) 1996-06-25 1997-06-19 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム
JP2007069577A Withdrawn JP2007172657A (ja) 1996-06-25 2007-03-16 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム

Family Applications After (1)

Application Number Title Priority Date Filing Date
JP2007069577A Withdrawn JP2007172657A (ja) 1996-06-25 2007-03-16 一般に混同するワードを自然言語パーザにおいて識別及び分析する方法及びシステム

Country Status (4)

Country Link
US (1) US5999896A (ja)
EP (1) EP0836144A3 (ja)
JP (2) JPH1078964A (ja)
CN (1) CN1172992A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2006521578A (ja) * 2003-03-26 2006-09-21 コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ 音声認識システム
JP2008083165A (ja) * 2006-09-26 2008-04-10 Xanavi Informatics Corp 音声認識処理プログラム及び音声認識処理方法

Families Citing this family (55)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100318573B1 (ko) * 1996-10-16 2001-12-28 마찌다 가쯔히꼬 문자 입력 장치 및 문자 입력 프로그램을 기억한 기록 매체
US6782510B1 (en) * 1998-01-27 2004-08-24 John N. Gross Word checking tool for controlling the language content in documents using dictionaries with modifyable status fields
US6185524B1 (en) * 1998-12-31 2001-02-06 Lernout & Hauspie Speech Products N.V. Method and apparatus for automatic identification of word boundaries in continuous text and computation of word boundary scores
DE69939151D1 (de) * 1999-01-20 2008-09-04 Sony Deutschland Gmbh Sprecheradaption für verwechselbare Wörter
US6275791B1 (en) * 1999-02-26 2001-08-14 David N. Weise Natural language parser
US6510431B1 (en) 1999-06-28 2003-01-21 International Business Machines Corporation Method and system for the routing of requests using an automated classification and profile matching in a networked environment
EP1079387A3 (en) * 1999-08-26 2003-07-09 Matsushita Electric Industrial Co., Ltd. Mechanism for storing information about recorded television broadcasts
US6785651B1 (en) 2000-09-14 2004-08-31 Microsoft Corporation Method and apparatus for performing plan-based dialog
US20020194223A1 (en) * 2000-10-16 2002-12-19 Text Analysis International, Inc. Computer programming language, system and method for building text analyzers
US7003444B2 (en) * 2001-07-12 2006-02-21 Microsoft Corporation Method and apparatus for improved grammar checking using a stochastic parser
US20030105622A1 (en) * 2001-12-03 2003-06-05 Netbytel, Inc. Retrieval of records using phrase chunking
US7225121B2 (en) * 2002-02-20 2007-05-29 Palo Alto Research Center Incorporated Generating with Lexical Functional Grammars
US7380203B2 (en) * 2002-05-14 2008-05-27 Microsoft Corporation Natural input recognition tool
US7308648B1 (en) * 2002-11-27 2007-12-11 Microsoft Corporation Method, system, and computer-readable medium for filtering harmful HTML in an electronic document
US7218779B2 (en) * 2003-01-21 2007-05-15 Microsoft Corporation Ink divider and associated application program interface
US20050049868A1 (en) * 2003-08-25 2005-03-03 Bellsouth Intellectual Property Corporation Speech recognition error identification method and system
US20050091036A1 (en) * 2003-10-23 2005-04-28 Hazel Shackleton Method and apparatus for a hierarchical object model-based constrained language interpreter-parser
US7584092B2 (en) 2004-11-15 2009-09-01 Microsoft Corporation Unsupervised learning of paraphrase/translation alternations and selective application thereof
US7412385B2 (en) * 2003-11-12 2008-08-12 Microsoft Corporation System for identifying paraphrases using machine translation
US7505906B2 (en) * 2004-02-26 2009-03-17 At&T Intellectual Property, Ii System and method for augmenting spoken language understanding by correcting common errors in linguistic performance
WO2006035402A1 (en) * 2004-09-30 2006-04-06 Koninklijke Philips Electronics N.V. Automatic text correction
US7546235B2 (en) * 2004-11-15 2009-06-09 Microsoft Corporation Unsupervised learning of paraphrase/translation alternations and selective application thereof
US7908132B2 (en) * 2005-09-29 2011-03-15 Microsoft Corporation Writing assistance using machine translation techniques
KR20080086456A (ko) 2005-12-22 2008-09-25 인터내셔널 비지네스 머신즈 코포레이션 찾기 및 교체 입력의 파생어를 레버리징하는 찾기 및 교체기능을 갖춘 텍스트 편집 방법 및 시스템
US8019595B1 (en) 2006-09-11 2011-09-13 WordRake Holdings, LLC Computer processes for analyzing and improving document readability
US20090234638A1 (en) * 2008-03-14 2009-09-17 Microsoft Corporation Use of a Speech Grammar to Recognize Instant Message Input
CN101685438B (zh) * 2008-09-22 2012-09-12 财团法人资讯工业策进会 中文文章侦错装置以及中文文章侦错方法
WO2011089651A1 (ja) * 2010-01-22 2011-07-28 三菱電機株式会社 認識辞書作成装置、音声認識装置及び音声合成装置
US9201955B1 (en) 2010-04-15 2015-12-01 Google Inc. Unambiguous noun identification
US8560318B2 (en) * 2010-05-14 2013-10-15 Sony Computer Entertainment Inc. Methods and system for evaluating potential confusion within grammar structure for set of statements to be used in speech recognition during computing event
US8768723B2 (en) 2011-02-18 2014-07-01 Nuance Communications, Inc. Methods and apparatus for formatting text for clinical fact extraction
US9904768B2 (en) 2011-02-18 2018-02-27 Nuance Communications, Inc. Methods and apparatus for presenting alternative hypotheses for medical facts
US10460288B2 (en) 2011-02-18 2019-10-29 Nuance Communications, Inc. Methods and apparatus for identifying unspecified diagnoses in clinical documentation
US10032127B2 (en) 2011-02-18 2018-07-24 Nuance Communications, Inc. Methods and apparatus for determining a clinician's intent to order an item
US9569594B2 (en) 2012-03-08 2017-02-14 Nuance Communications, Inc. Methods and apparatus for generating clinical reports
US9064492B2 (en) 2012-07-09 2015-06-23 Nuance Communications, Inc. Detecting potential significant errors in speech recognition results
US10504622B2 (en) 2013-03-01 2019-12-10 Nuance Communications, Inc. Virtual medical assistant methods and apparatus
US12293825B2 (en) 2013-03-01 2025-05-06 Microsoft Technology Licensing, Llc. Virtual medical assistant methods and apparatus
US11024406B2 (en) 2013-03-12 2021-06-01 Nuance Communications, Inc. Systems and methods for identifying errors and/or critical results in medical reports
CN103246640B (zh) * 2013-04-23 2016-08-03 北京酷云互动科技有限公司 一种检测重复文本的方法及装置
US11183300B2 (en) 2013-06-05 2021-11-23 Nuance Communications, Inc. Methods and apparatus for providing guidance to medical professionals
US10496743B2 (en) 2013-06-26 2019-12-03 Nuance Communications, Inc. Methods and apparatus for extracting facts from a medical text
US10331763B2 (en) 2014-06-04 2019-06-25 Nuance Communications, Inc. NLU training with merged engine and user annotations
US10373711B2 (en) 2014-06-04 2019-08-06 Nuance Communications, Inc. Medical coding system with CDI clarification request notification
US10366424B2 (en) 2014-06-04 2019-07-30 Nuance Communications, Inc. Medical coding system with integrated codebook interface
US10319004B2 (en) 2014-06-04 2019-06-11 Nuance Communications, Inc. User and engine code handling in medical coding system
US10754925B2 (en) 2014-06-04 2020-08-25 Nuance Communications, Inc. NLU training with user corrections to engine annotations
US10528645B2 (en) * 2015-09-16 2020-01-07 Amazon Technologies, Inc. Content search using visual styles
CN105573979B (zh) * 2015-12-10 2018-05-22 江苏科技大学 一种基于汉字混淆集的错字词知识生成方法
US10366687B2 (en) 2015-12-10 2019-07-30 Nuance Communications, Inc. System and methods for adapting neural network acoustic models
US11152084B2 (en) 2016-01-13 2021-10-19 Nuance Communications, Inc. Medical report coding with acronym/abbreviation disambiguation
US10949602B2 (en) 2016-09-20 2021-03-16 Nuance Communications, Inc. Sequencing medical codes methods and apparatus
US11133091B2 (en) 2017-07-21 2021-09-28 Nuance Communications, Inc. Automated analysis system and method
CN107729318B (zh) * 2017-10-17 2021-04-20 语联网(武汉)信息技术有限公司 一种自动更正部分文字的方法-由中文词性判断
US11024424B2 (en) 2017-10-27 2021-06-01 Nuance Communications, Inc. Computer assisted coding systems and methods

Family Cites Families (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4674065A (en) * 1982-04-30 1987-06-16 International Business Machines Corporation System for detecting and correcting contextual errors in a text processing system
JPS61234461A (ja) * 1985-04-10 1986-10-18 Nec Corp 文字列訂正方式
US4887212A (en) * 1986-10-29 1989-12-12 International Business Machines Corporation Parser for natural language text
US4868750A (en) * 1987-10-07 1989-09-19 Houghton Mifflin Company Collocational grammar system
US5146405A (en) * 1988-02-05 1992-09-08 At&T Bell Laboratories Methods for part-of-speech determination and usage
US5060154A (en) * 1989-01-06 1991-10-22 Smith Corona Corporation Electronic typewriter or word processor with detection and/or correction of selected phrases
US5146406A (en) * 1989-08-16 1992-09-08 International Business Machines Corporation Computer method for identifying predicate-argument structures in natural language text
US5258909A (en) * 1989-08-31 1993-11-02 International Business Machines Corporation Method and apparatus for "wrong word" spelling error detection and correction
FR2679039B1 (fr) * 1991-07-09 1993-11-26 Merlin Gerin Dispositif de distribution d'energie electrique avec controle d'isolement.
US5537317A (en) * 1994-06-01 1996-07-16 Mitsubishi Electric Research Laboratories Inc. System for correcting grammer based parts on speech probability
US5521816A (en) * 1994-06-01 1996-05-28 Mitsubishi Electric Research Laboratories, Inc. Word inflection correction system
US5721938A (en) * 1995-06-07 1998-02-24 Stuckey; Barbara K. Method and device for parsing and analyzing natural language sentences and text

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2006521578A (ja) * 2003-03-26 2006-09-21 コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ 音声認識システム
US8447602B2 (en) 2003-03-26 2013-05-21 Nuance Communications Austria Gmbh System for speech recognition and correction, correction device and method for creating a lexicon of alternatives
JP2008083165A (ja) * 2006-09-26 2008-04-10 Xanavi Informatics Corp 音声認識処理プログラム及び音声認識処理方法

Also Published As

Publication number Publication date
JP2007172657A (ja) 2007-07-05
EP0836144A2 (en) 1998-04-15
CN1172992A (zh) 1998-02-11
EP0836144A3 (en) 2004-11-10
US5999896A (en) 1999-12-07

Similar Documents

Publication Publication Date Title
US5999896A (en) Method and system for identifying and resolving commonly confused words in a natural language parser
CN100489841C (zh) 用于开发自然语言理解应用的方法和集成开发工具
US7080004B2 (en) Grammar authoring system
CN1457041B (zh) 为一个自然语言理解系统用来自动注解训练数据的一个系统
Oostdijk Corpus linguistics and the automatic analysis of English
US7853874B2 (en) Spelling and grammar checking system
US8515733B2 (en) Method, device, computer program and computer program product for processing linguistic data in accordance with a formalized natural language
US20090192787A1 (en) Grammer checker
US20040111255A1 (en) Graph-based method for design, representation, and manipulation of NLU parser domains
JP2002215617A (ja) 品詞タグ付けをする方法
JP2011518352A (ja) ユーザーの過去のライティングに基づいて、ライティングを指導するためのシステム
Glass et al. A naive salience-based method for speaker identification in fiction books
Baldwin et al. Beauty and the beast: What running a broad-coverage precision grammar over the BNC taught us about the grammar—and the corpus
KR20190021015A (ko) 패러프레이징을 이용한 감정 사전 구축 및 이를 이용한 텍스트 상의 감정 구조 인식 시스템 및 방법
US7620541B2 (en) Critiquing clitic pronoun ordering in french
CN118468860A (zh) 拼写检查模型生成方法、装置、计算设备及存储介质
Huang An evaluation of POS taggers for the CHILDES corpus
WO2022254604A1 (ja) 判定装置、判定方法、及びプログラム
Fairon A web-based system for automatic language skill assessment: Evaling
JP3605735B2 (ja) 自然言語の意味解析処理装置
JP3357213B2 (ja) 情報処理装置
Iyyappan Online Tamil Error Correctors and Their Needs: Dr. K. Iyyappan Guest Lecturer, Department of Tamil, LN Government College, Ponneri-601204 Call: 9962660279 Email: agniiyyappan@ gmail. com
JPH07160714A (ja) 日本語文校正装置
JPS62272357A (ja) 機械翻訳システムにおける入力文のエラ−表示方式
JPH1139347A (ja) テキスト検索システム,インデックス作成装置,テキスト検索装置及びコンピュータ読み取り可能な記録媒体

Legal Events

Date Code Title Description
A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A821

Effective date: 20040205

RD02 Notification of acceptance of power of attorney

Free format text: JAPANESE INTERMEDIATE CODE: A7422

Effective date: 20040205

A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20040303

RD04 Notification of resignation of power of attorney

Free format text: JAPANESE INTERMEDIATE CODE: A7424

Effective date: 20040205

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20060818

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20061120

A02 Decision of refusal

Free format text: JAPANESE INTERMEDIATE CODE: A02

Effective date: 20061205

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20070305

RD13 Notification of appointment of power of sub attorney

Free format text: JAPANESE INTERMEDIATE CODE: A7433

Effective date: 20070305

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A821

Effective date: 20070306

A911 Transfer to examiner for re-examination before appeal (zenchi)

Free format text: JAPANESE INTERMEDIATE CODE: A911

Effective date: 20070425

A912 Re-examination (zenchi) completed and case transferred to appeal board

Free format text: JAPANESE INTERMEDIATE CODE: A912

Effective date: 20070511