JPH1083277A - 連結型読み上げシステム及びテキストを音声に変換する方法 - Google Patents

連結型読み上げシステム及びテキストを音声に変換する方法

Info

Publication number
JPH1083277A
JPH1083277A JP9242622A JP24262297A JPH1083277A JP H1083277 A JPH1083277 A JP H1083277A JP 9242622 A JP9242622 A JP 9242622A JP 24262297 A JP24262297 A JP 24262297A JP H1083277 A JPH1083277 A JP H1083277A
Authority
JP
Japan
Prior art keywords
word
list
word list
phonological
speech
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP9242622A
Other languages
English (en)
Inventor
Kazue Hata
和江 畑
Kibler Nicolas
ニコラス・キブレ
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Holdings Corp
Original Assignee
Matsushita Electric Industrial Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Industrial Co Ltd filed Critical Matsushita Electric Industrial Co Ltd
Publication of JPH1083277A publication Critical patent/JPH1083277A/ja
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/06Elementary speech units used in speech synthesisers; Concatenation rules
    • G10L13/07Concatenation rules
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/02Methods for producing synthetic speech; Speech synthesisers
    • G10L13/04Details of speech synthesis systems, e.g. synthesiser structure or memory management

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Machine Translation (AREA)

Abstract

(57)【要約】 【課題】 テキストを自然で人間らしい音声に変換する
読み上げシステムを提供する。 【解決手段】 数値情報のようなコンピュータに記憶さ
れたテキストは、単語リスト発生器42によって処理さ
れて単語リストを生成する。上記単語リスト発生器42
は韻律的環境状態又はトークンを上記単語リストにおけ
る各語彙項目に割り当てる。次に、ある単語の韻律的環
境状態を用いてその単語の音韻的特徴を決定する。それ
を各単語に実行し、サンプルリストが生成される。次い
で、韻律的情報及び音韻的情報を用いて、サンプルリス
トは適切なディジタル/アナログ変換器28を介して連
続して再生されテキストを音声に変換する出力を生成す
る。出力結果は、テキストの文脈に対し適切なイントネ
ーションの変化を有し、自然で人間らしく読み上げる。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】本発明はテキストを音声に変
換する(text-to-speech、TTS)読み上げシステムに
関する。特に、本発明は、連結されるべき単語の韻律的
環境と隣接する単語の音韻的特徴をも考慮に入れて自然
な発音を提供することによって、高品質で自然に発音さ
れる音声を生成する連結型読み上げシステムに関する。
本システムは、特に、テーブルやスプレッドシート等に
おける数字を読み上げることに利用できる。
【0002】
【従来の技術及び発明が解決しようとする課題】手書き
された記録物からのデータをコンピュータに入力する処
理において、校正は疲れを招き、時間を大幅に消費する
仕事である。データを入力するオペレータは、目をコン
ピュータのスクリーンと原稿の間を常に移動させなけれ
ばならない。ときどき、2人が仕事をすることができれ
ば、彼らは校正の仕事を2人で分配し、1人は原稿から
データを大きく読み上げ、もう1人はコンピュータのス
クリーン上における入力データをチェックすることがで
きる。
【0003】データ入力の校正の処理は、音声合成シス
テムの使用によって容易にすることができる。そのよう
なシステムのおかげで、オペレータは入力されたデータ
を聞いている間、原稿を見続けることができる。音声合
成システムがこの概念を用いるので、オペレータは原稿
からデータを読み上げる別の人を必要としない。従っ
て、オペレータは1人で仕事をすることができる。しか
しながら、現在の音声合成システムを使用すると疲れて
しまう。なぜなら、音声の品質が悪く、自然なフレーズ
やイントネーションに欠けるからである。よって、現在
の音声合成システムは校正への応用には不完全である。
ユーザーの疲労は、単調なトーンや貧弱なフレーズが多
くの間違いを引き起こす数字の読み上げシステムに特に
顕著である。
【0004】本発明は、データ入力オペレータが疲労せ
ずに働ける非常に自然な音声を有する読み上げシステム
を提供する。上記読み上げシステムは、ディジタル方式
で録音された音声サンプルが連結され又は共に結合され
て出力である音声を生成する連結技術を使用する。本発
明は自然な音声の2つの変数を組み合わせることによっ
てより本物らしい出力音声を達成するが、上記2つの変
数は、(1)韻律的又はイントネーションの変化と
(2)各単語の最初と最後の音素と、隣接する単語の最
後と最初の音素との同時発音のための変化を表す変数で
ある。単語の各使用に対して、1組の韻律的及び文節的
環境ルールは、文脈上で適切なディジタル方式のサンプ
ルを選択するために適用される。その結果は、オペレー
タに疲れを誘発しないより自然な音声の合成された音声
である。よって、本システムを使用するオペレータはよ
り低い間違い率を喜ぶ。
【0005】本発明のシステムは、人間の読み手が校正
する間にすることを獲得する。それは、最後以外のすべ
ての語彙項目に対して最後ではないイントネーションを
用いて、行又は列における数字を読み上げる。このイン
トネーションは、聞き手に現在の数字が行又は列におけ
る最後の数字ではないとするきっかけを与える。行又は
列における最後の数字に達したときにユーザーに知らせ
るので、この文脈上のきっかけは校正することにおいて
非常に役に立つ。この情報は、コンピュータのスクリー
ン上のテキストと原稿上のテキストがデータ入力のミス
による語彙項目の同じ数字を有しないというような混入
や削除という間違いを検出することに非常に有効であ
る。
【0006】本発明は、入力文字列をその後の音声の合
成のためのシーケンスに変換する高品質な連結型読み上
げシステムを備える。本発明は、コンピュータから読出
し可能な記録媒体に記録された単語の辞書と、上記辞書
に接続された単語リスト発生器とを含む。上記単語リス
ト発生器は、語彙項目をコンピュータのメモリ内の単語
リストに作成して記憶する入力文字列を受信する。上記
単語リスト発生器は、辞書に記録された単語から入力文
字列に対応する単語までの単語リストを構築する。上記
単語リスト発生器は、入力文字列における整数に対応す
る数値の各々の桁に置かれる単語を加える1組の記録さ
れたルールを有する。従って、単語リスト発生器は適切
な数値の各々の桁に置かれる単語を挿入して、その結
果、整数“1,243”は“ワン サウザンド、トゥ
ハンドレッド フォーティスリー”と発音される。
【0007】単語リスト発生器は、複数のイントネーシ
ョンのタイプを表す韻律的環境トークンのリストをさら
に含む。単語リスト発生器は、韻律的環境トークンの少
なくとも1つを単語リストの語彙項目の少なくとも幾つ
かに割り当てる。好ましい具体例は、1つの韻律的環境
トークンを単語リストにおける単語の各々に割り当て
る。
【0008】本読み上げシステムはまた、コンピュータ
から読出し可能なメモリに記憶された音声サンプルのデ
ータベースを含む。音韻的特徴解析器は、単語リストに
おける単語の語彙項目を解析し、それらの単語の韻律的
環境を決定する。特に、好ましい具体例は音韻的特徴テ
ーブルを調べ、各単語の最初と最後のものを決定する。
これらの特徴は隣接する単語と比較され各単語の韻律的
環境を決定する。自然な音声において、音素は音韻的な
文脈が異なれば異なる発音がされる。この場合におい
て、本発明は最初と最後の音素に集中し、各単語の語彙
項目の前後の単語に基づいて発音を変更する。
【0009】韻律的環境情報と音韻的特徴情報と共に単
語リスト発生器によって構成された単語リストを用い
て、読み上げシステムは音声サンプルのデータベースか
らサンプルリストを構築する。上記サンプルリストは、
音声の合成のためのシーケンスを供給するように連結さ
れた、実際にサンプリングされたデータを表す。サンプ
ルリストは、ディジタル/アナログ変換器を介して出力
されて適切なスピーカシステムを介して増幅されて再生
される音声信号を生成してもよい。
【0010】本発明、その目的及びその効果のより完全
な理解のためには、以下の説明と添付の図面を参照する
必要がある。本発明の目的は以上の問題点を解決し、高
品質な連結型読み上げシステムと、テキストからより自
然な音声に変換する方法とを提供することにある。
【0011】
【課題を解決するための手段】本発明に係る請求項1記
載の読み上げシステムは、入力文字列を音声合成のため
のシーケンスに変換する高品質な連結型読み上げシステ
ムであって、上記読み上げシステムは、コンピュータか
ら読出し可能な記録媒体に記憶された単語の辞書と、コ
ンピュータから読出し可能な記録媒体に記憶された音声
サンプルのデータベースと、上記辞書に接続され、上記
入力文字列を処理して語彙項目を単語リストに作成して
記憶する単語リスト発生器とを備え、上記単語リスト発
生器は上記入力文字列に対応する、上記辞書に記憶され
た単語からの上記単語リストを構築し、上記単語リスト
発生器は、複数のイントネーションのタイプを表す韻律
的環境トークンのリストをさらに有し、上記単語リスト
発生器は、少なくとも1つの上記韻律的環境トークンを
上記単語リストの語彙項目の少なくとも幾つかに割り当
て、上記単語リストの語彙項目と上記割り当てられた韻
律的環境トークンを解析し、(a)上記単語リストの語
彙項目と、(b)上記語彙項目の韻律的環境と、(c)
隣接する単語の音韻的特徴とに基づいて音声サンプルの
サンプルリストを構築する音韻的特徴解析器と、上記サ
ンプルリストをアナログ変換ユニットに連鎖的に提供し
てテキストを音声に変換する音声信号を生成する出力部
とを備えることを特徴とする。
【0012】また、請求項2記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記単
語リスト発生器は、上記入力文字列における整数に対応
する数値の各々の桁に置かれる単語を加えるようにさら
に動作可能であることを特徴とする。
【0013】さらに、請求項3記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記デ
ータベースは、上記辞書の単語の各々に対応する音声サ
ンプルを備えることを特徴とする。
【0014】また、請求項4記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記デ
ータベースは、上記辞書の単語の各々に対する1組の音
声サンプルを備え、上記1組の音声サンプルは上記複数
のイントネーションのタイプの各々に対する音声サンプ
ルを含むことを特徴とする。
【0015】さらに、請求項5記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記単
語リスト発生器は順序付けられたペアとして上記単語リ
ストを構築し、上記各ペアは単語トークンと韻律的環境
トークンとを備えることを特徴とする。
【0016】また、請求項6記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記韻
律的特徴解析器は、上記単語リストにおける語彙項目の
少なくとも前の単語を調べ、隣接する単語の音韻的特徴
を決定することを特徴とする。
【0017】さらに、請求項7記載の読み上げシステム
は、請求項1記載の読み上げシステムにおいて、上記音
韻的特徴解析器は、上記単語リストにおける語彙項目の
少なくとも次の単語を調べ、隣接する単語の音韻的特徴
を決定することを特徴とする。
【0018】また、請求項8記載のテキストを音声に変
換する方法は、音声合成される音声に変換されるべきテ
キストを表す入力文字列を受信することと、コンピュー
タから読出し可能な記録媒体に記憶された単語の辞書に
アクセスすることによって上記入力文字列に対応する単
語トークンの単語リストを構成することと、上記単語リ
ストにおける単語トークンの少なくとも幾つかが、対応
する韻律的環境トークンに関連するように、上記単語リ
ストに異なるイントネーションのタイプを表す韻律的環
境トークンを追加することと、上記単語リストにおける
隣接する単語の音韻的特徴を調べることによって上記単
語リストにおける上記単語トークンに関連する音韻的属
性を解析することと、(a)上記単語リストトークン
と、(b)上記対応する韻律的環境トークンと、(c)
上記音韻的属性とに基づいて、音声サンプルのサンプル
リストを構築することと、アナログ変換ユニットへの連
結型出力に対する上記サンプルリストを提供し、テキス
トを音声に変換する音声信号を生成することとを備える
ことを特徴とする。
【0019】さらに、請求項9記載のテキストを音声に
変換する方法は、請求項8記載の方法において、上記単
語リストを構成するステップは、上記入力文字列におけ
る整数に対応する数値の各々の桁に置かれる単語を加え
ることを含むことを特徴とする。
【0020】また、請求項10記載のテキストを音声に
変換する方法は、請求項8記載の方法において、上記サ
ンプルリストを構築するステップは、上記辞書の単語の
各々に対応するコンピュータの読出し可能媒体に記憶さ
れた音声サンプルのデータベースからの上記音声サンプ
ルを得ることによって実行されることを特徴とする。
【0021】さらに、請求項11記載のテキストを音声
に変換する方法は、請求項10記載の方法において、上
記データベースは上記辞書の単語の各々に対する1組の
音声サンプルを備え、上記1組の音声サンプルは上記異
なるイントネーションのタイプの各々に対する音声サン
プルの語彙項目を含むことを特徴とする。
【0022】また、請求項12記載のテキストを音声に
変換する方法は、請求項8記載の方法において、単語リ
ストを構築する上記ステップは、順序付けられたペアと
して上記単語リストを構築することを備え、上記各ペア
は単語トークンと韻律的環境トークンとを備えることを
特徴とする。
【0023】さらに、請求項13記載のテキストを音声
に変換する方法は、請求項8記載の方法において、音韻
的属性を解析する上記ステップは、上記単語リストにお
ける語彙項目の少なくとも前の単語を調べ、前の単語の
音韻的特徴に基づいて上記属性を決定することを特徴と
する。
【0024】また、請求項14記載のテキストを音声に
変換する方法は、請求項8記載の方法において、音韻的
属性を解析する上記ステップは、上記単語リストにおけ
る語彙項目の少なくとも次の単語を調べ、次の単語の音
韻的特徴に基づいて上記属性を決定することを特徴とす
る。
【0025】
【発明の実施の形態】以下、図面を用いてより詳細に説
明する。数字の読み上げシステムは図1において図式で
描かれている。上記数字の読み上げシステムは、ここに
記述したソフトウェアに関連してプログラムされたコン
ピュータによって実施されるように設計される。図1に
おいて、モニター12を有するコンピュータシステム1
0が図示される。スプレッドシートアプリケーションの
ような目標のアプリケーション14がモニター12上に
表示され、それは本発明の数字の読み上げシステムへの
入力ソースである。コンピュータ10は適切なスピーカ
システムを含む。図示された実施形態において、スピー
カ16はモニター12の左右の側面に設けられる。もち
ろん、スピーカ16の他の設置位置もまた可能である。
【0026】図1はまた、コンピュータシステム10の
より重要な内部コンポーネントの幾つかを図示する。こ
れらは、中央処理装置又はCPU20と、ランダムアク
セスメモリ又はRAM22と、ディスク記憶部を含むデ
ィスクドライブシステム24と、SCSI回路のような
適切なディスクインターフェース回路26(ときに、S
CSI回路という。)とを含む。これらのコンポーネン
トは、コンピュータシステム10の一部分を形成するコ
ンピュータバスによって共に接続される。好ましい実施
形態は、市販用で入手できる音声カード27と協働する
ように設計される。音声カード27は、適切なディジタ
ル/アナログ変換回路28を含み、ディジタル方式で録
音されたサンプルを、増幅器30によって増幅されてス
ピーカ16を介して再生されるアナログ信号に変換す
る。上記音声カード27は、図示されたようにコンピュ
ータバスへの接続によってCPU20に好ましくは接続
される。音声カード27は、例えば、クリエイティブ・
ラブズ、インク(Creative Labs,Inc)から入手可能な
市販されているサウンドブラスタカード(Soundblsterc
ard)にすることができる。
【0027】コンピュータシステム10は、幾つかの機
能モジュールを実施するようプログラムされる。これら
は図1に図示され、次で記述する。
【0028】本発明の読み上げシステムは、連結型読み
上げシステムである。連結とは、個々の音声サンプルを
シーケンスに繋ぎ合わせたり、組み合わせたりするプロ
セスである。個々の音声サンプルは、音素又は単語のよ
うな音声の個別の構成単位を表す。適当なサンプリング
レートで音声カード26を介して再生されるときに、個
々のサンプルは繋ぎ合わされて音声をシミュレーション
する音声を生成する1つのシーケンスを生成する。連結
型音声システムは公知であるが、本発明は、韻律的環境
と音韻的特徴を考慮に入れることによって、現存する連
結型音声技術を大幅に改善する。本発明の読み上げシス
テムはこれらの属性を用いて、与えられた文脈に対する
適切な発音と、適切なイントネーションと、適切な句切
りとを有する自然な音声による音声を生成する。その結
果物は聞いても疲労しないより自然な音声である。
【0029】上記読み上げシステムは、サンプリングさ
れた複数の音声の辞書40を有する。これらは、予め録
音されて記憶され、ディジタル方式でサンプリングされ
た音声である。音声サンプルのディジタル化に使用した
サンプリングレートは、システムの要求に基づいて選択
されることができる。もしメモリ資源が制限されれば、
より低いサンプリングレート(例えば、11キロヘル
ツ)を使用してもよい。より高品質な音声のためには、
より高いサンプリングレート(例えば、22キロヘル
ツ)を使用してもよい。もしコンパクトディスクの高品
質な音声を所望するならば、さらに高いサンプリングレ
ート(例えば、44.1キロヘルツ)を使用してもよ
い。所望するならば、サンプルの辞書40は、異なるサ
ンプリングレートでサンプリングされた音声毎の辞書を
含んでもよい。上記読み上げシステムは、どの辞書を使
用するのかを選択する、ユーザーインターフェースコン
トロールシステムにおける適切なボタンを提供されるこ
とができる。一般的には、サンプルの辞書40は、連結
型読み上げシステムが繋ぎ合わせる可能性のあるすべて
の音声の完全なコレクションを備える。比較的に限られ
た語彙数(すなわち、システムが発音可能な単語の限ら
れた数)を有する数字の読み上げシステムに対して、辞
書の語彙項目は個々の単語にすることができる。より多
い語彙数がサポートされなければならないより複雑な読
み上げシステムにおいては、サンプルの辞書40は、個
々の音素のような、より根本的な構成要素の音声のコン
ポーネントを記憶してもよい。完全な単語又は個々の音
素のいずれを記憶するかが、システム設計では大きな論
点である。システムの設計者は、特定のアプリケーショ
ンに適合するように適切な“粒状度”又は辞書の語彙項
目のサイズを選択すべきである。
【0030】好ましい実施形態は数字の読み上げシステ
ムとして最適化されている。よって、サンプルの辞書4
0内の各語彙項目は、個々の単語のディジタル方式で録
音されたサンプルである。より全体的に以下で説明され
るように、本システムは、韻律的環境と音韻的特徴とを
考慮することによって、より自然な音声の出力を達成す
る。人間が準備されたテキストを読むとき、話される単
語には、それらがどのように用いられるか、それらが準
備されたテキストのどこで現れるかを頼りに、異なるイ
ントネーション又はボイスピッチが与えられる。人間の
読み手は、話されている単語の韻律的環境に従ってイン
トネーションを直感的に変更する。イントネーションに
おける変化は、どこがフレーズの始まりと終わりなの
か、どこが文章の始まりと終わりなのか、又はどこが数
字の行の始まりと終わりなのかのような韻律的情報を伝
達して、聞き手に大きなきっかけを提供する。これらの
韻律的なきっかけは、フレーズやセンテンスの構成に制
限されることはない。それらはまた、数字を読むときに
重要な情報を伝達する。英語では、数字はトリプレット
(thousand=1,000、million=1,000,000等のように3桁
ずつに区切ったもので、3桁の組)に自然にさらに細分
化される。これらのトリプレットは一般にコンマで区切
られる(例えば、1,234である。)。英語で数字を
読むと、読み手は、それらが数字の全体においてどこに
現れるかによって、異なる個々の桁で異なるボイスピッ
チ又はイントネーションを用いる。従って、前述の例
(1,234)は、異なるピッチの音調曲線が、最初の
桁(1)、コンマの次の桁(2)及び最後の桁(4)に
置かれるように、“ワン サウザンド、トゥ ハンドレ
ッドサーティフォー(1,234)”と発音されるであ
ろう。
【0031】個々の単語は韻律的環境に依存して、異な
るピッチの音調曲線を有してもよいので、サンプルの辞
書40は各ピッチの音調曲線に対して異なるサンプルを
含む。従って、口頭英語をシミュレーションするように
設計された数字の読み上げシステムにおいて、最初のイ
ントネーション、区切りのイントネーション及び最後の
イントネーションの3つの異なるイントネーション又は
ピッチの音調曲線が用いられてもよい。よって、辞書内
の各単語は、各イントネーションに対して1回で、計3
回記憶される。
【0032】さらに出力音声の品質を向上するために、
数字の読み上げシステムはまた、人間の読み手が、どの
音声がその音素のすぐ前及び後なのかに依存して、異な
る音素を発音するという事実を考慮に入れる。これら
は、より自然で人間らしい音声特性を合成された音声に
与える音韻的特徴である。本発明の連結型読み上げシス
テムは、連結された要素(例えば、音素又は単語)の各
々を解析し、上記要素の隣接した要素に基づいて適切な
音声を選択する。数字の読み上げに最適化された好まし
い実施形態においては、個々の単語は、正確な音韻の設
定に必要とされる異なる発音に対応する種々の形でサン
プルの辞書40に記憶される。従って、韻律的環境の各
々に対して1つの語彙項目を記憶することに加えて、サ
ンプルの辞書40はまた、各韻律的環境に対する単語の
すべての発音の変形型を記憶する。与えられた単語の前
後の単語がどのようなものかに拘わらず及び韻律的環境
がどのようなものかに拘わらずに、サンプルの辞書40
は適合するサンプルを含む。
【0033】図1を参照すると、数字の読み上げシステ
ムは、好ましい実施形態の2つのパスシステムの第1の
パスを実行する単語リスト発生器42を使用する。単語
リスト発生器42は、音声に変換されるべきテキストを
含む入力バッファ44にアクセスする。上記入力バッフ
ァ44は任意の適切な機構を介してテキストを有してロ
ードされることができる。例えば、入力バッファ44は
目標のアプリケーション14からのデータをコピーする
ことによってロードされることができる。単語リスト発
生器42は、実施の異なる可能性のある韻律的環境状態
を識別する韻律的環境テーブル46を含む。好ましい実
施形態は、最初の状態、最後の状態及び区切りの状態で
ある3つの韻律的環境状態を定義する。これらの3つの
状態は、この好ましい実施形態が最適化されている数字
の読み上げアプリケーションにおいてうまく機能する。
もちろん、システムは、アプリケーションに依存して、
より多い又はより少ない韻律的環境状態を用いて構成さ
れてもよい。
【0034】単語リスト発生器42は、入力バッファ4
4に記憶されたテキストを処理して単語リストを構築す
る。これは単語リストバッファ48に記憶される。この
プロセスは、図2、図3及び図4を伴って以下でより全
体的に記述する。
【0035】本質的に、単語リストは、出力の音声にお
いて合成されるために必要である各単語に対する単語の
トークンを含むリストである。これらの単語のトークン
は、それらが出力の音声において発音されるであろう順
番で配列される。韻律的環境のトークンは各単語に関連
し、単語リスト内の各単語の韻律的状態を表す。
【0036】数字の読み上げシステムは音韻的特徴解析
器50をさらに備える。上記音韻的特徴解析器50は、
単語が何から始まり何で終わるかを辞書における各単語
に対して識別する音韻的特徴テーブル52を含む。音韻
的特徴解析器50は、音韻的特徴テーブル52を用いて
単語リストバッファ48における各語彙項目の前後の単
語を調査して、単語リストバッファ48における各語彙
項目を解析する。この情報を用いて、音韻的特徴解析器
50はサンプルの辞書40にアクセスしてサンプルリス
トを構築する。上記サンプルリストはサンプルリストバ
ッファ54に記憶される。単語リストバッファ48にお
ける単語の適切な韻律的環境と音韻的特徴に対応する実
際のディジタル方式のサンプルは、上記サンプルリスト
バッファ54に記憶される。次いで、単語リストバッフ
ァ48はディジタル/アナログ変換器28から逐次出力
され、音声出力信号を生成する。
【0037】単語リスト発生器42と音韻的特徴解析器
50は、2つのパスの変換プロセスを実行する。このプ
ロセスは図2に図示される。第1のパスの間に、単語リ
ストと韻律的環境リストが生成される。第2のパスの間
に、サンプルリストが生成される。図2において、第1
のパスはステップ80で始まり、第2のパスはステップ
90で始まる。
【0038】入力テキストが入力バッファ44にロード
された後、単語リスト発生器42はステップ82で前処
理ステップを実行する。前処理ステップにおいて、入力
バッファにおけるテキストはクリアされ、いかなるユー
ザーの句読記号をも除去又は正規化する。従って、数字
の読み上げシステムにおいて、前処理ステップは、コン
マ、ハイフン及びスラッシュ記号を除去して、それらを
テキストを通して矛盾をなくさせる。これらの句読記号
は、句読や他の単語が挿入されるところを示す韻律的な
きっかけとして機能することができる。例えば、ハイフ
ンは、“減算(マイナス)”として読まれてもよいし、
スラッシュ記号は、“除算”として読まれてもよい。コ
ンマは数字がどのようにしてトリプレットに分割される
かを表してもよい。
【0039】次にステップ84において、入力文字列の
整数部分は数値に変換される。説明すると、テキストに
記述された数字は、数字の個々の桁を表すASCIIコ
ードとして現れる。番号がテキストから音声への変換の
ために適切に処理されることができるように、ASCI
Iコードの表現は数値の表現に変換されなければならな
い。実質的に、元の数字を表すASCIIコードの文字
列は、コンピュータが整数データのタイプとして処理す
る整数形式に変換される。
【0040】数字の数値への変換後、数字はステップ8
6において複数の範囲に正規化される。英語のテキスト
から音声への変換のアプリケーションにおいては、数字
は典型的に正規化されてトリプレットにグループ化され
る。他の言語は数を異なる音域にグループ化する。例え
ば、日本語では、数は4桁のグループにグループ化され
る。数値をトリプレットのような複数の範囲にグループ
化することによって、次いで、単語リスト発生器42は
適切な各々の桁に置かれる単語を単語リストに挿入する
ことができる。従って、数値“1,200”は“one-th
ousand-two-hundred”という単語リストを生成する。
【0041】よって、ステップ88において、単語リス
ト発生器42は単語リストを生成し、それを単語リスト
データ構造120に記憶する。図4を伴って以下でより
完全に説明される単語リストデータ構造120は、単語
リストバッファ48に記憶される。図示されるように、
単語リストデータ構造120は、順序付けられたペアの
アレイを備える。各順序付けられたペアは、話されるべ
き単語を表すトークンとその単語の韻律的環境状態とを
備える。単語リスト発生器42は、韻律的環境テーブル
46にアクセスして韻律的環境状態を決定し、それの現
在の韻律的環境における単語を発音するときにどのイン
トネーションが用いられるべきかを示す環境トークンを
割り当てる。特に、単語リスト発生器42は、入力バッ
ファのテキスト内のそれの位置に関係する単語と、各々
の桁に置かれる句読記号とのそれの関係とを調査する。
もし単語が数値における最初の単語として現れるなら
ば、それは最初の状態トークンが割り当てられる。もし
単語が数値における最後の単語であるならば、それは最
後の状態トークンが割り当てられ、もし単語が他の基準
に遭遇すれば、それは区切りの状態トークンが割り当て
られる。区切り状態は擬似コードにおける“コンマ”状
態として参照される。
【0042】単語リストが構成された後に、第2の処理
のパスがステップ90で始まる。本質的に、第2のパス
は単語リストにおける各語彙項目を調べて、サンプルリ
ストを構築する。単語リストの先頭で始まり、最後に達
するまでリストを通して続き、処理ループは実行される
(ステップ92乃至ステップ110)。ステップ94に
おいて、単語と韻律的環境トークンは単語リストにおけ
る現在の語彙項目から読まれる。次に、ステップ96に
おいて、現在の語彙項目に対する音韻的特徴は、音韻的
特徴テーブル52を用いて決定される。特にこのステッ
プ94において、現在の単語に隣接する(前後の)単語
が調査される。ステップ98において、前の単語の終わ
りと次の単語の始まりが用いられて音韻的特徴テーブル
52にアクセスし、現在の単語の音韻的特徴状態を決定
する。
【0043】ステップ100の現在の単語では、それの
韻律的環境属性とそれの音韻的特徴属性が、適切なディ
ジタル方式のサンプルをサンプルリストデータ構造12
2にルックアップしてコピーするために用いられる。サ
ンプルリストデータ構造122はサンプルリストバッフ
ァ54に記憶される。本質的に、このステップ100
は、現在の文脈に対して適切な音声とイントネーション
を有するディジタル方式のサンプルを選択することによ
って、サンプルリストを構築する。ディジタル方式のサ
ンプルの語彙項目をサンプルリストに加えた後に、(ス
テップ110における)手順は、現在の語彙項目のポイ
ンタを単語リストにおける次の語彙項目に指し示す。次
いで、上記手順は、単語リストにおける最後の語彙項目
が処理されるまで、サイクルが何度も繰り返されるステ
ップ94に後戻りするように分岐する。
【0044】単語リストにおける最後の語彙項目が処理
された後に、サンプルリストは連結型再生のために必要
とされるすべてのディジタル方式のサンプルの完全なシ
ーケンスを含む。このことは、サンプルリストが、ディ
ジタル/アナログ変換器28を介して順序通り格納され
たサンプルを逐次出力することによって再生される、ス
テップ112で図示される。このことは、スピーカ16
を介して増幅されて再生されてもよい連結されて合成さ
れた音声信号を結果として生じる。
【0045】それの好ましい実施形態における本発明を
さらに図示して、図4は、現在の実施において用いられ
る幾つかのデータ構造を示す。データ構造は、コンピュ
ータのランダムアクセスメモリ22における対象物とし
て物理的に実施される。(単語リストバッファ48に記
憶された)単語リストデータ構造120は本質的に、コ
ード又はトークンがシステムの有限の語彙における単語
を表すように割り当てられる整数の配列である。単語リ
ストデータ構造120は順序付けされた1組のペアを備
え、各順序付けされたペアは、サンプルの辞書40から
の単語を表すトークンと、その単語に関連する韻律的環
境状態のトークンとを備える。韻律的環境状態のトーク
ンは環境テーブル46において説明される。好ましい実
施形態においては、最初の状態、最後の状態及び区切り
の状態の3つの状態が認識される。もちろん、所望する
ならば、異なる数の韻律的環境状態を用いてシステムを
実施してもよい。単語リストデータ構造120には、第
1の処理パスの間に、単語リスト発生器42によってデ
ータを入力してもよい。
【0046】第2の処理のパスは、サンプルリストバッ
ファ54に記憶されたサンプルリストデータ構造122
を占めることを含む。音韻的特徴解析器50は現在の語
彙項目の前の単語及び次の単語を識別して、音韻的特徴
テーブル52にアクセスして、単語が何から始まり何で
終わるかを確かめる。次いで、この情報を用いて、音韻
的特徴解析器はサンプルの辞書40から適切なサンプル
を選択する。適切なサンプルの選択は、単語の識別子又
はトークンと、その語彙項目に関連する韻律的環境と、
その現在の文脈における語彙項目の発音に影響を及ぼす
音韻的特徴との3つの情報を知ることを含む。単語の識
別子のトークンと韻律的環境情報は単語リストから得ら
れる。音韻的特徴情報は上述した音韻的特徴テーブル5
2にアクセスすることによって得られる。この情報を用
いて、適当なサンプルが識別され、サンプルの辞書40
から抜粋される。上記サンプルは、音声カード27を介
して後に再生されて音声機器に関連するディジタル方式
のサンプルとして、サンプルリストデータ構造122内
に置かれる。
【0047】前述から、本発明は韻律的環境情報及び音
韻的特徴情報を組み合わせてより自然な人間らしい読み
上げを達成する連結型読み上げシステムを提供すること
が理解されるであろう。本発明は数字の読み上げシステ
ムに関して図示して説明したが、図示した実施形態にお
いて用いられる技術は他のタイプの読み上げシステムに
も適用されることができることは明白であろう。よっ
て、本発明が、添付した特許請求の範囲における本発明
の精神から逸脱することなく変形例又は変更例が可能で
あることは理解されるであろう。
【0048】<メモリにおけるオブジェクト>システム
の有限の語彙における単語を表すコードを割り当てられ
る整数の配列である、“単語”のリストである。
【0049】各1つが、例えば“最初”、“最後”、
“コンマ”等のようなイントネーションのタイプの分類
の1つを割り当てられる整数の配列である、“韻律的環
境”のリストである。
【0050】システムの語彙における単語の各々に属す
る音韻的特徴の配列である。サンプルの特徴は“母音で
終わる”又は“Sで始まる”であるように、音韻的特徴
は単語が始まる音素のタイプと単語が終わる音素のタイ
プとを表す、“音韻的特徴”のテーブルである。
【0051】各々の複数の録音が異なる環境に対して適
切であるように、システムの語彙における単語の各々の
1組の録音(又は“サンプル”)である。
【0052】音声装置を介して連続して再生されるべき
“サンプル”のリストである。
【0053】<モジュール1:単語及び韻律的環境リス
トの構築>どのタイプの数字又は状態が生成されるべき
かに依存して、幾つかの異なるモジュールがここで用い
られる。例えば、1乃至999,999,999の間の
整数を生成する擬似コードを表す。
【0054】“単語XにイントネーションYを加える”
と言うと、これは、新しい語彙項目が上述したような単
語リスト及び韻律的環境リストに生成されることと、こ
れらはそれぞれ値X、値Yを割り当てられるということ
を意味する。
【0055】入力文字列を除去する。整数部分を数値に
変換する。
【0056】各トリプル(103毎に区切られ、それぞ
れ3つの数字からなるmillions(106)、thousands
(103)、ones(101))に対して、次のことを実行
する。(例えば、もし与えられる整数が123,04
9,228ならば、123と、49と、228とを用い
てこのループを介して3つのパスを生成する)。
【0057】もし百の位が0でなければ、“one
(1)”乃至“nine(9)”に“hundred(100)"を
足したものを加え、10と0の位が共に0でありかつそ
れがones(101)のトリプルであれば最後のイントネ
ーションを選択し、それ以外は中間のイントネーション
である。
【0058】もし十の位が1で一の位が0でなければ、
適切な“teen”の単語を加え、これがones(101)の
トリプルであれば最後のイントネーションを選択し、そ
れ以外は中間のイントネーションを選択する。
【0059】もし十の位が0でなければ、この値に依存
して“ten(10)”、“twenty(20)”、…、“nin
ety(90)”を加え、十の位が0でありかつこれがone
s(101)のトリプルであれば最後のイントネーション
を用い、それ以外は中間のイントネーションを選択す
る。
【0060】もし一の位が0でなければ、その値に依存
して“one(1)”、“two(2)”、…、“nine
(9)”を加え、一の位が0でありかつこれがones(1
1)のトリプルであれば最後のイントネーションを用
い、それ以外は中間のイントネーションを選択する。
【0061】もしこれがmillions(106)のトリプル
であれば、“million(1,000,000)”の単語を加え、も
しこれがthousands(103)のトリプルであれば、“th
ousand(1,000)”の単語を加える。もしこれがmillio
ns(106)のトリプルでありかつ数字の下6桁が00
0000であるか、又はこれがthousands(103)のト
リプルでありかつ数字の下3桁が000であれば、最後
のイントネーションを用い、それ以外はコンマのイント
ネーションを用いる。
【0062】<モジュールII:サンプルリストの構築
>このモジュールの機能は、利用できるサンプルに対応
するコードを有する前述したサンプルリストをすべて満
たすことである。
【0063】上記モジュールは、(サンプルがサンプル
リストに加えられる順序で)逐一、単語リストと韻律的
環境リストとを通して進行し、次のうちの1つに反応す
る1組のルールに従って、各1つに対する1つのサンプ
ルを選択する:この単語の識別子;この単語の韻律的環
境;(音韻的特徴テーブルにおいてそれらをルックアッ
プすることによって検索された)前の単語の音韻的特徴
である。次の単語の音韻的特徴も同様である。
【0064】
【発明の効果】以上詳述したように、本発明に係る請求
項1記載の読み上げシステムによれば、入力文字列を音
声合成のためのシーケンスに変換する高品質な連鎖的読
み上げシステムであって、上記読み上げシステムは、コ
ンピュータから読出し可能な記憶媒体に記憶された単語
の辞書と、コンピュータから読出し可能な記憶媒体に記
憶された音声サンプルのデータベースと、上記辞書に接
続され、上記入力文字列を処理して単語リストに語彙項
目を作成して記憶する単語リスト発生器とを備え、上記
単語リスト発生器は上記入力文字列に対応する、上記辞
書に記憶された単語からの上記単語リストを構築し、上
記単語リスト発生器は、複数のイントネーションのタイ
プを表す韻律的環境トークンのリストをさらに有し、上
記単語リスト発生器は、少なくとも1つの上記韻律的環
境トークンを上記単語リストの語彙項目の少なくとも幾
つかに割り当て、上記単語リストの語彙項目と上記割り
当てられた韻律的環境トークンを解析し、(a)上記単
語リストの語彙項目と、(b)上記語彙項目の韻律的環
境と、(c)隣接する単語の音韻的特徴とに基づいて音
声サンプルのサンプルリストを構築する音韻的特徴解析
器と、上記サンプルリストをアナログ変換ユニットに連
鎖的に提供してテキストを音声に変換する音声信号を生
成する出力部とを備える。従って、韻律的環境情報と音
韻的特徴情報とをサンプルのサンプルリストを構築する
ことに使用したので、上記読み上げシステムは、与えら
れた文脈に対する適切な発音と、適切なイントネーショ
ンと、適切な句切りとを有するより自然な人間らしい音
声を出力することが可能である。
【0065】また、請求項2記載の読み上げシステムに
おいては、請求項1記載の読み上げシステムにおいて、
上記単語リスト発生器が、上記入力文字列における整数
に対応する数値の各々の桁に置かれる単語を加えるよう
にさらに動作可能である。従って、韻律的環境情報と音
韻的特徴情報とをサンプルのサンプルリストを構築する
ことに使用したので、上記読み上げシステムは、与えら
れた文脈に対する適切な発音と、適切なイントネーショ
ンと、適切な句切りとを有するより自然な人間らしい音
声を出力することが可能である。
【0066】さらに、請求項3記載の読み上げシステム
においては、請求項1記載の読み上げシステムにおい
て、上記データベースが、上記辞書の単語の各々に対応
する音声サンプルを備える。従って、韻律的環境情報と
音韻的特徴情報とをサンプルのサンプルリストを構築す
ることに使用したので、上記読み上げシステムは、与え
られた文脈に対する適切な発音と、適切なイントネーシ
ョンと、適切な句切りとを有するより自然な人間らしい
音声を出力することが可能である。
【0067】また、請求項4記載の読み上げシステムに
おいては、請求項1記載の読み上げシステムにおいて、
上記データベースが、上記辞書の単語の各々に対する1
組の音声サンプルを備え、上記1組の音声サンプルは上
記複数のイントネーションのタイプの各々に対する音声
サンプルを含む。従って、韻律的環境情報と音韻的特徴
情報とをサンプルのサンプルリストを構築することに使
用したので、上記読み上げシステムは、与えられた文脈
に対する適切な発音と、適切なイントネーションと、適
切な句切りとを有するより自然な人間らしい音声を出力
することが可能である。また、音声サンプルが複数のイ
ントネーションのタイプの各々に対する音声サンプルを
含むので、上記読み上げシステムはさらに自然な音声を
出力することができる。
【0068】さらに、請求項5記載の読み上げシステム
においては、請求項1記載の読み上げシステムにおい
て、上記単語リスト発生器は順序付けられたペアとして
上記単語リストを構築し、上記各ペアは単語トークンと
韻律的環境トークンとを備える。従って、韻律的環境情
報と音韻的特徴情報とをサンプルのサンプルリストを構
築することに使用したので、上記読み上げシステムは、
与えられた文脈に対する適切な発音と、適切なイントネ
ーションと、適切な句切りとを有するより自然な人間ら
しい音声を出力することが可能である。
【0069】また、請求項6記載の読み上げシステムに
おいては、請求項1記載の読み上げシステムにおいて、
上記韻律的特徴解析器は、上記単語リストにおける語彙
項目の少なくとも前の単語を調べ、隣接する単語の音韻
的特徴を決定する。従って、韻律的環境情報と音韻的特
徴情報とをサンプルのサンプルリストを構築することに
使用したので、上記読み上げシステムは、与えられた文
脈に対する適切な発音と、適切なイントネーションと、
適切な句切りとを有するより自然な人間らしい音声を出
力することが可能である。また、上記音韻的特徴解析器
は単語リストにおける語彙項目の少なくとも前の単語を
調べて隣接する単語の音韻的特徴を決定するので、上記
読み上げシステムはより人間らしい音声を出力すること
ができる。
【0070】さらに、請求項7記載の読み上げシステム
においては、請求項1記載の読み上げシステムにおい
て、上記音韻的特徴解析器は、上記単語リストにおける
語彙項目の少なくとも次の単語を調べ、隣接する単語の
音韻的特徴を決定する。従って、韻律的環境情報と音韻
的特徴情報とをサンプルのサンプルリストを構築するこ
とに使用したので、上記読み上げシステムは、与えられ
た文脈に対する適切な発音と、適切なイントネーション
と、適切な句切りとを有するより自然な人間らしい音声
を出力することが可能である。また、上記音韻的特徴解
析器は単語リストにおける語彙項目の少なくとも次の単
語を調べて隣接する単語の音韻的特徴を決定するので、
上記読み上げシステムはより人間らしい音声を出力する
ことができる。
【0071】また、請求項8記載のテキストを音声に変
換する方法においては、音声合成される音声に変換され
るべきテキストを表す入力文字列を受信することと、コ
ンピュータから読出し可能な記憶媒体に記憶された単語
の辞書にアクセスすることによって上記入力文字列に対
応する単語トークンの単語リストを構成することと、上
記単語リストにおける単語トークンの少なくとも幾つか
が、対応する韻律的環境トークンに関連するように、上
記単語リストに異なるイントネーションのタイプを表す
韻律的環境トークンを追加することと、上記単語リスト
における隣接する単語の音韻的特徴を調べることによっ
て上記単語リストにおける上記単語トークンに関連する
音韻的属性を解析することと、(a)上記単語リストト
ークンと、(b)上記対応する韻律的環境トークンと、
(c)上記音韻的属性とに基づいて、音声サンプルのサ
ンプルリストを構築することと、アナログ変換ユニット
への連鎖的出力に対する上記サンプルリストを提供し、
テキストを音声に変換する音声信号を生成することとを
備える。従って、韻律的環境情報と音韻的特徴情報とを
サンプルのサンプルリストを構築することに使用したの
で、上記方法は、与えられたテキストからその文脈に対
する適切な発音と、適切なイントネーションと、適切な
句切りとを有するより自然な人間らしい音声を出力する
ことが可能である。
【0072】さらに、請求項9記載のテキストを音声に
変換する方法においては、請求項8記載の方法におい
て、上記単語リストを構成するステップは、上記入力文
字列における整数に対応する数値の各々の桁に置かれる
単語を加えることを含む。従って、韻律的環境情報と音
韻的特徴情報とをサンプルのサンプルリストを構築する
ことに使用したので、上記方法は、与えられたテキスト
からその文脈に対する適切な発音と、適切なイントネー
ションと、適切な句切りとを有するより自然な人間らし
い音声を出力することが可能である。
【0073】また、請求項10記載のテキストを音声に
変化する方法においては、請求項8記載の方法におい
て、上記サンプルリストを構築するステップは、上記辞
書の単語の各々に対応するコンピュータから読出し可能
な記憶媒体に記憶された音声サンプルのデータベースか
らの上記音声サンプルを得ることによって実行される。
従って、韻律的環境情報と音韻的特徴情報とをサンプル
のサンプルリストを構築することに使用したので、上記
方法は、与えられたテキストからその文脈に対する適切
な発音と、適切なイントネーションと、適切な句切りと
を有するより自然な人間らしい音声を出力することが可
能である。
【0074】さらに、請求項11記載のテキストを音声
に変換する方法においては、請求項10記載の方法にお
いて、上記データベースは上記辞書の単語の各々に対す
る1組の音声サンプルを備え、上記1組の音声サンプル
は上記異なるイントネーションのタイプの各々に対する
音声サンプルの語彙項目を含む。従って、韻律的環境情
報と音韻的特徴情報とをサンプルのサンプルリストを構
築することに使用したので、上記方法は、与えられたテ
キストからその文脈に対する適切な発音と、適切なイン
トネーションと、適切な句切りとを有するより自然な人
間らしい音声を出力することが可能である。また、音声
サンプルが複数のイントネーションのタイプの各々に対
する音声サンプルの語彙項目を含むので、上記方法はさ
らに自然な音声を出力することができる。
【0075】また、請求項12記載のテキストを音声に
変換する方法においては、請求項8記載の方法におい
て、単語リストを構築する上記ステップは、順序付けら
れたペアとして上記単語リストを構築することを備え、
上記各ペアは単語トークンと韻律的環境トークンとを備
える。従って、韻律的環境情報と音韻的特徴情報とをサ
ンプルのサンプルリストを構築することに使用したの
で、上記方法は、与えられたテキストからその文脈に対
する適切な発音と、適切なイントネーションと、適切な
句切りとを有するより自然な人間らしい音声を出力する
ことが可能である。
【0076】さらに、請求項13記載のテキストを音声
に変換する方法においては、請求項8記載の方法におい
て、上記音韻的属性を解析するステップは、上記単語リ
ストにおける語彙項目の少なくとも前の単語を調べ、前
の単語の音韻的特徴に基づいて上記属性を決定する。従
って、韻律的環境情報と音韻的特徴情報とをサンプルの
サンプルリストを構築することに使用したので、上記方
法は、与えられたテキストからその文脈に対する適切な
発音と、適切なイントネーションと、適切な句切りとを
有するより自然な人間らしい音声を出力することが可能
である。また、上記音韻的属性を解析するステップは単
語リストにおける語彙項目の少なくとも前の単語を調べ
て前の単語の音韻的特徴に基づいてその音韻的属性を決
定するので、上記方法はより人間らしい音声を出力する
ことができる。
【0077】また、請求項14記載のテキストを音声に
変換する方法においては、請求項8記載の方法におい
て、上記音韻的属性を解析するステップは、上記単語リ
ストにおける語彙項目の少なくとも次の単語を調べ、次
の単語の音韻的特徴に基づいて上記属性を決定する。従
って、韻律的環境情報と音韻的特徴情報とをサンプルの
サンプルリストを構築することに使用したので、上記方
法は、与えられたテキストからその文脈に対する適切な
発音と、適切なイントネーションと、適切な句切りとを
有するより自然な人間らしい音声を出力することが可能
である。また、上記音韻的属性を解析するステップは単
語リストにおける語彙項目の少なくとも次の単語を調べ
て次の単語の音韻的特徴に基づいてその音韻的属性を決
定するので、上記方法はより人間らしい音声を出力する
ことができる。
【図面の簡単な説明】
【図1】 図1は、コンピュータを用いる数字読み上げ
システムの好ましい構成を図示したブロック図である。
【図2】 図2は、好ましい実施形態の数字読み上げシ
ステムによって実行されるコンピュータを用いたプロセ
スを表すフローチャート図である。
【図3】 図3は、好ましい実施形態の数字読み上げシ
ステムによって実行されるコンピュータを用いたプロセ
スを表すフローチャート図である。
【図4】 図4は、高品質な連鎖されて合成された音声
を生成するように本発明の数字読み上げシステムによっ
て生成されて処理される好ましいデータ構造を図示する
データ構造図である。
【符号の説明】
10…コンピュータシステム、 12…モニター、 14…目標のアプリケーション、 16…スピーカ、 20…中央処理装置(CPU)、 22…ランダムアクセスメモリ(RAM)、 24…ディスクドライブシステム、 26…ディスクインターフェース回路(SCSI回
路)、 28…ディジタル/アナログ変換器、 30…増幅器、 40…サンプルの辞書、 42…単語リスト発生器、 44…入力バッファ、 46…韻律的環境テーブル、 50…音韻的特徴解析器、 54…サンプルリストバッファ、 120…単語リストデータ構造、 122…サンプルリストデータ構造。

Claims (14)

    【特許請求の範囲】
  1. 【請求項1】 入力文字列を音声合成のためのシーケン
    スに変換する高品質な連結型読み上げシステムであっ
    て、上記読み上げシステムは、 コンピュータから読出し可能な記録媒体に記憶された単
    語の辞書と、 コンピュータから読出し可能な記録媒体に記憶された音
    声サンプルのデータベースと、 上記辞書に接続され、上記入力文字列を処理して語彙項
    目を単語リストに作成して記憶する単語リスト発生器と
    を備え、上記単語リスト発生器は上記入力文字列に対応
    する、上記辞書に記憶された単語からの上記単語リスト
    を構築し、 上記単語リスト発生器は、複数のイントネーションのタ
    イプを表す韻律的環境トークンのリストをさらに有し、
    上記単語リスト発生器は、少なくとも1つの上記韻律的
    環境トークンを上記単語リストの語彙項目の少なくとも
    幾つかに割り当て、 上記単語リストの語彙項目と上記割り当てられた韻律的
    環境トークンを解析し、(a)上記単語リストの語彙項
    目と、(b)上記語彙項目の韻律的環境と、(c)隣接
    する単語の音韻的特徴とに基づいて音声サンプルのサン
    プルリストを構築する音韻的特徴解析器と、 上記サンプルリストをアナログ変換ユニットに連鎖的に
    提供してテキストを音声に変換する音声信号を生成する
    出力部とを備えた読み上げシステム。
  2. 【請求項2】 上記単語リスト発生器は、上記入力文字
    列における整数に対応する数値の各々の桁に置かれる単
    語を加えるようにさらに動作可能である請求項1記載の
    読み上げシステム。
  3. 【請求項3】 上記データベースは、上記辞書の単語の
    各々に対応する音声サンプルを備えた請求項1記載の読
    み上げシステム。
  4. 【請求項4】 上記データベースは、上記辞書の単語の
    各々に対する1組の音声サンプルを備え、上記1組の音
    声サンプルは上記複数のイントネーションのタイプの各
    々に対する音声サンプルを含む請求項1記載の読み上げ
    システム。
  5. 【請求項5】 上記単語リスト発生器は順序付けられた
    ペアとして上記単語リストを構築し、上記各ペアは単語
    トークンと韻律的環境トークンとを備えた請求項1記載
    の読み上げシステム。
  6. 【請求項6】 上記韻律的特徴解析器は、上記単語リス
    トにおける語彙項目の少なくとも前の単語を調べ、隣接
    する単語の音韻的特徴を決定する請求項1記載の読み上
    げシステム。
  7. 【請求項7】 上記音韻的特徴解析器は、上記単語リス
    トにおける語彙項目の少なくとも次の単語を調べ、隣接
    する単語の音韻的特徴を決定する請求項1記載の読み上
    げシステム。
  8. 【請求項8】 音声合成される音声に変換されるべきテ
    キストを表す入力文字列を受信することと、 コンピュータから読出し可能な記録媒体に記憶された単
    語の辞書にアクセスすることによって上記入力文字列に
    対応する単語トークンの単語リストを構成することと、 上記単語リストにおける単語トークンの少なくとも幾つ
    かが、対応する韻律的環境トークンに関連するように、
    上記単語リストに異なるイントネーションのタイプを表
    す韻律的環境トークンを追加することと、 上記単語リストにおける隣接する単語の音韻的特徴を調
    べることによって上記単語リストにおける上記単語トー
    クンに関連する音韻的属性を解析することと、 (a)上記単語リストトークンと、(b)上記対応する
    韻律的環境トークンと、(c)上記音韻的属性とに基づ
    いて、音声サンプルのサンプルリストを構築すること
    と、 アナログ変換ユニットへの連結型出力に対する上記サン
    プルリストを提供し、テキストから音声への音声信号を
    生成することとを備えたテキストを音声に変換する方
    法。
  9. 【請求項9】 上記単語リストを構成するステップは、
    上記入力文字列における整数に対応する数値の各々の桁
    に置かれる単語を加えることを含む請求項8記載の方
    法。
  10. 【請求項10】 上記サンプルリストを構築するステッ
    プは、上記辞書の単語の各々に対応するコンピュータか
    ら読出し可能な記録媒体に記憶された音声サンプルのデ
    ータベースからの上記音声サンプルを得ることによって
    実行される請求項8記載の方法。
  11. 【請求項11】 上記データベースは上記辞書の単語の
    各々に対する1組の音声サンプルを備え、上記1組の音
    声サンプルは上記異なるイントネーションのタイプの各
    々に対する音声サンプルの語彙項目を含む請求項10記
    載の方法。
  12. 【請求項12】 単語リストを構築する上記ステップ
    は、順序付けられたペアとして上記単語リストを構築す
    ることを備え、上記各ペアは単語トークンと韻律的環境
    トークンとを備えた請求項8記載の方法。
  13. 【請求項13】 音韻的属性を解析する上記ステップ
    は、上記単語リストにおける語彙項目の少なくとも前の
    単語を調べ、前の単語の音韻的特徴に基づいて上記属性
    を決定する請求項8記載の方法。
  14. 【請求項14】 音韻的属性を解析する上記ステップ
    は、上記単語リストにおける語彙項目の少なくとも次の
    単語を調べ、次の単語の音韻的特徴に基づいて上記属性
    を決定する請求項8記載の方法。
JP9242622A 1996-09-09 1997-09-08 連結型読み上げシステム及びテキストを音声に変換する方法 Pending JPH1083277A (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/709581 1996-09-09
US08/709,581 US5878393A (en) 1996-09-09 1996-09-09 High quality concatenative reading system

Publications (1)

Publication Number Publication Date
JPH1083277A true JPH1083277A (ja) 1998-03-31

Family

ID=24850451

Family Applications (1)

Application Number Title Priority Date Filing Date
JP9242622A Pending JPH1083277A (ja) 1996-09-09 1997-09-08 連結型読み上げシステム及びテキストを音声に変換する方法

Country Status (2)

Country Link
US (1) US5878393A (ja)
JP (1) JPH1083277A (ja)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1005018A3 (en) * 1998-11-25 2001-02-07 Matsushita Electric Industrial Co., Ltd. Speech synthesis employing prosody templates

Families Citing this family (135)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6493662B1 (en) * 1998-02-11 2002-12-10 International Business Machines Corporation Rule-based number parser
US6513002B1 (en) * 1998-02-11 2003-01-28 International Business Machines Corporation Rule-based number formatter
HUP0103622A3 (en) * 1998-08-20 2003-01-28 Agouron Pharmaceuticals Inc La Non-peptide gnrh agents, methods and intermediates for their preparation and medicaments containing them
US6188983B1 (en) * 1998-09-02 2001-02-13 International Business Machines Corp. Method for dynamically altering text-to-speech (TTS) attributes of a TTS engine not inherently capable of dynamic attribute alteration
US6601030B2 (en) * 1998-10-28 2003-07-29 At&T Corp. Method and system for recorded word concatenation
US7369994B1 (en) 1999-04-30 2008-05-06 At&T Corp. Methods and apparatus for rapid acoustic unit selection from a large speech corpus
US7149690B2 (en) * 1999-09-09 2006-12-12 Lucent Technologies Inc. Method and apparatus for interactive language instruction
US7386450B1 (en) * 1999-12-14 2008-06-10 International Business Machines Corporation Generating multimedia information from text information using customized dictionaries
US8645137B2 (en) 2000-03-16 2014-02-04 Apple Inc. Fast, language-independent method for user authentication by voice
US6456935B1 (en) * 2000-03-28 2002-09-24 Horizon Navigation, Inc. Voice guidance intonation in a vehicle navigation system
US6990450B2 (en) * 2000-10-19 2006-01-24 Qwest Communications International Inc. System and method for converting text-to-voice
US6990449B2 (en) * 2000-10-19 2006-01-24 Qwest Communications International Inc. Method of training a digital voice library to associate syllable speech items with literal text syllables
US7451087B2 (en) * 2000-10-19 2008-11-11 Qwest Communications International Inc. System and method for converting text-to-voice
US6871178B2 (en) * 2000-10-19 2005-03-22 Qwest Communications International, Inc. System and method for converting text-to-voice
US20040102975A1 (en) * 2002-11-26 2004-05-27 International Business Machines Corporation Method and apparatus for masking unnatural phenomena in synthetic speech using a simulated environmental effect
US7716052B2 (en) * 2005-04-07 2010-05-11 Nuance Communications, Inc. Method, apparatus and computer program providing a multi-speaker database for concatenative text-to-speech synthesis
JP4570509B2 (ja) * 2005-04-22 2010-10-27 富士通株式会社 読み生成装置、読み生成方法及びコンピュータプログラム
US20070043564A1 (en) * 2005-08-19 2007-02-22 Microsoft Corporation Parameterization of counting systems
US20070055526A1 (en) * 2005-08-25 2007-03-08 International Business Machines Corporation Method, apparatus and computer program product providing prosodic-categorical enhancement to phrase-spliced text-to-speech synthesis
US8677377B2 (en) 2005-09-08 2014-03-18 Apple Inc. Method and apparatus for building an intelligent automated assistant
US9318108B2 (en) 2010-01-18 2016-04-19 Apple Inc. Intelligent automated assistant
US7996222B2 (en) * 2006-09-29 2011-08-09 Nokia Corporation Prosody conversion
US8086439B2 (en) * 2007-02-06 2011-12-27 Microsoft Corporation Translation of text into numbers
WO2008109781A2 (en) * 2007-03-06 2008-09-12 Cognitive Code Corp. Artificial intelligence system
US8977255B2 (en) 2007-04-03 2015-03-10 Apple Inc. Method and system for operating a multi-function portable electronic device using voice-activation
US9330720B2 (en) 2008-01-03 2016-05-03 Apple Inc. Methods and apparatus for altering audio output signals
US8996376B2 (en) 2008-04-05 2015-03-31 Apple Inc. Intelligent text-to-speech conversion
US10496753B2 (en) 2010-01-18 2019-12-03 Apple Inc. Automatically adapting user interfaces for hands-free interaction
US20100030549A1 (en) 2008-07-31 2010-02-04 Lee Michael M Mobile device having human language translation capability with positional feedback
US8352268B2 (en) * 2008-09-29 2013-01-08 Apple Inc. Systems and methods for selective rate of speech and speech preferences for text to speech synthesis
US8396714B2 (en) * 2008-09-29 2013-03-12 Apple Inc. Systems and methods for concatenation of words in text to speech synthesis
US8352272B2 (en) * 2008-09-29 2013-01-08 Apple Inc. Systems and methods for text to speech synthesis
US8712776B2 (en) 2008-09-29 2014-04-29 Apple Inc. Systems and methods for selective text to speech synthesis
US9959870B2 (en) 2008-12-11 2018-05-01 Apple Inc. Speech recognition involving a mobile device
US8380507B2 (en) * 2009-03-09 2013-02-19 Apple Inc. Systems and methods for determining the language to use for speech generated by a text to speech engine
US10241644B2 (en) 2011-06-03 2019-03-26 Apple Inc. Actionable reminder entries
US10255566B2 (en) 2011-06-03 2019-04-09 Apple Inc. Generating and processing task items that represent tasks to perform
US9858925B2 (en) 2009-06-05 2018-01-02 Apple Inc. Using context information to facilitate processing of commands in a virtual assistant
US10241752B2 (en) 2011-09-30 2019-03-26 Apple Inc. Interface for a virtual digital assistant
US9431006B2 (en) 2009-07-02 2016-08-30 Apple Inc. Methods and apparatuses for automatic speech recognition
US10276170B2 (en) 2010-01-18 2019-04-30 Apple Inc. Intelligent automated assistant
US10705794B2 (en) 2010-01-18 2020-07-07 Apple Inc. Automatically adapting user interfaces for hands-free interaction
US10679605B2 (en) 2010-01-18 2020-06-09 Apple Inc. Hands-free list-reading by intelligent automated assistant
US10553209B2 (en) 2010-01-18 2020-02-04 Apple Inc. Systems and methods for hands-free notification summaries
DE202011111062U1 (de) 2010-01-25 2019-02-19 Newvaluexchange Ltd. Vorrichtung und System für eine Digitalkonversationsmanagementplattform
US8682667B2 (en) 2010-02-25 2014-03-25 Apple Inc. User profiling for selecting user specific voice input processing information
US10762293B2 (en) 2010-12-22 2020-09-01 Apple Inc. Using parts-of-speech tagging and named entity recognition for spelling correction
US9262612B2 (en) 2011-03-21 2016-02-16 Apple Inc. Device access using voice authentication
US10057736B2 (en) 2011-06-03 2018-08-21 Apple Inc. Active transport based notifications
US8994660B2 (en) 2011-08-29 2015-03-31 Apple Inc. Text correction processing
US10134385B2 (en) 2012-03-02 2018-11-20 Apple Inc. Systems and methods for name pronunciation
US9483461B2 (en) 2012-03-06 2016-11-01 Apple Inc. Handling speech synthesis of content for multiple languages
US9280610B2 (en) 2012-05-14 2016-03-08 Apple Inc. Crowd sourcing information to fulfill user requests
US9721563B2 (en) 2012-06-08 2017-08-01 Apple Inc. Name recognition system
US9495129B2 (en) 2012-06-29 2016-11-15 Apple Inc. Device, method, and user interface for voice-activated navigation and browsing of a document
US9576574B2 (en) 2012-09-10 2017-02-21 Apple Inc. Context-sensitive handling of interruptions by intelligent digital assistant
US9547647B2 (en) 2012-09-19 2017-01-17 Apple Inc. Voice-based media searching
DE112014000709B4 (de) 2013-02-07 2021-12-30 Apple Inc. Verfahren und vorrichtung zum betrieb eines sprachtriggers für einen digitalen assistenten
US9368114B2 (en) 2013-03-14 2016-06-14 Apple Inc. Context-sensitive handling of interruptions
WO2014144579A1 (en) 2013-03-15 2014-09-18 Apple Inc. System and method for updating an adaptive speech recognition model
WO2014144949A2 (en) 2013-03-15 2014-09-18 Apple Inc. Training an at least partial voice command system
WO2014197334A2 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for user-specified pronunciation of words for speech synthesis and recognition
WO2014197336A1 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for detecting errors in interactions with a voice-based digital assistant
US9582608B2 (en) 2013-06-07 2017-02-28 Apple Inc. Unified ranking with entropy-weighted information for phrase-based semantic auto-completion
WO2014197335A1 (en) 2013-06-08 2014-12-11 Apple Inc. Interpreting and acting upon commands that involve sharing information with remote devices
KR101959188B1 (ko) 2013-06-09 2019-07-02 애플 인크. 디지털 어시스턴트의 둘 이상의 인스턴스들에 걸친 대화 지속성을 가능하게 하기 위한 디바이스, 방법 및 그래픽 사용자 인터페이스
US10176167B2 (en) 2013-06-09 2019-01-08 Apple Inc. System and method for inferring user intent from speech inputs
KR101809808B1 (ko) 2013-06-13 2017-12-15 애플 인크. 음성 명령에 의해 개시되는 긴급 전화를 걸기 위한 시스템 및 방법
KR101749009B1 (ko) 2013-08-06 2017-06-19 애플 인크. 원격 디바이스로부터의 활동에 기초한 스마트 응답의 자동 활성화
US9620105B2 (en) 2014-05-15 2017-04-11 Apple Inc. Analyzing audio input for efficient speech and music recognition
US10592095B2 (en) 2014-05-23 2020-03-17 Apple Inc. Instantaneous speaking of content on touch devices
US9502031B2 (en) 2014-05-27 2016-11-22 Apple Inc. Method for supporting dynamic grammars in WFST-based ASR
US10289433B2 (en) 2014-05-30 2019-05-14 Apple Inc. Domain specific language for encoding assistant dialog
US9785630B2 (en) 2014-05-30 2017-10-10 Apple Inc. Text prediction using combined word N-gram and unigram language models
US9760559B2 (en) 2014-05-30 2017-09-12 Apple Inc. Predictive text input
US9715875B2 (en) 2014-05-30 2017-07-25 Apple Inc. Reducing the need for manual start/end-pointing and trigger phrases
US9633004B2 (en) 2014-05-30 2017-04-25 Apple Inc. Better resolution when referencing to concepts
US9734193B2 (en) 2014-05-30 2017-08-15 Apple Inc. Determining domain salience ranking from ambiguous words in natural speech
US10170123B2 (en) 2014-05-30 2019-01-01 Apple Inc. Intelligent assistant for home automation
WO2015184186A1 (en) 2014-05-30 2015-12-03 Apple Inc. Multi-command single utterance input method
US10078631B2 (en) 2014-05-30 2018-09-18 Apple Inc. Entropy-guided text prediction using combined word and character n-gram language models
US9430463B2 (en) 2014-05-30 2016-08-30 Apple Inc. Exemplar-based natural language processing
US9842101B2 (en) 2014-05-30 2017-12-12 Apple Inc. Predictive conversion of language input
US9338493B2 (en) 2014-06-30 2016-05-10 Apple Inc. Intelligent automated assistant for TV user interactions
US10659851B2 (en) 2014-06-30 2020-05-19 Apple Inc. Real-time digital assistant knowledge updates
US10446141B2 (en) 2014-08-28 2019-10-15 Apple Inc. Automatic speech recognition based on user feedback
US9818400B2 (en) 2014-09-11 2017-11-14 Apple Inc. Method and apparatus for discovering trending terms in speech requests
US10789041B2 (en) 2014-09-12 2020-09-29 Apple Inc. Dynamic thresholds for always listening speech trigger
US9606986B2 (en) 2014-09-29 2017-03-28 Apple Inc. Integrated word N-gram and class M-gram language models
US10127911B2 (en) 2014-09-30 2018-11-13 Apple Inc. Speaker identification and unsupervised speaker adaptation techniques
US9668121B2 (en) 2014-09-30 2017-05-30 Apple Inc. Social reminders
US9886432B2 (en) 2014-09-30 2018-02-06 Apple Inc. Parsimonious handling of word inflection via categorical stem + suffix N-gram language models
US9646609B2 (en) 2014-09-30 2017-05-09 Apple Inc. Caching apparatus for serving phonetic pronunciations
US10074360B2 (en) 2014-09-30 2018-09-11 Apple Inc. Providing an indication of the suitability of speech recognition
US10552013B2 (en) 2014-12-02 2020-02-04 Apple Inc. Data detection
US9711141B2 (en) 2014-12-09 2017-07-18 Apple Inc. Disambiguating heteronyms in speech synthesis
US9865280B2 (en) 2015-03-06 2018-01-09 Apple Inc. Structured dictation using intelligent automated assistants
US9886953B2 (en) 2015-03-08 2018-02-06 Apple Inc. Virtual assistant activation
US10567477B2 (en) 2015-03-08 2020-02-18 Apple Inc. Virtual assistant continuity
US9721566B2 (en) 2015-03-08 2017-08-01 Apple Inc. Competing devices responding to voice triggers
US9899019B2 (en) 2015-03-18 2018-02-20 Apple Inc. Systems and methods for structured stem and suffix language models
US9842105B2 (en) 2015-04-16 2017-12-12 Apple Inc. Parsimonious continuous-space phrase representations for natural language processing
US10083688B2 (en) 2015-05-27 2018-09-25 Apple Inc. Device voice control for selecting a displayed affordance
US10127220B2 (en) 2015-06-04 2018-11-13 Apple Inc. Language identification from short strings
US10101822B2 (en) 2015-06-05 2018-10-16 Apple Inc. Language input correction
US10255907B2 (en) 2015-06-07 2019-04-09 Apple Inc. Automatic accent detection using acoustic models
US11025565B2 (en) 2015-06-07 2021-06-01 Apple Inc. Personalized prediction of responses for instant messaging
US10186254B2 (en) 2015-06-07 2019-01-22 Apple Inc. Context-based endpoint detection
US10747498B2 (en) 2015-09-08 2020-08-18 Apple Inc. Zero latency digital assistant
US10671428B2 (en) 2015-09-08 2020-06-02 Apple Inc. Distributed personal assistant
US9697820B2 (en) 2015-09-24 2017-07-04 Apple Inc. Unit-selection text-to-speech synthesis using concatenation-sensitive neural networks
US11010550B2 (en) 2015-09-29 2021-05-18 Apple Inc. Unified language modeling framework for word prediction, auto-completion and auto-correction
US10366158B2 (en) 2015-09-29 2019-07-30 Apple Inc. Efficient word encoding for recurrent neural network language models
US11587559B2 (en) 2015-09-30 2023-02-21 Apple Inc. Intelligent device identification
US10691473B2 (en) 2015-11-06 2020-06-23 Apple Inc. Intelligent automated assistant in a messaging environment
US10049668B2 (en) 2015-12-02 2018-08-14 Apple Inc. Applying neural network language models to weighted finite state transducers for automatic speech recognition
US10223066B2 (en) 2015-12-23 2019-03-05 Apple Inc. Proactive assistance based on dialog communication between devices
US10446143B2 (en) 2016-03-14 2019-10-15 Apple Inc. Identification of voice inputs providing credentials
US9934775B2 (en) 2016-05-26 2018-04-03 Apple Inc. Unit-selection text-to-speech synthesis based on predicted concatenation parameters
US9972304B2 (en) 2016-06-03 2018-05-15 Apple Inc. Privacy preserving distributed evaluation framework for embedded personalized systems
US10249300B2 (en) 2016-06-06 2019-04-02 Apple Inc. Intelligent list reading
US10049663B2 (en) 2016-06-08 2018-08-14 Apple, Inc. Intelligent automated assistant for media exploration
DK179588B1 (en) 2016-06-09 2019-02-22 Apple Inc. INTELLIGENT AUTOMATED ASSISTANT IN A HOME ENVIRONMENT
US10586535B2 (en) 2016-06-10 2020-03-10 Apple Inc. Intelligent digital assistant in a multi-tasking environment
US10509862B2 (en) 2016-06-10 2019-12-17 Apple Inc. Dynamic phrase expansion of language input
US10192552B2 (en) 2016-06-10 2019-01-29 Apple Inc. Digital assistant providing whispered speech
US10490187B2 (en) 2016-06-10 2019-11-26 Apple Inc. Digital assistant providing automated status report
US10067938B2 (en) 2016-06-10 2018-09-04 Apple Inc. Multilingual word prediction
DK179415B1 (en) 2016-06-11 2018-06-14 Apple Inc Intelligent device arbitration and control
DK201670540A1 (en) 2016-06-11 2018-01-08 Apple Inc Application integration with a digital assistant
DK179049B1 (en) 2016-06-11 2017-09-18 Apple Inc Data driven natural language event detection and classification
DK179343B1 (en) 2016-06-11 2018-05-14 Apple Inc Intelligent task discovery
US10593346B2 (en) 2016-12-22 2020-03-17 Apple Inc. Rank-reduced token representation for automatic speech recognition
DK179745B1 (en) 2017-05-12 2019-05-01 Apple Inc. SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT
DK201770431A1 (en) 2017-05-15 2018-12-20 Apple Inc. Optimizing dialogue policy decisions for digital assistants using implicit feedback

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3704345A (en) * 1971-03-19 1972-11-28 Bell Telephone Labor Inc Conversion of printed text into synthetic speech
US4685135A (en) * 1981-03-05 1987-08-04 Texas Instruments Incorporated Text-to-speech synthesis system
US4692941A (en) * 1984-04-10 1987-09-08 First Byte Real-time text-to-speech conversion system
DE3723078A1 (de) * 1987-07-11 1989-01-19 Philips Patentverwaltung Verfahren zur erkennung von zusammenhaengend gesprochenen woertern
US4979216A (en) * 1989-02-17 1990-12-18 Malsheen Bathsheba J Text to speech synthesis system and method using context dependent vowel allophones
JPH05181491A (ja) * 1991-12-30 1993-07-23 Sony Corp 音声合成装置
US5384893A (en) * 1992-09-23 1995-01-24 Emerson & Stern Associates, Inc. Method and apparatus for speech synthesis based on prosodic analysis
US5636325A (en) * 1992-11-13 1997-06-03 International Business Machines Corporation Speech synthesis and analysis of dialects
US5642466A (en) * 1993-01-21 1997-06-24 Apple Computer, Inc. Intonation adjustment in text-to-speech systems
US5651095A (en) * 1993-10-04 1997-07-22 British Telecommunications Public Limited Company Speech synthesis using word parser with knowledge base having dictionary of morphemes with binding properties and combining rules to identify input word class

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1005018A3 (en) * 1998-11-25 2001-02-07 Matsushita Electric Industrial Co., Ltd. Speech synthesis employing prosody templates

Also Published As

Publication number Publication date
US5878393A (en) 1999-03-02

Similar Documents

Publication Publication Date Title
US5878393A (en) High quality concatenative reading system
US6505158B1 (en) Synthesis-based pre-selection of suitable units for concatenative speech
US6684187B1 (en) Method and system for preselection of suitable units for concatenative speech
US6778962B1 (en) Speech synthesis with prosodic model data and accent type
US5475796A (en) Pitch pattern generation apparatus
US20030074196A1 (en) Text-to-speech conversion system
US6477495B1 (en) Speech synthesis system and prosodic control method in the speech synthesis system
JP2007249212A (ja) テキスト音声合成のための方法、コンピュータプログラム及びプロセッサ
WO2005034082A1 (en) Method for synthesizing speech
JPH08508127A (ja) システムをトレーニングする方法、その結果得られる装置、およびその使用方法
US20050171778A1 (en) Voice synthesizer, voice synthesizing method, and voice synthesizing system
US20070083369A1 (en) Generating words and names using N-grams of phonemes
Gibbon et al. Spoken language system and corpus design
KR0173340B1 (ko) 텍스트/음성변환기에서 억양패턴 정규화와 신경망 학습을 이용한 억양 생성 방법
KR0175249B1 (ko) 음성 합성을 위한 한국어 문장의 발음처리 방법
JP2658109B2 (ja) 音声合成装置
JP4441380B2 (ja) 音声合成装置、音声合成方法及び音声合成プログラム
JPS60188995A (ja) 文章発声方法
JPH03245192A (ja) 外国語単語の発音決定方法
KR920009961B1 (ko) 무제한 단어 한국어 합성 방법 및 회로
JPH07160685A (ja) 文章読み上げ装置
Mac Lochlainn Sintéiseoir 1.0: a multidialectical TTS application for Irish
Olaszy et al. Interactive, TTS supported speech message composer for large, limited vocabulary, but open information systems.
JPH09185393A (ja) 音声合成方式
JPH04190398A (ja) 音声合成方法