JPH08328813A - 改良した声送信方法と装置 - Google Patents

改良した声送信方法と装置

Info

Publication number
JPH08328813A
JPH08328813A JP8112830A JP11283096A JPH08328813A JP H08328813 A JPH08328813 A JP H08328813A JP 8112830 A JP8112830 A JP 8112830A JP 11283096 A JP11283096 A JP 11283096A JP H08328813 A JPH08328813 A JP H08328813A
Authority
JP
Japan
Prior art keywords
voice
text
sample
user
audio
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP8112830A
Other languages
English (en)
Inventor
Troy Lee Cline
トロイ・リー・クライン
Scott Harlan Isensee
スコット・ハーラン・アイセンシー
Isla Park Fredrick
フレドリック・アイラ・パーク
Ricky Lee Poston
リッキー・リー・ポストン
Scott Rogers Gregory
グレゴリー・スコット・ロジャース
Harold Warner John
ジョン・ハラルド・ウエナー
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
International Business Machines Corp
Original Assignee
International Business Machines Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by International Business Machines Corp filed Critical International Business Machines Corp
Publication of JPH08328813A publication Critical patent/JPH08328813A/ja
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/02Methods for producing synthetic speech; Speech synthesisers
    • G10L13/04Details of speech synthesis systems, e.g. synthesiser structure or memory management

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computer And Data Communications (AREA)
  • Information Transfer Between Computers (AREA)

Abstract

(57)【要約】 【課題】 独自のプログラムを有するコンピュータ・シ
ステムとコンピュータによって実行される方法によっ
て、コンピュータ・システムに対して音声を効率よく送
信する命令を行う。 【解決手段】 上記の方法は、ユーザからの声を第1シ
ステムに於いてテキストに変形するステップ、上記のユ
ーザの声標本を第2システムに於いて声データベースに
記憶する1組の声特性に変換するステップ、及び上記の
テキストを上記の第2システムに送信するステップを有
し、これによって上記の第2システムは、上記の声標本
から得た声特性を使用して上記のユーザの声を合成する
ことによって上記のテキストをオーディオに変換する。

Description

【発明の詳細な説明】
【0001】
【発明の属する技術分野】本発明は、オーディオ/音声
を送信する場合の改良に関し、更に詳しくは、通信チャ
ンネルの帯域幅を小さくして音声を送信する場合の改良
に関するが、これに限定されるものではない。
【0002】
【従来の技術】話言葉は人間のコミュニケーションと人
間と機械及び機械と人間のコミュニケーションに於いて
主要な役割を果たしている。例えば、ボイス・メール・
システム、介護システム及びビデオ会議システムには、
人間の音声が含まれている。音声処理活動の3つの主要
な領域は、音声の符号化、音声の合成及び音声の認識か
ら構成されている。音声合成装置はテキストを音声に変
換し、一方音声認識システムは人間の言葉に「傾聴し」
これを理解する。音声符号化技術は、ディジタル化した
音声を圧縮して送信帯域幅と記憶容量に対する要求を減
少させる。ボイス・メール・システムのような従来の音
声符号化システムは、音声を捕捉し、ディジタル化し、
圧縮してこれを他の遠隔地のボイス・メール・システム
に送信する。音声コード化システムは音声圧縮スキーム
を有し、このスキームは次に波形コーダまたは分析‐再
合成技術を有している。波形コーダは、パルス・コード
変調(PCM)を使用して所定のレート、例えば、8K
Hzで音声の波形をサンプリングする。受け入れ可能な
音声の品質でPCMオーディオの送信と記憶を行うに
は、約64Kビット/sのサンプリング速度が必要であ
る。従って、音声を約125秒記録するには約1Mバイ
トのメモリが必要であり、これはこのような少量の音声
の場合でも、実質的な量の記憶容量を占める。共通の電
話送信線で音声とデータを組み合わせて送信するために
は、現在の技術を使用して使用可能な帯域幅28.8K
b/sを音声とデータに分割しなければならない。この
ような状況下で音声をディジタル・オーディオ信号とし
て送信しようとすると、使用可能である以上の帯域幅が
必要になり、従って、このような送信は実行不可能であ
る。
【0003】
【発明が解決しようとする課題】従って、必要とする通
信チャンネルの帯域幅と記憶容量を減少させながら、高
品質でオーデイオの送信を行うシステムに対する大きな
需要が存在する。
【0004】
【課題を解決するための手段】装置とコンピュータによ
って実行する方法によって、オーディオ(例えば、音
声)を第1データ処理システムから第2データ処理シス
テムに最小の帯域幅を使用して送信する。この方法はオ
ーディオ(例えば、音声のサンプル)をテキストに変形
するステップを有する。次のステップは、話者の声の標
本を1組の声特性に変換するステップを有し、これによ
ってこの声特性を第2システムの声データベースに記憶
する。または、声特性は発信システム(即ち、第1シス
テム)によって決定し、受信システム(即ち、第2シス
テム)に送信することができる。最終のステップはテキ
ストを第2システムに送信するステップを有し、これに
よってこの第2システムは音声のサンプルから得た声特
性を使用して話者の声を合成することによってこのテキ
ストをオーディオに変換する。
【0005】従って、本発明の目的は、送信帯域幅を狭
くする改良した音声送信システムを提供することであ
る。
【0006】他の目的は、送信の前にオーディオをテキ
ストに変換する改良した音声送信システムを提供し、こ
れによって送信帯域幅と記憶容量に対する要求を大幅に
削減することである。
【0007】更に他の目的は、テキストから再生した合
成音声が話者の音声と類似するように話者の音声の標本
を送信する改良した音声送信システムを提供することで
ある。
【0008】これら及び他の目的、効果、及び特徴は、
下記の図面と詳細な説明に照らして更に明らかになる。
【0009】
【発明の実施の形態】好適な実施例は、テキストを送信
するためのコンピュータによって実行される方法及び装
置を有し、ここで高性能音声(speech)合成装置
はテキストを話者の声(voice)を表す音声として
再生する。
【0010】この好適な実施例は、図1に示すラップト
ップ・コンピュータまたはワークステーションによって
実行する。ワークステーション100は、IBM(登録
商標)のパワーPC(登録商標)またはインテル(登録
商標)の486マイクロプロセッサのような中央処理装
置(CPU)10を有し、キャッシュ15、ランダム・
アクセス・メモリ(RAM)14、リード・オンリ・メ
モリ16及び不揮発性RAM(NVRAM)32を処理
する。I/Oアダプタ18によって制御した1個以上の
デスィク20によって、長期間に渡る記憶が行われる。
種々の他の記憶媒体を使用することが可能であり、これ
には、テープ、CD−ROM及びWORMドライブが含
まれている。取り外し可能な記憶媒体をまた設けてデー
タまたはコンピュータ処理命令を記憶してもよい。
【0011】サン・ソラリス(Sun Solaris(登録商
標))、マイクロソフト・ウイドウズNT(Microsoft
Windows NT(登録商標))、IBM OS/2(登録商
標)、またはアップル・マックOS(Apple MAC OS(登
録商標))のようないずれかの適当な動作システムの机
上からの命令とデータによって、RAM14からCPU
10を制御する。しかし、当業者は、他のハードウェア
装置と動作システムを利用しても本発明を実行すること
のできることを容易に認識する。
【0012】ユーザは、ユーザ・インタフェース・アダ
プタ22によって制御されたI/O装置(即ち、ユーザ
制御装置)を介してワークステーション100と通信を
行う。表示装置38はユーザに対して情報を表示し、一
方キーボード24、ポイント装置26、マイク30、及
びスピーカ28によってユーザはコンピュータ・システ
ムに命令を行うことができる。または、ジョイ・スティ
ック、タッチ・スクリーンまたは仮想現実ヘッドセット
(図示せず)のような他の種類のユーザ制御装置を使用
することもできる。通信アダプタ34は、このコンピュ
ータ・システムとネットワーク・アダプタ40によって
ネットワークに接続された他の処理装置の間の通信を制
御する。表示アダプタ36は、このコンピュータ・シス
テムと表示装置38の間の通信を制御する。
【0013】図2は、本発明による改良した音声送信シ
ステム290のブロック図を示す。送信システム290
は、ワークステーション200とワークステーション2
50を有している。これらのワークステーション200
と250はワークステーション100の構成部品を有し
てもよい(図1参照)。更に、ワークステーション20
0は従来の音声認識システム202を有している。この
音声認識システム202は、例えば、IBMボイスタイ
プ・ディクテーション(Voicetype Dictation(登録商
標))装置のような何れかの適当なディクテーション
(口述筆記)装置を有し、音声をテキストに変換する。
従って、この好適な実施例では、ユーザはマイク206
に話しかけ、A/Dサブシステム204がそのアナログ
音声をディジタル音声に変換する。音声認識システム2
02は、そのディジタル音声をテキスト・ファイルに変
換する。実例として、125秒間話を行うと、約2Kバ
イト(即ち、2頁)のテキストが発生する。125秒の
ディジタル化したオーディオを転送する場合に6400
0ビット/秒の帯域幅と1MBの記憶スペースが必要に
なるのと比較して、この場合の帯域幅に対する要求は1
32ビット/秒(2K/125秒)である。
【0014】ワークステーション200はテキスト・フ
ァイルの前部に話者の識別コードを挿入し、そのテキス
ト・ファイルとコードをネットワーク・アダプタ240
と254を介してテキスト音声合成装置252に送信す
る。このテキスト・ファイルは略語、日付、時刻、公
式、及び句読符号を有してもよい。更に、もしユーザが
テキストを再生したオーディオに適当なイントネーショ
ン及び韻律特性を付加しようと希望すれば、このユーザ
はテキスト・ファイルに「タグ」を付け加える。例え
ば、もしユーザが特定の文章をより強勢してより大きな
声で話すことを希望すれば、このユーザはその文章にタ
グ(例えば、下線)を付け加える。もしユーザが質問を
行う場合などに、文の終わりで調子を上げることを希望
すれば、このユーザはその文章の末尾に疑問符を付ける
ことを命令する。これに応答して、テキスト音声合成装
置252は、これらのタグ及びコンマや感嘆符のような
全ての標準的な句読用マークを解釈し、再生したオーデ
ィオのイントネーション及び韻律特性を適当に調整す
る。
【0015】ワークステーション200と250は、I
BM MACPA(即ち、マルチメディア・オーディオ
・キャプチャ・アンド・プレーバック・アダプタ(Multi
media Audio Capture and Playback Adapter) 、クリエ
ーティブ ・ラブズ・サウンド・ブラスタ (Creative L
abs Sound Blaster)のオーディオ・カードまたはチップ
が1個の装置のようないずれかの適当なA/D及びD/
Aサブシステム204または205をそれぞれ有してい
る。サブシステム204は、話者の声の標本をサンプリ
ングし、ディジタル化し、圧縮する。この好適な実施例
では、声の標本に少数(例えば、約30個)の注意深く
構造化した文章が含まれ、これらの文章によって話者の
十分な声特性を捕捉する。これらの音声特性には声の韻
律‐抑揚、調子音声の調節と速度が含まれる。
【0016】ワークステーション200はディジタル化
した音声の標本の前部に話者の識別コードを挿入し、そ
のディジタル化した音声の標本ファイルをネットワーク
・アダプタ240と254を介してワークステーション
250に送信する。この好適な実施例では、例え話者が
その後数百個のテキスト・ファイルを送信するような場
合でも、ワークステーション200は1人の話者につい
て1回だけ音声の標本ファイルを送信する。または、音
声の標本ファイルは、テキスト・ファイルと共に送信し
てもよい。音声特性抽出装置257はディジタル化した
音声の標本ファイルを処理し、各ディフォーン(diphon
e)セグメントに対してオーディオの標本を分離し、特性
韻律曲線を決定する。これは、隠れたマルコフ・モデル
のような周知のディジタル信号処理技術を使用して行
う。このデータは話者の識別コードと共に音声データベ
ース258に記憶する。
【0017】テキスト音声合成装置252は、ファース
ト・バイト(First Byte(登録商標))合成装置のよう
な何れかの適当な従来の合成装置を有している。この合
成装置252はネットワーク・アダプタ254から受け
取ったテキスト・ファイルの話者の識別コードを検討
し、その話者の識別コードに対する音声データベース2
58及び対応する音声特性を検索する。合成装置252
はテキスト・ファイルの各入力された文章を文法的に解
析して文章の構造を判定し、その種類の文章(例えば、
疑問文または感嘆文)に対する音声データベース258
から特性韻律曲線を選択する。合成装置252は各語を
1つ以上の音素に変換し、次に各音素をディフォーンに
変換する。合成装置252は、ディフォーンを変更し、
例えば、近くの同一のディフォーンを併合することによ
って、調音随伴を説明する。
【0018】合成装置252は各ディフォーンに対する
音声データベース258からディジタルのオーディオ標
本を抽出し、これらの標本を繋ぎ合わせ、テキスト・フ
ァイルに於ける各文章に対する基本的なディジタルのオ
ーディオ波を形成する。これはピッチ・シンクロナス・
オーバラップ・アンド・アッド(Pitch SynchronousOve
rlap and Add、PSOLA)として知られる技術に従っ
て行う。このPSOLA技術は、音声合成技術の当業者
にとって周知のものである。もしこの時点で基本的なオ
ーディオ波が出力されれば、このオーディオは非常に単
調な方法で幾分元の話者が話しているように伝わる。従
って、合成装置252は、音声データベース258で見
つけた特性韻律曲線に従ってデジタルのオーディオ波形
の調子とテンポを変更する。例えば、質問の場合の特性
韻律曲線は、文章の末端近くの調子を上げるように指示
している場合がある。調子とテンポを変更する技術は、
当業者にとって周知である。最後に、D/A‐A/Dサ
ブシステム256は、合成装置252から得たディジタ
ル・オーディオ波形をアナログ波形に変換し、これをス
ピーカ260を介して音声として出力する。
【0019】まとめとして、本発明の構成に関して以下
の事項を開示する。 (1) コンピュータによって実行する改良した声送信
方法に於いて、上記の方法は、(a)ユーザからの声を
第1システムに於いてテキストに変形するステップと、
(b)上記のユーザの声標本を1組の声特性に変換する
ステップであって、上記の声特性は第2システムの声デ
ータベースに記憶する上記のステップと、(c)上記の
テキストを上記の第2システムに送信し、これによって
上記の第2システムは上記の声標本からの声特性を使用
して上記のユーザの声を合成することにより上記のテキ
ストをオーディオに変換するステップと、を含むことを
特徴とする方法。 (2)上記のステップ(a)は、上記のテキスト・ファ
イルにタグを挿入して声の韻律を指示するステップを含
むことを特徴とする上記(1)に記載の方法。 (3)上記のステップ(c)は、上記の第2システムに
よって、上記の送信された声標本から得た声特性と上記
のテキスト・ファイルに挿入したタグを使用して上記の
テキストをオーディオに変換するステップを含むことを
特徴とする上記(1)に記載の方法。 (4)上記のステップ(b)は、話者の声の標本を捕捉
するステップと、上記の捕捉した声標本をサンプリング
してディジタル化し、これによってディジタル化した声
を形成するステップと、上記のディジタル化した声から
声特性を抽出するステップと、上記の声特性を上記の声
データベースに記憶するステップと、を含むことを特徴
とする上記(1)に記載の方法。 (5)上記のステップ(b)は、上記の声データベース
に記憶する前に上記の声特性に声識別コードを挿入する
ステップを含むることを特徴とする上記(1)に記載の
方法。 (6)上記のステップ(a)は、上記のテキストを送信
する前に上記のテキストに上記の声識別コードを挿入す
るステップを含むことを特徴とする上記(5)に記載の
方法。 (7)上記のステップ(c)は、上記のテキスト共に送
信された上記の声識別コードに基づいて上記の声データ
ベースから上記の声特性を抽出するステップと、上記の
声特性を使用して上記のテキストをディジタル・オーデ
ィオ標本にマップ化するステップと、D/Aサブシステ
ムを使用して上記のディジタル・オーディオ標本を声と
して出力し、オーディオ出力を発生するステップと、を
含むことを特徴とする上記(6)に記載の方法。 (8)声を送信するコンピュータ・システムに於いて、
上記のコンピュータ・システムは、ユーザのディジタル
化した声標本を第1システムに於いてテキストに変形す
る音声認識システムと、上記のユーザの声標本をディジ
タル化するアナログ/ディジタル・サブシステムと、上
記のテキストと上記のディジタル化した声標本を第2シ
ステムに送信する手段と、上記の送信したディジタル化
声標本から得た声特性を使用して上記のユーザの声を合
成することによって上記の送信したテキストをディジタ
ル・オーディオに変換するテキスト音声合成装置と、上
記のディジタル・オーディオを可聴音に変換するディジ
タル/アナログ・サブシステムと、を含むことを特徴と
するコンピュータ・システム。
【図面の簡単な説明】
【図1】本発明による代表的なハードウェア環境のブロ
ック図を示す。
【図2】本発明による改良した音声送信システムのブロ
ック図を示す。
【符号の説明】
10 CPU 14 RAM 15 キャッシュ 16 ROM 18 I/O アダプタ 20 ディスク 22 ユーザ・インターフェース・アダプタ 24 キーボード 26 ポイント装置 28、260 スピーカ 30、206 マイク 32 NVRAM 34、通信アダプタ 36 表示アダプタ 38、 表示装置 100、200、250、 ワークステーション 202 音声認識システム 204、256 A/D−D/Aサブシステム 240、254 ネットワーク・アダプタ 252 テキスト音声合成装置 257 音声特性抽出装置 258 声データベース 290 声送信システム
───────────────────────────────────────────────────── フロントページの続き (72)発明者 スコット・ハーラン・アイセンシー アメリカ合衆国テキサス州 ジョウジタウ ン サウスリッジサークル 411 (72)発明者 フレドリック・アイラ・パーク アメリカ合衆国テキサス州 アウスチン スコットランドウェル・ドライブ 11101 (72)発明者 リッキー・リー・ポストン アメリカ合衆国テキサス州 アウスチン ダブリユ・ルンドバーグ 4デイ 2018 (72)発明者 グレゴリー・スコット・ロジャース アメリカ合衆国テキサス州 サンス ソウ シ プレイス 10808 (72)発明者 ジョン・ハラルド・ウエナー アメリカ合衆国テキサス州 アウスチン サンス ソウシ コーブ 6507

Claims (8)

    【特許請求の範囲】
  1. 【請求項1】コンピュータによって実行する改良した声
    送信方法に於いて、上記の方法は、 (a)ユーザからの声を第1システムに於いてテキスト
    に変形するステップと、 (b)上記のユーザの声標本を1組の声特性に変換する
    ステップであって、上記の声特性は第2システムの声デ
    ータベースに記憶する上記のステップと、 (c)上記のテキストを上記の第2システムに送信し、
    これによって上記の第2システムは上記の声標本からの
    声特性を使用して上記のユーザの声を合成することによ
    り上記のテキストをオーディオに変換するステップと、 を含むことを特徴とする方法。
  2. 【請求項2】上記のステップ(a)は、上記のテキスト
    ・ファイルにタグを挿入して声の韻律を指示するステッ
    プを含むことを特徴とする請求項1記載の方法。
  3. 【請求項3】上記のステップ(c)は、上記の第2シス
    テムによって、上記の送信された声標本から得た声特性
    と上記のテキスト・ファイルに挿入したタグを使用して
    上記のテキストをオーディオに変換するステップを含む
    ことを特徴とする請求項1記載の方法。
  4. 【請求項4】上記のステップ(b)は、 話者の声の標本を捕捉するステップと、 上記の捕捉した声標本をサンプリングしてディジタル化
    し、これによってディジタル化した声を形成するステッ
    プと、 上記のディジタル化した声から声特性を抽出するステッ
    プと、 上記の声特性を上記の声データベースに記憶するステッ
    プと、 を含むことを特徴とする請求項1記載の方法。
  5. 【請求項5】上記のステップ(b)は、上記の声データ
    ベースに記憶する前に上記の声特性に声識別コードを挿
    入するステップを含むることを特徴とする請求項1記載
    の方法。
  6. 【請求項6】上記のステップ(a)は、上記のテキスト
    を送信する前に上記のテキストに上記の声識別コードを
    挿入するステップを含むことを特徴とする請求項5記載
    の方法。
  7. 【請求項7】上記のステップ(c)は、 上記のテキスト共に送信された上記の声識別コードに基
    づいて上記の声データベースから上記の声特性を抽出す
    るステップと、 上記の声特性を使用して上記のテキストをディジタル・
    オーディオ標本にマップ化するステップと、 D/Aサブシステムを使用して上記のディジタル・オー
    ディオ標本を声として出力し、オーディオ出力を発生す
    るステップと、 を含むことを特徴とする請求項6記載の方法。
  8. 【請求項8】声を送信するコンピュータ・システムに於
    いて、上記のコンピュータ・システムは、 ユーザのディジタル化した声標本を第1システムに於い
    てテキストに変形する音声認識システムと、 上記のユーザの声標本をディジタル化するアナログ/デ
    ィジタル・サブシステムと、 上記のテキストと上記のディジタル化した声標本を第2
    システムに送信する手段と、 上記の送信したディジタル化声標本から得た声特性を使
    用して上記のユーザの声を合成することによって上記の
    送信したテキストをディジタル・オーディオに変換する
    テキスト音声合成装置と、 上記のディジタル・オーディオを可聴音に変換するディ
    ジタル/アナログ・サブシステムと、 を含むことを特徴とするコンピュータ・システム。
JP8112830A 1995-05-31 1996-05-07 改良した声送信方法と装置 Pending JPH08328813A (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/455,430 US5696879A (en) 1995-05-31 1995-05-31 Method and apparatus for improved voice transmission
US455430 1995-05-31

Publications (1)

Publication Number Publication Date
JPH08328813A true JPH08328813A (ja) 1996-12-13

Family

ID=23808772

Family Applications (1)

Application Number Title Priority Date Filing Date
JP8112830A Pending JPH08328813A (ja) 1995-05-31 1996-05-07 改良した声送信方法と装置

Country Status (2)

Country Link
US (1) US5696879A (ja)
JP (1) JPH08328813A (ja)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2001086497A (ja) * 1999-09-10 2001-03-30 Mega Chips Corp 情報通信システム
JP2021022836A (ja) * 2019-07-26 2021-02-18 株式会社リコー 通信システム、通信端末、通信方法およびプログラム

Families Citing this family (37)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6035273A (en) * 1996-06-26 2000-03-07 Lucent Technologies, Inc. Speaker-specific speech-to-text/text-to-speech communication system with hypertext-indicated speech parameter changes
US5899974A (en) * 1996-12-31 1999-05-04 Intel Corporation Compressing speech into a digital format
US6041300A (en) * 1997-03-21 2000-03-21 International Business Machines Corporation System and method of using pre-enrolled speech sub-units for efficient speech synthesis
US5884266A (en) * 1997-04-02 1999-03-16 Motorola, Inc. Audio interface for document based information resource navigation and method therefor
US5987405A (en) * 1997-06-24 1999-11-16 International Business Machines Corporation Speech compression by speech recognition
US6295342B1 (en) * 1998-02-25 2001-09-25 Siemens Information And Communication Networks, Inc. Apparatus and method for coordinating user responses to a call processing tree
US6119086A (en) * 1998-04-28 2000-09-12 International Business Machines Corporation Speech coding via speech recognition and synthesis based on pre-enrolled phonetic tokens
JP3460579B2 (ja) 1998-05-21 2003-10-27 松下電器産業株式会社 データ転送方法
US6173250B1 (en) * 1998-06-03 2001-01-09 At&T Corporation Apparatus and method for speech-text-transmit communication over data networks
US6260016B1 (en) 1998-11-25 2001-07-10 Matsushita Electric Industrial Co., Ltd. Speech synthesis employing prosody templates
US6185533B1 (en) 1999-03-15 2001-02-06 Matsushita Electric Industrial Co., Ltd. Generation and synthesis of prosody templates
EP1045372A3 (en) * 1999-04-16 2001-08-29 Matsushita Electric Industrial Co., Ltd. Speech sound communication system
US6879957B1 (en) * 1999-10-04 2005-04-12 William H. Pechter Method for producing a speech rendition of text from diphone sounds
WO2001067293A1 (en) * 2000-03-07 2001-09-13 Oipenn, Inc. Method and apparatus for distributing multi-lingual speech over a digital network
US6308154B1 (en) * 2000-04-13 2001-10-23 Rockwell Electronic Commerce Corp. Method of natural language communication using a mark-up language
US6775651B1 (en) * 2000-05-26 2004-08-10 International Business Machines Corporation Method of transcribing text from computer voice mail
US6944591B1 (en) * 2000-07-27 2005-09-13 International Business Machines Corporation Audio support system for controlling an e-mail system in a remote computer
US6856958B2 (en) * 2000-09-05 2005-02-15 Lucent Technologies Inc. Methods and apparatus for text to speech processing using language independent prosody markup
US7089184B2 (en) * 2001-03-22 2006-08-08 Nurv Center Technologies, Inc. Speech recognition for recognizing speaker-independent, continuous speech
US6792407B2 (en) 2001-03-30 2004-09-14 Matsushita Electric Industrial Co., Ltd. Text selection and recording by feedback and adaptation for development of personalized text-to-speech systems
US20030028377A1 (en) * 2001-07-31 2003-02-06 Noyes Albert W. Method and device for synthesizing and distributing voice types for voice-enabled devices
US6681208B2 (en) * 2001-09-25 2004-01-20 Motorola, Inc. Text-to-speech native coding in a communication system
KR20030048752A (ko) * 2001-12-13 2003-06-25 한국전자통신연구원 네트워크를 이용한 사용자간 커뮤니케이션 시스템 및 그방법
US7966497B2 (en) * 2002-02-15 2011-06-21 Qualcomm Incorporated System and method for acoustic two factor authentication
US7533735B2 (en) 2002-02-15 2009-05-19 Qualcomm Corporation Digital authentication over acoustic channel
US7401224B2 (en) * 2002-05-15 2008-07-15 Qualcomm Incorporated System and method for managing sonic token verifiers
US20040015988A1 (en) * 2002-07-22 2004-01-22 Buvana Venkataraman Visual medium storage apparatus and method for using the same
JP3938033B2 (ja) * 2002-12-13 2007-06-27 株式会社日立製作所 通信端末およびそれを用いたシステム
EP1630791A4 (en) * 2003-06-05 2008-05-28 Kenwood Corp SPEECH SYNTHESIS DEVICE, SPEECH SYNTHESIS METHOD, AND PROGRAM
US7412377B2 (en) * 2003-12-19 2008-08-12 International Business Machines Corporation Voice model for speech processing based on ordered average ranks of spectral features
US7706510B2 (en) * 2005-03-16 2010-04-27 Research In Motion System and method for personalized text-to-voice synthesis
JP2009194577A (ja) * 2008-02-13 2009-08-27 Konica Minolta Business Technologies Inc 画像形成装置、音声案内方法及び音声案内プログラム
US8315866B2 (en) 2009-05-28 2012-11-20 International Business Machines Corporation Generating representations of group interactions
US20130201316A1 (en) 2012-01-09 2013-08-08 May Patents Ltd. System and method for server based control
US9997154B2 (en) * 2014-05-12 2018-06-12 At&T Intellectual Property I, L.P. System and method for prosodically modified unit selection databases
GB201620317D0 (en) * 2016-11-30 2017-01-11 Microsoft Technology Licensing Llc Audio signal processing
US20240062750A1 (en) * 2022-08-18 2024-02-22 Avaya Management L.P. Speech transmission from a telecommunication endpoint using phonetic characters

Family Cites Families (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4124773A (en) * 1976-11-26 1978-11-07 Robin Elkins Audio storage and distribution system
FR2530897B1 (fr) * 1982-03-16 1991-10-31 Victor Company Of Japan Procede et systeme pour une compression de donnees par un echantillonnage a frequence variable
US4707858A (en) * 1983-05-02 1987-11-17 Motorola, Inc. Utilizing word-to-digital conversion
US4588986A (en) * 1984-09-28 1986-05-13 The United States Of America As Represented By The Administrator Of The National Aeronautics And Space Administration Method and apparatus for operating on companded PCM voice data
JPS61252596A (ja) * 1985-05-02 1986-11-10 株式会社日立製作所 文字音声通信方式及び装置
DE3703143A1 (de) * 1987-02-03 1988-08-11 Thomson Brandt Gmbh Verfahren zur uebertragung eines audiosignals
US4903021A (en) * 1987-11-24 1990-02-20 Leibholz Stephen W Signal encoding/decoding employing quasi-random sampling
US5226090A (en) * 1989-12-29 1993-07-06 Pioneer Electronic Corporation Voice-operated remote control system
JPH03203794A (ja) * 1989-12-29 1991-09-05 Pioneer Electron Corp 音声リモートコントロール装置
US5179576A (en) * 1990-04-12 1993-01-12 Hopkins John W Digital audio broadcasting system
US5168548A (en) * 1990-05-17 1992-12-01 Kurzweil Applied Intelligence, Inc. Integrated voice controlled report generating and communicating system
US5297231A (en) * 1992-03-31 1994-03-22 Compaq Computer Corporation Digital signal processor interface for computer system
US5386493A (en) * 1992-09-25 1995-01-31 Apple Computer, Inc. Apparatus and method for playing back audio at faster or slower rates without pitch distortion

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2001086497A (ja) * 1999-09-10 2001-03-30 Mega Chips Corp 情報通信システム
JP2021022836A (ja) * 2019-07-26 2021-02-18 株式会社リコー 通信システム、通信端末、通信方法およびプログラム

Also Published As

Publication number Publication date
US5696879A (en) 1997-12-09

Similar Documents

Publication Publication Date Title
US5696879A (en) Method and apparatus for improved voice transmission
JP3340585B2 (ja) 音声応答装置
US7124082B2 (en) Phonetic speech-to-text-to-speech system and method
US5943648A (en) Speech signal distribution system providing supplemental parameter associated data
US5911129A (en) Audio font used for capture and rendering
US5875427A (en) Voice-generating/document making apparatus voice-generating/document making method and computer-readable medium for storing therein a program having a computer execute voice-generating/document making sequence
US6151576A (en) Mixing digitized speech and text using reliability indices
US7483832B2 (en) Method and system for customizing voice translation of text to speech
US5915237A (en) Representing speech using MIDI
US20050065795A1 (en) Text structure for voice synthesis, voice synthesis method, voice synthesis apparatus, and computer program thereof
US20040073428A1 (en) Apparatus, methods, and programming for speech synthesis via bit manipulations of compressed database
US6148285A (en) Allophonic text-to-speech generator
JPH02204827A (ja) 報告作成装置および方法
CN1559068A (zh) 通信系统中文本到话音的本地编码
US20070088547A1 (en) Phonetic speech-to-text-to-speech system and method
Patra et al. Text to speech conversion with phonematic concatenation
CN1118493A (zh) 基音同步波形叠加汉语文语转换系统
JP2002127062A (ja) ロボットシステム、ロボット制御信号生成装置、ロボット制御信号生成方法、記録媒体、プログラムおよびロボット
JPH11265195A (ja) 情報配信システム、情報送信装置、情報受信装置、情報配信方法
JPH10133678A (ja) 音声再生装置
JP2000231396A (ja) セリフデータ作成装置、セリフ再生装置、音声分析合成装置及び音声情報転送装置
JP3219822B2 (ja) 音声合成用符号化装置及び復号化装置
JPH03160500A (ja) 音声合成装置
JPS6295595A (ja) 音声応答方式
JPS6024596A (ja) 音声合成装置