TWI281145B - System and method for transforming text to speech - Google Patents
System and method for transforming text to speech Download PDFInfo
- Publication number
- TWI281145B TWI281145B TW093138499A TW93138499A TWI281145B TW I281145 B TWI281145 B TW I281145B TW 093138499 A TW093138499 A TW 093138499A TW 93138499 A TW93138499 A TW 93138499A TW I281145 B TWI281145 B TW I281145B
- Authority
- TW
- Taiwan
- Prior art keywords
- language
- text
- speech
- data
- prosody
- Prior art date
Links
- 238000000034 method Methods 0.000 title claims description 35
- 230000001131 transforming effect Effects 0.000 title 1
- 230000015572 biosynthetic process Effects 0.000 claims abstract description 25
- 238000003786 synthesis reaction Methods 0.000 claims abstract description 25
- 230000033764 rhythmic process Effects 0.000 claims description 42
- 239000000463 material Substances 0.000 claims description 25
- 238000012545 processing Methods 0.000 claims description 22
- 238000013519 translation Methods 0.000 claims description 16
- 238000010586 diagram Methods 0.000 description 5
- 235000021152 breakfast Nutrition 0.000 description 4
- 230000006870 function Effects 0.000 description 3
- 230000008569 process Effects 0.000 description 3
- 230000002194 synthesizing effect Effects 0.000 description 3
- 238000012546 transfer Methods 0.000 description 2
- 235000017166 Bambusa arundinacea Nutrition 0.000 description 1
- 235000017491 Bambusa tulda Nutrition 0.000 description 1
- 241001330002 Bambuseae Species 0.000 description 1
- 206010011469 Crying Diseases 0.000 description 1
- 235000015334 Phyllostachys viridis Nutrition 0.000 description 1
- 239000011425 bamboo Substances 0.000 description 1
- 230000008901 benefit Effects 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 238000012217 deletion Methods 0.000 description 1
- 230000037430 deletion Effects 0.000 description 1
- 230000010354 integration Effects 0.000 description 1
- 238000004519 manufacturing process Methods 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 230000000750 progressive effect Effects 0.000 description 1
- 230000035807 sensation Effects 0.000 description 1
- 238000012360 testing method Methods 0.000 description 1
- 238000013518 transcription Methods 0.000 description 1
- 230000035897 transcription Effects 0.000 description 1
- 230000007704 transition Effects 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
- 230000003442 weekly effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/08—Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Machine Translation (AREA)
- Document Processing Apparatus (AREA)
Description
1281145 九、發明說明: 【發明所屬之技術領域】 ^發明是關於-種處歡字轉語音的祕與方法,更特 =地,本發明是於處理多語言文字轉語音的系統與 方法。 、 【先前技術】 對於文字轉語音(text_t〇-Speech)系統而言,無論接受的是 二段文字的輸人或是-篇文章,這些文字本身並沒有包含任何 耸,特性(說話的聲調、停頓方式、發音長短等韻律),只 ^吾言學的特性,所以必須透過自動刪的機制來產生這些文 字的可能的^學特性(acusticfeature),近來流行串接法,就是 以一個錄好聲音的語料庫來當作比對的標的,從語料庫中抓出 相對應的聲音單元。 、文字轉語音系統主要的功能在於將所輸入的文字轉換成 ,然流暢的語音輸出。請參閱第六圖,其是說明對於處理單一 語言ϋ ΐ知文字轉與語音系統之運作流程,其中首先所輸入的 一文字字申(text string)先經過語言處理⑴nguistic pr〇cessing;), 將文子子串拆分成數個語義段落(semantic segments),該語義 段落包含相對應的音標(ac〇ustic unit)。語言處理在不同的語言 會有不同的考量,以中文『你吃過早餐了嗎』為例,經過斷詞、 ^音字處理以及聲調處理等語言處理後,變成:『你(音標:ni3) 0乙過(chil guo4)早餐(za〇3 cani)了(ie5)嗎(mal)』;然而以英文 :Have you had breakfast』為例,並不需要斷詞,而是要處理 母個央文卓子所對應的音標及重音的位置等,成為『Have (hae v) you (yu) had (h ae d) breakfast(b r ey k f a st)』。在語言處理 後’接著對於母一個語義段落利用合成處理(外她6咖process) 的技術組合出相對應的語音資料,最後進行韻律處理(prosody processing),對於整句話中每個音素的基周曲線⑼他 contour)、音量及音長等作一個整體的處理。 1281145 美國專利6,141,642揭露-種多語言文字轉語音裝置盥方 ^其中是包含糾的語該_統,分魏理獨語言^文 子^音讀,而後將不同語該理L彳得賴語音資料合 it:起輸出。,專利6,243,68ΐΒι揭露一種用於電腦電話 ^(Computer Telephony Integration)系統中的多語古笋 其巾包含多個語音合成||,分職柄同語言的文字轉 ’而後將不同語言處理系統所得刺語音資料合併後 广ϋΓί美國專㈣是結合不同語言的語音資料庫,而 ^口曰輸出%,使用者會聽到不同語言是來自於不同的聲音, y之外,整句話的韻律也不連續。再者,即使是以 者錄下不同語言的所有單字,這樣賴可以解決音色 =是要粧柯語言的财單字,所需成本極 ς想I、對於夕^文字轉語音的處理方法,f知技藝仍不盡 — 克服習知技藝的上述缺點,本案發明人乃經悉心試 ’並-本鐵而不捨之精神,終於創作出本案『文字轉 ς H統與方法』’關新的概念進行多語言的語音合成處 理,而產生韻律連續的語音輸出。 【發明内容】 夕目的是提供—敎字轉語音系統,用以提升 C ΐί出的自然度與流暢度。本發明之文字轉語音系統 處理器’用以將包含至少—第-語言與-第二語言 斜.分為—第—語言文字資料與—第二語言文字資 二筮用日標庫’包含複數個通用音標,其是該第一語言與 Γί:!:!通用的音標;至少—第一語音合成單元與-第二語 ilii70 簡由該複數個顧音標,分別產生對應於該 。口曰文字貢料的一第一語音資料以及對應於該第二語言 1281145 —弟二言吾音資粗· -語音資料與該第二語音f理器’用以將該第 根據上述構想,該第=的明律取佳化。 音標資料。 ^弟一語言文字資料是分別包含 ϊϊ 士 標庫較佳是由同-語者所建立。 根據上述_,該理巧含—組參考韻律。 決定該第-語音資料^係根據轉考韻律,分別 二韻律參數。 /、ϋΛ弟一語音資料的第一韻律參數與第 素、ίίίίί想’料—與第二韻律參數紋義語音的音 料與該第二語音資料的方式’力層串接該第-語音資 第一語音資料與第二理器更進—步調整串接後的該 口曰貝料。 以提供一種驗字轉語音的方法, 列步驟·供;;至少」T一=一第該一=:包含下 料區分為以㈡ 用mey供該第—語言與該第二語言通_複數個通 語4字ΐ=該Ϊ數個通用音標,分別產生對應於該第-次Γ丨文 枓的一弟一語音資料以及對應於該第二語古女念 音標述構想’該第—與第二語言文字資料是分別包含 祀據上述構想,邊被數個通用音標是由同一語者所建立。 根據上述構想,該步驟(e)更包含一步驟(el):提供一組表 1281145 考韻律。 根據上述構想,該步驟(e)更包含一步驟(e2):根 韻律,分別決定該第一語音資料與該第二語音資料二^考 參數與第二韻律參數。 、日員律 根據上述構想,該第一與第二韻律參數是定義达立 素、音量及音長。 …曰的音 根據上述構想,該步驟(e)更包含一步驟(e3) ··根 韻律參數與娜二韻律參數,藉續層式的方式 — 第-語音資料與該第二語音資料,達到韻律連續的目=接该 根據上述構想,該步驟(e)更包含一步驟(e4) 」 整串接後該第一語音資料與第二語音資料的韻律。一^調 月^另一目的是提供一種文字轉語音系、统,其可將 文字*料轉換為單—語言’並藉由韻律的調整,接并 曰輸出的自然度與流暢度。敎字轉語音系統 ^ 理,,用以將包含至少—第—語讀—第二語言的 以將該語音㈣的轉最触。 4處理斋’用 以及該第二語言文字魏是包含單字、片語 —i艮據上述構想,該語音合成單元更包含-叫爐έ日甘 該第—語言的語法及語義,而重組該第 得到具有正確語法及語義的該&4 =上述構想’該韻律處理器包含—組參考韻律。 該語音嫌減㈣錄據縣相律,決定 根據上述構想,該韻律參數是定義語音的音素、音量及 1281145 根據上述構想,該韻律處理器係根據該韻律參數, 该語音資料,達到韻律連續的目的。 本發明之另一目的是提供一種用於文字轉語音的方法, ^可,多語言的文字資料轉換為單—語言,並藉由韻律 正^提升語音輸出的自然度與流暢度。該方法包含下列步顿 ρ)提供包含至少一第一語言與一第二語言的文字資料 ,文字資料區分為-第—語言文字資料與一第二語言文警 該第二語言文字資料翻譯成為以該第—語言呈現的二 ⑷產生—語音龍對應於該第—語言文字資料與 以翻澤貝料;以及⑻將該語音資料的韻律最佳化。 、 以及該第二的文字賴是包含單字、片語 語言更包含—步_ ••根據該第一 料二料與該翻譯資 考韻^據上述構想,該步驟(e)更包含—步驟(ei):提供一組參 韻律_):輯該參考 音長根據上述構想,該猶參數是絲語音的音素、音量及 參數根據該韻律 【實施方式】 請參閱第一圖A,苴3 祕丄。 說明本發日_文字轉明之第—較佳實施例, 含一文字處理器u、之文字轉語音系統1包 用曰軚庫12、第一語音合成單元131 1281145 f日合成單元132以及一韻律處理器14。該文字轉語音 二件及其功能如下所述:該文字處理1111是用以接 子ί,中該文字字串是包含至少一第一語言與一第二 二^子魏’且該文字處理1111是依不同語言而將該文 二子 1 分為—第―語言文字資料與—第二語言文字資 ί料盘語言文字f料與第二語言文字㈣是包含音標 $洛。該通用音標庫12包含複數個通用音標,其 f吕與該第二語言通用的音標,該通用音標庫12較 二二了者所錄製。該第—語音合成單元131與第二語音合 用演算法自動取得該第-語言文字資料與第二 所定義的音標’當該第—語言文字資料與第二 使用該通用立早疋131與第二語音合成單元132 t文字^ΙΐΐτδΓa δ成’進而分別產生對應於該第一語 二的- ί 弟—語音資料以及對應於該第二語言文字資 3料該韻律處理器14是用以接收該第-語 哭14心曰,料並將其韻律最佳化,其中該韻律處理 i分別ΐ定第且根據該參考韻律’該韻律處理器14 -曰貝科與料二語音資料的音高、音量、 = 串接該第-語音資料與該第二語音i ^9_流触合成語音以供輸出。 斗、士义圖疋既明本發明用於文字轉音的方法之每浐古 第-語言與—第二語 · 1先&供包含至少- 分為一第一語言文字資料_盎串一 r ’产次將該文字字串區 其中該第—語言文字資 二文字讀1〇22, 含音標資料盥狂義而仏二、弟一5吾言文字資料1〇22是包 子丁貝t七、π義奴洛,而後提供一通用音標庫1〇3,其具有 1281145 該第一語言與該第二語言通用的複數個通用音標,並藉由該複 數個通用音標,分別產生對應於該第一語言文字資料1〇21的 一,=語音資料1041以及對應於該第二語言文字資料1〇22的 =第—語音資料1〇42,最後藉由韻律處理,將該第一語音資 料1041與該第二語音資料1042形成韻律最佳化的合^語音 1〇5’作為語音輸出。 第二圖與第三圖是根據本發明之第二較佳實施例,說明 本發明所提供文字轉語音系統的實施方式。請參閱第二圖,在 此實施例中,所提供的通用音標庫21,是具有可供中文、英 文與日文共用的通用音標。當在本發明的文字處理器22中輸 ^文子字串『father與m〇ther』,則該文字處理器22依中文與 :文’將該文字字串區分為『触er』、『與』以及『細化』 文字㈣,其中該語言文字資料包含依音標資料而 mo』的音標為該通用音標庫内中文、英文與日文通用的音 二,此K語音合成單元231接收『father』及『讀-』 ίϋ文子貝料『後’以運算法自動取得其中所定義的音標,而 収mo』的音標是直接由該通用音標庫21取得, 『er』的音標則是取自英語語音合成單元231 人成建庫i以完成『father』及『mGther』的英文語音 t音合成單元232接收到『與⑴v)』的語言文 自棘得射所㈣的音標,然而由於 人該·音標斜,所以是自中文語音 ίίϊϋ合成的英文合成語音射文合 的文^字串中整f音貝律處理:請參閱第三圖,由於所輸入 〜又錯的&成語音具有流暢的韻律變化,所以需調整整體 1281145 基本的音高(FO base)、音量(v〇l base)、語速(Speedbase)及音長 (deration),為達此目的,本發明的韻律處理器具有參考韻律作 為調整的彳^據,並進-步分職定数合成語音的継參數與 中文合成浯音的韻律參數,該韻律參數(F〇 base,v〇1 base, Speed bas,Duration base)是定義個別合成語音的音高(F〇 base)、曰 i(Vol base)、語速(Speed base)及音長(duration),因 而本發明的韻,處理器可依參考韻律與韻律參數,以階層式的 方式’將^同語言-層一層放上去,讓整體韻律連續麵。例 如,,士實施例中的文字字串中,英文是 ^要語言,而中文是少數語言,根據參考韻律先決定少數語言 /』的韻。律參數(F〇b,Volb)(F〇e,ν〇ΰ,_端的主要語言則 疋巧參ί韻律決定城律參數之後,該韻律處理ϋ依少數語言 的=參數而進—步調整主要語言『father』及―』的 [(F〇h VolO...^ 、〇二?達到整體合成語音的韻律連續順暢。當然,亦可先 決定f要,音的參考韻律,再依主要語言的參考韻律而修改少 數5吾S的參考韻律。 >、:芩閱第四圖A,其是根據本發明之第三較佳實施例, ,明本發_文字轉語音系統。本發明之文字轉語音祕4包 二ii處,41、—翻譯模組42、—語音合成單元43以及 二C理S44。該文字轉語音系統4的元件及其功能如下 由文字處理器41是用以接收文字字串,射該文字字 第—語言與—第二語言的文字資料’且該文字 處理=Μ疋依不同語言而將該文字字串處理區分為一第一語 曰ϋίϋ與—第二語言文字資料,其中該第二語言文字資料 ϊΊί予、片和及句子至少其―;該麟模組42是將該 文字資料翻戦第—語言形式的翻譯資料;該語音合 是用以接收該第—語言文字資料與該翻譯資料,而 後產-語音#料,語音合成單元43更包含—剖析模組 12 1281145 考韻律含—組參考雜,且根據該參 的音高、音量參數。該雛參數歧義語音 ,調整該;器根據該韻 4。太:疋况縣购文字轉音的方法之實施方 i 一二1巧文字轉語音的方法包含:f先提供包含至少- 八為二^二ΐ—ΐ:的文字字串401;其次將該文字字串區 文字貧料4G21與—第二語言文字資料4022, 二中:弟—δσ §文字貢料是包含單字、片語以及句子至少盆 ;資=二;;ΐ;資料嶋為刪一語言呈現“ #j4G3 ’根據㈣—語言的語法及語義,而將該第一言五古 4021與該翻譯資料403重組,以得到具有正確語i 音資料產生—語音資料彻,其是對應於該第一 b吕文字貢料4021與該翻譯資料4〇3;以及將該語音資料4〇3 ^韻律最佳化,而得韻律最佳化的合成語音他,進而完成語 f輸出。根據本發明,將該語音資料的韻律最佳化之方法為1 k供一組參考韻律;根據該參考韻律,決定該語音資料的韻律 參數j其中該韻律參數是定義語音的音高、音量、語速及音長; 根據^韻律參數,調整該語音資料,達到韻律連續的目的。 弟五圖是根據本發明之第四較佳實施例,說明本發明所 提供文字轉語音系統的實施方式。當在本發明的文字處理器 51中輸入文字字串『tomorrow會下雨嗎』,則該文字處理器 51依中文與央文,將該文字字串區分為『t〇m〇rf〇w』、『會下 雨嗎』的兩段語言文字資料,其中語言文字資料『會下雨嗎』 經由翻譯模組52翻譯為英文『will it rain?』,而後,該語音合 成單元53接收『tomorrow』與『will it rain?』的文字資料後, 13 1281145 將其轉換為語音資料,且該語音合成單元53更包含 · $ 53卜其係根據該英文的語法及語義,而將該所接收的 . tomorrow』與『will it rain?』重組,以得到具有正確語法及 語^的該語音資料『Will it rain tomorrow?』;而後,該^律處 理益54是用以將該語音資料的韻律最佳化,其中該韻律處理 器54更包含一組參考韻律’且根據該參考韻g,決定該=立 資料的韻f參數。該韻律參數是定義語音的音高、音量了;‘ 及音長,藉以使得該韻律處理器54根據該韻律參數,調整續 語音資料,達到韻律連續的目的。 上述實施例皆是以輸入『中文』與『英文』的混合語言 子串進說行說明,當然’本發明文字轉語音的系統與方法亦可 · 應用於其他各種不同的混合語言。 上二上所述,本發明文子轉語音的系統與方法可將混合多 種語言^文字字串,藉由一通用音標庫與特定韻律處理,而產 生^有高自然度與流暢度的多語言合成語音;此外,本發明的 ^子轉浯音系統與方法更可包含一翻譯模組,而將混合多種語 1的文字字串,藉由該翻譯模組與特定韻律處理,而產生具有 高自然度與流暢度的單一語言合成語音。本發明的確克服/了習 知,藝中多語言文字轉語青不順暢的缺點,故本發明不但具有 新穎性、進步性,更當然具有產業上的利甩性。 φ 本案得由热悉本技藝之人士任施匠思而為諸般修飾,然 皆不脫如附申請專利範圍所欲保護者。 14 1281145 【圖式簡單說明】 的文^轉^^音八系^根據本發明之第一較佳實施例,說明本發明 第一圖B是說明本發明用於文字轉音的方法之實施方 式。 第—圖與第三圖是根據本發明之較佳實施 本發,提供7轉語音系統的實齡式。 ^四圖A是根據本發明之第三較佳實施例,說明本發明 的文予轉語音系統。 第四圖B是根據本發明之第三較佳實施例,說明本發明 用於^字轉音的方法之實施方式。 第五圖是根據本發明之第四較佳實施例,說明本發 k供文^字轉語音系統的實施方式。 第六圖是說明習知技藝文字轉語音系統的運作流程。 【主要元件符號說明】 1文子轉語音系統 12通用音標庫 132第二語音合成單元 101文字字串 1022第二語言文字資料 1041第一語音資料 105韻律最佳化的合成語音 22文字處理器 232中文語音合成單元 4文字轉語音系統 42翻譯模組 431剖析模組 11文字處理器 131第一語音合成單元 14韻律處理器 1021第一語言文字資料 通用音標庫 、 1042第二語音資料 21通用音樣庫 231英文語音合成單元 24韻律處理器 41文字處理器 43語音合成單元 44韻律處理器
15 1281145 401文字字串 4022第二語言文字資料 404語音資料 51文字處理器 53語音合成單元 54韻律處理器 4021第一語言文字資料 403翻譯資料 405韻律最佳化的合成語音 52翻譯模組 531剖析模組
16
Claims (1)
- 申請專利範圍: 1. 一種文字轉語音系統,其包含: 一文字處理器,用以將包含至少一第一語言與一第二 語言的文字字串區分為一第一語言文字資料與一第二語言 文字資料; 一通用音標庫,由同一語者所建立,包含複數個通用 音標,其是該第一語言與該第二語言通用的音標; 至少一第一語音合成單元與一第二語音合成單元,用 以藉由該複數個通用音標,分別產生對應於該第一語言文 字資料的一第一語音資料以及對應於該第二語言文字資料 的一第二語音資料;以及 一韻律處理器,用以將該第一語音語音與該第二語音 資料的韻律最佳化,達到韻律連續的目的。 2. 如申請專利範圍第1項的文字轉語音系統,其中該第一 與第二語言文字資料是分別包含音標資料。 3. 如申請專利範圍第1項的文字轉語音系統,其中該韻律 處理器包含一組參考韻律。 4. 如申請專利範圍第3項的文字轉語音系統,其中該韻律 處理器係根據該參考韻律,分別決定該第一語音資料與該 第二語音資料的第一韻律參數與第二韻律參數。 5. 如申請專利範圍第4項的文字轉語音系統,其中該第一 與第二韻律參數是定義語音的音高、音量、語速及音長。 6. 如申請專利範圍第4項的文字轉語音系統,其中該韻律 處理器係根據該第一韻律參數與該第二韻律參數,藉由階 17Mm 層式的方式,分層串接該第一語音資料與該第二語音資料。 7. 如申請專利範圍第6項的文字轉語音系統,其中該韻律 處理器更進一步調整串接後的該第一語音資料與第二語音 資料。 8. —種用於文字轉語音的方法,其包含下列步驟: (a)提供包含至少一第一語言與一第二語言的文字字 串; (b) 將該文字字串區分為一第一語言文字資料與一第 二語言文字資料; (c) 提供該第一語言與該第二語言通用的複數個通用音 標,該複數個通用音標是由同一語者所建立; (d) 藉由該複數個通用音標,分別產生對應於該第一語 言文字資料的一第一語音資料以及對應於該第二語言文字 資料的一第二語音資料;以及 (e) 將該第一語音資料與該第二語音資料的韻律最佳 化,達到韻律連續的目的。 9. 如申請專利範圍第8項的方法,其中該第一與第二語言 文字資料是分別包含音標資料。 10. 如申請專利範圍第8項的方法,其中該步驟(e)更包含一 步驟(el):提供一組參考韻律。 11. 如申請專利範圍第10項的方法,其中該步驟(e)更包含 一步驟(e2):根據該參考韻律,分別決定該第一語音資料與 該第二語音資料的第一韻律參數與第二韻律參數。 18 L 一_———.一一—一·一 12. 如申請專利範圍第11項的方法,其中該第一與第二韻 律參數是定義語音的音高、音量、語速及音長。 13. 如申請專利範圍第11項的方法,其中該步驟(e)更包含 一步驟(e3):根據該第一韻律參數與該第二韻律參數,藉由 階層式的方式,分層串接該第一語音資料與該第二語音資 料。 14. 如申請專利範圍第13項的文字轉語音系統,其中該步 驟(e)更包含一步驟(e4):更進一步調整串接後該第一語音 資料與第二語音資料的韻律。 15. —種文字轉語音系統,其包含: 一文字處理器,用以將包含至少一第一語言與一第二 語言的文字資料區分為一第一語言文字資料與一第二語言 文字資料; 一翻譯模組,用以將該第二語言文字資料翻譯成為以 該第一語言呈現的一翻譯資料; 一語音合成單元,用以接收該第一語言文字資料與該 翻譯資料,而後產生一語音資料;以及 一韻律處理器,用以將該語音資料的韻律最佳化,達 到韻律連續的目的。 16. 如申請專利範圍第15項的文字轉語音系統,其中該第 二語言文字資料是包含單字、片語以及句子至少其一。 17·如申請專利範圍第15項的文字轉語音系統,其中該語 音合成單元更包含一剖析模組,其係根據該第一語言的語 19 法及語義,而將該第一語言文字資料與該翻譯資料重組, 以得到具有正確語法及語義的該語音資料。 18. 如申請專利範圍第15項的文字轉語音系統,其中該韻 律處理器包含一組參考韻律。 19. 如申請專利範圍第18項的文字轉語音系統,其中該韻 律處理為係根據該參考音貝律,決定該語音貨料的音貝律參數。 20. 如申請專利範圍第19項的文字轉語音系統,其中該韻 律參數是定義語音的音高、音量、語速及音長。 21. 如申請專利範圍第19項的文字轉語音系統,其中該韻 律處理器係根據該韻律參數,調整該語音資料。 22. —種用於文字轉語音的方法,其包含下列步驟: (a) 提供包含至少一第一語言與一第二語言的文字資 料; (b) 將該文字資料區分為一第一語言文字資料與一第 二語言文字資料; (c) 將該第二語言文字資料翻譯成為以該第一語言呈現 的一翻譯資料; (d) 產生一語音資料對應於該第一語言文字資料與該 翻譯資料;以及 (e) 將該語音資料的韻律最佳化,達到韻律連續的目的。 23. 如申請專利範圍第22項的方法,其中該第二語言文字 資料是包含單字、片語以及句子至少其一。 2屯如申請專利範圍第22項的方法,其中該步驟(d)更包含 20 Ϊ28Μ45 一步驟(dl):根據該第一語言的語法及語義,而重組該第 一語言文字資料與該翻譯資料,以得到具有正確語法及語 義的該語音資料。 25. 如申請專利範圍第22項的方法,其中該步驟(e)更包含 一步驟(el):提供一組參考韻律。 26. 如申請專利範圍第25項的方法,其中該步驟(e)更包含 一步驟(e2):根據該參考韻律,決定該語音資料的韻律參數。 27. 如申請專利範圍第26項的方法,其中該韻律參數是定 義語音的音高、音量、語速及音長。 28. 如申請專利範圍第25項的方法,其中該步驟(e)更包含 一步驟(e3):根據該韻律參數,調整該語音資料。21
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| TW093138499A TWI281145B (en) | 2004-12-10 | 2004-12-10 | System and method for transforming text to speech |
| US11/298,028 US20060136216A1 (en) | 2004-12-10 | 2005-12-09 | Text-to-speech system and method thereof |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| TW093138499A TWI281145B (en) | 2004-12-10 | 2004-12-10 | System and method for transforming text to speech |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| TW200620240A TW200620240A (en) | 2006-06-16 |
| TWI281145B true TWI281145B (en) | 2007-05-11 |
Family
ID=36597236
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| TW093138499A TWI281145B (en) | 2004-12-10 | 2004-12-10 | System and method for transforming text to speech |
Country Status (2)
| Country | Link |
|---|---|
| US (1) | US20060136216A1 (zh) |
| TW (1) | TWI281145B (zh) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8898066B2 (en) | 2010-12-30 | 2014-11-25 | Industrial Technology Research Institute | Multi-lingual text-to-speech system and method |
| US9865251B2 (en) | 2015-07-21 | 2018-01-09 | Asustek Computer Inc. | Text-to-speech method and multi-lingual speech synthesizer using the method |
Families Citing this family (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP4743686B2 (ja) * | 2005-01-19 | 2011-08-10 | 京セラ株式会社 | 携帯端末装置、およびその音声読み上げ方法、並びに音声読み上げプログラム |
| CN101727904B (zh) * | 2008-10-31 | 2013-04-24 | 国际商业机器公司 | 语音翻译方法和装置 |
| US9798653B1 (en) * | 2010-05-05 | 2017-10-24 | Nuance Communications, Inc. | Methods, apparatus and data structure for cross-language speech adaptation |
| TWI413104B (zh) * | 2010-12-22 | 2013-10-21 | Ind Tech Res Inst | 可調控式韻律重估測系統與方法及電腦程式產品 |
| US20130030789A1 (en) * | 2011-07-29 | 2013-01-31 | Reginald Dalce | Universal Language Translator |
| KR20140121580A (ko) * | 2013-04-08 | 2014-10-16 | 한국전자통신연구원 | 자동 번역 및 통역 장치 및 그 방법 |
| KR20170044849A (ko) * | 2015-10-16 | 2017-04-26 | 삼성전자주식회사 | 전자 장치 및 다국어/다화자의 공통 음향 데이터 셋을 활용하는 tts 변환 방법 |
| US20180018961A1 (en) * | 2016-07-13 | 2018-01-18 | Google Inc. | Audio slicer and transcription generator |
| CN112352275B (zh) | 2018-12-13 | 2024-11-22 | 微软技术许可有限责任公司 | 具有多级别文本信息的神经文本到语音合成 |
| CN111798832B (zh) * | 2019-04-03 | 2024-09-20 | 北京汇钧科技有限公司 | 语音合成方法、装置和计算机可读存储介质 |
Family Cites Families (11)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TW421750B (en) * | 1997-03-14 | 2001-02-11 | Omron Tateisi Electronics Co | Language identification device, language identification method and storage media recorded with program of language identification |
| KR100238189B1 (ko) * | 1997-10-16 | 2000-01-15 | 윤종용 | 다중 언어 tts장치 및 다중 언어 tts 처리 방법 |
| US6292772B1 (en) * | 1998-12-01 | 2001-09-18 | Justsystem Corporation | Method for identifying the language of individual words |
| US6185533B1 (en) * | 1999-03-15 | 2001-02-06 | Matsushita Electric Industrial Co., Ltd. | Generation and synthesis of prosody templates |
| JP3711411B2 (ja) * | 1999-04-19 | 2005-11-02 | 沖電気工業株式会社 | 音声合成装置 |
| GB2353927B (en) * | 1999-09-06 | 2004-02-11 | Nokia Mobile Phones Ltd | User interface for text to speech conversion |
| US6601026B2 (en) * | 1999-09-17 | 2003-07-29 | Discern Communications, Inc. | Information retrieval by natural language querying |
| US6848080B1 (en) * | 1999-11-05 | 2005-01-25 | Microsoft Corporation | Language input architecture for converting one text form to another text form with tolerance to spelling, typographical, and conversion errors |
| US6865533B2 (en) * | 2000-04-21 | 2005-03-08 | Lessac Technology Inc. | Text to speech |
| US6704699B2 (en) * | 2000-09-05 | 2004-03-09 | Einat H. Nir | Language acquisition aide |
| CN1159702C (zh) * | 2001-04-11 | 2004-07-28 | 国际商业机器公司 | 具有情感的语音-语音翻译系统和方法 |
-
2004
- 2004-12-10 TW TW093138499A patent/TWI281145B/zh not_active IP Right Cessation
-
2005
- 2005-12-09 US US11/298,028 patent/US20060136216A1/en not_active Abandoned
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8898066B2 (en) | 2010-12-30 | 2014-11-25 | Industrial Technology Research Institute | Multi-lingual text-to-speech system and method |
| US9865251B2 (en) | 2015-07-21 | 2018-01-09 | Asustek Computer Inc. | Text-to-speech method and multi-lingual speech synthesizer using the method |
Also Published As
| Publication number | Publication date |
|---|---|
| US20060136216A1 (en) | 2006-06-22 |
| TW200620240A (en) | 2006-06-16 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Arvaniti | Greek phoneticsthe state of the art | |
| Prahallad et al. | The IIIT-H Indic speech databases. | |
| Iida et al. | A corpus-based speech synthesis system with emotion | |
| Fagyal et al. | French: A linguistic introduction | |
| US11062615B1 (en) | Methods and systems for remote language learning in a pandemic-aware world | |
| US8219398B2 (en) | Computerized speech synthesizer for synthesizing speech from text | |
| TWI281145B (en) | System and method for transforming text to speech | |
| Astésano | Prosodic characteristics of reference French | |
| JP3270356B2 (ja) | 発話文書作成装置,発話文書作成方法および発話文書作成手順をコンピュータに実行させるプログラムを格納したコンピュータ読み取り可能な記録媒体 | |
| Aida-Zade et al. | The main principles of text-to-speech synthesis system | |
| CN1801321B (zh) | 文字转语音的系统与方法 | |
| Otake et al. | Lexical selection in action: Evidence from spontaneous punning | |
| JP4811557B2 (ja) | 音声再生装置及び発話支援装置 | |
| Aaron et al. | Conversational computers | |
| Yung | A heuristic theory of metrical transformation and tune metamorphosis: tracking creativity in traditional Cantonese opera | |
| JP4409279B2 (ja) | 音声合成装置及び音声合成プログラム | |
| El-Imam et al. | Rules and algorithms for phonetic transcription of standard Malay | |
| Reichl | From performance to text: A medievalist's perspective on the textualization of modern Turkic oral poetry | |
| JP2002132282A (ja) | 電子テキスト読み上げ装置 | |
| Kirby | Comparative tonal text-setting in Mandarin and Cantonese popular song | |
| Zhirmunsky et al. | Introduction to Rhyme: Its" History and Theory" | |
| Bracks | Compound Intonation Units in Totoli | |
| Athanasopoulou et al. | The Acoustic Manifestation of Prominence in Stressless Languages. | |
| JP2894447B2 (ja) | 複合音声単位を用いた音声合成装置 | |
| Patil et al. | Text Echo Personalized TTS System |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| MM4A | Annulment or lapse of patent due to non-payment of fees |