ITRM940763A1 - Disposizione e metodo di sintesi vocale - Google Patents

Disposizione e metodo di sintesi vocale Download PDF

Info

Publication number
ITRM940763A1
ITRM940763A1 IT94RM000763A ITRM940763A ITRM940763A1 IT RM940763 A1 ITRM940763 A1 IT RM940763A1 IT 94RM000763 A IT94RM000763 A IT 94RM000763A IT RM940763 A ITRM940763 A IT RM940763A IT RM940763 A1 ITRM940763 A1 IT RM940763A1
Authority
IT
Italy
Prior art keywords
phoneme
points
time scale
weighting
information
Prior art date
Application number
IT94RM000763A
Other languages
English (en)
Inventor
Tomas Svensson
Original Assignee
Telia Ab
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Telia Ab filed Critical Telia Ab
Publication of ITRM940763A0 publication Critical patent/ITRM940763A0/it
Publication of ITRM940763A1 publication Critical patent/ITRM940763A1/it
Application granted granted Critical
Publication of IT1276336B1 publication Critical patent/IT1276336B1/it

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/04Time compression or expansion
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/06Elementary speech units used in speech synthesisers; Concatenation rules
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/08Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination

Landscapes

  • Engineering & Computer Science (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Machine Translation (AREA)
  • Processing Or Creating Images (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Electric Clocks (AREA)
  • Document Processing Apparatus (AREA)
  • Electrophonic Musical Instruments (AREA)

Abstract

La presente invenzione si riferisce ad un metodo ed a una disposizione per trasformare fonemi su un periodo più breve o più lungo che un fonema esistente. La trasformazione ha luogo asimmetricamente in quanto un fonema di base viene diviso in un certo numero di punti, detti punti essendo individuati rispetto ad elementi portanti informazioni nel fonema. Ciò consente una ponderazione nel fonema tra elementi portanti informazioni ed elementi portanti meno informazioni. Le parti del fonema con elementi portanti meno informazioni vengono trasformate entro un intervallo di tempo più lungo o rispettivamente più breve. Elementi nel fonema che rappresentano parti portanti informazioni vengono trasferiti senza essere variati nel tempo. Ciò fornisce una trasformazione del fonema che conserva il suo carattere originale in tutte le porzioni essenziali. Per il fatto che viene individuato il fonema portante meno informazioni, l'invenzione fornisce anche un'indicazione di dove differenti fonemi possono essere sistemati uno dentro l'altro nella creazione della parola artificiale.

Description

Descrizione
dell'invenzione avente per titolo:
"Disposizione e metodo di sintesi vocale"
Campo tecnico
La presente invenzione si riferisce alla sintesi della parola. Nella sintesi della parola, o sintesi vocale, vengono individuate parole che vengono suddivise in un certo numero di suoni caratteristici chiamati fonemi, nella individuazione di sequenze parlate, è essenziale che i detti fonemi siano correttamente individuati. I fonemi vengono anche utilizzati per generare sequenze parlate con mezzi artificiali·
Stato della,tecnica
Quando la parola viene generata artificialmen- , te, si utilizza normalmente una biblioteca con fonemi fondamentali. Quando questi fonemi vengono assemblati in parole,essi devono in molti casi essere trasformati entro periodi più lunghi o più corti che sono rappresentati dai fonemi di base. E' noto a questo riguardo che si individuano i fonemi in un certo numero di punti. Quando si trasforma il fonema originale in una differente scala di tempo, il che può significare un allungamento o un accorciamento della scala di tempo, è noto che si esegue la trasformazione in un certo numero di punti prescelti. Quando la scala di tempo viene allungata, eie coinvolge certi punti nel fonema originale rappresentando un certo numero di punti nel nuovo fonema. Quando la scala di tempo viene accorciata, un certo numero di punti nel fonane originale viene combinato per formare un unico punto nel nuovo fonema. Quando il fonema originale viene trasferito ad una scala di tempo che, per esempio, è del 25% più lunga del fonane nella biblioteca, in certo numero di punti nel fonema della biblioteca viene selezionato. Nel nuovo fonema, che è formato dalla trasformazione, il 25% di punti in più viene inserito rispetto al fonema della biblioteca. In seguito alla trasformazione, il nuovo fonema conterrà dunque un numero di punti che non sono definiti le fonema della biblioteca. In seguito alla trasformazio viene selezionato ciascun quarto punto nel fonema della biblioteca. Queste parti del fonema vengono duplicate e trasferite a due punti nel fonema allungato. I punti restanti vengono trasferiti dal fonema della biblioteca al fonema allungato, punto per punto. Ciò consente un allungamento del tempo del fonema originale mediante un allungamento uniforme del tempo sull'intero fonema. Nei casi in cui il fonema della biblioteca è più lungo del fonema che deve essere formato ciascun quarto punto viene scelto nella stessa maniera come sopra, supponendo che l'accorciamento del tempo sia del 25%. Quando il fonema accorciato nel tempo è stato formato, questi punti vengono rimossi nella trasformazione. Nel Brevetto EP 252544 è descritta la modifica della,scala della parola di un nuovo punto segnale. Ciò si basa, tra l'altro, sullaconstatazione che la compressione della scala di tempo riduce il contenuto d'informazioni e che l'espansione della scala di tempo aumenta il contenuto d'informazioni. Si possono così rimuovere "periodi di tono" o inserirli rispettivamente su un segmento. L'invenzione consiste in un metodo per migliorare il metodo SOLA mediante sovrapposizione di blocchi parzialmente sovrapposti.
Il Brevetto US 4435832 mostra una sintesi vocale con allungamento e compressione della scala di tempo senza cambiare il tono della parola sintetica. I parametri LPC vengono campionati a partire da forme d'onda segmentate prelevate dalla parola normale in un dato intervallo di tempo, da informazioni riguardanti fonemi vocali/non vocali, tono e informazioni sul volume. L'LPC viene interpolato e l'intervallo della scala di tempo per l'interpolazione viene migliorato.
Nel Brevetto US 4864620 è descritto un metodo per modificare la scala di tempo di informazioni vocali o segnali vocali per riprodurre la parola registrata ad una differente velocità senza cambiamento del tono. Campioni del settore tempo vengono prulevati in inquadrature dove il numero dei campionamenti per inquadratura è funzione del desiderato fattore di cambiamento della parola. Blocchi vengono formati a partire dalle inquadrature. Si realizzano transizioni relativamente morbide mediante ponderazione graduata.
La modifica della scala di tempo di segnali vocali è ancora indicata nel Brevetto US 5216744.
Viene determinato il numero di campionamento che costituiscono un "periodo di tone". Inoltre un gruppo campione combinato formato di un primo gruppo campione e da un secondo gruppo campione viene formato. Il numero di campioni in ciascun gruppo è uguale al numero di campioni che costituiscono un periodo di tono.
Descrizione dell'invenzione
Problema tecnico
Nella sintesi vocale è essenziale che parole e frasi prodotte artifictalmente siano riprodotte naturalmente. E' anche essenziale che la parola prodotta da una persona sia identificata correttamente.
A questo riguardo è possibile identificare un certo numero di suoni, fonemi, caratteristici per differenti lingue. Questi fonemi sono disposti in differenti forme di biblioteche. Detto fonemi costituiscono un nucleo di base. I fonemi possono estendersi su un tempo più lungo o più corto che gli intervalli di tempo che sono rappresentati dal fonema di base a seconda del contesto e della parole i cui sono inclusi. Ciò comporta che i fonemi rappresentati nella biblioteca devono essere trasformati in periodi di tempo più lunghi o più corti. In questo contesto è essenziale in una trasformazione del genere che la caratteristica del fonema non venga cambiata. Ciò implica che le parti portanti informazioni del fonema non vengano cambiate. E' dunque desiderabile che cambiamenti di tempo avvengano nelle parti del fonema che portano meno informazioni. Nell'assemblaggio di un certo numero di fonemi in parole e frasi, è anche essenziale che le transizioni tra fonemi abbiano luogo in maniera tale che le parti portanti informazioni di un rispettivo fonema non siano cambiate.
Nella parola naturale, il tono fondamentale viene cambiato con il medesimo fonema nello svolgimento della parola. Le soluzioni presentate finora non hanno tenuto conto di questo fenomeno. E' quindi desiderabile che il cambiamento nel tono fondamentale, di maggiore o minor frequenza, sia preso in considerazione quando si trasformano fonemi.
L'invenzione caratterizzata si propone di indicare una soluzione al problema caratterizzato. Soluzione
La presente invenzione riguarda un metodo per la sintesi vocale. Viene identificato un fonema in un certo numero di punti nella eccitazione della corrispondente corda vocale dell'oratore. Il fonema deve essere trasformato ad un altro tempo rispetto a quello che è rappresentato dal fonema originale. Dopo che i punti sono stati scelti, i punti nel fonema che sono portatori di informazioni vengono identificati, Per trasporto d'informazioni s'intendono a questo riguardo le parti del fonema necessarie affinchè il fonema sia correttamente compreso. Le parti del fonema che portano meno informazioni vengono anch'esse identificate. Parti che portano meno informazioni possono essere cambiate senza che la caratteristica del fonema venga cambiata nella sua parte più essenziale. Quando vengono adoperati fonemi, per esempio,per generare parola artificiale, è desiderabile che si possa adoperare un certo numero di fonemi di base i quali vengono trasformati in valori desiderati in differenti occasioni. L'invenzione tiene conto di questa situazione e sposta le transizioni tra differenti fonemi verso le parti che portano meno informzioni. Nella trasformazione in una nuova scala di tempo, la compressione o rispettivamente lo stiramento hanno essenzialmente luogo nelle parti del fonema che portano meno informazioni In questo modo le parti portanti informazioni del fonema sono mantenute essenzialmente intatte-La disposizione comprende un elemento che sceglie un fonema da una sequenza vocale o da un elemento memorizzatore. L'elemento identifica un certo numero di punti nel fonema. Vengono poi identificate le parti portanti informazioni del fonema o, rispettivamente le parti del fonema portanti meno inforinazioni.
L' elemento provvede allora a che la trasformazione del fonema in un tempo più lungo/più corto abbia luogo mediante compressione o rispettivamente mediante stiratura nella parte del fonema che porta meno informazioni. In questo modo il carattere del fonema viene essenzialmente conservato. Inoltre viene data la possibilità di ottenere transizioni tra differenti fonemi che danno un'impressione naturale.
L'invenzione permette di memorizzare una seriie di fonemi di biblioteca rappresentanti un certo numero di suoni che si trovano nel linguaggio. Questi fonemi di biblioteca possono essere utilizzati per trasformazioni in un tempo più lungo o più corto di quanto rappresentato dal fonemadi biblioteca. Con la soluzione indicata, il fonema trasformato viene corrotto in misura minima rispetto al fonema di biblioteca. Ciò si deve al fattoche le parti del fonema essenziali per l'interpretazione del fonema sono invariate o variate in minor misura. L'invenzione permette anche di tener conto di cambiamenti nel tono fondamentale nel fonema. Si possono introdurre così variazioni nel tono fondamentale nel fonema trasformato, in relazione al fonema di biblioteca. Il significato è che a sequenze vocali createsi può dare un carattere concordante con la parola naturale. Ciò è essenziale, sia per comprendere la parola sia per ottenere una intonazione naturale nel suono creato.
Descrizione delle figure
La Figura 1 mostra esempi di cartografia lineare della scala di tempo.
La Figura 2 mostra la formazione della scala di tempo secondo l'invenzione;
La Figura 3 mostra l'invenzione in forma di schema a blocchi.
La Figura 4 mostra un fonema nel quale una finestra A esclude asimmetricamente un impulso.
Forma di attuazione preferita
Nel testo che segue, l'invenzione è descritta con riguardo alle figure. Nel creare una parola artificiale, un testo arriva in 1 nella Figura 1. 11 testo viene analizzato da 1 e suddiviso nei suoi componenti fondamentali. I fonemi vengono ora scelti dalla biblioteca. Il fonema nella biblioteca rappresenta un valore campione. Ciè comporta che il fonema si è visto conferire un valore campione rispetto alla durata, al tono ecc. Quando il fonema deve essere quindi inserito nel testo che è arrivato, occorre di norma una qualche forma di modifica del fonema, il che significa che l'estensione del fonema nel tempo deve essere cambiata. ciò è rappresentato per esempio da tempi lunghi, corti o medi durante i quali deve essere rappresentata per esempio una vocale, ^er trasformare il fonema di biblioteca, esso viene identificato in un certo numero di punti. Il fonema viene ora analizzato da 1. Nell'analisi, vengono determinate parti portanti informazioni e parti portanti meno informazioni.· Le parti portanti meno informazioni vengono ora scelte per la trasformazione. E' stato osservato che le transizioni tra differenti fonemi sono di maggior significato che le parti più stabili nell'interno dei fonemi. Il processo di sviluppo , che contiene informazioni decisive riguardanti l'interpretazione del fonema, è di particolare importanza in questo contesto. I punti portanti meno informazioni vengono poi copiati per dare un certo numero di punti equivalenti nella nuova scala di tempo quando si prolunga il tempo, ciò è illustrato nella Figura 2 in cui certi punti sono trasferiti dalla scala di tempo più corta ad un certo numero di punti nella scala di tempo più lunga. In questo modo le parti portanti informazioni del fonema sono conservate nella stiratura della scala di tempo senza che la caratteristica del fonema venga cambiata·
La scala di tempo viene accorciata in maniera corrispondente. In questo caso, due o più punti nella parte del fonema che non porta informazioni sono combinati per formare un singolo punto. In questo modo le parti portanti informazioni sono anch'esse mantenute in gran parte intatte quando la scala di tempo nel fonema viene accorciata.
Per ridurre l'effetto dell'eccitazione di una corda vocale precedente, è stata scelta una finestra che è stata ritagliata asimmetricamente. ciò è illustrato nella Figura 4. La finestra viene così tagliata ripidamente all'inizio, registrando così il periodo iniziale dell'impulso e una parte minima della parte finale degli impulsi precedenti. E' anche conveniente il fatto che venga tagliata una parte dell'impulso tanto grande che si ottiene il suovalore massimo ed una proporzione dell'impulso smorzato. Questa soluzioneoffre la possibilità di spostare le transizioni tra gli impulsi di eccitazione delle corde vocalialle zone dove gli impulsi sono smorzati e non contengono informazioni significative. Un ritaglio a finestra dì questo tipo dà inoltre come conseguenza di poter identificare la significanza dei singoli impulsi per comprendere i fonemi.
L'invenzione permette inoltre di ponderare differenti punti nel fonema di biblioteca in relazione agli elementi portanti informazioni. La ponderazione viene utilizzata nella trasformazione del fonema
in maniera tale che i punti ai quali è stata conferita una minor ponderazione siano trasformati in un periodo di tempo più lungo .delle parti che hanno ricevuto una maggior ponderazione. Punti con bassa ponderazione .vengono dunque assegnati per esempio a tre punti in una scala di tempo più lunga, mentre punti che rappresentano una ponderazione media sono trasformati per esempio in due punti nella nuova scala di tempo,e punti con ponderazione massima vengono trasferiti invariati nella nuova scala.
All'atto della trasfrormazione in una scala di tempo più corta di quella rappresentata nel fonema di base, tre punti che rappresentano per esempio la ponderazione minore sono combinati in un unico punto in maniera simile, e punti rappresentanti una ponderazione media sono combinati a due a ùue in un unico punto nel fonema accorciato nel tempo. Punti con la ponderazione la più alta sono trasferiti invariati nella nuova scala di tempo.
In questo modo l'invenzione.rende possibile la scalata nel tempo di fonemi da effettuare senza che le parti del fenoma portanti informazioni siano cambiate in una qualsiasi parte essenziale. Il metodo permette anche di legare l'uno all'altro differenti fonemi in maniera tale che che importanti informazioni nel fonema non siano distrutte nelle transizioni di fonemi. Ciò è causato dalla transizione tra i fonemi che avviene in parti non portanti alcuna informazione.
In questo modo l'invenzione permette che parole ed espressioni create tramite la sintesi vocale diventino quasi naturali.
Poiché i punti scelti nel fonema rappresentano eccitazioni delle corde vocali nella parola, è possibile cambiare il tono fondamentale. Questo è necessario, per esempio,per dare il giusto carattere al fonema che viene creato. Il cambiamento del tono fondamentale, viene ottenuto dalle eccitazioni delle corde vocali nel fonema creato che viene riprodotto in punti che vengono cambiati in relazione al fonema originale. Si supponga,per esempio, che il fonema di base rappresenti un suono con tono fondamentale immutato. Ciò comporta che le eccitazioni delle corde vocali avvengano con lo stesso reciproco distanziamento. In un fonema trasformato, tuttavia, il tono fondamentale viene cambiato durante il periodo di vita del fonema. Conoscendo il cambiamento nel tono fondamentale caratteristico, si deve tener conto di ciò nella trasformazione nel fonema nuovo, che in questo caso può essere un fonema che è invariato nel tempo o che viene trasformato in un tempo più lungo o più corto, gli intervalli di tempo sono determinati tra ciascuna eccitazione delle corde vocali che comparirà nel fonema. Così, per esempio, l'intervallo di tempo tra la prima e la seconda eccitazione delle corde vocali è TI e l'intervallo tra l'ultima e la penultima eccitazione delle corde vocalie T2. Se in questo caso avviene che l'alterazione nel tono fondamentale cambia uniformemente con il passare del tempo, le eccitazioni intermedie delle corde vocali devono essere distribuite prendendo ciò in considerazione. Detta distribuzione viene opportunamente effettuata medianti modelli matematici conosciuti. Rispettive eccitazioni delle corde vocali nel fonema di base vengono poi trasferite a rispettivi punti nel fonema trasferito. Ciò consente una variazione nel tono fondamentale che corrisponde alla parola naturale. .
L'invenzione non è limitata alla forma di realizzazione mostrata sopra ma può essere sottoposta a modifiche entro l'ambito di applicazione delle rivendicazioni che seguono ed entro il concetto dellinvenzione.

Claims (10)

  1. RIVENDICAZIONI 1. Metodo di sintesi vocale per trasformare un dato fonema da una prima scala di tmpo ad una seconda scala di tempo, caratterizzato dal fatto che vengono determinati punti con un intervallo di tempo circostante, rappresentanti una parte di una curva del fonema; che vengono identificate le parti del fonema portanti più e rispettivamente, meno informazioni e che le parti del fonema portanti meno informazioni vengono trasformate nella seconda scala di tempo entro un periodo più lungo/più corto nella seconda scala di tempo, e che le parti del fonema portanti più informazioni vengono trasformate nella seconda scala di tempo essenzialmente senza essere cambiate nel tempo, per cui il carattere originale del fonema viene essenzialmente conservato.
  2. 2. Metodo secondo la rivendicazione 1, caratterizzato dal fatto che sono identificati i differenti punti nei fonemi ed essi ricevono differente ponderazione rispetto al grado d'informazione che rappresentano.
  3. 3. Metodo secondo le rivendicazioni 1 o 2, caratterizzato dal fatto che i punti con una minor ponderazione vengono trasformati entro un periodo più lungo/più corto dei punti con maggior ponderazione, e che la trasformazione avviene mediante duplicazione o rimozione di punti con la minor ponderazione.
  4. 4. Metodo secondo la rivendicazione 1, caratterizzato dal fatto che transizioni di fonemi avvengono nelle parti del fonema che non portano alcuna informazione.
  5. 5. Metodo secondo la rivendicazione 1, caratterizzato dal fatto che i punti prescelti nella seconda scala di tempo sono scelti con lo stesso o con un altro intervallo di tempo rispetto alla prima scala di tempo per cui il tono fondamentale viene mantenuto o viene cambiato in relazione al dato fonema all'atto della trasformazione del fonema .
  6. 6. Disposizione nella sintesi vocale che comprende un elemento di selezione che sceglie un fonema da una sequenza vocale o da un elemento di memoria, per trasferire il fonema da una prima scala di tempo ad una seconda scala di tempo, caratterizzata dal fatto che l'elemento di selezione identifica un certo numero di punti con un intervallo di tempo circostante che rappresenta una parte della curva del fonema, per cui vengono identificate le parti del fonema portanti informazioni, e rispettivamente portanti meno informazioni; che l'elemento trasforma le parti del fonema portanti meno informazioni entro un tempo più lunto/più corto nella trasformazione del fonema in un'altra scala di tempo rispetto alla scala di tempo originale rappresentata dal fonema; e che il carattere originale del fonema viene essenzialmente conservato.
  7. 7. Disposizione secondo la rivendicazione 6, caratterizzata dal fatto che l'elemento di selezione identifica e pondera differenti punti a seconda del contenuto d'informazione dei detti punti rispetto alla identificabilità del fonema.
  8. 8. Disposizione secondo le rivendicazioni 6 o 7, caratterizzata dal fatto che l'elemento di selezione trasforma punti con minor ponderazione entro una scala di tempo più lunga dei punti che rappresentano una ponderazione media, e che punti ai quali è stata attribuita una ponderazione superiore vengono trasformati in condizione invariata.
  9. 9. Disposizione secondo le rivendicazioni 6 o 7, caratterizzata dal fatto che tre o più punti con ponderazione bassa vengono combinati, e che punti con ponderazione media vengono combinati in un numero di punti minore che non i punti con bassa ponderazione; e che punti con ponderazione alta vengono trasformati in condizione invariata.
  10. 10. Disposizione secondo la rivendicazione 6, caratterizzata dal fatto che l'elemento di selezione cambia il tono fondamentale nel fonema durante il trasferimento alla seconda scala di tempo; e che i punti prescelti nel fonema rappresentano eccitazioni delle corde vocali nella parola .
IT94RM000763A 1993-11-25 1994-11-23 Disposizione e metodo di sintesi vocale IT1276336B1 (it)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
SE9303902A SE516521C2 (sv) 1993-11-25 1993-11-25 Anordning och förfarande vid talsyntes

Publications (3)

Publication Number Publication Date
ITRM940763A0 ITRM940763A0 (it) 1994-11-23
ITRM940763A1 true ITRM940763A1 (it) 1996-05-23
IT1276336B1 IT1276336B1 (it) 1997-10-28

Family

ID=20391875

Family Applications (1)

Application Number Title Priority Date Filing Date
IT94RM000763A IT1276336B1 (it) 1993-11-25 1994-11-23 Disposizione e metodo di sintesi vocale

Country Status (10)

Country Link
US (1) US5729657A (it)
AU (1) AU676389B2 (it)
CH (1) CH689883A5 (it)
DE (1) DE4441906C2 (it)
ES (1) ES2106669B1 (it)
FR (1) FR2713006B1 (it)
GB (1) GB2284328B (it)
IT (1) IT1276336B1 (it)
NL (1) NL194481C (it)
SE (1) SE516521C2 (it)

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
AU674246B2 (en) * 1993-08-04 1996-12-12 British Telecommunications Public Limited Company Synthesising speech by converting phonemes to digital waveforms
US7089184B2 (en) * 2001-03-22 2006-08-08 Nurv Center Technologies, Inc. Speech recognition for recognizing speaker-independent, continuous speech
US7912708B2 (en) * 2002-09-17 2011-03-22 Koninklijke Philips Electronics N.V. Method for controlling duration in speech synthesis
JP4455633B2 (ja) * 2007-09-10 2010-04-21 株式会社東芝 基本周波数パターン生成装置、基本周波数パターン生成方法及びプログラム
JP6047922B2 (ja) * 2011-06-01 2016-12-21 ヤマハ株式会社 音声合成装置および音声合成方法
JP6992612B2 (ja) * 2018-03-09 2022-01-13 ヤマハ株式会社 音声処理方法および音声処理装置

Family Cites Families (23)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3158685A (en) * 1961-05-04 1964-11-24 Bell Telephone Labor Inc Synthesis of speech from code signals
FR1602936A (it) * 1968-12-31 1971-02-22
US3704345A (en) * 1971-03-19 1972-11-28 Bell Telephone Labor Inc Conversion of printed text into synthetic speech
US4214125A (en) * 1977-01-21 1980-07-22 Forrest S. Mozer Method and apparatus for speech synthesizing
JPS55147697A (en) * 1979-05-07 1980-11-17 Sharp Kk Sound synthesizer
JPS5650398A (en) * 1979-10-01 1981-05-07 Hitachi Ltd Sound synthesizer
US4406001A (en) * 1980-08-18 1983-09-20 The Variable Speech Control Company ("Vsc") Time compression/expansion with synchronized individual pitch correction of separate components
US4435831A (en) * 1981-12-28 1984-03-06 Mozer Forrest Shrago Method and apparatus for time domain compression and synthesis of unvoiced audible signals
US4700301A (en) * 1983-11-02 1987-10-13 Dyke Howard L Method of automatically steering agricultural type vehicles
US4692941A (en) * 1984-04-10 1987-09-08 First Byte Real-time text-to-speech conversion system
US4701937A (en) * 1985-05-13 1987-10-20 Industrial Technology Research Institute Republic Of China Signal storage and replay system
JPH0632020B2 (ja) * 1986-03-25 1994-04-27 インタ−ナシヨナル ビジネス マシ−ンズ コ−ポレ−シヨン 音声合成方法および装置
US4802221A (en) * 1986-07-21 1989-01-31 Ncr Corporation Digital system and method for compressing speech signals for storage and transmission
US4833718A (en) * 1986-11-18 1989-05-23 First Byte Compression of stored waveforms for artificial speech
US5189702A (en) * 1987-02-16 1993-02-23 Canon Kabushiki Kaisha Voice processing apparatus for varying the speed with which a voice signal is reproduced
JPS63285598A (ja) * 1987-05-18 1988-11-22 ケイディディ株式会社 音素接続形パラメ−タ規則合成方式
IL84902A (en) * 1987-12-21 1991-12-15 D S P Group Israel Ltd Digital autocorrelation system for detecting speech in noisy audio signal
FR2636163B1 (fr) * 1988-09-02 1991-07-05 Hamon Christian Procede et dispositif de synthese de la parole par addition-recouvrement de formes d'onde
DE58906713D1 (de) * 1989-04-12 1994-02-24 Siemens Ag Verfahren zur Dehnung oder Raffung eines Zeitsignals.
US5216744A (en) * 1991-03-21 1993-06-01 Dictaphone Corporation Time scale modification of speech signals
JP3278863B2 (ja) * 1991-06-05 2002-04-30 株式会社日立製作所 音声合成装置
US5175769A (en) * 1991-07-23 1992-12-29 Rolm Systems Method for time-scale modification of signals
EP0527527B1 (en) * 1991-08-09 1999-01-20 Koninklijke Philips Electronics N.V. Method and apparatus for manipulating pitch and duration of a physical audio signal

Also Published As

Publication number Publication date
FR2713006A1 (fr) 1995-06-02
SE516521C2 (sv) 2002-01-22
DE4441906A1 (de) 1995-06-01
AU676389B2 (en) 1997-03-06
AU7885694A (en) 1995-06-01
SE9303902L (sv) 1995-05-26
ITRM940763A0 (it) 1994-11-23
NL194481B (nl) 2002-01-02
US5729657A (en) 1998-03-17
ES2106669A1 (es) 1997-11-01
GB2284328B (en) 1998-01-28
GB9423236D0 (en) 1995-01-04
IT1276336B1 (it) 1997-10-28
GB2284328A (en) 1995-05-31
SE9303902D0 (sv) 1993-11-25
FR2713006B1 (fr) 1998-03-20
DE4441906C2 (de) 2003-02-13
NL9401964A (nl) 1995-06-16
CH689883A5 (de) 1999-12-31
NL194481C (nl) 2002-05-03
ES2106669B1 (es) 1998-06-01

Similar Documents

Publication Publication Date Title
US5740320A (en) Text-to-speech synthesis by concatenation using or modifying clustered phoneme waveforms on basis of cluster parameter centroids
Chapman Vocalizations of toddlers with cleft lip and palate
US5400434A (en) Voice source for synthetic speech system
EP1221693B1 (en) Prosody template matching for text-to-speech systems
JPH0833744B2 (ja) 音声合成装置
US7454345B2 (en) Word or collocation emphasizing voice synthesizer
JP2000172285A (ja) フィルタパラメ―タとソ―ス領域において独立にクロスフェ―ドを行う半音節結合型のフォルマントベ―スのスピ―チシンセサイザ
Pind Speech segment durations and quantity in Icelandic
ITRM940763A1 (it) Disposizione e metodo di sintesi vocale
KR101029493B1 (ko) 음성 신호 합성 방법, 컴퓨터 판독가능 저장 매체 및 컴퓨터 시스템
Shoaf et al. Does node stability underlie the verbal transformation effect? A test of node structure theory
US7529672B2 (en) Speech synthesis using concatenation of speech waveforms
Demenko et al. The stylization of intonation contours
JPH08248993A (ja) 音韻時間長制御方法
JP6631186B2 (ja) 音声作成装置、方法、及びプログラム、音声データベース作成装置
EP0912975B1 (en) A method for synthesising voiceless consonants
Hansakunbuntheung et al. Analysis and modeling of syllable duration for Thai speech synthesis.
Daul et al. Comparing Phonological Feature Sets for Low-Resource ASR
JP3310217B2 (ja) 音声合成方法とその装置
Ohala et al. The phonetics of sound change
JPS5965897A (ja) 残差信号符号化方法
JPH0225520B2 (it)
Bae et al. On a cepstral technique for pitch control in the high quality text-to-speech type system
Peet Postlexical palatalization in English: an acoustic-phonetic study
JPH01120600A (ja) 音声規則合成方法

Legal Events

Date Code Title Description
0001 Granted