NL8400552A - Systeem voor het analyseren van menselijke spraak. - Google Patents

Systeem voor het analyseren van menselijke spraak. Download PDF

Info

Publication number
NL8400552A
NL8400552A NL8400552A NL8400552A NL8400552A NL 8400552 A NL8400552 A NL 8400552A NL 8400552 A NL8400552 A NL 8400552A NL 8400552 A NL8400552 A NL 8400552A NL 8400552 A NL8400552 A NL 8400552A
Authority
NL
Netherlands
Prior art keywords
pitch
block
value
values
peak positions
Prior art date
Application number
NL8400552A
Other languages
English (en)
Original Assignee
Philips Nv
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Philips Nv filed Critical Philips Nv
Priority to NL8400552A priority Critical patent/NL8400552A/nl
Priority to US06/691,594 priority patent/US4791671A/en
Priority to EP85200221A priority patent/EP0153787B1/en
Priority to DE8585200221T priority patent/DE3571093D1/de
Priority to JP60033019A priority patent/JPH0632028B2/ja
Publication of NL8400552A publication Critical patent/NL8400552A/nl

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/90—Pitch determination of speech signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Mobile Radio Communication Systems (AREA)

Description

ik -i PHN 10903 1 NV.Philips1 Gloeilampenfabrieken te Eindhoven.
'Systeem voor het analyseren van menselijke spraak". — A. Achtergrond van de uitvinding A.1 Gebied_van_de ^i^vinding
Systeem voor het analyseren van menselijke spraak voor het bepalen van 5 de toonhoogte van spraaksegmenten onder toepassing van meer dan één toonhoogtedetectie-algoritme.
A.2 Beschr^jyi^g^an_de stand van cie_techniek_
Een systeem zoals hierboven genoemd is bekend uit referentie D1. in het W aldaar beschreven systeem wordt gebruik gemaakt van de autocorrelatie-methode/ de cepstrummethode en van de laagdoorlaatgefilterde golf vorm.
De keuze van deze methodes werd zoals in deze publicatie is aangegeven bepaald door de wens om redelijk onafhankelijke schattingen van de toonhoogte te verkrijgen.
15
De autocorrelatiemethode maakt direct gebruik van informatie uit het tijddomein (referentie D2), terwijl de cepstrummethode gebruik maakt van informatie uit het frequentiedomein. Andere methoden welke gebruik maken van informatie uit het frequentiedomein zijn bekend, bijvoorbeeld 20 de in referentie D3 beschreven harmonische zeef methode. Daar wordt het. amplitudespectrum bepaald voor een kort segment (40 ms) van het bemonsterd signaal en vervolgens wordt in het amplitudespectrum gezocht naar de frequentieposities van de significante pieken van de amplitude (significante piekposities) en tenslotte wordt -door wat wordt genoemd de 25 harmonische zeef- gezocht naar een toonhoogte waarvan de harmonischen het beste passen bij de significante piekposities van het amplitudespectrum.
Bij de hier genoemde methodes voor het bepalen van de toonhoogte in spraak doen zich voor elke methode karakteristieke problemen voor. Over 30 het algemeen kan men zeggen dat methodes opererend in de frequentiewe-reld nogal eens fouten maken voor hoge toonhoogtes en dat methodes werkend in de tijdwereld juist fouten maken voor lagere toonhoogtes en vaak veelvouden van de eigenlijke toonhoogte als toonhoogte aangeven.
8400552 > . * PHN 10903 2 B. Samenvatting van de uitvinding
De uitvinding beoogt een systeem van het in A.1 aangegeven type te verschaffen met twee detectie-algoritmes welke op optimale wijze comple- 5 mentaire toonhoogte-informaties verschaffen, welke gerekend over het gebied van lage tot hoge toonhoogten complementair zijn voor wat betreft de betrouwbaarheid van de informatie, waarbij voor het gebied van de lage toonhoogten het ene detectie-algoritme en voor het gebied van hoge toonhoogten het andere algoritme betrouwbaarder is. Dit doel wordt 10 volgens de uitvinding daardoor bereikt, dat in een eerste elementaire toonhoogtemeter het amplitudespectrum van het spraaksegment wordt bepaald en significante piekposities daarin bepaald worden, dat in een tweede elementaire toonhoogtemeter de autocorrelatiefunctie wordt bepaald en significante piekposities daarin bepaald worden, en dat de 15 significante piekposities van het amplitudespectrum resp. de significante piekposities van de autocorrelatiefunctie de ingangsgegevens vormen van de werkwijze, omvattende de navolgende stappen: - het kiezen van een waarde voor de toonhoogte resp. periode en het bepalen van een reeks opeenvolgende gehele veelvouden van deze waarde 20 en het bepalen van intervallen rondom deze waarde en de veelvouden daarvan, welke intervallen een masker definiëren met openingen ter plaatse van een interval, aan welke openingen harmonische nummers zijn toegevoegd corresponderende met de vermenigvuldigde factoren in de genoemde veelvouden; 25 - het berekenen van een kwaliteitsgetal overeenkomstig een criterium dat de mate aangeeft waarin de significante piekposities en de openingen van het masker bij elkaar passen; - het herhalen van de voorafgaande stappen voor opeenvolgende hogere waarden van de toonhoogte resp. periode tot een bepaalde hoogste 30 waarde, waardoor een reeks bij deze waarden van de toonhoogte resp.
periode behorende kwaliteitsgetallen verkregen wordt; - het selecteren van een drietal waarden van de toonhoogte resp. periode met de hoogste kwaliteitsgetallen; - het omzetten van de waarden voor de periode in waarden voor de toon-hoogte; - het combineren van de zo gevonden waarden voor de toonhoogte met de bijbehorende kwaliteitsgetallen tot een schatting van de toonhoogte die het meest waarschijnlijk is.
8400552 RHN 10903 3 * ·*
Bij de combinatie van gegevens kannen ook nog andere gegevens mee in rekening genomen worden, bijvoorbeeld meetgegevens uit het recente verleden om zodoende ook tijdcontinuïteit van de bepaling van de toonhoogte te garanderen.
5 C. Korte beschrijving van de figuren
Fig. 1: Blokschema van het uitvoeringsvoorbeeld.
10 Fig. 2: Blokschema van een procedure die meerdere malen wordt toegepast en die ten doel heeft een harmonische relatie te ontdekken tussen een reeks getallen aan de ingang.
Fig. 3: Blokschema voor het bepalen van significante piekposities in 15 het amplitudespectrum.
Fig. 4: Uitgewerkt stroomdiagram van de procedure voor het bepalen van een drietal fQ-schattingen met de hoogste kwaliteitsgetallen, gebaseerd op de significante piekposities in het amplitudespectrum.
20
Fig. 5: Blokschema voor het bepalen van significante piekposities in de genormaliseerde autocorrelatiefunctie.
Fig. 6: Uitgewerkt stroomdiagram van de procedure voor het bepalen van 25 een drietal fQ-schattingen met de hoogste kwaliteitsgetallen, gebaseerd op de significante piekposities in de genormaliseerde autocorrelatiefunctie.
Fig. 7: Stroomdiagram van de combinatieprocedure die de gegevens combi-30 neert tot een meer betrouwbare schatting van de toonhoogte.
0. Referenties 1. L.R. Rabiner et al., Ά semi-automatic pitch detector (SARD)', IEEE 35 Transactions on acoustics, speech and signal processing, Vol.
ASSP-23, No. 6, December 1975, pp 570-574.
2. L.R. Rabiner, On the use of autocorrelation analysis for pitch detection', IEEE Transactions on acoustics, speech and signal pro- 6400552 * ï PHN 10903 4 cessing, Vol. ASSP-25, No. 1, February 1977, pp 24-33.
3. Nederlandse octrooi-aanvrage 78 12 151 (PHN 9313).
Ξ. Uitvoeringsvoorbeeld 5
Het in Fig. 1 aangegeven spraakanalysesysteem dient er toe de toonhoogte van spraaksignalen in een gebied van 50 Hz tot 500 Hz te bepalen.
Dit doel wordt gerealiseerd in een spraakanalysesysteem van het onderhavige type door: 10 - uit te gaan van een spraaksegment van 40 ms lang, zoals is aangeduid in blok 10; - het bepalen van het amplitudespectrum. van dit segment door het toepassen van een venster in blok 11 en een Fourier-transforraatie in blok 12; 15 - het bepalen van significante piekposities in dit amplitudespectrum zoals aangeduid in blok 13; - het nagaan of de gevonden piekposities passen bij een harmonische reeks in blok 14 met het inschrift: HRMSV. De functie van blok 14 wordt aangeduid als harmonische zeef en omvat de volgende stappen: 20 * het kiezen van een waarde voor de toonhoogte en het bepalen van een reeks opeenvolgende gehele veelvouden van deze waarde en het bepalen van intervallen rondom deze waarde en de veelvouden daarvan, welke intervallen een masker definiëren met openingen ter plaatse van een interval, aan welke openingen harmonische nummers zijn toe- 25 gevoegd corresponderende met de vermenigvuldigde factoren in de genoemde veelvouden; * het berekenen van een kwaliteitsgetal overeenkomstig een criterium dat de mate aangeeft waarin de significante piekposities en de openingen van het masker bij elkaar passen; 30 * het herhalen van de voorafgaande stappen voor opeenvolgende hogere waarden van de toonhoogte tot een bepaalde hoogste waarde, waardoor een reeks bij deze waarden van de toonhoogte behorende kwaliteits-getallen verkregen wordt; * het selecteren van een drietal waarden van de toonhoogte met de 35 hoogste kwaliteitsgêtallen.
- het bepalen van significante piekposities in de autocorrelatiefunctie (blok 15) van datzelfde spraaksegment in blok 16; - het nagaan of de gevonden piekposities passen bij een harmonische 8400552 PHN 10903 5 * reeks zoals aangegeven in blok 17, die qua werking gelijk is aan blok 14· Dit geschiedt door: * het kiezen van een waarde voor de periode en het bepalen van een reeks opeenvolgende gehele veelvouden van deze waarde en het bepa- 5 len van intervallen rondom deze waarde en de veelvouden daarvan, welke intervallen een masker definiëren met openingen ter plaatse van een interval, aan welke openingen harmonische nummers zijn toegevoegd corresponderende met de vermenigvuldigingsfactoren in de genoemde veelvouden; 10 * het berekenen van een kwaliteitsgetal overeenkomstig een criterium dat de mate aangeeft waarin de significante piekposities en de openingen van het masker bij elkaar passen; * het herhalen van de voorafgaande stappen voor opeenvolgende hogere waarden van de periode tot een bepaalde hoogste waarde, waardoor 15 een reeks bij deze waarden van de toonhoogte behorende kwaliteits- getallen verkregen wordt; * het selecteren van een drietal waarden van de periode met de hoogste kwaliteitsgetallen; - het omzetten van de waarden voor de periode in waarden voor de toon- 20 hoogte; - het combineren van de zo gevonden waarden voor de toonhoogte met de bijbehorende kwaliteitsgetallen tot een schatting van de toonhoogte die het meest waarschijnlijk is aangeduid met blok 18» 25 in het hier beschreven spraakanalysesysteem vormt de zogenoemde harmonische zeef, aangeduid met blok 14 en 17 in Fig» 1 een belangrijk onderdeel·
De werking van de harmonische zeef is nader aangeduid in Fig. 2 die 30 opereert op significante piekposities p(i) hetzij frequenties (blok 14) hetzij perioden (blok 17)· De beschrijving zal plaatsvinden met betrekking tot blok 14 in termen van frequenties (toonhoogtes), wanneer deze veranderd worden in perioden dan heeft de beschrijving betrekking op blok 17. In dit proces wordt eerst een waarde Fg voor de toonhoogte aangenomen, zoals gerepresenteerd in blok 19.
Bondam deze beginwaarde en een aantal opeenvolgende gehele veelvouden daarvan worden intervallen gedefinieerd. Deze intervallen worden beschouwd als openingen in een masker in de zin dat een getalwaarde welke 8400552
\ 4 S
PHN 10903 6 coïncideert met een opening door het masker zal worden doorgelaten. In deze opvatting functioneert het masker als een soort zeef voor getalwaarden. Deze operaties worden gerepresenteerd door blok 20 met de inscriptie MSK.
5 Aan de openingen van een masker zijn nummers toegevoegd, welke worden aangeduid als harmonische nummers en welke corresponderen met de verme-nigvuldigfactoren van de betreffende veelvouden van de gekozen waarde van de toonhoogte.
In een volgende bewerking wordt bepaald in welke mate de significante 10 piekposities p(i) en de openingen van het masker bij elkaar passen. Wanneer weinig significante piekposities door het masker worden doorgelaten dan is er duidelijk een slechte aanpassing. Wanneer anderzijds veel van de piekposities worden doorgelaten maar veel openingen in het masker geen significante piekposities doorlaten omdat deze op die 15 plaats niet aanwezig zijn, dan is er eveneens sprake van een slechte aanpassing.
Het is mogelijk een geschikt criterium te vinden om de mate van aanpassing tot uitdrukking te brengen in een kwaliteitsgetal, zoals in het navolgende nog zal worden toegelicht. Op dit punt van de beschrijving 20 is het voldoende te melden dat een kwaliteitsgetal wordt berekend voor het masker. Deze operatie wordt gerepresenteerd door blok 21, met de inscriptie QLT.
In de beslis singsruit 22 wordt nagegaan of de waarde Fs welke voor de toonhoogte gekozen is kleiner is dan een bepaalde maximale waarde: 25 fs<· Μχ. Wanneer dit zo is, dan wordt de Y-tak van ruit 22 gevolgd, waardoor een lus 23 ontstaat naar blok 24* In deze lus wordt de waarde van Fs op een bepaalde wijze verhoogd; met een bepaald bedrag of een bepaald percentage. Deze functie wordt gerepresenteerd door blok 24 met de inscriptie NCR Fs· 30 Het gevolg van de aanwezigheid van beslissingsruit 22 is dat de procedures welke worden gerepresenteerd door de blokken 20 en 21 voortdurend worden herhaald voor steeds nieuwe waarden van Fg totdat Fs de maximale waarde Mx. bereikt. Wanneer dit het geval is dan wordt de N-tak gevolgd en wordt lus 23 verlaten.
35 volgende procedure in het huidige spraakanalysesysteem bestaat dan in het bepalen van een drietal waarden van Fs waarvan de kwaliteitsge-tallen de hoogste waarden hebben. Dit geschiedt in blok 25 met het inschrift SLCT Fs.
8400552 s * PHN 10903 7
In het onderhavige spraakanalysesysteem. wordt vervolgens een üauwkeuri-ge schatting gemaakt van de mogelijke toonhoogtes uitgaande van de drie geselecteerde waarden Fs· Deze laatste stap in de procedure voor het bepalen van de toonhoogte wordt gerepresenteerd door blok 26 met het 5 inschrift STM EP( 1,2,3) waarvan de uitgangstak de drie geschatte waarden EP(1,2,3) van de toonhoogte levert* In dit blok 26 worden de harmonische nummers van de openingen van het referentiemasker toe gevoegd aan de met deze openingen coïnciderende significante piekposities p(i) en ieder van deze piekposities p(i) zal dan een harmonisch nummer nj_ krij- 10 gen welke de plaats van de piekposities bepaalt in een reeks harmoni- /v schen van dezelfde grondtoon* Een goede schatting van F0: F0 kan gedefinieerd worden als de waarde waarvoor de afwijkingen tussen de laatstgenoemde significante piekposities p(i) en de overeenkomstige veelvou-
A
den n^.FQ van de waarschijnlijke waarde zo klein mogelijk zijn. Wanneer 15 voor het bepalen van de afwijkingen een m.s.e.-criterium (mean-square- Λ error) wordt toegepast dan laat FQ zich berekenen door de uitdrukking:
Λ K K
Fo “Σ P(i)*ni/X»i2 CD
i*1 i*1 20
De sommatie in deze uitdrukking strekt zich uit over alle significante piekposities welke coïncideren met een opening van het referentiemasker waarvan het aantal door K wordt gerepresenteerd. Overigens vormt de waarde van de toonhoogte welke behoort bij het referentiemasker reeds een eerste schatting van de gezochte toonhoogte.
25
In Fig. 3 is in meer detail de procedure geïllustreerd voor het verkrijgen van de waarden van de significante piekposities in het frequentiedomein.
Van het bemonsterde spraaksignaal worden tijdsegmenten genomen met een duur van 40 ms. Deze functie wordt gerepresenteerd door blok 27, met de 30 inscriptie 40 ms. De volgende bewerking is het vermenigvuldigen van het spraaksignaalsegment met een zogenaamd 'Hamming window1, welke functie wordt gerepresenteerd door blok 28 met de inscriptie WNDW.
De monsters van het spraaksignaalsegment worden vervolgens onderworpen aan een discrete Fourier-transformatie met 256 punten zoals gerepresen-35 teerd door blok 29 met de inscriptie DFT.
In de volgende operatie worden de amplituden van 128 spectrumcomponen-ten bepaald uit de 256 reële en imaginaire waarden welke door de DFT
8400552 PHN 10903 8 r *· * »· geleverd worden. Uit deze spectrumcomponenten worden de significante piekposities PP(i) afgeleid welke de plaatsen van de pieken in het spectrum representeren.
Sommige operaties van het onderhavige spraakanalysesysteem kunnen wor-5 den geïmplementeerd in dé software van een general-purpose computer. Andere operaties kunnen versneld worden door toepassing van externe hardware.
Vanaf blok 30 wordt de procedure geïmplementeerd door de software van een general-purpose computer.
10 De computer ontvangt als ingangsgegevens de componenten AF(r), r=1, 128 van het amplitudespectrum zoals gerepresenteerd door blok 31. Als beginwaarden voor de routine worden r=2 en NTOP=0 gezet. Deze functie wordt gerepresenteerd door blok 32. NTOP is een variabele, die het aantal gevonden locale maxima telt.
15 Te beginnen met spectrumconponent AP(2) wordt in beslissingsruit 33 onderzocht of de spectrumcomponent AF(2) groter is dan een drempelwaarde THF. De N-tak van ruit 33 voert naar blok 39 welke aangeeft dat r met ëën verhoogd wordt. Daarna wordt in beslissingsruit 40 onderzocht of r groter of gelijk is geworden aan 127. Zolang dit niet het geval is 20 wordt een lus 41 gevormd naar blok 33* De functie van blok 33 wordt dan herhaald met een nieuwe waarde van r.
De Y-tak van beslissingsruit 33 voert naar beslissingsruit 34 waarin wordt onderzocht of de spectrumcomponent AF(2) groter of gelijk is aan de voorafgaande spectrumcomponent AF(1) en of spectrumcomponent AF(2) 25 groter is dan de volgende spectrumcomponent AF(3). Deze functie wordt gerepresenteerd door beslissingsruit 34. Wanneer de spectrumcomponent een locaal maximum vormt, dan wordt de Y-tak van ruit 36 gevolgd.
De N-tak van ruit 34 voert naar blok 39 welke aangeeft dat r met één verhoogd wordt Zolang de nieuwe waarde van r kleiner is dan 127.
30 De drempelwaarde THF wordt in de eerste plaats gevormd door een absolute waarde welke wordt bepaald door het niveau van de ruis welke een gevolg is van de kwantisering en de 'Hamming window'.
In de tweede plaats kan een deel van de drempelwaarde THF variabel zijn k om rekening te houden met het maskeren van een spectrumcomponent door 35 de naburige spectrumcomponenten wanneer deze een veel grotere amplitude hebben. Dit effect treedt op bij het menselijke gehoor en is daar een belangrijke factor bij de waarneming van de toonhoogte.
Wanneer de Y-tak van beslissingsruit 34 wordt gevolgd, dan wordt een 8400552 » * PHN 10903 9 operatie uitgevoerd om de amplitude en de frequentie van het locale marirmm van het amplitudespectrum te bepalen. Hiervoor wordt gebruik .gemaakt vein interpolatie tussen de waarden AF(r-1), AF(r) en AF(r+1) met een tweedegraads polynoom (parabolische interpolatie}· Deze functie 5 wordt gerepresenteerd door blok 36 met het inschrift INTRP. In blok 37 wordt nu het aantal locale maxima NTOP met één verhoogd.
Het zoeken naar locale maxima van het amplitudespectrum wordt voortgezet tot maximaal zes significante piekposities PF(i) bepaald zijn* Wanneer dit het geval is, dan wordt de Y-tak van beslis sings ruit 38 actief 10 en worden de significante piekposities PF(i) uitgevoerd (blok 42).
De significante piekposities PF(i) welke worden geleverd door de routine volgens Fig. 3 vormen de ingangsgegevens voor de routine volgens Fig. 4& en 4B. Deze figuren dienen op de aan gegeven wijze onder elkaar te worden geplaatst.
15
Fig. 4A en 4B tonen het stroomdiagram van een programma voor het bepalen van een drietal waarschijnlijke waarden van de toonhoogte gebruikmakende van het concept van de maskers.
Het programma ontvangt als ingangsgegevens de significante piekposities 20 PF(i), i=1, .... , Nf zoals geïllustreerd in blok 43. Deze worden alternatief als componenten aangeduid* '
In het begin worden een drietal f0-schattingen fQ( j), j=1, 2, 3 met bijbehorende kwaliteitsgetallen q(j) op nul gezet (blok 44).
Wanneer het aantal aangeboden conponenten kleiner is dan één (ruit 45), 25 dan wordt de routine verlaten en dé waarden fQ(i)=0 uitgevoerd (blok 46).
Wördt één of meer componenten ingevoerd dan wordt de routine verder gevolgd via de N-tak van de beslissingsruit 45.
ata voorbereiding wordt de variabele 1 welke het nummer van het masker 30 aangeeft op één gezet en wordt de bij dit masker behorende toonhoogte fot °P 50 32 ingesteld (blok 47). Daarna worden enkele variabelen op een beginwaarde gezet (blok 48).
In de volgende procedure (blok 49) wordt te beginnen bij de eerste component PF(1) een schatting gemaakt van het bij de component PF{1) beho-35 rende harmonische nummer m^ en wordt deze waarde afgerond naar het meest nabij gelegen gehele getal mifc·
Wanneer m·^ groter is dan 11 (beslissingsruit 50), dan wordt een groot deel van het programma overgeslagen, omdat in het onderhavige spraak— 8400552 PHN 10903 10 • * analysesysteem harmoniechen met een hoger nummer dan 11 niet bij de toonhoogtebepaling worden betrokken.
Vervolgens wordt nagegaan of m·^ de waarde nul heeft (bes lis singsruit 52). Is dit niet het geval# dan wordt nagegaan of de component PF(n) in 5 een opening van het masker mét toonhoogte f0]_ valt. Wanneer de relatieve afwijking van PF(n) ten opzichte van de meest nabij gelegen harmonische van de grondtoon f^ kleiner is dan een bepaald percentage# in het •huidige systeem 5%# dan wordt PF(n) geacht in de opening te liggen (be-slissingsruit 54).
10 Wanneer de component PF(n) in een opening van het masker ligt, dan wordt de N-tak van beslissingsruit 54 actief.
De volgende operatie betreft nu het geval dat voor m^ dezelfde waarde wordt gevonden als de waarde m^jr (K+1=k) welke de vorige keer is bepaald. In dit geval liggen er twee componenten in'dezelfde opening van 15 het masker. Het onderhavige spraakanaiysesysteem accepteert alleen de component welke het dichtst bij het midden van de opening ligt en telt de andere component niet mee*
De variabele K telt het aantal van de componenten welke in een opening liggen. Wanneer m^ groter is dan m^K (beslis sings ruit 55) dan wordt 20 daarna K met één verhoogd (blok 58).
Wanneer echter m·^ niet groter is dan m^j. dan wordt bepaald voor welke van de waarden m^fc en m^g de kleinste relatieve afwijking optreedt ten opzichte van het midden van de opening (beslissingsruit 56). Wan- Λ Λ neer dit het geval is voor m^ dan wordt m-^ gelijk gesteld aan m^ 25 (blok 57). In het andere geval wordt m]_K niet veranderd. In beide gevallen wordt K niet verhoogd.
Wanneer het programma de Y-tak van beslissingsruit 52# de Y-tak van be-slissingruit 54 of de N-tak van beslissingruit 56 volgt of na de operaties van de blokken 57 of 58# wordt de waarde van n met één verhoogd 30 (blok 59). De variabele n telt de aangeboden componenten PF(i) en wanneer n niet groter is dan het totaal aantal aangeboden componenten (beslissingsruit 60)# dan wordt de lus 61 binnengetreden.
De beschreven routine begint dan opnieuw bij blok 49 voor een nieuwe waarde van n. Op deze wijze wordt de routine herhaald voor alle N com-35 ponenten PF(i).
Wanneer n groter wordt dan N# dan wordt de Y-tak van beslissingsruit 60 gevolgd. Hierna wordt geregistreerd dat voor het masker met index 1 het aantal in aanmerking genomen componenten N^ gelijk is aan N (blok 62).
8400552 p PHN T0903 11
Wanneer het programma de Y-tak van beslissingsruit 50 volgt dan wordt gelijk gesteld aan n (blok 63}· Componenten PF(i) met een hogere in-dexwaarde hebben een geschat harmonisch nummer dat groter is dan 11 en worden niet in aanmerking genomen bij de toonhoogte-bepaling. Een mas-5 ker heeft in het huidige spraakanalysesysteem 11 openingen en componen-ten PF(i) welke buiten het masker liggen, doen niet mee bij de bepaling van de toonhoogte·
De volgende procedure heeft betrekking op de berekening van een kwali-teitsgetal Q waarmede wordt aangegeven de mate waarin de componenten 10 PF(i) en de openingen van het masker op elkaar passen.
Een kwaliteitsgetal kan worden afgeleid door de reeks aangeboden componenten PF(i) en de reeks openingen van een masker te beschouwen als vectoren in een meerdimensionale ruimte. De afstand tussen de vectoren geeft dan aan hoe goed de componenten PF(i) en het masker op elkaar 15 passen. Het kwaliteitsgetal kan dan worden berekend als êên gedeeld door de afstand. In de plaats van de afstand kan ook iedere andere uitdrukking genomen worden welke minimaal is als de afstand minimaal is en omgekeerd.
Het kan op elementaire wijze worden aangetoond dat de afstand D kan 20 worden uitgedrukt door: D =*\/n + M - 2k' (2) waarin N het aantal componenten PF{i), M het aantal openingen van het 25 masker en K het aantal van de componenten PF(i) voorstelt welke liggen * in de openingen van het masker.
Het kwaliteitsgetal Q kan worden uitgedrukt als: 30 1 1 Q =--- (3)
D2 N + Μ - 2K
De afstand D kan worden genormaliseerd door deze te delen door de lengte van de eenheidsvector: 35 \ J l E=yN+M-K (4)
Dit zou resulteren in het kwaliteitsgetal: 8400532 • * PHN 10903 12
E2 N + Μ - K
Q ---- (5)
D2 N + Μ - 2K
Na elementaire bewerkingen kan worden aangetoond dat Q volgens uitdruk-5 king (5) maximaal is wanneer Q' volgens de uitdrukking:
K
Q'-- (6)
N + M
jg maximaal is.
In het kwaliteitsgetal wordt bij voorkeur tot uitdrukking gebracht dat de berekening des te betrouwbaarder is naarmate het aantal componenten dat binnen het masker valt groter is. Om dit te bereiken wordt gebruik gemaakt van kwaliteitsmaat Q" waarvoor dan geldt: 15 K2 Q" - (7)
N + M
In het gebruikte systeem voor het vinden van de significante piekposi-20 ties PF(i) wordt het zoeken gestopt als 6 piekposities zijn gevonden (beslissingsruit 38 in Fig. 2). De meest ideale meting is die waarbij deze 6 piekposities samenvallen met de eerste zes maskergaten zodat men voor het kwaliteitsgetal Q" de waarde 3 vindt.
Het heeft voordelen het kwaliteitsgetal Q" te normaliseren met deze 25 hoogst bereikbare waarde zodat het nieuwe kwaliteitsgetal Qn wordt.
Q" K2 Ön=“ =-- <8) 3 3(N + M) 30
Dit kwaliteitsgetal bereikt in het ideale geval de waarde 1 en bereikt een lagere waarde in alle andere niet ideale situaties.
Componenten PF(i) welke buiten het masker vallen dragen niet bij tot de waarde van K hoewel ze wel een harmonisch verband kunnen hebben met de grondtoon van het masker. Een beter bruikbaar kwaliteitsgetal zal wor-35 den verkregen wanneer in de uitdrukkingen voor Q de grootheid N wordt vervangen door N]y welke het aantal componenten aan geeft, dat binnen het bereik van het masker ligt.
Het kan voorkomen dat openingen van het masker buiten het bereik van de 8400552
« V
BHN 10903 13
F
aangeboden, componenten vallen en daarom geen component doorlaten. Het kwaliteitsgetal kan hiervoor worden gecorrigeerd door in de uitdrukking voor Q de grootheid M te vervangen door m·^, welke het hoogste nummer is van de openingen welke een component doorlaten.
5
In de procedure volgens Fig. 4Ά en 4B wordt in blok 63 de kwaliteits-maat Qn volgens betrekking (8) uit gerekend/ en in blok 64 wordt de nauwkeurige schatting van de eventuele toonhoogte uitgerekend volgens de uitdrukking (1).
10 In blok 65 wordt de waarde van 1 met één opgehoogd en er wordt een nieuwe waarde van f0^ bepaald, die 3% hoger is dan de vorige waarde.
In beslissingsruit 66 wordt nagegaan of 1 groter is dan een grenswaarde I>. Deze grenswaarde in het huidige spraakanalysesysteem op 80 gesteld.
Is dit niet het geval dan wordt de ruit 66 aan de N-tak verlaten en 15 wordt lus 67 binnengegaan waarna het hele proces van het zoeken opnieuw begint, is echter de grenswaarde L overschreden dan wordt de ruit 66 langs de Y-tak verlaten en worden in blok 68 de drie grootste kwali-teitsgetallen met de bijbehorende schattingen van de toonhoogte gezocht die dan aan de uitgang van de operatie in blok 69 beschikbaar zijn.
20
In Fig. 5 is in meer detail aangegeven de procedure voor het verkrijgen van de waarden van de significante piekposities in het tijddomein. Aan deze procedure ligt hetzelfde spraaksegment van 40 ms (blok 70) ten grondslag als in Fig. 3 (blok 27) . Van dit signaal wordt nu in blok 71 25 aangeduid met NBG de energie berekend. Deze energie E is gedefinieerd door:
1 N
E « — y Sjr2 (N = 100) (9) N ήρϊ 30
Van het spraaksegment wordt nu de genormaliseerde autocorrelatiefunctie berekend in blok 72 volgens de uitdrukking: 1 *1 35 -/ SK'SR+j N - j K=1 AT(j) » - (10)
E
voor j=1, ....... 80.
8400502 * · * PHN 10903 14
Deze functie wordt voor gesteld in blok 73/ waarin de variabele j is vervangen door r. Als beginwaarden voor de nu volgende routine worden in blok 74 gezet: r=2 en NTOP=0.
Te beginnen met de autocorrelatiecoëfficient AT(2) wordt in beslis-5 singsruit 75 onderzocht of de autocorrelatiecoëfficient AT(2) groter is dan een drempelwaarde THA. De N-tak van ruit 75 voert naar blok 81 welke aangeeft dat r met één wordt verhoogd. Daarna wordt in beslissings-ruit 83 onderzocht of r groter of gelijk is geworden aan 79. Zolang dit niet het geval is wordt de lus 82 naar de bes lis sings ruit 75 gevolgd.
10 De functie van beslissingsruit 75 wordt dan herhaald met een nieuwe waarde van r.
De Y-tak van beslissingsruit 75 voert naar beslissingsruit 76 waarin wordt onderzocht of de autocorrelatiecoëfficient groter of gelijk is aan de voorafgaande autocorrelatiecoëfficient AT(1) en of autocorrela-15 tiecoëfficient AT(2) groter is dan de volgende autocorrelatiecoëfficient AT(3)· Wanneer de autocorrelatiecoëfficient een locaal maximum vormt, dan wordt de Y-tak van ruit 76 gevolgd. De N-tak van ruit 76 voert naar blok 81, welke aangeeft dat r met één wordt verhoogd. Wanneer de Y-tak van beslissingsruit 76 wordt gevolgd, dan wordt een ope-20 ratie uitgevoerd om de positie op de tijdas van het locale maximum van de autocorrelatiefunctie te bepalen. Hiervoor wordt gebruik gemaakt van interpolatie tussen de waarden AT(r-1), AT(r) en AT(r+1) met een tweedegraads polynoom (parabolische interpolatie). Deze functie wordt gerepresenteerd door blok 77 met het inschrift INTRP. In blok 78 wordt nu 25 het aantal locale maxima NTOP met één verhoogd. Het zoeken naar locale maxima in de autocorrelatiefunctie wordt voortgezet tot maximaal zes significante piekposities PP(i) bepaald zijn.
Wanneer zes significante piekposities zijn gevonden, dan wordt de Y-tak van de beslis sings ruit 80 actief en dan worden de significante piekpo-30 sities uitgevoerd (blok 84).
De significante piekposities PP(i) welke worden geleverd door de routine volgens Fig. 5 vormen de ingangsgegevens voor de routine volgens Fig. 6a en 6b. Deze figuren dienen op de aangegeven wijze onder elkaar te worden geplaatst.
Fig. 6A en 6B tonen het stroomdiagram van een procedure voor het bepalen van een drietal waarschijnlijke waarden van de toonhoogte gebruik makende van het concept van de maskers. Het concept van de maskers 35 8400552 t · PHN 10903 15 wordt nu toegepast op de significante piekposities PP(i) die liggen in het tijddomein en stellen derhalve periodeduren voor.
Het programma ontvangt als ingangsgegevens de significante piekposities PP{i), i=l...N, zoals geïllustreerd in blok 90. Deze worden alternatief 5 als componenten aangeduid. In het begin worden een drietal tQ-schattingen tQ(i),i=l,2,3 met bijbehorende kwaliteitsgetallen s(i) op nul gezet (blok 91). Wanneer het aantal aangeboden componenten kleiner is dan één (ruit 92) dan wordt de routine via de Y-tak van ruit 92 verlaten en worden de waarden to(i)=0 uitgevoerd (blok 93). Worden één of meer com-10 ponenten ingevoerd dan wordt de routine verder gevolgd via de N-tak van ruit 92.
Als voorbereiding wordt de variabele 1 welke het nummer van het masker aangeeft op één gezet en wordt de bij dit masker behorende periodeduur tQl op 2 ms ingesteld ( blok 94). In de volgende operatie (blok 95) 15 worden enkele variabelen op hun beginwaarde gezet. In blok 96 wordt te beginnen bij de eerste component PP(1) een schatting gemaakt van het bij de component PP(1) behorende harmonische nummer m^ en wordt deze waarde afgerond naar het meest nabij gelegen gehele getal m·^. Wanneer mlk groter is dan' 11 (bes lis sings ruit 97) dan wordt een groot gedeelte 20 van de procedure via de lus 98 overgeslagen, omdat in het onderhavige spraakanalysesysteem een harmonische relatie met een hoger nummer dan 11 niet bij de toorihoogtebepaling wordt betrokken.
Vervolgens wordt nagegaan of m^ de waarde nul heeft (in beslissings-ruit 99). Is dit niet het geval dan wordt ruit 99 via de N-tak verlaten 25 en wordt nagegaan of de component PP(n) in een opening van het masker met periode t0l valt. Wanneer de relatieve afwijking van PP(n) ten opzichte van het meest nabij gelegen veelvoud van de grondperiode tQ]_ kleiner is dan een bepaald percentage, in het huidige systeem 5%, dan wordt PP(n) geacht in de opening te liggen (beslissingsruit 101). Wan-30 neer de component PP(n) in een opening van het masker ligt, dan wordt de N-tak van beslissingsruit 101 actief.
De volgende operatie betreft het geval dat voor m^k dezelfde waarde wordt gevonden als de waarde m^K (K+1=k) welke de vorige keer is bepaald. In dit geval liggen er twee componenten in dezelfde opening van 35 het masker.
Het onderhavige spraakanalysesysteem accepteert alleen de component welke het dichtst bij het midden van de opening ligt en telt de andere component niet mee. De variabele K telt het aantal van de componenten 8400552 * PHN 10903 16 welke in een opening liggen. Wanneer m·^ groter is dan (beslis- singsruit 102) dan wordt daarna K met één verhoogd (blok 105). Wanneer echter m1jc niet groter is dan m1K dan wordt ruit 102 via de N-tak verlaten en wordt bepaald voor welke van de waarden m^ en de 5 kleinste afwijking optreedit ten opzichte van het midden van de opening (beslissingsruit 103). Wanneer dit het geval is voor m^, dan wordt ®1K gelijk gesteld aan m^ (blok 104). In het andere geval wordt m^jr niet veranderd. In beide gevallen wordt K niet verhoogd.
Wanneer het programma de Y-tak van beslissingsruit 99, de Y-tak van be-10 slissingsruit 101 of de N-tak van beslissingsruit 103 volgt of na de operaties van de blokken 105 of 104, wordt de waarde van n met één verhoogd (blok 106).
De variabele n telt de aangeboden componenten PP(n) en wanneer n niet groter is dan het totaal aantal aangeboden componenten (beslissingsruit 15 107), dan wordt de lus 108 gevolgd. De beschreven routine begint dan opnieuw bij blok 96 voor een nieuwe waarde van n. Op deze wijze wordt de routine herhaald voor alle N componenten PP(i).
Wanneer n groter wordt dan N, dan wordt de Y-tak van beslissingsruit 107 gevolgd. Hierna wordt geregistreerd dat voor het masker met index 1 20 het aantal in aanmerking genomen componenten Nj_ gelijk is aan N (blok 109). Wanneer het programma de Y-tak van beslissingsruit 97 volgt dan wordt Ν^_ gelijkgesteld aan n (blok 110). Componenten PP(i) met een hogere indexwaarde hebben een geschat harmonisch nummer, dat groter is dan 11 en worden niet in aanmerking genomen bij de toonhoogtebepaling. 25 Een masker heeft in het huidige spraakanalysesysteem 11 openingen en componenten PP(i) welke buiten het masker liggen, doen niet mee met de bepaling van de toonhoogte.
In het blok 111 wordt nu de kwaliteitsmaat uitgerekend volgens betrekking (8) en in blok 112 wordt de nauwkeurige schatting van de eventuele 30 periode uitgerekend volgens de uitdrukking (1).
In blok 113 wordt 1 met één verhoogd en er wordt een nieuwe waarde van tQ^ berekend, die 3% hoger is dan de vorige. In beslissingsruit 115 wordt nagegaan of 1 groter is dan een grenswaarde L. Deze grenswaarde is in het onderhavige spraakanalysesysteem op 80 gesteld. Is 1 niet 35 groter dan L dan wordt ruit 115 via de N-tak verlaten, waarna lus 114 wordt binnengegaan, en het hele proces van het zoeken opnieuw begint. Is echter de grenswaarde L overschreden dan wordt beslissingsruit via de Y-tak verlaten, waarna in blok 116 de drie grootste kwaliteitsgetal- 8400552 . * ί ΡΗΝ 10903 17 len S(K) met de bijbehorende periodeschattingen t0(k) worden gezocht.
Deze drie best passende periodesehattingen fcQ(i) met bijbehorende kwa-liteitsgetallen s(j) zijn nu beschikbaar in blok 117 en worden vervolgens in blok 118 omgezet naar een schatting van de toonhoogte door de 5 inverse van tQ(j) te berekenen.
Er zijn nu een drietal schattingen voor de toonhoogte met bijbehorende kwaliteitsgetallen beschikbaar verkregen uit de toonhoogtemeter werkende in het frequentiedomein, genoemd fQ(j), j=1,2,3 zoals aan gegeven in 10 blok 69 ên een drietal schattingen voor fQ met bijbehorende kwaliteitsgetallen verkregen uit de autocorrelatie-toonhoogtemeter werkende in het tijddomein, genoemd fQ(i) ,1=4,5,6, zoals is aangegeven in blok 119.
In de nu volgende combinatieschakeling CMB (blok 18f Fig. 1) worden deze resultaten gecombineerd tot een meer betrouwbare meting van de toon-15 hoogte.
Bovendien is hier de principiële mogelijkheid aanwezig om meer gegevens dan de hier genoemde te laten meebeslissen over de uiteindelijk aan te wijzen toonhoogte.
Hierbij valt te denken aan eèn andere nog nader te specificeren toon-20 hoogtemeter, of aan de toonhoogteschattingen van het vorige meetinter-val met gereduceerde kwaliteitsgetallen (gereduceerd om gegevens uit het verleden wat minder te laten wegen bij de bepaling van de huidige toonhoogte) of aan de meetresultaten afgeleid uit het recente verleden (tracking).
25 De combinatieschakeling is weergegeven in Fig. 7 en gaat uit van de gegevens in blok 120, zijnde de zes mogelijke schattingen van de toonhoogte met bijbehorende kwaliteitsgetallen.
In blok 121 wordt de tel variabele m op één gezet en in blok 122 wordt de grootheid SCR(m) op nul gezet. In blok 123 wordt de telvariabele k 30 die in lus 128 actief is, op één gezet. Als de relatieve afwijking tussen de m-de toonhoogteschatting en de k-de toonhoogtes chatting kleiner is dan 12,5%, dan wordt de beslissingsruit 124 via de Y-tak verlaten.
In blok 125 wordt in dit geval het produkt van de kwaliteitsgetallen van de m-de en de k-de toonhoogteschatting bij SCR(m) opgeteld. Wordt 35 ruit 124 via de N-tak verlaten dan wordt geen bijdrage bij SCR(m) opgeteld en wordt blok 126 binnengegaan waar de variabele k met één wordt verhoogd. In beslissingsruit 127 wordt nagegaan of de variabele k groter is dan 6. Is dit niet het geval dan wordt via de N-tak van ruit 127 8400552 * . PHN 10903 18 de lus 128 binnengegaan. Is de variabele k groter dan 6 geworden dan wordt beslissingsruit 127 door de Y-tak verlaten, waarna in blok 129 de variabele m wordt verhoogd met één. In beslissingsruit 130 wordt nagegaan of de variabele m groter is dan 6. Is dit niet het geval dan wordt 5 de ruit 130 via de N-tak verlaten en wordt de lus 131 binnengegaan. Is de variabele m groter dan 6 dan wordt de ruit 130 via de Y-tak verla ten. Dan is in SCR(m) voor alle 6 toonhoogteschattingen berekend hoe goed de 6 toonhoogteschattingen met elkaar overeenkomen. In blok 132 wordt nu nog de index j bepaald waarvoor de bijbehorende SCR(j) de 10 hoogste waarde aanneemt. Tenslotte komt dan de toonhoogteschatting f0(j) als de meest waarschijnlijke beschikbaar in blok 133.
15 20 25 30 8400552 35

Claims (1)

1. Systeem voor het analyseren van menselijke spraak voor het bepalen van de toonhoogte van spraaksegmenten onder toepassing van meer dan één toonhoogtedetectie-algoritme met het kenmerk dat in een eerste elementaire toonhoogtemeter het amplitudespectrum van het spraakseg- 5 ment wordt bepaald en significante piekposities daarin bepaald worden/ dat in een tweede elementaire toonhoogtemeter de autocorrela-tiefunctie wordt bepaald en significante piekposities daarin bepaald worden, en dat de significante piekposities van het amplitudespec-trum resp. de significante piekposities van de aütocorrelatiefunctie 10 de ingangsgegevens vormen van de werkwijze omvattende de navolgende stappen: - het kiezen van een waarde voor de toonhoogte resp. periode en het bepalen van een reeks opeenvolgende gehele veelvouden van deze waarde en het bepalen van intervallen rondom deze waarde en de 15 veelvouden daarvan, welke intervallen een masker definiëren met openingen ter plaatse van een interval, aan welke openingen harmonische nummers zijn toegevoegd corresponderende met de vermenigvuldigde factoren in de genoemde veelvouden. - het berekenen van een kwaliteitsgetal overeenkomstig een criterium 20 dat de mate aangeeft waarin de significante piekposities en de openingen van het masker bij elkaar passen. - het herhalen van de voorafgaande stappen voor opeenvolgende hogere waarden van de toonhoogte resp* periode tot een bepaalde hoogste waarde, waardoor een reeks bij deze waarden van de toonhoogte 25 resp. periode behorende kwaliteitsget allen verkregen wordt. - het selecteren van een drietal waarden van de toonhoogte resp. periode met de hoogste kwaliteitsgetallen. - het omzetten van de waarden voor de periode in waarden voor de toonhoogte. 30. het combineren van de zo gevonden waarden voor de toonhoogte met de bijbehorende kwaliteitsgetallen tot een schatting van de toonhoogte die het meest waarschijnlijk is. 35 8400552
NL8400552A 1984-02-22 1984-02-22 Systeem voor het analyseren van menselijke spraak. NL8400552A (nl)

Priority Applications (5)

Application Number Priority Date Filing Date Title
NL8400552A NL8400552A (nl) 1984-02-22 1984-02-22 Systeem voor het analyseren van menselijke spraak.
US06/691,594 US4791671A (en) 1984-02-22 1985-01-15 System for analyzing human speech
EP85200221A EP0153787B1 (en) 1984-02-22 1985-02-20 System of analyzing human speech
DE8585200221T DE3571093D1 (en) 1984-02-22 1985-02-20 System of analyzing human speech
JP60033019A JPH0632028B2 (ja) 1984-02-22 1985-02-22 音声分析方式

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
NL8400552 1984-02-22
NL8400552A NL8400552A (nl) 1984-02-22 1984-02-22 Systeem voor het analyseren van menselijke spraak.

Publications (1)

Publication Number Publication Date
NL8400552A true NL8400552A (nl) 1985-09-16

Family

ID=19843518

Family Applications (1)

Application Number Title Priority Date Filing Date
NL8400552A NL8400552A (nl) 1984-02-22 1984-02-22 Systeem voor het analyseren van menselijke spraak.

Country Status (5)

Country Link
US (1) US4791671A (nl)
EP (1) EP0153787B1 (nl)
JP (1) JPH0632028B2 (nl)
DE (1) DE3571093D1 (nl)
NL (1) NL8400552A (nl)

Families Citing this family (30)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPH0636154B2 (ja) * 1986-06-25 1994-05-11 松下電工株式会社 音声コ−ド変換器
US5007093A (en) * 1987-04-03 1991-04-09 At&T Bell Laboratories Adaptive threshold voiced detector
NL8701798A (nl) * 1987-07-30 1989-02-16 Philips Nv Werkwijze en inrichting voor het bepalen van het verloop van een spraakparameter, bijvoorbeeld de toonhoogte, in een spraaksignaal.
US5003604A (en) * 1988-03-14 1991-03-26 Fujitsu Limited Voice coding apparatus
US5321636A (en) * 1989-03-03 1994-06-14 U.S. Philips Corporation Method and arrangement for determining signal pitch
US5226108A (en) * 1990-09-20 1993-07-06 Digital Voice Systems, Inc. Processing a speech signal with estimated pitch
US5233660A (en) * 1991-09-10 1993-08-03 At&T Bell Laboratories Method and apparatus for low-delay celp speech coding and decoding
US5715365A (en) * 1994-04-04 1998-02-03 Digital Voice Systems, Inc. Estimation of excitation parameters
JPH0896514A (ja) * 1994-07-28 1996-04-12 Sony Corp オーディオ信号処理装置
US5704000A (en) * 1994-11-10 1997-12-30 Hughes Electronics Robust pitch estimation method and device for telephone speech
US6026357A (en) * 1996-05-15 2000-02-15 Advanced Micro Devices, Inc. First formant location determination and removal from speech correlation information for pitch detection
US6092040A (en) * 1997-11-21 2000-07-18 Voran; Stephen Audio signal time offset estimation algorithm and measuring normalizing block algorithms for the perceptually-consistent comparison of speech signals
US6718217B1 (en) 1997-12-02 2004-04-06 Jsr Corporation Digital audio tone evaluating system
US6263086B1 (en) * 1998-04-15 2001-07-17 Xerox Corporation Automatic detection and retrieval of embedded invisible digital watermarks from halftone images
GB9811019D0 (en) * 1998-05-21 1998-07-22 Univ Surrey Speech coders
US6470311B1 (en) 1999-10-15 2002-10-22 Fonix Corporation Method and apparatus for determining pitch synchronous frames
GB2375028B (en) * 2001-04-24 2003-05-28 Motorola Inc Processing speech signals
KR100347188B1 (en) * 2001-08-08 2002-08-03 Amusetec Method and apparatus for judging pitch according to frequency analysis
TW589618B (en) * 2001-12-14 2004-06-01 Ind Tech Res Inst Method for determining the pitch mark of speech
JP3881932B2 (ja) * 2002-06-07 2007-02-14 株式会社ケンウッド 音声信号補間装置、音声信号補間方法及びプログラム
US7272551B2 (en) * 2003-02-24 2007-09-18 International Business Machines Corporation Computational effectiveness enhancement of frequency domain pitch estimators
US6988064B2 (en) * 2003-03-31 2006-01-17 Motorola, Inc. System and method for combined frequency-domain and time-domain pitch extraction for speech signals
US9818120B2 (en) 2015-02-20 2017-11-14 Innovative Global Systems, Llc Automated at-the-pump system and method for managing vehicle fuel purchases
US20090018824A1 (en) * 2006-01-31 2009-01-15 Matsushita Electric Industrial Co., Ltd. Audio encoding device, audio decoding device, audio encoding system, audio encoding method, and audio decoding method
US8768690B2 (en) 2008-06-20 2014-07-01 Qualcomm Incorporated Coding scheme selection for low-bit-rate applications
US20090319261A1 (en) * 2008-06-20 2009-12-24 Qualcomm Incorporated Coding of transitional speech frames for low-bit-rate applications
CN103189916B (zh) * 2010-11-10 2015-11-25 皇家飞利浦电子股份有限公司 估计信号模式的方法和设备
CN102842305B (zh) * 2011-06-22 2014-06-25 华为技术有限公司 一种基音检测的方法和装置
CN103426441B (zh) 2012-05-18 2016-03-02 华为技术有限公司 检测基音周期的正确性的方法和装置
EP3306609A1 (en) * 2016-10-04 2018-04-11 Fraunhofer Gesellschaft zur Förderung der Angewand Apparatus and method for determining a pitch information

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US2908761A (en) * 1954-10-20 1959-10-13 Bell Telephone Labor Inc Voice pitch determination
US3535454A (en) * 1968-03-05 1970-10-20 Bell Telephone Labor Inc Fundamental frequency detector
US3629510A (en) * 1969-11-26 1971-12-21 Bell Telephone Labor Inc Error reduction logic network for harmonic measurement system
US4004096A (en) * 1975-02-18 1977-01-18 The United States Of America As Represented By The Secretary Of The Army Process for extracting pitch information
NL177950C (nl) * 1978-12-14 1986-07-16 Philips Nv Spraakanalysesysteem voor het bepalen van de toonhoogte in menselijke spraak.
JPS56128999A (en) * 1980-03-14 1981-10-08 Hitachi Ltd Voice pitch period detector
JPS5876891A (ja) * 1981-10-30 1983-05-10 株式会社日立製作所 音声ピツチ抽出方法
JPS58140798A (ja) * 1982-02-15 1983-08-20 株式会社日立製作所 音声ピツチ抽出方法

Also Published As

Publication number Publication date
JPS60194499A (ja) 1985-10-02
EP0153787A3 (en) 1985-12-18
EP0153787A2 (en) 1985-09-04
JPH0632028B2 (ja) 1994-04-27
US4791671A (en) 1988-12-13
EP0153787B1 (en) 1989-06-14
DE3571093D1 (en) 1989-07-20

Similar Documents

Publication Publication Date Title
EP0153787B1 (en) System of analyzing human speech
Sachdev et al. The GstLAL search analysis methods for compact binary mergers in Advanced LIGO's second and advanced Virgo's first observing runs
US5381512A (en) Method and apparatus for speech feature recognition based on models of auditory signal processing
Gold et al. Parallel processing techniques for estimating pitch periods of speech in the time domain
KR100880480B1 (ko) 디지털 오디오 신호의 실시간 음악/음성 식별 방법 및시스템
NL7812151A (nl) Werkwijze en inrichting voor het bepalen van de toon- hoogte in menselijke spraak.
US6812394B2 (en) Method and device for determining rhythm units in a musical piece
KR100590661B1 (ko) 펄스 검출 및 특성화를 위한 장치 및 방법
JP5101316B2 (ja) 基本周波数の高調波及び分数調波の抑制を用いたピッチ抽出
JPH10322333A5 (nl)
GB2159996A (en) Speech recognition method and apparatus
RU2368931C2 (ru) Способ для управления качеством промышленных процессов, в частности лазерных сварочных процессов
WO1989008910A1 (en) Voice activity detection
CN119740102B (zh) 注意力眼镜的脑电信号实时解码及意图识别方法及设备
GB2375028A (en) Processing speech signals
CN110085259A (zh) 音频比对方法、装置和设备
Lal et al. Accurate estimation of glottal closure instants and glottal opening instants from electroglottographic signal using variational mode decomposition
US5122731A (en) Method and apparatus for frequency spectrum analysis
CN115308814B (zh) 低采样数据采集设备的授时误差测量方法及装置
JP4790318B2 (ja) 2つの調波信号の共通源の判定方法
JPS6356560B2 (nl)
Muhammad Extended average magnitude difference function based pitch detection
US8108164B2 (en) Determination of a common fundamental frequency of harmonic signals
EP0579812B1 (en) Process for speech analysis
Yantorno A study of the spectral autocorrelation peak valley ratio (SAPVR) as a method for identification of usable speech and detection of co-channel speech

Legal Events

Date Code Title Description
A1B A search report has been drawn up
BV The patent application has lapsed