DD218969A1 - Anordnung zur bildung von sprechergruppen - Google Patents

Anordnung zur bildung von sprechergruppen Download PDF

Info

Publication number
DD218969A1
DD218969A1 DD25118583A DD25118583A DD218969A1 DD 218969 A1 DD218969 A1 DD 218969A1 DD 25118583 A DD25118583 A DD 25118583A DD 25118583 A DD25118583 A DD 25118583A DD 218969 A1 DD218969 A1 DD 218969A1
Authority
DD
German Democratic Republic
Prior art keywords
speaker
similarity
reference data
speakers
distance
Prior art date
Application number
DD25118583A
Other languages
English (en)
Inventor
Karl-Heinz Affa
Original Assignee
Affa Karl Heinz
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Affa Karl Heinz filed Critical Affa Karl Heinz
Priority to DD25118583A priority Critical patent/DD218969A1/de
Publication of DD218969A1 publication Critical patent/DD218969A1/de

Links

Landscapes

  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

Anordnung zur Bildung von Sprechergruppen, insbesondere fuer automatische Spracherkennungssysteme, durch die Bildung von Mittelwertfunktionen. Die Aufgabe der Erfindung besteht darin, die zwischen den einzelnen Sprechern bestehenden unterschiedlichen Aehnlichkeitsbeziehungen zu nutzen, um Gruppen von Sprechern zu schaffen. Erfindungsgemaess wird die Aufgabe dadurch geloest, dass die Sprachsignale jedes Sprechers von einer Signalquelle, einem Mikrofon oder Magnetband ueber eine Kettenschaltung, bestehend aus einem Vorverstaerker, einem Preemphasis-Filter, einer aus einem System von Bandpaessen aufgebauten Filterbank, einem Analogmultiplexer und einem Analog-Digital-Umsetzer in Form eines 8 bit Datenwortes an den Digitalrechner uebertragen werden. Ueber einen definierten Zeitraum werden die Amplitudenwerte kanalweise aufsummiert und abschliessend auf die Anzahl der betrachteten Zeitfenster normiert. Das so entstandene Mittelwertspektrum wird in einem externen Speicher geladen. Aus den gespeicherten Mittelwertspektren von N untersuchten Sprechern wird eine Aehnlichkeitsmatrix ermittelt und dazu als Aehnlichkeitsmass die City-Block-Distanz, der Euklidische Abstand oder andere bekannte Abstandsmasse verwendet. Die Sprechergruppen werden in einer folgenden Stufe gebildet. Dazu wird zeilenweise jedes Abstandsmass in einer weiteren Stufe mit einer Aehnlichkeitsschwelle verglichen. Fig. 4

Description

Anordnung zur Bildung von Sprechergruppen, insbesondere für automatische Spracherkennungssysteme, durch die Bildung von Mittelwertfunktionen.
Elemente der Erfindung können in Sprecheridentifikationssystemen und Sprecherverifikationssystemen verwendet werden.
Charakteristik der bekannten technischen Lösungen
Die ersten Forschungen auf dem Gebiet der automatischen Spracherkennung gehen bis in die 50er Jahre zurück. Seit dieser Zeit sind eine Vielzahl von automatischen Erkennungssystemen bekannt geworden, die unter Heranziehung fast ebenso vieler Sprachmerkmale mehr oder weniger zuverlässige Erkennungsergebnisse erzielen.
(HOIMGREET, G.L.ι Speaker Recognition, Speech Charakteristics, Speech Evaluation and Modification of Speech Signals - A Selected Bibliography
in: IEEE Transactions of Audio and Electroacoustics, 1966, S. 32 - 39).
Dabei tritt die Individualität der menschlichen Sprache von Anfang an als Störfaktor in Erscheinung. Um diesem Sachverhalt Rechnung zu tragen, wurden bisher eine Reihe von Einschränkungen notwendig.
Die gegenwärtig realisierten automatischen Spracherkennungssysteme verwenden vorwiegend Worte als kleinste zu erkennende Einheiten (Einzelworterkenner). Dabei existieren noch Systeme , deren kleinste zu erkennende Einheiten Silben oder
Phoneme darstellen.
Die erwähnten Einschränkungen, die durch die Sprecherindividualität der menschlichen Sprache bedingt sind, führten bei der Entwicklung der Einzelwörterkenner zu zwei Grundrichtungen: . '
1. Pur jeden, das Spracherkennungssystem benutzenden Sprecher wird ein gesonderter Referenzdatensatz gebildet. Dabei ist es notwendig, daß für jeden Sprecher der vollständige Lernzyklus abgearbeitet werden muß. Bevor ein neuer Sprecher an das System herantritt, wird zuerst der
; für ihn gültige Referenzdatensatz ausgewählt. Diese Referenzdatenwahl kann automatisch (über die automatische Sprechererkennung.) erfolgen oder sie kann dem Erkennungssystem über ein Bedienpult· mitgeteilt werden. Der Nachteil dieses Verfahrens besteht darin, daß für jeden das System benutzenden Sprecher ein vollständiger Referenzdatensatz ermittelt werden muß. Das erfordert einen relativ großen Aufwand, da der Rechenzeitbedarf für die Anlernphase in der Regel um ein Vielfaches höher liegt als für die Erkennungsphase.
(US-PS 3261916 \
LIEK, W·: Die Erkennung von Sprache durch elektronische Systeme
in: Nachrichten-Elektronik, 1978, Heft 9).
\
2. Bei diesem Verfahren wird ein gemeinsamer Referenzdatensatz für alle Sprecher gebildet· TJm die unterschiedlichen Sprechereigenarten berücksichtigen zu können, ist es deshalb notwendig, für jedes Wort mehrere Referenzmuster zu speichern. Dadurch vergrößert sich der Speicherplatzbedarf notwendigerweise um ein Vielfaches gegenüber dem ersten Verfahren. Um diesen Aufwand zumindest teilweise reduzieren zu können, werden mit Hilfe von Clusterverfahren Repräsentanten von Referenzworten mit gleicher Wortbedeutung gebildet. Der Speicherplatzbedarf bleibt jedoch weiterhin relativ hoch. Dadurch, daß die Anzahl der Referenzworte gegenüber dem ersten Verfahren um ein Vielfaches höher liegt, erhöht sich auch die Erkennungszeit.
(DE-OS 2240557
SCOTT, P.B.: VICI-A Speaker Independent Word Recognition System in: Int. Conf. on ASSP, 1976,. S. 210 - 213).
Die Anzahl der zu verarbeitenden Worte und Sprecher wird durch den zur Verfügung stehenden Speicherplatz für die Speicherung der Referenzdaten bestimmt. Darüber hinaus muß noch die Möglichkeit bestehen, den eigentlichen Erkennungsprozeß in relativ kurzer Zeit (möglichst Echtzeit) durchzuführen. Das bedeutet also, daß ohne wesentliche Vergrößerung des Speicherplatzes eine Erhöhung der Sprecherzahl gleichzeitig eine Verringerung der Zahl der zu erkennenden Worte zur Folge hat. Ebenso zieht eine Erhöhung der Zahl der zu erkennenden Worte notgedrungen eine Verringerung der Sprecherzahl nach sich. Da der in einem Digitalrechner zur Verfugung stehende Speicherplatz derzeit noch sehr begrenzt und darüber hinaus auch noch relativ teuer ist, wirken sich die genannten Einschränkungen ungünstig auf eine breitere Anwendung aus. -
Bestrebungen, diese Fachteile durch eine geeignete Merkmalvektornormierung oder Merkmalvektortransformation zu kompensieren, stecken noch in den Anfängen und sind bisher von keinem Erfolg gekrönt.
(VIHCZJUE, T.K·; KULIAS, Α·Ι.: Sadaca podstrojki,
pod diktora pri raspoznavanii reci
in: OBRABOTKA I RASPOZHAVAHIE SIGHAXOV, Kiew, 1975
RAMISHVILI, G.S.i Recevoj signal i individualnost golosa Isdatjelstwo "Mezniereba", Tbilissi, 1976).
Den bisherigen Lösungen haftet der Mangel an, daß bei konstanter Größe des Hauptspeichers eine Erhöhung der Sprechern -zahl nur durch eine Reduzierung der Anzahl der zu erkennenden Worte möglich ist. Zum anderen hat eine Vergrößerung der Zahl.der zu erkennenden Worte eine Verringerung der Sprecherzahl zur Folge.
Ziel der Erfindung
Das Ziel der Erfindung ist es, daß ohne eine nennenswerte Vergrößerung des notwendigen Speicherplatzbedarfes des Hauptspeichers eine gpößei^e Anzahl von Sprechern mit dem auto"-
- 4 matischen Spracherkennungssystem arbeiten können.
Darlegung des Wesens der, Erfindung
Die Aufgabe der Erfindung besteht darin, die zwischen den einzelnen Sprechern bestehenden unterschiedlichen Ähnlichkeitsbeziehungen zu nutzen, um Gruppen von Sprechern zu- schaffen, die sich dadurch auszeichnen, daß sich die Mitglieder einer Sprechergruppe hinsichtlich ihrer zur Sprecherkennung verwendeten Sprachmerkmale ähnlich sind. ' Erfindungsgemäß wird die Aufgabe dadurch gelöst, daß die Sprachsignale jedes Sprechers von einer Signalquelle, einem Mikrofon oder Magnetband über eine Kettenschaltung, bestehend aus einem Vorverstärker, einem Preemphasis-Filter, einer aus einem System von Bandpässen aufgebauten Filterbank, einem Analogmultiplexer und einem Analog-Digital-Umsetzer in Form eines 8 bit Datenwortes, an den Digitalrechner übertragen wer-/den. Über einen definierten Zeiträum,werden die Amplitudenwerte kanalweise aufsummiert und abschließend auf die Anzahl der betrachteten Zeitfenster normiert· Für das' so entstandene Mitte lwertspekt rum von IT untersuchten Sprechern wird eine Ähnlichkeitsmatrix ermittelt und dazu als Ähnlichkeitsmaß die City-Block-Distanz, der Euklidische Abstand oder andere bekannte Abstandsmaße verwendet. ,
Die Sprechergruppen werden in einer folgenden Stufe gebildet. Dazu wird zeilenweise ^edes Abstandsmaß in einer weiteren Stufe mit einer Ärmlichkeitsschwelle verglichen. Alle Indizes der Abstandsmaße, welche die Ähnlichkeitsschwelle unterschreiten, werden an eine Stufe zur Ausgabe der Sprechernummern der ermittelten Sprechergruppen weitergegeben, in aufsteigender Folge sortiert und ausgegeben. In automatischen Spracherkennungssystemen erfolgt in einer weiteren Stufe die Bildung eines MittelwertSpektrums zur Vorauswahl des zur Klassifikation verwendeten Referenzdatensatzes. In einem externen Speicher ist dazu eine Auswahl von Referenzdatensätzen unterschiedlicher Sprechertypen gespeichert. In die Mittelwertbildung, werden alle vorher gesprochenen Erkennungseinheiten einbezogen. Nach Jedem gesprochenen Wort wird überprüft, ob die getroffene Referenzdatenauswahl noch gültig ist. Ein neuer Re-
ferenzdatensatz wird in den Hauptspeicher geladen, wenn dieser die Ähnlichkeitsbedingungen besser erfüllt.
Zur Bildung von Sprechergruppen werden als Sprachmerkiaale Merkmal vektorfolgen von Amplitudenhistogrannnen, liulldurch-' gangsfunktionen und LPC-Analysefunktiqnen verwendet.
Bei der Benutzung eines automatischen Spracherkennungssysteins durch einen Premdsprecher wird aus vorliegenden Sätzen von Referenzdaten derjenige Datensatz zur Erkennung herangezogen, der mit hoher Sicherheit das'beste Erkennungsergebnis liefert.
Ausführungsbeispiel ' ..' ''
Die Erfindung soll nachstehend an einem Ausführungsbeispiel näher erläutert werden. . . ,
In der zugehörigen Zeichnung zeigen: , l ,
Pig. 1: Blockschaltbild der Anordnung zur Bildung . von Sprechergruppen
Pig. 2: Mittelwertspektrum eines weiblichen und eines männlichen Sprechers .
Pig.· 3'· - Prinzip der Sprechergruppenbildung allgemein
Pig. 4: Prinzip der Sprechergruppenbildung in einem automatischen Spracherkennungssystem
Den Ausgangspunkt für* die Bildung von Sprechergruppen bilden Mittelwertfunktionen von verschiedenen Sprechern. Diese Mittelwertfunktionen werden durch komponentenweise Mittelung von Parameterftmktlonen gebildet. Dabei müssen die Parameterfunktionen als Yektorfolgen konstanter Komponentenzahl darstellbar sein· Diese Bedingungen erfüllen ζ. B. Pilterspektren, Hulldurchgangsfunktionen, Amplituden- bzw. Pegelhistogramme und iPC-Koeffizienten.
Die Verwendung von Pilterspektren zur automatischen Spracherkennung ist sehr weit verbreitet. In diesem Pail werden Mittelwertspektren zur Ermittlung der Sprechergruppen herangezogen. In Pig. 1 wird eine Anordnung gezeigt, mit der Mittelwertspektren unterschiedlicher Sprecher gebildet werden können. Die Sprachsignale jedes Sprechers gelangen von einer Signalquelle 1 (Mikrofon^ Magnetband o. dgl.) über einen Vor-
verstärker 2 ,auf ein Preemphasis-Filter 3· Dieses Filter bewirkt eine Höhenanhebung des Sprachsignals um etwa.6'- 12 dB pro Oktave, um dem bei der Sprache typischen Amplitudenabfall zu hohen Frequenzen hin entgegenzuwirken. Danach gelangt das Sprachsignal zur Parallelfilterbank 4· Diese Parallelfilterbank besteht aus einem System von Bandpässen. Die Untersuchungen wurden mit einer 20kanaligen Filterbank durchgeführt, die die nachfolgend angegebenen Grenzfrequenzen und Mittelfrequenzen besitzen. '
iz (Hz) Bandbreite (Hz)
70 - 170 170 - 270 . 270 -370 370 - 470 470 - 570 570 - 680 680 - 810 810 - 970 970 - 1170 . 1170-1400 1400 - 1680 1680 - 2000 2000 - 2400 2400 - 2880 2880 - 3460 3460 - 4150 4150 - 4980 . ' 4980 - 5980 5980 - 7170 7170 - 8600
Ein sich daran anschließender Analogmultiplexer 5 tastet alle 12,5 ms die Filterausgänge schrittweise ab. Die so entstandene analoge Funktion wird vom Analog-Digital-Umsetzer in ein 8 bit langes Datenwort umgewandelt. Diese 8 bit lassen eine Auflösung von 128 Amplitüdenstufen zu. Das entspricht einem Dynamikumfang von 48 dB. Die weitere Verarbeitung erfolgt rechentechnisch. Das digitalisierte Signal gelangt in den Rechner 7 (KRS 4201) und wird dort gemittelt.
Kanalnummer I littenfreq·
1 109
2 214
• / 3 . 316
4 417
.5 518
6 623
7 742
a 886
9 1065
10 1280
11 1535
12 1833
13 2191
14 2629
15 3157
16 3789
17' 4546
18 5457
19 6548
20 7853
Das geschieht so, daß die Amplitudenwerte über den gesamten •zu betrachtenden-Zeitraum kanalw-ise aufsummiert und abschließend auf die Anzahl der befrachteten Zeitfenster normiert werden. Pausenabschnitte werden dabei nicht berücksichtigt. Das sogenannte Hittelwertspektrum kann in einem externen Speicher 8 (Magnetband, ,Magnetplatten o. dgl.) gespeichert und/oder z. B. von einer grafischen Ausgabeeinheit 9 (Plotter, XY-Sehreiber o. dgl.) gezeichnet werden.
Fig. 2 zeigt die Mittelwertspektren eines männlichen und eines weiblichen Sprechers. Den Punktionsverläufen liegt ein 30 Worte umfassender Sprechtext zugrunde. In der Regel hat sich nach einem '20 - 30 s langen Sprechtext ein stabiles Mittelwertspektrum herausgebildet, das unabhängig vom gesprochenen Text und charakteristisch für den jeweiligen Sprecher ist. Die sprechertypischen Maxima werden insbesondere durch die energiereichen Vokalanteile des Sprachmaterials bestimmt.. Die Vokale enthalten wesentliche sprecherbeschreibende Informationen. Die wortbedeutungstragende Information innerhalb des Sprachspektrums wird durch die Mittelung über einen längeren, aus verschiedenen Worten bestehenden Sprachtext abgeschwächt. Sprecher mit ähnlicher Gestalt der Mittenwertspektren haben demzufolge wesentliche Gemeinsamkeiten bezüglich der Artikulation» Pur solche Sprecher ist es möglich, einen gemeinsamen Referenzdatensatz für die automatische Spracherkennung zu verwenden. Sprecher mit einem derartigen gemeinsamen Referenzdatensatz bilden eine Sprechergruppe·
Pig. 3 verdeutlicht das Prinzip der Sprechergruppenbildung. In einem Digitalrechner (z. B. ERS 4201) sind in geeigneter Weise die Mittelwertspektren von Έ untersuchten Sprechern 10 gespeichert. Anschließend erfolgt die Ermittlung einer Ähnlichkeitsmatrix 11. Als Ähnlichkeitsmaß eignet sich die City-Block-Distanz oder der Euklidische Abstand. Diese Ähnlichkeitsmaße sind zu einen rechentechnisch sehr gut handhabbar (einfache Rechenoperationen und damit verbunden geringe Rechenzeiten) und zum anderen physikalisch sehr gut interpretierbar. Darüber hinaus lassen sich eine Vielzahl anderer Abstandsmaße, deren Berechnung weitaus aufwendiger ist (Pischerkriterium, Mahalanobis-Distanz, Korrelationsmaß usw.), anwen-
r-, r* um αr> r, n, .„ ^ π it *
- 8 -
den. ;
Die City-Block-Distanz läßt sich nach der Beziehung
JL-
' ' CDij = 2_i ! Si(1) " Xj(1) 1=1
und der Euklidische Abstand nach der Beziehung
I ' j'—-—; —-~—,
• 1=1-
ermitteln. Dabei bezeichnet i und j das Sprecherpaar, für das der Abstand ermittelt wird. Die Komponente der Parameterfunktion wird durch 1 angegeben. L ist die Anzahl der Komponenten, aus denen sich der Parametervektor χ -zusammensetzt.
In der Stufe 13 erfolgt die Bildung der Sprechergruppen. Dabei wird so vorgegangen, daß zeilenweise jedes Abstandsmaß mit einer Ähnlichkeitsschwelle Stufe 12 verglichen wird. Die Ähnlichkeitsschwelle wird experimentell bestimmt. Sie sollte so gewählt werden, daß etwa 2-5 Sprecher einer Gruppe, zugeordnet werden. Hachdem die gesamte Zeile der Ähnlichkeitsmatrix abgearbeitet wurde, werden alle Indizes der Abstandsmaße, die die Ähnlichkeitsschwelle unterschreiten, an die Stufe 14 weitergegeben. Die Indizes der Abstandsmaße stimmen mit den Hämmern der betrachteten Sprecher überein. In der Stufe 14 werden die Sprechernummern, die nach Abarbeitung jeder Zeile der Ähnlichkeitsmatrix übermittelt werden, in aufsteigender Folge sortiert· Die so entstandenen Polgen werden verglichen, um Wiederholungen auszuschließen. Abschließend werden die Sprechernummern jeder Sprechergruppe ausgegeben.
4 zeigt die Anordnung zur Sprechergruppenbildung in einem automatischen Spracherkennungssystem« Ein wesentlicher Vorteil des Systems ist die dynamische Sprecheranpassung. Dabei erfolgt eine ständige Aktualisierung der Referenzdaten. Für die Eingabe der Sprachdaten gilt das in bezug auf Fig. 1 Gesagte. Dies betrifft die Stufen 1-6.
Während innerhalb des Rechners die eingegebene Vektorfolge zum einen zur Klassifikation verwendet wird, erfolgt zum anderen die Bildung eines Mittelwertspektrums zur Vorauswahl
r - 9 -
des zur Klassifikation verwendeten Referenzdatensatzes in einer Stufe 15. Auf einem externen Speicher 16 (Digitalmagnetband, Digitalkassette, Magnetplatte ο. dgl.) sind in geeigneter Weise eine Auswahl von Referenzdatensätzen unterschiedlicher Sprechertypen gespeichert. Mit Hilfe des in Stufe 15 gebildeten Mittelwertspektrums wird der Referenzdatensatz ausgewählt, dessen Mittelwertspektrum (über den gesamten Referenzdatensatz gebildet) die größte Ähnlichkeit zu diesem neu ermittelten Mittelwertspektrum'besitzt. Dabei gehen alle vorher gesprochenen Srkennungseinhe.iten in die Mittelung ein. !lach jedem gesprochenen Wort wird überprüft, ob die getroffene ReferenzdatenausY/ahl17 noch gültig ist. Im anderen Fall wird ein anderer Referenzdatensatz, der die Ähnlichkeitsbedingung besser erfüllt, in den Hauptspeicher geladen. Dadurch wird erreicht, daß bei Sprecherwechsel eine Anpassung des Erkennungssystems an.den neuen Sprecher erreicht wird. Da die meisten Spracherkennungssysteme die Möglichkeit vorsehen, ein falsch erkanntes Wort Stufe 18 "zurückzuweisen, ist es sogar möglich, den ausgewählten Referenzdatensatz ständig zu aktualisieren. Immer wenn eine Erkennungseinheit richtig erkannt wurde, erfolgt die Ermittlung eines neuen Referenzdatenwortes, in dem der Mittelwert zwischen dem eben gesprochenen Text und dem bisherigen Referenzdatenwort berechnet wird Stufe 19. Damit wird erreicht, daß die während des normalen Sprechablaufs typischen Sprachveränderungen eines Sprechers Berücksichtigung finden. In der Stufe 20 erfolgt die durch die Spracheingabe bezweckte Reaktion des Erkennungssystems.
Die Tabelle 1 enthält die Erkennungsergebnisse von 10 männlichen Sprechern. Es wurden insgesamt 30 unterschiedliche Worte verwendet, mit jeweils 7 Realisierungen pro Wort. Das ergibt einen Gesamtumfang von 210 Worten pro Sprecher.
Mit den in den Figuren 1 und 3 beschriebenen Anordnungen wurde die Ähnlichkeitsmatrix für diese Sprecher ermittelt. Als Abstandsmaß wurde die City-Block-Distanz verwendet. Die Ähnlichkeitsmatrix ist in Tabelle 2 enthalten. Die Ähnlichkeitsschwelle zur Sprechergruppenbildung wurde so gewählt, daß Gruppen von maximal zwei Sprechern gebildet werden. Für grössere Sprechergruppen ist eine höhere Sprecherzahl 'nötig. Die
Tabelle 3 enthält die Erkennungsergebnisse für zwei Sprechergruppen (Gruppe 1 aus Sprecher 2 und 8, Gruppe 2 aus Sprecher 5 und 7 gebildet).
Die Erkennungsergebnisse der Sprecher innerhalb einer Sprechergruppe liegen über 90 %. Beim Erkennungsvorgang befindet sich jeweils nur der Referenzdatensatz für eine Sprechergruppe im Hauptspeicher. Welcher Referenzdatensatz das ist, wird während des laufenden Erkennungsproaesses entschieden, leben den Referenzsprachdaten der jeweiligen Sprechergruppe sind außerdem die Mittelwertspektren sämtlicher zur Verfügung stehenden Referenzdatensätze der unterschiedlichen Sprechergruppen gespeichert. -
Parallel zum Erkennungsprozeß, wird das Mittelwertspektrum des Nutzers ermittelt. Dabei gehen vorherliegende Sprachäußerungen in die Mittelung ein. Es wird bei jedem Erkennungsprozeß geprüft, zu welchem Mittelwertspektrum der Referenzdatensätze der Sprechergruppen die größte Ähnlichkeit besteht. Dieser Referenzdatensatz wird von einem Externspeicher (Magnetband, Magnetplatte, Magnetkassette o. ä.) in den Hauptspeicher geladen. Damit arbeitet das Erkennungssystem gewissermaßen 'sprecheranpassend. Bei Sprecherwechsel kann automatisch auf einen geeigneten Referenzdatensatz zurückgegriffen werden.
Anhand der Tabellen 1 und 2 soll verdeutlicht werden, wie bei Hutzung des automatischen Spracherkennungssystems durch einen Fremdsprecher verfahren wird. Als Referenzdatensätze stehen zum Beispiel Muster der Sprecher 1 -. 5 zur Verfügung· Im allgemeinen Pail können das auch Referenzdatensätze von Sprechergruppen sein. Die Sprecher 6-10 stellen Fremdsprecher dar. Damit gelten die ersten 5 Zeilen der Tabelle 1 und 2.
Aus Tabelle 2 ist ersichtlich, daß zum Beispiel für Sprecher 10 (Fremdsprecher) der Sprecher 3 das geringste Abstandsmaß (0,81) liefert. Tabelle !zeigt, daß unter Verwendung des Referenzdatensatzes des Sprechers 3 für den Sprecher 10 das höchste Erkennungsergebnis (86,3 %) erzielt wird.
Für Sprecher 8 liefert der Referenzdatensatz des Sprechers 2 (Abstandsmaß 0,73) das höchste Erkennungsergebnis (87,6 %)» Für Sprecher 7 wird demzufolge mit dem Referenzdatensatz des
Sprechers 5 (Abstandsmaß 0,78) das beste Erkennungsergebnis (90,4 SS)' erreicht.
ITutzer
1 1 2 3 4 5 6 7 8 9 10
2 96,2 81 ,8 61,9 ,83,8 91,9 85,2 78,0 83,3 54,7 50,4
3 81,9 99,0 78,1 77,4 84,4 79,5 79,4 87,6 72,4 70,0
Qj Λ O •4 74,3 74,2 99,0 82,4 85,2 72,9 74,2 86,4 67,5 86,3
φ U 5 71.,9 72,2 65,2 97,1 80,0 78,1 76,1 72,4 69,0 71,4
Pt co 6 79,5 80,3 77,0 78,6 99,0 71,4 90,4 62,5 66,0 62,4
U φ 7 72,1 71 ,2 76,3 82,2 78,3 97,8 69,, 8 72,9 71,8 78,3
8 60,9 65,3 63,2 >9,1 86,3 67,3 98,1 72,1 66,3 62,1
φ 9 63,2 75,3 69,1 68,2 62,1 64,1 62,7 97,3 73,2 77,3
© 10 59,8 62,3 60,3 69,8 72,1 67,3 69,1 73,2 97,8 80,3
57,9 53,8 49,7 65,2 68,3 79,2 62,7 85,1 84,2 98,5
Tabelle 1 (Angaben in %)
Sprecher
1 1 2 3 4 •5 6 7 8 9 10
2 0,00 1 ,23 1,69 1,19 1,22 1,41 1,39 1 ,10 1,11 1 ,26
3 1,23 0,00 1 ,16 1 ,02 0,93 1,32 1,02 0,73 1,22 1,33
4 1,69 1 ,16 0,00 1 ,06 0,99 1,00 1,34 0,93 1,14 0,81
U 5 1,19 1 ,02 1 ,06 0,00 0,81 0,84 0,98 0,93 1 ,08 0,99
£ } 6 1,22 0,93 0,99 0,81 0,00 1,03 0,78 1 ,02 1 ,09 1,12
W (S U 7 1,41 1,32 1,00 0,84 1,03 0,00 1,28 1,19 1,12 0,95
Oi Kl 8 1,39 1,02 1,34 0,98 0,78 1 ,28 0,00 1,31 1,36 1 ,47
9 1 ,10 0,73 0,93 0,93 1 ,02 1,19 1,31 0,00 0,87 0,78
10 1,11 1 ,22 1,14 1 ,08 1,09 1,12 1,36 0,87 0,00 0,95
1,26 1,33 0,81 0,99 1,12 0,95 1,47 0,78 0,95 0,00
Tabelle 2 (Angaben ohne Maßeinheit (normiert),)
& Ό4 Φ
ange. Spre Lernt pher sr
vn ro
er» 03 U) _i
03
03 95,' ro
•Φ ro co ro VD U)
ω •φ 00
ω U) vn
U? VD CP.
U) VJl
VD ·£- 03
s To
oo VD O 03
VD
-J ro V» . f*v. 03 vn VD
VD 75,7 ι O
φ H
ro

Claims (4)

1. Anordnung zur Bildung von Sprechergruppen, insbesondere für automatische Spracherkennungssysteme,.durch die Bildung von Mittelwertfunktionen dadurch gekennzeichnet·, daß die Sprachsignale jedes Sprechers von einer Signalquelle (1), einem Mikrofon oder Magnetband, über eine Kettenschaltung, bestehend aus einem Vorverstärker (2), einem Preemphasis-Filter (3), einer aus einem System von Bandpässen aufgebauten filterbank (4), einem Analogmultiplexer (5) und einem Analog-Digital-Umsetzer (6), in Form eines 8 bit Datenwortes an den Digitalrechner (7) übertragen werden, über einen definierten Zeitraum die Amplitudenwerte kanalweise aufsummiert und abschließend auf die
, betrachteten Zeitfenster normiert werden, das entstandene Mittelwertspektrum in einen externen Speicher (8) geladen und aus den gespeicherten Mittelwertspektren (10) von IT. untersuchten Sprechern eine Ähnlichkeitsmatrix (11) ermittelt und dazu als Ähnlichkeitsmaß die City-Block-Distanz benutzt wird, in einer folgenden Stufe (12) mit einer Ähnlichkeitsschwelle verglichen, alle Indizes der Abstandsmaße, welche die Ähnlichkeitsschwelle unterschreiten, werden an eine Stufe (14) zur Ausgabe der Sprechernummern der ermittelten Sprechergruppen weitergegeben, in aufsteigender Polge sortiert und ausgegeben, weiter erfolgt in automatischen Spracherkennungssystemen die Mittelwertbildung zur Vorauswahl des zur Klassifikation verwendeten Referenzdatensatzes in einer Stufe (15)» eine Auswahl von Referenzdatensätzen unterschiedlicher Sprechertypen ist in einem externen Speicher (16) gespeichert, in die Mittelwertbildung werden alle vorher gesprochenen Erkennungseinheiten einbezogen, nach jedem gesprochenen. Wort wird überprüft, ob die getroffene Referenzdatenauswahl (17) noch gültig ist'* und ein neuer Referenzdatensatz wird in den Hauptspeicher geladen, wenn dieser die Ähnlichkeitsbedingungen besser erfüllt.
2. Anordnung zur Bildung von Sprechergruppen nach Punkt 1 dadurch gekennzeichnet, daß als Sprachmerkmale Merkmalvektorfolgen von Amplitudenhistogrammen, ITulldurchgangsfunktionen und LPC-Analysefunktionen verwendet werden.
-H-
3· Anordnung zur Bildung von Sprechergruppen nach. Punkt 1 lind 2 dadurch gekennzeichnet, daß als Ähnlichkeitsmaß der Euklidische Abstand, das Kreuzkorrelationsmaß und ·. die Mahalanobis-Distanz verwendet werden.
4. Anordnung zur Bildung von Sprechergruppen nach Punkt 1 dadurch gekennzeichnet, daß bei Benutzung eines automatischen Spracherkennungssystems durch einen Fremdsprecher aus vorliegenden Sätzen von Referenzdaten derjenige Datensatz zur Erkennung· herangezogen wird, der mit hoher Sicherheit das beste Erkennungsergebnis liefert.
Hierzu 3 Blatt Zeichnungen.
DD25118583A 1983-05-24 1983-05-24 Anordnung zur bildung von sprechergruppen DD218969A1 (de)

Priority Applications (1)

Application Number Priority Date Filing Date Title
DD25118583A DD218969A1 (de) 1983-05-24 1983-05-24 Anordnung zur bildung von sprechergruppen

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
DD25118583A DD218969A1 (de) 1983-05-24 1983-05-24 Anordnung zur bildung von sprechergruppen

Publications (1)

Publication Number Publication Date
DD218969A1 true DD218969A1 (de) 1985-02-20

Family

ID=5547514

Family Applications (1)

Application Number Title Priority Date Filing Date
DD25118583A DD218969A1 (de) 1983-05-24 1983-05-24 Anordnung zur bildung von sprechergruppen

Country Status (1)

Country Link
DD (1) DD218969A1 (de)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE10050808A1 (de) * 2000-10-13 2002-05-16 Voicecom Ag Sprachgeführte Gerätesteuerung mit Benutzeroptimierung

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE10050808A1 (de) * 2000-10-13 2002-05-16 Voicecom Ag Sprachgeführte Gerätesteuerung mit Benutzeroptimierung
DE10050808C2 (de) * 2000-10-13 2002-12-19 Voicecom Ag Sprachgeführte Gerätesteuerung mit Benutzeroptimierung

Similar Documents

Publication Publication Date Title
DE69622565T2 (de) Verfahren und vorrichtung zur dynamischen anpassung eines spracherkennungssystems mit grossem wortschatz und zur verwendung von einschränkungen aus einer datenbank in einem spracherkennungssystem mit grossem wortschatz
EP1405222B9 (de) Verfahren und vorrichtung zum erzeugen eines fingerabdrucks und verfahren und vorrichtung zum identifizieren eines audiosignals
EP0821346B1 (de) Verfahren zur Sprecherverifikation durch einen Rechner anhand mindestens eines von einem Sprecher eingesprochenen Sprachsignals
EP1214703B1 (de) Verfahren zum trainieren der grapheme nach phonemen regeln für die sprachsynthese
EP0925461B1 (de) Verfahren zur mehrsprachenverwendung eines hidden markov lautmodelles in einem spracherkennungssystem
DE2422028C2 (de) Schaltungsanordnung zur Identifizierung einer Formantfrequenz in einem gesprochenen Wort
DE69423692T2 (de) Sprachkodiergerät und Verfahren unter Verwendung von Klassifikationsregeln
DE19847419A1 (de) Verfahren zur automatischen Erkennung einer buchstabierten sprachlichen Äußerung
EP0862161A2 (de) Verfahren zur Spracherkennung mit Sprachmodellanpassung
DE102014107028B4 (de) Verbesserte biometrische Passwortsicherheit
DE1547032A1 (de) Einrichtung zum Identifizieren einer Person
DE69738116T2 (de) Lokalisierung eines Musters in einem Signal
DE3043516C2 (de) Verfahren und Vorrichtung zur Spracherkennung
DE2020753A1 (de) Einrichtung zum Erkennen vorgegebener Sprachlaute
DE112017006049B4 (de) Verfahren und Vorrichtung zur Klangidentifizierung anhand periodischer Anzeichen
EP1058235B1 (de) Wiedergabeverfahren für sprachgesteuerte Systeme mit text-basierter Sprachsynthese
DE19837102A1 (de) Verfahren und Anordnung zum Durchführen einer Datenbankanfrage
EP1125278B1 (de) Datenverarbeitungssystem oder kommunikationsendgerät mit einer einrichtung zur erkennung gesprochener sprache und verfahren zur erkennung bestimmter akustischer objekte
DE102004017486A1 (de) Verfahren zur Geräuschreduktion bei einem Sprach-Eingangssignal
DE4111781A1 (de) Computersystem zur spracherkennung
DE102007042971A1 (de) Spracherkennungsverfahren und Spracherkennungsvorrichtung
DE69915817T2 (de) Vorrichtung und verfahren zur spracherkennung
DE10010232A1 (de) Verfahren und Vorrichtung zur Spracherkennung
DE2363590A1 (de) Spracherkennungssystem mit merkmalsfolgekodierung
EP0834860B1 (de) Verfahren zur Spracherkennung mit kontexabhängig modellierten Hidden Markov Modellen

Legal Events

Date Code Title Description
ENJ Ceased due to non-payment of renewal fee