DE3200645A1 - "verfahren und vorrichtung zur spracherkennung" - Google Patents

"verfahren und vorrichtung zur spracherkennung"

Info

Publication number
DE3200645A1
DE3200645A1 DE19823200645 DE3200645A DE3200645A1 DE 3200645 A1 DE3200645 A1 DE 3200645A1 DE 19823200645 DE19823200645 DE 19823200645 DE 3200645 A DE3200645 A DE 3200645A DE 3200645 A1 DE3200645 A1 DE 3200645A1
Authority
DE
Germany
Prior art keywords
sounds
signals
sound
voiced
unvoiced
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
DE19823200645
Other languages
English (en)
Other versions
DE3200645C2 (de
Inventor
Koichi Osaka Omura
Hiroyoshi Hirakata Yuasa
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Panasonic Electric Works Co Ltd
Original Assignee
Matsushita Electric Works Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Matsushita Electric Works Ltd filed Critical Matsushita Electric Works Ltd
Priority to DE3249698A priority Critical patent/DE3249698C2/de
Priority to DE19823200645 priority patent/DE3200645A1/de
Publication of DE3200645A1 publication Critical patent/DE3200645A1/de
Application granted granted Critical
Publication of DE3200645C2 publication Critical patent/DE3200645C2/de
Granted legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Description

PRINZ, BUNKE":&.-PPcR:TNER.
jropea
Patentanwälte · European Patent Attorneys München «~ r- Stuttgart
MATSUSHITA ELECTRIC WORKS, LTD. 12. Januar 1982
1048, Oaza-Kadoma, Kadoma-shi,
Osaka 571, Japan
Unser Zeichen: M 1521
Verfahren und Vorrichtung zur Spracherkennung
Die Erfindung bezieht sich auf ein Verfahren und eine Vorrichtung zur Spracherkennung, wobei durch phonetische Analyse gesprochener Nachrichten Steuersignale für die Steuerung des Betriebs gesteuerter Maschinen oder Geräte, beispielsweise eines Massagegeräts, einer automatischen Tür oder dergleichen, erzeugt werden.
Für ein solches Verfahren und eine solche Vorrichtung ist aus der US-PS 3 94 6 157 eine Methode bekannt, bei der zeitliche Schwankungen der Sprachenergie E der mittels eines Mikrophons erfaßten Nachricht in einem vorbestimmten Frequenzband (200 bis 3400 Hz) gemessen werden, dann die zeitliche Ableitung dE/dt der zeitlichen Schwankungen der Energie E bestimmt werden und dann zusätzlich die Energieverteilung E im Frequenzband von 200 bis 800 Hz, die Energieverteilung E^ im Frequenzband von 800 bis 1600 Hz und die Energieverteilung E1, im Frequenzband von 1600 bis 3400 Hz gemessen werden. Wenn die Energie E vorhanden ist, während der Impuls der Ableitung dE/dt niedrig ist und ein hoher Impuls der Energie-
Schw/Ma
Verteilung E vorhanden ist, wird der Klang als /S/ unterschieden, also als ein stimmloser Reiblaut. Wenn die Energie E vorhanden ist, während der Impuls der Ableitung dE/dt hoch ist und ein hoher Impuls in der Energieverteilung E„ vorhan-
. den ist; wird der Klang als /T/ unterschieden, d.h. als stimmloser Sprenglaut. Wenn die Energie E vorhanden ist und auch in der Energieverteilung EM ein hoher Impuls vorhanden ist, wird der Klang als /A/ unterschieden, d.h. als stimmhafter mittlerer Vokal. Bei Anwesenheit der Energie E und eines hohen Impulses in der Energieverteilung E wird der Klang als /O/ unterschieden, d.h. als stimmhafter tiefer Vokal. Außerdem wird der Klang als /I/ unterschieden, also als stimmhafter hoher Vokal, wenn die Energie E vorhanden ist und die Energieverteilungen En und E„ gleichzeitig einen hohen Impuls
D ri
enthalten. Diese Unterscheidungen werden in einer ersten Logikschaltung ausgeführt, und der Inhalt der gesamten gesprochenen Nachricht wird durch Vergleich der Ausgangssignale der ersten Logikschaltung mit einer Codetabelle in einer zweiten Logikschaltung erkannt. In dieser Anordnung wird je- : doch eine Differenzierschaltung benötigt, und es gilt,, daß zum Erkennen eines nasalen Konsonanten /N/, einer geflüster- , ten Nachricht oder dergleichen die Energie der gesprochenen Nachricht in jedem einer größeren Anzahl von Frequenzbändern
gemessen werden muß I 'Das bekannte Verfahren war daher in mancher Hinsicht nachteilig. Wenn die gesprochene Nachricht in einem aus mehreren Wörtern bestehenden Satz vorliegt, konnte sie mittels dieses Verfahrens nicht behandelt werden.
Mit Hilfe der Erfindung sollen daher ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wodurch in einer gesprochenen Nachricht enthaltene, durch stimmhafte oder stimmlose Laute gebildete Phoneme unterschieden werden können, und wodurch für den Fall, daß nur stimmhafte Laute vorhanden sind, die Inhalte der Nachricht mit Hilfe von nur vier Signalen erkannt werden können, die erhal-
COPY
---■•■r^j
ten werden können, indem unterschieden wird, ob die Laute offene oder geschlossene Klänge sind.
Ferner sollen mit Hilfe der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird und mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangs-Signalen der Filterbänke unterschieden wird, ob die Nachrieht aus stimmhaften oder stimmlosen Lauten besteht und ob es sich im Fall von stimmhaften Lauten um offene oder geschlossene Klänge handelt.
Ferner sollen mittels der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, und von den mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der Filterbänke erhaltenen Signalen werden die Stimmhaftlaut- und die Stimmloslautsignale, die Signale stimmhafter oder stimmloser Laute enthalten, auf der ersten Rangebene behandelt, während die Signale, die Signale offener oder geschlossener Laute enthalten, auf der zweiten Rangebene behandelt werden, damit der Erkennungsvorgang schnell durchgeführt wird.
Weiterhin sollen mit Hilfe der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, und von mittels Subtraktionen zwischen jeweiligen Ausgangssignalen der Filterbänke erhaltenen Signalen werden die Signale für stimmhafte und stimmlose Laute auf der ersten Rangebene in drei Werte umgesetzt, während die Signale für offene und geschlossene Klänge auf der zweiten Rangebene in drei
COPY
Werte umgesetzt werden, wodurch die anschließenden Verarbeitungen einfacher gestaltet werden.
Ferner sollen mit Hilfe der Erfindung· ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, nämlich einer ersten Filtergruppe mit einem Frequenzband von 0 bis 1 kHz, in dem sich die Energieanteile der stimm haften Sprachlaute konzentrieren, und einer zweiten Filterbank mit einem Frequenzband von 2 bis 12 kHz, in dem sich die Energieanteile der stimmlosen Sprachlaute konzentrieren; mi Hilfe einer Subtraktion zwischen jeweiligen Ausgangssignalen der ersten und zweiten Filterbänke werden Signale für stimmhafte und stimmlose Laute erzeugt, und es werden Signale für stimmhafte, stimmlose und stumme Sprachlaute erzeugt, wenn die Signale für stimmhafte und stimmlose Sprachlaute einen vorbestimmten Wert überschreiten, kleiner als ein weiterer vorbestimmter Wert sind bzw. zwischen den beiden vorbestimmten Werten liegen; diese drei Signale werden mit zuvor gespeicherten Bezugsmustern verglichen, so daß der Inhalt der gesprochenen Nachricht erkannt werden kann.
Mit Hilfe der Erfindung sollen ferner ein Verfahren und eine " Vorrichtung zur Spracherkennung geschaffen werden, wobei die jeweiligen Längen der obengenannten drei Signale, d.h. der Signale für stimmhafte, stimmlose und stumme Sprachlaute, gemessen werden und vorhandene Muster der drei Signale sowie Muster der gemessenen Längen mit Bezugsmustern verglichen werden, damit die Erkennungsgenauigkeit verbessert wird.
Außerdem sollen mittels der Erfindung ein Verfahren und eine : Vorrichtung zur Spracherkennung geschaffen werden, wobei zur richtigen Erkennung einer gesprochenen Nachricht unabhängig von der Anwesenheit oder der Abwesenheit eines Signals für
COPY
einen stimmlosen Laut im Anschluß an ein Signal für einen
stummen Laut ein Bezugsmuster, in dem das Signal für einen
stimmlosen Laut folgt, sowie ein Bezugsmuster, in dem das
Signal für einen stimmlosen Laut nicht folgt, im Hinblick
auf ein Bezugsmuster mit Signalen für stumme Laute erzeugt
werden, wodurch jeder auf phonetische Unterschiede zwischen
einzelnen Sprechern und dergleichen in der gesprochenen
- -- ϊΐ Nachricht zurückzuführende Einfluß eliminiert werden kann ' C und die allgemeine Anwendbarkeit des Verfahrens und der Vor- J richtung gewährleistet werden kann. jj
Mit Hilfe der Erfindung sollen ferner ein Verfahren und eine :■!
Vorrichtung zur Spracherkennung geschaffen werden, wobei eine '<
.i gesprochene Nachricht mehreren Filterbänken mit jeweils unter-
schiedlichen Durchlaßfrequenzbändern zugeführt wird, nämlich
einer ersten Filterbank, die ein Frequenzband von 0 bis 500 Hz
durchläßt, in dem die Energieanteile mittlerer und offener
Klänge in stimmhaften Lauten konzentriert sind, sowie eine
zweite Filterbank, die ein Frequenzband von 0,5 bis 1 kHz
durchläßt, in dem die Energieanteile mittlerer und geschlossener Klänge in stimmhaften Lauten konzentriert sind; Signale . j?
für offene und geschlossene Klänge werden mit Hilfe von Sub- Ji
ί-traktionen zwischen jeweiligen Ausgangssignalen der beiden ,; Filterbänke erhalten, und Signale für offene, geschlossene und stumme ίί
Klänge werden abhängig davon erzeugt, daß die Signale für ,;
offene und geschlossene Klänge einen vorbestimmten Wert über- ^
schreiten, kleiner als ein weiterer vorbestimmter Wert sind {?
oder zwischen den beiden vorbestimmten Werten liegen; die '--
drei Signale werden mit zuvor gespeicherten Bezugsmustern f
verglichen, damit der Inhalt der gesprochenen Nachricht er- '■
kannt wird. ■ j:
Außerdem sollen mit Hilfe der Erfindung ein Verfahren und eine
Vorrichtung zur Spracherkennung geschaffen werden, wobei die ]
Längen der obigen drei Signale, d.h. der Signale für offene, ;·
geschlossene und stumme Klänge, gemessen und vorhandene Muster \ er drei Signale sowie Muster der Längen jeweils mit Bezugsmustern \
verglichen werden, damit die Erkennungsgenauigkeit verbessert wird.
Weiterhin werden mit Hilfe der Erfindung ein Verfahren und : eine Vorrichtung zur Spracherkennung geschaffen, wobei eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, nämlich -': einer ersten Filterbank mit einem Frequenzband von 0 bis 1 kHz, in dem die Energieanteile stimmhafter Laute konzentriert sind, einer zweiten Filterbank mit einem Frequenzband von 2 bis 12 kHz, in dem die Energieanteile stimmloser Laute konzentriert sind, einer dritten Filterbank mit einem Frequenzband von 0 bis 500 Hz, in dem die Energieanteile offener Klänge stimmhafter Laute konzentriert sind, und einer vierten Filterbank mit einem Durchlaßband von 0,1 bis 1 kHz, in dem die Energieanteile geschlossener Klage stimmhafter Laute konzentriert sind; Signale für stimmhafte und stimmlose Laute werden mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der ersten und zweiten Filterbank erhalten, so daß Signale für stimmhafte, stimmlose und stumme Laute abhängig ; davon erzeugt werden, ob die Signale für stimmhafte und stimmlose Laute einen vorbestimmten ersten Wert überschreiten, '> kleiner als ein vorbestimmter zweiter Wert sind oder zwischen ■ den beiden ersten und zweiten Werten liegen; Signale für | offene und geschlossene Klänge werden mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der dritten und ; vierten Filterbank erzeugt, so daß Signale für offene, geschlossene und stumme Klänge jeweils abhängig davon gebil- j det werden, ob die Signale für offene und geschlossene Klänge einen vorbestimmten dritten Wert überschreiten, kleiner als ein vorbestimmter vierter Wert sind oder zwischen dem dritten und vierten Wert liegen; ein weiteres Signal für | offene Klänge wird erzeugt, wenn das Signal für stimmhafte Laute und das Signal für offene Klänge gleichzeitig vorhanden sind; ein weiteres Signal für geschlossene Klänge wird erzeugt, wenn das Signal für stimmhafte Laute und das Signal für geschlossene Klänge gleichzeitig vorhanden sind; ein
COPY
,M- ■
weiteres Signal für mittlere Klänge wird erzeugt, wenn das
Signal für stimmhafte Laute und das Signal für stumme Klänge
gleichzeitig vorhanden sind; als Ergebnis wird der Inhalt
der gesprochenen Nachricht dadurch erkannt, daß die fünf
Signale, nämlich das für offene Klänge, das für geschlossene
Klänge, das für mittlere Klänge, das für stumme Laute und
das für stumme Klänge mit zuvor gespeicherten Bezugsmustern .- Yi verglichen wird. Das zu schaffende Verfahren und die zu ~"
schaffende Vorrichtung zur Spracherkennung sollen so ausgestaltet sein, daß die fünf Signale nacheinander mit dem Be- j: zugsmuster verglichen werden. ' /.-
Bei dem zu schaffenden Verfahren und der zu schaffenden Vorrich- i--
tung zur Spracherkennung sollen die fünf Signale ebenso wie \
ihre jeweilige Dauer nacheinander mit den Bezugsmustern ver- *
glichen werden. :
I Die Erfindung wird nun unter Bezugnahme auf die Zeichnung ,-]
beispielshalber erläutert. Es zeigen: \
Fig. 1 ein Blockschaltbild eines Systems zur Erkennung von :"?. Phonemeleme.nten in. einer gesprochenen Nachricht unter ;'j Verwendung »der Erfindung, ' "
■ - H
Fig. 2 eine als Blockschaltbild dargestellte Aus führungs form }j einer Erkennungsvorrichtung nach der Erfindung, j
Fig. 3 ein.Frequenzspektrum eines Beispiels einer mit Hilfe j
der Erfindung zu behandelnden gesprochenen Nachricht, i
wobei die Nachricht /Senakaosasure/ eines japanischen .\
Satzes lautet, .;
Fig. 4 ein Diagramm mit Signalen V für stimmhafte Laute und
Signalen UV für stimmlose Laute, wenn die Nachricht ,·
/Senakaosasure/ von der Erkennungsvorrichtung von Fig. 2 ·\
empfangen wird, wobei die gleichen Signale V und UV auch COPY
in den anderen Ausführungsformen erzeugt werden, \
Fig. 5 ein Blockschaltbild einer weiteren Ausführungsform der Erkennungsvorrichtung nach der Erfindung,
Fig. 6 ein Diagramm mit Signalen VO und VC für offene und geschlossene Klänge, die erzeugt werden, wenn die gesprochene Nachricht /Senakaosasure/ die Ausführungsform von Fig. 5 erreicht, wobei die Signale V und UV die gleichen wie in Fig. 4 sind,
Fig. 7 ein Flußdiagramm eines Erkennungsverfahrens nach der Erfindung entsprechend der Erkennungsvorrichtung von Fig. 2,
Fig. 8 ein Flußdiagramm einer weiteren Ausführungsvorm des Verfahrens nach der Erfindung entsprechend Fig. 5,
Fig. 9 bis 12
Flußdiagramme weiterer Ausführungsbeispiele des Verfahrens nach der Erfindung, wobei die Figuren 9 und 11 für Fig. 2 und die Figuren 10 und 12 für Fig. 5 gelten,
Fig. 13 und 14
Blockschaltbilder weiterer Ausführungsformen von Erken-! nungsvorrichtungen nach der Erfindung, ■
Fig. 15 bis 18 :-
Flußdiagramme weiterer Ausführungsbeispiele des erfin-; dungsgemäßen Verfahrens, wobei die Figuren 15 und 17 für die Vorrichtung von Fig. 13 und die Figuren 16 und 18 für die Vorrichtung von Fig. 14 gelten,
Fig. 19 ein Schaltbild einer weiteren Ausführungsform der Vor-■ richtung von Fig. 13 zur Erzeugung notwendiger Signale aus Signalen für stimmhafte und stimmlose Laute,
COPY
- /9Γ" -
wobei "V/UV" der nur durch stimmhafte Laute V, stimmlose Laute UV und stumme Laute S gekennzeichnete Fall ist, "V(D" bis "V(4)" speziellere Muster jeweiliger stimmhafter Laute V in der Nachricht bedeuten, von einem Kreis umgebene Ziffern an den jeweiligen Wegen Sprechhäufigkeiten fü-r den Fall von aufeinanderfolgenden fünf Sprechvorgängen angeben, die zeitliche Länge der jeweiligen Kästchen normierte Längen von Klängen angeben und
Fig. 20 bis 22
Diagramme zur Erläuterung der Wirkungsweise der Schaltung von Fig. 19, - ■.
Fig. 23 ein Schaltbild eines weiteren Ausführungsbeispiels ; der Vorrichtung von Fig. 14 zur Erzeugung notwendiger Signale aus Signalen für stimmhafte und stimmlose Laute : jj
Ij und aus Signalen für offene und geschlossene Klänge, 1
wobei die Arbeitsweise dieser Ausführungsform in j
Fig. 22 dargestellt ist,
Fig. 24 bis 26
Schaltbilder weiterer Ausführungsbeispiele der Vorrichtung von Fig. 14, wobei die Figuren 25A bis 25C Diagramme zur Erläuterung der Wirkungsweise der Schaltung von Fig. 2 4 sind,
Fig. 27A bis 27E
Flußdiagramme für weitere Ausführungsbeispiele des Erkennungsverfahrens nach der Erfindung, h
Fig. 2 8 ein Diagramm zur genaueren Erläuterung der Vorgänge : _,
H bei den in den Figuren 27C und 27D dargestellten jj Verfahren bei Verwendung der gesprochenen Nachricht /Senakaosasure/,
Fig. 2 9 schematische Phonemmuster der Nachricht /Senakaosasure/,
schraffierte Abschnitte jeweilige Perioden stummer Laute S und mittlerer Klänge VM am Übergang von einem Phonem zum anderen bedeuten, "
Fig. 30 eine erläuternde Darstellung der Bezugsmustererzeugung nach der Erfindung, *■"- \
Fig. 31 ein Flußdiagramm zur genauen Erläuterung eines .Teils * des Schritts zur Erzeugung der Bezugsmuster von Fig. 30 nach der Erfindung,
Fig. 32A bis 32C
erläuternde Darstellungen zum Flußdiagramm von Fig. 31 und
Fig. 33 ein Flußdiagramm mit weiteren Einzelheiten eines Teils des Schritts zur Bezugsmustererzeugung von Fig. 30. :
Die Erfindung wird anschließend im Zusammenhang mit den in ! der Zeichnung dargestellten bevorzugten Ausführungsbeispielen t schrieben, doch sollte sie dadurch nicht nur auf diese Ausführung beispiele beschränkt werden,, sondern alle Abwandlungen, A'nderur gen und äquivalente Ausführungen umfassen, die im Rahmen der · \ Ansprüche möglich sind. - i:
Unter Bezugnahme auf das in Fig. 1 dargestellte System zur ϊ Erkennung von Phonemelementen einer gesprochenen Nachricht nacl· der Erfindung soll eine von einem Sprecher gesprochene Nach- ■ rieht dadurch erkannt werden, daß in selektiver Weise die in \ der gesprochenen Nachricht enthaltenen Phoneme P in stimmhafte Laute V und in stimmlose Laute UV (STEP (P->-V/UV) ) getrennt werde] die stimmlosen Laute UV in Reiblaute F und Sprenglaute PL(STEP(UV+F/PL)) unterteilt· werden und die stimmhaften Laute' V in offene Klänge VO, d.h. Klänge mit hoher Energie des erste: Formanten, und in geschlossene Klänge VC, d.h. in Klänge.mit i
BAD ORIGINAL
Vr -
■ Us
niedriger Energie im ersten Formanten (STEP (V-»-VO/VC) ) unter- : teilt werden.
In der in Fig. 2 dargestellten ersten Ausführungsform der Erfindung werden Tasten eines Tastenfeldes 1 betätigt, und ein Startbefehl zum Schreiben von Bezugsmustern wird anfänglich in einen Betriebsspeicher RAM3 über eine Busleitung 2 ' .'· eingespeichert. Wenn ein in einem Computer CPU4 ausgeführtes Programm den Vorgang des Schreibens des Bezugsmusters erreicht, wird der Startbefehl aus dem Betriebsspeicher 3 gelesen, und als Reaktion auf diesen Befehl wird aus einem Programmspeicher R0M5 ein Bezugsmuster-Schreibprogramm gelesen; als Reaktion auf dieses Programm bewirkt der Computer 4 das Abspeichern der über das Tastenfeld 1 , das Mikrophon 6 oder eine andere geeignete Einrichtung gelieferten Bezugsmuster in einem Speicher 7. Im vorliegenden Fall soH auf die über das Mikrophon 6 gelieferten Bezugsmuster Bezug genommen werden. Wenn das Bezugsmuster des als Beispiel verwendeten Ausdrucks "Senakaosasure" (der dem Ausdruck "Massiere den Rücken") entspricht, mit dem in Fig. 3 dargestellten Spektrum in das Mikrophon 6 eingegeben wird, wird es durch einen Vor- ; Verstärker 8 geschickt und von einer ersten Filterbank 9 und ' einer zweiten Filterbank 10 aufgeteilt. Die erste Filterbank läßt ein Frequenzband von 0 bis 1 kHz durch, und die zweite Filterbank 10 .läßt .ein Frequenzband von 5 bis 10 kHz durch. Ausgangssignale der ersten Filterbank 9 werden in einem Subtraktionsglied 11 von Ausgangssignalen der zweiten Filterbank 10 subtrahiert, und in einer Mittelungsschaltung 12 erfolgt eine Mittelung, wobei die Ergebnisse die in Fig. 4 dargestellten Signale "stimmhafte Laute" und "stimmlose Laute" sind. Genauer gesagt stammt das Diagramm von Fig. 4 von dem Bezugsmuster, das von den beiden Filterbänken 9 und 10 behandelt worden ist, nachdem es zunächst durch den Vorverstärker 8 und dann durch einen logarithmischen Verstärker 8-1 und einen Wechselstromverstärker 8-2 von Fig. 2 3 verstärkt worden ist. COPY
- vt
. 46
In Fig. 3 ist die Frequenz in kHz an der Abszisse angegeben, und die Energie ist an der Ordinate angegeben; jede Abtastlinie gibt ein Phonemspek.trum bei jeweils 10 ms an. Außerdem sind auch die entsprechenden Phoneme der Nachricht "Senakaosai ■ angegeben. In Fig. 4 sind die Signale V und UV für die stimm-
\ haften Laute bzw. die stimmlosen Laute angegeben, die gemäß '■,
j den Spektren von Fig. 3 erhalten wurden; die den Abtastlinien
: von Fig. 3 entsprechenden Werte sind dabei an der Abszisse au:
getragen, wobei der Kurveriverlauf so ausgeführt ist, daß er den jeweiligen Zuständen entspricht, bei denen die Abtastung
- stimmhafte Laute zeigen (d.h. Werte über einem vorbestimmten
ersten Wert auf der positiven Seite haben) oder stimmlose Lau zeigen (d.h. Werte unterhalb eines vorbestimmten zweiten Wert auf der negativen Seite haben) . Die Signale V und UV für stini lose bzw. stimmhafte Laute werden einem A/D-Umsetzer 13 über die Mittelungsschaltung 12 zugeführt, damit sie digitalisiert werden, und sie werden dann über E/A-Anschluß 14 in den Speie 7 eingegeben. Auf diese Weise wird der Schreibvorgang der Bezugsmuster beendet, jedoch können durch den gleichen Vorgar auch weitere Bezugsmuster in den Speicher 7 geschrieben werde
Als nächstes., werden Vergleichsvorgänge der gesprochenen Nachricht mit deja Bezugsmustern, d.h. das Erkennen der gesprocher Nachricht, erläutert. Wenn der Computer 4 gemäß dem im Progrc speicher 5 gespeicherten Steuerprogramm mit dem Erkennen eine gesprochenen Nachricht befaßt ist (was durch Betätigen der · Tasten des Tastenfeldes 1 erreicht werden kann) und die ge- j sprochene Nachricht beispielsweise der oben angegebene Ausdri "Senakaosasure" in das Mikrophon 6 eingegeben wird, wird diei Nachricht der ersten Filterbank 9 und der zweiten Filterbank über den Vorverstärker 8 zugeführt. In der gleichen Weise wi< beim Schreiben der Bezugsmuster wird die gesprochene Nachric] durch den A/D-Umsetzer 13 digitalisiert und in einem Sprachnachrichtenspeicher 15 über den E/A-Anschluß 14 abgespeicher· Im Anschluß daran vergleicht der Computer 4 nacheinander die
BAD ORIGINAL
- ,13 -
im Speicher 15 enthaltene gesprochene Nachricht abhängig von
dem im Programmspeicher 5 enthaltenen Erkennungsprögramm mit
den im Speicher 7 gespeicherten Bezugsmustern beispielsweise ί
bezüglich jeder Abtastlinie. *;
■ ■ ■ ■ ■ ' ' H
Nach Beendigung des Vorgangs zum Erkennen der gesprochenen ~ |
Nachricht liefert der Computer 4 als Reaktion auf die Erken- ~ .·"- \
nungsergebnisse ein Ansteuersignal über den E/A-Anschluß 14 I
an nachfolgende Baueinheiten, beispielsweise ein Massagegerät \
16. ■ j-
In der in Fig. 2 dargestellten ersten Ausführungsform wird \, die gesprochene Nachricht nur nach Umsetzung in die Signale '\ V und UV für stimmhafte bzw. stimmlose Laute benutzt. In diesem : Fall bleibt die Tendenz dazu bestehen, daß bei einem völlig anderen Befehl, der jedoch die gleiche Anordnung stimmhafter · und stimmloser Klänge hat, eine Fehloperation auftreten kann,
i: wobei es überdies nicht leicht ist, die Anzahl der zu erkennenf den gesprochenen Nachrichten zu vergrößern. Es wird somit eine \
[verbesserte Ausführung der oben erläuterten, in Fig. 2 darge- f
> j
^stellten ersten Ausführungsform anschließend beschrieben. [
Ϋ;1η der in Fig. 5 dargestellten zweiten Ausführungsform der
^ Erfindung ist im Vergleich zur ersten Ausführungsform die
erste Filterbank 9 durch zwei erste Filterbänke 9-1 und 9-2
mit den Durchlaßbändern 0 bis 500 Hz bzw. 0,5 bis 1 kHz und
eine Additionsschaltung 11-1 zum Addieren der jeweiligen
Ausgangssignale der ersten Filterbänke 9-1 und 9-2 ersetzt.
Zusätzlich vorgesehen sind eine Subtraktionsschaltung 11-2
zum Subtrahieren der Ausgangssignale der ersten Filterbank 9-1
von den Ausgangssignalen der anderen ersten Filterbank 9-2,
eine Mittelungsschaltung 12-1 einschließlich einer Integrationsschaltung mit einer Zeitkonstanten von etwa 20 ms zum Mitteln
der Ausgangssignale der Subtraktionsschaltung 12-2 und ein
Multiplexer 17 zum Übertragen von Ausgangssignalen der Mitte-
BAD ORIGINAL
lungsschaltung 12-1 und der.obigen Mittelungsschaltung 12, die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms enthält, zum A/D-Umsetzer 13. Die Subtraktionsschaltung 11 subtrahiert Ausgangssignale der Additionsschaltung 11-1 von Ausgangssignalen der zweiten Filterbank 10, und sie steuert außerdem den Multiplexer 17 über den E/A-Anschluß i 14. Dadurch können Signale VO für offene Klänge und Signale VC für geschlossene Klänge am Ausgang der Mittelungsschaltung :, 12-1 erzeugt werden. Diese Signale VO und VC können gemäß Fig. 6 für den Ausdruck "Senakaosasure" dargestellt werden, der schematisch auch in den Figuren 3 und 4 gezeigt ist. Ebenso wie die Signale V und UV für stimmhafte bzw. stimmlose Laute werden auch die Signale VO und VC für offene bzw. ge- : schlossene Klänge in der Mittelungsschaltung 12-1 gemittelt und über den Multiplexer 17 dem A/D-Umsetzer 13 zugeführt, damit sie durch diesen verarbeitet werden. ;
In der in Fig. 5 dargestellten zweiten Ausführungsform werden die Signale VO für offene Klänge und VC für geschlossene Klänge zusätzlich zu den Signalen V für stimmhafte Laute und UV für stimmlose Laute benutzt, so daß die Vorgänge des Schreibens · der Bezugsmuster und des Vergleichs dieser Bezugsmuster mit ■ der gesprochenen Nachricht sowie die Verarbeitungsvorgänge · jkomplizierter werden, jedoch erg-ibt die größere Anzahl von | Vergleichsinformationen natürlich eine größere Genauigkeit \ bei der Nachrichtenerkennung als im Fall der ersten Ausführung form. Während in der ersten Ausführungsform nur der Trennvor- [
gang STEP(P+V/UV) mit den Signalen V für stimmhafte Laute und. UV für stimmlose Laute gemäß Fig. 1 durchgeführt werden muß, ; kann der Trennvorgang in der zweiten Ausführungsform sowohl gemäß STEP (P+V/UV) und STEP (V+VO/VC) mit den Signalen U für ! stimmhafte Laute und UV für stimmlose Laute bzw. für die Signa le VO für offene Klänge und VC für geschlossene Klänge durchge führt werden. In -der ersten Ausführungsform ist somit die ange ordnete Reihenfolge der stimmhaften und stimmlosen Laute, ein I
BAD ORIGINAL *
-49- ■ ■ I
. . ■ ■ ί
Erkennungselement, während in der zweiten Aus führ ungs form j* die angeordneten Reihenfolgen der stimmhaften und stimmlosen Laute sowie der offenen und geschlossenen Klänge als Erkennungselemente dienen. . . "
Wie die oben beschriebenen ersten und zweiten Ausführungsformen arbeiten, wird nun unter Bezugnahme auf die Flußdiagramme der Figuren 7 und 8 genauer erläutert.
Fig. 7 zeigt die Arbeitsweise der ersten Ausführungsform. Beim · Schreiben der Bezugsmuster werden durch das Mikrophon erhaltene ■ gesprochene Standardnachrichten verstärkt und in Signale V für ; stimmhafte Laute und UV für stimmlose Laute umgesetzt; diese '. Signale werden vom A/D-Umsetzer digitalisiert, und sie werden als die Bezugsmuster über den links liegenden Weg im Speicher abgespeichert. Beim Erkennen der von einer Person gesprochenen Nachricht wird die Schaltung auf den rechten Weg umgeschaltet, ; und die vom Mikrophon empfangene gesprochene Nachricht wird ;, verstärkt und in Signale V für die stimmhaften Laute und UV !r für die stimmlosen Laute umgesetzt; diese Signale werden dann ί;
vom A/D-Umsetzer digitalisiert und über den rechts liegenden ü
Weg einer Erkennungsanordnung abgeführt, also einer Anordnung, y\
in der sie mit den Bezugsmustern der im Speicher abgespeicher- 'J
ten gesprochenen Standardnachrichten verglichen wird. /j
In der Erkennungsanordnung werden die aus dem Speicher gele- j! senen Signale V und UV der gegebenen Nachricht gewöhnlich ί schrittweise miteinander verglichen, und wenn eines der Bezugs- ', muster mit den Signalen V und UV der gegebenen Nachricht übereinstimmt, wird für das nachfolgende Massagegerät oder dergleichen abhängig von dem bestimmten übereinstimmenden Muster sin Steuersignal erzeugt.
Pig. 8 gilt für die Wirkungsweise der zweiten Ausführungsform.
Seim Schreiben der Bezugsmuster werden durch.das Mikrophon
-so-
erhaltene gesprochene Standardnachrichten verstärkt und dann in Signale V für stimmhafte Laute und UV für stimmlose Laute sowie in Signale VO für offene Klänge und VC für geschlossene : Klänge umgesetzt; die Signale V, UV und VO, VC werden vom A/D-Umsetzer digitalisiert und dann über den linken Schaltungszweig in jeden von zwei Speichersystemen abgespeichert. Beim Erkennen der gegebenen gesprochenen Nachricht wird die Schaltungsanordnung auf den rechts liegenden Weg umgeschaltet, Und die vom Mikrophon empfangene Nachricht wird verstärkt und in Signale V für die stimmhaften Laute und UV für die stimmlosen Laute sowie die Signale VO für die offenen Klänge und VC für die geschlossenen Klänge umgesetzt; die Signale V, UV und VO, VC werden jeweils vom A/D-Umsetzer digitalisiert und jeder von zwei Erkennungsvorrichtungen zugeführt. Dabei handelt es ' sich um Anordnungen zum Vergleichen der jeweiligen Signale V, 1 und VO, VC mit in den jeweiligen Speichersystemen gespeicherte] Bezugsmustern. In der Erkennungsanordnung werden die Bezugsmuster aus den Speichersystem ausgelesen, und die Signale V, U' und VO, VC der gegebenen Nachricht werden jeweils gewöhnlich schrittweise miteinander verglichen. Wenn eines der Bezugsmuster mit den Signalen V, UV und VO, VC der gegebenen Nach- ; rieht übereinstimmt,. wird abhängig von dem übereinstimmenden Muster ein Steuersignal für das nachfolgende Massagegerät oder dergleichen erzeugt.
Bei den beiden beschriebenen ersten und zweiten Ausführungsformen wird das Erkennen der Nachricht dadurch ausgeführt, daß die Signale V für die stimmhaften Laute und UV für die stimmlosen Laute oder diese beiden Signale V, UV und die Signale : VO für die offenen Klänge und VC für die geschlossenen Klänge der A/D-Umsetzung unterzogen und mit den Bezugsmustern bezüglich ihres jeweiligen Verlaufs verglichen werden. In weiteren', anschließend zu erläuternden Ausführungsbeispielen werden hinsichtlich des Erkennungsvorgangs Verbesserungen erzielt.
BAD ORieiNAL
-VT-
Bei einer dritten Ausführungsform, die in Fig. 9 dargestellt ist, werden Symbole V für stimmhafte Laute, Symbole UV für ' stimmlose Laute und Symbole S für stumme Laute aus den vom A/D-Umsetzer 13 der ersten oder der zweiten Ausführungsform digitalisierten Signalen V für stimmhafte Laute und Signalen UV für stimmlose Laute erzeugt, wobei das Lautsymbol V entsprechend den einen vorbestimmten Wert überschreitenden digitalisierten Signalen gebildet wird, das Lautsymbol UV entsprechend den unter einem weiteren vorbestimmten Wert liegenden Signalen gebildet wird und das Lautsymbol S entsprechend den zwischen den zwei Werten liegenden Signalen gebildet wird. Der ErkennungsVorgang kann daher einfacher als bei der ersten oder der zweiten Ausführungsform gemacht werden. Außerdem werden die bei dem Symbolbildungsschritt erhaltenen Lautsymbole in der dritten Ausführungsform in einem in Fig. 9 ersichtlichen Formungsschritt so geformt, daß alle Lautsymbole V und UV, die kürzer als ein vorbestimmter Wert sind, zum Lautsymbol S gemacht werden. Wenn die Lautsymbole V hintereinander mit dem Lautsymbol S der kürzeren Dauer in Einfügung neben dem Lautsymbol V mit einer längeren Dauer vorhanden sind, wird dieses spezielle Lautsymbol V-gelöscht, damit diese Symbole im Lautsymbol S repräs^itier.t. werden. Wenn die Lautsymbole UV nacheinander auch mit dem kürzer dauernden Lautsymbol S in Einfügung neben dem langer dauernden Symbol UV vorhanden sind, wird das Lautsymbol S gelöscht, damit die Symbole durch das Symbol UV repräsentiert werden. Nach dem Formungsschritt werden die jeweiligen Längen der geformten Lautsymbole U, UV und S gezählt, und im Anschluß daran wird die gesamte zeitliche Länge der gesprochenen Nachricht von ihrem Anfang bis zu ihrem Ende erhalten. Diese gesamte zeitliche Länge wird gleich dem Wert Tausend gesetzt, und es werden die entsprechenden Verhältnisse der geformten Lautsymbole V, UV und S berechnet. Mit diesem Normierungsschritt für die zeitlichen Längen können alle phonetischen Unterschiede und dergleichen zwischen einzelnen Sprechern der Nachricht zur Verbesserung der Erkennungswirksam-
- ve* -
• 5a-
keit eliminiert werden. Die jeweiligen geformten Lautsymbole und die entsprechenden normierten Längen werden im Speichersystem gespeichert, so daß Bezugsmuster entstehen. Nach Beendigung des Erzeugens oder Lernens von Bezugsmustern wird eine von einer Person gesprochene gegebene Nachricht, die vom Mikrophon empfangen wird, in ebensolcher Weise verarbeitet, und es ; wird ein Vergleich der Bezugsmuster mit den geformten Lautsymbolen und den entsprechenden normierten Längen durchgeführt.
Wie aus Fig. 9 hervorgeht, kann der Längennormierungsschritt weggelassen werden, wenn es erwünscht ist, da die Erkennungsfähigkeit auch bei einer solchen Weglassung aufrechterhalten . wird, was insbesondere dann gilt, wenn die Anzahl der Elemente in der gesprochenen Nachricht begrenzt ist. In der dritten Ausfuhrungsform kann sogar der Längenmeßschritt weggelassen werden, wobei das Erkennen dann ausschließlich mittels der geformten Lautsymbole durchgeführt wird, was die Anordnung beträchtlich und vorteilhaft vereinfacht.
Die Verarbeitung der Signale oder Symbole nach der A/D-Umsetzun wird in der dritten Ausführungsform vom Computer 4 durchgeführt eine Bezugnahme auf F-ig. 2 dient einer ausreichenden Klarstellung eines praktischen Ausführungsbeispiels der Schaltungsan-' : Ordnung dieser Ausführungsform.
In der in Fig. 10 dargestellten vierten Ausführungsform des Ver f ahrens werden wie in der dritten Ausführung von Fig. 5 die Lautsymbole V \ für die stimmhaften Laute, UV für die stimmlosen Laute und S für die stumme Laute ebenso wie in der dritten Ausführungsform aus den im A/D-Umsetzer digitalisierten Signalen V für die stimmhaften Laute und UV für die stimmlosen Laute gebildet, und die Klangsymbole VO für die offenen Klänge, VC für die geschlossenen Klänge und VM für. die mittleren Klänge werden jeweils bei der Anwesenheit des Lautsymbols V für stimmhafte Laute aus den digitalisierten Signalen VO für die offenen Klänge und VC für die geschlossenei
BAD
■■-,"Π
Klänge gebildet. Dies bedeutet, daß "i" Gruppen der Klangsymbole VO, VC und VM für jedes "i"-te Lautsymbol V(i) für stimmhafte Laute erzeugt werden. Die Ezeugung der Klangsymbole VO, VC und VM erfolgt so, daß sie jeweils der Periode entsprechen, -in der die digitalisierten Signale VO und VC einen vorbestimmten Wert überschreiten, der Periode entsprechen, in der sie kleiner als ein weiterer vorbestimmter Wert sind, und der Periode entsprechen, in der sie zwischen diesen beiden Werten liegen. Die jeweiligen Symbole werden dann wie in der dritten Ausführungsform die Symbole V, UV und S mittels des Formungsschritts geformt, während bei den Klangsymbolen VO, VC und VM die beiden Symbole VO und VC mit kürzerer Länge als ein vorbestimmter Wert zum Symbol VM gemacht werden, und jedes Symbol VM, das kürzer als der vorbestimmte Wert ist, und das zwischen aufeinanderfolgenden Symbolen VO insbesondere neben dem Symbol VO mit größerer Länge als der vorbestimmte Wert liegt, wird gelöscht und zum Symbol VO gemacht. Jedes Symbol VM mit kürzerer Länge, das zwischen entsprechenden aufeinanderfolgenden Symbolen VC insbesondere neben dem längeren Symbol VC vorhanden ist, wird gelöscht und zum Symbol VM gemacht. Nach dem Formungsvorgang werden die-Längen-der jeweils geformten Symbole V, UV, S, VO, VC und VM gezählt,. worauf der gleiche Norir.ierungsschritt wie bei der dritten Ausführungsform durchgeführt wird. Der Längennormierungsvorgang für die Symbole V, UV und S geht aus der vorangehenden Beschreibung klar hervor, und die Längen der Symbole VO7 VC und VM v/erden bezüglich jedes der Symbole V(i) bestimmt. Somit wird die gesamte zeitliche Länge der jeweiligen Symbole VO, VC und VM für jedes Symbol V(i) auf den Wert Tausend gesetzt,, und es wird ihr Verhältnis zu den jeweiligen Längen der Symbole VO, VC und VM erhalten. Die geformten Symbole und ihre entsprechend normierten Längen werden in den Speichersystemen abgespeichert, damit darin Bezugsmuster entstehen. Nach Beendigung der Erzeugung oder des Lernens der Bezugsmuster wird die von der Person in das Mikrophon gesprochene Nachricht in der gleichen Weise verarbeitet, wie oben erläutert wurde, und ihre geformten Symbole sowie die entspre-
- 20 -
— ι
chend normierten Längen werden mit den gespeicherten Bezugsmustern verglichen. Bei einer genauen Betrachtung dieses Vergleichsvorgangs erfolgt auf einer ersten Rangebene ein Vergleich hinsichtlich der Symbole V,. UV und S, damit eine Gruppe von Bezugsmustern entnommen wird, die für die Nachricht von Bedeutung sind; ebenso wird ein Vergleich bezüglich, der normierten Längen der Symbole V, UV und S durchgeführt, damit eine weitere Auswahl zutreffender Bezugsmuster aus der entnommenen Gruppe erfolgt. Auf einer zweiten Rangebene wird ein Vergleich bezüglich der Symbole VO, VC und VM für die ausgewählten Bezugsmuster durchgeführt, und gleichzeitig erfolgt ein Vergleich hinsichtlich der normierten Längen dieser Symbole VO, VC und VM, damit die am meisten zutreffenden und die sich daran anschließenden nächsten zutreffenden Bezugsmuster entnommen werden. Wenn diese zwei zutreffenden Bezugsmuster keinen entscheidenden Unterschied aufweisen, wird angezeigt, daß eine erneute Eingabe der gesprochenen Nachricht erforderlich ist; wird jedoch ein entscheidender Unterschied angezeigt, wird ein Befehl entsprechend dem am meisten zu- : treffenden Bezugsmuster an das zu steuernde Gerät, beispielsweise das Massagegerät/ abgegeben.
In Fig. 10. ist zu erkennen, daß in der beschriebenen vierten Ausführungsform der Normierungsschritt und außerdem sogar der Längenmeßschritt weggelassen werden kann, wenn dies erwünscht ist.
In der dritten und in der vierten Ausführungsform werden die jeweiligen Signale nach der A/D-Umsetzung in Symbole umgewandelt; in dieser Hinsicht durchgeführte Abwandlungen der ersten und der zweiten Ausführungsform werden nun als fünfte und als sechste Ausführungsform der Erfindung beschrieben. ;
In der in Fig. 11 dargestellten fünften Ausführungsform ist der nach der A/D-Umsetzung in der in Fig. 9 dargestellten drit
BAD ORIGINAL
32C0645
ten Ausführungsform durchgeführte Symbolbildungsschritt für
die Signale V und UV durch einen Codierschritt ersetzt, der
so durchgeführt wird, daß "+1" Abschnitten.der digitalisierten
Signale V und UV über einem vorbestimmten Wert, d.h. stimmhaften Lautabschnitten, entspricht, "-1" Abschnitten dieser
Signale unterhalb eines weiteren vorbestimmten Werts, d.h.
stimmlosen Lautabschnitten, entspricht, und "0" Abschnitten :
dieser Signale zwischen den zwei Werten, d.h. stummen Lautabschnitten, entspricht. Bei dem auf das Codieren folgenden
Formungsschritt werden die " + 1" und "-1 " entsprechenden Signale, /"; die kürzer als der vorbestimmte Wert sind, zu "0" gemacht,
Signale entsprechend "0" mit einer kürzeren Länge zwischen ·" aufeinanderfolgenden " + 1 "-Signalen neben einem " + 1 "-Signal ': mit längerer Dauer werden gelöscht und zu "+1" gemacht, und
Signale entsprechend "0" mit einer kürzeren Dauer zwischen
jeweils aufeinanderfolgenden "-1"-Signalen neben einem "-1"-Signal mit längerer Dauer werden gelöscht und zu "~1" gemacht.
Die anschließenden Schritte sind die gleichen wie in der dritten ·; Ausführungsform.
In der in Fig. 12 dargestellten Ausführungsform wird der Symbol- ;; bildungsschritt für die Signale V und UV für die stimmhaften ■ '-
bzw. stimmlosen Laute sowie für die Signale VO und VC für die §
offenen bzw. geschlossenen Klänge nach der A/D-Umsetzung zu t.
einem Codierschritt gemacht. Bei diesem Codierschritt werden J
die digitalisierten Signale V und UV ebenso wie in der fünften f Ausführungsform codiert, während die digitalisierten Signale VO
und VC so codiert werden, daß " + 1" den über einem vorbestimmten j"
Wert liegenden Signalabschnitten, d.h. Abschnitten offener ■ Klänge, entspricht, daß "-1" Abschnitten unterhalb eines weite- ■ ren vorbestimmten Werts, d.h. Abschnitten geschlossener Klänge, '.> entspricht, und daß "0" Abschnitten zwischen diesen zwei Werten,
d.h. Abschnitten mittlerer Klänge, entspricht. Der auf das
Codieren folgende Formungsschritt ist der gleiche wie in der.. '" vierten Ausführungsform. , ,
COPY
In den beschriebenen Ausführungsformen 1 bis 6 werden die A/D-Umsetzung, die anschließende Symbolbildung und die Codierung in drei Werte durchgeführt, doch ist es in optimale Weise auch möglich, die A/D-Umsetzung in manchen Fällen unnötig zu machen. Wenn beispielsweise die Erkennungsfähigkeit etwas geringer sein darf als bei der A/D-Umsetzung, kann ein Impulscodierer verwendet werden, wie anschließend erläutert wird. -· -
In der in Fig. 13 dargestellten siebten Ausführungsform der Erfindung ist der in der ersten Ausführungsform von Fig.· 7 verwendete A/D-Umsetzer 13 durch einen Impulscodierer 13-1 ersetzt, damit die erforderlichen Kosten für den Fall reduziert werden, daß eine höhere Erkennungsfähigkeit nicht ge- fordert wird, wie noch zu erkennen sein wird. Im vorliegender Fall werden die Signale so codiert, daß "+1" Abschnitten der Signale V und UV über einem vorbestimmten Wert, d.h. Abschnil ten mit stimmhaften Lauten, entspricht, "-1" stummen Lautabschnitten unterhalb eines weiteren vorbestimmten Werts ent- spricht und "0" stummen Lautabschnitten zwischen diesen beid« Werten entspricht. Dieses Codieren kann im Flußdiagramm von ' Fig. 15 dargestellt werden, wie aus der obigen Beschreibung : erkennen ist», , !
In Fig. 14 ist eine achte Ausführungsform der Erfindung dargi stellt, in der der Multiplexer 17 und der A/D-Umsetzer 13 de: zweiten Ausführungsform von Fig. 5 weggelassen sind und zwischen die Mittelungsschaltungen 12 und 12-1 sowie den E/A- ; Anschluß 14 ein Impulscodierer 13-1 eingefügt ist. Es ist zu erkennen, daß die achte Ausführungsform bei dieser Anordnung die gleiche Wirkung wie die siebte Ausführungsform hat. Das· Codieren wird somit so ausgeführt, daß "+1" den stimmhaften: Lautabschnitten der Signale V und UV über einem vorbestimmte Wert entspricht, "-1" den stimmlosen Lautabschnitten unterha eines weiteren vorbestimmten Werts entspricht und "0" den st
BAD ORIGINAL
- 2-5 -
men Lautabschnitten zwischen diesen zwei Werten entspricht. Wenn stimmhafte Laute vorhanden sind, wird das Codieren außerdem so durchgeführt, daß " + 1" den offenen Klangabschnitten der Signale VO und VC über einem vorbestimmten Wert entspricht,
■ "-1" den geschlossenen Klangabschnitten unterhalb eines vorbestimmten Werts entspricht und "0" den mittleren Klangabschnitten zwischen den zwei Werten entspricht. Dies kann im " Flußdiagramm von Fig. 16 angegeben werden.
Eine neunte Ausführungsform der Erfindung steht im Zusammenhang mit der siebten Ausführungsform. Zusätzlich zur Codierung mit Hilfe des Impulscodierers 13-1 in der siebten Ausführungsform wird gleichzeitig die Anzal der Abtastimpulse gezählt, so daß die Längen der jeweiligen stimmhaften, stimmlosen und stummen Lautperioden ebenfalls gemessen und normiert Werden. Dieses Normieren des gemessenen Längenwerts repräsentiert die jeweiligen Längen in Verhältnissen der jeweiligen stimmhaften, stimmlosen und stummen Lautperioden in bezug auf die Gesamtlänge vom Beginn bis zur Beendigung der gesprochenen Nachricht, wobei die Gesamtzeit beispielsweise auf den Wert Tausend festgelegt--wird. 3ei dieser Darstellung können alle Einflüsse auf den ErkennungsVorgang, die auf verschiedene ' Ankunftsgeschwindigkeiten der Nachrichtensignale aufgrund möglicher phonetischer Unterschiede zwischen einzelnen Spreehern der Nachricht oder dergleichen zurückzuführen sind, beseitigt werden, und die Erkennungsgenauigkeit kann weiter verbessert werden. Da die Erkennungsmerkmale im vorliegenden Fall von der Darstellung mit stimmhaftem, stimmlosem und stummem Laut auf die Darstellung mit ihrer Länge erweitert werden, kann die Erkennungswirksamkeit weiter verbessert werden. Da der Erkennungsvorgang nach einer Bewertung der Gültigkeit und Ungültigkeit der Darstellung mit stimmhaften, stimmlosen und stummen Lauten mittels der Längen durchgeführt werden kann, kann auch eine wirksame Verkürzung der für den Erkennungsvorgang erforderlichen Zeit erreicht werden. Der spezielle Vorgang kann
-S8-
durch das Flußdiagramm von Fig. 17 veranschaulicht werden.
Eine zehnte Ausführungsform der Erfindung hängt von der achten Ausführungsform ab. Zusätzlich zur Codierung mittels des Impulscodierers 13-1 im Fall der vierten Ausführungsform wird gleichzeitig die Anzahl der Abtastimpulse gezählt, wodurcl die Längen der jeweiligen stimmhaften, stimmlosen und stummen Lautperioden sowie der jeweiligen offenen, geschlossenen und stummen Klangperioden oder der jeweiligen offenen, geschlossenen, mittleren und stummen Klangperioden gemessen werden. Die gemessenen Längenwerte werden im wesentlichen ebenso wie im Fall der neunten Ausführungsform normiert. Mit Bezug auf die neunte Ausführungsform ist zu erkennen, daß mit dieser zehnten Ausführungsform die gleiche Wirkung wie mit der neunten Aus- ■ führungsform erreicht werden kann. Die Arbeitsweise ist in diesem Fall im Flußdiagramm von Fig. 18 dargestellt.
In den beschriebenen Ausführungsbeispielen 1 bis 10 werden die erwünschten Signale V für stimmhafte Laute und UV für stimm- ' lose Laute sowie die Signale VO für offene Klänge und VC für geschlossene Klänge durch Subtraktionsvorgänge zwischen den : Ausgängen der Filterbänke erhalten, so daß eine wirksame Rausc eliminierung erreicht werden kann. Wenn jedoch im Anschluß an den Vorverstärker 8 eine Serienschaltung aus einem logarithmischen Verstärker und einem Wechselstromverstärker eingefügt wird, kann das Rauschen ebenfalls gut eliminiert werden. In der Praxis gibt es keine Probleme, wenn der logarithmische Ver stärker zwischen den Vorverstärker 8 und den Differenzverstärfc 11 (oder die Differenzverstärker 11 und 34 in der später beschriebenen Fig. 23) eingefügt wird. Weitere Erläuterungen wei den auf die Erläuterungen der in den Figuren 19 und 23 dargestellten Ausführungsformen beschränkt, da Einzelheiten der ' Anordnung ohne weiteres im Hinblick auf die Figuren 2, 5, 13 und 14 verständlich sind.
BAD ORIGINAL
Die Erfindung wird nun anhand weiterer Ausführungsbeispiele erläutert. · ..
Fig. 19 zeigt das Schaltbild einer praktischen Anordnung der in Fig. 13 dargestellten Ausführungsform, wobei eine vom Mikrophon 6 empfangene gesprochene Nachricht X(t) durch den Vorverstärker 8, den logarithmischen Verstärker 8-1 und den. Wechselstromverstärker 8-2 zu Signalen LOGX(t) umgeformt, und diese Signale werden den Eingängen der ersten Filterbank 9 und der zweiten Filterbank 10 zugeführt. Als Beispiele für die gesprochene Nachricht X(t) sind /a/ und /u/ in den Figuren 2QA bzw. 2OB dargestellt. In Fig. 2OA ist ein Signal LOGX(t) für /a/ in einer logarithmisch umgesetzten Kurve ebenfalls dargestellt; Fig. 2OB zeigt ein ebensolches Signal für /u/. Die erste Filterbank 9 besteht aus einer Serienschaltung aus einem Filter, die eine Frequenzkomponente unter 1 kHz durchläßt, einer Gleichrichterschaltung sowie einer Mittelungsschaltung, die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms enthält; die zweite Filterbank 10 enthält eine Serienschaltung aus einem Filter, das eine Frequenzkomponente von 5 bis 12 kHz durchläßt, einer Gleichrichterschaltung und einer Mittelungsschaltung mit einer Integrationsschaltung mit einer Zeitkonstanten von etwa 1 ms. In Fig. 21A sind die Frequenzspektren von /s/ (stimmloser Laut) und /a/ (stimmhafter Laut) als Beispiel für die gesprochene Nachricht X dargestellt, während Fig. 21B die Frequenzspektren ihrer logarithmisch umgesetzten Signale LOGX zeigt. Aus dem Vergleich der Figuren 21A und 21B ist zu erkennen, daß mittels der Erfindung die anschließenden Verarbeitungsvorgänge durch eine logarithmische Umsetzung vereinfacht werden können, während der Erkennungsgrad beibehalten wird. Die Ausgangssignale der ersten Filterbank 9 werden von den Ausgangssignalen der zweiten Filterbank 10 im Differenzverstärker 11 subtrahiert, und die Ausgangssignale dieses Differenzverstärkers werden von der Mittelungsr. schaltung 12 gemittelt, die eine Integrationsschaltung mit
tf *- -
-GO-
einer Zeitkonstanten von 10 ms enthält. Die Ausgangssignale werden dann Diskriminatorschaltungen 18 und 19 als gemittelte Stimmhaft- und Stimmlos-Signale y(t) zugeführt. Die Diskrimrna torschaltung liefert mit dem Empfang .jedes in einem Taktimpuls generator 20 erzeugten Taktimpulses einen Abtastimpuls C (mit einer Periode von 8 ms), doch gibt sie nur dann ein Ausgangs- \ signal mit hohem Wert ab, wenn die Signale für stimmhafte und stimmlose Laute kleiner als ein Bezugswert R sind. Die Period der Abtastimpulse C wird mittels einer vom E/A-Anschluß 14 festgelegten CR-Zeitkonstanten richtig eingestellt, was bedeutet, daß die Ausgangsfrequenz des Taktimpulsgenerators von ein Frequenzteiler geteilt und dann einer richtigen Periodeneinste lung an einer Abgriff-Schaltung abhängig von CR am E/A-Anschlv 14 unterzogen wird. Die Diskriminatorschaltung 19 liefert bei. jedem Abtastimpuls C aus dem Taktimpulsgeneratof 20 ein Ausgangssignal mit hohem Wert, wenn die Signale V für stimmhafte Laute und UV für stimmlose Laute größer als der Bezugswert Rv sind. Als Reaktion auf den vom Taktimpulsgenerator 20 gelieferten Abtastimpuls C wird eine retriggerbare, monostabile i Impulsgeneratorschaltung in der jeweiligen Diskriminatorschaltung 18 und 19 ausgelöst (wobei die Dauer eines Ausgangsimpuli der monostabilen Schaltung 1,5 mal größer als die Abtastperioc ist und mittels einer Widerstandsumschaltschaltung im Takt-, ■
impulsgenerator 20 abhängig von CR eingestellt ist), damit ■ Signale V und UV erzeugt werden. Fig. 22 erklärt die Wirkun· weise für den Fall, daß die Signale V und UV aus den Signal x(t) entsprechend einer gesprochenen Nachricht /seQto/ unter j Anwendung der Abtastimpulsfolge C erzeugt werden. In der For mungsschaltung 21 wird aus den Signalen V, und UVft in einer i Differenzschaltung ein bezüglich eines Signals S , das einen stummen Klang repräsentiert, negiertes Signal erzeugt, und' dieses negierte Signal wird dazu benutzt, in einer NAND- ! Schaltung die Signale Vp und UVp zu erzeugen, die jeweils einen stimmhaften Laut bzw. einen stimmlosen Laut anzeigen. Das Signal S wird dem Zähler 22 zugeführt, und es löscht ein
BAD ORIGINAL
Zähler 22 an dem Zeitpunkt, an dem es auf einen hohen Wert
ansteigt. Nach dem Löschen und während des hohen Werts des
Signals S zählt der Zähler 22 die Anzahl·- der Abtastimpulse
C , damit die Länge der Periode des stimmlosen Lauts gemessen
wird. Nur wenn der gezählte Wert des Zählers 22 größer als
eine vorbestimmte Zahl wird, wird ein Signal C erzeugt.
Eine Diskriminatorschaltung 2 3 unterscheidet, ob die gespro- f chene Nachricht X(t) empfangen wird oder nicht, und sie liefert [ ein Signal P/N mit hohem Wert abhängig vom Anstieg der Signale ; V und UV auf einen hohen Wert; dieses Ausgangssignal P/N
fällt als Reaktion auf das Ausgangssignal C des Zählers 22.
Dies bedeutet, daß das Ausgangssignal P/N ein Impuls ist,
der am Anfangspunkt der gesprochenen Nachricht X(t) ansteigt
und am Endpunkt abfällt. Außerdem wird ein Zähler 24 gelöscht,
wenn Impulse der Signale V und UV anstiegen, und er zählt :- die Abtastimpulse C in der gleichen Weise wie der Zähler 22, ' , während die Impulse der Signale V und UV einen hohen Wert
haben. Andererseits erzeugt eine Zeitgeberschaltung 25 beim ·. Abfallen der Signale V , UV , P/N und eines vom Taktimpuls- |! generator 20 gelieferten Impulses TM ein Abtastsignal STB. | Der Impuls TM wird von einer Abgriff-Umschaltschaltung der Takt-· <impulsgenerator 20 abhängig von CR-erzeugt, wobei eine gewisse \, Zeitverzögerung bezüglich des Abtastimpulses C wegen der Be- jf" triebszeit des Zählers 22 und der Diskriminatorschaltung 23 ;; vorhanden ist. Als Reaktion auf das Abtastsignal· STB hält - j eine Halteschaltung 26 die Zählergebnisse des Zählers 24
fest, die in einer Vergleichsschaltung 27 mit einem über den 5 E/A-Anschluß gelieferten Signal TR verglichen werden. Das j Signal TR wird mittels einer Bedienungstafel, d.h. mittels t des Tastenfeldes 1, in Abhängigkeit von der Sprechgeschwindig- | keit des Sprechers, d.h. von der- Ankunftsgeschwindigkeit der { gesprochenen Nachricht eingestellt. Das Signal TR ist ein
Bezugswert für die Bestimmung, ob die Phonemkomponente im ,. I Signal UV ein stimmloser Reiblaut V oder ein stimmloser Spreng- ■_
copy i
laut PL ist; es wird dazu benutzt, ein Signal dafür zu erzeugen, daß erkannt wird, daß es sich um den stimmlosen Reib-
laut F handelt, wenn die Dauer, d.h. der gezählte Wert des : Zählers 24, den Wert TR überschreitet, und daß es sich um den stimmlosen Sprenglaut PL handelt, wenn die Dauer oder dei gezählte Wert des Zählers 24 kleiner als TR ist. Das Ergebnis des Vergleichsvorgangs in der Vergleichsschaltung 27 wird einer Symbolbildungsschaltung 28 zugeführt, die ein Signal zur Unterscheidung des stimmhaften Lauts V, des stimmlosen Reiblauts F und des stimmlosen Sprenglauts PL liefert, was abhängig vom Abtastsignal STB und den als Reaktion auf die Signale V und UV von der Zeitsteuerschaltung 25 abgegebener Signalen SV und SU erfolgt. Wenn das Signal V einen hohen Wert hat, wird der Impuls SV von der Zeitsteuerschaltung 25 nach Ankunft des Impulses TM abgegeben und die Symbolbildungs schaltung 28 liefert als Antwort auf das Abtastsignal STB einen dem stimmhaften Laut V entsprechenden Impuls. Wenn das Signal UV einen hohen Wert hat, wird der Impuls SV von der Zeitsteuerschaltung 25 nach Ankunft des Impulses TM abgegebei und die Symbolbildungsschaltung 28 liefert abhängig vom Vergleichsergebnis der Vergleichsschaltung 27 einen den stimmlos Reiblaut F oder den stimmlosen Sprenglaut PL repräsentierend« Impuls. Die Ausgangsssignale V, PL und F der Symbolbildungs-' schaltung 28 haben die Werte "1", "0" und "0" für den Fall ; des stimmhaften Lauts V, die Werte "0", "0" und "1" für den Fall des stimmlosen Reiblauts F und die Werte "0", "1" und "( für den Fall des stimmlosen Sprenglauts PL. Für den Fall des stummen Lauts haben die Signale V, PL und F dagegen die Wert< "0", "0" und "0". Die Ausgangssignale V, PL und F der Diskriminatorschaltung 2 8 werden vom Abtastsignal STB einem speichernden Codierer 29 zugeführt, und von (0,0,0) in (0,0), ve: (1,0,0) in (0,1), von (0,0,1) in (1,0) und von (0,1,0) in (1 umgesetzt, damit sie als binäre Signale DF vorliegen, die da] dem E/A-Anschluß 14 zugeführt werden. Nachdem die binären Signale DF (die in Fig. 19 einschließlich ihrer Lage mit DF.
BAD ORIGINAL
-63-
und DF angegeben sind) vom Abtastsignal aus dem Codierer 29
ausgegeben worden sind/ liefert die Zeitsteuerschaltung 25
an den E/A-Anschluß 14 abhängig von den jeweiligen Signalimpulsen P/N, S , V , UV und TM ein Signal READY, und der \f
Jr Jr Jr -:>*-}
Inhalt der Halteschaltung 26 wird als Impuls PT abgegeben. f
Die andere Zeitsteuerschaltung 30 empfängt die Signale S , β
" Ii
P/N und TM zur Erzeugung von Signalen SS und SRDY. Abhängig ■?
vom Signal SS speichert die Halteschaltung 31 den Inhalt des \ Zählers 22, während das Signal SRDY ein Bereit-Signal ist, ; das die Beendigung der Abgabe des Inhalts der Halteschaltung
31 (ausgedrückt durch ein Signal ST) angibt. !
Der Computer 4 speichert die jeweiligen Signale DF (deren
Inhalt gleich DF und DF ist), PT und ST im Bezugsmusterspeicher 7 oder im Sprachnachrichtenspeicher 15 als Reaktion
auf die Inhalte der Speicher RAM3 und ROM5. Dies bedeutet die
Abspeicherung einer Klassifizierung, die repräsentiert ist
durch das Signal DF des stummen Lauts S, des stimmhaften Lauts ■"' V, des stimmlosen Reiblauts F und des stimmlosen Sprenglauts ΐ PL, durch die vom Signal PT (aus der Halteschaltung 31) des jj stimmhaften Lauts \&, des- stimmlosen Reiblauts F und des stimm- ' ί losen Sprenglauts PL (aus der Halteschaltung 26) repräsen- j tierten Längen sowie durch die Längen des stummen Lauts S ' Ij (aus der Halteschaltung 31). Der Computer CPU4 vergleicht f
dann das Signal DF mit dem entsprechenden Signal der Bezugs- f; muster zum Zweck seiner Erkennung. Die Inhalte des Signals DF | sind im Muster 1 von Fig. 22 durch V, F, PL und S angegeben. J Wenn die DF-Erkennung mit einigen der Bezugsmuster überein- jj
ii stimmt, dann werden die Längen verglichen. Beim Vergleich der
Längen werden vorzugsweise diese Längen zuvor normiert. Wenn
die gesprochene Nachricht mit einem der Bezugsmuster bei dem
Erkennungsvorgang übereinstimmt, wird ein entsprechendes Befehlssignal zur Steuerung eines Geräts, beispielsweise eines Massagegeräts, als Reaktion auf die gegebene gesprochene Nachricht
geliefert. C0PY
In der Ausführungsform von Fig. 1.9 wird die Erzeugung der Signale DF, PT und ST aus den Signalen V und UV in der dargestellten Schaltungsanordnung durchgeführt, jedoch kann dieser Schritt auch im Computer 4 ausgeführt werden. Ein Flußdiagramm dieser Ausführungsform ist bei Bezugsnahme auf die Figuren 15 und 17 offensichtlich, so daß es hier weggelassen ist.
In Fig. 23 ist eine bezüglich der Ausführungsform von Fig. 14 abgewandelte Ausführungsform dargestellt, mit der zusätzlich zu den unter Bezugnahme auf Fig. 19 erklärten Vergleichsvorgängen auch die Signale VO für offene Klänge und VC für geschlossene Klänge verglichen werden können. Die über das Mikrophon 6 erhaltene gesprochene Nachricht X wird im Vorver- ' stärker 8 verstärkt und mittels des logarithmischen Verstärken 8-1 sowie des Wechselstromverstärkers 8-2 in die Signale LOGX umgesetzt; diese Signale werden den Eingängen der ersten Filterbank 9 und der zweiten Filterbank 10 zugeführt. Die erste Filterbank 9 besteht aus einer Serienschaltung eines Filters,5 das eine Frequenzkomponente unter 1 kHz durchläßt, einer Gleichrichterschaltung und einer Mittelungsschaltung, die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms
ί enthält. Die zweite Filterbank besteht ebenfalls aus einer ■ t Serienschaltung aus einem Filter, das eine Frequenzkomponente' von 5 bis 12 kHz durchläßt, einer Gleichrichterschaltung und ; einer Mittelungsschaltung, die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 1 ms enthält. Das Ausgangssigna]
ί der ersten Filterbank 9 wird vom Ausgangssignal der zweiten Filterbank 10 im Differenzverstärker 11 subtrahiert, dessen ; Ausgangssignale von der Mittelungsschaltung 12, die eine Integrationsschaltung mit einer Zeitkonstanten von 10 ms enthält,* gemittelt und als Signale V für die stimmhaften Laute und UV ' für die stimmlosen Klänge in Diskriminatorschaltungen 18 und 19 eingegeben we-rden. Die Diskriminatorschaltung 18 liefert bei jeder Ankunft eines Taktimpulses, d.h. des Abtastimpulses
BAD
3200B4*
- 3-r -
mit der Periode von 8 ms aus dem Taktimpulsgenerator 20 ein |
Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht, | wenn die Signale V und UV kleiner als ein Bezugswert R sind.
Die andere Diskriminatorschaltung 19 liefert ebenfalls bei ?|
jedem Abtastimpuls C aus dem Taktimpulsgenerator 20 ein " f
Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht, - ;i
wenn die Signale V und UV größer als der Bezugswert R sind. <
Als Reaktion auf den Abtastimpuls C arbeiten die retrigger- ;
baren, monostabilen Impulsgeneratorschaltungen (deren Impuls I
eine um 1,5 mal größere Dauer als der Abtastimpuls haben) in f den Diskriminatorschaltungen 18 und 19, und sie erzeugen die
Signale V und UV. Die Formungsschaltung 21 erzeugt aus den ;
Signalen V und UV ein einen stummen Laut repräsentierendes ■-■ negiertes Signal Sp an einer Antivalenzschaltung, und unter
Verwendung dieses negierten Signals Sp erzeugt sie auch an
einer NAND-Schaltung die Signale V und UV , die einen stimmhaften Laut V bzw. einen stimmlosen Laut UV repräsentieren.
Das negierte Signal S wird dem Zähler 22 zugeführt, den sie
an dem Zeitpunkt löscht, an dem das Signal auf einen hohen ;
Wert ansteigt. Nach dem Löschvorgang und während des hohen |
Signalwerts des Signals S zählt der Zähler 22 die Anzahl der |
Abtastimpulse C zur Messung der Länge der Periode des stummen ' ,-;
Lauts, und nur dann, wenn der vom Zähler 22 gezählte Wert über «
einer vorbestimmten Zahl liegt, wird das Signal C erzeugt. I
Die Diskriminatorschaltung 23 unterscheidet, ob die gesprochene ]'
Nachricht X(t) empfangen wird oder nicht, und sie gibt ein ,;
Signal P/N mit hohem Wert abhängig vom Anstieg des Signals V |
und des Signals UVn auf einen hohen Wert ab. Das Ausgangssignal :.
ir (
P/N fällt abhängig vom Ausgangssignal C des Zählers 22, was l
bedeutet, daß das Ausgangssignal P/N ein Impuls ist, der am ;.!
Anfangszeitpunkt der gesprochenen Nachricht X(t) ansteigt und !;
an ihrem Beendigungspunkt abfällt. Der Zähler 24 wird gelöscht, j
wenn die Impulse der Signale V und UV ansteigen, und er zäh-lt H
die Abtastimpulse C ebenso wie der Zähler 22 während der Zeit- :j
periode, in der die Impulse der Signale V und UV einen hohen Wert haben. Andererseits erzeugt die Zeitgeberschaltung 25 ein Abtastsignal STB nach dem Abfall der Signale V-/ UV und P/N. Zusätzlich erzeugt die Zeitgeberschaltung 25 auch Signale SV und SU in Abhängigkeit von den Signalen Vp/ UV und P/N. Der Zählerstand des Zählers 24 wird mit einem über den E/A-Anschluß eingegebenen Signal TR verglichen. 'Dieses Signal TR1 wird an einer Bedienungstafel, d.h. am _ Tastenfeld 1, in Abhängigkeit von der Sprechgeschwindigkeit des Sprechers oder, in anderen Worten, in Abhängigkeit von der Ankunftsgeschwindigkeit der gesprochenen Nachricht eingestellt. Das Signal TR ist außerdem ein Bezugswert, mit dem bestimmt werden kann, ob die Phonemkomponente des Signals UV für den stimmlosen Laut ein stimmloser Reiblaut F oder ein stimmloser Sprenglaut PL ist, und es wird dazu benutzt, ein Signal zu erzeugen, daß angibt, ob der Laut ein stimmloser Reiblaut F ist, wenn die Dauer des Lauts oder der Zählerstand des Zählers 24 über dem Signal TR liegt, oder ein stimmloser Sprenglaut PL ist, wenn die Dauer des Lauts oder : der Zählerstand unter TR1 liegt. Das Vergleichsergebnis der Vergleichsschaltung 26 wird in die Diskriminatorschaltung eingegeben, die ein Signal zur Unterscheidung des stimmhaften Klangs V, des stimmlosen Reiblauts F und des Stimmhaften Sprenglauts"PL in Abhängigkeit von den Signalen SV und SU abgibt, die von der Zeitgeberschaltung 25 in Abhängigkeit von den Signalen Vp und UV vom Abtastsignal STB und vom Vergleichsergebnis der Vergleichsschaltung 26 abgegeben werden. Wenn das Signal V einen hohen Wert hat, gibt die · Zeitgeberschaltung 25 einen Impuls SV ab, und die Diskriminat< schaltung 27 gibt abhängig vom Abtastsignal STB einen Impuls ab, der anzeigt, daß ein stimmhafter Laut V vorliegt. Wenn da; Signal UV einen hohen Wert hat, gibt die Zeitgeberschaltung einen Impuls SV ab, und die Diskriminatorschaltung 27 liefert abhängig vom Vergleichsergebnis der Vergleichsschaltung 26 und vom Abtastsignal STB ebenfalls einen Impuls, der angibt,.
BAD ORIGINAL COPY
daß das Signal ein stimmloser Reiblaut F oder ein stimmloser
Sprenglaut PL ist. Die Ausgangssignale V, PL und F der Diskriminatorschaltung 27 haben somit für den Fall des stimmhaften
Lauts V die Werte "1", "0" und "0", für den Fall des stimmlosen Reiblauts F die Werte "0", "0" und "1", für den Fall des : j stimmlosen Sprenglauts PL die Werte "0", "1" und "0" und für I den Fall des stummen Lauts die Werte "0", "0" und "0". Die " ? Ausgangssignale V, F und PL werden durch das Abtastsignal STB I dem speichernden Codierer 29 zugeführt und von (0,0,0) in \ (0,0), von (1,0,0) in (0,1), von (0,0,1) in (1,0) und von ' \ (0,1,0) in (1,1) umgesetzt, so daß sie in Form eines binären
Signals DF vorliegen und anschließend an den E/A-Anschluß 14 I abgegeben werden. Nachdem das binäre Signal DF (das in Fig. 23 '■; einschließlich der Lage als DF und DF angegeben ist) vom
Codierer 29 durch das Abtastsignal abgegeben worden ist, wird
dem E/A-Anschluß aus der Zeitgeberschaltung 25 abhängig von : den Signalen (P/N, V und UV ein Signal READY abgegeben.
Die vom Vorverstärker 8 verstärkte gesprochene Nachricht X(t) '
i wird den Eingängen einer dritten Filterbank 32 und einer ?
vierten Filterbank „33 über einen im hohen Bereich wirksamen \ Anhebungsverstärke^ 8-3 .mit +6 dB/Oktave zugeführt. Die dritte ' |
Filterbank 32 besteht aus einem eine Frequenzkomponente von '?.
0 bis 0,5 kHz durchlassenden Filter, einer Gleichrichter- I
schaltung und einer Mittelungsschaltung, die eine Integrations- t
schaltung mit einer Zeitkonstanten von etwa 5,5 ms enthält. |
Die vierte Filterbank 33 besteht aus einer Serienschaltung \
eines eine Frequenzkomponente von 0,5 bis 1,0 kHz durchlassen- I
den Filters, einer Gleichrichterschaltung und einer Mittelungs- t
schaltung mit einer Integrationsschaltung mit einer Zeitkonstan- !.
ten von etwa 10 ms. Die Ausgangssignale der dritten Filter- ;*
bank 3 2 werden von einem logarithmischen Verstärker 3 2A loga- ii
rithmisch verstärkt, und sie werden von den Ausgangssignalen }
der vierten Filterbank 33 in einem Differenzverstärker 34 sub- \\
trahiert, die von einem weiterenlogarithmischen Verstärker 33A j
- 3-4- -
ebenfalls logarithmisch verstärkt worden sind. Die Ausgangssignale dieses Differenzverstärkers 34 können mittels der logarithmischen Verstärker 32A und 33A an solche Ausgangssignale angeglichen werden, die für den Menschen hörbar sind. Die Ausgangssignale des Differenzverstärkers werden in einer Mittelungsschaltung 35 gemittelt, die eine Integrationsschaltung mit einer Zeitkonstanten von 20 ms enthält; sie werden ferner Diskriminatorschaltungen 36 und 37 als Signale VO für offene Klänge und VC für geschlossene Klänge zugeführt. Die Diskriminatorschaltung 36 liefert jedesmal dann, wenn der Taktimpuls, d.h. der vom Taktimpulsgenerator 20 erzeugte Abtastimpuls C mit einer Periode von 8 ms, ankommt, ein Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht, wenn die Signale VO und VC kleiner als ein Bezugswert R ist. . Die andere Diskriminatorschaltung 27 liefert mit jedem Abtastimpuls C aus dem Taktimpulsgenerator 20 ebenfalls ein Ausgangs signal mit hohem Wert, was nur dann geschieht, wenn die Signale VO und VC größer als ein Bezugswert R sind. Abhängig von dem vom Taktimpulsgenerator 20 abgegebenen Abtastimpuls Cp werden retriggerbare monostabile Impulsgeneratorschaltungen (bei denen die Dauer des abgegebenen Impulses jeweils 1,5 mal so ; groß wie die Abtastimpulsperiode ist) in den Diskriminatorschaltungen 36»und 37 betätigt, so daß sie Signale VO und VC, abgeben, und aus diesen Signalen erzeugt eine Formungsschaltung 38 in ihrer Antivalenzschaltung stumme Klänge repräsen- ! tierende negierte Signale, und unter Verwendung der negierten Signale werden in einer NAND-Schaltung ein einen offenen Klang VO anzeigendes Signal VOp sowie ein einen geschlossenen Klang : VC anzeigendes Signal VC erzeugt. Diese Signale VO und VC ; werden einem Zähler 3 9 zugeführt, den sie bei ihrem Anstieg löschen. Nach dem Löschen zählt der Zähler 39 die Abtastimpulse C , während die jeweiligen Signale VO und VC einen : hohen Wert haben. Andererseits erzeugt eine Zeitgeberschaltung 40 ein Abtastsignal VSTB beim Abfallen der Signale VO und VC_ Die Zeitgeberschaltung 40 erzeugt auch abhängig von den Signal
BAD
-.69-
νθρ, VCp und TM die Signale SO und SC. Der Stand des Zählers wird in einer Vergleichsschaltung 41 mit einem über den E/AAnschluß eingegebenen Signal TR„ verglichen. Dieses Signal TR wird an der Bedienungstafel, d.h. an der Tastatur 1, in Abhängigkeit von der-Sprechgeschwindigkeit des Sprechers oder, in anderen Worten, von der Ankunftsgeschwindigkeit der gesprochenen Nachricht eingestellt. Das Signal TR ist ein Bezugswert für die Entnahme des mittleren Klangs VM aus den Phonemkomponenten in den Signalen VO_ und VC , und es wird dazu benutzt, ein Signal für das Erkennen eines offenen Klangs VO oder eines geschlossenen Klangs VC zu erzeugen, wenn die Dauer, d.h. der gezählte Wert des Zählers 39, das Signal TR überschreitet, oder ein Signal für das Erkennen eines mittleren Klangs VM zu erzeugen, wenn die Dauer, d.h. der gezählte Wert des Zählers 39, unter TR„ liegt. Die Vergleichsergebnisse der Vergleichsschaltung 41 werden einer Symbolbildungsschaltung 42 zugeführt, die ein Signal dafür liefert, den offenen Klang VO, den geschlossenen Klang VC und den mittleren Klang VM abhängig von den Signalen SO und SC zu unterscheiden, die von der Zeitgeberschaltung 4 0 in Abhängigkeit von den Signalen VO und VCp, dem Abtastsignal VSB und denr Vergleichsergebnis der Vergleichsschaltung 41 geliefert werdeSi. Wenn das Signal VO einen hohen Wert hat, wird der Impuls SO von der Zeitgeberschaltung 40 abgegeben, und ein Vergleichsergebnis darüber, ob ie Periode, in der das Signal VO einen hohen Wert hat, langer oder kürzer als der Bezugswert TR_ ist, wird ans der Vergleichsschaltung 41 abgegeben, so daß dann, wenn die Periode des Signals VO mit hohem Wert größer als der Bezugswert TR» ist, eine Symbolbildungsschaltung 42 als Reaktion auf das Abtastsignal VSTB einen Impuls abgibt, der anzeigt, daß der offene Klang VO vorliegt, während dann, wenn die Periode des Signals VOp mit hohem Wert kleiner als der Bezugswert TR„ ist, die Symbolbildungsschaltung ebenfalls als Reaktion auf das Abtastsignal VSTB einen Impuls abgibt, der anzeigt, daß der mittlere Klang VM vorliegt. Wenn das Signal VCp einen hohen Wert hat, wird von der Zeitgeber-
-TO-
schaltung 4 0 ein Impuls SC abgegeben, während das Vergleichsergebnis darüber, ob die Periode mit hohem Wert langer oder kürzer als der Bezugswert TR3 ist, von der Vergleichsschaltung" 41 abgegeben wird. Wenn die Periode des Signals VC mit hohem Wert langer als der Bezugswert TR ist, gibt die Symbolbildungsschaltung 42 abhängig vom Abtastsignal VSTB einen Impuls ab, der zeigt, daß der geschlossene Klang VC vorliegt. Ist die Periode des Signals VC mit hohem Wert dagegen kürzer als der Bezugswert TR„ , liefert die Symbolbildungsschaltung 42 ebenfalls abhängig vom Abtastsignal VSTB einen Impuls, der anzeigt, daß der mittlere Klang VM vorliegt. Die Ausgangssignale VO und VC der Symbolbildungsschaltung 4 2 haben somit für den Fall des offenen Klangs VO die Werte "1" und "0", für den Fall des geschlossenen Klangs VC die Werte "0" und "1" und für den FaIL des mittleren Klangs VM die Werte "0" und "0". Die Ausgangssignale VO und VC der Symbolbildungsschaltung 42 werden vom Abtastsignal VSTB in die Halteschaltung 4 3 eingegeben, und wenn das Ausgangssignal V der Ausgangssignale V, PL und F der Diskriminatorschaltung 27 als ein Signal mit hohem Wert bestätigt wird, werden sie zum E/A-Anschluß 14 abgegeben. Diese Ausgangssignale VO und VC sind in Fig. 23 einschließlich ihrer Lage mit DF0 und DF- dargestellt. Die Halteschaltung 44 speichert den gezählten Wert des Zählers 39 abhängig vom Ab-. , tastsignal VSTB, und sie gibt diesen Wert auch an den E/AAnschluß 14 ab, damit er für den Fall der Anwendung der Längen bei der Erkennung der Signale VO und VC benutzt wird. Nachdem die Ausgangssignale der Halteschaltungen 43 und 44 zum E/A- t Anschluß 14 abgegeben worden sind, gibt die Zeitgeberschaltunc 4 0 ein Bereit-Signal SRDY ab. !
Das dem Taktimpulsgenerator 20 vom E/A-Anschluß 14 gelieferte" Signal CR ist ein Signal, das in selektiver Weise die Abgabe [ der Ausgangssignale Cp und TM des Taktimpulsgenerators 20 bewirkt.
BAD ORIGINAL
- rr -
Der Computer 4 bewirkt die Speicherung der Signale DF , DF , DF„ und DF3 sowie des Ausgangssignals der Halteschaltung 44 im Bezugsmusterspeicher 7 oder im Sprachnachrichtenspeicher 15 abhängig von Signalen aus dem Speicher.3 und dem Speicher 5. Dies bedeutet, daß in den Speichersystemen die Signale DFQ, DF1, DF und DF , die die Klassifizierung des stummen Lauts S, den offenen Klangs VO, des geschlossenen Klangs VC, des mittleren Klangs VM, des stimmlosen Reiblauts F und des stimmlosen Sprenglauts PL angeben, sowie die Signale, die die Längen des offenen Klangs VO, des geschlossenen Klangs VC und des mittleren Klangs VM angeben, abgespeichert werden. Im Anschluß daran vergleicht der Computer 4 diese klassifizierten Signale und die Längen mit denen der zuvor abgespeicherten Bezugsmuster für das Erkennen der Nachricht (siehe das Muster 2 von Fig. 22) . In diesem Fall kann der ErkennungsVorgang gut. vereinfacht werden, wenn die klassifizierten Signale vor den Längen verglichen werden und die Längen nur dann verglichen " werden, wenn die klassifizierten Signale eine Übereinstimmung mit den Bezugsmustern zeigen. Beim Vergleich der Längen ist es außerdem sehr günstig, wenn sie einer Normierung unterzogen werden. Wenn die gesamte gesprochene Nachricht bei diesem Erkennüngsvorgang mit einem der Bezugsmuster übereinstimmt, · wird ein Befehlssignal für das richtige Steuern eines Geräts, beispielsweise eines Massagegeräts, abhängig von der gegebenen gesprochenen Nachricht geliefert.
In der Ausfuhrungsform von Fig. 23 wird der Schritt der Erzeugung der klassifizierten Signale und der Längen aus den Signalen V / UV, VO und VC mittels der dargestellten Schaltungsanordnung durchgeführt; dieser Schritt kann natürlich auch vom Computer 4 ausgeführt werden. Ein Flußdiagramm der Ausführungsform von Fig. 2 3 ergibt sich klar bei Bezugnahme auf die Figuren 16 und 18, so daß-, es hier weggelassen ist.
In Fig. 24 ist eine weitere praktische Ausführungsform der Ausführung von Fig. 14 dargestellt, in der die über das Mikrophon 6 erhaltene gesprochene Nachricht X(t) vom Verstärker 8 verstärkt und den Eingängen der ersten Filterbank 9, der zweiten Filterbank 1O7 der dritten Filterbank 45, der vierten Filterbank 46 und der fünften Filterbank 47 zugeführt wird. Diese Filterbänke enthalten jeweils eine Serienschaltung aus einem Filter, einer Gleichrichterschaltung und einer Mittelungsschaltung, die eine Integrationsschaltung enthält. Das Filter der ersten Filterbank 9 läßt eine Frequenzkomponente unter 0,5 kHz durch, das Filter der zweiten Filterbank 10 läßt eine Frequenzkomponente von 0,5 bis 1,0 kHz durch, das Filter in der dritten Filterbank 45 läßt eine Frequenzkomponente von 0,8 bis 1,8 kHz durch, das Filter in der vierten Filterbank 4 6 läßt eine Frequenzkomponente von 1,8 bis 3,2 kHz durch. Die Integrationsschaltung hat eine Zeitkonstante von etwa 5,5 ms in der ersten Filterbank 9 und in der zweiten Filterbank 10 sowie eine Zeitkonstante von etwa 3 ms in der dritten Filterbank 45 und in der vierten Filterbank 46. Durch Bezugnahme auf die Figuren 25A bis 25C ist erkennbar, daß mittels der dritten Filterbank 45 und der vierten Filterbank 46 Ausgangssignale erzeugt werden, die den Artikulationen an den vorderen und
ta - !
hinteren Bereichen "einer Zungenlage, bezüglich des zweiten \ Formanten in zweifacher Hinsicht unterteilt, erzeugt werden. ; Fig. 25A zeigt die Artikulationspunkte für /a/, /e/, /i/, /o/ und /u/; Fig. 25B zeigt die Beziehungen des ersten Formanten F1 und des zweiten Formanten F' zwischen den jeweiligen Vokale /a/, /e/, /i/, /o/ und /u/ und Fig. 25C zeigt ebenfalls die ; F1- und F -Beziehungen zwischen diesen Vokalen, insbesondere für den Fall der japanischen Sprache. Die Artikulationspunkte sind in der japanischen Sprache für diese Vokale ein wenig : nach innen verschoben.
BAD ORIGINAL
In der fünften Filterbank 47 läßt das Filter eine Frequenz- , komponente von 5,0 bis 12,0 kHz durch, und die Integrationsschaltung hat eine Zeitkonstante von etwa 1 ms. Die Mittelungsschaltungen in den Filterbänken 9, 10, 45, 46 und 47 haben eine Grenzfrequenz von 29 Hz, 29 Hz, 53 Hz, 53 Hz bzw. 159 Hz. ■ i
Ausgangssignale f.. und f der ersten Filterbank bzw. der zweiten Filterbank werden in einer Additionsschaltung 48 addiert, und im Anschluß daran wird di e Summe in einem Koeffizientenmultiplizierer 48A so verarbeitet, daß sie an einem Differenzver- · stärker 49 eine Beziehung von -6 dB/Oktave bezüglich des Ausgangssignals fj. der fünften Filterbank 47 hat, und sie wird dann vom Ausgangssignal f- subtahiert. Das Ausgangssignal f^ (f.. + f2) des Verstärkers 49 wird über eine verstärkende Mittelungsschaltung 50 einer Diskriminatorschaltung 51 zugeführt. Diese Diskriminatorschaltung 51 weist einen voreingestellten Bezugswert R , v auf, und die Schaltung soll die Eingangssignale abhängig von dem Bezugswert R ,n verarbeiten; der Schwellenwert an den Übergangs Zeitpunkten des Signals fg - (f.. + f») oder den Signalen V der stimmhaften Laute und UV der stimmlosen ; Laute von der Periode des stimmlosen Lauts UV zur Periode des stimmhaften Lauts ^V wird gleich. R (normalerweise i- R^. /rjV) - !· gemacht, und der Schwellenwert der übergänge von der Periode j. des stimmhaften Lauts V zur Periode des stimmlosen Lauts UV ; wird gleich R (^ R) gemacht, wodurch die Ausgangssignale (V/UV) der Diskriminatorschaltung 51 einen hohen Wert haben, während sie innerhalb der Periode des stimmhaften Lauts V liegen und die Periode des stimmhaften Lauts getreu wiedergeben.
Das Aussgangssignal f der ersten Filterbank 9 wird in einem Koeffizientenmultiplizierer 52 so verarbeitet, daß es in bezug auf das Ausgangssignal f„ der zweiten Filterbank 10 eine Beziehung von -6 dB/Oktave hat, und es wird vom Ausgangssignal f2 an einen Differenzverstärker 53 subtrahiert, dessen Ausgangs-
- ΪΟ -
signale über eine verstärkende Mittelungsschaltung 54 einer Diskriminatorschaltung 55 zugeführt werden. Ein eingestellter Bezugswert R1/2 dieser Diskriminatorschaltung 55 ist so, vorherbestimmt, daß die Schaltung jeweilige Eingangssignale abhängig vom Bezugswert R .„ verarbeitet, wobei ein Schwellenwert an den Ubergangszeitpunkten vom geschlossenen Klang VC zum offenen Klang VO gleich R1 (normalerweise φ Ri/2^ gemacht wird, und ein Schwellenwert an den Ubergangszeitpunkten vom offenen Klang VO zum geschlossenen Klang VC gleich R0 (^ R1) gemacht wird, wodurch Ausgangssignale der Diskriminatorschaltung 55 während der Periode des offenen Klangs VO mit hohem Wert erzeugt werden und diese bestimmte Periode getreu wiedergegeben wird. Ein Koeffizientenmultiplizierer 56 sorgt dafür, daß das Ausgangssignal f.. der dritten Filterbank ■ 45 eine Beziehung von -6 dB/Oktave bezüglich des Äusgangssignals f. der vierten Filterbank 4 6 hat, und das Ausgangs-· signal f_ wird von diesem Ausgangssignal f. in einem Differenzverstärker 57 subtrahiert, dessen Ausgangssignale über die verstärkende Mittelungsschaltung 58 einer Diskriminatorschaltung ; 59 zugeführt werden. Die Diskriminatorschaltung 59 weist einen vorbestimmten eingestellten Bezugswert R3Z4 auf, und sie ver-i arbeitet die jeweiligen Eingangssignale in Abhängigkeit von diesem Bezugswert; ein Schwellenwert für Übergänge von einem. \. hinteren Klang VR zu einem vorderen Klang VF wird gleich s R_ (normalerweise ^ R^ ,.) gemacht, und ein Schwellenwert für ; übergänge von dem vorderen Klang VF zum hinteren Klang VR : wird gleich R. (■£ R-J gemacht. Es ist außerdem eine Diskrimi-; natorschaltung 60 vorgesehen, die Signale Sp erzeugt, die angeben, daß das Signal X(t) von einem stimmhaften oder stimm- ■ losen Laut stammt, wenn das Signal den Bezugswert R überschreitet, und von einem stummen Laut stammt, wenn es diesen Bezugswert nicht überschreitet, wodurch die vier Signale \ (V/UV)p, P /2, P3/4 und Sp an den E/A-Anschluß 14 geliefert und als 4-Bit-Signal Pfc = ((V/UV)pt, P1/2t' P3/4t' SPt* für eine Abstandsberechnung benutzt werden. ;
BAD ORIGINAL
- tr -
"-Ϊ5-
In einem praktischen Beispiel soll das aus den Größen ((V/UV)pt, P1/2t' P3/4t' SPt) bestehende 4-Bit-Signal
für /a/ den Wert (1, 1, 0, 1) und für /i/ den Wert (1/ 0, 1, 1) haben. Wenn das Signal P dem Computer 4 mit < einer vorbestimmten Abtastperiode (die in geeigneter Weise ϊ im Bereich von 5 bis 20 ms abhängig von der Sprechgeschwindigkeit ausgewählt ist) zugeführt wird, wird das Signal P- = (Phonemvektor) im Musterspeicher 7 (repräsentiert durch Q ) oder im Sprachnachrichtenspeicher 15 nur gespeichert, wenn i dem Computer 4 das gleiche Bitmuster nacheinander öfter als eine vorbestimmte Anzahl (beispielsweise zweimal oder dreimal) zugeführt wird, damit Fehlerkennungen vermieden werden.
Das Bezugsmuster Qgt = <(V/üV)pst, P1/2st, P3/4st' SPst} kann in der gleichen Weise wie das oben erwähnte Bit-Signal P gebildet werden.
Im Computer 4 wird dann der Abstand zwischen den aus der ge-
sprochenen Nachricht X(t) gebildeten Signalen, d.h. dem
Phonemvektor P , und dem Phonemvektor Q , des Bezugsmusters :-
berechnet. Es ist erkennbar, daß der Abstand zwischen den "
den jeweiligen Phonemen der gesprochenen Nachricht X ent- .· sprechenden Phonemvektor P und dem den jeweiligen Phonemen ' jr des Bezugsmusters entsprechenden Phonemvektor Q unter Ver- ' l
Wendung der Antivalenzbeziehung 0 ausgedrückt werden kann: >
VQst * Pt} = 2t { ({V/°V)Pst®
+ (P1/2st® 11V2St* + (P3/4st©P3/4t) + .(SPst© Spt)} .
Das Bezugsmuster für den Fall, daß der Ausdruck Σ, {Q - P. } unter dem vorbestimmten Wert und dem Minimum liegt, also das "s" entsprechende Muster für den Fall, daß Σ {Q - P } unter dem vorbestiinmtGn Wert und dem Minimum liegt, soll als Inhalt
- -w
. 76
der gesprochenen Nachricht X erkannt werden, und es wird über die Busleitung 2 und den E/A-Anschluß 14 dem Gerät, beispielsweise dem Massagegerät, zugeführt, damit dieses einen richtigen Arbeitsvorgang ausführt. - .
Für den Fall, daß Σ {Q - P } nicht, für alle "s" unterhalb : des vorbestimmten Werts liegt, wird im vorliegenden Ausführungsbeispiel entschieden, daß kein Bezugsmuster vorliegt, das auf die gesprochene Nachricht X anwendbar ist und kein zutreffendes Bezugsmuster existiert, was in anderen Worten bedeutet, daß die gegebene gesprochene Nachricht X kein richtiger Befehl ist, so daß eine erneute Eingabe der Nachricht als notwendig angezeigt wird. Falls der Unterschied zwischen dem Minimumwert des Ausdrucks Σ {Q - P } und einem nächsten Wert, d.h. den
t st t
vorletzten Wert vor dem Minimum, kleiner als ein vorbestimmtei Wert ist, wird eine erneute Eingabe angefordert, um jede fehle hafte Erkennung zu vermeiden. Es ist zu erkennen, daß erfordei lichenfalls dafür gesorgt werden kann, daß ein einziges Steue: signal für das zu steuernde Gerät mehreren Bezugsmustern entspricht, so daß die gleiche Tätigkeit des Geräts mit Hilfe jeweils verschiedener gesprochener Nachrichten erreicht werdei kann.
Die Kapazität des Computers 4 kann im Fall der Ausführungsfor von Fig. 24 beträchtlich mehr reduziert werden, als bei bekannten Ausführungen. Dies soll anschließend unter Verwendung des obigen Beispiels der gesprochenen Nachricht /Senakaosasur erläutert werden. Da diese Nachricht 13 Phoneme enthält, betr das Volumen des 4-Bit-Signals P insgesamt 4 χ 13 = 52 Bits. Ein herkömmlicher 4-Bit-Computer (4-Bit-CPU) erforderte somit 800 Bytes für die Verarbeitung der gesprochenen Nachricht mit einer Länge von 2 Sekunden; mittels der Erfindung kann eine L beträchtliche Reduzierung dieser Verarbeitungszeit erzielt werden, die sich praktisch aus der Verarbeitung von 20 bis 3C Bytes ergibt. Wenn etwa 16 Typen gesprochener Nachrichten vo3
BAD ORIGINAL
- A3 -
handen sind, können sie gut erkannt werden, wenn nur das 4-Bit-Signal Pfc = ((V/UV)pt, P3Z4) und ein 2-Bit-Signal verwendet werden. Dies läßt sich ohne weiteres daraus erkennen, daß die sich auf die stimmhaften Laute beziehenden Signale V und die auf die stimmlosen Laute UV sich beziehen- | den Signale sowie die Signale, die sich auf den zweiten . Formanten beziehen, bei dem die Differenz des Frequenz- · \ spektrums der fünf Vokale /a/, /o/, /u/, /e/ und /i/ am größten ist, benutzt werden. \
Ein Flußdiagramm der Ausführungsform von Fig. 24 ergibt sich ohne weiteres bei Betrachtung der Figuren 16 und 18, so daß
es hier weggelassen ist. l
In Fig. 26 ist eine weitere Ausführungsform der Erfindung · . dargestellt, bei der die Diskriminatorschaltungen 51, 55, 59 und 60 von Fig. 24 entfernt sind, die den Diskriminatorschaltungen 36 und 37 von Fig. 23 entsprechenden Diskriminatorschaltungen 61 und 62 an die verstärkende Mittelungsschaltung , 50 angeschlossen sind und anschließend zu erläuternde Abwand- ; [■ lungen vorgenommen sind. Zwei Diskriminatorschaltungen 63 und j 64 sind an die verstärkende Mittelungsschaltung 54 ange- " \, schlossen. Die Diskriminatorschaltung 63 vergleicht die Aus- ί gangssignale der verstärkenden Mittelungsschaltung 54 mit dem . ? Bezugswert R1, und sie erzeugt ein Signal P1, das nur dann einen hohen Wert hat, wenn die Ausgangssignale der Diskrimi- j natorschaltung 54 größer als der Bezugswert R1 sind. Die an- ,: dere Diskriminatorschaltung 64 vergleicht die gleichen Aus- \ gangssignale der Mittelungsschaltung 54 mit einem weiteren : Bezugswert R_, und sie erzeugt ein Signal P„, das nur dann ; einen hohen Wert hat, wenn die verglichenen Signale kleiner " als der Wert R3 sind. Zwei weitere Diskriminatorschaltungen 65 und 66 sind an die verstärkende Mittelungsschaltung 58 angeschlossen. Die Diskriminatorschaltung 65 vergleicht dabei die" "i Ausgangssignale der Mittelungsschaltung 58 mit dem Bezugswert R-, ■
- ΛΑ
und sie erzeugt ein Signal P^, das nur dann den hohen Wert hat, wenn die verglichenen Signale größer als der Bezugswert R_ sind. Die andere Diskriminatorschaltung 66 vergleicht die ! gleichen Ausgangssignale der Mittelungsschaltung 58 mit einem Bezugswert R., und sie erzeugt ein Signal P., das nur dann den hohen Wert hat, wenn die verglichenen Signale kleiner als der Bezugswert R. sind. Mit dieser Anordnung werden dem E/AAnschluß 14 die sechs Signale Vp, UV und P bis P. zugeführt, und der Computer 4 wählt diese Signale in Form von 6-Bit-Signalen pfc = (Vpfc, UVpfc, P^, P^, TP^, P4fc) für die Abstands berechnung. Weitere Verarbeitungen der Signale für die Nach- : richtenerkennung werden so durchgeführt wie im Zusammenhang mit der obigen Ausführungsform von Fig. 24 erläutert wurde.
In Fig. 27 sind Flußdiagramme dargestellt, die zusammen mit jeweils einer der Ausführungsformen der Figuren 5, 14, 23, 24 und 26 benützt werden können; die Flußdiagramme gelten spezie] für den Fall, daß eine programmierte Verarbeitung im Computer für die von den obigen Ausführungsbeispielen erhaltenen Signa] V für stimmhafte Laute und UV für stimmlose Laute sowie ihre Impulssignale durchgeführt wird. Das Flußdiagramm von Fig. 27J ist ein Formungsprogramm für die Signale U und UV, bei dem un· geformte Signale U und UV (die in einer Liste für ungeformte , Signale enthalten sind) in den Computer 4 eingegeben werden u: zuerst einem Bestimmungsvorgang unterzogen werden, ob ihr . erster Impuls der stille Laut S ist oder nicht. Wenn der erst' Impuls der stumme Laut S ist, wird dieser Impuls zusammen mit seiner Länge in eine Liste für geformte Signale eingegeben. [ Wenn ein zweiter Impuls der ungeformt.en Liste beispielsweise : nicht der stumme Laut S ist, wird festgestellt, ob seine Läng größer als ein vorbestimmter Wert iSR1 ist oder nicht. Ist se Länge nicht größer als dieser Wert, wird der zweite Impuls al der stumme Laut S interpretiert und in die geformte Liste eingegeben; ist seine Länge jedoch größer, werden der zweite Imp und seine Länge in die geformte Liste geschoben. Der Bestimmu
BAD ORIGINAL
- 46 -
-M-
Vorgang wird an einem dritten Impuls der ungeformten Liste
fortgesetzt, um festzustellen, ob der Impuls einem stummen
Laut S entspricht oder nicht, und ob seine Länge kleiner als
ein vorbestimmter Wert iSR2 ist oder nicht. Ist seine Länge x
nicht kleiner, werden der dritte Impuls und seine Länge so,
als entspräche er einem stummen Laut S, in die geformte Liste
geschoben; ist seine Länge kleiner, wird festgestellt, ob ·' > ein vierter Impuls mit dem zweiten Impuls identisch ist oder I nicht. Liegt keine Identität vor, werden der dritte Impuls \ und seine Länge so, als entspräche er dem stummen Laut S, in \ die geformte Liste geschoben, während für den Fall der Identität der dritte Impuls so modifiziert wird, daß er gleich ; dem zweiten und vierten Impuls ist, und er wird in die geformte ι Liste aufgenommen. Im Anschluß daran wird ein Suchvorgang
durchgeführt, um festzustellen, ob ein erster stummer Laut S
im fünften und in den folgenden Impulsen der ungeformten Liste :-l vorhanden ist. Es wird festgestellt, ob der jüngste stumme Ά Laut S kleiner als der Wert iSR2 ist oder nicht, und im An- !- Schluß daran werden die gleichen Vorgänge wiederholt, die " oben beschrieben wurden. Wenn die ungeformte Liste auf diese « Weise vollständig -für den Formvorgang verarbeitet worden ist, j' wird festgestellt,job der letzte Impuls der Liste ein stummer | Laut S ist oder nicht; liegt ein stummer Laut vor, wird der | letzte stumme Laut S in der geformten Liste weggelassen; liegt i
kein stummer Laut vor, wird der Formvorgang beendet. r
Da das Formprogramm für die Signale VO der offenen Klänge und ;·
VC der geschlossenen Klänge mit dem obigen Programm von Fig. 27A ]
für die Signale V und UV völlig übereinstimmt, wird hier nicht <
darauf Bezug genommen. ^
Das in Fig. 27B dargestellte Flußdiagramm gilt für ein Programm '
zur Erstellung zusammengesetzter Signale aus den geformten -
Signalen V, UV sowie VO und VC. Es wird festgestellt, ob die l
COPY "
jeweiligen Impulse der geformten Liste der Signale V und UV dem stummen Laut S oder dem stimmlosen Laut UV entsprechen. Für den Fall, daß S oder UV bestimmt wird, werden die Signale für S oder UV zusammen mit ihrer jeweiligen Länge in eine Gesamtimpulsliste geschoben. Wenn der Impuls weder S noch UV entsprach oder die Schiebevorgänge von S und UV in die : ; Gesamtimpulsliste beendet sind, wird festgestellt, ob ein offener Klang VO in der geformten Liste der Signale VO für die offenen Klänge und VC für die geschlossenen Klänge innerhalb der Zeitperiode des stimmhaften Lauts V in der geformten Liste der Signale V für stimmhafte Laute und UV für stimmlose Laute vorhanden ist. Wenn VO in der V-Periode vorhanden ist, wird das Signal VO in die Gesamtimpulsliste geschoben. Falls VO in der V-Periode nicht vorhanden ist, oder wenn das Schiebe der V0-Signale in die Gesamtimpulsliste beendet ist, wird bestimmt, ob ein Klangsignal VC in der V-Periode vorhanden ist. Wenn VC in der V-Periode vorhanden ist, wird das VC-Klangsignal in die Gesamtimpulsliste geschoben. Wenn VC in der V-Periode nicht vorhanden ist oder das Schieben der VC-Klang— signale in die Gesamtimpulsliste beendet ist, wird festgestel" ob ein Signal S für einen stummen Laut in der geformten Liste der Signale VO und VC in der V-Periode vorhanden ist oder nie! Wenn S vorhanden ist, wird dieses Lautsignal als mittlerer - \ Klang VM interpretiert und in die Gesamtimpulsliste geschoben Falls kein Lautsignal S in der V-Periode vorhanden ist oder j das Schieben des Klangsignals VM in die Liste beendet ist, is der Vorgang der Erstellung der Gesamtimpulse beendet. - i
In Fig. 27C ist das Flußdiagramm eines Programms zur hierarch sehen Klassifizierung der Gesamtimpulsliste dargestellt. Aus der Liste werden zunächst die Lautsignale V und UV ausge wählt und entsprechend ihrer Klassifizierung in die erste Ran ebene eingegeben. Mit η = 1 , d.h. beim ersten Lautsignal V, wird festgestellt, ob die Klangsignale VM, VO und VC in der Liste vorhanden sind. Bei Anwesenheit der Klangsignale.VM, VO
BAD ORIGINAL
- 47 -
- 2A-
und VC werden sie als V(1) in der zweiten Rangebene klassi- j fiziert. Im Anschluß daran wird mit η = η + 1, also für das zweite Lautsignal V, festgestellt, ob VM,- VO und VC in der Liste vorhanden sind oder nicht. Die Verarbeitung wird in der gleichen Weise bis zum letzten Lautsignal V wiederholt. Bei Beendigung der Verarbeitung bis zum letzten Lautsignal V, bei dem V(n) in der zweiten Rangebene klassifiziert wird, sindkeine Klangsignale VM, VO oder VC für η + 1 vorhanden. Somit ist erreicht worden, daß die Liste aus "n" Teilen von V(n) als zweite Rangebene erstellt ist. Wie aus dem Obigen hervorgeht, wird bei der hierarchischen Klassifizierung die aus den Lautsignalen V, UV und S bestehende Liste als erste Rangebene erstellt, und eine weitere Liste mit den Klangsignalen VM, VO und VC, die das Lautsignal V in der Liste der ersten Rangebene repräsentieren und nacheinander zu V(1), V(2) ... V(n) gemacht werden, wird als die zweite Rangebene erstellt. Ergebnisse dieser hierarchischen Klassifizierung sind in Fig. 28
ΐ für die gesprochene Nachricht /Senakaosasure/ dargestellt.
Fig. 27D zeigt das Flußdiagramm eines Programms zur Normierung \
der Längen der in den Listen der ersten und der zweiten Rang- :
ebene enthaltenen jeweiligen Elemente, die gemäß Fig. 2 7C "\
klassifiziert worden sind, wobei gilt: j = 1; es wird dabei %
festgestellt, ob die Normierung der Liste der ersten Rangebene . }
beendet worden ist. Falls die Beendigung nocht nicht erfolgt ;~
ist, werden die Längen der in der Liste der ersten Rangebene " j klassifizierten Elemente normiert. Das heißt, daß zunächst der
Normierungskoeffizient X. = 1000/(Z1 Y.) der zu verarbeitenden j gesprochenen Nachricht (die zur "i"-ten gesprochenen Nachricht
gemacht wird) erhalten wird (Y.. ist dabei die Länge des ersten ■
Elements der Liste der ersten Rangebene) . Im Anschluß daran ';.
wird die erste normierte Länge P. ..-■ = X. ·Υ. der Nachricht er- \
AD ι 3 halten (j = 1) , worauf .die Normierung mit j = j + 1 wiederholt wird, bis das letzte Element der Liste der ersten Rangebene ■-- [-normiert ist (praktische numerische Werte sind in Fig. 28 an- COPY gegeben). Nach Beendigung der Normierung der Liste der ersten
- Αβ -
■Sä-
Rangebene wird mit η = 1 festgestellt, ob die Liste der
zweiten Rangebene vollständig normiert worden ist oder nicht. , Wenn die Normierung noch nicht beendet worden ist, wird die I Länge des Elements V(1) normiert. Mit k = 1 wird festgestellt, ob die Längen der Elemente von V(1) normiert sind oder nicht. Ist dies noch nicht der Fall, wird der Normierungskoeffizient: Χ±(1) = 1000/(E1 Y1 (D) gebildet (Y. ist dabei die Länge des ersten Elements von V(I)). Im Anschluß daran wird die erste
normierte Länge P.,(D = X.(1)■Y, (1) (k = 1) für V(1) erhalter Die Normierung wird dann bis zum letzten Element von V(D mit k = k + 1 wiederholt. Nach der Beendigung der Normierung für V(D wird die Normierung für V(2) ... V(n) in der Liste der
zweiten Rangebene mit η = η + 1 in der oben beschriebenen Weis durchgeführt. Nach Beendigung der Normierung für die Liste
der zweiten Rangebene ist die Längennormierung fertig. Eine
Bezugnahme auf Fig. 28 trägt zum weiteren Verständnis des
Normierungsvorgangs bei.
In Fig. 27E ist das Flußdiagramm eines Programms zur Identifizierung der in Fig. 27D normierten Signale dargestellt. Bei einer ersten Identifizierung wird die normierte Liste der
ersten Rangebene mit den Bezugsmustern im Hinblick auf die
Anzahl der jeweiligen Lautsignale V, UV und S in dieser Liste verglichen. Wenn kein Lautsignal mit kurzer Länge vorhanden " ist, werden die Signale mit den Bezugsmustern verglichen, die kein kurzes Lautsignal S enthalten, während die Signale, die das kurze Lautsignal enthalten, verglichen und als Lautsignal interpretiert werden, die einen Laut UV unmittelbar benachbar dem kurzen Laut S haben. Bei der Durchführung des Vergleichsvorgangs wird auch die Normierungszeit betrachtet. Wenn sich die Nachricht bei der ersten Identifizierung als anwendbar ; auf eines der Bezugsmuster erweist, wird eine zweite Identifi zierung ausgeführt, wozu die normierte zweite Rangebene benut wird. Es werden also V(D ... V(n) nacheinander verglichen.
Wie sich aus der Zeichnung ergibt, wird der Vergleichsvorganc
BAD ORIGINAL
-■83-
auf vier Wegen durchgeführt, wobei es in diesem Fall ausreichen soll, wenn sich herausstellt, daß die jeweiligen Signale Bezugsmustern entsprechen, die bei der ersten Identifizierung in einem der vier Wege ausgewählt worden sind. Auf dem ersten Weg werden die Bezugsmuster ausgewählt, die *' beispielsweise mit V(1) übereinstimmen, worin das Klangsignal VM zum Klangsignal VO oder zum Klangsignal VC gemacht ~" -T1 wird; das oder die Bezugsmuster, die mit V(1) übereinstimmen, worin die Klangsignale VO und VC gleich dem Klangsignal VM sind, bleiben übrig. Auf dem zweiten Weg werden die Bezugsmuster ausgewählt, die mit V(1) in der vom Klangsignal VO. besetzten Rate übereinstimmen. Auf dem dritten Weg wird bestimmt, ob die Hauptkomponente von V(D eines der Klangsignale VO, VC und VM ist, und es werden die mit einer solchen Komponente übereinstimmenden Bezugsmuster ausgewählt; es wird dann festgestellt, ob die zweite Komponente von V(D gleich einem der Klangsignale VO, VC und VM xst, worauf das oder die Bezugsmuster, die in dieser Hinsicht übereinstimmen, übrig bleiben. Auf dem dritten Weg, werden insbesondere die jeweiligen Komponenten von V(D nacheinander, beginnend mit denen " mit der größeren Länge, zu . dem mit der kürzesten Länge angeordnet, und das oder die. Bezugsmuster, die in einer solchen Folge übereinstimmen, werden ausgewählt. Auf dem vierten Weg werden solche "Punkte", wie sie in der folgenden Tabelle angegeben sind, als eine Funktion benutzt, die das Ausmaß der Übereinstimmung angibt, das dem Abstand zwischen dem Eingangs- - I muster von V(i) mit (i) von 1 bis η in den Signalen V(D ··· V(n) % und dem Bezugsmuster entspricht: i
COPY
Eingangsmuster Bezugsmuster Punkt
• VM VO/VC 0
VO/VC VM 0
VO VO + 1
VM VM + 1
VC VC + 1
VO VC - 1
VC VO - 1
Es werden die Bezugsmuster ausgewählt/ bei denen die Gesamtsumme der Punkte, die für jeden Abtastwert oder für jeden der normierten Zeit entsprechenden Abtastwert berechnet sind, über einem vorbestimmten Wert liegt (die gesamte Abtastzahl beträgt beispielsweise 1000). Wenn das Eingangsmuster vollständig mit dem Bezugsmuster übereinstimmt, ist die gesamte Abtastzahl gleich der zuvor genannten Gesamtsumme. Der vierte Weg legt somit die "Punkte" bezüglich des Kurvenverlaufs fest, doch ist zu erkennen, daß diese Definition bezüglich der symbolischen Impulse oder der normierten Längenwerte gemacht werden kann.
Die auf diesel Weise-in den jeweiligen vier Wegen ausgewählten und bezüglich aller V(i) übereinstimmenden Bezugsmuster werdei entnommen, und aus den entnommenen Bezugsmustern wird das optimale Bezugsmuster ausgewählt, wodurch der Erkennungsvorgang beendet wird. Wenn das optimale Bezugsmuster ausgewählt werdei kann,'soll über die Busleitung 2 und den E/A-Anschluß 14 ein diesem optimalen Muster entsprechender Befehl zu einem Gerät, beispielsweise dem Massagegerät 16, gegeben werden, jedoch sollte vom Sprecher eine erneute Eingabe der gesprochenen Nacl rieht verlangt werden, wenn kein optimales Bezugsmuster ausgewählt werden kann.
BAD ORIGINAL
- 51.-
Die vier oben beschriebenen Wege sind im Flußdiagramm von Fig. 27E zwar für die Durchführung der zweiten Identifizierung auf der zweiten Rangebene beschrieben worden, doch ist es auch möglich, einige dieser Wege wegzulassen, falls dies erforderlich·ist.
Aus den Ausführungsformen der Figuren 24 und 26 ist offensichtlich, daß Ergebnisse weiter an Modelle des menschlichen Hörorgans angepaßt werden können, wenn der logarithmische Verstärker bei jedem der zwei Eingänge der entsprechenden Differenzverstärker 49, 53 und 57 oder zwischen die Gleichrichterschaltung und die Mittelungsschaltung in jeder der fünf Filterbänke 9, 10, 45, 4 6 und 47 eingefügt wird. Für diesen Fall erzielbare Vorteile lassen sich ohne weiteres verstehen, wenn auf die logarithmischen Verstärker 32A und 33A von Fig. 23 Bezug genommen wird; eine genaue Beschreibung ist aus diesem Grund hier weggelassen.
Wie aus der obigen Beschreibung hervorgeht, werden mit Hilfe der Erfindung mehrere Bezugsmuster bei der Erkennung einer speziellen gesprochenen'Nachricht gebildet, damit ein gewisses Ausmaß an Freiheit?-in den Bearbeitungs- und Erkennungsfähig- | keiten gewährleistet wird. Experimente haben gezeigt, daß im Gegensatz zu den Signalen V für stimmhafte Laute und UV für stimmlose Laute die Signale VO und VC für offene bzw. geschlossene Klänge unter dem Einfluß individueller phonetischer Unterschiede oder einiger anderer Bedingungen variabel sind. Bei Berücksichtigung dieses Sachverhalts in Bezugnahme auf die oben erwähnte gesprochene Nachricht /Senakaosasure/ und auf die die Phonemmuster dieser Nachricht darstellende Fig. ist zu erkennen, daß die Zone des stimmhaften Klangs V wenigstens zwei unterschiedliche Artikulationen aufweist, während die Zone des stimmlosen Klangs UV möglicherweise nur in einem Spezialfall verschwindet, nämlich im Anschluß an den kurzen ΓΌΡΥ stummen Klang S. Aus diesem Grund wird ein Bezugsmuster so gebildet, daß das Vorhandensein des stimmlosen Klangs UV er-
kannt werden kann, ohne Rücksicht darauf, ob er an einer Stelle im Anschluß an den kurzen stummen Laut S verschwindet oder nicht. Für den Fall/ daß der stimmhafte Laut V unter der Annahme behandelt wird, daß der mittlere Klang VM zwischen einem offenen Klang VO und einem geschlossenen Klang VC entweder als offener Klang VO oder als geschlossener Klang VC 3 ■ gesprochen werden kann, sind alle diese Fälle in Fig. 29 enthalten.
Wenn nur die Signale V für stimmhafte Laute und UV für stimmlose Laute benutzt werden, kann der Erkennungsvorgang auf der Basis durchgeführt werden, daß bestimmt wird, ob der stumme Laut S kurz ist oder nicht, wobei der stimmlose Laut UV nur dann auf den stummen Laut S folgt, wenn dieser kurz ist.
Falls sowohl die Signale V für stimmhafte Laute und UV für stimmlose Laute als auch die Signale VO für offene Klänge und VC für geschlossene Klänge verwendet werden, ist es möglich, nicht nur die Erscheinung des Verschwindens des stimmlosen i Lauts UV nach dem stummen Laut S, sondern auch die Anwesenheit und Schwankung des mittleren Klangs VM zu berücksicht- ; gen. In diesem Fall ist es jedoch notwendig, zuvor die Längen· zu messen. Die obige Verarbeitung bei Anwesenheit des kurzen , stummen Lauts S sollte dabei gleichzeitig durchgeführt werden, und es kann ein bevorzugtes Ergebnis erreicht werden. !
Unter Bezugnahme auf Fig. 30 wird nun die bevorzugte Erstellu? oder Abspeicherung der Bezugsmuster nach der Erfindung erläuti Unzuverlässigkeiten und Nichtbestimmtheiten aufgrund phonetisi Unterschiede der individuellen Sprecher oder dergleichen werd< dabei berücksichtigt. Wenn eine ankommende gesprochene Nachrii verarbeitet werden soll, die einen Abschnitt des stummen Klarl· S -*- stimmlosen Klangs UV ·*■ stimmhaften Klangs V enthält, wird auch ein Muster mit verschwindendem Klang UV erzeugt. Wenn ei
BAD ORIGINAL
Abschnitt S ·*■ V enthalten ist, wird auch ein Muster mit einem Abschnitt S ■*· UV -*■ V' erzeugt. Wenn die Nachricht weder den Abschnitt S ·*■ UV ■*■ V noch den Abschnitt S -*■ V enthält, wird das Muster beibehalten wie es ist. Im Anschluß daran wird geprüft, ob sich das Programm im Lernmodus befindet oder nicht; die weitere Verarbeitung wird durch eine Reihe von Schritten gemäß Fig. 30 auf der linken Seite fortgesetzt, wenn sich das Programm im Lernmodus befindet. Ist dies nicht der Fall, erfolgt der weitere Ablauf durch die rechts angegebene Folge von Schritten. Für den Fall des Lernmodus werden die Längen oder die normierten Längen der Signale V für stimmhafte Laute und UV für stimmlose Laute gemittelt. Die Signale werden dann codiert oder in entsprechende Symbole umgesetzt, was mittels einer entsprechenden Aufteilung in eine passende Anzahl von Zeitabschnitten für jedes Signal V(i) erfolgt, und die gleichen Zeitabschnitte, die zum gleichen Symbol gehören, werden zum Kernabschnitt gemacht, während von den Kernabschnitten verschiedene Abschnitte zu Zweigen des Signals VM, der Signale VM und VO oder der Signale VM und VC gemacht, wonach die Bezugsmuster erzeugt sind. Falls sich das Programm nicht im Lernmodus befindet, führt der Beginn des Sprechens zur Erzeugung eines geeigneten Musters aus Signalen VO und VC, und das Muster wird dann so gebildet, daß es der mit VO und VC endenden Sprache entspricht, während der Zwischenabschnitt in geeigneter Weise entsprechend VC ->· VO und VO -*■ VC verarbeitet wird, wodurch die Bezugsmuster erstellt worden sind; das zuletzt erstellte Bezugsmuster wird in den Bezugsmusterspeicher 7 geschrieben.
Mit Bezugnahme auf die Figuren 31 bis 33 erfolgt nun die Erläuterung weiterer Einzelheiten der oben erwähnten Schritte der Erzeugung von Bezugsmustern mit Hilfe des Lernmodus. Das in Fig. 31 dargestellte" Flußdiagramm kann sowohl für den gleichen Sprecher als auch für mehrere verschiedene Sprecher ange- QQf wendet werden; die folgenden Erläuterungen gelten jedoch für
— 5 Λ —
den Fall, daß der gleiche Sprecher eine gesprochene Nachricht mehrmals (im vorliegenden Fall fünfmal) wiederholt. Zu Beginn wird der Zeitbereich in zehn Abschnitte unterteilt, wie in Fig. 32A zu erkennen ist (jeder Abschnitt kann beispielsweise eine Länge von 5 ms haben, doch kann er auch kürzer sein). Wenn die normierte Länge geteilt werden soll, sollten die geteilten Bereiche abhängig von den gegebenen Wörtern in einer geeigneten Anzahl vorhanden sein. Nach der Teilung werden die Zeitbereiche, in denen sich die Symbole (VO, VC, VM und dergleichen) nicht ändern, zum Kernbereich gemacht. Bei den Mustern (a) bis (e) in Fig. 32A werden die Bereiche der Symbole VO zum Kernbereich gemacht. Nachdem auf diese Weise der Kernbereich erhalten worden ist, werden die Zeitbereiche mit variierenden Symbolen zu einem VM-Bereich gemacht (siehe Fig. 32A und Fig. 32B), wodurch nun ein Bezugsmuster A mit einem Kernbereich VO gebildet worden ist (Fig. 321 Wenn ein Muster vorliegt, das in den gleichen Zeitbereichen die Symbole VM oder VC enthält, wird eine Verzweigung des Symbols VC für das Symbol VM im Bezugsmuster A gebildet (siehe Fig. 32A und Fig. 32C). Wenn entweder VO oder VC in den gleichen Zeitbereichen vorhanden ist, werden die Zeitbereiche zu einem VM-Berei.ch gemacht, wodurch ein Bezugsmuster B erstellt wird, in dem Verzweigungen zum Muster A hinzugefügt sind j (Fig. 32C). Mit dieser Erstellung der Bezugsmuster A und B · sind die Schritte zur Bildung der Bezugsmuster im Lernmodus ; beendet. Der Betriebsablauf schreitet dann zum Schreibschritt gemäß Fig. 30 weiter, bei dem die Bezugsmuster A und B in den. Speicher 7 geschrieben werden. Bei der obigen Erstellung der ; Bezugsmuster im Lernmodus ist es notwendig, den Verstärkungs-; faktor beispielsweise an der Eingangsseite des Differenzverstärkers 11-2 von Fig. 5 in einem ausgeglichenen Zustand zu i halten. Zu diesem Zweck wird der Verstärkungsfaktor so eingestellt, daß sich bei einer Artikulation von /a/ das Klangsign; VO und bei einer Artikulation von /i/ das Klangsignal VC ergibt. Wegen der vom Sprecher abhängigen vorhandenen phonetisc!
BAD ORIGINAL
Unterschiede ist es insbesondere für den Erkennungsvorgang vorteilhaft, wenn die Schaltungsanordnung so ausgebildet wird, daß sie eine automatisch durchgeführte Verstärkungsabgleicheinstellung aufweist, so daß das Ausgangssignal des Differenzverstärkers bei einem natürlich artikulierten Vokal /e/ nur bei Ankunft eines (nicht dargestellten) Abgleicheinstellsignals den Wert "0" hat. Mit dieser Abgleicheinstellung ist es möglich, nichtdeterminative Bezugsmuster zu erstellen, ohne daß es notwendig ist, die gleiche gesprochene Nachricht wiederholt zu sprechen und sie zu lernen, wie in dem Flußdiagramm von Fig. 33 angegeben ist. . ■ " ■
Fig. 33 zeigt Einzelheiten der Schritte zur Bezugsmustererstellung für den Fall, daß kein Lernmodus vorliegt, wobei bei der Darstellung der Signale V für stimmhafte Laute und UV für stimmlose Laute die V-Signale nacheinander verarbeitet werden. Wenn die jeweiligen V-Artikulationen mit einem VC-Klang beginnen, wird ein VM-Zweig hinzugefügt. Wenn anstelle eines Beginns mit einem VC-Klang mit einem VO-Klang begonnen wird, werden VC- und VM-Zweige parallel zwischen den Start und VO hinzugefügt, und ein VM-Zweig wird parallel zu VO hinzugefügt. Wenn die V-Artikulationen anders als mit einem VC- oder : VO-Klang beginnen, werden sie zu einem VM-Klang gemacht.
Wenn die V-Artikulationen mit einem VC-Klang enden, wird ein paralleler VM-Zweig zu VC hinzugefügt. Wenn sie mit einem VO-Klang enden, werden sie so ausgebildet, daß sie mit VO -»■ VC enden, und zu VO und VC wird ein paralleler VM-Zweig hinzugefügt. Wenn keine Endung mit dem Klang VC oder dem Klang VO vorliegt, werden die Artikulationen so ausgelegt, als endeten sie mit dem Klang VM.
Wenn im Verlauf eines Lauts V ein Abschnitt VC ■*■ VO vorhanden ist, wird parallel zu VC und zu VO ein VM-Zweig hinzugefügt. Bei Fehlen eines Abschnitts VC ·*■ VO, jedoch in Anwesenheit COPYs
-Jo-
eines Abschnitts VO ·> VC, wird zu VO und zu VC ein VM-Zweig hinzugefügt. Wenn die Artikulationen weder mit einem Abschnitt VC ->■ VO noch mit einem Abschnitt VO ■> VC enden, wer- " den sie so ausgelegt, als endeten sie mit dem Klang VM.
Damit sind die Schritte zur Bezugsmustererstellung für den ■--Fall beendet, daß der Lernmodus nicht vorliegt. Der Betriebsablauf schaltet dann zu dem Bezugsmuster-Schreibschritt weiter, der in Fig. 30 angegeben ist, bei dem die so gebildeten Bezugsmuster in den Speicher geschrieben werden.
Beim Lesen der obigen Bezugnahmen auf die Figuren 27A bis 27E und 30 bis 33 wird erkennbar, daß die Bezugsmuster so erstellt werden können, daß gesprochene Nachrichtenmuster erfaßt werden, wie sie in Fig. 28 dargestellt sind. Bei der Erfindung wird das Verarbeitungsprogramm so gebildet, wie beschrieben worden ist, so daß alle die aufeinanderfolgenden Artikulationen gemäß Fig. 28 begleitenden Schwankungen in ausreichender Weise erfaßt werden. Aus Fig. 28 ist natürlich '--klar erkennbar, daß die Signale V für stimmhafte Laute und UV für stimmlose Laute richtig verarbeitet werden, wenn sie : Signale S für einen kurzen stummen Klang zwischen V- und UV-Signalen oder VO- und VC-Signalen enthalten. Es kann eine . Tendenz dafür erkennbar sein, daß Signale VM für einen mitt-' leren Klang zwischen V- und UV-Signalen oder zwischen VO- -. und VC-Signalen eingefügt sind, doch werden auch solche Nachrichten richtig verarbeitet. Somit ist klar, daß gemäß der. ;
j Erfindung unerwünschte Einflüsse aufgrund von Schwankungen ; des Phonemmusters der gesprochenen Nachricht in Begleitung l von individuellen phonetischen Unterschieden, Betonungsverschiebungen unter verschiedenen Bedingungen und dergleichen i in wirksamer Weise beseitigt werden können. Dies bedeutet in anderen Worten, daß gemäß der Erfindung die Abschnitte mit geringeren Schwankungen im Phonemmuster der gesprochenen Nac rieht zum Kernabschnitt des zu erstellenden Bezugsmusters ge
BAD ORIGINAL
- 5*7 -
macht werden, während andere Abschnitte mit vielen Schwankun- ϊ gen zum Restabschnitt gemacht werden. Das Erkennen oder das
Bezugsmustererstellen wird zunächst in bezug auf den Kernabschnitt und dann in bezug auf den Restabschnitt durchgeführt, , wobei ein nichtdeterminativer Charakter oder ein vorbestimmter .f Freiheitsgrad erhalten wird. Es ist somit möglich, die Kapazität des jeweiligen Computers und des Speichersystems und somit · = auch die erforderliche Verarbeitungszeit beträchtlich herab- J zusetzen. Nach der Erfindung wird das zutreffende Bezugsmuster \ sogar mit einer einzigen Eingabe der gesprochenen Nachricht | durch Verarbeitung im Computer erstellt, ohne daß ein Lern- . ; modus zugrundegelegt wird, so daß die Bezugsmuster also in
höchst wirksamer Weise erstellt werden können. -
COPY
Leerseite
ORIGINAL fNSPECTED

Claims (1)

PRINZ, BUNKE & Patentanwälte · European Patent* Attorneys *** München Stuttgart MATSUSHITA ELECTRIC WORKS, LTD. 12. Januar .1982 1048, Oaza-Kadoma, Kadoma-shi, . Osaka 571, Japan Unser Zeichen: M 1521 Patentansprüche
1. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der ; ji gesprochenen Nachricht mit Bezugsmustern verglichen wird, ι ;?
• j: dadurch gekennzeichnet, ' ji
b) daß aus den Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten und aus den Energieanteilen der dem zweiten Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte Laute und Signale für stimmlose Laute erzeugt werden und
a) daß die gesprochene Nachricht in einem ersten Frequenzband analysiert wird, in dem sich die Energieanteile stimmhafter Laute konzentrieren, und in einem zweiten Frequenzband analysiert wird, in dem sich die Energie- M anteile stimmloser Laute konzentrieren,
Schw/Ma
c) daß die Signale für stimmhafte Laute und für stimmlose Laute jeweils mit den Bezugsmustern verglichen werden, ' damit eines der Bezugsmuster entnommen wird, das mit r den Signalen im wesentlichen übereinstimmt. -
2. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß die Signale für stimmlose und stimmhafte Laute Impulssignale sind. -■
3. Verfahren nach Anspruch 2, dadurch gekennzeichnet, ■
d) daß die Längen der jeweiligen stimmhaften, stimmlosen . und stummen Lautperioden in den Signalen für stimmhafte und stimmlose Laute gemessen werden und
e) daß die im Schritt (d) gemessenen Längen mit jeweiligen Bezugsmustern verglichen werden, damit eines der Bezugs muster entnommen wird, bei dem die Längen im wesentlich mit den gemessenen Längen übereinstimmen. ί
4. Verfahren nach Anspruch 3, dadurch gekennzeichnet, · i
f) daß die stimmhaften, stimmlosen und stummen Lautperiode
der Signale, deren Längen sich im Schritt (d) kürzer al
ι ein vorbestimmter Wert erwiesen haben, durch Verarbeite
geformt werden. '·..
5. Verfahren nach Anspruch 4, dadurch gekennzeichnet, daß sti hafte und stimmlose Klänge mit der unterhalb des vorbestin ten Werts liegenden Länge als stumme Klänge verarbeitet we
6. Verfahren nach Anspruch 5, dadurch gekennzeichnet, daß bed Vorliegen eines stimmhaften Lauts, der sich über einen sti men Laut mit einer Länge, die kürzer als der vorbestimmte ist, zu einem stimmhaften Laut mit einer über dem vorbesti
BAD ORIG'MAL
—3-2 00
ten Wert liegenden Länge fortsetzt, dieser stumme Laut als ein stimmloser Laut verarbeitet wird.
7. Verfahren nach Anspruch 3, dadurch gekennzeichnet,
g) daß zur Vereinfachung des Schritts (e) die im Schritt (d) gemessenen Längen normiert werden.
8. Verfahren nach Anspruch 1, dadurch gekennzeichnet,
•h) daß die Signale für stimmhafte und stimmlose Laute durch Zuordnung von +1 zum stimmhaften Laut, -1 zum stimmlosen Laut und 0 zum stummen Laut codiert werden.
9. Verfahren nach Anspruch 7, dadurch gekennzeichnet,
i) daß die normierten Längen durch Zuordnung von +1 zu der über einem vorbestimmten Wert liegenden Länge, -1 zu der unter einem weiteren vorbestimmten Wert liegenden Länge und 0 zu einer zwischen den beiden vorbestimmten Werten liegenden Länge codiert werden.
0. Verfahren nach Anspruch 4, dadurch gekennzeichnet, daß ein stimmloser Laut, der sich zu einem stummen Laut mit einem über dem vorbestimmten Wert liegenden Dauer fortsetzt, als ein stimmloser Sprenglaut verarbeitet wird, wenn seine Länge kleiner als der vorbestimmte Wert ist, während er als stimmloser Reiblaut verarbeitet wird, wenn seine Länge über dem vorbestimmten Wert liegt.
ten Wert liegenden Länge fortsetzt, dieser stumme Laut als ein stimmhafter Laut verarbeitet wird und daß sich bei Vorliegen eines stimmlosen Lauts, der sich über den stummen Laut mit einer Länge, die kleiner als der vorbestimmte Wert ist, zu einem stimmlosen Laut mit einer über dem vorbestimm- "1|
COPY
-A-
11. Verfahren nach Anspruch .1, dadurch gekennzeichnet,
j) daß die Amplitude der gesprochenen Nachricht vor dem Analysierungsschritt (a) komprimiert wird.
12. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß dei Komprimierungsschritt nur durchgeführt wird, wenn die Amplitude über einem vorbestimmten Wert liegt, " .
13. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß de] Komprimierungsschritt so durchgeführt wird, daß die über einem vorbestimmten Wert liegende Amplitude auf einen logarithmischen Wert komprimiert wird.
14. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß de Komprimierungsschritt durchgeführt wird, damit eine kompri mierte Amplitude zur Breite einer Funktion der gesprochene Nachricht vor der Komprimierung gemacht wird.
15. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß das erste Frequenzband von 0 bis 1,0 kHz reicht und daß das zweite Frequenzband von 2 bis 12 kHz reicht.
16. Verfahren zur Spracherkennung, bei dem eine gesprochene :
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt: wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver- ' teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, dadurch gekennzeichnet,
a) daß die gesprochene Nachricht in einem ersten Frequenzband analysiert wird, indem sich die Energieanteile stimmhafter Laute konzentrieren, in einem zweiten Frequenzband analysiert wird, indem sich die Energiean- ; teile stimmloser Laute konzentrieren, in einem dritten
BAD ORIGINAL
Frequenzband analysiert wird, indem sich die Energieanteile offener Klänge der stimmhaften Laute konzen- · trieren, und in einem vierten Frequenzband analysiert wird, indem sich die Energieanteile geschlossener Klänge der stimmhaften Laute konzentrieren,
b) daß aus den Energieanteilen stimmhafter Lautkomponenten, " die dem ersten Frequenzband angehören, und aus den Energieanteilen stimmloser Lautkomponenten, die dem zweiten Frequenzband angehören, Signale für stimmhafte Laute und für stimmlose Laute erzeugt werden,
c) daß aus den Energieanteilen von offenen Klangkomponenten, die dem dritten Frequenzband angehören, und aus den Energieanteilen geschlossener Lautkomponenten, die dem vierten Frequenzband angehören, Signale für offene und für geschlossene Klänge erzeugt werden und
d) daß die Signale für stimmhafte und stimmlose Laute sowie die Signale für offene und geschlossene Klänge mit Bezugsmustern verglichen werden, damit eines der Bezugsmuster entnommen wird, das mit den jeweiligen Signalen ' im wesentlichen übereinstimmt. :
7. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß die | Signale für offene und geschlossene Klänge nur mit dem Bezugs- sj muster verglichen werden, das bei dem Vergleichsvorgang der j Signale für stimmhafte und stimmlose Laute entnommen worden ;! ist.
8. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß die Signale für stimmhafte und stimmlose Laute sowie die Signale für offene und geschlossene Klänge jeweils Impulssignale sind.
COPY
19. Verfahren nach Anspruch 18, dadurch gekennzeichnet,
e) daß die Längen der stimmhaften, stimmlosen und stummen "■ Lautperioden der Signale für stimmhafte und stimmlose
Laute sowie die Längen der offenen, geschlossenen und
stummen Klangperioden in den Signalen für offene und ''·'; geschlossene Klänge gemessen werden und
f) daß die Längen der stimmhaften, stimmlosen und stummen
Lautperioden sowie der offenen, geschlossenen und stumme
Klangperioden mit den jeweiligen Bezugsmustern vergliche werden, damit eines der Bezugsmuster entnommen wird, bei dem hinsichtlich der Längen im wesentlichen Übereinstimmung besteht.
20. Verfahren nach Anspruch 19, dadurch gekennzeichnet,
g) daß die stimmhaften, stimmlosen und stummen Lautperioden in den Signalen für stimmhafte und stimmlose Laute sowie die offenen/ geschlossenen und stummen Klangperioden in den Signalen für offene und geschlossene Klänge zur For-r mung verarbeitet werden, wenn ihre gemessenen Längen '
unter einem vorbestimmten Wert liegen. . ι
21. Verfahren nach Anspruch 20, dadurch gekennzeichnet, daß sti
hafte und stimmlose Laute sowie offene und geschlossene ί Klänge, deren Längen kleiner als ein vorbestimmter Wert sin
t als stumme Laute verarbeitet werden. !
22. Verfahren nach Anspruch 21, dadurch gekennzeichnet, daß ein stummer Laut mit einer unter einem vorbestimmten Wert liege den Länge als ein stimmhafter Laut verarbeitet wird, wenn : er zwischen einem stimmhaften Laut mit einer über dem vorbe stimmten Werte liegenden Länge und einem weiteren stimmhaft Laut liegt, während er als stimmloser Laut verarbeitet wird
BAD ORIGINAL
•3
—y - — .-j
wenn er zwischen einem stimmlosen Laut mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren stimmlosen Laut liegt, und daß ein stummer Laut als offener Klang verarbeitet wird, wenn er zwischen einem offenen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren offenen Klang liegt, jedoch als geschlossener Klang verarbeitet wird, wenn er zwischen einem geschlossenen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren geschlossenen Klang liegt.
23. Verfahren nach Anspruch 19, dadurch gekennzeichnet,
h) daß die gemessenen Längen zur Vereinfachung der Vergleichs und Verarbeitungsschritte normiert werden.
24. Verfahren nach Anspruch 16, dadurch gekennzeichnet,
i) daß die Signale für stimmhafte und stimmlose Laute sowie die Signale für offene und geschlossene Klänge codiert werden, indem in den Signalen für stimmhafte und stimmlose Laute den stimmhaften Lauten +1,den stimmlosen Lauten -1 und den stummen Lauten- 0 zugeordnet wird, während in den Signalen für offene und geschlossene Klänge den offenen Klängen +1, den geschlossenen Klängen -1 und den stummen Lauten 0 zugeordnet wird.
25. Verfahren nach Anspruch 23, dadurch gekennzeichnt,
j) daß die normierten Längen codiert werden, indem +1 den Längen über einen vorbestimmten Wert, -1 den Längen unter einem weiteren vorbestimmten Wert und 0- den Längen zwischen den beiden vorbestimmten Werten zugeordnet wird.
CX)PY
26. Verfahren nach Anspruch 20, dadurch gekennzeichnet, daß eine stimmlose Lautperiode, die sich als eine stumme Lautperiode mit einer über einem vorbestimmten Wert liegenden Länge fortsetzt, als ein stimmloser Sprenglaut verarbeitet wird, wenn die Länge der stimmlosen Lautperiode kleiner als der vorbestimmte Wert ist, jedoch als stimmloser Reib- ' laut verarbeitet wird, wenn die Länge über diesem vorbestimmten Wert liegt. -
27. Verfahren nach Anspruch 16, dadurch gekennzeichnet,
k) daß die Amplitude der gesprochenen Nachricht vor dem Analysierungsschritt (a) komprimiert wird.
28. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß der Komprimierungsschritt nur dann durchgeführt wird, wenn die Amplitude der Nachricht über einem vorbestimmten Wert liegt.
29. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß der Komprimierungsschritt so durchgeführt wird, daß die ■ ; Amplitude der Nachricht nur dann auf einen logarithmischen Wert kompryniert wird, wenn sie über einem vorbestimmten . > Wert liegt. !
30. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß ■ der Komprimierungsschritt so durchgeführt wird, daß das - ; Ergebnis der Kompression die Breite einer Funktion der gesprochenen Nachricht vor der Komprimierung ist. !
31. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß j das erste Frequenzband von 0 bis 1,0 kHz, das zweite [ Frequenzband von 2 bis 12 kHz, das dritte Frequenzband von 0 bis 0,5 kHz und das vierte Frequenzband von 0,5
bis 1,0 kHz reicht. :
COPY
ORIGINAL INSPECTED
32. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen -Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, dadurch gekennzeichnet,
a) daß durch Analyse die Nachricht in ein erstes Frequenzband von 0 bis 1 kHz aufgeteilt wird, indem sich die Energieanteile stimmhafter Laute konzentrieren, in ein zweites Frequenzband von 2 bis 12 kHz aufgeteilt wird, in dem sich die Energieanteile stimmloser Laute konzentrieren, in ein drittes Frequenzband von 0 bis 0,5 kHz aufgeteilt wird, indem sich die Energieanteile offener Klänge in den stimmhaften Lauten konzentrieren, und in ein viertes Frequenzband von 0,5 bis 1,0 kHz aufgeteilt wird, indem sich die Energieanteile geschlossener Klänge in den stimmhaften Lauten konzentrieren,
b) daß aus den Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten.und aus den Energieanteilen der"dem zweiten Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte und stimmlose Laute gebildet werden,
c) daß die Längen der stimmhaften, stimmlosen und stummen Lautperioden in den Signalen der stimmhaften und stimmlosen Klänge gemessen werden,
d) daß aus den Energieanteilen der dem dritten Frequenzband angehörigen offenen Klangkomponenten und aus den Energieanteilen der dem vierten Frequenzband angehörigen geschlossenen Klangkomponenten Signale für offene und geschlossene Klänge gebildet werden, _
e) daß die Längen der offenen, geschlossenen und stummen Klangperioden in den Signalen für offene und geschlossene Klänge gemessen werden, .;
f) daß die stimmhaften und stimmlosen Laute sowie die offenen und geschlossenen Klänge mit einer unter einem vorbestimmten Wert liegenden Länge zur Formung als ein stummer Laut verarbeitet werden, der Stumme Laut mit einer' unter dem vorbestimmten Wert liegenden Länge zwischen ' ; dem stimmhaften Laut mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren stimmhaften Laui zur Formung als stimmhafter Laut verarbeitet wird, der ■ stumme Laut mit einer unter dem vorbestimmten Wert liegei den Länge zwischen den stimmlosen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weitere: stummen Laut zur Formung als stimmloser Laut verarbeitet wird, der stumme Laut mit einer unter dem vorbestimmten Wert liegenden Länge zwischen einem offenen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren offenen Klang zur Formung als offener Klang verarbeitet wird und der stumme Laut mit einer ^ unter dem vorbestimmten Wert liegenden Länge zwischen i dem geschlossenen Klang mit einer über dem vorbestimmter Wert liegenden Länge und einem weiteren geschlossenen j
Klang als geschlossener Klang verarbeitet wird, \
g) daß zusammengesetzte Impulse mit stimmlosen und stummen Lautperioden geformter Signale für stimmhafte und stimmlose Laute als stimmlose und stumme Lautperioden gebildi werden, mit offenen und geschlossenen Klängen von Signalen für offene und geschlossene Klänge, die in Überein-
ί Stimmung mit stimmhaften Lautperiode geformter Signale ;
für stimmhafte und stimmlose Klänge vorhanden sind, als offene oder geschlossene Klänge gebildet werden und mit
■ stummen Lauten der geformten Signale für offeneund ge-.
BAD ORIGINAL
schlossene Klänge, die in Übereinstimmung mit den stimmhaften Lautperioden der geformten Signale für stimmhafte und stimmlose Laute vorhanden sind, als mittlere Klänge gebildet werden,
h) daß jeweilige Gruppen der geformten Signale für stimmhafte und stimmlose Laute hierarchisch so klassifiziert werden, daß sie in einer ersten Rangebene liegen, wobei die offenen, geschlossenen und mittleren Klänge, die in den zusammengesetzten Impulsen aufeinanderfolgen, in einer zweiten Rangebene liegen,
i) daß die Längen der ersten Rangebene normiert werden, !
j) daß die Längen jeweiliger Gruppen der zweiten Rangebene normiert werden,
k) daß die Signale auf der ersten Rangebene mit entsprechenden Bezugsmustern verglichen werden, damit diejenigen Bezugsmuster entnommen werden, die im wesentlichen mit den Signalen übereinstimmen, und
1) daß die Signale auf der zweiten- Rangebene mit den entnommenen Bezugsmustern verglichen werden, damit eines von ihnen entnommen wird, das im wesentlichen mit diesen Signalen übereinstimmt.
33. Verfahren nach Anspruch 32, dadurch gekennzeichnet,
m) daß festgestellt wird, ob das im Schritt (1) entnommene optimale Bezugsmuster ausreichend verschieden vom nächstzutreffenden entnommenen Bezugsmuster ist, damit bei einer ungenügenden Abweichung ein die Notwendigkeit einer erneuten Eingabe der Nachricht anzeigendes Signal er-,. zeugt wird.
34. Verfahren nach Anspruch 32, dadurch gekennzeichnet, daß die mittleren Klänge'jeweiliger Signalgruppen in der zweiten Rangebene mit jedem der offenen und geschlossenen Klänge in den Bezugsmustern verglichen werden, daß die offenen und geschlossenen Klänge in jeweiligen Gruppen der zweiten Rangebene als mittlere Klänge mit den durch den Vergleich entnommenen Bezugsmustern verglichen werden, daß ein Bezugsmuster entnommen wird, dessen offene Klänge die gleiche Rate wie die offenen Klänge in den jeweiligen Gruppen auf der zweiten Rangebene haben, daß ein Bezugsmuster entnommen wird, daß die gleichen Hauptkomponenten wie die jeweiligen Gruppen auf der zweiten Rangebene hat, daß ein Bezugsmuster entnommen wird, das bei einer Auswertung an den Punkten +1,0 und -1 mit Eingangsmustern jedes Abtastwerts in den jeweiligen Signalgruppen auf der zweiten Rangebene am besten übereinstimmt, und daß schließlich in ausgewählter Weise ein gemeinsames Bezugsmuster der bei diesen vier Schritten erhaltenen Bezugsmuster entnommen wird. j
35. Verfahren nach Anspruch 32, dadurch gekennzeichnet, daß ; der Vergleichsschritt (k) dadurch ausgeführt wird, daß bei '■ Anwesenheit eines stummen Klangs mit kurzer Länge ein [ stimmloser Klang mit kurzer Länge hinzuaddiert wird. ·
36. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt _ ι wird, die in den jeweiligen Frequenzbändern enthaltenen , Energieanteile gemessen werden und eine Frequenzbandver- ί teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, j dadurch gekennzeichnet, Γ
a) daß die gesprochene Nachricht durch Analyse in ein von 0 bis 1 kHz reichendes Frequenzband, in dem sich ;
copy
'—r — ~
- 13 -
die Energieanteile stimmhafter Laute konzentrieren, sowie in ein von 2 bis 12 kHz reichendes zweites Frequenzband, in dem sich die Energieanteile stimmloser Laute konzentrieren, aufgeteilt wird,
b) daß abhängig von Unterschieden zwischen jeweiligen Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten und der dem zweiten Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte und für stimmlose Laute gebildet werden,
c) daß die Signale für stimmhafte und für .stimmlose Laute zur Erzeugung von Signalen V für stimmhafte Laute, Signalen UVp für stimmlose Laute und Signalen Sp für stumme Laute geformt werden,
d) daß die Längen des durch das Signal Vp repräsentierten stimmhaften Lauts, des durch das Signal UV repräsentierten stimmlosen Lauts sowie des durch die Signale Sp repräsentierten stummen Lauts gemessen werden,
e) daß die jeweiligen Signale codiert werden, damit aus den Signalen UV für stimmlose Laute, aus den Signalen Sp für stumme Laute und den gemessenen Werten der Längen Signale PL für stimmlose Sprenglaute für stimmlose Lautperioden mit einer unter einem vorbestimmten Wert liegenden Länge, die sich zu einer stimmhaften Lautperiode mit einer über dem vorbestimmten Wert liegenden Dauer fortsetzt, und Signale F für stimmlose Reiblaute für diejenigen Perioden mit einer über dem vorbestimmten f Wert liegenden Länge gebildet werden, und damit weitere Ί-
bildet werden, und
Signale V für stimmhafte Laute aus den Signalen V ge-
si
COPY
» ■
- 14 -
f) daß die abhängig von ihrem Inhalt codierten Signale mit den Bezugsmustern verglichen werden, damit eines der Bezugsmuster entnommen wird, das im wesentlichen mit diesen Inhalten übereinstimmt.
37. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß der Codierschritt (e) so ausgeführt wird, daß ein binäres Signal DF entsteht, das den Signalen V, PL und F entspricht, das ein Signal V für stimmhafte Laute, ein Signal F für stimmlose Reiblaute und ein Signal PL für stimmlose Sprenglaute als eine Gruppe enthält, und zwar in der Form (0, 0, 0) - (0, 0), (1, 0, 0) -v (0, 1), (0, 1, 0) ■*■ (1, 1) und (0, 0, 1) ■*■ (1 , 0) .
38. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß bei dem Vergleichsschritt (f) auch die gemessenen Werte der Längen verglichen werden.
39. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß bei dem Formungsschritt (c) die Signale Vp für stimmhafte Laute nur erzeugt werden, wenn die Signale für stimmhafte : und für stimmlose Laute kleiner als ein vorbestimmter Wert sind, die Signale UVp für stimmlose Laute nur erzeugt werden, wenn sie über einem weiteren vorbestimmten Wert liegen, und die Signale Sp für stumme Laute nur erzeugt werden, wenn sie zwischen den beiden vorbestimmten Werten liegen.
40. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver- ■ teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, dadurch gekennzeichnet, daß die Bezugsmuster dadurch er-
COPY
stellt werden, daß folgende Schritte ausgeführt werden:
a) daß die gesprochene Nachricht als eine Folge von mehreren Eingaben erhalten wird, indem die Nachricht mehrmals wiederholt gesprochen wird, .<;
b) daß ein Kernabschnitt der jeweiligen Bezugsmuster mit _. gegenseitig identischen und gleichzeitigen Impulsen jeweiliger Eingaben der Nachricht gebildet wird und
c) daß die gleichzeitigen, jedoch gegenseitig nicht iden- ; tischen Impulse als ein mittlerer Klang VM dargestellt werden.
41. Verfahren nach Anspruch 40, dadurch gekennzeichnet, daß bei der Erstellung der Bezugsmuster folgende weitere Schritte durchgeführt werden, die darin bestehen,
d) daß ein erster Zweig geschlossener Klänge VC bezüglich des mittleren Klangs VM gebildet wird, wenn eine der Eingaben der gesprochenen Nachricht den mittleren Klang VM enthält, der als geschlossener Klang VC dargestellt wird,
e) daß ein zweiter Zweig des offenen Klangs bezüglich des mittleren Klangs VM gebildet wird, wenn eine der Eingaben der gesprochenen Nachricht den mittleren Klang VM enthält, der als der offene Klang VO dargestellt wird, und
f) daß ein dritter Zweig zur Beibehaltung des mittleren Klangs VM gebildet wird, wenn die Eingaben der gesprochenen Nachricht die eine Eingabe enthalten, in der der mittlere Klang VM zum geschlossenen Klang VC wird, und die eine Eingabe enthalten, in der der mittlere Klang
VM zum offenen Klang VO wird.
COPY
42. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zur Erkennung des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, dadurch gekennzeichnet,
a) daß ein Zweig eines mittleren Klangs VM hinzugefügt wird, wenn stimmhafte Laute der Nachricht entweder mit einem geschlossenen Klang VC oder einem offenen Klang VO beginnt, wobei die stimmhaften Anfangslaute, die anders als die Klänge VC und VO sind, zum mittleren Klang VM gemacht werden,
b) daß zum geschlossenen Klang VC ein Zweig des mittleren Klangs VM hinzugefügt wird, wenn stimmhafte Laute mit einem geschlossenen Klang VC und einem offenen Klang VO enden, wobei im zuletzt genannten Fall der geschlossene Klang VC neben dem offenen Klang VO und ein Zweig eines offenen Klangs VO zu VO - VC und VO hinzugefügt werden, wobei der stimmhafte Endlaut, der kein geschlossener Klang oder offener Klang ist, zum mittleren Klang VM gemacht wird, und ' \
c) daß zum offenen Klang VO und zum geschlossenen Klang VC ein Zweig eines mittleren Klangs VM hinzugefügt wird, wenn der offene Klang VO und der geschlossene Klang VC ; nacheinander in den jeweiligen stimmhaften Lauten der Nachricht vorhanden sind, wobei der mittlere Klang in . Abwesenheit der aufeinanderfolgenden offenen und geschlossenen Klänge VO bzw- VC eingefügt wird.
BAD ORIGINAL
■*3 200 63RT
- 17 -
43- Verfahren nach Anspruch 42, dadurch gekennzeichnet,
d). daß ein Zweig zum Kurzschließen des -stummen Lauts S und des stimmhaften Lauts V hinzugefügt wird, wenn ein Abschnitt mit einem aufeinanderfolgenden stummen Laut S, einem stimmlosen Laut UV und einem stimmhaften Laut V vorhanden ist, während ein Zweig eines stimmlosen Lauts UV zwischen einem stummen Laut S und einem stimmhaften Laut V hinzugefügt wird, wenn ein Abschnitt mit einem aufeinanderfolgenden stummen Laut S und stimmhaften Laut V vorhanden ist.
44y Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
a) eine erste Filterbank (9) zum Auswählen stimmhafter Lautkomponenten, die einem ersten Frequenzband angehören, in dem die EnergieanteiLe stimmhafter Laute der gesprochenen Nachricht konzentriert sind,
b) eine zweite Filterbank (10) "zum Auswählen stimmloser Lautkomponenten, die einem zweiten Frequenzband angehören, in dem Energieanteile stimmloser Laute der gesprochenen Nachricht konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen der zweiten Filterbank (10),
d) einen A/D-Umsetzer (13) zur Digitalisierung der Ausgangssignale des Differenzverstärkers (11), wobei diese Ausgangssignale die Signale für stimmhafte und stimmlose ,' Laute sind,
e) ein erstes Speichersystem (15) zum Speichern der digital: sierten Signale für stimmhafte und stimmlose Laute, I
e1) ein zweites Speichersystem (7) zum Speichern von Bezugsmustern und
f) einen Computer (4), der die Abspeicherung der digitalisierten Signale für stimmhafte und stimmlose Laute in dei ersten Speichersystem (15) bewirkt und die Signale mit dt nen in dem zweiten Speichersystem (7) vergleicht.
45. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen , Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, . gekennzeichnet durch . *
• ■ f
a) eine erste Filterbank (9-1), in der aus der gesprochenen Nachricht offene Klangkomponenten ausgewählt werden, die einem ersten Frequenzband angehören, in dem die Energieanteile offener Klänge in stimmhaften Lauten konzentrier 'sind, I
b) eine zweite Filterbank (9-2), in der aus der gesprochene Nachricht geschlossene Klangkomponenten ausgewählt werde die einem zweiten Frequenzband angehören, in dem Energie anteile geschlossener Klänge in den stimmhaften Lauten konzentriert sind,
BAD ORIGINAL
rrr ^2Q
c) einen ersten Differenzverstärker (11-2), in dem Signale jj für offene und geschlossene Klänge durch Subtrahieren 1 der Ausgangssignale der ersten Filterbank (9-1) von \ Ausgangssignalen der zweiten Filterbank (9-2) gebildet A
werden, : η
d) eine Additionsschaltung (11-1)/ in der die Ausgangssignale
der ersten und der zweiten Filterbank miteinander addiert I werden, Γ
e) eine dritte Filterbank (10), in der aus der gesprochenen
Nachricht stimmlose Lautkomponenten ausgewählt werden,
die einem dritten Frequenzband angehören, in dem die
Energieanteile stimmloser Laute konzentriert sind,
f) einen zweiten Differenzverstärker (11), in dem Signale
für stimmhafte und stimmlose Laute durch Subtrahieren " der Ausgangssignale der Additionsschaltung (11-1) von ' Ausgangssignalen der dritten Filterbank (10) erzeugt
werden, : ■:
g) einen A/D-Umsetzer (13), in dem die Signale für offene · ί und geschlossene Klänge und die Signale für stimmhafte : und stimmlose Laute aus den beiden Differenzverstärkern : (11-2, 11) digitalisiert werden,
h) ein erstes Speichersystem (15), in dem die digitalisier- ! ten Signale für offene und geschlossene Klänge sowie
für stimmhafte und stimmlose Laute gespeichert werden,
i) ein zweites Speichersystem (7), in dem Bezugsmuster ge- I speichert werden, und
j) einen Computer (4), der die Abspeicherung der digitali- j sierten Signale für offene und geschlossene Klänge und
für stimmhafte und stimmlose Laute im ersten Speicher-
system (15) bewirkt und der diese Signale mit den im zweiten Speichersystem (7) abgespeicherten Bezugsmustern vergleicht.
46. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird/ die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver-_ teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
a) eine erste Filterbank (9), in der aus der gesprochenen Nachricht stimmhafte Lautkomponenten ausgewählt werden, die einem ersten Frequenzband angehören, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht stimmlose Lautkomponenten ausgewählt werden, ', die einem zweiten Frequenzband angehören, in dem die
Energieanteile stimmloser Laute konzentriert sind, .
c) eine dritte Filterbank (32), in der aus der gesprochenen
es . *
Nachrictit offene Klangkomponenten ausgewählt werden, die einem dritten Frequenzband angehören, in dem die Energie;· anteile offener Klänge in den stimmhaften Lauten konzentriert sind,
d) eine vierte Filterbank (33), in der aus der gesprochenen Nachricht geschlossene Klangkomponenten ausgewählt werden die einem vierten Frequenzband angehören, in dem die s Energieanteile geschlossener Klänge in den stimmhaften > Lauten konzentriert sind, :
BAD ORIGINAL
e) einen ersten Differenzverstärker (11), in dem Signale für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen der zweiten Filterbank (10) erzeugt werden,
f) einen zweiten Differenzverstärker (34) , in dem Signale für offene und für geschlossene Klänge durch Subtrahieren der Ausgangssignale der dritten Filterbank (32) von Ausgangssignalen der vierten Filterbank (33) erzeugt werden,
g) einen A/D-Umsetzer, in dem die Signale für stimmhafte und stimmlose Laute und die Signale für offene und geschlossene Klänge aus den beiden Differenzverstärkern (11, 34) digitalisiert werden,
h) ein erstes Speichersystem (15), in dem die digitalisierten Signale für stimmhafte und stimmlose Laute sowie für offene und geschlossene Klänge gespeichert werden,
i) ein zweites Speichersystem (7), in dem Bezugsmuster gespeichert werden, und
j) einen Computer (4) , der die Abspeicherung der digitalisierten Signale für stimmhafte und stimmlose Laute sowie für offene und geschlossene Klänge in den beiden Speichersystemen (15, 7) bewirkt und diese Signale mit den Bezugsmustern vergleicht.
17. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
BAD ORIGINAL
a) eine erste Filterbank (9), in der aus der gesprochenen
Nachricht Energiekomponenten ausgewählt werden, die in
einem ersten Frequenzband verteilt sind, in dem die
Energieanteile stimmhafter Laute .konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht Energieanteile ausgewählt werden, die in einem zweiten Frequenzband verteilt sind, in dem die Energieanteile stimmloser Laute konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen der zweiten Filterbank (10) ,
d) einen Impulscodierer (13) zum Codieren der Signale für
stimmhafte und stimmlose Laute aus dem Differenzverstärker (11) ,
e) ein erstes Speichersystem (15) zum Speichern der codierten Signale für stimmlose und stimmhafte Laute, . -
e') ein zweites Speichersystem (7) zum Speichern der Bezugs-s
muster und „ - !
f) einen Computer (4), der die Abspeicherung der codierten
Signale für stimmhafte und stimmlose Laute im ersten
Speichersystem (15) bewirkt und diese Signale mit den f im zweiten Speichersystem (7) gespeicherten Bezugs- ' mustern vergleicht.
48. Vorrichtung zur Spracherkennung, bei der eine gesprochene Γ Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen
Energieanteile gemessen werden und eine Frequenzbandver- .
BAD ORIGINAL
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch - ·.
a) eine erste Filterbank (9-1), in der aus der gesprochenen Nachricht offene Klangkomponenten ausgewählt werden, die einem ersten Frequenzband angehören, in dem die Energieanteile offener Klänge in stimmhaften Lauten konzentriert sind,
b) eine zweite Filterbank (9-2), in der aus der gesprochenen Nachricht geschlossene Klangkomponenten ausgewählt werden, die einem zweiten Frequenzband angehören, in dem Energieanteile geschlossener Klänge in den stimmhaften Lauten konzentriert sind,
c) einen ersten Differenzverstärker (11-2), in dem Signale für offene und geschlossene Klänge durch Subtrahieren der Ausgangssignale der ersten Filterbank (9-1) von Ausgangssignalen der zweiten Filterbank (9-2) gebildet werden,
d) eine Additionsschaltung (11-1), in der die Ausgangssignale der ersten und der zweiten Filterbank miteinander addiert werden,
e) eine dritte Filterbank (10), in der aus der gesprochenen Nachricht stimmlose Lautkomponenten ausgewählt werden, die einem dritten Frequenzband angehören, in dem die Energieanteile stimmloser Laute konzentriert sind,
f) einen zweiten Differenzverstärker (11), in dam Signale für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der Additionsschaltung (11-1) von Ausgangssignalen der dritten Filterbank (10) erzeugt werden,
- COPY
g) einen Impulscodierer (13-1), in dem die Signale für offene und geschlossene Klänge und die Signale für stimmhafte und stimmlose Laute aus den beiden Differenzverstärkern (11-2, 11) codiert werden,
h) ein erstes Speichersystem (15), in dem die codierten Signale für offene und geschlossene Klänge sowie für stimmhafte und stimmlose Laute gespeichert werden, -.. .
i) ein zweites Speichersystem (7), in dem die Bezugsmuster gespeichert werden, und
j) einen Computer (4), der die Abspeicherung der codierten Signale für offene und geschlossene Klänge sowie für stimmhafte und stimmlose Laute im ersten Speichersystem (15) bewirkt und diese Signale mit den Bezugsmustern im zweite: Speichersystem (7) vergleicht.
49. Vorrichtung zur Spracherkennung, bei der eine gesprochene | Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen ; Energieanteile gemessen werden und eine Frequenzbandverteilung diener Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
a) eine erste Filterbank, in der aus der gesprochenen Nachricht stimmhafte Lautkomponenten ausgewählt werden, die einem ersten Frequenzband angehören, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank, in der aus der gesprochenen Nachricht stimmlose Lautkomponenten ausgewählt werden, die einem zweiten Frequenzband angehören, in dem die Energieanteile stimmloser Laute konzentriert sind,
BAD ORIGINAL
c) eine dritte Filterbank, in der aus der gesprochenen \ Nachricht offene Klangkomponenten ausgewählt werden,, die | einem dritten Frequenzband angehören, in dem die Energie- --anteile offener Klänge in den stimmhaften Lauten konzen- j triert sind, - f
d) eine vierte Filterbank, in der aus der gesprochenen -■
Nachricht geschlossene Klangkomponenten ausgewählt werden, j die einem vierten Frequenzband angehören, in dem die ι Energieanteile geschlossener Klänge in den stimmhaften · f
Lauten konzentriert sind, ;
e) einen ersten Differenzverstärker, in dem Signale
für stimmhafte und stimmlose Laute durch Subtrahieren
der Ausgangssignale der ersten Filterbank von Ausgangssignalen der zweiten Filterbank erzeugt werden,
f) einen zweiten Differenzverstärker, in dem Signale . : für offene und für geschlossene Klänge durch Subtrahieren
der Ausgangssignale der dritten Filterbank von Aus- Γ gangssignalen der vierten Filterbank erzeugt werden,
- j.
β . . f
g) einen Impulscodierer, in dem die Signale für stimmhafte :-'
und stimmlose Laute und die Signale für offene und ge- j schlossene Klänge aus den beiden Differenzverstärkern -. codiert werden, \
h) ein erstes Speichersystem, in dem die codierten Signale ': für offene und geschlossene Klänge sowie für stimmhafte
und stimmlose Laute gespeichert werden, i
i) ein zweites Speichersystem, in dem die Bezugsmuster gespeichert werden, und
COPY
- 26 - ; ■
j) einen Computer, der die Abspeicherung der codierten Signale für stimmhafte und stimmlose Laute und für offene und für geschlossene Klänge im ersten Speichersystem bzw. im zweiten Speichersystem bewirkt und diese Signale mit bem Bezugsmuster vergleicht.
50. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt .' wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
a) eine erste Filterbank (9), in der aus der gesprochenen Nachricht Energie anteile ausgewählt werden, die in einem ersten Frequenzband verteilt sind, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht Energieanteile ausgewählt werden, die in einem zweiten Frequenzband verteilt sind, in dem die Energieanteile stimmloser Laute konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangs- j Signalen der zweiten Filterbank (10),
d) eine Mittelungsschaltung (12) zum Mitteln der Ausgangssignale des Differenzverstärkers (11), '
e) eine erste Diskriminatorschaltung (18) zur Erzeugung eine Signals mit ,hohem Wert, wenn die Ausgangssignale der Mitt lungsschaltung (12) kleiner als ein vorbestimmter Wert si
BAD ORIGINAL
f) eine zweite Diskriminatorschaltung (19) zur Erzeugung ' _% eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) größer-als ein weiterer vorbestimmter Wert sind, ,-
■ ~-rf
g) eine Formungsschaltung (21) zur Erzeugung von Signalen
V für stimmhafte Laute, UVp für stimmlose Laute und . ;f S für stumme Laute aus den Ausgangssignalen der beiden Diskriminatorschaltungen (18, 19),
h) einen ersten Zähler. (24) zum Zählen der Längen der durch die Signale V repräsentierten stimmhaften Laute und zum Zählen der Längen der durch die Signale UVp repräsentierten stimmlosen Laute,
i) einen zweiten Zähler (22) zum Zählen der Längen der durch die Signale S repräsentierten stummen Laute,
j) eine Vergleichsschaltung (27) zum Vergleichen des gezählten Werts des ersten Zählers (24) mit einem vorbestimmten Wert und zum Erzeugen eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten Wert überschreitet, ' ·.
k) eine.Codierschaltung (29), die aus einer Gruppe von Signalen V, PL und F eine Gruppe codierter Signale DF1 und DF , nämlich ein logisches Summensignal DF^ aus dem zweiten Signal PL und dem dritten Signal F und ein logisches Summensignal DF1 aus dem ersten Signal V und dem dritten Signal F erzeugt, wobei die Gruppe der Signale V, PL und F ein erstes Signal V enthält, das nur dann einen hohen Wert hat, wenn das Signal V für stimmhafte Laute einen hohen Wert.hat und wenn Ausgangssignale der Vergleichsschaltung (27) einen hohen Wert haben, ein zweites i Signal PL enthält, das nur dann einen hohen Wert hat, wenn
- BAD ORIGINAL
diejenigen Ausgangssignale der Vergleichsschaltung (27)
einen niedrigen Wert haben, die den Signalen UV der
stimmlosen Laute entsprechen, die nacheinander in einer
stummen Lautperiode auftreten, deren zum zweiten Zähler
(22) gezählter Wert einen vorbestimmten Wert überschreitet, und ein drittes Signal F enthält, das nur dann einen hohen Wert hat, wenn diejenigen Ausgangssignale der
Vergleichsschaltung (27) einen hohen Wert haben, die den, Signalen UVp für stimmlose Laute entsprechen, die nacheinander in der stummen Lautperiode auftreten, deren
vom zweiten Zähler (22) gezählter Wert den vorbestimmten Wert überschreitet,
1) ein erstes Speichersystem (15) zum Speichern der codier- , ten Signale DF und DF ,
m) ein zweites Speichersystem zum Speichern der Zählinhalte der beiden Speicher (24, 22), die den codierten Signalen DF1 und DF entsprechen, j
η) ein drittes Speichersystem (7) zum Speichern der Bezugs- ; muster und
o) einen Computer (4), der die. Abspeicherung der codierten \ Signale DF1 und DF und der Zählinhalte der beiden Zähler (24, 22) im ersten bzw. im zweiten Speichersystem bewirkt und die Signale mit den im dritten Speichersystem gespeicherten Bezugsmustern vergleicht. ·■
51. Vorrichtung zur Spracherkennung, bei der eine gesprochene
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt \ wird, die in den jeweiligen Frequenzbändern enthaltenen ί Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der
gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
BAD ORIGINAL
a) eine erste Filterbank (9), in der aus der gesprochenen Nachricht Energiekomponenten ausgewählt werden, die in einem ersten Frequenzband verteilt sind, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht Energieanteile ausgewählt werden, die in einem zweiten Frequenzband verteilt sind, in dem die Energieanteile stimmloser Laute konzentriert sind,
c) einen ersten Differenzverstärker (11) zur Erzeugung von Signalen für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen der zweiten Filterbank (10),
d) eine erste Mittelungsschaltung (12) zum Mitteln der Ausgangssignale des ersten Differenzverstärkers (11),
e) eine erste Diskriminatorschaltung (18) zur Erzeugung eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) kleiner als ein vorbestimmter Wert sind,
f) eine zweite Diskriminatorschaltung (19) zur Erzeugung eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) größer als ein weiterer vorbestimmter Wert sind,
g) eine erste Formungsschaltung (21) zur Erzeugung von Signalen V für stimmhafte Laute, UV für stimmlose Laute und S für stumme Laute aus den Ausgangssignalen der beiden Diskriminatorschaltungen (18, 19),
h) einen ersten Zähler (24) zum Zählen der Längen der durchdie Signale V repräsentierten stimmhaften Laute und zum
Zählen der Längen der durch die Signale UVp repräsentierten stimmlosen Laute,
i) einen zweiten Zähler (22) zum Zählen der Längen der durch die Signale S repräsentierten stummen Laute,
j) eine erste Vergleichsschaltung (27) zum Vergleichen des gezählten Werts des ersten Zählers (24) mit einem vorbestimmten Wert und zum Erzeugen eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten Wert überschreitet,
k) eine erste Codierschaltung (29), die aus einer Gruppe von Signalen V, PL und F eine Gruppe codierter Signale DF und DFn, nämlich ein logisches Summensignal DF» aus dem zweiten Signal PL und dem dritten Signal F und ein logisches Summensignal DF1 aus dem ersten Signal V und dem dritten Signal F erzeugt, wobei die Gruppe der Signale V, PL und F ein erstes Signal V enthält, das nur dann einen " hohen Wert hat, wenn das Signal V für stimmhafte Laute einen hohen Wert hat und wenn Ausgangssignale der Vergleichsschaltung (27) einen hohen Wert haben, ein zweites Signal PL enthält, das nur dann einen hohen Wert hat, wem diejenigen Ausgängssignale der Vergleichsschaltung (27) j
einen niedrigen Wert haben, die den Signalen UV der ? stimmlosen Laute entsprechen, die nacheinander in einer ; stummen Lautperiode auftreten, deren im zweiten Zähler ' (22) gezählter Wert einen vorbestimmten Wert überschrei-J tet, und ein drittes Signal F enthält, das nur dann einen hohen Wert hat, wenn diejenigen Ausgangssignale der Vergleichsschaltung (27) einen hohen Wert haben, die den, Signalen UV für stimmlose Laute, entsprechen, die nach- jeinander in der stummen Lautperiode auftreten, deren vom zweiten Zähler (22) gezählter Wert den vorbestimmten Wert überschreitet, ";
BAD ORIGINAL
1) eine dritte Filterbank (32), die aus der gesprochenen Nachricht Energieanteile aus einem dritten Frequenzband auswählt, in dem die Energieanteile offener Klänge konzentriert sind, ·
m) eine vierte Filterbank (33), die aus der gesprochenen Nachricht Energieanteile aus einem vierten Frequenzband -. auswählt, in dem die Energieanteile geschlossener Klänge konzentriert sind,
n) einen zweiten Differenzverstärker (34) zur Erzeugung von Signalen für offene und geschlossene Klänge durch Subtrahieren der Ausgangssignale der dritten Filterbank (32) von Ausgangssignalen der vierten Filterbank (33),
o) eine zweite Mittelungsschaltung (35) zum Mitteln der Ausgangssignale des zweiten Differenzverstärkers (34),
p) eine dritte Diskriminatorschaltung (36), die nur dann ein Ausgangssignal mit hohem Wert abgibt, wenn Ausgangssignale der zweiten Mittelungsschaltung (35) kleiner als ein vorbestimmter Wert sind, t f
q) eine vierte Diskriminatorschaltung (37), die nur dann ein Ausgangssignal mit hohem Wert abgibt, wenn Ausgangssignale der zweiten Mittelungsschaltung (35) größer als ein weiterer vorbestimmter Wert sind,
r) eine zweite Formungsschaltung (38) zur Erzeugung von Signalen VO für offene Klänge und von Signalen VC für geschlossene Klänge aus Ausgangssignalen der dritten Diskriminatorschaltung (36) und der vierten Diskriminator schaltung (37),
■ copy
s) einen dritten Zähler (39) zum Zählen der Längen der durch die Signale VO repräsentierten offenen Klänge sowie der Längen der durch die Signale VCp repräsentierten geschlossenen Klänge,
t) eine zweite Vergleichsschaltung (41) zum Vergleichen der gezählten Werte des dritten Zählers (39) mit einem vorbestimmten Wert und zur Abgabe eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten' Wert überschreitet,
u) eine zweite Codierschaltung (43) zur Erzeugung einer Gruppe von Signalen DF3 und DF aus einem vierten Signal VO und einem fünften Signal VC, wobei das vierte Signal nur dann einen hohen Wert hat, wenn die Signale VO für offene Klänge einen hohen Wert haben und auch die Ausgangs signale der zweiten Vergleichsschaltung (41) einen hohen Wert haben, während das fünfte Signal VC nur dann den hohen Wert hat, wenn die Signale VC für geschlossene J Klänge den hohen Wert haben und die Ausgangssignale der zweiten Vergleichsschaltung (41) ebenfalls den hohen Wert, haben,
v) ein erstes Speichersystem zur Speicherung der codierten j Signale DF3, DF3, DF1 und DFQ, i
w) ein zweites Speichersystem zum Speichern von Zählinhalten' des ersten Zählers (24), des zweiten Zählers (22) und des dritten Zählers (39) entsprechend den codierten Signalen ; DF3, DF2, DF1 und DFQ, :
x) ein drittes Speichersystem (7) zum Speichern von Bezugs- mustern und
BAD ORIGINAL
y) einen Computer (4), der das Abspeichern der codierten Signale DF3, DF3,.DF1 und DFQ sowie der Zählinhalte der drei Zähler (24, 22, 39) ini ersten und im zweiten Speichersystem bewirkt und der die Signale mit den im dritten Speichersystem gespeicherten Bezugsmustern vergleicht.
52. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch .
a) eine erste Filterbank (9) zum Auswählen der in einem Bereich von 0 bis 0,5 kHz liegenden Energieanteile der Nachricht,
b) eine zweite Filterbank (10) zum Auswählen der in einem Bereich von 0,5 bis 1,0 kHz liegenden Energieanteile der Nachricht,
c) eine dritte Filterbank (45) zum Auswählen der in einem Bereich von 0,8 bis 1,8 kHz liegenden Energieanteile der Nachricht,
d) eine vierte Filterbank (46) zum Auswählen der in einem Bereich von 1,8 bis 3,2 kHz liegenden Energieanteile der
. Nachricht,
e) eine fünfte Filterbank (47) zum Auswählen der in einem Bereich von 5 bis 12 kHz liegenden Energieanteile der Nachricht,
COPY
f) einen ersten Differenzverstärker (49) , der die Ausgangssignale der ersten Filterbank (9) und der zweiten Filterbank (10) gemeinsam von Ausgangssignalen der fünften Filterbank (47) subtrahiert,
g) einen zweiten Differenzverstärker (53) , der die Ausgangssignale der ersten Filterbank (9) von AusgangsSignalen der zweiten Filterbank (10) subtrahiert,
h) einen dritten Differenzverstärker (57) , der die Ausgangssignale der dritten Filterbank (45) von Ausgangssignalen der vierten Filterbank (46) subtrahiert,
i) mehrere Diskriminatorschaltungen (61 - 66), die aus jewe: ligen Ausgangssignalen der drei Differenzverstärker (49, 53, 57) unterscheidende Ausgangssignale erzeugt,
j) eine erste Speicherschaltung (15) zum Speichern der Ausgangssignale der Diskriminatorschaltungen (61 - 66) , ':
k) eine zweite Speicherschaltung (7) zum Speichern der Bezu< muster und
1) einen CoSnputer ■ (4) , der die Abspeicherung der Ausgangs- '■ signale der Diskriminatorschaltungen (61 - 66) in der erste] Speicherschaltung (15) bewirkt und der diese Ausgangssignale mit den jeweiligen Bezugsmustern vergleicht.
BAD ORIGINAL
DE19823200645 1982-01-12 1982-01-12 "verfahren und vorrichtung zur spracherkennung" Granted DE3200645A1 (de)

Priority Applications (2)

Application Number Priority Date Filing Date Title
DE3249698A DE3249698C2 (en) 1982-01-12 1982-01-12 Method for speech recognition and device for carrying out this method
DE19823200645 DE3200645A1 (de) 1982-01-12 1982-01-12 "verfahren und vorrichtung zur spracherkennung"

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
DE19823200645 DE3200645A1 (de) 1982-01-12 1982-01-12 "verfahren und vorrichtung zur spracherkennung"

Publications (2)

Publication Number Publication Date
DE3200645A1 true DE3200645A1 (de) 1983-07-21
DE3200645C2 DE3200645C2 (de) 1987-06-25

Family

ID=6152886

Family Applications (2)

Application Number Title Priority Date Filing Date
DE19823200645 Granted DE3200645A1 (de) 1982-01-12 1982-01-12 "verfahren und vorrichtung zur spracherkennung"
DE3249698A Expired DE3249698C2 (en) 1982-01-12 1982-01-12 Method for speech recognition and device for carrying out this method

Family Applications After (1)

Application Number Title Priority Date Filing Date
DE3249698A Expired DE3249698C2 (en) 1982-01-12 1982-01-12 Method for speech recognition and device for carrying out this method

Country Status (1)

Country Link
DE (2) DE3200645A1 (de)

Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US2297528A (en) 1941-12-12 1942-09-29 Bell Henry Barto Fraud prevention device for meters
DE957235C (de) * 1953-04-21 1957-01-31 Nordwestdeutscher Rundfunk Ans Verfahren zur UEbertragung oder Speicherung von Schallereignissen, bei dem der zu uebertragende Frequenzbereich in zwei getrennte Bereiche aufgeteilt wird
DE2020753A1 (de) * 1969-07-30 1971-02-11 Rca Corp Einrichtung zum Erkennen vorgegebener Sprachlaute
DE2400027A1 (de) * 1973-01-08 1974-07-25 Xerox Corp Verfahren und vorrichtung zum erkennen von worten
US3946157A (en) * 1971-08-18 1976-03-23 Jean Albert Dreyfus Speech recognition device for controlling a machine
US4297528A (en) 1979-09-10 1981-10-27 Interstate Electronics Corp. Training circuit for audio signal recognition computer

Patent Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US2297528A (en) 1941-12-12 1942-09-29 Bell Henry Barto Fraud prevention device for meters
DE957235C (de) * 1953-04-21 1957-01-31 Nordwestdeutscher Rundfunk Ans Verfahren zur UEbertragung oder Speicherung von Schallereignissen, bei dem der zu uebertragende Frequenzbereich in zwei getrennte Bereiche aufgeteilt wird
DE2020753A1 (de) * 1969-07-30 1971-02-11 Rca Corp Einrichtung zum Erkennen vorgegebener Sprachlaute
US3946157A (en) * 1971-08-18 1976-03-23 Jean Albert Dreyfus Speech recognition device for controlling a machine
DE2400027A1 (de) * 1973-01-08 1974-07-25 Xerox Corp Verfahren und vorrichtung zum erkennen von worten
US4297528A (en) 1979-09-10 1981-10-27 Interstate Electronics Corp. Training circuit for audio signal recognition computer

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
WINCKEL, Fritz, Grundlagen der natürlichen und elektronischen Spracherkennung, In: ETZ-B, Bd. 19, 1967, Heft 23, S. 673-678 *
Winckel, Fritz, Grundlagen der natürlichen und elektronischen Spracherkennung, In: ETZ-B., 1967, Bd. 19, H. 23, S. 673-678

Also Published As

Publication number Publication date
DE3249698C2 (en) 1987-11-26
DE3200645C2 (de) 1987-06-25

Similar Documents

Publication Publication Date Title
DE69421911T2 (de) Spracherkennung mit pausedetektion
DE2626793C3 (de) Elektrische Schaltungsanordnung zum Bestimmen des stimmhaften oder stimmlosen Zustandes eines Sprachsignals
DE3783154T2 (de) Spracherkennungssystem.
DE69430082T2 (de) Verfahren und Vorrichtung zur Sprachdetektion
DE102004049457B3 (de) Verfahren und Vorrichtung zur Extraktion einer einem Audiosignal zu Grunde liegenden Melodie
DE69030561T2 (de) Spracherkennungseinrichtung
DE2918533C2 (de)
DE69311303T2 (de) Sprachtrainingshilfe für kinder.
DE3687815T2 (de) Verfahren und vorrichtung zur sprachanalyse.
DE2753277C2 (de) Verfahren und Einrichtung zur Spracherkennung
DE3236834C2 (de) Verfahren und Gerät zur Sprachanalyse
DE3236832C2 (de) Verfahren und Gerät zur Sprachanalyse
DE19847419A1 (de) Verfahren zur automatischen Erkennung einer buchstabierten sprachlichen Äußerung
DE2326517A1 (de) Verfahren und schaltungsanordnung zum erkennen von gesprochenen woertern
DE19942178C1 (de) Verfahren zum Aufbereiten einer Datenbank für die automatische Sprachverarbeitung
DE4031638C2 (de)
DE2524804A1 (de) Verfahren und vorrichtung zur automatischen spracherkennung
DE2020753A1 (de) Einrichtung zum Erkennen vorgegebener Sprachlaute
DE3853702T2 (de) Spracherkennung.
EP1282897A1 (de) Verfahren zum erzeugen einer sprachdatenbank für einen zielwortschatz zum trainieren eines spracherkennungssystems
DE102004049478A1 (de) Verfahren und Vorrichtung zur Glättung eines Melodieliniensegments
DE1206167B (de) Schaltung zur Verbesserung der Erkennbarkeit von Lauten bei der Schallanalyse
DE102004049517B4 (de) Extraktion einer einem Audiosignal zu Grunde liegenden Melodie
EP1076896B1 (de) Verfahren und vorrichtung zur erkennung mindestens eines schlüsselworts in gesprochener sprache durch einen rechner
DE19854420C2 (de) Verfahren und Einrichtung zum Verarbeiten von Schallsignalen

Legal Events

Date Code Title Description
OP8 Request for examination as to paragraph 44 patent law
8172 Supplementary division/partition in:

Ref country code: DE

Ref document number: 3249698

Format of ref document f/p: P

Q171 Divided out to:

Ref country code: DE

Ref document number: 3249698

AH Division in

Ref country code: DE

Ref document number: 3249698

Format of ref document f/p: P

D2 Grant after examination
AH Division in

Ref country code: DE

Ref document number: 3249698

Format of ref document f/p: P

8364 No opposition during term of opposition
8339 Ceased/non-payment of the annual fee