DE3200645A1 - "verfahren und vorrichtung zur spracherkennung" - Google Patents
"verfahren und vorrichtung zur spracherkennung"Info
- Publication number
- DE3200645A1 DE3200645A1 DE19823200645 DE3200645A DE3200645A1 DE 3200645 A1 DE3200645 A1 DE 3200645A1 DE 19823200645 DE19823200645 DE 19823200645 DE 3200645 A DE3200645 A DE 3200645A DE 3200645 A1 DE3200645 A1 DE 3200645A1
- Authority
- DE
- Germany
- Prior art keywords
- sounds
- signals
- sound
- voiced
- unvoiced
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
- 238000000034 method Methods 0.000 title claims abstract description 106
- 230000015654 memory Effects 0.000 claims description 43
- 238000012935 Averaging Methods 0.000 claims description 41
- 230000008569 process Effects 0.000 claims description 37
- 238000003860 storage Methods 0.000 claims description 27
- 238000009826 distribution Methods 0.000 claims description 20
- 238000012545 processing Methods 0.000 claims description 18
- 239000002360 explosive Substances 0.000 claims description 17
- 238000007493 shaping process Methods 0.000 claims description 16
- 239000012141 concentrate Substances 0.000 claims description 9
- 230000006870 function Effects 0.000 claims description 9
- 239000002131 composite material Substances 0.000 claims description 2
- 230000006835 compression Effects 0.000 claims 9
- 238000007906 compression Methods 0.000 claims 9
- 239000013074 reference sample Substances 0.000 claims 3
- 150000001875 compounds Chemical class 0.000 claims 1
- 238000011156 evaluation Methods 0.000 claims 1
- 230000036651 mood Effects 0.000 claims 1
- 239000000523 sample Substances 0.000 claims 1
- 230000003068 static effect Effects 0.000 claims 1
- 238000001514 detection method Methods 0.000 abstract description 10
- 230000002123 temporal effect Effects 0.000 abstract description 4
- 230000005236 sound signal Effects 0.000 description 34
- 238000005070 sampling Methods 0.000 description 33
- 238000010606 normalization Methods 0.000 description 20
- 230000004044 response Effects 0.000 description 15
- 238000010586 diagram Methods 0.000 description 14
- 230000010354 integration Effects 0.000 description 14
- 230000015572 biosynthetic process Effects 0.000 description 9
- 238000006243 chemical reaction Methods 0.000 description 8
- 238000001228 spectrum Methods 0.000 description 7
- 230000007704 transition Effects 0.000 description 7
- 230000001419 dependent effect Effects 0.000 description 5
- FAPWRFPIFSIZLT-UHFFFAOYSA-M Sodium chloride Chemical compound [Na+].[Cl-] FAPWRFPIFSIZLT-UHFFFAOYSA-M 0.000 description 3
- 230000000694 effects Effects 0.000 description 3
- 238000012217 deletion Methods 0.000 description 2
- 230000037430 deletion Effects 0.000 description 2
- 230000008030 elimination Effects 0.000 description 2
- 238000003379 elimination reaction Methods 0.000 description 2
- 238000012986 modification Methods 0.000 description 2
- 230000004048 modification Effects 0.000 description 2
- 238000000465 moulding Methods 0.000 description 2
- 238000002360 preparation method Methods 0.000 description 2
- 230000003014 reinforcing effect Effects 0.000 description 2
- 238000012549 training Methods 0.000 description 2
- 101100524645 Toxoplasma gondii ROM5 gene Proteins 0.000 description 1
- 230000009471 action Effects 0.000 description 1
- 230000009286 beneficial effect Effects 0.000 description 1
- 230000008901 benefit Effects 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 238000005352 clarification Methods 0.000 description 1
- 230000000052 comparative effect Effects 0.000 description 1
- 230000007423 decrease Effects 0.000 description 1
- 230000008034 disappearance Effects 0.000 description 1
- 238000002474 experimental method Methods 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 238000007689 inspection Methods 0.000 description 1
- 210000004072 lung Anatomy 0.000 description 1
- 238000001208 nuclear magnetic resonance pulse sequence Methods 0.000 description 1
- 210000000056 organ Anatomy 0.000 description 1
- 238000003825 pressing Methods 0.000 description 1
- 230000009467 reduction Effects 0.000 description 1
- 230000002787 reinforcement Effects 0.000 description 1
- 238000000926 separation method Methods 0.000 description 1
- 239000011780 sodium chloride Substances 0.000 description 1
- 238000009331 sowing Methods 0.000 description 1
- 230000001960 triggered effect Effects 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Description
PRINZ, BUNKE":&.-PPcR:TNER.
jropea
Patentanwälte · European Patent Attorneys München «~ r- Stuttgart
MATSUSHITA ELECTRIC WORKS, LTD. 12. Januar 1982
1048, Oaza-Kadoma, Kadoma-shi,
Osaka 571, Japan
Osaka 571, Japan
Unser Zeichen: M 1521
Verfahren und Vorrichtung zur Spracherkennung
Die Erfindung bezieht sich auf ein Verfahren und eine Vorrichtung zur Spracherkennung, wobei durch phonetische Analyse
gesprochener Nachrichten Steuersignale für die Steuerung des Betriebs gesteuerter Maschinen oder Geräte, beispielsweise
eines Massagegeräts, einer automatischen Tür oder dergleichen, erzeugt werden.
Für ein solches Verfahren und eine solche Vorrichtung ist aus der US-PS 3 94 6 157 eine Methode bekannt, bei der zeitliche
Schwankungen der Sprachenergie E der mittels eines Mikrophons erfaßten Nachricht in einem vorbestimmten Frequenzband
(200 bis 3400 Hz) gemessen werden, dann die zeitliche Ableitung dE/dt der zeitlichen Schwankungen der Energie E
bestimmt werden und dann zusätzlich die Energieverteilung E im Frequenzband von 200 bis 800 Hz, die Energieverteilung E^
im Frequenzband von 800 bis 1600 Hz und die Energieverteilung E1, im Frequenzband von 1600 bis 3400 Hz gemessen werden.
Wenn die Energie E vorhanden ist, während der Impuls der Ableitung dE/dt niedrig ist und ein hoher Impuls der Energie-
Schw/Ma
Verteilung E vorhanden ist, wird der Klang als /S/ unterschieden,
also als ein stimmloser Reiblaut. Wenn die Energie E vorhanden ist, während der Impuls der Ableitung dE/dt hoch
ist und ein hoher Impuls in der Energieverteilung E„ vorhan-
. den ist; wird der Klang als /T/ unterschieden, d.h. als stimmloser
Sprenglaut. Wenn die Energie E vorhanden ist und auch in der Energieverteilung EM ein hoher Impuls vorhanden ist,
wird der Klang als /A/ unterschieden, d.h. als stimmhafter mittlerer Vokal. Bei Anwesenheit der Energie E und eines
hohen Impulses in der Energieverteilung E wird der Klang als /O/ unterschieden, d.h. als stimmhafter tiefer Vokal.
Außerdem wird der Klang als /I/ unterschieden, also als stimmhafter hoher Vokal, wenn die Energie E vorhanden ist und die
Energieverteilungen En und E„ gleichzeitig einen hohen Impuls
D ri
enthalten. Diese Unterscheidungen werden in einer ersten Logikschaltung ausgeführt, und der Inhalt der gesamten gesprochenen
Nachricht wird durch Vergleich der Ausgangssignale der ersten Logikschaltung mit einer Codetabelle in einer
zweiten Logikschaltung erkannt. In dieser Anordnung wird je- : doch eine Differenzierschaltung benötigt, und es gilt,, daß
zum Erkennen eines nasalen Konsonanten /N/, einer geflüster- ,
ten Nachricht oder dergleichen die Energie der gesprochenen Nachricht in jedem einer größeren Anzahl von Frequenzbändern
gemessen werden muß I 'Das bekannte Verfahren war daher in mancher
Hinsicht nachteilig. Wenn die gesprochene Nachricht in einem aus mehreren Wörtern bestehenden Satz vorliegt, konnte
sie mittels dieses Verfahrens nicht behandelt werden.
Mit Hilfe der Erfindung sollen daher ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wodurch
in einer gesprochenen Nachricht enthaltene, durch stimmhafte oder stimmlose Laute gebildete Phoneme unterschieden
werden können, und wodurch für den Fall, daß nur stimmhafte Laute vorhanden sind, die Inhalte der Nachricht mit
Hilfe von nur vier Signalen erkannt werden können, die erhal-
COPY
---■•■r^j
ten werden können, indem unterschieden wird, ob die Laute offene oder geschlossene Klänge sind.
Ferner sollen mit Hilfe der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine
gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird und
mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangs-Signalen der Filterbänke unterschieden wird, ob die Nachrieht
aus stimmhaften oder stimmlosen Lauten besteht und ob es sich im Fall von stimmhaften Lauten um offene oder geschlossene
Klänge handelt.
Ferner sollen mittels der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine
gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, und von
den mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der Filterbänke erhaltenen Signalen werden die Stimmhaftlaut-
und die Stimmloslautsignale, die Signale stimmhafter oder stimmloser Laute enthalten, auf der ersten Rangebene behandelt,
während die Signale, die Signale offener oder geschlossener Laute enthalten, auf der zweiten Rangebene behandelt
werden, damit der Erkennungsvorgang schnell durchgeführt wird.
Weiterhin sollen mit Hilfe der Erfindung ein Verfahren und eine Vorrichtung zur Spracherkennung geschaffen werden, wobei
eine gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt
wird, und von mittels Subtraktionen zwischen jeweiligen Ausgangssignalen der Filterbänke erhaltenen Signalen werden
die Signale für stimmhafte und stimmlose Laute auf der ersten Rangebene in drei Werte umgesetzt, während die Signale für
offene und geschlossene Klänge auf der zweiten Rangebene in drei
COPY
Werte umgesetzt werden, wodurch die anschließenden Verarbeitungen einfacher gestaltet werden.
Ferner sollen mit Hilfe der Erfindung· ein Verfahren und
eine Vorrichtung zur Spracherkennung geschaffen werden, wobei eine gesprochene Nachricht mehreren Filterbänken mit
jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt
wird, nämlich einer ersten Filtergruppe mit einem Frequenzband von 0 bis 1 kHz, in dem sich die Energieanteile der stimm
haften Sprachlaute konzentrieren, und einer zweiten Filterbank mit einem Frequenzband von 2 bis 12 kHz, in dem sich
die Energieanteile der stimmlosen Sprachlaute konzentrieren; mi Hilfe einer Subtraktion zwischen jeweiligen Ausgangssignalen
der ersten und zweiten Filterbänke werden Signale für stimmhafte und stimmlose Laute erzeugt, und es werden Signale für
stimmhafte, stimmlose und stumme Sprachlaute erzeugt, wenn die Signale für stimmhafte und stimmlose Sprachlaute einen
vorbestimmten Wert überschreiten, kleiner als ein weiterer vorbestimmter Wert sind bzw. zwischen den beiden vorbestimmten
Werten liegen; diese drei Signale werden mit zuvor gespeicherten Bezugsmustern verglichen, so daß der Inhalt der
gesprochenen Nachricht erkannt werden kann.
Mit Hilfe der Erfindung sollen ferner ein Verfahren und eine "
Vorrichtung zur Spracherkennung geschaffen werden, wobei die jeweiligen Längen der obengenannten drei Signale, d.h. der
Signale für stimmhafte, stimmlose und stumme Sprachlaute, gemessen werden und vorhandene Muster der drei Signale sowie
Muster der gemessenen Längen mit Bezugsmustern verglichen werden, damit die Erkennungsgenauigkeit verbessert wird.
Außerdem sollen mittels der Erfindung ein Verfahren und eine : Vorrichtung zur Spracherkennung geschaffen werden, wobei zur
richtigen Erkennung einer gesprochenen Nachricht unabhängig von der Anwesenheit oder der Abwesenheit eines Signals für
COPY
einen stimmlosen Laut im Anschluß an ein Signal für einen
stummen Laut ein Bezugsmuster, in dem das Signal für einen
stimmlosen Laut folgt, sowie ein Bezugsmuster, in dem das
Signal für einen stimmlosen Laut nicht folgt, im Hinblick
auf ein Bezugsmuster mit Signalen für stumme Laute erzeugt
werden, wodurch jeder auf phonetische Unterschiede zwischen
stummen Laut ein Bezugsmuster, in dem das Signal für einen
stimmlosen Laut folgt, sowie ein Bezugsmuster, in dem das
Signal für einen stimmlosen Laut nicht folgt, im Hinblick
auf ein Bezugsmuster mit Signalen für stumme Laute erzeugt
werden, wodurch jeder auf phonetische Unterschiede zwischen
einzelnen Sprechern und dergleichen in der gesprochenen
- -- ϊΐ Nachricht zurückzuführende Einfluß eliminiert werden kann ' C
und die allgemeine Anwendbarkeit des Verfahrens und der Vor- J
richtung gewährleistet werden kann. jj
Mit Hilfe der Erfindung sollen ferner ein Verfahren und eine :■!
Vorrichtung zur Spracherkennung geschaffen werden, wobei eine '<
.i gesprochene Nachricht mehreren Filterbänken mit jeweils unter-
schiedlichen Durchlaßfrequenzbändern zugeführt wird, nämlich
einer ersten Filterbank, die ein Frequenzband von 0 bis 500 Hz
durchläßt, in dem die Energieanteile mittlerer und offener
Klänge in stimmhaften Lauten konzentriert sind, sowie eine
zweite Filterbank, die ein Frequenzband von 0,5 bis 1 kHz
durchläßt, in dem die Energieanteile mittlerer und geschlossener Klänge in stimmhaften Lauten konzentriert sind; Signale . j?
einer ersten Filterbank, die ein Frequenzband von 0 bis 500 Hz
durchläßt, in dem die Energieanteile mittlerer und offener
Klänge in stimmhaften Lauten konzentriert sind, sowie eine
zweite Filterbank, die ein Frequenzband von 0,5 bis 1 kHz
durchläßt, in dem die Energieanteile mittlerer und geschlossener Klänge in stimmhaften Lauten konzentriert sind; Signale . j?
für offene und geschlossene Klänge werden mit Hilfe von Sub- Ji
ί-traktionen zwischen jeweiligen Ausgangssignalen der beiden ,;
Filterbänke erhalten, und Signale für offene, geschlossene und stumme ίί
Klänge werden abhängig davon erzeugt, daß die Signale für ,;
offene und geschlossene Klänge einen vorbestimmten Wert über- ^
schreiten, kleiner als ein weiterer vorbestimmter Wert sind {?
oder zwischen den beiden vorbestimmten Werten liegen; die '--
drei Signale werden mit zuvor gespeicherten Bezugsmustern f
verglichen, damit der Inhalt der gesprochenen Nachricht er- '■
kannt wird. ■ j:
Außerdem sollen mit Hilfe der Erfindung ein Verfahren und eine
Vorrichtung zur Spracherkennung geschaffen werden, wobei die ]
Längen der obigen drei Signale, d.h. der Signale für offene, ;·
geschlossene und stumme Klänge, gemessen und vorhandene Muster \
er drei Signale sowie Muster der Längen jeweils mit Bezugsmustern \
verglichen werden, damit die Erkennungsgenauigkeit verbessert wird.
Weiterhin werden mit Hilfe der Erfindung ein Verfahren und : eine Vorrichtung zur Spracherkennung geschaffen, wobei eine
gesprochene Nachricht mehreren Filterbänken mit jeweils unterschiedlichen Durchlaßfrequenzbändern zugeführt wird, nämlich -':
einer ersten Filterbank mit einem Frequenzband von 0 bis 1 kHz, in dem die Energieanteile stimmhafter Laute konzentriert sind,
einer zweiten Filterbank mit einem Frequenzband von 2 bis 12 kHz, in dem die Energieanteile stimmloser Laute konzentriert
sind, einer dritten Filterbank mit einem Frequenzband von 0 bis 500 Hz, in dem die Energieanteile offener Klänge
stimmhafter Laute konzentriert sind, und einer vierten Filterbank mit einem Durchlaßband von 0,1 bis 1 kHz, in dem die
Energieanteile geschlossener Klage stimmhafter Laute konzentriert sind; Signale für stimmhafte und stimmlose Laute werden
mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der ersten und zweiten Filterbank erhalten, so daß
Signale für stimmhafte, stimmlose und stumme Laute abhängig ;
davon erzeugt werden, ob die Signale für stimmhafte und stimmlose Laute einen vorbestimmten ersten Wert überschreiten, '>
kleiner als ein vorbestimmter zweiter Wert sind oder zwischen ■ den beiden ersten und zweiten Werten liegen; Signale für |
offene und geschlossene Klänge werden mit Hilfe von Subtraktionen zwischen jeweiligen Ausgangssignalen der dritten und ;
vierten Filterbank erzeugt, so daß Signale für offene, geschlossene und stumme Klänge jeweils abhängig davon gebil- j
det werden, ob die Signale für offene und geschlossene Klänge einen vorbestimmten dritten Wert überschreiten, kleiner
als ein vorbestimmter vierter Wert sind oder zwischen dem dritten und vierten Wert liegen; ein weiteres Signal für |
offene Klänge wird erzeugt, wenn das Signal für stimmhafte Laute und das Signal für offene Klänge gleichzeitig vorhanden
sind; ein weiteres Signal für geschlossene Klänge wird erzeugt, wenn das Signal für stimmhafte Laute und das Signal
für geschlossene Klänge gleichzeitig vorhanden sind; ein
COPY
,M- ■
weiteres Signal für mittlere Klänge wird erzeugt, wenn das
Signal für stimmhafte Laute und das Signal für stumme Klänge
gleichzeitig vorhanden sind; als Ergebnis wird der Inhalt
der gesprochenen Nachricht dadurch erkannt, daß die fünf
Signale, nämlich das für offene Klänge, das für geschlossene
Klänge, das für mittlere Klänge, das für stumme Laute und
das für stumme Klänge mit zuvor gespeicherten Bezugsmustern .- Yi verglichen wird. Das zu schaffende Verfahren und die zu ~"
schaffende Vorrichtung zur Spracherkennung sollen so ausgestaltet sein, daß die fünf Signale nacheinander mit dem Be- j: zugsmuster verglichen werden. ' /.-
Signal für stimmhafte Laute und das Signal für stumme Klänge
gleichzeitig vorhanden sind; als Ergebnis wird der Inhalt
der gesprochenen Nachricht dadurch erkannt, daß die fünf
Signale, nämlich das für offene Klänge, das für geschlossene
Klänge, das für mittlere Klänge, das für stumme Laute und
das für stumme Klänge mit zuvor gespeicherten Bezugsmustern .- Yi verglichen wird. Das zu schaffende Verfahren und die zu ~"
schaffende Vorrichtung zur Spracherkennung sollen so ausgestaltet sein, daß die fünf Signale nacheinander mit dem Be- j: zugsmuster verglichen werden. ' /.-
Bei dem zu schaffenden Verfahren und der zu schaffenden Vorrich- i--
tung zur Spracherkennung sollen die fünf Signale ebenso wie \
ihre jeweilige Dauer nacheinander mit den Bezugsmustern ver- *
glichen werden. :
I Die Erfindung wird nun unter Bezugnahme auf die Zeichnung ,-]
beispielshalber erläutert. Es zeigen: \
Fig. 1 ein Blockschaltbild eines Systems zur Erkennung von :"?.
Phonemeleme.nten in. einer gesprochenen Nachricht unter ;'j
Verwendung »der Erfindung, ' "
■ - H
Fig. 2 eine als Blockschaltbild dargestellte Aus führungs form }j
einer Erkennungsvorrichtung nach der Erfindung, j
Fig. 3 ein.Frequenzspektrum eines Beispiels einer mit Hilfe j
der Erfindung zu behandelnden gesprochenen Nachricht, i
wobei die Nachricht /Senakaosasure/ eines japanischen .\
Satzes lautet, .;
Fig. 4 ein Diagramm mit Signalen V für stimmhafte Laute und
Signalen UV für stimmlose Laute, wenn die Nachricht ,·
/Senakaosasure/ von der Erkennungsvorrichtung von Fig. 2 ·\
empfangen wird, wobei die gleichen Signale V und UV auch COPY
in den anderen Ausführungsformen erzeugt werden, \
Fig. 5 ein Blockschaltbild einer weiteren Ausführungsform
der Erkennungsvorrichtung nach der Erfindung,
Fig. 6 ein Diagramm mit Signalen VO und VC für offene und geschlossene
Klänge, die erzeugt werden, wenn die gesprochene Nachricht /Senakaosasure/ die Ausführungsform von Fig. 5 erreicht, wobei die Signale V und UV
die gleichen wie in Fig. 4 sind,
Fig. 7 ein Flußdiagramm eines Erkennungsverfahrens nach der
Erfindung entsprechend der Erkennungsvorrichtung von Fig. 2,
Fig. 8 ein Flußdiagramm einer weiteren Ausführungsvorm des
Verfahrens nach der Erfindung entsprechend Fig. 5,
Fig. 9 bis 12
Flußdiagramme weiterer Ausführungsbeispiele des Verfahrens
nach der Erfindung, wobei die Figuren 9 und 11 für Fig. 2 und die Figuren 10 und 12 für Fig. 5 gelten,
Fig. 13 und 14
Blockschaltbilder weiterer Ausführungsformen von Erken-!
nungsvorrichtungen nach der Erfindung, ■
Fig. 15 bis 18 :-
Flußdiagramme weiterer Ausführungsbeispiele des erfin-;
dungsgemäßen Verfahrens, wobei die Figuren 15 und 17 für die Vorrichtung von Fig. 13 und die Figuren 16 und
18 für die Vorrichtung von Fig. 14 gelten,
Fig. 19 ein Schaltbild einer weiteren Ausführungsform der Vor-■
richtung von Fig. 13 zur Erzeugung notwendiger Signale
aus Signalen für stimmhafte und stimmlose Laute,
COPY
- /9Γ" -
wobei "V/UV" der nur durch stimmhafte Laute V, stimmlose Laute UV und stumme Laute S gekennzeichnete Fall ist,
"V(D" bis "V(4)" speziellere Muster jeweiliger stimmhafter Laute V in der Nachricht bedeuten, von einem Kreis
umgebene Ziffern an den jeweiligen Wegen Sprechhäufigkeiten fü-r den Fall von aufeinanderfolgenden fünf
Sprechvorgängen angeben, die zeitliche Länge der jeweiligen Kästchen normierte Längen von Klängen angeben und
Fig. 20 bis 22
Diagramme zur Erläuterung der Wirkungsweise der Schaltung von Fig. 19, - ■.
Fig. 23 ein Schaltbild eines weiteren Ausführungsbeispiels ;
der Vorrichtung von Fig. 14 zur Erzeugung notwendiger Signale aus Signalen für stimmhafte und stimmlose Laute : jj
Ij und aus Signalen für offene und geschlossene Klänge, 1
wobei die Arbeitsweise dieser Ausführungsform in j
Fig. 22 dargestellt ist,
Fig. 24 bis 26
Schaltbilder weiterer Ausführungsbeispiele der Vorrichtung von Fig. 14, wobei die Figuren 25A bis 25C
Diagramme zur Erläuterung der Wirkungsweise der Schaltung von Fig. 2 4 sind,
Fig. 27A bis 27E
Flußdiagramme für weitere Ausführungsbeispiele des Erkennungsverfahrens nach der Erfindung, h
Fig. 2 8 ein Diagramm zur genaueren Erläuterung der Vorgänge : _,
H bei den in den Figuren 27C und 27D dargestellten jj Verfahren bei Verwendung der gesprochenen Nachricht
/Senakaosasure/,
Fig. 2 9 schematische Phonemmuster der Nachricht /Senakaosasure/,
schraffierte Abschnitte jeweilige Perioden stummer Laute S und mittlerer Klänge VM am Übergang von einem
Phonem zum anderen bedeuten, "
Fig. 30 eine erläuternde Darstellung der Bezugsmustererzeugung nach der Erfindung, *■"- \
Fig. 31 ein Flußdiagramm zur genauen Erläuterung eines .Teils *
des Schritts zur Erzeugung der Bezugsmuster von Fig. 30 nach der Erfindung,
Fig. 32A bis 32C
erläuternde Darstellungen zum Flußdiagramm von Fig. 31 und
Fig. 33 ein Flußdiagramm mit weiteren Einzelheiten eines Teils des Schritts zur Bezugsmustererzeugung von Fig. 30. :
Die Erfindung wird anschließend im Zusammenhang mit den in !
der Zeichnung dargestellten bevorzugten Ausführungsbeispielen t schrieben, doch sollte sie dadurch nicht nur auf diese Ausführung
beispiele beschränkt werden,, sondern alle Abwandlungen, A'nderur
gen und äquivalente Ausführungen umfassen, die im Rahmen der · \
Ansprüche möglich sind. - i:
Unter Bezugnahme auf das in Fig. 1 dargestellte System zur ϊ
Erkennung von Phonemelementen einer gesprochenen Nachricht nacl·
der Erfindung soll eine von einem Sprecher gesprochene Nach- ■
rieht dadurch erkannt werden, daß in selektiver Weise die in \
der gesprochenen Nachricht enthaltenen Phoneme P in stimmhafte Laute V und in stimmlose Laute UV (STEP (P->-V/UV) ) getrennt werde]
die stimmlosen Laute UV in Reiblaute F und Sprenglaute PL(STEP(UV+F/PL)) unterteilt· werden und die stimmhaften Laute'
V in offene Klänge VO, d.h. Klänge mit hoher Energie des erste: Formanten, und in geschlossene Klänge VC, d.h. in Klänge.mit i
BAD ORIGINAL
Vr -
■ Us
niedriger Energie im ersten Formanten (STEP (V-»-VO/VC) ) unter- :
teilt werden.
In der in Fig. 2 dargestellten ersten Ausführungsform der
Erfindung werden Tasten eines Tastenfeldes 1 betätigt, und ein Startbefehl zum Schreiben von Bezugsmustern wird anfänglich
in einen Betriebsspeicher RAM3 über eine Busleitung 2 ' .'·
eingespeichert. Wenn ein in einem Computer CPU4 ausgeführtes Programm den Vorgang des Schreibens des Bezugsmusters erreicht,
wird der Startbefehl aus dem Betriebsspeicher 3 gelesen, und als Reaktion auf diesen Befehl wird aus einem Programmspeicher
R0M5 ein Bezugsmuster-Schreibprogramm gelesen; als Reaktion auf dieses Programm bewirkt der Computer 4 das
Abspeichern der über das Tastenfeld 1 , das Mikrophon 6 oder eine andere geeignete Einrichtung gelieferten Bezugsmuster in einem Speicher 7. Im vorliegenden Fall soH auf die
über das Mikrophon 6 gelieferten Bezugsmuster Bezug genommen werden. Wenn das Bezugsmuster des als Beispiel verwendeten
Ausdrucks "Senakaosasure" (der dem Ausdruck "Massiere den Rücken") entspricht, mit dem in Fig. 3 dargestellten Spektrum
in das Mikrophon 6 eingegeben wird, wird es durch einen Vor- ; Verstärker 8 geschickt und von einer ersten Filterbank 9 und '
einer zweiten Filterbank 10 aufgeteilt. Die erste Filterbank läßt ein Frequenzband von 0 bis 1 kHz durch, und die zweite
Filterbank 10 .läßt .ein Frequenzband von 5 bis 10 kHz durch.
Ausgangssignale der ersten Filterbank 9 werden in einem Subtraktionsglied 11 von Ausgangssignalen der zweiten Filterbank
10 subtrahiert, und in einer Mittelungsschaltung 12 erfolgt eine Mittelung, wobei die Ergebnisse die in Fig. 4 dargestellten
Signale "stimmhafte Laute" und "stimmlose Laute" sind. Genauer gesagt stammt das Diagramm von Fig. 4 von dem Bezugsmuster, das von den beiden Filterbänken 9 und 10 behandelt
worden ist, nachdem es zunächst durch den Vorverstärker 8 und dann durch einen logarithmischen Verstärker 8-1 und einen
Wechselstromverstärker 8-2 von Fig. 2 3 verstärkt worden ist. COPY
- vt
. 46
In Fig. 3 ist die Frequenz in kHz an der Abszisse angegeben, und die Energie ist an der Ordinate angegeben; jede Abtastlinie
gibt ein Phonemspek.trum bei jeweils 10 ms an. Außerdem
sind auch die entsprechenden Phoneme der Nachricht "Senakaosai ■ angegeben. In Fig. 4 sind die Signale V und UV für die stimm-
\ haften Laute bzw. die stimmlosen Laute angegeben, die gemäß '■,
j den Spektren von Fig. 3 erhalten wurden; die den Abtastlinien
: von Fig. 3 entsprechenden Werte sind dabei an der Abszisse au:
getragen, wobei der Kurveriverlauf so ausgeführt ist, daß er den jeweiligen Zuständen entspricht, bei denen die Abtastung
- stimmhafte Laute zeigen (d.h. Werte über einem vorbestimmten
ersten Wert auf der positiven Seite haben) oder stimmlose Lau zeigen (d.h. Werte unterhalb eines vorbestimmten zweiten Wert
auf der negativen Seite haben) . Die Signale V und UV für stini
lose bzw. stimmhafte Laute werden einem A/D-Umsetzer 13 über die Mittelungsschaltung 12 zugeführt, damit sie digitalisiert
werden, und sie werden dann über E/A-Anschluß 14 in den Speie
7 eingegeben. Auf diese Weise wird der Schreibvorgang der Bezugsmuster beendet, jedoch können durch den gleichen Vorgar
auch weitere Bezugsmuster in den Speicher 7 geschrieben werde
Als nächstes., werden Vergleichsvorgänge der gesprochenen Nachricht
mit deja Bezugsmustern, d.h. das Erkennen der gesprocher
Nachricht, erläutert. Wenn der Computer 4 gemäß dem im Progrc speicher 5 gespeicherten Steuerprogramm mit dem Erkennen eine
gesprochenen Nachricht befaßt ist (was durch Betätigen der · Tasten des Tastenfeldes 1 erreicht werden kann) und die ge- j
sprochene Nachricht beispielsweise der oben angegebene Ausdri "Senakaosasure" in das Mikrophon 6 eingegeben wird, wird diei
Nachricht der ersten Filterbank 9 und der zweiten Filterbank über den Vorverstärker 8 zugeführt. In der gleichen Weise wi<
beim Schreiben der Bezugsmuster wird die gesprochene Nachric] durch den A/D-Umsetzer 13 digitalisiert und in einem Sprachnachrichtenspeicher
15 über den E/A-Anschluß 14 abgespeicher· Im Anschluß daran vergleicht der Computer 4 nacheinander die
BAD ORIGINAL
- ,13 -
im Speicher 15 enthaltene gesprochene Nachricht abhängig von
dem im Programmspeicher 5 enthaltenen Erkennungsprögramm mit
den im Speicher 7 gespeicherten Bezugsmustern beispielsweise ί
bezüglich jeder Abtastlinie. *;
■ ■ ■ ■ ■ ' ' H
Nach Beendigung des Vorgangs zum Erkennen der gesprochenen ~ |
Nachricht liefert der Computer 4 als Reaktion auf die Erken- ~ .·"- \
nungsergebnisse ein Ansteuersignal über den E/A-Anschluß 14 I
an nachfolgende Baueinheiten, beispielsweise ein Massagegerät \
16. ■ j-
In der in Fig. 2 dargestellten ersten Ausführungsform wird \,
die gesprochene Nachricht nur nach Umsetzung in die Signale '\
V und UV für stimmhafte bzw. stimmlose Laute benutzt. In diesem :
Fall bleibt die Tendenz dazu bestehen, daß bei einem völlig anderen Befehl, der jedoch die gleiche Anordnung stimmhafter ·
und stimmloser Klänge hat, eine Fehloperation auftreten kann,
i: wobei es überdies nicht leicht ist, die Anzahl der zu erkennenf den gesprochenen Nachrichten zu vergrößern. Es wird somit eine \
i: wobei es überdies nicht leicht ist, die Anzahl der zu erkennenf den gesprochenen Nachrichten zu vergrößern. Es wird somit eine \
[verbesserte Ausführung der oben erläuterten, in Fig. 2 darge- f
>
j
^stellten ersten Ausführungsform anschließend beschrieben. [
Ϋ;1η der in Fig. 5 dargestellten zweiten Ausführungsform der
^ Erfindung ist im Vergleich zur ersten Ausführungsform die
erste Filterbank 9 durch zwei erste Filterbänke 9-1 und 9-2
mit den Durchlaßbändern 0 bis 500 Hz bzw. 0,5 bis 1 kHz und
eine Additionsschaltung 11-1 zum Addieren der jeweiligen
Ausgangssignale der ersten Filterbänke 9-1 und 9-2 ersetzt.
Zusätzlich vorgesehen sind eine Subtraktionsschaltung 11-2
zum Subtrahieren der Ausgangssignale der ersten Filterbank 9-1
von den Ausgangssignalen der anderen ersten Filterbank 9-2,
eine Mittelungsschaltung 12-1 einschließlich einer Integrationsschaltung mit einer Zeitkonstanten von etwa 20 ms zum Mitteln
der Ausgangssignale der Subtraktionsschaltung 12-2 und ein
Multiplexer 17 zum Übertragen von Ausgangssignalen der Mitte-
^ Erfindung ist im Vergleich zur ersten Ausführungsform die
erste Filterbank 9 durch zwei erste Filterbänke 9-1 und 9-2
mit den Durchlaßbändern 0 bis 500 Hz bzw. 0,5 bis 1 kHz und
eine Additionsschaltung 11-1 zum Addieren der jeweiligen
Ausgangssignale der ersten Filterbänke 9-1 und 9-2 ersetzt.
Zusätzlich vorgesehen sind eine Subtraktionsschaltung 11-2
zum Subtrahieren der Ausgangssignale der ersten Filterbank 9-1
von den Ausgangssignalen der anderen ersten Filterbank 9-2,
eine Mittelungsschaltung 12-1 einschließlich einer Integrationsschaltung mit einer Zeitkonstanten von etwa 20 ms zum Mitteln
der Ausgangssignale der Subtraktionsschaltung 12-2 und ein
Multiplexer 17 zum Übertragen von Ausgangssignalen der Mitte-
BAD ORIGINAL
lungsschaltung 12-1 und der.obigen Mittelungsschaltung 12,
die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms enthält, zum A/D-Umsetzer 13. Die Subtraktionsschaltung 11 subtrahiert Ausgangssignale der Additionsschaltung
11-1 von Ausgangssignalen der zweiten Filterbank 10, und
sie steuert außerdem den Multiplexer 17 über den E/A-Anschluß i 14. Dadurch können Signale VO für offene Klänge und Signale VC
für geschlossene Klänge am Ausgang der Mittelungsschaltung :, 12-1 erzeugt werden. Diese Signale VO und VC können gemäß
Fig. 6 für den Ausdruck "Senakaosasure" dargestellt werden, der schematisch auch in den Figuren 3 und 4 gezeigt ist.
Ebenso wie die Signale V und UV für stimmhafte bzw. stimmlose Laute werden auch die Signale VO und VC für offene bzw. ge- :
schlossene Klänge in der Mittelungsschaltung 12-1 gemittelt und über den Multiplexer 17 dem A/D-Umsetzer 13 zugeführt,
damit sie durch diesen verarbeitet werden. ;
In der in Fig. 5 dargestellten zweiten Ausführungsform werden
die Signale VO für offene Klänge und VC für geschlossene Klänge zusätzlich zu den Signalen V für stimmhafte Laute und UV für
stimmlose Laute benutzt, so daß die Vorgänge des Schreibens · der Bezugsmuster und des Vergleichs dieser Bezugsmuster mit ■
der gesprochenen Nachricht sowie die Verarbeitungsvorgänge · jkomplizierter
werden, jedoch erg-ibt die größere Anzahl von | Vergleichsinformationen natürlich eine größere Genauigkeit \
bei der Nachrichtenerkennung als im Fall der ersten Ausführung form. Während in der ersten Ausführungsform nur der Trennvor- [
gang STEP(P+V/UV) mit den Signalen V für stimmhafte Laute und.
UV für stimmlose Laute gemäß Fig. 1 durchgeführt werden muß, ;
kann der Trennvorgang in der zweiten Ausführungsform sowohl gemäß STEP (P+V/UV) und STEP (V+VO/VC) mit den Signalen U für !
stimmhafte Laute und UV für stimmlose Laute bzw. für die Signa le VO für offene Klänge und VC für geschlossene Klänge durchge
führt werden. In -der ersten Ausführungsform ist somit die ange ordnete Reihenfolge der stimmhaften und stimmlosen Laute, ein I
BAD ORIGINAL *
-49- ■ ■ I
. . ■ ■ ί
Erkennungselement, während in der zweiten Aus führ ungs form j*
die angeordneten Reihenfolgen der stimmhaften und stimmlosen Laute sowie der offenen und geschlossenen Klänge als Erkennungselemente
dienen. . . "
Wie die oben beschriebenen ersten und zweiten Ausführungsformen arbeiten, wird nun unter Bezugnahme auf die Flußdiagramme
der Figuren 7 und 8 genauer erläutert.
Fig. 7 zeigt die Arbeitsweise der ersten Ausführungsform. Beim · Schreiben
der Bezugsmuster werden durch das Mikrophon erhaltene ■ gesprochene Standardnachrichten verstärkt und in Signale V für ;
stimmhafte Laute und UV für stimmlose Laute umgesetzt; diese '. Signale werden vom A/D-Umsetzer digitalisiert, und sie werden
als die Bezugsmuster über den links liegenden Weg im Speicher abgespeichert. Beim Erkennen der von einer Person gesprochenen
Nachricht wird die Schaltung auf den rechten Weg umgeschaltet, ; und die vom Mikrophon empfangene gesprochene Nachricht wird ;,
verstärkt und in Signale V für die stimmhaften Laute und UV !r
für die stimmlosen Laute umgesetzt; diese Signale werden dann ί;
vom A/D-Umsetzer digitalisiert und über den rechts liegenden ü
Weg einer Erkennungsanordnung abgeführt, also einer Anordnung, y\
in der sie mit den Bezugsmustern der im Speicher abgespeicher- 'J
ten gesprochenen Standardnachrichten verglichen wird. /j
In der Erkennungsanordnung werden die aus dem Speicher gele- j!
senen Signale V und UV der gegebenen Nachricht gewöhnlich ί schrittweise miteinander verglichen, und wenn eines der Bezugs- ',
muster mit den Signalen V und UV der gegebenen Nachricht übereinstimmt, wird für das nachfolgende Massagegerät oder dergleichen
abhängig von dem bestimmten übereinstimmenden Muster sin Steuersignal erzeugt.
Pig. 8 gilt für die Wirkungsweise der zweiten Ausführungsform.
Seim Schreiben der Bezugsmuster werden durch.das Mikrophon
-so-
erhaltene gesprochene Standardnachrichten verstärkt und dann in Signale V für stimmhafte Laute und UV für stimmlose Laute
sowie in Signale VO für offene Klänge und VC für geschlossene : Klänge umgesetzt; die Signale V, UV und VO, VC werden vom
A/D-Umsetzer digitalisiert und dann über den linken Schaltungszweig in jeden von zwei Speichersystemen abgespeichert. Beim
Erkennen der gegebenen gesprochenen Nachricht wird die Schaltungsanordnung auf den rechts liegenden Weg umgeschaltet, Und
die vom Mikrophon empfangene Nachricht wird verstärkt und in Signale V für die stimmhaften Laute und UV für die stimmlosen
Laute sowie die Signale VO für die offenen Klänge und VC für die geschlossenen Klänge umgesetzt; die Signale V, UV und
VO, VC werden jeweils vom A/D-Umsetzer digitalisiert und jeder von zwei Erkennungsvorrichtungen zugeführt. Dabei handelt es '
sich um Anordnungen zum Vergleichen der jeweiligen Signale V, 1 und VO, VC mit in den jeweiligen Speichersystemen gespeicherte]
Bezugsmustern. In der Erkennungsanordnung werden die Bezugsmuster aus den Speichersystem ausgelesen, und die Signale V, U'
und VO, VC der gegebenen Nachricht werden jeweils gewöhnlich schrittweise miteinander verglichen. Wenn eines der Bezugsmuster mit den Signalen V, UV und VO, VC der gegebenen Nach- ;
rieht übereinstimmt,. wird abhängig von dem übereinstimmenden
Muster ein Steuersignal für das nachfolgende Massagegerät oder dergleichen erzeugt.
Bei den beiden beschriebenen ersten und zweiten Ausführungsformen wird das Erkennen der Nachricht dadurch ausgeführt, daß
die Signale V für die stimmhaften Laute und UV für die stimmlosen Laute oder diese beiden Signale V, UV und die Signale :
VO für die offenen Klänge und VC für die geschlossenen Klänge der A/D-Umsetzung unterzogen und mit den Bezugsmustern bezüglich
ihres jeweiligen Verlaufs verglichen werden. In weiteren', anschließend zu erläuternden Ausführungsbeispielen werden hinsichtlich
des Erkennungsvorgangs Verbesserungen erzielt.
BAD ORieiNAL
-VT-
Bei einer dritten Ausführungsform, die in Fig. 9 dargestellt
ist, werden Symbole V für stimmhafte Laute, Symbole UV für ' stimmlose Laute und Symbole S für stumme Laute aus den vom
A/D-Umsetzer 13 der ersten oder der zweiten Ausführungsform
digitalisierten Signalen V für stimmhafte Laute und Signalen UV für stimmlose Laute erzeugt, wobei das Lautsymbol V entsprechend
den einen vorbestimmten Wert überschreitenden digitalisierten Signalen gebildet wird, das Lautsymbol UV entsprechend
den unter einem weiteren vorbestimmten Wert liegenden Signalen gebildet wird und das Lautsymbol S entsprechend
den zwischen den zwei Werten liegenden Signalen gebildet wird. Der ErkennungsVorgang kann daher einfacher als bei der
ersten oder der zweiten Ausführungsform gemacht werden. Außerdem werden die bei dem Symbolbildungsschritt erhaltenen Lautsymbole
in der dritten Ausführungsform in einem in Fig. 9
ersichtlichen Formungsschritt so geformt, daß alle Lautsymbole V und UV, die kürzer als ein vorbestimmter Wert sind, zum Lautsymbol
S gemacht werden. Wenn die Lautsymbole V hintereinander mit dem Lautsymbol S der kürzeren Dauer in Einfügung neben dem
Lautsymbol V mit einer längeren Dauer vorhanden sind, wird dieses spezielle Lautsymbol V-gelöscht, damit diese Symbole im
Lautsymbol S repräs^itier.t. werden. Wenn die Lautsymbole UV
nacheinander auch mit dem kürzer dauernden Lautsymbol S in Einfügung neben dem langer dauernden Symbol UV vorhanden sind,
wird das Lautsymbol S gelöscht, damit die Symbole durch das Symbol UV repräsentiert werden. Nach dem Formungsschritt werden
die jeweiligen Längen der geformten Lautsymbole U, UV und S gezählt, und im Anschluß daran wird die gesamte zeitliche
Länge der gesprochenen Nachricht von ihrem Anfang bis zu ihrem Ende erhalten. Diese gesamte zeitliche Länge wird gleich dem
Wert Tausend gesetzt, und es werden die entsprechenden Verhältnisse der geformten Lautsymbole V, UV und S berechnet. Mit
diesem Normierungsschritt für die zeitlichen Längen können alle phonetischen Unterschiede und dergleichen zwischen einzelnen
Sprechern der Nachricht zur Verbesserung der Erkennungswirksam-
- ve* -
• 5a-
keit eliminiert werden. Die jeweiligen geformten Lautsymbole und die entsprechenden normierten Längen werden im Speichersystem
gespeichert, so daß Bezugsmuster entstehen. Nach Beendigung des Erzeugens oder Lernens von Bezugsmustern wird eine
von einer Person gesprochene gegebene Nachricht, die vom Mikrophon empfangen wird, in ebensolcher Weise verarbeitet, und es ;
wird ein Vergleich der Bezugsmuster mit den geformten Lautsymbolen und den entsprechenden normierten Längen durchgeführt.
Wie aus Fig. 9 hervorgeht, kann der Längennormierungsschritt
weggelassen werden, wenn es erwünscht ist, da die Erkennungsfähigkeit auch bei einer solchen Weglassung aufrechterhalten .
wird, was insbesondere dann gilt, wenn die Anzahl der Elemente in der gesprochenen Nachricht begrenzt ist. In der dritten
Ausfuhrungsform kann sogar der Längenmeßschritt weggelassen
werden, wobei das Erkennen dann ausschließlich mittels der geformten Lautsymbole durchgeführt wird, was die Anordnung beträchtlich
und vorteilhaft vereinfacht.
Die Verarbeitung der Signale oder Symbole nach der A/D-Umsetzun wird in der dritten Ausführungsform vom Computer 4 durchgeführt
eine Bezugnahme auf F-ig. 2 dient einer ausreichenden Klarstellung eines praktischen Ausführungsbeispiels der Schaltungsan-' :
Ordnung dieser Ausführungsform.
In der in Fig. 10 dargestellten vierten Ausführungsform des Ver
f ahrens werden wie in der dritten Ausführung von Fig. 5 die Lautsymbole V \
für die stimmhaften Laute, UV für die stimmlosen Laute und S für die stumme
Laute ebenso wie in der dritten Ausführungsform aus den im A/D-Umsetzer
digitalisierten Signalen V für die stimmhaften Laute und UV für die stimmlosen Laute gebildet, und die Klangsymbole VO für
die offenen Klänge, VC für die geschlossenen Klänge und VM für. die mittleren Klänge werden jeweils bei der Anwesenheit des
Lautsymbols V für stimmhafte Laute aus den digitalisierten
Signalen VO für die offenen Klänge und VC für die geschlossenei
BAD
■■-,"Π
Klänge gebildet. Dies bedeutet, daß "i" Gruppen der Klangsymbole VO, VC und VM für jedes "i"-te Lautsymbol V(i) für
stimmhafte Laute erzeugt werden. Die Ezeugung der Klangsymbole VO, VC und VM erfolgt so, daß sie jeweils der Periode
entsprechen, -in der die digitalisierten Signale VO und VC einen vorbestimmten Wert überschreiten, der Periode entsprechen,
in der sie kleiner als ein weiterer vorbestimmter Wert sind, und der Periode entsprechen, in der sie zwischen diesen
beiden Werten liegen. Die jeweiligen Symbole werden dann wie in der dritten Ausführungsform die Symbole V, UV und S mittels
des Formungsschritts geformt, während bei den Klangsymbolen VO, VC und VM die beiden Symbole VO und VC mit kürzerer Länge als
ein vorbestimmter Wert zum Symbol VM gemacht werden, und jedes Symbol VM, das kürzer als der vorbestimmte Wert ist, und das
zwischen aufeinanderfolgenden Symbolen VO insbesondere neben dem Symbol VO mit größerer Länge als der vorbestimmte Wert liegt,
wird gelöscht und zum Symbol VO gemacht. Jedes Symbol VM mit kürzerer Länge, das zwischen entsprechenden aufeinanderfolgenden
Symbolen VC insbesondere neben dem längeren Symbol VC vorhanden ist, wird gelöscht und zum Symbol VM gemacht. Nach dem Formungsvorgang werden die-Längen-der jeweils geformten Symbole V, UV,
S, VO, VC und VM gezählt,. worauf der gleiche Norir.ierungsschritt
wie bei der dritten Ausführungsform durchgeführt wird.
Der Längennormierungsvorgang für die Symbole V, UV und S geht aus der vorangehenden Beschreibung klar hervor, und die Längen
der Symbole VO7 VC und VM v/erden bezüglich jedes der Symbole
V(i) bestimmt. Somit wird die gesamte zeitliche Länge der jeweiligen Symbole VO, VC und VM für jedes Symbol V(i) auf den
Wert Tausend gesetzt,, und es wird ihr Verhältnis zu den jeweiligen
Längen der Symbole VO, VC und VM erhalten. Die geformten Symbole und ihre entsprechend normierten Längen werden in den
Speichersystemen abgespeichert, damit darin Bezugsmuster entstehen. Nach Beendigung der Erzeugung oder des Lernens der
Bezugsmuster wird die von der Person in das Mikrophon gesprochene Nachricht in der gleichen Weise verarbeitet, wie oben
erläutert wurde, und ihre geformten Symbole sowie die entspre-
- 20 -
— ι
chend normierten Längen werden mit den gespeicherten Bezugsmustern verglichen. Bei einer genauen Betrachtung dieses
Vergleichsvorgangs erfolgt auf einer ersten Rangebene ein Vergleich hinsichtlich der Symbole V,. UV und S, damit eine
Gruppe von Bezugsmustern entnommen wird, die für die Nachricht von Bedeutung sind; ebenso wird ein Vergleich bezüglich,
der normierten Längen der Symbole V, UV und S durchgeführt, damit eine weitere Auswahl zutreffender Bezugsmuster aus der
entnommenen Gruppe erfolgt. Auf einer zweiten Rangebene wird ein Vergleich bezüglich der Symbole VO, VC und VM für
die ausgewählten Bezugsmuster durchgeführt, und gleichzeitig erfolgt ein Vergleich hinsichtlich der normierten Längen dieser
Symbole VO, VC und VM, damit die am meisten zutreffenden und die sich daran anschließenden nächsten zutreffenden Bezugsmuster entnommen werden. Wenn diese zwei zutreffenden Bezugsmuster keinen entscheidenden Unterschied aufweisen, wird angezeigt,
daß eine erneute Eingabe der gesprochenen Nachricht erforderlich ist; wird jedoch ein entscheidender Unterschied
angezeigt, wird ein Befehl entsprechend dem am meisten zu- :
treffenden Bezugsmuster an das zu steuernde Gerät, beispielsweise das Massagegerät/ abgegeben.
In Fig. 10. ist zu erkennen, daß in der beschriebenen vierten
Ausführungsform der Normierungsschritt und außerdem sogar der Längenmeßschritt weggelassen werden kann, wenn dies erwünscht
ist.
In der dritten und in der vierten Ausführungsform werden die jeweiligen Signale nach der A/D-Umsetzung in Symbole umgewandelt;
in dieser Hinsicht durchgeführte Abwandlungen der ersten und der zweiten Ausführungsform werden nun als fünfte und als
sechste Ausführungsform der Erfindung beschrieben. ;
In der in Fig. 11 dargestellten fünften Ausführungsform ist
der nach der A/D-Umsetzung in der in Fig. 9 dargestellten drit
BAD ORIGINAL
32C0645
ten Ausführungsform durchgeführte Symbolbildungsschritt für
die Signale V und UV durch einen Codierschritt ersetzt, der
so durchgeführt wird, daß "+1" Abschnitten.der digitalisierten
Signale V und UV über einem vorbestimmten Wert, d.h. stimmhaften Lautabschnitten, entspricht, "-1" Abschnitten dieser
Signale unterhalb eines weiteren vorbestimmten Werts, d.h.
stimmlosen Lautabschnitten, entspricht, und "0" Abschnitten :
dieser Signale zwischen den zwei Werten, d.h. stummen Lautabschnitten, entspricht. Bei dem auf das Codieren folgenden
Formungsschritt werden die " + 1" und "-1 " entsprechenden Signale, /"; die kürzer als der vorbestimmte Wert sind, zu "0" gemacht,
Signale entsprechend "0" mit einer kürzeren Länge zwischen ·" aufeinanderfolgenden " + 1 "-Signalen neben einem " + 1 "-Signal ': mit längerer Dauer werden gelöscht und zu "+1" gemacht, und
Signale entsprechend "0" mit einer kürzeren Dauer zwischen
jeweils aufeinanderfolgenden "-1"-Signalen neben einem "-1"-Signal mit längerer Dauer werden gelöscht und zu "~1" gemacht.
Die anschließenden Schritte sind die gleichen wie in der dritten ·; Ausführungsform.
die Signale V und UV durch einen Codierschritt ersetzt, der
so durchgeführt wird, daß "+1" Abschnitten.der digitalisierten
Signale V und UV über einem vorbestimmten Wert, d.h. stimmhaften Lautabschnitten, entspricht, "-1" Abschnitten dieser
Signale unterhalb eines weiteren vorbestimmten Werts, d.h.
stimmlosen Lautabschnitten, entspricht, und "0" Abschnitten :
dieser Signale zwischen den zwei Werten, d.h. stummen Lautabschnitten, entspricht. Bei dem auf das Codieren folgenden
Formungsschritt werden die " + 1" und "-1 " entsprechenden Signale, /"; die kürzer als der vorbestimmte Wert sind, zu "0" gemacht,
Signale entsprechend "0" mit einer kürzeren Länge zwischen ·" aufeinanderfolgenden " + 1 "-Signalen neben einem " + 1 "-Signal ': mit längerer Dauer werden gelöscht und zu "+1" gemacht, und
Signale entsprechend "0" mit einer kürzeren Dauer zwischen
jeweils aufeinanderfolgenden "-1"-Signalen neben einem "-1"-Signal mit längerer Dauer werden gelöscht und zu "~1" gemacht.
Die anschließenden Schritte sind die gleichen wie in der dritten ·; Ausführungsform.
In der in Fig. 12 dargestellten Ausführungsform wird der Symbol- ;;
bildungsschritt für die Signale V und UV für die stimmhaften ■ '-
bzw. stimmlosen Laute sowie für die Signale VO und VC für die §
offenen bzw. geschlossenen Klänge nach der A/D-Umsetzung zu t.
einem Codierschritt gemacht. Bei diesem Codierschritt werden J
die digitalisierten Signale V und UV ebenso wie in der fünften f
Ausführungsform codiert, während die digitalisierten Signale VO
und VC so codiert werden, daß " + 1" den über einem vorbestimmten j"
Wert liegenden Signalabschnitten, d.h. Abschnitten offener ■
Klänge, entspricht, daß "-1" Abschnitten unterhalb eines weite- ■
ren vorbestimmten Werts, d.h. Abschnitten geschlossener Klänge, '.>
entspricht, und daß "0" Abschnitten zwischen diesen zwei Werten,
d.h. Abschnitten mittlerer Klänge, entspricht. Der auf das
Codieren folgende Formungsschritt ist der gleiche wie in der.. '" vierten Ausführungsform. , ,
d.h. Abschnitten mittlerer Klänge, entspricht. Der auf das
Codieren folgende Formungsschritt ist der gleiche wie in der.. '" vierten Ausführungsform. , ,
COPY
In den beschriebenen Ausführungsformen 1 bis 6 werden die
A/D-Umsetzung, die anschließende Symbolbildung und die Codierung in drei Werte durchgeführt, doch ist es in optimale
Weise auch möglich, die A/D-Umsetzung in manchen Fällen unnötig zu machen. Wenn beispielsweise die Erkennungsfähigkeit
etwas geringer sein darf als bei der A/D-Umsetzung, kann ein Impulscodierer verwendet werden, wie anschließend erläutert
wird. -· -
In der in Fig. 13 dargestellten siebten Ausführungsform der
Erfindung ist der in der ersten Ausführungsform von Fig.· 7 verwendete A/D-Umsetzer 13 durch einen Impulscodierer 13-1
ersetzt, damit die erforderlichen Kosten für den Fall reduziert werden, daß eine höhere Erkennungsfähigkeit nicht ge- fordert
wird, wie noch zu erkennen sein wird. Im vorliegender Fall werden die Signale so codiert, daß "+1" Abschnitten der
Signale V und UV über einem vorbestimmten Wert, d.h. Abschnil ten mit stimmhaften Lauten, entspricht, "-1" stummen Lautabschnitten
unterhalb eines weiteren vorbestimmten Werts ent- spricht und "0" stummen Lautabschnitten zwischen diesen beid«
Werten entspricht. Dieses Codieren kann im Flußdiagramm von ' Fig. 15 dargestellt werden, wie aus der obigen Beschreibung :
erkennen ist», , !
In Fig. 14 ist eine achte Ausführungsform der Erfindung dargi
stellt, in der der Multiplexer 17 und der A/D-Umsetzer 13 de: zweiten Ausführungsform von Fig. 5 weggelassen sind und zwischen
die Mittelungsschaltungen 12 und 12-1 sowie den E/A- ; Anschluß 14 ein Impulscodierer 13-1 eingefügt ist. Es ist zu
erkennen, daß die achte Ausführungsform bei dieser Anordnung die gleiche Wirkung wie die siebte Ausführungsform hat. Das·
Codieren wird somit so ausgeführt, daß "+1" den stimmhaften:
Lautabschnitten der Signale V und UV über einem vorbestimmte Wert entspricht, "-1" den stimmlosen Lautabschnitten unterha
eines weiteren vorbestimmten Werts entspricht und "0" den st
BAD ORIGINAL
- 2-5 -
men Lautabschnitten zwischen diesen zwei Werten entspricht.
Wenn stimmhafte Laute vorhanden sind, wird das Codieren außerdem so durchgeführt, daß " + 1" den offenen Klangabschnitten der
Signale VO und VC über einem vorbestimmten Wert entspricht,
■ "-1" den geschlossenen Klangabschnitten unterhalb eines vorbestimmten
Werts entspricht und "0" den mittleren Klangabschnitten zwischen den zwei Werten entspricht. Dies kann im "
Flußdiagramm von Fig. 16 angegeben werden.
Eine neunte Ausführungsform der Erfindung steht im Zusammenhang
mit der siebten Ausführungsform. Zusätzlich zur Codierung
mit Hilfe des Impulscodierers 13-1 in der siebten Ausführungsform wird gleichzeitig die Anzal der Abtastimpulse
gezählt, so daß die Längen der jeweiligen stimmhaften, stimmlosen und stummen Lautperioden ebenfalls gemessen und normiert
Werden. Dieses Normieren des gemessenen Längenwerts repräsentiert die jeweiligen Längen in Verhältnissen der jeweiligen
stimmhaften, stimmlosen und stummen Lautperioden in bezug auf die Gesamtlänge vom Beginn bis zur Beendigung der gesprochenen
Nachricht, wobei die Gesamtzeit beispielsweise auf den Wert Tausend festgelegt--wird. 3ei dieser Darstellung können alle
Einflüsse auf den ErkennungsVorgang, die auf verschiedene '
Ankunftsgeschwindigkeiten der Nachrichtensignale aufgrund möglicher phonetischer Unterschiede zwischen einzelnen Spreehern
der Nachricht oder dergleichen zurückzuführen sind, beseitigt
werden, und die Erkennungsgenauigkeit kann weiter verbessert werden. Da die Erkennungsmerkmale im vorliegenden Fall
von der Darstellung mit stimmhaftem, stimmlosem und stummem Laut auf die Darstellung mit ihrer Länge erweitert werden, kann
die Erkennungswirksamkeit weiter verbessert werden. Da der Erkennungsvorgang nach einer Bewertung der Gültigkeit und Ungültigkeit
der Darstellung mit stimmhaften, stimmlosen und stummen Lauten mittels der Längen durchgeführt werden kann, kann auch
eine wirksame Verkürzung der für den Erkennungsvorgang erforderlichen Zeit erreicht werden. Der spezielle Vorgang kann
-S8-
durch das Flußdiagramm von Fig. 17 veranschaulicht werden.
Eine zehnte Ausführungsform der Erfindung hängt von der
achten Ausführungsform ab. Zusätzlich zur Codierung mittels des Impulscodierers 13-1 im Fall der vierten Ausführungsform
wird gleichzeitig die Anzahl der Abtastimpulse gezählt, wodurcl die Längen der jeweiligen stimmhaften, stimmlosen und stummen
Lautperioden sowie der jeweiligen offenen, geschlossenen und stummen Klangperioden oder der jeweiligen offenen, geschlossenen,
mittleren und stummen Klangperioden gemessen werden. Die gemessenen Längenwerte werden im wesentlichen ebenso wie im
Fall der neunten Ausführungsform normiert. Mit Bezug auf die
neunte Ausführungsform ist zu erkennen, daß mit dieser zehnten
Ausführungsform die gleiche Wirkung wie mit der neunten Aus- ■
führungsform erreicht werden kann. Die Arbeitsweise ist in diesem Fall im Flußdiagramm von Fig. 18 dargestellt.
In den beschriebenen Ausführungsbeispielen 1 bis 10 werden die erwünschten Signale V für stimmhafte Laute und UV für stimm- '
lose Laute sowie die Signale VO für offene Klänge und VC für geschlossene Klänge durch Subtraktionsvorgänge zwischen den :
Ausgängen der Filterbänke erhalten, so daß eine wirksame Rausc eliminierung erreicht werden kann. Wenn jedoch im Anschluß an
den Vorverstärker 8 eine Serienschaltung aus einem logarithmischen Verstärker und einem Wechselstromverstärker eingefügt
wird, kann das Rauschen ebenfalls gut eliminiert werden. In der Praxis gibt es keine Probleme, wenn der logarithmische Ver
stärker zwischen den Vorverstärker 8 und den Differenzverstärfc
11 (oder die Differenzverstärker 11 und 34 in der später beschriebenen
Fig. 23) eingefügt wird. Weitere Erläuterungen wei den auf die Erläuterungen der in den Figuren 19 und 23 dargestellten
Ausführungsformen beschränkt, da Einzelheiten der ' Anordnung ohne weiteres im Hinblick auf die Figuren 2, 5, 13
und 14 verständlich sind.
Die Erfindung wird nun anhand weiterer Ausführungsbeispiele erläutert. · ..
Fig. 19 zeigt das Schaltbild einer praktischen Anordnung der in Fig. 13 dargestellten Ausführungsform, wobei eine vom
Mikrophon 6 empfangene gesprochene Nachricht X(t) durch den Vorverstärker 8, den logarithmischen Verstärker 8-1 und den.
Wechselstromverstärker 8-2 zu Signalen LOGX(t) umgeformt, und
diese Signale werden den Eingängen der ersten Filterbank 9 und der zweiten Filterbank 10 zugeführt. Als Beispiele für die
gesprochene Nachricht X(t) sind /a/ und /u/ in den Figuren 2QA bzw. 2OB dargestellt. In Fig. 2OA ist ein Signal LOGX(t)
für /a/ in einer logarithmisch umgesetzten Kurve ebenfalls dargestellt; Fig. 2OB zeigt ein ebensolches Signal für /u/.
Die erste Filterbank 9 besteht aus einer Serienschaltung aus einem Filter, die eine Frequenzkomponente unter 1 kHz durchläßt,
einer Gleichrichterschaltung sowie einer Mittelungsschaltung,
die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms enthält; die zweite Filterbank 10 enthält
eine Serienschaltung aus einem Filter, das eine Frequenzkomponente von 5 bis 12 kHz durchläßt, einer Gleichrichterschaltung
und einer Mittelungsschaltung mit einer Integrationsschaltung mit einer Zeitkonstanten von etwa 1 ms. In Fig. 21A
sind die Frequenzspektren von /s/ (stimmloser Laut) und /a/ (stimmhafter Laut) als Beispiel für die gesprochene Nachricht
X dargestellt, während Fig. 21B die Frequenzspektren ihrer logarithmisch umgesetzten Signale LOGX zeigt. Aus dem Vergleich
der Figuren 21A und 21B ist zu erkennen, daß mittels der Erfindung die anschließenden Verarbeitungsvorgänge durch eine logarithmische
Umsetzung vereinfacht werden können, während der Erkennungsgrad beibehalten wird. Die Ausgangssignale der ersten
Filterbank 9 werden von den Ausgangssignalen der zweiten Filterbank 10 im Differenzverstärker 11 subtrahiert, und die Ausgangssignale
dieses Differenzverstärkers werden von der Mittelungsr.
schaltung 12 gemittelt, die eine Integrationsschaltung mit
tf *- -
-GO-
einer Zeitkonstanten von 10 ms enthält. Die Ausgangssignale
werden dann Diskriminatorschaltungen 18 und 19 als gemittelte Stimmhaft- und Stimmlos-Signale y(t) zugeführt. Die Diskrimrna
torschaltung liefert mit dem Empfang .jedes in einem Taktimpuls generator 20 erzeugten Taktimpulses einen Abtastimpuls C (mit
einer Periode von 8 ms), doch gibt sie nur dann ein Ausgangs- \
signal mit hohem Wert ab, wenn die Signale für stimmhafte und stimmlose Laute kleiner als ein Bezugswert R sind. Die Period
der Abtastimpulse C wird mittels einer vom E/A-Anschluß 14 festgelegten CR-Zeitkonstanten richtig eingestellt, was bedeutet,
daß die Ausgangsfrequenz des Taktimpulsgenerators von ein
Frequenzteiler geteilt und dann einer richtigen Periodeneinste lung an einer Abgriff-Schaltung abhängig von CR am E/A-Anschlv
14 unterzogen wird. Die Diskriminatorschaltung 19 liefert bei.
jedem Abtastimpuls C aus dem Taktimpulsgeneratof 20 ein Ausgangssignal
mit hohem Wert, wenn die Signale V für stimmhafte Laute und UV für stimmlose Laute größer als der Bezugswert Rv
sind. Als Reaktion auf den vom Taktimpulsgenerator 20 gelieferten Abtastimpuls C wird eine retriggerbare, monostabile i
Impulsgeneratorschaltung in der jeweiligen Diskriminatorschaltung 18 und 19 ausgelöst (wobei die Dauer eines Ausgangsimpuli
der monostabilen Schaltung 1,5 mal größer als die Abtastperioc ist und mittels einer Widerstandsumschaltschaltung im Takt-, ■
impulsgenerator 20 abhängig von CR eingestellt ist), damit ■
Signale V und UV erzeugt werden. Fig. 22 erklärt die Wirkun·
weise für den Fall, daß die Signale V und UV aus den Signal
x(t) entsprechend einer gesprochenen Nachricht /seQto/ unter j
Anwendung der Abtastimpulsfolge C erzeugt werden. In der For mungsschaltung 21 wird aus den Signalen V, und UVft in einer i
Differenzschaltung ein bezüglich eines Signals S , das einen
stummen Klang repräsentiert, negiertes Signal erzeugt, und' dieses negierte Signal wird dazu benutzt, in einer NAND- !
Schaltung die Signale Vp und UVp zu erzeugen, die jeweils
einen stimmhaften Laut bzw. einen stimmlosen Laut anzeigen. Das Signal S wird dem Zähler 22 zugeführt, und es löscht ein
BAD ORIGINAL
Zähler 22 an dem Zeitpunkt, an dem es auf einen hohen Wert
ansteigt. Nach dem Löschen und während des hohen Werts des
Signals S zählt der Zähler 22 die Anzahl·- der Abtastimpulse
C , damit die Länge der Periode des stimmlosen Lauts gemessen
wird. Nur wenn der gezählte Wert des Zählers 22 größer als
eine vorbestimmte Zahl wird, wird ein Signal C erzeugt.
ansteigt. Nach dem Löschen und während des hohen Werts des
Signals S zählt der Zähler 22 die Anzahl·- der Abtastimpulse
C , damit die Länge der Periode des stimmlosen Lauts gemessen
wird. Nur wenn der gezählte Wert des Zählers 22 größer als
eine vorbestimmte Zahl wird, wird ein Signal C erzeugt.
Eine Diskriminatorschaltung 2 3 unterscheidet, ob die gespro- f
chene Nachricht X(t) empfangen wird oder nicht, und sie liefert [
ein Signal P/N mit hohem Wert abhängig vom Anstieg der Signale ; V und UV auf einen hohen Wert; dieses Ausgangssignal P/N
fällt als Reaktion auf das Ausgangssignal C des Zählers 22.
Dies bedeutet, daß das Ausgangssignal P/N ein Impuls ist,
der am Anfangspunkt der gesprochenen Nachricht X(t) ansteigt
und am Endpunkt abfällt. Außerdem wird ein Zähler 24 gelöscht,
wenn Impulse der Signale V und UV anstiegen, und er zählt :- die Abtastimpulse C in der gleichen Weise wie der Zähler 22, ' , während die Impulse der Signale V und UV einen hohen Wert
haben. Andererseits erzeugt eine Zeitgeberschaltung 25 beim ·. Abfallen der Signale V , UV , P/N und eines vom Taktimpuls- |! generator 20 gelieferten Impulses TM ein Abtastsignal STB. | Der Impuls TM wird von einer Abgriff-Umschaltschaltung der Takt-· <impulsgenerator 20 abhängig von CR-erzeugt, wobei eine gewisse \, Zeitverzögerung bezüglich des Abtastimpulses C wegen der Be- jf" triebszeit des Zählers 22 und der Diskriminatorschaltung 23 ;; vorhanden ist. Als Reaktion auf das Abtastsignal· STB hält - j eine Halteschaltung 26 die Zählergebnisse des Zählers 24
fest, die in einer Vergleichsschaltung 27 mit einem über den 5 E/A-Anschluß gelieferten Signal TR verglichen werden. Das j Signal TR wird mittels einer Bedienungstafel, d.h. mittels t des Tastenfeldes 1, in Abhängigkeit von der Sprechgeschwindig- | keit des Sprechers, d.h. von der- Ankunftsgeschwindigkeit der { gesprochenen Nachricht eingestellt. Das Signal TR ist ein
Bezugswert für die Bestimmung, ob die Phonemkomponente im ,. I Signal UV ein stimmloser Reiblaut V oder ein stimmloser Spreng- ■_
fällt als Reaktion auf das Ausgangssignal C des Zählers 22.
Dies bedeutet, daß das Ausgangssignal P/N ein Impuls ist,
der am Anfangspunkt der gesprochenen Nachricht X(t) ansteigt
und am Endpunkt abfällt. Außerdem wird ein Zähler 24 gelöscht,
wenn Impulse der Signale V und UV anstiegen, und er zählt :- die Abtastimpulse C in der gleichen Weise wie der Zähler 22, ' , während die Impulse der Signale V und UV einen hohen Wert
haben. Andererseits erzeugt eine Zeitgeberschaltung 25 beim ·. Abfallen der Signale V , UV , P/N und eines vom Taktimpuls- |! generator 20 gelieferten Impulses TM ein Abtastsignal STB. | Der Impuls TM wird von einer Abgriff-Umschaltschaltung der Takt-· <impulsgenerator 20 abhängig von CR-erzeugt, wobei eine gewisse \, Zeitverzögerung bezüglich des Abtastimpulses C wegen der Be- jf" triebszeit des Zählers 22 und der Diskriminatorschaltung 23 ;; vorhanden ist. Als Reaktion auf das Abtastsignal· STB hält - j eine Halteschaltung 26 die Zählergebnisse des Zählers 24
fest, die in einer Vergleichsschaltung 27 mit einem über den 5 E/A-Anschluß gelieferten Signal TR verglichen werden. Das j Signal TR wird mittels einer Bedienungstafel, d.h. mittels t des Tastenfeldes 1, in Abhängigkeit von der Sprechgeschwindig- | keit des Sprechers, d.h. von der- Ankunftsgeschwindigkeit der { gesprochenen Nachricht eingestellt. Das Signal TR ist ein
Bezugswert für die Bestimmung, ob die Phonemkomponente im ,. I Signal UV ein stimmloser Reiblaut V oder ein stimmloser Spreng- ■_
copy i
laut PL ist; es wird dazu benutzt, ein Signal dafür zu erzeugen, daß erkannt wird, daß es sich um den stimmlosen Reib-
laut F handelt, wenn die Dauer, d.h. der gezählte Wert des :
Zählers 24, den Wert TR überschreitet, und daß es sich um den stimmlosen Sprenglaut PL handelt, wenn die Dauer oder dei
gezählte Wert des Zählers 24 kleiner als TR ist. Das Ergebnis des Vergleichsvorgangs in der Vergleichsschaltung 27 wird
einer Symbolbildungsschaltung 28 zugeführt, die ein Signal zur Unterscheidung des stimmhaften Lauts V, des stimmlosen
Reiblauts F und des stimmlosen Sprenglauts PL liefert, was abhängig vom Abtastsignal STB und den als Reaktion auf die
Signale V und UV von der Zeitsteuerschaltung 25 abgegebener
Signalen SV und SU erfolgt. Wenn das Signal V einen hohen Wert hat, wird der Impuls SV von der Zeitsteuerschaltung 25
nach Ankunft des Impulses TM abgegeben und die Symbolbildungs schaltung 28 liefert als Antwort auf das Abtastsignal STB
einen dem stimmhaften Laut V entsprechenden Impuls. Wenn das Signal UV einen hohen Wert hat, wird der Impuls SV von der
Zeitsteuerschaltung 25 nach Ankunft des Impulses TM abgegebei und die Symbolbildungsschaltung 28 liefert abhängig vom Vergleichsergebnis
der Vergleichsschaltung 27 einen den stimmlos Reiblaut F oder den stimmlosen Sprenglaut PL repräsentierend«
Impuls. Die Ausgangsssignale V, PL und F der Symbolbildungs-' schaltung 28 haben die Werte "1", "0" und "0" für den Fall ;
des stimmhaften Lauts V, die Werte "0", "0" und "1" für den Fall des stimmlosen Reiblauts F und die Werte "0", "1" und "(
für den Fall des stimmlosen Sprenglauts PL. Für den Fall des stummen Lauts haben die Signale V, PL und F dagegen die Wert<
"0", "0" und "0". Die Ausgangssignale V, PL und F der Diskriminatorschaltung
2 8 werden vom Abtastsignal STB einem speichernden Codierer 29 zugeführt, und von (0,0,0) in (0,0), ve:
(1,0,0) in (0,1), von (0,0,1) in (1,0) und von (0,1,0) in (1
umgesetzt, damit sie als binäre Signale DF vorliegen, die da] dem E/A-Anschluß 14 zugeführt werden. Nachdem die binären
Signale DF (die in Fig. 19 einschließlich ihrer Lage mit DF.
BAD ORIGINAL
-63-
und DF angegeben sind) vom Abtastsignal aus dem Codierer 29
ausgegeben worden sind/ liefert die Zeitsteuerschaltung 25
an den E/A-Anschluß 14 abhängig von den jeweiligen Signalimpulsen P/N, S , V , UV und TM ein Signal READY, und der \f
ausgegeben worden sind/ liefert die Zeitsteuerschaltung 25
an den E/A-Anschluß 14 abhängig von den jeweiligen Signalimpulsen P/N, S , V , UV und TM ein Signal READY, und der \f
Jr Jr Jr -:>*-}
Inhalt der Halteschaltung 26 wird als Impuls PT abgegeben. f
Die andere Zeitsteuerschaltung 30 empfängt die Signale S , β
" Ii
P/N und TM zur Erzeugung von Signalen SS und SRDY. Abhängig ■?
vom Signal SS speichert die Halteschaltung 31 den Inhalt des \
Zählers 22, während das Signal SRDY ein Bereit-Signal ist, ;
das die Beendigung der Abgabe des Inhalts der Halteschaltung
31 (ausgedrückt durch ein Signal ST) angibt. !
31 (ausgedrückt durch ein Signal ST) angibt. !
Der Computer 4 speichert die jeweiligen Signale DF (deren
Inhalt gleich DF und DF ist), PT und ST im Bezugsmusterspeicher 7 oder im Sprachnachrichtenspeicher 15 als Reaktion
auf die Inhalte der Speicher RAM3 und ROM5. Dies bedeutet die
Abspeicherung einer Klassifizierung, die repräsentiert ist
durch das Signal DF des stummen Lauts S, des stimmhaften Lauts ■"' V, des stimmlosen Reiblauts F und des stimmlosen Sprenglauts ΐ PL, durch die vom Signal PT (aus der Halteschaltung 31) des jj stimmhaften Lauts \&, des- stimmlosen Reiblauts F und des stimm- ' ί losen Sprenglauts PL (aus der Halteschaltung 26) repräsen- j tierten Längen sowie durch die Längen des stummen Lauts S ' Ij (aus der Halteschaltung 31). Der Computer CPU4 vergleicht f
Inhalt gleich DF und DF ist), PT und ST im Bezugsmusterspeicher 7 oder im Sprachnachrichtenspeicher 15 als Reaktion
auf die Inhalte der Speicher RAM3 und ROM5. Dies bedeutet die
Abspeicherung einer Klassifizierung, die repräsentiert ist
durch das Signal DF des stummen Lauts S, des stimmhaften Lauts ■"' V, des stimmlosen Reiblauts F und des stimmlosen Sprenglauts ΐ PL, durch die vom Signal PT (aus der Halteschaltung 31) des jj stimmhaften Lauts \&, des- stimmlosen Reiblauts F und des stimm- ' ί losen Sprenglauts PL (aus der Halteschaltung 26) repräsen- j tierten Längen sowie durch die Längen des stummen Lauts S ' Ij (aus der Halteschaltung 31). Der Computer CPU4 vergleicht f
dann das Signal DF mit dem entsprechenden Signal der Bezugs- f;
muster zum Zweck seiner Erkennung. Die Inhalte des Signals DF | sind im Muster 1 von Fig. 22 durch V, F, PL und S angegeben. J
Wenn die DF-Erkennung mit einigen der Bezugsmuster überein- jj
ii stimmt, dann werden die Längen verglichen. Beim Vergleich der
Längen werden vorzugsweise diese Längen zuvor normiert. Wenn
die gesprochene Nachricht mit einem der Bezugsmuster bei dem
Erkennungsvorgang übereinstimmt, wird ein entsprechendes Befehlssignal zur Steuerung eines Geräts, beispielsweise eines Massagegeräts, als Reaktion auf die gegebene gesprochene Nachricht
geliefert. C0PY
die gesprochene Nachricht mit einem der Bezugsmuster bei dem
Erkennungsvorgang übereinstimmt, wird ein entsprechendes Befehlssignal zur Steuerung eines Geräts, beispielsweise eines Massagegeräts, als Reaktion auf die gegebene gesprochene Nachricht
geliefert. C0PY
In der Ausführungsform von Fig. 1.9 wird die Erzeugung der
Signale DF, PT und ST aus den Signalen V und UV in der
dargestellten Schaltungsanordnung durchgeführt, jedoch kann dieser Schritt auch im Computer 4 ausgeführt werden. Ein
Flußdiagramm dieser Ausführungsform ist bei Bezugsnahme auf
die Figuren 15 und 17 offensichtlich, so daß es hier weggelassen ist.
In Fig. 23 ist eine bezüglich der Ausführungsform von Fig. 14
abgewandelte Ausführungsform dargestellt, mit der zusätzlich
zu den unter Bezugnahme auf Fig. 19 erklärten Vergleichsvorgängen auch die Signale VO für offene Klänge und VC für
geschlossene Klänge verglichen werden können. Die über das Mikrophon 6 erhaltene gesprochene Nachricht X wird im Vorver- '
stärker 8 verstärkt und mittels des logarithmischen Verstärken 8-1 sowie des Wechselstromverstärkers 8-2 in die Signale LOGX
umgesetzt; diese Signale werden den Eingängen der ersten Filterbank 9 und der zweiten Filterbank 10 zugeführt. Die erste
Filterbank 9 besteht aus einer Serienschaltung eines Filters,5
das eine Frequenzkomponente unter 1 kHz durchläßt, einer Gleichrichterschaltung und einer Mittelungsschaltung, die eine
Integrationsschaltung mit einer Zeitkonstanten von etwa 10 ms
ί enthält. Die zweite Filterbank besteht ebenfalls aus einer ■ t
Serienschaltung aus einem Filter, das eine Frequenzkomponente' von 5 bis 12 kHz durchläßt, einer Gleichrichterschaltung und ;
einer Mittelungsschaltung, die eine Integrationsschaltung mit einer Zeitkonstanten von etwa 1 ms enthält. Das Ausgangssigna]
ί der ersten Filterbank 9 wird vom Ausgangssignal der zweiten
Filterbank 10 im Differenzverstärker 11 subtrahiert, dessen ;
Ausgangssignale von der Mittelungsschaltung 12, die eine Integrationsschaltung mit einer Zeitkonstanten von 10 ms enthält,*
gemittelt und als Signale V für die stimmhaften Laute und UV '
für die stimmlosen Klänge in Diskriminatorschaltungen 18 und 19 eingegeben we-rden. Die Diskriminatorschaltung 18 liefert
bei jeder Ankunft eines Taktimpulses, d.h. des Abtastimpulses
BAD
3200B4*
- 3-r -
mit der Periode von 8 ms aus dem Taktimpulsgenerator 20 ein |
Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht, | wenn die Signale V und UV kleiner als ein Bezugswert R sind.
Die andere Diskriminatorschaltung 19 liefert ebenfalls bei ?|
jedem Abtastimpuls C aus dem Taktimpulsgenerator 20 ein " f
Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht, - ;i
wenn die Signale V und UV größer als der Bezugswert R sind. <
Als Reaktion auf den Abtastimpuls C arbeiten die retrigger- ;
baren, monostabilen Impulsgeneratorschaltungen (deren Impuls I
eine um 1,5 mal größere Dauer als der Abtastimpuls haben) in f
den Diskriminatorschaltungen 18 und 19, und sie erzeugen die
Signale V und UV. Die Formungsschaltung 21 erzeugt aus den ;
Signalen V und UV ein einen stummen Laut repräsentierendes ■-■
negiertes Signal Sp an einer Antivalenzschaltung, und unter
Verwendung dieses negierten Signals Sp erzeugt sie auch an
einer NAND-Schaltung die Signale V und UV , die einen stimmhaften Laut V bzw. einen stimmlosen Laut UV repräsentieren.
Das negierte Signal S wird dem Zähler 22 zugeführt, den sie
Verwendung dieses negierten Signals Sp erzeugt sie auch an
einer NAND-Schaltung die Signale V und UV , die einen stimmhaften Laut V bzw. einen stimmlosen Laut UV repräsentieren.
Das negierte Signal S wird dem Zähler 22 zugeführt, den sie
an dem Zeitpunkt löscht, an dem das Signal auf einen hohen ;
Wert ansteigt. Nach dem Löschvorgang und während des hohen |
Signalwerts des Signals S zählt der Zähler 22 die Anzahl der |
Abtastimpulse C zur Messung der Länge der Periode des stummen ' ,-;
Lauts, und nur dann, wenn der vom Zähler 22 gezählte Wert über «
einer vorbestimmten Zahl liegt, wird das Signal C erzeugt. I
Die Diskriminatorschaltung 23 unterscheidet, ob die gesprochene ]'
Nachricht X(t) empfangen wird oder nicht, und sie gibt ein ,;
Signal P/N mit hohem Wert abhängig vom Anstieg des Signals V |
und des Signals UVn auf einen hohen Wert ab. Das Ausgangssignal :.
ir (
P/N fällt abhängig vom Ausgangssignal C des Zählers 22, was l
bedeutet, daß das Ausgangssignal P/N ein Impuls ist, der am ;.!
Anfangszeitpunkt der gesprochenen Nachricht X(t) ansteigt und !;
an ihrem Beendigungspunkt abfällt. Der Zähler 24 wird gelöscht, j
wenn die Impulse der Signale V und UV ansteigen, und er zäh-lt H
die Abtastimpulse C ebenso wie der Zähler 22 während der Zeit- :j
periode, in der die Impulse der Signale V und UV einen
hohen Wert haben. Andererseits erzeugt die Zeitgeberschaltung 25 ein Abtastsignal STB nach dem Abfall der Signale
V-/ UV und P/N. Zusätzlich erzeugt die Zeitgeberschaltung
25 auch Signale SV und SU in Abhängigkeit von den Signalen Vp/ UV und P/N. Der Zählerstand des Zählers 24 wird mit
einem über den E/A-Anschluß eingegebenen Signal TR verglichen. 'Dieses Signal TR1 wird an einer Bedienungstafel, d.h. am _
Tastenfeld 1, in Abhängigkeit von der Sprechgeschwindigkeit des Sprechers oder, in anderen Worten, in Abhängigkeit von
der Ankunftsgeschwindigkeit der gesprochenen Nachricht eingestellt. Das Signal TR ist außerdem ein Bezugswert, mit
dem bestimmt werden kann, ob die Phonemkomponente des Signals UV für den stimmlosen Laut ein stimmloser Reiblaut F oder
ein stimmloser Sprenglaut PL ist, und es wird dazu benutzt, ein Signal zu erzeugen, daß angibt, ob der Laut ein stimmloser
Reiblaut F ist, wenn die Dauer des Lauts oder der Zählerstand des Zählers 24 über dem Signal TR liegt, oder ein
stimmloser Sprenglaut PL ist, wenn die Dauer des Lauts oder :
der Zählerstand unter TR1 liegt. Das Vergleichsergebnis der
Vergleichsschaltung 26 wird in die Diskriminatorschaltung eingegeben, die ein Signal zur Unterscheidung des stimmhaften
Klangs V, des stimmlosen Reiblauts F und des Stimmhaften
Sprenglauts"PL in Abhängigkeit von den Signalen SV und SU abgibt, die von der Zeitgeberschaltung 25 in Abhängigkeit
von den Signalen Vp und UV vom Abtastsignal STB und
vom Vergleichsergebnis der Vergleichsschaltung 26 abgegeben werden. Wenn das Signal V einen hohen Wert hat, gibt die ·
Zeitgeberschaltung 25 einen Impuls SV ab, und die Diskriminat< schaltung 27 gibt abhängig vom Abtastsignal STB einen Impuls
ab, der anzeigt, daß ein stimmhafter Laut V vorliegt. Wenn da; Signal UV einen hohen Wert hat, gibt die Zeitgeberschaltung
einen Impuls SV ab, und die Diskriminatorschaltung 27 liefert abhängig vom Vergleichsergebnis der Vergleichsschaltung 26
und vom Abtastsignal STB ebenfalls einen Impuls, der angibt,.
BAD ORIGINAL COPY
daß das Signal ein stimmloser Reiblaut F oder ein stimmloser
Sprenglaut PL ist. Die Ausgangssignale V, PL und F der Diskriminatorschaltung 27 haben somit für den Fall des stimmhaften
Lauts V die Werte "1", "0" und "0", für den Fall des stimmlosen Reiblauts F die Werte "0", "0" und "1", für den Fall des : j stimmlosen Sprenglauts PL die Werte "0", "1" und "0" und für I den Fall des stummen Lauts die Werte "0", "0" und "0". Die " ? Ausgangssignale V, F und PL werden durch das Abtastsignal STB I dem speichernden Codierer 29 zugeführt und von (0,0,0) in \ (0,0), von (1,0,0) in (0,1), von (0,0,1) in (1,0) und von ' \ (0,1,0) in (1,1) umgesetzt, so daß sie in Form eines binären
Signals DF vorliegen und anschließend an den E/A-Anschluß 14 I abgegeben werden. Nachdem das binäre Signal DF (das in Fig. 23 '■; einschließlich der Lage als DF und DF angegeben ist) vom
Codierer 29 durch das Abtastsignal abgegeben worden ist, wird
dem E/A-Anschluß aus der Zeitgeberschaltung 25 abhängig von : den Signalen (P/N, V und UV ein Signal READY abgegeben.
Sprenglaut PL ist. Die Ausgangssignale V, PL und F der Diskriminatorschaltung 27 haben somit für den Fall des stimmhaften
Lauts V die Werte "1", "0" und "0", für den Fall des stimmlosen Reiblauts F die Werte "0", "0" und "1", für den Fall des : j stimmlosen Sprenglauts PL die Werte "0", "1" und "0" und für I den Fall des stummen Lauts die Werte "0", "0" und "0". Die " ? Ausgangssignale V, F und PL werden durch das Abtastsignal STB I dem speichernden Codierer 29 zugeführt und von (0,0,0) in \ (0,0), von (1,0,0) in (0,1), von (0,0,1) in (1,0) und von ' \ (0,1,0) in (1,1) umgesetzt, so daß sie in Form eines binären
Signals DF vorliegen und anschließend an den E/A-Anschluß 14 I abgegeben werden. Nachdem das binäre Signal DF (das in Fig. 23 '■; einschließlich der Lage als DF und DF angegeben ist) vom
Codierer 29 durch das Abtastsignal abgegeben worden ist, wird
dem E/A-Anschluß aus der Zeitgeberschaltung 25 abhängig von : den Signalen (P/N, V und UV ein Signal READY abgegeben.
Die vom Vorverstärker 8 verstärkte gesprochene Nachricht X(t) '
i wird den Eingängen einer dritten Filterbank 32 und einer ?
vierten Filterbank „33 über einen im hohen Bereich wirksamen \
Anhebungsverstärke^ 8-3 .mit +6 dB/Oktave zugeführt. Die dritte ' |
Filterbank 32 besteht aus einem eine Frequenzkomponente von '?.
0 bis 0,5 kHz durchlassenden Filter, einer Gleichrichter- I
schaltung und einer Mittelungsschaltung, die eine Integrations- t
schaltung mit einer Zeitkonstanten von etwa 5,5 ms enthält. |
Die vierte Filterbank 33 besteht aus einer Serienschaltung \
eines eine Frequenzkomponente von 0,5 bis 1,0 kHz durchlassen- I
den Filters, einer Gleichrichterschaltung und einer Mittelungs- t
schaltung mit einer Integrationsschaltung mit einer Zeitkonstan- !.
ten von etwa 10 ms. Die Ausgangssignale der dritten Filter- ;*
bank 3 2 werden von einem logarithmischen Verstärker 3 2A loga- ii
rithmisch verstärkt, und sie werden von den Ausgangssignalen }
der vierten Filterbank 33 in einem Differenzverstärker 34 sub- \\
trahiert, die von einem weiterenlogarithmischen Verstärker 33A j
- 3-4- -
ebenfalls logarithmisch verstärkt worden sind. Die Ausgangssignale
dieses Differenzverstärkers 34 können mittels der logarithmischen Verstärker 32A und 33A an solche Ausgangssignale
angeglichen werden, die für den Menschen hörbar sind. Die Ausgangssignale des Differenzverstärkers werden in einer
Mittelungsschaltung 35 gemittelt, die eine Integrationsschaltung mit einer Zeitkonstanten von 20 ms enthält; sie werden
ferner Diskriminatorschaltungen 36 und 37 als Signale VO für offene Klänge und VC für geschlossene Klänge zugeführt. Die
Diskriminatorschaltung 36 liefert jedesmal dann, wenn der Taktimpuls, d.h. der vom Taktimpulsgenerator 20 erzeugte
Abtastimpuls C mit einer Periode von 8 ms, ankommt, ein Ausgangssignal mit hohem Wert, was jedoch nur dann geschieht,
wenn die Signale VO und VC kleiner als ein Bezugswert R ist. .
Die andere Diskriminatorschaltung 27 liefert mit jedem Abtastimpuls C aus dem Taktimpulsgenerator 20 ebenfalls ein Ausgangs
signal mit hohem Wert, was nur dann geschieht, wenn die Signale VO und VC größer als ein Bezugswert R sind. Abhängig von dem
vom Taktimpulsgenerator 20 abgegebenen Abtastimpuls Cp werden
retriggerbare monostabile Impulsgeneratorschaltungen (bei denen die Dauer des abgegebenen Impulses jeweils 1,5 mal so ;
groß wie die Abtastimpulsperiode ist) in den Diskriminatorschaltungen 36»und 37 betätigt, so daß sie Signale VO und VC,
abgeben, und aus diesen Signalen erzeugt eine Formungsschaltung 38 in ihrer Antivalenzschaltung stumme Klänge repräsen- !
tierende negierte Signale, und unter Verwendung der negierten Signale werden in einer NAND-Schaltung ein einen offenen Klang
VO anzeigendes Signal VOp sowie ein einen geschlossenen Klang :
VC anzeigendes Signal VC erzeugt. Diese Signale VO und VC ;
werden einem Zähler 3 9 zugeführt, den sie bei ihrem Anstieg löschen. Nach dem Löschen zählt der Zähler 39 die Abtastimpulse
C , während die jeweiligen Signale VO und VC einen :
hohen Wert haben. Andererseits erzeugt eine Zeitgeberschaltung 40 ein Abtastsignal VSTB beim Abfallen der Signale VO und VC_
Die Zeitgeberschaltung 40 erzeugt auch abhängig von den Signal
BAD
-.69-
νθρ, VCp und TM die Signale SO und SC. Der Stand des Zählers
wird in einer Vergleichsschaltung 41 mit einem über den E/AAnschluß eingegebenen Signal TR„ verglichen. Dieses Signal TR
wird an der Bedienungstafel, d.h. an der Tastatur 1, in Abhängigkeit
von der-Sprechgeschwindigkeit des Sprechers oder, in anderen
Worten, von der Ankunftsgeschwindigkeit der gesprochenen Nachricht eingestellt. Das Signal TR ist ein Bezugswert für
die Entnahme des mittleren Klangs VM aus den Phonemkomponenten in den Signalen VO_ und VC , und es wird dazu benutzt, ein
Signal für das Erkennen eines offenen Klangs VO oder eines geschlossenen Klangs VC zu erzeugen, wenn die Dauer, d.h. der
gezählte Wert des Zählers 39, das Signal TR überschreitet, oder ein Signal für das Erkennen eines mittleren Klangs VM
zu erzeugen, wenn die Dauer, d.h. der gezählte Wert des Zählers 39, unter TR„ liegt. Die Vergleichsergebnisse der Vergleichsschaltung
41 werden einer Symbolbildungsschaltung 42 zugeführt, die
ein Signal dafür liefert, den offenen Klang VO, den geschlossenen Klang VC und den mittleren Klang VM abhängig von den Signalen
SO und SC zu unterscheiden, die von der Zeitgeberschaltung 4 0 in Abhängigkeit von den Signalen VO und VCp, dem Abtastsignal
VSB und denr Vergleichsergebnis der Vergleichsschaltung 41 geliefert werdeSi. Wenn das Signal VO einen hohen Wert hat,
wird der Impuls SO von der Zeitgeberschaltung 40 abgegeben, und ein Vergleichsergebnis darüber, ob ie Periode, in der das
Signal VO einen hohen Wert hat, langer oder kürzer als der
Bezugswert TR_ ist, wird ans der Vergleichsschaltung 41 abgegeben,
so daß dann, wenn die Periode des Signals VO mit hohem Wert größer als der Bezugswert TR» ist, eine Symbolbildungsschaltung
42 als Reaktion auf das Abtastsignal VSTB einen Impuls abgibt, der anzeigt, daß der offene Klang VO vorliegt,
während dann, wenn die Periode des Signals VOp mit hohem Wert
kleiner als der Bezugswert TR„ ist, die Symbolbildungsschaltung
ebenfalls als Reaktion auf das Abtastsignal VSTB einen Impuls abgibt, der anzeigt, daß der mittlere Klang VM vorliegt. Wenn
das Signal VCp einen hohen Wert hat, wird von der Zeitgeber-
-TO-
schaltung 4 0 ein Impuls SC abgegeben, während das Vergleichsergebnis darüber, ob die Periode mit hohem Wert langer oder
kürzer als der Bezugswert TR3 ist, von der Vergleichsschaltung"
41 abgegeben wird. Wenn die Periode des Signals VC mit hohem Wert langer als der Bezugswert TR ist, gibt die Symbolbildungsschaltung
42 abhängig vom Abtastsignal VSTB einen Impuls ab, der zeigt, daß der geschlossene Klang VC vorliegt. Ist die
Periode des Signals VC mit hohem Wert dagegen kürzer als der Bezugswert TR„ , liefert die Symbolbildungsschaltung 42 ebenfalls
abhängig vom Abtastsignal VSTB einen Impuls, der anzeigt, daß der mittlere Klang VM vorliegt. Die Ausgangssignale VO
und VC der Symbolbildungsschaltung 4 2 haben somit für den Fall des offenen Klangs VO die Werte "1" und "0", für den Fall des
geschlossenen Klangs VC die Werte "0" und "1" und für den FaIL des mittleren Klangs VM die Werte "0" und "0". Die Ausgangssignale
VO und VC der Symbolbildungsschaltung 42 werden vom Abtastsignal VSTB in die Halteschaltung 4 3 eingegeben, und
wenn das Ausgangssignal V der Ausgangssignale V, PL und F der Diskriminatorschaltung 27 als ein Signal mit hohem Wert bestätigt
wird, werden sie zum E/A-Anschluß 14 abgegeben. Diese
Ausgangssignale VO und VC sind in Fig. 23 einschließlich ihrer Lage mit DF0 und DF- dargestellt. Die Halteschaltung 44
speichert den gezählten Wert des Zählers 39 abhängig vom Ab-. ,
tastsignal VSTB, und sie gibt diesen Wert auch an den E/AAnschluß 14 ab, damit er für den Fall der Anwendung der Längen
bei der Erkennung der Signale VO und VC benutzt wird. Nachdem die Ausgangssignale der Halteschaltungen 43 und 44 zum E/A- t
Anschluß 14 abgegeben worden sind, gibt die Zeitgeberschaltunc 4 0 ein Bereit-Signal SRDY ab. !
Das dem Taktimpulsgenerator 20 vom E/A-Anschluß 14 gelieferte"
Signal CR ist ein Signal, das in selektiver Weise die Abgabe [
der Ausgangssignale Cp und TM des Taktimpulsgenerators 20 bewirkt.
BAD ORIGINAL
- rr -
Der Computer 4 bewirkt die Speicherung der Signale DF , DF , DF„ und DF3 sowie des Ausgangssignals der Halteschaltung 44
im Bezugsmusterspeicher 7 oder im Sprachnachrichtenspeicher 15 abhängig von Signalen aus dem Speicher.3 und dem Speicher 5.
Dies bedeutet, daß in den Speichersystemen die Signale DFQ,
DF1, DF und DF , die die Klassifizierung des stummen Lauts
S, den offenen Klangs VO, des geschlossenen Klangs VC, des mittleren Klangs VM, des stimmlosen Reiblauts F und des stimmlosen
Sprenglauts PL angeben, sowie die Signale, die die Längen des offenen Klangs VO, des geschlossenen Klangs VC und
des mittleren Klangs VM angeben, abgespeichert werden. Im Anschluß daran vergleicht der Computer 4 diese klassifizierten
Signale und die Längen mit denen der zuvor abgespeicherten Bezugsmuster für das Erkennen der Nachricht (siehe das Muster 2
von Fig. 22) . In diesem Fall kann der ErkennungsVorgang gut. vereinfacht werden, wenn die klassifizierten Signale vor den
Längen verglichen werden und die Längen nur dann verglichen "
werden, wenn die klassifizierten Signale eine Übereinstimmung mit den Bezugsmustern zeigen. Beim Vergleich der Längen ist
es außerdem sehr günstig, wenn sie einer Normierung unterzogen werden. Wenn die gesamte gesprochene Nachricht bei diesem
Erkennüngsvorgang mit einem der Bezugsmuster übereinstimmt, · wird ein Befehlssignal für das richtige Steuern eines Geräts,
beispielsweise eines Massagegeräts, abhängig von der gegebenen gesprochenen Nachricht geliefert.
In der Ausfuhrungsform von Fig. 23 wird der Schritt der Erzeugung
der klassifizierten Signale und der Längen aus den Signalen V / UV, VO und VC mittels der dargestellten Schaltungsanordnung
durchgeführt; dieser Schritt kann natürlich auch vom Computer 4 ausgeführt werden. Ein Flußdiagramm der Ausführungsform von Fig. 2 3 ergibt sich klar bei Bezugnahme auf die Figuren
16 und 18, so daß-, es hier weggelassen ist.
In Fig. 24 ist eine weitere praktische Ausführungsform der
Ausführung von Fig. 14 dargestellt, in der die über das Mikrophon 6 erhaltene gesprochene Nachricht X(t) vom Verstärker
8 verstärkt und den Eingängen der ersten Filterbank 9, der zweiten Filterbank 1O7 der dritten Filterbank 45,
der vierten Filterbank 46 und der fünften Filterbank 47 zugeführt wird. Diese Filterbänke enthalten jeweils eine
Serienschaltung aus einem Filter, einer Gleichrichterschaltung und einer Mittelungsschaltung, die eine Integrationsschaltung enthält. Das Filter der ersten Filterbank 9 läßt
eine Frequenzkomponente unter 0,5 kHz durch, das Filter der zweiten Filterbank 10 läßt eine Frequenzkomponente von 0,5
bis 1,0 kHz durch, das Filter in der dritten Filterbank 45 läßt eine Frequenzkomponente von 0,8 bis 1,8 kHz durch, das
Filter in der vierten Filterbank 4 6 läßt eine Frequenzkomponente von 1,8 bis 3,2 kHz durch. Die Integrationsschaltung
hat eine Zeitkonstante von etwa 5,5 ms in der ersten Filterbank 9 und in der zweiten Filterbank 10 sowie eine
Zeitkonstante von etwa 3 ms in der dritten Filterbank 45 und in der vierten Filterbank 46. Durch Bezugnahme auf die
Figuren 25A bis 25C ist erkennbar, daß mittels der dritten Filterbank 45 und der vierten Filterbank 46 Ausgangssignale
erzeugt werden, die den Artikulationen an den vorderen und
ta - !
hinteren Bereichen "einer Zungenlage, bezüglich des zweiten \
Formanten in zweifacher Hinsicht unterteilt, erzeugt werden. ; Fig. 25A zeigt die Artikulationspunkte für /a/, /e/, /i/, /o/
und /u/; Fig. 25B zeigt die Beziehungen des ersten Formanten F1 und des zweiten Formanten F' zwischen den jeweiligen Vokale
/a/, /e/, /i/, /o/ und /u/ und Fig. 25C zeigt ebenfalls die ; F1- und F -Beziehungen zwischen diesen Vokalen, insbesondere
für den Fall der japanischen Sprache. Die Artikulationspunkte sind in der japanischen Sprache für diese Vokale ein wenig :
nach innen verschoben.
BAD ORIGINAL
In der fünften Filterbank 47 läßt das Filter eine Frequenz- ,
komponente von 5,0 bis 12,0 kHz durch, und die Integrationsschaltung
hat eine Zeitkonstante von etwa 1 ms. Die Mittelungsschaltungen in den Filterbänken 9, 10, 45, 46 und 47 haben
eine Grenzfrequenz von 29 Hz, 29 Hz, 53 Hz, 53 Hz bzw. 159 Hz. ■ i
Ausgangssignale f.. und f der ersten Filterbank bzw. der zweiten
Filterbank werden in einer Additionsschaltung 48 addiert, und im Anschluß daran wird di e Summe in einem Koeffizientenmultiplizierer
48A so verarbeitet, daß sie an einem Differenzver- · stärker 49 eine Beziehung von -6 dB/Oktave bezüglich des Ausgangssignals
fj. der fünften Filterbank 47 hat, und sie wird
dann vom Ausgangssignal f- subtahiert. Das Ausgangssignal f^ (f..
+ f2) des Verstärkers 49 wird über eine verstärkende Mittelungsschaltung
50 einer Diskriminatorschaltung 51 zugeführt. Diese Diskriminatorschaltung 51 weist einen voreingestellten
Bezugswert R , v auf, und die Schaltung soll die Eingangssignale
abhängig von dem Bezugswert R ,n verarbeiten; der Schwellenwert
an den Übergangs Zeitpunkten des Signals fg - (f.. + f»)
oder den Signalen V der stimmhaften Laute und UV der stimmlosen ;
Laute von der Periode des stimmlosen Lauts UV zur Periode des stimmhaften Lauts ^V wird gleich. R (normalerweise i- R^. /rjV) - !·
gemacht, und der Schwellenwert der übergänge von der Periode j.
des stimmhaften Lauts V zur Periode des stimmlosen Lauts UV ; wird gleich R (^ R) gemacht, wodurch die Ausgangssignale
(V/UV) der Diskriminatorschaltung 51 einen hohen Wert haben, während sie innerhalb der Periode des stimmhaften Lauts V
liegen und die Periode des stimmhaften Lauts getreu wiedergeben.
Das Aussgangssignal f der ersten Filterbank 9 wird in einem
Koeffizientenmultiplizierer 52 so verarbeitet, daß es in bezug auf das Ausgangssignal f„ der zweiten Filterbank 10 eine
Beziehung von -6 dB/Oktave hat, und es wird vom Ausgangssignal f2
an einen Differenzverstärker 53 subtrahiert, dessen Ausgangs-
- ΪΟ -
signale über eine verstärkende Mittelungsschaltung 54 einer Diskriminatorschaltung 55 zugeführt werden. Ein eingestellter
Bezugswert R1/2 dieser Diskriminatorschaltung 55 ist so,
vorherbestimmt, daß die Schaltung jeweilige Eingangssignale abhängig vom Bezugswert R .„ verarbeitet, wobei ein Schwellenwert
an den Ubergangszeitpunkten vom geschlossenen Klang VC zum offenen Klang VO gleich R1 (normalerweise φ Ri/2^
gemacht wird, und ein Schwellenwert an den Ubergangszeitpunkten vom offenen Klang VO zum geschlossenen Klang VC gleich
R0 (^ R1) gemacht wird, wodurch Ausgangssignale der Diskriminatorschaltung
55 während der Periode des offenen Klangs VO mit hohem Wert erzeugt werden und diese bestimmte Periode
getreu wiedergegeben wird. Ein Koeffizientenmultiplizierer 56 sorgt dafür, daß das Ausgangssignal f.. der dritten Filterbank ■
45 eine Beziehung von -6 dB/Oktave bezüglich des Äusgangssignals f. der vierten Filterbank 4 6 hat, und das Ausgangs-·
signal f_ wird von diesem Ausgangssignal f. in einem Differenzverstärker
57 subtrahiert, dessen Ausgangssignale über die verstärkende Mittelungsschaltung 58 einer Diskriminatorschaltung ;
59 zugeführt werden. Die Diskriminatorschaltung 59 weist einen vorbestimmten eingestellten Bezugswert R3Z4 auf, und sie ver-i
arbeitet die jeweiligen Eingangssignale in Abhängigkeit von diesem Bezugswert; ein Schwellenwert für Übergänge von einem. \.
hinteren Klang VR zu einem vorderen Klang VF wird gleich s R_ (normalerweise ^ R^ ,.) gemacht, und ein Schwellenwert für ;
übergänge von dem vorderen Klang VF zum hinteren Klang VR : wird gleich R. (■£ R-J gemacht. Es ist außerdem eine Diskrimi-;
natorschaltung 60 vorgesehen, die Signale Sp erzeugt, die angeben, daß das Signal X(t) von einem stimmhaften oder stimm- ■
losen Laut stammt, wenn das Signal den Bezugswert R überschreitet,
und von einem stummen Laut stammt, wenn es diesen Bezugswert nicht überschreitet, wodurch die vier Signale \
(V/UV)p, P /2, P3/4 und Sp an den E/A-Anschluß 14 geliefert
und als 4-Bit-Signal Pfc = ((V/UV)pt, P1/2t' P3/4t' SPt* für
eine Abstandsberechnung benutzt werden. ;
BAD ORIGINAL
- tr -
"-Ϊ5-
In einem praktischen Beispiel soll das aus den Größen ((V/UV)pt, P1/2t' P3/4t' SPt) bestehende 4-Bit-Signal
für /a/ den Wert (1, 1, 0, 1) und für /i/ den Wert (1/ 0, 1, 1) haben. Wenn das Signal P dem Computer 4 mit <
einer vorbestimmten Abtastperiode (die in geeigneter Weise ϊ
im Bereich von 5 bis 20 ms abhängig von der Sprechgeschwindigkeit ausgewählt ist) zugeführt wird, wird das Signal P- =
(Phonemvektor) im Musterspeicher 7 (repräsentiert durch Q ) oder im Sprachnachrichtenspeicher 15 nur gespeichert, wenn i
dem Computer 4 das gleiche Bitmuster nacheinander öfter als eine vorbestimmte Anzahl (beispielsweise zweimal oder dreimal)
zugeführt wird, damit Fehlerkennungen vermieden werden.
Das Bezugsmuster Qgt =
<(V/üV)pst, P1/2st, P3/4st' SPst}
kann in der gleichen Weise wie das oben erwähnte Bit-Signal P gebildet werden.
Im Computer 4 wird dann der Abstand zwischen den aus der ge-
sprochenen Nachricht X(t) gebildeten Signalen, d.h. dem
Phonemvektor P , und dem Phonemvektor Q , des Bezugsmusters :-
berechnet. Es ist erkennbar, daß der Abstand zwischen den "
den jeweiligen Phonemen der gesprochenen Nachricht X ent- .· sprechenden Phonemvektor P und dem den jeweiligen Phonemen ' jr
des Bezugsmusters entsprechenden Phonemvektor Q unter Ver- ' l
Wendung der Antivalenzbeziehung 0 ausgedrückt werden kann: >
VQst * Pt} = 2t { ({V/°V)Pst®
+ (P1/2st® 11V2St* + (P3/4st©P3/4t)
+ .(SPst© Spt)} .
Das Bezugsmuster für den Fall, daß der Ausdruck Σ, {Q - P. }
unter dem vorbestimmten Wert und dem Minimum liegt, also das "s" entsprechende Muster für den Fall, daß Σ {Q - P } unter
dem vorbestiinmtGn Wert und dem Minimum liegt, soll als Inhalt
- -w
. 76
der gesprochenen Nachricht X erkannt werden, und es wird über die Busleitung 2 und den E/A-Anschluß 14 dem Gerät, beispielsweise
dem Massagegerät, zugeführt, damit dieses einen richtigen Arbeitsvorgang ausführt. - .
Für den Fall, daß Σ {Q - P } nicht, für alle "s" unterhalb :
des vorbestimmten Werts liegt, wird im vorliegenden Ausführungsbeispiel entschieden, daß kein Bezugsmuster vorliegt, das
auf die gesprochene Nachricht X anwendbar ist und kein zutreffendes Bezugsmuster existiert, was in anderen Worten bedeutet,
daß die gegebene gesprochene Nachricht X kein richtiger Befehl ist, so daß eine erneute Eingabe der Nachricht als notwendig
angezeigt wird. Falls der Unterschied zwischen dem Minimumwert des Ausdrucks Σ {Q - P } und einem nächsten Wert, d.h. den
t st t
vorletzten Wert vor dem Minimum, kleiner als ein vorbestimmtei
Wert ist, wird eine erneute Eingabe angefordert, um jede fehle hafte Erkennung zu vermeiden. Es ist zu erkennen, daß erfordei
lichenfalls dafür gesorgt werden kann, daß ein einziges Steue:
signal für das zu steuernde Gerät mehreren Bezugsmustern entspricht, so daß die gleiche Tätigkeit des Geräts mit Hilfe
jeweils verschiedener gesprochener Nachrichten erreicht werdei
kann.
Die Kapazität des Computers 4 kann im Fall der Ausführungsfor
von Fig. 24 beträchtlich mehr reduziert werden, als bei bekannten Ausführungen. Dies soll anschließend unter Verwendung
des obigen Beispiels der gesprochenen Nachricht /Senakaosasur erläutert werden. Da diese Nachricht 13 Phoneme enthält, betr
das Volumen des 4-Bit-Signals P insgesamt 4 χ 13 = 52 Bits.
Ein herkömmlicher 4-Bit-Computer (4-Bit-CPU) erforderte somit 800 Bytes für die Verarbeitung der gesprochenen Nachricht mit
einer Länge von 2 Sekunden; mittels der Erfindung kann eine L
beträchtliche Reduzierung dieser Verarbeitungszeit erzielt werden, die sich praktisch aus der Verarbeitung von 20 bis 3C
Bytes ergibt. Wenn etwa 16 Typen gesprochener Nachrichten vo3
BAD ORIGINAL
- A3 -
handen sind, können sie gut erkannt werden, wenn nur das
4-Bit-Signal Pfc = ((V/UV)pt, P3Z4) und ein 2-Bit-Signal
verwendet werden. Dies läßt sich ohne weiteres daraus erkennen, daß die sich auf die stimmhaften Laute beziehenden
Signale V und die auf die stimmlosen Laute UV sich beziehen- | den Signale sowie die Signale, die sich auf den zweiten .
Formanten beziehen, bei dem die Differenz des Frequenz- · \
spektrums der fünf Vokale /a/, /o/, /u/, /e/ und /i/ am größten ist, benutzt werden. \
Ein Flußdiagramm der Ausführungsform von Fig. 24 ergibt sich ohne weiteres bei Betrachtung der Figuren 16 und 18, so daß
es hier weggelassen ist. l
In Fig. 26 ist eine weitere Ausführungsform der Erfindung · .
dargestellt, bei der die Diskriminatorschaltungen 51, 55, 59 und 60 von Fig. 24 entfernt sind, die den Diskriminatorschaltungen
36 und 37 von Fig. 23 entsprechenden Diskriminatorschaltungen 61 und 62 an die verstärkende Mittelungsschaltung ,
50 angeschlossen sind und anschließend zu erläuternde Abwand- ; [■
lungen vorgenommen sind. Zwei Diskriminatorschaltungen 63 und j 64 sind an die verstärkende Mittelungsschaltung 54 ange- " \,
schlossen. Die Diskriminatorschaltung 63 vergleicht die Aus- ί
gangssignale der verstärkenden Mittelungsschaltung 54 mit dem . ? Bezugswert R1, und sie erzeugt ein Signal P1, das nur dann einen
hohen Wert hat, wenn die Ausgangssignale der Diskrimi- j
natorschaltung 54 größer als der Bezugswert R1 sind. Die an- ,:
dere Diskriminatorschaltung 64 vergleicht die gleichen Aus- \
gangssignale der Mittelungsschaltung 54 mit einem weiteren : Bezugswert R_, und sie erzeugt ein Signal P„, das nur dann ;
einen hohen Wert hat, wenn die verglichenen Signale kleiner " als der Wert R3 sind. Zwei weitere Diskriminatorschaltungen 65
und 66 sind an die verstärkende Mittelungsschaltung 58 angeschlossen.
Die Diskriminatorschaltung 65 vergleicht dabei die" "i Ausgangssignale der Mittelungsschaltung 58 mit dem Bezugswert R-, ■
- ΛΑ
und sie erzeugt ein Signal P^, das nur dann den hohen Wert
hat, wenn die verglichenen Signale größer als der Bezugswert R_ sind. Die andere Diskriminatorschaltung 66 vergleicht die !
gleichen Ausgangssignale der Mittelungsschaltung 58 mit einem
Bezugswert R., und sie erzeugt ein Signal P., das nur dann
den hohen Wert hat, wenn die verglichenen Signale kleiner als der Bezugswert R. sind. Mit dieser Anordnung werden dem E/AAnschluß
14 die sechs Signale Vp, UV und P bis P. zugeführt,
und der Computer 4 wählt diese Signale in Form von 6-Bit-Signalen pfc = (Vpfc, UVpfc, P^, P^, TP^, P4fc) für die Abstands
berechnung. Weitere Verarbeitungen der Signale für die Nach- : richtenerkennung werden so durchgeführt wie im Zusammenhang
mit der obigen Ausführungsform von Fig. 24 erläutert wurde.
In Fig. 27 sind Flußdiagramme dargestellt, die zusammen mit jeweils einer der Ausführungsformen der Figuren 5, 14, 23, 24
und 26 benützt werden können; die Flußdiagramme gelten spezie] für den Fall, daß eine programmierte Verarbeitung im Computer
für die von den obigen Ausführungsbeispielen erhaltenen Signa] V für stimmhafte Laute und UV für stimmlose Laute sowie ihre
Impulssignale durchgeführt wird. Das Flußdiagramm von Fig. 27J ist ein Formungsprogramm für die Signale U und UV, bei dem un·
geformte Signale U und UV (die in einer Liste für ungeformte ,
Signale enthalten sind) in den Computer 4 eingegeben werden u: zuerst einem Bestimmungsvorgang unterzogen werden, ob ihr .
erster Impuls der stille Laut S ist oder nicht. Wenn der erst' Impuls der stumme Laut S ist, wird dieser Impuls zusammen mit
seiner Länge in eine Liste für geformte Signale eingegeben. [
Wenn ein zweiter Impuls der ungeformt.en Liste beispielsweise : nicht der stumme Laut S ist, wird festgestellt, ob seine Läng
größer als ein vorbestimmter Wert iSR1 ist oder nicht. Ist se Länge nicht größer als dieser Wert, wird der zweite Impuls al
der stumme Laut S interpretiert und in die geformte Liste eingegeben; ist seine Länge jedoch größer, werden der zweite Imp
und seine Länge in die geformte Liste geschoben. Der Bestimmu
BAD ORIGINAL
- 46 -
-M-
Vorgang wird an einem dritten Impuls der ungeformten Liste
fortgesetzt, um festzustellen, ob der Impuls einem stummen
Laut S entspricht oder nicht, und ob seine Länge kleiner als
ein vorbestimmter Wert iSR2 ist oder nicht. Ist seine Länge x
nicht kleiner, werden der dritte Impuls und seine Länge so,
als entspräche er einem stummen Laut S, in die geformte Liste
geschoben; ist seine Länge kleiner, wird festgestellt, ob ·' > ein vierter Impuls mit dem zweiten Impuls identisch ist oder I nicht. Liegt keine Identität vor, werden der dritte Impuls \ und seine Länge so, als entspräche er dem stummen Laut S, in \ die geformte Liste geschoben, während für den Fall der Identität der dritte Impuls so modifiziert wird, daß er gleich ; dem zweiten und vierten Impuls ist, und er wird in die geformte ι Liste aufgenommen. Im Anschluß daran wird ein Suchvorgang
durchgeführt, um festzustellen, ob ein erster stummer Laut S
im fünften und in den folgenden Impulsen der ungeformten Liste :-l vorhanden ist. Es wird festgestellt, ob der jüngste stumme Ά Laut S kleiner als der Wert iSR2 ist oder nicht, und im An- !- Schluß daran werden die gleichen Vorgänge wiederholt, die " oben beschrieben wurden. Wenn die ungeformte Liste auf diese « Weise vollständig -für den Formvorgang verarbeitet worden ist, j' wird festgestellt,job der letzte Impuls der Liste ein stummer | Laut S ist oder nicht; liegt ein stummer Laut vor, wird der | letzte stumme Laut S in der geformten Liste weggelassen; liegt i
fortgesetzt, um festzustellen, ob der Impuls einem stummen
Laut S entspricht oder nicht, und ob seine Länge kleiner als
ein vorbestimmter Wert iSR2 ist oder nicht. Ist seine Länge x
nicht kleiner, werden der dritte Impuls und seine Länge so,
als entspräche er einem stummen Laut S, in die geformte Liste
geschoben; ist seine Länge kleiner, wird festgestellt, ob ·' > ein vierter Impuls mit dem zweiten Impuls identisch ist oder I nicht. Liegt keine Identität vor, werden der dritte Impuls \ und seine Länge so, als entspräche er dem stummen Laut S, in \ die geformte Liste geschoben, während für den Fall der Identität der dritte Impuls so modifiziert wird, daß er gleich ; dem zweiten und vierten Impuls ist, und er wird in die geformte ι Liste aufgenommen. Im Anschluß daran wird ein Suchvorgang
durchgeführt, um festzustellen, ob ein erster stummer Laut S
im fünften und in den folgenden Impulsen der ungeformten Liste :-l vorhanden ist. Es wird festgestellt, ob der jüngste stumme Ά Laut S kleiner als der Wert iSR2 ist oder nicht, und im An- !- Schluß daran werden die gleichen Vorgänge wiederholt, die " oben beschrieben wurden. Wenn die ungeformte Liste auf diese « Weise vollständig -für den Formvorgang verarbeitet worden ist, j' wird festgestellt,job der letzte Impuls der Liste ein stummer | Laut S ist oder nicht; liegt ein stummer Laut vor, wird der | letzte stumme Laut S in der geformten Liste weggelassen; liegt i
kein stummer Laut vor, wird der Formvorgang beendet. r
Da das Formprogramm für die Signale VO der offenen Klänge und ;·
VC der geschlossenen Klänge mit dem obigen Programm von Fig. 27A ]
für die Signale V und UV völlig übereinstimmt, wird hier nicht <
darauf Bezug genommen. ^
Das in Fig. 27B dargestellte Flußdiagramm gilt für ein Programm '
zur Erstellung zusammengesetzter Signale aus den geformten -
Signalen V, UV sowie VO und VC. Es wird festgestellt, ob die l
COPY "
jeweiligen Impulse der geformten Liste der Signale V und UV dem stummen Laut S oder dem stimmlosen Laut UV entsprechen.
Für den Fall, daß S oder UV bestimmt wird, werden die Signale für S oder UV zusammen mit ihrer jeweiligen Länge in eine
Gesamtimpulsliste geschoben. Wenn der Impuls weder S noch UV entsprach oder die Schiebevorgänge von S und UV in die : ;
Gesamtimpulsliste beendet sind, wird festgestellt, ob ein offener Klang VO in der geformten Liste der Signale VO für
die offenen Klänge und VC für die geschlossenen Klänge innerhalb der Zeitperiode des stimmhaften Lauts V in der geformten
Liste der Signale V für stimmhafte Laute und UV für stimmlose Laute vorhanden ist. Wenn VO in der V-Periode vorhanden ist,
wird das Signal VO in die Gesamtimpulsliste geschoben. Falls VO in der V-Periode nicht vorhanden ist, oder wenn das Schiebe
der V0-Signale in die Gesamtimpulsliste beendet ist, wird bestimmt, ob ein Klangsignal VC in der V-Periode vorhanden ist.
Wenn VC in der V-Periode vorhanden ist, wird das VC-Klangsignal in die Gesamtimpulsliste geschoben. Wenn VC in der
V-Periode nicht vorhanden ist oder das Schieben der VC-Klang—
signale in die Gesamtimpulsliste beendet ist, wird festgestel" ob ein Signal S für einen stummen Laut in der geformten Liste
der Signale VO und VC in der V-Periode vorhanden ist oder nie!
Wenn S vorhanden ist, wird dieses Lautsignal als mittlerer - \
Klang VM interpretiert und in die Gesamtimpulsliste geschoben Falls kein Lautsignal S in der V-Periode vorhanden ist oder j
das Schieben des Klangsignals VM in die Liste beendet ist, is der Vorgang der Erstellung der Gesamtimpulse beendet. - i
In Fig. 27C ist das Flußdiagramm eines Programms zur hierarch sehen Klassifizierung der Gesamtimpulsliste dargestellt.
Aus der Liste werden zunächst die Lautsignale V und UV ausge wählt und entsprechend ihrer Klassifizierung in die erste Ran
ebene eingegeben. Mit η = 1 , d.h. beim ersten Lautsignal V, wird festgestellt, ob die Klangsignale VM, VO und VC in der
Liste vorhanden sind. Bei Anwesenheit der Klangsignale.VM, VO
BAD ORIGINAL
- 47 -
- 2A-
und VC werden sie als V(1) in der zweiten Rangebene klassi- j
fiziert. Im Anschluß daran wird mit η = η + 1, also für das
zweite Lautsignal V, festgestellt, ob VM,- VO und VC in der
Liste vorhanden sind oder nicht. Die Verarbeitung wird in der gleichen Weise bis zum letzten Lautsignal V wiederholt. Bei
Beendigung der Verarbeitung bis zum letzten Lautsignal V, bei dem V(n) in der zweiten Rangebene klassifiziert wird, sindkeine
Klangsignale VM, VO oder VC für η + 1 vorhanden. Somit ist erreicht worden, daß die Liste aus "n" Teilen von V(n)
als zweite Rangebene erstellt ist. Wie aus dem Obigen hervorgeht, wird bei der hierarchischen Klassifizierung die aus
den Lautsignalen V, UV und S bestehende Liste als erste Rangebene erstellt, und eine weitere Liste mit den Klangsignalen
VM, VO und VC, die das Lautsignal V in der Liste der ersten Rangebene repräsentieren und nacheinander zu V(1), V(2) ... V(n)
gemacht werden, wird als die zweite Rangebene erstellt. Ergebnisse dieser hierarchischen Klassifizierung sind in Fig. 28
ΐ für die gesprochene Nachricht /Senakaosasure/ dargestellt.
Fig. 27D zeigt das Flußdiagramm eines Programms zur Normierung \
der Längen der in den Listen der ersten und der zweiten Rang- :
ebene enthaltenen jeweiligen Elemente, die gemäß Fig. 2 7C "\
klassifiziert worden sind, wobei gilt: j = 1; es wird dabei %
festgestellt, ob die Normierung der Liste der ersten Rangebene . }
beendet worden ist. Falls die Beendigung nocht nicht erfolgt ;~
ist, werden die Längen der in der Liste der ersten Rangebene " j
klassifizierten Elemente normiert. Das heißt, daß zunächst der
Normierungskoeffizient X. = 1000/(Z1 Y.) der zu verarbeitenden j
gesprochenen Nachricht (die zur "i"-ten gesprochenen Nachricht
gemacht wird) erhalten wird (Y.. ist dabei die Länge des ersten ■
Elements der Liste der ersten Rangebene) . Im Anschluß daran ';.
wird die erste normierte Länge P. ..-■ = X. ·Υ. der Nachricht er- \
AD ι 3
halten (j = 1) , worauf .die Normierung mit j = j + 1 wiederholt
wird, bis das letzte Element der Liste der ersten Rangebene ■-- [-normiert
ist (praktische numerische Werte sind in Fig. 28 an- COPY gegeben). Nach Beendigung der Normierung der Liste der ersten
- Αβ -
■Sä-
Rangebene wird mit η = 1 festgestellt, ob die Liste der
zweiten Rangebene vollständig normiert worden ist oder nicht. , Wenn die Normierung noch nicht beendet worden ist, wird die I Länge des Elements V(1) normiert. Mit k = 1 wird festgestellt, ob die Längen der Elemente von V(1) normiert sind oder nicht. Ist dies noch nicht der Fall, wird der Normierungskoeffizient: Χ±(1) = 1000/(E1 Y1 (D) gebildet (Y. ist dabei die Länge des ersten Elements von V(I)). Im Anschluß daran wird die erste
normierte Länge P.,(D = X.(1)■Y, (1) (k = 1) für V(1) erhalter Die Normierung wird dann bis zum letzten Element von V(D mit k = k + 1 wiederholt. Nach der Beendigung der Normierung für V(D wird die Normierung für V(2) ... V(n) in der Liste der
zweiten Rangebene mit η = η + 1 in der oben beschriebenen Weis durchgeführt. Nach Beendigung der Normierung für die Liste
der zweiten Rangebene ist die Längennormierung fertig. Eine
Bezugnahme auf Fig. 28 trägt zum weiteren Verständnis des
Normierungsvorgangs bei.
zweiten Rangebene vollständig normiert worden ist oder nicht. , Wenn die Normierung noch nicht beendet worden ist, wird die I Länge des Elements V(1) normiert. Mit k = 1 wird festgestellt, ob die Längen der Elemente von V(1) normiert sind oder nicht. Ist dies noch nicht der Fall, wird der Normierungskoeffizient: Χ±(1) = 1000/(E1 Y1 (D) gebildet (Y. ist dabei die Länge des ersten Elements von V(I)). Im Anschluß daran wird die erste
normierte Länge P.,(D = X.(1)■Y, (1) (k = 1) für V(1) erhalter Die Normierung wird dann bis zum letzten Element von V(D mit k = k + 1 wiederholt. Nach der Beendigung der Normierung für V(D wird die Normierung für V(2) ... V(n) in der Liste der
zweiten Rangebene mit η = η + 1 in der oben beschriebenen Weis durchgeführt. Nach Beendigung der Normierung für die Liste
der zweiten Rangebene ist die Längennormierung fertig. Eine
Bezugnahme auf Fig. 28 trägt zum weiteren Verständnis des
Normierungsvorgangs bei.
In Fig. 27E ist das Flußdiagramm eines Programms zur Identifizierung
der in Fig. 27D normierten Signale dargestellt. Bei einer ersten Identifizierung wird die normierte Liste der
ersten Rangebene mit den Bezugsmustern im Hinblick auf die
Anzahl der jeweiligen Lautsignale V, UV und S in dieser Liste verglichen. Wenn kein Lautsignal mit kurzer Länge vorhanden " ist, werden die Signale mit den Bezugsmustern verglichen, die kein kurzes Lautsignal S enthalten, während die Signale, die das kurze Lautsignal enthalten, verglichen und als Lautsignal interpretiert werden, die einen Laut UV unmittelbar benachbar dem kurzen Laut S haben. Bei der Durchführung des Vergleichsvorgangs wird auch die Normierungszeit betrachtet. Wenn sich die Nachricht bei der ersten Identifizierung als anwendbar ; auf eines der Bezugsmuster erweist, wird eine zweite Identifi zierung ausgeführt, wozu die normierte zweite Rangebene benut wird. Es werden also V(D ... V(n) nacheinander verglichen.
Wie sich aus der Zeichnung ergibt, wird der Vergleichsvorganc
ersten Rangebene mit den Bezugsmustern im Hinblick auf die
Anzahl der jeweiligen Lautsignale V, UV und S in dieser Liste verglichen. Wenn kein Lautsignal mit kurzer Länge vorhanden " ist, werden die Signale mit den Bezugsmustern verglichen, die kein kurzes Lautsignal S enthalten, während die Signale, die das kurze Lautsignal enthalten, verglichen und als Lautsignal interpretiert werden, die einen Laut UV unmittelbar benachbar dem kurzen Laut S haben. Bei der Durchführung des Vergleichsvorgangs wird auch die Normierungszeit betrachtet. Wenn sich die Nachricht bei der ersten Identifizierung als anwendbar ; auf eines der Bezugsmuster erweist, wird eine zweite Identifi zierung ausgeführt, wozu die normierte zweite Rangebene benut wird. Es werden also V(D ... V(n) nacheinander verglichen.
Wie sich aus der Zeichnung ergibt, wird der Vergleichsvorganc
BAD ORIGINAL
-■83-
auf vier Wegen durchgeführt, wobei es in diesem Fall ausreichen
soll, wenn sich herausstellt, daß die jeweiligen Signale Bezugsmustern entsprechen, die bei der ersten Identifizierung
in einem der vier Wege ausgewählt worden sind. Auf dem ersten Weg werden die Bezugsmuster ausgewählt, die *'
beispielsweise mit V(1) übereinstimmen, worin das Klangsignal VM zum Klangsignal VO oder zum Klangsignal VC gemacht ~" -T1
wird; das oder die Bezugsmuster, die mit V(1) übereinstimmen, worin die Klangsignale VO und VC gleich dem Klangsignal VM
sind, bleiben übrig. Auf dem zweiten Weg werden die Bezugsmuster ausgewählt, die mit V(1) in der vom Klangsignal VO.
besetzten Rate übereinstimmen. Auf dem dritten Weg wird bestimmt, ob die Hauptkomponente von V(D eines der Klangsignale
VO, VC und VM ist, und es werden die mit einer solchen Komponente übereinstimmenden Bezugsmuster ausgewählt; es wird dann
festgestellt, ob die zweite Komponente von V(D gleich einem der Klangsignale VO, VC und VM xst, worauf das oder die
Bezugsmuster, die in dieser Hinsicht übereinstimmen, übrig bleiben. Auf dem dritten Weg, werden insbesondere die jeweiligen
Komponenten von V(D nacheinander, beginnend mit denen " mit der größeren Länge, zu . dem mit der kürzesten Länge angeordnet,
und das oder die. Bezugsmuster, die in einer solchen
Folge übereinstimmen, werden ausgewählt. Auf dem vierten Weg werden solche "Punkte", wie sie in der folgenden Tabelle angegeben
sind, als eine Funktion benutzt, die das Ausmaß der Übereinstimmung angibt, das dem Abstand zwischen dem Eingangs- - I
muster von V(i) mit (i) von 1 bis η in den Signalen V(D ··· V(n) %
und dem Bezugsmuster entspricht: i
COPY
| • VM | VO/VC | 0 |
| VO/VC | VM | 0 |
| VO | VO | + 1 |
| VM | VM | + 1 |
| VC | VC | + 1 |
| VO | VC | - 1 |
| VC | VO | - 1 |
Es werden die Bezugsmuster ausgewählt/ bei denen die Gesamtsumme der Punkte, die für jeden Abtastwert oder für jeden
der normierten Zeit entsprechenden Abtastwert berechnet sind, über einem vorbestimmten Wert liegt (die gesamte Abtastzahl
beträgt beispielsweise 1000). Wenn das Eingangsmuster vollständig mit dem Bezugsmuster übereinstimmt, ist die gesamte
Abtastzahl gleich der zuvor genannten Gesamtsumme. Der vierte Weg legt somit die "Punkte" bezüglich des Kurvenverlaufs fest,
doch ist zu erkennen, daß diese Definition bezüglich der symbolischen Impulse oder der normierten Längenwerte gemacht
werden kann.
Die auf diesel Weise-in den jeweiligen vier Wegen ausgewählten
und bezüglich aller V(i) übereinstimmenden Bezugsmuster werdei entnommen, und aus den entnommenen Bezugsmustern wird das optimale
Bezugsmuster ausgewählt, wodurch der Erkennungsvorgang beendet wird. Wenn das optimale Bezugsmuster ausgewählt werdei
kann,'soll über die Busleitung 2 und den E/A-Anschluß 14 ein diesem optimalen Muster entsprechender Befehl zu einem Gerät,
beispielsweise dem Massagegerät 16, gegeben werden, jedoch sollte vom Sprecher eine erneute Eingabe der gesprochenen Nacl
rieht verlangt werden, wenn kein optimales Bezugsmuster ausgewählt
werden kann.
BAD ORIGINAL
- 51.-
Die vier oben beschriebenen Wege sind im Flußdiagramm von Fig. 27E zwar für die Durchführung der zweiten Identifizierung
auf der zweiten Rangebene beschrieben worden, doch ist es auch möglich, einige dieser Wege wegzulassen, falls dies
erforderlich·ist.
Aus den Ausführungsformen der Figuren 24 und 26 ist offensichtlich,
daß Ergebnisse weiter an Modelle des menschlichen Hörorgans angepaßt werden können, wenn der logarithmische
Verstärker bei jedem der zwei Eingänge der entsprechenden Differenzverstärker 49, 53 und 57 oder zwischen die Gleichrichterschaltung
und die Mittelungsschaltung in jeder der fünf Filterbänke 9, 10, 45, 4 6 und 47 eingefügt wird. Für
diesen Fall erzielbare Vorteile lassen sich ohne weiteres verstehen, wenn auf die logarithmischen Verstärker 32A und 33A
von Fig. 23 Bezug genommen wird; eine genaue Beschreibung ist aus diesem Grund hier weggelassen.
Wie aus der obigen Beschreibung hervorgeht, werden mit Hilfe der Erfindung mehrere Bezugsmuster bei der Erkennung einer
speziellen gesprochenen'Nachricht gebildet, damit ein gewisses
Ausmaß an Freiheit?-in den Bearbeitungs- und Erkennungsfähig- |
keiten gewährleistet wird. Experimente haben gezeigt, daß im Gegensatz zu den Signalen V für stimmhafte Laute und UV für
stimmlose Laute die Signale VO und VC für offene bzw. geschlossene
Klänge unter dem Einfluß individueller phonetischer Unterschiede oder einiger anderer Bedingungen variabel sind.
Bei Berücksichtigung dieses Sachverhalts in Bezugnahme auf die oben erwähnte gesprochene Nachricht /Senakaosasure/ und
auf die die Phonemmuster dieser Nachricht darstellende Fig. ist zu erkennen, daß die Zone des stimmhaften Klangs V wenigstens
zwei unterschiedliche Artikulationen aufweist, während die Zone des stimmlosen Klangs UV möglicherweise nur in einem
Spezialfall verschwindet, nämlich im Anschluß an den kurzen ΓΌΡΥ
stummen Klang S. Aus diesem Grund wird ein Bezugsmuster so gebildet, daß das Vorhandensein des stimmlosen Klangs UV er-
kannt werden kann, ohne Rücksicht darauf, ob er an einer Stelle im Anschluß an den kurzen stummen Laut S verschwindet
oder nicht. Für den Fall/ daß der stimmhafte Laut V unter der Annahme behandelt wird, daß der mittlere Klang VM zwischen
einem offenen Klang VO und einem geschlossenen Klang VC entweder als offener Klang VO oder als geschlossener Klang VC 3 ■
gesprochen werden kann, sind alle diese Fälle in Fig. 29 enthalten.
Wenn nur die Signale V für stimmhafte Laute und UV für stimmlose Laute benutzt werden, kann der Erkennungsvorgang auf der
Basis durchgeführt werden, daß bestimmt wird, ob der stumme Laut S kurz ist oder nicht, wobei der stimmlose Laut UV nur
dann auf den stummen Laut S folgt, wenn dieser kurz ist.
Falls sowohl die Signale V für stimmhafte Laute und UV für stimmlose Laute als auch die Signale VO für offene Klänge und
VC für geschlossene Klänge verwendet werden, ist es möglich, nicht nur die Erscheinung des Verschwindens des stimmlosen i
Lauts UV nach dem stummen Laut S, sondern auch die Anwesenheit und Schwankung des mittleren Klangs VM zu berücksicht- ;
gen. In diesem Fall ist es jedoch notwendig, zuvor die Längen· zu messen. Die obige Verarbeitung bei Anwesenheit des kurzen ,
stummen Lauts S sollte dabei gleichzeitig durchgeführt werden, und es kann ein bevorzugtes Ergebnis erreicht werden. !
Unter Bezugnahme auf Fig. 30 wird nun die bevorzugte Erstellu?
oder Abspeicherung der Bezugsmuster nach der Erfindung erläuti Unzuverlässigkeiten und Nichtbestimmtheiten aufgrund phonetisi
Unterschiede der individuellen Sprecher oder dergleichen werd< dabei berücksichtigt. Wenn eine ankommende gesprochene Nachrii
verarbeitet werden soll, die einen Abschnitt des stummen Klarl·
S -*- stimmlosen Klangs UV ·*■ stimmhaften Klangs V enthält, wird
auch ein Muster mit verschwindendem Klang UV erzeugt. Wenn ei
BAD ORIGINAL
Abschnitt S ·*■ V enthalten ist, wird auch ein Muster mit
einem Abschnitt S ■*· UV -*■ V' erzeugt. Wenn die Nachricht
weder den Abschnitt S ·*■ UV ■*■ V noch den Abschnitt S -*■ V
enthält, wird das Muster beibehalten wie es ist. Im Anschluß daran wird geprüft, ob sich das Programm im Lernmodus befindet
oder nicht; die weitere Verarbeitung wird durch eine Reihe von Schritten gemäß Fig. 30 auf der linken Seite fortgesetzt,
wenn sich das Programm im Lernmodus befindet. Ist dies nicht der Fall, erfolgt der weitere Ablauf durch die
rechts angegebene Folge von Schritten. Für den Fall des Lernmodus werden die Längen oder die normierten Längen der Signale
V für stimmhafte Laute und UV für stimmlose Laute gemittelt. Die Signale werden dann codiert oder in entsprechende Symbole
umgesetzt, was mittels einer entsprechenden Aufteilung in eine passende Anzahl von Zeitabschnitten für jedes Signal V(i)
erfolgt, und die gleichen Zeitabschnitte, die zum gleichen Symbol gehören, werden zum Kernabschnitt gemacht, während von
den Kernabschnitten verschiedene Abschnitte zu Zweigen des Signals VM, der Signale VM und VO oder der Signale VM und VC
gemacht, wonach die Bezugsmuster erzeugt sind. Falls sich das Programm nicht im Lernmodus befindet, führt der Beginn
des Sprechens zur Erzeugung eines geeigneten Musters aus Signalen VO und VC, und das Muster wird dann so gebildet, daß es
der mit VO und VC endenden Sprache entspricht, während der Zwischenabschnitt in geeigneter Weise entsprechend VC ->· VO
und VO -*■ VC verarbeitet wird, wodurch die Bezugsmuster erstellt
worden sind; das zuletzt erstellte Bezugsmuster wird in den Bezugsmusterspeicher 7 geschrieben.
Mit Bezugnahme auf die Figuren 31 bis 33 erfolgt nun die
Erläuterung weiterer Einzelheiten der oben erwähnten Schritte der Erzeugung von Bezugsmustern mit Hilfe des Lernmodus. Das
in Fig. 31 dargestellte" Flußdiagramm kann sowohl für den gleichen Sprecher als auch für mehrere verschiedene Sprecher ange- QQf
wendet werden; die folgenden Erläuterungen gelten jedoch für
— 5 Λ —
den Fall, daß der gleiche Sprecher eine gesprochene Nachricht mehrmals (im vorliegenden Fall fünfmal) wiederholt.
Zu Beginn wird der Zeitbereich in zehn Abschnitte unterteilt, wie in Fig. 32A zu erkennen ist (jeder Abschnitt kann beispielsweise
eine Länge von 5 ms haben, doch kann er auch kürzer sein). Wenn die normierte Länge geteilt werden soll,
sollten die geteilten Bereiche abhängig von den gegebenen Wörtern in einer geeigneten Anzahl vorhanden sein. Nach der
Teilung werden die Zeitbereiche, in denen sich die Symbole (VO, VC, VM und dergleichen) nicht ändern, zum Kernbereich
gemacht. Bei den Mustern (a) bis (e) in Fig. 32A werden die Bereiche der Symbole VO zum Kernbereich gemacht. Nachdem auf
diese Weise der Kernbereich erhalten worden ist, werden die Zeitbereiche mit variierenden Symbolen zu einem VM-Bereich
gemacht (siehe Fig. 32A und Fig. 32B), wodurch nun ein Bezugsmuster A mit einem Kernbereich VO gebildet worden ist (Fig. 321
Wenn ein Muster vorliegt, das in den gleichen Zeitbereichen die Symbole VM oder VC enthält, wird eine Verzweigung des
Symbols VC für das Symbol VM im Bezugsmuster A gebildet (siehe Fig. 32A und Fig. 32C). Wenn entweder VO oder VC in den gleichen
Zeitbereichen vorhanden ist, werden die Zeitbereiche zu einem VM-Berei.ch gemacht, wodurch ein Bezugsmuster B erstellt
wird, in dem Verzweigungen zum Muster A hinzugefügt sind j (Fig. 32C). Mit dieser Erstellung der Bezugsmuster A und B ·
sind die Schritte zur Bildung der Bezugsmuster im Lernmodus ; beendet. Der Betriebsablauf schreitet dann zum Schreibschritt
gemäß Fig. 30 weiter, bei dem die Bezugsmuster A und B in den. Speicher 7 geschrieben werden. Bei der obigen Erstellung der ;
Bezugsmuster im Lernmodus ist es notwendig, den Verstärkungs-; faktor beispielsweise an der Eingangsseite des Differenzverstärkers
11-2 von Fig. 5 in einem ausgeglichenen Zustand zu i
halten. Zu diesem Zweck wird der Verstärkungsfaktor so eingestellt, daß sich bei einer Artikulation von /a/ das Klangsign;
VO und bei einer Artikulation von /i/ das Klangsignal VC ergibt. Wegen der vom Sprecher abhängigen vorhandenen phonetisc!
BAD ORIGINAL
Unterschiede ist es insbesondere für den Erkennungsvorgang
vorteilhaft, wenn die Schaltungsanordnung so ausgebildet wird, daß sie eine automatisch durchgeführte Verstärkungsabgleicheinstellung
aufweist, so daß das Ausgangssignal des
Differenzverstärkers bei einem natürlich artikulierten Vokal /e/ nur bei Ankunft eines (nicht dargestellten) Abgleicheinstellsignals
den Wert "0" hat. Mit dieser Abgleicheinstellung ist es möglich, nichtdeterminative Bezugsmuster zu erstellen,
ohne daß es notwendig ist, die gleiche gesprochene Nachricht wiederholt zu sprechen und sie zu lernen, wie in dem Flußdiagramm
von Fig. 33 angegeben ist. . ■ " ■
Fig. 33 zeigt Einzelheiten der Schritte zur Bezugsmustererstellung
für den Fall, daß kein Lernmodus vorliegt, wobei bei der Darstellung der Signale V für stimmhafte Laute und UV für
stimmlose Laute die V-Signale nacheinander verarbeitet werden. Wenn die jeweiligen V-Artikulationen mit einem VC-Klang beginnen,
wird ein VM-Zweig hinzugefügt. Wenn anstelle eines Beginns mit einem VC-Klang mit einem VO-Klang begonnen wird,
werden VC- und VM-Zweige parallel zwischen den Start und VO hinzugefügt, und ein VM-Zweig wird parallel zu VO hinzugefügt.
Wenn die V-Artikulationen anders als mit einem VC- oder :
VO-Klang beginnen, werden sie zu einem VM-Klang gemacht.
Wenn die V-Artikulationen mit einem VC-Klang enden, wird ein paralleler VM-Zweig zu VC hinzugefügt. Wenn sie mit einem
VO-Klang enden, werden sie so ausgebildet, daß sie mit VO -»■ VC enden, und zu VO und VC wird ein paralleler VM-Zweig
hinzugefügt. Wenn keine Endung mit dem Klang VC oder dem Klang VO vorliegt, werden die Artikulationen so ausgelegt, als endeten
sie mit dem Klang VM.
Wenn im Verlauf eines Lauts V ein Abschnitt VC ■*■ VO vorhanden
ist, wird parallel zu VC und zu VO ein VM-Zweig hinzugefügt. Bei Fehlen eines Abschnitts VC ·*■ VO, jedoch in Anwesenheit COPYs
-Jo-
eines Abschnitts VO ·> VC, wird zu VO und zu VC ein VM-Zweig
hinzugefügt. Wenn die Artikulationen weder mit einem Abschnitt VC ->■ VO noch mit einem Abschnitt VO ■>
VC enden, wer- " den sie so ausgelegt, als endeten sie mit dem Klang VM.
Damit sind die Schritte zur Bezugsmustererstellung für den ■--Fall
beendet, daß der Lernmodus nicht vorliegt. Der Betriebsablauf schaltet dann zu dem Bezugsmuster-Schreibschritt
weiter, der in Fig. 30 angegeben ist, bei dem die so gebildeten Bezugsmuster in den Speicher geschrieben werden.
Beim Lesen der obigen Bezugnahmen auf die Figuren 27A bis 27E und 30 bis 33 wird erkennbar, daß die Bezugsmuster so
erstellt werden können, daß gesprochene Nachrichtenmuster erfaßt werden, wie sie in Fig. 28 dargestellt sind. Bei der
Erfindung wird das Verarbeitungsprogramm so gebildet, wie beschrieben worden ist, so daß alle die aufeinanderfolgenden
Artikulationen gemäß Fig. 28 begleitenden Schwankungen in ausreichender Weise erfaßt werden. Aus Fig. 28 ist natürlich '--klar
erkennbar, daß die Signale V für stimmhafte Laute und UV für stimmlose Laute richtig verarbeitet werden, wenn sie :
Signale S für einen kurzen stummen Klang zwischen V- und UV-Signalen
oder VO- und VC-Signalen enthalten. Es kann eine . Tendenz dafür erkennbar sein, daß Signale VM für einen mitt-'
leren Klang zwischen V- und UV-Signalen oder zwischen VO- -.
und VC-Signalen eingefügt sind, doch werden auch solche Nachrichten richtig verarbeitet. Somit ist klar, daß gemäß der. ;
j Erfindung unerwünschte Einflüsse aufgrund von Schwankungen ;
des Phonemmusters der gesprochenen Nachricht in Begleitung l
von individuellen phonetischen Unterschieden, Betonungsverschiebungen unter verschiedenen Bedingungen und dergleichen i
in wirksamer Weise beseitigt werden können. Dies bedeutet in anderen Worten, daß gemäß der Erfindung die Abschnitte mit
geringeren Schwankungen im Phonemmuster der gesprochenen Nac rieht zum Kernabschnitt des zu erstellenden Bezugsmusters ge
BAD ORIGINAL
- 5*7 -
macht werden, während andere Abschnitte mit vielen Schwankun- ϊ
gen zum Restabschnitt gemacht werden. Das Erkennen oder das
Bezugsmustererstellen wird zunächst in bezug auf den Kernabschnitt und dann in bezug auf den Restabschnitt durchgeführt, , wobei ein nichtdeterminativer Charakter oder ein vorbestimmter .f Freiheitsgrad erhalten wird. Es ist somit möglich, die Kapazität des jeweiligen Computers und des Speichersystems und somit · = auch die erforderliche Verarbeitungszeit beträchtlich herab- J zusetzen. Nach der Erfindung wird das zutreffende Bezugsmuster \ sogar mit einer einzigen Eingabe der gesprochenen Nachricht | durch Verarbeitung im Computer erstellt, ohne daß ein Lern- . ; modus zugrundegelegt wird, so daß die Bezugsmuster also in
höchst wirksamer Weise erstellt werden können. -
Bezugsmustererstellen wird zunächst in bezug auf den Kernabschnitt und dann in bezug auf den Restabschnitt durchgeführt, , wobei ein nichtdeterminativer Charakter oder ein vorbestimmter .f Freiheitsgrad erhalten wird. Es ist somit möglich, die Kapazität des jeweiligen Computers und des Speichersystems und somit · = auch die erforderliche Verarbeitungszeit beträchtlich herab- J zusetzen. Nach der Erfindung wird das zutreffende Bezugsmuster \ sogar mit einer einzigen Eingabe der gesprochenen Nachricht | durch Verarbeitung im Computer erstellt, ohne daß ein Lern- . ; modus zugrundegelegt wird, so daß die Bezugsmuster also in
höchst wirksamer Weise erstellt werden können. -
COPY
Leerseite
ORIGINAL fNSPECTED
Claims (1)
1. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der ; ji gesprochenen Nachricht mit Bezugsmustern verglichen wird, ι ;?
• j: dadurch gekennzeichnet, ' ji
b) daß aus den Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten und aus den
Energieanteilen der dem zweiten Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte Laute
und Signale für stimmlose Laute erzeugt werden und
a) daß die gesprochene Nachricht in einem ersten Frequenzband analysiert wird, in dem sich die Energieanteile
stimmhafter Laute konzentrieren, und in einem zweiten Frequenzband analysiert wird, in dem sich die Energie- M
anteile stimmloser Laute konzentrieren,
Schw/Ma
c) daß die Signale für stimmhafte Laute und für stimmlose Laute jeweils mit den Bezugsmustern verglichen werden, '
damit eines der Bezugsmuster entnommen wird, das mit r den Signalen im wesentlichen übereinstimmt. -
2. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß die Signale für stimmlose und stimmhafte Laute Impulssignale
sind. -■
3. Verfahren nach Anspruch 2, dadurch gekennzeichnet, ■
d) daß die Längen der jeweiligen stimmhaften, stimmlosen . und stummen Lautperioden in den Signalen für stimmhafte
und stimmlose Laute gemessen werden und
e) daß die im Schritt (d) gemessenen Längen mit jeweiligen Bezugsmustern verglichen werden, damit eines der Bezugs
muster entnommen wird, bei dem die Längen im wesentlich mit den gemessenen Längen übereinstimmen. ί
4. Verfahren nach Anspruch 3, dadurch gekennzeichnet, · i
f) daß die stimmhaften, stimmlosen und stummen Lautperiode
der Signale, deren Längen sich im Schritt (d) kürzer al
ι ein vorbestimmter Wert erwiesen haben, durch Verarbeite
geformt werden. '·..
5. Verfahren nach Anspruch 4, dadurch gekennzeichnet, daß sti hafte und stimmlose Klänge mit der unterhalb des vorbestin
ten Werts liegenden Länge als stumme Klänge verarbeitet we
6. Verfahren nach Anspruch 5, dadurch gekennzeichnet, daß bed Vorliegen eines stimmhaften Lauts, der sich über einen sti
men Laut mit einer Länge, die kürzer als der vorbestimmte ist, zu einem stimmhaften Laut mit einer über dem vorbesti
BAD ORIG'MAL
—3-2 00
ten Wert liegenden Länge fortsetzt, dieser stumme Laut als ein stimmloser Laut verarbeitet wird.
7. Verfahren nach Anspruch 3, dadurch gekennzeichnet,
g) daß zur Vereinfachung des Schritts (e) die im Schritt (d)
gemessenen Längen normiert werden.
8. Verfahren nach Anspruch 1, dadurch gekennzeichnet,
•h) daß die Signale für stimmhafte und stimmlose Laute durch Zuordnung von +1 zum stimmhaften Laut, -1 zum stimmlosen
Laut und 0 zum stummen Laut codiert werden.
9. Verfahren nach Anspruch 7, dadurch gekennzeichnet,
i) daß die normierten Längen durch Zuordnung von +1 zu der
über einem vorbestimmten Wert liegenden Länge, -1 zu der unter einem weiteren vorbestimmten Wert liegenden Länge
und 0 zu einer zwischen den beiden vorbestimmten Werten liegenden Länge codiert werden.
0. Verfahren nach Anspruch 4, dadurch gekennzeichnet, daß ein stimmloser Laut, der sich zu einem stummen Laut mit einem
über dem vorbestimmten Wert liegenden Dauer fortsetzt, als ein stimmloser Sprenglaut verarbeitet wird, wenn seine Länge
kleiner als der vorbestimmte Wert ist, während er als stimmloser Reiblaut verarbeitet wird, wenn seine Länge über dem
vorbestimmten Wert liegt.
ten Wert liegenden Länge fortsetzt, dieser stumme Laut als ein stimmhafter Laut verarbeitet wird und daß sich bei
Vorliegen eines stimmlosen Lauts, der sich über den stummen Laut mit einer Länge, die kleiner als der vorbestimmte Wert
ist, zu einem stimmlosen Laut mit einer über dem vorbestimm- "1|
COPY
-A-
11. Verfahren nach Anspruch .1, dadurch gekennzeichnet,
j) daß die Amplitude der gesprochenen Nachricht vor dem Analysierungsschritt (a) komprimiert wird.
12. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß dei
Komprimierungsschritt nur durchgeführt wird, wenn die Amplitude über einem vorbestimmten Wert liegt, " .
13. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß de]
Komprimierungsschritt so durchgeführt wird, daß die über einem vorbestimmten Wert liegende Amplitude auf einen logarithmischen
Wert komprimiert wird.
14. Verfahren nach Anspruch 11, dadurch gekennzeichnet, daß de Komprimierungsschritt durchgeführt wird, damit eine kompri
mierte Amplitude zur Breite einer Funktion der gesprochene
Nachricht vor der Komprimierung gemacht wird.
15. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß das erste Frequenzband von 0 bis 1,0 kHz reicht und daß das zweite
Frequenzband von 2 bis 12 kHz reicht.
16. Verfahren zur Spracherkennung, bei dem eine gesprochene :
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt:
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver- '
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
dadurch gekennzeichnet,
a) daß die gesprochene Nachricht in einem ersten Frequenzband analysiert wird, indem sich die Energieanteile
stimmhafter Laute konzentrieren, in einem zweiten Frequenzband analysiert wird, indem sich die Energiean- ;
teile stimmloser Laute konzentrieren, in einem dritten
BAD ORIGINAL
Frequenzband analysiert wird, indem sich die Energieanteile
offener Klänge der stimmhaften Laute konzen- · trieren, und in einem vierten Frequenzband analysiert
wird, indem sich die Energieanteile geschlossener Klänge
der stimmhaften Laute konzentrieren,
b) daß aus den Energieanteilen stimmhafter Lautkomponenten, "
die dem ersten Frequenzband angehören, und aus den Energieanteilen stimmloser Lautkomponenten, die dem zweiten
Frequenzband angehören, Signale für stimmhafte Laute und für stimmlose Laute erzeugt werden,
c) daß aus den Energieanteilen von offenen Klangkomponenten, die dem dritten Frequenzband angehören, und aus den Energieanteilen
geschlossener Lautkomponenten, die dem vierten Frequenzband angehören, Signale für offene und für
geschlossene Klänge erzeugt werden und
d) daß die Signale für stimmhafte und stimmlose Laute sowie die Signale für offene und geschlossene Klänge mit Bezugsmustern
verglichen werden, damit eines der Bezugsmuster entnommen wird, das mit den jeweiligen Signalen '
im wesentlichen übereinstimmt. :
7. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß die |
Signale für offene und geschlossene Klänge nur mit dem Bezugs- sj
muster verglichen werden, das bei dem Vergleichsvorgang der j Signale für stimmhafte und stimmlose Laute entnommen worden ;!
ist.
8. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß die Signale für stimmhafte und stimmlose Laute sowie die Signale
für offene und geschlossene Klänge jeweils Impulssignale sind.
COPY
19. Verfahren nach Anspruch 18, dadurch gekennzeichnet,
e) daß die Längen der stimmhaften, stimmlosen und stummen "■
Lautperioden der Signale für stimmhafte und stimmlose
Laute sowie die Längen der offenen, geschlossenen und
stummen Klangperioden in den Signalen für offene und ''·'; geschlossene Klänge gemessen werden und
Laute sowie die Längen der offenen, geschlossenen und
stummen Klangperioden in den Signalen für offene und ''·'; geschlossene Klänge gemessen werden und
f) daß die Längen der stimmhaften, stimmlosen und stummen
Lautperioden sowie der offenen, geschlossenen und stumme
Lautperioden sowie der offenen, geschlossenen und stumme
Klangperioden mit den jeweiligen Bezugsmustern vergliche werden, damit eines der Bezugsmuster entnommen wird, bei
dem hinsichtlich der Längen im wesentlichen Übereinstimmung besteht.
20. Verfahren nach Anspruch 19, dadurch gekennzeichnet,
g) daß die stimmhaften, stimmlosen und stummen Lautperioden in den Signalen für stimmhafte und stimmlose Laute sowie
die offenen/ geschlossenen und stummen Klangperioden in den Signalen für offene und geschlossene Klänge zur For-r
mung verarbeitet werden, wenn ihre gemessenen Längen '
unter einem vorbestimmten Wert liegen. . ι
21. Verfahren nach Anspruch 20, dadurch gekennzeichnet, daß sti
hafte und stimmlose Laute sowie offene und geschlossene ί Klänge, deren Längen kleiner als ein vorbestimmter Wert sin
t als stumme Laute verarbeitet werden. !
22. Verfahren nach Anspruch 21, dadurch gekennzeichnet, daß ein
stummer Laut mit einer unter einem vorbestimmten Wert liege den Länge als ein stimmhafter Laut verarbeitet wird, wenn :
er zwischen einem stimmhaften Laut mit einer über dem vorbe stimmten Werte liegenden Länge und einem weiteren stimmhaft
Laut liegt, während er als stimmloser Laut verarbeitet wird
BAD ORIGINAL
•3
—y - — .-j
wenn er zwischen einem stimmlosen Laut mit einer über
dem vorbestimmten Wert liegenden Länge und einem weiteren stimmlosen Laut liegt, und daß ein stummer Laut als offener
Klang verarbeitet wird, wenn er zwischen einem offenen Klang mit einer über dem vorbestimmten Wert liegenden Länge
und einem weiteren offenen Klang liegt, jedoch als geschlossener Klang verarbeitet wird, wenn er zwischen einem
geschlossenen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren geschlossenen Klang
liegt.
23. Verfahren nach Anspruch 19, dadurch gekennzeichnet,
h) daß die gemessenen Längen zur Vereinfachung der Vergleichs
und Verarbeitungsschritte normiert werden.
24. Verfahren nach Anspruch 16, dadurch gekennzeichnet,
i) daß die Signale für stimmhafte und stimmlose Laute sowie
die Signale für offene und geschlossene Klänge codiert werden, indem in den Signalen für stimmhafte und stimmlose
Laute den stimmhaften Lauten +1,den stimmlosen Lauten -1 und den stummen Lauten- 0 zugeordnet wird,
während in den Signalen für offene und geschlossene Klänge den offenen Klängen +1, den geschlossenen Klängen
-1 und den stummen Lauten 0 zugeordnet wird.
25. Verfahren nach Anspruch 23, dadurch gekennzeichnt,
j) daß die normierten Längen codiert werden, indem +1 den Längen über einen vorbestimmten Wert, -1 den Längen
unter einem weiteren vorbestimmten Wert und 0- den Längen zwischen den beiden vorbestimmten Werten zugeordnet wird.
CX)PY
26. Verfahren nach Anspruch 20, dadurch gekennzeichnet, daß eine stimmlose Lautperiode, die sich als eine stumme Lautperiode
mit einer über einem vorbestimmten Wert liegenden Länge fortsetzt, als ein stimmloser Sprenglaut verarbeitet
wird, wenn die Länge der stimmlosen Lautperiode kleiner als der vorbestimmte Wert ist, jedoch als stimmloser Reib- '
laut verarbeitet wird, wenn die Länge über diesem vorbestimmten Wert liegt. -
27. Verfahren nach Anspruch 16, dadurch gekennzeichnet,
k) daß die Amplitude der gesprochenen Nachricht vor dem Analysierungsschritt (a) komprimiert wird.
28. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß der Komprimierungsschritt nur dann durchgeführt wird, wenn
die Amplitude der Nachricht über einem vorbestimmten Wert liegt.
29. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß der Komprimierungsschritt so durchgeführt wird, daß die ■ ;
Amplitude der Nachricht nur dann auf einen logarithmischen Wert kompryniert wird, wenn sie über einem vorbestimmten . >
Wert liegt. !
30. Verfahren nach Anspruch 27, dadurch gekennzeichnet, daß ■
der Komprimierungsschritt so durchgeführt wird, daß das - ; Ergebnis der Kompression die Breite einer Funktion der
gesprochenen Nachricht vor der Komprimierung ist. !
31. Verfahren nach Anspruch 16, dadurch gekennzeichnet, daß j das erste Frequenzband von 0 bis 1,0 kHz, das zweite [
Frequenzband von 2 bis 12 kHz, das dritte Frequenzband von 0 bis 0,5 kHz und das vierte Frequenzband von 0,5
bis 1,0 kHz reicht. :
COPY
ORIGINAL INSPECTED
32. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen -Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
dadurch gekennzeichnet,
a) daß durch Analyse die Nachricht in ein erstes Frequenzband von 0 bis 1 kHz aufgeteilt wird, indem sich die
Energieanteile stimmhafter Laute konzentrieren, in ein zweites Frequenzband von 2 bis 12 kHz aufgeteilt wird,
in dem sich die Energieanteile stimmloser Laute konzentrieren, in ein drittes Frequenzband von 0 bis 0,5 kHz
aufgeteilt wird, indem sich die Energieanteile offener
Klänge in den stimmhaften Lauten konzentrieren, und in ein viertes Frequenzband von 0,5 bis 1,0 kHz aufgeteilt
wird, indem sich die Energieanteile geschlossener Klänge in den stimmhaften Lauten konzentrieren,
b) daß aus den Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten.und aus den
Energieanteilen der"dem zweiten Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte und
stimmlose Laute gebildet werden,
c) daß die Längen der stimmhaften, stimmlosen und stummen Lautperioden in den Signalen der stimmhaften und stimmlosen
Klänge gemessen werden,
d) daß aus den Energieanteilen der dem dritten Frequenzband angehörigen offenen Klangkomponenten und aus den Energieanteilen
der dem vierten Frequenzband angehörigen geschlossenen Klangkomponenten Signale für offene und geschlossene
Klänge gebildet werden, _
e) daß die Längen der offenen, geschlossenen und stummen
Klangperioden in den Signalen für offene und geschlossene Klänge gemessen werden, .;
f) daß die stimmhaften und stimmlosen Laute sowie die offenen und geschlossenen Klänge mit einer unter einem vorbestimmten Wert liegenden Länge zur Formung als ein stummer
Laut verarbeitet werden, der Stumme Laut mit einer' unter dem vorbestimmten Wert liegenden Länge zwischen ' ;
dem stimmhaften Laut mit einer über dem vorbestimmten Wert liegenden Länge und einem weiteren stimmhaften Laui
zur Formung als stimmhafter Laut verarbeitet wird, der ■ stumme Laut mit einer unter dem vorbestimmten Wert liegei
den Länge zwischen den stimmlosen Klang mit einer über dem vorbestimmten Wert liegenden Länge und einem weitere:
stummen Laut zur Formung als stimmloser Laut verarbeitet wird, der stumme Laut mit einer unter dem vorbestimmten
Wert liegenden Länge zwischen einem offenen Klang mit einer über dem vorbestimmten Wert liegenden Länge und
einem weiteren offenen Klang zur Formung als offener Klang verarbeitet wird und der stumme Laut mit einer ^
unter dem vorbestimmten Wert liegenden Länge zwischen i dem geschlossenen Klang mit einer über dem vorbestimmter
Wert liegenden Länge und einem weiteren geschlossenen j
Klang als geschlossener Klang verarbeitet wird, \
g) daß zusammengesetzte Impulse mit stimmlosen und stummen
Lautperioden geformter Signale für stimmhafte und stimmlose Laute als stimmlose und stumme Lautperioden gebildi
werden, mit offenen und geschlossenen Klängen von Signalen für offene und geschlossene Klänge, die in Überein-
ί Stimmung mit stimmhaften Lautperiode geformter Signale ;
für stimmhafte und stimmlose Klänge vorhanden sind, als offene oder geschlossene Klänge gebildet werden und mit
■ stummen Lauten der geformten Signale für offeneund ge-.
BAD ORIGINAL
schlossene Klänge, die in Übereinstimmung mit den stimmhaften Lautperioden der geformten Signale für
stimmhafte und stimmlose Laute vorhanden sind, als mittlere Klänge gebildet werden,
h) daß jeweilige Gruppen der geformten Signale für stimmhafte und stimmlose Laute hierarchisch so klassifiziert
werden, daß sie in einer ersten Rangebene liegen, wobei die offenen, geschlossenen und mittleren Klänge, die
in den zusammengesetzten Impulsen aufeinanderfolgen,
in einer zweiten Rangebene liegen,
i) daß die Längen der ersten Rangebene normiert werden, !
j) daß die Längen jeweiliger Gruppen der zweiten Rangebene normiert werden,
k) daß die Signale auf der ersten Rangebene mit entsprechenden Bezugsmustern verglichen werden, damit diejenigen
Bezugsmuster entnommen werden, die im wesentlichen mit den Signalen übereinstimmen, und
1) daß die Signale auf der zweiten- Rangebene mit den entnommenen Bezugsmustern verglichen werden, damit eines
von ihnen entnommen wird, das im wesentlichen mit diesen Signalen übereinstimmt.
33. Verfahren nach Anspruch 32, dadurch gekennzeichnet,
m) daß festgestellt wird, ob das im Schritt (1) entnommene
optimale Bezugsmuster ausreichend verschieden vom nächstzutreffenden
entnommenen Bezugsmuster ist, damit bei einer ungenügenden Abweichung ein die Notwendigkeit einer
erneuten Eingabe der Nachricht anzeigendes Signal er-,. zeugt wird.
34. Verfahren nach Anspruch 32, dadurch gekennzeichnet, daß die mittleren Klänge'jeweiliger Signalgruppen in der
zweiten Rangebene mit jedem der offenen und geschlossenen Klänge in den Bezugsmustern verglichen werden, daß die
offenen und geschlossenen Klänge in jeweiligen Gruppen der zweiten Rangebene als mittlere Klänge mit den durch
den Vergleich entnommenen Bezugsmustern verglichen werden, daß ein Bezugsmuster entnommen wird, dessen offene Klänge
die gleiche Rate wie die offenen Klänge in den jeweiligen Gruppen auf der zweiten Rangebene haben, daß ein Bezugsmuster entnommen wird, daß die gleichen Hauptkomponenten
wie die jeweiligen Gruppen auf der zweiten Rangebene hat, daß ein Bezugsmuster entnommen wird, das bei einer Auswertung
an den Punkten +1,0 und -1 mit Eingangsmustern jedes Abtastwerts in den jeweiligen Signalgruppen auf der
zweiten Rangebene am besten übereinstimmt, und daß schließlich in ausgewählter Weise ein gemeinsames Bezugsmuster
der bei diesen vier Schritten erhaltenen Bezugsmuster entnommen wird. j
35. Verfahren nach Anspruch 32, dadurch gekennzeichnet, daß ;
der Vergleichsschritt (k) dadurch ausgeführt wird, daß bei '■ Anwesenheit eines stummen Klangs mit kurzer Länge ein [
stimmloser Klang mit kurzer Länge hinzuaddiert wird. ·
36. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt _ ι
wird, die in den jeweiligen Frequenzbändern enthaltenen , Energieanteile gemessen werden und eine Frequenzbandver- ί
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, j
dadurch gekennzeichnet, Γ
a) daß die gesprochene Nachricht durch Analyse in ein von 0 bis 1 kHz reichendes Frequenzband, in dem sich ;
copy
'—r — ~
- 13 -
die Energieanteile stimmhafter Laute konzentrieren, sowie in ein von 2 bis 12 kHz reichendes zweites
Frequenzband, in dem sich die Energieanteile stimmloser Laute konzentrieren, aufgeteilt wird,
b) daß abhängig von Unterschieden zwischen jeweiligen
Energieanteilen der dem ersten Frequenzband angehörigen stimmhaften Lautkomponenten und der dem zweiten
Frequenzband angehörigen stimmlosen Lautkomponenten Signale für stimmhafte und für stimmlose Laute gebildet
werden,
c) daß die Signale für stimmhafte und für .stimmlose Laute
zur Erzeugung von Signalen V für stimmhafte Laute, Signalen UVp für stimmlose Laute und Signalen Sp für
stumme Laute geformt werden,
d) daß die Längen des durch das Signal Vp repräsentierten
stimmhaften Lauts, des durch das Signal UV repräsentierten stimmlosen Lauts sowie des durch die Signale Sp
repräsentierten stummen Lauts gemessen werden,
e) daß die jeweiligen Signale codiert werden, damit aus den Signalen UV für stimmlose Laute, aus den Signalen
Sp für stumme Laute und den gemessenen Werten der Längen
Signale PL für stimmlose Sprenglaute für stimmlose Lautperioden mit einer unter einem vorbestimmten Wert liegenden
Länge, die sich zu einer stimmhaften Lautperiode mit einer über dem vorbestimmten Wert liegenden Dauer
fortsetzt, und Signale F für stimmlose Reiblaute für diejenigen Perioden mit einer über dem vorbestimmten f
Wert liegenden Länge gebildet werden, und damit weitere Ί-
bildet werden, und
Signale V für stimmhafte Laute aus den Signalen V ge-
si
COPY
» ■
- 14 -
f) daß die abhängig von ihrem Inhalt codierten Signale mit den Bezugsmustern verglichen werden, damit eines
der Bezugsmuster entnommen wird, das im wesentlichen mit diesen Inhalten übereinstimmt.
37. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß der Codierschritt (e) so ausgeführt wird, daß ein binäres
Signal DF entsteht, das den Signalen V, PL und F entspricht, das ein Signal V für stimmhafte Laute, ein Signal F für
stimmlose Reiblaute und ein Signal PL für stimmlose Sprenglaute als eine Gruppe enthält, und zwar in der Form
(0, 0, 0) - (0, 0), (1, 0, 0) -v (0, 1), (0, 1, 0) ■*■ (1, 1)
und (0, 0, 1) ■*■ (1 , 0) .
38. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß bei dem Vergleichsschritt (f) auch die gemessenen Werte
der Längen verglichen werden.
39. Verfahren nach Anspruch 36, dadurch gekennzeichnet, daß bei dem Formungsschritt (c) die Signale Vp für stimmhafte
Laute nur erzeugt werden, wenn die Signale für stimmhafte : und für stimmlose Laute kleiner als ein vorbestimmter Wert
sind, die Signale UVp für stimmlose Laute nur erzeugt werden, wenn sie über einem weiteren vorbestimmten Wert
liegen, und die Signale Sp für stumme Laute nur erzeugt
werden, wenn sie zwischen den beiden vorbestimmten Werten liegen.
40. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver- ■
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
dadurch gekennzeichnet, daß die Bezugsmuster dadurch er-
COPY
stellt werden, daß folgende Schritte ausgeführt werden:
a) daß die gesprochene Nachricht als eine Folge von mehreren Eingaben erhalten wird, indem die Nachricht
mehrmals wiederholt gesprochen wird, .<;
b) daß ein Kernabschnitt der jeweiligen Bezugsmuster mit _.
gegenseitig identischen und gleichzeitigen Impulsen jeweiliger Eingaben der Nachricht gebildet wird und
c) daß die gleichzeitigen, jedoch gegenseitig nicht iden- ;
tischen Impulse als ein mittlerer Klang VM dargestellt werden.
41. Verfahren nach Anspruch 40, dadurch gekennzeichnet, daß bei der Erstellung der Bezugsmuster folgende weitere
Schritte durchgeführt werden, die darin bestehen,
d) daß ein erster Zweig geschlossener Klänge VC bezüglich des mittleren Klangs VM gebildet wird, wenn eine der Eingaben
der gesprochenen Nachricht den mittleren Klang VM enthält, der als geschlossener Klang VC dargestellt
wird,
e) daß ein zweiter Zweig des offenen Klangs bezüglich
des mittleren Klangs VM gebildet wird, wenn eine der Eingaben der gesprochenen Nachricht den mittleren Klang
VM enthält, der als der offene Klang VO dargestellt wird, und
f) daß ein dritter Zweig zur Beibehaltung des mittleren Klangs VM gebildet wird, wenn die Eingaben der gesprochenen
Nachricht die eine Eingabe enthalten, in der der mittlere Klang VM zum geschlossenen Klang VC wird, und
die eine Eingabe enthalten, in der der mittlere Klang
VM zum offenen Klang VO wird.
COPY
42. Verfahren zur Spracherkennung, bei dem eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zur Erkennung des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
dadurch gekennzeichnet,
a) daß ein Zweig eines mittleren Klangs VM hinzugefügt wird, wenn stimmhafte Laute der Nachricht entweder mit
einem geschlossenen Klang VC oder einem offenen Klang VO beginnt, wobei die stimmhaften Anfangslaute, die
anders als die Klänge VC und VO sind, zum mittleren Klang VM gemacht werden,
b) daß zum geschlossenen Klang VC ein Zweig des mittleren Klangs VM hinzugefügt wird, wenn stimmhafte Laute mit
einem geschlossenen Klang VC und einem offenen Klang VO enden, wobei im zuletzt genannten Fall der geschlossene
Klang VC neben dem offenen Klang VO und ein Zweig eines offenen Klangs VO zu VO - VC und VO hinzugefügt werden,
wobei der stimmhafte Endlaut, der kein geschlossener Klang oder offener Klang ist, zum mittleren Klang VM
gemacht wird, und ' \
c) daß zum offenen Klang VO und zum geschlossenen Klang VC ein Zweig eines mittleren Klangs VM hinzugefügt wird,
wenn der offene Klang VO und der geschlossene Klang VC ; nacheinander in den jeweiligen stimmhaften Lauten der
Nachricht vorhanden sind, wobei der mittlere Klang in . Abwesenheit der aufeinanderfolgenden offenen und geschlossenen
Klänge VO bzw- VC eingefügt wird.
BAD ORIGINAL
■*3 200 63RT
- 17 -
43- Verfahren nach Anspruch 42, dadurch gekennzeichnet,
d). daß ein Zweig zum Kurzschließen des -stummen Lauts S
und des stimmhaften Lauts V hinzugefügt wird, wenn ein Abschnitt mit einem aufeinanderfolgenden stummen Laut S,
einem stimmlosen Laut UV und einem stimmhaften Laut V vorhanden ist, während ein Zweig eines stimmlosen Lauts
UV zwischen einem stummen Laut S und einem stimmhaften Laut V hinzugefügt wird, wenn ein Abschnitt mit einem
aufeinanderfolgenden stummen Laut S und stimmhaften Laut V vorhanden ist.
44y Vorrichtung zur Spracherkennung, bei der eine gesprochene
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen
Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der
gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
a) eine erste Filterbank (9) zum Auswählen stimmhafter Lautkomponenten, die einem ersten Frequenzband angehören,
in dem die EnergieanteiLe stimmhafter Laute der gesprochenen Nachricht konzentriert sind,
b) eine zweite Filterbank (10) "zum Auswählen stimmloser Lautkomponenten, die einem zweiten Frequenzband angehören,
in dem Energieanteile stimmloser Laute der gesprochenen Nachricht konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen
für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen
der zweiten Filterbank (10),
d) einen A/D-Umsetzer (13) zur Digitalisierung der Ausgangssignale
des Differenzverstärkers (11), wobei diese Ausgangssignale
die Signale für stimmhafte und stimmlose ,' Laute sind,
e) ein erstes Speichersystem (15) zum Speichern der digital: sierten Signale für stimmhafte und stimmlose Laute, I
e1) ein zweites Speichersystem (7) zum Speichern von Bezugsmustern und
f) einen Computer (4), der die Abspeicherung der digitalisierten Signale für stimmhafte und stimmlose Laute in dei
ersten Speichersystem (15) bewirkt und die Signale mit dt nen in dem zweiten Speichersystem (7) vergleicht.
45. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen , Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird, .
gekennzeichnet durch . *
• ■ f
a) eine erste Filterbank (9-1), in der aus der gesprochenen Nachricht offene Klangkomponenten ausgewählt werden, die
einem ersten Frequenzband angehören, in dem die Energieanteile offener Klänge in stimmhaften Lauten konzentrier
'sind, I
b) eine zweite Filterbank (9-2), in der aus der gesprochene Nachricht geschlossene Klangkomponenten ausgewählt werde
die einem zweiten Frequenzband angehören, in dem Energie anteile geschlossener Klänge in den stimmhaften Lauten
konzentriert sind,
BAD ORIGINAL
rrr ^2Q
c) einen ersten Differenzverstärker (11-2), in dem Signale jj
für offene und geschlossene Klänge durch Subtrahieren 1
der Ausgangssignale der ersten Filterbank (9-1) von \ Ausgangssignalen der zweiten Filterbank (9-2) gebildet A
werden, : η
d) eine Additionsschaltung (11-1)/ in der die Ausgangssignale
der ersten und der zweiten Filterbank miteinander addiert I werden, Γ
der ersten und der zweiten Filterbank miteinander addiert I werden, Γ
e) eine dritte Filterbank (10), in der aus der gesprochenen
Nachricht stimmlose Lautkomponenten ausgewählt werden,
die einem dritten Frequenzband angehören, in dem die
Energieanteile stimmloser Laute konzentriert sind,
Nachricht stimmlose Lautkomponenten ausgewählt werden,
die einem dritten Frequenzband angehören, in dem die
Energieanteile stimmloser Laute konzentriert sind,
f) einen zweiten Differenzverstärker (11), in dem Signale
für stimmhafte und stimmlose Laute durch Subtrahieren " der Ausgangssignale der Additionsschaltung (11-1) von '
Ausgangssignalen der dritten Filterbank (10) erzeugt
werden, : ■:
werden, : ■:
g) einen A/D-Umsetzer (13), in dem die Signale für offene · ί
und geschlossene Klänge und die Signale für stimmhafte :
und stimmlose Laute aus den beiden Differenzverstärkern :
(11-2, 11) digitalisiert werden,
h) ein erstes Speichersystem (15), in dem die digitalisier- !
ten Signale für offene und geschlossene Klänge sowie
für stimmhafte und stimmlose Laute gespeichert werden,
für stimmhafte und stimmlose Laute gespeichert werden,
i) ein zweites Speichersystem (7), in dem Bezugsmuster ge- I speichert werden, und
j) einen Computer (4), der die Abspeicherung der digitali- j sierten Signale für offene und geschlossene Klänge und
für stimmhafte und stimmlose Laute im ersten Speicher-
system (15) bewirkt und der diese Signale mit den im zweiten Speichersystem (7) abgespeicherten Bezugsmustern vergleicht.
46. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird/ die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandver-_
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
a) eine erste Filterbank (9), in der aus der gesprochenen
Nachricht stimmhafte Lautkomponenten ausgewählt werden, die einem ersten Frequenzband angehören, in dem die
Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen
Nachricht stimmlose Lautkomponenten ausgewählt werden, ', die einem zweiten Frequenzband angehören, in dem die
Energieanteile stimmloser Laute konzentriert sind, .
c) eine dritte Filterbank (32), in der aus der gesprochenen
es . *
Nachrictit offene Klangkomponenten ausgewählt werden, die
einem dritten Frequenzband angehören, in dem die Energie;· anteile offener Klänge in den stimmhaften Lauten konzentriert
sind,
d) eine vierte Filterbank (33), in der aus der gesprochenen Nachricht geschlossene Klangkomponenten ausgewählt werden
die einem vierten Frequenzband angehören, in dem die s Energieanteile geschlossener Klänge in den stimmhaften >
Lauten konzentriert sind, :
BAD ORIGINAL
e) einen ersten Differenzverstärker (11), in dem Signale
für stimmhafte und stimmlose Laute durch Subtrahieren
der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen der zweiten Filterbank (10) erzeugt werden,
f) einen zweiten Differenzverstärker (34) , in dem Signale
für offene und für geschlossene Klänge durch Subtrahieren der Ausgangssignale der dritten Filterbank (32) von Ausgangssignalen
der vierten Filterbank (33) erzeugt werden,
g) einen A/D-Umsetzer, in dem die Signale für stimmhafte und stimmlose Laute und die Signale für offene und geschlossene
Klänge aus den beiden Differenzverstärkern (11, 34) digitalisiert werden,
h) ein erstes Speichersystem (15), in dem die digitalisierten Signale für stimmhafte und stimmlose Laute sowie für
offene und geschlossene Klänge gespeichert werden,
i) ein zweites Speichersystem (7), in dem Bezugsmuster gespeichert
werden, und
j) einen Computer (4) , der die Abspeicherung der digitalisierten Signale für stimmhafte und stimmlose Laute sowie
für offene und geschlossene Klänge in den beiden Speichersystemen (15, 7) bewirkt und diese Signale mit den
Bezugsmustern vergleicht.
17. Vorrichtung zur Spracherkennung, bei der eine gesprochene
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt wird, die in den jeweiligen Frequenzbändern enthaltenen
Energieanteile gemessen werden und eine Frequenzbandverteilung dieser Energiewerte zum Erkennen des Inhalts der
gesprochenen Nachricht mit Bezugsmustern verglichen wird, gekennzeichnet durch
BAD ORIGINAL
a) eine erste Filterbank (9), in der aus der gesprochenen
Nachricht Energiekomponenten ausgewählt werden, die in
einem ersten Frequenzband verteilt sind, in dem die
Energieanteile stimmhafter Laute .konzentriert sind,
Nachricht Energiekomponenten ausgewählt werden, die in
einem ersten Frequenzband verteilt sind, in dem die
Energieanteile stimmhafter Laute .konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen
Nachricht Energieanteile ausgewählt werden, die in einem zweiten Frequenzband verteilt sind, in dem die Energieanteile
stimmloser Laute konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen
für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen
der zweiten Filterbank (10) ,
d) einen Impulscodierer (13) zum Codieren der Signale für
stimmhafte und stimmlose Laute aus dem Differenzverstärker (11) ,
stimmhafte und stimmlose Laute aus dem Differenzverstärker (11) ,
e) ein erstes Speichersystem (15) zum Speichern der codierten Signale für stimmlose und stimmhafte Laute, . -
e') ein zweites Speichersystem (7) zum Speichern der Bezugs-s
muster und „ - !
f) einen Computer (4), der die Abspeicherung der codierten
Signale für stimmhafte und stimmlose Laute im ersten
Speichersystem (15) bewirkt und diese Signale mit den f im zweiten Speichersystem (7) gespeicherten Bezugs- ' mustern vergleicht.
Speichersystem (15) bewirkt und diese Signale mit den f im zweiten Speichersystem (7) gespeicherten Bezugs- ' mustern vergleicht.
48. Vorrichtung zur Spracherkennung, bei der eine gesprochene Γ
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen
Energieanteile gemessen werden und eine Frequenzbandver- .
wird, die in den jeweiligen Frequenzbändern enthaltenen
Energieanteile gemessen werden und eine Frequenzbandver- .
BAD ORIGINAL
teilung dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch - ·.
a) eine erste Filterbank (9-1), in der aus der gesprochenen Nachricht offene Klangkomponenten ausgewählt werden, die
einem ersten Frequenzband angehören, in dem die Energieanteile offener Klänge in stimmhaften Lauten konzentriert
sind,
b) eine zweite Filterbank (9-2), in der aus der gesprochenen Nachricht geschlossene Klangkomponenten ausgewählt werden,
die einem zweiten Frequenzband angehören, in dem Energieanteile geschlossener Klänge in den stimmhaften Lauten
konzentriert sind,
c) einen ersten Differenzverstärker (11-2), in dem Signale
für offene und geschlossene Klänge durch Subtrahieren der Ausgangssignale der ersten Filterbank (9-1) von
Ausgangssignalen der zweiten Filterbank (9-2) gebildet werden,
d) eine Additionsschaltung (11-1), in der die Ausgangssignale der ersten und der zweiten Filterbank miteinander addiert
werden,
e) eine dritte Filterbank (10), in der aus der gesprochenen Nachricht stimmlose Lautkomponenten ausgewählt werden,
die einem dritten Frequenzband angehören, in dem die Energieanteile stimmloser Laute konzentriert sind,
f) einen zweiten Differenzverstärker (11), in dam Signale
für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der Additionsschaltung (11-1) von Ausgangssignalen
der dritten Filterbank (10) erzeugt werden,
- COPY
g) einen Impulscodierer (13-1), in dem die Signale für
offene und geschlossene Klänge und die Signale für stimmhafte und stimmlose Laute aus den beiden Differenzverstärkern (11-2, 11) codiert werden,
h) ein erstes Speichersystem (15), in dem die codierten Signale für offene und geschlossene Klänge sowie für
stimmhafte und stimmlose Laute gespeichert werden, -.. .
i) ein zweites Speichersystem (7), in dem die Bezugsmuster
gespeichert werden, und
j) einen Computer (4), der die Abspeicherung der codierten Signale für offene und geschlossene Klänge sowie für stimmhafte
und stimmlose Laute im ersten Speichersystem (15) bewirkt und diese Signale mit den Bezugsmustern im zweite:
Speichersystem (7) vergleicht.
49. Vorrichtung zur Spracherkennung, bei der eine gesprochene | Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen ; Energieanteile gemessen werden und eine Frequenzbandverteilung
diener Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
a) eine erste Filterbank, in der aus der gesprochenen Nachricht stimmhafte Lautkomponenten ausgewählt werden,
die einem ersten Frequenzband angehören, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank, in der aus der gesprochenen Nachricht stimmlose Lautkomponenten ausgewählt werden,
die einem zweiten Frequenzband angehören, in dem die Energieanteile stimmloser Laute konzentriert sind,
BAD ORIGINAL
c) eine dritte Filterbank, in der aus der gesprochenen \
Nachricht offene Klangkomponenten ausgewählt werden,, die |
einem dritten Frequenzband angehören, in dem die Energie- --anteile
offener Klänge in den stimmhaften Lauten konzen- j triert sind, - f
d) eine vierte Filterbank, in der aus der gesprochenen -■
Nachricht geschlossene Klangkomponenten ausgewählt werden, j die einem vierten Frequenzband angehören, in dem die ι Energieanteile geschlossener Klänge in den stimmhaften · f
Nachricht geschlossene Klangkomponenten ausgewählt werden, j die einem vierten Frequenzband angehören, in dem die ι Energieanteile geschlossener Klänge in den stimmhaften · f
Lauten konzentriert sind, ;
e) einen ersten Differenzverstärker, in dem Signale
für stimmhafte und stimmlose Laute durch Subtrahieren
der Ausgangssignale der ersten Filterbank von Ausgangssignalen der zweiten Filterbank erzeugt werden,
der Ausgangssignale der ersten Filterbank von Ausgangssignalen der zweiten Filterbank erzeugt werden,
f) einen zweiten Differenzverstärker, in dem Signale . :
für offene und für geschlossene Klänge durch Subtrahieren
der Ausgangssignale der dritten Filterbank von Aus- Γ gangssignalen der vierten Filterbank erzeugt werden,
der Ausgangssignale der dritten Filterbank von Aus- Γ gangssignalen der vierten Filterbank erzeugt werden,
- j.
β . . f
g) einen Impulscodierer, in dem die Signale für stimmhafte :-'
und stimmlose Laute und die Signale für offene und ge- j
schlossene Klänge aus den beiden Differenzverstärkern -.
codiert werden, \
h) ein erstes Speichersystem, in dem die codierten Signale ':
für offene und geschlossene Klänge sowie für stimmhafte
und stimmlose Laute gespeichert werden, i
und stimmlose Laute gespeichert werden, i
i) ein zweites Speichersystem, in dem die Bezugsmuster gespeichert
werden, und
COPY
- 26 - ; ■
j) einen Computer, der die Abspeicherung der codierten Signale für stimmhafte und stimmlose Laute und für
offene und für geschlossene Klänge im ersten Speichersystem bzw. im zweiten Speichersystem bewirkt und diese
Signale mit bem Bezugsmuster vergleicht.
50. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt .'
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
a) eine erste Filterbank (9), in der aus der gesprochenen Nachricht Energie anteile ausgewählt werden, die in
einem ersten Frequenzband verteilt sind, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht Energieanteile ausgewählt werden, die in einem
zweiten Frequenzband verteilt sind, in dem die Energieanteile stimmloser Laute konzentriert sind,
c) einen Differenzverstärker (11) zur Erzeugung von Signalen
für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangs- j
Signalen der zweiten Filterbank (10),
d) eine Mittelungsschaltung (12) zum Mitteln der Ausgangssignale des Differenzverstärkers (11), '
e) eine erste Diskriminatorschaltung (18) zur Erzeugung eine
Signals mit ,hohem Wert, wenn die Ausgangssignale der Mitt lungsschaltung (12) kleiner als ein vorbestimmter Wert si
BAD ORIGINAL
f) eine zweite Diskriminatorschaltung (19) zur Erzeugung ' _%
eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) größer-als ein weiterer
vorbestimmter Wert sind, ,-
■ ~-rf
g) eine Formungsschaltung (21) zur Erzeugung von Signalen
V für stimmhafte Laute, UVp für stimmlose Laute und . ;f
S für stumme Laute aus den Ausgangssignalen der beiden Diskriminatorschaltungen (18, 19),
h) einen ersten Zähler. (24) zum Zählen der Längen der durch die Signale V repräsentierten stimmhaften Laute und zum
Zählen der Längen der durch die Signale UVp repräsentierten
stimmlosen Laute,
i) einen zweiten Zähler (22) zum Zählen der Längen der durch die Signale S repräsentierten stummen Laute,
j) eine Vergleichsschaltung (27) zum Vergleichen des gezählten Werts des ersten Zählers (24) mit einem vorbestimmten
Wert und zum Erzeugen eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten
Wert überschreitet, ' ·.
k) eine.Codierschaltung (29), die aus einer Gruppe von
Signalen V, PL und F eine Gruppe codierter Signale DF1
und DF , nämlich ein logisches Summensignal DF^ aus dem
zweiten Signal PL und dem dritten Signal F und ein logisches Summensignal DF1 aus dem ersten Signal V und dem
dritten Signal F erzeugt, wobei die Gruppe der Signale V, PL und F ein erstes Signal V enthält, das nur dann einen
hohen Wert hat, wenn das Signal V für stimmhafte Laute einen hohen Wert.hat und wenn Ausgangssignale der Vergleichsschaltung
(27) einen hohen Wert haben, ein zweites i Signal PL enthält, das nur dann einen hohen Wert hat, wenn
- BAD ORIGINAL
diejenigen Ausgangssignale der Vergleichsschaltung (27)
einen niedrigen Wert haben, die den Signalen UV der
stimmlosen Laute entsprechen, die nacheinander in einer
stummen Lautperiode auftreten, deren zum zweiten Zähler
(22) gezählter Wert einen vorbestimmten Wert überschreitet, und ein drittes Signal F enthält, das nur dann einen hohen Wert hat, wenn diejenigen Ausgangssignale der
Vergleichsschaltung (27) einen hohen Wert haben, die den, Signalen UVp für stimmlose Laute entsprechen, die nacheinander in der stummen Lautperiode auftreten, deren
vom zweiten Zähler (22) gezählter Wert den vorbestimmten Wert überschreitet,
einen niedrigen Wert haben, die den Signalen UV der
stimmlosen Laute entsprechen, die nacheinander in einer
stummen Lautperiode auftreten, deren zum zweiten Zähler
(22) gezählter Wert einen vorbestimmten Wert überschreitet, und ein drittes Signal F enthält, das nur dann einen hohen Wert hat, wenn diejenigen Ausgangssignale der
Vergleichsschaltung (27) einen hohen Wert haben, die den, Signalen UVp für stimmlose Laute entsprechen, die nacheinander in der stummen Lautperiode auftreten, deren
vom zweiten Zähler (22) gezählter Wert den vorbestimmten Wert überschreitet,
1) ein erstes Speichersystem (15) zum Speichern der codier- , ten Signale DF und DF ,
m) ein zweites Speichersystem zum Speichern der Zählinhalte
der beiden Speicher (24, 22), die den codierten Signalen DF1 und DF entsprechen, j
η) ein drittes Speichersystem (7) zum Speichern der Bezugs- ;
muster und
o) einen Computer (4), der die. Abspeicherung der codierten \
Signale DF1 und DF und der Zählinhalte der beiden Zähler
(24, 22) im ersten bzw. im zweiten Speichersystem bewirkt und die Signale mit den im dritten Speichersystem gespeicherten
Bezugsmustern vergleicht. ·■
51. Vorrichtung zur Spracherkennung, bei der eine gesprochene
Nachricht durch Analyse in mehrere Frequenzbänder zerlegt \
wird, die in den jeweiligen Frequenzbändern enthaltenen ί Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der
gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch
BAD ORIGINAL
a) eine erste Filterbank (9), in der aus der gesprochenen Nachricht Energiekomponenten ausgewählt werden, die in
einem ersten Frequenzband verteilt sind, in dem die Energieanteile stimmhafter Laute konzentriert sind,
b) eine zweite Filterbank (10), in der aus der gesprochenen Nachricht Energieanteile ausgewählt werden, die in einem
zweiten Frequenzband verteilt sind, in dem die Energieanteile stimmloser Laute konzentriert sind,
c) einen ersten Differenzverstärker (11) zur Erzeugung von Signalen
für stimmhafte und stimmlose Laute durch Subtrahieren der Ausgangssignale der ersten Filterbank (9) von Ausgangssignalen
der zweiten Filterbank (10),
d) eine erste Mittelungsschaltung (12) zum Mitteln der Ausgangssignale des ersten Differenzverstärkers (11),
e) eine erste Diskriminatorschaltung (18) zur Erzeugung
eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) kleiner als ein vorbestimmter
Wert sind,
f) eine zweite Diskriminatorschaltung (19) zur Erzeugung
eines Signals mit hohem Wert, wenn die Ausgangssignale der Mittelungsschaltung (12) größer als ein weiterer
vorbestimmter Wert sind,
g) eine erste Formungsschaltung (21) zur Erzeugung von Signalen V für stimmhafte Laute, UV für stimmlose Laute
und S für stumme Laute aus den Ausgangssignalen der beiden Diskriminatorschaltungen (18, 19),
h) einen ersten Zähler (24) zum Zählen der Längen der durchdie Signale V repräsentierten stimmhaften Laute und zum
Zählen der Längen der durch die Signale UVp repräsentierten
stimmlosen Laute,
i) einen zweiten Zähler (22) zum Zählen der Längen der durch die Signale S repräsentierten stummen Laute,
j) eine erste Vergleichsschaltung (27) zum Vergleichen des gezählten Werts des ersten Zählers (24) mit einem vorbestimmten
Wert und zum Erzeugen eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten Wert
überschreitet,
k) eine erste Codierschaltung (29), die aus einer Gruppe von Signalen V, PL und F eine Gruppe codierter Signale DF
und DFn, nämlich ein logisches Summensignal DF» aus dem
zweiten Signal PL und dem dritten Signal F und ein logisches Summensignal DF1 aus dem ersten Signal V und dem
dritten Signal F erzeugt, wobei die Gruppe der Signale V, PL und F ein erstes Signal V enthält, das nur dann einen "
hohen Wert hat, wenn das Signal V für stimmhafte Laute einen hohen Wert hat und wenn Ausgangssignale der Vergleichsschaltung
(27) einen hohen Wert haben, ein zweites Signal PL enthält, das nur dann einen hohen Wert hat, wem
diejenigen Ausgängssignale der Vergleichsschaltung (27) j
einen niedrigen Wert haben, die den Signalen UV der ?
stimmlosen Laute entsprechen, die nacheinander in einer ; stummen Lautperiode auftreten, deren im zweiten Zähler '
(22) gezählter Wert einen vorbestimmten Wert überschrei-J tet, und ein drittes Signal F enthält, das nur dann einen
hohen Wert hat, wenn diejenigen Ausgangssignale der Vergleichsschaltung (27) einen hohen Wert haben, die den,
Signalen UV für stimmlose Laute, entsprechen, die nach- jeinander
in der stummen Lautperiode auftreten, deren vom zweiten Zähler (22) gezählter Wert den vorbestimmten
Wert überschreitet, ";
BAD ORIGINAL
1) eine dritte Filterbank (32), die aus der gesprochenen
Nachricht Energieanteile aus einem dritten Frequenzband auswählt, in dem die Energieanteile offener Klänge konzentriert
sind, ·
m) eine vierte Filterbank (33), die aus der gesprochenen Nachricht Energieanteile aus einem vierten Frequenzband -.
auswählt, in dem die Energieanteile geschlossener Klänge konzentriert sind,
n) einen zweiten Differenzverstärker (34) zur Erzeugung
von Signalen für offene und geschlossene Klänge durch Subtrahieren der Ausgangssignale der dritten Filterbank
(32) von Ausgangssignalen der vierten Filterbank (33),
o) eine zweite Mittelungsschaltung (35) zum Mitteln der Ausgangssignale des zweiten Differenzverstärkers (34),
p) eine dritte Diskriminatorschaltung (36), die nur dann ein Ausgangssignal mit hohem Wert abgibt, wenn Ausgangssignale
der zweiten Mittelungsschaltung (35) kleiner als ein vorbestimmter Wert sind, t f
q) eine vierte Diskriminatorschaltung (37), die nur dann ein Ausgangssignal mit hohem Wert abgibt, wenn Ausgangssignale
der zweiten Mittelungsschaltung (35) größer als ein weiterer vorbestimmter Wert sind,
r) eine zweite Formungsschaltung (38) zur Erzeugung von
Signalen VO für offene Klänge und von Signalen VC für
geschlossene Klänge aus Ausgangssignalen der dritten Diskriminatorschaltung (36) und der vierten Diskriminator
schaltung (37),
■ copy
s) einen dritten Zähler (39) zum Zählen der Längen der
durch die Signale VO repräsentierten offenen Klänge sowie der Längen der durch die Signale VCp repräsentierten
geschlossenen Klänge,
t) eine zweite Vergleichsschaltung (41) zum Vergleichen der gezählten Werte des dritten Zählers (39) mit einem
vorbestimmten Wert und zur Abgabe eines Ausgangssignals mit hohem Wert, wenn der gezählte Wert den vorbestimmten'
Wert überschreitet,
u) eine zweite Codierschaltung (43) zur Erzeugung einer Gruppe von Signalen DF3 und DF aus einem vierten Signal
VO und einem fünften Signal VC, wobei das vierte Signal nur dann einen hohen Wert hat, wenn die Signale VO für
offene Klänge einen hohen Wert haben und auch die Ausgangs signale der zweiten Vergleichsschaltung (41) einen hohen
Wert haben, während das fünfte Signal VC nur dann den hohen Wert hat, wenn die Signale VC für geschlossene J
Klänge den hohen Wert haben und die Ausgangssignale der zweiten Vergleichsschaltung (41) ebenfalls den hohen Wert,
haben,
v) ein erstes Speichersystem zur Speicherung der codierten j Signale DF3, DF3, DF1 und DFQ, i
w) ein zweites Speichersystem zum Speichern von Zählinhalten' des ersten Zählers (24), des zweiten Zählers (22) und des
dritten Zählers (39) entsprechend den codierten Signalen ;
DF3, DF2, DF1 und DFQ, :
x) ein drittes Speichersystem (7) zum Speichern von Bezugs- mustern
und
BAD ORIGINAL
y) einen Computer (4), der das Abspeichern der codierten Signale DF3, DF3,.DF1 und DFQ sowie der Zählinhalte der
drei Zähler (24, 22, 39) ini ersten und im zweiten Speichersystem
bewirkt und der die Signale mit den im dritten Speichersystem gespeicherten Bezugsmustern vergleicht.
52. Vorrichtung zur Spracherkennung, bei der eine gesprochene Nachricht durch Analyse in mehrere Frequenzbänder zerlegt
wird, die in den jeweiligen Frequenzbändern enthaltenen Energieanteile gemessen werden und eine Frequenzbandverteilung
dieser Energiewerte zum Erkennen des Inhalts der gesprochenen Nachricht mit Bezugsmustern verglichen wird,
gekennzeichnet durch .
a) eine erste Filterbank (9) zum Auswählen der in einem Bereich von 0 bis 0,5 kHz liegenden Energieanteile der
Nachricht,
b) eine zweite Filterbank (10) zum Auswählen der in einem Bereich von 0,5 bis 1,0 kHz liegenden Energieanteile der
Nachricht,
c) eine dritte Filterbank (45) zum Auswählen der in einem Bereich von 0,8 bis 1,8 kHz liegenden Energieanteile der
Nachricht,
d) eine vierte Filterbank (46) zum Auswählen der in einem Bereich von 1,8 bis 3,2 kHz liegenden Energieanteile der
. Nachricht,
e) eine fünfte Filterbank (47) zum Auswählen der in einem Bereich von 5 bis 12 kHz liegenden Energieanteile der
Nachricht,
COPY
f) einen ersten Differenzverstärker (49) , der die Ausgangssignale
der ersten Filterbank (9) und der zweiten Filterbank (10) gemeinsam von Ausgangssignalen der fünften
Filterbank (47) subtrahiert,
g) einen zweiten Differenzverstärker (53) , der die Ausgangssignale
der ersten Filterbank (9) von AusgangsSignalen der zweiten Filterbank (10) subtrahiert,
h) einen dritten Differenzverstärker (57) , der die Ausgangssignale
der dritten Filterbank (45) von Ausgangssignalen der vierten Filterbank (46) subtrahiert,
i) mehrere Diskriminatorschaltungen (61 - 66), die aus jewe:
ligen Ausgangssignalen der drei Differenzverstärker (49,
53, 57) unterscheidende Ausgangssignale erzeugt,
j) eine erste Speicherschaltung (15) zum Speichern der Ausgangssignale
der Diskriminatorschaltungen (61 - 66) , ':
k) eine zweite Speicherschaltung (7) zum Speichern der Bezu<
muster und
1) einen CoSnputer ■ (4) , der die Abspeicherung der Ausgangs- '■
signale der Diskriminatorschaltungen (61 - 66) in der erste] Speicherschaltung (15) bewirkt und der diese Ausgangssignale
mit den jeweiligen Bezugsmustern vergleicht.
BAD ORIGINAL
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE3249698A DE3249698C2 (en) | 1982-01-12 | 1982-01-12 | Method for speech recognition and device for carrying out this method |
| DE19823200645 DE3200645A1 (de) | 1982-01-12 | 1982-01-12 | "verfahren und vorrichtung zur spracherkennung" |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE19823200645 DE3200645A1 (de) | 1982-01-12 | 1982-01-12 | "verfahren und vorrichtung zur spracherkennung" |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| DE3200645A1 true DE3200645A1 (de) | 1983-07-21 |
| DE3200645C2 DE3200645C2 (de) | 1987-06-25 |
Family
ID=6152886
Family Applications (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| DE19823200645 Granted DE3200645A1 (de) | 1982-01-12 | 1982-01-12 | "verfahren und vorrichtung zur spracherkennung" |
| DE3249698A Expired DE3249698C2 (en) | 1982-01-12 | 1982-01-12 | Method for speech recognition and device for carrying out this method |
Family Applications After (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| DE3249698A Expired DE3249698C2 (en) | 1982-01-12 | 1982-01-12 | Method for speech recognition and device for carrying out this method |
Country Status (1)
| Country | Link |
|---|---|
| DE (2) | DE3200645A1 (de) |
Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US2297528A (en) | 1941-12-12 | 1942-09-29 | Bell Henry Barto | Fraud prevention device for meters |
| DE957235C (de) * | 1953-04-21 | 1957-01-31 | Nordwestdeutscher Rundfunk Ans | Verfahren zur UEbertragung oder Speicherung von Schallereignissen, bei dem der zu uebertragende Frequenzbereich in zwei getrennte Bereiche aufgeteilt wird |
| DE2020753A1 (de) * | 1969-07-30 | 1971-02-11 | Rca Corp | Einrichtung zum Erkennen vorgegebener Sprachlaute |
| DE2400027A1 (de) * | 1973-01-08 | 1974-07-25 | Xerox Corp | Verfahren und vorrichtung zum erkennen von worten |
| US3946157A (en) * | 1971-08-18 | 1976-03-23 | Jean Albert Dreyfus | Speech recognition device for controlling a machine |
| US4297528A (en) | 1979-09-10 | 1981-10-27 | Interstate Electronics Corp. | Training circuit for audio signal recognition computer |
-
1982
- 1982-01-12 DE DE19823200645 patent/DE3200645A1/de active Granted
- 1982-01-12 DE DE3249698A patent/DE3249698C2/de not_active Expired
Patent Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US2297528A (en) | 1941-12-12 | 1942-09-29 | Bell Henry Barto | Fraud prevention device for meters |
| DE957235C (de) * | 1953-04-21 | 1957-01-31 | Nordwestdeutscher Rundfunk Ans | Verfahren zur UEbertragung oder Speicherung von Schallereignissen, bei dem der zu uebertragende Frequenzbereich in zwei getrennte Bereiche aufgeteilt wird |
| DE2020753A1 (de) * | 1969-07-30 | 1971-02-11 | Rca Corp | Einrichtung zum Erkennen vorgegebener Sprachlaute |
| US3946157A (en) * | 1971-08-18 | 1976-03-23 | Jean Albert Dreyfus | Speech recognition device for controlling a machine |
| DE2400027A1 (de) * | 1973-01-08 | 1974-07-25 | Xerox Corp | Verfahren und vorrichtung zum erkennen von worten |
| US4297528A (en) | 1979-09-10 | 1981-10-27 | Interstate Electronics Corp. | Training circuit for audio signal recognition computer |
Non-Patent Citations (2)
| Title |
|---|
| WINCKEL, Fritz, Grundlagen der natürlichen und elektronischen Spracherkennung, In: ETZ-B, Bd. 19, 1967, Heft 23, S. 673-678 * |
| Winckel, Fritz, Grundlagen der natürlichen und elektronischen Spracherkennung, In: ETZ-B., 1967, Bd. 19, H. 23, S. 673-678 |
Also Published As
| Publication number | Publication date |
|---|---|
| DE3249698C2 (en) | 1987-11-26 |
| DE3200645C2 (de) | 1987-06-25 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69421911T2 (de) | Spracherkennung mit pausedetektion | |
| DE2626793C3 (de) | Elektrische Schaltungsanordnung zum Bestimmen des stimmhaften oder stimmlosen Zustandes eines Sprachsignals | |
| DE3783154T2 (de) | Spracherkennungssystem. | |
| DE69430082T2 (de) | Verfahren und Vorrichtung zur Sprachdetektion | |
| DE102004049457B3 (de) | Verfahren und Vorrichtung zur Extraktion einer einem Audiosignal zu Grunde liegenden Melodie | |
| DE69030561T2 (de) | Spracherkennungseinrichtung | |
| DE2918533C2 (de) | ||
| DE69311303T2 (de) | Sprachtrainingshilfe für kinder. | |
| DE3687815T2 (de) | Verfahren und vorrichtung zur sprachanalyse. | |
| DE2753277C2 (de) | Verfahren und Einrichtung zur Spracherkennung | |
| DE3236834C2 (de) | Verfahren und Gerät zur Sprachanalyse | |
| DE3236832C2 (de) | Verfahren und Gerät zur Sprachanalyse | |
| DE19847419A1 (de) | Verfahren zur automatischen Erkennung einer buchstabierten sprachlichen Äußerung | |
| DE2326517A1 (de) | Verfahren und schaltungsanordnung zum erkennen von gesprochenen woertern | |
| DE19942178C1 (de) | Verfahren zum Aufbereiten einer Datenbank für die automatische Sprachverarbeitung | |
| DE4031638C2 (de) | ||
| DE2524804A1 (de) | Verfahren und vorrichtung zur automatischen spracherkennung | |
| DE2020753A1 (de) | Einrichtung zum Erkennen vorgegebener Sprachlaute | |
| DE3853702T2 (de) | Spracherkennung. | |
| EP1282897A1 (de) | Verfahren zum erzeugen einer sprachdatenbank für einen zielwortschatz zum trainieren eines spracherkennungssystems | |
| DE102004049478A1 (de) | Verfahren und Vorrichtung zur Glättung eines Melodieliniensegments | |
| DE1206167B (de) | Schaltung zur Verbesserung der Erkennbarkeit von Lauten bei der Schallanalyse | |
| DE102004049517B4 (de) | Extraktion einer einem Audiosignal zu Grunde liegenden Melodie | |
| EP1076896B1 (de) | Verfahren und vorrichtung zur erkennung mindestens eines schlüsselworts in gesprochener sprache durch einen rechner | |
| DE19854420C2 (de) | Verfahren und Einrichtung zum Verarbeiten von Schallsignalen |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| OP8 | Request for examination as to paragraph 44 patent law | ||
| 8172 | Supplementary division/partition in: |
Ref country code: DE Ref document number: 3249698 Format of ref document f/p: P |
|
| Q171 | Divided out to: |
Ref country code: DE Ref document number: 3249698 |
|
| AH | Division in |
Ref country code: DE Ref document number: 3249698 Format of ref document f/p: P |
|
| D2 | Grant after examination | ||
| AH | Division in |
Ref country code: DE Ref document number: 3249698 Format of ref document f/p: P |
|
| 8364 | No opposition during term of opposition | ||
| 8339 | Ceased/non-payment of the annual fee |