FR2859565A1 - Adaptation intelligente a un utilisateur dans des systemes de dialogue - Google Patents

Adaptation intelligente a un utilisateur dans des systemes de dialogue Download PDF

Info

Publication number
FR2859565A1
FR2859565A1 FR0409340A FR0409340A FR2859565A1 FR 2859565 A1 FR2859565 A1 FR 2859565A1 FR 0409340 A FR0409340 A FR 0409340A FR 0409340 A FR0409340 A FR 0409340A FR 2859565 A1 FR2859565 A1 FR 2859565A1
Authority
FR
France
Prior art keywords
confidence
words
user
dialogue
word
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
FR0409340A
Other languages
English (en)
Other versions
FR2859565B1 (fr
Inventor
Thomas Jersak
Susanne Kronenberg
Alexandros Philopoulos
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Mercedes Benz Group AG
Original Assignee
DaimlerChrysler AG
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by DaimlerChrysler AG filed Critical DaimlerChrysler AG
Publication of FR2859565A1 publication Critical patent/FR2859565A1/fr
Application granted granted Critical
Publication of FR2859565B1 publication Critical patent/FR2859565B1/fr
Anticipated expiration legal-status Critical
Expired - Fee Related legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00—Speech recognition
    • G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063—Training
    • G10L2015/0631—Creating reference templates; Clustering

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Machine Translation (AREA)
  • User Interface Of Digital Computer (AREA)

Abstract

Dans ce procédé de fonctionnement d'un système de dialogue dans lequel un système d'identification de la parole reçoit les paroles d'un utilisateur du système et une probabilité d'une reconnaissance correcte des paroles est évaluée sur la base d'une règle de confiance associant des valeurs de confiance à un mot ou une phrase contenu éventuellement dans les paroles, au moins lorsque la conclusion n'indique pas une reconnaissance correcte, les mots ou phrases sont mémorisés temporairement dans l'unité de mémoire, lorsqu'une reconnaissance correcte est constatée, au moins les derniers mots ou phrases mémorisés sont comparés aux nouveaux mots ou phrases reconnus éventuellement, et le système de reconnaissance de la parole conclut à une reconnaissance correcte d'un mot ou d'une phrase lorsque ce mot ou cette phrase est identifié parmi les nouveaux mots ou phrases.Application notamment à dans des systèmes de dialogue avec adaptation intelligente à l'utilisateur.

Description

L'invention concerne un procédé pour faire fonctionner un système de
dialogue vocal, qui s'adapte à la qualité vocale de différents locuteurs,
selon lequel les paroles d'un utilisateur du système sont envoyées par l'intermédiaire d'une interface vocale à un appareil de reconnaissance de la parole associé au système de dialogue vocal, à la suite de quoi le système de reconnaissance de la parole estime la vraisemblance d'une reconnaissance correcte des paroles prononcées par l'utilisateur, par le fait qu'il utilise pour l'estimation une règle de confiance, avec laquelle une valeur de confiance est associée au mot ou à la phrase potentiellement contenu(e) dans les paroles prononcées, et par le fait qu'on en conclut à une identification correcte du mot ou de la phrase, qui représente la valeur de confiance maximale, lorsque cette valeur de confiance dépasse une certaine valeur de seuil de confiance, et selon lequel la poursuite du déroulement du dialogue vocal est adaptée à l'utilisateur du système en fonction du fait que la conclusion a indiqué une reconnaissance correcte ou non.
Une multiplicité de dispositifs techniques moder- nes sont couplés à un système de dialogue vocal, au moyen duquel un utilisateur peut commander ce dispositif. Ainsi il est connu de commander des systèmes de navigation et des systèmes audio dans des véhicules automobiles par l'inter- médiaire d'une interface vocale couplée à un système de dialogue vocal. Mais de même on connaît aussi des systèmes de renseignement et de réservation à commande vocale, dans lesquels un utilisateur peut demander et déclencher des services désirés (réservations ou renseignements sur des programmes de voyages). Dans le cas d'un dialogue exécuté avec un utilisateur du système, les demandes vocales sont fournies par le système de dialogue vocal, à la suite de quoi le système attend une manifestation de l'utilisateur sous la forme de paroles prononcées. Pour comprendre éventuellement les paroles prononcées par l'utilisateur, un dispositif de reconnaissance de la parole est activé à cet effet. Dans le cas où aucune parole de l'utilisateur n'est produite, le système de reconnaissance de la parole est fermé au bout d'un intervalle de temps prédéterminé (dit Final-Timeout), et le système de dialogue vocal réagit à nouveau à une demande vocale réitérée.
D'après EP 0 651 372 A2 on connaît un tel système de dialogue vocal, qui permet d'adapter le dialogue en fonction de la compréhension du langage ou de la forme parlée du mode de type de langage d'un utilisateur.
A cet effet, la probabilité d'une reconnaissance correcte de paroles d'un utilisateur lors d'une demande vocale est évaluée au moyen du système de reconnaissance de la parole associé au dialogue vocal. Pour l'estimation, on utilise une règle de confiance qui est associée aux mots ou phrases contenu(e)s éventuellement dans les paroles prononcées. Si la valeur de confiance d'un mot éventuellement reconnu ou d'une phrase dépasse une certaine valeur de seuil de confiance, on suppose avec une grande probabilité que le mot ou la phrase a été reconnu de façon correcte, de sorte que le dialogue peut se poursuivre avec l'étape suivante de dialogue. Si la valeur de confiance est inférieure à la valeur de seuil de confiance, le dialogue vocal est adapté à l'utilisateur du système en ce sens que le mot ou la phrase éventuellement reconnu est communiqué à cet utilisateur et qu'il lui est demandé de confirmer le caractère correct de la reconnaissance ou d'identifier le mot ou la phrase comme étant reconnu par erreur. Si le mot ou la phrase est identifié comme étant reconnu à tort, le résultat de la reconnaissance est rejeté et la demande vocale est répétée.
Dans le cas d'utilisateurs du système, qui disposent d'un langage compréhensible aisément pour le système de dialogue, les valeurs de confiance générées par le système de reconnaissance de la parole sont régulièrement supérieures à la valeur de seuil de confiance. De ce fait le dialogue vocal peut être adapté à ces utilisateurs du système de telle sorte que ces derniers peuvent naviguer sans rétrodemande au moyen du dialogue et par conséquent atteindre rapidement l'objectif du dialogue. D'autre part, il est possible que le système de dialogue vocal s'adapte de manière plus souple également à des utilisateurs du système ayant une façon de parler difficilement compréhensible, sans exclure ces utilisateurs du dialogue. Ceci s'effectue par le fait que les différentes paroles prononcées, éventuellement reconnues, qui possèdent seulement une faible valeur de confiance, sont modifiées sans rétrodemande. Le système de dialogue vocal s'adapte par conséquent également de façon souple à des situations, dans lesquelles des utilisateurs en soi bien compréhensibles du système communiquent avec le système dans un environnement comportant des bruits secondaires intenses.
Un dispositif de téléphone mains libres, qui est adapté de façon analogue à des locuteurs bien compréhensi- bles et mal compréhensibles, est décrit dans US 5305244 Al.
Ici également un système de reconnaissance de la parole conclut, sur la base d'une règle de confiance, au moyen de laquelle une valeur de confiance d'un mot ou d'une phrase éventuellement reconnu est déterminée, à la reconnaissance correcte par comparaison à une valeur de seuil de confiance. Si la valeur de confiance est inférieure à la valeur de seuil de confiance, un mot éventuellement reconnu ou la phrase est communiqué à l'utilisateur du système, et il lui est demandé de confirmer éventuellement le caractère correct de la reconnaissance ou d'identifier le mot ou la phrase comme reconnu d'une manière erronée ou par erreur. Dans le cas où l'état correct de la reconnaissance est confirmé, le classificateur situé à l'intérieur dudit système de reconnaissance de la parole est modifié en ce sens en rapport avec le mot ou la phrase conclu comme étant reconnu de façon correcte et il est entraîné ensuite avec les données de signal reçues actuellement par l'interface vocale. De cette manière, l'algorithme de classification de reconnaissance contenu dans le système de reconnaissance de la parole est adapté à l'utilisateur respectif du système. Grâce à la modification adaptative de l'algorithme de reconnaissance, la puissance de reconnaissance est assurément améliorée par rapport au locuteur actuel, mais le procédé est approprié uniquement pour un fonctionnement avec ce seul utilisateur et pose des problèmes lors de l'utilisation par d'autres utilisateurs du système, qui répondent avec des qualités vocales différentes.
Les demandes vocales produites par un système de dialogue sont conçues d'une manière générale de telle sorte que même des utilisateurs n'ayant pas l'expérience du système reçoivent des indications suffisantes concernant le type de paroles prononcées auquel le système s'attend lors de la demande vocale. Cependant ceci conduit fréquemment au fait que des utilisateurs ayant l'expérience du système se sentent perturbés par la possibilité de réalisation de la demande vocale étant donné qu'ils connaissent déjà au début de la demande vocale quelles paroles sont alors attendues par le système. Pour de tels utilisateurs, le déroulement du dialogue serait trop lent de sorte que des systèmes de dialogue vocal avancés disposent de la possibilité de ce qu'on appelle un "Barge-In" c'est-à-dire une intervention.
Le "Barge-In" permet à l'utilisateur du système d'interrom- pre les demandes vocales de systèmes de dialogue vocal, au moyen d'une entrée dans sa propre langue. Dans le cas d'une telle entrée dans la langue de l'utilisateur, il peut s'agir d'une part de l'entrée prématurée des paroles attendues par le système, ou bien d'autres indications influençant le dialogue vocal. Grâce à cette entrée dans la langue de l'utilisateur, la délivrance extérieure de la demande vocale est interrompue. Ceci fournit l'avantage d'une interaction plus efficace avec le système par le fait que le dialogue vocal est accéléré étant donné que l'utilisateur du système peut interrompre et arrêter des demandes vocales. Un problème peut cependant s'avérer résider dans le fait que le système de reconnaissance vocale du système de dialogue vocal pourrait éventuellement mal interpréter des paroles de l'utilisateur du système. Dans ce cas, la demande vocale serait assurément interrompue, mais le dia- logue ne pourrait plus se poursuivre d'une façon judicieuse avec les paroles apparemment délivrées de l'utilisateur du système.
Pour éviter de telles interruptions indésirables du dialogue en raison d'erreurs d'interprétation de paroles prononcées par l'utilisateur, il est usuel que le système de reconnaissance de la parole associé au système de dialo- gue vocal, estime les paroles prononcées d'un utilisateur du système dans le sens d'une vraisemblance de reconnais- sance correcte des paroles prononcées par l'utilisateur.
Ceci s'effectue par le fait qu'il utilise pour l'estimation une règle de confiance, au moyen de laquelle une valeur de confiance est associée au mot ou à la phrase contenu éven- tuellement dans les paroles prononcées. Sur la base de cette valeur de confiance, on en conclut alors à une reconnaissance correcte dans le cas où cette valeur de confiance dépasse une certaine valeur de seuil de confiance. Si c'est le cas, la délivrance de la demande vocale est interrompue et le dialogue se poursuit sur la base des paroles pronon- cées par l'utilisateur du système. Si la valeur de confiance d'un mot éventuellement reconnu est inférieure à la valeur de seuil de confiance, le système de dialogue vocal ne réagit pas à des paroles prononcées par l'utilisateur et poursuit la délivrance de la demande vocale. De cette manière, le système de dialogue vocal adapte son comportement au locuteur présentant une qualité vocale différente, par le fait qu'il accepte le "Barge-In" de locuteurs très bien compréhensibles, et rejette des paroles de locuteurs difficilement compréhensibles, dans le cadre du "Barge-In". Un rejet des paroles de l'utilisateur du système pose relativement peu de problèmes étant donné qu'il correspond au comportement normal de l'utilisateur qui est de répéter des paroles prononcées antérieurement, dans le cas où le système n'a pas réagi à ces paroles. Cependant un problème réside ici dans l'interaction du système de dialogue avec des locuteurs difficilement compréhensibles. Il peut arriver que ces mêmes paroles soient répétées à plusieurs reprises et que chaque fois les valeurs de confiance associées à ces paroles se situent au-dessous de la valeur de seuil de confiance. Il en résulte alors que l'utilisateur ne peut pas influer par un "Barge-In" sur le dialogue vocal.
C'est pourquoi l'invention a pour but de trouver un procédé pour faire fonctionner un système de dialogue vocal, qui est adapté à la qualité vocale de différents locuteurs, ce qui permet également à des utilisateurs difficilement compréhensibles du système d'influer, au moyen de paroles, sur des demandes vocales ou pendant leur interruption, sur le dialogue vocal, sans que le dialogue vocal ne puisse pas être transmis judicieusement en raison d'une interprétation erronée des paroles de l'utilisateur.
Le problème est résolu à l'aide d'un procédé caractérisé en ce qu'au moins dans le cas où la conclusion n'a pas indiqué une reconnaissance correcte, les mots ou les phrases, identifiés potentiellement, sont mémorisés temporairement dans une unité de mémoire, que lorsque le système de reconnaissance de la parole ne conclut pas à nouveau à une reconnaissance correcte lors du processus suivant de reconnaissance, au moins les mots ou phrases mémorisés en dernier lieu dans l'unité de mémoire sont comparés aux mots ou phrases identifiés potentielle-ment comme nouveaux par le système de reconnaissance de la parole, et que le système de reconnaissance de la parole conclut à la reconnaissance correcte d'un mot ou d'une phrase lorsque dans le cadre de la comparaison, ce mot ou cette phrase est identifié aussi bien dans les mots ou phrases mémorisés que dans les mots ou phrases éventuellement reconnus.
Le problème est en outre résolu à l'aide d'un procédé caractérisé en ce que la valeur de confiance est sélectionnée en fonction de l'étape actuelle de dialogue, auquel cas lorsque les paroles prononcées par l'utilisateur sont situées sur la voie envisagée, au moyen du dialogue, la valeur de seuil de confiance usuelle est réduite de sorte que le système de reconnaissance de la parole en conclut à un mot ou une phrase reconnu, également lorsqu'à ce mot ou à cette phrase a été affectée une valeur de confiance plus faible que ce qui est habituellement nécessaire à cet effet.
Le problème est également résolu à l'aide d'un procédé caractérisé en ce qu'au moins les cas, dans lesquels la conclusion n'a pas fourni une identification correcte, sont consignés au moins temporairement dans une unité de mémoire, et que la valeur de seuil de confiance est réduite lorsque les paroles prononcées par un utilisateur du système, sur la reconnaissance desquelles aucune conclusion n'a été faite, tombe audessous d'un pourcentage prédéterminé par rapport au nombre total des paroles prononcées, ou que la valeur de confiance est accrue lorsque les paro- les prononcées par un utilisateur du système, sur l'identification desquelles une conclusion a été établie, sont toujours situées nettement au-dessus de la valeur de seuil de confiance.
Selon une autre caractéristique de l'invention, pour la comparaison avec les nouveaux mots ou phrases éventuellement reconnus, seuls les mots ou phrases éventuellement reconnus des dernières paroles prononcées par l'utilisateur du système sont utilisés.
Selon une autre caractéristique de l'invention, la valeur de seuil de confiance est choisie en outre en fonction de l'étape actuelle de dialogue, auquel cas lors-que les paroles prononcées par l'utilisateur sont situées sur la voie envisagée, au moyen du dialogue, la valeur de seuil de confiance usuelle est réduite de sorte que le système de reconnaissance de la parole en conclut à un mot ou à une phrase reconnu(e) , également lorsqu'à ce mot ou cette phrase a été affectée une valeur de confiance plus faible que ce qui est habituellement nécessaire à cet effet.
Selon une autre caractéristique de l'invention, au début du déroulement du procédé, la valeur de seuil de confiance est adaptée spécifiquement à des utilisateurs différents.
Dans le procédé pour faire fonctionner un système de dialogue vocal, qui s'adapte à la qualité vocale de locuteurs différents, les paroles prononcées par un utilisateur du système sont envoyées par l'intermédiaire d'une interface vocale à un système de reconnaissance de la para- le associé à un système de dialogue vocal. Le système de reconnaissance de la parole estime alors le caractère vraisemblable d'une identification correcte des paroles de l'utilisateur, par le fait qu'il utilise pour l'estimation une règle de confiance, au moyen de laquelle une valeur de confiance est associée au mot ou à la phrase éventuellement contenu dans les paroles prononcées. Alors, on en conclut à une reconnaissance correcte du mot ou de la phrase, qui possède la valeur de confiance maximale, lorsque cette valeur de confiance dépasse une certaine valeur de seuil de confiance. Le système de dialogue vocal adapte alors le déroulement du dialogue vocal en fonction du fait que la conclusion a indiqué ou non une reconnaissance correcte.
Une valeur de seuil de confiance usuelle, égale-ment fréquemment spécifique à l'utilisation, est en général déterminée expérimentalement et est choisie d'une manière générale de telle sorte que la multiplicité des paroles prononcées par des utilisateurs du système, qui répondent d'une manière bien compréhensible pour le système de dialogue vocal, sont reconnues comme correctes par le système de reconnaissance de la parole du système. A partir de l'état de la technique, on connaît une pluralité de règles de confiance convenant pour un tel système de dialogue vocal. Ainsi, une règle de confiance appropriée pourrait être définie par le fait que la différence entre les probabili- tés de reconnaissance d'un mot ou d'une phrase identifié par le système de reconnaissance de la parole et le mot ou la phrase reconnu avec la probabilité la plus faible en second, est formée. La valeur de confiance associée au mot ou à la phrase correspondrait alors à cette différence.
L'une des solutions particulièrement avantageuses de la présente invention réside dans le fait qu'au moins dans les cas où la conclusion n'a pas indiqué une reconnaissance correcte, les mots ou phrases éventuellement reconnus sont mémorisés temporairement dans une unité de mémoire. Si le système de reconnaissance de la parole ne prend à nouveau pas une décision pour une reconnaissance correcte après le processus de reconnaissance suivant, tout d'abord les mots ou phrases mémorisés en dernier lieu dans l'unité de mémoire sont comparés aux mots ou phrases éven- tuellement reconnus nouvellement par le système de recon- naissance de la parole. Le système de reconnaissance de la parole peut en conclure alors, d'une manière inventive, à une reconnaissance correcte d'un mot ou d'une phrase lors-que dans le cadre de la comparaison, ce mot ou cette phrase est identifié aussi bien dans les mots ou les phrases mémorisés que dans les nouveaux mots ou phrases potentiellement identifiés.
Grâce à cet agencement avantageux de l'invention, des locuteurs, qui sont difficilement reconnus par le système de dialogue vocal, sont assistés par ce dernier de telle sorte que, éventuellement, des répétitions de ces mêmes paroles prononcées par l'utilisateur sont acceptées même lorsque la valeur de confiance associée à ces paroles est inférieure à la valeur de seuil de confiance devant être actuellement observée.
Pour maintenir à une faible valeur la dépense de calcul et l'emplacement de mémoire nécessaire, il est avantageux dans le cadre de la comparaison des nouveaux mots ou phrases éventuellement reconnus, que seuls les mots ou phrases mémorisés des paroles précédentes soient utilisés. Mais on peut également tout aussi bien imaginer des applications, notamment dans le domaine de la technique de sécurité, dans lequel les nouveaux mots ou phrases sont comparés à plusieurs paroles prononcées antérieures, une conclusion indiquant une reconnaissance correcte est faite uniquement lorsque le même mot ou la même phrase peut être identifié au moyen de la suite de plusieurs paroles prononcées.
La dépense de calcul et de mémoire peut être optimisée de façon supplémentaire lorsqu'on définit l'autre valeur de seuil, à laquelle est comparée la valeur de confiance associée aux mots ou phrases éventuellement reconnus. Si la valeur de confiance associée vient se situer au-dessous de cette autre valeur de seuil, ce mot éventuellement reconnu n'est pas mémorisé dans l'unité de mémoire, pour des comparaisons ultérieures.
Une autre solution avantageuse du problème selon l'invention réside dans le fait que la valeur de seuil de configuration est choisie en fonction de l'étape actuelle du dialogue. Ceci s'effectue sur la base selon laquelle l'utilisateur du système de dialogue vocal peut prononcer des paroles d'une manière différente par rapport à la demande vocale du système. Ainsi il peut prononcer des paroles qui correspondent à l'étape de dialogue actuelle de sorte que le dialogue peut être transmis de la manière usuelle envisagée. Mais d'autre part, il est fréquemment possible à l'utilisateur du système de diriger le dialogue au moyen de paroles ciblées dans une autre direction que la direction usuelle; par exemple par le fait que des indi- cations vocales (dites Short-Cuts) sont indiquées ou par le fait que l'on passe de façon ciblée conjointement à un autre dialogue (modification du flux du dialogue). Si les paroles prononcées par l'utilisateur sont situées sur la voie envisagée au moyen du dialogue, le système de reconnaissance de la parole réduit avantageusement la valeur de seuil usuelle de confiance, de telle sorte que le système de reconnaissance de la parole réduit avantageusement la valeur de seuil de confiance usuelle de telle sorte qu'il en conclut également à un mot ou à une phrase reconnue, lorsqu'à ce dernier a été affectée une valeur de confiance plus faible que ce qui est usuel. Si cependant l'utilisa- teur du système modifie le flux du dialogue par ses paro- les, le système de reconnaissance de la parole doit être certain que le mot ou la phrase, sur la base duquel il en a conclu à une reconnaissance sûre, correspond également à l'intention effective de l'utilisateur du système. Par conséquent, dans une telle situation, la valeur de seuil de confiance n'est pas réduite. On peut même imaginer que dans une telle situation, dans laquelle on s'écarte du flux de dialogue usuel, la valeur de seuil usuelle de confiance est accrue.
Grâce à cette solution avantageuse du problème selon l'invention, on aboutit à ce que le système de dialogue vocal s'adapte à l'utilisateur du système en fonction de l'état réel du dialogue et permet de ce fait que les paroles, qui s'insèrent sans problème dans le flux de dialogue actuel, soient acceptées, même dans le cas de locuteurs difficilement compréhensibles, plus rapidement que ce n'est le cas pour des paroles modifiant le flux du dialogue.
Alternativement à cela, le problème selon l'invention peut être également résolu d'une manière avantageuse par le fait qu'au moins certains cas, dans lesquels la conclusion n'a pas indiqué une reconnaissance correcte, il se produit au moins temporairement l'exécution d'un protocole dans une unité de mémoire. Cette solution prévoit en outre que la valeur de seuil usuelle de confiance est réduite lorsque les paroles prononcées par un utilisateur du système, pour lesquelles aucune conclusion de reconnaissance n'a été établie, dépasse un nombre prédéterminé par rapport au nombre total des paroles prononcées. On pourrait ainsi imaginer de réduire la valeur de seuil de confiance lorsque par exemple au moins 80 pour cent des paroles prononcées par l'utilisateur du système atteignent au maximum une valeur de confiance, qui vient se situer encore au-dessous de la valeur de seuil de confiance. D'une part on peut imaginer de réduire la valeur de seuil de confiance de manière que toutes les valeurs de confiance obtenues au maximum jusqu'alors viennent se situer au-dessus de cette valeur de seuil. Pour garantir une certaine sécurité de reconnaissance, il est cependant préférable de réduire la valeur de seuil de confiance uniquement au point que seul un nombre déterminé des valeurs de confiance obtenues au maximum jusqu'alors dépas- sent la valeur de seuil. Si cette valeur est choisie par exemple de telle sorte que 50 pour cent des dernières paroles, qui sont déterminées comme non reconnues, ne dépassent pas la valeur de seuil, on peut obtenir, approximativement une reconnaissance deux fois plus fréquente par le système de reconnaissance de la parole. De cette manière, le seuil d'acceptation du système de dialogue vocal est réduit et est adapté au comportement vocal des utilisateurs.
Inversement, par exemple un système important du point de vue sécurité peut être amélioré d'une manière avantageuse lorsque, dans le cas où les valeurs de confiance affectées au maximum aux paroles de l'utilisateur du système, dépassent nettement la valeur de seul de confiance usuelle, cette valeur est accrue.
En général, l'utilisateur ne remarque pas cet accroissement de la valeur de seuil de confiance étant donné que ses paroles sont obtenues encore toujours de telle sorte que des valeurs de confiance supérieures leur sont normalement affectées. De cette manière, la sécurité de reconnaissance est accrue sans réduction importante du confort vocal.
L'avantage de toutes les formes de réalisation décrites précédemment de l'invention réside dans le fait que le comportement du système de dialogue vocal s'adapte de façon dynamique à l'utilisateur du système étant donné qu'il prend en compte la compréhension des paroles de cet utilisateur et en partie également l'étape actuelle de dialogue. Les locuteurs, qui sont mal reconnus par le système de dialogue vocal, sont assistés par ce dernier par le fait que des répétitions des mêmes paroles de l'utilisateur sont éventuellement acceptées même lorsque la valeur de confiance devant être associée à ces paroles est infé- rieure à la valeur de seuil de confiance devant être actuellement observée. Sinon, le système est à même de s'adapter à des locuteurs bien compréhensibles, par accroissement du niveau de seuil de confiance de telle sorte que la sécurité de reconnaissance peut être accrue sans réduction importante du confort vocal.
D'une manière particulièrement avantageuse, on peut améliorer les procédés décrits précédemment lorsqu'on utilise, en tant que valeur de sortie pour la valeur de seuil de confiance, au début du procédé, une valeur de seuil déjà adaptée à l'utilisateur actuel. A cet effet on pourrait imaginer que l'utilisateur du système s'identifie de façon explicite au début du dialogue vocal ou lors de l'activation du système de dialogue vocal ou que le système de dialogue vocal comprenne un dispositif d'identification de personnes, ou soit relié à un tel dispositif de manière à identifier automatiquement l'utilisateur du système. Le préréglage de la valeur de seuil de confiance pourrait être effectué au moyen d'une introduction directe dans le système de dialogue vocal (notamment d'une manière haptique au moyen d'un clavier ou de façon acoustique au moyen d'un microphone) ou être exécuté de façon automatique par lec- ture d'un tableau mémorisé dans une mémoire et dans lequel sont mémorisées des valeurs de confiance avantageuses pour les utilisateurs individuels. Si un utilisateur n'était pas encore enregistré dans un tel tableau, le système de dialogue pourrait prérégler le niveau de seuil de confiance par exemple sur une valeur de seuil normalisée et ensuite générer une autre entrée convenant pour des dialogues ultérieurs, dans le tableau.
Le procédé selon l'invention peut être utilisé avantageusement dans les phases d'un dialogue vocal, dans lesquelles le système de dialogue vocal attend les paroles de l'utilisateur du système en rapport avec une demande vocale, mais convient de la même manière pour améliorer la capacité de "Barge-In" du système. Grâce à l'adaptation selon l'invention du système de dialogue vocal à différents locuteurs, il est également fréquemment possible pour des utilisateurs (locuteurs) difficilement compréhensibles du système d'interrompre une demande vocale du système de dialogue vocal et d'accélérer de ce fait le dialogue. Le système comporte par conséquent également, dans les cas où il apparaît des difficultés de compréhension (locuteurs mal compréhensibles), une capacité de coopération accrue.

Claims (2)

REVENDICATIONS
1. Procédé pour faire fonctionner un système de dialogue vocal, qui s'adapte à la qualité vocale de dif-5 férents locuteurs, selon lequel les paroles prononcées par un utilisateur du système sont envoyées par l'intermédiaire d'une interface vocale à un appareil de reconnaissance de la parole associé au système de dialogue vocal, à la suite de quoi le système de reconnaissance de la parole estime la vraisemblance d'une reconnaissance correcte des paroles prononcées par l'utilisateur, par le fait qu'il utilise pour l'estimation une règle de confiance, avec laquelle une valeur de confiance est asso- ciée au mot ou à la phrase potentiellement contenu(e) dans les paroles prononcées, et par le fait qu'on en conclut à une identification correcte du mot ou de la phrase, qui représente la valeur de confiance maximale, lorsque cette valeur de confiance dépasse une certaine valeur de seuil de confiance, et selon lequel la poursuite du déroulement du dialogue vocal est adaptée à l'utilisateur du système en fonction du fait que la conclusion a indiqué une reconnaissance correcte ou non, caractérisé en ce que la valeur de confiance est sélectionnée en fonction de l'étape actuelle de dialogue, auquel cas lorsque les paroles prononcées par l'utilisateur sont situées sur la voie envisagée, au moyen du dialogue, la valeur de seuil de confiance usuelle est réduite de sorte que le système de reconnaissance de la parole en conclut à un mot ou une phrase reconnu, également lorsqu'à ce mot ou à cette phrase a été affectée une valeur de confiance plus faible que ce qui est habituellement néces- saine à cet effet.
2. Procédé selon la revendication 1, caractérisé en ce qu'au début du déroulement du procédé, la valeur de seuil de confiance est adaptée spécifiquement à des 5 utilisateurs différents.
FR0409340A 2003-09-05 2004-09-03 Adaptation intelligente a un utilisateur dans des systemes de dialogue Expired - Fee Related FR2859565B1 (fr)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
DE10341305A DE10341305A1 (de) 2003-09-05 2003-09-05 Intelligente Nutzeradaption bei Dialogsystemen

Publications (2)

Publication Number Publication Date
FR2859565A1 true FR2859565A1 (fr) 2005-03-11
FR2859565B1 FR2859565B1 (fr) 2006-09-29

Family

ID=33154634

Family Applications (1)

Application Number Title Priority Date Filing Date
FR0409340A Expired - Fee Related FR2859565B1 (fr) 2003-09-05 2004-09-03 Adaptation intelligente a un utilisateur dans des systemes de dialogue

Country Status (4)

Country Link
US (1) US20050055205A1 (fr)
DE (1) DE10341305A1 (fr)
FR (1) FR2859565B1 (fr)
GB (1) GB2408133B (fr)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109891498A (zh) * 2016-11-08 2019-06-14 国立研究开发法人情报通信研究机构 语音对话系统、语音对话装置、用户终端以及语音对话方法

Families Citing this family (18)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7725318B2 (en) * 2004-07-30 2010-05-25 Nice Systems Inc. System and method for improving the accuracy of audio searching
JP4679254B2 (ja) * 2004-10-28 2011-04-27 富士通株式会社 対話システム、対話方法、及びコンピュータプログラム
US8200495B2 (en) 2005-02-04 2012-06-12 Vocollect, Inc. Methods and systems for considering information about an expected response when performing speech recognition
US7827032B2 (en) 2005-02-04 2010-11-02 Vocollect, Inc. Methods and systems for adapting a model for a speech recognition system
US7949533B2 (en) * 2005-02-04 2011-05-24 Vococollect, Inc. Methods and systems for assessing and improving the performance of a speech recognition system
US7895039B2 (en) * 2005-02-04 2011-02-22 Vocollect, Inc. Methods and systems for optimizing model adaptation for a speech recognition system
US7865362B2 (en) 2005-02-04 2011-01-04 Vocollect, Inc. Method and system for considering information about an expected response when performing speech recognition
US7720684B2 (en) * 2005-04-29 2010-05-18 Nuance Communications, Inc. Method, apparatus, and computer program product for one-step correction of voice interaction
US8055502B2 (en) * 2006-11-28 2011-11-08 General Motors Llc Voice dialing using a rejection reference
US8983841B2 (en) * 2008-07-15 2015-03-17 At&T Intellectual Property, I, L.P. Method for enhancing the playback of information in interactive voice response systems
EP2148325B1 (fr) * 2008-07-22 2014-10-01 Nuance Communications, Inc. Procédé pour déterminer la présence d'un composant de signal désirable
US8914290B2 (en) 2011-05-20 2014-12-16 Vocollect, Inc. Systems and methods for dynamically improving user intelligibility of synthesized speech in a work environment
US9978395B2 (en) 2013-03-15 2018-05-22 Vocollect, Inc. Method and system for mitigating delay in receiving audio stream during production of sound from audio stream
US11094320B1 (en) * 2014-12-22 2021-08-17 Amazon Technologies, Inc. Dialog visualization
US20180025731A1 (en) * 2016-07-21 2018-01-25 Andrew Lovitt Cascading Specialized Recognition Engines Based on a Recognition Policy
US10714121B2 (en) 2016-07-27 2020-07-14 Vocollect, Inc. Distinguishing user speech from background speech in speech-dense environments
US10748531B2 (en) * 2017-04-13 2020-08-18 Harman International Industries, Incorporated Management layer for multiple intelligent personal assistant services
CN114333822B (zh) * 2021-12-30 2025-08-01 深聪半导体(江苏)有限公司 一种以置信度调整播报音的语音交互方法、系统、设备及介质

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0651372A2 (fr) * 1993-10-27 1995-05-03 AT&T Corp. Procédé de reconnaissance de la parole automatique utilisant des mesures de la fiabilité

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5305244B2 (en) * 1992-04-06 1997-09-23 Computer Products & Services I Hands-free user-supported portable computer
US5737489A (en) * 1995-09-15 1998-04-07 Lucent Technologies Inc. Discriminative utterance verification for connected digits recognition
CA2239339C (fr) * 1997-07-18 2002-04-16 Lucent Technologies Inc. Methode et dispositif d'authentification d'un locuteur par verification de l'information verbale au moyen de decodage force
US6208964B1 (en) * 1998-08-31 2001-03-27 Nortel Networks Limited Method and apparatus for providing unsupervised adaptation of transcriptions
US6571210B2 (en) * 1998-11-13 2003-05-27 Microsoft Corporation Confidence measure system using a near-miss pattern
FI116991B (fi) * 1999-01-18 2006-04-28 Nokia Corp Menetelmä puheen tunnistamisessa, puheentunnistuslaite ja puheella ohjattava langaton viestin
GB2372864B (en) * 2001-02-28 2005-09-07 Vox Generation Ltd Spoken language interface
GB2375211A (en) * 2001-05-02 2002-11-06 Vox Generation Ltd Adaptive learning in speech recognition
GB2383459B (en) * 2001-12-20 2005-05-18 Hewlett Packard Co Speech recognition system and method

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0651372A2 (fr) * 1993-10-27 1995-05-03 AT&T Corp. Procédé de reconnaissance de la parole automatique utilisant des mesures de la fiabilité

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
E.HORVITZ, T.PAEK: "Harnessing models of users' goals to mediate clarification dialog in spoken language system", 8TH CONFERENCE ON USER MODELING, July 2001 (2001-07-01), SONTHOFEN, GERMANY, pages 1 - 11, XP002344138, Retrieved from the Internet <URL:ftp://ftp.research.microsoft.com /pub/ejh/umdl.pdf> [retrieved on 20050908] *
LOPEZ-COZAR R ET AL: "A NEW WORD-CONFIDENCE THRESHOLD TECHNIQUE TO ENHANCE THE PERFORMANCE OF SPOKEN DIALOGUE SYSTEMS", 6TH EUROPEAN CONFERENCE ON SPEECH COMMUNICATION AND TECHNOLOGY. EUROSPEECH '99. BUDAPEST, HUNGARY, SEPT. 5 - 9, 1999, EUROPEAN CONFERENCE ON SPEECH COMMUNICATION AND TECHNOLOGY. (EUROSPEECH), BONN : ESCA, DE, vol. VOL. 3 OF 6, 5 September 1999 (1999-09-05), pages 1395 - 1398, XP001075940 *
PIETQUIN O ET AL: "ASR system modeling for automatic evaluation and optimization of dialogue systems", 2002 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH, AND SIGNAL PROCESSING. PROCEEDINGS (CAT. NO.02CH37334) IEEE PISCATAWAY, NJ, USA, vol. 1, 2002, pages I.45 - I.48, XP002344139, ISBN: 0-7803-7402-9 *

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109891498A (zh) * 2016-11-08 2019-06-14 国立研究开发法人情报通信研究机构 语音对话系统、语音对话装置、用户终端以及语音对话方法

Also Published As

Publication number Publication date
DE10341305A1 (de) 2005-03-31
GB2408133A (en) 2005-05-18
GB2408133B (en) 2005-10-05
FR2859565B1 (fr) 2006-09-29
US20050055205A1 (en) 2005-03-10
GB0419491D0 (en) 2004-10-06

Similar Documents

Publication Publication Date Title
CN116615779B (zh) 冻结词
US7069221B2 (en) Non-target barge-in detection
US11669300B1 (en) Wake word detection configuration
CN111566729B (zh) 用于远场和近场声音辅助应用的利用超短语音分段进行的说话者标识
US20210134276A1 (en) Keyword detection modeling using contextual information
CN111540349A (zh) 一种语音的打断方法和装置
CN101535983B (zh) 协作会话语音用户界面的系统和方法
EP4238090B1 (fr) Filtrage vocal d&#39;autres interlocuteurs à partir d&#39;appels et de messages audio
US10887764B1 (en) Audio verification
US7826945B2 (en) Automobile speech-recognition interface
US8880402B2 (en) Automatically adapting user guidance in automated speech recognition
CN1220176C (zh) 用于一种语音识别设备的训练或适配方法
EP0573301B1 (fr) Méthode et système pour la reconnaissance de parole
EP2051241B1 (fr) Système de dialogue vocal avec rendu du signal de parole adapté à l&#39;utilisateur
US8428944B2 (en) System and method for performing compensated speech recognition
FR2582121A1 (fr) Procede et systeme interactif pour l&#39;identification d&#39;un ordre applique a ce systeme par son utilisateur
EP0867856A1 (fr) &#34;Méthode et dispositif de detection d&#39;activité vocale&#34;
US20030055643A1 (en) Method for controlling a voice input and output
CN1830025A (zh) 驱动对话系统的方法
US20080249779A1 (en) Speech dialog system
EP0892388A1 (fr) Méthode et dispositif d&#39;authentification d&#39;interlocuteur par vérification d&#39;information utilisant un codage forcé
US20050055205A1 (en) Intelligent user adaptation in dialog systems
CA2932449A1 (fr) Procede de detection de la voix
CN111557030A (zh) 用于处理语音输入的方法、设备和具有指令的计算机可读存储介质、具有语音处理的机动车和用户终端设备
JP2020148805A (ja) 音声認識システム、及び、音声認識方法

Legal Events

Date Code Title Description
CA Change of address
CD Change of name or company name
ST Notification of lapse

Effective date: 20100531