CN1115902A - 利用置信度测度的自动语音识别(asr)处理 - Google Patents
利用置信度测度的自动语音识别(asr)处理 Download PDFInfo
- Publication number
- CN1115902A CN1115902A CN94117734A CN94117734A CN1115902A CN 1115902 A CN1115902 A CN 1115902A CN 94117734 A CN94117734 A CN 94117734A CN 94117734 A CN94117734 A CN 94117734A CN 1115902 A CN1115902 A CN 1115902A
- Authority
- CN
- China
- Prior art keywords
- mentioned
- user
- pronunciation
- translating
- confidence
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/10—Speech classification or search using distance or distortion measures between unknown speech and reference templates
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Telephonic Communication Services (AREA)
- Input From Keyboards Or The Like (AREA)
Abstract
自动语音识别(ASR)系统中的用户接口,是根据ASR过程结果的置信度级而动态控制的。系统利用ASR系统输出的置信度程度来区分易出误差的ASR译释和可能正确的译释,而该置信度确定为由ASR系统选定的第一和第二选择的置信度之差的函数。用户接口由于不确定信息的结果而由系统采取的显式校验步骤与当置信度较高时采取的行动不同。根据误译释的“结果”以及特定用户的系统历史性能给出不同的处理。
Description
本发明涉及自动语音识别(ASR),特别是涉及在利用自动语音识别的系统中装备的用户接口处理,其中,计算个人语音输入的ASR译释的置信度测度,并用它来有选择地改变给予该个人语音的处理。
自动语音识别(ASR)系统已开始在各种应用中被广泛接受。1989年5月2日发给Binkerd等人的美国专利4827500描述了一种在呼叫目标中选择的自动语音识别技术,其中呼叫者与一具有ASR功能的声音响应单元互相配合。这种系统或者请求一口头输入,或者为用户提供一选择菜单,然后等待口头响应,利用ASR译释该响应,并执行所请求的动作,所有这一切都没有人的介入。
有设计使用ASR的系统的用户接口中的一个重要问题,是关系到处理识别误差的可能性的问题,这是因为每当ASR系统译释一发音时,总存在关于发音和译释之间对应性的剩余不定度。这个问题对于数字串的输入尤为重要,例如在一系统中呼叫者说出电话号码或信用卡号码。这是因为对于数字串(而且,在某些情况下,甚至对于数字串的一段)仅有85%~90%总精确率并不鲜见。为了对付可能的误差,现在的系统对所有的处理使用某种类型的显式校验,其中误差率引起关注,从而避免处理不正确数字串的可能性。比如,在每一连接的数字串输入后,ASR系统可“回读”最优数字串侯选者,并需要使用该系统的个人给一肯定或否定的响应。一个例子是:“如果你的信用卡号码是XXX—YYYY,请说‘是’,否则说‘不是”。虽然这种类型的显式校验常常是必需的和有用的,但它很麻烦,浪费时间和烦人,特别是对那些ASR系统的频繁用户,或者那些对ASR系统十分信任的用户。如果前一次请求未被识别的话其它系统请求用户重新输入一语音请求。然而,当确认识别以后,则进行静态校验过程。
根据本发明相,使用自动语音识别(ASR)技术的系统中设置了用户接口,以给出一动态过程,其中,根据ASR过程结果中的置信度的水平,对用户进行不同的处理。在一个实施例中,系统这样安排,以利用ASR系统输出的置信度的水平或程度,来区分一发音的易出错误的ASR译释和可能正确的译释。置信度可被确定为由ASR系数选择的第一和第二选择的近似分数(在下面定义)之差的函数。在该实施例中,用户接口这样安排,以使得当置信度较低时,由系统采取的显式校验步骤与当置信度较高时采用的行动不同。此外,根据误译释的“结果”以及相对于特定用户(其语音正在处理)的系统的历史性能,来给出不同的处理。在本发明的另一实施例中,在ASR系统译释一发音之后,评价出译释的置信度,并可能发生三种不同的与用户的相互作用。
示例性地,当ASR系统用于识别数字位时,译释的置信度可以通过在每一发音数字与每一ASR系统已训练的数字模型之间指定一近似记分来确定,这里大分数表示好的对应。因此,对每一发音产生一向量,表明该发音与每一模型的近似。当具有最接近度的模型的近似记分比下一个最优选择的近似记分大很多时,我们说存在着高置信度。这本质上意味着该译释大大优于其它译释。
通过将ASR系统性能结果的置信度式“确定性水平”变换为几个不同的动作,这些动作由产生误差结果的详细分析以及与用户响应校验请求和/或重新输入信息的困难的详细分析共同确定,系统的用户接口得到大大改善,当这些动作被断定时,用户只需重新输入或校验语音输入。
通过结合附图考虑下面的详细描述,可以更充分地理解本发明。附图中,
图1是一流程图,示出当一人用声音输入来拨电话号码后,常规ASR系统采取的步骤;
图2和3合起来是一流程图,示出依据本发明安排的ASR系统,对于用声音输入拨动电话号码者作出响应而采取的步骤;
图4是一框图,示出设置声音处理单元以实现动态用户接口过程(例如图2和3中所述的过程)的一种安排。
图5是一流程图,示出依据本发明的ASR系统中采取的步骤,其中三个不同的结果来自于产生了三种可能置信度级的ASR处理。
首先参考图1,流程图示出常规ASR系统采取的步骤。在这个例子中,一人用声音输入拨动电话号码,ASR系统译释该人的发音并采取行动,比如完成电话呼叫,以响应从ASR系统获得的发音的译释。更具体地,描述了包含拨动10位电话号码(3位区域号,后面7位是本地电话号)的处理。
图2的过程由步骤101开始,此时呼叫者连接到一语音处理平台(下面结合图4描述)。该平台提供可听提示,(prompts)接收语音输入并利用ASR技术译释语音。在步骤103,用户由可听通知提示,通过在步骤105说出3位数输入电话呼叫的区域号。在步骤106,执行任意已知的自动语音识别过程,并确定由呼叫者说出的数字。一般地,由ASR过程完成的译释典型地包括用户输入语音与存贮的语言样本的比较。然而,ASR系统可实现几种熟知的语音识别过程中的任一种。
在步骤106识别了区域号的3位数字之后,系统在步骤107请求呼叫者显式校验被识别的数字确实与用户在步骤105说的数字相同。用户则在步骤108回答“是”或“不是”,系统则依据回答在分支步骤111采取不同的行动。具体说,如果在步骤108接收的答案为“是”,这表示头三位数字被正确识别,则过程继续前进正步骤113,用户被提示输入电话号码其余的7位。用户在步骤115说出这七位数字,在步骤116,如同在步骤106一样,再次利用ASR过程确定呼叫者说出的数字。接着,在步骤117,请求呼叫者显式校验被识别的数字与在步骤115说出的数字一致。如果在步骤119说“是”,则在分支步骤121识别出正响应,而系统继续,在步骤123利用所有10位被识别数字,完成这一次处理。
如果在步骤108或119从呼叫者接收到一个负响应,则该响应使得分支步骤111或121分别转移控制到步骤125或127,在那里决定是否已进行太多次失败的尝试。这可以这样完成,即当过程开始时初始化一计数器,每次在步骤111或121遇到“不是”回答时将计数器加1,并将计数器中的计数值与一预定门限相比较。如果在步骤125或127指示负响应,表示门限尚未被超出,则过程可重复,即执行步骤103—111或113—121再作识别尝试。如果在步骤125或127指示正响应,则自动语音识别已“失败”,呼叫者可在步骤126或128被连接到一人工话务员。
图1中所示的过程对用户产生相同的处理,即不管在步骤106和116完成的语音识别的置信度是多少,也不管与同一用户以前校验尝试相联系的历史细节如何,用户与系统间的对话是相同的。这种烦琐的、静态的方法被本发明消除了,本发明支持动态方法,它利用与在步骤106和116完成的语音识别相联系的置信度级来改变给予用户的处理。
特别地,现在参考图2和3,这里示出一流程图,说明了依据本发明安排的ASR系统中,为了响应用声音输入拨动电话号码的人而采取的步骤。在这个示范性过程中,执行了与上述相同的处理,即包括拨10位电话号码(3位区域号,后面7位本地电话号)的处理。该过程在步骤201开始,此时呼叫者被连接到执行与上述相同的功能的语音处理平台,而且提供与正在进行的识别相联系的置信度级的指示。置信度级确定的细节将在下面更详细地描述。下面一篇文章描述了产生与自动语音识别系统相连系的置信度测度的一种示范性技术。文章题目是“识别索引:词汇诊断的一种统计方法”,作者K.P.Avila等,发表在1987年10~11月“specch Technology”第四卷第1期第62—67页上。
在步骤203,用户由一可听通知提示,通过在步骤205说出了3位数字而输入电话呼叫的区域号。在步骤206,执行自动语音识别过程,并确定由呼叫者说出的数字。象以前一样,由ASR过程执行的译释典型地包括将用户输入语音与存贮的语音样本进行比较。然而,ASR系统还提供一置信度值,它是与识别相联系的置信度级的指示。如图2所示,在步骤231完成的置信度分析有两个输出,标为“很高置信度”和“中等置信度”。如下面结合图5所说明的那样,可以使用多于两个的置信度级,并且各级的定义可以不同。
如果在步骤231确定的置信度级是“中等置信度”,过程以与上面所描述相同的方式继续。特别地,系统在步骤207请求呼叫者显式校验被识别的数字确实与在步骤205用户说出的数字相同。用户则在步骤208回答“是”或“不是”,系统则依据该回答在分支步骤211采取不同的行动。特别地,如果在步骤208接收的回答为“是”,表示头三位数字被正确识别,则过程继续前进至步骤213,用户被提示输入电话号码的其余七位。用户在步骤215说出这七位数字,在步骤216,如同在步骤206那样再次利用ASR过程,确定由呼叫者说出的数字。然而,如同在步骤231,ASR系统提供与识别相联系的置信度级的指示。如图3所示。在步骤233完成的置信度分析可有两个输出,标为“很高置信度”或“中等置信度”。如果步骤233的输出代表“中等置信度”,则请求呼叫者在步骤217以显式校验被识别的数字与在步骤215说出的数字相同。如果在步骤218说出“是”,则在分支步骤221识别出正响应,系统继续在步骤223利用所有十位被识别数字,完成这一处理。
在与图1中所用方法相似的方法中,注意如果在步骤208或218从呼叫者接收到页响应,该响应会使得支枝步骤211或221分别转移控制到步骤225或227,在这里确定是否已进行了太多次失败的尝试。如果在步骤225或227指示负响应,表示门限尚未被超过,则过程可被重复,即执行步骤203—211或213—221来再次进行识别尝试。如果在步骤225或227指示正响应,则自动语音识别已“失败”,呼叫者可在步骤226或228被连接到一人工话务员。
如果在步骤231或233完成的置信度分析指示识别具有“很高置信度”,则对用户给予不同的处理。特别地,如果头三位以很高的置信度识别,则略过步骤207,208和211,从而对在语音识别中关于头三位作出的判决不进行显式校验,然后,如果接下来的七位也是以很高置信度识别,则步骤217,218和221被略过,从而对在语音识别中关于后七位作出的判决不进行显式校验。因此,可以看出图2和3所示的过程是自适应的,它在用户和系统间产生不同的对话,该对话依赖于在步骤206和216完成的语音识别的置信度级。
如图4所示,一典型的语音处理单元301可设置用于电信网络的范围内,如1990年5月1日颁发给A.N.Daudelin的美国专利4922529中的图1所示(这里收入作为参考)。语音处理单元301包括通信接口311,通过中继线315将其连接到其它的系统部件。接口311和中继续315可以支持多路同时双向会话,从而在任一给定时间可以处理多个呼叫。语音处理单元301中执行的过程由中央处理单元(CPU)303控制,而它又在存贮器(例如数据库309)含有的存贮程序的控制下工作。语音处理单元301所提供的功能度包括(á)利用语音发生器307向用户播放通知的能力,以及(b)利用ASR模块305译释接收的用户发音的能力。本自语音发生器307的通知的排序和在ASR模块305中完成的识别操作一起组成了用户接口,它依据本发明动态受控。语音处理单元的元件互相连接,并通过公共总线313与通信接口311互连。
如上所述,来自ASR模块305的输出包括:接收的用户发音的译释,以及译释中置信度的指示,后一信息可被CPU 303得到,从而用户接口过程可以根据置信度级动态调整。
语音处理单元301可利用AT&T的Conversant MAP 100VoiceResponso Unit实现,它与语音识别包成套装配在一起,而存贮在数据库309中的控制软件可利用交互工具(称为Script Builder)来产生。然而,要注意图4的语音处理单元301的特别设置仅仅作为示例性说明之用,而其它方法,例如在Daudelin专利中引用的文献里描述的方法,对于熟练的技术人员是显而易见的。特别地,应该理解:虽然结合图1,2和3描述的过程涉及进行电话呼叫范围内语音识别的应用,语音识别也可用于某“局部”过程,例如当用户与计算机或其它设备交互作用的时候。洗碗机或个人计算机可以通过在设备中加入自动语音识别单元而响应口头命令。依据本发明,计算机可以设置成响应口头发出的“格式化”命令的识别,而将磁盘格式化。由于格式化是一次可能引起数据丢失的重要操作,只有当该命令的非常高的置信度识别时,该命令才被执行。如果置信度级是中等,可以请求用户说“是”或重复该命令来显式校验该命令。如果置信度级是低的,可能需要用户在健盘上打出该命令。在这种局部情况下,通信接口311可被连接到一语音输入装置(如麦克风)以及输出装置(如扬声器或显示板)。
现在参考图5,说明采用不同用户接口过程的本发明的另一实施例。在该实施例中,用户在步骤400被提示语音输入,ASR模块305在步骤401译释用户发音之后,在步骤403确定译释的置信度,并依据三个可能的级别来评价置信度,然后与用户可能发生三种不同的相互作用。首先,如果译释正确的可能性较大,则在步骤405达到一正结果,ASR译释不经显式校验,在步骤407被接受,而忽略有错的可能性。处理则在步骤409完成。第二,对于中级不确定性,在步骤411达到一正结果,因此用户需要在步骤413显式校验(或反校验)结果,因为这可能比强迫用户重新输入信息(用声音或其它)更为有利。如果结果被验证,则在步骤415产生一正结果,处理在步骤409完成。如果结果未被验证,则在步骤41 5产生一负结果,只要没有发生太多失败的尝试,如步骤417确定的那样,用户就需要重复该过程(从步骤400开始)。第三,不确定性很大,和/或误译释的后果很严重,则步骤405和411的结果均为负。该条件作为“译释失败”处理,而用户需要“再试一次”,而不进行(可能的)错误结果的显式校验。只要用户尚未失败太多次,如在步骤417指示的那样,就可通过重复在步骤400开始的过程来实现。如果失败太多,则图5的过程在步骤419结束,因此用户(在电话呼叫的范围之内)可被连接到一人工话务员。
图1和3的步骤231和233中完成的置信度分析以及图5的步骤405和411中完成的置信度分析,可以这样完成:为每一发音数字对于每一已经训练的数字模型指定近似记分,大的分数表示好的对应,小的分数表示差的对应。这种方法为每一说出的数字产生了一置信度值向量,它表示了发音与每一模型的近似程度。我们已观查到,具有最大近似的选择更有可能是正确选择。这是在当次最大近似的置信度值的大小比它小很多的时候。因此,利用这两个近似分数之差的函数来确定其发音的“最佳”译释选择确实是“正确”的选择的置信度级。置信度级的确定可以用很多方法来完成,所有方法都利用来自ASR系统的特定数据将可能正确的发音与正确可能性较小的发音区分开来。从这个观点看。一特定的误差率可看作由这样一个域导出,它包括x%的有<a%误差的数目(可看作不太容易出错)和y%的有>b%和<c%误差的数目(一个更易出错的集合),以及z%所有>c%误差的数目(一个被认为不可能正确的集合)。可以利用以ASR系统和已知语音样本作的实验来确定哪些特定值用作x,y,z和a,b,以及c。
这里还应注意到,语音识别工作的两个可能输出的相对“近似”可以用不同方式来表示。可以利用分数的比率或线性差,或者利用一些更复杂的函数。最佳“近似”的具体确定依赖于所使用的具体模型的性质以及计算相似测度的算法,还可能涉及到其它变量。
依据本发明,历史细节,如与同一用户以前的校验尝试相连系的成功测度,可以用来动态改变或调整ASR过程和ASR系统与用户相互作用的方式,这是因为ASR系统的所有用户并不都经历同样的成功级。也不都产生同样的置信度级。可以用符号“绵羊”和“山羊”来描述这一方案,即对于某些人(即“绵羊(sheep)”)工作得较好的ASR过程与对于其他人(即“山羊(goat)”)工作得较差的过程是不同的。很清楚,当ASR系统将显式校验措施引入用户接口时,它改进了对于山羊的系统性能,允许较少的误差发生。同时,对于所有用户,通过引入额外的相互作用,它降低了接口的质量,并且绵羊(其语音一般为系统所理解)对该措施的需求较小。
使用历史的“成功测度”能适应两种类型用户,因为“成功测度”能够允许可能是绵羊的用户和可能是山羊的用户之间的差异。当ASR处理应用于基于用户的服务时,(在一段时间内涉及同样的用户),确定或预测哪一个为“ASR绵羊”是可能的。在这种服务中,对于某一给定用户,进行或不进行显式校验都很容易跟踪ASR系统返器一高置信度分数的频度和/或一特别用户成功的频度。一贯接收高置信度分数和/或一贯成功的用户,“被假定为绵羊”。对于这些用户,即使在某些情况下置信度级不是“很高”,校验措施也可省去。的确,对于那些ASR系统历史上工作很好的人,中等置信度级就可以使过程跳过显式校验,并省去图2和3中的步骤207,208和211和/或步骤217,218和221,省去图4中的步骤413和415。对于具有大成功测度的用户,只有当步骤231或233中的结果产生“低”置信度级,或当步骤405和411的结果均为负时,才执行那些步骤。注意在某些不能获得历史信息的实现中,例如当一新用户利用声音命令操作计算机时,比较历史的用户发音与ASR识别,以及跟踪识别成功的频度是行不通的。
区分各种类型用户所需的历史信息可以存贮在图4的数据库309中,并可以被检存以响应个人访问语音处理单元301。例如,可以利用自动号码识别(ANI)信息来识别用户,当电话呼叫从起始交换机服务的一电话站产生时,该信息被送给该起始交换机。或者,可以利用个人识别号码(PIN)来识别用户,该号码由用户作为ASR过程的一部分给出。在上述两种情况下,ANI或PIN被用作一检索关键词来确定数据库中的信息,指示是否该特定用户是要改变过程的用户,以及,如果是,如何改变。本质上,系统可以这样确定用户是绵羊还是山羊。
下面的试验对本发明进行了模拟,它的10位电话号码有两部分组成,3位区域号和7位当地号,利用AT&TConversant系统上的自动语音识别。在这个实验中,利用数字串侯选者的置信度测度来改进用户接口,从而当第一数字串候选者深到比第二数字串侯选者高得多的置信度分数时,不进行显式校验。特别地,AT&T Coversant系统为多达四个可能的数字串侯选者的每一个指定一在1和1,000,000之间的置信度值。具有最高置信度值的侯选者称为“第一侯选者”;具有次高置信度值的侯选者称为“第二侯选者”;依此类推。系统计算第一和第二侯选者的置信度值之差,从而确定ASR结果的置信度级,然后利用该差别,依据哪些显式较验提示是否实行,以及过程中哪些步骤省略来调整整个过程。如果1号侯选者和2号侯选者之间的差别大于6000,则假定置信度很高,足以改变过程并略过显式校验步骤。在那些置信度分数差小于6000的处理中,则有下面类型的对话,其中S代表系统提高,U代表用户输入:
S:现在请说出您想呼叫的区域号。
U:9U8
S:您是说9,0,8吗?
U:是
S:现在请说出您想呼叫的7位电话号码。
U:9496510
S:您是说9,4,9,6,5,1,0吗?
U:是
S:谢谢!
另一方面,如果置信度分数差大于6000,则有下面类型的对话:
S:现在请说出您想呼叫的区域号。
U:908
S:现在请说出您想呼叫的7位电话号码。
U:9496510
S:谢谢!
ASR性能和收集的择优数据表明,动态利用置信度分数来调整校验过程的用户接口优于常规的用户接口。完成电话号码处理的平均时间减少约25%;用户偏爱使用置信度记分的系统;且“错号”呼叫的百分比没有增加。对于其它根据置信度记分的过程调整,也会观查到相似的结果。
关于在处理ASR采样中确定用户接口时利用历史数据作为成功测度,问题可分为两组。一组,侧定的绵羊;被定义为那些识别器在至少60%的处理中(用户进行多达32次ASR尝试)具有高置信度的用户。另一组,侧定的山羊,是剩余的用户。对于每一用户组,将总ASR准确度与那些识别器有“高置信度”(定义为置信度差的分数>6000)处理的准确度相比较。发现总的ASR性能表明成功率为83.8%,然而,如果仅考虑那些ASR置信度高的处理,成功率为97.5%,这表明在这些情况下,不象以前注意到的那样需要用户证实结果。然而,也可以认为识别器的准确度仅是对于“高置信度处理”期间的ASR假定的绵羊。数据表明,对于这些用户,ASR系统达到极高的性能,407次尝试中406次成功,准确率为99.8%。
简言之,这些实验表明对于一些用户,识别器常常具有高置信度。对于这些个人,当置信度高时,识别器实际上总是正确的。在那些假定绵羊可被识别的情况下,可以定义最佳ASR用户接口为能够与人工话务员讲话一样快或比其更快完成处理的用户接口。这可能需要根据识别器置信度分数和/或用户表明的ASR选择或系统使用历史来进行实时呼叫流程判决。总的关键在于,用户接口应当识别山羊和绵羊的不同需求。现行大多数系统都只为山羊最优化,而本系统可对于绵羊和山羊的呼叫流程都进行最优化。
那些本领域的普通技术人员可对本发明进行各种更改。相应地,本发明仅由所附权利要求书所限。
Claims (21)
1.在接受语音输入与执行自动语音识别(ASR)的系统中调节以适应用户接口的系统,包括接收发音的装置;
利用ASR处理上述发音的装置,以产生上述发音的译释并确定上述译释的置信度级;以及以上述置信度级的函数有选择地调节以适应由用户请求的上述译释的校验的装置。
2.根据权利要求1中确定的系统,其中设置所述处理装置以决定上述发音的至少第一和第二译释,上述译释具有各自相联系的第一和第二置信度值,以及
其中上述置信度级确定为上述第一和第二置信度值的相对大小的函数。
3.根据权利要求1中确定的系统,其中所述系统进一步包括:
为上述系统的每一用户存贮信息的装置,该信息代表了以上述系统以前使用的函数计算的成功测度,以及
从上述存贮装置中检索信息和按上述成功测度值的函数调节适应上述用户接口的装置。
4.根据权利要求3中确定的系统,其中所述成功测度包括上述系统的上述每个用户的以前成功率。
5.根据权利要求3中确定的系统,其中上述成功测度包括与上述每一用户的ASR译释相联系的以前置信度值。
6.根据权利要求3中确定的系统,其中上述系统将上述成功测度与一和用户相关的门限相比较。
7.根据权利要求1中确定的系统,其中上述最后说明的装置按上述译释中误差结果的函数调节适应上述校验。
8.自动语音识别系统包括:
产生用户发音的至少第一和第二译释以及上述译释的各自第一和第二置信度值的装置,以及
用来响应上述第一和第二置信度值的相对大力进行操作的装置,以提示上述用户在接受上述第一译释为上述发音的精确表示之前。校验上述第一译释。
9.权利要求8中确定的系统,其中上述系统进一步包括:用包含上述第一译释的信息提示上述用户的装置。
10.自动语音识别系统包括
产生用户发音的译释和上述译释的置信度值的装置,以及
用来响应上述置信度值的大小进行操作的用户接口装置,用于(a)请求上述用户在接受上述译释为上述发音的精确表示之前校验上述译释,或者(b)不经校验就接受上述译释为上述发音的精确表示。
11.根据权利要求10中确定的系统,其中上述系统进一步包括,存贮信息的装置,该信息指示了上述系统在译释上述用户的发音中以前的成功,以及
响应上述存贮信息的装置,该信息用来控制上述用户接口装置。
12.在接受语音输入和执行自动语言识别(ASR)的系统中,适应用户接口的一种方法,包括下列步骤:
接收一发音;
利用ASR处理上述发音,以产生上述发音的译释,并确定上述译释的置信度级;以及
按上述置信度级的函数。有选择地适应由用户请求的上述译释的校验。
13.根据权利要求12中确定的方法。其中上述处理步骤包括:确定上述发音的至少第一和第二译释,上述译释具有各自相联系的第一和第二置信度值,以及
确定置信度级为上述第一和第二置信度值的函数。
14.根据权利要求12中确定的方法进一步包括:
为上述系统的每一用户存贮信息,该信息代表以上述系统以前使用的函数计算的成功测度,以及
检索信息并依据上述成功测度值的函数改变用户接口。
15.根据权利要求14中确定的方法,其中所述成功测度包括上述方法的上述每一用户以前的成功率。
16.根据权利要求14中确定的方法,其中此成功测度包括与上述每一用户的ASR译释相联系的以前的置信度值。
17.根据权利要求14中确定的方法。其中所述方法进一步包括将上述成功测度与一和用户相关的门限比较。
18.自动语音识别的一种方法包括下列步骤:
产生用户发音的至少第一和第二译释,以及上述译释的各自的第一和第二置信度值,以及
响应上述第一和第二置信度值的相对值,提示上述用户在接受上述第一译释为上述发音的精确表示之前校验上述第一译释。
19.根据权利要求18中确定的方法。其中上述方法进一步包括:用包含上述第一译释的信息提示上述用户。
20.执行自动语音识别系统的一种方法包括下列步骤:
产生用户发音的译释和上述译释的置信度值,以及
适应用户接口的工作,以响应上述置信度值的大小,这是通过(a)请求上述用户在接受上述译释为上述发音的精确表示之前校验上述译释,(b)不经校验,接受上述译释为上述发音的精确表示,或者(c)拒绝上述译释,并请求上述用户提供一新的发音。
21.根据权利要求20中确定的方法,其中上述方法进一步包括以下步骤:存贮信息,该信息表示上述系统在译释上述用户的发音中以前的成功,以及
适应上述用户接口以响应上述存贮的信息。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US144,065 | 1993-10-27 | ||
| US08/144,065 US5566272A (en) | 1993-10-27 | 1993-10-27 | Automatic speech recognition (ASR) processing using confidence measures |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| CN1115902A true CN1115902A (zh) | 1996-01-31 |
Family
ID=22506897
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN94117734A Pending CN1115902A (zh) | 1993-10-27 | 1994-10-26 | 利用置信度测度的自动语音识别(asr)处理 |
Country Status (5)
| Country | Link |
|---|---|
| US (1) | US5566272A (zh) |
| EP (1) | EP0651372A3 (zh) |
| JP (1) | JPH07181994A (zh) |
| CN (1) | CN1115902A (zh) |
| CA (1) | CA2131600C (zh) |
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN1783213B (zh) * | 2004-12-01 | 2010-06-09 | 纽昂斯通讯公司 | 用于自动语音识别的方法和装置 |
| CN1902682B (zh) * | 2003-07-31 | 2013-06-19 | 摩托罗拉解决方案公司 | 口语系统 |
| CN104282305A (zh) * | 2013-07-12 | 2015-01-14 | 通用汽车环球科技运作有限责任公司 | 语音对话系统中用于结果仲裁的系统和方法 |
| CN109889676A (zh) * | 2017-12-06 | 2019-06-14 | 通用汽车环球科技运作有限责任公司 | 顾问无缝连接 |
| CN110637339A (zh) * | 2017-05-15 | 2019-12-31 | 苹果公司 | 使用隐式反馈优化数字助理的对话策略决策 |
| CN114242052A (zh) * | 2021-12-14 | 2022-03-25 | 山东远联信息科技有限公司 | 一种智能电话外呼方法和装置 |
| CN116888663A (zh) * | 2020-12-08 | 2023-10-13 | 谷歌有限责任公司 | 基于部分假设的流式动作实施 |
Families Citing this family (135)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7053752B2 (en) | 1996-08-06 | 2006-05-30 | Intuitive Surgical | General purpose distributed operating room control system |
| US6646541B1 (en) | 1996-06-24 | 2003-11-11 | Computer Motion, Inc. | General purpose distributed operating room control system |
| US6463361B1 (en) | 1994-09-22 | 2002-10-08 | Computer Motion, Inc. | Speech interface for an automated endoscopic system |
| US5828997A (en) * | 1995-06-07 | 1998-10-27 | Sensimetrics Corporation | Content analyzer mixing inverse-direction-probability-weighted noise to input signal |
| US6496099B2 (en) * | 1996-06-24 | 2002-12-17 | Computer Motion, Inc. | General purpose distributed operating room control system |
| US6911916B1 (en) | 1996-06-24 | 2005-06-28 | The Cleveland Clinic Foundation | Method and apparatus for accessing medical data over a network |
| US6642836B1 (en) | 1996-08-06 | 2003-11-04 | Computer Motion, Inc. | General purpose distributed operating room control system |
| US6137863A (en) * | 1996-12-13 | 2000-10-24 | At&T Corp. | Statistical database correction of alphanumeric account numbers for speech recognition and touch-tone recognition |
| US6061654A (en) * | 1996-12-16 | 2000-05-09 | At&T Corp. | System and method of recognizing letters and numbers by either speech or touch tone recognition utilizing constrained confusion matrices |
| US6122613A (en) * | 1997-01-30 | 2000-09-19 | Dragon Systems, Inc. | Speech recognition using multiple recognizers (selectively) applied to the same input sample |
| US6094476A (en) * | 1997-03-24 | 2000-07-25 | Octel Communications Corporation | Speech-responsive voice messaging system and method |
| CA2292959A1 (en) | 1997-05-06 | 1998-11-12 | Speechworks International, Inc. | System and method for developing interactive speech applications |
| US6219453B1 (en) | 1997-08-11 | 2001-04-17 | At&T Corp. | Method and apparatus for performing an automatic correction of misrecognized words produced by an optical character recognition technique by using a Hidden Markov Model based algorithm |
| US6154579A (en) * | 1997-08-11 | 2000-11-28 | At&T Corp. | Confusion matrix based method and system for correcting misrecognized words appearing in documents generated by an optical character recognition technique |
| JPH1175044A (ja) * | 1997-08-27 | 1999-03-16 | Casio Comput Co Ltd | 画像中継伝送方法、音声中継伝送方法、画像中継伝送装置及び音声中継伝送装置 |
| US6603835B2 (en) | 1997-09-08 | 2003-08-05 | Ultratec, Inc. | System for text assisted telephony |
| FR2769118B1 (fr) * | 1997-09-29 | 1999-12-03 | Matra Communication | Procede de reconnaissance de parole |
| US6141661A (en) * | 1997-10-17 | 2000-10-31 | At&T Corp | Method and apparatus for performing a grammar-pruning operation |
| US6205428B1 (en) | 1997-11-20 | 2001-03-20 | At&T Corp. | Confusion set-base method and apparatus for pruning a predetermined arrangement of indexed identifiers |
| US6122612A (en) * | 1997-11-20 | 2000-09-19 | At&T Corp | Check-sum based method and apparatus for performing speech recognition |
| US6208965B1 (en) | 1997-11-20 | 2001-03-27 | At&T Corp. | Method and apparatus for performing a name acquisition based on speech recognition |
| US6205261B1 (en) | 1998-02-05 | 2001-03-20 | At&T Corp. | Confusion set based method and system for correcting misrecognized words appearing in documents generated by an optical character recognition technique |
| US6151572A (en) * | 1998-04-27 | 2000-11-21 | Motorola, Inc. | Automatic and attendant speech to text conversion in a selective call radio system and method |
| US7937260B1 (en) | 1998-06-15 | 2011-05-03 | At&T Intellectual Property Ii, L.P. | Concise dynamic grammars using N-best selection |
| US6400805B1 (en) | 1998-06-15 | 2002-06-04 | At&T Corp. | Statistical database correction of alphanumeric identifiers for speech recognition and touch-tone recognition |
| JP2002525664A (ja) * | 1998-09-11 | 2002-08-13 | コーニンクレッカ フィリップス エレクトロニクス エヌ ヴィ | 仮定の制限された組の確実性を評価することによってユーザ表現を認識する方法および装置におけるエラー復旧方法 |
| DE19842405A1 (de) * | 1998-09-16 | 2000-03-23 | Philips Corp Intellectual Pty | Spracherkennungsverfahren mit Konfidenzmaßbewertung |
| WO2000018100A2 (en) * | 1998-09-24 | 2000-03-30 | Crossmedia Networks Corporation | Interactive voice dialog application platform and methods for using the same |
| US7447626B2 (en) * | 1998-09-28 | 2008-11-04 | Udico Holdings | Method and apparatus for generating a language independent document abstract |
| US6571210B2 (en) * | 1998-11-13 | 2003-05-27 | Microsoft Corporation | Confidence measure system using a near-miss pattern |
| FI116991B (fi) | 1999-01-18 | 2006-04-28 | Nokia Corp | Menetelmä puheen tunnistamisessa, puheentunnistuslaite ja puheella ohjattava langaton viestin |
| US6574596B2 (en) * | 1999-02-08 | 2003-06-03 | Qualcomm Incorporated | Voice recognition rejection scheme |
| US6224383B1 (en) | 1999-03-25 | 2001-05-01 | Planetlingo, Inc. | Method and system for computer assisted natural language instruction with distracters |
| US6766295B1 (en) * | 1999-05-10 | 2004-07-20 | Nuance Communications | Adaptation of a speech recognition system across multiple remote sessions with a speaker |
| US7283964B1 (en) | 1999-05-21 | 2007-10-16 | Winbond Electronics Corporation | Method and apparatus for voice controlled devices with improved phrase storage, use, conversion, transfer, and recognition |
| US6584439B1 (en) | 1999-05-21 | 2003-06-24 | Winbond Electronics Corporation | Method and apparatus for controlling voice controlled devices |
| US6885990B1 (en) | 1999-05-31 | 2005-04-26 | Nippon Telegraph And Telephone Company | Speech recognition based on interactive information retrieval scheme using dialogue control to reduce user stress |
| JP3990075B2 (ja) * | 1999-06-30 | 2007-10-10 | 株式会社東芝 | 音声認識支援方法及び音声認識システム |
| WO2001025807A2 (en) | 1999-10-05 | 2001-04-12 | Seagate Technology Llc | Integrated on-board device and method for the protection of magn etoresistive heads from electrostatic discharge |
| US6539353B1 (en) | 1999-10-12 | 2003-03-25 | Microsoft Corporation | Confidence measures using sub-word-dependent weighting of sub-word confidence scores for robust speech recognition |
| US7941481B1 (en) | 1999-10-22 | 2011-05-10 | Tellme Networks, Inc. | Updating an electronic phonebook over electronic communication networks |
| US6807574B1 (en) | 1999-10-22 | 2004-10-19 | Tellme Networks, Inc. | Method and apparatus for content personalization over a telephone interface |
| EP1100242A3 (de) * | 1999-11-12 | 2004-10-13 | Siemens AG Österreich | Verfahren zur dialoggesteuerten Bedienung elektronischer Geräte |
| US6591239B1 (en) | 1999-12-09 | 2003-07-08 | Steris Inc. | Voice controlled surgical suite |
| US6856956B2 (en) * | 2000-07-20 | 2005-02-15 | Microsoft Corporation | Method and apparatus for generating and displaying N-best alternatives in a speech recognition system |
| WO2002009093A1 (en) * | 2000-07-20 | 2002-01-31 | Koninklijke Philips Electronics N.V. | Feedback of recognized command confidence level |
| JP3567864B2 (ja) * | 2000-07-21 | 2004-09-22 | 株式会社デンソー | 音声認識装置及び記録媒体 |
| US7143039B1 (en) | 2000-08-11 | 2006-11-28 | Tellme Networks, Inc. | Providing menu and other services for an information processing system using a telephone or other audio interface |
| US7308408B1 (en) | 2000-07-24 | 2007-12-11 | Microsoft Corporation | Providing services for an information processing system using an audio interface |
| JP4486235B2 (ja) * | 2000-08-31 | 2010-06-23 | パイオニア株式会社 | 音声認識装置 |
| US20020059072A1 (en) * | 2000-10-16 | 2002-05-16 | Nasreen Quibria | Method of and system for providing adaptive respondent training in a speech recognition application |
| US6941266B1 (en) * | 2000-11-15 | 2005-09-06 | At&T Corp. | Method and system for predicting problematic dialog situations in a task classification system |
| EP1207517B1 (en) * | 2000-11-16 | 2007-01-03 | Sony Deutschland GmbH | Method for recognizing speech |
| US6925154B2 (en) * | 2001-05-04 | 2005-08-02 | International Business Machines Corproation | Methods and apparatus for conversational name dialing systems |
| US7409349B2 (en) * | 2001-05-04 | 2008-08-05 | Microsoft Corporation | Servers for web enabled speech recognition |
| US7506022B2 (en) * | 2001-05-04 | 2009-03-17 | Microsoft.Corporation | Web enabled recognition architecture |
| US20020178182A1 (en) * | 2001-05-04 | 2002-11-28 | Kuansan Wang | Markup language extensions for web enabled recognition |
| US7610547B2 (en) * | 2001-05-04 | 2009-10-27 | Microsoft Corporation | Markup language extensions for web enabled recognition |
| EP1262954A1 (en) * | 2001-05-30 | 2002-12-04 | Telefonaktiebolaget L M Ericsson (Publ) | Method and apparatus for verbal entry of digits or commands |
| AUPR578801A0 (en) * | 2001-06-19 | 2001-07-12 | Syrinx Speech Systems Pty Limited | Language assisted recognition module |
| US8416925B2 (en) | 2005-06-29 | 2013-04-09 | Ultratec, Inc. | Device independent text captioned telephone service |
| US7711570B2 (en) | 2001-10-21 | 2010-05-04 | Microsoft Corporation | Application abstraction with dialog purpose |
| US8229753B2 (en) | 2001-10-21 | 2012-07-24 | Microsoft Corporation | Web server controls for web enabled recognition and/or audible prompting |
| DE60211197T2 (de) * | 2001-10-31 | 2007-05-03 | Koninklijke Philips Electronics N.V. | Verfahren und vorrichtung zur wandlung gesprochener in geschriebene texte und korrektur der erkannten texte |
| US6791529B2 (en) * | 2001-12-13 | 2004-09-14 | Koninklijke Philips Electronics N.V. | UI with graphics-assisted voice control system |
| US6772118B2 (en) * | 2002-01-04 | 2004-08-03 | General Motors Corporation | Automated speech recognition filter |
| US7003458B2 (en) * | 2002-01-15 | 2006-02-21 | General Motors Corporation | Automated voice pattern filter |
| US7218839B2 (en) * | 2002-02-11 | 2007-05-15 | Scientific-Atlanta, Inc. | Management of television presentation recordings |
| JP2003241790A (ja) * | 2002-02-13 | 2003-08-29 | Internatl Business Mach Corp <Ibm> | 音声コマンド処理システム、コンピュータ装置、音声コマンド処理方法およびプログラム |
| EP1377000B1 (en) * | 2002-06-11 | 2009-04-22 | Swisscom (Schweiz) AG | Method used in a speech-enabled automatic directory system |
| JP3726783B2 (ja) * | 2002-07-16 | 2005-12-14 | 株式会社デンソー | 音声認識装置 |
| US7243071B1 (en) | 2003-01-16 | 2007-07-10 | Comverse, Inc. | Speech-recognition grammar analysis |
| US7260535B2 (en) | 2003-04-28 | 2007-08-21 | Microsoft Corporation | Web server controls for web enabled recognition and/or audible prompting for call controls |
| US20040230637A1 (en) * | 2003-04-29 | 2004-11-18 | Microsoft Corporation | Application controls for speech enabled recognition |
| US6983244B2 (en) * | 2003-08-29 | 2006-01-03 | Matsushita Electric Industrial Co., Ltd. | Method and apparatus for improved speech recognition with supplementary information |
| DE10341305A1 (de) * | 2003-09-05 | 2005-03-31 | Daimlerchrysler Ag | Intelligente Nutzeradaption bei Dialogsystemen |
| US20050109052A1 (en) * | 2003-09-30 | 2005-05-26 | Albers Walter F. | Systems and methods for conditioning air and transferring heat and mass between airflows |
| US7552055B2 (en) * | 2004-01-10 | 2009-06-23 | Microsoft Corporation | Dialog component re-use in recognition systems |
| US8160883B2 (en) | 2004-01-10 | 2012-04-17 | Microsoft Corporation | Focus tracking in dialogs |
| US7899671B2 (en) * | 2004-02-05 | 2011-03-01 | Avaya, Inc. | Recognition results postprocessor for use in voice recognition systems |
| US8515024B2 (en) | 2010-01-13 | 2013-08-20 | Ultratec, Inc. | Captioned telephone service |
| US7895039B2 (en) * | 2005-02-04 | 2011-02-22 | Vocollect, Inc. | Methods and systems for optimizing model adaptation for a speech recognition system |
| US7865362B2 (en) * | 2005-02-04 | 2011-01-04 | Vocollect, Inc. | Method and system for considering information about an expected response when performing speech recognition |
| US8200495B2 (en) * | 2005-02-04 | 2012-06-12 | Vocollect, Inc. | Methods and systems for considering information about an expected response when performing speech recognition |
| US7949533B2 (en) * | 2005-02-04 | 2011-05-24 | Vococollect, Inc. | Methods and systems for assessing and improving the performance of a speech recognition system |
| US7827032B2 (en) * | 2005-02-04 | 2010-11-02 | Vocollect, Inc. | Methods and systems for adapting a model for a speech recognition system |
| EP1734509A1 (en) * | 2005-06-17 | 2006-12-20 | Harman Becker Automotive Systems GmbH | Method and system for speech recognition |
| US11258900B2 (en) | 2005-06-29 | 2022-02-22 | Ultratec, Inc. | Device independent text captioned telephone service |
| US7697827B2 (en) | 2005-10-17 | 2010-04-13 | Konicek Jeffrey C | User-friendlier interfaces for a camera |
| KR100717385B1 (ko) * | 2006-02-09 | 2007-05-11 | 삼성전자주식회사 | 인식 후보의 사전적 거리를 이용한 인식 신뢰도 측정 방법및 인식 신뢰도 측정 시스템 |
| JP2007256643A (ja) * | 2006-03-23 | 2007-10-04 | Denso Corp | 音声認識装置及びナビゲーションシステム |
| JP4887911B2 (ja) | 2006-05-31 | 2012-02-29 | 船井電機株式会社 | 電子機器 |
| CN101118745B (zh) * | 2006-08-04 | 2011-01-19 | 中国科学院声学研究所 | 语音识别系统中的置信度快速求取方法 |
| US8880402B2 (en) * | 2006-10-28 | 2014-11-04 | General Motors Llc | Automatically adapting user guidance in automated speech recognition |
| US8599704B2 (en) | 2007-01-23 | 2013-12-03 | Microsoft Corporation | Assessing gateway quality using audio systems |
| US8090077B2 (en) * | 2007-04-02 | 2012-01-03 | Microsoft Corporation | Testing acoustic echo cancellation and interference in VoIP telephones |
| US8180029B2 (en) | 2007-06-28 | 2012-05-15 | Voxer Ip Llc | Telecommunication and multimedia management method and apparatus |
| US8165877B2 (en) | 2007-08-03 | 2012-04-24 | Microsoft Corporation | Confidence measure generation for speech related searching |
| US20090098920A1 (en) * | 2007-10-10 | 2009-04-16 | Waterleaf Limited | Method and System for Auditing and Verifying User Spoken Instructions for an Electronic Casino Game |
| EP2081185B1 (en) | 2008-01-16 | 2014-11-26 | Nuance Communications, Inc. | Speech recognition on large lists using fragments |
| US8868424B1 (en) * | 2008-02-08 | 2014-10-21 | West Corporation | Interactive voice response data collection object framework, vertical benchmarking, and bootstrapping engine |
| EP2221806B1 (en) | 2009-02-19 | 2013-07-17 | Nuance Communications, Inc. | Speech recognition of a list entry |
| US8676581B2 (en) * | 2010-01-22 | 2014-03-18 | Microsoft Corporation | Speech recognition analysis via identification information |
| JP5533042B2 (ja) * | 2010-03-04 | 2014-06-25 | 富士通株式会社 | 音声検索装置、音声検索方法、プログラム及び記録媒体 |
| US9118669B2 (en) | 2010-09-30 | 2015-08-25 | Alcatel Lucent | Method and apparatus for voice signature authentication |
| US20120123807A1 (en) * | 2010-10-25 | 2012-05-17 | The Travelers Companies, Inc. | Systems, methods, and apparatus for enterprise billing and accounts receivable |
| US9396725B2 (en) | 2011-05-09 | 2016-07-19 | At&T Intellectual Property I, L.P. | System and method for optimizing speech recognition and natural language parameters with user feedback |
| US8738375B2 (en) | 2011-05-09 | 2014-05-27 | At&T Intellectual Property I, L.P. | System and method for optimizing speech recognition and natural language parameters with user feedback |
| US8914290B2 (en) | 2011-05-20 | 2014-12-16 | Vocollect, Inc. | Systems and methods for dynamically improving user intelligibility of synthesized speech in a work environment |
| TWI466101B (zh) * | 2012-05-18 | 2014-12-21 | Asustek Comp Inc | 語音識別方法及系統 |
| US9269349B2 (en) * | 2012-05-24 | 2016-02-23 | Nuance Communications, Inc. | Automatic methods to predict error rates and detect performance degradation |
| IN2013DE00428A (zh) * | 2013-02-14 | 2015-06-19 | Alcatel Lucent | |
| US9978395B2 (en) | 2013-03-15 | 2018-05-22 | Vocollect, Inc. | Method and system for mitigating delay in receiving audio stream during production of sound from audio stream |
| US9715878B2 (en) | 2013-07-12 | 2017-07-25 | GM Global Technology Operations LLC | Systems and methods for result arbitration in spoken dialog systems |
| US12482458B2 (en) | 2014-02-28 | 2025-11-25 | Ultratec, Inc. | Semiautomated relay method and apparatus |
| US10389876B2 (en) | 2014-02-28 | 2019-08-20 | Ultratec, Inc. | Semiautomated relay method and apparatus |
| US10878721B2 (en) | 2014-02-28 | 2020-12-29 | Ultratec, Inc. | Semiautomated relay method and apparatus |
| US20180034961A1 (en) | 2014-02-28 | 2018-02-01 | Ultratec, Inc. | Semiautomated Relay Method and Apparatus |
| US20180270350A1 (en) | 2014-02-28 | 2018-09-20 | Ultratec, Inc. | Semiautomated relay method and apparatus |
| US10147414B1 (en) | 2014-05-15 | 2018-12-04 | Namecoach, Inc | Link-based audio-recording, collection, collaboration, embedding and delivery system |
| US9418679B2 (en) * | 2014-08-12 | 2016-08-16 | Honeywell International Inc. | Methods and apparatus for interpreting received speech data using speech recognition |
| CN105551485B (zh) * | 2015-11-30 | 2020-04-21 | 讯飞智元信息科技有限公司 | 语音文件检索方法及系统 |
| US10714121B2 (en) | 2016-07-27 | 2020-07-14 | Vocollect, Inc. | Distinguishing user speech from background speech in speech-dense environments |
| EP3506256A4 (en) * | 2016-08-26 | 2019-08-21 | Sony Corporation | INFORMATION PROCESSING DEVICE AND INFORMATION PROCESSING METHOD |
| CN110603586B (zh) * | 2017-05-09 | 2020-09-22 | 苹果公司 | 用于校正识别错误的用户界面 |
| KR102338618B1 (ko) * | 2017-07-25 | 2021-12-10 | 삼성에스디에스 주식회사 | 휴먼 에이전트에 의하여 보조 되는 무인 대화 서비스 제공 방법 |
| US11138334B1 (en) | 2018-10-17 | 2021-10-05 | Medallia, Inc. | Use of ASR confidence to improve reliability of automatic audio redaction |
| CN109817210B (zh) * | 2019-02-12 | 2021-08-17 | 百度在线网络技术(北京)有限公司 | 语音写作方法、装置、终端和存储介质 |
| US12170082B1 (en) | 2019-03-31 | 2024-12-17 | Medallia, Inc. | On-the-fly transcription/redaction of voice-over-IP calls |
| US11398239B1 (en) | 2019-03-31 | 2022-07-26 | Medallia, Inc. | ASR-enhanced speech compression |
| US11107475B2 (en) | 2019-05-09 | 2021-08-31 | Rovi Guides, Inc. | Word correction using automatic speech recognition (ASR) incremental response |
| US11539900B2 (en) | 2020-02-21 | 2022-12-27 | Ultratec, Inc. | Caption modification and augmentation systems and methods for use by hearing assisted user |
| CN112003991A (zh) * | 2020-09-02 | 2020-11-27 | 深圳壹账通智能科技有限公司 | 一种外呼方法及相关设备 |
| KR102487323B1 (ko) * | 2021-01-14 | 2023-01-11 | 가톨릭대학교 산학협력단 | 하이브리드 기법을 적용한 소음하 숫자 기반 청력 검사 방법 및 청력 검사 장치 |
| DE112021008175T5 (de) * | 2021-11-30 | 2024-08-08 | Fanuc Corporation | Spracherkennungsvorrichtung und computerlesbares speichermedium |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4922519A (en) * | 1986-05-07 | 1990-05-01 | American Telephone And Telegraph Company | Automated operator assistance calls with voice processing |
| US4827500A (en) * | 1987-01-30 | 1989-05-02 | American Telephone And Telegraph Company, At&T Bell Laboratories | Automatic speech recognition to select among call destinations |
| US5033088A (en) * | 1988-06-06 | 1991-07-16 | Voice Processing Corp. | Method and apparatus for effectively receiving voice input to a voice recognition system |
| JP2964518B2 (ja) * | 1990-01-30 | 1999-10-18 | 日本電気株式会社 | 音声制御方式 |
| US5222146A (en) * | 1991-10-23 | 1993-06-22 | International Business Machines Corporation | Speech recognition apparatus having a speech coder outputting acoustic prototype ranks |
| US5305244B2 (en) * | 1992-04-06 | 1997-09-23 | Computer Products & Services I | Hands-free user-supported portable computer |
| US5297183A (en) * | 1992-04-13 | 1994-03-22 | Vcs Industries, Inc. | Speech recognition system for electronic switches in a cellular telephone or personal communication network |
-
1993
- 1993-10-27 US US08/144,065 patent/US5566272A/en not_active Expired - Lifetime
-
1994
- 1994-09-07 CA CA002131600A patent/CA2131600C/en not_active Expired - Fee Related
- 1994-10-19 EP EP94307658A patent/EP0651372A3/en not_active Withdrawn
- 1994-10-26 JP JP6284571A patent/JPH07181994A/ja active Pending
- 1994-10-26 CN CN94117734A patent/CN1115902A/zh active Pending
Cited By (11)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN1902682B (zh) * | 2003-07-31 | 2013-06-19 | 摩托罗拉解决方案公司 | 口语系统 |
| CN1783213B (zh) * | 2004-12-01 | 2010-06-09 | 纽昂斯通讯公司 | 用于自动语音识别的方法和装置 |
| US9502024B2 (en) | 2004-12-01 | 2016-11-22 | Nuance Communications, Inc. | Methods, apparatus and computer programs for automatic speech recognition |
| CN104282305A (zh) * | 2013-07-12 | 2015-01-14 | 通用汽车环球科技运作有限责任公司 | 语音对话系统中用于结果仲裁的系统和方法 |
| CN104282305B (zh) * | 2013-07-12 | 2018-04-24 | 通用汽车环球科技运作有限责任公司 | 语音对话系统中用于结果仲裁的系统和方法 |
| CN110637339A (zh) * | 2017-05-15 | 2019-12-31 | 苹果公司 | 使用隐式反馈优化数字助理的对话策略决策 |
| CN110637339B (zh) * | 2017-05-15 | 2023-05-09 | 苹果公司 | 使用隐式反馈优化数字助理的对话策略决策 |
| CN109889676A (zh) * | 2017-12-06 | 2019-06-14 | 通用汽车环球科技运作有限责任公司 | 顾问无缝连接 |
| CN116888663A (zh) * | 2020-12-08 | 2023-10-13 | 谷歌有限责任公司 | 基于部分假设的流式动作实施 |
| US11996101B2 (en) | 2020-12-08 | 2024-05-28 | Google Llc | Streaming action fulfillment based on partial hypotheses |
| CN114242052A (zh) * | 2021-12-14 | 2022-03-25 | 山东远联信息科技有限公司 | 一种智能电话外呼方法和装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| EP0651372A2 (en) | 1995-05-03 |
| US5566272A (en) | 1996-10-15 |
| EP0651372A3 (en) | 1997-06-04 |
| JPH07181994A (ja) | 1995-07-21 |
| CA2131600A1 (en) | 1995-04-28 |
| CA2131600C (en) | 1998-04-28 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN1115902A (zh) | 利用置信度测度的自动语音识别(asr)处理 | |
| USRE38101E1 (en) | Methods and apparatus for performing speaker independent recognition of commands in parallel with speaker dependent recognition of names, words or phrases | |
| US20020196911A1 (en) | Methods and apparatus for conversational name dialing systems | |
| US6377662B1 (en) | Speech-responsive voice messaging system and method | |
| US9754586B2 (en) | Methods and apparatus for use in speech recognition systems for identifying unknown words and for adding previously unknown words to vocabularies and grammars of speech recognition systems | |
| US4882757A (en) | Speech recognition system | |
| US6356868B1 (en) | Voiceprint identification system | |
| JP4173207B2 (ja) | 発声音に関する話者の検証を行うためのシステム及び方法 | |
| US7401017B2 (en) | Adaptive multi-pass speech recognition system | |
| US7502742B2 (en) | Method and system for voice recognition menu navigation | |
| EP0647344B1 (en) | Method for recognizing alphanumeric strings spoken over a telephone network | |
| CN1842842A (zh) | 一种根据辅助信息提高语音识别的方法和设备 | |
| CN1894946A (zh) | 自动电话菜单导航的方法和装置 | |
| JP2004518155A (ja) | マッピングを用いた自動音声認識のためのシステムおよび方法 | |
| CN1708783A (zh) | 用于语音识别的方法和系统 | |
| CN1639768B (zh) | 自动语音识别方法及装置 | |
| US20010049599A1 (en) | Tone and speech recognition in communications systems | |
| CN1613108A (zh) | 多人的网络可访问依赖于说话者的声音模型 | |
| JP4355035B2 (ja) | 音声認識データベースにアドレスを登録する方法とシステム | |
| Gao et al. | Innovative approaches for large vocabulary name recognition | |
| US20030023439A1 (en) | Method and apparatus for automatic recognition of long sequences of spoken digits | |
| EP1164576B1 (en) | Speaker authentication method and system from speech models | |
| JPH04242800A (ja) | 文法規則に基づいた照合値制約を用いた高性能音声認識方法並びに音声認識回路 | |
| US20050049858A1 (en) | Methods and systems for improving alphabetic speech recognition accuracy | |
| WO2024251169A1 (zh) | 语音识别方法、设备和存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| C06 | Publication | ||
| PB01 | Publication | ||
| C10 | Entry into substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| C01 | Deemed withdrawal of patent application (patent law 1993) | ||
| WD01 | Invention patent application deemed withdrawn after publication |