CN112653902A - 说话人识别方法、装置及电子设备 - Google Patents

说话人识别方法、装置及电子设备 Download PDF

Info

Publication number
CN112653902A
CN112653902A CN201910959899.2A CN201910959899A CN112653902A CN 112653902 A CN112653902 A CN 112653902A CN 201910959899 A CN201910959899 A CN 201910959899A CN 112653902 A CN112653902 A CN 112653902A
Authority
CN
China
Prior art keywords
speaker
file
content
speech
client
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
CN201910959899.2A
Other languages
English (en)
Other versions
CN112653902B (zh
Inventor
王全剑
黄鹏
李波
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Alibaba Group Holding Ltd
Original Assignee
Alibaba Group Holding Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Alibaba Group Holding Ltd filed Critical Alibaba Group Holding Ltd
Priority to CN201910959899.2A priority Critical patent/CN112653902B/zh
Publication of CN112653902A publication Critical patent/CN112653902A/zh
Application granted granted Critical
Publication of CN112653902B publication Critical patent/CN112653902B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/43Processing of content or additional data, e.g. demultiplexing additional data from a digital video stream; Elementary client operations, e.g. monitoring of home network or synchronising decoder's clock; Client middleware
    • H04N21/44Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs
    • H04N21/44008Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs involving operations for analysing video streams, e.g. detecting features or characteristics in the video stream
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/233Processing of audio elementary streams
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/20Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
    • H04N21/23Processing of content or additional data; Elementary server operations; Server middleware
    • H04N21/234Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs
    • H04N21/23418Processing of video elementary streams, e.g. splicing of video streams or manipulating encoded video stream scene graphs involving operations for analysing video streams, e.g. detecting features or characteristics
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/43Processing of content or additional data, e.g. demultiplexing additional data from a digital video stream; Elementary client operations, e.g. monitoring of home network or synchronising decoder's clock; Client middleware
    • H04N21/439Processing of audio elementary streams
    • H04N21/4394Processing of audio elementary streams involving operations for analysing the audio stream, e.g. detecting features or characteristics in audio streams
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/80Generation or processing of content or additional data by content creator independently of the distribution process; Content per se
    • H04N21/81Monomedia components thereof
    • H04N21/8106Monomedia components thereof involving special audio data, e.g. different tracks for different languages

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)

Abstract

本申请实施例公开了说话人识别方法、装置及电子设备。所述方法包括:从待识别的视频文件中分离获得音频文件以及图像文件;对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。如此方案,有助于提高说话人识别的准确度。

Description

说话人识别方法、装置及电子设备
技术领域
本申请涉及语音识别技术领域,特别是涉及说话人识别方法、装置及电子设备,视频处理方法、装置及电子设备。
背景技术
声纹识别,也称为说话人识别,可以通过计算机语音处理技术,对语音信号进行分析处理,确定说话人身份。
对于直播、会议等可能涉及多个说话人的场景来说,进行说话人识别时,不仅需要识别出语音信号中包含哪些人,还需要确定出每个人对应的具体语音段有哪些。以用户A与用户B之间的对话语音为例,可以先进行语音分割,找到不同说话人之间的语音跳变点,将整个对话语音分割为若干语音段,并标注好每个语音段对应的起止时间以及说话人id,然后再进行说话人聚类,将对应同一个说话人id的语音段合并在一起。
理想状态下,以上对话语音经过处理,可以获得两个类别:一个类别对应用户A的id1,包括用户A在对话过程中说的所有语音段;另一个类别对应用户B的id2,包括用户B在对话过程中说的所有语音段。
但在实际应用过程中,受周围环境噪声的影响,很可能在语音分割时,出现分割错误。例如,将用户A对应的一个语音段,拆分成两个子语音段,且对应的说话人id分别被标注为id1以及id2,这就导致说话人聚类时,被标注为id2的子语音段要合并到用户B对应的类别中。虽然说话人身份识别正确,但合并出的语音段却出现错误。
或者,上述被拆分出的两个子语音段,对应的说话人id可能被识别为id1以及id3,如此识别后,不仅合并出的语音段有误,还导致说话人身份识别出错,将原本只有两个用户对话的语音识别为三个用户。
如何提高说话人识别准确度,特别是在多人参与的有声语言交流活动,例如多人演讲场景下,存在背景音乐、掌声等强噪声干扰时,如何提高说话人识别的准确度成为技术人员要解决的技术问题。
发明内容
本申请提供了一种说话人识别方法、装置及电子设备,可以基于声纹特征以及人脸特征进行说话人识别,有助于提高识别准确度。
本申请提供了如下方案:
一种说话人识别方法,包括:
从待识别的视频文件中分离获得音频文件以及图像文件;
对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
一种视频文件处理方法,包括:
服务端获得有声语言交流活动产生的视频文件;
根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
建立所述说话人与对应的说话内容之间的关联关系。
一种视频文件处理方法,包括:
客户端接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
将所述看点文件推送给所述客户端关联的用户。
一种说话人识别装置,包括:
文件分离单元,用于从待识别的视频文件中分离获得音频文件以及图像文件;
语音分割单元,用于对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息;
人脸识别单元,用于对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对齐处理单元,用于对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
一种视频文件处理装置,应用于服务端,包括:
视频文件获得单元,用于获得有声语言交流活动产生的视频文件;
说话人识别单元,用于根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
说话内容获得单元,用于对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
关联关系建立单元,用于建立所述说话人与对应的说话内容之间的关联关系。
一种视频文件处理装置,应用于客户端,包括:
看点文件接收单元,用于接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
看点文件推送单元,用于将所述看点文件推送给所述客户端关联的用户。
一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
从待识别的视频文件中分离获得音频文件以及图像文件;
对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
获得有声语言交流活动产生的视频文件;
根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
建立所述说话人与对应的说话内容之间的关联关系。
一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
将所述看点文件推送给客户端关联的用户。
根据本申请提供的具体实施例,本申请公开了以下技术效果:
本申请实施例,可以对视频文件进行声音图像分离,并对分离出的音频文件进行语音分割,获得至少一个语音段,以及每个语音段各自对应的起止时间信息以及说话人标识信息;同时,还可以对分离出的图像文件进行人脸识别,获得不同时间对应的人脸识别结果。然后再对声纹特征以及人脸特征进行对齐处理,获得说话人聚类结果,即,确定至少一个语音段对应的说话人。其中,对齐处理可以是基于语音段对应的起止时间,确定该起止时间对应的人脸识别结果是否可以对应到同一个说话人;或者,对齐处理可以是基于人脸识别结果,确定相邻语音段是否可以对应到同一个说话人。如此基于用户的声纹特征以及人脸特征,实现的说话人身份识别,有助于解决现有技术识别准确度低的问题。
当然,实施本申请的任一产品并不一定需要同时达到以上所述的所有优点。
附图说明
为了更清楚地说明本申请实施例或现有技术中的技术方案,下面将对实施例中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本申请的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。
图1是本申请实施例提供的系统的示意图;
图2是本申请实施例提供的第一种方法的流程图;
图3是本申请实施例提供的第一种交流文本的示意图;
图4是本申请实施例提供的第二种交流文本的示意图;
图5是本申请实施例提供的第二种方法的流程图;
图6是本申请实施例提供的第三种方法的流程图;
图7是本申请实施例提供的第四种方法的流程图;
图8是本申请实施例提供的第一种装置的示意图;
图9是本申请实施例提供的第二种装置的示意图;
图10是本申请实施例提供的第三种装置的示意图;
图11是本申请实施例提供的计算机系统的架构的示意图;
图12是本申请实施例提供的电子设备的架构的示意图。
具体实施方式
下面将结合本申请实施例中的附图,对本申请实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本申请一部分实施例,而不是全部的实施例。基于本申请中的实施例,本领域普通技术人员所获得的所有其他实施例,都属于本申请保护的范围。
实施例1
为了解决多人说话场景下,受环境噪声等因素的影响,导致说话人识别准确性低的问题,本申请实施例提供一种基于声纹特征以及人脸特征进行说话人识别的工具。下面结合具体示例,对识别过程进行解释说明。
本申请实施例涉及的识别对象主要是包括音频以及图像的视频文件。获得待识别的视频文件后,可以先进行声音图像分离,将视频文件拆分成可提取声纹特征的音频文件,以及可提取人脸特征的图像文件。例如,可以通过多媒体视频处理工具FFmpeg(FastForward Mpeg)从视频文件中分离出音频文件以及图像文件。
对于音频文件来说,可以通过声纹跟踪技术进行语音分割,找到不同说话人之间的语音跳变点,将音频文件分割为多个语音段,并标注好每个语音段对应的起止时间以及说话人标识信息。例如,视频文件1的时间长度为10分钟,对从视频文件1中分离出的音频文件进行语音分割后,可以获得表1所示语音段的相关信息。
表1
语音段的标识信息 起止时间信息(单位:s) 说话人标识信息
语音段1 0~11 id1
语音段2 12~550 id2
语音段3 551~600 id1
对于图像文件来说,可以对其包括的图像帧进行人脸识别,通过人脸特征确定图像文件包括哪些说话人。作为一种示例,可以按照预设时间间隔,从图像文件中抽取图像帧,并通过人脸识别技术确定各图像帧对应的说话人的身份信息。例如,针对从视频文件1中分离出的图像文件,采用按秒抽帧的方式,可以获得下表2所示的人脸识别结果信息。
表2
时间信息(单位:s) 说话人身份信息
1 用户1
2 用户1
…… ……
12 用户2
13 用户2
14 用户1
…… ……
600 用户2
其中,说话人身份信息可以是在人脸识别过程中自定义的编号。例如,根据第1秒对应的图像帧进行人脸识别,确定的用户可以定义为用户1,如果在对第2~11秒对应的图像帧进行人脸识别的过程中,识别结果表示对应同一用户1,则继续使用相同的编号定义该用户;如果对第12秒对应的图像帧进行人脸识别时,确定该人脸特征对应的用户为一名新的用户,则可将该新的用户定义为用户2。以此类推,为图像文件中出现的用户定义对应的编号。
或者,可以预先创建说话人信息库,通过信息库保存至少一个说话人的身份信息(例如,身份信息可以体现为说话人的姓名等)与人脸特征信息之间的关联关系。这样,对图像帧进行人脸识别,提取到对应的人脸特征信息后,可以查询信息库,确定该人脸特征信息对应的说话人的身份信息。
按照上文所做介绍,获得表1以及表2的识别结果后,可以对声纹特征以及人脸特征进行对齐处理,获得说话人聚类结果。
下面结合具体示例,对特征对齐过程进行举例说明。
一种方式下,可以根据语音段对应的起止时间信息,获得该起止时间对应的目标人脸识别结果,确定目标人脸识别结果是否对应同一个说话人。
具体地,如果目标人脸识别结果对应一名目标用户,即,声纹特征以及人脸特征在该起止时间内是保持对齐的,则可直接建立语音段以及目标用户之间的关联关系。
以表1所示语音段1为例,对应的起止时间为0~11s,且由表2可知,该起止时间对应的人脸识别的说话人身份信息均为用户1,即,目标人脸识别结果仅对应一名目标用户。此时,可以确定语音段1为用户1说话过程中产生的音频,可以建立语音段1与用户1之间的关联关系。
具体地,如果目标人脸识别结果对应至少两名用户,则可从中确定一名目标用户,即,对目标人脸识别结果进行合并处理,将至少两名用户合并为一名目标用户,实现声纹特征以及人脸特征在该起止时间内的对齐,然后再对语音段以及目标用户进行关联。
以表1所示语音段2为例,对应的起止时间为12~550s,且由表2可知,该起止时间对应的人脸识别的说话人身份信息包括用户1以及用户2,即,目标人脸识别结果对应两名目标用户。出现这种情况的原因,可能是在某个用户说话期间,镜头切换拍摄到另一个用户,即,说话人通常是两名用户中的一位,故可从中确定一名目标用户,建立目标用户与语音段之间的关联关系。例如,可以将起止时间内出现次数最多的用户,确定为目标用户。
上述示例中,如果在12~550s对应的图像帧中,识别为用户1的图像帧的占比明显少于识别为用户2的图像帧,则可将用户2确定为目标用户。即,可以确定语音段2为用户2说话过程中产生的音频,可以建立语音段2与用户2之间的关联关系。
在另一种方式下,可以根据人脸识别结果,确定相邻语音段是否对应同一个说话人。
具体地,可以根据相邻语音段各自对应的起止时间信息,确定进行对齐处理的目标起止时间;获得目标起止时间对应的目标人脸识别结果;如果目标人脸识别结果对应一名目标用户,则可确定该相邻语音段对应同一说话人,可以对该相邻语音段以及目标用户进行关联。
以表1所示语音段3为例,对应的起止时间为551~600s,如果通过表2确定该起止时间对应的说话人身份信息为用户2,(可能起止时间对应的人脸识别结果仅包括用户2;或者,也可能包括多名用户,但用户2出现的次数最多),即,对于相邻的语音段2与语音段3来说,虽然二者在音频识别时对应不同的用户id,但在图像识别时却对应相同的用户身份。出现这种情况的原因,可能是受环境噪声的影响,在语音分割时将同一用户的声音分割到多个id,针对于此,可以将相邻语音段对应到图像识别出的说话人,实现声纹特征以及人脸特征在目标起止时间内的对齐。也就是说,可以确定语音段2以及语音段3均为用户2说话过程中产生的音频,可以建立语音段2以及语音段3与用户2之间的关联关系。
通过以上对齐处理,可以获得下表3所示说话人聚类结果。
表3
Figure BDA0002228568570000101
需要说明的是,对于同一说话人关联至少两个语音段的情况来说,作为一种示例,可以如表3所示,建立该说话人与对应的至少两个语音段之间的关联关系;或者,可以对至少两个语音段进行合并处理,再建立说话人与合并后的语音段之间的关联关系。
如此基于用户的声纹特征以及人脸特征,实现的说话人身份识别,有助于解决现有技术识别准确度低的问题。
可以理解地,本申请实施例可以基于完整的视频文件进行说话人识别,如上文所举示例,可对0~600s的音频文件以及图像文件进行分析处理;或者,可以基于用户感兴趣的部分视频文件进行说话人识别,例如,截取第12~600s对应的视频文件,进行声音图像分离后,按照上文介绍的处理过程进行说话人识别。不论采用哪种方式进行说话人识别,只要音频文件以及图像文件在时间上保持对齐即可。
此外,需要说明的是,上述说话人识别的工具可以部署在用户关联的终端设备上,对终端设备获得的视频文件进行本地分析处理;或者,可以部署在云端服务器上,对终端设备或者其他服务器提交的视频文件进行分析处理,识别视频文件包括几个说话人,以及每个说话人分别对应哪些语音段。
可以理解地,本申请实施例提供的说话人识别工具可以应用到多种场景下。作为一种示例,可以应用到多人参与的有声语言交流活动中,例如,多人会议、多人演讲等活动。
以多人会议场景为例,可以识别说话人(例如,参会者)身份信息,并确定各说话人在会议上发言时产生的语音段的集合。作为一种示例,可以基于说话人对应的语音段的集合,提取说话人阐述的会议观点。以多人演讲场景为例,可以识别说话人(例如,演讲者)身份信息,并确定各说话人在演讲过程中产生的语音段。作为一种示例,可以基于说话人对应的语音段的集合,提取说话人的演讲看点。
或者,可以应用到影视剧场景下,用于识别不同角色的身份信息,以及各角色对应的语音段的集合。作为一种示例,可以基于角色对应的语音段的集合,提取剧情看点。
下面以演讲直播场景下拍摄的视频为例,对视频文件的处理过程进行解释说明。
实施例2
针对演讲直播来说,现有技术只能在直播结束后,通过人工分析的方式提取不同演讲人的演讲看点,再手动添加到视频文件中,导致视频处理过程消耗大量的人力成本以及时间成本。
对应于此,本实施例提供一种可自动进行视频文件处理的工具,如图1所示,可以包括客户端以及服务端。其中,客户端可以部署在用户关联的终端设备上,服务端可以部署在云端服务器上,例如,部署在直播服务器上,且实施例1提供的说话人识别的工具可以作为服务端的一个功能,识别演讲视频中的演讲者身份,并确定不同演讲者关联的语音段的集合。
下面结合图2所示流程图,对视频文件的处理过程进行解释说明。
S101:服务端获得有声语言交流活动产生的视频文件。
本示例中,有声语言交流活动产生的视频文件,即演讲产生的视频文件,可以由进行演讲直播的直播服务器获得,并提交至服务端。如果直播服务器在演讲直播结束后,将演讲产生的视频文件提交至服务端,服务端可以进行直播后处理,在文件中添加对应的内容看点(本示例中,内容看点可以体现为演讲者的演讲看点),供用户进行回看。如果直播服务器在直播过程中,将演讲产生的视频文件提交至服务端,服务端可以进行实时处理,在已完成直播的视频文件中添加对应的演讲看点,这样,用户在观看直播时,可以选择跟随正在直播的演讲,同步进行在线观看;或者,可以选择对已完成直播的部分内容进行回看。
例如,对于一个2小时的演讲直播来说,如果已经直播了30分钟,服务端可以对这30分钟直播产生的视频文件进行分析处理,添加演讲看点,供用户回看前30分钟的直播内容,并可直接定位到演讲看点对应的演讲片段。
S102:根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合。
具体实现过程可参见上文实施例1处所做介绍,此处不再赘述。
如果视频文件1即为演讲产生的视频文件,经说话人识别后可以获得表3所示识别结果。其中,语音段1为演讲者1演讲过程中产生的音频,语音段2以及语音段3为演讲者2演讲过程中产生的音频。
作为一种示例,可以在演讲开始前,预先创建演讲者信息库,通过演讲者信息库保存不同演讲者的人脸特征信息,这样,服务端对图像文件进行人脸识别时,便可根据演讲者的人脸特征,从演讲者信息库中确定出演讲者的身份信息。或者,可以通过演讲者信息库保存不同演讲者的声纹特征,这样,服务端对音频文件进行声纹特征跟踪时,便可根据演讲者的声纹特征,从信息库中确定出演讲者的身份信息。其中,演讲者信息库可以由本发明实施例的服务端创建,或者可以由其他服务端创建后提供给本发明实施例的服务端,本申请实施例对此可不做具体限定。
优选地,还可以预先设置噪声阈值,确定噪声可能对语音分割产生影响时,再通过对声纹特征以及人脸特征进行特征对齐的方式进行说话人识别。
一种方式下,如果演讲场地布设有噪声采集设备,服务端获得噪声采集设备采集的噪声信息后,可以判断噪声信息表示的噪声值是否超过预设阈值(例如,预设阈值可以体现为预设分贝值):如果超过预设阈值,可以确定噪声可能会影响语音分割的准确度,可以按照实施例1提供的方案,从视频文件中分离音频文件以及图像文件,进行说话人识别。如果未超过预设阈值,可以确定噪声对语音分割的影响较小,可以从视频文件中提取音频文件,只根据音频文件进行说话人识别即可。
或者,在另一种方式下,服务端获得视频文件,完成对视频文件的声音图像分离后,可以根据音频文件中的音量变化情况,确定是否存在噪声干扰。如果音量的幅值在一定范围内变化,可能是演讲者在说话导致的幅值变化,此时可以从视频文件中提取音频文件,并根据音频文件进行说话人识别。如果音量的幅值出现大幅度变化,可能是出现掌声或者背景音乐等噪声干扰,此时可以按照实施例1提供的方案,从视频文件中分离音频文件以及图像文件,进行说话人识别。
S103:对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容。
S104:建立所述说话人与对应的说话内容之间的关联关系。
具体地,可以通过语音识别技术,将语音段转换为识别文本,获得说话人的说话内容。
上文所举示例中,对语音段1进行语音识别,可以获得演讲内容1(本示例中,说话内容可以体现为演讲者的演讲内容),建立演讲者1与演讲内容1之间的关联关系;对语音段2以及语音段3进行语音识别,可以分别获得演讲内容2以及演讲内容3,建立演讲者2与演讲内容2、演讲内容3之间的关联关系。
上述示例经视频处理过程,可以获得下表4所示关联关系。
表4
Figure BDA0002228568570000131
作为一种示例,对语音段2以及语音段3进行语音识别后,还可以对演讲内容2以及演讲内容3进行合并处理,获得演讲内容4后,建立演讲者2与演讲内容4之间的关联关系。
S105:从所述说话人关联的说话内容中,提取所述说话人的内容看点。
以上示例中,获得演讲者关联的演讲内容后,便可从中提取演讲者的演讲看点,即,演讲者在演讲过程中阐述的主要观点。例如,可以通过生成式(abstractive)或者抽取式(extractive),提取演讲看点,具体实现过程可参见相关技术,此处不做详述。
对于演讲者1来说,可以基于演讲内容1提取演讲者1的演讲看点。对于演讲者2来说,可以分别基于演讲内容2以及演讲内容3提取演讲者2的演讲看点;或者,可以基于合并获得的演讲内容4提取演讲者2的演讲看点。
此外,考虑到演讲者的观点可能需要较长时间进行阐述,即,从起止时间较长的语音段中提取到演讲者的演讲看点的可能性更大一些,故可以对语音集合中起止时间较长的部分语音段,进行文本识别。例如,可以对语音段2进行文本识别,并根据演讲内容2提取演讲者2的演讲看点。
综上,便可自动从演讲视频中提取演讲者的演讲看点,相对现有技术只能在直播结束后,通过人工提炼演讲看点的方案,本申请实施例不仅可以提高视频文件的处理速度,降低人力成本以及时间成本;此外,还可以在直播过程中便对已完成直播的内容进行实时处理,供用户在回看以及在线观看直播两种方式中进行选择,为用户提供更多的使用体验。
S106:对所述内容看点进行后处理,生成看点文件下发至客户端。
本申请实施例中,可以将内容看点以不同形式下发至客户端,下面结合具体示例对后处理过程进行解释说明。
1.如果客户端关联的智能设备为视频播放设备,则可以视频形式下发内容看点。例如,在教学场景下,可以将添加有内容看点的视频发送到客户端,供用户观看学习。
一种方式下,服务端可以将内容看点添加到视频文件中,并将包含内容看点的视频文件发送至客户端进行视频播放。即,后处理生成的看点文件为包含内容看点的视频文件。
也就是说,可以在原始视频的基础上进行后处理,实现内容看点的添加。具体地,可以根据内容看点对应的语音段的起止时间,确定内容看点的添加节点。例如,将内容看点添加到对应的语音段的开始时间节点上,这样,用户点击视频文件进度条上展示的内容看点后,可以快速定位到该内容看点对应的播放片段,供用户观看。
或者,另一种方式下,可以根据内容看点生成模拟交流活动的演示视频,并将包含内容看点的演示视频发送至客户端进行视频播放。即,后处理生成的看点文件为包含内容看点的演示视频。
也就是说,为了便于用户快速的了解交流活动涉及的主要看点,可以基于内容看点生成一个演示视频,该演示视频可以作为原始视频的摘要视频,尽量简洁的把不同说话人的内容看点展示给用户。
具体地,可以先根据说话人的形象或者其他虚拟形象,确定演示视频中的人物,再通过不同人物进行交流对话的形式,将对应说话人的内容看点表述出来。
2.如果客户端关联的智能设备为音频播放设备,则可以音频形式下发内容看点。例如,在智能音箱上部署客户端后,可以将添加有内容看点的音频文件发送到客户端,供用户收听。
具体地,可以将内容看点添加到音频文件中(例如,可以根据内容看点对应的语音段的起止时间,确定内容看点在音频文件中的添加节点),并将包含内容看点的音频文件发送至客户端进行音频播放。即,后处理生成的看点文件为包含内容看点的音频文件。
作为一种示例,客户端获得看点文件后,可以直接进行音频播放。或者,可以先对看点文件中添加的内容看点进行播放,供用户从中选择感兴趣的目标内容看点。这样,用户输入目标内容看点(以智能音箱为例,用户可以通过语音操控的方式说出目标内容看点)后,客户端可以将目标内容看点提交到服务端,由服务端将目标内容看点对应的音频片段发送到客户端进行音频播放。或者,可以先对说话人的身份信息进行播放,供用户从中选择感兴趣的目标说话人,这样,客户端与服务端相互配合,可以向用户推送与目标说话人相关的音频片段。
3.可以文本形式下发内容看点。
具体地,可以根据客户端的展示类型,将内容看点生成对应类型的交流文本,并将交流文本发送至客户端进行展示。即,后处理生成的看点文件为包含内容看点的交流文本。
作为一种示例,客户端的展示类型可以是文本展示,例如,通过邮件、帖子等形式展示内容看点,对应地,服务端可以生成图3所示文本类型的交流文本,下发到客户端进行展示。或者,客户端的展示类型可以是海报展示,对应地,服务端可以生成图4所示海报类型的交流文本,下发到客户端进行展示。
S107:客户端接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,将所述看点文件推送给所述客户端关联的用户。
本申请实施例中,客户端可以通过视频形式、音频形式、文本形式向用户进行看点文件推送,具体可参见上文所做介绍,此处不再赘述。
S108:客户端向服务端提交服务请求,触发服务端为客户端关联的用户提供相关服务。
由上文介绍可知,本申请实施例可以实现视频文件的数据化处理。作为一种优选方案,服务端还可以根据需求,定义一个数组结构,用于保存说话人、语音段、内容看点等信息之间的关联关系。
对于视频文件1来说,进行视频处理后可以获得下表5所示关联关系。
表5
Figure BDA0002228568570000161
Figure BDA0002228568570000171
也就是说,客户端除了可以向用户推送服务端下发的看点文件之外,还可以请求服务端为用户提供多种服务。下面以演讲场景为例,对服务端提供不同服务的实现过程进行举例说明。
1.可以为用户在直播过程中提交的转发请求,生成个性化的直播封面。
具体地,用户在线观看演讲直播的过程中,如果想对直播进行分享操作,可以通过用户关联的客户端,向服务端提交直播转发请求。对应地,服务端可以获得已完成直播的内容对应的演讲看点,例如,基于已经直播的30分钟演讲内容提取的演讲看点,发送至客户端。
作为一种示例,客户端可以对服务端下发的演讲看点进行展示,供用户从中选择目标演讲看点,并将目标演讲看点提交到服务端,以便服务端根据目标演讲看点生成直播封面。例如,服务端可以将目标演讲看点添加到直播封面上;或者,可以从目标演讲看点对应的演讲片段中,截取一张目标图像,利用目标图像以及目标演讲看点生成直播封面,具体地,可以根据表3以及表5确定目标演讲看点对应的起止时间,进而从该起止时间对应的演讲片段中截取目标图像。
服务端根据目标演讲看点生成直播封面后,可以获得包含该直播封面的转发链接,该转发链接可以作为用户的专属链接,下发到客户端,供用户进行直播转发。如此便可在用户进行直播转发时,展示该用户专属的个性化直播封面。相对于现有技术只能转发包含统一封面的直播链接,本申请实施例提供的转发服务,不仅有助于提高用户体验,还可能通过个性化分享吸引更多的用户观看演讲直播,提高传播引导效率。
2.可以在用户回看时,直接定位到用户感兴趣的播放片段。
具体地,不论是直播结束后进行回看,还是在直播过程中对已完成直播的内容进行回看,用户可以通过客户端向服务端提交播放请求,触发服务端将演讲看点下发到客户端进行展示,供用户从中选择目标演讲看点,进而将用户选择的目标演讲看点提交到服务端。对应地,服务端可以根据表3以及表5所示关联关系,确定目标演讲看点对应的目标语音段,并根据目标语音段的起止时间,从视频文件中确定目标演讲看点对应的播放片段,将播放片段下发至客户端进行视频播放。也就是说,客户端可以只接收并播放用户感兴趣的片段。
或者,在另一种方式下,如果客户端可以将视频文件中添加的演讲看点展示给用户查看,例如,在视频文件的进度条上展示演讲看点,客户端可以获得用户从中选择的目标演讲看点,生成包含目标演讲看点的播放请求,提交到服务端。例如,用户点击进度条上展示的演讲看点2后,可以生成针对演讲看点2的播放请求。对应地,服务端获得上述播放请求后,可以根据表3以及表5所示关联关系,确定用户想要观看12~550s的演讲片段,故可控制客户端加载12~550s的视频资源,播放这部分片段。也就是说,客户端既可以播放完整的演讲视频,又可以根据用户操作跳转播放用户感兴趣的片段。
对于以音频形式收听演讲的用户来说,通过客户端提交播放请求后,服务端可以根据用户确定的目标演讲看点,从音频文件中确定该目标演讲看点对应的播放片段,并将播放片段下发到客户端进行音频播放。
3.可以根据用户输入的检索信息,直接定位到用户感兴趣的播放片段。
具体地,客户端可以提供用于提交检索信息的操作选项,通过操作选项获得检索信息后,可以生成检索请求提交到服务端。
作为一种示例,用户提交的检索信息可以是演讲者的标识信息,即,用户想要观看某个(某些)演讲者的演讲片段。对应于此,服务端获得检索请求后,可以根据表3以及表5所示关联关系,确定演讲者关联的目标语音段,并根据目标语音段的起止时间,从视频文件中确定演讲者对应的播放片段,将播放片段下发至客户端进行视频播放。
或者,作为另一种示例,用户提交的检索信息可以是内容关键词,即,用户想要观看与某个(某些)内容相关的演讲片段。对应于此,服务端获得检索请求后,可以从演讲看点中,确定与内容关键词相匹配的目标演讲看点,再根据表3以及表5所示关联关系,确定目标演讲看点对应的目标语音段,并根据目标语音段的起止时间,从视频文件中确定目标演讲看点对应的播放片段,将播放片段下发至客户端进行视频播放。
优选地,为了提高用户基于内容关键词进行播放片段检索的准确率,可以预先从演讲看点中提炼内容关键词,并将内容关键词下发到客户端进行展示,供用户从中选择感兴趣的内容关键词,提交到服务端。
同样地,对于以音频形式收听演讲的用户来说,通过客户端提交检索请求后,服务端可以根据用户确定的演讲者的标识信息或者内容关键词,从音频文件中确定对应的播放片段,并将播放片段下发到客户端进行音频播放。
可以理解地,以上示例中确定的目标演讲看点可能是同一个看点,也可能是不同的看点,主要由用户的实际需求决定。
实施例3
该实施例3是与实施例1相对应的,提供了一种说话人识别方法,参见图5,该方法具体可以包括:
S201:从待识别的视频文件中分离获得音频文件以及图像文件;
S202:对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
S203:对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
实施例4
该实施例4是与实施例2相对应的,从服务端的角度,提供了一种视频文件处理方法,参见图6,该方法具体可以包括:
S301:服务端获得有声语言交流活动产生的视频文件;
S302:根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
S303:对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
S304:建立所述说话人与对应的说话内容之间的关联关系。
实施例5
该实施例5是与实施例2相对应的,从客户端的角度,提供了一种视频文件处理方法,参见图7,该方法具体可以包括:
S401:客户端接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
S402:将所述看点文件推送给所述客户端关联的用户。
关于前述实施例3至实施例5中的未详述部分,可以参见前述实施例中的记载,这里不再赘述。
与实施例1相对应,本申请实施例还提供了一种说话人识别装置,参见图8,该装置可以应用于服务端,包括:
文件分离单元501,用于从待识别的视频文件中分离获得音频文件以及图像文件;
语音分割单元502,用于对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息;
人脸识别单元503,用于对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对齐处理单元504,用于对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
其中,所述装置还包括:
合并处理单元,用于对说话人对应的至少一个语音段进行合并处理。
其中,所述对齐处理单元,具体用于:
根据相邻语音段各自对应的起止时间信息,确定进行对齐处理的目标起止时间;获得所述目标起止时间对应的目标人脸识别结果;如果所述目标人脸识别结果对应一名目标用户,则对所述相邻语音段进行合并处理,并对合并后的语音段以及所述目标用户进行关联。
其中,所述对齐处理单元,具体用于:
根据语音段对应的起止时间信息,获得所述起止时间对应的目标人脸识别结果;如果所述目标人脸识别结果对应至少两名用户,则从中确定一名目标用户,并对所述语音段以及所述目标用户进行关联。
其中,所述装置还包括:
信息库获得单元,用于获得说话人信息库,所述说话人信息库中保存有至少一个说话人的身份信息关联的人脸特征信息;
身份信息确定单元,用于根据所述目标用户的人脸特征信息,从所述说话人信息库中确定所述目标用户的身份信息。
与实施例2相对应,本申请实施例还提供了一种视频文件处理装置,参见图9,该装置应用于服务端,包括:
视频文件获得单元601,用于获得有声语言交流活动产生的视频文件;
说话人识别单元602,用于根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
说话内容获得单元603,用于对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
关联关系建立单元604,用于建立所述说话人与对应的说话内容之间的关联关系。
其中,所述装置还包括:
内容看点提取单元,用于从所述说话人关联的说话内容中,提取所述说话人的内容看点;
内容看点处理单元,用于对所述内容看点进行后处理,生成看点文件下发至客户端。
其中,所述内容看点处理单元,具体用于:
如果所述客户端关联的智能设备为视频播放设备,则将所述内容看点添加到所述视频文件中,并将包含所述内容看点的视频文件发送至所述客户端进行视频播放。
其中,所述内容看点处理单元,具体用于:
如果所述客户端关联的智能设备为视频播放设备,则根据所述内容看点生成模拟交流活动的演示视频,并将包含所述内容看点的演示视频发送至所述客户端进行视频播放。
其中,所述内容看点处理单元,具体用于:
如果所述客户端关联的智能设备为音频播放设备,则将所述内容看点添加到所述音频文件中,并将包含所述内容看点的音频文件发送至所述客户端进行音频播放。
其中,所述内容看点处理单元,具体用于:
根据客户端的展示类型,将所述内容看点生成对应类型的交流文本,并将所述交流文本发送至所述客户端进行展示。
其中,如果交流活动场地布设有噪声采集设备,所述装置还包括:
噪声信息获得单元,用于获得所述噪声采集设备采集的噪声信息;
所述说话人识别单元,用于在所述噪声信息表示噪声值超过预设阈值时,从所述视频文件中分离所述音频文件以及所述图像文件,进行说话人识别。
其中,所述装置还包括:
音频文件提取单元,用于在所述噪声信息表示噪声值未超过所述预设阈值时,从所述视频文件中提取音频文件,并根据所述音频文件进行说话人识别。
其中,所述视频文件为交流活动直播过程中获得的,已完成直播的内容对应的视频文件。
其中,所述装置还包括:
内容看点发送单元,用于在获得客户端提交的直播转发请求时,将所述已完成直播的内容对应的内容看点发送至所述客户端,供所述客户端关联的用户从中选择目标内容看点;
直播封面生成单元,用于接收所述客户端提交的所述目标内容看点,并根据所述目标内容看点生成直播封面;
转发链接下发单元,用于获得包含所述直播封面的转发链接,下发至所述客户端进行直播转发。
其中,所述关联关系建立单元,还用于建立所述说话人、所述语音段的集合以及所述内容看点之间的关联关系。
其中,所述装置还包括:
内容看点发送单元,用于在获得客户端提交的播放请求时,将所述内容看点发送至所述客户端,供所述客户端关联的用户从中选择目标内容看点;
播放片段确定单元,用于接收所述客户端提交的所述目标内容看点;确定所述目标内容看点对应的目标语音段,并根据所述目标语音段的起止时间,从所述视频文件中确定所述目标内容看点对应的播放片段;
播放片段下发单元,用于将所述播放片段下发至所述客户端进行播放。
其中,所述装置还包括:
检索请求获得单元,用于获得客户端提交的检索请求,所述检索请求中包括说话人的标识信息;
播放片段确定单元,用于确定所述说话人关联的目标语音段,并根据所述目标语音段的起止时间,从所述视频文件中确定所述说话人对应的播放片段;
播放片段下发单元,用于将所述播放片段下发至所述客户端进行播放。
其中,所述装置还包括:
检索请求获得单元,用于获得客户端提交的检索请求,所述检索请求中包括内容关键词;
播放片段确定单元,用于从所述内容看点中,确定与所述内容关键词相匹配的目标内容看点;获得所述目标内容看点对应的目标语音段,并根据所述目标语音段的起止时间,从所述视频文件中确定所述目标内容看点对应的播放片段;
播放片段下发单元,用于将所述播放片段下发至所述客户端进行播放。
与实施例2相对应,本申请实施例还提供了一种视频文件处理装置,参见图10,该装置应用于客户端,包括:
看点文件接收单元701,用于接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
看点文件推送单元702,用于将所述看点文件推送给所述客户端关联的用户。
另外,本申请实施例还提供了一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
从待识别的视频文件中分离获得音频文件以及图像文件;
对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
以及一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
获得有声语言交流活动产生的视频文件;
根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
建立所述说话人与对应的说话内容之间的关联关系。
以及一种电子设备,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
将所述看点文件推送给客户端关联的用户。
其中,图11示例性的展示出了计算机系统的架构,具体可以包括处理器810,视频显示适配器811,磁盘驱动器812,输入/输出接口813,网络接口814,以及存储器820。上述处理器810、视频显示适配器811、磁盘驱动器812、输入/输出接口813、网络接口814,与存储器820之间可以通过通信总线830进行通信连接。
其中,处理器810可以采用通用的CPU(Central Processing Unit,中央处理器)、微处理器、应用专用集成电路(Application Specific Integrated Circuit,ASIC)、或者一个或多个集成电路等方式实现,用于执行相关程序,以实现本申请所提供的技术方案。
存储器820可以采用ROM(Read Only Memory,只读存储器)、RAM(Random AccessMemory,随机存取存储器)、静态存储设备,动态存储设备等形式实现。存储器820可以存储用于控制计算机系统800运行的操作系统821,用于控制计算机系统800的低级别操作的基本输入输出系统(BIOS)。另外,还可以存储网页浏览器823,数据存储管理系统824,以及视频文件处理系统825等等。上述视频文件处理系统825就可以是本申请实施例中具体实现前述各步骤操作的服务端。总之,在通过软件或者固件来实现本申请所提供的技术方案时,相关的程序代码保存在存储器820中,并由处理器810来调用执行。
输入/输出接口813用于连接输入/输出模块,以实现信息输入及输出。输入输出/模块可以作为组件配置在设备中(图中未示出),也可以外接于设备以提供相应功能。其中输入设备可以包括键盘、鼠标、触摸屏、麦克风、各类传感器等,输出设备可以包括显示器、扬声器、振动器、指示灯等。
网络接口814用于连接通信模块(图中未示出),以实现本设备与其他设备的通信交互。其中通信模块可以通过有线方式(例如USB、网线等)实现通信,也可以通过无线方式(例如移动网络、WIFI、蓝牙等)实现通信。
总线830包括一通路,在设备的各个组件(例如处理器810、视频显示适配器811、磁盘驱动器812、输入/输出接口813、网络接口814,与存储器820)之间传输信息。
需要说明的是,尽管上述设备仅示出了处理器810、视频显示适配器811、磁盘驱动器812、输入/输出接口813、网络接口814,存储器820,总线830等,但是在具体实施过程中,该设备还可以包括实现正常运行所必需的其他组件。此外,本领域的技术人员可以理解的是,上述设备中也可以仅包含实现本申请方案所必需的组件,而不必包含图中所示的全部组件。
其中,图12示例性的展示出了电子设备的架构,例如,设备900可以是移动电话,计算机,数字广播终端,消息收发设备,游戏控制台,平板设备,医疗设备,健身设备,个人数字助理,飞行器等。
参照图12,设备900可以包括以下一个或多个组件:处理组件902,存储器904,电源组件906,多媒体组件908,音频组件910,输入/输出(I/O)的接口912,传感器组件914,以及通信组件916。
处理组件902通常控制设备900的整体操作,诸如与显示,电话呼叫,数据通信,相机操作和记录操作相关联的操作。处理元件902可以包括一个或多个处理器920来执行指令,以完成本公开技术方案提供的方法的全部或部分步骤。此外,处理组件902可以包括一个或多个模块,便于处理组件902和其他组件之间的交互。例如,处理部件902可以包括多媒体模块,以方便多媒体组件908和处理组件902之间的交互。
存储器904被配置为存储各种类型的数据以支持在设备900的操作。这些数据的示例包括用于在设备900上操作的任何应用程序或方法的指令,联系人数据,电话簿数据,消息,图片,视频等。存储器904可以由任何类型的易失性或非易失性存储设备或者它们的组合实现,如静态随机存取存储器(SRAM),电可擦除可编程只读存储器(EEPROM),可擦除可编程只读存储器(EPROM),可编程只读存储器(PROM),只读存储器(ROM),磁存储器,快闪存储器,磁盘或光盘。
电源组件906为设备900的各种组件提供电力。电源组件906可以包括电源管理系统,一个或多个电源,及其他与为设备900生成、管理和分配电力相关联的组件。
多媒体组件908包括在设备900和用户之间的提供一个输出接口的屏幕。在一些实施例中,屏幕可以包括液晶显示器(LCD)和触摸面板(TP)。如果屏幕包括触摸面板,屏幕可以被实现为触摸屏,以接收来自用户的输入信号。触摸面板包括一个或多个触摸传感器以感测触摸、滑动和触摸面板上的手势。触摸传感器可以不仅感测触摸或滑动动作的边界,而且还检测与触摸或滑动操作相关的持续时间和压力。在一些实施例中,多媒体组件908包括一个前置摄像头和/或后置摄像头。当设备900处于操作模式,如拍摄模式或视频模式时,前置摄像头和/或后置摄像头可以接收外部的多媒体数据。每个前置摄像头和后置摄像头可以是一个固定的光学透镜系统或具有焦距和光学变焦能力。
音频组件910被配置为输出和/或输入音频信号。例如,音频组件910包括一个麦克风(MIC),当设备900处于操作模式,如呼叫模式、记录模式和语音识别模式时,麦克风被配置为接收外部音频信号。所接收的音频信号可以被进一步存储在存储器904或经由通信组件916发送。在一些实施例中,音频组件910还包括一个扬声器,用于输出音频信号。
I/O接口912为处理组件902和外围接口模块之间提供接口,上述外围接口模块可以是键盘,点击轮,按钮等。这些按钮可包括但不限于:主页按钮、音量按钮、启动按钮和锁定按钮。
传感器组件914包括一个或多个传感器,用于为设备900提供各个方面的状态评估。例如,传感器组件914可以检测到设备900的打开/关闭状态,组件的相对定位,例如所述组件为设备900的显示器和小键盘,传感器组件914还可以检测设备900或设备900一个组件的位置改变,用户与设备900接触的存在或不存在,设备900方位或加速/减速和设备900的温度变化。传感器组件914可以包括接近传感器,被配置用来在没有任何的物理接触时检测附近物体的存在。传感器组件914还可以包括光传感器,如CMOS或CCD图像传感器,用于在成像应用中使用。在一些实施例中,该传感器组件914还可以包括加速度传感器,陀螺仪传感器,磁传感器,压力传感器或温度传感器。
通信组件916被配置为便于设备900和其他设备之间有线或无线方式的通信。设备900可以接入基于通信标准的无线网络,如WiFi,2G或3G,或它们的组合。在一个示例性实施例中,通信部件916经由广播信道接收来自外部广播管理系统的广播信号或广播相关信息。在一个示例性实施例中,所述通信部件916还包括近场通信(NFC)模块,以促进短程通信。例如,在NFC模块可基于射频识别(RFID)技术,红外数据协会(IrDA)技术,超宽带(UWB)技术,蓝牙(BT)技术和其他技术来实现。
在示例性实施例中,设备900可以被一个或多个应用专用集成电路(ASIC)、数字信号处理器(DSP)、数字信号处理设备(DSPD)、可编程逻辑器件(PLD)、现场可编程门阵列(FPGA)、控制器、微控制器、微处理器或其他电子元件实现,用于执行上述方法。
在示例性实施例中,还提供了一种包括指令的非临时性计算机可读存储介质,例如包括指令的存储器904,上述指令可由设备900的处理器920执行以完成本公开技术方案提供的方法。例如,所述非临时性计算机可读存储介质可以是ROM、随机存取存储器(RAM)、CD-ROM、磁带、软盘和光数据存储设备等。
通过以上的实施方式的描述可知,本领域的技术人员可以清楚地了解到本申请可借助软件加必需的通用硬件平台的方式来实现。基于这样的理解,本申请的技术方案本质上或者说对现有技术做出贡献的部分可以以软件产品的形式体现出来,该计算机软件产品可以存储在存储介质中,如ROM/RAM、磁碟、光盘等,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行本申请各个实施例或者实施例的某些部分所述的方法。
本说明书中的各个实施例均采用递进的方式描述,各个实施例之间相同相似的部分互相参见即可,每个实施例重点说明的都是与其他实施例的不同之处。尤其,对于系统或系统实施例而言,由于其基本相似于方法实施例,所以描述得比较简单,相关之处参见方法实施例的部分说明即可。以上所描述的系统及系统实施例仅仅是示意性的,其中所述作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案的目的。本领域普通技术人员在不付出创造性劳动的情况下,即可以理解并实施。
以上对本申请所提供的说话人识别方法、装置及电子设备,视频文件处理方法、装置及电子设备,进行了详细介绍,本文中应用了具体个例对本申请的原理及实施方式进行了阐述,以上实施例的说明只是用于帮助理解本申请的方法及其核心思想;同时,对于本领域的一般技术人员,依据本申请的思想,在具体实施方式及应用范围上均会有改变之处。综上所述,本说明书内容不应理解为对本申请的限制。

Claims (27)

1.一种说话人识别方法,其特征在于,包括:
从待识别的视频文件中分离获得音频文件以及图像文件;
对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
2.根据权利要求1所述的方法,其特征在于,还包括:
对说话人对应的至少一个语音段进行合并处理。
3.根据权利要求1所述的方法,其特征在于,
所述对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,包括:
根据相邻语音段各自对应的起止时间信息,确定进行对齐处理的目标起止时间;
获得所述目标起止时间对应的目标人脸识别结果;
如果所述目标人脸识别结果对应一名目标用户,则对所述相邻语音段进行合并处理,并对合并后的语音段以及所述目标用户进行关联。
4.根据权利要求1所述的方法,其特征在于,
所述对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,包括:
根据语音段对应的起止时间信息,获得所述起止时间对应的目标人脸识别结果;
如果所述目标人脸识别结果对应至少两名用户,则从中确定一名目标用户,并对所述语音段以及所述目标用户进行关联。
5.根据权利要求4所述的方法,其特征在于,
从所述至少两名用户中确定一名目标用户,包括:
将所述起止时间内出现次数最多的用户,确定为所述目标用户。
6.根据权利要求3至5中任一项所述的方法,其特征在于,还包括:
获得说话人信息库,所述说话人信息库中保存有至少一个说话人的身份信息关联的人脸特征信息;
根据所述目标用户的人脸特征信息,从所述说话人信息库中确定所述目标用户的身份信息。
7.一种视频文件处理方法,其特征在于,包括:
服务端获得有声语言交流活动产生的视频文件;
根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
建立所述说话人与对应的说话内容之间的关联关系。
8.根据权利要求7所述的方法,其特征在于,还包括:
从所述说话人关联的说话内容中,提取所述说话人的内容看点;
对所述内容看点进行后处理,生成看点文件下发至客户端。
9.根据权利要求8所述的方法,其特征在于,
对所述内容看点进行后处理,生成看点文件下发至客户端,包括:
如果所述客户端关联的智能设备为视频播放设备,则将所述内容看点添加到所述视频文件中,并将包含所述内容看点的视频文件发送至所述客户端进行视频播放。
10.根据权利要求8所述的方法,其特征在于,
对所述内容看点进行后处理,生成看点文件下发至客户端,包括:
如果所述客户端关联的智能设备为视频播放设备,则根据所述内容看点生成模拟交流活动的演示视频,并将包含所述内容看点的演示视频发送至所述客户端进行视频播放。
11.根据权利要求8所述的方法,其特征在于,
对所述内容看点进行后处理,生成看点文件下发至客户端,包括:
如果所述客户端关联的智能设备为音频播放设备,则将所述内容看点添加到所述音频文件中,并将包含所述内容看点的音频文件发送至所述客户端进行音频播放。
12.根据权利要求8所述的方法,其特征在于,
对所述内容看点进行后处理,生成看点文件下发至客户端,包括:
根据客户端的展示类型,将所述内容看点生成对应类型的交流文本,并将所述交流文本发送至所述客户端进行展示。
13.根据权利要求7所述的方法,其特征在于,如果交流活动场地布设有噪声采集设备,所述方法还包括:
获得所述噪声采集设备采集的噪声信息;
如果所述噪声信息表示噪声值超过预设阈值,再从所述视频文件中分离所述音频文件以及所述图像文件。
14.根据权利要求13所述的方法,其特征在于,所述方法还包括:
如果所述噪声信息表示噪声值未超过所述预设阈值,则从所述视频文件中提取音频文件,并根据所述音频文件进行说话人识别。
15.根据权利要求7所述的方法,其特征在于,
所述视频文件为交流活动直播过程中获得的,已完成直播的内容对应的视频文件。
16.根据权利要求15所述的方法,其特征在于,还包括:
如果获得客户端提交的直播转发请求,则将所述已完成直播的内容对应的内容看点发送至所述客户端,供所述客户端关联的用户从中选择目标内容看点;
接收所述客户端提交的所述目标内容看点,并根据所述目标内容看点生成直播封面;
获得包含所述直播封面的转发链接,下发至所述客户端进行直播转发。
17.根据权利要求8所述的方法,其特征在于,还包括:
建立所述说话人、所述语音段的集合以及所述内容看点之间的关联关系。
18.根据权利要求17所述的方法,其特征在于,还包括:
如果获得客户端提交的播放请求,则将所述内容看点发送至所述客户端,供所述客户端关联的用户从中选择目标内容看点;
接收所述客户端提交的所述目标内容看点;
确定所述目标内容看点对应的目标语音段,并根据所述目标语音段的起止时间,确定所述目标内容看点对应的播放片段;
将所述播放片段下发至所述客户端进行播放。
19.根据权利要求17所述的方法,其特征在于,还包括:
获得客户端提交的检索请求,所述检索请求中包括说话人的标识信息;
确定所述说话人关联的目标语音段,并根据所述目标语音段的起止时间,确定所述说话人对应的播放片段;
将所述播放片段下发至所述客户端进行播放。
20.根据权利要求17所述的方法,其特征在于,还包括:
获得客户端提交的检索请求,所述检索请求中包括内容关键词;
从所述内容看点中,确定与所述内容关键词相匹配的目标内容看点;
获得所述目标内容看点对应的目标语音段,并根据所述目标语音段的起止时间,确定所述目标内容看点对应的播放片段;
将所述播放片段下发至所述客户端进行播放。
21.一种视频文件处理方法,其特征在于,包括:
客户端接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
将所述看点文件推送给所述客户端关联的用户。
22.一种说话人识别装置,其特征在于,包括:
文件分离单元,用于从待识别的视频文件中分离获得音频文件以及图像文件;
语音分割单元,用于对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息;
人脸识别单元,用于对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对齐处理单元,用于对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
23.一种视频文件处理装置,其特征在于,应用于服务端,包括:
视频文件获得单元,用于获得有声语言交流活动产生的视频文件;
说话人识别单元,用于根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
说话内容获得单元,用于对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
关联关系建立单元,用于建立所述说话人与对应的说话内容之间的关联关系。
24.一种视频文件处理装置,其特征在于,应用于客户端,包括:
看点文件接收单元,用于接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
看点文件推送单元,用于将所述看点文件推送给所述客户端关联的用户。
25.一种电子设备,其特征在于,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
从待识别的视频文件中分离获得音频文件以及图像文件;
对所述音频文件进行语音分割,获得至少一个语音段各自对应的起止时间信息以及说话人标识信息,以及对所述图像文件进行人脸识别,获得不同时间对应的人脸识别结果;
对所述说话人标识信息以及所述人脸识别结果,在时间上进行对齐处理,确定所述至少一个语音段对应的说话人。
26.一种电子设备,其特征在于,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
获得有声语言交流活动产生的视频文件;
根据从所述视频文件中分离出的音频文件以及图像文件,进行说话人识别,获得不同说话人各自关联的语音段的集合;
对所述说话人关联的语音段的集合进行语音识别,获得所述说话人的说话内容;
建立所述说话人与对应的说话内容之间的关联关系。
27.一种电子设备,其特征在于,包括:
一个或多个处理器;以及
与所述一个或多个处理器关联的存储器,所述存储器用于存储程序指令,所述程序指令在被所述一个或多个处理器读取执行时,执行如下操作:
接收服务端发送的对有声语言交流活动的视频进行处理获得的看点文件,所述看点文件中添加有不同说话人的内容看点,所述内容看点为根据对所述视频中分离出的音频文件以及图像文件进行说话人识别,确定的不同说话人关联的语音段的集合中提取;
将所述看点文件推送给客户端关联的用户。
CN201910959899.2A 2019-10-10 2019-10-10 说话人识别方法、装置及电子设备 Active CN112653902B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201910959899.2A CN112653902B (zh) 2019-10-10 2019-10-10 说话人识别方法、装置及电子设备

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201910959899.2A CN112653902B (zh) 2019-10-10 2019-10-10 说话人识别方法、装置及电子设备

Publications (2)

Publication Number Publication Date
CN112653902A true CN112653902A (zh) 2021-04-13
CN112653902B CN112653902B (zh) 2023-04-11

Family

ID=75343469

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201910959899.2A Active CN112653902B (zh) 2019-10-10 2019-10-10 说话人识别方法、装置及电子设备

Country Status (1)

Country Link
CN (1) CN112653902B (zh)

Cited By (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113592116A (zh) * 2021-09-28 2021-11-02 阿里云计算有限公司 设备状态分析方法、装置、设备和存储介质
CN113901785A (zh) * 2021-09-29 2022-01-07 联想(北京)有限公司 一种标记方法及电子设备
CN114299952A (zh) * 2021-12-29 2022-04-08 湖北微模式科技发展有限公司 结合多种运动分析的话者角色区分方法及系统
CN114299953A (zh) * 2021-12-29 2022-04-08 湖北微模式科技发展有限公司 一种结合嘴部运动分析的话者角色区分方法与系统
CN114630179A (zh) * 2022-03-17 2022-06-14 维沃移动通信有限公司 音频提取方法和电子设备
CN114842858A (zh) * 2022-04-27 2022-08-02 成都爱奇艺智能创新科技有限公司 一种音频处理方法、装置、电子设备及存储介质
CN115691506A (zh) * 2021-07-27 2023-02-03 中移动信息技术有限公司 基于说话人分割的角色识别方法及装置
CN115798029A (zh) * 2021-09-08 2023-03-14 西安宇视信息科技有限公司 一种声纹匹配方法和装置及声纹身份识别方法
CN115881135A (zh) * 2022-12-08 2023-03-31 北京奇艺世纪科技有限公司 说话人确定方法、装置、电子设备及存储介质
CN115880744A (zh) * 2022-08-01 2023-03-31 北京中关村科金技术有限公司 一种基于唇动的视频角色识别方法、装置及存储介质
CN115910106A (zh) * 2022-11-29 2023-04-04 杭州华橙软件技术有限公司 一种音视频处理方法、装置、设备及介质
CN116303296A (zh) * 2023-05-22 2023-06-23 天宇正清科技有限公司 一种数据存储方法、装置、电子设备及介质
CN120126480A (zh) * 2025-03-11 2025-06-10 中电信人工智能科技(北京)有限公司 面向多说话人环境的语音识别方法、装置与电子设备

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN102572372A (zh) * 2011-12-28 2012-07-11 中兴通讯股份有限公司 会议纪要的提取方法和装置
CN105224925A (zh) * 2015-09-30 2016-01-06 努比亚技术有限公司 视频处理装置、方法及移动终端
CN105512348A (zh) * 2016-01-28 2016-04-20 北京旷视科技有限公司 用于处理视频和相关音频的方法和装置及检索方法和装置
CN106548793A (zh) * 2015-09-16 2017-03-29 中兴通讯股份有限公司 存储和播放音频文件的方法和装置
CN109410957A (zh) * 2018-11-30 2019-03-01 福建实达电脑设备有限公司 基于计算机视觉辅助的正面人机交互语音识别方法及系统

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN102572372A (zh) * 2011-12-28 2012-07-11 中兴通讯股份有限公司 会议纪要的提取方法和装置
CN106548793A (zh) * 2015-09-16 2017-03-29 中兴通讯股份有限公司 存储和播放音频文件的方法和装置
CN105224925A (zh) * 2015-09-30 2016-01-06 努比亚技术有限公司 视频处理装置、方法及移动终端
CN105512348A (zh) * 2016-01-28 2016-04-20 北京旷视科技有限公司 用于处理视频和相关音频的方法和装置及检索方法和装置
CN109410957A (zh) * 2018-11-30 2019-03-01 福建实达电脑设备有限公司 基于计算机视觉辅助的正面人机交互语音识别方法及系统

Cited By (17)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115691506A (zh) * 2021-07-27 2023-02-03 中移动信息技术有限公司 基于说话人分割的角色识别方法及装置
CN115798029A (zh) * 2021-09-08 2023-03-14 西安宇视信息科技有限公司 一种声纹匹配方法和装置及声纹身份识别方法
CN113592116A (zh) * 2021-09-28 2021-11-02 阿里云计算有限公司 设备状态分析方法、装置、设备和存储介质
CN113901785A (zh) * 2021-09-29 2022-01-07 联想(北京)有限公司 一种标记方法及电子设备
CN114299952A (zh) * 2021-12-29 2022-04-08 湖北微模式科技发展有限公司 结合多种运动分析的话者角色区分方法及系统
CN114299953A (zh) * 2021-12-29 2022-04-08 湖北微模式科技发展有限公司 一种结合嘴部运动分析的话者角色区分方法与系统
CN114299953B (zh) * 2021-12-29 2022-08-23 湖北微模式科技发展有限公司 一种结合嘴部运动分析的话者角色区分方法与系统
CN114630179A (zh) * 2022-03-17 2022-06-14 维沃移动通信有限公司 音频提取方法和电子设备
CN114842858A (zh) * 2022-04-27 2022-08-02 成都爱奇艺智能创新科技有限公司 一种音频处理方法、装置、电子设备及存储介质
CN115880744A (zh) * 2022-08-01 2023-03-31 北京中关村科金技术有限公司 一种基于唇动的视频角色识别方法、装置及存储介质
CN115880744B (zh) * 2022-08-01 2023-10-20 北京中关村科金技术有限公司 一种基于唇动的视频角色识别方法、装置及存储介质
CN115910106A (zh) * 2022-11-29 2023-04-04 杭州华橙软件技术有限公司 一种音视频处理方法、装置、设备及介质
CN115881135A (zh) * 2022-12-08 2023-03-31 北京奇艺世纪科技有限公司 说话人确定方法、装置、电子设备及存储介质
CN115881135B (zh) * 2022-12-08 2026-03-13 北京奇艺世纪科技有限公司 说话人确定方法、装置、电子设备及存储介质
CN116303296A (zh) * 2023-05-22 2023-06-23 天宇正清科技有限公司 一种数据存储方法、装置、电子设备及介质
CN116303296B (zh) * 2023-05-22 2023-08-25 天宇正清科技有限公司 一种数据存储方法、装置、电子设备及介质
CN120126480A (zh) * 2025-03-11 2025-06-10 中电信人工智能科技(北京)有限公司 面向多说话人环境的语音识别方法、装置与电子设备

Also Published As

Publication number Publication date
CN112653902B (zh) 2023-04-11

Similar Documents

Publication Publication Date Title
CN112653902B (zh) 说话人识别方法、装置及电子设备
CN105247879B (zh) 客户机设备、控制方法、系统和程序
US8972262B1 (en) Indexing and search of content in recorded group communications
CN108847214B (zh) 语音处理方法、客户端、装置、终端、服务器和存储介质
US9621851B2 (en) Augmenting web conferences via text extracted from audio content
WO2022121601A1 (zh) 一种直播互动方法、装置、设备及介质
US8411130B2 (en) Apparatus and method of video conference to distinguish speaker from participants
CN111294606B (zh) 直播处理方法、装置、直播客户端及介质
CN105551498A (zh) 一种语音识别的方法及装置
CN114727120B (zh) 直播音频流的获取方法、装置、电子设备及存储介质
WO2019047850A1 (zh) 标识的显示方法和装置、请求的响应方法和装置
CN110427099A (zh) 信息记录方法、装置、系统、电子设备以及信息获取方法
CN112954390A (zh) 视频处理方法、装置、存储介质及设备
CN113792178B (zh) 一种歌曲生成方法、装置、电子设备及存储介质
CN111556279A (zh) 即时会话的监控方法和通信方法
CN109729367B (zh) 提供直播媒体内容信息的方法、装置及电子设备
CN112532931A (zh) 一种视频处理方法、装置和电子设备
CN114390306A (zh) 一种直播互动摘要生成方法和装置
CN114341866A (zh) 同声传译方法、装置、服务器和存储介质
CN116996702A (zh) 演唱会直播处理方法、装置、存储介质和电子设备
WO2020154883A1 (zh) 语音信息的处理方法、装置、存储介质及电子设备
CN112584225A (zh) 视频录制处理方法、视频播放控制方法及电子设备
US10657202B2 (en) Cognitive presentation system and method
CN111161710A (zh) 同声传译方法、装置、电子设备及存储介质
CN112565913B (zh) 视频通话方法、装置和电子设备

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant