CN117242517A - 音频信号处理方法及装置、通信设备、通信系统、存储介质 - Google Patents
音频信号处理方法及装置、通信设备、通信系统、存储介质 Download PDFInfo
- Publication number
- CN117242517A CN117242517A CN202380010554.7A CN202380010554A CN117242517A CN 117242517 A CN117242517 A CN 117242517A CN 202380010554 A CN202380010554 A CN 202380010554A CN 117242517 A CN117242517 A CN 117242517A
- Authority
- CN
- China
- Prior art keywords
- window function
- value
- audio signal
- variable
- processing
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
- G10L25/21—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being power information
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/45—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of analysis window
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Telephonic Communication Services (AREA)
Abstract
本公开提出一种音频信号处理方法及装置、通信设备、通信系统、存储介质,该方法包括:确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延;以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。本公开的方法,实现有效地降低音频信号处理的延时。
Description
技术领域
本公开涉及通信技术领域,尤其涉及一种音频信号处理方法及装置、通信设备、通信系统、存储介质。
背景技术
数字化的音频信号通常数据量较大,不适合存储和传输的应用需求。因此,通常会采用数字音频的压缩编码技术对音频信号进行压缩编码处理。数字音频的压缩编码技术,已经成为一门非常重要的音频信号处理技术。
发明内容
本公开实施例提供一种音频信号处理方法、装置、设备、芯片系统、存储介质、计算机程序及计算机程序产品,可应用于通信技术领域中,音频信号处理时首先将音频信号分割成预定时间段长度的音频信号,用于解决“对音频信号进行压缩编码过程会引入延时,从而影响音频信号恢复的时效性”这一技术问题。
本公开提出音频信号处理方法及装置、通信设备、通信系统、存储介质。
根据本公开实施例的第一方面,提出了一种音频信号处理方法,包括:确定处理第一音频信号所需的窗函数长度值;确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延;以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。
根据本公开实施例的第二方面,提出了一种音频信号处理方法,包括:获取与第一音频信号相关的谱系数;确定第一窗函数,其中,第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延;根据第一窗函数处理谱系数,得到第一音频信号。
根据本公开实施例的第三方面,提出了一种音频信号处理方法,包括:第一通信设备,用于确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数;第二通信设备,用于获取与第一音频信号相关的谱系数,并根据第一窗函数处理谱系数,得到第一音频信号。
根据本公开实施例的第四方面,提出了一种音频信号处理装置,包括:处理模块,用于确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。
根据本公开实施例的第五方面,提出了一种音频信号处理装置,包括:处理模块,用于获取与第一音频信号相关的谱系数,并确定第一窗函数,其中,第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理谱系数,得到第一音频信号。
根据本公开实施例的第六方面,提出了一种通信设备,包括:一个或多处理器;其中,处理器用于调用指令以使得通信设备执行第一方面、第二方面、第三方面中任一方面的音频信号处理方法。
根据本公开实施例的第七方面,提出了一种通信系统,其特征在于,包括第一通信设备和第二通信设备,其中,第一通信设备被配置为实现第一方面的音频信号处理方法,第二通信设备被配置为实现第二方面的音频信号处理方法。
根据本公开实施例的第八方面,提出了一种存储介质,存储介质存储有指令,其特征在于,当指令在通信设备上运行时,使得通信设备执行如第一方面、第二方面、第三方面中任一方面的音频信号处理方法。
附图说明
为了更清楚地说明本公开实施例或背景技术中的技术方案,下面将对本公开实施例或背景技术中所需要使用的附图进行说明。
图1是根据本公开实施例示出的通信系统的架构示意图;
图2是AVS3中MDCT模块中对信号进行加窗的的示意图;
图3A是根据本公开一实施例示出的音频信号处理方法的交互示意图;
图3B是根据本公开另一实施例示出的音频信号处理方法的交互示意图;
图4A是根据本公开另一实施例示出的音频信号处理方法的交互示意图;
图4B是根据本公开另一实施例示出的音频信号处理方法的交互示意图;
图5A是根据本公开另一实施例示出的音频信号处理方法的交互示意图;
图5B是根据本公开另一实施例示出的音频信号处理方法的交互示意图;
图6A是本公开实施例中一实施例示出的时域信号编码处理的流程示意图;
图6B是本公开实施例中低延时窗的函数示意图;
图6C是本公开实施例中一实施例示出的解码处理的流程示意图;
图6D是本公开实施例中信号重叠相加示意图;
图7A是本公开实施例中Wav测试文件一的波形示意图;
图7B为本公开实施例中与Wav测试文件一的波形对应的输出信号1的示意图;
图7C为本公开实施例中与Wav测试文件一的波形对应的输出信号2的示意图;
图7D是本公开实施例中Wav测试文件二的波形示意图;
图7E为本公开实施例中与Wav测试文件二的波形对应的输出信号1的示意图;
图7F为本公开实施例中与Wav测试文件二的波形对应的输出信号2的示意图;
图7G是本公开实施例中Wav测试文件三的波形示意图;
图7H为本公开实施例中与Wav测试文件三的波形对应的输出信号1的示意图;
图7I为本公开实施例中与Wav测试文件三的波形对应的输出信号2的示意图;
图8A是本公开实施例提出的音频信号处理装置的结构示意图;
图8B是本公开实施例提出的音频信号处理装置的结构示意图;
图9A是本公开实施例提出的通信设备的结构示意图;
图9B是本公开实施例提出的芯片的结构示意图。
具体实施方式
本公开实施例提出了音频信号处理方法及装置、通信设备、通信系统、存储介质。在一些实施例中,音频信号处理方法与信息处理方法、通信方法等术语可以相互替换,音频信号处理装置与信息处理装置、通信装置等术语可以相互替换,信息处理系统、通信系统等术语可以相互替换。
本公开实施例并非穷举,仅为部分实施例的示意,不作为对本公开保护范围的具体限制。在不矛盾的情况下,某一实施例中的每个步骤均可以作为独立实施例来实施,且各步骤之间可以任意组合,例如,在某一实施例中去除部分步骤后的方案也可以作为独立实施例来实施,且在某一实施例中各步骤的顺序可以任意交换,另外,某一实施例中的可选实现方式可以任意组合;此外,各实施例之间可以任意组合,例如,不同实施例的部分或全部步骤可以任意组合,某一实施例可以与其他实施例的可选实现方式任意组合。
在各本公开实施例中,如果没有特殊说明以及逻辑冲突,各实施例之间的术语和/或描述具有一致性,且可以互相引用,不同实施例中的技术特征根据其内在的逻辑关系可以组合形成新的实施例。
本公开实施例中所使用的术语只是为了描述特定实施例的目的,而并非作为对本公开的限制。
在本公开实施例中,除非另有说明,以单数形式表示的元素,如“一个”、“一种”、“该”、“上述”、“所述”、“前述”、“这一”等,可以表示“一个且只有一个”,也可以表示“一个或多个”、“至少一个”等。例如,在翻译中使用如英语中的“a”、“an”、“the”等冠词(article)的情况下,冠词之后的名词可以理解为单数表达形式,也可以理解为复数表达形式。
在本公开实施例中,“多个”是指两个或两个以上。
在一些实施例中,“至少一者(at least one of)”、“至少一项(at least oneof)”、“至少一个(at least one of)”、“一个或多个(one or more)”、“多个(a pluralityof)”、“多个(multiple)等术语可以相互替换。
本公开实施例中的如“A、B、C……中的至少一者”、“A和/或B和/或C……”等描述方式,包括了A、B、C……中任意一个单独存在的情况,也包括了A、B、C……中任意多个的任意组合情况,每种情况可以单独存在;例如,“A、B、C中的至少一者”包括单独A、单独B、单独C、A和B组合、A和C组合、B和C组合、A和B和C组合的情况;例如,A和/或B包括单独A、单独B、A和B的组合的情况。
在一些实施例中,“在一情况下A,在另一情况下B”、“响应于一情况A,响应于另一情况B”等记载方式,根据情况可以包括以下技术方案:与B无关地执行A,即,在一些实施例中A;与A无关地执行B,即,在一些实施例中B;A和B被选择性执行,即,在一些实施例中从A与B中选择执行;A和B都被执行,即,在一些实施例中A和B。当有A、B、C等更多分支时也类似上述。
本公开实施例中的“第一”、“第二”等前缀词,仅仅为了区分不同的描述对象,不对描述对象的位置、顺序、优先级、数量或内容等构成限制,对描述对象的陈述参见权利要求或实施例中上下文的描述,不应因为使用前缀词而构成多余的限制。例如,描述对象为“字段”,则“第一字段”和“第二字段”中“字段”之前的序数词并不限制“字段”之间的位置或顺序,“第一”和“第二”并不限制其修饰的“字段”是否在同一个消息中,也不限制“第一字段”和“第二字段”的先后顺序。再如,描述对象为“等级”,则“第一等级”和“第二等级”中“等级”之前的序数词并不限制“等级”之间的优先级。再如,描述对象的数量并不受序数词的限制,可以是一个或者多个,以“第一装置”为例,其中“装置”的数量可以是一个或者多个。此外,不同前缀词修饰的对象可以相同或不同,例如,描述对象为“装置”,则“第一装置”和“第二装置”可以是相同的装置或者不同的装置,其类型可以相同或不同;再如,描述对象为“信息”,则“第一信息”和“第二信息”可以是相同的信息或者不同的信息,其内容可以相同或不同。
在一些实施例中,“包括A”、“包含A”、“用于指示A”、“携带A”,可以解释为直接携带A,也可以解释为间接指示A。
在一些实施例中,“响应于……”、“响应于确定……”、“在……的情况下”、“在……时”、“当……时”、“若……”、“如果……”等术语可以相互替换。
在一些实施例中,“大于”、“大于或等于”、“不小于”、“多于”、“多于或等于”、“不少于”、“高于”、“高于或等于”、“不低于”、“以上”等术语可以相互替换,“小于”、“小于或等于”、“不大于”、“少于”、“少于或等于”、“不多于”、“低于”、“低于或等于”、“不高于”、“以下”等术语可以相互替换。
在一些实施例中,装置等可以解释为实体的、也可以解释为虚拟的,其名称不限定于实施例中所记载的名称,“装置”、“设备(equipment)”、“设备(device)”、“电路”、“网元”、“节点”、“功能”、“单元”、“部件(section)”、“系统”、“网络”、“芯片”、“芯片系统”、“实体”、“主体”等术语可以相互替换。
在一些实施例中,“网络”可以解释为网络中包含的装置(例如,接入网设备、核心网设备等)。
在一些实施例中,“接入网设备(access network device,AN device)”、“无线接入网设备(radio access network device,RAN device)”、“基站(base station,BS)”、“无线基站(radio base station)”、“固定台(fixed station)”、“节点(node)”、“接入点(access point)”、“发送点(transmission point,TP)”、“接收点(reception point,RP)”、“发送接收点(transmission/reception point,TRP)”、“面板(panel)”、“天线面板(antenna panel)”、“天线阵列(antenna array)”、“小区(cell)”、“宏小区(macro cell)”、“小型小区(small cell)”、“毫微微小区(femto cell)”、“微微小区(pico cell)”、“扇区(sector)”、“小区组(cell group)”、“载波(carrier)”、“分量载波(component carrier)”、“带宽部分(bandwidth part,BWP)”等术语可以相互替换。
在一些实施例中,“终端(terminal)”、“终端设备(terminal device)”、“用户设备(user equipment,UE)”、“用户终端(user terminal)”、“移动台(mobile station,MS)”、“移动终端(mobile terminal,MT)”、订户站(subscriber station)、移动单元(mobileunit)、订户单元(subscriber unit)、无线单元(wireless unit)、远程单元(remoteunit)、移动设备(mobiledevice)、无线设备(wireless device)、无线通信设备(wirelesscommunication device)、远程设备(remote device)、移动订户站(mobile subscriberstation)、接入终端(access terminal)、移动终端(mobile terminal)、无线终端(wireless terminal)、远程终端(remote terminal)、手持设备(handset)、用户代理(useragent)、移动客户端(mobile client)、客户端(client)等术语可以相互替换。
在一些实施例中,获取数据、信息等可以遵照所在地国家的法律法规。
在一些实施例中,可以在得到用户同意后获取数据、信息等。
此外,本公开实施例的表格中的每一元素、每一行、或每一列均可以作为独立实施例来实施,任意元素、任意行、任意列的组合也可以作为独立实施例来实施。
本公开中各表所示的对应关系可以被配置,也可以是预定义的。各表中的信息的取值仅仅是举例,可以配置为其他值,本公开并不限定。在配置信息与各参数的对应关系时,并不一定要求必须配置各表中示意出的所有对应关系。例如,本公开中的表格中,某些行示出的对应关系也可以不配置。又例如,可以基于上述表格做适当的变形调整,例如,拆分,合并等等。上述各表中标题示出参数的名称也可以采用通信装置可理解的其他名称,其参数的取值或表示方式也可以通信装置可理解的其他取值或表示方式。上述各表在实现时,也可以采用其他的数据结构,例如可以采用数组、队列、容器、栈、线性表、指针、链表、树、图、结构体、类、堆、散列表或哈希表等。
本公开中的预定义可以理解为定义、预先定义、存储、预存储、预协商、预配置、固化、或预烧制。
图1是根据本公开实施例示出的通信系统的架构示意图。如图1所示,通信系统100可以包括终端(terminal)101、网络设备102。网络设备102可以包括接入网设备和核心网设备(core network device)的至少一者。
在一些实施例中,终端101例如包括手机(mobile phone)、可穿戴设备、物联网设备、具备通信功能的汽车、智能汽车、平板电脑(Pad)、带无线收发功能的电脑、虚拟现实(virtual reality,VR)终端设备、增强现实(augmented reality,AR)终端设备、工业控制(industrial control)中的无线终端设备、无人驾驶(self-driving)中的无线终端设备、远程手术(remote medical surgery)中的无线终端设备、智能电网(smart grid)中的无线终端设备、运输安全(transportation safety)中的无线终端设备、智慧城市(smart city)中的无线终端设备、智慧家庭(smart home)中的无线终端设备中的至少一者,但不限于此。
在一些实施例中,接入网设备例如是将终端接入到无线网络的节点或设备,接入网设备可以包括5G通信系统中的演进节点B(evolved NodeB,eNB)、下一代演进节点B(nextgeneration eNB,ng-eNB)、下一代节点B(next generation NodeB,gNB)、节点B(node B,NB)、家庭节点B(home node B,HNB)、家庭演进节点B(home evolved nodeB,HeNB)、无线回传设备、无线网络控制器(radio network controller,RNC)、基站控制器(base stationcontroller,BSC)、基站收发台(base transceiver station,BTS)、基带单元(base bandunit,BBU)、移动交换中心、6G通信系统中的基站、开放型基站(Open RAN)、云基站(CloudRAN)、其他通信系统中的基站、WiFi系统中的接入节点中的至少一者,但不限于此。
在一些实施例中,本公开的技术方案可适用于Open RAN架构,此时,本公开实施例所涉及的接入网设备间或者接入网设备内的接口可变为Open RAN的内部接口,这些内部接口之间的流程和信息交互可以通过软件或者程序实现。
在一些实施例中,接入网设备可以由集中单元(central unit,CU)与分布式单元(distributed unit,DU)组成的,其中,CU也可以称为控制单元(control unit),采用CU-DU的结构可以将接入网设备的协议层拆分开,部分协议层的功能放在CU集中控制,剩下部分或全部协议层的功能分布在DU中,由CU集中控制DU,但不限于此。
在一些实施例中,核心网设备可以是一个设备,包括一个或多个网元,也可以是多个设备或设备群,分别包括一个或多个网元中的全部或部分。网元可以是虚拟的,也可以是实体的。核心网,例如包括演进分组核心(Evolved Packet Core,EPC)、5G核心网络(5GCore Network,5GCN)、下一代核心(Next Generation Core,NGC)中的至少一者。
可以理解的是,本公开实施例描述的通信系统是为了更加清楚的说明本公开实施例的技术方案,并不构成对于本公开实施例提出的技术方案的限定,本领域普通技术人员可知,随着系统架构的演变和新业务场景的出现,本公开实施例提出的技术方案对于类似的技术问题同样适用。
下述本公开实施例可以应用于图1所示的通信系统100、或部分主体,但不限于此。图1所示的各主体是例示,通信系统可以包括图1中的全部或部分主体,也可以包括图1以外的其他主体,各主体数量和形态为任意,各主体之间的连接关系是例示,各主体之间可以不连接也可以连接,其连接可以是任意方式,可以是直接连接也可以是间接连接,可以是有线连接也可以是无线连接。
本公开各实施例可以应用于长期演进(Long Term Evolution,LTE)、LTE-Advanced(LTE-A)、LTE-Beyond(LTE-B)、SUPER 3G、IMT-Advanced、第四代移动通信系统(4th generation mobile communication system,4G)、)、第五代移动通信系统(5thgeneration mobile communication system,5G)、5G新空口(new radio,NR)、未来无线接入(Future Radio Access,FRA)、新无线接入技术(New-Radio Access Technology,RAT)、新无线(New Radio,NR)、新无线接入(New radio access,NX)、未来一代无线接入(Futuregeneration radio access,FX)、Global System for Mobile communications(GSM(注册商标))、CDMA2000、超移动宽带(Ultra Mobile Broadband,UMB)、IEEE 802.11(Wi-Fi(注册商标))、IEEE 802.16(WiMAX(注册商标))、IEEE 802.20、超宽带(Ultra-WideBand,UWB)、蓝牙(Bluetooth(注册商标))、陆上公用移动通信网(Public Land Mobile Network,PLMN)网络、设备到设备(Device-to-Device,D2D)系统、机器到机器(Machine to Machine,M2M)系统、物联网(Internet of Things,IoT)系统、车联网(Vehicle-to-Everything,V2X)、利用其他通信方法的系统、基于它们而扩展的下一代系统等。此外,也可以将多个系统组合(例如,LTE或者LTE-A与5G的组合等)应用。
数字化的音频信号通常数据量较大,不适合存储和传输的应用需求。因此,通常会采用数字音频的压缩编码技术对音频信号进行压缩编码处理。数字音频的压缩编码技术,已经成为一门非常重要的音频信号处理技术。
可选地,数字音频的压缩编码技术,可以例如是改进离散余弦变换(ModifiedDiscrete Cosine Transform,MDCT)是一种用于多媒体信号压缩的算法。MDCT是基于时间-频率分解的理论,用于将频域信号分成多个子带进行分析和处理。可以使用窗函数将时间域的信号分成一系列预定时间段长度的信号设定的时间段,并对每个时间段信号进行离散余弦变换(Discrete Cosine Transform,DCT),而后,再将之组成频谱。由于使用了窗函数,从而可以减少DCT突变带来的音频伪影,提高音频的质量。
可选地,高级音频编码(Advanced Audio Coding,AAC)、动态影像专家压缩标准音频层面3(Moving Picture Experts Group Audio Layer III,MP3)和AC-3(AC-3是一种数字多媒体技术)等,均使用MDCT算法来进行音频信号压缩。并且在H.264(H.264是一种高度压缩数字视频编解码器标准)和高效率视频编码(High Efficiency Video Coding,HEVC)等视频编码标准中也广泛应用了MDCT技术来进行视频信号压缩。除此之外,MDCT在光谱分析、人造语音合成、图像等领域有着广泛的应用。
如图2所示,图2是AVS3中MDCT模块中对信号进行加窗的的示意图,其中,AVS3是一种音视频信源编码标准,对于N点序列X(n),其MDCT的数学表达式为:
其中, x(n)表示输入信号。
IMDCT的数学表达式为:
其中,n=0,1,...,N-1。
在音频编解码中常用的窗函数为:
其中,w(n)表示窗函数。
可选的,大多数音频编码器均是先对信号加窗,后进行MDCT处理,以AVS3举例,主要有4种类型的窗,其中长短窗和短长窗是切换窗,也称为过渡窗。当信息发生突变时,可以使用短窗进行MDCT处理,此时,可以从长窗过渡到短窗,可以使用过渡窗。还有两种窗,即长窗和短窗,是音频编码中最常用的窗,长窗一般为2048个点,短窗为256个点。以长窗为例,信号通过在编码端经过加窗、MDCT处理,在解码端经过IMDCT和加窗,利用时域混叠抵消技术(Time Domain Aliasing Cancellation,TDAC),对信号进行50%的重叠相加,使得信号完美重建。
可选的,为了能完美重建信号,可以对信号进行重叠相加。例如,可以采用2N个点来进行MDCT处理,得到N个谱系数。其中2N个点的组成为上一帧的N个点和当前帧的N个点,如图2所示,当解码端恢复信号时,通过对上一帧的N个点和当前帧的N点进行重叠相加得到N个点,窗的长度为2N,即有50%的重叠相加。但是,当处理当前帧的2N个点时,只能恢复当前帧的N个点,而在下一帧恢复剩下的N个点。此时,产生的算法延时为N。因此,在AVS3中,通过加窗会产生固有的算法延时N。也即是说,对音频信号进行压缩编码过程会引入延时,从而影响音频信号恢复的时效性。
本公开实施例示出的方法,通过改变的窗的形状以及参数,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
本公开实施例示出的方法,能够应用于各种音频编码、视频编码、音频合成等领域,除此之外,还可以用于信号和图像的分析和处理、通信的调制和解调以及数学分析等应用场景。
图3A是根据本公开一实施例示出的音频信号处理方法的交互示意图。如图3A所示,本公开实施例涉及音频信号处理方法,可以用于通信系统100,本实施例可以应用于对第一音频信号进行编码处理的过程中,上述通信系统100中的终端101和/或网络设备102均可以对第一音频信号进行编码处理。当然,其他任意可能的具有编码处理功能的设备、装置、组件、模块等,同样可以使用本公开实施例中提供的音频信号处理方法对第一音频信号进行编码处理。上述方法包括:
步骤S3101,确定能量阈值。
一些实施例中,能量阈值,是指确定信号中每个子信号块的能量大小的门限值。示例的,如果子信号块的能量大于或等于能量阈值,表示子信号块的能量相对较大,如果子信号块的能量小于能量阈值,表示子信号块的能量相对较小。
一些实施例中,能量阈值可以根据音频信号处理需求自适应调整,也可以基于协议约定。
步骤S3102,确定与第一音频信号中每个子信号块对应的能量值。
一些实施例中,第一音频信号是指待处理的信号。可以对第一音频信号进行划分,得到多个子信号块,分别分析每个子信号块的能量情况。可以使用量化的能量值表达每个子信号块的能量情况。每个子信号块的能量值可以被用于确定处理第一音频信号所需的窗函数长度值,该窗函数长度值决定了是采用长窗处理第一音频信号,还是采用短窗处理第一音频信号。
一些实施例中,可以基于任意可能的能量分析方法分析每个子信号块的能量值。
一些实施例中,子信号块,也可以被称为子块。
步骤S3103,根据能量阈值和多个能量值,确定窗函数长度值。
一些实施例中,窗函数长度值可以用N来表示,窗函数长度值可以用于表示窗的大小。
一些实施例中,在确定能量阈值和每个子信号块的能量值之后,可以参考能量阈值和多个能量值来确定窗函数长度值。
一些实施例中,可以每个能量值和能量阈值的大小比对情况,根据大小比对情况来选择合适的窗函数长度值。
一些实施例中,可以确定窗的大小。示例的,可以通过比较能量阈值和每个子块能量(子信号块的能量值的一个可选示例)的大小,即可得出窗的大小。示例的,当有一个子块能量大于能量阈值时,即判定为短窗,当所有的子块能量均小于或等于能量阈值时,判定为长窗,其中,短窗和长窗可以是用不同的窗函数长度值来区分。示例的,长窗的窗函数长度值可以是第一窗函数长度值,短窗的窗函数长度值可以是第二窗函数长度值,第二窗函数长度值可以远小于第一窗函数长度值。
一些实施例中,如果对第一音频信号划分得到多个子信号块,其中与多个子信号块分别对应的多个能量值均小于或等于能量阈值,则确定窗函数长度值为第一窗函数长度值,即表示可以基于长窗处理第一音频信号。一些实施例中,如果对第一音频信号划分得到多个子信号块,其中与多个子信号块分别对应的多个能量值中至少一个能量值大于能量阈值,则确定窗函数长度值为第二窗函数长度值,其中,第二窗函数长度值小于第一窗函数长度值,即表示可以基于短窗处理第一音频信号。
由此,通过对第一音频信号进行能量分析,并为第一音频信号的处理确定一个合适的窗函数长度值,实现选择出合适的窗来对第一音频信号进行截断处理,提升第一音频信号编码处理的准确度和编码处理效果。
步骤S3104,根据窗函数长度值、与窗函数长度值相关的参考变量值、第一变量以及第二窗函数确定第一窗函数。
一些实施例中,第一窗函数是本公开实施例中用于对第一音频信号进行截断处理的窗函数。
一些实施例中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延。
一些实施例中,第二窗函数可以例如是已有的窗函数。第二窗函数可以具体例如是在音频编解码中常用的窗函数为:
其中,w(n)表示第二窗函数。
可以理解的是,在使用音频编解码中常用的窗函数对第一音频信号进行截断处理后并频域变换,如果需恢复第一音频信号,则通常会存在一定的时延,通常该时延是与N相关的,N越大,则时延越大,N越小则时延越小。为了有效地降低恢复第一音频信号所需要的时延,本公开实施例中可以对上述窗函数作出一定的改进处理。示例的,可以参考窗函数长度值、与窗函数长度值相关的参考变量值、第一变量对第二窗函数进行一定的改进处理,并将改进处理所得的窗函数作为第一窗函数。
一些实施例中,窗函数长度值可以用N表示,与窗函数长度值相关的参考变量值可以用X表示,第一变量可以用n表示,第一变量也可以被称为离散时间轴的序号,参考变量值小于窗函数长度值(即X小于N),参考变量值用于确定恢复第一音频信号所需要的时延。也即是说,本公开实施例中改进的窗函数,参考变量值X是与恢复第一音频信号所需要的时延相关的(即恢复第一音频信号所需要的时延,是由参考变量值X决定而不是由窗函数长度值N决定),并且由于参考变量值X小于窗函数长度值N。由于降低了恢复第一音频信号所需要的时延。因此。通过改变的窗的形状以及参数,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
本公开实施例中,通过参考窗函数长度值、与窗函数长度值相关的参考变量值、第一变量对第二窗函数进行一定的改进处理,并将改进处理所得的窗函数作为第一窗函数。实现在支持尽可能降低恢复第一音频信号所需要的时延的同时,还能够有效避免引入过多的运算开销,
一些实施例中,第一窗函数满足第一条件,第一条件包括:第一值和第二值的和值为1;其中,第一值是基于第一窗函数处理第一变量所得的值的平方,第二值是基于第一窗函数处理第二变量所得的值的平方,第二变量为第一变量和窗函数长度值之间的和值。
一些实施例中,第一条件是能够支持降低恢复第一音频信号所需要的时延,并且支持第一音频信号能够被有效恢复的第一窗函数需要满足的条件。第一变量为n,第二变量为n+N,第一值是基于第一窗函数处理第一变量所得的值的平方,第二值是基于第一窗函数处理第二变量所得的值的平方,第一值和第二值的和值需要为1。
一些实施例中,通过配置第一条件,能够基于该第一条件对第一窗函数进行灵活地配置处理,有效地适用于个性化的音频信号处理场景,提升信号编码处理灵活性和编码处理效果。
一些实施例中,第一条件为以下公式:W(n)2+W(n+N)2=1;其中,n表示第一变量,N表示窗函数长度值,W()表示第一窗函数,从而能够提升第一条件的配置便捷性。
一些实施例中,第一窗函数包括以下至少一项:与第一变量对应的第一函数部分,其中,第一变量属于第一取值范围;与第一变量对应的第二函数部分,其中,第一变量属于第二取值范围;与第一变量对应的第三函数部分,其中,第一变量属于第三取值范围;与第一变量对应的第四函数部分,其中,第一变量属于第四取值范围;其中,不同取值范围之间不存在交集部分,且取值范围是根据窗函数长度值和参考变量值对参考取值范围分割得到,参考取值范围的最小值为零,最大值为两倍的窗函数长度,不同函数部分之间互不相同,至少一个函数部分与第二窗函数相关,且至少一个函数部分为恒定值。在基于改进后第一窗函数对第一音频信号进行截断处理后,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
一些实施例中,第一窗函数可以为分段函数,包含不同的函数部分,当第一变量n位于不同的取值范围时,可以对应采用不同的函数部分。第一取值范围例如0≤n<N-X,即第一变量n大于或等于0,且小于窗函数长度值和参考变量值之间的差值;第二取值范围例如N-X≤n<N,即第一变量n大于或等于窗函数长度值和参考变量值之间的差值,且小于窗函数长度值;第三取值范围例如N≤n<2N-X,即第一变量n大于或等于窗函数长度值,且小于两倍的窗函数长度值和参考变量值之间的差值;第四取值范围例如2N-X≤n<2N,即第一变量n大于或等于两倍的窗函数长度值和参考变量值之间的差值,且小于两倍的窗函数长度值;相应的,对应前述不同的取值范围,第一窗函数可以具体对应不同的函数部分。示例的,与第一取值范围相对应,第一函数部分可以是恒定值0;与第二取值范围相对应,第二函数部分可以是w(n-N+X);与第三取值范围相对应,第三函数部分可以是恒定值1;与第四取值范围相对应,第四函数部分可以是w(n-2N+2X)。
一些实施例中,第一窗函数可以具体例如为以下公式:
其中,n表示第一变量,N表示窗函数长度值,X表示参考变量值,WD()表示第一窗函数,w()表示第二窗函数,从而能够准确地、清晰地表达第一窗函数,使得第一窗函数能够被准确地用于对第一音频信号进行截断处理。
一些实施例中,参考变量值是与窗函数长度值相关的,也即是说,可以参考处理第一音频信号所需的窗函数长度值确定参考变量值,参考变量值和窗函数长度值之间的关系可以由以下公式表达:其中,N表示窗函数长度值,X表示参考变量值,m为正整数。
由上述公式可以看出,参考变量值是小于窗函数长度值的,并且对已有的第二窗函数进行了改进,以得到第一窗函数,使得该第一窗函数中包含参考变量值,由参考变量值决定恢复第一音频信号所需的时延。因此,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
步骤S3105,根据第一窗函数处理第一音频信号,得到中间音频信号。
一些实施例中,在确定第一窗函数后,可以采用第一窗函数对第一音频信号进行截断处理,所得信号可以被称为中间音频信号。示例的,可以对第一窗函数和第一音频信号相乘,得到中间音频信号。
一些实施例中,根据第一窗函数处理第一音频信号,也可以被称为加窗。示例的,将输入信号(第一音频信号的一个可选示例)乘以窗函数(第一窗函数的一个可选示例),即X(n)=W(n)*input(n),其中W(n)为第一窗函数,input(n)为输入信号,X(n)为加窗后的信号(中间音频信号的一个可选示例)。
步骤S3106,根据第一处理信息处理中间音频信号,得到与第一音频信号相关的谱系数,其中,第一处理信息包括:参考变量值。
在一些实施例中,可以采用第一处理信息处理中间音频信号,得到与第一音频信号相关的谱系数,第一处理信息用于对中间音频信号进行改进离散余弦变换处理。
在一些实施例中,第一处理信息是指进行改进离散余弦变换处理所需要的信息。
由于第一窗函数是改进了的窗函数,第一窗函数包含了参考变量值,为了有效地根据中间音频信号确定与第一音频信号相关的谱系数,还可以将参考变量值包含在第一处理信息中,使得第一处理信息能够有效地适用于对中间音频信号的变换处理。
在一些实施例中,第一处理信息为以下公式:
其中,k=0,1,...,N-1,n表示第一变量,N表示窗函数长度值,X表示参考变量值,x(n)表示中间音频信号,X(k)表示谱系数。由此,实现将参考变量值包含在改进离散余弦变换的公式中,使得改进离散余弦变换的公式能够有效地适用于对中间音频信号进行改进离散余弦变换处理。
在一些实施例中,编码端在根据第一处理信息处理中间音频信号,得到与第一音频信号相关的谱系数之后,可以将与第一音频信号相关的谱系数传输至解码端,由解码端根据与第一音频信号相关的谱系数恢复第一音频信号。
本公开实施例所涉及的音频信号处理方法可以包括步骤S3101~步骤S3106中的至少一者。例如,步骤S3101可以作为独立实施例来实施,步骤S3102可以作为独立实施例来实施,以此类推,但不限于此。步骤S3101+S3102可以作为独立实施例来实施,步骤S3101+S3102+S3103可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
本实施例中,通过确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。通过改变的窗的形状以及参数,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
图3B是根据本公开另一实施例示出的音频信号处理方法的交互示意图。如图3B所示,本公开实施例涉及音频信号处理方法,可以用于通信系统100,本实施例可以应用于对第一音频信号进行解码处理的过程中,上述通信系统100中的终端101和/或网络设备102均可以对第一音频信号进行解码处理。当然,其他任意可能的具有解码处理功能的设备、装置、组件、模块等,同样可以使用本公开实施例中提供的音频信号处理方法对第一音频信号进行解码处理。另外,编码处理和解码处理,可以是由相同的设备实施,或者也可以是由不同的设备实施,对此不做限制。上述方法包括:
步骤S3201,获取与第一音频信号相关的谱系数。
一些实施例中,可以获取编码端对第一音频信号编码处理得到的谱系数。示例的,编码端在根据第一处理信息处理中间音频信号,得到与第一音频信号相关的谱系数之后,可以将与第一音频信号相关的谱系数传输至解码端,由此,解码端可以从编码端获取与第一音频信号相关的谱系数,并根据与第一音频信号相关的谱系数恢复第一音频信号。
步骤S3202,根据处理第一音频信号所使用窗函数长度值、与窗函数长度值相关的参考变量值、第一变量以及第二窗函数确定第一窗函数。
一些实施例中,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延。在本实施例中,针对处理第一音频信号所使用窗函数长度值、与窗函数长度值相关的参考变量值、第一变量以及第二窗函数的描述说明,以及针对确定第一窗函数的描述说明可以具体参见上述实施例,在此不再赘述。
步骤S3203,根据第二处理信息处理谱系数,得到中间音频信号,其中,第二处理信息包括:参考变量值。
在一些实施例中,第二处理信息是指进行逆改进离散余弦变换处理所需要的信息。
在一些实施例中,可以采用第二处理信息处理谱系数,得到中间音频信号,第二处理信息用于对谱系数进行逆改进离散余弦变换处理。
由于第一窗函数是改进了的窗函数,第一窗函数包含了参考变量值,为了有效地根据与第一音频信号相关的谱系数恢复中间音频信号,还可以将参考变量值包含在第二处理信息中,使得第二处理信息能够有效地适用于对与第一音频信号相关的谱系数的变换处理。
在一些实施例中,第二处理信息为以下公式:
其中,n=0,1,...,2N-1,n表示第一变量,N表示窗函数长度值,X表示参考变量值,x(n)表示中间音频信号,X(k)表示谱系数。由此,实现将参考变量值包含在逆改进离散余弦变换的公式中,使得逆改进离散余弦变换的公式能够有效地适用于对与第一音频信号相关的谱系数进行逆改进离散余弦变换处理。
步骤S3204,根据第一窗函数处理中间音频信号,得到第一音频信号。
一些实施例中,在采用上述第二处理信息处理与第一音频信号相关的谱系数,得到中间音频信号之后,可以对中间音频信号加窗,以恢复第一音频信号。示例的,对中间音频信号进行加窗,即将输入信号(例如中间音频信号)乘以窗函数(第一窗函数的一个可选示例),公式如下:即X(n)=W(n)*input(n),其中W(n)为第一窗函数,input(n)为输入信号,X(n)为加窗后的信号。
一些实施例中,可以对加窗后的信号进行重叠相加,以恢复得到第一音频信号。示例的,可以将上一帧的X个点与当前帧的N-X到N个点进行重叠相加,以恢复出X个点,加上当前帧的N-X个点(该N-X个点不用被重叠相加),一共恢复出N个点,而当前帧的2N-X到2N部分的X个点到下一帧才能恢复出来,所以延时为X。
本公开实施例所涉及的音频信号处理方法可以包括步骤S3201~步骤S3204中的至少一者。例如,步骤S3201可以作为独立实施例来实施,步骤S3202可以作为独立实施例来实施,以此类推,但不限于此。步骤S3201+S3202可以作为独立实施例来实施,步骤S3201+S3202+S3203可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
本实施例中,通过获取与第一音频信号相关的谱系数,并确定第一窗函数,其中,第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理谱系数,得到第一音频信号。通过改变的窗的形状以及参数,实现降低对音频信号进行压缩编码过程所引入的延时,从而能够有效地提升音频信号恢复的时效性。
图4A是根据本公开另一实施例示出的音频信号处理方法的交互示意图。如图4A所示,本公开实施例涉及音频信号处理方法,可以用于编码处理过程中,上述方法包括:
步骤S4101,确定处理第一音频信号所需的窗函数长度值。
步骤S4102,确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延。
步骤S4103,根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。
本公开实施例所涉及的音频信号处理方法可以包括步骤S4101~步骤S4103中的至少一者。例如,步骤S4101可以作为独立实施例来实施,步骤S4102可以作为独立实施例来实施,以此类推,但不限于此。步骤S4101+S4102可以作为独立实施例来实施,步骤S4101+S4102+S4103可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
图4B是根据本公开另一实施例示出的音频信号处理方法的交互示意图。如图4B所示,本公开实施例涉及音频信号处理方法,可以用于编码处理过程中,上述方法包括:
步骤S4201,确定能量阈值。
步骤S4202,确定与第一音频信号中每个子信号块对应的能量值。
步骤S4203,根据能量阈值和多个能量值,确定窗函数长度值。
步骤S4204,根据窗函数长度值、与窗函数长度值相关的参考变量值、第一变量以及第二窗函数确定第一窗函数。
步骤S4205,根据第一窗函数处理第一音频信号,得到中间音频信号。
步骤S4206,根据第一处理信息处理中间音频信号,得到与第一音频信号相关的谱系数,其中,第一处理信息包括:参考变量值。
本公开实施例所涉及的音频信号处理方法可以包括步骤S4201~步骤S4206中的至少一者。例如,步骤S4201可以作为独立实施例来实施,步骤S4202可以作为独立实施例来实施,以此类推,但不限于此。步骤S4201+S4202可以作为独立实施例来实施,步骤S4201+S4202+S4203可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
图5A是根据本公开另一实施例示出的音频信号处理方法的交互示意图。如图5A所示,本公开实施例涉及音频信号处理方法,可以用于解码处理过程中,上述方法包括:
步骤S5101,获取与第一音频信号相关的谱系数。
步骤S5102,确定第一窗函数,其中,第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延。
步骤S5103,根据第一窗函数处理谱系数,得到第一音频信号。
本公开实施例所涉及的音频信号处理方法可以包括步骤S5101~步骤S5103中的至少一者。例如,步骤S5101可以作为独立实施例来实施,步骤S5102可以作为独立实施例来实施,以此类推,但不限于此。步骤S5101+S5102可以作为独立实施例来实施,步骤S5101+S5102+S5103可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
图5B是根据本公开另一实施例示出的音频信号处理方法的交互示意图。如图5B所示,本公开实施例涉及音频信号处理方法,可以用于解码处理过程中,上述方法包括:
步骤S5201,获取与第一音频信号相关的谱系数。
步骤S5202,根据处理第一音频信号所使用窗函数长度值、与窗函数长度值相关的参考变量值、第一变量以及第二窗函数确定第一窗函数,其中,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延。
步骤S5203,根据第二处理信息处理谱系数,得到中间音频信号,其中,第二处理信息包括:参考变量值。
步骤S5204,根据第一窗函数处理中间音频信号,得到第一音频信号。
本公开实施例所涉及的音频信号处理方法可以包括步骤S5201~步骤S5204中的至少一者。例如,步骤S5201可以作为独立实施例来实施,步骤S5202可以作为独立实施例来实施,以此类推,但不限于此。步骤S5201+S5202可以作为独立实施例来实施,步骤S5201+S5202+S5203可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
以下为对上述方法的示例性介绍。
可选地实施例:
如图6A所示,图6A是本公开实施例中一实施例示出的时域信号编码处理的流程示意图。如图6A所示,本公开实施例中,示出了编码端流程。以编码端是一个编码器进行示例。
一些实施例中,编码器输入端每次读取N个点,以N取1024点为例,将输入的数据从整形数据变为浮点型数据。
一些实施例中,编码器对第一音频信号以帧为单位进行处理,对读取到的一帧第一音频信号进行能量的计算,计算公式如下:
blockEnergy[i]+=input[i*nblockSize+j]*input[i*nblockSize+j];
其中i=0,1,...,7表示将一帧第一音频信号分为8个子块(子信号块的一个可选示例),blockEnergy[i]表示计算每一个子块的能量,j=0,1,...,127表示每一个子块的大小为128个点,nblockSize表示子块的长度,input表示输入的信号,以上公式正好将1024个点分为8个子块,并计算了每个子块的能量。
一些实施例中,可以确定窗的大小,通过比较门限阈值的能量(能量阈值的一个可选示例)和每个子块能量的大小(能量值的一个可选示例),即可得出窗的大小(窗函数长度值的一个可选示例),当有一个子块的能量大于门限阈值的能量时,即判定为短窗,否则为长窗。
一些实施例中,以窗函数为长窗进行示例。本公开实施例中,可以通过改变窗函数重叠相加部分的长度,以降低延时。改进的窗函数需要满足信号的完美重建。长窗的公式如下:
其中,X为可变参数(上述参考变量值的一个可选示例),其取值为其中m为正整数。本公开实施例中的窗函数一共分为四个部分,第一部分为置零,n的范围从0到N-X,第二部分为w(),n的范围从N-X到N,第三部分为恒定增益1,n的范围从N到2N-X,第四部分的n的范围为2N-X到2N。窗的形状如下图6B所示,图6B是本公开实施例中低延时窗的函数示意图。
一些实施例中,可以对第一音频信号加窗。示例的,将输入信号(第一音频信号的一个可选示例)乘以窗函数(第一窗函数的一个可选示例),即X(n)=W(n)*input(n),其中W(n)为第一窗函数,input(n)为输入信号,X(n)为加窗后的信号(中间音频信号的一个可选示例)。
一些实施例中,可以对加窗后的信号进行MDCT变换,MDCT的公式如下:
其中,k=0,1,...,N-1,n表示第一变量,N表示窗函数长度值,X表示参考变量值,x(n)表示中间音频信号,X(k)表示谱系数。也即是说,对2N个点作MDCT变换,得到N个点的MDCT系数。
如图6C所示,图6C是本公开实施例中一实施例示出的解码处理的流程示意图。如图6C所示,本公开实施例中,示出了解码端流程。
一些实施例中,可以将编码端得到的MDCT系数(第一音频信号的谱系数的一个可选示例)进行逆改进离散余弦变换(Inverse Modified Discrete Cosine Transform,IMDCT)得到时域信号。IMDCT的公式如下:
其中,n=0,1,...,2N-1,n表示第一变量,N表示窗函数长度值,X表示参考变量值,x(n)表示中间音频信号,X(k)表示谱系数。即N个点的频域系数转换为2N个点的时域信号。
一些实施例中,可以通过读取编码端传过来的信息,确定窗型,然后对信号进行加窗,即将输入信号乘以窗函数,示例的,对中间音频信号进行加窗,即将输入信号(例如中间音频信号)乘以窗函数(第一窗函数的一个可选示例),公式如下:即X(n)=W(n)*input(n),其中W(n)为第一窗函数,input(n)为输入信号,X(n)为加窗后的信号。
一些实施例中,加窗之后进行重叠相加,将上一帧的X个点与当前帧的N-X到N个点进行重叠相加,以恢复出X个点,加上当前帧的N-X个点(不用重叠相加),一共恢复出N个点,而当前帧的2N-X到2N部分的X个点到下一帧才能恢复出来,所以延时为X。重叠相加的示意如图6D所示,图6D是本公开实施例中信号重叠相加示意图。
本公开实施例中,可以将原有的长窗替换成上述的低延时窗(第一窗函数的一个可选示例),首先验证使用低延时窗时是否能完美重建,选取X=N/4进行验证。经试验验证,本公开实施例所使用的方法能够将原始信号完全恢复出来,即实现了完美重建,但延时从原来的N变成了X(N/4)。
实验方案:将原音频信号经过已有长窗进行编解码得到输出信号1,再将原音频信号通过改进的低延时窗进行编解码同样得到一个输出信号2,将两者波形的比较。取X=N/32。
如图7A-图7C所示,图7A是本公开实施例中Wav测试文件一的波形示意图。图7B为本公开实施例中与Wav测试文件一的波形对应的输出信号1的示意图。图7C为本公开实施例中与Wav测试文件一的波形对应的输出信号2的示意图。
如图7D-图7F所示,图7D是本公开实施例中Wav测试文件二的波形示意图。图7E为本公开实施例中与Wav测试文件二的波形对应的输出信号1的示意图。图7F为本公开实施例中与Wav测试文件二的波形对应的输出信号2的示意图。
如图7G-图7I所示,图7G是本公开实施例中Wav测试文件三的波形示意图。图7H为本公开实施例中与Wav测试文件三的波形对应的输出信号1的示意图。图7I为本公开实施例中与Wav测试文件三的波形对应的输出信号2的示意图。
从上述图7A-图7I中可知输出信号1和输出信号2与原信号基本一致,本公开实施例中提供的方法,在降低算法延时的同时,还能够有效地保证音频处理的质量。
本公开实施例中还提供了一种音频信号处理方法,第一通信设备确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数;第二通信设备获取与第一音频信号相关的谱系数,并根据第一窗函数处理谱系数,得到第一音频信号。
其中,第一通信设备例如是执行编码过程的通信设备,第二通信设备例如是执行解码过程的通信设备,第一通信设备可以是终端或者网络设备,第二通信设备也可以是终端或者网络设备,第一通信设备和第二通信设备可以是相同或者不相同的通信设备。
图8A是本公开实施例提出的音频信号处理装置的结构示意图。如图8A所示,音频信号处理装置包括:处理模块,用于确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,第一窗函数包括:与窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理第一音频信号,得到与第一音频信号相关的谱系数。
图8B是本公开实施例提出的音频信号处理装置的结构示意图。如图8B所示,音频信号处理装置包括:处理模块,用于获取与第一音频信号相关的谱系数,并确定第一窗函数,其中,第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,参考变量值小于窗函数长度值,参考变量值用于确定恢复第一音频信号所需要的时延,以及根据第一窗函数处理谱系数,得到第一音频信号。
应理解以上装置中各单元或模块的划分仅是一种逻辑功能的划分,在实际实现时可以全部或部分集成到一个物理实体上,也可以物理上分开。此外,装置中的单元或模块可以以处理器调用软件的形式实现:例如装置包括处理器,处理器与存储器连接,存储器中存储有指令,处理器调用存储器中存储的指令,以实现以上任一方法或实现上述装置各单元或模块的功能,其中处理器例如为通用处理器,例如中央处理单元(Central ProcessingUnit,CPU)或微处理器,存储器为装置内的存储器或装置外的存储器。或者,装置中的单元或模块可以以硬件电路的形式实现,可以通过对硬件电路的设计实现部分或全部单元或模块的功能,上述硬件电路可以理解为一个或多个处理器;例如,在一种实现中,上述硬件电路为专用集成电路(application-specific integrated circuit,ASIC),通过对电路内元件逻辑关系的设计,实现以上部分或全部单元或模块的功能;再如,在另一种实现中,上述硬件电路为可以通过可编程逻辑器件(programmable logic device,PLD)实现,以现场可编程门阵列(Field Programmable Gate Array,FPGA)为例,其可以包括大量逻辑门电路,通过配置文件来配置逻辑门电路之间的连接关系,从而实现以上部分或全部单元或模块的功能。以上装置的所有单元或模块可以全部通过处理器调用软件的形式实现,或全部通过硬件电路的形式实现,或部分通过处理器调用软件的形式实现,剩余部分通过硬件电路的形式实现。
如图9A所示,图9A是本公开实施例提出的通信设备的结构示意图,通信设备9100包括一个或多个处理器9101。处理器9101可以是通用处理器或者专用处理器等,例如可以是基带处理器或中央处理器。基带处理器可以用于对通信协议以及通信数据进行处理,中央处理器可以用于对通信装置(如,基站、基带芯片,终端设备、终端设备芯片,DU或CU等)进行控制,执行程序,处理程序的数据。处理器9101用于调用指令以使得通信设备9100执行以上任一方法。
在一些实施例中,通信设备9100还包括用于存储指令的一个或多个存储器9102。可选地,全部或部分存储器9102也可以处于通信设备9100之外。
在一些实施例中,通信设备9100还包括一个或多个收发器9103。在通信设备9100包括一个或多个收发器9103时,上述方法中的发送接收等通信步骤由收发器9103执行,其他步骤由处理器9101执行。
在一些实施例中,收发器可以包括接收器和发送器,接收器和发送器可以是分离的,也可以集成在一起。可选地,收发器、收发单元、收发机、收发电路等术语可以相互替换,发送器、发送单元、发送机、发送电路等术语可以相互替换,接收器、接收单元、接收机、接收电路等术语可以相互替换。
可选地,通信设备9100还包括一个或多个接口电路9104,接口电路9104与存储器9102连接,接口电路9104可用于从存储器9102或其他装置接收信号,可用于向存储器9102或其他装置发送信号。例如,接口电路9104可读取存储器9102中存储的指令,并将该指令发送给处理器9101。
以上实施例描述中的通信设备9100可以是网络设备或者终端,但本公开中描述的通信设备9100的范围并不限于此,通信设备9100的结构可以不受图9A的限制。通信设备可以是独立的设备或者可以是较大设备的一部分。例如所述通信设备可以是:1)独立的集成电路IC,或芯片,或,芯片系统或子系统;(2)具有一个或多个IC的集合,可选地,上述IC集合也可以包括用于存储数据,程序的存储部件;(3)ASIC,例如调制解调器(Modem);(4)可嵌入在其他设备内的模块;(5)接收机、终端设备、智能终端设备、蜂窝电话、无线设备、手持机、移动单元、车载设备、网络设备、云设备、人工智能设备等等;(6)其他等等。
图9B是本公开实施例提出的芯片的结构示意图。对于通信设备9100可以是芯片或芯片系统的情况,可以参见图9B所示的芯片9200的结构示意图,但不限于此。芯片9200包括一个或多个处理器9201,处理器9201用于调用指令以使得芯片9200执行以上任一方法。
在一些实施例中,芯片9200还包括一个或多个接口电路9202,接口电路9202与存储器9203连接,接口电路9202可以用于从存储器9203或其他装置接收信号,接口电路9202可用于向存储器9203或其他装置发送信号。例如,接口电路9202可读取存储器9203中存储的指令,并将该指令发送给处理器9201。可选地,接口电路、接口、收发管脚、收发器等术语可以相互替换。
在一些实施例中,芯片9200还包括用于存储指令的一个或多个存储器9203。可选地,全部或部分存储器9203可以处于芯片9200之外。
本公开还提出存储介质,上述存储介质上存储有指令,当上述指令在通信设备9100上运行时,使得通信设备9100执行以上任一方法。可选地,上述存储介质是电子存储介质。可选地,上述存储介质是计算机可读存储介质,但不限于此,其也可以是其他装置可读的存储介质。可选地,上述存储介质可以是非暂时性(non-transitory)存储介质,但不限于此,其也可以是暂时性存储介质。
在本公开实施例中,处理器是具有音频信号处理能力的电路,在一种实现中,处理器可以是具有指令读取与运行能力的电路,例如中央处理单元(Central ProcessingUnit,CPU)、微处理器、图形处理器(graphics processing unit,GPU)(可以理解为微处理器)、或数字音频信号处理器(digital signal processor,DSP)等;在另一种实现中,处理器可以通过硬件电路的逻辑关系实现一定功能,上述硬件电路的逻辑关系是固定的或可以重构的,例如处理器为专用集成电路(application-specific integrated circuit,ASIC)或可编程逻辑器件(programmable logic device,PLD)实现的硬件电路,例如FPGA。在可重构的硬件电路中,处理器加载配置文档,实现硬件电路配置的过程,可以理解为处理器加载指令,以实现以上部分或全部单元或模块的功能的过程。此外,还可以是针对人工智能设计的硬件电路,其可以理解为ASIC,例如神经网络处理单元(Neural Network ProcessingUnit,NPU)、张量处理单元(Tensor Processing Unit,TPU)、深度学习处理单元(Deeplearning Processing Unit,DPU)等。
本公开还提出程序产品,上述程序产品被通信设备9100执行时,使得通信设备9100执行以上任一方法。可选地,上述程序产品是计算机程序产品。
本公开还提出计算机程序,当其在计算机上运行时,使得计算机执行以上任一方法。
在上述实施例中,可以全部或部分地通过软件、硬件、固件或者其任意组合来实现。当使用软件实现时,可以全部或部分地以计算机程序产品的形式实现。所述计算机程序产品包括一个或多个计算机程序。在计算机上加载和执行所述计算机程序时,全部或部分地产生按照本公开实施例所述的流程或功能。所述计算机可以是通用计算机、专用计算机、计算机网络、或者其他可编程装置。所述计算机程序可以存储在计算机可读存储介质中,或者从一个计算机可读存储介质向另一个计算机可读存储介质传输,例如,所述计算机程序可以从一个网站站点、计算机、服务器或数据中心通过有线(例如同轴电缆、光纤、数字用户线(digital subscriber line,DSL))或无线(例如红外、无线、微波等)方式向另一个网站站点、计算机、服务器或数据中心进行传输。所述计算机可读存储介质可以是计算机能够存取的任何可用介质或者是包含一个或多个可用介质集成的服务器、数据中心等数据存储设备。所述可用介质可以是磁性介质(例如,软盘、硬盘、磁带)、光介质(例如,高密度数字视频光盘(digital video disc,DVD))、或者半导体介质(例如,固态硬盘(solid state disk,SSD))等。
本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本公开的范围。
所属领域的技术人员可以清楚地了解到,为描述的方便和简洁,上述描述的系统、装置和单元的具体工作过程,可以参考前述方法实施例中的对应过程,在此不再赘述。
以上所述,仅为本公开的具体实施方式,但本公开的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本公开揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本公开的保护范围之内。因此,本公开的保护范围应以所述权利要求的保护范围为准。
Claims (28)
1.一种音频信号处理方法,其特征在于,所述方法包括:
确定处理第一音频信号所需的窗函数长度值;
确定第一窗函数,其中,所述第一窗函数包括:与所述窗函数长度值相关的参考变量值,所述参考变量值小于所述窗函数长度值,所述参考变量值用于确定恢复所述第一音频信号所需要的时延;以及
根据所述第一窗函数处理所述第一音频信号,得到与所述第一音频信号相关的谱系数。
2.如权利要求1所述的方法,其特征在于,所述确定处理第一音频信号所需的窗函数长度值,包括:
确定能量阈值;
确定与所述第一音频信号中每个子信号块对应的能量值;
根据所述能量阈值和多个所述能量值,确定所述窗函数长度值。
3.如权利要求2所述的方法,其特征在于,所述根据所述能量阈值和多个所述能量值,确定所述窗函数长度值,包括:
如果多个所述能量值均小于或等于所述能量阈值,则确定所述窗函数长度值为第一窗函数长度值;
如果至少一个所述能量值大于所述能量阈值,则确定所述窗函数长度值为第二窗函数长度值,其中,所述第二窗函数长度值小于所述第一窗函数长度值。
4.如权利要求1-3任一项所述的方法,其特征在于,所述第一窗函数满足第一条件,所述第一条件包括:第一值和第二值的和值为1;其中,所述第一值是基于所述第一窗函数处理第一变量所得的值的平方,所述第二值是基于所述第一窗函数处理第二变量所得的值的平方,所述第二变量为所述第一变量和所述窗函数长度值之间的和值。
5.如权利要求4所述的方法,其特征在于,所述第一条件为以下公式:
W(n)2+W(n+N)2=1;
其中,n表示第一变量,N表示所述窗函数长度值,W()表示所述第一窗函数。
6.如权利要求1-4任一项所述的方法,其特征在于,所述确定第一窗函数,包括:
根据所述窗函数长度值、所述参考变量值、第一变量以及第二窗函数确定所述第一窗函数。
7.如权利要求6所述的方法,其特征在于,所述第一窗函数包括以下至少一项:
与所述第一变量对应的第一函数部分,其中,所述第一变量属于第一取值范围;
与所述第一变量对应的第二函数部分,其中,所述第一变量属于第二取值范围;
与所述第一变量对应的第三函数部分,其中,所述第一变量属于第三取值范围;
与所述第一变量对应的第四函数部分,其中,所述第一变量属于第四取值范围;
其中,不同所述取值范围之间不存在交集部分,且所述取值范围是根据所述窗函数长度值和所述参考变量值对参考取值范围分割得到,所述参考取值范围的最小值为零,最大值为两倍的所述窗函数长度,不同所述函数部分之间互不相同,至少一个所述函数部分与所述第二窗函数相关,且至少一个所述函数部分为恒定值。
8.如权利要求6或7所述的方法,其特征在于,所述第一窗函数为以下公式:
其中,n表示所述第一变量,N表示所述窗函数长度值,X表示所述参考变量值,WD()表示所述第一窗函数,w()表示所述第二窗函数。
9.如权利要求1-8任一项所述的方法,其特征在于,所述根据所述第一窗函数处理所述第一音频信号,得到与所述第一音频信号相关的谱系数,包括:
根据所述第一窗函数处理所述第一音频信号,得到中间音频信号;
根据第一处理信息处理所述中间音频信号,得到所述与所述第一音频信号相关的谱系数,其中,所述第一处理信息包括:所述参考变量值。
10.如权利要求9所述的方法,其特征在于,所述第一处理信息用于对所述中间音频信号进行改进离散余弦变换处理。
11.如权利要求9或10所述的方法,其特征在于,所述第一处理信息为以下公式:
其中,k=0,1,...,N-1,n表示所述第一变量,N表示所述窗函数长度值,X表示所述参考变量值,x(n)表示所述中间音频信号,X(k)表示所述谱系数。
12.如权利要求1-11任一项所述的方法,其特征在于,所述参考变量值由以下公式确定:
其中,N表示所述窗函数长度值,X表示所述参考变量值,m为正整数。
13.一种音频信号处理方法,其特征在于,所述方法包括:
获取与第一音频信号相关的谱系数;
确定第一窗函数,其中,所述第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,所述参考变量值小于所述窗函数长度值,所述参考变量值用于确定恢复所述第一音频信号所需要的时延;
根据所述第一窗函数处理所述谱系数,得到所述第一音频信号。
14.如权利要求13所述的方法,其特征在于,所述第一窗函数满足第一条件,所述第一条件包括:第一值和第二值的和值为1;其中,所述第一值是基于所述第一窗函数处理第一变量所得的值的平方,所述第二值是基于所述第一窗函数处理第二变量所得的值的平方,所述第二变量为所述第一变量和所述窗函数长度值之间的和值。
15.如权利要求14所述的方法,其特征在于,所述第一条件为以下公式:
W(n)2+W(n+N)2=1;
其中,n表示第一变量,N表示所述窗函数长度值,W()表示所述第一窗函数。
16.如权利要求13-15任一项所述的方法,其特征在于,所述确定第一窗函数,包括:
根据所述窗函数长度值、所述参考变量值、第一变量以及第二窗函数确定所述第一窗函数。
17.如权利要求16所述的方法,其特征在于,所述第一窗函数包括以下至少一项:
与所述第一变量对应的第一函数部分,其中,所述第一变量属于第一取值范围;
与所述第一变量对应的第二函数部分,其中,所述第一变量属于第二取值范围;
与所述第一变量对应的第三函数部分,其中,所述第一变量属于第三取值范围;
与所述第一变量对应的第四函数部分,其中,所述第一变量属于第四取值范围;
其中,不同所述取值范围之间不存在交集部分,且所述取值范围是根据所述窗函数长度值和所述参考变量值对参考取值范围分割得到,所述参考取值范围的最小值为零,最大值为两倍的所述窗函数长度,不同所述函数部分之间互不相同,至少一个所述函数部分与所述第二窗函数相关,且至少一个所述函数部分为恒定值。
18.如权利要求16或17所述的方法,其特征在于,所述第一窗函数为以下公式:
其中,n表示所述第一变量,N表示所述窗函数长度值,X表示所述参考变量值,WD()表示所述第一窗函数,w()表示所述第二窗函数。
19.如权利要求13-18任一项所述的方法,其特征在于,所述根据所述第一窗函数处理所述谱系数,得到所述第一音频信号,包括:
根据第二处理信息处理所述谱系数,得到中间音频信号,其中,所述第二处理信息包括:所述参考变量值;
根据所述第一窗函数处理所述中间音频信号,得到所述第一音频信号。
20.如权利要求19所述的方法,其特征在于,所述第二处理信息用于对所述谱系数进行逆改进离散余弦变换处理。
21.如权利要求19或20所述的方法,其特征在于,所述第二处理信息为以下公式:
其中,n=0,1,...,2N-1,n表示所述第一变量,N表示所述窗函数长度值,X表示所述参考变量值,x(n)表示所述中间音频信号,X(k)表示所述谱系数。
22.如权利要求1-21任一项所述的方法,其特征在于,所述参考变量值由以下公式确定:
其中,N表示所述窗函数长度值,X表示所述参考变量值,m为正整数。
23.一种音频信号处理方法,其特征在于,所述方法包括:
第一通信设备,用于确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,所述第一窗函数包括:与所述窗函数长度值相关的参考变量值,所述参考变量值小于所述窗函数长度值,所述参考变量值用于确定恢复所述第一音频信号所需要的时延,以及根据所述第一窗函数处理所述第一音频信号,得到与所述第一音频信号相关的谱系数;
第二通信设备,用于获取与第一音频信号相关的谱系数,并根据所述第一窗函数处理所述谱系数,得到所述第一音频信号。
24.一种音频信号处理装置,其特征在于,所述装置包括:
处理模块,用于确定处理第一音频信号所需的窗函数长度值,并确定第一窗函数,其中,所述第一窗函数包括:与所述窗函数长度值相关的参考变量值,所述参考变量值小于所述窗函数长度值,所述参考变量值用于确定恢复所述第一音频信号所需要的时延,以及根据所述第一窗函数处理所述第一音频信号,得到与所述第一音频信号相关的谱系数。
25.一种音频信号处理装置,其特征在于,所述装置包括:
处理模块,用于获取与第一音频信号相关的谱系数,并确定第一窗函数,其中,所述第一窗函数包括:与处理第一音频信号所使用窗函数长度值相关的参考变量值,所述参考变量值小于所述窗函数长度值,所述参考变量值用于确定恢复所述第一音频信号所需要的时延,以及根据所述第一窗函数处理所述谱系数,得到所述第一音频信号。
26.一种通信设备,其特征在于,包括:
一个或多处理器;
其中,所述处理器用于调用指令以使得所述通信设备执行权利要求1-23中任一项所述的方法。
27.一种通信系统,其特征在于,包括第一通信设备和第二通信设备,其中,所述第一通信设备被配置为实现权利要求1-12中任一项所述的方法,所述第二通信设备被配置为实现权利要求13-22中任一项所述的方法。
28.一种存储介质,所述存储介质存储有指令,其特征在于,当所述指令在通信设备上运行时,使得所述通信设备执行如权利要求1-23中任一项所述的方法。
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/CN2023/112078 WO2025030449A1 (zh) | 2023-08-09 | 2023-08-09 | 音频信号处理方法及装置、通信设备、通信系统、存储介质 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| CN117242517A true CN117242517A (zh) | 2023-12-15 |
Family
ID=89091651
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202380010554.7A Pending CN117242517A (zh) | 2023-08-09 | 2023-08-09 | 音频信号处理方法及装置、通信设备、通信系统、存储介质 |
Country Status (2)
| Country | Link |
|---|---|
| CN (1) | CN117242517A (zh) |
| WO (1) | WO2025030449A1 (zh) |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP2372703A1 (en) * | 2010-03-11 | 2011-10-05 | Fraunhofer-Gesellschaft zur Förderung der Angewandten Forschung e.V. | Signal processor, window provider, encoded media signal, method for processing a signal and method for providing a window |
| CN109215667B (zh) * | 2017-06-29 | 2020-12-22 | 华为技术有限公司 | 时延估计方法及装置 |
| US11380343B2 (en) * | 2019-09-12 | 2022-07-05 | Immersion Networks, Inc. | Systems and methods for processing high frequency audio signal |
| CN113035223B (zh) * | 2021-03-12 | 2023-11-14 | 北京字节跳动网络技术有限公司 | 音频处理方法、装置、设备及存储介质 |
| CN115116475B (zh) * | 2022-06-13 | 2024-02-02 | 北京邮电大学 | 一种基于时延神经网络的语音抑郁症自动检测方法和装置 |
-
2023
- 2023-08-09 CN CN202380010554.7A patent/CN117242517A/zh active Pending
- 2023-08-09 WO PCT/CN2023/112078 patent/WO2025030449A1/zh active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| WO2025030449A1 (zh) | 2025-02-13 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2375192T3 (es) | Codificación por transformación mejorada de habla y señales de audio. | |
| RU2718421C1 (ru) | Устройство аудиодекодирования, устройство аудиокодирования, способ аудиодекодирования, способ аудиокодирования, программа аудиодекодирования и программа аудиокодирования | |
| CN113870872B (zh) | 基于深度学习的语音音质增强方法、装置和系统 | |
| CN103368682B (zh) | 信号编码和解码的方法和设备 | |
| KR101837191B1 (ko) | 고주파수 대역 신호에 대한 예측 방법 및 코딩/디코딩 디바이스 | |
| JPWO2007088853A1 (ja) | 音声符号化装置、音声復号装置、音声符号化システム、音声符号化方法及び音声復号方法 | |
| CN113994425B (zh) | 对基于场景的音频数据进行编码和解码的设备和方法 | |
| KR102915663B1 (ko) | 오디오 신호 인코딩 방법, 디코딩 방법, 인코딩 기기 및 디코딩 기기 | |
| CN114008705B (zh) | 基于操作条件执行心理声学音频编解码 | |
| WO2015136078A1 (en) | Audio coding method and apparatus | |
| CN117831548A (zh) | 音频编解码系统的训练方法、编码方法、解码方法、装置 | |
| EP4135330A1 (en) | Data processing method and system | |
| CN116434760A (zh) | 一种音频编码方法、装置、电子设备及存储介质 | |
| KR20070070174A (ko) | 스케일러블 부호화 장치, 스케일러블 복호 장치 및스케일러블 부호화 방법 | |
| WO2025145380A1 (zh) | 信号编码和解码方法、设备及存储介质 | |
| CN104981868B (zh) | 对音频信号进行编码和解码的方法以及用于对音频信号进行编码和解码的设备 | |
| KR102763821B1 (ko) | 오디오 인코딩 방법 및 디바이스 그리고 오디오 디코딩 방법 및 디바이스 | |
| WO2025030449A1 (zh) | 音频信号处理方法及装置、通信设备、通信系统、存储介质 | |
| WO2022012677A1 (zh) | 音频编解码方法和相关装置及计算机可读存储介质 | |
| JP7407110B2 (ja) | 符号化装置及び符号化方法 | |
| CN118160034A (zh) | 编解码方法、装置以及存储介质 | |
| CN114945981A (zh) | 一种音频信号处理方法和装置 | |
| CN120435737A (zh) | 编码和解码方法、设备及存储介质 | |
| WO2025020009A1 (zh) | 一种模型初始化方法及其装置 | |
| WO2025091293A1 (zh) | 分组方法、编码器、解码器以及存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination |