ES2916342T3 - Síntesis de señales para la reproducción de audio inmersiva - Google Patents
Síntesis de señales para la reproducción de audio inmersivaInfo
- Publication number
- ES2916342T3 ES2916342T3 ES17741145T ES17741145T ES2916342T3 ES 2916342 T3 ES2916342 T3 ES 2916342T3 ES 17741145 T ES17741145 T ES 17741145T ES 17741145 T ES17741145 T ES 17741145T ES 2916342 T3 ES2916342 T3 ES 2916342T3
- Authority
- ES
- Spain
- Prior art keywords
- inputs
- synthesized
- locations
- audio tracks
- azimuth
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 230000015572 biosynthetic process Effects 0.000 title claims description 10
- 238000003786 synthesis reaction Methods 0.000 title claims description 10
- 230000004044 response Effects 0.000 claims abstract description 39
- 238000000034 method Methods 0.000 claims abstract description 30
- 230000002194 synthesizing effect Effects 0.000 claims abstract description 16
- 238000005316 response function Methods 0.000 claims abstract description 14
- 238000001914 filtration Methods 0.000 claims abstract description 8
- 230000006870 function Effects 0.000 claims description 17
- 238000004364 calculation method Methods 0.000 claims description 9
- 230000003287 optical effect Effects 0.000 claims description 8
- 230000001052 transient effect Effects 0.000 claims description 2
- 238000000605 extraction Methods 0.000 claims 1
- 230000005236 sound signal Effects 0.000 description 12
- 230000008569 process Effects 0.000 description 5
- 238000012545 processing Methods 0.000 description 4
- 238000000926 separation method Methods 0.000 description 3
- 238000012546 transfer Methods 0.000 description 3
- 230000009286 beneficial effect Effects 0.000 description 2
- 239000000872 buffer Substances 0.000 description 2
- 238000010586 diagram Methods 0.000 description 2
- 230000008447 perception Effects 0.000 description 2
- 230000002238 attenuated effect Effects 0.000 description 1
- 230000008859 change Effects 0.000 description 1
- 238000011161 development Methods 0.000 description 1
- 210000005069 ears Anatomy 0.000 description 1
- 230000000694 effects Effects 0.000 description 1
- 239000000284 extract Substances 0.000 description 1
- 230000004907 flux Effects 0.000 description 1
- 230000014509 gene expression Effects 0.000 description 1
- 238000007654 immersion Methods 0.000 description 1
- 238000004519 manufacturing process Methods 0.000 description 1
- 238000013507 mapping Methods 0.000 description 1
- 239000011159 matrix material Substances 0.000 description 1
- 230000004048 modification Effects 0.000 description 1
- 238000012986 modification Methods 0.000 description 1
- 230000035807 sensation Effects 0.000 description 1
- 230000003595 spectral effect Effects 0.000 description 1
- 230000003068 static effect Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 238000000844 transformation Methods 0.000 description 1
- 230000001131 transforming effect Effects 0.000 description 1
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S3/00—Systems employing more than two channels, e.g. quadraphonic
- H04S3/008—Systems employing more than two channels, e.g. quadraphonic in which the audio signals are in digital form, i.e. employing more than two discrete digital channels
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S7/00—Indicating arrangements; Control arrangements, e.g. balance control
- H04S7/30—Control circuits for electronic adaptation of the sound field
- H04S7/307—Frequency adjustment, e.g. tone control
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/01—Multi-channel, i.e. more than two input channels, sound reproduction with two speakers wherein the multi-channel information is substantially preserved
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/11—Positioning of individual sound objects, e.g. moving airplane, within a sound field
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/01—Enhancing the perception of the sound image or of the spatial distribution using head related transfer functions [HRTF's] or equivalents thereof, e.g. interaural time difference [ITD] or interaural level difference [ILD]
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S3/00—Systems employing more than two channels, e.g. quadraphonic
- H04S3/002—Non-adaptive circuits, e.g. manually adjustable or static, for enhancing the sound image or the spatial distribution
- H04S3/004—For headphones
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Multimedia (AREA)
- Stereophonic System (AREA)
Abstract
Un método para sintetizar sonido, que comprende: recibir primeras entradas (80) que comprenden varias primeras pistas de audio monoaurales (82), de tal manera que cada primera entrada comprenda una pista de audio monoaural respectiva; recibir segundas entradas que indiquen las respectivas ubicaciones de las fuentes tridimensionales (3D) con coordenadas de acimut y elevación que se tienen que asociar con las primeras entradas; asignar a cada una de las primeras entradas las respectivas funciones de respuesta de filtrado izquierda y derecha basadas en respuestas de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D; y sintetizar las señales de salida estéreo izquierda y derecha (94) aplicando (116) las respectivas respuestas de filtrado derecha e izquierda a las primeras entradas, en donde la síntesis de las señales de salida estéreo izquierda y derecha comprende: el muestreo ascendente espacial del primer conjunto de pistas de audio monoaurales para generar unas segundas varias entradas sintetizadas, que tienen ubicaciones de las fuentes 3D sintetizadas con coordenadas respectivas diferentes de las ubicaciones de las fuentes 3D respectivas asociadas con las primeras entradas; filtrar las entradas sintetizadas utilizando las funciones de respuesta de filtrado calculadas con las coordenadas de acimut y elevación de las ubicaciones de las fuentes 3D sintetizadas; y después de filtrar las primeras entradas utilizando las respectivas respuestas de filtrado izquierdo y derecho, sumar las entradas sintetizadas filtradas con las primeras entradas filtradas para producir las señales de salida estéreo, caracterizado por que el muestreo ascendente espacial del primer conjunto de pistas de audio monoaurales comprende la aplicación de una transformada de ondícula a las pistas de audio monoaurales para generar los respectivos espectrogramas (84) de las pistas de audio monoaurales e interpolar entre los espectrogramas de acuerdo con las ubicaciones de las fuentes 3D para generar las entradas sintetizadas.
Description
DESCRIPCIÓN
Síntesis de señales para la reproducción de audio inmersiva
Referencia cruzada a la solicitud relacionada
Esta solicitud reivindica la prioridad de la solicitud de patente provisional de EE. UU. 62/280.134, presentada el 19 de enero de 2016, de la solicitud de patente provisional de EE. UU. 62/400.699, presentada el 28 de septiembre de 2016, y de la solicitud de patente provisional de EE. UU. 62/432.578, presentada el 11 de diciembre de 2016.
Campo de la invención
La presente invención hace referencia en general al procesamiento de señales de audio, y en particular a los métodos, sistemas y software para la generación y reproducción de la salida de audio.
Antecedentes
En los últimos años, los avances en la grabación y reproducción de audio han facilitado el desarrollo del "sonido envolvente" inmersivo, en el que el audio se reproduce desde múltiples altavoces que rodean al oyente. Los sistemas de sonido envolvente para uso doméstico incluyen, por ejemplo, las disposiciones conocidas como "5.1" y "7.1", en las que el audio se graba para que sea reproducido a través de cinco o siete canales (tres altavoces frente al oyente y altavoces adicionales a los lados y posiblemente detrás o por encima del oyente) más un subwoofer.
Por otra parte, un gran número de usuarios escucha hoy en día música y otros contenidos de audio a través de auriculares estéreo, normalmente por medio de reproductores de audio portátiles y teléfonos inteligentes. Las grabaciones de sonido envolvente multicanal generalmente se convierten mediante mezclado descendente de 5.1 o 7.1 canales a dos canales con este propósito y, por consiguiente, el oyente pierde gran parte de la experiencia de audio inmersiva que la grabación envolvente es capaz de proporcionar.
En la literatura de patentes se han descrito diversas técnicas para el mezclado descendente del sonido multicanal en estéreo. Por ejemplo, la patente de EE.UU. 5.742.689 describe un método para procesar señales de audio multicanal, en donde cada canal corresponde a un altavoz colocado en una ubicación particular en una sala, de tal forma que se crea, a través de los auriculares, la sensación de múltiples altavoces "fantasma" colocados por toda la sala. Las funciones de transferencia relacionadas con la cabeza (HRTF) se eligen de acuerdo con la elevación y el acimut de cada altavoz previsto con respecto al oyente. Cada canal se filtra con una función HRTF de tal manera que, cuando se combinan en los canales izquierdo y derecho y se reproducen a través de los auriculares, el oyente perciba que el sonido lo producen realmente altavoces fantasma colocados por toda la sala "virtual".
Como otro ejemplo, la patente de EE.UU. 6.421.446 describe un aparato para crear imágenes de audio en 3D a través de los auriculares utilizando la síntesis binaural que incluye la elevación. La ubicación aparente de las señales de sonido, tal como la percibe una persona que escucha las señales de sonido a través de los auriculares, se puede posicionar o mover en acimut, elevación y alcance mediante un bloque de control de alcance y un bloque de control de ubicación. Se pueden proporcionar varios bloques de control de alcance y bloques de control de ubicación en función del número de señales de sonido de entrada que se tengan que posicionar o mover.
El documento US 2015/223002 A1 hace referencia a un sistema de reproducción de contenido de audio basado en objetos a través de un sistema que incluye controladores direccionables individualmente, incluyendo al menos un controlador que se configura para proyectar ondas de sonido hacia una o más superficies dentro de un entorno de audición para su reflexión en un área de audición dentro del entorno de audición.
El documento US 2010/191537 A1 hace referencia a un decodificador de audio binaural orientado a objetos que comprende medios de decodificación para decodificar y reproducir al menos un objeto de audio basado en parámetros de funciones de transferencia relacionadas con la cabeza.
El documento EP 0976305 A1 hace referencia a un método de procesamiento de una señal de audio de un solo canal para proporcionar una señal de audio que tenga los canales izquierdo y derecho correspondientes a una fuente de sonido en una dirección determinada en el espacio.
Compendio
Las formas de realización de la presente invención que se describen a continuación en la presente memoria proporcionan métodos, sistemas y software mejorados para sintetizar señales de audio.
De acuerdo con un primer aspecto de la presente invención se proporciona un método para sintetizar sonido, de acuerdo con la reivindicación 1.
Según un segundo aspecto de la presente invención se proporciona un aparato para sintetizar sonido, de acuerdo con la reivindicación 9.
En algunas formas de realización, al menos una de las segundas entradas especifica una trayectoria 3D en el espacio, y la asignación de las respuestas del filtrado izquierdo y derecho incluye la especificación, en cada uno de un conjunto de puntos a lo largo de la trayectoria 3D, de las respuestas del filtrado que varían sobre la trayectoria en respuesta a las coordenadas de acimut y elevación de los puntos. La síntesis de las señales de salida estéreo izquierda y derecha incluye la aplicación de forma secuencial a la primera entrada asociada con al menos una de las segundas entradas de las respuestas del filtrado especificadas para los puntos a lo largo de la trayectoria 3D.
En algunas formas de realización, la recepción de una o más segundas entradas incluye la recepción de un punto inicial y un momento inicial de la trayectoria, la recepción de un punto final y un momento final de la trayectoria, y el cálculo automático de la trayectoria 3d entre el punto inicial y el punto final de tal manera que se recorra la trayectoria desde el momento inicial hasta el momento final. En una forma de realización descrita, el cálculo automático de la trayectoria 3D incluye el cálculo de una trayectoria sobre una superficie de una esfera que se centra en un origen de las coordenadas de acimut y elevación.
En algunas formas de realización, las funciones de respuesta de filtrado incluyen una muesca en una frecuencia determinada, que varía en función de las coordenadas de elevación.
En una forma de realización, la interpolación entre los espectrogramas incluye el cálculo de una función del flujo óptico entre los puntos en los espectrogramas.
En una forma de realización descrita, la síntesis de las señales de salida estéreo izquierda y derecha incluye la extracción de los componentes de baja frecuencia de las primeras entradas, y la aplicación de las respectivas respuestas del filtrado izquierdo y derecho incluye el filtrado de las primeras entradas después de la extracción de los componentes de baja frecuencia y, a continuación, la adición de los componentes de baja frecuencia extraídos a las primeras entradas filtradas.
De forma adicional o como alternativa, cuando las ubicaciones de las fuentes 3D tengan coordenadas de alcance que se tengan que asociar con las primeras entradas, la síntesis de las salidas estéreo izquierda y derecha puede incluir la modificación adicional de las primeras entradas en respuesta a las coordenadas de alcance asociadas.
También se proporciona, de acuerdo con una forma de realización de la invención, un aparato para sintetizar sonido, que incluye una interfaz de entrada configurada para recibir una o más primeras entradas, cada una de las cuales incluye una pista de audio monoaural respectiva, y para recibir una o más segundas entradas que indican las ubicaciones de las fuentes tridimensionales (3D) respectivas que tienen coordenadas de acimut y elevación que se asocian con las primeras entradas. Un procesador se configura para asignar a cada una de las primeras entradas respectivas las respuestas del filtrado izquierdo y derecho basadas en funciones de respuesta de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D, y para sintetizar señales de salida estéreo izquierda y derecha aplicando las respectivas respuestas del filtrado izquierdo y derecho a las primeras entradas.
En una forma de realización descrita, el aparato incluye una interfaz de salida de audio, que incluye altavoces izquierdo y derecho, que se configuran para reproducir las señales de salida estéreo izquierda y derecha, respectivamente.
Adicionalmente, de acuerdo con una forma de realización de la invención, se proporciona un producto de software informático, de acuerdo con la reivindicación 11.
La presente invención se entenderá mejor a partir de la siguiente descripción detallada de las formas de realización de la misma, tomada junto con los dibujos en los que:
Breve descripción de los dibujos
La Fig. 1 es una ilustración esquemática y gráfica de un sistema de síntesis y reproducción de audio, de acuerdo con una forma de realización de la invención;
La Fig. 2 es una representación esquemática de una pantalla de la interfaz de usuario en el sistema de la Fig. 1
La Fig. 3 es un diagrama de flujo que ilustra de forma esquemática un método para convertir una entrada de audio multicanal en una salida estéreo, de acuerdo con una forma de realización de la invención;
La Fig. 4 es un diagrama de bloques que ilustra de forma esquemática un método para sintetizar una salida de audio, de acuerdo con una forma de realización de la invención; y
La Fig. 5 es un diagrama de flujo que ilustra de forma esquemática un método para filtrar señales de audio, de acuerdo con una forma de realización de la invención.
Descripción detallada de las formas de realización
Visión de conjunto
Las herramientas de mezcla y edición de audio conocidas en la técnica permiten al usuario combinar múltiples pistas de audio de entrada (grabadas a partir de diferentes instrumentos y/o voces, por ejemplo) en señales de salida estéreo izquierda y derecha. Sin embargo, dichas herramientas generalmente proporcionan una flexibilidad limitada a la hora de dividir las entradas entre las salidas izquierda y derecha y no pueden duplicar la sensación de inmersión auditiva que el oyente obtiene en un entorno en directo. Los métodos conocidos en la técnica para convertir el sonido envolvente en estéreo son igualmente incapaces de preservar la experiencia de audio inmersiva de la grabación original.
Las formas de realización de la presente invención que se describen en la presente memoria proporcionan métodos, sistemas y software para sintetizar sonido que son capaces de reproducir de forma realista un entorno de audio tridimensional (3D) completo a través de auriculares estéreo. Estas formas de realización hacen uso, de una manera novedosa, de la respuesta de los oyentes humanos a las señales de audio espaciales, que incluye no sólo las diferencias en el volumen del sonido escuchado por los oídos izquierdo y derecho, sino también las diferencias en la respuesta de frecuencia del sistema auditivo humano en función del acimut y la elevación. En particular, algunas formas de realización utilizan funciones de respuesta de filtrado que comprenden una muesca en una frecuencia determinada, que varía en función de las coordenadas de elevación de las fuentes de audio.
En las formas de realización descritas, un procesador recibe una o más pistas de audio monoaurales como entradas, así como una ubicación de la fuente 3D respectiva asociada a cada entrada. Un usuario del sistema puede especificar estas ubicaciones de las fuentes de forma arbitraria, al menos en términos de coordenadas de acimut y elevación de cada fuente, por ejemplo, así como la distancia. Por lo tanto, se pueden especificar múltiples fuentes de pistas musicales, bandas sonoras de vídeo (como por ejemplo películas o juegos) y/u otros sonidos ambientales no sólo en el plano horizontal, sino también con diferentes elevaciones por encima y por debajo del nivel de la cabeza del oyente.
Para convertir la pista o pistas de audio en señales estéreo, el procesador asigna las respectivas respuestas del filtrado izquierdo y derecho a cada una de las entradas, basándose en funciones de respuesta de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D. El procesador aplica estas respuestas del filtrado a las entradas correspondientes para sintetizar las señales de salida estéreo izquierda y derecha. Cuando se van a mezclar juntas múltiples entradas, con diferentes ubicaciones de fuentes respectivas, el procesador aplica las respuestas del filtrado izquierdo y derecho apropiadas, respectivas, a cada una de las entradas para generar los respectivos componentes estéreo izquierdo y derecho. Los componentes estéreo izquierdos se suman entonces a todas las entradas para generar la salida estéreo izquierda, y los componentes estéreo derechos se suman igualmente para generar la salida estéreo derecha. Se puede aplicar un limitador a los componentes sumados para impedir el recorte en la reproducción de las señales de salida.
Algunas formas de realización de la presente invención permiten al procesador simular el movimiento de una fuente de audio a lo largo de una trayectoria 3D en el espacio, de modo que la salida estéreo de al oyente la sensación de que la fuente de audio se está moviendo realmente durante la reproducción. Para este propósito, el usuario puede introducir los puntos inicial y final y los correspondientes momentos inicial y final de la trayectoria. El procesador calcula de forma automática la trayectoria 3D sobre esta base, posiblemente calculando una trayectoria sobre la superficie de una esfera centrada en el origen de coordenadas del acimut y la elevación de los puntos inicial y final. Como alternativa, el usuario puede introducir secuencias arbitrarias de puntos para generar trayectorias, en esencia, con cualesquiera propiedades geométricas que desee.
Con independencia de cómo se obtenga la trayectoria, el procesador calcula, en múltiples puntos a lo largo de la trayectoria 3D, respuestas de filtrado que varían en función de las coordenadas de acimut y elevación de los puntos, y posiblemente también en términos de coordenadas de distancia. A continuación, el procesador aplica de forma secuencial estas respuestas de filtrado a la entrada de audio correspondiente para crear la ilusión de que la fuente de audio se ha movido a lo largo de la trayectoria entre los puntos inicial y final durante un período comprendido entre los momentos inicial y final especificados. Esta capacidad se puede utilizar, por ejemplo, para simular la sensación de una actuación en directo, en la que los cantantes y músicos se mueven por el teatro, o para mejorar la sensación de realismo en juegos de ordenador y aplicaciones de entretenimiento.
Para mejorar la riqueza y autenticidad de la experiencia de audio del oyente, puede ser beneficioso añadir fuentes de audio virtuales en ubicaciones adicionales además de las especificadas en realidad por el usuario. Para este propósito, el procesador realiza un muestreo ascendente espacial de las pistas de audio de entrada para generar entradas adicionales sintetizadas, con sus propias ubicaciones de fuentes 3D sintetizadas que son diferentes de las respectivas ubicaciones de fuentes 3D asociadas a las entradas reales. El muestreo ascendente se realiza transformando las entradas al dominio de la frecuencia, utilizando una transformada de ondícula y, a continuación, interpolando entre los espectrogramas resultantes para generar las entradas sintetizadas. El procesador filtra las entradas sintetizadas utilizando las funciones de respuesta de filtrado apropiadas para las coordenadas de acimut y elevación de sus ubicaciones de fuentes sintetizadas y, a continuación, suma las entradas sintetizadas filtradas con las entradas reales filtradas para producir las señales de salida estéreo.
Los principios de la presente invención pueden tener aplicación en la producción de salidas estéreo en una amplia gama de aplicaciones, por ejemplo:
- Sintetizar una salida estéreo a partir de una o más pistas monoaurales con ubicaciones de fuentes arbitrarias especificadas por el usuario, incluyendo posiblemente ubicaciones en movimiento.
- Conversión de grabaciones de sonido envolvente (como por ejemplo 5.1 y 7.1) en una salida estéreo, en donde las ubicaciones de las fuentes corresponden a ubicaciones de altavoces estándar.
- Generación estéreo en tiempo real a partir de conciertos y otros eventos en directo, con entrada simultánea de múltiples micrófonos colocados en cualesquiera ubicaciones de las fuentes que se deseen, y mezclado descendente en línea en estéreo. (Un dispositivo para realizar este tipo de mezclado descendente en tiempo real se podría instalar, por ejemplo, en una furgoneta de retransmisión aparcada en el lugar del evento).
Otras aplicaciones serán evidentes para los expertos en la técnica después de leer la presente descripción. Todas estas aplicaciones se consideran dentro del alcance de la presente invención.
Descripción del sistema
La Fig. 1 es una ilustración esquemática y gráfica de un sistema 20 para la síntesis y reproducción de audio, de acuerdo con una forma de realización de la invención. El sistema 20 recibe múltiples entradas de audio, cada una de las cuales comprende una pista de audio monoaural respectiva, junto con las correspondientes entradas de localización que indican las respectivas ubicaciones de las fuentes tridimensionales (3D) que tienen coordenadas de acimut y elevación para asociarse con las entradas de audio. El sistema sintetiza señales de salida estéreo izquierda y derecha, que se reproducen en el presente ejemplo en los auriculares estéreo 24 que lleva un oyente 22.
Las entradas comprenden normalmente pistas de audio monoaurales, representadas en la Fig. 1 por los músicos 26, 28, 30 y 32, cada uno en una ubicación de fuente diferente. Las ubicaciones de las fuentes se introducen en el sistema 20 en coordenadas con respecto a un origen situado en el centro de la cabeza del oyente 22. Tomando el plano X-Y como un plano horizontal que atraviesa la cabeza del oyente, las coordenadas de las fuentes se pueden especificar en términos de acimut (es decir, el ángulo de la fuente proyectado sobre el plano X-Y) y de elevación por encima o por debajo del plano. En algunos casos, también se pueden especificar los alcances respectivos de las fuentes (es decir, la distancia desde el origen), aunque el alcance no se considera explícitamente en las formas de realización que vienen a continuación.
Las pistas de audio y sus respectivas coordenadas de ubicación de la fuente se introducen normalmente por parte de un usuario del sistema 20 (por ejemplo, el oyente 22 o un usuario profesional, como por ejemplo un ingeniero de sonido). En el caso de los músicos 28 y 30, las ubicaciones de las fuentes introducidas por el usuario varían con el tiempo, para simular el movimiento de los músicos mientras tocan sus respectivas partes. En otras palabras, incluso cuando las pistas de audio de entrada se graban con un micrófono estático y monofónico, con los músicos sin moverse durante la grabación, por ejemplo, el usuario puede hacer que la salida simule una situación en la que uno o más de los músicos se estén moviendo. El usuario puede introducir los movimientos en términos de una trayectoria, con puntos inicial y final en el espacio y el tiempo. Las señales de salida estéreo resultantes darán al oyente 22 una percepción de movimiento de estas fuentes de audio en tres dimensiones.
En el ejemplo ilustrado, las señales estéreo se envían a los auriculares 24 a través de un dispositivo móvil 34, como por ejemplo un teléfono inteligente, que recibe las señales mediante un enlace de retransmisión en directo desde un servidor 36 por medio de una red 38. Como alternativa, un archivo de audio que contiene las señales de salida estéreo se puede descargar y almacenar en la memoria del dispositivo móvil 34, o se puede grabar en un medio fijo, como por ejemplo un disco óptico. Como alternativa, las señales estéreo se pueden emitir desde otros dispositivos, como por ejemplo un decodificador, un televisor, una radio o un sistema de entretenimiento para el coche, una tableta o un ordenador portátil, entre otros.
En la descripción que viene a continuación, en aras de la claridad y la concreción, se supone que el servidor 36 sintetiza las señales de salida estéreo izquierda y derecha. Sin embargo, como alternativa, el software de aplicación del dispositivo móvil 34 puede realizar todas o parte de las etapas involucradas en la conversión de las pistas de entrada con las ubicaciones asociadas en una salida estéreo de acuerdo con las formas de realización de la presente invención.
El servidor 36 comprende un procesador 40, normalmente un procesador informático de propósito general, que se programa con software para llevar a cabo las funciones que se describen en la presente memoria. Este software se puede descargar en el procesador 40 de forma electrónica, a través de una red, por ejemplo. De forma alternativa o adicional, el software se puede almacenar en medios tangibles, no transitorios, legibles por ordenador, como por ejemplo medios de memoria óptica, magnética o electrónica. Además, de forma alternativa o adicional, al menos algunas de las funciones del procesador 40 que se describen en la presente memoria se pueden llevar a cabo por un procesador de señales digitales (DSP) programable o por otra lógica programable o cableada. El servidor 36 comprende además una memoria 42 e interfaces, incluyendo una interfaz de red 44 a la red 38 y una interfaz de usuario 46, cualquiera de las cuales se puede utilizar como interfaz de entrada para recibir las entradas de audio y las respectivas ubicaciones de las fuentes.
Como se ha explicado anteriormente, el procesador 40 aplica a cada una de las entradas representadas por los músicos 26, 28, 30, 32, ..., las respectivas respuestas del filtrado izquierdo y derecho basadas en funciones de respuesta de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D, y genera por lo tanto los respectivos componentes estéreo izquierdo y derecho. El procesador 40 suma estos componentes estéreo izquierdo y derecho sobre todas las entradas para generar las salidas estéreo izquierda y derecha. Los detalles de este proceso se describen a continuación en la presente memoria.
La Fig. 2 es una representación esquemática de una pantalla de interfaz de usuario, que se presenta mediante la interfaz de usuario 46 del servidor 36 (Fig. 1).
Esta figura ilustra en particular cómo el usuario puede especificar las ubicaciones y, en su caso, las trayectorias de las entradas de audio que se utilizarán para generar la salida estéreo a los auriculares 24.
El usuario selecciona cada pista de entrada introduciendo un identificador de pista en un campo de entrada 50. Por ejemplo, el usuario puede buscar archivos de audio almacenados en la memoria 42 e introducir el nombre del archivo en el campo 50. Para cada pista de entrada, el usuario selecciona las coordenadas de ubicación inicial, en términos de acimut, elevación y posible alcance (distancia) con respecto a un origen en el centro de la cabeza del oyente, utilizando los controles en pantalla 52 y/o un dispositivo de entrada de usuario dedicado (no mostrado). El acimut y la elevación seleccionados se marcan como un punto inicial 54 en un área de visualización 56, que presenta las ubicaciones de las fuentes con respecto a una cabeza 58. Cuando la fuente de la pista seleccionada es estacionaria, no se requiere ninguna otra entrada de ubicación en esta fase.
Por otra parte, para las ubicaciones de las fuentes que se tienen que mover (como en el caso de la simulación del movimiento de los músicos 28 y 30 en la Fig. 1), la pantalla 46 permite al usuario especificar una trayectoria 3D 70 en el espacio. Para este propósito, los controles 52 se ajustan para indicar el punto inicial 54 de la trayectoria, y una entrada del momento inicial 62 es seleccionada por el usuario para indicar el momento inicial de la trayectoria. Del mismo modo, el usuario introduce el momento final y un punto final 68 de la trayectoria utilizando una entrada de momento final 64 y una entrada de ubicación final 66 (normalmente utilizando controles de acimut, elevación y posiblemente alcance, como los controles 52). Opcionalmente, para generar trayectorias más complejas, el usuario puede introducir puntos adicionales en el espacio y el tiempo a lo largo del recorrido de la trayectoria deseada.
Como opción adicional, cuando la salida estéreo que se va a generar por el servidor 36 se va a acoplar como una pista de sonido a un clip de vídeo, el usuario puede indicar los momentos inicial y final en términos de fotogramas de inicio y fin en el clip de vídeo. En este caso de utilización, el usuario puede, de forma adicional o como alternativa, indicar las ubicaciones de las fuentes de audio señalando ubicaciones en determinados fotogramas de vídeo.
Basándose en las anteriores entradas del usuario, el procesador 40 calcula de forma automática la trayectoria 3D 70 entre el punto inicial 54 y el punto final 68, con una velocidad seleccionada de modo que la trayectoria se recorra desde el momento inicial hasta el momento final. En el ejemplo ilustrado, la trayectoria 70 comprende un camino sobre la superficie de una esfera centrada en el origen de las coordenadas de acimut, elevación y alcance. Como alternativa, el procesador 40 puede calcular trayectorias más complejas, ya sea de forma totalmente automática como interactiva, bajo el control del usuario.
Cuando el usuario ha especificado la trayectoria 70 de una determinada pista de entrada de audio, el procesador 40 asigna y aplica a esta pista respuestas de filtrado que varían a lo largo de la trayectoria, basándose en las coordenadas de acimut, elevación y alcance de los puntos a lo largo de la trayectoria. El procesador 40 aplica de forma secuencial estas respuestas de filtrado a la entrada de audio de modo que los componentes estéreo correspondientes cambiarán con el tiempo de acuerdo con las coordenadas actuales a lo largo de la trayectoria.
Métodos para la síntesis de audio
La Fig. 3 es un diagrama de flujo que ilustra de forma esquemática un método para convertir una entrada de audio multicanal en una salida estéreo, de acuerdo con una forma de realización de la invención. En este ejemplo, las instalaciones del servidor 36 se utilizan para convertir una entrada de sonido envolvente 5.1 80 en una salida estéreo de dos canales 92. Por lo tanto, en contraste con el ejemplo anterior, el procesador 40 recibe cinco pistas de entrada de audio 82 con ubicaciones de fuente fijas, correspondientes a las posiciones de los altavoces central (C), izquierdo (L), derecho (R), y envolvente izquierdo y derecho (LS, RS) en el sistema 5.1. Se pueden aplicar técnicas similares en la conversión de entradas de sonido envolvente 7.1 a estéreo, así como en la conversión de entradas de audio multipista con cualquier distribución deseada de las ubicaciones de las fuentes (estándar o de otro modo) en el espacio 3D.
Para enriquecer la experiencia de audio del oyente, el procesador 40 realiza una mezcla ascendente (es decir, un muestreo ascendente) de las pistas de entrada 82, para crear entradas sintetizadas - "altavoces virtuales"- en ubicaciones de fuentes adicionales en el espacio 3D que rodean al oyente. En esta forma de realización, la mezcla ascendente se realiza en el dominio de la frecuencia. Por consiguiente, como etapa preliminar, el procesador 40 transforma las pistas de entrada 82 en espectrogramas correspondientes 84, aplicando una transformada de ondícula a las pistas de audio de entrada. Los espectrogramas 84 se pueden representar como una gráfica bidimensional de la frecuencia en función del tiempo.
La transformada de ondícula descompone cada una de las señales de audio en un conjunto de coeficientes de ondícula utilizando una función finita amortiguada de media cero (de ondícula madre), localizada en tiempo y frecuencia. La transformada de ondícula continua es la suma a lo largo de todo el tiempo de la señal multiplicada por versiones escaladas y desplazadas de la de ondícula madre. Este proceso produce coeficientes de ondícula que son una función de la escala y la posición. La ondícula madre utilizada en la presente forma de realización es la ondícula compleja de Morlet, que comprende una curva sinusoidal modulada por un gaussiano, definida de la siguiente manera:
'¥ 0 ( l ] ) = 7 r-V4e ¡w'>'’ e - ',2r-
Como alternativa, se pueden utilizar otros tipos de ondículas para este propósito. Además, de forma alternativa, los principios de la presente invención se pueden aplicar, mutatis mutandis, utilizando otras transformaciones en el dominio del tiempo y la frecuencia para descomponer los múltiples canales de audio.
En términos matemáticos, la transformada de ondícula continua se formula como:
En este caso Xn es la serie temporal digitalizada con periodos de tiempo 5t , n = 1, ..., n , s es la escala, y ^ 0 (n) es la ondícula madre escalada y trasladada (desplazada). La potencia de la ondícula se define como
La ondícula madre de Morlet se normaliza por un factor de V ( * / j )
en donde s es la escala. Además, los coeficientes de la ondícula se normalizan por la varianza de la señal (o2) para crear valores de potencia relativos al ruido blanco.
Para facilitar el cálculo, la transformada de ondícula continua se puede expresar de forma alternativa de la siguiente manera:
A
En este caso, * es la transformada de Fourier de la señal Xn; [l; es la transformada de Fourier de la ondícula madre; * indica el conjugado complejo; s es la escala; k= 0 ... N-1; e i es la unidad imaginaria básica
El procesador 40 interpola entre los espectrogramas 84 de acuerdo con las ubicaciones de las fuentes 3D de los altavoces en la entrada 80 para generar un conjunto de tramas sobremuestreadas 86, que incluyen tanto las pistas de entrada originales 82 como las entradas sintetizadas 88. Para llevar a cabo esta etapa, el procesador 40 calcula los espectrogramas intermedios, que representan los altavoces virtuales en el dominio de la frecuencia en las respectivas ubicaciones en el espacio esférico que rodea al oyente. Para este propósito, en la presente forma de realización, el procesador 40 trata cada par de altavoces adyacentes como "fotogramas de película", con los puntos de datos del espectrograma como "píxeles", e interpola un fotograma que está virtualmente situado en el espacio y tiempo entre ellos. En otras palabras, los espectrogramas 84 de los canales de audio originales en el dominio de la frecuencia se tratan como imágenes, en donde x es el tiempo, y es la frecuencia, y la intensidad del color se utiliza para indicar la potencia o amplitud espectral.
Entre cada par de fotogramas Fo y Fi, en los tiempos respectivos to y ti, el procesador 40 inserta un fotograma Fi, que es una matriz de espectrograma interpolado en el momento h que comprende píxeles con coordenadas (x,y), dadas como:
ti = (t - t0)/(ti - to)
Fi,x,y = (1 - ti)Fü,x,y tiFl x.y
Algunas formas de realización también tienen en cuenta el movimiento de los elementos de alta potencia dentro del espectrograma.
El procesador 40 deforma gradualmente esta "imagen" de acuerdo con el flujo óptico. El campo de flujo óptico Vx,y define, para cada píxel (x,y), un vector con dos elementos, [x,y]. Para cada píxel (x,y) de la imagen resultante, el procesador 40 busca el vector de flujo en el campo Vx,y, por ejemplo, utilizando un algoritmo que se describe a continuación. Se considera que este píxel "viene de" un punto que se encuentra hacia atrás a lo largo del vector Vx.y y que "va hacia" un punto a lo largo de la dirección hacia delante del mismo vector. Dado que es el vector que va desde el píxel (x,y) en el primer fotograma hasta el píxel correspondiente en el segundo fotograma, el procesador 40 puede utilizar esta relación para encontrar las coordenadas hacia atrás [xb ,yb] y las coordenadas hacia delante [xt ,yt], que se utilizan en la interpolación de las "imágenes" intermedias:
ti = (t - to)/(ti - to)
[xb,yb] = [x,y] -
tiVx,y
[xf,yf] = [x,y] (1 - ti)Vx,y
Fi,x,y — (1 ” tj)Fo,xb,yb "I" t jF l ^ y f
Para determinar el vector de flujo Vx,y descrito anteriormente, el procesador 40 divide la primera trama en bloques cuadrados (de un tamaño predeterminado, indicado en este caso como "s"), y estos bloques se comparan con bloques del mismo tamaño en la segunda trama, dentro de una distancia máxima d entre los bloques a comparar. El pseudocódigo de este proceso es el siguiente:
TABLA I - CÁLCULO DEL VECTOR DE FLUJO
block-from-firstframe = crop (firstframe, x, y, x+s, y+s);
closest-difference = inf;
best-position = [x,y];
for (dx=-d:d)
for (dy=-d:d)
block-from-secondframe = crop(secondframe, x+dx, y+dy, x+s+dx, y+s+dy);
difference-between-blocks = block-from-firstframe - block-from-secondframe; sum = difference-between-blocks.^ 2;
if sum<closest-difference
closest_difference = sum;
best-position = [x+dx,y+dy];
end
end
end
flow-vector(x,y) = best-position - [x,y];
Una vez calculados los espectrogramas para todos los altavoces virtuales (entradas sintetizadas 88), como se ha descrito anteriormente, el procesador 40 aplica una reconstrucción de ondícula para regenerar una representación en el dominio del tiempo 90 tanto de las pistas de entrada reales 82 como de las entradas sintetizadas 88. Se puede utilizar el siguiente algoritmo de reconstrucción de ondícula, por ejemplo, basado en una función delta:
En este caso Xn es la serie de tiempo reconstruida con etapas de tiempo 5f, S¡ es la resolución de la frecuencia; Cs es una constante que equivale a 0,776 para una de ondícula de Morlet con W0 = 6; ^ 0 (0) se obtiene de la de ondícula madre y es igual a tt1/4; J es el número de escalas; j es un índice que define los límites del filtro, en donde j = y'1 ... ¡2 y 0 <p < p < J; Sj es la jth-ésima escala; y 9Íes la parte real de la de ondícula compleja Wn.
Para realizar el mezclado descendente de las representaciones en el dominio del tiempo 90 en una salida estéreo 92, el procesador 40 filtra las entradas reales y sintetizadas utilizando funciones de respuesta de filtrado calculadas en las coordenadas de acimut y elevación de cada una de las ubicaciones de las fuentes 3D reales y sintetizadas. Este proceso utiliza una base de datos de filtros HRTF, y posiblemente también filtros de muesca correspondientes a las elevaciones respectivas de las ubicaciones de las fuentes. Para cada señal de canal, indicada como x(n), el procesador 40 convoluciona la señal con el par de filtros HRTF izquierdo y derecho que coinciden con su ubicación con respecto al oyente. Este cálculo normalmente utiliza una convolución en tiempo discreta:
En este caso x es una señal de audio que es la salida de la reconstrucción de ondícula descrita anteriormente, que representa un altavoz real o virtual, n es la longitud de esa señal, y N es la longitud del filtro HRTF izquierdo hL y del filtro HRTF derecho hR. Las salidas de estas convoluciones son los componentes izquierdo y derecho de la señal estéreo de salida, indicadas en consecuencia yL e yR.
Por ejemplo, dado un altavoz virtual con una elevación de 50° y un acimut de 60°, el audio será convolucionado con el filtro HRTF izquierdo asociado a estas direcciones y con el filtro HRTF derecho asociado a estas direcciones, y posiblemente también con filtros de muesca correspondientes a la elevación de 50°. Las convoluciones crearán componentes estéreo izquierdo y derecho, que darán al oyente la percepción de la direccionalidad del sonido. El procesador 40 repite este cálculo para todos los altavoces en la representación del dominio del tiempo 90, en donde cada altavoz se convoluciona con un par de filtros diferentes (de acuerdo con la ubicación de la fuente correspondiente).
Además, en algunas formas de realización, el procesador 40 también modifica las señales de audio de acuerdo con los alcances respectivos (distancias) de las ubicaciones de las fuentes 3D. Por ejemplo, el procesador 40 puede amplificar o atenuar el volumen de una señal de acuerdo con el alcance. De forma adicional o como alternativa, el procesador 40 puede añadir reverberación a una o más de las señales con el aumento del alcance de la ubicación de la fuente correspondiente.
Después de filtrar todas las señales (reales y sintetizadas) utilizando las respuestas de filtrado apropiadas izquierda y derecha, el procesador 40 suma los resultados filtrados para producir la salida estéreo 92, que comprende un canal izquierdo 94 que es la suma de todos los componentes yL generados por las convoluciones, y un canal derecho 94 que es la suma de todos los componentes yR.
La Fig. 4 es un diagrama de bloques que ilustra de forma esquemática un método para sintetizar estos componentes de salida de audio izquierdo y derecho, de acuerdo con una forma de realización de la invención. En esta forma de realización, el procesador 40 es capaz de realizar todos los cálculos en tiempo real, y el servidor 36 puede por lo tanto retransmitir en directo la salida estéreo bajo demanda al dispositivo móvil 34. Para reducir la carga de cálculo, el servidor 36 puede renunciar a la adición de "altavoces virtuales" (según se proporciona en la forma de realización de la Fig. 3), y utilizar sólo las pistas de entrada reales en la generación de la salida estéreo. Como alternativa, el método de la Fig. 4 se puede utilizar para generar archivos de audio estéreo fuera de línea, para su posterior reproducción.
En una forma de realización, el procesador 40 recibe y opera sobre trozos de entrada de audio 100 de un tamaño determinado (por ejemplo, 65536 bytes de cada uno de los canales de entrada). El procesador guarda temporalmente los trozos en un búfer 102, y procesa cada trozo junto con un trozo anterior almacenado en el búfer para evitar discontinuidades en la salida en los límites entre trozos sucesivos. El procesador 40 aplica filtros 104 a cada trozo 100 para convertir cada canal de entrada en componentes estéreo izquierdo y derecho con señales direccionales adecuadas, correspondientes a la ubicación de la fuente 3D asociada con el canal. Un algoritmo de filtrado adecuado para este propósito se describe a continuación en la presente memoria con referencia a la Fig. 5.
A continuación, el procesador 40 alimenta todas las señales filtradas de cada lado (izquierdo y derecho) a un sumador 106, para calcular las salidas estéreo izquierda y derecha. Para evitar el recorte en la reproducción, el procesador 40 puede aplicar un limitador 108 a las señales sumadas, por ejemplo, de acuerdo con la siguiente ecuación:
En este caso x es la señal de entrada al limitador, e Y es la salida. La retransmisión en directo resultante de los trozos de salida 110 se puede ahora reproducir en los auriculares estéreo 24.
La Fig. 5 es un diagrama de flujo que muestra de forma esquemática detalles de los filtros 104, de acuerdo con una forma de realización de la invención. Filtros similares se pueden utilizar, por ejemplo, en el mezclado descendente de la representación en el dominio del tiempo 90 en la salida estéreo 92 (Fig. 3), así como en el filtrado de las entradas de las fuentes que se tienen que mover a lo largo de trayectorias virtuales (según se ilustra en la Fig. 2). Cuando los trozos de audio 100 contienen múltiples canales en un formato intercalado (como es común en algunos estándares de audio), el procesador 40 comienza por dividir los canales de entrada en retransmisiones en directo diferentes, en una etapa de separación de canales 112.
Los inventores han comprobado que algunos filtros de señal provocan la distorsión de los componentes de audio de baja frecuencia, mientras que, por otro lado, el sentido de la direccionalidad del oyente se basa en las señales de la
gama de frecuencias más alta, por encima de los 1000 Hz. Por consiguiente, el procesador 40 extrae los componentes de baja frecuencia de los canales individuales (excepto el canal del subwoofer, cuando está presente), y almacena en un búfer los componentes de baja frecuencia como un conjunto separado de señales, en una etapa de separación de frecuencias 114.
En una forma de realización, la separación de la señal de baja frecuencia se logra utilizando un filtro de cruce, por ejemplo, un filtro de cruce que tenga una frecuencia de corte de 100 Hz y un orden 16. El filtro de cruce se puede implementar como un filtro Butterworth de respuesta al impulso infinita (IIR), con una función de transferencia H que se puede representar en forma digital mediante la siguiente ecuación:
En este caso z es una variable compleja y L es la longitud del filtro. En otra forma de realización, el filtro de cruce se implementa como un filtro Chebyshev.
El procesador 40 suma juntos los componentes de baja frecuencia resultantes de todas las señales originales. La señal de baja frecuencia resultante, denominada en la presente memoria Sub', se duplica y posteriormente se incorpora a los canales estéreo izquierdo y derecho. Estas etapas son útiles para preservar la calidad de los componentes de baja frecuencia de la entrada.
A continuación, el procesador 40 filtra el componente de alta frecuencia de cada uno de los canales individuales con respuestas de filtrado correspondientes a las respectivas ubicaciones de los canales, con el fin de crear la ilusión de que cada componente emana de la dirección deseada. Para este propósito, el procesador 40 filtra cada canal con los filtros HRTF izquierdo y derecho apropiados, para asignar la señal a un acimut específico en el plano horizontal, en una etapa de filtrado de acimut 116, y con un filtro de muesca, para asignar la señal a una elevación específica, en una etapa de filtrado de elevación 118. Los filtros HRTF y los filtros de muesca se describen en este caso por separado en aras de la claridad conceptual y de cálculo, pero se pueden aplicar de forma alternativa en una única operación de cálculo.
El filtro HRTF se puede aplicar en la etapa 116 utilizando las siguientes convoluciones:
En este caso y(n) son los datos procesados, n es una variable de tiempo discreta, x es un trozo de las muestras de audio que se procesan, y h es el núcleo de la convolución que representa la respuesta al impulso del filtro HRTF apropiado (izquierdo o derecho). Los filtros de muesca aplicados en la etapa 118 pueden ser filtros de mínimos cuadrados limitados con respuesta al impulso finita (FIR), y se pueden aplicar igualmente mediante convolución, de forma similar a los filtros HRTF mostrados en las fórmulas anteriores. Las expresiones detalladas de los coeficientes de filtrado que se pueden utilizar en los filtros HRTF y de muesca en una serie de escenarios de ejemplo se presentan en la solicitud de patente provisional de EE. UU. 62/400.699 mencionada anteriormente.
El procesador 40 no necesita aplicar las mismas condiciones de procesamiento a todos los canales, sino que puede aplicar una polarización a ciertos canales para mejorar la experiencia auditiva del oyente, en una etapa de polarización 120. Por ejemplo, los inventores han encontrado beneficioso en algunos casos polarizar las elevaciones de ciertos canales, ajustando los filtros de muesca correspondientes de modo que las ubicaciones de las fuentes 3D de los canales se perciban por debajo del plano horizontal. Como otro ejemplo, el procesador 40 puede amplificar la ganancia de los canales de sonido envolvente (SL y SR) y/o de los canales traseros (RL y RR) recibidos desde una entrada de sonido envolvente, con el fin de aumentar el volumen de los canales de sonido envolvente y potenciar de este modo el efecto envolvente en el audio procedente de los auriculares 24. Como otro ejemplo, el canal Sub', según se ha definido anteriormente, se puede atenuar con respecto a los componentes de alta frecuencia o se puede limitar de otro modo. Los inventores han comprobado que las polarizaciones en el rango de ±5 dB pueden dar buenos resultados.
Después de la aplicación de los filtros y de cualesquiera polarizaciones deseadas, el procesador 40 pasa todos los componentes estéreo izquierdos y todos los componentes estéreo derechos, junto con el componente Sub', a los sumadores 106, en una etapa de salida de filtrado 122. La generación y salida de las señales estéreo a los auriculares 24 continúa entonces según se ha descrito anteriormente.
Claims (12)
1. Un método para sintetizar sonido, que comprende:
recibir primeras entradas (80) que comprenden varias primeras pistas de audio monoaurales (82), de tal manera que cada primera entrada comprenda una pista de audio monoaural respectiva;
recibir segundas entradas que indiquen las respectivas ubicaciones de las fuentes tridimensionales (3D) con coordenadas de acimut y elevación que se tienen que asociar con las primeras entradas;
asignar a cada una de las primeras entradas las respectivas funciones de respuesta de filtrado izquierda y derecha basadas en respuestas de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D; y
sintetizar las señales de salida estéreo izquierda y derecha (94) aplicando (116) las respectivas respuestas de filtrado derecha e izquierda a las primeras entradas,
en donde la síntesis de las señales de salida estéreo izquierda y derecha comprende:
el muestreo ascendente espacial del primer conjunto de pistas de audio monoaurales para generar unas segundas varias entradas sintetizadas, que tienen ubicaciones de las fuentes 3D sintetizadas con coordenadas respectivas diferentes de las ubicaciones de las fuentes 3D respectivas asociadas con las primeras entradas;
filtrar las entradas sintetizadas utilizando las funciones de respuesta de filtrado calculadas con las coordenadas de acimut y elevación de las ubicaciones de las fuentes 3D sintetizadas; y
después de filtrar las primeras entradas utilizando las respectivas respuestas de filtrado izquierdo y derecho, sumar las entradas sintetizadas filtradas con las primeras entradas filtradas para producir las señales de salida estéreo, caracterizado por que el muestreo ascendente espacial del primer conjunto de pistas de audio monoaurales comprende la aplicación de una transformada de ondícula a las pistas de audio monoaurales para generar los respectivos espectrogramas (84) de las pistas de audio monoaurales e interpolar entre los espectrogramas de acuerdo con las ubicaciones de las fuentes 3D para generar las entradas sintetizadas.
2. El método de acuerdo con la reivindicación 1, en donde al menos una de las segundas entradas especifica una trayectoria 3D en el espacio, y
en donde la asignación de las respuestas de filtrado izquierdo y derecho comprende la especificación, en cada uno de varios puntos de la trayectoria 3D, de respuestas de filtrado que varían a lo largo de la trayectoria en respuesta a las coordenadas de acimut y elevación de los puntos, y
en donde la síntesis de las señales de salida estéreo izquierda y derecha comprende aplicar de forma secuencial a la primera entrada que está asociada con la al menos una de las segundas entradas las respuestas de filtrado que se especifican para los puntos a lo largo de la trayectoria 3D.
3. El método de acuerdo con la reivindicación 2, en donde la recepción de las segundas entradas comprende: recibir un punto inicial y un momento inicial de la trayectoria;
recibir un punto final y un momento final de la trayectoria; y
calcular de forma automática la trayectoria 3D entre el punto inicial y el punto final, de tal manera que la trayectoria se recorra desde el momento inicial hasta el momento final.
4. El método de acuerdo con la reivindicación 3, en donde el cálculo automático de la trayectoria 3D comprende el cálculo de una trayectoria sobre una superficie de una esfera centrada en un origen de las coordenadas de acimut y elevación.
5. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 4, en donde las funciones de respuesta de filtrado comprenden una muesca a una frecuencia determinada, que varía en función de las coordenadas de elevación.
6. El método de acuerdo con la reivindicación 5, en donde la interpolación entre los espectrogramas comprende calcular una función de flujo óptico entre puntos en los espectrogramas.
7. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 4, en donde sintetizar las señales de salida estéreo izquierda y derecha comprende extraer componentes de baja frecuencia de las primeras entradas, y en donde aplicar las respuestas de filtrado izquierdo y derecho comprende filtrar las primeras entradas después de la extracción de los componentes de baja frecuencia y, a continuación, agregar los componentes de baja frecuencia extraídos a las primeras entradas filtradas.
8. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 4, en donde las ubicaciones de las fuentes 3D tienen coordenadas de alcance que se deben asociar con las primeras entradas, y en donde sintetizar las salidas estéreo izquierda y derecha comprende modificar aún más las primeras entradas en respuesta a las coordenadas de alcance asociadas.
9. Aparato (20) para sintetizar sonido, que comprende:
una interfaz de entrada (44, 46) configurada para recibir las primeras entradas (80) que comprenden un primer conjunto de pistas de audio monoaurales (82), de tal manera que cada primera entrada comprende una pista de audio monoaural respectiva, y para recibir segundas entradas que indiquen las respectivas ubicaciones de las fuentes tridimensionales (3D) con coordenadas de acimut y elevación que se tienen que asociar con las primeras entradas; y
un procesador (40), que se configura para asignar a cada una de las primeras entradas las respectivas respuestas de filtrado izquierdo y derecho basadas en funciones de respuesta de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D, y para sintetizar (116) las señales de salida estéreo izquierda y derecha (94) aplicando las respectivas respuestas del filtrado izquierdo y derecho a las primeras entradas,
caracterizado por que el procesador se configura para el muestreo ascendente espacial del primer conjunto de pistas de audio monoaurales aplicando una transformada de ondícula a las pistas de audio de entrada para generar los respectivos espectrogramas (84) de las pistas de audio de entrada y, para interpolar entre los espectrogramas de acuerdo con las ubicaciones de las fuentes 3D para generar entradas sintetizadas y sintetizar las señales de salida estéreo izquierda y derecha utilizando tanto las primeras entradas como las entradas sintetizadas.
10. El aparato de acuerdo con la reivindicación 9, en donde el procesador se configura para interpolar entre los espectrogramas utilizando una función de flujo óptico calculada entre los puntos de los espectrogramas.
11. Un producto de software de ordenador, que comprende un medio no transitorio legible por ordenador en el que se almacenan instrucciones de programa, cuyas instrucciones, cuando son leídas por un ordenador (36), hacen que el ordenador reciba las primeras entradas (80) que comprenden un primer grupo de pistas de audio monoaurales (82), de tal manera que cada primera entrada comprenda una pista de audio monoaural respectiva, y que reciba segundas entradas que indican las respectivas ubicaciones de las fuentes tridimensionales (3D) que tienen las coordenadas de acimut y elevación que se tienen que asociar con las primeras entradas,
en donde las instrucciones hacen que el ordenador asigne a cada una de las primeras entradas las respectivas respuestas de filtrado izquierdo y derecho basadas en funciones de respuesta de filtrado que dependen de las coordenadas de acimut y elevación de las respectivas ubicaciones de las fuentes 3D, y que sintetice (116) señales de salida estéreo izquierda y derecha (94) aplicando las respectivas respuestas de filtrado izquierdo y derecho a las primeras entradas,
caracterizado por que las instrucciones hacen que el ordenador realice un muestreo ascendente espacial del primer grupo de pistas de audio monoaurales aplicando una transformada de ondícula a las pistas de audio de entrada para generar los respectivos espectrogramas (84) de las pistas de audio de entrada y, para interpolar entre los espectrogramas de acuerdo con las ubicaciones de las fuentes 3D para generar entradas sintetizadas y sintetizar las señales de salida estéreo izquierda y derecha utilizando tanto las primeras entradas como las entradas sintetizadas.
12. El producto de acuerdo con la reivindicación 11, en donde las instrucciones hacen que el ordenador interpole entre los espectrogramas utilizando una función de flujo óptico calculada entre puntos en los espectrogramas.
Applications Claiming Priority (4)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US201662280134P | 2016-01-19 | 2016-01-19 | |
| US201662400699P | 2016-09-28 | 2016-09-28 | |
| US201662432578P | 2016-12-11 | 2016-12-11 | |
| PCT/IB2017/050018 WO2017125821A1 (en) | 2016-01-19 | 2017-01-04 | Synthesis of signals for immersive audio playback |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2916342T3 true ES2916342T3 (es) | 2022-06-30 |
Family
ID=59361718
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES17741145T Active ES2916342T3 (es) | 2016-01-19 | 2017-01-04 | Síntesis de señales para la reproducción de audio inmersiva |
Country Status (11)
| Country | Link |
|---|---|
| US (1) | US10531216B2 (es) |
| EP (1) | EP3406088B1 (es) |
| JP (1) | JP6820613B2 (es) |
| KR (1) | KR102430769B1 (es) |
| CN (1) | CN108476367B (es) |
| AU (1) | AU2017210021B2 (es) |
| CA (1) | CA3008214C (es) |
| DK (1) | DK3406088T3 (es) |
| ES (1) | ES2916342T3 (es) |
| SG (1) | SG11201804892PA (es) |
| WO (1) | WO2017125821A1 (es) |
Families Citing this family (17)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN111316671B (zh) * | 2017-11-14 | 2021-10-22 | 索尼公司 | 信号处理设备和方法以及程序 |
| US20190182592A1 (en) * | 2017-12-11 | 2019-06-13 | Marvin William Caesar | Method for adjusting audio for listener location and head orientation within a physical or virtual space |
| US10523171B2 (en) | 2018-02-06 | 2019-12-31 | Sony Interactive Entertainment Inc. | Method for dynamic sound equalization |
| US10652686B2 (en) | 2018-02-06 | 2020-05-12 | Sony Interactive Entertainment Inc. | Method of improving localization of surround sound |
| US10477338B1 (en) | 2018-06-11 | 2019-11-12 | Here Global B.V. | Method, apparatus and computer program product for spatial auditory cues |
| WO2020014506A1 (en) | 2018-07-12 | 2020-01-16 | Sony Interactive Entertainment Inc. | Method for acoustically rendering the size of a sound source |
| EP3824463A4 (en) * | 2018-07-18 | 2022-04-20 | Sphereo Sound Ltd. | Detection of audio panning and synthesis of 3d audio from limited-channel surround sound |
| US11304021B2 (en) | 2018-11-29 | 2022-04-12 | Sony Interactive Entertainment Inc. | Deferred audio rendering |
| US10932083B2 (en) * | 2019-04-18 | 2021-02-23 | Facebook Technologies, Llc | Individualization of head related transfer function templates for presentation of audio content |
| WO2020253941A1 (en) | 2019-06-17 | 2020-12-24 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder with a signal-dependent number and precision control, audio decoder, and related methods and computer programs |
| CN112738634B (zh) * | 2019-10-14 | 2022-08-02 | 北京字节跳动网络技术有限公司 | 视频文件的生成方法、装置、终端及存储介质 |
| US11363402B2 (en) * | 2019-12-30 | 2022-06-14 | Comhear Inc. | Method for providing a spatialized soundfield |
| KR20250052461A (ko) | 2021-07-08 | 2025-04-18 | 붐클라우드 360 인코포레이티드 | 올패스 필터 네트워크를 사용한 고도 지각적 큐의 무색 생성 |
| CN113747304B (zh) * | 2021-08-25 | 2024-04-26 | 深圳市爱特康科技有限公司 | 一种新型的低音回放方法和装置 |
| CN114339582B (zh) * | 2021-11-30 | 2024-02-06 | 北京小米移动软件有限公司 | 双通道音频处理、方向感滤波器生成方法、装置以及介质 |
| CN116320962A (zh) * | 2023-01-03 | 2023-06-23 | 蔚来汽车科技(安徽)有限公司 | 音频处理方法、装置、计算机设备和存储介质 |
| EP4690842A2 (en) * | 2023-03-31 | 2026-02-11 | Iyo Inc. | Virtual auditory display filters and associated systems, methods, and non-transitory computer-readable media |
Family Cites Families (29)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5371799A (en) | 1993-06-01 | 1994-12-06 | Qsound Labs, Inc. | Stereo headphone sound source localization system |
| JPH08107600A (ja) * | 1994-10-04 | 1996-04-23 | Yamaha Corp | 音像定位装置 |
| US5742689A (en) * | 1996-01-04 | 1998-04-21 | Virtual Listening Systems, Inc. | Method and device for processing a multichannel signal for use with a headphone |
| US6421446B1 (en) | 1996-09-25 | 2002-07-16 | Qsound Labs, Inc. | Apparatus for creating 3D audio imaging over headphones using binaural synthesis including elevation |
| GB9726338D0 (en) * | 1997-12-13 | 1998-02-11 | Central Research Lab Ltd | A method of processing an audio signal |
| GB2343347B (en) * | 1998-06-20 | 2002-12-31 | Central Research Lab Ltd | A method of synthesising an audio signal |
| US6175631B1 (en) * | 1999-07-09 | 2001-01-16 | Stephen A. Davis | Method and apparatus for decorrelating audio signals |
| JP3915746B2 (ja) * | 2003-07-01 | 2007-05-16 | 日産自動車株式会社 | 車両用外界認識装置 |
| US20050273324A1 (en) | 2004-06-08 | 2005-12-08 | Expamedia, Inc. | System for providing audio data and providing method thereof |
| JP4449616B2 (ja) * | 2004-07-21 | 2010-04-14 | パナソニック株式会社 | タッチパネル |
| US7774707B2 (en) | 2004-12-01 | 2010-08-10 | Creative Technology Ltd | Method and apparatus for enabling a user to amend an audio file |
| KR100606734B1 (ko) * | 2005-02-04 | 2006-08-01 | 엘지전자 주식회사 | 삼차원 입체음향 구현 방법 및 그 장치 |
| JP2007068022A (ja) * | 2005-09-01 | 2007-03-15 | Matsushita Electric Ind Co Ltd | 音像定位装置 |
| CN1937854A (zh) * | 2005-09-22 | 2007-03-28 | 三星电子株式会社 | 用于再现双声道虚拟声音的装置和方法 |
| CN101390443B (zh) * | 2006-02-21 | 2010-12-01 | 皇家飞利浦电子股份有限公司 | 音频编码和解码 |
| KR101368859B1 (ko) * | 2006-12-27 | 2014-02-27 | 삼성전자주식회사 | 개인 청각 특성을 고려한 2채널 입체 음향 재생 방법 및장치 |
| CN101690269A (zh) | 2007-06-26 | 2010-03-31 | 皇家飞利浦电子股份有限公司 | 双耳的面向对象的音频解码器 |
| JP2009065452A (ja) * | 2007-09-06 | 2009-03-26 | Panasonic Corp | 音像定位制御装置、音像定位制御方法、プログラム、および集積回路 |
| US20120020483A1 (en) * | 2010-07-23 | 2012-01-26 | Deshpande Sachin G | System and method for robust audio spatialization using frequency separation |
| US9271102B2 (en) * | 2012-08-16 | 2016-02-23 | Turtle Beach Corporation | Multi-dimensional parametric audio system and method |
| WO2014036121A1 (en) * | 2012-08-31 | 2014-03-06 | Dolby Laboratories Licensing Corporation | System for rendering and playback of object based audio in various listening environments |
| US8638959B1 (en) | 2012-10-08 | 2014-01-28 | Loring C. Hall | Reduced acoustic signature loudspeaker (RSL) |
| CN105075292B (zh) * | 2013-03-28 | 2017-07-25 | 杜比实验室特许公司 | 用于创作和渲染音频再现数据的方法和设备 |
| WO2014171706A1 (ko) * | 2013-04-15 | 2014-10-23 | 인텔렉추얼디스커버리 주식회사 | 가상 객체 생성을 이용한 오디오 신호 처리 방법 |
| WO2015031080A2 (en) * | 2013-08-30 | 2015-03-05 | Gleim Conferencing, Llc | Multidimensional virtual learning audio programming system and method |
| JP6184808B2 (ja) * | 2013-09-05 | 2017-08-23 | 三菱重工業株式会社 | 中子型および中空構造体の製造方法 |
| CN104581610B (zh) * | 2013-10-24 | 2018-04-27 | 华为技术有限公司 | 一种虚拟立体声合成方法及装置 |
| CN107464553B (zh) * | 2013-12-12 | 2020-10-09 | 株式会社索思未来 | 游戏装置 |
| JP6642989B2 (ja) * | 2015-07-06 | 2020-02-12 | キヤノン株式会社 | 制御装置、制御方法及びプログラム |
-
2017
- 2017-01-04 AU AU2017210021A patent/AU2017210021B2/en not_active Ceased
- 2017-01-04 US US16/061,343 patent/US10531216B2/en active Active
- 2017-01-04 CA CA3008214A patent/CA3008214C/en active Active
- 2017-01-04 KR KR1020187022360A patent/KR102430769B1/ko active Active
- 2017-01-04 WO PCT/IB2017/050018 patent/WO2017125821A1/en not_active Ceased
- 2017-01-04 SG SG11201804892PA patent/SG11201804892PA/en unknown
- 2017-01-04 DK DK17741145.1T patent/DK3406088T3/da active
- 2017-01-04 ES ES17741145T patent/ES2916342T3/es active Active
- 2017-01-04 CN CN201780005679.5A patent/CN108476367B/zh not_active Expired - Fee Related
- 2017-01-04 EP EP17741145.1A patent/EP3406088B1/en active Active
- 2017-01-04 JP JP2018535000A patent/JP6820613B2/ja not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| CN108476367B (zh) | 2020-11-06 |
| KR102430769B1 (ko) | 2022-08-09 |
| US20190020963A1 (en) | 2019-01-17 |
| EP3406088A4 (en) | 2019-08-07 |
| DK3406088T3 (da) | 2022-04-25 |
| CA3008214C (en) | 2022-05-17 |
| EP3406088A1 (en) | 2018-11-28 |
| KR20180102596A (ko) | 2018-09-17 |
| SG11201804892PA (en) | 2018-08-30 |
| US10531216B2 (en) | 2020-01-07 |
| JP2019506058A (ja) | 2019-02-28 |
| CA3008214A1 (en) | 2017-07-27 |
| JP6820613B2 (ja) | 2021-01-27 |
| WO2017125821A1 (en) | 2017-07-27 |
| AU2017210021B2 (en) | 2019-07-11 |
| CN108476367A (zh) | 2018-08-31 |
| AU2017210021A1 (en) | 2018-07-05 |
| EP3406088B1 (en) | 2022-03-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2916342T3 (es) | Síntesis de señales para la reproducción de audio inmersiva | |
| RU2736418C1 (ru) | Принцип формирования улучшенного описания звукового поля или модифицированного описания звукового поля с использованием многоточечного описания звукового поля | |
| TWI517028B (zh) | 音訊空間定位和環境模擬 | |
| EP2891336B1 (en) | Virtual rendering of object-based audio | |
| CN101874414B (zh) | 改善最佳收听区域内的声场渲染精度的方法和设备 | |
| US11122384B2 (en) | Devices and methods for binaural spatial processing and projection of audio signals | |
| CN113170271B (zh) | 用于处理立体声信号的方法和装置 | |
| CN101263740A (zh) | 生成3d声音的方法和设备 | |
| CN110089135A (zh) | 用于生成音频映象的系统和方法 | |
| US12395806B2 (en) | Object-based audio spatializer | |
| US20190394596A1 (en) | Transaural synthesis method for sound spatialization | |
| US11665498B2 (en) | Object-based audio spatializer | |
| Paterson et al. | Producing 3-D audio | |
| US20250350898A1 (en) | Object-based Audio Spatializer With Crosstalk Equalization | |
| WO2021063458A1 (en) | A method and system for real-time implementation of time-varying head-related transfer functions | |
| WO2022034805A1 (ja) | 信号処理装置および方法、並びにオーディオ再生システム | |
| KR20230059283A (ko) | 공연과 영상에 몰입감 향상을 위한 실감음향 처리 시스템 | |
| KR20050060552A (ko) | 입체 음향 시스템 및 입체 음향 구현 방법 |







