ES2670870T3 - Método de realce de sonido, dispositivo, programa y medio de grabación - Google Patents
Método de realce de sonido, dispositivo, programa y medio de grabación Download PDFInfo
- Publication number
- ES2670870T3 ES2670870T3 ES11852100.4T ES11852100T ES2670870T3 ES 2670870 T3 ES2670870 T3 ES 2670870T3 ES 11852100 T ES11852100 T ES 11852100T ES 2670870 T3 ES2670870 T3 ES 2670870T3
- Authority
- ES
- Spain
- Prior art keywords
- sound
- filter
- sounds
- microphones
- frequency
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04R—LOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
- H04R3/00—Circuits for transducers
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04R—LOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
- H04R3/00—Circuits for transducers
- H04R3/005—Circuits for transducers for combining the signals of two or more microphones
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L21/0232—Processing in the frequency domain
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L2021/02082—Noise filtering the noise being echo, reverberation of the speech
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L2021/02161—Number of inputs available containing the signal or the noise to be suppressed
- G10L2021/02166—Microphone arrays; Beamforming
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04R—LOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
- H04R2430/00—Signal processing covered by H04R, not provided for in its groups
- H04R2430/03—Synergistic effects of band splitting and sub-band processing
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Otolaryngology (AREA)
- General Health & Medical Sciences (AREA)
- Computational Linguistics (AREA)
- Quality & Reliability (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Multimedia (AREA)
- Circuit For Audible Band Transducer (AREA)
- Obtaining Desirable Characteristics In Audible-Bandwidth Transducers (AREA)
Abstract
Un método de realce de sonido de obtención de una señal de salida en el dominio de frecuencia en el que un sonido de una posición deseada determinada por una dirección y una distancia se realza aplicando, para cada frecuencia, un filtro que realza el sonido de la posición deseada a señales en el dominio de la frecuencia transformadas a partir de M sonidos captados, captados con M micrófonos (200-1, ..., 200-M), donde M es un número entero mayor o igual a dos, en donde cada una de las funciones de transferencia ai,g se obtiene mediante la suma de una función de transferencia de un sonido directo que viene de la posición determinada por la dirección i y la distancia g y llega directamente a los M micrófonos y una función de transferencia de uno o más sonidos reflejados cuyas descomposiciones debidas a la reflexión y diferencias de tiempo de llegada con respecto al sonido directo se corrigen, siendo el uno o más sonidos reflejados producidos por la reflexión del sonido directo fuera de un objeto reflector y llegando a los M micrófonos, comprendiendo el método: un paso de diseño de filtro para obtener uno o una pluralidad de filtros; y un paso (S26, S36) de aplicación de filtro de aplicación, para cada frecuencia, para una posición deseada que es un objetivo de un realce de sonido, de un filtro obtenido en el paso de diseño de filtro a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con los M micrófonos para obtener una señal de salida en el dominio de frecuencia en el que se realza un sonido de la posición deseada; en donde el paso (S21, S35) de diseño de filtro usa la función de transferencia ai,g de un sonido que viene de cada una de una o de una pluralidad de posiciones predeterminadas que se supone que son fuentes de sonido y llega a cada uno de los micrófonos para obtener, para cada frecuencia y para cada una o una pluralidad de posiciones predeterminadas, un filtro respectivo para la posición predeterminada respectiva como objetivo de un realce de sonido antes de captar los M sonidos captados con los M micrófonos (200-1, ..., 200-M), donde i denota una dirección y g denota una distancia para identificar cada una de las posiciones.
Description
DESCRIPCIÓN
Método de realce de sonido, dispositivo, programa y medio de grabación Campo técnico
La presente invención se refiere a una técnica capaz de realzar sonidos en un intervalo estrecho deseado (técnica 5 de realce de sonido).
Antecedentes de la técnica
Cuando un dispositivo de filmación de películas (cámara de video o videocámara), por ejemplo, equipado con un micrófono se acerca a un sujeto para filmar al sujeto, es preferible para la grabación de video que solamente los sonidos de alrededor del sujeto se deberían realzar en sincronización con el acercamiento de la filmación. Se han 10 estudiado y desarrollado técnicas (técnicas de realce de sonido directivo agudo) para realzar sonidos en un intervalo estrecho que incluye una dirección deseada (una dirección del objetivo). La sensibilidad de un micrófono pertinente a las direcciones alrededor del micrófono se denomina directividad. Cuando la directividad en una dirección particular es aguda, se realzan los sonidos que llegan desde un intervalo estrecho incluyendo la dirección particular y se suprimen los sonidos fuera del intervalo. Aquí se describirán en primer lugar tres técnicas convencionales 15 relacionadas con la técnica de realce de sonido directivo agudo. El término “sonido o sonidos” como se usa en la presente memoria no se limita a la voz humana, sino que se refiere a “sonido o sonidos” en general, tales como música y ruido ambiental, así como llamadas de animales y voz humana.
[1] Técnica de realce de sonido directivo agudo que usa propiedades físicas
Ejemplos típicos de esta categoría incluyen micrófonos de cañón y micrófonos parabólicos. El principio de un 20 micrófono 900 de tubo acústico se describirá primero con referencia a la Fig. 1. El micrófono 900 de tubo acústico usa una interferencia de sonido para realzar sonidos que llegan desde una dirección del objetivo. La Fig. 1A ilustra el realce de sonidos que llegan desde una dirección del objetivo mediante el micrófono 900 de tubo acústico. La abertura del tubo 901 acústico del micrófono 900 de tubo acústico se apunta a la dirección del objetivo. Los sonidos que llegan desde la parte delantera (dirección del objetivo) de la abertura del tubo 901 acústico viajan directamente a 25 través del interior del tubo 901 acústico y alcanzan un micrófono 902 del micrófono 900 de tubo acústico con baja pérdida de energía. Por otra parte, los sonidos que llegan desde direcciones distintas de la dirección del objetivo entran en el tubo 901 a través de muchas rendijas 903 provistas en los lados del tubo como se ilustra en la Fig. 1B. Los sonidos que se introducen a través de las rendijas 903 interfieren unos con otros, lo que reduce los niveles de presión de sonido de los sonidos que vinieron de las direcciones distintas a la dirección del objetivo y alcanzan el 30 micrófono 902.
El principio de un micrófono 910 parabólico se describirá a continuación con referencia a la Fig. 2. El micrófono 910 parabólico usa la reflexión de sonidos para realzar los sonidos que llegan desde una dirección del objetivo. La Fig. 2A es un diagrama que ilustra el realce de sonidos que llegan desde la dirección del objetivo por el micrófono 910 parabólico. Un reflector 911 parabólico (superficie parabólica) del micrófono 910 parabólico se apunta a la dirección 35 del objetivo de modo que la línea que enlaza entre el vértice del reflector 911 parabólico y el punto focal del reflector 911 parabólico coincide con la dirección del objetivo. Los sonidos que llegan desde la dirección del objetivo se reflejan por el reflector 911 parabólico y se enfocan en el punto focal. Por consiguiente, un micrófono 912 colocado en el punto focal puede realzar y captar señales de sonido incluso con poca energía. Por otra parte, los sonidos que llegan desde las direcciones distintas a la dirección del objetivo y se reflejan por el reflector 911 parabólico no se 40 enfocan en el punto focal, como se ilustra en la Fig. 2B. Por consiguiente, se disminuyen los niveles de presión de sonido de los sonidos que vienen desde la dirección distinta a la dirección del objetivo y que llegaron al micrófono 912.
[2] Técnica de realce de sonido directivo agudo que usa procesamiento de señal
Ejemplos típicos de esta categoría incluyen agrupaciones de micrófonos en fase (véase la bibliografía no de patente 45 1). La Fig. 3 es un diagrama que ilustra que una agrupación de micrófonos en fase que incluye múltiples micrófonos
se usa para realzar sonidos de una dirección del objetivo y suprime los sonidos de las otras direcciones distintas de la dirección del objetivo. La agrupación de micrófonos en fase realiza procesamiento de señal para aplicar un filtro que incluye información acerca de las diferencias de fase y/o de amplitud entre los micrófonos a las señales captadas con los micrófonos y superpone las señales resultantes para realzar los sonidos de la dirección del 50 objetivo. A diferencia del micrófono de tubo acústico y el micrófono parabólico descritos en la categoría [1], la agrupación de micrófonos en fase puede realzar los sonidos que llegan desde cualquier dirección debido a que realza los sonidos mediante el procesamiento de señal.
[3] Técnica de realce de sonido directivo agudo mediante captación selectiva de sonidos reflejados
Ejemplos típicos de esta categoría incluyen conformación de haces múltiples (véase la bibliografía no de patente 2). 55 La conformación de haces múltiples es una técnica de realce de sonido directivo agudo que recoge sonidos individuales, incluyendo sonidos directos y sonidos reflejados, juntos para captar los sonidos que llegan de una
dirección del objetivo con una relación señal a ruido alta y se ha estudiado más intensivamente en el campo de lo inalámbrico más que en el de la acústica.
El procesamiento de la conformación de haces múltiples en un dominio de frecuencia se describirá a continuación. Los símbolos se definirán antes de la descripción. El índice de una frecuencia se denota por w y el índice de un 5 número de tiempo de trama se denota por k. Representaciones en el dominio de frecuencia de señales analógicas recibidas en M micrófonos se denotan porX^ (w, k) = [Xi (w, k), ..., Xm (w, k)]T, la dirección desde la cual un sonido directo de una fuente de sonido ubicada en una dirección 0s a ser realzada se denota por 0si, las direcciones desde las cuales llegan sonidos reflejados se denotan por 0s2, ..., 0sR. Aquí, T representa la transposición y R - 1 es el número total de sonidos reflejados. Un filtro que realza un sonido desde una dirección 0sr se denota por W^(w, 0sr). 10 Aquí, r es un número entero que satisface 1 < r< R.
Una precondición para la conformación de haces múltiples es que se conozcan las direcciones a partir de las cuales llegan los sonidos directos y reflejados y sus tiempos de llegada. Es decir, el número de objetos, tales como paredes, suelos, reflectores, que obviamente se espera que reflejen los sonidos es igual a R - 1. El número de sonidos reflejados, R - 1, a menudo se establece en un valor relativamente pequeño, tal como 3 o 4. Esto se basa en 15 el hecho de que hay una alta correlación entre un sonido directo y un sonido reflejado de bajo orden. Dado que la conformación de haces múltiples realza los sonidos individualmente y añade síncronamente las señales realzadas, una señal de salida Y(w, k, 0s) se puede dar por la ecuación (1). Aquí, H representa la transposición hermitiana.
R
y(®,*,<9s) = £w'V,0sr)X(ffl,í:) (1)
r-l
La conformación de haces de retardo y suma se describirá como método para diseñar un filtro W^(w, 0sr). 20 Suponiendo que los sonidos directos y reflejados llegan como ondas planas, entonces el filtro W^(w, 0sr) se puede dar por la ecuación (2).
donde, h^ (w, 0sr) = [h-i(w, 0sr), ..., hM(w, 0sr)] es un vector de propagación de un sonido que llega de una dirección
0sr.
25 Suponiendo que ondas planas llegan a una agrupación de micrófonos lineales (una agrupación de micrófonos en la que M micrófonos están dispuestos linealmente), entonces los elementos hm(w, 0sr) que componen h^(w, 0sr) se pueden dar por la ecuación (3).
donde m es un número entero que satisface 1 < m < M, c es la velocidad del sonido, u representa la distancia entre 30 micrófonos adyacentes, j es una unidad imaginaria, y z (0sr) representa un retardo de tiempo entre un sonido directo y un sonido reflejado que llega desde la dirección 0sr.
Por último, una señal de salida Y(w, k, 0s) se transforma a un dominio de tiempo para obtener una señal en la que se realza un sonido de la fuente de sonido situada en la dirección del objetivo 0s.
La Fig. 4 ilustra una configuración funcional de la técnica de realce de sonido directivo agudo que usa la 35 conformación de haces múltiples.
Paso 1
Un convertidor 110 AD convierte señales analógicas emitidas desde M micrófonos 100-1, ..., 100-M en señales digitales x^(t) = [x-i(t), ..., XM(t)]T. Aquí, t representa el índice de un tiempo discreto.
Paso 2
40 Una sección 120 de transformada en el dominio de frecuencia transforma la señal digital de cada canal en una señal en el dominio de frecuencia mediante un método tal como transformada de Fourier discreta rápida. Por ejemplo, para el micrófono de orden m (1 < m < M), las señales Xm((k - 1) N + 1), ..., Xm(kN) en N puntos de muestreo se almacenan en un almacenador temporal. Aquí, N es aproximadamente 512 en el caso de muestreo a 16 KHz. La
5
10
15
20
25
30
35
40
45
transformada de Fourier discreta rápida de las señales analógicas de M canales almacenados en el almacenador temporal se realiza para obtener señales en el dominio de frecuencia X^(w, k) = [Xi(w, k), ..., Xm(w, k)]T.
Paso 3
Cada una de las secciones de filtrado de realce 130-r (1 < r < R) aplica un filtro W^H(u>, 0sr) para una dirección 0sr a las señales en el dominio de frecuencia X^(w, k) = [Xi(u>, k), ..., Xm(w, k)]T y emite una señal Zr (w, k) en la que se realza un sonido de la dirección 0sr. Es decir, cada sección de filtrado de realce 130-r (1 < r < R) realiza un procesamiento dado por la ecuación (4):
Zr(a>,k) = WH(a>,0sr)X(a>,k) (4)
Un sumador 140 toma entradas de las señales Z1(w, k), ..., Zr(w, k) y emite una señal de suma Y(w, k). La suma se puede dar por la ecuación (5):
Paso 5
Una sección 150 de transformada en el dominio de tiempo transforma la señal suma Y(w, k) a un dominio de tiempo y emite una señal y(t) en el dominio de tiempo en la que se realza el sonido de la dirección 0s.
En algunas situaciones, por ejemplo en una situación donde hay múltiples fuentes de sonido en aproximadamente la misma dirección a diferentes distancias de un micrófono, se puede desear que los sonidos que llegan de las fuentes de sonido sean realzados selectivamente mediante la técnica de realce de sonido directivo agudo. Consideremos una situación donde un dispositivo de filmación de películas equipado con un micrófono se acerca a un sujeto para filmar al sujeto como en el ejemplo descrito anteriormente. Si hay una fuente de sonido (conocida como la “fuente de sonido trasera”) en la parte trasera del sujeto enfocado (conocido como la “fuente de sonido enfocado”) en el intervalo de directividad del micrófono, un sonido de la fuente de sonido enfocado y un sonido de la fuente de sonido trasera se mezclan y se realzan, dando a los espectadores una experiencia de escucha no natural. Por lo tanto, se desea una técnica capaz de realzar sonidos en un intervalo estrecho que incluye una dirección deseada según las distancias desde un micrófono (una técnica de realce de punto de sonido). Se describirán a modo de ilustración tres técnicas convencionales con relación a la técnica de realce de punto de sonido.
(1) La técnica descrita en la bibliografía no de patente 3 es un método de diseño óptimo para una agrupación de retardo y suma en un campo cercano de sonido donde las ondas de sonido son esféricas. La agrupación está diseñada de modo que se maximiza la relación SN entre una señal de objetivo de una posición de fuente de sonido y sonidos indeseados (ruido de fondo y reverberación).
(2) La técnica descrita en la bibliografía no de patente 4 requiere dos agrupaciones pequeñas de micrófonos y permite una captura de sonido de punto según las distancias sin necesitar una agrupación grande de micrófonos.
(3) La técnica descrita en la bibliografía no de patente 5 distingue entre distancias a una fuente de sonido con una única agrupación de micrófonos y realza o suprime sonidos solamente de la fuente de sonido en un intervalo de distancia particular, eliminando por ello el ruido de interferencia. Esta técnica tiene la ventaja del hecho de que la potencia de un sonido que llega directamente desde una fuente de sonido y la potencia de un sonido entrante reflejado varían según las distancias para realzar sonidos según las distancias de las fuentes de sonido.
Además se hace referencia a la bibliografía no de patente 6 que investiga el efecto de la reflexión de sala en una separación de fuente ciega. Se demuestra que se puede reducir la reflexión de orden más alto usando el método de subespacio. Se demuestra además que la reflexión de orden más bajo tiene poco efecto en el rendimiento de separación. La bibliografía no de patente 6 falla al describir que el filtro que realza los sonidos se obtiene antes de captar los sonidos a ser realzados.
Lista de referencias
Bibliografía no de patente
Bibliografía no de patente 1: O. L. Frost, “An algorithm for linearly constrained adaptative array processing”, Actas del IEEE, vol. 60, páginas 926 - 935, 1972.
Bibliografía no de patente 2: J. L. Flanagan, A. C. Surendran, E. E. Jan, “Spatially selective sound capture for speech and audio processing”, Speech Communication, Volumen 13, Número 1-2, páginas 207 - 222, octubre de 1993.
5
10
15
20
25
30
35
40
45
50
55
Bibliografía no de patente 3: Hiroaki Nomura, Yutaka Kaneda, Junji Kojima, “Microphone array for near sound field”, El Diario de la Sociedad Acústica de Japón, Vol. 53, N° 2, páginas 110 - 116, 1997.
Bibliografía no de patente 4: Yusuke Hioka, Kazunori Kobayashi, Kenichi Furuya y Akitoshi Kataoka, “Enhancement of Sound Sources Located within a Particular Area Using a Pair of Small Microphone arrays”, Actas del IEICE sobre Fundamentos, Vol. E91-A, N° 2, páginas 561 -574, agosto de 2004.
Bibliografía no de patente 5: Yusuke Hioka, Kenta Niwa, Sumitaka Sakauchi, Ken'ichi Furuta y Yoichi Haneda, “A method of separating sound sources located at different distances based on direct-to-reververation ratio”, Actas de la Reunión de Otoño de la Sociedad de Acústica de Japón, páginas 633 - 634, septiembre de 2009.
Bibliografía no de patente 6: Futoshi Asano et al., “Blind Source Separation in Reflective Sound Fields”, Taller Internacional sobre Comunicación de Habla Manos Libres (HSC2001), Kyoto, Japón, 9-11 de abril de 2001, páginas 51-54.
Compendio de la invención
Problemas a ser resueltos por la invención
Según la técnica de realce de sonido directivo agudo descrita en la categoría [1], un sonido que llega de una dirección del objetivo no se puede realzar a menos que el micrófono en sí mismo apunte a la dirección del objetivo, como se puede ver a partir de los ejemplos de micrófonos de tubo acústico y los micrófonos parabólicos. Es decir, cuando la dirección del objetivo pueda variar, se necesitan medios de accionamiento y control para cambiar la orientación del micrófono de tubo acústico o del micrófono parabólico en sí mismo, a menos que se use una acción física humana. Además, mientras que el micrófono parabólico destaca en la captación de sonido de relación SN alta debido a que el micrófono parabólico puede enfocar la energía de los sonidos reflejados por el reflector parabólico en el punto focal, es difícil para el micrófono parabólico, así como para el micrófono de tubo acústico lograr una directividad alta, por ejemplo, un ángulo visual de aproximadamente 5° a 10° (directividad aguda de un ángulo de aproximadamente + 5° a + 10° con respecto a la dirección del objetivo).
Según la técnica de realce de sonido directivo agudo descrita en la categoría [2], con el fin de lograr una directividad más alta, se requieren más micrófonos y un tamaño de la agrupación más grande (una longitud total más grande de la agrupación). No es realista aumentar el tamaño de la agrupación ilimitadamente, debido a un espacio restringido donde se coloca la agrupación de micrófonos en fase, los costes y el número de micrófonos capaces de realizar procesamiento en tiempo real. Por ejemplo, los micrófonos disponibles en el mercado son capaces de procesar en tiempo real hasta aproximadamente 100 señales. La directividad que se puede lograr con una agrupación de micrófonos en fase con alrededor de 100 micrófonos es aproximadamente + 30° con respecto a la dirección del objetivo y por lo tanto es difícil para una agrupación de micrófonos en fase realzar el sonido de una dirección del objetivo con una directividad aguda de aproximadamente + 5° a + 10°, por ejemplo. Además, es difícil para la técnica convencional en la categoría [2] captar un sonido de una dirección del objetivo con una relación SN alta de modo que el sonido no se oculte en sonidos de otras direcciones distintas de la dirección del objetivo.
Según la técnica de realce de sonido directivo agudo descrita en la categoría [3], mientras que un sonido de una dirección del objetivo se puede captar con una relación SN alta de modo que el sonido no se oculte en sonidos de direcciones distintas de la dirección del objetivo y los sonidos de cualquier dirección se pueden realzar sin necesitar los medios de accionamiento y control mencionados anteriormente, es difícil para la técnica lograr una directividad alta. En particular, la voz humana incluye una proporción alta de componentes de frecuencia en un intervalo de aproximadamente 100 Hz a aproximadamente 2 kHz. Sin embargo, es difícil para la técnica convencional en la categoría [3] lograr una directividad aguda de aproximadamente + 5° a + 10° en una dirección del objetivo en tal banda de baja frecuencia.
La técnica de realce de punto de sonido descrita en (1) no toma ninguna medida para proteger contra fuentes de interferencia debido a que la técnica usa el método de agrupación de retardo y suma. La técnica de realce de punto de sonido descrita en (2) requiere una pluralidad de agrupaciones de micrófonos y, por lo tanto, puede ser desventajosa debido al aumento de tamaño y coste del sistema. El aumento de tamaño de las agrupaciones de micrófonos restringe la instalación y el transporte de las agrupaciones. La información que se refiere a reverberación varía con los cambios de entorno y es difícil para la técnica de realce de punto de sonido descrita en (3) responder de manera robusta a tales cambios de entorno.
A la luz de estas circunstancias, un primer objeto de la presente invención es proporcionar una técnica de realce de sonido (una técnica de realce de punto de sonido) que pueda captar un sonido con una relación SN suficientemente alta y seguir un sonido de cualquier dirección sin necesidad de mover físicamente un micrófono, y aún tiene una directividad más aguda en una dirección deseada que las técnicas convencionales y puede realzar sonidos según las distancias de la agrupación de micrófonos. Un segundo objeto de la presente invención es proporcionar una técnica de realce de sonido (una técnica de realce de sonido directivo agudo) que puede captar un sonido con una relación SN suficientemente alta, puede seguir un sonido de cualquier dirección sin necesitar mover físicamente un micrófono y aún tiene una directividad más aguda en una dirección deseada que las técnicas convencionales.
5
10
15
20
25
30
35
40
45
50
55
Medios para resolver los problemas (Técnica de realce de punto de sonido)
Una función de transferencia ai,g de un sonido que viene de cada una de una o más posiciones que se supone que son fuentes de sonido (donde i denota la dirección y g denota la distancia para identificar cada posición) y llega a los micrófonos (el número de micrófonos M > 2) se usa para obtener un filtro para una posición que es un objetivo de realce de sonido antes de capturar los M sonidos capturados con los M micrófonos [un proceso de diseño de filtro]. Cada función de transferencia a¡,g se representa mediante la suma de funciones de transferencia de un sonido directo que viene de una posición determinada por una dirección i y una distancia g y llega directamente a los M micrófonos y funciones de transferencia de uno o más sonidos reflejados que se producen por reflexión del sonido directo fuera de un objeto reflector y llega a los M micrófonos. El filtro está diseñado para ser aplicado, para cada frecuencia, a una señal en el dominio de frecuencia transformada de cada una de las M señales captadas obtenidas captando sonidos con los M micrófonos. El filtro obtenido como resultado del proceso de diseño de filtro se aplica a una señal en el dominio de frecuencia para cada frecuencia para obtener una señal de salida [un proceso de aplicación de filtro]. La señal de salida es una señal en el dominio de frecuencia en la que se realza el sonido de la posición que es el objetivo del realce de sonido.
Cada función de transferencia ai,g puede ser, por ejemplo, la suma de un vector de dirección de un sonido directo y un vector o vectores de dirección de uno o más sonidos reflejados cuyas descomposiciones debidas a reflexión y a diferencias de tiempo de llegada del sonido directo han sido corregidas o se pueden obtener mediante mediciones en un entorno real.
En el proceso de diseño de filtro, se puede obtener un filtro para cada frecuencia de manera que se minimiza la potencia de sonidos de posiciones distintas de la posición que es el objetivo del realce de sonido. Alternativamente, se puede obtener un filtro para cada frecuencia de manera que se maximice la relación de SN de un sonido de la posición que es el objetivo del realce de sonido. Alternativamente, se puede obtener un filtro para cada frecuencia de manera que se minimiza la potencia de sonidos de posiciones distintas de una o más posiciones que supone que son fuentes de sonido mientras que un coeficiente de filtro para uno de los M micrófonos se mantiene en un valor constante.
Alternativamente, el filtro se puede obtener para cada frecuencia en el proceso de diseño de filtro de manera que la potencia de sonidos de posiciones distintas a la posición que es el objetivo del realce de sonido y puntos de supresión se minimiza en condiciones que (1) el filtro pasa sonidos en todas las bandas de frecuencia de la posición que es el objetivo del realce de sonido y que (2) el filtro suprime sonidos en todas las bandas de frecuencia de uno o más puntos de supresión. Alternativamente, el filtro puede ser obtenido para cada frecuencia normalizando una función de transferencia as,h de un sonido desde la posición en i = s, g = h que es el objetivo de realce del sonido. Alternativamente, se puede obtener un filtro para cada frecuencia usando una matriz de correlación espacial representada por funciones de transferencia ai,g correspondientes a posiciones distintas de la posición que es el objetivo del realce de sonido. Alternativamente, el filtro se puede obtener para cada frecuencia de manera que la potencia de sonidos de posiciones distintas de la posición que es el objetivo de realce de sonido se minimice bajo la condición de que el filtro reduzca la cantidad de descomposición de un sonido de la posición que es el objetivo del realce de sonido a un valor predeterminado o menos. Alternativamente, se puede obtener un filtro para cada frecuencia usando una matriz de correlación espacial representada por señales en el dominio de frecuencia obtenidas transformando señales obtenidas mediante la observación con una agrupación de micrófonos. Alternativamente, se puede obtener un filtro para cada frecuencia usando una matriz de correlación espacial representada por funciones de transferencia ai,g correspondientes a cada una de una o más posiciones que se supone que son fuentes de sonido.
(Técnica de realce de sonido directivo agudo)
Una función de transferencia ae de un sonido que viene de cada una de una o más direcciones a partir de las cuales se supone que vienen sonidos y llegan a los micrófonos (el número de micrófonos M > 2) se usa para obtener un filtro para una posición que es el objetivo de realce de sonido antes de captar los M sonidos captados con los M micrófonos [un proceso de diseño de filtro]. Cada función de transferencia ae se representa por la suma de funciones de transferencia de un sonido directo que viene de una dirección e y llega directamente a los M micrófonos y las funciones de transferencia de uno o más sonidos reflejados que se producen por reflexión del sonido directo fuera de un objeto reflector y llega a los M micrófonos. El filtro está diseñado para ser aplicado, para cada frecuencia, a una señal en el dominio de frecuencia transformada a partir de cada una de las M señales captadas obtenidas captando sonidos con los M micrófonos. El filtro obtenido como resultado del proceso de diseño de filtro se aplica a una señal en el dominio de frecuencia para cada frecuencia para obtener una señal de salida [un proceso de aplicación de filtro]. La señal de salida es una señal en el dominio de frecuencia en la que se realza el sonido de la posición que es el objetivo de realce de sonido.
Cada función de transferencia ae puede ser, por ejemplo, la suma de un vector de dirección de un sonido directo y un vector o vectores de dirección de uno o más sonidos reflejados cuyas descomposiciones debido a reflexión y a
5
10
15
20
25
30
35
40
45
50
55
diferencias de tiempo de llegada del sonido directo han sido corregidas o se pueden obtener mediante mediciones en un entorno real.
En el proceso de diseño de filtro, se puede obtener un filtro para cada frecuencia de manera que se minimiza la potencia de sonidos de direcciones distintas de la dirección que es el objetivo realce de sonido. Alternativamente, se puede obtener un filtro para cada frecuencia de manera que se maximice la relación SN de un sonido de la dirección que es el objetivo del realce de sonido. Alternativamente, se puede obtener un filtro para cada frecuencia de manera que se minimice la potencia de sonidos de direcciones desde las cuales es probable que lleguen sonidos mientras que un coeficiente de filtro para uno de los M micrófonos se mantiene en un valor constante.
Alternativamente, el filtro se puede obtener para cada frecuencia en el proceso de diseño de filtro de manera que se minimice la potencia de los sonidos de direcciones distintas a la dirección que es el objetivo de realce de sonido y direcciones nulas en condiciones que (1) el filtro pasa sonidos en todas las bandas de frecuencia de la dirección que es el objetivo de realce de sonido y que (2) el filtro suprime sonidos en todas las bandas de frecuencia de una o más direcciones nulas. Alternativamente, el filtro se puede obtener para cada frecuencia normalizando una función de transferencia as de un sonido de la dirección 0 = s que es el objetivo de realce de sonido. Alternativamente, se puede obtener un filtro para cada frecuencia usando una matriz de correlación espacial representada por funciones de transferencia a0 correspondientes a direcciones distintas a la dirección que es el objetivo de realce de sonido. Alternativamente, el filtro se puede obtener para cada frecuencia de manera que se minimice la potencia de sonidos de direcciones distintas de la dirección que es el objetivo de realce de sonido bajo la condición de que el filtro reduzca la cantidad de descomposición de un sonido de la dirección que es el objetivo de realce de sonido a un valor predeterminado o menos. Alternativamente, se puede obtener un filtro para cada frecuencia usando una matriz de correlación espacial representada por señales en el dominio de frecuencia obtenidas transformando señales obtenidas mediante la observación con una agrupación de micrófonos-
Efectos de la invención
(Técnica de realce de punto de sonido)
Dado que la técnica de realce de punto de sonido de la presente invención usa no solamente un sonido directo de una dirección deseada, sino también sonidos reflejados, la técnica de realce de punto de sonido es capaz de captar sonidos con una relación SN suficientemente alta desde la dirección. Además, la técnica de realce de punto de sonido de la presente invención es capaz de seguir un sonido en cualquier dirección sin necesidad de mover físicamente el micrófono debido a que el realce de del sonido se logra mediante procesamiento de señal. Además, dado que cada función de transferencia ai,g está representada por la suma de la función de transferencia de un sonido directo que viene de la posición determinada por una dirección i y una distancia g y llega directamente a M micrófonos y la función o funciones de transferencia de uno o más sonidos reflejados que se producen por reflexión del sonido fuera de un objeto reflector y llegan a los M micrófonos, un filtro que aumenta el grado de supresión de coherencia que determina el grado de directividad en una dirección deseada, se pueden diseñar según los criterios típicos de diseño de filtro, como se describirá más tarde en mayor detalle en la sección «Principio de la técnica de realce de punto de sonido». Es decir, se puede lograr una directividad más aguda en la dirección deseada de lo que era posible anteriormente. Dado que los sonidos reflejados se usan como se describirá más tarde en la sección «Principio de la técnica de realce del punto de sonido», hay diferencias significativas en la función de transferencia entre sonidos de diferentes posiciones a diferentes distancias en aproximadamente la misma dirección como se ve desde la agrupación de micrófonos. Extrayendo las diferencias entre las funciones de transferencia mediante la conformación de haces, sonidos en un intervalo estrecho que incluye una dirección deseada se pueden realzar según las distancias de la agrupación de micrófonos.
(Técnica de realce de sonido directivo agudo)
Dado que la técnica de realce de sonido directivo agudo de la presente invención usa no solamente un sonido directo de una dirección deseada sino también sonidos reflejados, la técnica de realce de sonido directivo agudo es capaz de captar sonidos con una relación SN suficientemente alta desde la dirección. Además, la técnica de realce de sonido directivo agudo de la presente invención es capaz de seguir un sonido en cualquier dirección sin necesidad de mover físicamente el micrófono debido a que el realce de sonido se logra mediante procesamiento de señal. Además, dado que cada función de transferencia a0 se representa por la suma de la función de transferencia de un sonido directo que viene de una dirección O y llega directamente a M micrófonos y la función o funciones de transferencia de uno o más sonidos reflejados que se producen por reflexión del sonido fuera de un objeto reflector y llegan a los M micrófonos, un filtro que aumenta el grado de supresión de coherencia que determina el grado de directividad en una dirección deseada se puede diseñar con criterios típicos de diseño de filtro, como se describirá más tarde en más detalle en la sección «Principio de realce de sonido directivo agudo». Es decir, se puede lograr una directividad más aguda en una dirección deseada de lo que era posible anteriormente.
Breve descripción de los dibujos
La Fig. 1A es un diagrama que ilustra que sonidos que llegan de una dirección del objetivo se realzan mediante un micrófono de tubo acústico;
5
10
15
20
25
30
35
40
45
La Fig. 1B es un diagrama que ilustra que sonidos que llegan de direcciones distintas de una dirección del objetivo se suprimen por un micrófono de tubo acústico;
La Fig. 2A es un diagrama que ilustra que sonidos que llegan de una dirección objetivo se realzan mediante un micrófono parabólico;
La Fig. 2B es un diagrama que ilustra que sonidos que llegan de direcciones distintas de una dirección del objetivo se suprimen por un micrófono parabólico;
La Fig. 3 es un diagrama que ilustra que se realza un sonido de una dirección del objetivo y se suprime un sonido de una dirección distinta de la dirección del objetivo usando una agrupación de micrófonos en fase que incluye una pluralidad de micrófonos;
La Fig. 4 es un diagrama que ilustra una configuración funcional de una técnica de realce de sonido directivo agudo que usa conformación de haces múltiples como ejemplo de técnicas convencionales.
La Fig. 5A es un diagrama que muestra esquemáticamente que una directividad suficientemente alta no se puede lograr teniendo en cuenta solamente sonidos directos;
La Fig. 5B es un diagrama que muestra esquemáticamente que se puede lograr una directividad suficientemente alta teniendo en cuenta tanto los sonidos directos como los reflejados;
La Fig. 6 es un diagrama que muestra las dependencias de dirección de coherencias de una técnica convencional y un principio de la presente invención;
La Fig. 7 es un diagrama que ilustra una configuración funcional de un aparato de realce de sonido directivo agudo (primera realización);
La Fig. 8 es un diagrama que ilustra un procedimiento de un método de realce de sonido directivo agudo (primera realización);
La Fig. 9 es un diagrama que ilustra una configuración de un primer ejemplo;
La Fig. 10 es un diagrama que ilustra una configuración funcional de un aparato de realce de sonido directivo agudo (segunda realización);
La Fig. 11 es un diagrama que ilustra un procedimiento de un método de realce de sonido directivo agudo (segunda realización);
La Fig. 12 es un diagrama que muestra los resultados de un experimento en un primer ejemplo;
La Fig. 13 es un diagrama que muestra los resultados de un experimento en el primer ejemplo;
La Fig. 14 es un diagrama que muestra la directividad con un filtro W^(u>, 0) en el primer ejemplo;
La Fig. 15 es un diagrama que ilustra una configuración de un segundo ejemplo;
La Fig. 16 es un diagrama que muestra los resultados de un experimento en un ejemplo experimental;
La Fig. 17 es un diagrama que ilustra los resultados de un experimento en un ejemplo experimental;
La Fig. 18A es un diagrama que ilustra sonidos directos que llegan a una agrupación de micrófonos de dos fuentes de sonido A y B;
La Fig. 18B es un diagrama que ilustra sonidos directos que llegan a una agrupación de micrófonos de dos fuentes de sonido A y B y sonidos reflejados que llegan a la agrupación de micrófonos de dos fuentes de sonido virtuales A(£ ) y B(£ );
La Fig. 19 es un diagrama que ilustra una configuración funcional de un aparato de realce de punto de sonido (primera realización);
La Fig. 20 es un diagrama que ilustra un procedimiento de un método de realce de punto de sonido (primera realización);
La Fig. 21 es un diagrama que ilustra una configuración funcional de un aparato de realce de punto sonido (segunda realización);
La Fig. 22 es un diagrama que ilustra un procedimiento de un método de realce de punto de sonido (segunda realización);
5
10
15
20
25
30
35
40
45
La Fig. 23A ilustra la directividad (en un dominio bidimensional) de un conformador de haces de varianza mínima sin reflector;
La Fig. 23B ilustra la directividad (en un dominio bidimensional) de un conformador de haces de varianza mínima con reflector;
La Fig. 24A es una vista en planta que ilustra una configuración ejemplar de una implementación de la presente invención;
La Fig. 24B es una vista frontal que ilustra la configuración ejemplar de la implementación de la presente invención;
La Fig. 24C es una vista lateral que ilustra la configuración ejemplar de la implementación de la presente invención;
La Fig. 25A es una vista lateral que ilustra otra configuración ejemplar de una implementación de la presente invención;
La Fig. 25B es una vista lateral que ilustra otra configuración ejemplar de una implementación de la presente invención;
La Fig. 26 es un diagrama que ilustra una forma en uso de la configuración ejemplar de la implementación ilustrada en la Fig. 25B;
La Fig. 27A es una vista en planta que ilustra una configuración ejemplar de una implementación de la presente invención;
La Fig. 27B es una vista frontal que ilustra la configuración ejemplar de la implementación de la presente invención; La Fig. 27C es una vista lateral que ilustra la configuración ejemplar de la implementación de la presente invención;
y
La Fig. 28 es una vista lateral que ilustra una configuración ejemplar de una implementación de la presente invención.
Descripción detallada de las realizaciones
Se describirá en primer lugar una técnica de realce de sonido directivo agudo y luego se describirá una técnica de realce de punto de sonido.
«Técnica de realce de sonido directivo agudo>>
Se describirá un principio de una técnica de realce de sonido directivo agudo de la presente invención. La técnica de realce de sonido directivo agudo de la presente invención se basa en la naturaleza de una técnica de agrupación de micrófonos que es capaz de seguir los sonidos de cualquier dirección sobre la base de procesamiento de señal y usa positivamente los sonidos reflejados para captar sonidos con una relación SN alta. Una característica de la presente invención es un uso combinado de los sonidos reflejados y una técnica de procesamiento de señal que permite una directividad aguda.
Antes de la descripción, se definirán de nuevo los símbolos. El índice de una frecuencia discreta se denota por w (El índice w de una frecuencia discreta se puede considerar que es una frecuencia angular w debido a que una frecuencia f y una frecuencia angular w satisfacen la relación w = 2nf. Con respecto a w, el “índice de una frecuencia discreta” también se puede conocer algunas veces simplemente como “frecuencia”) y el índice del número de tiempo de trama se denota por k. Una representación en el dominio de frecuencia de una trama de orden k de una señal analógica recibida en M micrófonos se denota por X^(w, k) = [Xi(w, k), ..., Xm(w, k)]T y un filtro que realza una señal en el dominio de frecuencia X^(w, k) de un sonido de una dirección del objetivo 0s como se ve desde el centro de una agrupación de micrófonos con una frecuencia w se denota por W^(w, 0s), donde M es un número entero mayor o igual a 2 y T representa la transposición. Entonces, una señal en el dominio de frecuencia Y(w, k, 0s) resultante del realce de la señal en el dominio de frecuencia X^(w, k) del sonido de la dirección del objetivo 0s con la frecuencia w (en lo sucesivo, la señal resultante se conoce como señal de salida) se puede dar por la ecuación (6):
donde H representa la transposición hermitiana.
Mientras que el “centro de una agrupación de micrófonos” se puede determinar arbitrariamente, típicamente el centro geométrico de la agrupación de los M micrófonos se trata como el “centro de una agrupación de micrófonos”. En el caso de una agrupación de micrófonos lineales, por ejemplo, el punto equidistante de los micrófonos en ambos extremos de la agrupación se trata como el “centro de la agrupación de micrófonos”. En el caso de una agrupación
5
10
15
20
25
30
35
40
45
de micrófonos planos en la que los micrófonos están dispuestos en una matriz cuadrada de m x m (m2 = M), por ejemplo, la posición en la que las diagonales que unen los micrófonos en las esquinas se cruzan, se trata como el “centro de la agrupación de micrófonos”.
Un filtro W^(w, 0s) se puede diseñar de varias formas. Aquí se describirá un diseño que usa el método de respuesta sin distorsión de varianza mínima (MVDR). En el método MVDR, un filtro W^(w, 0s) está diseñado de modo que la potencia de sonidos de direcciones distintas de una dirección del objetivo 0s (en lo sucesivo, sonidos de direcciones distintas de la dirección del objetivo 0s también se conocerán como “ruido”) se minimiza a la frecuencia w (véase la ecuación (7)) usando una matriz de correlación espacial Q(w) bajo la condición de restricción de la ecuación (8). Las funciones de transferencia a una frecuencia w entre una fuente de sonido y los M micrófonos se denotan por a^(w, 0s) = [ai(w, 0s), ..., aM(w, 0s)]T, donde la fuente de sonido se supone que está en una dirección 0s. En otras palabras, a^(w, 0s) = [ai(w, 0s), ..., aM(w, 0s)]T representa funciones de transferencia de un sonido de la dirección 0s a los micrófonos incluidos en la agrupación de micrófonos a la frecuencia w. La matriz de correlación espacial Q(w) representa la correlación entre los componentes Xi(w, k), ..., Xm(w, k) de una señal en el dominio de frecuencia X^(w, k) a la frecuencia w y tiene E[Xi(w, k)Xj * (w, k) (1 < i < M, 1 < j < M) como sus elementos (i, j). El operador E[] representa una operación de promediado estadístico y el símbolo * es un operador conjugado complejo. La matriz de correlación espacial Q(w) se puede expresar usando valores estadísticos de Xi(w, k), ..., Xm(w, k) obtenidos a partir de la observación o se pueden expresar usando funciones de transferencia. Este último caso, donde la matriz de correlación espacial Q(w) se expresa usando funciones de transferencia, se describirá momentáneamente en lo sucesivo.
min (wH(<a,8s)Q(a)¡V(a>,es)) (7)
*W,)
WH(a>,Os)B(&,0s) = 1.0 (8)
Es conocido que el filtro W^(w, 0s) que es una solución óptima de la ecuación (7) se puede dar por la ecuación (9) (véase la Referencia 1 enumerada a continuación).
Como se apreciará a partir del hecho de que la matriz inversa de la matriz de correlación espacial Q(w) se incluye en la ecuación (9), la estructura de la matriz de correlación espacial Q(w) es importante para lograr una directividad aguda. Se apreciará a partir de la ecuación (7) que la potencia de ruido depende de la estructura de la matriz de correlación espacial Q(w).
Un conjunto de índices p de direcciones desde las cuales llega el ruido se denota por {1, 2, ..., P -1}. Se supone que el índice s de la dirección del objetivo 0s no pertenece al conjunto {1, 2, ..., P - 1}. Suponiendo que P - 1 ruidos vienen de direcciones arbitrarias, la matriz de correlación espacial Q(w) se puede dar por la ecuación (10a). Con el fin de diseñar un filtro que funcione suficientemente en presencia de muchos ruidos, es preferible que P sea un valor relativamente grande. Se supone aquí que P es un número entero del orden de M. Mientras que la descripción se da como si la dirección del objetivo 0s es una dirección constante (y, por lo tanto, direcciones distintas de la dirección del objetivo 0s se describen como direcciones desde las cuales llega el ruido) por claridad de la explicación del principio de la técnica de realce de sonido directivo agudo de la presente invención, la dirección del objetivo 0s en realidad puede ser cualquier dirección que pueda ser un objetivo de realce de sonido. Normalmente, una pluralidad de direcciones pueden ser direcciones del objetivo 0s. En este sentido, la diferenciación entre la dirección del objetivo 0s y las direcciones de ruido es subjetiva. Es más correcto considerar que una dirección seleccionada de P direcciones diferentes que están predeterminadas como una pluralidad de direcciones posibles a partir de las cuales puede llegar cualquier sonido, incluyendo un sonido o ruido del objetivo, es la dirección del objetivo y las otras direcciones son direcciones de ruido. Por lo tanto, la matriz de correlación espacial Q(w) se puede representar mediante funciones de transferencia a^(w, 0<p) = [a1(w, 0<p), ..., aM(w, 0<p)]T ) de sonidos que vienen de
direcciones 0<p incluidas en una pluralidad de direcciones posibles desde las cuales pueden llegar los sonidos a los micrófonos y se pueden escribir como la ecuación (10b), donde O es la unión del conjunto {1, 2, ..., P - 1} y un conjunto {s}. Obsérvese que |O| = P y |O| representa el número de elementos del conjunto O.
Q(m) = a(co,8s)áH(ú),0s)+ £ a(ú>,úp)aH (ü),0p) (10o)
pe{l,~5P-n
Q(®)= £3(a),d¿)aH(a),0¿) (10 b)
5
10
15
20
25
30
35
40
45
Aquí, se supone que la función de transferencia a^(w, 0s) de un sonido de la dirección del objetivo 0s y las funciones de transferencia a^(w, 0p) = [a-i(w, 0p), ..., aM(w, 0p)]T de los sonidos de las direcciones p e {1, 2, ..., P - 1} son ortogonales entre sí. Es decir, se supone que hay P sistemas base ortogonales que satisfacen la condición dada por la ecuación (11). El símbolo ^ representa ortogonalidad. Si A^ ^ B^, el producto interno de los vectores A^ y B^ es cero. Se supone aquí que P < M. Obsérvese que si la condición dada por la ecuación (11) se puede relajar para suponer que hay P sistemas base que se pueden considerar aproximadamente como sistemas base ortogonales, P es preferiblemente un valor del orden de M o un valor relativamente grande mayor o igual a M.
a(co, 6S) _L a(co, Ox) _L • • • _L a(a>, 6P_X) (11)
Entonces, la matriz de correlación espacial Q(w) se puede expandir como la ecuación (12). La ecuación (12) significa que la matriz de correlación espacial Q(w) se puede descomponer en una matriz V(w) = [a^(w, 0s), a^(w, 01), ..., a^(w, 0p-1)]T compuesta de P funciones de transferencia que satisfacen la ortogonalidad y una matriz unidad A(w). Aquí, p es un valor propio de una función de transferencia a^(w, 0<p) que satisface la ecuación (11) para la matriz de correlación espacial Q(w) y es un valor real.
Q(<o) = pV(a>)Á(<o)VH(a>) (12)
Entonces, la matriz inversa de la matriz de correlación espacial Q(w) se puede dar por la ecuación (13).
i
Q-' (m) = —fH(a>)Á~' (o)K(®) (13)
P
La sustitución de la ecuación (13) en la ecuación (7) muestra que se minimiza la potencia de ruido. Si se minimiza la potencia de ruido, significa que se logra la directividad en la dirección del objetivo 0s. Por lo tanto, la ortogonalidad entre las funciones de transferencia de sonidos de diferentes direcciones es una condición importante para lograr la directividad en la dirección del objetivo 0s.
La razón por la cual es difícil para las técnicas convencionales lograr una directividad aguda en una dirección del objetivo 0s se tratará a continuación.
Las técnicas convencionales asumieron en el diseño de filtros que las funciones de transferencia estaban compuestas de esos sonidos directos. En realidad, hay sonidos reflejados que se producen por la reflexión de sonidos de la misma fuente de sonido fuera de superficies tales como las paredes y el techo, y llegan a los micrófonos. Sin embargo, las técnicas convencionales consideraban los sonidos reflejados como un factor que degrada la directividad e ignoraban la presencia de los sonidos reflejados. En las técnicas convencionales, las funciones de transferencia a^conv(w, 0) = [a1(w, 0), ..., aM(w, 0)]T se trataron como a^conv(w, 0) = h^d(w, 0), donde h^d (w, 0) = [hd1(w, 0), ..., hdM(w, 0)]T representa vectores de dirección solamente de un sonido directo que llega de una dirección 0. Obsérvese que un vector de dirección es un vector complejo donde las características de respuesta de fase de los micrófonos a una frecuencia w con respecto a un punto de referencia están dispuestas para una onda de sonido de una dirección 0 vista desde el centro de la agrupación de micrófonos.
Suponiendo que los sonidos llegan a una agrupación de micrófonos lineales como ondas planas, un elemento de orden m hdm(w, 0) del vector de dirección h^d (w, 0) de un sonido directo se da, por ejemplo, por la ecuación (14a), donde m es un número entero que satisface 1 < m < M, c representa la velocidad del sonido, u representa la distancia entre micrófonos adyacentes, j es una unidad imaginaria. El punto de referencia es el punto medio de la longitud completa de la agrupación de micrófonos lineales (el centro de la agrupación de micrófonos lineales). La dirección 0 se define como el ángulo formado por la dirección desde la cual llega un sonido directo y la dirección en la cual los micrófonos incluidos en la agrupación de micrófonos lineales, como se ve desde el centro de la agrupación de micrófonos lineales (véase la Fig. 9). Obsérvese que un vector de dirección se puede expresar de varias formas. Por ejemplo, suponiendo que el punto de referencia es la posición del micrófono en un extremo de la agrupación de micrófonos lineales, un elemento de orden m hdm(w, 0) del vector de dirección h^d (w, 0) de un sonido directo se puede dar por la ecuación (14b). En la siguiente descripción, la suposición es que el elemento de orden m hdm(w, 0) del vector de dirección h^d (w, 0) de un sonido directo se puede escribir como la ecuación (14a).
5
10
15
20
25
30
35
40
El producto interno Yconv(w, 0) de una función de transferencia de una dirección 0 y una función de transferencia de una dirección del objetivo 0s se pueden dar por la ecuación (15), donde 0 ^ 0s.
En lo sucesivo, Yconv(w, 0) se conoce como coherencia. La dirección 0 en el cual la coherencia Yconv(w, 0) es 0 se puede dar por la ecuación (16), donde q es un número entero arbitrario, excepto 0. Dado que 0 < 0 < n/2, el intervalo de q está limitado para cada banda de frecuencia.
Dado que solamente se pueden cambiar los parámetros relacionados con el tamaño de la agrupación de micrófonos (M y u) en la ecuación (16), es difícil reducir la coherencia Yconv(w, 0) sin cambiar ninguno de los parámetros relacionados con el tamaño de la agrupación de micrófonos si la diferencia (diferencia angular) |0 - 0s| entre direcciones es pequeña. Si este es el caso, la potencia de ruido no se reduce a un valor suficientemente pequeño y resultará una directividad que tiene una anchura de haz amplia en la dirección del objetivo 0s como se ilustra esquemáticamente en la Fig. 5A.
La técnica de realce de sonido directivo agudo de la presente invención se basa en la consideración descrita anteriormente y se caracteriza por tener en cuenta positivamente los sonidos reflejados, a diferencia de la técnica convencional, sobre la base de un entendimiento de que con el fin de diseñar un filtro que proporciona una directividad aguda en la dirección del objetivo 0s, es importante permitir que la coherencia sea reducida a un valor suficientemente pequeño, incluso cuando la diferencia (diferencia angular) |0 - 0s| entre direcciones es pequeña, el filtro que se calcula antes de captar los sonidos a ser realzados con los M micrófonos. Dos tipos de ondas planas, esto es, sonidos directos de una fuente de sonido y sonidos reflejados producidos por la reflexión de ese sonido fuera de un objeto 300 reflector, juntos entran en los micrófonos de una agrupación de micrófonos. Permitamos que el número de sonidos reflejados sea denotado por S . Aquí, S es un número entero predeterminado mayor o igual a 1. Entonces, una función de transferencia a^(u>, 0) = [a-i(w, 0), ..., aM(w, 0)]T se puede expresar por la suma de una función de transferencia de un sonido directo que viene de una dirección que puede ser un objetivo de realce de sonido y llega directamente a la agrupación de micrófonos y la función o funciones de transferencia de uno o más sonidos reflejados que se producen por reflexión de ese sonido fuera de un objeto reflector y llegan a la agrupación de micrófonos. Específicamente, la función de transferencia se puede representar como la suma del vector de dirección del sonido directo y del vector de dirección de S sonidos reflejados cuyas descomposiciones debidas a la reflexión y a las diferencias de tiempo de llegada del sonido directo se corrigen, como se muestra en la ecuación
(17a), donde T (0) es la diferencia de tiempo de llegada entre el sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y (1 < £ < S ) es un coeficiente para tener en cuenta descomposiciones de sonidos debidas a la reflexión. Aquí, h^^(w, 0) = [hrl^(w, 0), ..., hrM^(w, 0)]T representa los vectores de dirección de los sonidos reflejados correspondientes al sonido directo de la dirección 0. Típicamente, a (1 < £ < S ) es menor o igual a 1 (1 < £ < S ). Para cada sonido reflejado, si el número de reflexiones en el camino desde la fuente de sonido a los micrófonos es 1, a (1 < £ < S ) se puede considerar que representa la reflectancia acústica del objeto desde el cual se reflejó el sonido reflejado de orden £ .
Dado que se proporcionan uno o más sonidos reflejados a la agrupación de micrófonos compuesta por M micrófonos, son necesarios uno o más objetos reflectores. Desde este punto de vista, una fuente de sonido, la agrupación de micrófonos y uno o más objetos reflectores están preferiblemente en tal relación de posición que un
5
10
15
20
25
30
35
sonido de la fuente de sonido se refleja fuera al menos un objeto reflector antes de llegar a la agrupación de micrófonos, suponiendo que la fuente de sonido se sitúa en la dirección del objetivo. Cada uno de los objetos reflectores tiene una forma bidimensional (por ejemplo, una placa plana) o una forma tridimensional (por ejemplo, una forma parabólica). Cada objeto reflector tiene preferiblemente aproximadamente el tamaño de la agrupación de micrófonos o mayor (mayor en un factor de 1 a 2). Con el fin de usar eficazmente los sonidos reflejados, la
reflectancia a (1 < £ < S ) de cada objeto reflector es preferiblemente al menos mayor que 0, y más
preferiblemente, la amplitud de un sonido reflejado que llega a la agrupación de micrófonos es mayor que la amplitud del sonido directo en un factor de 0,2 o mayor. Por ejemplo, cada objeto reflector es un sólido rígido. Cada objeto reflector puede ser un objeto móvil (por ejemplo, un reflector) o un objeto inamovible (como un suelo, una pared o un techo). Obsérvese que si un objeto inamovible se establece como un objeto reflector, el vector de dirección para el objeto reflector necesita ser cambiado a medida que la agrupación de micrófonos se reubica (véanse las funciones
Y(0) y (9) descritas más tarde) y, en consecuencia, el filtro necesita ser recalculado (restablecido). Por lo tanto,
los objetos reflectores son preferiblemente accesorios de la agrupación de micrófonos en aras de la robustez frente a los cambios de entorno (en este caso, S sonidos reflejados supuestos se considera que son sonidos reflejados fuera de los objetos reflectores). Aquí los “accesorios de la agrupación de micrófonos” son “objetos tangibles capaces de seguir los cambios de posición y orientación de la agrupación de micrófonos mientras se mantiene la relación de posición (relación geométrica) con la agrupación de micrófonos). Un ejemplo simple puede ser una configuración donde los objetos reflectores se fijan a la agrupación de micrófonos.
Con el fin de describir concretamente las ventajas de la técnica de realce de sonido directivo agudo de la presente invención, se supone en lo siguiente que S = 1, los sonidos se reflejan una vez y existe un objeto reflector a una distancia de L metros del centro de la agrupación de micrófonos. El objeto reflector es un objeto grueso y rígido. Dado que S = 1 en este caso, el símbolo que representa esto se omite y, por lo tanto, la ecuación (17a) se puede reescribir como la ecuación (17b):
Un elemento de orden m del vector de dirección h^r(w, 0) = [hr-i(w, 0), ..., hrM(w, 0)]T de un sonido reflejado se puede dar por la ecuación (18a ) de la misma forma que se representa el vector de dirección de un sonido directo (véase la ecuación (14a)). La función ^(0) emite la dirección desde la cual llega un sonido reflejado. Obsérvese que si el vector de dirección de un sonido directo se escribe como la ecuación (14b), un elemento de orden m del vector de
dirección h^ r (w, 0) = [h r£ (w, 0), ., h rM (w, 0)]T de un sonido reflejado se da por la ecuación (18b). Típicamente, un elemento de orden m de un vector de dirección de orden £ (1 < £ < S ) h^r^ (w, 0) = [h rl^ (w, 0), ..., h rM^ (w, 0)]T se da por la ecuación (18c) o la ecuación (18d). La función ^ (0) emite la dirección desde la cual llega el sonido reflejado de orden £ .
hrm(o)M) = exp hrm(cu,0) = exp hrm^(ü),0) = exp ($>,&) = exp
(18a)
(18*)
(18c)
(18¿)
Dado que la ubicación de un objeto reflector se puede establecer según sea adecuado, la dirección desde la cual llega un sonido reflejado se puede tratar como un parámetro variable.
Suponiendo que un objeto reflector de placa plana está cerca de la agrupación de micrófonos (la distancia L no es extremadamente grande en comparación con el tamaño de la agrupación de micrófonos), la coherencia y(w, 0) se da por la ecuación (19), donde 0 ^ 0s.
y(a>,6) = aH (a>,6s)a(co,6)
= hd (co,ds)hd(co,6)
+ a exp[- jcoT{d)\ • hd (co, 6S )hr (co,6)
+ a exp[jo) r (9S)] • hf1 (co, 9S )hd (co, O)
+ «2 exp[- jco(z(6) - t(Os))\ • hrH (oo,6s)hr (<o,6) (19)
Será evidente a partir de la ecuación (19) que la coherencia y(w, 0) de la ecuación (19) puede ser menor que la coherencia Yconv(w, 0) de la técnica convencional de la ecuación (15). Dado que los parámetros (y(0) y L) que se pueden cambiar reubicando o reorientando el objeto reflector se incluyen en el segundo al cuarto términos de la 5 ecuación (19), hay una posibilidad de que se pueda eliminar el primer término, h^dH(w, 0) h^d(w, 0).
Por ejemplo, si se coloca un reflector plano en tal posición que la dirección a lo largo de la cual se disponen los micrófonos en una agrupación de micrófonos lineales es normal al reflector, y(0) = n - 0 se mantiene para la función Y(0) y la ecuación (20) recoge la diferencia z (0) en el tiempo de llegada entre un sonido directo y un sonido reflejado. Por lo tanto, las condiciones de las ecuaciones (21) y (22) se generan para los elementos de la ecuación 10 (19). Aquí, el símbolo * es un operador complejo conjugado:
15
Dado que el valor absoluto de h^dH(w, 0) h^r(w, 0) es suficientemente menor que h^dH(w, 0) h^d(w, 0), el segundo y tercer términos de la ecuación (19) son despreciables. Entonces la coherencia y(w, 0) se puede aproximar como la ecuación (23):
Incluso si h^dH(w, 0) h^d(w, 0) ^ 0, una coherencia aproximada y~(w, 0) tiene una solución mínima 0 de la ecuación (24), donde q es un número entero positivo arbitrario. El intervalo de q está restringido para cada frecuencia.
Es decir, no solamente se puede suprimir la coherencia en una dirección dada por la ecuación (16), sino también la 20 coherencia en una dirección dada por la ecuación (24). Dado que la supresión de la coherencia puede reducir la potencia de ruido, se puede lograr una directividad aguda como se muestra esquemáticamente en la Fig. 5B.
5
10
15
20
25
30
35
40
Mientras que las Fig. 5A y 5B muestran esquemáticamente la diferencia entre la directividad lograda por el principio de la técnica de realce de sonido directivo agudo de la presente invención y la directividad lograda por una técnica convencional, la Fig. 6 muestra específicamente la diferencia entre 0 dada por la ecuación (16) y 0 dada por la ecuación (24). Aquí, w = 2nx 1000 [rad/s], L = 0,70 [m], y 0s = n/4 [rad]. La dependencia de la dirección de la coherencia normalizada se muestra en la Fig. 6 para la comparación entre las técnicas. La dirección indicada por un círculo es 0 dada por la ecuación (16) y las direcciones indicadas por el símbolo + son 0 dadas por la ecuación (24). Como se puede ver a partir de la Fig. 6, según la técnica convencional, 0 que produce una coherencia de 0 para 0s = n/4 [rad] existe solamente en la dirección indicada por el círculo, mientras que según el principio de la mejora de sonido directivo agudo de la presente invención, 0 que produce una coherencia de 0 para 0s = n/4 [rad] existe en muchas direcciones indicadas por el símbolo +. Especialmente, las direcciones indicadas por el símbolo + existen mucho más cerca de 0s = n/4 [rad] que la dirección indicada por el círculo. Por lo tanto, se entenderá que la técnica de la presente invención logra una directividad más aguda que la técnica convencional.
Como es evidente a partir de la descripción precedente, la esencia de la técnica de realce de sonido directivo agudo de la presente invención es que la función de transferencia a^(w, 0) = [a-i(w, 0), ..., aM(w, 0)]T se representa por la suma del vector de dirección de un sonido directo y los vectores de dirección de S sonidos reflejados, como se muestra en la Ecuación (17a), por ejemplo. Dado que esto no afecta al concepto de diseño de filtro, los filtros W^ (w, 0s) se pueden diseñar mediante un método distinto de la respuesta sin distorsión de varianza mínima (MVDR).
Se describirán métodos distintos del método de MVDR descrito anteriormente. Son: <1> un método de diseño de filtro basado en el criterio de maximización de SNR, <2> un método de diseño de filtro basado en inversión de potencia, <3> un método de diseño de filtro que usa MVDR con una o más direcciones nulas (direcciones en las que se suprime la ganancia de ruido) como una condición de restricción, <4> un método de diseño de filtro usando conformación de haces de retardo y suma, <5> un método de diseño de filtro que usa el método de máxima verosimilitud y <6> un método de diseño de filtro usando la agrupación adaptativa de micrófonos para reducción de ruido (AMNOR). Para <1> el método de diseño de filtro basado en el criterio de maximización de SNR y <2> el método de diseño de filtro basado en inversión de potencia, se hace referencia a la Referencia 2 enumerada a continuación. Para <3> el método de diseño de filtro que usa MVDR con una o más direcciones nulas (direcciones en las que se suprime la ganancia de ruido) como condición de restricción, se hace referencia a la Referencia 3 enumerada a continuación. Para <6> el método de diseño de filtro que usa el método de la agrupación adaptativa de micrófonos para reducción de ruido (AMNOR), se hace referencia a la Referencia 4 enumerada a continuación.
<1> Método de diseño de filtro basado en el criterio de maximización de SNR
En el método de diseño de filtro basado en el criterio de maximización de SNR, se determina un filtro W^(w, 0s) sobre la base de un criterio de maximización de la relación SN (SNR) en una dirección del objetivo 0s. La matriz de correlación espacial para un sonido de la dirección del objetivo 0s se denota por Rss(w) y la matriz de correlación espacial para un sonido desde una dirección distinta de la dirección del objetivo 0s se denota por Rnn(w). Entonces la SNR se puede dar por la ecuación (25). Aquí, Rss(w) se puede dar por la ecuación (26) y Rnn(w) se puede dar por la ecuación (27). Las funciones de transferencia a^(w, 0) = [a-i(w, 0s), ..., aM(w, 0s)]T se pueden dar por la ecuación (17a) (para ser precisos, la ecuación (17a) donde 0 se sustituye por 0s).
nrR WH (G),0s)Rss{o))W{(Q,es)
wH(aA)KÁ®W{G),es)
Rss{co) = a{co,es)aH(p,es)
Rnn(P>)= X á{ú),ep)aH (0),ep)
p*Q,-,p- 1}
(25)
(26) (27)
El filtro W^(w, 0s) que maximiza la SNR de la ecuación (25) se puede obtener estableciendo el gradiente relacionado con el filtro W^(w, 0s) en cero, es decir, por la ecuación (28).
donde
5
10
15
20
25
30
35
^((üA)[^] =
2/?„ (coW (o>, g, 6S )Rnn (coW(co, Gs))- 2 Rnn (co)tV(ú), 9s)(wH {o>, Os) Rss (co)W (a, 0S))
(wH(a>,0s)Rnn(a>W(co,6>s)f
De esta manera, el filtro W^(u>, 0s) que maximiza la SNR de la ecuación (25) se puede dar por la ecuación (29):
W(a>,es) = R-l(c})a{a,,gs)(29)
La ecuación (29) incluye la matriz inversa de la matriz de correlación espacial Rnn(w) de un sonido de una dirección distinta de la dirección del objetivo 0s. Es conocido que la matriz inversa de Rnn(w) se puede sustituir por la matriz inversa de una matriz de correlación espacial Rxx(w) de una entrada completa incluyendo sonidos de la dirección del objetivo 0s y otras direcciones distintas de la dirección del objetivo 0s. Obsérvese que Rxx(w) = Rss(w) + Rnn(w) = Q(u>) (véanse las ecuaciones (10a), (26) y (27)). Es decir, el filtro W^(u>, 0s) que maximiza la SNR de la ecuación (25) se puede obtener por la ecuación (30):
W(a>,es) = R2(<a)a(m,9¡) (30)
<2> Método de diseño de filtro basado en inversión de potencia
En el método de diseño de filtro basado en inversión de potencia, un filtro W^(u>, 0s) se determina sobre la base de un criterio de minimización de la potencia media de salida de un conformador de haces mientras que un coeficiente de filtro para un micrófono se fija a un valor constante. Aquí, se describirá un ejemplo donde se fija el coeficiente de filtro para el primer micrófono entre M micrófonos. En este método de diseño, se diseña un filtro W^(w, 0s) que minimiza la potencia de los sonidos de todas las direcciones (todas las direcciones desde las cuales pueden llegar sonidos) usando una matriz de correlación espacial Rxx(w) (véase la ecuación (31)) bajo la condición de restricción de la ecuación (32). Las funciones de transferencia a^(u>, 0s) = [a-i(u>, 0s), ..., aM(u>, 0s)]T se pueden dar por la
ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0s). Aquí, Rxx(w) = Q(u>) (véanse las ecuaciones (1oa), (26) y (27)).
donde
Es conocido que el filtro W^(u>, 0s) que es una solución óptima de la ecuación (31) se puede dar por la ecuación (33):
W(0),es) = R-¿(a>)G (33)
<3> Método de diseño de filtro que usa MVDR con una o más direcciones nulas como condición de restricción
En el método MVDR descrito anteriormente, se ha diseñado un filtro W^(u>, 0s) bajo la condición de restricción única que se obtiene un filtro que minimiza la potencia media de salida de un conformador de haces dada por la ecuación (7) (es decir, la potencia de ruido que es sonidos de direcciones distintas de la dirección del objetivo) bajo la condición de restricción que el filtro pasa sonidos de una dirección del objetivo 0s en todas las bandas de frecuencia como se expresa por la ecuación (8). Según el método, la potencia de ruido se puede suprimir de manera general. Sin embargo, el método no es necesariamente preferible si se conoce previamente que hay una fuente o fuentes de ruido que tienen una potencia fuerte en una o más direcciones particulares. Si este es el caso, se requiere un filtro que suprima intensamente una o más direcciones conocidas particulares (es decir, direcciones nulas) en las que existe la fuente o fuentes de ruido. Por lo tanto, el método de diseño de filtro descrito aquí obtiene un filtro que minimiza la potencia media de salida del conformador de haces dada por la ecuación (7) (es decir, minimiza la potencia media de salida de sonidos de direcciones distintas a una dirección del objetivo y las direcciones nulas) bajo las condiciones de restricción que (1) el filtro pasa sonidos desde la dirección del objetivo 0s en todas las bandas de frecuencia y que (2) el filtro suprime sonidos de B direcciones nulas conocidas 0N1, 0n2, ..., 0nb (B es un número entero predeterminado mayor o igual a 1) en todas las bandas de frecuencia. Permitamos que un conjunto
de índices O de direcciones desde las cuales llega el sonido sean denotados por {1, 2, ..., P}, entonces Nj e {1, 2, ..., P} (dondeje{1, 2, ..., B}) y B < P-1, como se ha descrito anteriormente.
Permitamos que a^(w, 0i) = [a-i(w, 0i), ..., aM(w, 0i)]T sean funciones de transferencia entre una fuente de sonido que se supone que está situada en una dirección 0i y los M micrófonos a una frecuencia w, en otras palabras, funciones 5 de transferencia de un sonido de una dirección 0i a una frecuencia w que llega a los micrófonos de una agrupación de micrófonos, entonces una condición de restricción se puede dar por la ecuación (34). Aquí, los índices i e {s, N1, N2, ..., NB}, las funciones de transferencia a^(w, 0i) = [a-i(w, 0i), ..., aM(w, 0i)]T se puede dar por la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0i), y f¡(u>) representa una característica de paso a una frecuencia w para una dirección 0i.
10
La ecuación (34) se puede representar como una matriz, por ejemplo como la ecuación (35). Aquí A^(w, 0s) = [a^(w, 0s), a^(w, 0n-i), ..., a^(w, 0nb)]
WH(a> ,es)Á(.a>,es) = F(35)
donde
15
Teniendo en consideración las condiciones de restricción que (1) el filtro pasa sonidos de la dirección del objetivo 0s en todas las bandas de frecuencia y que (2) el filtro suprime sonidos de B direcciones nulas conocidas 0N1, 0n2, ..., 0nb en todas las bandas de frecuencia, se deberían establecer idealmente fs(w) = 1,0 y fi(w) = 0,0 (i e {N1, N2, ..., NB}). Esto significa que el filtro pasa por completo sonidos en todas las bandas de frecuencia de la dirección del 20 objetivo 0s y bloquea por completo sonidos en todas las bandas de frecuencia de B direcciones nulas conocidas 0N1, 0n2, ..., 0nb. En realidad, sin embargo, es difícil en algunas situaciones efectuar tal control como que pasa por completo todas las bandas de frecuencia o que bloquea por completo todas las bandas de frecuencia. En tal caso, el valor absoluto de fs(w) se establece en un valor cercano a 1,0 y el valor absoluto de fi(w) (i e {N1, N2, ..., NB}) se establece en un valor cerca de 0,0. Por supuesto, fi(w) y fj(w) (i ^ j; i y j e {N1, N2, ..., NB}) pueden ser iguales o 25 diferentes.
Según el método de diseño de filtro descrito aquí, el filtro W^(w, 0s) que es una solución óptima de la ecuación (7) bajo la condición de restricción dada por la ecuación (35) se puede dar por la ecuación (36) (véase la Referencia 3 enumerada a continuación).
30 <4> Método de diseño de filtro que usa conformación de haces de retardo y suma
Como es evidente a partir de la ecuación (2), suponiendo que los sonidos directos y reflejados que llegan son ondas planas, entonces un filtro W^(w, 0s) se puede dar por la ecuación (37). Es decir, el filtro W^(w, 0s) se puede obtener normalizando una función de transferencia a^(w, 0s). La función de transferencia a^(w, 0s) = [a-i(w, 0s), ..., aM(w, 0s)]T se puede dar por la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0s). El 35 método de diseño de filtro no logra necesariamente una alta precisión de filtrado sino que requiere solamente una pequeña cantidad de cálculo.
<5> Método de diseño de filtro que usa el método de máxima verosimilitud
Excluyendo la información espacial que se refiere a los sonidos de una dirección del objetivo a partir de una matriz 40 de correlación espacial Q(w) en el método MVDR descrito anteriormente, se puede mejorar la flexibilidad de supresión de ruido y se puede suprimir además la potencia de ruido. Por lo tanto, en el método de diseño de filtro descrito aquí, la matriz de correlación espacial Q(w) se escribe como el segundo término del lado derecho de la ecuación (10a), es decir, la ecuación (10c). Un filtro W^(w, 0s) se puede dar por la ecuación (9) o (36). Aquí, Q(w) incluida en la ecuación (9) y (36) o Rxx(w) = Q(w) incluida en las ecuaciones (30) y (33) es una matriz de correlación 45 espacial dada por la ecuación (10c).
5
10
15
20
25
30
35
40
45
Q(o)) = 2 a{tí},ep)aH{ú),ep) (10c)
pe{i,-sJp-i}
<6> Método de diseño de filtro que usa el método AMNOR
El método AMNOR obtiene un filtro que permite alguna cantidad de descomposición D de un sonido de una dirección del objetivo mediante una solución de compromiso de la cantidad de descomposición D del sonido de la dirección del objetivo frente a la potencia de ruido restante en una señal de salida de filtro (por ejemplo, la cantidad de descomposición D se mantiene en un cierto umbral DA o menos) y, cuando se introduce una señal mixta de [a] una señal producida aplicando las funciones de transferencia entre una fuente de sonido y micrófonos a una señal virtual de una dirección del objetivo (en lo sucesivo, conocida como la señal virtual del objetivo) y [b] ruido (obtenido mediante la observación con M micrófonos en un entorno ruidoso sin un sonido de la dirección del objetivo), emite una señal de salida de filtro que reproduce mejor la señal virtual del objetivo en términos de error cuadrático mínimo (es decir, se minimiza la potencia de ruido contenida en una señal de salida de filtro). Según el método AMNOR, un filtro W^(w, 0s) se puede dar por la ecuación (38) (véase la Referencia 4 enumerada a continuación). Aquí, Rss(w) se puede dar por la ecuación (26) y Rnn(w) se puede dar por la ecuación (27). Las funciones de transferencia a^(w, 0) = [a-i(u>, 0s), ..., aM(w, 0s)]T se pueden dar por la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0s).
Ps es un coeficiente que asigna una ponderación al nivel de la señal virtual del objetivo y denominado el nivel de señal virtual del objetivo. El nivel de señal virtual del objetivo Ps es una constante que no es dependiente de las frecuencias. El nivel de señal virtual del objetivo Ps se puede determinar empíricamente o se puede determinar de modo que la diferencia entre la cantidad de descomposición D de un sonido de la dirección del objetivo y el umbral DA esté dentro de un margen de error predeterminado arbitrariamente. Se describirá este último caso. La respuesta de frecuencia F(w) del filtro W^(w, 0s) a un sonido de una dirección del objetivo 0s en el método AMNOR se puede dar por la ecuación (39). Permitamos que la cantidad de descomposición D(Ps) cuando se usa el filtro W^(w, 0s) dado por la ecuación (38) sea denotada por D(Ps), entonces la cantidad de descomposición D(Ps) se puede definir por la ecuación (40). Aquí, wo representa el límite superior de la frecuencia w (típicamente, una frecuencia más alta adyacente a una frecuencia discreta w). La cantidad de descomposición D(Ps) es una función monótonamente decreciente de Ps. Por lo tanto, un nivel de señal virtual del objetivo Ps tal que la diferencia entre la cantidad de descomposición D(Ps) y el umbral DA está dentro de un margen de error predeterminado arbitrariamente se puede obtener obteniendo repetidamente la cantidad de descomposición D(Ps) mientras se cambia Ps con la monotonía de D(Ps).
<Variación>
En la descripción precedente, las matrices de correlación espacial Q(w), Rss(w) y Rnn(w) se expresan usando funciones de transferencia. Sin embargo, las matrices de correlación espacial Q(w), Rss(w) y Rnn(w) también se pueden expresar usando las señales en el dominio de frecuencia X^ (w, k) descritas anteriormente. Mientras que la matriz de correlación espacial Q(w) se describirá a continuación, la siguiente descripción también se aplica a Rss(w) y Rnn(w). (Q(w) se puede sustituir por Rss(w) y Rnn(w)). La matriz de correlación espacial Rss(w) se puede obtener usando representaciones en el dominio de frecuencia de señales analógicas obtenidas mediante observación con una agrupación de micrófonos (que incluye M micrófonos) en un entorno donde solamente existen sonidos de una dirección del objetivo. La matriz de correlación espacial Rnn(w) se puede obtener usando representaciones en el dominio de frecuencia de una señal analógica obtenida mediante observación con una agrupación de micrófonos (que incluye M micrófonos) en un entorno donde no existen sonidos de la dirección del objetivo (es decir, un entorno ruidoso).
La matriz de correlación espacial Q(w) que usa señales en el dominio de frecuencia X^(w, k) = [Xi(w, k), ..., Xm(w, k)]T se puede dar por la ecuación (41). Aquí, el operador E [■] representa una operación de promediado estadístico. Cuando se ve una serie de tiempo discreta de una señal analógica recibida con una agrupación de micrófonos (que incluye M micrófonos) como un proceso estocástico, el operador E [■] representa una operación de valor de media aritmética (valor esperado) si el proceso estocástico es un denominado proceso estacionario en sentido amplio o un proceso estacionario de segundo orden. En este caso, la matriz de correlación espacial Q(w) se puede dar por la
5
10
15
20
25
30
ecuación (42) usando señales en el dominio de frecuencia X^(u>, k - i) (i = 0, 1, ..., Q - 1) de un total de Q tramas actuales y pasadas almacenadas en una memoria, por ejemplo. Cuando i = 0, una trama de orden k es la trama actual. Obsérvese que la matriz de correlación espacial Q(u) dada por la ecuación (41) o (42) se puede recalcular para cada trama o se puede calcular a intervalos regulares o irregulares, o se puede calcular antes de la implementación de una realización, que se describirá más tarde (especialmente cuando se usa Rss(u) o Rnn(u) en el diseño de filtro, la matriz de correlación espacial Q(u) se calcula preferiblemente de antemano usando señales en el dominio de frecuencia obtenidas antes de la implementación de la realización). Si la matriz de correlación espacial Q(u>) se recalcula para cada trama, la matriz de correlación espacial Q(u>) depende de las tramas actuales y pasadas y, por lo tanto, la matriz de correlación espacial se representará explícitamente como Q(u>, k) como en las ecuaciones (41a) y (42a).
Q(co) = E[X(co,k)XH(co,k)] (41)
í-l
Q(co) = £ X{CÚ, k - i)X H{co,k- i) (42)
7=0
Oico, k) = E[X{co, k)XH (co, k)] (4 la)
<-i
Q(a>,k) - 2^X{co,k-i)XH(co,k-i) (42a)
7=0
Si se usa la matriz de correlación espacial Q(u>, k) representada por la ecuación (41a) o (42a), el filtro W^(u>, 0s) también depende de las tramas actuales y pasadas y, por lo tanto, se representa explícitamente como W^(u>, 0s, k). Entonces, un filtro W^(u>, 0s) representado por cualquiera de las ecuaciones (9), (29), (30), (33), (36) y (38) descritas con los métodos de diseño de filtro descritos anteriormente se reescribe como las ecuaciones (9m), (29m), (30m), (33m), (36m) o (38m).
«Primera realización de la técnica de realce de sonido directivo agudo>>
Las Fig. 7 y 8 ilustran una configuración funcional y un flujo de proceso de una primera realización de una técnica de realce de sonido directivo agudo de la presente invención. Un aparato 1 de realce de sonido de la primera realización (en lo sucesivo conocido como el aparato de realce de sonido directivo agudo) incluye un convertidor 210 AD, un generador 220 de tramas, una sección 230 de transformación en el dominio de frecuencia, una sección 240 de aplicación de filtro, una sección 250 de transformación en el dominio de tiempo, una sección 260 de diseño de filtro y almacenamiento 290.
[Paso S1]
La sección 260 de diseño de filtro calcula de antemano un filtro W^(w, 0i) para cada frecuencia para cada una de las direcciones discretas a partir de las cuales pueden llegar los sonidos a ser realzados. La sección 260 de diseño de filtro calcula los filtros W^(u>, 01), ..., W^(u>, 0) ..., W^(w, 0i) (1 < i < I, uE Q, i es un número entero y Q es un conjunto de frecuencias u), donde I es el número total de direcciones discretas a partir de las cuales pueden llegar los sonidos a ser realzados (I es un número entero predeterminado mayor o igual a 1 y satisface I < P).
5
10
15
20
25
30
35
40
45
50
Para hacerlo así, las funciones de transferencia a^(w, 0i) = [a-i(u, 0i), ..., aM(u, 0i)]T (1 < i < I, ueD ) necesitan ser obtenidas excepto para el caso de <Variación> descrito anteriormente. La función de transferencia a^(w, 0i) = [a-i(u, 0i), ..., aM(u, 0i)]T se puede calcular prácticamente según la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0i) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos y la información de entorno tal como la relación de posición de los objetos reflectores tales como un reflector, el suelo, las paredes o el techo, a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y el sonido reflejado de orden £ (1 < £ < S ) y la reflectancia acústico del objeto reflector. Obsérvese que si se usa <3> el método de diseño de filtro que usa MVDR con una o más direcciones nulas como condición de restricción, los índices i de las direcciones usadas para calcular las funciones de transferencia a^(w, 0i) (1 < i < I, ueD) preferiblemente cubren todos los índices N1, N2, ..., NB de direcciones de al menos B direcciones nulas. En otras palabras, los índices N1, N2, ..., NB de las direcciones de B direcciones nulas se establecen en cualquiera de los diferentes números enteros mayores o iguales a 1 y menores o iguales a I.
El número S de sonidos reflejados se establece en un número entero que satisface 1 < S . El número S no está limitado y se puede establecer en un valor adecuado según la capacidad de cálculo y otros factores. Si se coloca un reflector cerca de la agrupación de micrófonos, las funciones de transferencia a^(u>, 0i) se pueden calcular prácticamente según la ecuación (17b) (para ser precisos, por la ecuación (17b) donde 0 se sustituye por 0i).
Para calcular vectores de dirección, se pueden usar las ecuaciones (14a), (14b), (18a), (18b), (18d) o (18d), por ejemplo. Obsérvese que las funciones de transferencia obtenidas mediante mediciones reales en un entorno real, por ejemplo, se pueden usar para diseñar los filtros en lugar de usar las ecuaciones (17a) y (17b).
Entonces, W^(u>, 0i) (1 < i < I) se obtiene según cualquiera de las ecuaciones (9), (29), (30), (33), (36), (37) y (38), por ejemplo, usando las funciones de transferencia a^(u>, 0) excepto para el caso descrito en <Variación>. Obsérvese que si se usa la ecuación (9), (30), (33) o (36), la matriz de correlación espacial Q(u>) (o Rxx(u)) se puede calcular según la ecuación (10b), excepto para el caso descrito con respecto a <5> el método de diseño de filtro que usa el método de máxima verosimilitud. Si la ecuación (9), (30), (33) o (36) se usa según <5> el método de diseño de filtro que usa el método de máxima verosimilitud descrito anteriormente, la matriz de correlación espacial Q(u>) (o Rxx(u)) se puede calcular según la ecuación (10c). Si se usa la ecuación (29), la matriz de correlación espacial Rnn(u) se puede calcular según la ecuación (27). Los I x | Q | filtros W^(w, 0i) (1 < i < I, uE Q) se almacenan en el almacenamiento 290, donde | Q | representa el número de elementos del conjunto Q.
[Paso S2]
Los M micrófonos 200-1, ..., 200-M que componen la agrupación de micrófonos se usan para captar sonidos, donde M es un número entero mayor o igual a 2.
No hay ninguna restricción en la disposición de los M micrófonos. Sin embargo, una disposición bidimensional o tridimensional de los M micrófonos tiene la ventaja de eliminar la incertidumbre de una dirección desde la cual llegan los sonidos a ser realzados. Es decir, una disposición plana o esférica de los micrófonos puede evitar el problema con una disposición lineal horizontal de los M micrófonos de que un sonido que llega desde una dirección frontal no se puede distinguir de un sonido que llega desde arriba a la derecha, por ejemplo. Con el fin de proporcionar un intervalo amplio de direcciones que se pueden establecer como direcciones de captura de sonido, cada micrófono tiene preferiblemente una directividad capaz de captar sonidos con un cierto nivel de presión de sonido en direcciones del objetivo 0s potenciales que son direcciones de captura de sonido. Por consiguiente, son preferibles los micrófonos que tienen una directividad relativamente débil, tales como micrófonos omnidireccionales o micrófonos unidireccionales.
[Paso S3]
El convertidor 210 AD convierte las señales analógicas (señales de captura) captadas con los M micrófonos 200-1, ..., 200-M en señales digitales x^(t) = [x-i(t), ..., xM(t)]T, donde t representa el índice de un tiempo discreto.
[Paso S4]
El generador 220 de tramas toma entradas de las señales digitales x^(t) = [x-i(t), ..., xM(t)]T emitidas desde el convertidor 210 AD, almacena N muestras en un almacenador temporal sobre una base canal por canal, y emite señales digitales x^(k) = [x^-i(k), ..., x^M(k)]T en tramas, donde k es un índice de un número de tiempo de trama y x^m(k) [xm((k - 1)N + 1), ..., xM(kN)] (1 < m < M). N depende de la frecuencia de muestreo y 512 es adecuado para muestrear a 16 kHz.
[Paso S5]
La sección 230 de transformación en el dominio de frecuencia transforma las señales digitales x^ (k) en tramas en señales en el dominio de frecuencia X^(w, k) = [X-i(u>, k), ..., Xm(u, k)]T y emite las señales en el dominio de frecuencia, donde u es un índice de una frecuencia discreta. Una forma de transformar una señal en el dominio de
5
10
15
20
25
30
35
40
45
50
tiempo en una señal de dominio de frecuencia es una transformada de Fourier discreta rápida. Sin embargo, la forma de transformar la señal no está limitada a esto. Se puede usar otro método para transformar a una señal en el dominio de frecuencia. La señal en el dominio de frecuencia X^(w, k) se emite para cada frecuencia w y trama k a la vez.
[Paso S6]
La sección 240 de aplicación de filtro aplica el filtro W^(w, 0s) correspondiente a una dirección del objetivo 0s a ser realzada a la señal en el dominio de frecuencia X^(w, k) = [Xi(w, k), ..., Xm(w, k)]T en cada trama k para cada frecuencia w eQy emite una señal de salida Y(w, k, 0s) (véase la ecuación (43)). El índice s de la dirección del objetivo 0s es s E {1, ..., 1} y los filtros W^(w, 0s) se almacenan en el almacenamiento 290. Por lo tanto, la sección 240 de aplicación de filtro solamente tiene que recuperar el filtro W^(w, 0s) que corresponde a la dirección del objetivo 0s a ser realzada desde el almacenamiento 290. Si el índice s de la dirección del objetivo 0s no pertenece al conjunto {1, ..., I}, es decir, el filtro W^(w, 0s) que corresponde a la dirección del objetivo 0s no se ha calculado en el proceso en el paso Si, la sección 260 de diseño de filtro puede calcular en este momento el filtro W^(w, 0s) que corresponde a la dirección del objetivo 0s o se puede usar un filtro W^(w, 0s) que corresponde a una dirección 0s’ cercana a la dirección del objetivo 0s.
[Paso S7]
La sección 250 de transformación en el dominio de tiempo transforma la señal de salida Y(w, k, 0s) de cada frecuencia wE q en una trama de orden k a un dominio de tiempo para obtener un señal y(k) de trama en el dominio de tiempo en la trama de orden k, entonces combina las señales y(k) en el dominio de tiempo de tramas obtenidas del orden del índice de número de tiempo de trama, y emite una señal y(t) en el dominio de tiempo en la cual se realza el sonido de la dirección del objetivo 0s. El método para transformar una señal en el dominio de frecuencia a una señal en el dominio de tiempo es una transformación inversa de la transformada usada en el proceso en el paso S5 y puede ser una transformada de Fourier inversa discreta rápida, por ejemplo.
Mientras que la primera realización se ha descrito aquí en la que los filtros W^(w, 0i) se calculan de antemano en el proceso en el paso Si, la sección 260 de diseño de filtro puede calcular el filtro W^(w, 0i) para cada frecuencia después de que se determina la dirección del objetivo 0s, dependiendo de la capacidad de cálculo del aparato 1 de realce de sonido directivo agudo.
«Segunda realización de la técnica de realce de sonido directivo agudo>>
Las Fig. 10 y 11 ilustran una configuración funcional y un flujo de proceso de una segunda realización de una técnica de realce de sonido directivo agudo de la presente invención. Un aparato 2 de realce de sonido directivo agudo de la segunda realización incluye un convertidor 210 AD, una generador 220 de tramas, una sección 230 de transformación en el dominio de frecuencia, una sección 240 de aplicación de filtro, una sección 250 de transformación en el dominio de tiempo, una sección 261 de cálculo de filtro y un almacenamiento 290.
[Paso S11]
M micrófonos 200-1, ..., 200-M que componen una agrupación de micrófonos se usa para captar sonidos, donde M es un número entero mayor o igual a 2. La disposición de los M micrófonos es como se describe en la primera realización.
[Paso S12]
El convertidor 210 AD convierte señales analógicas (señales de captura) captadas con los M micrófonos 200-1, ..., 200-M en señales digitales x^(t) = [x1(t), ..., XM(t)]T, donde t representa el índice de un tiempo discreto.
[Paso S13]
El generador 220 de tramas toma entradas de las señales digitales x^(t) = [x1(t), ..., XM(t)]T emitidas desde el convertidor 210 AD, almacena N muestras en un almacenador temporal sobre una base canal por canal, y emite señales digitales x^(k) = [x^(k), ..., x^M(k)]T en tramas, donde k es un índice de un número de tiempo de trama y x^m(k) [xm((k - 1)N + 1), ..., Xm(kN)] (1 < m < M). N depende de la frecuencia de muestreo y 512 es adecuado para muestrear a 16 kHz.
[Paso S14]
La sección 230 de transformación en el dominio de frecuencia transforma las señales digitales x^(k) en tramas a señales en el dominio de frecuencia X^(w, k) = [X1(w, k), ..., Xm(w, k)]T y emite las señales en el dominio de frecuencia, donde w es un índice de una frecuencia discreta. Una forma de transformar una señal en el dominio de
5
10
15
20
25
30
35
40
45
50
tiempo en una señal en el dominio de frecuencia es la transformada de Fourier discreta rápida. Sin embargo, la forma de transformar la señal no está limitada a esto. Se puede usar otro método para transformar una señal en el dominio de frecuencia. La señal en el dominio de frecuencia X^(w, k) se emite para cada frecuencia w y trama k a la vez.
[Paso S15]
La sección 261 de cálculo de filtro calcula el filtro W^(w, 0s, k) (w eQ; Qes un conjunto de frecuencias w) que corresponde a la dirección del objetivo 0s a ser usada en un trama actual de orden k.
Para hacerlo así, necesitan ser proporcionadas funciones de transferencia a^(w, 0s) = [ai(w, 0s), ..., aM(w, 0s)]T (w eQ ). Las funciones de transferencia a^(w, 0s) = [ai(w, 0s), ., aM(w, 0s)]T se puede calcular prácticamente según la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0s) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos e información de entorno tal como la relación de posición de objetos reflectores tales como un reflector, suelo, paredes o techo a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y un sonido reflejado de orden £ (1 < £ < S ), y la reflectancia acústica del objeto reflector. Obsérvese que si se usa <3> el método de diseño de filtro que usa MVDR con una o más direcciones nulas como condición de restricción, también necesitan ser obtenidas las funciones de transferencia a^(w, 0Nj) (1 <j < B, w eQ). Las funciones de transferencia se pueden calcular prácticamente según la ecuación (17a) (para ser precisos, por la ecuación (17a) donde 0 se sustituye por 0Nj) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos y la información de entorno, tal como la relación de posición de objetos reflectores, tales como un reflector, un piso, una pared o el techo a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y un sonido reflejado de orden £ (1 < £ < S ), y la reflectancia acústica del objeto reflector.
El número S de sonidos reflejados se establece en un número entero que satisface 1 < S . El número S no está limitado y se puede establecer en un valor adecuado según la capacidad de cálculo y otros factores. Si un reflector se coloca cerca de la agrupación de micrófonos, las funciones de transferencia a^(w, 0s) se pueden calcular prácticamente según la ecuación (17b) (para ser precisos, por la ecuación (17b) donde 0 se sustituye por 0s). En este caso, las funciones de transferencia a^(w, 0Nj) (1 <j < B, w eQ) se pueden calcular prácticamente según la ecuación (17b) (para ser precisos, por la ecuación (17b) donde 0 se sustituye por 0Nj).
Para calcular los vectores de dirección, se pueden usar las ecuaciones (14a), (14b), (18a), (18b), (18c) o (18d), por ejemplo. Obsérvese que las funciones de transferencia obtenidas mediante mediciones reales en un entorno real, por ejemplo, se pueden usar para diseñar los filtros en lugar de usar las ecuaciones (17a) y (17b).
Entonces, la sección 261 de cálculo de filtro calcula los filtros W^(w, 0s, k) (w eQ) según cualquiera de las ecuaciones (9m), (29m) m (30m), (33m), (36m) y (38m) usando las funciones de transferencia a^(w, 0s) (w eQ ) y, si se necesita, las funciones de transferencia a^(w, 0Nj) (1 <j < B, w eQ). Obsérvese que la matriz de correlación espacial Q(w) (o Rxx(w)) se puede calcular según la ecuación (41a) o (42a). En el cálculo de la matriz de correlación espacial Q(w), se usan las señales en el dominio de frecuencia X^(w, k - i) (i = 0, 1, ..., £ - 1) de un total de £ tramas actuales y pasadas almacenadas en el almacenamiento 290, por ejemplo.
[Paso S16]
La sección 240 de aplicación de filtro aplica el filtro W^(w, 0s, k) correspondiente a una dirección del objetivo 0s a ser realzada a la señal en el dominio de frecuencia X^(w, k) = [X1(w, k), ..., Xm(w, k)]T en cada trama k para cada frecuencia w eQ y emite una señal de salida Y(w, k, 0s) (véase la ecuación (44)).
[Paso S17]
La sección 250 de transformada en el dominio de tiempo transforma la señal de salida Y(w, k, 0s) de cada frecuencia w eQ de un trama de orden k a un dominio de tiempo para obtener una señal y(k) de trama en el dominio de tiempo en la trama de orden k, entonces combina las señales y(k) en el dominio de tiempo de tramas obtenidas del orden del índice de número de tiempo de trama, y emite una señal y(t) en el dominio de tiempo en el que se realza el sonido de la dirección del objetivo 0s. El método para transformar una señal en el dominio de frecuencia en una señal en el dominio de tiempo es una transformación inversa del método de transformación usado en el proceso en el paso S14 y puede ser una transformada de Fourier inversa discreta rápida, por ejemplo.
5
10
15
20
25
30
35
40
45
50
55
[Ejemplo experimental de técnica de realce de sonido directivo agudo]
Se describirán los resultados de un experimento sobre la primera realización de la técnica de realce de sonido directivo agudo de la presente invención (el método de respuesta sin distorsión de varianza mínima (MVDR) bajo una única condición de restricción). Como se ilustra en la Fig. 9, se disponen linealmente 24 micrófonos y se coloca un reflector 300 de modo que la dirección a lo largo de la cual los micrófonos en la agrupación de micrófonos lineales es normal al reflector 300. Aunque no hay restricción en la forma del reflector 300, se usó un reflector plano rígido semigrueso que tenía un tamaño de 1,0 m x 1,0 m. La distancia entre micrófonos adyacentes era 4 cm y la reflectancia a del reflector 300 era 0,8. Una dirección del objetivo 0s se estableció en 45 grados. Bajo la suposición de que los sonidos llegarían a la agrupación de micrófonos lineales como ondas planas, se calcularon las funciones de transferencia según la ecuación (17b) (véanse la ecuaciones (14a) y (18a)) y se investigaron las directividades de los filtros generados. Se usaron dos métodos convencionales (el método MVDR sin reflector y el método de conformación de haces de retardo y suma con reflector) para comparación con la técnica.
Las Fig. 12 y 13 muestran los resultados del experimento. Se puede ver que la primera realización de la técnica de realce de sonido directivo agudo de la presente invención puede lograr una directividad aguda en la dirección del objetivo en todas las bandas de frecuencia en comparación con los dos métodos convencionales. Se entenderá que la técnica de realce de sonido directivo agudo es eficaz especialmente en bandas de frecuencias más bajas. La Fig. 14 muestra la directividad de los filtros W^(u>, 0) generados según la primera realización de la técnica de realce de sonido directivo agudo de la presente invención. Se puede ver a partir de la Fig. 14 que la técnica realza no solamente los sonidos directos sino también los sonidos reflejados.
El mismo experimento se dirigió con el reflector 300 colocado de modo que la superficie plana del reflector 300 formase un ángulo de 45 grados con la dirección en la que estaban dispuestos los micrófonos de la agrupación de micrófonos lineales, como se muestra en la Fig. 15. Una dirección del objetivo 0s se estableció a 22,5 grados. Las otras condiciones experimentales fueron las mismas que las del experimento en el que el reflector 300 se colocó de modo que la dirección en la que se dispusieron los micrófonos de la agrupación de micrófonos lineales era normal al reflector 300.
Las Fig. 16 y 17 muestran los resultados del experimento. Se puede ver que la primera realización de la técnica de realce de sonido directivo agudo de la presente invención puede lograr una directividad aguda en la dirección del objetivo en todas las bandas de frecuencia en comparación con los dos métodos convencionales. Se entenderá que la técnica de realce de sonido directivo agudo es eficaz especialmente en bandas de frecuencias más bajas.
<Ejemplos de aplicaciones>
Hablando en sentido figurado, la técnica de realce de sonido directivo agudo es equivalente a la generación de una imagen clara a partir de una imagen borrosa y desenfocada y es útil para obtener información detallada acerca de un campo acústico. La siguiente es una descripción de ejemplos de servicios donde es útil la técnica de realce de sonido directivo agudo de la presente invención.
Un primer ejemplo es la creación de contenidos que son combinación de audio y video. El uso de una realización de la técnica de realce de sonido directivo agudo de la presente invención permite que el sonido del objetivo desde una gran distancia sea realzado claramente incluso en un entorno ruidoso con sonidos de ruido (sonidos distintos de los sonidos del objetivo). Por lo tanto, por ejemplo se pueden añadir a la imagen en movimiento sonidos en un área particular correspondiente a una imagen en movimiento acercada de un jugador de fútbol que dribla que fue filmada desde el exterior del campo.
Un segundo ejemplo es una aplicación a una videoconferencia (o una teleconferencia de audio). Cuando se mantiene una conferencia en una sala pequeña, la voz de un orador humano se puede realzar hasta cierto grado con varios micrófonos según una técnica convencional. Sin embargo, en una sala de conferencias grande (por ejemplo, un gran espacio donde hay oradores humanos a una distancia de 5 metros o más de los micrófonos), es difícil realzar claramente la voz de un orador humano a una distancia con las técnicas convencionales mediante el método convencional y necesita ser colocado un micrófono enfrente de cada orador humano. Por el contrario, el uso de una realización de la técnica de realce de sonido directivo agudo de la presente invención es capaz de realzar claramente sonidos desde una gran distancia y, por lo tanto, permite la construcción de un sistema de videoconferencia que es utilizable en una sala de conferencias grande sin tener que colocar un micrófono enfrente de cada orador humano.
<<Principio de la técnica de realce de punto de sonido>>
Se describirá a continuación un principio de una técnica de realce de punto de sonido de la presente invención. La técnica de realce de punto de sonido de la presente invención se basa en la naturaleza de una técnica de agrupación de micrófonos que es capaz de seguir sonidos desde cualquier dirección sobre la base de procesamiento de señal y usa positivamente los sonidos reflejados para captar sonidos con una relación SN alta. Una característica de la presente invención es un uso combinado de los sonidos reflejados y una técnica de procesamiento de señal que permite una directividad aguda. En particular, una de las características notables de la técnica de realce de punto de sonido de la presente invención es el uso de un objeto reflector para aumentar la
5
10
15
20
25
30
35
40
45
50
55
diferencia entre las funciones de transferencia de diferentes fuentes de sonido para una agrupación de micrófonos, a la luz del hecho de que las funciones de transferencia de fuentes de sonido situadas casi en las mismas direcciones de la agrupación de micrófonos, pero a diferentes distancias de la agrupación de micrófono a la agrupación de micrófonos son muy similares entre sí. Extrayendo las diferencias en la función de transferencia a través de procesamiento de señal, se puede lograr una técnica de realce de punto de sonido capaz de realzar sonidos según las distancias desde la agrupación de micrófonos.
Antes de la descripción, se definirán de nuevo los símbolos. El índice de una frecuencia discreta se denota por w (El índice w de una frecuencia discreta se puede considerar que es una frecuencia angular w debido a que una frecuencia f y una frecuencia angular w satisfacen la relación w = 2nf. Con respecto a w, el “índice de una frecuencia discreta” también se puede conocer algunas veces simplemente como “frecuencia”) y el índice del número de tiempo de trama se denota por k. La representación en el dominio de frecuencia de un trama de orden k de una señal analógica recibida en M micrófonos se denota por X^(w, k) = [Xi(w, k), ..., Xm(w, k)]Ty un filtro que realza una señal en el dominio de frecuencia X^(w, k) de un sonido desde una fuente de sonido se supone que está situado en una dirección 0s como se ve desde el centro de la agrupación de micrófonos a una distancia Dh desde el centro de la agrupación de micrófonos con una frecuencia w se denota por W^(w, 0s, Dh), donde M es un número entero mayor o igual a 2 y T representa la transposición. Se supone aquí que la distancia Dh es fija.
Mientras que el “centro de una agrupación de micrófonos” se puede determinar arbitrariamente, típicamente el centro geométrico de la agrupación de los M micrófonos se trata como el “centro de una agrupación de micrófonos”. En el caso de una agrupación de micrófonos lineales, por ejemplo, el punto equidistante de los micrófonos en ambos extremos de la agrupación se trata como el “centro de la agrupación de micrófonos”. En el caso de una agrupación plana de micrófonos en la que se disponen micrófonos en una matriz cuadrada de m x m (m2 = M), por ejemplo, la posición en la que se cruzan las diagonales que unen los micrófonos en las esquinas se trata como el “centro de la agrupación de micrófonos”.
La expresión “la fuente de sonido se supone que está situada en...” se ha usado debido a que la presencia real de una fuente de sonido en la ubicación no es esencial para la técnica de realce de punto de sonido de la presente invención. Es decir, como será evidente a partir de la descripción más tarde, la técnica de realce de punto de sonido de la presente invención realiza en esencia procesamiento de señal de aplicación de filtros a señales representadas por frecuencias y permite realizaciones en las que se crea un filtro de antemano para cada distancia discreta Dh. Por consiguiente, la presencia real de una fuente de sonido en la ubicación no se requiere incluso en la etapa donde se realiza realmente el procesamiento de realce de punto de sonido. Por ejemplo, si una fuente de sonido existe realmente en una ubicación en una dirección 0s como se ve desde la agrupación de micrófonos y a una distancia de Dh de la agrupación de micrófonos en la etapa donde se realiza realmente el procesamiento de realce de punto de sonido, un sonido de la fuente de sonido se puede realzar eligiendo un filtro adecuado para la ubicación. Si la fuente de sonido no existe realmente en la ubicación y si se supone que no hay sonidos e incluso ningún ruido en absoluto, un sonido realzado por el filtro será idealmente un silencio total. Sin embargo, esto no es diferente de realzar un “sonido que llega de la ubicación”.
Bajo estas condiciones, una señal en el dominio de frecuencia Y(w, k, 0s, Dh) que resulta del realce de una señal en el dominio de frecuencia X^(w, k) de un sonido de una fuente de sonido que se supone que está en una ubicación en una dirección 0s a una distancia de Dh como se ve desde el centro de la agrupación de micrófonos (en lo sucesivo conocida como “ubicación (0s, Dh)” a menos que se indique de otro modo) con frecuencia w se puede dar por la ecuación (106) (en lo sucesivo la señal resultante se conoce como señal de salida):
Y(co, k, 0,, Dh ) = W1H (m, 9,, Dh )X(®, k) (106)
donde H representa la transposición hermitiana.
El filtro W^(w, 0s, Dh) se puede diseñar de varias formas. Se describirá aquí un diseño que usa el método de respuesta sin distorsión de varianza mínima (MVDR). En el método MVDR, un filtro W^(w, 0s, Dh) está diseñado de modo que la potencia de sonidos de direcciones distintas de la dirección 0s (en lo sucesivo, los sonidos de direcciones distintas de la dirección 0s también se conocerán como “ruido”) se minimiza a una frecuencia w usando una matriz de correlación espacial Q(w) bajo la condición de restricción de la ecuación (108) (véase la ecuación (107). Se debería señalar que la matriz de correlación espacial Q(w) se especifica como Q(w, Dh) debido a que se supone aquí que la dirección Dh es fija). Suponiendo que una fuente de sonido se sitúa en una posición (0s, Dh), entonces a^(w, 0s, Dh) = [ai(w, 0s, Dh), ..., aM(w, 0s, Dh)]T representa las funciones de transferencia a una frecuencia
w entre la fuente de sonido y los M micrófonos. En otras palabras, a^(w, 0s, Dh) = [ai(w, 0s, Dh), ..., aM(w, 0s, Dh)]T
representa las funciones de transferencia de un sonido desde la posición (0s, Dh) hasta los micrófonos incluidos en la agrupación de micrófonos a la frecuencia w. La matriz de correlación espacial Q(w) representa la correlación entre los componentes Xi(w, k), ..., Xm(w, k) de una señal en el dominio de frecuencia X^(w, k) a la frecuencia w y tiene E[Xi(w, k)Xj*(w, k)] (1 < i < M, 1 < j < M) como sus elementos (i, j). El operador E[] representa una operación de promediado estadístico y el símbolo * es un operador conjugado complejo. La matriz de correlación espacial Q(w) se puede expresar usando los valores estadísticos de X1(w, k), ..., Xm(w, k) obtenidos a partir de la observación o se
5
10
15
20
25
30
35
40
pueden expresar usando funciones de transferencia. Este último caso, donde la matriz de correlación espacial Q(u>) se expresa usando funciones de transferencia, se describirá momentáneamente en lo sucesivo.
Es conocido que el filtro W^(w, 0s, Dh) que es una solución óptima de la ecuación (107) se puede dar por la ecuación (109) (véase la Referencia 1 enumerada más tarde).
W(<B,^,Dh) = -n-----Q '(«,Dh)a(g>,^,Dh)--------
aH(®,é>s,D„)Q“ (w,Dk)3(®,e,,D„)
Como se apreciará a partir del hecho de que la matriz inversa de la matriz de correlación espacial Q(w, Dh) se incluye en la ecuación (109), la estructura de la matriz de correlación espacial Q(u>, Dh) es importante para lograr una directividad aguda. Se apreciará a partir de la ecuación (107) que la potencia de ruido depende de la estructura de la matriz de correlación espacial Q(u>, Dh).
Un conjunto de índices p de direcciones desde las cuales llega ruido se denota por {1, 2, ..., P -1}. Se supone que el índice s de la dirección del objetivo 0s no pertenece al conjunto {1, 2, ..., P -1}. Suponiendo que P - 1 ruidos vienen de direcciones arbitrarias, la matriz de correlación espacial Q(u>, Dh) se puede dar por la ecuación (110a). Con el fin de diseñar un filtro que funcione suficientemente en presencia de muchos ruidos, es preferible que P sea un valor relativamente grande. Se supone aquí que P es un número entero del orden de M. Mientras que la descripción se da como si la dirección 0s es una dirección constante (y por lo tanto direcciones distintas de la dirección 0s se describen como direcciones desde las cuales llega ruido) por claridad de la explicación del principio de la técnica de realce de punto de sonido de la presente invención, la dirección 0s en realidad pueden ser cualquier dirección que pueda ser un objetivo de realce de sonido. Usualmente, una pluralidad de direcciones pueden ser las direcciones 0s. A la luz de esto, la diferenciación entre la dirección 0s y las direcciones de ruido es subjetiva. Es más correcto considerar que una dirección seleccionada a partir de P direcciones diferentes que están predeterminadas como una pluralidad de direcciones posibles a partir de la cuales puede llegar cualquier sonido, incluyendo un sonido o ruido del objetivo, es la dirección que puede ser un objetivo de realce de sonido y las otras direcciones son direcciones de ruido. Por lo tanto, la matriz de correlación espacial Q(u>, Dh) se puede representar por las funciones de transferencia a^(u>, 0<p, Dh) = [a-i(w, 0<p, Dh), ..., aM(w, 0<p, Dh)]T (9G O) de sonidos que vienen de direcciones 0<p incluidas en una pluralidad de direcciones posibles que están a una distancia Dh del centro de la agrupación de micrófonos y desde las cuales pueden llegar sonidos a los micrófonos y se pueden escribir como la ecuación (110b), donde O es la unión del conjunto {1, 2, ..., P - 1} y un conjunto {s}. Obsérvese que |O| = P y |O| representa el número de elementos del conjunto O.
Q(^DJ = á(í»,0s,Dh)áH(¿y,0s,Dh)+ ]T á(a>,0p,Dh jalV,0p,Dh) (110a)
pe{l,-fP-l}
Q(<y,Dh)= £a(<»,fy,Dh)aH(ü>,fy,Dh)
Aquí, se supone que la función de transferencia a^(u>, 0s, Dh) de un sonido de la dirección 0s y las funciones de transferencia a^(u>, 0p, Dh) = [a-i(u>, 0p, Dh), ..., aM(w, 0p, Dh)]T de los sonidos de las direcciones p e {1, 2, ..., P -1} son ortogonales entre sí. Es decir, se supone que hay P sistemas base ortogonales que satisfacen la condición dada por la ecuación (111). El símbolo ^ representa ortogonalidad. Si A^ ^ B^, el producto interno de los vectores A^ y B^es cero. Se supone aquí que P < M. Obsérvese que si la condición dada por la ecuación (111) se puede relajar para suponer que hay P sistemas base que se pueden considerar aproximadamente como sistemas base ortogonales, P es preferiblemente un valor del orden de M o un valor relativamente grande mayor o igual a M.
Entonces, la matriz de correlación espacial Q(w, Dh) se puede expandir como la ecuación (112). La ecuación (112) supone que la matriz de correlación espacial Q(w, Dh) se puede descomponer en una matriz V(u>, Dh) = [a^(u>, 0s, Dh), a^(w, 01, Dh), ..., a^(w, 0p-1, Dh)]T compuesta por P funciones de transferencia que satisfacen la ortogonalidad y una matriz unidad A(w, Dh) ■ Aquí, p es un valor propio de una función de transferencia a^(u>, 0<p, Dh) que satisface la ecuación (111) para la matriz de correlación espacial Q(u>, Dh) y es un valor real.
(110b)
5
10
15
20
25
30
35
Entonces, la matriz inversa de la matriz de correlación espacial Q(w) se puede dar por la ecuación (113).
Q-' (a, Dh ) = i VH (<a, Dh )A-‘ (fi>, D„ )■V(a>, Dh) (113)
p
La sustitución de la ecuación (113) en la ecuación (107) muestra que se minimiza la potencia de ruido. Si se minimiza la potencia de ruido, significa que se logra la directividad en la dirección 0s. Por lo tanto, la ortogonalidad entre las funciones de transferencia de sonidos de diferentes direcciones es una condición importante para lograr la directividad en la dirección 0s.
La razón de por qué es difícil para las técnicas convencionales lograr una directividad aguda en una dirección 0s se tratará a continuación.
Las técnicas convencionales asumieron en el diseño de filtros que las funciones de transferencia se componen de los de sonidos directos. En realidad, hay sonidos reflejados que se producen por la reflexión de sonidos de la misma fuente de sonido fuera de superficies tales como las paredes y el techo y llegan a los micrófonos. Sin embargo, las técnicas convencionales consideraban los sonidos reflejados como un factor que degradaba la directividad e ignoraban la presencia de los sonidos reflejados. Suponiendo que los sonidos llegan a una agrupación de micrófonos lineales como ondas planas, la técnica convencional trataba las funciones de transferencia a^conv(w, 0) = [a-i(w, 0), ..., aM(w, 0)]T como a^ conv(w, 0) = h^ d(w, 0) donde h^d(w, 0) = [hd-i(w, 0), ..., hdM(w, 0)]T representa vectores de dirección de solamente un sonido directo que llega de una dirección 0 (dado que las ondas de sonido se considera que son ondas planas, los vectores de dirección no dependen de la distancia D). Obsérvese que un vector de dirección es un vector complejo donde se disponen las características de respuesta de fase de los micrófonos a una frecuencia w con respecto a un punto de referencia para una onda de sonido de una dirección 0 vista desde el centro de la agrupación de micrófonos.
Se supone en lo sucesivo momentáneamente que el sonido llega al micrófono lineal como ondas planas. Supongamos que un elemento de orden m hdM(w, 0) del vector de dirección h^d(w, 0) de un sonido directo se da, por ejemplo, por la ecuación (114c), donde u representa la distancia entre micrófonos adyacentes, j es una unidad imaginaria. En este caso, el punto de referencia es el punto medio de la longitud total de la agrupación de micrófonos lineales (el centro de la agrupación de micrófonos lineales). La dirección 0 se define como el ángulo formado por la dirección desde la cual llega un sonido directo y la dirección en la que están dispuestos los micrófonos incluidos en la agrupación de micrófonos lineales, como se ve desde el centro de la agrupación de micrófonos lineales (véase la Fig. 9). Obsérvese que un vector de dirección se puede expresar de varias formas. Por ejemplo, suponiendo que el punto de referencia es la posición del micrófono en un extremo de la agrupación de micrófonos lineales, un elemento de orden m hdm(w, 0) del vector de dirección h^d(w, 0) de un sonido directo se puede dar por la ecuación (114d). En la siguiente descripción, la suposición es que el elemento de orden m hdm(w, 0) del vector de dirección h^d(w, 0) de un sonido directo se puede escribir como la ecuación (114c).
(114c) (114d)
El producto interno Yconv(w, 0) de una función de transferencia de una dirección 0 y una función de transferencia de una dirección del objetivo 0s se puede dar por la ecuación (115), donde 0 ^ 0s.
5
10
15
20
25
30
35
40
45
En lo sucesivo, Yconv(w, 0) se conoce como coherencia. La dirección 0 en la cual la coherencia Yconv(w, 0) es 0 se puede dar por la ecuación (116), donde q es un número entero arbitrario, excepto 0. Dado que 0 < 0 < n/2, el intervalo de q está limitado para cada banda de frecuencia.
Dado que solamente los parámetros relacionados con el tamaño de la agrupación de micrófonos (M y u) se pueden cambiar en la ecuación (116), es difícil reducir la coherencia Yconv(w, 0) sin cambiar ninguno de los parámetros relacionados con el tamaño de la agrupación de micrófonos si la diferencia (diferencia angular) |0 - 0s| entre direcciones es pequeña. Si este es el caso, la potencia de ruido no se reduce a un valor suficientemente pequeño y resultará una directividad que tiene una anchura de haz amplia en la dirección del objetivo 0s como se ilustra esquemáticamente en la Fig. 5A.
La técnica de realce de punto de sonido de la presente invención se basa en la consideración descrita anteriormente y se caracteriza por tener en cuenta positivamente los sonidos reflejados, a diferencia de la técnica convencional, sobre la base de un entendimiento de que con el fin de diseñar un filtro que proporcione una directividad aguda en la dirección 0s, es importante permitir que la coherencia sea reducida a un valor suficientemente pequeño incluso cuando la diferencia (diferencia angular) |0 - 0s| entre direcciones es pequeña.
Dos tipos de ondas planas, esto es, sonidos directos desde una fuente de sonido y sonidos reflejados producidos por reflexión de ese sonido fuera de un objeto 300 reflector, juntos entran en los micrófonos de una agrupación de micrófonos. Permitamos que el número de sonidos reflejados sea denotado por S . Aquí, S es un número entero predeterminado mayor o igual a 1. Entonces, una función de transferencia a^(w, 0) = [a-i(w, 0), ..., aM(w, 0)]T se puede expresar mediante la suma de una función de transferencia de un sonido directo que viene de una dirección que puede ser un objetivo de realce de sonido y llega directamente a la agrupación de micrófonos y la función o funciones de transferencia de uno o más sonidos reflejados que se producen por la reflexión de ese sonido fuera de un objeto reflector y llegan a la agrupación de micrófonos. Específicamente, la función de transferencia se puede representar como la suma del vector de dirección del sonido directo y el vector de dirección de S sonidos reflejados cuyas descomposiciones debidas a la reflexión y las diferencias de tiempo de llegada del sonido directo se corrigen,
como se muestra en la ecuación (117a), donde T (0) es la diferencia de tiempo de llegada entre el sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y a (1 < £ < S ) es un coeficiente para tener en cuenta las
descomposiciones de los sonidos debidas a la reflexión. Aquí, h^ ^ (w, 0) = [h rl^ (w, 0), ., h rM^ (w, 0)]T representa los vectores de dirección de los sonidos reflejados correspondientes al sonido directo desde la dirección 0. Típicamente, a (1 < £ < S ) es menor o igual a 1 (1 < £ < S ). Para cada sonido reflejado, si el número de
reflexiones en el camino desde la fuente de sonido a los micrófonos es 1, a (1 < £ < S ) se puede considerar que representa la reflectancia acústica del objeto desde el cual se reflejó el sonido reflejado de orden £ .
Dado que se proporcionan uno o más sonidos reflejados a la agrupación de micrófonos compuesta por M micrófonos, son necesarios uno o más objetos reflectores. Desde este punto de vista, una fuente de sonido, la agrupación de micrófonos, y uno o más objetos reflectores están preferiblemente en tal relación de posición que un sonido de la fuente de sonido se refleja fuera al menos un objeto reflector antes de llegar a la agrupación de micrófonos, suponiendo que la fuente de sonido está situada en la dirección del objetivo para la mejora de sonido. Cada uno de los objetos reflectores tiene una forma bidimensional (por ejemplo, una placa plana) o una forma tridimensional (por ejemplo, una forma parabólica). Cada objeto reflector es preferiblemente de aproximadamente el tamaño de la agrupación de micrófonos o mayor (mayor en un factor de 1 a 2). Con el fin de usar eficazmente los
sonidos reflejados, la reflectancia a (1 < £ < S ) de cada objeto reflector es preferiblemente al menos mayor que
0, y más preferiblemente, la amplitud de un sonido reflejado que llega a la agrupación de micrófonos es mayor que la amplitud del sonido directo en un factor de 0,2 o mayor. Por ejemplo, cada objeto reflector es un sólido rígido. Cada objeto reflector puede ser un objeto móvil (por ejemplo, un reflector) o un objeto inamovible (tal como un suelo, una pared o un techo). Obsérvese que si un objeto inamovible se establece como objeto reflector, el vector de dirección para el objeto reflector necesita ser cambiado a medida que se vuelve a situar la agrupación de micrófonos (véanse
las funciones ^(0) y ^ (0) descritas más tarde) y, en consecuencia, el filtro necesita ser recalculado (restablecido).
5
10
15
20
25
Por lo tanto, los objetos reflectores son preferiblemente accesorios de la agrupación de micrófonos en aras de la robustez frente a cambios de entorno (en este caso, S sonidos reflejados supuestos se considera que son sonidos reflejados fuera de los objetos reflectores). Aquí los “accesorios de la agrupación de micrófonos” son “objetos tangibles capaces de seguir los cambios de la posición y la orientación de la agrupación de micrófonos mientras que se mantiene la relación de posición (relación geométrica) con la agrupación de micrófonos). Un ejemplo simple puede ser una configuración donde los objetos reflectores se fijan a la agrupación de micrófonos.
Con el fin de describir concretamente ventajas de la técnica de realce de punto de sonido de la presente invención, se supone en lo siguiente que S = 1, los sonidos se reflejan una vez y un objeto reflector existe a una distancia de L metros del centro de la agrupación de micrófonos. El objeto reflector es un objeto grueso y rígido. Dado que S = 1 en este caso, el símbolo que representa esto se omite y, por lo tanto, la ecuación (117a) se puede reescribir como la ecuación (117b):
a(ú), 9) = h d {co, 9) + a exp[- j co z (9)] • h r{co, 9) (117b)
Se representa un elemento de orden m del vector de dirección h^r(w, 0) = [hri(w, 0), ..., hrM(w, 0)]T de un sonido reflejado se puede dar por la ecuación (118a) de la misma forma que el vector de dirección de un sonido directo (véase la ecuación (114c)). La función ^(0) emite la dirección desde la cual llega un sonido reflejado. Obsérvese que si el vector de dirección de un sonido directo se escribe como la ecuación (114d), un elemento de orden m del vector de dirección h^r(w, 0) = [hr-i(w, 0), ..., hrM(w, 0)]T de un sonido reflejado se da por la ecuación (118b). Si S <2, un elemento de orden m de un vector de dirección de orden £ (1 < £ < S ) h^ ^ (w, 0) = [h rl^ (w, 0), ., h rM^ (w, 0)]T
se da por la ecuación (118c) o la ecuación (118d). La función ^ (0) emite la dirección desde la cual llega el sonido reflejado de orden £ (1 < £ < S ).
Dado que la ubicación de un objeto reflector se puede establecer según sea adecuado, la dirección desde la cual llega un sonido reflejado se puede tratar como un parámetro variable.
Suponiendo que un objeto reflector de placa plana está cerca de la agrupación de micrófonos (la distancia L no es extremadamente grande en comparación con el tamaño de la agrupación de micrófonos), la coherencia y(w, 0) se da por la ecuación (119), donde 0 ^ 0s.
y{co, 9) = áH {co, 9S )a{co, 9)
— (co, 9S )hd {co, 6)
+ a exp[- j co t (6)\ • h {co, 0S )h r (co, 9)
+ aex p[]^(9s)]-h]\ú),9s)hd(ú),9)
+ a2 exp[- ja>(r(9) — r(^s))] • h (ú), 9s)hr (co,9) (119)
5
10
15
20
25
30
Será evidente a partir de la ecuación (119) que la coherencia y(w, 0) de la ecuación (119) puede ser menor que la coherencia Yconv(w, 0) de la técnica convencional de la ecuación (115). Dado que los parámetros (y(0) y L) que se pueden cambiar volviendo a situar o reorientando el objeto reflector se incluyen en el segundo a cuarto términos de la ecuación (119), hay una posibilidad de que se pueda eliminar el primer término, h^dH(w, 0) h^d(w, 0).
Por ejemplo, si se coloca un reflector plano en tal posición que la dirección a lo largo de la cual se disponen los micrófonos en una agrupación de micrófonos lineales es normal al reflector, y(0) = n- 0 se mantiene para la función Y(0) y la ecuación (120) recoge la diferencia z (0) en el tiempo de llegada entre un sonido directo y un sonido reflejado Por lo tanto, las condiciones de las ecuaciones (121) y (122) se generan para los elementos de la ecuación (119). Aquí el símbolo * es un operador conjugado complejo.
Dado que el valor absoluto de h^dH(w, 0) h^r(w, 0) es suficientemente menor que h^dH(w, 0) h^d(w, 0), el segundo y tercer términos de la ecuación (119) son despreciables. Entonces la coherencia y(w, 0) se puede aproximar como la ecuación (123):
y (o,0) * {l + a2 exp[- - r(0s))]} hj1 (co,Os)hd(o,0) (123)
Incluso si h^dH(w, 0) h^d(w, 0) ^ 0, una coherencia aproximada y(w, 0) tiene una solución mínima 0 de la ecuación (124), donde q es un número entero positivo arbitrario. El intervalo de q está restringido para cada frecuencia.
Es decir, no solamente se puede suprimir la coherencia en una dirección dada por la ecuación (116) sino también la coherencia en una dirección dada por la ecuación (124). Dado que la supresión de coherencia puede reducir la potencia de ruido, una directividad aguda se puede lograr como se muestra esquemáticamente en la Fig. 5B.
Mientras que las Fig. 5A y 5B muestran esquemáticamente la diferencia entre la directividad lograda por la técnica de realce de sonido directivo agudo de la presente invención y la directividad lograda mediante una técnica convencional, la Fig. 6 muestra específicamente la diferencia entre 0 dada por la ecuación (116) y 0 dada por la ecuación (124). Aquí, w = 2nx 1000 [rad/s], L = 0,70 [m], y 0s = n/4 [rad]. La dependencia de la dirección de la coherencia normalizada se muestra en la Fig. 6 para comparación entre las técnicas. La dirección indicada por un círculo es 0 dada por la ecuación (116) y las direcciones indicadas por el símbolo + son 0 dadas por la ecuación (124). Como se puede ver a partir de la Fig. 6, según la técnica convencional, 0 que produce una coherencia de 0 para 0s = n/4 [rad] existe solamente en la dirección indicada por el círculo, mientras que según el principio de la técnica de realce de sonido directivo agudo de la presente invención, 0 que produce una coherencia de 0 para 0s = n/4 [rad] existe en muchas direcciones indicadas por el símbolo +. Especialmente, las direcciones indicadas por el símbolo + existen mucho más cerca de 0s = n/4 [rad] que la dirección indicada por el círculo. Por lo tanto, se entenderá que la técnica de la presente invención logra una directividad más aguda que la técnica convencional.
Mientras que por claridad de la explicación del principio de la técnica de realce de punto de sonido de la presente invención, se ha supuesto en lo precedente que ondas de sonidos llegan como ondas planas, la esencia de la
5
10
15
20
25
30
35
40
técnica de realce de sonido de punto de la presente invención es que la función de transferencia a^(w, 0, D) = [a-i(w, 0, D), ..., aM(w, 0, D)]t se representa mediante la suma del vector de dirección de un sonido directo y los vectores de dirección de S sonidos reflejados, como se muestra en la Ecuación (117a), por ejemplo, como es evidente a partir de la descripción precedente. Por consiguiente, se entenderá que la técnica no está limitada a las ondas de sonido que llegan como ondas planas, sino que es capaz de lograr el realce del sonido de los sonidos que llegan como ondas esféricas con una directividad más alta que la técnica convencional.
Se describirán las funciones de transferencia a^(w, 0, D) de ondas de sonido que llegan como ondas esféricas. Dos tipos de ondas esféricas, esto es, sonidos directos de una fuente de sonido y sonidos reflejados producidos por reflexión de ese sonido fuera de un objeto 300 reflector, juntos entran en los micrófonos de una agrupación de micrófonos. Permitamos que el número de sonidos reflejados sea denotado por S . Aquí, S es un número entero predeterminado mayor o igual a 1. Entonces, una función de transferencia a^(w, 0, D) = [a-i(w, 0, D), ..., aM(w, 0, D)]T se puede expresar mediante la suma de una función de transferencia de un sonido directo que viene de una posición (0s, D) que puede ser un objetivo de realce de sonido y llega directamente a la agrupación de micrófonos y la función o funciones de transferencia de uno o más sonidos reflejados que se producen por la reflexión de ese sonido fuera de un objeto reflector y llegan a la agrupación de micrófonos. Específicamente, la función de transferencia se puede representar como la suma del vector de dirección del sonido directo y del vector de dirección de S sonidos reflejados cuyas descomposiciones debidas a la reflexión y las diferencias de tiempo de llegada del sonido directo se corrigen, como se muestra en la ecuación (125), donde T (0, D) es la diferencia de tiempo de
llegada entre el sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y a (1 < £ < S ) es un coeficiente para tener en cuenta las descomposiciones de los sonidos debidas a la reflexión. Aquí h^d(w, 0, Dh) = [hd-i(w, 0, Dh), ..., hdM(w, 0, Dh)]T representa el vector de dirección de un sonido directo de la posición (0s, D) y h^^ (w, 0, D) =
[h rl£ (w, 0, D), ., h rMe (w, 0, D)]t representa el vector de dirección de un sonido reflejado correspondiente al sonido
directo de la posición (0s, D). Se añadirá aquí una nota acerca del término “vector de dirección”. Un “vector de dirección” también se denomina “vector de dirección” y, como su nombre sugiere, representa típicamente un vector complejo que es dependiente de la “dirección”. Desde este punto de vista, es más preciso hacer referencia a un vector complejo que es dependiente de una posición (0s, D) como “vector de dirección extendida”, por ejemplo. Sin embargo, en aras de la simplicidad, el vector complejo que es dependiente de una posición (0s, D) también se
conocerá simplemente como el “vector de dirección” en la presente memoria. Típicamente, a (1 < £ < S ) es menor o igual a 1 (1 < £ < S ). Para cada sonido reflejado, si el número de reflexiones en el camino desde la fuente de sonido a los micrófonos es 1, a (1 < £ < S ) se puede considerar que representa la reflectancia acústica del objeto desde el cual se reflejó el sonido reflejado de orden £ .
á(¿y,0, D) = hd 0,0, D) + exp[- jcoz ^ {0,D)]■ hr^(<y, 0,D) (125)
En la ecuación (125), un elemento de orden m hdm(w, 0, Dh) del vector de dirección h^d (w, 0, Dh) del sonido directo se puede dar por la ecuación (125a), por ejemplo. Aquí m es un número entero que satisface 1 < m < M, c representa la velocidad del sonido y j es una unidad imaginaria. En un sistema de coordenadas espaciales adecuadamente establecido, v^e,D(d) representa un vector de posición de una posición (0, D), u^m representa un vector de posición de un micrófono de orden m, el símbolo |||| representa una norma, y f(||v^0,o(d) - u^m|| es una función que representa una distancia de descomposición de una onda de sonido. Por ejemplo, f(||v^0,o(d) - u^m||) = 1/ Hv^d™ - u^m|| y en este caso la ecuación (125a) se puede escribir como la ecuación (125b).
En la ecuación (125), un elemento de orden m hrm^ (w, 0, D) del vector de dirección h^^ (w, 0, D) = [h rl^ (w, 0, D), ..., hrMe (w, 0, D)]t se puede dar por la ecuación (126a), como el vector de dirección del sonido directo (véase la
5
10
15
20
25
30
35
40
ecuación (125a)). Aquí, m es un número entero que satisface 1 < m < M, c representa la velocidad del sonido y j es
una unidad imaginaria. En el sistema de coordenadas espaciales, v^e,D('£> representa un vector de posición de una posición que es una imagen espejo de una posición (e, D) con respecto a la superficie reflectora de un reflector de orden £ , u^m representa el vector de posición del micrófono de orden m, el símbolo el símbolo |||| representa una
norma, y f(||v^e,D('£> - u^m|| es una función que representa una distancia de descomposición de una onda de
sonido. Por ejemplo, f(||v^e,D('£> -u^m||) es una función que representa una descomposición de distancia de una
onda de sonido. Por ejemplo, f(||v^e,D('£> -u^m||) = 1/||v^e,D('£> -u^m|| y en este caso la ecuación (126a) se puede escribir como la ecuación (126b).
Obsérvese que una diferencia de tiempo de llegada de orden £ T (e, D) y vector de posición v^e,D('£> se pueden calcular teóricamente sobre la base de la relación de posición entre la posición (e, D), la agrupación de micrófonos y el objeto reflector de orden £ cuando se determina la relación de posición.
A diferencia de las técnicas convencionales, la técnica de realce de punto de sonido de la presente invención tiene en cuenta positivamente los sonidos reflejados y, por lo tanto, es capaz de un realce de punto de sonido directivo agudo. Esto se describirá tomando dos fuentes de sonido a modo de ejemplo. Es difícil el realce de puntos de los sonidos que emanan de dos fuentes de sonido A y B a diferentes distancias de una agrupación de micrófonos pero en aproximadamente las mismas direcciones vistas desde la agrupación de micrófonos como se ilustra en la Fig. 18A solamente de sonidos directos de las dos fuentes de sonido por la siguiente razón. Dado el hecho de que e[A] ~ e[B] y D[a] ^ D[b], hay una diferencia entre un valor de función de descomposición f(||v^e[A], D[A](d) - u^m||) que aparece en el vector de dirección h^d (w, e[A], D[a]) de un sonido directo correspondiente a la posición (e[A], D[a]) de la fuente de sonido A y un valor de función de descomposición f(||v^e[B], D[B](d) - u^m||) que aparece en el vector de dirección h^d (w, eP], D[b]) de un sonido directo correspondiente a la posición (0P], D[b]) de la fuente de sonido B como función de la distancia desde la agrupación de micrófonos. Sin embargo, en realidad, la distinción entre la intensidad de una señal de fuente (volumen de sonido) y su valor de función de descomposición no se puede hacer a partir de la intensidad de un sonido (volumen de sonido) captado con la agrupación de micrófonos. Es decir, si a^conv(w, e, D) = h^d(w, 0, D) como en la técnica convencional, las funciones de transferencia de sonidos directos no son suficientes como indicación para diferenciar entre las distancias de fuentes de sonido en aproximadamente las mismas direcciones y, por lo tanto, es difícil diseñar filtros capaces de realce de punto, como es evidente a partir de las ecuaciones (109), (110a) y (110b).
Por el contrario, la técnica de realce de punto de sonido de la presente invención tiene en cuenta positivamente los sonidos reflejados, por lo tanto existen fuentes de sonido virtuales A(£ ) y B(£ ) de sonidos reflejados de orden £ en posiciones de imágenes espejo de las fuentes de sonido A y B con respecto a la superficie reflectora del reflector 300 de orden £ desde el punto de vista de la agrupación de micrófonos como se ilustra en la Fig. 18B. Esto es equivalente a que los sonidos que emanan de las fuentes de sonido A y B y que se reflejan en el reflector 300 de orden £ vienen desde las fuentes de sonido virtuales A(£ ) y B(£ ). Hay una diferencia significativa entre el sonido
reflejado de orden £ desde la fuente de sonido virtual A(£ ) y el sonido reflejado de orden £ desde la fuente de
sonido virtual B(£ ) en el vector de posición V^e^(^D^(^ y ^ y en la diferencia de tiempo
de llegada T (0[a], D[a]) y T (0[b], D[b]). Las funciones de transferencia a^(W[A], 0[a], D[a]) y a^(wP], 0[b], D[b]) que
corresponden a las posiciones (0[A], D[a]) y (0[B], D[b]), respectivamente, se pueden dar por las ecuaciones (127a) y (127b), respectivamente. La presencia del segundo término de las ecuaciones (127a) y (127b) proporciona una diferencia significativa entre funciones de transferencia correspondientes a diferentes posiciones a pesar de que 0[A] ~ 0[b]. Extrayendo la diferencia entre las funciones de transferencia mediante el método de conformación de haces, se puede realizar el realce de punto de los sonidos según las posiciones de las fuentes de sonido asumidas.
Hasta ahora, la distancia Dh se ha fijado con el fin de explicar qué tan alta directividad se puede lograr. Por consiguiente, las matrices de correlación espacial Q(u>) se han escrito como (110a) y (110b). Sin embargo, teniendo 5 en cuenta la correlación entre las funciones de transferencia de M canales para diferentes distancias D5 (8= 1, 2, ..., G), la cantidad de información que se refiere a un campo de sonido se puede aumentar para construir una matriz de correlación espacial que proporciona filtros más precisos La matriz de correlación espacial Q(u>) se puede dar por la
5
10
15
20
25
30
35
ecuación (110c). Un conjunto al que pertenecen los índices O de direcciones 9$ se denota por O (|0| = P) y un conjunto al que pertenecen los índices 8 de distancias D5 se denota por A (|A|) = G).
Q(®) = ZZ á(íB,^,Dí)aH(®>^,Dí) (110c)
Entonces, usando la matriz de correlación espacial Q(u>) dada por la ecuación (110c), un filtro W^(w, 9s, Dh) diseñado mediante el método de respuesta sin distorsión de varianza mínima (MVDR) se puede escribir como la ecuación (109a) en lugar de la ecuación (109).
Como se ha descrito, la esencia de la técnica de realce de punto de sonido de la presente invención es que la función de transferencia a^(u>, 9, D) = [a-i(u>, 9, D), ..., aM(w, 9, D)]T se representa mediante la suma del vector de dirección de un sonido directo y los vectores de dirección de S sonidos reflejados. Dado que esto no afecta al concepto de diseño de filtro, los filtros W^(u>, 9s, Dh) se pueden diseñar mediante un método distinto del método de respuesta sin distorsión de varianza mínima (MVDR).
Se describirán métodos distintos del método MVDR descrito anteriormente. Son: <1> un método de diseño de filtro basado en el criterio de maximización de SNR, <2> un método de diseño de filtro basado en inversión de potencia, <3> un método de diseño de filtro que usa MVDR con uno o más puntos de supresión (direcciones en las que se suprime la ganancia de ruido) como una condición de restricción, <4> un método de diseño de filtro que usa la conformación de haces de retardo y suma, <5> un método de diseño de filtro que usa el método de máxima verosimilitud y <6> un método de diseño de filtro que usa el método de agrupación adaptativa de micrófonos para reducción de ruido (AMNOR). Para <1> el método de diseño de filtro basado en el criterio de maximización de SNR y <2> el método de diseño de filtro basado en la inversión de potencia, se hace referencia a la Referencia 2 enumerada a continuación. Para <3> el método de diseño de filtro que usa MVDR con uno o más puntos de supresión (direcciones en las que se suprime la ganancia de ruido) como condición de restricción, se hace referencia a la Referencia 3 enumerada a continuación. Para <6> el método de diseño de filtro que usa el método de agrupación adaptativa de micrófonos para reducción de ruido (AMNOR), se hace referencia a la Referencia 4 enumerada a continuación.
<1> Método de diseño de filtro basado en el criterio de maximización de SNR
En el método de diseño de filtro basado en el criterio de maximización de SNR, se determina un filtro W^(w, 9s, Dh) sobre la base de un criterio de maximización de la relación SN (SNR) de una posición (9s, Dh). La matriz de correlación espacial para un sonido desde la posición (9s, Dh) se denota por Rss(w) y una matriz de correlación espacial para un sonido de una posición distinta de la posición (9s, Dh) se denota por Rnn(w). Entonces la SNR se puede dar por la ecuación (128). Aquí, Rss(w) se puede dar por la ecuación (129) y Rnn(w) se puede dar por la ecuación (130). Las funciones de transferencia a^(w, 9s, Dh) = [a-i(u>, 9s, Dh), ..., aM(w, 9s, Dh)]T se pueden dar por la ecuación (125), por ejemplo (para ser precisos, la ecuación (125) donde 9 se sustituye por 9s y D se sustituye por Dh). Un conjunto al que pertenecen los índices O de direcciones 9$ se denota por O (|O| = P) y un conjunto al que pertenecen los índices 8 de distancias D5 se denota por A (|A|) = G).
El filtro W^(u>, 9s, Dh) que maximiza la SNR de la ecuación (128) se puede obtener estableciendo el gradiente relacionado con el filtro W^(w, 9s, Dh) a cero, es decir, por la ecuación (131).
5
10
15
20
25
30
donde
Vwo.a.d,)!51®^0 <13i>
De esta manera, el filtro W^(u>, 0s, Dh) que maximiza la SNR de la ecuación (128) se puede dar por la ecuación (132):
La ecuación (132) incluye la matriz inversa de la matriz de correlación espacial Rnn(w) de un sonido de una posición distinta de la posición (0s, Dh). Es conocido que la matriz inversa de Rnn(w) se puede sustituir con la matriz inversa de una matriz de correlación espacial Rxx(w) de una entrada completa que incluye sonidos de (1) la posición (0s, Dh) y (2) sonidos de una posición distinta de la dirección (0s, Dh). Aquí, Rxx(w) = Rss(w) + Rnn(w) = Q(w). Es decir, el filtro W^(w, 0s, Dh) que maximiza la SNR de la ecuación (128) se puede obtener por la ecuación (133):
<2> Método de diseño de filtro basado en inversión de potencia
En el método de diseño de filtro basado en inversión de potencia, un filtro W^(w, 0s, Dh) se determina sobre la base de un criterio de minimización de la potencia de salida promedio de un conformador de haces mientras que un coeficiente de filtro para un micrófono se fija a un valor constante. Aquí, se describirá un ejemplo donde se fija el coeficiente de filtro para el primer micrófono entre M micrófonos. En este método de diseño, se diseña un filtro W^(w, 0s, Dh) que minimiza la potencia de sonidos de todas las posiciones (todas las posiciones que se puede suponer que son posiciones de fuente de sonido)) usando una matriz de correlación espacial Rxx(w) (véase la ecuación (134)) bajo la condición de restricción de la ecuación (135). Las funciones de transferencia a^(w, 0s, dh) = [a-i(u>, 0s, Dh), ..., aM(w, 0s, Dh)]T se pueden dar por la ecuación (125), por ejemplo (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0s y D se sustituye por Dh).
min (WH(¿y, <9S} Dh )Rxx (ícj)W(&>, #s, Dh)) (134)
«'to/ÍAJ
WH(fi>,0s,Dh)G = GhR¿(í»)G (135)
donde
Es conocido que el filtro W^(w, 0s, Dh) que es una solución óptima de la ecuación (134) se puede dar por la ecuación (136) (véase la Referencia 2 enumerada a continuación).
<3> Método de diseño de filtro que usa MVDR con uno o más puntos de supresión como condición de restricción
En el método MVDR descrito anteriormente, un filtro W^(u>, 0s, Dh) se ha diseñado bajo la condición de restricción única de que se obtiene un filtro que minimiza la potencia de salida promedio de un conformador de haces dada por la ecuación (107) (es decir, la potencia de ruido que es sonidos de direcciones distintas de una posición (0s, Dh) bajo la condición de restricción de que el filtro pasa sonidos desde una posición (0s, Dh) en todas las bandas de frecuencia como se expresa por la ecuación (108). Según el método, la potencia de ruido se puede suprimir de
10
15
20
25
30
35
40
manera general. Sin embargo, el método no es necesariamente preferible si se conoce previamente que hay una fuente o fuentes de ruido que tienen una potencia fuerte en una o más direcciones particulares. Si este es el caso, se requiere un filtro que suprima fuertemente una o más direcciones conocidas particulares (es decir, puntos de supresión) en las que existe la fuente o fuentes de ruido. Por lo tanto, el método de diseño de filtro descrito aquí obtiene un filtro que minimiza la potencia de salida promedio del conformador de haces dada por la ecuación (107) (es decir, minimiza la potencia de salida promedio de sonidos de direcciones distintas de una posición (0s, Dh) y los puntos de supresión) bajo las condiciones de restricción que (1) el filtro pasa sonidos desde la posición (0s, Dh) en todas las bandas de frecuencia y que (2) el filtro suprime sonidos de B puntos de supresión conocidos (0ni, Dgi), (0N2, Dg2), ..., (0nb, Dgb). (B es un número entero predeterminado mayor o igual a 1) en todas las bandas de frecuencia. Permitamos que un conjunto de índices Ó de direcciones desde las cuales llega ruido sean denotadas por {1, 2, ..., P}, entonces Nj e {1, 2, ..., P} (donde j e {1, 2,. .., B}) y B < P - 1, como se ha descrito anteriormente. Permitamos que un conjunto de índices 8 de distancias a fuentes de sonido sean denotados por {1, 2, ..., G}, entonces Gj e {1, 2, ..., G} (dondej e {1, 2, .. ., B}) y B < G-1.
Permitamos que a^(w, 0i, Dg) = [ai(w, 0i, Dg), ..., aM(w, 0i, Dg)]T sean funciones de transferencia entre una fuente de sonido que se supone que está situada en una posición (0i, Dg) y los M micrófonos a una frecuencia w, en otras palabras, funciones de transferencia de un sonido desde una posición (0i, Dg) a una frecuencia w que llega a los micrófonos de una agrupación de micrófonos, entonces se puede dar una condición de restricción por la ecuación (137). Aquí, para los índices i y g, (i, g) e {(s, h), (N1, G1), (N2, G2), ..., (NB, GB)}, las funciones de transferencia a^(w, 0i, Dg) = [ai(w, 0i, Dg), ..., aM(w, 0i, Dg)]T se pueden dar por la ecuación (125) (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0i y D se sustituye por Dh), y fi,g(w) representa una característica de paso a frecuencia w para una posición (0i, Dg).
WH (¿y, 0S, Dh )a(®, 0¡,Dg) = fig (co)
(i, g) e {(s, h), (NI, Gl), (N2, G 2), - “, (NB, GB)} (137)
La ecuación (137) se puede representar como una matriz, por ejemplo, escrita como la ecuación (138). Aquí, A^(w, 0s, Dh) = [([a^ (w, 0s, Dh), a^ (w, 0N1, Dgi), ..., a^ (w), 0nb, DgB)].
WH(®^s,Dh)A(íy,0s,Dh) = F (138)
donde
Teniendo en consideración las condiciones de restricción que (1) el filtro pasa sonidos de la posición (0s, Dh) en todas las bandas de frecuencia y que (2) el filtro suprime sonidos de B puntos de supresión conocidos (0ni, Dgi), (0N2, Dg2), .., (0nb, Dgb), en todas las bandas de frecuencia, se debería establecer idealmente fs,h(w) = 1,0 y fi,g(w) = 0,0 ((i, g) e {(N1, G1), (N2, G2), ..., (NB, GB)}. Esto significa que el filtro pasa completamente sonidos en todas las bandas de frecuencia desde la posición (0s, Dh) y bloquea completamente sonidos en todas las bandas de frecuencia de B puntos de supresión conocidos (0ni, Dgi), (0n2, Dg2), ..., (0nb, Dgb), En realidad, sin embargo, es difícil en algunas situaciones efectuar tal control como que pasan completamente todas las bandas de frecuencia o que se bloquean completamente todas las bandas de frecuencia. En tal caso, el valor absoluto de fs,h(w) se establece en un valor cercano a 1,0 y el valor absoluto de fi,g(w) ((i, g) e {(N1, G1), (N2, G2), ..., (NB, GB)} se establece en un valor cercano a 0,0. Por supuesto, fi,g_i(w) y fj,g_j(w) (i ^j; i y j e {N1, N2, ..., NB}) pueden ser iguales o diferentes.
Según el método de diseño de filtro descrito aquí, el filtro W^(w, 0s, Dh) que es una solución óptima de la ecuación (107) bajo la condición de restricción dada por la ecuación (138) se puede dar por la ecuación (139) (véase la Referencia 3 enumerada a continuación). Mientras que se ha usado una matriz de correlación espacial Q(w) que se puede dar por la ecuación (110c), se puede usar una matriz de correlación espacial dada por la ecuación (110a) o (110b).
<4> Método de diseño de filtro que usa conformación de haces de retardo y suma
Suponiendo que los sonidos directos y reflejados que llegan son ondas planas, entonces un filtro W^(w, 0s, Dh) se puede dar por la ecuación (140) según la conformación de haces de retardo y suma. Es decir, el filtro W^(w, 0s, Dh) se puede obtener normalizando una función de transferencia a^(w, 0s, Dh). La función de transferencia a^(w, 0s, Dh) = [ai(w, 0s, Dh), ..., aM(w, 0s, Dh)]T se puede dar por la ecuación (125) (para ser precisos, por la ecuación (125)
donde 0 se sustituye por 0sy D se sustituye por Dh). El método de diseño de filtro no logra necesariamente una alta precisión de filtrado, sino que solamente requiere una pequeña cantidad de cálculo.
<5> Método de diseño de filtro que usa el método de máxima verosimilitud
5 Excluyendo la información espacial que se refiere a sonidos de una dirección del objetivo de una matriz de correlación espacial Q(w, Dh) en el método MVDR descrito anteriormente, se puede mejorar la flexibilidad de supresión de ruido y se puede suprimir aún más la potencia de ruido. Por lo tanto, en el método de diseño de filtro descrito aquí, la matriz de correlación espacial Q(w, Dh) se escribe como el segundo término del lado derecho de la ecuación (110a), es decir, la ecuación (1l0d). Un filtro W^(w, 0s, Dh) se puede dar por la ecuación (109) o (139). 10 Aquí, la matriz de correlación espacial incluida en las, ecuaciones (109) y (139) es una matriz de correlación espacial dada por la ecuación (110d).
Q(¿y,Dh) = Y ^,Op,Dh)aR(co,0p,Dh) (llOd)
pe{l, . ■
Alternativamente, la información espacial que se refiere a sonidos de la posición (0s, Dh) se puede excluir de la matriz de correlación espacial Q(w). En ese caso, una matriz de correlación espacial Q(u>) se da por la ecuación 15 (110e) en el método de diseño de filtro descrito aquí. Un filtro W^(u>, 0s, Dh) se puede dar por la ecuación (109) o
(139). Aquí, la matriz de correlación espacial incluida en las ecuaciones (109) y (139) se da por la ecuación (110e).
<6> Método de diseño de filtro que usa el método AMNOR
El método AMNOR obtiene un filtro que permite alguna cantidad de descomposición D de un sonido de una 20 dirección del objetivo mediante una solución de compromiso de la cantidad de descomposición D del sonido de la dirección del objetivo frente a la potencia del ruido restante en una señal de salida de filtro (por ejemplo, la cantidad de descomposición D se mantiene en un cierto umbral DA o menos) y, cuando se introduce una señal mezclada de [a] una señal producida aplicando funciones de transferencia entre una fuente de sonido y los micrófonos a una señal virtual (en lo sucesivo conocida como la señal virtual) de una dirección del objetivo y [b] ruido (obtenido 25 mediante observación con M micrófonos en un entorno ruidoso sin un sonido de la dirección del objetivo), emite una señal de salida de filtro que reproduce mejor la señal virtual en términos de error cuadrático mínimo (es decir, se minimiza la potencia de ruido contenido en una señal de salida de filtro).
El método de diseño de filtro descrito aquí incorpora el concepto de distancia en el método AMNOR y se puede considerar similar al método AMNOR. Específicamente, el método obtiene un filtro que permite alguna cantidad de 30 descomposición D de un sonido de una posición (0s, Dh) mediante una solución de compromiso de la cantidad de descomposición D del sonido de la posición (0s, Dh) frente a la potencia de ruido restante en una señal de salida de filtro (por ejemplo, la cantidad de descomposición D se mantiene en cierto umbral DA o menos) y, cuando se introduce una señal mezclada de [a] una señal producida aplicando funciones de transferencia entre una fuente de sonido y los micrófonos a una señal de objetivo virtual de una posición (0s, Dh) (en lo sucesivo conocida como la 35 señal de objetivo virtual) y [b] ruido (obtenido mediante observación con M micrófonos en un entorno ruidoso sin un sonido de la posición (0s, Dh)), emite una señal de salida de filtro que reproduce la mejor señal de objetivo virtual en términos de error cuadrático mínimo (es decir, se minimiza la potencia de ruido contenido en una señal de salida de filtro).
Según el método de diseño de filtro descrito aquí, un filtro W^(u>, 0s, Dh) se puede dar por la ecuación (141) como en 40 el método AMNOR (véase la Referencia 4 enumerada a continuación). Aquí, Rss(w) se puede dar por la ecuación (126) y Rnn(w) se puede dar por la ecuación (127). Las funciones de transferencia a^(u>, 0s, Dh) = [a-i(u>, 0s, Dh), ..., aM(w, 0s, Dh)]T se puede dar por la ecuación (125) (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0s y D se sustituye por Dh).
5
10
15
20
25
30
35
40
Ps es un coeficiente que asigna una ponderación al nivel de la señal de objetivo virtual y denominado el nivel de señal de objetivo virtual. El nivel de señal de objetivo virtual Ps es una constante que no es dependiente de las frecuencias. El nivel de señal de objetivo virtual Ps se puede determinar empíricamente o se puede determinar de modo que la diferencia entre la cantidad de descomposición D de un sonido desde la posición (0s, Dh) y el umbral DA está dentro de un margen de error predeterminado arbitrariamente. Se describirá este último caso. La respuesta en frecuencia F(w) del filtro W^(w, 0s, Dh) a un sonido de una posición (0s, Dh) se puede dar por la ecuación (142). Permitamos que la cantidad de descomposición D(Ps) cuando se usa el filtro W^(w, 0s, Dh) dado por la ecuación (141) sea denotada por D(Ps), entonces la cantidad de descomposición D(Ps) se puede definir por la ecuación (143). Aquí, wo representa el límite superior de la frecuencia w (típicamente, una frecuencia más alta adyacente a una frecuencia discreta w). La cantidad de descomposición D(Ps) es una función monótonamente decreciente de Ps. Por lo tanto, un nivel de señal de objetivo virtual Ps de manera que la diferencia entre la cantidad de descomposición D(Ps) y el umbral DA está dentro de un margen de error predeterminado arbitrariamente se puede obtener obteniendo repetidamente la cantidad de descomposición D(Ps) mientras que se cambia Ps con la monotonía de D(Ps).
<Variación>
En la descripción precedente, las matrices de correlación espacial Q(w), Rss(w) y Rnn(w) se expresan usando funciones de transferencia. Sin embargo, las matrices de correlación espacial Q(w), Rss(w) y Rnn(w) también se pueden expresar usando las señales en el dominio de frecuencia X^(w, k) descritas anteriormente. Mientras que la matriz de correlación espacial Q(w) se describirá a continuación, la siguiente descripción también se aplica a Rss(w) y Rnn(w). (Q(w) se puede sustituir por Rss(w) o Rnn(w)). La matriz de correlación espacial Rss(w) se puede obtener usando representaciones en el dominio de frecuencia de señales analógicas obtenidas mediante observación con una agrupación de micrófonos (que incluye M micrófonos) en un entorno donde solamente existen sonidos de una posición (0s, Dh). La matriz de correlación espacial Rnn(w) se puede obtener usando representaciones en el dominio de frecuencia de una señal analógica obtenida mediante observación con una agrupación de micrófonos (que incluye M micrófonos) en un entorno donde no existen sonidos de una posición (0s, Dh) (es decir, un entorno ruidoso).
La matriz de correlación espacial Q(w) que usa las señales en el dominio de frecuencia X^(w, k) = [X-i(w, k), ..., Xm(w, k)]T se puede dar por la ecuación (144). Aquí, el operador E [■] representa una operación de promediado estadístico. Cuando se ve una serie de tiempo discreta de una señal analógica recibida con una agrupación de micrófonos (que incluye M micrófonos) como un proceso estocástico, el operador E [■] representa una operación de valor de media aritmética (valor esperado) si el proceso estocástico es un denominado proceso estacionario en sentido amplio o un proceso estacionario de segundo orden. En este caso, la matriz de correlación espacial Q(w) se puede dar por la ecuación (145) usando las señales en el dominio de frecuencia X^(w, k - i) (i = 0, 1, ..., Q - 1) de un total de Q tramas actuales y pasadas almacenadas en una memoria, por ejemplo. Cuando i = 0, un trama de orden k es la trama actual. Obsérvese que la matriz de correlación espacial Q(w) dada por la ecuación (144) o (145) se puede recalcular para cada trama o se puede calcular en un intervalo regular o irregular, o se puede calcular antes de la implementación de una realización, que se describirá más tarde (especialmente cuando se usa Rss(w) o Rnn(w), la matriz de correlación espacial Q(w) se calcula preferiblemente de antemano usando señales en el dominio de frecuencia obtenidas antes de la implementación de la realización). Si la matriz de correlación espacial Q(w) se recalcula para cada trama, la matriz de correlación espacial Q(w) depende de las tramas actuales y pasadas y, por lo tanto, la matriz de correlación espacial se representará explícitamente como Q(w, k) como en las ecuaciones (144a) y (145a).
5
10
15
20
25
30
Si se usa la matriz de correlación espacial Q(w, k) representada por la ecuación (144a) o (145a), el filtro W^(u>, 0s, Dh) también depende de las tramas actuales y pasadas y, por lo tanto, se representa explícitamente como W^(w, 0s, Dh, k). Entonces, un filtro W^(w, 0s, Dh) representado por cualquiera de las ecuaciones (109), (132), (133), (136), (139) y (141) descritas con los métodos de diseño de filtro descritos anteriormente se reescribe como las ecuaciones (109m), (132m), (133m), (136m), (139m) o (141m).
(109m)
(132m)
(133tn)
(136m)
(139m)
(141m)
«Primera realización de la técnica de realce de punto de sonido»
Las Fig. 19 y 20 ilustran una configuración funcional y un flujo de proceso de una primera realización de una técnica de realce de punto de sonido de la presente invención. Un aparato 3 de realce de punto de sonido de la primera realización incluye un convertidor 610 AD, un generador 620 de tramas, una sección 630 de transformada en el dominio de frecuencia, una sección 640 de aplicación de filtro, una sección 650 de transformada en el dominio de tiempo, una sección 660 de diseño de filtro y almacenamiento 690.
[Paso S21]
La sección 660 de diseño de filtro calcula de antemano un filtro W^(u>, 0i, Dg) para cada frecuencia para cada una de las posibles posiciones discretas (0i, Dg) a partir de las cuales pueden llegar los sonidos a ser realzados. La sección 660 de diseño de filtro calcula los filtros W^(u>, 01, D1), ..., W^(w, 0i, D1), ..., W^(w, 0i, D1), ..., W^(u>, 01, D2), ..., W^(w, 0i, D2), ..., W^(w, 0i, D2), ..., W^(w, 01, Dg), ..., W^(w, 0i, Dg), ..., W^(w, 0i, Dg), ..., W^(w, 01, Dg), ..., W^(w, 0i, Dg), ..., W^(u>, 0i, Dg) (1 < i < I, 1 < g < G, we Q ; iy g son números enteros y Q es un conjunto de frecuencias w), donde I es el número total de direcciones discretas a partir de las cuales pueden llegar los sonidos a ser realzados (I es un número entero predeterminado mayor o igual a 1 y satisface I < P) y G es el número de las distancias discretas (G un número entero predeterminado mayor o igual a 1).
Para hacerlo así, las funciones de transferencia a^(w, 0i, Dg) = [a1(w, 0i, Dg), ..., aM(w, 0i, Dg)]T(1 < i < I, 1 < g < G,
ueQ) necesitan ser obtenidas excepto para el caso de <Variación> descrito anteriormente. Las funciones de transferencia a^(u>, 0i, Dg) = [a1(w, 0i, Dg), ..., aM(w, 0i, Dg)]T se pueden calcular prácticamente según la ecuación (125) (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0i y D se sustituye por Dg) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos y la información de entorno, tal como la relación de posición de un objeto reflector, tal como un reflector, suelo, paredes y techo a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y la reflectancia acústica del objeto reflector. Obsérvese que si se usa <3> el método de diseño de filtro que usa MVDR
5
10
15
20
25
30
35
40
45
50
con uno o más puntos de supresión como condición de restricción, los índices (i, g) de las direcciones usadas para calcular las funciones de transferencia a^(u, 0i, Dg) (1 < i < I, 1 < g < G, ueD ) cubren preferiblemente todos los índices (N1, G1), (N2, G2), ..., (NB, GB) de direcciones de al menos B posiciones de supresión. En otras palabras, los B índices N1, N2, ..., NB se establecen en cualquiera de diferentes números enteros mayores o iguales a 1 y menores o iguales a I y los B índices G1, G2, ..., GB se establecen en cualquiera de diferentes números enteros mayores o iguales a 1 y menores o iguales a G.
El número S de sonidos reflejados se establece en un número entero que satisface 1 < S .El número S no está limitado y se puede establecer en un valor adecuado según la capacidad de cálculo y otros factores.
Para calcular vectores de dirección, se pueden usar las ecuaciones (125a), (125b), (126a) o (126b), por ejemplo. Obsérvese que las funciones de transferencia obtenidas mediante mediciones reales en un entorno real, por ejemplo, se pueden usar para diseñar los filtros en lugar de usar la ecuación (125).
Entonces, W^(u, 0i, Dg) (1 < i < I, 1 < g < G) se obtiene según cualquiera de las ecuaciones (109), (109a), (132), (133), (136), (139), (140) y (141), por ejemplo, usando las funciones de transferencia a^(u, 0i, Dg), excepto para el caso descrito en <Variación>. Obsérvese que si se usa la ecuación (109), (109a), (133), (136) o (139), la matriz de correlación espacial Q(u) (o Rxx(u)) se puede calcular según la ecuación (110b), excepto para el caso descrito con respecto a <5> el método de diseño de filtro que usa el método de máxima verosimilitud. Si la ecuación (109), (109a), (133), (136) o (139) se usa según <5> el método de diseño de filtro que usa el método de máxima verosimilitud descrito anteriormente, la matriz de correlación espacial Q(u) (o Rxx(u)) se puede calcular según la ecuación (110c) o (110d). Si se usa la ecuación (132), la matriz de correlación espacial Rnn(u) se puede calcular según la ecuación (130). I x G x | Q filtros W^(u, 0i, Dg) (1 < i < I, 1 < g < G, uE Q) se almacenan en el almacenamiento 690, donde | Q | representa el número de elementos del conjunto Q.
[Paso S22]
Los M micrófonos 200-1, ..., 200-M que componen la agrupación de micrófonos se usan para captar sonidos, donde M es un número entero mayor o igual a 2.
No hay ninguna restricción en la disposición de los M micrófonos. Sin embargo, una disposición bidimensional o tridimensional de los M micrófonos tiene la ventaja de eliminar la incertidumbre de una dirección desde la cual llegan los sonidos a ser realzados. Es decir, una disposición plana o esférica de los micrófonos puede evitar el problema con una disposición lineal horizontal de los M micrófonos que un sonido que llega desde una dirección frontal no se pueda distinguir de un sonido que llega desde la derecha arriba, por ejemplo. Con el fin de proporcionar un intervalo amplio de direcciones que se pueden establecer como direcciones de captura de sonido, cada micrófono preferiblemente tiene una directividad capaz de captar sonidos con un cierto nivel de presión de sonido en direcciones de objetivo potenciales 0s que son direcciones de captura de sonido. Por consiguiente, son preferibles micrófonos que tienen una directividad relativamente débil, tales como micrófonos omnidireccionales o micrófonos unidireccionales.
[Paso S23]
El convertidor 610 AD convierte las señales analógicas (señales de captura) captadas con los M micrófonos 200-1, ..., 200-M en señales digitales x^(t) = [xft), ..., xM(t)]T, donde t representa el índice de un tiempo discreto.
[Paso S24]
El generador 620 de tramas toma las entradas de las señales digitales x^(t) = [xft), ..., xM(t)]T emitidas desde el convertidor 610 AD, almacena N muestras en un almacenador temporal sobre una base canal por canal, y emite señales digitales x^(k) = [x^-i(k), ..., x^M(k)]T en tramas, donde k es un índice de un número de tiempo de trama y x^m(k) = [xm((k - 1)N + 1), ..., xm(kN)] (1 < m < M). N depende de la frecuencia de muestreo y 512 es adecuada para muestrear a 16 kHz.
[Paso S25]
La sección 630 de transformada en el dominio de frecuencia transforma las señales digitales x^-(k) en tramas a señales en el dominio de frecuencia X^(u, k) = [Xfu, k), ..., Xm(u, k)]T y emite las señales en el dominio de frecuencia, donde u es el índice de una frecuencia discreta. Una forma de transformar una señal en el dominio de tiempo a una señal en el dominio de frecuencia es la transformada de Fourier discreta rápida. Sin embargo, la forma de transformar la señal no se limita a ésta. Se puede usar otro método para transformar a una señal en el dominio de frecuencia. La señal en el dominio de frecuencia X^(u, k) se emite para cada frecuencia u y trama k a la vez.
[Paso S26]
La sección 640 de aplicación de filtro aplica el filtro W^(u, 0s, Dh) correspondiente a una posición (0s, Dh) a ser realzada a la señal en el dominio de frecuencia X^(u, k) = [Xfu, k), ..., Xm(u, k)]T en cada trama k para cada
5
10
15
20
25
30
35
40
45
50
frecuencia w eQ y emite una señal de salida Y(w, k, 0s, Dh) (véase la ecuación (146)). Los índices s y h de la posición (0s, Dh) son s e {1, ..., I} y h e {1, ..., G} y el filtro W^(w, 0s, Dh) se almacena en el almacenamiento 690. Por lo tanto, la sección 640 de aplicación de filtro solamente tiene que recuperar el filtro W^(w, 0s, Dh) que corresponde a la posición (0s, Dh) a ser realzada del almacenamiento 690, por ejemplo, en el proceso en el paso S26. Si el índice s de la dirección 0s no pertenece al conjunto {1, ..., I} o el índice h de dirección Dh no pertenece al conjunto {1, ..., G}, es decir, el filtro W^(w, 0s, Dh) que corresponde a la posición (0s, Dh) no se ha calculado en el proceso en el paso S21, la sección 660 de diseño de filtro puede calcular en este momento el filtro W^(w, 0s, Dh) que corresponde a la posición (0s, Dh) o se puede usar el filtro W^(w, 0s’, Dh) o W^(w, 0s, Dh ) o W^(w, 0s’, Dh ) que corresponde a una dirección 0s’ cerca de la dirección 0s y/o una distancia Dh’ cerca de la distancia Dh.
Y(¿d, k, , Dh) - WH (co, 0S, Dh )X(&), k) (146)
[Paso S27]
La sección 650 de transformada en el dominio de tiempo transforma la señal de salida Y(w, k, 0s, Dh) de cada frecuencia w e q en un trama de orden k en un dominio de tiempo para obtener una señal y(k) de trama en el dominio de tiempo en la trama de orden k, entonces combina las señales y(k) en el dominio de tiempo de trama obtenidas en el orden del índice de número de tiempo de trama, y emite una señal y(t) en el dominio de tiempo en la que se realza el sonido de una posición (0s, Dh). El método para transformar una señal en el dominio de frecuencia en una señal en el dominio de tiempo es una transformada inversa de la transformada usada en el proceso en el paso S25 y puede ser una transformada de Fourier inversa discreta rápida, por ejemplo.
Mientras que la primera realización se ha descrito aquí en la que los filtros W^(w, 0i, Dg) se calculan de antemano en el proceso en el paso S21, la sección 660 de diseño de filtro puede calcular el filtro W^(w, 0s, Dh) para cada frecuencia después de que se determina la posición (0s, Dh), dependiendo de la capacidad de cálculo del aparato 3 de realce de punto de sonido.
«Segunda realización de la técnica de realce de punto de sonido»
Las Fig. 21 y 22 ilustran una configuración funcional y un flujo de proceso de la segunda realización de una técnica de realce de punto de sonido de la presente invención. Un aparato 4 de realce de punto de sonido de la segunda realización incluye un convertidor 610 AD, un generador 620 de tramas, una sección 630 de transformada en el dominio de frecuencia, una sección 640 de aplicación de filtro, una sección 650 de transformada en el dominio de tiempo, una sección 661 de cálculo de filtro y un almacenamiento 690.
[Paso S31]
M micrófonos 200-1, ..., 200-M que componen una agrupación de micrófonos se usan para captar sonidos, donde M es un número entero mayor o igual a 2. La disposición de los M micrófonos es como se describe en la primera realización.
[Paso S32]
El convertidor 610 AD convierte señales analógicas (señales de captura) captadas con los M micrófonos 200-1, ..., 200-M en señales digitales x^(t) = [x-i(t), ..., XM(t)]T, donde t representa el índice de un tiempo discreto.
[Paso S33]
El generador 620 de tramas toma las entradas de las señales digitales x^(t) = [x-i(t), ..., XM(t)]T emitidas desde el convertidor 610 AD, almacena N muestras en un almacenador temporal sobre una base canal por canal, y emite las señales digitales x^(k) = [x^-i(k), ..., x^M(k)]T en tramas, donde k es un índice de un número de tiempo de trama y x^m(k) = [xm((k - 1)N + 1), ..., Xm(kN)] (1 < m < M). N depende de la frecuencia de muestreo y 512 es adecuada para muestrear a 16 kHz.
[Paso S34]
La sección 630 de transformada en el dominio de frecuencia transforma las señales digitales x^(k) en tramas en señales en el dominio de frecuencia X^(w, k) = [X-i(w, k), ..., Xm(w, k)]T y emite las señales en el dominio de frecuencia, donde w es un índice de una frecuencia discreta. Una forma de transformar una señal en el dominio de tiempo en una señal en el dominio de frecuencia es una transformada de Fourier discreta rápida. Sin embargo, la forma de transformar la señal no está limitada a ésta. Se puede usar otro método para transformar a una señal en el dominio de frecuencia. La señal en el dominio de frecuencia X^(w, k) se emite para cada frecuencia w y trama k a la vez.
5
10
15
20
25
30
35
40
45
[Paso S35]
La sección 661 de cálculo de filtro calcula el filtro W^(w, 0s, Dh, k) (w eQ ; Q es un conjunto de frecuencias w) que corresponde a la posición (0s, Dh) a ser usado en un trama actual de orden k.
Para hacerlo así, necesitan ser proporcionadas las funciones de transferencia a^(w, 0s, Dh) = [ai(w, 0s, Dh), ...,
aM(w, 0s, Dh)]T (w eQ ). Las funciones de transferencia a^(w, 0s, Dh) = [ai(w, 0s, Dh), ..., aM(w, 0s, Dh)]T se pueden
calcular prácticamente según la ecuación (17a) (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0s y D se sustituye por Dh) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos y la información de entorno, tal como la relación de posición de un objeto reflector tal como un reflector, el suelo, las paredes o el techo a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y la reflectancia acústica del objeto reflector. Obsérvese que si se usa <3> el método de diseño de filtro que usa MVDR con uno o más puntos de supresión como condición de restricción, también necesitan ser obtenidas las funciones de transferencia a^(w, 0Nj, DGj) (1 < j < B, w eQ ). Las funciones de transferencia se pueden calcular prácticamente según la ecuación (125) (para ser precisos, por la ecuación (125) donde 0 se sustituye por 0Nj y D se sustituye por DGj) sobre la base de la disposición de los micrófonos en la agrupación de micrófonos y la información del entorno tal como la relación de posición de un objeto reflector, tal como un reflector, el suelo, una pared o el techo a la agrupación de micrófonos, la diferencia de tiempo de llegada entre un sonido directo y un sonido reflejado de orden £ (1 < £ < S ) y la reflectancia acústica del objeto reflector.
El número S de sonidos reflejados se establece en un número entero que satisface 1 < S . El número S no está limitado y se puede establecer en un valor adecuado según la capacidad de cálculo y otros factores.
Para calcular los vectores de dirección, se pueden usar la ecuación (125a), (125b), (126a) o (126b), por ejemplo. Obsérvese que las funciones de transferencia obtenidas mediante mediciones reales en un entorno real, por ejemplo, se pueden usar para diseñar los filtros en lugar de usar la ecuación (125).
Entonces, la sección 661 de cálculo de filtro calcula los filtros W^(w, 0s, Dh, k) (w eQ) según cualquiera de las ecuaciones (109m), (132m), (133m), (136m), (139m) y (141m) usando las funciones de transferencia a^(w, 0s, Dh) (w eQ) y, si se necesita, las funciones de transferencia a^(w, 0Nj, DGj) (1 < j < B, w eQ). Obsérvese que la matriz de correlación espacial Q(w) (o Rxx(w)) se puede calcular según la ecuación (144a) o (145a). En el cálculo de la matriz de correlación espacial Q(w), se usan las señales en el dominio de frecuencia X^(w, k - i) (i = 0, 1, ..., £ - 1) de un total de £ tramas actuales y pasadas almacenadas en el almacenamiento 690, por ejemplo.
[Paso S36]
La sección 640 de aplicación de filtro aplica el filtro W^(w, 0s, Dh, k) correspondiente a la dirección del objetivo 0s a ser realzada a la señal en el dominio de frecuencia X^(w, k) = [X1(w, k), ..., Xm(w, k)]Ten cada trama k para cada frecuencia weQ y emite una señal de salida Y(w, k, 0s, Dh) (véase la ecuación (147)).
Y(ú), k,#s,Dh) = WH (co, , Dh, k)X(co, k) Vffleí) (147)
[Paso S37]
La sección 650 de transformada en el dominio del tiempo transforma la señal de salida Y(w, k, 0s, Dh) de cada frecuencia weQ de un trama de orden k en un dominio de tiempo para obtener una señal y(k) de trama en el dominio de tiempo en la trama de orden k, entonces combina las señales y(k) en el dominio de tiempo de tramas obtenidas en el orden del índice de número de tiempo de trama, y emite una señal y(t) en el dominio de tiempo en la que se realza el sonido de la posición (0s, Dh). El método para transformar una señal en el dominio de frecuencia en una señal en el dominio de tiempo es una transformada inversa de la transformada usada en el proceso en el paso S34 y puede ser una transformada de Fourier inversa discreta rápida, por ejemplo.
Un filtro W^(w, 0i) que corresponde a una dirección 0i se puede calcular por ^ W^ (w, 0i, Dg) en la técnica
de realce de punto de sonido, donde pg [1 < g < G] es un factor de ponderación, que satisface preferiblemente ^ = 1 y preferiblemente 0 < pg [1 < g < G]. Obsérvese que el filtro W^(w, 0i, Dg) puede ser un filtro
representado usando funciones de transferencia medidas en un entorno real.
5
10
15
20
25
30
35
40
45
50
55
[Ejemplo experimental de técnica de realce de punto de sonido]
Se describirán los resultados de ejemplos experimentales sobre el realce de punto de sonido según la primera realización de la técnica de realce de punto de sonido de la presente invención (el método de respuesta sin distorsión de varianza mínima (MVDR) bajo una única condición de restricción). Los experimentos se dirigieron en el mismo entorno ilustrado en la Fig. 9. Como se ilustra en la Fig. 9, están dispuestos linealmente 24 micrófonos y está colocado un reflector 300 de modo que la dirección a lo largo de la cual los micrófonos en la agrupación de micrófonos lineales es normal al reflector 300. Si bien no hay ninguna restricción en la forma del reflector 300, se usó un reflector plano rígido semigrueso que tenía un tamaño de 1,0 m x 1,0 m. La distancia entre micrófonos adyacentes era 4 cm y la reflectancia a del reflector 300 era 0,8. Una fuente de sonido se situó en una dirección 0s de 45 grados a una distancia Dh de 1,13 m. La Fig. 23A muestra la directividad (en un dominio bidimensional) de un conformador de haces de varianza mínima obtenido como resultado del experimento donde no se colocó un reflector 300; la Fig. 23B muestra la directividad (en un dominio bidimensional) de un conformador de haces de varianza mínima obtenido como resultado del experimento donde se colocó un reflector 300. La presión de sonido [en dB] se representa como sombras, donde las regiones más blancas representan presiones más altas de los sonidos captados. Idealmente, si solamente la posición en una dirección de 45 grados a una distancia de 1,13 m es blanca y las otras regiones están más cerca de negras, se puede decir que se ha logrado un realce de punto de los sonidos deseados. La comparación entre los resultados experimentales en las Fig. 23A y 23B muestra que el realce de punto de los sonidos deseados no se puede lograr suficientemente sin un reflector 300 y el realce de punto de los sonidos deseados se puede lograr con un reflector 300.
<Aplicaciones de ejemplo>
Hablando en sentido figurado, la técnica de realce de punto de sonido es equivalente a la generación de una imagen clara a partir de una imagen difusa, borrosa y es útil para obtener información detallada acerca de un campo acústico. La siguiente es una descripción de ejemplos de servicios donde es útil la técnica de realce de punto de sonido de la presente invención.
Un primer ejemplo es la creación de contenidos que son combinación de audio y video. El uso de una realización de la técnica de realce de punto de sonido de la presente invención permite que el sonido del objetivo desde una gran distancia sea realzado claramente incluso en un entorno ruidoso con sonidos de ruido (sonidos distintos de los sonidos del objetivo). Por lo tanto, por ejemplo, sonidos en un área particular correspondiente a una imagen en movimiento acercada de un jugador de fútbol que dribla que se filmó desde el exterior del campo se pueden añadir a la imagen en movimiento.
Un segundo ejemplo es una aplicación para una videoconferencia (o una teleconferencia de audio). Cuando se mantiene una conferencia en una sala pequeña, la voz de un orador humano se puede realzar hasta un cierto grado con varios micrófonos según una técnica convencional. Sin embargo, en una sala de conferencias grande (por ejemplo, un espacio grande donde hay oradores humanos a una distancia de 5 m o más desde los micrófonos), es difícil realzar claramente la voz de un orador humano a una distancia con las técnicas convencionales mediante el método convencional y necesita ser colocado un micrófono enfrente a cada orador humano. Por el contrario, el uso de una realización de la técnica de realce de punto de sonido de la presente invención es capaz de realzar claramente sonidos de un área particular más alejada de un área particular y por lo tanto permite la construcción de un sistema de videoconferencia que es utilizable en una sala de conferencias grande sin tener que colocar un micrófono enfrente de cada orador humano. Además, dado que se pueden realzar los sonidos de un área en particular, se pueden relajar las restricciones en las ubicaciones de los participantes en la conferencia con respecto a las ubicaciones de los micrófonos.
Configuraciones de la implementación de la técnica de realce de sonido>
Las configuraciones ejemplares de implementaciones de las técnicas de realce de sonido de la presente invención se describirán a continuación con referencia a las Fig. 24 a 28. Si bien las agrupaciones de micrófonos en los ejemplos se representan como agrupaciones de micrófonos lineales, las agrupaciones de micrófonos no están limitadas a las configuraciones de agrupaciones de micrófonos lineales.
En una configuración ejemplar de una implementación ilustrada en las Fig. 24A, 24B y 24C, M micrófonos 200-1, ..., 200-M que componen una agrupación de micrófonos lineales están fijados a una placa 400 de soporte plana rectangular y en este estado el orificio de captura de sonido de cada micrófono está colocado en una superficie plana (en lo sucesivo conocida como la superficie de abertura) de la placa 400 de soporte (M = 13 en los ejemplos representados). Obsérvese que las líneas de cableado conectadas a los micrófonos 200-1, ..., 200-M no se representan. Un reflector 300 de placa plana rectangular está fijado en un borde de la placa 400 de soporte de tal manera que la dirección en la que están dispuestos los micrófonos 200-1, ..., 200-M es normal al reflector 300. La superficie de abertura de la placa 400 de soporte es un ángulo de 90 grados al reflector 300. En la configuración ejemplar ilustrada en las Fig. 24A, 24B y 24C, las propiedades preferibles del reflector 300 son las mismas que las del reflector descrito anteriormente. No hay restricciones sobre las propiedades de la placa 400 de soporte; es esencial solamente que la placa 400 de soporte sea lo suficientemente rígida para fijar firmemente los micrófonos 200-1, ..., 200-M.
5
10
15
20
25
30
35
40
45
50
55
60
En una configuración ejemplar ilustrada en la Fig. 25A, un eje 410 está fijado a un borde de la placa 400 de soporte y un reflector 300 está unido de manera giratoria al eje 410. En esta configuración ejemplar, se puede cambiar la colocación geométrica del reflector 300 en la agrupación de micrófonos.
En una configuración ejemplar ilustrada en la Fig. 25B, se añaden dos reflectores 310 y 320 adicionales a la configuración ilustrada en las Fig. 24A, 24B y 24C. Los dos reflectores 310 y 320 adicionales pueden tener las mismas propiedades que el reflector 300 o tener propiedades diferentes de las propiedades del reflector 300. El reflector 310 puede tener las mismas propiedades que el reflector 320 o tener propiedades diferentes de las propiedades del reflector 320. El reflector 300 se conoce en lo sucesivo como el reflector 300 fijo. Un eje 510 está fijado a un borde del reflector 300 fijo (el borde opuesto al borde del reflector 300 fijo que está fijado a la placa 400 de soporte) y el reflector 310 está unido de manera giratoria al eje 510. Un eje 520 está fijado a un borde de la placa 400 de soporte (el borde opuesto al borde de la placa 400 de soporte en la que está fijado el reflector 300 fijo) y el reflector 320 está unido de manera giratoria al eje 520. Los reflectores 310 y 320 se conocerán en lo sucesivo como reflectores 310 y 320 móviles. Cuando el reflector 310 móvil está colocado de modo que la superficie reflectora del reflector 310 móvil está al ras con la superficie reflectora del reflector 300 fijo en la configuración ilustrada en la Fig. 25B, la combinación del reflector 300 fijo y del reflector 310 móvil funciona como un reflector que tiene una superficie reflectora mayor que el reflector 300 fijo. Además, en la configuración ejemplar ilustrada en la Fig. 25B, cuando los reflectores 310 y 320 móviles se establecen en posiciones adecuadas, un sonido se puede reflejar repetidamente en un espacio encerrado por la placa 400 de soporte y los reflectores 300 fijos, los reflectores 310 y 320 móviles como se representa en la Fig. 26, por ejemplo, por ello, se puede controlar el número S de sonidos reflejados. Obsérvese que la placa 400 de soporte en la configuración ejemplar ilustrada en la Fig. 25B funciona como un objeto reflector y, por lo tanto, tiene preferiblemente las mismas propiedades que el objeto reflector descrito anteriormente.
Una configuración ejemplar de una implementación ilustrada en las Fig. 27A, 27B y 27C difiere de la configuración ejemplar ilustrada en las Fig. 24A, 24B y 24C en que una agrupación de micrófonos (una agrupación de micrófonos lineales en el ejemplo representado) también se proporciona en el reflector 300. Mientras que la dirección en la que están dispuestos los M micrófonos fijados a la placa 400 de soporte y la dirección en la que están dispuestos los M' micrófonos fijados al reflector 300 están en el mismo plano en la configuración ejemplar ilustrada en las Fig. 27A, 27B y 27C, los micrófonos no están limitados a esta disposición (M' = 13 en el ejemplo representado). Por ejemplo, los M' micrófonos pueden estar dispuestos y fijados al reflector 300 en la dirección ortogonal a la dirección en la que los M micrófonos están dispuestos y fijados a la placa 400 de soporte. En la configuración ejemplar ilustrada en las Fig. 27A, 27B y 27C, la combinación de la agrupación de micrófonos proporcionada en la placa 400 de soporte y el reflector 300 (el reflector 300 se usa como un objeto reflector sin usar la agrupación de micrófonos proporcionada en el reflector 300) se pueden usar para implementar la técnica de realce de sonido de la presente invención o la combinación de la placa 400 de soporte (la placa 400 de soporte se usa como objeto reflector sin usar la agrupación de micrófonos provista en la placa 400 de soporte) y la agrupación de micrófonos provista en el reflector 300 para implementar la técnica de realce de sonido de la presente invención.
En una configuración ejemplar extendida ilustrada en las Fig. 27A, 27B y 27C, se pueden añadir dos reflectores 310 y 320 adicionales a la configuración ejemplar ilustrada en las Fig. 27A, 27B y 27C como en la configuración ejemplar ilustrada en la Fig. 25B (véase la Fig. 28). Aunque no se representa, se puede proporcionar una agrupación de micrófonos en al menos uno de los reflectores 310 y 320 móviles. El orificio de captura de sonido de cada uno de los micrófonos de la agrupación de micrófonos proporcionada en el reflector 310 móvil se puede colocar en una superficie (la superficie de abertura) del reflector 310 móvil que es opuesta a la superficie de abertura de la placa 400 de soporte, por ejemplo. El orificio de captura de sonido de cada uno de los micrófonos de la agrupación de micrófonos proporcionada en el reflector 320 móvil se puede colocar en una superficie plana (la superficie de abertura) que puede formar el mismo plano que la superficie de abertura de la placa 400 de soporte, por ejemplo. Esta configuración ejemplar se puede usar de la misma forma que la configuración ejemplar ilustrada en la Fig. 25B. Además, en esta configuración ejemplar, cuando el reflector 320 móvil está colocado de modo que la superficie de abertura del reflector 320 móvil está al ras con la superficie de abertura de la placa 400 de soporte, la combinación de la placa 400 de soporte y el reflector 320 móvil funcionan como una agrupación de micrófonos más grande que la agrupación de micrófonos proporcionada en la placa 400 de soporte. Tanto la configuración ejemplar ilustrada en la Fig. 28 como la configuración ejemplar en la que se proporciona una agrupación de micrófonos al menos uno de los reflectores 310 y 320 móviles se puede usar de la misma forma que la configuración ejemplar ilustrada en la Fig. 26. En ambas de la configuración ejemplar ilustrada en la Fig. 28 y la configuración ejemplar en la que se proporciona una agrupación de micrófonos en al menos uno de los reflectores 310 y 320 móviles, los reflectores 310 y 320 móviles se pueden usar como objetos reflectores ordinarios y la agrupación de micrófonos proporcionada en la placa 400 de soporte y la agrupación de micrófonos proporcionada en el reflector 300 fijo se pueden usar como una agrupación combinada de micrófonos. Esto es equivalente a una configuración ejemplar que usa una agrupación de micrófonos compuesta por (M + M') micrófonos y dos objetos reflectores.
Si se proporciona una agrupación de micrófonos en el reflector 310 móvil, la agrupación de micrófonos se puede colocar en el reflector 310 móvil de modo que el orificio de captura de sonido de cada uno de los micrófonos de la agrupación de micrófonos proporcionada en el reflector 310 móvil está colocado en la superficie plana (la superficie de abertura) opuesta a la superficie plana del reflector 310 móvil que es opuesta a la superficie de abertura de la placa 400 de soporte. Si se proporciona una agrupación de micrófonos en el reflector 320 móvil, la agrupación de
5
10
15
20
25
30
35
40
45
50
55
micrófonos se puede colocar en el reflector 320 móvil de modo que el orificio de captura de sonido de cada uno de los micrófonos de la agrupación de micrófonos proporcionada en el reflector 320 móvil está colocado en la superficie plana (la superficie de abertura) opuesta a la superficie plana del reflector 320 móvil que puede formar el mismo plano que la superficie de abertura de la placa 400 de soporte. Por supuesto, se puede proporcionar una agrupación de micrófonos en al menos uno de los reflectores 310 y 320 móviles de modo que ambas superficies del reflector 310 y/o 320 móvil sean superficies de abertura.
[A] Si se proporciona una agrupación de micrófonos en al menos uno de los reflectores 310 y 320 móviles y, además, la superficie de abertura del reflector 310 móvil es una superficie plana opuesta a la superficie de abertura de la placa 400 de soporte o la superficie de abertura del reflector 320 móvil es una superficie plana que puede formar el mismo plano que la superficie de abertura de la placa 400 de soporte, colocar el reflector 310 móvil y/o el reflector 320 móvil de tal manera que la superficie de abertura del reflector 310 móvil y/o el reflector 320 móvil es invisible desde la dirección de la vista en la forma ilustrada en las Fig. 24A, 24B y 24C puede proporcionar el mismo efecto que aumentar el tamaño de la agrupación a través del uso de la agrupación de micrófonos proporcionada en el reflector 310 móvil y/o el reflector 320 móvil, aunque el tamaño de la agrupación aparente como se ve desde la dirección de la vista disminuye.
[B] Si se proporciona una agrupación de micrófonos en al menos uno de los reflectores 310 y 320 móviles y, además, la superficie de abertura del reflector 310 móvil es una superficie plana opuesta a la superficie opuesta a la superficie de abertura de la placa 400 de soporte o la superficie de abertura del reflector 320 móvil es una superficie plana opuesta a la superficie que puede formar el mismo plano que la superficie de abertura de la placa 400 de soporte, se puede proporcionar el mismo efecto que aumentar el tamaño de la agrupación en la forma ilustrada en las Fig. 24A, 24B y 24C, mientras que el tamaño de la agrupación aparente como se ve desde la dirección de la vista se mantiene igual.
Proporcionar una agrupación de micrófonos en ambas superficies de al menos uno de los reflectores 310 y 320 móviles de modo que ambas superficies del reflector 310 y/o 320 móvil sean superficies de abertura, puede proporcionar los mismos efectos que ambos de [A] y [B] .
<Referencias>
(Referencia 1) Simon Haykin, “Adaptive Filter Theory”, traducido por Hiroshi Suzuki et. al, primera edición, Kagaku Gijutsu Shuppann, 2001, páginas 66 - 73, 248 - 255
(Referencia 2) Nobuyoshi Kikuma, “Adaptive Antenna Technology”, Primera edición, Ohmsha, 2003, páginas 35-90, ISBN4-27403611-1
(Referencia 3) Futoshi Asano, “Array signal processing - sound source localization/tracking and separation”, editado por la Sociedad Acústica de Japón, serie de tecnología acústica 16, primera edición, Corona Publishing, páginas 8889, 259 -261, ISBN978-4-339-01116-6
(Referencia 4) Yutaka Kaneda, “Directivity characteristics of adaptative microphone-array for noise reduction (AMNOR)”, El Diario de la Sociedad Acústica de Japón, Vol. 44, N° 1, 1988, páginas 23 -30
<Configuración de hardware ejemplar de aparato de realce de sonido>
Un aparato de realce de sonido relacionado con las realizaciones descritas anteriormente incluye una sección de entrada a la cual se puede conectar un teclado y similares, una sección de salida a la que se puede conectar un visualizador de cristal líquido y similares, una CPU (Unidad de Procesamiento Central) (que puede incluir una memoria como memoria caché), memorias tales como una RAM (Memoria de Acceso Aleatorio) y una ROM (Memoria de Sólo Lectura), un almacenamiento externo, que es un disco duro, y un bus que interconecta la sección de entrada, la sección de salida, la CPU, la RAM, la ROM y el almacenamiento externo de tal manera que puedan intercambiar datos. Un dispositivo (unidad) capaz de leer y escribir datos en un medio de grabación tal como un CD- ROM se puede proporcionar en el aparato de realce de sonido según sea necesario. Una entidad física que incluye estos recursos de hardware puede ser un ordenador de propósito general.
Los programas para realzar sonidos en un intervalo estrecho y los datos requeridos para el procesamiento por los programas se almacenan en el almacenamiento externo del aparato de realce de sonido (el almacenamiento no está limitado a un almacenamiento externo; por ejemplo, los programas se pueden almacenar en un dispositivo de almacenamiento de sólo lectura tal como una ROM). Los datos obtenidos a través del procesamiento de los programas se almacenan en la RAM o en el dispositivo de almacenamiento externo según sea adecuado. Un dispositivo de almacenamiento que almacena datos y direcciones de sus ubicaciones de almacenamiento se conocerá en lo sucesivo simplemente como “almacenamiento”.
El almacenamiento del aparato de realce de sonido almacena un programa para obtener un filtro para cada frecuencia usando una matriz de correlación espacial, un programa para convertir una señal analógica en una señal digital, un programa para generar tramas, un programa para transformar una señal digital en cada trama a una señal en el dominio de frecuencia en el dominio de frecuencia, un programa para aplicar un filtro correspondiente a una
5
10
15
20
25
30
35
40
45
dirección o posición que es un objetivo de realce de sonido a una señal en el dominio de frecuencia en cada frecuencia para obtener una señal de salida, y un programa para transformar la salida única a una señal en el dominio de tiempo.
En el aparato de realce de sonido, los programas almacenados en el almacenamiento y los datos requeridos para el procesamiento de los programas se cargan en la RAM según sea necesario y se interpretan y ejecutan o procesan por la CPU. Como resultado, la CPU implementa funciones dadas (la sección de diseño de trama, el convertidor AD, el generador de tramas, la sección de transformación en el dominio de frecuencia, la sección de aplicación de filtro y la sección de transformación en el dominio de tiempo) para implementar el realce de sonido.
<Apéndice>
Los procesos descritos en las realizaciones se pueden realizar no solamente en una secuencia temporal como está escrita o se pueden realizar en paralelo unos con otros o individualmente, dependiendo del flujo máximo de los aparatos que realizan los procesos o requerimientos.
Si las funciones de procesamiento de cualquiera de las entidades de hardware (aparato de realce de sonido) descritas en las realizaciones se implementan mediante un ordenador, el procesamiento de las funciones que las entidades de hardware deberían incluir se describe en los programas. El programa se ejecuta en el ordenador para implementar las funciones de procesamiento de la entidad de hardware en el ordenador.
Los programas que describen el procesamiento pueden estar grabados en un medio de grabación legible por ordenador. El medio de grabación legible por ordenador puede ser cualquier medio de grabación tal como un dispositivo de grabación magnética, un disco óptico, un medio de grabación magnetoóptico y una memoria de semiconductores. Específicamente, por ejemplo, un dispositivo de disco duro, un disco flexible o una cinta magnética se pueden usar como dispositivo de grabación magnética, un DVD (Disco Versátil Digital), un DVD-RAM (Memoria de Acceso Aleatorio), un CD-ROM (Memoria de Sólo Lectura en Disco Compacto) o un CD-R (Grabable)/RW (Reescribible) se pueden usar como disco óptico, MO (disco magnetoóptico) se puede usar como medio de grabación magnetoóptico, y una EEP-ROM (Memoria de Sólo Lectura Borrable y Programable Electrónicamente) se puede usar como memoria de semiconductores.
El programa se distribuye vendiendo, transfiriendo o prestando un medio de grabación portátil en el que está grabado el programa, tal como un DVD o un CD-ROM. El programa puede estar almacenado en un dispositivo de almacenamiento de un ordenador servidor y ser transferido desde el ordenador servidor a otros ordenadores sobre una red, distribuyendo por ello el programa.
Un ordenador que ejecuta el programa primero almacena el programa grabado en un medio de grabación portátil o se transfiere desde un ordenador servidor a un dispositivo de almacenamiento del ordenador. Cuando el ordenador ejecuta los procesos, el ordenador lee el programa almacenado en el medio de grabación del ordenador y ejecuta los procesos según el programa leído. En otro modo de ejecución del programa, el ordenador puede leer el programa directamente de un medio de grabación portátil y ejecutar los procesos según el programa o puede ejecutar los procesos según el programa cada vez que se transfiere el programa desde el ordenador servidor al ordenador. Alternativamente, los procesos se pueden ejecutar usando un servicio denominado ASP (Proveedor de Servicios de Aplicaciones) en el que el programa no se transfiere desde un ordenador servidor al ordenador, sino que las funciones de proceso se implementan mediante instrucciones para ejecutar el programa y la adquisición de los resultados de la ejecución. Obsérvese que el programa en este modo abarca información que se proporciona para el procesamiento por un ordenador electrónico y es equivalente al programa (tal como datos que no son comandos directos a un ordenador pero que tienen la naturaleza que define el procesamiento del ordenador).
Mientras que las entidades de hardware están configuradas haciendo que un ordenador ejecute un programa predeterminado en las realizaciones descritas anteriormente, en al menos algunos de los procesos se pueden implementar por hardware.
Claims (29)
- 51015202530354045REIVINDICACIONES1. Un método de realce de sonido de obtención de una señal de salida en el dominio de frecuencia en el que un sonido de una posición deseada determinada por una dirección y una distancia se realza aplicando, para cada frecuencia, un filtro que realza el sonido de la posición deseada a señales en el dominio de la frecuencia transformadas a partir de M sonidos captados, captados con M micrófonos (200-1, ..., 200-M), donde M es un número entero mayor o igual a dos, en donde cada una de las funciones de transferencia a¡,g se obtiene mediante la suma de una función de transferencia de un sonido directo que viene de la posición determinada por la dirección i y la distancia g y llega directamente a los M micrófonos y una función de transferencia de uno o más sonidos reflejados cuyas descomposiciones debidas a la reflexión y diferencias de tiempo de llegada con respecto al sonido directo se corrigen, siendo el uno o más sonidos reflejados producidos por la reflexión del sonido directo fuera de un objeto reflector y llegando a los M micrófonos,comprendiendo el método:un paso de diseño de filtro para obtener uno o una pluralidad de filtros; yun paso (S26, S36) de aplicación de filtro de aplicación, para cada frecuencia, para una posición deseada que es un objetivo de un realce de sonido, de un filtro obtenido en el paso de diseño de filtro a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con los M micrófonos para obtener una señal de salida en el dominio de frecuencia en el que se realza un sonido de la posición deseada;en donde el paso (S21, S35) de diseño de filtro usa la función de transferencia ai,g de un sonido que viene de cada una de una o de una pluralidad de posiciones predeterminadas que se supone que son fuentes de sonido y llega a cada uno de los micrófonos para obtener, para cada frecuencia y para cada una o una pluralidad de posiciones predeterminadas, un filtro respectivo para la posición predeterminada respectiva como objetivo de un realce de sonido antes de captar los M sonidos captados con los M micrófonos (200-1, ..., 200-M), donde i denota una dirección y g denota una distancia para identificar cada una de las posiciones.
- 2. El método de realce de sonido según la reivindicación 1,en donde cada una de las funciones de transferencia ai,g se obtiene mediante medición en un entorno real.
- 3. El método de realce de sonido según la reivindicación 1 o 2,
en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de
minimización de la potencia de los sonidos de posiciones distintas de la posición que es el objetivo del realce desonido. - 4. El método de realce de sonido según la reivindicación 1 o 2,
en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio demaximización de la relación señal a ruido de un sonido de la posición que es el objetivo del realce de sonido. - 5. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de minimización de la potencia de los sonidos de posiciones distintas de la una o la pluralidad de posiciones que se supone que son posiciones de fuente de sonido mientras que un coeficiente de filtro para uno de los M micrófonos se fija a un valor constante.
- 6. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de minimización de la potencia de los sonidos de posiciones distintas de la posición que es el objetivo de realce de sonido y uno o más puntos de supresión cuyas direcciones en las que la ganancia de ruido se suprime en condiciones que (1) el filtro pasa sonidos en todas las bandas de frecuencia de la posición que es el objetivo de realce de sonido y que (2) el filtro suprime los sonidos en todas las bandas de frecuencia del uno o más puntos de supresión.
- 7. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro normaliza una función de transferencia as,h de un sonido de la posición en una dirección i = s a una distancia g = h que es el objetivo de realce de sonido para obtener el filtro W para cada frecuencia, como W = as,h /( as,hH as,h) donde H representa la transposición hemitiana.
- 8. El método de realce de sonido según la reivindicación 1 o 2,5101520253035404550en donde el paso de diseño de filtro usa una matriz de correlación espacial representada por las funciones de transferencia a¡,g correspondientes a las posiciones distintas de la posición que es el objetivo del realce de sonido para obtener el filtro para cada frecuencia.
- 9. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de minimización de la potencia de los sonidos de posiciones distintas de la posición que es el objetivo de realce de sonido bajo la condición de que el filtro reduce la descomposición de un sonido de la posición que es el objetivo del realce de sonido a una cantidad predeterminada o menos.
- 10. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro usa una matriz de correlación espacial representada por una señal en el dominio de frecuencia para obtener el filtro para cada frecuencia, siendo la señal en el dominio de frecuencia obtenida transformando una señal obtenida mediante observación con una agrupación de micrófonos a un dominio de frecuencia.
- 11. El método de realce de sonido según la reivindicación 1 o 2,en donde el paso de diseño de filtro usa una matriz de correlación espacial representada por las funciones de transferencia ai,g correspondientes a cada posición incluida en una o una pluralidad de posiciones que se supone que son posiciones de fuente de sonido para obtener el filtro para cada frecuencia
- 12. El método de realce de sonido según cualquiera de las reivindicaciones 1 a 11,en donde los M sonidos captados incluyen sonidos reflejados de uno o más objetos (300) reflectores colocados.
- 13. Un aparato de realce de sonido que obtiene una señal de salida en el dominio de frecuencia en el que un sonido de una posición deseada determinada por una dirección y una distancia se realza aplicando, para cada frecuencia, un filtro que realza el sonido de la posición deseada a las señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con M micrófonos (200-1, ..., 200-M), donde M es un número entero mayor o igual a dos, en donde cada una de las funciones de transferencia ai,g se obtiene mediante la suma de una función de transferencia de un sonido directo que viene de la posición determinada por la dirección i y la distancia g y llega directamente a los M micrófonos y una función de transferencia de uno o más sonidos reflejados cuyas descomposiciones debidas a reflexión y diferencias de tiempo de llegada con respecto al sonido directo se corrigen, siendo el uno o más sonidos reflejados producidos por la reflexión del sonido directo fuera de un objeto reflector y llegando a los M micrófonos,comprendiendo el aparato:una sección de diseño de filtro para obtener uno o una pluralidad de filtros; yuna sección (640) de aplicación de filtro aplicando, para cada frecuencia, para una posición deseada que es un objetivo de un realce de sonido, un filtro obtenido por la sección de diseño de filtro a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con los M micrófonos para obtener una señal de salida en el dominio de frecuencia en la que se realza un sonido de la posición deseada;en donde la sección (660, 661) de diseño de filtro usa la función de transferencia ai,g de un sonido que viene de cada una de una o una pluralidad de posiciones predeterminadas que se supone que son fuentes de sonido y llega a cada uno de los micrófonos para obtener, para cada frecuencia y para cada una de una o una pluralidad de posiciones predeterminadas, un filtro respectivo para la posición predeterminada respectiva como objetivo de un realce de sonido antes de la captación de los M sonidos captados con los M micrófonos (200-1, ..., 200-M), donde i denota una dirección y g denota una distancia para identificar cada una de las posiciones; yel objeto reflector existe en un entorno o está comprendido por el aparato de realce de sonido.
- 14. El aparato de realce de sonido según la reivindicación 13, comprendiendo además uno o más objetos (300) reflectores que proporcionan cada uno de los sonidos reflejados a los M micrófonos.
- 15. Un método de realce de sonido de obtención de una señal de salida en el dominio de frecuencia en el que un sonido de una dirección deseada se realza aplicando, para cada frecuencia, un filtro que realza el sonido de la dirección deseada a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con M micrófonos (200-1, ..., 200-M), donde M es un número entero mayor o igual a dos, en donde cada una de las funciones de transferencia a$ se obtiene mediante la suma de una función de transferencia de un sonido directo que viene de la dirección O y llega directamente a los M micrófonos y una función de transferencia de uno o más sonidos reflejados cuyas descomposiciones debidas a la reflexión y a diferencias de tiempo de llegada con respecto al sonido directo se corrigen, siendo el uno o más sonidos reflejados producidos por reflexión del sonido directo fuera de un objeto reflector y que llega a los M micrófonos,51015202530354045comprendiendo el método:un paso de diseño de filtro para obtener uno o una pluralidad de filtros; yun paso (S6, S16) de aplicación de filtro de aplicación, para cada frecuencia, para una dirección deseada que es un objetivo de un realce de sonido, de un filtro obtenido en el paso de diseño de filtro a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con los M micrófonos para obtener una señal de salida en el dominio de frecuencia en la que se realza un sonido de la dirección deseada;en donde el paso (S1, S15) de diseño de filtro usa la función de transferencia a$ de un sonido que viene de cada una de una o una pluralidad de direcciones predeterminadas O que se supone que son direcciones desde las cuales vienen los sonidos y llegan a cada uno de los micrófonos para obtener, para cada frecuencia y para cada una de una o una pluralidad de direcciones predeterminadas, un filtro respectivo para la dirección predeterminada respectiva como objetivo de un realce de sonido antes de la captación de los M sonidos captados con los M micrófonos (200-1, ..., 200-M).
- 16. El método de realce de sonido según la reivindicación 15,en donde cada una de las funciones de transferencia a$ se obtiene mediante medición en un entorno real.
- 17. El método de realce de sonido según la reivindicación 15 o 16,
en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de
minimización de la potencia de sonidos de direcciones distintas de la dirección que es el objetivo del realce desonido. - 18. El método de realce de sonido según la reivindicación 15 o 16,
en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio demaximización de la relación señal a ruido de un sonido de la dirección que es el objetivo del realce de sonido. - 19. El método de realce de sonido según la reivindicación 15 o 16,
en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio deminimización de la potencia de sonidos a partir de la una o la pluralidad de direcciones que se supone que sondirecciones desde las cuales vienen los sonidos, mientras que un coeficiente de filtro para uno de los M micrófonos se fija a un valor constante. - 20. El método de realce de sonido según la reivindicación 15 o 16,en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio deminimización de la potencia de sonidos de las direcciones distintas de la dirección que es el objetivo de realce desonido y una o más direcciones nulas en condiciones que (1) el filtro pasa sonidos en todas las bandas de frecuencia de la dirección que es el objetivo de realce de sonido y que (2) el filtro suprime sonidos en todas las bandas de frecuencia de la una o más direcciones nulas.
- 21. El método de realce de sonido según la reivindicación 15 o 16,en donde el paso de diseño de filtro normaliza una función de transferencia as de un sonido de la posición en la dirección O = s que es el objetivo de realce de sonido para obtener el filtro W para cada frecuencia, como W = as /( asH as) donde H representa la transposición hemitiana.
- 22. El método de realce de sonido según la reivindicación 15 o 16,en donde el paso de diseño de filtro usa una matriz de correlación espacial representada por las funciones de transferencia a$ correspondientes a las direcciones distintas de las direcciones que son el objetivo del realce de sonido para obtener el filtro para cada frecuencia.
- 23. El método de realce de sonido según la reivindicación 15 o 16,en donde el paso de diseño de filtro implica, para cada frecuencia, el diseño del filtro basado en el criterio de minimización de la potencia de los sonidos de direcciones distintas de la dirección que es el objetivo de realce de sonido bajo la condición de que el filtro reduzca la descomposición de un sonido de la dirección que es el objetivo del realce de sonido a una cantidad predeterminada o menos.
- 24. El método de realce de sonido según la reivindicación 15 o 16,en donde el paso de diseño de filtro usa una matriz de correlación espacial representada por una señal en el dominio de frecuencia para obtener el filtro para cada frecuencia, siendo la señal en el dominio de frecuencia obtenida51015202530transformando una señal obtenida mediante observación con una agrupación de micrófonos a un dominio de frecuencia.
- 25. El método de realce de sonido según la reivindicación 15 o 16,en donde los M sonidos captados incluyen sonidos reflejados de uno o más objetos (300) reflectores colocados.
- 26. Un aparato de realce de sonido que obtiene una señal de salida en el dominio de frecuencia en la que un sonido de una dirección deseada se realza aplicando, para cada frecuencia, un filtro que realza el sonido de la dirección deseada a las señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con M micrófonos (200-1, ..., 200-M), donde M es un número entero mayor o igual a dos, en donde cada una de las funciones de transferencia a$ se obtiene mediante la suma de una función de transferencia de un sonido directo que viene de la dirección O y llega directamente a los M micrófonos y una función de transferencia de uno o más sonidos reflejados cuyas descomposiciones debidas a la reflexión y a las diferencias de tiempo de llegada con respecto al sonido directo se corrigen, siendo el uno o más sonidos reflejados producidos por reflexión del sonido directo fuera de un objeto reflector y que llegan a los M micrófonos,comprendiendo el método:una sección de diseño de filtro para obtener uno o una pluralidad de filtros; yuna sección (240) de aplicación de filtro que aplica, para cada frecuencia, para una dirección deseada que es un objetivo de un realce de sonido, un filtro obtenido por la sección de diseño de filtro a señales en el dominio de frecuencia transformadas a partir de M sonidos captados, captados con los M micrófonos para obtener una señal de salida en el dominio de frecuencia en la que se realza un sonido de la dirección deseada;en donde la sección (260, 261) de diseño de filtro usa la función de transferencia a$ de un sonido que viene de cada una de una o una pluralidad de direcciones predeterminadas O que se supone que son direcciones desde las cuales vienen los sonidos y llegan a cada uno de los micrófonos para obtener, para cada frecuencia y para cada una de una o una pluralidad de direcciones predeterminadas, un filtro respectivo para la dirección predeterminada respectiva como objetivo de un realce de sonido antes de la captación de los M sonidos captados con los M micrófonos (200-1, ..., 200-M); yel objeto reflector existe en un entorno o está comprendido por el aparato de realce de sonido.
- 27. El aparato de realce de sonido según la reivindicación 26 comprendiendo además uno o más objetos (300) reflectores que proporcionan cada uno de los sonidos reflejados a los M micrófonos.
- 28. Un programa de ordenador que hace que un ordenador ejecute el procesamiento del método de realce de sonido según la reivindicación 1 o 15.
- 29. Un medio de grabación legible por ordenador que tiene grabado en el mismo un programa de ordenador para hacer que un ordenador ejecute los pasos del método de realce de sonido según la reivindicación 1 o 15.
Applications Claiming Priority (11)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2010285181 | 2010-12-21 | ||
| JP2010285175 | 2010-12-21 | ||
| JP2010285175 | 2010-12-21 | ||
| JP2010285181 | 2010-12-21 | ||
| JP2011025784 | 2011-02-09 | ||
| JP2011025784 | 2011-02-09 | ||
| JP2011190807 | 2011-09-01 | ||
| JP2011190807 | 2011-09-01 | ||
| JP2011190768 | 2011-09-01 | ||
| JP2011190768 | 2011-09-01 | ||
| PCT/JP2011/079978 WO2012086834A1 (ja) | 2010-12-21 | 2011-12-19 | 音声強調方法、装置、プログラム、記録媒体 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2670870T3 true ES2670870T3 (es) | 2018-06-01 |
Family
ID=46314097
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES11852100.4T Active ES2670870T3 (es) | 2010-12-21 | 2011-12-19 | Método de realce de sonido, dispositivo, programa y medio de grabación |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US9191738B2 (es) |
| EP (1) | EP2642768B1 (es) |
| JP (1) | JP5486694B2 (es) |
| CN (1) | CN103282961B (es) |
| ES (1) | ES2670870T3 (es) |
| WO (1) | WO2012086834A1 (es) |
Families Citing this family (48)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US9549253B2 (en) * | 2012-09-26 | 2017-01-17 | Foundation for Research and Technology—Hellas (FORTH) Institute of Computer Science (ICS) | Sound source localization and isolation apparatuses, methods and systems |
| US10175335B1 (en) | 2012-09-26 | 2019-01-08 | Foundation For Research And Technology-Hellas (Forth) | Direction of arrival (DOA) estimation apparatuses, methods, and systems |
| US10136239B1 (en) | 2012-09-26 | 2018-11-20 | Foundation For Research And Technology—Hellas (F.O.R.T.H.) | Capturing and reproducing spatial sound apparatuses, methods, and systems |
| US10149048B1 (en) | 2012-09-26 | 2018-12-04 | Foundation for Research and Technology—Hellas (F.O.R.T.H.) Institute of Computer Science (I.C.S.) | Direction of arrival estimation and sound source enhancement in the presence of a reflective surface apparatuses, methods, and systems |
| US9955277B1 (en) | 2012-09-26 | 2018-04-24 | Foundation For Research And Technology-Hellas (F.O.R.T.H.) Institute Of Computer Science (I.C.S.) | Spatial sound characterization apparatuses, methods and systems |
| US9554203B1 (en) | 2012-09-26 | 2017-01-24 | Foundation for Research and Technolgy—Hellas (FORTH) Institute of Computer Science (ICS) | Sound source characterization apparatuses, methods and systems |
| US20160210957A1 (en) | 2015-01-16 | 2016-07-21 | Foundation For Research And Technology - Hellas (Forth) | Foreground Signal Suppression Apparatuses, Methods, and Systems |
| JP5997007B2 (ja) * | 2012-10-31 | 2016-09-21 | 日本電信電話株式会社 | 音源位置推定装置 |
| US10867597B2 (en) | 2013-09-02 | 2020-12-15 | Microsoft Technology Licensing, Llc | Assignment of semantic labels to a sequence of words using neural network architectures |
| JP6125457B2 (ja) * | 2014-04-03 | 2017-05-10 | 日本電信電話株式会社 | 収音システム及び放音システム |
| KR101834913B1 (ko) * | 2014-04-30 | 2018-04-13 | 후아웨이 테크놀러지 컴퍼니 리미티드 | 복수의 입력 오디오 신호를 잔향제거하기 위한 신호 처리 장치, 방법 및 컴퓨터가 판독 가능한 저장매체 |
| JP6411780B2 (ja) * | 2014-06-09 | 2018-10-24 | ローム株式会社 | オーディオ信号処理回路、その方法、それを用いた電子機器 |
| US10127901B2 (en) * | 2014-06-13 | 2018-11-13 | Microsoft Technology Licensing, Llc | Hyper-structure recurrent neural networks for text-to-speech |
| TWI584657B (zh) * | 2014-08-20 | 2017-05-21 | 國立清華大學 | 一種立體聲場錄音以及重建的方法 |
| CN106716526B (zh) * | 2014-09-05 | 2021-04-13 | 交互数字麦迪逊专利控股公司 | 用于增强声源的方法和装置 |
| JP6294805B2 (ja) * | 2014-10-17 | 2018-03-14 | 日本電信電話株式会社 | 収音装置 |
| US10034088B2 (en) * | 2014-11-11 | 2018-07-24 | Sony Corporation | Sound processing device and sound processing method |
| CN107210029B (zh) * | 2014-12-11 | 2020-07-17 | 优博肖德Ug公司 | 用于处理一连串信号以进行复调音符辨识的方法和装置 |
| US9525934B2 (en) * | 2014-12-31 | 2016-12-20 | Stmicroelectronics Asia Pacific Pte Ltd. | Steering vector estimation for minimum variance distortionless response (MVDR) beamforming circuits, systems, and methods |
| TWI576834B (zh) * | 2015-03-02 | 2017-04-01 | 聯詠科技股份有限公司 | 聲頻訊號的雜訊偵測方法與裝置 |
| WO2016178231A1 (en) * | 2015-05-06 | 2016-11-10 | Bakish Idan | Method and system for acoustic source enhancement using acoustic sensor array |
| US9407989B1 (en) | 2015-06-30 | 2016-08-02 | Arthur Woodrow | Closed audio circuit |
| JP6131989B2 (ja) * | 2015-07-07 | 2017-05-24 | 沖電気工業株式会社 | 収音装置、プログラム及び方法 |
| JP2017102085A (ja) * | 2015-12-04 | 2017-06-08 | キヤノン株式会社 | 情報処理装置、情報処理方法及びプログラム |
| TWI596950B (zh) * | 2016-02-03 | 2017-08-21 | 美律實業股份有限公司 | 指向性錄音模組 |
| US9881619B2 (en) | 2016-03-25 | 2018-01-30 | Qualcomm Incorporated | Audio processing for an acoustical environment |
| JP6187626B1 (ja) * | 2016-03-29 | 2017-08-30 | 沖電気工業株式会社 | 収音装置及びプログラム |
| US10074012B2 (en) | 2016-06-17 | 2018-09-11 | Dolby Laboratories Licensing Corporation | Sound and video object tracking |
| US10097920B2 (en) * | 2017-01-13 | 2018-10-09 | Bose Corporation | Capturing wide-band audio using microphone arrays and passive directional acoustic elements |
| CN107017003B (zh) * | 2017-06-02 | 2020-07-10 | 厦门大学 | 一种麦克风阵列远场语音增强装置 |
| GB2565097B (en) | 2017-08-01 | 2022-02-23 | Xmos Ltd | Processing echoes received at a directional microphone unit |
| KR102053109B1 (ko) * | 2018-02-06 | 2019-12-06 | 주식회사 위스타 | 마이크 어레이를 이용한 지향성 빔포밍 방법 및 장치 |
| US11317200B2 (en) * | 2018-08-06 | 2022-04-26 | University Of Yamanashi | Sound source separation system, sound source position estimation system, sound source separation method, and sound source separation program |
| US10708702B2 (en) | 2018-08-29 | 2020-07-07 | Panasonic Intellectual Property Corporation Of America | Signal processing method and signal processing device |
| EP3847645B1 (en) * | 2018-09-25 | 2022-04-13 | Huawei Technologies Co., Ltd. | Determining a room response of a desired source in a reverberant environment |
| CN110503970B (zh) * | 2018-11-23 | 2021-11-23 | 腾讯科技(深圳)有限公司 | 一种音频数据处理方法、装置及存储介质 |
| CN110211601B (zh) * | 2019-05-21 | 2020-05-08 | 出门问问信息科技有限公司 | 一种空域滤波器参数矩阵的获取方法、装置及系统 |
| TWI866996B (zh) | 2019-06-26 | 2024-12-21 | 美商杜拜研究特許公司 | 具有改善頻率解析度的低延遲音訊濾波器組 |
| UA129473C2 (uk) | 2019-09-03 | 2025-05-07 | Долбі Лабораторіс Лайсензін Корпорейшн | Банк аудіофільтрів із декореляційними компонентами |
| CN110689900B (zh) * | 2019-09-29 | 2022-05-13 | 北京地平线机器人技术研发有限公司 | 信号增强方法和装置、计算机可读存储介质、电子设备 |
| US11082763B2 (en) * | 2019-12-18 | 2021-08-03 | The United States Of America, As Represented By The Secretary Of The Navy | Handheld acoustic hailing and disruption systems and methods |
| DE102020120426B3 (de) | 2020-08-03 | 2021-09-30 | Wincor Nixdorf International Gmbh | Selbstbedienung-Terminal und Verfahren |
| US11483647B2 (en) * | 2020-09-17 | 2022-10-25 | Bose Corporation | Systems and methods for adaptive beamforming |
| CN112599126B (zh) * | 2020-12-03 | 2022-05-27 | 海信视像科技股份有限公司 | 一种智能设备的唤醒方法、智能设备及计算设备 |
| WO2022173986A1 (en) | 2021-02-11 | 2022-08-18 | Nuance Communications, Inc. | Multi-channel speech compression system and method |
| CN113053376A (zh) * | 2021-03-17 | 2021-06-29 | 财团法人车辆研究测试中心 | 语音辨识装置 |
| CN113709653B (zh) * | 2021-08-25 | 2022-10-18 | 歌尔科技有限公司 | 定向定位听音方法、听力装置及介质 |
| CN115081241B (zh) * | 2022-07-18 | 2024-11-26 | 安徽理工大学 | 一种基于可靠度下多测点实测值的噪声源声功率反推方法 |
Family Cites Families (20)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4536887A (en) * | 1982-10-18 | 1985-08-20 | Nippon Telegraph & Telephone Public Corporation | Microphone-array apparatus and method for extracting desired signal |
| JPS5972295A (ja) * | 1982-10-18 | 1984-04-24 | Nippon Telegr & Teleph Corp <Ntt> | 多点受音装置 |
| JP2913105B2 (ja) * | 1989-03-10 | 1999-06-28 | 日本電信電話株式会社 | 音響信号検出方法 |
| DE69011709T2 (de) * | 1989-03-10 | 1994-12-15 | Nippon Telegraph & Telephone | Einrichtung zur Feststellung eines akustischen Signals. |
| US6473733B1 (en) * | 1999-12-01 | 2002-10-29 | Research In Motion Limited | Signal enhancement for voice coding |
| US6577966B2 (en) * | 2000-06-21 | 2003-06-10 | Siemens Corporate Research, Inc. | Optimal ratio estimator for multisensor systems |
| JP4815661B2 (ja) * | 2000-08-24 | 2011-11-16 | ソニー株式会社 | 信号処理装置及び信号処理方法 |
| US6738481B2 (en) * | 2001-01-10 | 2004-05-18 | Ericsson Inc. | Noise reduction apparatus and method |
| US6947570B2 (en) * | 2001-04-18 | 2005-09-20 | Phonak Ag | Method for analyzing an acoustical environment and a system to do so |
| US7502479B2 (en) * | 2001-04-18 | 2009-03-10 | Phonak Ag | Method for analyzing an acoustical environment and a system to do so |
| CA2354808A1 (en) * | 2001-08-07 | 2003-02-07 | King Tam | Sub-band adaptive signal processing in an oversampled filterbank |
| CA2354858A1 (en) * | 2001-08-08 | 2003-02-08 | Dspfactory Ltd. | Subband directional audio signal processing using an oversampled filterbank |
| JP2004279845A (ja) * | 2003-03-17 | 2004-10-07 | Univ Waseda | 信号分離方法およびその装置 |
| KR100959983B1 (ko) * | 2005-08-11 | 2010-05-27 | 아사히 가세이 가부시키가이샤 | 음원 분리 장치, 음성 인식 장치, 휴대 전화기, 음원 분리방법, 및, 프로그램 |
| CN1809105B (zh) * | 2006-01-13 | 2010-05-12 | 北京中星微电子有限公司 | 适用于小型移动通信设备的双麦克语音增强方法及系统 |
| US8363846B1 (en) * | 2007-03-09 | 2013-01-29 | National Semiconductor Corporation | Frequency domain signal processor for close talking differential microphone array |
| JP4455614B2 (ja) * | 2007-06-13 | 2010-04-21 | 株式会社東芝 | 音響信号処理方法及び装置 |
| JP5123595B2 (ja) * | 2007-07-31 | 2013-01-23 | 独立行政法人情報通信研究機構 | 近傍場音源分離プログラム、及びこのプログラムを記録したコンピュータ読取可能な記録媒体、並びに近傍場音源分離方法 |
| CN101192411B (zh) * | 2007-12-27 | 2010-06-02 | 北京中星微电子有限公司 | 大距离麦克风阵列噪声消除的方法和噪声消除系统 |
| KR101475864B1 (ko) * | 2008-11-13 | 2014-12-23 | 삼성전자 주식회사 | 잡음 제거 장치 및 잡음 제거 방법 |
-
2011
- 2011-12-19 WO PCT/JP2011/079978 patent/WO2012086834A1/ja not_active Ceased
- 2011-12-19 US US13/996,302 patent/US9191738B2/en active Active
- 2011-12-19 CN CN201180061060.9A patent/CN103282961B/zh active Active
- 2011-12-19 JP JP2012549909A patent/JP5486694B2/ja active Active
- 2011-12-19 ES ES11852100.4T patent/ES2670870T3/es active Active
- 2011-12-19 EP EP11852100.4A patent/EP2642768B1/en active Active
Also Published As
| Publication number | Publication date |
|---|---|
| EP2642768B1 (en) | 2018-03-14 |
| JPWO2012086834A1 (ja) | 2015-02-23 |
| EP2642768A1 (en) | 2013-09-25 |
| JP5486694B2 (ja) | 2014-05-07 |
| CN103282961B (zh) | 2015-07-15 |
| EP2642768A4 (en) | 2014-08-20 |
| US9191738B2 (en) | 2015-11-17 |
| US20130287225A1 (en) | 2013-10-31 |
| WO2012086834A1 (ja) | 2012-06-28 |
| CN103282961A (zh) | 2013-09-04 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2670870T3 (es) | Método de realce de sonido, dispositivo, programa y medio de grabación | |
| ES2525839T3 (es) | Adquisición de sonido mediante la extracción de información geométrica de estimativos de dirección de llegada | |
| ES2779198T3 (es) | Aparato y procedimiento para la adquisición espacialmente selectiva del sonido mediante triangulación acústica | |
| ES2922639T3 (es) | Método y dispositivo para la reproducción mejorada de campo sonoro de señales de entrada de audio codificadas espacialmente | |
| ES2502842T3 (es) | Método y aparato para mejorar la discriminación de ruido usando un factor de atenuación | |
| ES2758522T3 (es) | Aparato, procedimiento o programa informático para generar una descripción de campo de sonido | |
| US9641929B2 (en) | Audio signal processing method and apparatus and differential beamforming method and apparatus | |
| ES2472456T3 (es) | Método y dispositivo para decodificar una representación de un campo ac�stico de audio para reproducción de audio | |
| BR112016025767B1 (pt) | Sistema, aparelho e método para reprodução de cena acústica consistente baseada em funções adaptáveis | |
| CN111916094B (zh) | 音频信号处理方法、装置、设备及可读介质 | |
| Ahrens et al. | Spherical harmonic decomposition of a sound field based on observations along the equator of a rigid spherical scatterer | |
| JP6117142B2 (ja) | 変換装置 | |
| CN211529608U (zh) | 机器人及其语音识别装置 | |
| JP5486567B2 (ja) | 狭指向音声再生処理方法、装置、プログラム | |
| JP2013135373A (ja) | ズームマイク装置 | |
| US11120814B2 (en) | Multi-microphone signal enhancement | |
| JP2018148340A (ja) | 収音装置、及び収音方法 | |
| JP2015198411A (ja) | 変換装置 | |
| Chen et al. | An adaptive microphone array with local acoustic sensitivity | |
| Zhang et al. | Enhancing long-distance speech signals using PDMA speech enhancement system | |
| Götz et al. | Blind Direction-Dependent Acoustic Parameter Estimation Using Smart Glasses | |
| Nordholm et al. | Microphone array speech processing | |
| Helwani et al. | How to design a delay-and-sum beamformer for rigid rotationally symmetric arrays? | |
| Hafizovic et al. | Speech enhancement based on a simplified generalized sidelobe canceller structure | |
| WO2020011962A1 (en) | A microphone system |