ES2321518T3 - Procedimiento para analizar señales que contienen impulsos. - Google Patents

Procedimiento para analizar señales que contienen impulsos. Download PDF

Info

Publication number
ES2321518T3
ES2321518T3 ES04739023T ES04739023T ES2321518T3 ES 2321518 T3 ES2321518 T3 ES 2321518T3 ES 04739023 T ES04739023 T ES 04739023T ES 04739023 T ES04739023 T ES 04739023T ES 2321518 T3 ES2321518 T3 ES 2321518T3
Authority
ES
Spain
Prior art keywords
signal
vowel
procedure
analysis
oscillations
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES04739023T
Other languages
English (en)
Inventor
Frank Uldall Leonhard
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Individual
Original Assignee
Individual
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Individual filed Critical Individual
Application granted granted Critical
Publication of ES2321518T3 publication Critical patent/ES2321518T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/02Feature extraction for speech recognition; Selection of recognition unit

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Acoustics & Sound (AREA)
  • Signal Processing (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Emergency Protection Circuit Devices (AREA)
  • Control Of Electric Motors In General (AREA)
  • Protection Of Transformers (AREA)
  • Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)

Abstract

Procedimiento para analizar una señal de entrada que presenta un ancho de banda de frecuencias de entrada, comprendiendo el procedimiento: - proporcionar por lo menos una parte de ancho de banda de frecuencias limitada de la señal de entrada, - para cada una de dichas por lo menos unas partes de ancho de banda de frecuencias limitado de la señal de entrada, determinar las duraciones de un número predeterminado de semiciclos y magnitudes de señal de pico o de pico a pico durante el respectivo número predeterminado de semiciclos, representando un semiciclo el intervalo de tiempo entre dos picos consecutivos, y - proporcionar dichas magnitudes de señal en función de las duraciones del número predeterminado de semiciclos, para determinar de ese modo la distribución de dichas magnitudes de señal.

Description

Procedimiento para analizar señales que contienen impulsos.
Campo de la invención
La presente invención se refiere al análisis de las señales de impulsos, tales como las señales de voz, las señales fisiológicas en el cuerpo de una persona o un animal, tales como las señales nerviosas, y las señales de productos industriales, con el propósito de determinar una cualidad de las señales, como en el caso del reconocimiento de vocales en las señales de voz.
Antecedentes de la invención
Durante décadas, se ha supuesto que la base fundamental para evaluar la percepción auditiva era la transformada de Fourier de tiempo corto. Esto se ha debido a que la construcción de la cóclea apunta en esa dirección. No obstante, este supuesto ha dado lugar a varios fenómenos inexplicables, entre los cuales cabe citar el desconocimiento sobre la manera en que el oído humano percibe las vocales y, en general, la manera en que percibe las "imágenes" de so-
nido.
En un origen, el oído evolucionó como un sistema de alerta cuya función era la de alertar contra los enemigos que están al acecho, siendo comúnmente el motivo que conduce al estado de alerta el sonido de la rotura de pequeñas ramas. Dicho sonido es un impulso y puede tener una duración muy corta que no es adecuada para el análisis mediante la transformada de Fourier, ya que en dicho análisis se calcula el promedio de información contenida en el impulso durante todo el análisis. Asimismo, el espectro de frecuencias de una señal tiene un punto débil en la medida en que las frecuencias destacadas del espectro pueden proceder de diferentes fuentes que son imposibles de identificar. Esto plantea un problema importante en el análisis de las vocales en el reconocimiento de voz, ya que el ruido de fondo puede interpretarse como falsos formantes.
La transformada de Fourier es una herramienta matemática que elimina la dimensión del tiempo y, por consiguiente, no resulta adecuada por naturaleza para el análisis de los impulsos. Debido a la gran importancia de los impulsos, el comportamiento dinámico de la señal es muy importante, y entonces el procedimiento de análisis debe basarse en herramientas que reflejen el comportamiento físico de la cóclea. La presente invención ofrece un análisis en el tiempo y la frecuencia que simula el comportamiento del oído humano.
En la patente US nº 5.422.977, se da a conocer un procedimiento para generar una imagen de señal estabilizada a partir de una forma de onda. El procedimiento comprende la detección de picos en la forma de onda y, como respuesta a la detección de un pico, el muestreo de un segmento de tiempo prolongado de dicha forma de onda, y subsiguientemente la obtención de un resultado de totalización sumando una primera señal constituida por el segmento de tiempo prolongado de dicha forma de onda con una segunda señal que representa un resultado de totalización previo atenuado formado a partir de segmentos de tiempo prolongado anteriores de dicha forma de onda. Por esta razón, el resultado de totalización tiende hacia una forma constante y genera una imagen estabilizada de dicha forma de onda cuando dicha forma de onda es constante. Este procedimiento se basa en la suma totalizadora de fragmentos de señal que se prolongan en el tiempo a partir de un pico detectado. Por consiguiente, una forma de onda de la señal puede percibirse como una imagen "congelada" del frente de onda.
Aunque el procedimiento de la presente invención se diseñó inicialmente para el análisis de la voz, el procedimiento resulta también adecuado para otros propósitos. Así pues, los resultados del procedimiento de la presente invención pueden utilizarse para identificar sonido, vibración o voz, o para medir la calidad de productos cuando el sonido o la vibración ponen de manifiesto la calidad de los productos. El procedimiento de la presente invención también puede utilizarse en conexión con el reconocimiento de voz o la codificación y la decodificación de voz en telecomunicación de banda estrecha. En su aspecto más general, el resultado de la presente invención puede utilizarse para identificar o representar características que pueden ser percibidas por el oído de una persona o un animal, aunque no está limitado a dicho uso.
El análisis de oscilaciones es un análisis general que también puede utilizarse fuera del rango de frecuencias que puede percibir el oído de una persona o un animal, tal como el rango de las altas frecuencias de telecomunicación.
Sumario de la invención
La presente invención dispone un procedimiento según la reivindicación 1 para analizar una señal de entrada que presenta un ancho de banda de frecuencias de entrada. El procedimiento comprende la provisión de por lo menos una parte de ancho de banda de frecuencias limitado de la señal de entrada. Para cada parte de ancho de banda de frecuencias limitado de la señal de entrada, se determinan las duraciones de un número predeterminado de semiciclos y excursiones de señal durante los respectivos semiciclos. Basándose en las excursiones de señal y los correspondientes semiciclos, se determina una característica de la señal de entrada. Las excursiones de señal pueden determinarse como valores de pico a pico o como una excursión de señal entre dos ceros consecutivos de la parte de ancho de banda de frecuencias limitado sometida a rectificación de onda completa o media onda. La característica de señal determinada puede ser una vocal de una señal de voz o una señal fisiológica en el cuerpo de una persona o un animal (tal como una señal nerviosa) o una característica relacionada con el estado de un producto industrial. El procedimiento ofrece el reconocimiento de vocales independiente del hablante e incluso el reconocimiento de vocales susurradas.
Breve descripción de los dibujos
En los dibujos, se representa lo siguiente:
Figura 1: 50 ms de la vocal "æ:" como en "had", pronunciado por un hombre y una mujer;
figura 2: 10 ms (un impulso) de la vocal "æ:" (hombre) y la salida de cuatro canales auditivos;
figura 3: 10 ms (dos impulsos) de la vocal "æ:" (mujer) y la salida de cuatro canales auditivos;
figura 4: Aproximadamente 10 ms (dos impulsos) de la vocal "a:" (hombre) y la salida de cuatro canales auditivos;
figura 5: Aproximadamente 10 ms (dos impulsos) de la vocal "a:" (mujer) y la salida de cuatro canales auditivos;
figura 6: Análisis de las oscilaciones de la vocal "i:" pronunciada por una mujer;
figura 7: Análisis de las oscilaciones de la vocal "i:" pronunciada por un hombre;
figura 8: Análisis de las oscilaciones de la vocal "a:" pronunciada por una mujer;
figura 9: Análisis de las oscilaciones de la vocal "a:" pronunciada por un hombre;
figura 10: Análisis de las oscilaciones de la vocal "u:" pronunciada por una mujer;
figura 11: Análisis de las oscilaciones de la vocal "u:" pronunciada por un hombre;
figura 12: 10 ms (un impulso) de la vocal "æ:" (hombre) con 5 dB de ruido blanco añadido;
figura 13: Análisis de las oscilaciones de la vocal "æ:" sin ruido blanco;
figura 14: Análisis de las oscilaciones de la vocal "æ:" con 5 dB de ruido blanco añadido;
figura 15: 10 ms de la vocal "æ:" susurrada (hombre);
figura 16: Análisis de las oscilaciones de la vocal "æ:" susurrada y
figura 17: Diagrama de bloques del análisis APPA.
Descripción detallada de la invención
Típicamente, se genera un impulso cuando una fuerza abrupta golpea un sistema. Dicha fuerza puede tener origen en un fallo de una rueda de engranaje de una caja de engranajes u otro producto industrial, generándose un impulso cada vez que la parte anómala de la rueda se engrana, debido a la fuerza provocada por el fallo. Asimismo, dicha fuerza puede ser producto de la explosión por presión creada por las cuerdas vocales en la voz sonora. Se dice que la fuerza es abrupta porque la respuesta transitoria del sistema es muy importante y también porque a menudo es no lineal.
Mediante una transformada de Fourier, el dominio del tiempo se elimina y, por lo tanto, la transformada de Fourier no es muy conveniente para describir las condiciones dinámicas de las señales. Un procedimiento más adecuado consiste en dividir el intervalo de frecuencias auditivas en canales auditivos por medio de un banco de filtros o unos filtros pasabanda. Los filtros pasabanda con amplias bandas de frecuencias presentan una respuesta al impulso corta y, en consecuencia, una resolución temporal alta.
Durante muchos años se ha supuesto que la cóclea del oído estaba dividida en un grupo de canales de frecuencia auditiva, en los cuales se realizaba el análisis de la señal [Zwicker 1961]. Sin embargo, los procedimientos utilizados se centraban en el análisis de régimen cuasiestacionario en el dominio de la frecuencia, entre otros, para poder localizar los formantes en las señales de voz. En una excepción, descrita por F. Leonhard [Leonhard 1993] y [Leonhard 2002], se tienen en cuenta los cambios abruptos de energía, pero no se describe de una manera minuciosa cómo se percibe la imagen del sonido.
Idealmente, un impulso es la respuesta de un sistema a un impulso y contiene frecuencias propias amortiguadas, que pueden describirse con respecto a los polos de un sistema y que, realmente, constituyen un tipo de huella dactilar del sistema. El objetivo de un análisis de impulsos es obtener tanta información y tan precisa como sea posible a partir del impulso, tal como parece ser el caso de la percepción auditiva. En lo sucesivo, se centrará la atención en el análisis del "color" de la imagen del sonido o las vocales, que pueden considerarse "colores" especiales del sonido.
En la figura 1, se representan 50 ms de la vocal "æ:" como en la palabra "had" pronunciada por un hombre (señal superior) y una mujer (señal inferior). Como se observa la señal contiene frecuencias amortiguadas, lo cual resulta muy obvio en el caso del hombre. También se observa claramente que, en el hombre, el intervalo entre los impulsos es más o menos el doble que en la mujer.
Para obtener una alta resolución temporal, es necesario que los filtros pasabanda de los canales auditivos tengan bandas de frecuencias amplias. La figura 2 representa alrededor de 10 ms de la vocal "æ:" pronunciada por un hombre (un impulso) y la salida de cuatro canales auditivos. Un canal bajo en el rango de frecuencias es un canal de hasta 600 Hz y un canal del rango de 600 a 1400 Hz, y un canal alto en el rango de frecuencias es un canal de entre 1400 y 2800 Hz y un canal de entre 2000 y 4000 Hz. La vocal se presenta principalmente en el tercer canal.
La figura 3 representa alrededor de 10 ms (dos impulsos) de la vocal "æ:" pronunciada por una mujer y la salida de los cuatro canales auditivos. Comparada con la vocal pronunciada por el hombre, el período entre los impulsos es solo la mitad (alrededor de 5 ms para la mujer y 10 ms para el hombre). No obstante, el período de las oscilaciones en los canales medios es muy similar. Dicho de otro modo, la oscilación es independiente del período fundamental. La sensibilidad más alta del oído en el rango de frecuencias más altas se compensa con la ganancia de los cuatro canales. Si hay oscilaciones en el canal bajo, se obtiene un mejor volumen de la imagen del sonido.
En este contexto, se producen tres fenómenos de interés para los impulsos. El primero de ellos es la naturaleza de la oscilación (el período y la magnitud). El período de tiempo de las oscilaciones parece ser muy importante para la imagen del sonido. El segundo es la evolución de la energía instantánea en toda la duración del impulso. El tercero es el período de los impulsos. El período puede ser constante a lo largo de un intervalo de tiempo más largo o puede ser aleatorio. Tal vez resulte muy tentador realizar un análisis de frecuencias por medio de una transformada de Fourier para analizar las oscilaciones. Debe tenerse en cuenta, sin embargo, que las oscilaciones a menudo se componen de más de una frecuencia, hecho que afecta a su período de tiempo. Por consiguiente, un procedimiento más adecuado consistirá en medir el período de tiempo de las oscilaciones en un análisis de oscilaciones.
La figura 4 representa la voz y la salida de los cuatro canales para alrededor de 10 ms de la vocal "a:" como en la palabra "hod" pronunciada por un hombre. La vocal viene representada por las oscilaciones del segundo canal.
La figura 5 representa la vocal "a:" pronunciada por una mujer. Asimismo, se puede observar que la frecuencia fundamental de la voz femenina es alrededor del doble de la frecuencia fundamental de la voz masculina, aunque el período dominante de las oscilaciones del segundo canal es igual.
Las oscilaciones de los canales, especialmente de los tres canales superiores, son muy importantes para la identificación de las vocales. Como se observa en la figura 2, la salida de los canales es bastante periódica. Esto podría llevar a suponer que la oscilación solo consiste en una frecuencia. Sin embargo, los filtros pasabanda presentan bandas muy amplias (habitualmente de una o dos octavas) y el impulso es una respuesta transitoria. Esto significa que la oscilación a menudo está constituida por más de una frecuencia. En las vocales, habitualmente el segundo formante es el dominante, aunque está influido por otras frecuencias.
Durante un lapso de tiempo, se miden directamente las oscilaciones desde la parte superior hasta la parte inferior y desde la parte inferior hasta la parte superior, es decir, se miden los semiciclos o un número predeterminado de semiciclos. En ambos casos, los valores de pico a pico se miden y ordenan basándose en el período entre la parte superior y la parte inferior y el período entre la parte inferior y la parte superior, ya sea de forma continua o discreta (es decir, en un número de intervalos finitos también denominados "bins" (segmentos de tiempo)), y se acumulan numéricamente.
Otro procedimiento consiste en realizar una rectificación (p.ej., rectificación de onda completa o media onda) de las señales filtradas con un filtro pasabanda y medir el período entre las partes superiores, que constituye el semiciclo de una señal no rectificada.
Para ilustrar la importancia de los canales, se analizan las oscilaciones de tres vocales que se identifican en canales diferentes. Para ilustrar que el análisis de oscilaciones es independiente del hablante, se analizan las vocales pronunciadas por una persona de sexo masculino y una persona de sexo femenino seleccionadas aleatoriamente. Las vocales son "i:" como en "heed", "a:" como en "hod" y "u:" como en "who'd".
El canal bajo presenta un intervalo de tiempo total de 1 a 2 ms y el otro canal presenta un intervalo comprendido entre 0,16 y 1,2 ms. Todos los canales se dividen en 20 segmentos de tiempo y la escala de los segmentos es logarítmica. En un lapso de tiempo de 30 ms, se ordenan los semiciclos de las oscilaciones basándose en la duración, y el valor de pico a pico se acumula en el segmento de tiempo correspondiente.
Las figuras 6 a 11 representan gráficos de los resultados. Las figuras 6 y 7 representan la vocal "i:", y tanto la pronunciación femenina como la masculina presentan reflexiones destacadas en el segmento de tiempo 2 del canal alto, que corresponden al intervalo de tiempo comprendido entre 0,17 y 0,19 ms. Esto constituye el semiciclo de las oscilaciones. El período de oscilación se halla pues en el intervalo de 0,34 a 0,38 ms y es independiente del período fundamental. La voz femenina presenta asimismo una reflexión en los segmentos de tiempo 14 y 19 del canal bajo, lo cual significa que la imagen de sonido de la voz femenina tiene más volumen que la voz masculina.
Las figuras 8 y 9 representan el resultado de la vocal "a:" pronunciada por una mujer y un hombre, presentando ambas reflexiones destacadas en el segmento de tiempo 13 del segundo canal correspondiente al intervalo de tiempo comprendido entre 0,54 ms y 0,59 ms y un período de oscilación de entre 1,08 y 1,18 ms.
Las figuras 10 y 11 representan el resultado de la vocal "u:" pronunciada por una mujer y un hombre, presentando ambas reflexiones destacadas en el primer canal. La pronunciación femenina presenta la reflexión en el segmento de tiempo 11 y la pronunciación masculina en el segmento de tiempo 12. Esto corresponde a un período de tiempo de 3,4 a 3,9 ms. La vocal "u:" es la más grave, y en realidad las oscilaciones con un período superior a 2,5 ms, más o menos, suenan como una "u". La reflexión en los segmentos de tiempo 16 y 17 del segundo canal, correspondiente a un período de 1,5 a 1,8 ms, también puede ser muy importante para la vocal "u:", especialmente si se va a identificar a través de un teléfono.
El hecho de que las dos voces sean muy diferentes y los resultados sean tan notables, permite deducir que con toda probabilidad esta técnica permitirá realizar un reconocimiento de voz independiente del hablante.
Los principios del análisis APPA son por naturaleza sólidos ante el ruido, puesto que se basan en un análisis temporal de las oscilaciones. Para ilustrar esta cuestión, se añaden 5 dB de ruido blanco (WN) a la vocal "æ:" pronunciada por un hombre. Se analizan entonces la señal limpia y la señal con ruido. La figura 12 representa la misma señal de voz de la figura 2, pero con la adición de 5 dB de ruido blanco.
La figura 13 representa un análisis de oscilaciones de la señal limpia, y la figura 14 representa un análisis de la misma señal con 5 dB de ruido blanco añadidos. Los 5 dB de ruido blanco añadidos constituyen una cantidad de ruido muy cuantiosa y resulta difícil escuchar la señal. Como se observa en la figura 13, el resultado presenta reflexiones destacadas en el segmento de tiempo 6 del canal 3 correspondiente a un período de oscilación comprendido entre 0,53 y 0,59 ms. En la figura 14, se observa que los 5 dB de ruido blanco añadidos hacen desplazar la reflexión hasta el segmento de tiempo 5 correspondiente a un período comprendido entre 0,48 y 0,53 ms. Esto puede deberse al hecho de que los períodos se hallan en el límite entre dos segmentos. La reflexión sigue siendo notable en la señal de ruido.
Al parecer, el análisis APPA también es capaz de identificar las vocales aunque estas sean susurradas. La figura 15 representa la vocal "æ:" susurrada por un hombre. En este caso, la vocal sonora y la vocal susurrada son pronunciadas por dos personas diferentes.
Como se observa en la figura 15, cuando la vocal se susurra no se detecta ningún período fundamental. En la figura 16, se ilustra un análisis de oscilaciones que presenta reflexiones destacadas en el segmento de tiempo 5 correspondiente a un período de 0,48 a 0,56 ms, que se corresponde mucho con la versión sonora representada en la figura 14.
De lo que se ha explicado anteriormente, se deduce que las oscilaciones de la señal parecen tener gran importancia para la percepción auditiva, especialmente en los canales auditivos más altos. Evidentemente, es posible utilizar todos los parámetros para analizar la imagen del sonido, aunque, por ejemplo, en el reconocimiento de voz resultará ventajoso disponer de una cantidad menor de parámetros. Por consiguiente, es aconsejable disponer de un subconjunto de parámetros.
La magnitud máxima de los valores de pico a pico de las oscilaciones acumulados y el segmento de tiempo donde se alcanza es muy importante.
En lugar de utilizar como característica el segmento de tiempo en el cual la magnitud alcanza su valor máximo, tal vez resulte ventajoso utilizar en su lugar el punto central de todas las magnitudes de cada canal. En consecuencia, es preferible que el procedimiento de la presente invención calcule esta característica.
La presente invención se basa en el supuesto de que la cóclea presenta una banda muy amplia cuando está relajada y que su comportamiento es adaptativo si se acciona mediante sinusoides y presenta una banda más estrecha alrededor de las frecuencias.
En la figura 17, el bloque de canales auditivos bajos comprende uno o más canales que presentan, cada uno, un filtro pasabanda en el rango de frecuencias auditivas bajas de 50 Hz a, por ejemplo, 600 Hz. Típicamente, se utilizan dos canales (por ejemplo, uno de 50 a 200 Hz y otro de 200 a 600 Hz), cada uno de los cuales comprende más de una octava y posiblemente más de dos octavas. En cada canal, se detecta un número predeterminado de oscilaciones semicíclicas, preferentemente de un semiciclo, y se clasifican las correspondientes excursiones o magnitudes de señal (por ejemplo, los valores pico a pico del semiciclo) de conformidad con las duraciones del semiciclo. La clasificación puede realizarse de manera continua o discreta por medio de intervalos finitos o "bins" (segmentos de tiempo) con intervalos parciales del intervalo total. Preferentemente, la clasificación se realiza utilizando una escala de tiempo logarítmica. El rango de frecuencias auditivas bajas comprendido entre 50 y 600 Hz corresponde a oscilaciones semicíclicas del intervalo de tiempo comprendido entre 0,7 y 10 ms.
Igualmente, el bloque de canales auditivos medios comprende uno o más canales que presentan, cada uno, un filtro pasabanda en el rango de frecuencias auditivas medias comprendido de 600 a, por ejemplo, 4000 Hz. Típicamente, se utilizan tres canales (por ejemplo, uno de 60 a 1400 Hz, otro de 1400 a 2800 Hz y otro de 2000 a 4000 Hz), cada uno de los cuales comprende una octava o más. En cada canal, se detecta un número predeterminado de oscilaciones semicíclicas, preferentemente de un semiciclo, y se clasifican las correspondientes magnitudes de señal (por ejemplo, los valores pico a pico del semiciclo) de conformidad con las duraciones del semiciclo. La clasificación puede realizarse de manera continua o discreta por medio de intervalos finitos o "bins" ("segmentos de tiempo") con intervalos parciales del intervalo total. Preferentemente, la clasificación se realiza utilizando una escala de tiempo logarítmica. El rango de frecuencias auditivas medias de 600 a 4000 Hz corresponde a oscilaciones semicíclicas del intervalo de tiempo comprendido entre 0,12 y 1,2 ms.
La presente invención puede presentar también un bloque de canales auditivos altos (no representado), que es un banco de filtros que contiene filtros pasabanda que se hallan también dentro del intervalo comprendido entre 4 y 18 kHz, correspondiente a las oscilaciones semicíclicas en el intervalo de tiempo comprendido entre 0,01 y 0,14 ms.
En algunas aplicaciones, puede bastar con disponer de un filtro pasabanda que presente un ancho de banda de frecuencias adecuado.
Las salidas de los analizadores de oscilación se utilizan para interpretar la "imagen del sonido", es decir para reconocer las vocales del habla.
Para otros objetivos, el procedimiento puede comprender otros rangos de frecuencias adecuados para cada objetivo.
Referencias
[Leonhard 1993]
Frank U. Leonhard, "Method and System for Detecting and Generating Transient Conditions in Auditory Signals", EP 0737351, abril \underbar{1993}.
[Zwicker 1961]
E. Zwicker, "Subdivision of the audible frequency range into critical bands", Journal of the Acoustical Society of America, 33, página 248-249, \underbar{1961}.
[Seneff 1988]
Stephanie Seneff, "A joint synchrony/mean-rate model of auditory speech processing", Journal of Phonetics (\underbar{1988}) 16, 55-76.
[Thorsen 1978]
Nina Thorsen & Oluf Thorsen, "Fonetik for sprogstuderende", Institut for Fonetik, Københavns Universitet, 3. Reviderede udgave, \underbar{1978}.
[Leonhard 2002]
Frank Uldall Leonhard, "Quality Control of Electro-acoustic Transducers", WO 0225997, marzo \underbar{2002}.

Claims (7)

1. Procedimiento para analizar una señal de entrada que presenta un ancho de banda de frecuencias de entrada, comprendiendo el procedimiento:
- proporcionar por lo menos una parte de ancho de banda de frecuencias limitada de la señal de entrada,
- para cada una de dichas por lo menos unas partes de ancho de banda de frecuencias limitado de la señal de entrada, determinar las duraciones de un número predeterminado de semiciclos y magnitudes de señal de pico o de pico a pico durante el respectivo número predeterminado de semiciclos, representando un semiciclo el intervalo de tiempo entre dos picos consecutivos, y
- proporcionar dichas magnitudes de señal en función de las duraciones del número predeterminado de semiciclos, para determinar de ese modo la distribución de dichas magnitudes de señal.
2. Procedimiento según la reivindicación 1, que comprende rectificar cada una de dichas por lo menos una parte de ancho de banda de frecuencias limitada de la señal de entrada y determinar las magnitudes de señal como la magnitud de la señal entre dos ceros consecutivos.
3. Procedimiento según la reivindicación 1 ó 2, en el que el número predeterminado de semiciclos es de un semiciclo.
4. Procedimiento según cualquiera de las reivindicaciones 1 a 3, en el que la distribución de las magnitudes de señal en función de las duraciones del número predeterminado de semiciclos se utiliza para identificar vocales en una señal de voz.
5. Procedimiento según la reivindicación 4, en el que dicha por lo menos una parte de ancho de banda de frecuencias limitada presenta un ancho de banda de por lo menos una octava.
6. Procedimiento según cualquiera de las reivindicaciones 1 a 4, en el que la distribución de las magnitudes de señal en función de las duraciones del número predeterminado de semiciclos se utiliza para identificar el estado de un producto industrial.
7. Procedimiento según cualquiera de las reivindicaciones 1 a 4, en el que la distribución de las magnitudes de señal en función de las duraciones del número predeterminado de semiciclos se utiliza para identificar el estado de una señal fisiológica, tal como una señal nerviosa, en el cuerpo de una persona o de un animal.
ES04739023T 2003-08-06 2004-08-06 Procedimiento para analizar señales que contienen impulsos. Expired - Lifetime ES2321518T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DKPA200301136 2003-08-06
DK200301136 2003-08-06

Publications (1)

Publication Number Publication Date
ES2321518T3 true ES2321518T3 (es) 2009-06-08

Family

ID=34129841

Family Applications (1)

Application Number Title Priority Date Filing Date
ES04739023T Expired - Lifetime ES2321518T3 (es) 2003-08-06 2004-08-06 Procedimiento para analizar señales que contienen impulsos.

Country Status (7)

Country Link
US (1) US7844450B2 (es)
EP (1) EP1652171B1 (es)
CN (1) CN1864201B (es)
AT (1) ATE422696T1 (es)
DE (1) DE602004019424D1 (es)
ES (1) ES2321518T3 (es)
WO (1) WO2005015543A1 (es)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN101745186B (zh) * 2008-12-05 2012-01-11 宏达国际电子股份有限公司 脑波模拟器
US8949114B2 (en) * 2009-06-04 2015-02-03 Optis Wireless Technology, Llc Method and arrangement for estimating the quality degradation of a processed signal
EP2572356B1 (en) * 2010-05-17 2015-01-14 Telefonaktiebolaget L M Ericsson (PUBL) Method and arrangement for processing of speech quality estimate
CN113448514B (zh) * 2021-06-02 2022-03-15 合肥群音信息服务有限公司 一种多源语音数据的自动处理系统

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US2918667A (en) * 1957-04-01 1959-12-22 Rca Corp Signal frequency change detector
US2971058A (en) * 1957-05-29 1961-02-07 Rca Corp Method of and apparatus for speech analysis and printer control mechanisms
US3204030A (en) * 1961-01-23 1965-08-31 Rca Corp Acoustic apparatus for encoding sound
US3737666A (en) * 1971-04-15 1973-06-05 L Dutro Counter for a stream of overlapped articles
US4783807A (en) * 1984-08-27 1988-11-08 John Marley System and method for sound recognition with feature selection synchronized to voice pitch
GB2169719B (en) * 1985-01-02 1988-11-16 Medical Res Council Analysis of non-sinusoidal waveforms
GB2232801B (en) * 1989-05-18 1993-12-22 Medical Res Council Apparatus and methods for the generation of stabilised images from waveforms
DK46493D0 (da) * 1993-04-22 1993-04-22 Frank Uldall Leonhard Metode for signalbehandling til bestemmelse af transientforhold i auditive signaler
DE69922059D1 (de) * 1998-03-13 2004-12-23 Frank Uldall Leonhard Signalverarbeitungsverfahren zur Analyse von Sprachsignal-Transienten
AU2001289594A1 (en) * 2000-09-20 2002-04-02 Leonhard Research A/S A method of measuring the impulse response capability of a system

Also Published As

Publication number Publication date
DE602004019424D1 (de) 2009-03-26
EP1652171A1 (en) 2006-05-03
WO2005015543A1 (en) 2005-02-17
EP1652171B1 (en) 2009-02-11
US20070156409A1 (en) 2007-07-05
US7844450B2 (en) 2010-11-30
CN1864201A (zh) 2006-11-15
ATE422696T1 (de) 2009-02-15
CN1864201B (zh) 2010-12-08

Similar Documents

Publication Publication Date Title
Moore Basic auditory processes involved in the analysis of speech sounds
Moore 13 Aspects of Auditory Processing Related to Speech Perception
Hamill et al. The hearing sciences
Katalin Studying noise measurement and analysis
WO2010011963A1 (en) Methods and systems for identifying speech sounds using multi-dimensional analysis
KR20210158020A (ko) 청력 역치를 고려한 어음 청력 검사음 생성 장치, 방법 및 프로그램
Sataloff et al. The physics of sound
KR102310542B1 (ko) 일음절어를 이용한 청력 검사 장치, 방법 및 프로그램
Wiciak et al. Quietness in the soundscape of the Białowieża National Park
JP2023502697A (ja) 咳嗽を監視および分析するための方法およびシステム
Carullo et al. Performance comparison of different contact microphones used for voice monitoring
CN1864201B (zh) 用于分析包含脉冲的信号的方法
US11653138B2 (en) Acoustic reflex detection
Rosen Phase and the hearing-impaired
Glorig Principles Involved in Selectingl a Hearing Aid
Owens Hearing loss: a primer for the performing arts
US12250512B2 (en) Acoustic reflex detection
White Perceived Harm Level of Personal Listening Devices and Effects on Task Performance
US20180035925A1 (en) Method For Hearing Performance Assessment and Hearing System
Majka et al. Submilisecond acoustic pulses: effective pitch and Weber-Fechner law in discrimination of duration times
Azman et al. An evaluation of sound restoration hearing protection devices and audibility issues in mining
Borgh et al. The effect of own voice on noise dosimeter measurements: a field study in a day-care environment, including adults and children
Pereira et al. An acoustical study of IPOD output: Effects of headsets and control settings
US10658996B2 (en) Rendering wideband ultrasonic signals audible
Bjelic et al. Effect of Curvature Shape of Transparent COVID-19 Protective Face Shields on the Speech Signal