ES2321518T3 - Procedimiento para analizar señales que contienen impulsos. - Google Patents
Procedimiento para analizar señales que contienen impulsos. Download PDFInfo
- Publication number
- ES2321518T3 ES2321518T3 ES04739023T ES04739023T ES2321518T3 ES 2321518 T3 ES2321518 T3 ES 2321518T3 ES 04739023 T ES04739023 T ES 04739023T ES 04739023 T ES04739023 T ES 04739023T ES 2321518 T3 ES2321518 T3 ES 2321518T3
- Authority
- ES
- Spain
- Prior art keywords
- signal
- vowel
- procedure
- analysis
- oscillations
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Computational Linguistics (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
- Emergency Protection Circuit Devices (AREA)
- Control Of Electric Motors In General (AREA)
- Protection Of Transformers (AREA)
- Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)
Abstract
Procedimiento para analizar una señal de entrada que presenta un ancho de banda de frecuencias de entrada, comprendiendo el procedimiento: - proporcionar por lo menos una parte de ancho de banda de frecuencias limitada de la señal de entrada, - para cada una de dichas por lo menos unas partes de ancho de banda de frecuencias limitado de la señal de entrada, determinar las duraciones de un número predeterminado de semiciclos y magnitudes de señal de pico o de pico a pico durante el respectivo número predeterminado de semiciclos, representando un semiciclo el intervalo de tiempo entre dos picos consecutivos, y - proporcionar dichas magnitudes de señal en función de las duraciones del número predeterminado de semiciclos, para determinar de ese modo la distribución de dichas magnitudes de señal.
Description
Procedimiento para analizar señales que
contienen impulsos.
La presente invención se refiere al análisis de
las señales de impulsos, tales como las señales de voz, las señales
fisiológicas en el cuerpo de una persona o un animal, tales como las
señales nerviosas, y las señales de productos industriales, con el
propósito de determinar una cualidad de las señales, como en el caso
del reconocimiento de vocales en las señales de voz.
Durante décadas, se ha supuesto que la base
fundamental para evaluar la percepción auditiva era la transformada
de Fourier de tiempo corto. Esto se ha debido a que la construcción
de la cóclea apunta en esa dirección. No obstante, este supuesto ha
dado lugar a varios fenómenos inexplicables, entre los cuales cabe
citar el desconocimiento sobre la manera en que el oído humano
percibe las vocales y, en general, la manera en que percibe las
"imágenes" de so-
nido.
nido.
En un origen, el oído evolucionó como un sistema
de alerta cuya función era la de alertar contra los enemigos que
están al acecho, siendo comúnmente el motivo que conduce al estado
de alerta el sonido de la rotura de pequeñas ramas. Dicho sonido es
un impulso y puede tener una duración muy corta que no es adecuada
para el análisis mediante la transformada de Fourier, ya que en
dicho análisis se calcula el promedio de información contenida en el
impulso durante todo el análisis. Asimismo, el espectro de
frecuencias de una señal tiene un punto débil en la medida en que
las frecuencias destacadas del espectro pueden proceder de
diferentes fuentes que son imposibles de identificar. Esto plantea
un problema importante en el análisis de las vocales en el
reconocimiento de voz, ya que el ruido de fondo puede interpretarse
como falsos formantes.
La transformada de Fourier es una herramienta
matemática que elimina la dimensión del tiempo y, por consiguiente,
no resulta adecuada por naturaleza para el análisis de los impulsos.
Debido a la gran importancia de los impulsos, el comportamiento
dinámico de la señal es muy importante, y entonces el procedimiento
de análisis debe basarse en herramientas que reflejen el
comportamiento físico de la cóclea. La presente invención ofrece un
análisis en el tiempo y la frecuencia que simula el comportamiento
del oído humano.
En la patente US nº 5.422.977, se da a conocer
un procedimiento para generar una imagen de señal estabilizada a
partir de una forma de onda. El procedimiento comprende la detección
de picos en la forma de onda y, como respuesta a la detección de un
pico, el muestreo de un segmento de tiempo prolongado de dicha forma
de onda, y subsiguientemente la obtención de un resultado de
totalización sumando una primera señal constituida por el segmento
de tiempo prolongado de dicha forma de onda con una segunda señal
que representa un resultado de totalización previo atenuado formado
a partir de segmentos de tiempo prolongado anteriores de dicha forma
de onda. Por esta razón, el resultado de totalización tiende hacia
una forma constante y genera una imagen estabilizada de dicha forma
de onda cuando dicha forma de onda es constante. Este procedimiento
se basa en la suma totalizadora de fragmentos de señal que se
prolongan en el tiempo a partir de un pico detectado. Por
consiguiente, una forma de onda de la señal puede percibirse como
una imagen "congelada" del frente de onda.
Aunque el procedimiento de la presente invención
se diseñó inicialmente para el análisis de la voz, el procedimiento
resulta también adecuado para otros propósitos. Así pues, los
resultados del procedimiento de la presente invención pueden
utilizarse para identificar sonido, vibración o voz, o para medir la
calidad de productos cuando el sonido o la vibración ponen de
manifiesto la calidad de los productos. El procedimiento de la
presente invención también puede utilizarse en conexión con el
reconocimiento de voz o la codificación y la decodificación de voz
en telecomunicación de banda estrecha. En su aspecto más general, el
resultado de la presente invención puede utilizarse para identificar
o representar características que pueden ser percibidas por el oído
de una persona o un animal, aunque no está limitado a dicho uso.
El análisis de oscilaciones es un análisis
general que también puede utilizarse fuera del rango de frecuencias
que puede percibir el oído de una persona o un animal, tal como el
rango de las altas frecuencias de telecomunicación.
La presente invención dispone un procedimiento
según la reivindicación 1 para analizar una señal de entrada que
presenta un ancho de banda de frecuencias de entrada. El
procedimiento comprende la provisión de por lo menos una parte de
ancho de banda de frecuencias limitado de la señal de entrada. Para
cada parte de ancho de banda de frecuencias limitado de la señal de
entrada, se determinan las duraciones de un número predeterminado de
semiciclos y excursiones de señal durante los respectivos
semiciclos. Basándose en las excursiones de señal y los
correspondientes semiciclos, se determina una característica de la
señal de entrada. Las excursiones de señal pueden determinarse como
valores de pico a pico o como una excursión de señal entre dos ceros
consecutivos de la parte de ancho de banda de frecuencias limitado
sometida a rectificación de onda completa o media onda. La
característica de señal determinada puede ser una vocal de una señal
de voz o una señal fisiológica en el cuerpo de una persona o un
animal (tal como una señal nerviosa) o una característica
relacionada con el estado de un producto industrial. El
procedimiento ofrece el reconocimiento de vocales independiente del
hablante e incluso el reconocimiento de vocales susurradas.
En los dibujos, se representa lo siguiente:
Figura 1: 50 ms de la vocal "æ:" como en
"had", pronunciado por un hombre y una mujer;
figura 2: 10 ms (un impulso) de la vocal
"æ:" (hombre) y la salida de cuatro canales auditivos;
figura 3: 10 ms (dos impulsos) de la vocal
"æ:" (mujer) y la salida de cuatro canales auditivos;
figura 4: Aproximadamente 10 ms (dos impulsos)
de la vocal "a:" (hombre) y la salida de cuatro canales
auditivos;
figura 5: Aproximadamente 10 ms (dos impulsos)
de la vocal "a:" (mujer) y la salida de cuatro canales
auditivos;
figura 6: Análisis de las oscilaciones de la
vocal "i:" pronunciada por una mujer;
figura 7: Análisis de las oscilaciones de la
vocal "i:" pronunciada por un hombre;
figura 8: Análisis de las oscilaciones de la
vocal "a:" pronunciada por una mujer;
figura 9: Análisis de las oscilaciones de la
vocal "a:" pronunciada por un hombre;
figura 10: Análisis de las oscilaciones de la
vocal "u:" pronunciada por una mujer;
figura 11: Análisis de las oscilaciones de la
vocal "u:" pronunciada por un hombre;
figura 12: 10 ms (un impulso) de la vocal
"æ:" (hombre) con 5 dB de ruido blanco añadido;
figura 13: Análisis de las oscilaciones de la
vocal "æ:" sin ruido blanco;
figura 14: Análisis de las oscilaciones de la
vocal "æ:" con 5 dB de ruido blanco añadido;
figura 15: 10 ms de la vocal "æ:" susurrada
(hombre);
figura 16: Análisis de las oscilaciones de la
vocal "æ:" susurrada y
figura 17: Diagrama de bloques del análisis
APPA.
Típicamente, se genera un impulso cuando una
fuerza abrupta golpea un sistema. Dicha fuerza puede tener origen en
un fallo de una rueda de engranaje de una caja de engranajes u otro
producto industrial, generándose un impulso cada vez que la parte
anómala de la rueda se engrana, debido a la fuerza provocada por el
fallo. Asimismo, dicha fuerza puede ser producto de la explosión por
presión creada por las cuerdas vocales en la voz sonora. Se dice que
la fuerza es abrupta porque la respuesta transitoria del sistema es
muy importante y también porque a menudo es no lineal.
Mediante una transformada de Fourier, el dominio
del tiempo se elimina y, por lo tanto, la transformada de Fourier no
es muy conveniente para describir las condiciones dinámicas de las
señales. Un procedimiento más adecuado consiste en dividir el
intervalo de frecuencias auditivas en canales auditivos por medio de
un banco de filtros o unos filtros pasabanda. Los filtros pasabanda
con amplias bandas de frecuencias presentan una respuesta al impulso
corta y, en consecuencia, una resolución temporal alta.
Durante muchos años se ha supuesto que la cóclea
del oído estaba dividida en un grupo de canales de frecuencia
auditiva, en los cuales se realizaba el análisis de la señal
[Zwicker 1961]. Sin embargo, los procedimientos utilizados se
centraban en el análisis de régimen cuasiestacionario en el dominio
de la frecuencia, entre otros, para poder localizar los formantes en
las señales de voz. En una excepción, descrita por F. Leonhard
[Leonhard 1993] y [Leonhard 2002], se tienen en cuenta los cambios
abruptos de energía, pero no se describe de una manera minuciosa
cómo se percibe la imagen del sonido.
Idealmente, un impulso es la respuesta de un
sistema a un impulso y contiene frecuencias propias amortiguadas,
que pueden describirse con respecto a los polos de un sistema y que,
realmente, constituyen un tipo de huella dactilar del sistema. El
objetivo de un análisis de impulsos es obtener tanta información y
tan precisa como sea posible a partir del impulso, tal como parece
ser el caso de la percepción auditiva. En lo sucesivo, se centrará
la atención en el análisis del "color" de la imagen del sonido
o las vocales, que pueden considerarse "colores" especiales del
sonido.
En la figura 1, se representan 50 ms de la vocal
"æ:" como en la palabra "had" pronunciada por un hombre
(señal superior) y una mujer (señal inferior). Como se observa la
señal contiene frecuencias amortiguadas, lo cual resulta muy obvio
en el caso del hombre. También se observa claramente que, en el
hombre, el intervalo entre los impulsos es más o menos el doble que
en la mujer.
Para obtener una alta resolución temporal, es
necesario que los filtros pasabanda de los canales auditivos tengan
bandas de frecuencias amplias. La figura 2 representa alrededor de
10 ms de la vocal "æ:" pronunciada por un hombre (un impulso) y
la salida de cuatro canales auditivos. Un canal bajo en el rango de
frecuencias es un canal de hasta 600 Hz y un canal del rango de 600
a 1400 Hz, y un canal alto en el rango de frecuencias es un canal de
entre 1400 y 2800 Hz y un canal de entre 2000 y 4000 Hz. La vocal se
presenta principalmente en el tercer canal.
La figura 3 representa alrededor de 10 ms (dos
impulsos) de la vocal "æ:" pronunciada por una mujer y la
salida de los cuatro canales auditivos. Comparada con la vocal
pronunciada por el hombre, el período entre los impulsos es solo la
mitad (alrededor de 5 ms para la mujer y 10 ms para el hombre). No
obstante, el período de las oscilaciones en los canales medios es
muy similar. Dicho de otro modo, la oscilación es independiente del
período fundamental. La sensibilidad más alta del oído en el rango
de frecuencias más altas se compensa con la ganancia de los cuatro
canales. Si hay oscilaciones en el canal bajo, se obtiene un mejor
volumen de la imagen del sonido.
En este contexto, se producen tres fenómenos de
interés para los impulsos. El primero de ellos es la naturaleza de
la oscilación (el período y la magnitud). El período de tiempo de
las oscilaciones parece ser muy importante para la imagen del
sonido. El segundo es la evolución de la energía instantánea en toda
la duración del impulso. El tercero es el período de los impulsos.
El período puede ser constante a lo largo de un intervalo de tiempo
más largo o puede ser aleatorio. Tal vez resulte muy tentador
realizar un análisis de frecuencias por medio de una transformada de
Fourier para analizar las oscilaciones. Debe tenerse en cuenta, sin
embargo, que las oscilaciones a menudo se componen de más de una
frecuencia, hecho que afecta a su período de tiempo. Por
consiguiente, un procedimiento más adecuado consistirá en medir el
período de tiempo de las oscilaciones en un análisis de
oscilaciones.
La figura 4 representa la voz y la salida de los
cuatro canales para alrededor de 10 ms de la vocal "a:" como en
la palabra "hod" pronunciada por un hombre. La vocal viene
representada por las oscilaciones del segundo canal.
La figura 5 representa la vocal "a:"
pronunciada por una mujer. Asimismo, se puede observar que la
frecuencia fundamental de la voz femenina es alrededor del doble de
la frecuencia fundamental de la voz masculina, aunque el período
dominante de las oscilaciones del segundo canal es igual.
Las oscilaciones de los canales, especialmente
de los tres canales superiores, son muy importantes para la
identificación de las vocales. Como se observa en la figura 2, la
salida de los canales es bastante periódica. Esto podría llevar a
suponer que la oscilación solo consiste en una frecuencia. Sin
embargo, los filtros pasabanda presentan bandas muy amplias
(habitualmente de una o dos octavas) y el impulso es una respuesta
transitoria. Esto significa que la oscilación a menudo está
constituida por más de una frecuencia. En las vocales, habitualmente
el segundo formante es el dominante, aunque está influido por otras
frecuencias.
Durante un lapso de tiempo, se miden
directamente las oscilaciones desde la parte superior hasta la parte
inferior y desde la parte inferior hasta la parte superior, es
decir, se miden los semiciclos o un número predeterminado de
semiciclos. En ambos casos, los valores de pico a pico se miden y
ordenan basándose en el período entre la parte superior y la parte
inferior y el período entre la parte inferior y la parte superior,
ya sea de forma continua o discreta (es decir, en un número de
intervalos finitos también denominados "bins" (segmentos de
tiempo)), y se acumulan numéricamente.
Otro procedimiento consiste en realizar una
rectificación (p.ej., rectificación de onda completa o media onda)
de las señales filtradas con un filtro pasabanda y medir el período
entre las partes superiores, que constituye el semiciclo de una
señal no rectificada.
Para ilustrar la importancia de los canales, se
analizan las oscilaciones de tres vocales que se identifican en
canales diferentes. Para ilustrar que el análisis de oscilaciones es
independiente del hablante, se analizan las vocales pronunciadas por
una persona de sexo masculino y una persona de sexo femenino
seleccionadas aleatoriamente. Las vocales son "i:" como en
"heed", "a:" como en "hod" y "u:" como en
"who'd".
El canal bajo presenta un intervalo de tiempo
total de 1 a 2 ms y el otro canal presenta un intervalo comprendido
entre 0,16 y 1,2 ms. Todos los canales se dividen en 20 segmentos de
tiempo y la escala de los segmentos es logarítmica. En un lapso de
tiempo de 30 ms, se ordenan los semiciclos de las oscilaciones
basándose en la duración, y el valor de pico a pico se acumula en el
segmento de tiempo correspondiente.
Las figuras 6 a 11 representan gráficos de los
resultados. Las figuras 6 y 7 representan la vocal "i:", y
tanto la pronunciación femenina como la masculina presentan
reflexiones destacadas en el segmento de tiempo 2 del canal alto,
que corresponden al intervalo de tiempo comprendido entre 0,17 y
0,19 ms. Esto constituye el semiciclo de las oscilaciones. El
período de oscilación se halla pues en el intervalo de 0,34 a 0,38
ms y es independiente del período fundamental. La voz femenina
presenta asimismo una reflexión en los segmentos de tiempo 14 y 19
del canal bajo, lo cual significa que la imagen de sonido de la voz
femenina tiene más volumen que la voz masculina.
Las figuras 8 y 9 representan el resultado de la
vocal "a:" pronunciada por una mujer y un hombre, presentando
ambas reflexiones destacadas en el segmento de tiempo 13 del segundo
canal correspondiente al intervalo de tiempo comprendido entre 0,54
ms y 0,59 ms y un período de oscilación de entre 1,08 y 1,18 ms.
Las figuras 10 y 11 representan el resultado de
la vocal "u:" pronunciada por una mujer y un hombre,
presentando ambas reflexiones destacadas en el primer canal. La
pronunciación femenina presenta la reflexión en el segmento de
tiempo 11 y la pronunciación masculina en el segmento de tiempo 12.
Esto corresponde a un período de tiempo de 3,4 a 3,9 ms. La vocal
"u:" es la más grave, y en realidad las oscilaciones con un
período superior a 2,5 ms, más o menos, suenan como una "u". La
reflexión en los segmentos de tiempo 16 y 17 del segundo canal,
correspondiente a un período de 1,5 a 1,8 ms, también puede ser muy
importante para la vocal "u:", especialmente si se va a
identificar a través de un teléfono.
El hecho de que las dos voces sean muy
diferentes y los resultados sean tan notables, permite deducir que
con toda probabilidad esta técnica permitirá realizar un
reconocimiento de voz independiente del hablante.
Los principios del análisis APPA son por
naturaleza sólidos ante el ruido, puesto que se basan en un análisis
temporal de las oscilaciones. Para ilustrar esta cuestión, se añaden
5 dB de ruido blanco (WN) a la vocal "æ:" pronunciada por un
hombre. Se analizan entonces la señal limpia y la señal con ruido.
La figura 12 representa la misma señal de voz de la figura 2, pero
con la adición de 5 dB de ruido blanco.
La figura 13 representa un análisis de
oscilaciones de la señal limpia, y la figura 14 representa un
análisis de la misma señal con 5 dB de ruido blanco añadidos. Los 5
dB de ruido blanco añadidos constituyen una cantidad de ruido muy
cuantiosa y resulta difícil escuchar la señal. Como se observa en la
figura 13, el resultado presenta reflexiones destacadas en el
segmento de tiempo 6 del canal 3 correspondiente a un período de
oscilación comprendido entre 0,53 y 0,59 ms. En la figura 14, se
observa que los 5 dB de ruido blanco añadidos hacen desplazar la
reflexión hasta el segmento de tiempo 5 correspondiente a un período
comprendido entre 0,48 y 0,53 ms. Esto puede deberse al hecho de que
los períodos se hallan en el límite entre dos segmentos. La
reflexión sigue siendo notable en la señal de ruido.
Al parecer, el análisis APPA también es capaz de
identificar las vocales aunque estas sean susurradas. La figura 15
representa la vocal "æ:" susurrada por un hombre. En este caso,
la vocal sonora y la vocal susurrada son pronunciadas por dos
personas diferentes.
Como se observa en la figura 15, cuando la vocal
se susurra no se detecta ningún período fundamental. En la figura
16, se ilustra un análisis de oscilaciones que presenta reflexiones
destacadas en el segmento de tiempo 5 correspondiente a un período
de 0,48 a 0,56 ms, que se corresponde mucho con la versión sonora
representada en la figura 14.
De lo que se ha explicado anteriormente, se
deduce que las oscilaciones de la señal parecen tener gran
importancia para la percepción auditiva, especialmente en los
canales auditivos más altos. Evidentemente, es posible utilizar
todos los parámetros para analizar la imagen del sonido, aunque, por
ejemplo, en el reconocimiento de voz resultará ventajoso disponer de
una cantidad menor de parámetros. Por consiguiente, es aconsejable
disponer de un subconjunto de parámetros.
La magnitud máxima de los valores de pico a pico
de las oscilaciones acumulados y el segmento de tiempo donde se
alcanza es muy importante.
En lugar de utilizar como característica el
segmento de tiempo en el cual la magnitud alcanza su valor máximo,
tal vez resulte ventajoso utilizar en su lugar el punto central de
todas las magnitudes de cada canal. En consecuencia, es preferible
que el procedimiento de la presente invención calcule esta
característica.
La presente invención se basa en el supuesto de
que la cóclea presenta una banda muy amplia cuando está relajada y
que su comportamiento es adaptativo si se acciona mediante
sinusoides y presenta una banda más estrecha alrededor de las
frecuencias.
En la figura 17, el bloque de canales auditivos
bajos comprende uno o más canales que presentan, cada uno, un filtro
pasabanda en el rango de frecuencias auditivas bajas de 50 Hz a, por
ejemplo, 600 Hz. Típicamente, se utilizan dos canales (por ejemplo,
uno de 50 a 200 Hz y otro de 200 a 600 Hz), cada uno de los cuales
comprende más de una octava y posiblemente más de dos octavas. En
cada canal, se detecta un número predeterminado de oscilaciones
semicíclicas, preferentemente de un semiciclo, y se clasifican las
correspondientes excursiones o magnitudes de señal (por ejemplo, los
valores pico a pico del semiciclo) de conformidad con las duraciones
del semiciclo. La clasificación puede realizarse de manera continua
o discreta por medio de intervalos finitos o "bins" (segmentos
de tiempo) con intervalos parciales del intervalo total.
Preferentemente, la clasificación se realiza utilizando una escala
de tiempo logarítmica. El rango de frecuencias auditivas bajas
comprendido entre 50 y 600 Hz corresponde a oscilaciones
semicíclicas del intervalo de tiempo comprendido entre 0,7 y 10
ms.
Igualmente, el bloque de canales auditivos
medios comprende uno o más canales que presentan, cada uno, un
filtro pasabanda en el rango de frecuencias auditivas medias
comprendido de 600 a, por ejemplo, 4000 Hz. Típicamente, se utilizan
tres canales (por ejemplo, uno de 60 a 1400 Hz, otro de 1400 a 2800
Hz y otro de 2000 a 4000 Hz), cada uno de los cuales comprende una
octava o más. En cada canal, se detecta un número predeterminado de
oscilaciones semicíclicas, preferentemente de un semiciclo, y se
clasifican las correspondientes magnitudes de señal (por ejemplo,
los valores pico a pico del semiciclo) de conformidad con las
duraciones del semiciclo. La clasificación puede realizarse de
manera continua o discreta por medio de intervalos finitos o
"bins" ("segmentos de tiempo") con intervalos parciales
del intervalo total. Preferentemente, la clasificación se realiza
utilizando una escala de tiempo logarítmica. El rango de frecuencias
auditivas medias de 600 a 4000 Hz corresponde a oscilaciones
semicíclicas del intervalo de tiempo comprendido entre 0,12 y 1,2
ms.
La presente invención puede presentar también un
bloque de canales auditivos altos (no representado), que es un banco
de filtros que contiene filtros pasabanda que se hallan también
dentro del intervalo comprendido entre 4 y 18 kHz, correspondiente a
las oscilaciones semicíclicas en el intervalo de tiempo comprendido
entre 0,01 y 0,14 ms.
En algunas aplicaciones, puede bastar con
disponer de un filtro pasabanda que presente un ancho de banda de
frecuencias adecuado.
Las salidas de los analizadores de oscilación se
utilizan para interpretar la "imagen del sonido", es decir para
reconocer las vocales del habla.
Para otros objetivos, el procedimiento puede
comprender otros rangos de frecuencias adecuados para cada
objetivo.
- [Leonhard 1993]
- Frank U. Leonhard, "Method and System for Detecting and Generating Transient Conditions in Auditory Signals", EP 0737351, abril \underbar{1993}.
- [Zwicker 1961]
- E. Zwicker, "Subdivision of the audible frequency range into critical bands", Journal of the Acoustical Society of America, 33, página 248-249, \underbar{1961}.
- [Seneff 1988]
- Stephanie Seneff, "A joint synchrony/mean-rate model of auditory speech processing", Journal of Phonetics (\underbar{1988}) 16, 55-76.
- [Thorsen 1978]
- Nina Thorsen & Oluf Thorsen, "Fonetik for sprogstuderende", Institut for Fonetik, Københavns Universitet, 3. Reviderede udgave, \underbar{1978}.
- [Leonhard 2002]
- Frank Uldall Leonhard, "Quality Control of Electro-acoustic Transducers", WO 0225997, marzo \underbar{2002}.
Claims (7)
1. Procedimiento para analizar una señal de
entrada que presenta un ancho de banda de frecuencias de entrada,
comprendiendo el procedimiento:
- proporcionar por lo menos una parte de ancho
de banda de frecuencias limitada de la señal de entrada,
- para cada una de dichas por lo menos unas
partes de ancho de banda de frecuencias limitado de la señal de
entrada, determinar las duraciones de un número predeterminado de
semiciclos y magnitudes de señal de pico o de pico a pico durante el
respectivo número predeterminado de semiciclos, representando un
semiciclo el intervalo de tiempo entre dos picos consecutivos, y
- proporcionar dichas magnitudes de señal en
función de las duraciones del número predeterminado de semiciclos,
para determinar de ese modo la distribución de dichas magnitudes de
señal.
2. Procedimiento según la reivindicación 1, que
comprende rectificar cada una de dichas por lo menos una parte de
ancho de banda de frecuencias limitada de la señal de entrada y
determinar las magnitudes de señal como la magnitud de la señal
entre dos ceros consecutivos.
3. Procedimiento según la reivindicación 1 ó 2,
en el que el número predeterminado de semiciclos es de un
semiciclo.
4. Procedimiento según cualquiera de las
reivindicaciones 1 a 3, en el que la distribución de las magnitudes
de señal en función de las duraciones del número predeterminado de
semiciclos se utiliza para identificar vocales en una señal de
voz.
5. Procedimiento según la reivindicación 4, en
el que dicha por lo menos una parte de ancho de banda de frecuencias
limitada presenta un ancho de banda de por lo menos una octava.
6. Procedimiento según cualquiera de las
reivindicaciones 1 a 4, en el que la distribución de las magnitudes
de señal en función de las duraciones del número predeterminado de
semiciclos se utiliza para identificar el estado de un producto
industrial.
7. Procedimiento según cualquiera de las
reivindicaciones 1 a 4, en el que la distribución de las magnitudes
de señal en función de las duraciones del número predeterminado de
semiciclos se utiliza para identificar el estado de una señal
fisiológica, tal como una señal nerviosa, en el cuerpo de una
persona o de un animal.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DKPA200301136 | 2003-08-06 | ||
| DK200301136 | 2003-08-06 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2321518T3 true ES2321518T3 (es) | 2009-06-08 |
Family
ID=34129841
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES04739023T Expired - Lifetime ES2321518T3 (es) | 2003-08-06 | 2004-08-06 | Procedimiento para analizar señales que contienen impulsos. |
Country Status (7)
| Country | Link |
|---|---|
| US (1) | US7844450B2 (es) |
| EP (1) | EP1652171B1 (es) |
| CN (1) | CN1864201B (es) |
| AT (1) | ATE422696T1 (es) |
| DE (1) | DE602004019424D1 (es) |
| ES (1) | ES2321518T3 (es) |
| WO (1) | WO2005015543A1 (es) |
Families Citing this family (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN101745186B (zh) * | 2008-12-05 | 2012-01-11 | 宏达国际电子股份有限公司 | 脑波模拟器 |
| US8949114B2 (en) * | 2009-06-04 | 2015-02-03 | Optis Wireless Technology, Llc | Method and arrangement for estimating the quality degradation of a processed signal |
| EP2572356B1 (en) * | 2010-05-17 | 2015-01-14 | Telefonaktiebolaget L M Ericsson (PUBL) | Method and arrangement for processing of speech quality estimate |
| CN113448514B (zh) * | 2021-06-02 | 2022-03-15 | 合肥群音信息服务有限公司 | 一种多源语音数据的自动处理系统 |
Family Cites Families (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US2918667A (en) * | 1957-04-01 | 1959-12-22 | Rca Corp | Signal frequency change detector |
| US2971058A (en) * | 1957-05-29 | 1961-02-07 | Rca Corp | Method of and apparatus for speech analysis and printer control mechanisms |
| US3204030A (en) * | 1961-01-23 | 1965-08-31 | Rca Corp | Acoustic apparatus for encoding sound |
| US3737666A (en) * | 1971-04-15 | 1973-06-05 | L Dutro | Counter for a stream of overlapped articles |
| US4783807A (en) * | 1984-08-27 | 1988-11-08 | John Marley | System and method for sound recognition with feature selection synchronized to voice pitch |
| GB2169719B (en) * | 1985-01-02 | 1988-11-16 | Medical Res Council | Analysis of non-sinusoidal waveforms |
| GB2232801B (en) * | 1989-05-18 | 1993-12-22 | Medical Res Council | Apparatus and methods for the generation of stabilised images from waveforms |
| DK46493D0 (da) * | 1993-04-22 | 1993-04-22 | Frank Uldall Leonhard | Metode for signalbehandling til bestemmelse af transientforhold i auditive signaler |
| DE69922059D1 (de) * | 1998-03-13 | 2004-12-23 | Frank Uldall Leonhard | Signalverarbeitungsverfahren zur Analyse von Sprachsignal-Transienten |
| AU2001289594A1 (en) * | 2000-09-20 | 2002-04-02 | Leonhard Research A/S | A method of measuring the impulse response capability of a system |
-
2004
- 2004-08-06 DE DE602004019424T patent/DE602004019424D1/de not_active Expired - Lifetime
- 2004-08-06 CN CN2004800291069A patent/CN1864201B/zh not_active Expired - Fee Related
- 2004-08-06 ES ES04739023T patent/ES2321518T3/es not_active Expired - Lifetime
- 2004-08-06 US US10/567,118 patent/US7844450B2/en not_active Expired - Fee Related
- 2004-08-06 EP EP04739023A patent/EP1652171B1/en not_active Expired - Lifetime
- 2004-08-06 WO PCT/DK2004/000526 patent/WO2005015543A1/en not_active Ceased
- 2004-08-06 AT AT04739023T patent/ATE422696T1/de not_active IP Right Cessation
Also Published As
| Publication number | Publication date |
|---|---|
| DE602004019424D1 (de) | 2009-03-26 |
| EP1652171A1 (en) | 2006-05-03 |
| WO2005015543A1 (en) | 2005-02-17 |
| EP1652171B1 (en) | 2009-02-11 |
| US20070156409A1 (en) | 2007-07-05 |
| US7844450B2 (en) | 2010-11-30 |
| CN1864201A (zh) | 2006-11-15 |
| ATE422696T1 (de) | 2009-02-15 |
| CN1864201B (zh) | 2010-12-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Moore | Basic auditory processes involved in the analysis of speech sounds | |
| Moore | 13 Aspects of Auditory Processing Related to Speech Perception | |
| Hamill et al. | The hearing sciences | |
| Katalin | Studying noise measurement and analysis | |
| WO2010011963A1 (en) | Methods and systems for identifying speech sounds using multi-dimensional analysis | |
| KR20210158020A (ko) | 청력 역치를 고려한 어음 청력 검사음 생성 장치, 방법 및 프로그램 | |
| Sataloff et al. | The physics of sound | |
| KR102310542B1 (ko) | 일음절어를 이용한 청력 검사 장치, 방법 및 프로그램 | |
| Wiciak et al. | Quietness in the soundscape of the Białowieża National Park | |
| JP2023502697A (ja) | 咳嗽を監視および分析するための方法およびシステム | |
| Carullo et al. | Performance comparison of different contact microphones used for voice monitoring | |
| CN1864201B (zh) | 用于分析包含脉冲的信号的方法 | |
| US11653138B2 (en) | Acoustic reflex detection | |
| Rosen | Phase and the hearing-impaired | |
| Glorig | Principles Involved in Selectingl a Hearing Aid | |
| Owens | Hearing loss: a primer for the performing arts | |
| US12250512B2 (en) | Acoustic reflex detection | |
| White | Perceived Harm Level of Personal Listening Devices and Effects on Task Performance | |
| US20180035925A1 (en) | Method For Hearing Performance Assessment and Hearing System | |
| Majka et al. | Submilisecond acoustic pulses: effective pitch and Weber-Fechner law in discrimination of duration times | |
| Azman et al. | An evaluation of sound restoration hearing protection devices and audibility issues in mining | |
| Borgh et al. | The effect of own voice on noise dosimeter measurements: a field study in a day-care environment, including adults and children | |
| Pereira et al. | An acoustical study of IPOD output: Effects of headsets and control settings | |
| US10658996B2 (en) | Rendering wideband ultrasonic signals audible | |
| Bjelic et al. | Effect of Curvature Shape of Transparent COVID-19 Protective Face Shields on the Speech Signal |