ES2377017T3 - Procedimiento y aparato para el ajuste automático de la velocidad de reproducción de datos de audio - Google Patents
Procedimiento y aparato para el ajuste automático de la velocidad de reproducción de datos de audio Download PDFInfo
- Publication number
- ES2377017T3 ES2377017T3 ES07760954T ES07760954T ES2377017T3 ES 2377017 T3 ES2377017 T3 ES 2377017T3 ES 07760954 T ES07760954 T ES 07760954T ES 07760954 T ES07760954 T ES 07760954T ES 2377017 T3 ES2377017 T3 ES 2377017T3
- Authority
- ES
- Spain
- Prior art keywords
- audio data
- playback speed
- rate
- values
- reproduction
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 238000000034 method Methods 0.000 title claims abstract description 43
- 230000004044 response Effects 0.000 claims abstract description 11
- 230000008859 change Effects 0.000 claims description 18
- 238000012545 processing Methods 0.000 claims description 15
- 238000005070 sampling Methods 0.000 claims description 4
- 230000001360 synchronised effect Effects 0.000 claims description 4
- 238000010586 diagram Methods 0.000 description 7
- 230000008569 process Effects 0.000 description 4
- 230000008901 benefit Effects 0.000 description 3
- 238000004891 communication Methods 0.000 description 3
- 238000013500 data storage Methods 0.000 description 3
- 230000014509 gene expression Effects 0.000 description 3
- 238000007726 management method Methods 0.000 description 3
- 238000005259 measurement Methods 0.000 description 3
- 230000009471 action Effects 0.000 description 2
- 230000008878 coupling Effects 0.000 description 2
- 238000010168 coupling process Methods 0.000 description 2
- 238000005859 coupling reaction Methods 0.000 description 2
- 230000001755 vocal effect Effects 0.000 description 2
- 238000006243 chemical reaction Methods 0.000 description 1
- 238000004590 computer program Methods 0.000 description 1
- 239000012141 concentrate Substances 0.000 description 1
- 230000001276 controlling effect Effects 0.000 description 1
- 238000013523 data management Methods 0.000 description 1
- 230000007423 decrease Effects 0.000 description 1
- 230000003247 decreasing effect Effects 0.000 description 1
- 230000001934 delay Effects 0.000 description 1
- 238000001514 detection method Methods 0.000 description 1
- 239000000284 extract Substances 0.000 description 1
- 238000012986 modification Methods 0.000 description 1
- 230000004048 modification Effects 0.000 description 1
- 230000003287 optical effect Effects 0.000 description 1
- 230000001105 regulatory effect Effects 0.000 description 1
- 238000012549 training Methods 0.000 description 1
- 238000005303 weighing Methods 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/04—Time compression or expansion
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Quality & Reliability (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Signal Processing For Digital Recording And Reproducing (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
- Signal Processing Not Specific To The Method Of Recording And Reproducing (AREA)
Abstract
Un procedimiento para el ajuste automático de la velocidad de reproducción de datos de audio que comprende: identificar (502) una primera condición en los datos de audio relativa a una velocidad del habla y una segunda condición en los datos de audio relativa a ruido de fondo convirtiendo (501) los datos de audio desde un dominio temporal a un dominio frecuencial, extrayendo características de los datos de audio en el dominio frecuencial y midiendo (503) una tasa de cambio de las características extraídas en el dominio frecuencial generando uno o más valores (401-403; 501-503) de control de la velocidad de reproducción en respuesta a la primera condición, y comparar (504) las características con un modelo de voz para generar uno o más valores adicionales de control de la velocidad de reproducción en respuesta a la segunda condición; y ajustar automáticamente (506) una velocidad de reproducción de los datos de audio en respuesta a todos los valores (404; 506) de control de la velocidad de reproducción.
Description
Procedimiento y aparato para el ajuste automático de la velocidad de reproducción de datos de audio
Campo técnico
Las realizaciones de la presente invención son pertinentes a los reproductores multimedia que reproducen datos de audio. Más específicamente, las realizaciones de la presente invención versan acerca de un procedimiento y un aparato para el ajuste automático de la velocidad de reproducción de datos de audio.
Antecedentes
Existen reproductores multimedia que permiten la reproducción de grabaciones de audio y de sesiones de audiovídeo a una velocidad que es superior a la velocidad normal. Esto permite que los usuarios escuchen y vean estas sesiones en un periodo de tiempo menor. El uso de estas características puede ser común, por ejemplo, en aplicaciones empresariales, en las que los empleados ven y/o escuchan sesiones de formación, reuniones, conferencias y presentaciones. El uso de estas características también puede ser común en aplicaciones de ocio, por ejemplo, cuando los usuarios escuchan la radio o audio bajo demanda o ven la televisión. Estas características permiten que la reproducción a mayor velocidad esté libre de fallos de audio y vídeo.
Típicamente, los usuarios descubren que la reproducción de datos de audio resulta inteligible y comprensible a velocidades de reproducción aproximadamente entre 1,2 y 1,9 veces la velocidad normal de reproducción. Sin embargo, la velocidad óptima puede variar durante la reproducción debido a la velocidad de la voz de la persona que habla, al ruido de fondo, a la presencia de pausas de silencio o rellenadas, y a otros criterios que pueden cambiar en el curso de la reproducción de los datos de audio.
Los reproductores multimedia actuales permiten que los usuarios ajusten manualmente la velocidad de reproducción de los datos de audio. Cuando la velocidad óptima de reproducción cambia frecuentemente en el curso de la reproducción de datos de audio, realizar ajustes manualmente puede resultar inconveniente. Además, cuando se realiza un ajuste manual, un oyente puede reaccionar solamente a cambios en los datos de audio. La demora experimentada en la detección y la reacción al cambio en los datos de audio puede dar como resultado la reproducción de porciones de datos de audio a una velocidad que resulte incomprensible para el oyente. Esto puede hacer que el oyente vuelva a reproducir los datos de audio, negando así algunos de los beneficios de la reproducción a mayor velocidad.
El ajuste automático de la velocidad de reproducción de los datos de audio ha sido dado a conocer previamente. En lo que sigue se identifican dos ejemplos de publicaciones anteriores a modo de antecedente de la presente invención.
La publicación de solicitud de patente estadounidense US 2002/0010916 A1 da a conocer un procedimiento y un aparato que controla la velocidad de reproducción de datos de audio correspondientes a un flujo de voz en continuo. Usando un reconocimiento de voz, se determina la tasa de velocidad de los datos de audio y se la compara con una tasa diana. En base a esta comparación, se aumenta o se disminuye la tasa para que coincida con la tasa diana.
La publicación de solicitud de patente estadounidense US 2005/0149329 A1 describe un aparato para cambiar la velocidad de reproducción de voz grabada que incluye una memoria que almacena una pluralidad de mensajes de voz grabados y una pluralidad de tablas de características. Cada tabla de características está asociada con un mensaje individual de los mensajes vocales e incluye parámetros intermedios basados en los estados de fluctuación de las tramas de voz del mensaje grabado de voz asociado. Un módulo de reproducción recibe una entrada que especifica un mensaje de voz grabado en la memoria que debe ser reproducido y la velocidad con la que el mensaje de voz grabado debe ser reproducido. En respuesta a esta entrada, el módulo de reproducción usa un conjunto de reglas de decisión para modificar el mensaje de voz especificado en base a los parámetros de las tramas de voz en la tabla de características asociada con el mensaje de voz especificado y la velocidad de reproducción especificada, antes de la reproducción del mensaje de voz especificado.
La presente invención proporciona un procedimiento para la gestión de datos de audio, según se define en la reivindicación 1, un medio accesible por máquina, según se define en la reivindicación 5, para la implementación de tal procedimiento y un aparato de ajuste de la velocidad de reproducción, según se define en la reivindicación 6. Notablemente, los datos de audio se convierten de un dominio temporal a un dominio frecuencial, se extraen características de los datos de audio en un dominio frecuencial y las tasas de cambio de las características extraídas en el dominio frecuencial se usan y se miden para generar uno o más parámetros de control de la velocidad de reproducción que son usados después para ajustar automáticamente la velocidad de reproducción de los datos de audio.
Breve descripción de los dibujos
Las características y las ventajas de las realizaciones de la presente invención están ilustradas a título de ejemplo y no se pretende que limiten el alcance de las realizaciones de la presente invención a las realizaciones particulares mostradas.
La Figura 1 es un diagrama de bloques de un sistema ejemplar en el cual puede implementarse una realización ejemplar de la presente invención.
La Figura 2 es un diagrama de bloques de una unidad de ajuste de la velocidad de reproducción según una realización ejemplar de la presente invención.
La Figura 3 es un diagrama de bloques de una unidad integradora de la tasa de cambio según una realización ejemplar de la presente invención.
La Figura 4 es un diagrama de flujo que ilustra un procedimiento para la gestión de datos de audio según una primera realización de la presente invención.
La Figura 5 es un diagrama de flujo que ilustra un procedimiento para la gestión de datos de audio según una segunda realización de la presente invención.
La Figura 6 es un diagrama de flujo que ilustra un procedimiento para la generación de un valor de control de la velocidad de reproducción según una realización de la presente invención.
Descripción detallada
En la descripción siguiente, se presenta nomenclatura específica con fines de explicación para proporcionar una comprensión cabal de realizaciones de la presente invención. Sin embargo, será evidente para un experto en la técnica que estos detalles específicos pueden no ser requeridos para poner en práctica las realizaciones de la presente invención. En otros casos, se muestran en forma de diagrama de bloques circuitos, dispositivos y procedimientos bien conocidos para evitar oscurecer innecesariamente realizaciones de la presente invención.
La Figura 1 es un diagrama de bloques de una primera realización de un sistema en el que puede implementarse una realización de la presente invención. El sistema es un sistema 100 de ordenador. El sistema 100 de ordenador incluye uno o más procesadores que procesan señales de datos. Según se muestra, el sistema 100 de ordenador incluye un primer procesador 101 y un procesador enésimo 105, pudiendo n ser cualquier número. Los procesadores 101 y 105 pueden ser microprocesadores de ordenador de conjunto complejo de instrucciones, microprocesadores informáticos de conjunto reducido de instrucciones, microprocesadores con palabras de instrucciones muy largas, procesadores que implementen una combinación de conjuntos de instrucciones u otros dispositivos procesadores. Los procesadores 101 y 105 pueden ser procesadores de núcleos múltiples, con múltiples núcleos procesadores en cada chip. Los procesadores 101 y 105 están acoplados a un bus 110 de CPU que transmite señales de datos entre los procesadores 101 y 105 y otros componentes en el sistema 100 de ordenador.
El sistema 100 de ordenador incluye una memoria 113. La memoria 113 incluye una memoria principal que puede ser un dispositivo de memoria dinámica de acceso aleatorio (DRAM). La memoria 113 puede almacenar instrucciones y código representados por señales de datos que pueden ser ejecutados por los procesadores 101 y
105. Una memoria de almacenamiento temporal (almacenamiento temporal del procesador) puede residir en cada uno de los procesadores 101 y 105 para almacenar señales de datos procedentes de la memoria 113. El almacenamiento temporal puede acelerar los accesos a memoria de los procesadores 101 y 105 aprovechando la localidad del acceso. En una realización alternativa del sistema 100 de ordenador, el almacenamiento temporal puede residir de forma externa a los procesadores 101 y 105.
Un controlador puente 111 de memoria está acoplado al bus 110 de CPU y a la memoria 113. El controlador puente 111 de memoria dirige señales de datos entre los procesadores 101 y 105, la memoria 113 y otros componentes en el sistema 100 de ordenador y comunica las señales de datos entre el bus 110 de CPU, la memoria 113 y un primer bus 120 de entrada/salida (E/S).
El primer bus 120 de E/S puede ser un solo bus o una combinación de múltiples buses. El primer bus 120 de E/S proporciona enlaces de comunicaciones entre componentes en el sistema 100 de ordenador. Un controlador 121 de red está acoplado al primer bus 120 de E/S. El controlador 121 de rey puede enlazar el sistema 100 de ordenador con una red de ordenadores (no mostrada) y soporta la comunicación entre las máquinas. Un controlador 122 del dispositivo de visualización está acoplado al primer bus 120 de E/S. El controlador 122 del dispositivo de visualización permite el acoplamiento de un dispositivo de visualización (no mostrado) al sistema 100 de ordenador y actúa como interfaz entre el dispositivo de visualización y el sistema 100 de ordenador.
Un segundo bus 130 de E/S puede ser un solo bus o una combinación de múltiples buses. El segundo bus 130 de E/S proporciona enlaces de comunicaciones entre componentes en el sistema 100 de ordenador. El dispositivo 131 3
de almacenamiento de datos está acoplado al segundo bus 130 de E/S. El dispositivo 131 de almacenamiento de datos puede ser una unidad de disco duro, una unidad de disquete flexible, un dispositivo de CD-ROM, un dispositivo de memoria flash u otro dispositivo de almacenamiento masivo. Una interfaz 132 de entrada está acoplada al segundo bus 130 de E/S. La interfaz 132 de entrada puede ser, por ejemplo, un teclado y/o un controlador de ratón u otra interfaz de entrada. La interfaz 132 de entrada puede ser un dispositivo dedicado o puede residir en otro dispositivo, como un controlador de bus u otro controlador. La interfaz 132 de entrada permite el acoplamiento de un dispositivo de entrada al sistema 100 de ordenador y transmite señales de datos desde un dispositivo de entrada al sistema 100 de ordenador. Un controlador 133 de audio está acoplado al segundo bus 130 de E/S. El controlador 133 de audio opera coordinando la grabación y la reproducción de sonidos. Un puente 123 de bus acopla el primer bus 120 de E/S al segundo bus 130 de E/S. El puente 123 de bus opera regulando y comunicando señales de datos entre el primer bus 120 de E/S y el segundo bus 130 de E/S.
Según una realización de la presente invención, una unidad 140 de ajuste de la velocidad de reproducción puede ser implementada en el sistema 100 de ordenador. Según una realización, el sistema 100 de ordenador lleva a cabo la gestión de los datos de audio en respuesta a la ejecución de secuencias de instrucciones por parte del procesador 101 en la memoria 113 representada por la unidad 140 de ajuste de la velocidad de reproducción. Tales instrucciones pueden ser leídas a la memoria 113 desde otros medios legibles por ordenador, tales como el almacenamiento 131 de datos o desde un ordenador conectado a la red por medio del controlador 112 de red. La ejecución de las secuencias de instrucciones en la memoria 113 hace que el procesador soporte la gestión de los datos de audio. Según una realización de la presente invención, la unidad 140 de ajuste de la velocidad de reproducción identifica una condición en los datos de audio. La unidad 140 de ajuste de la velocidad de reproducción ajusta automáticamente una velocidad de reproducción de los datos de audio en respuesta a la identificación de la condición. La condición puede ser, por ejemplo, una velocidad del habla, el ruido de fondo, una pausa rellenada u otra condición.
La Figura 2 es un diagrama de bloques de una unidad 200 de ajuste de la velocidad de reproducción según una realización ejemplar de la presente invención. La unidad 200 de ajuste de la velocidad de reproducción puede ser usada para implementar la unidad 140 de ajuste de la velocidad de reproducción mostrada en la Figura 1. Debería apreciarse que la unidad 200 de ajuste de la velocidad de reproducción puede residir en otros tipos de sistemas. La unidad 200 de ajuste de la velocidad de reproducción incluye una pluralidad de módulos que puede ser implementada en un soporte lógico. En realizaciones alternativas puede usarse circuitería de soporte físico en lugar en un soporte lógico, o en combinación con el mismo, para llevar a cabo la gestión de datos de audio. Así, las realizaciones de la presente invención no están limitadas a ninguna combinación específica de circuitería de soporte físico y de soporte lógico.
La unidad 200 de ajuste de la velocidad de reproducción incluye una unidad extractora 210 de características. La unidad extractora 210 de características extrae características de los datos de audio que recibe. Según una realización de la presente invención, la unidad extractora 210 de características transforma los datos de audio de un dominio temporal a un dominio frecuencial e identifica características en el dominio frecuencial. En una realización, las características pueden basarse en energías de subbanda. En esta realización, las características pueden ser identificarse usando coeficientes cepstrales de frecuencias Mel o usando otras técnicas o procedimientos. Según una realización alternativa, las características pueden basarse en características de fonema. En esta realización, las características de fonema pueden ser identificadas por coincidencia de patrones o clasificación de patrones contra señales de voz de referencia, usando un modelo oculto de Márkov, un alineamiento de Viterbi o saltos temporales dinámicos o usando otras técnicas o procedimientos. Debería apreciarse que las características pueden basarse en otras propiedades y ser identificadas usando otras técnicas.
La unidad 200 de ajuste de la velocidad de reproducción incluye una unidad integradora 220 de la tasa de cambio. La unidad integradora 220 de la tasa de cambio reconoce una condición en la que los datos de audio incluyen un habla que es producida con una velocidad que ha cambiado. Según una realización, la unidad integradora 220 de la tasa de cambio produce una salida que corresponde a la tasa de cambio, promediada en el tiempo, de las características desde la unidad 210. El integrador 220 de la tasa de cambio puede generar un valor de control de la velocidad de reproducción que puede ser usado para ajustar la velocidad de reproducción de los datos de audio. Según una realización en la que las características se basan en energías de subbanda, la unidad integradora 220 de la tasa de cambio puede medir una diferencia entre muestras consecutivas de una característica. Tomando una media de las mediciones de una pluralidad de características, se identifica una tasa global de cambio de las características. La tasa de cambio puede usarse para determinar una tasa de cambio del habla y un valor apropiado de control de la velocidad de reproducción que ha de ser generado. Según una realización en la que las características se basan en fonemas, la tasa de cambio de las clasificaciones de fonemas pueden ser promediadas en el tiempo para generar un valor apropiado de control de la velocidad de reproducción.
La unidad 200 de ajuste de la velocidad de reproducción puede incluir una unidad comparadora 230. La unidad comparadora 230 reconoce cuándo hay presentes otras condiciones en los datos de audio. La unidad comparadora 230 puede generar uno o más valores de control de la velocidad de reproducción que pueden ser usados para ajustar la velocidad de reproducción de los datos de audio en base a las condiciones. Según una realización de la unidad 200 de ajuste de la velocidad de reproducción, la unidad comparadora 230 puede comparar las
características de los datos de audio con características en modelos de voz que pueden reflejar condiciones diferentes. Las características de los datos de audio pueden compararse con modelos de voz que reflejan cantidades altas y bajas de ruido de fondo para determinar un grado de ruido de fondo presente en los datos de audio y la calidad de la grabación. Según una realización de la presente invención, si hay presente un grado elevado de ruido de fondo en los datos de audio, la unidad comparadora 230 genera un valor de control de la velocidad de reproducción que disminuye una velocidad de reproducción. Las características de los datos de audio pueden ser comparadas con modelos de voz que reflejan pausas en el habla o pausas rellenadas con expresiones que no contribuyen al contenido de los datos de audio para determinar si puede acelerarse o editarse una porción de los datos de audio durante la reproducción. Debería apreciarse que también pueden detectarse de forma similar otras condiciones. Por ejemplo, la unidad comparadora 230 puede generar valores de control de la velocidad de reproducción para ajustar la velocidad de reproducción de los datos de audio en base a cambios en imágenes de vídeo.
La unidad 200 de ajuste de la velocidad de reproducción incluye una unidad 240 de procesamiento de datos de audio. La unidad 240 de procesamiento de datos de audio recibe uno o más valores de control de la velocidad de reproducción. Cuando la unidad 240 de procesamiento de datos de audio recibe más de un valor de control de la velocidad de reproducción, puede tomar una media de los valores, calcular una media ponderada de los valores o tomar un valor mínimo o máximo. La unidad 240 de procesamiento de datos de audio también recibe los datos de audio que deben reproducirse y ajusta una velocidad de reproducción de los datos de audio en respuesta a los uno o más valores de control de la velocidad de reproducción. Según una realización de la presente invención, la unidad 240 de procesamiento de datos de audio puede ajustar la velocidad de reproducción llevando a cabo un muestreo selectivo, solapamiento y suma sincronizados, escalado armónico o llevando a cabo otros procedimientos u otras técnicas.
La unidad 200 de ajuste de la velocidad de reproducción puede incluir una unidad 250 de retardo temporal. La unidad 250 de retardo temporal retarda el momento en el que la unidad 240 de procesamiento de datos de audio recibe los datos de audio. Insertando un retardo, la unidad 250 de retardo temporal permite que la unidad integradora 220 de la tasa de cambio y la unidad comparadora 230 analicen las características de los datos de audio y generen valores apropiados de control de la velocidad de reproducción antes de que los datos de audio sean reproducidos por la unidad 240 de procesamiento de datos de audio.
Según una realización de la unidad 200 de ajuste de la velocidad de reproducción, la unidad extractora 210 de características, la unidad integradora 220 de la tasa de cambio, la unidad comparadora 230, la unidad 240 de procesamiento de datos de audio y la unidad 250 de retardo temporal pueden ser implementadas usando cualquier procedimiento, técnica o circuitería apropiados. Debería apreciarse que algunos de los componentes mostrados pueden ser opcionales, tales como la unidad comparadora 230 y la unidad 250 de retardo temporal.
La Figura 3 es un diagrama de bloques de una unidad integradora 300 de la tasa de cambio según una realización ejemplar de la presente invención. La unidad integradora 300 de la tasa de cambio puede ser implementada como una realización de la unidad integradora 220 de la tasa de cambio mostrada en la Figura 2. La unidad integradora 300 de la tasa de cambio incluye una pluralidad de unidades de diferencia. Según una realización de la unidad integradora 300 de la tasa de cambio, se proporciona una unidad de diferencia para cada tipo de característica procesada por la unidad integradora 300 de la tasa de cambio. El bloque 310 representa una primera unidad de diferencia. El bloque 311 representa una enésima unidad de diferencia, pudiendo ser n cualquier número. Las unidades 310 y 311 de diferencia comparan las propiedades de las características recibidas desde una unidad extractora de características de diferentes periodos de tiempo y calculan un valor absoluto de la diferencia (valor absoluto de la diferencia). Por ejemplo, la unidad 310 de diferencia puede calcular el valor absoluto de la diferencia de una característica de un primer tipo identificada en el instante t y de una característica del primer tipo identificada en t-1. La unidad 311 de diferencia puede calcular el valor absoluto de la diferencia de una característica de un segundo tipo identificada en el instante t y una característica del segundo tipo identificada en t-1.
La unidad integradora 300 de la tasa de cambio puede incluir una pluralidad de unidades de ponderación opcionales. Según una realización de la unidad integradora 300 de la tasa de cambio, se proporciona una unidad de ponderación para cada tipo de característica procesado por la unidad integradora 300 de la tasa de cambio. El bloque 320 representa una primera unidad de ponderación. El bloque 321 representa una enésima unidad de ponderación. Cada unidad de ponderación pondera el valor absoluto de la diferencia de un tipo de característica. Las unidades 320 y 321 de ponderación pueden aplicar un coeficiente de ponderación a los valores absolutos de la diferencia en base a las propiedades de las características.
La unidad integradora 300 de la tasa de cambio incluye una unidad sumadora 330. La unidad sumadora 330 suma los valores absolutos ponderados de diferencias recibidos por las unidades 320 y 321 de ponderación.
La unidad integradora 300 de la tasa de cambio incluye una unidad 340 de control de la velocidad de reproducción. La unidad 340 de control de la velocidad de reproducción genera un valor de control de la velocidad de reproducción a partir de la suma de los valores absolutos ponderados de diferencias. Según una realización de la unidad integradora 300 de la tasa de cambio, la unidad 340 de control de la velocidad de reproducción toma una media de
la suma de los valores absolutos ponderados de diferencias. Según una realización alternativa, la unidad 340 de control de la velocidad de reproducción integra la suma de los valores absolutos ponderados de diferencias en un periodo de tiempo.
La Figura 4 es un diagrama de flujo que ilustra un procedimiento para la gestión de datos de audio según una primera realización de la presente invención. En 401, los datos de audio son transformados de un dominio temporal a un dominio frecuencial. Según una realización de la presente invención, puede aplicarse una transformada rápida de Fourier a los datos de audio para transformarlos de un dominio temporal a un dominio frecuencial.
En 402, se identifican características de los datos de audio transformados al dominio frecuencial. Según una realización de la presente invención, las características pueden basarse en energías de subbanda. En esta realización, las características se identifican usando coeficientes cepstrales de frecuencias Mal. Según una realización alternativa de la presente invención, las características puede basarse en características de fonemas.
En 403, se genera una medida de la tasa de cambio de las características. Según una realización de la presente invención, la medida de la tasa de cambio de las características puede ser generada analizando las características de los datos de audio. La medida de la tasa de cambio de las características puede ser usada para identificar una condición en la que ha cambiado una velocidad vocal de una persona que habla. Según una realización de la presente invención, se genera un valor de control de la velocidad de reproducción.
En 404, se ajusta una velocidad de reproducción de los datos de audio. El ajuste se basa en la tasa de cambio de las características determinada en 403, según se refleja por medio del valor de control de la velocidad de reproducción. Según una realización de la presente invención, la velocidad de reproducción del audio puede ajustarse llevando a cabo un muestreo selectivo, solapamiento y suma sincronizados, escalado armónico o llevando a cabo otros procedimientos.
La Figura 5 es un diagrama de flujo que ilustra un procedimiento para la gestión de datos de audio según una segunda realización de la presente invención. En 501, los datos de audio son transformados de un dominio temporal a un dominio frecuencial. Según una realización de la presente invención, puede aplicarse una transformada rápida de Fourier a los datos de audio para transformarlos de un dominio temporal a un dominio frecuencial.
En 502, se identifican características de los datos de audio transformados al dominio frecuencial. Según una realización de la presente invención, las características pueden basarse en energías de subbanda. En esta realización, las características se identifican usando coeficientes cepstrales de frecuencias Mel. Según una realización alternativa de la presente invención, las características puede basarse en características de fonemas.
En 503, se genera una medida de la tasa de cambio de las características. Según una realización de la presente invención, la medida de la tasa de cambio de las características puede ser generada analizando las características de los datos de audio. La medida de la tasa de cambio de las características puede ser usada para identificar una condición en la que ha cambiado una velocidad vocal de una persona que habla. Según una realización de la presente invención, se genera un valor de control de la velocidad de reproducción.
En 504, se comparan las características de los datos de audio identificados en 502 con características en modelos de voz que reflejan condiciones diferentes para determinar la presencia de las condiciones. Por ejemplo, pueden compararse características de los datos de audio con modelos de voz que reflejan cantidades altas y bajas de ruido de fondo para determinar un grado de ruido de fondo presente en los datos de audio. Las características de los datos de audio pueden ser comparadas también con modelos de voz que reflejan pausas en el habla o pausas rellenadas con expresiones que no contribuyen al contenido de los datos de audio para determinar si puede acelerarse una porción de los datos de audio durante la reproducción o si puede eliminarse u omitirse. Debería apreciarse que también pueden detectarse otras condiciones. Según una realización de la presente invención, se generan uno o más valores de control de la velocidad de reproducción.
En 505, se determina un ajuste de la velocidad de reproducción a partir de los valores de control de la velocidad de reproducción generados. Según una realización de la presente invención, los valores de control de la velocidad de reproducción son promediados para determinar el grado de ajuste a realizar en la velocidad de reproducción de los datos de audio. Según una realización alternativa de la presente invención, se toma una media ponderada de los valores de control de la velocidad de reproducción para determinar el grado de ajuste a realizar en la velocidad de reproducción de los datos de audio.
En 506, se ajusta una velocidad de reproducción de los datos de audio. El ajuste se basa en la media o la media ponderada de los valores de control de la velocidad de reproducción generados. Según una realización de la presente invención, la velocidad de reproducción del audio puede ajustarse llevando a cabo un muestreo selectivo, solapamiento y suma sincronizados, escalado armónico o llevando a cabo otros procedimientos.
La Figura 6 es un diagrama de flujo que ilustra un procedimiento para la generación de un valor de control de la velocidad de reproducción según una realización de la presente invención. El procedimiento mostrado en la Figura 6 puede ser usado para implementar los bloques 403 y 503 mostrados en las Figuras 4 y 5. En 601, se determinan
valores absolutos de diferencias para una pluralidad de tipos de características. Según una realización de la presente invención, el valor absoluto se toma de la diferencia de cada tipo de característica medida en un primer instante y un segundo instante.
En 602, se ponderan los valores absolutos de diferencias de los tipos de características. Según una realización de la presente invención, los valores absolutos de diferencias de los tipos de características se ponderan en base a propiedades de las características.
En 603, se suman conjuntamente los valores absolutos ponderados de diferencias.
En 604, se genera un valor de control de la velocidad de reproducción a partir de la suma de los valores absolutos ponderados de diferencias. Según una realización de la presente invención, se toma una media de la suma de los valores absolutos ponderados de diferencias. Según una realización alternativa, la suma de los valores absolutos ponderados de diferencias se integra en un periodo de tiempo.
Según una realización de la presente invención, un procedimiento de gestión de los datos de audio incluye la identificación de una condición en los datos de audio y el ajuste automático de una velocidad de reproducción de los datos de audio en respuesta a la identificación de la condición. La condición puede incluir un cambio producido en la velocidad del habla, la presencia de ruido de fondo, la presencia de una pausa o de una pausa rellenada en el habla. Ajustando automáticamente la velocidad de reproducción, las realizaciones de la presente invención permiten que los oyentes se concentren en los datos de audio que se están reproduciendo sin tener que distraerse por tener que ajustar manualmente la velocidad de reproducción.
Las Figuras 4-6 son diagramas de flujo que ilustran procedimientos según realizaciones de la presente invención. algunas de las técnicas ilustrados en estas figuras pueden llevarse a cabo secuencialmente, en paralelo o en un orden distinto del descrito. Debería apreciarse que no se requiere que se lleven a cabo todas las técnicas descritas, que pueden añadirse técnicas adicionales o que algunas de las técnicas ilustradas pueden ser sustituidas con otras técnicas.
Las realizaciones de la presente invención pueden ser proporcionadas como un producto de programa de ordenador, o soporte lógico, que puede incluir un artículo fabricado en un medio accesible por máquina o legible por máquina que tiene instrucciones. Las instrucciones en el medio accesible por máquina o legible por máquina pueden ser usadas para programar un sistema de ordenador u otro dispositivo electrónico. El medio legible por máquina puede incluir, sin limitación, disquetes flexibles, discos ópticos, CD-ROM y discos magneto-ópticos u otro tipo de medios/medio legible por máquina adecuados para almacenar o transmitir instrucciones electrónicas. Las técnicas descritas en el presente documento no están limitadas a ninguna configuración particular de soporte lógico. Pueden encontrar aplicabilidad en cualquier entorno informático o de procesamiento. Las expresiones “medio accesible por máquina” o “medio legible por máquina” usadas en el presente documento incluirán cualquier medio que sea capaz de almacenar, codificar o transmitir una secuencia de instrucciones para su ejecución por una máquina y que hagan que la máquina lleve a cabo uno cualquiera de los procedimientos descritos en el presente documento. Además, es común en la técnica hablar de que un soporte lógico, en una u otra forma (por ejemplo, programa, procedimiento, proceso, aplicación, módulo, unidad, lógica, etcétera) emprenda una acción o provoque un resultado. Tales expresiones son meramente una forma apropiada de enunciar que la ejecución del soporte lógico por un sistema de procesamiento hace que el procesador lleve a cabo una acción para producir un resultado.
En la anterior memoria, las realizaciones de la presente invención han sido descritas con referencia a realizaciones ejemplares específicas de la misma. Sin embargo, será evidente que pueden realizarse a la misma diversas modificaciones y diversos cambios sin apartarse del espíritu y el alcance más amplios de las realizaciones de la presente invención. En consecuencia, la memoria y los dibujos han de ser considerados en un sentido ilustrativo, no restrictivo.
Claims (7)
- REIVINDICACIONES1. Un procedimiento para el ajuste automático de la velocidad de reproducción de datos de audio que comprende:identificar (502) una primera condición en los datos de audio relativa a una velocidad del habla y una segunda condición en los datos de audio relativa a ruido de fondo convirtiendo (501) los datos de audio 5 desde un dominio temporal a un dominio frecuencial, extrayendo características de los datos de audio en el dominio frecuencial y midiendo (503) una tasa de cambio de las características extraídas en el dominio frecuencial generando uno o más valores (401-403; 501-503) de control de la velocidad de reproducción en respuesta a la primera condición, y comparar (504) las características con un modelo de voz para generar uno o más valores adicionales de control de la velocidad de reproducción en respuesta a la segunda10 condición; yajustar automáticamente (506) una velocidad de reproducción de los datos de audio en respuesta a todos los valores (404; 506) de control de la velocidad de reproducción.
- 2. El procedimiento de la reivindicación 1 en el que el ajuste automático de una velocidad de reproducción de los datos de audio en respuesta a todos los valores de control de la velocidad de reproducción comprende:15 tomar una media de todos los valores de control de la velocidad de reproducción generados; yaplicar la media de todos los valores (506) de control de la velocidad de reproducción.
- 3. El procedimiento de la reivindicación 1 en el que las características comprenden, al menos, una de:
- (a)
- energías de subbanda; o
- (b)
- características (502) de fonema.
- 20 4. El procedimiento de la reivindicación 1 en el que el ajuste de la velocidad de reproducción de los datos de audio comprende llevar a cabo, al menos, uno de:
- (a)
- muestreo selectivo;
- (b)
- solapamiento y suma sincronizados; o
- (c)
- escalado armónico.
- 25 5. Un medio de almacenamiento de instrucciones accesible por máquina que, cuando se ejecuta, hace que la máquina lleve a cabo el procedimiento de una cualquiera de las reivindicaciones 1-4.
- 6. Un aparato (200) de ajuste de la velocidad de reproducción que comprende:una unidad extractora (210) de características para convertir datos de audio de un dominio temporal a un dominio frecuencial e identificar características de los datos de audio en el dominio frecuencial;30 una unidad integradora (220) de la tasa de cambio para identificar una condición relativa a una velocidad del habla a partir del cambio de la tasa de las características identificadas en el dominio frecuencial y generar uno o más valores de control de la velocidad de reproducción;una unidad comparadora (230) para comparar las características de los datos de audio identificados en el dominio frecuencial con características en modelos de voz para identificar una condición relativa al ruido de35 fondo y para generar otro u otros valores de control de la velocidad de reproducción; yuna unidad procesadora (240) de datos de audio para ajustar una velocidad de reproducción de los datos de audio en respuesta a todos los valores de control de la velocidad de reproducción.
- 7. El ajuste de la velocidad de reproducción de la reivindicación 6 en el que la unidad procesadora (240) de datosde audio toma una media de los uno o más valores de control de la velocidad de reproducción generados a 40 partir del integrador de la tasa de cambio y de la unidad comparadora.
- 8. El aparato de ajuste de la velocidad de reproducción de la reivindicación 6 en el que la unidad procesadora(240) de datos de audio toma una media ponderada de los uno o más valores de control de la velocidad de reproducción generados a partir del integrador de la tasa de cambio y de la unidad comparadora.
- 9. El aparato de ajuste de la velocidad de reproducción de la reivindicación 6 en el que la unidad procesadora45 (240) de datos de audio toma un mínimo o un máximo de los uno o más valores de control de la velocidad de reproducción generados a partir del integrador de la tasa de cambio y de la unidad comparadora.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US411074 | 1989-09-22 | ||
| US11/411,074 US20070250311A1 (en) | 2006-04-25 | 2006-04-25 | Method and apparatus for automatic adjustment of play speed of audio data |
| PCT/US2007/067013 WO2007127671A1 (en) | 2006-04-25 | 2007-04-19 | Method and apparatus for automatic adjustment of play speed of audio data |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2377017T3 true ES2377017T3 (es) | 2012-03-21 |
Family
ID=38620546
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES07760954T Active ES2377017T3 (es) | 2006-04-25 | 2007-04-19 | Procedimiento y aparato para el ajuste automático de la velocidad de reproducción de datos de audio |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US20070250311A1 (es) |
| EP (1) | EP2011118B1 (es) |
| CN (1) | CN101427314B (es) |
| AT (1) | ATE543180T1 (es) |
| ES (1) | ES2377017T3 (es) |
| WO (1) | WO2007127671A1 (es) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20220270632A1 (en) * | 2018-08-03 | 2022-08-25 | Sling Media Pvt. Ltd | Systems and methods for intelligent playback |
Families Citing this family (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20060209210A1 (en) * | 2005-03-18 | 2006-09-21 | Ati Technologies Inc. | Automatic audio and video synchronization |
| TWI442773B (zh) | 2006-11-30 | 2014-06-21 | Dolby Lab Licensing Corp | 抽取視訊與音訊信號內容之特徵以提供此等信號之可靠識別的技術 |
| JP2010283605A (ja) * | 2009-06-04 | 2010-12-16 | Canon Inc | 映像処理装置及び方法 |
| GB2493413B (en) * | 2011-07-25 | 2013-12-25 | Ibm | Maintaining and supplying speech models |
| US10158825B2 (en) * | 2015-09-02 | 2018-12-18 | International Business Machines Corporation | Adapting a playback of a recording to optimize comprehension |
| CN105869626B (zh) * | 2016-05-31 | 2019-02-05 | 宇龙计算机通信科技(深圳)有限公司 | 一种语速自动调节的方法及终端 |
| CN114930865A (zh) * | 2020-01-07 | 2022-08-19 | 杜比实验室特许公司 | 用于设置包括音频的媒体内容的回放速度的计算机实施的方法、设备和计算机程序产品 |
| CN111356010A (zh) * | 2020-04-01 | 2020-06-30 | 上海依图信息技术有限公司 | 一种获取音频最适播放速度的方法与系统 |
| CN113542874B (zh) * | 2020-12-31 | 2025-02-21 | 腾讯科技(深圳)有限公司 | 信息播放控制方法、装置、设备及计算机可读存储介质 |
| CN113395545B (zh) * | 2021-06-10 | 2023-02-28 | 北京字节跳动网络技术有限公司 | 视频处理、视频播放方法、装置、计算机设备及存储介质 |
| US11922824B2 (en) | 2022-03-23 | 2024-03-05 | International Business Machines Corporation | Individualized media playback pacing to improve the listener's desired outcomes |
| CN120220730B (zh) * | 2025-05-28 | 2025-08-22 | 嘉石科技股份有限公司 | 一种基于智能声频监控的智慧水务语音播报方法及系统 |
Family Cites Families (24)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5664227A (en) * | 1994-10-14 | 1997-09-02 | Carnegie Mellon University | System and method for skimming digital audio/video data |
| EP0797822B1 (en) * | 1994-12-08 | 2002-05-22 | The Regents of the University of California | Method and device for enhancing the recognition of speech among speech-impaired individuals |
| JP4132109B2 (ja) * | 1995-10-26 | 2008-08-13 | ソニー株式会社 | 音声信号の再生方法及び装置、並びに音声復号化方法及び装置、並びに音声合成方法及び装置 |
| KR970023192A (ko) * | 1995-10-31 | 1997-05-30 | 김광호 | 음성신호 자동변속재생방법 |
| US5828994A (en) * | 1996-06-05 | 1998-10-27 | Interval Research Corporation | Non-uniform time scale modification of recorded audio |
| US6009386A (en) * | 1997-11-28 | 1999-12-28 | Nortel Networks Corporation | Speech playback speed change using wavelet coding, preferably sub-band coding |
| US6374225B1 (en) * | 1998-10-09 | 2002-04-16 | Enounce, Incorporated | Method and apparatus to prepare listener-interest-filtered works |
| US6292776B1 (en) * | 1999-03-12 | 2001-09-18 | Lucent Technologies Inc. | Hierarchial subband linear predictive cepstral features for HMM-based speech recognition |
| US6278387B1 (en) * | 1999-09-28 | 2001-08-21 | Conexant Systems, Inc. | Audio encoder and decoder utilizing time scaling for variable playback |
| US6505153B1 (en) * | 2000-05-22 | 2003-01-07 | Compaq Information Technologies Group, L.P. | Efficient method for producing off-line closed captions |
| KR100403238B1 (ko) * | 2000-09-30 | 2003-10-30 | 엘지전자 주식회사 | 비디오의 지능형 빨리 보기 시스템 |
| AU2002213338A1 (en) * | 2000-10-16 | 2002-04-29 | Eliza Corporation | Method of and system for providing adaptive respondent training in a speech recognition application |
| US7610205B2 (en) * | 2002-02-12 | 2009-10-27 | Dolby Laboratories Licensing Corporation | High quality time-scaling and pitch-scaling of audio signals |
| US20020188745A1 (en) * | 2001-06-11 | 2002-12-12 | Hughes David A. | Stacked stream for providing content to multiple types of client devices |
| KR20030048303A (ko) * | 2001-12-12 | 2003-06-19 | 주식회사 하빈 | 주위환경 자동적응형 디지털 오디오 재생장치 |
| US7149412B2 (en) * | 2002-03-01 | 2006-12-12 | Thomson Licensing | Trick mode audio playback |
| GB0228245D0 (en) * | 2002-12-04 | 2003-01-08 | Mitel Knowledge Corp | Apparatus and method for changing the playback rate of recorded speech |
| EP1469457A1 (en) * | 2003-03-28 | 2004-10-20 | Sony International (Europe) GmbH | Method and system for pre-processing speech |
| US6999922B2 (en) * | 2003-06-27 | 2006-02-14 | Motorola, Inc. | Synchronization and overlap method and system for single buffer speech compression and expansion |
| US7464028B2 (en) * | 2004-03-18 | 2008-12-09 | Broadcom Corporation | System and method for frequency domain audio speed up or slow down, while maintaining pitch |
| US8032360B2 (en) * | 2004-05-13 | 2011-10-04 | Broadcom Corporation | System and method for high-quality variable speed playback of audio-visual media |
| US7844464B2 (en) * | 2005-07-22 | 2010-11-30 | Multimodal Technologies, Inc. | Content-based audio playback emphasis |
| US7664558B2 (en) * | 2005-04-01 | 2010-02-16 | Apple Inc. | Efficient techniques for modifying audio playback rates |
| US8050541B2 (en) * | 2006-03-23 | 2011-11-01 | Motorola Mobility, Inc. | System and method for altering playback speed of recorded content |
-
2006
- 2006-04-25 US US11/411,074 patent/US20070250311A1/en not_active Abandoned
-
2007
- 2007-04-19 CN CN200780014500.9A patent/CN101427314B/zh not_active Expired - Fee Related
- 2007-04-19 WO PCT/US2007/067013 patent/WO2007127671A1/en not_active Ceased
- 2007-04-19 EP EP07760954A patent/EP2011118B1/en not_active Not-in-force
- 2007-04-19 AT AT07760954T patent/ATE543180T1/de active
- 2007-04-19 ES ES07760954T patent/ES2377017T3/es active Active
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20220270632A1 (en) * | 2018-08-03 | 2022-08-25 | Sling Media Pvt. Ltd | Systems and methods for intelligent playback |
| US11972770B2 (en) * | 2018-08-03 | 2024-04-30 | Dish Network Technologies India Private Limited | Systems and methods for intelligent playback |
| US12562182B2 (en) | 2018-08-03 | 2026-02-24 | Dish Network Technologies India Private Limited | Systems and methods for intelligent playback |
Also Published As
| Publication number | Publication date |
|---|---|
| ATE543180T1 (de) | 2012-02-15 |
| WO2007127671A1 (en) | 2007-11-08 |
| EP2011118A1 (en) | 2009-01-07 |
| EP2011118B1 (en) | 2012-01-25 |
| CN101427314B (zh) | 2013-09-25 |
| CN101427314A (zh) | 2009-05-06 |
| EP2011118A4 (en) | 2010-09-22 |
| US20070250311A1 (en) | 2007-10-25 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP2011118B1 (en) | Method and apparatus for automatic adjustment of play speed of audio data | |
| Uchanski et al. | Speaking clearly for the hard of hearing IV: Further studies of the role of speaking rate | |
| US9916842B2 (en) | Systems, methods and devices for intelligent speech recognition and processing | |
| JP5750380B2 (ja) | 音声翻訳装置、音声翻訳方法および音声翻訳プログラム | |
| JPH10312467A (ja) | 像合成のための自動スピーチ整列方法 | |
| WO2017006766A1 (ja) | 音声対話方法および音声対話装置 | |
| EP4558988A1 (en) | Intelligent speech or dialogue enhancement | |
| US11727949B2 (en) | Methods and apparatus for reducing stuttering | |
| WO2007112176A2 (en) | System and method for altering playback speed of recorded content | |
| US20200075000A1 (en) | System and method for broadcasting from a group of speakers to a group of listeners | |
| US12142264B1 (en) | Noise reduction in shared workspaces | |
| Muckenhirn et al. | Presentation attack detection using long-term spectral statistics for trustworthy speaker verification | |
| JP2015222847A (ja) | 音声処理装置、音声処理方法および音声処理プログラム | |
| WO2023132653A1 (en) | Method and device for managing audio based on spectrogram | |
| US12315490B2 (en) | Text-to-speech and speech recognition for noisy environments | |
| US20250246197A1 (en) | Synthesizing audio for synchronous communication | |
| US20040054524A1 (en) | Speech transformation system and apparatus | |
| JP2015187738A (ja) | 音声翻訳装置、音声翻訳方法および音声翻訳プログラム | |
| Saukh et al. | Quantle: fair and honest presentation coach in your pocket | |
| Tajiri et al. | Acoustic evaluation of voice signal distortion by videoconferencing platforms and devices used in telepractice for cleft palate | |
| JP2001154684A (ja) | 話速変換装置 | |
| KR20260047982A (ko) | 오디오 배속 방법 및 오디오 배속 장치 | |
| JP2004133231A (ja) | 外国語会話学習用記憶媒体,音出力装置及び配信装置 | |
| WO2026094564A1 (ja) | 変換装置、変換方法、および記録媒体 | |
| JP4297433B2 (ja) | 音声合成方法及びその装置 |