ES2271084T3 - Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. - Google Patents

Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. Download PDF

Info

Publication number
ES2271084T3
ES2271084T3 ES01982239T ES01982239T ES2271084T3 ES 2271084 T3 ES2271084 T3 ES 2271084T3 ES 01982239 T ES01982239 T ES 01982239T ES 01982239 T ES01982239 T ES 01982239T ES 2271084 T3 ES2271084 T3 ES 2271084T3
Authority
ES
Spain
Prior art keywords
voice
signal
output
voice signal
macro
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES01982239T
Other languages
English (en)
Inventor
John Gerard Beerends
Andries Pieter Hekstra
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Koninklijke KPN NV
Original Assignee
Koninklijke KPN NV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Koninklijke KPN NV filed Critical Koninklijke KPN NV
Application granted granted Critical
Publication of ES2271084T3 publication Critical patent/ES2271084T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/69Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for evaluating synthetic or decoded voice signals
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Monitoring And Testing Of Exchanges (AREA)
  • Telephonic Communication Services (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Tests Of Electronic Circuits (AREA)
  • Testing, Inspecting, Measuring Of Stereoscopic Televisions And Televisions (AREA)

Abstract

Método de evaluación de calidad de voz objetiva basada en la salida, en el que una señal de voz de salida degradada que comprende una parte de información de voz se compara con una señal de referencia recuperada a partir de dicha señal de voz de salida, caracterizado porque dicha señal de referencia se proporciona mediante aproximación perceptual de dicha parte de información de voz de dicha señal de voz de salida usando un recodificador de voz que produce una señal de voz de referencia de tasa de transferencia de bits finita.

Description

Método y dispositivo para evaluación de calidad de voz objetiva sin señal de referencia.
Campo de la invención
La presente invención se refiere en general a la evaluación de calidad de voz y, más en particular, a un método y un dispositivo para la evaluación objetiva de calidad de voz de una señal de salida sin implicar oyentes humanos, tal como una señal de salida recibida en un sistema de telecomunicaciones inalámbrico y señales de voz transmitidas según voz sobre protocolo de Internet (VoIP).
Antecedentes de la invención
La evaluación de calidad de voz proporciona la optimización del control y diseño de algoritmos y equipamientos de codificación y transmisión de voz.
Los métodos de evaluación de calidad de voz que implican esquemas de calificación de oyentes humanos tales como, por ejemplo, la puntuación de opinión media (MOS, Mean Opinion Score) o la medida de aceptabilidad diagnóstica (DAM, Diagnostic Acceptability Measure), proporcionan una medida de calidad subjetiva.
Este tipo de evaluación de calidad de voz es bastante cara y requiere instalaciones apropiadas y equipos y condiciones de prueba.
Para evitar los oyentes humanos, se han propuestos mediciones de voz objetivas, que intentan estimar o predecir la calidad de voz subjetiva usando expresiones matemáticas.
Normalmente, los métodos de evaluación de calidad de voz objetiva se basan en una comparación de la señal de voz de entrada original limpia y sin distorsión con la señal de voz de salida degradada. Sin embargo, en la práctica, la señal de entrada original limpia normalmente no está disponible en la salida del sistema o dispositivo que está siendo sometido a prueba.
La solicitud de patente internacional WO-A-96/06495 propone analizar ciertas características estadísticas de la voz que son independientes del hablante para determinar en qué medida se ha modificado o distorsionado la señal de salida por un enlace de telecomunicaciones, por ejemplo, sin requerir la señal de entrada limpia y sin distorsión.
Con el mismo fin, la solicitud de patente internacional WO-A-96/06496 da a conocer el análisis por un medio de reconocimiento de voz el contenido de una señal recibida. El resultado de este análisis se procesa por un sintetizador de voz para generar una señal de voz sin distorsiones.
La solicitud de patente internacional WO-A-97/05730 da a conocer la medida de calidad de voz usando análisis de tracto vocal y una red neuronal para producir una señal de referencia como una réplica de la señal de entrada limpia.
El reconocimiento de voz, la síntesis de voz y la adaptación de la señal sintetizada a la voz y otras propiedades del hablante de la señal degradada, con el fin de proporcionar una señal de referencia para la comparación con la señal de voz degradada para evaluar la calidad de voz de la misma, comprende en la práctica tareas intensivas desde el punto de vista informático con una precisión limitada.
Sin embargo, es imposible reconstruir a partir de la señal de voz degradada una señal de referencia que sea igual a la señal de voz de entrada original.
Además la señal de referencia está disponible con un retardo que impide una retroalimentación a tiempo para objetivos de control para mejorar la calidad de voz si la calidad evaluada está por debajo de un nivel establecido.
Sumario de la invención
La invención pretende superar las tareas intensivas desde el punto de vista informático y el retardo inherente provocado por ello, evaluando la calidad de voz objetiva basada en la salida.
La invención proporciona un nuevo método de evaluación de calidad de voz objetiva basada en la salida, en el que una señal de voz de salida degradada que comprende una parte información de voz se compara con una señal de referencia recuperada de la señal de voz de salida, y se caracteriza porque la señal de referencia se proporciona mediante aproximación perceptual de la parte de información de voz de la señal de voz de salida usando un recodificador de voz que produce una señal de voz de referencia de entropía finita, que proporciona un número finito de bits por segundo, es decir una tasa de transferencia de bits.
La invención se basa en la idea de que al procesar la señal de voz distorsionada usando un recodificador de voz que realiza una aproximación perceptual con tasa de transferencia de bits finita, la parte de información de voz de la señal de voz de salida degradada se reproduce de manera objetiva según las propiedades del recodificador de voz, proporcionando una señal de voz de referencia para una evaluación objetiva de la calidad de la voz.
Usando un recodificador de voz según la presente invención, no son necesarios cálculos y procesamiento informáticos extensivos para la extracción de parámetros de voz y similares de la voz de salida que está en prueba, de modo que no se introducen retardos indebidos.
Un códec de voz (codificador de voz/decodificador de voz) es un dispositivo mediante el que se procesa perceptualmente una señal de voz en una señal de un número finito de bits por segundo. En consecuencia, en una realización preferida del método según la invención, la señal de referencia se proporciona recodificando la señal de voz de salida degradada usando un códec de voz de referencia (recodificador), tal como un códec que funciona según la norma ITU-T G.729 o la norma ETSI 6.71, por ejemplo.
El recodificador debería (de manera ideal) ser esencialmente transparente para señales de voz limpias y sin distorsión y esencialmente no transparente para señales de voz distorsionadas en la medida en que es una medida de la distorsión de la señal de voz.
Es decir, si la señal degradada contiene una cantidad molesta de ruido de fondo, por ejemplo, el recodificador debería "distorsionar" la señal, por ejemplo suprimiendo el ruido de fondo o debería "degradar" la señal de voz de salida debido al consumo de bits por el ruido. En caso de que un sistema de transmisión de voz en prueba sea transparente, la medida de calidad objetiva debería también predecir tal transparencia, lo que se consigue mediante un recodificador que es casi transparente para una señal de voz limpia.
En comparación con los métodos de la técnica anterior resumidos anteriormente, la invención adopta un enfoque mucho más pragmático y se centra en la derivación de una señal de voz de referencia a partir de la parte de información de voz de la señal de voz de salida degradada que presenta una distancia perceptual respecto a la señal de voz degradada que es una medida del grado en que se ha distorsionado la señal de voz degradada.
En consecuencia, en una realización adicional del método según la invención, la comparación de la señal de referencia y la señal de voz de salida degradada comprende el cálculo de la distancia perceptual entre la señal de voz de salida y la señal de referencia.
En general, la señal de voz recodificada tendrá un menor grado de calidad de voz subjetiva que la entrada original. Como una medida de la distancia perceptual puede usarse cualquier modelo psicoacústico de la audición humana, tal como ITU-T P.861 o PSQM99 sometido a evaluación de rendimiento (benchmarking) por ITU-T SG12/pregunta 13. La medida de distancia perceptual puede determinarse con mayor precisión adaptando la medida perceptual al tipo de recodificador y/o viceversa. Alternativamente, la distancia perceptual entre la señal de voz de salida degradada y la señal de voz de referencia puede reducirse o aumentarse filtrando partes enormemente distorsionadas de la señal de voz de salida o eliminando de otro modo las distorsiones severas en la señal de voz de salida en caso de que la calidad predicha fuese, de otro modo, demasiado baja o demasiado alta. El procesamiento de valores medios de la señal de voz de salida y la señal de voz de referencia puede usarse para reducir la distancia perceptual entre estas señales.
En la práctica, la señal de voz de salida puede degradarse en el sentido de que parte o partes de la misma se han desvanecido, es decir, la amplitud de la señal se ha reducido a cero o básicamente a cero, por ejemplo. En el caso de un recodificador transparente a la voz degradada, se apreciará que la señal de voz de referencia producida reflejará del mismo modo la voz de salida desvanecida, de modo que una comparación de la señal de voz de salida con la señal de voz de referencia no llevará a la medida de calidad pretendida.
En una realización adicional del método según la invención, este problema se resuelve en el sentido de que se recuperan las denominadas macro-propiedades características de la señal de voz de salida, y en que estas macro-propiedades se imponen a la señal de voz de referencia.
Tal como apreciarán los expertos en la técnica, la voz comprende una cierta periodicidad del nivel de energía y sonido momentáneos, en intervalos de algunas decenas de milisegundos, por ejemplo. En general, una señal de voz puede caracterizarse porque una serie unas denominadas macro-propiedades, es decir, silencios, ruido de fondo, periodicidad, disminuciones bruscas de la amplitud original, etcétera. Al extraer estas macro-propiedades de la señal de voz de salida e imponerlas en la señal de referencia, la parte o partes de la señal de voz de salida que se han desvanecido, por ejemplo, o que han infringido de otro modo las macro-propiedades de la señal de voz, pueden tenerse en cuenta en la señal de referencia. En consecuencia, la posterior comparación de la señal de voz de salida con la señal de referencia producirá una medida de la calidad que refleja la cantidad de degradación de la señal de voz de salida debido a la parte o partes que han infringido las macro-propiedades.
Las macro-propiedades extraídas de la señal de voz de salida puede, en una realización adicional del método según la invención, imponerse en la señal de voz de salida antes de su aproximación perceptual por el recodificador de voz. En una realización adicional de la invención, las macro-propiedades se imponen a la señal de voz de salida durante la aproximación perceptual por el recodificador de voz. Es decir, durante el uso de un códec de voz de referencia como recodificador, las macro-propiedades pueden superponerse después de la codificación de la señal de voz de salida y antes de la decodificación de la misma por el códec de referencia. En otra realización adicional de la invención, las macro-propiedades se superponen a la señal de voz de salida después de su aproximación perceptual, es decir, directamente en la señal de voz de referencia producida. Además, las macro-propiedades pueden aplicarse de manera ventajosa a la señal de voz de salida degradada para la comparación con la señal de voz de referencia producida a partir de la señal de voz de salida degradada.
En una realización sencilla de la invención, las infracciones contra las macro-propiedades de la señal de voz pueden tenerse en cuenta incorporando distorsiones o infracciones en la señal de voz de referencia, de modo que éstas se reflejen en la medida de calidad.
La aproximación perceptual de la señal de voz de salida puede proporcionarse en el ámbito del tiempo y/o de la frecuencia. En el último caso, según la invención, la señal de voz de salida se somete a una transformación en el ámbito tiempo-frecuencia, y la señal de voz de referencia se recupera a partir de la señal de voz de salida transformada.
La invención proporciona adicionalmente un dispositivo para la evaluación de calidad de voz objetiva basada en la salida según el método descrito anteriormente.
El método y el dispositivo según la invención son particularmente adecuados para la evaluación de calidad de voz de una señal de voz de salida en una red de telecomunicaciones basada en IP (protocolo de Internet), tal como VoIP o una red de telecomunicaciones IP inalámbrica, en la que la calidad de voz evaluada puede usarse para el control y la adaptación en tiempo real de la calidad de voz y transmisión de la red.
Lo anteriormente mencionado y otras características y ventajas de la invención se ilustran en la siguiente descripción con referencia a los dibujos adjuntos.
Breve descripción de los dibujos
La figura 1 muestra, de forma esquemática e ilustrativa, los principios de la evaluación de calidad de voz objetiva basada en la salida según la presente invención.
La figura 2 muestra un diagrama de bloques general de un dispositivo para la evaluación de calidad de voz objetiva basada en la salida según la invención.
Las figuras 3-6 muestran diagramas de bloques de realizaciones del dispositivo según la invención.
Descripción detallada de las realizaciones
En la figura 1, el sistema en prueba, tal como un sistema de telecomunicaciones fijo o inalámbrico de IP (protocolo de Internet), está designado en general con el número de referencia 1. El sistema 1 comprende medios de codificación y decodificación de voz, en general indicados como códec 3.
Una señal de voz de entrada original, por ejemplo proporcionada por un hablante en un terminal de teléfono de un sistema de comunicación de voz que funciona por radio, cable o VoIP (voz sobre protocolo de Internet), se transmite a través del sistema 1 y se recibe como una señal de voz de salida degradada en otro terminal de teléfono del sistema 1. La señal de voz de salida degradada comprende una parte de información de voz o habla y una parte de ruido o distorsión.
Puede obtenerse una medida de la calidad subjetiva de la señal de voz de salida a partir de esquemas de calificación por oyentes humanos, tal como la puntuación de opinión media (MOS) ampliamente conocida que implica sujetos humanos 4.
Una medida objetiva de la calidad de voz de la señal de voz de salida proporcionada por el sistema 1 en prueba puede derivarse de un modelo informático 5, que modela sujetos humanos; designado de manera ilustrativa como MOS objetiva. El modelo informático 5 requiere tanto datos representativos de la señal de voz de salida degradada como datos representativos de la señal de voz de entrada original.
Sin embargo, en la evaluación de calidad de voz objetiva basada en la salida, que es el objeto de la presente invención, los datos representativos de la señal de voz de entrada original no están disponibles. Por lo tanto, tienen que producirse datos de referencia para comparar con la señal de voz de salida degradada.
Según la presente invención, se produce una señal de voz de referencia procesando la señal de voz de salida degradada usando un recodificador de voz 2. El recodificador de voz 2 proporciona una aproximación perceptual de la parte de información de voz de la señal de voz de salida en forma de una señal de voz de referencia con una tasa de transferencia de bits finita.
La figura 2 muestra una estructuración práctica de un dispositivo de medición de calidad de voz objetiva según la presente invención, en el que el recodificador de voz es un códec de voz de referencia 6, que tiene la propiedad de ser esencialmente transparente para señales de voz limpias y esencialmente no transparente para señales de voz distorsionadas en la medida de que es una medida de la distorsión de la señal de voz de entrada.
El códec 6 "distorsiona" o "degrada" la señal de voz en su entrada de tal modo que una cantidad de ruido de fondo, clics y otras distorsiones no aparecen en la señal recodificada proporcionada. Es decir, la señal de voz de salida degradada del sistema 1 en prueba, recodificada por el recodificador 6, resulta en una señal de voz de referencia que es una representación de la parte de información de voz de la señal de voz de entrada limpia original.
Al comparar la señal de voz de referencia con la señal de voz de salida degradada recibida, usando medios de medición de calidad perceptuales 7, puede proporcionarse una medida de calidad que da como resultado una predicción de MOS.
El códec de voz de referencia 6 puede ser de cualquier tipo adecuado, tal como un códec que funciona según la norma ITU-T G.729 o ETSI 6.71, por ejemplo.
Como medida de calidad perceptual puede usarse cualquier modelo psicoacústico de la audición humana, tal como ITU-T P.861 o PSQM99, que calcule una medida de distancia perceptual entre la señal de voz de referencia recodificada y la señal de voz de salida degradada.
Los expertos en la técnica apreciarán que el recodificador de voz 2, es decir el códec 6, puede producir una señal de voz de referencia sin tareas informáticas intensivas para extraer parámetros y otros datos representativos de la voz de un hablante, mientras al mismo tiempo se evita el retardo de tiempo inherente de los métodos de la técnica anterior.
El procesamiento o la aproximación de la señal de voz de salida degradada para proporcionar la señal de referencia y su comparación, puede proporcionarse tanto en el ámbito temporal como de frecuencia. En el último caso, la señal de voz de salida degradada se somete a transformación en el ámbito de tiempo frecuencia (TFDT) 11, tal como se indica por las líneas discontinuas en la figura 2.
La figura 3 muestra una realización de la invención, que tiene en cuenta, por ejemplo, una predicción MOS en el caso de voz de salida degradada, de la que se han desvanecido parte o partes, es decir que tiene una amplitud de señal cero o básicamente cero. Es el caso, por ejemplo, si la señal de voz de entrada original se silencia temporalmente por el sistema 1 en prueba.
Los medios 8 están conectados operativamente para la recuperación de macro-propiedades de la señal de voz de salida representativas del grado de condición de voz de la señal de voz de salida, tal como silencios naturales, periodicidad, disminuciones bruscas de amplitud, ruido de fondo, etcétera. Las macro-propiedades se imponen por los medios 8 a la señal de voz de salida degradada antes del procesamiento de la misma por el recodificador de voz 2 o códec de voz 6, estando este último en la figura 3 separado en un codificador de voz 9 y un posterior decodificador de voz 10.
Los medios 8 para extraer e imponer las macro-propiedades también pueden funcionar junto con el recodificador de voz 2, tal como se muestra en la figura 4, en el que los medios 8 están conectados de manera operativa entre el codificador de voz 9 y el decodificador de voz 10.
La figura 5 muestra otra realización de la invención, en la que los medios 8 pueden funcionar en la señal de voz de referencia recodificada proporcionada por el codificador de voz 9 y el decodificador de voz 10.
La figura 6 muestra los medios 8 conectados de manera operativa en frente de los medios 7 para comparar la voz recodificada, obtenida a partir de la voz de salida degradada, con la voz de salida degradada sobre la que se ha se han impuesto las macro-propiedades.
En una realización sencilla de la invención, las infracciones contra las macro-propiedades de la señal de voz pueden tenerse en cuenta incorporando distorsiones o infracciones similares en la señal de voz de referencia, tal como se reflejan en la medida de calidad (no mostrado).
Puede usarse la predicción MOS, entre otras, para controlar la calidad de voz y/o la calidad de transmisión en una red de telecomunicaciones, tal como una red de telecomunicaciones de datos por cable o inalámbrica de IP.
A partir de una configuración experimental se ha verificado que el método y el dispositivo según la presente invención proporciona una evaluación fiable de calidad de voz objetiva basada en la salida, con un enfoque mucho menos complejo y mucho más manejable que los métodos de la técnica anterior de evaluación de calidad de voz objetiva basada en la salida.

Claims (23)

1. Método de evaluación de calidad de voz objetiva basada en la salida, en el que una señal de voz de salida degradada que comprende una parte de información de voz se compara con una señal de referencia recuperada a partir de dicha señal de voz de salida, caracterizado porque dicha señal de referencia se proporciona mediante aproximación perceptual de dicha parte de información de voz de dicha señal de voz de salida usando un recodificador de voz que produce una señal de voz de referencia de tasa de transferencia de bits finita.
2. Método según la reivindicación 1, en el que dicha señal de voz de referencia se proporciona recodificando dicha señal de voz de salida usando un códec de voz de referencia como un recodificador de voz.
3. Método según la reivindicación 1 ó 2, en el que dicho recodificador es de un tipo que es esencialmente transparente para señales de voz limpias y sin distorsión y esencialmente no transparente para señales de voz distorsionadas en la medida en que es una medida de la distorsión de dicha señal de voz.
4. Método según la reivindicación 1, 2 ó 3, en el que se recuperan macro-propiedades representativas de dicha señal de voz de salida, y en el que dichas macro-propiedades se imponen a dicha señal de voz de referencia.
5. Método según la reivindicación 4, en el que dichas macro-propiedades se imponen a dicha señal de voz de salida antes de dicha aproximación perceptual.
6. Método según la reivindicación 4, en el que dichas macro-propiedades se imponen a dicha señal de voz de salida durante dicha aproximación perceptual.
7. Método según la reivindicación 4, en el que dichas macro-propiedades se imponen a dicha señal de voz de salida después de dicha aproximación perceptual.
8. Método según la reivindicación 1, 2 ó 3, en el que se recuperan macro-propiedades representativas de dicha señal de voz de salida, y en el que dichas macro-propiedades se imponen a dicha señal de voz de salida antes de dicha comparación.
9. Método según la reivindicación 1, 2, 3, 4, 5, 6, 7 u 8, en el que dicha comparación comprende el cálculo de la distancia perceptual entre dicha señal de voz de salida y dicha señal de referencia.
10. Método según la reivindicación 1, 2, 3, 4, 5, 6, 7, 8 ó 9, en el que dicha señal de voz de salida se somete a transformación en el ámbito de tiempo/frecuencia, y en el que dicha señal de voz de referencia se recupera a partir de dicha señal de voz de salida transformada.
11. Dispositivo para la evaluación de calidad de voz objetiva basada en la salida, que comprende medios de recuperación conectados de manera operativa para recuperar una señal de referencia a partir de una señal de voz de salida degradada que comprende una parte de información de voz y medios de comparación conectados de manera operativa para comparar dicha señal de voz de salida con dicha señal de referencia, caracterizado porque dichos medios de recuperación comprenden medios de procesamiento conectados de manera operativa para la aproximación perceptual de dicha parte de información de voz de dicha señal de voz de salida usando un recodificador de voz que produce una señal de voz de referencia de tasa de transferencia de bits finita.
12. Dispositivo según la reivindicación 11, en el que dichos medios de recuperación comprenden un códec de voz de referencia como un recodificador de voz para proporcionar dicha señal de voz de referencia recodificando dicha señal de voz de salida.
13. Dispositivo según la reivindicación 11 ó 12, en el que dicho recodificador de voz es de un tipo que es esencialmente transparente para señales de voz limpias y sin distorsión y esencialmente no transparente para señales de voz distorsionadas en la medida en que es una medida de la distorsión de dicha señal de voz.
14. Dispositivo según la reivindicación 11, 12 ó 13, que comprende medios conectados de manera operativa para recuperar macro-propiedades representativas de dicha señal de voz de salida, y medios de superposición para imponer dichas macro-propiedades a dicha señal de referencia.
15. Dispositivo según la reivindicación 14, en el que dichos medios de superposición están conectados de manera operativa para imponer dichas macro-propiedades a dicha señal de voz de salida antes de dicha aproximación perceptual.
16. Dispositivo según la reivindicación 14, en el que dichos medios de superposición están conectados de manera operativa para imponer dichas macro-propiedades a dicha señal de voz de salida a través de dichos medios de procesamiento operativos para la aproximación perceptual de dicha señal de salida.
17. Dispositivo según la reivindicación 14, en el que dichos medios de superposición están conectados de manera operativa para imponer dichas macro-propiedades a dicha señal de voz de salida después de dicha aproximación perceptual de la misma.
18. Dispositivo según la reivindicación 14, en el que dichos medios de superposición están conectados de manera operativa para imponer dichas macro-propiedades a dicha señal de voz de salida antes de la comparación de la misma.
19. Dispositivo según la reivindicación 11, 12, 13, 14, 15, 16, 17 ó 18, en el que dichos medios de comparación están conectados de manera operativa para calcular la distancia perceptual entre dicha señal de voz de salida y dicha señal de referencia.
20. Dispositivo según la reivindicación 11, 12, 13, 14, 15, 16, 17, 18 ó 19, que comprende medios de transformación para la transformación en el ámbito de tiempo/frecuencia de dicha señal de voz de salida, y en el que dichos medios de recuperación están conectados de manera operativa para la recuperación de dicha señal de voz de referencia a partir de dicha señal de voz de salida transformada.
21. Uso del método y el dispositivo según cualquiera de las reivindicaciones anteriores para evaluar la calidad de voz de una señal de voz de salida en una red de telecomunicaciones basada en IP (protocolo de Internet).
22. Uso del método y el dispositivo según la reivindicación 21 en el que dicha red de telecomunicaciones es una red de telecomunicaciones de IP inalámbrica.
23. Uso del método y el dispositivo según la reivindicación 21 ó 22 para controlar la calidad de voz en dicha red de telecomunicaciones.
ES01982239T 2000-09-06 2001-09-03 Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. Expired - Lifetime ES2271084T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP00203109 2000-09-06
EP00203109A EP1187100A1 (en) 2000-09-06 2000-09-06 A method and a device for objective speech quality assessment without reference signal

Publications (1)

Publication Number Publication Date
ES2271084T3 true ES2271084T3 (es) 2007-04-16

Family

ID=8171994

Family Applications (1)

Application Number Title Priority Date Filing Date
ES01982239T Expired - Lifetime ES2271084T3 (es) 2000-09-06 2001-09-03 Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia.

Country Status (9)

Country Link
US (1) US7024352B2 (es)
EP (2) EP1187100A1 (es)
JP (1) JP2004508596A (es)
AT (1) ATE338331T1 (es)
AU (1) AU2002213876A1 (es)
DE (1) DE60122751T2 (es)
DK (1) DK1317752T3 (es)
ES (1) ES2271084T3 (es)
WO (1) WO2002021514A1 (es)

Families Citing this family (23)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1298646B1 (en) * 2001-10-01 2006-01-11 Koninklijke KPN N.V. Improved method for determining the quality of a speech signal
US7308403B2 (en) 2002-07-01 2007-12-11 Lucent Technologies Inc. Compensation for utterance dependent articulation for speech quality assessment
US7499856B2 (en) 2002-12-25 2009-03-03 Nippon Telegraph And Telephone Corporation Estimation method and apparatus of overall conversational quality taking into account the interaction between quality factors
JP4356696B2 (ja) * 2003-06-02 2009-11-04 株式会社ニコン 多層膜反射鏡及びx線露光装置
EP1492084B1 (en) * 2003-06-25 2006-05-17 Psytechnics Ltd Binaural quality assessment apparatus and method
US20050228655A1 (en) * 2004-04-05 2005-10-13 Lucent Technologies, Inc. Real-time objective voice analyzer
US7392187B2 (en) * 2004-09-20 2008-06-24 Educational Testing Service Method and system for the automatic generation of speech features for scoring high entropy speech
KR20060066416A (ko) * 2004-12-13 2006-06-16 한국전자통신연구원 음성 코덱을 이용한 후두 원격 진단 서비스 장치 및 그 방법
US7856355B2 (en) * 2005-07-05 2010-12-21 Alcatel-Lucent Usa Inc. Speech quality assessment method and system
US8370132B1 (en) * 2005-11-21 2013-02-05 Verizon Services Corp. Distributed apparatus and method for a perceptual quality measurement service
EP1918909B1 (en) * 2006-11-03 2010-07-07 Psytechnics Ltd Sampling error compensation
US8321222B2 (en) * 2007-08-14 2012-11-27 Nuance Communications, Inc. Synthesis by generation and concatenation of multi-form segments
CN102157147B (zh) * 2011-03-08 2012-05-30 公安部第一研究所 一种拾音系统语音质量客观评价的测试方法
PL401371A1 (pl) * 2012-10-26 2014-04-28 Ivona Software Spółka Z Ograniczoną Odpowiedzialnością Opracowanie głosu dla zautomatyzowanej zamiany tekstu na mowę
PL401372A1 (pl) * 2012-10-26 2014-04-28 Ivona Software Spółka Z Ograniczoną Odpowiedzialnością Hybrydowa kompresja danych głosowych w systemach zamiany tekstu na mowę
DE102013005844B3 (de) * 2013-03-28 2014-08-28 Technische Universität Braunschweig Verfahren und Vorrichtung zum Messen der Qualität eines Sprachsignals
US9396738B2 (en) 2013-05-31 2016-07-19 Sonus Networks, Inc. Methods and apparatus for signal quality analysis
US11888919B2 (en) 2013-11-20 2024-01-30 International Business Machines Corporation Determining quality of experience for communication sessions
US10148526B2 (en) 2013-11-20 2018-12-04 International Business Machines Corporation Determining quality of experience for communication sessions
CN106531190B (zh) * 2016-10-12 2020-05-05 科大讯飞股份有限公司 语音质量评价方法和装置
RU2729147C1 (ru) * 2020-04-02 2020-08-05 Общество С Ограниченной Ответственностью "Центр Коррекции Слуха И Речи "Мелфон" (Ооо "Цкср "Мелфон") Способ автоматизированной оценки качества распознавания речи пациентом
RU2743049C1 (ru) * 2020-09-07 2021-02-15 Общество С Ограниченной Ответственностью "Центр Коррекции Слуха И Речи "Мелфон" (Ооо "Цкср "Мелфон") Способ доврачебной оценки качества распознавания речи, скрининговой аудиометрии и программно-аппаратный комплекс, его реализующий
CN114374924B (zh) * 2022-01-07 2024-01-19 上海纽泰仑教育科技有限公司 录音质量检测方法及相关装置

Family Cites Families (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FI94810C (fi) * 1993-10-11 1995-10-25 Nokia Mobile Phones Ltd Menetelmä huonon GSM-puhekehyksen tunnistamiseksi
CA2196553C (en) * 1994-08-18 2000-04-11 Michael Peter Hollier Analysis of audio quality
US5706392A (en) * 1995-06-01 1998-01-06 Rutgers, The State University Of New Jersey Perceptual speech coder and method
US6201960B1 (en) * 1997-06-24 2001-03-13 Telefonaktiebolaget Lm Ericsson (Publ) Speech quality measurement based on radio link parameters and objective measurement of received speech signals
US6330428B1 (en) * 1998-12-23 2001-12-11 Nortel Networks Limited Voice quality performance evaluator and method of operation in conjunction with a communication network
US6246978B1 (en) * 1999-05-18 2001-06-12 Mci Worldcom, Inc. Method and system for measurement of speech distortion from samples of telephonic voice signals
US6609092B1 (en) * 1999-12-16 2003-08-19 Lucent Technologies Inc. Method and apparatus for estimating subjective audio signal quality from objective distortion measures

Also Published As

Publication number Publication date
EP1317752B1 (en) 2006-08-30
US20030171922A1 (en) 2003-09-11
JP2004508596A (ja) 2004-03-18
US7024352B2 (en) 2006-04-04
DK1317752T3 (da) 2007-01-08
ATE338331T1 (de) 2006-09-15
AU2002213876A1 (en) 2002-03-22
WO2002021514A1 (en) 2002-03-14
DE60122751D1 (de) 2006-10-12
EP1187100A1 (en) 2002-03-13
EP1317752A1 (en) 2003-06-11
DE60122751T2 (de) 2007-08-30

Similar Documents

Publication Publication Date Title
ES2271084T3 (es) Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia.
CN101411171B (zh) 非侵入信号质量评测的方法和设备
Sun et al. Perceived speech quality prediction for voice over IP-based networks
CN102044248B (zh) 一种针对流媒体音频质量的客观评测方法
CN103730131B (zh) 语音质量评估的方法和装置
Rix Perceptual speech quality assessment-a review
KR960029798A (ko) 신호 특성 측정 방법 및 장치. 음성 신호의 음질 측정 방법 및 신호 성질 측정 방법
CN105100508B (zh) 一种网络语音质量评估方法、装置和系统
Jassim et al. WARP-Q: Quality prediction for generative neural speech codecs
Enzinger et al. Empirical test of the performance of an acoustic-phonetic approach to forensic voice comparison under conditions similar to those of a real case
Mahdi et al. Advances in voice quality measurement in modern telecommunications
ES2211633T3 (es) Evaluacion no intrusiva de la calidad del habla.
JP4761391B2 (ja) 受聴品質評価方法および装置
Kim A cue for objective speech quality estimation in temporal envelope representations
Cai et al. Speech quality evaluation: A new application of digital watermarking
Chernick et al. Testing the ability of speech recognizers to measure the effectiveness of encoding algorithms for digital speech transmission
Parsa et al. Interactions between speech coders and disordered speech
Jelassi et al. Voicing-aware parametric speech quality models over VoIP networks
Hoene et al. Calculation of speech quality by aggregating the impacts of individual frame losses
Li Speech intelligibility of VoIP to PSTN interworking-a key index for the QoS
Hoene et al. Error propagation after Concealing a lost speech frame
Liu et al. An assessment of automatic speech recognition as speech intelligibility estimation in the context of additive noise.
Nakayama et al. Tongue habit discrimination system using acoustical feature for oral habits improvement
Chernick et al. Can speech recognizers measure the effectiveness of encoding algorithms for digital speech transmission?
Kouril et al. Objective speech quality evaluation. A primarily experiments on a various age and gender speakers corpus