ES2271084T3 - Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. - Google Patents
Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. Download PDFInfo
- Publication number
- ES2271084T3 ES2271084T3 ES01982239T ES01982239T ES2271084T3 ES 2271084 T3 ES2271084 T3 ES 2271084T3 ES 01982239 T ES01982239 T ES 01982239T ES 01982239 T ES01982239 T ES 01982239T ES 2271084 T3 ES2271084 T3 ES 2271084T3
- Authority
- ES
- Spain
- Prior art keywords
- voice
- signal
- output
- voice signal
- macro
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000000034 method Methods 0.000 title claims abstract description 33
- 238000011156 evaluation Methods 0.000 title description 6
- 238000013459 approach Methods 0.000 claims description 10
- 238000012545 processing Methods 0.000 claims description 7
- 238000011084 recovery Methods 0.000 claims description 6
- 230000009466 transformation Effects 0.000 claims description 5
- 206010013952 Dysphonia Diseases 0.000 claims description 3
- 238000004364 calculation method Methods 0.000 claims description 3
- 238000013441 quality evaluation Methods 0.000 claims 1
- 238000001303 quality assessment method Methods 0.000 abstract description 12
- 238000012360 testing method Methods 0.000 description 5
- 230000005540 biological transmission Effects 0.000 description 4
- 238000005259 measurement Methods 0.000 description 3
- 238000012546 transfer Methods 0.000 description 3
- 230000006978 adaptation Effects 0.000 description 2
- 238000005094 computer simulation Methods 0.000 description 2
- 230000007423 decrease Effects 0.000 description 2
- 238000010586 diagram Methods 0.000 description 2
- 241000282412 Homo Species 0.000 description 1
- 101150093282 SG12 gene Proteins 0.000 description 1
- 238000013528 artificial neural network Methods 0.000 description 1
- 230000015572 biosynthetic process Effects 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 238000004891 communication Methods 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 230000001934 delay Effects 0.000 description 1
- 238000009795 derivation Methods 0.000 description 1
- 238000013461 design Methods 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
- 238000001914 filtration Methods 0.000 description 1
- 230000006870 function Effects 0.000 description 1
- 230000014509 gene expression Effects 0.000 description 1
- 238000005457 optimization Methods 0.000 description 1
- 238000012797 qualification Methods 0.000 description 1
- 238000003786 synthesis reaction Methods 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/69—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for evaluating synthetic or decoded voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Monitoring And Testing Of Exchanges (AREA)
- Telephonic Communication Services (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Tests Of Electronic Circuits (AREA)
- Testing, Inspecting, Measuring Of Stereoscopic Televisions And Televisions (AREA)
Abstract
Método de evaluación de calidad de voz objetiva basada en la salida, en el que una señal de voz de salida degradada que comprende una parte de información de voz se compara con una señal de referencia recuperada a partir de dicha señal de voz de salida, caracterizado porque dicha señal de referencia se proporciona mediante aproximación perceptual de dicha parte de información de voz de dicha señal de voz de salida usando un recodificador de voz que produce una señal de voz de referencia de tasa de transferencia de bits finita.
Description
Método y dispositivo para evaluación de calidad
de voz objetiva sin señal de referencia.
La presente invención se refiere en general a la
evaluación de calidad de voz y, más en particular, a un método y un
dispositivo para la evaluación objetiva de calidad de voz de una
señal de salida sin implicar oyentes humanos, tal como una señal de
salida recibida en un sistema de telecomunicaciones inalámbrico y
señales de voz transmitidas según voz sobre protocolo de Internet
(VoIP).
La evaluación de calidad de voz proporciona la
optimización del control y diseño de algoritmos y equipamientos de
codificación y transmisión de voz.
Los métodos de evaluación de calidad de voz que
implican esquemas de calificación de oyentes humanos tales como, por
ejemplo, la puntuación de opinión media (MOS, Mean Opinion Score) o
la medida de aceptabilidad diagnóstica (DAM, Diagnostic
Acceptability Measure), proporcionan una medida de calidad
subjetiva.
Este tipo de evaluación de calidad de voz es
bastante cara y requiere instalaciones apropiadas y equipos y
condiciones de prueba.
Para evitar los oyentes humanos, se han
propuestos mediciones de voz objetivas, que intentan estimar o
predecir la calidad de voz subjetiva usando expresiones
matemáticas.
Normalmente, los métodos de evaluación de
calidad de voz objetiva se basan en una comparación de la señal de
voz de entrada original limpia y sin distorsión con la señal de voz
de salida degradada. Sin embargo, en la práctica, la señal de
entrada original limpia normalmente no está disponible en la salida
del sistema o dispositivo que está siendo sometido a prueba.
La solicitud de patente internacional
WO-A-96/06495 propone analizar
ciertas características estadísticas de la voz que son
independientes del hablante para determinar en qué medida se ha
modificado o distorsionado la señal de salida por un enlace de
telecomunicaciones, por ejemplo, sin requerir la señal de entrada
limpia y sin distorsión.
Con el mismo fin, la solicitud de patente
internacional WO-A-96/06496 da a
conocer el análisis por un medio de reconocimiento de voz el
contenido de una señal recibida. El resultado de este análisis se
procesa por un sintetizador de voz para generar una señal de voz sin
distorsiones.
La solicitud de patente internacional
WO-A-97/05730 da a conocer la medida
de calidad de voz usando análisis de tracto vocal y una red neuronal
para producir una señal de referencia como una réplica de la señal
de entrada limpia.
El reconocimiento de voz, la síntesis de voz y
la adaptación de la señal sintetizada a la voz y otras propiedades
del hablante de la señal degradada, con el fin de proporcionar una
señal de referencia para la comparación con la señal de voz
degradada para evaluar la calidad de voz de la misma, comprende en
la práctica tareas intensivas desde el punto de vista informático
con una precisión limitada.
Sin embargo, es imposible reconstruir a partir
de la señal de voz degradada una señal de referencia que sea igual a
la señal de voz de entrada original.
Además la señal de referencia está disponible
con un retardo que impide una retroalimentación a tiempo para
objetivos de control para mejorar la calidad de voz si la calidad
evaluada está por debajo de un nivel establecido.
La invención pretende superar las tareas
intensivas desde el punto de vista informático y el retardo
inherente provocado por ello, evaluando la calidad de voz objetiva
basada en la salida.
La invención proporciona un nuevo método de
evaluación de calidad de voz objetiva basada en la salida, en el que
una señal de voz de salida degradada que comprende una parte
información de voz se compara con una señal de referencia recuperada
de la señal de voz de salida, y se caracteriza porque la señal de
referencia se proporciona mediante aproximación perceptual de la
parte de información de voz de la señal de voz de salida usando un
recodificador de voz que produce una señal de voz de referencia de
entropía finita, que proporciona un número finito de bits por
segundo, es decir una tasa de transferencia de bits.
La invención se basa en la idea de que al
procesar la señal de voz distorsionada usando un recodificador de
voz que realiza una aproximación perceptual con tasa de
transferencia de bits finita, la parte de información de voz de la
señal de voz de salida degradada se reproduce de manera objetiva
según las propiedades del recodificador de voz, proporcionando una
señal de voz de referencia para una evaluación objetiva de la
calidad de la voz.
Usando un recodificador de voz según la presente
invención, no son necesarios cálculos y procesamiento informáticos
extensivos para la extracción de parámetros de voz y similares de la
voz de salida que está en prueba, de modo que no se introducen
retardos indebidos.
Un códec de voz (codificador de
voz/decodificador de voz) es un dispositivo mediante el que se
procesa perceptualmente una señal de voz en una señal de un número
finito de bits por segundo. En consecuencia, en una realización
preferida del método según la invención, la señal de referencia se
proporciona recodificando la señal de voz de salida degradada usando
un códec de voz de referencia (recodificador), tal como un códec que
funciona según la norma ITU-T G.729 o la norma ETSI
6.71, por ejemplo.
El recodificador debería (de manera ideal) ser
esencialmente transparente para señales de voz limpias y sin
distorsión y esencialmente no transparente para señales de voz
distorsionadas en la medida en que es una medida de la distorsión de
la señal de voz.
Es decir, si la señal degradada contiene una
cantidad molesta de ruido de fondo, por ejemplo, el recodificador
debería "distorsionar" la señal, por ejemplo suprimiendo el
ruido de fondo o debería "degradar" la señal de voz de salida
debido al consumo de bits por el ruido. En caso de que un sistema de
transmisión de voz en prueba sea transparente, la medida de calidad
objetiva debería también predecir tal transparencia, lo que se
consigue mediante un recodificador que es casi transparente para una
señal de voz limpia.
En comparación con los métodos de la técnica
anterior resumidos anteriormente, la invención adopta un enfoque
mucho más pragmático y se centra en la derivación de una señal de
voz de referencia a partir de la parte de información de voz de la
señal de voz de salida degradada que presenta una distancia
perceptual respecto a la señal de voz degradada que es una medida
del grado en que se ha distorsionado la señal de voz degradada.
En consecuencia, en una realización adicional
del método según la invención, la comparación de la señal de
referencia y la señal de voz de salida degradada comprende el
cálculo de la distancia perceptual entre la señal de voz de salida y
la señal de referencia.
En general, la señal de voz recodificada tendrá
un menor grado de calidad de voz subjetiva que la entrada original.
Como una medida de la distancia perceptual puede usarse cualquier
modelo psicoacústico de la audición humana, tal como
ITU-T P.861 o PSQM99 sometido a evaluación de
rendimiento (benchmarking) por ITU-T SG12/pregunta
13. La medida de distancia perceptual puede determinarse con mayor
precisión adaptando la medida perceptual al tipo de recodificador
y/o viceversa. Alternativamente, la distancia perceptual entre la
señal de voz de salida degradada y la señal de voz de referencia
puede reducirse o aumentarse filtrando partes enormemente
distorsionadas de la señal de voz de salida o eliminando de otro
modo las distorsiones severas en la señal de voz de salida en caso
de que la calidad predicha fuese, de otro modo, demasiado baja o
demasiado alta. El procesamiento de valores medios de la señal de
voz de salida y la señal de voz de referencia puede usarse para
reducir la distancia perceptual entre estas señales.
En la práctica, la señal de voz de salida puede
degradarse en el sentido de que parte o partes de la misma se han
desvanecido, es decir, la amplitud de la señal se ha reducido a cero
o básicamente a cero, por ejemplo. En el caso de un recodificador
transparente a la voz degradada, se apreciará que la señal de voz de
referencia producida reflejará del mismo modo la voz de salida
desvanecida, de modo que una comparación de la señal de voz de
salida con la señal de voz de referencia no llevará a la medida de
calidad pretendida.
En una realización adicional del método según la
invención, este problema se resuelve en el sentido de que se
recuperan las denominadas macro-propiedades
características de la señal de voz de salida, y en que estas
macro-propiedades se imponen a la señal de voz de
referencia.
Tal como apreciarán los expertos en la técnica,
la voz comprende una cierta periodicidad del nivel de energía y
sonido momentáneos, en intervalos de algunas decenas de
milisegundos, por ejemplo. En general, una señal de voz puede
caracterizarse porque una serie unas denominadas
macro-propiedades, es decir, silencios, ruido de
fondo, periodicidad, disminuciones bruscas de la amplitud original,
etcétera. Al extraer estas macro-propiedades de la
señal de voz de salida e imponerlas en la señal de referencia, la
parte o partes de la señal de voz de salida que se han desvanecido,
por ejemplo, o que han infringido de otro modo las
macro-propiedades de la señal de voz, pueden tenerse
en cuenta en la señal de referencia. En consecuencia, la posterior
comparación de la señal de voz de salida con la señal de referencia
producirá una medida de la calidad que refleja la cantidad de
degradación de la señal de voz de salida debido a la parte o partes
que han infringido las macro-propiedades.
Las macro-propiedades extraídas
de la señal de voz de salida puede, en una realización adicional del
método según la invención, imponerse en la señal de voz de salida
antes de su aproximación perceptual por el recodificador de voz. En
una realización adicional de la invención, las
macro-propiedades se imponen a la señal de voz de
salida durante la aproximación perceptual por el recodificador de
voz. Es decir, durante el uso de un códec de voz de referencia como
recodificador, las macro-propiedades pueden
superponerse después de la codificación de la señal de voz de salida
y antes de la decodificación de la misma por el códec de referencia.
En otra realización adicional de la invención, las
macro-propiedades se superponen a la señal de voz de
salida después de su aproximación perceptual, es decir, directamente
en la señal de voz de referencia producida. Además, las
macro-propiedades pueden aplicarse de manera
ventajosa a la señal de voz de salida degradada para la comparación
con la señal de voz de referencia producida a partir de la señal de
voz de salida degradada.
En una realización sencilla de la invención, las
infracciones contra las macro-propiedades de la
señal de voz pueden tenerse en cuenta incorporando distorsiones o
infracciones en la señal de voz de referencia, de modo que éstas se
reflejen en la medida de calidad.
La aproximación perceptual de la señal de voz de
salida puede proporcionarse en el ámbito del tiempo y/o de la
frecuencia. En el último caso, según la invención, la señal de voz
de salida se somete a una transformación en el ámbito
tiempo-frecuencia, y la señal de voz de referencia
se recupera a partir de la señal de voz de salida transformada.
La invención proporciona adicionalmente un
dispositivo para la evaluación de calidad de voz objetiva basada en
la salida según el método descrito anteriormente.
El método y el dispositivo según la invención
son particularmente adecuados para la evaluación de calidad de voz
de una señal de voz de salida en una red de telecomunicaciones
basada en IP (protocolo de Internet), tal como VoIP o una red de
telecomunicaciones IP inalámbrica, en la que la calidad de voz
evaluada puede usarse para el control y la adaptación en tiempo real
de la calidad de voz y transmisión de la red.
Lo anteriormente mencionado y otras
características y ventajas de la invención se ilustran en la
siguiente descripción con referencia a los dibujos adjuntos.
La figura 1 muestra, de forma esquemática e
ilustrativa, los principios de la evaluación de calidad de voz
objetiva basada en la salida según la presente invención.
La figura 2 muestra un diagrama de bloques
general de un dispositivo para la evaluación de calidad de voz
objetiva basada en la salida según la invención.
Las figuras 3-6 muestran
diagramas de bloques de realizaciones del dispositivo según la
invención.
En la figura 1, el sistema en prueba, tal como
un sistema de telecomunicaciones fijo o inalámbrico de IP (protocolo
de Internet), está designado en general con el número de referencia
1. El sistema 1 comprende medios de codificación y decodificación
de voz, en general indicados como códec 3.
Una señal de voz de entrada original, por
ejemplo proporcionada por un hablante en un terminal de teléfono de
un sistema de comunicación de voz que funciona por radio, cable o
VoIP (voz sobre protocolo de Internet), se transmite a través del
sistema 1 y se recibe como una señal de voz de salida degradada en
otro terminal de teléfono del sistema 1. La señal de voz de salida
degradada comprende una parte de información de voz o habla y una
parte de ruido o distorsión.
Puede obtenerse una medida de la calidad
subjetiva de la señal de voz de salida a partir de esquemas de
calificación por oyentes humanos, tal como la puntuación de opinión
media (MOS) ampliamente conocida que implica sujetos humanos 4.
Una medida objetiva de la calidad de voz de la
señal de voz de salida proporcionada por el sistema 1 en prueba
puede derivarse de un modelo informático 5, que modela sujetos
humanos; designado de manera ilustrativa como MOS objetiva. El
modelo informático 5 requiere tanto datos representativos de la
señal de voz de salida degradada como datos representativos de la
señal de voz de entrada original.
Sin embargo, en la evaluación de calidad de voz
objetiva basada en la salida, que es el objeto de la presente
invención, los datos representativos de la señal de voz de entrada
original no están disponibles. Por lo tanto, tienen que producirse
datos de referencia para comparar con la señal de voz de salida
degradada.
Según la presente invención, se produce una
señal de voz de referencia procesando la señal de voz de salida
degradada usando un recodificador de voz 2. El recodificador de voz
2 proporciona una aproximación perceptual de la parte de información
de voz de la señal de voz de salida en forma de una señal de voz de
referencia con una tasa de transferencia de bits finita.
La figura 2 muestra una estructuración práctica
de un dispositivo de medición de calidad de voz objetiva según la
presente invención, en el que el recodificador de voz es un códec de
voz de referencia 6, que tiene la propiedad de ser esencialmente
transparente para señales de voz limpias y esencialmente no
transparente para señales de voz distorsionadas en la medida de que
es una medida de la distorsión de la señal de voz de entrada.
El códec 6 "distorsiona" o "degrada"
la señal de voz en su entrada de tal modo que una cantidad de ruido
de fondo, clics y otras distorsiones no aparecen en la señal
recodificada proporcionada. Es decir, la señal de voz de salida
degradada del sistema 1 en prueba, recodificada por el recodificador
6, resulta en una señal de voz de referencia que es una
representación de la parte de información de voz de la señal de voz
de entrada limpia original.
Al comparar la señal de voz de referencia con la
señal de voz de salida degradada recibida, usando medios de medición
de calidad perceptuales 7, puede proporcionarse una medida de
calidad que da como resultado una predicción de MOS.
El códec de voz de referencia 6 puede ser de
cualquier tipo adecuado, tal como un códec que funciona según la
norma ITU-T G.729 o ETSI 6.71, por ejemplo.
Como medida de calidad perceptual puede usarse
cualquier modelo psicoacústico de la audición humana, tal como
ITU-T P.861 o PSQM99, que calcule una medida de
distancia perceptual entre la señal de voz de referencia
recodificada y la señal de voz de salida degradada.
Los expertos en la técnica apreciarán que el
recodificador de voz 2, es decir el códec 6, puede producir una
señal de voz de referencia sin tareas informáticas intensivas para
extraer parámetros y otros datos representativos de la voz de un
hablante, mientras al mismo tiempo se evita el retardo de tiempo
inherente de los métodos de la técnica anterior.
El procesamiento o la aproximación de la señal
de voz de salida degradada para proporcionar la señal de referencia
y su comparación, puede proporcionarse tanto en el ámbito temporal
como de frecuencia. En el último caso, la señal de voz de salida
degradada se somete a transformación en el ámbito de tiempo
frecuencia (TFDT) 11, tal como se indica por las líneas discontinuas
en la figura 2.
La figura 3 muestra una realización de la
invención, que tiene en cuenta, por ejemplo, una predicción MOS en
el caso de voz de salida degradada, de la que se han desvanecido
parte o partes, es decir que tiene una amplitud de señal cero o
básicamente cero. Es el caso, por ejemplo, si la señal de voz de
entrada original se silencia temporalmente por el sistema 1 en
prueba.
Los medios 8 están conectados operativamente
para la recuperación de macro-propiedades de la
señal de voz de salida representativas del grado de condición de voz
de la señal de voz de salida, tal como silencios naturales,
periodicidad, disminuciones bruscas de amplitud, ruido de fondo,
etcétera. Las macro-propiedades se imponen por los
medios 8 a la señal de voz de salida degradada antes del
procesamiento de la misma por el recodificador de voz 2 o códec de
voz 6, estando este último en la figura 3 separado en un codificador
de voz 9 y un posterior decodificador de voz 10.
Los medios 8 para extraer e imponer las
macro-propiedades también pueden funcionar junto con
el recodificador de voz 2, tal como se muestra en la figura 4, en el
que los medios 8 están conectados de manera operativa entre el
codificador de voz 9 y el decodificador de voz 10.
La figura 5 muestra otra realización de la
invención, en la que los medios 8 pueden funcionar en la señal de
voz de referencia recodificada proporcionada por el codificador de
voz 9 y el decodificador de voz 10.
La figura 6 muestra los medios 8 conectados de
manera operativa en frente de los medios 7 para comparar la voz
recodificada, obtenida a partir de la voz de salida degradada, con
la voz de salida degradada sobre la que se ha se han impuesto las
macro-propiedades.
En una realización sencilla de la invención, las
infracciones contra las macro-propiedades de la
señal de voz pueden tenerse en cuenta incorporando distorsiones o
infracciones similares en la señal de voz de referencia, tal como se
reflejan en la medida de calidad (no mostrado).
Puede usarse la predicción MOS, entre otras,
para controlar la calidad de voz y/o la calidad de transmisión en
una red de telecomunicaciones, tal como una red de
telecomunicaciones de datos por cable o inalámbrica de IP.
A partir de una configuración experimental se ha
verificado que el método y el dispositivo según la presente
invención proporciona una evaluación fiable de calidad de voz
objetiva basada en la salida, con un enfoque mucho menos complejo y
mucho más manejable que los métodos de la técnica anterior de
evaluación de calidad de voz objetiva basada en la salida.
Claims (23)
1. Método de evaluación de calidad de voz
objetiva basada en la salida, en el que una señal de voz de salida
degradada que comprende una parte de información de voz se compara
con una señal de referencia recuperada a partir de dicha señal de
voz de salida, caracterizado porque dicha señal de referencia
se proporciona mediante aproximación perceptual de dicha parte de
información de voz de dicha señal de voz de salida usando un
recodificador de voz que produce una señal de voz de referencia de
tasa de transferencia de bits finita.
2. Método según la reivindicación 1, en el que
dicha señal de voz de referencia se proporciona recodificando dicha
señal de voz de salida usando un códec de voz de referencia como un
recodificador de voz.
3. Método según la reivindicación 1 ó 2, en el
que dicho recodificador es de un tipo que es esencialmente
transparente para señales de voz limpias y sin distorsión y
esencialmente no transparente para señales de voz distorsionadas en
la medida en que es una medida de la distorsión de dicha señal de
voz.
4. Método según la reivindicación 1, 2 ó 3, en
el que se recuperan macro-propiedades
representativas de dicha señal de voz de salida, y en el que dichas
macro-propiedades se imponen a dicha señal de voz de
referencia.
5. Método según la reivindicación 4, en el que
dichas macro-propiedades se imponen a dicha señal de
voz de salida antes de dicha aproximación perceptual.
6. Método según la reivindicación 4, en el que
dichas macro-propiedades se imponen a dicha señal de
voz de salida durante dicha aproximación perceptual.
7. Método según la reivindicación 4, en el que
dichas macro-propiedades se imponen a dicha señal de
voz de salida después de dicha aproximación perceptual.
8. Método según la reivindicación 1, 2 ó 3, en
el que se recuperan macro-propiedades
representativas de dicha señal de voz de salida, y en el que dichas
macro-propiedades se imponen a dicha señal de voz de
salida antes de dicha comparación.
9. Método según la reivindicación 1, 2, 3, 4, 5,
6, 7 u 8, en el que dicha comparación comprende el cálculo de la
distancia perceptual entre dicha señal de voz de salida y dicha
señal de referencia.
10. Método según la reivindicación 1, 2, 3, 4,
5, 6, 7, 8 ó 9, en el que dicha señal de voz de salida se somete a
transformación en el ámbito de tiempo/frecuencia, y en el que dicha
señal de voz de referencia se recupera a partir de dicha señal de
voz de salida transformada.
11. Dispositivo para la evaluación de calidad de
voz objetiva basada en la salida, que comprende medios de
recuperación conectados de manera operativa para recuperar una señal
de referencia a partir de una señal de voz de salida degradada que
comprende una parte de información de voz y medios de comparación
conectados de manera operativa para comparar dicha señal de voz de
salida con dicha señal de referencia, caracterizado porque
dichos medios de recuperación comprenden medios de procesamiento
conectados de manera operativa para la aproximación perceptual de
dicha parte de información de voz de dicha señal de voz de salida
usando un recodificador de voz que produce una señal de voz de
referencia de tasa de transferencia de bits finita.
12. Dispositivo según la reivindicación 11, en
el que dichos medios de recuperación comprenden un códec de voz de
referencia como un recodificador de voz para proporcionar dicha
señal de voz de referencia recodificando dicha señal de voz de
salida.
13. Dispositivo según la reivindicación 11 ó 12,
en el que dicho recodificador de voz es de un tipo que es
esencialmente transparente para señales de voz limpias y sin
distorsión y esencialmente no transparente para señales de voz
distorsionadas en la medida en que es una medida de la distorsión de
dicha señal de voz.
14. Dispositivo según la reivindicación 11, 12 ó
13, que comprende medios conectados de manera operativa para
recuperar macro-propiedades representativas de dicha
señal de voz de salida, y medios de superposición para imponer
dichas macro-propiedades a dicha señal de
referencia.
15. Dispositivo según la reivindicación 14, en
el que dichos medios de superposición están conectados de manera
operativa para imponer dichas macro-propiedades a
dicha señal de voz de salida antes de dicha aproximación
perceptual.
16. Dispositivo según la reivindicación 14, en
el que dichos medios de superposición están conectados de manera
operativa para imponer dichas macro-propiedades a
dicha señal de voz de salida a través de dichos medios de
procesamiento operativos para la aproximación perceptual de dicha
señal de salida.
17. Dispositivo según la reivindicación 14, en
el que dichos medios de superposición están conectados de manera
operativa para imponer dichas macro-propiedades a
dicha señal de voz de salida después de dicha aproximación
perceptual de la misma.
18. Dispositivo según la reivindicación 14, en
el que dichos medios de superposición están conectados de manera
operativa para imponer dichas macro-propiedades a
dicha señal de voz de salida antes de la comparación de la
misma.
19. Dispositivo según la reivindicación 11, 12,
13, 14, 15, 16, 17 ó 18, en el que dichos medios de comparación
están conectados de manera operativa para calcular la distancia
perceptual entre dicha señal de voz de salida y dicha señal de
referencia.
20. Dispositivo según la reivindicación 11, 12,
13, 14, 15, 16, 17, 18 ó 19, que comprende medios de transformación
para la transformación en el ámbito de tiempo/frecuencia de dicha
señal de voz de salida, y en el que dichos medios de recuperación
están conectados de manera operativa para la recuperación de dicha
señal de voz de referencia a partir de dicha señal de voz de salida
transformada.
21. Uso del método y el dispositivo según
cualquiera de las reivindicaciones anteriores para evaluar la
calidad de voz de una señal de voz de salida en una red de
telecomunicaciones basada en IP (protocolo de Internet).
22. Uso del método y el dispositivo según la
reivindicación 21 en el que dicha red de telecomunicaciones es una
red de telecomunicaciones de IP inalámbrica.
23. Uso del método y el dispositivo según la
reivindicación 21 ó 22 para controlar la calidad de voz en dicha red
de telecomunicaciones.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP00203109 | 2000-09-06 | ||
| EP00203109A EP1187100A1 (en) | 2000-09-06 | 2000-09-06 | A method and a device for objective speech quality assessment without reference signal |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2271084T3 true ES2271084T3 (es) | 2007-04-16 |
Family
ID=8171994
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES01982239T Expired - Lifetime ES2271084T3 (es) | 2000-09-06 | 2001-09-03 | Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. |
Country Status (9)
| Country | Link |
|---|---|
| US (1) | US7024352B2 (es) |
| EP (2) | EP1187100A1 (es) |
| JP (1) | JP2004508596A (es) |
| AT (1) | ATE338331T1 (es) |
| AU (1) | AU2002213876A1 (es) |
| DE (1) | DE60122751T2 (es) |
| DK (1) | DK1317752T3 (es) |
| ES (1) | ES2271084T3 (es) |
| WO (1) | WO2002021514A1 (es) |
Families Citing this family (23)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP1298646B1 (en) * | 2001-10-01 | 2006-01-11 | Koninklijke KPN N.V. | Improved method for determining the quality of a speech signal |
| US7308403B2 (en) | 2002-07-01 | 2007-12-11 | Lucent Technologies Inc. | Compensation for utterance dependent articulation for speech quality assessment |
| US7499856B2 (en) | 2002-12-25 | 2009-03-03 | Nippon Telegraph And Telephone Corporation | Estimation method and apparatus of overall conversational quality taking into account the interaction between quality factors |
| JP4356696B2 (ja) * | 2003-06-02 | 2009-11-04 | 株式会社ニコン | 多層膜反射鏡及びx線露光装置 |
| EP1492084B1 (en) * | 2003-06-25 | 2006-05-17 | Psytechnics Ltd | Binaural quality assessment apparatus and method |
| US20050228655A1 (en) * | 2004-04-05 | 2005-10-13 | Lucent Technologies, Inc. | Real-time objective voice analyzer |
| US7392187B2 (en) * | 2004-09-20 | 2008-06-24 | Educational Testing Service | Method and system for the automatic generation of speech features for scoring high entropy speech |
| KR20060066416A (ko) * | 2004-12-13 | 2006-06-16 | 한국전자통신연구원 | 음성 코덱을 이용한 후두 원격 진단 서비스 장치 및 그 방법 |
| US7856355B2 (en) * | 2005-07-05 | 2010-12-21 | Alcatel-Lucent Usa Inc. | Speech quality assessment method and system |
| US8370132B1 (en) * | 2005-11-21 | 2013-02-05 | Verizon Services Corp. | Distributed apparatus and method for a perceptual quality measurement service |
| EP1918909B1 (en) * | 2006-11-03 | 2010-07-07 | Psytechnics Ltd | Sampling error compensation |
| US8321222B2 (en) * | 2007-08-14 | 2012-11-27 | Nuance Communications, Inc. | Synthesis by generation and concatenation of multi-form segments |
| CN102157147B (zh) * | 2011-03-08 | 2012-05-30 | 公安部第一研究所 | 一种拾音系统语音质量客观评价的测试方法 |
| PL401371A1 (pl) * | 2012-10-26 | 2014-04-28 | Ivona Software Spółka Z Ograniczoną Odpowiedzialnością | Opracowanie głosu dla zautomatyzowanej zamiany tekstu na mowę |
| PL401372A1 (pl) * | 2012-10-26 | 2014-04-28 | Ivona Software Spółka Z Ograniczoną Odpowiedzialnością | Hybrydowa kompresja danych głosowych w systemach zamiany tekstu na mowę |
| DE102013005844B3 (de) * | 2013-03-28 | 2014-08-28 | Technische Universität Braunschweig | Verfahren und Vorrichtung zum Messen der Qualität eines Sprachsignals |
| US9396738B2 (en) | 2013-05-31 | 2016-07-19 | Sonus Networks, Inc. | Methods and apparatus for signal quality analysis |
| US11888919B2 (en) | 2013-11-20 | 2024-01-30 | International Business Machines Corporation | Determining quality of experience for communication sessions |
| US10148526B2 (en) | 2013-11-20 | 2018-12-04 | International Business Machines Corporation | Determining quality of experience for communication sessions |
| CN106531190B (zh) * | 2016-10-12 | 2020-05-05 | 科大讯飞股份有限公司 | 语音质量评价方法和装置 |
| RU2729147C1 (ru) * | 2020-04-02 | 2020-08-05 | Общество С Ограниченной Ответственностью "Центр Коррекции Слуха И Речи "Мелфон" (Ооо "Цкср "Мелфон") | Способ автоматизированной оценки качества распознавания речи пациентом |
| RU2743049C1 (ru) * | 2020-09-07 | 2021-02-15 | Общество С Ограниченной Ответственностью "Центр Коррекции Слуха И Речи "Мелфон" (Ооо "Цкср "Мелфон") | Способ доврачебной оценки качества распознавания речи, скрининговой аудиометрии и программно-аппаратный комплекс, его реализующий |
| CN114374924B (zh) * | 2022-01-07 | 2024-01-19 | 上海纽泰仑教育科技有限公司 | 录音质量检测方法及相关装置 |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FI94810C (fi) * | 1993-10-11 | 1995-10-25 | Nokia Mobile Phones Ltd | Menetelmä huonon GSM-puhekehyksen tunnistamiseksi |
| CA2196553C (en) * | 1994-08-18 | 2000-04-11 | Michael Peter Hollier | Analysis of audio quality |
| US5706392A (en) * | 1995-06-01 | 1998-01-06 | Rutgers, The State University Of New Jersey | Perceptual speech coder and method |
| US6201960B1 (en) * | 1997-06-24 | 2001-03-13 | Telefonaktiebolaget Lm Ericsson (Publ) | Speech quality measurement based on radio link parameters and objective measurement of received speech signals |
| US6330428B1 (en) * | 1998-12-23 | 2001-12-11 | Nortel Networks Limited | Voice quality performance evaluator and method of operation in conjunction with a communication network |
| US6246978B1 (en) * | 1999-05-18 | 2001-06-12 | Mci Worldcom, Inc. | Method and system for measurement of speech distortion from samples of telephonic voice signals |
| US6609092B1 (en) * | 1999-12-16 | 2003-08-19 | Lucent Technologies Inc. | Method and apparatus for estimating subjective audio signal quality from objective distortion measures |
-
2000
- 2000-09-06 EP EP00203109A patent/EP1187100A1/en not_active Withdrawn
-
2001
- 2001-09-03 JP JP2002525646A patent/JP2004508596A/ja active Pending
- 2001-09-03 DK DK01982239T patent/DK1317752T3/da active
- 2001-09-03 AT AT01982239T patent/ATE338331T1/de active
- 2001-09-03 ES ES01982239T patent/ES2271084T3/es not_active Expired - Lifetime
- 2001-09-03 EP EP01982239A patent/EP1317752B1/en not_active Expired - Lifetime
- 2001-09-03 WO PCT/EP2001/010154 patent/WO2002021514A1/en not_active Ceased
- 2001-09-03 AU AU2002213876A patent/AU2002213876A1/en not_active Abandoned
- 2001-09-03 US US10/363,235 patent/US7024352B2/en not_active Expired - Lifetime
- 2001-09-03 DE DE60122751T patent/DE60122751T2/de not_active Expired - Lifetime
Also Published As
| Publication number | Publication date |
|---|---|
| EP1317752B1 (en) | 2006-08-30 |
| US20030171922A1 (en) | 2003-09-11 |
| JP2004508596A (ja) | 2004-03-18 |
| US7024352B2 (en) | 2006-04-04 |
| DK1317752T3 (da) | 2007-01-08 |
| ATE338331T1 (de) | 2006-09-15 |
| AU2002213876A1 (en) | 2002-03-22 |
| WO2002021514A1 (en) | 2002-03-14 |
| DE60122751D1 (de) | 2006-10-12 |
| EP1187100A1 (en) | 2002-03-13 |
| EP1317752A1 (en) | 2003-06-11 |
| DE60122751T2 (de) | 2007-08-30 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2271084T3 (es) | Metodo y dispositivo para evaluacion de calidad de voz objetiva sin señal de referencia. | |
| CN101411171B (zh) | 非侵入信号质量评测的方法和设备 | |
| Sun et al. | Perceived speech quality prediction for voice over IP-based networks | |
| CN102044248B (zh) | 一种针对流媒体音频质量的客观评测方法 | |
| CN103730131B (zh) | 语音质量评估的方法和装置 | |
| Rix | Perceptual speech quality assessment-a review | |
| KR960029798A (ko) | 신호 특성 측정 방법 및 장치. 음성 신호의 음질 측정 방법 및 신호 성질 측정 방법 | |
| CN105100508B (zh) | 一种网络语音质量评估方法、装置和系统 | |
| Jassim et al. | WARP-Q: Quality prediction for generative neural speech codecs | |
| Enzinger et al. | Empirical test of the performance of an acoustic-phonetic approach to forensic voice comparison under conditions similar to those of a real case | |
| Mahdi et al. | Advances in voice quality measurement in modern telecommunications | |
| ES2211633T3 (es) | Evaluacion no intrusiva de la calidad del habla. | |
| JP4761391B2 (ja) | 受聴品質評価方法および装置 | |
| Kim | A cue for objective speech quality estimation in temporal envelope representations | |
| Cai et al. | Speech quality evaluation: A new application of digital watermarking | |
| Chernick et al. | Testing the ability of speech recognizers to measure the effectiveness of encoding algorithms for digital speech transmission | |
| Parsa et al. | Interactions between speech coders and disordered speech | |
| Jelassi et al. | Voicing-aware parametric speech quality models over VoIP networks | |
| Hoene et al. | Calculation of speech quality by aggregating the impacts of individual frame losses | |
| Li | Speech intelligibility of VoIP to PSTN interworking-a key index for the QoS | |
| Hoene et al. | Error propagation after Concealing a lost speech frame | |
| Liu et al. | An assessment of automatic speech recognition as speech intelligibility estimation in the context of additive noise. | |
| Nakayama et al. | Tongue habit discrimination system using acoustical feature for oral habits improvement | |
| Chernick et al. | Can speech recognizers measure the effectiveness of encoding algorithms for digital speech transmission? | |
| Kouril et al. | Objective speech quality evaluation. A primarily experiments on a various age and gender speakers corpus |