ES2292919T3 - Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. - Google Patents

Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. Download PDF

Info

Publication number
ES2292919T3
ES2292919T3 ES03291085T ES03291085T ES2292919T3 ES 2292919 T3 ES2292919 T3 ES 2292919T3 ES 03291085 T ES03291085 T ES 03291085T ES 03291085 T ES03291085 T ES 03291085T ES 2292919 T3 ES2292919 T3 ES 2292919T3
Authority
ES
Spain
Prior art keywords
terminal
voice
modifying
parameters
word signal
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES03291085T
Other languages
English (en)
Inventor
Pierre Bonnard
Ivan Bourmeyster
Xavier Fourquin
Pierre Ladouce
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
TCT Mobile Ltd
Original Assignee
TCT Mobile Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by TCT Mobile Ltd filed Critical TCT Mobile Ltd
Application granted granted Critical
Publication of ES2292919T3 publication Critical patent/ES2292919T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04MTELEPHONIC COMMUNICATION
    • H04M1/00Substation equipment, e.g. for use by subscribers
    • H04M1/72Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
    • H04M1/724User interfaces specially adapted for cordless or mobile telephones
    • H04M1/72448User interfaces specially adapted for cordless or mobile telephones with means for adapting the functionality of the device according to specific conditions
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/003Changing voice quality, e.g. pitch or formants
    • G10L21/007Changing voice quality, e.g. pitch or formants characterised by the process used
    • G10L21/013Adapting to target pitch
    • G10L2021/0135Voice conversion or morphing

Landscapes

  • Engineering & Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Signal Processing (AREA)
  • Physics & Mathematics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Health & Medical Sciences (AREA)
  • Computational Linguistics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Mobile Radio Communication Systems (AREA)
  • Telephonic Communication Services (AREA)
  • Telephone Function (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

Terminal (8) de telecomunicación que comprende medios (9) de entrada por el usuario del citado terminal de una señal de palabra analógica, medios (10) para convertir la citada señal de palabra analógica en una señal de palabra numérica (S), un codificador de voz (11) para ejecutar una codificación de fuente de la citada señal de palabra numérica (S), incluyendo el citado codificador de voz (11) medios (2, 3, 4) para extraer parámetros (LAR, P, I) de reconstrucción de la citada señal de palabra numérica y un formateador de datos (12) que entrega una señal de palabra codificada (C) función de los parámetros de reconstrucción extraídos, caracterizado porque el citado terminal (8) comprende medios (13) para modificar, durante una comunicación telefónica, al menos uno de los citados parámetros de reconstrucción de manera que la voz transmitida asociada a la citada señal de palabra codificada (C) sea modificada, estando los citados medios gobernados por medios (14) de selección por el usuario de un tipo de modificación de la voz que se va a transmitir y/o por medios (15) para configurar manualmente las modificaciones de los citados parámetros de reconstrucción de palabra.

Description

Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicación telefónica.
La presente invención se refiere a un terminal de telecomunicación que permite modificar la voz transmitida durante una comunicación telefónica, más particularmente adaptado a un sistema de telefonía móvil.
Incluso si bien la transmisión de la palabra sigue siendo el elemento esencial de la telefonía móvil, sin embargo los fabricantes buscan diferenciar sus productos ofreciendo nuevos servicios atractivos y de distracción para el consumidor. Los juegos, los servicios ligados al reconocimiento vocal o la multiplicación de los sonidos de llamada son ejemplos.
Estos nuevos servicios implican a menudo un coste suplementario en el teléfono ligado a la adición de elementos lógicos o materiales.
La presente invención se dirige a proporcionar un terminal de telecomunicación que ofrece un servicio de modificación de la voz transmitida por el usuario del terminal durante una comunicación telefónica, teniendo este servicio una característica atractiva y de distracción que se ponen en práctica de manera simple y económica.
La presente invención propone a este efecto un terminal de telecomunicación tal como el definido en la reivindicación 1.
El documento WO 98/35340 describe un sistema de conversión de voz en el cual una señal de fuente (voz de un primer usuario) debe ser transformada en una señal de destino (voz de un segundo usuario). Este sistema aplica el principio de los "codebook", es decir de bibliotecas de fonemas registrados previamente para cada usuario posible (fase de aprendizaje), con una correspondencia única entre la biblioteca de fonemas ligada al primer usuario y la biblioteca de fonemas correspondiente al segundo usuario.
El documento US 5.956.685 describe un sistema que permite convertir principalmente una señal de palabra en otra señal representativa de una voz modificada. Este sistema descansa sobre el tratamiento de datos de palabras correspondiente a divisiones de la señal de palabra de fuente numerada en función de la puntuación.
Gracias a la invención, la colocación de un servicio de modificación de la voz transmitida por un teléfono móvil se hace de manera simple y económica utilizando un codificador de voz ya presente en el teléfono para la codificación de la voz. Los parámetros de reconstrucción son representativos de la voz que se va a transmitir y su modificación permite actuar directamente sobre la sonoridad de la voz transmitida.
Ventajosamente, los citados medios para modificar los parámetros de reconstrucción comprenden medios para modificar la frecuencia fundamental de la voz.
De acuerdo con un modo de realización, la citada codificación de fuente de la señal de palabra es una codificación de RPE-LTP (Regular Pulse Excitation Long Term Prediction).
De manera ventajosa, los citados medios para modificar los parámetros de reconstrucción comprenden medios para modificar los parámetros de filtro de corto plazo del citado codificador de voz.
Los parámetros de filtro de corto plazo son por ejemplo los coeficientes de reflexión, llamados coeficientes de LAR (Long Área Ratio) determinados durante una codificación del tipo de RPE-LTP.
De acuerdo con una variante, los citados medios para modificar los parámetros de reconstrucción comprenden medios para modificar los parámetros de filtro de largo plazo del citado codificador de voz.
Un parámetro de filtro de largo plazo es por ejemplo la frecuencia fundamental asociada a un paso (pitch) determinado durante una codificación del tipo de RPE-LTP.
Ventajosamente, los citados medios para modificar los parámetros de reconstrucción comprenden medios para modificar los parámetros asociados a amplitudes de excitación del citado codificador de voz.
Un parámetro asociado a una amplitud de excitación puede ser por ejemplo un parámetro que define la señal de impulso de excitación determinada durante una codificación de RPE-LTP.
De acuerdo con un modo de realización, los citados medios para modificar los parámetros de reconstrucción comprenden medios para modificar los citados parámetros en función de datos codificados representativos de un conjunto de notas definidas por sus frecuencias y sus duraciones respectivas.
Ventajosamente, el terminal comprende medios de selección de un tipo de modificación de la voz que se va a transmitir.
De manera ventajosa, el terminal comprende medios para configurar manualmente las modificaciones de los citados parámetros de reconstrucción de la señal de palabra.
De acuerdo con un modo de realización, el terminal comprende medios para ejecutar las citadas modificaciones en un modo de prueba.
De manera ventajosa, el terminal es un teléfono móvil.
Otras características y ventajas de la presente invención se desprenderán de la descripción siguiente de un modo de realización de la invención dado a título ilustrativo y en absoluto limitativo.
En las figuras siguientes:
\bullet La figura 1 representa esquemáticamente un terminal de telecomunicación de acuerdo con la invención,
\bullet La figura 2 representa esquemáticamente los medios de codificación y de modificación de la voz utilizados en un terminal de telecomunicación de acuerdo con la invención, que utilizan una codificación de RPE-LTP de acuerdo con la norma GSM 06.10.
En todas las figuras, los elementos comunes llevan los mismos números de referencia.
La figura 1 representa un terminal de telecomunicación 8 de acuerdo con la invención, tal como un teléfono móvil.
El terminal 8 comprende un micrófono 9, un convertidor analógico numérico 10, un codificador de voz 11, un formateador de datos 12, medios 13 para modificar parámetros de reconstrucción de la voz, medios 14 de selección de un tipo de modificación de la voz que se va a transmitir, medios 15 para configurar manualmente las modificaciones de los parámetros de reconstrucción de la señal de palabra y medios 16 para ejecutar modificaciones en un modo de prueba.
El codificador de voz 11, el formateador de datos 12 y los medios 13 para modificar los parámetros de reconstrucción de la voz se describirán a continuación en relación con la figura 2.
La figura 2 representa un codificador de voz 11 para ejecutar una codificación de RPE-LTP de acuerdo con la norma GSM 06.10, un formateador 12 de flujo de datos y medios 13 de modificaciones de parámetros de reconstrucción de la voz. El codificador de voz 11, el formateador 12 y los medios 13 son medios lógicos ejecutados por un procesador programable no representado.
El codificador de voz 11 incluye medios 2 de determinación de coeficientes de reflexión de LAR, medios 3 de determinación de una frecuencia fundamental de la voz y medios 4 de determinación de una señal de impulso de excitación, a partir de una señal S muestreada.
El principio de la codificación de RPE-LTP consiste en modelizar la señal de palabra como un filtro lineal cuyos parámetros evolucionan en el tiempo, siendo el citado filtro lineal excitado por una señal de impulso. Por lo tanto, se comprende que el objetivo de esta codificación es determinar la señal de impulso de excitación, definiendo los diferentes parámetros el filtro lineal y la frecuencia fundamental de la voz que se va a transmitir. Este tipo de codificación de la palabra opera en tramas de 20 ms en la banda [300-3400 Hz]. El filtro lineal se descompone en dos partes: una primera parte que tiene en cuenta las correlaciones de corto plazo de la señal de palabra y una segunda parte que tiene en cuenta las correlaciones de largo plazo de la señal de palabra. Se hablará en lo que sigue del filtro de corto plazo y del filtro de largo plazo.
La señal S constituye una trama de palabra de 20 ms muestreada a 8 kHz.
Los medios 2 permiten determinar los coeficientes de reflexión de LAR del filtro de corto plazo. Se utiliza para esto el algoritmo de Durbin que se aplica a la señal filtrada con el fin de obtener una predicción lineal. El algoritmo de Durbin genera diez coeficientes de reflexión, llamados coeficientes de LAR, comprendidos entre -1 y 1, expresados en la escala logarítmica de LAR (Long Area Ratio).
Los medios 3 de determinación de una frecuencia fundamental de la voz utilizan un procedimiento de predicción asociado al filtro de largo plazo en tramas de 5 ms y permiten reproducir la frecuencia fundamental asociada a un paso P comprendido entre 56 y 444 Hz y característico del locutor, así como la ganancia asociada a esta frecuencia.
Los medios 4 permiten determinar la señal de impulso I de excitación.
El conjunto de los datos proporcionados por los medios 2, 3 y 4 para una trama de 20 ms es formateado en el formateador 12 de flujo de datos que va a producir una señal de palabra C codificada.
Cuando estos parámetros están definidos, se pueden producir diferentes efectos en la voz modificando los citados parámetros de LAR, P e I. Los medios de modificación 13 permiten modificar estos diferentes parámetros.
Así, los medios 13 de modificación pueden modificar únicamente el valor del paso asociado a la frecuencia fundamental de manera que transformen una voz de hombre en una voz de mujer. Para ello, el valor de paso P de cada trama es modificado en un valor Min (P+P_{effet}, Max (P)), siendo P_{effet} un valor predefinido, por ejemplo a 90 Hz, y siendo Max (P) el valor de paso máximo aceptado por el sistema estándar. En efecto, una voz masculina tiene un valor de paso aproximadamente de 120 Hz mientras que una voz femenina tiene un valor de paso de aproximadamente
210 Hz.
Los medios 13 de modificación pueden proceder de manera similar para transformar una voz de mujer en una voz de hombre. Para ello, el valor de paso P de cada trama es modificado en un valor Max (P-P_{effet}, Min (P)), siendo P_{effet} un valor predefinido de 90 Hz y siendo Min (P) el valor de paso mínimo aceptado por el sistema estándar.
Se puede igualmente obtener un efecto de susurro cuando los medios 13 modifican el paso y la ganancia. Para ello, los medios de modificación 13 aumentan el paso y disminuyen la ganancia de manera que la salida de la señal del filtro de largo plazo sea substancialmente modificada disminuyendo el efecto de las vibraciones de las cuerdas vocales. Los parámetros de LAR permanecen sin cambios.
Se puede obtener también un efecto de voz robotizada cuando los medios 13 modifican los parámetros del filtro de largo plazo. Para ello, el paso se fija en un valor relativamente elevado. Como para el efecto de susurro, la prosodia, es decir el conjunto de los elementos fónicos que caracterizan el lenguaje hablado, es completamente modificada y transformada en un sonido monótono que tiene una frecuencia fundamental única y parámetros de LAR no cambiados.
Otra propiedad notable de los parámetros de los codificadores de voz se refiere al hecho de que los parámetros de LAR representan el trayecto vocal y el trayecto nasal ligados a la producción de palabra, pudiendo estos dos trayectos ser modelizados por filtros de resonancia del tipo de filtro "todo polo", representando cada polo una frecuencia de resonancia. Por lo tanto, haciendo la producción de la palabra intervenir el trayecto vocal y el trayecto nasal, los medios 13 pueden modificar estos parámetros de manera que las vocales resuenan como las de una persona que tiene la nariz taponada.
El trayecto vocal y el trayecto nasal pueden ser cada uno modelizados por un filtro todo polo pero la suma de estos dos filtros no es todo polo. Para modelizar la combinación de estos dos trayectos en forma de un filtro todo polo, es preciso construir un cero situando dos polos uno al lado de otro. Este cero representa la contribución de la cavidad vocal.
Aproximando estos dos polos uno al lado de otro, los medios de modificación 13 disminuyen la contribución de la cavidad nasal y dan así un efecto "resfriado" a la voz.
Los parámetros pueden igualmente ser modificados en función de datos codificados representativos de un conjunto de notas definidas por sus frecuencias y sus duraciones respectivas. Así la voz modificada puede seguir una partitura definida en un formato de codificación que define un conjunto de pares (frecuencia, duración) y tener así un efecto cantado. Una partitura es proporcionada por los medios 13 de modificación de los parámetros de reconstrucción. Esta partitura puede ser en un formato de codificación de música MIDI, SMAF de Yamaha®, EMR R5 polifónico, IrDA iMelody del IrMC (Infrared Mobile Communications) u otro formato de descripción vectorial de la música. En la etapa de tratamiento previo, la partitura es transcrita automáticamente si es necesario, para que las frecuencias de las notas estén en el intervalo [56 Hz, 444 Hz].
Las notas son interpretadas en duración y en frecuencia, correspondiendo a cada nota una fecha de inicio, una fecha de finalización y una frecuencia. Las tramas de palabra de 5 ms son modificadas por los medios 13 para que el paso de la palabra sea igual a la frecuencia de la nota correspondiente en el mismo instante.
Las modificaciones de los parámetros se hacen generalmente por medio de intercambios entre el formateador de flujo de datos y los medios 13 con el fin de modificar los parámetros. Sin embargo, se pueden igualmente considerar modificaciones de los parámetros hechas directamente al nivel del codificador de voz 11.
En la figura 1, el usuario tiene la posibilidad de seleccionar el tipo de efectos deseado sobre la voz que se va a transmitir por medio de los medios 14 de selección de un tipo de modificación. Puede igualmente configurar manualmente las modificaciones de los parámetros de reconstrucción de la señal de palabra por medio de los medios 15. Así, puede por ejemplo influir sobre el valor del paso modificado a Min (P+P_{effet}, Max (P)) en el caso de una transformación de voz masculina en voz femenina fijando a su vez el valor de P_{effet}. Puede igualmente probar el efecto obtenido por medio de los medios 16 que le permiten ejecutar el tipo de modificación seleccionado con los parámetros tal como los ha fijado.
Durante una comunicación móvil, la voz del usuario es primero muestreada y numerada por los medios 9. A continuación es codificada por el codificador de voz 11, el cual realiza la etapa 7 tal como se describe en relación con la figura 1.
La voz codificada es a continuación formateada por el formateador 12 en forma de parámetros de reconstrucción de la voz obtenidos gracias al codificador de voz 11.
Los medios 13, gobernados por los medios 14, 15 y 16 van entonces a modificar los parámetros formateados de reconstrucción de la voz para obtener los efectos buscados por el usuario. Los parámetros modificados son a continuación retransmitidos a los medios 12 y después son enviados al interlocutor por medio de la red de telecomunicación o ejecutados en modo de prueba por el usuario.
Se puede igualmente considerar una modificación de los parámetros de reconstrucción directamente al nivel de los medios 11 por los medios 13.
Se ha de entender que la invención no está limitada al modo de realización que acaba de describirse.
Particularmente, el modo de realización porta en una codificación de fuente del tipo de RPE-LTP, pero se puede considerar cualquier otra codificación de fuente tal como, por ejemplo, la ETS 300 726 GSM EFR (Enhanced Full Rate) y la 3GPP TS 26.071 AM (Adaptive Multirate).

Claims (9)

1. Terminal (8) de telecomunicación que comprende medios (9) de entrada por el usuario del citado terminal de una señal de palabra analógica, medios (10) para convertir la citada señal de palabra analógica en una señal de palabra numérica (S), un codificador de voz (11) para ejecutar una codificación de fuente de la citada señal de palabra numérica (S), incluyendo el citado codificador de voz (11) medios (2, 3, 4) para extraer parámetros (LAR, P, I) de reconstrucción de la citada señal de palabra numérica y un formateador de datos (12) que entrega una señal de palabra codificada (C) función de los parámetros de reconstrucción extraídos, caracterizado porque el citado terminal (8) comprende medios (13) para modificar, durante una comunicación telefónica, al menos uno de los citados parámetros de reconstrucción de manera que la voz transmitida asociada a la citada señal de palabra codificada (C) sea modificada, estando los citados medios gobernados por medios (14) de selección por el usuario de un tipo de modificación de la voz que se va a transmitir y/o por medios (15) para configurar manualmente las modificaciones de los citados parámetros de reconstrucción de palabra.
2. Terminal (8) de acuerdo con la reivindicación precedente, caracterizado porque los citados medios (13) para modificar los citados parámetros de reconstrucción comprenden medios para modificar un parámetro representativo de la frecuencia fundamental de la voz.
3. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, caracterizado porque la citada codificación de fuente de la señal de palabra es una codificación de RPE-LTP.
4. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, caracterizado porque los citados medios (13) para modificar los citados parámetros de reconstrucción comprenden medios para modificar los parámetros de filtro de corto plazo del citado codificador de voz.
5. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, caracterizado porque los citados medios (13) para modificar los citados parámetros de reconstrucción comprenden medios para modificar los citados parámetros asociados a amplitudes de excitación.
6. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, caracterizado porque los citados medios (13) para modificar los citados parámetros de reconstrucción comprenden medios para modificar los parámetros de filtro de largo plazo del citado codificador de voz.
7. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, caracterizado porque los citados medios (13) para modificar los citados parámetros de reconstrucción comprenden medios para modificar los citados parámetros en función de datos codificados representativos de un conjunto de notas definidas por sus frecuencias y sus duraciones respectivas.
8. Terminal (8) de acuerdo con una de las reivindicaciones precedentes, que comprende medios (16) para ejecutar las citadas modificaciones en un modo de prueba.
9. Terminal de acuerdo con una de las reivindicaciones precedentes, caracterizado porque el citado terminal es un teléfono móvil.
ES03291085T 2002-05-16 2003-05-06 Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. Expired - Lifetime ES2292919T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0206035A FR2839836B1 (fr) 2002-05-16 2002-05-16 Terminal de telecommunication permettant de modifier la voix transmise lors d'une communication telephonique
FR0206035 2002-05-16

Publications (1)

Publication Number Publication Date
ES2292919T3 true ES2292919T3 (es) 2008-03-16

Family

ID=29266109

Family Applications (1)

Application Number Title Priority Date Filing Date
ES03291085T Expired - Lifetime ES2292919T3 (es) 2002-05-16 2003-05-06 Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica.

Country Status (8)

Country Link
US (1) US7796748B2 (es)
EP (1) EP1363272B1 (es)
CN (2) CN101668271B (es)
AT (1) ATE370496T1 (es)
DE (1) DE60315544T2 (es)
ES (1) ES2292919T3 (es)
FR (1) FR2839836B1 (es)
PT (1) PT1363272E (es)

Families Citing this family (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR2852778B1 (fr) 2003-03-21 2005-07-22 Cit Alcatel Terminal de telecommunication
JP2006333057A (ja) * 2005-05-26 2006-12-07 Nec Corp ボイスチェンジャ付電話機およびその制御方法並びに制御プログラム
JP4445536B2 (ja) * 2007-09-21 2010-04-07 株式会社東芝 移動無線端末装置、音声変換方法およびプログラム
EP2345352A1 (en) * 2010-01-19 2011-07-20 Nestec S.A. Method for providing information to a user from a capsule for the preparation of a beverage using a code
CN103903627B (zh) * 2012-12-27 2018-06-19 中兴通讯股份有限公司 一种语音数据的传输方法及装置
US20140195222A1 (en) * 2013-01-07 2014-07-10 Microsoft Corporation Speech Modification for Distributed Story Reading
US9613620B2 (en) * 2014-07-03 2017-04-04 Google Inc. Methods and systems for voice conversion
CN110503965B (zh) * 2019-08-29 2021-09-14 珠海格力电器股份有限公司 一种调制解调器语音编解码器的选择方法和存储介质

Family Cites Families (19)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4823380A (en) * 1987-03-27 1989-04-18 Chaim Kohen Voice changer
US4868867A (en) * 1987-04-06 1989-09-19 Voicecraft Inc. Vector excitation speech or audio coder for transmission or storage
US5255339A (en) * 1991-07-19 1993-10-19 Motorola, Inc. Low bit rate vocoder means and method
US5526464A (en) * 1993-04-29 1996-06-11 Northern Telecom Limited Reducing search complexity for code-excited linear prediction (CELP) coding
US5956685A (en) * 1994-09-12 1999-09-21 Arcadia, Inc. Sound characteristic converter, sound-label association apparatus and method therefor
US5567901A (en) * 1995-01-18 1996-10-22 Ivl Technologies Ltd. Method and apparatus for changing the timbre and/or pitch of audio signals
US5692101A (en) * 1995-11-20 1997-11-25 Motorola, Inc. Speech coding method and apparatus using mean squared error modifier for selected speech coder parameters using VSELP techniques
JP3357795B2 (ja) * 1996-08-16 2002-12-16 株式会社東芝 音声符号化方法および装置
JP3707153B2 (ja) * 1996-09-24 2005-10-19 ソニー株式会社 ベクトル量子化方法、音声符号化方法及び装置
JPH10153998A (ja) * 1996-09-24 1998-06-09 Nippon Telegr & Teleph Corp <Ntt> 補助情報利用型音声合成方法、この方法を実施する手順を記録した記録媒体、およびこの方法を実施する装置
EP0970466B1 (en) * 1997-01-27 2004-09-22 Microsoft Corporation Voice conversion
SE516595C2 (sv) * 1998-03-13 2002-02-05 Ericsson Telefon Ab L M Kommunikationsanordning och arbetssätt för behandling av röstmeddelanden
JPH11289361A (ja) * 1998-04-03 1999-10-19 Nec Corp 携帯電話装置
FI981508A7 (fi) * 1998-06-30 1999-12-31 Nokia Corp Menetelmä, laite ja järjestelmä käyttäjän tilan arvioimiseksi
US6463128B1 (en) * 1999-09-29 2002-10-08 Denso Corporation Adjustable coding detection in a portable telephone
KR20010065803A (ko) * 1999-12-30 2001-07-11 윤종용 휴대 전화 단말 장치의 통화중 음색 변환 방법
US20030028380A1 (en) * 2000-02-02 2003-02-06 Freeland Warwick Peter Speech system
US7006787B1 (en) * 2000-02-14 2006-02-28 Lucent Technologies Inc. Mobile to mobile digital wireless connection having enhanced voice quality
US20030135374A1 (en) * 2002-01-16 2003-07-17 Hardwick John C. Speech synthesizer

Also Published As

Publication number Publication date
US20030215085A1 (en) 2003-11-20
DE60315544T2 (de) 2008-05-15
CN101668271B (zh) 2012-06-13
ATE370496T1 (de) 2007-09-15
FR2839836A1 (fr) 2003-11-21
FR2839836B1 (fr) 2004-09-10
US7796748B2 (en) 2010-09-14
EP1363272B1 (fr) 2007-08-15
DE60315544D1 (de) 2007-09-27
PT1363272E (pt) 2007-11-05
CN101668271A (zh) 2010-03-10
CN1474622A (zh) 2004-02-11
EP1363272A1 (fr) 2003-11-19

Similar Documents

Publication Publication Date Title
JP4246792B2 (ja) 声質変換装置および声質変換方法
Chu Speech coding algorithms: foundation and evolution of standardized coders
CN1989548B (zh) 语音解码装置及补偿帧生成方法
US6161091A (en) Speech recognition-synthesis based encoding/decoding method, and speech encoding/decoding system
CN1758330B (zh) 用于通过交互式话音响应系统防止语音理解的方法和设备
JP4813796B2 (ja) 信号を合成するための方法、記憶媒体及びコンピュータシステム
CN1742321B (zh) 韵律模仿合成方法和装置
US20030097254A1 (en) Ultra-narrow bandwidth voice coding
KR950007859B1 (ko) 음성화 혹은 핏치정보 없이 음성을 합성하는 방법 및 장치
US7587312B2 (en) Method and apparatus for pitch modulation and gender identification of a voice signal
JPH05233565A (ja) 音声合成システム
JP2001005474A (ja) 音声符号化装置及び方法、入力信号判定方法、音声復号装置及び方法、並びにプログラム提供媒体
KR20000053407A (ko) 음성 채널을 통한 비음성 정보 전송 방법
WO2000077774A1 (en) Noise signal encoder and voice signal encoder
US7796748B2 (en) Telecommunication terminal able to modify the voice transmitted during a telephone call
US7865360B2 (en) Audio device
JP2000356995A (ja) 音声通信システム
ES2266908T3 (es) Metodo de sintesis para una señal de sonido fija.
ATE322731T1 (de) Sprachsynthetisierer auf der basis von sprachkodierung mit veränderlicher bit-rate
KR100650071B1 (ko) 악음·음성 재생 장치 및 악음·음성 재생 방법
JP2004301954A (ja) 音響信号の階層符号化方法および階層復号化方法
JP4230550B2 (ja) 音声符号化方法及び装置、並びに音声復号化方法及び装置
US20080146197A1 (en) Method and device for emitting an audible alert
KR101129124B1 (ko) 개인 음성 특성을 이용한 문자음성변환 단말기 및 그에사용되는 문자음성변환 방법
KR101567566B1 (ko) 개인 음색을 반영한 통계적 음성합성 시스템 및 방법