ES2292919T3 - Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. - Google Patents
Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. Download PDFInfo
- Publication number
- ES2292919T3 ES2292919T3 ES03291085T ES03291085T ES2292919T3 ES 2292919 T3 ES2292919 T3 ES 2292919T3 ES 03291085 T ES03291085 T ES 03291085T ES 03291085 T ES03291085 T ES 03291085T ES 2292919 T3 ES2292919 T3 ES 2292919T3
- Authority
- ES
- Spain
- Prior art keywords
- terminal
- voice
- modifying
- parameters
- word signal
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
- 238000004891 communication Methods 0.000 title claims description 5
- 238000012986 modification Methods 0.000 claims description 24
- 230000004048 modification Effects 0.000 claims description 24
- 230000005284 excitation Effects 0.000 claims description 8
- 230000007774 longterm Effects 0.000 claims description 8
- 238000012360 testing method Methods 0.000 claims description 4
- 230000000694 effects Effects 0.000 description 10
- 230000001755 vocal effect Effects 0.000 description 5
- 238000010295 mobile communication Methods 0.000 description 2
- 230000003044 adaptive effect Effects 0.000 description 1
- 230000005540 biological transmission Effects 0.000 description 1
- 238000006243 chemical reaction Methods 0.000 description 1
- 230000003247 decreasing effect Effects 0.000 description 1
- 238000000034 method Methods 0.000 description 1
- 210000003928 nasal cavity Anatomy 0.000 description 1
- 210000001331 nose Anatomy 0.000 description 1
- 238000012545 processing Methods 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
- 210000001260 vocal cord Anatomy 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72448—User interfaces specially adapted for cordless or mobile telephones with means for adapting the functionality of the device according to specific conditions
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/003—Changing voice quality, e.g. pitch or formants
- G10L21/007—Changing voice quality, e.g. pitch or formants characterised by the process used
- G10L21/013—Adapting to target pitch
- G10L2021/0135—Voice conversion or morphing
Landscapes
- Engineering & Computer Science (AREA)
- Human Computer Interaction (AREA)
- Signal Processing (AREA)
- Physics & Mathematics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Health & Medical Sciences (AREA)
- Computational Linguistics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Computer Networks & Wireless Communication (AREA)
- Mobile Radio Communication Systems (AREA)
- Telephonic Communication Services (AREA)
- Telephone Function (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
Terminal (8) de telecomunicación que comprende medios (9) de entrada por el usuario del citado terminal de una señal de palabra analógica, medios (10) para convertir la citada señal de palabra analógica en una señal de palabra numérica (S), un codificador de voz (11) para ejecutar una codificación de fuente de la citada señal de palabra numérica (S), incluyendo el citado codificador de voz (11) medios (2, 3, 4) para extraer parámetros (LAR, P, I) de reconstrucción de la citada señal de palabra numérica y un formateador de datos (12) que entrega una señal de palabra codificada (C) función de los parámetros de reconstrucción extraídos, caracterizado porque el citado terminal (8) comprende medios (13) para modificar, durante una comunicación telefónica, al menos uno de los citados parámetros de reconstrucción de manera que la voz transmitida asociada a la citada señal de palabra codificada (C) sea modificada, estando los citados medios gobernados por medios (14) de selección por el usuario de un tipo de modificación de la voz que se va a transmitir y/o por medios (15) para configurar manualmente las modificaciones de los citados parámetros de reconstrucción de palabra.
Description
Terminal de telecomunicaciones que permite
modificar la voz transmitida durante una comunicación
telefónica.
La presente invención se refiere a un terminal
de telecomunicación que permite modificar la voz transmitida
durante una comunicación telefónica, más particularmente adaptado a
un sistema de telefonía móvil.
Incluso si bien la transmisión de la palabra
sigue siendo el elemento esencial de la telefonía móvil, sin
embargo los fabricantes buscan diferenciar sus productos ofreciendo
nuevos servicios atractivos y de distracción para el consumidor.
Los juegos, los servicios ligados al reconocimiento vocal o la
multiplicación de los sonidos de llamada son ejemplos.
Estos nuevos servicios implican a menudo un
coste suplementario en el teléfono ligado a la adición de elementos
lógicos o materiales.
La presente invención se dirige a proporcionar
un terminal de telecomunicación que ofrece un servicio de
modificación de la voz transmitida por el usuario del terminal
durante una comunicación telefónica, teniendo este servicio una
característica atractiva y de distracción que se ponen en práctica
de manera simple y económica.
La presente invención propone a este efecto un
terminal de telecomunicación tal como el definido en la
reivindicación 1.
El documento WO 98/35340 describe un sistema de
conversión de voz en el cual una señal de fuente (voz de un primer
usuario) debe ser transformada en una señal de destino (voz de un
segundo usuario). Este sistema aplica el principio de los
"codebook", es decir de bibliotecas de fonemas registrados
previamente para cada usuario posible (fase de aprendizaje), con
una correspondencia única entre la biblioteca de fonemas ligada al
primer usuario y la biblioteca de fonemas correspondiente al segundo
usuario.
El documento US 5.956.685 describe un sistema
que permite convertir principalmente una señal de palabra en otra
señal representativa de una voz modificada. Este sistema descansa
sobre el tratamiento de datos de palabras correspondiente a
divisiones de la señal de palabra de fuente numerada en función de
la puntuación.
Gracias a la invención, la colocación de un
servicio de modificación de la voz transmitida por un teléfono
móvil se hace de manera simple y económica utilizando un codificador
de voz ya presente en el teléfono para la codificación de la voz.
Los parámetros de reconstrucción son representativos de la voz que
se va a transmitir y su modificación permite actuar directamente
sobre la sonoridad de la voz transmitida.
Ventajosamente, los citados medios para
modificar los parámetros de reconstrucción comprenden medios para
modificar la frecuencia fundamental de la voz.
De acuerdo con un modo de realización, la citada
codificación de fuente de la señal de palabra es una codificación
de RPE-LTP (Regular Pulse Excitation Long Term
Prediction).
De manera ventajosa, los citados medios para
modificar los parámetros de reconstrucción comprenden medios para
modificar los parámetros de filtro de corto plazo del citado
codificador de voz.
Los parámetros de filtro de corto plazo son por
ejemplo los coeficientes de reflexión, llamados coeficientes de LAR
(Long Área Ratio) determinados durante una codificación del tipo de
RPE-LTP.
De acuerdo con una variante, los citados medios
para modificar los parámetros de reconstrucción comprenden medios
para modificar los parámetros de filtro de largo plazo del citado
codificador de voz.
Un parámetro de filtro de largo plazo es por
ejemplo la frecuencia fundamental asociada a un paso (pitch)
determinado durante una codificación del tipo de
RPE-LTP.
Ventajosamente, los citados medios para
modificar los parámetros de reconstrucción comprenden medios para
modificar los parámetros asociados a amplitudes de excitación del
citado codificador de voz.
Un parámetro asociado a una amplitud de
excitación puede ser por ejemplo un parámetro que define la señal
de impulso de excitación determinada durante una codificación de
RPE-LTP.
De acuerdo con un modo de realización, los
citados medios para modificar los parámetros de reconstrucción
comprenden medios para modificar los citados parámetros en función
de datos codificados representativos de un conjunto de notas
definidas por sus frecuencias y sus duraciones respectivas.
Ventajosamente, el terminal comprende medios de
selección de un tipo de modificación de la voz que se va a
transmitir.
De manera ventajosa, el terminal comprende
medios para configurar manualmente las modificaciones de los citados
parámetros de reconstrucción de la señal de palabra.
De acuerdo con un modo de realización, el
terminal comprende medios para ejecutar las citadas modificaciones
en un modo de prueba.
De manera ventajosa, el terminal es un teléfono
móvil.
Otras características y ventajas de la presente
invención se desprenderán de la descripción siguiente de un modo de
realización de la invención dado a título ilustrativo y en absoluto
limitativo.
En las figuras siguientes:
\bullet La figura 1 representa
esquemáticamente un terminal de telecomunicación de acuerdo con la
invención,
\bullet La figura 2 representa
esquemáticamente los medios de codificación y de modificación de la
voz utilizados en un terminal de telecomunicación de acuerdo con la
invención, que utilizan una codificación de RPE-LTP
de acuerdo con la norma GSM 06.10.
En todas las figuras, los elementos comunes
llevan los mismos números de referencia.
La figura 1 representa un terminal de
telecomunicación 8 de acuerdo con la invención, tal como un teléfono
móvil.
El terminal 8 comprende un micrófono 9, un
convertidor analógico numérico 10, un codificador de voz 11, un
formateador de datos 12, medios 13 para modificar parámetros de
reconstrucción de la voz, medios 14 de selección de un tipo de
modificación de la voz que se va a transmitir, medios 15 para
configurar manualmente las modificaciones de los parámetros de
reconstrucción de la señal de palabra y medios 16 para ejecutar
modificaciones en un modo de prueba.
El codificador de voz 11, el formateador de
datos 12 y los medios 13 para modificar los parámetros de
reconstrucción de la voz se describirán a continuación en relación
con la figura 2.
La figura 2 representa un codificador de voz 11
para ejecutar una codificación de RPE-LTP de acuerdo
con la norma GSM 06.10, un formateador 12 de flujo de datos y
medios 13 de modificaciones de parámetros de reconstrucción de la
voz. El codificador de voz 11, el formateador 12 y los medios 13 son
medios lógicos ejecutados por un procesador programable no
representado.
El codificador de voz 11 incluye medios 2 de
determinación de coeficientes de reflexión de LAR, medios 3 de
determinación de una frecuencia fundamental de la voz y medios 4 de
determinación de una señal de impulso de excitación, a partir de una
señal S muestreada.
El principio de la codificación de
RPE-LTP consiste en modelizar la señal de palabra
como un filtro lineal cuyos parámetros evolucionan en el tiempo,
siendo el citado filtro lineal excitado por una señal de impulso.
Por lo tanto, se comprende que el objetivo de esta codificación es
determinar la señal de impulso de excitación, definiendo los
diferentes parámetros el filtro lineal y la frecuencia fundamental
de la voz que se va a transmitir. Este tipo de codificación de la
palabra opera en tramas de 20 ms en la banda
[300-3400 Hz]. El filtro lineal se descompone en
dos partes: una primera parte que tiene en cuenta las correlaciones
de corto plazo de la señal de palabra y una segunda parte que tiene
en cuenta las correlaciones de largo plazo de la señal de palabra.
Se hablará en lo que sigue del filtro de corto plazo y del filtro de
largo plazo.
La señal S constituye una trama de palabra de 20
ms muestreada a 8 kHz.
Los medios 2 permiten determinar los
coeficientes de reflexión de LAR del filtro de corto plazo. Se
utiliza para esto el algoritmo de Durbin que se aplica a la señal
filtrada con el fin de obtener una predicción lineal. El algoritmo
de Durbin genera diez coeficientes de reflexión, llamados
coeficientes de LAR, comprendidos entre -1 y 1, expresados en la
escala logarítmica de LAR (Long Area Ratio).
Los medios 3 de determinación de una frecuencia
fundamental de la voz utilizan un procedimiento de predicción
asociado al filtro de largo plazo en tramas de 5 ms y permiten
reproducir la frecuencia fundamental asociada a un paso P
comprendido entre 56 y 444 Hz y característico del locutor, así como
la ganancia asociada a esta frecuencia.
Los medios 4 permiten determinar la señal de
impulso I de excitación.
El conjunto de los datos proporcionados por los
medios 2, 3 y 4 para una trama de 20 ms es formateado en el
formateador 12 de flujo de datos que va a producir una señal de
palabra C codificada.
Cuando estos parámetros están definidos, se
pueden producir diferentes efectos en la voz modificando los citados
parámetros de LAR, P e I. Los medios de modificación 13 permiten
modificar estos diferentes parámetros.
Así, los medios 13 de modificación pueden
modificar únicamente el valor del paso asociado a la frecuencia
fundamental de manera que transformen una voz de hombre en una voz
de mujer. Para ello, el valor de paso P de cada trama es modificado
en un valor Min (P+P_{effet}, Max (P)), siendo P_{effet} un
valor predefinido, por ejemplo a 90 Hz, y siendo Max (P) el valor
de paso máximo aceptado por el sistema estándar. En efecto, una voz
masculina tiene un valor de paso aproximadamente de 120 Hz mientras
que una voz femenina tiene un valor de paso de
aproximadamente
210 Hz.
210 Hz.
Los medios 13 de modificación pueden proceder de
manera similar para transformar una voz de mujer en una voz de
hombre. Para ello, el valor de paso P de cada trama es modificado en
un valor Max (P-P_{effet}, Min (P)), siendo
P_{effet} un valor predefinido de 90 Hz y siendo Min (P) el valor
de paso mínimo aceptado por el sistema estándar.
Se puede igualmente obtener un efecto de susurro
cuando los medios 13 modifican el paso y la ganancia. Para ello,
los medios de modificación 13 aumentan el paso y disminuyen la
ganancia de manera que la salida de la señal del filtro de largo
plazo sea substancialmente modificada disminuyendo el efecto de las
vibraciones de las cuerdas vocales. Los parámetros de LAR
permanecen sin cambios.
Se puede obtener también un efecto de voz
robotizada cuando los medios 13 modifican los parámetros del filtro
de largo plazo. Para ello, el paso se fija en un valor relativamente
elevado. Como para el efecto de susurro, la prosodia, es decir el
conjunto de los elementos fónicos que caracterizan el lenguaje
hablado, es completamente modificada y transformada en un sonido
monótono que tiene una frecuencia fundamental única y parámetros de
LAR no cambiados.
Otra propiedad notable de los parámetros de los
codificadores de voz se refiere al hecho de que los parámetros de
LAR representan el trayecto vocal y el trayecto nasal ligados a la
producción de palabra, pudiendo estos dos trayectos ser modelizados
por filtros de resonancia del tipo de filtro "todo polo",
representando cada polo una frecuencia de resonancia. Por lo tanto,
haciendo la producción de la palabra intervenir el trayecto vocal y
el trayecto nasal, los medios 13 pueden modificar estos parámetros
de manera que las vocales resuenan como las de una persona que
tiene la nariz taponada.
El trayecto vocal y el trayecto nasal pueden ser
cada uno modelizados por un filtro todo polo pero la suma de estos
dos filtros no es todo polo. Para modelizar la combinación de estos
dos trayectos en forma de un filtro todo polo, es preciso construir
un cero situando dos polos uno al lado de otro. Este cero representa
la contribución de la cavidad vocal.
Aproximando estos dos polos uno al lado de otro,
los medios de modificación 13 disminuyen la contribución de la
cavidad nasal y dan así un efecto "resfriado" a la voz.
Los parámetros pueden igualmente ser modificados
en función de datos codificados representativos de un conjunto de
notas definidas por sus frecuencias y sus duraciones respectivas.
Así la voz modificada puede seguir una partitura definida en un
formato de codificación que define un conjunto de pares (frecuencia,
duración) y tener así un efecto cantado. Una partitura es
proporcionada por los medios 13 de modificación de los parámetros
de reconstrucción. Esta partitura puede ser en un formato de
codificación de música MIDI, SMAF de Yamaha®, EMR R5 polifónico,
IrDA iMelody del IrMC (Infrared Mobile Communications) u otro
formato de descripción vectorial de la música. En la etapa de
tratamiento previo, la partitura es transcrita automáticamente si es
necesario, para que las frecuencias de las notas estén en el
intervalo [56 Hz, 444 Hz].
Las notas son interpretadas en duración y en
frecuencia, correspondiendo a cada nota una fecha de inicio, una
fecha de finalización y una frecuencia. Las tramas de palabra de 5
ms son modificadas por los medios 13 para que el paso de la palabra
sea igual a la frecuencia de la nota correspondiente en el mismo
instante.
Las modificaciones de los parámetros se hacen
generalmente por medio de intercambios entre el formateador de
flujo de datos y los medios 13 con el fin de modificar los
parámetros. Sin embargo, se pueden igualmente considerar
modificaciones de los parámetros hechas directamente al nivel del
codificador de voz 11.
En la figura 1, el usuario tiene la posibilidad
de seleccionar el tipo de efectos deseado sobre la voz que se va a
transmitir por medio de los medios 14 de selección de un tipo de
modificación. Puede igualmente configurar manualmente las
modificaciones de los parámetros de reconstrucción de la señal de
palabra por medio de los medios 15. Así, puede por ejemplo influir
sobre el valor del paso modificado a Min (P+P_{effet}, Max (P))
en el caso de una transformación de voz masculina en voz femenina
fijando a su vez el valor de P_{effet}. Puede igualmente probar
el efecto obtenido por medio de los medios 16 que le permiten
ejecutar el tipo de modificación seleccionado con los parámetros
tal como los ha fijado.
Durante una comunicación móvil, la voz del
usuario es primero muestreada y numerada por los medios 9. A
continuación es codificada por el codificador de voz 11, el cual
realiza la etapa 7 tal como se describe en relación con la figura
1.
La voz codificada es a continuación formateada
por el formateador 12 en forma de parámetros de reconstrucción de
la voz obtenidos gracias al codificador de voz 11.
Los medios 13, gobernados por los medios 14, 15
y 16 van entonces a modificar los parámetros formateados de
reconstrucción de la voz para obtener los efectos buscados por el
usuario. Los parámetros modificados son a continuación
retransmitidos a los medios 12 y después son enviados al
interlocutor por medio de la red de telecomunicación o ejecutados
en modo de prueba por el usuario.
Se puede igualmente considerar una modificación
de los parámetros de reconstrucción directamente al nivel de los
medios 11 por los medios 13.
Se ha de entender que la invención no está
limitada al modo de realización que acaba de describirse.
Particularmente, el modo de realización porta en
una codificación de fuente del tipo de RPE-LTP, pero
se puede considerar cualquier otra codificación de fuente tal como,
por ejemplo, la ETS 300 726 GSM EFR (Enhanced Full Rate) y la 3GPP
TS 26.071 AM (Adaptive Multirate).
Claims (9)
1. Terminal (8) de telecomunicación que
comprende medios (9) de entrada por el usuario del citado terminal
de una señal de palabra analógica, medios (10) para convertir la
citada señal de palabra analógica en una señal de palabra numérica
(S), un codificador de voz (11) para ejecutar una codificación de
fuente de la citada señal de palabra numérica (S), incluyendo el
citado codificador de voz (11) medios (2, 3, 4) para extraer
parámetros (LAR, P, I) de reconstrucción de la citada señal de
palabra numérica y un formateador de datos (12) que entrega una
señal de palabra codificada (C) función de los parámetros de
reconstrucción extraídos, caracterizado porque el citado
terminal (8) comprende medios (13) para modificar, durante una
comunicación telefónica, al menos uno de los citados parámetros de
reconstrucción de manera que la voz transmitida asociada a la
citada señal de palabra codificada (C) sea modificada, estando los
citados medios gobernados por medios (14) de selección por el
usuario de un tipo de modificación de la voz que se va a transmitir
y/o por medios (15) para configurar manualmente las modificaciones
de los citados parámetros de reconstrucción de palabra.
2. Terminal (8) de acuerdo con la reivindicación
precedente, caracterizado porque los citados medios (13)
para modificar los citados parámetros de reconstrucción comprenden
medios para modificar un parámetro representativo de la frecuencia
fundamental de la voz.
3. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque la citada
codificación de fuente de la señal de palabra es una codificación
de RPE-LTP.
4. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque los
citados medios (13) para modificar los citados parámetros de
reconstrucción comprenden medios para modificar los parámetros de
filtro de corto plazo del citado codificador de voz.
5. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque los
citados medios (13) para modificar los citados parámetros de
reconstrucción comprenden medios para modificar los citados
parámetros asociados a amplitudes de excitación.
6. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque los
citados medios (13) para modificar los citados parámetros de
reconstrucción comprenden medios para modificar los parámetros de
filtro de largo plazo del citado codificador de voz.
7. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque los
citados medios (13) para modificar los citados parámetros de
reconstrucción comprenden medios para modificar los citados
parámetros en función de datos codificados representativos de un
conjunto de notas definidas por sus frecuencias y sus duraciones
respectivas.
8. Terminal (8) de acuerdo con una de las
reivindicaciones precedentes, que comprende medios (16) para
ejecutar las citadas modificaciones en un modo de prueba.
9. Terminal de acuerdo con una de las
reivindicaciones precedentes, caracterizado porque el citado
terminal es un teléfono móvil.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0206035A FR2839836B1 (fr) | 2002-05-16 | 2002-05-16 | Terminal de telecommunication permettant de modifier la voix transmise lors d'une communication telephonique |
| FR0206035 | 2002-05-16 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2292919T3 true ES2292919T3 (es) | 2008-03-16 |
Family
ID=29266109
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES03291085T Expired - Lifetime ES2292919T3 (es) | 2002-05-16 | 2003-05-06 | Terminal de telecomunicaciones que permite modificar la voz transmitida durante una comunicacion telefonica. |
Country Status (8)
| Country | Link |
|---|---|
| US (1) | US7796748B2 (es) |
| EP (1) | EP1363272B1 (es) |
| CN (2) | CN101668271B (es) |
| AT (1) | ATE370496T1 (es) |
| DE (1) | DE60315544T2 (es) |
| ES (1) | ES2292919T3 (es) |
| FR (1) | FR2839836B1 (es) |
| PT (1) | PT1363272E (es) |
Families Citing this family (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR2852778B1 (fr) | 2003-03-21 | 2005-07-22 | Cit Alcatel | Terminal de telecommunication |
| JP2006333057A (ja) * | 2005-05-26 | 2006-12-07 | Nec Corp | ボイスチェンジャ付電話機およびその制御方法並びに制御プログラム |
| JP4445536B2 (ja) * | 2007-09-21 | 2010-04-07 | 株式会社東芝 | 移動無線端末装置、音声変換方法およびプログラム |
| EP2345352A1 (en) * | 2010-01-19 | 2011-07-20 | Nestec S.A. | Method for providing information to a user from a capsule for the preparation of a beverage using a code |
| CN103903627B (zh) * | 2012-12-27 | 2018-06-19 | 中兴通讯股份有限公司 | 一种语音数据的传输方法及装置 |
| US20140195222A1 (en) * | 2013-01-07 | 2014-07-10 | Microsoft Corporation | Speech Modification for Distributed Story Reading |
| US9613620B2 (en) * | 2014-07-03 | 2017-04-04 | Google Inc. | Methods and systems for voice conversion |
| CN110503965B (zh) * | 2019-08-29 | 2021-09-14 | 珠海格力电器股份有限公司 | 一种调制解调器语音编解码器的选择方法和存储介质 |
Family Cites Families (19)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4823380A (en) * | 1987-03-27 | 1989-04-18 | Chaim Kohen | Voice changer |
| US4868867A (en) * | 1987-04-06 | 1989-09-19 | Voicecraft Inc. | Vector excitation speech or audio coder for transmission or storage |
| US5255339A (en) * | 1991-07-19 | 1993-10-19 | Motorola, Inc. | Low bit rate vocoder means and method |
| US5526464A (en) * | 1993-04-29 | 1996-06-11 | Northern Telecom Limited | Reducing search complexity for code-excited linear prediction (CELP) coding |
| US5956685A (en) * | 1994-09-12 | 1999-09-21 | Arcadia, Inc. | Sound characteristic converter, sound-label association apparatus and method therefor |
| US5567901A (en) * | 1995-01-18 | 1996-10-22 | Ivl Technologies Ltd. | Method and apparatus for changing the timbre and/or pitch of audio signals |
| US5692101A (en) * | 1995-11-20 | 1997-11-25 | Motorola, Inc. | Speech coding method and apparatus using mean squared error modifier for selected speech coder parameters using VSELP techniques |
| JP3357795B2 (ja) * | 1996-08-16 | 2002-12-16 | 株式会社東芝 | 音声符号化方法および装置 |
| JP3707153B2 (ja) * | 1996-09-24 | 2005-10-19 | ソニー株式会社 | ベクトル量子化方法、音声符号化方法及び装置 |
| JPH10153998A (ja) * | 1996-09-24 | 1998-06-09 | Nippon Telegr & Teleph Corp <Ntt> | 補助情報利用型音声合成方法、この方法を実施する手順を記録した記録媒体、およびこの方法を実施する装置 |
| EP0970466B1 (en) * | 1997-01-27 | 2004-09-22 | Microsoft Corporation | Voice conversion |
| SE516595C2 (sv) * | 1998-03-13 | 2002-02-05 | Ericsson Telefon Ab L M | Kommunikationsanordning och arbetssätt för behandling av röstmeddelanden |
| JPH11289361A (ja) * | 1998-04-03 | 1999-10-19 | Nec Corp | 携帯電話装置 |
| FI981508A7 (fi) * | 1998-06-30 | 1999-12-31 | Nokia Corp | Menetelmä, laite ja järjestelmä käyttäjän tilan arvioimiseksi |
| US6463128B1 (en) * | 1999-09-29 | 2002-10-08 | Denso Corporation | Adjustable coding detection in a portable telephone |
| KR20010065803A (ko) * | 1999-12-30 | 2001-07-11 | 윤종용 | 휴대 전화 단말 장치의 통화중 음색 변환 방법 |
| US20030028380A1 (en) * | 2000-02-02 | 2003-02-06 | Freeland Warwick Peter | Speech system |
| US7006787B1 (en) * | 2000-02-14 | 2006-02-28 | Lucent Technologies Inc. | Mobile to mobile digital wireless connection having enhanced voice quality |
| US20030135374A1 (en) * | 2002-01-16 | 2003-07-17 | Hardwick John C. | Speech synthesizer |
-
2002
- 2002-05-16 FR FR0206035A patent/FR2839836B1/fr not_active Expired - Fee Related
-
2003
- 2003-05-06 AT AT03291085T patent/ATE370496T1/de not_active IP Right Cessation
- 2003-05-06 EP EP03291085A patent/EP1363272B1/fr not_active Expired - Lifetime
- 2003-05-06 ES ES03291085T patent/ES2292919T3/es not_active Expired - Lifetime
- 2003-05-06 DE DE60315544T patent/DE60315544T2/de not_active Expired - Lifetime
- 2003-05-06 PT PT03291085T patent/PT1363272E/pt unknown
- 2003-05-15 CN CN2009101730797A patent/CN101668271B/zh not_active Expired - Fee Related
- 2003-05-15 CN CNA031368166A patent/CN1474622A/zh active Pending
- 2003-05-15 US US10/438,143 patent/US7796748B2/en not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| US20030215085A1 (en) | 2003-11-20 |
| DE60315544T2 (de) | 2008-05-15 |
| CN101668271B (zh) | 2012-06-13 |
| ATE370496T1 (de) | 2007-09-15 |
| FR2839836A1 (fr) | 2003-11-21 |
| FR2839836B1 (fr) | 2004-09-10 |
| US7796748B2 (en) | 2010-09-14 |
| EP1363272B1 (fr) | 2007-08-15 |
| DE60315544D1 (de) | 2007-09-27 |
| PT1363272E (pt) | 2007-11-05 |
| CN101668271A (zh) | 2010-03-10 |
| CN1474622A (zh) | 2004-02-11 |
| EP1363272A1 (fr) | 2003-11-19 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP4246792B2 (ja) | 声質変換装置および声質変換方法 | |
| Chu | Speech coding algorithms: foundation and evolution of standardized coders | |
| CN1989548B (zh) | 语音解码装置及补偿帧生成方法 | |
| US6161091A (en) | Speech recognition-synthesis based encoding/decoding method, and speech encoding/decoding system | |
| CN1758330B (zh) | 用于通过交互式话音响应系统防止语音理解的方法和设备 | |
| JP4813796B2 (ja) | 信号を合成するための方法、記憶媒体及びコンピュータシステム | |
| CN1742321B (zh) | 韵律模仿合成方法和装置 | |
| US20030097254A1 (en) | Ultra-narrow bandwidth voice coding | |
| KR950007859B1 (ko) | 음성화 혹은 핏치정보 없이 음성을 합성하는 방법 및 장치 | |
| US7587312B2 (en) | Method and apparatus for pitch modulation and gender identification of a voice signal | |
| JPH05233565A (ja) | 音声合成システム | |
| JP2001005474A (ja) | 音声符号化装置及び方法、入力信号判定方法、音声復号装置及び方法、並びにプログラム提供媒体 | |
| KR20000053407A (ko) | 음성 채널을 통한 비음성 정보 전송 방법 | |
| WO2000077774A1 (en) | Noise signal encoder and voice signal encoder | |
| US7796748B2 (en) | Telecommunication terminal able to modify the voice transmitted during a telephone call | |
| US7865360B2 (en) | Audio device | |
| JP2000356995A (ja) | 音声通信システム | |
| ES2266908T3 (es) | Metodo de sintesis para una señal de sonido fija. | |
| ATE322731T1 (de) | Sprachsynthetisierer auf der basis von sprachkodierung mit veränderlicher bit-rate | |
| KR100650071B1 (ko) | 악음·음성 재생 장치 및 악음·음성 재생 방법 | |
| JP2004301954A (ja) | 音響信号の階層符号化方法および階層復号化方法 | |
| JP4230550B2 (ja) | 音声符号化方法及び装置、並びに音声復号化方法及び装置 | |
| US20080146197A1 (en) | Method and device for emitting an audible alert | |
| KR101129124B1 (ko) | 개인 음성 특성을 이용한 문자음성변환 단말기 및 그에사용되는 문자음성변환 방법 | |
| KR101567566B1 (ko) | 개인 음색을 반영한 통계적 음성합성 시스템 및 방법 |