KR20200027331A - 음성 합성 장치 - Google Patents
음성 합성 장치 Download PDFInfo
- Publication number
- KR20200027331A KR20200027331A KR1020180105487A KR20180105487A KR20200027331A KR 20200027331 A KR20200027331 A KR 20200027331A KR 1020180105487 A KR1020180105487 A KR 1020180105487A KR 20180105487 A KR20180105487 A KR 20180105487A KR 20200027331 A KR20200027331 A KR 20200027331A
- Authority
- KR
- South Korea
- Prior art keywords
- language
- voice
- speech
- speaker
- characteristic information
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/08—Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
- G06F40/58—Use of machine translation, e.g. for multi-lingual retrieval, for server-side translation for client devices or for real-time translation
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L13/00—Speech synthesis; Text to speech systems
- G10L13/02—Methods for producing synthetic speech; Speech synthesisers
- G10L13/033—Voice editing, e.g. manipulating the voice of the synthesiser
- G10L13/0335—Pitch control
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/005—Language recognition
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/04—Segmentation; Word boundary detection
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
- G10L25/63—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/90—Pitch determination of speech signals
Landscapes
- Engineering & Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Multimedia (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Theoretical Computer Science (AREA)
- General Health & Medical Sciences (AREA)
- Psychiatry (AREA)
- Hospice & Palliative Care (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Child & Adolescent Psychology (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Machine Translation (AREA)
Abstract
Description
도 2는 본 발명의 일 실시 예에 따른 음성 합성 장치의 구성을 설명하기 위한 블록도이다.
도 3은 본 발명의 일 실시 예에 따른 음성 합성 장치의 동작 방법을 설명하기 위한 흐름도이다.
도 4는 본 발명의 일 실시 예에 따라, 화자의 제1 언어로된 음성으로부터 음성의 특성 정보를 추출하는 예를 설명하는 도면이다.
도 5a 및 도 5b는 본 발명의 일 실시 예에 따라, 음성의 특성 정보를 통해 화자의 발화 유형을 추출하고, 추출된 발화 유형과 화자의 음색을 조합하여, 화자 분석 정보를 생성하는 과정을 설명하는 도면이다.
도 6은 본 발명의 일 실시 예에 따라 도 3의 과정에서 생성된 화자 분석 정보에 기초하여, 제2 언어의 음성을 합성하는 과정을 설명하는 흐름도이다.
도 7 내지 도 9는 본 발명의 일 실시 예에 따라 화자 분석 정보를 이용하여, 제2 언어로된 합성 음성을 생성하는 과정을 설명하는 도면이다.
도 10은 본 발명의 실시 예에 따라 화자의 음성으로부터 화자의 음색 및 음성 스타일(또는 발화 유형)을 반영하여, 제1 언어의 음성을 제2 언어의 음성으로 시청자에게 제공하는 시나리오를 개략적으로 설명하는 도면이다.
Claims (15)
- 음성 합성 장치에 있어서,
음성 및 상기 음성에 대응하는 텍스트를 저장하는 데이터 베이스; 및
상기 데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하고, 상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하고, 상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하고, 상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하고, 상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 프로세서를 포함하는
음성 합성 장치. - 제1항에 있어서,
상기 제1 언어의 음성의 파형, 상기 제1 언어의 음성의 주파수 대역 및 상기 제1 언어의 음성의 파워 스펙트럼을 추출하는 전처리부를 더 포함하는
음성 합성 장치. - 제2항에 있어서,
상기 프로세서는
상기 전처리부에서 추출된 상기 음성의 파형, 상기 음성의 주파수 대역 및 상기 파워 스펙트럼 중 하나 이상을 이용하여, 상기 음색 및 상기 특성 정보를 추출하는
음성 합성 장치. - 제3항에 있어서,
상기 특성 정보는
화자의 성별 정보, 음의 높낮이, 화자의 발화 속도, 화자의 감정을 포함하는
음성 합성 장치. - 제4항에 있어서,
상기 프로세서는
상기 특성 정보를 구성하는 복수의 유형 항목들 각각에 가중치를 두고, 상기 가중치가 반영된 상기 발화 유형을 생성하는
음성 합성 장치. - 제5항에 있어서,
상기 프로세서는
상기 제2 언어로 번역된 텍스트에 상기 음색을 반영한 번역 합성 음성을 생성하고,
상기 번역 합성 음성에 상기 생성된 발화 유형을 적용하여, 최종 합성 음성을 생성하는
음성 합성 장치. - 제1항에 있어서,
상기 프로세서는
상기 제1 언어의 음성에 대응하는 텍스트에 복수의 문장들이 포함된 경우, 복수의 문장들 각각으로부터 상기 특성 정보를 추출하고, 추출된 특성 정보에 기초하여, 상기 복수의 문장들 각각에 대응하는 복수의 발화 유형들을 생성하는
음성 합성 장치. - 제7항에 있어서,
상기 프로세서는
상기 복수의 문장들이 상기 제2 언어로 번역된 복수의 번역 문장들 각각에 대응하는 발화 유형을 적용하여, 상기 제2 언어로 합성된 음성을 생성하는
음성 합성 장치. - 음성 합성 장치의 동작 방법에 있어서,
데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하는 단계;
상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하는 단계;
상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하는 단계;
상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하는 단계; 및
상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 단계를 포함하는
음성 합성 장치의 동작 방법. - 제9항에 있어서,
상기 제1 언어의 음성의 파형, 상기 제1 언어의 음성의 주파수 대역 및 상기 제1 언어의 음성의 파워 스펙트럼을 추출하는 단계를 더 포함하는
음성 합성 장치의 동작 방법. - 제10항에 있어서,
상기 특성 정보를 추출하는 단계는
상기 추출된 상기 음성의 파형, 상기 음성의 주파수 대역 및 상기 파워 스펙트럼 중 하나 이상을 이용하여, 상기 음색 및 상기 특성 정보를 추출하는 단계를 포함하고,
상기 특성 정보는
화자의 성별 정보, 음의 높낮이, 화자의 발화 속도, 화자의 감정을 포함하는
음성 합성 장치의 동작 방법. - 제11항에 있어서,
상기 발화 유형을 분류하는 단계는
상기 상기 특성 정보를 구성하는 복수의 유형 항목들 각각에 가중치를 부여하는 단계; 및
상기 가중치가 반영된 상기 발화 유형을 생성하는 단계를 포함하는
음성 합성 장치의 동작 방법. - 제12항에 있어서,
상기 제2 언어의 음성으로 합성하는 단계는
상기 제2 언어로 번역된 텍스트에 상기 음색을 반영한 번역 합성 음성을 생성하는 단계와
상기 번역 합성 음성에 상기 생성된 발화 유형을 적용하여, 최종 합성 음성을 생성하는 단계를 포함하는
음성 합성 장치의 동작 방법. - 제9항에 있어서,
상기 특성 정보를 추출하는 단계는
상기 제1 언어의 음성에 대응하는 텍스트에 복수의 문장들이 포함된 경우, 복수의 문장들 각각으로부터 상기 특성 정보를 추출하는 단계를 포함하고,
상기 발화 유형을 분류하는 단계는
추출된 특성 정보에 기초하여, 상기 복수의 문장들 각각에 대응하는 복수의 발화 유형들을 생성하는 단계를 포함하는
음성 합성 장치의 동작 방법. - 제14항에 있어서,
상기 제2 언어의 음성으로 합성하는 단계는
상기 복수의 문장들이 상기 제2 언어로 번역된 복수의 번역 문장들 각각에 대응하는 발화 유형을 적용하여, 상기 제2 언어로 합성된 음성을 생성하는 단계를 포함하는
음성 합성 장치의 동작 방법.
Priority Applications (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020180105487A KR20200027331A (ko) | 2018-09-04 | 2018-09-04 | 음성 합성 장치 |
| PCT/KR2019/010234 WO2020050509A1 (en) | 2018-09-04 | 2019-08-12 | Voice synthesis device |
| US16/547,323 US11120785B2 (en) | 2018-09-04 | 2019-08-21 | Voice synthesis device |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020180105487A KR20200027331A (ko) | 2018-09-04 | 2018-09-04 | 음성 합성 장치 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| KR20200027331A true KR20200027331A (ko) | 2020-03-12 |
Family
ID=69639439
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020180105487A Ceased KR20200027331A (ko) | 2018-09-04 | 2018-09-04 | 음성 합성 장치 |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US11120785B2 (ko) |
| KR (1) | KR20200027331A (ko) |
| WO (1) | WO2020050509A1 (ko) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20220090759A (ko) * | 2020-12-23 | 2022-06-30 | 주식회사 한글과컴퓨터 | 발화자의 음성을 성별 및 시간에 따라 자동으로 통역하는 전자 장치 및 그 동작 방법 |
| WO2026029471A1 (ko) * | 2024-07-31 | 2026-02-05 | 삼성전자 주식회사 | 통화 번역 서비스를 제공하는 방법 및 그 전자 장치 |
Families Citing this family (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US12086558B2 (en) * | 2020-03-09 | 2024-09-10 | Warner Bros. Entertainment Inc. | Systems and methods for generating multi-language media content with automatic selection of matching voices |
| KR20210150842A (ko) | 2020-06-04 | 2021-12-13 | 삼성전자주식회사 | 음성 또는 문자를 번역하는 전자 장치 및 그 방법 |
| CN112035628B (zh) * | 2020-08-03 | 2024-07-09 | 北京小米松果电子有限公司 | 对话数据清洗方法、装置及存储介质 |
| CN112365874B (zh) * | 2020-11-17 | 2021-10-26 | 北京百度网讯科技有限公司 | 语音合成模型的属性注册、装置、电子设备与介质 |
| CN113345416B (zh) * | 2021-08-02 | 2021-10-29 | 智者四海(北京)技术有限公司 | 语音合成方法、装置及电子设备 |
| US12293756B2 (en) * | 2021-09-30 | 2025-05-06 | Microsoft Technology Licensing, Llc | Computing system for domain expressive text to speech |
| CN116110366A (zh) * | 2021-11-11 | 2023-05-12 | 北京字跳网络技术有限公司 | 音色选择方法、装置、电子设备、可读存储介质及程序产品 |
| CN120283236A (zh) * | 2022-11-16 | 2025-07-08 | 三星电子株式会社 | 电子装置及机器翻译方法 |
Family Cites Families (12)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US9070363B2 (en) * | 2007-10-26 | 2015-06-30 | Facebook, Inc. | Speech translation with back-channeling cues |
| JP4213755B2 (ja) | 2007-03-28 | 2009-01-21 | 株式会社東芝 | 音声翻訳装置、方法およびプログラム |
| JP2012198277A (ja) * | 2011-03-18 | 2012-10-18 | Toshiba Corp | 文書読み上げ支援装置、文書読み上げ支援方法および文書読み上げ支援プログラム |
| KR101203188B1 (ko) * | 2011-04-14 | 2012-11-22 | 한국과학기술원 | 개인 운율 모델에 기반하여 감정 음성을 합성하기 위한 방법 및 장치 및 기록 매체 |
| JP2013017119A (ja) | 2011-07-06 | 2013-01-24 | Asahi Kasei Electronics Co Ltd | 発振器 |
| JP5665780B2 (ja) * | 2012-02-21 | 2015-02-04 | 株式会社東芝 | 音声合成装置、方法およびプログラム |
| US20150057994A1 (en) * | 2013-08-20 | 2015-02-26 | Eric Hong Fang | Unified Mobile Learning Platform |
| KR101834546B1 (ko) * | 2013-08-28 | 2018-04-13 | 한국전자통신연구원 | 핸즈프리 자동 통역 서비스를 위한 단말 장치 및 핸즈프리 장치와, 핸즈프리 자동 통역 서비스 방법 |
| US9978374B2 (en) * | 2015-09-04 | 2018-05-22 | Google Llc | Neural networks for speaker verification |
| KR102525209B1 (ko) * | 2016-03-03 | 2023-04-25 | 한국전자통신연구원 | 원시 발화자의 목소리와 유사한 특성을 갖는 합성음을 생성하는 자동 통역 시스템 및 그 동작 방법 |
| KR102281504B1 (ko) * | 2019-09-16 | 2021-07-26 | 엘지전자 주식회사 | 인공 지능을 이용한 음성 합성 장치, 음성 합성 장치의 동작 방법 |
| KR102281600B1 (ko) * | 2019-09-19 | 2021-07-29 | 엘지전자 주식회사 | 합성 음성에 대한 보정을 수행하는 인공 지능 장치 및 그 방법 |
-
2018
- 2018-09-04 KR KR1020180105487A patent/KR20200027331A/ko not_active Ceased
-
2019
- 2019-08-12 WO PCT/KR2019/010234 patent/WO2020050509A1/en not_active Ceased
- 2019-08-21 US US16/547,323 patent/US11120785B2/en active Active
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20220090759A (ko) * | 2020-12-23 | 2022-06-30 | 주식회사 한글과컴퓨터 | 발화자의 음성을 성별 및 시간에 따라 자동으로 통역하는 전자 장치 및 그 동작 방법 |
| WO2026029471A1 (ko) * | 2024-07-31 | 2026-02-05 | 삼성전자 주식회사 | 통화 번역 서비스를 제공하는 방법 및 그 전자 장치 |
Also Published As
| Publication number | Publication date |
|---|---|
| US20200074981A1 (en) | 2020-03-05 |
| US11120785B2 (en) | 2021-09-14 |
| WO2020050509A1 (en) | 2020-03-12 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR20200027331A (ko) | 음성 합성 장치 | |
| US11727914B2 (en) | Intent recognition and emotional text-to-speech learning | |
| US20240021202A1 (en) | Method and apparatus for recognizing voice, electronic device and medium | |
| Czyzewski et al. | An audio-visual corpus for multimodal automatic speech recognition | |
| CN109741732B (zh) | 命名实体识别方法、命名实体识别装置、设备及介质 | |
| CN110517689B (zh) | 一种语音数据处理方法、装置及存储介质 | |
| US9899028B2 (en) | Information processing device, information processing system, information processing method, and information processing program | |
| US20250349282A1 (en) | Personalized and dynamic text to speech voice cloning using incompletely trained text to speech models | |
| Rekimoto | WESPER: Zero-shot and realtime whisper to normal voice conversion for whisper-based speech interactions | |
| KR20220004737A (ko) | 다국어 음성 합성 및 언어간 음성 복제 | |
| KR20140120560A (ko) | 통역 장치 제어 방법, 통역 서버의 제어 방법, 통역 시스템의 제어 방법 및 사용자 단말 | |
| CN110599998B (zh) | 一种语音数据生成方法及装置 | |
| KR102584436B1 (ko) | 화자분리 기반 자동통역 서비스를 제공하는 시스템, 사용자 단말 및 방법 | |
| US12112769B2 (en) | System, user terminal, and method for providing automatic interpretation service based on speaker separation | |
| CN113823300B (zh) | 语音处理方法及装置、存储介质、电子设备 | |
| CN111161695A (zh) | 歌曲生成方法和装置 | |
| WO2023142590A1 (zh) | 手语视频的生成方法、装置、计算机设备及存储介质 | |
| CN112562733A (zh) | 媒体数据处理方法及装置、存储介质、计算机设备 | |
| CN113505612B (zh) | 多人对话语音实时翻译方法、装置、设备及存储介质 | |
| US20250078851A1 (en) | System and Method for Disentangling Audio Signal Information | |
| US11250837B2 (en) | Speech synthesis system, method and non-transitory computer readable medium with language option selection and acoustic models | |
| WO2024127763A1 (ja) | 情報処理装置及び情報処理方法、コンピュータプログラム、学習装置、遠隔会議システム、並びに支援装置 | |
| CN119889256B (zh) | 歌曲生成方法、歌曲生成模型的训练方法、装置及设备 | |
| CN119580692B (zh) | 语音合成方法和装置、电子设备及存储介质 | |
| JP7805137B2 (ja) | 音声信号変換装置およびプログラム |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A201 | Request for examination | ||
| PA0109 | Patent application |
Patent event code: PA01091R01D Comment text: Patent Application Patent event date: 20180904 |
|
| PA0201 | Request for examination | ||
| E902 | Notification of reason for refusal | ||
| PE0902 | Notice of grounds for rejection |
Comment text: Notification of reason for refusal Patent event date: 20200128 Patent event code: PE09021S01D |
|
| PG1501 | Laying open of application | ||
| E601 | Decision to refuse application | ||
| PE0601 | Decision on rejection of patent |
Patent event date: 20200703 Comment text: Decision to Refuse Application Patent event code: PE06012S01D Patent event date: 20200128 Comment text: Notification of reason for refusal Patent event code: PE06011S01I |