KR20200027331A - 음성 합성 장치 - Google Patents

음성 합성 장치 Download PDF

Info

Publication number
KR20200027331A
KR20200027331A KR1020180105487A KR20180105487A KR20200027331A KR 20200027331 A KR20200027331 A KR 20200027331A KR 1020180105487 A KR1020180105487 A KR 1020180105487A KR 20180105487 A KR20180105487 A KR 20180105487A KR 20200027331 A KR20200027331 A KR 20200027331A
Authority
KR
South Korea
Prior art keywords
language
voice
speech
speaker
characteristic information
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
KR1020180105487A
Other languages
English (en)
Inventor
채종훈
박용철
양시영
장주영
한성민
Original Assignee
엘지전자 주식회사
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 엘지전자 주식회사 filed Critical 엘지전자 주식회사
Priority to KR1020180105487A priority Critical patent/KR20200027331A/ko
Priority to PCT/KR2019/010234 priority patent/WO2020050509A1/en
Priority to US16/547,323 priority patent/US11120785B2/en
Publication of KR20200027331A publication Critical patent/KR20200027331A/ko
Ceased legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/08Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/40Processing or translation of natural language
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/40Processing or translation of natural language
    • G06F40/58Use of machine translation, e.g. for multi-lingual retrieval, for server-side translation for client devices or for real-time translation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/02Methods for producing synthetic speech; Speech synthesisers
    • G10L13/033Voice editing, e.g. manipulating the voice of the synthesiser
    • G10L13/0335Pitch control
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/005Language recognition
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/04Segmentation; Word boundary detection
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/63Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/90Pitch determination of speech signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Multimedia (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Signal Processing (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • Psychiatry (AREA)
  • Hospice & Palliative Care (AREA)
  • Artificial Intelligence (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Child & Adolescent Psychology (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Machine Translation (AREA)

Abstract

본 발명의 일 실시 예에 따른 음성 합성 장치는 음성 및 상기 음성에 대응하는 텍스트를 저장하는 데이터 베이스 및 상기 데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하고, 상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하고, 상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하고, 상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하고, 상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 프로세서를 포함한다.

Description

음성 합성 장치{VOICE SYNTHESIS DEVICE}
본 발명은 음성 합성 장치에 관한 것이다.
인공 지능(artificial intelligence)은 인간의 지능으로 할 수 있는 사고, 학습, 자기계발 등을 컴퓨터가 할 수 있도록 하는 방법을 연구하는 컴퓨터 공학 및 정보기술의 한 분야로, 컴퓨터가 인간의 지능적인 행동을 모방할 수 있도록 하는 것을 의미한다.
또한, 인공지능은 그 자체로 존재하는 것이 아니라, 컴퓨터 과학의 다른 분야와 직간접으로 많은 관련을 맺고 있다. 특히 현대에는 정보기술의 여러 분야에서 인공지능적 요소를 도입하여, 그 분야의 문제 풀이에 활용하려는 시도가 매우 활발하게 이루어지고 있다.
인공 지능을 이용한 음성 에이전트 서비스는 사용자의 음성에 응답하여, 사용자에게 필요한 정보를 제공하는 서비스이다.
그러나, 종래의 외국어를 더빙 또는 통역하여, 한국어로 제공해 주는 음성 에이전트 서비스는 원 발화자의 목소리나 스타일과 관계 없는 특정 성우가 발화하는 일괄적인 음성을 제공하는데 그쳤다.
이에 따라, 영화와 같은 컨텐트의 제공 시, 시청자는 원 발화자의 발화 느낌을 그대로, 전달받을 수 없는 한계가 있었다.
본 발명은 전술한 문제 및 다른 문제를 해결하는 것을 목적으로 한다.
본 발명은 원 발화자의 목소리나 스타일을 반영하여, 더빙이나, 통역 음성을 시청자에게 제공할 수 있는 음성 합성 장치의 제공을 목적으로 한다.
본 발명의 일 실시 예에 따른 음성 합성 장치는 음성 및 상기 음성에 대응하는 텍스트를 저장하는 데이터 베이스 및 상기 데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하고, 상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하고, 상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하고, 상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하고, 상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 프로세서를 포함한다.
본 발명의 일 실시 예에 따른 음성 합성 장치의 동작 방법은 데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하는 단계와 상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하는 단계와 상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하는 단계와 상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하는 단계 및 상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 단계를 포함한다.
본 발명의 적용 가능성의 추가적인 범위는 이하의 상세한 설명으로부터 명백해질 것이다. 그러나 본 발명의 사상 및 범위 내에서 다양한 변경 및 수정은 당업자에게 명확하게 이해될 수 있으므로, 상세한 설명 및 본 발명의 바람직한 실시 예와 같은 특정 실시 예는 단지 예시로 주어진 것으로 이해되어야 한다.
본 발명의 실시 예에 따르면, 외국어로 발화하는 컨텐트의 시청 시, 원 발화자의 목소리 및 스타일이 반영된 더빙이나, 통역이 제공되어, 시청자에게 향상된 음성 서비스 경험을 줄 수 있다.
또한, 본 발명의 실시 예에 따르면, 실제 화자가 번역된 음성으로 발화하는 것과 같은 효과가 주어져, 시청자의 컨텐트 시청 몰입도가 향상될 수 있다.
도 1은 본 발명의 일 실시 예에 따른 음성 합성 시스템의 구성을 설명하기 위한 도면이다.
도 2는 본 발명의 일 실시 예에 따른 음성 합성 장치의 구성을 설명하기 위한 블록도이다.
도 3은 본 발명의 일 실시 예에 따른 음성 합성 장치의 동작 방법을 설명하기 위한 흐름도이다.
도 4는 본 발명의 일 실시 예에 따라, 화자의 제1 언어로된 음성으로부터 음성의 특성 정보를 추출하는 예를 설명하는 도면이다.
도 5a 및 도 5b는 본 발명의 일 실시 예에 따라, 음성의 특성 정보를 통해 화자의 발화 유형을 추출하고, 추출된 발화 유형과 화자의 음색을 조합하여, 화자 분석 정보를 생성하는 과정을 설명하는 도면이다.
도 6은 본 발명의 일 실시 예에 따라 도 3의 과정에서 생성된 화자 분석 정보에 기초하여, 제2 언어의 음성을 합성하는 과정을 설명하는 흐름도이다.
도 7 내지 도 9는 본 발명의 일 실시 예에 따라 화자 분석 정보를 이용하여, 제2 언어로된 합성 음성을 생성하는 과정을 설명하는 도면이다.
도 10은 본 발명의 실시 예에 따라 화자의 음성으로부터 화자의 음색 및 음성 스타일(또는 발화 유형)을 반영하여, 제1 언어의 음성을 제2 언어의 음성으로 시청자에게 제공하는 시나리오를 개략적으로 설명하는 도면이다.
이하, 첨부된 도면을 참조하여 본 명세서에 개시된 실시 예를 상세히 설명하되, 도면 부호에 관계없이 동일하거나 유사한 구성요소는 동일한 참조 번호를 부여하고 이에 대한 중복되는 설명은 생략하기로 한다. 이하의 설명에서 사용되는 구성요소에 대한 접미사 "모듈" 및 "부"는 명세서 작성의 용이함만이 고려되어 부여되거나 혼용되는 것으로서, 그 자체로 서로 구별되는 의미 또는 역할을 갖는 것은 아니다. 또한, 본 명세서에 개시된 실시 예를 설명함에 있어서 관련된 공지 기술에 대한 구체적인 설명이 본 명세서에 개시된 실시 예의 요지를 흐릴 수 있다고 판단되는 경우 그 상세한 설명을 생략한다. 또한, 첨부된 도면은 본 명세서에 개시된 실시 예를 쉽게 이해할 수 있도록 하기 위한 것일 뿐, 첨부된 도면에 의해 본 명세서에 개시된 기술적 사상이 제한되지 않으며, 본 발명의 사상 및 기술 범위에 포함되는 모든 변경, 균등물 내지 대체물을 포함하는 것으로 이해되어야 한다.
제1, 제2 등과 같이 서수를 포함하는 용어는 다양한 구성요소들을 설명하는데 사용될 수 있지만, 상기 구성요소들은 상기 용어들에 의해 한정되지는 않는다. 상기 용어들은 하나의 구성요소를 다른 구성요소로부터 구별하는 목적으로만 사용된다.
어떤 구성요소가 다른 구성요소에 "연결되어" 있다거나 "접속되어" 있다고 언급된 때에는, 그 다른 구성요소에 직접적으로 연결되어 있거나 또는 접속되어 있을 수도 있지만, 중간에 다른 구성요소가 존재할 수도 있다고 이해되어야 할 것이다. 반면에, 어떤 구성요소가 다른 구성요소에 "직접 연결되어" 있다거나 "직접 접속되어" 있다고 언급된 때에는, 중간에 다른 구성요소가 존재하지 않는 것으로 이해되어야 할 것이다.
단수의 표현은 문맥상 명백하게 다르게 뜻하지 않는 한, 복수의 표현을 포함한다. 본 출원에서, "포함한다" 또는 "가지다" 등의 용어는 명세서상에 기재된 특징, 숫자, 단계, 동작, 구성요소, 부품 또는 이들을 조합한 것이 존재함을 지정하려는 것이지, 하나 또는 그 이상의 다른 특징들이나 숫자, 단계, 동작, 구성요소, 부품 또는 이들을 조합한 것들의 존재 또는 부가 가능성을 미리 배제하지 않는 것으로 이해되어야 한다.
본 명세서에서 설명되는 단말기에는 휴대폰, 스마트 폰(smart phone), 노트북 컴퓨터(laptop computer), 디지털방송용 단말기, PDA(personal digital assistants), PMP(portable multimedia player), 네비게이션, 슬레이트 PC(slate PC), 태블릿 PC(tablet PC), 울트라북(ultrabook), 웨어러블 디바이스(wearable device, 예를 들어, 워치형 단말기 (smartwatch), 글래스형 단말기 (smart glass), HMD(head mounted display)) 등과 같은 이동 단말기가 포함될 수 있다.
그러나, 본 명세서에 기재된 실시 예에 따른 구성은 이동 단말기에만 적용 가능한 경우를 제외하면, 디지털 TV, 데스크탑 컴퓨터, 디지털사이니지 등과 같은 고정 단말기에도 적용될 수도 있음을 본 기술분야의 당업자라면 쉽게 알 수 있을 것이다.
도 1은 본 발명의 일 실시 예에 따른 음성 합성 시스템의 구성을 설명하기 위한 도면이다.
본 발명의 실시 예에 따른 음성 합성 시스템(1)은 단말기(10), 음성 합성 장치(20), 음성 데이터 베이스(30) 및 텍스트 데이터 베이스(40)를 포함할 수 있다.
음성 합성 장치(20)는 음성 데이터 베이스(30)에 저장된 제1 언어의 음성을 제2 언어의 음성으로 변환할 수 있다.
단말기(10)는 음성 합성 장치(20)로부터 제2 언어의 음성으로 변환된 합성 음성을 수신할 수 있다.
음성 데이터 베이스(30)는 컨텐트에 포함된 제1 언어의 음성을 저장할 수 있다.
음성 데이터 베이스(30)는 제1 언어의 음성이 제2 언어의 음성으로 변환된 합성 음성을 저장할 수 있다.
텍스트 데이터 베이스(40)는 제1 언어의 음성에 대응하는 제1 텍스트, 제1 텍스트가 제2 언어로 번역된 제2 텍스트를 저장할 수 있다.
음성 데이터 베이스(30) 및 텍스트 데이터 베이스(40)는 음성 합성 장치(20)에 포함될 수도 있다.
도 2는 본 발명의 일 실시 예에 따른 음성 합성 장치의 구성을 설명하기 위한 블록도이다.
도 2를 참고하면, 음성 합성 장치(20)는 마이크로폰(210), 전처리부(220), 프로세서(230), 스피커(250), 통신부(270) 및 데이터 베이스(290)를 포함할 수 있다.
마이크로폰(210)은 화자의 음성을 수신할 수 있다.
마이크로폰(510)은 외부의 음향 신호를 전기적인 음성 데이터로 처리할 수 있다.
처리된 음성 데이터는 음성 합성 장치(20)에서 수행 중인 기능(또는 실행 중인 응용 프로그램)에 따라 다양하게 활용될 수 있다. 한편, 마이크로폰(210)에는 외부의 음향 신호를 입력 받는 과정에서 발생되는 잡음(noise)을 제거하기 위한 다양한 잡음 제거 알고리즘이 구현될 수 있다.
전처리부(220)는 마이크로폰(210)을 통해 수신된 음성 또는 데이터 베이스(290)에 저장된 음성을 전처리 할 수 있다.
전처리부(220)는 웨이브 처리부(221), 주파수 처리부(223), 파워 스펙트럼 처리부(225), 음성 텍스트(Speech To Text, STT) 변환부(227)를 포함할 수 있다.
웨이브 처리부(221)는 음성의 파형을 추출할 수 있다.
주파수 처리부(223)는 음성의 주파수 대역을 추출할 수 있다.
파워 스펙트럼 처리부(225)는 음성의 파워 스펙트럼을 추출할 수 있다.
파워 스펙트럼은 시간적으로 변동하는 파형이 주어졌을 때, 그 파형에 어떠한 주파수 성분이 어떠한 크기로 포함되고 있는지를 나타내는 파라미터일 수 있다.
음성 텍스트(Speech To Text, STT) 변환부(227)는 음성을 텍스트로 변환할 수 있다.
음성 텍스트 변환부(227)는 특정 언어의 음성을 해당 언어의 텍스트로 변환할 수 있다.
프로세서(230)는 음성 합성 장치(20)의 전반적인 동작을 제어할 수 있다.
프로세서(230)는 음성 분석부(231), 텍스트 분석부(232), 특징 클러스터링부(233), 텍스트 매핑부(234) 및 음성 합성부(235)를 포함할 수 있다.
음성 분석부(231)는 전처리부(220)에서 전처리된, 음성의 파형, 음성의 주파수 대역 및 음성의 파워 스펙트럼 중 하나 이상을 이용하여, 음성의 특성 정보를 추출할 수 있다.
음성의 특성 정보는 화자의 성별 정보, 화자의 목소리(또는 음색, tone), 음의 높낮이, 화자의 말투, 화자의 발화 속도, 화자의 감정 중 하나 이상을 포함할 수 있다.
또한, 음성의 특성 정보는 화자의 음색을 더 포함할 수도 있다.
텍스트 분석부(232)는 음성 텍스트 변환부(227)에서 변환된 텍스트로부터, 주요 표현 어구를 추출할 수 있다.
텍스트 분석부(232)는 변환된 텍스트로부터 어구와 어구 간의 어조가 달라짐을 감지한 경우, 어조가 달라지는 어구를 주요 표현 어구로 추출할 수 있다.
텍스트 분석부(232)는 어구와 어구 간의 주파수 대역이 기 설정된 대역 이상 변경된 경우, 어조가 달라진 것으로 판단할 수 있다.
텍스트 분석부(232)는 변환된 텍스트의 어구 내에, 주요 단어를 추출할 수도 있다. 주요 단어란 어구 내에 존재하는 명사일 수 있으나, 이는 예시에 불과하다.
특징 클러스터링부(233)는 음성 분석부(231)에서 추출된 음성의 특성 정보를 이용하여, 화자의 발화 유형을 분류할 수 있다.
특징 클러스터링부(233)는 음성의 특성 정보를 구성하는 유형 항목들 각각에, 가중치를 두어, 화자의 발화 유형을 분류할 수 있다.
특징 클러스터링부(233)는 딥러닝 모델의 어텐션(attention) 기법을 이용하여, 화자의 발화 유형을 분류할 수 있다.
텍스트 매핑부(234)는 제1 언어로 변환된 텍스트를 제2 언어의 텍스트로 번역할 수 있다.
텍스트 매핑부(234)는 제2 언어로 번역된 텍스트를 제1 언어의 텍스트와 매핑 시킬 수 있다.
텍스트 매핑부(234)는 제1 언어의 텍스트를 구성하는 주요 표현 어구를 이에 대응하는 제2 언어의 어구에 매핑 시킬 수 있다.
텍스트 매핑부(234)는 제1 언어의 텍스트를 구성하는 주요 표현 어구에 대응하는 발화 유형을 제2 언어의 어구에 매핑시킬 수 있다. 이는, 제2 언어의 어구에 분류된 발화 유형을 적용시키기 위함이다.
음성 합성부(235)는 텍스트 매핑부(234)에서 제2 언어로 번역된 텍스트의 주요 표현 어구에, 특징 클러스터링부(233)에서 분류된 발화 유형 및 화자의 음색을 적용하여, 합성된 음성을 생성할 수 있다.
스피커(250)는 합성된 음성을 출력할 수 있다.
통신부(270)는 단말기(10) 또는 외부 서버와 유선 또는 무선으로 통신을 수행할 수 있다.
데이터 베이스(290)는 도 1에서 설명된 음성 데이터 베이스(30) 및 텍스트 데이터 베이스(40)를 포함할 수 있다.
데이터 베이스(290)는 컨텐트에 포함된 제1 언어의 음성을 저장할 수 있다.
데이터 베이스(290)는 제1 언어의 음성이 제2 언어의 음성으로 변환된 합성 음성을 저장할 수 있다.
데이터 베이스(290)는 제1 언어의 음성에 대응하는 제1 텍스트, 제1 텍스트가 제2 언어로 번역된 제2 텍스트를 저장할 수 있다.
한편, 도 2에 포함된 구성 요소들은 도 1에 도시된 단말기(10)에도 포함될 수 있다. 즉, 도 1의 단말기(10)는 음성 합성 장치(20)가 수행하는 동작들을 동일하게 수행할 수 있다.
도 3은 본 발명의 일 실시 예에 따른 음성 합성 장치의 동작 방법을 설명하기 위한 흐름도이다.
도 3을 참조하면, 음성 합성 장치(20)의 마이크로폰(210)은 화자가 발화한 제1 언어의 음성을 획득한다(S301).
일 실시 예에서, 화자는 영화의 영상에서 등장하는 배우 일 수 있다.
마이크로폰(210)은 전체 영상의 한 씬에서 등장하는 배우가 발화한 제1 언어의 음성을 입력 받을 수 있다. 한 씬은 영상을 구성하는 일정 시간 구간을 갖는 영상일 수 있다.
여기서, 제1 언어는 영어일 수 있으나, 이는 예시에 불과하다.
음성 합성 장치(20)의 프로세서(230)는 획득된 제1 언어의 음성으로부터 화자의 음색(tone) 및 음성의 특성 정보를 추출한다(S303).
일 실시 예에서, 음성 합성 장치(20)의 전처리부(220)는 제1 언어의 음성을 전처리 할 수 있다.
전처리부(220)는 제1 언어의 음성으로부터 음성의 파형, 음성의 주파수, 음성의 파워 스펙트럼을 추출할 수 있다.
프로세서(230)는 전처리부(220)에 추출된 정보로부터, 화자의 음색을 추출할 수 있다. 예를 들어, 프로세서(230)는 음성의 주파수를 기초로, 화자의 음색을 추출할 수 있다. 구체적으로, 프로세서(230)는 음성의 주파수 대역을 추출하고, 추출된 주파수 대역으로부터 주요 음역대(또는 formant)를 화자의 음색으로 결정할 수 있다.
프로세서(230)는 추출된 음성의 파형, 음성의 주파수, 음성의 파워 스펙트럼을 이용하여, 음성의 특성 정보를 추출할 수 있다.
음성의 특성 정보는 음성을 발화한 화자의 성별, 화자의 목소리, 음성의 높낮이, 화자의 말투, 음성의 발화 속도, 화자의 감정 중 하나 이상을 포함할 수 있다.
후술하겠지만, 화자의 성별, 화자의 목소리, 음성의 높낮이, 화자의 말투, 음성의 발화 속도 및 화자의 감정 각각은 발화의 유형을 나타내는 유형 항목일 수 있다.
또한, 본 발명의 실시 예에서, 화자의 음색은 음성의 특성 정보에 포함될 수 있다.
음성 합성 장치(20)의 프로세서(230)는 추출된 음성의 특성 정보에 기초하여, 화자의 발화 유형을 분류한다(S305).
일 실시 예에서, 프로세서(230)는 추출된 음성의 특성 정보를 이용하여, 화자의 발화 유형을 분류할 수 있다. 구체적으로, 프로세서(230)는 음성의 특성 정보를 구성하는 유형 항목들 각각에, 가중치를 두어, 화자의 발화 유형을 분류할 수 있다.
이에 대해서는 후술한다.
음성 합성 장치(20)의 프로세서(230)는 분류된 발화 유형과 화자의 음색을 조합한다(S407).
프로세서(230)는 분류된 발화 유형과 화자의 음색을 조합할 수 있다. 화자의 음색은 추후, 제1 언어의 음성을 제2 언어의 음성으로 합성하는데 사용될 수 있다.
음성 합성 장치(20)의 프로세서(230)는 조합 결과를 포함하는 화자 분석 정보를 생성한다(S509).
즉, 화자 분석 정보는 화자의 음색 및 이에 대응하는 발화 유형에 대한 정보를 포함할 수 있다.
이하에서는, 도 3의 실시 예를 상세히 설명한다.
도 4는 본 발명의 일 실시 예에 따라, 화자의 제1 언어로된 음성으로부터 음성의 특성 정보를 추출하는 예를 설명하는 도면이다.
도 4를 참조하면, 마이크로폰(210)은 영화의 한 씬(410)에 등장하는 배우가 발화하는 제1 언어의 음성을 수신할 수 있다.
전처리부(220)는 제1 언어의 음성을 전처리하고, 전처리 결과에 기초하여, 제1 언어의 음성에 대응하는 파형(421) 및 파워 스펙트럼(423)을 추출할 수 있다.
프로세서(230)는 추출된 파형(421) 및 파워 스펙트럼(423)을 이용하여, 음성의 특성 정보(425)를 추출할 수 있다.
음성의 특성 정보(425)는 화자의 성별 정보, 화자의 목소리(또는 음색, tone), 음의 높낮이, 화자의 말투, 화자의 발화 속도, 화자의 감정 중 하나 이상을 포함할 수 있다.
일 예로, 프로세서(230)는 일정 시간 동안 발화된 단어의 개수를 이용하여, 화자의 발화 속도를 추출할 수 있다.
프로세서(230)는 음성의 피치를 측정하여, 음의 높낮이를 추출할 수 있다.
도 5a 및 도 5b는 본 발명의 일 실시 예에 따라, 음성의 특성 정보를 통해 화자의 발화 유형을 추출하고, 추출된 발화 유형과 화자의 음색을 조합하여, 화자 분석 정보를 생성하는 과정을 설명하는 도면이다.
먼저, 도 5a를 참조하면, 발화 유형 항목 및 발화 유형 항목에 대응하는 가중치 간의 대응 관계를 나타내는 제1 발화 유형(510)이 도시되어 있다.
각 발화 유형은 텍스트를 구성하는 하나의 문장 또는 어구 단위로, 적용될 수 있다.
예를 들어, 텍스트에 2개의 문장이 있는 경우, 2개의 문장들 각각에는 서로 다른 발화 유형이 적용될 수 있다.
또 다른 예로, 1개의 문장에 2개의 어구가 포함된 경우, 2개의 어구들 각각에는 서로 다른 발화 유형이 적용될 수 있다.
도 5a 및 도 5b에서, 가중치는 0 에서 1 사이의 값을 가질 수 있는 값을 가정하여 설명한다.
발화 유형 항목이 발화 속도인 경우, 가중치가 1에 가까울수록 발화 속도가 빠르며, 가중치가 0에 가까울수록 발화 속도가 느림을 가정한다.
예를 들어, 프로세서(230)는 제1 언어의 음성으로부터 추출된 발화 속도를 통해, 발화 속도 항목의 가중치를 0.2로 설정할 수 있다.
발화 유형 항목이 성별인 경우, 가중치가 1에 가까울수록 여성의 음성에 가깝고, 가중치가 0에 가까울수록 남성의 음성에 가까움을 가정한다.
프로세서(230)는 제1 언어의 음성으로부터 추출된 성별 정보를 통해, 성별 항목의 가중치를 0.1로 설정할 수 있다.
발화 유형 항목이 슬픈 감정인 경우, 가중치가 1에 가까울수록 슬픔의 정도가 크고, 가중치가 0에 가까울수록 슬픔의 정도가 낮음을 가정한다.
프로세서(230)는 제1 언어의 음성으로부터 추출된 말투를 통해, 슬픈 감정 항목의 가중치를 0.5로 설정할 수 있다.
발화 유형 항목이 음의 높낮이인 경우, 가중치가 1에 가까울수록 음이 높고, 가중치가 0에 가까울수록 음이 낮음을 가정한다.
프로세서(230)는 제1 언어의 음성으로부터 추출된 피치를 통해, 음의 높낮이 항목의 가중치를 0.2로 설정할 수 있다.
이와 같이, 프로세서(230)는 복수의 발화 유형 항목들 각각에 가중치를 두어, 화자의 제1 발화 유형(510)을 획득할 수 있다.
본 발명의 실시 예에 따르면, 복수의 발화 유형 항목들 각각에 가중치를 두어, 화자의 발화 유형을 추출하는 경우, 해당 씬에서 화자의 발화 유형이 보다 정확하게 파악될 수 있다.
프로세서(230)는 획득된 제1 발화 유형(510)과 화자의 음색(530)을 조합하여, 화자 분석 정보(550)를 생성할 수 있다.
생성된 화자 분석 정보(550)는 추후, 제1 언어의 음성이 제2 언어의 음성으로 변환되는 과정에서 사용될 수 있다.
도 5b를 참조하면, 제2 발화 유형(570)에 대한 예가 도시되어 있다.
즉, 동일한 화자의 음색이라도, 발화된 문장이나 어구에 따라 서로 다른 발화 유형이 적용될 수 있다.
도 5b를 참조하면, 발화 속도 항목에는 0.5의 가중치가, 성별 항목에는 0.1의 가중치가, 슬픈 감정 항목에는 0.3의 가중치가, 음의 높낮이 항목에는 0.7의 가중치가 각각 적용된 제2 발화 유형(570)이 도시되어 있다.
이와 같이, 프로세서(230)는 하나의 텍스트 내에 2개의 문장이 있는 경우, 또는 하나의 문장에 2개의 어구가 있는 경우, 각 문장 또는 각 어구를 서로 다른 발화 유형으로 분류할 수 있다.
이에 따라, 실제 배우의 목소리 스타일이 번역된 음성으로 그대로 시청자에게 전달될 수 있다.
도 6은 본 발명의 일 실시 예에 따라 도 3의 과정에서 생성된 화자 분석 정보에 기초하여, 제2 언어의 음성을 합성하는 과정을 설명하는 흐름도이다.
도 6을 참조하면, 음성 합성 장치(20)의 전처리부(220)는 화자의 제1 언어의 음성을 텍스트로 변환한다(S601).
전처리부(220)에 포함된 음성 텍스트 변환부(227)은 제1 언어의 음성을 제1 언어의 텍스트로 변환할 수 있다.
음성 합성 장치(20)의 프로세서(230)는 제1 언어로 변환된 텍스트를 제2 언어로 번역한다(S603).
일 실시 예에서, 제1 언어가 영어인 경우, 제2 언어는 한국어 일 수 있다.
일 실시 예에서, 프로세서(230)는 제1 언어로 변환된 텍스트와 제2 언어로 번역된 텍스트 간 매핑을 수행할 수 있다. 구체적으로, 프로세서(230)는 제1 언어로 변환된 텍스트로부터 주요 표현들을 추출하고, 추출된 주요 표현들 각각에 대응하는 번역된 표현들 각각을 매핑 시킬 수 있다.
음성 합성 장치(20)의 프로세서(230)는 제2 언어로 번역된 텍스트를 화자 분석 정보를 이용하여, 제2 언어의 음성으로 합성한다(S605).
먼저, 프로세서(230)는 도 3의 단계 S309에서 생성된 화자 분석 정보에 포함된 화자의 음색을 이용하여, 제2 언어로 번역된 텍스트에 대응하는 번역 합성 음성을 생성할 수 있다.
그 후, 프로세서(230)는 생성된 번역 합성 음성에 화자 분석 정보에 포함된 발화 유형을 반영하여, 최종 합성 음성을 생성할 수 있다.
구체적으로, 프로세서(230)는 발화 유형(510)에 포함된 복수의 발화 유형 항목들 각각에 대응하는 가중치를 번역 합성 음성에 반영하여, 최종 합성 음성을 생성할 수 있다.
음성 합성 장치(20)의 프로세서(230)는 제2 언어의 음성으로 합성된 합성 음성을 스피커(250)로 출력한다(S607).
일 실시 예에서, 프로세서(230)는 영상의 재생 요청을 수신함에 따라 제2 언어로 합성된 합성 음성을 영상과 함께, 출력할 수 있다.
이하에서는 도 6의 실시 예를 상세히 설명한다.
도 7 내지 도 9는 본 발명의 일 실시 예에 따라 화자 분석 정보를 이용하여, 제2 언어로된 합성 음성을 생성하는 과정을 설명하는 도면이다.
도 7 내지 도 9에서, 제1 언어는 영어이고, 제2 언어는 한국어 임을 가정한다.
도 7을 참조하면, 영화의 한 씬(410)이 도시되어 있다.
전처리부(220)의 음성 텍스트 변환부(227)는 상기 씬(410)에서 배우가 제1 언어로 발화한 음성을 텍스트(710)로 변환할 수 있다.
프로세서(230)는 제1 언어의 음성에 대응하는 텍스트에 복수의 문장들이 포함된 경우, 복수의 문장들 각각으로부터 상기 특성 정보를 추출하고, 추출된 특성 정보에 기초하여, 상기 복수의 문장들 각각에 대응하는 복수의 발화 유형들을 생성할 수 있다.
도 7 내지 도 9에서는 주요 표현에 대해 발화 유형을 적용하는 예를 들어 설명한다.
실제로, 프로세서(230)는 제2 언어로 번역된 텍스트 전체에 발화 유형을 적용하여, 합성 음성을 생성할 수 있다.
제1 언어의 텍스트(710)는 주요 표현들(711, 713)을 포함할 수 있다. 여기서, 주요 표현들(711, 713)은 예시에 불과하다.
프로세서(230)에 포함된 텍스트 분석부(232)는 제1 언어의 텍스트(710)로부터 주요 표현들(711, 713)을 추출할 수 있다.
텍스트 분석부(232)는 텍스트(710)로부터 어구와 어구 간의 어조가 달라짐을 감지한 경우, 어조가 달라지는 표현을 주요 표현으로 추출할 수 있다.
그 후, 프로세서(230)는 도 8에 도시된 바와 같이, 제1 언어의 텍스트(710)를 제2 언어의 텍스트(810)로 번역할 수 있다.
프로세서(230)는 제1 언어의 텍스트(710)로부터 추출된 주요 표현들(711, 713) 각각을 제2 언어의 텍스트(810)에 포함된 번역 표현들(811, 813) 각각에 매핑 시킬 수 있다.
예를 들어, 프로세서(230)는 제1 주요 표현(711)을 제1 번역 표현(811)에 매핑시킬 수 있고, 제2 주요 표현(713)을 제2 번역 표현(813)에 매핑시킬 수 있다.
그 후, 프로세서(230)는 도 9에 도시된 바와 같이, 제2 언어의 텍스트(810)에 포함된 번역 표현들(811, 813) 각각에 화자 분석 정보를 반영할 수 있다.
일 실시 예에서, 화자 분석 정보는 하나의 어구 또는 하나의 문장마다 반영될 수 있다.
예를 들어, 프로세서(230)는 제1 화자 분석 정보를 제1 번역 표현(811)에 반영하여, 합성 음성을 생성할 수 있고, 제2 화자 분석 정보를 제2 번역 표현(813)에 반영할 수 있다.
예를 들어, 제1 화자 분석 정보가 도 5a에 도시된, 제1 발화 유형(510)을 포함하고, 제2 화자 분석 정보가 도 5b에 도시된 제2 발화 유형(530)을 포함하는 경우, 프로세서(230)는 제1 번역 표현(811)에는 제1 발화 유형(510)을 반영하여, 합성 음성을 생성하고, 제2 번역 표현(813)에는 제2 발화 유형(570)을 반영하여, 합성 음성을 생성할 수 있다.
프로세서(230)는 제2 언어로 번역된 텍스트(810)에 화자의 음색(530)을 반영하여, 제2 언어로 번역된 번역 합성 음성을 생성할 수 있다.
그 후, 프로세서(230)는 생성된 번역 합성 음성에 발화 유형(510)을 반영하여, 최종 합성 음성을 생성할 수 있다. 번역 합성 음성은 동일한 어조로 발화하는 기계음일 수 있다.
프로세서(230)는 번역 합성 음성에 발화 유형(510)에 포함된 발화 유형 항목들 각각의 가중치가 반영된 음성 특성을 조합하여, 최종 합성 음성을 생성할 수 있다.
이와 같이, 번역 합성 음성에 발화 유형이 반영된 경우, 실제 화자가 번역된 음성으로 발화하는 것과 같은 효과가 주어져, 시청자의 컨텐트 시청 몰입도가 향상될 수 있다.
한편, 도 7 내지 도 9에서는 번역된 텍스트 중 주요 표현들에 대해서만, 발화 유형 및 음색이 적용되어, 합성 음성이 생성된 것으로 되어 있으나, 이는 예시에 불과하고, 텍스트 전체에 대해서 발화 유형 및 음색을 적용하여, 합성 음성이 생성될 수 있다.
도 10은 본 발명의 실시 예에 따라 화자의 음성으로부터 화자의 음색 및 음성 스타일(또는 발화 유형)을 반영하여, 제1 언어의 음성을 제2 언어의 음성으로 시청자에게 제공하는 시나리오를 개략적으로 설명하는 도면이다.
도 10을 참조하면, 각 화자가 제1 언어(1010)로 특정 발화 유형(1030)을 가지고, 발화를 한다.
음성 합성 장치(20)는 화자의 음색 및 발화 유형(1030)을 반영한 제2 언어(1050)의 음성을 생성할 수 있다.
추후, 시청자는 영화와 같은 컨텐트 재생 시, 성우가 발화한 더빙 음성을 듣지 않고, 실제 배우가 더빙한 것 같은 음성을 들을 수 있다.
이에 따라, 화자의 발화 별 목소리 및 스타일을 반영하는 더빙의 수요가 시청자에게 충족될 수 있다.
전술한 본 발명은, 프로그램이 기록된 매체에 컴퓨터가 읽을 수 있는 코드로서 구현하는 것이 가능하다. 컴퓨터가 읽을 수 있는 매체는, 컴퓨터 시스템에 의하여 읽혀질 수 있는 데이터가 저장되는 모든 종류의 기록장치를 포함한다. 컴퓨터가 읽을 수 있는 매체의 예로는, HDD(Hard Disk Drive), SSD(Solid State Disk), SDD(Silicon Disk Drive), ROM, RAM, CD-ROM, 자기 테이프, 플로피 디스크, 광 데이터 저장 장치 등이 있다. 또한, 상기 컴퓨터는 음성 합성 장치의 프로세서를 포함할 수도 있다.
따라서, 상기의 상세한 설명은 모든 면에서 제한적으로 해석되어서는 아니되고, 예시적인 것으로 고려되어야 한다. 본 발명의 범위는 첨부된 청구항의 합리적 해석에 의해 결정되어야 하고, 본 발명의 등가적 범위 내에서의 모든 변경은 본 발명의 범위에 포함된다.

Claims (15)

  1. 음성 합성 장치에 있어서,
    음성 및 상기 음성에 대응하는 텍스트를 저장하는 데이터 베이스; 및
    상기 데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하고, 상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하고, 상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하고, 상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하고, 상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 프로세서를 포함하는
    음성 합성 장치.
  2. 제1항에 있어서,
    상기 제1 언어의 음성의 파형, 상기 제1 언어의 음성의 주파수 대역 및 상기 제1 언어의 음성의 파워 스펙트럼을 추출하는 전처리부를 더 포함하는
    음성 합성 장치.
  3. 제2항에 있어서,
    상기 프로세서는
    상기 전처리부에서 추출된 상기 음성의 파형, 상기 음성의 주파수 대역 및 상기 파워 스펙트럼 중 하나 이상을 이용하여, 상기 음색 및 상기 특성 정보를 추출하는
    음성 합성 장치.
  4. 제3항에 있어서,
    상기 특성 정보는
    화자의 성별 정보, 음의 높낮이, 화자의 발화 속도, 화자의 감정을 포함하는
    음성 합성 장치.
  5. 제4항에 있어서,
    상기 프로세서는
    상기 특성 정보를 구성하는 복수의 유형 항목들 각각에 가중치를 두고, 상기 가중치가 반영된 상기 발화 유형을 생성하는
    음성 합성 장치.
  6. 제5항에 있어서,
    상기 프로세서는
    상기 제2 언어로 번역된 텍스트에 상기 음색을 반영한 번역 합성 음성을 생성하고,
    상기 번역 합성 음성에 상기 생성된 발화 유형을 적용하여, 최종 합성 음성을 생성하는
    음성 합성 장치.
  7. 제1항에 있어서,
    상기 프로세서는
    상기 제1 언어의 음성에 대응하는 텍스트에 복수의 문장들이 포함된 경우, 복수의 문장들 각각으로부터 상기 특성 정보를 추출하고, 추출된 특성 정보에 기초하여, 상기 복수의 문장들 각각에 대응하는 복수의 발화 유형들을 생성하는
    음성 합성 장치.
  8. 제7항에 있어서,
    상기 프로세서는
    상기 복수의 문장들이 상기 제2 언어로 번역된 복수의 번역 문장들 각각에 대응하는 발화 유형을 적용하여, 상기 제2 언어로 합성된 음성을 생성하는
    음성 합성 장치.
  9. 음성 합성 장치의 동작 방법에 있어서,
    데이터 베이스에 저장된 제1 언어의 음성의 음색 및 특성 정보를 추출하는 단계;
    상기 추출된 특성 정보에 기초하여, 화자의 발화 유형을 분류하는 단계;
    상기 음색 및 상기 발화 유형을 포함하는 화자 분석 정보를 생성하는 단계;
    상기 제1 언어의 음성에 대응하는 텍스트를 제2 언어로 번역하는 단계; 및
    상기 화자 분석 정보를 이용하여, 상기 제2 언어로 번역된 텍스트를 상기 제2 언어의 음성으로 합성하는 단계를 포함하는
    음성 합성 장치의 동작 방법.
  10. 제9항에 있어서,
    상기 제1 언어의 음성의 파형, 상기 제1 언어의 음성의 주파수 대역 및 상기 제1 언어의 음성의 파워 스펙트럼을 추출하는 단계를 더 포함하는
    음성 합성 장치의 동작 방법.
  11. 제10항에 있어서,
    상기 특성 정보를 추출하는 단계는
    상기 추출된 상기 음성의 파형, 상기 음성의 주파수 대역 및 상기 파워 스펙트럼 중 하나 이상을 이용하여, 상기 음색 및 상기 특성 정보를 추출하는 단계를 포함하고,
    상기 특성 정보는
    화자의 성별 정보, 음의 높낮이, 화자의 발화 속도, 화자의 감정을 포함하는
    음성 합성 장치의 동작 방법.
  12. 제11항에 있어서,
    상기 발화 유형을 분류하는 단계는
    상기 상기 특성 정보를 구성하는 복수의 유형 항목들 각각에 가중치를 부여하는 단계; 및
    상기 가중치가 반영된 상기 발화 유형을 생성하는 단계를 포함하는
    음성 합성 장치의 동작 방법.
  13. 제12항에 있어서,
    상기 제2 언어의 음성으로 합성하는 단계는
    상기 제2 언어로 번역된 텍스트에 상기 음색을 반영한 번역 합성 음성을 생성하는 단계와
    상기 번역 합성 음성에 상기 생성된 발화 유형을 적용하여, 최종 합성 음성을 생성하는 단계를 포함하는
    음성 합성 장치의 동작 방법.
  14. 제9항에 있어서,
    상기 특성 정보를 추출하는 단계는
    상기 제1 언어의 음성에 대응하는 텍스트에 복수의 문장들이 포함된 경우, 복수의 문장들 각각으로부터 상기 특성 정보를 추출하는 단계를 포함하고,
    상기 발화 유형을 분류하는 단계는
    추출된 특성 정보에 기초하여, 상기 복수의 문장들 각각에 대응하는 복수의 발화 유형들을 생성하는 단계를 포함하는
    음성 합성 장치의 동작 방법.
  15. 제14항에 있어서,
    상기 제2 언어의 음성으로 합성하는 단계는
    상기 복수의 문장들이 상기 제2 언어로 번역된 복수의 번역 문장들 각각에 대응하는 발화 유형을 적용하여, 상기 제2 언어로 합성된 음성을 생성하는 단계를 포함하는
    음성 합성 장치의 동작 방법.
KR1020180105487A 2018-09-04 2018-09-04 음성 합성 장치 Ceased KR20200027331A (ko)

Priority Applications (3)

Application Number Priority Date Filing Date Title
KR1020180105487A KR20200027331A (ko) 2018-09-04 2018-09-04 음성 합성 장치
PCT/KR2019/010234 WO2020050509A1 (en) 2018-09-04 2019-08-12 Voice synthesis device
US16/547,323 US11120785B2 (en) 2018-09-04 2019-08-21 Voice synthesis device

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
KR1020180105487A KR20200027331A (ko) 2018-09-04 2018-09-04 음성 합성 장치

Publications (1)

Publication Number Publication Date
KR20200027331A true KR20200027331A (ko) 2020-03-12

Family

ID=69639439

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020180105487A Ceased KR20200027331A (ko) 2018-09-04 2018-09-04 음성 합성 장치

Country Status (3)

Country Link
US (1) US11120785B2 (ko)
KR (1) KR20200027331A (ko)
WO (1) WO2020050509A1 (ko)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20220090759A (ko) * 2020-12-23 2022-06-30 주식회사 한글과컴퓨터 발화자의 음성을 성별 및 시간에 따라 자동으로 통역하는 전자 장치 및 그 동작 방법
WO2026029471A1 (ko) * 2024-07-31 2026-02-05 삼성전자 주식회사 통화 번역 서비스를 제공하는 방법 및 그 전자 장치

Families Citing this family (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US12086558B2 (en) * 2020-03-09 2024-09-10 Warner Bros. Entertainment Inc. Systems and methods for generating multi-language media content with automatic selection of matching voices
KR20210150842A (ko) 2020-06-04 2021-12-13 삼성전자주식회사 음성 또는 문자를 번역하는 전자 장치 및 그 방법
CN112035628B (zh) * 2020-08-03 2024-07-09 北京小米松果电子有限公司 对话数据清洗方法、装置及存储介质
CN112365874B (zh) * 2020-11-17 2021-10-26 北京百度网讯科技有限公司 语音合成模型的属性注册、装置、电子设备与介质
CN113345416B (zh) * 2021-08-02 2021-10-29 智者四海(北京)技术有限公司 语音合成方法、装置及电子设备
US12293756B2 (en) * 2021-09-30 2025-05-06 Microsoft Technology Licensing, Llc Computing system for domain expressive text to speech
CN116110366A (zh) * 2021-11-11 2023-05-12 北京字跳网络技术有限公司 音色选择方法、装置、电子设备、可读存储介质及程序产品
CN120283236A (zh) * 2022-11-16 2025-07-08 三星电子株式会社 电子装置及机器翻译方法

Family Cites Families (12)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9070363B2 (en) * 2007-10-26 2015-06-30 Facebook, Inc. Speech translation with back-channeling cues
JP4213755B2 (ja) 2007-03-28 2009-01-21 株式会社東芝 音声翻訳装置、方法およびプログラム
JP2012198277A (ja) * 2011-03-18 2012-10-18 Toshiba Corp 文書読み上げ支援装置、文書読み上げ支援方法および文書読み上げ支援プログラム
KR101203188B1 (ko) * 2011-04-14 2012-11-22 한국과학기술원 개인 운율 모델에 기반하여 감정 음성을 합성하기 위한 방법 및 장치 및 기록 매체
JP2013017119A (ja) 2011-07-06 2013-01-24 Asahi Kasei Electronics Co Ltd 発振器
JP5665780B2 (ja) * 2012-02-21 2015-02-04 株式会社東芝 音声合成装置、方法およびプログラム
US20150057994A1 (en) * 2013-08-20 2015-02-26 Eric Hong Fang Unified Mobile Learning Platform
KR101834546B1 (ko) * 2013-08-28 2018-04-13 한국전자통신연구원 핸즈프리 자동 통역 서비스를 위한 단말 장치 및 핸즈프리 장치와, 핸즈프리 자동 통역 서비스 방법
US9978374B2 (en) * 2015-09-04 2018-05-22 Google Llc Neural networks for speaker verification
KR102525209B1 (ko) * 2016-03-03 2023-04-25 한국전자통신연구원 원시 발화자의 목소리와 유사한 특성을 갖는 합성음을 생성하는 자동 통역 시스템 및 그 동작 방법
KR102281504B1 (ko) * 2019-09-16 2021-07-26 엘지전자 주식회사 인공 지능을 이용한 음성 합성 장치, 음성 합성 장치의 동작 방법
KR102281600B1 (ko) * 2019-09-19 2021-07-29 엘지전자 주식회사 합성 음성에 대한 보정을 수행하는 인공 지능 장치 및 그 방법

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20220090759A (ko) * 2020-12-23 2022-06-30 주식회사 한글과컴퓨터 발화자의 음성을 성별 및 시간에 따라 자동으로 통역하는 전자 장치 및 그 동작 방법
WO2026029471A1 (ko) * 2024-07-31 2026-02-05 삼성전자 주식회사 통화 번역 서비스를 제공하는 방법 및 그 전자 장치

Also Published As

Publication number Publication date
US20200074981A1 (en) 2020-03-05
US11120785B2 (en) 2021-09-14
WO2020050509A1 (en) 2020-03-12

Similar Documents

Publication Publication Date Title
KR20200027331A (ko) 음성 합성 장치
US11727914B2 (en) Intent recognition and emotional text-to-speech learning
US20240021202A1 (en) Method and apparatus for recognizing voice, electronic device and medium
Czyzewski et al. An audio-visual corpus for multimodal automatic speech recognition
CN109741732B (zh) 命名实体识别方法、命名实体识别装置、设备及介质
CN110517689B (zh) 一种语音数据处理方法、装置及存储介质
US9899028B2 (en) Information processing device, information processing system, information processing method, and information processing program
US20250349282A1 (en) Personalized and dynamic text to speech voice cloning using incompletely trained text to speech models
Rekimoto WESPER: Zero-shot and realtime whisper to normal voice conversion for whisper-based speech interactions
KR20220004737A (ko) 다국어 음성 합성 및 언어간 음성 복제
KR20140120560A (ko) 통역 장치 제어 방법, 통역 서버의 제어 방법, 통역 시스템의 제어 방법 및 사용자 단말
CN110599998B (zh) 一种语音数据生成方法及装置
KR102584436B1 (ko) 화자분리 기반 자동통역 서비스를 제공하는 시스템, 사용자 단말 및 방법
US12112769B2 (en) System, user terminal, and method for providing automatic interpretation service based on speaker separation
CN113823300B (zh) 语音处理方法及装置、存储介质、电子设备
CN111161695A (zh) 歌曲生成方法和装置
WO2023142590A1 (zh) 手语视频的生成方法、装置、计算机设备及存储介质
CN112562733A (zh) 媒体数据处理方法及装置、存储介质、计算机设备
CN113505612B (zh) 多人对话语音实时翻译方法、装置、设备及存储介质
US20250078851A1 (en) System and Method for Disentangling Audio Signal Information
US11250837B2 (en) Speech synthesis system, method and non-transitory computer readable medium with language option selection and acoustic models
WO2024127763A1 (ja) 情報処理装置及び情報処理方法、コンピュータプログラム、学習装置、遠隔会議システム、並びに支援装置
CN119889256B (zh) 歌曲生成方法、歌曲生成模型的训练方法、装置及设备
CN119580692B (zh) 语音合成方法和装置、电子设备及存储介质
JP7805137B2 (ja) 音声信号変換装置およびプログラム

Legal Events

Date Code Title Description
A201 Request for examination
PA0109 Patent application

Patent event code: PA01091R01D

Comment text: Patent Application

Patent event date: 20180904

PA0201 Request for examination
E902 Notification of reason for refusal
PE0902 Notice of grounds for rejection

Comment text: Notification of reason for refusal

Patent event date: 20200128

Patent event code: PE09021S01D

PG1501 Laying open of application
E601 Decision to refuse application
PE0601 Decision on rejection of patent

Patent event date: 20200703

Comment text: Decision to Refuse Application

Patent event code: PE06012S01D

Patent event date: 20200128

Comment text: Notification of reason for refusal

Patent event code: PE06011S01I