KR20200090355A - 실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 - Google Patents
실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 Download PDFInfo
- Publication number
- KR20200090355A KR20200090355A KR1020190007277A KR20190007277A KR20200090355A KR 20200090355 A KR20200090355 A KR 20200090355A KR 1020190007277 A KR1020190007277 A KR 1020190007277A KR 20190007277 A KR20190007277 A KR 20190007277A KR 20200090355 A KR20200090355 A KR 20200090355A
- Authority
- KR
- South Korea
- Prior art keywords
- video
- information
- user terminal
- unit
- translation
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Images
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/40—Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
- H04N21/47—End-user applications
- H04N21/488—Data services, e.g. news ticker
- H04N21/4884—Data services, e.g. news ticker for displaying subtitles
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
- G06F40/58—Use of machine translation, e.g. for multi-lingual retrieval, for server-side translation for client devices or for real-time translation
-
- G06K9/00268—
-
- G06K9/00335—
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V40/00—Recognition of biometric, human-related or animal-related patterns in image or video data
- G06V40/10—Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
- G06V40/16—Human faces, e.g. facial parts, sketches or expressions
- G06V40/168—Feature extraction; Face representation
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V40/00—Recognition of biometric, human-related or animal-related patterns in image or video data
- G06V40/20—Movements or behaviour, e.g. gesture recognition
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/24—Speech recognition using non-acoustical features
- G10L15/25—Speech recognition using non-acoustical features using position of the lips, movement of the lips or face analysis
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N21/00—Selective content distribution, e.g. interactive television or video on demand [VOD]
- H04N21/20—Servers specifically adapted for the distribution of content, e.g. VOD servers; Operations thereof
- H04N21/21—Server components or server architectures
- H04N21/218—Source of audio or video content, e.g. local disk arrays
- H04N21/21805—Source of audio or video content, e.g. local disk arrays enabling multiple viewpoints, e.g. using a plurality of cameras
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N5/00—Details of television systems
- H04N5/222—Studio circuitry; Studio devices; Studio equipment
- H04N5/262—Studio circuits, e.g. for mixing, switching-over, change of character of image, other special effects ; Cameras specially adapted for the electronic generation of special effects
- H04N5/278—Subtitling
Landscapes
- Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Health & Medical Sciences (AREA)
- Signal Processing (AREA)
- Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Human Computer Interaction (AREA)
- Audiology, Speech & Language Pathology (AREA)
- General Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- General Health & Medical Sciences (AREA)
- Oral & Maxillofacial Surgery (AREA)
- Databases & Information Systems (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Acoustics & Sound (AREA)
- Psychiatry (AREA)
- Social Psychology (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- Machine Translation (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
Abstract
Description
도 2은 본 발명의 일 실시예에 따른 동영상 번역 시스템을 설명하기 위한 블럭도이다.
도 3는 본 발명과 관련된 사용자 단말기를 설명하기 위한 블럭도이다.
도 4은 본 발명의 일 실시예에 따른 동영상 번역 방법을 설명하기 위한 도면이다.
도 5는 본 발명의 일 실시예에 따른 입술의 특징점 추출 방법을 설명하기 위한 도면이다.
도 6는 본 발명의 일 실시예에 따른 입술 이미지로부터 음성 인식 방법을 설명하기 위한 도면이다.
도 7은 본 발명의 일 실시예에 따른 동영상의 카테고리를 이용하여 입술 이미지로부터 음성 인식 방법을 설명하기 위한 도면이다.
도 8은 본 발명의 일 실시예에 따른 동영상과 번역 자막을 재생하는 방법을 설명하기 위한 도면이다.
110: 음성인식부
120: 입술인식부
130 번역부
140: 프로세싱부
150: 데이터베이스부
160: 출력영상생성부
170: 네트워크부
200: 사용자 단말기
210: 센싱부
220: 제어부
230: 통신부
240: 전원부
250: 출력부
251: 디스플레이부
260: 사용자입력부
270: 인터페이스부
Claims (6)
- MCN 시스템 기반의 멀티미디어 콘텐츠 제공을 위한 실시간 번역 기반 멀티 채널 방송 시스템에 있어서,
상기 실시간 번역 기반 멀티 채널 방송 시스템은,
실시간으로 멀티미디어 콘텐츠 제공을 위해 동영상 및 동영상 정보를 입력받고, 요청에 따라 선택된 동영상 및 동영상 정보를 전송하는 동영상 번역 시스템; 및
상기 동영상 번역 시스템과 네트워크를 통해 연결되어 동영상을 선택하고 선택된 동영상의 실시간 전송을 요청할 수 있는 사용자 단말기를 포함하되,
상기 동영상 번역 시스템은,
영상과 음성을 포함하는 동영상과 동영상 카테고리 정보를 입력 받는 동영상 입력부;
입력 받은 동영상의 프레임에서 입술 영역을 추출하고, 추출된 입술 영역으로부터 입술의 특징점을 추출하여 동영상 내의 음성을 텍스트로 추출하는 입술인식부;
추출된 텍스트를 특정 언어로 번역하여 자막 정보를 생성하는 번역부;
상기 입력된 동영상과 상기 자막 정보를 동기화하여 출력영상을 생성하는 출력영상생성부; 및
생성된 출력영상을 사용자 단말기로 전송하는 통신부;를 포함하되,
상기 입술인식부는,
상기 동영상 카테고리 정보를 기반으로 하여 동영상 내의 음성을 텍스트로 추출하며,
상기 입술인식부는,
입력 받은 동영상의 프레임에서 얼굴 영역을 추출하고, 추출된 얼굴 영역에서 얼굴의 특징점 정보를 추출하고,
상기 입술 영역은 추출된 얼굴의 특징점 정보 중의 하나인 것을 특징으로 하는 실시간 번역 기반 멀티 채널 방송 시스템.
- 제1항에 있어서,
상기 번역부는,
상기 추출된 텍스트를 상기 사용자 단말기로부터 요청받은 특정 언어로 번역하여 자막 정보를 생성하고,
상기 사용자 단말기로부터 번역하고자 하는 언어에 대한 요청이 없을 경우, 사용자 단말기의 위치 정보를 이용하여 번역하고자 하는 언어를 결정하고 상기 추출된 텍스트를 번역하여 자막 정보를 생성하는 것을 특징으로 하는 동영상 번역 시스템.
- 제1항에 있어서,
상기 출력영상생성부는,
상기 입력된 동영상과 두 개 이상의 다른 언어로 된 자막 정보를 동기화하여 출력영상을 생성하는 것을 특징으로 하는 동영상 번역 시스템.
- 영상과 음성을 포함하는 동영상과 동영상 카테고리 정보를 입력 받는 정보 입력 단계;
사용자 단말기로부터 동영상에 대한 전송을 요청받는 요청 수신 단계; 및
상기 사용자 단말기로 선택된 동영상을 전송하는 콘텐츠 전송 단계를 포함하는 실시간 번역 기반 멀티 채널 방송 방법에 있어서,
상기 정보 입력 단계는,
영상과 음성을 포함하는 동영상과 동영상 카테고리 정보를 입력 받는 단계;
입력 받은 동영상의 프레임에서 입술 영역을 추출하고, 추출된 입술 영역으로부터 입술의 특징점을 추출하는 단계;
상기 동영상 카테고리 정보를 기반으로 하여 동영상 내의 음성을 텍스트로 추출하는 단계; 및
추출된 텍스트를 특정 언어로 번역하여 자막 정보를 생성하고 저장하는 단계를 포함하고,
상기 콘텐츠 전송 단계는,
상기 입력된 동영상과 상기 자막 정보를 동기화하여 출력영상을 생성하는 단계; 및
생성된 출력영상을 사용자 단말기로 전송하는 단계;를 포함하는 것을 특징으로 하는 실시간 번역 기반 멀티 채널 방송 방법.
- 제4항에 있어서,
상기 자막 정보를 생성하는 단계는,
상기 추출된 텍스트를 사용자 단말기로부터 요청받은 특정 언어로 번역하여 자막 정보를 생성하고, 사용자 단말기로부터 번역하고자 하는 언어에 대한 요청이 없을 경우, 사용자 단말기의 위치 정보를 이용하여 번역하고자 하는 언어를 결정하고 상기 추출된 텍스트를 번역하여 자막 정보를 생성하는 것을 특징으로 하는 동영상 번역 방법.
- 제4항에 있어서,
상기 출력영상을 생성하는 단계는,
상기 입력된 동영상과 두 개 이상의 다른 언어로 된 자막 정보를 동기화하여 출력영상을 생성하는 것을 특징으로 하는 동영상 번역 방법.
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020190007277A KR20200090355A (ko) | 2019-01-21 | 2019-01-21 | 실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020190007277A KR20200090355A (ko) | 2019-01-21 | 2019-01-21 | 실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| KR20200090355A true KR20200090355A (ko) | 2020-07-29 |
Family
ID=71893501
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020190007277A Withdrawn KR20200090355A (ko) | 2019-01-21 | 2019-01-21 | 실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 |
Country Status (1)
| Country | Link |
|---|---|
| KR (1) | KR20200090355A (ko) |
Cited By (9)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112541956A (zh) * | 2020-11-05 | 2021-03-23 | 北京百度网讯科技有限公司 | 动画合成方法、装置、移动终端和电子设备 |
| US20220043144A1 (en) * | 2020-08-07 | 2022-02-10 | Tdk Corporation | Acoustic multipath correction |
| CN115880737A (zh) * | 2021-09-26 | 2023-03-31 | 天翼爱音乐文化科技有限公司 | 一种基于降噪自学习的字幕生成方法、系统、设备及介质 |
| US11626099B2 (en) | 2016-05-10 | 2023-04-11 | Invensense, Inc. | Transmit beamforming of a two-dimensional array of ultrasonic transducers |
| US11651611B2 (en) | 2016-05-04 | 2023-05-16 | Invensense, Inc. | Device mountable packaging of ultrasonic transducers |
| US11673165B2 (en) | 2016-05-10 | 2023-06-13 | Invensense, Inc. | Ultrasonic transducer operable in a surface acoustic wave (SAW) mode |
| US11995909B2 (en) | 2020-07-17 | 2024-05-28 | Tdk Corporation | Multipath reflection correction |
| US12002282B2 (en) | 2018-03-22 | 2024-06-04 | Invensense, Inc. | Operating a fingerprint sensor comprised of ultrasonic transducers |
| US12197681B2 (en) | 2021-08-25 | 2025-01-14 | Tdk Corporation | Anchor configurations for an array of ultrasonic transducers |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR101055908B1 (ko) | 2004-03-09 | 2011-08-09 | 톰슨 라이센싱 | 다채널 자격 관리 및 제어를 통한 안전한 데이터 전송 |
| KR101187600B1 (ko) | 2011-02-09 | 2012-10-08 | 한국과학기술연구원 | 스테레오 카메라 기반의 3차원 실시간 입술 특징점 추출을 이용한 음성 인식 장치 및 음성 인식 방법 |
| KR101869332B1 (ko) | 2016-12-07 | 2018-07-20 | 정우주 | 사용자 맞춤형 멀티미디어 컨텐츠를 제공하는 방법 및 장치 |
-
2019
- 2019-01-21 KR KR1020190007277A patent/KR20200090355A/ko not_active Withdrawn
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR101055908B1 (ko) | 2004-03-09 | 2011-08-09 | 톰슨 라이센싱 | 다채널 자격 관리 및 제어를 통한 안전한 데이터 전송 |
| KR101187600B1 (ko) | 2011-02-09 | 2012-10-08 | 한국과학기술연구원 | 스테레오 카메라 기반의 3차원 실시간 입술 특징점 추출을 이용한 음성 인식 장치 및 음성 인식 방법 |
| KR101869332B1 (ko) | 2016-12-07 | 2018-07-20 | 정우주 | 사용자 맞춤형 멀티미디어 컨텐츠를 제공하는 방법 및 장치 |
Cited By (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11651611B2 (en) | 2016-05-04 | 2023-05-16 | Invensense, Inc. | Device mountable packaging of ultrasonic transducers |
| US11673165B2 (en) | 2016-05-10 | 2023-06-13 | Invensense, Inc. | Ultrasonic transducer operable in a surface acoustic wave (SAW) mode |
| US11626099B2 (en) | 2016-05-10 | 2023-04-11 | Invensense, Inc. | Transmit beamforming of a two-dimensional array of ultrasonic transducers |
| US12002282B2 (en) | 2018-03-22 | 2024-06-04 | Invensense, Inc. | Operating a fingerprint sensor comprised of ultrasonic transducers |
| US11995909B2 (en) | 2020-07-17 | 2024-05-28 | Tdk Corporation | Multipath reflection correction |
| US12174295B2 (en) * | 2020-08-07 | 2024-12-24 | Tdk Corporation | Acoustic multipath correction |
| US20220043144A1 (en) * | 2020-08-07 | 2022-02-10 | Tdk Corporation | Acoustic multipath correction |
| CN112541956A (zh) * | 2020-11-05 | 2021-03-23 | 北京百度网讯科技有限公司 | 动画合成方法、装置、移动终端和电子设备 |
| US12197681B2 (en) | 2021-08-25 | 2025-01-14 | Tdk Corporation | Anchor configurations for an array of ultrasonic transducers |
| US12260050B2 (en) | 2021-08-25 | 2025-03-25 | Tdk Corporation | Differential receive at an ultrasonic transducer |
| US12578825B2 (en) | 2021-08-25 | 2026-03-17 | Tdk Corporation | Anchor configurations for an array of ultrasonic transducers |
| CN115880737B (zh) * | 2021-09-26 | 2024-04-19 | 天翼爱音乐文化科技有限公司 | 一种基于降噪自学习的字幕生成方法、系统、设备及介质 |
| CN115880737A (zh) * | 2021-09-26 | 2023-03-31 | 天翼爱音乐文化科技有限公司 | 一种基于降噪自学习的字幕生成方法、系统、设备及介质 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR20200090355A (ko) | 실시간 번역 기반 멀티 채널 방송 시스템 및 이를 이용하는 방법 | |
| US12452390B2 (en) | Word flow annotation | |
| US20250266053A1 (en) | Identifying input for speech recognition engine | |
| CN110288077B (zh) | 一种基于人工智能的合成说话表情的方法和相关装置 | |
| EP3824462B1 (en) | Electronic apparatus for processing user utterance and controlling method thereof | |
| WO2021036644A1 (zh) | 一种基于人工智能的语音驱动动画方法和装置 | |
| US20170287465A1 (en) | Speech Recognition and Text-to-Speech Learning System | |
| CN113205569B (zh) | 图像绘制方法及装置、计算机可读介质和电子设备 | |
| CN115394285B (zh) | 语音克隆方法、装置、设备及存储介质 | |
| CN110322760B (zh) | 语音数据生成方法、装置、终端及存储介质 | |
| US10388325B1 (en) | Non-disruptive NUI command | |
| US20150326822A1 (en) | Display apparatus and method for performing videotelephony using the same | |
| Ivanko et al. | Multimodal speech recognition: increasing accuracy using high speed video data | |
| KR20220037819A (ko) | 복수의 기동어를 인식하는 인공 지능 장치 및 그 방법 | |
| JP2000207170A (ja) | 情報処理装置および情報処理方法 | |
| CN118227009B (zh) | 基于虚拟形象的物品交互方法、装置及电子设备 | |
| US20240119930A1 (en) | Artificial intelligence device and operating method thereof | |
| WO2019150708A1 (ja) | 情報処理装置、情報処理システム、および情報処理方法、並びにプログラム | |
| KR20200056754A (ko) | 개인화 립 리딩 모델 생성 방법 및 장치 | |
| CN113409770A (zh) | 发音特征处理方法、装置、服务器及介质 | |
| CN119131900A (zh) | 一种基于大语言模型的汉语手语翻译方法及系统 | |
| US20210082427A1 (en) | Information processing apparatus and information processing method | |
| CN118506786A (zh) | 音频翻译方法、装置、设备及存储介质 | |
| CN119204043B (zh) | 内容翻译方法、系统及可穿戴翻译设备 | |
| KR20200048976A (ko) | 전자 장치 및 그 제어 방법 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PA0109 | Patent application |
St.27 status event code: A-0-1-A10-A12-nap-PA0109 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-2-2-P10-P22-nap-X000 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-2-2-P10-P22-nap-X000 |
|
| PG1501 | Laying open of application |
St.27 status event code: A-1-1-Q10-Q12-nap-PG1501 |
|
| R18-X000 | Changes to party contact information recorded |
St.27 status event code: A-3-3-R10-R18-oth-X000 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-2-2-P10-P22-nap-X000 |
|
| PC1203 | Withdrawal of no request for examination |
St.27 status event code: N-1-6-B10-B12-nap-PC1203 |
|
| WITN | Application deemed withdrawn, e.g. because no request for examination was filed or no examination fee was paid | ||
| R18-X000 | Changes to party contact information recorded |
St.27 status event code: A-3-3-R10-R18-oth-X000 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-2-2-P10-P22-nap-X000 |
|
| R18-X000 | Changes to party contact information recorded |
St.27 status event code: A-3-3-R10-R18-oth-X000 |
|
| R18 | Changes to party contact information recorded |
Free format text: ST27 STATUS EVENT CODE: A-3-3-R10-R18-OTH-X000 (AS PROVIDED BY THE NATIONAL OFFICE) |
|
| R18-X000 | Changes to party contact information recorded |
St.27 status event code: A-3-3-R10-R18-oth-X000 |