KR20200087977A - 멀티모달 문서 요약 시스템 및 방법 - Google Patents
멀티모달 문서 요약 시스템 및 방법 Download PDFInfo
- Publication number
- KR20200087977A KR20200087977A KR1020190004398A KR20190004398A KR20200087977A KR 20200087977 A KR20200087977 A KR 20200087977A KR 1020190004398 A KR1020190004398 A KR 1020190004398A KR 20190004398 A KR20190004398 A KR 20190004398A KR 20200087977 A KR20200087977 A KR 20200087977A
- Authority
- KR
- South Korea
- Prior art keywords
- text
- vector
- document
- image
- abstraction
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Images
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/10—Text processing
- G06F40/166—Editing, e.g. inserting or deleting
-
- G06K9/00456—
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0464—Convolutional networks [CNN, ConvNet]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V30/00—Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
- G06V30/40—Document-oriented image-based pattern recognition
- G06V30/41—Analysis of document content
- G06V30/413—Classification of content, e.g. text, photographs or tables
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Artificial Intelligence (AREA)
- General Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Health & Medical Sciences (AREA)
- Computational Linguistics (AREA)
- General Engineering & Computer Science (AREA)
- Biomedical Technology (AREA)
- Evolutionary Computation (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- Data Mining & Analysis (AREA)
- Biophysics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Life Sciences & Earth Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Multimedia (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
본 기술은 멀티모달 문서 요약 시스템 및 방법이 개시된다. 본 기술의 구체적인 실시 예에 의하면 제공받은 멀티모달 문서에 포함된 이미지 및 텍스트를 이용하여 요약문을 생성함에 따라, 기존의 텍스트만을 이용하여 작성된 문서의 요약문에 비해 제공되는 문서에 포함된 정보의 함축성과 다양성을 향상시킬 수 있고, 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 모델을 구축하고 구축된 모델에 대한 학습 데이터로 생성된 텍스트 및 이미지 각각의 요약문에 대해 주의 집중 메커니즘(Attention Mechanism)을 수행하여 제공받은 문서의 요약을 생성함에 따라 멀티모달 문서의 질을 향상시킬 수 있다.
Description
본 발명은 멀티모달 문서 요약 시스템 및 방법에 관한 것으로서, 보다 상세하게는, 이미지 및 텍스트가 혼용된 멀티모달 문서에서 텍스트 및 이미지 요약문을 각각 추상화한 다음 각각의 추상화 결과가 결합된 요약문을 생성함으로써 멀티모달 문서에 포함된 정보와 정확하게 매칭되는 요약을 제공할 수 있도록 한 기술에 관한 것이다.
최근 컴퓨터의 보급 및 인터넷의 발달로 전자 문서의 양이 급격히 증가하게 되었고 이에 따라 수많은 전자 문서 가운데 원하는 문서를 색출해내는 데에도 상대적으로 많은 시간이 걸리게 되었다.
문서 검색 시스템은 공통적으로 검색어(keyword)를 사용한 검색 시스템으로, 핵심 단어로 문서를 검색하는 경우 사용자가 간단한 검색어 입력만으로 원하는 정보를 검색할 수 있는 시스템이다.
그러나, 오늘날에는 검색어에 해당하는 검색 결과의 양이 방대할 뿐만 아니라 그 검색 결과가 정확한지 제대로 파악할 수 없기 때문에 실제로는 사용자가 그 검색 결과에 해당하는 문서들을 일일이 확인을 해야 한다.
사용자가 문서의 내용을 보다 편리하고 신속하게 파악할 수 있도록 하기 위해 문서의 원본을 자동으로 요약하는 기술이 개발되었다.
문서 요약이란 간단히 말하면 문서의 내용을 일정한 크기로 줄여주는 것이라고 할 수 있으며, 문서에서 중요하지 않은 부분이나 사소한 부분을 생략하면서 핵심적인 내용 및 제목을 일관성 있게 추려내어 모아주는 문서 내용 압축 시스템이다.
일 예로, 한국등록번호 제10-0435442호(등록일 2004년 06월 01일) "문서 요약 방법 및 시스템"에는 문서의 구조적인 특징을 파악하여 일정한 규칙에 의해 구조화시킨 후 문서의 구조화된 단락에서 자주 발생하는 패턴을 추출하여 자연어 처리(NLP) 기술을 이용하여 문서를 자동 요약하는 기술이 개시되어 있다.
본 발명의 목적은, 이미지와 텍스트가 혼재된 멀티모달 문서의 정보와 매칭되는 제목을 생성하여 멀티모달 문서의 질을 향상시킬 수 있는 멀티모달 문서 요약 시스템 및 방법을 제공하고자 함에 있다.
본 발명의 목적은 이상에서 언급한 목적으로 제한되지 않으며, 언급되지 않은 본 발명의 다른 목적 및 장점들은 하기의 설명에 의해서 이해될 수 있으며, 본 발명의 실시 예에 의해 보다 분명하게 알게 될 것이다. 또한, 본 발명의 목적 및 장점들은 특허청구 범위에 나타낸 수단 및 그 조합에 의해 실현될 수 있음을 쉽게 알 수 있을 것이다.
사용자 단말과 서버 간에 멀티모달 문서 요약 시스템에 있어서, 상기 서버는 이미지 및 텍스트가 혼합된 멀티모달 문서에서 텍스트 추상화 벡터를 생성하는 텍스트 인코더; 제공된 멀티모달 문서에서 이미지 추상화 벡터를 생성하는 이미지 인코더; 및 상기 텍스트 추상화 벡터와 이미지 추상화 벡터를 결합하여 멀티모달 문서의 요약을 생성하는 디코더로 구비되는 것을 특징으로 하는 시스템을 제공한다.
컴퓨터로 구현되는 멀티모달 문서 요약 방법에 있어서, 이미지 및 텍스트가 혼합된 멀티모달 문서에서 추출된 텍스트를 음절 단위로 임베딩하여 음절 백터를 도출하고, 도출된 음절 벡터를 입력으로 텍스트 추상화 벡터를 생성하는 단계; 상기 멀티모달 문서에서 딥러닝 알고리즘의 CNN(Convolution Neural Network) 구조의 VGGNet(Visual Geometry Group Network)를 이용하여 이미지 벡터를 생성하고 생성된 이미지 백터를 입력으로 이미지 추상화 벡터를 생성하는 단계; 및 상기 텍스트 추상화 벡터와 이미지 추상화 벡터를 결합하여 멀티모달 문서의 요약을 생성하여 사용자 단말로 전달하는 단계를 포함하는 것을 특징으로 하는 멀티모달 문서 요약 방법을 제공한다.
본 발명에 의하면, 이미지 및 텍스트가 혼합된 멀티모달 문서에 포함된 이미지 및 텍스트를 이용하여 멀티모달 문서의 요약을 생성함에 따라, 기존의 텍스트 또는 이미지 만을 이용하여 작성된 문서의 요약에 비해 제공되는 멀티모달 문서에 포함된 정보를 신속하게 획득할 수 있다.
또한 본 발명에 의하면, 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 모델을 구축하고 구축된 모델에 대한 학습 데이터로 생성된 텍스트 및 이미지 각각의 추상화 벡터에 대해 주의 집중 메커니즘(Attention Mechanism)을 수행하여 이미지 및 텍스트가 혼합된 멀티모달 문서의 요약을 생성함에 따라 멀티모달 문서의 질을 향상시킬 수 있다.
본 명세서에서 첨부되는 다음의 도면들은 본 발명의 바람직한 실시 예를 예시하는 것이며, 후술하는 발명의 상세한 설명과 함께 본 발명의 기술사상을 더욱 이해시키는 역할을 하는 것이므로, 본 발명은 그러한 도면에 기재된 사항에만 한정되어 해석되어서는 아니된다.
도 1은 본 실시 예의 문서 요약 시스템의 구성을 보인 블록도이다.
도 2는 본 실시 예의 시스템의 서버의 세부 구성도이다.
도 1은 본 실시 예의 문서 요약 시스템의 구성을 보인 블록도이다.
도 2는 본 실시 예의 시스템의 서버의 세부 구성도이다.
이하에서는 도면을 참조하여 본 발명의 실시 예들을 보다 상세하게 설명한다.
본 발명의 이점 및 특징, 그리고 그것들을 달성하는 방법은 첨부되는 도면과 함께 후술되어 있는 실시 예들을 참조하면 명확해질 것이다. 그러나 본 발명은 이하에서 개시되는 실시 예들에 한정되는 것이 아니라 서로 다른 다양한 형태로 구현될 수 있으며, 단지 본 실시 예들은 본 발명의 개시가 완전하도록 하고, 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에게 발명의 범주를 완전하게 알려주기 위해 제공되는 것이며, 본 발명은 청구항의 범주에 의해 정의될 뿐이다.
본 명세서에서 사용되는 용어에 대해 간략히 설명하고, 본 발명에 대해 구체적으로 설명하기로 한다.
본 발명에서 사용되는 용어는 본 발명에서의 기능을 고려하면서 가능한 현재 널리 사용되는 일반적인 용어들을 선택하였으나, 이는 당 분야에 종사하는 기술자의 의도 또는 판례, 새로운 기술의 출현 등에 따라 달라질 수 있다. 또한, 특정한 경우는 출원인이 임의로 선정한 용어도 있으며, 이 경우 해당되는 발명의 설명 부분에서 상세히 그 의미를 기재할 것이다. 따라서 본 발명에서 사용되는 용어는 단순한 용어의 명칭이 아닌, 그 용어가 가지는 의미와 본 발명의 전반에 걸친 내용을 토대로 정의되어야 한다.
명세서 전체에서 어떤 부분이 어떤 구성요소를 "포함"한다고 할 때, 이는 특별히 반대되는 기재가 없는 한 다른 구성요소를 제외하는 것이 아니라 다른 구성요소를 더 포함할 수 있음을 의미한다. 또한, 명세서에서 사용되는 "부"라는 용어는 소프트웨어, FPGA 또는 ASIC과 같은 하드웨어 구성요소를 의미하며, "부"는 어떤 역할들을 수행한다. 그렇지만 "부"는 소프트웨어 또는 하드웨어에 한정되는 의미는 아니다. "부"는 어드레싱할 수 있는 저장 매체에 있도록 구성될 수도 있고 하나 또는 그 이상의 프로세서들을 재생시키도록 구성될 수도 있다.
따라서, 일 예로서 "부"는 소프트웨어 구성요소들, 객체지향 소프트웨어 구성요소들, 클래스 구성요소들 및 태스크 구성요소들과 같은 구성요소들과, 프로세스들, 함수들, 속성들, 프로시저들, 서브루틴들, 프로그램 코드의 세그먼트들, 드라이버들, 펌웨어, 마이크로 코드, 회로, 데이터, 데이터베이스, 데이터 구조들, 테이블들, 어레이들 및 변수들을 포함한다. 구성요소들과 "부"들 안에서 제공되는 기능은 더 작은 수의 구성요소들 및 "부"들로 결합되거나 추가적인 구성요소들과 "부"들로 더 분리될 수 있다.
아래에서는 첨부한 도면을 참고하여 본 발명의 실시 예에 대하여 본 발명이 속하는 기술 분야에서 통상의 지식을 가진 자가 용이하게 실시할 수 있도록 상세히 설명한다. 그리고 도면에서 본 발명을 명확하게 설명하기 위해서 설명과 관계없는 부분은 생략한다.
본 실시 예는 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 기 구축된 모델에 대한 학습 데이터를 이용하여 이미지 및 텍스트가 혼합된 멀티모달 문서에서 텍스트 추상화 벡터와 이미지 추상화 벡터를 각각 생성하고 생성된 각각의 텍스트 추상화 벡터 및 이미지 추상화 벡터에 대해 주의 집중 메커니즘(Attention Mechanism)을 적용하여 제공받은 이미지 및 텍스트가 혼합된 멀티모달 문서의 요약(제목)을 생성하는 구성을 갖춘다.
본 명세서에서, 이미지 및 텍스트가 혼합된 멀티모달 문서는 텍스트 및 이미지와 같은 파일들의 논리적인 구조로 표현된 데이터를 의미하며, DB(database)와 같은 정형화 된 데이터는 물론이고, 블로그 나 카페 등 웹 데이터와 같은 비정형 데이터를 포괄하여 의미할 수 있다. 인터넷 뉴스 기사, 블로그, 또는 온라인 커뮤니티 및 사회관계망의 게시물 등과 같은 온라인 멀티모달(multimodal) 특징을 가진 문서를 일 예로 할 수 있으나, 이러한 것으로만 한정되는 것은 아니다. 여기에서 멀티모달 문서란 문서에서 전달하고자 하는 의미 표현을 위해 텍스트, 이미지, 음성 등 적어도 하나 이상의 서로 다른 표현방법이 사용된 문서를 의미한다.
한편 본 명세서의 추상화라 함은 시각적으로 생성되지 아니한 텍스트 요약 및 이미지 요약을 의미이다.
도 1은 본 실시 예의 멀티모달 서비스를 제공하기 위한 문서 요약 시스템의 블록도로서, 도 1을 참조하면, 본 실시 예의 시스템은, 사용자 단말(10)과 서버(20) 간 통신망 접속을 통해 웹 기반으로 멀티모달 문서의 요약을 제공하도록 구비될 수 있다.
여기서 사용자 단말(10)은 컴퓨팅 시스템으로 구현되는 고정형 단말이거나 이동형 단말일 수 있다. 예를 들면, 스마트폰(smart phone), 휴대폰, 네비게이션, 컴퓨터, 노트북, 디지털방송용 단말, PDA(Personal Digital Assistants), PMP(Portable Multimedia Player), 태블릿 PC 등이 있다. 이러한 사용자 단말(10) 각각은 무선 또는 유선 통신 방식을 이용하여 네트워크를 통해 다른 전자 기기 및/또는 서버(20)와 통신할 수 있다.
통신 방식은 제한되지 않으며, 네트워크가 포함할 수 있는 통신망(일례로, 이동통신망, 유선 인터넷, 무선인터넷, 방송망)을 활용하는 통신 방식뿐만 아니라 기기들간의 근거리 무선 통신 역시 포함될 수 있다. 예를 들어, 네트워크는, PAN(personal area network), LAN(local area network), CAN(campus area network), MAN(metropolitan area network), WAN(wide area network), BBN(broadband network), 인터넷 등의 네트워크 중 하나 이상의 임의의 네트워크를 포함할 수 있다. 또한, 네트워크는 버스 네트워크, 스타 네트워크, 링 네트워크, 메쉬 네트워크, 스타-버스 네트워크, 트리 또는 계층적(hierarchical) 네트워크 등을 포함하는 네트워크 토폴로지 중 임의의 하나 이상을 포함할 수 있으나, 이에 제한되지 않는다.
서버(20)는 사용자 단말(10)과 네트워크를 통해 통신하여 멀티모달 문서의 요약을 제공하는 장치 또는 복수의 장치들로 구현될 수 있다. 서버(20)는 사용자 단말(10)로 서비스나 컨텐츠를 제공하기 위한 하나의 시스템을 구성하도록 구축될 수도 있고, 또는 각기 서로 다른 서비스나 컨텐츠를 제공하는 개별 시스템들일 수도 있다.
서버(20)는 사용자 단말(10)를 통한 사용자의 요청에 따라 사용자 단말(10)의 화면을 구성할 수 있는 코드를 사용자 단말(10)로 제공할 수 있고, 사용자 단말(10)은 사용자 단말(10)이 포함하는 프로그램(일례로 브라우저나 특정 어플리케이션)을 이용하여 제공된 코드를 이용하여 화면을 구성하여 표시함으로써 사용자에게 컨텐츠를 제공할 수 있다.
서버(20)는 사용자 단말(10)을 통한 사용자의 요청에 따라 사용자 단말(10)로 서비스나 컨텐츠를 제공할 수 있다. 일례로 사용자 단말(10)은 서버(20)가 제공하는 코드, 파일, 데이터 등을 수신하고, 사용자 단말(10)에 설치된 프로그램(어플리케이션)과 수신된 코드, 파일, 데이터 등을 이용하여 서버(20)가 제공하는 서비스나 컨텐츠를 제공받을 수 있게 된다.
서버(20)는 텍스트 및 이미지가 포함된 멀티모달 문서가 입력으로 주어지면 해당 멀티모달 문서에서 텍스트를 추출한 다음 추출된 텍스트의 음절 단위를 임베딩하여 벡터 형태로 수치화한 다음 텍스트 추상화 벡터를 도출할 수 있다, 여기서, 텍스트 요약은 형태소 분석을 통해 주어진 문서 내의 모든 문장을 품사 정보가 포함된 단어의 집합으로 생성할 수 있고, 단어의 집합을 생성하는 대상에는 문서의 제목이 포함될 수 있다.
또한 서버(20)는 수신된 멀티모달 문서에서 이미지를 추출한 다음 추출된 이미지에 대한 벡터 형태로 수치화하여 이미지 추상화 벡터를 도출할 수 있으며 도출된 텍스트 및 이미지 추상화 벡터에 대해 주위 집중 메커니즘을 적용하여 수신된 멀티모달 문서의 요약을 생성하고 생성된 멀티모달 문서의 용약을 사용자 단말(10)로 제공한다.
여기서, 서버(20)는 문서의 핵심 문장 요약에 있어서 문서에 포함된 문장들 간의 유사성과 다양성을 동시에 고려하여 새로운 점수를 정의할 수 있으며, 이를 기준으로 하여 문서에서 핵심문장 또는 핵심 이미지를 추출할 수 있다. 이때, 유사성은 문장을 구성하는 단어들 간의 유사도 점수를 의미할 수 있고, 다양성은 문장을 구성하는 단어들의 출현 확률로부터 산출되는 불확실성(entropy)을 의미할 수 있다.
도 2는 도 1에 도시된 서버(20)의 세부적인 구성도로서, 도 2를 참조하면 서버(20)는 텍스트 인코더(100), 이미지 인코더(200), 및 디코더(300)를 포함할 수 있다.
텍스트 인코더(100)는 이미지 및 텍스트가 혼합된 멀티모달 문서의 집합을 사전에 학습된 텍스트 기술자를 이용하여 텍스트를 추출하고 추출된 텍스트를 음절 단위로 임베딩하여 음절 벡터를 도출하며 도출된 음절 벡터를 입력으로 텍스트 추상화 벡터를 생성한다.
텍스트 요약문의 음절 단위는 요약문의 의미적으로 분류하는 단위로서 단어, 문장, 문단, 문서 등으로 설정될 수 있으며, 하나의 텍스트 단위가 다른 텍스트 단위로 이루어지는 경우, 상기 하나의 음절 단위는 상위 텍스트 단위로 지칭되며, 상기 상위 음절 단위를 이루는 음소 단위는 하위 텍스트 단위로 지칭되며 본 실시 예에서는 음절 단위를 일례로 설명한다.
예를 들어, 하나 이상의 문장으로 구성된 문단, 하나 이상의 문단으로 구성된 섹션 등을 포함한 문서에서, 본 명세서의 문서는 반드시 보고 문서 전체를 의도하는 것으로 해석되지 않으며, 섹션(또는 문단)을 의도할 수 있다. 즉, 본 명세서의 문서는 문단, 섹션, 문서 컨텐츠를 포함할 수 있다.
그리고 음절 임베딩은 음절 단위로 텍스트를 수치화한 것을 나타낸다. 예를 들어, 문장 임베딩은 문장 단위의 텍스트를 수치화한 것을, 단어 임베딩은 단어 단위의 텍스트를 수치화한 것을 나타내며 본 실시 예에서의 임베딩은 음절 단위의 텍스트를 수치화하여 음절 벡터를 도출한 것을 나타낸다.
텍스트 인코더(100)는 음절 단위의 텍스트에 대해 임베딩하여 음절 벡터를 도출한 다음 도출된 음절 벡터를 텍스트 기술자에 적용하여 다음 음절 벡터를 도출하고, 이러한 음절 벡터를 도출하는 과정은 문장의 마지막 음절에 도달할 때까지 반복 수행한다.
또한 텍스트 인코더(100)는 모든 음절에 대한 음절 벡터가 도출된 다음 도출된 음절 벡터를 포함하는 문장을 텍스트 기술자에 적용하여 학습하고 학습 결과를 토대로 텍스트 추상화 벡터를 생성하며 생성된 텍스트 추상화 벡터에 대해 학습을 반복 수행하여 문서의 텍스트 추상화 벡터를 완성한다.
본 실시 예에서 텍스트 기술자는 RNN(Recurrent Neutral Network) 기반으로 설명하고 있으나, 이에 한정하지 아니하고 텍스트 기술자의 특성에 따라 CNN(Convolutional Neural Network) 등의 다양한 방법으로 생성될 수 있다.
또한 텍스트 기술자는 음절 벡터 간의 오차는 loss function을 통해 산출하고 이러한 loss function은 그래디언트 디센트 최적화 알고리즘을 이용하여 최소화할 수 있고, 이에 한정하지 아니하고 다양한 최적화 알고리즘이 사용될 수 있다.
한편, 이미지 인코더(200)는, 사용자 단말(10)로부터 제공된 멀티모달 문서 내의 이미지를 추출한 다음 추출된 이미지를 이미지 기술자에 적용하여 문서의 입력 이미지를 다수의 셋트로 분할한 다음 분할된 각각의 셋트를 다수 서브 이미지로 분할하며, 분할된 다수의 서브 이미지를 병렬로 처리하여 한 세트의 출력 이미지를 생성한다.
그리고, 이미지 인코더(200)는 생성된 한 셋트의 출력 이미지 각각에 대해 한 셋트의 특징 맵을 생성하고 생성된 각 셋트의 특징 맵을 병합하고 병합된 특징 맵을 처리하여 이미지 벡터를 출력한다.
본 실시 예에서 설명 상의 편의를 위해 이미지 기술자는 이미지의 특징 맵을 벡터 형태로 표현하는 CNN(Convolutional neural network) feature 기법을 예를 들어 설명하고 있으나, SIFT(Scale Invariant Feature Transform), HOG(Histogram of Oriented Gradient), SURF(Speeded Up Robust Features) 등 다양한 기법들이 사용될 수 있다.
그리고, 이미지 인코더(200)는 이미지 벡터와 사전에 구축된 데이터베이스의 이미지 기술자들과의 유사도를 산출하고 유사도가 높은 이미지를 표현한 이미지 추상화 벡터를 확률적으로 선택한 다음 디코더(300)로 전달된다.
이에 디코더(300)는 주위 집중(Attention) 메커니즘을 해당 문서에 대한 요약(제목)을 완성한다.
주위 집중 메커니즘은, 인간의 두뇌에서 일어나는 주위 집중 정도를 텍스트 인식 및 이미지 인식에 적용하는 알고리즘으로, 복수의 후보자 클라스에 대하여 주 의 집중 정도를 척도하는 주의 집중 메카니즘의 모델을 이용하여 주어진 입력 패턴에 대해 출력층의 목표치를 선택하고 선택된 입력 패턴에 대한 신경회로망의 출력와 목표치 사이의 출력 오차를 산출하고 산출된 출력 오차가 임계 범위 내에 속하도록 반복적으로 학습하여 주위집중 정도를 출력할 수 있다.
이에 디코더(300)는 음절 벡터와 이미지 벡터를 입력 패턴으로 주위 집중 메커니즘에 적용하여 목표치 벡터를 정해주면 입력 패턴을 목표치 벡터를 출력하기 위한 새로운 입력 패턴으로 변형되고, 이에 텍스트 인코더(100) 및 이미지 인코더(200)로부터 제공된 텍스트 추상화 벡터와 이미지 추상화 벡터에 대해 주위 집중 메커니즘으로 결합하여 문서의 제목을 생성한다.
예를 들어, 서버(20)의 텍스트 인코더(100)의 텍스트 추상화 벡터의 내용(실제로 볼 수는 없으며 숫자로 표현) “문재인 대통령”이고 이미지 인코더(200)의 이미지 추상화 벡터의 내용(실제로 볼 수는 없으며 숫자로 표현)이 “환호하는”이라면 디코더(300)의 멀티모달 문서의 요약은 “환호하는 문재인 대통령”으로 생성되고, 이러한 생성된 멀티모달 문서의 요약은 네트워크를 통해 사용자 단말(10)로 전달된다.
즉, 텍스트 문서 “이승엽 선수가 홈런 신기록을 세웠다”는 내용의 10문장짜리 기사가 있고, 해당 문서에 “이승엽 선수가 환하게 웃는 모습”의 이미지가 추가되어 있다면, 두 개의 정보로부터 “이승엽 선수가 홈런 신기록을 갱신하고 환하게 웃고 있다”라는 멀티모달 문서의 요약이 생성된다.
이에 본 실시 예에 의하면, 제공받은 문서에 포함된 이미지 및 텍스트를 이용하여 요약문을 생성함에 따라, 기존의 텍스트 또는 이미지 만을 이용하여 작성된 문서의 요약문에 비해 제공되는 문서에 포함된 정보의 함축성 및 다양성을 향상시킬 수 있다.
또한 본 발명에 의하면, 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 모델을 구축하고 구축된 모델에 대한 학습 데이터로 생성된 텍스트 및 이미지 각각의 요약문에 대해 주의 집중 메커니즘(Attention Mechanism)을 수행하여 제공받은 문서의 요약문을 생성함에 따라 문서의 품질을 향상시킬 수 있다.
한편 본 발명의 다른 실시 예에 따르면, 컴퓨터로 구현되는 멀티모달 문서 요약 방법에 있어서, 사용자 단말로부터 제공받은 이미지와 텍스트가 합성된 멀티모달 문서에서 추출된 텍스트를 음절 단위로 임베딩하여 음절 백터를 도출하고, 도출된 음절 벡터를 입력으로 텍스트 추상화 벡터를 생성하는 단계; 상기 멀티모달 문서에서 추출된 이미지를 딥러닝 알고리즘의 CNN(Convolution Neural Network) 구조의 VGGNet(Visual Geometry Group Network)를 이용하여 이미지 벡터를 생성하고 생성된 이미지 백터를 입력으로 이미지 추상화 벡터를 생성하는 단계; 및 상기 텍스트 추상화 벡터와 이미지 추상화 벡터를 결합하여 멀티모달 문서의 요약을 생성하고 생성된 멀티모달 문서의 요약을 사용자 단말로 전달하는 단계를 포함하고 상기의 문서 요약 방법의 각 단계는 전술한 텍스트 인코더(100), 이미지 인코더(200), 및 디코더(300)에서 수행되는 기능으로 자세한 원용은 생략한다.
따라서, 본 실시 예에 의거, 제공받은 멀티모달 문서에 포함된 이미지 및 텍스트를 이용하여 요약문을 생성함에 따라, 기존의 텍스트만을 이용하여 작성된 문서의 요약문에 비해 제공되는 문서에 포함된 정보의 함축성 및 다양성을 향상시킬 수 있고, 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 모델을 구축하고 구축된 모델에 대한 학습 데이터로 생성된 텍스트 및 이미지 각각의 요약문에 대해 주의 집중 메커니즘(Attention Mechanism)을 수행하여 제공받은 문서의 요약을 생성함에 따라 멀티모달 문서의 질을 향상시킬 수 있다.
제공받은 멀티모달 문서에 포함된 이미지 및 텍스트를 이용하여 요약문을 생성함에 따라, 기존의 텍스트만을 이용하여 작성된 문서의 요약문에 비해 제공되는 문서에 포함된 정보의 함축성 및 다양성을 향상시킬 수 있고, 대용량의 뉴스 기사의 텍스트, 이미지, 제목에서 추출된 데이터로 모델을 구축하고 구축된 모델에 대한 학습 데이터로 생성된 텍스트 및 이미지 각각의 요약문에 대해 주의 집중 메커니즘(Attention Mechanism)을 수행하여 제공받은 문서의 요약을 생성함에 따라 멀티모달 문서의 질을 향상시킬 수 있는 멀티모달 문서 요약 시스템에 대한 운용의 정확성 및 신뢰도 측면, 더 나아가 성능 효율 면에 매우 큰 진보를 가져올 수 있으며, 문서 요약 시스템의 시판 또는 영업의 가능성이 충분할 뿐만 아니라 현실적으로 명백하게 실시할 수 있는 정도이므로 산업상 이용가능성이 있는 발명이다.
10 : 사용자 단말
20 : 서버
100 : 텍스트 인코더
200 : 이미지 인코더
300 : 디코더
20 : 서버
100 : 텍스트 인코더
200 : 이미지 인코더
300 : 디코더
Claims (7)
- 사용자 단말과 서버 간에 멀티모달 문서 요약 시스템에 있어서,
상기 서버는
이미지 및 텍스트가 혼합된 멀티모달 문서에서 텍스트 추상화 벡터를 생성하는 텍스트 인코더;
상기 멀티모달 문서에서 이미지 추상화 벡터를 생성하는 이미지 인코더; 및
상기 텍스트 추상화 벡터와 이미지 추상화 벡터를 결합하여 멀티모달 문서의 요약을 생성하는 디코더로 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 제1항에 있어서, 상기 텍스트 인코더는
수신된 멀티모달 문서에서 추출된 텍스트를 텍스트 기술자에 적용하여 음절 단위로 임베딩하여 음절 벡터를 생성하고,
상기 생성된 음절 벡터를 입력으로 텍스트 추상화 벡터를 생성하도록 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 제2항에 있어서, 상기 텍스트 기술자는,
RNN(Recurrent Neural Network) 학습 모델, CNN(Convolutional Neural Network) 기반 중 하나로 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 제1항에 있어서, 상기 이미지 인코더는
상기 멀티모달 문서에서 추출된 이미지를 이미지 기술자에 적용하여 이미지 벡터를 생성하고,
생성된 이미지 백터를 입력으로 이미지 추상화 벡터를 생성하도록 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 제4항에 있어서, 상기 이미지 기술자는,
딥러닝 알고리즘의 CNN(Convolution Neural Network) 구조의 VGGNet(Visual Geometry Group Network) feature, SIFT(Scale Invariant Feature Transform), HOG(Histogram of Oriented Gradient), SURF(Speeded Up Robust Features) 중 하나로 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 제1항에 있어서, 상기 디코더는
상기 텍스트 요약문 및 이미지 요약문 각각에 대해 주위집중 알고리즘을 적용하여 수신된 문서의 요약을 생성하도록 구비되는 것을 특징으로 하는 멀티모달 문서 요약 시스템. - 컴퓨터로 구현되는 멀티모달 문서 요약 방법에 있어서,
이미지 및 텍스트가 혼합된 멀티모달 문서에서 추출된 텍스트를 음절 단위로 임베딩하여 음절 백터를 도출하고, 도출된 음절 벡터를 입력으로 텍스트 추상화 벡터를 생성하는 단계;
상기 멀티모달 문서에서 딥러닝 알고리즘의 CNN(Convolution Neural Network) 구조의 VGGNet(Visual Geometry Group Network)를 이용하여 이미지 벡터를 생성하고 생성된 이미지 백터를 입력으로 이미지 추상화 벡터를 생성하는 단계; 및
상기 텍스트 추상화 벡터와 이미지 추상화 벡터를 결합하여 멀티모달 문서의 요약을 생성하여 사용자 단말로 전달하는 단계를 포함하는 것을 특징으로 하는 멀티모달 문서 요약 방법.
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020190004398A KR20200087977A (ko) | 2019-01-14 | 2019-01-14 | 멀티모달 문서 요약 시스템 및 방법 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020190004398A KR20200087977A (ko) | 2019-01-14 | 2019-01-14 | 멀티모달 문서 요약 시스템 및 방법 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| KR20200087977A true KR20200087977A (ko) | 2020-07-22 |
Family
ID=71893065
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020190004398A Withdrawn KR20200087977A (ko) | 2019-01-14 | 2019-01-14 | 멀티모달 문서 요약 시스템 및 방법 |
Country Status (1)
| Country | Link |
|---|---|
| KR (1) | KR20200087977A (ko) |
Cited By (9)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN113609285A (zh) * | 2021-08-09 | 2021-11-05 | 福州大学 | 一种基于依赖门控融合机制的多模态文本摘要系统 |
| CN114003726A (zh) * | 2021-12-31 | 2022-02-01 | 山东大学 | 一种基于子空间嵌入的学术论文差异性分析方法 |
| KR20220097814A (ko) * | 2020-12-31 | 2022-07-08 | 중앙대학교 산학협력단 | 데이터 통합 분석 학습을 이용한 데이터 분류 장치 및 방법 |
| CN114757177A (zh) * | 2022-03-11 | 2022-07-15 | 重庆邮电大学 | 一种基于bart融合指针生成网络的文本摘要方法 |
| KR102476499B1 (ko) | 2021-11-18 | 2022-12-12 | 주식회사 티맥스에이아이 | 유사 컨텐츠 제공 기법 |
| CN115982343A (zh) * | 2023-03-13 | 2023-04-18 | 阿里巴巴达摩院(杭州)科技有限公司 | 摘要生成方法、训练摘要生成模型的方法及装置 |
| US11943184B2 (en) | 2021-01-21 | 2024-03-26 | Samsung Electronics Co., Ltd. | Device and method for providing notification message related to content |
| CN117975486A (zh) * | 2024-03-29 | 2024-05-03 | 厦门大学 | 基于文本图像的产品摘要生成方法、系统和存储介质 |
| US20250371286A1 (en) * | 2024-05-31 | 2025-12-04 | Writer, Inc. | Natural language generation using knowledge graph incorporating textual summaries |
-
2019
- 2019-01-14 KR KR1020190004398A patent/KR20200087977A/ko not_active Withdrawn
Cited By (16)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20220097814A (ko) * | 2020-12-31 | 2022-07-08 | 중앙대학교 산학협력단 | 데이터 통합 분석 학습을 이용한 데이터 분류 장치 및 방법 |
| US11943184B2 (en) | 2021-01-21 | 2024-03-26 | Samsung Electronics Co., Ltd. | Device and method for providing notification message related to content |
| CN113609285B (zh) * | 2021-08-09 | 2024-05-14 | 福州大学 | 一种基于依赖门控融合机制的多模态文本摘要系统 |
| CN113609285A (zh) * | 2021-08-09 | 2021-11-05 | 福州大学 | 一种基于依赖门控融合机制的多模态文本摘要系统 |
| KR102476499B1 (ko) | 2021-11-18 | 2022-12-12 | 주식회사 티맥스에이아이 | 유사 컨텐츠 제공 기법 |
| KR20230073138A (ko) | 2021-11-18 | 2023-05-25 | 주식회사 티맥스에이아이 | 유사 컨텐츠 제공 기법 |
| CN114003726A (zh) * | 2021-12-31 | 2022-02-01 | 山东大学 | 一种基于子空间嵌入的学术论文差异性分析方法 |
| CN114003726B (zh) * | 2021-12-31 | 2022-04-08 | 山东大学 | 一种基于子空间嵌入的学术论文差异性分析方法 |
| CN114757177A (zh) * | 2022-03-11 | 2022-07-15 | 重庆邮电大学 | 一种基于bart融合指针生成网络的文本摘要方法 |
| CN115982343B (zh) * | 2023-03-13 | 2023-08-22 | 阿里巴巴达摩院(杭州)科技有限公司 | 摘要生成方法、训练摘要生成模型的方法及装置 |
| CN115982343A (zh) * | 2023-03-13 | 2023-04-18 | 阿里巴巴达摩院(杭州)科技有限公司 | 摘要生成方法、训练摘要生成模型的方法及装置 |
| CN117975486A (zh) * | 2024-03-29 | 2024-05-03 | 厦门大学 | 基于文本图像的产品摘要生成方法、系统和存储介质 |
| US20250371286A1 (en) * | 2024-05-31 | 2025-12-04 | Writer, Inc. | Natural language generation using knowledge graph incorporating textual summaries |
| US12579382B2 (en) | 2024-05-31 | 2026-03-17 | Writer, Inc. | Natural language generation using knowledge graph incorporating textual summaries |
| US12585891B2 (en) | 2024-05-31 | 2026-03-24 | Writer, Inc. | Natural language generation using knowledge graph incorporating textual summaries |
| US12591751B2 (en) | 2024-05-31 | 2026-03-31 | Writer, Inc. | Natural language generation using knowledge graph incorporating textual summaries |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN111753060B (zh) | 信息检索方法、装置、设备及计算机可读存储介质 | |
| CN111444326B (zh) | 一种文本数据处理方法、装置、设备以及存储介质 | |
| CN112131350B (zh) | 文本标签确定方法、装置、终端及可读存储介质 | |
| RU2678716C1 (ru) | Использование автоэнкодеров для обучения классификаторов текстов на естественном языке | |
| KR101754473B1 (ko) | 문서를 이미지 기반 컨텐츠로 요약하여 제공하는 방법 및 시스템 | |
| CN110097085B (zh) | 歌词文本生成方法、训练方法、装置、服务器及存储介质 | |
| CN111190997B (zh) | 一种使用神经网络和机器学习排序算法的问答系统实现方法 | |
| CN110717017A (zh) | 一种处理语料的方法 | |
| CN114490949B (zh) | 基于bm25算法的文档检索方法、装置、设备及介质 | |
| US20200104350A1 (en) | Information extraction from open-ended schema-less tables | |
| CN107193792A (zh) | 基于人工智能的生成文章的方法和装置 | |
| CN110309355B (zh) | 内容标签的生成方法、装置、设备及存储介质 | |
| CN113704623A (zh) | 一种数据推荐方法、装置、设备及存储介质 | |
| US12536224B2 (en) | Machine learning selection of images | |
| KR101545050B1 (ko) | 정답 유형 자동 분류 방법 및 장치, 이를 이용한 질의 응답 시스템 | |
| KR20230119398A (ko) | 영상 편집 자동화 시스템 | |
| CN120279301A (zh) | 基于视觉语言对齐的视觉叙事生成方法、装置、电子设备及存储介质 | |
| CN114281919A (zh) | 基于目录树的节点添加方法、装置、设备以及存储介质 | |
| CN114118087A (zh) | 实体确定方法、装置、电子设备及存储介质 | |
| CN113408282A (zh) | 主题模型训练和主题预测方法、装置、设备及存储介质 | |
| CN114238562A (zh) | 文本处理方法、装置、电子设备及存储介质 | |
| CN117725153B (zh) | 文本匹配方法、装置、电子设备和存储介质 | |
| Garg et al. | On-device document classification using multimodal features | |
| CN115761771B (zh) | 视觉分析方法及装置 | |
| CN113393556B (zh) | 图像处理方法、装置、计算机设备和可读存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PA0109 | Patent application |
Patent event code: PA01091R01D Comment text: Patent Application Patent event date: 20190114 |
|
| PG1501 | Laying open of application | ||
| PC1203 | Withdrawal of no request for examination | ||
| WITN | Application deemed withdrawn, e.g. because no request for examination was filed or no examination fee was paid |