KR20200072020A - 음성인식시스템의 대화 안내 방법 - Google Patents

음성인식시스템의 대화 안내 방법 Download PDF

Info

Publication number
KR20200072020A
KR20200072020A KR1020180159722A KR20180159722A KR20200072020A KR 20200072020 A KR20200072020 A KR 20200072020A KR 1020180159722 A KR1020180159722 A KR 1020180159722A KR 20180159722 A KR20180159722 A KR 20180159722A KR 20200072020 A KR20200072020 A KR 20200072020A
Authority
KR
South Korea
Prior art keywords
user
domain
conversation
recognition system
guiding
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
KR1020180159722A
Other languages
English (en)
Inventor
이경철
조재민
Original Assignee
현대자동차주식회사
기아자동차주식회사
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 현대자동차주식회사, 기아자동차주식회사 filed Critical 현대자동차주식회사
Priority to KR1020180159722A priority Critical patent/KR20200072020A/ko
Priority to US16/413,884 priority patent/US11056113B2/en
Priority to CN201910496395.1A priority patent/CN111301312B/zh
Publication of KR20200072020A publication Critical patent/KR20200072020A/ko
Pending legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60RVEHICLES, VEHICLE FITTINGS, OR VEHICLE PARTS, NOT OTHERWISE PROVIDED FOR
    • B60R16/00Electric or fluid circuits specially adapted for vehicles and not otherwise provided for; Arrangement of elements of electric or fluid circuits specially adapted for vehicles and not otherwise provided for
    • B60R16/02Electric or fluid circuits specially adapted for vehicles and not otherwise provided for; Arrangement of elements of electric or fluid circuits specially adapted for vehicles and not otherwise provided for electric constitutive elements
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K35/00Instruments specially adapted for vehicles; Arrangement of instruments in or on vehicles
    • B60K35/10Input arrangements, i.e. from user to vehicle, associated with vehicle functions or specially adapted therefor
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K35/00Instruments specially adapted for vehicles; Arrangement of instruments in or on vehicles
    • B60K35/20Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor
    • B60K35/26Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor using acoustic output
    • B60K35/265Voice
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K35/00Instruments specially adapted for vehicles; Arrangement of instruments in or on vehicles
    • B60K35/20Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor
    • B60K35/28Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor characterised by the type of the output information, e.g. video entertainment or vehicle dynamics information; characterised by the purpose of the output information, e.g. for attracting the attention of the driver
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60RVEHICLES, VEHICLE FITTINGS, OR VEHICLE PARTS, NOT OTHERWISE PROVIDED FOR
    • B60R16/00Electric or fluid circuits specially adapted for vehicles and not otherwise provided for; Arrangement of elements of electric or fluid circuits specially adapted for vehicles and not otherwise provided for
    • B60R16/02Electric or fluid circuits specially adapted for vehicles and not otherwise provided for; Arrangement of elements of electric or fluid circuits specially adapted for vehicles and not otherwise provided for electric constitutive elements
    • B60R16/037Electric or fluid circuits specially adapted for vehicles and not otherwise provided for; Arrangement of elements of electric or fluid circuits specially adapted for vehicles and not otherwise provided for electric constitutive elements for occupant comfort, e.g. for automatic adjustment of appliances according to personal settings, e.g. seats, mirrors, steering wheel
    • B60R16/0373Voice control
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/16Sound input; Sound output
    • G06F3/167Audio in a user interface, e.g. using voice commands for navigating, audio feedback
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/065Adaptation
    • G10L15/07Adaptation to the speaker
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/26Speech to text systems
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K2360/00Indexing scheme associated with groups B60K35/00 or B60K37/00 relating to details of instruments or dashboards
    • B60K2360/148Instrument input by voice
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K2360/00Indexing scheme associated with groups B60K35/00 or B60K37/00 relating to details of instruments or dashboards
    • B60K2360/16Type of output information
    • B60K2360/161Explanation of functions, e.g. instructions
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K2360/00Indexing scheme associated with groups B60K35/00 or B60K37/00 relating to details of instruments or dashboards
    • B60K2360/16Type of output information
    • B60K2360/164Infotainment
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/225Feedback of the input speech
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/226Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
    • G10L2015/227Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics of the speaker; Human-factor methodology
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/226Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics
    • G10L2015/228Procedures used during a speech recognition process, e.g. man-machine dialogue using non-speech characteristics of application context

Landscapes

  • Engineering & Computer Science (AREA)
  • Mechanical Engineering (AREA)
  • Chemical & Material Sciences (AREA)
  • Combustion & Propulsion (AREA)
  • Transportation (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Artificial Intelligence (AREA)
  • Navigation (AREA)
  • Telephonic Communication Services (AREA)

Abstract

본 발명은 음성인식시스템의 대화 안내 방법에 관한 것으로, 차량의 기능과 상황에 기초하여 사용자에게 최적화된 도메인(이하, 사용자 도메인)을 생성하고, 아울러 정상적으로 인식되지 않아 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 관리하는 음성인식시스템에서 사용자에게 맞춤형 대화를 안내함으로써, 사용자로 하여금 음성인식에 이용되는 음성명령어를 용이하게 인지할 수 있도록 하는 것은 물론 사용자의 상황에 맞는 제안(Proposal)을 통해 사용자의 만족도를 향상시킬 수 있는 음성인식시스템의 대화 안내 방법을 제공하고자 한다.
이를 위하여, 본 발명은 음성인식시스템의 대화 안내 방법에 있어서, 차량에 탑재된 시스템으로부터 수집한 음성인식 기능정보와 상황정보에 기초하여 사용자 도메인을 관리하는 단계; 상기 사용자 도메인을 기반으로 음성인식에 사용되는 대화를 생성하는 단계; 및 상기 생성한 대화를 사용자에게 안내하는 단계를 포함한다.

Description

음성인식시스템의 대화 안내 방법{METHOD FOR GUIDING CONVERSATION IN SPEECH RECOGNITION SYSTEM}
본 발명은 음성인식에 사용되는 대화를 사용자에게 안내하는 기술에 관한 것이다.
음성인식기술은 음성신호로부터 특징을 추출하고, 상기 추출된 특징에 패턴인식 알고리즘을 적용시킨 후 화자가 어떤 음소열 또는 단어열을 발화시켜 발생된 음성신호인가를 역추적하는 기술이다.
최근 들어, 대화체 음성인식의 정확도를 높이기 위한 다양한 방법들이 제안되고 있는데, 화행정보를 이용한 음성인식방법은 1차 음성인식과정에서 얻어진 인식결과를 바탕으로 하여 화행을 추정한 다음, 추정된 화행에 특화된 언어모델을 이용하여 최종 인식결과를 탐색한다. 그런데 이 방법에 따르면 1차 음성인식과정에서 얻어진 인식결과에 수반되는 오류로 인하여 화행추정 오류가 발생하게 되면, 잘못된 최종 인식결과를 도출할 가능성이 높다.
다른 방법으로는 예를 들면, 날씨, 관광 등과 같은 주제(topic) 별로 다수의 도메인을 분류하고, 각 도메인에 대하여 특화된 음향모델과 언어모델을 생성한 다음, 이들을 이용하여 주어진 음성신호를 인식하는 도메인 기반 음성인식기술이 널리 사용되고 있다. 이 방법에 따르면, 음성신호가 입력되면 준비된 복수개의 도메인에 대하여 병렬적으로 음성인식을 수행하여 인식결과를 생성한 다음, 복수개의 인식결과 중 가장 신뢰도가 높은 인식결과를 최종적으로 선택한다.
이러한 도메인 기반의 음성인식기술은 모든 도메인을 대상으로 의미분석을 수행해야 하기 때문에, 도메인의 수가 증가할수록 처리속도가 느려지는 것은 물론 사용자의 음성명령이 중의적 의미로 해석될 가능성이 높아 정확도 높은 결과를 도출하지 못해, 사용자에게 "인식하지 못했습니다. 다시 입력해 주세요" 등과 같은 안내문구를 표시하거나, 예외처리로서 웹검색을 통해 얻은 결과를 제공하게 된다. 이때, 예외처리는 정확도가 낮은 결과를 제공하는 것으로, 예외처리가 많아질수록 음성인식성능에 신뢰성은 떨어지게 된다.
아울러, 도메인의 수가 증가할수록 지원하는 서비스의 수가 증가하게 되고, 이로 인해 각 서비스에 이용되는 음성명령어의 수도 증가하게 되는데, 사용자 입장에서는 이러한 음성명령어를 파악하는데 어려움이 있다.
대한민국등록특허 제10-1675144호
본 발명은 차량의 기능과 상황에 기초하여 사용자에게 최적화된 도메인(이하, 사용자 도메인)을 생성하고, 아울러 정상적으로 인식되지 않아 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 관리하는 음성인식시스템에서 사용자에게 맞춤형 대화를 안내함으로써, 사용자로 하여금 음성인식에 이용되는 음성명령어를 용이하게 인지할 수 있도록 하는 것은 물론 사용자의 상황에 맞는 제안(Proposal)을 통해 사용자의 만족도를 향상시킬 수 있는 음성인식시스템의 대화 안내 방법을 제공하는데 그 목적이 있다.
본 발명의 목적들은 이상에서 언급한 목적으로 제한되지 않으며, 언급되지 않은 본 발명의 다른 목적 및 장점들은 하기의 설명에 의해서 이해될 수 있으며, 본 발명의 실시예에 의해 보다 분명하게 알게 될 것이다. 또한, 본 발명의 목적 및 장점들은 특허 청구 범위에 나타낸 수단 및 그 조합에 의해 실현될 수 있음을 쉽게 알 수 있을 것이다.
상기 목적을 달성하기 위한 본 발명의 방법은, 음성인식시스템의 대화 안내 방법에 있어서, 차량에 탑재된 시스템으로부터 수집한 음성인식 기능정보와 상황정보에 기초하여 사용자 도메인을 관리하는 단계; 상기 사용자 도메인을 기반으로 음성인식에 사용되는 대화를 생성하는 단계; 및 상기 생성한 대화를 사용자에게 안내하는 단계를 포함한다. 이때, 상기 대화는 음성명령어가 바람직하다.
또한, 상기 대화를 생성하는 단계는 예외처리된 음성명령어에 상응하는 기능이 추가된 경우, 상기 음성명령어에 가중치를 부여하여 안내 빈도를 증가시키는 단계를 포함할 수 있다.
또한, 상기 사용자에게 안내하는 단계는 상기 생성한 대화를 음성으로 안내할 수도 있고, 문구로 안내할 수도 있다.
또한, 상기 사용자 도메인은 복수의 메인 도메인을 포함하고, 각 메인 도메인은 복수의 서브 도메인을 포함할 수 있다.
또한, 상기 사용자 도메인을 관리하는 단계는 특정 메인 도메인을 활성화하거나 비활성화하는 단계; 및 특정 서브 도메인을 활성화하거나 비활성화하는 단계를 포함할 수 있다.
또한, 상기 사용자 도메인을 관리하는 단계는 차량에 탑재된 시스템으로부터 수집한 사용자의 선호도 정보에 기초하여 메인 도메인과 서브 도메인의 활성화 여부를 결정하는 단계를 포함할 수 있다.
또한, 상기 활성화 여부를 결정하는 단계는 상기 사용자의 선호도 정보로서 사용자가 설정한 메뉴 우선순위 및 즐겨찾기에 기초하여 메인 도메인과 서브 도메인의 활성화 여부를 결정할 수 있다.
또한, 상기 사용자 도메인을 관리하는 단계는 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 추가 관리하는 단계를 더 포함할 수 있다.
또한, 상기 사용자 도메인을 추가 관리하는 단계는 상기 사용자가 선택한 도메인에 가중치를 부여할 수 있다.
또한, 상기 사용자 도메인을 추가 관리하는 단계는 불명확한 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 예외처리 모델1을 생성하는 단계; 및 미지원 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 예외처리 모델2를 생성하는 단계를 포함할 수 있다.
상기 목적을 달성하기 위한 본 발명의 다른 방법은, 음성인식시스템의 대화 안내 방법에 있어서, 차량에 탑재된 시스템으로부터 차량의 고장정보를 수집하는 단계; 상기 차량의 고장정보에 기초하여 대화를 생성하는 단계; 및 상기 생성한 대화를 사용자에게 안내하는 단계를 포함할 수 있다. 이때, 대화는 제안(Proposal)하는 형태의 시나리오이다.
상기 목적을 달성하기 위한 본 발명의 또 다른 방법은, 음성인식시스템의 대화 안내 방법에 있어서, 차량에 탑재된 시스템과 연동하여 사용자의 스케줄을 관리하는 단계; 상기 스케줄에 상응하는 대화를 생성하는 단계; 및 상기 생성한 대화를 사용자에게 안내하는 단계를 포함할 수 있다. 이때, 대화는 제안(Proposal)하는 형태의 시나리오이다.
본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 방법은, 차량의 기능과 상황에 기초하여 사용자에게 최적화된 도메인(이하, 사용자 도메인)을 생성하고, 아울러 정상적으로 인식되지 않아 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 관리하는 음성인식시스템에서 사용자에게 맞춤형 대화를 안내함으로써, 사용자로 하여금 음성인식에 이용되는 음성명령어를 용이하게 인지할 수 있도록 하는 것은 물론 사용자의 상황에 맞는 제안(Proposal)을 통해 사용자의 만족도를 향상시킬 수 있다.
도 1 은 본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 과정에 대한 개념도,
도 2 는 본 발명의 일 실시예에 따른 복수의 사용자를 대상으로 생성한 사용자 도메인 모델을 나타내는 도면,
도 3 은 본 발명의 일 실시예에 따른 예외처리 관리 모듈의 구성을 나타내는 도면,
도 4 는 본 발명의 제1 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도,
도 5 는 본 발명의 제2 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도,
도 6 은 본 발명의 제3 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도,
도 7 은 본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 방법을 실행하기 위한 컴퓨팅 시스템을 보여주는 블록도이다.
이하, 본 발명의 일부 실시예들을 예시적인 도면을 통해 상세하게 설명한다. 각 도면의 구성요소들에 참조부호를 부가함에 있어서, 동일한 구성요소들에 대해서는 비록 다른 도면상에 표시되더라도 가능한 한 동일한 부호를 가지도록 하고 있음에 유의해야 한다. 또한, 본 발명의 실시예를 설명함에 있어, 관련된 공지 구성 또는 기능에 대한 구체적인 설명이 본 발명의 실시예에 대한 이해를 방해한다고 판단되는 경우에는 그 상세한 설명은 생략한다.
본 발명의 실시예의 구성 요소를 설명하는 데 있어서, 제 1, 제 2, A, B, (a), (b) 등의 용어를 사용할 수 있다. 이러한 용어는 그 구성 요소를 다른 구성 요소와 구별하기 위한 것일 뿐, 그 용어에 의해 해당 구성 요소의 본질이나 차례 또는 순서 등이 한정되지 않는다. 또한, 다르게 정의되지 않는 한, 기술적이거나 과학적인 용어를 포함해서 여기서 사용되는 모든 용어들은 본 발명이 속하는 기술 분야에서 통상의 지식을 가진 자에 의해 일반적으로 이해되는 것과 동일한 의미를 가진다. 일반적으로 사용되는 사전에 정의되어 있는 것과 같은 용어들은 관련 기술의 문맥상 가지는 의미와 일치하는 의미를 가진 것으로 해석되어야 하며, 본 출원에서 명백하게 정의하지 않는 한, 이상적이거나 과도하게 형식적인 의미로 해석되지 않는다.
도 1 은 본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 과정에 대한 개념도로서, 차량에 적용된 음성인식시스템의 프로세서에 대한 기능 블록을 나타낸다.
먼저, 사용자 도메인 분석 모듈(110)은 차량의 기능과 상황(차량에 구비된 시스템의 동작상태)에 기초하여 사용자에게 최적화된 도메인(이하, 사용자 도메인)을 생성하고, 아울러 정상적으로 인식되지 않아 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 관리하는 역할을 수행하는 기능 블록으로서, 차량 기능 분석 모듈(111), 차량 상황 분석 모듈(112), 사용자 도메인 관리 모듈(113), 예외처리 관리 모듈(114)을 구비할 수 있다.
차량 기능 분석 모듈(111)은 기능별 모델 세트(set)를 구성하기 위한 기능 블록으로서, 차량에서 제공하는 음성인식 관련 기능 세트를 구성한다. 즉, 차량에 탑재된 각종 시스템으로부터 음성인식 관련 기능 정보를 수집한다. 예를 들어, 차량의 AVN(Audio Video Nagavigation) 시스템에서 제공하는 음성인식과 관련된 기능에 대한 도메인 세트를 구성할 수 있다.
차량 기능 분석 모듈(111)은 차량 내 시스템에서 지원하는 기능에 따라 메인 도메인과 서브 도메인을 구성할 수 있다. 이때, 지원 기능 세트는 일례로 하기와 같이 구성할 수 있다.
1) Calling 기능 - 지원
2) Messaging 기능 - Android 폰 연결 시 지원, Iphone 연결 시 미지원
3) E-mail 기능 - 미지원
4) Car manual 제공 - 지원
5) Online Music 제공 - 사용자가 Online Music 사이트에 가입하고 연동을 허가한 경우에 지원
차량 기능 분석 모듈(111)은 사용자가 설정한 메뉴 우선순위 및 즐겨찾기 등과 같은 사용자의 선호도를 반영하여 도메인을 구성할 수 있다. 예를 들어, 우선순위가 높은 메뉴에 해당하거나 즐겨찾기에 포함된 기능에 상응하는 도메인의 가중치를 높일 수 있다. 참고로, 가중치가 높은 도메인일수록 음성인식 결과로 도출될 가능성이 높아진다.
차량 기능 분석 모듈(111)은 차량에 탑재된 시스템이 제공하는 음성인식 기능의 추가 및 삭제를 관리하는 기능 관리 모듈을 포함할 수 있다. 따라서, 차량 기능 분석 모듈(111)은 실시간으로 차량에 탑재된 시스템이 제공하는 음성인식 기능을 분석할 수 있다.
차량 기능 분석 모듈(111)은 차량에 탑재된 시스템이 제공하는 음성인식 기능의 추가 및 삭제가 발생하면 이를 사용자 도메인 관리 모듈(113)에 알릴 수 있다.
차량 상황 분석 모듈(112)은 상황별 모델 세트(set)를 구성하기 위한 기능 블록으로서, 차량에 탑재된 각종 시스템으로부터 차량의 상황정보를 수집할 수 있다. 예를 들어, 주행상태(정차, 주차), 내비게이션 설정 상태(목적지, 등록지점, 즐겨찾기 등), 정보(스포츠, 뉴스, 날씨 등) 수신 상태, 폰 연결 상태(폰북, 콜 히스토리, 즐겨찾기, 데이터 다운로드) 등과 같은 상황정보를 수집할 수 있다.
차량 상황 분석 모듈(112)은 주행상태에 따른 각 메인 도메인 및 각 서브 도메인의 사용빈도를 분석하여 각 메인 도메인 및 각 서브 도메인에 가중치를 부여할 수 있다.
일례로, 사용자가 주행중에 자주 사용하는 도메인의 사용빈도가 Communication 50%, Media 30%, 뉴스 10%, 내비게이션 10% 라면, 그 사용빈도에 따라 가중치를 부여할 수 있다. 이때, 가중치가 0 인 도메인은 주행중에 디스에이블(Disable) 된다.
다른 예로, 사용자가 정차시 자주 사용하는 도메인의 사용빈도가 내비게이션 검색 50%, 지식 검색 30%, 뉴스 20% 라면, 그 사용빈도에 따라 가중치를 부여할 수 있다. 이때, 가중치가 0 인 도메인은 주행중에 디스에이블(Disable) 된다.
또 다른 예로, 폰이 연결되지 않은 상황에는 Communication 도메인이 비활성화 처리되며, 주행중 전화 사용빈도에 따라 해당 Communication 도메인 및 서브 도메인의 가중치를 부여할 수 있다.
차량 상황 분석 모듈(112)은 상술한 상황들을 복합적으로 분석하여 메인 도메인 및 서브 도메인의 활성화 여부를 결정하고, 아울러 가중치를 부여할 수 있다.
차량 상황 분석 모듈(112)은 차량 네트워크 및 차량에 탑재된 시스템을 통해 차량의 고장정보, 차량의 위치정보, 현재 시간정보, 경로탐색정보(목적지 정보) 등을 수집할 수 있다.
차량 상황 분석 모듈(112)은 스마트폰이 연결된 경우, 스마트폰에 저장된 기념일 정보와 전화번호, 이름 등을 수집할 수도 있다.
사용자 도메인 관리 모듈(113)은 사용자 도메인을 관리하는 기능 블록으로서, 사용자 도메인 모델을 주기적으로 관리한다.
도 1에 도시된 바와 같이, 사용자 도메인 모델은 Communication 도메인, Navigation 도메인, Media 도메인, Knowledge 도메인, 뉴스 도메인, 스포츠 도메인, 날씨 도메인 등을 포함할 수 있다. 이때, Communication 도메인은 서브 도메인으로서 Calling, Messaging, E-mail을 포함할 수 있고, Navigation 도메인은 서브 도메인으로서 POI(Position Of Interest)/Address, Parking, Traffic을 포함할 수 있고, Media 도메인은 서브 도메인으로서 Radio, Local Music, Online music을 포함할 수 있고, Knowledge 도메인은 서브 도메인으로서 POI Knowledge, General, Car manual을 포함할 수 있다. 이때, 메인 도메인으로서 뉴스 도메인과 스포츠 도메인 및 날씨 도메인은 디스에이블 상태이고, 서브 도메인으로서 E-Mail, Radio, General 역시 디스에이블 상태이다.
사용자 도메인 관리 모듈(113)은 서버에 구축되는 경우, 복수의 사용자를 대상으로 해당 사용자에 최적화된 사용자 도메인 모델을 생성 및 관리할 수 있다. 즉, 사용자 도메인 관리 모듈(113)은 도 2에 도시된 바와 같이 제2 사용자 도메인 모델이 저장된 고객 DB2, 제3 사용자 도메인 모델이 저장된 고객 DB3 등을 생성 및 관리할 수 있다.
예외처리 관리 모듈(114)은 정상적으로 인식되지 않아 예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 관리하기 위한 기능 블록으로서, 미지원 도메인, 불병확한 명령어로 분류되어 예외처리된 케이스에 대해 자료를 수집할 수 있다.
예외처리 관리 모듈(114)은 상기 수집된 자료를 기준으로 지원 가능한 도메인 중에서 미지원 명령어 또는 지원 가능하지만 명확하지 않은 발화에 대해 코퍼스(Corpus)를 수집하고, 이를 이용하여 미지원 명령어와 불명확 명령어를 구분함으로써, 미지원 명령어로 구분된 명령어 발화시 사용자에게 이에 대한 안내를 제공할 수 있다.
예외처리 관리 모듈(114)은 불명확하게 발화하여 예외처리된 결과에서 사용자의 선택이 있는 경우 해당 도메인에 대해 추가 가중치를 부여하여 해당 도메인에서 의미분석이 수행될 수 있도록 한다.
예를 들어, '스타벅스 찾아줘', '스타벅스 길안내', '스타벅스 어디야' 등과 같이 각 도메인별로 자연어에 대한 의도파악을 위한 메인 키워드가 있어야 해당 도메인을 인식할 수 있다. 단순히 '스타벅스는?'은 사용자 발화가 어떤 의도를 의미하는지 알 수 있는 어휘가 없다. 이러한 경우 예외처리가 이루어지는데, 이때 사용자가 예외처리된 결과에서 지도검색을 선택하거나 내비게이션을 통해 스타벅스를 검색하면, 예외처리 관리 모듈(114)은 내비게이션 도메인에 가중치를 부여할 수 있다. 이로 인해 추후 '스타벅스는?'이 입력되면 곧바로 내비게이션 길안내가 이루어질 수 있다.
예외처리 관리 모듈(114)은 미지원 명령어를 발화하여 예외처리된 결과에서 사용자의 선택이 있는 경우 해당 도메인에 대해 추가 가중치를 부여하여 해당 도메인에서 의미분석이 수행될 수 있도록 한다.
예를 들어, 사용자가 '봄 하늘'이라 명확하게 발화하였지만 의도 파악이 안되는 경우, 날씨 도메인의 봄 날씨 및 검색 도메인의 미세먼지 정보를 제공하고, 사용자가 날씨를 선택하면, 날씨 도메인에 가중치를 부여하여 추후 '봄 하늘'이 입력되면 봄 날씨가 제공되도록 할 수 있다. 이를 확장하여 '가을 하늘', '여름 비 소식' 등과 같이 유사한 발화가 발생해도 날씨 도메인을 통해 가을 날씨, 여름 날씨 가 제공되도록 할 수 있다.
결국, 예외처리 관리 모듈(144)은 사용자의 음성명령에 따른 서비스 결과가 사용자의 의도에 맞지 않는 경우, 사용자의 선택에 기초하여 사용자 도메인을 관리하는 역할을 수행한다.
일정 관리 모듈(115)은 차량 상황 분석 모듈(112)에 의해 수집된 차량의 고장정보, 차량의 위치정보, 현재 시간정보, 경로탐색정보(목적지 정보), 기념일 정보, 전화번호 및 이름 등에 기초하여 사용자의 일정을 관리할 수 있다.
다음으로, 전처리 모듈(120)은 사용자로부터 입력받은 음성의 노이즈를 제거한다.
다음으로, 음성 인식부(130)는 입력된 음성신호로부터 사용자가 발화한 음성을 인식하고, 그 인식 결과를 출력한다. 음성인식부(120)에서 출력되는 인식결과는 텍스트 형태의 발화문일 수 있다.
음성 인식부(130)는 음성인식엔진(Automatic Speech Recognition, ASR)을 포함하고, 음성인식엔진은 입력된 음성에 음성인식 알고리즘을 적용하여 사용자가 발화한 음성을 인식하고, 인식결과를 생성할 수 있다.
이때, 입력된 음성은 음성인식을 위한 더 유용한 형태로 변환될 수 있는바, 음성신호로부터 시작지점과 끝지점을 검출하여 입력된 음성에 포함된 실제 음성 구간을 검출한다. 이를 EPD(End Point Detection)이라 한다. 그리고, 검출된 구간 내에서 켑스트럼(Cepstrum), 선형 예측 코딩(Linear Predictive Coefficient: LPC), MFCC(Mel Frequency Cepstral Coefficient) 또는 필터 뱅크 에너지(Filter Bank Energy) 등의 특징 벡터 추출 기술을 적용하여 입력된 음성의 특징 벡터를 추출할 수 있다. 그리고, 추출된 특징 벡터와 훈련된 기준 패턴과의 비교를 통하여 인식 결과를 얻을 수 있다. 이를 위해, 음성의 신호적인 특성을 모델링하여 비교하는 음향 모델(Acoustic Model) 과 인식 어휘에 해당하는 단어나 음절 등의 언어적인 순서 관계를 모델링하는 언어 모델(Language Model)이 사용될 수 있다.
음성 인식부(130)는 음성을 인식함에 있어 어느 방식을 사용해도 무방하다. 예를 들어, 히든 마르코프 모델이 적용된 음향 모델을 사용할 수도 있고, 음향 모델과 음성 모델을 통합한 N-best 탐색법을 사용할 수 있다. N-best 탐색법은 음향 모델과 언어 모델을 이용하여 N개까지의 인식 결과 후보를 선택한 후, 이들 후보의 순위를 재평가함으로써 인식 성능을 향상시킬 수 있다.
음성 인식부(130)는 인식 결과의 신뢰성을 확보하기 위해 신뢰값(confidence value)을 계산할 수 있다. 신뢰값은 음성 인식 결과에 대해서 그 결과를 얼마나 믿을 만한 것인가를 나타내는 척도이다. 일례로, 인식된 결과인 음소나 단어에 대해서, 그 외의 다른 음소나 단어로부터 그 말이 발화되었을 확률에 대한 상대값으로 정의할 수 있다. 따라서, 신뢰값은 0 에서 1 사이의 값으로 표현할 수도 있고, 0 에서 100 사이의 값으로 표현할 수도 있다.
신뢰값이 미리 설정된 임계값(threshold)을 초과하는 경우에는 인식 결과를 출력하여 인식 결과에 대응되는 동작이 수행되도록 할 수 있고, 신뢰값이 임계값 이하인 경우에는 인식 결과를 거절(rejection)할 수 있다.
음성 인식부(120)의 인식 결과인 텍스트 형태의 발화문은 NUL(Natural Language Understanding) 엔진(140)으로 입력된다.
NLU 엔진(140)은 자연어 이해 기술을 적용하여 발화 언어에 포함된 사용자의 발화 의도를 파악할 수 있다. 즉, NLU 엔진(140)은 발화 언어의 의미를 분석할 수 있다.
NLU 엔진(140)은 텍스트 형태의 발화문에 대해 형태소 분석을 수행한다. 형태소는 의미의 최소 단위로서, 더 이상 세분화할 수 없는 가장 작은 의미 요소를 나타낸다. 따라서, 형태소 분석은 자연어 이해의 첫 단계로서, 입력 문자열을 형태소열로 바꿔준다.
NLU 엔진(140)은 형태소 분석 결과에 기초하여 발화문으로부터 도메인을 추출한다. 도메인은 사용자 발화언어의 주제를 식별할 수 있는 것으로서, 예를 들어, 경로 안내, 날씨 검색, 교통 검색, 일정 관리, 주유 안내, 공조 제어 등의 다양한 주제를 나타내는 도메인이다.
NLU 엔진(140)은 발화문으로부터 개체명을 인식할 수 있다. 개체명은 인명, 지명, 조직명, 시간, 날짜, 화폐 등의 고유 명사로서, 개체명 인식은 문장에서 개체명을 식별하고 식별된 개체명의 종류를 결정하는 작업이다. 개체명 인식을 통해 문장에서 중요한 키워드를 추출하여 문장의 의미를 파악할 수 있다.
NLU 엔진(140)은 발화문이 갖는 화행을 분석할 수 있다. 화행 분석은 사용자 발화에 대한 의도를 분석하는 작업으로, 사용자가 질문을 하는 것인지, 요청을 하는 것인지, 단순한 감정 표현을 하는 것인지 등에 관한 문장의 의도를 파악하는 것이다.
NLU 엔진(140)은 사용자의 발화 의도에 대응하는 액션을 추출한다. 발화문에 대응되는 도메인, 개체명, 화행 등의 정보에 기초하여 사용자의 발화 의도를 파악하고, 발화 의도에 대응되는 액션을 추출한다.
NLU 엔진(140)의 처리 결과는 예를 들어, 발화문에 대응되는 도메인과 키워드를 포함할 수 있으며, 형태소 분석 결과, 개체명, 액션 정보, 화행 정보 등을 더 포함할 수도 있다.
다음으로, 도메인 처리 모듈(150)은 NLU 엔진(140)에서 참조할 사용자 도메인 모델 및 예외처리 모델을 선정한다. 여기서, 예외처리 모델은 예외처리 관리 모듈(113)이 관리하는 모델로서, 도 3에 도시된 바와 같이 불명확한 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 생성한 예외처리 모델1과 미지원 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 생성한 예외처리 모델2를 의미한다.
도메인 처리 모듈(150)은 NLU 엔진(140)에 의해 인식된 결과(일례로, Intent: search Music, Slot: 봄 및 드라이브)를 기반으로 정보처리 결과를 제안하거나 서비스를 제안하거나 상기 인식된 결과를 미지원 도메인으로 판단하거나 불명확 명령어로 판단할 수 있다.
다음으로, 서비스 처리 모듈(160)은 도메인 처리 모듈(150)의 처리 결과에 기초하여 검색을 추천하거나 데이터 검색을 수행하거나 서비스를 제안하거나 예외처리를 수행한다.
서비스 처리 모듈(160)은 CP(Contents Provider, 170)로부터 컨텐츠를 획득하여 사용자에게 제공할 수 있다.
서비스 처리 모듈(160)은 예외처리로서 웹 검색(180)을 수행할 수 있다. 이때, 예외처리에 따른 사용자의 최종 선택(190)은 예외처리 관리 모듈(114)로 전달되어 예외처리 모델을 생성하는데 이용될 수 있다.
서비스 대화 생성 모듈(200)은 초기 사용법 등에 대한 기능별 기본 시나리오를 생성하고, 상기 생성한 기능별 기본 시나리오를 음성으로 변환(TTS, Text To Speech)하며, 상기 생성한 기능별 기본 시나리오를 문구(sentence)로 생성할 수 있다.
예를 들어, 기본 시나리오는 "가까운 스타벅스 가자", "오늘의 주요 뉴스 알려줘', "오늘 서울 날씨 알려줘" 등을 포함할 수 있다.
서비스 대화 생성 모듈(200)은 헬프(help) 모드에 대한 시나리오로서, "가까운 스타벅스 가자", "서울역 근처 맛집 알려줘", "가장 싼 SK 주유소 알려줘" 등을 제공할 수 있다.
서비스 대화 생성 모듈(200)은 가중치가 내비게이션 도메인, 음악 도메인, 날씨 도메인의 순서로 높은 경우, 기본 시나리오로서 "강변 드라이브 코스 알려줘", "드라이브하면서 듣기 좋은 노래 알려줘", "목적지 주변의 날씨 어때? 등을 포함할 수 있다.
서비스 대화 생성 모듈(200)은 사용자 도메인 관리 모듈(113)에 의해 관리되고 있는 사용자 도메인 모델에 기초하여 사용자 모델 시나리오를 생성하고, 상기 생성한 사용자 모델 시나리오를 음성으로 변환하고, 상기 생성한 사용자 모델 시나리오를 문구로 생성할 수 있다.
예를 들어, 사용자 도메인 모델에 스포츠 도메인이 포함된 경우, 사용자 모델 시나리오는 'LAD(Los Angeles Dodgers) 야구 스코어는?", "오늘 LAD 야구 일정은?", "오늘 LAD 야구장 날씨는?" 등을 포함할 수 있다.
서비스 대화 생성 모듈(200)은 기본 시나리오에 상응하는 음성을 스피커를 통해 사용자에게 제공하고, 기본 시나리오에 상응하는 문구를 디스플레이를 통해 사용자에게 제공할 수 있다.
서비스 대화 생성 모듈(200)은 사용자 모델 시나리오에 상응하는 음성을 스피커를 통해 사용자에게 제공할 수 있고, 사용자 모델 시나리오에 상응하는 문구를 디스플레이를 통해 사용자에게 제공할 수 있다.
서비스 대화 생성 모듈(200)은 예외처리 관리 모듈(114)에 의해 수집된 자료를 기반으로 예외처리된 명령어 및 시나리오에 대한 기능이 추가된 경우, 상기 명령어 및 시나리오에 가중치를 부여하여 안내 빈도를 높일 수도 있다.
서비스 대화 생성 모듈(200)은 차량 상황 분석 모듈(112)에 의해 수집된 차량의 고장정보에 기초하여 차량에 고장이 발생한 경우, 서비스 대화를 생성할 수 있다.
예를 들어, 서비스 대화는 "타이어 압력이 낮아졌어요. 가까운 정비소로 안내해 드릴까요?", 차량의 엔진오일을 교체할 시기입니다. 서비스 센터로 안내해 드릴까요?" 등을 포함할 수 있다.
서비스 대화 생성 모듈(200)은 일정 관리 모듈(115)에 의해 관리되는 사용자의 스케쥴에 기초하여 서비스 대화를 생성할 수도 있다.
예를 들어, 서비스 대화는 "오늘 아내분의 생일인데, 가까운 베이커리로 안내할까요?", "3시에 회의가 있는 삼성동까지 도착하지 못할 것 같아요. 30분 늦을 거 같다고 김철수씨에게 메시지를 보낼까요?" 등을 포함할 수 있다.
도 4 는 본 발명의 제1 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도로서, 음성인식시스템에 구비된 프로세서 또는 별도의 프로세서에 의해 수행될 수 있다.
먼저, 차량에 탑재된 시스템으로부터 수집한 음성인식 기능정보와 상황정보에 기초하여 사용자 도메인을 관리한다(401). 즉, 전체 도메인 중에서 차량의 음성인식 기능과 상황에 따라 선택된 도메인(사용자 도메인)을 실시간으로 관리한다.
이후, 상기 사용자 도메인을 기반으로 음성인식에 사용되는 대화를 생성한다(402). 즉, 사용자 도메인 중에서 임의로 또는 가중치에 기초하여 도메인을 선택하고, 해당 도메인에 상응하는 대화를 생성한다. 이때, 대화는 음성명령어일 수 있다. 예를 들어, 날씨 도메인이 선택된 경우, 음성명령어는 "오늘 서울 날씨 알려줘" 등이 될 수 있다.
이후, 상기 생성한 대화를 사용자에게 안내한다(403). 이때, 상기 생성한 대화를 안내하는 시점은 사용자가 음성명령어 입력을 위해 PPT(Push To Talk) 버튼을 누른 경우, 사용자가 헬프(Help) 모드로 진입한 경우 등이 될 수 있다.
이후, 예외처리된 음성명령어에 상응하는 기능이 추가된 경우, 상기 음성명령어에 가중치를 부여하여 안내 빈도를 증가시키는 단계
도 5 는 본 발명의 제2 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도로서, 음성인식시스템에 구비된 프로세서 또는 별도의 프로세서에 의해 수행될 수 있다.
먼저, 차량에 탑재된 시스템으로부터 차량의 고장정보를 수집한다(501). 여기서, 고장정보는 긴급한 고장과 긴급하지 않은 고장으로 구분할 수 있으며, 긴급하지 않은 고장은 타이어 압력, 램프 단선 등을 포함할 수 있고, 긴급한 고장은 엔진 경고등 점등, 시동꺼짐 등을 포함할 수 있다.
이후, 상기 차량의 고장정보에 기초하여 대화를 생성한다(502). 일례로, 시동꺼짐의 경우, "지정된 정비센터에 전화할까요?", "견인차량을 호출할까요?" 등이 될 수 있다.
이후, 상기 생성한 대화를 사용자에게 안내한다(503). 이때, 대화는 지시하는 음성명령어라기 보다는 제안하는 형태의 시나리오이다.
도 6 은 본 발명의 제3 실시예에 따른 음성인식시스템의 대화 안내 방법에 대한 흐름도로서, 음성인식시스템에 구비된 프로세서 또는 별도의 프로세서에 의해 수행될 수 있다.
먼저, 차량에 탑재된 시스템과 연동하여 사용자의 스케줄을 관리한다(601).
이후, 상기 스케줄에 상응하는 대화를 생성한다(602). 즉, 일정이 도래하거나 일정이 도래하기 직전에 제안하는 형태의 대화(시나리오)를 생성한다.
예를 들어, 일정이 도래한 경우(기념일 등)의 대화는 "오늘 아내분의 생일인데, 가까운 베이커리로 안내할까요?"가 될 수 있고, 일정이 도래하기 직전(약속시간 등)의 대화는 "3시에 회의 장소인 삼성동까지 도착하지 못할 것 같아요. 30분 늦을 것 같다고 김철수씨에게 메시지 보낼까요?"가 될 수 있다. 이때, 김철수씨의 전화번호는 사용자의 폰북에서 확인할 수 있다.
이후, 상기 생성한 대화를 사용자에게 안내한다(603). 이때, 대화는 지시하는 음성명령어라기 보다는 제안하는 형태의 시나리오이다.
도 7 은 본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 방법을 실행하기 위한 컴퓨팅 시스템을 보여주는 블록도이다.
도 7은 참조하면, 상술한 본 발명의 일 실시예에 따른 음성인식시스템의 대화 안내 방법은 컴퓨팅 시스템을 통해서도 구현될 수 있다. 컴퓨팅 시스템(1000)은 시스템 버스(1200)를 통해 연결되는 적어도 하나의 프로세서(1100), 메모리(1300), 사용자 인터페이스 입력 장치(1400), 사용자 인터페이스 출력 장치(1500), 스토리지(1600), 및 네트워크 인터페이스(1700)를 포함할 수 있다.
프로세서(1100)는 중앙 처리 장치(CPU) 또는 메모리(1300) 및/또는 스토리지(1600)에 저장된 명령어들에 대한 처리를 실행하는 반도체 장치일 수 있다. 메모리(1300) 및 스토리지(1600)는 다양한 종류의 휘발성 또는 불휘발성 저장 매체를 포함할 수 있다. 예를 들어, 메모리(1300)는 ROM(Read Only Memory) 및 RAM(Random Access Memory)을 포함할 수 있다.
따라서, 본 명세서에 개시된 실시예들과 관련하여 설명된 방법 또는 알고리즘의 단계는 프로세서(1100)에 의해 실행되는 하드웨어, 소프트웨어 모듈, 또는 그 2 개의 결합으로 직접 구현될 수 있다. 소프트웨어 모듈은 RAM 메모리, 플래시 메모리, ROM 메모리, EPROM 메모리, EEPROM 메모리, 레지스터, 하드 디스크, SSD(Solid State Drive), 착탈형 디스크, CD-ROM과 같은 저장 매체(즉, 메모리(1300) 및/또는 스토리지(1600))에 상주할 수도 있다. 예시적인 저장 매체는 프로세서(1100)에 커플링되며, 그 프로세서(1100)는 저장 매체로부터 정보를 판독할 수 있고 저장 매체에 정보를 기입할 수 있다. 다른 방법으로, 저장 매체는 프로세서(1100)와 일체형일 수도 있다. 프로세서 및 저장 매체는 주문형 집적회로(ASIC) 내에 상주할 수도 있다. ASIC는 사용자 단말기 내에 상주할 수도 있다. 다른 방법으로, 프로세서 및 저장 매체는 사용자 단말기 내에 개별 컴포넌트로서 상주할 수도 있다.
이상의 설명은 본 발명의 기술 사상을 예시적으로 설명한 것에 불과한 것으로서, 본 발명이 속하는 기술 분야에서 통상의 지식을 가진 자라면 본 발명의 본질적인 특성에서 벗어나지 않는 범위에서 다양한 수정 및 변형이 가능할 것이다.
따라서, 본 발명에 개시된 실시예들은 본 발명의 기술 사상을 한정하기 위한 것이 아니라 설명하기 위한 것이고, 이러한 실시예에 의하여 본 발명의 기술 사상의 범위가 한정되는 것은 아니다. 본 발명의 보호 범위는 아래의 청구범위에 의하여 해석되어야 하며, 그와 동등한 범위 내에 있는 모든 기술 사상은 본 발명의 권리범위에 포함되는 것으로 해석되어야 할 것이다.
110: 사용자 도메인 분석 모듈
120: 전처리 모듈
130: 음성 인식부
140: NLU 엔진
150: 도메인 처리 모듈
160: 서비스 처리 모듈
200: 서비스 대화 생성 모듈

Claims (12)

  1. 차량에 탑재된 시스템으로부터 수집한 음성인식 기능정보와 상황정보에 기초하여 사용자 도메인을 관리하는 단계;
    상기 사용자 도메인을 기반으로 음성인식에 사용되는 대화를 생성하는 단계; 및
    상기 생성한 대화를 사용자에게 안내하는 단계
    를 포함하는 음성인식시스템의 대화 안내 방법.
  2. 제 1 항에 있어서,
    상기 대화는,
    음성명령어인 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  3. 제 2 항에 있어서,
    상기 대화를 생성하는 단계는,
    예외처리된 음성명령어에 상응하는 기능이 추가된 경우, 상기 음성명령어에 가중치를 부여하여 안내 빈도를 증가시키는 단계
    를 포함하는 음성인식시스템의 대화 안내 방법.
  4. 제 1 항에 있어서,
    상기 사용자에게 안내하는 단계는,
    상기 생성한 대화를 음성으로 안내하는 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  5. 제 1 항에 있어서,
    상기 사용자에게 안내하는 단계는,
    상기 생성한 대화를 문구로 안내하는 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  6. 제 1 항에 있어서,
    상기 사용자 도메인은,
    복수의 메인 도메인을 포함하고, 각 메인 도메인은 복수의 서브 도메인을 포함하는 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  7. 제 6 항에 있어서,
    상기 사용자 도메인을 관리하는 단계는,
    특정 메인 도메인을 활성화하거나 비활성화하는 단계; 및
    특정 서브 도메인을 활성화하거나 비활성화하는 단계
    를 포함하는 음성인식시스템의 대화 안내 방법.
  8. 제 6 항에 있어서,
    상기 사용자 도메인을 관리하는 단계는,
    차량에 탑재된 시스템으로부터 수집한 사용자의 선호도 정보에 기초하여 메인 도메인과 서브 도메인의 활성화 여부를 결정하는 단계
    를 포함하는 음성인식시스템의 대화 안내 방법.
  9. 제 8 항에 있어서,
    상기 활성화 여부를 결정하는 단계는,
    상기 사용자의 선호도 정보로서 사용자가 설정한 메뉴 우선순위 또는 즐겨찾기에 기초하여 메인 도메인과 서브 도메인의 활성화 여부를 결정하는 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  10. 제 1 항에 있어서,
    상기 사용자 도메인을 관리하는 단계는,
    예외처리된 결과에 대한 사용자의 선택을 반영하여 상기 사용자 도메인을 추가 관리하는 단계
    를 더 포함하는 음성인식시스템의 대화 안내 방법.
  11. 제 10 항에 있어서,
    상기 사용자 도메인을 추가 관리하는 단계는,
    상기 사용자가 선택한 도메인에 가중치를 부여하는 것을 특징으로 하는 음성인식시스템의 대화 안내 방법.
  12. 제 10 항에 있어서,
    상기 사용자 도메인을 추가 관리하는 단계는,
    불명확한 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 예외처리 모델1을 생성하는 단계; 및
    미지원 명령어의 예외처리 결과에 대한 사용자의 선택에 기초하여 예외처리 모델2를 생성하는 단계
    를 포함하는 음성인식시스템의 대화 안내 방법.
KR1020180159722A 2018-12-12 2018-12-12 음성인식시스템의 대화 안내 방법 Pending KR20200072020A (ko)

Priority Applications (3)

Application Number Priority Date Filing Date Title
KR1020180159722A KR20200072020A (ko) 2018-12-12 2018-12-12 음성인식시스템의 대화 안내 방법
US16/413,884 US11056113B2 (en) 2018-12-12 2019-05-16 Conversation guidance method of speech recognition system
CN201910496395.1A CN111301312B (zh) 2018-12-12 2019-06-10 语音识别系统的会话引导方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
KR1020180159722A KR20200072020A (ko) 2018-12-12 2018-12-12 음성인식시스템의 대화 안내 방법

Publications (1)

Publication Number Publication Date
KR20200072020A true KR20200072020A (ko) 2020-06-22

Family

ID=71072830

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020180159722A Pending KR20200072020A (ko) 2018-12-12 2018-12-12 음성인식시스템의 대화 안내 방법

Country Status (3)

Country Link
US (1) US11056113B2 (ko)
KR (1) KR20200072020A (ko)
CN (1) CN111301312B (ko)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2021261664A1 (ko) * 2020-06-23 2021-12-30 주식회사 오투오 인공지능 음성 대화 기반의 관광서비스시스템

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112307072A (zh) * 2019-07-26 2021-02-02 沃尔沃汽车公司 车用智能使用手册系统
CN112787899B (zh) * 2021-01-08 2022-10-28 青岛海尔特种电冰箱有限公司 设备语音交互方法、计算机可读存储介质以及冰箱
GB202211620D0 (en) * 2022-08-09 2022-09-21 Oakspire Ltd Automated speech recognition to support context-aware intent recognition
CN118410134A (zh) * 2023-10-27 2024-07-30 北京字跳网络技术有限公司 用于创建数字助手的方法、装置、设备和存储介质
CN118136016B (zh) * 2024-04-10 2025-02-18 广州小鹏汽车科技有限公司 语音交互方法、服务器及计算机可读存储介质
WO2026044067A1 (en) * 2024-08-21 2026-02-26 Cerence Operating Company Automotive assistant with hierarchy having a backbone and domain-specific delegees

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR101675144B1 (ko) 2010-08-24 2016-11-10 현대모비스 주식회사 음성 인식 안내 시스템 및 방법

Family Cites Families (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7949529B2 (en) * 2005-08-29 2011-05-24 Voicebox Technologies, Inc. Mobile systems and methods of supporting natural language human-machine interactions
KR101325756B1 (ko) * 2006-08-21 2013-11-08 주식회사 팬택 유무선 환경의 디지털 권한 관리 데이터를 사용자도메인에서 사용 가능하도록 임포트 하는 방법
JP2008064885A (ja) * 2006-09-05 2008-03-21 Honda Motor Co Ltd 音声認識装置、音声認識方法、及び音声認識プログラム
US7765312B2 (en) * 2007-03-12 2010-07-27 Telefonaktiebolaget L M Ericsson (Publ) Applying policies for managing a service flow
DE102007036425B4 (de) * 2007-08-02 2023-05-17 Volkswagen Ag Menügesteuertes Mehrfunktionssystem insbesondere für Fahrzeuge
US8140335B2 (en) * 2007-12-11 2012-03-20 Voicebox Technologies, Inc. System and method for providing a natural language voice user interface in an integrated voice navigation services environment
US20110307250A1 (en) * 2010-06-10 2011-12-15 Gm Global Technology Operations, Inc. Modular Speech Recognition Architecture
US10475447B2 (en) * 2016-01-25 2019-11-12 Ford Global Technologies, Llc Acoustic and domain based speech recognition for vehicles
US10297254B2 (en) * 2016-10-03 2019-05-21 Google Llc Task initiation using long-tail voice commands by weighting strength of association of the tasks and their respective commands based on user feedback
US10325592B2 (en) * 2017-02-15 2019-06-18 GM Global Technology Operations LLC Enhanced voice recognition task completion
US11113473B2 (en) * 2018-04-02 2021-09-07 SoundHound Inc. Interpreting expressions having potentially ambiguous meanings in different domains
US11704533B2 (en) * 2018-05-23 2023-07-18 Ford Global Technologies, Llc Always listening and active voice assistant and vehicle operation
US10878805B2 (en) * 2018-12-06 2020-12-29 Microsoft Technology Licensing, Llc Expediting interaction with a digital assistant by predicting user responses

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR101675144B1 (ko) 2010-08-24 2016-11-10 현대모비스 주식회사 음성 인식 안내 시스템 및 방법

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2021261664A1 (ko) * 2020-06-23 2021-12-30 주식회사 오투오 인공지능 음성 대화 기반의 관광서비스시스템

Also Published As

Publication number Publication date
US20200193984A1 (en) 2020-06-18
CN111301312A (zh) 2020-06-19
US11056113B2 (en) 2021-07-06
CN111301312B (zh) 2024-05-31

Similar Documents

Publication Publication Date Title
US11056113B2 (en) Conversation guidance method of speech recognition system
US12308027B1 (en) Device naming-indicator generation
EP1936606B1 (en) Multi-stage speech recognition
KR102414456B1 (ko) 대화 시스템, 이를 포함하는 차량 및 유고 정보 처리 방법
US10229671B2 (en) Prioritized content loading for vehicle automatic speech recognition systems
US7016849B2 (en) Method and apparatus for providing speech-driven routing between spoken language applications
US11508367B2 (en) Dialogue system and dialogue processing method
CN102097096B (zh) 在语音识别后处理过程中使用音调来改进识别精度
KR102869070B1 (ko) 음성인식시스템의 도메인 관리 방법
KR102915192B1 (ko) 대화 시스템, 대화 처리 방법 및 전자 장치
CN109920410B (zh) 用于基于车辆的环境确定推荐的可靠性的装置和方法
US10741178B2 (en) Method for providing vehicle AI service and device using the same
KR20200000155A (ko) 대화 시스템 및 이를 이용한 차량
KR20200006739A (ko) 대화 시스템, 이를 포함하는 차량 및 대화 처리 방법
KR20210120286A (ko) 대화 시스템, 그를 가지는 차량 및 대화 시스템의 제어 방법
KR20200004054A (ko) 대화 시스템 및 대화 처리 방법
US8626506B2 (en) Method and system for dynamic nametag scoring
US11756550B1 (en) Integration of speech processing functionality with organization systems
KR20200095636A (ko) 대화 시스템이 구비된 차량 및 그 제어 방법
CN111798842B (zh) 对话系统和对话处理方法
US20080147400A1 (en) Adapting a language model to accommodate inputs not found in a directory assistance listing
KR20250043811A (ko) 음성 인식 시스템을 평가하기 위한 방법 및 장치
KR20250001013A (ko) 음성 인식 기반 검색 결과 제공 방법 및 이를 위한 전자 장치
KR102787014B1 (ko) 대화 시스템, 이를 포함하는 차량 및 대화 처리 방법
KR102956765B1 (ko) 대화 시스템 및 대화 처리 방법

Legal Events

Date Code Title Description
PA0109 Patent application

St.27 status event code: A-0-1-A10-A12-nap-PA0109

R18-X000 Changes to party contact information recorded

St.27 status event code: A-3-3-R10-R18-oth-X000

R18-X000 Changes to party contact information recorded

St.27 status event code: A-3-3-R10-R18-oth-X000

PG1501 Laying open of application

St.27 status event code: A-1-1-Q10-Q12-nap-PG1501

PN2301 Change of applicant

St.27 status event code: A-3-3-R10-R13-asn-PN2301

St.27 status event code: A-3-3-R10-R11-asn-PN2301

A201 Request for examination
PA0201 Request for examination

St.27 status event code: A-1-2-D10-D11-exm-PA0201

D13-X000 Search requested

St.27 status event code: A-1-2-D10-D13-srh-X000

E902 Notification of reason for refusal
PE0902 Notice of grounds for rejection

St.27 status event code: A-1-2-D10-D21-exm-PE0902

B15 Application refused following examination

Free format text: ST27 STATUS EVENT CODE: N-2-6-B10-B15-EXM-PE0601 (AS PROVIDED BY THE NATIONAL OFFICE)

PE0601 Decision on rejection of patent

St.27 status event code: N-2-6-B10-B15-exm-PE0601

E12 Pre-grant re-examination requested

Free format text: ST27 STATUS EVENT CODE: A-2-3-E10-E12-REX-PX0901 (AS PROVIDED BY THE NATIONAL OFFICE)

E13 Pre-grant limitation requested

Free format text: ST27 STATUS EVENT CODE: A-2-3-E10-E13-LIM-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

E13-X000 Pre-grant limitation requested

St.27 status event code: A-2-3-E10-E13-lim-X000

P11 Amendment of application requested

Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P11-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13 Application amended

Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P13-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

PX0901 Re-examination

St.27 status event code: A-2-3-E10-E12-rex-PX0901