이하, 도면을 참조하여, 본 발명의 실시의 형태를 설명한다.
이하에 나타내는 제 1 및 제 2의 실시 형태에 관한 음성 입력 처리 장치는, 예를 들면 차량에 탑재되는 음향 영상 장치(예를 들면, 디스플레이·오디오(DA) 장치)로서 실현될 수 있으나, 본 발명은, 이에 한하지 않고, 복수의 일반 기기의 동작을 음성 커맨드에 의해 제어하는 음성 입력 처리 장치에 넓게 적용할 수 있다.
<제 1 실시 형태>
먼저, 본 발명의 제 1의 실시 형태에 관한 음성 입력 처리 장치에 대하여 설명한다.
도 1은, 본 발명의 제 1의 실시 형태에 관한 음성 입력 처리 장치를 이용한 차량에 탑재된 시스템의 구성을 나타내는 도이다.
음성 입력 처리 장치(10)는, 차량(이하, 호스트 차량이라 한다)의 내부에 탑재되어, 처리 장치(100)와, 기억 장치(102)와, 호스트 차량 내에 반입된 제 1 외부 기기(110), 제 2 외부 기기(112), 제 3 외부 기기(114) 및 제 4 외부 기기(116)와 통신하기 위한 통신 인터페이스(통신 INF)(104) 등, 을 포함한다.
여기에서, 제 1 ~ 제 4 외부 기기(110 ~ 116)는, 예를 들면 스마트폰 등의 다기능 휴대 단말, 혹은 휴대용 PC(Personal Computer) 등의 휴대 단말인 것으로 할 수 있다. 제 1 ~ 4 외부 기기(110 ~ 116)는, 각각, 음성 입력 처리 장치(10)와 통신하기 위한 통신 인터페이스(통신 INF)(120,122,124,126)와, 처리 장치(130,132,134,136) 등, 을 구비한다.
제 1 및 제 2 외부 기기(110,112)의 처리 장치(130,132)는, 각각의 외부 기기가 구비된 마이크로폰(도시하지 않음)으로부터 입력되는 음성 또는 통신 INF(120,122)를 통해 입력되는 음성을 인식하는 음성 인식 유닛(140,142)과, 각각의 외부 기기가 구비된 기능을 제어하는 기능 제어 유닛(144,146)을 구비한다. 또한, 제 3 및 제 4 외부 기기(114,116)의 처리 장치(134,136)는, 각각의 외부 기기가 구비된 기능을 제어하는 기능 제어 유닛(150,152)을 구비한다.
본 실시 형태에서는, 제 1 외부 기기(110)는, 예를 들면 다기능 휴대 기기 iPhone(등록 상표)이며, 음성 입력 처리 장치(10)와의 사이가, 블루투스(Bluetooth)와 라이트닝(Lightening)(등록 상표) 케이블로 접속되어 있다. 또한, 제 2 외부 기기(112)는, 예를 들면 다기능 휴대 기기 넥서스(Nexus)(등록 상표)이며, 음성 입력 처리 장치(10)와의 사이가, 블루투스(Bluetooth)와 USB 케이블로 접속되어 있다. 또한, 제 3 외부 기기(114) 및 제 4 외부 기기(116)와 음성 입력 처리 장치(10)와의 사이는, 각각 USB 케이블 및 블루투스(Bluetooth)로 접속되어 있다.
또한, 본 실시 형태에서는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 넷의 외부 기기가 음성 입력 처리 장치(10)에 접속되는 것으로 했지만, 이에 한정하지 않고, 음성 입력 처리 장치(10)에는 임의의 수의 외부 기기가 접속되는 것으로 할 수 있다.
음성 입력 처리 장치(10)는, 또한, 통신 INF(104)를 통해, 호스트 차량에 설치된 전자 제어 유닛(ECU, Electronic Control Unit)(160a, 160b)과 통신(예를 들면, CAN(Controller Area Network) 버스 통신)을 실시한다. ECU(160a, 160b)는, 호스트 차량이 구비된 기능의 일부(예를 들면, 창문의 개폐, 와이퍼의 온오프, 헤드 램프의 점등 등)를 실행한다. 또한, 본 실시 형태에서는 ECU(160a, 160b)의 둘의 ECU가 음성 입력 처리 장치(10)에 접속되는 것으로 했지만, 이에 한정하지 않고, 음성 입력 처리 장치(10)에는 임의의 수의 ECU가 접속되는 것으로 할 수 있다.
음성 입력 처리 장치(10)는, 또한, 통신 INF(104)를 통해 외부 서버(도시하지 않음)와 통신할 수 있으며, 예를 들면, 외부 서버에 입력 음성을 송신하고, 당해 외부 서버가 실시하는 당해 입력 음성에 대한 음성 인식의 결과를 당해 외부 서버로부터 수신할 수 있다.
음성 입력 처리 장치(10)는, 게다가, 차량에 탑재된 마이크로폰(170), 스피커(172), 디스플레이(174), 조작 스위치(176) 등의 휴먼 인터페이스 디바이스와 통신하기 위한 HMI 인터페이스(HMI-INF)(106)도 가지고 있다.
디스플레이(174)는, 예를 들면 터치 패널(도시하지 않음)을 구비한 액정 표시 디스플레이를 포함하는 것으로 할 수 있다. 음성 입력 처리 장치(10)는, HMI-INF(106)를 통해, 사용자가 디스플레이(174)의 터치 패널에 입력한 정보나 커맨드를 수신할 수 있다.
조작 스위치(176)는, 내비게이션 유닛(204), ECU(160a, 160b), 제 1 ~ 제 4 외부 기기(110 ~ 116)의 동작에 관한 지시 정보를 사용자가 입력하기 위한 하나 또는 복수의 스위치에 의해 구성되어 있다. 또한, 조작 스위치(176)는, 디스플레이(174)에 표시되는 터치 패널에 의해 온·오프되는 버튼에 의해 구성되는 것으로 할 수도 있다.
더하여, 이하에서는, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 패널을 통해 입력되는 내비게이션 유닛(204), ECU(160a, 160b), 제 1 ~ 제 4 외부 기기(110 ~ 116)의 동작에 관한 지시 정보를, 동작 지시 정보라 칭한다. 또한, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 패널(도시하지 않음)은, 사용자의 조작에 의해 정보가 입력되는 조작 입력부에 대응한다.
제 1 ~ 제 4 외부 기기(110 ~ 116)가 구비된 처리 장치(130 ~ 136)는, 예를 들면, CPU(Central Processing Unit) 등의 프로세서, 프로그램이 기록된 ROM(Read Only Memory), 데이터의 일시 기억을 위한 RAM(Random Access Memory) 등을 갖는 컴퓨터이며, 음성 인식 유닛(140)과 기능 제어 유닛(144), 음성 인식 유닛(142)과 기능 제어 유닛(146), 기능 제어 유닛(150), 및 기능 제어 유닛(152)은, 각각, 예를 들면 컴퓨터에 있는 처리 장치(130 ~ 136)가 컴퓨터·프로그램을 실행함으로써 실현된다.
도 2는, 본 실시 형태에 관한 음성 입력 처리 장치(10)의 구성을 나타내는 도이다. 본 음성 입력 처리 장치(10)의 처리 장치(100)는, 예를 들면, CPU 등의 프로세서, 프로그램이 기록된 ROM, 데이터의 일시 기억을 위한 RAM 등을 갖는 컴퓨터이며, 전체 제어 유닛(200)과, 오디오 유닛(202)과, 내비게이션 유닛(204)과, 제 1 외부 기기 제어 유닛(206)과, 제 2 외부 기기 제어 유닛(208), 을 갖고 있다. 처리 장치(100)가 갖는 상기 각 유닛은, 예를 들면 컴퓨터인 처리 장치(100)가 컴퓨터·프로그램을 실행함으로써 실현된다.
전체 제어 유닛(200)은, 주 음성 인식 유닛(210)과 커맨드 처리 유닛(212)을 구비한다. 주 음성 인식 유닛(210)은, HMI-INF(106)를 통해 마이크로폰(170)으로부터 입력된 음성을 기억 장치(102)에 기억시킴과 동시에, 당해 입력된 음성(입력 음성)에 대해 음성 인식 처리를 실행하여, 당해 입력 음성으로부터 커맨드를 추출한다.
커맨드 처리 유닛(212)은, 조작 스위치(176)로부터 입력되는 동작 지시 정보에 기초해, HMI-INF(106)를 통해 마이크로폰(170)으로부터 취득된 음성을, 주 음성 인식 유닛(210), 오디오 유닛(202), 내비게이션 유닛(204), 제 1 외부 기기 제어 유닛(206), 및/또는 제 2 외부 기기 제어 유닛(208) 중 어느 하나에 선택적으로 입력함과 동시에, 디스플레이(174)의 터치 패널로부터 입력되는 동작 지시 정보를, 오디오 유닛(202), 내비게이션 유닛(204), 제 1 외부 기기 제어 유닛(206), 및/또는 제 2 외부 기기 제어 유닛(208)의 어느 하나에 선택적으로 입력한다.
또한, 커맨드 처리 유닛(212)은, 주 음성 인식 유닛(210)에 의해 추출된 커맨드와, HMI-INF(106)를 통해 조작 스위치(176) 및/또는 디스플레이(174)의 터치 패널로부터 취득되는 동작 지시 정보, 에 기초하여, 상기 추출된 커맨드 및 상기 동작 지시 정보에 의해 특정되는 동작의 실행을, 오디오 유닛(202), 내비게이션 유닛(204), ECU(160a, 160b), 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 하나에 지시한다. 여기에서, 커맨드 처리 유닛(212)에 의한 상기 동작의 실행 지시는, 당해 지시를 위한 신호(동작 지시 신호)를 당해 동작에 관련하는 유닛 또는 기기(오디오 유닛(202), 내비게이션 유닛(204), ECU(160a, 160b), 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 하나)에 출력하는 것, 및/또는 기억 장치(102)에 기억시킨 입력 음성을 당해 동작에 관련하는 유닛 또는 기기(오디오 유닛(202), 내비게이션 유닛(204) 또는 제 1, 제 2 외부 기기(110,112)의 어느 하나)에 출력함으로써 이루어진다.
커맨드 처리 유닛(212)은, 또한, 제 1 ~ 제 4 외부 기기(110 ~ 114)로부터 출력되는 소리 정보 및/또는 화상 정보를, HMI-INF(106)를 통해 스피커(172) 및/또는 디스플레이(174)에 출력하는 기능을 갖는다.
오디오 유닛(202)은, 처리 장치(100)가 애플리케이션 프로그램을 실행함으로써 실현되어, 음성 인식 유닛(216)과 음악 재생 유닛(218)을 구비한다. 음성 인식 유닛(216)은, HMF-INF(106)을 통해 마이크로폰(170)으로부터 입력되는 입력 음성, 또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 부여되는 입력 음성에 대해 음성 인식 처리를 실시해, 당해 입력 음성에 포함되는 동작 지시를 추출한다.
음악 재생 유닛(218)은, 음성 인식 유닛(216)이 추출한 동작 지시, 및/또는 조작 스위치(176) 혹은 디스플레이(174)의 터치 패널로부터 입력되는 동작 지시 정보, 및/또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 주어지는 동작 신호에 기초하여, 상기 동작 지시, 동작 지시 정보, 및/또는 작동 신호가 나타내는 악곡의 지정 및 재생 방법의 지정 등(이퀄라이저 설정, 반복 재생 등)에 따라, 예를 들면 기억 장치(102)에 미리 기억된 악곡 중에서 당해 지정된 악곡을 재생하고, 제 1 ~ 제 4 외부 기기(110 ~ 116)에 당해 지정된 악곡의 재생을 지시하여, 재생된 당해 악곡을 HMI-INF(106)를 통해 스피커(172)로 출력한다. 즉, 오디오 유닛(202)은, 악곡 재생을 실시하는 기기로서 동작하는 것 외에, 악곡 재생을 실시할 제 1 ~ 제 4 외부 기기와의 사이에서 신호 수수(授受)를 실시하는 플랫폼으로서도 기능한다.
내비게이션 유닛(204)은, 처리 장치(100)가 애플리케이션 프로그램을 실행함으로써 실현되어, 음성 인식 유닛(222)과 경로 탐색 유닛(224)을 구비한다. 음성 인식 유닛(222)은, HMF-INF(106)을 통해 마이크로폰(170)으로부터 입력되는 입력 음성, 또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 부여되는 입력 음성에 대해 음성 인식 처리를 실시해, 당해 입력 음성에 포함되는 동작 지시를 추출한다.
경로 탐색 유닛(224)은, 음성 인식 유닛(222)이 추출한 동작 지시, 및/또는 조작 스위치(176) 혹은 디스플레이(174)의 터치 패널로부터 입력되는 동작 지시 정보, 및/또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 부여되는 동작 신호에 기초하여, 상기 동작 지시, 동작 지시 정보, 및/또는 동작 신호가 나타내는 목적지까지의 경로를 탐색하고, 디스플레이(174) 등을 이용하여 당해 경로에 대한 안내를 실시한다.
경로 탐색 유닛(224)은, 또한, 제 1 ~ 제 4 외부 기기(110 ~ 116)가 실시한 경로 탐색의 결과를 디스플레이(174) 등으로 출력하기 위한 플랫폼으로서도 기능한다.
제 1 외부 기기 제어 유닛(206), 및 제 2 외부 기기 제어 유닛(208)은, 음성 입력 처리 장치(10)에 접속되는 외부 기기의 동작을 제어하는 플랫폼이며, 처리 장치(100)가 애플리케이션 프로그램을 실행함으로써 실현된다.
제 1 외부 기기 제어 유닛(206)은, 예를 들면 다기능 휴대 단말 iPhone(등록 상표)의 동작을 제어하는 카플레이(CarPlay)(등록 상표) 시스템의 플랫폼이며, 음성 인식 유닛(228)과, 기기 통신 처리 유닛(230), 을 구비한다. 음성 인식 유닛(228)은, HMF-INF(106)을 통해 마이크로폰(170)으로부터 입력되는 입력 음성, 또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 주어지는 입력 음성에 대해 음성 인식 처리를 실시해, 그 입력 음성에 포함되는 동작 지시를 추출한다.
기기 통신 처리 유닛(230)은, 음성 인식 유닛(228)이 추출한 동작 지시, 및/또는 조작 스위치(176) 혹은 디스플레이(174)의 터치 패널로부터 입력되는 동작 지시 정보, 및/또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 주어지는 동작 신호에 기초하여, 상기 동작 지시, 동작 지시 정보, 및/또는 동작 신호가 나타내는 동작을, 예를 들면 라이트닝(Lightning)(등록 상표) 케이블 접속 인터페이스인 제 3 통신 INF(244)(후술)를 통해, 예를 들면 다기능 휴대 단말 아이폰(iPhone)(등록 상표)인 제 1 외부 기기(110)에 지시한다.
기기 통신 처리 유닛(230)은, 또한, 예를 들면 제 1 외부 기기(110)로부터 출력되는 소리 정보 및/또는 화상 정보를, HMI-INF(106)를 통해 스피커(172) 및/또는 디스플레이(174)에 출력하는 기능을 갖는다.
제 2 외부 기기 제어 유닛(208)은, 예를 들면 다기능 휴대 단말 넥서스(Nexus)(등록 상표)의 동작을 제어하는 안드로이드 오토(Android Auto)(등록 상표) 시스템의 플랫폼이며, 음성 인식 유닛(234)과, 기기 통신 처리 유닛(236), 을 구비한다. 음성 인식 유닛(234)은, HMF-INF(106)을 통해 마이크로폰(170)으로부터 입력되는 입력 음성, 또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 부여되는 입력 음성에 대해 음성 인식 처리를 실시해, 당해 입력 음성에 포함되는 동작 지시를 추출한다.
기기 통신 처리 유닛(236)은, 음성 인식 유닛(234)이 추출한 동작 지시, 및/또는 조작 스위치(176) 혹은 디스플레이(174)의 터치 패널로부터 입력되는 동작 지시 정보, 및/또는 전체 제어 유닛(200)의 커맨드 처리 유닛(212)으로부터 부여되는 동작 신호를 바탕으로, 상기 동작 지시, 동작 지시 정보, 및/또는 동작 신호가 나타내는 동작을, 예를 들면 USB 통신 인터페이스인 제 4 통신 INF(246)(후술), 또는 예를 들면 블루투스(Bluetooth)(등록 상표) 통신 인터페이스인 제 2 통신 INF(242)(후술)을 통해, 예를 들면 다기능 휴대 단말 넥서스(Nexus)(등록 상표)인 제 2 외부 기기(112)에 지시한다.
기기 통신 처리 유닛(236)은, 또한, 예를 들면 제 2 외부 기기(112)로부터 출력되는 소리 정보 및/또는 화상 정보를, HMI-INF(106)를 통해 스피커(172) 및/또는 디스플레이(174)에 출력하는 기능을 갖는다.
여기에서, 전체 제어 유닛(200)이 구비하는 주 음성 인식 장치(210)는, 제 1의 음성 인식부에 대응하고, 오디오 유닛(202), 내비게이션 유닛(204), 제 1 및 제 2 외부 기기 제어 유닛(206, 208)이 구비하는 음성 인식 유닛(216, 222, 228, 234)은, 제 2의 음성 인식부에 대응한다.
통신 INF(104)는, 외부 서버와 무선 통신을 통해 통신하기 위한 무선 통신 인터페이스인 제 1 통신 INF(240)와, 예를 들면 블루투스(Bluetooth)(등록 상표) 통신 인터페이스인 제 2 통신 INF(242)와, 예를 들면 다기능 휴대 단말 아이폰(iPhone)(등록 상표)와 통신하기 위한 라이트닝(Lightning)(등록 상표) 케이블 접속 인터페이스인 제 3 통신 INF(244)와, 예를 들면 USB 통신 인터페이스인 제 4 통신 INF(246)와 ECU(160a, 160b)와 통신하기 위한 예를 들면 캔(CAN) 인터페이스인 제 5 통신 INF(248), 을 가지고 있다.
또한, 본 실시 형태에서는, 기재를 구체적인 것으로서 이해를 용이하게 하기 위해, 일례로서, 제 1 외부 기기 제어 유닛(206)을 카플레이(CarPlay)(등록 상표) 시스템의 플랫폼, 제 2 외부 기기 제어 유닛(206)을 안드로이드 오토(Android Auto)(등록 상표) 시스템의 플랫폼, 제 1 외부 기기(110)를 다기능 휴대 단말 아이폰(iPhone)(등록 상표), 제 2 외부 기기(112)를 다기능 휴대 단말 넥서스(Nexus)(등록 상표), 제 2 통신 INF(242)을 블루투스(Bluetooth)(등록 상표) 통신 인터페이스, 제 3 통신 INF(244)을 라이트닝(Lightning)(등록 상표) 케이블 접속 인터페이스, 제 4 통신 INF(246)를 USB 통신 인터페이스, 인 것으로 했다. 이를 위해, 카플레이(CarPlay)(등록 상표) 시스템의 플랫폼인 제 1 외부 기기 제어 유닛(206)은, 라이트닝(Lightning)(등록 상표) 케이블 접속 인터페이스인 제 3 통신 INF(244)을 통해서만 아이폰(iPhone)(등록 상표)인 제 1 외부 기기(110)와 통신을 실시하고, 안드로이드 오토(Android Auto)(등록 상표) 시스템의 플랫폼인 제 2 외부 기기 제어 유닛(206)은, 블루투스(Bluetooth)(등록 상표) 통신 인터페이스인 제 2 통신 INF(242), 또는 USB 통신 인터페이스인 제 4 통신 INF(246)을 통해, 다기능 휴대 단말 넥서스(Nexus)(등록 상표)인 제 2 외부 기기(112)와 통신한다.
그러나, 이에 한정하지 않고, 제 1 외부 기기 제어 유닛(206), 및 제 2 외부 기기 제어 유닛(208)은, 음성 입력 처리 장치(10)에 접속되는 외부 기기의 동작을 제어하는 플랫폼인 한, 제 2 ~ 제 4 통신 INF(242 ~ 246) 등의 종류가 다른 복수의 통신 인터페이스를 통해, 각각 하나 이상의 외부 기기와의 접속을 실시하는 것으로 할 수 있다.
이하, 본 실시 형태의 음성 입력 처리 장치(10)가 실시하는 음악 재생 동작과 내비게이션 동작을 예로 들어, 처리 장치(100)에서의 동작을 더 설명한다.
음악 재생 동작을 실시할 때에는, 도 3에 나타낸 바와 같이, 당해 음악 동작을 실시하게 하는 기기 또는 유닛의 선택, 당해 기기와의 사이의 신호의 접속 경로의 선택 등에 대해, 이하와 같은 사항에 대한 선택을 실시할 필요가 있다.
(A1) 음악 재생을 실시하게 하는 기기 또는 유닛(이하, 총칭하여 「음악 재생 기기」라고도 함)에 대한 선택지로서, 오디오 유닛(202), 제 1 외부 기기(110), 제 2 외부 기기(112), 제 3 외부 기기(114), 제 4 외부 기기(116)가 존재할 수 있다.
(A2) 음악 재생 기기와의 사이의 신호의 접속 경로는, 사용하는 플랫폼(사용 플랫폼)에 대한 선택지와, 통신 인터페이스에 대한 선택지, 에서 규정된다.
(A2-1) 사용 플랫폼에 대한 선택지로서, 오디오 유닛(202), 제 1 외부 기기 제어 유닛(206), 제 2 외부 기기 제어 유닛(208)이 존재할 수 있다.
(A2-2) 통신 인터페이스의 선택지로서, 제 2 통신 INF(242)(예를 들면 블루투스(Bluetooth) 통신 인터페이스), 제 3 통신 INF(244)(예를 들면 라이트닝(Lightning) 케이블 통신 인터페이스), 제 4 통신 INF(246)(예를 들면 USB 통신 인터페이스)가 존재할 수 있다.
(A3) 음악 재생 기기에 대해, 음성 커맨드를 사용하는지 아닌지, 및 사용할 경우는, 어느 유닛 또는 외부 기기가 갖는 음성 인식 기능을 이용하는가, 에 대한 선택지가 존재할 수 있다.
(A4) 재생하는 악곡(개별의 악곡의 곡명이나, 악곡 앨범의 명칭 등)에 대한 선택지가 존재할 수 있다. 또한, 도 3에 있어서, 도시한 표의 가장 오른쪽란의 「재생 악곡명」란에서의 선택지로서 나타낸 「악곡 1」「악곡 2」등은, 임의의 악곡명인 것으로 할 수 있다.
사용자는, 음악 재생의 실행 지시와, 상기 각 사항의 선택에 대해 지정을, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 스크린에 의해 입력하는 동작 지시 정보의 적어도 일부, 및/또는 음성 커맨드를 이용하는 경우에는 당해 음성 커맨드의 적어도 일부로서, 전체 제어 유닛(200)에 입력할 수 있다(예를 들면, 재생하는 악곡의 지정을 음성 커맨드의 내용의 적어도 일부로서 입력하고, 그 외 사항의 선택지의 지정을 동작 지시 정보의 적어도 일부로서 입력할 수 있다).
음성 입력 처리 장치(10)의 전체 제어 유닛(200)은, 동작 지시 정보의 적어도 일부 및/또는 음성 커맨드의 적어도 일부에 의해 입력된 상기 각 사항의 선택지의 지정을 바탕으로, 오디오 유닛(202)에 의해 또는 제 1 ~ 제 4 외부 기기(110 ~ 116) 중 하나를 이용하여, 지정된 악곡의 재생을 실시한다. 또한, 전체 제어 유닛(200)은, 예를 들면 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 학습 모드 동작이 지정될 때는, 지정된 악곡의 곡명과, 악곡 재생 동작의 내용을 나타내는 동작 정보(예를 들면, 동작 지시 정보의 적어도 일부 및/또는 음성 커맨드의 적어도 일부에 의해 입력된 상기 각 사항의 선택지의 지정)를, 동작 이력으로서 기억 장치(102)에 기억한다.
도 4는, 음악 재생 동작에 관한 동작 이력의 일례를 나타내는 도이다. 도시된 표의 가장 오른쪽의 두 열에 나타낸 바와 같이, 동작 이력에는, 도 3에 나타내는 항목 외에, 같은 악곡이 같은 선택지 지정을 이용하여 재생된 횟수(도 4의 표의 오른쪽으로부터 두 번째의 「빈도」열), 및 그 악곡이 그 선택지 지정을 이용하여 최후로 재생된 일시(도 4의 표의 가장 우측의 「최종 사용일」열) 등의, 다른 항목도 포함할 수 있다.
도 4의 표에 있어서, 예를 들면 「곡명 1」의 행에 의해, 당해 「곡명 1」의 악곡이, 예를 들면 라이트닝(Lightning) 케이블 통신 인터페이스인 제 3 통신 INF(244)을 통해 접속된(도시된 표의 왼쪽으로부터 네 번째의 열 참조), ID1-001의 식별 코드(도시된 표의 왼쪽으로부터 두 번째의 열 참조)를 가지는 제 1 외부 기기(110), 예를 들면 아이폰(iPhone)(등록 상표) 기기에 의해, 제 1 외부 기기 제어 유닛(206)이 제공하는 플랫폼(예를 들면, 카플레이(CarPlay) 시스템의 플랫폼)을 통해 제공된 것을 알 수 있다(도시된 표의 왼쪽으로부터 세 번째의 열 참조). 또한, 당해 제공에 있어서, 제 1 외부 기기 제어 유닛(206)이 제공하는 음성 인식 기능이 이용되어진 것(도시된 표의 왼쪽으로부터 다섯 번째의 열 참조), 이 재생 동작이 2015년 11월 1일의 8시 3분에 이루어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 재생 동작이 과거 10회 이루어진 것(도시된 표의 오른쪽으로부터 두 번째의 열 참조), 을 알 수 있다.
또한, 도 4의 표에 있어서, 예를 들면 「곡명 2」의 행에 의해, 당해 「곡명 2」의 악곡이, 예를 들면 USB 통신 인터페이스인 제 4 통신 INF(246)을 통해 접속된(도시된 표의 왼쪽으로부터 네 번째의 열 참조), ID2-002의 식별 코드(도시된 표의 왼쪽으로부터 두 번째의 열 참조)를 가지는 제 2 외부 기기(112), 예를 들면 넥서스(Nexus)(등록 상표) 기기에 의해, 제 2 외부 기기 제어 유닛(208)이 제공하는 플랫폼(예를 들면, 안드로이드 오토(Android Auto) 시스템의 플랫폼)을 통해 제공된 것을 알 수 있다(도시된 표의 왼쪽으로부터 세 번째의 열 참조). 또한, 당해 제공에 있어서, 제 2 외부 기기 제어 유닛(208)이 제공하는 음성 인식 기능이 이용된 것(도시된 표의 왼쪽으로부터 다섯 번째의 열 참조), 이 재생 동작이 2015년 11월 1일 12시 31분에 이루어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 재생 동작이 과거 3회 이루어진 것(도시된 표의 오른쪽으로부터 두 번째의 열 참조),을 알 수 있다.
또한, 도 4의 표에 있어서, 예를 들면 「곡명 100」의 행에 의해, 당해 「곡명 100」의 악곡이, 예를 들면 블루투스(Bluetooth) 통신 인터페이스인 제 2 통신 INF(242)을 통해 접속된(도시된 표의 왼쪽으로부터 네 번째의 열 참조), ID2-006의 식별 코드(도시된 표의 왼쪽으로부터 두 번째의 열 참조)를 갖는 다른 제 2 외부 기기(112), 예를 들면 넥서스(Nexus)(등록 상표) 기기에 의해, 오디오 유닛(202)이 제공하는 플랫폼을 통해 제공된 것을 알 수 있다(도시된 표의 왼쪽으로부터 세 번째의 열 참조). 또한, 당해 제공에 있어서, ID2-006의 식별 코드를 갖는 제 2 외부 기기(112) 자신이 갖는 음성 인식 기능이 이용된 것(도시된 표의 왼쪽으로부터 다섯 번째의 열 참조), 이 재생 동작이 2015년 10월 26일의 18시 12분에 이루어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 재생 동작이 과거 15회 이루어진 것(도시된 표의 오른쪽으로부터 두 번째의 열 참조), 을 알 수 있다.
도 4에 나타낸 바와 같이 동작 이력을 기억한 후, 전체 제어 유닛(200)은, 사용자가 음성에 의해 특정의 악곡의 재생을 지정했을 때는, 예를 들면 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 운용 모드 동작이 지정되어 있는 것을 조건으로, 주 음성 인식 유닛(210)에 의해 당해 음성에 대한 음성 인식을 실시하여 당해 악곡을 추출하고, 당해 악곡이 포함되어 있는 동작 정보를 상기 동작 이력으로부터 추출하여, 당해 추출한 동작 정보가 나타내는 각 선택지의 지정에 따라 상기 지정된 악곡의 재생을 실시한다.
이에 의해, 본 실시 형태의 음성 입력 처리 장치(10)에서는, 간략화된 음성 커맨드(예를 들면, 재생을 희망하는 악곡의 곡명만을 지정하는 음성 커맨드)의 사용을 가능하게 하고, 또한 음성 입력 처리 장치가 구비하는 음성 인식 기능(예를 들면, 음성 인식 유닛(210, 216, 222, 228, 234)가 실시하는 음성 인식 기능)이나 외부 기기가 구비하는 음성 인식 기능(예를 들면, 제 1, 제 2 외부 기기(110, 112)의 음성 인식 유닛(140, 142)에 의한 음성 인식 기능)의 동작 경합을 방지하여 이들 기능의 실행을 적절하게 관리할 수 있다.
마찬가지로, 내비게이션 동작을 실시할 때에는, 도 5에 나타낸 바와 같이, 당해 내비게이션 동작을 실시하게 하는 기기 또는 유닛의 선택, 당해 장비와의 사이의 신호의 접속 경로의 선택 등에 대해, 이하와 같은 사항에 대한 선택을 실시할 필요가 있다.
(B1) 내비게이션 재생을 실시하게 하는 기기 또는 유닛(이하, 총칭하여 「내비게이션 실행 기기」라고도 함)에 대한 선택지로서, 내비게이션 유닛(204), 제 1 통신 기기(110), 제 2 통신 기기(112), 제 3 통신 기기(114), 제 4 통신 기기(116)가 존재할 수 있다.
(B2) 내비게이션 실행 기기가 제 1 ~ 제 4 외부 기기(110 ~ 118) 중 어느 것인 경우에는, 이들 내비게이션 실행 기기와의 사이의 신호의 접속 경로가, 사용하는 플랫폼(사용 플랫폼)에 대한 선택지와, 통신 인터페이스에 대한 선택지, 로 규정될 수 있다.
(B2-1) 사용 플랫폼에 대한 선택지로서, 내비게이션 유닛(204), 제 1 외부 기기 제어 유닛(206), 제 2 외부 기기 제어 유닛(208)이 존재할 수 있다.
(B2-2) 통신 인터페이스의 선택지로서, 제 2 통신 INF(242)(예를 들면 블루투스 통신 인터페이스), 제 3 통신 INF(244)(예를 들면 라이트닝 케이블 통신 인터페이스), 제 4 통신 INF(246)(예를 들면 USB 통신 인터페이스)가 존재할 수 있다.
(B3) 내비게이션 실행 기기에 대해, 음성 커맨드를 사용하는지 아닌지, 및 사용할 경우는, 어느 유닛 또는 외부 기기가 갖는 음성 인식 기능을 이용하는지, 에 대한 선택지가 존재할 수 있다.
(B4) 내비게이션에서의 경로 탐색에 이용하는 목적지에 대한 선택지나, 경로 탐색의 조건(거리 우선, 시간 우선 등)이 존재할 수 있다. 또한, 도 5에 있어서, 도시된 표의 가장 오른쪽란의 「목적지」란에서의 선택지로서 나타낸 「지명 1」「지명 2」 등은, 임의의 지명인 것으로 할 수 있다.
사용자는, 내비게이션 동작의 실행 지시와, 상기 각 사항의 선택지에 대하여 지정을, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 스크린에 의해 입력하는 동작 지시 정보의 적어도 일부, 및/또는 음성 커맨드를 이용할 경우에는 당해 음성 커맨드의 적어도 일부로서, 전체 제어 유닛(200)에 입력할 수 있다(예를 들면, 경로 탐색에 이용되는 목적지의 지정을 음성 커맨드의 내용의 적어도 일부로서 입력하고, 그 외 사항의 선택지의 지정을 동작 지시 정보의 적어도 일부로서 입력할 수 있다).
음성 입력 처리 장치(10)의 전체 제어 유닛(200)은, 동작 지시 정보의 적어도 일부 및/또는 음성 커맨드의 적어도 일부에 의해 입력된 상기 각 사항의 선택지의 지정에 기초하여, 음성 입력 처리 장치 또는 외부 기기의 어느 것을 이용하여, 지정된 목적지까지의 경로를 탐색하고, 및 탐색한 경로까지의 안내를 실시한다. 또한, 전체 제어 유닛(200)은, 예를 들면 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 학습 모드 동작이 지정되어 있을 경우는, 지정된 목적지와, 내비게이션 동작의 내용을 나타내는 동작 정보(예를 들면, 동작 지시 정보의 적어도 일부 및/또는 음성 커맨드의 적어도 일부에 의해 입력된 상기 각 사항의 선택지의 지정)를, 동작 이력으로서 기억 장치(102)에 기억한다.
도 6은, 내비게이션 동작에 관한 동작 이력의 일례를 나타내는 도이다. 도시된 표의 가장 오른쪽의 두 열에 나타낸 바와 같이, 동작 이력에는, 도 5로 나타낸 항목의 외에도, 같은 목적지의 내비게이션 동작이 같은 선택지 지정을 이용하여 실시된 횟수(도 6의 표의 오른쪽으로부터 두 번째의 「빈도」열), 및 그 목적지에 대한 내비게이션 동작이 그 선택지 지정을 이용하여 최후로 실시된 일시(도 6의 표의 가장 우측의 「최종 사용일」열) 등의, 그 외 항목도 포함할 수 있다.
도 6의 표에 있어서, 예를 들면 「지명 a」의 행에 의해, 당해 「지명 a」에 대한 내비게이션 동작이, 내비게이션 유닛(204)을 이용하여 실행될 수 있는 것을 알 수 있다(도시된 표의 왼쪽으로부터 두 번째의 열 참조). 또한, 당해 제공에 있어서, 내비게이션 유닛(204)이 갖는 음성 인식 기능이 이용되어진 것(도시된 표의 왼쪽으로부터 다섯 번째의 열 참조), 이 내비게이션 동작이 2015년 11월 1일의 8시 3분에 실시되어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 내비게이션 동작이 과거 10회 이루어진 것(도시된 표의 오른쪽으로부터 두 번째의 열 참조),를 알 수 있다.
또한, 도 6의 표에 있어서, 예를 들면 「지명 b」의 행에 의해, 당해 「지명 b」에 대한 내비게이션 동작이, 예를 들면 라이트닝(Lightning) 케이블 통신 인터페이스인 제 3 통신 INF(244)을 통해 접속된(도시된 표의 왼쪽으로부터 네 번째의 열 참조), ID1-001의 식별 코드(도시된 표의 왼쪽으로부터 2번째의 열 참조)를 가지는 제 1 외부 기기(110), 예를 들면 아이폰(iPhone)(등록 상표) 기기에 의해, 제 1 외부 기기 제어 유닛(206)이 제공하는 플랫폼(예를 들면, 카플레이(CarPlay) 시스템의 플랫폼)에 의해 실행된 것을 알 수 있다(도시된 표의 왼쪽으로부터 3번째의 열 참조). 또한, 당해 내비게이션 동작의 실행에 있어서, 제 1 외부 기기 제어 유닛(206)이 제공하는 음성 인식 기능이 이용되어진 것(도시된 표의 왼쪽으로부터 5번째의 열 참조), 이 내비게이션 동작이 2015년 11월 1일의 12시 31분에 이루어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 내비게이션 동작이 과거 3회 이루어진 것(도시된 표의 오른쪽으로부터 2번째의 열 참조), 을 알 수 있다.
또한, 도 6의 표에 있어서, 예를 들면 「지명 c」의 행에 의해, 당해 「지명 c」에 대한 내비게이션 동작이, 예를 들면 USB 통신 인터페이스인 제 4 통신 INF(246)을 통해 접속된(도시된 표의 왼쪽으로부터 4번째의 열 참조), ID2-002의 식별 코드(도시된 표의 왼쪽으로부터 2번째의 열 참조)를 가지는 제 2 외부 기기(112), 예를 들면 넥서스(Nexus)(등록 상표) 기기에 의해, 제 2 외부 기기 제어 유닛(208)이 제공하는 플랫폼(예를 들면 안드로이드 오토(Android Auto) 시스템의 플랫폼)를 통하여 실행된 것을 알 수 있다(도시된 표의 왼쪽으로부터 3번째의 열 참조). 또한, 당해 실행에 있어서, 제 2 외부 기기 제어 유닛(208)이 제공하는 음성 인식 기능이 이용되어진 것(도시된 표의 왼쪽으로부터 5번째의 열 참조), 이 내비게이션 동작이 2015년 11월 3일의 7시 58분에 이루어진 것(도시된 표의 가장 오른쪽의 열 참조), 및 같은 내비게이션 동작이 과거 30회 이루어진 것(도시된 표의 오른쪽으로부터 2번째의 열 참조), 을 알 수 있다.
도 6에 나타낸 바와 같이 동작 이력을 기억한 후, 전체 제어 유닛(200)은, 사용자가 음성에 의해 특정의 목적지를 지정했을 때에는, 예를 들면 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 운용 모드 동작이 지정되어 있는 것을 조건으로 하여, 주 음성 인식 유닛(210)에 의해 당해 음성에 대한 음성 인식을 실시하여 당해 목적지를 추출하고, 당해 목적지가 포함되어 있는 동작 정보를 상기 동작 이력으로부터 추출하여, 당해 추출한 동작 정보가 나타내는 각 선택지의 지정에 따라 상기 지정된 목적지까지의 경로 탐색과 경로 안내를 실시한다.
이에 의해, 본 실시 형태의 음성 입력 처리 장치(10)에서는, 간략화된 음성 커맨드(예를 들면, 목적지만을 지정하는 음성 커맨드)의 사용을 가능하게 하고, 또한 음성 입력 처리 장치가 구비하는 음성 인식 기능(예를 들면, 음성 인식 유닛(210, 216, 222, 228, 234)이 실시하는 음성 인식 기능)이나 외부 기기가 구비하는 음성 인식 기능(예를 들면, 제 1, 제 2 외부 기기(110, 112)의 음성 인식 유닛(140, 142)에 의한 음성 인식 기능)의 동작 경합을 방지하여 그들 기능의 실행을 적절하게 관리할 수 있다.
이상과 같이, 전체 제어 유닛(200)의 커맨드 처리 유닛(212)은, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 스크린에 의해 입력되는 동작 지시 정보 및/또는 음성 커맨드로부터 추출되는 커맨드에 기초하여, 음성 입력 처리 장치의 동작(오디오 유닛(202)이나 내비게이션 유닛(204)의 동작)을 제어하고 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 동작을 제어하여, 동작 지시 정보의 적어도 일부 및/또는 상기 커맨드의 내용의 적어도 일부(예를 들면, 재생을 희망하는 악곡의 곡명이나, 경로 탐색에 이용하는 목적지)와, 당해 동작 지시 정보 및/또는 커맨드에 기초하여 실시한 음성 입력 처리 장치 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 동작의 내용, 을 관련지은 동작 정보를, 동작 이력으로서 기억 장치(102)에 기억한다. 그리고, 커맨드 처리 유닛(212)은, 새로운 음성이 입력되었을 때는, 주 음성 인식부(210)에 의해 추출되는 커맨드의 내용의 적어도 일부(예를 들면, 재생을 희망하는 악곡의 곡명이나, 경로 탐색에 이용하는 목적지)가 포함되는 동작 정보를, 기억 장치(102)가 기억하는 동작 이력으로부터 추출하고, 상기 추출되는 커맨드와 당해 추출한 동작 정보에 기초하여 음성 입력 처리 장치의 동작(오디오 유닛(202)이나 내비게이션 유닛(204)의 동작)을 제어하고 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)에 동작을 지시한다.
다음으로, 음성 입력 처리 장치(10)의 전체 제어 유닛(200)이 실시하는 처리의 순서에 대하여, 도 7에 나타낸 흐름도에 따라 설명한다. 본 처리는, 음성 입력 처리 장치(10)의 전원이 켜졌을 때에 개시하고, 꺼졌을 때에 종료한다.
처리를 개시하면, 먼저, 전체 제어 유닛(200)은, HMI-INF(106)를 통해 마이크로폰(170)으로부터 음성이 입력되었는지 아닌지를 판단하고(S100), 입력되어 있지 않을 때는(S100, No), 단계 S100으로 돌아가 음성이 입력되는 것을 대기한다. 예를 들면, 전체 제어 유닛(200)의 커맨드 처리 유닛(212)은, 마이크로폰(170)으로부터 입력되는 소리를 일시 기억 장치(도시하지 않음)에 기억하여 버퍼링하고, 버퍼링한 소리의 주파수 분석 등에 의해 당해 버퍼링한 소리에 음성이 포함되어 있는지 아닌지를 판단할 수 있다.
한편, 단계 S100에 있어서 음성이 입력되었을 때는(S100, Yes), 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 운용 모드 동작이 지정되어 있는지 아닌지를 판단하고(S102), 운영 모드가 아니라 학습 모드가 지정되어 있을 때는(S102, No), 입력된 음성에 포함되는 커맨드를 주 음성 인식 유닛(210)에 의해 추출하고, 당해 추출한 커맨드와, 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 입력되는 동작 지시 정보에 기초하여, 커맨드 처리 유닛(212)에 의해, 지정된 동작을 실행한다(S104). 그리고, 실행한 당해 동작의 동작 정보를, 동작 이력으로서 기억 장치(102)에 기억한 후(S106), 단계 S100으로 돌아가 처리를 반복한다.
한편, 단계 S102에 있어서, 조작 스위치(176) 또는 디스플레이(174)의 터치 스크린에 의해 운용 모드가 지정되어 있을 때는(S102, Yes), 커맨드 처리 유닛(212)은, 단계 S100에서 입력된 음성(입력 음성)을(예를 들면, 상기 버퍼링한 소리로부터 추출하여) 주 음성 인식 유닛(210)으로 보내고, 주 음성 인식 유닛(210)은 전송된 당해 입력 음성을 기억 장치(102)에 보존한다(S108). 주 음성 인식 유닛(210)은, 전송된 당해 입력 음성에 대해 음성 인식 처리를 실시해, 당해 음성에 포함되는 커맨드를 추출하여, 당해 커맨드가 지정하는 기능(당해 커맨드가 그 실행을 지시하는 기능)을 특정한다(S110). 예를 들면, 주 음성 인식 유닛(210)은, 미리 정해진 단어나 문구(예를 들면, 음악 재생 기능의 실행을 지시하는 「···의 재생」이나, 내비게이션 기능의 실행을 지시하는 「···까지의 경로를 탐색」, 차량 조작의 일부로서의 와이퍼 동작의 실행을 지시하는 「와이퍼 동작 ON」 등의 문구)를 추출함으로써, 지정된 기능(지정 기능)을 특정할 수 있다.
다음으로, 커맨드 처리 유닛(212)은, 특정 기능이 차량 조작 관련의 기능(예를 들면, 와이퍼의 동작 개시나, 창문의 개폐 등)인지 아닌지를 판단하고(S112), 차량 조작 관련의 기능일 때는(S112, Yes), 보다 구체적인 지정의 동작(예를 들면, 와이퍼의 동작 개시나, 창문의 개폐 등)을 특정하여(S114), 당해 특정한 지정 동작의 커맨드(예를 들면, 지정 동작의 실행을 지시하는 신호)를, 제 5 통신 INF(248)을 통해 대응하는 ECU(예를 들면 ECU(160a))로 송신한 후(S116), 단계 S100으로 다시 돌아가 처리를 반복한다.
한편, 단계 S112에 있어서, 지정 기능이 차량 조작 관련의 기능이 아닐 때는(S112, No), 커맨드 처리 유닛(212)은, 특정 기능이 오디오 재생(예를 들면, 음악 재생)인지 아닌지를 판단하고(S118), 오디오 재생일 때는(S118, Yes), 오디오 재생 처리를 실행한 후(S120), 단계 S100으로 다시 돌아가 처리를 반복한다. 한편, 단계 S120에서 실시하는 오디오 재생 처리에 대해서는 후술한다.
한편, 단계 S118에 있어서, 지정 기능이 오디오 재생이 아닐 때는(S118, No), 커맨드 처리 유닛(212)은, 특정 기능이 내비게이션인지 아닌지를 판단하고(S122), 내비게이션일 때는(S122, Yes), 내비게이션 처리를 실행한 후(S124), 단계 S100으로 다시 돌아가 처리를 반복한다. 한편, 단계 S124에서 실시하는 내비게이션 처리에 대해서는 후술한다.
한편, 단계 S122에 있어서, 지정 기능이 내비게이션이 아닐 때는(S122, No), 커맨드 처리 유닛(212)은, 예를 들면 무선 통신 인터페이스인 제 1 통신 INF(240)을 통해 음성 인식 기능을 가진 외부 서버와 접속 가능한지 아닌지를 판단하고(S126), 접속 가능일 때는(S126, Yes), 단계 S108에서 기억 장치(102)에 보존한 입력 음성을 당해 외부 서버로 송신한 후(S128), 단계 S100으로 돌아가 처리를 반복한다. 이에 의해, 예를 들면, 송신처의 외부 서버가 입력 음성에 따라 처리한 결과를 취득하여, 당해 입력 음성에 따라 처리를 실시할 수 있다. 또한, 음성 인식 기능을 가진 외부 서버와 접속 가능한지 아닌지의 판단은, 예를 들면, 커맨드 처리 유닛(212)이, 접속 가능한 외부 서버에 대한 정보를 미리 보유하고 있는 것으로, 당해 정보 중에 음성 인식 기능을 가진 외부 서버의 정보가 있으면, 음성 인식 기능을 가진 외부 서버와 접속 가능하다고 판단하는 것으로 할 수 있다.
한편, 단계 S126에 있어서, 음성 인식 기능을 가진 외부 서버와 접속 가능하지 않을 때는(S126, No), 커맨드 처리 유닛(212)은, 통신 INF(104)을 통해 음성 인식 기능을 가진 외부 기기가 접속되어 있는지 아닌지를 판단하고(S130), 접속되어 있을 때는(130, Yes), 단계 S108에서 기억 장치(102)에 보존한 입력 음성을 음성 인식 기능을 가진 외부 기기의 어느 것(본 실시 형태에서는, 제 1 외부 기기(110) 또는 제 2 외부 기기(112))에 송신한 후(S132), 단계 S100으로 돌아가 처리를 반복한다. 이에 의해, 예를 들면, 송신처의 외부 기기에 의해, 입력 음성에 따라 처리를 실시할 수 있다. 또한, 입력 음성을 송신하는 외부 기기의 선택은, 예를 들면, 미리 정해진 우선 순위, 또는 디스플레이(174)나 조작 스위치(176) 등을 통해 사용자가 입력한 우선 순위에 따라 실시하는 것으로 할 수 있다.
한편, 단계 S130에 있어서, 음성 인식 기능을 가진 외부 기기가 접속되어 있지 않을 때는(S130, No), 그대로 단계 S100으로 돌아가 처리를 반복한다.
[오디오 재생 처리]
다음으로, 도 7의 단계 S120에서의 오디오 재생 처리의 순서에 대해서, 도 8에 나타낸 흐름도에 따라 설명한다.
처리를 개시하면, 먼저, 커맨드 처리 유닛(212)은, 단계 S110에서 특정된 지정 기능이, 악곡 재생인지 아닌지를 판단하고(S200), 악곡 재생이 아닐 때는(S200, No), 주 음성 인식 유닛(210)에 의해, 단계 S108에서 기억 장치(102)에 보존한 입력 음성 전체의 음성 인식을 실시한 후(S202), 오디오 재생 처리를 종료한다. 또한, 단계 S202에 있어서, 제 1 통신 INF(240)을 통해 음성 인식 기능을 갖는 외부 서버와 연결 가능할 때는, 단계 S108에 있어서 기억 장치(102)에 보존한 입력 음성을 당해 외부 서버에 송신하여 음성 인식을 실시하는 것으로 해도 좋다.
한편, S200에 있어서 지정 기능이 악곡 재생일 때는(S200, Yes), 주 음성 인식 유닛(210)에 의해, 단계 S108에서 기억 장치(102)에 보존한 입력 음성으로부터 재생 대상인 악곡의 지정(지정 악곡)의 곡명을 추출하고(S204), 당해 지정 악곡의 곡명을 포함한 동작 정보를, 기억 장치(102)가 기억하는 악곡 재생 동작에 관한 동작 이력(도 4와 같은 동작 이력)으로부터 검색하여 추출한다(S206).
그리고, 커맨드 처리 유닛(212)은, 상기 지정 악곡의 곡명을 포함한 동작 정보가 있었는지 아닌지(즉, 추출되었는지 아닌지)를 판단하고(S208), 추출되지 않은 때는(S208, No), 단계 S202로 처리를 옮긴다. 한편, 단계 S208에 있어서 상기 지정 악곡의 곡명을 포함한 동작 정보가 추출된 때는(S208, Yes), 당해 추출된 동작 정보가 복수인지 아닌지를 판단하고(S210), 복수일 때는(S210, Yes), 추출된 복수의 동작 정보로부터, 소정의 조건에 따라 하나의 동작 정보를 선택한 후(S212), 단계 S214로 처리를 옮긴다. 당해 소정의 조건은, 예를 들면, 「추출된 복수의 동작 정보 중, 「빈도」(도 4의 표의 오른쪽으로부터 2번째의 「빈도」열의 숫자)가 가장 많은 동작 정보를 선택하는」 것이나, 또는 「복수의 동작 정보 중, 「최종 사용 일」(도 4의 표의 가장 오른쪽의 「최종 사용일」열의 일자)가 가장 가까운 동작 정보를 선택하는」것을 규정하는 것으로 할 수 있다.
한편, 단계 S210에 있어서 지정 악곡의 곡명을 포함한 동작 정보로서 추출된 동작 정보가 복수가 아닐 때(즉, 하나일 때)는(S210, No), 그대로 단계 S214로 처리를 옮긴다.
단계 S214에 있어서, 커맨드 처리 유닛(212)은, 단계 S206에서 추출된 하나의 동작 정보 또는 단계 S206에서 추출된 복수의 동작 정보 중으로부터 단계 S212에서 선택된 하나의 동작 정보(이하, 「추출된 동작 정보」라 한다)에 따라 지정 악곡의 재생이 가능한지 아닌지를 판단한다(S214). 예를 들면, 도 4에 나타내는 동작 이력이 이용된 경우에 있어, 「곡명 1」의 악곡이 지정 악곡일 때는, 가장 왼쪽 열에 「곡명 1」을 포함한 동작 정보가 추출되는 것으로 되지만, 당해 추출된 동작 정보가 나타내는 식별 ID1-001의 기기가 통신 INF(104)에 접속되어 있지 않은 경우나, 접속되어있다고 하더라도, 당해 추출된 동작 정보가 나타내는 통신 INF의 지정인 제 3 통신 INF(244)에 접속되어 있지 않은 경우에는, 단계 S214에 있어서, 「곡명 1」의 지정 악곡은, 추출된 동작 정보에 따라 재생하는 것은 불가능하다고 판단된다.
그리고, 단계 S214에 있어서, 추출된 동작 정보에 따라 지정 악곡을 재생하는 것이 불가능하다고 판단될 때는(S214, No), 단계 S202로 처리를 옮기고, 가능일 때는(S214, Yes), 당해 추출된 동작 정보가, 지정 악곡의 재생시 음성 인식 기능을 사용하는 것을 나타내고 있는지 아닌지를 판단한다(S216). 당해 판단은, 예를 들면, 도 4에 나타낸 동작 이력으로부터 동작 정보가 추출되는 경우에는, 도시된 표의 오른쪽으로부터 세 번째의 「음성 인식 기능」열에 나타난 정보에 기초하여 실시할 수 있다.
그리고, 음성 인식 기능의 사용이 지정되어 있을 때는(S216, Yes), 도 7의 단계 S108에서 기억 장치(102)에 보존한 입력 음성을, 추출된 동작 정보가 나타내는 음성 인식 기능을 제공하는 기기 또는 유닛(도 4에 나타낸 동작 이력의 표의, 오른쪽으로부터 3번째의 「음성 인식 기능」 열에 나타난 기기 또는 유닛)으로 송신하여(S218), 오디오 재생 처리를 종료한다. 이에 의해, 당해 입력 음성을 수신한 음악 재생 기기는, 당해 입력 음성에 대하여 음성 인식을 실시하고, 당해 입력 음성에 포함되는 명령에 따라, 지정 악곡을 재생할 수 있다.
한편, 단계 S216에 있어서, 추출된 동작 정보에 음성 인식 기능의 사용이 지정되어 있지 않을 때는(S216, No), 추출된 동작 정보에 따라, 지정의 음악 재생 기기에 의해 지정 악곡을 재생하기 위한 동작 지시 신호를 생성하고(S220), 당해 동작 지시 신호를, 당해 추출된 동작 정보가 지정하는 접속 경로를 통해, 상기 지정의 음악 재생 기기에 송신하여(S222), 오디오 재생 처리를 종료한다.
[내비게이션 처리]
다음으로, 도 7의 단계 S124에서의 내비게이션 처리의 순서에 대해, 도 9에 나타내는 흐름도에 따라 설명한다.
처리를 개시하면, 먼저, 커맨드 처리 유닛(212)은, 단계 S110에서 특정된 지정 기능이, 경로 탐색인지 아닌지를 판단하고(S300), 경로 탐색이 아닐 때는(S300, No), 주 음성 인식 유닛(210)에 의해, 단계 S108에서 기억 장치(102)에 보존한 입력 음성 전체의 음성 인식을 실시한 후(S302), 내비게이션 처리를 종료한다. 또한, 단계 S302에 있어서, 제 1 통신 INF(240)을 통해 음성 인식 기능을 갖는 외부 서버와 접속 가능할 때는, 단계 S108에서 기억 장치(102)에 보존한 입력 음성을 당해 외부 서버에 송신하여 음성 인식을 실시할 것으로 해도 좋다.
한편, 단계 S300에서 지정 기능이 경로 탐색일 때는(S200, Yes), 주 음성 인식 유닛(210)에 의해, 단계 S108에서 기억 장치(102)에 보존한 입력 음성으로부터 경로 탐색에 이용하는 목적지의 지정(지정 목적지)의 지명을 추출하고(S304), 당해 지정 목적지의 지명을 포함한 동작 정보를, 기억 장치(102)가 기억하는 내비게이션 동작에 관한 동작 이력(도 6과 같은 동작 이력)으로부터 검색하여 추출한다(S306).
그리고, 커맨드 처리 유닛(212)은, 상기 지정 목적지의 지명을 포함한 동작 정보가 있었는지 아닌지(즉, 추출되었는지 아닌지)를 판단하고(S308), 추출되지 않은 때는(S308, No), 단계 S302로 처리를 옮긴다. 한편, 단계 S308에서 상기 지정 목적지의 지명을 포함한 동작 정보가 추출되었을 때는(S308, Yes), 당해 추출된 동작 정보가 복수인지 아닌지를 판단하고(S310), 복수일 때는(S310, Yes), 추출된 복수의 동작 정보로부터, 소정의 조건에 따라 하나의 동작 정보를 선택한 후(S312), 단계 S314로 처리를 옮긴다. 해당 소정의 조건은, 예를 들면, 「추출된 복수의 동작 정보 중, 「빈도」(도 6의 표의 오른쪽으로부터 2번째의 「빈도」열의 숫자)가 가장 많은 동작 정보를 선택하는」 것이나, 또는 「복수의 동작 정보 중, 「최종 사용일」(도 6의 표의 가장 오른쪽의 「최종 사용일」 열의 일자)가 가장 가까운 동작 정보를 선택하는」 것을 규정하는 것으로 할 수 있다.
한편, 단계 S310에서 지정 목적지의 지명을 포함한 동작 정보로서 추출된 동작 정보가 복수가 아닐 때(즉, 하나일 때)는(S310, No), 그대로 단계 S314로 처리를 옮긴다.
단계 S314에 있어서, 커맨드 처리 유닛(212)은, 단계 S306에서 추출된 하나의 동작 정보 또는 단계 S306에서 추출된 복수의 동작 정보 중으로부터 단계 S312에서 선택된 하나의 동작 정보(이하, 「추출된 동작 정보」라 한다)에 따라 지정 목적지까지의 내비게이션이 실행 가능인지 아닌지를 판단한다(S314). 예를 들면, 도 6에 나타낸 동작 이력이 이용되는 경우에 있어, 「지명 b」의 목적지가 지정 목적지일 때는, 가장 왼쪽 열에 「지명 b」를 포함한 동작 정보가 추출되는 것으로 되지만, 당해 추출된 동작 정보가 나타내는 식별 ID1-001의 기기가 통신 INF(104)에 접속되어 있지 않은 경우나, 접속되어있다고 하더라도,당해 추출된 동작 정보가 나타내는 통신 INF의 지정인 제 3 통신 INF(244)에 접속되어 있지 않은 경우에는, 단계 S314에서 「지명 a」의 지정 목적지는, 추출된 동작 정보에 따라 내비게이션을 실행하는 것은 불가능하다고 판단된다.
그리고, 단계 S314에서 추출된 동작 정보에 따라 지정 목적지까지의 내비게이션을 실행하는 것이 불가능하다고 판단될 때는(S314, No), 단계 S302로 처리를 옮기고, 가능일 때는(S314, Yes), 당해 추출된 동작 정보가, 내비게이션 실행시 음성 인식 기능을 사용하는 것을 나타내고 있는지 아닌지를 판단한다(S316). 당해 판단은, 예를 들면, 도 6에 나타낸 동작 이력으로부터 동작 정보가 추출되는 경우에는, 도시된 표의 오른쪽으로부터 3번째의 「음성 인식 기능」열에 나타난 정보에 기초하여 실시할 수 있다.
그리고, 음성 인식 기능의 사용이 지정되어 있을 때는(S316, Yes), 도 7의 단계 S108에서 기억 장치(102)에 보존한 입력 음성을, 추출된 동작 정보가 나타내는 음성 인식 기능을 제공하는 기기 또는 유닛(도 6에 나타낸 동작 이력의 표의, 오른쪽으로부터 3번째의 「음성 인식 기능」 열에 나타난 기기 또는 유닛)으로 송신하여(S318), 내비게이션 처리를 종료한다. 이에 의해, 당해 입력 음성을 수신한 내비게이션 실행 기기는, 당해 입력 음성에 대해 음성 인식을 실시하고, 당해 입력 음성에 포함되는 커맨드에 따라, 지정 목적지까지의 내비게이션을 실행할 수 있다.
한편, 단계 S316에 있어서, 추출된 동작 정보에 음성 인식 기능의 사용이 지정되어 있지 않을 때는(S316, No), 추출된 동작 정보에 따라, 지정의 내비게이션 실행 기기에 의해 지정 목적지까지의 내비게이션을 실행하기 위한 동작 지시 신호를 생성하고(S320), 당해 동작 지시 신호를, 당해 추출된 동작 정보가 지정하는 접속 경로(도 6의 「접속 경로」 열이 나타내는 연결 통로)을 통해, 상기 지정의 내비게이션 실행 기기에 송신하여(S322), 내비게이션 처리를 종료한다.
<제 2 실시 형태>
다음으로, 본 발명의 제 2의 실시 형태에 관한 음성 입력 처리 장치에 대해 설명한다.
본 음성 입력 처리 장치에서는, 도 8의 단계 S214에 있어서, 선택된 동작 정보에 따라 지정 악곡의 재생을 실시할 수 없고, 또한 재생을 실시할 수 없는 이유가, 당해 선택된 동작 정보가 나타내는 접속 경로를 따라 음악 재생 기기와의 접속을 실시할 수 없다고 하는 것일 경우에, 미리 정한 소정의 조건에 따라, 상기 선택된 동작 정보가 나타내는 접속 경로와 같은 기능을 갖는 대체의 접속 경로를 선택하여, 당해 음악 재생 기기와의 접속을 실시한다.
이에 의해, 본 실시 형태에 관한 음성 입력 처리 장치에서는, 추출된 동작 정보가 나타내는 접속 경로를 따라 음악 재생 기기와의 접속을 할 수 없는 경우에도, 접속 경로와 같은 기능을 갖는 대체의 접속 경로를 선택하여 접속을 실시하기 때문에, 음성 입력 처리 장치로서의 편리성이 향상된다.
또한, 본 실시 형태에 관한 음성 입력 처리 장치에서는, 사용자가 제 1 ~ 제 4 외부 기기(110 ~ 116) 중 어느 하나에 대한 직접 입력(즉, 당해 외부 기기에 대해 직접 실시한 음성 커맨드의 입력 및/또는 입력 조작)에 의해 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것이 실시한 동작의 정보를, 당해 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것을 취득하여, 상기 음성 커맨드의 내용의 적어도 일부 및/또는 상기 입력 조작의 내용의 적어도 일부(예를 들면, 음악 재생 동작에서의 지정 악곡의 곡명이나, 내비게이션 동작에서의 경로 탐색에 이용하는 지정 목적지의 지명)와, 당해 음성 커맨드 및/또는 입력 조작에 기초하여 실시한 상기 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것의 동작의 내용, 을 관련지어진 동작 정보를, 동작 이력으로서 기억 장치(102)에 기억한다. 그리고, 동작 이력의 동작 정보에 나타낸 내용으로서, 당해 동작 정보가, 제 1 ~ 제 4 외부 기기(110 ~ 116)에 대한 직접 입력에 기초한 동작인지 아닌지에 대한 직접 입력 정보를 포함하고 있다.
또한, 본 실시 형태에 관한 음성 입력 처리 장치에서는, 동작 이력의 동작 정보에 나타낸 내용으로서, 또한, 재생된 악곡이, 예를 들면 악곡 앨범에 포함되는 악곡으로서 자동적으로 재생되었는지 아닌지를 나타내는 자동 재생 정보를 포함한다.
그리고, 도 8의 단계 S212과 같은 하나의 동작 정보의 선택이, 상기 직접 입력 정보 및 자동 재생 정보에도 기초하여 이루어진다.
도 10은, 제 2의 실시 형태에 관한 음성 입력 처리 장치의 구성을 나타내는 도이다. 또한, 도 10에 있어서도, 도 2에 나타낸 제 1의 실시 형태에 관한 음성 입력 처리 장치(10)와 동일한 구성 요소에 대해서는, 도 2에서의 부호와 동일한 부호를 이용하는 것으로 하고, 상술한 제 1의 실시 형태에 관한 음성 입력 처리 장치(10)에 대한 설명을 원용하는 것으로 한다.
본 음성 입력 처리 장치(1000)는, 제 1의 실시 형태에 관한 음성 입력 처리 장치(10)와 같은 구성을 갖지만, 처리 장치(100) 대신에 처리 장치(1100)를 구비하는 점이 다르다. 처리 장치(1100)는, 처리 장치(100)와 같은 구성을 갖지만, 전체 제어 유닛(200) 대신에 전체 제어 유닛(1010)을 가지며, 오디오 유닛(202) 대신에 오디오 유닛(1002)을 갖는 점이 다르다. 오디오 유닛(1002)은, 오디오 유닛(202)과 같은 구성을 갖지만, 음성 인식 유닛을 갖지 않고, 음악 재생 유닛(218) 대신 음악 재생 유닛(1018)을 갖는 점이 오디오 유닛(202)과 다르다. 음악 재생 유닛(1018)은, 음악 재생 유닛(218)과 같은 구성을 갖지만, 음성 인식 기능에 대한 동작을 실행하지 않는 점이 음악 재생 유닛(218)과 다르다.
또한, 전체 제어 유닛(1010)은, 전체 제어 유닛(200)과 동일한 구성을 갖지만, 커맨드 처리 유닛(212) 대신 커맨드 처리 유닛(1012)에 갖는 점이 다르다.
커맨드 처리 유닛(1012)은, 커맨드 처리 유닛(212)과 같은 기능을 가지며, 같은 동작을 실시하지만, 또한, 사용자가 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것에 대한 직접 입력(즉, 해당 외부 기기에 대하여 직접 실시한 음성 커맨드의 입력 및/또는 입력 조작)에 의해 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것이 실시한 동작의 정보(직접 입력 동작 정보)를, 당해 대응하는 제 1 ~ 4 외부 기기(110 ~ 116)의 어느 것을 취득하여, 상기 음성 커맨드의 내용의 적어도 일부 및/또는 상기 입력 조작의 내용의 적어도 일부(예를 들면, 음악 재생 동작에서의 지정 악곡의 곡명이나, 내비게이션 동작에서의 경로 탐색에 이용하는 지정 목적지의 지명)와, 당해 음성 커맨드 및/또는 입력 조작에 기초하여 실시한 상기 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것의 동작의 내용과, 를, 관련지어진 동작 정보를, 동작 이력으로서 기억 장치(102)에 기억한다. 그리고, 동작 이력의 동작 정보에 나타낸 내용으로서, 당해 동작 정보가, 제 1 ~ 제 4 외부 기기(110 ~ 116)에 대한 직접 입력에 기초한 동작인지 아닌지에 대해 「직접 입력」정보를 포함시킨다. 또한, 상기 직접 입력 동작 정보는, 커맨드 처리 유닛(1012)이, 예를 들면, 대응하는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것이 통신 INF(104)에 접속되었을 때, 및/또는 당해 접속 후에 소정의 시간 간격으로 취득하여, 기억 장치(102)에 기억시킨 동작 이력을 갱신하는 것으로 한다.
또한, 커맨드 처리 유닛(1012)은, 새로운 악곡이 재생될 때에, 당해 악곡의 재생이, 예를 들면 악곡 앨범에 포함되는 악곡으로서 자동적으로 재생되었는지 아닌지를 나타내는 자동 재생 정보를, 대응하는 음악 재생 기기로부터 취득하여, 동작 이력을 구성하는 동작 정보에, 상기 자동 재생 정보를 포함시키는 것으로 한다.
도 11은, 커맨드 처리 유닛(1012)이 작성하는, 음악 재생 동작에 대한 동작 이력의 일례를 나타내는 도이다. 도시된 표의 가장 오른쪽의 두 열에 나타낸 바와 같이, 본 실시 형태에서의 음악 재생 동작에 대한 동작 이력을 구성하는 동작 정보에는, 상술한 「직접 입력」 정보와, 「자동 재생」 정보가 포함되어 있다.
커맨드 처리 유닛(1012)은, 또한, 도 7에 나타낸 처리 대신 도 12에 나타낸 처리를 실시하는 점이, 커맨드 처리 유닛(212)과 다르다. 도 12에 나타낸 처리는, 도 7에 나타낸 처리와 같지만, 단계 S120의 오디오 재생 처리(도 8) 대신에, 단계 S420에서, 도 13에 나타낸 오디오 재생 처리(2)를 실행하는 점이 다르다. 또한, 도 12 및 도 13에서는, 각각 도 7 및 도 8에 나타낸 단계와 같은 처리를 실시하는 단계에 대해서는 같은 부호를 이용하여 나타내는 것으로서, 상술한 도 7 및 도 8에 대한 설명을 원용하는 것으로 한다.
도 13에 나타낸 오디오 재생 처리(2)는, 도 8에 나타낸 오디오 재생 처리와 같지만, 단계 S212, S214에 대신해 단계 S512, S514을 실행하는 점, 및 단계 S516이 추가되어 있는 점이 다르다.
이하, 도 13에 나타낸 오디오 재생 처리(2)의 처리 중, 도 8에 나타낸 오디오 재생 처리와 다른 상기의 단계 S512, S514, S516에 대해 설명한다.
커맨드 처리 유닛(1012)은, 단계 S210에 있어서, 지정 악곡의 곡명을 포함한 복수의 동작 정보가 동작 이력으로부터 추출되었다고 판단될 때에(S210, Yes), 도 11에 나타낸 동작 이력의 「빈도」 열 및/또는 「최종 사용일」 열의 정보에 더하여, 「음성 인식 기능」 열, 「자동 재생」 열, 및 「직접 입력」 열의 정보에도 기초하여, 소정의 조건에 따라, 상기 추출된 복수의 동작 정보로부터 하나의 동작 정보를 선택한다(S512).
상기 소정의 조건은, 예를 들면, 어떤 음성 인식 동작에 기초하여 실시된 동작의 동작 정보(도 11에 나타낸 동작 이력의 「음성 인식 기능」 열이 「사용하지 않음」이 아닌 동작 정보)를, 어떤 음성 인식 동작에 기초하지 않는 동작의 동작 정보(「음성 인식 기능」열이 「사용하지 않음」인 동작 정보. 즉, 조작 스위치(176)나 디스플레이(174)의 터치 패널에의 수동의 입력 조작에 의해 실시된 동작의 동작 정보)보다도 우선적으로 선택하는 것을 규정하는 조건을 포함하는 것으로 할 수 있다.
또한, 상기 소정의 조건은, 재생된 악곡(도 11에 나타낸 동작 이력의 「재생 악곡명」 열에 나타낸 곡명의 악곡)이 자동적으로 재생된 것이 아닌 것을 나타내고 있는 동작 정보(「자동 재생」 열이 No 인 동작 정보)를, 자동적으로 재생된 것인 것을 나타내고 있는 동작 정보(「자동 재생」 열이 Yes 인 동작 정보)보다도 우선적으로 선택하는 것을 규정하는 조건을 포함하는 것으로 할 수 있다.
또한, 상기 소정의 조건은, 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것으로부터 취득한 정보에 기초하여 동작 정보(도 11에 나타낸 동작 이력의 「직접 입력」 열이 Yes 인 동작 정보)에 우선하여, 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것으로부터 취득한 정보에 기초하여 동작 정보 이외의 동작 정보(「직접 입력」 열이 No 인 동작 정보)를 선택하는 것을 규정하는 조건을 포함하는 것으로 할 수 있다.
또한, 커맨드 처리 유닛(1012)은, 단계 S514에서, 추출된 동작 정보에 따라 지정 악곡을 재생하는 것이 불가능하다고 판단될 때는(S514, No), 대체 접속 처리를 실행하고(S516), 오디오 재생 처리(2)를 종료한다.
다음으로, 도 13의 단계 S516의 대체 접속 처리 순서에 대하여, 도 14에 나타낸 흐름도에 따라 설명한다.
처리를 개시하면, 커맨드 처리 유닛(1012)은, 먼저, 대상의 음악 재생 기기가 통신 INF(104)에 접속되어 있는지 아닌지를 판단하고(S600), 접속되어 있지 않을 때는(S600, No), 주 음성 인식 유닛(210)에 의해, 단계 S108에서 기억 장치(102)에 보존한 입력 음성 전체의 음성 인식을 실시한 후(S602), 대체 접속 처리를 종료한다. 또한, 단계 S602에 있어서, 제 1 통신 INF(240)을 통해 음성 인식 기능을 갖는 외부 서버와 접속 가능할 때는, 단계 S108에서 기억 장치(102)에 보존한 입력 음성을 당해 외부 서버에 송신하여 음성 인식을 실시하는 것으로 해도 좋다.
한편, 단계 S600에 있어서, 대상의 음악 재생 기기가 통신 INF(104)에 접속되어있는 것으로 판단될 때는(S600, Yes), 당해 대상의 음악 재생 기기에 대해, 단계 S206 또는 S512에서 추출된 동작 정보에 나타난 접속 경로에 대신하여 사용할 수 있는 접속 경로(대체 접속 경로)를 이용하여 통신 접속을 실시할 수 있는지 아닌지를 판단한다(S604). 이 판단은, 예를 들면, 제 1 ~ 제 5 통신 INF(240 ~ 248)에 접속되어있는 각 기기에 식별 ID의 송신을 요구하는 신호를 송신하고, 각 기기로부터 회신되는 식별 ID 중에 상기 대상으로 하는 음악 재생 기기의 식별 ID가 포함되어 있는지 아닌지에 의해 판단할 수 있다. 즉, 대상으로 하는 음악 재생 기기의 식별 ID가 포함되어 있으면, 적어도 당해 식별 ID가 회신되어 온 경로를 대체 접속 경로로서 이용할 수 있다고 판단 할 수 있다.
그리고, 대체 접속 경로를 이용하여 대상의 음악 재생 기기와의 통신 접속을 실시할 수 없다고 판단될 때는(S604, No), 단계 S602에 처리를 옮겨 대체 접속 처리를 종료한다. 한편, 대체 접속 경로를 이용하여 대상의 음악 재생 기기와의 통신 접속을 실시할 수 있다고 판단될 때는(S604, Yes), 미리 정한 소정의 조건에 따라, 대체 접속 경로를 결정한다(S606).
당해 소정의 조건은, 예를 들면, 「대응하는 동작 정보가 나타내는 동작이, 제 1 ~ 제 4 외부 기기(110 ~ 116)의 어느 것을 음악 재생 기기로 하는 것에 있어서, 당해 음악 재생 기기가 갖는 음성 인식 기능에 기초하여 실시되어진 것일 때는, 당해 음악 재생 기기가 갖는 음성 인식 기능의 동작을 실시할 수 있는 접속 경로를 선택하는」 것을 규정하는 것이라고 할 수 있다. 예를 들면, 도 11에 나타낸동작 이력에서, 「재생 악곡명」 열에 「곡명 2」를 포함한 동작 정보에서는, ID2-002의 식별 ID를 가지는 제 2 외부 기기(112)를 음악 재생 기기로 하고(「음악 재생」 열 참조), 당해 음악 재생 기기인 제 2 외부 기기(112)의 음성 인식 기능을 이용하여 음악 재생이 이루어지고 있다(「음성 인식」 열 참조). 이 경우, ID2-002의 식별 ID를 가지는 제 2 외부 기기(112)가 제 4 통신 INF(246)에 접속되어 있지 않고, 예를 들면 블루투스(Bluetooth) 통신 인터페이스인 제 2 통신 INF(242)에 접속되어있는 경우에는, 음성 인식 기능에 대한 동작을 실시하지 않는 오디오 유닛(1002)을 플랫폼으로 이용하지 않고, 예를 들면 제 2 외부 기기(112)의 음성 인식 기능을 동작시킬 수 있는 제 2 외부 기기 제어 유닛(208)을 플랫폼으로 하는 제 2 통신 INF(242)을 통한 접속 경로를 대체 접속 경로로서 선택한다.
다음으로, 커맨드 처리 유닛(1012)은, 추출된 동작 정보가, 지정 악곡의 재생 시 음성 인식 기능을 사용하는 것을 나타내고 있는지 아닌지를 판단한다(S608). 당해 판단은, 예를 들면, 도 11에 나타낸 동작 이력으로부터 동작 정보가 추출되는 경우에는, 도시된 표의 오른쪽으로부터 4번째의 「음성 인식 기능」 열에 나타난 정보에 기초하여 실시할 수 있다.
그리고, 음성 인식 기능의 사용이 지정되어 있을 때는(S608, Yes), 도 7의 단계 S108에서 기억 장치(102)에 보존한 입력 음성을, 단계 S606에서 결정된 대체 접속 경로를 통해, 동작 정보가 나타낸 음성 인식 기능을 제공하는 기기 또는 유닛(도 11에 나타낸 동작 이력의 표의, 오른쪽으로부터 4번째의 「음성 인식 기능」 열에 나타난 기기 또는 유닛)으로 송신하여(S610), 대체 접속 처리를 종료한다. 이에 의해, 당해 입력 음성을 수신한 음악 재생 기기는, 당해 입력 음성에 대해 음성 인식을 실시하고, 당해 입력 음성에 포함되는 커맨드에 따라, 지정 악곡을 재생할 수 있다.
한편, 단계 S608에 있어서, 추출된 동작 정보에 음성 인식 기능의 사용이 지정되어 있지 않을 때는(S608, No), 추출된 동작 정보를 바탕으로, 지정의 음악 재생 기기에 의해 지정 악곡을 재생하기 위한 동작 지시 신호를 생성하고(S612), 당해 동작 지시 신호를, 단계 S606에서 결정한 대체 접속 경로를 통해, 상기 지정의 음악 재생 기기에 송신하여(S614), 대체 접속 처리를 종료한다.
이상 설명한 바와 같이, 제 1 및 제 2의 실시 형태에 관한 음성 입력 처리 장치(10, 1000)는, 입력된 음성의 내용을 주 음성 인식부(210)에 의해 인식하여 당해 음성에 포함되는 커맨드를 추출해, 조작 스위치(176) 및/또는 디스플레이(174)의 터치 스크린에 의해 입력되는 동작 지시 정보 및/또는 상기 추출된 커맨드에 기초하여, 커맨드 처리 유닛(212, 1012)에 의해, 예를 들면 음성 입력 처리 장치가 실시하는 음악 재생 동작이나 내비게이션 동작을 제어 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)에 음악 재생 동작이나 내비게이션 동작을 지시한다. 또한, 커맨드 처리 유닛(212, 1012)은, 상기 동작 지시 정보의 적어도 일부 및/또는 상기 커맨드의 내용의 적어도 일부(예를 들면, 음악 재생 동작에 이용하는 악곡의 곡명 또는 내비게이션 동작에서의 경로 탐색에 이용하는 목적지의 지명)와, 당해 동작 지시 정보 및/또는 커맨드에 기초하여 실시한 음성 입력 처리 장치 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)의 동작(음악 재생 동작이나 내비게이션 동작)의 내용, 을 관련지어진 동작 정보를, 동작 이력으로서 기억 장치(102)에 기억한다. 그리고, 커맨드 처리 유닛(212, 1012)은, 새로운 음성이 입력되었을 때는, 주 음성 인식 유닛(210)에 의해 추출되는 커맨드의 내용의 적어도 일부가 포함되는 동작 정보를 동작 이력으로부터 추출하고, 상기 추출되는 커맨드와 상기 추출된 동작 정보에 기초하여 음성 입력 처리 장치의 동작을 제어하고 및/또는 제 1 ~ 제 4 외부 기기(110 ~ 116)에 동작을 지시한다.
이에 의해, 음성 입력 처리 장치(10, 1000)에서는, 간략화된 음성 커맨드(예를 들면, 악곡명이나 목적지의 지명만을 지정하는 음성 커맨드)의 사용을 가능하게 하고, 또한 음성 입력 처리 장치가 구비하는 음성 인식 기능(예를 들면, 음성 인식 유닛(210, 216, 222, 228, 234)이 실시하는 음성 인식 기능)이나 외부 기기가 구비하는 음성 인식 기능(예를 들면, 제 1, 제 2 외부 기기(110, 112)의 음성 인식 유닛(140, 142)에 의한 음성 인식 기능)의 동작 경합을 방지하여 그 기능의 실행을 적절하게 관리할 수 있다.