ES2964533T3 - Método de control de voz y dispositivo electrónico - Google Patents
Método de control de voz y dispositivo electrónico Download PDFInfo
- Publication number
- ES2964533T3 ES2964533T3 ES19886971T ES19886971T ES2964533T3 ES 2964533 T3 ES2964533 T3 ES 2964533T3 ES 19886971 T ES19886971 T ES 19886971T ES 19886971 T ES19886971 T ES 19886971T ES 2964533 T3 ES2964533 T3 ES 2964533T3
- Authority
- ES
- Spain
- Prior art keywords
- interface
- voice
- application
- electronic device
- control
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72403—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality
- H04M1/7243—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality with interactive means for internal management of messages
- H04M1/72433—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality with interactive means for internal management of messages for voice messaging, e.g. dictaphones
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/26—Speech to text systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/01—Input arrangements or combined input and output arrangements for interaction between user and computer
- G06F3/048—Interaction techniques based on graphical user interfaces [GUI]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/01—Input arrangements or combined input and output arrangements for interaction between user and computer
- G06F3/048—Interaction techniques based on graphical user interfaces [GUI]
- G06F3/0484—Interaction techniques based on graphical user interfaces [GUI] for the control of specific functions or operations, e.g. selecting or manipulating an object, an image or a displayed text element, setting a parameter value or selecting a range
- G06F3/04842—Selection of displayed objects or displayed text elements
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/01—Input arrangements or combined input and output arrangements for interaction between user and computer
- G06F3/048—Interaction techniques based on graphical user interfaces [GUI]
- G06F3/0487—Interaction techniques based on graphical user interfaces [GUI] using specific features provided by the input device, e.g. functions controlled by the rotation of a mouse with dual sensing arrangements, or of the nature of the input device, e.g. tap gestures based on pressure sensed by a digitiser
- G06F3/0488—Interaction techniques based on graphical user interfaces [GUI] using specific features provided by the input device, e.g. functions controlled by the rotation of a mouse with dual sensing arrangements, or of the nature of the input device, e.g. tap gestures based on pressure sensed by a digitiser using a touch-screen or digitiser, e.g. input of commands through traced gestures
- G06F3/04883—Interaction techniques based on graphical user interfaces [GUI] using specific features provided by the input device, e.g. functions controlled by the rotation of a mouse with dual sensing arrangements, or of the nature of the input device, e.g. tap gestures based on pressure sensed by a digitiser using a touch-screen or digitiser, e.g. input of commands through traced gestures for inputting data by handwriting, e.g. gesture or text
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/16—Sound input; Sound output
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/16—Sound input; Sound output
- G06F3/165—Management of the audio stream, e.g. setting of volume, audio stream path
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F3/00—Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
- G06F3/16—Sound input; Sound output
- G06F3/167—Audio in a user interface, e.g. using voice commands for navigating, audio feedback
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/02—Constructional features of telephone sets
- H04M1/03—Constructional features of telephone transmitters or receivers, e.g. telephone hand-sets
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72403—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72403—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality
- H04M1/72406—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality by software upgrading or downloading
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72448—User interfaces specially adapted for cordless or mobile telephones with means for adapting the functionality of the device according to specific conditions
- H04M1/72454—User interfaces specially adapted for cordless or mobile telephones with means for adapting the functionality of the device according to specific conditions according to context-related or environment-related conditions
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/223—Execution procedure of a spoken command
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L2021/02161—Number of inputs available containing the signal or the noise to be suppressed
- G10L2021/02165—Two microphones, one receiving mainly the noise signal and the other one mainly the speech signal
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L2021/02161—Number of inputs available containing the signal or the noise to be suppressed
- G10L2021/02166—Microphone arrays; Beamforming
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M1/00—Substation equipment, e.g. for use by subscribers
- H04M1/72—Mobile telephones; Cordless telephones, i.e. devices for establishing wireless links to base stations without route selection
- H04M1/724—User interfaces specially adapted for cordless or mobile telephones
- H04M1/72403—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality
- H04M1/72442—User interfaces specially adapted for cordless or mobile telephones with means for local support of applications that increase the functionality for playing music files
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04M—TELEPHONIC COMMUNICATION
- H04M2250/00—Details of telephonic subscriber devices
- H04M2250/74—Details of telephonic subscriber devices with voice recognition means
Landscapes
- Engineering & Computer Science (AREA)
- Human Computer Interaction (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Health & Medical Sciences (AREA)
- General Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- General Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Acoustics & Sound (AREA)
- Computer Networks & Wireless Communication (AREA)
- General Health & Medical Sciences (AREA)
- Quality & Reliability (AREA)
- Environmental & Geological Engineering (AREA)
- General Business, Economics & Management (AREA)
- Business, Economics & Management (AREA)
- Telephone Function (AREA)
- User Interface Of Digital Computer (AREA)
Abstract
Se proporciona un método de control por voz y un dispositivo electrónico, comprendiendo el método: mostrar una primera interfaz de una aplicación, comprendiendo la primera interfaz un control utilizado para actualizar la primera interfaz; en respuesta a una señal de despertar introducida por un usuario, iniciar una aplicación de voz en segundo plano; mostrar M sugerencias de entrada de voz en la primera interfaz, en donde cada sugerencia de entrada de voz corresponde a al menos un control en la primera interfaz; adquirir una señal de control de voz introducida por el usuario, correspondiendo la señal de control de voz a una primera sugerencia de entrada de voz entre las M sugerencias de entrada de voz; y en respuesta a la señal de control de voz, mostrar una segunda interfaz de la aplicación, siendo la segunda interfaz una interfaz actualizada después de que se activa un primer control en la primera interfaz, y correspondiendo el primer control a la primera sugerencia de entrada de voz. Por lo tanto, se puede solicitar al usuario que realice una tarea de voz relacionada con la aplicación durante la ejecución de la aplicación, mejorando así la eficiencia del control de voz y la experiencia del usuario del dispositivo electrónico. (Traducción automática con Google Translate, sin valor legal)
Description
DESCRIPCIÓN
Método de control de voz y dispositivo electrónico
Campo técnico
La presente solicitud se refiere al campo de las tecnologías de comunicaciones y, en particular, a un método de control por voz y a un dispositivo electrónico.
Antecedentes
Una tecnología de reconocimiento de voz es una tecnología que permite a una máquina (p. ej., un teléfono móvil o un dispositivo portátil) convertir una señal acústica en un texto o comando correspondiente mediante su reconocimiento y su comprensión. Hoy en día, muchos teléfonos móviles tienen instalada una aplicación de voz que se usa para el reconocimiento de voz, tal como un asistente de voz (p. ej., Xiaoai, Siri y Xiao E). Normalmente, en el teléfono móvil se pueden preestablecer una o más señales de activación (p. ej., una señal de golpeo o una palabra de activación tal como “ Hola, Xiao E” ). Cuando se detecta que un usuario ha introducido estas señales de activación, esto indica que el usuario tiene intención de usar una función de reconocimiento de voz en ese momento. Por lo tanto, puede hacerse que el teléfono móvil inicie la aplicación de voz para realizar un reconocimiento de voz y a continuación ejecutar una tarea de voz correspondiente.
Normalmente, antes de entregarse, en el teléfono móvil se preconfigura una tarea de voz específica que el teléfono móvil puede reconocer y ejecutar, por ejemplo, una tarea de voz para ver qué tiempo va a hacer y una tarea de voz para llamar a un contacto. Tal y como se muestra en la Fig. 1, el usuario puede ver, en una interfaz 101 de ajustes de la aplicación de voz, todas las tareas de voz que cada aplicación admite específicamente. Sin embargo, como las tareas de voz son de diversos tipos, en un proceso específico de uso de la aplicación, el usuario puede olvidar si la aplicación admite la función de reconocimiento de voz u olvidar una tarea específica de la aplicación que puede controlarse mediante voz. En consecuencia, la aplicación de voz del teléfono móvil no se usa mucho, la función de reconocimiento de voz de la aplicación de voz no puede usarse plenamente en el teléfono móvil y la aplicación de voz no puede ayudar al usuario a desocupar sus manos. El documento WO 2010/141802 se refiere en general a técnicas y sistemas para implementar comandos de voz contextuales. En particular, en un dispositivo se visualiza un elemento de datos en un primer contexto. En el dispositivo se recibe una entrada física que selecciona, en el primer contexto, el elemento de datos visualizado. En el dispositivo se recibe una entrada de voz que relaciona el elemento de datos seleccionado con una operación en un segundo contexto. La operación se realiza, en el segundo contexto, en el elemento de datos seleccionado. Las realizaciones de la presente solicitud proporcionan un método de control por voz y un dispositivo electrónico para que se pueda incitar a un usuario a que ejecute, en un proceso de ejecución de una aplicación, una tarea de voz relacionada con la aplicación. Esto mejora la eficiencia del control por voz de una aplicación de voz instalada en el dispositivo electrónico y la experiencia de usuario. En particular, se proporciona un dispositivo electrónico que tiene las características de la reivindicación independiente 1. En las reivindicaciones dependientes preferidas se definen realizaciones.
Para lograr los anteriores objetivos, en la presente solicitud se utilizan las siguientes soluciones técnicas.
Según un primer ejemplo que no está abarcado por las reivindicaciones, en la presente solicitud se proporciona un método de control por voz, que incluye: visualizar, por parte de un dispositivo electrónico, una primera interfaz de una aplicación, donde la primera interfaz incluye un control que se usa para actualizar la primera interfaz; si se recibe una señal de activación introducida por un usuario, habilitar, por parte del dispositivo electrónico, una aplicación de voz en segundo plano; además, visualizar, por parte del dispositivo electrónico, en la primera interfaz, M (donde M es un entero mayor que 0) incitadores de entrada por voz proporcionados por la aplicación de voz, donde cada incitador de entrada por voz corresponde a al menos un control en la primera interfaz; posteriormente, captar, por parte del dispositivo electrónico usando la aplicación de voz habilitada (p. ej., un asistente de voz como Siri o Xiao E), una señal de control por voz introducida por el usuario; y, si la señal de control por voz corresponde a un primer incitador de entrada por voz de los M incitadores de entrada por voz, visualizar, por parte del dispositivo electrónico, una segunda interfaz de la aplicación en respuesta a la señal de control por voz, donde la segunda interfaz es una interfaz obtenida por actualización después de que se active un primer control (donde el primer control corresponde al primer incitador de entrada por voz) en la primera interfaz.
En otras palabras, cuando el dispositivo electrónico visualiza una interfaz de una aplicación, si se detecta que el usuario ha activado la aplicación de voz, el dispositivo electrónico puede incitar, usando la aplicación de voz, al usuario a que introduzca un incitador de entrada por voz en la interfaz actual. El incitador de entrada por voz está asociado con uno o más controles en la interfaz. De este modo, una vez que se detecta que el usuario ha introducido una señal de control por voz que corresponde a un incitador de entrada por voz, el dispositivo electrónico puede activar un control correspondiente basándose en la señal de control por voz, de modo que el dispositivo electrónico actualiza la interfaz que se está visualizando. De este modo, en un proceso de uso de la aplicación, el usuario puede introducir, en el dispositivo electrónico, basándose en el incitador de entrada por voz, una señal de control por voz que puede ejecutarse en la interfaz actual. Esto mejora la eficiencia del control por voz de una aplicación de voz instalada en el dispositivo electrónico y mejora la experiencia de usuario.
En un posible método de diseño, después de habilitar, por parte del dispositivo electrónico, una aplicación de voz en segundo plano, el método incluye además: si se detecta una operación de control táctil realizada por el usuario sobre el control en la primera interfaz, ejecutar, por parte del dispositivo electrónico, una instrucción de operación que corresponde a la operación de control táctil. En otras palabras, después de que el dispositivo electrónico habilite la aplicación de voz en segundo plano, como la aplicación de voz que se está ejecutando en segundo plano no afecta a la interacción entre el usuario y la aplicación en primer plano, el usuario aún puede manejar el control en la primera interfaz en la primera interfaz visualizada.
En un posible método de diseño, después de la habilitación, por parte del dispositivo electrónico, de una aplicación de voz en segundo plano, el método incluye además: visualizar, por parte del dispositivo electrónico, un identificador de la aplicación de voz en la primera interfaz para indicar al usuario que se está habilitando o se ha habilitado la aplicación de voz en segundo plano. El identificador de la aplicación de voz puede visualizarse en la primera interfaz en forma de botón flotante, y el usuario puede ajustar una ubicación del identificador en la primera interfaz.
En un posible método de diseño, después de la visualización, por parte de un dispositivo electrónico, de una primera interfaz de una aplicación, el método incluye además: visualizar, por parte del dispositivo electrónico, un botón de incitación en la primera interfaz; y, si el dispositivo electrónico recibe una operación de clic de hacer clic en el botón de incitación por parte del usuario, visualizar, por parte del dispositivo electrónico, los M incitadores de entrada por voz en la primera interfaz en respuesta a la operación de clic.
En un posible método de diseño, después de la visualización, por parte de un dispositivo electrónico, de una primera interfaz de una aplicación, el método incluye además: obtener, por parte del dispositivo electrónico, un archivo de configuración que está asociado con la primera interfaz, donde el archivo de configuración registrada N (donde N es un entero mayor o igual que M) tareas de voz que pueden ser ejecutadas por el dispositivo electrónico en la primera interfaz; y, en este caso, la visualización, por parte del dispositivo electrónico en la primera interfaz, de M incitadores de entrada por voz incluye: visualizar, por parte del dispositivo electrónico, los M incitadores de entrada por voz en la primera interfaz basándose en el archivo de configuración, donde cada incitador de entrada por voz está asociado con una tarea de voz en el archivo de configuración. Por ejemplo, un incitador de entrada por voz “ reproducir” está asociado con una tarea de reproducción en el archivo de configuración.
Por ejemplo, los M incitadores de entrada por voz pueden mantener una correspondencia unívoca con M tareas de voz cuyas frecuencias de uso son, cada una, mayores que un umbral de las N tareas de voz.
En un posible método de diseño, el archivo de configuración incluye además una correspondencia entre una primera tarea de voz y un primer evento táctil del primer control, donde la primera tarea de voz es una de las N tareas de voz; después de la captación, por parte del dispositivo electrónico, de una señal de control por voz introducida por el usuario, el método incluye además: determinar, por parte del dispositivo electrónico, que una tarea de voz que corresponde a la señal de control por voz es la primera tarea de voz; y la visualización, por parte del dispositivo electrónico, de una segunda interfaz de la aplicación en respuesta a la señal de control por voz incluye: ejecutar, por parte del dispositivo electrónico, el primer evento táctil sobre el primer control en respuesta a la señal de control por voz, de modo que el dispositivo electrónico actualiza la primera interfaz a la segunda interfaz.
En otras palabras, el dispositivo electrónico puede convertir, basándose en el archivo de configuración de la primera interfaz, la señal de control por voz introducida por el usuario en un evento táctil correspondiente y luego ejecutarlo. Esto implementa una función de control de cada botón de operación en la primera interfaz usando palabras. De este modo, el dispositivo electrónico puede implementar, en cada interfaz de la aplicación, una función de control por voz para cada botón de operación que haya en la interfaz. Esto mejora la eficiencia del control por voz del teléfono móvil y la experiencia de usuario. En un posible método de diseño, cuando el dispositivo electrónico ejecuta el primer evento táctil sobre el primer control, el método incluye además: visualizar, por parte del dispositivo electrónico, un efecto de animación, que se presenta cuando el usuario ejecuta el primer evento táctil sobre el primer control para que el usuario tenga una buena experiencia de usuario tanto en una GUI como en una VUI.
En un posible método de diseño, después de la captación, por parte del dispositivo electrónico, de una señal de control por voz introducida por el usuario, el método incluye además: enviar, por parte del dispositivo electrónico, la señal de control por voz y una información de interfaz de la primera interfaz a un servidor para que el servidor reconozca, basándose en la información de interfaz, la tarea de voz que corresponde a la señal de control por voz, donde la información de interfaz incluye al menos uno de entre un identificador de la primera interfaz, un tipo de página de la primera interfaz y un tipo de aplicación a la que pertenece la primera interfaz. En este caso, como la información de interfaz puede reflejar un escenario de uso real del dispositivo electrónico actual, el servidor puede realizar con mayor precisión, basándose en la información de interfaz, un reconocimiento de la voz sobre la señal de control por voz introducida por el usuario para determinar con mayor precisión una tarea de voz real que ha de ejecutar el usuario. Según un segundo ejemplo que no está abarcado por las reivindicaciones, la presente solicitud proporciona un dispositivo electrónico que incluye una pantalla táctil, donde la pantalla táctil incluye una superficie sensible al tacto y un visualizador; uno o más procesadores; una o más memorias; un módulo de comunicaciones; y uno o más programas informáticos. El procesador está acoplado a cada uno de la pantalla táctil, el módulo de comunicaciones y la memoria. Los uno o más programas informáticos están almacenados en la memoria. Cuando el dispositivo electrónico está encendido, el procesador ejecuta los uno o más programas informáticos que están almacenados en la memoria, de modo que el dispositivo electrónico realiza el método de control por voz según uno cualquiera de los diseños posibles.
Según un tercer ejemplo que está no abarcado por las reivindicaciones, la presente solicitud proporciona un medio de almacenamiento informático que incluye una instrucción informática. Cuando la instrucción informática se ejecuta en un dispositivo electrónico, el dispositivo electrónico queda habilitado para realizar el método de control por voz según uno cualquiera de los diseños posibles del primer ejemplo.
Según un cuarto ejemplo que no está abarcado por las reivindicaciones, la presente solicitud proporciona un producto de programa informático. Cuando el programa informático se ejecuta en un dispositivo electrónico, el dispositivo electrónico queda habilitado para realizar el método de control por voz según uno cualquiera de los diseños posibles del primer ejemplo. Puede entenderse que el terminal según el segundo ejemplo, el medio de almacenamiento informático según el tercer ejemplo y el producto de programa informático según el cuarto ejemplo se usan todos para realizar el correspondiente método proporcionado anteriormente. Por lo tanto, a fin de obtener los efectos beneficiosos que pueden tener el terminal, el medio de almacenamiento informático y el producto de programa informático, véanse los efectos beneficiosos de los correspondientes métodos proporcionados anteriormente. En la presente memoria no se describen los detalles.
Breve descripción de los dibujos
La Fig. 1 es un diagrama esquemático de una interfaz de ajustes de una aplicación de voz de la técnica anterior; la Fig. 2 es un diagrama estructural esquemático 1 de un dispositivo electrónico según una realización de la presente solicitud;
la Fig. 3 es un diagrama arquitectónico esquemático de un sistema operativo en un dispositivo electrónico según una realización de la presente solicitud;
la Fig. 4 es un diagrama 1 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 5 es un diagrama de flujo esquemático de un método de control por voz según una realización de la presente solicitud; la Fig. 6 es un diagrama 2 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 7A es un diagrama 3 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 7B es un diagrama esquemático de un escenario que se muestra cuando una aplicación de voz se ejecuta en primer plano en la técnica anterior;
la Fig. 8 es un diagrama 4 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 9(a) y la Fig. 9(b) son un diagrama 5 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 10 es un diagrama 6 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 11 es un diagrama 7 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 12 es un diagrama 8 de escenario esquemático de un método de control por voz según una realización de la presente solicitud;
la Fig. 13 es un diagrama 9 de escenario esquemático de un método de control por voz según una realización de la presente solicitud; y
la Fig. 14 es un diagrama estructural esquemático 2 de un dispositivo electrónico según una realización de la presente solicitud.
Descripción de las realizaciones
A continuación se describen con detalle las implementaciones de las realizaciones de la presente solicitud haciendo referencia a los dibujos adjuntos.
Un método de control por voz que se proporciona en las realizaciones de la presente solicitud puede aplicarse a un dispositivo electrónico, tal como un teléfono móvil, una tableta, un ordenador de sobremesa, un ordenador portátil, un ordenador microportátil, un ordenador personal ultraportátil (Ultra-Mobile Personal Computer - UMPC), un ordenador de mano, un subportátil, un asistente digital personal (Personal Digital Assistant - PDA), un dispositivo electrónico ponible o un dispositivo de realidad virtual. Este aspecto no está limitado en las realizaciones de la presente solicitud. Por ejemplo, la Fig. 2 es un diagrama estructural esquemático de un dispositivo electrónico 100.
El dispositivo electrónico 100 puede incluir un procesador 110, una interfaz 120 de memoria externa, una memoria interna 121, un puerto 130 de bus serie universal (Universal Serial Bus - USB), un módulo 140 de gestión de carga, un módulo 141 de gestión de energía, una batería 142, una antena 1, una antena 2, un módulo 150 de comunicaciones móviles, un módulo 160 de comunicaciones inalámbricas, un módulo 170 de audio, un altavoz 170A, un receptor 170B, un micrófono 170C, un conector 170D de cascos, un módulo 180 de sensores, una tecla 190, un motor 191, un indicador 192, una cámara 193, un visualizador 194, una interfaz 195 de tarjeta de módulo de identidad de abonado (Subscriber Identification Module - SIM) y componentes similares. El módulo 180 de sensores puede incluir un sensor 180A de presión, un sensor 180B de giroscopio, un sensor 180C de presión barométrica, un sensor magnético 180D, un sensor 180E de aceleración, un sensor 180F de distancia, un sensor 180G óptico de proximidad, un sensor 180H de huella dactilar, un sensor 180J de temperatura, un sensor táctil 180K, un sensor óptico ambiental 180L, un sensor 180M de conducción ósea y sensores similares.
Puede entenderse que la estructura que se muestra en esta realización de la presente solicitud no constituye una limitación específica del dispositivo electrónico 100. En algunas otras realizaciones de la presente solicitud, el dispositivo electrónico 100 puede incluir más o menos componentes que los mostrados en la figura, o algunos componentes pueden combinarse, o algunos componentes pueden dividirse, o pueden usarse distintas disposiciones de componentes. Los componentes mostrados en la figura pueden implementarse mediante hardware, software o una combinación de software y hardware. El procesador 110 puede incluir una o más unidades de procesamiento. Por ejemplo, el procesador 110 puede incluir un procesador de aplicaciones (Application Processor - AP), un procesador de módem, una unidad de procesamiento de gráficos (Graphics Processing Unit - GPU), un procesador de señales de imagen (Image Signal Processor - ISP), un controlador, una memoria, un códec de vídeo, un procesador de señales digitales (Digital Signal Processor - DSP), un procesador de banda base, una unidad de procesamiento de red neuronal (Neuralnetwork Processing Unit - NPU) y/o componentes similares. Distintas unidades de procesamiento pueden ser componentes independientes o pueden estar integradas en uno o más procesadores.
El controlador puede ser un centro nervioso y un centro de mando del dispositivo electrónico 100. El controlador puede generar una señal de control de operación basándose en un código de operación por instrucción y una señal de secuencia de tiempo para realizar un control absoluto de una lectura de instrucción y de una ejecución de instrucción. Además, en el procesador 110 puede disponerse una memoria que esté configurada para almacenar una instrucción y datos. En algunas realizaciones, la memoria en el procesador 110 es una memoria caché. La memoria puede almacenar una instrucción o datos que hayan sido usados o usados cíclicamente por el procesador 110. Si el procesador 110 necesita usar de nuevo la instrucción o los datos, el procesador 110 puede invocar directamente de la memoria la instrucción o los datos. Esto evita un acceso recurrente por parte, y reduce el tiempo de espera, del procesador 110. Por lo tanto, el rendimiento del sistema mejora.
En algunas realizaciones, el procesador 110 puede incluir una o más interfaces. La interfaz puede incluir una interfaz de circuito interintegrado (Inter-Integrated Circuit - I2C), una interfaz de sonido de circuito interintegrado (Inter-Integrated Circuit Sound - I2S), una interfaz de modulación por impulsos codificados (Pulse Code Modulation - PCM), una interfaz de emisor-receptor asíncrono universal (Universal Asynchronous Receiver/Transmitter - UART), una interfaz de procesador de la industria móvil (Mobile Industry Processor Interface - MIPI), una interfaz de entrada/salida de uso general (General-Purpose Input/Output - GPIO), una interfaz de módulo de identidad de abonado (Subscriber Identity Module - SIM), una interfaz de bus serie universal (Universal Serial Bus - USB) e/o interfaces similares. La interfaz I2C es un bus serie de sincronización bidireccional e incluye una línea de datos en serie (Serial Data Line - SDA) y una línea de reloj en serie (Derail Clock Line - SCL). En algunas realizaciones, el procesador 110 puede incluir una pluralidad de grupos de buses I2C. El procesador 110 puede acoplarse por separado al sensor táctil 180K, a un cargador, a un flash, a la cámara 193 y a dispositivos similares usando distintas interfaces de bus I2C. Por ejemplo, el procesador 110 puede acoplarse al sensor táctil 180K usando la interfaz I2C con el fin de que el procesador 110 se comunique con el sensor táctil 180K utilizando de la interfaz de bus I2C para implementar una función táctil del dispositivo electrónico 100.
La interfaz I2S puede configurarse para realizar una comunicación de audio. En algunas realizaciones, el procesador 110 puede incluir una pluralidad de grupos de buses I2S. El procesador 110 puede acoplarse al módulo 170 de audio usando el bus I2S para implementar una comunicación entre el procesador 110 y el módulo 170 de audio. En algunas realizaciones, el módulo 170 de audio puede transmitir una señal de audio al módulo 160 de comunicaciones inalámbricas usando la interfaz I2S para implementar una función de respuesta a una llamada usando unos cascos Bluetooth.
La interfaz PCM también puede usarse para una comunicación de audio, y muestra, cuantifica y codifica una señal analógica. En algunas realizaciones, el módulo 170 de audio puede acoplarse al módulo 160 de comunicaciones inalámbricas usando una interfaz de bus PCM. En algunas realizaciones, el módulo 170 de audio puede transmitir una señal de audio al módulo 160 de comunicaciones inalámbricas usando la interfaz PCM para implementar una función de respuesta a una llamada usando unos cascos Bluetooth. Tanto la interfaz I2S como la interfaz PCM pueden configurarse para realizar una comunicación de audio.
La interfaz UART es un bus de datos serie universal y está configurado para una comunicación asíncrona. El bus puede ser un bus de comunicaciones bidireccionales. El bus convierte los datos a transmitir entre una comunicación en serie y una comunicación en paralelo. En algunas realizaciones, la interfaz UART normalmente está configurada para conectar el procesador 110 y el módulo 160 de comunicaciones inalámbricas. Por ejemplo, el procesador 110 se comunica con un módulo Bluetooth en el módulo 160 de comunicaciones inalámbricas usando la interfaz UART para implementar una función Bluetooth. En algunas realizaciones, el módulo 170 de audio puede transferir una señal de audio al módulo 160 de comunicaciones inalámbricas usando la interfaz UART para implementar una función de reproducción de música usando unos cascos Bluetooth.
La interfaz MIPI puede configurarse para conectar el procesador 110 a un componente periférico como el visualizador 194 o la cámara 193. La interfaz MIPI incluye una interfaz en serie de cámara (Camera Serial Interface - CSI), una interfaz en serie de visualizador (Display Serial Interface - DSI) e interfaces similares. En algunas realizaciones, el procesador 110 se comunica con la cámara 193 usando la interfaz CSI para implementar una función de realización de fotografías del dispositivo electrónico 100. El procesador 110 se comunica con el visualizador 194 usando la interfaz DSI para implementar una función de visualización del dispositivo electrónico 100.
La interfaz GPIO puede configurarse mediante software. La interfaz GPIO puede configurarse como una señal de control o como una señal de datos. En algunas realizaciones, la interfaz GPIO puede configurarse para conectar el procesador 110 a la cámara 193, el visualizador 194, el módulo 160 de comunicaciones inalámbricas, el módulo 170 de audio, el módulo 180 de sensores y componentes similares. La interfaz GPIO también puede configurarse como la interfaz I2C, la interfaz I2S, la interfaz UART, la interfaz MIPI e interfaces similares.
La interfaz USB 130 es una interfaz que se ajusta a una especificación del estándar USB y puede ser, específicamente, una interfaz mini USB, una interfaz micro USB, una interfaz USB de tipo-C o una interfaz similar. La interfaz USB 130 puede configurarse para conectarse al cargador para cargar el dispositivo electrónico 100, o puede configurarse para realizar una transmisión de datos entre el dispositivo electrónico 100 y un dispositivo periférico, o puede configurarse para conectarse a unos cascos para reproducir audio por los mismos. La interfaz puede además configurarse para conectar a otro dispositivo electrónico, tal como un dispositivo de RA.
Puede entenderse que una relación de conexión por interfaz entre los módulos que se muestran en esta realización de la presente solicitud es meramente un ejemplo a efectos descriptivos y no constituye una limitación de una estructura del dispositivo electrónico 100. En algunas otras realizaciones de la presente solicitud, el dispositivo electrónico 100 puede, alternativamente, usar una manera de conexión por interfaz diferente de la de la realización anterior o una combinación de una pluralidad de maneras de conexión por interfaz.
El módulo 140 de gestión de carga está configurado para recibir del cargador una entrada de carga. El cargador puede ser un cargador inalámbrico o un cargador cableado. En algunas realizaciones de carga por cable, el módulo 140 de gestión de carga puede recibir una entrada de carga de un cargador cableado usando la interfaz USB 130. En algunas realizaciones de carga inalámbrica, el módulo 140 de gestión de carga puede recibir una entrada de carga inalámbrica mediante una bobina de carga inalámbrica del dispositivo electrónico 100. El módulo 140 de gestión de carga suministra energía al dispositivo electrónico usando el módulo 141 de gestión de energía mientras carga la batería 142.
El módulo 141 de gestión de energía está configurado para conectar la batería 142 y el módulo 140 de gestión de carga al procesador 110. El módulo 141 de gestión de energía recibe una entrada de la batería 142 y/o del módulo 140 de gestión de carga y suministra energía al procesador 110, la memoria interna 121, una memoria externa, el visualizador 194, la cámara 193, el módulo 160 de comunicaciones inalámbricas y componentes similares. El módulo 141 de gestión de energía puede además configurarse para monitorizar parámetros tales como una capacidad de batería, un recuento de ciclos de batería y un estado de salud de batería (fuga o impedancia eléctrica). En algunas otras realizaciones, el módulo 141 de gestión de energía puede disponerse, alternativamente, en el procesador 110. En algunas otras realizaciones, el módulo 141 de gestión de energía y el módulo 140 de gestión de carga pueden disponerse, alternativamente, en un mismo dispositivo.
Una función de comunicación inalámbrica del dispositivo electrónico 100 puede implementarse usando la antena 1, la antena 2, el módulo 150 de comunicaciones móviles, el módulo 160 de comunicaciones inalámbricas, el procesador de módem, el procesador de banda base y componentes similares.
La antena 1 y la antena 2 están configuradas para transmitir y recibir una señal de onda electromagnética. Cada antena del dispositivo electrónico 100 puede configurarse para cubrir una o más bandas de frecuencias de comunicaciones. Además, pueden multiplexarse distintas antenas para mejorar la utilización de antena. Por ejemplo, la antena 1 puede multiplexarse como una antena de diversidad de una red de área local inalámbrica. En algunas otras realizaciones, la antena se puede usar en combinación con un interruptor de sintonización.
El módulo 150 de comunicaciones móviles puede proporcionar una solución, aplicada al dispositivo electrónico 100, a la comunicación inalámbrica, incluidas la 2G, la 3G, la 4G, la 5G y comunicaciones similares. El módulo 150 de comunicaciones móviles puede incluir al menos un filtro, un interruptor, un amplificador de potencia, un amplificador de bajo ruido (Low Noise Amplifier - LNA) y componentes similares. El módulo 150 de comunicaciones móviles puede recibir una onda electromagnética usando la antena 1, realizar un procesamiento, tal como un filtrado o una amplificación, de la onda electromagnética recibida y transmitir la onda electromagnética al procesador de módem para su demodulación. El módulo 150 de comunicaciones móviles puede además amplificar una señal modulada por el procesador de módem y convertirla en una onda electromagnética para radiarse usando la antena 1. En algunas realizaciones, al menos algunos módulos de función del módulo 150 de comunicaciones móviles pueden estar dispuestos en el procesador 110. En algunas realizaciones, al menos algunos módulos de función del módulo 150 de comunicaciones móviles pueden estar dispuestos en un mismo dispositivo, al igual que al menos algunos módulos en el procesador 110.
El procesador de módem puede incluir un modulador y un demodulador. El modulador está configurado para modular una señal de banda base de baja frecuencia a enviar en una señal de media o de alta frecuencia. El demodulador está configurado para demodular una señal de onda electromagnética recibida en una señal de banda base de baja frecuencia. Luego, el demodulador transmite la señal de banda base de baja frecuencia obtenida por demodulación al procesador de banda base para su procesamiento. La señal de banda base de baja frecuencia es procesada por el procesador de banda base y transmitida luego al procesador de aplicaciones. El procesador de aplicaciones da salida a una señal acústica usando un dispositivo de audio (que no se limita al altavoz 170A, el receptor 170B o dispositivos similares) o visualiza una imagen o un vídeo usando el visualizador 194. En algunas realizaciones, el procesador de módem puede ser un componente independiente. En algunas otras realizaciones, el procesador de módem puede ser independiente del procesador 110, y está dispuesto en un mismo dispositivo al igual que el módulo 150 de comunicaciones móviles u otro módulo de función.
El módulo 160 de comunicaciones inalámbricas puede proporcionar una solución, aplicada al dispositivo electrónico 100, a la comunicación inalámbrica, incluidos una red de área local inalámbrica (Wireless Local Area Networks -WLAN) (p. ej., una red de fidelidad inalámbrica [Wireless Fidelity - Wi-Fi]), Bluetooth (BT), un sistema mundial de navegación por satélite (Global Navigation Satellite System - GNSS), una modulación de frecuencia (Frequency Modulation - FM), una comunicación de campo cercano (Near Field Communication - NFC), una tecnología infrarroja (IR) y similares. El módulo 160 de comunicaciones inalámbricas puede ser uno o más componentes que integran al menos un módulo procesador de comunicaciones. El módulo 160 de comunicaciones inalámbricas recibe una onda electromagnética usando la antena 2, realiza un procesamiento de modulación y filtrado de frecuencia de una señal de onda electromagnética y envía una señal procesada al procesador 110. El módulo 160 de comunicaciones inalámbricas puede además recibir del procesador 110 una señal a enviar, realizar una modulación y una amplificación de frecuencia de la señal y convertirla en una onda electromagnética para radiarse usando la antena 2.
En algunas realizaciones, la antena 1 y el módulo 150 de comunicaciones móviles del dispositivo electrónico 100 están acoplados, y la antena 2 y el módulo 160 de comunicaciones inalámbricas del dispositivo electrónico 100 están acoplados para que el dispositivo electrónico 100 pueda comunicarse con una red y con otro dispositivo usando una tecnología de comunicaciones inalámbricas. La tecnología de comunicaciones inalámbricas puede incluir un sistema global de comunicaciones móviles (Global System for Mobile communications - GSM), un servicio general de radio por paquetes (General Packet Radio Service - GPRS), un acceso múltiple por división de código (Code Division Multiple Access - CDMA), un acceso múltiple por división de código de banda ancha (Wideband Code Division Multiple Access - WCDMA), un acceso múltiple por división de código por división de tiempo (Time-Division Code Division Multiple Access - TD-SCDMA), una evolución a largo plazo (Long Term Evolution - LTE), una tecnología BT, un sistema GNSs , una red WLAN, una comunicación NFC, una modulación FM, una tecnología IR y/o tecnologías similares. El sistema GNSS puede incluir un sistema de posicionamiento global (Global Positioning System - GPS), un sistema mundial de navegación por satélite (Global Navigation Satellite System - GLONASS), un sistema de navegación por satélite BeiDou (BeiDou Navigation Satellite System - BDS), un sistema por satélite cuasicenital (Quasi-Zenith Satellite System - QZSS) y/o un sistema de aumentación basado en satélites (Satellite Based Augmentation Systems - SBAS).
El dispositivo electrónico 100 implementa una función de visualización usando la unidad GPU, el visualizador 194, el procesador de aplicaciones y componentes similares. La unidad GPU es un microprocesador para procesar imágenes y conecta el visualizador 194 al procesador de aplicaciones. La unidad<g>P<u>está configurada para: realizar un cálculo matemático y geométrico y representar una imagen. El procesador 110 puede incluir una o más unidades GPU, que ejecutan una instrucción de programa para generar o cambiar información de visualización.
El visualizador 194 está configurado para visualizar una imagen, un vídeo y similares. El visualizador 194 incluye un panel de visualización. El panel de visualización puede ser un visualizador de cristal líquido (Liquid Crystal Display - LCD), un diodo emisor de luz orgánico (Organic Light-Emitting Diode - OLED), un diodo emisor de luz orgánico de matriz activa (Active-Matrix Organic Light Emitting Diode - AMOLED), un diodo emisor de luz flexible (Flex Light-Emitting Diode - FLED), un miniled, microled, un micro OLED, un diodo emisor de luz de punto cuántico (Quantum Dot Light Emitting Diodes - QLED) o similares. En algunas realizaciones, el dispositivo electrónico 100 puede incluir uno o N visualizadores 194, donde N es un entero positivo mayor que 1.
El dispositivo electrónico 100 puede implementar una función de realización de fotografías usando el procesador ISP, la cámara 193, el códec de vídeo, la unidad GPU, el visualizador 194, el procesador de aplicaciones y componentes similares. El procesador ISP está configurado para procesar datos facilitados por la cámara 193. Por ejemplo, durante la realización de una fotografía, se aprieta un obturador, se transmite un rayo de luz a un elemento sensible a la luz de una cámara a través de una lente y se convierte una señal óptica en una señal eléctrica. El elemento sensible a la luz de la cámara transmite la señal eléctrica al procesador ISP para su procesamiento y convierte la señal eléctrica en una imagen visible. El procesador ISP puede realizar además una optimización algorítmica del ruido, el brillo y el aspecto de la imagen. El procesador ISP puede optimizar aún más parámetros tales como la exposición y la temperatura de color de un escenario de realización de fotografías. En algunas realizaciones, el procesador ISP puede estar dispuesto en la cámara 193. La cámara 193 está configurada para capturar una imagen estática o un vídeo. Una imagen óptica se genera para un objeto utilizando una lente y se proyecta sobre el elemento sensible a la luz. El elemento sensible a la luz puede ser un dispositivo de carga acoplada (Charge Coupled Device - CCD) o un fototransistor de semiconductor complementario de óxido metálico (Complementary Metal-Oxide-Semiconductor -CMOS). El elemento sensible a la luz convierte una señal óptica en una señal eléctrica y luego transmite la señal eléctrica al procesador ISP para que la convierta en una señal de imagen digital. El procesador ISP da salida la señal de imagen digital hacia el procesador DSP para su procesamiento. El procesador DSP convierte la señal de imagen digital en una señal de imagen en un formato estándar tal como el RGB o el YUV. En algunas realizaciones, el dispositivo electrónico 100 puede incluir una o N cámaras 193, donde N es un entero positivo mayor que 1. El procesador de señales digitales está configurado para procesar una señal digital. Además de una señal de imagen digital, el procesador de señales digitales puede también procesar otra señal digital. Por ejemplo, cuando el dispositivo electrónico 100 selecciona una frecuencia, el procesador de señales digitales está configurado para realizar una transformada de Fourier en la energía de frecuencia y propiedades similares.
El códec de vídeo está configurado para comprimir o descomprimir un vídeo digital. El dispositivo electrónico 100 puede admitir uno o más códecs de vídeo. De este modo, el dispositivo electrónico 100 puede reproducir o grabar vídeos en una pluralidad de formatos de codificación, por ejemplo, grupo de expertos de imágenes en movimiento (Moving Picture Experts Group - MPEG)1, MPEG2, MPEG3 y MPEG4.
La unidad NPU es un procesador informático de red neuronal (Neural-Network - NN) que procesa rápidamente la información de entrada haciendo referencia a una estructura de una red neuronal biológica, por ejemplo, haciendo referencia a un modo de transferencia entre neuronas cerebrales humanas, y además puede realizar un autoaprendizaje de forma continua. Mediante la unidad NPU, pueden implementarse aplicaciones tales como una cognición inteligente del dispositivo electrónico 100, por ejemplo, el reconocimiento de imágenes, el reconocimiento facial, el reconocimiento de la voz y la comprensión de textos.
La interfaz 120 de memoria externa puede configurarse para conectar a una tarjeta de memoria externa, por ejemplo, una tarjeta micro SD a fin de ampliar una capacidad de almacenamiento del dispositivo electrónico 100. La tarjeta de memoria externa se comunica con el procesador 110 usando la interfaz 120 de memoria externa para implementar una función de almacenamiento de datos. Por ejemplo, en la tarjeta de memoria externa se almacena un archivo tal como música o un vídeo.
La memoria interna 121 puede configurarse para almacenar un código de programa ejecutable por ordenador, y el código de programa ejecutable incluye una instrucción. El procesador 110 ejecuta la instrucción almacenada en la memoria interna 121 para ejecutar diversas aplicaciones de función y un procesamiento de datos del dispositivo electrónico 100. La memoria interna 121 puede incluir una zona de almacenamiento de programas y una zona de almacenamiento de datos. La zona de almacenamiento de programas puede almacenar un sistema operativo, una aplicación requerida por al menos una función (p. ej., una función de reproducción de voz o una función de reproducción de imágenes) y similares. La zona de almacenamiento de datos puede almacenar datos (p. ej., datos de audio y una guía telefónica) y cosas similares creados en un proceso de uso del dispositivo electrónico 100. Además, la memoria interna 121 puede incluir una memoria de acceso aleatorio de alta velocidad o puede también incluir una memoria no volátil, tal como al menos un dispositivo de almacenamiento de disco magnético, una memoria flash o un almacenamiento flash universal (Universal Flash Storage - UFS).
El dispositivo electrónico 100 puede implementar una función de audio, tal como una reproducción o una grabación de música, usando el módulo 170 de audio, el altavoz 170A, el receptor 170B, el micrófono 170C, el conector 170D de cascos, el procesador de aplicaciones y componentes similares.
El módulo 170 de audio está configurado para convertir una información digital de audio en una salida de señal analógica de audio, y también está configurado para convertir una entrada analógica de audio en una señal digital de audio. El módulo 170 de audio puede además configurarse para codificar y decodificar una señal de audio. En algunas realizaciones, el módulo 170 de audio puede estar dispuesto en el procesador 110, o bien algunos módulos de función del módulo 170 de audio están dispuestos en el procesador 110.
El altavoz 170A, también denominado “ bocina” , está configurado para convertir una señal eléctrica de audio en una señal acústica. El dispositivo electrónico 100 puede usarse para escuchar música o responder a una llamada en un modo manos libres por el altavoz 170A.
El receptor 170B, también denominado “ auricular” , está configurado para convertir una señal eléctrica de audio en una señal acústica. Cuando se responde a una llamada o se escucha una información de voz usando el dispositivo electrónico 100, el receptor 170B puede colocarse cerca de una oreja humana para escuchar hablar a alguien.
El micrófono 170C, también denominado “ micro” o “ micrófono” , está configurado para convertir una señal acústica en una señal eléctrica. Cuando realiza una llamada o envía información de voz, un usuario puede generar un sonido cerca del micrófono 170C utilizando su boca para introducir una señal acústica en el micrófono 170C. En el dispositivo electrónico 100 se puede disponer al menos un micrófono 170C. En algunas otras realizaciones, dos micrófonos 170C pueden estar dispuestos en el dispositivo electrónico 100 para captar una señal acústica e implementar una función de reducción del ruido. En algunas otras realizaciones, tres, cuatro o más micrófonos 170C pueden estar dispuestos, alternativamente, en el dispositivo electrónico 100 para captar una señal acústica, implementar una reducción del ruido y reconocer una fuente de sonido a fin de implementar una función de grabación direccional y otras funciones similares.
El conector 170D de cascos está configurado para conectar a unos cascos cableados. El conector 170D de cascos puede ser una interfaz USB 130 o puede ser una interfaz estándar de la Plataforma Abierta de Terminales Móviles (Open Mobile Terminal Platform - OMTP) de 3,5 mm o una interfaz estándar de la Asociación Estadounidense de la Industria de las Telecomunicaciones Celulares (Cellular Telecommunications Industry Association Of The USA - CTIA).
El sensor 180A de presión está configurado para detectar una señal de presión, y puede convertir la señal de presión en una señal eléctrica. En algunas realizaciones, el sensor 180A de presión puede estar dispuesto en el visualizador 194. Existen muchos tipos de sensores 180A de presión, por ejemplo, un sensor de presión resistivo, un sensor de presión inductivo y un sensor de presión capacitivo. El sensor de presión capacitivo puede incluir al menos dos placas paralelas de materiales conductores. Cuando se aplica una fuerza al sensor 180A de presión, la capacitancia entre los electrodos cambia. El dispositivo electrónico 100 determina la intensidad de presión basándose en el cambio de la capacitancia. Cuando se realiza una operación táctil sobre el visualizador 194, el dispositivo electrónico 100 detecta una intensidad de dicha operación táctil usando el sensor 180A de presión. El dispositivo electrónico 100 también puede calcular una ubicación táctil basándose en una señal de detección del sensor 180A de presión. En algunas realizaciones, las operaciones táctiles que se realizan en una misma ubicación táctil, pero que tienen intensidades de operación táctil diferentes, pueden corresponder a distintas instrucciones de operación. Por ejemplo, cuando sobre un icono de aplicación de mensajería se realiza una operación táctil cuya intensidad de operación táctil es menor que un primer umbral de presión, se realiza una instrucción para ver un mensaje SMS. Cuando sobre el icono de aplicación de mensajería se realiza una operación táctil cuya intensidad de operación táctil es mayor o igual que el primer umbral de presión, se realiza una instrucción para crear un mensaje SMS.
El sensor 180B de giroscopio se puede configurar para determinar una postura en movimiento del dispositivo electrónico 100. En algunas realizaciones puede determinarse una velocidad angular del dispositivo electrónico 100 alrededor de tres ejes (concretamente, los ejes x, y y z) usando el sensor 180B de giroscopio. El sensor 180B de giroscopio se puede configurar para implementar una estabilización de imagen durante la realización de fotografías. Por ejemplo, cuando se aprieta el obturador, el sensor 180B de giroscopio detecta un ángulo en el que está temblando el dispositivo electrónico 100, calcula, basándose en el ángulo, una distancia que un módulo de lente tiene que compensar y permite que la lente cancele el temblor del dispositivo electrónico 100 a través de un movimiento inverso para implementar la estabilización de imagen. El sensor 180B de giroscopio también se puede usar en un escenario de navegación y en un escenario de juego somático.
El sensor 180C de presión barométrica está configurado para medir la presión barométrica. En algunas realizaciones, el dispositivo electrónico 100 calcula una altitud usando la presión barométrica medida por el sensor 180C de presión barométrica para ayudar en el posicionamiento y la navegación.
El sensor magnético 180D incluye un sensor Hall. El dispositivo electrónico 100 puede detectar la apertura y el cierre de una funda de cuero plegable usando el sensor magnético 180D. En algunas realizaciones, cuando el dispositivo electrónico 100 es un teléfono plegable, el dispositivo electrónico 100 puede detectar la apertura y el cierre de una tapa plegable basándose en el sensor magnético 180D. Además, se establece una característica, tal como el desbloqueo automático de la tapa plegable, basándose en un estado de apertura o de cierre detectado de la funda de cuero o en un estado de apertura o de cierre detectado de la tapa plegable.
El sensor 180E de aceleración puede detectar la magnitud de las aceleraciones en diversas direcciones (normalmente, en tres ejes) del dispositivo electrónico 100 y puede detectar una magnitud y una dirección de la gravedad cuando el dispositivo electrónico 100 está quieto. El sensor 180E de aceleración puede además configurarse para identificar una postura del dispositivo electrónico, y se aplica a una aplicación, tal como la conmutación entre el modo horizontal y el modo vertical o un podómetro.
El sensor 180F de distancia está configurado para medir una distancia. El dispositivo electrónico 100 puede medir la distancia de manera infrarroja o de manera láser. En algunas realizaciones, en un escenario de realización de fotografías, el dispositivo electrónico 100 puede medir una distancia usando el sensor 180F de distancia para implementar un enfoque rápido.
El sensor 180G óptico de proximidad puede incluir, por ejemplo, un diodo emisor de luz (LED) y un detector óptico, por ejemplo, un fotodiodo. El diodo emisor de luz puede ser un diodo emisor de luz infrarroja. El dispositivo electrónico 100 emite luz infrarroja usando el diodo emisor de luz. El dispositivo electrónico 100 detecta una luz infrarroja reflejada por un objeto cercano usando el fotodiodo. Cuando se detecta suficiente luz reflejada, puede determinarse que hay un objeto cerca del dispositivo electrónico 100. Cuando se detecta insuficiente luz reflejada, el dispositivo electrónico 100 puede determinar que no hay un objeto cerca del mismo. El dispositivo electrónico 100 puede detectar, usando el sensor 180G óptico de proximidad, que el usuario lo está sujetando al dispositivo electrónico 100 cerca de una de sus orejas para realizar una llamada o para realizar automáticamente un apagado de pantalla con el fin de ahorrar energía. El sensor 180G óptico de proximidad también se puede usar en un modo de tapa inteligente o en un modo de bolsillo para realizar automáticamente un desbloqueo o un bloqueo de pantalla.
El sensor 180L de luz ambiente está configurado para detectar un brillo de luz ambiente. El dispositivo electrónico 100 puede ajustar de manera adaptativa el brillo del visualizador 194 basándose en el brillo de luz ambiente detectado. El sensor 180L de luz ambiente también se puede configurar para ajustar automáticamente el balance de blancos durante la realización de fotografías. El sensor 180L de luz ambiente también puede cooperar con el sensor 180G óptico de proximidad para detectar si el dispositivo electrónico 100 está en un bolsillo a fin de impedir un tacto accidental.
El sensor 180H de huella dactilar está configurado para captar una huella dactilar. El dispositivo electrónico 100 puede usar una característica de la huella dactilar captada para implementar un desbloqueo basado en la huella dactilar, un acceso de bloqueo de aplicación, una realización de fotografías basada en la huella dactilar, una respuesta a una llamada basada en la huella dactilar y acciones similares.
El sensor 180J de temperatura está configurado para detectar una temperatura. En algunas realizaciones, el dispositivo electrónico 100 implementa una política de procesamiento de temperatura usando la temperatura detectada por el sensor 180J de temperatura. Por ejemplo, cuando la temperatura comunicada por el sensor 180J de temperatura sobrepasa un umbral, el dispositivo electrónico 100 reduce el rendimiento de un procesador que está cerca del sensor 180J de temperatura para reducir el consumo de energía a efectos de protección térmica. En algunas otras realizaciones, cuando la temperatura cae por debajo de otro umbral, el dispositivo electrónico 100 calienta la batería 142 para evitar que el dispositivo electrónico 100 se apague anormalmente debido a una baja temperatura. En algunas otras realizaciones, cuando la temperatura cae por debajo de otro umbral más, el dispositivo electrónico 100 aumenta una tensión de salida de la batería 142 para evitar un apagado anormal provocado por una baja temperatura.
El sensor táctil 180K también se denomina “ panel táctil” . El sensor táctil 180K puede disponerse en el visualizador 194, y el sensor táctil 180K y el visualizador 194 constituyen una pantalla táctil, denominada “ pantalla táctil” . El sensor táctil 180K está configurado para detectar una operación táctil sobre o cerca del sensor táctil 180K. El sensor táctil puede transferir la operación táctil detectada al procesador de aplicaciones para que determine un tipo de evento táctil. Puede proporcionarse una salida visual relacionada con la operación táctil usando el visualizador 194. En algunas otras realizaciones, el sensor táctil 180K también puede estar dispuesto en una superficie del dispositivo electrónico 100, en una ubicación diferente a la del visualizador 194.
El sensor 180M de conducción ósea puede obtener una señal de vibración. En algunas realizaciones, el sensor 180M de conducción ósea puede obtener una señal de vibración de un hueso de vibración de una parte de cuerda vocal humana. El sensor 180M de conducción ósea también puede hacer contacto con un pulso corporal para recibir una señal de latido de presión arterial. En algunas realizaciones, el sensor 180M de conducción ósea también se puede disponer en los cascos para obtener unos cascos de conducción ósea. El módulo 170 de audio puede obtener una señal de voz por análisis basándose en la señal de vibración, que procede del hueso de vibración de la parte de cuerda vocal y que es obtenida por el sensor 180M de conducción ósea, para implementar una función de voz. El procesador de aplicaciones puede analizar la información de frecuencia cardíaca basándose en la señal de latido de presión arterial obtenida por el sensor 180M de conducción ósea para implementar una función de detección de la frecuencia cardíaca.
La tecla 190 incluye una tecla de encendido, una tecla de volumen y teclas similares. La tecla 190 puede ser una tecla mecánica o puede ser una tecla táctil. El dispositivo electrónico 100 puede recibir una entrada de tecla y generar una entrada de señal de tecla relacionada con un ajuste de usuario y un control de función del dispositivo electrónico 100.
El motor 191 puede generar un incitador vibratorio. El motor 191 puede configurarse para proporcionar un incitador vibratorio de llamada entrante y una retroalimentación por vibración táctil. Por ejemplo, las operaciones táctiles realizadas en distintas aplicaciones (p. ej., la realización de fotografías y la reproducción de audio) pueden corresponder a distintos efectos de retroalimentación por vibración. El motor 191 también puede corresponder a distintos efectos de retroalimentación por vibración relacionados con operaciones táctiles realizadas sobre distintas zonas del visualizador 194. Distintos escenarios de aplicación (p. ej., un recordatorio de hora, una recepción de información, una alarma y un juego) también pueden corresponder a distintos efectos de retroalimentación por vibración. Se puede personalizar aún más un efecto de retroalimentación por vibración táctil.
El indicador 192 puede ser una luz indicadora y puede estar configurado para indicar un estado de carga y un cambio de energía, o bien puede estar configurado para indicar un mensaje, una llamada perdida, una notificación y similares. La interfaz 195 de tarjeta SIM está configurada para conectar a una tarjeta SIM. La tarjeta SIM puede insertarse en la interfaz 195 de tarjeta SIM o sacarse de la interfaz 195 de tarjeta SIM para implementar un contacto con, o una separación de, el dispositivo electrónico 100. El dispositivo electrónico 100 puede admitir una o N interfaces de tarjeta SIM, donde N es un entero positivo mayor que 1. La interfaz 195 de tarjeta SIM puede admitir una tarjeta nanoSIM, una tarjeta microSIM, una tarjeta SIM y tarjetas similares. En una misma interfaz 195 de tarjeta SIM se puede insertar al mismo tiempo una pluralidad de tarjetas. La pluralidad de tarjetas puede ser de un mismo tipo o de distintos tipos. La interfaz 195 de tarjeta SIM puede ser compatible con distintos tipos de tarjetas SIM. La interfaz 195 de tarjeta SIM puede además ser compatible con una tarjeta de memoria externa. Mediante la tarjeta SIM, el dispositivo electrónico 100 interactúa con una red para implementar funciones tales una conversación y una comunicación de datos. En algunas realizaciones, el dispositivo electrónico 100 usa una tarjeta eSIM, a saber, una tarjeta SIM incorporada. La tarjeta eSIM puede estar incorporada en el dispositivo electrónico 100 y no puede separarse del dispositivo electrónico 100.
Un sistema de software del dispositivo electrónico 100 puede usar una arquitectura en capas, una arquitectura dirigida por eventos, una arquitectura de micronúcleos, una arquitectura de microservicios o una arquitectura en la nube. En esta realización de la presente solicitud se utiliza un sistema Android que tiene una arquitectura en capas como ejemplo para ilustrar una estructura de software del dispositivo electrónico 100.
La Fig. 3 es un diagrama de bloques de una estructura de software de un dispositivo electrónico 100 según una realización de la presente solicitud.
En la arquitectura en capas, el software está dividido en varias capas, y cada capa tiene una función y una tarea definidas. Las capas se comunican entre sí mediante una interfaz de software. En algunas realizaciones, el sistema Android está dividido, de arriba a abajo, en cuatro capas: una capa de aplicación, una capa de marco de aplicación, una biblioteca de sistema y Android Runtime y una capa de núcleo.
La capa de aplicación puede incluir una serie de paquetes de aplicaciones.
Tal y como se muestra en la Fig. 3, el paquete de aplicaciones puede incluir aplicaciones como “ cámara” , “ galería” , “ calendario” , “ llamadas” , “ mapas” , “ navegación” , “ Bluetooth” , “ música” , “vídeos” y “ mensajería” .
En esta realización de la presente solicitud, la capa de aplicación puede incluir además una aplicación de voz que tiene una función de reconocimiento de la voz. La aplicación de voz a veces también puede denominarse aplicación de asistente de voz, por ejemplo, un asistente de voz Xiao E, Xiaoai o Siri.
Después de habilitarse la aplicación de voz, puede captarse una señal de control por voz enviada por un usuario, y esta señal se convierte en una tarea de voz correspondiente. Además, la aplicación de voz puede invocar una interfaz de una aplicación relacionada para llevar a cabo la tarea de voz, de modo que el usuario controla el dispositivo electrónico de manera hablada.
La capa de marco de aplicación proporciona una interfaz de programación de aplicaciones (Application Programming Interface - API) y un marco de programación de una aplicación en la capa de aplicación. La capa de marco de aplicación incluye algunas funciones predefinidas.
Tal y como se muestra en la Fig. 3, la capa de marco de aplicación puede incluir un gestor de ventanas, un proveedor de contenido, un sistema de vistas, un gestor de teléfono, un gestor de recursos, un gestor de notificaciones y similares. El gestor de ventanas está configurado para gestionar un programa de ventanas. El gestor de ventanas puede obtener un tamaño del visualizador, determ inar si hay una barra de estado, realizar un bloqueo de pantalla, hacer una captura de pantalla y acciones similares.
El proveedor de contenido está configurado para: almacenar y obtener datos y permitir que una aplicación acceda a los datos. Los datos pueden incluir un vídeo, una imagen, un audio, llamadas que se hagan y reciban, un historial de navegación y unos favoritos, una agenda y similares.
El sistema de vistas incluye controles visuales tales como un control para visualizar un texto y un control para visualizar una imagen. El sistema de vistas puede configurarse para construir una aplicación. Una interfaz de visualización puede incluir una o más vistas. Por ejemplo, una interfaz de visualización que incluye un icono de notificación de mensajes SMS puede incluir una vista de visualización de texto y una vista de visualización de imagen.
El gestor de teléfono está configurado para proporcionar al dispositivo electrónico 100 una función de comunicación, por ejemplo, una gestión de un estado de llamada (que incluye la respuesta o el rechazo).
El gestor de recursos proporciona diversos recursos, tales como una cadena de caracteres localizada, un icono, una imagen, un archivo de diseño y un archivo de vídeo para una aplicación.
El gestor de notificaciones permite que una aplicación visualice información de notificación en una barra de estado, y puede configurarse para dar un mensaje de notificación. El gestor de notificaciones puede desaparecer automáticamente después de una breve pausa sin que haga falta una interacción de usuario. Por ejemplo, el gestor de notificaciones está configurado para notificar la finalización de una descarga, dar una notificación de mensaje y acciones similares. El gestor de notificaciones puede ser una notificación que aparezca en una barra de estado superior del sistema en forma de gráfico o de texto de barra de desplazamiento, por ejemplo, una notificación de una aplicación que se está ejecutando en segundo plano, o bien puede ser una notificación que aparezca en la pantalla en forma de ventana de diálogo. Por ejemplo, se visualiza información de texto en la barra de estado, se reproduce un sonido de alerta, el dispositivo electrónico vibra o la luz indicadora parpadea.
En esta realización de la presente solicitud, la capa de marco de aplicación incluye además un gestor de interfaz de usuario de voz (Voice User Interface - VUI). El gestor de VUI puede monitorizar un estado de ejecución de la aplicación de voz o puede hacer de puente entre la aplicación de voz y otra aplicación y transferir una tarea de voz reconocida por la aplicación de voz a una aplicación relacionada para su ejecución.
Por ejemplo, una aplicación en la capa de aplicación puede proporcionar un archivo de configuración, y en el archivo de configuración puede registrarse una tarea de voz admitida por una interfaz relacionada de la aplicación. Se usa una aplicación de música como ejemplo. Cuando se está instalando la aplicación de música, el dispositivo electrónico puede almacenar en el mismo un archivo 1 de configuración proporcionado por dicha aplicación. El archivo 1 de configuración puede tener registrada una tarea de voz admitida por la aplicación de música cuando la aplicación de música visualiza una interfaz de reproducción de música. Por ejemplo, la tarea de voz incluye: reproducir, pausar, saltar a una canción anterior/siguiente, subir/bajar el volumen y acciones similares.
En este caso, cuando el dispositivo electrónico ejecuta en primer plano la interfaz de reproducción de música de la aplicación de música, si detecta que el usuario ha introducido una palabra de activación “ Hola, Xiao E” , el dispositivo electrónico puede habilitar la aplicación de voz en segundo plano. Después de detectar que la aplicación de voz está habilitada, el gestor de VUI puede obtener el archivo 1 de configuración que corresponde a la interfaz de reproducción de música que se está visualizando en ese momento. Además, tal y como se muestra en la Fig. 4, el gestor de VUI puede visualizar, en forma de un incitador 401 de entrada por voz, la tarea de voz que está registrada en el archivo 1 de configuración en la interfaz de reproducción de música 402 que se está ejecutando.
De este modo, cuando el usuario usa la aplicación de música, el dispositivo electrónico puede incitarlo con una tarea de voz admitida por la interfaz de aplicación actual. Posteriormente, el usuario puede enviar una correspondiente señal de control por voz al dispositivo electrónico basándose en el incitador 401 de entrada por voz visualizado en la interfaz 402 de reproducción de música con el fin de hacer que dicho dispositivo ejecute la tarea de voz admitida por la interfaz de aplicación actual. Esto puede mejorar la eficiencia del control por voz de una aplicación de voz instalada en el dispositivo electrónico y mejorar aún más la experiencia de usuario.
Cabe señalar que una aplicación que se está ejecutando en primer plano se refiere en general a una aplicación a la que pertenece una interfaz que se está visualizando en una pantalla de un teléfono móvil. La interfaz normalmente está en estado expandido, y el usuario puede interactuar con la aplicación en primer plano que se muestra en la interfaz. Por ejemplo, si el teléfono móvil está visualizando una interfaz de una aplicación WeChat, la aplicación que se está ejecutando en primer plano es en ese momento la aplicación WeChat. A modo de otro ejemplo, si la aplicación de música de la Fig. 4 se está visualizando en estado expandido en la pantalla del teléfono móvil, la aplicación de música es en ese momento la aplicación en primer plano. A modo de otro ejemplo, si la aplicación de vídeo de la Fig. 6 se está visualizando en estado expandido en la pantalla del teléfono móvil, la aplicación de vídeo es en ese momento la aplicación en primer plano. Cuando una aplicación se está ejecutando en segundo plano, el teléfono móvil normalmente no visualiza en la pantalla una interfaz de la aplicación en estado expandido, y dicha interfaz es invisible para el usuario. Sin embargo, el teléfono móvil puede visualizar en la pantalla una entrada (p. ej., un icono de la aplicación) de la aplicación en segundo plano. Por ejemplo, tal y como se muestra en la Fig. 7A o la Fig. 8, el teléfono móvil puede visualizar, en forma de menú flotante, un identificador 701 de la aplicación de voz que se está ejecutando en segundo plano en la interfaz de la aplicación en primer plano. El usuario puede arrastrar el identificador 701 hasta cualquier punto de la interfaz actual. Además, cuando el teléfono móvil visualiza el identificador 701 de la aplicación de voz, el usuario todavía puede interactuar con la interfaz de la aplicación en primer plano. Por ejemplo, tal y como se muestra en la Fig. 7A, el usuario puede hacer clic en un control, tal como un botón 602 de reproducción en una interfaz 601 de la aplicación de vídeo.
Normalmente, la aplicación de voz incluye dos partes. Una parte es un servicio de voz que se está ejecutando en segundo plano, y se usa para captar una señal acústica introducida por el usuario, extraer la señal acústica y realizar una conversión de texto, un reconocimiento de la voz o una acción similar. La otra parte es un contenido visualizado en la pantalla del teléfono móvil, y se usa para visualizar una interfaz de la aplicación de voz, por ejemplo, un contenido de un diálogo entre el usuario y la aplicación de voz. En esta realización de la presente solicitud, la aplicación de voz que se está ejecutando en segundo plano en el teléfono móvil puede considerarse como el servicio de voz que se está ejecutando en segundo plano en el teléfono móvil. Por supuesto, cuando el servicio de voz se ejecuta en segundo plano, el teléfono móvil puede visualizar, alternativamente, una información, tal como el identificador de la aplicación de voz, en forma de menú flotante y cosas similares. Este aspecto no está limitado en las realizaciones de la presente solicitud.
Android Runtime incluye una biblioteca central y una máquina virtual. Android Runtime está a cargo de la programación y la gestión del sistema Android.
La biblioteca central incluye dos partes: una función que hay que invocar en lenguaje Java y una biblioteca central de Android. La capa de aplicación y la capa de estructura de aplicación se ejecutan en la máquina virtual. La máquina virtual ejecuta archivos Java de la capa de aplicación y de la capa de estructura de aplicación como archivos binarios. La máquina virtual está configurada para implementar funciones como la gestión de ciclos de vida de objeto, la gestión de pilas, la gestión de hilos, la gestión de la seguridad y las excepciones y la recogida de basura.
La biblioteca de sistema puede incluir una pluralidad de módulos de función, por ejemplo, un gestor de superficies, una biblioteca multimedia, una biblioteca de procesamiento de gráficos tridimensionales (p. ej., OpenGL ES) y un motor de gráficos 2D (p. ej., SGL).
El gestor de superficies está configurado para gestionar un subsistema de visualización y proporcionar una fusión de capas 2D y 3D para una pluralidad de aplicaciones.
La biblioteca multimedia admite la reproducción y la grabación en una pluralidad de formatos de audio y vídeo, archivos de imágenes estáticas y similares usados habitualmente. La biblioteca multimedia puede admitir una pluralidad de formatos de codificación de audio y de vídeo como MPEG4, H.264, MP3, AAC, AMR, JPG y PNG. La biblioteca de procesamiento de gráficos tridimensionales está configurada para implementar un dibujo de gráficos tridimensionales, una representación de imágenes, una composición, un procesamiento de capas y acciones similares. El motor de gráficos 2D es un motor de dibujo para el dibujo 2D.
La capa de núcleo es una capa entre el hardware y el software. La capa de núcleo incluye al menos un controlador de visualizador, un controlador de cámara, un controlador de audio, un controlador de sensor y controladores similares. Este aspecto no está limitado en las realizaciones de la presente solicitud.
A continuación se describe, haciendo referencia a los dibujos adjuntos, un método de control por voz que se proporciona en las realizaciones de la presente solicitud.
Tal y como se muestra en la Fig. 5, el método de control por voz proporcionado en la presente solicitud incluye los siguientes pasos S501 a S505. Los pasos S501 a S505 se describen usando un ejemplo en el que un teléfono móvil se emplea como dispositivo electrónico.
S501: el teléfono móvil visualiza una primera interfaz de una aplicación, donde la primera interfaz incluye uno o más controles usados para actualizar la primera interfaz.
Normalmente, en el teléfono móvil hay instaladas una o más aplicaciones. Después de detectar una operación de habilitación de una aplicación por parte de un usuario, el teléfono móvil puede comenzar a ejecutar la aplicación como una aplicación en primer plano. En este caso, el teléfono móvil puede visualizar una interfaz de la aplicación en una pantalla táctil. Usando como ejemplo la primera interfaz, cuando visualiza la primera interfaz de la aplicación, el teléfono móvil normalmente la visualiza en estado expandido, de modo que el usuario puede interactuar con la aplicación en la primera interfaz.
La primera interfaz visualizada por el teléfono móvil normalmente incluye uno o más controles. Normalmente, un elemento presentado en una interfaz gráfica de usuario (Graphical User Interface - GUI) puede denominarse control, y el control puede proporcionar una operación específica a un usuario. Tal y como se muestra en la Fig. 6, la primera interfaz visualizada por el teléfono móvil es una interfaz 601 de reproducción de una aplicación de vídeo. En la interfaz 601 de reproducción hay dispuesta una pluralidad de controles, tal como un botón de reproducción, un botón de volver y un cuadro de entrada. El usuario puede manejar estos controles para actualizar el contenido de visualización del teléfono móvil para que el teléfono móvil muestre una segunda interfaz actualizada. Por ejemplo, si detecta que el usuario ha hecho clic en el botón de volver en la interfaz 601 de reproducción, el teléfono móvil visualiza, en respuesta a la operación de clic, un menú de nivel anterior (es decir, la segunda interfaz) de la interfaz 601 de reproducción. A modo de otro ejemplo, si detecta que el usuario ha hecho clic en el botón de reproducción en la interfaz 601 de reproducción, el teléfono móvil reproduce, en respuesta a la operación de clic, un vídeo en la interfaz 601 de reproducción. En este caso, la interfaz visualizada en el teléfono móvil se actualiza de la primera interfaz a la segunda interfaz.
S502: en respuesta a recibir una señal de activación preestablecida, el teléfono móvil habilita una aplicación de voz en segundo plano para comenzar a captar una señal de control por voz introducida por el usuario.
Por ejemplo, antes de habilitar la aplicación de voz, el teléfono móvil puede poner un micrófono en estado siempre encendido. En este caso, cuando el teléfono móvil visualiza una interfaz (p. ej., la primera interfaz) de una aplicación, el micrófono del teléfono móvil capta una señal acústica a una frecuencia de funcionamiento específica.
Tal y como se muestra en la Fig. 6, el teléfono móvil está visualizando la interfaz 601 de reproducción (es decir, la primera interfaz) de “ Juego de Tronos” (“ Game of Thrones” ) en la aplicación de vídeo. Cuando el micrófono capta una señal acústica, el teléfono móvil puede reconocer además si dicha señal es la señal de activación preestablecida. Por ejemplo, una vez que el usuario envía una señal acústica “ Hola, Xiao E” , el teléfono móvil puede captarla usando el micrófono. Si el teléfono móvil reconoce que la señal acústica es la señal de activación preestablecida, esto indica que el usuario espera llevar a cabo en ese momento una tarea de voz relacionada usando una función de reconocimiento de la voz proporcionada por la aplicación de voz. En este caso, para evitar que se bloquee la primera interfaz (p. ej., la interfaz 601 de reproducción) que está siendo visualizada por el teléfono móvil, el teléfono móvil puede habilitar la aplicación de voz en segundo plano. Por ejemplo, tal y como se muestra en la Fig. 7A, después de habilitar la aplicación de voz en segundo plano, el teléfono móvil puede visualizar un icono 701 de la misma en la interfaz 601 de reproducción. El icono 701 se usa para indicar que la aplicación de voz se está ejecutando en el segundo plano del teléfono móvil. Como la aplicación de voz se está ejecutando en el segundo plano del teléfono móvil, el teléfono móvil todavía puede responder a diversas operaciones realizadas por el usuario en la interfaz 601 de reproducción, por ejemplo, una operación de hacer clic en el botón de reproducción por parte del usuario. Naturalmente, puede preestablecerse, alternativamente, que, cuando habilite la aplicación de voz en segundo plano, el teléfono móvil no pueda responder a diversas operaciones realizadas por el usuario en la primera interfaz (p. ej., la interfaz 601 de reproducción). Este aspecto no está limitado en las realizaciones de la presente solicitud.
Después de que el teléfono móvil habilite la aplicación de voz en segundo plano, el usuario puede comenzar a introducir, en la aplicación de voz, una señal de control por voz que espera que ejecute el teléfono móvil, por ejemplo, hacer una llamada a un contacto llamado Sam o empezar a reproducir un vídeo. Por lo tanto, después de habilitar la aplicación de voz en segundo plano, el teléfono móvil puede continuar usando el micrófono para captar la señal de control por voz introducida por el usuario. Por ejemplo, el teléfono móvil puede establecer que el micrófono se active automáticamente durante cinco segundos después de haber habilitado la aplicación de voz, para captar una señal de control por voz introducida por el usuario en esos cinco segundos. A modo de otro ejemplo, el teléfono móvil puede establecer que el icono 701 de la aplicación de voz sea un botón de encendido/apagado del micrófono. Si detecta que el usuario ha hecho clic en el icono 701, el teléfono móvil puede activar el micrófono durante cinco segundos para captar una señal de control por voz introducida por el usuario en esos cinco segundos. A modo de otro ejemplo, si detecta que el usuario ha hecho clic en el icono 701, el teléfono móvil activa el micrófono y lo mantiene en estado de funcionamiento para captar la señal de control por voz introducida por el usuario. Después de detectar que el usuario ha vuelto a hacer clic en el icono 701, el teléfono móvil puede desactivar el micrófono.
Cabe señalar que la señal de activación puede incluir otra señal aparte de una palabra de activación introducida por el usuario mediante la voz. Por ejemplo, la señal de activación puede ser una señal de clic del usuario en un botón, o bien puede ser un gesto táctil del usuario. Este aspecto no está limitado en las realizaciones de la presente solicitud.
Además, el teléfono móvil puede preestablecer las aplicaciones que tienen permiso para usar la aplicación de voz. Por ejemplo, puede establecerse que una aplicación W eChat tenga permiso para usar la aplicación de voz, pero que una aplicación Alipay no tenga permiso para usarla. En este caso, cuando el teléfono móvil ejecuta, en primer plano, la aplicación que tiene el permiso para usar la aplicación de voz, si recibe la señal de activación introducida por el usuario, el teléfono móvil puede habilitar la aplicación de voz en segundo plano. En consecuencia, si el teléfono móvil ejecuta, en primer plano, una aplicación o una interfaz de una aplicación que no tiene permiso para usar la aplicación de voz, después de recibir la señal de activación introducida por el usuario, el teléfono móvil puede ejecutar la aplicación de voz en primer plano. Tal y como se muestra en la Fig. 7B, cuando está ejecutando la aplicación de voz en primer plano, el teléfono móvil puede visualizar una interfaz 702 de la aplicación de voz en estado expandido. La interfaz 702 puede incluir unos controles de la aplicación de voz. El teléfono móvil puede visualizar en la interfaz 702 un contenido de un diálogo entre el usuario y la aplicación de voz.
S503: el teléfono móvil obtiene un archivo de configuración que está asociado con la primera interfaz, donde en el archivo de configuración está registrada una tarea de voz que el teléfono móvil tiene permitido ejecutar en la primera interfaz.
Como el usuario habilita la aplicación de voz cuando el teléfono móvil visualiza la primera interfaz, después de habilitarla, el usuario probablemente quiere ejecutar una tarea de voz relacionada con la primera interfaz usando dicha aplicación. La primera interfaz es, por ejemplo, la interfaz 601 de reproducción. Cuando el teléfono móvil visualiza la interfaz 601 de reproducción, si detecta la señal de activación introducida por el usuario, esto indica que el usuario probablemente tiene que realizar una operación específica sobre un botón de operación en la interfaz 601 de reproducción usando la aplicación de voz. Por ejemplo, cuando al usuario le resulte inconveniente hacer clic con cualquiera de sus dos manos en un botón 602 de reproducción en la interfaz 601 de reproducción, puede que quiera implementar, usando una función de control por voz de la aplicación de voz, una operación de visualización del vídeo “ Juego de Tronos” en la interfaz 601 de reproducción.
En esta realización de la presente solicitud, el teléfono móvil puede tener previamente almacenado un archivo de configuración de cada aplicación. Por ejemplo, cada aplicación se corresponde a uno o más archivos de configuración. En el caso de un archivo de configuración, el archivo de configuración registra una tarea de voz admitida por la aplicación de voz en distintas interfaces de una aplicación. Alternativamente, en un archivo de configuración puede haber registrada solo una tarea de voz admitida por la aplicación de voz en una interfaz de una aplicación. Usando como ejemplo la aplicación de vídeo anterior, un desarrollador de la aplicación de vídeo puede meter un archivo 1 de configuración de la interfaz de reproducción y un archivo 2 de configuración de una página de inicio en un paquete de instalación de la aplicación de vídeo. En el archivo 1 de configuración está registrada una tarea de voz que la aplicación de voz tiene permitido ejecutar en la interfaz de reproducción de la aplicación de vídeo, por ejemplo, reproducir, avanzar rápido o pasar a un episodio siguiente. En el archivo 2 de configuración está registrada una tarea de voz que la aplicación de voz tiene permitido ejecutar en la página de inicio de la aplicación de vídeo, por ejemplo, ver un registro histórico de reproducciones o buscar una palabra clave. Cuando está instalando la aplicación de vídeo, el teléfono móvil puede almacenar localmente el archivo 1 de configuración y el archivo 2 de configuración que se proporcionan en el paquete de instalación de dicha aplicación.
Alternativamente, el teléfono móvil puede generar automáticamente el archivo 1 de configuración y el archivo 2 de configuración. Por ejemplo, cuando ejecuta la interfaz 601 de reproducción de la aplicación de vídeo, el teléfono móvil puede obtener unos botones incluidos en la interfaz 601 de reproducción y unos atributos de los mismos. Usando como ejemplo el botón 602 de reproducción, un atributo del botón 602 de reproducción es que el botón 602 de reproducción pertenece a un tipo de botón en el que se puede hacer clic, y hacer clic en el botón 602 de reproducción puede usarse para empezar a reproducir un vídeo o para parar un vídeo. En este caso, el teléfono móvil puede registrar, en el archivo 1 de configuración, una tarea de reproducción y una tarea de pausa como tareas de voz admitidas por la interfaz 601 de reproducción. Igualmente, el teléfono móvil registra, en el archivo 1 de configuración, una tarea de voz que corresponde a otro botón en la interfaz 601 de reproducción y, por último, genera el archivo 1 de configuración que corresponde a la interfaz 601 de reproducción.
Por ejemplo, el archivo de configuración puede ser un archivo en un formato XML (Extensible Markup Language -Lenguaje Extensible de Marcado). Por ejemplo, un contenido específico del archivo 1 de configuración es el siguiente:
<VoiceIntentList>
<VoiceIntent //Tarea 1 de voz
intentId=“@id/¡ntent_power” //La tarea 1 de voz es la tarea de reproducción
bindViewld=“@id/power” //Un botón que corresponde a la tarea 1 de voz es el botón de
reproducción
voiceOnClick=“voiceSwitchPower” //Una operación que corresponde a la tarea 1 de voz es hacer
clic en el botón de reproducción
voiceTags=“@string/power_controller”/> //Observaciones: Control de potencia (opcional)
<Voicelntent //Tarea 2 de voz
...>
<Voicelntent //Tarca 3 de voz
...>
Puede entenderse que en el archivo 1 de configuración están registradas una o más tareas de voz que la aplicación de voz permite que se ejecuten en la interfaz de reproducción de la aplicación de vídeo. La primera tarea 1 de voz se usa como ejemplo. En el campo intentId se registra que un contenido específico de la tarea 1 de voz es la tarea de reproducción. En el campo bindViewId se registra que un botón sobre el que se realiza la tarea 1 de voz es el botón de reproducción en la interfaz de reproducción. En el campo voiceOnClick se registra que una operación específica realizada en el teléfono móvil cuando se realiza la tarea 1 de voz es hacer clic en el botón de reproducción.
Para ser más concretos, el archivo 1 de configuración además registra una correspondencia entre la tarea 1 de voz y un evento táctil de hacer clic en el botón de reproducción en la interfaz de reproducción. En el caso del teléfono móvil, cuando el teléfono móvil recibe una señal de control por voz para introducir la tarea de reproducción por parte del usuario, esto equivale a que el teléfono móvil detecte que el usuario ha hecho clic en el botón de reproducción en la interfaz de reproducción. Opcionalmente, en el campo voiceTags se registra una observación sobre la tarea 1 de voz. Por ejemplo, algunos usuarios están acostumbrados a llamar control de energía a una operación de reproducción. Por lo tanto, puede meterse una observación sobre que control de energía es otra manera de expresar la tarea de reproducción. Posteriormente, si detecta una señal de control por voz relacionada con control de energía introducida por el usuario, el teléfono móvil puede determinar, con referencia a la observación sobre la tarea 1 de voz, que una tarea de voz que el usuario espera ejecutar es la tarea de reproducción.
Si el teléfono móvil posteriormente determina que la señal de control por voz introducida por el usuario corresponde a la tarea de reproducción, el teléfono móvil puede ejecutar, basándose en el campo de bindViewId y el campo voiceOneClick del archivo 1 de configuración, una función relacionada (p. ej., una función callback voiceSwitchPower) que corresponde a hacer clic en el botón de reproducción de la aplicación de vídeo. De este modo, en la aplicación de vídeo se implementa, usando la señal de control por voz, una función de control del teléfono móvil para que ejecute la tarea de reproducción.
Específicamente, en el paso S503, después de que el teléfono móvil habilite la aplicación de voz en una capa de aplicación, dicha aplicación puede informar de un evento de habilitación de la misma a un gestor de VUI que está en una capa de marco de aplicación. Después de detectar el evento de habilitación, el gestor de VUI puede obtener el archivo de configuración que está asociado con la primera interfaz visualizada en ese momento. Por ejemplo, el gestor de VUI primero puede determinar que una interfaz que se está ejecutando en primer plano es la interfaz 601 de reproducción de la aplicación de vídeo. Luego, el gestor de VUI puede leer, basándose en un identificador de la interfaz 601 de reproducción, el archivo 1 de configuración que se ha establecido en la aplicación de vídeo para la interfaz 601 de reproducción. El archivo 1 de configuración registra las una o más tareas de voz que la aplicación de voz permite que se ejecuten en la interfaz de reproducción de la aplicación de vídeo.
S504: el teléfono móvil visualiza un incitador de entrada por voz en la primera interfaz basándose en el archivo de configuración.
Después de habilitar la aplicación de voz en la primera interfaz, puede que el usuario no conozca las tareas de voz específicas que dicha aplicación puede ejecutar en la primera interfaz. En consecuencia, el usuario no puede usar con precisión diversas funciones de reconocimiento de la voz proporcionadas por la aplicación de voz. En el paso S504, después de que el teléfono móvil obtenga el archivo de configuración que está asociado con la primera interfaz, como todas las tareas de voz registradas en el archivo de configuración pueden ser ejecutadas por la aplicación de voz en la primera interfaz, el teléfono móvil puede visualizar en la primera interfaz una o más tareas de voz en el archivo de configuración como incitadores de entrada por voz para solicitar al usuario que envíe señales de control por voz precisas para controlar las funciones en la primera interfaz.
Por ejemplo, después de obtener el archivo 1 de configuración de la interfaz 601 de reproducción, el gestor de VUI puede visualizar, en dicha interfaz 601 de reproducción, en forma de incitador de entrada por voz, la tarea de voz que está registrada en el archivo 1 de configuración. Tal y como se muestra en la Fig. 8, el teléfono móvil puede visualizar uno o más incitadores 801 de entrada por voz cerca del icono 701 de la aplicación de voz. Cada incitador 801 de entrada por voz corresponde a una tarea de voz en el archivo 1 de configuración. Normalmente, cada tarea de voz está asociada con uno o más controles en la interfaz 601 de reproducción. Por lo tanto, cada incitador de entrada por voz también está asociado con uno o más controles en la primera interfaz. Por ejemplo, cuando la tarea de reproducción está registrada en el archivo 1 de configuración y corresponde al botón de reproducción en la interfaz 601 de reproducción, el teléfono móvil puede visualizar un correspondiente incitador de entrada por voz “ reproduce” . Cuando una tarea de avance rápido está registrada en el archivo 1 de configuración y corresponde a un botón de avance rápido en la interfaz 601 de reproducción y a un control deslizante en una barra de progreso de vídeo, el teléfono móvil puede visualizar un correspondiente incitador de entrada por voz “ avanza rápido x segundos” , donde x es cualquier entero positivo, por ejemplo, “ avanza rápido 10 segundos” en la Fig. 8.
Cuando hay una cantidad relativamente grande de incitadores de entrada por voz, en la interfaz 601 de reproducción se puede visualizar un botón “ más” 802. Si detecta que el usuario ha hecho clic en el botón “ más” 802, el teléfono móvil puede visualizar completamente en la interfaz 601 de reproducción un incitador 801 de entrada por voz oculto. Antes de que el usuario haga clic en el botón “ más” , el teléfono móvil puede visualizar únicamente, basándose en un hábito de uso de aquél, varios incitadores 801 de entrada por voz que el usuario utiliza con la mayor frecuencia. Además, el teléfono móvil puede reconocer inteligentemente una voz del usuario. Por ejemplo, en el incitador 801 de entrada por voz mostrado en la Fig. 8 se encuentra el incitador de voz “ avanza rápido 10 segundos” . Si una instrucción de voz dada por el usuario es “ avanza rápido 15 segundos” , el teléfono móvil aún puede entender lo que pretende el usuario dividiéndola en dos instrucciones “ avanza rápido” y “ 15 segundos” , y avanza rápido el vídeo durante 15 segundos.
En la realización anterior se ha utilizado a efectos descriptivos un ejemplo en el que el incitador 801 de entrada por voz se visualiza en la interfaz 601 de reproducción. Puede entenderse que, cuando el teléfono móvil visualiza una interfaz de otra aplicación, el teléfono móvil también puede incitar, en forma de incitador de entrada por voz, al usuario con una tarea de voz admitida por la interfaz actual según el método anterior. Por ejemplo, tal y como se muestra en la Fig. 9(a), cuando el teléfono móvil visualiza una interfaz 901 de realización de fotografías de una aplicación de cámara, si el teléfono móvil detecta que el teléfono móvil habilita la aplicación de voz en segundo plano, el teléfono móvil puede obtener un archivo de configuración asociado con la interfaz 901 de realización de fotografías de la aplicación de cámara y, además, visualizar en la interfaz 901 de realización de fotografías una tarea de voz en dicho archivo en forma de un incitador 902 de entrada por voz. Por ejemplo, el incitador 902 de entrada por voz puede incluir “ fotografía” , “ graba” , “ autorretrata” , “ ver una foto” y expresiones similares. “ Fotografía” corresponde a un botón de realización de fotografías en la interfaz 901 de realización de fotografías. “ Graba” corresponde a un botón de grabación en la interfaz 901 de realización de fotografías. “ Autorretrata” corresponde a un botón para activar una cámara frontal que está en la interfaz 901 de realización de fotografías. “ Ver una foto” corresponde a una miniatura fotográfica 903 en la interfaz 901 de realización de fotografías. Todas las tareas de voz que corresponden a los incitadores 902 de entrada por voz son tareas que puede ejecutar la aplicación de voz en la interfaz 901 de realización de fotografías.
Por ejemplo, cuando el teléfono móvil visualiza la interfaz 901 de realización de fotografías mostrada en la Fig. 9(a), si detecta que el usuario ha introducido la señal de control por voz “ fotografía” , puede invocar la aplicación de voz para realizar una operación de realización de fotografía que corresponde a la señal de control por voz en respuesta a la señal de control por voz. Después de llevar a cabo la operación de realización de fotografía, el teléfono móvil puede continuar visualizando la interfaz 901 de realización de fotografías de la aplicación de cámara. En este caso, tal y como se muestra en la Fig. 9(b), en la interfaz 901 de realización de fotografías también puede visualizarse una miniatura fotográfica 903 obtenida por el teléfono móvil en una realización de fotografía anterior. Además, el teléfono móvil puede continuar visualizando el incitador 902 de entrada por voz que corresponde a la interfaz 901 de realización de fotografías. En este caso, si el usuario quiere ver la foto obtenida en la realización de fotografía anterior, puede introducir la señal de control por voz “ ver una foto” en el teléfono móvil. Tal y como se muestra en la Fig. 10, el teléfono móvil puede permitir, en respuesta a la señal de control por voz, que una aplicación de galería visualice una interfaz 904 de navegación de una última fotografía. Además, el teléfono móvil puede obtener un archivo de configuración que está asociado con la interfaz 904 de navegación y, además, visualizar en la interfaz 904 de navegación una tarea de voz en el archivo de configuración en forma de un incitador 905 de entrada por voz. Por ejemplo, el incitador 905 de entrada por voz puede incluir “ amplía” , “ reduce” , “ siguiente” , “ volver a la cámara” y expresiones similares. La foto visualizada en la interfaz 904 de navegación también puede usarse como un control, y las los incitadores 905 de entrada por voz, tales como “ amplía” , “ reduce” y “ siguiente” , corresponden a la foto. “ Amplía” corresponde a realizar una operación de ampliación sobre la foto. “ Reduce” corresponde a realizar una operación de reducción sobre la foto. “ Siguiente” corresponde a realizar una operación de deslizamiento sobre la foto. Si la interfaz 904 de navegación incluye un botón que se usa para visualizar una siguiente foto, “ siguiente” puede corresponder además al botón usado para visualizar la siguiente foto.
Además, si el teléfono móvil tiene una función de reconocimiento facial, puede reconocer automáticamente una cara incluida en la interfaz 904 de navegación, por ejemplo, la de un usuario A. Además, si una señal de control por voz recibida que ha sido introducida por el usuario es “ ampliar al usuario A” , el teléfono móvil puede ampliar la imagen visualizada en ese momento usando como centro una ubicación del usuario A (p. ej., una cara del usuario A).
En otras palabras, después de que el teléfono móvil visualice una interfaz de una aplicación y habilite la aplicación de voz en segundo plano, el teléfono móvil puede incitar al usuario con una tarea de voz que puede ser ejecutada por la aplicación de voz en la interfaz actual. De este modo, el usuario puede aprender con precisión a usar la aplicación de voz para controlar a través de la voz diversas funciones en la interfaz actual. Esto mejora la eficiencia de uso de la aplicación de voz.
Además, los incitadores de entrada por voz visualizados por el teléfono móvil en la interfaz de la misma aplicación también pueden cambiar dinámicamente. Por ejemplo, el teléfono móvil puede ocultar el incitador de entrada por voz “ reproduce” si detecta que se está reproduciendo un vídeo en la interfaz 601 de reproducción. En consecuencia, si detecta que el usuario ha pausado la reproducción del vídeo en la interfaz 601 de reproducción, el teléfono móvil puede mostrar el incitador de entrada por voz “ reproduce” y puede ocultar el incitador de entrada por voz “ pausa” . Este aspecto no está limitado en las realizaciones de la presente solicitud.
Por ejemplo, después de habilitar la aplicación de voz, el teléfono móvil puede visualizar inmediatamente un incitador de entrada por voz relacionado con la primera interfaz. Alternativamente, después de habilitar la aplicación de voz, si el teléfono móvil no capta, en un tiempo específico (p. ej., dos segundos), ninguna señal de control por voz introducida por el usuario, esto indica que puede que el usuario no sepa cómo usar la aplicación de voz en este caso. Por lo tanto, el teléfono móvil puede visualizar un incitador de entrada por voz relacionado con la primera interfaz. Alternativamente, tal y como se muestra en la Fig. 11, después de habilitar la aplicación de voz, el teléfono móvil puede visualizar un botón 1001 de incitación en la primera interfaz (p. ej., la interfaz 601 de reproducción). Si detecta que el usuario ha hecho clic en el botón 1001 de incitación, el teléfono móvil puede visualizar, en la interfaz 601 de reproducción, según el método anterior, el incitador 801 de entrada por voz relacionado que se muestra en la Fig. 8.
Después de visualizar el incitador de entrada por voz en la primera interfaz durante un período de tiempo (p. ej., tres segundos), el teléfono móvil puede ocultarlo automáticamente. Alternativamente, después de que el teléfono móvil visualice el incitador de entrada por voz en la primera interfaz, si no capta, en un tiempo específico, ninguna señal de control por voz introducida por el usuario ni detecta, en un tiempo específico, ningún evento de entrada por parte del usuario en la pantalla táctil, el teléfono móvil puede ocultar automáticamente el incitador de entrada por voz en la primera interfaz.
Cabe señalar que el paso (es decir, el paso S504) en el que el teléfono móvil visualiza el incitador de entrada por voz en la primera interfaz es un paso opcional. En otras palabras, después de habilitar la aplicación de voz en segundo plano, puede que el teléfono móvil no incite al usuario con la tarea de voz admitida por aquélla en la interfaz actual. Este aspecto no está limitado en las realizaciones de la presente solicitud.
Independientemente de si visualiza o no el incitador de entrada por voz, después de que el teléfono móvil habilite la aplicación de voz en segundo plano, el usuario puede introducir la señal de control por voz en el teléfono móvil usando la aplicación de voz. En este caso, una vez que la aplicación de voz capte la señal de control por voz introducida por el usuario, se puede proceder con el siguiente paso S505.
S505: en respuesta a la señal de control por voz captada por la aplicación de voz, el teléfono móvil ejecuta una tarea de voz que corresponde a dicha señal, de modo que el teléfono móvil actualiza la primera interfaz visualizada a la segunda interfaz.
Usando todavía como ejemplo la interfaz 601 de reproducción, después de que el teléfono móvil visualice el incitador 801 de entrada por voz en la interfaz 601 de reproducción, el usuario puede introducir una correspondiente señal de control por voz en el teléfono móvil basándose el incitador 801 de entrada por voz. En este caso, la aplicación de voz todavía se está ejecutando en segundo plano. Por lo tanto, la aplicación de voz puede captar, utilizando el micrófono, la señal de control por voz introducida por el usuario. Por ejemplo, después de que el usuario haya introducido una señal de control por voz como “ reproduce” o “ empieza a reproducir” , la aplicación de voz puede convertir, utilizando un algoritmo de reconocimiento de la voz preestablecido, dicha señal introducida por el usuario en una señal de texto y realizar una comprensión semántica para reconocer una tarea de voz real que corresponde a la señal de control por voz. Además, la aplicación de voz puede informar de la tarea de voz real reconocida al gestor de VUI en la capa de marco de aplicación. El gestor de VUI compara la tarea de voz real con la tarea de voz que está registrada en el archivo 1 de configuración obtenido en el paso S503 para determinar si la señal de control por voz introducida por el usuario es la tarea de voz admitida en el archivo 1 de configuración.
Si la señal de control por voz introducida por el usuario es una tarea de voz en el archivo 1 de configuración, por ejemplo, la señal de control por voz “ reproduce” introducida por el usuario es la tarea 1 de voz en el archivo 1 de configuración, el gestor de VUI puede ejecutar, basándose en el archivo 1 de configuración, un evento táctil que corresponde a la tarea 1 de voz. Usando todavía como ejemplo la tarea 1 de voz, en el archivo 1 de configuración se registra que la tarea 1 de voz corresponde al botón de reproducción y, específicamente, al evento táctil de hacer clic en dicho botón en la interfaz de reproducción. Esto indica que el usuario espera, al introducir la señal de control por voz “ reproduce” , controlar el botón 602 de reproducción en la interfaz 601 de reproducción para implementar una función de reproducción. En este caso, el gestor de VUI puede ejecutar, basándose en el campo bindViewId y el campo voiceOnClick en el archivo 1 de configuración, una función relacionada (p. ej., la función callback voiceSwitchPower en la tarea 1 de voz) que corresponde a hacer clic en el botón de reproducción en la aplicación de vídeo para implementar, en dicha aplicación, la tarea de voz que corresponde a la señal de control por voz “ reproduce” . En este caso, tal y como se muestra en la Fig. 12, después de hacerse clic en el botón 602 de reproducción en la interfaz 601 de reproducción, el contenido de vídeo reproducido por el teléfono móvil cambia. Además, el botón 602 de reproducción visualizado originalmente puede actualizarse a un botón 1103 de pausa. En otras palabras, la interfaz visualizada por el teléfono móvil se actualiza de la primera interfaz a la segunda interfaz 1102.
Además, tal y como se muestra en la Fig. 12, después de que se implemente la tarea de voz que corresponde a la señal de control por voz “ reproducir” , la aplicación de voz puede además visualizar una información 1101 de respuesta para la señal de control por voz introducida por el usuario para indicarle que la respuesta a la señal de control por voz se ha llevado a cabo. Posteriormente, el usuario puede seguir comunicándose con la aplicación de voz para llevar a cabo una respuesta a otra señal de control por voz.
Alternativamente, después de que el teléfono móvil determine que la señal de control por voz introducida por el usuario es la tarea 1 de voz en el archivo 1 de configuración, como está registrado en dicha tarea que es específicamente la tarea de reproducción y que un botón usado para la tarea es el botón de reproducción, el gestor de VUI puede además informar a la aplicación de vídeo de un evento de clic del botón de reproducción. Por ejemplo, el gestor de VUI puede tener unas coordenadas del botón de reproducción durante el evento de clic para notificarlas a la aplicación de vídeo. Además, la aplicación de vídeo puede, en respuesta al evento de clic, invocar una función relacionada en la capa de mar
Puede aprenderse que, en esta realización de la presente solicitud, se puede establecer un correspondiente archivo de configuración para cada interfaz en la aplicación. En el archivo de configuración están registrados una tarea de voz admitida por una correspondiente interfaz y un evento táctil específico que corresponde a la tarea de voz. De este modo, cuando está ejecutando una interfaz de la aplicación, el teléfono móvil puede convertir, basándose en el archivo de configuración de la interfaz, la señal de control por voz introducida por el usuario en un correspondiente evento táctil y, después, ejecutar el evento táctil a fin de implementar una función de control de cada botón de operación en la interfaz de la aplicación a través de la voz. De este modo, el teléfono móvil puede implementar, en cada interfaz de la aplicación, una función de control por voz para cada botón de operación que haya en dicha interfaz. Esto mejora la eficiencia del control por voz del teléfono móvil y la experiencia de usuario.
Además, después de determinar que la señal de control por voz introducida por el usuario es la tarea de reproducción en el archivo 1 de configuración, el teléfono móvil puede además visualizar, en la interfaz 601 de reproducción, un efecto de animación de la operación de control táctil de hacer clic en el botón 602 de reproducción para indicar visualmente al usuario que el teléfono móvil está respondiendo a la señal de control por voz introducida por el usuario. A modo de otro ejemplo, cuando el usuario introduce, a través de la voz, un texto (p. ej., un número de teléfono) en una interfaz que se está visualizando en el teléfono móvil, el teléfono móvil también puede presentarle, en la interfaz, un proceso de introducción del número de teléfono para que tenga una buena experiencia de usuario tanto en una interfaz GUI (Graphical User Interface - Interfaz Gráfica de Usuario) como en una interfaz VUI.
Por ejemplo, después de determinar que la señal de control por voz introducida por el usuario es la tarea de reproducción en el archivo 1 de configuración, el teléfono móvil puede simular un proceso de visualización del evento de clic en la pantalla táctil mediante la ejecución del siguiente código:
newOnVoiceClickListener{
public void onVoiceClick(final View view) {
view.setPressed(true);
//Simular presionar con un dedoy visualizar unestado apretado
view.performClick();
//Ejecutar una función callback correspondiente a un eventode clic
view.postDelayed(newRealsePressed(view),500);
//Transcurridos 500ms, simularsoltar
el dedo y visualizar un estado soltado
}
}
En consecuencia, si la señal de control por voz introducida por el usuario no pertenece a una tarea de voz en el archivo de configuración de la primera interfaz, esto indica que el teléfono móvil no admite la ejecución, en la primera interfaz actual, de la señal de control por voz enviada por el usuario. El teléfono móvil puede informar, usando la aplicación de voz, al usuario de que la tarea de voz no se puede llevar a cabo o incitarle a que vuelva a introducir una tarea de voz.
En algunas otras realizaciones, tal y como la mostrada en la Fig. 13, después de captar, usando la aplicación de voz, la señal de control por voz introducida por el usuario, el teléfono móvil puede además enviar dicha señal a un servidor. Por ejemplo, cuando la señal de control por voz introducida por el usuario es relativamente compleja y, por consiguiente, a la aplicación de voz le cuesta reconocerla, el teléfono móvil puede enviar al servidor la señal de control por voz introducida por el usuario. El servidor realiza un reconocimiento y una comprensión semánticos sobre la señal de control por voz introducida por el usuario para reconocer una tarea de voz real que corresponda a la señal de control por voz. Posteriormente, el servidor puede enviar la tarea de voz real reconocida al teléfono móvil para que el teléfono móvil la compare con una tarea de voz en un correspondiente archivo de configuración a fin de determinar si la señal de control por voz introducida por el usuario es la tarea de voz admitida en el archivo de configuración.
Por ejemplo, en esta realización de la presente solicitud, además de enviarle la señal de control por voz introducida por el usuario, el teléfono móvil puede además enviar al servidor información de interfaz de la primera interfaz. Por ejemplo, la información de interfaz de la primera interfaz puede ser un identificador de la primera interfaz, o puede ser un tipo de página (p. ej., una interfaz de ajustes o una interfaz de chat) de la primera interfaz, o puede ser un tipo (p. ej., una aplicación de vídeo) de la aplicación a la que pertenece la primera interfaz, un nombre de paquete o información similar.
Por ejemplo, en el teléfono móvil del usuario están instaladas tanto una aplicación de Ctrip como una aplicación de Booking. La aplicación de Booking es una de las aplicaciones predeterminadas que la aplicación de voz utiliza en el teléfono móvil. Tal y como se muestra aún en la Fig. 13, el teléfono móvil está visualizando en ese momento una página 1201 de inicio de la aplicación de Ctrip. Cuando el teléfono móvil habilita la aplicación de voz en segundo plano, la aplicación de voz capta una señal de control por voz “ quiero reservar un billete de avión” introducida por el usuario. Además, el teléfono móvil puede enviar al servidor la señal de control por voz captada por la aplicación de voz. Es más, el teléfono móvil puede además enviar al servidor una información de interfaz (p. ej., un nombre de paquete de la aplicación de Ctrip) de la página 1201 de inicio que se está ejecutando en ese momento. De este modo, el servidor puede realizar un reconocimiento de la voz sobre la señal de control por voz “ quiero reservar un billete de avión” haciendo referencia a la información de interfaz y reconocer que una tarea de voz real enviada por el usuario es: reservar un billete de avión utilizando la aplicación de Ctrip en lugar de la aplicación de Booking. En este caso, una vez que el servidor envía al teléfono móvil la tarea de voz real reconocida, el teléfono móvil puede habilitar automáticamente una interfaz de búsqueda de billetes de avión de la aplicación de Ctrip basada en dicha tarea en respuesta a la señal de control por voz “ quiero reservar un billete de avión” .
En consecuencia, si una interfaz que el teléfono móvil está visualizando en ese momento no es una interfaz de la aplicación de Ctrip, por ejemplo, cuando el teléfono móvil está visualizando en ese momento un escritorio (que también puede denominarse pantalla de inicio), si el teléfono móvil habilita la aplicación de voz en segundo plano y la aplicación de voz capta la señal de control por voz introducida por el usuario “ quiero reservar un billete de avión” , el teléfono móvil puede enviar al servidor la señal de control por voz captada por la aplicación de voz. Además, el teléfono móvil puede además enviar al servidor una información de interfaz del escritorio que se está ejecutando en ese momento. De este modo, el servidor puede realizar un reconocimiento de la voz sobre la señal de control por voz “ quiero reservar un billete de avión” haciendo referencia a la información de interfaz y reconocer que una tarea de voz real enviada por el usuario es: reservar un billete de avión utilizando la aplicación de Booking predeterminada en lugar de la aplicación de Ctrip. En este caso, después de que el servidor envíe la tarea de voz real reconocida al teléfono móvil, el teléfono móvil puede habilitar automáticamente una interfaz de búsqueda de billetes de avión de la aplicación de Booking basándose en la tarea de voz real en respuesta a la señal de control por voz “ quiero reservar un billete de avión” . En otras palabras, en esta realización de la presente solicitud, el teléfono móvil puede enviar activamente al servidor información de interfaz de una aplicación que se está ejecutando. Como la información de interfaz puede reflejar un escenario de uso real actual del teléfono móvil, el servidor puede realizar con mayor precisión, haciendo referencia a la información de interfaz, un reconocimiento de la voz sobre la señal de control por voz introducida por el usuario. De este modo, se determina con mayor precisión la tarea de voz real enviada por el usuario.
Tal y como se muestra en la Fig. 14, una realización de la presente solicitud divulga un dispositivo electrónico, que incluye: una pantalla táctil 1401, donde la pantalla táctil 1401 incluye una superficie táctil 1406 y un visualizador 1407; uno o más procesadores 1402; una memoria 1403 un módulo 1408 de comunicaciones; una o más aplicaciones (no mostradas); uno o más programas informáticos 1404, donde los componentes anteriores pueden conectarse usando uno o más buses 1405 de comunicaciones. Los uno o más programas informáticos 1404 están almacenados en la memoria 1403, y están configurados para ser ejecutados por los uno o más procesadores 1402. Los uno o más programas informáticos 1404 incluyen una instrucción. La instrucción puede usarse para realizar los pasos de las realizaciones anteriores. Por ejemplo, la instrucción puede usarse para realizar los pasos mostrados en la Fig. 5. Las descripciones anteriores acerca de las implementaciones permiten a un experto en la técnica comprender que, con el propósito de una descripción breve y conveniente, la división de los módulos funcionales anteriores se toma como un ejemplo de ilustración. En la aplicación real, las funciones anteriores pueden asignarse a diferentes módulos e implementarse de acuerdo con un requisito, es decir, una estructura interna de un aparato se divide en diferentes módulos de funciones para implementar todas o parte de las funciones descritas anteriormente. Para un proceso de trabajo específico del sistema, el aparato y la unidad anteriores, véase en las realizaciones de método anteriores un proceso correspondiente, cuyos detalles no se describirán de nuevo en la presente memoria.
Las unidades funcionales en las realizaciones de la presente solicitud pueden integrarse en una sola unidad de procesamiento, o cada una de las unidades puede existir físicamente por separado, o dos o más unidades están integradas en una unidad. La unidad integrada puede implementarse en forma de hardware, o puede implementarse en forma de una unidad funcional de software.
Cuando la unidad integrada se implementa en forma de una unidad funcional de software y se vende o usa como un producto independiente, la unidad integrada puede almacenarse en un medio de almacenamiento legible por ordenador. Con base en tal comprensión, las soluciones técnicas de las modalidades de esta solicitud esencialmente, o la parte que contribuye a la técnica anterior, o todas o algunas de las soluciones técnicas pueden implementarse en forma de un producto de software. El producto de software informático está almacenado en un medio de almacenamiento e incluye varias instrucciones para ordenar a un dispositivo informático (que puede ser un ordenador personal, un servidor o un dispositivo de red) que realice todas o algunos de los pasos de los métodos descritos en las realizaciones de la presente solicitud. El medio de almacenamiento anterior incluye: cualquier medio que pueda almacenar código de programa, tal como una memoria flash, un disco duro extraíble, una memoria de solo lectura, una memoria de acceso aleatorio, un disco magnético o un disco óptico.
Las descripciones anteriores son simplemente implementaciones específicas de las modalidades de esta solicitud, pero no pretenden limitar el alcance de protección de las modalidades de esta solicitud. Por lo tanto, el alcance de protección de las modalidades de esta solicitud debería estar sujeto al alcance de protección de las reivindicaciones.
Claims (1)
- REIVINDICACIONESUn dispositivo electrónico, que comprende:una pantalla táctil (1401), en donde la pantalla táctil (1401) comprende una superficie (1406) sensible al tacto y un visualizador (1407);uno o más procesadores (1402);una o más memorias (1403); yuno o más programas informáticos (1404), en donde los uno o más programas informáticos están almacenados en las una o más memorias (1403), los uno o más programas informáticos (1404) comprenden una instrucción y, cuando la instrucción es ejecutada por los uno o más procesadores (1402), el dispositivo electrónico queda habilitado para realizar los siguientes pasos:visualizar una primera interfaz (901) de una primera aplicación, en donde la primera interfaz (901) comprende al menos un control usado para actualizar la primera interfaz (901);habilitar una aplicación de voz en segundo plano en respuesta a una señal de activación preestablecida introducida por un usuario para comenzar a captar una señal de control por voz introducida por el usuario; obtener un primer archivo de configuración que está asociado con la primera interfaz (901) de entre uno o más archivos de configuración correspondientes a la primera aplicación, en donde cada uno de los uno o más archivos de configuración registra un número de tareas de voz admitidas por la aplicación de voz en una respectiva interfaz de la primera aplicación, y en donde el primer archivo de configuración registra N tareas de voz que se permite que se ejecuten en la primera interfaz (901) y N es un entero mayor que 0; visualizar, en la primera interfaz (901), M incitadores (902) de entrada por voz basándose en el primer archivo de configuración, en donde cada incitador de entrada por voz de los M incitadores (902) de entrada por voz se corresponde a un control en la primera interfaz (901), y M es un entero mayor que 0 y menor o igual que N; captar una primera señal de control por voz introducida por el usuario, en donde la primera señal de control por voz se corresponde a un primer incitador de entrada por voz de los M incitadores (901) de entrada por voz, el primer incitador de entrada por voz se corresponde a un primer control en la primera interfaz (901), y el primer control es uno del al menos un control de la primera interfaz (901);visualizar, en la primera interfaz (901), un efecto de animación del primer control que se ha generado simulando una operación de hacer clic en el primer control en respuesta a la primera señal de control por voz; y después de visualizarse el efecto de animación, visualizar una segunda interfaz de la primera aplicación en respuesta a la primera señal de control por voz, en donde la segunda interfaz es una interfaz obtenida por actualización después de activarse el primer control en la primera interfaz (901).El dispositivo electrónico según la reivindicación 1, en donde después de habilitar la aplicación de voz en segundo plano, el dispositivo electrónico está configurado además para:ejecutar, si se detecta una operación de control táctil realizada por el usuario sobre el control en la primera interfaz (901), una instrucción de operación que corresponde a la operación de control táctil.El dispositivo electrónico según la reivindicación 1 o 2, en donde después de habilitar la aplicación de voz en segundo plano, el dispositivo electrónico está configurado además para:visualizar un identificador de la aplicación de voz en la primera interfaz (901).El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 3, en donde la primera aplicación es una aplicación de música, la primera interfaz es una interfaz de reproducción de música de la aplicación de música, el dispositivo electrónico está configurado además para:visualizar uno o más de los siguientes contenidos en la primera interfaz:un control de reproducción y un incitador de entrada por voz que corresponde al control de reproducción; o un control de pausa y un incitador de entrada por voz que corresponde al control de pausa; oun control de vuelta a una anterior y un incitador de entrada por voz que corresponde al control de vuelta a una anterior; oun control de paso a una siguiente y un incitador de entrada por voz que corresponde al control de paso a una siguiente; oun control de subida del volumen y un incitador de entrada por voz que corresponde al control de subida del volumen; oun control de bajada del volumen y un incitador de entrada por voz que corresponde al control de bajada del volumen;5. El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 3, en donde la primera aplicación es una aplicación de cámara, la primera interfaz (901) es una interfaz de realización de fotografías de la aplicación de cámara, el dispositivo electrónico está configurado además para:visualizar uno o más de los siguientes contenidos en la primera interfaz (901):un control de realización de fotografías y un incitador de entrada por voz que corresponde al control de realización de fotografías; oun control de grabación y un incitador de entrada por voz que corresponde al control de grabación; o habilitar un control de cámara frontal y un incitador de entrada por voz que corresponde a la habilitación de un control de cámara frontal; over un control fotográfico y un incitador de entrada por voz que corresponde a la vista de un control fotográfico.6. El dispositivo electrónico según la reivindicación 5, en donde el dispositivo electrónico está configurado además para:recibir una señal de control por voz usada para la realización de fotografías e introducida por el usuario en la interfaz de realización de fotografías;hacer una foto en respuesta a la señal de control por voz usada para fotografiar, y seguir visualizando la interfaz de realización de fotografías e incitadores de entrada por voz que corresponden a la interfaz de realización de fotografías; yvisualizar una miniatura fotográfica de la foto en la interfaz de realización de fotografías.7. El dispositivo electrónico según la reivindicación 6, en donde el dispositivo electrónico está configurado además para:recibir una señal de control por voz usada para ver una foto introducida por el usuario en la interfaz de realización de fotografías;visualizar la foto en respuesta a la señal de control por voz usada para ver una foto.8. El dispositivo electrónico según la reivindicación 7, en donde el dispositivo electrónico está configurado además para realizar uno o más de los siguientes pasos:recibir, en una interfaz para visualizar la foto, una señal de control por voz usada para ampliar introducida por el usuario, y ampliar la foto; orecibir, en la interfaz para visualizar la foto, una señal de control por voz usada para reducir introducida por el usuario, y reducir la foto; orecibir, en la interfaz para visualizar la foto, una señal de control por voz usada para revisar una foto siguiente introducida por el usuario, y realizar una operación de deslizamiento sobre la foto; o recibir, en la interfaz para visualizar la foto, una señal de control por voz usada para volver a la cámara introducida por el usuario, y visualizar la interfaz de realización de fotografías de la aplicación de cámara.9. El dispositivo electrónico según la reivindicación 4, en donde visualizar en la primera interfaz el control de pausa y el incitador de entrada por voz que corresponde al control de pausa, el dispositivo electrónico está configurado además para:recibir una señal de control por voz usada para pausar introducida por el usuario;visualizar la segunda interfaz en respuesta a la señal de control por voz usada para pausar, en donde la segunda interfaz es una interfaz obtenida por actualización después de activarse el control de pausa en la primera interfaz, la segunda interfaz visualiza el control de reproducción y el incitador de entrada por voz que corresponde al control de reproducción, y la segunda interfaz no visualiza el control de pausa y el incitador de entrada por voz que corresponde al control de pausa.10. El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 9, en donde:la primera señal de control por voz comprende un nombre del primer control, ola segunda señal de control por voz comprende un nombre del segundo control.11. El dispositivo electrónico según la reivindicación 10, en dondeobtener el nombre del primer control usando el primer archivo de configuración; oobtener el nombre del segundo control usando el primer archivo de configuración.12. El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 11, en donde:la señal de activación comprende una palabra de activación introducida por el usuario; ola señal de activación comprende una señal de clic del usuario en un botón; ola señal de activación comprende un gesto táctil del usuario.13. El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 12, en donde el dispositivo electrónico está configurado además para:visualizar inmediatamente, después de habilitar la aplicación de voz, los M incitadores de entrada por voz en la primera interfaz (901); ovisualizar, después de habilitar la aplicación de voz, los M incitadores de entrada por voz en la primera interfaz (901) una vez transcurrido un período de tiempo preestablecido.14. El dispositivo electrónico según una cualquiera de las reivindicaciones 1 a 13, en donde el dispositivo electrónico está configurado además para:ocultar automáticamente los M incitadores de entrada por voz antes de que el dispositivo electrónico capte la primera señal de control por voz introducida por el usuario.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN201811407531.7A CN109584879B (zh) | 2018-11-23 | 2018-11-23 | 一种语音控制方法及电子设备 |
| PCT/CN2019/118645 WO2020103764A1 (zh) | 2018-11-23 | 2019-11-15 | 一种语音控制方法及电子设备 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2964533T3 true ES2964533T3 (es) | 2024-04-08 |
Family
ID=65924299
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES19886971T Active ES2964533T3 (es) | 2018-11-23 | 2019-11-15 | Método de control de voz y dispositivo electrónico |
Country Status (9)
| Country | Link |
|---|---|
| US (1) | US11450322B2 (es) |
| EP (1) | EP3872807B1 (es) |
| JP (1) | JP7142783B2 (es) |
| KR (1) | KR102470275B1 (es) |
| CN (3) | CN109584879B (es) |
| AU (1) | AU2019385366B2 (es) |
| ES (1) | ES2964533T3 (es) |
| RU (1) | RU2766255C1 (es) |
| WO (1) | WO2020103764A1 (es) |
Families Citing this family (81)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8572513B2 (en) | 2009-03-16 | 2013-10-29 | Apple Inc. | Device, method, and graphical user interface for moving a current position in content at a variable scrubbing rate |
| EP3195098B1 (en) | 2014-07-21 | 2024-10-23 | Apple Inc. | Remote user interface |
| WO2016036510A1 (en) | 2014-09-02 | 2016-03-10 | Apple Inc. | Music user interface |
| US9547419B2 (en) | 2014-09-02 | 2017-01-17 | Apple Inc. | Reduced size configuration interface |
| US10928980B2 (en) | 2017-05-12 | 2021-02-23 | Apple Inc. | User interfaces for playing and managing audio items |
| CN111343060B (zh) | 2017-05-16 | 2022-02-11 | 苹果公司 | 用于家庭媒体控制的方法和界面 |
| US12526361B2 (en) | 2017-05-16 | 2026-01-13 | Apple Inc. | Methods for outputting an audio output in accordance with a user being within a range of a device |
| CN109584879B (zh) | 2018-11-23 | 2021-07-06 | 华为技术有限公司 | 一种语音控制方法及电子设备 |
| CN110138959B (zh) * | 2019-04-10 | 2022-02-15 | 荣耀终端有限公司 | 显示人机交互指令的提示的方法及电子设备 |
| CN110060679B (zh) * | 2019-04-23 | 2022-02-11 | 诚迈科技(南京)股份有限公司 | 一种全程语音控制的交互方法和系统 |
| CN110096211B (zh) * | 2019-04-30 | 2021-03-19 | 广东美的厨房电器制造有限公司 | 家用电器的控制方法和家用电器 |
| KR102393717B1 (ko) | 2019-05-06 | 2022-05-03 | 애플 인크. | 전자 디바이스의 제한된 동작 |
| CN110148414B (zh) * | 2019-05-21 | 2021-06-29 | 大众问问(北京)信息科技有限公司 | 一种语音说法引导方法和装置 |
| US10904029B2 (en) | 2019-05-31 | 2021-01-26 | Apple Inc. | User interfaces for managing controllable external devices |
| KR102436985B1 (ko) | 2019-05-31 | 2022-08-29 | 애플 인크. | 오디오 미디어 제어를 위한 사용자 인터페이스 |
| DK201970533A1 (en) | 2019-05-31 | 2021-02-15 | Apple Inc | Methods and user interfaces for sharing audio |
| US20200379716A1 (en) * | 2019-05-31 | 2020-12-03 | Apple Inc. | Audio media user interface |
| CN110262767B (zh) * | 2019-06-03 | 2022-03-11 | 交互未来(北京)科技有限公司 | 基于靠近嘴部检测的语音输入唤醒装置、方法和介质 |
| CN110336720B (zh) * | 2019-06-29 | 2021-08-20 | 华为技术有限公司 | 设备控制方法和设备 |
| CN115145529B (zh) * | 2019-08-09 | 2023-05-09 | 华为技术有限公司 | 语音控制设备的方法及电子设备 |
| CN110502300A (zh) * | 2019-08-14 | 2019-11-26 | 上海掌门科技有限公司 | 语音播放方法、设备以及计算机可读介质 |
| CN110493123B (zh) * | 2019-09-16 | 2022-06-28 | 腾讯科技(深圳)有限公司 | 即时通讯方法、装置、设备及存储介质 |
| CN110825469A (zh) * | 2019-09-18 | 2020-02-21 | 华为技术有限公司 | 语音助手显示方法及装置 |
| CN112533041A (zh) * | 2019-09-19 | 2021-03-19 | 百度在线网络技术(北京)有限公司 | 视频播放方法、装置、电子设备和可读存储介质 |
| CN112540741A (zh) * | 2019-09-23 | 2021-03-23 | 深圳市万普拉斯科技有限公司 | 指令动态推荐方法、移动终端和计算机存储介质 |
| CN112579032B (zh) * | 2019-09-27 | 2023-10-03 | 百度在线网络技术(北京)有限公司 | 智能设备引导的方法及装置 |
| CN116564304A (zh) | 2019-09-30 | 2023-08-08 | 华为终端有限公司 | 语音交互方法及装置 |
| CN112652302B (zh) * | 2019-10-12 | 2024-05-24 | 腾讯科技(深圳)有限公司 | 语音控制方法、装置、终端及存储介质 |
| CN110865755A (zh) * | 2019-11-11 | 2020-03-06 | 珠海格力电器股份有限公司 | 终端的语音控制方法、装置、存储介质及终端 |
| CN110851108A (zh) * | 2019-11-18 | 2020-02-28 | 北京小米移动软件有限公司 | 电子设备操作方法、装置、电子设备及存储介质 |
| CN111124229B (zh) * | 2019-12-24 | 2022-03-11 | 山东舜网传媒股份有限公司 | 通过语音交互实现网页动画控制的方法、系统及浏览器 |
| CN111326149A (zh) * | 2020-02-25 | 2020-06-23 | 青岛海尔空调器有限总公司 | 一种提高语音辨识率的优化方法及系统 |
| US11595509B2 (en) * | 2020-03-05 | 2023-02-28 | Avaya Management L.P. | Telecommunications soft client having a GUI-less operating mode |
| CN111462783A (zh) * | 2020-03-05 | 2020-07-28 | 深圳壹账通智能科技有限公司 | 音视频录制引导方法、装置、计算机设备及存储介质 |
| CN111427532A (zh) * | 2020-03-20 | 2020-07-17 | 青岛聚好联科技有限公司 | 一种App语音输入控制的方法及装置 |
| CN113535040A (zh) * | 2020-04-14 | 2021-10-22 | 北京达佳互联信息技术有限公司 | 图像处理方法、装置、电子设备和存储介质 |
| US11079913B1 (en) | 2020-05-11 | 2021-08-03 | Apple Inc. | User interface for status indicators |
| CN113703656B (zh) * | 2020-05-22 | 2026-01-13 | 苹果公司 | 数字助理用户界面和响应模式 |
| CN111833868A (zh) * | 2020-06-30 | 2020-10-27 | 北京小米松果电子有限公司 | 语音助手控制方法、装置及计算机可读存储介质 |
| CN111880875B (zh) * | 2020-07-15 | 2023-12-22 | 百度在线网络技术(北京)有限公司 | 多媒体播放的控制方法、装置、设备、存储介质和系统 |
| CN114007117B (zh) | 2020-07-28 | 2023-03-21 | 华为技术有限公司 | 一种控件显示方法和设备 |
| CN114255745A (zh) * | 2020-09-10 | 2022-03-29 | 华为技术有限公司 | 一种人机交互的方法、电子设备及系统 |
| US12511021B2 (en) | 2020-09-14 | 2025-12-30 | Apple Inc. | Device management user interface |
| US11392291B2 (en) | 2020-09-25 | 2022-07-19 | Apple Inc. | Methods and interfaces for media control with dynamic feedback |
| CN114327198A (zh) * | 2020-09-29 | 2022-04-12 | 华为技术有限公司 | 控制功能推送方法及设备 |
| CN114363462B (zh) * | 2020-09-30 | 2023-01-06 | 华为技术有限公司 | 一种界面显示方法、电子设备及计算机可读介质 |
| US20220310058A1 (en) * | 2020-11-03 | 2022-09-29 | Microsoft Technology Licensing, Llc | Controlled training and use of text-to-speech models and personalized model generated voices |
| CN115048161B (zh) * | 2021-02-26 | 2025-12-09 | 华为技术有限公司 | 应用的控制方法及其电子设备、装置和介质 |
| US11720325B2 (en) * | 2021-04-16 | 2023-08-08 | Google Llc | Automated assistant performance of a non-assistant application operation(s) in response to a user input that can be limited to a parameter(s) |
| CN115408492A (zh) * | 2021-05-26 | 2022-11-29 | 华为技术有限公司 | 资源显示的方法、终端及服务器 |
| CN115497470A (zh) * | 2021-06-18 | 2022-12-20 | 华为技术有限公司 | 跨设备的对话业务接续方法、系统、电子设备和存储介质 |
| CN113709294A (zh) * | 2021-07-26 | 2021-11-26 | 青岛海尔科技有限公司 | 一种语音助手的状态管理和ui更新方法、装置及设备 |
| CN115691486A (zh) * | 2021-07-28 | 2023-02-03 | 华为技术有限公司 | 语音指令执行方法、电子设备及介质 |
| CN113672192B (zh) * | 2021-08-20 | 2025-03-07 | Vidaa(荷兰)国际控股有限公司 | 一种浏览器页面文字提示消息的方法及显示设备 |
| US12596520B2 (en) | 2021-09-24 | 2026-04-07 | Apple Inc. | Media controls user interface |
| CN113940831B (zh) * | 2021-10-27 | 2022-12-16 | 青岛豪江智能科技股份有限公司 | 带语音控制及生命体征监测的智能护理床电控系统 |
| CN114090148B (zh) * | 2021-11-01 | 2025-03-11 | 深圳Tcl新技术有限公司 | 信息同步方法、装置、电子设备及计算机可读存储介质 |
| CN113946810B (zh) * | 2021-12-07 | 2022-09-20 | 荣耀终端有限公司 | 一种应用程序的运行方法及电子设备 |
| CN116527807A (zh) * | 2022-01-24 | 2023-08-01 | 华为技术有限公司 | 流转续播方法、电子设备、存储介质和程序产品 |
| US12579758B2 (en) | 2022-02-08 | 2026-03-17 | Apple Inc. | Devices, methods, and graphical user interfaces for interacting with virtual objects using hand gestures |
| CN114495934A (zh) * | 2022-02-28 | 2022-05-13 | 海信视像科技股份有限公司 | 一种语音指令响应状态的提示方法及显示设备 |
| CN116842170A (zh) * | 2022-03-24 | 2023-10-03 | 华为技术有限公司 | 一种信息分享方法及相关设备 |
| CN114639384B (zh) * | 2022-05-16 | 2022-08-23 | 腾讯科技(深圳)有限公司 | 语音控制方法、装置、计算机设备及计算机存储介质 |
| US12386428B2 (en) | 2022-05-17 | 2025-08-12 | Apple Inc. | User interfaces for device controls |
| CN115019791B (zh) * | 2022-05-30 | 2025-07-04 | 星河智联汽车科技有限公司 | 一种车载会议场景下的语音交互方法、装置及车辆 |
| CN115022545B (zh) * | 2022-06-02 | 2024-04-02 | 北京字跳网络技术有限公司 | 用于内容拍摄的方法、装置、设备和存储介质 |
| CN115328571A (zh) * | 2022-08-16 | 2022-11-11 | 亿咖通(湖北)技术有限公司 | 一种启动方法、装置、电子设备及存储介质 |
| US12615491B2 (en) | 2022-09-06 | 2026-04-28 | Apple Inc. | Interfaces for device interactions |
| CN119907961A (zh) | 2022-10-11 | 2025-04-29 | 三星电子株式会社 | 用于执行与用户语音相对应的操作的电子设备及其控制方法 |
| CN117956066B (zh) * | 2022-10-27 | 2025-09-26 | 荣耀终端股份有限公司 | 一种服务控制方法及电子设备、芯片系统、存储介质 |
| CN115729544A (zh) * | 2022-11-18 | 2023-03-03 | 维沃移动通信有限公司 | 桌面组件生成方法、装置、电子设备和可读存储介质 |
| CN115810358A (zh) * | 2022-12-09 | 2023-03-17 | 平安银行股份有限公司 | 信息录入方法、装置、存储介质及电子设备 |
| CN118588070A (zh) * | 2023-03-02 | 2024-09-03 | 华为技术有限公司 | 语音控制方法及电子设备 |
| CN119229861B (zh) * | 2023-06-30 | 2025-12-26 | 荣耀终端股份有限公司 | 一种通过语音控制终端设备的方法及终端设备 |
| CN119946368A (zh) * | 2023-10-27 | 2025-05-06 | 荣耀终端股份有限公司 | 一种视频生成方法、电子设备及存储介质 |
| WO2025110258A1 (ko) * | 2023-11-20 | 2025-05-30 | 엘지전자 주식회사 | 영상표시장치 및 이를 포함하는 시스템 |
| CN120216044A (zh) * | 2023-12-20 | 2025-06-27 | 荣耀终端股份有限公司 | 应用的启动方法、电子设备及可读介质 |
| CN120279902A (zh) * | 2023-12-29 | 2025-07-08 | 荣耀终端股份有限公司 | 一种语音控制方法及电子设备 |
| CN118444995B (zh) * | 2023-12-29 | 2025-04-15 | 荣耀终端股份有限公司 | 应用启动方法和电子设备 |
| CN120279903A (zh) * | 2023-12-29 | 2025-07-08 | 荣耀终端股份有限公司 | 一种语音控制方法及电子设备 |
| CN120279901A (zh) * | 2023-12-29 | 2025-07-08 | 荣耀终端股份有限公司 | 一种语音控制方法及电子设备 |
Family Cites Families (50)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US7334050B2 (en) | 2000-06-07 | 2008-02-19 | Nvidia International, Inc. | Voice applications and voice-based interface |
| GB2388209C (en) * | 2001-12-20 | 2005-08-23 | Canon Kk | Control apparatus |
| US7174294B2 (en) * | 2002-06-21 | 2007-02-06 | Microsoft Corporation | Speech platform architecture |
| JP2007171809A (ja) * | 2005-12-26 | 2007-07-05 | Canon Inc | 情報処理装置及び情報処理方法 |
| US8311836B2 (en) * | 2006-03-13 | 2012-11-13 | Nuance Communications, Inc. | Dynamic help including available speech commands from content contained within speech grammars |
| TW200928315A (en) | 2007-12-24 | 2009-07-01 | Mitac Int Corp | Voice-controlled navigation device and method thereof |
| US8768702B2 (en) * | 2008-09-05 | 2014-07-01 | Apple Inc. | Multi-tiered voice feedback in an electronic device |
| US10540976B2 (en) * | 2009-06-05 | 2020-01-21 | Apple Inc. | Contextual voice commands |
| US8290780B2 (en) | 2009-06-24 | 2012-10-16 | International Business Machines Corporation | Dynamically extending the speech prompts of a multimodal application |
| KR101626159B1 (ko) * | 2009-11-25 | 2016-05-31 | 엘지전자 주식회사 | 사용자 적응형 디스플레이 장치 및 디스플레이 방법 |
| US9665344B2 (en) * | 2010-02-24 | 2017-05-30 | GM Global Technology Operations LLC | Multi-modal input system for a voice-based menu and content navigation service |
| WO2013022218A2 (en) | 2011-08-05 | 2013-02-14 | Samsung Electronics Co., Ltd. | Electronic apparatus and method for providing user interface thereof |
| WO2014055181A1 (en) * | 2012-10-01 | 2014-04-10 | Nuance Communications, Inc. | Systems and methods for providing a voice agent user interface |
| CN103871437B (zh) * | 2012-12-11 | 2017-08-22 | 比亚迪股份有限公司 | 车载多媒体装置及其语音控制方法 |
| KR20140075997A (ko) * | 2012-12-12 | 2014-06-20 | 엘지전자 주식회사 | 이동 단말기 및 이동 단말기의 제어 방법 |
| CN103885693B (zh) * | 2012-12-20 | 2018-07-06 | 联想(北京)有限公司 | 一种信息处理方法及电子设备 |
| US9196262B2 (en) * | 2013-03-14 | 2015-11-24 | Qualcomm Incorporated | User sensing system and method for low power voice command activation in wireless communication systems |
| CN104076916B (zh) * | 2013-03-29 | 2017-05-24 | 联想(北京)有限公司 | 一种信息处理方法以及电子设备 |
| US9530410B1 (en) * | 2013-04-09 | 2016-12-27 | Google Inc. | Multi-mode guard for voice commands |
| CN103338311A (zh) * | 2013-07-11 | 2013-10-02 | 成都西可科技有限公司 | 一种智能手机锁屏界面启动app的方法 |
| JP2015026102A (ja) | 2013-07-24 | 2015-02-05 | シャープ株式会社 | 電子機器 |
| CN103442138A (zh) | 2013-08-26 | 2013-12-11 | 华为终端有限公司 | 语音控制方法、装置及终端 |
| CN104700832B (zh) * | 2013-12-09 | 2018-05-25 | 联发科技股份有限公司 | 语音关键字检测系统及方法 |
| JP5955299B2 (ja) * | 2013-11-08 | 2016-07-20 | 株式会社ソニー・インタラクティブエンタテインメント | 表示制御装置、表示制御方法、プログラム及び情報記憶媒体 |
| US9582246B2 (en) * | 2014-03-04 | 2017-02-28 | Microsoft Technology Licensing, Llc | Voice-command suggestions based on computer context |
| KR101584887B1 (ko) * | 2014-03-07 | 2016-01-22 | 주식회사 엘지유플러스 | 통신 단말기에서 음성 인식 서비스의 멀티태스킹을 지원하는 방법 및 시스템 |
| CN103885596B (zh) * | 2014-03-24 | 2017-05-24 | 联想(北京)有限公司 | 一种信息处理方法及电子设备 |
| US10592095B2 (en) * | 2014-05-23 | 2020-03-17 | Apple Inc. | Instantaneous speaking of content on touch devices |
| KR102281178B1 (ko) * | 2014-07-09 | 2021-07-23 | 삼성전자주식회사 | 멀티-레벨 음성 인식 방법 및 장치 |
| US10200824B2 (en) * | 2015-05-27 | 2019-02-05 | Apple Inc. | Systems and methods for proactively identifying and surfacing relevant content on a touch-sensitive device |
| CN105094331B (zh) * | 2015-07-27 | 2018-08-07 | 联想(北京)有限公司 | 一种信息处理方法及电子设备 |
| CN105895093A (zh) * | 2015-11-02 | 2016-08-24 | 乐视致新电子科技(天津)有限公司 | 语音信息处理方法及装置 |
| CN105446489B (zh) | 2015-12-08 | 2017-09-22 | 广州神马移动信息科技有限公司 | 语音双模控制方法、装置及用户终端 |
| US10446143B2 (en) * | 2016-03-14 | 2019-10-15 | Apple Inc. | Identification of voice inputs providing credentials |
| CN105957530B (zh) * | 2016-04-28 | 2020-01-03 | 海信集团有限公司 | 一种语音控制方法、装置和终端设备 |
| US10043516B2 (en) * | 2016-09-23 | 2018-08-07 | Apple Inc. | Intelligent automated assistant |
| KR102848501B1 (ko) * | 2016-10-28 | 2025-08-20 | 에스케이텔레콤 주식회사 | 이중 웨이크업을 이용한 음성 인식 서비스 제공 방법 및 이를 위한 장치 |
| JP6244483B2 (ja) * | 2017-01-05 | 2017-12-06 | 任天堂株式会社 | 情報処理装置、情報処理システム、ならびに起動用プログラムおよびそれを記憶した記憶媒体 |
| KR20180084392A (ko) * | 2017-01-17 | 2018-07-25 | 삼성전자주식회사 | 전자 장치 및 그의 동작 방법 |
| KR102423298B1 (ko) * | 2017-03-28 | 2022-07-21 | 삼성전자주식회사 | 음성 인식 서비스 운용 방법, 이를 지원하는 전자 장치 및 시스템 |
| CN107277225B (zh) | 2017-05-04 | 2020-04-24 | 北京奇虎科技有限公司 | 语音控制智能设备的方法、装置和智能设备 |
| US10237209B2 (en) * | 2017-05-08 | 2019-03-19 | Google Llc | Initializing a conversation with an automated agent via selectable graphical element |
| KR102007478B1 (ko) * | 2017-06-28 | 2019-08-05 | 크리스토퍼 재현 윤 | 특정 조건에서 음성인식을 이용한 어플리케이션 제어 장치 및 방법 |
| CN107346229A (zh) * | 2017-07-18 | 2017-11-14 | 珠海市魅族科技有限公司 | 语音输入方法及装置、计算机装置及可读存储介质 |
| US10896050B2 (en) * | 2017-10-03 | 2021-01-19 | Google Llc | Systems, methods, and apparatus that provide multi-functional links for interacting with an assistant agent |
| CN108366281A (zh) * | 2018-02-05 | 2018-08-03 | 山东浪潮商用系统有限公司 | 一种应用于机顶盒的全语音交互方法 |
| CN108572764B (zh) * | 2018-03-13 | 2022-01-14 | 努比亚技术有限公司 | 一种文字输入控制方法、设备及计算机可读存储介质 |
| CN108520750A (zh) * | 2018-03-13 | 2018-09-11 | 努比亚技术有限公司 | 一种语音输入控制方法、设备及计算机可读存储介质 |
| CN108829371B (zh) | 2018-06-19 | 2022-02-22 | Oppo广东移动通信有限公司 | 界面控制方法、装置、存储介质及电子设备 |
| CN109584879B (zh) | 2018-11-23 | 2021-07-06 | 华为技术有限公司 | 一种语音控制方法及电子设备 |
-
2018
- 2018-11-23 CN CN201811407531.7A patent/CN109584879B/zh active Active
- 2018-11-23 CN CN202110896766.2A patent/CN113794800B/zh active Active
-
2019
- 2019-11-15 KR KR1020217018691A patent/KR102470275B1/ko active Active
- 2019-11-15 ES ES19886971T patent/ES2964533T3/es active Active
- 2019-11-15 AU AU2019385366A patent/AU2019385366B2/en active Active
- 2019-11-15 CN CN201980076304.7A patent/CN113056901A/zh active Pending
- 2019-11-15 JP JP2021528948A patent/JP7142783B2/ja active Active
- 2019-11-15 US US17/295,569 patent/US11450322B2/en active Active
- 2019-11-15 RU RU2021117890A patent/RU2766255C1/ru active
- 2019-11-15 WO PCT/CN2019/118645 patent/WO2020103764A1/zh not_active Ceased
- 2019-11-15 EP EP19886971.1A patent/EP3872807B1/en active Active
Also Published As
| Publication number | Publication date |
|---|---|
| AU2019385366B2 (en) | 2022-12-01 |
| CN113794800A (zh) | 2021-12-14 |
| EP3872807B1 (en) | 2023-10-18 |
| US11450322B2 (en) | 2022-09-20 |
| CN113794800B (zh) | 2022-08-26 |
| CN109584879A (zh) | 2019-04-05 |
| CN109584879B (zh) | 2021-07-06 |
| RU2766255C1 (ru) | 2022-02-10 |
| JP2022508176A (ja) | 2022-01-19 |
| KR102470275B1 (ko) | 2022-11-23 |
| US20210407507A1 (en) | 2021-12-30 |
| WO2020103764A1 (zh) | 2020-05-28 |
| KR20210092795A (ko) | 2021-07-26 |
| EP3872807A4 (en) | 2021-12-22 |
| JP7142783B2 (ja) | 2022-09-27 |
| EP3872807A1 (en) | 2021-09-01 |
| AU2019385366A1 (en) | 2021-06-10 |
| CN113056901A (zh) | 2021-06-29 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| ES2964533T3 (es) | Método de control de voz y dispositivo electrónico | |
| CN113645351B (zh) | 应用界面交互方法、电子设备和计算机可读存储介质 | |
| CN110114747B (zh) | 一种通知处理方法及电子设备 | |
| WO2021052263A1 (zh) | 语音助手显示方法及装置 | |
| CN110910872A (zh) | 语音交互方法及装置 | |
| CN111543042B (zh) | 通知消息的处理方法及电子设备 | |
| WO2021036770A1 (zh) | 一种分屏处理方法及终端设备 | |
| CN113704205B (zh) | 日志存储的方法、芯片、电子设备和可读存储介质 | |
| CN109976626A (zh) | 一种应用图标的切换方法及电子设备 | |
| CN113452945A (zh) | 分享应用界面的方法、装置、电子设备及可读存储介质 | |
| CN112882823A (zh) | 屏幕显示方法及电子设备 | |
| CN113448658A (zh) | 截屏处理的方法、图形用户接口及终端 | |
| CN114077365A (zh) | 分屏显示方法和电子设备 | |
| CN113641271A (zh) | 应用窗口的管理方法、终端设备及计算机可读存储介质 | |
| CN114995715A (zh) | 悬浮球的控制方法和相关装置 | |
| WO2022042766A1 (zh) | 信息显示方法、终端设备及计算机可读存储介质 | |
| WO2022127130A1 (zh) | 一种添加操作序列的方法、电子设备和系统 | |
| CN115016697A (zh) | 投屏方法、计算机设备、可读存储介质和程序产品 | |
| WO2022022381A1 (zh) | 生成涂鸦图案的方法、装置、电子设备及存储介质 | |
| CN113380240B (zh) | 语音交互方法和电子设备 | |
| CN115032640A (zh) | 手势识别方法和终端设备 | |
| CN112286596A (zh) | 消息显示方法及电子设备 | |
| WO2022042774A1 (zh) | 头像显示方法及电子设备 | |
| WO2024012346A1 (zh) | 任务迁移的方法、电子设备和系统 | |
| WO2025060749A1 (zh) | 一种拍照方法、电子设备及存储介质 |