ES2992090T3 - Seleccionar características del habla para construir modelos para detectar condiciones médicas - Google Patents
Seleccionar características del habla para construir modelos para detectar condiciones médicas Download PDFInfo
- Publication number
- ES2992090T3 ES2992090T3 ES18794118T ES18794118T ES2992090T3 ES 2992090 T3 ES2992090 T3 ES 2992090T3 ES 18794118 T ES18794118 T ES 18794118T ES 18794118 T ES18794118 T ES 18794118T ES 2992090 T3 ES2992090 T3 ES 2992090T3
- Authority
- ES
- Spain
- Prior art keywords
- speech data
- features
- feature
- data item
- speech
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H80/00—ICT specially adapted for facilitating communication between medical practitioners or patients, e.g. for collaborative diagnosis, therapy or health monitoring
-
- A—HUMAN NECESSITIES
- A61—MEDICAL OR VETERINARY SCIENCE; HYGIENE
- A61B—DIAGNOSIS; SURGERY; IDENTIFICATION
- A61B5/00—Measuring for diagnostic purposes; Identification of persons
- A61B5/103—Measuring devices for testing the shape, pattern, colour, size or movement of the body or parts thereof, for diagnostic purposes
- A61B5/11—Measuring movement of the entire body or parts thereof, e.g. head or hand tremor or mobility of a limb
- A61B5/1123—Discriminating type of movement, e.g. walking or running
-
- A—HUMAN NECESSITIES
- A61—MEDICAL OR VETERINARY SCIENCE; HYGIENE
- A61B—DIAGNOSIS; SURGERY; IDENTIFICATION
- A61B5/00—Measuring for diagnostic purposes; Identification of persons
- A61B5/40—Detecting, measuring or recording for evaluating the nervous system
- A61B5/4076—Diagnosing or monitoring particular conditions of the nervous system
- A61B5/4088—Diagnosing of monitoring cognitive diseases, e.g. Alzheimer, prion diseases or dementia
-
- A—HUMAN NECESSITIES
- A61—MEDICAL OR VETERINARY SCIENCE; HYGIENE
- A61B—DIAGNOSIS; SURGERY; IDENTIFICATION
- A61B5/00—Measuring for diagnostic purposes; Identification of persons
- A61B5/48—Other medical applications
- A61B5/4803—Speech analysis specially adapted for diagnostic purposes
-
- A—HUMAN NECESSITIES
- A61—MEDICAL OR VETERINARY SCIENCE; HYGIENE
- A61B—DIAGNOSIS; SURGERY; IDENTIFICATION
- A61B5/00—Measuring for diagnostic purposes; Identification of persons
- A61B5/72—Signal processing specially adapted for physiological signals or for diagnostic purposes
- A61B5/7235—Details of waveform analysis
- A61B5/7264—Classification of physiological signals or data, e.g. using neural networks, statistical classifiers, expert systems or fuzzy systems
- A61B5/7267—Classification of physiological signals or data, e.g. using neural networks, statistical classifiers, expert systems or fuzzy systems involving training the classification device
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N20/00—Machine learning
- G06N20/10—Machine learning using kernel methods, e.g. support vector machines [SVM]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0499—Feedforward networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/09—Supervised learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N7/00—Computing arrangements based on specific mathematical models
- G06N7/01—Probabilistic graphical models, e.g. probabilistic networks
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
- G10L25/66—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for extracting parameters related to health condition
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H10/00—ICT specially adapted for the handling or processing of patient-related medical or healthcare data
- G16H10/20—ICT specially adapted for the handling or processing of patient-related medical or healthcare data for electronic clinical trials or questionnaires
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H40/00—ICT specially adapted for the management or administration of healthcare resources or facilities; ICT specially adapted for the management or operation of medical equipment or devices
- G16H40/60—ICT specially adapted for the management or administration of healthcare resources or facilities; ICT specially adapted for the management or operation of medical equipment or devices for the operation of medical equipment or devices
- G16H40/67—ICT specially adapted for the management or administration of healthcare resources or facilities; ICT specially adapted for the management or operation of medical equipment or devices for the operation of medical equipment or devices for remote operation
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H50/00—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
- G16H50/20—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for computer-aided diagnosis, e.g. based on medical expert systems
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H50/00—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
- G16H50/50—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for simulation or modelling of medical disorders
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F2111/00—Details relating to CAD techniques
- G06F2111/10—Numerical modelling
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
- G10L15/063—Training
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
Landscapes
- Health & Medical Sciences (AREA)
- Engineering & Computer Science (AREA)
- Life Sciences & Earth Sciences (AREA)
- Medical Informatics (AREA)
- Physics & Mathematics (AREA)
- Public Health (AREA)
- General Health & Medical Sciences (AREA)
- Biomedical Technology (AREA)
- Pathology (AREA)
- Theoretical Computer Science (AREA)
- Artificial Intelligence (AREA)
- Epidemiology (AREA)
- Molecular Biology (AREA)
- Biophysics (AREA)
- Data Mining & Analysis (AREA)
- Primary Health Care (AREA)
- Evolutionary Computation (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- General Physics & Mathematics (AREA)
- Animal Behavior & Ethology (AREA)
- Heart & Thoracic Surgery (AREA)
- Surgery (AREA)
- Veterinary Medicine (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- Neurology (AREA)
- Physiology (AREA)
- Computational Linguistics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Signal Processing (AREA)
- Psychiatry (AREA)
- Databases & Information Systems (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Multimedia (AREA)
- Acoustics & Sound (AREA)
- Human Computer Interaction (AREA)
- Hospice & Palliative Care (AREA)
- Developmental Disabilities (AREA)
- Psychology (AREA)
Abstract
Se puede entrenar un modelo matemático para diagnosticar una condición médica de una persona mediante el procesamiento de las características acústicas 1021 y las características lingüísticas 1022 del habla de la persona. El rendimiento del modelo matemático se puede mejorar seleccionando adecuadamente las características 1021, 1022 que se utilizarán con el modelo matemático. Las características 1021, 1022 pueden seleccionarse calculando una puntuación de selección de características 1031 para cada característica acústica 1021 y cada característica lingüística 1022, y luego seleccionando las características 1021, 1022 utilizando las puntuaciones 1031, como por ejemplo seleccionando las características 1021, 1022 con las puntuaciones más altas 1031. En algunas implementaciones, las determinaciones de estabilidad 1032 pueden calcularse para cada característica 1021, 1022 y las características 1021, 1022 pueden seleccionarse utilizando tanto las puntuaciones de selección de características 1031 como las determinaciones de estabilidad 1032. Luego, un modelo matemático puede entrenarse utilizando las características seleccionadas 1021, 1022 e implementarse. En algunas implementaciones, los avisos pueden seleccionarse utilizando las puntuaciones de selección de avisos calculadas 1041, y el modelo matemático implementado puede utilizarse con los avisos seleccionados. (Traducción automática con Google Translate, sin valor legal)
Description
DESCRIPCIÓN
Seleccionar características del habla para construir modelos para detectar condiciones médicas
Campo de la invención
La presente invención se refiere a la selección de características del habla que se utilizarán para construir modelos matemáticos para detectar condiciones médicas con el fin de mejorar el rendimiento de los modelos.
Antecedentes
El diagnóstico temprano de condiciones médicas, como la enfermedad de Alzheimer o las conmociones cerebrales, puede permitir un mejor tratamiento y una mejor calidad de vida para la persona con la condición médica. Un procedimiento que se puede utilizar para detectar condiciones médicas es procesar el habla de una persona, ya que el sonido de la voz de una persona o las palabras utilizadas por una persona pueden proporcionar información útil para realizar un diagnóstico médico.
Para detectar una condición médica a partir del habla de una persona, se pueden extraer características del habla, y las características pueden ser procesadas con un modelo matemático. El tipo y número de características extraídas del habla pueden impactar el rendimiento del modelo, especialmente donde la cantidad de datos de entrenamiento para entrenar el modelo es limitada. En consecuencia, la selección adecuada de características puede mejorar el rendimiento del modelo.
El documento WO2016/028495 A1 describe sistemas para una evaluación basada en el habla del estado mental de un paciente. El documento US2016/022193 A1 describe sistemas de grabación biométrica en tiempo real, análisis de información y monitoreo para la gestión de la salud conductual. El documento US2014/073993 A1 describe sistemas y procedimientos para utilizar sonidos de vocales aislados para la evaluación de lesiones traumáticas cerebrales leves. Sin embargo, ninguno de estos documentos describe la selección de características basada en puntuaciones como se presenta en esta especificación.
Breve descripción de las figuras
La invención y la siguiente descripción detallada de ciertas realizaciones de la misma pueden entenderse mediante referencia a las siguientes figuras:
La Figura 1 es un sistema ejemplar para proporcionar un servicio de diagnóstico de una condición médica mediante el procesamiento del habla de una persona.
La Figura 2 es un sistema ejemplar para procesar datos del habla con un modelo matemático para realizar un diagnóstico médico.
La Figura 3 es un corpus de entrenamiento de ejemplo de datos del habla.
La Figura 4 es una lista de ejemplos de indicaciones para usar en el diagnóstico de una condición médica.
La Figura 5 es un sistema ejemplar para seleccionar características para entrenar un modelo matemático para diagnosticar una condición médica.
Las Figuras 6A y 6B son gráficos conceptuales de pares de valores de características y valores de diagnóstico. La Figura 7 es un diagrama de flujo de una implementación de ejemplo para seleccionar características para entrenar un modelo matemático para diagnosticar una condición médica.
La Figura 8 es un diagrama de flujo de una implementación de ejemplo para seleccionar indicaciones para su uso con un modelo matemático para diagnosticar una condición médica.
La Figura 9 es un diagrama de flujo de una implementación de ejemplo para entrenar un modelo matemático para diagnosticar una condición médica que está adaptado a un conjunto de indicaciones seleccionadas.
La Figura 10 es un dispositivo informático ejemplar que puede ser utilizado para entrenar y desplegar un modelo matemático para diagnosticar una condición médica.
Descripción detallada
Se describen en la presente memoria técnicas para seleccionar características del habla que se utilizarán para construir o entrenar un modelo matemático para detectar o diagnosticar una condición médica. La presente invención se describe en el conjunto de reivindicaciones adjunto.
La Figura 1 es un sistema de ejemplo 100 para diagnosticar una condición médica utilizando el habla de una persona. La Figura 1 incluye un servicio de diagnóstico de condiciones médicas 140 que puede recibir datos del habla de una persona y procesar los datos del habla para determinar si una persona tiene una condición médica. Por ejemplo, el servicio de diagnóstico de condiciones médicas 140 puede procesar los datos del habla para calcular una determinación de sí o no sobre si la persona tiene la condición médica o para calcular una puntuación que indique una probabilidad o una posibilidad de que la persona tenga la condición médica y/o la gravedad de la condición.
Como se utiliza en la presente memoria, un diagnóstico se refiere a cualquier determinación sobre si una persona puede tener una condición médica o cualquier determinación sobre la posible gravedad de la condición médica. Un diagnóstico puede incluir cualquier forma de evaluación, conclusión, opinión o determinación relacionada con una condición médica. En algunas instancias, un diagnóstico puede ser incorrecto, y una persona diagnosticada con una condición médica puede no tener en realidad la condición médica.
El servicio de diagnóstico de condiciones médicas 140 puede recibir los datos del habla de una persona utilizando cualquier técnica apropiada. Por ejemplo, una persona puede hablar aun dispositivo móvil 110 y el dispositivo móvil 110 puede grabar el habla y transmitir los datos de habla grabados al servicio de diagnóstico de condiciones médicas 140 a través de la red 130. Se pueden utilizar técnicas apropiadas y cualquier red adecuada para que el dispositivo móvil 110 transmita los datos del habla grabados al servicio de diagnóstico de condiciones médicas 140. Por ejemplo, se puede instalar una aplicación o "app" en el dispositivo móvil 110 que utiliza una llamada API (interfaz de programación de aplicaciones) REST (transferencia de estado representacional) para transmitir los datos del habla a través de Internet o de una red de telefonía móvil. En otro ejemplo, un proveedor médico puede tener un ordenador de proveedor médico 120 que se utiliza para grabar el habla de una persona y transmitir los datos de habla al servicio de diagnóstico de condiciones médicas 140.
En algunas implementaciones, el servicio de diagnóstico de condiciones médicas 140 puede estar instalado en el dispositivo móvil 110 o en el ordenador del proveedor médico 120 de tal manera que no sea necesario transmitir los datos del habla a través de una red. El ejemplo de la Figura 1 no es limitante, y se pueden utilizar técnicas apropiadas para transmitir datos del habla para su procesamiento por un modelo matemático.
La salida del servicio de diagnóstico de condiciones médicas 140 puede ser utilizada para cualquier propósito apropiado. Por ejemplo, la información puede ser presentada a la persona que proporcionó los datos del habla o a un profesional médico que está tratando a la persona.
La Figura 2 es un sistema de ejemplo 200 para procesar datos del habla con un modelo matemático para realizar un diagnóstico médico. En el procesamiento de los datos del habla, se pueden calcular características a partir de los datos del habla, y luego las características pueden ser procesadas por el modelo matemático. Se pueden utilizar cualquier tipo de características apropiadas.
Las características incluyen características acústicas, donde las características acústicas son cualquier característica calculada a partir de los datos de habla que no involucran ni dependen de realizar el reconocimiento del habla en los datos de habla (por ejemplo, las características acústicas no utilizan información sobre las palabras habladas en los datos de habla). Por ejemplo, las características acústicas pueden incluir coeficientes cepstrales en frecuencia de mel, características de predicción lineal perceptual, fluctuación o shimmer.
Las características incluyen características del lenguaje donde las características del lenguaje se calculan utilizando los resultados de un reconocimiento del habla. Por ejemplo, las características del lenguaje pueden incluir una velocidad del habla (por ejemplo, el número de vocales o sílabas por segundo), un número de rellenos (por ejemplo, "ehs" y "ahs"), la dificultad de las palabras (por ejemplo, palabras menos comunes), o las partes del habla de las palabras que siguen a los rellenos.
En la Figura 2, los datos del habla son procesados por el componente de cálculo de características acústicas 210 y el componente de reconocimiento del habla 220. El componente de cálculo de características acústicas 210 puede calcular características acústicas a partir de los datos del habla, como cualquiera de las características acústicas descritas en la presente memoria. El componente de reconocimiento del habla 220 puede realizar el reconocimiento automático del habla en los datos del habla utilizando cualquier técnica apropiada (por ejemplo, modelos de mezcla gaussiana, modelado acústico, modelado del lenguaje y redes neuronales).
Debido a que el componente de reconocimiento del habla 220 puede utilizar características acústicas en la realización del reconocimiento del habla, algunos procesos de estos dos componentes pueden superponerse y, por lo tanto, son posibles otras configuraciones. Por ejemplo, el componente de características acústicas 210 puede calcular las características acústicas necesarias para el componente de reconocimiento del habla 220, y así el componente de reconocimiento del habla 220 puede no necesitar calcular ninguna característica acústica.
El componente de cálculo de características del lenguaje 230 puede recibir resultados de reconocimiento del habla del componente de reconocimiento del habla 220 y procesar los resultados del reconocimiento del habla para determinar características del lenguaje, como cualquiera de las características del lenguaje descritas en la presente memoria. Los resultados del reconocimiento del habla pueden estar en cualquier formato apropiado e incluir cualquier información apropiada. Por ejemplo, los resultados del reconocimiento del habla pueden incluir una rejilla de palabras que incluye múltiples secuencias posibles de palabras, información sobre rellenos, y los tiempos de palabras, sílabas, vocales, rellenos, o cualquier otra unidad del habla.
El clasificador de condiciones médicas 240 puede procesar las características acústicas y las características del lenguaje con un modelo matemático para generar una o más puntuaciones de diagnóstico que indican si la persona tiene la condición médica, como una puntuación que indica una probabilidad o posibilidad de que la persona tenga la condición médica y/o una puntuación que indica la gravedad de la condición médica. El clasificador de condiciones médicas 240 puede utilizar cualquier técnica apropiada, como un clasificador implementado con una máquina de vectores de soporte o una red neuronal, como un perceptrón multicapa.
El rendimiento del clasificador de condiciones médicas 240 puede depender de las características calculadas por el componente de cálculo de características acústicas 210 y el componente de cálculo de características del lenguaje 230. Además, un conjunto de características que funciona bien para una condición médica puede no funcionar bien para otra condición médica. Por ejemplo, la dificultad con las palabras puede ser una característica importante para diagnosticar la enfermedad de Alzheimer, pero puede no ser útil para determinar si una persona tiene una conmoción cerebral. Por otro ejemplo, las características relacionadas con la pronunciación de vocales, sílabas o palabras pueden ser importantes para la enfermedad de Parkinson, pero pueden ser menos importantes para otras condiciones médicas. En consecuencia, se necesitan técnicas para determinar un primer conjunto de características que funcione bien para una primera condición médica, y este proceso puede necesitar repetirse para determinar un segundo conjunto de características que funcione bien para una segunda condición médica.
En algunas implementaciones, el clasificador de condiciones médicas 240 puede utilizar otras características, que pueden ser referidas como características no verbales, además de características acústicas y características del lenguaje. Por ejemplo, se pueden obtener o calcular características a partir de información demográfica de una persona (por ejemplo, género, edad o lugar de residencia), información de un historial médico (por ejemplo, peso, lecturas recientes de presión arterial o diagnósticos previos), o cualquier otra información apropiada.
La selección de características para diagnosticar una condición médica puede ser más importante en situaciones donde la cantidad de datos de entrenamiento para entrenar el modelo matemático es relativamente pequeña. Por ejemplo, para entrenar un modelo matemático para diagnosticar conmociones cerebrales, los datos de entrenamiento necesarios pueden incluir datos del habla de un número de individuos poco después de que experimentan una conmoción. Tales datos pueden existir en pequeñas cantidades y obtener más ejemplos de tales datos puede llevar un período de tiempo significativo.
Entrenar modelos matemáticos con una menor cantidad de datos de entrenamiento puede resultar en un sobreajuste, donde el modelo matemático se adapta a los datos de entrenamiento específicos, pero debido a la pequeña cantidad de datos de entrenamiento, el modelo puede no funcionar bien con nuevos datos. Por ejemplo, el modelo puede ser capaz de detectar todas las conmociones en los datos de entrenamiento, pero puede tener una alta tasa de error al procesar datos de producción de personas que pueden tener conmociones.
Una técnica para prevenir el sobreajuste al entrenar un modelo matemático es reducir el número de características utilizadas para entrenar el modelo matemático. La cantidad de datos de entrenamiento necesaria para entrenar un modelo sin sobreajuste aumenta a medida que aumenta el número de características. En consecuencia, utilizar un menor número de características permite construir modelos con una menor cantidad de datos de entrenamiento. Donde es necesario entrenar un modelo con un menor número de características, se vuelve más importante seleccionar las características que permitirán que el modelo funcione bien. Por ejemplo, cuando hay una gran cantidad de datos de entrenamiento disponibles, se pueden utilizar cientos de características para entrenar el modelo y es más probable que se hayan utilizado características apropiadas. Por el contrario, donde hay una pequeña cantidad de datos de entrenamiento disponibles, solo se pueden utilizar alrededor de 10 características para entrenar un modelo, y es más importante seleccionar las características que son más importantes para diagnosticar la condición médica.
A continuación, se presentan ejemplos de características que pueden ser utilizadas para diagnosticar una condición médica.
Las características acústicas pueden ser calculadas utilizando características de segmento de corto tiempo. Al procesar datos del habla, la duración de los datos del habla puede variar. Por ejemplo, algunas hablas pueden durar un segundo o dos y otras hablas pueden durar varios minutos o más. Para mantener la consistencia en el procesamiento de datos del habla, se puede procesar en segmentos de corto tiempo (a veces referidos como cuadros). Por ejemplo, cada segmento de corta duración puede ser de 25 milisegundos, y los segmentos pueden avanzar en incrementos de 10 milisegundos, de modo que hay un solapamiento de 15 milisegundos entre dos segmentos sucesivos.
Los siguientes son ejemplos no limitativos de características de segmentos de corto tiempo: características espectrales (como coeficientes cepstrales en frecuencia de mel o predictivos lineales perceptuales); características prosódicas (como tono, energía o probabilidad de sonoridad); características de calidad del habla (como temblor, temblor de temblor, brillo o relación armónicos-ruido); entropía (por ejemplo, para captar cuán precisamente se pronuncia una expresión, donde la entropía puede ser calculada a partir de los posteriores de un modelo acústico que está entrenado con datos de habla natural).
Las características del segmento de corto tiempo pueden combinarse para calcular características acústicas para el habla. Por ejemplo, una muestra de habla de dos segundos puede producir 200 características de segmento a corto plazo para el tono que pueden combinarse para calcular una o más características acústicas para el tono.
Las características del segmento de corto tiempo pueden combinarse para calcular una característica acústica para una muestra de habla utilizando cualquier técnica apropiada. En algunas implementaciones, se puede calcular una característica acústica utilizando estadísticas de las características de segmento a corto plazo (por ejemplo, media aritmética, desviación estándar, asimetría, curtosis, primer cuartil, segundo cuartil, tercer cuartil, el segundo cuartil menos el primer cuartil, el tercer cuartil menos el primer cuartil, el tercer cuartil menos el segundo cuartil, percentil 0.01, percentil 0.99, el percentil 0.99 menos el percentil 0.01, el porcentaje de segmentos a corto plazo cuyos valores están por encima de un umbral (por ejemplo, donde el umbral es el 75% del rango más el mínimo), el porcentaje de segmentos cuyos valores están por encima de un umbral (por ejemplo, donde el umbral es el 90% del rango más el mínimo), la pendiente de una aproximación lineal de los valores, el desplazamiento de una aproximación lineal de los valores, el error lineal calculado como la diferencia entre la aproximación lineal y los valores reales, o el error cuadrático calculado como la diferencia entre la aproximación lineal y los valores reales. En algunas implementaciones, una característica acústica puede ser calculada como un i-vector o vector de identidad de las características de segmentos a corto plazo. Se puede calcular un vector de identidad utilizando técnicas apropiadas, como realizar una conversión de matriz a vector usando una técnica de análisis factorial y un modelo de mezcla gaussiana.
Los siguientes son ejemplos no limitativos de características del lenguaje. Una velocidad del habla, como calcular la duración de todas las palabras habladas dividida por el número de vocales o cualquier otra medida apropiada de la velocidad del habla. Una serie de rellenos que pueden indicar titubeo en el habla, como (1) un número de rellenos dividido por la duración de las palabras habladas o (2) un número de rellenos dividido por el número de palabras habladas. Una medida de la dificultad de las palabras o el uso de palabras menos comunes. Por ejemplo, la dificultad de las palabras puede calcularse utilizando estadísticas de las probabilidades de 1-gramas de las palabras habladas, como clasificando las palabras según sus percentiles de frecuencia (por ejemplo, 5%, 10%, 15%, 20%, 30% o 40%). Las partes del habla de las palabras que siguen a los rellenos de pausa, como (1) los conteos de cada clase de parte del habla divididos por el número de palabras habladas o (2) los conteos de cada clase de parte del habla divididos por la suma de todos los conteos de partes del habla.
En algunas implementaciones, las características del lenguaje pueden incluir una determinación de si una persona respondió correctamente a una pregunta. Por ejemplo, se puede preguntar a una persona cuál es el año actual o quién es el presidente de los Estados Unidos. El habla de la persona puede ser procesado para determinar qué dijo la persona en respuesta a la pregunta y para determinar si la persona respondió correctamente a la pregunta.
Para entrenar un modelo para diagnosticar una condición médica, se puede recopilar un corpus de datos de entrenamiento. El corpus de entrenamiento puede incluir ejemplos de habla donde se conoce el diagnóstico de la persona. Por ejemplo, se puede saber que la persona no tuvo conmoción cerebral, o que tuvo una conmoción cerebral leve, moderada o severa.
La Figura 3 ilustra un ejemplo de un corpus de entrenamiento que incluye datos del habla para entrenar un modelo para diagnosticar conmociones cerebrales. Por ejemplo, las filas de la tabla de la Figura 3 pueden corresponder a entradas de la base de datos. En este ejemplo, cada entrada incluye un identificador de una persona, el diagnóstico conocido de la persona (por ejemplo, sin conmoción o una conmoción leve, media o severa), un identificador de una indicación o pregunta que se presentó a una persona (por ejemplo, "¿Cómo estás hoy?") y un nombre de archivo de un archivo que contiene los datos del habla. Los datos de entrenamiento pueden ser almacenados en cualquier formato apropiado utilizando cualquier tecnología de almacenamiento adecuada.
El corpus de entrenamiento puede almacenar una representación del habla de una persona utilizando cualquier formato apropiado. Por ejemplo, un elemento de datos del habla del corpus de entrenamiento puede incluir muestras digitales de una señal de audio recibida en un micrófono o puede incluir una versión procesada de la señal de audio, como coeficientes cepstrales en frecuencia de mel.
Un único corpus de entrenamiento puede contener datos del habla relacionados con múltiples condiciones médicas, o se puede utilizar un corpus de entrenamiento separado para cada condición médica (por ejemplo, un primer corpus de entrenamiento para conmociones y un segundo corpus de entrenamiento para la enfermedad de Alzheimer). Se puede utilizar un corpus de entrenamiento separado para almacenar datos del habla de personas sin ninguna condición médica conocida o diagnosticada, ya que este corpus de entrenamiento puede ser utilizado para entrenar modelos para múltiples condiciones médicas.
La Figura 4 ilustra un ejemplo de indicaciones almacenadas que pueden ser utilizadas para diagnosticar condiciones médicas. Cada indicación puede ser presentada a una persona, ya sea por una persona (por ejemplo, un profesional médico) o por un ordenador, para obtener el habla de la persona en respuesta a la indicación. Cada indicación puede tener un identificador de indicación para que se pueda referenciar de forma cruzada con el identificador de indicación del corpus de entrenamiento. Las indicaciones de la Figura 4 pueden ser almacenadas utilizando cualquier tecnología de almacenamiento apropiada, como una base de datos.
La Figura 5 es un sistema ejemplar 500 que puede ser utilizado para seleccionar características para entrenar un modelo matemático para diagnosticar una condición médica, y luego utilizar las características seleccionadas para entrenar el modelo matemático. El sistema 500 puede ser utilizado múltiples veces para seleccionar características para diferentes condiciones médicas. Por ejemplo, un primer uso del sistema 500 puede seleccionar características para diagnosticar conmociones cerebrales y un segundo uso del sistema 500 puede seleccionar características para diagnosticar la enfermedad de Alzheimer.
La Figura 5 incluye un corpus de entrenamiento 510 de elementos de datos del habla para entrenar un modelo matemático para diagnosticar una condición médica. El corpus de entrenamiento 510 puede incluir cualquier información apropiada, como datos del habla de múltiples personas con y sin la condición médica, una etiqueta que indique si la persona tiene o no la condición médica, y cualquier otra información que se describe en la presente memoria.
El componente de cálculo de características acústicas 210, el componente de reconocimiento del habla 220 y el componente de cálculo de características del lenguaje 230 pueden ser implementados como se describe arriba para calcular características acústicas y del lenguaje para los datos del habla en el corpus de entrenamiento. El componente de cálculo de características acústicas 210 y el componente de cálculo de características del lenguaje 230 pueden calcular una gran cantidad de características para que se puedan determinar las características de mejor rendimiento. Esto puede contrastar con la Figura 2 donde estos componentes se utilizan en un sistema de producción y, por lo tanto, estos componentes pueden calcular únicamente las características que fueron seleccionadas previamente.
El componente de cálculo de puntuación de selección de características 520 puede calcular una puntuación de selección para cada característica (que puede ser una característica acústica, una característica del lenguaje, o cualquier otra característica descrita en la presente memoria). Para calcular una puntuación de selección para una característica, se puede crear un par de números para cada elemento de datos de habla en el corpus de entrenamiento, donde el primer número del par es el valor de la característica y el segundo número del par es un indicador del diagnóstico de la condición médica. El valor para el indicador del diagnóstico de la condición médica puede tener dos valores (por ejemplo, 0 si la persona no tiene la condición médica y 1 si la persona tiene la condición médica) o puede tener un mayor número de valores (por ejemplo, un número real entre 0 y 1 o múltiples enteros que indican la probabilidad o gravedad de la condición médica).
En consecuencia, para cada característica, se puede obtener un par de números para cada elemento de datos del habla del corpus de entrenamiento. Las Figuras 6A y 6B ilustran dos gráficos conceptuales de los pares de números para una primera característica y una segunda característica. Para la Figura 6A, no parece haber un patrón o correlación entre los valores de la primera característica y los valores de diagnóstico correspondientes, pero para la Figura 6B, sí parece haber un patrón o correlación entre los valores de la segunda característica y los valores de diagnóstico. En consecuencia, se puede concluir que la segunda característica es probablemente una característica útil para determinar si una persona tiene la condición médica y que la primera característica no lo es.
El componente de cálculo de puntuación de selección de características 520 puede calcular una puntuación de selección para una característica utilizando los pares de valores de características y valores de diagnóstico. El componente de cálculo de puntuación de selección de características 520 puede calcular cualquier puntuación apropiada que indique un patrón o correlación entre los valores de las características y los valores de diagnóstico. Por ejemplo, el componente de cálculo de puntuación de selección de características 520 puede calcular un índice Rand, un índice Rand ajustado, información mutua, información mutua ajustada, una correlación de Pearson, una correlación de Pearson absoluta, una correlación de Spearman, o una correlación de Spearman absoluta.
La puntuación de selección indica la utilidad de la característica en la detección de una condición médica. Por ejemplo, una alta puntuación de selección puede indicar que una característica debería ser utilizada en el entrenamiento del modelo matemático, y un bajo puntuación de selección puede indicar que la característica no debería ser utilizada en el entrenamiento del modelo matemático.
El componente de determinación de estabilidad de características 530 puede determinar si una característica (que puede ser una característica acústica, una característica del lenguaje, o cualquier otra característica descrita en la presente memoria) es estable o inestable. Para hacer una determinación de estabilidad, los elementos de datos de habla pueden ser divididos en múltiples grupos, que pueden ser referidos como pliegues. Por ejemplo, los elementos de datos del habla pueden dividirse en cinco pliegues. En algunas implementaciones, los elementos de datos del habla pueden dividirse en pliegues de tal manera que cada pliegue tenga un número aproximadamente igual de elementos de datos del habla para diferentes géneros y grupos de edad.
Las estadísticas de cada pliegue pueden compararse con las estadísticas de los otros pliegues. Por ejemplo, para un primer pliegue, se puede determinar el valor de la característica de la mediana (o media o cualquier otra estadística relacionada con el centro o medio de una distribución) (denotado como Mi). También se pueden calcular estadísticas para la combinación de los otros pliegues. Por ejemplo, para la combinación de los otros pliegues, se puede calcular la mediana de los valores de características (denotada como Mo) y una estadística que mide la variabilidad de los valores de características (denotada como Vo), como el rango intercuartílico, la varianza o la desviación estándar. La característica puede determinarse como inestable si la mediana del primer pliegue difiere demasiado de la mediana del segundo pliegue. Por ejemplo, se puede determinar que la característica es inestable si
Vo K
M±< M 0 - C jorM±> M0+ C j
donde C es un factor de escalado. El proceso puede repetirse para cada uno de los otros pliegues. Por ejemplo, la mediana de un segundo pliegue puede ser comparada con la mediana y la variabilidad de los otros pliegues como se describe arriba.
En algunas implementaciones, si, después de comparar cada pliegue con los otros pliegues, la mediana de cada pliegue no está demasiado lejos de la mediana de los otros pliegues, entonces la característica puede ser determinada como estable. Por el contrario, si la mediana de cualquier pliegue está demasiado lejos de la mediana de los otros pliegues, entonces la característica puede determinarse como inestable.
En algunas implementaciones, el componente de determinación de estabilidad de características 530 puede generar un valor booleano para cada característica para indicar si la característica es estable o no. En algunas implementaciones, el componente de determinación de estabilidad 530 puede generar una puntuación de estabilidad para cada característica. Por ejemplo, se puede calcular una puntuación de estabilidad como la mayor distancia entre la mediana de un pliegue y los otros pliegues (por ejemplo, una distancia de Mahalanobis).
El componente de selección de características 540 puede recibir las puntuaciones de selección de características del componente de cálculo de puntuaciones de selección de características 520 y las determinaciones de estabilidad del componente de determinación de estabilidad de características 530 y seleccionar un subconjunto de características para ser utilizado en el entrenamiento del modelo matemático. El componente de selección de características 540 puede seleccionar un número de características que tienen las puntuaciones de selección más altos y que también son suficientemente estables.
En algunas implementaciones, el número de características que se seleccionarán (o un número máximo de características que se seleccionarán) puede establecerse de antemano. Por ejemplo, se puede determinar un número N en función de la cantidad de datos de entrenamiento, y se pueden seleccionar N características. Las características seleccionadas pueden determinarse eliminando características inestables (por ejemplo, características determinadas como inestables o características con una puntuación de estabilidad por debajo de un umbral) y luego seleccionando las N características con las puntuaciones de selección más altos.
En algunas implementaciones, el número de características a seleccionar puede basarse en las puntuaciones de selección y las determinaciones de estabilidad. Por ejemplo, las características seleccionadas pueden determinarse eliminando características inestables y luego seleccionando todas las características con una puntuación de selección superior a un umbral.
En algunas implementaciones, las puntuaciones de selección y las puntuaciones de estabilidad pueden combinarse al seleccionar características. Por ejemplo, para cada característica se puede calcular una indicación combinada (como sumando o multiplicando la puntuación de selección y la puntuación de estabilidad de la característica) y se pueden seleccionar características utilizando la indicación combinada.
El componente de entrenamiento del modelo 550 puede entonces entrenar un modelo matemático utilizando las características seleccionadas. Por ejemplo, el componente de entrenamiento del modelo 550 puede iterar sobre los elementos de datos del habla del corpus de entrenamiento, obtener las características seleccionadas para los elementos de datos del habla y luego entrenar el modelo matemático utilizando las características seleccionadas. En algunas implementaciones, se pueden aplicar técnicas de reducción de dimensiones, como el análisis de componentes principales o el análisis discriminante lineal, a las características seleccionadas como parte del entrenamiento del modelo. Cualquier modelo matemático apropiado puede ser entrenado, como cualquiera de los modelos matemáticos que se describen en la presente memoria.
En algunas implementaciones, se pueden utilizar otras técnicas, como los procedimientos de envoltura, para la selección de características o se pueden utilizar en combinación con las técnicas de selección de características presentadas anteriormente. Los procedimientos de envoltura pueden seleccionar un conjunto de características, entrenar un modelo matemático utilizando el conjunto de características seleccionado y luego evaluar el rendimiento del conjunto de características utilizando el modelo entrenado. Donde el número de características posibles es relativamente pequeño y/o el tiempo de entrenamiento es relativamente corto, se pueden evaluar todos los conjuntos posibles de características y se puede seleccionar el conjunto con mejor rendimiento. Donde el número de características posibles es relativamente grande y/o el tiempo de entrenamiento es un factor significativo, se pueden utilizar técnicas de optimización para encontrar de manera iterativa un conjunto de características que funcione bien.
En algunas implementaciones, se puede seleccionar un conjunto de características utilizando el sistema 500, y luego se puede seleccionar un subconjunto de estas características utilizando procedimientos de envoltura como el conjunto final de características.
La Figura 7 es un diagrama de flujo de una implementación de ejemplo para seleccionar características para entrenar un modelo matemático para diagnosticar una condición médica. En la Figura 7 y otros diagramas de flujo en la presente memoria presentes, el orden de los pasos es ejemplar y son posibles otros órdenes, no todos los pasos son obligatorios, los pasos pueden ser combinados (total o parcialmente) o subdivididos y, en algunas implementaciones, algunos pasos pueden ser omitidos o se pueden añadir otros pasos. Los procedimientos descritos por cualquier diagrama de flujo descrito en la presente memoria pueden ser implementados, por ejemplo, por cualquiera de los ordenadores o sistemas descritos en la presente memoria.
En el paso 710, se obtiene un corpus de entrenamiento de elementos de datos del habla. El corpus de entrenamiento puede incluir una representación de una señal de audio del habla de una persona, una indicación de un diagnóstico médico de la persona de la cual se obtuvo el habla, y cualquier otra información apropiada, como cualquiera de la información descrita en la presente memoria.
En el paso 720, se obtienen los resultados del reconocimiento del habla para cada elemento de datos del habla del corpus de entrenamiento. Los resultados del reconocimiento del habla pueden haber sido calculados con antelación y almacenados con el corpus de entrenamiento o almacenados en otra ubicación. Los resultados del reconocimiento del habla pueden incluir cualquier información apropiada, como una transcripción, una lista de las transcripciones con mayor indicación (por ejemplo, una lista N-mejor), una red de transcripciones posibles e información de tiempo, como el tiempo de inicio y fin de las palabras, rellenos u otras unidades del habla.
En el paso 730, se calculan características acústicas para cada elemento de datos del habla del corpus de entrenamiento. Las características acústicas pueden incluir cualquier característica que se calcule sin utilizar los resultados del reconocimiento del habla de un elemento de datos del habla, como cualquiera de las características acústicas descritas en la presente memoria. Las características acústicas pueden incluirse o calcularse a partir de datos utilizados en el proceso de reconocimiento del habla (por ejemplo, coeficientes cepstrales de frecuencia de mel o predictores lineales perceptuales), pero las características acústicas no utilizan los resultados del reconocimiento del habla, como la información sobre las palabras o los elementos de pausa presentes en un elemento de datos de habla.
En el paso 740, se calculan características del lenguaje para cada elemento de datos de habla del corpus de entrenamiento. Las características del lenguaje pueden incluir cualquier característica que se compute utilizando los resultados del reconocimiento del habla, como cualquiera de las características del lenguaje que se describen en la presente memoria.
En el paso 750, se calcula una puntuación de selección de características para cada característica acústica y cada característica del lenguaje. Para calcular una puntuación de selección de características para la característica, se puede utilizar el valor de la característica para cada elemento de datos del habla en el corpus de entrenamiento junto con otra información, como un valor de diagnóstico conocido correspondiente al elemento de datos del habla. La puntuación de selección de características puede ser calculado utilizando cualquiera de las técnicas descritas en la presente memoria, como el cálculo de una correlación de Pearson absoluta. En algunas implementaciones, se pueden calcular puntuaciones de selección de características para otras características también, como las características relacionadas con la información demográfica de una persona.
En el paso 760, se selecciona una pluralidad de características utilizando las puntuaciones de selección de características. Por ejemplo, se pueden seleccionar varias características que tienen las puntuaciones de selección más altas. En algunas implementaciones, se puede calcular una determinación de estabilidad para cada característica y se pueden seleccionar la pluralidad de características utilizando tanto las puntuaciones de selección de características como las determinaciones de estabilidad, como por ejemplo utilizando cualquiera de las técnicas descritas en la presente memoria.
En el paso 770, se entrena un modelo matemático utilizando las características seleccionadas. Cualquier modelo matemático apropiado puede ser entrenado, como una red neuronal o una máquina de vectores de soporte. Después de que el modelo matemático ha sido entrenado, puede ser implementado en un sistema de producción, como el sistema 100 de la Figura 1, para realizar el diagnóstico de condiciones médicas.
Los pasos de la Figura 7 pueden ser realizados de varias maneras. Por ejemplo, en algunas implementaciones, los pasos 730 y 740 pueden realizarse en un bucle que itera sobre cada uno de los elementos de datos del habla en el corpus de entrenamiento. Para una primera iteración, se pueden calcular características acústicas y de lenguaje para un primer elemento de datos del habla; para una segunda iteración, se pueden calcular características acústicas y de lenguaje para un segundo elemento de datos del habla, y así sucesivamente.
Al utilizar un modelo desplegado para diagnosticar una condición médica, a la persona que se le está diagnosticando se le puede presentar una secuencia de indicaciones o indicaciones para obtener la voz de la persona. Se pueden utilizar cualquier tipo de indicaciones apropiadas, como cualquiera de las indicaciones de la Figura 4. Después de que se han seleccionado las características, como se describe arriba, se pueden seleccionar indicaciones para que las indicaciones seleccionadas proporcionen información útil sobre las características seleccionadas.
Por ejemplo, supongamos que una característica seleccionada es el tono. Mientras que el tono se ha determinado como una característica útil para diagnosticar una condición médica, algunas indicaciones pueden ser mejores que otras para obtener una característica de tono útil. Las expresiones muy cortas (por ejemplo, respuestas de sí/no) pueden no proporcionar suficientes datos para calcular con precisión el tono, por lo que las indicaciones que generan respuestas más largas pueden ser más útiles para obtener información sobre el tono.
Para otro ejemplo, supongamos que una característica seleccionada es la dificultad de la palabra. Aunque se ha determinado que la dificultad de las palabras es una característica útil para diagnosticar una condición médica, algunas indicaciones pueden ser mejores que otras para obtener una característica útil de dificultad de palabras. Las indicaciones que piden a un usuario que lea un pasaje presentado generalmente resultarán en el habla de las palabras en el pasaje, y, por lo tanto, la característica de dificultad de palabras tendría el mismo valor cada vez que se presente esta indicación, y, por lo tanto, esta indicación no sería útil para obtener información sobre la dificultad de las palabras. Por el contrario, las indicaciones abiertas, como "¿Cuéntame sobre tu día?", pueden resultar en una mayor variabilidad del vocabulario en las respuestas y, por lo tanto, pueden proporcionar información más útil sobre la dificultad de las palabras.
Seleccionar un conjunto de indicaciones también puede mejorar el rendimiento de un sistema para diagnosticar condiciones médicas y proporcionar una mejor experiencia para la persona que está siendo evaluada. Al utilizar el mismo conjunto de indicaciones para cada persona evaluada, el sistema para diagnosticar condiciones médicas puede proporcionar resultados más precisos, ya que los datos recopilados de múltiples personas pueden ser más comparables que si se utilizaran diferentes indicaciones con cada persona. Además, utilizar un conjunto definido de indicaciones permite que la evaluación de una persona sea más predecible y de una duración deseada que sea apropiada para la evaluación de la condición médica. Por ejemplo, para evaluar si una persona tiene la enfermedad de Alzheimer, puede ser aceptable utilizar más indicaciones para recolectar una mayor cantidad de datos, pero para evaluar si una persona tiene una conmoción cerebral durante un evento deportivo, puede ser necesario utilizar un menor número de indicaciones para obtener un resultado más rápidamente.
En algunas implementaciones, las indicaciones pueden seleccionarse mediante el cálculo de las puntuaciones de selección de mensajes. Un corpus de entrenamiento puede tener múltiples o incluso muchos elementos de datos del habla para un solo indicación. Por ejemplo, el corpus de entrenamiento puede incluir ejemplos de la indicación utilizado con diferentes personas o la misma indicación puede ser utilizado con la misma persona varias veces. La Figura 8 es un diagrama de flujo de una implementación de ejemplo de la selección de indicaciones para su uso con un modelo desplegado para diagnosticar una condición médica.
Los pasos 810 a 840 pueden realizarse para cada indicación (o un subconjunto de las indicaciones) en el corpus de entrenamiento para calcular una puntuación de selección de indicaciones para cada indicación.
En el paso 810 se obtiene una indicación, y en el paso 820 se obtienen elementos de datos del habla correspondientes a la indicación del corpus de entrenamiento.
En el paso 830, se calcula una puntuación de diagnóstico médico para cada elemento de datos del habla correspondiente a la indicación. Por ejemplo, una puntuación de diagnóstico médico para un elemento de datos de habla puede ser un número producido por un modelo matemático (por ejemplo, el modelo matemático entrenado en la Figura 7) que indica la probabilidad de que una persona tenga la condición médica y/o la gravedad de la condición médica.
En el paso 840, se calcula una puntuación de selección de indicación para la indicación utilizando las puntuaciones de diagnóstico médico calculados. El cálculo de una puntuación de selección de indicación puede ser similar al cálculo de una puntuación de selección de características, como se describe arriba. Para cada elemento de datos del habla correspondiente a la indicación, se pueden obtener un par de números. Para cada par, el primer número del par puede ser la puntuación de diagnóstico médico calculado a partir del elemento de datos del habla, y el segundo número del par puede ser un diagnóstico de condición médica conocido de la persona (por ejemplo, se sabe que la persona tiene la condición médica o una gravedad de la condición médica). La representación de estos pares de números puede resultar en un gráfico similar a la Figura 6A o Figura 6B, y dependiendo del contexto puede o no haber un patrón o correlación en los pares de números.
Una puntuación de selección de indicaciones para una indicación puede incluir cualquier indicación que indique un patrón o correlación entre las puntuaciones de diagnóstico médico calculadas y los diagnósticos de condiciones médicas conocidas. Por ejemplo, una puntuación de selección de indicación puede incluir un índice de Rand, un índice de Rand ajustado, información mutua, información mutua ajustada, una correlación de Pearson, una correlación de Pearson absoluta, una correlación de Spearman o una correlación de Spearman absoluta.
En el paso 850 se determina si quedan otros mensajes por procesar. Si quedan indicaciones por procesar, entonces el procesamiento puede continuar al paso 810 para procesar indicaciones adicionales. Si todas las indicaciones han sido procesadas, entonces el procesamiento puede continuar al paso 860.
En el paso 860, se selecciona una pluralidad de indicaciones utilizando las puntuaciones de selección de indicaciones. Por ejemplo, se pueden seleccionar varios mensajes que tengan las puntuaciones de selección de mensajes más altas. En algunas implementaciones, se puede calcular una determinación de estabilidad para cada indicación y se pueden seleccionar la pluralidad de indicaciones utilizando tanto las puntuaciones de selección de indicaciones como las determinaciones de estabilidad de las indicaciones, como utilizando cualquiera de las técnicas descritas en la presente memoria.
En el paso 870, las indicaciones seleccionadas se utilizan con un servicio de diagnóstico de condiciones médicas desplegado. Por ejemplo, al diagnosticar a una persona, se pueden presentar las indicaciones seleccionadas a una persona para obtener el habla de la persona en respuesta a cada una de las indicaciones.
En algunas implementaciones, se pueden utilizar otras técnicas, como los procedimientos de envoltura, para la selección de indicaciones o pueden ser utilizados en combinación con las técnicas de selección de indicaciones presentadas anteriormente. En algunas implementaciones, un conjunto de indicaciones puede ser seleccionado utilizando el proceso de la Figura 8, y luego un subconjunto de estas indicaciones puede ser seleccionado utilizando procedimientos de envoltura como el conjunto final de características.
En algunas implementaciones, una persona involucrada en la creación del servicio de diagnóstico de condiciones médicas puede asistir en la selección de indicaciones. La persona puede utilizar su conocimiento o experiencia para seleccionar indicaciones en función de las características seleccionadas. Por ejemplo, donde una característica seleccionada es la dificultad de las palabras, la persona puede revisar las indicaciones y seleccionar aquellas que son más propensas a proporcionar información útil relacionada con la dificultad de las palabras. La persona puede seleccionar uno o más mensajes que probablemente proporcionen información útil para cada una de las características seleccionadas.
En algunas implementaciones, la persona puede revisar las indicaciones seleccionadas por el proceso de la Figura 8, y añadir o eliminar indicaciones para mejorar el rendimiento de un sistema de diagnóstico de condiciones médicas. Por ejemplo, dos indicaciones pueden proporcionar información útil sobre la dificultad de las palabras, pero la información proporcionada por las dos indicaciones puede ser en gran medida redundante, y usar ambas indicaciones puede no ofrecer un beneficio significativo sobre el uso de solo una de ellas.
En algunas implementaciones, se puede entrenar un segundo modelo matemático después de la selección de las indicaciones que está adaptado a las indicaciones seleccionadas. El modelo matemático entrenado en la Figura 7 puede procesar una única enunciación (en respuesta a una indicación) para generar una puntuación de diagnóstico médico. Donde el proceso de realizar un diagnóstico comprende el procesamiento de múltiples enunciados correspondientes a múltiples indicaciones, entonces cada uno de los enunciados puede ser procesado por el modelo matemático de la Figura 7 para generar múltiples puntuaciones de diagnóstico médico. Para determinar un diagnóstico médico general, puede ser necesario combinar de alguna manera las múltiples puntuaciones de diagnóstico médico. En consecuencia, el modelo matemático entrenado en la Figura 7 puede no estar adaptado a un conjunto seleccionado de indicaciones.
Cuando se utilizan las indicaciones seleccionadas en una sesión para diagnosticar a una persona, cada una de las indicaciones puede presentarse a la persona para obtener una expresión correspondiente a cada una de las indicaciones. En lugar de procesar las expresiones por separado, las expresiones pueden ser procesadas simultáneamente por el modelo para generar una puntuación de diagnóstico médico. En consecuencia, un modelo puede ser adaptado a los indicios seleccionados porque está entrenado para procesar simultáneamente las expresiones correspondientes a cada uno de los indicios seleccionados.
La Figura 9 es un diagrama de flujo de una implementación de ejemplo que entrena un modelo matemático que está adaptado a un conjunto de indicaciones seleccionadas. En el paso 910, se obtiene un primer modelo matemático, como utilizando el proceso de la Figura 7. En el paso 920, se selecciona una pluralidad de indicaciones utilizando el primer modelo matemático, tal como por el proceso de la Figura 8.
En el paso 930, se entrena un segundo modelo matemático que procesa simultáneamente múltiples elementos de datos del habla correspondientes a la pluralidad de indicaciones seleccionadas para generar una puntuación de diagnóstico médico. Al entrenar el segundo modelo matemático, se puede utilizar un corpus de entrenamiento que incluya sesiones con elementos de datos del habla correspondientes a cada uno de las múltiples indicaciones seleccionadas. Al entrenar el modelo matemático, la entrada al modelo matemático puede fijarse a los elementos de datos del habla de la sesión y correspondientes a cada una de las indicaciones seleccionadas. La salida del modelo matemático puede fijarse a un diagnóstico médico conocido. Los parámetros del modelo pueden ser entrenados para procesar de manera óptima el elemento de datos de habla simultáneamente para generar una puntuación de diagnóstico médico. Se pueden utilizar técnicas de entrenamiento apropiadas, como el descenso de gradiente estocástico.
El segundo modelo matemático puede ser implementado como parte de un servicio de diagnóstico de condiciones médicas, como el servicio de la Figura 1. El segundo modelo matemático puede proporcionar un mejor rendimiento que el primer modelo matemático porque ha sido entrenado para procesar las expresiones simultáneamente en lugar de individualmente y, por lo tanto, el entrenamiento puede ser mejor para combinar la información de todas las expresiones y generar la puntuación de diagnóstico de la condición médica.
La Figura 10 ilustra los componentes de una realización de un dispositivo informático 1000 para implementar cualquiera de las técnicas descritas anteriormente. En la Figura 10, los componentes se muestran como si estuvieran en un único dispositivo informático, pero los componentes pueden estar distribuidos entre múltiples dispositivos informáticos, como un sistema de dispositivos informáticos, incluyendo, por ejemplo, un dispositivo informático de usuario final (por ejemplo, un teléfono inteligente o una tableta) y/o un dispositivo informático de servidor (por ejemplo, computación en la nube).
El dispositivo informático 1000 puede incluir cualquier componente típico de un dispositivo informático, como memoria volátil o no volátil 1010, uno o más procesadores 1011 y una o más interfaces de red 1012. El dispositivo informático 1000 también puede incluir cualquier componente de entrada y salida, como pantallas, teclados y pantallas táctiles. El dispositivo informático 1000 también puede incluir una variedad de componentes o módulos que proporcionan funcionalidad específica, y estos componentes o módulos pueden ser implementados en software, hardware o una combinación de ambos. A continuación, se describen varios ejemplos de componentes para una implementación de ejemplo, y otras implementaciones pueden incluir componentes adicionales o excluir algunos de los componentes descritos a continuación.
El dispositivo informático 1000 puede tener un componente de cálculo de características acústicas 1021 que puede calcular características acústicas para un elemento de datos del habla como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de cálculo de características del lenguaje 1022 que puede calcular características del lenguaje para un elemento de datos del habla como se describe arriba. El dispositivo informático 1000 puede tener un componente de reconocimiento del habla 1023 que puede generar resultados de reconocimiento del habla para un elemento de datos del habla como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de cálculo de puntuaciones de selección de características 1031 que puede calcular puntuaciones de selección para características como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de cálculo de puntuaciones de estabilidad de características 1032 que puede realizar determinaciones de estabilidad o calcular puntuaciones de estabilidad como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de selección de características 1033 que puede seleccionar características utilizando puntuaciones de selección y/o determinaciones de estabilidad como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de cálculo de puntuaciones de selección de indicaciones 1041 que puede calcular puntuaciones de selección para indicaciones como se describe arriba. El dispositivo informático 1000 puede tener un componente de cálculo de puntuación de estabilidad de indicación 1042 que puede hacer determinaciones de estabilidad o calcular puntuaciones de estabilidad como se describe anteriormente. El dispositivo informático 1000 puede tener un componente de selección de mensajes 1043 que puede seleccionar mensajes utilizando las puntuaciones de selección y/o determinaciones de estabilidad como se describe arriba. El dispositivo informático 1000 puede tener un componente de entrenamiento de modelos 1050 que puede entrenar modelos matemáticos como se describe arriba. El dispositivo informático 1000 puede tener un componente de diagnóstico de condiciones médicas 1060 que puede procesar elementos de datos del habla para determinar una puntuación de diagnóstico médico como se describe arriba.
El dispositivo informático 1000 puede incluir o tener acceso a varios almacenes de datos, como el almacén de datos del corpus de entrenamiento 1070. Los almacenes de datos pueden utilizar cualquier tecnología de almacenamiento conocida, como archivos, bases de datos relacionales o no relacionales, o cualquier medio legible por ordenador no transitorio.
Los procedimientos y sistemas que se describen en la presente memoria pueden ser implementados en parte o en su totalidad a través de una máquina que ejecuta software, códigos de programa y/o instrucciones en un procesador. "Procesador" como se utiliza en la presente memoria se entiende que incluye al menos un procesador y, a menos que el contexto indique claramente lo contrario, el plural y el singular deben entenderse como intercambiables. Cualquier aspecto de la presente descripción puede implementarse como un procedimiento en la máquina, como un sistema o aparato como parte de o en relación con la máquina, o como un producto de programa informático incorporado en un medio legible por ordenador que se ejecuta en una o más de las máquinas. El procesador puede ser parte de un servidor, cliente, infraestructura de red, plataforma informática móvil, plataforma informática estacionaria u otra plataforma informática. Un procesador puede ser cualquier tipo de dispositivo computacional o de procesamiento capaz de ejecutar instrucciones de programa, códigos, instrucciones binarias y similares. El procesador puede ser o incluir un procesador de señales, procesador digital, procesador embebido, microprocesador o cualquier variante como un coprocesador (coprocesador matemático, coprocesador gráfico, coprocesador de comunicación y similares) que pueda facilitar directa o indirectamente la ejecución de código de programa o instrucciones de programa almacenadas en él. Además, el procesador puede permitir la ejecución de múltiples programas, hilos y códigos. Los hilos pueden ejecutarse simultáneamente para mejorar el rendimiento del procesador y facilitar las operaciones simultáneas de la aplicación. A modo de implementación, los procedimientos, códigos de programa, instrucciones de programa y similares descritos en la presente memoria pueden ser implementados en uno o más hilos. El hilo puede generar otros hilos que pueden tener prioridades asignadas asociadas a ellos; el procesador puede ejecutar estos hilos en función de la prioridad o en cualquier otro orden basado en las instrucciones proporcionadas en el código de programa. El procesador puede incluir memoria que almacena procedimientos, códigos, instrucciones y programas según se describe en la presente memoria y en otros lugares. El procesador puede acceder a un medio de almacenamiento a través de una interfaz que puede almacenar procedimientos, códigos e instrucciones como se describe en la presente memoria y en otros lugares. El medio de almacenamiento asociado con el procesador para almacenar procedimientos, programas, códigos, instrucciones de programa u otro tipo de instrucciones capaces de ser ejecutadas por el dispositivo informático o procesamiento puede incluir, pero no se limita a, uno o más de un CD-ROM, DVD, memoria, disco duro, unidad flash, RAM, ROM, caché y similares.
Un procesador puede incluir uno o más núcleos que pueden mejorar la velocidad y el rendimiento de un multiprocesador. En realizaciones, el proceso puede ser un procesador de doble núcleo, procesadores de cuatro núcleos, otros multiprocesadores a nivel de chip y similares que combinan dos o más núcleos independientes (llamados un die).
Los procedimientos y sistemas que se describen en la presente memoria pueden ser implementados en parte o en su totalidad a través de una máquina que ejecuta software informático en un servidor, cliente, cortafuegos, puerta de enlace, concentrador, enrutador u otro hardware informático y/o de red similar. El programa de software puede estar asociado con un servidor que puede incluir un servidor de archivos, servidor de impresión, servidor de dominio, servidor de internet, servidor de intranet y otras variantes como servidor secundario, servidor anfitrión, servidor distribuido y similares. El servidor puede incluir una o más memorias, procesadores, medios legibles por ordenador, medios de almacenamiento, puertos (físicos y virtuales), dispositivos de comunicación e interfaces capaces de acceder a otros servidores, clientes, máquinas y dispositivos a través de un medio cableado o inalámbrico, y similares. Los procedimientos, programas o códigos que se describen en la presente memoria y en otros lugares pueden ser ejecutados por el servidor. Además, otros dispositivos necesarios para la ejecución de los procedimientos descritos en esta solicitud pueden considerarse como parte de la infraestructura asociada con el servidor.
El servidor puede proporcionar una interfaz a otros dispositivos que incluye, sin limitación, clientes, otros servidores, impresoras, servidores de bases de datos, servidores de impresión, servidores de archivos, servidores de comunicación, servidores distribuidos y similares. Además, este acoplamiento y/o conexión puede facilitar la ejecución remota de programas a través de la red. La interconexión de algunos o todos estos dispositivos puede facilitar el procesamiento paralelo de un programa o procedimiento en una o más ubicaciones sin desviarse del alcance de la descripción. Además, cualquiera de los dispositivos conectados al servidor a través de una interfaz puede incluir al menos un medio de almacenamiento capaz de almacenar procedimientos, programas, código y/o instrucciones. Un repositorio central puede proporcionar instrucciones de programa a ejecutar en diferentes dispositivos. En esta implementación, el repositorio remoto puede actuar como un medio de almacenamiento para el código de programa, instrucciones y programas.
El programa de software puede estar asociado con un cliente que puede incluir un cliente de archivos, cliente de impresión, cliente de dominio, cliente de internet, cliente de intranet y otras variantes como cliente secundario, cliente anfitrión, cliente distribuido y similares. El cliente puede incluir una o más de memorias, procesadores, medios legibles por ordenador, medios de almacenamiento, puertos (físicos y virtuales), dispositivos de comunicación e interfaces capaces de acceder a otros clientes, servidores, máquinas y dispositivos a través de un medio cableado o inalámbrico, y similares. Los procedimientos, programas o códigos descritos en la presente memoria y en otros lugares pueden ser ejecutados por el cliente. Además, otros dispositivos requeridos para la ejecución de los procedimientos descritos en esta solicitud pueden ser considerados como parte de la infraestructura asociada con el cliente.
El cliente puede proporcionar una interfaz a otros dispositivos que incluye, sin limitación, servidores, otros clientes, impresoras, servidores de bases de datos, servidores de impresión, servidores de archivos, servidores de comunicación, servidores distribuidos y similares. Además, este acoplamiento y/o conexión puede facilitar la ejecución remota de programas a través de la red. La interconexión de algunos o todos estos dispositivos puede facilitar el procesamiento paralelo de un programa o procedimiento en una o más ubicaciones sin desviarse del alcance de la descripción. Además, cualquiera de los dispositivos conectados al cliente a través de una interfaz puede incluir al menos un medio de almacenamiento capaz de almacenar procedimientos, programas, aplicaciones, código y/o instrucciones. Un repositorio central puede proporcionar instrucciones de programa a ejecutar en diferentes dispositivos. En esta implementación, el repositorio remoto puede actuar como un medio de almacenamiento para el código de programa, las instrucciones y los programas.
Los procedimientos y sistemas que se describen en la presente memoria pueden ser implementados en parte o en su totalidad a través de infraestructuras de red. La infraestructura de red puede incluir elementos tales como dispositivos informáticos, servidores, enrutadores, concentradores, cortafuegos, clientes, ordenadores personales, dispositivos de comunicación, dispositivos de enrutamiento y otros dispositivos, módulos y/o componentes activos y pasivos, como se conoce en la técnica. Los dispositivos informáticos y/o no informáticos asociados con la infraestructura de red pueden incluir, además de otros componentes, un medio de almacenamiento como memoria flash, búfer, pila, RAM, ROM y similares. Los procesos, procedimientos, códigos de programa, instrucciones descritas en la presente memoria y en otros lugares pueden ser ejecutados por uno o más de los elementos de infraestructura de red.
Los procedimientos, códigos de programa e instrucciones que se describen en la presente memoria y en otros lugares pueden ser implementados en una red celular que comprende múltiples celdas. La red celular puede ser una red de acceso múltiple por división de frecuencia (FDMA) o una red de acceso múltiple por división de código (CDMA). La red celular puede incluir dispositivos móviles, sitios de celdas, estaciones base, repetidores, antenas, torres y similares. La red celular puede ser un GSM, GPRS, 3G, EVDO, malla, u otros tipos de redes.
Los procedimientos, códigos de programas e instrucciones que se describen en la presente memoria y en otros lugares pueden ser implementados en o a través de dispositivos móviles. Los dispositivos móviles pueden incluir dispositivos de navegación, teléfonos celulares, teléfonos móviles, asistentes digitales personales móviles, ordenadores portátiles, palmtops, netbooks, buscapersonas, lectores de libros electrónicos, reproductores de música y similares. Estos dispositivos pueden incluir, además de otros componentes, un medio de almacenamiento como una memoria flash, búfer, RAM, ROM y uno o más dispositivos informáticos. Los dispositivos informáticos asociados con dispositivos móviles pueden estar habilitados para ejecutar códigos de programa, procedimientos e instrucciones almacenados en ellos. Alternativamente, los dispositivos móviles pueden estar configurados para ejecutar instrucciones en colaboración con otros dispositivos. Los dispositivos móviles pueden comunicarse con estaciones base conectadas a servidores y configuradas para ejecutar códigos de programa. Los dispositivos móviles pueden comunicarse en una red de igual a igual, red en malla u otra red de comunicaciones. El código de programa puede ser almacenado en el medio de almacenamiento asociado con el servidor y ejecutado por un dispositivo informático integrado dentro del servidor. La estación base puede incluir un dispositivo informático y un medio de almacenamiento. El dispositivo de almacenamiento puede almacenar códigos de programa e instrucciones ejecutados por los dispositivos informáticos asociados con la estación base.
El software del ordenador, los códigos de programa y/o las instrucciones pueden ser almacenados y/o pueden accederse en medios legibles por máquina que pueden incluir: componentes de ordenador, dispositivos y medios de grabación que retienen datos digitales utilizados para el cálculo durante algún intervalo de tiempo; almacenamiento de semiconductores conocido como memoria de acceso aleatorio (RAM); almacenamiento masivo típicamente para un almacenamiento más permanente, como discos ópticos, formas de almacenamiento magnético como discos duros, cintas, tambores, tarjetas y otros tipos; registros de procesador, memoria caché, memoria volátil, memoria no volátil; almacenamiento óptico como CD, DVD; medios removibles como memoria flash (por ejemplo, memorias o llaves USB), discos flexibles, cinta magnética, cinta de papel, tarjetas perforadas, discos RAM independientes, unidades Zip, almacenamiento masivo removible, fuera de línea, y similares; otra memoria de ordenador como memoria dinámica, memoria estática, almacenamiento de lectura/escritura, almacenamiento mutable, solo lectura, acceso aleatorio, acceso secuencial, direccionable por ubicación, direccionable por archivo, direccionable por contenido, almacenamiento conectado en red, red de área de almacenamiento, códigos de barras, tinta magnética, y similares.
Los procedimientos y sistemas que se describen en la presente memoria pueden transformar elementos físicos y/o intangibles de un estado a otro. Los procedimientos y sistemas que se describen en la presente memoria también pueden transformar datos que representan elementos físicos y/o intangibles de un estado a otro.
Los elementos descritos y representados en la presente memoria, incluyendo en diagramas de flujo y diagramas de bloques a lo largo de las figuras, implican límites lógicos entre los elementos. Sin embargo, de acuerdo con las prácticas de ingeniería de software o hardware, los elementos representados y sus funciones pueden ser implementados en máquinas a través de medios ejecutables por ordenador que tienen un procesador capaz de ejecutar instrucciones de programa almacenadas en ellos como una estructura de software monolítica, como módulos de software independientes, o como módulos que emplean rutinas externas, código, servicios, etc., o cualquier combinación de estos, y todas dichas implementaciones pueden estar dentro del alcance de la presente descripción. Ejemplos de tales máquinas pueden incluir, pero no se limitan a, asistentes digitales personales, laptops, ordenadores personales, teléfonos móviles, otros dispositivos informáticos de mano, equipos médicos, dispositivos de comunicación por cable o inalámbricos, transductores, chips, calculadoras, satélites, tabletas, libros electrónicos, gadgets, dispositivos electrónicos, dispositivos que tienen inteligencia artificial, dispositivos informáticos, equipos de red, servidores, enrutadores y similares. Además, los elementos representados en el diagrama de flujo y en los diagramas de bloques o cualquier otro componente lógico pueden ser implementados en una máquina capaz de ejecutar instrucciones de programa. Así, aunque los dibujos y descripciones anteriores exponen aspectos funcionales de los sistemas descritos, no se debe inferir ninguna disposición particular de software para implementar estos aspectos funcionales a partir de estas descripciones a menos que se indique explícitamente o sea de otro modo claro a partir del contexto. De manera similar, se apreciará que los diversos pasos identificados y descritos anteriormente pueden ser variados, y que el orden de los pasos puede ser adaptado a aplicaciones particulares de las técnicas que se describen en la presente memoria. Todas esas variaciones y modificaciones están destinadas a estar dentro del alcance de esta descripción. Como tal, la representación y/o descripción de un orden para varios pasos no debe entenderse como un requisito de un orden particular de ejecución para esos pasos, a menos que sea requerido por una aplicación particular, o se indique explícitamente o sea de otro modo claro a partir del contexto.
Los procedimientos y/o procesos descritos anteriormente, y los pasos de los mismos, pueden ser realizados en hardware, software o cualquier combinación de hardware y software adecuada para una aplicación particular. El hardware puede incluir un ordenador de propósito general y/o un dispositivo informático dedicado o un dispositivo informático específico o un aspecto o componente particular de un dispositivo informático específico. Los procesos pueden realizarse en uno o más microprocesadores, microcontroladores, microcontroladores integrados, procesadores de señal digital programables u otro dispositivo programable, junto con memoria interna y/o externa. Los procesos también pueden, o en su lugar, estar incorporados en un circuito integrado específico de aplicación, una matriz de puertas programables, lógica de matriz programable, o cualquier otro dispositivo o combinación de dispositivos que puedan ser configurados para procesar señales electrónicas. Se apreciará además que uno o más de los procesos pueden ser realizados como un código ejecutable por ordenador capaz de ser ejecutado en un medio legible por máquina.
El código ejecutable por ordenador puede ser creado utilizando un lenguaje de programación estructurado como C, un lenguaje de programación orientado a objetos como C++, o cualquier otro lenguaje de programación de alto o bajo nivel (incluyendo lenguajes de ensamblaje, lenguajes de descripción de hardware y lenguajes y tecnologías de programación de bases de datos) que pueda ser almacenado, compilado o interpretado para ejecutarse en uno de los dispositivos mencionados, así como combinaciones heterogéneas de procesadores, arquitecturas de procesadores, o combinaciones de diferentes hardware y software, o cualquier otra máquina capaz de ejecutar instrucciones de programa.
Así, en un aspecto, cada procedimiento descrito anteriormente y las combinaciones de los mismos pueden estar caracterizados porque se incorporen en código ejecutable por ordenador que, al ejecutarse en uno o más dispositivos informáticos, realiza los pasos correspondientes. En otro aspecto, los procedimientos pueden ser realizados en sistemas que ejecutan los pasos de los mismos, y pueden estar distribuidos entre dispositivos de varias maneras, o toda la funcionalidad puede estar integrada en un dispositivo dedicado e independiente u otro hardware. En otro aspecto, los medios para realizar los pasos asociados con los procesos descritos anteriormente pueden incluir cualquiera del hardware y/o software descrito anteriormente. Todas esas permutaciones y combinaciones están destinadas a caer dentro del alcance de la presente descripción.
Claims (13)
- REIVINDICACIONESi. Un sistema (100) para entrenar un modelo matemático para detectar una condición médica y para detectar la condición médica utilizando el modelo matemático, en el que la condición médica es una conmoción cerebral o la enfermedad de Alzheimer, comprendiendo el sistema al menos un ordenador (120) configurado para: obtener (710) un corpus de entrenamiento que comprende elementos de datos del habla, en el que cada elemento de datos del habla está etiquetado con un valor de diagnóstico, y en el que cada elemento de datos del habla corresponde a una indicación;obtener (720) resultados de reconocimiento del habla para cada elemento de datos del habla utilizando reconocimiento automático del habla, en el que los resultados de reconocimiento del habla para un elemento de datos del habla comprenden una transcripción del elemento de datos del habla;calcular (730) una pluralidad de características acústicas para cada elemento de datos de habla en el corpus de entrenamiento, en el que la pluralidad de características acústicas se calcula a partir del elemento de datos de habla y en el que el cálculo de la pluralidad de características acústicas no utiliza los resultados de reconocimiento de habla del elemento de datos de habla;calcular (740) una pluralidad de características del lenguaje para cada elemento de datos del habla en el corpus de entrenamiento procesando los resultados del reconocimiento del habla;calcular (750) una puntuación de selección de características para cada característica de la pluralidad de características acústicas y cada característica de la pluralidad de características del lenguaje, en el que: la puntuación de selección de características para una característica indica la utilidad de la característica para detectar la condición médica, yla puntuación de selección de características se calcula utilizando, para cada elemento de datos del habla, un valor de la característica y el valor de diagnóstico correspondiente al elemento de datos del habla; seleccionar (760) una pluralidad de características de la pluralidad de características acústicas y la pluralidad de características del lenguaje utilizando las puntuaciones de selección de características;entrenar (770) el modelo matemátide características para cada elemento de datos del habla del corpus de entrenamiento;desplegar un producto o servicio (140) para detectar la condición médica utilizando el modelo matemático; presentar, por parte del producto o servicio, una indicación a una persona;recibir (820) un elemento de datos del habla correspondiente a la voz de la persona en respuesta a la indicación; ycalcular (830) una puntuación de diagnóstico médico procesando el elemento de datos del habla utilizando el modelo matemático, comprendiendo la puntuación de diagnóstico médico una determinación de si la persona puede tener la condición médica o una posible gravedad de la condición médica.
- 2. El sistema de la reivindicación 1, en el que cada elemento de datos del habla del corpus de entrenamiento corresponde a una indicación de una pluralidad de indicaciones, comprendiendo la pluralidad de indicaciones la indicación presentada, y en el que al menos un ordenador está configurado para:calcular una puntuación de diagnóstico médico para cada elemento de datos de habla del corpus de entrenamiento procesando los elementos de datos de habla con el modelo matemático;calcular (840) una puntuación de selección de indicación para cada indicación de la pluralidad de indicaciones utilizando las puntuaciones de diagnóstico médico;seleccionar (860) un subconjunto de indicaciones de la pluralidad de indicaciones utilizando las puntuaciones de selección de indicaciones, comprendiendo el subconjunto de indicaciones la indicación presentada; desplegar el producto o servicio para detectar la condición médica utilizando el modelo matemático y el subconjunto de indicaciones;recibir un elemento de datos de habla correspondiente a la voz de la persona para cada indicación del subconjunto de indicaciones; ycalcular la puntuación de diagnóstico médico para la persona procesando los elementos de datos del habla utilizando el modelo matemático.
- 3. El sistema de la reivindicación 1, en el que al menos un ordenador está configurado para:dividir el corpus de entrenamiento en una pluralidad de pliegues; ycalcular una estadística para cada característica y cada pliegue de la pluralidad de pliegues.
- 4. El sistema de la reivindicación 3, en el que al menos un ordenador está configurado para:calcular una determinación de estabilidad para cada característica de la pluralidad de características acústicas y la pluralidad de características del lenguaje utilizando las estadísticas de cada característica y cada pliegue de la pluralidad de pliegues; yselecciona la pluralidad de características utilizando las determinaciones de estabilidad.
- 5. El sistema de la reivindicación 1, en el que el modelo matemático que comprende una red neuronal o una máquina de soporte vectorial.
- 6. El sistema de la reivindicación 1, en el que la pluralidad de características acústicas comprende al menos una de características espectrales, características prosódicas o características de calidad del habla.
- 7. Un procedimiento implementado por ordenador para entrenar un modelo matemático para detectar una condición médica y para detectar la condición médica utilizando el modelo matemático, en el que la condición médica es una conmoción cerebral o la enfermedad de Alzheimer, comprendiendo el procedimiento:Obtener (710) un corpus de entrenamiento que comprende elementos de datos del habla, en el que cada elemento de datos del habla está etiquetado con un valor de diagnóstico, y en el que cada elemento de datos del habla corresponde a una indicación;obtener (720) resultados de reconocimiento del habla para cada elemento de datos del habla utilizando reconocimiento automático del habla, en el que los resultados de reconocimiento del habla para un elemento de datos del habla comprenden una transcripción del elemento de datos del habla;calcular (730) una pluralidad de características acústicas para cada elemento de datos del habla en el corpus de entrenamiento, en el que la pluralidad de características acústicas se calcula a partir del elemento de datos del habla y en el que el cálculo de la pluralidad de características acústicas no utiliza los resultados del reconocimiento del habla del elemento de datos del habla;calcular (740) una pluralidad de características del lenguaje para cada elemento de datos de habla en el corpus de entrenamiento mediante el procesamiento de los resultados del reconocimiento de habla; calcular (750) una puntuación de selección de características para cada característica de la pluralidad de características acústicas y cada característica de la pluralidad de características del lenguaje, en el que: la puntuación de selección de características para una característica indica la utilidad de la característica para detectar la condición médica, yla puntuación de selección de características se calcula utilizando, para cada elemento de datos del habla, un valor de la característica y el valor de diagnóstico correspondiente al elemento de datos del habla; seleccionar (760) una pluralidad de características de la pluralidad de características acústicas y la pluralidad de características del lenguaje utilizando las puntuaciones de selección de características;entrenar (770) el modelo matemátide características para cada elemento de datos del habla del corpus de entrenamiento;desplegar un producto o servicio (140) para detectar la condición médica utilizando el modelo matemático; recibir (820) un elemento de datos del habla correspondiente a la voz de una persona en respuesta a una indicación; ycalcular (830) una puntuación de diagnóstico médico procesando el elemento de datos del habla utilizando el modelo matemático, comprendiendo la puntuación de diagnóstico médico una determinación de si la persona puede tener la condición médica o una posible gravedad de la condición médica.
- 8. El procedimiento implementado por ordenador de la reivindicación 7, en el que la pluralidad de características del lenguaje comprende uno o más de un número de rellenos de pausa durante un período de tiempo, un número de rellenos de pausa sobre un número de palabras, dificultad de las palabras, o velocidad del habla.
- 9. El procedimiento implementado por ordenador de la reivindicación 7, en el que el cálculo de una puntuación de selección de características para una característica comprende generar un par de números para cada elemento de datos de habla del corpus de entrenamiento, y en el que un primer número del par corresponde a un valor de característica y un segundo número del par corresponde a un valor de diagnóstico.
- 10. El procedimiento implementado por ordenador de la reivindicación 7, que comprende:dividir el corpus de entrenamiento en una pluralidad de pliegues; y calcular una estadística para cada característica y cada pliegue de la pluralidad de pliegues.
- 11. El procedimiento implementado por ordenador de la reivindicación 10, que comprende:calcular una determinación de estabilidad para cada característica de la pluralidad de características acústicas y la pluralidad de características del lenguaje utilizando las estadísticas para cada característica y cada pliegue de la pluralidad de pliegues; yseleccionar la pluralidad de características utilizando las determinaciones de estabilidad.
- 12. El procedimiento implementado por ordenador de la reivindicación 7, que comprende:seleccionar una pluralidad de indicaciones utilizando el modelo matemático; yentrenar un segundo modelo matemático utilizando la pluralidad seleccionada de indicaciones y los elementos de datos del habla del corpus de entrenamiento.
- 13. Uno o más medios legibles por ordenador no transitorios que comprenden instrucciones ejecutables por ordenador que, cuando se ejecutan, hacen que al menos un procesador realice acciones que comprenden: obtener (710) un corpus de entrenamiento que comprende elementos de datos del habla, en el que cada elemento de datos del habla está etiquetado con un valor de diagnóstico, y en el que cada elemento de datos del habla corresponde a una indicación;obtener (720) resultados de reconocimiento del habla para cada elemento de datos del habla utilizando reconocimiento automático del habla, en el que los resultados de reconocimiento del habla para un elemento de datos del habla comprenden una transcripción del elemento de datos del habla;calcular (730) una pluralidad de características acústicas para cada elemento de datos del habla en el corpus de entrenamiento, en el que la pluralidad de características acústicas se calcula a partir del elemento de datos del habla y en el que el cálculo de la pluralidad de características acústicas no utiliza los resultados del reconocimiento del habla del elemento de datos del habla;calcular (740) una pluralidad de características del lenguaje para cada elemento de datos del habla en el corpus de entrenamiento mediante el procesamiento de los resultados del reconocimiento del habla; calcular (750) una puntuación de selección de características para cada característica de la pluralidad de características acústicas y cada característica de la pluralidad de características del lenguaje, en el que: la puntuación de selección de características para una característica indica la utilidad de la característica para detectar una condición médica, en el que la condición médica es una conmoción cerebral o la enfermedad de Alzheimer, yla puntuación de selección de características se calcula utilizando, para cada elemento de datos del habla, un valor de la característica y el valor de diagnóstico correspondiente al elemento de datos del habla; seleccionar (760) una pluralidad de características de la pluralidad de características acústicas y la pluralidad de características del lenguaje utilizando las puntuaciones de selección de características;entrenar (770) un modelo matemáticaracterísticas seleccionadas para cada elemento de datos de habla del corpus de entrenamiento; desplegar un producto o servicio (140) para detectar la condición médica utilizando el modelo matemático; presentar, por parte del producto o servicio, una indicación a una persona;recibir (820) un elemento de datos del habla correspondiente a la voz de la persona en respuesta a la indicación; ycalcular (830) una puntuación de diagnóstico médico procesando el elemento de datos del habla utilizando el modelo matemático, comprendiendo la puntuación de diagnóstico médico una determinación de si la persona puede tener la condición médica o una posible gravedad de la condición médica.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US201762502584P | 2017-05-05 | 2017-05-05 | |
| US201862614192P | 2018-01-05 | 2018-01-05 | |
| PCT/US2018/031460 WO2018204934A1 (en) | 2017-05-05 | 2018-05-07 | Selecting speech features for building models for detecting medical conditions |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2992090T3 true ES2992090T3 (es) | 2024-12-09 |
Family
ID=64014871
Family Applications (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES18794955T Active ES2988668T3 (es) | 2017-05-05 | 2018-05-07 | Evaluación médica basada en la voz |
| ES18794118T Active ES2992090T3 (es) | 2017-05-05 | 2018-05-07 | Seleccionar características del habla para construir modelos para detectar condiciones médicas |
Family Applications Before (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES18794955T Active ES2988668T3 (es) | 2017-05-05 | 2018-05-07 | Evaluación médica basada en la voz |
Country Status (5)
| Country | Link |
|---|---|
| US (8) | US10152988B2 (es) |
| EP (4) | EP4471801A3 (es) |
| JP (8) | JP7208977B2 (es) |
| ES (2) | ES2988668T3 (es) |
| WO (2) | WO2018204934A1 (es) |
Families Citing this family (98)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US10939821B2 (en) * | 2017-03-20 | 2021-03-09 | Applications Technology (Apptek), Llc | Systems and methods for diagnosing and analyzing concussions |
| WO2018204934A1 (en) | 2017-05-05 | 2018-11-08 | Canary Speech, LLC | Selecting speech features for building models for detecting medical conditions |
| US10910105B2 (en) * | 2017-05-31 | 2021-02-02 | International Business Machines Corporation | Monitoring the use of language of a patient for identifying potential speech and related neurological disorders |
| JPWO2018230562A1 (ja) * | 2017-06-14 | 2020-04-23 | 日本電気株式会社 | 通知システム |
| US20190043623A1 (en) * | 2017-08-04 | 2019-02-07 | Thomas W. WATLINGTON, IV | System and method for physiological and psychological support in home healthcare |
| US11436549B1 (en) | 2017-08-14 | 2022-09-06 | ClearCare, Inc. | Machine learning system and method for predicting caregiver attrition |
| US11508479B2 (en) * | 2017-10-16 | 2022-11-22 | Optum, Inc. | Automated question generation and response tracking |
| US20190385711A1 (en) | 2018-06-19 | 2019-12-19 | Ellipsis Health, Inc. | Systems and methods for mental health assessment |
| WO2019246239A1 (en) | 2018-06-19 | 2019-12-26 | Ellipsis Health, Inc. | Systems and methods for mental health assessment |
| US20210290149A1 (en) * | 2018-07-05 | 2021-09-23 | Highmark Innovations Inc. | System for generating indications of neurological impairment |
| US12205348B2 (en) * | 2018-08-02 | 2025-01-21 | Veritone, Inc. | Neural network orchestration |
| US11120226B1 (en) | 2018-09-04 | 2021-09-14 | ClearCare, Inc. | Conversation facilitation system for mitigating loneliness |
| US11633103B1 (en) | 2018-08-10 | 2023-04-25 | ClearCare, Inc. | Automatic in-home senior care system augmented with internet of things technologies |
| US20210219893A1 (en) * | 2018-08-26 | 2021-07-22 | Vocalis Health Ltd. | System and method for measurement of vocal biomarkers of vitality and biological aging |
| US11631401B1 (en) * | 2018-09-04 | 2023-04-18 | ClearCare, Inc. | Conversation system for detecting a dangerous mental or physical condition |
| US11380351B2 (en) * | 2018-09-20 | 2022-07-05 | Samsung Electronics Co., Ltd. | System and method for pulmonary condition monitoring and analysis |
| US10847177B2 (en) | 2018-10-11 | 2020-11-24 | Cordio Medical Ltd. | Estimating lung volume by speech analysis |
| US11176230B2 (en) | 2018-12-05 | 2021-11-16 | Bank Of America Corporation | Processing authentication requests to secured information systems based on user behavior profiles |
| US11048793B2 (en) | 2018-12-05 | 2021-06-29 | Bank Of America Corporation | Dynamically generating activity prompts to build and refine machine learning authentication models |
| US11120109B2 (en) | 2018-12-05 | 2021-09-14 | Bank Of America Corporation | Processing authentication requests to secured information systems based on machine-learned event profiles |
| US11159510B2 (en) | 2018-12-05 | 2021-10-26 | Bank Of America Corporation | Utilizing federated user identifiers to enable secure information sharing |
| US11113370B2 (en) | 2018-12-05 | 2021-09-07 | Bank Of America Corporation | Processing authentication requests to secured information systems using machine-learned user-account behavior profiles |
| US11036838B2 (en) | 2018-12-05 | 2021-06-15 | Bank Of America Corporation | Processing authentication requests to secured information systems using machine-learned user-account behavior profiles |
| US12161481B2 (en) * | 2018-12-18 | 2024-12-10 | Szededi Tudomanyegyetem | Automatic detection of neurocognitive impairment based on a speech sample |
| US10943588B2 (en) * | 2019-01-03 | 2021-03-09 | International Business Machines Corporation | Methods and systems for managing voice response systems based on references to previous responses |
| US11133026B2 (en) * | 2019-01-04 | 2021-09-28 | International Business Machines Corporation | Natural language processor for using speech to cognitively detect and analyze deviations from a baseline |
| US11350885B2 (en) * | 2019-02-08 | 2022-06-07 | Samsung Electronics Co., Ltd. | System and method for continuous privacy-preserved audio collection |
| WO2020176476A1 (en) * | 2019-02-26 | 2020-09-03 | Flatiron Health, Inc. | Prognostic score based on health information |
| US11024327B2 (en) | 2019-03-12 | 2021-06-01 | Cordio Medical Ltd. | Diagnostic techniques based on speech models |
| US11011188B2 (en) * | 2019-03-12 | 2021-05-18 | Cordio Medical Ltd. | Diagnostic techniques based on speech-sample alignment |
| US12494224B2 (en) | 2019-03-12 | 2025-12-09 | Cordio Medical Ltd. | Analyzing speech using speech-sample alignment and segmentation based on acoustic features |
| CN113544776B (zh) * | 2019-03-12 | 2024-08-27 | 科蒂奥医疗公司 | 基于语音样本对准的诊断技术 |
| US12488805B2 (en) | 2019-03-12 | 2025-12-02 | Cordio Medical Ltd. | Using optimal articulatory event-types for computer analysis of speech |
| US12512114B2 (en) | 2019-03-12 | 2025-12-30 | Cordio Medical Ltd. | Analyzing speech using speech models and segmentation based on acoustic features |
| US20210373596A1 (en) * | 2019-04-02 | 2021-12-02 | Talkgo, Inc. | Voice-enabled external smart processing system with display |
| JP7843138B2 (ja) * | 2019-04-15 | 2026-04-09 | ヤンセン ファーマシューティカ エヌ.ベー. | スピーチ分析を使用して認知低下を検出するためのシステム及び方法 |
| JP7327987B2 (ja) * | 2019-04-25 | 2023-08-16 | キヤノン株式会社 | 医療診断支援システム、医療診断支援装置、医療診断支援方法及びプログラム |
| US11547345B2 (en) * | 2019-05-04 | 2023-01-10 | Intraneuron | Dynamic neuropsychological assessment tool |
| CN110263641B (zh) * | 2019-05-17 | 2026-03-10 | 原力图新(重庆)科技有限公司 | 疲劳检测方法、装置及可读存储介质 |
| EP3745412A1 (en) * | 2019-05-28 | 2020-12-02 | Corti ApS | An intelligent computer aided decision support system |
| US12147223B2 (en) | 2019-05-30 | 2024-11-19 | Abb Schweiz Ag | Method and system for monitoring condition of drives |
| MX2021014721A (es) * | 2019-05-30 | 2022-04-06 | Insurance Services Office Inc | Sistemas y metodos para aprendizaje de maquina de atributos de voz. |
| JP7495029B2 (ja) * | 2019-09-04 | 2024-06-04 | オンタクト ヘルス カンパニー リミテッド | 最適な移送病院決定方法及びサーバ |
| US11114113B2 (en) | 2019-10-18 | 2021-09-07 | LangAware, Inc. | Multilingual system for early detection of neurodegenerative and psychiatric disorders |
| EP3809411B1 (en) * | 2019-10-18 | 2025-03-26 | LangAware, Inc. | Multi-lingual system for early detection of alzheimer's disease |
| JP2022553749A (ja) * | 2019-10-25 | 2022-12-26 | エリプシス・ヘルス・インコーポレイテッド | 速度ベースのスクリーニング及び挙動の健康状態の監視のための音響及び自然言語処理モデル |
| CN112908317B (zh) * | 2019-12-04 | 2023-04-07 | 中国科学院深圳先进技术研究院 | 一种针对认知障碍的语音识别系统 |
| JPWO2021111964A1 (es) * | 2019-12-04 | 2021-06-10 | ||
| US20210182696A1 (en) * | 2019-12-11 | 2021-06-17 | International Business Machines Corporation | Prediction of objective variable using models based on relevance of each model |
| WO2021127348A1 (en) * | 2019-12-18 | 2021-06-24 | Darroh Steven | Voice training therapy app system and method |
| US11232570B2 (en) | 2020-02-13 | 2022-01-25 | Olympus Corporation | System and method for diagnosing severity of gastritis |
| US11484211B2 (en) | 2020-03-03 | 2022-11-01 | Cordio Medical Ltd. | Diagnosis of medical conditions using voice recordings and auscultation |
| JP7539105B2 (ja) * | 2020-03-24 | 2024-08-23 | パナソニックIpマネジメント株式会社 | 認知機能判定システム、及びプログラム |
| JP7450216B2 (ja) * | 2020-03-24 | 2024-03-15 | パナソニックIpマネジメント株式会社 | 認知機能判定システム、及びプログラム |
| US20210298711A1 (en) * | 2020-03-25 | 2021-09-30 | Applications Technology (Apptek), Llc | Audio biomarker for virtual lung function assessment and auscultation |
| US20210315500A1 (en) * | 2020-04-10 | 2021-10-14 | döTERRA International LLC | Systems and methods for determining wellness using a mobile application |
| CN112133284B (zh) * | 2020-04-23 | 2023-07-07 | 中国医学科学院北京协和医院 | 一种医疗语音对话方法及装置 |
| CA3179063A1 (en) * | 2020-05-16 | 2021-11-25 | Erik Edwards | Machine learning systems and methods for multiscale alzheimer's dementia recognition through spontaneous speech |
| JP7410516B2 (ja) * | 2020-06-19 | 2024-01-10 | 国立大学法人北海道大学 | 親子健康管理システム、親子健康分析装置、及び親子健康管理方法 |
| US11417342B2 (en) | 2020-06-29 | 2022-08-16 | Cordio Medical Ltd. | Synthesizing patient-specific speech models |
| KR102659616B1 (ko) * | 2020-07-10 | 2024-04-23 | 주식회사 이모코그 | 음성 특성 기반 알츠하이머병 예측 방법 및 장치 |
| EP4179961A4 (en) * | 2020-07-10 | 2023-06-07 | Emocog Co., Ltd. | LANGUAGE PROPERTIES BASED METHOD AND DEVICE FOR PREDICTING ALZHEIMER'S DISEASE |
| US11526796B2 (en) * | 2020-07-15 | 2022-12-13 | International Business Machines Corporation | Qubit pulse calibration via canary parameter monitoring |
| US12444502B2 (en) | 2020-08-03 | 2025-10-14 | The COVID Detection Foundation | Ensemble machine-learning models to detect respiratory syndromes |
| EP3965116A1 (en) * | 2020-09-02 | 2022-03-09 | Koninklijke Philips N.V. | Responding to emergency calls |
| WO2022055798A1 (en) * | 2020-09-08 | 2022-03-17 | Lifeline Systems Company | Cognitive impairment detected through audio recordings |
| WO2022054687A1 (ja) * | 2020-09-08 | 2022-03-17 | テルモ株式会社 | プログラム、情報処理装置及び情報処理方法 |
| US12205582B2 (en) | 2020-10-08 | 2025-01-21 | Mastercard International Incorporated | System and method for implementing a virtual caregiver |
| US11495211B2 (en) | 2020-10-29 | 2022-11-08 | International Business Machines Corporation | Memory deterioration detection and amelioration |
| US12334105B2 (en) | 2020-11-23 | 2025-06-17 | Cordio Medical Ltd. | Detecting impaired physiological function by speech analysis |
| GB202019000D0 (en) | 2020-12-02 | 2021-01-13 | Accexible Impacto S L | Detection of cognitive impairment |
| EP4312768A4 (en) * | 2021-03-31 | 2024-12-25 | Aural Analytics, Inc. | SYSTEMS AND METHODS FOR DIGITAL LANGUAGE-BASED ASSESSMENT OF COGNITIVE FUNCTION |
| US11887583B1 (en) * | 2021-06-09 | 2024-01-30 | Amazon Technologies, Inc. | Updating models with trained model update objects |
| KR102640314B1 (ko) * | 2021-07-12 | 2024-02-23 | (주)휴톰 | 인공지능 수술 시스템 및 그것의 제어방법 |
| US20230018524A1 (en) * | 2021-07-19 | 2023-01-19 | Modality.Ai, Inc. | Multimodal conversational platform for remote patient diagnosis and monitoring |
| CN113838450B (zh) * | 2021-08-11 | 2022-11-25 | 北京百度网讯科技有限公司 | 音频合成及相应的模型训练方法、装置、设备及存储介质 |
| US12125497B2 (en) | 2021-09-07 | 2024-10-22 | Canary Speech, LLC | Paired neural networks for diagnosing health conditions via speech |
| WO2023095136A1 (en) * | 2021-11-24 | 2023-06-01 | B.G. Negev Technologies And Applications Ltd., At Ben-Gurion University | Subject diagnosis using speech analysis |
| US20250046335A1 (en) * | 2021-11-29 | 2025-02-06 | Corti Aps | Spoken language understanding by means of representations learned unsupervised |
| EP4220648A4 (en) | 2021-12-08 | 2024-07-10 | Sevenpointone Inc. | Method and server for dementia test based on questions and answers using artificial intelligence call |
| KR102380376B1 (ko) * | 2021-12-08 | 2022-04-01 | 주식회사 세븐포인트원 | 인공지능 콜을 이용한 음성 질의응답 기반의 치매 검사 방법 및 서버 |
| KR102755040B1 (ko) * | 2021-12-29 | 2025-01-21 | 서울대학교병원 | 기계학습을 기반으로 하는 문진 텍스트를 이용한 우울증 예측 장치 및 그 방법 |
| WO2023168281A1 (en) * | 2022-03-02 | 2023-09-07 | Arizona Board Of Regents On Behalf Of Arizona State University | System for diagnosing, tracking, and predicting recovery patterns in patients with traumatic brain injury |
| CN119212611A (zh) * | 2022-03-13 | 2024-12-27 | 索纳菲有限责任公司 | 通过使用人的声音提供健康信息的系统和方法 |
| US12008921B2 (en) * | 2022-04-22 | 2024-06-11 | 617 Education Inc. | Systems and methods for grapheme-phoneme correspondence learning |
| US12190062B2 (en) | 2022-04-28 | 2025-01-07 | Optum, Inc. | Natural language processing techniques using hybrid reason code prediction machine learning frameworks |
| US12537018B2 (en) * | 2022-08-31 | 2026-01-27 | Eleos Mental Systems Ltd. | Method and system for predicting a mental condition of a speaker |
| JP2024065641A (ja) * | 2022-10-31 | 2024-05-15 | キヤノンメディカルシステムズ株式会社 | 医用情報処理装置、医用情報処理システム及びプログラム |
| KR20240062495A (ko) * | 2022-11-01 | 2024-05-10 | 삼성전자주식회사 | 전자 장치 및 그 제어 방법 |
| CN115736830A (zh) * | 2022-11-16 | 2023-03-07 | 平安银行股份有限公司 | 短期记忆测试方法、装置、设备及计算机可读存储介质 |
| US12518774B2 (en) | 2023-02-05 | 2026-01-06 | Cordio Medical Ltd. | Identifying optimal articulatory event-types for computer analysis of speech |
| AU2024213722A1 (en) | 2023-02-05 | 2025-08-28 | Cordio Medical Ltd. | Identifying optimal articulatory event-types for computer analysis of speech |
| US12597512B2 (en) | 2023-05-15 | 2026-04-07 | HealthGPT, Inc. | Real-time use of multiple parallel automatic speech recognition (ASR) modules in a conversational artificial intelligence (AI) architecture |
| US12555595B2 (en) | 2023-05-18 | 2026-02-17 | Cordio Medical Ltd. | Converting a sequence of speech records of a human subject into a sequence of indicators of a physiological state of the subject |
| US20250140402A1 (en) | 2023-10-26 | 2025-05-01 | Canary Speech, Inc. | Techniques for speech language model training and application |
| WO2025221739A1 (en) * | 2024-04-15 | 2025-10-23 | Linus Health, Inc. | Estimating memory impairment from a mobile multimodal digital screening |
| US20250364134A1 (en) * | 2024-05-22 | 2025-11-27 | Sorenson Ip Holdings, Llc | Health assessment |
| WO2026080579A1 (en) * | 2024-10-08 | 2026-04-16 | Sonovoice, Inc. | Systems and methods for voice evaluation |
Family Cites Families (67)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6067516A (en) | 1997-05-09 | 2000-05-23 | Siemens Information | Speech and text messaging system with distributed speech recognition and speaker database transfers |
| JPH11197116A (ja) | 1998-01-08 | 1999-07-27 | Mitsubishi Electric Corp | 健康管理装置 |
| US6507790B1 (en) * | 1998-07-15 | 2003-01-14 | Horton, Inc. | Acoustic monitor |
| US7725307B2 (en) * | 1999-11-12 | 2010-05-25 | Phoenix Solutions, Inc. | Query engine for processing voice based queries including semantic decoding |
| US7062443B2 (en) | 2000-08-22 | 2006-06-13 | Silverman Stephen E | Methods and apparatus for evaluating near-term suicidal risk using vocal parameters |
| US20030105638A1 (en) | 2001-11-27 | 2003-06-05 | Taira Rick K. | Method and system for creating computer-understandable structured medical data from natural language reports |
| US20030115214A1 (en) | 2001-12-17 | 2003-06-19 | Nir Essar | Medical reporting system and method |
| US7315821B2 (en) | 2002-01-31 | 2008-01-01 | Sanyo Electric Co., Ltd. | System and method for health care information processing based on acoustic features |
| US6804654B2 (en) | 2002-02-11 | 2004-10-12 | Telemanager Technologies, Inc. | System and method for providing prescription services using voice recognition |
| US7483868B2 (en) * | 2002-04-19 | 2009-01-27 | Computer Associates Think, Inc. | Automatic neural-net model generation and maintenance |
| US7825488B2 (en) * | 2006-05-31 | 2010-11-02 | Advanced Analogic Technologies, Inc. | Isolation structures for integrated circuits and modular methods of forming the same |
| US6696339B1 (en) * | 2002-08-21 | 2004-02-24 | Micron Technology, Inc. | Dual-damascene bit line structures for microelectronic devices and methods of fabricating microelectronic devices |
| US20040210159A1 (en) | 2003-04-15 | 2004-10-21 | Osman Kibar | Determining a psychological state of a subject |
| US9240188B2 (en) * | 2004-09-16 | 2016-01-19 | Lena Foundation | System and method for expressive language, developmental disorder, and emotion assessment |
| US20120277594A1 (en) | 2009-01-23 | 2012-11-01 | Pryor Timothy R | Mental health and well-being |
| TW200735878A (en) | 2005-11-18 | 2007-10-01 | Astrazeneca Ab | Pharmaceutical compositions |
| US8478596B2 (en) * | 2005-11-28 | 2013-07-02 | Verizon Business Global Llc | Impairment detection using speech |
| WO2007070661A2 (en) * | 2005-12-13 | 2007-06-21 | Naryx Pharma, Inc. | Methods of measuring symptoms of chronic rhinosinusitis |
| WO2007121570A1 (en) * | 2006-04-20 | 2007-11-01 | Iq Life, Inc. | Interactive patient monitoring system using speech recognition |
| US8750971B2 (en) * | 2007-05-24 | 2014-06-10 | Bao Tran | Wireless stroke monitoring |
| EP2356814B1 (en) | 2008-11-07 | 2016-02-10 | Koninklijke Philips N.V. | Hospital tv/monitor display control with hierarchical access control |
| US9390167B2 (en) | 2010-07-29 | 2016-07-12 | Soundhound, Inc. | System and methods for continuous audio matching |
| US8494857B2 (en) | 2009-01-06 | 2013-07-23 | Regents Of The University Of Minnesota | Automatic measurement of speech fluency |
| WO2010132541A2 (en) | 2009-05-14 | 2010-11-18 | University Of Delaware | Electromagnetic detection apparatus and methods |
| US20120116186A1 (en) * | 2009-07-20 | 2012-05-10 | University Of Florida Research Foundation, Inc. | Method and apparatus for evaluation of a subject's emotional, physiological and/or physical state with the subject's physiological and/or acoustic data |
| US9087320B2 (en) * | 2009-09-15 | 2015-07-21 | Korrio, Inc. | Sports collaboration and communication platform |
| JP4876207B2 (ja) | 2010-06-11 | 2012-02-15 | 国立大学法人 名古屋工業大学 | 認知機能障害危険度算出装置、認知機能障害危険度算出システム、及びプログラム |
| WO2012003523A1 (en) | 2010-07-06 | 2012-01-12 | Rmit University | Emotional and/or psychiatric state detection |
| US8784311B2 (en) | 2010-10-05 | 2014-07-22 | University Of Florida Research Foundation, Incorporated | Systems and methods of screening for medical states using speech and other vocal behaviors |
| US20120310670A1 (en) | 2011-06-01 | 2012-12-06 | nPruv, Inc. | Systems and methods for automated informed consent |
| US9055861B2 (en) | 2011-02-28 | 2015-06-16 | Samsung Electronics Co., Ltd. | Apparatus and method of diagnosing health by using voice |
| US9514281B2 (en) | 2011-05-03 | 2016-12-06 | Graeme John HIRST | Method and system of longitudinal detection of dementia through lexical and syntactic changes in writing |
| US9763617B2 (en) | 2011-08-02 | 2017-09-19 | Massachusetts Institute Of Technology | Phonologically-based biomarkers for major depressive disorder |
| JP2013073509A (ja) * | 2011-09-28 | 2013-04-22 | Sapporo City Univ | 通信システム、通信方法、プログラムおよび通信装置 |
| US20130158434A1 (en) * | 2011-12-20 | 2013-06-20 | Delta Electronics, Inc. | Apparatus for voice assisted medical diagnosis |
| CN110353685B (zh) * | 2012-03-29 | 2022-03-04 | 昆士兰大学 | 用于处理患者声音的方法与装置 |
| US9517373B2 (en) * | 2012-07-06 | 2016-12-13 | Danny Rendon | Sprinkler head removal system and method |
| US20140073993A1 (en) * | 2012-08-02 | 2014-03-13 | University Of Notre Dame Du Lac | Systems and methods for using isolated vowel sounds for assessment of mild traumatic brain injury |
| WO2014062441A1 (en) | 2012-10-16 | 2014-04-24 | University Of Florida Research Foundation, Inc. | Screening for neurologial disease using speech articulation characteristics |
| US20140113263A1 (en) * | 2012-10-20 | 2014-04-24 | The University Of Maryland, Baltimore County | Clinical Training and Advice Based on Cognitive Agent with Psychological Profile |
| US9135571B2 (en) | 2013-03-12 | 2015-09-15 | Nuance Communications, Inc. | Methods and apparatus for entity detection |
| US9295423B2 (en) | 2013-04-03 | 2016-03-29 | Toshiba America Electronic Components, Inc. | System and method for audio kymographic diagnostics |
| US9495646B2 (en) * | 2013-06-05 | 2016-11-15 | The Trustees Of Columbia University In The City Of New York | Monitoring health of dynamic system using speaker recognition techniques |
| WO2015107681A1 (ja) | 2014-01-17 | 2015-07-23 | 任天堂株式会社 | 情報処理システム、情報処理サーバ、情報処理プログラム、および情報提供方法 |
| WO2015168606A1 (en) | 2014-05-02 | 2015-11-05 | The Regents Of The University Of Michigan | Mood monitoring of bipolar disorder using speech analysis |
| US12191030B2 (en) | 2014-07-07 | 2025-01-07 | Zoll Medical Corporation | Medical device with natural language processor |
| US9952685B2 (en) * | 2014-07-22 | 2018-04-24 | Logitech Europe S.A. | Input device with means for altering the operating mode of the input device |
| US10874340B2 (en) * | 2014-07-24 | 2020-12-29 | Sackett Solutions & Innovations, LLC | Real time biometric recording, information analytics and monitoring systems for behavioral health management |
| JP2017532082A (ja) * | 2014-08-22 | 2017-11-02 | エスアールアイ インターナショナルSRI International | 患者の精神状態のスピーチベース評価のためのシステム |
| WO2016077786A1 (en) | 2014-11-14 | 2016-05-19 | Zoll Medical Corporation | Medical premonitory event estimation |
| US20160135737A1 (en) | 2014-11-17 | 2016-05-19 | Elwha Llc | Determining treatment compliance using speech patterns captured during use of a communication system |
| US20160140986A1 (en) | 2014-11-17 | 2016-05-19 | Elwha Llc | Monitoring treatment compliance using combined performance indicators |
| CA2979390A1 (en) * | 2015-03-12 | 2016-09-15 | Akili Interactive Labs, Inc. | Processor implemented systems and methods for measuring cognitive abilities |
| US20160335399A1 (en) | 2015-03-16 | 2016-11-17 | Outside The Leather, Llc | System and method for a patient initiated medical interview using a voice-based medical history questionnaire |
| US20160278633A1 (en) | 2015-03-23 | 2016-09-29 | International Business Machines Corporation | Monitoring a person for indications of a brain injury |
| US11638550B2 (en) | 2015-07-07 | 2023-05-02 | Stryker Corporation | Systems and methods for stroke detection |
| EP3332322A4 (en) * | 2015-08-06 | 2018-08-22 | Avishai Abrahami | Cognitive state alteration system integrating multiple feedback technologies |
| US10127929B2 (en) | 2015-08-19 | 2018-11-13 | Massachusetts Institute Of Technology | Assessing disorders through speech and a computational model |
| WO2017048730A1 (en) * | 2015-09-14 | 2017-03-23 | Cogito Corporation | Systems and methods for identifying human emotions and/or mental health states based on analyses of audio inputs and/or behavioral data collected from computing devices |
| US9899035B2 (en) * | 2015-11-04 | 2018-02-20 | Ioannis Kakadiaris | Systems for and methods of intelligent acoustic monitoring |
| RU2018114958A (ru) | 2015-11-12 | 2019-12-13 | Авент, Инк. | Платформа для отслеживания результата лечения пациента |
| US11164596B2 (en) | 2016-02-25 | 2021-11-02 | Samsung Electronics Co., Ltd. | Sensor assisted evaluation of health and rehabilitation |
| US11404170B2 (en) | 2016-04-18 | 2022-08-02 | Soap, Inc. | Method and system for patients data collection and analysis |
| US10796715B1 (en) * | 2016-09-01 | 2020-10-06 | Arizona Board Of Regents On Behalf Of Arizona State University | Speech analysis algorithmic system and method for objective evaluation and/or disease detection |
| US10939821B2 (en) * | 2017-03-20 | 2021-03-09 | Applications Technology (Apptek), Llc | Systems and methods for diagnosing and analyzing concussions |
| WO2018204934A1 (en) | 2017-05-05 | 2018-11-08 | Canary Speech, LLC | Selecting speech features for building models for detecting medical conditions |
| US10614689B2 (en) | 2017-09-07 | 2020-04-07 | Ridgewood Technology Partners, LLC | Methods and systems for using pattern recognition to identify potential security threats |
-
2018
- 2018-05-07 WO PCT/US2018/031460 patent/WO2018204934A1/en not_active Ceased
- 2018-05-07 EP EP24206768.4A patent/EP4471801A3/en active Pending
- 2018-05-07 JP JP2020511875A patent/JP7208977B2/ja active Active
- 2018-05-07 ES ES18794955T patent/ES2988668T3/es active Active
- 2018-05-07 JP JP2020511874A patent/JP7208224B2/ja active Active
- 2018-05-07 EP EP24202331.5A patent/EP4468206A3/en active Pending
- 2018-05-07 EP EP18794955.7A patent/EP3618698B1/en active Active
- 2018-05-07 ES ES18794118T patent/ES2992090T3/es active Active
- 2018-05-07 US US15/973,498 patent/US10152988B2/en active Active
- 2018-05-07 US US15/973,504 patent/US10311980B2/en active Active
- 2018-05-07 WO PCT/US2018/031461 patent/WO2018204935A1/en not_active Ceased
- 2018-05-07 EP EP18794118.2A patent/EP3619657B1/en active Active
- 2018-11-13 US US16/189,997 patent/US10896765B2/en active Active
-
2019
- 2019-05-24 US US16/422,718 patent/US11348694B2/en active Active
-
2021
- 2021-01-18 US US17/151,632 patent/US11749414B2/en active Active
-
2022
- 2022-05-30 US US17/827,970 patent/US11756693B2/en active Active
- 2022-09-21 JP JP2022149805A patent/JP7812763B2/ja active Active
-
2023
- 2023-01-05 JP JP2023000544A patent/JP7566939B2/ja active Active
- 2023-07-05 US US18/347,382 patent/US12051513B2/en active Active
-
2024
- 2024-06-13 US US18/742,032 patent/US12444510B2/en active Active
- 2024-10-02 JP JP2024173193A patent/JP7804736B2/ja active Active
-
2025
- 2025-11-10 JP JP2025189216A patent/JP2026021546A/ja active Pending
- 2025-12-01 JP JP2025210605A patent/JP2026048727A/ja active Pending
-
2026
- 2026-01-09 JP JP2026002712A patent/JP2026050462A/ja active Pending
Also Published As
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP7804736B2 (ja) | 病状を検出するモデルを構築するための音声特徴の選択 | |
| US11545173B2 (en) | Automatic speech-based longitudinal emotion and mood recognition for mental health treatment | |
| Chien et al. | An automatic assessment system for Alzheimer’s disease based on speech using feature sequence generator and recurrent neural network | |
| ES3051515T3 (en) | Detection of cognitive impairment | |
| JP2023038924A (ja) | 音声を介して健康状態を診断するためのペアになったニューラルネットワーク | |
| Tasnim et al. | Cost-effective models for detecting depression from speech | |
| Triantafyllopoulos et al. | Distinguishing between pre-and post-treatment in the speech of patients with chronic obstructive pulmonary disease | |
| You et al. | Predicting dementia risk using paralinguistic and memory test features with machine learning models | |
| Triantafyllopoulos et al. | Introducing the COVID-19 YouTube (COVYT) speech dataset featuring the same speakers with and without infection | |
| Triantafyllopoulos et al. | COVYT: Introducing the Coronavirus YouTube and TikTok speech dataset featuring the same speakers with and without infection | |
| US20250140402A1 (en) | Techniques for speech language model training and application | |
| HK40120515A (en) | Selecting speech features for building models for detecting medical conditions | |
| López-Velázquez et al. | Automatic speech analysis for detecting cognitive impairment | |
| Zhu | Development of generalizable, interpretable, and privacy-preserving human-centric audio applications | |
| Perrone | Voice Classification in Parkinson’s Disease Using Transformer Models and Error Rate Metrics | |
| Daudet et al. | Experiences in Designing a Mobile Speech-Based Assessment Tool for Neurological Diseases | |
| HK40126980A (en) | Techniques for speech language model training and application |