ES2332741T3 - Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. - Google Patents

Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. Download PDF

Info

Publication number
ES2332741T3
ES2332741T3 ES06838989T ES06838989T ES2332741T3 ES 2332741 T3 ES2332741 T3 ES 2332741T3 ES 06838989 T ES06838989 T ES 06838989T ES 06838989 T ES06838989 T ES 06838989T ES 2332741 T3 ES2332741 T3 ES 2332741T3
Authority
ES
Spain
Prior art keywords
tree
sample
distance
samples
max
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES06838989T
Other languages
English (en)
Inventor
Christian Balderer
Chao Yuan
Claus Neubauer
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Siemens Corp
Original Assignee
Siemens Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Siemens Corp filed Critical Siemens Corp
Application granted granted Critical
Publication of ES2332741T3 publication Critical patent/ES2332741T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B17/00Systems involving the use of models or simulators of said systems
    • G05B17/02Systems involving the use of models or simulators of said systems electric
    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B23/00Testing or monitoring of control systems or parts thereof
    • G05B23/02Electric testing or monitoring
    • G05B23/0205Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults
    • G05B23/0218Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults
    • G05B23/0243Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults model based detection method, e.g. first-principles knowledge model
    • G05B23/0245Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults model based detection method, e.g. first-principles knowledge model based on a qualitative model, e.g. rule based; if-then decisions
    • G05B23/0248Causal models, e.g. fault tree; digraphs; qualitative physics
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/21Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
    • G06F18/214Generating training patterns; Bootstrap methods, e.g. bagging or boosting

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Automation & Control Theory (AREA)
  • Theoretical Computer Science (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Evolutionary Biology (AREA)
  • Evolutionary Computation (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • General Engineering & Computer Science (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Artificial Intelligence (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Testing And Monitoring For Control Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Alarm Systems (AREA)

Abstract

Procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto S de muestras de un sistema de monitorización de estados de máquina, siendo el conjunto seleccionado de datos de entrenamiento para su uso en el entrenamiento de un modelo estadístico para evaluar mediciones en el sistema de monitorización de estados de máquina, comprendiendo el procedimiento las etapas de: realizar las siguientes etapas para cada muestra p del conjunto S: calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en la que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S; si la distancia calculada es mayor que un umbral de distancia rmax, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd; repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia rmax, o bien el nodo del árbol kd no tiene hijos; y si ninguna distancia calculada está por debajo del umbral de distancia rmax, entoncesllenar una hoja siguiente en el árbol kd con p; y usar los nodos del árbol kd como el conjunto de datos de entrenamiento.

Description

Uso de agrupamiento secuencial para selección de instancias en monitorización de estados de máquina.
Referencia cruzada a solicitudes relacionadas
Esta solicitud reivindica el beneficio de la solicitud de patente provisional estadounidense número de serie
60/742.505 titulada "Use of Sequential Clustering for Instance Selection in Machine Condition Monitoring", ("Uso de agrupamiento secuencial para selección de instancias en monitorización de estados de máquina") presentada el 5 de diciembre de 2005.
Campo de la invención
La presente invención se refiere en general al campo de la monitorización de estados de máquina, y más en particular, a técnicas y sistemas para seleccionar instancias de entrenamiento representativas para su uso en el entrenamiento de un modelo estadístico para monitorización de estados de máquina.
El documento "Monitorización de estados con análisis de componentes independientes de campo medio" ("Condition monitoring with mean field independent components analysis") trata un procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto de muestras de un sistema de monitorización de estados de máquina.
Antecedentes de la invención
Muchas instalaciones de equipos de servicio y fabricación actuales incluyen, además de sistemas para controlar máquinas y procesos, sistemas para monitorización de estados de máquina. Los sistemas de monitorización de estados de máquina incluyen una disposición de sensores instalados en el equipo, una red de comunicaciones que enlaza esos sensores y un procesador conectado a la red para recibir señales desde los sensores y realizar determinaciones sobre estados de máquina a partir de esas señales.
El propósito de la monitorización de estados de máquina es detectar averías lo antes posible para evitar un daño adicional de las máquinas. Normalmente, se empleaban modelos físicos para describir la relación entre sensores que miden el rendimiento de una máquina. El incumplimiento de esas relaciones físicas podría indicar averías. Sin embargo, a menudo es difícil adquirir modelos físicos precisos.
Una alternativa al uso de modelos físicos es el uso de modelos estadísticos basándose en técnicas de aprendizaje asistido por ordenador. Ese enfoque ha adquirido un interés aumentado en las últimas décadas. A diferencia de un modelo físico, que supone relaciones de sensores conocidas, un modelo estadístico aprende las relaciones entre sensores a partir de datos históricos. Esa característica de los modelos estadísticos es una gran ventaja porque el mismo modelo genérico puede aplicarse a diferentes máquinas. Los modelos aprendidos difieren sólo en sus parámetros.
Hay dos tipos básicos de modelos estadísticos usados en monitorización de estados de máquina: un modelo basado en regresión y un modelo basado en clasificación. En un modelo de regresión, se usa un conjunto de sensores para predecir (o estimar) otro sensor. Puesto que un modelo de regresión puede producir una estimación continua, la desviación del valor real respecto a la estimación puede usarse directamente para el diagnóstico de averías. Por ejemplo, una lógica sencilla puede construirse como "cuanto mayor la desviación, mayor la posibilidad de una avería".
En un modelo basado en clasificación, la salida es discreta. Una aplicación de un modelo basado en clasificación es un detector fuera de intervalo, en el que a menudo se emplea un clasificador de una clase. Una salida de clasificador de una clase indica si hay un estado de fuera de intervalo o no.
Para poder usar modelos estadísticos para monitorización de estados de máquina, es necesario entrenar el modelo basándose en datos históricos etiquetados. En un modelo basado en clasificación, una etiqueta de punto de datos puede ser o bien "normal" (representando datos buenos) o bien "anómala" (representando datos que indican una avería).
Un enfoque de entrenamiento es incluir todos los datos disponibles en el conjunto de entrenamiento. La ventaja de un enfoque con todo incluido es que se espera que el modelo estadístico entrenado generalice bien, porque los datos de entrenamiento cubren la mayor parte de las variaciones que pueden producirse en el futuro. Sin embargo, en ese enfoque existen dos problemas. En primer lugar, puede haber demasiados datos de entrenamiento, haciendo que el proceso de entrenamiento requiera mucho tiempo o que incluso sea incontrolable. En segundo lugar, muchos de los datos pueden ser muy similares. No es necesario usar muestras de entrenamiento similares. Además, los datos similares pueden provocar un sobreentrenamiento si, durante el periodo de entrenamiento seleccionado, resulta que la máquina está funcionando en el mismo modo durante la mayor parte del tiempo. Un submuestreo sencillo puede solucionar el primero de los problemas anteriores, pero no el segundo. El submuestreo puede provocar también una pérdida de puntos de datos útiles. Un operario humano puede seleccionar manualmente instancias de entrenamiento; sin embargo, un proceso de este tipo es tedioso y también incontrolable si en un modelo están presentes múltiples sensores.
\global\parskip0.970000\baselineskip
Por tanto existe una necesidad de un procedimiento mejorado para seleccionar datos de entrenamiento. Un procedimiento mejorado de este tipo encontraría instancias de entrenamiento representativas y al mismo tiempo reduciría la redundancia de datos.
Un enfoque puede ser usar técnicas de agrupamiento convencionales para agrupar los datos de entrenamiento, y a continuación usar cada centro de grupo como una instancia seleccionada. Los dos algoritmos de agrupamiento usados con mayor frecuencia son el algoritmo de k-medias y el algoritmo de agrupamiento ISODATA. Ambos algoritmos son procedimientos iterativos. Para el algoritmo de k-medias en un inicio se seleccionan aleatoriamente k centros de grupo. Cada muestra de entrenamiento se asigna al grupo más próximo basándose en la distancia desde la muestra hasta el centro de grupo. Entonces se actualizan todos los centros de grupo basándose en las asignaciones nuevas. El proceso se repite hasta que converge.
El algoritmo ISODATA está más avanzado porque puede dividir y fusionar grupos. Un grupo se fusiona con otro grupo si el grupo es demasiado pequeño o muy próximo a otro grupo. Un grupo se divide si es demasiado grande o su desviación estándar supera un valor predefinido.
Sin embargo, ningún algoritmo es apropiado para su uso en la selección de datos de entrenamiento en la presente solicitud, por al menos dos razones. En primer lugar, tanto los algoritmos ISODATA como los de k-medias crean un punto de datos virtual, mientras que la presente solicitud requiere seleccionar un punto de datos real. En segundo lugar, ambos procedimientos de agrupamiento carecen de un control preciso del tamaño geométrico de cada grupo. Por ejemplo, la técnica puede producir una serie de grupos grandes. El centro de un grupo grande no es representativo de todos sus elementos, porque la distancia entre los elementos es demasiado grande.
Por tanto, actualmente existe la necesidad de un procedimiento para seleccionar datos de entrenamiento a partir de un conjunto de datos amplio. Ese procedimiento debería limitar el número de muestras de entrenamiento, mientras que garantiza que las muestras seleccionadas son representativas de los datos.
Sumario de la invención
La presente invención trata las necesidades descritas anteriormente proporcionando un procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto S de muestras de un sistema de monitorización de estados de máquina. El conjunto seleccionado de datos de entrenamiento es para su uso en el entrenamiento de un modelo estadístico para evaluar mediciones en el sistema de monitorización de estados de máquina.
Inicialmente el procedimiento realiza las siguientes etapas para cada muestra p del conjunto S: calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en la que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S; si la distancia calculada es mayor que un umbral de distancia r_{max}, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd; repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia r_{max}, o bien el nodo del árbol kd no tiene hijos; y si ninguna distancia calculada está por debajo del umbral de distancia r_{max}, entonces llenar una hoja siguiente en el árbol kd con p. Después de realizar las etapas en cada muestra p, se usan los nodos del árbol kd como el conjunto de datos de entrenamiento.
El procedimiento puede incluir además la etapa de aleatorizar un orden de las muestras p en el conjunto de entrenamiento S.
La distancia r_{max} puede determinarse como r_{max} = r_{0}\sqrt{\mathit{d}} donde r_{0} es una constante predeterminada y d es un número de sensores representados por la muestra s. r_{0} puede ajustarse de manera empírica a 1/33.
La etapa de realizar las etapas para cada muestra p del conjunto S puede comprender además retroceder en el árbol kd si un centro de grupo más próximo para una muestra p no está ubicado en el hipercubo del árbol kd especificado por el centro de grupo.
Otra realización de la invención es un procedimiento para entrenar un modelo estadístico para evaluar mediciones en un sistema de monitorización de estados de máquina, usando un conjunto S de muestras de datos del sistema de monitorización de estados de máquina. El procedimiento comprende las etapas de agrupar las muestras en S en una pluralidad de grupos comparando cada muestra p con un subconjunto de las demás muestras de S, seleccionándose el subconjunto de las demás muestras de S usando un árbol kd que tiene nodos correspondientes a muestras de datos de S; y entrenar el modelo estadístico usando un valor único a partir de cada grupo de la pluralidad de grupos.
En otra realización de la invención, se prevé un medio que puede utilizarse en un ordenador que tiene instrucciones legibles por ordenador almacenadas en el mismo para la ejecución por un procesador para realizar los procedimientos descritos anteriormente.
Breve descripción de los dibujos
La figura 1 es una ilustración esquemática de un sistema de monitorización de máquina según una realización de la invención.
\global\parskip1.000000\baselineskip
La figura 2 es un gráfico que muestra un árbol kd según una realización de la invención.
La figura 3 es un gráfico que muestra un espacio dividido por un árbol kd según una realización de la invención.
La figura 4 es un listado de pseudocódigo que representa un procedimiento según una realización de la invención.
La figura 5 es un diagrama que muestra el agrupamiento de datos usando un algoritmo de k-medias.
La figura 6 es un diagrama que muestra el agrupamiento de datos usando un procedimiento según una realización de la invención.
La figura 7 es un diagrama de flujo que representa un procedimiento según una realización de la invención.
Descripción de la invención
En la figura 1 se muestra un sistema 110 para monitorizar estados de máquinas 120, 130, 140 según una realización de la invención. El sistema incluye una pluralidad de sensores de máquina tales como los sensores 121A, 121B conectados a la máquina 120. Los sensores pueden ser, por ejemplo, acelerómetros, sensores de temperatura, sensores de flujo, sensores de posición, sensores de tasa, sensores químicos o cualquier sensor que mida un estado de una máquina o proceso. Los sensores miden estados elegidos porque están relacionados de maneras predecibles que reflejan la presencia o ausencia de estados de funcionamiento normales en una instalación 100.
Los sensores 121A, 121B están conectados a través de una red 150 de datos a una interfaz 118 de datos en el sistema 110 de monitorización de estados de máquina. Un procesador 116 recibe los datos de sensor desde la interfaz 118 de datos y realiza los procedimientos de monitorización de la invención. El procesador está conectado a medios 112 de almacenamiento para almacenar instrucciones legibles por ordenador que, cuando se ejecutan, realizan los procedimientos de monitorización. Los medios 112 de almacenamiento también pueden almacenar datos históricos recibidos desde los sensores 121A, 121B. Está prevista una interfaz 114 de usuario para comunicar los resultados a y recibir instrucciones desde un usuario.
La presente invención aplica un nuevo procedimiento de agrupamiento secuencial para seleccionar instancias de entrenamiento representativas. El procedimiento de agrupamiento limita el tamaño geométrico de cada grupo y evita por tanto los problemas de grupos grandes producidos por procedimientos de agrupamiento con k-medias o ISODATA. El procedimiento requiere sólo una exploración de todos los datos de entrenamiento, a diferencia de los procedimientos iterativos de los procedimientos de agrupamiento convencionales descritos anteriormente. El procedimiento utiliza además un árbol kd para acelerar además el proceso de agrupamiento.
Inicialmente, pueden normalizarse los datos de entrenamiento haciendo que los datos de cada sensor tengan una media de cero y tengan una desviación estándar de 1. Esto se hace para eliminar diferentes desfases y escalas presentes en diferentes sensores.
Ahora se describirá el procedimiento de agrupamiento. Supongamos que S indica el conjunto de entrenamiento original y p indica una muestra de entrenamiento en S. Un conjunto de instancias seleccionadas se indica como Q. r_{max} es un umbral de distancia. Inicialmente, Q está vacío.
Lo que sigue es un algoritmo según la invención para agrupamiento secuencial del vecino más próximo:
\quad
para cada p en S, realizar lo siguiente:
\quad
retirar p de S
\quad
si Q está vacío o la distancia de vecino más próximo entre p y cada instancia en Q > r_{max}, entonces
\quad
sumar p a Q.
\vskip1.000000\baselineskip
En el algoritmo anterior, r_{max} es un parámetro importante que indica el tamaño geométrico de cada grupo. En una realización preferida de la invención, r_{max} = r_{0}\sqrt{\mathit{d}}, donde r_{0} es una constante y d es la dimensión de datos (el número de sensores). Los inventores han escogido de manera empírica r_{0} = 1/33.
Para mejorar adicionalmente la velocidad del procedimiento, los inventores han empleado un algoritmo de árbol kd en la parte de búsqueda secuencial del vecino más próximo del algoritmo de agrupamiento descrito anteriormente.
Con referencia a las figuras 2 y 3 se describe un árbol kd. Un árbol kd es la generalización multidimensional de un árbol de búsqueda binario. Cada nodo en el árbol a modo de ejemplo de la figura 2 es una instancia de entrenamiento seleccionada. En el caso mostrado, [2, 5] es la primera muestra de entrenamiento en S; por tanto, se convierte en la raíz 210 del árbol 200 y también el primer centro de grupo. Cada nodo del árbol 200 define una división de todo el espacio d-dimensional.
En el primer nivel del árbol se divide (línea 310) el espacio 300 (figura 3) según la coordenada y, en el segundo nivel según la coordenada x (línea 320), etc. Para datos que tienen dimensiones mayores que dos, la tercera, cuarta y dimensiones mayores se usan para dividir a niveles posteriores. Un árbol kd divide todo el espacio en hipercubos separados y ofrece una capacidad de búsqueda rápida para ubicar un hipercubo que contiene una entrada.
Los inventores han integrado el algoritmo de árbol kd en el algoritmo de agrupamiento secuencial del vecino más próximo descrito anteriormente. Inicialmente, se aleatoriza el orden de las muestras de entrenamiento en S para eliminar la dependencia temporal para los valores de cada sensor. Ese procesamiento previo hace que los resultados se aproximen a un árbol binario equilibrado.
Para cada muestra de entrenamiento p en S, se calcula una distancia entre p y un nodo (inicialmente la raíz) del árbol kd. Si la distancia es menor que r_{max}, entonces se determina que p ya está representada por el nodo, y que se elimina p.
Si la distancia no es menor que r_{max}, entonces el procedimiento rastrea el árbol kd para ubicar el hipercubo en el que se encuentra p. Si p no pertenece a ninguno de los grupos existentes, p se convierte en una nueva hoja del árbol kd.
En la figura 4 se muestra una representación de pseudocódigo de un procedimiento según la invención. El procedimiento incorpora el algoritmo de árbol kd en el agrupamiento secuencial del vecino más próximo tratado anteriormente. Obsérvese que el centro de grupo más próximo para una entrada no está ubicado necesariamente en un hipercubo especificado por el centro de grupo. Por tanto es necesario realizar un cierto retroceso. Por ejemplo, en el árbol mostrado en la figura 3, una nueva entrada [3.1 5.1] seguiría la rama [2, 5] \rightarrow [3, 8] y no encontraría coincidencia. Sin embargo, esa entrada, está realmente muy próxima a y debería pertenecer al nodo [2, 5] por el que acaba de pasar. El retroceso garantiza una colocación correcta en una situación de este tipo.
Si se usa m para indicar el número promedio de retrocesos, todo el algoritmo necesita normalmente un tiempo O(n(log k+m)) para todos los n puntos de datos, siendo O una notación convencional que indica una cota superior asintótica. Sin el árbol kd, es necesario calcular una distancia desde p hasta cada uno de los centros de grupo. En ese caso, se requiere el tiempo O(nk). Puesto que normalmente k>>log k + m, el uso del árbol kd acelera significativamente el proceso de agrupamiento.
El procedimiento de la invención se comparó con una técnica de k-medias que usaba cuarenta y seis muestras de datos de entrenamiento bidimensionales (es decir, el tamaño de S es 46). Los resultados se muestran gráficamente en la figura 5 (el enfoque de k-medias) y la figura 6 (el procedimiento de la presente invención). El enfoque de agrupamiento de la presente invención selecciona automáticamente 16 instancias, mostradas dentro de los 16 círculos de igual radio en la figura 6. Los círculos tienen el radio r_{max} centrado en cada instancia.
Los resultados que aplican un algoritmo de k-medias con k = 16 a los datos se muestran en la figura 5. Para comparar con los resultados de la técnica descrita en este momento, se traza un círculo para cada centro de grupo de la figura. El radio de cada círculo es igual a la distancia máxima desde un elemento de grupo hasta el centro de grupo. La técnica de k-medias produce grupos que tienen una gran variación en los tamaños geométricos. El centro de grupo de un grupo muy grande no es representativo de sus elementos de grupo. Por ejemplo, varias muestras en el grupo más grande en la figura 5 deberían haberse seleccionado como instancias representativas. Puede observarse que el procedimiento de la presente invención produce instancias de entrenamiento más representativas.
En la figura 7 se muestra un diagrama de flujo 700 que muestra un procedimiento según una realización de la invención. El procedimiento comienza (etapa 705) comprobando (etapa 710) si el conjunto de muestras S está vacío. Si quedan muestras en el conjunto de muestras, se retira una única muestra p (etapa 715) del conjunto de muestras S para su procesamiento. El nodo raíz del árbol kd se selecciona inicialmente (etapa 720) como nodo de comparación. Inicialmente, el árbol kd está completamente vacío, en cuyo caso la primera muestra p se asigna como el nodo raíz (no mostrado), y el procedimiento continúa.
Se calcula una distancia D (etapa 725) desde la muestra p hasta el nodo de comparación (en la primera iteración, el nodo raíz). Si la distancia D no es mayor que la distancia umbral r_{max} (decisión 730), entonces eso indica que la muestra p ya está representada por el nodo de comparación y se elimina p (etapa 735) y el procedimiento vuelve a retirar otra muestra del conjunto S.
Si la distancia D es mayor que la distancia umbral r_{max} (decisión 730), entonces se determina si el nodo de comparación del árbol kd tiene un hijo que contenga p (decisión 740). Si no, entonces p se asigna como hijo del nodo de comparación (etapa 745) y el procedimiento vuelve a retirar otra muestra del conjunto S.
Si el nodo de comparación tiene hijos, entonces el hijo del nodo de comparación que contiene p se selecciona como el nodo de comparación, y el procedimiento continúa calculando otra distancia (etapa 725).
Una vez que se han procesado todas las muestras en el conjunto S (decisión 710), se usan los nodos del árbol kd resultante (etapa 760) como el conjunto de entrenamiento y el procedimiento termina (etapa 765).
La descripción detallada anterior debe entenderse a cualquier respecto como ilustrativa y a modo de ejemplo, pero no limitativa, y el alcance de la invención dado a conocer en el presente documento no debe determinarse a partir de la descripción de la invención, sino en su lugar a partir de las reivindicaciones interpretadas según toda la amplitud permitida por las leyes de patentes. Por ejemplo, aunque el procedimiento se da a conocer en el presente documento de forma que describe procedimientos de agrupamiento para preparar datos de entrenamiento para un sistema de monitorización de estados de máquina, el procedimiento puede usarse en cualquier sistema de evaluación estadística en el que deban agruparse datos, mientras permanece dentro del alcance de la invención. Debe entenderse que las realizaciones mostradas y descritas en el presente documento son sólo ilustrativas de los principios de la presente invención y que los expertos en la técnica pueden implementar diversas modificaciones sin apartarse del alcance de la invención.

Claims (17)

1. Procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto S de muestras de un sistema de monitorización de estados de máquina, siendo el conjunto seleccionado de datos de entrenamiento para su uso en el entrenamiento de un modelo estadístico para evaluar mediciones en el sistema de monitorización de estados de máquina, comprendiendo el procedimiento las etapas de:
realizar las siguientes etapas para cada muestra p del conjunto S:
\quad
calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en la que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S;
\quad
si la distancia calculada es mayor que un umbral de distancia r_{max}, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd;
\quad
repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia r_{max}, o bien el nodo del árbol kd no tiene hijos; y
\quad
si ninguna distancia calculada está por debajo del umbral de distancia r_{max}, entonces_{ }llenar una hoja siguiente en el árbol kd con p; y
usar los nodos del árbol kd como el conjunto de datos de entrenamiento.
\vskip1.000000\baselineskip
2. Procedimiento según la reivindicación 1, que comprende además la etapa de:
aleatorizar un orden de las muestras p en el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
3. Procedimiento según la reivindicación 1, en el que la distancia r_{max} se determina como
r_{max} = r_{0}\sqrt{\mathit{d}}
donde r_{0} es una constante predeterminada y d es un número de sensores representados por la muestra s.
\vskip1.000000\baselineskip
4. Procedimiento según la reivindicación 3, en el que r_{0} se ajusta a 1/33.
\vskip1.000000\baselineskip
5. Procedimiento según la reivindicación 1, la etapa de realizar las etapas para cada muestra p del conjunto S comprende además:
retroceder en el árbol kd si un centro de grupo más próximo para una muestra p no está ubicado en un hipercubo del árbol kd especificado por el centro de grupo.
6. Procedimiento para entrenar un modelo estadístico para evaluar mediciones en un sistema de monitorización de estados de máquina, usando un conjunto S de muestras de datos del sistema de monitorización de estados de máquina, comprendiendo el procedimiento las etapas de:
agrupar las muestras en S en una pluralidad de grupos comparando cada muestra p con un subconjunto de las demás muestras de S, seleccionándose el subconjunto de las demás muestras de S usando un árbol kd que tiene nodos correspondientes a muestras de datos de S; y
entrenar el modelo estadístico usando un valor único a partir de cada grupo de la pluralidad de grupos.
\vskip1.000000\baselineskip
7. Procedimiento según la reivindicación 6, en el que el valor único es una muestra de datos a partir del grupo.
\vskip1.000000\baselineskip
8. Procedimiento según la reivindicación 6, en el que la etapa de agrupar las muestras en S en una pluralidad de grupos comprende además la etapa de:
eliminar las muestras de datos que se encuentra que pertenecen a un grupo que ya tiene un elemento, por lo que cada grupo tiene un elemento.
\vskip1.000000\baselineskip
\global\parskip0.970000\baselineskip
9. Procedimiento según la reivindicación 6, que comprende además la etapa de:
aleatorizar un orden de las muestras de datos en el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
10. Procedimiento según la reivindicación 6, en el que la etapa de agrupar las muestras en S en una pluralidad de grupos comprende además la etapa de:
calcular una distancia desde cada muestra p hasta cada elemento del subconjunto de las demás muestras de S; y
comparar cada distancia con un umbral de distancia r_{max}.
\vskip1.000000\baselineskip
11. Procedimiento según la reivindicación 10, en el que la distancia r_{max} se determina como
r_{max} = r_{0}\sqrt{\mathit{d}}
donde r_{0} es una constante predeterminada y d es un número de sensores representados por la muestra s.
\vskip1.000000\baselineskip
12. Procedimiento según la reivindicación 11, en el que r_{0} se ajusta a 1/33.
13. Medio que puede utilizarse en un ordenador que tiene instrucciones legibles por ordenador almacenadas en el mismo para la ejecución por un procesador para realizar un procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto S de muestras de un sistema de monitorización de estados de máquina, siendo el conjunto seleccionado de datos de entrenamiento para su uso en el entrenamiento de un modelo estadístico para evaluar mediciones en el sistema de monitorización de estados de máquina, comprendiendo el procedimiento las etapas de:
realizar las siguientes etapas para cada muestra p del conjunto S:
\quad
calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en el que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S;
\quad
si la distancia calculada es mayor que un umbral de distancia r_{max}, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd;
\quad
repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia r_{max}, o bien el nodo del árbol kd no tiene hijos; y
\quad
si ninguna distancia calculada está por debajo del umbral de distancia r_{max}, entonces_{ }llenar una hoja siguiente en el árbol kd con p; y
usar los nodos del árbol kd como el conjunto de datos de entrenamiento.
\vskip1.000000\baselineskip
14. Medio que puede utilizarse en un ordenador según la reivindicación 13, que comprende además la etapa de:
aleatorizar un orden de las muestras p en el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
15. Medio que puede utilizarse en un ordenador según la reivindicación 13, en el que la distancia r_{max} se determina como
r_{max} = r_{0}\sqrt{\mathit{d}}
donde r_{0} es una constante predeterminada y d es un número de sensores representados por la muestra s.
\vskip1.000000\baselineskip
16. Medio que puede utilizarse en un ordenador según la reivindicación 15, en el que r_{0} se ajusta a 1/33.
17. Medio que puede utilizarse en un ordenador según la reivindicación 13, la etapa de realizar las siguientes etapas para cada muestra p del conjunto S comprende además:
retroceder en el árbol kd si un centro de grupo más próximo para una muestra p no está ubicado en un hipercubo del árbol kd especificado por el centro de grupo.
ES06838989T 2005-12-05 2006-12-05 Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. Active ES2332741T3 (es)

Applications Claiming Priority (4)

Application Number Priority Date Filing Date Title
US74250505P 2005-12-05 2005-12-05
US742505P 2005-12-05
US56580506A 2006-12-01 2006-12-01
US565805 2006-12-01

Publications (1)

Publication Number Publication Date
ES2332741T3 true ES2332741T3 (es) 2010-02-11

Family

ID=37814409

Family Applications (1)

Application Number Title Priority Date Filing Date
ES06838989T Active ES2332741T3 (es) 2005-12-05 2006-12-05 Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina.

Country Status (6)

Country Link
US (1) US7716152B2 (es)
EP (1) EP1958034B1 (es)
AT (1) ATE445870T1 (es)
DE (1) DE602006009839D1 (es)
ES (1) ES2332741T3 (es)
WO (1) WO2007067521A1 (es)

Families Citing this family (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2010047917A2 (en) * 2008-10-20 2010-04-29 Siemens Corporation Method and apparatus for creating state estimation models in machine condition monitoring
JP5955378B2 (ja) 2011-04-12 2016-07-20 トムソン ライセンシングThomson Licensing エンコード方法及びデコード方法
US8988238B2 (en) 2012-08-21 2015-03-24 General Electric Company Change detection system using frequency analysis and method
CN105825228B (zh) * 2016-03-14 2019-04-30 百度在线网络技术(北京)有限公司 图像识别方法及装置
WO2018140337A1 (en) * 2017-01-26 2018-08-02 Siemens Aktiengesellschaft A unifying semi-supervised approach for machine condition monitoring and fault diagnosis
DE102018205660A1 (de) * 2018-04-13 2019-10-17 Siemens Aktiengesellschaft Simulieren von statistisch modellierten Sensordaten
EP3861415B1 (en) * 2018-10-01 2023-06-14 ABB Schweiz AG Method and control system for detecting condition of plurality of process equipment in industrial plant
US11651276B2 (en) * 2019-10-31 2023-05-16 International Business Machines Corporation Artificial intelligence transparency
CN111177301B (zh) * 2019-11-26 2023-05-26 云南电网有限责任公司昆明供电局 一种关键信息识别提取方法及系统
CN111488829A (zh) * 2020-04-10 2020-08-04 广东电网有限责任公司江门供电局 杆塔巡检照片分类方法、装置、电子设备以及存储介质

Family Cites Families (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6052485A (en) * 1997-02-03 2000-04-18 The United States Of America As Represented By The Secretary Of The Navy Fractal features used with nearest neighbor clustering for identifying clutter in sonar images
US7233692B2 (en) * 2002-11-14 2007-06-19 Lockheed Martin Corporation Method and computer program product for identifying output classes with multi-modal dispersion in feature space and incorporating multi-modal structure into a pattern recognition system
US7769561B2 (en) * 2005-12-01 2010-08-03 Siemens Corporation Robust sensor correlation analysis for machine condition monitoring
US7567878B2 (en) * 2005-12-07 2009-07-28 Siemens Corporate Research, Inc. Evaluating anomaly for one class classifiers in machine condition monitoring
US7958062B2 (en) * 2006-05-31 2011-06-07 Lockheed Martin Corporation Method and system of creating health operating envelope for dynamic systems by unsupervised learning of a sequence of discrete event codes

Also Published As

Publication number Publication date
US20090043536A1 (en) 2009-02-12
DE602006009839D1 (de) 2009-11-26
ATE445870T1 (de) 2009-10-15
WO2007067521A1 (en) 2007-06-14
EP1958034B1 (en) 2009-10-14
US7716152B2 (en) 2010-05-11
EP1958034A1 (en) 2008-08-20

Similar Documents

Publication Publication Date Title
Kodandaramaiah Use of dispersal–vicariance analysis in biogeography–a critique
Mesgaran et al. Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models
Luo et al. Identifying infection sources and regions in large networks
ES2332741T3 (es) Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina.
ES2703573T3 (es) Procedimiento para detectar anomalías en una red de distribución, en particular de agua potable
CN112615888B (zh) 一种网络攻击行为的威胁评估方法及装置
Burbrink et al. When are adaptive radiations replicated in areas? Ecological opportunity and unexceptional diversification in West Indian dipsadine snakes (Colubridae: Alsophiini)
Millán-Roures et al. Detection of anomalies in water networks by functional data analysis
US20220067584A1 (en) Model generation apparatus, model generation method, computer-readable storage medium storing a model generation program, model generation system, inspection system, and monitoring system
Li et al. Geographically weighted elastic net: A variable-selection and modeling method under the spatially nonstationary condition
CN109450956A (zh) 网络安全性评估方法、系统、介质和计算设备
Zhao et al. Landscape-scale disturbances modified bird community dynamics in successional forest environment
Long The crux of the method: assumptions in ordinary least squares and logistic regression
Zheng et al. Adversarial graph neural network for multivariate time series anomaly detection
Ferreira et al. Modeling stream fish distributions using interval‐censored detection times
CN117906376B (zh) 一种回转窑碳排放量监测方法及系统
CN115392293A (zh) 变压器故障的监测方法、装置、计算机设备和存储介质
Hutchinson et al. An external memory data structure for shortest path queries
TW202044110A (zh) 無監督模型評估方法、裝置、伺服器及可讀儲存媒體
Szarmach et al. Multi-label classification for AIS data anomaly detection using wavelet transform
Grisi-Filho et al. Scale‐Free Networks with the Same Degree Distribution: Different Structural Properties
Chanda et al. Elevation determines the spatial risk of Anthrax outbreaks in Karnataka, India
CN113296992B (zh) 异常原因确定方法、装置、设备和存储介质
Whalen et al. Model aggregation for distributed content anomaly detection
KR20050061358A (ko) 네트워크 진단 방법, 네트워크 진단을 수행하는 코드를포함하는 컴퓨터 판독 가능 매체 및 시스템