ES2332741T3 - Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. - Google Patents
Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. Download PDFInfo
- Publication number
- ES2332741T3 ES2332741T3 ES06838989T ES06838989T ES2332741T3 ES 2332741 T3 ES2332741 T3 ES 2332741T3 ES 06838989 T ES06838989 T ES 06838989T ES 06838989 T ES06838989 T ES 06838989T ES 2332741 T3 ES2332741 T3 ES 2332741T3
- Authority
- ES
- Spain
- Prior art keywords
- tree
- sample
- distance
- samples
- max
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G05—CONTROLLING; REGULATING
- G05B—CONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
- G05B17/00—Systems involving the use of models or simulators of said systems
- G05B17/02—Systems involving the use of models or simulators of said systems electric
-
- G—PHYSICS
- G05—CONTROLLING; REGULATING
- G05B—CONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
- G05B23/00—Testing or monitoring of control systems or parts thereof
- G05B23/02—Electric testing or monitoring
- G05B23/0205—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults
- G05B23/0218—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults
- G05B23/0243—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults model based detection method, e.g. first-principles knowledge model
- G05B23/0245—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults model based detection method, e.g. first-principles knowledge model based on a qualitative model, e.g. rule based; if-then decisions
- G05B23/0248—Causal models, e.g. fault tree; digraphs; qualitative physics
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/20—Analysing
- G06F18/21—Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
- G06F18/214—Generating training patterns; Bootstrap methods, e.g. bagging or boosting
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- Automation & Control Theory (AREA)
- Theoretical Computer Science (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Evolutionary Biology (AREA)
- Evolutionary Computation (AREA)
- Computer Vision & Pattern Recognition (AREA)
- General Engineering & Computer Science (AREA)
- Bioinformatics & Computational Biology (AREA)
- Artificial Intelligence (AREA)
- Life Sciences & Earth Sciences (AREA)
- Testing And Monitoring For Control Systems (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Alarm Systems (AREA)
Abstract
Procedimiento para seleccionar un conjunto de datos de entrenamiento a partir de un conjunto S de muestras de un sistema de monitorización de estados de máquina, siendo el conjunto seleccionado de datos de entrenamiento para su uso en el entrenamiento de un modelo estadístico para evaluar mediciones en el sistema de monitorización de estados de máquina, comprendiendo el procedimiento las etapas de: realizar las siguientes etapas para cada muestra p del conjunto S: calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en la que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S; si la distancia calculada es mayor que un umbral de distancia rmax, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd; repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia rmax, o bien el nodo del árbol kd no tiene hijos; y si ninguna distancia calculada está por debajo del umbral de distancia rmax, entoncesllenar una hoja siguiente en el árbol kd con p; y usar los nodos del árbol kd como el conjunto de datos de entrenamiento.
Description
Uso de agrupamiento secuencial para selección de
instancias en monitorización de estados de máquina.
Esta solicitud reivindica el beneficio de la
solicitud de patente provisional estadounidense número de
serie
60/742.505 titulada "Use of Sequential Clustering for Instance Selection in Machine Condition Monitoring", ("Uso de agrupamiento secuencial para selección de instancias en monitorización de estados de máquina") presentada el 5 de diciembre de 2005.
60/742.505 titulada "Use of Sequential Clustering for Instance Selection in Machine Condition Monitoring", ("Uso de agrupamiento secuencial para selección de instancias en monitorización de estados de máquina") presentada el 5 de diciembre de 2005.
La presente invención se refiere en general al
campo de la monitorización de estados de máquina, y más en
particular, a técnicas y sistemas para seleccionar instancias de
entrenamiento representativas para su uso en el entrenamiento de un
modelo estadístico para monitorización de estados de máquina.
El documento "Monitorización de estados con
análisis de componentes independientes de campo medio"
("Condition monitoring with mean field independent components
analysis") trata un procedimiento para seleccionar un
conjunto de datos de entrenamiento a partir de un conjunto de
muestras de un sistema de monitorización de estados de máquina.
Muchas instalaciones de equipos de servicio y
fabricación actuales incluyen, además de sistemas para controlar
máquinas y procesos, sistemas para monitorización de estados de
máquina. Los sistemas de monitorización de estados de máquina
incluyen una disposición de sensores instalados en el equipo, una
red de comunicaciones que enlaza esos sensores y un procesador
conectado a la red para recibir señales desde los sensores y
realizar determinaciones sobre estados de máquina a partir de esas
señales.
El propósito de la monitorización de estados de
máquina es detectar averías lo antes posible para evitar un daño
adicional de las máquinas. Normalmente, se empleaban modelos físicos
para describir la relación entre sensores que miden el rendimiento
de una máquina. El incumplimiento de esas relaciones físicas podría
indicar averías. Sin embargo, a menudo es difícil adquirir modelos
físicos precisos.
Una alternativa al uso de modelos físicos es el
uso de modelos estadísticos basándose en técnicas de aprendizaje
asistido por ordenador. Ese enfoque ha adquirido un interés
aumentado en las últimas décadas. A diferencia de un modelo físico,
que supone relaciones de sensores conocidas, un modelo estadístico
aprende las relaciones entre sensores a partir de datos históricos.
Esa característica de los modelos estadísticos es una gran ventaja
porque el mismo modelo genérico puede aplicarse a diferentes
máquinas. Los modelos aprendidos difieren sólo en sus
parámetros.
Hay dos tipos básicos de modelos estadísticos
usados en monitorización de estados de máquina: un modelo basado en
regresión y un modelo basado en clasificación. En un modelo de
regresión, se usa un conjunto de sensores para predecir (o estimar)
otro sensor. Puesto que un modelo de regresión puede producir una
estimación continua, la desviación del valor real respecto a la
estimación puede usarse directamente para el diagnóstico de averías.
Por ejemplo, una lógica sencilla puede construirse como "cuanto
mayor la desviación, mayor la posibilidad de una avería".
En un modelo basado en clasificación, la salida
es discreta. Una aplicación de un modelo basado en clasificación es
un detector fuera de intervalo, en el que a menudo se emplea un
clasificador de una clase. Una salida de clasificador de una clase
indica si hay un estado de fuera de intervalo o no.
Para poder usar modelos estadísticos para
monitorización de estados de máquina, es necesario entrenar el
modelo basándose en datos históricos etiquetados. En un modelo
basado en clasificación, una etiqueta de punto de datos puede ser o
bien "normal" (representando datos buenos) o bien
"anómala" (representando datos que indican una avería).
Un enfoque de entrenamiento es incluir todos los
datos disponibles en el conjunto de entrenamiento. La ventaja de un
enfoque con todo incluido es que se espera que el modelo estadístico
entrenado generalice bien, porque los datos de entrenamiento cubren
la mayor parte de las variaciones que pueden producirse en el
futuro. Sin embargo, en ese enfoque existen dos problemas. En
primer lugar, puede haber demasiados datos de entrenamiento,
haciendo que el proceso de entrenamiento requiera mucho tiempo o que
incluso sea incontrolable. En segundo lugar, muchos de los datos
pueden ser muy similares. No es necesario usar muestras de
entrenamiento similares. Además, los datos similares pueden
provocar un sobreentrenamiento si, durante el periodo de
entrenamiento seleccionado, resulta que la máquina está funcionando
en el mismo modo durante la mayor parte del tiempo. Un submuestreo
sencillo puede solucionar el primero de los problemas anteriores,
pero no el segundo. El submuestreo puede provocar también una
pérdida de puntos de datos útiles. Un operario humano puede
seleccionar manualmente instancias de entrenamiento; sin embargo,
un proceso de este tipo es tedioso y también incontrolable si en un
modelo están presentes múltiples sensores.
\global\parskip0.970000\baselineskip
Por tanto existe una necesidad de un
procedimiento mejorado para seleccionar datos de entrenamiento. Un
procedimiento mejorado de este tipo encontraría instancias de
entrenamiento representativas y al mismo tiempo reduciría la
redundancia de datos.
Un enfoque puede ser usar técnicas de
agrupamiento convencionales para agrupar los datos de entrenamiento,
y a continuación usar cada centro de grupo como una instancia
seleccionada. Los dos algoritmos de agrupamiento usados con mayor
frecuencia son el algoritmo de k-medias y el algoritmo de
agrupamiento ISODATA. Ambos algoritmos son procedimientos
iterativos. Para el algoritmo de k-medias en un inicio se
seleccionan aleatoriamente k centros de grupo. Cada muestra
de entrenamiento se asigna al grupo más próximo basándose en la
distancia desde la muestra hasta el centro de grupo. Entonces se
actualizan todos los centros de grupo basándose en las asignaciones
nuevas. El proceso se repite hasta que converge.
El algoritmo ISODATA está más avanzado porque
puede dividir y fusionar grupos. Un grupo se fusiona con otro grupo
si el grupo es demasiado pequeño o muy próximo a otro grupo. Un
grupo se divide si es demasiado grande o su desviación estándar
supera un valor predefinido.
Sin embargo, ningún algoritmo es apropiado para
su uso en la selección de datos de entrenamiento en la presente
solicitud, por al menos dos razones. En primer lugar, tanto los
algoritmos ISODATA como los de k-medias crean un punto de
datos virtual, mientras que la presente solicitud requiere
seleccionar un punto de datos real. En segundo lugar, ambos
procedimientos de agrupamiento carecen de un control preciso del
tamaño geométrico de cada grupo. Por ejemplo, la técnica puede
producir una serie de grupos grandes. El centro de un grupo grande
no es representativo de todos sus elementos, porque la distancia
entre los elementos es demasiado grande.
Por tanto, actualmente existe la necesidad de un
procedimiento para seleccionar datos de entrenamiento a partir de
un conjunto de datos amplio. Ese procedimiento debería limitar el
número de muestras de entrenamiento, mientras que garantiza que las
muestras seleccionadas son representativas de los datos.
La presente invención trata las necesidades
descritas anteriormente proporcionando un procedimiento para
seleccionar un conjunto de datos de entrenamiento a partir de un
conjunto S de muestras de un sistema de monitorización de
estados de máquina. El conjunto seleccionado de datos de
entrenamiento es para su uso en el entrenamiento de un modelo
estadístico para evaluar mediciones en el sistema de monitorización
de estados de máquina.
Inicialmente el procedimiento realiza las
siguientes etapas para cada muestra p del conjunto S:
calcular una distancia desde la muestra p hasta un nodo de
un árbol kd, en la que cada nodo del árbol kd está
vacío o representa otra muestra retirada del conjunto S; si
la distancia calculada es mayor que un umbral de distancia
r_{max}, y el nodo del árbol kd tiene hijos,
calcular una distancia desde la muestra p hasta un hijo del
nodo seleccionado según una clasificación de p en el árbol
kd; repetir la etapa anterior hasta que o bien la distancia
calculada está por debajo del umbral de distancia r_{max},
o bien el nodo del árbol kd no tiene hijos; y si ninguna
distancia calculada está por debajo del umbral de distancia
r_{max}, entonces llenar una hoja siguiente en el árbol
kd con p. Después de realizar las etapas en cada
muestra p, se usan los nodos del árbol kd como el
conjunto de datos de entrenamiento.
El procedimiento puede incluir además la etapa
de aleatorizar un orden de las muestras p en el conjunto de
entrenamiento S.
La distancia r_{max} puede determinarse
como r_{max} = r_{0}\sqrt{\mathit{d}} donde
r_{0} es una constante predeterminada y d es un
número de sensores representados por la muestra s.
r_{0} puede ajustarse de manera empírica a 1/33.
La etapa de realizar las etapas para cada
muestra p del conjunto S puede comprender además
retroceder en el árbol kd si un centro de grupo más próximo
para una muestra p no está ubicado en el hipercubo del árbol
kd especificado por el centro de grupo.
Otra realización de la invención es un
procedimiento para entrenar un modelo estadístico para evaluar
mediciones en un sistema de monitorización de estados de máquina,
usando un conjunto S de muestras de datos del sistema de
monitorización de estados de máquina. El procedimiento comprende las
etapas de agrupar las muestras en S en una pluralidad de
grupos comparando cada muestra p con un subconjunto de las
demás muestras de S, seleccionándose el subconjunto de las
demás muestras de S usando un árbol kd que tiene nodos
correspondientes a muestras de datos de S; y entrenar el
modelo estadístico usando un valor único a partir de cada grupo de
la pluralidad de grupos.
En otra realización de la invención, se prevé un
medio que puede utilizarse en un ordenador que tiene instrucciones
legibles por ordenador almacenadas en el mismo para la ejecución por
un procesador para realizar los procedimientos descritos
anteriormente.
La figura 1 es una ilustración esquemática de un
sistema de monitorización de máquina según una realización de la
invención.
\global\parskip1.000000\baselineskip
La figura 2 es un gráfico que muestra un árbol
kd según una realización de la invención.
La figura 3 es un gráfico que muestra un espacio
dividido por un árbol kd según una realización de la
invención.
La figura 4 es un listado de pseudocódigo que
representa un procedimiento según una realización de la
invención.
La figura 5 es un diagrama que muestra el
agrupamiento de datos usando un algoritmo de k-medias.
La figura 6 es un diagrama que muestra el
agrupamiento de datos usando un procedimiento según una realización
de la invención.
La figura 7 es un diagrama de flujo que
representa un procedimiento según una realización de la
invención.
En la figura 1 se muestra un sistema 110 para
monitorizar estados de máquinas 120, 130, 140 según una realización
de la invención. El sistema incluye una pluralidad de sensores de
máquina tales como los sensores 121A, 121B conectados a la máquina
120. Los sensores pueden ser, por ejemplo, acelerómetros, sensores
de temperatura, sensores de flujo, sensores de posición, sensores
de tasa, sensores químicos o cualquier sensor que mida un estado de
una máquina o proceso. Los sensores miden estados elegidos porque
están relacionados de maneras predecibles que reflejan la presencia
o ausencia de estados de funcionamiento normales en una instalación
100.
Los sensores 121A, 121B están conectados a
través de una red 150 de datos a una interfaz 118 de datos en el
sistema 110 de monitorización de estados de máquina. Un procesador
116 recibe los datos de sensor desde la interfaz 118 de datos y
realiza los procedimientos de monitorización de la invención. El
procesador está conectado a medios 112 de almacenamiento para
almacenar instrucciones legibles por ordenador que, cuando se
ejecutan, realizan los procedimientos de monitorización. Los medios
112 de almacenamiento también pueden almacenar datos históricos
recibidos desde los sensores 121A, 121B. Está prevista una interfaz
114 de usuario para comunicar los resultados a y recibir
instrucciones desde un usuario.
La presente invención aplica un nuevo
procedimiento de agrupamiento secuencial para seleccionar instancias
de entrenamiento representativas. El procedimiento de agrupamiento
limita el tamaño geométrico de cada grupo y evita por tanto los
problemas de grupos grandes producidos por procedimientos de
agrupamiento con k-medias o ISODATA. El procedimiento
requiere sólo una exploración de todos los datos de entrenamiento, a
diferencia de los procedimientos iterativos de los procedimientos
de agrupamiento convencionales descritos anteriormente. El
procedimiento utiliza además un árbol kd para acelerar además
el proceso de agrupamiento.
Inicialmente, pueden normalizarse los datos de
entrenamiento haciendo que los datos de cada sensor tengan una
media de cero y tengan una desviación estándar de 1. Esto se hace
para eliminar diferentes desfases y escalas presentes en diferentes
sensores.
Ahora se describirá el procedimiento de
agrupamiento. Supongamos que S indica el conjunto de
entrenamiento original y p indica una muestra de
entrenamiento en S. Un conjunto de instancias seleccionadas
se indica como Q. r_{max} es un umbral de
distancia. Inicialmente, Q está vacío.
Lo que sigue es un algoritmo según la invención
para agrupamiento secuencial del vecino más próximo:
- \quad
- para cada p en S, realizar lo siguiente:
- \quad
- retirar p de S
- \quad
- si Q está vacío o la distancia de vecino más próximo entre p y cada instancia en Q > r_{max}, entonces
- \quad
- sumar p a Q.
\vskip1.000000\baselineskip
En el algoritmo anterior, r_{max} es un
parámetro importante que indica el tamaño geométrico de cada grupo.
En una realización preferida de la invención, r_{max} =
r_{0}\sqrt{\mathit{d}}, donde r_{0} es una
constante y d es la dimensión de datos (el número de
sensores). Los inventores han escogido de manera empírica
r_{0} = 1/33.
Para mejorar adicionalmente la velocidad del
procedimiento, los inventores han empleado un algoritmo de árbol
kd en la parte de búsqueda secuencial del vecino más próximo
del algoritmo de agrupamiento descrito anteriormente.
Con referencia a las figuras 2 y 3 se describe
un árbol kd. Un árbol kd es la generalización
multidimensional de un árbol de búsqueda binario. Cada nodo en el
árbol a modo de ejemplo de la figura 2 es una instancia de
entrenamiento seleccionada. En el caso mostrado, [2, 5] es la
primera muestra de entrenamiento en S; por tanto, se
convierte en la raíz 210 del árbol 200 y también el primer centro de
grupo. Cada nodo del árbol 200 define una división de todo el
espacio d-dimensional.
En el primer nivel del árbol se divide (línea
310) el espacio 300 (figura 3) según la coordenada y, en el
segundo nivel según la coordenada x (línea 320), etc. Para
datos que tienen dimensiones mayores que dos, la tercera, cuarta y
dimensiones mayores se usan para dividir a niveles posteriores. Un
árbol kd divide todo el espacio en hipercubos separados y
ofrece una capacidad de búsqueda rápida para ubicar un hipercubo
que contiene una entrada.
Los inventores han integrado el algoritmo de
árbol kd en el algoritmo de agrupamiento secuencial del
vecino más próximo descrito anteriormente. Inicialmente, se
aleatoriza el orden de las muestras de entrenamiento en S
para eliminar la dependencia temporal para los valores de cada
sensor. Ese procesamiento previo hace que los resultados se
aproximen a un árbol binario equilibrado.
Para cada muestra de entrenamiento p en
S, se calcula una distancia entre p y un nodo
(inicialmente la raíz) del árbol kd. Si la distancia es
menor que r_{max}, entonces se determina que p ya
está representada por el nodo, y que se elimina p.
Si la distancia no es menor que
r_{max}, entonces el procedimiento rastrea el árbol
kd para ubicar el hipercubo en el que se encuentra p.
Si p no pertenece a ninguno de los grupos existentes,
p se convierte en una nueva hoja del árbol kd.
En la figura 4 se muestra una representación de
pseudocódigo de un procedimiento según la invención. El
procedimiento incorpora el algoritmo de árbol kd en el
agrupamiento secuencial del vecino más próximo tratado
anteriormente. Obsérvese que el centro de grupo más próximo para
una entrada no está ubicado necesariamente en un hipercubo
especificado por el centro de grupo. Por tanto es necesario realizar
un cierto retroceso. Por ejemplo, en el árbol mostrado en la figura
3, una nueva entrada [3.1 5.1] seguiría la rama [2, 5] \rightarrow
[3, 8] y no encontraría coincidencia. Sin embargo, esa entrada,
está realmente muy próxima a y debería pertenecer al nodo [2, 5]
por el que acaba de pasar. El retroceso garantiza una colocación
correcta en una situación de este tipo.
Si se usa m para indicar el número
promedio de retrocesos, todo el algoritmo necesita normalmente un
tiempo O(n(log k+m)) para todos los n
puntos de datos, siendo O una notación convencional que
indica una cota superior asintótica. Sin el árbol kd, es
necesario calcular una distancia desde p hasta cada uno de
los centros de grupo. En ese caso, se requiere el tiempo
O(nk). Puesto que normalmente k>>log
k + m, el uso del árbol kd acelera
significativamente el proceso de agrupamiento.
El procedimiento de la invención se comparó con
una técnica de k-medias que usaba cuarenta y seis muestras
de datos de entrenamiento bidimensionales (es decir, el tamaño de
S es 46). Los resultados se muestran gráficamente en la
figura 5 (el enfoque de k-medias) y la figura 6 (el
procedimiento de la presente invención). El enfoque de agrupamiento
de la presente invención selecciona automáticamente 16 instancias,
mostradas dentro de los 16 círculos de igual radio en la figura 6.
Los círculos tienen el radio r_{max} centrado en cada
instancia.
Los resultados que aplican un algoritmo de
k-medias con k = 16 a los datos se muestran en la
figura 5. Para comparar con los resultados de la técnica descrita
en este momento, se traza un círculo para cada centro de grupo de
la figura. El radio de cada círculo es igual a la distancia máxima
desde un elemento de grupo hasta el centro de grupo. La técnica de
k-medias produce grupos que tienen una gran variación en los
tamaños geométricos. El centro de grupo de un grupo muy grande no es
representativo de sus elementos de grupo. Por ejemplo, varias
muestras en el grupo más grande en la figura 5 deberían haberse
seleccionado como instancias representativas. Puede observarse que
el procedimiento de la presente invención produce instancias de
entrenamiento más representativas.
En la figura 7 se muestra un diagrama de flujo
700 que muestra un procedimiento según una realización de la
invención. El procedimiento comienza (etapa 705) comprobando (etapa
710) si el conjunto de muestras S está vacío. Si quedan
muestras en el conjunto de muestras, se retira una única muestra
p (etapa 715) del conjunto de muestras S para su
procesamiento. El nodo raíz del árbol kd se selecciona
inicialmente (etapa 720) como nodo de comparación. Inicialmente, el
árbol kd está completamente vacío, en cuyo caso la primera
muestra p se asigna como el nodo raíz (no mostrado), y el
procedimiento continúa.
Se calcula una distancia D (etapa 725)
desde la muestra p hasta el nodo de comparación (en la
primera iteración, el nodo raíz). Si la distancia D no es
mayor que la distancia umbral r_{max} (decisión 730),
entonces eso indica que la muestra p ya está representada por
el nodo de comparación y se elimina p (etapa 735) y el
procedimiento vuelve a retirar otra muestra del conjunto
S.
Si la distancia D es mayor que la distancia
umbral r_{max} (decisión 730), entonces se determina si el
nodo de comparación del árbol kd tiene un hijo que contenga
p (decisión 740). Si no, entonces p se asigna como
hijo del nodo de comparación (etapa 745) y el procedimiento vuelve a
retirar otra muestra del conjunto S.
Si el nodo de comparación tiene hijos, entonces
el hijo del nodo de comparación que contiene p se selecciona
como el nodo de comparación, y el procedimiento continúa calculando
otra distancia (etapa 725).
Una vez que se han procesado todas las muestras
en el conjunto S (decisión 710), se usan los nodos del árbol
kd resultante (etapa 760) como el conjunto de entrenamiento y
el procedimiento termina (etapa 765).
La descripción detallada anterior debe
entenderse a cualquier respecto como ilustrativa y a modo de
ejemplo, pero no limitativa, y el alcance de la invención dado a
conocer en el presente documento no debe determinarse a partir de
la descripción de la invención, sino en su lugar a partir de las
reivindicaciones interpretadas según toda la amplitud permitida por
las leyes de patentes. Por ejemplo, aunque el procedimiento se da a
conocer en el presente documento de forma que describe
procedimientos de agrupamiento para preparar datos de entrenamiento
para un sistema de monitorización de estados de máquina, el
procedimiento puede usarse en cualquier sistema de evaluación
estadística en el que deban agruparse datos, mientras permanece
dentro del alcance de la invención. Debe entenderse que las
realizaciones mostradas y descritas en el presente documento son
sólo ilustrativas de los principios de la presente invención y que
los expertos en la técnica pueden implementar diversas
modificaciones sin apartarse del alcance de la invención.
Claims (17)
1. Procedimiento para seleccionar un conjunto de
datos de entrenamiento a partir de un conjunto S de muestras
de un sistema de monitorización de estados de máquina, siendo el
conjunto seleccionado de datos de entrenamiento para su uso en el
entrenamiento de un modelo estadístico para evaluar mediciones en el
sistema de monitorización de estados de máquina, comprendiendo el
procedimiento las etapas de:
realizar las siguientes etapas para cada muestra
p del conjunto S:
- \quad
- calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en la que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S;
- \quad
- si la distancia calculada es mayor que un umbral de distancia r_{max}, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd;
- \quad
- repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia r_{max}, o bien el nodo del árbol kd no tiene hijos; y
- \quad
- si ninguna distancia calculada está por debajo del umbral de distancia r_{max}, entonces_{ }llenar una hoja siguiente en el árbol kd con p; y
usar los nodos del árbol kd como el
conjunto de datos de entrenamiento.
\vskip1.000000\baselineskip
2. Procedimiento según la reivindicación 1, que
comprende además la etapa de:
aleatorizar un orden de las muestras p en
el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
3. Procedimiento según la reivindicación 1, en
el que la distancia r_{max} se determina como
r_{max} =
r_{0}\sqrt{\mathit{d}}
donde r_{0} es una
constante predeterminada y d es un número de sensores
representados por la muestra
s.
\vskip1.000000\baselineskip
4. Procedimiento según la reivindicación 3, en
el que r_{0} se ajusta a 1/33.
\vskip1.000000\baselineskip
5. Procedimiento según la reivindicación 1, la
etapa de realizar las etapas para cada muestra p del conjunto
S comprende además:
retroceder en el árbol kd si un centro de
grupo más próximo para una muestra p no está ubicado en un hipercubo
del árbol kd especificado por el centro de grupo.
6. Procedimiento para entrenar un modelo
estadístico para evaluar mediciones en un sistema de monitorización
de estados de máquina, usando un conjunto S de muestras de
datos del sistema de monitorización de estados de máquina,
comprendiendo el procedimiento las etapas de:
agrupar las muestras en S en una
pluralidad de grupos comparando cada muestra p con un
subconjunto de las demás muestras de S, seleccionándose el
subconjunto de las demás muestras de S usando un árbol
kd que tiene nodos correspondientes a muestras de datos de
S; y
entrenar el modelo estadístico usando un valor
único a partir de cada grupo de la pluralidad de grupos.
\vskip1.000000\baselineskip
7. Procedimiento según la reivindicación 6, en
el que el valor único es una muestra de datos a partir del
grupo.
\vskip1.000000\baselineskip
8. Procedimiento según la reivindicación 6, en
el que la etapa de agrupar las muestras en S en una
pluralidad de grupos comprende además la etapa de:
eliminar las muestras de datos que se encuentra
que pertenecen a un grupo que ya tiene un elemento, por lo que cada
grupo tiene un elemento.
\vskip1.000000\baselineskip
\global\parskip0.970000\baselineskip
9. Procedimiento según la reivindicación 6, que
comprende además la etapa de:
aleatorizar un orden de las muestras de datos en
el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
10. Procedimiento según la reivindicación 6, en
el que la etapa de agrupar las muestras en S en una
pluralidad de grupos comprende además la etapa de:
calcular una distancia desde cada muestra
p hasta cada elemento del subconjunto de las demás muestras
de S; y
comparar cada distancia con un umbral de
distancia r_{max}.
\vskip1.000000\baselineskip
11. Procedimiento según la reivindicación 10, en
el que la distancia r_{max} se determina como
r_{max} =
r_{0}\sqrt{\mathit{d}}
donde r_{0} es una
constante predeterminada y d es un número de sensores
representados por la muestra
s.
\vskip1.000000\baselineskip
12. Procedimiento según la reivindicación 11, en
el que r_{0} se ajusta a 1/33.
13. Medio que puede utilizarse en un ordenador
que tiene instrucciones legibles por ordenador almacenadas en el
mismo para la ejecución por un procesador para realizar un
procedimiento para seleccionar un conjunto de datos de
entrenamiento a partir de un conjunto S de muestras de un
sistema de monitorización de estados de máquina, siendo el conjunto
seleccionado de datos de entrenamiento para su uso en el
entrenamiento de un modelo estadístico para evaluar mediciones en
el sistema de monitorización de estados de máquina, comprendiendo
el procedimiento las etapas de:
realizar las siguientes etapas para cada muestra
p del conjunto S:
- \quad
- calcular una distancia desde la muestra p hasta un nodo de un árbol kd, en el que cada nodo del árbol kd está vacío o representa otra muestra retirada del conjunto S;
- \quad
- si la distancia calculada es mayor que un umbral de distancia r_{max}, y el nodo del árbol kd tiene hijos, calcular una distancia desde la muestra p hasta un hijo del nodo seleccionado según una clasificación de p en el árbol kd;
- \quad
- repetir la etapa anterior hasta que o bien la distancia calculada está por debajo del umbral de distancia r_{max}, o bien el nodo del árbol kd no tiene hijos; y
- \quad
- si ninguna distancia calculada está por debajo del umbral de distancia r_{max}, entonces_{ }llenar una hoja siguiente en el árbol kd con p; y
usar los nodos del árbol kd como el
conjunto de datos de entrenamiento.
\vskip1.000000\baselineskip
14. Medio que puede utilizarse en un ordenador
según la reivindicación 13, que comprende además la etapa de:
aleatorizar un orden de las muestras p en
el conjunto de entrenamiento S.
\vskip1.000000\baselineskip
15. Medio que puede utilizarse en un ordenador
según la reivindicación 13, en el que la distancia r_{max} se
determina como
r_{max} =
r_{0}\sqrt{\mathit{d}}
donde r_{0} es una
constante predeterminada y d es un número de sensores
representados por la muestra
s.
\vskip1.000000\baselineskip
16. Medio que puede utilizarse en un ordenador
según la reivindicación 15, en el que r_{0} se ajusta a 1/33.
17. Medio que puede utilizarse en un ordenador
según la reivindicación 13, la etapa de realizar las siguientes
etapas para cada muestra p del conjunto S comprende
además:
retroceder en el árbol kd si un centro de
grupo más próximo para una muestra p no está ubicado en un hipercubo
del árbol kd especificado por el centro de grupo.
Applications Claiming Priority (4)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US74250505P | 2005-12-05 | 2005-12-05 | |
| US742505P | 2005-12-05 | ||
| US56580506A | 2006-12-01 | 2006-12-01 | |
| US565805 | 2006-12-01 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2332741T3 true ES2332741T3 (es) | 2010-02-11 |
Family
ID=37814409
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES06838989T Active ES2332741T3 (es) | 2005-12-05 | 2006-12-05 | Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. |
Country Status (6)
| Country | Link |
|---|---|
| US (1) | US7716152B2 (es) |
| EP (1) | EP1958034B1 (es) |
| AT (1) | ATE445870T1 (es) |
| DE (1) | DE602006009839D1 (es) |
| ES (1) | ES2332741T3 (es) |
| WO (1) | WO2007067521A1 (es) |
Families Citing this family (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2010047917A2 (en) * | 2008-10-20 | 2010-04-29 | Siemens Corporation | Method and apparatus for creating state estimation models in machine condition monitoring |
| JP5955378B2 (ja) | 2011-04-12 | 2016-07-20 | トムソン ライセンシングThomson Licensing | エンコード方法及びデコード方法 |
| US8988238B2 (en) | 2012-08-21 | 2015-03-24 | General Electric Company | Change detection system using frequency analysis and method |
| CN105825228B (zh) * | 2016-03-14 | 2019-04-30 | 百度在线网络技术(北京)有限公司 | 图像识别方法及装置 |
| WO2018140337A1 (en) * | 2017-01-26 | 2018-08-02 | Siemens Aktiengesellschaft | A unifying semi-supervised approach for machine condition monitoring and fault diagnosis |
| DE102018205660A1 (de) * | 2018-04-13 | 2019-10-17 | Siemens Aktiengesellschaft | Simulieren von statistisch modellierten Sensordaten |
| EP3861415B1 (en) * | 2018-10-01 | 2023-06-14 | ABB Schweiz AG | Method and control system for detecting condition of plurality of process equipment in industrial plant |
| US11651276B2 (en) * | 2019-10-31 | 2023-05-16 | International Business Machines Corporation | Artificial intelligence transparency |
| CN111177301B (zh) * | 2019-11-26 | 2023-05-26 | 云南电网有限责任公司昆明供电局 | 一种关键信息识别提取方法及系统 |
| CN111488829A (zh) * | 2020-04-10 | 2020-08-04 | 广东电网有限责任公司江门供电局 | 杆塔巡检照片分类方法、装置、电子设备以及存储介质 |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6052485A (en) * | 1997-02-03 | 2000-04-18 | The United States Of America As Represented By The Secretary Of The Navy | Fractal features used with nearest neighbor clustering for identifying clutter in sonar images |
| US7233692B2 (en) * | 2002-11-14 | 2007-06-19 | Lockheed Martin Corporation | Method and computer program product for identifying output classes with multi-modal dispersion in feature space and incorporating multi-modal structure into a pattern recognition system |
| US7769561B2 (en) * | 2005-12-01 | 2010-08-03 | Siemens Corporation | Robust sensor correlation analysis for machine condition monitoring |
| US7567878B2 (en) * | 2005-12-07 | 2009-07-28 | Siemens Corporate Research, Inc. | Evaluating anomaly for one class classifiers in machine condition monitoring |
| US7958062B2 (en) * | 2006-05-31 | 2011-06-07 | Lockheed Martin Corporation | Method and system of creating health operating envelope for dynamic systems by unsupervised learning of a sequence of discrete event codes |
-
2006
- 2006-12-05 AT AT06838989T patent/ATE445870T1/de active
- 2006-12-05 DE DE602006009839T patent/DE602006009839D1/de active Active
- 2006-12-05 WO PCT/US2006/046361 patent/WO2007067521A1/en not_active Ceased
- 2006-12-05 ES ES06838989T patent/ES2332741T3/es active Active
- 2006-12-05 EP EP06838989A patent/EP1958034B1/en not_active Not-in-force
-
2008
- 2008-03-14 US US12/048,381 patent/US7716152B2/en not_active Expired - Fee Related
Also Published As
| Publication number | Publication date |
|---|---|
| US20090043536A1 (en) | 2009-02-12 |
| DE602006009839D1 (de) | 2009-11-26 |
| ATE445870T1 (de) | 2009-10-15 |
| WO2007067521A1 (en) | 2007-06-14 |
| EP1958034B1 (en) | 2009-10-14 |
| US7716152B2 (en) | 2010-05-11 |
| EP1958034A1 (en) | 2008-08-20 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Kodandaramaiah | Use of dispersal–vicariance analysis in biogeography–a critique | |
| Mesgaran et al. | Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models | |
| Luo et al. | Identifying infection sources and regions in large networks | |
| ES2332741T3 (es) | Uso de agrupamiento secuencial para seleccion de instancias en monitorizacion de estados de maquina. | |
| ES2703573T3 (es) | Procedimiento para detectar anomalías en una red de distribución, en particular de agua potable | |
| CN112615888B (zh) | 一种网络攻击行为的威胁评估方法及装置 | |
| Burbrink et al. | When are adaptive radiations replicated in areas? Ecological opportunity and unexceptional diversification in West Indian dipsadine snakes (Colubridae: Alsophiini) | |
| Millán-Roures et al. | Detection of anomalies in water networks by functional data analysis | |
| US20220067584A1 (en) | Model generation apparatus, model generation method, computer-readable storage medium storing a model generation program, model generation system, inspection system, and monitoring system | |
| Li et al. | Geographically weighted elastic net: A variable-selection and modeling method under the spatially nonstationary condition | |
| CN109450956A (zh) | 网络安全性评估方法、系统、介质和计算设备 | |
| Zhao et al. | Landscape-scale disturbances modified bird community dynamics in successional forest environment | |
| Long | The crux of the method: assumptions in ordinary least squares and logistic regression | |
| Zheng et al. | Adversarial graph neural network for multivariate time series anomaly detection | |
| Ferreira et al. | Modeling stream fish distributions using interval‐censored detection times | |
| CN117906376B (zh) | 一种回转窑碳排放量监测方法及系统 | |
| CN115392293A (zh) | 变压器故障的监测方法、装置、计算机设备和存储介质 | |
| Hutchinson et al. | An external memory data structure for shortest path queries | |
| TW202044110A (zh) | 無監督模型評估方法、裝置、伺服器及可讀儲存媒體 | |
| Szarmach et al. | Multi-label classification for AIS data anomaly detection using wavelet transform | |
| Grisi-Filho et al. | Scale‐Free Networks with the Same Degree Distribution: Different Structural Properties | |
| Chanda et al. | Elevation determines the spatial risk of Anthrax outbreaks in Karnataka, India | |
| CN113296992B (zh) | 异常原因确定方法、装置、设备和存储介质 | |
| Whalen et al. | Model aggregation for distributed content anomaly detection | |
| KR20050061358A (ko) | 네트워크 진단 방법, 네트워크 진단을 수행하는 코드를포함하는 컴퓨터 판독 가능 매체 및 시스템 |