ES2992341T3 - Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte - Google Patents

Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte Download PDF

Info

Publication number
ES2992341T3
ES2992341T3 ES22706264T ES22706264T ES2992341T3 ES 2992341 T3 ES2992341 T3 ES 2992341T3 ES 22706264 T ES22706264 T ES 22706264T ES 22706264 T ES22706264 T ES 22706264T ES 2992341 T3 ES2992341 T3 ES 2992341T3
Authority
ES
Spain
Prior art keywords
loose
packages
action
package
state
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES22706264T
Other languages
English (en)
Inventor
Michael Zettler
Marc Christian Weber
Daniel Hein
Clemens Otte
Martin Schall
Frank Pfeiffer
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Koerber Supply Chain Logistics GmbH
Original Assignee
Koerber Supply Chain Logistics GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Koerber Supply Chain Logistics GmbH filed Critical Koerber Supply Chain Logistics GmbH
Application granted granted Critical
Publication of ES2992341T3 publication Critical patent/ES2992341T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B13/00Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion
    • G05B13/02Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion electric
    • G05B13/0265Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion electric the criterion being a learning criterion
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B65CONVEYING; PACKING; STORING; HANDLING THIN OR FILAMENTARY MATERIAL
    • B65GTRANSPORT OR STORAGE DEVICES, e.g. CONVEYORS FOR LOADING OR TIPPING, SHOP CONVEYOR SYSTEMS OR PNEUMATIC TUBE CONVEYORS
    • B65G43/00Control devices, e.g. for safety, warning or fault-correcting
    • B65G43/08Control devices operated by article or material being fed, conveyed or discharged
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B65CONVEYING; PACKING; STORING; HANDLING THIN OR FILAMENTARY MATERIAL
    • B65GTRANSPORT OR STORAGE DEVICES, e.g. CONVEYORS FOR LOADING OR TIPPING, SHOP CONVEYOR SYSTEMS OR PNEUMATIC TUBE CONVEYORS
    • B65G43/00Control devices, e.g. for safety, warning or fault-correcting
    • B65G43/10Sequence control of conveyors operating in combination
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B65CONVEYING; PACKING; STORING; HANDLING THIN OR FILAMENTARY MATERIAL
    • B65GTRANSPORT OR STORAGE DEVICES, e.g. CONVEYORS FOR LOADING OR TIPPING, SHOP CONVEYOR SYSTEMS OR PNEUMATIC TUBE CONVEYORS
    • B65G47/00Article or material-handling devices associated with conveyors; Methods employing such devices
    • B65G47/22Devices influencing the relative position or the attitude of articles during transit by conveyors
    • B65G47/26Devices influencing the relative position or the attitude of articles during transit by conveyors arranging the articles, e.g. varying spacing between individual articles
    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B19/00Program-control systems
    • G05B19/02Program-control systems electric
    • G05B19/418Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM]
    • G05B19/4189Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM] characterised by the transport system

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Automation & Control Theory (AREA)
  • General Physics & Mathematics (AREA)
  • Quality & Reliability (AREA)
  • Manufacturing & Machinery (AREA)
  • General Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Mechanical Engineering (AREA)
  • Health & Medical Sciences (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Evolutionary Computation (AREA)
  • Medical Informatics (AREA)
  • Software Systems (AREA)
  • Control Of Conveyors (AREA)

Abstract

El uso de métodos de aprendizaje por refuerzo en sistemas de transporte (2) para mercancías por unidad (4) está llegando rápidamente a su límite debido al elevado número de elementos de transporte individuales (12) que determinan la dimensionalidad de los vectores de acción (a(t)). La invención se refiere a un procedimiento implementado por ordenador, a un dispositivo para el procesamiento de datos y a un sistema informático para el accionamiento de un dispositivo de regulación de un sistema de transporte (2) con elementos de transporte (12) accionables individualmente para conseguir una alineación y/o una distancia definida de las mercancías por unidad (4), en el que el accionamiento del dispositivo de regulación (14) se determina mediante un agente que actúa según métodos de aprendizaje por refuerzo. Mediante una imagen se genera para cada mercancía por unidad (4n) un vector de estado local individual sn(t) de una dimensión determinada de antemano y que se corresponde con todas las mercancías por unidad (4). Se selecciona un vector de acción (an(t)) individualmente para cada pieza de bien (4n) de un espacio de acción según una estrategia (política) para el vector de estado actual (sn(t)) de dicha pieza de bien (4), siendo dicha estrategia la misma para todas las piezas de bien (4, 4n). Los vectores de acción (an(t)) se proyectan sobre los elementos transportadores (12), y se resuelven los conflictos (por ejemplo, múltiples vectores de acción (an(t)) asignados al mismo elemento transportador (12)). Después de que transcurra un tiempo de ciclo (At), se generan de nuevo vectores de estado (sn(t+Δt)) para cada pieza de bien (4n) y se evalúan utilizando recompensas, y se adapta la estrategia. (Traducción automática con Google Translate, sin valor legal)

Description

DESCRIPCIÓN
Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte
La presente invención se refiere al campo técnico de los sistemas de transporte para bultos sueltos, en particular mediante sistemas de transporte adecuados para la separación en piezas(singulation)y/u orientación de los bultos sueltos.
En el sector de la logística, los singularizadores se utilizan para separar en piezas un flujo entrante de muchos bultos sueltos sin ordenar, en particular envíos postales como pequeños paquetes y paquetes o bultos de equipaje, es decir, para crear una distancia definida entre paquetes individuales y, a menudo, también para garantizar una orientación determinada de los bultos sueltos. Esto es necesario para poder procesar los bultos sueltos en etapas de proceso posteriores, por ejemplo, para escanear direcciones. Otro objetivo es maximizar el rendimiento (paquetes/hora) manteniendo una calidad de regulación determinada (distancias y orientación) determinada, así como posiblemente otras condiciones adicionales, como reducir el consumo de energía y el desgaste.
Existen singularizadores con recorridos de transporte que discurren en paralelo, que presentan en cada caso una multitud de elementos transportadores dispuestos uno detrás de otro, en los que se monitoriza la posición y orientación de los bultos sueltos mediante sensores (p. ej. cámaras). Un singularizador está controlado por un equipo de regulación. Los bultos sueltos que se introducen en el singularizador como una corriente desordenada de bultos sueltos deben transportarse por los elementos transportadores y, mientras tanto, separarse en piezas y orientarse a distancias definidas. Las cintas transportadoras de todos los elementos transportadores se pueden controlar por separado, en donde los valores nominales de las velocidades se especifican mediante un control. Los procesos de regulación se establecen en condiciones de prueba, antes de la instalación en el cliente final, con un flujo estándar de mercancías con una determinada distribución fija de propiedades de bultos sueltos. Dependiendo de la disposición actual de los bultos sueltos en el sistema de transporte captada por los sensores, el control individual de las velocidades de transporte de todos los elementos transportadores, predeterminada para esta disposición se selecciona mediante el control y los elementos transportadores se controlan correspondientemente, es decir, los elementos transportadores se aceleran y desaceleran de manera diferente. El ajuste óptimo, manual o asistido manualmente, de estos procesos de regulación es muy complejo, porque para lograr una separación en piezas y disposición eficientes, las velocidades de los elementos transportadores deben reajustarse en un ciclo muy alto (por ejemplo, 30 ms).
Además, este ajuste previo de los procesos de regulación sólo es muy eficaz y fiable para la separación en piezas y orientación si los bultos sueltos realmente transportados en el sistema de transporte presentan propiedades similares (distribución de peso, propiedades de fricción, tamaño, forma, material, ...) como los productos estándar utilizados para el ajuste previo. Sin embargo, si el espectro de productos presenta propiedades diferentes a las de los productos estándar (por ejemplo, pequeños paquetes de plástico más lisos y resbaladizos en lugar de paquetes o pequeños paquetes de cartón antideslizantes), los bultos sueltos no reaccionan a un cambio en los parámetros como los productos estándar. Estas propiedades a este respecto no son necesariamente observables directamente en la imagen de la cámara, pero influyen en la dinámica, por ejemplo, a través de un tiempo muerto modificado cuando cambia la velocidad. Las adaptaciones a situaciones específicas del cliente después de la puesta en servicio son difíciles, en particular si las propiedades del flujo de bultos sueltos en el cliente respectivo continúan cambiando con el tiempo después de la puesta en servicio de la instalación.
Hasta ahora, el problema se ha resuelto mediante una combinación de procesamiento de imágenes clásico y diseño de regulador manual, es decir, reconociendo los paquetes en la imagen de la cámara, convirtiéndolos en una representación interna (por ejemplo, polígonos) y diseñando manualmente un regulador adecuado, por ejemplo, un regulador PID asumiendo una distribución estadística esperada determinada del flujo de paquetes. También por regla general se utilizan simulaciones. El problema a menudo se simplifica cuando el regulador se concentra en el paquete de más adelante en cada caso de un flujo de bultos sueltos e ignora inicialmente otros paquetes, lo que, sin embargo, puede reducir la calidad de regulación.
Debido al gran número de elementos transportadores, el control es complejo desde el punto de vista de la tecnología de regulación, ya que la dimensión de este problema de regulación corresponde al número de elementos transportadores en el sistema de transporte. La adaptación de los procesos de regulación basados en singularizadores ya ajustados a singularizadores adicionales con diferente número y longitud de elementos transportadores es complejo. La combinación de tiempos de ciclo elevados y alta dimensión no permite que los métodos normales de aprendizaje automático se ajusten al flujo de bultos sueltos real.
Los documentos EP 3287396 A1, EP 3153242 A2 y US 2016/239000 A1 muestran sistemas transportadores para transportar bultos sueltos con control de la distancia entre los bultos sueltos.
La presente invención se basa, por tanto, en el objetivo de proporcionar un procedimiento y un dispositivo que ofrezcan una mejora con respecto al estado de la técnica. Este objetivo se resuelve mediante las soluciones descritas en las reivindicaciones independientes. Diseños ventajosos se desprenden de las reivindicaciones dependientes.
La solución de acuerdo con la invención prevé un procedimiento implementado por ordenador para controlar un equipo de regulación de un sistema de transporte para el transporte de bultos sueltos de al menos un tipo, en particular envíos postales y bultos de equipaje. El sistema de transporte presenta una multitud de elementos transportadores orientados a lo largo y paralelos a una dirección de transporte, los elementos transportadores se accionan controlando el equipo de regulación mediante un accionamiento asociado en cada caso con una velocidad ajustable individualmente para lograr una orientación y/o una distancia definida entre los bultos sueltos. El control del equipo de regulación está determinado por al menos un agente, que actúa o está predeterminado según métodos de aprendizaje por refuerzo(reinforcement leaming),que,de acuerdo con una estrategia, selecciona en términos de situación una acción de un espacio de acción para un estado inicial con el fin de llegar a un estado subsiguiente, en donde los estados con vectores de estado y las acciones se pueden representar con vectores de acción. El procedimiento comprende las etapas de procedimiento:
a) crear una imagen inicial del sistema de transporte.
b) P cada uno de los bultos sueltos en la imagen, crear individualmente un vector de estado fijado previamente, por tanto, predeterminado, y para todos los bultos sueltos de un tipo de la misma dimensión, que comprende información de estado del bulto suelto correspondiente extraída de la imagen creada inmediatamente antes (imagen inicial o subsiguiente.
c) Para cada bulto suelto, seleccionar individualmente un vector de acción de un espacio de acción de acuerdo con la misma estrategia (política) para todos los bultos sueltos de un tipo para el vector de estado actual de este bulto suelto, en donde la dimensión del vector de acción está predeterminada.
d) Para cada bulto suelto, representar el vector de acción en los elementos transportadores reales de este bulto suelto para determinar la velocidad de estos elementos transportadores y el control correspondiente de los elementos transportadores, es decir, un ajuste de la velocidad de los accionamientos de estos. elementos transportadores, con el equipo de regulación.
e) Después de que haya transcurrido un tiempo de ciclo, crear una imagen subsiguiente del sistema de transporte y realizar la etapa de procedimiento b) para obtener un vector de estado del estado subsiguiente (vector de estado subsiguiente) para cada bulto suelto.
f) ) Si la estrategia para bultos sueltos (4) de un tipo debe seguir entrenándose durante la realización del procedimiento, el vector de estado del estado subsiguiente se evalúa para cada bulto suelto de este tipo mediante un método del aprendizaje por refuerzo basado en una recompensa. después de lo cual el agente entrena y, por tanto optimiza, su estrategia para bultos sueltos (4) de este tipo, adaptando los vectores de acción del espacio de acción.
g) Realizar de nuevo las etapas de procedimiento c) - f) para cada bulto suelto, utilizando la estrategia mejorada o predeterminada, siempre que el bulto suelto correspondiente se represente en la imagen subsiguiente. El procedimiento también se realiza para bultos sueltos nuevos que aparecen en la imagen.
La solución de acuerdo con la invención se refiere a un dispositivo para el procesamiento de datos para un control implementado por ordenador de un equipo de regulación de un sistema de transporte para el transporte de bultos sueltos de al menos un tipo, en particular envíos postales y bultos de equipaje. El sistema de transporte presenta una multitud de elementos transportadores orientados a lo largo y paralelos a una dirección de transporte, en donde los elementos transportadores se accionan controlando el equipo de regulación mediante un accionamiento asociado en cada caso con una velocidad ajustable individualmente para lograr una orientación y/o una distancia definida entre los bultos sueltos. El control del equipo de regulación está determinado por al menos un agente que actúa según métodos de aprendizaje por refuerzo, que, de acuerdo con una estrategia para bultos sueltos de un tipo, selecciona en términos de situación una acción a partir de un espacio de acción para llegar a un estado subsiguiente, en donde los estados con vectores de estado y las acciones se pueden representar con vectores de acción, en donde los bultos sueltos en el sistema de transporte pueden registrarse mediante al menos un sensor y el equipo de regulación comprende una unidad de cálculo. El dispositivo comprende medios para la realización del procedimiento de acuerdo con la invención.
La solución de acuerdo con la invención se refiere además a un sistema de transporte para el transporte de bultos sueltos de al menos un tipo, en particular envíos postales y bultos de equipaje, que presenta una multitud de elementos transportadores orientados a lo largo y paralelos a una dirección de transporte. Los elementos transportadores se accionan mediante un accionamiento asociado en cada caso con una velocidad ajustable individualmente bajo el control de un equipo de regulación para lograr una orientación y/o una distancia definida de los bultos sueltos. El control del equipo de regulación está determinado por al menos un agente que actúa según métodos de aprendizaje por refuerzo, que, de acuerdo con una estrategia que es la misma para todos los bultos sueltos de un tipo, selecciona en términos de situación una acción de un espacio de acción para un estado inicial para llegar a un estado subsiguiente, en donde los estados con vectores de estado y las acciones se pueden representar con vectores de acción, que comprende un dispositivo de acuerdo con la invención.
La solución de acuerdo con la invención se refiere además a un programa informático que comprende instrucciones que, cuando se ejecutan por una unidad de cálculo conectada a un sistema de transporte de acuerdo con la invención, le inducen a ejecutar el procedimiento de acuerdo con la invención.
El dispositivo, el sistema de transporte y el programa informático, en la medida en que sean transferibles, presentan las mismas ventajas que se enumeran respecto al procedimiento presentado. Las características de procedimiento también pueden verse formuladas como una propiedad de la unidad de dispositivo correspondiente y viceversa.
La aplicación de un método del aprendizaje por refuerzo a todos los bultos sueltos (de un tipo) y a todos los elementos transportadores de un sistema de transporte al mismo tiempo es un problema de grandes dimensiones, porque para cada tiempo de ciclo se debe determinar una velocidad individualmente para cada elemento transportador. Esto no se puede resolver a partir de un número determinado de elementos transportadores dentro del tiempo de ciclo (p. ej. 30 ms) típico en sistemas transportadores como los singularizadores. Al descomponer el problema de regulación de todos los elementos transportadores en vectores de acción locales de un bulto suelto, la dimensión se reduce hasta tal punto que una unidad de cálculo es capaz de aplicar un método de aprendizaje por refuerzo a esta pluralidad de dimensiones bajas y, por tanto, menos problemas complejos dentro del tiempo de ciclo requerido. Al fijar previamente la dimensión de los vectores de estado de todos los bultos sueltos, la dimensión de cada vector de estado está predeterminada y la dimensión de los vectores de estado de todos los bultos sueltos coincide. Además, a partir de un número determinado de elementos transportadores en el sistema de transporte, la dimensión de los vectores de acción es menor que el número de elementos transportadores. El vector de acción representa la función motora disponible de los elementos transportadores y no se realiza ningún cambio cuando un bulto suelto ya se presenta perfectamente orientado y a la distancia deseada de los bultos sueltos contiguos. En este caso, de acuerdo con una realización, a los vectores de acción se les dotar previamente de valores por defecto del sistema de transporte. El agente (de cada tipo de bulto suelto) también obtiene no sólo una recompensa por cada tiempo de ciclo, sino también tantas recompensas por cada tiempo de ciclo como bultos sueltos que van a singularizarse de un tipo se encuentren sobre los elementos transportadores. El número de bultos sueltos y el número de tipos de bultos sueltos no cambian el principio de procedimiento. De este modo, el agente aprende más rápido porque la estrategia no se entrena una sola vez con una sola pasada, sino según el número de bultos sueltos y, por tanto, se optimiza más rápidamente. Esto permite que el procedimiento se ajuste con especial rapidez a un flujo cambiante de bultos sueltos.
Mediante el ajuste de la velocidad se acelera o desacelera un elemento transportador mediante su accionamiento, con lo que los elementos transportadores cambian la orientación y la posición del bulto suelto que descansa sobre ellos. Antes de que comience el procedimiento, se pueden asignar valores estándar a todos los elementos transportadores del bulto suelto. Las imágenes se obtienen a través de una imagen de cámara (sensor de imagen) y/o a través de otros sensores para determinar el lugar y la posición de los bultos sueltos y se convierten en una imagen que se puede describir mediante vectores de estado.
De acuerdo con una forma de realización, los bultos sueltos en la imagen se pueden asociar a un primer tipo y al menos a otro tipo, dependiendo de las propiedades de los bultos sueltos, y para cada tipo asociado se puede proporcionar un agente con una estrategia para bultos sueltos de este tipo. Cuando para todos los bultos sueltos en la imagen se utiliza la misma estrategia, todos los bultos sueltos pertenecen a un tipo y los bultos sueltos no se asocian. Sin embargo, cuando se transportan tipos de bultos sueltos fáciles de diferenciar (por ejemplo, paquetes de cartón como bultos sueltos del primer tipo y pequeños paquetes de bolsas de plástico como bultos sueltos del segundo tipo; maletas rígidas como bultos sueltos del primer tipo y bolsas de viaje flexibles como bultos sueltos del segundo tipo; ...) en el mismo sistema de transporte entonces estos tipos de bultos sueltos presentan diferentes propiedades de adherencia y fricción. Incluso en el mismo estado inicial (misma orientación, misma superficie de descanso en los mismos elementos transportadores), estos tipos de bultos sueltos reaccionan de manera diferente a un control de los elementos transportadores seleccionado de acuerdo con los vectores de acción, es decir, alcanzan un estado subsiguiente diferente incluso con control idéntico de los elementos transportadores sobre los que descansan. Aunque este estado subsiguiente no se diferenciará mucho, aún puede tener sentido utilizar diferentes estrategias para estos diferentes tipos de bultos sueltos. El sistema de transporte puede determinar el tipo de bulto suelto, por ejemplo, basándose en la imagen, y luego asignar una estrategia propia a cada tipo de bulto suelto asociado, es decir, la estrategia uno para paquetes de cartón y la estrategia dos para paquetes pequeños de bolsas de plástico, así como cualquier otra estrategia para otros tipos de bultos sueltos.
De acuerdo con una forma de realización, para cada tiempo de ciclo y para cada bulto suelto se pueden determinar las velocidades de aquellos elementos transportadores sobre los que descansa el bulto suelto, pero sobre los que no se ha representado ningún vector de acción de este bulto suelto, y estos mismos elementos transportadores se pueden controlar individualmente de manera correspondiente con el equipo de regulación. Las velocidades se pueden determinar interpolando las velocidades de aquellos elementos transportadores contiguos en los que se ha representado un vector de acción de este bulto suelto. Esto soluciona el problema de que la dimensión del vector de acción no se corresponde necesariamente con el número de elementos transportadores sobre los que descansa el bulto suelto. Para esta tarea de interpolación es adecuada, por ejemplo, la interpolación bilineal.
De acuerdo con una forma de realización, para cada tiempo de ciclo, es decir, siempre simultáneamente con la determinación de las velocidades de los elementos transportadores de acción, se determinan las velocidades de todos aquellos elementos transportadores sobre los que ni descansa ningún bulto suelto ni sobre los cuales se ha representado ningún vector de acción de un bulto suelto y se controla individualmente de manera correspondiente estos elementos transportadores individuales con el equipo de regulación. Las velocidades se pueden determinar mediante interpolación, por ejemplo, interpolación bilineal de las velocidades de aquellos elementos transportadores contiguos en los que se ha representado un vector de acción de este bulto suelto. Para los elementos transportadores de borde se pueden asumir condiciones marginales especiales. Adicional o alternativamente, las velocidades se pueden determinar basándose en los parámetros de velocidad del sistema de transporte. Estos pueden ser valores estándar de la instalación o de la simulación, por ejemplo, el promedio de todos los elementos transportadores del vector de acción. De forma adicional o alternativa, la velocidad de los elementos transportadores, en cuyos elementos transportadores contiguos se ha representado el vector de acción de un bulto suelto, se puede seleccionar de modo que coincidan con la velocidad de este elemento transportador contiguo. De forma adicional o alternativa, las velocidades para algunos o todos estos elementos transportadores pueden ser idénticas y pueden determinarse a partir del promedio de las velocidades de los elementos transportadores en los que se ha representado un vector de acción de un bulto suelto. Al accionar incluso aquellos elementos transportadores sobre los que en este momento no descansa ningún bulto suelto, no es necesario acelerarlos desde cero cuando sobre ellos se representa una velocidad del vector de acción en el siguiente tiempo de ciclo. Un control de estos elementos transportadores también tiene sentido, ya que durante el tiempo del ciclo se puede transportar un bulto suelto sobre uno o varios de estos elementos transportadores.
De acuerdo con una forma de realización, la información de estado de un bulto suelto representada en el vector de estado puede comprender posición y/u orientación.
De acuerdo con una forma de realización, la información de estado representada en el vector de estado o la información de estado representada de otra manera de un bulto suelto comprenden además la superposición del bulto suelto con aquellos elementos transportadores sobre los que descansa el bulto suelto y/o información de estado de un número predeterminado de siguientes bultos sueltos contiguos dentro de una distancia predeterminada, que comprende al menos su posición y/o distancia con respecto al bulto suelto del vector de estado, por lo que al vector de estado se le aplican valores por defecto en caso de un número menor que el número predeterminado de siguientes bultos sueltos contiguos; y/o velocidad y/o tamaño del bulto suelto; y/o información de estado global del sistema de transporte, por ejemplo, que comprende un número de bultos sueltos en el sistema de transporte, velocidad media del sistema de transporte, priorización de bultos sueltos individuales, por ejemplo, en función del tamaño y/o criterio de clasificación. Los valores estándar pueden representar, por ejemplo, bultos sueltos virtuales, ya perfectamente orientados a la distancia deseada, de modo que estos bultos sueltos virtuales tengan la menor influencia perturbadora posible en la regulación de los bultos sueltos considerados.
El número real de cintas sobre las que descansa un bulto suelto varía en función del tamaño y la orientación del bulto suelto. Sin embargo, los vectores de acción tienen una dimensión constante. Para resolver este problema, el vector de acción sólo puede describir las velocidades que se sitúan por debajo de puntos o superficies predeterminadas del bulto suelto. Son puntos predeterminados adecuados, por ejemplo, los vértices de un rectángulo de circunscripción y/o un centro de gravedad aproximado. La ubicación y la posición del bulto suelto se abstrae y se determina mediante una selección de parámetros de descanso, que se seleccionan de tal manera que puedan verse influenciados por los vectores de acción. De este modo, el bulto suelto real siempre se describe con un número fijo de parámetros en cuanto a su descanso en el sistema de transporte. Las propiedades del bulto suelto se abstraen en parámetros del modelo que pueden verse influenciados por el vector de acción, cuyo número corresponde a la dimensión del vector de acción.
Cuando los vectores de acción asociados por el agente para dos o más bultos sueltos se representan en el mismo elemento transportador, se debe decidir a qué valor se le da qué prioridad. Este conflicto se puede resolver priorizando y/o promediando ponderadamente las velocidades especificadas por los vectores de acción en función de la superposición respectiva de estos bultos sueltos con este elemento transportador y/o de la calidad de los vectores de estado. De acuerdo con el resultado, se controla el elemento transportador correspondiente.
Si dos elementos del vector de acción de un bulto suelto están representados en el mismo elemento transportador, este elemento transportador puede controlarse con un promedio de estos elementos o se puede dar preferencia en su totalidad o de manera ponderada a uno de los elementos.
De acuerdo con una forma de realización, la imagen puede analizarse utilizando métodos de procesamiento de imágenes y los vectores de estado pueden crearse basándose en la imagen analizada. Los bultos sueltos se simulan, por ejemplo, con rectángulos de circunscripción.
De acuerdo con una forma de realización, un primer intento de crear los vectores de estado puede realizarse automáticamente a partir de la imagen utilizando el aprendizaje de refuerzo profundo. Por lo tanto, se puede realizar un primer o intento adicional de crear los vectores de estado a partir de la imagen original. A este respecto la representación de los vectores de estado no está predefinida, sino que se aprende automáticamente a partir de la imagen (de la cámara) utilizando el aprendizaje de refuerzo profundo; por tanto, los vectores de estado se forman directamente a partir de la asociación de píxeles de la imagen de la cámara digital. Si, por el contrario, los vectores de estado se determinan a través de la etapa intermedia de métodos de procesamiento de imágenes realizados sobre la imagen, los vectores de estado se definen mediante conocimiento experto, además los errores de procesamiento de imágenes tienen un efecto directo sobre los vectores de estado. Si por alguna razón este primer intento de crear una imagen o parte de una imagen no tiene éxito, a continuación se puede intentar evaluar los vectores de estado para esta imagen o parte de esta imagen usando métodos de procesamiento de imágenes para obtener los vectores de estado.
Además, para obtener un agente más previsor, el agente de aprendizaje puede optimizar su estrategia basándose en la comparación de los vectores de estado del estado inicial y del estado subsiguiente basado en una recompensa y adaptar los vectores de acción del espacio de acción.
Para proporcionar al agente una primera estrategia con poco esfuerzo, de modo que el cliente ya disponga de una estrategia sólida y, por tanto, de un sistema de transporte funcional, la estrategia del agente para bultos sueltos de un tipo determinado se puede entrenar con un sistema de transporte virtual (y, por tanto, bultos sueltos virtuales y elementos transportadores virtuales) o con un sistema de transporte real. Si ya se ha entregado una estrategia predeterminada, se puede prescindir de un entrenamiento de la estrategia durante la realización del procedimiento, por ejemplo, si el flujo de bultos sueltos es muy similar o el sistema informático del explotador del sistema de transporte carece de capacidad de cálculo.
Las formas de realización de la invención se explican con más detalle a continuación utilizando, por ejemplo, las figuras. A este respecto muestran:
figura 1 un sistema de transporte desde arriba;
figura 2 una selección de posibles disposiciones de los elementos transportadores;
figura 3 un diagrama de flujo para determinar el vector de acción;
figura 4 el principio de un sistema de aprendizaje por refuerzo;
figura 5 un bulto suelto con puntos de esquina y centro de gravedad estimado;
figura 6 ejemplos de determinadas velocidades de los elementos transportadores sobre los que descansa un bulto suelto;
la figura 1 muestra un sistema de transporte 2 correspondiente, que transporta bultos sueltos 4 a lo largo de una dirección de transporte principal 6 sobre un recorrido de transporte 8 descansando sobre transportadores 12 con un ámbito de aplicación típico como singularizador 2 en el sector postal y logístico. Los transportadores 12 están dispuestos paralelamente a la dirección principal de transporte 6 en segmentos 10 dispuestos uno detrás de otro a lo largo de la dirección principal de transporte 6, alineados y a lo largo de una línea. Los bultos sueltos 4 se entregan para el transporte de un segmento 10 al siguiente segmento 10 en cada caso y descansan sobre varios transportadores 12 al mismo tiempo y, por lo tanto, pueden separarse en piezas y/o girarse durante su transporte cuando los transportadores 12 están controlados individualmente mediante un equipo de regulación no mostrado en este caso, por ejemplo, haciendo funcionar los transportadores 12 sobre los que descansa el bulto suelto 4 correspondiente a una velocidad de transporte 16 mayor que los transportadores 12 vecinos. Para ello, el equipo de regulación comprende una unidad informática no representada en la figura. El sistema de transporte 2 comprende varios sensores 26 dispuestos por encima y a lo largo del recorrido de transporte y diseñados como detectores ópticos. En principio, sin embargo, también se pueden utilizar otros tipos de sensores siempre que la unidad de cálculo sea capaz de crear los vectores de estado de los bultos sueltos 4 basándose en la entrada de sensor. En principio, un único sensor 26 puede ser suficiente con un buen ángulo de visión.
El sistema de transporte 2 está subdividido a lo largo de la dirección de transporte principal 6 en segmentos 18, 20, 22, 24, que ejecutan esencialmente diferentes tareas. En primer lugar se intenta ensanchar la distribución de bultos sueltos en un dispositivo de ensanchamiento 18 basándose en la disposición de los elementos transportadores 12. A continuación se realiza el transporte a lo largo de la dirección de transporte principal 6 sobre un transportador de transferencia 20. El transportador de transferencia 20 comprende dos segmentos 10b, 10c, que comprenden en cada caso solo un único transportador 12 que abarca todo el ancho del recorrido de transporte 8. Para una corrección especialmente eficaz de la orientación, los segmentos 10d - 10h o sus transportadores 12 en la sección de orientación 22 son relativamente cortos.
Para una corrección de la distancia especialmente eficaz, los segmentos 10d - 10h o sus transportadores 12 en la sección de corrección de distancia 24 están diseñados más largos que los de la sección de orientación 22. Es posible dividir las secciones 22, 24 del sistema de transporte 2 en subsistemas de transporte con diferentes estrategias (mayor recompensa por una buena orientación en la sección de orientación 22 o por distancias bien ajustadas en la sección de corrección de distancia 24), de modo que se utiliza en cada caso una estrategia optimizada u optimizable de la sección 22, 24 correspondiente. Sin embargo, este enfoque de dividir en diferentes secciones 22/24 es particularmente adecuado para sistemas transportadores 2 que no utilizan métodos de aprendizaje por refuerzo. De acuerdo con una forma de realización se otorga además una recompensa basándose en una comparación de los vectores de estado del estado inicial y posterior s<n>(t), s<n>(t+At) para lograr una optimización aún mejor y más rápida de la estrategia.
El comportamiento de regulación óptimo del equipo de regulación del sistema de transporte 2 lo aprende la máquina mediante aprendizaje por refuerzo (figura 4). En este sentido, un "agente" interactúa con el entorno que puede ser una instalación concreta como sistema de transporte 2, su simulación/gemelo digital o un modelo aprendido basado en datos ("modelo sustituto") de la instalación 2 o simulación. Las acciones que influyen en el entorno son las velocidades v de todos los elementos transportadores 12 (por ejemplo, cintas transportadoras) y se representan como motricidad disponible en vectores de acción a<n>(t) con unas dimensiones menores que el número de elementos transportadores 12. Las observaciones que están a disposición del agente como datos de entrada son imágenes del sistema de transporte, en particular basadas en cámaras 26 y/u otros datos de sensores, y se representan en vectores de estado S<n>(t). Si el vector de estado s<n>(t) de un bulto suelto 4 ya tiene la orientación deseada y una distancia suficiente con respecto sus los bultos sueltos 4' contiguos, el vector de acción representará un transporte adicional sencillo en la dirección de transporte 6. El comportamiento del agente se optimiza mediante una señal de recompensa que describe la calidad de la situación actual. Esencialmente, la calidad está determinada por la posición/orientación y las distancias mutuas de los paquetes 4. Por ejemplo, el valor de la recompensa es alto si los paquetes 4 tienen una distancia teórica definida entre sí y se encuentran en un ángulo determinado sobre el sistema de transporte 2 o sus elementos transportadores 12. Además, también se pueden tener en cuenta como recompensa el consumo de energía, el consumo durante toda la vida, las emisiones de ruido, etc.
Dado que se conocen los métodos de aprendizaje por refuerzo, en particular mediante una red neuronal o una red neuronal recurrente, incluida la determinación del modelo del sistema, se omite en este punto una descripción más detallada. Los métodos comunes (por ejemplo, NFQ, DQN, optimización de políticas próximas) pueden usarse en principio para la invención.
De acuerdo con una forma de realización, los bultos sueltos 4 en la imagen se asocian a un primer tipo y al menos a otro tipo, dependiendo de las propiedades de los bultos sueltos 4. Un agente proporcionará una estrategia propia para cada tipo de bulto suelto asociado. Si solo se utiliza una estrategia para todos los bultos sueltos 4, no es necesario realizar ninguna asociación.
La asociación de los bultos sueltos 4 a un tipo se realiza en función de las propiedades de los bultos sueltos. La asociación se puede realizar basándose en la imagen o determinarse previamente (p. ej. en una estación de clasificación), en donde es necesario realizar un seguimiento preciso de cada bulto suelto durante el procedimiento para no perder la asociación a un tipo de bulto suelto. Las posibles propiedades que determinan las asociaciones a un tipo de bulto suelto pueden ser categoría (paquetes pequeños, paquetes, cartas grandes, ...), material de embalaje (cartón o plástico), peso (ya que influye en la adherencia a los elementos transportadores), tamaño (determina sobre cuantos elementos transportadores descansa un bulto suelto) ... El sistema de transporte determina el tipo de bultos sueltos 4, por ejemplo, basándose en la imagen o mediante sensores adicionales, y luego asocia su propia estrategia a cada tipo de bulto suelto asociado, por ejemplo, estrategia uno para paquetes de cartón pesados y estrategia dos para paquetes de cartón ligeros, estrategia tres para pequeños paquetes con bolsas de plástico pesados, estrategia cuatro para paquetes pequeños con bolsas de plástico ligeros, así como cualquier estrategia adicional para otros tipos de bulto suelto.
La figura 2 no muestra de manera concluyente posibles disposiciones de los elementos transportadores 12 del sistema de transporte 2. En la figura 2a, todos los elementos transportadores 12 están dispuestos en una red como una matriz. Esta forma es la más fácil de describir y también la representación de un vector de acción a<n>(t) sobre los elementos transportadores reales 12 es especialmente sencilla y produce siempre un efecto comparable a través de los elementos transportadores 12 controlados que con otra disposición. Los elementos transportadores 12 en la figura 2b están desplazados en segmentos transversalmente a la dirección de transporte 6, de modo que dos elementos transportadores 12 contiguos desembocan en cada caso en un elemento transportador 12. Y en la figura 2c, los elementos transportadores 12 dispuestos uno detrás de otro a lo largo de la dirección de transporte 6 forman en cada caso recorridos de transporte continuos que están dispuestos en cada caso desplazados con respecto a sus elementos transportadores 12. Sin embargo, la disposición de las figuras 2b, 2c puede ofrecer ventajas, en particular para bultos sueltos 4 más pequeños de una corriente de paquetes, que de otro modo solo descansan sobre un elemento transportador 12.
En un sistema de transporte 2 que funciona con el procedimiento de acuerdo con la invención, es ventajoso un diseño de igual longitud de todos los elementos transportadores 12 sin una división en secciones 22/24 (figura 2a), ya que todos los elementos transportadores 12 son de la misma longitud y por tanto los bultos sueltos 4 se manipulan del mismo modo por toda la zona.
La figura 3 muestra un diagrama de flujo para determinar el vector de acción a(t) de acuerdo con la invención. Dado que para cada elemento transportador 12 debe ajustarse una velocidad de la cinta desde un intervalo continuo (por ejemplo, entre 0,1 m/s y 3,5 m/s), por ejemplo con 85 elementos transportadores el espacio de acción es un subconjunto de RA85, que está muy por encima de la complejidad que puede aprenderse utilizando procedimientos conocidos (por ejemplo, porque en general el número de ejemplos de entrenamiento requeridos aumenta exponencialmente con la dimensión de los espacios de datos).
Por lo tanto, no se crea un vector de estado s(t) para todo el sistema de transporte 2, sino que basándose en una imagen del sensor 26, para cada bulto suelto 4<1>, 4<n>se crea un vector de estado individual s<1>(t), s<n>(t). Los vectores de estados<1>(t), s<n>(t) se construyen de manera que para cada bulto suelto 4<1>, 4<n>presenta la misma dimensión. Esto significa que, en particular, el número de bultos sueltos 4' contiguos considerados permanece constante, al limitarse, por ejemplo, a los dos o tres bultos sueltos siguientes a una distancia predeterminada. Los bultos sueltos 4 que se encuentran más alejados son irrelevantes para la orientación y el ajuste de la distancia de este bulto suelto 4 y no deben tenerse en cuenta. Esta restricción da como resultado un vector de estado s<n>(t) de tamaño constante independientemente del número real de bultos sueltos 4. En el caso de que el número total de bultos sueltos 4' realmente contiguos sea menor que el número de paquetes contiguos considerados, la información de estado correspondiente del vector de estado s<n>(t) se puede llenar con valores por defecto. En este caso son adecuados valores que proceden, por ejemplo, de los denominados bultos sueltos 4' virtuales con una distancia suficiente y una orientación perfecta sobre la cinta. Los valores de los bultos sueltos virtuales 4' deben seleccionarse de modo que tengan la menor influencia posible en la regulación del bulto suelto contemplado 4<n>.
Para reducir adecuadamente el espacio de acción, sólo se utiliza una cantidad parcial de elementos transportadores 12 para cada bulto suelto 4<n>. Esto es básicamente posible porque desde la perspectiva de un bulto suelto individual 4<n>en un momento t no son relevantes todos los elementos transportadores 12, sino sólo un subconjunto de los elementos transportadores 12, en particular aquellos en los que se encuentra el bulto suelto 4<n>. Dependiendo del tamaño y orientación del bulto suelto 4<n>y los elementos transportadores 12, sin embargo, el número de elementos transportadores 12 relevantes varía. Sin embargo, para el aprendizaje automático, los vectores de acción a<n>(t) deben tener una dimensión constante. La dimensión de los vectores de acción a<n>(t) es por tanto menor que el número de elementos transportadores 12 de todo el sistema de transporte 2 con el fin de reducir la dimensión del problema global. Debe encontrarse una abstracción adecuada para ello. Por ejemplo, el vector de acción a<n>(t) por bulto suelto 4<n>puede seleccionarse de forma que sólo contenga determinados elementos transportadores 12, por ejemplo los situados bajo los vértices v-<i>, v<2>, v<3>, v<4>de un bulto suelto 4, así como bajo su centro de gravedad (estimado) v<c>, (Figura 5). En la figura 6, un vector de acción de 5 dimensiones a<n>(t) vendría dado por las velocidades de cinta v<21>, v<- n>, v<13>, v<23>(2,01, 2,04, 2,04, 0,10) [m/s] por debajo de los 4 vértices y por la velocidad de cinta v<s>(2,04 m/s) por debajo del centro de gravedad.
Una representación alternativa del vector de acción a<n>(t) sería la división del área base del bulto suelto 4<n>o un rectángulo de circunscripción en un número fijo de zonas, donde cada zona se describe mediante una velocidad v<i>. Alternativamente, el vector de acción a<n>(t) también puede describir un vector de velocidad del bulto suelto 4<n>. La representación del vector de acción a<n>(t) es en cualquier caso independiente de los elementos transportadores reales 12, pero determina su control en el curso posterior del proceso.
Los procedimientos de aprendizaje por refuerzo utilizan una función de estrategia(política) que representa un vector de estado s<n>(t) en un vector de acción a<n>(t) del espacio de acción, es decir, la función de estrategia selecciona velocidades de cinta adecuadas dependiendo de la situación respectiva representada en el vector de estado s<n>(t). La función estratégica se representa por regla general mediante un modelo aprendido por máquina (red neuronal, proceso gaussiano, bosque aleatorio, ecuaciones parametrizadas, etc.). La representación del vector de acción seleccionado a<n>(t) en los elementos transportadores reales 12 influye en el estado subsiguientes s<n>(t+At) del bulto suelto. Para entrenar la estrategia, basándose en el estado subsiguiente s<n>(t+At) se otorga una recompensa, que el agente utiliza para adaptar los vectores de acción del espacio de acción y así mejorar la estrategia. También es posible otorgar una recompensa para comparar el estado subsiguiente s<n>(t+At) con el estado inicial s<n>(t) o con estados más distantes s<n>(t-At), s<n>(t-2At),... Esta comparación aislada del estado subsiguiente con el estado anterior o con algo más que el estado inmediatamente anterior y/o la evaluación aislada del estado subsiguiente s<n>(t+At) combinado con una evaluación cuantificada con recompensas permite adaptar el modelo de estrategia.
Por lo tanto, el modelo de estrategia se mejora de modo que en el futuro para el estado inicial s<n>(t), se seleccionan vectores de acción aún más adecuados a<n>(t) y se representan en el sistema de transporte 2 real. Sin embargo, también es posible optimizar la estrategia de antemano con un sistema de transporte real o virtual según el modo de proceder descrito y aplicar simplemente esta estrategia ya predeterminada a los vectores de estado individuales s<n>(t) durante el control del sistema de transporte 2.
Por un lado, es posible optimizar la estrategia y, por tanto, la selección de los vectores de acción a<n>(t) para cada bulto suelto 4, 4<n>durante el funcionamiento de la instalación 2 (es decir, la estrategia sigue aprendiendo o entrenándose durante la realización del procedimiento). O la estrategia se puede entrenar y predeterminar previamente usando datos de entrenamiento (por ejemplo, datos históricos del funcionamiento de la instalación usando el "control estándar"), con la misma instalación 2 o una comparable y diferente ocupación de bulto suelto o con ayuda de una simulación de la instalación 2. Por un lado, esta estrategia predeterminada se puede utilizar como una "estrategia inicial" predeterminada y luego esta estrategia predeterminada se entrena adicionalmente y, por lo tanto, se optimiza durante la realización del procedimiento. O esta estrategia predeterminada simplemente se aplica sin optimización adicional en los estados de los bultos sueltos 4<n>representados en los vectores de estado s<n>(t) durante el tiempo de ejecución -la estrategia ya no se modifica durante el tiempo de ejecución.
Dado que se conocen las coordenadas de lugar del bulto suelto 4 y de los elementos transportadores 12, los estados de los bultos sueltos 4 del mundo real se pueden representar en vectores de estado s<n>(t) del mundo virtual. Para cada bulto suelto 4 individualmente, según su vector de estado s<n>(t) con una estrategia en el mundo virtual se selecciona un vector de acción a<n>(t). Este vector de acción a<n>(t) a su vez se puede representar volviendo a los elementos transportadores 12 del sistema de transporte 2 real, de modo que estos elementos transportadores 12 se controlan con las velocidades representadas del vector de acción a<n>(t), después de lo cual el bulto suelto 4 y todo el sistema de transporte 2 se transfiere a un estado subsiguiente. En cada caso después del transcurso de un tiempo de ciclo At, este proceso se evalúa basándose en una recompensa, lo que mejora la estrategia. Este proceso se realiza para cada bulto suelto 4 en el área de la imagen hasta que el bulto suelto 4 haya abandonado la zona de la imagen.
Después del transcurso de cada tiempo de ciclo At, es decir, esencialmente al mismo tiempo que la determinación de las velocidades v de aquellos elementos transportadores en los que un vector de acción a<n>(t) se ha representado, se determinan las velocidades de aquellos elementos transportadores 12, en los que sin embargo el vector de acción a<n>(t) no se ha representado. Las velocidades de estos elementos transportadores 12 se determinan y controlan de acuerdo con esta determinación mediante el equipo de regulación.
Esto se refiere a los elementos transportadores 12 sobre los que descansa el bulto suelto 4<n>sobre los cuales no se ha representado ningún vector de acción a<n>(t) de este bulto suelto 4<n>. Las velocidades v de estos elementos transportadores 12 se determinan mediante interpolación, por ejemplo, interpolación bilineal, de las velocidades v de aquellos elementos transportadores 12 contiguos en los que se ha representado un vector de acción a<n>(t) de este bulto suelto 4.
Esto también se refiere a aquellos elementos transportadores en los que ni descansa ningún bulto suelto 4<n>ni sobre los que no se ha representado ningún vector de acción a<n>(t) de un bulto suelto 4<n>. Las velocidades v de estos elementos transportadores 12 pueden determinarse según uno de los modos de proceder siguientes, que también pueden combinarse entre sí:
Interpolando las velocidades v de aquellos elementos transportadores contiguos 12 en los que no se ha representado ningún vector de acción a<n>(t) de un bulto suelto 4<n>. Para los elementos transportadores de borde 12 se pueden asumir condiciones marginales especiales. Las velocidades v se determinan basándose en los parámetros de velocidad del sistema de transporte 2 (valores estándar de la instalación o simulación, por ejemplo, promedio de todos los elementos transportadores del vector de acción). La velocidad v de los elementos transportadores 12, en cuyos elementos transportadores 12 contiguos no se ha representado el vector de acción a<n>(t) de un bulto suelto 4<n>se seleccionan de modo que coincidan con la velocidad de este elemento transportador contiguo 12. En este sentido pueden surgir conflictos potenciales que pueden resolverse, por ejemplo, priorizando y/o promediando de forma ponderada. Las velocidades para algunos o todos estos elementos transportadores 12 pueden ser idénticas y determinarse a partir del promedio de las velocidades de los elementos transportadores 12 en los que ha representado un vector de acción a<n>(t) de un bulto suelto 4<n>.
Una ventaja esencial del procedimiento de acuerdo con la invención es que la estrategia se entrena desde la perspectiva de un bulto suelto 4<n>en cada caso para todos los bultos sueltos 4 futuros (y para estados futuros de este mismo bulto suelto 4) y además se utiliza como estrategia común y compartida para todos los bultos sueltos 4. Por tanto, el mismo modelo de estrategia se aplica a cada bulto suelto 4, 4<1>, 4<n>y se calcula un vector de acción local individual a<1>(t), a<n>(t) en cada caso basado en el vector de estado individual s<1>(t), s<n>(t).
Los vectores de acción a<1>(t), a<n>(t) se representan en los elementos transportadores reales 12 como una matriz banda global (que comprende todos los elementos transportadores 12). Los elementos transportadores 12 intermedios reciben valores interpolados adecuadamente (por ejemplo, mediante interpolación bilineal). Pueden surgir conflictos al representar en la matriz banda real, es decir, más de un paquete 4 se dirige al mismo elemento transportador 12. Estos conflictos, varios de los cuales se muestran en la figura 7, se resuelven priorizando y/o promediando de forma ponderada dependiendo de la superposición del bulto suelto 4 con el elemento transportador 12 y el estado del paquete. Por ejemplo, un paquete 4 con poca superposición obtiene un peso bajo en el promedio de la velocidad de su vector de acción a(t) proyectada sobre el elemento transportador 12. La lógica correspondiente puede especificarse mediante conocimientos expertos o aprenderse también mediante una máquina. La superposición de cada bulto suelto 4 con sus elementos transportadores 12 puede representarse en el vector de estado s<n>(t) o de otra manera.
La función de estrategia puede entrenarse utilizando datos reales o simulados. En particular, el entrenamiento puede continuar en el cliente durante el funcionamiento, lo que permite que el sistema de transporte se adapte automáticamente a las propiedades cambiantes del flujo de paquetes (tamaño, peso, forma y material de los paquetes).
De acuerdo con una forma de realización, el vector de estado s<n>(t) de un bulto suelto 4<n>puede comprender una o más de las siguientes informaciones: información de estado del paquete pertinente 4 (y de los paquetes contiguos 4') como posiciones, velocidades, orientación, ... información global sobre el estado del sistema de transporte 2: número de paquetes 4, velocidad media v, priorización por el usuario, ...
Lista de referencias
2 Sistema de transporte
4 Bulto suelto
6 Dirección de transporte
8 Recorrido de transporte
10 Segmento
12 Transportador
18 Dispositivo de ensanchamiento
20 Transportador de transferencia
22 Sección de orientación
24 Sección de corrección de distancia
26 Sensor
v Velocidad
a(t) Vector de acción
s(t) Vector de estado
At Tiempo de ciclo

Claims (15)

REIVINDICACIONES
1. Procedimiento implementado por ordenador para controlar un equipo de regulación de un sistema de transporte (2) para el transporte de bultos sueltos (4) de al menos un tipo, en particular envíos postales y bultos de equipaje, en donde el sistema de transporte (2) presenta una multitud de elementos transportadores (12) orientados a lo largo de y paralelos a una dirección de transporte (6), los elementos transportadores 12) se accionan controlando el equipo de regulación mediante un accionamiento asociado en cada caso con una velocidad (v) ajustable individualmente para lograr una orientación y/o una distancia definida de los bultos sueltoscaracterizado por que
el control del equipo de regulación (14) se determina mediante al menos un agente predeterminado o que actúa según métodos de aprendizaje por refuerzo, que, de acuerdo con una estrategia, selecciona en términos de situación una acción desde un espacio de acción para un estado inicial con el fin de llegar a un estado subsiguiente, en donde los estados con vectores de estado (s(t), s(t+At)) y las acciones se pueden representar con vectores de acción (a(t), a(t+ At)) que comprende las etapas de procedimiento:
a) crear una imagen inicial del sistema de transporte (2);
b) para cada uno de los bultos sueltos (4<n>) en la imagen, crear individualmente un vector de estado s<n>(t) de una dimensión fijada previamente e igual para todos los bultos sueltos (4, 4<n>) de un tipo, que comprenda información de estado del elemento pertinente (4<n>) extraída de la imagen creada inmediatamente antes;
c) para cada bulto suelto (4<n>) seleccionar individualmente un vector de acción (a<n>(t)) de un espacio de acción de acuerdo con la misma estrategia (política) para todos los bultos sueltos (4) de un tipo para el vector de estado actual (s<n>(t)) de este bulto suelto (4<n>), en donde la dimensión del vector de acción (a<n>(t)) está predeterminada; y d) para cada bulto suelto (4<n>), representar el vector de acción (a<n>(t)) en los elementos transportadores (12) reales de este bulto suelto (4<n>) para determinar la velocidad (v) de estos elementos transportadores (12), y el correspondiente control de los elementos transportadores (12) con el equipo de regulación.
2. Procedimiento según la reivindicación 1, que comprende además
e) después de que haya transcurrido un tiempo de ciclo (At), crear una imagen subsiguiente del sistema de transporte (2) y realizar la etapa de procedimiento b) para obtener un vector de estado del estado subsiguiente (s<n>(t+At)) para cada bulto suelto (4<n>);
f) si la estrategia para bultos sueltos (4) de un tipo debe seguir entrenándose durante la realización del procedimiento, el vector de estado del estado subsiguiente (s<n>(t+At)) se evalúa para cada bulto suelto (4<n>) de este tipo mediante un método del aprendizaje por refuerzo basado en una recompensa después de lo cual el agente entrena y, por tanto optimiza, su estrategia para bultos sueltos (4) de este tipo, adaptando los vectores de acción (a<n>(t)) del espacio de acción; y
g) realizar de nuevo las etapas de procedimiento c) - f) para cada bulto suelto (4<n>), utilizando la estrategia mejorada o predeterminada, siempre que el bulto suelto (4<n>) correspondiente se represente en la imagen subsiguiente.
3. Procedimiento según la reivindicación 1 o 2, que comprende además la etapa de procedimiento de
asociar los bultos sueltos (4, 4') en la imagen a un primer tipo y al menos a otro tipo dependiendo de las propiedades de los bultos sueltos (44') y para cada tipo asociado proporcionar a un agente una estrategia para bultos sueltos (4, 4') de este tipo.
4. Procedimiento según una de las reivindicaciones 2 o 3, que comprende además la etapa de procedimiento de para cada tiempo de ciclo (At) y para cada bulto suelto (4<n>), determinar las velocidades (v) de aquellos elementos transportadores (12) sobre los que descansa el bulto suelto (4<n>) pero en los que no se ha representado ningún vector de acción a<n>(t) de este bulto suelto (4<n>), y el correspondiente control individual de estos mismos elementos transportadores (12) con el equipo de regulación, en donde las velocidades (v) se determinan por interpolación de las velocidades (v) de aquellos elementos transportadores (12) contiguos en los que se ha representado un vector de acción (a<n>(t)) de este bulto suelto (4<n>).
5. Procedimiento según una de las reivindicaciones 2 a 4, que comprende además la etapa de procedimiento de para cada tiempo de ciclo (At), determinar las velocidades (v) de todos aquellos elementos transportadores (12) sobre los que ni descansa ningún bulto suelto (4) ni en los que no se ha representado ningún vector de acción (a<n>(t)) de un bulto suelto (4), y control individual correspondiente de estos elementos transportadores (12) con el equipo de regulación, en donde
- las velocidades (v) se determinan por interpolación de las velocidades (v) de aquellos elementos transportadores contiguos (12) en los que se ha representado un vector de acción (a<n>(t)) de un bulto suelto (4<n>); y/o
- las velocidades (v) se determinan utilizando los parámetros de velocidad del sistema de transporte (2); y/o - la velocidad (v) de los elementos transportadores (12), en cuyos elementos transportadores (12) contiguos no se ha representado el vector de acción (a<n>(t)) de un bulto suelto (4<n>) se seleccionan de modo que coincidan con la velocidad de este elemento transportador contiguo (12); y/o
- las velocidades son idénticas para algunos o todos estos elementos transportadores (12) y se determinan a partir del promedio de las velocidades de los elementos transportadores (12) en los que se ha representado un vector de acción (a<n>(t)) de un bulto suelto (4<n>).
6. Procedimiento según una de las reivindicaciones anteriores,caracterizado por que
la información de estado de un bulto suelto (4<n>) representada en el vector de estado (s<n>(t)) comprende la posición y/o la orientación del bulto suelto (4<n>).
7. Procedimiento según una de las reivindicaciones anteriores,caracterizado por que
la información de estado de un bulto suelto (4) representada en el vector de estado (s<n>(t)) o de otro modo comprende
- superposición del bulto suelto (4) con los elementos transportadores (12) sobre los que descansa el bulto suelto (4); y/o
- información de estado de un número predeterminado de bultos sueltos (4) contiguos más próximos dentro de una distancia predeterminada, que comprende al menos su posición y/o su distancia al bulto suelto (4) del vector de estado (s<n>(t)), en donde en caso de un número de bultos sueltos (4') contiguos más próximos inferior al número predeterminado se dota al vector de estado (s<n>(t)) de valores por defecto; y/o
- velocidad y/o tamaño del bulto suelto (4); y/o
- información de estado global del sistema de transporte (2), por ejemplo, que comprende un número de bultos sueltos (4) en el sistema de transporte (2), velocidad media del sistema de transporte (2), priorización de bultos sueltos (4) individuales, por ejemplo, en función del tamaño y/o del criterio de clasificación.
8. Procedimiento según una de las reivindicaciones anteriores,caracterizado por que
el vector de acción (a<n>(t)) sólo describe las velocidades que se sitúan por debajo de puntos o superficies predeterminados del bulto suelto (4).
9. Procedimiento según una de las reivindicaciones anteriores,caracterizado por que
cuando los vectores de acción (a<n>(t), a<n>(t)) asociados a dos o más bultos sueltos (4, 4') se representan en el mismo elemento transportador (12) se realiza una priorización y/o un cálculo de promedio ponderado de las velocidades especificadas por los vectores de acción (a<n>(t), a<n>(t)) en función de la superposición respectiva de estos bultos sueltos (4) con este elemento transportador (12) y/o de una calidad de los vectores de estado (s<n>(t)); y/o cuando dos elementos del vector de acción (a<n>(t)) de un bulto suelto (4<n>) se representan en el mismo elemento transportador (12), este elemento transportador (12) se controla con un promedio de estos elementos o uno de los elementos se prefiere en su totalidad o de manera ponderada.
10. Procedimiento según una de las reivindicaciones anteriores,caracterizado por que
la imagen se evalúa utilizando métodos de procesamiento de imágenes y los vectores de estado (s<n>(t)) se crean basándose en la imagen evaluada y/o
un primer intento de crear los vectores de estado(s<n>(t)) se lleva a cabo automáticamente a partir de la imagen mediante el aprendizaje por refuerzo profundo.
11. Procedimiento según una de las reivindicaciones 1 a 10, que comprende además la etapa de procedimiento de entrenar la estrategia del agente para bultos sueltos (4) de un tipo con un sistema de transporte virtual o real (2', 2).
12. Dispositivo para el procesamiento de datos para un control implementado por ordenador de un equipo de regulación de un sistema de transporte (2) para el transporte de bultos sueltos (4) de al menos un tipo, en particular envíos postales y bultos de equipaje, en donde el sistema de transporte (2) presenta una multitud de elementos transportadores (12) orientados a lo largo y paralelos a una dirección de transporte (6), en donde los elementos transportadores (12) se accionan bajo el control del equipo de regulación mediante un accionamiento asociado en cada caso con una velocidad ajustable individualmente para lograr una orientación y/o una distancia definida de los bultos sueltos, en donde el control del equipo de regulación se determina por al menos un agente que actúa según métodos de aprendizaje por refuerzo, que, de acuerdo con una estrategia para bultos sueltos (4) de un tipo selecciona en términos de situación una acción desde un espacio de acción para un estado inicial con el fin de llegar a un estado subsiguiente, en donde los estados con vectores de estado y las acciones con vectores de acción pueden representarse, en donde los bultos sueltos sobre el sistema de transporte (2) pueden detectarse mediante al menos un sensor (26) y el equipo de regulación comprende una unidad de cálculo; que comprende medios para la realización del procedimiento según una de las reivindicaciones precedentes.
13. Dispositivo según la reivindicación 12,caracterizado por que
el dispositivo está diseñado para la realización del procedimiento según una de las reivindicaciones 2 a 11.
14. Sistema de transporte (2) para transportar bultos sueltos (4) de al menos un tipo, en particular envíos postales y bultos de equipaje, en donde el sistema de transporte (2) presenta una multitud de elementos transportadores (12) orientados a lo largo y en paralelo a una dirección de transporte (6), en donde los elementos transportadores (12) se accionan controlando un equipo de regulación mediante un accionamiento asociado en cada caso con una velocidad ajustable individualmente para lograr una orientación y/o una distancia definida de los bultos sueltos, en donde el control del equipo de regulación se determina por al menos un agente que actúa según métodos de aprendizaje por refuerzo, que de acuerdo con una estrategia igual para todos los bultos sueltos (4) de un tipo, selecciona en términos de situación una acción desde un espacio de acción para un estado inicial para llegar a un estado subsiguiente, en donde los estados pueden representarse con vectores de estado y las acciones pueden representarse con vectores de acción, en donde el sistema de transporte (2) comprende un dispositivo según la reivindicación 12 o 13.
15. Programa informático que comprende instrucciones que, cuando son ejecutadas por una unidad de cálculo conectada a un sistema de transporte (2) según la reivindicación 14, instan a que la unidad de cálculo ejecute el procedimiento según una de las reivindicaciones 1 a 11.
ES22706264T 2021-03-01 2022-02-01 Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte Active ES2992341T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP21159819.8A EP4053650B1 (de) 2021-03-01 2021-03-01 Computerimplementiertes verfahren, vorrichtung zur datenverarbeitung und computersystem zum ansteuern einer regelungseinrichtung eines fördersystems
PCT/EP2022/052335 WO2022184358A1 (de) 2021-03-01 2022-02-01 Computerimplementiertes verfahren, vorrichtung zur datenverarbeitung und computersystem zum ansteuern einer regelungseinrichtung eines fördersystems

Publications (1)

Publication Number Publication Date
ES2992341T3 true ES2992341T3 (es) 2024-12-11

Family

ID=74844754

Family Applications (2)

Application Number Title Priority Date Filing Date
ES21159819T Active ES2966145T3 (es) 2021-03-01 2021-03-01 Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte
ES22706264T Active ES2992341T3 (es) 2021-03-01 2022-02-01 Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte

Family Applications Before (1)

Application Number Title Priority Date Filing Date
ES21159819T Active ES2966145T3 (es) 2021-03-01 2021-03-01 Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte

Country Status (7)

Country Link
US (1) US12351401B2 (es)
EP (2) EP4053650B1 (es)
CA (1) CA3212285A1 (es)
DK (1) DK4053650T3 (es)
ES (2) ES2966145T3 (es)
PT (2) PT4053650T (es)
WO (1) WO2022184358A1 (es)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP4342826A1 (de) * 2022-09-20 2024-03-27 Schneider Electric Industries SAS Verfahren zur erstellung einer steuerung für ein transportsystem
DE102023134877A1 (de) * 2023-12-13 2025-06-18 Körber Supply Chain Logistics Gmbh Computerimplementiertes Verfahren zur Bestimmung einer Steuerungsstrategie zur Steuerung eines Handhabungsprozesses von zumindest einer Handhabungsvorrichtung zum Handhaben von Stückgütern, Computerprogramm und Handhabungsvorrichtung zum Handhaben von Stückgütern

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20160239000A1 (en) * 2015-02-12 2016-08-18 Nec Laboratories America, Inc. TS-DIST: Learning Adaptive Distance Metric in Time Series Sets
DE102015117241B4 (de) * 2015-10-09 2018-11-15 Deutsche Post Ag Ansteuerung einer Förderanlage
EP3287396B1 (de) * 2016-08-25 2023-12-06 Körber Supply Chain Logistics GmbH Fördersystem mit segmenten
WO2019182952A1 (en) * 2018-03-20 2019-09-26 Tokyo Electron Limited Self-aware and correcting heterogenous platform incorporating integrated semiconductor processing modules and method for using same
DE102019108126A1 (de) * 2019-03-28 2020-10-01 Weber Maschinenbau Gmbh Breidenbach Vorrichtung zum Fördern von Produkten
US20220027529A1 (en) * 2020-07-21 2022-01-27 Rockwell Automation Technologies, Inc. Controls system based digital twin for supervisory control of independent cart technology tracks and lines
US12459752B2 (en) * 2021-12-08 2025-11-04 Intelligrated Headquarters, Llc Conveyor system control via predictive feed-forward mapping
US20220105629A1 (en) * 2021-12-16 2022-04-07 Venkat Natarajan Failure rate estimation and reinforcement learning safety factor systems

Also Published As

Publication number Publication date
PT4053650T (pt) 2023-12-12
DK4053650T3 (da) 2023-12-11
EP4053650B1 (de) 2023-09-06
EP4302159B1 (de) 2024-10-02
US20240140724A1 (en) 2024-05-02
EP4053650A1 (de) 2022-09-07
PT4302159T (pt) 2024-11-21
EP4302159A1 (de) 2024-01-10
ES2966145T3 (es) 2024-04-18
WO2022184358A1 (de) 2022-09-09
CA3212285A1 (en) 2022-09-09
US12351401B2 (en) 2025-07-08

Similar Documents

Publication Publication Date Title
Vitelli et al. Safetynet: Safe planning for real-world self-driving vehicles using machine-learned policies
ES2966145T3 (es) Procedimiento implementado por ordenador, dispositivo para el procesamiento de datos y sistema informático para controlar un equipo de regulación de un sistema de transporte
Zhou et al. Development of an efficient driving strategy for connected and automated vehicles at signalized intersections: A reinforcement learning approach
Deo et al. How would surround vehicles move? A unified framework for maneuver classification and motion prediction
Pazour et al. A model to design a national high-speed rail network for freight distribution
ES2264662T3 (es) Sistema de transporte de objetos.
Klimke et al. Cooperative behavior planning for automated driving using graph neural networks
US20230274646A1 (en) Method for efficient route planning of vehicles in a sorting system
US20120228085A1 (en) system for rotating a number of packages
Semsar-Kazerooni et al. Multi-objective platoon maneuvering using artificial potential fields
Hang et al. Conflict resolution for connected automated vehicles at unsignalized roundabouts considering personalized driving behaviours
Sierra-Garcia et al. Federated discrete reinforcement learning for automatic guided vehicle control
Santos et al. Cohesion and segregation in swarm navigation
Hartmann et al. Competitive driving of autonomous vehicles
US20210397200A1 (en) Method for moving a driverless transport vehicle on an inclined transport roadway
Keskin et al. Altruistic control of connected automated vehicles in mixed-autonomy multi-lane highway traffic
Karalakou et al. Deep RL reward function design for lane-free autonomous driving
JP5785693B2 (ja) 増列装置
Jain et al. Collision avoidance for multiple static obstacles using path-velocity decomposition
US20250033896A1 (en) Dynamic sorting of items in a conveyor system
JP7782702B2 (ja) 交通分散制御システム、方法、及びプログラム
AU2023321641A1 (en) Method and system for transporting items
Jayawardana et al. Multi-residual Mixture of Experts Learning for Cooperative Control in Multi-vehicle Systems
US20240002160A1 (en) Process for controlling a conveyor line for items of general cargo that has been added by retrofitting
Yazgan et al. Centralized Decision-Making for Platooning By Using SPaT-Driven Reference Speeds