KR20220121568A - 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법 - Google Patents

강화학습을 이용한 생산공정의 스케줄링 장치 및 방법 Download PDF

Info

Publication number
KR20220121568A
KR20220121568A KR1020210025807A KR20210025807A KR20220121568A KR 20220121568 A KR20220121568 A KR 20220121568A KR 1020210025807 A KR1020210025807 A KR 1020210025807A KR 20210025807 A KR20210025807 A KR 20210025807A KR 20220121568 A KR20220121568 A KR 20220121568A
Authority
KR
South Korea
Prior art keywords
estimation function
function
reinforcement learning
permutation
learning
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
KR1020210025807A
Other languages
English (en)
Inventor
김병욱
김성준
Original Assignee
창원대학교 산학협력단
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 창원대학교 산학협력단 filed Critical 창원대학교 산학협력단
Priority to KR1020210025807A priority Critical patent/KR20220121568A/ko
Publication of KR20220121568A publication Critical patent/KR20220121568A/ko
Ceased legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B19/00Program-control systems
    • G05B19/02Program-control systems electric
    • G05B19/418Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM]
    • G05B19/41865Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM] characterised by job scheduling, process planning, material flow
    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B19/00Program-control systems
    • G05B19/02Program-control systems electric
    • G05B19/418Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM]
    • G05B19/4183Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM] characterised by data acquisition, e.g. workpiece identification
    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B19/00Program-control systems
    • G05B19/02Program-control systems electric
    • G05B19/418Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM]
    • G05B19/41885Total factory control, i.e. centrally controlling a plurality of machines, e.g. direct or distributed numerical control [DNC], flexible manufacturing systems [FMS], integrated manufacturing systems [IMS] or computer integrated manufacturing [CIM] characterised by modeling, simulation of the manufacturing system
    • GPHYSICS
    • G05CONTROLLING; REGULATING
    • G05BCONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
    • G05B23/00Testing or monitoring of control systems or parts thereof
    • G05B23/02Electric testing or monitoring
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02PCLIMATE CHANGE MITIGATION TECHNOLOGIES IN THE PRODUCTION OR PROCESSING OF GOODS
    • Y02P90/00Enabling technologies with a potential contribution to greenhouse gas [GHG] emissions mitigation
    • Y02P90/30Computing systems specially adapted for manufacturing

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Automation & Control Theory (AREA)
  • Manufacturing & Machinery (AREA)
  • Quality & Reliability (AREA)
  • Theoretical Computer Science (AREA)
  • Software Systems (AREA)
  • Evolutionary Computation (AREA)
  • Computing Systems (AREA)
  • Mathematical Physics (AREA)
  • Medical Informatics (AREA)
  • Data Mining & Analysis (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Preparation Of Compounds By Using Micro-Organisms (AREA)
  • Forging (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

본 발명은 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법에 관한 것이다. 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 장치는 작업에 대한 일정을 추정함수로 생성하는 생성모듈, 상기 작업에 대한 파라미터를 입력하는 입력모듈, 상기 추정함수 및 파라미터를 전처리하는 전처리모듈, 상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습모듈 그리고 상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력모듈을 포함하여 구성된다.

Description

강화학습을 이용한 생산공정의 스케줄링 장치 및 방법{Device and method for production process using reinforcement learning}
본 발명은 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법에 관한 것으로, 보다 상세하게는 서로 다른 작업 시간을 갖는 기계와 다수의 작업에 대해 최종 공정시간을 최소화하도록 강화학습을 이용하여 생산공정의 작업순열을 스케줄링하는 장치 및 방법에 관한 것이다.
산업 발전에 따라 소품종 대량생산 설비, 다품종 소량생산 설비 등의 제조공정에서 설비는 성과목표가 향상된 기술, 생산의 효율성이 증대된 기술을 요구하고 있다. 이러한 요구에 따라 흐름생산 공정 또는 개별 작업 생산 공정의 작업 일정을 최적화하는 생산일정 연구가 활발히 진행되고 있다.
생산일정 연구에서 NP-hard의 문제는 일련의 m개의 기계에서 n개의 작업이 처리되도록 흐름생산 공정을 적용할 수 있다. 예를 들어, 흐름생산 공정은 전자, 종이 및 섬유 산업, 콘크리트 생산 산업, 사진 필름 제조 산업과 같은 일반적인 제조 분야 또는 인터넷 서비스 시스템, 컨테이너 처리 시스템, 토목 시스템과 같은 비 제조 분야에서도 활용할 수 있다.
종래의 흐름생산 공정 기술의 문제점을 해결하기 위해 단일 또는 복수의 기계에서 최적의 작업 시간을 도출하는 분기 한정법 알고리즘, NEH 휴리스틱 알고리즘,
Figure pat00001
-탐욕 선택에 기반으로 한 휴리스틱 알고리즘, 확률 분포를 통한 선택 알고리즘이 개발되었다. 이와 같은 알고리즘은 소규모 흐름생산에 대한 최적의 생산 일정을 도출할 수 있다. 또한 Simulated Annealing(SA), Tabu Search(TS), Genetic Algorithm(GA)와 같은 메타 휴리스틱 접근 알고리즘, 흐름 상점 스케줄링을 위한 하이브리드 유전 알고리즘(hybrid genetic algorithm, HGA), 전체 공정 시간을 최소화하는 변형 SA 알고리즘은 초기의 작업 일정 결과를 기초하여 작업순열을 직접적으로 탐색할 수 있다.
다만, 상기한 알고리즘은 계산 복잡도 및 계산 비용이 매우 높아 비효율적이고 산업분야에 적용하기 어렵다. 또한 복잡한 품종 생산 작업에서는 최적의 작업 순열을 도출하는 방향의 알고리즘을 수렴시키기 어렵다는 문제점이 있다.
이러한 문제점을 해결하기 위해 생산일정 기술은 유한 시간 내에 최적의 작업 일정을 도출하여 기계의 유휴 시간을 최소화하도록 일정계획 정책 및 추정함수의 정책을 탐색하는 강화학습 기반의 스케줄링 기술이 요구된다.
본 발명은 전술한 종래 기술의 문제점을 해결하기 위한 것으로서, 본 발명은 작업일정에 대한 추정함수를 학습 및 탐색하여 최적의 작업일정을 출력하는 생산공정의 스케줄링 장치 및 방법을 제공하는 것을 목적으로 한다.
본 발명은 Double-Q learning 기법으로 작업순열을 추정함수에 갱신하여 추정함수를 학습 및 탐색하는 생산공정의 스케줄링 장치 및 방법을 제공하는 것을 목적으로 한다.
본 발명의 목적은 이상에서 언급한 것으로 제한되지 않으며, 언급되지 않은 또 다른 목적들은 아래의 기재로부터 본 발명이 속하는 기술 분야의 통상의 지식을 가진 자에게 명확히 이해될 수 있을 것이다.
이와 같은 목적을 달성하기 위한 본 발명은, 작업에 대한 일정을 추정함수로 생성하는 생성모듈, 상기 작업에 대한 파라미터를 입력하는 입력모듈, 상기 추정함수 및 파라미터를 전처리하는 전처리모듈, 상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습모듈 그리고 상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력모듈을 포함하는 강화학습을 이용한 생산공정의 스케줄링 장치를 제공한다.
상기 강화학습모듈은, 상기 추정함수의 학습을 기설정된 횟수만큼 반복하는 반복부, 상기 추정함수의 반복 횟수여부를 탐색하는 탐색부, 상기 탐색부의 탐색 결과에 따라 상기 추정함수의 입실론 계수와 무작위 난수를 비교하는 비교부, 상기 비교결과에 따라 작업순열을 결정하는 결정부 및 상기 작업순열을 상기 반복부의 추정함수에 갱신하는 갱신부를 포함한다.
상기 강화학습모듈은, Double-Q learning 기법 또는 Dueling Architecture 기법을 활용하여 학습하는 것을 특징으로 한다.
상기 갱신부의 갱신시점을 판별하는 판별부를 더 포함한다.
상기 결정부는, 상기 추정함수의 입실론 계수가 상기 무작위 난수보다 클 경우 무작위로 작업순열을 결정하고, 상기 추정함수의 입실론 계수가 무작위 난수보다 작거나 같을 경우 상기 추정함수에 기초하여 작업순열을 결정하는 것을 특징으로 한다.
상기 출력모듈은, 상기 강화학습된 추정함수의 가중치 정보에 따라 상기 작업순열을 출력하는 것을 특징으로 한다.
상기 가중치 정보는, 상태함수, 행동함수, 이점함수에 대해 연산한 가중치를 이용하는 것을 특징으로 한다.
본 발명의 다른 특징에 따르면, 강화학습을 이용한 생산공정의 스케줄링 방법에 있어서, 작업에 대한 일정을 추정함수로 생성하는 생성단계, 상기 작업에 대한 파라미터를 입력하는 입력단계, 상기 추정함수 및 파라미터를 전처리하는 전처리단계, 상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습단계, 그리고 상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력단계를 포함하는 강화학습을 이용한 생산공정의 스케줄링 방법을 제공한다.
상기 강화학습단계는, 상기 추정함수의 학습을 기설정된 횟수만큼 반복하는 반복단계, 상기 추정함수의 반복 횟수여부를 탐색하는 탐색단계, 상기 추정함수의 입실론 계수와 무작위 난수를 비교하는 비교단계, 상기 비교결과에 따라 작업순열을 결정하는 결정단계 및 상기 작업순열을 상기 반복부의 추정함수에 갱신하는 갱신단계를 포함한다.
상기 갱신단계의 갱신시점을 판별하는 판별단계를 더 포함한다.
상기 결정단계는, 상기 추정함수의 입실론 계수가 상기 무작위 난수보다 클 경우 무작위로 작업순열을 결정하고, 상기 추정함수의 입실론 계수가 무작위 난수보다 작거나 같을 경우 상기 추정함수에 기초하여 작업순열을 결정하는 것을 특징으로 한다.
상기 출력단계는, 상태함수, 행동함수, 이점함수를 연산한 가중치를 기초로 한 추정함수의 가중치 정보에 따라 상기 작업순열을 출력하는 것을 특징으로 한다.
이상과 같은 본 발명의 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법에 따르면, 서로 다른 처리시간을 갖는 작업일정에 대한 추정함수를 학습 및 탐색하여 최적의 작업일정을 출력함으로써, 기계의 유휴시간을 최소화하여 기계시스템의 생산 효율성을 높일 수 있다.
본 발명은 Double-Q learning 기법으로 작업순열을 추정함수에 갱신하여 추정함수의 학습 및 탐색을 수행함으로써, 특정 상태에서 기계의 행동이 지나치게 과대평가되는 과적합 문제를 방지할 수 있는 기대효과를 가진다.
또한, 본 발명은 추정함수의 가중치 정보에 기초하여 강화 학습함으로써, 분산을 낮추고 수렴속도를 증가시킬 수 있다. 또한, 실제 산업현장에서 유동적으로 변경되는 작업순열 및 비용을 실시간으로 도출할 수 있어 실제 산업현장에서 적용할 수 있다.
본 발명에서 얻을 수 있는 효과는 이상에서 언급한 효과들로 제한되지 않으며, 언급하지 않은 또 다른 효과들은 아래의 기재로부터 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에게 명확하게 이해될 수 있을 것이다.
도 1은 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 장치를 설명하기 위한 블록도
도 2는 도 1의 강화학습모듈을 설명하기 위한 블록도
도 3은 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 방법을 설명하기 위한 흐름도
도 4는 도 3의 강화학습 단계를 설명하기 위한 흐름도
본 발명의 목적 및 효과, 그리고 그것들을 달성하기 위한 기술적 구성들은 첨부되는 도면과 함께 상세하게 후술되어 있는 실시 예들을 참조하면 명확해질 것이다. 본 발명을 설명함에 있어서 공지 기능 또는 구성에 대한 구체적인 설명이 본 발명의 요지를 불필요하게 흐릴 수 있다고 판단되는 경우에는 그 상세한 설명을 생략할 것이다.
그리고 후술되는 용어들은 본 발명에서의 기능을 고려하여 정의된 용어들로서 이는 사용자, 운용자의 의도 또는 관례 등에 따라 달라질 수 있다.
그러나 본 발명은 이하에서 개시되는 실시 예들에 한정되는 것이 아니라 서로 다른 다양한 형태로 구현될 수 있다. 단지 본 실시 예들은 본 발명의 개시가 완전하도록 하고, 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에게 발명의 범주를 완전하게 알려주기 위해 제공되는 것이며, 본 발명은 청구항의 범주에 의해 정의될 뿐이다. 그러므로 그 정의는 본 명세서 전반에 걸친 내용을 토대로 내려져야 할 것이다.
이와 같은 본 발명은 비록 한정된 실시 예와 도면에 의해 설명되나, 본 발명은 이것에 의해 한정되지 않으며, 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에 의해 본 발명의 기술 사상과 아래에 기재될 청구범위의 균등 범위 내에서 다양한 수정 및 변형이 가능함은 물론이다.
이하에서는 도면에 도시한 실시 예에 기초하면서 본 발명에 대하여 더욱 상세하게 설명하기로 한다. 그러나, 본원이 이러한 실시 예와 도면에 제한되는 것은 아니다.
이하, 첨부된 도면을 참조하여 본 발명의 구성에 대하여 상세히 설명한다.
도 1은 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 장치(1000)를 설명하기 위한 블록도이다.
도 1에 도시된 바와 같이, 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 장치(1000)는 작업에 대한 일정을 추정함수로 생성하는 생성모듈(100), 상기 작업에 대한 파라미터를 입력하는 입력모듈(200), 상기 추정함수 및 파라미터를 전처리하는 전처리모듈(300), 상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습모듈(400) 및 상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력모듈(500)을 포함한다.
생성모듈(100)은 기계 작업에 대한 일정을 추정함수로 생성한다. 여기서 추정함수는 가중치 정보를 포함하고 있는 상태함수, 행동함수, 이점함수일 수 있으며, 추정함수의 가중치 정보는 각 작업들의 가치에 대해 상대적으로 부여되는 중요도이며 상태함수, 행동함수, 이점함수 간의 연산을 통해 획득한 값일 수 있다.
또한, 추정함수는 듀얼 구조를 통해 현재상태에 따라 어떤 행동을 수행하는지를 판단하는 이점함수(advantage function)일 수 도 있다.
상기 이점함수는 하기 (수학식 1)과 같으며, 상기 (수학식 1)의 이점함수를 이용하여 하기 (수학식 2)와 같은 추정함수를 생성할 수 있다.
Figure pat00002
여기서, s는 현재 상태의 작업 또는 작업들, a는 다음 선택할 작업 또는 행동을 나타내며, S함수는 현재 상태의 작업(s)에 대해 다음 선택할 작업(a)들의 가중치 정보 함수이며, V함수는 작업들(s)에 대한 가중치 정보 함수를 의미한다.
Figure pat00003
여기서, s는 현재 상태의 작업 또는 작업들, a는 다음 선택할 작업 또는 행동을 나타내며, V함수는 전체 작업들(s)에 대한 가중치 정보 함수, A함수는 전체 작업들에서 다음 작업을 선택할 때의 가중치 정보 함수,
Figure pat00004
함수는 어떤 작업(s)에서의 선택할 수 있는 다음 작업(
Figure pat00005
)들에 대한 가중치 합의 평균을 구하는 함수를 의미한다.
본 발명의 일 실시예에 따르면, 생성모듈(100)은 학습환경의 과적합 문제를 해결하기 위해 두 개의 추정함수 또는 복수 개의 추정함수를 활용할 수 있다. 이는 특정 상태에서 선택한 행동에 대해 지나치게 과대평가된 가치를 학습하여 노이즈로 인해 학습환경에서 발생하는 과적합 문제를 방지하기 위함이다.
입력모듈(200)은 각각의 기계 및 작업의 파라미터가 입력되는 구성이다. 입력모듈(200)의 파라미터는 학습의 횟수, 속도, 작업의 소요시간, 무작위 난수 설정값을 포함한다.
전처리모듈(300)은 추정함수의 학습에 용이하도록 추정함수 및 파라미터를 전처리하고 추정함수 및 파라미터를 기 설정된 초기값으로 설정한다. 본 발명의 일 실시예에 따르면, 전처리모듈(300)은 Minmax Scaler 기법 또는 Standard Scaler 기법을 활용하여 파라미터를 전처리할 수 있다.
강화학습모듈(400)은 추정함수 및 파라미터를 이용하여 추정함수를 학습한다. 본 발명의 일 실시예에 따르면, 강화학습모듈(400)은 다중 목적함수 기반 강화학습 흐름 생산일정 및 목적함수의 파라미터에 대한 성능향상을 위해 Double-Q learning 기법 또는 Dueling Architecture 기법을 활용하여 학습할 수 있다.
도 2에 도시된 바와 같이, 강화학습모듈(400)은 반복부(410), 탐색부(420), 비교부(430), 결정부(440), 갱신부(450), 판별부(460)을 포함하여 구성된다.
반복부(410)는 추정함수의 학습을 기설정된 횟수만큼 반복하고, 탐색부(420)는 추정함수를 탐색하여 반복된 추정함수의 반복횟수를 탐색하며, 비교부(430)는 추정함수의 입실론 계수와 무작위 난수를 비교한다.
여기서, 입실론 계수는 추정함수의 탐색의 비율을 결정하는 계수이며 입실론 계수는 초기값인 '1'에서 점차 'O'으로 수렴할 수 있다. 그리고, 무작위 난수는 사용자에 의해 입력모듈(200)에 입력된 설정값에 해당된다.
결정부(440)는 비교부(430)의 비교결과에 따라 무작위 작업순열 또는 추정함수를 통한 작업순열을 결정하는 역할이다. 상기 무작위 작업순열은 입력된 작업의 파라미터가 무작위로 섞긴 작업 배열을 의미한다.
갱신부(450)는 결정된 무작위 작업순열 또는 추정함수를 통한 작업순열을 이용하여 추정함수를 갱신하는 역할이며, 작업순열에 따라 다음작업의 가중치 정보를 기반으로 갱신할 수 있다.
판별부(460)는 강화학습모듈(400)에서 잘못된 행동에 대한 가중치가 과평가되어 잘못된 방향으로 학습이 진행되는 것을 방지하기 위해 반복부(410)의 기설정된 반복횟수만큼 학습을 수행했는지, 탐색부(420)의 탐색을 수행했는지, 갱신부(450)의 갱신시점, 출력모듈(500)의 작업순열 결과를 판별한다.
출력모듈(500)은 강화학습된 추정함수를 통해 작업순열을 출력한다. 본 발명에 따른 추정함수는 가중치 정보를 포함하고 있어, 출력모듈(500)은 우수한 작업순열을 도출한 추정함수의 가중치 정보를 기반으로 최적의 작업순열을 출력하게 된다.
도 3은 본 발명에 따른 강화학습을 이용한 생산공정의 스케줄링 방법을 설명하기 위한 흐름도이다,
먼저, 생성모듈(100)은 작업에 대한 일정을 추정함수로 생성(S100)하고, 입력모듈(200)은 작업에 대한 파라미터를 입력(S200)한다. 여기서, S100단계는 가중치 정보를 포함하는 추정함수를 생성할 수 있으며, S200단계는 사용자에 의해 각각의 기계 및 작업에 따른 소요시간에 대한 정보를 입력하고, 학습 시 반복횟수 설정값, 학습 시 진행속도값, 난수 설정값 등을 입력할 수 있다.
그리고 나서, 전처리모듈(300)은 학습에 용이하도록 전처리(S300)하고, 추정함수와 파라미터를 기 설정된 초기값으로 설정한다.
강화학습모듈(400)은 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습한다(S400). 추정함수 학습방법은 도 4를 참조한다. 도 4에 도시된 바와 같이, 강화학습모듈(400)에서 반복부(410)는 추정함수를 사용자에 의해 기 설정된 학습의 횟수만큼 반복한다(S410).
반복부(410)에서 기설정된 횟수만큼 반복 시, S500 단계로 이어져 출력모듈(500)은 작업 순열의 결과를 출력할 수 있다. 그러나, 기설정된 횟수만큼 반복하지 못한 경우, S420 단계로 이어져 탐색부(420)는 추정함수의 재 학습횟수를 결정하기 위해 추정함수를 탐색한다(S420).
탐색부(420)는 추정함수를 탐색하여 추정함수의 재 학습횟수가 결정된 경우 S410 단계로 진행되어 작업순열을 출력하고, 추정함수를 탐색하지 못한 경우 S430 단계로 진행되어 비교부(430)가 추정함수의 입실론 계수와 기 설정된 무작위 난수를 비교한다(S430).
입실론 계수와 무작위 난수의 비교 결과에 따라, 결정부(440)는 작업순열을 결정한다(S440). 결정부(440)는 추정함수의 입실론 계수가 무작위 난수보다 클 경우 무작위로 작업순열을 결정하고, 추정함수의 입실론 계수가 무작위 난수보다 작거나 같을 경우, 상기 추정함수에 기초하여 작업순열을 결정한다.
본 발명의 일 실시예에 따르면, 결정부(440)는 작업과 기계간의 가중치를 포함하는 추정함수를 기반으로 작업 순열을 결정하는 것으로, 현재 진행 중인 작업에서 다음에 수행할 작업 중 가장 낮은 가중치를 갖는 작업을 선택하여 작업순열을 결정하게 된다.
갱신부(450)는 결정된 작업순열을 이용하여 탐색단계(S420)의 추정함수를 갱신(S450)하고, 갱신된 추정함수를 이용하여 탐색부(420)는 재 탐색을 수행한다.
상기 S410단계 내지 S450단계는 강화학습모듈(400)이 현재 작업상태에서 다음 작업 상태를 선택하기 위해 추정함수의 가중치를 학습하는 구성이다.
그리고 나서, 출력모듈(500)은 추정함수의 가중치 정보를 기반으로 하여 작업순열을 출력한다(S500). 즉, 출력모듈(500)은 작업의 가중치에 따라 작업을 스케줄링할 수 있다.
본 발명의 일 실시예에 따르면, 출력모듈(500)은 상태-행동함수와 상태함수의 차인 이점함수를 통해 작업순열의 결과를 출력할 수 있다. 예를 들어, 출력모듈(500)은 각 작업들의 가중치 정보를 포함하는 상태함수를 이용하여 가장 낮은 가중치를 갖는 작업을 첫 번째 작업으로 선정하고, 현재 상태의 작업에서 다음 작업들에 대한 가중치 정보를 포함하는 상태-행동함수를 이용하여 현재 상태의 작업에서 가장 낮은 가중치를 갖는 작업을 출력할 수 있다. 또, 현재 상태에 대한 이점함수의 평균치를 뺀 값과 상태함수의 가중치를 합한 상태-행동함수를 이용하여 다음 작업순열을 결정하여 출력할 수 있다.
이와 같이 본 발명에 따르면, 강화학습을 이용한 생산공정의 스케줄링 장치(1000) 및 방법은 추정함수를 Double-Q learning 기법으로 강화학습하여 최적의 작업일정을 출력할 수 있으므로, 기계의 유휴시간을 최소화하여 기계시스템의 생산 효율성을 높일 수 있고, 기계의 과적합 문제를 방지할 수 있다.
이상과 같이 본 발명의 도시된 실시 예를 참고하여 설명하고 있으나, 이는 예시적인 것들에 불과하며, 본 발명이 속하는 기술 분야의 통상의 지식을 가진 자라면 본 발명의 요지 및 범위에 벗어나지 않으면서도 다양한 변형, 변경 및 균등한 타 실시 예들이 가능하다는 것을 명백하게 알 수 있을 것이다. 따라서 본 발명의 진정한 기술적 보호 범위는 첨부된 청구범위의 기술적인 사상에 의해 정해져야 할 것이다.
1000: 생산공정 스케줄링 장치
100: 생성모듈
200: 입력모듈
300: 전처리모듈
400: 강화학습모듈
410: 반복부
420: 탐색부
430: 비교부
440: 결정부
450: 갱신부
460: 판별부
500: 출력모듈

Claims (12)

  1. 작업에 대한 일정을 추정함수로 생성하는 생성모듈;
    상기 작업에 대한 파라미터를 입력하는 입력모듈;
    상기 추정함수 및 파라미터를 전처리하는 전처리모듈;
    상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습모듈; 및
    상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력모듈을 포함하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  2. 제1항에 있어서,
    상기 강화학습모듈은,
    상기 추정함수의 학습을 기설정된 횟수만큼 반복하는 반복부;
    상기 상기 추정함수의 반복 횟수여부를 탐색하는 탐색부;
    상기 탐색부의 탐색 결과에 따라 상기 추정함수의 입실론 계수와 무작위 난수를 비교하는 비교부;
    상기 비교결과에 따라 작업순열을 결정하는 결정부; 및
    상기 작업순열을 이용하여 상기 추정함수를 갱신하는 갱신부를 포함하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  3. 제1항에 있어서,
    상기 강화학습모듈은,
    Double-Q learning 기법 또는 Dueling Architecture 기법을 활용하여 학습하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  4. 제2항에 있어서,
    상기 갱신부의 갱신시점을 판별하는 판별부를 더 포함하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  5. 제2항에 있어서,
    상기 결정부는,
    상기 추정함수의 입실론 계수가 상기 무작위 난수보다 클 경우 무작위로 작업순열을 결정하고,
    상기 추정함수의 입실론 계수가 무작위 난수보다 작거나 같을 경우 상기 추정함수에 기초하여 작업순열을 결정하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  6. 제1항에 있어서,
    상기 출력모듈은,
    상기 강화학습된 추정함수의 가중치 정보에 따라 상기 작업순열을 출력하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  7. 제1항에 있어서,
    상기 가중치 정보는,
    상태함수, 행동함수, 이점함수 간의 연산을 통한 가중치를 이용하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 장치.
  8. 강화학습을 이용한 생산공정의 스케줄링 방법에 있어서,
    작업에 대한 일정을 추정함수로 생성하는 생성단계;
    상기 작업에 대한 파라미터를 입력하는 입력단계;
    상기 추정함수 및 파라미터를 전처리하는 전처리단계;
    상기 전처리된 추정함수 및 파라미터를 이용하여 추정함수를 학습하는 강화학습단계; 및
    상기 강화학습된 추정함수를 통해 작업순열을 출력하는 출력단계를 포함하는 강화학습을 이용한 생산공정의 스케줄링 방법.
  9. 제8항에 있어서,
    상기 강화학습단계는,
    상기 추정함수의 학습을 기설정된 횟수만큼 반복하는 반복단계;
    상기 상기 추정함수의 반복 횟수여부를 탐색하는 탐색단계;
    상기 탐색 결과에 따라 상기 추정함수의 입실론 계수와 무작위 난수를 비교하는 비교단계;
    상기 비교결과에 따라 작업순열을 결정하는 결정단계; 및
    상기 작업순열을 이용하여 상기 추정함수를 갱신하는 갱신단계를 포함하는 강화학습을 이용한 생산공정의 스케줄링 방법.
  10. 제9항에 있어서,
    상기 갱신단계의 갱신시점을 판별하는 판별단계를 더 포함하는 강화학습을 이용한 생산공정의 스케줄링 방법.
  11. 제8항에 있어서,
    상기 결정단계는,
    상기 추정함수의 입실론 계수가 상기 무작위 난수보다 클 경우 무작위로 작업순열을 결정하고,
    상기 추정함수의 입실론 계수가 무작위 난수보다 작거나 같을 경우 상기 추정함수에 기초하여 작업순열을 결정하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 방법.
  12. 제8항에 있어서,
    상기 출력단계는,
    상태함수, 행동함수, 이점함수를 연산한 가중치를 기초로 한 추정함수의 가중치 정보에 따라 상기 작업순열을 출력하는 것을 특징으로 하는 강화학습을 이용한 생산공정의 스케줄링 방법.
KR1020210025807A 2021-02-25 2021-02-25 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법 Ceased KR20220121568A (ko)

Priority Applications (1)

Application Number Priority Date Filing Date Title
KR1020210025807A KR20220121568A (ko) 2021-02-25 2021-02-25 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
KR1020210025807A KR20220121568A (ko) 2021-02-25 2021-02-25 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법

Publications (1)

Publication Number Publication Date
KR20220121568A true KR20220121568A (ko) 2022-09-01

Family

ID=83281908

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020210025807A Ceased KR20220121568A (ko) 2021-02-25 2021-02-25 강화학습을 이용한 생산공정의 스케줄링 장치 및 방법

Country Status (1)

Country Link
KR (1) KR20220121568A (ko)

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN117669988A (zh) * 2023-12-26 2024-03-08 中建八局第一数字科技有限公司 一种基于Q-Learning算法改进NEH的装配式预制构件生产调度方法
CN119937625A (zh) * 2024-12-20 2025-05-06 国网湖北省电力有限公司信息通信公司 一种多无人机巡检轨迹和移动储能端调度巡检方法及系统
KR20250104453A (ko) 2023-12-29 2025-07-08 엠아이큐브솔루션주식회사 강화 학습을 이용한 생산 계획 수립 시스템 및 방법
KR20250117865A (ko) 2024-01-29 2025-08-05 (주)빅아이 인공지능 기반으로 한 제품 생산스케줄링 시스템
WO2025206443A1 (ko) * 2024-03-29 2025-10-02 한화정밀기계 주식회사 생산 계획 수립 방법 및 그 장치

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN117669988A (zh) * 2023-12-26 2024-03-08 中建八局第一数字科技有限公司 一种基于Q-Learning算法改进NEH的装配式预制构件生产调度方法
KR20250104453A (ko) 2023-12-29 2025-07-08 엠아이큐브솔루션주식회사 강화 학습을 이용한 생산 계획 수립 시스템 및 방법
KR20250117865A (ko) 2024-01-29 2025-08-05 (주)빅아이 인공지능 기반으로 한 제품 생산스케줄링 시스템
WO2025206443A1 (ko) * 2024-03-29 2025-10-02 한화정밀기계 주식회사 생산 계획 수립 방법 및 그 장치
CN119937625A (zh) * 2024-12-20 2025-05-06 国网湖北省电力有限公司信息通信公司 一种多无人机巡检轨迹和移动储能端调度巡检方法及系统

Similar Documents

Publication Publication Date Title
Tang et al. A neural network model and algorithm for the hybrid flow shop scheduling problem in a dynamic environment
Tormos et al. An efficient multi-pass heuristic for project scheduling with constrained resources
Naderi et al. Scheduling open shops with parallel machines to minimize total completion time
Zou et al. A new algorithm based on evolutionary computation for hierarchically coupled constraint optimization: Methodology and application to assembly job-shop scheduling
CN114648232B (zh) 基于改进黑猩猩优化算法的云端化资源柔性作业调度方法
Xu et al. An intelligent optimization algorithm for blocking flow-shop scheduling based on differential evolution
Nguyen et al. Learning reusable initial solutions for multi-objective order acceptance and scheduling problems with genetic programming
Biswas et al. Modified particle swarm optimization for solving machine-loading problems in flexible manufacturing systems
Pan et al. A novel multi-objective particle swarm optimization algorithm for no-wait flow shop scheduling problems
Rifai et al. Multi-operator hybrid genetic algorithm-simulated annealing for reentrant permutation flow-shop scheduling
Mahadevan Sensitive discount optimality: Unifying discounted and average reward reinforcement learning
Moral et al. Multi-objective hybrid evolutionary optimization with automatic switching among constituent algorithms
CN110852500B (zh) 一种资源受限混合流水车间优化方法
Carvalho et al. Multi-objective flexible job-shop scheduling problem with DIPSO: More diversity, greater efficiency
El-Fakih et al. A method and a genetic algorithm for deriving protocols for distributed applications with minimum communication cost
Zhang et al. Local search enhanced multi-objective evolutionary algorithm for fuzzy flexible job shop scheduling
Nurdiansyah et al. An Improved Differential Evolution Algorithm for Permutation Flow Shop Scheduling Problem.
Chica et al. A multiobjective GRASP for the 1/3 variant of the time and space assembly line balancing problem
Sultana et al. Reconstructing gene regulatory network with enhanced particle swarm optimization
US7809657B2 (en) System and method for implementing a multi objective evolutionary algorithm on a programmable logic hardware device
Aqil et al. Heuristics and metaheuristics for the bi-criterion optimization of the flexible flow shop scheduling problem with two stages
Ahmed et al. Application of an Efficient Genetic Algorithm for Solving n× 𝒎𝒎 Flow Shop Scheduling Problem Comparing it with Branch and Bound Algorithm and Tabu Search Algorithm
Biswas et al. Machine loading in Flexible manufacturing System: A swarm optimization approach
Nouinou et al. New heuristic for single machine semi-online total completion time minimization
Albrecht et al. On logarithmic simulated annealing

Legal Events

Date Code Title Description
PA0109 Patent application

Patent event code: PA01091R01D

Comment text: Patent Application

Patent event date: 20210225

PA0201 Request for examination
PE0902 Notice of grounds for rejection

Comment text: Notification of reason for refusal

Patent event date: 20220331

Patent event code: PE09021S01D

PG1501 Laying open of application
E601 Decision to refuse application
PE0601 Decision on rejection of patent

Patent event date: 20221031

Comment text: Decision to Refuse Application

Patent event code: PE06012S01D

Patent event date: 20220331

Comment text: Notification of reason for refusal

Patent event code: PE06011S01I