• 제목/요약/키워드: 학습강화

검색결과 1,589건 처리시간 0.027초

개선된 강화학습을 이용한 줄고누게임의 학습속도개선 (An improvement of the learning speed through Improved Reinforcement Learning on Jul-Gonu Game)

  • 신용우;정태충
    • 인터넷정보학회논문지
    • /
    • 제10권3호
    • /
    • pp.9-15
    • /
    • 2009
  • 보드게임은 많은 수의 말들과 상태공간을 갖고 있다. 그래서 학습이 많은 시간동안 학습을 하여야 한다. 또한 상대방과의 대결이 1 대 1 로 이루어지지 않고, 여러 말 대 여러 말로 이루어지므로 전략적인 사고가 필요하다. 그러므로 최적의 학습을 적용하여야 한다. 본 논문에서는 강화학습 알고리즘을 이용하였다. 보상 값을 받아 보드게임 말이 학습하게 하여 지능적으로 움직이게 하였다. 학습 도중에 동일한 최선 값이 있을 때, 줄고누 문제 영역 지식을 활용한 휴리스틱을 사용해 학습의 속도 향상을 시도하였다. 단순 구현된 말과 개선 구현된 말을 비교하기 위해 보드게임을 제작하였다. 그래서 일방공격형 말과 승부를 하게 하였다. 실험결과 개선 구현된 말의 성능이 학습속도 측면에서 월등히 향상됨을 알 수 있었다.

  • PDF

인지 무선 시스템에서 강화학습 기반 협력 센싱 기법 (Reinforce Learning Based Cooperative Sensing for Cognitive Radio Networks)

  • 김도윤;최영준;;최증원
    • 한국전자통신학회논문지
    • /
    • 제13권5호
    • /
    • pp.1043-1050
    • /
    • 2018
  • 본 논문은 인지 무선(CR, Cognitive Radio) 네트워크에서 우선 사용자(Primary User)의 존재 유무를 2차 사용자(Secondary User)가 결정하기 위하여 협력 센싱을 사용하는 환경에서 스펙트럼 센싱의 감지 성능을 높이기 위해 강화 학습(Reinforce learning) 기반으로 최적의 인지 무선 사용자 선택하는 협력 센싱 방안을 제안한다. 협력 센싱을 통해 파악한 전역 센싱 결과와 인지 무선 사용자의 센싱 결과 간의 유사도에 따라 정확도가 높은 사용자를 파악한다. 이 정확도를 강화학습의 보상으로 사용하여 협력 센싱을 수행할수록 전역 결정과 일치하는 센싱 정보를 전송하는 사용자를 선택할 수 있다. 실험 결과 제안한 기법이 기존 협력 센싱 대비 향상된 스펙트럼 감지 성능을 보임을 확인할 수 있다.

행위 기반 강화 학습 에이전트 구조 (An Agent Architecture for Behavior-Based Reinforcement Learning)

  • 황종근;김인철
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2007년도 추계학술대회
    • /
    • pp.284-293
    • /
    • 2007
  • 본 논문에서는 실시간 동정 환경에 효과적인 L-CAA 에이전트 구조를 제안한다. L-CAA 에이전트 구조는 변화하는 환경에 대한 적응성을 높이기 위해, 선행 연구를 통해 개발된 행위 기반 에이전트 구조인 CAA에 강화 학습 기능을 추가하여 확장한 것이다. 안정적인 성능을 위해 L-CAA에서 행위 선택 메커니즘은 크게 두 단계로 나뉜다. 첫 번째 단계에서는 사용자가 미리 정의한 각 행위의 수행 가능 조건과 효용성을 검사함으로써 행위 라이브러리로부터 실행할 행위들을 추출한다. 하지만 첫 번째 단계에서 다수의 행위가 추출되면, 두 번째 단계에서는 강화 학습의 도움을 받아 이들 중에서 실행할 하나의 행위를 선택한다. 즉, 강화 학습을 통해 갱신된 각 행위들의 Q 함수 값을 서로 비교함으로써, 가장 큰 기대 보상 값을 가진 행위를 선택하여 실행한다. 또한 L-CAA에서는 실행 중인 행위의 유지 가능 조건을 지속적으로 검사하여 환경의 동적 변화로 인해 일부 조건이 만족되지 않는 경우가 발생하면 현재 행위의 실행을 즉시 종료할 수 있다. 그 뿐 아니라, L-CAA는 행위 실행 중에도 효용성이 더 높은 다른 행위가 발생하면 현재의 행위를 일시 정지하였다가 복귀하는 기능도 제공한다. 본 논문에서는 L-CAA 구조의 효과를 분석하기 위해, 대표적인 동적 가상환경인 Unreal Tournament 게임에서 자율적을 동작하는 L-CAA기반의 UTBot 들을 구현하고, 이들을 이용하여 성능실험을 전개해본다.

  • PDF

심층 강화학습 기반의 선박 항로계획 수립 (Generation of ship's passage plan based on deep reinforcement learning)

  • 이형탁;양현;조익순
    • 한국항해항만학회:학술대회논문집
    • /
    • 한국항해항만학회 2023년도 추계학술대회
    • /
    • pp.230-231
    • /
    • 2023
  • 본 연구는 선박의 항해계획을 자동으로 수립하기 위한 심층 강화학습 기반 알고리즘을 제안한다. 먼저 부산항과 광양항을 대상지역으로 선정하고, 대상 선박으로 흘수 16m의 컨테이너선을 지정하였다. 실험 결과는 심층 강화학습을 사용하여 수립한 항해계획이 선행연구에서 활용한 Q-learning기반의 알고리즘보다 더 효율적인 것으로 분석되었다. 본 알고리즘은 선박의 항해계획을 자동으로 수립하는 방법을 제시하며, 해상 안전 및 효율성 향상에 기여할 수 있다.

  • PDF

교수학습지원센터에 대한 학습자 만족도 및 효과 분석 (An Analysis of Learner Satisfaction and Effectiveness Regarding 'Center for Teaching and Learning Support')

  • 김창수;최석윤;김정훈
    • 한국콘텐츠학회논문지
    • /
    • 제11권3호
    • /
    • pp.487-495
    • /
    • 2011
  • 본 연구는 교수학습지원센터에서 교육정보를 이용하고 있는 학생들을 대상으로 해당 교수학습지원센터에 대한 만족도와 효과성을 분석하였다. 이를 토대로 교수학습지원센터가 학생에 대한 교육 지원을 강화하기 위해 어떤 부분의 개선이 필요한지 개선 사항을 도출하고자 하는 목적을 가지고 있다. 분석 결과, 각 학교급에 따른 만족도와 효과를 가지고 있었으며, 개선에 대한 요구도 다른 것으로 나타났다. 따라서 교수학습지원센터는 일원화된 서비스 체계보다는 학교급에 적합한 서비스를 강화할 필요가 있다. 즉, 교육정보를 제공함에 있어서도 초등학생과 중학생에게는 재미와 흥미를 강화할 수 있는 개선이 요구되며, 고등학생에게는 정보의 질적 측면을 강화하는 등의 노력이 요구된다.

강화학습의 학습 가속을 위한 함수 근사 방법 (Function Approximation for accelerating learning speed in Reinforcement Learning)

  • 이영아;정태충
    • 한국지능시스템학회논문지
    • /
    • 제13권6호
    • /
    • pp.635-642
    • /
    • 2003
  • 강화학습은 제어, 스케쥴링 등 많은 응용분야에서 성공적인 학습 결과를 얻었다. 기본적인 강화학습 알고리즘인 Q-Learning, TD(λ), SARSA 등의 학습 속도의 개선과 기억장소 등의 문제를 해결하기 위해서 여러 함수 근사방법(function approximation methods)이 연구되었다. 대부분의 함수 근사 방법들은 가정을 통하여 강화학습의 일부 특성을 제거하고 사전지식과 사전처리가 필요하다. 예로 Fuzzy Q-Learning은 퍼지 변수를 정의하기 위한 사전 처리가 필요하고, 국소 최소 자승법은 훈련 예제집합을 이용한다. 본 논문에서는 온-라인 퍼지 클러스터링을 이용한 함수 근사 방법인 Fuzzy Q-Map을 제안하다. Fuzzy Q-Map은 사전 지식이 최소한으로 주어진 환경에서, 온라인으로 주어지는 상태를 거리에 따른 소속도(membership degree)를 이용하여 분류하고 행동을 예측한다. Fuzzy Q-Map과 다른 함수 근사 방법인 CMAC와 LWR을 마운틴 카 문제에 적용하여 실험 한 결과 Fuzzy Q-Map은 훈련예제를 사용하지 않는 CMAC보다는 빠르게 최고 예측율에 도달하였고, 훈련 예제를 사용한 LWR보다는 낮은 예측율을 보였다.

강화학습을 이용한 이종 장비 토목 공정 계획 (Earthwork Planning via Reinforcement Learning with Heterogeneous Construction Equipment)

  • 지민기;박준건;김도형;정요한;박진규;문일철
    • 한국시뮬레이션학회논문지
    • /
    • 제27권1호
    • /
    • pp.1-13
    • /
    • 2018
  • 토목 공정 계획은 건설 공정 관리에서 중요한 과제 중 하나이다. 수학적 방법론에 기반을 둔 최적화 기법, 휴리스틱에 기반을 둔 최적화 기법 그리고 행위자 기반의 시뮬레이션 등의 방법론이 건설 공정 관리를 위해 적용되어왔다. 본 연구에서는 가상의 토목 공정 환경을 개발하고, 가상의 토목 공정 환경에서 강화학습을 이용한 시뮬레이션을 통해 토목 공정의 최적 경로를 찾는 방법을 제안하였다. 강화학습에 있어 본 연구에서는 상호작용 하며 서로 다른 행동을 하는 굴삭기와 트럭 에이전트들 에 대해 순차적 학습과 독립적 학습에 기반을 둔 두 가지의 Markov decision process (MDP)를 사용하였다. 가상의 토목 공정 환경에서 두 가지 방법 모두 최적에 가까운 토목 공정 계획을 만들어 낼 수 있음을 시뮬레이션 결과에 따라 알 수 있었으며, 이 계획은 건설 자동화의 기초가 될 수 있을 것이다.

가상 환경에서의 강화학습을 이용한 비행궤적 시뮬레이션 (Flight Trajectory Simulation via Reinforcement Learning in Virtual Environment)

  • 이재훈;김태림;송종규;임현재
    • 한국시뮬레이션학회논문지
    • /
    • 제27권4호
    • /
    • pp.1-8
    • /
    • 2018
  • 인공지능을 이용하여 목표 지점까지 제어하는 가장 대표적인 방법은 강화학습이다. 하지만 그동안 강화학습을 처리하기 위해서는 구현하기 어렵고 복잡한 연산을 처리해야만 했다. 본 논문에서는 이를 개선한 Proximal Policy Optimization (PPO) 알고리즘을 이용하여 가상환경에서 목표지점에 도달하기 위한 계획된 비행궤적을 찾는 방법을 시뮬레이션 하였다. 또한 외부 환경요소가 비행궤적 학습에 미치는 영항을 알아보기 위하여 궤적의 변화, 보상 값의 영향 및 외부 바람등과 같은 변수를 추가하고 궤적 학습 성능 및 학습 속도에 미치는 영향을 비교 분석을 수행한다. 본 결과를 통하여 에이전트가 다양한 외부환경의 변화에도 계획된 궤적을 찾을 수 있다는 것을 시뮬레이션 결과에 따라 알 수 있었으며, 이는 실제 비행체에 적용할 수 있을 것이다.

SDN에서 심층강화학습 기반 라우팅 알고리즘 (A Routing Algorithm based on Deep Reinforcement Learning in SDN)

  • 이성근
    • 한국전자통신학회논문지
    • /
    • 제16권6호
    • /
    • pp.1153-1160
    • /
    • 2021
  • 본 논문은 소프트웨어 정의 네트워크에서 심층강화학습을 활용하여 최적의 경로를 결정하는 라우팅 알고리즘을 제안한다. 학습을 위한 심층강화학습 모델은 DQN 을 기반으로 하고, 입력은 현재 네트워크 상태, 발신지, 목적지 노드이고, 출력은 발신지에서 목적지까지의 경로 리스트를 반환한다. 라우팅 작업을 이산 제어 문제로 정의하며, 라우팅을 위한 서비스 품질 파라미터는 지연, 대역폭, 손실률을 고려하였다. 라우팅 에이전트는 사용자의 서비스 품질 프로파일에 따라 적절한 서비스 등급으로 분류하고, SDN에서 수집된 현재 네트워크 상태로부터 각 링크 별로 제공할 수 있는 서비스 등급을 변환한다. 이러한 변환된 정보를 토대로 발신지에서부터 목적지까지 요구되는 서비스 등급을 만족시키는 경로를 선택하도록 학습을 한다. 시뮬레이션 결과는 제안한 알고리즘이 일정한 에피소드를 진행하게 되면 올바른 경로를 선택하게 되고, 학습이 성공적으로 수행됨을 나타냈다.

효율적인 경로 선택을 위한 Q-Learning 정책 및 보상 설계 (Q-Learning Policy and Reward Design for Efficient Path Selection)

  • 용성중;박효경;유연휘;문일영
    • 한국항행학회논문지
    • /
    • 제26권2호
    • /
    • pp.72-77
    • /
    • 2022
  • 강화학습의 기법 중 Q-Learning은 주어진 상태에서 행동을 수행하면서 미래의 효율적인 기댓값을 예측하는 Q 함수를 학습하면서 최적의 정책을 학습하는 것이다. Q-Learning은 강화학습의 기본적인 알고리즘으로 많이 활용하고 있다. 본 논문에서는 Q-Learning을 바탕으로 정책과 보상을 설계하여 효율적인 경로를 선택하고 학습하는 효용성에 대하여 연구하였다. 또한 Frozen Lake 게임의 8x8 그리드 환경에 동일한 학습 횟수를 적용하여 기존 알고리즘 및 처벌 보상 정책과 제시한 처벌강화 정책의 결과를 비교하였다. 해당 비교를 통해 본 논문에서 제시한 Q-Learning의 처벌강화 정책이 통상적인 알고리즘의 적용보다 학습 속도를 상당히 높일 수 있는 것으로 분석되었다.