GeoVerse Lab
AI·컴퓨팅과학연구본부

강화학습·에이전트 센터

심층 강화학습, 모델기반 월드모델, 다중에이전트 시스템, LLM 기반 에이전트를 아우르는 강화학습 이론과 자율 에이전트 아키텍처를 발전시켜 과학적 탐색·실험설계·적응제어를 위한 순차적 의사결정 시스템을 연구한다.

머신러닝연구센터자연어처리연구센터컴퓨터비전연구센터고성능컴퓨팅센터양자컴퓨팅연구센터생성형AI·파운데이션모델 센터강화학습·에이전트 센터AI 안전·정렬 센터과학을 위한 AI 센터로보틱스·임바디드 AI 센터
연구분야 15
마르코프 의사결정과정과 최적확률제어
🗺️ 마르코프 의사결정과정과 최적확률제어
마르코프 의사결정과정(Markov decision process, MDP)은 불확실성 아래의 연속적 의사결정을 위한 표준 수학모형이다. 각 단계에서 행위자는 상태
시간차학습과 연합학습
🔔 시간차학습과 연합학습
시간차학습(temporal-difference learning)은 최종 결과가 아니라 연이은 추정치 사이의 차이로 예측을 갱신하는 기술이다. 학습자는 에피소드가
정책경사와 직접 정책최적화
⛰️ 정책경사와 직접 정책최적화
정책경사(policy gradient) 방법은 행위자의 정책을 조절 가능한 가중치를 가진 행동 확률분포로 직접 매개변수화하고, 기대보상에 대한 경사상승으로 개선한
액터-크리틱 기법과 쾌락뉴런 이론
🎭 액터-크리틱 기법과 쾌락뉴런 이론
액터-크리틱 구조는 강화학습 행위자를 협동하는 두 모듈로 나눈다. 행동을 고르는 매개변수화된 정책인 액터와 그 행동을 평가하는 학습된 가치함수인 크리틱이며, 크리
모델기반 강화학습과 월드모델
🔮 모델기반 강화학습과 월드모델
모델기반 강화학습은 행위자에게 환경의 내부 예측모형, 경험에서 배우는 전이와 보상의 역학을 갖추게 하고, 그 모형을 통해 계획함으로써, 시행착오식 가치학습에 더하
다중에이전트시스템과 확률게임
🕸️ 다중에이전트시스템과 확률게임
다중에이전트시스템은 여러 학습자가 하나의 환경을 공유하고 각 에이전트의 결과가 모두의 공동 행동에 의존할 때의 의사결정을 연구하며, 그 수학적 핵심은 로이드 샤플
몬테카를로 트리탐색과 자기대국 학습
♟️ 몬테카를로 트리탐색과 자기대국 학습
몬테카를로 트리탐색(MCTS)은 한 번의 시뮬레이션씩 탐색 트리를 키워 수를 결정하는 기술로, 노드의 통계는 무작위 플레이아웃에서 온다. 방문 횟수와 승수로 유망
LLM 기반 자율에이전트와 목표지향행동 이론
🤖 LLM 기반 자율에이전트와 목표지향행동 이론
LLM 기반 에이전트는 대규모 언어모델이 추론의 핵을 맡는 소프트웨어 시스템이다. 지시와 관측을 텍스트로 지각하고, 목표를 단계로 분해하고, 검색·코드실행·데이터
베이즈 및 최적 실험설계
🧪 베이즈 및 최적 실험설계
최적 실험설계는 무엇을, 어디서, 어떤 설정으로 측정할지 실험 조건을 골라, 각 관측이 문제의 양에 대해 가장 많은 정보를 싣도록 만드는 기술이다. 실험 자체를
탐색-활용과 다중슬롯머신 문제 이론
🎰 탐색-활용과 다중슬롯머신 문제 이론
탐색-활용 딜레마는 불확실성 아래 연속적 의사결정의 근본적 긴장이다. 현재 가장 좋아 보이는 선택을 고르는 것은 쌓인 지식을 활용하지만 평범한 선택에 갇힐 수 있
계층적 강화학습과 목표분해
🪜 계층적 강화학습과 목표분해
계층적 강화학습은 MDP 틀에 시간적으로 확장된 행동을 도입한다. 제어를 돌려주기 전에 하부 정책에 여러 걸음을 맡기는 기술, 곧 옵션(options)이다. 학습
모방학습과 관찰·사회학습
🪞 모방학습과 관찰·사회학습
모방학습(imitation learning)은 보상 신호에 대한 시행착오가 아니라 유능한 행위자의 시연에서 행동을 얻는 기술이며, 그 심리학적 기초는 앨버트 밴듀
내적동기와 호기심 기반 탐색
내적동기와 호기심 기반 탐색
내적동기 연구는 과제가 아니라 학습 행위자 안에서 나오는 보상신호를 만든다. 새로운 자극에 대한 흥미, 결과를 예측하기 어려운 상태에 대한 흥미, 그리고 그것을
순차게임과 전개형 분석
♟︎ 순차게임과 전개형 분석
전개형 게임이론은 전략적 상호작용을 게임 트리로 나타낸다. 참여자들이 의사결정 노드에서 차례로 두고, 우연은 우연 노드에서 움직이고, 이득은 잎에서 확정되며, 정
적응·자기조정 제어시스템
🎛️ 적응·자기조정 제어시스템
적응제어는 제어기가 제어 대상 플랜트의 측정으로부터 자기 매개변수를 온라인으로 조정하여, 플랜트의 역학이 알려지지 않았거나 운전조건·부하·손상·노화에 따라 표류할