← AI·컴퓨팅과학연구본부
강화학습·에이전트 센터
심층 강화학습, 모델기반 월드모델, 다중에이전트 시스템, LLM 기반 에이전트를 아우르는 강화학습 이론과 자율 에이전트 아키텍처를 발전시켜 과학적 탐색·실험설계·적응제어를 위한 순차적 의사결정 시스템을 연구한다.
연구분야 15

🗺️ 마르코프 의사결정과정과 최적확률제어
마르코프 의사결정과정(Markov decision process, MDP)은 불확실성 아래의 연속적 의사결정을 위한 표준 수학모형이다. 각 단계에서 행위자는 상태…

🔔 시간차학습과 연합학습
시간차학습(temporal-difference learning)은 최종 결과가 아니라 연이은 추정치 사이의 차이로 예측을 갱신하는 기술이다. 학습자는 에피소드가 …

⛰️ 정책경사와 직접 정책최적화
정책경사(policy gradient) 방법은 행위자의 정책을 조절 가능한 가중치를 가진 행동 확률분포로 직접 매개변수화하고, 기대보상에 대한 경사상승으로 개선한…

🎭 액터-크리틱 기법과 쾌락뉴런 이론
액터-크리틱 구조는 강화학습 행위자를 협동하는 두 모듈로 나눈다. 행동을 고르는 매개변수화된 정책인 액터와 그 행동을 평가하는 학습된 가치함수인 크리틱이며, 크리…

🔮 모델기반 강화학습과 월드모델
모델기반 강화학습은 행위자에게 환경의 내부 예측모형, 경험에서 배우는 전이와 보상의 역학을 갖추게 하고, 그 모형을 통해 계획함으로써, 시행착오식 가치학습에 더하…

🕸️ 다중에이전트시스템과 확률게임
다중에이전트시스템은 여러 학습자가 하나의 환경을 공유하고 각 에이전트의 결과가 모두의 공동 행동에 의존할 때의 의사결정을 연구하며, 그 수학적 핵심은 로이드 샤플…

♟️ 몬테카를로 트리탐색과 자기대국 학습
몬테카를로 트리탐색(MCTS)은 한 번의 시뮬레이션씩 탐색 트리를 키워 수를 결정하는 기술로, 노드의 통계는 무작위 플레이아웃에서 온다. 방문 횟수와 승수로 유망…

🤖 LLM 기반 자율에이전트와 목표지향행동 이론
LLM 기반 에이전트는 대규모 언어모델이 추론의 핵을 맡는 소프트웨어 시스템이다. 지시와 관측을 텍스트로 지각하고, 목표를 단계로 분해하고, 검색·코드실행·데이터…

🧪 베이즈 및 최적 실험설계
최적 실험설계는 무엇을, 어디서, 어떤 설정으로 측정할지 실험 조건을 골라, 각 관측이 문제의 양에 대해 가장 많은 정보를 싣도록 만드는 기술이다. 실험 자체를 …

🎰 탐색-활용과 다중슬롯머신 문제 이론
탐색-활용 딜레마는 불확실성 아래 연속적 의사결정의 근본적 긴장이다. 현재 가장 좋아 보이는 선택을 고르는 것은 쌓인 지식을 활용하지만 평범한 선택에 갇힐 수 있…

🪜 계층적 강화학습과 목표분해
계층적 강화학습은 MDP 틀에 시간적으로 확장된 행동을 도입한다. 제어를 돌려주기 전에 하부 정책에 여러 걸음을 맡기는 기술, 곧 옵션(options)이다. 학습…

🪞 모방학습과 관찰·사회학습
모방학습(imitation learning)은 보상 신호에 대한 시행착오가 아니라 유능한 행위자의 시연에서 행동을 얻는 기술이며, 그 심리학적 기초는 앨버트 밴듀…

✨ 내적동기와 호기심 기반 탐색
내적동기 연구는 과제가 아니라 학습 행위자 안에서 나오는 보상신호를 만든다. 새로운 자극에 대한 흥미, 결과를 예측하기 어려운 상태에 대한 흥미, 그리고 그것을 …

♟︎ 순차게임과 전개형 분석
전개형 게임이론은 전략적 상호작용을 게임 트리로 나타낸다. 참여자들이 의사결정 노드에서 차례로 두고, 우연은 우연 노드에서 움직이고, 이득은 잎에서 확정되며, 정…

🎛️ 적응·자기조정 제어시스템
적응제어는 제어기가 제어 대상 플랜트의 측정으로부터 자기 매개변수를 온라인으로 조정하여, 플랜트의 역학이 알려지지 않았거나 운전조건·부하·손상·노화에 따라 표류할…
