🎓GeoAcademyGeoVerse Lab
AI·컴퓨팅과학대학

강화학습·에이전트 센터

강화학습·에이전트 센터는 심층 강화학습, 모델기반 월드모델, 다중에이전트 시스템, LLM 기반 에이전트에 이르는 순차적 의사결정 이론과 자율 에이전트 아키텍처를 가르친다. 학생은 과학적 탐색, 실험 설계, 적응 제어 문제를 직접 강화학습 문제로 정식화하고 에이전트를 학습시키는 프로젝트를 수행하며, 단일 에이전트에서 다중 에이전트 협업까지 점진적으로 난이도를 높여간다. 이 과정을 통해 졸업생은 불확실하고 변화하는 환경에서 스스로 의사결정을 내리는 자율 시스템을 직접 설계·구현하는 수준에 도달한다.

⚙️ 지오아카데미시스템관리대학🖥️ AI·컴퓨팅과학대학🔬 기초과학대학⚡ 지능형지구물리탐사대학🛢️ 자원에너지공학대학🌍 응용지구과학대학💼 경제정책미래전략대학🎓 교육훈련대학🚀 혁신국제협력대학
머신러닝학과컴퓨터비전학과자연어처리학과고성능컴퓨팅학과양자컴퓨팅학과생성형AI·파운데이션모델 센터강화학습·에이전트 센터AI 안전·정렬 센터과학을 위한 AI 센터로보틱스·임바디드 AI 센터
🤖
🔑
리처드 벨먼
학과장

연구원(실제 GeoVerse Lab 소속) 15

데이비드 블랙웰🔑
1919–2010
데이비드 블랙웰
연구원(마르코프의사결정과정/최적확률제어)
💡 마르코프의사결정과정의 최적성·수렴성에 관한 기초적결과(블랙웰최적성) 증명, 동적계획법기반 순차적의사결정정책이 증명가능하게 최적인 엄밀한조건 확립 — 벨먼틀의 확장·엄밀화
이반 파블로프🔑
1849–1936
이반 파블로프
연구원(시간차학습/연합학습)
💡 고전적조건화 발견 — 유기체가 반복된 시간적짝짓기를 통해 예측적자극과 지연된보상을 연합하는 것을 학습 — 강화학습의 시간차학습알고리즘이 직접 수학적으로 형식화하는 근본적 연합학습현상
매그너스 헤스테네스🔑
1906–1991
매그너스 헤스테네스
연구원(정책경사/직접정책최적화)
💡 변분법·제약최적화의 현대적 수치기법(켤레기울기법, 증강라그랑주법) 창시, 정책경사강화학습알고리즘이 정책매개변수 최적화에 직접 적용하는 경사기반 최적화기제 제공
🧑‍🔬
🔑
1941–1997
해리 클롭프
연구원(액터-크리틱기법/쾌락뉴런이론)
💡 '쾌락뉴런' 가설 제안 — 개별뉴런이 국소적 보상유사신호를 최대화하도록 작동한다는 이론 — 정책('액터')과 가치추정 비평가를 분리하는 서턴·바르토의 액터-크리틱구조에 직접 영감을 줌
🧑‍🔬
🔑
1918–2016
제이 라이트 포레스터
연구원(모델기반강화학습/월드모델)
💡 시스템다이내믹스 창시 — 복잡시스템의 행동을 예측·추론하기 위해 명시적 피드백루프 시뮬레이션모델을 구축하는 학문 — 모델기반강화학습에이전트가 학습하고 그 안에서 계획하는 '월드모델'의 직접적 개념·용어적 조상
로이드 섀플리🔑
1923–2016
로이드 섀플리
연구원(다중에이전트시스템/확률게임)
💡 확률게임이론 창시 — 마르코프의사결정과정을 경쟁·협력적목표를 가진 다중상호작용에이전트로 일반화 — 다중에이전트강화학습의 정확한 수학적틀
🧑‍🔬
🔑
1901–1990
아서 새뮤얼
연구원(몬테카를로트리서치/자기대국학습)
💡 자기자신과 대국하며 미니맥스탐색으로 보드위치를 평가해 학습하는 최초의 자기개선형 게임프로그램(체커) 제작, '머신러닝' 용어 창시 및 MCTS·AlphaZero급 시스템이 직접 계승하는 자기대국트리탐색패러다임 창시
아르투로 로센블루에스🔑
1900–1970
아르투로 로센블루에스
연구원(LLM기반 자율에이전트/목표지향행동이론)
💡 위너·비글로와 함께 사이버네틱스 공동창시, 목표지향적·피드백기반 기계행동이론 형식화 — 지각-행동-피드백루프를 통해 목표를 추구하는 에이전트의 창시적 이론틀, 도구사용·피드백기반 LLM자율에이전트와 직결
구스타브 엘프빙🔑
1908–1984
구스타브 엘프빙
연구원(베이즈·최적 과학실험설계)
💡 최적실험설계이론 창시 — 실험당 얻는 통계적정보를 최대화하도록 실험조건을 선택하는 방법('엘프빙집합') 규명 — 자율과학탐색을 위한 베이즈최적실험설계의 기초
🧑‍🔬
🔑
1927–2021
피터 휘틀
연구원(탐색-활용/다중슬롯머신문제이론)
💡 '불안정한슬롯머신' 이론과 휘틀지수 개발, 관측되지않은 슬롯도 계속 진화하는 더 현실적인 상황으로 다중슬롯머신이론을 일반화 — 정보수집과 기지의좋은선택지 활용 간 균형을 맞추는 현대 탐색-활용알고리즘의 기초
🧑‍🔬
🔑
1927–1992
앨런 뉴얼
연구원(계층적강화학습/목표분해)
💡 일반문제해결기(GPS)와 수단-목표분석 공동개발, 복합목표를 하위목표계층으로 분해하는 창시적방법 — 계층적강화학습의 옵션·하위목표틀의 직접적 기초
앨버트 반두라🔑
1925–2021
앨버트 반두라
연구원(모방학습/관찰·사회학습)
💡 사회학습이론 창시, 유기체가 직접적 시행착오보상 없이 타인을 관찰·모방함으로써 복잡한행동을 학습함을 입증(보보인형실험) — 강화학습의 모방학습·행동복제가 직접 형식화하는 창시적 심리현상
🧑‍🔬
🔑
1924–1976
대니얼 벌린
연구원(내적동기/호기심기반탐색)
💡 호기심의 실험심리학 창시, 새로움·불확실성·복잡성 자체가 외적보상과 무관하게 탐색행동을 유발함을 입증 — 강화학습의 내적동기·호기심기반탐색보너스가 직접 형식화하는 창시적 심리이론
🧑‍🔬
🔑
1925–2014
해럴드 W. 쿤
연구원(순차게임/전개형분석)
💡 전개형게임이론(순차적수와 정보집합을 가진 게임트리) 개발, 게임트리탐색과 순차적 다중에이전트RL이 직접 다루는 불확실성하 순차적 다단계 의사결정의 정확한 형식적 표현 제공
🧑‍🔬
🔑
1919–1997
야코프 츠이프킨
연구원(적응·자기조정제어시스템)
💡 적응·학습제어시스템이론 창시 — 조절기가 관측된 시스템행동에 기반해 자신의 매개변수를 온라인으로 조정하는 법 규명 — 변화하는 환경에 반응해 정책을 조정하는 적응제어이론적 강화학습에이전트의 직접적 기초