🎓GeoAcademyGeoVerse Lab
AI·컴퓨팅과학대학

AI 안전·정렬 센터

AI 안전·정렬 센터는 첨단 AI 시스템을 고위험 환경에 배치할 때 요구되는 안전성·통제가능성·유익성을 평가하고 확보하는 능력을 기른다. 학생은 RLHF 등 정렬 기법의 원리를 익히고, 기계적 해석가능성 도구로 모델 내부를 분석하며, 강건성 시험과 레드팀 공격을 직접 설계·수행하는 실습을 반복한다. 또한 확장 가능한 감독(scalable oversight) 체계를 설계하는 과제를 통해, 사람이 모델의 판단을 신뢰성 있게 검증하는 방법을 체득한다. 이 과정을 마친 학생은 과학·사회적으로 민감한 영역에 배치되는 AI 시스템의 위험을 사전에 식별하고 완화 조치를 설계할 수 있다.

⚙️ 지오아카데미시스템관리대학🖥️ AI·컴퓨팅과학대학🔬 기초과학대학⚡ 지능형지구물리탐사대학🛢️ 자원에너지공학대학🌍 응용지구과학대학💼 경제정책미래전략대학🎓 교육훈련대학🚀 혁신국제협력대학
머신러닝학과컴퓨터비전학과자연어처리학과고성능컴퓨팅학과양자컴퓨팅학과생성형AI·파운데이션모델 센터강화학습·에이전트 센터AI 안전·정렬 센터과학을 위한 AI 센터로보틱스·임바디드 AI 센터
🤖
🔑
노버트 위너
학과장

연구원(실제 GeoVerse Lab 소속) 15

W. 로스 애슈비🔑
1903–1972
W. 로스 애슈비
연구원(가치정렬/사이버네틱스제어)
💡 사이버네틱스 제어이론(필요다양성법칙, 호메오스탯) 창시, 조절기가 대상시스템을 제어하려면 그 다양성을 모델링해야 함을 규명 — AI 정렬의 시스템이론적 뿌리
프랭크 P. 램지🔑
1903–1930
프랭크 P. 램지
연구원(선호학습/보상모델링)
💡 주관적 기대효용이론 창시, 선택으로부터 효용함수를 도출하는 공리적 기반 확립 — 인간피드백 기반 보상모델링의 수학적 토대
🧑‍🔬
🔑
1904–1985
도널드 O. 헵
연구원(신경표상의 메커니즘적 해석가능성)
💡 상관활동을 통한 뉴런연결 이론('함께발화하는 세포는 함께연결된다') 제안, 분산표상이 개념을 인코딩하는 방식 연구의 시초 — 신경망 학습표상 해석의 이론적 뿌리
오귀스트 케르크호프스🔑
1835–1903
오귀스트 케르크호프스
연구원(적대적강건성/보안평가)
💡 케르크호프스의 원리(키를 제외한 모든 것이 공개되어도 안전해야 한다) 정식화, AI시스템의 적대적강건성·레드티밍 평가가 전제하는 보안공학의 근본가정
존 포브스 내시 주니어🔑
1928–2015
존 포브스 내시 주니어
연구원(확장가능한감독/다중에이전트토론)
💡 비협력게임이론과 내시균형 창시, 에이전트간 전략적 상호작용 분석의 형식적 틀 — AI안전 토론·다중에이전트 감독 프로토콜의 게임이론적 기초
한스 요나스🔑
1903–1993
한스 요나스
연구원(AI 거버넌스/기술책임윤리)
💡 '책임의 원칙' 정식화 — 현대기술의 전례없는 힘이 미래세대에 대한 장기적·사전예방적 책임윤리를 요구한다는 이론, AI거버넌스 프레임워크의 토대
🧑‍🔬
🔑
1936–2001
로버트 W. 플로이드
연구원(형식검증/안전필수 AI시스템)
💡 형식적 프로그램검증(플로이드-호어 논리) 창시, 안전필수 AI시스템이 명시된 속성을 만족함을 형식적으로 증명하는 수학적 기초
허먼 칸🔑
1922–1983
허먼 칸
연구원(실존적위험분석/장기 AI안전)
💡 저확률·파국적 위험에 대한 체계적 시나리오분석('생각할 수 없는 것을 생각하기') 창시, 이후 첨단 AI에 적용되는 실존적위험 분석방법론의 선구
레오니트 후르비치🔑
1917–2008
레오니트 후르비치
연구원(역강화학습/메커니즘·인센티브설계)
💡 메커니즘설계이론 창시, 사익추구 에이전트의 합리적행동이 진짜 선호를 드러내고 원하는 결과를 만들도록 인센티브구조를 설계하는 법 규명 — 역강화학습과 인센티브정렬의 직접적 토대
존 롤스🔑
1921–2002
존 롤스
연구원(알고리즘 공정성/AI 분배정의)
💡 현대 분배정의이론(공정으로서의 정의, 무지의 베일, 차등의원칙) 창시, 알고리즘 공정성 연구에서 '공정한' AI 의사결정절차의 정의로 가장 많이 인용되는 철학적 기초
J. C. R. 리클라이더🔑
1915–1990
J. C. R. 리클라이더
연구원(신뢰가능한 AI/인간-AI공생)
💡 '인간-컴퓨터공생' 비전 창시 — 상보적 강점을 가진 인간과 기계가 유의미한 인간감독하에 협력한다는 개념 — 신뢰가능하고 인간호환적인 AI시스템 설계의 토대
🧑‍🔬
🔑
1925–2019
찰스 페로
연구원(안전공학/복합 AI시스템의 시스템적위험)
💡 정상사고이론 창시 — 긴밀결합·복잡시스템에서는 안전장치와 무관하게 파국적 실패가 불가피하다는 이론 — 복잡하고 불투명한 AI시스템의 시스템적위험 분석의 토대
이마누엘 칸트🔑
1724–1804
이마누엘 칸트
연구원(머신에씩스/의무론적 제약설계)
💡 의무론적 윤리학(정언명령 — 보편화가능한 원칙에 따라 행동하고 사람을 목적으로 대하라) 창시, AI시스템의 제약설계에서 공리주의와 함께 논의되는 양대 윤리체계 중 하나
🧑‍🔬
🔑
1906–1985
브루노 데 피네티
연구원(캘리브레이션/AI안전을 위한 불확도추정)
💡 주관적(베이즈) 확률이론과 교환가능성정리 창시, 좋은 주관적확률예측자의 기준으로서 캘리브레이션을 정의 — AI시스템의 신뢰도추정이 믿을만한지 평가하는 토대
레프 폰트랴긴🔑
1908–1988
레프 폰트랴긴
연구원(제어이론/자율에이전트의 교정가능성)
💡 최적제어이론(폰트랴긴의 최대원리) 창시, 제약하에서 동역학계를 목표로 유도하는 수학적 틀 — 자율 AI에이전트에 대한 통제·교정가능성 유지이론과 직결