GeoVerse Lab
AI·컴퓨팅과학연구본부

AI 안전·정렬 센터

정렬 기법(RLHF 등), 기계적 해석가능성, 강건성·레드팀, 확장 가능한 감독 등 AI 정렬·안전·평가 방법론을 연구하여, 고위험 과학·사회적 환경에 배치되는 첨단 AI 시스템의 안전성·통제가능성·유익성을 확보한다.

⚙️ 지오버스시스템관리연구본부🖥️ AI·컴퓨팅과학연구본부🔬 기초과학연구본부⚡ 지능형지구물리탐사연구본부🛢️ 자원에너지공학연구본부🌍 응용지구과학연구본부💼 경제정책미래전략연구본부🎓 교육훈련인재양성연구본부🚀 혁신사업화국제협력연구본부
머신러닝연구센터자연어처리연구센터컴퓨터비전연구센터고성능컴퓨팅센터양자컴퓨팅연구센터생성형AI·파운데이션모델 센터강화학습·에이전트 센터AI 안전·정렬 센터과학을 위한 AI 센터로보틱스·임바디드 AI 센터
노버트 위너🔑
센터장
노버트 위너
센터장(AI 안전·정렬 센터)
💡 사이버네틱스 창시자, AI 위험성 조기 경고
오귀스트 케르크호프스🔑
1835–1903
오귀스트 케르크호프스
연구원(적대적강건성/보안평가)
💡 케르크호프스의 원리(키를 제외한 모든 것이 공개되어도 안전해야 한다) 정식화, AI시스템의 적대적강건성·레드티밍 평가가 전제하는 보안공학의 근본가정
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
W. 로스 애슈비🔑
1903–1972
W. 로스 애슈비
연구원(가치정렬/사이버네틱스제어)
💡 사이버네틱스 제어이론(필요다양성법칙, 호메오스탯) 창시, 조절기가 대상시스템을 제어하려면 그 다양성을 모델링해야 함을 규명 — AI 정렬의 시스템이론적 뿌리
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑‍🔬
🔑
1906–1985
브루노 데 피네티
연구원(캘리브레이션/AI안전을 위한 불확도추정)
💡 주관적(베이즈) 확률이론과 교환가능성정리 창시, 좋은 주관적확률예측자의 기준으로서 캘리브레이션을 정의 — AI시스템의 신뢰도추정이 믿을만한지 평가하는 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
레프 폰트랴긴🔑
1908–1988
레프 폰트랴긴
연구원(제어이론/자율에이전트의 교정가능성)
💡 최적제어이론(폰트랴긴의 최대원리) 창시, 제약하에서 동역학계를 목표로 유도하는 수학적 틀 — 자율 AI에이전트에 대한 통제·교정가능성 유지이론과 직결
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
존 포브스 내시 주니어🔑
1928–2015
존 포브스 내시 주니어
연구원(확장가능한감독/다중에이전트토론)
💡 비협력게임이론과 내시균형 창시, 에이전트간 전략적 상호작용 분석의 형식적 틀 — AI안전 토론·다중에이전트 감독 프로토콜의 게임이론적 기초
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
이마누엘 칸트🔑
1724–1804
이마누엘 칸트
연구원(머신에씩스/의무론적 제약설계)
💡 의무론적 윤리학(정언명령 — 보편화가능한 원칙에 따라 행동하고 사람을 목적으로 대하라) 창시, AI시스템의 제약설계에서 공리주의와 함께 논의되는 양대 윤리체계 중 하나
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
존 롤스🔑
1921–2002
존 롤스
연구원(알고리즘 공정성/AI 분배정의)
💡 현대 분배정의이론(공정으로서의 정의, 무지의 베일, 차등의원칙) 창시, 알고리즘 공정성 연구에서 '공정한' AI 의사결정절차의 정의로 가장 많이 인용되는 철학적 기초
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
한스 요나스🔑
1903–1993
한스 요나스
연구원(AI 거버넌스/기술책임윤리)
💡 '책임의 원칙' 정식화 — 현대기술의 전례없는 힘이 미래세대에 대한 장기적·사전예방적 책임윤리를 요구한다는 이론, AI거버넌스 프레임워크의 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑‍🔬
🔑
1904–1985
도널드 O. 헵
연구원(신경표상의 메커니즘적 해석가능성)
💡 상관활동을 통한 뉴런연결 이론('함께발화하는 세포는 함께연결된다') 제안, 분산표상이 개념을 인코딩하는 방식 연구의 시초 — 신경망 학습표상 해석의 이론적 뿌리
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
레오니트 후르비치🔑
1917–2008
레오니트 후르비치
연구원(역강화학습/메커니즘·인센티브설계)
💡 메커니즘설계이론 창시, 사익추구 에이전트의 합리적행동이 진짜 선호를 드러내고 원하는 결과를 만들도록 인센티브구조를 설계하는 법 규명 — 역강화학습과 인센티브정렬의 직접적 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
프랭크 P. 램지🔑
1903–1930
프랭크 P. 램지
연구원(선호학습/보상모델링)
💡 주관적 기대효용이론 창시, 선택으로부터 효용함수를 도출하는 공리적 기반 확립 — 인간피드백 기반 보상모델링의 수학적 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑‍🔬
🔑
1925–2019
찰스 페로
연구원(안전공학/복합 AI시스템의 시스템적위험)
💡 정상사고이론 창시 — 긴밀결합·복잡시스템에서는 안전장치와 무관하게 파국적 실패가 불가피하다는 이론 — 복잡하고 불투명한 AI시스템의 시스템적위험 분석의 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
J. C. R. 리클라이더🔑
1915–1990
J. C. R. 리클라이더
연구원(신뢰가능한 AI/인간-AI공생)
💡 '인간-컴퓨터공생' 비전 창시 — 상보적 강점을 가진 인간과 기계가 유의미한 인간감독하에 협력한다는 개념 — 신뢰가능하고 인간호환적인 AI시스템 설계의 토대
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑‍🔬
🔑
1936–2001
로버트 W. 플로이드
연구원(형식검증/안전필수 AI시스템)
💡 형식적 프로그램검증(플로이드-호어 논리) 창시, 안전필수 AI시스템이 명시된 속성을 만족함을 형식적으로 증명하는 수학적 기초
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
허먼 칸🔑
1922–1983
허먼 칸
연구원(실존적위험분석/장기 AI안전)
💡 저확률·파국적 위험에 대한 체계적 시나리오분석('생각할 수 없는 것을 생각하기') 창시, 이후 첨단 AI에 적용되는 실존적위험 분석방법론의 선구
🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터