🔑1835–1903오귀스트 케르크호프스연구원(적대적강건성/보안평가)💡 케르크호프스의 원리(키를 제외한 모든 것이 공개되어도 안전해야 한다) 정식화, AI시스템의 적대적강건성·레드티밍 평가가 전제하는 보안공학의 근본가정🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1903–1972W. 로스 애슈비연구원(가치정렬/사이버네틱스제어)💡 사이버네틱스 제어이론(필요다양성법칙, 호메오스탯) 창시, 조절기가 대상시스템을 제어하려면 그 다양성을 모델링해야 함을 규명 — AI 정렬의 시스템이론적 뿌리🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑🔬🔑1906–1985브루노 데 피네티연구원(캘리브레이션/AI안전을 위한 불확도추정)💡 주관적(베이즈) 확률이론과 교환가능성정리 창시, 좋은 주관적확률예측자의 기준으로서 캘리브레이션을 정의 — AI시스템의 신뢰도추정이 믿을만한지 평가하는 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1908–1988레프 폰트랴긴연구원(제어이론/자율에이전트의 교정가능성)💡 최적제어이론(폰트랴긴의 최대원리) 창시, 제약하에서 동역학계를 목표로 유도하는 수학적 틀 — 자율 AI에이전트에 대한 통제·교정가능성 유지이론과 직결🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1928–2015존 포브스 내시 주니어연구원(확장가능한감독/다중에이전트토론)💡 비협력게임이론과 내시균형 창시, 에이전트간 전략적 상호작용 분석의 형식적 틀 — AI안전 토론·다중에이전트 감독 프로토콜의 게임이론적 기초🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1724–1804이마누엘 칸트연구원(머신에씩스/의무론적 제약설계)💡 의무론적 윤리학(정언명령 — 보편화가능한 원칙에 따라 행동하고 사람을 목적으로 대하라) 창시, AI시스템의 제약설계에서 공리주의와 함께 논의되는 양대 윤리체계 중 하나🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1921–2002존 롤스연구원(알고리즘 공정성/AI 분배정의)💡 현대 분배정의이론(공정으로서의 정의, 무지의 베일, 차등의원칙) 창시, 알고리즘 공정성 연구에서 '공정한' AI 의사결정절차의 정의로 가장 많이 인용되는 철학적 기초🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1903–1993한스 요나스연구원(AI 거버넌스/기술책임윤리)💡 '책임의 원칙' 정식화 — 현대기술의 전례없는 힘이 미래세대에 대한 장기적·사전예방적 책임윤리를 요구한다는 이론, AI거버넌스 프레임워크의 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑🔬🔑1904–1985도널드 O. 헵연구원(신경표상의 메커니즘적 해석가능성)💡 상관활동을 통한 뉴런연결 이론('함께발화하는 세포는 함께연결된다') 제안, 분산표상이 개념을 인코딩하는 방식 연구의 시초 — 신경망 학습표상 해석의 이론적 뿌리🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1917–2008레오니트 후르비치연구원(역강화학습/메커니즘·인센티브설계)💡 메커니즘설계이론 창시, 사익추구 에이전트의 합리적행동이 진짜 선호를 드러내고 원하는 결과를 만들도록 인센티브구조를 설계하는 법 규명 — 역강화학습과 인센티브정렬의 직접적 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1903–1930프랭크 P. 램지연구원(선호학습/보상모델링)💡 주관적 기대효용이론 창시, 선택으로부터 효용함수를 도출하는 공리적 기반 확립 — 인간피드백 기반 보상모델링의 수학적 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑🔬🔑1925–2019찰스 페로연구원(안전공학/복합 AI시스템의 시스템적위험)💡 정상사고이론 창시 — 긴밀결합·복잡시스템에서는 안전장치와 무관하게 파국적 실패가 불가피하다는 이론 — 복잡하고 불투명한 AI시스템의 시스템적위험 분석의 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1915–1990J. C. R. 리클라이더연구원(신뢰가능한 AI/인간-AI공생)💡 '인간-컴퓨터공생' 비전 창시 — 상보적 강점을 가진 인간과 기계가 유의미한 인간감독하에 협력한다는 개념 — 신뢰가능하고 인간호환적인 AI시스템 설계의 토대🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🧑🔬🔑1936–2001로버트 W. 플로이드연구원(형식검증/안전필수 AI시스템)💡 형식적 프로그램검증(플로이드-호어 논리) 창시, 안전필수 AI시스템이 명시된 속성을 만족함을 형식적으로 증명하는 수학적 기초🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터
🔑1922–1983허먼 칸연구원(실존적위험분석/장기 AI안전)💡 저확률·파국적 위험에 대한 체계적 시나리오분석('생각할 수 없는 것을 생각하기') 창시, 이후 첨단 AI에 적용되는 실존적위험 분석방법론의 선구🖥️ AI·컴퓨팅과학연구본부AI 안전·정렬 센터