GeoVerse Lab
AI·컴퓨팅과학연구본부

AI 안전·정렬 센터

정렬 기법(RLHF 등), 기계적 해석가능성, 강건성·레드팀, 확장 가능한 감독 등 AI 정렬·안전·평가 방법론을 연구하여, 고위험 과학·사회적 환경에 배치되는 첨단 AI 시스템의 안전성·통제가능성·유익성을 확보한다.

머신러닝연구센터자연어처리연구센터컴퓨터비전연구센터고성능컴퓨팅센터양자컴퓨팅연구센터생성형AI·파운데이션모델 센터강화학습·에이전트 센터AI 안전·정렬 센터과학을 위한 AI 센터로보틱스·임바디드 AI 센터
연구분야 15
가치정렬/사이버네틱스제어
🎛️ 가치정렬/사이버네틱스제어
가치정렬은 AI시스템의 행동이 문자 그대로 훈련받은 좁은 목적함수만이 아니라 그것을 배치하는 사람들의 의도와 가치를 따르도록 만드는 데 쓰이는 훈련·평가기법의 집
선호학습/보상모델링
👍 선호학습/보상모델링
선호학습은 절대적 수치점수가 아니라 쌍별비교 데이터셋을 이용해 인간평가자가 두 후보 출력 중 어느 쪽을 선호할지를 예측하도록 보상모델을 훈련시킨 뒤, 그 학습된
신경표상의 메커니즘적 해석가능성
🔍 신경표상의 메커니즘적 해석가능성
메커니즘적 해석가능성은 훈련된 신경망의 내부계산을, 그 매개변수를 입출력으로만 평가되는 불투명한 함수로 다루는 대신 어떤 뉴런이나 주의집중헤드의 조합이 특정 하위
적대적강건성/보안평가
🛡️ 적대적강건성/보안평가
적대적강건성은 공격자가 잘못되거나 안전하지 않은 출력을 유도하려고 입력을 의도적으로, 때로는 감지하기 어려울 만큼 교란할 때 훈련된 모델이 얼마나 신뢰성 있게 올
확장가능한감독/다중에이전트토론
⚖️ 확장가능한감독/다중에이전트토론
확장가능한감독은 비전문가인간이나 덜 유능한 모델처럼 상대적으로 약한 평가자가, 자신이 스스로 검증할 수 없는 출력을 내는 더 유능한 AI시스템을 어떻게 여전히 신
AI 거버넌스/기술책임윤리
🏛️ AI 거버넌스/기술책임윤리
AI 거버넌스는 첨단AI시스템이 개발·배치되는 방식을 형성하는 제도, 규제, 자율규범을 설계하는 학제간 연구·실천으로, 기술표준, 기업자율거버넌스, 국가규제, 국
형식검증/안전필수 AI시스템
형식검증/안전필수 AI시스템
형식검증은 유한한 예시집합에 대한 시험이 아니라 수학적 연역을 통해, 소프트웨어 조각이 정의된 부류 내의 모든 가능한 입력에 대해 정밀하게 명시된 사양을 만족함을
실존적위험분석/장기 AI안전
⚠️ 실존적위험분석/장기 AI안전
실존적위험분석은 급속하고 통제가 미흡한 AI역량 증가 같은 사건이 인류의 장기적 전망을 영구적이고 급격하게 축소시킬 수 있는 시나리오를, 직접적인 역사적 선례나
역강화학습/메커니즘·인센티브설계
🎯 역강화학습/메커니즘·인센티브설계
역강화학습은 일반적인 강화학습처럼 보상이 주어졌다고 가정하고 그에 대응하는 행동을 계산하는 대신, 관측된 에이전트의 행동을 가장 잘 설명하는 보상함수를 추론한다.
알고리즘 공정성/AI 분배정의
⚖️ 알고리즘 공정성/AI 분배정의
알고리즘 공정성은 특히 훈련자료가 역사적인 차별이나 불평등한 대우의 패턴을 반영할 때, AI시스템이 개인에 대해 내리는 결정에서 공정성을 어떻게 정의·측정·시행할
신뢰가능한 AI/인간-AI공생
🤝 신뢰가능한 AI/인간-AI공생
신뢰가능한 AI연구는 인간감독자가 AI시스템을 무시하거나 그 실제신뢰성과 무관하게 출력을 무비판적으로 받아들이는 대신, 주어진 결정에 그 출력을 얼마나 신뢰할지를
안전공학/복합 AI시스템의 시스템적위험
🏭 안전공학/복합 AI시스템의 시스템적위험
복합 AI시스템의 시스템적위험분석은 실패가 어떤 단일하고 식별가능한 구성요소결함이 아니라 긴밀히결합되고 매우복잡한 시스템 내 많은 올바르게작동하는 구성요소들의 상
머신에씩스/의무론적 제약설계
📜 머신에씩스/의무론적 제약설계
머신에씩스는 AI시스템의 훈련과 행동에 내장된 가치체계를 설계하며, 그러한 가치가 주로 시스템이 결코 위반해서는 안 되는 엄격하고 보편화가능한 규칙으로 표현되어야
캘리브레이션/AI안전을 위한 불확도추정
📏 캘리브레이션/AI안전을 위한 불확도추정
캘리브레이션은 모델이 예측과 함께 보고하는 신뢰도가 그 예측이 실제로 맞는 것으로 드러나는 실제빈도와 일치하는지를 측정하며, 이를테면 잘 캘리브레이션된 모델이 7
제어이론/자율에이전트의 교정가능성
🕹️ 제어이론/자율에이전트의 교정가능성
교정가능성연구는 인가된 인간조작자로부터의 교정·수정·정지를, 에이전트가 그렇지 않으면 추구하는 어떤 목적에 대한 장애물로 저항하는 대신 신뢰성 있게 받아들이는 자