← AI·컴퓨팅과학연구본부
생성형AI·파운데이션모델 센터
사전학습·RLHF·스케일링 법칙을 아우르는 대규모 파운데이션 모델(LLM, 디퓨전, 멀티모달)을 발전시키고, 도메인 적응과 검색증강생성(RAG)을 통해 과학적 추론·데이터 합성·지구과학 특화 응용에 맞게 조정한다.
연구분야 15

🔄 시퀀스모델링/연결주의구조
시퀀스모델링은 텍스트·음성·시계열 같은 순서화된자료를 처리하거나 생성하도록 신경망을 훈련시키는데, 정보를 신경망의 층을 통해, 또는 한 시간단계에서 다음으로 진행…

🌫️ 디퓨전모델/스코어기반생성모델링
디퓨전모델은 실제훈련예시에 무작위잡음을 점진적으로 더해 순수잡음과 구별할 수 없게 될 때까지 만드는 고정된과정을 역전시키는 법을 학습하여 새로운자료를 생성하는데,…

🔤 통계·자기회귀언어모델링
언어모델은 기호(가장 흔하게는 단어나 하위단어토큰)의 시퀀스에 확률을 부여하며, 자기회귀언어모델은 그 확률을 각각 그 이전에 온 기호만을 조건으로 다음기호를 예측…

🎲 생성적확률모델링/잠재변수추론
잠재변수생성모델은 관측자료가 먼저 어떤 사전분포로부터 관측되지않은 저차원 잠재변수를 표본추출한 뒤 그 잠재변수를 조건으로 관측자료를 생성함으로써 만들어진다고 가정…

⚔️ 생성적적대신경망/미니맥스게임이론적생성
생성적적대신경망은 두 신경망을 대립적으로 훈련시킨다. 무작위입력으로부터 합성자료를 만드는 생성기와, 생성기의 합성출력을 실제훈련예시와 구별하려는 판별기이며, 두 …

🗜️ 오토인코더/잠재표상학습
오토인코더는 잠재병목이라 불리는 좁은 중간층을 통과시킨 뒤 자신의 입력을 재구성하도록 훈련되는 신경망으로, 그 병목을 통과할 만큼 압축되면서도 원래입력을 정확히 …

📈 스케일링법칙/거대모델의 창발적행동
신경스케일링법칙은 언어모델의 시험손실과 모델매개변수수·훈련데이터셋 크기·사용된 연산량 같은 훈련에 투자된 자원의 규모 사이에서 경험적으로 관측된 거듭제곱법칙관계로…

🔗 멀티모달/시각-언어파운데이션모델
멀티모달 파운데이션모델은 그 공유공간 내에서 짝지어진 영상-텍스트쌍을 가깝게 끌어당기고 짝지어지지않은쌍을 밀어냄으로써 대개 훈련되어, 이를테면 영상과 그것을 기술…

📚 검색증강생성/정보검색
검색증강생성은 응답을 생성하기 전에 외부말뭉치로부터 관련문서의 소집합을 검색하고, 검색된텍스트를 추가맥락으로 언어모델의 생성을 조건화하여, 모델의 출력이 그 훈련…

🧵 단어/벡터임베딩/분포의미론
단어임베딩은 각 단어나 하위단어토큰을 조밀한 수치벡터로 표현하는데, 대규모훈련말뭉치 전반에서 비슷한언어적맥락에 나타나는 단어가 결과적인 벡터공간에서 가깝게 위치하…

💡 문맥내학습/순차적·적응적통계추론
문맥내학습은 대형언어모델이 근원 가중치에 대한 어떠한 갱신도 전혀 일어나지 않은 채, 그 입력프롬프트에 직접 놓인 소수의 예시 입출력쌍을 조건으로 삼는 것만으로 …

🔧 파인튜닝/전이학습
파인튜닝은 이미 대규모범용데이터셋으로 사전훈련된 파운데이션모델을 더 작은 과제특화데이터셋으로 훈련을 계속함으로써 특정하위과제에 적응시키는데, 대개 모델의 모든매개…

🔤 하위단어토큰화
하위단어토큰화는 원문텍스트를 자주반복되는문자열, 즉 하위단어토큰의 고정된 어휘집합으로 분할하는데, 흔한 온전한단어는 단일토큰이 되고 드물거나 처음보는단어는 더짧고…

🧪 지식증류/모델압축
지식증류는 더작은 학생신경망을 훈련시켜 이미훈련된 더큰 교사신경망의 출력행동을 재현하도록 하는데, 대개 학생이 가능한답 중 단하나의 가장 가능성높은답만이 아니라 …

📚 말뭉치분류체계/도메인적응데이터큐레이션
도메인적응데이터큐레이션은 훈련말뭉치를 법률, 의학, 코드, 일상대화 같은 주제도메인의 계층적분류체계로 조직화하여, 모델이 원문텍스트덩어리 전체를 미분화된하나로 취…
