세미나

스페셜 토크 시리즈: LLM 정렬을 위한 강화학습, 위험 민감 강화학습 외

2025년 6월 9일 · Pascal Poupart · 워털루대학교 · Vector Institute
스페셜 토크 시리즈: LLM 정렬을 위한 강화학습, 위험 민감 강화학습 외

파스칼 푸파르(Pascal Poupart) 워털루대학교 교수의 스페셜 토크 시리즈입니다(2025년 6월 9일~6월 20일 방문). 공동연구 주제는 강화학습 파운데이션 모델(Reinforcement Learning Foundation Models)입니다.

LLM 정렬과 추론을 위한 강화학습. 인간 피드백 기반 강화학습(RLHF)이 LLM의 정렬을 어떻게 개선하는지, 보상 유도 텍스트 생성의 최신 연구 성과, 그리고 보상 과정 모델을 활용해 추론 시점의 추론 능력을 높이는 방법을 다룹니다.

위험 민감 강화학습. 대부분의 강화학습 기법은 기대 수익을 최대화하기 때문에 파국적 결과의 위험을 안고 있습니다. 이 강연에서는 기대 수익과 다양한 위험·변동성 개념 사이의 균형을 탐색하는 위험 민감 강화학습의 최신 연구를 논의합니다.

기계가 모르는 것을 알도록 학습시키기. 소프트맥스 출력층을 가진 신경망 예측기가 학습 데이터에서 멀어질수록 임의로 높은 확신을 보이는 이유, 이를 방지하는 간단한 수정 방법, 그리고 분산·연합학습에서 보정(calibration)을 향상시키는 보간 기법을 소개합니다.

강화학습은 언제 인과 추론을 활용해야 하는가? 강화학습과 인과 추론은 서로를 보완합니다. 어떤 강화학습 설정이 인과 추론의 도움을 받을 수 있는지, 그리고 어떻게 활용할 수 있는지를 살펴봅니다.

연사

파스칼 푸파르 교수는 워털루대학교 데이비드 R. 체리턴 컴퓨터과학부 교수이자 벡터 연구소(Vector Institute)의 캐나다 CIFAR AI 체어입니다. 토론토대학교에서 박사학위를 받았으며(2005), 강화학습 분야에 대한 기여로 잘 알려져 있습니다. JMLR과 TMLR의 편집위원이며, NeurIPS, ICML, AISTATS, ICLR, IJCAI, AAAI, UAI에서 (수석) 영역 의장을 꾸준히 맡고 있습니다.