세미나

멀티모달 파운데이션 모델의 최신 연구 성과

2025년 6월 27일 · Ming-Hsuan Yang · UC 머시드 · Google DeepMind
멀티모달 파운데이션 모델의 최신 연구 성과

비전·언어 모델의 최근 발전은 시각 이해와 생성 과제의 성능을 크게 끌어올렸습니다. 이번 강연에서는 트랜스포머를 위한 효과적인 토크나이저 설계에 관한 최신 연구와, 고정된(frozen) 대형언어모델을 다양한 비전 과제에 적응시키는 연구를 소개합니다. 여기에는 시각 분류, 영상-텍스트 검색, 시각 캡셔닝, 시각 질의응답, 시각적 접지(visual grounding), 영상 생성, 스타일화, 아웃페인팅, 영상-오디오 변환이 포함됩니다. 시간이 허락하면 확산 모델 학습과 동적 3D 비전에 관한 최근 연구 결과도 함께 다룹니다.

연사

양밍쉬안(Ming-Hsuan Yang) 교수는 UC머세드 교수이자 구글 딥마인드 리서치 사이언티스트입니다. 구글 패컬티 어워드, NSF CAREER상, 엔비디아 파이오니어 연구상, CVPR 2023 롱게-히긴스상(Test of Time), ICML 2024 최우수 논문상, WACV 2025 테스트 오브 타임 어워드 등을 수상했습니다. IEEE TPAMI 부편집장(Associate Editor-in-Chief)이며 IEEE, ACM, AAAI 펠로우입니다.