- 2026년 7월 24일 오전 10:35
- 조회수: 108
INFORMATION
- 2026년 7월 24일
- 오전 10시 ~
온라인 비디오 시청 (YouTube)
손병우
TOPIC
On-Line Video
OVERVIEW
청취자 후기
김현이
이번 세미나에서는 CLIP에서 사용하는 프롬프트가 어떻게 학습 가능한 형태로 발전해왔는지를 소개해주었다. CLIP은 이미지와 텍스트의 유사도를 이용해 분류를 수행하는데, 같은 의미의 문장이라도 프롬프트를 어떻게 작성하느냐에 따라 성능 차이가 크게 발생한다. 이러한 문제를 해결하기 위해 사람이 직접 프롬프트를 만드는 대신, 데이터로부터 프롬프트를 학습하는 연구가 등장하였다.
CoOp은 적은 수의 이미지로도 과제에 적합한 프롬프트를 학습할 수 있었지만, 모든 이미지에 동일한 프롬프트를 사용하여 새로운 클래스에 대한 성능이 떨어지는 문제가 있었다. CoCoOp은 입력 이미지마다 다른 프롬프트를 생성하여 이를 보완하였다. 이후 MaPLe은 텍스트 쪽만 조정하던 기존 방식에서 벗어나 이미지와 텍스트 인코더를 함께 학습하는 멀티모달 프롬프트 방식을 제안하였다.
마지막으로 MMRL은 이미지와 텍스트가 하나의 공유 표현을 함께 학습하도록 하고, CLIP이 기존에 가지고 있던 일반화 능력과 새로운 과제에 적응하는 능력을 나누어 학습하였다. 특히 앞부분의 특징은 최대한 유지하고 뒷부분에서만 새로운 표현을 학습한다는 점이 인상적이었다.
이번 세미나를 통해 프롬프트 학습이 단순히 문장을 잘 만드는 문제를 넘어, 이미지와 텍스트의 표현을 함께 조정하는 방향으로 발전하고 있다는 것을 알 수 있었다. 각 연구가 이전 방법의 한계를 어떻게 보완했는지 순서대로 설명해주어 전체 흐름을 이해하는 데 도움이 되었다. 좋은 세미나를 준비해준 손병우 연구원에게 고맙다는 말을 전하며 후기를 마친다.