- 2026년 7월 24일 오전 10:35
- 조회수: 230
INFORMATION
- 2026년 7월 24일
- 오전 10시 ~
온라인 비디오 시청 (YouTube)
손병우
TOPIC
On-Line Video
OVERVIEW
청취자 후기
김현이
이번 세미나에서는 CLIP에서 사용하는 프롬프트가 어떻게 학습 가능한 형태로 발전해왔는지를 소개해주었다. CLIP은 이미지와 텍스트의 유사도를 이용해 분류를 수행하는데, 같은 의미의 문장이라도 프롬프트를 어떻게 작성하느냐에 따라 성능 차이가 크게 발생한다. 이러한 문제를 해결하기 위해 사람이 직접 프롬프트를 만드는 대신, 데이터로부터 프롬프트를 학습하는 연구가 등장하였다.
CoOp은 적은 수의 이미지로도 과제에 적합한 프롬프트를 학습할 수 있었지만, 모든 이미지에 동일한 프롬프트를 사용하여 새로운 클래스에 대한 성능이 떨어지는 문제가 있었다. CoCoOp은 입력 이미지마다 다른 프롬프트를 생성하여 이를 보완하였다. 이후 MaPLe은 텍스트 쪽만 조정하던 기존 방식에서 벗어나 이미지와 텍스트 인코더를 함께 학습하는 멀티모달 프롬프트 방식을 제안하였다.
마지막으로 MMRL은 이미지와 텍스트가 하나의 공유 표현을 함께 학습하도록 하고, CLIP이 기존에 가지고 있던 일반화 능력과 새로운 과제에 적응하는 능력을 나누어 학습하였다. 특히 앞부분의 특징은 최대한 유지하고 뒷부분에서만 새로운 표현을 학습한다는 점이 인상적이었다.
이번 세미나를 통해 프롬프트 학습이 단순히 문장을 잘 만드는 문제를 넘어, 이미지와 텍스트의 표현을 함께 조정하는 방향으로 발전하고 있다는 것을 알 수 있었다. 각 연구가 이전 방법의 한계를 어떻게 보완했는지 순서대로 설명해주어 전체 흐름을 이해하는 데 도움이 되었다. 좋은 세미나를 준비해준 손병우 연구원에게 고맙다는 말을 전하며 후기를 마친다.
김정인
이번 세미나에서는 Vision-Language Model(VLM)에서 사용되는 Prompt Learning의 개념과 발전 과정을 살펴볼 수 있었다. CLIP과 같은 VLM은 이미지와 텍스트 표현 간의 유사도를 활용해 분류를 수행하지만, 사용하는 prompt에 따라 성능이 달라질 수 있기 때문에 데이터셋에 적합한 prompt를 사람이 반복적으로 설계하고 평가해야 한다는 한계가 있다. Prompt Learning은 이러한 prompt를 데이터로부터 학습함으로써 효율적으로 VLM을 task에 적응시키는 방법이라는 점을 이해할 수 있었다.
초기 CoOp은 handcrafted prompt를 learnable context vector로 대체하였고, CoCoOp은 입력 이미지에 따라 prompt를 조건화하여 unseen class에 대한 일반화 성능을 개선하였다. 이후 MaPLe은 text branch뿐 아니라 visual branch에도 prompt를 적용하고 두 modality의 prompt를 함께 최적화함으로써 multimodal prompt learning으로 확장하였다.
최근의 MMRL은 prompt 자체를 학습하는 것을 넘어 text와 visual modality가 shared representation space를 공동으로 학습하도록 확장하였다. 또한 pretrained CLIP의 일반화 지식과 task-specific representation을 분리하여 활용함으로써 adaptation과 generalization 간의 균형을 고려하였다.
이번 세미나를 통해 Prompt Learning이 text prompt tuning에서 conditional prompting, multimodal prompting, 그리고 multimodal representation learning으로 점차 확장되어 온 흐름을 이해할 수 있었다. 특히 사전학습된 VLM의 지식을 유지하면서 적은 학습 비용으로 새로운 task에 효과적으로 적응하고, 동시에 unseen class나 새로운 domain에 대한 일반화 성능을 확보하는 것이 Prompt Learning의 중요한 연구 방향이라는 점이 인상적이었다. 유익한 세미나를 준비해 준 병우에게 고마운 마음을 전하며, 이상으로 세미나 후기를 마친다.