- 2026년 7월 24일 오전 10:35
- 조회수: 299
INFORMATION
- 2026년 7월 24일
- 오전 10시 ~
온라인 비디오 시청 (YouTube)
손병우
TOPIC
On-Line Video
OVERVIEW
청취자 후기
김현이
이번 세미나에서는 CLIP에서 사용하는 프롬프트가 어떻게 학습 가능한 형태로 발전해왔는지를 소개해주었다. CLIP은 이미지와 텍스트의 유사도를 이용해 분류를 수행하는데, 같은 의미의 문장이라도 프롬프트를 어떻게 작성하느냐에 따라 성능 차이가 크게 발생한다. 이러한 문제를 해결하기 위해 사람이 직접 프롬프트를 만드는 대신, 데이터로부터 프롬프트를 학습하는 연구가 등장하였다.
CoOp은 적은 수의 이미지로도 과제에 적합한 프롬프트를 학습할 수 있었지만, 모든 이미지에 동일한 프롬프트를 사용하여 새로운 클래스에 대한 성능이 떨어지는 문제가 있었다. CoCoOp은 입력 이미지마다 다른 프롬프트를 생성하여 이를 보완하였다. 이후 MaPLe은 텍스트 쪽만 조정하던 기존 방식에서 벗어나 이미지와 텍스트 인코더를 함께 학습하는 멀티모달 프롬프트 방식을 제안하였다.
마지막으로 MMRL은 이미지와 텍스트가 하나의 공유 표현을 함께 학습하도록 하고, CLIP이 기존에 가지고 있던 일반화 능력과 새로운 과제에 적응하는 능력을 나누어 학습하였다. 특히 앞부분의 특징은 최대한 유지하고 뒷부분에서만 새로운 표현을 학습한다는 점이 인상적이었다.
이번 세미나를 통해 프롬프트 학습이 단순히 문장을 잘 만드는 문제를 넘어, 이미지와 텍스트의 표현을 함께 조정하는 방향으로 발전하고 있다는 것을 알 수 있었다. 각 연구가 이전 방법의 한계를 어떻게 보완했는지 순서대로 설명해주어 전체 흐름을 이해하는 데 도움이 되었다. 좋은 세미나를 준비해준 손병우 연구원에게 고맙다는 말을 전하며 후기를 마친다.
김정인
이번 세미나에서는 Vision-Language Model(VLM)에서 사용되는 Prompt Learning의 개념과 발전 과정을 살펴볼 수 있었다. CLIP과 같은 VLM은 이미지와 텍스트 표현 간의 유사도를 활용해 분류를 수행하지만, 사용하는 prompt에 따라 성능이 달라질 수 있기 때문에 데이터셋에 적합한 prompt를 사람이 반복적으로 설계하고 평가해야 한다는 한계가 있다. Prompt Learning은 이러한 prompt를 데이터로부터 학습함으로써 효율적으로 VLM을 task에 적응시키는 방법이라는 점을 이해할 수 있었다.
초기 CoOp은 handcrafted prompt를 learnable context vector로 대체하였고, CoCoOp은 입력 이미지에 따라 prompt를 조건화하여 unseen class에 대한 일반화 성능을 개선하였다. 이후 MaPLe은 text branch뿐 아니라 visual branch에도 prompt를 적용하고 두 modality의 prompt를 함께 최적화함으로써 multimodal prompt learning으로 확장하였다.
최근의 MMRL은 prompt 자체를 학습하는 것을 넘어 text와 visual modality가 shared representation space를 공동으로 학습하도록 확장하였다. 또한 pretrained CLIP의 일반화 지식과 task-specific representation을 분리하여 활용함으로써 adaptation과 generalization 간의 균형을 고려하였다.
이번 세미나를 통해 Prompt Learning이 text prompt tuning에서 conditional prompting, multimodal prompting, 그리고 multimodal representation learning으로 점차 확장되어 온 흐름을 이해할 수 있었다. 특히 사전학습된 VLM의 지식을 유지하면서 적은 학습 비용으로 새로운 task에 효과적으로 적응하고, 동시에 unseen class나 새로운 domain에 대한 일반화 성능을 확보하는 것이 Prompt Learning의 중요한 연구 방향이라는 점이 인상적이었다. 유익한 세미나를 준비해 준 병우에게 고마운 마음을 전하며, 이상으로 세미나 후기를 마친다.
김지현
최근에 prompt tuning을 주제로 개인연구를 마무리했기에 특히나 흥미롭게 들었던 세미나였다. 나는 text promt learning (CoOp, CoCoOp)에 기반한 튜닝 방법론에 대해서만 공부했었는데, 본 세미나에서는 multi-modal 기반 learning 기법(MaPLe, MMRL)까지 다루어주어, vision-language model의 구조적 특성을 활용한 prompt learning의 발전 과정을 더 깊이 알 수 있는 기회가 되었다.
CoOp은 수동으로 작성된 handcrafted prompt를 학습 가능한 벡터로 대체하는 기법을 최초로 제안하며, CLIP 인코더는 고정한 채로 이 벡터들만을 학습시켜 few-shot classification 성능을 극대화시킨 연구이다. 다만, 학습에 이용된 특정 데이터 분포에 과적합되어 일반화 성능이 낮은 문제가 있기에, 후속 연구로서 CoCoOp이 제안되었다. CoOp에 추가적으로 작은 신경망을 하나 더 학습해서 각 이미지마다 conditional token vector를 생성하고 학습하도록 하여, 기존 CoOp의 정적인 구조에서 탈피하고 unseen class에 대해서도 일반화 성능을 높일 수 있었다. 그러나 두 연구는 CLIP과 같은 vision language model을 기반으로 하면서도 vision modality를 이용하지는 않았다. 이러한 한계를 지적하며 제안된 방법론인 MaPLe은 텍스트와 이미지 모두에 대해 함께 적응을 수행하며 시너지를 유도한다. 보다 구체적으로는, 두 모달리티 모두에 learnable prompt를 삽입해 학습 가능하도록 하고, VL coupling function을 통해 vision, text 모달리티 간의 정렬을 유지하는 전략을 취한다. 그리고 MMRL은 여기서 더 나아가, 이미지와 텍스트가 함께 공유할 수 있는 표현 공간을 도입하여 멀티모달 상호작용을 촉진하는 기법을 제안한다.
결국 CLIP과 같은 vision language encoder 구조를 이용해 연구할 때는, 어떻게 vision과 text 모달리티 두 가지를 적절히 함께 이용할 수 있는가?를 중심적으로 고민해야 하는 것 같다. 좋은 세미나 준비해준 병우에게 감사의 말을 전하며, 앞으로의 연구도 잘 마무리할 수 있기를 응원한다.