Visual Prompt Tuning
- 2026년 9월 4일 오후 2:57
- 조회수: 2
REFERENCES
INFORMATION
- 2026년 9월 4일
- 오전 12시 ~
온라인 비디오 시청 (YouTube)
발표자:
김윤아
김윤아
TOPIC
Visual Prompt Tuning
On-Line Video
OVERVIEW
요약:
최근 Vision Transformer(ViT)는 컴퓨터 비전 분야의 핵심 백본으로 자리 잡았으며, 대규모 데이터로 사전학습한 뒤 다운스트림 태스크에 맞춰 미세조정하는 pretrain-then-finetune 패러다임이 표준적인 활용 방식이 되었다. 그러나 모델 규모가 수억에서 수십억 개의 파라미터로 커지면서, 태스크마다 백본 전체를 갱신하고 저장하는 full fine-tuning은 학습 및 저장 비용 측면에서 현실적인 한계를 갖는다. 이를 완화하기 위해 다양한 parameter-efficient fine-tuning(PEFT) 기법이 제안되었으며, 그중 사전학습된 백본을 동결한 채 입력 시퀀스에 학습 가능한 prompt token만을 추가하는 visual prompt tuning이 주목받고 있다 [1]. VPT는 모델 내부 구조를 전혀 수정하지 않으면서도 극히 적은 파라미터만으로 full fine-tuning에 준하거나 이를 능가하는 성능을 달성할 수 있음을 보였고, 이는 곧 prompt를 어디에, 얼마나 개입시킬 것인가가 성능을 좌우하는 핵심 설계 문제라는 인식으로 이어졌다. 이후 연구들은 prompt의 개입 위치를 모델 내부로 확장하거나 [2], 레이어별 개입 정도를 데이터로부터 조절하는 방향으로 [3] 이 질문에 답해 왔다. 본 세미나에서는 visual prompt tuning의 등장 배경과 기본 개념을 살펴보고, 이를 정교화해 온 연구 흐름을 소개하는 것을 목표로 한다.
참고자료:
[1] Jia, M., Tang, L., Chen, B. C., Cardie, C., Belongie, S., Hariharan, B., & Lim, S. N. (2022). Visual prompt tuning. In European Conference on Computer Vision (pp. 709-727).
[2] Han, C., Wang, Q., Cui, Y., Cao, Z., Wang, W., Qi, S., & Liu, D. (2023). E²VPT: An effective and efficient approach for visual prompt tuning. In Proceedings of the IEEE/CVF International Conference on Computer Vision (pp. 17491-17502).
[3] Yoo, S., Kim, E., Jung, D., Lee, J., & Yoon, S. (2023). Improving visual prompt tuning for self-supervised vision transformers. In International Conference on Machine Learning (pp. 39848-39861).