- 2026년 7월 10일 오후 12:36
- 조회수: 398
INFORMATION
- 2026년 7월 10일
- 오전 10시 ~
온라인 비디오 시청 (YouTube)
강동훈
TOPIC
On-Line Video
OVERVIEW
청취자 후기
김정인
이번 세미나에서는 Weakly Supervised Video Anomaly Detection(WSVAD)의 기본 개념부터 최근 Vision-Language Model을 활용한 연구까지의 발전 과정을 살펴볼 수 있었다. WSVAD는 각 frame이나 segment의 정답을 모두 제공하지 않고 비디오 전체의 정상·이상 여부만을 이용해 실제 이상이 발생한 구간을 찾아내는 문제로, 세밀한 frame-level labeling에 필요한 비용을 줄이면서도 이상 구간을 탐지할 수 있다는 점이 흥미로웠다.
초기 연구에서는 MIL Ranking을 통해 이상 비디오에서 가장 높은 anomaly score를 가진 segment가 정상 비디오에서 가장 높은 anomaly score를 가진 segment보다 높은 점수를 갖도록 학습하였다. 하지만 이러한 방식은 가장 높은 score를 가진 segment에 학습이 집중되어 이상 비디오 내의 여러 anomaly 구간을 충분히 반영하기 어렵고, 기존 C3D 기반 visual feature는 action recognition 중심으로 학습되어 동일한 행동도 상황에 따라 정상과 이상으로 달라지는 의미적 맥락을 표현하는 데 한계가 있었다.
이후 CLIP-TSA에서는 CLIP의 visual representation과 temporal information을 활용하여 이상 상황의 맥락과 여러 이상 구간을 함께 고려하였고, VadCLIP은 visual feature와 text label을 연결하여 단순히 정상과 이상을 구분하는 것을 넘어 어떤 종류의 이상이 발생했는지까지 파악하는 방향으로 확장하였다. 또한 최근에는 정상 패턴 자체를 학습하고 이상 사건과 배경 정보를 분리하려는 접근까지 제안되면서, WSVAD 연구가 단순한 anomaly score 예측에서 점차 영상의 의미적 맥락을 이해하는 방향으로 발전하고 있음을 알 수 있었다.
이번 세미나를 통해 제한된 supervision만으로 이상 구간을 탐지하는 기본 아이디어에서 시작하여, CLIP과 Vision-Language Alignment를 활용해 이상 상황의 의미까지 이해하려는 연구 흐름을 파악할 수 있었다. 특히 video anomaly detection에서는 단순한 시각적 패턴뿐 아니라 상황의 맥락과 정상성에 대한 이해가 중요하다는 점이 인상적이었다. 휼륭한 세미나를 준비해 준 동훈에게 고마운 마음을 전하며, 이상으로 세미나 후기를 마친다.