- 2026년 8월 27일 오후 3:17
- 조회수: 65
안채원
이번 학회에서는 자연어로 입력된 사용자의 요구사항에 따라 반도체 SEM 이미지 내의 객체를 분할하는 연구를 주제로 포스터 발표를 진행하였다. 기존의 SAM3 Agent를 반도체 SEM 이미지에 적용하면서 발생하는 문제를 분석하고, 이를 해결하기 위해 SEM 이미지의 특성을 반영한 시스템 프롬프트와 미검출 객체를 추가로 탐색하는 Self-feedback loop를 제안하였다. 특히 SAM3 Image Encoder에서 추출한 특징을 활용하여 유사도를 계산하거나 K-means 군집화를 통해 미검출 객체의 위치를 찾고, 이를 다시 Exemplar로 활용하여 객체를 추가 분할하는 방법을 소개하였다.
발표 중에는 연구의 기존 방법과의 차이점이나 추가 학습 없이 새로운 반도체 이미지에 적용할 수 있는 이유 등에 대한 질문을 받을 수 있었다. 특히 기존 SAM3 Agent와 비교했을 때 어떤 부분이 개선되었는지 설명하면서, 기존 프레임워크가 자연 이미지를 중심으로 설계되어 반복적이고 규칙적인 특징을 가진 SEM 이미지에서는 객체를 놓치거나 적절하지 않은 객체를 선택하는 문제가 발생할 수 있다는 점을 설명하였다. 이에 제안한 방법에서는 이미지 특징을 다시 분석하여 미검출 객체의 위치를 탐색하고, 추가적인 Exemplar를 적용한 뒤 다시 MLLM이 결과를 분석하는 Self-feedback 과정을 통해 이러한 문제를 보완한다고 답변하였다.
또한 새로운 반도체 공정에 대해서도 별도의 재학습 없이 적용할 수 있는 이유에 대해서는, 특정 공정의 데이터를 학습하는 방식이 아니라 SAM3와 MLLM이 가진 기존의 능력을 활용하면서 시스템 프롬프트와 추가 도구를 통해 추론 과정을 보완하는 방식이기 때문이라고 설명하였다. 이러한 질의응답을 통해 연구를 진행하는 과정에서는 당연하게 생각했던 부분도 다른 사람의 입장에서는 충분한 설명이 필요하다는 것을 느꼈다.
첫 번째로 청취한 발표는 긴 영상에서 발생하는 방대한 Vision Token을 효율적으로 압축하여 Large Multimodal Model이 장시간 영상을 이해할 수 있도록 하는 방법에 관한 연구였다. 기존에는 질문과 관련된 프레임을 미리 선택하여 모델에 입력하는 방식을 사용할 수 있지만, 실제 상황에서는 어떤 프레임이 질문과 관련 있는지를 사전에 정확하게 판단하기 어렵다는 한계가 있다는 점이 인상적이었다.
이를 해결하기 위해 입력된 이미지 토큰의 중요도를 Gate를 통해 판단하고, Learnable Sampling을 활용하여 중요한 정보를 적응적으로 선택하고 압축하는 방식을 제안하였다. 또한 긴 시퀀스를 효율적으로 처리하기 위해 State Space Model 기반의 양방향 Mamba 구조를 적용하였다. 영상의 길이가 증가할수록 Attention 기반 모델은 계산량과 메모리 사용량이 크게 증가할 수 있기 때문에, 모델 구조를 개선하는 것뿐만 아니라 입력 자체를 효율적으로 압축하는 과정도 중요하다는 것을 느낄 수 있었다.
Mamba는 이전에 비디오 연구를 할 때 접한 적이 있었는데, 아직은 트랜스포머의 압도적인 성능 때문에 주류가 되지는 않았다고 알고 있었다. 하지만 네이버 현직자 분이 mamba라는 구조를 실제 현업에 도입하여 연구를 하신 것을 보고 기술의 변화가 가장 빨리 적용 되는 곳이 ai분야라는 것을 다시 한번 느낄 수 있었고, 새로운 트렌드에 항상 열려있는 자세로 받아들여야할 것 같다는 생각이 들었다.
Mask Prior Drift를 완화하기 위해 저주파 성분을 중심으로 마스크의 사전 정보를 보정하여 객체의 대략적인 위치와 형태가 생성 과정에서 점차 밀려나는 현상을 방지하고, 고주파 성분을 조절하여 객체의 경계와 세부적인 질감이 자연스럽게 유지될 수 있도록 하였다. 또한 Attention Map을 주파수 영역으로 변환하여 분석하고, Attention이 특정 위치에 과도하게 집중되는 Positional Attention Collapse 현상을 완화하는 방법도 인상적이었다. 고주파 성분을 억제하고 중저주파 성분의 분포를 조절함으로써 Attention이 하나의 지점으로 집중되는 것을 방지하고 보다 부드럽고 균일하게 퍼지도록 유도한다.
이번 발표를 통해 주파수 기반 분석이 생각보다 다양한 분야에 활용될 수 있다는 것을 느꼈다. 평소 이미지 처리에서 주로 사용되는 개념이라고 생각했던 주파수 분석이 Diffusion Model이나 Vision Language Model의 내부 현상을 분석하고 개선하는 방법으로도 적용될 수 있다는 점이 특히 인상적이었다. 같은 Attention Map이라도 단순히 픽셀 공간에서 바라보는 것이 아니라 주파수 영역으로 변환하면 다른 관점에서 문제를 해석할 수 있다는 점을 배울 수 있었고 우리가 쉽게 접하는 개념들을 그냥 넘기지 말고 이 개념이 어떻게 적용될 수 있을지 생각해봐야 할 것 같다.