[학회후기]

2026 8 24일부터 26일까지 충남 예산 스플라스 리솜에서 열린 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회의 주제는 “From Data to Action: Agentic AI Meets the Physical World”, Physical AI Agentic AI를 중심으로 로봇, 제조 현장, World Model 등 다양한 연구와 산업 적용 사례를 접할 수 있었다.

내가 진행하고 있는 연구와 직접적으로 맞닿아 있는 분야는 아니지만, 산업 이상탐지가 단순히 이미지에서 정상과 이상을 판별하는 단계에 머무르지 않고, 이상을 발견한 뒤 원인을 추론하고 필요한 정보를 추가로 탐색해 적절한 후속 조치까지 제안하거나 수행하는 에이전트 기반 이상 대응 시스템으로 확장될 수 있겠다는 생각이 들어 관심이 생겼다. 특히 언어적 지시를 로봇의 실제 행동으로 연결하는 연구부터 제조 현장의 Physical AI, Sim-to-Real 기반 Robot Intelligence, 산업 현장에서 활용되는 Agentic AI까지 다양한 강연을 접하면서 이러한 가능성을 조금 더 구체적으로 생각해볼 수 있었다.

이번 학회에서 특히 인상적이었던 것은 다른 연구자들의 질문하는 태도였던 것 같다. 포스터 발표를 진행하며 다양한 질문을 받았는데, 설명을 듣다가 이해되지 않는 부분이 있으면 그냥 넘어가지 않고 충분히 이해할 때까지 질문을 이어가는 모습에서 연구에 대한 학구열을 느낄 수 있었다. 나 역시 익숙하지 않은 연구를 접했을 때 이해가 되지 않는다는 이유로 넘어가기보다, 적극적으로 질문하면서 배워야겠다는 학문적 자극을 받을 수 있었다.


[발표후기]

이번 학회에서는 Improving CLIP’s Zero-Shot Generalization Using LLM Descriptors with Visual Prompt Tuning이라는 주제로 포스터 발표를 진행하였다. 본 연구는 CLIP zero-shot image classification 성능을 향상시키기 위해, LLM이 생성한 text descriptor를 정제하고 이를 Visual Prompt Tuning과 결합하는 방법론을 제안하였다. 구체적으로는 LLM descriptor에 포함될 수 있는 노이즈를 filtering하고, 이미지별로 적합한 descriptor에 더 높은 가중치를 동적으로 부여한 뒤, 이를 바탕으로 생성한 pseudo-label을 활용해 VPT를 학습하는 방식으로 text 정보와 visual 정보를 함께 활용하고자 하였다. 실험 결과, 9개 이미지 분류 벤치마크에서 기존 CLIP zero-shot 및 관련 방법론 대비 평균 성능 향상을 확인할 수 있었다.


[청취후기]

1. Courtroom Analogy: New Perspective on Uncertainty-Aware Classification (KAIST 윤태성 / 김희영)

해당 발표의 주제는 분류 모델의 불확실성을법정에서 여러 변호사가 하나의 사건을 두고 각자의 주장을 펼치는 과정에 빗대어 설명한 Courtroom Analogy였다. 일반적인 분류 모델은 각 클래스에 대한 확률을 출력하지만, 그 예측을 모델이 얼마나 확신하고 있는지까지 신뢰성 있게 표현하는 것이 중요하다. 기존 uncertainty quantification 연구들이 주로 불확실성을 표현하는 분포 자체를 더 복잡하고 유연하게 만드는 데 집중했다면, 이 연구는 그 불확실성이 어떤 과정을 통해 만들어지는지까지 해석할 수 있도록 구조화했다는 점이 인상적이었다.


방법론에서는 하나의 입력을사건’, 각각의 클래스를 지지하는 모델을변호사로 생각한다. 모든 변호사는 동일한 증거를 보지만 각자 다른 해석을 할 수 있고, 각 변호사의 의견과 그 의견이 얼마나 설득력 있는지를 종합해 최종 판결을 내린다. 이를 위해 각 클래스의 의견을 Dirichlet distribution으로 표현하고, 이를 모든 클래스가 공유하는 공통 증거(shared evidence)와 특정 클래스를 추가적으로 지지하는 advocacy strength로 나누어 모델링한다. 마지막에는 각 변호사의 주장이 현재 입력에서 얼마나 타당한지를 나타내는 plausibility weight를 이용해 여러 의견을 종합한다. 특히 모델의 epistemic uncertainty를 각 변호사 자체가 얼마나 확신하지 못하는지(intra-expert uncertainty)와 변호사들끼리 얼마나 의견이 엇갈리는지(inter-expert uncertainty)로 나누어 해석할 수 있다는 점도 흥미로웠다. 단순히 성능을 높이는 새로운 구조를 제안하는 것을 넘어, 모델이 왜 불확실해하는지를 사람이 이해할 수 있는 형태로 설계하는 것 역시 방법론의 중요한 가치가 될 수 있다는 점에서 새로운 관점을 얻을 수 있었던 발표였다.


2.AnoStyler: Text-driven Localized Anomaly Generation via Lightweight Style Transfer (성균관대학교 소유림 / 강석호)

해당 발표는 text-guided style transfer를 활용해 이상 이미지를 생성하는 AnoStyler를 소개하였다. 산업 이상탐지에서는 실제 이상 이미지가 충분하지 않은 경우가 많아 합성 이상 데이터를 생성하는 연구가 활발한데, 기존 방법들은 생성된 이상이 부자연스럽거나 많은 실제 데이터를 필요로 하고, 최근에는 diffusion model과 같이 연산량이 큰 생성 모델에 의존하는 경우가 많다는 한계가 있다. AnoStyler는 이러한 문제를 해결하기 위해 이상 이미지 생성을 이미지를 새롭게 생성하는 문제가 아니라, 정상 이미지의 일부 영역에 원하는 이상 특성을 입히는 style transfer 문제로 바라본다는 점이 흥미로웠다. 실제로 하나의 정상 이미지와 클래스 및 결함 종류에 대한 텍스트 정보만을 이용해 이상 이미지를 생성하도록 설계되었다.


최근 이미지 생성이라고 하면 자연스럽게 diffusion과 같은 대규모 생성 모델부터 떠올리게 되는데, 반드시 복잡하고 큰 모델을 사용해야 좋은 결과를 얻는 것은 아니라는 점이 흥미로웠다. AnoStyler는 비교적 가벼운 U-Net 기반의 stylization network를 사용하면서도 MVTec-AD VisA에서 기존 zero-shot 방법들과 경쟁력 있는 이상 생성 및 탐지 성능을 보였고, diffusion 기반 방법보다 낮은 계산 비용으로 이상 이미지를 생성할 수 있었다. 문제의 특성을 잘 이해하고 그에 맞는 접근을 설계한다면, 반드시 복잡한 모델을 사용하지 않더라도 충분히 효과적인 방법론을 만들 수 있다는 점에서 가장 큰 배움을 얻었고, 개인적으로 이번 학회에서 가장 흥미롭게 들었던 발표 중 하나였다.