[학회 후기]

2026년 8월 24일부터 26일까지 충청남도 예산 스플라스 리솜에서 열린 한국데이터마이닝학회에 참가하였다. 이번 학회의 주제는 “From Data to Action: Agentic AI Meets the Physical World”로, 최근 관심이 높아지고 있는 Agentic AI와 Physical AI를 중심으로 다양한 초청강연과 기업 발표, 논문 발표가 진행되었다. 특히 흥미로웠던 점은 학술적인 연구뿐만 아니라 기업에서 실제로 AI를 적용하고 있는 사례들도 함께 들을 수 있었다는 것이다. 최근 논문이나 세미나를 통해 접했던 Agent와 Physical AI가 단순한 연구 주제에 그치지 않고 실제 산업 현장에서 어떻게 활용되고 있는지를 볼 수 있어 인상적이었다. 또한 여러 우수 논문 발표를 저자의 설명을 통해 직접 들을 수 있다는 점도 좋았다. 논문으로만 접했다면 이해하는 데 많은 시간이 필요했을 내용도 연구 배경과 문제 정의부터 설명을 들으니 핵심 아이디어를 훨씬 쉽게 따라갈 수 있었다. 평소 접하지 않았던 분야의 발표도 함께 들으면서 새로운 방법론과 문제 설정을 접할 수 있었고, 익숙한 기술을 새로운 문제에 적용하는 방식도 살펴볼 수 있었다. 여러 발표를 들으며 단순히 기존 문제에서 성능을 높이는 것 뿐만 아니라, 어떤 문제를 해결해야 하는지 정의하고 이를 적절한 연구 문제로 구체화하는 과정 자체가 중요하다는 점을 다시 생각하게 되었다. 평소에는 현재 진행 중인 연구와 실험에 집중하다 보니 다른 분야의 연구를 접할 기회가 많지 않았는데, 이번 학회를 통해 다양한 연구 주제와 접근 방식을 살펴보며 연구의 시야를 넓힐 수 있었던 의미 있는 시간이었다.



[발표 후기]

이번 학회에서는 MLLM Agent 기반 타이어 프로파일 능동 학습 방법론을 주제로 포스터 발표를 진행하였다. 포스터 발표를 준비하면서 가장 고민했던 부분은 Active Learning 자체를 설명하는 것보다 왜 이 문제에서 Active Learning이 필요한지를 납득시키는 것이었다. 타이어 프로파일 데이터는 전문 장비와 수작업을 통해 측정되기 때문에 많은 데이터를 확보하기 위해서는 시간과 비용이 필요하다. 이에 모든 데이터를 측정하는 대신, 현재 모델의 학습에 도움이 될 것으로 예상되는 샘플을 우선적으로 선택하여 추가 측정하는 Active Learning 방법을 적용하였고, 이때 형상 정보, 데이터 다양성, 예측 불확실성을 종합적으로 고려하는 MLLM Agent 기반 샘플 선택 방법을 활용하였다.이번 발표를 준비하며 새롭게 느낀 점은 Active Learning 연구에서는 최종 모델의 성능만으로 결과를 충분히 설명하기 어렵다는 것이었다. 발표를 준비하면서 각 방법이 학습 과정에서 얼마나 빠르게 오차를 줄이는지, 적은 샘플에서 얼마나 효율적인지를 함께 보여줄 필요가 있었고, 단순히 “어느 방법의 마지막 성능이 좋은가”가 아니라 “어느 방법이 적은 데이터로 더 효율적으로 학습하는가”라는 연구의 목적을 보다 명확하게 설명하기 위해 노력했다.이번 발표를 통해 연구 내용을 정리하는 것과 다른 사람에게 연구의 핵심을 전달하는 것은 별개의 과정이라는 점도 많이 느꼈다. 발표를 반복할수록 세부적인 알고리즘보다 문제 상황과 비교 기준을 먼저 제시하는 것이 중요하다는 것을 알게 되었고, 동시에 현재 실험에서 더 보완해야 할 부분도 자연스럽게 확인할 수 있었다. 이후 연구를 진행할 때에도 결과를 만드는 것 뿐 아니라 그 결과가 어떤 질문에 답하고 있는지를 계속 점검해야겠다는 생각이 들었다.



[청취 후기]

1) Uncovering and Suppressing Hallucination-Associated Components in Large Vision-Language Models (연세대학교 문다은/김지원/윤현수)

VLM의 Hallucination을 단순히 Attention Weight 관점에서 분석하는 데 그치지 않고, Residual Stream에 실제로 어떤 영향을 주는지를 기준으로 원인을 추적한다는 점이 인상적이었다. 연구에서는 Truthful 응답과 Hallucinated 응답에서 각 Head와 MLP Neuron의 기여도 차이를 BC-Score로 정의하고, Hallucination과 밀접하게 연관된 H-Head와 H-Neuron을 찾아냈다. 특히 Hallucination이 Attention Head 하나의 문제라기보다 MHA와 MLP 내부의 여러 구성 요소가 함께 관여하며, 서로 보완적인 경로를 형성할 수 있다는 분석이 흥미로웠다. 이를 바탕으로 Hallucination과 관련성이 높은 Head와 Neuron을 동시에 억제하는 DHCS(Dual H-Component Suppression)를 제안하고, 별도의 재학습 없이 여러 Hallucination benchmark에서 성능을 개선한 점도 인상적이었다. 단순히 Hallucination을 줄이는 방법을 제안하는 것을 넘어, 모델 내부의 어느 구성 요소가 Hallucination 발생에 실제로 기여하는지를 정량적으로 분석하고 이를 직접 제어했다는 점에서 이후 VLM Hallucination의 원인을 분석하거나 내부 표현을 조정하는 연구에도 참고할 만한 접근이라고 느꼈다.


2) Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models (ICML 2026, 연세대학교 홍수정/황성재)

최근 Autoregressive 방식의 대안으로 주목받는 Large Diffusion Vision-Language Model(LDVLM)의 생성 과정에서 발생하는 문제를 분석한 연구였다. LDVLM은 여러 토큰을 병렬적으로 생성할 수 있다는 장점이 있지만, 긴 응답을 생성할수록 같은 표현이 반복되거나 이미지 정보에 대한 grounding이 약해지는 문제가 발생한다. 이 연구에서는 그 원인을 각각 Mask Prior Drift와 Positional Attention Collapse로 정의하였다. 모든 생성 토큰이 동일한 Mask Token에서 시작하면서 hidden representation이 점차 비슷한 방향으로 쏠리고, RoPE의 위치 편향으로 인해 가까운 Mask Token에 Attention이 집중되면서 상대적으로 멀리 있는 Visual Token을 충분히 활용하지 못한다는 분석이 인상적이었다. 이를 해결하기 위해 별도의 추가 학습 없이 inference 단계에서 적용할 수 있는 Mask Prior Suppression과 Monotonic RoPE Scaling을 제안하였다는 점도 흥미로웠다. 특히 단순히 생성 품질이 떨어진다는 현상을 관찰하는 데서 끝나지 않고, Diffusion VLM의 반복 생성과 Visual Grounding 저하를 내부 표현과 Attention 구조의 문제로 나누어 분석한 뒤 각각에 직접 개입했다는 점이 기억에 남았다. 최근 VLM Hallucination이나 Visual Grounding 문제에 관심을 갖고 있는 만큼, 향후 모델 내부에서 시각 정보가 약해지는 원인을 분석하거나 inference 단계에서 이를 보정하는 연구를 진행할 때 참고할 만한 접근이라고 느꼈다.