2026 한국데이터마이닝 하계학술대회 - 송하영
2026년 8월 24일부터 26일까지 충남 예산 스플라스 리솜에서 개최된 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회의 대주제는 “From Data to Action: Agentic AI Meets the Physical World”로, 기존 인공지능 연구가 주로 디지털 환경에서의 인지·추론·생성에 집중해 왔다면, 최근에는 인공지능이 실제 물리적 환경과 상호작용하며 의사결정과 행동까지 수행하는 방향으로 확장되고 있는 연구 흐름을 반영하고 있었다. 이에 따라 학회에서도 Agentic AI, Physical AI를 비롯하여 인공지능이 실제 세계를 인지하고 판단하며 행동하는 방법과 관련된 다양한 강연이 소개되었다.본인은 최근 Flow Matching과 Diffusion Model을 중심으로 연구를 진행하면서, 이러한 생성 모델이 이미지나 데이터 생성뿐만 아니라 VLA(Vision-Language-Action)와 같은 분야에서 action trajectory의 분포를 학습하고 실제 행동을 생성하는 데에도 활용될 수 있다는 점에 관심을 가지고 있었다. 이번 학회에서 여러 연사들의 강연을 들으며 이러한 연구 흐름이 실제 산업 및 물리적 환경의 문제로 빠르게 확장되고 있음을 확인할 수 있었으며, 현재 연구하고 있는 diffusion 및 flow 기반 생성 모델에 대한 지식을 어떻게 실제 세계의 의사결정과 행동 문제에 적용할 수 있을지 고민해 보는 계기가 되었다. 특히 생성 모델을 단순히 이미지나 데이터를 생성하는 모델로 바라보는 것을 넘어, 복잡한 action space에서 가능한 행동들의 분포를 학습하고 그중 적절한 trajectory를 생성하는 모델로 해석할 수 있다는 점을 다시 상기하게 되며 이번 학회 참가를 통해 현재 수행하고 있는 생성모델 연구를 향후 Physical AI와 연결할 수 있지 않을까라는 생각과 함께 장기적으로는 이러한 방향으로도 연구 범위를 확장해 보고 싶다는 생각을 갖게 되었다.이번 학회에서는 다음의 주제로 포스터 발표에 참여하였다.Exploring Flow Posteriors in Noisy Space: Marginal Langevin Dynamics for Inverse Problems본 연구는 flow 기반 생성모델을 활용한 역문제(inverse problem) 해결 방법을 다룬다. 기존 방법들이 clean estimate에 대한 국소적인 likelihood correction 또는 clean-space posterior sampling에 주로 의존하는 것과 달리, 제안 방법은 noisy state에서 posterior Langevin dynamics를 수행하는 방식을 제안한다. 이를 통해 sampling 초기 단계에서는 조건부 해 공간을 보다 폭넓게 탐색하고, flow time이 annealing됨에 따라 관측값과 생성 prior가 동시에 지지하는 해로 점진적으로 수렴하도록 한다. AFHQ-Cat 데이터셋을 활용한 colorization, inpainting, super-resolution, Gaussian deblurring 등 네 가지 선형 역문제에서 기존 flow 기반 방법론 대비 향상된 복원 성능을 확인하였다.포스터 세션을 통해 연구를 소개하면서 생성형 모델과 inverse problem에 관심을 가진 여러 연구자들과 다양한 의견을 나눌 수 있었다. 특히 noisy state에서 posterior Langevin dynamics를 반복적으로 수행할 때 발생하는 계산 비용에 대한 질문이 인상적이었다. 해당 문제는 본인 역시 현재 방법론을 발전시키는 과정에서 중요하게 고민하고 있던 부분이었기 때문에, 연구자들과 직접 의견을 나누며 방법론의 장점뿐만 아니라 실제 적용을 위해 해결해야 할 한계를 다시 생각해 볼 수 있었다. 이를 통해 제안 방법이 실제 상황에서 활용되기 위해서는 복원 성능뿐만 아니라 NFE, forward-model evaluation, sampling cost 등 계산 효율성 측면에서도 충분한 경쟁력을 확보해야 한다는 점을 다시 한번 인식할 수 있었다. 연구를 발표하는 것에 그치지 않고 현재 연구의 한계와 향후 개선 방향에 대해 다른 연구자들과 논의할 수 있었다는 점에서 의미 있는 시간이었다.아래는 우수학회 논문 발표 중 가장 인상 깊었던 두 연구에 대해, 발표를 들으며 느낀 점과 저자들과 직접 의견을 나누며 얻은 인사이트를 정리한 내용이다.1. Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models (연세대학교 홍수정·황성재)본 연구는 Large Diffusion Vision-Language Model(LDVLM)의 long-form generation 과정에서 발생하는 반복 생성과 visual grounding 저하 문제를 분석한 연구이다. 저자는 모든 생성 토큰이 동일한 mask token에서 시작한다는 diffusion language model의 특성으로 인해 hidden representation이 공통된 prior 방향으로 수렴하는 Mask Prior Drift 현상이 발생하며, 이것이 반복 생성의 주요 원인이 될 수 있음을 보였다. 이를 해결하기 위해 mask prior와 정렬된 저차원 hidden-state 성분만을 선택적으로 억제하는 Mask Prior Suppression(MPS) 방법을 제안하였다. 발표를 들으며 개인적으로는 MPS의 설계에 대해 한 가지 의문이 들었다. Diffusion Language Model에서는 mask token이 주변 문맥을 참조하면서 각 token에 대한 logit을 형성하고, 점진적으로 적절한 word로 변환되면서 text generation이 이루어진다고 이해하고 있었기 때문이다. 이러한 관점에서 mask prior 자체를 억제할 경우 오히려 모델이 기존에 학습한 생성 능력이나 문맥 정보를 활용하는 능력이 저하될 가능성이 있지 않을까 하는 질문을 저자에게 드렸다.이에 대해 저자는 문제의 핵심이 mask prior 자체의 존재가 아니라, mask representation이 이미 특정 word 방향으로 충분히 수렴한 이후에도 해당 prior의 영향이 지속되면서 동일하거나 유사한 token의 반복 생성을 유발하는 데 있다고 설명하였다. 따라서 MPS는 mask prior를 완전히 제거하는 것이 아니라, 과도하게 특정 prior 방향으로 수렴하는 hidden-state 성분만을 선택적으로 억제하여 반복 생성을 완화하는 방식이라는 취지의 답변을 주었다. 이러한 토론을 통해 단순히 성능 향상 결과를 확인하는 것을 넘어, 왜 MPS라는 모듈이 필요한지, 그리고 diffusion language model에서 mask token의 representation bias가 실제 generation dynamics에 어떠한 영향을 줄 수 있는지에 대한 인사이트를 얻을 수 있었다. 특히 diffusion 기반 생성모델을 연구하는 입장에서 sampling dynamics 자체뿐만 아니라, intermediate representation에 내재된 prior와 bias가 최종 생성 결과에 어떠한 영향을 미치는지 분석하는 것 역시 중요하다는 점에서 깊은 인상을 받은 토론이었다.2. AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs (서울대학교 김재희·강필성)본 연구는 LLM API를 사용하는 과정에서 민감하거나 중요한 정보가 평문 형태로 외부 API 제공자에게 그대로 전달될 수 있다는 문제를 해결하기 위해, 토큰 단위의 일대일 치환 규칙을 활용하여 입력과 출력을 난독화하는 방법을 제안한 연구이다. 사용자는 원본 텍스트를 별도의 Alien Language로 변환한 후 API에 전달하고, 반환된 결과 역시 사용자 측에서 다시 원래 텍스트로 복원함으로써 API 제공자에게 원본 데이터가 직접적으로 노출되는 것을 줄이고자 하였다. 또한 Alien Adaptation Training을 통해 LLM이 이러한 변환된 언어를 직접 처리할 수 있도록 학습하여, 난독화 이후에도 기존 모델의 성능을 상당 부분 유지하도록 하였다. 발표를 들으며 이러한 치환 방식을 활용한 난독화가 기존 LLM API 환경을 크게 변경하지 않고 비교적 간단하게 적용할 수 있다는 점에서 흥미로운 접근이라고 생각하였다. 다만 저자 역시 논문에서 명시하고 있듯이, 해당 방법은 완전한 암호학적 보안성을 보장하는 방식은 아니기 때문에 충분한 양의 정보가 노출되거나 공격자가 치환 규칙의 일부를 추론할 수 있는 상황에서는 보안 측면의 한계가 존재할 수 있다고 판단하였다. 그럼에도 불구하고 완전동형암호(Fully Homomorphic Encryption)와 같은 암호학적 기법과 비교하면 보안성은 상대적으로 낮을 수 있지만, 별도의 복잡한 암호 연산이나 서버 구조의 변경 없이 기존 black-box LLM API 환경에 적용할 수 있다는 점에서 높은 실용성을 갖는 방법이라고 생각하였다. 이를 통해 실제 서비스 환경에서는 단순히 가장 강력한 보안성을 확보하는 것뿐만 아니라, 보안성과 모델 성능, 계산 비용, 시스템 적용 가능성 사이의 trade-off를 어떻게 설계할 것인지 역시 중요한 연구 문제라는 점을 생각해 볼 수 있었다.
Reviewed by
송하영
2026.08.28