Conference

Conference

Number of entries: 768 (필터 적용됨)
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 손병우

[학회후기]2026년 8월 24일부터 26일까지 충남 예산 스플라스 리솜에서 개최된 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회는 “From Data to Action: Agentic AI Meets the Physical World”를 주제로 진행되었으며, 구두 발표와 포스터 세션을 통해 Agentic AI와 Physical AI를 중심으로 한 다양한 연구 및 산업 적용 사례를 접할 수 있었다. 이번 학회를 통해 Agentic AI와 Physical AI가 현재 인공지능 연구의 중요한 흐름이라는 점을 다시 한번 확인할 수 있었다. 특히 구두 발표 세션에서는 관련 기술이 실제 산업에서 어떻게 활용되고 있는지뿐만 아니라, 산업계가 현재 어떤 문제와 한계에 주목하고 있는지도 살펴볼 수 있었다.Physical AI 분야에서는 실제 물리 환경의 데이터를 충분히 확보하기 어렵다는 점과 시뮬레이션에서 학습한 모델을 현실 환경에 적용하는 Sim-to-Real 과정에서의 차이가 주요한 문제로 다루어졌다. 이를 해결하기 위한 방향으로 물리 법칙을 학습 과정에 반영하는 Physics-Informed 접근법과 Mesh 및 3D Reconstruction 기술을 활용한 물리 환경 데이터 구축 방법이 소개된 점이 인상적이었다.Agentic AI 분야에서는 범용 모델의 성능뿐만 아니라 실제 산업 현장에서 활용하기 위한 도메인 특화 지식의 확보가 중요하게 다루어졌다. 특히 문서와 이미지 등 다양한 비정형 데이터로부터 필요한 정보를 추출하고, 이를 구조화하여 온톨로지와 지식 체계를 구축하는 과정이 에이전트의 추론과 의사결정에 중요한 기반이 된다는 점을 알 수 있었다. 이번 학회를 통해 최신 기술의 발전 방향뿐만 아니라, 이러한 기술을 실제 환경에 적용하기 위해 해결해야 할 데이터와 도메인 지식의 문제도 함께 생각해 볼 수 있었다.[발표후기]이번 학회에서는 TV 제품의 구동 조건과 IR 열화상 이미지를 활용하여 보드 내 소자의 실제 타점 온도를 예측하는 멀티모달 딥러닝 방법론을 포스터로 발표하였다. TV 제품의 열 신뢰성 평가에는 소자별 타점 온도가 필요하지만, 실제 소자에 직접 접촉하여 측정해야 하므로 데이터를 수집하는 데 많은 시간과 비용이 소요된다. 이에 상대적으로 수집이 용이한 IR 온도와 전압, 보드, 구동 패턴 등의 조건 및 열화상 이미지를 활용하여 실제 타점 온도를 예측하는 연구를 진행하였고, 이를 주제로 포스터  발표를 진행하였다.발표 과정에서 가장 크게 느꼈던 점 중 하나는, 연구자가 설명하고 싶은 내용과 청중이 궁금해하는 내용이 다를 수 있다는 점이었다. 특히 산업적인 관점에서는 모델의 세부 구조뿐만 아니라, 실제 현장에서 무엇이 문제였는지, 기존 방식에는 어떠한 한계가 있었으며 제안한 방법이 이를 어떻게 해결했는지를 궁금해하는 경우가 많았다. 따라서 연구 방법론을 곧바로 설명하기보다 먼저 산업 현장의 문제와 연구의 필요성을 충분히 전달한 뒤, 해결 방법과 결과를 연결하여 설명하는 것이 연구를 이해시키는 데 효과적이라는 점을 배울 수 있었다.또한 질문의 표면적인 내용에만 답하기보다, 질문자가 어떤 부분을 확인하고자 하는지를 파악하여 답변하는 것이 중요하다는 점도 느꼈다. 이번 발표 경험을 바탕으로 앞으로는 연구의 기술적인 내용뿐만 아니라 문제의 배경과 실제 활용 가능성까지 청중의 관점에서 설명할 수 있도록 발표를 구성해야겠다고 생각하였다.[청취후기]1. A Global-Local Frequency-Based Composite Loss Function for Enhancing Spatial Sharpness in Precipitation Prediction - (Poster, 안수빈 / 서울대학교)해당 연구는 딥러닝 기반 강수 예측에서 MSE와 같은 픽셀 기반 손실함수를 사용할 경우 예측 결과가 과도하게 평활화되어 국지적인 강수 패턴이 흐려지는 문제를 다루었으며, 이를 해결하기 위해 Fourier Transform 기반의 전역 주파수 일관성과 Dual-Tree Complex Wavelet Transform 기반의 지역 구조 보존을 함께 고려하는 WFCL을 제안하였다.Fourier Transform을 통해 전체 강수 분포의 저주파 및 전역적 특성을 반영하고, Wavelet Transform을 통해 위치와 방향에 따른 지역적 고주파 구조를 보존한다는 점이 흥미로웠다. 특히 일반적으로 두 변환 중 하나만 활용하는 것과 달리, 각각의 장점을 하나의 손실함수에 결합하여 강수 패턴의 전체적인 분포와 국지적인 선명도를 동시에 개선하고자 한 접근이 인상적이었다. 실험에서도 제안 방법이 기존 손실함수보다 구조적 일관성, 극한 강수 표현 및 공간적 위치 정확도에서 우수한 결과를 보인다는 점을 확인할 수 있었다.2. AnoStyler: Text-Driven Localized Anomaly Generation via Lightweight Style Transfer - (Presentation, 소유림 / 성균관대학교)해당 연구는 산업용 비주얼 이상 탐지를 위한 학습 데이터를 확보하기 어렵다는 문제를 해결하기 위해, 단 한 장의 정상 이미지와 텍스트 프롬프트만으로 사실적인 국소 이상 이미지를 생성하는 제로샷 이상 생성 방법을 제안하였다. 기존의 이상 생성 방법은 생성된 이상이 실제와 다르거나, Diffusion 모델과 같은 대규모 모델을 사용하여 많은 연산 비용이 필요하다는 한계가 있다. AnoStyler는 경량 U-Net 기반의 스타일 변환 네트워크를 활용하여 이러한 문제를 해결하고자 하였다.먼저 Line, Dot, Freeform 형태의 Meta-Shape Prior를 조합하여 이상 영역의 마스크를 생성하고, SAM을 통해 추출한 객체 영역과 결합함으로써 이상이 배경이 아닌 객체 내부에 생성되도록 하였다. 또한 정상과 이상 상태를 표현하는 여러 텍스트 프롬프트의 CLIP 임베딩을 평균하여 텍스트 조건을 안정적으로 구성하였다. 이후 정상 이미지에서 이상 이미지로 변화하는 방향이 텍스트 임베딩 공간에서 정상에서 이상으로 변화하는 방향과 일치하도록 네트워크를 학습하였는데, 이 부분이 특히 흥미로웠다. 무거운 Diffusion 모델 대신 경량 네트워크를 활용하면서도 높은 생성 품질과 이상 탐지 성능을 달성했다는 점에서, 실제 산업 현장에서의 활용 가능성과 연구적 의의를 모두 갖춘 논문이라고 생각할 수 있었다.
Reviewed by 손병우 손병우
2026.08.28
Read More
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 송하영

2026년 8월 24일부터 26일까지 충남 예산 스플라스 리솜에서 개최된 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회의 대주제는 “From Data to Action: Agentic AI Meets the Physical World”로, 기존 인공지능 연구가 주로 디지털 환경에서의 인지·추론·생성에 집중해 왔다면, 최근에는 인공지능이 실제 물리적 환경과 상호작용하며 의사결정과 행동까지 수행하는 방향으로 확장되고 있는 연구 흐름을 반영하고 있었다. 이에 따라 학회에서도 Agentic AI, Physical AI를 비롯하여 인공지능이 실제 세계를 인지하고 판단하며 행동하는 방법과 관련된 다양한 강연이 소개되었다.본인은 최근 Flow Matching과 Diffusion Model을 중심으로 연구를 진행하면서, 이러한 생성 모델이 이미지나 데이터 생성뿐만 아니라 VLA(Vision-Language-Action)와 같은 분야에서 action trajectory의 분포를 학습하고 실제 행동을 생성하는 데에도 활용될 수 있다는 점에 관심을 가지고 있었다. 이번 학회에서 여러 연사들의 강연을 들으며 이러한 연구 흐름이 실제 산업 및 물리적 환경의 문제로 빠르게 확장되고 있음을 확인할 수 있었으며, 현재 연구하고 있는 diffusion 및 flow 기반 생성 모델에 대한 지식을 어떻게 실제 세계의 의사결정과 행동 문제에 적용할 수 있을지 고민해 보는 계기가 되었다. 특히 생성 모델을 단순히 이미지나 데이터를 생성하는 모델로 바라보는 것을 넘어, 복잡한 action space에서 가능한 행동들의 분포를 학습하고 그중 적절한 trajectory를 생성하는 모델로 해석할 수 있다는 점을 다시 상기하게 되며 이번 학회 참가를 통해 현재 수행하고 있는 생성모델 연구를 향후 Physical AI와 연결할 수 있지 않을까라는 생각과 함께 장기적으로는 이러한 방향으로도 연구 범위를 확장해 보고 싶다는 생각을 갖게 되었다.이번 학회에서는 다음의 주제로 포스터 발표에 참여하였다.Exploring Flow Posteriors in Noisy Space: Marginal Langevin Dynamics for Inverse Problems본 연구는 flow 기반 생성모델을 활용한 역문제(inverse problem) 해결 방법을 다룬다. 기존 방법들이 clean estimate에 대한 국소적인 likelihood correction 또는 clean-space posterior sampling에 주로 의존하는 것과 달리, 제안 방법은 noisy state에서 posterior Langevin dynamics를 수행하는 방식을 제안한다. 이를 통해 sampling 초기 단계에서는 조건부 해 공간을 보다 폭넓게 탐색하고, flow time이 annealing됨에 따라 관측값과 생성 prior가 동시에 지지하는 해로 점진적으로 수렴하도록 한다. AFHQ-Cat 데이터셋을 활용한 colorization, inpainting, super-resolution, Gaussian deblurring 등 네 가지 선형 역문제에서 기존 flow 기반 방법론 대비 향상된 복원 성능을 확인하였다.포스터 세션을 통해 연구를 소개하면서 생성형 모델과 inverse problem에 관심을 가진 여러 연구자들과 다양한 의견을 나눌 수 있었다. 특히 noisy state에서 posterior Langevin dynamics를 반복적으로 수행할 때 발생하는 계산 비용에 대한 질문이 인상적이었다. 해당 문제는 본인 역시 현재 방법론을 발전시키는 과정에서 중요하게 고민하고 있던 부분이었기 때문에, 연구자들과 직접 의견을 나누며 방법론의 장점뿐만 아니라 실제 적용을 위해 해결해야 할 한계를 다시 생각해 볼 수 있었다. 이를 통해 제안 방법이 실제 상황에서 활용되기 위해서는 복원 성능뿐만 아니라 NFE, forward-model evaluation, sampling cost 등 계산 효율성 측면에서도 충분한 경쟁력을 확보해야 한다는 점을 다시 한번 인식할 수 있었다. 연구를 발표하는 것에 그치지 않고 현재 연구의 한계와 향후 개선 방향에 대해 다른 연구자들과 논의할 수 있었다는 점에서 의미 있는 시간이었다.아래는 우수학회 논문 발표 중 가장 인상 깊었던 두 연구에 대해, 발표를 들으며 느낀 점과 저자들과 직접 의견을 나누며 얻은 인사이트를 정리한 내용이다.1. Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models (연세대학교 홍수정·황성재)본 연구는 Large Diffusion Vision-Language Model(LDVLM)의 long-form generation 과정에서 발생하는 반복 생성과 visual grounding 저하 문제를 분석한 연구이다. 저자는 모든 생성 토큰이 동일한 mask token에서 시작한다는 diffusion language model의 특성으로 인해 hidden representation이 공통된 prior 방향으로 수렴하는 Mask Prior Drift 현상이 발생하며, 이것이 반복 생성의 주요 원인이 될 수 있음을 보였다. 이를 해결하기 위해 mask prior와 정렬된 저차원 hidden-state 성분만을 선택적으로 억제하는 Mask Prior Suppression(MPS) 방법을 제안하였다. 발표를 들으며 개인적으로는 MPS의 설계에 대해 한 가지 의문이 들었다. Diffusion Language Model에서는 mask token이 주변 문맥을 참조하면서 각 token에 대한 logit을 형성하고, 점진적으로 적절한 word로 변환되면서 text generation이 이루어진다고 이해하고 있었기 때문이다. 이러한 관점에서 mask prior 자체를 억제할 경우 오히려 모델이 기존에 학습한 생성 능력이나 문맥 정보를 활용하는 능력이 저하될 가능성이 있지 않을까 하는 질문을 저자에게 드렸다.이에 대해 저자는 문제의 핵심이 mask prior 자체의 존재가 아니라, mask representation이 이미 특정 word 방향으로 충분히 수렴한 이후에도 해당 prior의 영향이 지속되면서 동일하거나 유사한 token의 반복 생성을 유발하는 데 있다고 설명하였다. 따라서 MPS는 mask prior를 완전히 제거하는 것이 아니라, 과도하게 특정 prior 방향으로 수렴하는 hidden-state 성분만을 선택적으로 억제하여 반복 생성을 완화하는 방식이라는 취지의 답변을 주었다. 이러한 토론을 통해 단순히 성능 향상 결과를 확인하는 것을 넘어, 왜 MPS라는 모듈이 필요한지, 그리고 diffusion language model에서 mask token의 representation bias가 실제 generation dynamics에 어떠한 영향을 줄 수 있는지에 대한 인사이트를 얻을 수 있었다. 특히 diffusion 기반 생성모델을 연구하는 입장에서 sampling dynamics 자체뿐만 아니라, intermediate representation에 내재된 prior와 bias가 최종 생성 결과에 어떠한 영향을 미치는지 분석하는 것 역시 중요하다는 점에서 깊은 인상을 받은 토론이었다.2. AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs (서울대학교 김재희·강필성)본 연구는 LLM API를 사용하는 과정에서 민감하거나 중요한 정보가 평문 형태로 외부 API 제공자에게 그대로 전달될 수 있다는 문제를 해결하기 위해, 토큰 단위의 일대일 치환 규칙을 활용하여 입력과 출력을 난독화하는 방법을 제안한 연구이다. 사용자는 원본 텍스트를 별도의 Alien Language로 변환한 후 API에 전달하고, 반환된 결과 역시 사용자 측에서 다시 원래 텍스트로 복원함으로써 API 제공자에게 원본 데이터가 직접적으로 노출되는 것을 줄이고자 하였다. 또한 Alien Adaptation Training을 통해 LLM이 이러한 변환된 언어를 직접 처리할 수 있도록 학습하여, 난독화 이후에도 기존 모델의 성능을 상당 부분 유지하도록 하였다. 발표를 들으며 이러한 치환 방식을 활용한 난독화가 기존 LLM API 환경을 크게 변경하지 않고 비교적 간단하게 적용할 수 있다는 점에서 흥미로운 접근이라고 생각하였다. 다만 저자 역시 논문에서 명시하고 있듯이, 해당 방법은 완전한 암호학적 보안성을 보장하는 방식은 아니기 때문에 충분한 양의 정보가 노출되거나 공격자가 치환 규칙의 일부를 추론할 수 있는 상황에서는 보안 측면의 한계가 존재할 수 있다고 판단하였다. 그럼에도 불구하고 완전동형암호(Fully Homomorphic Encryption)와 같은 암호학적 기법과 비교하면 보안성은 상대적으로 낮을 수 있지만, 별도의 복잡한 암호 연산이나 서버 구조의 변경 없이 기존 black-box LLM API 환경에 적용할 수 있다는 점에서 높은 실용성을 갖는 방법이라고 생각하였다. 이를 통해 실제 서비스 환경에서는 단순히 가장 강력한 보안성을 확보하는 것뿐만 아니라, 보안성과 모델 성능, 계산 비용, 시스템 적용 가능성 사이의 trade-off를 어떻게 설계할 것인지 역시 중요한 연구 문제라는 점을 생각해 볼 수 있었다.
Reviewed by 송하영 송하영
2026.08.28
Read More
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 김윤아

[학회후기] 2026년 8월 24일부터 26일까지 충남 예산 스플라스 리솜에서 열린 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회의 주제는 “From Data to Action: Agentic AI Meets the Physical World”로, Physical AI와 Agentic AI를 중심으로 로봇, 제조 현장, World Model 등 다양한 연구와 산업 적용 사례를 접할 수 있었다. 내가 진행하고 있는 연구와 직접적으로 맞닿아 있는 분야는 아니지만, 산업 이상탐지가 단순히 이미지에서 정상과 이상을 판별하는 단계에 머무르지 않고, 이상을 발견한 뒤 원인을 추론하고 필요한 정보를 추가로 탐색해 적절한 후속 조치까지 제안하거나 수행하는 에이전트 기반 이상 대응 시스템으로 확장될 수 있겠다는 생각이 들어 관심이 생겼다. 특히 언어적 지시를 로봇의 실제 행동으로 연결하는 연구부터 제조 현장의 Physical AI, Sim-to-Real 기반 Robot Intelligence, 산업 현장에서 활용되는 Agentic AI까지 다양한 강연을 접하면서 이러한 가능성을 조금 더 구체적으로 생각해볼 수 있었다. 이번 학회에서 특히 인상적이었던 것은 다른 연구자들의 질문하는 태도였던 것 같다. 포스터 발표를 진행하며 다양한 질문을 받았는데, 설명을 듣다가 이해되지 않는 부분이 있으면 그냥 넘어가지 않고 충분히 이해할 때까지 질문을 이어가는 모습에서 연구에 대한 학구열을 느낄 수 있었다. 나 역시 익숙하지 않은 연구를 접했을 때 이해가 되지 않는다는 이유로 넘어가기보다, 적극적으로 질문하면서 배워야겠다는 학문적 자극을 받을 수 있었다.[발표후기] 이번 학회에서는 Improving CLIP’s Zero-Shot Generalization Using LLM Descriptors with Visual Prompt Tuning이라는 주제로 포스터 발표를 진행하였다. 본 연구는 CLIP의 zero-shot image classification 성능을 향상시키기 위해, LLM이 생성한 text descriptor를 정제하고 이를 Visual Prompt Tuning과 결합하는 방법론을 제안하였다. 구체적으로는 LLM descriptor에 포함될 수 있는 노이즈를 filtering하고, 이미지별로 적합한 descriptor에 더 높은 가중치를 동적으로 부여한 뒤, 이를 바탕으로 생성한 pseudo-label을 활용해 VPT를 학습하는 방식으로 text 정보와 visual 정보를 함께 활용하고자 하였다. 실험 결과, 9개 이미지 분류 벤치마크에서 기존 CLIP zero-shot 및 관련 방법론 대비 평균 성능 향상을 확인할 수 있었다.[청취후기]1. Courtroom Analogy: New Perspective on Uncertainty-Aware Classification (KAIST 윤태성 / 김희영)해당 발표의 주제는 분류 모델의 불확실성을 ‘법정에서 여러 변호사가 하나의 사건을 두고 각자의 주장을 펼치는 과정’에 빗대어 설명한 Courtroom Analogy였다. 일반적인 분류 모델은 각 클래스에 대한 확률을 출력하지만, 그 예측을 모델이 얼마나 확신하고 있는지까지 신뢰성 있게 표현하는 것이 중요하다. 기존 uncertainty quantification 연구들이 주로 불확실성을 표현하는 분포 자체를 더 복잡하고 유연하게 만드는 데 집중했다면, 이 연구는 그 불확실성이 어떤 과정을 통해 만들어지는지까지 해석할 수 있도록 구조화했다는 점이 인상적이었다.방법론에서는 하나의 입력을 ‘사건’, 각각의 클래스를 지지하는 모델을 ‘변호사’로 생각한다. 모든 변호사는 동일한 증거를 보지만 각자 다른 해석을 할 수 있고, 각 변호사의 의견과 그 의견이 얼마나 설득력 있는지를 종합해 최종 판결을 내린다. 이를 위해 각 클래스의 의견을 Dirichlet distribution으로 표현하고, 이를 모든 클래스가 공유하는 공통 증거(shared evidence)와 특정 클래스를 추가적으로 지지하는 advocacy strength로 나누어 모델링한다. 마지막에는 각 변호사의 주장이 현재 입력에서 얼마나 타당한지를 나타내는 plausibility weight를 이용해 여러 의견을 종합한다. 특히 모델의 epistemic uncertainty를 각 변호사 자체가 얼마나 확신하지 못하는지(intra-expert uncertainty)와 변호사들끼리 얼마나 의견이 엇갈리는지(inter-expert uncertainty)로 나누어 해석할 수 있다는 점도 흥미로웠다. 단순히 성능을 높이는 새로운 구조를 제안하는 것을 넘어, 모델이 왜 불확실해하는지를 사람이 이해할 수 있는 형태로 설계하는 것 역시 방법론의 중요한 가치가 될 수 있다는 점에서 새로운 관점을 얻을 수 있었던 발표였다.2.AnoStyler: Text-driven Localized Anomaly Generation via Lightweight Style Transfer (성균관대학교 소유림 / 강석호)해당 발표는 text-guided style transfer를 활용해 이상 이미지를 생성하는 AnoStyler를 소개하였다. 산업 이상탐지에서는 실제 이상 이미지가 충분하지 않은 경우가 많아 합성 이상 데이터를 생성하는 연구가 활발한데, 기존 방법들은 생성된 이상이 부자연스럽거나 많은 실제 데이터를 필요로 하고, 최근에는 diffusion model과 같이 연산량이 큰 생성 모델에 의존하는 경우가 많다는 한계가 있다. AnoStyler는 이러한 문제를 해결하기 위해 이상 이미지 생성을 이미지를 새롭게 생성하는 문제가 아니라, 정상 이미지의 일부 영역에 원하는 이상 특성을 입히는 style transfer 문제로 바라본다는 점이 흥미로웠다. 실제로 하나의 정상 이미지와 클래스 및 결함 종류에 대한 텍스트 정보만을 이용해 이상 이미지를 생성하도록 설계되었다.최근 이미지 생성이라고 하면 자연스럽게 diffusion과 같은 대규모 생성 모델부터 떠올리게 되는데, 반드시 복잡하고 큰 모델을 사용해야 좋은 결과를 얻는 것은 아니라는 점이 흥미로웠다. AnoStyler는 비교적 가벼운 U-Net 기반의 stylization network를 사용하면서도 MVTec-AD와 VisA에서 기존 zero-shot 방법들과 경쟁력 있는 이상 생성 및 탐지 성능을 보였고, diffusion 기반 방법보다 낮은 계산 비용으로 이상 이미지를 생성할 수 있었다. 문제의 특성을 잘 이해하고 그에 맞는 접근을 설계한다면, 반드시 복잡한 모델을 사용하지 않더라도 충분히 효과적인 방법론을 만들 수 있다는 점에서 가장 큰 배움을 얻었고, 개인적으로 이번 학회에서 가장 흥미롭게 들었던 발표 중 하나였다.
Reviewed by 김윤아 김윤아
2026.08.28
Read More
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 김혜준

[학회 후기]2026년 8월 24일부터 26일까지 충청남도 예산 스플라스 리솜에서 열린 한국데이터마이닝학회에 참가하였다. 이번 학회의 주제는 “From Data to Action: Agentic AI Meets the Physical World”로, 최근 관심이 높아지고 있는 Agentic AI와 Physical AI를 중심으로 다양한 초청강연과 기업 발표, 논문 발표가 진행되었다. 특히 흥미로웠던 점은 학술적인 연구뿐만 아니라 기업에서 실제로 AI를 적용하고 있는 사례들도 함께 들을 수 있었다는 것이다. 최근 논문이나 세미나를 통해 접했던 Agent와 Physical AI가 단순한 연구 주제에 그치지 않고 실제 산업 현장에서 어떻게 활용되고 있는지를 볼 수 있어 인상적이었다. 또한 여러 우수 논문 발표를 저자의 설명을 통해 직접 들을 수 있다는 점도 좋았다. 논문으로만 접했다면 이해하는 데 많은 시간이 필요했을 내용도 연구 배경과 문제 정의부터 설명을 들으니 핵심 아이디어를 훨씬 쉽게 따라갈 수 있었다. 평소 접하지 않았던 분야의 발표도 함께 들으면서 새로운 방법론과 문제 설정을 접할 수 있었고, 익숙한 기술을 새로운 문제에 적용하는 방식도 살펴볼 수 있었다. 여러 발표를 들으며 단순히 기존 문제에서 성능을 높이는 것 뿐만 아니라, 어떤 문제를 해결해야 하는지 정의하고 이를 적절한 연구 문제로 구체화하는 과정 자체가 중요하다는 점을 다시 생각하게 되었다. 평소에는 현재 진행 중인 연구와 실험에 집중하다 보니 다른 분야의 연구를 접할 기회가 많지 않았는데, 이번 학회를 통해 다양한 연구 주제와 접근 방식을 살펴보며 연구의 시야를 넓힐 수 있었던 의미 있는 시간이었다.[발표 후기]이번 학회에서는 MLLM Agent 기반 타이어 프로파일 능동 학습 방법론을 주제로 포스터 발표를 진행하였다. 포스터 발표를 준비하면서 가장 고민했던 부분은 Active Learning 자체를 설명하는 것보다 왜 이 문제에서 Active Learning이 필요한지를 납득시키는 것이었다. 타이어 프로파일 데이터는 전문 장비와 수작업을 통해 측정되기 때문에 많은 데이터를 확보하기 위해서는 시간과 비용이 필요하다. 이에 모든 데이터를 측정하는 대신, 현재 모델의 학습에 도움이 될 것으로 예상되는 샘플을 우선적으로 선택하여 추가 측정하는 Active Learning 방법을 적용하였고, 이때 형상 정보, 데이터 다양성, 예측 불확실성을 종합적으로 고려하는 MLLM Agent 기반 샘플 선택 방법을 활용하였다.이번 발표를 준비하며 새롭게 느낀 점은 Active Learning 연구에서는 최종 모델의 성능만으로 결과를 충분히 설명하기 어렵다는 것이었다. 발표를 준비하면서 각 방법이 학습 과정에서 얼마나 빠르게 오차를 줄이는지, 적은 샘플에서 얼마나 효율적인지를 함께 보여줄 필요가 있었고, 단순히 “어느 방법의 마지막 성능이 좋은가”가 아니라 “어느 방법이 적은 데이터로 더 효율적으로 학습하는가”라는 연구의 목적을 보다 명확하게 설명하기 위해 노력했다.이번 발표를 통해 연구 내용을 정리하는 것과 다른 사람에게 연구의 핵심을 전달하는 것은 별개의 과정이라는 점도 많이 느꼈다. 발표를 반복할수록 세부적인 알고리즘보다 문제 상황과 비교 기준을 먼저 제시하는 것이 중요하다는 것을 알게 되었고, 동시에 현재 실험에서 더 보완해야 할 부분도 자연스럽게 확인할 수 있었다. 이후 연구를 진행할 때에도 결과를 만드는 것 뿐 아니라 그 결과가 어떤 질문에 답하고 있는지를 계속 점검해야겠다는 생각이 들었다.[청취 후기]1) Uncovering and Suppressing Hallucination-Associated Components in Large Vision-Language Models (연세대학교 문다은/김지원/윤현수)VLM의 Hallucination을 단순히 Attention Weight 관점에서 분석하는 데 그치지 않고, Residual Stream에 실제로 어떤 영향을 주는지를 기준으로 원인을 추적한다는 점이 인상적이었다. 연구에서는 Truthful 응답과 Hallucinated 응답에서 각 Head와 MLP Neuron의 기여도 차이를 BC-Score로 정의하고, Hallucination과 밀접하게 연관된 H-Head와 H-Neuron을 찾아냈다. 특히 Hallucination이 Attention Head 하나의 문제라기보다 MHA와 MLP 내부의 여러 구성 요소가 함께 관여하며, 서로 보완적인 경로를 형성할 수 있다는 분석이 흥미로웠다. 이를 바탕으로 Hallucination과 관련성이 높은 Head와 Neuron을 동시에 억제하는 DHCS(Dual H-Component Suppression)를 제안하고, 별도의 재학습 없이 여러 Hallucination benchmark에서 성능을 개선한 점도 인상적이었다. 단순히 Hallucination을 줄이는 방법을 제안하는 것을 넘어, 모델 내부의 어느 구성 요소가 Hallucination 발생에 실제로 기여하는지를 정량적으로 분석하고 이를 직접 제어했다는 점에서 이후 VLM Hallucination의 원인을 분석하거나 내부 표현을 조정하는 연구에도 참고할 만한 접근이라고 느꼈다.2) Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models (ICML 2026, 연세대학교 홍수정/황성재)최근 Autoregressive 방식의 대안으로 주목받는 Large Diffusion Vision-Language Model(LDVLM)의 생성 과정에서 발생하는 문제를 분석한 연구였다. LDVLM은 여러 토큰을 병렬적으로 생성할 수 있다는 장점이 있지만, 긴 응답을 생성할수록 같은 표현이 반복되거나 이미지 정보에 대한 grounding이 약해지는 문제가 발생한다. 이 연구에서는 그 원인을 각각 Mask Prior Drift와 Positional Attention Collapse로 정의하였다. 모든 생성 토큰이 동일한 Mask Token에서 시작하면서 hidden representation이 점차 비슷한 방향으로 쏠리고, RoPE의 위치 편향으로 인해 가까운 Mask Token에 Attention이 집중되면서 상대적으로 멀리 있는 Visual Token을 충분히 활용하지 못한다는 분석이 인상적이었다. 이를 해결하기 위해 별도의 추가 학습 없이 inference 단계에서 적용할 수 있는 Mask Prior Suppression과 Monotonic RoPE Scaling을 제안하였다는 점도 흥미로웠다. 특히 단순히 생성 품질이 떨어진다는 현상을 관찰하는 데서 끝나지 않고, Diffusion VLM의 반복 생성과 Visual Grounding 저하를 내부 표현과 Attention 구조의 문제로 나누어 분석한 뒤 각각에 직접 개입했다는 점이 기억에 남았다. 최근 VLM Hallucination이나 Visual Grounding 문제에 관심을 갖고 있는 만큼, 향후 모델 내부에서 시각 정보가 약해지는 원인을 분석하거나 inference 단계에서 이를 보정하는 연구를 진행할 때 참고할 만한 접근이라고 느꼈다. 
Reviewed by 김혜준 김혜준
2026.08.28
Read More
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 강동훈

[학회 후기]2026년 8월 24일부터 26일까지 예산 스플라스 리솜에서 열린 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회에서는 최근 많은 관심을 받고 있는 Agentic AI와 Physical AI를 중심으로 초청강연과 다양한 연구 발표가 진행되었다. 평소 내가 연구하고 있는 분야뿐만 아니라 제목을 보고 흥미가 생긴 여러 발표도 함께 들으며 다양한 주제의 연구를 접할 수 있었다.특히 인상 깊었던 점은 최근 발표된 연구들을 논문의 저자가 직접 설명하는 세션이 마련되어 있었다는 것이다. 논문으로만 접했을 때는 이해하기 어려웠던 연구도 연구자가 직접 문제의 배경과 핵심 아이디어를 설명하는 과정을 들으니 훨씬 쉽게 이해할 수 있었다. 또한 같은 문제를 해결하더라도 연구마다 문제를 바라보는 관점과 접근 방식이 다르다는 점도 흥미로웠다.여러 발표를 들으며 단순히 기존 모델의 성능을 높이는 것뿐만 아니라, 어떤 문제를 정의하고 기존 방법의 한계를 어떻게 바라보는지가 연구에서 매우 중요하다는 점을 다시 느낄 수 있었다. 평소에는 현재 진행하고 있는 연구에 집중하다 보니 다른 분야의 연구를 충분히 접하기 어려웠는데, 이번 학회를 통해 새로운 방법론과 연구 아이디어를 다양하게 살펴보면서 연구에 대한 시야를 넓힐 수 있었다.짧은 일정이었지만 여러 연구자들의 발표와 연구에 대한 고민을 직접 들으며 앞으로 연구를 진행할 때 참고해보고 싶은 아이디어도 얻을 수 있었다. 현재 수행하고 있는 연구 역시 단순한 성능 향상에만 집중하기보다 문제를 명확히 정의하고, 연구 결과가 실제로 어떤 의미와 활용 가능성을 가질 수 있을지 함께 고민해야겠다는 생각이 들었다. 전체적으로 다양한 연구를 접하며 새로운 자극과 연구 방향에 대한 고민을 얻을 수 있었던 의미 있는 학회였다.[발표 후기]발표 제목: Cross-Attention 기반 이미지-Tabular 멀티모달 학습을 통한 타이어 Profile 편차 예측과 설계변수 영향 해석발표 내용: 이번 학회에서는 타이어 설계변수와 몰드 이미지를 함께 활용하여 실제 타이어 Profile의 1,600개 지점별 편차를 예측하는 연구를 포스터로 발표하였다. 단순히 두 입력을 결합하는 방식이 아니라 Cross-Attention을 통해 설계변수와 몰드 형상 간의 상호작용을 학습하도록 구성하였으며, Attention Map을 활용해 영역별 주요 설계변수의 영향도도 함께 해석하였다.실험 결과 제안한 방법이 Tabular만을 활용한 모델과 단순 Concat 방식보다 MAE, MSE, Hausdorff Distance에서 모두 좋은 성능을 보였다. 또한 Tread와 Sidewall 등의 영역에서 물리적 특성과 연관된 설계변수의 영향이 나타나는 것을 확인할 수 있었다.질문(1) Attention Pooling은 어떻게 진행되는 건가요?답변(1) Tabular와 Image의 혼합된 Fused Token을 각각의 weight를 기준으로 하나의 벡터로 통합하는 과정을 수행합니다.질문(2)히트맵에서의 진한 색 및 옅은 색이 의미하는 바는 무엇인가요?답변(2)진한 색으로 표현된 히트맵의 영역일수록 해당 부분에 특정 설계변수가 더 큰 영향을 준다는 것을 의미합니다. 또한 전체적인 타이어 형상을 예측할 때 해당 영역이 중요함을 의미합니다.이번 발표를 준비하고 여러 사람에게 연구를 설명하면서 연구의 핵심을 보다 간결하게 전달하는 방법을 배울 수 있었다. 또한 예측 성능뿐 아니라 결과를 어떻게 해석하고 실제 설계에 활용할 수 있을지까지 고민해볼 수 있었던 좋은 경험이었다.[청취 후기](1) ProMem: Process-Aware Memory Matching for Industrial Video Anomaly Detection (연세대학교 심준교 / 신범교 / 윤현수)해당 연구는 산업 현장의 비디오 이상 탐지에서 반복적으로 나타나는 공정의 순서와 시간적 구조를 활용하는 방법을 다룬 연구였다. 기존 산업 비디오 이상 탐지 방법은 주로 reconstruction이나 prediction 기반으로 접근하기 때문에 별도의 학습이 필요하고, 정상 공정이 일정한 순서와 주기를 반복한다는 특성을 충분히 활용하지 못한다는 한계가 있다. 이를 해결하기 위해 ProMem은 사전 학습된 visual encoder를 고정한 상태에서 정상 영상의 특징을 Memory에 저장하고, 공간·시간·주파수 특징을 이용해 공정 단계별로 여러 개의 순차적인 Memory Bank를 구성한다. 이후 입력 영상의 특징이 어떤 공정 단계에 해당하는지를 매칭하고, Memory와의 feature 차이뿐만 아니라 정상적인 공정 순서에서 벗어났는지까지 함께 고려하여 이상을 탐지한다.평소 Video Anomaly Detection 연구에서는 영상 내에서 발생한 시각적인 이상을 얼마나 잘 구분하는지가 중요하다고 생각했는데, 이번 발표를 통해 산업 영상에서는 단순한 외형적 이상뿐만 아니라 공정이 진행되는 순서 자체도 중요한 이상 정보가 될 수 있다는 점이 특히 인상 깊었다. 예를 들어 각 장면 자체는 정상처럼 보이더라도 특정 단계가 누락되거나 순서가 뒤바뀐다면 공정 전체에서는 이상으로 판단할 수 있다는 것이다. 또한 복잡한 모델을 새롭게 학습시키기보다 정상 데이터의 특징을 Memory로 구성하고 공정 구조를 활용했다는 점도 흥미로웠으며, 실제 산업 환경의 특성을 모델 설계에 직접 반영하는 것이 중요하다는 점을 느낄 수 있었던 발표였다.(2) AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs (서울대학교 김재희 / 강필성)해당 연구는 상용 LLM API 사용 시 Prompt와 Response가 외부 서버에 평문으로 전달되면서 발생하는 개인정보 노출 문제를 다룬 연구였다. 이를 해결하기 위해 원래 Token을 다른 Token으로 일대일 대응시키는 Vocabulary-level Bijection을 활용하여 사람이 읽기 어려운 ‘Alien Language’로 변환한 뒤 API에 전달하고, LLM은 Alien Adaptation Training을 통해 해당 언어를 이해하도록 학습한다.개인적으로는 모델 내부 구조를 수정하거나 복잡한 암호화 방식을 사용하는 대신, LLM과 주고받는 언어 자체를 변환해 개인정보 노출을 줄인다는 발상이 가장 인상적이었다.
Reviewed by 강동훈 강동훈
2026.08.28
Read More
28
2026.08

2026 한국데이터마이닝 하계학술대회 - 장성호

[학회 후기]2026년 8월 충남 예산에서 개최된 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회에서는 포스터 발표를 진행하며 다양한 연구자들과 연구에 대한 의견을 나눌 수 있었다.특히 많은 연구가 포스터 세션으로 진행되어 연구의 세부적인 부분까지 자유롭게 이야기할 수 있어 의미가 있었다. 연구를 진행하며 당연하게 생각했던 부분에 대해서도 질문을 받으면서 연구 동기와 한계를 다시 생각해 볼 수 있었고, 다른 연구들을 통해 다양한 관점을 접할 수 있었다. [발표후기]발표 제목: 게임 콘텐츠 생성을 위한 정답 데이터 없는 환경에서의 GRPO 기반 강화학습 프레임워크발표 내용: 본 연구는 정답이 되는 게임 맵 데이터 없이 사용자가 요구하는 조건을 만족하는 콘텐츠를 생성하는 것을 목표로 한다. GRPO 기반 학습 과정에서 발생하는 sparse reward와 공간 추론의 어려움을 완화하기 위해 Curriculum Learning, Domain Prompt, Q&A를 함께 활용하였다.질문 (1) GRPO 학습 초기에 collapse가 발생하는 이유는 무엇인가요?답변 (1) 학습 초기에는 모델이 객체 생성, 경로 연결, 목표 거리와 같은 여러 조건을 동시에 만족하는 맵을 생성하기 어렵기 때문에 대부분의 결과가 비슷하게 낮은 reward를 받게 된다. GRPO는 그룹 내 샘플의 상대적인 reward 차이를 이용해 학습하기 때문에 이러한 상황에서는 유의미한 학습 신호를 얻기 어렵고 학습이 불안정해질 수 있다. 이를 완화하기 위해 제안 방법론에서는 쉬운 조건부터 점진적으로 학습하는 Curriculum Learning을 적용하였다.질문 (2) 제안 방법은 게임 분야가 아닌 다른 방향으로 확장할 수 있나요?답변 (2) 본 연구의 핵심은 게임 자체보다는 정답 데이터가 없는 상황에서도 생성 결과가 주어진 조건을 만족하는지를 reward로 평가하며 학습할 수 있다는 점에 있다. 따라서 생성 결과에 대해 명확한 제약조건이나 평가 기준을 정의할 수 있는 문제라면 다른 분야에도 확장 가능성이 있다고 생각한다.질문 (3) 왜 정답 데이터가 없는 환경에서 학습해야 하나요?답변 (3) 게임 콘텐츠의 경우 새로운 게임이나 생성 조건이 추가될 때마다 이를 만족하는 정답 맵을 대량으로 제작하는 데 많은 비용이 필요하며, 경우에 따라서는 학습에 사용할 정답 데이터 자체가 존재하지 않을 수도 있다. 따라서 정답 맵 대신 콘텐츠가 만족해야 하는 조건을 reward로 정의하여 학습할 수 있다면, 새로운 환경에서도 별도의 정답 데이터 구축 없이 콘텐츠 생성을 학습할 수 있다는 장점이 있다.[청취 후기]1. Harmonized Cone for Feasible and Non-conflict Directions in Training Physics-Informed Neural Networks - (부도현/KAIST)해당 연구는 PINN에서 여러 loss를 동시에 최적화할 때 발생하는 gradient 문제를 다룬 연구였다. 기존 방법들이 loss reweighting이나 gradient conflict 완화에 각각 초점을 맞췄다면, 본 연구에서는 여러 loss를 동시에 감소시킬 수 있는 방향을 찾는 것이 중요하다고 보았다. 이를 위해 feasible direction과 non-conflict direction을 동시에 만족하는 영역을 Harmonized Cone으로 정의하고, 해당 영역에서 update direction을 결정하는 HARMONIC을 제안하였다.특히 여러 loss 중 일부를 희생하는 것이 아니라 가능한 한 모든 loss가 함께 감소할 수 있는 방향으로 학습함으로써 학습 안정성을 확보한다는 점이 흥미로웠다. 또한 이러한 조건을 추가적으로 고려함에도 기존 방법과 비교해 계산 시간이 크게 증가하지 않아, 학습 안정성과 계산 효율성을 동시에 확보했다는 점도 인상 깊었다.2. A Global-Local Frequency-Based Composite Loss Function for Enhancing Spatial Sharpness in Precipitation Prediction - (안수빈/서울대)해당 연구는 딥러닝 기반 강수 예측에서 MSE를 사용할 경우 예측 결과가 흐려지고 국지적인 강수 구조가 제대로 표현되지 않는 문제를 다루었다. 이를 해결하기 위해 Fourier Transform을 이용한 전역적인 주파수 정보와 Dual Tree Complex Wavelet Transform을 이용한 지역적인 구조 정보를 함께 반영하는 WFCL을 제안하였다.주파수 정보를 활용할 때 일반적으로 Fourier Transform이나 Wavelet Transform 중 하나를 사용하는 경우가 많은데, 두 방법의 장점을 하나의 loss에 함께 반영했다는 점이 인상 깊었다. 특히 Wavelet Transform을 통해 여러 방향의 고주파 밴드에서 지역적인 구조를 반영하는 동시에, 이 과정만으로 충분히 반영하기 어려운 전역적인 저주파 정보는 Fourier Transform을 통해 보완하였다. 서로 다른 주파수 표현을 함께 활용함으로써 강수 패턴의 국지적인 선명도와 전체적인 구조를 모두 고려하고, 결과적으로 성능 향상으로 이어졌다는 점이 흥미로웠다.
Reviewed by 장성호 장성호
2026.08.28
Read More
27
2026.08

2026 한국데이터마이닝 하계학술대회 - 박성수

[학회후기] 2026년 8월 24일부터 26일까지 충청남도 예산 스플라스 리솜에서 열린 2026 한국데이터마이닝학회 하계학술대회에 참석하였다. 이번 학회의 주제는 ‘데이터에서 실행으로: 에이전틱 AI가 만나는 피지컬 월드’였고, 로봇과 Physical AI, World Model, Agentic AI 등 최근 주목받고 있는 연구와 산업 적용 사례를 접할 수 있었다. 특히 최신 연구뿐만 아니라 실제 제조 및 산업 현장에서 AI를 어떻게 활용하고 있는지에 관한 발표가 함께 구성되어 있어서 연구에서 제안하는 기술과 실제 환경에서 요구되는 기술 사이의 연결을 생각해 볼 수 있었다. 여러 발표를 들으며 가장 인상 깊었던 점은 새로운 모델을 만드는 것만큼이나 기존 모델이 어떤 상황에서 실패하고 그 원인이 무엇인지를 구체적으로 분석하는 것이 중요한 연구가 될 수 있다는 점이었다. 실제 환경에서는 데이터의 변화나 계산 비용, 모델의 안정성 등 다양한 문제가 동시에 발생하기 때문에 단순한 성능 향상만으로는 충분하지 않다는 생각도 들었다. 이번 학회를 통해 앞으로 연구를 진행할 때도 결과적인 성능뿐 아니라 모델이 어떤 상황에서 잘 작동하고, 어떤 상황에서 실패하는지를 살펴볼 필요가 있겠다고 느꼈다. [발표후기] 제목: Retrieval-Guided Residual Correction for Robust Time-Series Forecasting 기존 시계열 예측 모델은 주로 제한된 Lookback Window를 기반으로 미래를 예측하기 때문에, 과거에 드물게 등장했거나 복잡한 패턴에 대해서는 충분한 정보를 활용하기 어렵다는 문제에서 출발한 연구다. 이를 보완하기 위해 현재 입력과 유사한 과거 시계열을 검색하고, 당시의 실제 미래값을 직접 가져오는 대신 해당 시점에서 기본 예측 모델이 발생시켰던 예측 오차, 즉 Residual을 활용하여 현재 예측값을 보정하는 방법을 제안하였다. 비슷한 상황에서 모델이 어떠한 방향으로 틀렸는지를 참고하면 기본 모델의 반복적인 오류를 보완할 수 있다는 것이 아이디어다. 질문 (1) 유사한 과거 입력을 찾더라도 당시의 Residual이 현재 상황에서도 유효하다는 보장이 없는데, 잘못 검색된 Residual로 인해 오히려 기본 예측 성능이 저하될 가능성은 없나요? 답변 (1) 충분히 발생할 수 있는 문제입니다. 따라서 제안 방법에서는 검색된 Residual을 그대로 현재 예측값에 더하지 않고 여러 Residual 정보를 요약한 뒤 Correction Head를 통해 필요한 보정값을 생성합니다. 또한 보정값의 크기를 제한하는 파라미터를 두어서 검색 정보가 잘못되더라도 기본 예측이 크게 훼손되지 않도록 하였습니다. 실제 실험에서도 파라미터를 작게 설정했을 때는 기본 모델 대비 안정적인 성능 향상이 나타나지만, 파라미터가 지나치게 커질 경우에는 성능이 감소하는 것을 확인했습니다. 향후에는 검색된 Residual의 신뢰도를 함께 고려하여 상황에 따라 보정 강도를 조절하는 방향도 고려할 수 있습니다. [청취후기] (1) Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models (연세대학교 홍수정 / 황성재) Diffusion 방식의 Vision-Language Model이 긴 문장을 생성할 때 발생하는 반복적인 문장 생성과 이미지 정보 활용 저하 문제를 분석한 연구다. Diffusion VLM은 Autoregressive 모델과 달리 여러 Mask Token을 반복적으로 복원하며 병렬적으로 문장을 생성하는데, 연구에서는 이러한 구조 자체에서 두 가지 문제가 발생한다는 것을 발견하였다. 첫 번째는 모든 생성 토큰이 동일한 Mask Token에서 시작하면서 Hidden Representation이 공통된 방향으로 점차 수렴하는 ‘Mask Prior Drift’이고, 이것이 특정 단어나 표현을 반복적으로 생성하는 원인이 된다. 두 번째는 RoPE가 갖는 위치적 편향으로 인해 생성 토큰이 멀리 위치한 유용한 이미지 토큰보다 주변의 아직 복원되지 않은 Mask Token에 지나치게 Attention을 주게 되는 ‘Positional Attention Collapse’이다. 연구에서는 이를 해결하기 위해 Mask Prior Suppression과 Monotonic RoPE Scaling을 제안했고, 별도의 재학습 없이 추론 단계에서 적용할 수 있다. 무엇보다 새로운 네트워크를 추가하여 성능을 높이려고 하지 않고, 먼저 모델이 실패하는 내부적인 원인을 분석하고 그 원인에 직접 개입했다는 점이 인상적이었다. 특히 반복 생성이라는 겉으로 드러난 현상을 단순한 성능 문제로 처리하지 않고 Hidden Representation과 Attention의 변화까지 추적하여 설명한 과정이 흥미로웠다. 연구를 진행하다 보면 성능이 좋지 않은 결과를 새로운 모듈이나 Loss로 곧바로 해결하려고 할 때가 많은데, 그러기보다 먼저 ‘모델이 정확히 어디에서, 왜 틀리고 있는가’를 분석하는 과정 자체가 중요한 연구가 될 수 있다는 점을 다시 생각하게 해준 발표였다. (2) PGRF-Net: A Prototype-Guided Relational Fusion Network for Diagnostic Multivariate Time-Series Anomaly Detection (연세대학교 정자훈 / 윤현수) 다변량 시계열 이상탐지에서 높은 탐지 성능과 해석 가능성을 동시에 확보하기 위한 연구다. 일반적인 이상탐지 모델은 특정 시점을 이상으로 판단하더라도 하나의 Anomaly Score만을 출력하기 때문에 어떤 특성 때문에 이상으로 판단했는지 파악하기 어렵다는 문제가 있다. 이 연구는 이런 문제를 해결하기 위해 이상 징후를 하나의 기준으로 판단하지 않고, 예측값과 실제값 사이의 차이를 나타내는 Predictive Deviation, 변수 간 관계 구조의 변화를 나타내는 Structural Deviation, 정상 상태의 Prototype과 얼마나 달라졌는지를 나타내는 Contextual Deviation, 그리고 국소적인 급격한 변화를 측정하는 Spike Deviation의 네 가지 증거로 나누어 바라본다. 이후 Gated Evidence Fusion Network가 데이터에 따라 각 증거의 중요도를 조절하여 최종 이상 점수를 생성한다. 단순히 이상 여부를 탐지하지 않고, 어떠한 종류의 변화가 이상 판단에 크게 기여했는지 확인할 수 있다는 것이 장점이다. 시계열 이상탐지 모델을 실제 산업 현장에서 활용한다고 생각했을 때 의미 있는 접근이라고 느꼈다. 현장에서는 모델이 ‘이상이다’라고 알려주는 것에서 끝나는 것이 아니라 왜 이상으로 판단했는지에 대한 단서가 있어야 이후의 점검이나 의사결정으로 연결할 수 있기 때문이다. 또한 서로 다른 성격을 가진 이상을 하나의 점수 생성 방식으로 모두 설명하려고 하지 않고, 여러 종류의 이상 증거를 먼저 분리해서 추출한 뒤에 상황에 따라 결합한다는 문제 설정도 인상적이었다.
Reviewed by 박성수 박성수
2026.08.27
Read More
27
2026.08

2026 한국데이터마이닝 하계학술대회 - 이용우

[학회 후기]2026년 8월 24일부터 26일까지 충남 예산 스플라스 리솜에서 열린 한국데이터마이닝학회 하계학술대회에 참가하였다. 이번 학회의 테마가 ‘From Data to Action: Agentic AI Meets the Physical World’였던 만큼, 기계공학 전공자로서 Physical AI라는 주제가 무척 반갑게 다가왔다. 향후 AI 연구에 기존 기계공학적 도메인 지식과 경험을 어떻게 효과적으로 접목할 수 있을지에 대한 고민과 기대감이 들었다.이전에 참석했던 다른 학회들과 비교했을 때 전반적인 발표의 깊이와 완성도가 매우 높다는 인상을 받았다. 특히 우수논문 발표 세션과 포스터 세션 전반에서 불확실성 정량화(Uncertainty Quantification, UQ)를 다룬 연구들이 다수 포진해 있어 더욱 흥미롭게 지켜보았다. 다양한 산업 및 머신러닝 문제에서 UQ를 정교하고 수준 높게 활용하는 연구들을 직접 접하며 연구적 자극과 함께 많은 인사이트를 얻을 수 있었던 것 같다. 아울러 학회 공식 일정이 끝난 뒤  교수님, 연구실 동료들과 함께 시골 정취를 느끼며 맛있는 식사와 담소를 나누고 좋은 추억을 쌓을 수 있었던 점도 뜻깊었다.[발표 후기]발표 제목: Quantile Regression Forest를 활용한 타이어 프로파일 지점별 가변 Prediction Band 구축발표 내용: 타이어 단면 외곽 형상인 프로파일 예측 시, 기존 점예측 방식이 갖는 신뢰도 판단의 한계를 극복하기 위해 설계 변수 및 지점(1,600 points)별 오차 특성을 반영하는 가변 Prediction Band 구축 방법론을 발표하였다. Quantile Regression Forest(QRF)로 지점별 법선 오차 분위수를 추정한 후, 프로파일 전체가 밴드 내에 포함될 확률을 보장하는 Full-profile Coverage Calibration을 적용해 밴드 폭을 최적화한 연구이다.현장 질의응답 및 피드백:- 질문: 각 포인트별 Band 폭을 예측할 때, Calibration 비율은 어떻게 산출하는 것인가요?- 답변: 모델(QRF)이 예측한 지점별 오차 분위수 대비 실제 오차의 비율을 계산하고, 그중 프로파일 내 최대 비율을 Calibration Score로 정의하여 산출합니다.- 재질문: 그렇다면 모델 학습 단계가 아닌 후처리(Post-processing) 방식에 가까운 형태인가요?- 답변: 네, 맞습니다. 지점별 분위수 추정 모델을 먼저 구축한 뒤, 검증 샘플을 기반으로 전체 커버리지를 보정하는 후처리 방식으로 동작합니다.- 피드백: 추후 법선 오차 분위수를 학습하는 단계에서 Full-Profile Coverage 관련 제약이나 목적식을 손실 함수(Loss Function)에 직접 반영하여 엔드투엔드로 최적화해보는 방향도 좋을 것 같습니다.발표 소회: 포스터 앞에 서서 내 연구에 많은 관심을 보여주시고 날카로운 질문과 유익한 피드백을 주신 연구자분들께 진심으로 감사했다. 연구의 발전 방향에 대한 좋은 아이디어를 얻음과 동시에, 앞으로 수행할 연구에 대한 책임감도 한층 더 무겁게 느끼게 되었다.[청취 후기]1) Courtroom Analogy: New Perspective on Uncertainty-Aware Classification (ICML 2026, KAIST 윤태성·김희영)현재 예측 불확실성을 주요 연구 주제로 다루고 있는 만큼 가장 주의 깊게 들었던 발표였다. 분류 문제를 법정 공방에 빗대어 클래스별 옹호자(Advocate) 의견과 신뢰도를 Dirichlet 혼합 분포로 모델링하고, 단일 순전파(Single forward pass)만으로 불확실성의 원인을 '증거 부족(Intra-advocate)'과 '클래스 간 경계 대립(Inter-advocate)'으로 분해하는 구조가 매우 신선했다. 향후 분류 문제에서, 미학습 데이터(OOD)가 유입되었을 때, 불확실성의 발생 원인을 세부적으로 진단하고 예측 신뢰도를 판단하는 데 유용하게 활용할 수 있을 것 같다.2) Hierarchical Bayesian Neural Architecture Search via Sparse Architecture Learning (광운대학교 장유나·이상민)신경망 구조를 사람이 수동으로 설계하는 대신 자동으로 탐색하는 NAS(Neural Architecture Search)라는 분야를 이번 학회를 통해 처음 접하게 되었는데, 매우 흥미롭고 유익한 발표였다. 탐색 과정에서 Posterior Relevance와 Decision Support를 분리하여, 후보 연산에 대한 신뢰도가 충분히 확보되었을 때 탐색 공간을 줄여나가는 계층적 베이지안 접근 방식이 인상적이었다. 딥러닝 모델의 구조 자체를 최적화하는 연구 분야가 어떻게 발전하고 있는지 전반적인 개념과 흐름을 새롭게 배울 수 있어 시야를 넓히는 데 큰 도움이 되었다.
Reviewed by 이용우 이용우
2026.08.27
Read More
27
2026.08

2026 한국데이터마이닝 하계학술대회 - 안채원

[학회후기]충청남도 예산에서 열린 데이터마이닝 학회에 참석하였다. 입학 후 두 번째 학회이지만, 포스터 발표는 처음이라 긴장도 되고 설레이기도 했다. 포스터 세션은 2개로 나눠졌는데, 청취자로 돌아다닐 수 있었던 두 번째 세션에서 발표에 대한 태도를 돌아보고 개선할 점도 찾을 수 있었다. 나는 청취자가 질문을 하면 설명을 해주는 수동적인 방식이었는데, 내가 포스터 앞에 서있자 먼저 '제가 대략적으로 설명해드릴까요?'라며 적극적으로 설명해주시는 발표자 분을 보며 다음 학회 때는 더욱 능동적으로 소통해야겠다는 생각이 들었다.  그리고 15분을 알차게 과외 선생님처럼 이해도롤 살피며 설명해주시는 또 다른 발표자 분을 보면서,  나 또한 나의 연구를 정확하게 설명하고 자유롭게 소통할 수 있는 연구자로 성장해야겠다는 목표를 가지게 되었다. [발표후기]제목: 분할 파운데이션 모델과 멀티모달 거대 언어모델 기반 반도체 SEM 이미지 추론 분할 기법이번 학회에서는 자연어로 입력된 사용자의 요구사항에 따라 반도체 SEM 이미지 내의 객체를 분할하는 연구를 주제로 포스터 발표를 진행하였다. 기존의 SAM3 Agent를 반도체 SEM 이미지에 적용하면서 발생하는 문제를 분석하고, 이를 해결하기 위해 SEM 이미지의 특성을 반영한 시스템 프롬프트와 미검출 객체를 추가로 탐색하는 Self-feedback loop를 제안하였다. 특히 SAM3 Image Encoder에서 추출한 특징을 활용하여 유사도를 계산하거나 K-means 군집화를 통해 미검출 객체의 위치를 찾고, 이를 다시 Exemplar로 활용하여 객체를 추가 분할하는 방법을 소개하였다.발표 중에는 연구의 기존 방법과의 차이점이나 추가 학습 없이 새로운 반도체 이미지에 적용할 수 있는 이유 등에 대한 질문을 받을 수 있었다. 특히 기존 SAM3 Agent와 비교했을 때 어떤 부분이 개선되었는지 설명하면서, 기존 프레임워크가 자연 이미지를 중심으로 설계되어 반복적이고 규칙적인 특징을 가진 SEM 이미지에서는 객체를 놓치거나 적절하지 않은 객체를 선택하는 문제가 발생할 수 있다는 점을 설명하였다. 이에 제안한 방법에서는 이미지 특징을 다시 분석하여 미검출 객체의 위치를 탐색하고, 추가적인 Exemplar를 적용한 뒤 다시 MLLM이 결과를 분석하는 Self-feedback 과정을 통해 이러한 문제를 보완한다고 답변하였다.또한 새로운 반도체 공정에 대해서도 별도의 재학습 없이 적용할 수 있는 이유에 대해서는, 특정 공정의 데이터를 학습하는 방식이 아니라 SAM3와 MLLM이 가진 기존의 능력을 활용하면서 시스템 프롬프트와 추가 도구를 통해 추론 과정을 보완하는 방식이기 때문이라고 설명하였다. 이러한 질의응답을 통해 연구를 진행하는 과정에서는 당연하게 생각했던 부분도 다른 사람의 입장에서는 충분한 설명이 필요하다는 것을 느꼈다.[청취후기](1) State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Lage Multimodal Models (KAIST 김기욱 / 서민준)첫 번째로 청취한 발표는 긴 영상에서 발생하는 방대한 Vision Token을 효율적으로 압축하여 Large Multimodal Model이 장시간 영상을 이해할 수 있도록 하는 방법에 관한 연구였다. 기존에는 질문과 관련된 프레임을 미리 선택하여 모델에 입력하는 방식을 사용할 수 있지만, 실제 상황에서는 어떤 프레임이 질문과 관련 있는지를 사전에 정확하게 판단하기 어렵다는 한계가 있다는 점이 인상적이었다.이를 해결하기 위해 입력된 이미지 토큰의 중요도를 Gate를 통해 판단하고, Learnable Sampling을 활용하여 중요한 정보를 적응적으로 선택하고 압축하는 방식을 제안하였다. 또한 긴 시퀀스를 효율적으로 처리하기 위해 State Space Model 기반의 양방향 Mamba 구조를 적용하였다. 영상의 길이가 증가할수록 Attention 기반 모델은 계산량과 메모리 사용량이 크게 증가할 수 있기 때문에, 모델 구조를 개선하는 것뿐만 아니라 입력 자체를 효율적으로 압축하는 과정도 중요하다는 것을 느낄 수 있었다. Mamba는 이전에 비디오 연구를 할 때 접한 적이 있었는데, 아직은 트랜스포머의 압도적인 성능 때문에 주류가 되지는 않았다고 알고 있었다. 하지만 네이버 현직자 분이 mamba라는 구조를 실제 현업에 도입하여 연구를 하신 것을 보고 기술의 변화가 가장 빨리 적용 되는 곳이 ai분야라는 것을 다시 한번 느낄 수 있었고, 새로운 트렌드에 항상 열려있는 자세로 받아들여야할 것 같다는 생각이 들었다. (2) Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models(연세대학교 홍수정/황성재)Mask Prior Drift를 완화하기 위해 저주파 성분을 중심으로 마스크의 사전 정보를 보정하여 객체의 대략적인 위치와 형태가 생성 과정에서 점차 밀려나는 현상을 방지하고, 고주파 성분을 조절하여 객체의 경계와 세부적인 질감이 자연스럽게 유지될 수 있도록 하였다. 또한 Attention Map을 주파수 영역으로 변환하여 분석하고, Attention이 특정 위치에 과도하게 집중되는 Positional Attention Collapse 현상을 완화하는 방법도 인상적이었다. 고주파 성분을 억제하고 중저주파 성분의 분포를 조절함으로써 Attention이 하나의 지점으로 집중되는 것을 방지하고 보다 부드럽고 균일하게 퍼지도록 유도한다.이번 발표를 통해 주파수 기반 분석이 생각보다 다양한 분야에 활용될 수 있다는 것을 느꼈다. 평소 이미지 처리에서 주로 사용되는 개념이라고 생각했던 주파수 분석이 Diffusion Model이나 Vision Language Model의 내부 현상을 분석하고 개선하는 방법으로도 적용될 수 있다는 점이 특히 인상적이었다. 같은 Attention Map이라도 단순히 픽셀 공간에서 바라보는 것이 아니라 주파수 영역으로 변환하면 다른 관점에서 문제를 해석할 수 있다는 점을 배울 수 있었고 우리가 쉽게 접하는 개념들을 그냥 넘기지 말고 이 개념이 어떻게 적용될 수 있을지 생각해봐야 할 것 같다.
Reviewed by 안채원 안채원
2026.08.27
Read More
27
2026.08

2026 한국데이터마이닝 하계학술대회 - 김성수

[학회후기]충청남도 예산에서 열린 데이터마이닝 학회에 참석하였다. 지난 데이터마이닝 학회까지는 주최 연구실로 참석했었지만, 이번 학회는 청취자로 참여하여 마음이 한결 편안했다. 이번 데이터마이닝 학회의 테마는 최근 화두인 Physical AI와 에이전트였다. 학술적인 내용뿐 아니라 기업 관계자분들이 오셔서 실제 현업 적용 사례를 여럿 소개해 주셨는데, 최신 연구임에도 이론에 머물지 않고 벌써 현장에서 활용되고 있다는 점이 놀라웠다. 또한 이번 학회에는 2026년 탑티어 컨퍼런스에 게재된 논문을 저자가 직접 구두로 발표하는 세션도 마련되어 있었다. 여러 발표를 들으며 느낀 점은, 단순히 성능을 끌어올리는 것보다 새로운 Task를 정의하고 문제 상황을 새롭게 바라보는 일이 훨씬 중요하다는 것이었다. Kaggle에 참여할 때처럼 성능에만 집착해 왔던 나에게, 좋은 문제를 정의하는 일의 중요성을 다시 한번 일깨워 준 시간이었다.[발표후기]제목: 대조적인 어휘 쌍을 활용한 SAM3 기반 제로샷 산업 이상 이미지 분할MVTec과 같은 산업 이상 이미지에서 추가 학습 없이 이상 영역을 분할하는 것을 목표로 하는 연구다. 이를 위해 어느 영역을 분할할지 판단하는 MLLM과 실제 분할을 수행하는 SAM3를 결합해 프레임워크를 구성했다. 다만 MLLM과 SAM3 모두 산업 이미지와 같은 특수 도메인에서는 성능이 저조하다는 한계가 있다. 이에 이상 정보만 활용하는 대신 MLLM을 통해 정상 정보까지 함께 확보하여 정보의 다양성을 높였다. 나아가 보다 정교한 결과를 얻기 위해 단일 문맥이 아닌 다양한 문맥 정보를 기반으로 Segmentation을 수행했고, 그 결과 이미지를 한층 정밀하게 분할할 수 있었다.질문 (1) Object 계열에서는 우수한데, Texture 계열에서는 왜 저조한가요?답변 (1) SAM3 특성 상, Object를 분할하는 모델이라 Object에서는 탁월했던 것으로 생각됩니다. 다만 Texture 계열은 지역적인 정보가 중요한데, 해당 방법론은 아직 세밀한 지역적 정보에 대한 개념은 반영하지 않고 있어 저조합니다.[청취후기](1) AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs (서울대학교 김재희 / 강필성)요즘 이슈의 중심인 LLM Safety를 다룬 발표였다. 이 연구는 입력과 출력을 그대로 주고받는 대신 단어를 치환하는 사전을 구축해, 중요한 정보가 식별되지 않도록 만드는 방법을 제안한다. 이때 단어를 1:1로 매핑하되 편집 거리는 최대화하고 의미적 유사도는 낮아지도록 사전을 설계한다. 다만 변환 결과를 보면 "까마귀가 에어컨 아래에서 코딩한다"처럼 문장 자체가 말이 되지 않는 형태였다. 개인적인 바람으로는, 문장으로는 그럴싸해 보이지만 실제 내용은 전혀 다른 "자연스러운" 암호화 전략에 대한 연구도 필요하지 않을까 하는 생각이 들었다.(2) State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Lage Multimodal Models (KAIST 김기욱 / 서민준)인공지능을 잘 모르는 사람이라도 "토큰"이라는 말은 이제 한 번쯤 들어봤을 것이다. 일반적인 텍스트보다 이미지가 더 많은 토큰을 차지하고, 이미지의 연속인 비디오는 그보다 훨씬 많은 토큰을 차지한다. 이 연구는 MLLM에서 긴 비디오를 다룰 때 토큰을 어떻게 효율적으로 활용할 수 있을지에 대한 방법론을 소개한다. 사실 이 발표는 내용보다도 발표자의 학회 참석 태도가 더 인상적이었다. 2026년 탑티어에 게재된 연구들이라 내용을 따라가기가 쉽지 않아 다들 질문을 망설이는 분위기였는데, 발표자는 대다수 발표에 적극적으로 참여했다. 특히 질문이 몰리는 발표에서는 적절히 완급을 조절하고, 질문이 나오지 않는 발표에는 먼저 나서서 질문하며 세션을 한층 풍성하게 만들어 주었다. 질문 내용을 들어 보면 자신이 이해한 부분에서 하나라도 더 얻어 가려는 태도가 분명히 드러났고, 누구나 알아듣기 쉽도록 잘 정제된 언어로 질문하는 방식 또한 배울 점이 많았다. 발표자를 보면서, 내용이 어렵다는 이유로 중간에 좌절했던 나 자신을 돌아보게 되었다.
Reviewed by 김성수 김성수
2026.08.27
Read More