World Model-Based Vison Language Action Model
- 2026년 8월 28일 오후 9:38
- 조회수: 6
INFORMATION
- 2026년 8월 28일
- 오후 12시 ~
온라인 비디오 시청 (YouTube)
발표자:
정재우
정재우
TOPIC
World Model-Based Vison Language Action Model
On-Line Video
OVERVIEW
요약:
기존 Vision-Language-Action Model(VLA)은 시각 관측과 언어 지시로부터 로봇의 행동을 직접 생성하는 정책 모델이다. 그러나 전문가 시연에 대한 모방학습에만 의존하는 기존 VLA는 환경의 역학에 대한 이해 없이 관측과 행동을 직접 사상하므로, 분포 외 상황에 취약하고 실패로부터 스스로 교정하지 못한다는 한계를 지닌다.
이를 보완하기 위해 월드 모델(World Model)을 VLA에 접목하는 연구들이 등장하며 활발히 진행되고 있다. 월드 모델은 에이전트가 환경의 역학(dynamics)을 학습하여 자신의 행동이 초래할 미래 상태를 예측할 수 있도록 하는 내부 모델로, 실제 상호작용 없이도 계획과 정책 학습을 가능하게 한다. 최근 월드 모델 기반 VLA 연구는 월드 모델을 정책의 보조 표현으로 사용하는 단계에서 정책이 상호작용하는 환경 자체로 사용하는 방법으로 발전하고 있다. 본 세미나에서는 이러한 흐름을 대표 연구들을 통해 살펴보고, VLA 분야 내 월드 모델의 역할 변화와 예측 대상 및 예측 공간의 설계 선택이 정책 성능에 미치는 영향을 함께 논의하고자 한다.
참고자료:
[1] Zhen, H., Qiu, X., Chen, P., Yang, J., Yan, X., Du, Y., Hong, Y., & Gan, C. (2024). 3D-VLA: A 3D Vision-Language-Action Generative World Model. In International Conference on Machine Learning (ICML).[2] Zhang, W., Liu, H., Qi, Z., Wang, Y., Yu, X., Zhang, J., Dong, R., He, J., Wang, H., Zhang, Z., Yi, L., Zeng, W., & Jin, X. (2025). DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge. In Advances in Neural Information Processing Systems (NeurIPS).