(1) 개요
최근 VLA(Vision-Language-Action) 관련 연구 동향에 관심이 생겨 관련 자료를 이것저것 찾아보던 중, 로보시지에서 진행하는 Physical AI 교육을 통해 실제 로봇을 직접 다루고 실습해볼 수 있는 기회를 얻게 되었다. 논문이나 자료, LLM에 질문을 던지는 것만으로는 로봇이 데이터를 어떻게 쌓고 이를 통해 어떻게 학습하는지가 잘 와닿지 않았는데, 이번 교육에서 로봇 조작부터 데이터 수집, 모델 학습, 추론까지 직접 실습해보면서 그 원리와 흐름이 실제로 어떻게 작동하는지를 몸으로 이해할 수 있었다.

(2) 직접 수집해본 로봇 행동 데이터
첫째 날에는 LeKiwi라는 로봇의 구조와 구성을 살펴보고, 이를 원격으로 조작하는 방법과 그 과정에서 학습용 데이터를 수집하는 방법을 배웠다. 데이터는 첫째 날과 둘째 날에 걸쳐 각각 유선과 무선 환경에서 수집해보았는데, 같은 작업이라도 연결 환경에 따라 조작의 안정성과 수집 난이도, 소요 시간이 꽤 다르게 나타난다는 것을 확인할 수 있었다. 또한 데이터를 수집할 때는 매번 일정한 규칙과 태도를 유지하며 조작해야 한다는 점이 인상 깊었다. 그리퍼를 여는 시점이나 팔을 뻗는 방식 등을 일관되게 유지하지 않으면 데이터의 질이 떨어질 수 있었기 때문에, 데이터 수집 자체가 단순 반복이 아니라 그 나름의 준비와 집중이 필요한 하나의 작업이라는 것을 체감할 수 있었다.

(3) 학습 결과가 실제 움직임이 되기까지
수집한 데이터를 온라인으로 업로드한 뒤, 이를 바탕으로 LeKiwi 로봇이 사람의 직접적인 조작 없이도 스스로 움직여 원하는 객체를 집을 수 있도록 모델을 학습시켰다. 학습에는 ACT와 SmolVLA 두 가지 방식을 활용했는데, 데이터의 품질이 좋고 양이 많을수록, 그리고 수집 과정에서 뚜렷한 규칙을 지킬수록 학습이 훨씬 잘 되어 로봇이 원하는 객체를 안정적으로 집어내는 모습을 확인할 수 있었다. 데이터 수집 단계에서 느꼈던 어려움이 실제로 학습 성능과 직결된다는 것을 결과로 직접 확인할 수 있었던 부분이 특히 인상 깊었다.

마지막 날에는 Isaac Sim이라는 시뮬레이션 환경에서 데이터를 수집하고 모델을 학습하는 방법을 배웠다. 시뮬레이션 환경 자체는 잘 구축되어 있었지만, 그 안에 들어가는 모든 객체는 사용자가 직접 만들어야 한다는 점에서 데이터 수집을 위해서는 생각보다 많은 준비 과정과 세밀한 환경 설정이 필요하다는 것을 알게 되었고, 동시에 그만큼 세부적으로 환경을 조절할 수 있다는 점에도 놀랐다. 다만 시간이 부족해 실제로 학습을 진행해보지는 못하고 방법론만 익히는 데 그쳐, 시뮬레이션에서 수집한 데이터가 실제 로봇의 행동으로 얼마나 잘 이어지고 실제 환경에서도 쉽게 동작할 수 있는지는 확인하지 못한 아쉬움이 남았다.

4) 교육을 마치며
로봇을 한 번도 다뤄본 적 없는 상태에서 VLA 연구를 시작했다면 환경 설정부터 많은 시행착오를 겪었을 텐데, 이번 교육 덕분에 LeKiwi 로봇 조작부터 데이터 수집, ACT·SmolVLA 학습, Isaac Sim 시뮬레이션까지 핵심 흐름을 짧은 기간에 알차게 익힐 수 있었다. 특히 데이터 수집 시 일관된 규칙을 지키는 것이 학습 성능으로 직결된다는 점을 직접 확인하며, 로봇에 대한 진입 장벽이 크게 낮아짐을 느꼈다. 이렇게 값진 경험을 할 수 있도록 기회를 마련해 주신 김성범 교수님과 허종국 선배님, 그리고 교육이 원활히 진행될 수 있도록 도와주신 로보시지 관계자분들께 진심으로 감사드린다.