9월 14일부터 9월 16일까지 3일간 로보시지에서 진행한 Physical AI 교육에 참여했다.

최근 들어 VLA(Vision-Language-Action)에 조금씩 관심이 생기고 있었다. 특히 나는 diffusion을 중심으로 연구하고 있다 보니, VLA에서도 action space를 생성하거나 추론하는 과정에 diffusion 계열 방법론이 활용된다는 점이 꽤 흥미롭게 느껴졌다. 논문으로만 볼 때는 아직 조금 멀게 느껴지는 분야였는데, 마침 좋은 기회로 실제 로봇을 직접 만지고 데이터를 수집해볼 수 있는 교육에 참여하게 되었다.


(1) 교육 후기 및 느낀점

이번 교육에서는 mobile manipulator인 LeKiwi를 활용해 calibration, teleoperation, 데이터 수집, 모델 학습 및 추론, 그리고 Isaac Sim을 이용한 simulation까지 Physical AI의 전체적인 흐름을 직접 경험해볼 수 있었다. 첫째 날과 둘째 날에는 실제 LeKiwi를 가지고 calibration과 teleoperation을 수행했다. Leader arm을 사람이 직접 움직이면 follower arm이 그 움직임을 따라가고, 이를 이용해 물체를 집고 옮기는 task의 데이터를 직접 수집했다. 사실 교육 전에는 로봇 학습에서도 결국 좋은 모델을 만들고 잘 학습시키는 것이 가장 중요하지 않을까 생각했다. 그런데 직접 해보니 오히려 데이터를 어떻게 만드는지가 생각보다 훨씬 중요했다.


예를 들어 같은 물체를 집어 옮기는 단순한 task라고 하더라도, gripper를 언제 열지, 어떤 방향으로 먼저 움직일지, 물체에 어떻게 접근할지 등 사람이 선택할 수 있는 방법은 여러 가지가 있었다. 사람 입장에서는 모두 성공하는 행동이지만, 적은 수의 데이터로 imitation learning 모델을 학습할 때는 이런 차이가 오히려 모델 입장에서 혼란이 될 수 있었다. 그래서 데이터를 수집할 때는 어느 정도 자신만의 규칙을 정하고 일관성 있게 수행하는 것이 중요하다는 것을 알게 되었다. 직접 해보기 전에는 성공한 데이터면 다 좋은 데이터 아닌가라고 생각했는데, 실제로는 같은 성공 데이터 안에서도 행동 방식이 얼마나 일관적인지가 꽤 중요했다. 반대로 너무 똑같은 조건에서만 데이터를 모으는 것도 문제가 되었다. 로봇이 학습할 때 보지 못했던 위치에 물체가 있거나, 작은 오차로 인해 trajectory가 조금만 어긋나도 스스로 복구하지 못하는 경우가 있었다. 결국 모든 데이터를 완벽한 데이터로만 구성하는 것이 항상 좋은 것은 아니었다. 다양한 초기 위치에서 시작해보거나, 실패한 상태에서 다시 정상적인 행동으로 돌아오는 recovery 데이터도 필요했다. 이 부분이 특히 인상 깊었다. 결국 Physical AI에서는 단순히 데이터의 개수보다 모델이 어떤 상태들을 학습 과정에서 경험했는가가 굉장히 중요하다는 생각이 들었다.


수집한 데이터로는 imitation learning 기반의 ACT와 경량 VLA 모델인 SmolVLA를 직접 학습하고 추론해보았다. 모델 학습 자체는 기존에 해오던 딥러닝 실험과 크게 다르지 않았지만, 차이가 있다면 결과가 바로 눈앞의 로봇 움직임으로 나타난다는 점이었다. 이미지 모델에서는 성능이 몇 퍼센트 떨어져도 숫자로만 느껴질 때가 많은데, 로봇에서는 데이터가 좋지 않거나 모델이 잘못 학습되면 로봇이 엉뚱한 곳으로 움직이거나 물체를 제대로 잡지 못하는 모습이 바로 보였다. 그래서 데이터와 모델의 관계가 훨씬 더 직접적으로 느껴졌다. 이미지 모델에서는 성능이 몇 퍼센트 떨어져도 숫자로만 느껴질 때가 많은데, 로봇에서는 데이터가 좋지 않거나 모델이 잘못 학습되면 로봇이 엉뚱한 곳으로 움직이거나 물체를 제대로 잡지 못하는 모습이 바로 보였다. 그래서 데이터와 모델의 관계가 훨씬 더 직접적으로 느껴졌다. 또 재미있었던 점은 VLA나 end-to-end 모델만 배운 것이 아니라 YOLO 기반 환경 인식과 rule-based control, teaching 기반 제어 방식도 함께 경험했다는 것이다. 이 과정에서 과연 모든 문제에 VLA가 필요한가라는 생각도 들었다. 예를 들어 물체의 위치가 어느 정도 정해져 있고, 동일한 동작을 계속 반복하는 작업이라면 굳이 큰 학습 모델을 사용할 필요 없이 rule-based 방식이 훨씬 안정적이고 효율적일 수도 있다.


그렇다면 VLA가 정말 필요한 순간은 언제일까, 내가 느끼기에는 결국 환경과 task가 복잡해질수록 사람이 모든 상황을 rule로 정의하기 어려워지는 지점에서 학습 기반 모델의 장점이 커지는 것 같다. 다양한 물체를 다루거나 여러 task를 하나의 모델로 수행하거나, 예상하지 못한 상황에 대응해야 할수록 사람이 직접 rule을 만드는 방식에는 한계가 생길 수밖에 없다. 그래서 앞으로 Physical AI 연구에서는 단순히 잘 정리된 benchmark에서 높은 성능을 내는 것보다 실제 환경에서 얼마나 버틸 수 있는지가 더 중요하지 않을까 하는 생각이 들었다. 실제 환경에서는 물체 위치도 달라질 수 있고, 로봇이 조금 흔들릴 수도 있으며, 카메라에 물체가 가려지거나 예상하지 못한 상황이 계속 발생할 수 있기 때문이다.


셋째 날에는 NVIDIA Isaac Sim을 활용해 simulation 환경을 직접 구성해보았다.
중력, 질량, 마찰력, collision 등의 물리 속성을 직접 설정해보고, 그에 따라 물체가 어떻게 움직이는지 확인했다. 이후에는 Isaac Sim 안에 구현된 LeKiwi를 직접 teleoperation하면서 simulation 상에서 데이터를 수집해보았다. 그동안 simulator라고 하면 이미 잘 만들어져 있는 가상환경 안에서 로봇을 실행하는 정도로 생각했는데, 실제로는 현실 세계와 비슷한 환경을 만들기 위해 상당히 많은 것을 직접 정의해야 했다. 물체의 질량이나 마찰계수, joint, 좌표계, collision 등을 제대로 설정하지 않으면 우리가 생각하는 것처럼 자연스럽게 움직이지 않았다. 결국 현실을 simulation으로 옮기는 것 자체가 하나의 큰 문제이며 따라서 Sim2Real이 왜 어려운지에 대해서도 어느정도 알 수 있는 계기가 되었다. 기존에는 누군가 만들어놓은 dataset을 받아서 모델을 학습하고 성능을 비교하는 경우가 대부분이었다면, Physical AI에서는 사람이 로봇을 어떻게 움직이는지, 어떤 상태에서 데이터를 수집하는지, 환경을 어떻게 구성하는지 자체가 이미 모델의 성능을 결정하는 중요한 요소였다.


결국 이번 교육을 통해 Physical AI에서는 모델 구조뿐 아니라 데이터 수집, 환경 설계, 제어 방식, 실패 상황에 대한 대응까지 전체 시스템을 함께 고려해야 한다는 것을 알 수 있었으며. 앞으로 관련 연구를 바라볼 때에도 단순히 benchmark 성능만 보는 것이 아니라, 실제 환경에서 어떤 데이터를 사용했고 어떠한 변화를 견딜 수 있는지까지 함께 살펴보는 것이 중요하겠다라고 생각 할 수 있었다.


(2) 본인 연구와의 연관성 및 추후 해결해보고 싶은 연구 질문

요근래 가지고 있었던 하나의 질문이 있었다. 나는 현재 Diffusion inverse problem을 연구하고 있는데, invere problem에서는 관측값이 불완전하거나 손상되어 있는 상황에서 prior를 이용해 원본을 복원하려고 한다. 그렇다면 이런 관점을 Physical AI에서 바라보면 어떻게 생각해볼 수 있을까?


자세한 예시는 아래와 같다.

가령, VLA가 컵을 집어서 다른곳을 옮겨라라는 task를 잘 수행한다고 하자. 그런데 컵의 손잡이나 물체의 일부가 다른 무언가에 의해 가려져 있다면 어떨까? 사람은 컵의 전체 모습을 보지 못하더라도 지금까지의 경험을 바탕으로 대략적인 형태를 예상하고 행동할 수 있다. 그렇다면 VLA 역시 현재 관측된 정보만을 그대로 이용하는 것이 아니라, 모델이 학습하면서 얻은 prior를 통해 보이지 않는 상태를 어느 정도 추론하면서 행동할 수 있어야 하지 않을까라는 예시이다. 물론 이것을 단순히 diffusion inverse problem과 같은 문제라고 말하기는 어렵다. image에 대해서 inverse problem를 해결하는 과정은 손상된 measurement로부터 clean image를 복원하는 것이 주된 목표지만, Physical AI에서는 상태를 추론하는 것에서 끝나지 않고 실제 action까지 이어져야 한다. 더 어려운 점은 잘못된 action이 다음 observation 자체를 바꿔버린다는 것이다. 그럼에도 내가 흥미롭게 느끼는 공통점은 불완전한 관측과 prior를 함께 이용해 보이지 않는 상태를 추론한다는 점이다.


따라서 앞으로 조금 더 고민해보고 싶은 질문은 다음과 같다.

부분적으로 관측되거나 가려진 환경에서, Physical AI가 학습한 prior와 현재의 observation을 함께 이용하면 VLA가 더 강건하게 행동할 수 있을까?  아직은 상당히 막연한 아이디어이고 실제 연구 문제로 만들기 위해서는 많은 간극을 메워야 할 것이다. 하지만 이러한 부분까지 잘 수행한다면 우리는 미래에 더욱 더 로봇이 우리의 일상에 녹아들 것이며 이번 교육에서 실제 로봇이 작은 환경 변화에도 쉽게 실패하는 모습을 보며 내가 연구하고 있는 분야와 Physical AI 사이에 많은 접점이 있을 수 있겠다라고 생각해볼 수 있었다. 이번 교육을 계기로 이 질문을 하나의 열린 연구 질문으로 남겨두고, 앞으로 조금씩 구체화해보고 싶다.


(3) 감사의 인사

마지막으로 이런 좋은 교육 기회를 만들어주신 교수님과 종국이 형에게 감사의 말씀을 전하고 싶다. 특히 해외 학회에서 직접 Physical AI 분야의 흐름과 중요성을 경험하고 돌아온 뒤, 단순히 요즘 이 분야가 중요하다라고 이야기하는 것에서 끝나는 것이 아닌 실제로 연구실 학생들과 후배들이 직접 경험할 수 있도록 교육까지 연결한 모습은 너무나 존경스러운 모습이었다. 사실 연구를 하다 보면 내 연구 하나를 따라가는 것만으로도 벅찰 때가 많은데, 새로운 흐름을 계속 공부하고 그것을 주변 사람들에게 전달하며 함께 성장할 수 있는 기회를 만든다는 것은 쉽지 않은 일이라 생각한다. 나도 언젠가는 후배들에게 내가 전해 받은 선한 영향을 물려줄 수 있는 그러한 사람이 되고 싶다.

좋은 양질의 교육을 진행해주신 로보시지 관계자들에게도 감사드리고, 교육이 원할하게 진행될 수 있도록 준비하고 도와준 연구실 선배들과 동기들에게도 고마운 마음을 전하며 이번 교육 후기를 마친다.