- 2026년 8월 7일 오전 8:54
- 조회수: 206
INFORMATION
- 2026년 8월 7일
- 오전 12시 ~
온라인 비디오 시청 (YouTube)
장성인
TOPIC
On-Line Video
OVERVIEW
목표조건부 강화학습(Goal-Conditioned RL, GCRL)은 일반 강화학습에 목표(goal) 정보를 함께 제공하여, 보상이 없는 방대한 오프라인 데이터로부터도 목표에 도달하는 행동을 스스로 학습할 수 있게 하는 강화학습의 한 계열이다. 그러나 목표까지의 거리가 먼 장기적(long-horizon) 상황에서는 정확한 가치 추정이 어려워 학습이 쉽지 않았고, 이를 극복하기 위해 최종 목표 이전에 거쳐야 할 부분목표(subgoal)를 활용하는 방법이 제안되었다. 이러한 부분목표 활용 기술 중 하나로 계층적 강화학습(Hierarchical RL)이 등장하였으며, 이를 오프라인 GCRL에 적용한 초기 알고리즘이 제안되었다. 이와 함께 이러한 계층적 알고리즘들을 표준화된 환경에서 공정하게 비교·평가할 수 있는 벤치마크의 필요성이 대두되었고, 이후 계층적 구조를 적용하더라도 여전히 장기 과제에서 나타나는 성능 한계를 분석하고 개선하려는 후속 연구가 이어졌다. 본 세미나에서는 GCRL이 계층적 학습을 통해 장기 과제의 한계를 극복해 나간 이러한 초기 연구들을 소개한다.
[2] Park, S., Frans, K., Eysenbach, B., & Levine, S. (2025, May). Ogbench: Benchmarking offline goal-conditioned rl. In International Conference on Learning Representations (Vol. 2025, pp. 94937-94982).
[3] Ahn, H., Choi, H., Han, J., & Moon, T. (2026). Option-aware temporally abstracted value for offline goal-conditioned reinforcement learning. Advances in Neural Information Processing Systems, 38, 99833-99861.
청취자 후기
김성범 교수님
이번 발표는 offline goal-conditioned reinforcement learning(GCRL)의 기본 개념에서 출발하여, long-horizon 문제를 해결하기 위한 HIQL(hierarchical implicit Q-learning)의 구조와 한계, 그리고 이를 평가하기 위한 OGBench, 나아가 HIQL의 high-level policy 문제를 보완하기 위한 OTA(option-aware temporally abstracted value)까지 연결하여 설명한 발표였습니다.
이후 offline GCRL에서는 미리 수집된 데이터만을 이용하기 때문에 환경과 추가적으로 상호작용하지 않고 policy를 학습할 수 있다는 장점이 있지만, 먼 goal일수록 value function의 추정 noise가 커지고 이를 online interaction을 통해 교정할 수 없다는 문제가 있음을 설명하였습니다. 이를 해결하기 위한 HIQL에서는 policy를 high-level policy와 low-level policy로 나누어, high-level policy가 intermediate subgoal을 제시하고 low-level policy가 해당 subgoal까지 도달하기 위한 실제 action을 선택하도록 구성합니다. 즉 먼 목표에 대해 매 순간 직접 primitive action을 결정하는 대신, 먼저 적절한 중간 목표를 정하고 가까운 목표에 대한 행동을 수행하도록 문제를 계층적으로 분해한 것입니다.
발표에서는 HIQL이 state-based 및 pixel-based benchmark에서 기존 방법보다 좋은 성능을 보였고, 일부 trajectory에만 action label이 존재하는 경우에도 높은 성능을 유지한다는 실험 결과를 소개하였습니다. 또한 기존 offline GCRL 연구를 보다 체계적으로 평가하기 위한 OGBench를 소개하고, 새로운 benchmark에서는 HIQL이 특히 매우 긴 long-horizon 환경에서 성능이 저하될 수 있음을 보여주었습니다. 이후 이러한 성능 저하의 주요 원인이 high-level policy의 subgoal selection에 있음을 분석하고, 여러 primitive action을 하나의 option 단위로 묶어 temporal abstraction을 수행하는 OTA가 보다 안정적으로 subgoal을 제시하여 long-horizon 성능을 향상시키는 흐름으로 발표를 마무리하였습니다.
전체적으로 일반 reinforcement learning과 goal-conditioned RL의 차이를 구체적인 예제를 통해 설명한 부분이 훌륭했습니다. 강화학습을 처음 접하는 사람에게는 “goal이 추가된다”는 설명만으로는 두 방법의 차이가 명확하지 않을 수 있는데, 트럭이 특정 목적지까지 이동하는 예시와 reward의 의미를 함께 보여줌으로써 GCRL의 개념을 매우 직관적으로 전달하였습니다. 또한 모든 슬라이드는 아니지만 주요 슬라이드를 질문으로 시작하여, 해당 슬라이드에서 무엇을 설명하려는지 청중에게 먼저 생각하게 한 구성도 좋았습니다. 다만 질문을 제시한 뒤 다음 슬라이드로 넘어가는 과정에서 이전 내용과의 연결이 충분히 설명되지 않아 전체 흐름이 다소 끊기는 느낌이 있었습니다. 각 질문이 왜 다음 내용으로 이어지는지를 한두 문장으로 연결해 주면 발표가 훨씬 자연스러워질 것 같습니다.
또한 실험 결과는 마우스 포인터를 활용하여 현재 어느 부분을 설명하고 있는지를 명확히 보여줄 필요가 있습니다. 예를 들어 high-level/low-level policy 구조를 설명할 때에는 현재 state, subgoal, final goal을 차례로 가리키면서 설명하고, 실험 테이블에서는 모든 숫자를 읽기보다는 비교하려는 baseline과 HIQL의 결과를 직접 가리키면서 왜 이 결과가 중요한지를 설명하는 것이 좋겠습니다. OGBench나 OTA 결과와 같이 여러 환경과 여러 막대가 함께 표시된 그림 역시 축과 비교 대상을 먼저 설명한 후 핵심 결과를 천천히 짚어주면 좋을 것 같습니다.
마지막으로 논문이나 슬라이드에 쓰인 표현을 그대로 읽거나 인용하여 설명하기보다는, 내용을 충분히 이해한 뒤 자신의 언어로 다시 설명하는 연습을 하면 발표가 더욱 자연스럽고 설득력 있게 전달될 것입니다.
직관적인 이해가 어려운 reinforcement learning 내용을 다양한 예제와 그림을 이용하여 이해하기 쉽게 정리하려고 노력한 점은 좋습니다. 앞으로는 슬라이드 간 질문과 답을 보다 자연스럽게 연결하고, 그림과 표를 보다 포인터를 이용해 자세하고 친절하게 설명하며, 논문의 문장을 전달하는 것보다 본인이 이해한 내용을 자신의 언어로 풀어 설명하는 데 집중한다면 훨씬 완성도 높은 발표가 될 것 같습니다. 수고했습니다!