Hierarchical Learning for Offline Goal-Conditioned RL
- 2026년 8월 7일 오전 8:54
- 조회수: 14
INFORMATION
- 2026년 8월 7일
- 오전 12시 ~
온라인 비디오 시청 (YouTube)
발표자:
장성인
장성인
TOPIC
Hierarchical Learning for Offline Goal-Conditioned RL
On-Line Video
OVERVIEW
목표조건부 강화학습(Goal-Conditioned RL, GCRL)은 일반 강화학습에 목표(goal) 정보를 함께 제공하여, 보상이 없는 방대한 오프라인 데이터로부터도 목표에 도달하는 행동을 스스로 학습할 수 있게 하는 강화학습의 한 계열이다. 그러나 목표까지의 거리가 먼 장기적(long-horizon) 상황에서는 정확한 가치 추정이 어려워 학습이 쉽지 않았고, 이를 극복하기 위해 최종 목표 이전에 거쳐야 할 부분목표(subgoal)를 활용하는 방법이 제안되었다. 이러한 부분목표 활용 기술 중 하나로 계층적 강화학습(Hierarchical RL)이 등장하였으며, 이를 오프라인 GCRL에 적용한 초기 알고리즘이 제안되었다. 이와 함께 이러한 계층적 알고리즘들을 표준화된 환경에서 공정하게 비교·평가할 수 있는 벤치마크의 필요성이 대두되었고, 이후 계층적 구조를 적용하더라도 여전히 장기 과제에서 나타나는 성능 한계를 분석하고 개선하려는 후속 연구가 이어졌다. 본 세미나에서는 GCRL이 계층적 학습을 통해 장기 과제의 한계를 극복해 나간 이러한 초기 연구들을 소개한다.
참고자료:
[1] Park, S., Ghosh, D., Eysenbach, B., & Levine, S. (2023). Hiql: Offline goal-conditioned rl with latent states as actions. Advances in Neural Information Processing Systems, 36, 34866-34891.
[2] Park, S., Frans, K., Eysenbach, B., & Levine, S. (2025, May). Ogbench: Benchmarking offline goal-conditioned rl. In International Conference on Learning Representations (Vol. 2025, pp. 94937-94982).
[3] Ahn, H., Choi, H., Han, J., & Moon, T. (2026). Option-aware temporally abstracted value for offline goal-conditioned reinforcement learning. Advances in Neural Information Processing Systems, 38, 99833-99861.
[2] Park, S., Frans, K., Eysenbach, B., & Levine, S. (2025, May). Ogbench: Benchmarking offline goal-conditioned rl. In International Conference on Learning Representations (Vol. 2025, pp. 94937-94982).
[3] Ahn, H., Choi, H., Han, J., & Moon, T. (2026). Option-aware temporally abstracted value for offline goal-conditioned reinforcement learning. Advances in Neural Information Processing Systems, 38, 99833-99861.