RL rollout 가속
기술 개요
강화학습 학습 루프에서 샘플 생성(rollout)을 추론 문제로 다뤄 가속하는 역량. 버스트 스케줄링, 프리픽스 공유 샘플 그룹, straggler 완화를 포함합니다.
도입 배경
RL 튜닝의 벽시계 시간 대부분이 학습이 아니라 롤아웃입니다. 롤아웃이 느리면 실험 횟수가 줄고, 실험이 적으면 모델이 나빠집니다.
구현 및 검증
vLLM 기반 롤아웃 풀에 버스트 스케줄링을 적용해, 학습 스텝 사이의 유휴 GPU를 샘플 생성에 재활용합니다.
같은 프롬프트 그룹의 샘플들이 프리픽스를 공유하게 만들어 GRPO 그룹 샘플링 비용을 줄입니다.
straggler(느린 샘플)를 조기 감지·재스케줄해 전체 배치가 꼬리 샘플에 끌려가지 않게 합니다.
검증 근거
아키텍처vLLM 기반 burst-scheduled rollout pool
방법론prefix-shared sample grouping — GRPO 그룹 비용 절감
방법론straggler 조기 재스케줄 정책