기술 역량

강화학습 정렬 GRPO · RLHF

기술 개요

모델의 행동을 의도한 방향으로 정렬하는 강화학습 단계. 행동 하네스 데이터셋 큐레이션 → 롤아웃 생성 → 보상 신호 설계까지 포함합니다.

도입 배경

엔터프라이즈 AI는 "똑똑한" 것보다 "올바른" 것이 중요합니다. 출력 형식, 거절 기준, 어조가 조직 정책을 따르려면 선호 최적화가 필요하고, 선호 최적화의 품질은 보상 설계와 롤아웃 인프라가 결정합니다.

구현 및 검증

GRPO(그룹 상대 정책 최적화)를 중심으로 추론형 모델을 강화학습 튜닝합니다. 그룹 단위 비교로 value 네트워크 없이도 안정적인 학습 신호를 얻습니다.

롤아웃(샘플 생성)을 추론 문제로 취급하는 전용 가속 인프라를 붙입니다. 프리픽스 공유 샘플 그룹과 버스트 스케줄링으로 RL 사이클의 벽시계 시간을 직접 줄입니다.

표준 JSONL 익스포트 형식으로 행동 데이터를 관리해, 재현 가능한 exporter 설계를 유지합니다.

검증 근거

방법론SFT → GRPO 순차 파이프라인과 각 단계별 평가 게이트 운영
아키텍처vLLM 기반 RL 롤아웃 가속 인프라 — 샘플 생성 병목 해소
방법론표준 JSONL 행동 데이터 익스포트 형식 + 재현 가능 exporter