강화학습 정렬 GRPO · RLHF
정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.
과제 적합성, rollout, 보상 설계, GRPO·RLHF 선택, reward hacking과 평가·복구를 함께 설계합니다.
01
문제 정의
정답을 자동 검증할 수 없는 과제에 불안정한 보상을 적용하면 모델은 의도보다 점수의 허점을 학습합니다.
rollout 처리량을 높여도 정책 버전과 표본 품질이 섞이면 학습 결과를 설명할 수 없습니다.
- 결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때
- SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때
- 보상 함수가 사람의 실제 판단을 대표하지 못할 때
- rollout 비용과 실패 복구 범위를 통제할 수 없을 때
강화학습 정렬 GRPO · RLHF 시스템 플레이트
- 01
상태 1
과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
- 02
상태 2
rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- 03
상태 3
보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
- 04
상태 4
held-out 행동 평가와 체크포인트 승격·롤백을 하나의 릴리스 게이트로 둡니다.
FEEDBACK수용 기준을 통과하지 못한 증거는 첫 통제 단계로 돌아갑니다: 유효 rollout 비율.
- 작업은 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.에서 시작합니다.
- 유효 rollout 비율을 통해 수용 여부를 결정합니다.
03
설계 방법
정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.
- 01
1단계
과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
- 02
2단계
rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- 03
3단계
보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
- 04
4단계
held-out 행동 평가와 체크포인트 승격·롤백을 하나의 릴리스 게이트로 둡니다.
04
적용 시나리오
결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때
정답을 자동 검증할 수 없는 과제에 불안정한 보상을 적용하면 모델은 의도보다 점수의 허점을 학습합니다.
- APPROACH
- 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
- BOUNDARY
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때
rollout 처리량을 높여도 정책 버전과 표본 품질이 섞이면 학습 결과를 설명할 수 없습니다.
- APPROACH
- rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- BOUNDARY
- 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
05
설계 선택
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때 | 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다. | 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. | 유효 rollout 비율 |
| SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때 | rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다. | 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다. | 보상-사람 판단 일치 |
강화학습 정렬 GRPO · RLHF 시스템 플레이트
- 보상 함수가 사람의 실제 판단을 대표하지 못할 때
보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
- SIGNAL
- 유효 rollout 비율
- MITIGATION
- rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- rollout 비용과 실패 복구 범위를 통제할 수 없을 때
비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
- SIGNAL
- 보상-사람 판단 일치
- MITIGATION
- 보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
- 작업은 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.에서 시작합니다.
- 유효 rollout 비율을 통해 수용 여부를 결정합니다.
07
검증 계획
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 유효 rollout 비율 | 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. |
| 보상-사람 판단 일치 | rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| held-out 행동 회귀 | 보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
08
한계와 실패 조건
보상 함수가 사람의 실제 판단을 대표하지 못할 때
보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
rollout 비용과 실패 복구 범위를 통제할 수 없을 때
비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
09
협업 방식
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
유효 rollout 비율 - 02
설계
Pattyrollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
Client소유자와 수용 기준을 확정합니다.
보상-사람 판단 일치 - 03
검증
Patty보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
Client운영 전환 또는 중단 결정을 내립니다.
held-out 행동 회귀
10
남는 산출물
- 강화학습 정렬 GRPO · RLHF 의사결정 기록
- 정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 유효 rollout 비율 · 보상-사람 판단 일치 · held-out 행동 회귀공동 관리
- 운영·복구 런북
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. · 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.운영 조직 소유
11
용어
- 강화학습 정렬 GRPO · RLHF
- 과제 적합성, rollout, 보상 설계, GRPO·RLHF 선택, reward hacking과 평가·복구를 함께 설계합니다.
- 수용 기준
- 유효 rollout 비율
- 운영 경계
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- TRL GRPO Trainer
방법과 용어를 확인하기 위한 1차 자료입니다.
- DeepSeekMath
방법과 용어를 확인하기 위한 1차 자료입니다.