강화학습 정렬 GRPO · RLHF
정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.
과제 적합성, rollout, 보상 설계, GRPO·RLHF 선택, reward hacking과 평가·복구를 함께 설계합니다.
§ 01
강화학습 정렬 GRPO · RLHF이 필요한 운영 조건
정답을 자동 검증할 수 없는 과제에 불안정한 보상을 적용하면 모델은 의도보다 점수의 허점을 학습합니다.
rollout 처리량을 높여도 정책 버전과 표본 품질이 섞이면 학습 결과를 설명할 수 없습니다.
- 결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때
- SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때
- 보상 함수가 사람의 실제 판단을 대표하지 못할 때
- rollout 비용과 실패 복구 범위를 통제할 수 없을 때
강화학습 정렬 GRPO · RLHF 시스템 플레이트
- 01
상태 1
과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
- 02
상태 2
rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- 03
상태 3
보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
- 04
상태 4
held-out 행동 평가와 체크포인트 승격·롤백을 하나의 릴리스 게이트로 둡니다.
FEEDBACK수용 기준을 통과하지 못한 증거는 첫 통제 단계로 돌아갑니다: 유효 rollout 비율.
- 작업은 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.에서 시작합니다.
- 유효 rollout 비율을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.
- 01
1단계
과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
검토 산출물 1 - 02
2단계
rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
검토 산출물 2 - 03
3단계
보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
검토 산출물 3 - 04
4단계
held-out 행동 평가와 체크포인트 승격·롤백을 하나의 릴리스 게이트로 둡니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때
정답을 자동 검증할 수 없는 과제에 불안정한 보상을 적용하면 모델은 의도보다 점수의 허점을 학습합니다.
- APPROACH
- 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.
- BOUNDARY
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때
rollout 처리량을 높여도 정책 버전과 표본 품질이 섞이면 학습 결과를 설명할 수 없습니다.
- APPROACH
- rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- BOUNDARY
- 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 결과 또는 과정의 품질을 반복 가능한 보상으로 판정할 수 있을 때 | 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다. | 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. | 유효 rollout 비율 |
| SFT 이후의 행동 차이를 명확한 held-out 평가로 확인할 수 있을 때 | rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다. | 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다. | 보상-사람 판단 일치 |
강화학습 정렬 GRPO · RLHF 시스템 플레이트
- 보상 함수가 사람의 실제 판단을 대표하지 못할 때
보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
- SIGNAL
- 유효 rollout 비율
- MITIGATION
- rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
- rollout 비용과 실패 복구 범위를 통제할 수 없을 때
비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
- SIGNAL
- 보상-사람 판단 일치
- MITIGATION
- 보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
- 작업은 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다.에서 시작합니다.
- 유효 rollout 비율을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 유효 rollout 비율 | 과제를 결과 검증형, 과정 검증형, 선호 판단형으로 나눠 방법 선택을 제한합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. |
| 보상-사람 판단 일치 | rollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| held-out 행동 회귀 | 보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
보상 함수가 사람의 실제 판단을 대표하지 못할 때
보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
rollout 비용과 실패 복구 범위를 통제할 수 없을 때
비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
유효 rollout 비율 - 02
설계
Pattyrollout 그룹의 정책 버전과 초기 상태를 고정해 비교 가능한 표본을 만듭니다.
Client소유자와 수용 기준을 확정합니다.
보상-사람 판단 일치 - 03
검증
Patty보상을 여러 신호로 분해하고 길이·형식·편법 최적화를 별도 실패로 추적합니다.
Client운영 전환 또는 중단 결정을 내립니다.
held-out 행동 회귀
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- 강화학습 정렬 GRPO · RLHF 의사결정 기록
- 정렬 방식은 유행이 아니라 관찰 가능한 행동, 보상 실패와 롤백 경계로 선택해야 합니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 유효 rollout 비율 · 보상-사람 판단 일치 · held-out 행동 회귀공동 관리
- 운영·복구 런북
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다. · 비교 가능한 정책 버전이 없는 표본은 학습·평가에서 제외합니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- 강화학습 정렬 GRPO · RLHF
- 과제 적합성, rollout, 보상 설계, GRPO·RLHF 선택, reward hacking과 평가·복구를 함께 설계합니다.
- 수용 기준
- 유효 rollout 비율
- 운영 경계
- 보상 상승을 안전성이나 정렬의 완성으로 해석하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- TRL GRPO Trainer
방법과 용어를 확인하기 위한 1차 자료입니다.
- DeepSeekMath
방법과 용어를 확인하기 위한 1차 자료입니다.
강화학습 정렬 GRPO · RLHF이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.