사전학습 & CPT
추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.
도메인 코퍼스 진단부터 혼합, 토크나이저, 분산 실행, 체크포인트와 서빙 수용까지 이어지는 CPT 설계 역량입니다.
§ 01
사전학습 & CPT이 필요한 운영 조건
일반 모델이 조직의 용어와 문서 분포를 안정적으로 다루지 못해도 CPT가 항상 정답은 아닙니다. 먼저 검색, SFT, 프롬프트 설계로 해결 가능한지 분리해야 합니다.
학습 데이터의 작은 편향도 장기 기억과 지시 따르기, 안전 동작에 동시에 영향을 줍니다. 실행 비용보다 잘못된 학습 방향을 늦게 발견하는 비용이 더 큽니다.
- 도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때
- 기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때
- 업데이트가 잦고 출처 인용이 핵심이면 RAG가 먼저일 때
- 대표 평가와 되돌릴 체크포인트를 준비할 수 없을 때
사전학습 & CPT 시스템 플레이트
- 01
1단계
코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.
- 02
2단계
도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.
- 03
3단계
분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.
- 04
4단계
병합·양자화·서빙 후에도 동일한 대표 과제로 수용 평가를 반복합니다.
- 작업은 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.에서 시작합니다.
- 도메인·일반 능력 회귀을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.
- 01
1단계
코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.
검토 산출물 1 - 02
2단계
도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.
검토 산출물 2 - 03
3단계
분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.
검토 산출물 3 - 04
4단계
병합·양자화·서빙 후에도 동일한 대표 과제로 수용 평가를 반복합니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때
일반 모델이 조직의 용어와 문서 분포를 안정적으로 다루지 못해도 CPT가 항상 정답은 아닙니다. 먼저 검색, SFT, 프롬프트 설계로 해결 가능한지 분리해야 합니다.
- APPROACH
- 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.
- BOUNDARY
- 코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.
기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때
학습 데이터의 작은 편향도 장기 기억과 지시 따르기, 안전 동작에 동시에 영향을 줍니다. 실행 비용보다 잘못된 학습 방향을 늦게 발견하는 비용이 더 큽니다.
- APPROACH
- 도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.
- BOUNDARY
- 공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때 | 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다. | 코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다. | 도메인·일반 능력 회귀 |
| 기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때 | 도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다. | 공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다. | 토큰 효율과 학습 안정성 |
사전학습 & CPT 시스템 플레이트
| Record | 방법 | 수용 증거 |
|---|---|---|
| R-1 | 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다. | 도메인·일반 능력 회귀 |
| R-2 | 도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다. | 토큰 효율과 학습 안정성 |
| R-3 | 분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다. | 배포 형태의 수용 결과 |
- 작업은 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.에서 시작합니다.
- 도메인·일반 능력 회귀을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 도메인·일반 능력 회귀 | 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다. |
| 토큰 효율과 학습 안정성 | 도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 배포 형태의 수용 결과 | 분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
업데이트가 잦고 출처 인용이 핵심이면 RAG가 먼저일 때
코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.
대표 평가와 되돌릴 체크포인트를 준비할 수 없을 때
공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
도메인·일반 능력 회귀 - 02
설계
Patty도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.
Client소유자와 수용 기준을 확정합니다.
토큰 효율과 학습 안정성 - 03
검증
Patty분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.
Client운영 전환 또는 중단 결정을 내립니다.
배포 형태의 수용 결과
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- 사전학습 & CPT 의사결정 기록
- 추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 도메인·일반 능력 회귀 · 토큰 효율과 학습 안정성 · 배포 형태의 수용 결과공동 관리
- 운영·복구 런북
- 코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다. · 공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- 사전학습 & CPT
- 도메인 코퍼스 진단부터 혼합, 토크나이저, 분산 실행, 체크포인트와 서빙 수용까지 이어지는 CPT 설계 역량입니다.
- 수용 기준
- 도메인·일반 능력 회귀
- 운영 경계
- 코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- Hugging Face 언어 모델링
방법과 용어를 확인하기 위한 1차 자료입니다.
- PEFT LoRA
방법과 용어를 확인하기 위한 1차 자료입니다.
사전학습 & CPT이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.