사전학습 & CPT

추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.

도메인 코퍼스 진단부터 혼합, 토크나이저, 분산 실행, 체크포인트와 서빙 수용까지 이어지는 CPT 설계 역량입니다.

§ 01

문제 정의

사전학습 & CPT이 필요한 운영 조건

일반 모델이 조직의 용어와 문서 분포를 안정적으로 다루지 못해도 CPT가 항상 정답은 아닙니다. 먼저 검색, SFT, 프롬프트 설계로 해결 가능한지 분리해야 합니다.

학습 데이터의 작은 편향도 장기 기억과 지시 따르기, 안전 동작에 동시에 영향을 줍니다. 실행 비용보다 잘못된 학습 방향을 늦게 발견하는 비용이 더 큽니다.

  • 도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때
  • 기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때
  • 업데이트가 잦고 출처 인용이 핵심이면 RAG가 먼저일 때
  • 대표 평가와 되돌릴 체크포인트를 준비할 수 없을 때
PLATE 01

사전학습 & CPT 시스템 플레이트

  1. 01

    1단계

    코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.

  2. 02

    2단계

    도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.

  3. 03

    3단계

    분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.

  4. 04

    4단계

    병합·양자화·서빙 후에도 동일한 대표 과제로 수용 평가를 반복합니다.

사전학습 & CPT의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.에서 시작합니다.
  2. 도메인·일반 능력 회귀을 통해 수용 여부를 결정합니다.

§ 03

설계 방법

구현보다 먼저 경계와 수용 기준을 고정합니다.

추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.

  1. 01

    1단계

    코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.

    검토 산출물 1
  2. 02

    2단계

    도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.

    검토 산출물 2
  3. 03

    3단계

    분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.

    검토 산출물 3
  4. 04

    4단계

    병합·양자화·서빙 후에도 동일한 대표 과제로 수용 평가를 반복합니다.

    검토 산출물 4

§ 04

적용 시나리오

가상의 업무 조건으로 적용 범위를 확인합니다.

가상 적용 시나리오

도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때

일반 모델이 조직의 용어와 문서 분포를 안정적으로 다루지 못해도 CPT가 항상 정답은 아닙니다. 먼저 검색, SFT, 프롬프트 설계로 해결 가능한지 분리해야 합니다.

APPROACH
코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.
BOUNDARY
코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.
가상 적용 시나리오

기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때

학습 데이터의 작은 편향도 장기 기억과 지시 따르기, 안전 동작에 동시에 영향을 줍니다. 실행 비용보다 잘못된 학습 방향을 늦게 발견하는 비용이 더 큽니다.

APPROACH
도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.
BOUNDARY
공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.

§ 05

설계 선택

이득과 비용을 같은 표에서 검토합니다.

DecisionGainCostWatch
도메인 언어와 지식의 반복적 공백이 검색만으로 해결되지 않을 때코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.도메인·일반 능력 회귀
기반 모델의 소유·배포 경계를 포함한 장기 모델 전략이 있을 때도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.토큰 효율과 학습 안정성
PLATE 02

사전학습 & CPT 시스템 플레이트

Record방법수용 증거
R-1코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.도메인·일반 능력 회귀
R-2도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.토큰 효율과 학습 안정성
R-3분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.배포 형태의 수용 결과
사전학습 & CPT의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.에서 시작합니다.
  2. 도메인·일반 능력 회귀을 통해 수용 여부를 결정합니다.

§ 07

검증 계획

성과 수치보다 먼저 측정 조건을 합의합니다.

MeasureMethodPass conditionCaveat
도메인·일반 능력 회귀코퍼스의 중복, 시점, 권리, 언어 분포를 진단하고 학습 가능 범위를 고정합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.
토큰 효율과 학습 안정성도메인·일반·리플레이 혼합 비율을 가설로 두고 작은 런에서 망각과 손실 변화를 비교합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족
배포 형태의 수용 결과분산 실행과 체크포인트를 재현 가능한 구성으로 고정하고 단계별 중단 기준을 둡니다.도입 검토에서 합의한 기준을 반복 측정으로 충족

§ 08

한계와 실패 조건

적용하지 말아야 할 조건도 설계의 일부입니다.

업데이트가 잦고 출처 인용이 핵심이면 RAG가 먼저일 때

코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.

대표 평가와 되돌릴 체크포인트를 준비할 수 없을 때

공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.

§ 10

남는 산출물

프로젝트가 끝나도 운영 조직에 남아야 합니다.

사전학습 & CPT 의사결정 기록
추가 학습은 더 많은 토큰을 넣는 일이 아니라, 무엇을 기억하고 무엇을 잊지 않을지 통제하는 작업입니다.고객 소유 · Patty 검토
검증 하네스와 수용 기준
도메인·일반 능력 회귀 · 토큰 효율과 학습 안정성 · 배포 형태의 수용 결과공동 관리
운영·복구 런북
코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다. · 공개되지 않은 비교 점수나 하드웨어 조건 없는 처리량을 성과로 제시하지 않습니다.운영 조직 소유

§ 11

용어

같은 단어를 같은 운영 의미로 사용합니다.

사전학습 & CPT
도메인 코퍼스 진단부터 혼합, 토크나이저, 분산 실행, 체크포인트와 서빙 수용까지 이어지는 CPT 설계 역량입니다.
수용 기준
도메인·일반 능력 회귀
운영 경계
코퍼스 권리와 계보가 불명확하면 학습 범위를 확장하지 않습니다.

REFERENCES

참고 문헌과 1차 자료

  1. Hugging Face 언어 모델링

    방법과 용어를 확인하기 위한 1차 자료입니다.

  2. PEFT LoRA

    방법과 용어를 확인하기 위한 1차 자료입니다.

사전학습 & CPT이 필요한 조건부터 함께 검토하겠습니다.

대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.

기술 검토 요청