SFT 데이터 파이프라인
SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.
원천 수집부터 스키마, 중복 제거, 오염 방지, 사람 감사, 캘리브레이션과 불변 내보내기를 설계합니다.
01
문제 정의
좋아 보이는 예시를 모으는 방식은 오류와 편향의 출처를 설명하지 못합니다.
학습·평가·양자화 캘리브레이션 데이터가 섞이면 성능 변화의 원인을 재현할 수 없습니다.
- 반복 가능한 지시 행동을 모델에 내재화해야 할 때
- 데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때
- 문제의 본질이 최신 지식 검색일 때
- 정답 스키마와 사람 감사 기준이 합의되지 않았을 때
SFT 데이터 파이프라인 시스템 플레이트
- 01
1단계
행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
- 02
2단계
정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
- 03
3단계
사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
- 04
4단계
학습·평가·캘리브레이션 분할을 불변 매니페스트로 묶고 모델과 연결합니다.
- 작업은 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.에서 시작합니다.
- 스키마 통과·거부 분포을 통해 수용 여부를 결정합니다.
03
설계 방법
SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.
- 01
1단계
행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
- 02
2단계
정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
- 03
3단계
사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
- 04
4단계
학습·평가·캘리브레이션 분할을 불변 매니페스트로 묶고 모델과 연결합니다.
04
적용 시나리오
반복 가능한 지시 행동을 모델에 내재화해야 할 때
좋아 보이는 예시를 모으는 방식은 오류와 편향의 출처를 설명하지 못합니다.
- APPROACH
- 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
- BOUNDARY
- 대량 생성 건수는 품질 근거로 사용하지 않습니다.
데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때
학습·평가·양자화 캘리브레이션 데이터가 섞이면 성능 변화의 원인을 재현할 수 없습니다.
- APPROACH
- 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
- BOUNDARY
- 사람 감사 없이 자동 점수만으로 출시하지 않습니다.
05
설계 선택
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 반복 가능한 지시 행동을 모델에 내재화해야 할 때 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 대량 생성 건수는 품질 근거로 사용하지 않습니다. | 스키마 통과·거부 분포 |
| 데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 사람 감사 없이 자동 점수만으로 출시하지 않습니다. | 중복·오염 검사 결과 |
SFT 데이터 파이프라인 시스템 플레이트
| Item | 방법 | 증거 | 경계 |
|---|---|---|---|
| 계층 1 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 스키마 통과·거부 분포 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
| 계층 2 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 중복·오염 검사 결과 | 사람 감사 없이 자동 점수만으로 출시하지 않습니다. |
| 계층 3 | 사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다. | 감사자 합의와 회귀 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
- 작업은 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.에서 시작합니다.
- 스키마 통과·거부 분포을 통해 수용 여부를 결정합니다.
07
검증 계획
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 스키마 통과·거부 분포 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
| 중복·오염 검사 결과 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 감사자 합의와 회귀 | 사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
08
한계와 실패 조건
문제의 본질이 최신 지식 검색일 때
대량 생성 건수는 품질 근거로 사용하지 않습니다.
정답 스키마와 사람 감사 기준이 합의되지 않았을 때
사람 감사 없이 자동 점수만으로 출시하지 않습니다.
09
협업 방식
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
스키마 통과·거부 분포 - 02
설계
Patty정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
Client소유자와 수용 기준을 확정합니다.
중복·오염 검사 결과 - 03
검증
Patty사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
Client운영 전환 또는 중단 결정을 내립니다.
감사자 합의와 회귀
10
남는 산출물
- SFT 데이터 파이프라인 의사결정 기록
- SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 스키마 통과·거부 분포 · 중복·오염 검사 결과 · 감사자 합의와 회귀공동 관리
- 운영·복구 런북
- 대량 생성 건수는 품질 근거로 사용하지 않습니다. · 사람 감사 없이 자동 점수만으로 출시하지 않습니다.운영 조직 소유
11
용어
- SFT 데이터 파이프라인
- 원천 수집부터 스키마, 중복 제거, 오염 방지, 사람 감사, 캘리브레이션과 불변 내보내기를 설계합니다.
- 수용 기준
- 스키마 통과·거부 분포
- 운영 경계
- 대량 생성 건수는 품질 근거로 사용하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- TRL SFT Trainer
방법과 용어를 확인하기 위한 1차 자료입니다.
- Hugging Face Datasets
방법과 용어를 확인하기 위한 1차 자료입니다.