SFT 데이터 파이프라인
SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.
원천 수집부터 스키마, 중복 제거, 오염 방지, 사람 감사, 캘리브레이션과 불변 내보내기를 설계합니다.
§ 01
SFT 데이터 파이프라인이 필요한 운영 조건
좋아 보이는 예시를 모으는 방식은 오류와 편향의 출처를 설명하지 못합니다.
학습·평가·양자화 캘리브레이션 데이터가 섞이면 성능 변화의 원인을 재현할 수 없습니다.
- 반복 가능한 지시 행동을 모델에 내재화해야 할 때
- 데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때
- 문제의 본질이 최신 지식 검색일 때
- 정답 스키마와 사람 감사 기준이 합의되지 않았을 때
SFT 데이터 파이프라인 시스템 플레이트
- 01
1단계
행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
- 02
2단계
정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
- 03
3단계
사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
- 04
4단계
학습·평가·캘리브레이션 분할을 불변 매니페스트로 묶고 모델과 연결합니다.
- 작업은 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.에서 시작합니다.
- 스키마 통과·거부 분포을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.
- 01
1단계
행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
검토 산출물 1 - 02
2단계
정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
검토 산출물 2 - 03
3단계
사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
검토 산출물 3 - 04
4단계
학습·평가·캘리브레이션 분할을 불변 매니페스트로 묶고 모델과 연결합니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
반복 가능한 지시 행동을 모델에 내재화해야 할 때
좋아 보이는 예시를 모으는 방식은 오류와 편향의 출처를 설명하지 못합니다.
- APPROACH
- 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.
- BOUNDARY
- 대량 생성 건수는 품질 근거로 사용하지 않습니다.
데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때
학습·평가·양자화 캘리브레이션 데이터가 섞이면 성능 변화의 원인을 재현할 수 없습니다.
- APPROACH
- 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
- BOUNDARY
- 사람 감사 없이 자동 점수만으로 출시하지 않습니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 반복 가능한 지시 행동을 모델에 내재화해야 할 때 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 대량 생성 건수는 품질 근거로 사용하지 않습니다. | 스키마 통과·거부 분포 |
| 데이터 버전과 모델 버전을 장기간 함께 추적해야 할 때 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 사람 감사 없이 자동 점수만으로 출시하지 않습니다. | 중복·오염 검사 결과 |
SFT 데이터 파이프라인 시스템 플레이트
| Item | 방법 | 증거 | 경계 |
|---|---|---|---|
| 계층 1 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 스키마 통과·거부 분포 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
| 계층 2 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 중복·오염 검사 결과 | 사람 감사 없이 자동 점수만으로 출시하지 않습니다. |
| 계층 3 | 사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다. | 감사자 합의와 회귀 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
- 작업은 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다.에서 시작합니다.
- 스키마 통과·거부 분포을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 스키마 통과·거부 분포 | 행동 단위 스키마와 필수 메타데이터를 원천 수집 전에 정의합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 대량 생성 건수는 품질 근거로 사용하지 않습니다. |
| 중복·오염 검사 결과 | 정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 감사자 합의와 회귀 | 사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
문제의 본질이 최신 지식 검색일 때
대량 생성 건수는 품질 근거로 사용하지 않습니다.
정답 스키마와 사람 감사 기준이 합의되지 않았을 때
사람 감사 없이 자동 점수만으로 출시하지 않습니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
스키마 통과·거부 분포 - 02
설계
Patty정확·근사 중복과 평가 오염을 별도 패스로 검사해 삭제 이유를 남깁니다.
Client소유자와 수용 기준을 확정합니다.
중복·오염 검사 결과 - 03
검증
Patty사람 감사 표본과 피드백을 데이터 규칙으로 되돌려 다음 내보내기에 반영합니다.
Client운영 전환 또는 중단 결정을 내립니다.
감사자 합의와 회귀
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- SFT 데이터 파이프라인 의사결정 기록
- SFT의 품질은 트레이너보다 데이터 계약, 계보, 분할과 출시 게이트에서 결정됩니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 스키마 통과·거부 분포 · 중복·오염 검사 결과 · 감사자 합의와 회귀공동 관리
- 운영·복구 런북
- 대량 생성 건수는 품질 근거로 사용하지 않습니다. · 사람 감사 없이 자동 점수만으로 출시하지 않습니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- SFT 데이터 파이프라인
- 원천 수집부터 스키마, 중복 제거, 오염 방지, 사람 감사, 캘리브레이션과 불변 내보내기를 설계합니다.
- 수용 기준
- 스키마 통과·거부 분포
- 운영 경계
- 대량 생성 건수는 품질 근거로 사용하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- TRL SFT Trainer
방법과 용어를 확인하기 위한 1차 자료입니다.
- Hugging Face Datasets
방법과 용어를 확인하기 위한 1차 자료입니다.
SFT 데이터 파이프라인이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.