기술 역량

SFT 데이터 파이프라인

기술 개요

지도 미세조정(SFT)용 데이터를 만들고 관리하는 엔지니어링. 데이터셋 빌더, 감사 도구, 보정 세트 구축, 중복 제거·클렌징 패스, 버전 있는 익스포트까지를 하나의 체계로 다룹니다.

도입 배경

SFT 결과의 품질은 모델보다 데이터가 결정합니다. 그러나 많은 조직이 "어떤 데이터가 이번 학습에 들어갔는지"조차 답하지 못합니다. 버전 관리되는 데이터 파이프라인이 없으면 회귀가 왔을 때 원인을 찾을 수 없습니다.

구현 및 검증

데이터셋 빌더가 원천 소스 → 스키마 검증 → 중복 제거 → 클렌징 → 버전 익스포트의 흐름을 코드로 실행합니다. 각 단계는 로그와 카운트를 남기므로 "이번 버전에서 무엇이 달라졌는가"가 diff로 보입니다.

보정(calibration) 세트를 AutoRound W4A16 양자화 검증과 연동해 운영합니다. 양자화 전후 성능 저하를 정량 게이트로 통과시켜, 배포되는 모든 모델이 같은 기준을 거칩니다.

검증 근거

아키텍처단계별 로그·카운트가 남는 버전형 SFT 데이터셋 파이프라인
방법론양자화 전후 성능 게이트를 데이터 파이프라인에 내장 (AutoRound W4A16)