학습용 데이터셋 생성
기술 개요
합성 데이터 생성부터 품질 감사, 스크러빙까지. 학습 데이터가 부족하거나 민감해서 확보하기 어려운 영역을 채우는 엔지니어링입니다.
도입 배경
도메인 특화 학습의 가장 큰 병목은 데이터입니다. 특히 규제 산업에서는 실데이터 사용 자체가 어렵습니다. 잘 감사된 합성 데이터는 이 문제의 유일한 실용적 해법입니다.
구현 및 검증
합성 생성 → 자동 감사 → 사람 감사 → PII/도메인 민감 정보 스크러빙 → 스키마 검증 출력의 5단계 흐름을 표준으로 운영합니다.
생성기와 감사기를 분리합니다. 생성에 쓴 프롬프트/모델이 감사에 재사용되지 않도록 격리해, 합성 데이터가 생성기의 맹점을 그대로 물려받지 않게 합니다.
검증 근거
방법론생성-감사-스크러빙 5단계 표준 흐름 + 생성기/감사기 격리 원칙
아키텍처스키마 검증된 데이터셋 출력 — 다운스트림 학습 코드와의 계약