기술 역량

학습용 데이터셋 생성

기술 개요

합성 데이터 생성부터 품질 감사, 스크러빙까지. 학습 데이터가 부족하거나 민감해서 확보하기 어려운 영역을 채우는 엔지니어링입니다.

도입 배경

도메인 특화 학습의 가장 큰 병목은 데이터입니다. 특히 규제 산업에서는 실데이터 사용 자체가 어렵습니다. 잘 감사된 합성 데이터는 이 문제의 유일한 실용적 해법입니다.

구현 및 검증

합성 생성 → 자동 감사 → 사람 감사 → PII/도메인 민감 정보 스크러빙 → 스키마 검증 출력의 5단계 흐름을 표준으로 운영합니다.

생성기와 감사기를 분리합니다. 생성에 쓴 프롬프트/모델이 감사에 재사용되지 않도록 격리해, 합성 데이터가 생성기의 맹점을 그대로 물려받지 않게 합니다.

검증 근거

방법론생성-감사-스크러빙 5단계 표준 흐름 + 생성기/감사기 격리 원칙
아키텍처스키마 검증된 데이터셋 출력 — 다운스트림 학습 코드와의 계약