모델 평가 & 레드팀
평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.
기능 품질, 안전, 보안, 편향과 도구 사용 실패를 위협 모델과 증거 기반 릴리스 게이트로 관리합니다.
§ 01
모델 평가 & 레드팀이 필요한 운영 조건
정상 입력 평균만 보면 희귀하지만 치명적인 실패와 공격 경로가 보이지 않습니다.
레드팀 발견 사항에 소유자와 종료 조건이 없으면 보고서만 남고 위험은 운영으로 넘어갑니다.
- 모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때
- 모델·정책 업데이트마다 위험 회귀를 검증해야 할 때
- 위협 모델과 위험 허용 주체가 정해지지 않았을 때
- 발견 사항을 수정하거나 차단할 운영 권한이 없을 때
모델 평가 & 레드팀 시스템 플레이트
- 01
상태 1
자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.
- 02
상태 2
자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
- 03
상태 3
재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.
- 04
상태 4
재시험 결과와 잔여 위험 승인 없이는 릴리스 게이트를 닫지 않습니다.
FEEDBACK수용 기준을 통과하지 못한 증거는 첫 통제 단계로 돌아갑니다: 위협 범위와 공격 표면.
- 작업은 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.에서 시작합니다.
- 위협 범위와 공격 표면을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.
- 01
1단계
자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.
검토 산출물 1 - 02
2단계
자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
검토 산출물 2 - 03
3단계
재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.
검토 산출물 3 - 04
4단계
재시험 결과와 잔여 위험 승인 없이는 릴리스 게이트를 닫지 않습니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때
정상 입력 평균만 보면 희귀하지만 치명적인 실패와 공격 경로가 보이지 않습니다.
- APPROACH
- 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.
- BOUNDARY
- 레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
모델·정책 업데이트마다 위험 회귀를 검증해야 할 때
레드팀 발견 사항에 소유자와 종료 조건이 없으면 보고서만 남고 위험은 운영으로 넘어갑니다.
- APPROACH
- 자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
- BOUNDARY
- 테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때 | 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다. | 레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다. | 위협 범위와 공격 표면 |
| 모델·정책 업데이트마다 위험 회귀를 검증해야 할 때 | 자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다. | 테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다. | 발견 재현·수정률 |
모델 평가 & 레드팀 시스템 플레이트
- 위협 모델과 위험 허용 주체가 정해지지 않았을 때
레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
- SIGNAL
- 위협 범위와 공격 표면
- MITIGATION
- 자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
- 발견 사항을 수정하거나 차단할 운영 권한이 없을 때
테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.
- SIGNAL
- 발견 재현·수정률
- MITIGATION
- 재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.
- 작업은 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.에서 시작합니다.
- 위협 범위와 공격 표면을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 위협 범위와 공격 표면 | 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다. |
| 발견 재현·수정률 | 자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 잔여 위험 승인 추적성 | 재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
위협 모델과 위험 허용 주체가 정해지지 않았을 때
레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
발견 사항을 수정하거나 차단할 운영 권한이 없을 때
테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
위협 범위와 공격 표면 - 02
설계
Patty자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
Client소유자와 수용 기준을 확정합니다.
발견 재현·수정률 - 03
검증
Patty재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.
Client운영 전환 또는 중단 결정을 내립니다.
잔여 위험 승인 추적성
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- 모델 평가 & 레드팀 의사결정 기록
- 평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 위협 범위와 공격 표면 · 발견 재현·수정률 · 잔여 위험 승인 추적성공동 관리
- 운영·복구 런북
- 레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다. · 테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- 모델 평가 & 레드팀
- 기능 품질, 안전, 보안, 편향과 도구 사용 실패를 위협 모델과 증거 기반 릴리스 게이트로 관리합니다.
- 수용 기준
- 위협 범위와 공격 표면
- 운영 경계
- 레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
REFERENCES
참고 문헌과 1차 자료
- NIST AI 600-1
방법과 용어를 확인하기 위한 1차 자료입니다.
- MITRE ATLAS
방법과 용어를 확인하기 위한 1차 자료입니다.
모델 평가 & 레드팀이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.