모델 평가 & 레드팀

평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.

기능 품질, 안전, 보안, 편향과 도구 사용 실패를 위협 모델과 증거 기반 릴리스 게이트로 관리합니다.

§ 01

문제 정의

모델 평가 & 레드팀이 필요한 운영 조건

정상 입력 평균만 보면 희귀하지만 치명적인 실패와 공격 경로가 보이지 않습니다.

레드팀 발견 사항에 소유자와 종료 조건이 없으면 보고서만 남고 위험은 운영으로 넘어갑니다.

  • 모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때
  • 모델·정책 업데이트마다 위험 회귀를 검증해야 할 때
  • 위협 모델과 위험 허용 주체가 정해지지 않았을 때
  • 발견 사항을 수정하거나 차단할 운영 권한이 없을 때
PLATE 01

모델 평가 & 레드팀 시스템 플레이트

  1. 01

    상태 1

    자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.

  2. 02

    상태 2

    자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.

  3. 03

    상태 3

    재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.

  4. 04

    상태 4

    재시험 결과와 잔여 위험 승인 없이는 릴리스 게이트를 닫지 않습니다.

FEEDBACK수용 기준을 통과하지 못한 증거는 첫 통제 단계로 돌아갑니다: 위협 범위와 공격 표면.

모델 평가 & 레드팀의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.에서 시작합니다.
  2. 위협 범위와 공격 표면을 통해 수용 여부를 결정합니다.

§ 03

설계 방법

구현보다 먼저 경계와 수용 기준을 고정합니다.

평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.

  1. 01

    1단계

    자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.

    검토 산출물 1
  2. 02

    2단계

    자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.

    검토 산출물 2
  3. 03

    3단계

    재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.

    검토 산출물 3
  4. 04

    4단계

    재시험 결과와 잔여 위험 승인 없이는 릴리스 게이트를 닫지 않습니다.

    검토 산출물 4

§ 04

적용 시나리오

가상의 업무 조건으로 적용 범위를 확인합니다.

가상 적용 시나리오

모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때

정상 입력 평균만 보면 희귀하지만 치명적인 실패와 공격 경로가 보이지 않습니다.

APPROACH
자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.
BOUNDARY
레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
가상 적용 시나리오

모델·정책 업데이트마다 위험 회귀를 검증해야 할 때

레드팀 발견 사항에 소유자와 종료 조건이 없으면 보고서만 남고 위험은 운영으로 넘어갑니다.

APPROACH
자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
BOUNDARY
테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.

§ 05

설계 선택

이득과 비용을 같은 표에서 검토합니다.

DecisionGainCostWatch
모델이 민감 데이터, 외부 도구 또는 고객 의사결정에 닿을 때자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.위협 범위와 공격 표면
모델·정책 업데이트마다 위험 회귀를 검증해야 할 때자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.발견 재현·수정률
PLATE 02

모델 평가 & 레드팀 시스템 플레이트

  1. 위협 모델과 위험 허용 주체가 정해지지 않았을 때

    레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.

    SIGNAL
    위협 범위와 공격 표면
    MITIGATION
    자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.
  2. 발견 사항을 수정하거나 차단할 운영 권한이 없을 때

    테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.

    SIGNAL
    발견 재현·수정률
    MITIGATION
    재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.
모델 평가 & 레드팀의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.에서 시작합니다.
  2. 위협 범위와 공격 표면을 통해 수용 여부를 결정합니다.

§ 07

검증 계획

성과 수치보다 먼저 측정 조건을 합의합니다.

MeasureMethodPass conditionCaveat
위협 범위와 공격 표면자산, 행위자, 권한과 피해 경로를 연결한 위협 모델을 먼저 작성합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.
발견 재현·수정률자동 공격 생성과 도메인 전문가의 수동 탐색을 상호 보완적으로 운영합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족
잔여 위험 승인 추적성재현 가능한 입력, 환경, 영향도와 완화책을 포함한 발견 원장을 유지합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족

§ 08

한계와 실패 조건

적용하지 말아야 할 조건도 설계의 일부입니다.

위협 모델과 위험 허용 주체가 정해지지 않았을 때

레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.

발견 사항을 수정하거나 차단할 운영 권한이 없을 때

테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.

§ 10

남는 산출물

프로젝트가 끝나도 운영 조직에 남아야 합니다.

모델 평가 & 레드팀 의사결정 기록
평가는 평균 품질과 최악의 실패를 함께 다루고 발견된 위험을 배포 결정까지 연결해야 합니다.고객 소유 · Patty 검토
검증 하네스와 수용 기준
위협 범위와 공격 표면 · 발견 재현·수정률 · 잔여 위험 승인 추적성공동 관리
운영·복구 런북
레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다. · 테스트 환경의 공격 성공률을 운영 환경 전체로 일반화하지 않습니다.운영 조직 소유

§ 11

용어

같은 단어를 같은 운영 의미로 사용합니다.

모델 평가 & 레드팀
기능 품질, 안전, 보안, 편향과 도구 사용 실패를 위협 모델과 증거 기반 릴리스 게이트로 관리합니다.
수용 기준
위협 범위와 공격 표면
운영 경계
레드팀은 안전을 증명하지 않고 알려진 실패 영역을 넓힙니다.

REFERENCES

참고 문헌과 1차 자료

  1. NIST AI 600-1

    방법과 용어를 확인하기 위한 1차 자료입니다.

  2. MITRE ATLAS

    방법과 용어를 확인하기 위한 1차 자료입니다.

모델 평가 & 레드팀이 필요한 조건부터 함께 검토하겠습니다.

대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.

기술 검토 요청