GPU 팜 운영

GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.

용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.

§ 01

문제 정의

GPU 팜 운영이 필요한 운영 조건

GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.

작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.

  • 학습·추론 작업이 여러 팀과 장비 세대를 공유할 때
  • 용량·비용·복구 수준을 지속적으로 예측해야 할 때
  • 소수 관리형 인스턴스로 요구가 충족될 때
  • 전력·냉각·네트워크 계측에 접근할 수 없을 때
PLATE 01

GPU 팜 운영 시스템 플레이트

CONTROL

시스템 1

GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.

CONTROL

시스템 2

장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.

EXECUTION

시스템 3

예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.

EXECUTION

시스템 4

노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.

  1. N1 N2context
  2. N2 N3decision
  3. N3 N4evidence
GPU 팜 운영의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
  2. 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.

§ 03

설계 방법

구현보다 먼저 경계와 수용 기준을 고정합니다.

GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.

  1. 01

    1단계

    GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.

    검토 산출물 1
  2. 02

    2단계

    장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.

    검토 산출물 2
  3. 03

    3단계

    예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.

    검토 산출물 3
  4. 04

    4단계

    노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.

    검토 산출물 4

§ 04

적용 시나리오

가상의 업무 조건으로 적용 범위를 확인합니다.

가상 적용 시나리오

학습·추론 작업이 여러 팀과 장비 세대를 공유할 때

GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.

APPROACH
GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
BOUNDARY
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
가상 적용 시나리오

용량·비용·복구 수준을 지속적으로 예측해야 할 때

작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.

APPROACH
장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
BOUNDARY
장비 추가를 운영 설계의 대체재로 취급하지 않습니다.

§ 05

설계 선택

이득과 비용을 같은 표에서 검토합니다.

DecisionGainCostWatch
학습·추론 작업이 여러 팀과 장비 세대를 공유할 때GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.작업 goodput과 큐 지연
용량·비용·복구 수준을 지속적으로 예측해야 할 때장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.장비 추가를 운영 설계의 대체재로 취급하지 않습니다.장비·링크 이상 탐지 시간
PLATE 02

GPU 팜 운영 시스템 플레이트

  1. 소수 관리형 인스턴스로 요구가 충족될 때

    공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.

    SIGNAL
    작업 goodput과 큐 지연
    MITIGATION
    장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
  2. 전력·냉각·네트워크 계측에 접근할 수 없을 때

    장비 추가를 운영 설계의 대체재로 취급하지 않습니다.

    SIGNAL
    장비·링크 이상 탐지 시간
    MITIGATION
    예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
GPU 팜 운영의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
  2. 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.

§ 07

검증 계획

성과 수치보다 먼저 측정 조건을 합의합니다.

MeasureMethodPass conditionCaveat
작업 goodput과 큐 지연GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
장비·링크 이상 탐지 시간장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족
복구 시간과 용량 예측 오차예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족

§ 08

한계와 실패 조건

적용하지 말아야 할 조건도 설계의 일부입니다.

소수 관리형 인스턴스로 요구가 충족될 때

공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.

전력·냉각·네트워크 계측에 접근할 수 없을 때

장비 추가를 운영 설계의 대체재로 취급하지 않습니다.

§ 10

남는 산출물

프로젝트가 끝나도 운영 조직에 남아야 합니다.

GPU 팜 운영 의사결정 기록
GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.고객 소유 · Patty 검토
검증 하네스와 수용 기준
작업 goodput과 큐 지연 · 장비·링크 이상 탐지 시간 · 복구 시간과 용량 예측 오차공동 관리
운영·복구 런북
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. · 장비 추가를 운영 설계의 대체재로 취급하지 않습니다.운영 조직 소유

§ 11

용어

같은 단어를 같은 운영 의미로 사용합니다.

GPU 팜 운영
용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.
수용 기준
작업 goodput과 큐 지연
운영 경계
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.

REFERENCES

참고 문헌과 1차 자료

  1. NVIDIA DCGM

    방법과 용어를 확인하기 위한 1차 자료입니다.

  2. Kubernetes Device Plugins

    방법과 용어를 확인하기 위한 1차 자료입니다.

GPU 팜 운영이 필요한 조건부터 함께 검토하겠습니다.

대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.

기술 검토 요청