GPU 팜 운영
GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.
용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.
01
문제 정의
GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.
작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.
- 학습·추론 작업이 여러 팀과 장비 세대를 공유할 때
- 용량·비용·복구 수준을 지속적으로 예측해야 할 때
- 소수 관리형 인스턴스로 요구가 충족될 때
- 전력·냉각·네트워크 계측에 접근할 수 없을 때
GPU 팜 운영 시스템 플레이트
시스템 1
GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
시스템 2
장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
시스템 3
예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
시스템 4
노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.
- N1 N2context
- N2 N3decision
- N3 N4evidence
- 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
- 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.
03
설계 방법
GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.
- 01
1단계
GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
- 02
2단계
장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
- 03
3단계
예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
- 04
4단계
노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.
04
적용 시나리오
학습·추론 작업이 여러 팀과 장비 세대를 공유할 때
GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.
- APPROACH
- GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
- BOUNDARY
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
용량·비용·복구 수준을 지속적으로 예측해야 할 때
작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.
- APPROACH
- 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
- BOUNDARY
- 장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
05
설계 선택
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 학습·추론 작업이 여러 팀과 장비 세대를 공유할 때 | GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다. | 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. | 작업 goodput과 큐 지연 |
| 용량·비용·복구 수준을 지속적으로 예측해야 할 때 | 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다. | 장비 추가를 운영 설계의 대체재로 취급하지 않습니다. | 장비·링크 이상 탐지 시간 |
GPU 팜 운영 시스템 플레이트
- 소수 관리형 인스턴스로 요구가 충족될 때
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
- SIGNAL
- 작업 goodput과 큐 지연
- MITIGATION
- 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
- 전력·냉각·네트워크 계측에 접근할 수 없을 때
장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
- SIGNAL
- 장비·링크 이상 탐지 시간
- MITIGATION
- 예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
- 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
- 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.
07
검증 계획
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 작업 goodput과 큐 지연 | GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. |
| 장비·링크 이상 탐지 시간 | 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 복구 시간과 용량 예측 오차 | 예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
08
한계와 실패 조건
소수 관리형 인스턴스로 요구가 충족될 때
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
전력·냉각·네트워크 계측에 접근할 수 없을 때
장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
09
협업 방식
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
작업 goodput과 큐 지연 - 02
설계
Patty장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
Client소유자와 수용 기준을 확정합니다.
장비·링크 이상 탐지 시간 - 03
검증
Patty예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
Client운영 전환 또는 중단 결정을 내립니다.
복구 시간과 용량 예측 오차
10
남는 산출물
- GPU 팜 운영 의사결정 기록
- GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 작업 goodput과 큐 지연 · 장비·링크 이상 탐지 시간 · 복구 시간과 용량 예측 오차공동 관리
- 운영·복구 런북
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. · 장비 추가를 운영 설계의 대체재로 취급하지 않습니다.운영 조직 소유
11
용어
- GPU 팜 운영
- 용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.
- 수용 기준
- 작업 goodput과 큐 지연
- 운영 경계
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- NVIDIA DCGM
방법과 용어를 확인하기 위한 1차 자료입니다.
- Kubernetes Device Plugins
방법과 용어를 확인하기 위한 1차 자료입니다.