GPU 팜 운영
GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.
용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.
§ 01
GPU 팜 운영이 필요한 운영 조건
GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.
작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.
- 학습·추론 작업이 여러 팀과 장비 세대를 공유할 때
- 용량·비용·복구 수준을 지속적으로 예측해야 할 때
- 소수 관리형 인스턴스로 요구가 충족될 때
- 전력·냉각·네트워크 계측에 접근할 수 없을 때
GPU 팜 운영 시스템 플레이트
시스템 1
GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
시스템 2
장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
시스템 3
예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
시스템 4
노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.
- N1 N2context
- N2 N3decision
- N3 N4evidence
- 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
- 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.
- 01
1단계
GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
검토 산출물 1 - 02
2단계
장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
검토 산출물 2 - 03
3단계
예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
검토 산출물 3 - 04
4단계
노드 격리, 체크포인트 복구와 예비 용량 전환을 정기적으로 훈련합니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
학습·추론 작업이 여러 팀과 장비 세대를 공유할 때
GPU 사용률만 보면 메모리 오류, 네트워크 정체와 전력 제한이 만든 유효 성능 손실을 놓칩니다.
- APPROACH
- GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.
- BOUNDARY
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
용량·비용·복구 수준을 지속적으로 예측해야 할 때
작업 소유자와 장애 도메인이 불명확하면 한 노드의 문제가 클러스터 대기로 확산됩니다.
- APPROACH
- 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
- BOUNDARY
- 장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 학습·추론 작업이 여러 팀과 장비 세대를 공유할 때 | GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다. | 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. | 작업 goodput과 큐 지연 |
| 용량·비용·복구 수준을 지속적으로 예측해야 할 때 | 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다. | 장비 추가를 운영 설계의 대체재로 취급하지 않습니다. | 장비·링크 이상 탐지 시간 |
GPU 팜 운영 시스템 플레이트
- 소수 관리형 인스턴스로 요구가 충족될 때
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
- SIGNAL
- 작업 goodput과 큐 지연
- MITIGATION
- 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
- 전력·냉각·네트워크 계측에 접근할 수 없을 때
장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
- SIGNAL
- 장비·링크 이상 탐지 시간
- MITIGATION
- 예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
- 작업은 GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다.에서 시작합니다.
- 작업 goodput과 큐 지연을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| 작업 goodput과 큐 지연 | GPU, 메모리, 링크, 호스트, 전력과 작업 큐를 같은 시간축으로 관측합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. |
| 장비·링크 이상 탐지 시간 | 장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 복구 시간과 용량 예측 오차 | 예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
소수 관리형 인스턴스로 요구가 충족될 때
공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
전력·냉각·네트워크 계측에 접근할 수 없을 때
장비 추가를 운영 설계의 대체재로 취급하지 않습니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
작업 goodput과 큐 지연 - 02
설계
Patty장비 세대와 작업 형상별 기준선을 캘리브레이션해 이상을 분리합니다.
Client소유자와 수용 기준을 확정합니다.
장비·링크 이상 탐지 시간 - 03
검증
Patty예약·우선순위·선점·격리 정책을 사용자 SLO와 유지보수 창에 연결합니다.
Client운영 전환 또는 중단 결정을 내립니다.
복구 시간과 용량 예측 오차
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- GPU 팜 운영 의사결정 기록
- GPU 팜은 장비 목록이 아니라 전력, 열, 네트워크, 스케줄러와 장애 대응이 결합된 생산 시스템입니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- 작업 goodput과 큐 지연 · 장비·링크 이상 탐지 시간 · 복구 시간과 용량 예측 오차공동 관리
- 운영·복구 런북
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다. · 장비 추가를 운영 설계의 대체재로 취급하지 않습니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- GPU 팜 운영
- 용량 계획, 텔레메트리, 작업 격리, 유지보수와 복구 훈련을 하나의 운영 모델로 만듭니다.
- 수용 기준
- 작업 goodput과 큐 지연
- 운영 경계
- 공칭 FLOPS를 실제 작업 처리량으로 사용하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- NVIDIA DCGM
방법과 용어를 확인하기 위한 1차 자료입니다.
- Kubernetes Device Plugins
방법과 용어를 확인하기 위한 1차 자료입니다.
GPU 팜 운영이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.