GPU 팜 운영
기술 개요
GPU 클러스터를 SLO 아래에서 운영하는 역량. 큐 깊이·in-flight·KV 압력 신호 기반의 선제적 오토스케일링, 빠른 모델 actuation, 멀티테넌시 flow control을 포함합니다.
도입 배경
GPU는 비싸고, 놀면 손해며, 부족하면 SLO가 깨집니다. 반응식 스케일링은 늦고, 과잉 프로비저닝은 낭비입니다. 신호 기반 선제 운영이 둘 사이의 길입니다.
구현 및 검증
큐 깊이, in-flight 요청 수, KV 압력을 스케일링 신호로 사용해 병목이 오기 전에 움직입니다.
sleep/wake와 dual-pod decoupling으로 모델 교체·재시작 시간을 최소화합니다.
멀티테넌시 flow control로 한 테넌트의 버스트가 다른 테넌트의 SLO를 침해하지 않게 합니다.
검증 근거
방법론큐 깊이/in-flight/KV 압력 복합 신호 선제 오토스케일링
아키텍처sleep/wake + dual-pod decoupling fast model actuation
방법론멀티테넌시 flow control 정책