분산 GPU 서빙 & 스케줄링
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.
요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
01
문제 정의
평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.
스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.
- 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
- 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
- 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
- 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
분산 GPU 서빙 & 스케줄링 시스템 플레이트
시스템 1
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
시스템 2
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
시스템 3
캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
시스템 4
노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.
- N1 N2context
- N2 N3decision
- N3 N4evidence
- 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
- p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.
03
설계 방법
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.
- 01
1단계
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
- 02
2단계
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
- 03
3단계
캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
- 04
4단계
노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.
04
적용 시나리오
여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.
- APPROACH
- 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
- BOUNDARY
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.
- APPROACH
- 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
- BOUNDARY
- GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
05
설계 선택
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때 | 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다. | 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. | p50/p95 첫 토큰·토큰 간 지연 |
| 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때 | 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다. | GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다. | 유효 토큰 처리량과 대기 시간 |
분산 GPU 서빙 & 스케줄링 시스템 플레이트
- 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
- SIGNAL
- p50/p95 첫 토큰·토큰 간 지연
- MITIGATION
- 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
- 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
- SIGNAL
- 유효 토큰 처리량과 대기 시간
- MITIGATION
- 캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
- 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
- p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.
07
검증 계획
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| p50/p95 첫 토큰·토큰 간 지연 | 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. |
| 유효 토큰 처리량과 대기 시간 | 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 격리·복구 시간 | 캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
08
한계와 실패 조건
단일 모델의 낮은 트래픽이 한 장비로 충분할 때
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
실제 요청 분포와 SLO가 아직 정의되지 않았을 때
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
09
협업 방식
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
p50/p95 첫 토큰·토큰 간 지연 - 02
설계
Patty텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
Client소유자와 수용 기준을 확정합니다.
유효 토큰 처리량과 대기 시간 - 03
검증
Patty캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
Client운영 전환 또는 중단 결정을 내립니다.
격리·복구 시간
10
남는 산출물
- 분산 GPU 서빙 & 스케줄링 의사결정 기록
- 분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- p50/p95 첫 토큰·토큰 간 지연 · 유효 토큰 처리량과 대기 시간 · 격리·복구 시간공동 관리
- 운영·복구 런북
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. · GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.운영 조직 소유
11
용어
- 분산 GPU 서빙 & 스케줄링
- 요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
- 수용 기준
- p50/p95 첫 토큰·토큰 간 지연
- 운영 경계
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- vLLM documentation
방법과 용어를 확인하기 위한 1차 자료입니다.
- Ray Serve LLM
방법과 용어를 확인하기 위한 1차 자료입니다.