분산 GPU 서빙 & 스케줄링
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.
요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
§ 01
분산 GPU 서빙 & 스케줄링이 필요한 운영 조건
평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.
스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.
- 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
- 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
- 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
- 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
분산 GPU 서빙 & 스케줄링 시스템 플레이트
시스템 1
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
시스템 2
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
시스템 3
캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
시스템 4
노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.
- N1 N2context
- N2 N3decision
- N3 N4evidence
- 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
- p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.
§ 03
구현보다 먼저 경계와 수용 기준을 고정합니다.
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.
- 01
1단계
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
검토 산출물 1 - 02
2단계
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
검토 산출물 2 - 03
3단계
캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
검토 산출물 3 - 04
4단계
노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.
검토 산출물 4
§ 04
가상의 업무 조건으로 적용 범위를 확인합니다.
여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.
- APPROACH
- 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
- BOUNDARY
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.
- APPROACH
- 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
- BOUNDARY
- GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
§ 05
이득과 비용을 같은 표에서 검토합니다.
| Decision | Gain | Cost | Watch |
|---|---|---|---|
| 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때 | 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다. | 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. | p50/p95 첫 토큰·토큰 간 지연 |
| 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때 | 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다. | GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다. | 유효 토큰 처리량과 대기 시간 |
분산 GPU 서빙 & 스케줄링 시스템 플레이트
- 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
- SIGNAL
- p50/p95 첫 토큰·토큰 간 지연
- MITIGATION
- 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
- 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
- SIGNAL
- 유효 토큰 처리량과 대기 시간
- MITIGATION
- 캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
- 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
- p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.
§ 07
성과 수치보다 먼저 측정 조건을 합의합니다.
| Measure | Method | Pass condition | Caveat |
|---|---|---|---|
| p50/p95 첫 토큰·토큰 간 지연 | 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. |
| 유효 토큰 처리량과 대기 시간 | 텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
| 격리·복구 시간 | 캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다. | 도입 검토에서 합의한 기준을 반복 측정으로 충족 | — |
§ 08
적용하지 말아야 할 조건도 설계의 일부입니다.
단일 모델의 낮은 트래픽이 한 장비로 충분할 때
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
실제 요청 분포와 SLO가 아직 정의되지 않았을 때
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.
§ 09
진단, 설계, 검증의 세 게이트로 진행합니다.
- 01
진단
Patty현행 구조와 실패 신호를 기술적으로 분석합니다.
Client대표 업무, 데이터 경계, 운영 제약을 제공합니다.
p50/p95 첫 토큰·토큰 간 지연 - 02
설계
Patty텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
Client소유자와 수용 기준을 확정합니다.
유효 토큰 처리량과 대기 시간 - 03
검증
Patty캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
Client운영 전환 또는 중단 결정을 내립니다.
격리·복구 시간
§ 10
프로젝트가 끝나도 운영 조직에 남아야 합니다.
- 분산 GPU 서빙 & 스케줄링 의사결정 기록
- 분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.고객 소유 · Patty 검토
- 검증 하네스와 수용 기준
- p50/p95 첫 토큰·토큰 간 지연 · 유효 토큰 처리량과 대기 시간 · 격리·복구 시간공동 관리
- 운영·복구 런북
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. · GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.운영 조직 소유
§ 11
같은 단어를 같은 운영 의미로 사용합니다.
- 분산 GPU 서빙 & 스케줄링
- 요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
- 수용 기준
- p50/p95 첫 토큰·토큰 간 지연
- 운영 경계
- 합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
REFERENCES
참고 문헌과 1차 자료
- vLLM documentation
방법과 용어를 확인하기 위한 1차 자료입니다.
- Ray Serve LLM
방법과 용어를 확인하기 위한 1차 자료입니다.
분산 GPU 서빙 & 스케줄링이 필요한 조건부터 함께 검토하겠습니다.
대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.