분산 GPU 서빙 & 스케줄링

분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.

요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.

01

문제 정의

평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.

스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.

  • 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
  • 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
  • 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
  • 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
02

분산 GPU 서빙 & 스케줄링 시스템 플레이트

CONTROL

시스템 1

입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.

CONTROL

시스템 2

텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.

EXECUTION

시스템 3

캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.

EXECUTION

시스템 4

노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.

  1. N1 N2context
  2. N2 N3decision
  3. N3 N4evidence
분산 GPU 서빙 & 스케줄링의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
  2. p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.

03

설계 방법

분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.

  1. 01

    1단계

    입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.

  2. 02

    2단계

    텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.

  3. 03

    3단계

    캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.

  4. 04

    4단계

    노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.

04

적용 시나리오

가상 적용 시나리오

여러 모델·테넌트가 제한된 GPU 풀을 공유할 때

평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.

APPROACH
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
BOUNDARY
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
가상 적용 시나리오

첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때

스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.

APPROACH
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
BOUNDARY
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

05

설계 선택

DecisionGainCostWatch
여러 모델·테넌트가 제한된 GPU 풀을 공유할 때입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.p50/p95 첫 토큰·토큰 간 지연
첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.유효 토큰 처리량과 대기 시간
06

분산 GPU 서빙 & 스케줄링 시스템 플레이트

  1. 단일 모델의 낮은 트래픽이 한 장비로 충분할 때

    합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

    SIGNAL
    p50/p95 첫 토큰·토큰 간 지연
    MITIGATION
    텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
  2. 실제 요청 분포와 SLO가 아직 정의되지 않았을 때

    GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

    SIGNAL
    유효 토큰 처리량과 대기 시간
    MITIGATION
    캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
분산 GPU 서빙 & 스케줄링의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
  2. p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.

07

검증 계획

MeasureMethodPass conditionCaveat
p50/p95 첫 토큰·토큰 간 지연입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.도입 검토에서 합의한 기준을 반복 측정으로 충족합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
유효 토큰 처리량과 대기 시간텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족—
격리·복구 시간캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족—

08

한계와 실패 조건

단일 모델의 낮은 트래픽이 한 장비로 충분할 때

합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

실제 요청 분포와 SLO가 아직 정의되지 않았을 때

GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

10

남는 산출물

분산 GPU 서빙 & 스케줄링 의사결정 기록
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.고객 소유 · Patty 검토
검증 하네스와 수용 기준
p50/p95 첫 토큰·토큰 간 지연 · 유효 토큰 처리량과 대기 시간 · 격리·복구 시간공동 관리
운영·복구 런북
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. · GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.운영 조직 소유

11

용어

분산 GPU 서빙 & 스케줄링
요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
수용 기준
p50/p95 첫 토큰·토큰 간 지연
운영 경계
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

REFERENCES

참고 문헌과 1차 자료

  1. vLLM documentation

    방법과 용어를 확인하기 위한 1차 자료입니다.

  2. Ray Serve LLM

    방법과 용어를 확인하기 위한 1차 자료입니다.