분산 GPU 서빙 & 스케줄링

분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.

요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.

§ 01

문제 정의

분산 GPU 서빙 & 스케줄링이 필요한 운영 조건

평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.

스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.

  • 여러 모델·테넌트가 제한된 GPU 풀을 공유할 때
  • 첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때
  • 단일 모델의 낮은 트래픽이 한 장비로 충분할 때
  • 실제 요청 분포와 SLO가 아직 정의되지 않았을 때
PLATE 01

분산 GPU 서빙 & 스케줄링 시스템 플레이트

CONTROL

시스템 1

입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.

CONTROL

시스템 2

텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.

EXECUTION

시스템 3

캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.

EXECUTION

시스템 4

노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.

  1. N1 N2context
  2. N2 N3decision
  3. N3 N4evidence
분산 GPU 서빙 & 스케줄링의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
  2. p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.

§ 03

설계 방법

구현보다 먼저 경계와 수용 기준을 고정합니다.

분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.

  1. 01

    1단계

    입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.

    검토 산출물 1
  2. 02

    2단계

    텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.

    검토 산출물 2
  3. 03

    3단계

    캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.

    검토 산출물 3
  4. 04

    4단계

    노드·링크·워커 실패를 주입해 배수, 재시도와 복구 시간을 측정합니다.

    검토 산출물 4

§ 04

적용 시나리오

가상의 업무 조건으로 적용 범위를 확인합니다.

가상 적용 시나리오

여러 모델·테넌트가 제한된 GPU 풀을 공유할 때

평균 토큰 처리량만 최적화하면 긴 요청이 짧은 요청의 첫 토큰 지연을 밀어낼 수 있습니다.

APPROACH
입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.
BOUNDARY
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
가상 적용 시나리오

첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때

스케줄러와 모델 병렬화가 따로 설계되면 장애와 재시도 비용이 예측 불가능해집니다.

APPROACH
텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
BOUNDARY
GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

§ 05

설계 선택

이득과 비용을 같은 표에서 검토합니다.

DecisionGainCostWatch
여러 모델·테넌트가 제한된 GPU 풀을 공유할 때입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.p50/p95 첫 토큰·토큰 간 지연
첫 토큰·토큰 간 지연과 처리량 SLO를 동시에 관리할 때텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.유효 토큰 처리량과 대기 시간
PLATE 02

분산 GPU 서빙 & 스케줄링 시스템 플레이트

  1. 단일 모델의 낮은 트래픽이 한 장비로 충분할 때

    합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

    SIGNAL
    p50/p95 첫 토큰·토큰 간 지연
    MITIGATION
    텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.
  2. 실제 요청 분포와 SLO가 아직 정의되지 않았을 때

    GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

    SIGNAL
    유효 토큰 처리량과 대기 시간
    MITIGATION
    캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.
분산 GPU 서빙 & 스케줄링의 의사결정과 검증 구조입니다. 표기는 아키텍처를 설명하며 측정된 배포 성과를 의미하지 않습니다.
  1. 작업은 입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.에서 시작합니다.
  2. p50/p95 첫 토큰·토큰 간 지연을 통해 수용 여부를 결정합니다.

§ 07

검증 계획

성과 수치보다 먼저 측정 조건을 합의합니다.

MeasureMethodPass conditionCaveat
p50/p95 첫 토큰·토큰 간 지연입력·출력 길이, 동시성, 우선순위와 버스트를 재현하는 부하 모델을 만듭니다.도입 검토에서 합의한 기준을 반복 측정으로 충족합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.
유효 토큰 처리량과 대기 시간텐서·파이프라인·데이터 병렬화와 프리필·디코드 분리를 모델 형상별 비교합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족
격리·복구 시간캐시 친화 라우팅, 입장 제어와 선점 규칙을 SLO별로 구성합니다.도입 검토에서 합의한 기준을 반복 측정으로 충족

§ 08

한계와 실패 조건

적용하지 말아야 할 조건도 설계의 일부입니다.

단일 모델의 낮은 트래픽이 한 장비로 충분할 때

합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

실제 요청 분포와 SLO가 아직 정의되지 않았을 때

GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.

§ 10

남는 산출물

프로젝트가 끝나도 운영 조직에 남아야 합니다.

분산 GPU 서빙 & 스케줄링 의사결정 기록
분산 추론의 목표는 GPU 점유율이 아니라 실제 트래픽의 지연·처리량·격리 기준을 예측 가능하게 지키는 것입니다.고객 소유 · Patty 검토
검증 하네스와 수용 기준
p50/p95 첫 토큰·토큰 간 지연 · 유효 토큰 처리량과 대기 시간 · 격리·복구 시간공동 관리
운영·복구 런북
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다. · GPU 사용률 하나로 사용자 지연과 안정성을 판단하지 않습니다.운영 조직 소유

§ 11

용어

같은 단어를 같은 운영 의미로 사용합니다.

분산 GPU 서빙 & 스케줄링
요청 형상, 병렬화, 배치, 라우팅과 장애 도메인을 함께 모델링해 서비스 수준을 설계합니다.
수용 기준
p50/p95 첫 토큰·토큰 간 지연
운영 경계
합성 최대 처리량을 운영 SLO 성능으로 주장하지 않습니다.

REFERENCES

참고 문헌과 1차 자료

  1. vLLM documentation

    방법과 용어를 확인하기 위한 1차 자료입니다.

  2. Ray Serve LLM

    방법과 용어를 확인하기 위한 1차 자료입니다.

분산 GPU 서빙 & 스케줄링이 필요한 조건부터 함께 검토하겠습니다.

대표 업무, 데이터와 인프라 경계, 실패 조건을 기준으로 적용 범위와 검증 계획을 구체화합니다.

기술 검토 요청