기술 역량

분산 GPU 서빙 & 스케줄링

기술 개요

여러 GPU·노드에 걸친 대규모 LLM 추론을 지능적으로 스케줄링하는 인프라 역량. KV 캐시 위치를 아는 라우팅, prefill/decode 분리 실행, 카나리 출시, 리전 페일오버를 포함합니다.

도입 배경

같은 모델이라도 인프라에 따라 비용과 지연이 몇 배씩 달라집니다. 모델 품질 경쟁이 평준화된 지금, 서빙 아키텍처가 곧 제품 경쟁력입니다.

구현 및 검증

KV-directory 기반 정밀 캐시 라우팅: 어떤 요청의 KV 캐시가 어디 있는지 디렉터리가 알고, 캐시 히트가 가능한 노드로 요청을 보냅니다.

Prefill/Decode 분리(P/D disaggregation): 긴 입력 처리(prefill)와 토큰 생성(decode)을 특성이 다른 워크로드로 보고 별도 풀에서 실행합니다. 노드 간 전송 비용을 명시적 가격으로 다루는 bounded early rejection 정책을 적용합니다.

wide-EP(expert parallelism) MoE 서빙과 멀티테넌시 flow control을 같은 커널에서 제공합니다.

검증 근거

아키텍처KV-directory 기반 캐시 인식 라우팅 + P/D disaggregation
아키텍처wide-EP MoE 멀티노드 서빙 구성 (DP/EP 패턴)
방법론bounded early rejection — 네트워크 전송 비용을 정책 변수로 관리