기술 역량

MoE 서빙 (wide EP)

기술 개요

대형 MoE(Mixture of Experts) 모델을 여러 노드에 expert-parallelism으로 나눠 서빙하는 역량.

도입 배경

MoE는 품질 대비 연산량 면에서 유리해 표준이 되고 있지만, expert들이 노드 경계를 넘어 분산될 때 통신이 병목이 됩니다. wide-EP 구성 노하우 없이는 MoE의 경제성을 실감하기 어렵습니다.

구현 및 검증

DP/EP 구성 패턴을 워크로드별로 정리해 두고, KV 공간 확장과 함께 튜닝합니다.

expert 배치를 통신 토폴로지에 맞게 배치해 cross-node all-to-all 트래픽을 줄입니다.

검증 근거

아키텍처멀티노드 wide-EP MoE 서빙 구성 패턴 문서화
방법론통신 토폴로지 인지 expert 배치 튜닝