MoE 서빙 (wide EP)
기술 개요
대형 MoE(Mixture of Experts) 모델을 여러 노드에 expert-parallelism으로 나눠 서빙하는 역량.
도입 배경
MoE는 품질 대비 연산량 면에서 유리해 표준이 되고 있지만, expert들이 노드 경계를 넘어 분산될 때 통신이 병목이 됩니다. wide-EP 구성 노하우 없이는 MoE의 경제성을 실감하기 어렵습니다.
구현 및 검증
DP/EP 구성 패턴을 워크로드별로 정리해 두고, KV 공간 확장과 함께 튜닝합니다.
expert 배치를 통신 토폴로지에 맞게 배치해 cross-node all-to-all 트래픽을 줄입니다.
검증 근거
아키텍처멀티노드 wide-EP MoE 서빙 구성 패턴 문서화
방법론통신 토폴로지 인지 expert 배치 튜닝