Thèmes : Infra · Recherche
SlimWise élague les experts uniquement au décodage pour servir plus efficacement les modèles MoE
Implémenté dans vLLM, SlimWise accélère le débit de décodage jusqu’à 1,81 fois sur Qwen3.6-35B-A3B avec 50 % d’experts élagués, pour une perte de précision minime.