SlimWise élague les experts uniquement au décodage pour servir plus efficacement les modèles MoE
1 sourcemis à jour il y a 12 hpertinence 3,7 sur5
L’essentiel
Implémenté dans vLLM, SlimWise accélère le débit de décodage jusqu’à 1,81 fois sur Qwen3.6-35B-A3B avec 50 % d’experts élagués, pour une perte de précision minime.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceGunho Park, Kyoungho Jeun, Juntaek Oh et al.huggingface.co
SlimWise: Decoupling Expert Pruning Across Prefill and Decode for Efficient MoE Serving (site externe)
Mixture-of-experts (MoE) models activate few experts per token, yet batched decoding can access nearly the entire expert pool, making expert-weight traffic a major bottleneck.
Sur les mêmes thèmes
Infra
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
TRACE propose un entraînement FP4 par RL pour les modèles MoE, guidé par les rollouts
Infra
AgSpec accélère le décodage spéculatif par récupération dans les pipelines d’agents de code
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5