Approximation de softmax dans les LLM préentraînés : sensibilité des modèles et accélération par noyaux
1 sourcemis à jour 29 sept.pertinence 3,6 sur5
L’essentiel
Sur le NVIDIA Blackwell B200, le débit des tensor cores dépasse de plus de deux ordres de grandeur le débit des fonctions spéciales d’exponentielle, ce qui met en évidence le coût de l’évaluation de l’exponentielle dans les noyaux d’attention fusionnés.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceShangzhen Zhu, Muyan Hu, Tomasz Kozlowskihuggingface.co
Approximating Softmax in Pretrained LLMs: Model Sensitivity and Kernel Acceleration (site externe)
On NVIDIA Blackwell B200, tensor-core throughput outpaces special-function exponential throughput by more than two orders of magnitude, exposing exponential evaluation in fused attention kernels.
Sur les mêmes thèmes
Infra
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
Infra
SlimWise élague les experts uniquement au décodage pour servir plus efficacement les modèles MoE
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
TRACE propose un entraînement FP4 par RL pour les modèles MoE, guidé par les rollouts
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5