Le filThèmes : Open sourceInfraRecherche
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
2 sourcesmis à jour il y a 4 jpertinence 3,9 sur5
L’essentiel
Dans un benchmark, passer de 8 à 128 experts a fait croître les paramètres totaux de 4,6 à 47 milliards, avec un débit d’entraînement en baisse de moins de 5 %. L’infrastructure a aussi été testée à plus de mille milliards de paramètres.
Couverture
- Sources
- 2
- Articles
- 2
- Par type (sources)
- Officiel 1Agrégateur 1
- Par rôle (articles)
- Primaire 1Relais 1
Propagation2 articles en 22 h 29, de Blog Hugging Face à TLDR AI.
Les sources
1 article, puis 1 sous « Relayé par »
Blog Hugging FaceOfficiel : fiche de la sourceSource primairePremier
Hugging FaceKyle Wiggershuggingface.co
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs (site externe)
Today we’re releasing Olmo-core 3, a significant upgrade to our framework for developing large language models featuring a redesigned open mixture-of-experts (MoE) training system.
Relayé par
TLDR AIAgrégateur : fiche de la sourceRelais+ 22 h 29
TLDR, fondée et dirigée par Dan Ni, qui la détient à 100 %allenai.org
Olmo-core 3 for MoE Training (site externe)
Olmo-core 3 is an open training framework designed to scale mixture-of-experts models into the trillion-parameter range.
Sur les mêmes thèmes
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
Galahad, une couche mémoire pour vLLM, SGLang et llama.cpp, évite de relire les mêmes textes
Recherche
LoGRA réduit la mémoire de l’entraînement par RL des LLM grâce à des esquisses de gradient de bas rang
Infra
PrismQuant propose une rotation qui aligne les activations avec les groupes INT4 asymétriques
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5