DigestsLe quotidien
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
Deux sujets et huit brèves, retenus pour leur poids dans la journée, parmi 261 articles collectés du mardi 6 octobre, 7 h 10, au mercredi 7 octobre, 7 h 10 (heure de Paris).
Le sujet du jour
1. Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
Reflection annonce Beam, un modèle de texte à mélange d’experts entraîné de zéro pour le code, l’agentique et la science, avec des poids sous licence Apache 2.0 attendus ce mois-ci.
- Reflection revendique 80,9 sur SWE-bench Verified et une efficacité d’inférence 3 à 4 fois supérieure à celle de GLM 5.2.
- Le pré-entraînement a porté sur 23,8 billions de tokens, avec quatre semaines de pré-entraînement et autant d’apprentissage par renforcement sur environ 10 500 GB300.
- Un rapport technique et des intégrations open source sont promis.
- Selon Latent Space, GLM 5.3, Kimi K3, Qwen 3.8 Max et DeepSeek V4.1 Flash restent généralement devant.
À suivre
2. OpenAI publie 722 manuscrits de mathématiques issus d’un modèle interne non diffusé
OpenAI a publié sur GitHub 722 manuscrits de mathématiques produits par un modèle de pointe interne, qui reste inédit, avec des formalisations de preuves en Lean.
- Chaque résultat a mobilisé en moyenne environ trois heures de calcul de ChatGPT Pro, rapporte la lettre.
- Les résultats annoncés viennent de commentateurs et n’ont pas été vérifiés de façon indépendante.
- OpenAI dit avoir consulté le groupe consultatif de l’« Institute for Advanced Study » sur les mathématiques et l’IA pour cette publication.
En bref
- Mistral. Mistral publie en préversion Mistral Large 4, accessible via son API. Story : Mistral · Source : Mistral
- Claude Code, sessions cloud. Claude.dev publie un guide des sessions cloud de Claude Code, qui exécutent chaque tâche sur une machine virtuelle neuve, avec quatre sessions réelles, sept chaînes de travail adaptées et la connexion à GitHub. Story : Claude Code, sessions cloud · Source : Claude Code, sessions cloud
- EmbeddingGemma 2. Google DeepMind publie sous licence Apache 2.0 ce modèle d’embeddings de 740 millions de paramètres, qui projette texte, code, images, vidéo et audio dans un même espace de 768 dimensions. Story : EmbeddingGemma 2 · Source : EmbeddingGemma 2
- Cursor SDK. Selon AINews, le SDK de Cursor ajoute le pilotage en cours d’exécution, des sous-agents en arrière-plan qui rendent compte à l’agent parent, des prompts système remplaçables et les annotations MCP readOnlyHint et destructiveHint sur les outils personnalisés. Story : Cursor SDK · Source : Cursor SDK
- Together AI, capacité d’inférence. Together AI annonce un grand cluster de GPU NVIDIA B300 sur IBM Cloud, avec réseau NVIDIA Spectrum-X Ethernet, dont elle est le premier client, pour son inférence destinée aux entreprises. Story : Together AI, capacité d’inférence · Source : Together AI, capacité d’inférence
- Devin, mémoire « Dreaming ». Selon AINews, Cognition lance Devin « Dreaming », qui élague et relie une mémoire en graphe pendant la nuit, et publie en open source son format adossé à git et markdown, Agent Memory Repo. Story : Devin, mémoire « Dreaming » · Source : Devin, mémoire « Dreaming »
- Agents, arrêt des outils inutiles. Selon les auteurs, 7 agents testés jugent inutiles les résultats d’une source défaillante dans 97 à 100 % des cas, mais s’arrêtent rarement sur la base de ce jugement. Story : Agents, arrêt des outils inutiles · Source : Agents, arrêt des outils inutiles
- UndoBench. Ce banc d’essai de 36 chaînes de travail et 36 scénarios de panne mesure que la compétence nominale atteint 83,54 % tandis que le taux de reprise conditionnel (CRSR) tombe à 46,72 %, selon ses auteurs. Story : UndoBench · Source : UndoBench