Le Crible

Édition de 14 h

Le filThèmes : ModèlesÉvaluations

Reflection avancerait 80,9 sur SWE-⁠bench Verified, selon un résumé de ses résultats relayé par AINews

L’essentiel

Selon ce résumé, le modèle serait 3 à 4 fois plus efficace en inférence que GLM 5.2, avec quatre semaines de pré-entraînement et autant de RL sur environ 10 500 GB300. Un rapport technique est promis.

Cette story fait partie d’un sujet suivi : Reflection dévoile Beam, un modèle open-weight entraîné aux États-Unis (6 sources, mis à jour il y a 5 h).

Propagation1 article, publié par AINews le 6 oct. à 8 h 28.

Les sources

1 article

Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.

Sur les mêmes thèmes

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources

  3. Modèles

    Mistral AI présente Mistral Large 4, disponible en préversion via son API

    Pertinence 4,6 sur54 sources

  4. Modèles

    L’Anthropic Frontier Red Team constate que GLM-⁠5.3 réalise des détournements de flux de contrôle complets

    Pertinence 4,4 sur52 sources

À lire ensuite

  1. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  2. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  3. Sécurité

    OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions

    Pertinence 4,8 sur54 sources

  4. Modèles

    Simon Willison couvre en direct la keynote de l’OpenAI DevDay 2026 fort Mason, à San Francisco

    Pertinence 4,7 sur53 sources