Le Crible

Édition de 15 h

Le filThèmes : AgentsOutils devRecherche

Des agents de code synthétisent des programmes pour la planification généralisée de tâches et de mouvements

L’essentiel

Trois configurations d’agents (Claude Code avec Opus 5, Codex avec GPT-⁠5.6 Sol et GPT-⁠6 Astra) atteignent 56 % à 95 % de succès moyen, contre 47 % pour les planificateurs, sur les 16 environnements où un planificateur existe.

Propagation1 article, publié par HF Daily Papers le 25 sept..

Les sources

1 article

Sur les mêmes thèmes

  1. Agents

    TokenCast prévoit la consommation de tokens d’un agent LLM pendant l’exécution de l’agent

    Pertinence 3,7 sur51 source

  2. Agents

    Reasonable explique TLA+ et transforme des spécifications TLA+ en preuves Verus vérifiées par machine

    Pertinence 3,7 sur51 source

  3. Agents

    Omni-⁠IO Skills rend des agents existants omni-natifs grâce à une surcouche de Skills

    Pertinence 3,3 sur51 source

  4. Outils dev

    Simon Willison couvre en direct la keynote de l’OpenAI DevDay 2026 fort Mason, à San Francisco

    Pertinence 4,7 sur53 sources

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources