Le Crible

Édition de 14 h

Le filThèmes : ÉvaluationsOutils devAgents

Claude publie des principes pour concevoir des évaluations et les améliorer sans se tromper

L’essentiel

Le texte présente aussi comment les commandes build-eval et hillclimb du skill claude-api appliquent ces principes.

Propagation1 article, publié par claude.dev le 28 sept. à 14 h 00.

Les sources

1 article

Sur les mêmes thèmes

  1. Agents

    LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian

    Pertinence 4,2 sur51 source

  2. Évaluations

    WideSWE mesure la capacité des agents de code à coordonner des modifications entre dépôts

    Pertinence 4,0 sur51 source

  3. Agents

    LangChain montre comment associer Jev, modèle de décision de TypeSafe AI, à LangGraph

    Pertinence 3,9 sur52 sources

  4. Agents

    Hugging Face ajoute un filtre pour les environnements d’apprentissage par renforcement sur le Hub

    Pertinence 3,5 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources