Le filThèmes : ÉvaluationsAgentsOpen source
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
1 sourcemis à jour il y a 3 jpertinence 4,0 sur5
L’essentiel
Le benchmark compte 507 workflows exécutés 20 fois. Claude Opus 5.5 est en tête avec 67,16 % de pass@1, mais 241 tâches seulement sont réussies 20 fois sur 20, autant que Claude Opus 5.
Propagation1 article, publié par Blog Hugging Face le 4 oct. à 0 h 56.
Les sources
1 article
Blog Hugging FaceOfficiel : fiche de la sourceSource primaire
Hugging FaceTuhin Kunduhuggingface.co
The Agent Said It Was Done. The Database Disagreed. (site externe)
Microsoft ThinkingBox grades AI agents on the records they leave behind, not the sentences they generate, and then asks whether they can do it twenty times in a row. It is now available through Hugging Face.
Sur les mêmes thèmes
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
Agents
GUI-HARVEST optimise automatiquement le harnais d’agents d’interface graphique sans modifier leur modèle
Agents
OmniEcho aide des agents incarnés à comprendre l’audio spatial, avec le benchmark OmniEchoBench
Agents
Raven, écosystème multi-agents open source, construit et fait évoluer des harnais modulaires
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5