Le filThèmes : ÉvaluationsAgents
Argo-Bench évalue des agents de données sur 210 tâches d’analyse en entreprise à grande échelle
1 sourcemis à jour il y a 5 jpertinence 3,5 sur5
L’essentiel
Le benchmark simule une plateforme de livraison new-yorkaise avec un entrepôt de 235 tables et 7,5 milliards de lignes. Le meilleur de 14 modèles obtient 95 ou plus sur seulement 34,8 % des tâches, avec 59,5 points de moyenne.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceGabriel Tomitsuka, Arman Raayatsanati, Emma Xing et al.huggingface.co
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows (site externe)
Real-world enterprise data science and analytics workflows require reasoning across dozens of tables, performing statistical analyses, and acting on the results.
Sur les mêmes thèmes
Agents
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5