Le filThèmes : ÉvaluationsAgents
CUA-SWE évalue des agents qui corrigent du code à partir de ce qu’affiche le logiciel en marche
1 sourcemis à jour il y a 6 jpertinence 3,4 sur5
L’essentiel
Ce benchmark couvre quatre domaines du génie logiciel. Les agents modifient le code, exécutent des commandes et inspectent l’interface visuelle. Chaque tâche inclut des tests déterministes qui vérifient le résultat.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FacePrince Zizhuang Wang, Chenhao Liang, Zelong Xu et al.huggingface.co
CUA-SWE: When Computer-Use Agents Meet Visual Software Engineering (site externe)
We introduce CUA-SWE, a benchmark, environment, and evaluation pipeline for software engineering with computer use.
Sur les mêmes thèmes
Agents
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5