Le filThèmes : ÉvaluationsAgents
SimuVerity évalue des agents qui génèrent des modèles Simulink sur 101 tâches d’ingénierie
1 sourcemis à jour il y a 2 jpertinence 3,2 sur5
L’essentiel
Sur ce benchmark qui couvre dix domaines d’ingénierie, le meilleur des six systèmes d’agents testés obtient un score global de seulement 42,86. La similarité structurelle y apparaît comme un mauvais indicateur de performance.
Propagation1 article, publié par HF Daily Papers le 5 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceRuiqi Zhang, Jiahao Wang, Mingxuan Li et al.huggingface.co
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation (site externe)
Existing Simulink benchmarks mainly evaluate whether generated models compile, execute, or resemble a reference model. These criteria do not establish whether a model satisfies its engineering requirements.
Sur les mêmes thèmes
Agents
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5