Le filThèmes : ÉvaluationsAgents
WorldAuditBench teste des agents multimodaux sur la détection d’anomalies dans des mondes 3D
1 sourcemis à jour il y a 6 jpertinence 2,9 sur5
L’essentiel
Le benchmark compte 213 tâches dans 13 environnements Unreal Engine 5 et Three.js. Pour cinq modèles de pointe, les taux de réussite vont de 6,6 % à 42,3 %, contre 83,4 % pour les humains.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceZiyan Jiang, Jingbo Yang, Jiabao Ji et al.huggingface.co
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents (site externe)
In this paper, we introduce WorldAuditBench, a benchmark for 3D world auditing comprising 213 anomaly tasks across 13 environments built with Unreal Engine 5 and Three.js, spanning five anomaly families.
Sur les mêmes thèmes
Agents
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5