Le filThèmes : ÉvaluationsAgentsRecherche
EditHero propose un benchmark d’édition 3D d’objets par parties sur de longues séquences de modifications
1 sourcemis à jour il y a 2 jpertinence 2,6 sur5
L’essentiel
Selon ses auteurs, c’est le premier benchmark du genre. Il oppose des méthodes non agentiques à des agents LLM/VLM qui éditent par code : ces derniers préservent mieux les parties non modifiées, mais chaque édition prend des minutes.
Propagation1 article, publié par HF Daily Papers le 5 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceRuihan Yu, Yu-Ju Tsai, Muyao Niu et al.huggingface.co
EditHero: A Benchmark for Long-Horizon Part-Level 3D Editing and Vibe Modeling (site externe)
3D editing methods are usually tested on a single edit, yet an asset is built through a long sequence of revisions, each of which must implement the requested change while leaving everything else unchanged.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
Agents
MILO fait évoluer des harnais d’agents et leur stratégie de recherche, et dépasse huit harnais de référence
Évaluations
Des chercheurs suggèrent que les modèles de langage tendent à présenter par défaut des récits de succès
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5