Le filThèmes : AgentsÉvaluationsRecherche
Rules to Tools fournit des vérifications exécutables à des agents de code scientifique
1 sourcemis à jour il y a 5 jpertinence 3,3 sur5
L’essentiel
Sur des tâches SciCode, la réparation complète atteint 29/30 avec les vérifications préparées, contre 26/30 avec du texte. Selon les auteurs, les résultats dépendent des tâches.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceJingjie Ning, Guojiang Zhao, Chen Xu et al.huggingface.co
Rules to Tools: Executable Checks for LLM Agents in Scientific Computing (site externe)
Scientific coding agents receive equations, boundary conditions, and output requirements in writing, then must assess the programs they revise. Rules to Tools (R2T) supplies prepared executable checks of public scientific requirements.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
Agents
MILO fait évoluer des harnais d’agents et leur stratégie de recherche, et dépasse huit harnais de référence
Évaluations
Des chercheurs suggèrent que les modèles de langage tendent à présenter par défaut des récits de succès
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5