Le filThèmes : AgentsRecherche
ControlScope compare trois niveaux de révision du workflow d’un agent LLM en cours d’exécution
1 sourcemis à jour 29 sept.pertinence 3,5 sur5
L’essentiel
Les chercheurs comparent la poursuite du code généré, l’édition des arguments du prochain appel d’outil et le remplacement du workflow. Sur 20 tâches de fichiers, FULL en réussit 15-16 avec le raisonnement, contre 13 pour KEEP.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceJingjie Ning, Xueqi Li, Yibo Kong et al.huggingface.co
ControlScope: Workflow Revision and Reliability in LLM Agents (site externe)
How much of a running workflow should a language model agent revise? ControlScope compares continuing generated code, editing the next tool call’s data arguments, and replacing the unfinished workflow from the same public execution state.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
PUBG Ally, un agent incarné vocal, joue comme coéquipier d’IA dans PUBG : BATTLEGROUNDS
Agents
DAEDALUS construit une mémoire d’agent à partir de tâches que des agents génèrent eux-mêmes
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5