Le filThèmes : RechercheAgents
AdviSD entraîne un petit conseiller par auto-distillation sélective pour guider Gemini et Claude
1 sourcemis à jour il y a 6 jpertinence 3,2 sur5
L’essentiel
Avec des conseillers Qwen3-8B, AdviSD dépasse advisor-GRPO de 4,2 à 6,4 points de pourcentage sur BFCL-v3 et de 3,9 à 5,1 points de score sur EnvScaler. Il bat aussi une sélection aléatoire de même effectif.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceRishabh Agrawal, Hejie Cui, Shasha Li et al.huggingface.co
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation (site externe)
Training an advisor to the Frontier LLMs via targeted multi-turn self-distillation.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
PUBG Ally, un agent incarné vocal, joue comme coéquipier d’IA dans PUBG : BATTLEGROUNDS
Agents
DAEDALUS construit une mémoire d’agent à partir de tâches que des agents génèrent eux-mêmes
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5