Le filThèmes : AgentsInfraRecherche
QwenGyre, un framework de RL élastique, entraîne des agents d’IA sur des tâches très longues
1 sourcemis à jour 29 sept.pertinence 3,6 sur5
L’essentiel
Sur Qwen 3.8 2.4T, avec 700 000 tokens par rollout, il gagne 6,0 points sur NL2RepoBench (52,5 % à 58,5 %) en 48 pas. Il accélère l’entraînement jusqu’à 1,85 fois face à Colocate et 1,78 fois face à Async.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceWeiqi Wang, Yuxin Zhou, Mouxiang Chen et al.huggingface.co
QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents (site externe)
Large language model (LLM) agents increasingly undertake extreme-long (xlong) horizon tasks, where a single execution can span hours, hundreds of model--environment interactions, and nearly 1M tokens per rollout.
Sur les mêmes thèmes
Infra
AgSpec accélère le décodage spéculatif par récupération dans les pipelines d’agents de code
Recherche
Des chercheurs présentent les Context Language Models, qui gèrent eux-mêmes leur contexte comme un fichier
Agents
Des chercheurs présentent SSR, qui remplace le raisonnement libre des agents de recherche par une sélection
Recherche
CacheBack filtre les caches KV échangés entre agents selon les besoins de l’agent récepteur
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5