Le filThèmes : RechercheInfraAgents
NeMo-DCR synchronise les poids d’un modèle d’un billion de paramètres en n’envoyant que les changements
1 sourcemis à jour il y a 12 hpertinence 3,3 sur5
L’essentiel
Selon le papier, une synchronisation par arbre de relais d’un modèle de 1T paramètres à 3 % de changements prend 150 s au lieu de 87,5 min. Pour 30B à 1T, elle est 12 à 40 fois plus rapide, même à 3 % et 5 %.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceSonglin Jiang, Zhiyu Li, Terry Kong et al.huggingface.co
NeMo-DCR: Bit-Exact Delta-Compressed Refit for Scalable Agentic RL at Trillion-Parameter Scale (site externe)
Agentic reinforcement learning (RL) disaggregates training from rollout, so each policy update must reach the rollout clusters before the next batch.
Sur les mêmes thèmes
Infra
AgSpec accélère le décodage spéculatif par récupération dans les pipelines d’agents de code
Recherche
Des chercheurs présentent les Context Language Models, qui gèrent eux-mêmes leur contexte comme un fichier
Agents
QwenGyre, un framework de RL élastique, entraîne des agents d’IA sur des tâches très longues
Agents
Des chercheurs présentent SSR, qui remplace le raisonnement libre des agents de recherche par une sélection
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5