Le filThèmes : RechercheAgentsOpen source
AlignOPSD aligne la supervision avant d’attribuer le crédit pour distiller des agents à long horizon
1 sourcemis à jour 29 sept.pertinence 3,5 sur5
L’essentiel
La méthode corrige un décalage entre décision et horodatage. Testée avec Qwen2.5-3B et Qwen2.5-7B, elle bat GRPO et StepOPSD dans les huit comparaisons et améliore GRPO de 5,5 à 8,7 %.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceMingju Chen, Can Lv, Jinrong Liu et al.huggingface.co
Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents (site externe)
Reinforcement learning with verifiable rewards (RLVR) often relies on sparse outcome rewards, providing coarse supervision for long-horizon agents. On-policy self-distillation (OPSD) complements this signal with dense privileged feedback.
Sur les mêmes thèmes
Agents
DAEDALUS construit une mémoire d’agent à partir de tâches que des agents génèrent eux-mêmes
Agents
TimeEvo fait évoluer un agent de séries temporelles à partir de ses échecs diagnostiqués
Agents
GraphForge synthétise des espaces de travail à partir de fichiers réels pour entraîner des agents
Recherche
DeskForge construit un corpus de 1,2 million d’observations de bureau pour des agents d’usage d’ordinateur
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5