Le filThèmes : RechercheModèles
Des chercheurs entraînent des modèles à apprendre du contexte grâce à des documents publics modifiés
1 sourcemis à jour 29 sept.pertinence 3,2 sur5
L’essentiel
Sans annotateur humain, le pipeline génère environ 10 000 échantillons. Le SFT fait passer Qwen3.6-35B-A3B de 13,7 % à 22,8 % sur CL-bench, puis un RL à récompense par rubriques atteint 24,6 % (Qwen3.8-2.4T : 23,9 %).
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceHaoyi Wu, Yang Xiao, Yusong Sun et al.huggingface.co
Learning to Learn from Context: Synthetic Training from Perturbed Public Documents (site externe)
Real-world tasks often require large language models (LLMs) to learn from complex task-specific context rather than pretrained parametric knowledge.
Sur les mêmes thèmes
Modèles
Xiaomi publie MiMo-V2.6-Pro, un modèle open-weights omnimodal de 1 000 milliards de paramètres
Modèles
Xiaomi MiMo publie MiMo-V2.6-Distill-Qwen-9B, un modèle agentique de 9 milliards de paramètres
Modèles
Reflection dévoile Beam, un modèle d’IA de 501 milliards de paramètres
Modèles
OpenAI publie 722 manuscrits de mathématiques issus d’un modèle interne non diffusé
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5