Latent-MOPD distille plusieurs modèles spécialisés dans un seul modèle élève via leurs états cachés
1 sourcemis à jour il y a 2 jpertinence 3,2 sur5
L’essentiel
Latent-MOPD dépasse les références testées sur neuf benchmarks de maths, de code et de logique dans le cadre principal d’une même famille de modèles. Le modèle élève surpasse aussi le meilleur enseignant sur la majorité d’entre eux.
Propagation1 article, publié par HF Daily Papers le 5 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceZhengyu Fang, Seoyeon Hong, Jie Yang et al.huggingface.co
Latent-MOPD: Latent Multi-Teacher On-Policy Distillation (site externe)
On-policy distillation (OPD) trains a student on the responses it generates. Existing LLM multi-teacher OPD transfers what specialists predict through their output distributions.
Sur les mêmes thèmes
Recherche
Xiaomi publie MiMo-V2.6-Pro, un modèle open-weights omnimodal de 1 000 milliards de paramètres
Recherche
Xiaomi MiMo publie MiMo-V2.6-Distill-Qwen-9B, un modèle agentique de 9 milliards de paramètres
Recherche
NVIDIA affine Nemotron 3 et atteint le niveau or à l’IOI 2026 et à l’IMO 2026
Recherche
Reflection dévoile Beam, un modèle d’IA de 501 milliards de paramètres
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5