Le filThèmes : RechercheModèlesÉvaluations
UniEvo-VL permet à un modèle multimodal de s’améliorer seul par autodistillation on-policy
1 sourcemis à jour il y a 6 jpertinence 2,6 sur5
L’essentiel
Sur Qwen-image-2512, le score GenEval passe de 0,747 à 0,808 et celui de GenEval2 Soft-TIFA de 32,97 à 35,53. Les résultats sont mitigés sur le rendu de texte, où le gain n’est pas uniforme selon les tâches.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceFang Wu, Da Xing, Yanjie Huang et al.huggingface.co
UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement (site externe)
Modern multimodal models bring generation and understanding into a single unified system, which enables them to provide and learn from their own feedback.
Sur les mêmes thèmes
Évaluations
Des salariés de la tech à San Francisco font conduire une Toyota Corolla par des modèles d’IA sur un parking
Recherche
DN-MOPD normalise le retour de chaque domaine pour fusionner plusieurs spécialistes dans un seul modèle
Recherche
LoHi associe une vidéo dense basse résolution et des images fixes haute résolution pour les vidéos longues
Recherche
Google Research présente Diffusion Controller, un réseau léger pour guider la génération d’images
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5