Le filThèmes : RechercheModèles
LoopVL étend les Loop Transformers aux modèles vision-langage et surpasse des modèles non récurrents
1 sourcemis à jour il y a 6 jpertinence 2,5 sur5
L’essentiel
Ce modèle entraîné de zéro combine les boucles de modules et les boucles de modèle. Il dépasse des modèles non récurrents de taille similaire ou supérieure en compréhension multimodale et en raisonnement visuel.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceZhe Qian, Ziyang Gong, Zhongxing Xu et al.huggingface.co
LoopVL: Recurrent Visual Intelligence (site externe)
We introduce LoopVL to study whether Loop Transformers can be effectively extended to vision- language models. LoopVL combines Module-Loop and Model-Loop computation to iteratively update a unified vision-language state through shared modules.
Sur les mêmes thèmes
Modèles
Xiaomi publie MiMo-V2.6-Pro, un modèle open-weights omnimodal de 1 000 milliards de paramètres
Modèles
Xiaomi MiMo publie MiMo-V2.6-Distill-Qwen-9B, un modèle agentique de 9 milliards de paramètres
Modèles
Reflection dévoile Beam, un modèle d’IA de 501 milliards de paramètres
Modèles
OpenAI publie 722 manuscrits de mathématiques issus d’un modèle interne non diffusé
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5