Le filThèmes : RechercheModèles
Une étude examine quand adapter l’état de démasquage aide les modèles de langage à diffusion masquée
1 sourcemis à jour il y a 6 jpertinence 3,0 sur5
L’essentiel
Les auteurs estiment l’adaptation plus utile si elle est sélective. Sur LLaDA-8B, remplir du JSON contraint en adaptant seulement 10 % des états capte 56,9 % de l’opportunité de l’oracle de l’ensemble des candidats.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceInjin Kong, Sunghwan Choi, Yohan Johuggingface.co
Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models (site externe)
Masked diffusion language models (MDMs) admit flexible generation orders, making the unmasking strategy an inference decision.
Sur les mêmes thèmes
Modèles
Xiaomi publie MiMo-V2.6-Pro, un modèle open-weights omnimodal de 1 000 milliards de paramètres
Modèles
Xiaomi MiMo publie MiMo-V2.6-Distill-Qwen-9B, un modèle agentique de 9 milliards de paramètres
Modèles
Reflection dévoile Beam, un modèle d’IA de 501 milliards de paramètres
Modèles
OpenAI publie 722 manuscrits de mathématiques issus d’un modèle interne non diffusé
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5