Le filThèmes : RechercheModèles
Un nouveau transformer, LIFT, transmet son état caché au token suivant au lieu de le recalculer
1 sourcemis à jour il y a 5 jpertinence 3,3 sur5
L’essentiel
LIFT ajoute peu de paramètres et se préentraîne en parallèle. Sur des modèles de 135 millions à 1 milliard de paramètres, il surpasse les transformers standards à budget égal en tokens, selon les auteurs de l’étude.
Propagation1 article, publié par TLDR AI le 1 oct. à 15 h 35.
Les sources
1 article
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
TLDR AIAgrégateur : fiche de la sourceRelais
TLDR, fondée et dirigée par Dan Ni, qui la détient à 100 %Dor Tirosh, Ido Amos, Mor Gevaarxiv.org
A new transformer passes its hidden state to the next token instead of recomputing it (site externe)
Transformer language models (LMs) are feed-forward: deep-layer representations are never fed back to shallower layers, and the only pathway for information to flow downward across generation steps is the decoded token.
Sur les mêmes thèmes
Modèles
Xiaomi publie MiMo-V2.6-Pro, un modèle open-weights omnimodal de 1 000 milliards de paramètres
Modèles
Xiaomi MiMo publie MiMo-V2.6-Distill-Qwen-9B, un modèle agentique de 9 milliards de paramètres
Modèles
Reflection dévoile Beam, un modèle d’IA de 501 milliards de paramètres
Modèles
OpenAI publie 722 manuscrits de mathématiques issus d’un modèle interne non diffusé
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5