GTR propose un backbone de vision récurrent sans softmax pour la prédiction dense à haute résolution
1 sourcemis à jour il y a 2 jpertinence 3,0 sur5
L’essentiel
Avec un pré-entraînement du détecteur sur Objects365, GTR-L atteint 58,9 box AP sur COCO val2017. Son opérateur CUDA est 4,0 fois plus rapide que FLA v0.5.0 dans un benchmark de noyau isolé à 1,6K tokens sur RTX 4090.
Propagation1 article, publié par HF Daily Papers le 5 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceZhe Feng, Longfei Liu, Wei Liu et al.huggingface.co
GTR: Gated Token Recurrence for Efficient Dense Prediction (site externe)
Self-attention-based vision backbones perform well on dense prediction, but the quadratic computational cost of global softmax attention limits their efficiency as image resolution increases.
Sur les mêmes thèmes
Infra
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
Infra
SlimWise élague les experts uniquement au décodage pour servir plus efficacement les modèles MoE
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
TRACE propose un entraînement FP4 par RL pour les modèles MoE, guidé par les rollouts
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5