Le filThèmes : RechercheInfraOpen source
RouteFM, un routeur de LLM préentraîné une fois, s’adapte à de nouveaux environnements par le contexte
1 sourcemis à jour il y a 5 jpertinence 3,0 sur5
L’essentiel
Des chercheurs présentent RouteFM, un routeur figé. Sur MMR-Bench, exclu du préentraînement, il dépasse de 2,23 points de qualité la meilleure référence avec seulement huit observations par modèle candidat.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceGuannan Lai, Han-Jia Yehuggingface.co
Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing (site externe)
Most LLM routers are trained for a fixed workload and candidate pool, requiring retraining as the routing environment changes. RouteFM explores a different paradigm: pretrain the routing capability once and adapt to new environments through context alone.
Sur les mêmes thèmes
Open source
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
Galahad, une couche mémoire pour vLLM, SGLang et llama.cpp, évite de relire les mêmes textes
Recherche
LoGRA réduit la mémoire de l’entraînement par RL des LLM grâce à des esquisses de gradient de bas rang
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5