Le filThèmes : RechercheInfraAgents
PReCache permet à des agents multi-LoRA de partager leur cache KV sans entraînement supplémentaire
1 sourcemis à jour 29 sept.pertinence 3,3 sur5
L’essentiel
PreLRShared atteint jusqu’à 3,1 fois moins de TTFT et 2,3 fois plus de débit par requête. ReBaseShared perd en moyenne 1,1 point de précision par rapport à l’inférence sans partage de cache.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceHyesung Jeon, Hyeongju Ha, Jae-Joon Kimhuggingface.co
PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction (site externe)
Multi-LoRA agent systems enable efficient role specialization by sharing a common backbone model.
Sur les mêmes thèmes
Infra
AgSpec accélère le décodage spéculatif par récupération dans les pipelines d’agents de code
Recherche
Des chercheurs présentent les Context Language Models, qui gèrent eux-mêmes leur contexte comme un fichier
Agents
QwenGyre, un framework de RL élastique, entraîne des agents d’IA sur des tâches très longues
Agents
Des chercheurs présentent SSR, qui remplace le raisonnement libre des agents de recherche par une sélection
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5