Le filThèmes : RechercheInfraÉvaluations
La compression du KV-cache par blocs crée des points faibles périodiques dans la récupération d’information
1 sourcemis à jour 30 sept.pertinence 3,3 sur5
L’essentiel
Dans de grands modèles open-weights qui l’utilisent, la précision de récupération en contexte long peut varier jusqu’à 40 points de pourcentage selon la position du token dans la fenêtre de compression.
Propagation1 article, publié par HF Daily Papers le 30 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceXingyu Zhu, Pu, Yi et al.huggingface.co
Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression (site externe)
Chunked KV-cache compression reduces the memory and attention costs of long-context inference by compressing windows of consecutive tokens into fewer cache entries at a fixed stride.
Sur les mêmes thèmes
Recherche
KernelZero fait évoluer conjointement deux modèles pour générer de meilleurs noyaux GPU
Recherche
Remplacer les grands modèles de langage par des modèles de décision Jev pour l’orchestration de services en périphérie à faible latence
Recherche
SoL-Refiner : raffinement en une étape à la vitesse de la lumière pour la vidéo haute résolution
Évaluations
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5