Le filThèmes : InfraOpen source
Un développeur accélère jusqu’à 42 fois le drafting par prompt lookup dans llama.cpp
1 sourcemis à jour 26 sept.pertinence 3,8 sur5
L’essentiel
Hayder Tirmazi réduit aussi la mémoire jusqu’à 2,6 fois. Une contribution de Daniel Lemire ajoute jusqu’à 4,2 fois de gain, soit jusqu’à 140 fois au total. Les tests tournent sur un Apple M4 Pro.
Propagation1 article, publié par jadidbourbaki.github.io le 26 sept. à 21 h 57.
Les sources
1 article
jadidbourbaki.github.ioCommunautéSource primaire
repéré sur Hacker News
Faster prompt lookup drafting in llama.cpp (site externe)
Sur les mêmes thèmes
Open source
OrcaRouter publie OrcaSAQ2 27B, Qwen3.8-27B quantifié à 3 bits, qui est en tendance sur Hugging Face
Infra
ISTA-DASLab publie des quantifications GGUF de Qwen3.8-27B avec un type de quantification par tenseur
Open source
ISTA-DASLab publie Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF, une version compressée de Qwen3.8-Flash-Next
Open source
ISTA-DASLab publie des quantifications GGUF de Qwen3.8-Flash-Next en quatre tailles, de 66,4 à 83,6 Go
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5