Le filThèmes : InfraOpen sourceÉvaluations
Modal présente Quail, un moteur d’inférence conçu pour les requêtes AI-SQL, plus rapide que vLLM
1 sourcemis à jour 24 sept.pertinence 4,0 sur5
L’essentiel
Sur une requête à jointures multiples, Quail dépasse un milliard de tokens par minute et par H100, soit plus de 10 fois la référence vLLM. Sur le benchmark publié, il est 1,84 fois plus rapide en moyenne géométrique.
Propagation1 article, publié par Blog Modal le 24 sept..
Les sources
1 article
Blog ModalOfficiel : fiche de la sourceSource primaire
Modal Labsmodal.com
Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engine (site externe)
On our newly-released benchmark for AI-SQL queries, Quail runs 1.84x faster than vLLM, geometrically averaged over tasks -- including two queries we designed to demonstrate areas for future improvement in AI-SQL inference.
Sur les mêmes thèmes
Infra
ISTA-DASLab publie des quantifications GGUF de Qwen3.8-27B avec un type de quantification par tenseur
Infra
Infatoshi publie GLM-5.3-UNCENSORED en quantification EXL3 3.0bpw, en tendance sur Hugging Face
Open source
Modèle en tendance : jialinyyzz/humanizer — génération de texte, 377 likes
Open source
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5