Le Crible

Édition de 14 h

Le filThèmes : InfraOpen sourceÉvaluations

Modal présente Quail, un moteur d’inférence conçu pour les requêtes AI-⁠SQL, plus rapide que vLLM

L’essentiel

Sur une requête à jointures multiples, Quail dépasse un milliard de tokens par minute et par H100, soit plus de 10 fois la référence vLLM. Sur le benchmark publié, il est 1,84 fois plus rapide en moyenne géométrique.

Propagation1 article, publié par Blog Modal le 24 sept..

Les sources

1 article

Sur les mêmes thèmes

  1. Infra

    ISTA-⁠DASLab publie des quantifications GGUF de Qwen3.8-⁠27B avec un type de quantification par tenseur

    Pertinence 4,0 sur51 source

  2. Infra

    Infatoshi publie GLM-⁠5.3-⁠UNCENSORED en quantification EXL3 3.0bpw, en tendance sur Hugging Face

    Pertinence 3,6 sur51 source

  3. Open source

    Modèle en tendance : jialinyyzz/humanizer — génération de texte, 377 likes

    Pertinence 3,2 sur51 source

  4. Open source

    Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs

    Pertinence 4,2 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources