Fiche modèle
GLM-5.2
Z.ai (Zhipu AI) · poids ouverts · sorti le 16/06/2026
Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.
Taille
744 Md
40 Md actifs
Scores
Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.
| Benchmark | Score | Rang | Réglage | Source |
|---|---|---|---|---|
| Indice de capacités ECI (Epoch AI)Capacités générales | 151,8149,8–153,8 | 49 / 274 | Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026 | |
| LMArena texte, contrôle du styleConversation (préférence humaine) | 1 4761 471–1 480 | 24 / 166 | « glm-5.2-max » | LMArena, CC BY 4.0, publié le 02/10/2026 |
| GPQA Diamond (Epoch AI)Sciences | 91,9 %88,7–95,0 | 24 / 186 | réglage « glm-5.2_max » | Epoch AI, CC BY 4.0, publié le 24/06/2026 |
| FrontierMath, niveaux 1 à 3 (Epoch AI)Maths | 59,2 %53,4–65,0 | 35 / 81 | réglage « glm-5.2_max » | Epoch AI, CC BY 4.0, publié le 19/06/2026 |
| OTIS Mock AIME 2024-2025 (Epoch AI)Maths de concours | 86,4 %78,1–94,7 | 67 / 176 | réglage « glm-5.2_max » | Epoch AI, CC BY 4.0, publié le 25/06/2026 |
| SimpleQA Verified (Epoch AI)Connaissances factuelles | 34,2 %31,3–37,1 | 52 / 77 | réglage « glm-5.2_max » | Epoch AI, CC BY 4.0, publié le 27/08/2026 |
| SWE-bench Verified (Epoch AI)Code | 78,7 %75,0–82,4 | 5 / 32 | réglage « glm-5.2_max » | Epoch AI, CC BY 4.0, publié le 25/06/2026 |
Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Prix par fournisseur d’API
| Fournisseur | Entrée $/M | Sortie $/M | Mélangé | Clé LiteLLM |
|---|---|---|---|---|
| Z.aiéditeur | 1,40 $ | 4,40 $ | 2,15 $ | zai/glm-5.2 |
| DeepInfra | 0,75 $ | 2,40 $ | 1,16 $ | deepinfra/zai-org/GLM-5.2 |
| Weights & Biases | 0,76 $ | 2,42 $ | 1,18 $ | wandb/zai-org/GLM-5.2 |
| Alibaba Cloud (DashScope) | 1,40 $ | 4,40 $ | 2,15 $ | dashscope/glm-5.2 |
| Alibaba Cloud (Qwen AI Platform) | 1,40 $ | 4,40 $ | 2,15 $ | qwen_ai_platform/glm-5.2 |
| Alibaba Cloud (Qwen Cloud) | 1,40 $ | 4,40 $ | 2,15 $ | qwencloud/glm-5.2 |
| Baseten | 1,40 $ | 4,40 $ | 2,15 $ | baseten/zai-org/GLM-5.2 |
| Cloudflare Workers AI | 1,40 $ | 4,40 $ | 2,15 $ | cloudflare/@cf/zai-org/glm-5.2 |
| Databricks | 1,40 $ | 4,40 $ | 2,15 $ | databricks/databricks-glm-5-2 |
| FriendliAI | 1,40 $ | 4,40 $ | 2,15 $ | friendliai/zai-org/GLM-5.2 |
| Mistral AI | 1,40 $ | 4,40 $ | 2,15 $ | mistral/glm-5-2 |
| Nebius | 1,40 $ | 4,40 $ | 2,15 $ | nebius/zai-org/GLM-5.2 |
| Novita AI | 1,40 $ | 4,40 $ | 2,15 $ | novita/zai-org/glm-5.2 |
| Perplexity | 1,40 $ | 4,40 $ | 2,15 $ | perplexity/perplexity/glm-5.2 |
| Together AI | 1,40 $ | 4,40 $ | 2,15 $ | together_ai/zai-org/GLM-5.2 |
| vertex_ai-zai_models | 1,40 $ | 4,40 $ | 2,15 $ | vertex_ai/zai-org/glm-5.2-maas |
| Microsoft Azure AI Foundry | 1,54 $ | 4,84 $ | 2,37 $ | azure_ai/FW-GLM-5.2 |
| Scaleway | 1,80 $ | 5,50 $ | 2,73 $ | scaleway/glm-5.2 |
$ par million de jetons, tarif catalogue sans remise, sans cache ni traitement par lots. 18 offres rapprochées. Écart entre le moins cher (DeepInfra, 1,16 $) et le plus cher : × 2,3. Relevé du 07/10/2026 ; vérifier chez le fournisseur avant de choisir. Sources : Prix : LiteLLM (BerriAI), licence MIT, © 2023 Berri AI. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
L’héberger soi-même
- Accès aux poids
- poids libres (usage sans restriction) (Epoch AI, CC BY 4.0)
- Licence
- MIT (carte du dépôt, déclaration de l’éditeur lue le 01/10/2026 ; lire la licence avant tout usage commercial)
- Taille
- 744 Md de paramètres, dont 40 Md actifs à chaque jeton (modèle à experts) (Epoch AI, CC BY 4.0 ; note : « 40 billion active »)
- Poids
- huggingface.co/zai-org/GLM-5.2 (dépôt rapproché par la table de correspondance, existence vérifiée auprès de Hugging Face le 01/10/2026)
Mémoire nécessaire
| Format des poids | Poids seuls | Ordre de grandeur du matériel |
|---|---|---|
| BF16 (pleine précision usuelle) | 1 488 Go | plusieurs serveurs à huit cartes |
| FP8 / 8 bits | 744 Go | un serveur à huit cartes de 141 à 192 Go |
| 4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre) | 446 Go | un serveur à huit cartes de 80 Go (640 Go) |
Calcul du Crible : 744 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs. Un modèle à experts doit charger tous ses paramètres en mémoire, mais n’en calcule que 40 Md par jeton : il répond plus vite que sa taille ne le laisse penser.
Outils
- vLLM (serveur, cartes graphiques) :
vllm serve zai-org/GLM-5.2sert le dépôt Hugging Face derrière une API compatible OpenAI. Le modèle doit être pris en charge par la version installée. - llama.cpp (ordinateur, processeur ou carte graphique) : lit les poids au format GGUF, souvent publiés en 4 bits par la communauté. Chercher une version GGUF (rien ne garantit qu’elle existe ni qu’elle est fidèle), puis
llama-server -hf <dépôt GGUF>. - Ollama (le plus simple sur un ordinateur) :
ollama run hf.co/<dépôt GGUF>lance une version GGUF publiée sur Hugging Face.
Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Évolution
Aucun changement de prix relevé depuis le début de nos relevés quotidiens.