Fiche modèle
DeepSeek V4 Flash 0731
DeepSeek · poids ouverts · sorti le 31/07/2026
Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.
Scores
Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.
| Benchmark | Score | Rang | Réglage | Source |
|---|---|---|---|---|
| Indice de capacités ECI (Epoch AI)Capacités générales | 154,5152,1–156,4 | 35 / 274 | Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026 | |
| LMArena texte, contrôle du style | absent du classement LMArena, ou nom non rapproché par la table de correspondance | |||
| GPQA Diamond (Epoch AI)Sciences | 91,0 %87,6–94,5 | 28 / 186 | réglage « deepseek-v4-flash-0731_max » | Epoch AI, CC BY 4.0, publié le 02/08/2026 |
| FrontierMath, niveaux 1 à 3 (Epoch AI)Maths | 57,5 %51,8–63,3 | 37 / 81 | réglage « deepseek-v4-flash-0731_max » | Epoch AI, CC BY 4.0, publié le 02/08/2026 |
| OTIS Mock AIME 2024-2025 (Epoch AI)Maths de concours | 94,4 %90,4–98,5 | 37 / 176 | réglage « deepseek-v4-flash-0731_max » | Epoch AI, CC BY 4.0, publié le 02/08/2026 |
| SimpleQA Verified (Epoch AI)Connaissances factuelles | 33,6 %30,7–36,6 | 55 / 77 | réglage « deepseek-v4-flash-0731_max » | Epoch AI, CC BY 4.0, publié le 27/08/2026 |
| SWE-bench Verified (Epoch AI) | non évalué par Epoch AI | |||
Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0). Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Prix par fournisseur d’API
| Fournisseur | Entrée $/M | Sortie $/M | Mélangé | Clé LiteLLM |
|---|---|---|---|---|
| DeepInfra | 0,080 $ | 0,18 $ | 0,11 $ | deepinfra/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Sail | 0,090 $ | 0,18 $ | 0,11 $ | sail/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Baseten | 0,13 $ | 0,26 $ | 0,16 $ | baseten/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Perplexity | 0,13 $ | 0,26 $ | 0,16 $ | perplexity/perplexity/deepseek-v4-flash-0731 |
| Weights & Biases | 0,13 $ | 0,28 $ | 0,17 $ | wandb/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Databricks | 0,14 $ | 0,28 $ | 0,18 $ | databricks/databricks-deepseek-v4-flash-0731 |
| Nebius | 0,14 $ | 0,28 $ | 0,18 $ | nebius/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Together AI | 0,14 $ | 0,28 $ | 0,18 $ | together_ai/deepseek-ai/DeepSeek-V4-Flash-0731 |
| Alibaba Cloud (DashScope) | 0,20 $ | 0,40 $ | 0,25 $ | dashscope/deepseek-v4-flash-0731 |
| Alibaba Cloud (Qwen AI Platform) | 0,20 $ | 0,40 $ | 0,25 $ | qwen_ai_platform/deepseek-v4-flash-0731 |
| Alibaba Cloud (Qwen Cloud) | 0,20 $ | 0,40 $ | 0,25 $ | qwencloud/deepseek-v4-flash-0731 |
| Fireworks AI | 0,22 $ | 0,66 $ | 0,33 $ | fireworks_ai/deepseek-v4-flash-0731 |
| Scaleway | 0,40 $ | 0,80 $ | 0,50 $ | scaleway/deepseek-v4-flash-0731 |
| Microsoft Azure AI Foundry | 0,44 $ | 1,32 $ | 0,66 $ | azure_ai/DeepSeek-V4-Flash-0731 |
| Novita AI | 0,44 $ | 1,32 $ | 0,66 $ | novita/deepseek/deepseek-v4-flash-0731 |
$ par million de jetons, tarif catalogue sans remise, sans cache ni traitement par lots. 15 offres rapprochées. Écart entre le moins cher (DeepInfra, 0,11 $) et le plus cher : × 6,3. Relevé du 07/10/2026 ; vérifier chez le fournisseur avant de choisir. Sources : Prix : LiteLLM (BerriAI), licence MIT, © 2023 Berri AI. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
L’héberger soi-même
- Accès aux poids
- poids libres (usage sans restriction) (Epoch AI, CC BY 4.0)
- Licence
- MIT (carte du dépôt, déclaration de l’éditeur lue le 01/10/2026 ; lire la licence avant tout usage commercial)
- Taille
- 284 Md de paramètres, dont 13 Md actifs à chaque jeton (modèle à experts) (Epoch AI, CC BY 4.0 ; confiance d’Epoch : Likely ; note : « 284B total, 13B active »)
- Poids
- huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 (dépôt rapproché par la table de correspondance, existence vérifiée auprès de Hugging Face le 01/10/2026)
Mémoire nécessaire
| Format des poids | Poids seuls | Ordre de grandeur du matériel |
|---|---|---|
| BF16 (pleine précision usuelle) | 568 Go | un serveur à huit cartes de 80 Go (640 Go) |
| FP8 / 8 bits | 284 Go | un serveur à huit cartes de 80 Go (640 Go) |
| 4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre) | 170 Go | deux à quatre cartes de 80 Go, ou un Mac de 192 Go |
Calcul du Crible : 284 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs. Un modèle à experts doit charger tous ses paramètres en mémoire, mais n’en calcule que 13 Md par jeton : il répond plus vite que sa taille ne le laisse penser.
Outils
- vLLM (serveur, cartes graphiques) :
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731sert le dépôt Hugging Face derrière une API compatible OpenAI. Le modèle doit être pris en charge par la version installée. - llama.cpp (ordinateur, processeur ou carte graphique) : lit les poids au format GGUF, souvent publiés en 4 bits par la communauté. Chercher une version GGUF (rien ne garantit qu’elle existe ni qu’elle est fidèle), puis
llama-server -hf <dépôt GGUF>. - Ollama (le plus simple sur un ordinateur) :
ollama run hf.co/<dépôt GGUF>lance une version GGUF publiée sur Hugging Face.
Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Évolution
Pas encore deux classements LMArena relevés pour ce modèle.
Aucun changement de prix relevé depuis le début de nos relevés quotidiens.