Le Crible

Fiche modèle

DeepSeek V4 Flash 0731

DeepSeek · poids ouverts · sorti le 31/07/2026

Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.

ECI

154,5

35e sur 274

Prix

0,11 $

par million de jetons, DeepInfra

Taille

284 Md

13 Md actifs

Scores

Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.

BenchmarkScoreRangRéglageSource
Indice de capacités ECI (Epoch AI)Capacités générales154,5152,1–156,435 / 274Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026
LMArena texte, contrôle du styleabsent du classement LMArena, ou nom non rapproché par la table de correspondance
GPQA Diamond (Epoch AI)Sciences91,0 %87,6–94,528 / 186réglage « deepseek-v4-flash-0731_max »Epoch AI, CC BY 4.0, publié le 02/08/2026
FrontierMath, niveaux 1 à 3 (Epoch AI)Maths57,5 %51,8–63,337 / 81réglage « deepseek-v4-flash-0731_max »Epoch AI, CC BY 4.0, publié le 02/08/2026
OTIS Mock AIME 2024-2025 (Epoch AI)Maths de concours94,4 %90,4–98,537 / 176réglage « deepseek-v4-flash-0731_max »Epoch AI, CC BY 4.0, publié le 02/08/2026
SimpleQA Verified (Epoch AI)Connaissances factuelles33,6 %30,7–36,655 / 77réglage « deepseek-v4-flash-0731_max »Epoch AI, CC BY 4.0, publié le 27/08/2026
SWE-bench Verified (Epoch AI)non évalué par Epoch AI

Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0). Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

Prix par fournisseur d’API

Prix par fournisseur d’API
FournisseurEntrée $/MSortie $/MMélangéClé LiteLLM
DeepInfra0,080 $0,18 $0,11 $deepinfra/deepseek-ai/DeepSeek-V4-Flash-0731
Sail0,090 $0,18 $0,11 $sail/deepseek-ai/DeepSeek-V4-Flash-0731
Baseten0,13 $0,26 $0,16 $baseten/deepseek-ai/DeepSeek-V4-Flash-0731
Perplexity0,13 $0,26 $0,16 $perplexity/perplexity/deepseek-v4-flash-0731
Weights & Biases0,13 $0,28 $0,17 $wandb/deepseek-ai/DeepSeek-V4-Flash-0731
Databricks0,14 $0,28 $0,18 $databricks/databricks-deepseek-v4-flash-0731
Nebius0,14 $0,28 $0,18 $nebius/deepseek-ai/DeepSeek-V4-Flash-0731
Together AI0,14 $0,28 $0,18 $together_ai/deepseek-ai/DeepSeek-V4-Flash-0731
Alibaba Cloud (DashScope)0,20 $0,40 $0,25 $dashscope/deepseek-v4-flash-0731
Alibaba Cloud (Qwen AI Platform)0,20 $0,40 $0,25 $qwen_ai_platform/deepseek-v4-flash-0731
Alibaba Cloud (Qwen Cloud)0,20 $0,40 $0,25 $qwencloud/deepseek-v4-flash-0731
Fireworks AI0,22 $0,66 $0,33 $fireworks_ai/deepseek-v4-flash-0731
Scaleway0,40 $0,80 $0,50 $scaleway/deepseek-v4-flash-0731
Microsoft Azure AI Foundry0,44 $1,32 $0,66 $azure_ai/DeepSeek-V4-Flash-0731
Novita AI0,44 $1,32 $0,66 $novita/deepseek/deepseek-v4-flash-0731

$ par million de jetons, tarif catalogue sans remise, sans cache ni traitement par lots. 15 offres rapprochées. Écart entre le moins cher (DeepInfra, 0,11 $) et le plus cher : × 6,3. Relevé du 07/10/2026 ; vérifier chez le fournisseur avant de choisir. Sources : Prix : LiteLLM (BerriAI), licence MIT, © 2023 Berri AI. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

L’héberger soi-même

Accès aux poids
poids libres (usage sans restriction) (Epoch AI, CC BY 4.0)
Licence
MIT (carte du dépôt, déclaration de l’éditeur lue le 01/10/2026 ; lire la licence avant tout usage commercial)
Taille
284 Md de paramètres, dont 13 Md actifs à chaque jeton (modèle à experts) (Epoch AI, CC BY 4.0 ; confiance d’Epoch : Likely ; note : « 284B total, 13B active »)
Poids
huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 (dépôt rapproché par la table de correspondance, existence vérifiée auprès de Hugging Face le 01/10/2026)

Mémoire nécessaire

Format des poidsPoids seulsOrdre de grandeur du matériel
BF16 (pleine précision usuelle)568 Goun serveur à huit cartes de 80 Go (640 Go)
FP8 / 8 bits284 Goun serveur à huit cartes de 80 Go (640 Go)
4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre)170 Godeux à quatre cartes de 80 Go, ou un Mac de 192 Go

Calcul du Crible : 284 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs. Un modèle à experts doit charger tous ses paramètres en mémoire, mais n’en calcule que 13 Md par jeton : il répond plus vite que sa taille ne le laisse penser.

Outils

Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

Évolution

Pas encore deux classements LMArena relevés pour ce modèle.

Aucun changement de prix relevé depuis le début de nos relevés quotidiens.

Lien permanent de cette fiche · Méthode et sources