Le Crible

Fiche modèle

Nemotron 3 Ultra

Nvidia · poids ouverts · sorti le 04/06/2026

Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.

ECI

146,2

77e sur 274

LMArena

1 426

64e sur 166 modèles de l’indice

Prix

0,81 $

par million de jetons, Perplexity

Taille

550 Md

55 Md actifs

Scores

Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.

BenchmarkScoreRangRéglageSource
Indice de capacités ECI (Epoch AI)Capacités générales146,2143,9–148,077 / 274Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026
LMArena texte, contrôle du styleConversation (préférence humaine)1 4261 419–1 43364 / 166« nvidia-nemotron-3-ultra-550b-a55b-nvfp4 »LMArena, CC BY 4.0, publié le 02/10/2026
GPQA Diamond (Epoch AI)Sciences85,4 %80,4–90,363 / 186réglage « nemotron-3-ultra »Epoch AI, CC BY 4.0, publié le 10/08/2026
FrontierMath, niveaux 1 à 3 (Epoch AI)non évalué par Epoch AI
OTIS Mock AIME 2024-2025 (Epoch AI)Maths de concours86,7 %76,6–96,761 / 176réglage « nemotron-3-ultra »Epoch AI, CC BY 4.0, publié le 10/08/2026
SimpleQA Verified (Epoch AI)non évalué par Epoch AI
SWE-bench Verified (Epoch AI)non évalué par Epoch AI

Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

Prix par fournisseur d’API

Prix par fournisseur d’API
FournisseurEntrée $/MSortie $/MMélangéClé LiteLLM
Perplexity0,25 $2,50 $0,81 $perplexity/perplexity/nemotron-3-ultra-550b-a55b
Weights & Biases0,50 $2,15 $0,91 $wandb/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B
DeepInfra0,50 $2,20 $0,93 $deepinfra/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B
Baseten0,60 $2,40 $1,05 $baseten/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B
Fireworks AI0,60 $2,40 $1,05 $fireworks_ai/nemotron-3-ultra-nvfp4
Microsoft Azure AI Foundry0,66 $2,64 $1,16 $azure_ai/FW-Nemotron-3-Ultra-NVFP4
Together AI0,60 $3,60 $1,35 $together_ai/nvidia/nemotron-3-ultra-550b-a55b
Nebius1,00 $3,00 $1,50 $nebius/nvidia/Nemotron-3-Ultra-550b-a55b

$ par million de jetons, tarif catalogue sans remise, sans cache ni traitement par lots. 8 offres rapprochées. Écart entre le moins cher (Perplexity, 0,81 $) et le plus cher : × 1,8. Relevé du 07/10/2026 ; vérifier chez le fournisseur avant de choisir. Sources : Prix : LiteLLM (BerriAI), licence MIT, © 2023 Berri AI. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

L’héberger soi-même

Accès aux poids
poids libres (usage sans restriction) (Epoch AI, CC BY 4.0)
Licence
OpenMDW 1.1 (carte du dépôt, déclaration de l’éditeur lue le 01/10/2026 ; lire la licence avant tout usage commercial)
Taille
550 Md de paramètres, dont 55 Md actifs à chaque jeton (modèle à experts) (Epoch AI, CC BY 4.0 ; confiance d’Epoch : Likely ; note : « "550B total parameters with up to 55B active per token" from https://docs.nvidia.com/nemotron/nightly/usage-cookbook/Nemotron-3-Ultra-Base/README.html »)
Poids
huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 (dépôt rapproché par la table de correspondance, existence vérifiée auprès de Hugging Face le 01/10/2026) Ce dépôt publie les poids en format réduit (NVFP4) : c’est la ligne correspondante du tableau de mémoire qui s’applique.

Mémoire nécessaire

Format des poidsPoids seulsOrdre de grandeur du matériel
BF16 (pleine précision usuelle)1 100 Goun serveur à huit cartes de 141 à 192 Go
FP8 / 8 bits550 Goun serveur à huit cartes de 80 Go (640 Go)
4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre)330 Goun serveur à huit cartes de 80 Go (640 Go)

Calcul du Crible : 550 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs. Un modèle à experts doit charger tous ses paramètres en mémoire, mais n’en calcule que 55 Md par jeton : il répond plus vite que sa taille ne le laisse penser.

Outils

Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

Évolution

1 4151 4251 43530/09/202602/10/2026
Note LMArena (« nvidia-nemotron-3-ultra-550b-a55b-nvfp4 ») à chaque classement publié depuis 180 jours, bande : intervalle publié. Une note d’arène est relative : elle bouge aussi quand d’autres modèles entrent au classement, sans que ce modèle ait changé. Sources : LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.

Aucun changement de prix relevé depuis le début de nos relevés quotidiens.

Lien permanent de cette fiche · Méthode et sources