Fiche modèle
Llama 3.3 70B
Meta AI · poids ouverts · sorti le 06/12/2024
Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.
Taille
70 Md
paramètres
Scores
Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.
| Benchmark | Score | Rang | Réglage | Source |
|---|---|---|---|---|
| Indice de capacités ECI (Epoch AI)Capacités générales | 127,3121,8–129,7 | 172 / 274 | Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026 | |
| LMArena texte, contrôle du styleConversation (préférence humaine) | 1 3181 314–1 321 | 120 / 166 | « llama-3.3-70b-instruct » | LMArena, CC BY 4.0, publié le 02/10/2026 |
| GPQA Diamond (Epoch AI)Sciences | 47,4 %41,9–53,0 | 144 / 186 | réglage « Llama-3.3-70B-Instruct » | Epoch AI, CC BY 4.0, publié le 27/01/2025 |
| FrontierMath, niveaux 1 à 3 (Epoch AI) | non évalué par Epoch AI | |||
| OTIS Mock AIME 2024-2025 (Epoch AI)Maths de concours | 5,1 %0,5–9,8 | 152 / 176 | réglage « Llama-3.3-70B-Instruct » | Epoch AI, CC BY 4.0, publié le 25/02/2025 |
| SimpleQA Verified (Epoch AI) | non évalué par Epoch AI | |||
| SWE-bench Verified (Epoch AI) | non évalué par Epoch AI | |||
Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Prix par fournisseur d’API
| Fournisseur | Entrée $/M | Sortie $/M | Mélangé | Clé LiteLLM |
|---|---|---|---|---|
| Hyperbolic | 0,12 $ | 0,30 $ | 0,16 $ | hyperbolic/meta-llama/Llama-3.3-70B-Instruct |
| Lambda | 0,12 $ | 0,30 $ | 0,16 $ | lambda_ai/llama3.3-70b-instruct-fp8 |
| Nebius | 0,13 $ | 0,40 $ | 0,20 $ | nebius/meta-llama/Llama-3.3-70B-Instruct |
| Crusoe | 0,20 $ | 0,20 $ | 0,20 $ | crusoe/meta-llama/Llama-3.3-70B-Instruct |
| Nscale | 0,20 $ | 0,20 $ | 0,20 $ | nscale/meta-llama/Llama-3.3-70B-Instruct |
| Novita AI | 0,14 $ | 0,40 $ | 0,20 $ | novita/meta-llama/llama-3.3-70b-instruct |
| DeepInfra | 0,23 $ | 0,40 $ | 0,27 $ | deepinfra/meta-llama/Llama-3.3-70B-Instruct |
| gradient_ai | 0,65 $ | 0,65 $ | 0,65 $ | gradient_ai/llama3.3-70b-instruct |
| OVHcloud | 0,67 $ | 0,67 $ | 0,67 $ | ovhcloud/Meta-Llama-3_3-70B-Instruct |
| Microsoft Azure AI Foundry | 0,71 $ | 0,71 $ | 0,71 $ | azure_ai/Llama-3.3-70B-Instruct |
| Weights & Biases | 0,71 $ | 0,71 $ | 0,71 $ | wandb/meta-llama/Llama-3.3-70B-Instruct |
| Amazon Bedrock | 0,72 $ | 0,72 $ | 0,72 $ | meta.llama3-3-70b-instruct-v1:0 |
| Google Vertex AI | 0,72 $ | 0,72 $ | 0,72 $ | vertex_ai/meta/llama-3.3-70b-instruct-maas |
| Oracle Cloud | 0,72 $ | 0,72 $ | 0,72 $ | oci/meta.llama-3.3-70b-instruct |
| Snowflake | 0,72 $ | 0,72 $ | 0,72 $ | snowflake/llama3.3-70b |
| Databricks | 0,50 $ | 1,50 $ | 0,75 $ | databricks/databricks-meta-llama-3-3-70b-instruct |
| SambaNova | 0,60 $ | 1,20 $ | 0,75 $ | sambanova/Meta-Llama-3.3-70B-Instruct |
| IBM watsonx | 0,75 $ | 0,75 $ | 0,75 $ | watsonx/meta-llama/llama-3-3-70b-instruct |
| Scaleway | 0,90 $ | 0,90 $ | 0,90 $ | scaleway/meta/llama-3.3-70b-instruct |
| Cerebras | 0,85 $ | 1,20 $ | 0,94 $ | cerebras/llama-3.3-70b |
| Together AI | 1,04 $ | 1,04 $ | 1,04 $ | together_ai/meta-llama/Llama-3.3-70B-Instruct-Turbo |
$ par million de jetons, tarif catalogue sans remise, sans cache ni traitement par lots. 21 offres rapprochées. Écart entre le moins cher (Hyperbolic, 0,16 $) et le plus cher : × 6,3. Relevé du 07/10/2026 ; vérifier chez le fournisseur avant de choisir. Sources : Prix : LiteLLM (BerriAI), licence MIT, © 2023 Berri AI. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
L’héberger soi-même
- Accès aux poids
- poids ouverts, usage restreint par la licence (Epoch AI, CC BY 4.0)
- Licence
- Llama 3.3 Community License (carte du dépôt, déclaration de l’éditeur lue le 01/10/2026 ; lire la licence avant tout usage commercial)
- Taille
- 70 Md de paramètres (Epoch AI, CC BY 4.0 ; note : « 70B »)
- Poids
- huggingface.co/meta-llama/Llama-3.3-70B-Instruct (dépôt rapproché par la table de correspondance, existence vérifiée auprès de Hugging Face le 01/10/2026) Téléchargement soumis à l’acceptation des conditions de l’éditeur sur le dépôt.
Mémoire nécessaire
| Format des poids | Poids seuls | Ordre de grandeur du matériel |
|---|---|---|
| BF16 (pleine précision usuelle) | 140 Go | deux à quatre cartes de 80 Go, ou un Mac de 192 Go |
| FP8 / 8 bits | 70 Go | une carte de centre de données de 80 Go, ou un Mac de 96 Go |
| 4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre) | 42 Go | deux cartes de 24 Go, ou un Mac de 64 Go de mémoire unifiée |
Calcul du Crible : 70 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs.
Outils
- vLLM (serveur, cartes graphiques) :
vllm serve meta-llama/Llama-3.3-70B-Instructsert le dépôt Hugging Face derrière une API compatible OpenAI. Le modèle doit être pris en charge par la version installée. - llama.cpp (ordinateur, processeur ou carte graphique) : lit les poids au format GGUF, souvent publiés en 4 bits par la communauté. Chercher une version GGUF (rien ne garantit qu’elle existe ni qu’elle est fidèle), puis
llama-server -hf <dépôt GGUF>. - Ollama (le plus simple sur un ordinateur) :
ollama run hf.co/<dépôt GGUF>lance une version GGUF publiée sur Hugging Face.
Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Évolution
Aucun changement de prix relevé depuis le début de nos relevés quotidiens.