Fiche modèle
LLaMA-65B
Meta AI · poids ouverts · sorti le 24/02/2023
Date de sortie, éditeur et accès : Epoch AI, CC BY 4.0. Fiche régénérée le 07/10/2026.
Taille
65 Md
paramètres
Scores
Rang parmi les 274 modèles de l’indice ECI évalués par la même source. Un nom de benchmark mène à son explication.
| Benchmark | Score | Rang | Réglage | Source |
|---|---|---|---|---|
| Indice de capacités ECI (Epoch AI)Capacités générales | 110,2101,4–114,1 | 227 / 274 | Epoch AI, CC BY 4.0, non daté par la source, vu publié le 07/10/2026 | |
| LMArena texte, contrôle du style | absent du classement LMArena, ou nom non rapproché par la table de correspondance | |||
| GPQA Diamond (Epoch AI) | non évalué par Epoch AI | |||
| FrontierMath, niveaux 1 à 3 (Epoch AI) | non évalué par Epoch AI | |||
| OTIS Mock AIME 2024-2025 (Epoch AI) | non évalué par Epoch AI | |||
| SimpleQA Verified (Epoch AI) | non évalué par Epoch AI | |||
| SWE-bench Verified (Epoch AI) | non évalué par Epoch AI | |||
Sources : Epoch AI, « Capabilities & benchmarking », epoch.ai/benchmarks (CC BY 4.0). Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Prix par fournisseur d’API
Aucun prix d’API pour ce modèle dans la table LiteLLM (ou aucun nom rapproché). Ce n’est pas la preuve qu’aucune offre n’existe.
L’héberger soi-même
- Accès aux poids
- poids ouverts, usage non commercial (Epoch AI, CC BY 4.0)
- Licence
- non relevée : pas de dépôt officiel, voir la publication de l’éditeur
- Taille
- 65 Md de paramètres (Epoch AI, CC BY 4.0 ; note : « Model card, table 1: https://github.com/facebookresearch/llama/blob/53011c3d7946dadb8274a4c5c7586ab54edf792d/MODEL_CARD.md »)
- Poids
- pas de dépôt officiel sur Hugging Face. Meta n'a jamais publié les poids de LLaMA (février 2023) sur Hugging Face : ils étaient envoyés sur demande, pour la recherche. Les dépôts qui les portent sont des copies de tiers. (publication : arxiv.org/abs/2302.13971, lien d’Epoch AI)
Mémoire nécessaire
| Format des poids | Poids seuls | Ordre de grandeur du matériel |
|---|---|---|
| BF16 (pleine précision usuelle) | 130 Go | deux à quatre cartes de 80 Go, ou un Mac de 192 Go |
| FP8 / 8 bits | 65 Go | une carte de centre de données de 80 Go, ou un Mac de 96 Go |
| 4 bits (GGUF Q4_K_M, environ 4,8 bits par paramètre) | 39 Go | deux cartes de 24 Go, ou un Mac de 64 Go de mémoire unifiée |
Calcul du Crible : 65 Md de paramètres × 2 octets (BF16), × 1 (FP8), × 0,6 environ (4 bits). Ajouter le cache de contexte, qui grandit avec la longueur des conversations et le nombre d’utilisateurs.
Outils
- vLLM (serveur, cartes graphiques) :
vllm serve <organisation/dépôt>avec le dépôt Hugging Face des poids, si le modèle y est publié. - llama.cpp (ordinateur, processeur ou carte graphique) : lit les poids au format GGUF, souvent publiés en 4 bits par la communauté. Chercher une version GGUF (rien ne garantit qu’elle existe ni qu’elle est fidèle), puis
llama-server -hf <dépôt GGUF>. - Ollama (le plus simple sur un ordinateur) :
ollama run hf.co/<dépôt GGUF>lance une version GGUF publiée sur Hugging Face.
Commandes d’après la documentation de chaque outil (liens ci-dessus). Les tailles, l’accès et les liens viennent des sources citées ; de Hugging Face, Le Crible ne reprend que l’adresse du dépôt et l’identifiant de licence déclaré sur sa carte. Sources : Epoch AI, « Data on AI models », epoch.ai/data/ai-models (CC BY 4.0) ; LMArena, leaderboard-dataset (Hugging Face), CC BY 4.0. Données adaptées : pourcentages, arrondis, meilleur réglage retenu, prix mélangé, rangs et frontière calculés ici.
Évolution
Pas encore deux classements LMArena relevés pour ce modèle.