NVIDIA RTX 4000 Ada Generation
Carte de classe entreprise, le GPU NVIDIA RTX 4000 Ada Generation repose sur l'architecture Ada Lovelace et dispose de 20 GB de mémoire, avec une bande passante mémoire de 360 GB/s et un TDP de 100 W. Il offre 26,7 TFLOPS de performances FP32. Actuellement disponible chez 5 fournisseurs à partir de 0,25 €/GPU/heure, avec une médiane du marché de 0,67 €/GPU/heure sur 5 configurations.
Caractéristiques matérielles
Identiques chez tous les fournisseurs
Prix médian sur l'ensemble des fournisseurs
5 offres chez 5 fournisseurs
Triées par prix croissant. Comparez les configurations côte à côte.
LLM qui tiennent sur le GPU NVIDIA RTX 4000 Ada Generation
VRAM estimée des LLM à poids ouverts populaires en précision 16 bits (FP16/BF16), 8 bits (FP8/INT8) et 4 bits (INT4/MXFP4), pour 20 GB par GPU.
| Modèle | Paramètres | 16 bits | 8 bits | 4 bits |
|---|---|---|---|---|
| GLM-4.7 Flash Z.ai | 31,2B | 75 GB Trop grand | 41 GB Trop grand | 24 GB Juste sur 1× · 0 % de marge |
| Qwen3.6 27B Alibaba | 27,8B | 67 GB Trop grand | 37 GB Trop grand | 21 GB Juste sur 1× · 12 % de marge |
| Mistral Small 3.2 24B Mistral AI | 24B | 58 GB Trop grand | 32 GB Trop grand | 18 GB 1× · 1,6 GB libres |
| gpt-oss-20b OpenAI | 21B 3,6B actifs | — Non publié | — Non publié | 17 GB 1× · 3,5 GB libres |
| Gemma 3 12B Google | 12,2B | 29 GB Trop grand | 16 GB 1× · 3,9 GB libres | 9,4 GB 1× · 11 GB libres |
| Granite 4.1 8B IBM | 8,8B | 21 GB Juste sur 1× · 13 % de marge | 12 GB 1× · 8,4 GB libres | 6,8 GB 1× · 13 GB libres |
| Qwen3 8B Alibaba | 8,2B | 20 GB Tient tout juste sur 1× | 11 GB 1× · 9,2 GB libres | 6,3 GB 1× · 14 GB libres |
| Llama 3.1 8B Instruct Meta | 8B | 19 GB Tient tout juste sur 1× | 11 GB 1× · 9,4 GB libres | 6,2 GB 1× · 14 GB libres |
| Mistral 7B Instruct v0.3 Mistral AI | 7,2B | 17 GB 1× · 2,6 GB libres | 9,6 GB 1× · 10 GB libres | 5,6 GB 1× · 14 GB libres |
| Qwen3 4B Alibaba | 4B | 9,7 GB 1× · 10 GB libres | 5,3 GB 1× · 15 GB libres | 3,1 GB 1× · 17 GB libres |
Estimations : poids du modèle plus 20 % pour le cache KV et le surcoût du runtime, avec des contextes courts. Les contextes longs et les lots importants demandent davantage. Les lignes marquées « juste » contiennent les poids, mais pas toute cette marge. Une valeur ×N correspond à la VRAM totale de N de ces GPU et ne préjuge en rien du débit de l'interconnexion. Notre méthode d'estimation · Partir plutôt d'un modèle
Vous en voulez plus sur cette page ?
Des données erronées ?


