Carte grand public, le GPU NVIDIA RTX 4060 Ti repose sur l'architecture Ada Lovelace et dispose de 8 GB de mémoire, avec une bande passante mémoire de 288 GB/s et un TDP de 160 W. Il offre 22,1 TFLOPS de performances FP32. Actuellement disponible chez 3 fournisseurs à partir de 0,10 €/GPU/heure, avec une médiane du marché de 0,12 €/GPU/heure sur 12 configurations.
Caractéristiques matérielles
Identiques chez tous les fournisseurs
Prix médian sur l'ensemble des fournisseurs
3 offres chez 3 fournisseurs
Triées par prix croissant. Comparez les configurations côte à côte.
| Fournisseur | Nombre | vCPU | RAM | Région | Par heure de GPU | Total/h | Action |
|---|---|---|---|---|---|---|---|
| ×4 | 40 | 126 GB | À partir de0,096 € +40,9 % 30 j | À partir de0,39 € | Lancer | ||
| ×2 | 32 | 63 GB | À partir de0,101 € +25,0 % 30 j | À partir de0,20 € | Lancer | ||
Theta EdgeCloudTendance | ×1 | 20 | 16 GB | 0,105 € -14,3 % 30 j | À partir de0,11 € | Lancer |
LLM qui tiennent sur le GPU NVIDIA RTX 4060 Ti
VRAM estimée des LLM à poids ouverts populaires en précision 16 bits (FP16/BF16), 8 bits (FP8/INT8) et 4 bits (INT4/MXFP4), pour 8 GB par GPU. Affichage des 12 plus grands qui tiennent.
| Modèle | Paramètres | 16 bits | 8 bits | 4 bits |
|---|---|---|---|---|
| Qwen3.6 35B-A3B Alibaba | 35B 3B actifs | 86 GB Trop grand | 47 GB Trop grand | 28 GB 4× · 4,4 GB libres |
| Qwen3 32B Alibaba | 32,8B | 79 GB Trop grand | 43 GB Trop grand | 25 GB 4× · 6,8 GB libres |
| Gemma 4 31B Google | 31,3B | 75 GB Trop grand | 41 GB Trop grand | 24 GB 4× · 8 GB libres |
| GLM-4.7 Flash Z.ai | 31,2B | 75 GB Trop grand | 41 GB Trop grand | 24 GB 4× · 8 GB libres |
| Qwen3.6 27B Alibaba | 27,8B | 67 GB Trop grand | 37 GB Juste sur 4× · 4 % de marge | 21 GB 4× · 11 GB libres |
| Mistral Small 3.2 24B Mistral AI | 24B | 58 GB Trop grand | 32 GB Tient tout juste sur 4× | 18 GB 4× · 14 GB libres ou 2× · 4 % de marge |
| gpt-oss-20b OpenAI | 21B 3,6B actifs | — Non publié | — Non publié | 17 GB 4× · 15 GB libres ou 2× · 16 % de marge |
| Gemma 3 12B Google | 12,2B | 29 GB 4× · 2,8 GB libres | 16 GB 4× · 16 GB libres ou 2× · 19 % de marge | 9,4 GB 2× · 6,6 GB libres ou 1× · 2 % de marge |
| Granite 4.1 8B IBM | 8,8B | 21 GB 4× · 11 GB libres | 12 GB 2× · 4,4 GB libres | 6,8 GB 1× · 1,2 GB libres |
| Qwen3 8B Alibaba | 8,2B | 20 GB 4× · 12 GB libres | 11 GB 2× · 5,2 GB libres | 6,3 GB 1× · 1,7 GB libres |
| Llama 3.1 8B Instruct Meta | 8B | 19 GB 4× · 13 GB libres | 11 GB 2× · 5,4 GB libres | 6,2 GB 1× · 1,8 GB libres |
| Mistral 7B Instruct v0.3 Mistral AI | 7,2B | 17 GB 4× · 15 GB libres ou 2× · 10 % de marge | 9,6 GB 2× · 6,4 GB libres ou 1× · 0 % de marge | 5,6 GB 1× · 2,4 GB libres |
Estimations : poids du modèle plus 20 % pour le cache KV et le surcoût du runtime, avec des contextes courts. Les contextes longs et les lots importants demandent davantage. Les lignes marquées « juste » contiennent les poids, mais pas toute cette marge. Une valeur ×N correspond à la VRAM totale de N de ces GPU et ne préjuge en rien du débit de l'interconnexion. Notre méthode d'estimation · Partir plutôt d'un modèle
Vous en voulez plus sur cette page ?
Des données erronées ?

