Was führt dieses LLM aus?
Wählen Sie das Modell, das Sie betreiben möchten. Wir bemessen es am veröffentlichten Checkpoint und listen die günstigsten heute mietbaren Konfigurationen, die es fassen — jeweils mit On-Demand- und Serverless-Tarif.
1 · Modell wählen
2 · Was es braucht
Qwen3 235B-A22B mit 16 Bit
564 GB VRAM
bei kurzem Kontext — am veröffentlichten Checkpoint gemessen, nicht aus der Parameterzahl geschätzt.
- Modellgewichte
- 470 GB
- KV-Cacheim Overhead enthalten
- —
- Laufzeit-Overhead20 % der Gewichte
- 94 GB
Über dieses Modell
- Parameter
- 235 Mrd.
- Aktiv pro Token
- 22 Mrd.
- Veröffentlicht in
- 16 Bit
- Gemessene Gewichte
- 470 GB
3 · Wo es läuft
Buchbare Konfigurationen
Günstigste zuerst, geprüft gegen 98 GPU-Typen mit aktuell buchbarer Kapazität.
| Konfiguration | VRAM gesamt | On-Demand | Serverless | GPU-Details |
|---|---|---|---|---|
| 8× NVIDIA A100 80GB | 640 GB 76 GB frei | 4,89 €/Std. 0,61 €/GPU-Std. | 13,56 €/Std. 1,70 €/GPU-Std. | Alle Preise |
| 8× NVIDIA RTX PRO 6000 | 768 GB 204 GB frei | 6,89 €/Std. 0,86 €/GPU-Std. Lium | 14,32 €/Std. 1,79 €/GPU-Std. | Alle Preise |
| 8× Intel Gaudi 2 | 768 GB 204 GB frei | 7,15 €/Std. 0,89 €/GPU-Std. | — | Alle Preise |
| 4× AMD Instinct MI300X | 768 GB 204 GB frei | 9,78 €/Std. 2,45 €/GPU-Std. | — | Alle Preise |
| 4× AMD Instinct MI325X | 1.024 GB 460 GB frei | 10,63 €/Std. 2,66 €/GPU-Std. | — | Alle Preise |
| 16× NVIDIA RTX 5090Knapp | 512 GB 52 GB unter dem Puffer | 12,12 €/Std. 0,76 €/GPU-Std. | — | Alle Preise |
| 8× NVIDIA H100 | 640 GB 76 GB frei | 12,88 €/Std. 1,61 €/GPU-Std. | 24,62 €/Std. 3,08 €/GPU-Std. | Alle Preise |
| 2× NVIDIA B300 | 576 GB 12 GB frei | 12,91 €/Std. 6,46 €/GPU-Std. | 14,21 €/Std. 7,10 €/GPU-Std. | Alle Preise |
Die 8 günstigsten werden angezeigt. Modellgewichte plus 20 % Laufzeit-Overhead, aus gemessenen Checkpoint-Größen; eine angegebene Kontextlänge addiert ihren KV-Cache. Jeder Preis ist der günstigste buchbare Tarif für genau diese Instanzgröße, für die gesamte Konfiguration — der günstigere der beiden ist hervorgehoben und bestimmt die Sortierung. Ein ×N-Wert ist der gesamte VRAM über N Karten und sagt nichts über den Durchsatz der Verbindung aus.
Wie das berechnet wird
Die Gewichtsgrößen werden an den tatsächlichen Checkpoint-Dateien auf Hugging Face gemessen — nie aus der Parameterzahl abgeleitet, die bei quantisierten Releases danebenliegt. Auf die Gewichte rechnen wir 20 % für Aktivierungen, CUDA-Kontext und Allocator-Reserve. Eine angegebene Kontextlänge addiert ihren KV-Cache explizit, berechnet nur für Architekturen, deren Cache-Form die Konfiguration eindeutig angibt.
Eine Konfiguration, die Gewichte und Cache fasst, aber nicht diesen vollen Puffer, wird als knapp markiert statt ausgeblendet — sie lädt und läuft womöglich bei Batchgröße eins, unter Last ist aber mit Problemen zu rechnen.
Preise sind der günstigste buchbare Tarif für genau diese Instanzgröße, aktualisiert mit dem übrigen Katalog.
