Was führt dieses LLM aus?

Wählen Sie das Modell, das Sie betreiben möchten. Wir bemessen es am veröffentlichten Checkpoint und listen die günstigsten heute mietbaren Konfigurationen, die es fassen — jeweils mit On-Demand- und Serverless-Tarif.

1 · Modell wählen

Modell
Präzision

Nur in 4 Bit veröffentlicht — wir rechnen nie über den ausgelieferten Checkpoint hinaus.

Kontext

Für diese Architektur veröffentlichen wir keine Kontextlängen-Schätzung.

2 · Was es braucht

DeepSeek V4 Pro mit 4 Bit

1.038 GB VRAM

bei kurzem Kontext — am veröffentlichten Checkpoint gemessen, nicht aus der Parameterzahl geschätzt.

Modellgewichte
865 GB
KV-Cacheim Overhead enthalten
Laufzeit-Overhead20 % der Gewichte
173 GB

Über dieses Modell

DeepSeek V4 ProDeepSeek
Parameter
1,6 Bio.
Aktiv pro Token
49 Mrd.
Veröffentlicht in
4 Bit
Gemessene Gewichte
865 GB
Quell-Checkpointdeepseek-ai/DeepSeek-V4-Pro

3 · Wo es läuft

Buchbare Konfigurationen

Günstigste zuerst, geprüft gegen 98 GPU-Typen mit aktuell buchbarer Kapazität.

KonfigurationVRAM gesamtOn-DemandServerlessGPU-Details
8× AMD Instinct MI300X
1.536 GB
498 GB frei
19,36 €/Std.
2,42 €/GPU-Std.
Cyfuture AI logoCyfuture AI
Alle Preise
8× AMD Instinct MI325X
2.048 GB
1.010 GB frei
21,05 €/Std.
2,63 €/GPU-Std.
Cyfuture AI logoCyfuture AI
Alle Preise
4× NVIDIA B300
1.152 GB
114 GB frei
25,83 €/Std.
6,46 €/GPU-Std.
Verda logoVerda
28,41 €/Std.
7,10 €/GPU-Std.
Verda logoVerda
Alle Preise
4× NVIDIA B300 CC
1.152 GB
114 GB frei
26,35 €/Std.
6,59 €/GPU-Std.
Verda logoVerda
Alle Preise
8× NVIDIA H200
1.128 GB
90 GB frei
27,55 €/Std.
3,44 €/GPU-Std.
Verda logoVerda
30,31 €/Std.
3,79 €/GPU-Std.
Verda logoVerda
Alle Preise
4× NVIDIA GB300
1.152 GB
114 GB frei
29,69 €/Std.
7,42 €/GPU-Std.
Verda logoVerda
Alle Preise
8× NVIDIA B200
1.440 GB
402 GB frei
35,13 €/Std.
4,39 €/GPU-Std.
Beyond.pl logoBeyond.pl
46,29 €/Std.
5,79 €/GPU-Std.
Verda logoVerda
Alle Preise
8× NVIDIA B200 CC
1.440 GB
402 GB frei
42,93 €/Std.
5,37 €/GPU-Std.
Verda logoVerda
Alle Preise

Modellgewichte plus 20 % Laufzeit-Overhead, aus gemessenen Checkpoint-Größen; eine angegebene Kontextlänge addiert ihren KV-Cache. Jeder Preis ist der günstigste buchbare Tarif für genau diese Instanzgröße, für die gesamte Konfiguration — der günstigere der beiden ist hervorgehoben und bestimmt die Sortierung. Ein ×N-Wert ist der gesamte VRAM über N Karten und sagt nichts über den Durchsatz der Verbindung aus.

Wie das berechnet wird

Die Gewichtsgrößen werden an den tatsächlichen Checkpoint-Dateien auf Hugging Face gemessen — nie aus der Parameterzahl abgeleitet, die bei quantisierten Releases danebenliegt. Auf die Gewichte rechnen wir 20 % für Aktivierungen, CUDA-Kontext und Allocator-Reserve. Eine angegebene Kontextlänge addiert ihren KV-Cache explizit, berechnet nur für Architekturen, deren Cache-Form die Konfiguration eindeutig angibt.

Eine Konfiguration, die Gewichte und Cache fasst, aber nicht diesen vollen Puffer, wird als knapp markiert statt ausgeblendet — sie lädt und läuft womöglich bei Batchgröße eins, unter Last ist aber mit Problemen zu rechnen.

Preise sind der günstigste buchbare Tarif für genau diese Instanzgröße, aktualisiert mit dem übrigen Katalog.

Weitersuchen