Was führt dieses LLM aus?

Wählen Sie das Modell, das Sie betreiben möchten. Wir bemessen es am veröffentlichten Checkpoint und listen die günstigsten heute mietbaren Konfigurationen, die es fassen — jeweils mit On-Demand- und Serverless-Tarif.

1 · Modell wählen

Modell
Präzision
Kontext

Für diese Architektur veröffentlichen wir keine Kontextlängen-Schätzung.

2 · Was es braucht

Qwen3.6 27B mit 16 Bit

67 GB VRAM

bei kurzem Kontext — am veröffentlichten Checkpoint gemessen, nicht aus der Parameterzahl geschätzt.

Modellgewichte
56 GB
KV-Cacheim Overhead enthalten
Laufzeit-Overhead20 % der Gewichte
11 GB

Über dieses Modell

Qwen3.6 27BAlibaba
Parameter
27,8 Mrd.
Veröffentlicht in
16 Bit
Gemessene Gewichte
56 GB
Quell-CheckpointQwen/Qwen3.6-27B

3 · Wo es läuft

Buchbare Konfigurationen

Günstigste zuerst, geprüft gegen 98 GPU-Typen mit aktuell buchbarer Kapazität.

KonfigurationVRAM gesamtOn-DemandServerlessGPU-Details
8× NVIDIA Tesla V100 16GB
128 GB
61 GB frei
0,21 €/Std.
0,03 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
6× NVIDIA RTX 3060
72 GB
5,3 GB frei
0,26 €/Std.
0,04 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
7× NVIDIA GTX 1070Knapp
56 GB
11 GB unter dem Puffer
0,30 €/Std.
0,04 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
4× NVIDIA Tesla P100Knapp
64 GB
2,7 GB unter dem Puffer
0,31 €/Std.
0,08 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
7× NVIDIA Titan Xp
84 GB
17 GB frei
0,36 €/Std.
0,05 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
7× NVIDIA GTX 1080 Ti
77 GB
10 GB frei
0,36 €/Std.
0,05 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
6× NVIDIA RTX A4000
96 GB
29 GB frei
0,36 €/Std.
0,06 €/GPU-Std.
Vast.ai logoVast.ai
Alle Preise
1× NVIDIA A100 80GB
80 GB
13 GB frei
0,37 €/Std.
Vast.ai logoVast.ai
1,70 €/Std.
Verda logoVerda
Alle Preise

Die 8 günstigsten werden angezeigt. Modellgewichte plus 20 % Laufzeit-Overhead, aus gemessenen Checkpoint-Größen; eine angegebene Kontextlänge addiert ihren KV-Cache. Jeder Preis ist der günstigste buchbare Tarif für genau diese Instanzgröße, für die gesamte Konfiguration — der günstigere der beiden ist hervorgehoben und bestimmt die Sortierung. Ein ×N-Wert ist der gesamte VRAM über N Karten und sagt nichts über den Durchsatz der Verbindung aus.

Wie das berechnet wird

Die Gewichtsgrößen werden an den tatsächlichen Checkpoint-Dateien auf Hugging Face gemessen — nie aus der Parameterzahl abgeleitet, die bei quantisierten Releases danebenliegt. Auf die Gewichte rechnen wir 20 % für Aktivierungen, CUDA-Kontext und Allocator-Reserve. Eine angegebene Kontextlänge addiert ihren KV-Cache explizit, berechnet nur für Architekturen, deren Cache-Form die Konfiguration eindeutig angibt.

Eine Konfiguration, die Gewichte und Cache fasst, aber nicht diesen vollen Puffer, wird als knapp markiert statt ausgeblendet — sie lädt und läuft womöglich bei Batchgröße eins, unter Last ist aber mit Problemen zu rechnen.

Preise sind der günstigste buchbare Tarif für genau diese Instanzgröße, aktualisiert mit dem übrigen Katalog.

Weitersuchen