Welches Open-Weight-LLM sollten Sie betreiben?

Vergleichen Sie 23 Modelle nach Größe, Lizenz und dem VRAM, den sie tatsächlich benötigen, und sehen Sie die günstigste Cloud-GPU, die jedes Modell jetzt fasst.

23 Modelle98 GPU-Typen mit buchbarer Kapazität
Größe
23 von 23 ModellenBis zu 4 Modelle markieren, um sie nebeneinander zu sehen.
VergleichenModellLizenzVRAM für den BetriebGünstigster BetriebMax. KontextAktionen
Qwen3 8BAlibaba8,2 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
20 GB
8 Bit
11 GB
4 Bit
6,3 GB
1× NVIDIA Tesla P4in 4 Bit0,02 €/Std. On-DemandVast.ai logobei Vast.ai
40KWas führt es aus?
Gemma 4 31BGoogle31,3 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
75 GB
8 Bit
41 GB
4 Bit
24 GB
2× NVIDIA Tesla V100 16GBin 4 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
256KWas führt es aus?
Qwen3 4BAlibaba4 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
9,7 GB
8 Bit
5,3 GB
4 Bit
3,1 GB
1× NVIDIA GTX 1050 Tiin 4 Bit0,01 €/Std. On-DemandVast.ai logobei Vast.ai
40KWas führt es aus?
gpt-oss-20bOpenAI21 Mrd.3,6 Mrd. aktivveröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
17 GB
128KWas führt es aus?
Llama 3.1 8B InstructMeta8 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
19 GB
8 Bit
11 GB
4 Bit
6,2 GB
1× NVIDIA Tesla P4in 4 Bit0,02 €/Std. On-DemandVast.ai logobei Vast.ai
Was führt es aus?
Qwen3.6 27BAlibaba27,8 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
67 GB
8 Bit
37 GB
4 Bit
21 GB
2× NVIDIA Tesla V100 16GBin 4 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
256KWas führt es aus?
gpt-oss-120bOpenAI117 Mrd.5,1 Mrd. aktivveröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
78 GB
128KWas führt es aus?
Qwen3 32BAlibaba32,8 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
79 GB
8 Bit
43 GB
4 Bit
25 GB
2× NVIDIA Tesla V100 16GBin 4 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
40KWas führt es aus?
Qwen3.6 35B-A3BAlibaba35 Mrd.3 Mrd. aktivveröffentlicht in 16 BitNicht angegeben
16 Bit
86 GB
8 Bit
47 GB
4 Bit
28 GB
2× NVIDIA Tesla V100 16GBin 4 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
256KWas führt es aus?
Mistral 7B Instruct v0.3Mistral AI7,2 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
17 GB
8 Bit
9,6 GB
4 Bit
5,6 GB
1× NVIDIA Tesla P4in 8 Bit0,02 €/Std. On-DemandVast.ai logobei Vast.aiKnapp8 GB
32KWas führt es aus?
Kimi K3Moonshot AI2,8 Bio.104 Mrd. aktivveröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
1.873 GB
1.024KWas führt es aus?
GLM-4.7 FlashZ.ai31,2 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
75 GB
8 Bit
41 GB
4 Bit
24 GB
2× NVIDIA Tesla V100 16GBin 4 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
198KWas führt es aus?
DeepSeek V4 FlashDeepSeek284 Mrd.veröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
192 GB
8× NVIDIA RTX 30900,62 €/Std. On-DemandVast.ai logobei Vast.ai
1.024KWas führt es aus?
GLM-5.2Z.ai753 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
1.808 GB
8 Bit
994 GB
4 Bit
579 GB
8× NVIDIA A100 80GBin 4 Bit4,89 €/Std. On-DemandVast.ai logobei Vast.ai
1.024KWas führt es aus?
DeepSeek R1DeepSeek671 Mrd.37 Mrd. aktivveröffentlicht in 8 BitNicht angegeben
16 Bit
8 Bit
826 GB
4 Bit
481 GB
8× NVIDIA A100 80GBin 4 Bit4,89 €/Std. On-DemandVast.ai logobei Vast.ai
160KWas führt es aus?
Granite 4.1 8BIBM8,8 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
21 GB
8 Bit
12 GB
4 Bit
6,8 GB
1× NVIDIA Tesla P4in 4 Bit0,02 €/Std. On-DemandVast.ai logobei Vast.ai
128KWas führt es aus?
Gemma 3 12BGoogle12,2 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
29 GB
8 Bit
16 GB
4 Bit
9,4 GB
1× NVIDIA Tesla P4in 4 Bit0,02 €/Std. On-DemandVast.ai logobei Vast.aiKnapp8 GB
Was führt es aus?
DeepSeek V4 ProDeepSeek1,6 Bio.49 Mrd. aktivveröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
1.038 GB
1.024KWas führt es aus?
Kimi K2.5Moonshot AI1 Bio.32 Mrd. aktivveröffentlicht in 4 BitNicht angegeben
16 Bit
8 Bit
4 Bit
714 GB
8× NVIDIA A100 80GB4,89 €/Std. On-DemandVast.ai logobei Vast.aiKnapp640 GB
256KWas führt es aus?
Qwen3 235B-A22BAlibaba235 Mrd.22 Mrd. aktivveröffentlicht in 16 BitNicht angegeben
16 Bit
564 GB
8 Bit
310 GB
4 Bit
181 GB
8× NVIDIA RTX 3090in 4 Bit0,62 €/Std. On-DemandVast.ai logobei Vast.ai
40KWas führt es aus?
Mistral Small 3.2 24BMistral AI24 Mrd.veröffentlicht in 16 BitNicht angegeben
16 Bit
58 GB
8 Bit
32 GB
4 Bit
18 GB
2× NVIDIA Tesla V100 16GBin 8 Bit0,05 €/Std. On-DemandVast.ai logobei Vast.ai
128KWas führt es aus?
Laguna-S 2.1Poolside118 Mrd.8 Mrd. aktivveröffentlicht in 16 BitNicht angegeben
16 Bit
282 GB
8 Bit
155 GB
4 Bit
90 GB
8× NVIDIA Tesla V100 16GBin 4 Bit0,21 €/Std. On-DemandVast.ai logobei Vast.ai
1.024KWas führt es aus?
Solar Open2 250BUpstage250 Mrd.15 Mrd. aktivveröffentlicht in 16 BitNicht angegeben
16 Bit
601 GB
8 Bit
330 GB
4 Bit
192 GB
8× NVIDIA RTX 3090in 4 Bit0,62 €/Std. On-DemandVast.ai logobei Vast.aiKnapp192 GB
1.024KWas führt es aus?

Wie diese Tabelle entsteht

Jede Größe wird an den Gewichtsdateien des veröffentlichten Checkpoints auf Hugging Face gemessen — nie aus der Parameterzahl abgeleitet, die bei quantisierten Releases danebenliegt. Der für den Betrieb benötigte VRAM besteht aus diesen Gewichten plus 20 % für Aktivierungen, CUDA-Kontext und Allocator-Reserve bei kurzem Kontext. Ein Modell wird nie über die Präzision hinaus bemessen, in der es veröffentlicht wurde.

Günstigster Betrieb ist der niedrigste buchbare Tarif, On-Demand oder Serverless, für die kleinste Konfiguration, die ein Anbieter tatsächlich verkauft und die das Modell fasst — immer mit Mietart gekennzeichnet, denn ein Scale-to-Zero-Tarif ist kein Stundentarif. Der Preis gilt für die gesamte Konfiguration.

Die Lizenz ist das einzige Feld, das wir nicht gemessen haben: Sie entspricht der Angabe auf der Modellkarte und wird auch so gekennzeichnet. Benchmark-Werte gibt es hier bewusst nicht — Qualitätsbewertungen sind kuratierte Fremddaten, und dieser Katalog führt nur Zahlen, für die wir einstehen können.

Weiter

Häufig gestellte Fragen

Wie wird der VRAM-Bedarf der einzelnen Modelle berechnet?
Aus dem veröffentlichten Checkpoint, nicht aus der Parameterzahl. Wir summieren die Gewichtsdateien des Hugging-Face-Repos jedes Modells, leiten die Präzision aus den gemessenen Bytes pro Parameter ab und rechnen 20% für Aktivierungen, CUDA-Kontext und Allocator-Reserve hinzu. Quantisierte Größen werden nur bis zu der Präzision aufgeführt, in der ein Modell tatsächlich veröffentlicht wurde, und ein Modell, das wir nicht zuverlässig messen können, wird zurückgehalten statt geschätzt.
Wie lässt sich Qwen3 8B derzeit am günstigsten betreiben?
In 4 Bit benötigt Qwen3 8B 6,3 GB VRAM und passt bequem in 1× Tesla P4, buchbar On-Demand ab 0,02 € pro Stunde bei Vast.ai. Das ist die günstigste solche Konfiguration unter den buchbaren Angeboten, die wir erfassen, aktualisiert zusammen mit dem restlichen Katalog; knappe Konfigurationen bleiben in dieser Antwort außen vor.
Welche Modelle sind gelistet?
23 Open-Weight-LLMs, nach Verbreitung kuratiert und an ihren veröffentlichten Checkpoints gemessen. Für jedes Modell zeigt der Katalog die Parameterzahl, die auf der Modellkarte angegebene Lizenz, den VRAM-Bedarf in jeder veröffentlichten Präzision und die günstigste Cloud-GPU-Konfiguration, die es heute fasst — Serverless eingeschlossen.
Warum gibt es keine Benchmark-Werte?
Weil wir sie nicht gemessen haben. Benchmark-Ergebnisse und Arena-Bewertungen sind Fremddaten, die sich mit jedem Evaluierungs-Setup ändern; dieser Katalog führt nur Zahlen, für die wir einstehen können: Größe, VRAM und den Preis für den Betrieb. Nutzen Sie ihn, um Modelle in die engere Wahl zu nehmen, die Sie sich leisten können, und beurteilen Sie die Qualität an Ihrer eigenen Aufgabe.