Welches Open-Weight-LLM sollten Sie betreiben?
Vergleichen Sie 23 Modelle nach Größe, Lizenz und dem VRAM, den sie tatsächlich benötigen, und sehen Sie die günstigste Cloud-GPU, die jedes Modell jetzt fasst.
| Vergleichen | Modell | Lizenz | VRAM für den Betrieb | Günstigster Betrieb | Max. Kontext | Aktionen |
|---|---|---|---|---|---|---|
| Qwen3 8BAlibaba8,2 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 40K | Was führt es aus? | ||
| Gemma 4 31BGoogle31,3 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 256K | Was führt es aus? | ||
| Qwen3 4BAlibaba4 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 40K | Was führt es aus? | ||
| gpt-oss-20bOpenAI21 Mrd.3,6 Mrd. aktivveröffentlicht in 4 Bit | Nicht angegeben |
| 128K | Was führt es aus? | ||
| Llama 3.1 8B InstructMeta8 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| — | Was führt es aus? | ||
| Qwen3.6 27BAlibaba27,8 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 256K | Was führt es aus? | ||
| gpt-oss-120bOpenAI117 Mrd.5,1 Mrd. aktivveröffentlicht in 4 Bit | Nicht angegeben |
| 128K | Was führt es aus? | ||
| Qwen3 32BAlibaba32,8 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 40K | Was führt es aus? | ||
| Qwen3.6 35B-A3BAlibaba35 Mrd.3 Mrd. aktivveröffentlicht in 16 Bit | Nicht angegeben |
| 256K | Was führt es aus? | ||
| Mistral 7B Instruct v0.3Mistral AI7,2 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 32K | Was führt es aus? | ||
| Kimi K3Moonshot AI2,8 Bio.104 Mrd. aktivveröffentlicht in 4 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? | ||
| GLM-4.7 FlashZ.ai31,2 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 198K | Was führt es aus? | ||
| DeepSeek V4 FlashDeepSeek284 Mrd.veröffentlicht in 4 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? | ||
| GLM-5.2Z.ai753 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? | ||
| DeepSeek R1DeepSeek671 Mrd.37 Mrd. aktivveröffentlicht in 8 Bit | Nicht angegeben |
| 160K | Was führt es aus? | ||
| Granite 4.1 8BIBM8,8 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 128K | Was führt es aus? | ||
| Gemma 3 12BGoogle12,2 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| — | Was führt es aus? | ||
| DeepSeek V4 ProDeepSeek1,6 Bio.49 Mrd. aktivveröffentlicht in 4 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? | ||
| Kimi K2.5Moonshot AI1 Bio.32 Mrd. aktivveröffentlicht in 4 Bit | Nicht angegeben |
| 256K | Was führt es aus? | ||
| Qwen3 235B-A22BAlibaba235 Mrd.22 Mrd. aktivveröffentlicht in 16 Bit | Nicht angegeben |
| 40K | Was führt es aus? | ||
| Mistral Small 3.2 24BMistral AI24 Mrd.veröffentlicht in 16 Bit | Nicht angegeben |
| 128K | Was führt es aus? | ||
| Laguna-S 2.1Poolside118 Mrd.8 Mrd. aktivveröffentlicht in 16 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? | ||
| Solar Open2 250BUpstage250 Mrd.15 Mrd. aktivveröffentlicht in 16 Bit | Nicht angegeben |
| 1.024K | Was führt es aus? |
Wie diese Tabelle entsteht
Jede Größe wird an den Gewichtsdateien des veröffentlichten Checkpoints auf Hugging Face gemessen — nie aus der Parameterzahl abgeleitet, die bei quantisierten Releases danebenliegt. Der für den Betrieb benötigte VRAM besteht aus diesen Gewichten plus 20 % für Aktivierungen, CUDA-Kontext und Allocator-Reserve bei kurzem Kontext. Ein Modell wird nie über die Präzision hinaus bemessen, in der es veröffentlicht wurde.
Günstigster Betrieb ist der niedrigste buchbare Tarif, On-Demand oder Serverless, für die kleinste Konfiguration, die ein Anbieter tatsächlich verkauft und die das Modell fasst — immer mit Mietart gekennzeichnet, denn ein Scale-to-Zero-Tarif ist kein Stundentarif. Der Preis gilt für die gesamte Konfiguration.
Die Lizenz ist das einzige Feld, das wir nicht gemessen haben: Sie entspricht der Angabe auf der Modellkarte und wird auch so gekennzeichnet. Benchmark-Werte gibt es hier bewusst nicht — Qualitätsbewertungen sind kuratierte Fremddaten, und dieser Katalog führt nur Zahlen, für die wir einstehen können.