GPU-Seiten listen beliebte Open-Weight-LLMs und den VRAM, den sie unserer Schätzung nach benötigen. Die Größe der Gewichte wird aus den Dateien des veröffentlichten Checkpoints auf Hugging Face gemessen und nicht aus der Parameterzahl berechnet — parameterbasierte Rechnungen sind bei Modellen in neueren quantisierten Formaten unzuverlässig. Ein Checkpoint, dessen gemessene Größe zu keiner uns bekannten Präzision passt, wird zurückgehalten statt geschätzt veröffentlicht.
Zu den Gewichten addieren wir 20 % für KV-Cache, Aktivierungen und Framework-Overhead, ausgehend von kurzen Kontextlängen. Lange Kontexte, große Batches, spekulatives Decoding und der parallele Betrieb mehrerer Modelle benötigen mehr. Größen für eine Präzision, in der ein Modell nicht veröffentlicht wurde (etwa eine 4-Bit-Version einer 16-Bit-Veröffentlichung), schätzen wir aus gemessenen Community-Quantisierungen und runden auf. Ein Modell, dessen Gewichte passen, dessen Overhead aber nicht, wird als knapper Fit ausgewiesen — mit dem Puffer, den diese Konfiguration tatsächlich lässt: Es lädt, aber ein langer Kontext oder ein großer Batch kann den Speicher trotzdem sprengen.
Ein „×N“-Wert bedeutet, dass das Modell in den gesamten VRAM von N dieser GPUs passt. Er sagt nichts über die Bandbreite der Verbindung aus, die wir nicht erfassen und die darüber entscheidet, ob die Aufteilung eines Modells auf mehrere Karten tatsächlich schnell ist. Betrachten Sie jede Angabe als Ausgangspunkt und prüfen Sie sie vor einer Buchung.