Lokale KI
Welche Hardware braucht ein lokales Sprachmodell?
Die häufigste Frage vor einem lokalen KI-Projekt lautet: Welche Hardware brauchen wir? Die Antwort hängt an drei Größen – Modellgröße, Kontextlänge und gleichzeitige Nutzer. Mit ein paar Faustregeln lässt sich die Größenordnung selbst abschätzen.
Von Christoph Weiß · Veröffentlicht · 3 Min. Lesezeit
Der Engpass ist der Speicher
Ein Sprachmodell muss für schnelle Antworten vollständig in den Speicher der GPU (oder in einen schnellen gemeinsamen Speicher) passen. Rechenleistung ist wichtig, aber in der Praxis entscheidet zuerst die Frage: Passt das Modell überhaupt hinein – und bleibt genug Platz für die laufenden Anfragen?
Faustregel für die Modellgewichte
Der Speicherbedarf der Modellgewichte ergibt sich grob aus Anzahl der Parameter × Bytes pro Parameter. Wie viele Bytes ein Parameter belegt, hängt von der Genauigkeit ab, in der das Modell geladen wird:
| Genauigkeit | Bytes je Parameter | Modell mit 8 Mrd. Parametern | Modell mit 70 Mrd. Parametern |
|---|---|---|---|
| 16 Bit (FP16/BF16) | 2 | ca. 16 GB | ca. 140 GB |
| 8 Bit (z. B. FP8) | 1 | ca. 8 GB | ca. 70 GB |
| 4 Bit (quantisiert) | ca. 0,5 | ca. 4–5 GB | ca. 35–40 GB |
Niedrigere Genauigkeit (Quantisierung) spart viel Speicher. Moderne Verfahren halten den Qualitätsverlust bei 8 Bit meist gering; bei 4 Bit hängt er stärker vom Modell und der Aufgabe ab. Deshalb gilt: mit den eigenen Anwendungsfällen testen.
Sonderfall Mixture-of-Experts
Viele aktuelle Modelle sind sogenannte Mixture-of-Experts-Modelle (MoE). Sie haben sehr viele Parameter insgesamt, nutzen pro Token aber nur einen kleinen Teil davon. Für den Speicherbedarf zählen alle Parameter, für die Geschwindigkeit eher die aktiven. Ein MoE-Modell braucht also viel Speicher, kann darin aber vergleichsweise schnell antworten.
Der unterschätzte Posten: Kontext und gleichzeitige Nutzer
Zusätzlich zu den Gewichten braucht jede laufende Anfrage Speicher für ihren Kontext, den sogenannten KV-Cache. Er wächst mit der Länge der Eingabe (etwa bei langen Dokumenten oder großen Context-Windows) und mit der Zahl gleichzeitiger Anfragen. Wer zehn Personen parallel lange Verträge analysieren lässt, braucht deutlich mehr Speicher als ein Einzelplatz mit kurzen Fragen.
Inferenz-Server wie vLLM verwalten diesen Speicher effizient und bedienen viele Anfragen parallel. Planen Sie trotzdem großzügig Reserve ein: Ein System, das nur knapp das Modell fasst, ist für den Mehrbenutzerbetrieb zu klein.
Speicherbandbreite bestimmt die Geschwindigkeit
Beim Erzeugen jedes Tokens müssen die aktiven Gewichte aus dem Speicher gelesen werden. Die Speicherbandbreite ist daher ein guter Anhaltspunkt dafür, wie schnell ein System antwortet. Zwei Beispiele aus den Datenblättern des Herstellers zeigen die Spannweite:
- NVIDIA DGX Spark: 128 GB gemeinsamer Systemspeicher (LPDDR5x) mit 273 GB/s Bandbreite. Viel Speicher auf kleinem Raum – gut, um auch größere Modelle zu laden, etwa für Entwicklung, Tests und kleinere Teams.
- NVIDIA RTX PRO 6000 Blackwell: 96 GB GDDR7 je Karte mit 1.792 GB/s Bandbreite. Deutlich schneller beim Lesen, und mehrere Karten lassen sich in einem Server kombinieren – geeignet für viele gleichzeitige Nutzer.
Wie schnell ein konkretes Modell tatsächlich läuft, hängt außerdem von Quantisierung, Software-Version, Kontextlänge und Last ab. Seriöse Geschwindigkeitsangaben nennen deshalb immer die Messbedingungen – siehe Wie schnell ist lokale KI?
Drei typische Größenklassen
| Szenario | Typische Hardware | Geeignet für |
|---|---|---|
| Einzelplatz und Entwicklung | Kompaktes System mit viel gemeinsamem Speicher, z. B. DGX Spark | Prototypen, Tests, einzelne Fachanwender, kleine Teams |
| Abteilung | Server mit ein bis zwei großen GPUs | Wissensassistent (RAG) und Textaufgaben für Dutzende Nutzer |
| Unternehmensweit | Server mit mehreren GPUs, ggf. mehrere Server | Viele parallele Nutzer, mehrere Modelle, Automatisierungen |
Was neben der GPU zählt
- Strom und Kühlung: Eine einzelne RTX PRO 6000 Blackwell (Workstation-Version) ist laut Hersteller für bis zu 600 W ausgelegt. Mehrere Karten brauchen einen Standort mit passender Stromversorgung und Kühlung.
- Netzwerk und Anbindung: Der Server muss sicher an die Anwendungen und Datenquellen angebunden werden, etwa für RAG über interne Dokumente.
- Betrieb: Modell- und Sicherheitsupdates, Monitoring und Backups gehören von Anfang an in die Planung.
- Reserve: Neue Modelle werden oft größer oder erlauben längere Kontexte. Etwas Luft nach oben verlängert die Nutzungsdauer.
So kommen Sie zur richtigen Größe
- Anwendungsfälle und erwartete Nutzerzahl festhalten.
- Passende Modelle auswählen und mit echten Beispielen testen – das geht auch ohne eigene Hardware.
- Speicherbedarf aus Modell, Genauigkeit, Kontextlänge und Parallelität abschätzen.
- Hardware mit Reserve auswählen und die Leistung nach dem Aufbau mit den eigenen Anfragen messen.
