Zum Inhalt springen
Cervus IT Logo – ein Hirsch mit digitalem Geweih

Lokale KI

Welche Hardware braucht ein lokales Sprachmodell?

Die häufigste Frage vor einem lokalen KI-Projekt lautet: Welche Hardware brauchen wir? Die Antwort hängt an drei Größen – Modellgröße, Kontextlänge und gleichzeitige Nutzer. Mit ein paar Faustregeln lässt sich die Größenordnung selbst abschätzen.

Von Christoph Weiß · Veröffentlicht · 3 Min. Lesezeit

Der Engpass ist der Speicher

Ein Sprachmodell muss für schnelle Antworten vollständig in den Speicher der GPU (oder in einen schnellen gemeinsamen Speicher) passen. Rechenleistung ist wichtig, aber in der Praxis entscheidet zuerst die Frage: Passt das Modell überhaupt hinein – und bleibt genug Platz für die laufenden Anfragen?

Faustregel für die Modellgewichte

Der Speicherbedarf der Modellgewichte ergibt sich grob aus Anzahl der Parameter × Bytes pro Parameter. Wie viele Bytes ein Parameter belegt, hängt von der Genauigkeit ab, in der das Modell geladen wird:

Näherungswerte nur für die Modellgewichte, ohne Kontextspeicher und Laufzeit-Overhead
GenauigkeitBytes je ParameterModell mit 8 Mrd. ParameternModell mit 70 Mrd. Parametern
16 Bit (FP16/BF16)2ca. 16 GBca. 140 GB
8 Bit (z. B. FP8)1ca. 8 GBca. 70 GB
4 Bit (quantisiert)ca. 0,5ca. 4–5 GBca. 35–40 GB

Niedrigere Genauigkeit (Quantisierung) spart viel Speicher. Moderne Verfahren halten den Qualitätsverlust bei 8 Bit meist gering; bei 4 Bit hängt er stärker vom Modell und der Aufgabe ab. Deshalb gilt: mit den eigenen Anwendungsfällen testen.

Sonderfall Mixture-of-Experts

Viele aktuelle Modelle sind sogenannte Mixture-of-Experts-Modelle (MoE). Sie haben sehr viele Parameter insgesamt, nutzen pro Token aber nur einen kleinen Teil davon. Für den Speicherbedarf zählen alle Parameter, für die Geschwindigkeit eher die aktiven. Ein MoE-Modell braucht also viel Speicher, kann darin aber vergleichsweise schnell antworten.

Der unterschätzte Posten: Kontext und gleichzeitige Nutzer

Zusätzlich zu den Gewichten braucht jede laufende Anfrage Speicher für ihren Kontext, den sogenannten KV-Cache. Er wächst mit der Länge der Eingabe (etwa bei langen Dokumenten oder großen Context-Windows) und mit der Zahl gleichzeitiger Anfragen. Wer zehn Personen parallel lange Verträge analysieren lässt, braucht deutlich mehr Speicher als ein Einzelplatz mit kurzen Fragen.

Inferenz-Server wie vLLM verwalten diesen Speicher effizient und bedienen viele Anfragen parallel. Planen Sie trotzdem großzügig Reserve ein: Ein System, das nur knapp das Modell fasst, ist für den Mehrbenutzerbetrieb zu klein.

Speicherbandbreite bestimmt die Geschwindigkeit

Beim Erzeugen jedes Tokens müssen die aktiven Gewichte aus dem Speicher gelesen werden. Die Speicherbandbreite ist daher ein guter Anhaltspunkt dafür, wie schnell ein System antwortet. Zwei Beispiele aus den Datenblättern des Herstellers zeigen die Spannweite:

  • NVIDIA DGX Spark: 128 GB gemeinsamer Systemspeicher (LPDDR5x) mit 273 GB/s Bandbreite. Viel Speicher auf kleinem Raum – gut, um auch größere Modelle zu laden, etwa für Entwicklung, Tests und kleinere Teams.
  • NVIDIA RTX PRO 6000 Blackwell: 96 GB GDDR7 je Karte mit 1.792 GB/s Bandbreite. Deutlich schneller beim Lesen, und mehrere Karten lassen sich in einem Server kombinieren – geeignet für viele gleichzeitige Nutzer.

Wie schnell ein konkretes Modell tatsächlich läuft, hängt außerdem von Quantisierung, Software-Version, Kontextlänge und Last ab. Seriöse Geschwindigkeitsangaben nennen deshalb immer die Messbedingungen – siehe Wie schnell ist lokale KI?

Drei typische Größenklassen

Orientierung – die tatsächliche Dimensionierung hängt von Modell und Nutzung ab
SzenarioTypische HardwareGeeignet für
Einzelplatz und EntwicklungKompaktes System mit viel gemeinsamem Speicher, z. B. DGX SparkPrototypen, Tests, einzelne Fachanwender, kleine Teams
AbteilungServer mit ein bis zwei großen GPUsWissensassistent (RAG) und Textaufgaben für Dutzende Nutzer
UnternehmensweitServer mit mehreren GPUs, ggf. mehrere ServerViele parallele Nutzer, mehrere Modelle, Automatisierungen

Was neben der GPU zählt

  • Strom und Kühlung: Eine einzelne RTX PRO 6000 Blackwell (Workstation-Version) ist laut Hersteller für bis zu 600 W ausgelegt. Mehrere Karten brauchen einen Standort mit passender Stromversorgung und Kühlung.
  • Netzwerk und Anbindung: Der Server muss sicher an die Anwendungen und Datenquellen angebunden werden, etwa für RAG über interne Dokumente.
  • Betrieb: Modell- und Sicherheitsupdates, Monitoring und Backups gehören von Anfang an in die Planung.
  • Reserve: Neue Modelle werden oft größer oder erlauben längere Kontexte. Etwas Luft nach oben verlängert die Nutzungsdauer.

So kommen Sie zur richtigen Größe

  1. Anwendungsfälle und erwartete Nutzerzahl festhalten.
  2. Passende Modelle auswählen und mit echten Beispielen testen – das geht auch ohne eigene Hardware.
  3. Speicherbedarf aus Modell, Genauigkeit, Kontextlänge und Parallelität abschätzen.
  4. Hardware mit Reserve auswählen und die Leistung nach dem Aufbau mit den eigenen Anfragen messen.

Quellen

Weitere Beiträge