Lokale KI im Unternehmen: Welche Hardware wird gebraucht?
Ein lokales Sprachmodell braucht vor allem eines: genug schnellen Speicher auf der Grafikkarte. Wie viel, hängt von der Modellgröße, der gewünschten Qualität und der Zahl gleichzeitiger Nutzer ab.
Warum der Grafikspeicher entscheidet
Beim Betrieb eines Sprachmodells müssen dessen Parameter, die gelernten Gewichte, im Speicher liegen. Grafikprozessoren (GPUs) berechnen die Antworten um ein Vielfaches schneller als normale Prozessoren, allerdings nur, wenn das Modell in ihren Speicher (VRAM) passt. Reicht der Speicher nicht, wird das System stark ausgebremst.
Faustregeln für die Modellgröße
Die Größe eines Modells wird in Milliarden Parametern angegeben. Durch Quantisierung, also die Speicherung der Gewichte mit weniger Bits, sinkt der Speicherbedarf deutlich, bei meist geringem Qualitätsverlust. Als grobe Orientierung bei 4-Bit-Quantisierung:
| Modellgröße | Grafikspeicher (ca.) | Typischer Einsatz |
|---|---|---|
| 7 bis 9 Mrd. Parameter | 8 bis 12 GB | Klassifizieren, Zusammenfassen, einfache Assistenten |
| 12 bis 14 Mrd. Parameter | 12 bis 16 GB | Gute deutsche Texte, Dokumentensuche |
| 27 bis 32 Mrd. Parameter | 24 bis 32 GB | Anspruchsvolle Texte, komplexere Auswertungen |
| 70 Mrd. Parameter und mehr | 48 GB und mehr, oft mehrere GPUs | Höchste Qualität, viele Nutzer |
Hinzu kommt Speicher für den Kontext, also die Textmenge, die das Modell gleichzeitig verarbeitet. Lange Dokumente und viele parallele Anfragen erhöhen den Bedarf.
Typische Konfigurationen
- Kleines Büro, wenige Nutzer: Arbeitsplatzrechner oder kleiner Server mit einer Grafikkarte mit 16 bis 24 GB Speicher.
- Mittelständler, Abteilungsbetrieb: Server mit ein oder zwei professionellen GPUs mit zusammen 48 GB oder mehr, 128 GB Arbeitsspeicher, schnelle NVMe-SSDs.
- Viele Nutzer, große Modelle: Mehrere GPUs, Betrieb über vLLM mit paralleler Verarbeitung.
Was außer der GPU wichtig ist
- Arbeitsspeicher: mindestens so viel wie Grafikspeicher, besser das Doppelte.
- SSD: Modelle umfassen viele Gigabyte; NVMe-SSDs verkürzen die Ladezeiten.
- Netzteil und Kühlung: Leistungsstarke GPUs brauchen mehrere hundert Watt und gute Belüftung.
- Dokumentensuche: Für RAG-Anwendungen kommen eine Vektordatenbank und ein kleineres Modell für die Suche hinzu.
Gebrauchte Server als Basis
Ausgemusterte Server aus Rechenzentren sind eine günstige Grundlage für lokale KI: stabile Netzteile, viel Arbeitsspeicher, Platz für mehrere Laufwerke. Mit einer passenden Grafikkarte nachgerüstet, laufen darauf viele Modelle zuverlässig. Wir stellen solche Systeme aus geprüften Beständen zusammen.
Software
Für den Betrieb haben sich Ollama und llama.cpp (einfach, sparsam) sowie vLLM (viele gleichzeitige Nutzer) bewährt. Als Oberfläche dient zum Beispiel Open WebUI. Für Spracherkennung kommt Whisper zum Einsatz, lokal und ohne Cloud.
Lokale KI für Ihr Unternehmen
Wir planen die passende Hardware, installieren das Modell und binden es an Ihre Abläufe an.