Stand: Oktober 2026
Wer ein Sprachmodell lokal auf dem eigenen Rechner ausführen möchte, braucht nicht automatisch einen Server. Schon ein vorhandener PC kann für erste Versuche reichen. Bei einem neuen System ist vor allem der Grafikspeicher wichtig: Je mehr VRAM verfügbar ist, desto größere Modelle und längere Kontexte lassen sich direkt auf der Grafikkarte ausführen.
Die wichtigste Komponente: Grafikspeicher
Für lokale Sprachmodelle sind VRAM, Arbeitsspeicher und Speicherbandbreite entscheidend. Die Rechenleistung beeinflusst die Antwortgeschwindigkeit; der VRAM bestimmt oft zuerst, welche Modellgröße bequem auf die GPU passt. Als grobe Orientierung für quantisierte Modelle gilt:
- 8 GB VRAM: kleine Modelle und erste Experimente.
- 12 bis 16 GB: guter Einstieg für viele alltägliche Aufgaben.
- 24 GB: mehr Spielraum für größere Modelle und längere Eingaben.
- 32 GB oder mehr: leistungsfähige Einzel-GPU-Systeme für anspruchsvollere Nutzung.
Das sind Richtwerte, keine festen Grenzen. Der Speicherbedarf hängt auch von Modell, Quantisierung, Kontextlänge und Software ab.
Welche Hardware lohnt sich?
Einfach ausprobieren: vorhandener Rechner
Für Chat, Zusammenfassungen und einfache Schreib- oder Programmierhilfe reicht oft ein vorhandener Rechner mit einem kleineren Modell. Eine neue Grafikkarte ist zum Einstieg nicht zwingend nötig. Für einen neuen PC sind 32 GB RAM ein Anfang; 64 GB bieten mehr Reserven, wenn mehrere Anwendungen laufen oder Modelle teilweise im Arbeitsspeicher liegen.
Gute Allround-Lösung: 16 bis 24 GB VRAM
Eine Grafikkarte mit 16 bis 24 GB VRAM ist für viele private Anwendungen ein ausgewogener Kompromiss. Achte beim Kauf auf den tatsächlichen Grafikspeicher und darauf, welche Hardware deine bevorzugte KI-Software unterstützt. NVIDIA ist wegen der breiten Unterstützung vieler KI-Werkzeuge oft unkompliziert. AMD kann ebenfalls passen; die Unterstützung hängt stärker von Betriebssystem, Treibern und Software ab.
Hohe Leistung mit einer Grafikkarte
Die GeForce RTX 5090 bietet 32 GB GDDR7-Speicher und ist eine leistungsfähige Option für lokale KI auf einem Desktop-PC. Sie ist allerdings teuer, groß und stromhungrig. Prüfe vor dem Kauf die Abmessungen, Kühlung und Netzteilanforderungen des konkreten Kartenmodells. NVIDIA führt GeForce RTX mit 6 bis 32 GB VRAM als Plattform für lokale KI-Entwicklung auf. RTX 5090 – technische Daten · NVIDIA: lokale KI mit GeForce RTX
Große Modelle mit gemeinsamem Speicher: Apple Silicon
Ein Mac mit Apple Silicon kann interessant sein, wenn möglichst viel Speicher für ein Modell verfügbar sein soll und ein leiser, kompakter Rechner wichtig ist. CPU und GPU teilen sich den Unified Memory. Apple nennt für den Mac Studio mit M3 Ultra bis zu 512 GB Unified Memory. Eine hohe Speicherkapazität ermöglicht größere Modelle, bedeutet aber nicht automatisch eine hohe Antwortgeschwindigkeit. Apple: Mac Studio mit M3 Ultra
Der Rest des Systems
- Arbeitsspeicher: 64 GB sind ein komfortabler Ausgangspunkt; 32 GB genügen für kleinere Modelle.
- Prozessor: Ein aktueller Mittelklasse-Prozessor reicht für viele GPU-gestützte Anwendungen.
- SSD: Mindestens 1 TB, besser 2 TB, wenn mehrere Modelle gespeichert werden.
- Netzteil und Gehäuse: passend zur Grafikkarte, mit ausreichender Stromversorgung, Kühlung und Platz.
Für reine Modell-Inferenz bringt ein teurer Prozessor oft weniger als eine passende GPU mit ausreichend VRAM. Wer ohne dedizierte Grafikkarte arbeiten oder große Modelle im Arbeitsspeicher halten möchte, sollte dagegen RAM-Kapazität und Speicherbandbreite besonders beachten.
Software und Kompatibilität
Für den Einstieg sind Werkzeuge wie Ollama oder grafische Oberflächen für lokale Modelle praktisch. Fortgeschrittene Nutzer können etwa llama.cpp einsetzen. Die Hardware-Unterstützung unterscheidet sich je nach Betriebssystem und Software. Prüfe deshalb vor dem Kauf die Dokumentation der gewünschten Umgebung. Ollama: Download und Plattformen · NVIDIA: unterstützte lokale KI-Werkzeuge
Fazit
Für erste Versuche reicht häufig der vorhandene Rechner. Wer einen neuen PC für lokale Sprachmodelle plant, sollte zuerst die gewünschte Modellgröße und die typischen Aufgaben festlegen. 16 bis 24 GB VRAM sind eine vielseitige Zielgröße für viele private Nutzer. Wer hohe Geschwindigkeit und eine einzelne leistungsfähige GPU möchte, kann die RTX 5090 mit 32 GB vergleichen. Wer möglichst große Modelle im gemeinsamen Speicher nutzen will, sollte einen Mac mit hoher Unified-Memory-Konfiguration prüfen.
Am sinnvollsten ist es, zuerst die gewünschte Software und typische Modelle auszuwählen und danach die Hardware zu dimensionieren. So vermeidest du, für ungenutzte Spitzenleistung zu bezahlen oder beim Grafikspeicher zu knapp zu planen.
KI optimierter Text
