Welcher Laptop für lokale KI?

Die kurze Antwort

Der beste Laptop für lokale KI ist der mit genug Speicher für dein Modell, nicht der mit der schnellsten Grafikkarte. Bei Windows zählt der VRAM der GPU, bei Apple der Unified Memory. Für 7- bis 14-Milliarden-Modelle (Llama, Mistral) reicht ein Windows-Notebook mit 16 GB VRAM oder ein MacBook Pro ab 32 GB. Wer 70B-Modelle mobil laufen lassen will, kommt an einem MacBook Pro mit M5 Max oder M4 Max und 96 bis 128 GB kaum vorbei. Alles andere ist Detail.

🛒 Meine Hardware für lokale KI als Amazon-Ideenliste

Du willst nicht jedes Gerät einzeln heraussuchen? Ich habe meine Empfehlungen für einen KI-fähigen Arbeitsplatz – KI-Laptops, Mini-PC, Grafikkarte & RAM, sortiert nach Modellgröße vom 7B-Einstieg bis zum 70B-fähigen Gerät – in einer Amazon-Ideenliste gebündelt. Ein Klick, alle Empfehlungen auf einen Blick.

👉 Zur Amazon-Ideenliste „KI-Laptops & Hardware für lokale KI (2026)“

* Affiliate-Link – kaufst du über die Liste, erhalte ich eine kleine Provision, für dich ohne Mehrkosten.

Die eine Regel, die wirklich zählt: Speicher

Fast jede Kaufberatung startet bei der GPU und hört dort auch wieder auf. Das ist der falsche Anfang. Ein Sprachmodell muss komplett in den Speicher passen. Tut es das nicht, lädt es entweder gar nicht oder es kriecht über die Auslagerung auf die langsame SSD, und dann wartest du sekundenlang auf jeden Satz.

Zwei Bauweisen, zwei Logiken:

  • Windows-Laptop mit NVIDIA-GPU: Es zählt der VRAM. Passt das Modell rein, ist die Karte schnell. Passt es nicht, hilft die Rechenleistung nichts. Mobile RTX-5090-Chips haben 24 GB VRAM, mehr geht im Notebook aktuell nicht.
  • MacBook mit Apple Silicon: CPU und GPU teilen sich denselben Speicher (Unified Memory). Dadurch stehen der GPU bis zu 128 GB zur Verfügung, und genau das lässt große Modelle portabel laufen, wo jeder Windows-Laptop kapituliert.

NVIDIA gewinnt beim Tempo, weil CUDA seit Jahren das ausgereifteste Ökosystem ist und Ollama, llama.cpp und LM Studio darauf am besten laufen. Apple gewinnt beim Speicherplatz und bei der Ruhe. Das ist der ganze Konflikt in einem Satz.

Erst die Frage: welches Modell willst du laufen lassen?

Bevor du auf einen Laptop schaust, leg fest, wie groß dein Modell sein soll. Danach richtet sich alles. Die Werte gelten für 4-bit-Quantisierung (Q4), die für den Alltag völlig ausreicht.

ModellSpeicherbedarf (Q4)Was das im Laptop heißt
3B (kleine Assistenten)ca. 3–4 GBLäuft auf fast jedem aktuellen Laptop, sogar ohne dedizierte GPU
7–8B (Llama 3, Mistral)ca. 5–8 GB8 GB VRAM oder ein Mac ab 16 GB reichen
13–14Bca. 8–10 GB16 GB VRAM oder Mac ab 24–32 GB
30Bca. 18–20 GBRTX 5090 mobil (24 GB) oder Mac ab 48 GB
70Bca. 35–40 GBSprengt jeden mobilen VRAM. Nur mit MacBook Pro (96–128 GB) portabel
Faustregel aus der Ollama-Doku: 8 GB RAM reichen für 3B-Modelle, 16 GB für 7B. Darüber wird die GPU bzw. der Unified Memory zum Flaschenhals.

Die ehrliche Nachricht an dieser Stelle: Die meisten Leute, die „ich will KI lokal laufen lassen“ sagen, meinen ein 7B- oder 13B-Modell. Dafür brauchst du keine 3.000-Euro-Maschine.

Windows-RTX-Laptop, MacBook oder Copilot+-Notebook?

TypStärkeSchwächePasst für
Windows-Laptop, RTX 50Höchste Geschwindigkeit für Modelle, die in den VRAM passen; CUDAMax. 24 GB VRAM mobil; kurze Akkulaufzeit unter Last; laut und heißTempo und Windows-Umgebung
MacBook Pro, M5/M4 MaxBis 128 GB Unified Memory, damit auch 70B mobil; leise; lange AkkulaufzeitTeuer; kein CUDA; langsamer als eine RTX bei kleinen ModellenGroße Modelle unterwegs, ruhiges Arbeiten
Copilot+ / Ryzen-AI-NotebookSehr lange Akkulaufzeit, günstig, viel RAM möglichSchwach bei allem über 13B; iGPU limitiert das TempoKleine Modelle plus viel Cloud-KI

Ein Punkt, den das Marketing gern verschweigt: Die NPU in den Copilot+-PCs ist 2026 für große Sprachmodelle noch Nebensache. Sie ist gut für Diktat, Webcam-Weichzeichner und Hintergrundaufgaben. Die eigentliche LLM-Last trägt die GPU oder der Unified Memory. Kauf also nicht wegen der TOPS-Zahl auf dem Aufkleber.

Wie schnell ist „schnell“? Token pro Sekunde in der Praxis

Geschwindigkeit misst man in Token pro Sekunde (Tok/s). Grob gilt: Ab etwa 15–20 Tok/s liest sich die Ausgabe flüssig, alles darunter fühlt sich zäh an. Die folgenden Werte sind Richtwerte für ein 7B-Modell und stammen aus Herstellern und unabhängigen Tests.

Hardware7B-Modell, ca. Tok/s
Reine CPU (ohne GPU)10–25
Apple Silicon (M-Chip)30–80
Mac mini M4, 32 GB28–35
NVIDIA-GPU (Desktop-Klasse)bis 150+
Achtung Laptop-Realität: Diese Spitzenwerte gelten am Netzteil. Im Akkubetrieb und nach ein paar Minuten Dauerlast drosseln dünne Notebooks spürbar. Plane das Netzteil ein.

Meine Empfehlungen nach Budget

Einstieg (ca. 700–1.300 €): kleine Modelle, wenig Geld

Für 3B- bis 8B-Modelle brauchst du keine dicke GPU. Ein Ryzen-AI- oder Copilot+-Notebook mit 32 GB RAM stemmt das über CPU und iGPU, langsam, aber nutzbar. Wer es lautlos mag, greift zum MacBook Air M4 mit 24 GB: Das läuft ein 7B-Modell mit rund 30 Tok/s und ohne Lüftergeräusch. Für viele Homeoffice-Anwender ist das schon die ehrlichste Wahl.

Mittelklasse (ca. 1.500–2.500 €): der Sweet Spot

Hier bekommst du 7B- bis 14B-Modelle richtig flüssig. Zwei Wege: ein Windows-Gaming- oder Creator-Laptop mit RTX 5070 Ti oder 5080 (16 GB VRAM), oder ein MacBook Pro mit M5 Pro bzw. dem günstigeren M4 Pro und 32 bis 48 GB. Der Mac schafft mit dem größeren Speicher auch 30B-Modelle knapp, die RTX ist bei den kleineren dafür schneller. Ich würde nach Umgebung entscheiden: CUDA-Tools und Gaming sprechen für Windows, Ruhe und Akkulaufzeit für den Mac.

High-End mobil (ab 3.000 €): alles, auch 70B

Ein RTX-5090-Laptop (24 GB VRAM) wie das HP Omen Max 16, die Asus-ROG-Reihe oder Lenovo Legion liefert die schnellste Inferenz bis etwa 30B. Sobald du 70B willst, führt der einzige mobile Weg über ein MacBook Pro mit M5 Max oder M4 Max und 96 bis 128 GB Unified Memory. Wer Wert auf Reparierbarkeit und Aufrüstbarkeit legt, sollte sich das Framework Laptop 16 ansehen, das passt gut zu einem Blog, der auf Nachhaltigkeit und Ehrlichkeit setzt.

Der Realitätscheck: Brauchst du das überhaupt?

Ich sage es lieber offen, auch wenn es ein paar Affiliate-Klicks kostet: Wenn du KI vor allem zum Texten, Recherchieren und Coden nutzt und deine Daten dabei in der Cloud liegen dürfen, brauchst du keinen KI-Laptop. Ein normales, gutes Notebook plus ChatGPT oder Claude ist billiger und bequemer.

Lokale Hardware lohnt sich in drei Fällen: wenn deine Daten das Haus nicht verlassen dürfen (Datenschutz, Mandanten, Patienten), wenn du oft offline arbeitest, oder wenn du so intensiv promptest, dass die Cloud-Kosten oder Rate-Limits wehtun. Trifft keiner dieser Punkte zu, steck das Geld lieber in Bildschirm und Stuhl.

Noch ein Wort zum Preis: 2026 ist wegen der Speicherknappheit ein schlechtes Jahr für RAM- und GPU-Preise. Prüf die aktuellen Straßenpreise vor dem Kauf, sie schwanken stärker als sonst.

Produktempfehlungen

Als Amazon-Partner verdiene ich an qualifizierten Verkäufen.

KategorieBeispielmodellLink
Einstieg, lautlosMacBook Air M4 (24 GB)Auf Amazon ansehen
Einstieg, viel RAMRyzen-AI-/Copilot+-Notebook (32 GB)Auf Amazon ansehen
Mittelklasse WindowsLaptop mit RTX 5070 Ti / 5080 (16 GB VRAM)Auf Amazon ansehen
Mittelklasse MacMacBook Pro M5 Pro / M4 Pro (32–48 GB)Auf Amazon ansehen
High-End WindowsRTX-5090-Laptop (HP Omen Max 16 / Asus ROG)Auf Amazon ansehen
High-End Mac (70B)MacBook Pro M5 Max / M4 Max (96–128 GB)Auf Amazon ansehen
Reparierbar / aufrüstbarFramework Laptop 16Auf Amazon ansehen

Häufige Fragen

Läuft ChatGPT lokal auf einem Laptop?

Nicht ChatGPT selbst, aber vergleichbare offene Modelle. Ein 7B-Modell wie Llama 3.1 läuft auf den meisten Laptops mit 16 GB RAM. Die richtig großen Modelle (70B und mehr) brauchen Workstation-Speicher oder bleiben in der Cloud.

Was ist wichtiger, GPU oder RAM?

Der Speicher entscheidet, welches Modell überhaupt passt, die GPU entscheidet, wie schnell es läuft. Ohne genug VRAM oder Unified Memory nützt die schnellste GPU nichts.

Reicht ein MacBook Air für lokale KI?

Für 7B-Modelle ja, mit 16 bis 24 GB Unified Memory sogar überraschend flüssig und komplett lautlos. Für 30B oder 70B reicht der Speicher nicht, dafür brauchst du ein MacBook Pro mit größerer Konfiguration.

Lohnt sich ein RTX-5090-Laptop gegenüber einem Desktop?

Nur, wenn du Mobilität brauchst. Ein Desktop mit derselben Karte ist leiser, kühler, günstiger pro Leistung und drosselt nicht unter Dauerlast. Der Laptop ist der Kompromiss für alle, die nicht ortsgebunden arbeiten wollen.

Fazit

Entscheide dich zuerst für eine Modellgröße, dann für den Speicher, dann erst für die Marke. Für die meisten reicht Mittelklasse: 16 GB VRAM unter Windows oder 32 GB Unified Memory beim Mac, und du hast einen Laptop, der 7B- bis 14B-Modelle flüssig laufen lässt. Alles darüber ist ein bewusster Aufpreis für große Modelle oder maximales Tempo. Und wenn du nach ehrlicher Prüfung merkst, dass Cloud-KI dir völlig reicht, hast du dir mit dieser Seite Geld gespart. Auch das ist ein gutes Ergebnis.

Als Amazon-Partner verdienen wir an qualifizierten Käufen. Für dich entstehen keine zusätzlichen Kosten. Dieser Beitrag wurde mit Unterstützung von KI (u. a. ChatGPT) erstellt und redaktionell geprüft. Empfehlungen basieren auf eigenen Recherchen und persönlichen Einschätzungen. Enthält Affiliate-Links.

Kommentar verfassen

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen
WordPress Cookie Plugin von Real Cookie Banner