Bauteil 05 / 07Block III · Inferenz

Hardware

Warum reden beim Thema LLM alle über Grafikkarten? Weil Speicher die harte Grenze ist: Er entscheidet, welche Modelle du überhaupt wählen kannst - und was jede Antwort kostet.

Was ist ein KI-Agent?

Basics

Für alle frei: das Konzept, die Analogie, das Warum.

Das ferne Gehirn aus dem LLM-Call steht irgendwo in einem Rechenzentrum - oder, seit Open Weights, auf deinem Schreibtisch. In beiden Fällen läuft es auf sehr konkreter Hardware. Ein Grundverständnis davon lohnt sich, selbst wenn du nie eine eigene GPU kaufst: Es erklärt die Preise, die Grenzen und die Modell-Auswahl.

Warum ausgerechnet GPUs

Ein LLM-Aufruf ist im Kern Millionen Mal dieselbe Rechnung: Zahlenreihen miteinander multiplizieren. Grafikkarten wurden genau dafür gebaut - tausende kleine Rechenwerke, die dieselbe Operation gleichzeitig ausführen. Eine CPU kann das auch, nur eben mit einer Handvoll Kernen statt tausenden: Das Modell antwortet dann in Minuten statt Sekunden.

VRAM ist die harte Grenze

Wichtiger als die Geschwindigkeit der GPU ist ihr Speicher (VRAM) - denn das komplette Modell muss hineinpassen. Die Faustregel: Parameter × Bytes pro Parameter. Ein 7B-Modell in halber Genauigkeit (2 Bytes) braucht rund 14 GB, ein 70B-Modell entsprechend 140 GB - mehr, als in jede einzelne Consumer-GPU passt.

Dazu kommt der Arbeitsspeicher fürs Gespräch selbst: Der KV-Cache wächst mit jedem Token im Kontext. Ein langes Gespräch mit großem Kontextfenster kostet zusätzlich Gigabytes. Wenn dir je ein lokales Modell bei langen Chats „out of memory“ gestorben ist - das war er.

Am schnellsten begreift man das am Regler. Zieh den Kontext auf und beobachte, ab wann der KV-Cache die Gewichte überholt - und was passiert, wenn nicht du allein fragst, sondern fünf Leute gleichzeitig:

Rechnen

Passt das auf deine Karte?

Zieh an den Reglern und sieh zu, was der Speicher macht. Die Gewichte stehen fest, sobald Modell und Quantisierung gewählt sind - alles danach ist Gespräch: Jedes Token im Kontext belegt Platz, und bei mehreren gleichzeitigen Anfragen belegt es ihn mehrfach.

Modell27B
Karte24 GB
Quantisierung
Kontext8K Tokens
Gleichzeitige Anfragen1
Karten (Tensor-Parallelität)1
Bedarf auf der KarteGeForce RTX 4090 · 24 GB

Passt - 7,2 GB bleiben frei.

16,8 von 24 GB belegt.

Gewichte14,6 GB
KV-Cache0,5 GB
Overhead1,7 GB
  • Der KV-Cache macht 3 % der Rechnung aus - 64 KB je Token und Anfrage.
  • 24 Aufmerksamkeitsköpfe, aber nur 4 KV-Köpfe: Grouped-Query Attention drückt den Cache um den Faktor 6.
  • Dense: Jedes Token geht durch alle 27 Milliarden Parameter - Obergrenze rund 64 Tokens/s, begrenzt von der Speicherbandbreite.

Modellwerte aus der config.json der Repos (Stand 2026-08-06), Kartenwerte aus den Datenblättern. Eine Abschätzung, kein Messwert: Je nach Runtime liegen zehn Prozent dazwischen, und der KV-Cache ist hier durchgehend in FP16 gerechnet.

Quantisierung: der Kompromiss

Die Rettung für kleine Budgets heißt Quantisierung: Die Gewichte werden gröber gespeichert - 8 statt 16 Bit, oder sogar 4. Das halbiert (oder viertelt) den Speicherbedarf, kostet aber ein wenig Qualität. Die überraschende Praxiserfahrung: Ein großes Modell in 4 Bit schlägt meist ein kleines in voller Genauigkeit. Deshalb sind quantisierte Varianten der Normalfall für lokales Arbeiten, nicht die Ausnahme.

Muss es die eigene GPU sein?

Nein. Der Weg zum laufenden Modell hat viele Stufen: Apple Silicon teilt sich den Speicher zwischen CPU und GPU - ein MacBook mit 32 GB fährt erstaunlich große Modelle. GPUs lassen sich stundenweise mieten, statt sie zu kaufen. Und die API ist am Ende nichts anderes als „jemand anderes betreibt die Hardware“ - bezahlt pro Token statt pro Grafikkarte.

Hardware entscheidet nicht, ob dein Agent klug ist - sie entscheidet, welche Modelle überhaupt zur Wahl stehen und was jede Antwort kostet. VRAM ist dabei die Währung: Modellgröße plus Kontext müssen hineinpassen.

Für den Agenten selbst gilt das Muster aus dem ganzen Block: Der Harness merkt von alledem nichts. Ob hinter der URL ein Rechenzentrum oder dein MacBook sitzt, ist eine Frage von Budget und Datenschutz - nicht der Architektur.

Vertiefung

Mit kostenlosem Konto: Experimente, Quizze und die Vertiefung.

Anmelden, um diesen Inhalt zu sehen

Dieser Bereich ist Mitgliedern vorbehalten. Logge dich ein, um weiterzulesen.

Jetzt anmelden

Deep-Dive

Für Pro-Mitglieder: die Tiefe für alle, die es wirklich bauen wollen.

Anmelden, um diesen Inhalt zu sehen

Dieser Bereich ist Mitgliedern vorbehalten. Logge dich ein, um weiterzulesen.

Jetzt anmelden

Diskussion· noch keine Beiträge

Unser Kommentar-Agent liest jeden neuen Beitrag, bedankt sich oder empfiehlt passende Inhalte.

Sei die erste Stimme - was denkst du dazu?

Melde dich an, um mitzudiskutieren.

Anmelden