Warum ist das eigentlich so?
Einzelne Erklärstücke zu Fragen, die beim Bauen von selbst auftauchen. Kein Frage-Antwort-Katalog: die Frage ist nur der Anlass, der Text ist die Erklärung - und jedes Stück steht für sich.
6. September 2026
Die Welt oder ein Modell der Welt
Zwei MCP-Endpunkte, dieselbe Frage, zwei ordentliche JSON-Antworten. Hinter der einen liegen Zeilen in einer Datenbank, hinter der anderen niemand. Ansehen kann man es keiner.
Lesenweltmodell · simulation · messen30. August 2026
Warum dieselbe Frage einmal 150 Sekunden dauert und einmal 4
150 000 Tokens Doku, ein Modell auf einem DGX Spark, eine Frage. Ob die Antwort nach 150 Sekunden anfängt oder nach 4, entscheidet allein die Reihenfolge im Prompt. Und diesen Faktor bringt keine Karte, die man kaufen kann.
Lesenprefix-cache · ttft · inferenz6. August 2026
Warum dein 8-GB-Modell 20 GB Speicher braucht
Die Dateigröße ist nicht der Speicherbedarf. Im Betrieb kommt der KV-Cache dazu - und der hängt nicht am Modell, sondern am Kontext und an der Zahl gleichzeitiger Anfragen.
Lesenvram · kv-cache · inferenz31. Juli 2026
Warum der zehnte Turn hundertmal so viel kostet wie der erste
Ein Agent, der zehn Schritte arbeitet, macht keine zehn kleinen Anfragen - er macht zehn immer größere. Warum die Rechnung nicht linear wächst, sondern in der Summe quadratisch.
Lesenkosten · kontext · token30. Juli 2026
Warum ein Modell falsch antwortet und dabei sicherer klingt als richtig
Erfundene Bibliotheken, erfundene Paragraphen, erfundene Zitate - vorgetragen ohne den kleinsten Zweifel. Das ist kein Aussetzer, sondern die direkte Folge davon, worauf das Modell trainiert wurde.
Lesenhalluzination · vertrauen · training29. Juli 2026
Warum die Antwort mitten im Satz abbricht
Die Ausgabe hört auf, als hätte jemand den Stecker gezogen - mitten im Wort, mitten in der Codezeile. Vier Ursachen kommen dafür infrage, und sie sehen im Ergebnis fast gleich aus.
Lesentoken · abbruch · betrieb