Wissens-Changelog

Was über die Zeit ins System kam - neue Bausteine, Tutorials und Aktualisierungen, chronologisch.

September 2026

  • 06. Sept.Neuconcept

    MCP-Server

    Schritt 8 des Aufbau-Diagramms war eine Kachel ohne Seite. Jetzt steht der Baustein da, in drei Stufen. Basics: was das Protokoll löst, warum vor MCP jeder Harness seine eigene Werkzeug-Anbindung schrieb, Werkzeuge gegen Ressourcen gegen Prompts, und wann stdio und wann Streamable HTTP. Pro baut einen eigenen Server, mit dem Dienst unter mcp/ in diesem Repo als Fallstudie - fünf Dateien, sechzehn redaktionelle Werkzeuge, elf für die Simulationswelten, und die zwei Entwurfsentscheidungen, an denen man sonst zweimal stolpert. Deep-Dive nimmt den Betrieb: Tool-Poisoning und Rug-Pull, Rechte je Werkzeug statt je Server, Sitzungsdeckel und Reaper, und das Auth-Modell mehrerer Endpunkte in einem Container. Die Sidecar-Seite verlinkt ihn jetzt an der Stelle, an der sie ihn bisher nur erwähnt hat.

  • 06. Sept.Neuinteractive

    Übungswelt - emulierter MCP-Endpunkt

    Eine Übungswelt zum Anlegen: Unter /weltmodell entsteht ein MCP-Endpunkt, der die Werkzeuge eines Szenarios ganz gewöhnlich anbietet und keines davon ausführt. Jeder Aufruf geht samt bisherigem Verlauf an ein Weltmodell, dessen vorhergesagte Beobachtung das Ergebnis ist - die Welt hat damit Zustand, ohne dass irgendwo einer gespeichert wird. Zwei Szenarien stehen bereit: „Elektro Rauner" mit 48 Werkzeugen aus acht Bereichen und die schmale „Stadtbücherei Ahlbeck" mit 20 aus vier. Damit lässt sich Werkzeugauswahl unter vielen Werkzeugen üben, ohne vorher ein System zu bauen. Dass alles erfunden ist, steht im Vertrag und nicht in einer Fußnote: in den Anweisungen an den Client, in jeder Werkzeugbeschreibung, an jeder Antwort und in jeder Protokollzeile. Vier Deckel begrenzen eine Welt - Aufrufe, Kontextlänge, Antwortzeit, Laufzeit. Die Regel dazu heißt: Üben in der erfundenen Welt, messen in der echten.

  • 06. Sept.Aktualisiertconcept

    Benchmarks

    Neues Kapitel „Weltmodelle - und was AgentWorldBench misst" im Baustein Benchmarks. Ein Weltmodell sagt nicht die nächste Aktion vorher, sondern die nächste Beobachtung: Es spielt die Umgebung, in der gehandelt wird. Qwen-AgentWorld deckt sieben davon ab (MCP, Suche, Terminal, SWE, Web, Betriebssystem, Android). Die AgentWorldBench-Werte aus der Veröffentlichung vom 24.06.2026 - 58,71 für die 397B gegen GPT-5.4 mit 58,25, Claude Opus 4.8 mit 56,59 und Gemini 3.1 Pro mit 54,57 - stehen als Fremdangabe im Kapitel, mit der Einordnung, dass dort Simulationsqualität gemessen wird und nicht Handlungsfähigkeit. Dazu die Einsatzfälle (Übungsumgebungen ohne Implementierung, Vorhersage als Vorschau, Datenerzeugung mit Vorbehalt), die drei Grenzen (Drift, keine Wahrheit, keine Bewertbarkeit) und die Bauart des Endpunkts /welt in diesem Repo.

  • 06. Sept.Neuaha

    Die Welt oder ein Modell der Welt

    Der Unterschied zwischen „die Welt antwortet" und „ein Modell sagt voraus, wie die Welt antworten würde" - vorgeführt an zwei MCP-Endpunkten dieser Plattform. Dieselbe Frage geht an das CRM von Simhaven (/sim-crm, Zeilen in einer Postgres-Tabelle) und an die Übungswelt (/welt, ein Weltmodell ohne System dahinter). Beide Antworten sind sauber formatiertes JSON, beide sehen gleich plausibel aus. Der naheliegende Test scheitert: Drei identische Aufrufe in derselben Welt liefern drei zeichengleiche Antworten, weil der Sitzungsverlauf mitreist. Auseinander gehen sie erst in zwei frisch angelegten Welten aus demselben Szenario - dieselbe Firma trägt einmal die Kundennummer K-1156 und einmal K-1051. Übereinstimmung gibt es genau dort, wo der Szenariotext etwas festlegt (38 Hausverwaltungen, Kliem als K-1077, Trienekens als K-1042); alles andere wird erfunden, im selben Format, ohne Markierung. Daraus die drei Folgen: Ein Benchmark ohne echte Ausführung misst Erzählung, ein Agent darf seine eigene Erfolgsmeldung nicht bewerten, und ein Feintuning auf erfundenen Werkzeugantworten bestätigt sich selbst. Die Regel dazu heißt: Üben in der erfundenen Welt, messen in der echten.

  • 06. Sept.Neututorial

    FunctionGemma auf den eigenen MCP nachtrainieren

    Die Kapitel zu FunctionGemma hören vor dem Training auf, weil der Hersteller keine Trainingsparameter veröffentlicht. Der neue Kurs holt es nach, an elf echten Werkzeugen aus den Sim-Welten dieses Repos (mcp/tools/sim_calendar.ts und sim_crm.ts). Sechs Kapitel entlang der Reihenfolge aus dem Baustein: Ausgangszustand protokollieren, Prüfbank S1-S5 als lauffähiger Code bauen, den rohen Spezialisten davorstellen, einen Datensatz aus Läufen des großen Modells destillieren, LoRA fahren, Weiche in den Harness bauen. Drei Messungen an derselben Prüfbank, alle aus einem tatsächlich gelaufenen Versuch auf einem DGX Spark: großes Modell 95,2 Prozent gelungene Aufträge bei 6,42 Sekunden, roher Spezialist 73,8 Prozent bei 0,20 Sekunden, nachtrainierter Spezialist 90,5 Prozent bei 0,16 Sekunden. Die Prüfstufe S5 (Pflichtangabe fehlt, Rückfrage statt Erfindung) springt von 50 auf 87,5 Prozent und liegt damit auf dem Wert des grossen Modells - mit elf Trainingsbeispielen. Auch die offene Temperaturfrage aus Kapitel 06 ist entschieden: die Herstellerangabe 1.0 kostet roh 8,7 Punkte, nach dem Feintuning nur noch 1,6.

  • 06. Sept.Neututorial

    Bau einen MCP-Server, der etwas tut

    MCP wurde auf der Plattform überall erwähnt und nirgends gebaut. Der neue Kurs baut einen Server, der etwas tut: den Helpdesk von Simhaven mit acht Tickets, einer Produktdoku und neun Werkzeugen, mit denen ein Agent den Posteingang leerräumt. Sieben Kapitel vom leeren Server bis zum eigenen Container - beide Transporte mit Entscheidungskriterium, die Werkzeugbeschreibung als Prompt-Anteil, ein Transport je Sitzung samt Reaper und Deckel, zwei Auth-Modelle nebeneinander (Dienst-Token und vorgangsgebundenes Token), die drei typischen Fehlerbilder ausgelöst statt behauptet, und Betrieb mit Gesundheitsprüfung und einer Logzeile je Aufruf. Jede abgedruckte Ausgabe ist gemessen: 130.152 Zeichen für ein Werkzeug, das den kompletten Posteingang zurückgibt, 5.223 mit Deckel. Der Baustein MCP verlinkt den Kurs, der Kurs zitiert den Dienst unter mcp/ in diesem Repo.

  • 05. Sept.Aktualisiertconcept

    Die Modell-Landschaft

    Bei der Modell-Landschaft klaffte die Lücke mitten im Baustein: unten 659 Wörter Basics, darüber eine Pro-Stufe mit über 2000, und dazwischen ein Inhaltsverzeichnis. Der Deep Dive ist jetzt ausgeschrieben. Dense gegen Mixture-of-Experts mit eigenen Zahlen statt allgemeiner Erklärung, nämlich dem Messfehler des eigenen Duell-Bands, dessen erste Auflage einen MoE gegen ein dichtes Modell antreten ließ und deshalb zwölf Punkte Abstand maß, wo nach der Wiederholung mit gleicher Bauform 5,8 blieben. Danach, was das Nachtraining an den Antworten hinterlässt: Sprachlecks aus der Datenmischung, der Werkzeuggriff ohne Anlass bei einer Aufgabe, die keinen verlangt, und Reasoning, das die Kosten von der Zahl der Schritte in den Text dazwischen verschiebt. Ein Abschnitt zu Lizenzen, den es sonst nirgends gibt, mit den drei Fällen aus dem eigenen Katalog und dem, was beim Weitergeben eines nachtrainierten Modells greift. Und zum Schluss die Reihenfolge von der Aufgabe zum Modell, mit der Messreihe als Begründung, warum zwanzig eigene Fälle jede Rangliste schlagen.

  • 05. Sept.Aktualisiertconcept

    Hardware

    Wie beim Nachbarbaustein standen über den Basics zwei Gliederungen und kein Text. Jetzt steht dort die Rechnung. Die Pro-Stufe führt Gewichte, KV-Cache und Overhead zu einer Zahl zusammen, stellt die Bandbreite als zweite Größe daneben (Tempo hängt am Speicherbus, nicht an den FLOPS), sortiert Consumer, Workstation, Rechenzentrum und Unified Memory nach dem, was der Aufpreis wirklich bringt, und rechnet drei Beispiele Schritt für Schritt durch: MacBook Pro, RTX 4090 und ein kleiner Server für acht Leute, samt der Stelle, an der sich dense und MoE überholen. Der Deep Dive nimmt den Fall danach: Tensor- gegen Pipeline-Parallelität mit ihren Nachteilen, was NVLink gegenüber PCIe wirklich einspart (beim Decode fast nichts, beim Prefill Faktor vierzehn), warum zehn Prozent der Schichten im RAM das Tempo halbieren, und die Formel, die aus Anschaffung, Strom und Auslastung eine Zahl je Million Tokens macht. Alle Zahlen kommen aus denselben Formeln wie der VRAM-Rechner der Seite und aus den Modellkarten.

  • 05. Sept.Aktualisiertconcept

    Inferenz-Engines

    Der Baustein hatte über den Basics zwei Inhaltsverzeichnisse und keinen Text. Jetzt steht dort etwas. Der Deep Dive erklärt, was eine Engine schnell macht: PagedAttention als Seitenverwaltung des KV-Cache, Continuous Batching mit Iteration-level Scheduling, Quantisierung an den zwei Orten, an denen sie verschieden wirkt, und die Stellschrauben am eigenen Server in der Reihenfolge, in der sie sich lohnen. Die Pro-Stufe stellt llama.cpp, vLLM und SGLang nebeneinander, ordnet TGI, TensorRT-LLM, MLX und ExLlama ein, erklärt, warum gleichzeitige Anfragen billiger sind als nacheinander gestellte, und schließt mit drei Empfehlungen für Einzelplatz, kleinen Server und Mehrbenutzerbetrieb. Jede Zahl hat eine Herkunft: entweder die eigenen Messungen vom DGX Spark oder ein benanntes Papier.

  • 05. Sept.Neuconcept

    Feintuning

    Block III hat einen siebten Baustein: Feintuning. Basics klären, was Feintuning wirklich ändert - Form und Verhalten, kein Wissen - und warum Prompt und RAG davor drankommen; dazu der Unterschied zwischen vollem Training und einem LoRA-Adapter. Die Pro-Stufe nimmt die Entscheidung auseinander: drei Bedingungen, die vorher stehen müssen, woher der Datensatz kommt, warum Destillation aus den Läufen des großen Modells der Normalweg ist und warum die unbequemen Fälle hineingehören. Der Deep Dive geht in den Betrieb - Adapter zuschalten in vLLM, llama.cpp und Ollama, mehrere auf einem Basismodell, das Versionierungs-Tripel aus Adapter, Datensatz und Prüfbank, und die Falle mit dem Chat-Template.

  • 05. Sept.Neuworkshop

    workshop:unternehmen-03-vom-schattenlauf-zum-selbstlauf

    Teil 3: wie ein zugeschnittener Agent in den Betrieb kommt. Vier Stufen - Schattenlauf, Vorschlag, Stichprobe, Selbstlauf -, und der Aufstieg hängt an gemessenen Zahlen statt an Zutrauen. Die Eingriffsquote ist die tragende: Sie sagt, wann die nächste Stufe fällig ist, und sie ist der Grund, warum jeder Modellwechsel eine Stufe zurückstuft.

  • 05. Sept.Neuworkshop

    workshop:unternehmen-02-die-neun-achsen

    Teil 2: die neun Entscheidungen, aus denen die Decke besteht. Jede Achse trägt Stufen, jede Stufe einen Nachweissatz und die Sprungstelle, an der die Testbarkeit kippt. Zusammen spannen sie den Zustandsraum auf - und der, nicht die Zahl der Tests, entscheidet, ob ein Agent prüfbar bleibt.

  • 05. Sept.Neuworkshop

    workshop:unternehmen-01-die-eingezogene-decke

    Teil 1 der Reihe „Der Unternehmens-Harness“: Warum ein Agent im Unternehmen anders gebaut wird als einer auf dem eigenen Rechner. Nicht, weil er weniger können darf - sondern weil niemand danebensitzt, der Ctrl-C tippt, wenn er falsch abbiegt. Die Decke, die man ihm einzieht, ist die Antwort auf die Frage nach dem schlimmsten Montagmorgen.

  • 05. Sept.Neuinteractive

    Zuschnitt

    Der Zuschnitt steht: ein Werkzeug unter „Werkbank“, in dem ein Unternehmens-Harness für genau einen Vorgang eingestellt wird. Neun Achsen mit Stufen - von der Wirkung auf die Welt bis zur Eskalation. Schiebt man eine hoch, steht daneben im selben Moment, was dafür bewiesen sein muss und welche Bausteine dazugehören; ein Regelwerk sperrt Kombinationen, die sich nicht belegen lassen. Dazu die vier Betriebsstufen Schattenlauf, Vorschlag, Stichprobe und Selbstlauf, der Aufstieg an Zahlen statt an Vertrauen, die Bauakte zum Drucken und Mitnehmen und der Bauauftrag als Starter-Paket. Der erste Zuschnitt ist für jedes Mitglied offen, weitere Vorgänge sind Pro.

  • 05. Sept.Aktualisiertworkshop

    workshop:harness-01-llm-call

    Der Bau-Prompt hat jetzt eine Setup-Automatik, die in allen zehn Teilen gilt: Der Coding-Agent installiert, legt Ordner an, hängt den Startbefehl per Symlink in den PATH, legt den Schlüssel in eine eigene Datei im Home und bindet sie aus der Shell-Konfiguration ein. Rückfragen nur noch, wenn zwei Antworten zu wirklich verschiedenem Ergebnis führen. Diese Fassung ist nach einem echten Durchlauf entstanden, und die Rückfragen waren dabei das Lästigste.

  • 05. Sept.Aktualisiertworkshop

    workshop:harness-00-einstieg

    Der Einstieg sagt jetzt, wie wenig du selbst tippst: Jeder Termin hat einen Bau-Prompt, der Coding-Agent installiert, richtet ein und fährt die Abnahme selbst in einer frischen Sitzung. Teil 1 legt dafür eine serien-prompt.md an, in der deine Antworten für alle weiteren Termine festgehalten sind.

  • 05. Sept.Neuaha

    Warum dieselbe Frage einmal 150 Sekunden dauert und einmal 4

    Warum dieselbe Frage einmal 150 Sekunden dauert und einmal 4: 150 000 Tokens Dokumentation, ein Modell auf einem DGX Spark, und die Reihenfolge im Prompt entscheidet allein über Faktor 36 bei der Zeit bis zum ersten Token. Mit Messdaten, vier Szenarien und dem Cache-Killer, den fast jeder einbaut, ohne es zu merken.

  • 05. Sept.Aktualisiertconcept

    Memory

    Memory ist das erste Bauteil aus Block II mit der Rubrik „Wie machen es die anderen?": Speicherform, Schreibweg, Leseweg, Geltungsbereich, Pflege. Sie steht direkt neben den Implementierungen Honcho, Mem0, LLM-Wiki und OKF, und zeigt, was die sechs Harnesse selbst gebaut haben, bevor sie einen Dienst anbinden.

  • 05. Sept.Aktualisiertconcept

    Guardrails

    Die Pro-Stufe von Guardrails trägt jetzt die Rubrik „Wie machen es die anderen?": Freigabe-Modell, Isolation, Eingangs- und Ausgangsseite, Budget. Sechs Harnesse, jede Zelle mit Quellcode-Beleg aus dem gepinnten Repo-Stand. Damit haben alle fünf Bauteile von Block I den Vergleich.

  • 05. Sept.Aktualisiertconcept

    Tools & Loop

    Die Pro-Stufe trägt jetzt die Rubrik „Wie machen es die anderen?": Werkzeug-Definition, Ausführung, Rückweg und Abbruch der Schleife in sechs echten Harnessen, jede Zelle mit Quellcode-Beleg aus dem gepinnten Repo-Stand.

  • 05. Sept.Aktualisiertconcept

    System Prompt

    Die Pro-Stufe trägt jetzt die Rubrik „Wie machen es die anderen?": Quellen, dynamische Anteile, Nutzer-Steuerung und Cache des System-Prompts in sechs echten Harnessen, jede Zelle mit Quellcode-Beleg.

  • 05. Sept.Aktualisiertconcept

    Message-History

    Die Pro-Stufe trägt jetzt die Rubrik „Wie machen es die anderen?": Wo der Verlauf liegt, wie er überlebt, was beim Abschneiden passiert, und wie sechs Harnesse das im Quellcode lösen. Jede Zelle mit Zitat und Permalink auf einen gepinnten Commit.

  • 05. Sept.Aktualisiertconcept

    Der LLM-Call

    Die Pro-Stufe trägt jetzt die Rubrik „Wie machen es die anderen?": sechs echte Harnesse (OpenClaw, Hermes, Pi, HybridClaw, DeepSeek Harness, NanoClaw) auf fünf Dimensionen des LLM-Calls, jede Zelle mit wortgetreuem Code-Zitat und Permalink auf einen gepinnten Commit. Dazu Matrix, A/B-Duell und Code-Detektiv.

  • 05. Sept.Neuconcept

    Wie machen es die anderen?

    „Wie machen es die anderen?" hat jetzt einen eigenen Ort. Bisher stand die Rubrik unten auf vier Bauteil-Seiten; jetzt gibt es den Hub mit drei Einstiegen. Über eine Herausforderung: „Das Kontextfenster wird knapp", und darunter, wie alle sechs Harnesse das lösen, quer über Message-History, Kompaktierung und Memory, mit einem Muster-Satz je Harness. Über ein Thema: elf Schichten statt vier, neu dazu Guardrails, Memory, Kompaktierung, MCP-Anbindung, Trigger & Kanäle, Tool-Routing & Skills und Subagenten, jede als Matrix mit Quellcode-Belegen, A/B-Duell und Code-Detektiv. Und über das Portrait eines Harness: alle Schichten von OpenClaw oder Hermes am Stück, als Architektur-Steckbrief. Kein Zitat ist neu erfunden; die Seiten sortieren dieselben Zellen anders.

August 2026

  • 21. Aug.Aktualisiertworkshop

    workshop:harness-04-tools-loop

    Mit Teil 4 ist dein Agent vollständig: Gespräch, Identität, Werkzeuge, Schleife, und das alles in gut 200 Zeilen ohne eine einzige Abhängigkeit. Es ist derselbe Motor, der auch in den großen Coding-Agenten arbeitet, dort nur mit deutlich mehr Komfort drumherum. Das Kapitel trägt den Termin jetzt selbst, mit Ablauf, Zeitbudget und den Stellen, an denen die Schleife kippt.

  • 21. Aug.Aktualisiertworkshop

    workshop:harness-03-system-prompt

    Teil 3 gibt deinem Agenten eine Identität, und das Kapitel führt jetzt durch den Termin statt nur durch den Prompt. Ablauf mit Zeitbudget, worauf es bei der Rollenbeschreibung ankommt, was danach anders klingt als vorher.

  • 21. Aug.Aktualisiertworkshop

    workshop:harness-02-message-history

    Teil 2 erklärt jetzt den Termin, statt ihn nur anzukündigen. Das Loch aus Teil 1 wird gefüllt: Das Modell weiß beim zweiten Aufruf nichts vom ersten, und die Message-History ist die Antwort darauf. Der Ablauf steht mit Zeitbudget da, dazu die Stellen, an denen sich die Sache entscheidet, und was am Ende in deinem Terminal läuft.

  • 21. Aug.Aktualisiertworkshop

    workshop:harness-01-llm-call

    Teil 1 der Harness-Reihe ist ein Kapitel geworden. Vorher stand da im Wesentlichen ein Bau-Prompt mit ein paar Sätzen davor: Wer die Serie las, ohne sie zu bauen, hatte nichts in der Hand. Jetzt trägt der Teil den Termin selbst. Der Ablauf steht in vier Schritten mit Zeitbudget da, vom Vorbereiten über das Interview und den Bau bis zur Abnahme, und dazu, worauf es bei den vier Fragen ankommt, die dein Coding-Agent dir stellt. Am Ende stellst du deinem Agenten im Terminal eine Frage und bekommst eine Antwort. Zwei Dinge siehst du dabei mit eigenen Augen: dass es wirklich nicht mehr als ein Aufruf ist, und dass dieser Aufruf zustandslos bleibt.

  • 21. Aug.Aktualisiertconcept

    Der LLM-Call

    Der Baustein spricht jetzt mit qwen3.8-27b-fast statt mit qwen3.6-35b-fast: Der GPU-Slot trägt nur ein großes Modell, und dort liegt jetzt Qwen 3.8. Betroffen sind die Beispiel-Calls und die Downloads. Dazu eine Korrektur in der Pro-Stufe: Der Absatz zum Context-Window nannte einen getrennten Output-Deckel, den es so nicht mehr gibt. Richtig ist, dass max_tokens nicht mehr als das eine Fenster von 262 144 Tokens anfordern darf.

  • 21. Aug.Neuworkshop

    workshop:harness-00-einstieg

    Vor Teil 1 der Harness-Reihe lag nichts mehr. Teil 0 füllt das: Neun Termine, und danach läuft auf deinem Rechner ein Agent, den du selbst gebaut hast, rund 200 Zeilen ohne Framework darunter. Der Einstieg sagt vorher, was das taugt und was nicht. Werkzeuge auf dieser Stufe sind Datei lesen, Datei schreiben, Ordner ansehen, und daraus wird trotzdem einmal eine Aufgabenliste und einmal ein Mini-Coding-Agent, bei dem nur der System-Prompt ein anderer ist. Was ein Agent ist, kommt aus dem System-Prompt; was er kann, aus den Werkzeugen. Der Systemcheck auf der Seite prüft deinen Rechner, bevor die 45 Minuten des ersten Termins draufgehen.

  • 17. Aug.Aktualisiertconcept

    Benchmarks

    Modellreport 04 „Qwen gegen Qwen“ ist in zweiter Auflage neu gerechnet — mit dem richtigen Gegenüber. Die erste Fassung verglich Qwen3.8-27B mit dem Mixture-of-Experts Qwen3.6-35B-A3B; das ist nicht das Vorgängermodell, sondern eine andere Bauform aus einer anderen Baureihe, und der Abstand fiel dadurch mit zwölf Punkten doppelt so groß aus. Jetzt stehen sich zwei dichte 27-B-Modelle am selben Endpunkt gegenüber: 744 gewertete Läufe über alle 20 Aufgaben, 88,4 gegen 94,2 Prozent. Das Ergebnis ist knapper und interessanter — die neue Generation verliert neun von 38 Zellen. Sie gewinnt, wo eine Aufgabe eine Zweifelsfrage enthält (Aufräumer, Arbeitsregeln, Kurskorrigierer, Anwendungsbau), und verliert, wo die Aufgabe ihre eigene Diagnose mitbringt: Beim Fehlerleser besteht die alte Generation 20 von 20 in 61 Sekunden, während die neue viermal in die Zeitgrenze denkt. Dazu die Token-Rechnung (+32 Prozent im Median bei praktisch gleicher Zugzahl), alle 65 Fehlläufe beider Seiten einzeln und 26 Auswertungsgrafiken. Als PDF in der Bibliothek, ab Pro — und kostenlos unter /gratis/qwen-duell.

  • 15. Aug.Aktualisiertconcept

    Die Modell-Landschaft

    Qwen3.8-27B steht jetzt in der Modell-Landschaft - als Generationssprung über Qwen3.6-27B mit nativem Bildeingang und schaltbarem Denken, samt Erfahrungsbericht aus dem Agentenbetrieb: 343 von 364 gewerteten Läufen bestanden (94 Prozent), 1 344 Werkzeugaufrufe unter Hermes ohne einen einzigen Fehler. Messdatum 14.08.2026.

  • 15. Aug.Aktualisiertconcept

    Benchmarks

    AgentLens hat jetzt Programmieraufgaben - und einen Prüfstand, der zum ersten Mal etwas ausführt statt zu lesen. Bei den beiden neuen Aufgaben wird nach dem Lauf die entstandene Anwendung gestartet und über HTTP befragt: erst die gewöhnlichen Anfragen, dann ein Neustart des Dienstes, dann dieselbe Frage noch einmal. Wer den Zustand nur im Arbeitsspeicher hielt, fällt genau an dieser Stelle. Aufgabe eins ist ein Bestandsfall (eine laufende API mit drei Mängeln, gemeldet als Beschwerden aus dem Betrieb statt als Fehlerbeschreibung), Aufgabe zwei baut von Null. Beide laufen auf einem dritten Harness, der anders als die schlanken beiden eine eingerichtete Entwicklungsumgebung mitbringt - gemessen werden soll die Programmierleistung, nicht das Überleben in einer kargen Umgebung.

  • 14. Aug.Aktualisiertconcept

    Die Modell-Landschaft

    Die Modellkarte von Qwen3.6-35B-A3B trägt jetzt den Erfahrungsbericht aus dem Agentenbetrieb: 720 gewertete Läufe über achtzehn Aufgaben, 82 Prozent mit Denkblock, 78 ohne - und warum der Mittelwert das Interessante verschweigt. Messdatum 13.08.2026.

  • 14. Aug.Aktualisiertconcept

    Benchmarks

    Neuer Modellreport 02: Qwen3.6-35B-A3B über den kompletten AgentLens-Katalog ausgewertet - 726 Läufe, achtzehn Aufgaben, beide Harnesse, und als Hybrid gleich zweimal: mit und ohne Denkblock. Der Band vermisst, was das laute Denken im Agentenbetrieb kauft und kostet, mit Trace-Belegen zu jedem Befund - als PDF in der Bibliothek, ab Pro.

  • 13. Aug.Aktualisiertconcept

    Benchmarks

    Neue Gattung in der Bibliothek: Modellreports. Der erste Band wertet gemma-4-31B-it über den kompletten AgentLens-Katalog aus - 180 Läufe, acht Aufgaben, beide Harnesse, 79 Seiten. Eine Befundtafel vorn nennt die fünf Stellen, an denen das Modell nicht durchkam - je mit Beleg, Ursache, Gegenmittel und dem Baustein, der es erklärt. Der Band erklärt dann den Messaufbau, dokumentiert dann jede Aufgabe einzeln mit echten Zahlen und Trace-Auszügen und nennt auch die Fehler des Prüfstands samt bereinigter Quoten: dreizehn Sim-Läufe, die ihre Welt nie erreichten, und zwei ungleich ausgestattete Sandboxen. Ab Pro, Karte auf der AgentLens-Seite.

  • 13. Aug.Aktualisiertconcept

    Die Modell-Landschaft

    Der Modell-Stöberer zeigt jetzt auch, wie sich ein Modell im Agentenbetrieb hält: Modelle, die durch einen AgentLens-Batch gelaufen sind, tragen im Detail-Panel einen Erfahrungsbericht mit eigenem Messdatum. Den Anfang macht Gemma 4 31B aus dem CRM-Batch vom 13.08. - ein Pass in zwanzig Versuchen, und der kam durch Bündelung der Werkzeugaufrufe.

  • 13. Aug.Aktualisiertconcept

    Tiny Agents und die Kompressionsgrenze

    Neu in der Bibliothek: Werkstattbuch 05 „Tiny Agents" - der Konzeptband zur Station. 79 Seiten, 26 Kapitel: die zwei Probleme, das Verzeichnis mit Veto und Abstain, das Protokoll aus Brief, Digest und hartem Budget - und der Betriebsteil mit Zahlen-Durchlauf, drittem Monat, Modellwechsel und acht Fehlerbildern. Ab Pro, Karte oben auf der Station.

  • 13. Aug.Aktualisiertconcept

    Hardware

    Vier neue Geräte im VRAM-Rechner: NVIDIA DGX Spark, MacBook Pro M5 Max, Mac mini M4 und Mac Studio M3 Ultra. Damit lässt sich der Speicherbedarf eines Modells jetzt auch gegen die Maschinen rechnen, die tatsächlich unter Schreibtischen stehen - inklusive der Fälle, in denen viel Speicher auf schmale Bandbreite trifft.

  • 12. Aug.Aktualisiertconcept

    Die Modell-Landschaft

    Der Modell-Stöberer wächst von zwölf auf achtzehn Karten - alle sechs Neuzugänge sind Modelle, die AgentLens gerade selbst im Benchmark testet: NVIDIAs Nemotron 3.5 Lightning und Nemotron 3 Nano (Mamba-Hybrid-MoEs für eine einzelne GPU), inclusionAIs Ling-3.0-tiny (7,9B MoE unter MIT), Googles Gemma 4 in zwei Bauarten (26B-A4B als MoE, 31B dense - beide multimodal, beide Apache 2.0) und Poolsides Laguna-S-2.1 (118B-A8B für agentisches Coding). Jede Karte ist gegen das Hugging-Face-Repo verifiziert und sagt wie immer, wofür man das Modell nimmt und warum es auf der Liste steht.

  • 12. Aug.Aktualisiertconcept

    Benchmarks

    Der Baustein Benchmarks bekommt sein Gegenstück in echt: AgentLens, der eigene Benchmark der Plattform. Modelle bekommen echte Agenten-Aufgaben - Dateien anlegen und umbauen, ein Server-Log auswerten, eine Kundenliste bereinigen, dazu die Parcours-Welten Termin-Diplomatie und CRM-Pfleger sowie Gedächtnis-Aufgaben über mehrere Gesprächs-Turns - und lösen sie in zwei echten Harnessen (Pi und Hermes), mehrfach je Zelle. Jeder Lauf wird komplett mitgeschnitten: Unter „Entdecken" steht die Ergebnisübersicht mit pass@k gegen pass^k, und hinter jeder Zahl liegt der klickbare Trace - jeder Tool-Call, jedes Ergebnis, jeder Fehlversuch, Fehlklassen vom Ghost-Call bis zur Fehler-Spirale automatisch markiert. Mit freiem Konto siehst du freigegebene Modelle und komplette Beispiel-Läufe; die volle Matrix samt Modell-Steckbriefen und Harness-Vergleich gehört zu Pro. Die Methodik steht als eigene Seite am Baustein.

  • 09. Aug.Neuconcept

    Wie ein LLM funktioniert

    Block III beginnt jetzt im Inneren: Wie ein LLM funktioniert. Die Station löst den Satz ein, der beim LLM-Call unbewiesen blieb - dass am anderen Ende der Leitung ein riesiger, schlauer Zufallsgenerator sitzt. Frei zugänglich die eine Aufgabe (das nächste Token, in Schleife) samt Sampling-Explainer zum Verformen der Verteilung; für Mitglieder der Weg durch die Maschine - Embeddings, Attention zum Ablesen an der Heatmap, das MLP als Wissensspeicher, der Stapel bis zur fertigen Verteilung und die drei Trainingsphasen vom Fortsetzer zum Assistenten, mit eigener Rätselwand. Im Deep-Dive für Pro: Backprop zum Anfassen, die Skalierungsgesetze und warum Halluzination keine Störung ist, sondern die Aufgabe. Dazu neu in der Bibliothek: Werkstattbuch 04 zum Thema - 73 Seiten von der Wette bis zu den Konsequenzen für den Agentenbau, mit Zahlen-Durchlauf, Glossar und Quellen, als PDF für Pro-Mitglieder.

  • 08. Aug.Neuconcept

    Guardrails im Betrieb

    Neuer Baustein in Block II: Guardrails im Betrieb. Die Hausordnung aus Block I wohnt im Harness - aber der Harness ist Partei, er führt aus, was das Modell sagt, und nicht jeder Agent läuft durch deinen Code. Diese Station nimmt die Kontrollebene außerhalb: was im Harness sitzt und was in einem Proxy, was live verhindert und was nur nachträglich beweist, was eine Regel garantiert und was ein Detektor nur wahrscheinlicher macht. Oben frei die Problematik samt einer Schleuse zum Selberschalten, darunter acht Kapitel für Pro-Mitglieder: der Schadenskatalog, die Einordnungs-Landkarte auf vier Achsen (Ort, Zeitpunkt, Wirkung, Entscheidung), der Torwächter, die Detektoren mit ihren echten statt beworbenen Zahlen, Ein- und Ausgangsschleuse, die Handbremse auf der Aktionsebene und die Grenzen - warum kein Filter die Prompt-Injection schließt. Mit zwei neuen interaktiven Flächen, darunter die filterbare Konzept-Matrix. Und oben auf der Seite das Werkstattbuch zum Thema: 98 Seiten, der umfangreichste Band der Reihe, als PDF für Pro-Mitglieder.

  • 08. Aug.Aktualisiertconcept

    Benchmarks

    Der Baustein Benchmarks bekommt ein Werkzeug und eine Messreihe. Das Lab „Eingabeformat" nimmt dein eigenes Material - oder eines von drei Beispielen: Fließtext, Tabelle, Navigation - baut daraus vier Fassungen mit gleichem Inhalt (Plaintext, Markdown, HTML, JSON) samt Tokenzahl und lässt zwei davon blind gegen dasselbe Modell laufen. Welche Seite welches Format war, verrät der Server erst nach deinem Urteil. Regler für Kontextlänge und Position des Materials sind dabei, weil man sonst Lost-in-the-Middle misst und es Formatwirkung nennt. Daneben steht der kontrollierte Zwilling: derselbe Haystack, fester Fragensatz mit hinterlegten Antworten, drei Needle-Tiefen, mehrere Seeds, Temperatur 0 - mit Konfidenzintervallen, die ausdrücklich sagen, wenn ein Vorsprung noch Rauschen ist. Token zählen ist frei, der Vergleich braucht ein Konto.

  • 08. Aug.Neuworkshop

    workshop:fs-01-sehtest

    Die dritte Werkbank-Reihe ist da: „Der KI-Führerschein", ein Ein-Tages-Workshop für Menschen, die KI bedienen statt bauen - kein Code, keine API. Neun Module vom Sehtest über die Frage, warum das Ding erfindet, ohne zu lügen, bis zu Verkehrsregeln, Fahrzeugkunde und dem Arbeitstag mit KI. Am Ende steht die Prüfung, und sie liegt jetzt auf der Plattform statt auf Papier: fünfzehn Fragen aus den Modulen des Tages, Auswertung am Server, ab zwölf richtigen Antworten ein Nachweis mit Datum, Umfang und Aussteller - der ausdrücklich sagt, was er nicht ist. Teilnehmen kann man ohne Konto, über den Teil-Link der Lernreise. Dazu zwei Bände: das Teilnehmerheft zum Mitnehmen (36 Seiten, je Modul eine Doppelseite mit Handgriffen, Prompt-Mustern und Notizzeilen, ab member und über den Teil-Link auch ohne Konto) und der Trainerleitfaden mit der Regie des Tages (78 Seiten, Minutenpläne, Moderationstexte, Übungen, Prüfungslösungen, „Was tun, wenn …", ab teacher).

  • 07. Aug.Neurepo

    Multica

    Neu in der Repo-Sammlung: Multica - ein Brett, auf dem ein Agent als Zuständiger eingetragen wird wie ein Kollege. Beim ersten Agenten ist die Lage übersichtlich, beim dritten kippt sie; lesenswert ist der Go-Teil, weil dort die Betriebsfragen ab dem zweiten Agenten als je eigene Pakete dastehen - Zuteilung, Maschine, Wiederholung nach Fehlschlag, nachspielbares Protokoll.

  • 07. Aug.Neuaha

    Warum dein 8-GB-Modell 20 GB Speicher braucht

    Neues Aha!-Stück: Warum dein 8-GB-Modell 20 GB Speicher braucht. Die Dateigröße ist nur der erste Posten - dazu kommt der KV-Cache, der mit jedem Token im Kontext wächst und mit jeder gleichzeitigen Anfrage noch einmal. Gerechnet an Qwen3-VL-8B-Instruct, samt der Stellschrauben, die wirklich etwas bringen.

  • 07. Aug.Aktualisiertconcept

    Hardware

    Der Baustein Hardware hat jetzt einen VRAM-Rechner. Modell, Quantisierung, Kontextlänge, gleichzeitige Anfragen und Kartenzahl gehen hinein, ein gestapelter Balken gegen die gewählte GPU kommt heraus - und man sieht am Regler, ab wann der KV-Cache die Gewichte überholt und was passiert, wenn nicht einer allein fragt, sondern fünf Leute gleichzeitig.

  • 07. Aug.Aktualisiertconcept

    Memory

    Der Memory-Baustein hat eine neue Ebene: Unter dem Konzept stehen jetzt Datenblätter zu den Systemen, die es umsetzen. Vier sind da - Honcho (das Gedächtnis als Modell des Nutzers statt als Faktenliste), Mem0 (der klassische Einstieg: ein LLM destilliert Aussagesätze, ein Vektor-Store findet sie wieder), LLM Wiki (verlinkte Markdown-Seiten, Navigation statt Ähnlichkeitssuche, nachgerechnet am Memory dieses Repos) und Google OKF (das Open Knowledge Format gegen dieselbe Spec gehalten). Oben auf der Seite neu das Werkstattbuch zum Thema: 97 Seiten als PDF für Pro-Mitglieder, mit einem Betriebsteil zu Wachstum, versteckten LLM-Kosten, Löschbarkeit und Migration.

  • 07. Aug.Neututorial

    Hugging Face für Einsteiger

    Neuer Einsteiger-Kurs: Hugging Face für Einsteiger. Acht Kapitel gegen die Annahme, die Plattform sei ein Download-Schalter für Modellgewichte - Hub-Repos lesen und auf Vertrauenswürdigkeit prüfen, Account und die seit Juli 2025 `hf` heißende CLI, ein Modell auf reiner CPU mit gepinntem Commit, Datasets im Streaming benutzen und eigene veröffentlichen. Herzstück ist Kapitel 05: von einem leeren Ordner zu einer öffentlich erreichbaren Gradio-Demo auf kostenloser Hardware, die nebenbei einen MCP-Endpunkt mitbringt und damit ein Werkzeug für den eigenen Agenten ist. Zum Schluss die Frage, woher die Rechenleistung kommt - inklusive der Antwort darauf, wo dabei die Daten verarbeitet werden. Ohne eigene GPU und ohne bezahlten Account nachvollziehbar.

  • 05. Aug.Aktualisiertworkshop

    workshop:harness-09-tool-routing

    Zum Harness-Kurs gibt es jetzt das Handout „Der kleine Harness": ein 26-seitiges PDF-Book im Werkstattbuch-Design, das die neun Teile der Serie kompakt zusammenfasst - was gebaut wurde, der Code-Kern und die Entdeckung jedes Kapitels. Du findest es auf der Workshop-Übersicht und am Ende von Teil 9.

  • 05. Aug.Neuworkshop

    workshop:tiny-01-capability-card

    Die Werkbank bekommt die Fortsetzung der Harness-Serie: „Dein Agent lernt zu delegieren", fünf Teile, in denen aus deinem Harness ein Host-Agent mit Kompressionsgrenze wird. Teil 1 gibt jeder Fähigkeit eine Fähigkeitskarte, Teil 2 baut den Concierge, der ohne LLM-Call routet, Teil 3 bringt ihm bei, ehrlich Nein zu sagen, Teil 4 zieht die Kompressionsgrenze ein, und Teil 5 sorgt dafür, dass beim Verdichten nichts verlorengeht. Wie in der Harness-Serie: kopierbare Bau-Prompts, gebaut wird gegen die echte API.

  • 05. Aug.Neututorial

    Bau dein eigenes PyTorch

    Neuer Bau-Kurs: Bau dein eigenes PyTorch. Tensor, Autograd, Trainingsschleife - in acht Schritten mit NumPy selbst gebaut und ohne torch. Von der eigenen Tensor-Klasse über das Herzstück Autograd, Schichten und ReLU, Loss und SGD bis zur Trainingsschleife, dem DataLoader und dem Beweis: Am Ende trennt dein eigenes Framework einen Datensatz mit über 90 Prozent Genauigkeit. Ein neuntes Kapitel zeigt, wie du den Kurs als Workshop führst; dazu gibt es zwei Skill-Packs für Claude Code zum Download - eines, das dich coacht, eines, das aufs Ziel führt.

  • 05. Aug.Neututorial

    Bau dein eigenes Tiny-Agents-System

    Neuer Bau-Kurs: Bau dein eigenes Tiny-Agents-System. Was der Baustein erklärt, baust du hier in acht Schritten - ein Concierge, der ohne einen einzigen LLM-Call routet, ein Runner mit frischem Kontext je Auftrag, eine harte Kompressionsgrenze dazwischen. Vom Messen des Problems über die Capability Card, den Positiv-Index, Veto und Abstain bis zu Brief, Digest und Budget, dem Artefakt-Speicher und der Abschlussmessung, ob das Ganze überhaupt etwas bringt. Ohne Framework, ohne Vektordatenbank, gegen einen beliebigen OpenAI-kompatiblen Endpunkt.

  • 05. Aug.Neuconcept

    Tiny Agents und die Kompressionsgrenze

    Neuer Baustein in Block II: Tiny Agents und die Kompressionsgrenze. Eine Etage über dem einzelnen Werkzeugaufruf steht die Frage, welche von zweihundert Fähigkeiten ein Modell überhaupt zu sehen bekommt - und die teurere zweite: was deren Ausgaben mit dem Kontext machen. Beides wird dauernd verwechselt, obwohl es Größenordnungen auseinanderliegt. Frei zugänglich der Einstieg samt Kapitel „Zwei Probleme, zwei Größenordnungen", darunter sechs Kapitel für Pro-Mitglieder: die Capability Card, der Concierge, warum Abstain ein Feature ist, Brief und Digest, der Artefakt-Speicher - und zum Schluss die Rechnung, was das alles kostet.

Juli 2026

  • 31. JuliNeuworkshop

    workshop:harness-01-llm-call

    Die Werkbank hat ihren ersten zusammenhängenden Kurs: die Harness-Serie, neun Kapitel, in denen du deinen eigenen Agenten-Harness baust. Vom LLM-Call über Message-History, System-Prompt, Tools & Loop, Guardrails, Memory, Kanäle & Trigger und Kontext-Kompaktierung bis zur Tool-Call-Optimierung, bei der ein kleines Modell den Werkzeuggriff übernimmt und das große denkt. Jedes Kapitel bringt kopierbare Bau-Prompts mit, gebaut wird gegen die echte API statt gegen eine Attrappe. Aus dem gemeinsamen Probelauf der ersten vier Teile sind die Erkenntnisse zurückgeflossen - darunter der Fall „Modell quittiert, ohne das Werkzeug angefasst zu haben", der jetzt Teil der Abnahme ist.

  • 31. JuliAktualisiertconcept

    Der LLM-Call

    Der LLM-Call bekommt zwei interaktive Flächen. Die Rätselwand im Jeopardy-Stil klopft ab, was von finish_reason, max_tokens, Stoppwörtern und Modellwahl hängengeblieben ist - vier Kategorien, vier Punktwerte, zu jeder Frage eine erklärende Auflösung, wahlweise allein, im Vollbild oder als Hot Seat zu zweit bis viert. Im Deep Dive zeigt der Tokenizer-Playground jetzt einen zweiten Modus: den BPE-Lauf vom Korpus zum Vokabular, Verschmelzung für Verschmelzung.

  • 31. JuliAktualisiertconcept

    Sidecars

    Sidecars: ein neuer Abschnitt darüber, was durch die Prozessgrenze zurückläuft. An einer echten Sitzung im Session-Viewer nachgerechnet - drei curl-Abrufe kippen 52 489 Zeichen in den Kontext, 43,5 % des ganzen Verlaufs, die teuerste Nachricht sind 25 400 Zeichen aus drei Fehlerseiten. Ein Sidecar gibt das Ergebnis zurück statt des Rohmaterials. Mit der ehrlichen Gegenprobe: Kontexteinsparung allein begründet noch kein Sidecar.

  • 30. JuliNeuconcept

    Tool-Calling im Betrieb

    Neuer Baustein in Block II: Tool-Calling im Betrieb. Der Werkzeugaufruf funktioniert im Prototyp und zerbricht in Produktion - nicht am Modell, sondern an sechs Übersetzungen dazwischen. Oben frei die Problematik samt Kettenrechnung, darunter sieben Kapitel für Pro-Mitglieder: Fehlerkatalog, erzwungene Syntax, Werkzeugkasten, Reparieren, Nachweise - und zum Schluss FunctionGemma, der 270-Millionen-Parameter-Spezialist, der neben dem großen Modell steht statt an seiner Stelle. Mit fünf neuen interaktiven Flächen - und oben auf der Seite dem Werkstattbuch zum Thema, 90 Seiten als PDF für Pro-Mitglieder.

  • 29. JuliNeuconcept

    Benchmarks

    Neuer Baustein: Benchmarks. Jede Woche „schlägt" ein neues Modell alle anderen. Benchmarks machen aus diesem Lärm Zahlen - nützlich fürs Grobsortieren, gefährlich, wenn man ihnen blind glaubt. Der Baustein geht die Namen durch, die dir überall begegnen, und zeigt, was sie messen und was nicht.

  • 29. JuliNeuconcept

    Hardware

    Neuer Baustein: Hardware. Warum reden beim Thema LLM alle über Grafikkarten? Weil Speicher die harte Grenze ist: VRAM entscheidet, welche Modelle du überhaupt wählen kannst, und was jede Antwort kostet. Lohnt sich auch, wenn du nie eine eigene GPU kaufst - es erklärt die Preise und die Auswahl.

  • 29. JuliNeuconcept

    Inferenz-Engines

    Neuer Baustein: Inferenz-Engines. Eine Modelldatei ist nur ein Sack voller Zahlen. Dass daraus eine API wird, die auf deinen Call antwortet, ist die Arbeit der Engine - des Plattenspielers, der die Platte abspielt. Sie erzeugt die Antwort Token für Token und hält das mit KV-Cache und Batching schnell.

  • 29. JuliNeuconcept

    Was in einem Modell-Download steckt

    Neuer Baustein: Was in einem Modell-Download steckt. „Lokal betreiben" heißt konkret: ein Ordner mit ein paar Gigabyte darin, und nichts, was von allein etwas tut. Der Baustein geht ihn Datei für Datei durch - und zeigt, warum ausgerechnet die kleinste davon, das Chat-Template, darüber entscheidet, ob dein Modell antwortet oder stottert.

  • 29. JuliNeuconcept

    Die Modell-Landschaft

    Neuer Baustein: Die Modell-Landschaft. „Das eine LLM" gibt es nicht - es gibt hunderte Modelle, in allen Größen, offen und geschlossen. Die erste Weiche ist nicht „welches Modell", sondern „wo läuft es": beim Anbieter oder auf deiner Hardware. Die gute Nachricht: dein Harness bleibt derselbe, nur die Nummer, die er wählt, ändert sich.

  • 29. JuliNeuconcept

    Sidecars

    Neuer Baustein: Sidecars. Was hängt eigentlich am anderen Ende eines Tools? Wer parst das PDF, wer transkribiert die Tonspur? In fast allen ernsthaften Aufbauten ein Sidecar: ein Dienst neben dem Agenten, der genau eine Sache kann und nach der Antwort nichts behält. Warum das ein eigener Container ist und keine Funktion im Agenten-Prozess.

  • 29. JuliNeuconcept

    Memory

    Neuer Baustein: Memory. Ein Agent erinnert sich nie - er schickt mit. Der Baustein zeigt, wie Informationen überhaupt in den Kontext kommen, was einmal pro Sitzung und was bei jeder Anfrage mitfährt, und ab wann dafür ein eigener Dienst neben dem Agenten steht. Es ist der erste Schritt aus dem Harness heraus.

  • 27. JuliAktualisiertconcept

    Tools & Loop

    Neue Recap-Bühne auf dem Tools-und-Loop-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Die Bühne spielt eine komplette Tool-Runde durch - Modell wünscht einen Aufruf, Harness führt aus, Ergebnis geht zurück - und macht sichtbar, dass der Loop im Harness wohnt, nicht im Modell.

  • 27. JuliAktualisiertconcept

    System Prompt

    Neue Recap-Bühne auf dem System-Prompt-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Zu sehen ist, wo der System-Prompt in der Anfrage sitzt, dass er bei jedem Zug mitreist - und wie derselbe Nutzer-Satz mit anderem System-Prompt eine andere Antwort bekommt.

  • 27. JuliAktualisiertconcept

    Message-History

    Neue Recap-Bühne auf dem Message-History-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Die Bühne zeigt, wie aus einzelnen Aufrufen ein Gespräch wird - welche Nachrichten bei jedem Zug erneut über den Draht gehen und was das für Kontext und Kosten bedeutet.

  • 27. JuliAktualisiertconcept

    Der LLM-Call

    Der LLM-Call-Baustein hat jetzt eine Vollbild-Bühne: der Harness-Recap zeigt Chat, Draht und Code nebeneinander und spielt den ersten Aufruf Schritt für Schritt durch. Neu im Deep Dive außerdem der Tokenizer-Playground - drei Tokenizer laufen vollständig im Browser (unser Qwen3 als byte-level BPE, cl100k_base, GPT-2), und die drei Behauptungen der Lerneinheit lassen sich in Sekunden selbst nachprüfen: Deutsch kostet mehr Tokens als Englisch, jedes Modell zerlegt anders, und an „Strawberry" scheitert der Tokenizer, nicht das Modell.

  • 26. JuliAktualisiertconcept

    Guardrails

    Der Guardrails-Baustein behandelt Prompt Injection nicht mehr als Warnung, sondern als Lernstrecke: die Verteidigungsleiter von Stufe 0 bis 6 als Tabelle, jede Schicht mit dem Angriff, an dem sie zerbricht. Dazu die drei Befunde aus Lakeras Auswertung von 279 000 echten Angriffen (Schichtung wirkt, Domänen-Einschränkung ist die stärkste Einzelmaßnahme, Verteidigung im System-Prompt kostet Nutzbarkeit), die Einordnung als OWASP LLM01 - und der Kommentar-Agent dieser Seite als Beispiel aus dem eigenen Haus. Beendete Arena-Challenges bekommen dazu eine Auflösung: welche Schicht wie oft gegriffen hat, und wo die Sackgassen lagen.

  • 25. JuliAktualisierttutorial

    OpenRouter-Key besorgen und ersten Call machen

    Das Einstiegs-Tutorial zum ersten LLM-Call läuft jetzt über OpenRouter statt über einen direkten Anthropic-Account: ein Key, hunderte Modelle, kostenlose Varianten - ohne Firmenverifizierung. Neu mit Screenshots für Registrierung und Key-Erzeugung, curl- und SDK-Variante, einem Vergleich der Response-Felder zum Anthropic-Dialekt und dem Weg, den Key direkt im eigenen Konto zu hinterlegen.