Agenten-Benchmark
AgentLens ist der Benchmark dieser Plattform für Agenten-Tauglichkeit. Modelle bekommen echte mehrschrittige Aufgaben - Dateien anlegen, einen Kalender aufräumen, ein CRM pflegen - und müssen sie mit Werkzeugen lösen, nicht mit einer schön formulierten Antwort. Jeder Lauf wird dabei komplett mitgeschnitten.
Gemessen wird, was einzelne Punktzahlen verstecken: ob ein Modell eine Aufgabe immer schafft oder nur manchmal (pass^k gegen pass@k), an welchem Schritt eine Kette kippt und welche von zehn Fehlerklassen dahintersteckt - vom Ghost-Call bis zur Fehler-Spirale. Infrastruktur-Fehler zählen dabei nie gegen das Modell.
Und weil dieselbe Aufgabe unter zwei Harnessen läuft, wird sichtbar, wie viel der Leistung am Modell hängt und wie viel am Gerüst darum. Jedes Ergebnis bleibt nachprüfbar: Hinter jeder Zelle der Matrix steht der Lauf selbst, Schritt für Schritt.
Modell × Harness × Aufgabe
Ein aussagekräftiger Agenten-Benchmark misst jede Kombination aus Modell, Harness und Aufgabe - und analysiert die Fehlschläge, statt Token/s zu zählen. Jede Zahl hier hat einen vollständigen Trace dahinter.
Die Bestandsaufnahme der Messreihe: diese Aufgaben, Harnesse und Modelle sind Teil des Benchmarks. Jede Aufgabe führt zu ihrer Detailseite mit Prompt, Ziel und Musterlösung.
20 Aufgaben
- T1Statusdatei anlegenWorkspace-AufgabeDie kleinste echte Aufgabe: eine Datei mit exaktem Inhalt anlegen. Wer hier scheitert, scheitert am Tool-Call selbst.
- T2Fehler aus dem Server-Log ziehenWorkspace-AufgabeEin Log lesen, ERROR-Zeilen zählen, die Request-IDs berichten — lesen, filtern, schreiben in einer Kette.
- T3Konfiguration aufteilenWorkspace-AufgabeEin Refactoring mit Nebenbedingung: etwas herauslösen, ohne den Rest zu beschädigen — der Klassiker, an dem Ketten kippen.
- T4Kundenliste bereinigenWorkspace-AufgabeDubletten nach Regel auflösen, Unbrauchbares verwerfen, nichts Gültiges verlieren — Datenpflege wie im echten Betrieb.
- T4Termin-Diplomatie (Simhaven-Kalender)Sim-Welt: KalenderDie Parcours-Aufgabe P5 als Benchmark: drei Kalender lesen, einen gültigen Slot finden, Termin samt Einladungen und Raum anlegen — echtes Mehrschritt-Tool-Calling gegen einen MCP-Server.
- T5Der CRM-Pfleger (Simhaven-CRM)Sim-Welt: CRMDie Parcours-Aufgabe P8 als Benchmark: fünfzig Kontakte, Dubletten zusammenführen ohne Notizen zu verlieren, Leads importieren, Status heben — die härteste Kette der Suite.
- T3Projektdaten über Ablenkung hinweg behaltenDialog-AufgabeTurn 1 nennt die Eckdaten, zwei Ablenkungsaufgaben später müssen sie im Briefing wieder auftauchen — Memory über mehrere Turns statt Needle-in-Haystack.
- T2Vereinbarte Arbeitsregeln durchhaltenDialog-AufgabeTurn 1 vereinbart Formatregeln, die folgenden Antworten müssen sie unaufgefordert einhalten — Instruktions-Gedächtnis statt Wissensabfrage.
- T5Fremden Dienst erschließen (ohne Wegweiser)Workspace-AufgabeErste Aufgabe im offenen Netz: aus einer PDF-Rechnung eine XRechnung machen — mit einem Dienst, den erst mal niemand zeigt.
- T4Fremden Dienst erschließen (mit Wegweiser)Workspace-AufgabeDieselbe Arbeit wie die Aufgabe davor, ein Satz mehr im Auftrag: die Adresse der llms.txt. Der Unterschied der beiden Ergebnisse ist der Messwert.
- T3Der AufräumerWorkspace-AufgabeLöschen ohne Kollateralschaden: Wegwerf-Material entfernen, aber drei Dateien stehen lassen, die nur so aussehen. Wer nach Muster greift statt zu lesen, fällt.
- T4Der FehlerleserWorkspace-AufgabeEin Cent fehlt, und der Code sieht richtig aus. Misst, ob ein Agent ausführt statt überfliegt — und ob er die Berechnung repariert oder den Test.
- T3Der BaumeisterWorkspace-Aufgabe144 Verzeichnisse nach Vorgabe anlegen. Fachlich trivial — gemessen wird nicht, ob es gelingt, sondern was es kostet: ein Aufruf oder hundertfünfzig.
- T4Die zweite HälfteWorkspace-AufgabeEin halbfertiges Archiv in den Sollzustand bringen — teils richtig, teils falsch, und niemand sagt, welches welches ist. Misst, ob ein Agent abgleicht, bevor er anfängt.
- T4Der RiesenlogWorkspace-Aufgabe40 MB Log, 400 000 Zeilen, zwei Zahlen als Ergebnis. Misst nicht Können, sondern Zurückhaltung — wer die Datei liest statt sie zu filtern, zahlt ein Vielfaches und scheitert meist ganz.
- T4Der KurskorrigiererWorkspace-AufgabeErst nach Monat sortieren, dann kommt die Gegenorder: doch nach Lieferant. Misst nicht, ob ein Agent das Neue bauen kann, sondern ob er das Alte zurückbaut.
- T3Die StichtagsrechnungWorkspace-AufgabeOffene Posten zum Stichtag auswerten: Fälligkeit aus Zahlungsziel rechnen, gemischte Datumsformate lesen, deutsche Beträge summieren. Kein Werkzeugwissen — nur richtig rechnen.
- T2Anweisung gegen GewohnheitWorkspace-AufgabeEine Fingerübung mit vier ausdrücklichen Verboten, die alle gegen das Default-Verhalten stehen. Misst nicht Können, sondern Einhalten.
- T4Der FlickenteppichWorkspace-AufgabeEine laufende Lager-API mit drei Mängeln. Gemeldet werden Symptome, nicht Fehler — und die Prüfung spricht am Ende die echte Anwendung an, nicht ihren Quelltext.
- T5Die AufgabenlisteWorkspace-AufgabeEine kleine Webanwendung von null: API, Webseite und lokale Datenbank. Der schärfste Schnitt ist der Neustart — wer den Zustand im Arbeitsspeicher hält, verliert ihn dort.
3 Harnesse
- piBewusst schlankes Gerüst (pi-coding-agent): wenige Werkzeuge, keine eingebaute Planung. Zeigt, was das Modell allein trägt.
- hermesDer Agent-Harness von Nous Research: eigene Werkzeugpalette und mehr Struktur drumherum. Zeigt, was ein Modell mit mehr Gerüst erreicht.
- opencodeEine eingerichtete Entwicklungsumgebung (OpenCode): Sprachlaufzeiten, Paketmanager und Werkzeuge, wie ein Mensch sie vorfände. Hier laufen die Programmieraufgaben - gemessen wird die Programmierleistung, nicht das Überleben in einer kargen Umgebung.
14 Modelle
- gemma-4-26b-a4b-it (openrouter)in VorbereitungFree-Tier über OpenRouter — https://openrouter.ai/google/gemma-4-26b-a4b-it:free
- Gemma4-27B vLLMin Vorbereitung
- gemma-4-31b-it (lokal)getestetEigener Inferenz-Server (llama.cpp) via Cloudflare-Tunnel — vorher OpenRouter :free (chronisch 429 im geteilten Google-AI-Studio-Pool). Tunnel-URL ist flüchtig: bei neuem Tunnel hier base_url nachziehen.
- gpt-oss-20b (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/openai/gpt-oss-20b:free
- laguna-s-2.1 (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/poolside/laguna-s-2.1:free
- ling-3.0-tiny (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/inclusionai/ling-3.0-tiny:free
- nemotron-3.5-lightning (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/nvidia/nemotron-3.5-lightning:free
- nemotron-3-nano-30b-a3b (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/nvidia/nemotron-3-nano-30b-a3b:free
- Nemotron 3 Nano 30B vLLMgetestet
- Qwen3.6-27B dense vLLMgetestetFranconia vLLM, dense 27B (Server meldet sich als qwen3.6-27b) - dichtes Gegenstueck zum MoE qwen3.6-35b bei ki-gilde.
- qwen3.6-35bgetestetKostprobe für Memberki-gilde vLLM, Standard-Serving.
- qwen3.6-35b-fastgetestetKostprobe für Memberki-gilde vLLM, Fast-Variante - dasselbe Modell, das auch runChat auf der Plattform bedient.
- qwen3.8-27b-q8 (lokal)getestetEigener Inferenz-Server (llama.cpp b8640, Qwen3.8-27B-Q8_0.gguf, n_ctx 131072, 1 Slot) via Cloudflare-Tunnel — selber Schlüssel wie gemma-4-31b-it (lokal). Tunnel-URL ist flüchtig: bei neuem Tunnel hier base_url nachziehen.
- Qwen3.8-vLLMgetestetKostprobe für Member
- Mit einem freien Konto siehst du die freigegebenen Modelle in der Ergebnisübersicht und komplette Beispiel-Läufe als Kostprobe.
- Pro sieht alles: die volle Matrix über alle Modelle, Aufgaben und Harnesse, die Modell-Steckbriefe und jeden einzelnen Trace.
Mit einem freien Konto kannst du außerdem weitere Modelle, Harnesse oder Aufgaben für die Messreihe vorschlagen.
Wie gemessen wird - Aufgaben, Fehlerklassen, Verdicts - steht im Bauteil Benchmarks: