AgentLens

Agenten-Benchmark

AgentLens ist der Benchmark dieser Plattform für Agenten-Tauglichkeit. Modelle bekommen echte mehrschrittige Aufgaben - Dateien anlegen, einen Kalender aufräumen, ein CRM pflegen - und müssen sie mit Werkzeugen lösen, nicht mit einer schön formulierten Antwort. Jeder Lauf wird dabei komplett mitgeschnitten.

Gemessen wird, was einzelne Punktzahlen verstecken: ob ein Modell eine Aufgabe immer schafft oder nur manchmal (pass^k gegen pass@k), an welchem Schritt eine Kette kippt und welche von zehn Fehlerklassen dahintersteckt - vom Ghost-Call bis zur Fehler-Spirale. Infrastruktur-Fehler zählen dabei nie gegen das Modell.

Und weil dieselbe Aufgabe unter zwei Harnessen läuft, wird sichtbar, wie viel der Leistung am Modell hängt und wie viel am Gerüst darum. Jedes Ergebnis bleibt nachprüfbar: Hinter jeder Zelle der Matrix steht der Lauf selbst, Schritt für Schritt.

Modell × Harness × Aufgabe

Ein aussagekräftiger Agenten-Benchmark misst jede Kombination aus Modell, Harness und Aufgabe - und analysiert die Fehlschläge, statt Token/s zu zählen. Jede Zahl hier hat einen vollständigen Trace dahinter.

Was gemessen wird

Die Bestandsaufnahme der Messreihe: diese Aufgaben, Harnesse und Modelle sind Teil des Benchmarks. Jede Aufgabe führt zu ihrer Detailseite mit Prompt, Ziel und Musterlösung.

20 Aufgaben

3 Harnesse

  • piBewusst schlankes Gerüst (pi-coding-agent): wenige Werkzeuge, keine eingebaute Planung. Zeigt, was das Modell allein trägt.
  • hermesDer Agent-Harness von Nous Research: eigene Werkzeugpalette und mehr Struktur drumherum. Zeigt, was ein Modell mit mehr Gerüst erreicht.
  • opencodeEine eingerichtete Entwicklungsumgebung (OpenCode): Sprachlaufzeiten, Paketmanager und Werkzeuge, wie ein Mensch sie vorfände. Hier laufen die Programmieraufgaben - gemessen wird die Programmierleistung, nicht das Überleben in einer kargen Umgebung.

14 Modelle

  • gemma-4-26b-a4b-it (openrouter)in VorbereitungFree-Tier über OpenRouter — https://openrouter.ai/google/gemma-4-26b-a4b-it:free
  • Gemma4-27B vLLMin Vorbereitung
  • gemma-4-31b-it (lokal)getestetEigener Inferenz-Server (llama.cpp) via Cloudflare-Tunnel — vorher OpenRouter :free (chronisch 429 im geteilten Google-AI-Studio-Pool). Tunnel-URL ist flüchtig: bei neuem Tunnel hier base_url nachziehen.
  • gpt-oss-20b (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/openai/gpt-oss-20b:free
  • laguna-s-2.1 (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/poolside/laguna-s-2.1:free
  • ling-3.0-tiny (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/inclusionai/ling-3.0-tiny:free
  • nemotron-3.5-lightning (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/nvidia/nemotron-3.5-lightning:free
  • nemotron-3-nano-30b-a3b (openrouter)getestetFree-Tier über OpenRouter — https://openrouter.ai/nvidia/nemotron-3-nano-30b-a3b:free
  • Nemotron 3 Nano 30B vLLMgetestet
  • Qwen3.6-27B dense vLLMgetestetFranconia vLLM, dense 27B (Server meldet sich als qwen3.6-27b) - dichtes Gegenstueck zum MoE qwen3.6-35b bei ki-gilde.
  • qwen3.6-35bgetestetKostprobe für Memberki-gilde vLLM, Standard-Serving.
  • qwen3.6-35b-fastgetestetKostprobe für Memberki-gilde vLLM, Fast-Variante - dasselbe Modell, das auch runChat auf der Plattform bedient.
  • qwen3.8-27b-q8 (lokal)getestetEigener Inferenz-Server (llama.cpp b8640, Qwen3.8-27B-Q8_0.gguf, n_ctx 131072, 1 Slot) via Cloudflare-Tunnel — selber Schlüssel wie gemma-4-31b-it (lokal). Tunnel-URL ist flüchtig: bei neuem Tunnel hier base_url nachziehen.
  • Qwen3.8-vLLMgetestetKostprobe für Member

Was sichtbar ist

  • Mit einem freien Konto siehst du die freigegebenen Modelle in der Ergebnisübersicht und komplette Beispiel-Läufe als Kostprobe.
  • Pro sieht alles: die volle Matrix über alle Modelle, Aufgaben und Harnesse, die Modell-Steckbriefe und jeden einzelnen Trace.

Mit einem freien Konto kannst du außerdem weitere Modelle, Harnesse oder Aufgaben für die Messreihe vorschlagen.

Wie gemessen wird - Aufgaben, Fehlerklassen, Verdicts - steht im Bauteil Benchmarks: