BenchmarksImplementierung 02 / 02

Weltmodelle - und was AgentWorldBench misst

Ein Weltmodell sagt nicht die nächste Aktion vorher, sondern die nächste Beobachtung: Es spielt die Umgebung. Was die Ranglistenzahlen dazu bedeuten, wofür man so etwas einsetzt und wo die Grenze verläuft.

Implementierungen

Je ein Datenblatt zu einem System, das dieses Bauteil umsetzt - immer nach demselben Raster.

Warum steht das hier und nicht bei den Tiny Agents? Weil die interessante Frage an ein Weltmodell eine Benchmark-Frage ist. Was sagt die Zahl aus, die darübersteht? Ein Weltmodell handelt nämlich gar nicht. Es spielt die Umgebung, in der gehandelt wird, und damit gehört es in denselben Baustein wie AgentLens - zu der Frage, wie du einen Agenten überhaupt beurteilst.

Die Umkehrung

Ein gewöhnliches Agenten-Modell bekommt einen Verlauf und sagt die nächste Aktion vorher. Welches Werkzeug, welche Argumente.

Ein Weltmodell bekommt denselben Verlauf plus die Aktion und sagt die nächste Beobachtung vorher. Was der Server geantwortet hätte. Was auf dem Terminal gestanden hätte. Wie die Seite nach dem Klick aussieht.

Dieselbe Bauart, andere Rolle. Der Agent spielt den Handelnden, das Weltmodell spielt die Welt. Mehr ist es nicht.

Qwen-AgentWorld deckt sieben solcher Umgebungen ab. MCP, Suche, Terminal, SWE, Web, Betriebssystem, Android. Jede davon hat ein eigenes Format, in dem Aktion und Beobachtung ausgedrückt werden, und das Modell ist darauf trainiert, in genau diesem Format zu antworten.

Die Zahlen, und was sie nicht sagen

Auf AgentWorldBench, dem mitgelieferten Maßstab, stehen laut der Veröffentlichung vom 24.06.2026 diese Werte:

ModellAgentWorldBench
Qwen-AgentWorld (397B)58,71
GPT-5.458,25
Claude Opus 4.856,59
Gemini 3.1 Pro54,57

Das sind Fremdangaben. Der Anbieter hat sie selbst veröffentlicht, nachgemessen wurden sie hier nicht. AgentLens misst etwas anderes und taugt nicht zum Gegencheck.

Wichtiger als die Rangfolge ist, was dort überhaupt bewertet wird. AgentWorldBench prüft Simulationsqualität. Wie nah kommt die vorhergesagte Beobachtung an die, die ein echtes System geliefert hätte? Ein hoher Wert heißt, dass das Modell überzeugend Umgebung spielt. Über Handlungsfähigkeit sagt er nichts. Ein Modell, das die Antwort eines CRM-Servers perfekt vorhersagt, hat damit keinen einzigen Auftrag abgearbeitet.

Der Abstand von 0,46 Punkten zum nächsten Allzweckmodell ist außerdem schmaler, als eine Tabelle wirken lässt. Bemerkenswert daran ist eher, dass ein spezialisiertes Modell hier überhaupt mit den großen mithält - und dass die großen offenbar nebenbei ganz brauchbare Weltmodelle sind.

Wofür man das einsetzt

Übungsumgebungen, die niemand bauen muss. Der stärkste Fall, und der Grund, warum auf dieser Plattform ein solcher Endpunkt steht. Ein Szenario für die Branche eines Kunden ist eine Textdatei statt eines Systems, und in der großen der beiden hier stehen 48 Werkzeuge aus acht Domänen, ohne Schema, ohne Migration, ohne Testdaten. Wer eine Welt zurücksetzen will, legt eine neue an.

Vorhersage als Vorschau. Dein Agent kann einen riskanten Aufruf erst gegen das Weltmodell laufen lassen und sich die vorhergesagte Beobachtung ansehen, bevor er ihn wirklich absetzt. Billiger als ein Rollback. Und ehrlicher als eine Selbsteinschätzung.

Datenerzeugung, mit Vorbehalt. Verläufe aus einer emulierten Welt kann man als Trainingsmaterial verwenden. Was dabei entsteht, ist allerdings Material über eine Fiktion, und wer einen Spezialisten darauf trainiert, muss ihn anschließend woanders prüfen als in derselben Fiktion. Siehe unten.

Wo die Grenze verläuft

Ein Weltmodell erfindet Umgebungen so, wie ein Sprachmodell Fakten erfindet - plausibel, formatgetreu, unmarkiert. Drei Dinge folgen daraus.

Es driftet. Je länger eine Sitzung läuft, desto mehr Verlauf muss in den Prompt, und irgendwann passt er nicht mehr hinein. Das ist kein Fehler, den man wegkonfiguriert, das ist die Bauart. Der Endpunkt hier schreibt deshalb je Aufruf mit, wie viel Verlauf noch hineinging.

Es hat keine Wahrheit. Zwei frische Welten aus demselben Szenario geben derselben Firma zwei verschiedene Kundennummern, und beide Antworten sehen gleich richtig aus. Vorgeführt ist das im Stück Die Welt oder ein Modell der Welt.

Es kann nicht bewerten. Eine Aufgabe gilt als bestanden, wenn ein Zustand nachweisbar eingetreten ist. In einer erfundenen Welt gibt es den nicht. Was du hinterher in der Hand hältst, ist ein Gesprächsprotokoll, das zu sich selbst passt.

Daraus wird die Regel, die in diesem Projekt an mehreren Stellen im Weg steht: Üben in der erfundenen Welt, messen in der echten. Gemessen wird gegen Simhaven, wo hinter dem Endpunkt Zeilen in einer Datenbank liegen, die eine Bewertung lesen kann.

Wie es hier gebaut ist

Der Endpunkt /welt liegt im selben MCP-Container wie die Simhaven-Welten und folgt denselben Regeln. Sitzungs-Token statt Betreiber-Token, frischer Server je Sitzung, eigener Scope. Die Szenarien sind Daten (mcp/world/scenarios/*.json). Zwei Stück, eines groß, eines schmal.

Vier Deckel begrenzen eine Welt. Aufrufe je Sitzung, Kontextlänge, Timeout, Sitzungsdauer - jeder Werkzeugaufruf ist ja ein LLM-Aufruf mit wachsendem Kontext, und eine vergessene Schleife wäre sonst eine GPU-Rechnung. Gezählt wird vor dem Prüfen. Sonst wäre das Anrennen gegen den Deckel kostenlos.

Betrieben wird das Modell als eigener kleiner Dauerdienst neben dem großen Inferenz-Slot, mit eigenen Umgebungsvariablen. Der Grund dafür war am 06.09.2026 direkt am Gerät zu besichtigen. Der große Slot war an dem Tag leer, und jede Anfrage an das Hausmodell kam mit HTTP 500 zurück. Ein Endpunkt, der in einer Schulung zuverlässig steht, darf an so etwas nicht hängen.

Anlegen kannst du eine Welt unter /weltmodell.