SWE-agent
SWE-agent/SWE-agent Auf GitHub ansehen20.119 SternePythonAktualisiert Aug. 2026
Der Agent aus der Forschung, der echte GitHub-Issues löst - und nebenbei zeigt, wie man Agenten überhaupt vergleichbar misst.
Die meisten Agenten sehen in der Demo gut aus. Ob sie wirklich etwas taugen, zeigt sich erst an einer Aufgabe, die niemand für sie zurechtgelegt hat - zum Beispiel an echten, bereits geschlossenen GitHub-Issues, deren Lösung man kennt und deren Tests man laufen lassen kann.
Genau darum geht es hier. SWE-agent ist ein Agent, der solche Issues bearbeitet, und zugleich der Anschauungsfall für eine These, die man beim Agentenbau schnell unterschätzt: Die Werkzeugoberfläche ist keine Nebensache. Ein Datei-Editor, der dem Modell nach jeder Änderung Zeilennummern und Kontext zurückgibt, verändert die Trefferquote stärker als der zehnte Satz im System-Prompt. Wer eigene Tools entwirft, findet hier die überzeugendste Begründung dafür, sie aus Modellsicht zu gestalten statt aus Programmierersicht.
Zweiter Grund, hierher zu schauen: der Aufbau der Auswertung. Container pro Aufgabe, feste Startbedingungen, ein Testlauf als Urteil - keine Modell-Jury. Das ist die Vorlage, wenn man den eigenen Agenten messen statt bewundern will.
- eval
- benchmark
- forschung
Community-Bewertung
Melde dich an, um dieses Projekt zu bewerten.
AnmeldenDiskussion· noch keine Beiträge
Unser Kommentar-Agent liest jeden neuen Beitrag, bedankt sich oder empfiehlt passende Inhalte.
Sei die erste Stimme - was denkst du dazu?
Melde dich an, um mitzudiskutieren.
Anmelden