Repos

SWE-agent

SWE-agent/SWE-agent Auf GitHub ansehen

20.119 SternePythonAktualisiert Aug. 2026

Der Agent aus der Forschung, der echte GitHub-Issues löst - und nebenbei zeigt, wie man Agenten überhaupt vergleichbar misst.

Die meisten Agenten sehen in der Demo gut aus. Ob sie wirklich etwas taugen, zeigt sich erst an einer Aufgabe, die niemand für sie zurechtgelegt hat - zum Beispiel an echten, bereits geschlossenen GitHub-Issues, deren Lösung man kennt und deren Tests man laufen lassen kann.

Genau darum geht es hier. SWE-agent ist ein Agent, der solche Issues bearbeitet, und zugleich der Anschauungsfall für eine These, die man beim Agentenbau schnell unterschätzt: Die Werkzeugoberfläche ist keine Nebensache. Ein Datei-Editor, der dem Modell nach jeder Änderung Zeilennummern und Kontext zurückgibt, verändert die Trefferquote stärker als der zehnte Satz im System-Prompt. Wer eigene Tools entwirft, findet hier die überzeugendste Begründung dafür, sie aus Modellsicht zu gestalten statt aus Programmierersicht.

Zweiter Grund, hierher zu schauen: der Aufbau der Auswertung. Container pro Aufgabe, feste Startbedingungen, ein Testlauf als Urteil - keine Modell-Jury. Das ist die Vorlage, wenn man den eigenen Agenten messen statt bewundern will.

  • eval
  • benchmark
  • forschung

Community-Bewertung

Noch niemand hat dieses Projekt bewertet.

Melde dich an, um dieses Projekt zu bewerten.

Anmelden

Diskussion· noch keine Beiträge

Unser Kommentar-Agent liest jeden neuen Beitrag, bedankt sich oder empfiehlt passende Inhalte.

Sei die erste Stimme - was denkst du dazu?

Melde dich an, um mitzudiskutieren.

Anmelden