
Acht Tage lang ließ ein KI-Forschungsagent Änderungen an seiner eigenen Software vorschlagen und testen. Sieben neue Versionen setzten sich nacheinander durch. Gleichzeitig berichten große KI-Labore, dass ihre Systeme immer mehr Arbeit an künftigen Modellen übernehmen. Klingt nach einer Maschine, die sich längst selbst weiterentwickelt? Der entscheidende Unterschied steckt in der Frage, was verbessert wird. Ein Agent kann seine Werkzeuge umbauen, ohne sein Grundmodell neu zu trainieren. Dieser Beitrag zeigt, was die jüngsten Versuche tatsächlich belegen, welche Angaben aus Firmenlaboren stammen und wo die Grenze zur vollautonomen KI-Entwicklung weiterhin verläuft.
Der Stand in einem Satz
Mehrstufige Selbstverbesserung von KI-Agenten ist experimentell belegt. Eine allgemein einsetzbare KI, die eigenständig bessere Grundmodelle entwickelt, ist öffentlich nicht nachgewiesen.
- AIDE² änderte in acht Tagen siebenmal die eigene Agentensoftware.
- Laborberichte belegen wachsende KI-Hilfe, keine geschlossene Modellentwicklung ohne Menschen.
Entscheidend ist, was sich verbessert: ein Arbeitsablauf, ein Agent oder das Grundmodell.
Kernpunkte
- Ein Experiment vom September zeigt eine echte Folge von sieben Verbesserungen eines KI-Forschungsagenten. Die Ergebnisse übertrugen sich auf zurückgehaltene Aufgaben. Das ist ein wichtiger, aber begrenzter Befund.
- OpenAI und Anthropic dokumentieren einen starken Einsatz von KI in der eigenen Forschung. Menschen setzen dort nach eigenen Angaben weiterhin Prioritäten, beurteilen Ergebnisse und entscheiden über Training und Einsatz.
- Die unabhängige Organisation METR hält die vollständige Automatisierung der KI-Forschung durch ein jüngst geprüftes System für unwahrscheinlich. Aus mehreren besseren Agentenversionen folgt noch keine „Intelligenzexplosion“.
Was „selbst“ in diesem Fall bedeutet
Der Ausdruck rekursive Selbstverbesserung wird für verschiedene Vorgänge benutzt. Bei der schwachen Variante hilft KI Menschen, bessere KI zu bauen: Sie schreibt Code, prüft Messwerte oder schlägt Experimente vor. Bei einer stärkeren Variante verändert ein KI-Agent seinen eigenen Arbeitsablauf. Die verbesserte Version nimmt dann die nächste Änderung vor. Erst in der weitreichendsten Lesart würde ein System weitgehend eigenständig ein leistungsfähigeres Grundmodell entwickeln, es testen und mit dessen Hilfe den nächsten Entwicklungsschritt schaffen. Die Forschenden von METR weisen ausdrücklich auf diese unterschiedlichen Definitionen hin.
Drei Stufen, drei unterschiedliche Belege
| Kriterium | Was ändert sich? | Was ist belegt? |
|---|---|---|
| KI als Forschungswerkzeug | Code, Auswertungen und Experimente in menschlich geführten Projekten. | Laborberichte zeigen wachsenden Einsatz; Gesamtbeschleunigung ist schwerer zu messen. |
| Agent verbessert seinen Agenten | Werkzeuge, Speicher oder Suche des Agenten werden über mehrere Runden umgeschrieben. | AIDE² und Darwin Gödel Machine zeigen begrenzte, getestete Schleifen bei festen Grundmodellen. |
| KI entwickelt Nachfolgemodell | Eine KI setzt Ziele, entwirft und trainiert ein stärkeres Grundmodell und wiederholt den ganzen Zyklus eigenständig. | Für diese starke Form gibt es keinen öffentlich bestätigten Nachweis. |
Diese Unterscheidung betrifft mehr als Wortklauberei. Ein besserer Suchalgorithmus kann ein vorhandenes Sprachmodell effizienter einsetzen, ohne dessen gelernte Fähigkeiten zu verändern. Ein schnellerer Trainingsbaustein kann später beim Bau eines Modells helfen, ohne dass das ältere Modell die gesamte neue Generation selbst geplant hätte. Die drei Entwicklungen können einander verstärken. Sie sind trotzdem unterschiedliche Behauptungen, für die unterschiedliche Belege nötig sind.
Das zeigte bereits AlphaEvolve von Google DeepMind: Sprachmodelle erzeugen Programmkandidaten, automatische Prüfer bewerten sie, und eine Auswahl guter Varianten fließt in weitere Suchrunden. Google berichtet, dass so auch Algorithmen für seine KI-Infrastruktur verbessert wurden. Der Prüfrahmen ist allerdings vorgegeben und die zugrunde liegenden Modelle werden durch diese Suchrunde nicht selbst zu neuen Grundmodellen. AlphaEvolve illustriert die Rückkopplung zwischen KI und KI-Entwicklung, ohne die starke Form einer autonomen Nachfolgerentwicklung zu beweisen.
Sieben Versionen in acht Tagen: der neue Versuch
Die im September veröffentlichte Arbeit „Recursive self-improvement of AI research agents“ geht einen Schritt weiter. Ihr System AIDE² bearbeitet nicht nur fremde Programme. Der Forschungsagent schlägt Änderungen an seinem eigenen Code vor, testet die geänderten Fassungen auf Aufgaben aus der KI-Forschung und behält erfolgreichere Varianten. Die angenommene Version wird wiederum zum Ausgangspunkt für die nächste Runde. In einem achttägigen autonomen Versuch entstanden so sieben aufeinanderfolgende Verbesserungen, darunter Änderungen an der Suche und am Umgang mit dem wachsenden Kontext des Agenten.
Wichtig ist der zweite Teil des Ergebnisses: Die Forschenden prüften die stärkste Version auf vier Aufgabenfamilien, die nicht zur Auswahl der Änderungen dienten. Nach ihren Angaben erreichte oder übertraf sie dort einen von Menschen entwickelten Forschungsagenten. Eine gesonderte Prüfung zum Ausnutzen von Bewertungsfehlern zeigte in dieser Versuchsanordnung einen Rückgang von 55 auf 32 Prozent. Zurückgehaltene Tests sind bedeutsam, weil eine scheinbare Verbesserung sonst nur darin bestehen könnte, bekannte Prüfaufgaben auswendig zu bedienen oder die Messgröße geschickt zu umgehen.
Das ist ein Preprint und zunächst ein Ergebnis der beteiligten Forschenden, keine unabhängige Replikation. Vor allem bleibt der Verbesserungsgegenstand begrenzt: AIDE² änderte den Agenten und seinen Arbeitsprozess auf Basis bereits vorhandener Grundmodelle. Es entwickelte nicht in acht Tagen sieben immer leistungsfähigere Sprachmodelle. Auch die vier zurückgehaltenen Benchmarks bilden nicht die gesamte Arbeit eines KI-Labors ab. Der Versuch belegt damit eine rekursive Schleife im Agentendesign und einen gewissen Transfer. Ob eine solche Schleife dauerhaft, über viele Forschungsfelder und bei der Entwicklung neuer Grundmodelle trägt, ist offen.
Ein Vorläufer macht die Grenze sichtbar. Die Darwin Gödel Machine verändert ebenfalls wiederholt den Code eines Coding-Agenten und wählt Varianten nach Tests aus. Die Autoren berichten deutliche Zuwächse auf ihren Programmierbenchmarks, arbeiteten aber mit festen Grundmodellen, Sandboxen und menschlicher Aufsicht. Der neuere AIDE²-Versuch erweitert die Evidenz um eine konkrete Serie von Verbesserungen eines Forschungsagenten und zurückgehaltene Aufgaben. Er hebt die Unterscheidung zwischen Agent und Grundmodell nicht auf.
In den Laboren wächst die Hilfe – die Entscheidung bleibt bei Menschen
Neben kontrollierten Versuchen gibt es Berichte aus der tatsächlichen Modellentwicklung. Anthropic beschreibt im September 2026, dass Claude bei Forschung und Technikentwicklung mitarbeitet. Nach Angaben des Unternehmens stammten im Mai mehr als 80 Prozent der in seine Codebasis übernommenen Codezeilen von Claude. Anthropic betont selbst, dass Codezeilen ein unvollkommenes Produktivitätsmaß sind: Viel Code kann mehr Review erfordern oder wenig Forschungswert schaffen. Das Unternehmen sieht weiterhin große Lücken, wenn KI eigenständig entscheiden soll, welche Forschungsziele lohnen.
OpenAI berichtet ebenfalls von wachsender Agentennutzung. Mitte August kamen in seiner Forschungsorganisation rechnerisch 3,1 Agenten-Arbeitstage auf einen menschlichen Arbeitstag. Ein Agenten-Arbeitstag misst Laufzeit, nicht den Wert einer Entdeckung; zudem können mehrere Agenten gleichzeitig an derselben Aufgabe arbeiten. OpenAI bezeichnet einen Forschungsagenten für gut definierte, mehrtägige Aufgaben unter menschlicher Anleitung als erreichtes Zwischenziel. Nach eigener Darstellung setzen Menschen weiter Forschungsprioritäten, wählen tragfähige Ergebnisse aus und entscheiden über Skalierung, Pausen und Freigaben. Das weitergehende Ziel eines automatisierten Forschers nennt OpenAI für März 2028 – als Plan, nicht als eingetretenes Ergebnis.
Solche Einblicke sind wertvoll, weil öffentliche Benchmarks den Alltag großer Labore kaum abbilden. Sie sind aber Angaben von Organisationen, die diese Systeme selbst entwickeln. Ihre Zahlen beschreiben außerdem verschiedene Dinge: Codeanteil, Laufzeit, subjektive Produktivität und Forschungsleistung lassen sich nicht ineinander umrechnen. Wer daraus eine einzige Beschleunigungszahl für die Entwicklung neuer Modelle macht, überspringt die schwierige Frage, welche Experimente tatsächlich zu robust besseren Modellen führten.
Was die September-Daten tragen
AIDE², 22. September 2026
Sieben Verbesserungen in acht Tagen; Übertrag auf vier zurückgehaltene Benchmarks.
- Aussagekraft
- Mehrere Versionen und Tests außerhalb der Auswahlaufgaben.
- Grenze
- Forschungsagent mit vorhandenem Grundmodell; keine Entwicklung stärkerer Grundmodelle.
OpenAI und Anthropic, September 2026
Beide berichten umfangreiche KI-Arbeit in eigener Entwicklung; Menschen setzen weiterhin Ziele und entscheiden über Modelle.
- Aussagekraft
- Direkte Einblicke in Forschungsabläufe.
- Grenze
- Unternehmensangaben und unterschiedliche Metriken; Agentenstunden oder Codezeilen sind kein Maß für Modellverbesserung.
METR, 22. September 2026
Der geprüfte Anthropic-Agent beschleunigt Teilaufgaben, automatisiert KI-Forschung aber wahrscheinlich nicht vollständig.
- Aussagekraft
- Externe Tests schwieriger Aufgaben.
- Grenze
- Vorläufige Prüfung mit begrenztem Zugang; kein Urteil über alle Modelle.
Die unabhängige Gegenprobe bremst die große Schlussfolgerung
Die Forschungsorganisation METR prüfte im September einen Anthropic-Agenten auf schwierigen und länger dauernden Aufgaben mit Bezug zur KI-Forschung. Ihr vorläufiges Urteil: Das System dürfte Forschende spürbar unterstützen und einige Teilaufgaben automatisieren, aber wahrscheinlich nicht die gesamte KI-Forschung übernehmen. Auf anspruchsvollen offenen Aufgaben sah METR weiter Schwächen beim vorausschauenden Urteil und bei der Wahl guter Forschungsschritte. Der Test umfasste nur einen begrenzten Zeitraum und einen Teil der möglichen Aufgaben. Er widerlegt deshalb keine künftige stärkere Schleife; er begrenzt die Behauptung, sie sei bereits vollendet.
Auch die wirtschaftliche Rückkopplung ist unklar. Ein schnellerer Agent muss zu besseren Forschungsentscheidungen, Trainingsergebnissen und wiederum besseren Agenten führen, damit sich Fortschritt selbst trägt. Rechenkapazität, Daten, Experimentierzeit und Kontrolle können dazwischen Engpässe bilden. METR modelliert solche Rückkopplungen und hält sowohl stärkere Beschleunigung als auch ein Abflachen für möglich. Das ist eine Analyse von Bedingungen, keine Vorhersage eines konkreten Datums.
Gerade deshalb sind Sicherheitsfragen praktisch und gegenwärtig. Ein Agent, der seinen eigenen Code verändert, braucht getrennte Prüfaufgaben, Protokolle seiner Änderungen und Grenzen für Zugriffe auf Trainingssysteme. Sonst kann eine Veränderung auf der sichtbaren Kennzahl gut aussehen und außerhalb des Tests schaden. Wissenschaftswelle hat bei KI-Agenten mit begrenzten Vollmachten bereits erklärt, warum Rechte und Freigaben Teil der Sicherheitsarchitektur sind. Bei einem sich verändernden Forschungsagenten müssen diese Kontrollen nach jeder neuen Version erneut gelten.
Woran eine stärkere Meldung zu messen wäre
Wenn: Ein System verbessert nur Werkzeuge oder Prompts.
Dann: Frage nach verborgenen Tests, Transfer und mehreren echten Iterationen.
Ein besserer Benchmarkwert kann eine enge Testanpassung sein.
Wenn: Ein Labor meldet mehr Code oder Agentenlaufzeit.
Dann: Frage nach validierter Forschungswirkung, menschlichen Eingriffen und unabhängiger Prüfung.
Aktivität ist nicht gleich Fortschritt des Grundmodells.
Wenn: Eine Intelligenzexplosion wird behauptet.
Dann: Verlange Belege für wiederholte, eigenständige Entwicklung stärkerer Nachfolgemodelle und für deren Tempo.
Ein begrenzter Agentenversuch belegt keinen ungebremsten Verlauf.
Was sich seit dem letzten Überblick geändert hat
Unser Beitrag vom 15. Juni über KI-gestützte KI-Entwicklung ordnete rekursive Selbstverbesserung noch vor allem als mögliches, öffentlich nicht robust belegtes Zukunftsszenario ein. Die neuen September-Daten verschieben diese Aussage an einer klar benennbaren Stelle: Mehrere aufeinanderfolgende Verbesserungen eines Forschungsagenten sind nun in einem konkreten Versuch dokumentiert. Zugleich geben Laborberichte einen tieferen Einblick in die laufende KI-Arbeit, und eine externe Prüfung setzt der Deutung voller Autonomie eine Grenze.
Die Antwort auf die Eingangsfrage lautet daher: Ja, KI-Systeme können in begrenzten, überprüften Schleifen Teile ihrer eigenen Agentensoftware verbessern. Der öffentlich belegte Stand reicht nicht für die Aussage, eine KI entwickle bereits selbständig und immer schneller ihre eigenen Nachfolgemodelle. Der nächste wichtige Nachweis wäre nicht bloß eine achte Agentenversion, sondern eine unabhängig geprüfte Kette: bessere Forschungsentscheidungen, ein nachweislich besseres Grundmodell, dessen messbarer Beitrag zur nächsten Verbesserung und ein über mehrere Runden tragfähiger Sicherheits- und Prüfprozess.




Schreibe einen Kommentar