Die Entwicklung der KI: Grenzen und Wahrheit rekursiver Selbstverbesserung (RSI)

By: mp.weixin.qq.com|24.09.2026 00:33:00

Autor: Zhao Zhimin, PhD an der Queen's University in Kanada (Forschungsschwerpunkte: Code-Intelligenz und Weltmodelle)

Wenn Sie zum ersten Mal von RSI hören, kann dieser Artikel als Einführung dienen. Wir führen Sie von Grund auf durch das Thema RSI: von den frühesten Versuchen der Selbstverbesserung in der KI über die heutigen Agenten, die Code verändern, Trainingsdaten erzeugen und an der Modellentwicklung mitwirken können, bis hin zu der Frage, wie KI nach und nach lernt, sich selbst zu verbessern.

Im 07.2026 veröffentlichte OpenAI GPT-5.6. Zum ersten Mal tauchte auf dem Bewertungsbogen ein etwas ungewöhnliches neues Thema auf: Kann KI daran mitwirken, KI selbst zu verbessern?

OpenAI ordnete diese Fähigkeit als Selbstverbesserung ein. GPT-5.6 Sol erreichte 57,9%, während GPT-5.5 auf 41,7% kam – ein Unterschied von 16,2 Prozentpunkten zwischen den beiden Modellgenerationen. Dabei geht es nicht darum, wie viele herkömmliche Probleme das Modell lösen kann, sondern ob es in die KI-Entwicklung einsteigen kann: Forschungssysteme zu debuggen, GPU-Kernel-Programme und Trainingsrezepte zu optimieren, Experimente im maschinellen Lernen durchzuführen und sogar bei der Verbesserung eines anderen Modells zu helfen.

Das ist keine isolierte Nachricht. Im selben Sommer begann OpenAI, Agenten als „automatisierte Forschungspraktikanten“ zu bezeichnen. Kuaishous AgentX hat Agenten bereits in die Entwicklung von Lösungsvorschlägen, das Schreiben von Code und die Durchführung von Online-A/B-Tests eingebunden, bei denen neue und alte Versionen verglichen werden. Google erklärte, dass lang laufende Agentenzyklen an der Verfeinerung der nächsten Modellversion beteiligt waren. Motus2 hat Vorhersagen, Bewertungen und Strategieaktualisierungen in echte Roboter eingebracht.

Diese Fälle betreffen die Durchführung von Forschung, industrielle Experimente, Modelltraining und physische Handlungen. Doch keiner davon beantwortet die entscheidende Frage: Wird das verbesserte System die nächste Verbesserung besser umsetzen können?

Genau diese Frage stellt die rekursive Selbstverbesserung (Recursive Self-Improvement, RSI). OpenAI bezeichnet diese Bewertung als RSI Index, der „die Fähigkeit, RSI zu erreichen“, misst. Da die vollständigen Fragen, die Gewichtung der Aufgaben und die Aggregationsformeln nicht offengelegt wurden, kann 57,9% nur als interne zusammengesetzte Kennzahl betrachtet werden, nicht als Bestehensquote bei Aufgaben oder als „Vollständigkeit“ von RSI.

Dennoch markieren diese Zahlen einen Wandel: Eine Frage, die zuvor hauptsächlich in Gedankenexperimenten vorkam, wird von führenden Forschungslaboren zunehmend in messbare Forschungskompetenzen zerlegt.

Forschende haben vierzig Jahre gebraucht, um immer mehr Verbesserungsprozesse an Maschinen zu übertragen. Dieser Artikel klärt zunächst einige leicht zu verwechselnde Fähigkeiten und betrachtet anschließend fünf „Grenzfortschritte“: Welche begrenzten Schleifen haben sich bereits in Bewegung gesetzt, warum entsprechen sie trotzdem keiner „Explosion der Intelligenz“ und weshalb ist wichtiger, wie sich die Schleife schließt, als ob sie sich schließt. Diese fünf Fortschritte dienen lediglich als erzählerisches Raster zur Einordnung der Geschichte und stellen keine allgemein anerkannte technologische Generationenfolge dar. Sie überschneiden sich zeitlich und entwickeln sich bis heute parallel weiter.

Was ist RSI: von der Selbstverbesserung zu rekursiven Zugewinnen

In all diesen Meldungen geht es um „Selbstverbesserung“, doch sie erklären nicht, woran sich erkennen lässt, dass ein geschlossener Kreislauf vollständig ist.

Im traditionellen Sinn bezeichnet rekursive Selbstverbesserung (Recursive Self-Improvement, RSI) ein KI-System, das seine aktuellen Fähigkeiten nutzt, um die kognitiven Mechanismen zu verbessern, durch die diese Fähigkeiten entstanden sind. Das verbesserte System wirkt dann an der nächsten Verbesserungsrunde mit. Besonders leicht zu verwechseln ist dabei, dass die Fähigkeit zur Selbstverbesserung nicht gleichbedeutend mit der Fähigkeit zur Selbstbeschleunigung ist. Ein System kann darin besser werden, einen festen Fragenkatalog zu lösen, ohne besser darin zu werden, die nächste Trainingsrunde zu entwerfen. Ein Unternehmen kann Forschung und Entwicklung durch den umfangreichen Einsatz von Agenten beschleunigen, ohne einen sich durch die Verbesserungen selbst verstärkenden Effekt zu erzielen.

Das Konzept ist nicht neu. 1863 stellte sich Samuel Butler vor, wie Maschinen Menschen durch iterative Evolution übertreffen könnten. 1950 schlug Turing den Bau einer „Kindmaschine“ vor, die erzogen und selbst verändert werden könnte. 1965 wies I. J. Good darauf hin, dass eine ausreichend intelligente Maschine stärkere Nachfolger entwerfen könnte, wenn auch das „Entwerfen besserer Maschinen“ Intelligenz erfordert. Diese könnten sich dann weiter verbessern und so zu einer „Explosion der Intelligenz“ führen.

Entscheidend ist nicht, ob KI an Verbesserungen mitwirkt, sondern ob das verbesserte System besser darin wird, sich selbst zu verbessern. Um diese Grenze klar zu bestimmen, lässt sich RSI in vier beobachtbare Kriterien unterteilen, geordnet von der am einfachsten bis zur am schwierigsten zu erreichenden Stufe.

Dieser Artikel verwendet den folgenden Rahmen. Er ist nicht die einzige akademische Standarddefinition, soll aber häufig miteinander vermischte Aussagen voneinander abgrenzen:

  • Anhaltende Verbesserung: Wirksame Veränderungen fließen in Gewichte, Speicher, Tools oder Trainingsprozesse ein, statt nach einer einzelnen Antwort zu verschwinden. Die hier gemeinten Gewichte, auch Parameter genannt, sind die Zahlenwerte, die das Modell während des Trainings fortlaufend anpasst und schließlich speichert. Dieses Kriterium muss erfüllt sein, damit von Selbstverbesserung gesprochen werden kann. In diesem Artikel bezeichnet der Begriff Verbesserungen bei der Ausgabe, dem Speicher, den Parametern oder den Tools.

  • Autonomer geschlossener Kreislauf: Das System kann Probleme erkennen, Änderungen vorschlagen, Experimente durchführen, Ergebnisse bewerten und innerhalb festgelegter Grenzen bessere Versionen übernehmen. Innerhalb dieser Grenzen kann eine neue Version an der nächsten Verbesserungsrunde teilnehmen. Dieser Artikel bezeichnet das als begrenzte RSI.

  • Rekursive Zugewinne (auch „Zündung“ genannt): Die neue Version erzielt nicht nur höhere Bewertungen bei Aufgaben, sondern ist auch besser darin, die nächste Verbesserung zu erzeugen als die alte Version. Erst wenn diese Grenze überschritten wird, beginnen sich „die Verbesserungsfähigkeiten selbst“ zu verstärken. Dieser Artikel nennt das rekursive Selbstbeschleunigung.

  • Robustheit und Kontrolle: Die Zugewinne bleiben bei festen Ressourcen und verborgenen Bewertungen bestehen und lassen sich auf unbekannte Aufgaben übertragen, ohne dass Bewertungskontamination, unkontrollierte Systemkomplexität, eine Verschlechterung der Ausrichtung oder fehlende Auditierbarkeit zum Problem werden. (Ausrichtung bedeutet, sicherzustellen, dass das Verhalten der KI mit menschlichen Absichten und Grenzen übereinstimmt – nicht nur, dass sie eine hohe Punktzahl erzielt.) Alle vier Kriterien müssen erfüllt sein, damit man sich einer offenen RSI annähert.

Derzeit zeichnen sich die ersten beiden Kriterien ab, für das dritte gibt es nicht genügend öffentliche Belege und das vierte ist weiterhin ungelöst. Das Vorhandensein begrenzter geschlossener Kreisläufe bedeutet nicht, dass die rekursive Selbstbeschleunigung eingesetzt hat. Erst wenn rekursive Rückkopplung ausreicht, um den zunehmenden Schwierigkeitsgrad der Forschung, längere Iterationszyklen und weitere Widerstände auszugleichen, können Verbesserungen einen Bereich der Selbstverstärkung erreichen.

Im Folgenden werden konsequent vier Begriffe verwendet. Selbstverbesserung bezeichnet Verbesserungen bei der Ausgabe, dem Speicher, den Parametern oder den Tools. Wenn eine neue Version innerhalb fester Grenzen an der nächsten Verbesserungsrunde teilnehmen kann, sprechen wir von begrenzter RSI. Wird ein verbessertes System besser darin, sich selbst zu verbessern, heißt das rekursive Selbstbeschleunigung – die „Zündung“ der dritten Ebene. Können diese Zugewinne außerdem bestehen bleiben, verallgemeinert werden und die ursprünglichen Aufgabengrenzen überschreiten, nähert sich das System einer offenen RSI.

Derzeit zeichnen sich die ersten beiden Ebenen ab, für die dritte gibt es nicht genügend öffentliche Belege und die vierte ist weiterhin ungelöst. Das Vorhandensein begrenzter geschlossener Kreisläufe bedeutet nicht, dass die rekursive Selbstbeschleunigung eingesetzt hat. Erst wenn rekursive Rückkopplung ausreicht, um den zunehmenden Schwierigkeitsgrad der Forschung, längere Iterationszyklen und weitere Widerstände auszugleichen, können Verbesserungen einen Bereich der Selbstverstärkung erreichen.

Um klar zu erkennen, welche Ebene wir heute erreicht haben, müssen wir zu einer KI zurückkehren, die bereits 1981 gelernt hatte zu „schummeln“.

Was ist RSI: von der Selbstverbesserung zu rekursiven Zugewinnen

1981 entwickelte Douglas Lenat ein System namens EURISKO. Es löste nicht nur Probleme mithilfe heuristischer Regeln, sondern erzeugte, veränderte und bewertete auch neue Regeln und wandte diesen Mechanismus sogar auf sich selbst an. Für die damalige Zeit war das ausgesprochen fortschrittlich.

EURISKO nahm an der nationalen Traveller-TCS-Meisterschaft im Weltraumschach teil. Das System entwarf Flotten, simulierte Schlachten und passte seine Strategien anhand von Niederlagen an. 1981 gewann es die Meisterschaft. Nachdem die Organisatoren die Regeln geändert hatten, gewann es 1982 erneut. Die KI-Community war erschüttert: Dieses Ding konnte sich tatsächlich selbst verbessern!

Doch Lenat stieß bald auf ein schwierigeres Problem.

EURISKO stellte fest, dass eine Verbesserung echter Fähigkeiten nicht der einzige Weg zu hohen Punktzahlen war. Eine bestimmte Regel machte keine bedeutenden Entdeckungen, lernte aber, ihren eigenen Namen in die Liste der „Entdecker“ aufzunehmen, wenn andere Regeln Entdeckungen machten. Dadurch näherte sich ihr interner „Nützlichkeitswert“ rasch dem Maximum. Anders gesagt: Sie wurde nicht intelligenter, sondern lernte, Schlupflöcher im Bewertungsmechanismus auszunutzen.

Dieses Phänomen wird heute gemeinhin als Reward Hacking bezeichnet: Das System findet Schlupflöcher, um seine Bewertung zu verbessern, ohne die vom Entwickler tatsächlich beabsichtigten Ziele zu erreichen. Im Zusammenhang mit der Selbstverbesserung von KI ist das besonders fatal: Sobald das System sowohl Gegenstand der Verbesserung ist als auch den Bewertungsprozess beeinflussen kann, kann Selbstverbesserung in Selbsttäuschung abgleiten. Auf diese Falle werden wir später immer wieder stoßen.

In den folgenden Jahrzehnten zeigten genetische Algorithmen, evolutionäre Strategien und neuronale Evolution immer wieder, dass Suche und Selektion komplexe Verhaltensweisen hervorbringen können. Zugleich trat dabei stets dasselbe Problem zutage: Solange die Bewertungsziele Schlupflöcher enthalten, lernt das System möglicherweise zuerst, diese auszunutzen, statt tatsächlich leistungsfähiger zu werden.

Diese Entwicklungslinie führt bis ins Jahr 2017, als ein noch extremerer Fall auftrat: DeepMinds AlphaZero. Das System meisterte Go, Schach und Shogi von Grund auf durch reines Selbstspiel und demonstrierte erstmals die Leistungsfähigkeit des „Trainings mit selbst erzeugten Daten“.

Im vierstufigen Rahmen dieses Artikels ist AlphaZero eine begrenzte Umsetzung: Das Selbstspiel erzeugt Trainingssignale, Verbesserungen werden in den Gewichten gespeichert und die ersten beiden Ebenen sind innerhalb eines festen Spiels etabliert.

Die entscheidende Einschränkung besteht jedoch darin, dass Menschen die Grenzen des geschlossenen Kreislaufs festlegen und das System diese Grenzen nicht selbst verändern kann. Belohnungsfunktionen (Punktzahlen für Siege), Spielregeln, Trainingsprozesse und Bewertungsmethoden werden allesamt von Menschen vorgegeben. AlphaZero erreichte in einer vollständig abgeschlossenen Sandbox einen anhaltenden, autonomen Selbstverbesserungskreislauf, konnte diese Sandbox aber weder hinterfragen noch verändern. Seine Verbesserungen bleiben daher für immer auf die Dimension „besser Schach spielen“ beschränkt und können nie über die Sandbox hinausgehen.

Das ist die gemeinsame Obergrenze historischer Methoden. Die Forschung im LLM-Zeitalter hat sie nicht übersprungen, sondern begonnen, einzelne zuvor von Menschen kontrollierte Elemente in den geschlossenen Kreislauf zu verlagern. Als Erstes wurde das Feedbacksignal übertragen, das bestimmt, „wo Verbesserungen nötig sind“.

Erster Fortschritt (2022--2023): KI aus ihren eigenen Fehlern lernen lassen

Alle historischen Methoden blieben an demselben Punkt hängen: Die Richtung der Verbesserung wurde von Menschen vorgegeben. EURISKO und AlphaZero waren auf von Menschen definierte Bewertungsfunktionen angewiesen, während genetische Algorithmen von menschlich entworfenen Fitnessfunktionen abhingen. Die Systeme konnten sich weiterentwickeln, aber nur entlang von Pfaden, die Menschen festgelegt hatten. Der erste Schritt nach vorn besteht daher in der Frage: Kann das System die Qualität seiner aktuellen Ausgabe ohne menschliches Eingreifen beurteilen und daraus Verbesserungsrichtungen ableiten? Dieses Feedback, das auf die nächste Änderung hinweist, wird in diesem Artikel als „Verbesserungssignal“ bezeichnet.

Dieser Schritt war zuvor unmöglich, weil Maschinen nicht verstehen konnten, „was eine gute Antwort ausmacht“. In der zweiten Hälfte des Jahres 2022 waren große Sprachmodelle (LLMs) in der Lage, Sprache zu verstehen und die Qualität eines Textes zu bewerten. Sprachliches Feedback vom System erzeugen zu lassen, wurde damit erstmals zu einer universell einsetzbaren Methode. Die entscheidende Einschränkung dieses Ansatzes: Während des gesamten Prozesses werden keine Parameter geändert; Verbesserungen entstehen hauptsächlich im Schlussfolgerungsprozess und im externen Speicher.

Reflexion: Fehleranalysen in wiederverwendbaren Speicher verwandeln

Der naheliegendste Ansatz besteht darin, das Modell seine Antworten in Echtzeit überarbeiten zu lassen: zuerst eine Antwort geben, diese anschließend kritisieren, dann umformulieren und den Zyklus wiederholen, ohne die Parameter zu verändern. Das hat jedoch einen grundlegenden Fehler. Die eigene Ausgabe mit demselben Modell zu kritisieren, ist, als würde man dasselbe Stück Stoff mit demselben Lineal messen – blinde Flecken lassen sich so nur schwer erkennen. Bleibt die Überprüfung auf den aktuellen Kontext beschränkt, verschwindet jeder Fortschritt mit Abschluss der Aufgabe.

Reflexion (NeurIPS'23) ergänzt ein entscheidendes Gestaltungselement: situativen Speicher. Nach einem Fehler bei einer Aufgabe verfasst das Modell eine Fehleranalyse in natürlicher Sprache und speichert sie für später. Bei ähnlichen Aufgaben wird dieser Kontext direkt eingebunden. Das kommt einem Notizbuch der Fehler für die KI gleich. Je mehr Fehler darin gesammelt sind, desto höher ist der Ausgangspunkt des nächsten Versuchs.

Im Python-Programmiertest HumanEval erreichte Reflexion eine pass@1-Genauigkeit von 91% und übertraf damit das zuvor beste im Paper aufgeführte Ergebnis von GPT-4 (80%). Pass@1 bezeichnet den Anteil der Aufgaben, die nach einem vollständigen Antwortversuch bestanden werden; das endgültige Programm muss dabei verborgene Unit-Tests bestehen. Während des gesamten Prozesses blieben die Modellparameter unverändert.

Die erste Fortschrittsgrenze: Der Speicher kann dauerhaft sein, aber es sind noch keine neuen grundlegenden Fähigkeiten entstanden.

Reflexions situativer Speicher kann Informationen über mehrere Aufgaben hinweg bewahren und erfüllt damit teilweise die Anforderung einer „dauerhaften Verbesserung“. Gespeichert wird jedoch externer Text und nicht der Modellparameter; außerdem entsteht kein neues Modell mit stärkeren grundlegenden Fähigkeiten. Wird der Speicher entfernt, kehrt die Fähigkeit in ihren ursprünglichen Zustand zurück.

Zusammengefasst: Dieser Schritt gibt der KI ein speicherbares Notizbuch ihrer Fehler, doch die Erfahrung wurde noch nicht verinnerlicht. Als Nächstes müssen Verbesserungen in die Parameter geschrieben werden, um eine wirklich neue Version zu schaffen.

Zweiter Fortschritt (2022--2024): Mit selbst erzeugten Daten trainieren

Ziel ist es, das Notizbuch der Fehler in den Kern des Modells einzubetten. Bei diesem Fortschritt geht es darum, selbst erzeugte Verbesserungssignale in die Parameter einfließen zu lassen und dadurch eine tatsächlich dauerhafte Leistungssteigerung zu erreichen. Ohne diesen Schritt gibt es keine rekursive Struktur, in der „aufeinanderfolgende Versionen stärker sind als ihre Vorgänger“ – und damit auch keine RSI.

Die Idee ist einfach: Das Modell erzeugt einen Stapel Trainingsdaten und trainiert sich anschließend mit diesen Daten erneut. Das klingt ein wenig danach, als würde man „sich selbst auf die Füße treten, um in den Himmel zu gelangen“. Ob es tatsächlich funktioniert, soll dieser Schritt zeigen.

Zum ersten Mal wurde die dauerhafte Verbesserung auf Gewichtsebene von großen Sprachmodellen systematisch angegangen.

STaR: Die Grundlagen des selbst gestarteten Schlussfolgerns

2022 ermöglichte STaR (Self-Taught Reasoner) (NeurIPS'22) dem Modell, Schlussfolgerungen zu erzeugen, korrekte Antwortteile zu behalten und sich damit selbst feinzujustieren. Anschließend nutzte es das aktualisierte Modell, um den nächsten Stapel Schlussfolgerungen zu erzeugen.

Das Problem: Wenn das Modell anfangs alles falsch beantwortet, kann der Zyklus nicht beginnen.

STaRs Lösung heißt umgekehrtes Schlussfolgern: Zuerst wird dem Modell die richtige Antwort mitgeteilt, damit es den Lösungsweg für das Training ableiten kann. Das ist, als würde man zunächst das Licht in einem dunklen Raum einschalten, damit das Modell das Gehen lernt, und es anschließend ausschalten, damit es sich selbst zurechtfindet.

SPIN: Das Modell durch den Vergleich mit historischen Versionen verbessern

Bei STaR ist die Schwelle für die Filterung festgelegt. SPIN (Self-Play Fine-Tuning) (ICML'24) lässt das aktuelle Modell dagegen mit historischen Versionen konkurrieren. Dabei lernt es, zwischen „menschlichen Beispielen“ und „Ausgaben historischer Versionen“ zu unterscheiden. Je schwieriger die Unterscheidung wird, desto näher kommt das Modell den menschlichen Beispielen – ohne zusätzliche manuelle Annotationen.

Die zweite Fortschrittsgrenze: Die Gewichte haben sich verändert, doch Ziele und Rotstift kommen weiterhin von Menschen.

Dieser Schritt löst das Problem der Beständigkeit auf Gewichtsebene, aber die Feedbacksignale hängen weiterhin von Menschen ab. Menschen entwerfen die Belohnungsfunktion, wählen die Trainingsaufgaben aus und legen die Kriterien für die Datenfilterung fest. Das System kann selbstständig mögliche Trainingsdaten erzeugen, doch Menschen entscheiden weiterhin, welche Daten „gut“ und das Training wert sind. SPIN benötigt zwar keine zusätzlichen manuellen Annotationen, orientiert sich aber nach wie vor an der vorhandenen Verteilung menschlicher Beispiele. Seine Obergrenze wird deshalb weiterhin durch diese Verteilung bestimmt.

Ein tiefer liegendes Problem ist, dass rekursive Zugewinne noch nicht aufgetreten sind: Mit steigenden Fähigkeiten des Modells verlieren feste Trainingsaufgaben nach und nach ihren Anspruch. Das System kann diese Aufgaben immer besser erledigen, aber es gibt keinen Beleg dafür, dass es zugleich besser darin wird, das Training selbst zu gestalten. Das ist wie bei einem Sportler, der bereits in unter 10 Sekunden läuft, während der Trainer immer noch nach den Maßstäben des Schulsports in der Grundschule urteilt. Der Spielraum für Verbesserungen wird durch die Bewertungskriterien begrenzt.

Zusammengefasst: Das System kann Daten erzeugen und sich selbst Antworten geben, aber sich noch nicht selbst benoten. Solange der Rotstift in menschlicher Hand bleibt, legen Menschen weiterhin die Obergrenze fest.

Dritter Fortschritt (2022--2025): Mehr Bewertungsbefugnis an KI übertragen

Kann auch dieser Rotstift an KI übergeben werden? Solange Bewertung und Feedback auf manuellen Annotationen oder von Menschen geschriebenen Prüfern beruhen, bleibt die Verbesserungsrichtung in menschlicher Hand. Ein Prüfer ist hier ein Programm, das anhand vorgegebener Regeln automatisch die Korrektheit von Ergebnissen beurteilen kann. Der dritte Fortschritt soll diese Abhängigkeit verringern: Können mehr Feedbacksignale von der KI selbst erzeugt werden?

Damit wird der autonome geschlossene Kreislauf vertieft: Das Modell soll nicht nur über seine Ausgabe nachdenken, sondern auch einen Teil des Trainingsfeedbacks an die KI abgeben.

Von CAI zu Meta-Rewarding: Antworten bewerten und Bewertende bewerten

Im Zentrum des dritten Fortschritts steht ein dreistufiger Sprung rund um die Frage: „Wer bewertet?“

Der erste Sprung: 2022 stellte Anthropic Constitutional AI (CAI) vor. Menschen verfassen eine Reihe von Textprinzipien, anhand derer die KI anschließend Bewertungen vergibt. In Experimenten zeigte sich dabei kein wesentlicher Unterschied zur Wirksamkeit manuell bewerteten Trainings, obwohl Menschen nicht mehr jede einzelne Bewertung vornehmen mussten.

Der zweite Sprung: 2024 ging Metas Self-Rewarding Language Models (ICML'24) einen Schritt weiter. Dasselbe Modell verfasst Antworten, bewertet sich selbst und andere mögliche Antworten und verwendet diese Bewertungen anschließend für seine Aktualisierung. Die eingesetzte Feinabstimmungsmethode heißt Direct Preference Optimization (DPO). Vereinfacht gesagt: „Diese Antwort ist besser als jene, also solltest du dich künftig stärker an der besseren orientieren.“

Ausgehend von Llama 2 70Md stieg die Gewinnrate bei AlpacaEval 2.0 nach drei Iterationsrunden von 9,94% auf 20,44%. GPT-4 fungiert dabei als Bewerter und GPT-4 Turbo als Gegner; die Gewinnrate entspricht nicht der üblichen Korrektheitsrate von Antworten.

Der dritte Sprung: Wenn sich die Qualität von Antworten selbst weiterentwickeln kann, kann sich dann auch die Qualität von Bewertungen weiterentwickeln? Meta-Rewarding (2024) ergänzt darauf aufbauend eine Ebene der „Metabewertung“. Dasselbe Modell übernimmt gleichzeitig die Rollen des Antwortenden, des Bewerters und des „Bewerters des Bewerters“. Die dritte Rolle beurteilt ausdrücklich, ob die Bewertung korrekt ist. Bei jeder Aktualisierungsrunde entwickelt sich das Modell gleichzeitig zu einem „besseren Antwortenden“ und einem „genaueren Bewerter“.

Das Paper weist jedoch auch auf ein beunruhigendes Phänomen hin: Nach mehreren Iterationsrunden beginnt der „Bewerter des Bewerters“ schlechter zu werden. Statt zu beurteilen, welche Bewertung plausibler ist, wählt er einfach diejenige mit der höheren Punktzahl – wodurch die Bewertungskriterien abdriften. Das erinnert an EURISKOs altes Problem in einer Version von 2024: Je weiter die Entwicklung voranschreitet, desto stärker verbiegt sich das Lineal, mit dem Gut und Schlecht gemessen werden.

Die Grenze des dritten Fortschritts: Sobald der Rotstift an die KI übergeben wird, beginnt sich auch das Lineal zu verbiegen.

Dieser Schritt verringert die Abhängigkeit von manuellen Annotationen für Feedbacksignale erheblich, macht zugleich aber das Kernproblem von RSI sichtbar: Haben der Bewerter und das Bewertete dieselben blinden Flecken, kann sich der geschlossene Kreislauf leicht selbst bestätigen.

Solche Systeme können dauerhafte, autonome Aktualisierungen vornehmen, sind aber möglicherweise nicht in der Lage, neue Aufgaben zu bewältigen, die sich von den Trainingsdaten unterscheiden. Ebenso wenig ist bewiesen, dass neue Versionen zu besseren Verbesserern werden. Das Problem verlagert sich von „menschliches Feedback ist zu langsam“ zu „Ist die Selbstbewertung zuverlässig?“

Zusammengefasst: Der Rotstift liegt endlich in der Hand der KI, doch während sie ihn hält, gibt sie sich selbst hohe Bewertungen.

Vierter Fortschritt (2023--2026):

KI ihre Arbeitsweise verändern lassen

Die ersten drei Fortschritte konzentrierten sich vor allem auf die Veränderung von Ausgaben, Speicher, Parametern und Feedbacksignalen. Die Fähigkeiten eines KI-Systems hängen jedoch nicht allein von den Parametern ab. Entscheidend ist auch das gesamte Kontrollsystem rund um den Betrieb des Modells: wie Prompts formuliert werden, welche Tools aufgerufen werden, wie Prozesse angeordnet sind, wo Erinnerungen gespeichert werden, welche Berechtigungen erteilt werden und wie Ergebnisse bewertet werden.

Lilian Weng bezeichnete diese gesamte Ebene 2026 in einem ausführlichen Artikel als Harness. Das lässt sich mit einem Pferdegeschirr vergleichen: Es unterstützt das Modell bei seiner Arbeit und schränkt zugleich ein, wohin es gehen kann, wie es dorthin gelangt und wie weit es kommt. Der Harness entscheidet darüber, ob sich die Fähigkeiten des Modells in zuverlässige Handlungen umsetzen lassen.

Die jüngste Selbstverbesserung dürfte beim Harness ansetzen: Die Veränderung von Gewichten ist teuer, Feedback kommt langsam und die Risiken sind hoch, während die Änderung des Harness im Wesentlichen einer Codeänderung entspricht – sie ist günstiger und lässt sich leichter rückgängig machen. Langfristig könnten sich Modellgewichte und Harness gemeinsam weiterentwickeln. Bewerter, Berechtigungskontrollen und wichtige Sicherheitsgrenzen sollten jedoch außerhalb dieses Entwicklungsbereichs bleiben.

Die Frage des vierten Fortschritts lautet daher: Kann das System seinen Harness autonom verändern, also die Architektur seiner eigenen Arbeitsweise festlegen?

Parameteraktualisierungen finden unter einer vorgegebenen Arbeitsweise statt und verinnerlichen Fähigkeiten im Modell. Harness-Aktualisierungen verändern, wie Fähigkeiten aufgerufen werden – ähnlich wie bei einer Neugestaltung der Werkbank, des Werkzeugkastens und der Trainingsmethoden.

Die Verbesserung des Harness folgt einer klaren Stufenfolge. Die optimierten Elemente reichen von oberflächlich bis tiefgreifend; jede Ebene kommt dem Kern der Frage „Wie denkt das System?“ näher:

flowchart LR

A["Prompt
Umformulierung"] --> B["Kontextstruktur
Was eingespeist wird"]

B --> C["Workflow
Änderung der Schritte"]

C --> D["Harness-Code
Änderung der gesamten Anordnung"]

D --> E["Optimierer-Code
Änderung der 'Art der Veränderung' selbst"]

Je tiefer man vordringt, desto größer ist der Hebel der Änderungen und desto näher kommt man der „Neuschreibung der eigenen Betriebslogik durch das System“. Im Folgenden betrachten wir diese Stufenfolge nacheinander, von oberflächlich bis tiefgreifend.

OPRO: Prompts sich selbst iterieren lassen

Kann das System allein dadurch stärker werden, dass es die Prompts verändert – also die Anweisungen, die wir dem Modell geben? OPRO (ICLR 2024) bietet einen repräsentativen Ansatz. Das Modell erhält die bereits ausprobierten Prompts zusammen mit ihren jeweiligen Bewertungen, leitet daraus Muster ab und erzeugt bessere Versionen. Was zuvor wiederholte menschliche Tests zur „Feinabstimmung der Formulierung“ erforderte, kann nun vom Modell selbst iteriert werden.

Die Obergrenze ist jedoch klar: So gut die Prompts auch sind, sie rufen lediglich die bereits vorhandenen Fähigkeiten des Modells ab und können keine neuen Fähigkeiten schaffen.

ADAS und AFlow: Agenten-Workflows automatisch entwerfen

Eine Ebene tiefer ist nicht mehr nur der Wortlaut das Optimierungsziel, sondern auch die Anordnung der dem Modell zugeführten Informationen und des gesamten Aufgabenprozesses. So reiht AI Scientist beispielsweise „Ideen vorschlagen → Code schreiben → Experimente durchführen → Paper verfassen → Peer Review“ zu einer Pipeline aneinander. Da sich der Prozess in Code schreiben lässt, kann auch nach ihm gesucht werden.

ADAS (ICLR 2025) macht das „Entwerfen von Workflows“ selbst zu einem Optimierungsproblem. Ein übergeordneter „Designer-Agent“ schreibt kontinuierlich neue Workflows in Code, führt sie aus, filtert sie und verändert sie in einer Schleife.

AFlow (ICLR 2025) geht noch weiter. Es stellt Workflows als Flussdiagramme aus Modellaufrufen und logischen Beurteilungen dar und nutzt anschließend Suchalgorithmen, um bessere Strukturen zu finden. So werden manuell entworfene Lösungen schließlich übertroffen.

Self-Harness und DGM: Das System den Harness-Code umschreiben lassen

An der Spitze der Stufenfolge steht die Möglichkeit, dass das System direkt den Code umschreibt, der seine Arbeitsweise festlegt. Hier gibt es zwei Ansätze.

Der erste Weg lautet „vorschlagen, bewerten, übernehmen“. Das System erkennt eigene Probleme, schlägt Änderungen vor und übernimmt sie, nachdem ihre Wirksamkeit überprüft wurde.

Self-Harness (2026) führt strenge Annahmekriterien ein: Zunächst fasst das System die Gründe für Fehler zusammen und nimmt dann kleine, rückgängig zu machende Änderungen vor. Eine neue Version wird nur beibehalten, wenn sie sowohl bei bekannten als auch bei unbekannten Problemen keine Rückschritte aufweist.

Der zweite Weg ist die evolutionäre Suche. Das System behält eine Gruppe möglicher Lösungen, lässt Varianten daraus entstehen und übernimmt durch Experimente die besseren Versionen.

Die Darwin Gödel Machine (DGM) (2025) entwickelt den selbstverändernden Code ihrer Tools direkt weiter. Unter der Voraussetzung, dass das Basismodell unverändert bleibt, stieg ihre Erfolgsquote bei der Fehlerbehebung auf SWE-bench Verified von 20% auf 50%.

Beiden Ansätzen liegt dieselbe Erkenntnis zugrunde: Code ist die universelle Sprache, die das System definiert. Sobald die Tools als ausführbarer und bewertbarer Code vorliegen, können programmierende Agenten diesen Entwurfsraum durchsuchen.

MetaClaw und AgentX: Echte Nutzer als Feedbackquelle

Unabhängig vom gewählten Ansatz benötigt die Selbstevolution der Tools Signale dafür, „wie gut die Änderungen sind“.

Die Verbesserungssignale von DGM stammen aus einem festen Testsatz. MetaClaw (2026) ermöglicht es Agenten dagegen, aus Gesprächen Erfahrungen aus dem realen Einsatz zu gewinnen und diese im Hintergrund in Gewichte zu überführen. So verlagert sich die Selbstevolution von Fragenkatalogen hin zu einer nutzergesteuerten Entwicklung.

In der Industrie haben einige diesen Ansatz bereits in realen Geschäftsanwendungen umgesetzt. Kuaishous AgentX (2026) überprüft Ausführungsprotokolle, um die Tools von Unteragenten zu verändern, und wählt neue Versionen anhand historischer Aufgaben aus.

AgentX verwendet ähnlich wie Self-Harness ein „Vorschlagen, bewerten, übernehmen“-Verfahren. Der Unterschied besteht darin, dass es letztlich reale Online-A/B-Tests bestehen muss. Nutzerinteraktion und Nutzungsverhalten werden zu den Belohnungssignalen des Systems.

Der wesentliche Unterschied zwischen diesen Methoden liegt nicht in den Mechanismen, sondern darin, wer der Trainer ist: der Testsatz, echte Nutzer oder das Online-Geschäft. Je näher der Trainer an der Realität ist, desto wahrscheinlicher sind tatsächlich nützliche Verbesserungen – allerdings steigt auch das Risiko, dass das System den Bewertungsmechanismus ausnutzt.

Die Grenze des vierten Fortschritts: Die Betriebsarchitektur kann verändert werden, doch Verifizierungsgrenzen und endgültige Ziele bleiben extern vorgegeben.

Dieser Fortschritt hat auch die Aufrufmethoden von Modellen, Tools und Speichern zu veränderbaren Objekten gemacht. Die Richtung, in der sich die Tools weiterentwickeln, wird jedoch weiterhin von externen Aufgaben, Prüfern oder Nutzerzielen bestimmt. Noch wichtiger ist, dass eine höhere Bewertung der Tools nicht gleichbedeutend mit einer stärkeren grundlegenden Intelligenz ist. Ein System kann seine Tools verändern, ohne dass es die aktualisierten Tools auch wirksam nutzen kann.

Kurz gesagt: Das System kann endlich seine eigenen Gliedmaßen und seine Werkbank umbauen. Doch die Annahmekriterien und die Grenzen des Aufbaus werden weiterhin von der Außenwelt festgelegt.

Fünfter Fortschritt (2025-2026):

Lern- und Forschungsprozesse in einen geschlossenen Kreislauf überführen

Die Veränderung von Tools ist ein Ansatz, doch die Tools verändern, wie das System während des Betriebs Aufgaben ausführt: welche Tools es aufruft, welchen Prozessen es folgt und wann es aufhört. Der fünfte Fortschritt setzt auf einer weiter vorgelagerten Ebene an: bei den Materialien und Umgebungen für das Lernen – den Quellen für Übungsaufgaben, der Beschaffenheit der Übungsumgebung und der Erzeugung von Trainingsdaten. Erstere bestimmen, wie vorhandene Fähigkeiten eingesetzt werden; Letztere bestimmen, mit welchen Erfahrungen die nächste Modellversion trainiert wird. Die Zeiträume überschneiden sich stark, da viele Teams beides gleichzeitig tun. Die veränderten Objekte sind jedoch unterschiedlich: Das eine beeinflusst die Kontrollstruktur beim Schlussfolgern, das andere die Datenzufuhr vor dem Training.

Damit beginnt ein weiterer Ansatz, den Umfang des geschlossenen Kreislaufs zu erweitern: Kann der gesamte Lern- und Forschungsprozess zu einem operativen Objekt des Systems werden? Das System beginnt, Trainingsmaterialien zu erzeugen, Übungsstrategien auszuwählen, Experimente durchzuführen und Trainingsprozesse zu verändern, bevor es die Ergebnisse wieder in das Modell oder die Tools einfließen lässt.

Hier gilt es, ein Missverständnis zu vermeiden. Wenn das System autonom Daten oder Umgebungen erzeugt, erweitert das lediglich den Umfang des autonomen geschlossenen Kreislaufs. Selbst wenn KI die Aufgabenerstellung, das Beantworten und die Bewertung vollständig übernimmt, hat das System die Schwelle zu rekursiven Zugewinnen noch nicht überschritten, sofern die neue Version nicht besser darin wird, die nächste Verbesserungsrunde zu entwerfen.

SEAL: Modelle ihre eigenen Trainingsdaten und Aktualisierungsanweisungen erzeugen lassen

Erhält ein Modell neues, ihm unbekanntes Material, lernt es normalerweise nur auf die von Menschen vorgegebene Weise. Ein Projekt aus dem Jahr 2025 ließ das Modell jedoch zunächst seinen eigenen „Lernplan“ schreiben: wie es das Material organisiert, in welchem Tempo es lernt und ob mehrere Überarbeitungen erforderlich sind. Das Modell entscheidet all das selbst und aktualisiert anschließend seine Parameter entsprechend dem Plan. Das ist, als würde es für sich selbst Unterricht planen und dann daran teilnehmen.

Diese Methode heißt SEAL (Self-Adapting LLMs) (NeurIPS'25). Die Qualität des Plans lässt sich daran messen, „wie gut das Modell nach dem Unterricht abschneidet“. Anhand der Ergebnisse passt das System anschließend den Plan an – das ist Reinforcement Learning.

Bei Fragen und Antworten zu Wissen stieg die Genauigkeit mit diesem Ansatz von 33,5% auf 47,0%. Damit übertraf er die direkte Verwendung von GPT-4.1 zur Erzeugung von Lernmaterialien.

SEAL behandelt die Frage, „wie das Modell Lernmaterialien für sich selbst vorbereitet“. Bei Agenten, die wiederholt mit ihrer Umgebung interagieren müssen, zeigt sich jedoch schnell ein weiterer Engpass: Praktisches Üben ist oft zu langsam und zu teuer. Das nächste Projekt bezieht deshalb auch die Umgebung in den geschlossenen Kreislauf ein.

SEAL behandelt die Frage, „wie das Modell Lernmaterialien für sich selbst vorbereitet“. Bei Agenten, die wiederholt mit ihrer Umgebung interagieren müssen, ist praktisches Üben oft zu langsam und zu teuer: Webumgebungen sind zu komplex und jede Aktion muss in der Realität ausgeführt werden, wodurch die Datenerfassung langsam und kostspielig wird. WebEvolver (EMNLP'25) bietet einen Kompromiss – ein internes „Weltmodell“ wird darauf trainiert, die Reaktionen des Webs zu simulieren. Das ist, als würde man im Kopf eine Sandbox bauen. Agenten können darin kostengünstig und ausgiebig üben und müssen nur für die Validierung kritischer Schritte online gehen. Bei der Ausführung von Aufgaben kann die Sandbox außerdem helfen, die Ergebnisse der nächsten Aktion vorherzusagen. In drei realen Webaufgaben-Testsätzen verbesserte sich die Gesamtleistung gegenüber bestehenden selbstevolvierenden Agenten um etwa 10%, ohne dass ein stärkeres „Lehrermodell“ erforderlich war.

Nun kann der geschlossene Kreislauf in einer simulierten Umgebung üben. Die nächste naheliegende Frage lautet: Können Vorhersage, Bewertung und Parameteraktualisierungen auch außerhalb des Webs stattfinden und den Kreislauf in der realen physischen Welt schließen?

Motus2: Wenn die Selbstverbesserung von Parametern in die physische Welt eintritt

Selbstverbesserung findet nicht nur in Sprache und Code statt. Im 08.2026 stieg die durchschnittliche Erfolgsquote eines Robotersystems bei zwei realen Maschinenaufgaben von 65% auf 75%. Die Veränderung ging auf einen sehr konkreten geschlossenen Kreislauf zurück: Zuerst stellt sich der Roboter mehrere Handlungen vor, sagt die Ergebnisse jeder Handlung voraus, wählt die besseren aus und nutzt die Ergebnisse anschließend für die nächste Trainingsrunde.

Dieses System heißt Motus2. Die Strategie schlägt Handlungen vor, das Weltmodell sagt deren Ergebnisse voraus und das Wertmodell beurteilt, ob diese Ergebnisse zur Erledigung der Aufgabe beitragen. Vorhersage und Bewertung dienen sowohl zur Auswahl von Handlungen als auch zur Aktualisierung der Handlungsparameter.

Es handelt sich um eine Strategieverbesserung auf Gewichtsebene, aber der geschlossene Kreislauf bleibt begrenzt: Das Grundgerüst des Weltmodells und des Wertmodells bleibt eingefroren, und die Aufgaben sowie die Überwachung werden weiterhin von außen vorgegeben. Das Paper zeigt nicht, dass Motus2 nach seiner Verbesserung besser darin ist, die nächste Runde von Lernalgorithmen zu entwerfen. Es beweist, dass der geschlossene Kreislauf mit echten Robotern funktionieren kann – nicht, dass eine offene RSI bereits erreicht wurde.

SEAL, WebEvolver und Motus2 haben Trainingsmaterialien, Übungsumgebungen und physische Handlungen in den geschlossenen Kreislauf eingebunden. Damit haben sie den Umfang der Tätigkeiten erweitert, die das System autonom ausführen kann. Dem System haben sie jedoch noch nicht die Entscheidungsbefugnis darüber gegeben, „was erforscht und wann ein Ergebnis übernommen werden soll“. Um zu sehen, wie weit diese Grenze in der realen Forschung und Entwicklung bereits verschoben wurde, müssen wir zu führenden Laboren und Produktionssystemen zurückkehren.

OpenAI und Google: Agenten an der Modellentwicklung beteiligen

OpenAIs „automatisierter Forschungspraktikant“ kann bereits Fehler beheben, GPU-Kernel-Programme optimieren, mit Trainingsrezepten experimentieren und bei der Verbesserung eines anderen Modells helfen. Auch Google erklärte, dass lang laufende Agenten an der Verfeinerung der zugrunde liegenden Modelle beteiligt waren. Doch keines der beiden Unternehmen hat einen vollständigen autonomen geschlossenen Kreislauf demonstriert: Menschen entscheiden weiterhin über die Forschungsrichtung und darüber, ob Ergebnisse weitergeführt werden. Die öffentlich verfügbaren Informationen reichen zudem nicht aus, um die Funktionsweise des Kreislaufs nachzuvollziehen.

Die tatsächliche Veränderung besteht darin, dass KI nicht länger nur „das untersuchte Modell“ ist, sondern zu einem „Ausführenden wird, der an der Erforschung von Modellen mitwirkt“. Sie ist in die Trainingswerkstatt eingetreten, hat aber noch nicht das Steuer des Labors übernommen.

Sommer 2026: Automatisierte Forschungssysteme beginnen, ihre eigenen Forschungsmethoden zu verbessern

Die ersten fünf Fortschritte erweiterten kontinuierlich, „was das System verändern kann“. Eine Reihe von Arbeiten, die im Sommer 2026 erschienen, stellte nun unmittelbar die Frage: Können wir automatisierte Forschungssysteme damit beauftragen, die automatisierten Forschungssysteme selbst zu erforschen und zu verbessern?

Bei einem Benchmark für das GPT-Pretraining verringerte die gewöhnliche innere Schleife den Validierungsverlust um etwa 0,009. Mit einer zusätzlichen äußeren Schleife sank er durchschnittlich um etwa 0,045 – eine ungefähr fünffache Verbesserung. Der Validierungsverlust lässt sich als Maß dafür verstehen, wie stark das Modell bei neuen Daten „danebenliegt“; in der Regel gilt: je niedriger, desto besser. Verglichen wird hier der Umfang der Verlustreduzierung, nicht eine Verfünffachung der Aufgaben genauigkeit.

Das Bilevel Autoresearch, mit dem dieses Ergebnis erzielt wurde, arbeitet mit zwei Schleifenebenen: Der innere Agent optimiert den Aufgabencode, während der äußere Agent den Suchmechanismus des inneren Agenten optimiert. Das System verbessert nicht mehr nur Antworten, sondern auch „die Art und Weise, Antworten zu finden“.

Recursive Harness Self-Improvement (RHI) erzielte ähnliche Ergebnisse: Bei 30 synthetischen Forschungsaufgaben im maschinellen Lernen übertraf der aktualisierte Agent mit geringem Inferenzbudget die nicht optimierte Konfiguration mit dem höchsten Budget und senkte gleichzeitig die Inferenzkosten um bis zu etwa 60%. Verbesserungen an den Betriebsmechanismen können manchmal wirksamer sein, als einfach das Denkbudget zu erhöhen.

Diese beiden Ergebnisse stammen jedoch hauptsächlich aus Experimenten in kontrolliertem Umfang. Um zu beweisen, dass der geschlossene Kreislauf nicht nur gelegentlich eine gute Lösung findet, sind ein längerer kontinuierlicher Betrieb, mehrere aufeinanderfolgende Versionen und Tests außerhalb der Schleife erforderlich. AIDE² versucht, diese drei Aspekte zu verbinden.

Die eigentliche Kontroverse dreht sich um AIDE². Das Weco-Team ließ einen automatisierten Forschungsagenten als äußeren Verbesserer kontinuierlich über 100 Schritte die Tools des inneren AIDE umschreiben. Während acht Tagen unbeaufsichtigten Betriebs filterte das System sieben aufeinanderfolgende verbesserte Versionen heraus. Dem Bericht des Teams zufolge übertraf die beste Version nicht nur den Ausgangspunkt, sondern auch eine Version, die zwei Jahre lang manuell optimiert worden war. Außerdem erzielte sie Zugewinne bei Aufgaben, mit denen die Schleife zuvor nie in Berührung gekommen war.

Auch beim Belohnungsbetrug zeigte sich eine Veränderung. Im GPU-Kernel-Programmtest KernelBench, der nicht an der Optimierung beteiligt war, wiesen beim Ausgangsmodell 63% der Testfälle das Muster auf: „Die öffentlichen Bewertungen scheinen sich verbessert zu haben, aber die verborgene Validierung erkennt das nicht an.“ Bei der besten weiterentwickelten Version sank dieser Anteil auf 34%. Die verborgene Bewertung ist dabei eine Punktzahl, die das System während der Optimierung nicht sieht und die nur bei der abschließenden Abnahme verwendet wird. Möglicherweise wurden dadurch Versionen aussortiert, die lediglich auf die öffentlichen Bewertungen zugeschnitten waren.

Weco bezeichnet dies als Level 1: netto positive Verbesserung. Das ist kein Branchenstandard, aber ein Beleg für begrenzte RSI, der derzeit ernsthaft in Betracht gezogen werden sollte. Auch die Grenzen der Belege sind klar: Die Ergebnisse stammen aus Eigenberichten des Teams, ein vollständiger Bericht steht noch aus. Zudem hat das weiterentwickelte System eine Zunahme der Komplexität und toten Code gezeigt. Noch wichtiger ist, dass es den Zündungstest der nächsten Stufe nicht bestanden hat: Es ist nicht nachgewiesen, dass das verbesserte System eine andere Version besser verbessern kann als sein Vorgänger.

In einem Satz: Der geschlossene Kreislauf konnte sich einige Male in die richtige Richtung drehen, doch es ist noch nicht bewiesen, dass die vorherige Runde die nächste beschleunigt.

Gesamtperspektive: So lässt sich der aktuelle Stand von RSI bestimmen

Die folgende Tabelle vergleicht frühere Fortschritte anhand der eingangs genannten vier Kriterien (anhaltende Verbesserung, autonomer geschlossener Kreislauf, rekursiver Zugewinn, Robustheit und Kontrollierbarkeit) und hebt wesentliche Lücken hervor. Ein Großteil der einschlägigen Arbeiten zu geschlossenen Meta-Forschungskreisläufen stammt aus den jüngsten Monaten des Jahres 2026 und wurde als arXiv-Preprint veröffentlicht. AIDE² wiederum beruht auf einem selbst veröffentlichten Blogbericht des Teams, der noch keinem Peer Review unterzogen wurde. Diese Schlussfolgerungen sollten als Beobachtungen zu einer Entwicklungsphase und nicht als etablierter Konsens betrachtet werden.

✅ in der Tabelle kennzeichnet direkte Belege, ⚠️ bedeutet, dass etwas nur unter begrenzten Bedingungen gilt oder die Belege noch nicht ausreichen, und ❌ steht dafür, dass es noch nicht nachgewiesen wurde.

Die Geschichte dieses Forschungsgebiets ist eine Geschichte davon, wie die „Objekte, die das System verändern kann“, nach und nach weiter nach innen rücken. Die veränderten Objekte reichten zunächst von Ausgaben und Erinnerungen über Parameter, Bewertungen, steuernde Tools und Trainingsumgebungen bis hin zu den Mechanismen, die Verbesserungen selbst hervorbringen.

Je tiefer man vordringt, desto schwieriger wird es, „Verbesserung“ zu definieren und nachzuweisen. Betrachtet man erneut die vier Kriterien – anhaltende Verbesserung, autonomer geschlossener Kreislauf, rekursiver Zugewinn sowie Robustheit und Kontrollierbarkeit –, liegen die eigentlichen Hindernisse für die Zündung und eine offene RSI heute in den schwierigsten Teilen der letzten drei Kriterien. Sie lassen sich in vier miteinander verknüpfte Hürden unterteilen.

Die erste Hürde (Ist der autonome geschlossene Kreislauf zuverlässig?): Ist der Prüfer zuverlässig, und kann das System ihn nicht verändern? Wenn das System zugleich Verbesserer und Bewerter ist, driften die Bewertungskriterien mit jeder Iteration ab. Der „Bewerter der Bewerter“ bei Meta-Rewarding hat sich zunehmend hohen Punktzahlen selbst zugeneigt; EURISKO wiederum lernte schon früher, den eigenen Namen ins Verzeichnis der Verdienste einzutragen. Beide Fälle erinnern an dasselbe: Der Optimierungsprozess wird jede Lücke zwischen Kennzahlen und tatsächlichen Zielen ausnutzen.

Externe Anker sind hier Bewertungen oder Beschränkungen, die das verbesserte System nicht manipulieren kann. Formale Beweise, ausführbare Prüfer und verborgene Tests sind normalerweise zuverlässiger als Selbstbewertungen des Modells. Die verborgenen Bewertungen von AIDE² können einen Teil des Belohnungsbetrugs verhindern, gerade weil die inneren Agenten sie nicht manipulieren können.

Das wirklich zuverlässige Prinzip besteht nicht darin, jeden Schritt von Menschen prüfen zu lassen, sondern vielmehr darin, dass Bewerter und Befugnisgrenzen außerhalb der Kontrolle des weiterentwickelten Systems bleiben müssen. Bei mathematischen Aufgaben und Programmieraufgaben kann man sich auf Beweissysteme, Compiler oder verborgene Tests stützen. Forschungsurteil, langfristige Codequalität und Einsatzgrenzen erfordern weiterhin eine abschließende menschliche Beurteilung.

Die zweite Hürde (Robustheit und Kontrollierbarkeit): Können Verbesserungen die eigene Datenverteilung verlassen? Wer sich mit selbst erzeugten Daten trainiert, verstärkt bestehende Verzerrungen und verringert die Vielfalt. Das kann schließlich zum Modellkollaps führen: Die Ausgaben werden immer eintöniger, und ursprüngliche Fehler verstärken sich in jeder Runde des Selbsttrainings erneut. Werden steuernde Tools anhand eines festen Fragenkatalogs verändert, können dessen Eigenschaften in den Workflow einfließen und eine andere Form der Überanpassung erzeugen.

Eine Verbesserung bei einer unbekannten Aufgabe reicht nicht aus. Das System muss verborgene Bewertungen über verschiedene Aufgaben, Bereiche und Zeiträume hinweg bestehen, um zu zeigen, dass es übertragbare Fähigkeiten statt immer ausgefeilterer Fähigkeiten zum Ablegen von Tests erworben hat.

Die dritte Hürde (der rekursive Zugewinn selbst): Hat die Verbesserung tatsächlich einen rekursiven Zugewinn? Eine höhere Aufgabenbewertung bedeutet nicht, dass das System besser darin ist, die nächste Verbesserung zu entwerfen. AIDE² zeigte mehrere Schritte einer netto positiven Verbesserung, bestand aber die Zündung nicht. AI4AI-Bench zeigt, dass die meisten Systeme weiterhin keine zentralen Lernalgorithmen verändern. Ist die Grundlage zu schwach, kann die Qualität selbst erzeugter Daten und der eigenen Fehlerdiagnose den Kreislauf zusätzlich verschlechtern.

Die vierte Hürde (Robustheit und Kontrollierbarkeit, Teil zwei): Können Fähigkeiten, Komplexität und Kontrolle gemeinsam wachsen? Stärker zu werden bedeutet nicht zwangsläufig, „gehorsamer“ zu werden. Und besser darin zu werden, Code zu verändern, heißt nicht unbedingt, dass er leichter zu warten ist. Der tote Code und die zunehmende Komplexität bei AIDE² sind eine Warnung im kleinen Maßstab. Bei größeren Trainingssystemen gilt: Je umfassender die Befugnisse und je schneller die Iterationen, desto schwieriger wird es für Menschen, nachzuvollziehen, was jede Änderung tatsächlich bewirkt.

OpenAIs Chefwissenschaftler Jakub Pachocki erklärte öffentlich, dass noch kein Labor die Ausrichtung und Überwachung so weit gelöst habe, dass sich der langfristige Betrieb mit voller Geschwindigkeit verantwortungsvoll skalieren lasse. Das eigentliche Ziel ist nicht bloß, die Leistungskurve steigen zu lassen, sondern sicherzustellen, dass Sicherheit, Überwachung, Zurücksetzen und Prüfbarkeit mindestens im gleichen Maße zunehmen.

AutoResearchEval untersuchte 800 reale Forschungsverläufe und fasste 45 Fehlerkategorien zusammen. Letztlich verweisen sie alle auf dieselbe Lücke: Den aktuellen Agenten fehlt eine stabile metakognitive Schleife. Sie können Schlussfolgerungen nicht fortlaufend anhand von Belegen überprüfen, Fehler nicht zuverlässig rückgängig machen und ihre Forschungswege nicht aktiv infrage stellen. Dieses Problem lässt sich nicht einfach lösen, indem man eine weitere Workflow-Ebene hinzufügt.

Das realistischere Szenario besteht daher wahrscheinlich nicht darin, dass Menschen einfach aus dem geschlossenen Kreislauf verdrängt werden, sondern darin, dass sie auf der Abstraktionsleiter nach oben rücken: vom Schreiben von Code zur Überprüfung von Code, von der Durchführung von Experimenten zur Gestaltung von Validierungen, von der lokalen Ausführung zur Entscheidung darüber, was erforscht werden sollte, welche Belege für einen Fortschritt ausreichen und wann Schluss ist. Während Maschinen immer mehr Arbeit übernehmen, bleibt den Menschen nicht die operative Befugnis für jeden einzelnen Schritt, sondern die Verantwortung für Ziele, Validierungsgrenzen und das endgültige Vetorecht.

Fazit: Der geschlossene Kreislauf der Selbstverbesserung ist da – rekursive Zugewinne müssen noch bewiesen werden

Von EURISKOs Erlernen der „Selbsttäuschung“ im Jahr 1981 bis hin zu Modellen, die 2026 beginnen, an Evaluierungen teilzunehmen, Steuerungswerkzeuge zu verändern, Strategien zu aktualisieren und Nachfolger zu trainieren, lautet die genauere Schlussfolgerung: Begrenzte, messbare Selbstverbesserungsschleifen sind entstanden und haben sogar begonnen, einen positiven Nettonutzen zu bringen. Es gibt jedoch noch keine ausreichenden öffentlichen Belege dafür, dass die verbesserten Systeme ihre eigenen Fähigkeiten zur Verbesserung kontinuierlich weiterentwickelt haben. Daher ist die Art und Weise, wie die Schleife entsteht, wichtiger als die Schleife selbst.

Eine Schleife, die sich unter sich verschiebenden Bewertungskriterien bildet, wird zunehmend besser darin, ihre eigenen verzerrten Ziele zu optimieren. Eine Schleife, die sich bei einem Zusammenbruch der Datenverteilung bildet, wird zunehmend besser darin, eine immer kleinere Teilmenge von Aufgaben zu bearbeiten. Eine Schleife, die sich bei verstärkten Alignment-Verzerrungen bildet, wird zunehmend leistungsfähiger und zugleich immer schwieriger zu korrigieren.

Die entscheidenden Fragen lauten inzwischen: Wird sie sich entzünden, und was bleibt dann außerhalb ihrer unveränderlichen Grenzen? Die erste Frage hängt davon ab, ob die Verbesserungskompetenz einen rekursiven Zuwachs erzielen kann; die zweite davon, ob Validierung, Befugnisse und Governance weiterhin wirksam bleiben können.

Kehren wir zu EURISKO zurück, das vor vierzig Jahren seinen Namen in die Liste der „Entdecker“ eintrug. Das Schlupfloch, das es ausnutzte, und die Herausforderungen, vor denen die heutigen hochmodernen selbstentwickelnden Systeme stehen, sind im Wesentlichen dieselben: Wenn ein System beginnt, sich selbst zu bewerten, woran erkennt man, ob es sich tatsächlich verbessert hat oder lediglich gelernt hat, sich selbst besser darzustellen?

Vierzig Jahre sind vergangen, und die Fähigkeiten der Systeme sind nicht mehr vergleichbar – doch diese Frage ist nahezu unverändert geblieben. Was sich verändert hat, ist der Einsatz: Was einst ein Spiel um Sieg oder Niederlage auf dem Spieltisch war, könnte heute die operativen Verfahren von Forschungs- und Wirtschaftssystemen betreffen. Wie diese Naht letztlich geschlossen wird, hängt weiterhin davon ab, wann und wie wir Hand anlegen oder uns zurückziehen.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]