Google erstellt WikiSkill, damit KI-Agenten ihre Fehler erinnern und sich verbessern

By: www.diariobitcoin.com|2026/08/29 13:32:09

**Forscher von Google Research haben WikiSkill vorgestellt, ein Framework, das die Fehler und Erfolge von KI-Agenten in einem persistenten Wiki speichert, um bessere Anweisungen für zukünftige Ausführungen zu erstellen. Die Tests zeigen bedeutende Fortschritte in Mathematik, Tabellenkalkulationen und interaktiven Umgebungen, obwohl das System noch kein kontinuierliches Lernen im strengen Sinne darstellt.


  • WikiSkill trennt die Ausführungsspuren, das angesammelte Wissen und die aktiven Anweisungen in drei Schichten.**
  • Das Framework erhöhte den Durchschnitt von Gemini 3.5 Flash von 49,5 % auf 68,1 % und den von Qwen-3.6-27B von 39,4 % auf 63,3 %.
  • Die großen Modelle nutzen die entwickelten Fähigkeiten besser, während die kleinen Modelle einen Teil der Lücke schließen können.

Ein externes Gedächtnis für vergessliche Agenten

Forscher von Google Research haben WikiSkill als ein Framework vorgestellt, das darauf abzielt, eine wiederkehrende Einschränkung von KI-Agenten zu lösen: Jede Ausführung endet und ein großer Teil der gewonnenen Erfahrung verschwindet. Anstatt die Parameter des Modells nach jeder Aufgabe zu ändern, sammelt das System Informationen über Fehler, Erfolge und nützliche Strategien in einer Struktur, die einer kollaborativen Enzyklopädie ähnelt. Der Agent konsultiert dann dieses Material, um bei der nächsten Gelegenheit mit besseren Anweisungen zu handeln.

Der Vorschlag impliziert nicht, dass das Modell auf traditionelle Weise kontinuierlich lernt. Das Modell bewahrt sein ursprüngliches Training, generiert jedoch präzisere Anweisungen für sich selbst aus der aufgezeichneten Erfahrung, eine weniger elegante Lösung als das permanente Lernen und potenziell anfällig für angesammelte Fehler. Dennoch zeigen die Ergebnisse der Studie, dass dieses externe Gedächtnis die Leistung bei Aufgaben, die mehrere Schritte und koordinierte Nutzung von Werkzeugen erfordern, erheblich verbessern kann.

Das Konzept basiert auf einer Perspektive von Andrej Karpathy über eine Art Wiki für Sprachmodelle, in der die Erfahrung der Agenten in persistentes und kumulatives Wissen umgewandelt wird. WikiSkill bringt diese Idee in die automatische Entwicklung von Fähigkeiten ein, mit einem Prozess, der versucht, frühere Ausführungen in wiederverwendbare Verfahren umzuwandeln, ohne das während des Trainings erlernte Verhalten zu berühren. Die Unterscheidung ist relevant, da sie es ermöglicht, Verhaltensänderungen zu testen, ohne eine vollständige Neuanpassung des Modells vorzunehmen.

Die Arbeit wurde in fünf Arten von Tests bewertet: mathematisches Denken, Websuche, Manipulation von Tabellenkalkulationen, Fragen und Antworten zu Dokumenten und interaktive Aufgaben in einer virtuellen Umgebung. Die Forscher verwendeten Qwen in Versionen mit 4 Milliarden, 9 Milliarden und 27 Milliarden Parametern sowie Gemma-4-31B und Gemini-3.5-Flash. Diese Kombination ermöglichte es, zu beobachten, wie das angesammelte Gedächtnis in Modellen unterschiedlicher Kapazitäten und bei Aufgaben mit sehr unterschiedlichen Anforderungen funktioniert.

Drei Schichten und ein Verbesserungszyklus

WikiSkill organisiert den Arbeitsbereich in drei Ebenen, die separate Funktionen erfüllen. Die Raw Layer bewahrt die vollständigen Spuren jeder Ausführung, einschließlich der Aufrufe von Werkzeugen, der erhaltenen Antworten und der vom Agenten durchgeführten Schritte; diese Aufzeichnungen sind unveränderlich und dienen als Rohmaterial zur Analyse des Verhaltens. Darüber liegt die Wiki Layer, in der die Erfahrung in strukturierte Schlussfolgerungen umgewandelt wird, wie Fehlerpatterns, betriebliche Empfehlungen und Strategien, die positive Ergebnisse erzielt haben.

Die Wiki Layer wird nach einer Aufgabe nicht zurückgesetzt, sondern wächst mit jeder Iteration, so die Beschreibung der Forscher. Diese Kontinuität ermöglicht es einer späteren Ausführung, zuvor erkannte Probleme zu konsultieren, selbst wenn die Strategie, die sie verursacht hat, nicht mehr aktiv ist. Die dritte Schicht, die Skill Layer genannt wird, enthält die Verfahrensanweisungen, die der Agent während der Ausführung verwendet, und fungiert als der veränderbare Teil des Systems.

Der Zyklus beginnt, wenn ein Inferenzagent eine Aufgabe mit den verfügbaren Fähigkeiten abschließt und eine neue Spur erzeugt. Danach überprüft ein Wiki Maintainer diese Protokolle, um zu identifizieren, was schiefgelaufen ist und welche Entscheidungen hilfreich waren, während ein Skill Proposer die gesammelten Schlussfolgerungen nutzt, um konkrete Änderungen an den aktiven Anweisungen vorzuschlagen. Die Architektur trennt somit die Beobachtung der Fakten, die Interpretation der Erfahrungen und die Anwendung eines neuen Verhaltens.

Bevor eine Modifikation akzeptiert wird, testet ein Validierungs- oder Gate-Mechanismus sie an einem unabhängigen Satz von Aufgaben. Wenn die Änderung die Ergebnisse verbessert, kann sie in die Skill Layer integriert werden; wenn sie die Leistung beeinträchtigt, wird sie zurückgenommen, ohne die Informationen zu löschen, die den Vorschlag hervorgebracht haben. Selbst ein fehlgeschlagendes Update behält seinen Nutzen, da die Wiki aufzeichnet, was versucht wurde und warum es nicht funktioniert hat, sodass das System vermeiden kann, denselben Weg zu wiederholen oder eine Alternative in späteren Runden zu entwerfen.

Ungleichmäßige Ergebnisse je nach Modell und Aufgabe

Die Studie berichtete von Verbesserungen von WikiSkill im Vergleich zu Agenten ohne zusätzliche Fähigkeiten. Im Durchschnitt stieg Gemini-3.5-Flash von 49,5 % ohne Fähigkeiten auf 68,1 % mit WikiSkill, während Qwen-3.6-27B von 39,4 % auf 63,3 % vorankam. Die Zahlen entsprechen dem Durchschnitt der fünf Benchmarks und wurden aus drei unabhängigen Ausführungen berechnet, gemäß der im Arbeit enthaltenen Tabelle.

Bei der Betrachtung einzelner Aufgaben werden die Unterschiede noch sichtbarer. Gemini-3.5-Flash stieg von 33,0 % auf 72,6 % in LiveMath und von 50,5 % auf 76,6 % in SpreadSheet, zwei der Szenarien, in denen die gesammelten Anweisungen den größten Einfluss zu haben scheinen. Im Fall von Qwen-3.6-27B erreichte WikiSkill 61,9 % in LiveMath und 81,7 % in SpreadSheet, gegenüber 33,9 % und 40,8 %, als das Modell ohne Fähigkeiten arbeitete.

Die Gewinne waren nicht in allen Bereichen gleichmäßig. Mathematische Aufgaben und die Manipulation von Tabellenkalkulationen zeigten die größten Sprünge, während OfficeQA, das erfordert, Fragen zu Dokumenten zu beantworten und mit langen Kontexten umzugehen, in mehreren Konfigurationen begrenzte Fortschritte zeigte. Bei Gemini-3.5-Flash beispielsweise stieg die Punktzahl von OfficeQA von 48,6 % auf 60,7 %, eine relevante Verbesserung, obwohl geringer als die in LiveMath und SpreadSheet beobachtete.

Die Modellgröße beeinflusste ebenfalls die Fähigkeit, die entwickelten Fähigkeiten zu nutzen. Die Forscher stellten fest, dass Qwen-3.5-4B Schwierigkeiten hatte, mehrstufige Suchstrategien zuverlässig auszuführen, wenn es diese über umfangreiche Kontexte hinweg aufrechterhalten musste, weshalb es oft zu seinem Standardverhalten zurückkehrte. Ein kleines Modell, das mit WikiSkill ausgestattet ist, kann jedoch die Leistung eines größeren Modells, das den Rahmen nicht nutzt, erreichen, was einen möglichen Weg eröffnet, die Nützlichkeit von Systemen mit weniger Ressourcen zu erhöhen.

Übertragung von Fähigkeiten und ausstehende Grenzen

Eine weitere Beobachtung der Studie ist, dass die von einem Modell geschaffenen Fähigkeiten auf ein anderes übertragen werden können und in einigen Fällen besser funktionieren als die Anweisungen, die das empfangende Modell selbst entwickelt hat. Diese Möglichkeit deutet auf ein gemeinsames Repository von Verfahren hin, in dem eine nützliche Fähigkeit zur Lösung von Tabellenkalkulationen oder zum Navigieren im Web in verschiedenen Agenten wiederverwendet werden könnte. Dennoch garantieren die Ergebnisse nicht, dass die Übertragung in allen Fällen vorteilhaft ist, weshalb die Forscher vorschlagen, sie individuell zu überprüfen.

Die Übertragung erfordert Vorsicht, da eine Anweisung, die in einem Modell funktioniert, von dessen Fähigkeiten, Denkstil oder Art der Interaktion mit den Werkzeugen abhängen kann. Ein kleinerer Agent könnte eine für ein größeres System entworfene Strategie unvollständig interpretieren, insbesondere wenn die Aufgabe erfordert, viele Schritte im Kontext zu halten. Der Validierungsmechanismus bietet eine Barriere gegen dieses Risiko, beseitigt jedoch nicht die Notwendigkeit, jede Fähigkeit in der Umgebung zu bewerten, in der sie verwendet wird.

WikiSkill zeigt auch einen grundlegenden Unterschied zwischen Gedächtnis und Lernen auf. Das Wiki speichert Informationen, und der Skill Proposer generiert neue Anweisungen, aber die Parameter des Modells bleiben unverändert; deshalb erwirbt das System kein dauerhaftes internes Verständnis auf die gleiche Weise, wie es ein kontinuierlicher Trainingsprozess tun würde. Die Lösung kann das beobachtbare Verhalten verbessern, obwohl eine falsche Schlussfolgerung, ein unvollständiger Datensatz oder eine falsche Inferenz in die Wissensbasis aufgenommen werden und zukünftige Entscheidungen beeinflussen könnten.

Das Schichtdesign versucht, dieses Problem zu lösen, indem es die ursprünglichen Spuren, die Schlussfolgerungen und die aktiven Fähigkeiten getrennt hält. Die Möglichkeit, ein Update rückgängig zu machen, schützt die sofortige Ausführung, während die Aufbewahrung der fehlgeschlagenen Versuche verhindert, dass nützliche Informationen für die spätere Analyse verloren gehen. Insgesamt zeigt der Ansatz, wie Entwickler Agenten mit einer angesammelten Betriebsgeschichte aufbauen können, ohne zu behaupten, dass sie das kontinuierliche Lernen gelöst haben, eine Herausforderung, die weiterhin offen bleibt.

Die Ergebnisse deuten darauf hin, dass externes Gedächtnis zu einem wichtigen Bestandteil für Agenten werden kann, die wiederholt an denselben Arten von Aufgaben arbeiten. WikiSkill beseitigt nicht die Einschränkungen der Modelle und garantiert nicht, dass jede Erfahrung eine Verbesserung hervorbringt, bietet jedoch ein systematisches Verfahren zur Beobachtung von Fehlern, Dokumentation von Strategien, Testen von Änderungen und Bewahrung der gewonnenen Lektionen. Das Hauptversprechen des Rahmens liegt darin, das Vergessen zwischen Ausführungen in einen schrittweisen Prozess der kontrollierten Verfeinerung zu verwandeln.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]