Google tworzy WikiSkill, aby agenci AI pamiętali o swoich błędach i poprawiali się

By: www.diariobitcoin.com|2026/08/29 13:32:09
0
Udostępnij
copy
Oceń nas w GoogleOceń nas w Google

**Badacze z Google Research zaprezentowali WikiSkill, ramy, które przechowują błędy i sukcesy agentów AI w trwałej wiki, aby tworzyć lepsze instrukcje w przyszłych wykonaniach. Testy pokazują znaczące postępy w matematyce, arkuszach kalkulacyjnych i interaktywnych środowiskach, chociaż system nadal nie reprezentuje uczenia się w sensie ścisłym.


  • WikiSkill oddziela ślady wykonania, zgromadzoną wiedzę i aktywne instrukcje w trzech warstwach.**
  • Ramy podniosły średnią Gemini 3.5 Flash z 49,5% do 68,1%, a Qwen-3.6-27B z 39,4% do 63,3%.
  • Duże modele lepiej wykorzystują rozwinięte umiejętności, podczas gdy mniejsze mogą zredukować część różnicy.

Zewnętrzna pamięć dla zapominających agentów

Badacze z Google Research zaprezentowali WikiSkill jako ramy mające na celu rozwiązanie powtarzającego się ograniczenia agentów sztucznej inteligencji: każde wykonanie kończy się, a znaczna część zdobytego doświadczenia znika. Zamiast modyfikować parametry modelu po każdym zadaniu, system gromadzi informacje o błędach, sukcesach i użytecznych strategiach w strukturze przypominającej encyklopedię współpracującą. Agent następnie konsultuje ten materiał, aby działać z lepszymi instrukcjami przy następnej okazji.

Propozycja nie oznacza, że model uczy się w sposób ciągły w tradycyjnym sensie. Model zachowuje swoje pierwotne szkolenie, ale generuje dokładniejsze instrukcje dla siebie na podstawie zarejestrowanego doświadczenia, co jest mniej eleganckim rozwiązaniem niż uczenie się na stałe i potencjalnie podatnym na błędy kumulacyjne. Niemniej jednak wyniki badania wskazują, że ta zewnętrzna pamięć może znacząco poprawić wydajność w zadaniach wymagających wielu kroków i skoordynowanego użycia narzędzi.

Koncepcja wywodzi się z perspektywy przypisywanej Andrejowi Karpathy'emu na temat rodzaju wiki dla modeli językowych, gdzie doświadczenie agentów przekształca się w wiedzę trwałą i kumulatywną. WikiSkill rozwija tę ideę w kierunku automatycznego rozwoju umiejętności, z procesem, który stara się przekształcić wcześniejsze wykonania w procedury wielokrotnego użytku, nie dotykając zachowania wyuczonego podczas szkolenia. Rozróżnienie to jest istotne, ponieważ pozwala testować zmiany zachowania bez przeprowadzania pełnej nowej regulacji modelu.

Praca została oceniona w pięciu rodzajach testów: rozumowanie matematyczne, wyszukiwanie w sieci, manipulacja arkuszami kalkulacyjnymi, pytania i odpowiedzi dotyczące dokumentów oraz zadania interaktywne w wirtualnym środowisku. Badacze użyli Qwen w wersjach 4 miliardów, 9 miliardów i 27 miliardów parametrów, a także Gemma-4-31B i Gemini-3.5-Flash. Ta kombinacja pozwoliła zaobserwować, jak zgromadzona pamięć działa w modelach o różnych możliwościach i w obliczu zadań o bardzo różnych wymaganiach.

Trzy warstwy i cykl poprawy

WikiSkill organizuje przestrzeń roboczą w trzech poziomach, które pełnią oddzielne funkcje. Warstwa Raw zachowuje pełne ślady każdego wykonania, w tym wywołania narzędzi, uzyskane odpowiedzi i kroki podjęte przez agenta; te zapisy są niezmienne i służą jako surowiec do analizy zachowania. Powyżej znajduje się Warstwa Wiki, gdzie doświadczenie przekształca się w ustrukturyzowane wnioski, takie jak wzorce błędów, zalecenia operacyjne i strategie, które przyniosły korzystne wyniki.

Warstwa Wiki nie resetuje się po wykonaniu zadania, lecz rośnie z każdą iteracją, zgodnie z opisem badaczy. Ta ciągłość pozwala na późniejsze wykonanie zapytań dotyczących problemów wykrytych wcześniej, nawet jeśli strategia, która je spowodowała, nie jest już aktywna. Trzecia warstwa, zwana warstwą umiejętności (Skill Layer), zawiera instrukcje proceduralne, które agent wykorzystuje podczas wykonania i działa jako część modyfikowalna systemu.

Cykl zaczyna się, gdy agent wnioskowania kończy zadanie z dostępnymi umiejętnościami i produkuje nowy ślad. Następnie, Wiki Maintainer przegląda te zapisy, aby zidentyfikować, co poszło nie tak i jakie decyzje pomogły, podczas gdy Skill Proposer wykorzystuje zgromadzone wnioski, aby zasugerować konkretne zmiany w aktywnych instrukcjach. Architektura w ten sposób oddziela obserwację faktów, interpretację doświadczenia i zastosowanie nowego zachowania.

Przed zaakceptowaniem modyfikacji, mechanizm walidacji lub gating testuje ją na niezależnym zbiorze zadań. Jeśli zmiana poprawia wyniki, może zostać włączona do warstwy umiejętności; jeśli pogarsza wydajność, zostaje cofnięta bez usuwania informacji, która doprowadziła do propozycji. Nawet nieudana aktualizacja zachowuje użyteczność, ponieważ wiki rejestruje, co próbowano i dlaczego to nie zadziałało, dzięki czemu system może uniknąć powtarzania tej samej drogi lub zaprojektować alternatywę w kolejnych rundach.

Nierówne wyniki w zależności od modelu i zadania

Badanie zgłosiło poprawę WikiSkill w porównaniu do agentów bez dodatkowych umiejętności. Średnio, Gemini-3.5-Flash przeszedł z 49,5% bez umiejętności do 68,1% z WikiSkill, podczas gdy Qwen-3.6-27B wzrósł z 39,4% do 63,3%. Liczby te odpowiadają średniej z pięciu benchmarków i zostały obliczone na podstawie trzech niezależnych wykonania, zgodnie z tabelą zawartą w pracy.

Obserwując poszczególne zadania, różnice stają się jeszcze bardziej widoczne. Gemini-3.5-Flash wzrósł z 33,0% do 72,6% w LiveMath i z 50,5% do 76,6% w SpreadSheet, dwóch scenariuszach, w których zgromadzone instrukcje wydają się mieć największy wpływ. W przypadku Qwen-3.6-27B, WikiSkill osiągnął 61,9% w LiveMath i 81,7% w SpreadSheet, w porównaniu do 33,9% i 40,8% odpowiednio, gdy model pracował bez umiejętności.

Zyski nie były jednorodne we wszystkich dziedzinach. Zadania matematyczne i manipulacja arkuszami kalkulacyjnymi wykazały najszersze skoki, podczas gdy OfficeQA, które wymaga odpowiadania na pytania dotyczące dokumentów i zarządzania długimi kontekstami, wykazało bardziej ograniczone postępy w różnych konfiguracjach. W Gemini-3.5-Flash, na przykład, wynik OfficeQA wzrósł z 48,6% do 60,7%, co jest istotną poprawą, chociaż mniejszą niż ta obserwowana w LiveMath i SpreadSheet.

Rozmiar modelu również wpłynął na zdolność do wykorzystania rozwiniętych umiejętności. Badacze zauważyli, że Qwen-3.5-4B miał trudności z niezawodnym wykonywaniem strategii wyszukiwania wieloetapowego, gdy musiał je utrzymywać w długich kontekstach, przez co często wracał do swojego domyślnego zachowania. Jednak mały model wyposażony w WikiSkill może dorównać wydajności większego modelu, który nie korzysta z tego frameworku, co otwiera możliwą drogę do zwiększenia użyteczności systemów z mniejszymi zasobami.

Transfer umiejętności i nieprzekroczone limity

Innym spostrzeżeniem badania jest to, że umiejętności stworzone przez jeden model mogą być przenoszone do innego i w niektórych przypadkach działać lepiej niż instrukcje, które model odbierający opracował samodzielnie. Ta możliwość wskazuje na wspólny zbiór procedur, gdzie umiejętność przydatna do rozwiązywania arkuszy kalkulacyjnych lub przeszukiwania sieci mogłaby być ponownie wykorzystana w różnych agentach. Niemniej jednak wyniki nie gwarantują, że transfer będzie korzystny w każdym przypadku, dlatego badacze sugerują weryfikację go indywidualnie.

Transfer wymaga ostrożności, ponieważ instrukcja, która działa w jednym modelu, może zależeć od jego możliwości, stylu rozumowania lub sposobu interakcji z narzędziami. Mniejszy agent może niepełni interpretować strategię zaprojektowaną dla większego systemu, szczególnie gdy zadanie wymaga utrzymania wielu kroków w kontekście. Mechanizm walidacji stanowi barierę przed tym ryzykiem, ale nie eliminuje potrzeby oceny każdej umiejętności w środowisku, w którym będzie używana.

WikiSkill ujawnia również fundamentalną różnicę między pamięcią a uczeniem się. Wiki przechowuje informacje, a Skill Proposer generuje nowe instrukcje, ale parametry modelu pozostają niezmienione; dlatego system nie nabywa wewnętrznego zrozumienia w taki sam sposób, jak miałoby to miejsce w przypadku ciągłego procesu szkolenia. Rozwiązanie może poprawić obserwowalne zachowanie, chociaż błędny wniosek, niekompletna rejestracja lub błędna inferencja mogą zostać włączone do bazy wiedzy i wpłynąć na przyszłe decyzje.

Projektowanie warstw stara się rozwiązać ten problem, utrzymując oddzielone oryginalne ślady, wnioski i aktywne umiejętności. Możliwość cofnięcia aktualizacji chroni natychmiastowe wykonanie, podczas gdy zachowanie nieudanych prób zapobiega utracie użytecznych informacji do późniejszej analizy. Wspólnie podejście to pokazuje, jak deweloperzy mogą budować agentów z nagromadzoną historią operacyjną, nie twierdząc, że rozwiązali problem ciągłego uczenia się, który wciąż pozostaje otwarty.

Wyniki sugerują, że pamięć zewnętrzna może stać się ważnym elementem dla agentów pracujących wielokrotnie nad tymi samymi rodzajami zadań. WikiSkill nie eliminuje ograniczeń modeli ani nie zapewnia, że każde doświadczenie przyniesie poprawę, ale oferuje systematyczny proces obserwacji błędów, dokumentowania strategii, testowania zmian i zachowywania zdobytych lekcji. Główna obietnica ramy polega na przekształceniu zapomnienia między wykonaniami w stopniowy proces kontrolowanego udoskonalania.

Cena --

--
--
--

Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.

Możesz również polubić

iconiconiconiconiconiconiconicon
Obsługa klienta:@weikecs
Współpraca biznesowa:@weikecs
Quant trading i MM:[email protected]
Program VIP:[email protected]