Google створює WikiSkill, щоб агенти ШІ запам'ятовували свої помилки та покращувалися
Дослідники Google Research представили WikiSkill, рамкову структуру, яка зберігає помилки та успіхи агентів ШІ у постійній вікі для створення кращих інструкцій у майбутніх виконаннях. Тести показують значні досягнення в математиці, електронних таблицях та інтерактивних середовищах, хоча система все ще не представляє собою безперервне навчання в строгому сенсі.
- WikiSkill розділяє сліди виконання, накопичені знання та активні інструкції на три шари.**
- Рамкова структура підвищила середній показник Gemini 3.5 Flash з 49,5% до 68,1%, а Qwen-3.6-27B з 39,4% до 63,3%.
- Великі моделі краще використовують еволюційні навички, тоді як маленькі можуть закрити частину прогалини.
Зовнішня пам'ять для агентів, які забувають
Дослідники Google Research представили WikiSkill як рамкову структуру, призначену для вирішення повторюваного обмеження агентів штучного інтелекту: кожне виконання закінчується, і велика частина отриманого досвіду зникає. Замість того, щоб змінювати параметри моделі після кожного завдання, система збирає інформацію про невдачі, успіхи та корисні стратегії в структурі, подібній до колективної енциклопедії. Агент потім консультується з цим матеріалом, щоб діяти з кращими інструкціями наступного разу.
Ця пропозиція не передбачає, що модель навчається безперервно в традиційному сенсі. Модель зберігає своє початкове навчання, але генерує більш точні інструкції для себе на основі зареєстрованого досвіду, що є менш елегантним рішенням, ніж постійне навчання і потенційно вразливим до накопичених помилок. Тим не менш, результати дослідження вказують на те, що ця зовнішня пам'ять може значно покращити продуктивність у завданнях, що вимагають кількох кроків і координованого використання інструментів.
Концепція виходить з перспективи, приписуваної Андрею Карпаті, про своєрідну вікі для мовних моделей, де досвід агентів перетворюється на постійні та накопичувані знання. WikiSkill переносить цю ідею на автоматичний розвиток навичок, з процесом, який намагається перетворити попередні виконання на повторно використовувані процедури, не торкаючись поведінки, навченої під час навчання. Це розрізнення є важливим, оскільки дозволяє тестувати зміни поведінки без проведення нового повного налаштування моделі.
Робота була оцінена за п'ятьма типами тестів: математичне міркування, веб-пошук, маніпуляція електронними таблицями, питання та відповіді на документи та інтерактивні завдання в віртуальному середовищі. Дослідники використовували Qwen у версіях з 4 мільярдами, 9 мільярдами та 27 мільярдами параметрів, а також Gemma-4-31B та Gemini-3.5-Flash. Ця комбінація дозволила спостерігати, як накопичена пам'ять працює в моделях різних можливостей і перед завданнями з дуже різними вимогами.
Три шари та цикл покращення
WikiSkill організовує робочий простір на три рівні, які виконують окремі функції. Raw Layer зберігає повні сліди кожного виконання, включаючи виклики інструментів, отримані відповіді та кроки, які виконує агент; ці записи є незмінними і служать сировиною для аналізу поведінки. Вище знаходиться Wiki Layer, де досвід перетворюється на структуровані висновки, такі як шаблони невдач, оперативні рекомендації та стратегії, які призвели до позитивних результатів.
Wiki Layer не перезапускається після виконання завдання, а зростає з кожною ітерацією, відповідно до опису дослідників. Ця безперервність дозволяє наступному виконанню звертатися до проблем, виявлених раніше, навіть якщо стратегія, яка їх викликала, більше не активна. Третій шар, званий Skill Layer, містить процедурні інструкції, які агент використовує під час виконання, і функціонує як змінна частина системи.
Цикл починається, коли агент інференції завершує завдання з доступними навичками та створює новий слід. Потім Wiki Maintainer переглядає ці записи, щоб визначити, що пішло не так і які рішення допомогли, в той час як Skill Proposer використовує накопичені висновки, щоб запропонувати конкретні зміни в активних інструкціях. Таким чином, архітектура розділяє спостереження фактів, інтерпретацію досвіду та застосування нової поведінки.
Перед тим, як прийняти модифікацію, механізм валідації або gating перевіряє її на незалежному наборі завдань. Якщо зміна покращує результати, її можна включити до Skill Layer; якщо вона погіршує продуктивність, її скасовують, не видаляючи інформацію, що стала основою пропозиції. Навіть невдала оновлення зберігає корисність, оскільки вікі реєструє, що було спробовано і чому це не спрацювало, щоб система могла уникнути повторення того ж шляху або розробити альтернативу в наступних раундах.
Нерівні результати залежно від моделі та завдання
Дослідження повідомило про покращення WikiSkill у порівнянні з агентами без додаткових навичок. В середньому, Gemini-3.5-Flash піднявся з 49,5% без навичок до 68,1% з WikiSkill, тоді як Qwen-3.6-27B просунувся з 39,4% до 63,3%. Ці цифри відповідають середньому значенню п’яти бенчмарків і були розраховані на основі трьох незалежних виконань, згідно з таблицею, включеною в роботу.
Спостерігаючи за окремими завданнями, різниці стають ще більш помітними. Gemini-3.5-Flash піднявся з 33,0% до 72,6% у LiveMath і з 50,5% до 76,6% у SpreadSheet, двох сценаріях, де накопичені інструкції, здається, мають найбільший вплив. У випадку Qwen-3.6-27B, WikiSkill досяг 61,9% у LiveMath і 81,7% у SpreadSheet, у порівнянні з 33,9% і 40,8% відповідно, коли модель працювала без навичок.
Приріст не був рівномірним у всіх доменах. Математичні завдання та маніпуляції з електронними таблицями показали найбільші стрибки, тоді як OfficeQA, що вимагає відповідати на запитання про документи та обробляти довгі контексти, продемонстрував більш обмежені покращення в кількох конфігураціях. У Gemini-3.5-Flash, наприклад, оцінка OfficeQA піднялася з 48,6% до 60,7%, що є значним покращенням, хоча й меншим, ніж спостережене в LiveMath і SpreadSheet.
Розмір моделі також вплинув на здатність використовувати еволюційні навички. Дослідники зазначили, що Qwen-3.5-4B мав труднощі з надійним виконанням стратегій пошуку з кількома кроками, коли йому потрібно було підтримувати їх через великі контексти, тому він часто повертався до своєї попередньої поведінки. Проте, невелика модель, оснащена WikiSkill, може зрівнятися за продуктивністю з більшою моделлю, яка не використовує цю структуру, що відкриває можливий шлях для підвищення корисності систем з меншими ресурсами.
Передача навичок та невизначені обмеження
Ще одне спостереження дослідження полягає в тому, що навички, створені моделлю, можуть бути передані іншій, і в деяких випадках працювати краще, ніж інструкції, які модель-отримувач розробила самостійно. Ця можливість вказує на спільний репозиторій процедур, де корисна навичка для вирішення електронних таблиць або навігації в Інтернеті може бути повторно використана в різних агентах. Однак результати не гарантують, що передача буде вигідною в усіх випадках, тому дослідники пропонують перевіряти її індивідуально.
Передача вимагає обережності, оскільки інструкція, яка працює в одній моделі, може залежати від її можливостей, стилю міркування або способу взаємодії з інструментами. Менший агент може неповно інтерпретувати стратегію, розроблену для більшої системи, особливо коли завдання вимагає збереження багатьох кроків у контексті. Механізм валідації пропонує бар'єр проти цього ризику, але не усуває необхідності оцінювати кожну здатність у середовищі, де вона буде використовуватися.
WikiSkill також виявляє фундаментальну різницю між пам'яттю та навчанням. Вікі зберігає інформацію, а Skill Proposer генерує нові інструкції, але параметри моделі залишаються незмінними; тому система не набуває внутрішнього постійного розуміння так, як це робив би процес безперервного навчання. Рішення може покращити спостережувану поведінку, хоча неправильний висновок, неповний запис або помилкове виведення можуть бути включені в базу знань і вплинути на майбутні рішення.
Дизайн шарів намагається вирішити цю проблему, зберігаючи окремими оригінальні сліди, висновки та активні навички. Можливість скасування оновлення захищає негайне виконання, тоді як збереження невдалих спроб запобігає втраті корисної інформації для подальшого аналізу. У сукупності цей підхід демонструє, як розробники можуть створювати агентів з накопиченою операційною історією, не стверджуючи, що вони вирішили проблему безперервного навчання, виклик, який все ще залишається відкритим.
Результати свідчать про те, що зовнішня пам'ять може стати важливим елементом для агентів, які повторно працюють над однаковими типами завдань. WikiSkill не усуває обмеження моделей і не гарантує, що кожен досвід принесе покращення, але пропонує систематичну процедуру для спостереження за помилками, документування стратегій, тестування змін і збереження отриманих уроків. Головна обіцянка рамки полягає в перетворенні забуття між виконаннями в поступовий процес контрольованого вдосконалення.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Криптовалютні платформи втратили $3,63 млрд через кібератаки

Ant Group представила фінансову модель Ling-3.0-flash-Fin, відкриття наступного тижня

Virtuals посилює політику безпеки гаманців AI-агентів

Ринкова капіталізація Alphabet зменшилася на майже 700 мільярдів доларів, конкурентоспроможність AI під питанням

Google представив модель транскрипції голосу Gemini 3.5

Mastercard підтримує XRP Ledger Hackathon у Нью-Йорку в жовтні

Google Cloud Gemini Enterprise запроваджує модель оплати за використання

Gemini об'єднується з Apex для розширення своїх крипто-прогнозних ринків серед американських брокерів

Ризик кредиту Gemini AI: Deutsche Bank аналізує за 5 хвилин

Чому OpenAI стикається з постійною втратою керівників?

Лист акціонерів Ендрю Кана: Інвестиції в робототехніку досягають переломного моменту, оцінка приватних інвестицій все ще серйозно відстає

Google запустив Gemini Enterprise for Legal для юридичних фірм

Найкращі моделі штучного інтелекту для трейдингу; порівняння 10 найкращих моделей

Бізнесмен з Лас-Вегаса зіткнувся з 280 роками ув'язнення за схему Понці на 24 мільйони доларів у криптовалюті

Ціна Gemini 3.7 Flash становить 0,75 долара за мільйон токенів, відмінність з офіційними документами Google

Gemini повідомляє про чистий збиток у 107,7 мільйона доларів, акції впали більш ніж на 7%

Відкриті моделі вб'ють «попит на обчислювальні потужності»? Morgan Stanley прогнозує три майбутні сценарії для ШІ

Сергій Брін знову бере участь у стратегії AI Google

SemiAnalysis: Gemini 3 Pro може стати піком конкурентоспроможності моделей Google, хмарний бізнес - найбільший вигодонабувач

Затримка запуску Google Gemini 3.5 Pro

Microsoft представляє додаток OneDrive Photos для користувачів Windows 11

Запуск B.AI API на Gemini 3.6 Flash та 3.5 Flash-Lite

Брати Вінклевосси пожертвували 10,018 мільйонів доларів у біткоїнах PAC Трампа

Відтворення "DeepSeek моменту"? Уолл-стріт стверджує: Kimi K3 навпаки підвищує попит на обчислювальні потужності

Абсолютний рекорд на Чемпіонаті світу: 5,7 мільярдів доларів ставок на Kalshi та Polymarket

Огляд восьми провідних AI-компаній Китаю та США та їх засновників

Випуск Google Gemini 3.5 Pro затримується на кілька місяців через недостатні можливості кодування

Аналіз внутрішнього листа Zhiyu AI: Велика хвиля вже тут, після виходу на біржу не намагатимемося отримати прибуток, а зосередимося на наукових дослідженнях, ставлячи на найвитратніший шлях AGI

Bitget: Токени на американському ринку акцій - TeraWulf зросли на 10,18%, Strategy впали на 10,12%






