Meta створила фільтр штучного інтелекту для вибору експериментів перед витрачанням годин GPU

By: www.diariobitcoin.com|2026/09/07 10:20:53
0
Поширити
copy
Оцінити в GoogleОцінити в Google

**Meta FAIR представила Моделі переваг досліджень штучного інтелекту, систему, яка класифікує експерименти машинного навчання перед їх виконанням, щоб зменшити витрати на GPU. У випробуваннях AIRS-Bench інструмент підвищив середній бал з 0,684 до 0,729 і досяг результатів, порівнянних з 24-годинним навчанням за приблизно 15 годин.


  • RPM порівнює невиконані кандидати та дозволяє агенту вибрати лише найбільш перспективний експеримент.
  • Агентна варіація досягла нормалізованого середнього балу 0,729 порівняно з 0,684 без системи.
  • Обидві версії зрівнялися з результатом базової моделі 24 години за приблизно 15 годин обчислень.

Автономні дослідження з використанням штучного інтелекту стикаються з менш помітною проблемою, ніж генерація ідей: перевірка їх коштує часу, грошей і обчислювальних потужностей. Агент може запропонувати десятки модифікацій для моделі машинного навчання, але кожне повне навчання може займати години або навіть дні на GPU, тому попередній відбір стає одним з найважливіших рішень у процесі.

Команда FAIR у Meta разом з дослідниками з Оксфордського університету та Університетського коледжу Лондона представила Моделі переваг досліджень штучного інтелекту, відомі як RPM. Система не намагається вгадати абсолютний бал або точно передбачити кінцевий результат експерименту, а скоріше впорядковує ще не виконані кандидати та вибирає, який з них заслуговує на перший прохід через витратну фазу навчання.

Фільтр перед витратами на обчислення

Пропозиція виходить з обмеження, виявленого в мовних моделях: хоча вони можуть міркувати про плани, код та історії пошуку, вони не є надійними, коли потрібно безпосередньо передбачити метрику виконання. Тому RPM приймає більш обмежене завдання - порівняти двох кандидатів і вирішити, який з них виглядає більш перспективним напрямком дослідження на основі доступних доказів.

Механізм інтегрується в AIRA-dojo, середовище еволюційного пошуку в дереві, яке жадібно вибирає батьків і використовує оператори Draft, Improve та Debug. Замість того, щоб генерувати нащадка, виконувати його та повторювати процес, агент застосовує оператор 15 разів паралельно, збирає неперевірених кандидатів і організовує турнір на вибування через парні порівняння.

Тільки переможець цього турніру доходить до етапу виконання, тоді як кожне порівняння отримує контекст з досліджених вузлів через пошук в ширину. Цей контекст включає попередні експерименти та отримані ними оцінки валідації, інформацію, яка дозволяє судді відрізняти між правдоподібним покращенням, надмірною варіацією та помилкою, яку ще можна виправити.

Підхід змінює центральне питання агента. Замість того, щоб просити його передбачити, скільки продуктивності матиме кожна пропозиція, його просять визначити, яка з них заслуговує на витрати наступного блоку ресурсів, рішення, яке ближче до оцінки, яку проводять дослідники, коли їм потрібно пріоритизувати гіпотези в умовах обмеженого бюджету.

Дві версії з різними витратами

Команда оцінила варіацію RPM, засновану лише на інференції, та іншу з агентними можливостями. У першій версії заморожена мовна модель виступає в ролі судді та перевіряє кандидатські плани, код та історію пошуку без проведення додаткових експериментів, тоді як оптимізована рубрика з MIPROv2 від DSPy орієнтує її рішення.

Ця рубрика намагається відтворити критерій головного дослідника: вона терпить виправні помилки, винагороджує ідеї, які можуть бути розширені, і карає напрямки, які повторюють вже досліджену роботу. Точність поза лінією цієї версії становила від 57,7% до 59,0%, що свідчить про те, що відбір покращується в порівнянні з випадковістю, хоча все ще далеко від представлення ідеального критерію.

Агентська версія використовує того ж суддю, але дозволяє працювати в ізольованому середовищі, яке клонує робочий простір агента та включає єдину H200. Її інструменти - python, bash та submit_solution, за допомогою яких вона виконує пілотні випробування малого масштабу, перш ніж вирішити, чи варто продовжувати в певному напрямку чи завершити цикл дослідження.

Дизайн включає два рішення, які безпосередньо впливають на поведінку системи. Щоб уникнути занадто ранньої зупинки, залишковий бюджет подається як 2700 секунд, хоча фактичний доступний час становить 300 секунд, а пілоти обмежені 30 з порогом у 60 секунд; крім того, агентський селектор втручається лише в Draft та Improve, оскільки Debug повертається до випадкового вибору, щоб не витрачати час на додаткові оцінки.

Результати в порівнянні з випадковим вибором

Випробування проводилися на AIRS-Bench, з 20 публічними завданнями тексту та табличних даних, 24 години обчислень на одній H200 для кожного завдання та 10 насіннями. Qwen3.6-27B працював як основа як для дослідницьких операторів, так і для RPM, умова, розроблена для того, щоб приписати покращення до шару вибору, а не до впровадження більш потужного судді.

Випадковий вибір, використаний як еталон без RPM, отримав середній нормалізований бал 0,684. Модель, заснована лише на інференції, підвищила цю цифру до 0,711, тоді як агентська версія досягла 0,729; розраховані стелі з валідатором-оракулом та тестовим оракулом становили 0,748 та 0,759 відповідно.

Різниця також проявилася у швидкості досягнення результату базової моделі. Варіант інференції досяг фінального балу 0,684 за 14,88 години, що еквівалентно прискоренню в 1,61 рази, а агентська система досягла цього за 15,50 години, з покращенням у 1,55 рази порівняно з 24 годинами еталону.

Перевага не усуває всі витрати: самоорганізована інференція додає 0,660 години на виконання. Після коригування за цей час, звітний показник для відповідної версії склав 0,708 за 23,34 години, що показує, що практична перевага залежить як від якості фільтра, так і від ефективності інфраструктури, яка його виконує.

Висновки та обмеження пропозиції

Звіт приписує два нові еталонні результати варіантам RPM. У WinoGrande агентська система досягла 94,1%, перевищивши 90,4%, приписаних попередній агентській системі під назвою AIRA₂, тоді як версія, заснована лише на інференції, отримала 95,7% у SVAMP, у порівнянні з попереднім людським результатом 94,2%.

Ці цифри не означають, що селектор може замінити експериментальну оцінку, оскільки RPM все ще потребує виконання обраного кандидата та перевірки його продуктивності. Його внесок полягає в зменшенні кількості пропозицій, які доходять до цієї фази, що є важливою різницею в сценаріях, де можливості GPU визначають, скільки гіпотез може дослідити команда.

Архітектура також показує, що автономія не залежить лише від надання більшої кількості інструментів агенту. Продуктивність покращується, коли система організовує бюджет, зберігає контекст попередніх випробувань і порівнює альтернативи перед тим, як зобов'язати ресурси, хоча дизайнерські рішення, такі як завищений бюджет і повернення Debug до випадковості, виявляють ще експериментальні компроміси.

Пропозиція частково розгортається: AIRA-dojo та AIRS-Bench є з відкритим кодом, використовувані LLM залишаються замороженими, а Qwen3.6-27B має відкриті ваги. Однак використання H200, вартість самоорганізованої інференції та залежність від коротких пілотів вказують на те, що перенесення цих результатів в інші середовища вимагатиме незалежного вимірювання інфраструктури, завдань та бюджетів.

MarkTechPost повідомив, що робота була розроблена FAIR у Meta разом з Оксфордським університетом та Університетським коледжем Лондона, і представила RPM як шар пріоритизації для агентів досліджень з ШІ. Найбільш значущим результатом, окрім конкретної цифри, є можливість перетворити вибір експериментів на явний компонент циклу машинного навчання, замість того, щоб залишати його випадковій генерації або інтуїції агента.

Публікація також зазначила, що оцінена ймовірність покращення в порівнянні з налаштуванням без RPM становила 0,5923 для варіанту інференції та 0,5913 для агентного, з нижніми межами довірчого інтервалу 95% 0,5066 та 0,5018. Ці дані свідчать про помірну статистичну перевагу і радять інтерпретувати результати як обнадійливі докази, а не як гарантію того, що метод працюватиме однаково для будь-якої проблеми дослідження.

Для команд, які навчають моделі з обмеженими бюджетами, привабливість полягає в отриманні більшої корисної експлорації з тими ж доступними годинами. Ідея все ще повинна бути підтверджена в більшій кількості завдань та налаштувань, але вона пропонує конкретну відповідь на зростаюче напруження: агенти можуть генерувати експерименти все швидше, тоді як можливість їх виконання залишається обмеженою та дорогою.

Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.

Вам також може сподобатися

Коли Polymarket та інші йдуть «за лаштунки»: друга половина ринку прогнозів поза біржами?

Звіт Polymarket за перше півріччя 2026 року: високообігні трейдери чи суперпрогнозисти?

IFM запускає K2 Horizon, відкриту сім'ю ШІ з 375 мільярдами параметрів

Інститут моделей фонду представив K2 Horizon, сім'ю з шести моделей штучного інтелекту під ліцензією Apache 2.0, яка включає дані, код, контрольні точки та інструменти для розгортання. Пропозиція поєднує масштабованість, невеликі моделі для обмежених пристроїв та власний аудит, який зменшив один з й...

Непал просить 2,5 мільярда доларів США у кліматичного фонду ООН після руйнівних повеней

Непал попросив фонду ООН для покриття втрат і збитків швидкої реакції після повеней, які забрали більше 1300 життів, тисячі зниклих безвісти та завдали збитків, оцінених у 2,5 мільярда доларів США.

Літак вантажного перевезення Amazon розбився під час посадки в Маямі, кілька постраждалих

Літак Boeing 767-300 компанії Amazon Air зійшов з траси під час посадки в Міжнародному аеропорту Маямі, зіткнувся з автомобілями та загорівся. Влада призупинила рейси, поки аварійні служби надавали допомогу постраждалим і починали оцінювати збитки.

Як майнити біткоїн: Посібник для початківців з майнінгу BTC - Топ 4 сайти для хмарного майнінгу у 2026 році

...

Найновіші статті

Більше

Нещодавні лістинги монет на WEEX

iconiconiconiconiconicon
Підтримка клієнтів:@weikecs
Співпраця:@weikecs
Кількісна торгівля та маркетмейкінг:[email protected]
VIP-програма:[email protected]