Meta создает ИИ-фильтр для выбора экспериментов перед тратой часов на GPU
**Meta FAIR представила Модели Предпочтений Исследований ИИ, систему, которая классифицирует эксперименты машинного обучения перед их выполнением, чтобы сократить расходы на GPU. В тестах AIRS-Bench инструмент повысил средний балл с 0,684 до 0,729 и достиг результатов, сопоставимых с 24-часовым обучением за примерно 15 часов.
- RPM сравнивают неисполненные кандидаты и позволяют агенту выбрать только самый многообещающий эксперимент.
- Агентская версия достигла нормализованного среднего балла 0,729 по сравнению с 0,684 без системы.
- Обе версии достигли результата базовой модели в 24 часа за примерно 15 часов вычислений.
Автономные исследования с использованием искусственного интеллекта сталкиваются с менее заметной проблемой, чем генерация идей: проверка их требует времени, денег и вычислительных мощностей. Агент может предложить десятки модификаций для модели машинного обучения, но каждое полное обучение может занять часы или даже дни на GPU, поэтому предварительный отбор становится одним из самых важных решений в процессе.
Команда FAIR в Meta, совместно с исследователями из Оксфордского университета и Университетского колледжа Лондона, представила Модели Предпочтений Исследований ИИ, известные как RPM. Система не пытается угадать абсолютный балл или точно предсказать конечный результат эксперимента, а упорядочивает еще не выполненные кандидаты и выбирает, какой из них стоит пройти через дорогостоящую фазу обучения в первую очередь.
Фильтр перед расходами на вычисления
Предложение основывается на ограничении, обнаруженном в языковых моделях: хотя они могут рассуждать о планах, коде и историях поиска, они оказываются ненадежными, когда необходимо напрямую предсказать метрику выполнения. Поэтому RPM принимает более узкую задачу — сравнить двух кандидатов и решить, какой из них кажется более многообещающим направлением исследования на основе доступных доказательств.
Механизм интегрируется в AIRA-dojo, эволюционную среду поиска в дереве, которая выбирает родителей жадным образом и использует операторы Draft, Improve и Debug. Вместо того чтобы генерировать потомка, выполнять его и повторять процесс, агент применяет оператор 15 раз параллельно, собирает не протестированные кандидаты и организует турнир на выбывание по парным сравнениям.
Только победитель этого турнира переходит к этапу выполнения, в то время как каждое сравнение получает контекст из исследованных узлов через обход в ширину. Этот контекст включает предыдущие эксперименты и полученные ими баллы валидации, информацию, которая позволяет судье различать между правдоподобным улучшением, избыточной вариацией и ошибкой, которую все еще можно исправить.
Подход меняет центральный вопрос агента. Вместо того чтобы просить его предсказать, сколько будет работать каждое предложение, его просят определить, какое из них заслуживает потребления следующего блока ресурсов, решение, более близкое к оценке, которую проводят исследователи, когда им необходимо расставить приоритеты среди гипотез в условиях ограниченного бюджета.
Две версии с различными затратами
Команда оценила вариант RPM, основанный исключительно на выводах, и другой с агентскими возможностями. В первом случае замороженная языковая модель выступает в качестве судьи и рассматривает кандидатские планы, код и историю поиска без проведения дополнительных экспериментов, в то время как оптимизированная рубрика с MIPROv2 от DSPy направляет ее решения.
Эта рубрика пытается воспроизвести критерии главного исследователя: она допускает исправимые ошибки, вознаграждает идеи, которые могут быть расширены, и наказывает направления, которые повторяют уже исследованную работу. Офлайн точность этой версии составила от 57,7% до 59,0%, что является признаком того, что отбор улучшает результаты по сравнению со случайностью, хотя все еще далек от представления идеального критерия.
Агентская версия использует того же судью, но позволяет работать в изолированной среде, которая клонирует рабочее пространство агента и включает единственную H200. Ее инструменты — python, bash и submit_solution, с помощью которых она выполняет пилотные испытания в небольшом масштабе, прежде чем решить, стоит ли продолжать в том направлении или завершить цикл исследования.
Дизайн включает два решения, которые напрямую влияют на поведение системы. Чтобы избежать слишком ранней остановки, оставшийся бюджет представлен как 2700 секунд, хотя фактическое доступное время составляет 300 секунд, а пилоты ограничены 30 с порогом в 60 секунд; кроме того, агентский селектор вмешивается только в Draft и Improve, потому что Debug возвращается к случайному выбору, чтобы не тратить время на дополнительные оценки.
Результаты по сравнению со случайным выбором
Испытания проводились на AIRS-Bench с 20 публичными задачами текстов и табличных данных, 24 часа вычислений на одной H200 для каждой задачи и 10 семен. Qwen3.6-27B работал как основа как для исследовательских операторов, так и для RPM, условие, разработанное для приписывания улучшения слою выбора, а не для внедрения более мощного судьи.
Случайный выбор, использованный в качестве эталона без RPM, получил средний нормализованный балл 0,684. Модель, основанная только на выводах, повысила эту цифру до 0,711, в то время как агентская версия достигла 0,729; потолки, рассчитанные с помощью валидационного оракула и тестового оракула, составили 0,748 и 0,759 соответственно.
Разница также проявилась в скорости достижения результата базовой модели. Вариант вывода достиг финального балла 0,684 за 14,88 часов, что эквивалентно ускорению в 1,61 раза, а агентская система достигла этого за 15,50 часов, с улучшением в 1,55 раза по сравнению с эталонными 24 часами.
Преимущество не устраняет все затраты: саморазмещенный вывод добавляет 0,660 часов на выполнение. Учитывая это время, сообщаемая производительность для соответствующей версии составила 0,708 за 23,34 часа, что показывает, что практическое преимущество зависит как от качества фильтра, так и от эффективности инфраструктуры, которая его выполняет.
Выдающиеся результаты и ограничения предложения
Отчет приписывает два новых эталонных результата вариантам RPM. В WinoGrande агентская система достигла 94,1%, что выше 90,4%, приписываемых предыдущей агентской системе под названием AIRA₂, в то время как версия, основанная только на выводах, получила 95,7% в SVAMP, по сравнению с предыдущим человеческим результатом 94,2%.
Эти цифры не означают, что селектор может заменить экспериментальную оценку, потому что RPM по-прежнему необходимо выполнять выбранного кандидата и проверять его производительность. Его вклад заключается в сокращении числа предложений, которые доходят до этой фазы, что является важным различием в сценариях, где возможности GPU определяют, сколько гипотез может исследовать команда.
Архитектура также показывает, что автономия не зависит исключительно от предоставления большего количества инструментов агенту. Производительность улучшается, когда система организует бюджет, сохраняет контекст предыдущих испытаний и сравнивает альтернативы перед тем, как выделить ресурсы, хотя дизайнерские решения, такие как завышенный бюджет и возвращение Debug к случайности, раскрывают все еще экспериментальные компромиссы.
Предложение частично развертываемо: AIRA-dojo и AIRS-Bench являются открытым исходным кодом, используемые LLM остаются замороженными, а Qwen3.6-27B имеет открытые веса. Тем не менее, использование H200, стоимость саморазмещенного вывода и зависимость от коротких пилотов указывают на то, что перенос этих результатов в другие среды потребует независимого измерения инфраструктуры, задач и бюджетов.
MarkTechPost сообщил, что работа была разработана FAIR в Meta совместно с Оксфордским университетом и Университетским колледжем Лондона, и представила RPM как слой приоритизации для исследовательских агентов с ИИ. Наиболее значимый результат, помимо конкретной цифры, заключается в возможности преобразования выбора экспериментов в явный компонент цикла машинного обучения, вместо того чтобы оставлять его на произвольное поколение или интуицию агента.
Публикация также отметила, что оценочная вероятность улучшения по сравнению с конфигурацией без RPM составила 0,5923 для варианта вывода и 0,5913 для агентного, с нижними пределами доверительного интервала 95% 0,5066 и 0,5018. Эти данные предполагают умеренное статистическое преимущество и советуют интерпретировать результаты как обнадеживающие доказательства, а не как гарантию того, что метод будет работать одинаково для любой исследовательской задачи.
Для команд, которые обучают модели с ограниченными бюджетами, привлекательность заключается в получении большего количества полезных исследований с теми же доступными часами. Идея все еще должна быть подтверждена в большем количестве задач и конфигураций, но она предлагает конкретный ответ на растущее напряжение: агенты могут генерировать эксперименты все быстрее, в то время как возможности их выполнения остаются ограниченными и дорогими.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

Китай покупает золото в наибольшем объеме за 3 года: что изменится

Кошелек Биткойна эпохи Сатоши переместил 600 BTC после 16 лет бездействия

Как торговля криптовалютой меняется с нулевыми комиссиями и ИИ

Strive сигнализирует о новой покупке Bitcoin, так как ASST достигает годового максимума

Искусственный интеллект Solana с «миллионом платежей в секунду» может оставить продавцов без оплаты даже после доставки

Сальвадор планирует увеличить свои резервы биткойнов в 2026-2027 годах

Операция НАБУ "Карфаген": что о новом коррупционном скандале думает бизнес

Банк Центральной Республики изменил LECAP на сумму до 2 миллиардов долларов в облигациях, привязанных к доллару

Йена достигает самого высокого уровня по отношению к доллару с февраля, Биткойн наблюдает

Глобальные ставки на максимуме: что это меняет для инвесторов в Бразилии

TOKEN2049 в Сингапуре возвращается с размахом, ежегодное мероприятие отрасли вновь открывается

Боковое движение Биткойна и риск снижения Эфириума: трейдер предсказывает движение двух криптовалют

Виталик Бутерин из Ethereum оценивает вероятность прорыва в криптографии в 60%, что может ослабить влияние посредников на Уолл-Стрит

Цена на "зеленую" сталь стала главным вызовом для нового завода ArcelorMittal

BNB Chain запускает поле битвы, является ли ключевым словом в этом раунде 'мем-акции'?

Биткойн: доходы майнеров восстанавливаются, но хешрейт не растет

Рост дата-центров в Австралии: крупные технологические компании США готовы инвестировать 155 миллиардов

Визит Чанпэна Чжао в Кыргызстан подчеркивает, почему государственная поддержка не может гарантировать выход из стейблкоина

Когда Polymarket уходит «за кулисы»: вторая половина рынка прогнозов вне биржи?

Отчет Polymarket за первую половину 2026 года: Высокочастотные трейдеры или суперпрогнозисты?

IFM запускает K2 Horizon, открытую семью ИИ с 375 миллиардами параметров

Непал запрашивает 2,5 миллиарда долларов у климатического фонда ООН после разрушительных наводнений

Самолет грузовых перевозок Amazon разбился при посадке в Майами, несколько человек пострадали

Как майнить биткойн: Руководство для начинающих по майнингу BTC - Топ-4 облачных майнинг-сайта в 2026 году
![[Редакционная статья] Свобода важнее демократии](/public-static/29_4631d65680.png?format=avif)
[Редакционная статья] Свобода важнее демократии

Экономика: Китай инвестирует 54 миллиарда в свою финансовую систему

Доступ к Stock Connect Baidu: акции могут вырасти на 20% за месяц?

Могут ли чипы AI Preferred Networks действительно обойти Nvidia в 10 раз?

Награды за криптотрейдинг ИИ и людей на WEEX в сентябре 2026 года






