Когда AI-агенты нанимают друг друга, кто будет контролировать?

By: foresightnews.pro|2026/09/01 02:32:13
0
Поделиться
copy
Оценить в GoogleОценить в Google

ERC‑8004 решает вопросы идентификации, ERC‑8183 решает вопросы хранения, а что дальше?


Автор: Thejaswini M A

Перевод: Saoirse, Foresight News


На протяжении долгого времени в развитии интернета поисковые системы просто возвращали списки результатов, а всю оставшуюся работу выполняли пользователи. На экране появлялись синие заголовки и гиперссылки. Затем мы нажимали на те материалы, которые, по нашему мнению, соответствовали нашим запросам. Однако вспоминать об этом опыте как о прошлом немного странно, и это вызывает у меня чувство ностальгии.


Как автор, я всегда испытываю неприязнь к SEO. Ключевые слова могут испортить много интересного в статье; в логике ранжирования Google внешние ссылки также рассматриваются как голосование. По сути, если на вашу страницу ссылается больше других веб-страниц, ваша страница будет иметь более высокий вес. Но это не повод для жалоб. Некоторая степень доверия всегда лучше, чем полное отсутствие доверия. Реклама поддерживает все в интернете. Но издатели контента явно недовольны этой системой.


Сегодня эта модель начинает угасать. Если я хочу найти книгу по финансовой экономике или узнать, как справиться с болью в лодыжках после длительной ходьбы, я просто открываю Gemini. Кто-то использует Perplexity, кто-то — GPT. Те, кто не чувствителен к расходам токенов, выбирают Claude. Эти инструменты, вероятно, более эффективны, чем чтение целой статьи? Мы не знаем... Возможно, это не так, но это действительно упрощает жизнь. Вам не нужно читать две статьи с противоположными мнениями, AI уже решил вашу проблему.


Я считаю, что, по крайней мере, среди людей младше 30 лет, поисковые системы больше не рассматриваются как необходимый активный вход.


Затем появляются агенты, которые полностью разрушают старую модель. Нечеловеческий трафик уже превышает человеческий. Агент, выполняющий исследовательскую задачу, может просмотреть тысячи веб-страниц и в конечном итоге выдать только одну записку. Это совершенно не похоже на человека. Поэтому в экономической системе, управляемой агентами, реклама может потерять свою ценность. Я когда-то писал две статьи, в которых обсуждал, должны ли программы платить за ресурсы, которые они используют. Мы пришли к выводу, что сама оплата — это самый простой этап.


Агенту, чтобы выполнить задачу в сети и произвести расчет стоимости, нужна независимая система из шести уровней технологий.


Агенту необходимо найти веб-ресурсы, доверять возвращаемым результатам, доверять другим роботам, подтвердить выполнение задач, произвести оплату и оставить соответствующее вознаграждение для создателей контента. Далее мы будем развивать эту тему по порядку.


Что есть в реальной сети?


Как машины, так и люди используют «поиск», но требования к веб-страницам у них совершенно разные.


Человеческий поиск возвращает полный список веб-страниц, которые пользователь просматривает по заголовкам и самостоятельно выбирает переход. Поиск для AI-агентов отличается. Агенты ограничены контекстным окном (краткосрочной памятью) и не просматривают веб-страницы полностью. Они не возвращают все ссылки, отсортированные по весу, а извлекают лишь несколько наиболее полезных для задачи отрывков и передают их модели, чтобы избежать переполнения памяти, и весь процесс занимает всего миллисекунды.


Основные игроки на этом рынке — Parallel и Exa, обе компании являются независимыми и обслуживают поиск для агентов. Parallel была основана Parag Agarwal после его ухода из Twitter, в апреле она завершила финансирование на сумму 100 миллионов долларов и была оценена в 2 миллиарда долларов. Parallel выполняет поиск на основе четко определенных целей, возвращая сжатые фрагменты контента, которые сортируются по вкладу в задачу, и для каждого факта указывается источник и уровень доверия.


Что касается Exa, то она привлекла инвестиции в размере 250 миллионов долларов в мае под руководством a16z и была оценена в 2,2 миллиарда долларов. Она обслуживает более 5000 компаний и 40 000 разработчиков, предоставляя базовые возможности для таких продуктов, как Cursor, Cognition, HubSpot, OpenRouter, Monday.com и др. Exa акцентирует внимание на семантическом понимании, а не на совпадении ключевых слов, и даже если исходный текст не содержит запрашиваемых слов, она может вернуть соответствующий контент, одновременно предоставляя чистый оригинальный текст веб-страницы.


Согласно официальной документации Parallel, стоимость тысячи запросов на двух высокоскоростных уровнях составляет 1 доллар, а на двух низкоскоростных уровнях — 5 долларов. Независимо от длины веб-страницы, извлечение содержимого URL фиксируется на уровне 1 доллара за тысячу. Exa взимает 7 долларов за тысячу запросов, что в 7 раз больше, чем Parallel; извлечение содержимого веб-страницы стоит 1 доллар за тысячу страниц, а вопросно-ответный интерфейс с ссылками — 5 долларов за тысячу.


Насколько хороши результаты поиска?


Google в основном проводит оценку качества поиска внутри компании: определяет, нажимает ли пользователь на первую ссылку, задерживается ли на странице или сразу покидает её; одновременно нанимает оценщиков для выставления оценок результатам. Ранее также проводились тесты RTEC, но не существовало публичных и доступных для покупки рейтингов. Google Analytics и Similarweb учитывают трафик, а не качество поиска.


Однако в интернете для агентов уже появились лабораторные тестовые наборы, специально предназначенные для оценки того, могут ли инструменты поиска помочь AI получить правильные ответы.


OpenAI выпустила BrowseComp в апреле 2025 года, который включает 1266 вопросов, построенных в обратном порядке. Создатели вопросов сначала определяют проверяемый объективный факт, а затем разрабатывают вопрос, скрывая факт под множеством ограничений. Если сначала задать вопрос, как в обычном знаниевом тесте, модель, вероятно, ответит правильно, полагаясь на свою память или удачный поиск. Однако сначала определение факта, а затем упаковка вопроса действительно позволяет проверить способности инструмента к веб-поиску.


Оригинальный GPT‑4o набрал всего 0,6%; GPT‑4o с включенной функцией веб-браузинга набрал 1,9%; Deep Research от OpenAI набрала 51,5%.



Цель тестирования — проверить, может ли система найти скрытый, проверяемый факт в реальном интернете и вывести его. Все 1266 вопросов имеют краткие стандартные ответы, и у модели есть только одна попытка ответа; совпадение дает балл, несовпадение — нет, и итоговый балл равен проценту правильных ответов от общего числа вопросов. Оригинальный GPT‑4o 0,6% указывает на то, что модель почти не может получить факты, полагаясь на свою память; GPT‑4o с включенной функцией браузера набрала 1,9%, что показывает, что улучшение, предоставляемое базовыми инструментами поиска, незначительно; Deep Research набрала 51,5%, что указывает на более длительный цикл поиска и чтения, при котором вероятность нахождения целевого факта составляет примерно половину.


Помимо BrowseComp, существуют и другие наборы для оценки: SimpleQA (OpenAI, 4326 вопросов), набор простых тестов на фактические данные; с ускорением инструментов браузинга, сложность SimpleQA была легко преодолена моделью, поэтому появился BrowseComp. GAIA (Meta / Hugging Face, 466 задач) предназначен для реальных сценариев помощников и может требовать веб-браузинга, вызова инструментов, чтения файлов и многократного рассуждения, а не просто поиска. DeepSearchQA — это исследовательский набор данных для многократного поиска, Artificial Analysis будет проводить комплексную оценку на основе этого набора данных. FRAMES (Google DeepMind, 824 образца) — это набор вопросов с несколькими переходами, требующий извлечения фактов из нескольких источников и их интеграции.


Частная организация Artificial Analysis была основана Джорджем Кэмероном и Микахом Хиллом-Смитом, и 18 августа 2026 года выпустила индекс поиска. Этот набор оценок фиксирует используемую модель AI и правила оценки, меняя только API поиска, который вызывает агент. Изменение баллов указывает на то, что различия исходят от самого инструмента поиска, а не от возможностей модели.


Источник: @artificialanalysis


Совершенно не используя поиск, одна и та же модель в этом индексе набрала 33 балла, а в подмножестве BrowseComp — 17 баллов. Даже если рейтинги различных поисковых сервисов изменяются, базовые баллы остаются неизменными.


По состоянию на 27 августа индекс поиска Artificial Analysis: версия Perplexity среднего уровня занимает первое место с 80 баллами; высокоскоростные уровни Parallel и Brave имеют по 75 баллов и делят второе место; You.com и Exa — 74 балла; Firecrawl, базовая версия Parallel и высокоскоростная версия Parallel — все по 73 балла.


Если баллы поисковых инструментов выше базового уровня, это означает, что поиск действительно помог модели получить новую информацию. Логика такова: AI, полагаясь только на память, получает базовый балл; после подключения поиска балл повышается, что указывает на то, что поиск нашел информацию, о которой модель изначально не знала; если балл не повысился, значит, поиск не сработал.


Однако в самой оценке есть ограничения: тестовые вопросы и используемые модели не являются специфичными для бизнес-сценариев. Поставщики могут специально оптимизировать свои инструменты для известных тестовых наборов (например, DeepSearchQA), как это делали сайты в прошлом для Google, применяя SEO.


Кто эти роботы по ту сторону?


Когда два AI-агента нанимают друг друга, недостаточно иметь только адрес кошелька и описание, чтобы установить доверие. Адрес кошелька может лишь подтвердить, что у аккаунта есть средства, текст описания легко подделать, он не может подтвердить личность разработчика робота и не может подтвердить, действительно ли его предыдущие рабочие записи являются подлинными. Стандарт ERC‑8004 был разработан для решения вопросов проверки подлинности идентичности и репутации агентов.


ERC‑8004 был совместно написан сотрудниками MetaMask, Фонда Ethereum, Google и Coinbase и запущен в основной сети Ethereum 29 января 2026 года, включая три основных реестра.


Первое, реестр идентичности, реализованный в форме NFT. Каждый агент соответствует токену с номером, идентификатор ресурса токена указывает на регистрационный файл, в котором записаны имя агента, конечная точка сервиса, поддержка платежей x402 и поддерживаемые модели доверия. Владельцем токена является владелец агента; при передаче прав собственности на токен информация о старом платежном кошельке будет очищена, новый владелец должен заново подписать подтверждение контроля.


Второе, реестр репутации, принимает подписанные отзывы, то есть публичную систему оценок на блокчейне. После использования агента пользователи могут оставить оценку на блокчейне, прикрепив метки задач (например, поиск, оценка). Владельцы агентов не могут писать отзывы о себе, отзывы могут быть отозваны. Любой может добавить комментарий к отзыву, записи о возврате средств и предупреждения о спаме могут быть прикреплены рядом с оценкой. Это публичная зона комментариев, связанная с ID агента, а не частная система звезд в рамках одного приложения.


Третье, реестр верификации, подключающий независимую проверку третьими сторонами. Агент инициирует запрос на верификацию, смарт-контракт проверяющего возвращает оценку от 0 до 100, а также ссылку на доказательства; источником доказательств могут быть результаты повторного выполнения задач, доказательства с нулевым знанием или подтверждения, выданные безопасным чипом.


Данная спецификация сама по себе не обрабатывает логику платежей, в документе это четко указано. Она лишь фиксирует идентичность агентов, внешние оценки и результаты проверки третьими сторонами, а платежи осуществляются другими протоколами. Качество данных реестра не идеальное. Согласно статистике 8004scan за июль, на 29 публичных блокчейнах зарегистрировано 385998 агентов, имеющих более 460000 оценок. Большинство ID — это просто пустые значки; 89,2% не имеют общедоступных стандартных интерфейсов для вызова сервисов; только 8631 агент имеет доступные услуги, что составляет всего 2,24%.


Источник: @8004_scan


В мае в ходе исследования по Ethereum, BNB Chain и Base Chain было обнаружено, что оценки на блокчейне не могут быть сопоставлены между различными агентами. Большинство отзывов не связано с результатами задач, которые можно проверить, стоимость накрутки оценок очень низка. После фильтрации подозрительных отзывов у большого количества оцененных агентов не осталось доступных и действительных отзывов. Этот стандарт лишь унифицирует формат вывода данных оценок, а какие отзывы являются правдивыми и надежными, решает внешняя система. ENS, EigenLayer, The Graph, Taiko заявили о намерении подключиться к этому стандарту, но инструменты фильтрации оценок еще не разработаны.


Действительно ли агент выполнил работу?


Архитектура Agentic Commerce, совместно разработанная Фондом Ethereum и Virtuals Protocol, нацелена на реализацию взаимного найма и совместной работы автономных AI-агентов с расчетами на блокчейне без участия человека. ERC-8004 в сочетании с ERC-8183 (стандартом эскроу) реализует эту систему. ERC-8183 стандартизирует весь процесс публикации задач, эскроу, проверки результатов и расчетов между агентами.


Процесс работы следующий: клиентский агент, инициирующий задачу, публикует задачу, указывая описание задачи, срок выполнения, бюджет и назначая оценщика. Клиент вносит средства в смарт-контракт, средства блокируются, и ни одна из сторон не может использовать их в одностороннем порядке.


Агент, предоставляющий услуги, выполняет вычисления вне сети, загружая конечный результат в децентрализованное хранилище, такое как IPFS или Arweave, а на блокчейн отправляется только хэш или локатор ресурса. Оценщик (это может быть специализированный судья-агент, автоматизированный оракул или проверяющий с нулевым знанием) проверяет результаты.


Если оценщик определяет, что задача выполнена, то после вычета комиссии производится оплата стороне, предоставившей услуги; если задача не выполнена, средства возвращаются клиенту. Если сторона, предоставляющая услуги, теряется, или оценщик превышает срок выполнения, контракт активирует логику публичного возврата средств, средства возвращаются клиенту, чтобы избежать постоянной блокировки активов.


Оценщик также может быть непосредственно клиентом, документ рассматривает этот режим как обычное решение в сценариях без третьих сторон. В то же время спецификация четко указывает: настоящий протокол не предоставляет механизмов разрешения споров и арбитража, отказ от результатов / истечения срока действия является окончательным решением. Если выбранный вами бот для оценки злонамеренно обманет вас, нет администратора или службы поддержки, к которым можно обратиться. Вы без помощи; и, как упоминалось в предыдущем разделе, вы не можете полагаться на оценки на блокчейне для выбора надежного оценщика, большинство отзывов являются ложными.


Системы, такие как UMA, Kleros, Bittensor могут смягчить риск злоупотребления оценщиками, но это будет стоить времени и увеличит затраты. Полностью автоматизированные эскроу-расчеты могут быть выполнены за секунды с очень низкими комиссиями; в то время как обновление процесса разрешения споров через UMA, Kleros требует вызова окна, залога и привлечения людей для голосования.


Завершен ли перевод средств?


Недавно в отрасли много обсуждений на эту тему, здесь кратко объясню.


x402 был представлен Coinbase, это протокол, построенный на существующих публичных блокчейнах, который взимает плату по запросу и использует стейблкоины для переводов.


Источник: @coinbase


Другой протокол — это протокол машинных платежей MPP, который был совместно выпущен Stripe и Tempo в марте 2026 года, в день выпуска основной сети Tempo. MPP — это стандарт HTTP. Сервер возвращает 402, требующий оплаты, с информацией о вызове; агент повторяет запрос с платежным подтверждением; сервер возвращает ресурс и квитанцию о платеже.


Фактический поток средств зависит от базового канала. На Tempo одна транзакция обрабатывается на блокчейне примерно за 0,5 секунды. В случае множества мелких вызовов агент может заранее заблокировать средства, в процессе ведя учет, а затем выполнить объединенный расчет на блокчейне, а не инициировать каждую транзакцию на блокчейне. Платежный лимит контролируется заблокированной суммой в текущей сессии или ключом доступа, а не режимом «разовое разрешение, постоянное списание».


MPP поддерживает несколько базовых каналов: Visa выпустила спецификацию карт, агенты могут использовать токенизированные карты для платежей; Lightspark реализует решение для платежей через сеть Lightning на основе того же процесса 402, одновременно предлагая программу карт Visa. Торговцы, уже подключившие карты Stripe, могут напрямую принимать платежи по картам MPP, средства поступают на обычный счет Stripe; сеть Lightning является еще одним доступным каналом в рамках правил MPP. Stripe также поддерживает x402. x402 и MPP оба используют статус-код HTTP 402 «требуется оплата», но это два разных протокола.


Получают ли создатели контента вознаграждение?


Если создатели не получают деньги, новых материалов для поиска не будет. Если создатели не могут зарабатывать, они прекратят публикацию работ, и AI-агенты в конечном итоге исчерпают новые материалы для чтения.


Cloudflare, Parallel, OpenLedger — три представительных проекта в этой области.


Cloudflare изначально взимал фиксированную плату за сбор данных с веб-страниц. Эта схема была слишком грубой, плата за сбор главной страницы и за сбор глубоких расследований была одинаковой. Теперь Cloudflare переходит на модель оплаты по ценности: вознаграждение выплачивается только тогда, когда контент действительно приносит ценность. Кроме того, для сайтов с рекламной прибылью, если AI-поставщик услуг отказывается платить, Cloudflare будет блокировать AI-роботов.


Parallel 19 мая запустил продукт Index, заимствовав алгоритм Шапли из теории кооперативных игр, чтобы вычислить долю каждого источника информации в конечном результате задачи агента, на основе чего осуществляется распределение. Оплата больше не производится за клики, а измеряется математической моделью фактического вклада каждой статьи в задачу. Партнерами по сотрудничеству являются The Atlantic, Fortune, PR Newswire, PitchBook, ZoomInfo, Tracxn, RocketReach, Enigma, Fiscal AI.


В настоящее время Index будет производить расчеты только тогда, когда агенты используют собственные инструменты поиска Parallel. Если другие AI-платформы не подключатся, он не сможет стать общепринятым стандартом.


OpenLedger — это другой подход, использующий токенизированную систему. Он оценивает влияние наборов данных на модели AI и выплачивает вознаграждения вкладчикам с помощью собственного токена. Эта схема предназначена для разработчиков данных для обучения AI, а не для компенсации ежедневных материалов новостных журналистов.


Я пытался найти реальные данные о суммах, которые эти проекты фактически выплачивают создателям. Cloudflare не опубликовал данные о выплатах; Parallel также не раскрыл; OpenLedger рассчитывается с помощью токена OPEN, не публикуя независимую статистику общей суммы выплат. Таким образом, в настоящее время у нас нет убедительных фактов для оценки реальной эффективности этой схемы.


В истории развития человеческой коммерции кассовые аппараты появились довольно поздно. Люди потратили много лет на создание устных соглашений и местных систем репутации, прежде чем изобрели низкосторонние платежи. Напротив, путь развития машинного интернета полностью перевернут: он с самого начала обеспечивал мгновенные, потоковые глобальные расчеты. Теперь экономика агентов должна спотыкаться, чтобы создать судебные разбирательства по мелким спорам на блокчейне, чтобы предотвратить мошенничество между двумя роботами из-за нескольких долларов за задание.


В заключение приведу слова Терри Пратчетта:

«Просто говорить о чистой логике и утверждать, что машины просто выполняют полученные команды, легко. Но люди имеют право ожидать, что машины тоже должны обладать хоть каплей здравого смысла.»

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

Свежие листинги на WEEX

iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:[email protected]
VIP-программа:[email protected]